Explosion de la technologie IA : Découvrez les alternatives open source de GPT-4 Vision dans la nouvelle version LLaVA 1.5 !

LLaVA 1.5 : Une alternative open source à GPT-4 Vision
L’intelligence artificielle générative est en plein essor avec l’émergence des grands modèles multimodaux (LMM) tels que GPT-4 Vision d’OpenAI. Ces modèles révolutionnent notre interaction avec les systèmes d’IA en intégrant à la fois du texte et des images.
Cependant, la nature fermée et commerciale de certaines de ces technologies peut entraver leur adoption universelle. C’est là que la communauté open source intervient en propulsant le modèle LLaVA 1.5 comme une alternative prometteuse à GPT-4 Vision.
La mécanique des LMM
Les LMM fonctionnent grâce à une architecture multicouche qui associe un modèle pré-entraîné pour le codage des éléments visuels, un grand modèle de langage (LLM) pour décrypter et répondre aux instructions de l’utilisateur, ainsi qu’un connecteur multimodal pour faire le lien entre vision et langage.
Leur formation se déroule en deux temps : un premier round d’alignement entre la vision et le langage, suivi d’un réglage fin pour répondre aux requêtes visuelles. Ce processus, bien qu’efficace, nécessite souvent des ressources computationnelles importantes et une base de données riche et précise.
Les atouts de LLaVA 1.5
LLaVA 1.5 mise sur le modèle CLIP pour l’encodage visuel et Vicuna pour le langage. Contrairement au modèle original, LLaVA, qui utilisait les versions texte de ChatGPT et GPT-4 pour le réglage visuel, LLaVA 1.5 va plus loin en connectant le modèle de langage et l’encodeur visuel via un perceptron multicouche (MLP), enrichissant ainsi sa base de données de formation avec des questions-réponses visuelles.
Cette mise à jour a permis à LLaVA 1.5 de surpasser d’autres LMM open source sur 11 des 12 benchmarks multimodaux, avec environ 600 000 exemples supplémentaires.
L’avenir des LMM open source
La démonstration en ligne de LLaVA 1.5, accessible à tous, présente des résultats prometteurs même avec un budget limité. Cependant, il convient de souligner que l’utilisation des données générées par ChatGPT est limitée à des fins non commerciales.
Malgré cette limitation, LLaVA 1.5 ouvre une fenêtre sur l’avenir des LMM open source. Sa rentabilité, son évolutivité dans la génération de données de formation et son efficacité dans le réglage des instructions visuelles en font une introduction aux innovations à venir.
LLaVA 1.5 n’est que le début d’une série d’avancées de la communauté open source. En anticipant des modèles plus efficaces et accessibles, nous pouvons envisager un avenir où la technologie IA générative sera accessible à tous, révélant ainsi le potentiel illimité de l’intelligence artificielle.



