Résultats décevants : Test d'un Multimodal LLM Open-source

Résultats décevants : Test d’un Multimodal LLM Open-source

Un groupe d’informaticiens de différentes universités a publié un LLM multimodal open source appelé LLaVA, et je suis tombé dessus en parcourant Twitter la semaine dernière. Similaire à GPT-4, ce LLM peut traiter à la fois des entrées de texte et d’image. Le projet utilise un LLM à usage général et un encodeur d’image pour créer un modèle d’assistant de langage et de vision de grande taille. Comme les fonctionnalités vantées semblaient prometteuses, j’ai décidé de tester ce modèle de langage de grande taille pour comprendre à quel point il est précis et fiable et ce que nous pouvons attendre du prochain modèle multimodal de GPT4 (en particulier ses capacités visuelles). Sur cette note, allons-y et explorons LLaVA.

Qu’est-ce que LLaVA, un modèle de langage multimodal ?

LLaVA (Large Language-and-Vision Assistant) est un LLM multimodal, similaire à GPT-4 d’OpenAI, qui peut gérer à la fois les entrées de texte et d’image. Bien qu’OpenAI n’ait pas encore ajouté la capacité de traitement d’image à GPT-4, un nouveau projet open source l’a déjà fait en infuser un encodeur de vision.

Développé par des informaticiens de l’Université du Wisconsin-Madison, de Microsoft Research et de l’Université de Columbia, le projet vise à démontrer comment fonctionnerait un modèle multimodal et à comparer ses capacités avec GPT-4.

Il utilise Vigogne comme le grand modèle de langage (LLM) et CLIP ViT-L/14 en tant qu’encodeur visuel, qui, pour ceux qui ne le savent pas, a été développé par OpenAI. Le projet a généré multimodal de haute qualité données suivant les instructions à l’aide de GPT-4 et cela se traduit par d’excellentes performances. Il obtient 92,53 % dans le benchmark ScienceQA.

En plus de cela, il a été affiné pour les jeux de données de raisonnement et de discussion visuelle à usage général, en particulier dans le domaine scientifique. Ainsi, dans l’ensemble, LLaVA est un point de départ de la nouvelle réalité multimodale, et j’étais très enthousiaste à l’idée de le tester.

Comment utiliser l’assistant visuel de LLaVA dès maintenant

1. Pour utiliser LLaVA, vous pouvez vous rendre sur llava.hliu.cc et consultez la démo. Il utilise le LLaVA-13B-v1 modèle en ce moment.

Comment utiliser LLaVA

2. Ajoutez simplement une image dans le coin supérieur gauche et sélectionnez «Recadrer« Assurez-vous d’ajouter des images carrées pour obtenir le meilleur résultat.

Comment utiliser LLaVA

3. Maintenant, ajoutez votre question en bas et cliquez sur « Envoyer ». Le LLM étudiera ensuite l’image et vous expliquera tout en détail. Vous pouvez également poser des questions complémentaires sur l’image que vous téléchargez.

Comment utiliser LLaVA

LLM multimodal avec capacités visuelles : premières impressions

Pour tester les capacités de vision de LLaVA, nous avons commencé avec quelques exemples de base. Nous avons téléchargé une peinture et demandé à LLaVA de identifier le tableauet il a répondu correctement à la question. J’ai également posé quelques questions complémentaires, et il a fait du bon travail là aussi.

  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné
  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné

Dans un autre exemple, j’ai téléchargé une image d’aliments et j’ai posé des questions sur le type de petit-déjeuner que l’on peut préparer et sur ce que serait le apport calorique total. Il a identifié correctement chaque élément et a proposé des recettes de cuisine et un nombre approximatif de calories. Bien que les recettes ne soient pas aussi détaillées, le LLM multimodal a suggéré des idées pour incorporer les trois aliments dans un plat/repas.

  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné
  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné

Ensuite, j’ai ajouté une image avec une note manuscrite lui demandant d’écrire un script Python pour l’algorithme de tri à bulles. Mais il n’a pas réussi à reconnaître le texte sur le papier. Et il n’a pas pu exécuter le code. J’ai donc ajouté une question mathématique simple et demandé la valeur de x, mais encore une fois, la réponse a été erronée.

  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné
  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné

Pour aller plus loin, j’ai ajouté une autre question mathématique, mais elle n’était pas écrite à la main pour la rendre plus lisible. J’ai pensé que c’était peut-être mon écriture que l’IA ne pouvait pas reconnaître. Cependant, encore une fois, elle a simplement halluciné et a inventé une équation par elle-même et a donné une mauvaise réponse. Je crois comprendre que c’est simplement n’utilise pas l’OCRmais visualise les pixels et les associe aux modèles ImageNet de CLIP. En résolvant des problèmes mathématiques, y compris des notes manuscrites et non manuscrites, le modèle LLaVA a échoué lamentablement.

Premières impressions de LLaVA

En avançant, je lui ai demandé d’expliquer un dessin animé du New Yorker et pourquoi il était drôle, mais il n’a pas réussi à comprendre la raison derrière l’humour. décrit simplement la scène. Lorsque j’ai souligné l’aspect genre dans l’image (l’humour), ce LLM multimodal a alors compris la mission et a répondu correctement.

  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné
  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné

Finalement, j’ai demandé à LLaVA de examiner un rapport médicalmais encore une fois, il a eu des hallucinations et a donné un résumé incorrect. Malgré des tentatives répétées, il n’a pas pu trouver de données pertinentes dans l’image téléchargée.

  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné
  • J'ai essayé un LLM multimodal open source, et je n'ai pas été impressionné

LLaVA a besoin de beaucoup d’améliorations

Pour résumer, il est très tôt, du moins dans l’espace open source, pour proposer un LLM multimodal performant. absence d’un modèle visuel-langagier puissant et fondamentalla communauté open source pourrait rester en retrait par rapport aux modèles propriétaires. Meta a bien sûr publié un certain nombre de modèles open source, mais il n’a publié aucun modèle visuel sur lequel la communauté open source pourrait travailler, à l’exception Segmenter n’importe quoi ce qui n’est pas applicable dans ce cas.

Alors que Google a publié PaLM-E, un modèle de langage multimodal incarné en mars 2023 et OpenAI a déjà démontré les capacités multimodales de GPT-4 lors du lancement. Lorsqu’on lui a demandé ce qu’il y avait de drôle dans une image où un Connecteur VGA est branché sur le port de chargement d’un téléphone, GPT-4 a dénoncé l’absurdité avec une précision clinique. Dans une autre démonstration lors du flux de développeurs GPT-4, le modèle multimodal d’OpenAI a rapidement créé un site Web entièrement fonctionnel après avoir analysé une note manuscrite dans une mise en page griffonnée sur le papier.

En termes simples, d’après ce que nous avons testé jusqu’à présent sur LLaVA, il semble que il faudra beaucoup plus de temps pour rattraper OpenAI dans le domaine du langage visuel. Bien sûr, avec plus de progrès, de développement et d’innovation, les choses s’amélioreront. Mais pour l’instant, nous attendons avec impatience de tester les capacités multimodales de GPT-4.

Soutenez notre effort ❤️

Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.

Paiement sécurisé sur PayPal
Voir aussi:  Le clip d'horreur généré par IA de Neill Blomkamp, « Nightborne », suscite un tollé
Moyens I/O Staff est une équipe de rédacteurs spécialisés, passionnés par la technologie, l’innovation et les usages numériques. Forts d’une expertise pointue en IA, applications mobiles, gaming et tendances digitales, nous produisons un contenu rigoureux, vérifié et utile. Notre mission : vous offrir une information fiable et claire pour mieux naviguer dans le monde numérique en constante évolution. Découvrez les avis de nos lecteurs sur Trustpilot.