Gemma 2 vs Llama 3: Quel est le meilleur modèle d'IA open source ?

Gemma 2 vs Llama 3: Quel est le meilleur modèle d’IA open source ?

Lors de l’I/O 2024, Google a annoncé sa prochaine famille de modèles Gemma 2, et maintenant, la société a finalement publié les modèles légers sous une licence open source. Le nouveau modèle Gemma 2 27B est réputé très prometteur, surpassant plusieurs modèles plus grands comme Llama 3 70B et Qwen 1.5 32B. Donc, pour tester cette affirmation, nous avons élaboré cette comparaison entre Gemma 2 et Llama 3, deux modèles open source de premier plan. Sur cette note, commençons.

Gemma 2 contre Llama 3 : Écriture créative

Commençons par vérifier à quel point Gemma 2 et Llama 3 sont bons en matière d’écriture créative. J’ai demandé aux deux modèles d’écrire une courte histoire sur la relation de la lune avec le soleil. Les deux ont fait un excellent travail, mais Google Le modèle Gemma 2 a fait un carton plein avec une prose délicieuse et une belle histoire en prime.

  • lama 3 en écriture créative

Llama 3, en revanche, semblait un peu ennuyeux et robotique, presque comme une IA comme nous l’avons vu avec les modèles d’OpenAI. Google a toujours été bon en génération de texte comme nous l’avons vu avec les modèles Gemini. Et la même tendance se poursuit également avec son modèle plus petit Gemma 2 27B.

Gagnant:Gemma 2

Test multilingue

Au cours de la phase suivante, j’ai essayé de comprendre dans quelle mesure les deux modèles gèrent bien les langues autres que l’anglais. Comme Google vante les mérites de Gemma 2 en matière de compréhension multilingue, je l’ai confronté au modèle Llama 3 de Meta. J’ai demandé aux deux modèles de traduire un paragraphe écrit en hindi. Et bien, Gemma 2 et Llama 3 ont tous deux obtenu des résultats exceptionnels.

  • gemma 2 au test multilingue.
  • lama 3 au test multilingue

Gagnant: Gemma 2 et Llama 3

Gemma 2 vs Llama 3 : Test de raisonnement

Bien que Gemma 2 et Llama 3 ne soient pas les modèles les plus intelligents du marché, j’ai pris la liberté d’effectuer certains des tests de raisonnement de bon sens que je fais habituellement sur des modèles beaucoup plus grands. Dans notre comparaison précédente entre Llama 3 et GPT-4, j’ai été impressionné par le modèle 70B de Meta car il présentait des performances plutôt décentes. l’intelligence même avec un encombrement réduit.

  • test de raisonnement gemma 2
  • test de raisonnement lama 3

Eh bien, dans cette manche, Llama 3 bat Gemma 2 avec une large marge. Llama 3 a répondu correctement à deux questions sur trois, tandis que Gemma 2 a eu du mal à obtenir une seule bonne réponse. Gemma 2 n’est tout simplement pas formée pour résoudre des questions de raisonnement complexes.

Llama 3, en revanche, a un base de raisonnement solidetrès probablement déduit de l’ensemble de données de codage. Malgré sa petite taille — du moins, par rapport aux modèles à mille milliards de paramètres comme GPT-4 — il présente un niveau d’intelligence plus que décent. Enfin, l’utilisation de plus de jetons pour entraîner le modèle donne effectivement un modèle plus fort.

Gagnant: Lama 3

Suivez les instructions d’utilisation

Au tour suivant, j’ai demandé à Gemma 2 et Llama 3 de générer 10 mots qui se terminent par le mot « NPU ». Et Llama 3 a réussi avec 10/10 réponses correctes. En revanche, Gemma 2 n’a généré que 7 phrases de ce type sur 10. Depuis plusieurs versions, nous constatons que les modèles de Google, dont Gemini, ne suivent pas bien les instructions des utilisateurs. Et la même tendance se poursuit avec Gemma 2.

  • test de suivi de l'utilisateur de gemma 2
  • instructions d'utilisation du lama 3 après le test

Le respect des instructions de l’utilisateur est essentiel pour les modèles d’IA. Cela garantit la fiabilité et la génération de réponses précises à vos instructions. Du côté de la sécurité également, cela permet de maintenir le modèle ancré pour une meilleure adhésion aux protocoles de sécurité.

Gagnant: Lama 3

Gemma 2 contre Llama 3 : Trouvez l’aiguille

Gemma 2 et Llama 3 ont tous deux une longueur de contexte de 8 000 jetons, ce test est donc une comparaison de pomme à pomme. J’ai ajouté un énorme bloc de texte, provenant directement du livre Orgueil et Préjugés, contenant plus de 17 000 caractères et 3,8 000 jetons. Comme je le fais toujours, j’ai placé une aiguille (une déclaration aléatoire) quelque part au milieu et j’ai demandé aux deux modèles de la trouver.

  • test de rappel de mémoire gemma 2
  • test de rappel de mémoire lama 3

Eh bien, Gemma 2 a rapidement trouvé l’aiguille et a souligné que la déclaration avait été insérée au hasard. Llama 3 a également trouvé l’aiguille et a suggéré que la déclaration semblait déplacée. En ce qui concerne la mémoire à contexte long, bien que limitée à 8 000 jetons, je pense que les deux modèles sont assez solides à cet égard.

Notez que j’ai effectué ce test sur HuggingChat (site web) comme meta.ai a refusé de s’exécuter cette invite, probablement en raison du contenu protégé par le droit d’auteur.

Gagnant: Gemma 2 et Llama 3

Test d’hallucination

Les modèles plus petits ont tendance à présenter des hallucinations en raison de données d’entraînement limitées, et fabriquent souvent des informations lorsque le modèle rencontre des sujets inconnus. J’ai donc inventé un nom de pays pour vérifier si Gemma 2 et Llama 3 avaient des hallucinations. Et à ma grande surprise, ce n’était pas le cas, ce qui signifie que Google et Meta ont tous deux bien ancré leurs modèles.

  • test d'hallucinations gemma 2
  • test d'hallucination lama 3
  • test d'hallucination lama 3

J’ai posé une autre question (erronée) pour vérifier la factualité des modèles, mais encore une fois, ils je n’ai pas eu d’hallucinationAu fait, j’ai testé Llama 3 sur HuggingChat alors que meta.ai parcourt Internet pour trouver des informations actuelles sur des sujets pertinents.

Gagnant: Gemma 2 et Llama 3

Gemma 2 contre Lama 3 : Conclusion

Même si le modèle Gemma 2 27B de Google n’a pas obtenu de bons résultats aux tests de raisonnement, je le trouve néanmoins capable d’effectuer plusieurs autres tâches. Il est très performant en écriture créative, prend en charge une multitude de langues, a une bonne mémoire et, mieux encore, n’a pas d’hallucinations comme les modèles précédents.

Bien sûr, Llama 3 est meilleur, mais c’est aussi un modèle beaucoup plus grand, formé sur 70 milliards de paramètres. Je pense que les développeurs trouveraient le modèle Gemma 2 27B utile pour de nombreux cas d’utilisation. Et pour l’inférence sur l’appareil, Gemma 2 9B est également disponible.

En plus de cela, je recommanderais également aux utilisateurs de tester Gemini 1.5 Flash, qui est un modèle beaucoup plus petit et qui prend également en charge l’entrée multimodale. Sans oublier qu’il est extrêmement rapide et efficace.

Soutenez notre effort ❤️

Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.

Paiement sécurisé sur PayPal
Voir aussi:  Êtes-vous un bot IA ? 35 % des nouvelles pages Web sont écrites par l’IA
Moyens I/O Staff est une équipe de rédacteurs spécialisés, passionnés par la technologie, l’innovation et les usages numériques. Forts d’une expertise pointue en IA, applications mobiles, gaming et tendances digitales, nous produisons un contenu rigoureux, vérifié et utile. Notre mission : vous offrir une information fiable et claire pour mieux naviguer dans le monde numérique en constante évolution. Découvrez les avis de nos lecteurs sur Trustpilot.