Lors de l’I/O 2024, Google a annoncé sa prochaine famille de modèles Gemma 2, et maintenant, la société a finalement publié les modèles légers sous une licence open source. Le nouveau modèle Gemma 2 27B est réputé très prometteur, surpassant plusieurs modèles plus grands comme Llama 3 70B et Qwen 1.5 32B. Donc, pour tester cette affirmation, nous avons élaboré cette comparaison entre Gemma 2 et Llama 3, deux modèles open source de premier plan. Sur cette note, commençons.
Gemma 2 contre Llama 3 : Écriture créative
Commençons par vérifier à quel point Gemma 2 et Llama 3 sont bons en matière d’écriture créative. J’ai demandé aux deux modèles d’écrire une courte histoire sur la relation de la lune avec le soleil. Les deux ont fait un excellent travail, mais Google Le modèle Gemma 2 a fait un carton plein avec une prose délicieuse et une belle histoire en prime.
Llama 3, en revanche, semblait un peu ennuyeux et robotique, presque comme une IA comme nous l’avons vu avec les modèles d’OpenAI. Google a toujours été bon en génération de texte comme nous l’avons vu avec les modèles Gemini. Et la même tendance se poursuit également avec son modèle plus petit Gemma 2 27B.
Gagnant:Gemma 2
Test multilingue
Au cours de la phase suivante, j’ai essayé de comprendre dans quelle mesure les deux modèles gèrent bien les langues autres que l’anglais. Comme Google vante les mérites de Gemma 2 en matière de compréhension multilingue, je l’ai confronté au modèle Llama 3 de Meta. J’ai demandé aux deux modèles de traduire un paragraphe écrit en hindi. Et bien, Gemma 2 et Llama 3 ont tous deux obtenu des résultats exceptionnels.
Gagnant: Gemma 2 et Llama 3
Gemma 2 vs Llama 3 : Test de raisonnement
Bien que Gemma 2 et Llama 3 ne soient pas les modèles les plus intelligents du marché, j’ai pris la liberté d’effectuer certains des tests de raisonnement de bon sens que je fais habituellement sur des modèles beaucoup plus grands. Dans notre comparaison précédente entre Llama 3 et GPT-4, j’ai été impressionné par le modèle 70B de Meta car il présentait des performances plutôt décentes. l’intelligence même avec un encombrement réduit.
Eh bien, dans cette manche, Llama 3 bat Gemma 2 avec une large marge. Llama 3 a répondu correctement à deux questions sur trois, tandis que Gemma 2 a eu du mal à obtenir une seule bonne réponse. Gemma 2 n’est tout simplement pas formée pour résoudre des questions de raisonnement complexes.
Llama 3, en revanche, a un base de raisonnement solidetrès probablement déduit de l’ensemble de données de codage. Malgré sa petite taille — du moins, par rapport aux modèles à mille milliards de paramètres comme GPT-4 — il présente un niveau d’intelligence plus que décent. Enfin, l’utilisation de plus de jetons pour entraîner le modèle donne effectivement un modèle plus fort.
Gagnant: Lama 3
Suivez les instructions d’utilisation
Au tour suivant, j’ai demandé à Gemma 2 et Llama 3 de générer 10 mots qui se terminent par le mot « NPU ». Et Llama 3 a réussi avec 10/10 réponses correctes. En revanche, Gemma 2 n’a généré que 7 phrases de ce type sur 10. Depuis plusieurs versions, nous constatons que les modèles de Google, dont Gemini, ne suivent pas bien les instructions des utilisateurs. Et la même tendance se poursuit avec Gemma 2.
Le respect des instructions de l’utilisateur est essentiel pour les modèles d’IA. Cela garantit la fiabilité et la génération de réponses précises à vos instructions. Du côté de la sécurité également, cela permet de maintenir le modèle ancré pour une meilleure adhésion aux protocoles de sécurité.
Gagnant: Lama 3
Gemma 2 contre Llama 3 : Trouvez l’aiguille
Gemma 2 et Llama 3 ont tous deux une longueur de contexte de 8 000 jetons, ce test est donc une comparaison de pomme à pomme. J’ai ajouté un énorme bloc de texte, provenant directement du livre Orgueil et Préjugés, contenant plus de 17 000 caractères et 3,8 000 jetons. Comme je le fais toujours, j’ai placé une aiguille (une déclaration aléatoire) quelque part au milieu et j’ai demandé aux deux modèles de la trouver.
Eh bien, Gemma 2 a rapidement trouvé l’aiguille et a souligné que la déclaration avait été insérée au hasard. Llama 3 a également trouvé l’aiguille et a suggéré que la déclaration semblait déplacée. En ce qui concerne la mémoire à contexte long, bien que limitée à 8 000 jetons, je pense que les deux modèles sont assez solides à cet égard.
Notez que j’ai effectué ce test sur HuggingChat (site web) comme meta.ai a refusé de s’exécuter cette invite, probablement en raison du contenu protégé par le droit d’auteur.
Gagnant: Gemma 2 et Llama 3
Test d’hallucination
Les modèles plus petits ont tendance à présenter des hallucinations en raison de données d’entraînement limitées, et fabriquent souvent des informations lorsque le modèle rencontre des sujets inconnus. J’ai donc inventé un nom de pays pour vérifier si Gemma 2 et Llama 3 avaient des hallucinations. Et à ma grande surprise, ce n’était pas le cas, ce qui signifie que Google et Meta ont tous deux bien ancré leurs modèles.
J’ai posé une autre question (erronée) pour vérifier la factualité des modèles, mais encore une fois, ils je n’ai pas eu d’hallucinationAu fait, j’ai testé Llama 3 sur HuggingChat alors que meta.ai parcourt Internet pour trouver des informations actuelles sur des sujets pertinents.
Gagnant: Gemma 2 et Llama 3
Gemma 2 contre Lama 3 : Conclusion
Même si le modèle Gemma 2 27B de Google n’a pas obtenu de bons résultats aux tests de raisonnement, je le trouve néanmoins capable d’effectuer plusieurs autres tâches. Il est très performant en écriture créative, prend en charge une multitude de langues, a une bonne mémoire et, mieux encore, n’a pas d’hallucinations comme les modèles précédents.
Bien sûr, Llama 3 est meilleur, mais c’est aussi un modèle beaucoup plus grand, formé sur 70 milliards de paramètres. Je pense que les développeurs trouveraient le modèle Gemma 2 27B utile pour de nombreux cas d’utilisation. Et pour l’inférence sur l’appareil, Gemma 2 9B est également disponible.
En plus de cela, je recommanderais également aux utilisateurs de tester Gemini 1.5 Flash, qui est un modèle beaucoup plus petit et qui prend également en charge l’entrée multimodale. Sans oublier qu’il est extrêmement rapide et efficace.
Soutenez notre effort ❤️
Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.


































