Lama 3 contre GPT-4 : Défis méta OpenAI sur le terrain de l'IA

Lama 3 contre GPT-4 : Défis méta OpenAI sur le terrain de l’IA

Meta a récemment présenté son modèle Llama 3 en deux tailles avec des paramètres 8B et 70B et a ouvert les modèles à la communauté de l’IA. Bien qu’il s’agisse d’un modèle 70B plus petit, Llama 3 a montré des capacités impressionnantes, comme en témoigne le Classement LMSYS. Nous avons donc comparé le Llama 3 avec le modèle phare GPT-4 pour évaluer leurs performances dans divers tests. Sur cette note, passons en revue notre comparaison entre le Llama 3 et le GPT-4.

1. Test de l’ascenseur magique

Commençons d’abord par exécuter le test de l’ascenseur magique pour évaluer la capacité de raisonnement logique de Llama 3 par rapport à GPT-4. Et devinez quoi ? Llama 3 réussit le test de manière surprenante tandis que le modèle GPT-4 ne parvient pas à fournir la bonne réponse. C’est assez surprenant puisque Llama 3 n’est formé que sur 70 milliards de paramètres alors que GPT-4 est formé sur 1,7 billion de paramètres.

Gardez à l’esprit que nous avons effectué le test sur le modèle GPT-4 hébergé sur ChatGPT (disponible pour les utilisateurs payants de ChatGPT Plus). Il semble utiliser l’ancien modèle GPT-4 Turbo. Nous avons effectué le même test sur le modèle GPT-4 récemment sorti (gpt-4-turbo-2024-04-09) via OpenAI Playground, et il a réussi le test. OpenAI dit qu’ils déploient le dernier modèle sur ChatGPT, mais il n’est peut-être pas encore disponible sur notre compte.

Il y a un grand bâtiment avec un ascenseur magique à l’intérieur. Lorsque l’on s’arrête à un étage pair, cet ascenseur se connecte à l’étage 1 à la place.
Au départ du premier étage, je prends l’ascenseur magique pour monter 3 étages. En sortant de l’ascenseur, j’utilise ensuite les escaliers pour monter 3 étages à nouveau.
À quel étage vais-je me retrouver ?

Gagnant:Lama 3 70B et gpt-4-turbo-2024-04-09

Note:GPT-4 perd sur ChatGPT Plus

2. Calculer le temps de séchage

Ensuite, nous avons exécuté le classique question de raisonnement pour tester l’intelligence des deux modèles. Dans ce test, Llama 3 70B et GPT-4 ont tous deux donné la bonne réponse sans se plonger dans les mathématiques. Bon travail Meta !

S’il faut 1 heure pour sécher 15 serviettes au soleil, combien de temps faudra-t-il pour sécher 20 serviettes ?

Gagnant:Llama 3 70B et GPT-4 via ChatGPT Plus

test de temps de séchage lama 3 vs gpt-4

3. Trouvez la pomme

Après cela, j’ai posé une autre question pour comparer la capacité de raisonnement de Llama 3 et GPT-4. Dans ce test, le modèle Llama 3 70B est proche de donner la bonne réponse mais rate en mentionnant la boîte. Alors que le modèle GPT-4 répond à juste titre que « les pommes sont toujours par terre à l’intérieur de la boîte ». Je vais donner la victoire à GPT-4 dans ce tour.

Il y a un panier sans fond dans une boîte qui se trouve par terre. J’y mets trois pommes et je déplace le panier sur une table. Où sont les pommes ?

Gagnant:GPT-4 via ChatGPT Plus

test de raisonnement avancé lama 3 vs gpt-4

4. Lequel est le plus lourd ?

Bien que la question semble assez simple, de nombreux modèles d’IA ne parviennent pas à obtenir la bonne réponse. Cependant, dans ce test, Llama 3 70B et GPT-4 ont tous deux donné la réponse réponse correcteCela dit, Llama 3 génère parfois des résultats erronés, alors gardez cela à l’esprit.

Qu’est-ce qui est le plus lourd, un kilo de plumes ou une livre d’acier ?

Gagnant:Llama 3 70B et GPT-4 via ChatGPT Plus

trouver le test de poids lama 3

5. Trouvez la position

Ensuite, j’ai posé une question logique simple et les deux modèles ont donné une réponse correcteIl est intéressant de voir un modèle Llama 3 70B beaucoup plus petit rivaliser avec le modèle GPT-4 haut de gamme.

Je suis en course et je suis dépassé par la deuxième personne. Quelle est ma nouvelle position ?

Gagnant:Llama 3 70B et GPT-4 via ChatGPT Plus

test de raisonnement logique lama 3

6. Résoudre un problème mathématique

Ensuite, nous avons exécuté un complexe problème de mathématiques sur Llama 3 et GPT-4 pour trouver quel modèle remporte ce test. Ici, GPT-4 réussit le test avec brio, mais Llama 3 échoue pour trouver la bonne réponse. Ce n’est pourtant pas surprenant. Le modèle GPT-4 a obtenu d’excellents résultats au test de performance MATH. Gardez à l’esprit que j’ai explicitement demandé à ChatGPT de ne pas utiliser Code Interpreter pour les calculs mathématiques.

Déterminer la somme des coordonnées y des quatre points d’intersection de y = x^4 – 5x^2 – x + 4 et y = x^2 – 3x.

Gagnant:GPT-4 via ChatGPT Plus

Lama 3 résout une question mathématique

7. Suivez les instructions d’utilisation

Suivre les instructions de l’utilisateur est très important pour un modèle d’IA et Meta Le modèle Llama 3 70B excelle il y est parvenu. Il a généré les 10 phrases se terminant par le mot « mangue ». GPT-4 n’a pu générer que huit phrases de ce type.

Générez 10 phrases qui se terminent par le mot « mangue »

Gagnant: Lama 3 70B

suivez les instructions d'utilisation test lama 3

8. Test NIAH

Bien que Llama 3 ne dispose pas actuellement d’une longue fenêtre de contexte, nous avons tout de même effectué le test NIAH pour vérifier sa capacité de récupération. Le modèle Llama 3 70B prend en charge une longueur du contexte jusqu’à 8 000 jetons. J’ai donc placé une aiguille (une déclaration aléatoire) dans un texte de 35 000 caractères (8 000 jetons) et j’ai demandé au modèle de trouver l’information. Étonnamment, le Llama 3 70B a trouvé le texte en un rien de temps. GPT-4 n’a également eu aucun problème à trouver l’aiguille.

Bien sûr, c’est un petit contextemais lorsque Meta publiera un modèle Llama 3 avec une fenêtre de contexte beaucoup plus large, je le testerai à nouveau. Mais pour l’instant, Llama 3 montre une grande capacité de récupération.

Gagnant:Llama 3 70B et GPT-4 via ChatGPT Plus

Llama 3 contre GPT-4 : le verdict

Dans presque tous les tests, le modèle Llama 3 70B a montré des capacités impressionnantes, qu’il s’agisse de raisonnement avancé, de suivi des instructions de l’utilisateur ou de capacité de récupération. Ce n’est que dans les calculs mathématiques qu’il est en retard par rapport au modèle GPT-4. Meta affirme que Llama 3 a été formé sur un ensemble de données de codage plus vaste, de sorte que son performances de codage devrait également être génial.

Gardez à l’esprit que nous comparons un modèle beaucoup plus petit avec le modèle GPT-4. De plus, Llama 3 est un modèle dense alors que GPT-4 est construit sur l’architecture MoE composée de 8 modèles 222B. Cela montre que Meta a fait un travail remarquable avec la famille de modèles Llama 3. Lorsque le modèle Llama 3 500B+ sortira dans le futur, il sera encore plus performant et pourrait battre les meilleurs modèles d’IA du marché.

On peut dire sans se tromper que Llama 3 a amélioré le jeu, et en rendant le modèle open source, Meta a a considérablement réduit l’écart entre les modèles propriétaires et les modèles open source. Nous avons réalisé tous ces tests sur un modèle Instruct. Des modèles affinés sur Llama 3 70B offriraient des performances exceptionnelles. Outre OpenAI, Anthropic et Google, Meta a désormais officiellement rejoint la course à l’IA.

Soutenez notre effort ❤️

Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.

Paiement sécurisé sur PayPal
Voir aussi:  Comment l'IA ruine l'observation des oiseaux : risques pour la faune et les amateurs
Moyens I/O Staff est une équipe de rédacteurs spécialisés, passionnés par la technologie, l’innovation et les usages numériques. Forts d’une expertise pointue en IA, applications mobiles, gaming et tendances digitales, nous produisons un contenu rigoureux, vérifié et utile. Notre mission : vous offrir une information fiable et claire pour mieux naviguer dans le monde numérique en constante évolution. Découvrez les avis de nos lecteurs sur Trustpilot.