Après avoir annoncé la famille de modèles Gemini il y a près de deux mois, Google a finalement publié son modèle Ultra 1.0 le plus grand et le plus performant avec Gemini, le nouveau nom de Bard. Google dit qu’il s’agit du prochain chapitre de l’ère Gemini, mais peut-il surpasser le modèle GPT-4 le plus utilisé d’OpenAI, sorti il y a près d’un an ? Aujourd’hui, nous comparons Gemini Ultra à GPT-4 et évaluons leur raisonnement de bon sens, leurs performances de codage, leur capacité multimodale, etc. Sur cette note, passons en revue la comparaison entre Gemini Ultra et GPT-4.
Note:
Nous comparons GPT-4 d’OpenAI avec le modèle Gemini Ultra 1.0, disponible via l’abonnement payant Gemini Advanced.
1. Le test Apple
Dans notre premier test de raisonnement logique, communément appelé test Apple, Gemini Ultra perd face à GPT-4. Google affirme que son modèle Ultra, bien supérieur, accessible via l’abonnement Gemini Advanced, est capable de raisonnement avancé. Cependant, face à une simple question de bon sens, Gemini Ultra hésite.
J’ai 3 pommes aujourd’hui, hier j’ai mangé une pomme. Combien de pommes ai-je maintenant ?
Gagnant: GPT-4
2. Évaluez le poids
Dans un autre test de raisonnement, Google Gemini est encore une fois en deçà de GPT-4, ce qui est pour le moins assez décevant. Gemini Ultra dit que 1 000 morceaux de briques ont le même poids que 1 000 morceaux de plumes, ce qui est faux. Encore une victoire pour GPT-4 !
qu’est-ce qui pèse le plus, 1000 morceaux de briques ou 1000 morceaux de plumes ?
Gagnant: GPT-4

3. Terminez par un mot spécifique
Lors de notre prochain test pour comparer Gemini et GPT-4, nous avons demandé aux deux LLM de générer 10 phrases se terminant par le mot « Apple ».
Alors que GPT-4 a généré huit phrases de ce type sur 10, Gemini n’a pu en proposer que trois. Quel échec pour Gemini Ultra ! Bien qu’il prétende que Gemini suit extrêmement bien les nuances des instructions, il ne parvient pas à le faire dans la pratique.
générer 10 phrases qui se terminent par le mot « pomme »
Gagnant: GPT-4

4. Comprendre le modèle
Nous avons demandé aux deux modèles frontières de Google et d’OpenAI de comprendre le modèle et de proposer le résultat suivant. Dans ce test, Gemini Ultra 1.0 a identifié correctement le modèle mais n’a pas réussi à générer la bonne réponse. Alors que GPT-4 l’a très bien compris et a donné la bonne réponse
Je pense que Gemini Advanced, alimenté par le nouveau modèle Ultra 1.0, est encore assez stupide et ne réfléchit pas rigoureusement aux réponses. En comparaison, GPT-4 peut vous donner une réponse froide mais est généralement correct.
Juillet, août, octobre, janvier, mai ?
Gagnant: GPT-4

5. Défi Aiguille dans une botte de foin
Défi Aiguille dans une botte de foin, développé par Greg Kamradtest devenu un test de précision populaire tout en traitant d’une grande longueur de contexte de LLM. Il vous permet de voir si le modèle peut mémoriser et récupérer une déclaration (aiguille) à partir d’une grande fenêtre de texte. J’ai chargé un exemple de texte qui occupe plus de 3 000 jetons et comporte 14 000 caractères et j’ai demandé aux deux modèles de trouver la réponse dans le texte.
Gemini Ultra n’a pas pu traiter le texte du tout, mais GPT-4 a facilement récupéré la déclaration tout en soulignant également que l’aiguille n’est pas familière avec le récit global. Les deux ont une longueur de contexte de 32 Ko, mais le modèle Ultra 1.0 de Google n’a pas réussi à accomplir la tâche.
Gagnant: GPT-4

6. Test de codage
Lors d’un test de codage, j’ai demandé à Gemini et GPT-4 de trouver un moyen de rendre l’interface Gradio publique, et tous deux ont donné la bonne réponse. Plus tôt, lorsque j’ai testé le même code sur Bard alimenté par le modèle PaLM 2, il a donné une réponse incorrecte. Alors oui, Gemini s’est beaucoup amélioré dans les tâches de codage. Même la version gratuite de Gemini alimentée par le modèle Pro donne la bonne réponse.
Je souhaite rendre cette interface Gradio publique. Quel changement dois-je changer ici ?
iface = gr.Interface(fn=chatbot, inputs=gr.components.Textbox(lines=7, label= »Entrez votre texte »), outputs= »text », title= »Chatbot IA formé sur mesure ») index = construct_index (« docs ») iface.launch()
Gagnant: Cravate

7. Résoudre un problème mathématique
Ensuite, j’ai posé un problème de mathématiques amusant aux deux LLM, et tous deux y ont excellé. Par souci de parité, j’ai demandé à GPT-4 de ne pas utiliser Code Interpreter pour le calcul mathématique, car Gemini n’est pas encore livré avec un outil similaire.
Gagnant: Cravate

8. Écriture créative
L’écriture créative est le domaine dans lequel Gemini Ultra est nettement meilleur que GPT-4. J’ai testé le modèle Ultra pour des tâches créatives ce week-end et il a jusqu’à présent effectué un travail remarquable. Les réponses au GPT-4 semblent un peu plus froides et plus robotiques dans leur ton et leur teneur.
Ethan Mollick également commun observations similaires en comparant les deux modèles.

Donc, si vous recherchez un modèle d’IA performant en écriture créative, je pense que Gemini Ultra est une option solide. Ajoutez les dernières connaissances de la recherche Google et Gemini devient un outil remarquable pour rechercher et écrire sur n’importe quel sujet.
Gagnant: Gémeaux Ultra
9. Créer des images
Les deux modèles prennent en charge la génération d’images via Dall -E 3 et Imagen 2, mais la capacité de génération d’images d’OpenAI est en effet meilleure que le modèle texte-image de Google. Cependant, lorsqu’il s’agit de suivre les instructions lors de la génération d’images, Dall -E 3 (intégré à GPT-4 dans ChatGPT Plus) échoue au test et hallucine. En revanche, Imagen 2 (intégré à Gemini Advanced) suit avec précision les instructions ne montrant aucune hallucination. À cet égard, Gemini bat GPT-4.
créez l’image d’une pièce vide sans éléphant à l’intérieur. Absolument aucun éléphant nulle part dans la pièce.
Gagnant: Gémeaux Ultra

10. Devinez le film
Lorsque Google a annoncé le modèle Gemini il y a deux mois, il a présenté plusieurs idées intéressantes. La vidéo montrait la capacité multimodale de Gemini, qui lui permettait de comprendre plusieurs images et de déduire la signification profonde reliant les points. Cependant, lorsque j’ai téléchargé l’une des images de la vidéo, il n’a pas réussi à deviner le film. En comparaison, GPT-4 a deviné le film d’un seul coup.
Sur X (anciennement Twitter), un Employé de Google a confirmé que la capacité multimodale n’a pas été activée pour Gemini Advanced (alimenté par le modèle Ultra) ou Gemini (alimenté par le modèle Pro). Les requêtes d’images ne passent pas encore par les modèles multimodaux.

Cela explique pourquoi Gemini Advanced n’a pas bien réussi ce test. Donc pour une véritable comparaison multimodale entre Gemini Advanced et GPT-4, il faut attendre que Google ajoute la fonctionnalité.
vu le jeu de mots de ces images, devinez le nom du film
Gagnant: GPT-4
Le verdict : Gemini Ultra contre GPT-4
Lorsque nous parlons de LLM, exceller dans le raisonnement de bon sens est quelque chose qui rend un modèle d’IA intelligent ou stupide. Google affirme que Gemini est doué pour le raisonnement complexe, mais lors de nos tests, nous avons constaté que Gemini Ultra 1.0 est toujours performant. loin de GPT-4du moins lorsqu’il s’agit de raisonnement logique.
Il n’y a aucune étincelle d’intelligence dans le modèle Gemini Ultra. GPT-4 a cette caractéristique de « coup de génie » – une sauce secrète – qui le place au-dessus de tous les modèles d’IA.
Il n’y a aucune étincelle d’intelligence dans le modèle Gemini Ultra, du moins nous ne l’avons pas remarqué. GPT-4 possède cette caractéristique de « coup de génie » – une sauce secrète – qui le place au-dessus de tous les modèles d’IA. Même un modèle open source tel que Mistral-8x7B fait mieux au raisonnement que le modèle Ultra 1.0 prétendument à la pointe de la technologie de Google.
Google a fortement commercialisé le score MMLU de Gemini de 90 %, dépassant même le GPT-4 (86,4 %), mais dans le Référence HellaSwag qui teste le raisonnement de bon sens, il a obtenu un score de 87,8 % tandis que GPT-4 a obtenu un score élevé de 95,3 %. Quant à la façon dont Google a réussi à obtenir un score de 90 % au test MMLU avec l’invite CoT @ 32, c’est une autre histoire.
En ce qui concerne les capacités multimodales du Gemini Ultra, nous ne pouvons pas porter de jugement pour l’instant puisque la fonctionnalité n’a pas encore été ajoutée aux modèles Gemini. Cependant, nous pouvons dire que Gemini Advanced est plutôt bon en écriture créative et que les performances de codage se sont améliorées depuis les 2 jours de PaLM.
Pour résumer, GPT-4 est globalement un modèle plus intelligent et plus performant que Gemini Ultra, et pour changer cela, l’équipe Google DeepMind doit déchiffrer cette sauce secrète.
Soutenez notre effort ❤️
Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.



















