Nous l’avons tous vu venir, et le jour est enfin arrivé : ChatGPT se transforme lentement en une IA de quartier amicale, avec la capacité de rire de manière effrayante à vos côtés si vous dites quelque chose de drôle, ou de dire « ohhh » si vous êtes gentil. Et ce n’est qu’une infime partie des annonces d’aujourd’hui. OpenAI vient d’organiser une conférence spéciale Mise à jour de l’événement de printempsau cours de laquelle elle a dévoilé son dernier grand modèle de langage (LLM) — GPT-4o. Avec cette mise à jour, ChatGPT obtient une application de bureau, sera meilleure et plus rapide, mais surtout, elle devient entièrement multimodale.
L’événement a débuté par une introduction de Mira Murati, directrice technique d’OpenAI, qui a révélé que les mises à jour d’aujourd’hui ne seront pas réservées aux utilisateurs payants : GPT-4o sera lancé sur toute la plateforme pour les utilisateurs gratuits et les abonnés payants. « La particularité de GPT-4o est qu’il apporte une intelligence de niveau GPT-4 à tout le monde, y compris à nos utilisateurs gratuits », a déclaré Murati.
GPT-4o est réputé pour être beaucoup plus rapide, mais ce qui est impressionnant, c’est qu’il augmente vraiment les capacités de traitement du texte, de la vision et de l’audio. Il peut également être utilisé par les développeurs pour s’intégrer à leurs API, et il serait jusqu’à deux fois plus rapide et 50 % moins cher, avec une limite de débit cinq fois supérieure à celle de GPT-4 Turbo.

Parallèlement au nouveau modèle, OpenAI lance l’application de bureau ChatGPT ainsi qu’une mise à jour de l’interface utilisateur sur le site Web. L’objectif est de rendre le chatbot aussi facile à utiliser que possible. « Nous envisageons l’avenir de l’interaction entre nous et les machines, et nous pensons que GPT-4o fait vraiment évoluer ce paradigme vers l’avenir de la collaboration, où l’interaction devient beaucoup plus naturelle », a déclaré Murati.
À cet égard, les nouvelles améliorations, présentées par Murati avec l’aide de Mark Chen et Barret Zoph d’OpenAI, semblent réellement rendre l’interaction beaucoup plus fluide. GPT-4o est désormais capable d’analyser des vidéos, des images et des discours en temps réel, et il peut identifier avec précision les émotions dans ces trois domaines. C’est particulièrement impressionnant dans ChatGPT Voice, qui est devenu si humain qu’il frôle le bord de la vallée de l’étrange.
Dire « bonjour » à ChatGPT suscite une réaction enthousiaste et amicale, avec une légère nuance de robotique. Lorsque Mark Chen a dit à l’IA qu’il faisait une démonstration en direct et qu’il avait besoin d’aide pour se calmer, elle a semblé suffisamment impressionnée et lui a suggéré de prendre quelques respirations profondes. Elle a également remarqué que ces respirations étaient beaucoup trop rapides (elles ressemblaient plutôt à des halètements, en fait) et a expliqué à Chen la bonne façon de respirer, en faisant d’abord une petite blague : « Tu n’es pas un aspirateur. »
La conversation se déroule naturellement, car vous pouvez désormais interrompre ChatGPT sans avoir à attendre qu’il se termine, et les réponses arrivent rapidement sans pause gênante. Lorsqu’on lui a demandé de raconter une histoire avant de dormir, il a répondu aux demandes concernant son ton de voix, passant d’enthousiaste à dramatique, puis à robotique. La deuxième moitié de la démonstration a montré la capacité de ChatGPT à lire avec précision le code, à aider à résoudre des problèmes mathématiques via la vidéo et à lire et décrire le contenu de l’écran.
La démo n’était pas parfaite : le bot semblait parfois s’interrompre et il était difficile de dire si c’était dû à quelqu’un d’autre qui parlait ou à la latence. Cependant, le son était aussi réaliste que l’on peut l’attendre d’un chatbot, et sa capacité à lire les émotions humaines et à réagir en conséquence est à la fois passionnante et anxiogène. Entendre ChatGPT rire ne figurait pas sur ma liste de choses que je pensais entendre cette semaine, mais nous y sommes.
GPT-4o, avec son design multimodal, ainsi que l’application de bureau, seront lancés progressivement au cours des prochaines semaines. Il y a quelques mois, Bing Chat nous disait qu’il voulait être humain, mais maintenant, nous sommes sur le point d’obtenir une version de ChatGPT qui pourrait être aussi proche de l’humain que nous l’avons jamais vu depuis le début de l’essor de l’IA.
Soutenez notre effort ❤️
Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.






















