Pendant un temps, nous avons pensé que Mountain View avait « perdu le nord » avec son développement des intelligences artificielles, mais tout semble indiquer que l'inquiétude est derrière nous. À travers une publication sur son blog officiel, Google a annoncé Gemini, un nouveau modèle multimodal qui cherche à concurrencer GPT-4, le système actuel dans la version payante de ChatGPT. Google décrit Gemini comme le modèle le plus puissant qu'il ait créé jusqu'à présent, tout en reconnaissant la nécessité d'une plus grande flexibilité en confirmant l'existence de trois builds ou « tailles », dont l'une est déjà disponible via Bard.

Un aperçu de Gemini, le nouveau modèle d'intelligence artificielle de Google
Google Gemini

Chaque modèle d'intelligence artificielle a ses points forts et ses faiblesses, mais une chose est sûre : ils doivent faire bien plus que ce qu'ils font aujourd'hui. Si nous jetons une pierre dans n'importe quelle direction, il est presque impossible de ne pas toucher un chatbot, cependant le public a besoin de travailler avec d'autres contenus que le texte. Ainsi, nous arrivons à la phase des modèles « multimodaux ». Vidéo, audio, code et images sont à la portée de ces plateformes, et dans le cas spécifique de Google, sa réponse est Gemini.

Gemini, le modèle multimodal de Google qui concurrencera GPT-4

Google explique que les exemples précédents de « multimodalité » n'étaient rien de plus que différents modèles exclusifs (texte seul, images seules, audio seul) réunis de manière peu efficace dans des phases secondaires de traitement. Gemini n'utilise pas cette stratégie, mais a été conçu dès le départ pour intégrer la multimodalité dans sa structure.

Un autre aspect essentiel de Gemini est qu'il sera disponible en trois modes ou « tailles » : Gemini Ultra pour les tâches de haute complexité qui demandent beaucoup de matériel, Gemini Pro orienté vers un usage général, et Gemini Nano, pensé pour les appareils mobiles et l'exécution locale.

Un aperçu de Gemini, le nouveau modèle d'intelligence artificielle de Google
Bard a déjà intégré une version spéciale de Gemini Pro, et elle est disponible dans 170 pays
Un aperçu de Gemini, le nouveau modèle d'intelligence artificielle de Google
L'analyse de vidéos est apparue en novembre, mais Gemini/Bard fait un assez bon travail (il faut d'abord activer l'extension)

Pour le moment, il n'est possible d'accéder qu'à Gemini Pro, grâce à un build spécialement optimisé pour Google Bard. Cependant, les utilisateurs en territoire européen et au Royaume-Uni devront attendre un peu plus (régulations, régulations). Une autre restriction est celle de la langue : pour explorer les vertus de Gemini/Bard, il faut parler anglais.

Un aperçu de Gemini, le nouveau modèle d'intelligence artificielle de Google
Les benchmarks se basent sur Gemini Ultra, et ne sont pas si utiles

Comme on pouvait s'y attendre, Google a partagé plusieurs benchmarks qui placent Gemini Ultra au-dessus ou au même niveau que GPT-4, mais cela ne change rien pour l'utilisateur moyen. En fait, une contradiction apparaît en présentant Gemini comme une solution générale, et en soulignant ses performances à travers des benchmarks extraordinairement spécifiques.

En même temps, les problèmes de fond restent intacts. Les intelligences artificielles inventent encore des réponses ou « délirent » dans leurs sessions, et Gemini n'y est pas immunisé, mais le pari de Google sur sa multimodalité est très grand, et nous en verrons certainement plus dans un avenir proche.

Annonce officielle : Cliquez ici