Des personnes anonymes ayant accès au projet ont fait état de difficultés de Gemini 4 Argon sur certaines tâches pratiques de programmation et de conception d’interfaces. Google a contesté l’idée que son modèle soit inférieur en codage. Ces critiques ont été rendues publiques le 30 septembre 2026, le jour où Google a annoncé Gemini 4 Argon et communiqué ses résultats de benchmark. Nous avions déjà présenté l’annonce du modèle et son déploiement par étapes.

Les quatre scores évaluent des tâches distinctes

Google a communiqué quatre résultats sur des benchmarks consacrés à des domaines différents. DeepSWE v1.1 porte sur des tâches de génie logiciel à long horizon ; AutomationBench évalue des fonctions métier de bout en bout ; LVBench mesure la compréhension de vidéos longues ; CWE-bench v1 concerne la remédiation de vulnérabilités logicielles.

BenchmarkTâche évaluéeRésultat communiqué par Google
DeepSWE v1.1Tâches de génie logiciel à long horizon77,9 %
AutomationBenchFonctions métier de bout en bout51,3 %
LVBenchCompréhension de vidéos longues91,7 %
CWE-bench v1Remédiation de vulnérabilités logicielles68 %

Ces scores décrivent des performances sur des épreuves ciblées ; ils ne mesurent pas tous le même type de travail. Google a également indiqué qu’Argon arrivait en tête sur AutomationBench et était à égalité pour la première place sur CWE-bench v1.

Les critiques sur l’usage pratique et la réponse de Google

Comparaison côte à côte de réponses générées et affichage d’un classement Agent Arena pour Gemini 4 Argon.

Les personnes anonymes ayant accès au projet ont décrit des difficultés dans certaines tâches pratiques de programmation et de conception d’interfaces. Google a rejeté l’idée qu’Argon soit inférieur en programmation et a invoqué ses usages et ses tests internes. Une autre personne anonyme au sein de Google a fait état d’un large accord interne selon lequel le modèle se situait à la pointe.

Une comparaison de prompts juxtapose des réponses générées par plusieurs modèles et affiche un classement Agent Arena. L’exercice est présenté comme un aperçu rapide mené sur un petit échantillon, avec des résultats qui varient selon les consignes.

Déploiement annoncé et limite de sortie

Dans son annonce du 30 septembre, Google a décrit un déploiement progressif : l’accès externe initial devait passer par le programme Fairwind et concerner des cyberdéfenseurs de confiance. Pour une ouverture plus large, l’entreprise a cité en premier les clients de l’API payante et les abonnés Google AI Ultra.

Google a annoncé une limite de 1 000 000 de jetons en sortie, contre 64 000 auparavant. Il s’agit du nombre de jetons que le modèle peut produire, et non d’une mesure de longueur de contexte.