Les résultats des tests de Gemini 4 Argon rapportés le 2 octobre lui attribuent 53 points à l’Intelligence Index, comme à GPT-6 Astra ; Claude Opus 5.5 atteint 58. Les scores d’Argon changent selon les épreuves, de l’automatisation au codage. Cette comparaison complète notre article sur les critiques liées au codage de Gemini 4 Argon et la réponse de Google avec des résultats couvrant plusieurs types de tâches.
Le résultat de l’Intelligence Index
Gemini 4 Argon et GPT-6 Astra ont tous deux obtenu 53 points à l’Intelligence Index. Le réglage de raisonnement utilisé était High pour Argon et Max pour Astra. Claude Opus 5.5 a marqué 58 points.
| Modèle | Score à l’Intelligence Index |
| Gemini 4 Argon | 53 |
| GPT-6 Astra | 53 |
| Claude Opus 5.5 | 58 |
L’index rassemble plusieurs dimensions en un score composite. Les évaluations ciblées mettent en évidence des écarts différents selon la tâche : le score commun d’Argon et d’Astra ne résume donc pas l’ensemble de leurs performances.
Des résultats différents selon les tests
Sur AA-Omniscience, Gemini 4 Argon affiche un taux d’hallucination de 15 % et un score d’exactitude de 50 %. Le taux mesure notamment la tendance du modèle à deviner plutôt qu’à reconnaître l’incertitude dans les cas évalués ; l’exactitude est un indicateur distinct.
À AutomationBench-AA, Argon obtient 78 %, contre 71 % pour Claude Sonnet 5.5. Sur Terminal Bench 4, il atteint 57 % : Claude Sonnet 5.5 obtient 64 %, Claude Opus 5.5, 60 %, et GPT-6 Astra, 59 %. Google a également publié un résultat de 51,3 % à l’AutomationBench de Zapier, une évaluation distincte d’AutomationBench-AA.
Le déploiement annoncé par Google
Le 30 septembre 2026, Google a annoncé un déploiement initial de Gemini 4 Argon auprès d’un groupe de cyberdéfenseurs de confiance dans le cadre de Fairwind. Pour élargir l’accès, l’entreprise a cité les clients de son API payante et les abonnés Google AI Ultra parmi les premiers groupes concernés.