W zestawieniu opublikowanym 2 października 2026 r. Gemini 4 Argon uzyskał 53 punkty w Intelligence Index — tyle samo co GPT-6 Astra. Claude Opus 5.5 zdobył 58 punktów. Remis dotyczy jednego indeksu: wyniki Argona różnią się w zależności od testowanego zadania. Wcześniej opisaliśmy odpowiedź Google na krytykę dotyczącą Gemini 4 Argon; nowe zestawienie pokazuje model z innej strony.

Wynik Gemini 4 Argon w Intelligence Index

Intelligence Index łączy wyniki w jeden wskaźnik. W tym zestawieniu Argon testowano przy ustawieniu rozumowania High, a GPT-6 Astra przy Max. Wyniki obu modeli były równe, choć testowano je na różnych ustawieniach.

ModelWynik w Intelligence Index
Gemini 4 Argon53
GPT-6 Astra53
GPT-6.1 Sol52
Claude Opus 5.558

Claude Opus 5.5 uzyskał najwyższy wynik w tym zestawieniu. Równe 53 punkty Argona i GPT-6 Astra opisują ich rezultat w indeksie, a nie identyczne wyniki w każdym zadaniu.

Wyniki zależą od rodzaju testu

W AA-Omniscience Gemini 4 Argon uzyskał 15% w mierze wskaźnika halucynacji oraz 50% dokładności. Pierwsza miara dotyczy skłonności do błędnego zgadywania w przypadkach, w których model może przyznać, że nie jest pewien odpowiedzi. Dokładność to osobny wynik. Dla GPT-6 Astra podano odpowiednio 51% i 63%.

W AutomationBench-AA Argon zdobył 78%, a Claude Sonnet 5.5 — 71%. Inaczej wypadł w Terminal Bench 4: jego wynik 57% był niższy niż rezultat GPT-6 Astra (59%), Claude Opus 5.5 (60%) i Claude Sonnet 5.5 (64%).

Wcześniej opisaliśmy reakcję Google na uwagi dotyczące praktycznego działania modelu. Wyniki poszczególnych testów pokazują, dlaczego pojedynczy rezultat indeksu nie wystarcza do opisania całego profilu modelu.

Wdrożenie zapowiedziane przez Google

30 września 2026 r. Google ogłosiło etapowe wdrażanie Gemini 4 Argon w programie Fairwind, rozpoczynając od zaufanych obrońców cyberbezpieczeństwa. Jako pierwsze grupy szerszego dostępu firma wskazała płatnych klientów API oraz subskrybentów Google AI Ultra.