Relacje opublikowane 30 września 2026 r. przypisywały anonimowym osobom z bezpośrednim dostępem do projektu zastrzeżenia dotyczące części zadań programistycznych i projektowania interfejsów. Google zakwestionowało ocenę, że Gemini 4 Argon gorzej radzi sobie z programowaniem, i wskazało na wewnętrzne użycie modelu oraz testy. Tego samego dnia firma ogłosiła Argon i podała wyniki czterech benchmarków.

Ogłoszenie modelu i etapowy plan dostępu opisaliśmy wcześniej w osobnym materiale. W tym ujęciu istotne jest zestawienie wyników z relacjami o pracy modelu w praktyce.

Co mierzą wyniki benchmarków Google

Google podało cztery wyniki, a każdy dotyczy innego rodzaju zadania. DeepSWE v1.1 obejmuje długotrwałe zadania z inżynierii oprogramowania, AutomationBench — realizację zadań biznesowych, LVBench — rozumienie długich nagrań wideo, a CWE-bench v1 — usuwanie podatności w oprogramowaniu.

BenchmarkOceniane zadanieWynik podany przez Google
DeepSWE v1.1Długotrwałe zadania z inżynierii oprogramowania77,9%
AutomationBenchZadania związane z funkcjami biznesowymi51,3%
LVBenchRozumienie długich nagrań wideo91,7%
CWE-bench v1Usuwanie podatności w oprogramowaniu68%

Google wskazało pierwsze miejsce Argon w AutomationBench oraz remis na szczycie CWE-bench v1. Wyniki opisują osiągnięcia w konkretnych testach; relacje o praktycznym użyciu dotyczą innego wymiaru pracy modelu.

Relacje o praktycznym użyciu i odpowiedź Google

Porównanie odpowiedzi Gemini 4 Argon na kilka promptów oraz widok rankingu Agent Arena.

Anonimowe osoby z bezpośrednim dostępem do projektu opisywały trudności w części zadań programistycznych i przy projektowaniu interfejsów. Google odrzuciło ocenę, że Argon wypada gorzej w programowaniu, i powołało się na wewnętrzne testy oraz użycie modelu. Inny anonimowy pracownik Google miał oceniać, że w firmie panowała szeroka zgoda co do tego, że Argon należy do czołówki modeli.

Te relacje dotyczą wybranych sytuacji pracy z modelem, podczas gdy wyniki benchmarków odnoszą się do zadań zdefiniowanych w poszczególnych testach. To dlatego dobre wyniki testowe i zastrzeżenia dotyczące konkretnych zastosowań mogą pojawiać się obok siebie.

Porównanie promptów pokazuje przykładowe odpowiedzi modelu oraz pozycję w rankingu Agent Arena. Niewielka próbka pozwala przyjrzeć się konkretnym generacjom, ale nie daje obrazu długotrwałej pracy nad projektem programistycznym.

Zapowiedziany dostęp i limit tokenów

Google opisało etapowe udostępnianie Gemini 4 Argon. Początkowy dostęp zewnętrzny miało otrzymać grono zaufanych obrońców cyberbezpieczeństwa w programie Fairwind. Późniejsza, szersza faza miała rozpocząć się od płatnych klientów API i subskrybentów Google AI Ultra.

Google podało limit wyjściowy wynoszący 1 000 000 tokenów, w porównaniu z wcześniejszym limitem 64 000. Chodzi o maksymalną liczbę tokenów generowanych w odpowiedzi modelu.