Relacje opublikowane 30 września 2026 r. przypisywały anonimowym osobom z bezpośrednim dostępem do projektu zastrzeżenia dotyczące części zadań programistycznych i projektowania interfejsów. Google zakwestionowało ocenę, że Gemini 4 Argon gorzej radzi sobie z programowaniem, i wskazało na wewnętrzne użycie modelu oraz testy. Tego samego dnia firma ogłosiła Argon i podała wyniki czterech benchmarków.
Ogłoszenie modelu i etapowy plan dostępu opisaliśmy wcześniej w osobnym materiale. W tym ujęciu istotne jest zestawienie wyników z relacjami o pracy modelu w praktyce.
Co mierzą wyniki benchmarków Google
Google podało cztery wyniki, a każdy dotyczy innego rodzaju zadania. DeepSWE v1.1 obejmuje długotrwałe zadania z inżynierii oprogramowania, AutomationBench — realizację zadań biznesowych, LVBench — rozumienie długich nagrań wideo, a CWE-bench v1 — usuwanie podatności w oprogramowaniu.
| Benchmark | Oceniane zadanie | Wynik podany przez Google |
| DeepSWE v1.1 | Długotrwałe zadania z inżynierii oprogramowania | 77,9% |
| AutomationBench | Zadania związane z funkcjami biznesowymi | 51,3% |
| LVBench | Rozumienie długich nagrań wideo | 91,7% |
| CWE-bench v1 | Usuwanie podatności w oprogramowaniu | 68% |
Google wskazało pierwsze miejsce Argon w AutomationBench oraz remis na szczycie CWE-bench v1. Wyniki opisują osiągnięcia w konkretnych testach; relacje o praktycznym użyciu dotyczą innego wymiaru pracy modelu.
Relacje o praktycznym użyciu i odpowiedź Google
Anonimowe osoby z bezpośrednim dostępem do projektu opisywały trudności w części zadań programistycznych i przy projektowaniu interfejsów. Google odrzuciło ocenę, że Argon wypada gorzej w programowaniu, i powołało się na wewnętrzne testy oraz użycie modelu. Inny anonimowy pracownik Google miał oceniać, że w firmie panowała szeroka zgoda co do tego, że Argon należy do czołówki modeli.
Te relacje dotyczą wybranych sytuacji pracy z modelem, podczas gdy wyniki benchmarków odnoszą się do zadań zdefiniowanych w poszczególnych testach. To dlatego dobre wyniki testowe i zastrzeżenia dotyczące konkretnych zastosowań mogą pojawiać się obok siebie.
Porównanie promptów pokazuje przykładowe odpowiedzi modelu oraz pozycję w rankingu Agent Arena. Niewielka próbka pozwala przyjrzeć się konkretnym generacjom, ale nie daje obrazu długotrwałej pracy nad projektem programistycznym.
Zapowiedziany dostęp i limit tokenów
Google opisało etapowe udostępnianie Gemini 4 Argon. Początkowy dostęp zewnętrzny miało otrzymać grono zaufanych obrońców cyberbezpieczeństwa w programie Fairwind. Późniejsza, szersza faza miała rozpocząć się od płatnych klientów API i subskrybentów Google AI Ultra.
Google podało limit wyjściowy wynoszący 1 000 000 tokenów, w porównaniu z wcześniejszym limitem 64 000. Chodzi o maksymalną liczbę tokenów generowanych w odpowiedzi modelu.