Berichtgeving van 30 september 2026 citeerde anonieme mensen met directe toegang tot het project, die problemen beschreven bij sommige programmeertaken en bij interfaceontwerp van Gemini 4 Argon. Google bestreed de typering dat het model zwakker presteert bij programmeren en wees op intern gebruik en tests. Een andere anonieme Google-medewerker zei dat er intern brede overeenstemming was dat Argon tot de voorhoede behoorde. Diezelfde dag kondigde Google het model aan en rapporteerde het benchmarkscores.

Wat Googles vier gerapporteerde scores meten

De vier scores gaan over verschillende, afgebakende taken. Google rapporteerde de resultaten als volgt:

BenchmarkGeteste taakScore volgens Google
DeepSWE v1.1Langdurige software-engineeringtaken77,9%
AutomationBenchEnd-to-end-taken voor bedrijfsfuncties51,3%
LVBenchBegrip van lange video’s91,7%
CWE-bench v1Verhelpen van softwarekwetsbaarheden68%

Google zei dat Gemini 4 Argon op AutomationBench als eerste eindigde en op CWE-bench v1 de eerste plaats deelde. Een score op zo’n specifieke test beschrijft prestaties op de bijbehorende taak; die geeft op zichzelf geen uitsluitsel over hoe een model presteert bij allerlei programmeeropdrachten of interfaceontwerp.

Verslagen over praktisch gebruik

Een vroege promptvergelijking zet modelantwoorden naast elkaar en bespreekt de positie van Gemini 4 Argon op Agent Arena.

De kritiek betrof sommige programmeertaken en interfaceontwerp. Googles reactie ging over programmeren: het bedrijf bestreed dat Argon daarop inferieur presteerde en verwees naar intern gebruik en tests. De anonieme interne beoordeling dat Argon tot de voorhoede behoorde, biedt een ander perspectief, maar is geen beschrijving van dezelfde concrete taken of meetmethode.

Een promptvergelijking zet modelantwoorden naast elkaar en bespreekt een vroege positie van Gemini 4 Argon op Agent Arena. De demonstratie gebruikt een kleine reeks prompts; de spreker noemt het een snelle indruk en merkt op dat de resultaten per prompt wisselen.

Aangekondigde toegang en outputlimiet

Google kondigde de eerste externe toegang aan voor vertrouwde cyberverdedigers via het Fairwind Program. Voor een latere, bredere fase noemde het bedrijf betalende API-klanten en abonnees van Google AI Ultra. De gefaseerde uitrol kwam ook aan bod in NeoTeo’s eerdere bericht over Gemini 4 Argon.

Google kondigde voor Gemini 4 Argon een limiet aan van 1.000.000 uitvoertokens, tegenover 64.000 eerder. Dat getal slaat op de hoeveelheid tekst die het model kan genereren.