Ein Bericht vom 30. September 2026 gab Einschätzungen anonymer Personen mit direktem Projektzugang wieder: Gemini 4 Argon habe bei einzelnen Programmieraufgaben und beim Interface-Design Schwierigkeiten. Google wies die Darstellung zurück, das Modell sei beim Programmieren unterlegen, und verwies auf interne Tests und eigene Nutzung. Am selben Tag hatte Google das Modell vorgestellt und vier Benchmarkwerte veröffentlicht.
Was Googles vier Benchmarkwerte messen
Google meldete Ergebnisse für vier Benchmarks, die unterschiedliche Aufgabenbereiche abdecken. Die Prozentwerte lassen sich deshalb nicht zu einer gemeinsamen Rangliste zusammenfassen.
| Benchmark | Bewerteter Aufgabenbereich | Von Google gemeldeter Wert |
| DeepSWE v1.1 | Langfristige Softwareentwicklung mit praxisnahen Aufgaben | 77,9 % |
| AutomationBench | Ende-zu-Ende-Aufgaben in Geschäftsprozessen | 51,3 % |
| LVBench | Verständnis langer Videos | 91,7 % |
| CWE-bench v1 | Behebung von Softwareschwachstellen | 68 % |
Was über den praktischen Einsatz berichtet wurde
Die anonymen Personen mit direktem Projektzugang schilderten Probleme bei bestimmten Programmieraufgaben und beim Interface-Design. Google widersprach der Einschätzung, Argons Programmierleistung sei unterlegen, und verwies auf interne Tests und den eigenen Einsatz des Modells. Eine weitere anonyme Google-Beschäftigte beschrieb laut dem Bericht eine breite interne Übereinstimmung, dass Argon zur Spitzengruppe gehöre.
Als Beispiel für interne Arbeit nannte Google die Portierung des Videodecoders libgav1 auf Rust. Argon-Agenten hätten dabei 32.000 Zeilen SIMD-Code ersetzt. Der daraus entstandene Decoder sei bei identischer Videoausgabe 2,7-mal schneller als der vorherige Rust-Port.
Ein promptbasierter Vergleich mit wenigen Aufgaben zeigt unterschiedliche Modellausgaben und ordnet sie in eine frühe Rangliste ein. Die kleine Auswahl liefert eine Momentaufnahme, keine umfassende Leistungsbewertung.
Zugang und Ausgabelimit
Google beschrieb den ersten externen Zugang als gestaffelten Rollout über das Fairwind-Programm für vertrauenswürdige Cyberabwehrteams. Für die anschließende Ausweitung nannte das Unternehmen zahlende API-Kunden und Abonnenten von Google AI Ultra als erste Gruppen. Mehr zur angekündigten Reihenfolge steht in unserer früheren Meldung zum gestaffelten Zugang.
Google gab für Gemini 4 Argon ein Ausgabelimit von 1.000.000 Tokens an; zuvor lag das genannte Limit bei 64.000 Tokens.