I risultati comparativi riportati il 2 ottobre assegnano a Gemini 4 Argon 53 punti nell’Intelligence Index, lo stesso punteggio di GPT-6 Astra; Claude Opus 5.5 ne ha ottenuti 58. È un pareggio su un indice composito, mentre le prove su accuratezza fattuale, automazione e coding restituiscono esiti diversi.
Il confronto nell’Intelligence Index
| Modello | Punteggio nell’Intelligence Index |
| Gemini 4 Argon | 53 |
| GPT-6 Astra | 53 |
| GPT-6.1 Sol | 52 |
| Claude Opus 5.5 | 58 |
Nel test, Gemini 4 Argon è stato valutato con il ragionamento impostato su High, mentre GPT-6 Astra era su Max. Il punteggio complessivo non descrive ogni singola capacità: Claude Opus 5.5, per esempio, ha ottenuto 58 nello stesso indice.
Risultati diversi a seconda del test
Su AA-Omniscience, Gemini 4 Argon ha registrato il 15% nella misura del tasso di allucinazioni e il 50% di accuratezza. La misura delle allucinazioni riguarda i casi del benchmark in cui il modello può indovinare una risposta errata o riconoscere l’incertezza; l’accuratezza è un dato distinto. Per GPT-6 Astra, i risultati riportati sulle due misure erano rispettivamente 51% e 63%.
Il profilo cambia nelle prove operative. Gemini 4 Argon ha ottenuto il 78% su AutomationBench-AA, contro il 71% di Claude Sonnet 5.5. Su Terminal Bench 4 ha totalizzato il 57%, sotto GPT-6 Astra al 59%, Claude Opus 5.5 al 60% e Claude Sonnet 5.5 al 64%.
Google ha comunicato separatamente un risultato del 51,3% su AutomationBench di Zapier: si tratta di una valutazione distinta da AutomationBench-AA.
Il nuovo quadro dei benchmark integra il precedente articolo di NeoTeo su Gemini 4 Argon.
Il rollout annunciato da Google
Il 30 settembre Google ha annunciato l’avvio di una distribuzione graduale di Gemini 4 Argon tramite Fairwind, inizialmente rivolta a un gruppo di difensori informatici di fiducia. Per la fase successiva di accesso più ampio, l’azienda ha indicato come primi destinatari i clienti API a pagamento e gli abbonati a Google AI Ultra.