I risultati comparativi riportati il 2 ottobre assegnano a Gemini 4 Argon 53 punti nell’Intelligence Index, lo stesso punteggio di GPT-6 Astra; Claude Opus 5.5 ne ha ottenuti 58. È un pareggio su un indice composito, mentre le prove su accuratezza fattuale, automazione e coding restituiscono esiti diversi.

Il confronto nell’Intelligence Index

ModelloPunteggio nell’Intelligence Index
Gemini 4 Argon53
GPT-6 Astra53
GPT-6.1 Sol52
Claude Opus 5.558

Nel test, Gemini 4 Argon è stato valutato con il ragionamento impostato su High, mentre GPT-6 Astra era su Max. Il punteggio complessivo non descrive ogni singola capacità: Claude Opus 5.5, per esempio, ha ottenuto 58 nello stesso indice.

Risultati diversi a seconda del test

Su AA-Omniscience, Gemini 4 Argon ha registrato il 15% nella misura del tasso di allucinazioni e il 50% di accuratezza. La misura delle allucinazioni riguarda i casi del benchmark in cui il modello può indovinare una risposta errata o riconoscere l’incertezza; l’accuratezza è un dato distinto. Per GPT-6 Astra, i risultati riportati sulle due misure erano rispettivamente 51% e 63%.

Il profilo cambia nelle prove operative. Gemini 4 Argon ha ottenuto il 78% su AutomationBench-AA, contro il 71% di Claude Sonnet 5.5. Su Terminal Bench 4 ha totalizzato il 57%, sotto GPT-6 Astra al 59%, Claude Opus 5.5 al 60% e Claude Sonnet 5.5 al 64%.

Google ha comunicato separatamente un risultato del 51,3% su AutomationBench di Zapier: si tratta di una valutazione distinta da AutomationBench-AA.

Il nuovo quadro dei benchmark integra il precedente articolo di NeoTeo su Gemini 4 Argon.

Il rollout annunciato da Google

Il 30 settembre Google ha annunciato l’avvio di una distribuzione graduale di Gemini 4 Argon tramite Fairwind, inizialmente rivolta a un gruppo di difensori informatici di fiducia. Per la fase successiva di accesso più ampio, l’azienda ha indicato come primi destinatari i clienti API a pagamento e gli abbonati a Google AI Ultra.