Resoconti pubblicati il 30 settembre 2026, giorno in cui Google annunciò Gemini 4 Argon, hanno attribuito a persone anonime con accesso diretto al progetto difficoltà in alcune attività pratiche di programmazione e nella progettazione di interfacce. Google ha contestato la valutazione secondo cui il modello sarebbe inferiore nella programmazione. L’azienda aveva presentato Argon con quattro risultati di benchmark, ciascuno riferito a un ambito specifico.
Gemini 4 Argon: benchmark e prestazioni nell’uso pratico
Secondo i resoconti del 30 settembre, alcune persone anonime con accesso diretto al progetto ritenevano che Argon faticasse in determinate attività di programmazione e nella progettazione di interfacce. Google ha respinto l’idea che il modello avesse prestazioni inferiori nella programmazione. Un’altra persona dipendente di Google, anch’essa anonima, ha riferito che all’interno dell’azienda c’era ampio accordo sul fatto che Argon fosse un modello all’avanguardia.
Le valutazioni riguardano ambiti diversi: i quattro benchmark comunicati da Google coprono attività di ingegneria del software, processi aziendali, comprensione di video lunghi e correzione di vulnerabilità. Non costituiscono un’unica prova di programmazione pratica.
Che cosa misurano i quattro risultati comunicati da Google
Google ha comunicato questi punteggi, associandoli a test distinti:
| Benchmark | Ambito valutato | Risultato comunicato da Google |
| DeepSWE v1.1 | Attività di ingegneria del software articolate e di lunga durata | 77,9% |
| AutomationBench | Esecuzione completa di funzioni e processi aziendali | 51,3% |
| LVBench | Comprensione di video lunghi | 91,7% |
| CWE-bench v1 | Correzione di vulnerabilità software | 68% |
I risultati danno un’indicazione sulle prestazioni nei rispettivi test; il dato su LVBench, per esempio, riguarda la comprensione di video e non la programmazione. Google ha inoltre riferito che Argon si è classificato a pari merito al primo posto su CWE-bench v1.
I resoconti sull’uso pratico e un confronto limitato
Un confronto rapido tra prompt mette a fianco le risposte di più modelli e mostra risultati variabili da una prova all’altra. Il campione è ridotto: è un esempio circoscritto del comportamento su quei prompt, non una valutazione complessiva delle attività di programmazione o progettazione di interfacce.
Accesso annunciato e limite di output
Nel piano presentato il 30 settembre, Google ha indicato una prima fase di accesso per difensori informatici di fiducia tramite il Fairwind Program, seguita da un ampliamento che sarebbe partito dai clienti API a pagamento e dagli abbonati a Google AI Ultra. Il piano iniziale non descriveva un accesso generalizzato. Il quadro dell’annuncio è ricostruito anche nel precedente approfondimento di NeoTeo.
Google ha annunciato per Gemini 4 Argon un limite di 1.000.000 di token in output, rispetto ai 64.000 del precedente limite in uscita citato dall’azienda. La misura indica quanti token il modello può generare, non la lunghezza della finestra di contesto.