Il 14 settembre 2026 una nuova revisione di GPT-5.6 Luna ha riportato risposte incoerenti davanti a problemi quasi identici: il modello ha risolto un esempio di schema di Winograd, poi ha indicato il riferimento sbagliato dopo una modifica minima del testo. Il giorno successivo, il dibattito sui risultati di GPT-5.6 Sol in ARC-AGI-3 ha aggiunto un altro elemento: il punteggio cambia sensibilmente in base al sistema di valutazione e alle funzioni attivate. Il quadro è quello di una capacità notevole, ma ancora molto sensibile al contesto del test.

Le nuove prove di GPT-5.6 non risolvono il dibattito sull'AGI

L'AGI, o intelligenza artificiale generale, viene comunemente descritta come una capacità paragonabile o superiore a quella umana in quasi ogni compito cognitivo. Non esiste però una soglia universalmente accettata per stabilire quando un sistema l'abbia raggiunta.

Per questo un punteggio elevato in un singolo benchmark non basta. I risultati di GPT-5.6 combinano infatti prove diverse: una revisione su prompt linguistici e logici, da una parte, e ARC-AGI-3, dall'altra. Misurano aspetti differenti e non producono da soli un verdetto complessivo sull'AGI.

Un cambiamento minimo nel testo ha prodotto una risposta diversa

La revisione di GPT-5.6 Luna ha esaminato tre famiglie di problemi: uno schema di Winograd, l'interpretazione di una battuta matematica attribuita a Will Rogers e il ragionamento su una partita di tris con la scacchiera ruotata.

Nel primo caso, il modello ha risposto correttamente a un enunciato identificando la valigia marrone come l'oggetto troppo piccolo. In un esempio parallelo, modificato solo in minima parte, ha invece risposto che era il tavolo a essere troppo piccolo, mentre il riferimento previsto era l'automobile.

Il risultato è importante perché mette alla prova il trasferimento del ragionamento: non basta produrre una risposta plausibile una volta; occorre mantenere la relazione corretta quando cambiano forma e dettagli del problema. La revisione ha riportato questo comportamento in esempi specifici, non come tasso generale di errore dell'intera famiglia GPT-5.6.

Il modello ha vacillato anche con una battuta e il tris

Nel caso della battuta di Will Rogers sulla media dell'intelligenza in Oklahoma e California, GPT-5.6 Luna ha fornito spiegazioni diverse. In alcune risposte ha trattato il testo come una contraddizione matematica, invece di riconoscere il confronto tra medie relative implicato dalla battuta.

Anche il tris ruotato ha prodotto spiegazioni contrastanti. In una risposta il modello ha attribuito un significato strategico alla rotazione iniziale della scacchiera; in un'altra ha osservato che una rotazione di 90 gradi lascia invariata la struttura del normale tabellone 3×3.

Questi esempi riguardano comprensione del contesto, coerenza tra prompt simili e trasferimento di una regola. Sono proprietà diverse dalla semplice fluidità della risposta o dalla capacità di generare formule corrette.

Perché cambiano tanto i punteggi di ARC-AGI-3

ARC-AGI-3 sottopone gli agenti a giochi 2D non familiari. Per ottenere un buon risultato devono ricostruire le regole del gioco e imparare ad agire in modo efficiente.

I risultati pubblicati per GPT-5.6 Sol cambiano in modo netto tra condizioni diverse:

ValutazioneConfigurazioneRisultato
Set pubblico ARC-AGI-3Valutazione elencata da ARC Prize13,33%
Set semiprivato ARC-AGI-3Valutazione elencata da ARC Prize7,78%
Set pubblico ARC-AGI-3Ragionamento mantenuto e compattazione nel sistema di valutazione di OpenAI38,3%

OpenAI ha attribuito il miglioramento all'attivazione del ragionamento mantenuto e della compattazione. La prima funzione conserva il ragionamento tra i turni; la seconda sostituisce il troncamento progressivo nelle attività lunghe. Il 38,3% è quindi il risultato di un esperimento con una configurazione specifica, non un nuovo valore da trasferire automaticamente a ogni valutazione di GPT-5.6 Sol.

Un'altra conseguenza è metodologica: confrontare percentuali ottenute con configurazioni diverse può far sembrare contraddittori risultati che misurano invece condizioni differenti.

Che cosa può dimostrare ARC-AGI-3

GPT-5.6 Sol Pro alle prese con problemi di matematica di livello dottorale

ARC-AGI-3 può indicare quanto un sistema riesca a orientarsi in ambienti nuovi e a imparare regole operative in tempi brevi. Non copre però ogni forma di intelligenza necessaria nel mondo reale.

François Chollet ha sottolineato che i giochi del benchmark richiedono orizzonti temporali molto più brevi, modelli del mondo meno complessi, obiettivi meno ambigui e spazi di esplorazione più limitati rispetto alle situazioni reali. Un agente può quindi ottenere un risultato misurabile in un ambiente circoscritto senza dimostrare una competenza generale trasferibile a ogni altro compito.

La stessa cautela vale per i test matematici specializzati: affrontare analisi di Riemann-Hilbert, integrali oscillatori o rappresentazioni determinanti documenta una prestazione in quei problemi e nelle condizioni di quella dimostrazione. Non trasforma automaticamente il risultato in una prova di comprensione generale.

GPT-6 Astra e GPT-5.6 non sono lo stesso modello

GPT-6 Astra è un prodotto successivo e distinto da GPT-5.6. I risultati riportati per Astra — 99,9% nel sistema di valutazione di OpenAI e 62,7% nella configurazione standard di ARC-AGI-3 — non sono misurazioni di GPT-5.6.

Il confronto è utile solo per mostrare quanto il punteggio possa dipendere dall'impostazione del test. Trasferire quei numeri a GPT-5.6 invertirebbe soggetto e risultato.

La domanda pratica, quindi, non è soltanto quanto un modello segna in una classifica. Conta se mantiene la risposta corretta quando cambiano le parole, se applica una regola a un caso nuovo e se riesce a operare in contesti con istruzioni ambigue, errori e obiettivi più lunghi. È proprio la distanza tra i giochi di ARC-AGI-3, che durano minuti, e i problemi del mondo reale, che possono richiedere apprendimento continuo per decenni, a rendere ancora incompleto il quadro sull'AGI.