GPT-6 Astra ha ottenuto il 62,7% su ARC-AGI-3 con Standard a massimo sforzo e il 99,9% con Provider Adapter ad alto sforzo. Un’altra esecuzione con Provider Adapter a massimo sforzo ha raggiunto il 98,6%. ARC Prize ha pubblicato questi risultati il 3 settembre 2026 e afferma di non sostenere che Astra sia AGI. La valutazione di ARC Prize riguarda prestazioni in specifici ambienti interattivi, non una capacità generale valida per qualunque compito.
Per il contesto del lancio e del dibattito sull’AGI, NeoTeo aveva già raccontato GPT-6 Astra. Qui il punto è più circoscritto: capire che cosa cambia tra i risultati ARC-AGI-3 e che cosa misurano.
I punteggi di GPT-6 Astra su ARC-AGI-3
Un harness è l’ambiente e l’interfaccia con cui un modello viene valutato. Su ARC-AGI-3 Semi-Private, ARC Prize ha riportato tre combinazioni di harness e sforzo di ragionamento:
| Condizione di valutazione | Punteggio | Sforzo di ragionamento | Gestione del contesto |
| Standard harness | 62,7% | Massimo | Interfaccia neutrale rispetto al provider |
| Provider Adapter | 98,6% | Massimo | Conserva lo stato opaco di ragionamento tra le richieste e usa la compattazione |
| Provider Adapter | 99,9% | Alto | Conserva lo stato opaco di ragionamento tra le richieste e usa la compattazione |
Il 62,7% e il 99,9% non sono quindi due risultati ottenuti nelle stesse condizioni: cambiano sia l’harness sia lo sforzo di ragionamento. Anche i due punteggi del Provider Adapter vanno distinti: 98,6% corrisponde al massimo sforzo, 99,9% allo sforzo alto.
Che cosa cambia tra i due harness
Standard è progettato per offrire un’interfaccia neutrale rispetto al provider, così da agevolare confronti tra sistemi diversi. Provider Adapter, invece, usa funzioni specifiche di gestione del contesto: secondo ARC Prize conserva tra una richiesta e l’altra lo stato opaco di ragionamento e impiega la compattazione nelle conversazioni lunghe.
La configurazione della prova, dunque, fa parte del risultato. Cambiare harness significa cambiare il modo in cui il modello gestisce il contesto durante l’interazione; il punteggio va letto insieme a quella configurazione e allo sforzo di ragionamento indicato.
Che cosa misura il confronto con le azioni umane
ARC-AGI-3 valuta come un agente esplora e apprende in ambienti nuovi, astratti e a turni. Deve ricavare gli obiettivi dall’interazione e affrontare attività di esplorazione, modellazione, pianificazione ed esecuzione, anziché seguire istruzioni esplicite per ogni passaggio.
Per costruire un termine di paragone, ARC Prize ha testato circa 500 persone del pubblico generale. Per ciascun livello, la baseline umana è la mediana delle azioni compiute dai partecipanti che lo hanno completato. Nelle prove di Astra con Provider Adapter a massimo sforzo, il modello ha usato meno azioni di quella mediana nel 96,0% dei livelli; la riduzione media è stata del 51,7% per livello.
Questi valori descrivono l’efficienza delle azioni in quella famiglia di livelli e con quel setup. Non misurano la capacità di svolgere qualsiasi attività umana.
Perché questi test non dimostrano l’AGI
Gli ambienti di ARC-AGI-3 sono circoscritti, deterministici e con obiettivi definiti. ARC Prize afferma che non rappresentano la complessità del mondo reale e che saturare un benchmark non è una prova di AGI. La stessa fondazione non sostiene che GPT-6 Astra sia AGI.
Un punteggio molto alto indica quindi un risultato notevole sui compiti misurati; non equivale a una valutazione complessiva dell’intelligenza del modello in contesti aperti e diversi.