Volgens ARC Prize behaalde GPT-6 Astra op ARC-AGI-3 Semi-Private 62,7% met Standard bij maximale redeneerinspanning, 98,6% met Provider Adapter bij maximale inspanning en 99,9% met die adapter bij hoge inspanning. ARC Prize publiceerde de evaluatie op 3 september 2026. De scores horen bij verschillende testopstellingen en instellingen.

ARC-AGI-3 is een benchmark waarin een model leert handelen in nieuwe, abstracte omgevingen. De uitkomsten zeggen dus iets over prestaties binnen die taakfamilie. De lancering en de bredere AGI-vraag rond Astra kwamen eerder aan bod in de eerdere bespreking van GPT-6 Astra.

De ARC-AGI-3-scores van GPT-6 Astra

De drie gerapporteerde scores horen bij deze combinaties van testopstelling en redeneerinspanning:

TestopstellingScoreRedeneerinspanningContextbeheer
Standard62,7%MaximaalProviderneutraal
Provider Adapter98,6%MaximaalAfgeschermde redeneertoestand bewaren tussen verzoeken; contextcompressie gebruiken
Provider Adapter99,9%HoogAfgeschermde redeneertoestand bewaren tussen verzoeken; contextcompressie gebruiken

De vergelijking tussen 62,7% en 99,9% verandert dus niet alleen van harness: ook de redeneerinspanning verschilt. De 98,6% is de Provider Adapter-score bij maximale inspanning. Zo blijven de uitkomsten gekoppeld aan de instellingen waaronder ARC Prize ze rapporteerde.

Wat verandert er tussen Standard en Provider Adapter?

Standard is opgezet als een providerneutrale interface, zodat modellen van verschillende aanbieders op een vergelijkbare manier kunnen worden geëvalueerd. Provider Adapter maakt gebruik van functies voor contextbeheer. ARC Prize beschrijft hoe die opstelling afgeschermde redeneertoestand tussen verzoeken bewaart en contextcompressie toepast bij langere gesprekken.

Dat zijn verschillende routes door dezelfde benchmark, niet dezelfde testconditie met een andere naam. Bij het interpreteren van een percentage tellen daarom zowel de gebruikte harness als de redeneerinspanning mee.

Wat de vergelijking met menselijke acties meet

Bij de Provider Adapter-run met maximale redeneerinspanning gebruikte GPT-6 Astra op 96,0% van de levels minder acties dan de mediane menselijke baseline. Gemiddeld waren per level 51,7% minder acties nodig. Voor de menselijke referentie liet ARC Prize ongeveer 500 mensen uit het algemene publiek meedoen; de baseline per level was het mediane aantal acties van de deelnemers die dat level voltooiden.

De maatstaf gaat over efficiëntie in acties binnen ARC-AGI-3. De omgevingen vragen een model om doelen af te leiden en al doende te leren, en vervolgens te verkennen, plannen en handelen. De percentages beschrijven die benchmarktaken, niet algemene menselijke vaardigheid.

Waarom deze tests geen AGI aantonen

ARC-AGI-3 gebruikt begrensde, deterministische en gesloten omgevingen. ARC Prize zegt dat die de complexiteit van de echte wereld niet vertegenwoordigen. Het benchmarkresultaat meet daarmee prestaties op een afgebakende groep taken; ARC Prize zegt expliciet niet te claimen dat GPT-6 Astra AGI is.