Op 14 september 2026 verscheen een nieuwe retest van GPT-5.6 Luna met drie lastige redeneertaken. Het model gaf bij vrijwel dezelfde Winograd-vraag verschillende antwoorden, wisselde van uitleg bij een wiskundige grap en redeneerde niet consistent over een gedraaid drie-op-een-rij-bord. Tegelijkertijd behaalde GPT-5.6 Sol op ARC-AGI-3 13,33% op de openbare set en 7,78% op de semi-private set. Die combinatie wijst op indrukwekkende, maar voorwaardelijke prestaties — niet op een definitief antwoord op de vraag of GPT-5.6 algemene kunstmatige intelligentie is.

Een kleine wijziging in de vraag veranderde het antwoord

De retest van GPT-5.6 Luna onderzocht onder meer een Winograd-schema: een korte zin waarin een model moet bepalen naar welk zelfstandig naamwoord een voornaamwoord verwijst. In één voorbeeld identificeerde Luna de bruine koffer als het voorwerp dat te klein was. Na een minimale wijziging in een parallel voorbeeld wees het model echter de tafel aan, terwijl de auto het bedoelde voorwerp was.

Dat is precies het soort test waarbij vloeiende taal niet genoeg is. Het model moet de relatie tussen woorden vasthouden wanneer de formulering verandert. Een antwoord dat overtuigend klinkt, kan toch op een verkeerd verband berusten.

Ook een grap en een gedraaid bord zorgden voor twijfel

Dezelfde retest beschreef wisselende verklaringen van GPT-5.6 Luna bij een grap van Will Rogers over gemiddelde intelligentie in Oklahoma en Californië. Het model behandelde de grap in sommige uitleggen als een wiskundige tegenstrijdigheid, terwijl de clou draait om een vergelijking van relatieve gemiddelden.

Bij een andere taak ging het om drie-op-een-rij op een bord dat eenmalig 90 graden was gedraaid. Luna gaf volgens de retest tegenstrijdige verklaringen over de vraag of die draaiing de strategie veranderde of alleen de fysieke oriëntatie van het bord.

Dit waren concrete observaties uit een retest, geen algemene foutmarge voor de hele GPT-5.6-familie. Ze raken wel aan een belangrijk AGI-criterium: kan een model een redenering betrouwbaar meenemen naar een licht gewijzigde situatie?

Waarom GPT-5.6 Sol zulke verschillende ARC-AGI-3-scores heeft

ARC-AGI-3 laat AI-systemen onbekende 2D-spelomgevingen onderzoeken. Ze moeten de regels afleiden en vervolgens efficiënt handelen. GPT-5.6 Sol kreeg daarbij verschillende resultaten, afhankelijk van de set en de testopstelling.

EvaluatieModel en omstandighedenResultaatWat wordt gemeten?
ARC-AGI-3, openbare setGPT-5.6 Sol, vermelde evaluatiecondities13,33%Regels afleiden en handelen in onbekende 2D-spellen
ARC-AGI-3, semi-private setGPT-5.6 Sol, vermelde evaluatiecondities7,78%Hetzelfde type onbekende 2D-speltaken op een andere set
ARC-AGI-3, openbare setGPT-5.6 Sol met vastgehouden redeneerstappen en compaction in de door OpenAI gerapporteerde testopstelling38,3%Hetzelfde benchmarktype met een andere configuratie van model en testopstelling

OpenAI rapporteerde op 29 juli 2026 dat het resultaat op de openbare set steeg van 13,3% naar 38,3% nadat redeneerstappen werden vastgehouden en compaction werd ingeschakeld. Bij compaction wordt informatie uit een lange taak samengevat in plaats van simpelweg steeds verder uit het contextvenster te verdwijnen.

De cijfers spreken elkaar niet noodzakelijk tegen: ze horen bij verschillende configuraties. Maar ze laten wel zien waarom een benchmarkscore zonder modelvariant, dataset en testopstelling weinig zegt over algemene intelligentie.

Wat ARC-AGI-3 wel en niet meet

ARC-AGI-3 meet een afgebakende vaardigheid: leren omgaan met onbekende spelregels in korte 2D-omgevingen. Dat is een nuttige test voor aanpassing en efficiënt handelen, maar het is niet hetzelfde als functioneren in de echte wereld.

Volgens François Chollet hebben echte situaties veel langere leercycli, complexere wereldmodellen, meer onduidelijke doelen en grotere zoekruimtes dan de spellen van ARC-AGI-3. De benchmark kan dus een deel van probleemoplossend vermogen zichtbaar maken, maar geen universele uitspraak doen over alle cognitieve taken.

Er bestaat bovendien geen algemeen aanvaarde grens waarboven een systeem automatisch AGI heet. Een veelgebruikte omschrijving gaat uit van menselijke of betere prestaties op vrijwel alle cognitieve taken. De beschikbare GPT-5.6-resultaten beantwoorden die bredere vraag niet.

Een gespecialiseerde demonstratie is nog geen algemene test

Een demonstratie van GPT-5.6 Sol Pro op geavanceerde wiskunde

Een afzonderlijke demonstratie laat zien hoe GPT-5.6 Sol Pro werkt aan geavanceerde wiskundige problemen, waaronder Riemann-Hilbert-analyse. De maker bespreekt daarbij zowel sterke antwoorden als omslachtige of verwarrende passages en benadrukt de rol van goede prompts en een aangepaste agentopstelling.

GPT-6 Astra is een ander model

GPT-6 Astra en GPT-5.6 zijn afzonderlijke modellen. Gemelde ARC-AGI-3-resultaten van GPT-6 Astra mogen daarom niet worden gebruikt als metingen van GPT-5.6. Ze illustreren hoogstens dat scores sterk kunnen veranderen wanneer een model of testopstelling verandert.

De bruikbaarste vraag is daardoor niet of één opvallend percentage AGI bewijst. Kijk naar overdracht: blijft het model correct wanneer de formulering, context of taak licht verandert? De Luna-retest en de uiteenlopende Sol-scores laten zien waarom juist die betrouwbaarheid naast een hoge benchmarkscore telt.