In een rapport dat Epoch AI op 23 september 2026 publiceerde, meldde de organisatie dat GPT-6 Astra in september 2026 80% scoorde op de Furniture Assembly Benchmark (FAB). Die benchmark test of een AI-model montagefouten kan herkennen op foto’s van meubels die al gedeeltelijk in elkaar zijn gezet.

Wat test de Furniture Assembly Benchmark?

FAB beoordeelt of een model een montagehandleiding en foto’s kan gebruiken om fouten in een meubelmontage te vinden en te beschrijven. Bij een correcte montage moet het model aangeven dat er geen fout is.

Epoch AI testte 60 foto’s van drie IKEA-meubelmontages. Per foto kregen de modellen de handleiding, een zoomfunctie en een Python-interpreter in een agentische testomgeving, met een limiet van 80 handelingen. GPT-6 Astra’s gerapporteerde mediane verwerkingstijd was drie minuten per foto.

Epoch AI gebruikte GPT-5.6 Sol om te beoordelen of beschrijvingen van fouten klopten. De organisatie gaf deze beoordelaar de opdracht mild te beoordelen.

Gerapporteerde FAB-scores per model en periode

ModelGerapporteerde FAB-scoreBenchmarkperiode
GPT-6 Astra80%September 2026
Claude Opus 4.528%November 2025

De 28% voor Claude Opus 4.5 was volgens Epoch AI de hoogste score in de historische FAB-resultaten van november 2025. De twee scores geven de gerapporteerde resultaten voor hun eigen model en periode weer.

Wat zeggen de resultaten over de test?

FAB meet het herkennen van montagefouten in beeld, niet het fysiek in elkaar zetten van meubels. De score van GPT-6 Astra is dus een resultaat voor die visuele diagnoseopdracht.

De evaluatie besloeg 60 foto’s van drie meubelmontages. Epoch AI heeft menselijke prestaties op FAB niet gemeten en zegt dat nog onduidelijk is hoe goed de resultaten zich vertalen naar andere fysieke taken.