Nel Furniture Assembly Benchmark (FAB), Epoch AI ha riportato per GPT-6 Astra un punteggio dell’80% nei risultati di settembre 2026. Il rapporto, pubblicato il 23 settembre, descrive una prova di diagnosi visiva: il modello doveva individuare errori in foto di mobili IKEA parzialmente montati, non assemblare mobili in autonomia.

I punteggi riportati per modello e periodo

Nel risultato di settembre 2026, GPT-6 Astra ha raggiunto l’80%, davanti a Claude Fable 5.1, al 70%, e Claude Opus 5, al 61%. Il precedente punteggio più alto riportato da Epoch AI per FAB era il 28% di Claude Opus 4.5 nel novembre 2025.

ModelloPunteggio FAB riportatoPeriodo del benchmark
GPT-6 Astra80%Settembre 2026
Claude Fable 5.170%Settembre 2026
Claude Opus 561%Settembre 2026
Claude Opus 4.528%Novembre 2025

Per GPT-6 Astra, Epoch AI ha riportato anche un tempo mediano di tre minuti per foto.

Che cosa valuta il Furniture Assembly Benchmark

FAB comprende 60 immagini distribuite su tre montaggi di mobili IKEA: la scarpiera STÄLL, la struttura letto TONSTAD e la cassettiera GULLABERG. Il modello riceveva una foto, le istruzioni di montaggio, uno strumento per ingrandire le immagini e un interprete Python, con un limite di 80 passaggi per immagine.

Per ottenere un risultato corretto, doveva individuare ogni passaggio di montaggio sbagliato e descrivere l’errore; davanti a un mobile montato correttamente, doveva invece segnalare che non c’erano errori. Un modello linguistico, GPT-5.6 Sol, valutava le descrizioni: Epoch AI riferisce che era stato istruito a usare criteri indulgenti.

I risultati di GPT-6 Astra variavano tra i tre mobili: 71% su STÄLL, 96% su TONSTAD e 67% su GULLABERG. Il punteggio complessivo dell’80% riassume quindi le prestazioni su questo specifico insieme di immagini e montaggi.

Che cosa dimostra il benchmark

FAB misura la capacità di confrontare una foto con le istruzioni e riconoscere errori in un mobile montato da una persona. Non valuta la manipolazione fisica dei componenti né l’assemblaggio autonomo da parte di un robot.

Epoch AI non ha misurato le prestazioni umane sul benchmark e afferma che resta incerto quanto i risultati si estendano ad altri compiti fisici. La valutazione riguarda 60 immagini di tre montaggi: è questo il perimetro del punteggio riportato.