Dans son rapport publié le 23 septembre 2026, Epoch AI rapporte un score de 80 % pour GPT-6 Astra au Furniture Assembly Benchmark (FAB). Cette évaluation mesure la capacité d’un modèle à repérer des erreurs de montage à partir de photos et d’une notice, pas à assembler physiquement un meuble.

Un score de 80 % sur le test FAB

Les résultats rapportés par Epoch AI pour septembre 2026 placent GPT-6 Astra à 80 %. En novembre 2025, Claude Opus 4.5 avait obtenu 28 %, le meilleur score antérieur rapporté pour FAB.

ModèleScore FAB rapportéPériode évaluée
GPT-6 Astra80 %Septembre 2026
Claude Opus 4.528 %Novembre 2025

Epoch AI rapporte aussi un temps médian de trois minutes par photo pour GPT-6 Astra, le plus rapide parmi les modèles évalués.

Ce que mesure le Furniture Assembly Benchmark

FAB s’appuie sur 60 photos réparties entre trois meubles IKEA : STÄLL, une armoire à chaussures, TONSTAD, un cadre de lit, et GULLABERG, une commode. Les images montrent des montages corrects ou comportant des erreurs.

Pour chaque photo, le modèle reçoit la notice de montage, un outil de zoom et un interpréteur Python dans un environnement agentique, avec un budget de 80 actions. Il doit repérer et décrire chaque étape mal exécutée ; si le meuble est correctement monté, il doit reconnaître qu’il n’y a pas d’erreur. Un modèle de langage, GPT-5.6 Sol, juge les descriptions avec une consigne de notation indulgente. Le plafond de 80 actions a été atteint dans moins de 5 % des cas.

Les scores de GPT-6 Astra varient selon le meuble : 71 % pour STÄLL, 96 % pour TONSTAD et 67 % pour GULLABERG.

La portée du résultat

FAB mesure un diagnostic visuel à partir de photos et de consignes. Il n’évalue ni la manipulation des pièces ni l’assemblage autonome d’un meuble.

L’évaluation porte sur 60 images et trois montages. Epoch AI indique ne pas avoir mesuré les performances humaines et précise que la généralisation des résultats à d’autres tâches physiques reste incertaine.