Em relatório publicado em 23 de setembro de 2026, a Epoch AI informou que GPT-6 Astra obteve 80% no Furniture Assembly Benchmark (FAB), uma avaliação de setembro que testa se modelos conseguem identificar erros de montagem em fotos. O resultado anterior mais alto citado pela organização era de Claude Opus 4.5, com 28% em novembro de 2025.
O resultado relatado de GPT-6 Astra no FAB
A Epoch AI relatou 80% para GPT-6 Astra em sua avaliação de setembro de 2026. O modelo teve a maior pontuação entre os resultados apresentados no relatório, seguido por Claude Fable 5.1, com 70%, e Claude Opus 5, com 61%.
A organização também informou que o tempo de GPT-6 Astra foi de três minutos por foto, pela mediana. Em novembro de 2025, Claude Opus 4.5 havia alcançado 28% na comparação histórica da Epoch AI. A organização observou que não tinha pontuações de GPT-5 e Gemini 3 para aquela comparação.
O que o Furniture Assembly Benchmark avalia
O FAB verifica se um modelo consegue comparar fotos de móveis parcialmente montados com as instruções de montagem e localizar erros. Para cada imagem com falhas, o modelo deve identificar todas as etapas incorretas e descrever os problemas; diante de uma montagem correta, deve indicar que não há erro.
A avaliação reuniu 60 imagens de três montagens de móveis IKEA: o armário para sapatos STÄLL, a estrutura de cama TONSTAD e a cômoda GULLABERG. Os modelos receberam as instruções, uma ferramenta de zoom nas imagens e um interpretador Python em um ambiente de execução controlado, com limite de 80 etapas por imagem.
A avaliação das descrições ficou a cargo de GPT-5.6 Sol, configurado para fazer uma correção leniente. Esse critério faz parte da pontuação relatada pela Epoch AI.
Resultados relatados do FAB por modelo e período
| Modelo | Resultado relatado no FAB | Período do resultado |
| GPT-6 Astra | 80% | Setembro de 2026 |
| Claude Opus 4.5 | 28% | Novembro de 2025 |
O que o benchmark permite concluir
O FAB mede diagnóstico visual de montagens feitas por pessoas. A tarefa não inclui manipular peças nem montar móveis fisicamente. Portanto, a pontuação de GPT-6 Astra descreve seu desempenho nessa avaliação com imagens e instruções.
A Epoch AI testou 60 imagens de apenas três montagens e ainda não mediu o desempenho de pessoas no benchmark. A organização afirma que permanece incerto até que ponto os resultados se aplicam a outras tarefas físicas.