Em relatório publicado em 23 de setembro de 2026, a Epoch AI informou que GPT-6 Astra obteve 80% no Furniture Assembly Benchmark (FAB), uma avaliação de setembro que testa se modelos conseguem identificar erros de montagem em fotos. O resultado anterior mais alto citado pela organização era de Claude Opus 4.5, com 28% em novembro de 2025.

O resultado relatado de GPT-6 Astra no FAB

A Epoch AI relatou 80% para GPT-6 Astra em sua avaliação de setembro de 2026. O modelo teve a maior pontuação entre os resultados apresentados no relatório, seguido por Claude Fable 5.1, com 70%, e Claude Opus 5, com 61%.

A organização também informou que o tempo de GPT-6 Astra foi de três minutos por foto, pela mediana. Em novembro de 2025, Claude Opus 4.5 havia alcançado 28% na comparação histórica da Epoch AI. A organização observou que não tinha pontuações de GPT-5 e Gemini 3 para aquela comparação.

O que o Furniture Assembly Benchmark avalia

O FAB verifica se um modelo consegue comparar fotos de móveis parcialmente montados com as instruções de montagem e localizar erros. Para cada imagem com falhas, o modelo deve identificar todas as etapas incorretas e descrever os problemas; diante de uma montagem correta, deve indicar que não há erro.

A avaliação reuniu 60 imagens de três montagens de móveis IKEA: o armário para sapatos STÄLL, a estrutura de cama TONSTAD e a cômoda GULLABERG. Os modelos receberam as instruções, uma ferramenta de zoom nas imagens e um interpretador Python em um ambiente de execução controlado, com limite de 80 etapas por imagem.

A avaliação das descrições ficou a cargo de GPT-5.6 Sol, configurado para fazer uma correção leniente. Esse critério faz parte da pontuação relatada pela Epoch AI.

Resultados relatados do FAB por modelo e período

ModeloResultado relatado no FABPeríodo do resultado
GPT-6 Astra80%Setembro de 2026
Claude Opus 4.528%Novembro de 2025

O que o benchmark permite concluir

O FAB mede diagnóstico visual de montagens feitas por pessoas. A tarefa não inclui manipular peças nem montar móveis fisicamente. Portanto, a pontuação de GPT-6 Astra descreve seu desempenho nessa avaliação com imagens e instruções.

A Epoch AI testou 60 imagens de apenas três montagens e ainda não mediu o desempenho de pessoas no benchmark. A organização afirma que permanece incerto até que ponto os resultados se aplicam a outras tarefas físicas.