En los resultados de septiembre de 2026 del Furniture Assembly Benchmark (FAB), Epoch AI situó a GPT-6 Astra en el 80 %. La prueba evalúa si un modelo puede detectar errores de montaje en fotografías; no comprueba si puede montar muebles por su cuenta. En un informe publicado el 23 de septiembre de 2026, Epoch AI también indicó que la mediana de GPT-6 Astra fue de tres minutos por foto.

El resultado de GPT-6 Astra en FAB

El 80 % fue la puntuación más alta de los resultados de FAB comunicados por Epoch AI. Como referencia histórica, la evaluación de noviembre de 2025 situó a Claude Opus 4.5 en el 28 % como resultado más alto de aquel periodo.

ModeloPuntuación en FABPeriodo del benchmark
GPT-6 Astra80 %Septiembre de 2026
Claude Opus 4.528 %Noviembre de 2025

Qué evalúa el Furniture Assembly Benchmark

FAB plantea una tarea de diagnóstico visual: el modelo recibe una fotografía de un mueble parcialmente montado y sus instrucciones. También dispone de una herramienta para ampliar la imagen y de un intérprete de Python, dentro de un entorno con un límite de 80 pasos por imagen.

Para acertar, debe identificar todos los pasos de montaje equivocados y describir los fallos; ante un montaje correcto, debe reconocer que no hay errores. GPT-5.6 Sol evalúa las descripciones y, según Epoch AI, fue configurado para puntuar con indulgencia.

La prueba reunió 60 imágenes de tres muebles IKEA: el zapatero STÄLL, la estructura de cama TONSTAD y la cómoda GULLABERG. En esos modelos, GPT-6 Astra obtuvo un 71 %, un 96 % y un 67 %, respectivamente.

El alcance de los resultados

FAB mide el reconocimiento de errores en imágenes de muebles montados por personas. No evalúa la manipulación física de piezas ni el montaje autónomo de muebles.

Epoch AI no ha medido el rendimiento humano en FAB y considera incierta la extrapolación de sus resultados a otras tareas físicas. La evaluación se limita a esas 60 imágenes y tres montajes.