En los resultados de septiembre de 2026 del Furniture Assembly Benchmark (FAB), Epoch AI situó a GPT-6 Astra en el 80 %. La prueba evalúa si un modelo puede detectar errores de montaje en fotografías; no comprueba si puede montar muebles por su cuenta. En un informe publicado el 23 de septiembre de 2026, Epoch AI también indicó que la mediana de GPT-6 Astra fue de tres minutos por foto.
El resultado de GPT-6 Astra en FAB
El 80 % fue la puntuación más alta de los resultados de FAB comunicados por Epoch AI. Como referencia histórica, la evaluación de noviembre de 2025 situó a Claude Opus 4.5 en el 28 % como resultado más alto de aquel periodo.
| Modelo | Puntuación en FAB | Periodo del benchmark |
| GPT-6 Astra | 80 % | Septiembre de 2026 |
| Claude Opus 4.5 | 28 % | Noviembre de 2025 |
Qué evalúa el Furniture Assembly Benchmark
FAB plantea una tarea de diagnóstico visual: el modelo recibe una fotografía de un mueble parcialmente montado y sus instrucciones. También dispone de una herramienta para ampliar la imagen y de un intérprete de Python, dentro de un entorno con un límite de 80 pasos por imagen.
Para acertar, debe identificar todos los pasos de montaje equivocados y describir los fallos; ante un montaje correcto, debe reconocer que no hay errores. GPT-5.6 Sol evalúa las descripciones y, según Epoch AI, fue configurado para puntuar con indulgencia.
La prueba reunió 60 imágenes de tres muebles IKEA: el zapatero STÄLL, la estructura de cama TONSTAD y la cómoda GULLABERG. En esos modelos, GPT-6 Astra obtuvo un 71 %, un 96 % y un 67 %, respectivamente.
El alcance de los resultados
FAB mide el reconocimiento de errores en imágenes de muebles montados por personas. No evalúa la manipulación física de piezas ni el montaje autónomo de muebles.
Epoch AI no ha medido el rendimiento humano en FAB y considera incierta la extrapolación de sus resultados a otras tareas físicas. La evaluación se limita a esas 60 imágenes y tres montajes.