Epoch AI berichtete am 23. September 2026, dass GPT-6 Astra im September 2026 im Furniture Assembly Benchmark (FAB) 80 Prozent erreichte. Der Test prüft, ob ein Modell anhand von Fotos und Montageanleitungen Fehler in teilweise aufgebauten IKEA-Möbeln erkennt.

GPT-6 Astra erreicht 80 Prozent im Möbelmontage-Benchmark

Der von Epoch AI entwickelte FAB bewertet, ob ein Modell falsche Montageschritte erkennt und beschreibt. Bei korrekt aufgebauten Möbeln soll es feststellen, dass kein Fehler vorliegt. Im September 2026 erzielte GPT-6 Astra dabei 80 Prozent.

Als vorherigen Bestwert im Benchmark meldete Epoch AI 28 Prozent für Claude Opus 4.5 im November 2025. Für diesen historischen Vergleich lagen der Organisation keine Ergebnisse für GPT-5 und Gemini 3 vor.

Was der Furniture Assembly Benchmark prüft

FAB umfasst 60 Fotos aus drei IKEA-Möbelaufbauten: einem STÄLL-Schuhschrank, einem TONSTAD-Bettgestell und einer GULLABERG-Kommode. Die Modelle erhalten das jeweilige Montagehandbuch, ein Werkzeug zum Vergrößern von Bildausschnitten und einen Python-Interpreter in einer Agentenumgebung. Pro Foto stehen ihnen bis zu 80 Aktionen zur Verfügung; diese Grenze wurde in weniger als fünf Prozent der Fälle erreicht.

Bei einem fehlerhaften Aufbau muss das Modell jeden falschen Montageschritt benennen und den Fehler sinnvoll beschreiben. Bei einem korrekten Aufbau muss es melden, dass kein Fehler vorliegt. GPT-5.6 Sol bewertet die Beschreibungen; Epoch AI zufolge wurde das Modell angewiesen, großzügig zu bewerten.

Die gemeldeten FAB-Ergebnisse im Vergleich

ModellBerichteter FAB-WertBenchmark-Zeitraum
GPT-6 Astra80 ProzentSeptember 2026
Claude Opus 4.528 ProzentNovember 2025

Die Werte sind die jeweils gemeldeten Ergebnisse für die genannten Modelle und Zeiträume. Der frühere Bestwert stammt aus dem November 2025; GPT-6 Astra erzielte den Wert von 80 Prozent im September 2026.

Was der Test über KI aussagt

GPT-6 Astra montierte bei FAB keine Möbel. Der Benchmark prüft die visuelle Diagnose eines menschlichen Aufbaus: Das Modell vergleicht Fotos mit der Anleitung und soll Fehler erkennen. Körperliche Handgriffe oder einen eigenständigen Möbelaufbau bewertet FAB nicht.

Die Ergebnisse beruhen auf 60 Fotos von drei Möbelaufbauten. Epoch AI hat die Leistung von Menschen bei FAB nicht gemessen und sagt, dass unklar bleibt, wie gut sich die Ergebnisse auf andere physische Aufgaben übertragen lassen.