We wrześniu 2026 r. GPT-6 Astra uzyskał 80% w Furniture Assembly Benchmark (FAB), teście rozpoznawania błędów montażu na zdjęciach mebli. Epoch AI, twórca benchmarku, podało ten wynik w raporcie opublikowanym 23 września. Próba obejmowała 60 zdjęć trzech mebli IKEA, a mediana czasu GPT-6 Astra wyniosła trzy minuty na fotografię.
Wynik GPT-6 Astra w FAB
W raporcie Epoch AI wynik GPT-6 Astra wynosi 80%. W historycznym zestawieniu benchmarku Claude Opus 4.5 uzyskał 28% w listopadzie 2025 r. — był to najwyższy wynik odnotowany w tamtym zestawieniu.
| Model | Wynik FAB | Okres benchmarku |
| GPT-6 Astra | 80% | wrzesień 2026 r. |
| Claude Opus 4.5 | 28% | listopad 2025 r. |
Mediana czasu GPT-6 Astra to trzy minuty na zdjęcie. Wynik jest więc podany razem z konkretnym pomiarem tempa: dotyczy czasu analizy pojedynczej fotografii, a nie całego zestawu.
Co sprawdza Furniture Assembly Benchmark?
FAB ocenia, czy model potrafi przeanalizować zdjęcie częściowo złożonego mebla wraz z instrukcją montażu i wskazać błędne kroki. Jeśli mebel złożono poprawnie, model powinien rozpoznać, że nie ma błędu. W teście wykorzystano szafkę na buty STÄLL, ramę łóżka TONSTAD i komodę GULLABERG.
Modele otrzymywały instrukcję, narzędzie do powiększania obrazu i interpreter Pythona w środowisku agentowym. Na każde zdjęcie przypadał limit 80 działań; osiągnięto go w mniej niż 5% przypadków. Ocenę opisów wykrytych błędów przeprowadzał GPT-5.6 Sol, skonfigurowany — jak podało Epoch AI — do łagodnego oceniania.
Zakres testu i jego ograniczenia
FAB bada analizę wizualną i rozpoznawanie błędów w meblach złożonych przez człowieka. Nie sprawdza, czy GPT-6 Astra potrafi fizycznie manipulować częściami ani samodzielnie zmontować mebel.
Epoch AI przetestowało 60 zdjęć obejmujących trzy konstrukcje i nie zmierzyło wyników ludzi w FAB. W raporcie oceniło też, że na podstawie takiego zakresu nie wiadomo, jak dobrze wyniki przekładają się na inne zadania fizyczne.