Wyniki GPT-6 Astra w ARC-AGI-3 nie rozstrzygają o osiągnięciu sztucznej inteligencji ogólnej (AGI). W ewaluacji opublikowanej 3 września 2026 r. ARC Prize podała 62,7% dla Standard harness przy maksymalnym wysiłku rozumowania, 98,6% dla Provider Adapter przy maksymalnym wysiłku i 99,9% dla Provider Adapter przy wysokim wysiłku (ewaluacja ARC Prize).
NeoTeo opisywało już GPT-6 Astra i pytanie o AGI; tutaj przyglądamy się warunkom testu ARC-AGI-3.
Wyniki GPT-6 Astra w ARC-AGI-3
Wszystkie trzy wyniki dotyczą części Semi-Private benchmarku ARC-AGI-3. Różnią się harness, czyli warstwą łączącą model z testem, oraz poziomem wysiłku rozumowania.
| Warunek oceny | Wynik | Wysiłek rozumowania | Obsługa kontekstu |
| Standard harness | 62,7% | Maksymalny | Interfejs neutralny względem dostawcy |
| Provider Adapter | 98,6% | Maksymalny | Zachowuje niejawny stan rozumowania między żądaniami i kompaktuje kontekst |
| Provider Adapter | 99,9% | Wysoki | Zachowuje niejawny stan rozumowania między żądaniami i kompaktuje kontekst |
Porównanie wyniku 62,7% z 99,9% obejmuje zmianę zarówno harnessu, jak i wysiłku rozumowania: pierwszy uzyskano przy Standard i wysiłku maksymalnym, drugi przy Provider Adapter i wysiłku wysokim.
Czym różnią się oba harnessy
Standard harness zapewnia interfejs neutralny względem dostawcy, przeznaczony do porównywania modeli w podobnych warunkach. Provider Adapter korzysta z funkcji zarządzania kontekstem dostawcy: zachowuje między żądaniami niejawny stan rozumowania i stosuje kompaktowanie długiej rozmowy.
ARC-AGI-3 sprawdza, jak model uczy się i działa w nowych, abstrakcyjnych środowiskach turowych. Zadania obejmują eksplorację, budowanie modelu sytuacji, wyznaczanie celów, planowanie i wykonywanie działań. Model musi wywnioskować cele i uczyć się przez interakcję, zamiast otrzymywać wszystkie instrukcje wprost.
Co mierzy porównanie liczby działań z ludźmi
Przy Provider Adapter i maksymalnym wysiłku rozumowania GPT-6 Astra używała mniej działań niż mediana ludzkiego punktu odniesienia na 96,0% poziomów. Średnio wykonywała o 51,7% mniej działań na poziom.
Punkt odniesienia powstał na podstawie testu przeprowadzonego przez ARC Prize z udziałem około 500 osób z ogółu społeczeństwa. Dla każdego poziomu obliczono medianę liczby działań wśród uczestników, którzy go ukończyli. Wyniki opisują więc efektywność działań w ARC-AGI-3, a nie wykonanie dowolnych ludzkich zadań.
Dlaczego te testy nie dowodzą AGI
ARC Prize opisuje ARC-AGI-3 jako benchmark o ograniczonych, deterministycznych i zamkniętych środowiskach, które nie oddają złożoności świata rzeczywistego. Wysoki wynik mierzy skuteczność w ramach tego zestawu zadań; ARC Prize nie twierdzi, że GPT-6 Astra jest AGI.