Wyniki GPT-6 Astra w ARC-AGI-3 nie rozstrzygają o osiągnięciu sztucznej inteligencji ogólnej (AGI). W ewaluacji opublikowanej 3 września 2026 r. ARC Prize podała 62,7% dla Standard harness przy maksymalnym wysiłku rozumowania, 98,6% dla Provider Adapter przy maksymalnym wysiłku i 99,9% dla Provider Adapter przy wysokim wysiłku (ewaluacja ARC Prize).

NeoTeo opisywało już GPT-6 Astra i pytanie o AGI; tutaj przyglądamy się warunkom testu ARC-AGI-3.

Wyniki GPT-6 Astra w ARC-AGI-3

Wszystkie trzy wyniki dotyczą części Semi-Private benchmarku ARC-AGI-3. Różnią się harness, czyli warstwą łączącą model z testem, oraz poziomem wysiłku rozumowania.

Warunek ocenyWynikWysiłek rozumowaniaObsługa kontekstu
Standard harness62,7%MaksymalnyInterfejs neutralny względem dostawcy
Provider Adapter98,6%MaksymalnyZachowuje niejawny stan rozumowania między żądaniami i kompaktuje kontekst
Provider Adapter99,9%WysokiZachowuje niejawny stan rozumowania między żądaniami i kompaktuje kontekst

Porównanie wyniku 62,7% z 99,9% obejmuje zmianę zarówno harnessu, jak i wysiłku rozumowania: pierwszy uzyskano przy Standard i wysiłku maksymalnym, drugi przy Provider Adapter i wysiłku wysokim.

Czym różnią się oba harnessy

Standard harness zapewnia interfejs neutralny względem dostawcy, przeznaczony do porównywania modeli w podobnych warunkach. Provider Adapter korzysta z funkcji zarządzania kontekstem dostawcy: zachowuje między żądaniami niejawny stan rozumowania i stosuje kompaktowanie długiej rozmowy.

ARC-AGI-3 sprawdza, jak model uczy się i działa w nowych, abstrakcyjnych środowiskach turowych. Zadania obejmują eksplorację, budowanie modelu sytuacji, wyznaczanie celów, planowanie i wykonywanie działań. Model musi wywnioskować cele i uczyć się przez interakcję, zamiast otrzymywać wszystkie instrukcje wprost.

Co mierzy porównanie liczby działań z ludźmi

Przy Provider Adapter i maksymalnym wysiłku rozumowania GPT-6 Astra używała mniej działań niż mediana ludzkiego punktu odniesienia na 96,0% poziomów. Średnio wykonywała o 51,7% mniej działań na poziom.

Punkt odniesienia powstał na podstawie testu przeprowadzonego przez ARC Prize z udziałem około 500 osób z ogółu społeczeństwa. Dla każdego poziomu obliczono medianę liczby działań wśród uczestników, którzy go ukończyli. Wyniki opisują więc efektywność działań w ARC-AGI-3, a nie wykonanie dowolnych ludzkich zadań.

Dlaczego te testy nie dowodzą AGI

ARC Prize opisuje ARC-AGI-3 jako benchmark o ograniczonych, deterministycznych i zamkniętych środowiskach, które nie oddają złożoności świata rzeczywistego. Wysoki wynik mierzy skuteczność w ramach tego zestawu zadań; ARC Prize nie twierdzi, że GPT-6 Astra jest AGI.