Najnowsza debata wokół GPT-5.6 nie przyniosła rozstrzygnięcia, czy model osiągnął sztuczną inteligencję ogólną (AGI). Retest GPT-5.6 Luna ujawnił niespójne odpowiedzi po niewielkiej zmianie treści polecenia, a wyniki GPT-5.6 Sol w teście ARC-AGI-3 wyraźnie zależały od użytej konfiguracji. To mocny sygnał, że płynna odpowiedź i pojedynczy wynik benchmarku nie wystarczają do oceny zdolności ogólnych.

Niewielka zmiana polecenia, inna odpowiedź

Retest GPT-5.6 Luna opublikowany 14 września obejmował trzy rodzaje zadań: test Winograda sprawdzający rozumienie odniesień zaimkowych, interpretację żartu matematycznego Willa Rogersa oraz rozumowanie na temat obróconej planszy do kółka i krzyżyka.

W jednym przykładzie testu Winograda model prawidłowo wskazał brązową walizkę jako przedmiot zbyt mały. W analogicznym zadaniu, po minimalnej zmianie sformułowania, wskazał stół, choć zamierzonym odniesieniem był samochód. Taki wynik dotyczy konkretnej serii odpowiedzi GPT-5.6 Luna; nie stanowi wskaźnika ogólnego odsetka błędów całej rodziny GPT-5.6.

To właśnie transfer rozumowania jest tu najważniejszy. Model nie dostał zupełnie nowego problemu — zmieniła się tylko część zdania, a odpowiedź przestała zachowywać właściwe odniesienie.

Żart i plansza też ujawniły wahania

W zadaniu z żartem Willa Rogersa GPT-5.6 Luna przedstawiał niespójne wyjaśnienia. Raz traktował wypowiedź jak sprzeczność matematyczną, zamiast rozpoznać porównanie średnich w Oklahomie i Kalifornii.

Podobnie było z obróconym o 90 stopni kółkiem i krzyżykiem. Model raz uznawał obrót planszy za zmianę istotną strategicznie, a innym razem opisywał go jako zmianę oznaczeń standardowej planszy 3×3, bez wpływu na strukturę gry.

Te przykłady dotyczą rozumowania w konkretnych promptach, a nie pełnego pomiaru inteligencji GPT-5.6. Pokazują jednak praktyczny problem: odpowiedź może brzmieć przekonująco, a mimo to nie przenosić poprawnie reguły na bardzo podobne zadanie.

Dlaczego wynik ARC-AGI-3 tak się zmienia?

ARC-AGI-3 sprawdza działanie agentów w nieznanych środowiskach 2D. Model musi najpierw odgadnąć zasady gry, a następnie wykonywać ruchy efektywnie. Wynik zależy więc nie tylko od samego modelu, lecz także od warunków, w których agent otrzymuje informacje i prowadzi rozumowanie.

OcenaWarunek pomiaruWynik GPT-5.6 Sol
Publiczny zbiór ARC-AGI-3Wynik wymieniony na stronie ARC Prize13,33%
Półprywatny zbiór ARC-AGI-3Wynik wymieniony na stronie ARC Prize7,78%
Publiczny zbiór ARC-AGI-3Uprząż OpenAI z zachowaniem rozumowania i kompakcją38,3%

OpenAI podało, że w jego eksperymencie zachowanie rozumowania oraz kompakcja podniosły wynik GPT-5.6 Sol z 13,3% do 38,3%. Kompakcja zastępuje bieżące obcinanie kontekstu sposobem przechowywania informacji potrzebnych przy dłuższych zadaniach. To nie są trzy wyniki uzyskane w identycznych warunkach, dlatego nie tworzą jednego prostego rankingu.

Wyniki GPT-5.6 Sol pokazują przede wszystkim, jak duże znaczenie ma uprząż testowa — zestaw ustawień i mechanizmów sterujących pracą modelu. Ta sama nazwa benchmarku nie gwarantuje identycznego pomiaru, jeśli zmieniają się konfiguracja, podział danych albo sposób prowadzenia zadania.

Co demonstracja matematyczna mówi o GPT-5.6 Sol?

Demonstracja pracy GPT-5.6 Sol Pro nad problemami matematycznymi

Wybrana demonstracja pokazuje GPT-5.6 Sol Pro pracujący nad zaawansowanymi problemami matematycznymi, między innymi analizą Riemanna–Hilberta, całkami oscylacyjnymi i reprezentacjami wyznacznikowymi. Interfejs prezentuje odpowiedzi zapisane w LaTeX-u, a prowadzący komentuje zarówno mocne strony modelu, jak i rozwlekłość oraz błędne lub zbędne fragmenty rozumowania.

To przykład specjalistycznej pracy modelu, nie uniwersalny test AGI. Zaawansowana odpowiedź w jednej dziedzinie nie zastępuje sprawdzianu stabilności przy zmiennych instrukcjach, niejasnych celach i zadaniach wymagających długiego działania.

ARC-AGI-3 nie jest pełnym testem AGI

Nie, wynik ARC-AGI-3 sam w sobie nie dowodzi, że GPT-5.6 jest AGI. Benchmark mierzy określoną klasę zadań w nieznanych grach 2D, podczas gdy często przywoływana definicja AGI zakłada zdolność dorównywania człowiekowi lub przewyższania go w niemal każdym zadaniu poznawczym. Nie istnieje jednak jeden powszechnie przyjęty próg, który rozstrzygałby tę kwestię.

François Chollet zwracał uwagę, że realne środowisko wymaga znacznie dłuższego uczenia ciągłego niż gry ARC-AGI-3 — dekad zamiast minut — a także bardziej złożonego modelowania świata, radzenia sobie z niejednoznacznymi celami i przeszukiwania większej przestrzeni możliwości.

GPT-6 Astra, o którym pojawiały się osobne doniesienia dotyczące wyników ARC-AGI-3, jest późniejszym, odrębnym produktem. Jego rezultaty nie są wynikami GPT-5.6 i nie można ich przypisywać temu modelowi.

Liczy się transfer, nie tylko liczba

Testy GPT-5.6 Sol i retest GPT-5.6 Luna prowadzą do podobnego wniosku: przy ocenie modeli trzeba sprawdzać nie tylko wynik końcowy, lecz także to, czy model zachowuje regułę po zmianie sformułowania, przenosi ją do nowego kontekstu i pozostaje użyteczny podczas dłuższego zadania.

GPT-5.6 pokazuje imponujące, ale nierówne i zależne od warunków możliwości. Na podstawie tych testów nie da się wydać ostatecznego werdyktu o AGI.