W karcie systemowej datowanej na 7 października 2026 r. OpenAI opisało mieszane wyniki testów GPT-6 Sol i GPT-6 Luna: oba modele lepiej niż GPT-5.6 Sol radziły sobie w testach jailbreaków prowadzonych w wielu turach, ale w wybranych testach bezpieczeństwa uzyskały istotnie gorsze wyniki od odpowiadających im modeli GPT-5.6 z sierpnia. To wyniki poszczególnych ewaluacji, a nie jeden prosty werdykt o bezpieczeństwie modeli.

Co podaje październikowa karta systemowa OpenAI

Karta systemowa OpenAI opisuje wyniki październikowych wersji GPT-6 Sol i GPT-6 Luna w kilku odrębnych obszarach: odporności na jailbreaki, testach bezpiecznego udzielania odpowiedzi, ewaluacjach dla osób poniżej 18 lat oraz klasyfikacjach zdolności. OpenAI opublikowało kartę systemową, a osobna ewaluacja jailbreaków w wielu turach przedstawia wyniki zależnie od budżetu atakującego.

Poprawa w jednym z tych testów nie przesądza o wynikach pozostałych. W szczególności odporność na jailbreaki i bezpieczne odpowiedzi na szkodliwe treści to różne miary.

Porównanie jailbreaków i jego ograniczenia

OpenAI podaje, że GPT-6 Sol i GPT-6 Luna osiągnęły wyższy zaobserwowany odsetek udanych obron niż GPT-5.6 Sol przy każdym testowanym budżecie atakującego. W zestawieniu z wrześniowymi wersjami GPT-6 estymaty punktowe obu październikowych modeli były nieco niższe, ale 95-procentowe przedziały ufności w dużej mierze się pokrywały.

W tej ewaluacji modele mierzone były bez zabezpieczeń stosowanych w środowisku produkcyjnym. OpenAI podaje, że produkcyjne klasyfikatory stanowią dodatkową warstwę ochrony. Wynik testu jailbreaków nie jest więc miarą częstości szkodliwych odpowiedzi w codziennym użyciu.

Które testy bezpieczeństwa wykazały regresję

W standardowych testach bezpiecznego udzielania odpowiedzi wyższy wynik oznacza lepszy rezultat. OpenAI wskazuje istotną statystycznie regresję GPT-6 Sol w kategorii samookaleczeń. W przypadku GPT-6 Luna istotne regresje dotyczą samookaleczeń, drastycznych treści i treści seksualnych.

Kategoria testuModel bazowy (sierpień)Wynik bazowyModel październikowyWynik październikowy
SamookaleczeniaGPT-5.6 Sol0,934GPT-6 Sol0,896
SamookaleczeniaGPT-5.6 Luna0,932GPT-6 Luna0,901
Drastyczne treściGPT-5.6 Luna0,867GPT-6 Luna0,812
Treści seksualneGPT-5.6 Luna0,971GPT-6 Luna0,899

W testach U18 OpenAI odnotowało istotne statystycznie regresje obu modeli w kategoriach treści z ograniczeniem wiekowym, treści seksualnych i zależności emocjonalnej. GPT-6 Luna uzyskała także istotnie gorszy wynik w kategorii drastycznych treści. Pozostałe różnice w tych testach nie były istotne statystycznie.

Kategoria testu U18GPT-5.6 Sol (sierpień)GPT-6 Sol (październik)GPT-5.6 Luna (sierpień)GPT-6 Luna (październik)
Treści z ograniczeniem wiekowym, niebezpieczne wyzwania i aktywności0,8650,7990,8570,814
Treści seksualne0,9710,9330,9840,904
Zależność emocjonalna0,9210,7700,9270,734
Samookaleczenia0,9870,9770,9770,974
Drastyczne treści0,8720,8450,8670,812

W tabeli U18 wyższy wynik oznacza lepszy rezultat. Dla osób, które OpenAI uznaje za młodsze niż 18 lat, karta opisuje dodatkową blokadę opartą na klasyfikatorze dla odpowiedzi dotyczących samookaleczeń, treści seksualnych i drastycznych. Ta warstwa nie jest ujęta w surowych wynikach testów U18.

Co wyniki mówią o codziennym użyciu

OpenAI zaznacza, że trudne, adversarialne prompty używane w wielu testach nie są reprezentatywne dla przeciętnego ruchu produkcyjnego. Część ewaluacji pomija też zabezpieczenia systemowe. Wyniki opisują zachowanie modeli w określonych warunkach testowych; nie podają częstości szkodliwych odpowiedzi w zwykłych rozmowach.

Klasyfikacje zdolności według OpenAI

OpenAI sklasyfikowało oba modele jako High pod względem zdolności w cyberbezpieczeństwie oraz w dziedzinach biologii i chemii. W cyberbezpieczeństwie nie osiągnęły progu Critical, a w zakresie samodoskonalenia AI nie osiągnęły progu High. OpenAI podało również, że wdrożono odpowiednie zabezpieczenia dla zdolności sklasyfikowanych jako High.