W karcie systemowej datowanej na 7 października 2026 r. OpenAI opisało mieszane wyniki testów GPT-6 Sol i GPT-6 Luna: oba modele lepiej niż GPT-5.6 Sol radziły sobie w testach jailbreaków prowadzonych w wielu turach, ale w wybranych testach bezpieczeństwa uzyskały istotnie gorsze wyniki od odpowiadających im modeli GPT-5.6 z sierpnia. To wyniki poszczególnych ewaluacji, a nie jeden prosty werdykt o bezpieczeństwie modeli.
Co podaje październikowa karta systemowa OpenAI
Karta systemowa OpenAI opisuje wyniki październikowych wersji GPT-6 Sol i GPT-6 Luna w kilku odrębnych obszarach: odporności na jailbreaki, testach bezpiecznego udzielania odpowiedzi, ewaluacjach dla osób poniżej 18 lat oraz klasyfikacjach zdolności. OpenAI opublikowało kartę systemową, a osobna ewaluacja jailbreaków w wielu turach przedstawia wyniki zależnie od budżetu atakującego.
Poprawa w jednym z tych testów nie przesądza o wynikach pozostałych. W szczególności odporność na jailbreaki i bezpieczne odpowiedzi na szkodliwe treści to różne miary.
Porównanie jailbreaków i jego ograniczenia
OpenAI podaje, że GPT-6 Sol i GPT-6 Luna osiągnęły wyższy zaobserwowany odsetek udanych obron niż GPT-5.6 Sol przy każdym testowanym budżecie atakującego. W zestawieniu z wrześniowymi wersjami GPT-6 estymaty punktowe obu październikowych modeli były nieco niższe, ale 95-procentowe przedziały ufności w dużej mierze się pokrywały.
W tej ewaluacji modele mierzone były bez zabezpieczeń stosowanych w środowisku produkcyjnym. OpenAI podaje, że produkcyjne klasyfikatory stanowią dodatkową warstwę ochrony. Wynik testu jailbreaków nie jest więc miarą częstości szkodliwych odpowiedzi w codziennym użyciu.
Które testy bezpieczeństwa wykazały regresję
W standardowych testach bezpiecznego udzielania odpowiedzi wyższy wynik oznacza lepszy rezultat. OpenAI wskazuje istotną statystycznie regresję GPT-6 Sol w kategorii samookaleczeń. W przypadku GPT-6 Luna istotne regresje dotyczą samookaleczeń, drastycznych treści i treści seksualnych.
| Kategoria testu | Model bazowy (sierpień) | Wynik bazowy | Model październikowy | Wynik październikowy |
| Samookaleczenia | GPT-5.6 Sol | 0,934 | GPT-6 Sol | 0,896 |
| Samookaleczenia | GPT-5.6 Luna | 0,932 | GPT-6 Luna | 0,901 |
| Drastyczne treści | GPT-5.6 Luna | 0,867 | GPT-6 Luna | 0,812 |
| Treści seksualne | GPT-5.6 Luna | 0,971 | GPT-6 Luna | 0,899 |
W testach U18 OpenAI odnotowało istotne statystycznie regresje obu modeli w kategoriach treści z ograniczeniem wiekowym, treści seksualnych i zależności emocjonalnej. GPT-6 Luna uzyskała także istotnie gorszy wynik w kategorii drastycznych treści. Pozostałe różnice w tych testach nie były istotne statystycznie.
| Kategoria testu U18 | GPT-5.6 Sol (sierpień) | GPT-6 Sol (październik) | GPT-5.6 Luna (sierpień) | GPT-6 Luna (październik) |
| Treści z ograniczeniem wiekowym, niebezpieczne wyzwania i aktywności | 0,865 | 0,799 | 0,857 | 0,814 |
| Treści seksualne | 0,971 | 0,933 | 0,984 | 0,904 |
| Zależność emocjonalna | 0,921 | 0,770 | 0,927 | 0,734 |
| Samookaleczenia | 0,987 | 0,977 | 0,977 | 0,974 |
| Drastyczne treści | 0,872 | 0,845 | 0,867 | 0,812 |
W tabeli U18 wyższy wynik oznacza lepszy rezultat. Dla osób, które OpenAI uznaje za młodsze niż 18 lat, karta opisuje dodatkową blokadę opartą na klasyfikatorze dla odpowiedzi dotyczących samookaleczeń, treści seksualnych i drastycznych. Ta warstwa nie jest ujęta w surowych wynikach testów U18.
Co wyniki mówią o codziennym użyciu
OpenAI zaznacza, że trudne, adversarialne prompty używane w wielu testach nie są reprezentatywne dla przeciętnego ruchu produkcyjnego. Część ewaluacji pomija też zabezpieczenia systemowe. Wyniki opisują zachowanie modeli w określonych warunkach testowych; nie podają częstości szkodliwych odpowiedzi w zwykłych rozmowach.
Klasyfikacje zdolności według OpenAI
OpenAI sklasyfikowało oba modele jako High pod względem zdolności w cyberbezpieczeństwie oraz w dziedzinach biologii i chemii. W cyberbezpieczeństwie nie osiągnęły progu Critical, a w zakresie samodoskonalenia AI nie osiągnęły progu High. OpenAI podało również, że wdrożono odpowiednie zabezpieczenia dla zdolności sklasyfikowanych jako High.