In een systeembeschrijving met datum 7 oktober 2026 meldt OpenAI gemengde uitkomsten voor GPT-6 Sol en GPT-6 Luna. Beide modellen hadden bij elk getest aanvalbudget voor meerturn-jailbreaks een hoger geobserveerd verdedigingssucces dan GPT-5.6 Sol. Tegelijkertijd rapporteert OpenAI significante terugval in specifieke standaard- en U18-veiligheidscategorieën.
Wat de jailbreaktest laat zien
Een meerturn-jailbreaktest laat een aanvaller over meerdere gespreksrondes prompts uitproberen en aanpassen. OpenAI rapporteert dat GPT-6 Sol en GPT-6 Luna bij elk getest aanvalbudget een hoger geobserveerd verdedigingssucces hadden dan GPT-5.6 Sol.
De vergelijking met GPT-6-versies uit september is een andere: de puntschattingen van de oktober-modellen lagen iets lager. De 95%-betrouwbaarheidsintervallen overlapten grotendeels. Dat maakt die uitkomst niet hetzelfde als een vastgestelde daling.
De jailbreaktest beoordeelde de modellen zonder de beschermingslagen die tijdens normaal gebruik worden ingezet. OpenAI zegt dat productieclassifiers een extra beschermingslaag vormen.
Welke veiligheidstests terugliepen
OpenAI meldt voor GPT-6 Sol een statistisch significante terugval op de standaardtest voor zelfbeschadiging. Voor GPT-6 Luna rapporteert OpenAI significante terugval bij zelfbeschadiging, gore en seksuele inhoud. De onderstaande scores vergelijken elk model met de overeenkomstige GPT-5.6-versie uit augustus. Bij deze safe-completion-scores geldt: hoger is beter.
| Testcategorie | Basismodel (augustus) | Score | GPT-6-model (oktober) | Score |
| Standaardtest voor zelfbeschadiging | GPT-5.6 Sol (August) | 0,934 | GPT-6 Sol (October) | 0,896 |
| Standaardtest voor zelfbeschadiging | GPT-5.6 Luna (August) | 0,932 | GPT-6 Luna (October) | 0,901 |
| Gore | GPT-5.6 Luna (August) | 0,867 | GPT-6 Luna (October) | 0,812 |
| Seksuele inhoud | GPT-5.6 Luna (August) | 0,971 | GPT-6 Luna (October) | 0,899 |
Ook in OpenAI’s evaluaties voor gebruikers onder de 18 jaar waren er significante terugvallen. Beide modellen scoorden lager op leeftijdsgebonden inhoud, seksuele inhoud en emotionele afhankelijkheid; voor GPT-6 Luna gold dat ook voor gore. Bij de test voor emotionele afhankelijkheid daalde de score van GPT-5.6 Sol naar GPT-6 Sol van 0,921 naar 0,770. Voor Luna liep die terug van 0,927 naar 0,734. Deze vergelijkingen gebruiken de overeenkomstige GPT-5.6-modellen uit augustus.
Voor veiligheidsbeoordelingen gebruikte OpenAI de laagste redeneerinstellingen voor inzet, bedoeld om het merendeel van het gebruik te vertegenwoordigen. De uitdagende testprompts zijn volgens OpenAI niet representatief voor gemiddeld productiegebruik. De scores geven dus niet aan hoe vaak schadelijke reacties in dagelijks gebruik voorkomen.
Voor gebruikers die OpenAI als mogelijk jonger dan 18 jaar inschat, beschrijft het bedrijf een aanvullende classifierblokkade voor reacties over zelfbeschadiging, seksuele inhoud en gore. Die blokkade zit niet in de ruwe U18-scores.
Andere gemelde resultaten
In de GPT-Red-evaluatie voor indirecte promptinjectie rapporteert OpenAI een robuustheidsscore van 97,13% voor GPT-6 Sol en 95,80% voor GPT-6 Luna. Die scores zijn gelijk gewogen over de beschikbare redeneerniveaus.
OpenAI meldt ook significante verbeteringen tegenover de overeenkomstige GPT-5.6-modellen uit augustus op vrijwel alle evaluatiemaatstaven voor feitelijkheid. De uitzondering was het aantal fouten op claimniveau bij prompts die sterk op feitelijkheid waren gericht. In dynamische meerturn-evaluaties voor mentale gezondheid, emotionele afhankelijkheid en zelfbeschadiging waren de verschillen met die GPT-5.6-modellen niet statistisch significant.
Capaciteitsclassificaties
OpenAI classificeert GPT-6 Sol en GPT-6 Luna als High in cybersecurity en in biologische en chemische domeinen. Beide blijven onder de Critical-drempel voor cybersecurity en halen de High-drempel voor AI-zelfverbetering niet. OpenAI meldt dat de bijbehorende waarborgen voor cybersecurity en biologische en chemische capaciteiten zijn ingevoerd.