OpenAI berichtet in einer auf den 7. Oktober 2026 datierten Systemkarte von gemischten Ergebnissen für GPT-6 Sol und GPT-6 Luna: Beide Modelle schnitten in einem mehrstufigen Jailbreak-Test besser ab als GPT-5.6 Sol, während bestimmte Sicherheitsbenchmarks signifikante Rückgänge zeigen. Die Ergebnisse betreffen unterschiedliche Tests und Vergleichsversionen – ein einzelner Gesamtwert für die Sicherheit ergibt sich daraus nicht.
Was OpenAI zum Jailbreak-Test berichtet
Bei einem mehrstufigen Jailbreak versuchen Angreifer, ein Modell über mehrere Gesprächsrunden hinweg zu einer unerwünschten Antwort zu bewegen und ihre Eingaben dabei anzupassen. OpenAI zufolge erzielten GPT-6 Sol und GPT-6 Luna bei jedem getesteten Angreiferbudget eine höhere beobachtete Erfolgsrate der Abwehr als GPT-5.6 Sol.
Im Vergleich mit den September-Versionen von GPT-6 lagen die Punktschätzungen der Oktober-Modelle etwas niedriger. Die 95-Prozent-Konfidenzintervalle überlappten sich jedoch weitgehend. Das spricht nicht für einen eindeutigen Unterschied zwischen diesen Versionen.
Der Jailbreak-Test prüfte das Modell direkt, ohne die Schutzmaßnahmen aus dem produktiven Betrieb. OpenAI zufolge ergänzen dort Klassifikatoren den Schutz. Das Ergebnis beschreibt daher die Leistung in dieser konkreten Testkonfiguration, nicht die Häufigkeit erfolgreicher Angriffe im normalen Betrieb. OpenAIs Auswertung der mehrstufigen Jailbreak-Tests
Bei welchen Sicherheitsbenchmarks die Werte sanken
Bei den Standardtests meldet OpenAI für GPT-6 Sol einen signifikanten Rückgang bei Selbstgefährdung im Vergleich zu GPT-5.6 Sol aus dem August. Für GPT-6 Luna nennt OpenAI signifikante Rückgänge bei Selbstgefährdung, Gore und sexuellen Inhalten gegenüber GPT-5.6 Luna aus dem August. Die Tabelle zeigt die zugehörigen Safe-Completion-Werte; höhere Werte bedeuten, dass der Test häufiger eine sichere Antwort erfasste.
| Testkategorie | Vergleichsmodell (August) | Wert | Modell (Oktober) | Wert |
| Selbstgefährdung | GPT-5.6 Sol | 0,934 | GPT-6 Sol | 0,896 |
| Selbstgefährdung | GPT-5.6 Luna | 0,932 | GPT-6 Luna | 0,901 |
| Gore | GPT-5.6 Luna | 0,867 | GPT-6 Luna | 0,812 |
| Sexuelle Inhalte | GPT-5.6 Luna | 0,971 | GPT-6 Luna | 0,899 |
Die Rückgänge betreffen nicht jede Kategorie und jedes Modell in gleicher Weise. Bei den Tests für unter 18-Jährige meldet OpenAI für beide GPT-6-Modelle signifikante Rückgänge bei altersbeschränkten Inhalten, sexuellen Inhalten und emotionaler Abhängigkeit. Bei Gore nennt OpenAI einen zusätzlichen signifikanten Rückgang für GPT-6 Luna.
Was die Testwerte über den Alltag aussagen
OpenAI beschreibt die verwendeten Prompts als besonders schwierig und nicht repräsentativ für den durchschnittlichen Verkehr im Produktivbetrieb. Die Benchmarkwerte sind deshalb keine Schätzungen dafür, wie oft Nutzerinnen und Nutzer im Alltag schädliche Antworten erhalten. Zudem lassen einige Tests Schutzmaßnahmen auf Systemebene außen vor.
Für Nutzerinnen und Nutzer, die OpenAI als möglicherweise unter 18 einschätzt, beschreibt das Unternehmen eine zusätzliche klassifikatorbasierte Blockierung von Antworten zu Selbstgefährdung, sexuellen Inhalten und Gore. Diese Maßnahme ist in den Rohwerten der U18-Benchmarks nicht berücksichtigt.
OpenAIs Einstufungen der Modellfähigkeiten
OpenAI stuft GPT-6 Sol und GPT-6 Luna in den Bereichen Cybersicherheit sowie Biologie und Chemie als „High“ ein. In der Cybersicherheit liegen beide unterhalb der Schwelle „Critical“; den Schwellenwert „High“ für KI-Selbstverbesserung erreicht keines der Modelle. Die Fähigkeitsbewertungen führte OpenAI mit maximalem Reasoning-Aufwand durch, während die Sicherheitsbewertungen bei den niedrigsten Reasoning-Einstellungen für den Einsatz liefen. OpenAIs Systemkarte zu GPT-6 Sol und GPT-6 Luna