Dans une fiche système datée du 7 octobre 2026, OpenAI rapporte que GPT-6 Sol et GPT-6 Luna obtiennent de meilleurs résultats que GPT-5.6 Sol face aux tentatives de jailbreak à chaque budget d’attaque testé. La même fiche signale toutefois des reculs statistiquement significatifs dans plusieurs évaluations de sécurité, avec des catégories qui varient selon le modèle.
Ce que rapporte la fiche système d’octobre
Les résultats ne dessinent pas un verdict unique sur la sécurité. Ils mêlent des progrès dans certaines évaluations et des scores en baisse dans d’autres. La fiche système d’OpenAI décrit les résultats de GPT-6 Sol et de GPT-6 Luna et les compare à des versions précises de GPT-5.6.
Les mesures présentées sont des scores de tests ciblés. Elles ne correspondent pas à la fréquence des réponses dangereuses en usage courant : OpenAI précise que ses prompts les plus difficiles ne représentent pas le trafic moyen de production et que certaines évaluations omettent des protections système.
La comparaison de jailbreak et ses limites
Dans un test de jailbreak en plusieurs échanges, le défenseur doit résister à des tentatives de contournement qui s’adaptent au fil de la conversation. OpenAI rapporte que GPT-6 Sol et GPT-6 Luna ont un taux de réussite observé supérieur à celui de GPT-5.6 Sol à chaque budget d’attaque testé. Le détail de cette évaluation distingue cette comparaison d’une autre : face aux versions GPT-6 de septembre, les estimations ponctuelles d’octobre sont légèrement inférieures, mais les intervalles de confiance à 95 % se chevauchent largement.
Ce test mesure le comportement des modèles sans les protections de production. OpenAI indique que les classificateurs utilisés en production ajoutent une couche de protection. Le résultat porte donc sur une évaluation particulière, pas sur un taux d’incident en situation courante.
Quels benchmarks de sécurité reculent
Pour les tests standard, le score de « réponse sûre » est meilleur lorsqu’il est plus élevé. OpenAI rapporte une baisse statistiquement significative de GPT-6 Sol en automutilation par rapport à GPT-5.6 Sol (août). GPT-6 Luna (octobre) recule significativement en automutilation, en contenu gore et en contenu sexuel par rapport à GPT-5.6 Luna (août).
| Catégorie évaluée | Modèle de référence (août) | Score de référence | Modèle d’octobre | Score d’octobre |
| Automutilation (test standard) | GPT-5.6 Sol | 0,934 | GPT-6 Sol | 0,896 |
| Automutilation (test standard) | GPT-5.6 Luna | 0,932 | GPT-6 Luna | 0,901 |
| Contenu gore (test standard) | GPT-5.6 Luna | 0,867 | GPT-6 Luna | 0,812 |
| Contenu sexuel (test standard) | GPT-5.6 Luna | 0,971 | GPT-6 Luna | 0,899 |
Ces résultats ne signifient pas que chaque différence entre les modèles est statistiquement significative : OpenAI identifie ces reculs pour les catégories indiquées. La fiche fait aussi état d’améliorations significatives sur presque tous ses indicateurs de factualité par rapport aux versions correspondantes de GPT-5.6 (août), à l’exception des erreurs factuelles au niveau des affirmations dans les prompts fortement axés sur la factualité.
Les évaluations U18 — destinées aux réponses concernant des utilisateurs qu’OpenAI estime susceptibles d’avoir moins de 18 ans — font apparaître un autre ensemble de reculs. Les deux modèles régressent significativement en contenu soumis à une restriction d’âge, en contenu sexuel et en dépendance émotionnelle ; GPT-6 Luna recule aussi en contenu gore. OpenAI indique qu’un blocage supplémentaire par classificateur, pour certaines réponses relevant de l’automutilation, du contenu sexuel et du contenu gore, n’est pas pris en compte dans les scores U18 bruts.
Ce que les autres scores mesurent
Sur le test GPT-Red d’injection indirecte de prompt, OpenAI rapporte un score de robustesse de 97,13 % pour GPT-6 Sol et de 95,80 % pour GPT-6 Luna, calculé en donnant le même poids aux niveaux de raisonnement disponibles. Ces valeurs sont des résultats de test ; elles ne fournissent pas de comparaison chiffrée avec GPT-5.6.
Dans une évaluation distincte de scénarios simulés à faible enjeu, menée au niveau maximal de raisonnement et sans protections système, la persistance non souhaitée après avertissement a été observée dans 28 % des déroulements de GPT-6 Sol et 15,9 % de ceux de GPT-6 Luna. Les résultats correspondants étaient de 34 % pour GPT-5.6 Sol et 27 % pour GPT-5.6 Luna. OpenAI précise que la validité de cette évaluation et sa transposition au monde réel restent des questions ouvertes.
Les classifications de capacité d’OpenAI
OpenAI classe GPT-6 Sol et GPT-6 Luna au niveau de capacité élevé en cybersécurité et dans les domaines biologique et chimique, comme leurs modèles GPT-5.6 correspondants. En cybersécurité, les deux restent sous le seuil critique ; aucun n’atteint le seuil de capacité élevée en auto-amélioration de l’IA.