Em um system card datado de 7 de outubro de 2026, a OpenAI relata resultados mistos para GPT-6 Sol e GPT-6 Luna: os dois modelos tiveram maior sucesso observado do defensor contra ataques de jailbreak do que o GPT-5.6 Sol, mas apresentaram regressões em categorias específicas de segurança em comparação com as versões correspondentes do GPT-5.6 de agosto.
O que o system card de outubro relata
A avaliação não aponta uma melhora uniforme. A OpenAI relata avanço no teste de jailbreak multiturno, mas também quedas estatisticamente significativas em alguns benchmarks de conteúdo prejudicial. Os resultados variam conforme o modelo e a categoria avaliada.
A OpenAI também relata melhora significativa em quase todas as métricas de factualidade em comparação com as versões correspondentes do GPT-5.6 de agosto. A exceção foram os erros em afirmações dentro de prompts com forte foco em factualidade.
A comparação de jailbreak e seus limites
Nos testes multiturno, que permitem ao atacante adaptar suas tentativas ao longo da conversa, GPT-6 Sol e GPT-6 Luna tiveram taxas observadas de sucesso do defensor superiores às do GPT-5.6 Sol em todos os orçamentos de ataque avaliados. Em comparação com as versões GPT-6 de setembro, porém, as estimativas pontuais dos modelos de outubro foram um pouco menores; os intervalos de confiança de 95% se sobrepõem amplamente.
A avaliação de jailbreak multiturno da OpenAI testou os modelos diretamente, sem as proteções de produção. A OpenAI afirma que classificadores usados em produção acrescentam outra camada de proteção.
Quais benchmarks de segurança regrediram
Nos benchmarks padrão, a OpenAI identifica uma regressão estatisticamente significativa do GPT-6 Sol em autolesão. Para o GPT-6 Luna, a regressão foi significativa em autolesão, conteúdo gráfico e conteúdo sexual. A tabela mostra as pontuações comparáveis das versões de agosto e outubro; valores maiores indicam mais conclusões seguras.
| Categoria avaliada | Modelo de referência (agosto) | Pontuação | Modelo (outubro) | Pontuação |
| Autolesão | GPT-5.6 Sol (agosto) | 0,934 | GPT-6 Sol (outubro) | 0,896 |
| Autolesão | GPT-5.6 Luna (agosto) | 0,932 | GPT-6 Luna (outubro) | 0,901 |
| Conteúdo gráfico | GPT-5.6 Luna (agosto) | 0,867 | GPT-6 Luna (outubro) | 0,812 |
| Conteúdo sexual | GPT-5.6 Luna (agosto) | 0,971 | GPT-6 Luna (outubro) | 0,899 |
Nas avaliações voltadas a menores de 18 anos, a OpenAI relata regressões significativas nos dois modelos em conteúdo com restrição etária, conteúdo sexual e dependência emocional. O GPT-6 Luna também regrediu em conteúdo gráfico. Essas comparações usam as respectivas versões do GPT-5.6 de agosto como referência.
O que as pontuações dizem sobre o uso cotidiano
A OpenAI afirma que os prompts difíceis dessas avaliações não representam o tráfego médio de produção e que algumas provas deixam de fora proteções em nível de sistema. Portanto, as pontuações descrevem o desempenho nos testes, não a frequência de respostas prejudiciais no uso cotidiano.
Nas avaliações U18, as pontuações brutas também não incluem um bloqueio adicional baseado em classificador para algumas respostas envolvendo autolesão, conteúdo sexual e conteúdo gráfico. A OpenAI descreve essa proteção para usuários que acredita terem menos de 18 anos.
As classificações de capacidade da OpenAI
A OpenAI classifica GPT-6 Sol e GPT-6 Luna como de capacidade alta em cibersegurança e nos domínios biológico e químico. Os dois ficam abaixo do patamar crítico em cibersegurança e nenhum alcança o patamar alto em autoaperfeiçoamento de IA.