Em um system card datado de 7 de outubro de 2026, a OpenAI relata resultados mistos para GPT-6 Sol e GPT-6 Luna: os dois modelos tiveram maior sucesso observado do defensor contra ataques de jailbreak do que o GPT-5.6 Sol, mas apresentaram regressões em categorias específicas de segurança em comparação com as versões correspondentes do GPT-5.6 de agosto.

O que o system card de outubro relata

A avaliação não aponta uma melhora uniforme. A OpenAI relata avanço no teste de jailbreak multiturno, mas também quedas estatisticamente significativas em alguns benchmarks de conteúdo prejudicial. Os resultados variam conforme o modelo e a categoria avaliada.

A OpenAI também relata melhora significativa em quase todas as métricas de factualidade em comparação com as versões correspondentes do GPT-5.6 de agosto. A exceção foram os erros em afirmações dentro de prompts com forte foco em factualidade.

A comparação de jailbreak e seus limites

Nos testes multiturno, que permitem ao atacante adaptar suas tentativas ao longo da conversa, GPT-6 Sol e GPT-6 Luna tiveram taxas observadas de sucesso do defensor superiores às do GPT-5.6 Sol em todos os orçamentos de ataque avaliados. Em comparação com as versões GPT-6 de setembro, porém, as estimativas pontuais dos modelos de outubro foram um pouco menores; os intervalos de confiança de 95% se sobrepõem amplamente.

A avaliação de jailbreak multiturno da OpenAI testou os modelos diretamente, sem as proteções de produção. A OpenAI afirma que classificadores usados em produção acrescentam outra camada de proteção.

Quais benchmarks de segurança regrediram

Nos benchmarks padrão, a OpenAI identifica uma regressão estatisticamente significativa do GPT-6 Sol em autolesão. Para o GPT-6 Luna, a regressão foi significativa em autolesão, conteúdo gráfico e conteúdo sexual. A tabela mostra as pontuações comparáveis das versões de agosto e outubro; valores maiores indicam mais conclusões seguras.

Categoria avaliadaModelo de referência (agosto)PontuaçãoModelo (outubro)Pontuação
AutolesãoGPT-5.6 Sol (agosto)0,934GPT-6 Sol (outubro)0,896
AutolesãoGPT-5.6 Luna (agosto)0,932GPT-6 Luna (outubro)0,901
Conteúdo gráficoGPT-5.6 Luna (agosto)0,867GPT-6 Luna (outubro)0,812
Conteúdo sexualGPT-5.6 Luna (agosto)0,971GPT-6 Luna (outubro)0,899

Nas avaliações voltadas a menores de 18 anos, a OpenAI relata regressões significativas nos dois modelos em conteúdo com restrição etária, conteúdo sexual e dependência emocional. O GPT-6 Luna também regrediu em conteúdo gráfico. Essas comparações usam as respectivas versões do GPT-5.6 de agosto como referência.

O que as pontuações dizem sobre o uso cotidiano

A OpenAI afirma que os prompts difíceis dessas avaliações não representam o tráfego médio de produção e que algumas provas deixam de fora proteções em nível de sistema. Portanto, as pontuações descrevem o desempenho nos testes, não a frequência de respostas prejudiciais no uso cotidiano.

Nas avaliações U18, as pontuações brutas também não incluem um bloqueio adicional baseado em classificador para algumas respostas envolvendo autolesão, conteúdo sexual e conteúdo gráfico. A OpenAI descreve essa proteção para usuários que acredita terem menos de 18 anos.

As classificações de capacidade da OpenAI

A OpenAI classifica GPT-6 Sol e GPT-6 Luna como de capacidade alta em cibersegurança e nos domínios biológico e químico. Os dois ficam abaixo do patamar crítico em cibersegurança e nenhum alcança o patamar alto em autoaperfeiçoamento de IA.