Una tarjeta de sistema de OpenAI fechada el 7 de octubre de 2026 comunica resultados mixtos para GPT-6 Sol y GPT-6 Luna. Ambos modelos lograron una mayor tasa observada de éxito del defensor que GPT-5.6 Sol en todos los presupuestos de ataque probados, pero OpenAI también informó de retrocesos significativos en varias categorías de seguridad frente a las versiones correspondientes de GPT-5.6 de agosto.
Qué resultados comunica la tarjeta de sistema
Las evaluaciones miden aspectos distintos. Una prueba de jailbreak examina si un atacante puede inducir al modelo a eludir sus barreras; otras miden si el modelo completa de forma segura solicitudes problemáticas en categorías concretas. Un mejor resultado en la primera no borra los retrocesos registrados en las segundas.
La comparación de jailbreak y sus límites
En la evaluación de ataques de varios turnos, OpenAI observó que GPT-6 Sol y GPT-6 Luna tenían una mayor tasa de éxito del defensor que GPT-5.6 Sol en cada presupuesto de ataque probado. Ese presupuesto representa la cantidad de intentos disponibles para el atacante.
Frente a las versiones GPT-6 de septiembre, las estimaciones puntuales de octubre fueron algo menores, aunque sus intervalos de confianza del 95 % se solapaban ampliamente. La comparación con GPT-5.6 Sol y la comparación con GPT-6 de septiembre tienen, por tanto, referencias distintas.
OpenAI también comunicó una robustez del 97,13 % para GPT-6 Sol y del 95,80 % para GPT-6 Luna en la evaluación GPT-Red de inyección indirecta de prompts, con un promedio equitativo entre los niveles de razonamiento disponibles.
Las pruebas de jailbreak evaluaron directamente los modelos sin las salvaguardas de producción. OpenAI señala que los clasificadores de producción añaden otra capa de protección.
Qué pruebas de seguridad retrocedieron
En las pruebas estándar, OpenAI identificó un retroceso estadísticamente significativo de GPT-6 Sol en autolesión. Para GPT-6 Luna, señaló retrocesos significativos en autolesión, gore y contenido sexual. La tabla recoge las puntuaciones de esas comparaciones: una puntuación más alta indica un mayor índice de respuestas seguras.
| Categoría | Modelo de referencia (agosto) | Puntuación de referencia | Modelo evaluado (octubre) | Puntuación de octubre |
| Autolesión estándar | GPT-5.6 Sol (agosto) | 0.934 | GPT-6 Sol (octubre) | 0.896 |
| Autolesión estándar | GPT-5.6 Luna (agosto) | 0.932 | GPT-6 Luna (octubre) | 0.901 |
| Gore | GPT-5.6 Luna (agosto) | 0.867 | GPT-6 Luna (octubre) | 0.812 |
| Contenido sexual | GPT-5.6 Luna (agosto) | 0.971 | GPT-6 Luna (octubre) | 0.899 |
En las evaluaciones para menores de 18 años (U18), OpenAI comunicó retrocesos estadísticamente significativos de ambos modelos en contenido restringido por edad, contenido sexual y dependencia emocional. GPT-6 Luna también retrocedió en gore. La tarjeta indica que un bloqueo adicional basado en clasificadores para respuestas relacionadas con autolesión, contenido sexual y gore no está reflejado en las puntuaciones U18 sin procesar.
Qué significan las puntuaciones en el uso cotidiano
OpenAI advierte de que sus prompts de seguridad más difíciles no representan el tráfico medio de producción y que algunas pruebas omiten intervenciones a nivel de sistema. Por eso, las puntuaciones describen el comportamiento en esas evaluaciones concretas, no la frecuencia de respuestas dañinas en el uso habitual.
Clasificaciones de capacidad
OpenAI clasificó GPT-6 Sol y GPT-6 Luna con capacidad High en ciberseguridad y en los ámbitos biológico y químico. En ciberseguridad, ambos quedaron por debajo del umbral Critical; ninguno alcanzó el umbral High en automejora de IA.