OpenAI divulgó el 25 de septiembre de 2026 un hallazgo sobre inyecciones de prompt autorreplicantes observadas en llamadas simuladas de herramientas durante el entrenamiento y la evaluación. El patrón combina una instrucción que persigue una acción no deseada con otra que induce al agente a reproducirla en una salida que otro agente podría procesar. OpenAI afirmó que no observó impacto fuera de esas simulaciones y que compartió el hallazgo por su novedad, no a raíz de un incidente.
Cómo una instrucción puede copiarse en otra salida
En este tipo de ataque, la instrucción maliciosa busca dos cosas: provocar una acción adversa y lograr que el agente copie esa instrucción en un canal de salida. Si otro agente procesa después ese mensaje, la instrucción puede volver a entrar en el flujo de trabajo.
El ejemplo del correo utiliza contenido sintético: un agente lee un mensaje entrante y copia la instrucción que contiene en su respuesta. OpenAI también describe rutas a través de archivos y comentarios de código, además de ataques de varios pasos que pasan por mensajes intermedios antes de desencadenar una acción. Entre los métodos figuran instrucciones que imitan razonamientos internos del modelo o mensajes falsos de herramientas.
Qué modelos aparecen en las evaluaciones
OpenAI fechó el descubrimiento del hallazgo el 27 de junio de 2026. La compañía utilizó un atacante de estilo GPT-Red basado en GPT-5.4-mini en sus pruebas de inyección de instrucciones.
En una evaluación multi-salto separada en Slack, GPT-5.5 fue el modelo vulnerable; GPT-5.5, ejecutado en el entorno de Codex, descubrió el ataque. Son papeles distintos dentro de esa evaluación.
OpenAI incorpora la autorreproducción al entrenamiento de GPT-Red
OpenAI afirmó que está añadiendo la autorreproducción como objetivo para los atacantes entrenados con GPT-Red. También espera que futuros modelos publicados encuentren este tipo de instrucciones durante su entrenamiento y sean más robustos frente a ellas; esa mejora es una expectativa, no un resultado medido. La compañía señaló que el entrenamiento de los atacantes GPT-Red se ejecuta en sus clústeres de investigación de mayor seguridad.