Em 25 de setembro de 2026, a OpenAI divulgou um achado sobre injeções de prompt autorreplicantes: instruções maliciosas que tentam induzir um agente a realizar uma ação indesejada e a repetir a própria instrução em uma saída que outro agente possa processar. Os exemplos ocorreram em chamadas simuladas a ferramentas durante treinamento e avaliação. A OpenAI afirmou que não observou impacto fora dessas simulações e que a divulgação não foi motivada por um incidente.

Como uma instrução pode ser copiada para outra saída

Uma injeção de prompt é uma instrução inserida em conteúdo que um agente de IA pode ler, como uma mensagem ou um arquivo. Na versão autorreplicante descrita pela OpenAI, o objetivo combina duas etapas: levar o agente a uma ação adversarial e fazer com que ele reproduza a instrução em um canal de saída.

No exemplo de e-mail, um agente recebeu uma mensagem sintética com uma instrução para copiá-la na resposta. A OpenAI também descreveu caminhos por arquivos e comentários de código, além de ataques em várias etapas, nos quais a instrução passa por mensagens intermediárias antes de chegar a uma ação. Entre as abordagens citadas estão mensagens falsas de ferramenta e textos que imitam o raciocínio interno do modelo.

A OpenAI datou a descoberta de 27 de junho de 2026. A divulgação e a atualização do relatório vieram em 25 de setembro do mesmo ano.

GPT-Red e a avaliação separada no Slack

O atacante no estilo GPT-Red descrito pela OpenAI era baseado no GPT-5.4-mini. Em uma avaliação separada com várias etapas no Slack, o GPT-5.5 foi o modelo vulnerável; o ataque foi descoberto pelo GPT-5.5 executado no ambiente Codex.

Esses papéis pertencem a avaliações diferentes: o GPT-5.4-mini serviu de base para o atacante no estilo GPT-Red, enquanto o GPT-5.5 aparece na avaliação do Slack tanto como modelo vulnerável quanto no ambiente usado para descobrir o ataque.

OpenAI inclui a autorreprodução no treinamento do GPT-Red

A OpenAI afirmou que está adicionando a autorreprodução como objetivo para os atacantes treinados com o GPT-Red. A empresa espera que modelos futuros se tornem mais robustos após encontrarem esse tipo de prompt durante o treinamento.