Il 25 settembre 2026 OpenAI ha descritto prompt injection autoreplicanti osservate in chiamate simulate agli strumenti durante attività di addestramento e valutazione. La tecnica combina l’obiettivo di indurre un agente a compiere un’azione indesiderata con quello di fargli riprodurre l’istruzione in un’uscita che un altro agente potrebbe elaborare.
OpenAI ha riferito di non aver osservato impatti al di fuori delle chiamate simulate descritte. La data di scoperta indicata dall’azienda è il 27 giugno 2026, distinta da quella della divulgazione e dell’aggiornamento del rapporto.
Come un’istruzione può ricomparire in un’altra risposta
Una prompt injection è un’istruzione inserita in contenuti che un agente di IA deve elaborare. Nella forma autoreplicante descritta da OpenAI, l’attacco cerca anche di far copiare quell’istruzione su un canale di uscita, per esempio in una risposta, dove un altro agente potrebbe incontrarla in seguito.
Nell’esempio principale, un’email sintetica conteneva un’istruzione che spingeva l’agente a copiarla nella risposta. OpenAI ha descritto anche attacchi che passavano attraverso file o commenti al codice, oltre a percorsi multi-hop: l’istruzione attraversa messaggi intermedi prima di portare all’azione. Tra gli approcci figuravano false catene di ragionamento e falsi messaggi degli strumenti.
GPT-Red e la valutazione Slack separata
Nell’approccio di tipo GPT-Red, il modello attaccante era basato su GPT-5.4-mini. In una distinta valutazione multi-hop su Slack, OpenAI ha indicato GPT-5.5 come modello vulnerabile e GPT-5.5 nel Codex harness come il modello che ha individuato l’attacco.
I due casi riguardano valutazioni diverse: GPT-5.4-mini era la base dell’attaccante di tipo GPT-Red; GPT-5.5 compare invece con ruoli distinti nella prova Slack.
OpenAI aggiunge l’autoreplicazione all’addestramento di GPT-Red
OpenAI ha detto che sta aggiungendo l’autoreplicazione tra gli obiettivi dei modelli attaccanti nell’addestramento di GPT-Red. L’azienda si aspetta che i modelli rilasciati in futuro siano più robusti dopo l’addestramento su prompt autoriproducenti.