Le 25 septembre 2026, OpenAI a décrit une injection de prompt autoréplicante observée lors de tests simulés : l’instruction cherche à pousser un agent vers une action indésirable, puis à le faire recopier cette même instruction dans une sortie qu’un autre agent pourrait traiter. OpenAI précise qu’aucun impact n’a été observé en dehors des appels d’outils simulés de ses essais.
Une instruction qui cherche à se recopier
Une injection de prompt est une instruction malveillante intégrée à un contenu qu’un agent d’intelligence artificielle est amené à traiter. Dans le cas décrit par OpenAI, l’attaque poursuit deux objectifs : provoquer une action indésirable et convaincre l’agent de reproduire l’instruction sur un canal de sortie.
L’exemple principal met en scène un courriel synthétique. L’agent lit le message entrant, puis recopie l’instruction dans sa réponse. OpenAI décrit aussi des chemins passant par des fichiers ou des commentaires de code, ainsi que des attaques en plusieurs étapes, où des messages intermédiaires transmettent l’instruction avant qu’elle ne déclenche une action. Parmi les approches citées figurent de faux raisonnements détaillés et de faux messages d’outil.
OpenAI date la découverte du phénomène du 27 juin 2026. L’entreprise a divulgué ses résultats le 25 septembre, en précisant que cette publication répondait à la nouveauté de l’attaque, et non à un incident.
GPT-Red et l’évaluation Slack distincte
Pour ses essais de type GPT-Red, OpenAI décrit un modèle attaquant fondé sur GPT-5.4-mini. Dans une évaluation distincte menée dans Slack, GPT-5.5 était le modèle vulnérable; l’attaque a été découverte par GPT-5.5 exécuté dans le dispositif Codex.
Ces rôles appartiennent à des évaluations différentes : GPT-5.4-mini sert de base au modèle attaquant de type GPT-Red, tandis que GPT-5.5 apparaît comme modèle vulnérable dans l’évaluation Slack et comme modèle ayant découvert l’attaque dans le dispositif Codex.
OpenAI ajoute l’autoréplication à l’entraînement de GPT-Red
OpenAI indique intégrer l’autoréplication parmi les objectifs d’attaque de l’entraînement de GPT-Red. L’entreprise s’attend à ce que les futurs modèles mis en circulation rencontrent de telles instructions pendant leur entraînement et gagnent en robustesse face à ce type d’attaque.