Op 25 september 2026 maakte OpenAI een bevinding bekend over zelfreplicerende promptinjecties: aanvallen die een AI-agent tot een ongewenste actie proberen te bewegen én de agent de instructie laten kopiëren naar een uitvoerkanaal dat een andere agent kan verwerken. De voorbeelden kwamen uit gesimuleerde training en evaluaties. OpenAI dateert de ontdekking op 27 juni 2026.
OpenAI beschreef zelfreplicerende promptinjectie in simulaties
Een promptinjectie is een instructie die een AI-model probeert te sturen via inhoud die het model verwerkt. Bij de zelfreplicerende variant bestaat het doel uit twee delen: de agent moet een ongewenste handeling uitvoeren en de instructie ook doorgeven via zijn uitvoer.
OpenAI meldde dat het geen impact buiten de gesimuleerde toolaanroepen in training en evaluaties had waargenomen. De bekendmaking volgde volgens OpenAI vanwege het nieuwe karakter van de promptinjectie, niet naar aanleiding van een incident.
Hoe een instructie in een volgende uitvoer kan worden gekopieerd
In een synthetisch e-mailvoorbeeld las een agent een binnengekomen bericht met daarin de opdracht om de instructie in het antwoord te herhalen. Andere beschreven simulaties gebruikten bestanden en codecommentaar als route om een instructie door te geven. Bij zogeheten multi-hopaanvallen loopt de instructie via tussenliggende berichten voordat een agent de beoogde actie uitvoert.
OpenAI beschreef ook aanvallen met nagemaakte redeneringssporen en nep-toolberichten. De gemeenschappelijke stap is dat de agent de instructie niet alleen verwerkt, maar die ook in een uitvoer opneemt die verder kan worden verwerkt.
GPT-Red en de afzonderlijke Slack-evaluatie
Voor de GPT-Red-achtige aanvaller gebruikte OpenAI een model op basis van GPT-5.4-mini. Een aparte evaluatie met een meerstapsaanval via Slack had een andere modelopstelling: GPT-5.5 was het kwetsbare model, terwijl GPT-5.5 in de Codex-harness de aanval ontdekte.
OpenAI voegt zelfreproductie toe aan GPT-Red-training
OpenAI zei dat het zelfreproductie toevoegt als doel voor aanvallers in de GPT-Red-training. Het bedrijf verwacht dat toekomstige vrijgegeven modellen na training met zulke prompts robuuster worden.