Am 25. September 2026 veröffentlichte OpenAI einen Befund zu selbstreplizierenden Prompt-Injections aus simulierten Trainings- und Evaluierungstests. Die Angriffe sollten einen Agenten zu einer unerwünschten Handlung bewegen und ihn zugleich dazu bringen, die eingeschleuste Anweisung in einer Ausgabe zu wiederholen, die ein weiterer Agent verarbeiten könnte. Außerhalb simulierter Tool-Aufrufe beobachtete OpenAI keine Auswirkungen; die Veröffentlichung erfolgte nach Unternehmensangaben wegen der Neuartigkeit des Verhaltens, nicht wegen eines Vorfalls.

OpenAI datiert die Entdeckung auf den 27. Juni 2026.

Was eine selbstreplizierende Prompt-Injection ausmacht

Bei einer Prompt-Injection versucht eine eingeschleuste Anweisung, das Verhalten eines KI-Modells zu beeinflussen. Bei der von OpenAI beschriebenen Variante kommt ein zweites Ziel hinzu: Der Agent soll die Anweisung in einer Ausgabe wiederholen, die später bei einem anderen Agenten ankommen kann.

In einem synthetischen E-Mail-Beispiel las ein Agent eine eingehende Nachricht und übernahm deren Anweisung in seine Antwort. OpenAI beschreibt außerdem simulierte Angriffe über Dateien und Code-Kommentare sowie mehrstufige Nachrichtenwege, bei denen eine Anweisung über Zwischenmeldungen weitergegeben wird, bevor sie eine Handlung auslöst. Zu den beschriebenen Ansätzen gehörten auch vorgetäuschte Gedankengänge und fingierte Werkzeugmeldungen.

GPT-Red und die separate Slack-Auswertung

Für einen Angreifer nach dem GPT-Red-Muster verwendete OpenAI ein Modell auf Basis von GPT-5.4-mini. In einer davon getrennten Slack-Auswertung war GPT-5.5 das anfällige Modell. Den Angriff entdeckte GPT-5.5, ausgeführt im Codex-Harness.

OpenAI ergänzt ein Ziel für das GPT-Red-Training

OpenAI nimmt Selbstreproduktion als zusätzliches Angreiferziel in das GPT-Red-Training auf. Das Unternehmen erwartet, dass künftige veröffentlichte Modelle solchen Prompts im Training begegnen.