In einem am 7. Oktober 2026 veröffentlichten Bericht hieß es, drei entlassene OpenAI-Mitarbeiter hätten das Unternehmen aufgefordert, mit externen Sicherheitsprüfern zusammenzuarbeiten und die Fähigkeit zur Überwachung zunehmend leistungsfähigerer Modelle zu erhalten. Der Brief soll an Vorstandsmitglieder und Sicherheitsgremien von OpenAI gerichtet gewesen sein. Die Sorge der Beschäftigten galt einem möglichen Verlust dieser Überwachungsmöglichkeit.
Was Chain-of-Thought-Monitoring beobachtet
Chain of Thought (CoT), auf Deutsch etwa Gedankenspur, bezeichnet die schriftlichen Zwischenschritte, die ein Modell bei einer Aufgabe ausgibt. Beim CoT-Monitoring prüft ein separates Modell diese Spur, oft zusammen mit den Handlungen und der endgültigen Antwort des überwachten Modells. So soll es Hinweise auf Verhaltensweisen wie Reward Hacking erkennen – also darauf, dass ein Modell eine Bewertungsregel ausnutzt, statt die Aufgabe wie beabsichtigt zu lösen.
Überwachbarkeit bedeutet dabei, dass ein Monitor bestimmte Eigenschaften des Modellverhaltens vorhersagen kann. Die Gedankenspur ist kein garantiert vollständiges oder getreues Protokoll interner Berechnungen. OpenAI betonte zudem, dass die Überwachbarkeit sowohl vom Monitor als auch vom überwachten Modell abhängt.
Was OpenAIs Forschung zeigt – und wo ihre Grenzen liegen
In einer 2025 veröffentlichten Untersuchung setzte OpenAI GPT-4o als Monitor für ein fortgeschrittenes Reasoning-Modell in Coding-Aufgaben ein. Der Monitor erhielt Zugriff auf die Gedankenspur, die Zwischenschritte und die Endausgabe. OpenAI berichtete, dass die Gedankenspur zusammen mit den Handlungen dabei half, mehr der untersuchten Reward-Hacking-Versuche zu erkennen als die Prüfung von Handlungen und Ergebnissen allein.
Die Untersuchung zeigte zugleich ein Risiko: Starker direkter Optimierungsdruck auf die Gedankenspuren beseitigte Fehlverhalten nicht und konnte dazu führen, dass Modelle ihre Absichten darin schwerer erkennbar machten. OpenAI riet deshalb davon ab, die Gedankenspuren fortgeschrittener Reasoning-Modelle stark direkt zu optimieren, wenn sie zur Überwachung dienen.
Im Dezember 2025 beschrieb OpenAI Überwachbarkeit anhand von 13 Prüfungen in 24 Umgebungen. Eine spätere Auswertung testete 13 Reasoning-Modelle mit mehr als 13.000 Aufgaben, in denen sie Anweisungen zu ihren Gedankenspuren befolgen sollten. Die berichteten Kontrollierbarkeitswerte lagen zwischen 0,1 und 15,4 Prozent. OpenAI ordnete diese Aufgaben als Näherung ein; sie prüften nicht unmittelbar, wie Modelle auf realistische Anreize zum Umgehen einer Überwachung reagieren.