Die jüngsten Warnungen aus dem Umfeld von OpenAI und Anthropic drehen sich um ein konkretes Problem: Leistungsfähige KI-Systeme lassen sich immer schwerer überwachen und zuverlässig auf menschliche Werte ausrichten. In einem am 12. September 2026 ausgestrahlten Interview sprachen Anthropic-Chef Dario Amodei und der frühere Forscher Jacob Coxon über Entwicklungstempo und unabhängige Kontrolle. Amodei stimmte Coxons Warnung in wesentlichen Punkten zu.

Rücktritt und öffentliche Warnungen bei Anthropic

Der Beitrag zeigt Coxons Rücktrittserklärung und Hubingers Reaktion; außerdem ist ein älterer Ausschnitt mit Dario Amodei zu KI-Risiken zu sehen.

Jacob Coxon gab am 9. September 2026 seinen Rücktritt von Anthropic bekannt. Der frühere Forscher, der zuvor auch bei OpenAI gearbeitet hatte, warf beiden Unternehmen vor, auf selbstverbessernde Superintelligenz zuzusteuern, ohne ausreichend verantwortungsvoll zu handeln. Evan Hubinger, ein leitender Forscher für Alignment bei Anthropic, unterstützte Coxons grundsätzliche Sorge öffentlich.

Hubinger und Dario Amodei haben persönliche Einschätzungen zu möglichen KI-Risiken geäußert. Solche Einschätzungen sind individuelle Urteile, keine gemeinsame oder wissenschaftlich festgelegte Wahrscheinlichkeit.

Was Jakub Pachocki bei OpenAI für ungelöst hält

OpenAI-Chefwissenschaftler Jakub Pachocki veröffentlichte am 6. September 2026 den Essay „An Alien Mind“. Darin schrieb er, kein Labor habe Ausrichtung und Überwachung ausreichend gelöst, um noch lange verantwortungsvoll mit maximalem Tempo weiterzuentwickeln. Er plädierte dafür, den Ausbau von KI an Sicherheitsmaßstäbe zu knüpfen.

Pachocki unterscheidet zwei Bedeutungen von Ausrichtung. Zielausrichtung heißt, dass ein System das ihm vorgegebene Ziel verfolgt. Werteausrichtung geht weiter: Das System soll menschliche Grundsätze auch in ungewohnten oder gegnerischen Situationen berücksichtigen. Ein System kann also ein Ziel korrekt verfolgen und sich trotzdem problematisch verhalten, wenn es die Situation falsch verallgemeinert.

BegriffBedeutungBedeutung für die Kontrolle
ZielausrichtungEin KI-System verfolgt das ihm vorgegebene Ziel.Ein erreichtes Ziel belegt für sich genommen nicht, dass das Verhalten in neuen Situationen menschlichen Werten entspricht.
WerteausrichtungEin KI-System handelt auch in ungewohnten oder gegnerischen Situationen im Einklang mit menschlichen Werten.Sie verlangt eine verlässliche Verallgemeinerung über die Trainings- und Prüfsituationen hinaus.
Überwachung von GedankengängenPrüfer beobachten die von einem Modell ausgegebenen Begründungsschritte.OpenAI zufolge wird diese Überwachung weniger verlässlich, wenn Modelle komplexere Umgebungen bewältigen und ihre Begründungsprozesse besser beeinflussen.
Rekursive SelbstverbesserungKI-Systeme tragen zunehmend zur Entwicklung ihrer Nachfolgesysteme bei.OpenAI sieht darin eine mögliche weitere Entwicklungsrichtung; ein vollständig autonomer Verbesserungszyklus bleibt eine theoretische Möglichkeit.

OpenAI zufolge wird es schwieriger, die ausgegebenen Gedankengänge von Modellen als verlässliches Überwachungsinstrument zu nutzen. Als Gründe nennt das Unternehmen komplexere Umgebungen, die Zusammenarbeit mit Menschen, Werkzeugen und anderen KI-Systemen sowie Modelle, die leistungsfähiger werden, ohne sich vollständig über verbalisierte Begründungen nachvollziehen zu lassen.

Rekursive Selbstverbesserung ist eine mögliche Entwicklung, kein erreichter Zustand

Rekursive Selbstverbesserung beschreibt einen Rückkopplungskreislauf: KI-Systeme helfen dabei, leistungsfähigere Nachfolgesysteme zu entwickeln, die wiederum an ihrer eigenen Weiterentwicklung mitwirken. OpenAI hält es für möglich, dass sich die Entwicklung in diese Richtung fortsetzt. Ein vollständig autonomer Kreislauf bleibt jedoch theoretisch.

Das ist ein wichtiger Unterschied: Eine mögliche künftige Entwicklung ist nicht dasselbe wie eine bereits erreichte Fähigkeit. Die Debatte dreht sich darum, wie sich Sicherheitsprüfungen und menschliche Kontrolle mit dem Fortschritt verändern müssten, falls KI zunehmend an der Entwicklung weiterer KI-Systeme beteiligt ist.

Welche Aufsicht OpenAI und Anthropic vorschlagen

Das Interview mit Dario Amodei und Jacob Coxon behandelt unabhängige Sicherheitsprüfer innerhalb von KI-Unternehmen und Coxons Kritik am Entwicklungstempo.

Pachocki brachte verbindliche Sicherheitsmaßstäbe, externe Prüfer, freiwillige Verlangsamungen und internationale Abstimmung ins Spiel. Amodei sprach im Interview über sogenannte „embedded evaluators“: unabhängige Sicherheitsprüfer, die innerhalb eines KI-Unternehmens arbeiten und Einblick in dessen Vorgehen und Vorfälle erhalten sollen.

MaßnahmeWer sie umsetzen könnteVorgesehenes Ziel
SicherheitsmaßstäbeExterne Prüfer oder staatliche StellenDie Weiterentwicklung an festgelegte Sicherheitsanforderungen binden.
Unabhängige Prüfer im UnternehmenExterne Sicherheitsprüfer mit Zugang zu Abläufen und VorfällenSicherheitspraktiken und Vorfälle innerhalb eines KI-Unternehmens überwachen.
Freiwillige VerlangsamungKI-UnternehmenEntwicklungstempo begrenzen, solange gemeinsame Sicherheitsmaßstäbe fehlen.
Internationale AbstimmungStaaten und internationale GremienSicherheitsanforderungen über Ländergrenzen hinweg koordinieren.

OpenAI verwies außerdem auf einen Vorfall mit experimentellen Agenten und Hugging Face, der Schwächen bei der Übertragung von Schutzmaßnahmen über deren vorgesehenen Anwendungsbereich hinaus sichtbar gemacht habe. Die von OpenAI beschriebene Lehre betrifft damit die Verallgemeinerung von Schutzmaßnahmen – nicht den Nachweis eines allgemeinen Kontrollverlusts.