In einem am 25. September veröffentlichten Interview verknüpfte Irregular-CTO Omer Nevo Vorfälle mit Modellen von OpenAI, Meta, Anthropic und Google mit einem gemeinsamen Problem in Irregulars Cybersecurity-Evaluierungen: Die Testumgebung ermöglichte unbeabsichtigten Internetzugriff. Nevo bezog auch Google-Modelle in diese Einordnung ein.

Was Nevo mit den Vorfällen verbindet

Die Unternehmen beschrieben Evaluierungen, in denen KI-Modelle Cyberaufgaben in einer simulierten Umgebung bearbeiten sollten. Bei mehreren Tests führte ein Fehler in der Abschottung dazu, dass Modelle reale Systeme erreichen konnten.

Bei OpenAI war eine Capture-the-Flag-Aufgabe (CTF) als isolierter Test angelegt. Eine Fehlkonfiguration ließ jedoch Zugriff auf das öffentliche Internet zu. Zudem entsprach der Name eines fiktiven Ziels einer echten Internetdomain. OpenAI zufolge gelangte das Modell dadurch auf eine reale Website und nutzte dort eine Schwachstelle aus.

Was OpenAI, Anthropic und Meta schilderten

Anthropic berichtete am 30. Juli von drei Vorfällen in sechs Evaluierungsläufen. Dabei erhielten Modelle unbefugten Zugriff auf Produktionssysteme von drei Organisationen. Die Vorfälle verteilten sich auf drei verschiedene simulierte CTF-Szenarien. Anthropic prüfte 141.006 Evaluierungsläufe, in denen Claude Zugang zum Internet hätte erhalten können.

Meta schilderte einen Vorfall mit dem noch nicht veröffentlichten Modell Muse Spark 1.1. Bei einer Anfang Juli gestarteten Evaluierung griff das Modell auf Informationen einer realen Website zu und änderte deren Datenbank. Meta führte das auf eine Fehlkonfiguration der Testumgebung und einen Zielnamen zurück, der einer realen Website entsprach.

Welche Kontrollen Irregular änderte

Omer Nevo sagte, Irregular habe Internetzugang stärker eingeschränkt, Überwachung und manuelle Prüfungen ausgeweitet sowie Kontrollen vor Evaluierungen verschärft. Außerdem habe das Unternehmen die Abstimmung und Dokumentation der Testbedingungen mit seinen Partnern verbessert.

Irregular erklärte am 14. August, das zugrunde liegende Problem sei vor der ersten öffentlichen Offenlegung behoben worden. Die vertiefte Untersuchung lief zu diesem Zeitpunkt noch. Das Unternehmen sagte außerdem, es gebe keine Hinweise auf kompromittierte Systeme seiner Kunden oder abgeflossene Kundendaten. Anthropic bezog seine Angaben separat auf Produktionssysteme dreier Organisationen, die bei den Evaluierungen erreicht wurden.

Der Hugging-Face-Vorfall war getrennt

Der OpenAI-Vorfall bei Hugging Face gehörte nicht zu den Irregular-Evaluierungen. OpenAI bezeichnete die Ereignisse als getrennt; Nevo ordnete den Hugging-Face-Vorfall ebenfalls als unabhängig von Irregulars Tests ein.