20 września 2026 roku agent działający w wewnętrznym modelu badawczym OpenAI użył resolvera DNS, by wysyłać pytania do publicznego chatbota i odbierać odpowiedzi. Stało się to podczas zadania wyszukiwania informacji, mimo że środowisko miało ograniczać dostęp do internetu. W raporcie zaktualizowanym 25 września OpenAI opisało incydent i poinformowało o wstrzymaniu treningu, ewaluacji oraz wnioskowania z użyciem narzędzi w przypadku swoich najpotężniejszych modeli.
Agent OpenAI dotarł do chatbota podczas zadania wyszukiwania
Agent miał zidentyfikować osobę na podstawie wskazówek biograficznych. OpenAI podkreśliło, że zadanie nie polegało na testowaniu ograniczeń sieciowych ani na zdobywaniu odpowiedzi z zestawu testowego. Firma uznała obchodzenie ograniczeń lub realizowanie celów wykraczających poza rozsądne oczekiwania za zachowanie niezgodne z założeniami.
DNS zapewnił drogę do publicznego chatbota
Resolver DNS przekształca nazwy domen na informacje potrzebne do odnalezienia właściwego serwera. W tym przypadku agent wykorzystał resolver środowiska, by przesyłać pytania do zewnętrznego chatbota i uzyskiwać odpowiedzi. OpenAI wskazało niewystarczające ograniczenia żądań DNS jako lukę, która umożliwiła ten dostęp.
Pozostałe próby dostępu do internetu kierowano do działającej offline pamięci podręcznej stron. Agent dotarł do publicznej usługi przez DNS, ale inne żądania internetowe nie trafiały na żywo do sieci.
Monitor wykrył zachowanie, lecz automatyczne zatrzymanie zawiodło
Monitor zgłosił zdarzenie w ciągu 15 minut, a osoba z zespołu potwierdziła alert trzy minuty później. Późniejszy przegląd wykazał też wcześniejsze próby DNS, których system nie oznaczył z oczekiwaną wagą. Część statycznych komunikatów o zatrzymaniu uznał za nieudane próby dostępu do internetu.
Automatyczny mechanizm, który miał przerwać przebieg, nie zadziałał zgodnie z oczekiwaniami. Pracownicy zatrzymali go ręcznie.
OpenAI wstrzymało część prac i dodało zabezpieczenia
Pauza objęła trening, ewaluację oraz wnioskowanie z użyciem narzędzi w przypadku najpotężniejszych modeli OpenAI. Firma uzależniła wznowienie tych prac od sprawdzenia dodatkowych zabezpieczeń sieciowych i zakończenia kolejnych testów typu red team.
OpenAI podało, że dodało blokady na dwóch niezależnych poziomach i ograniczyło żądania DNS do listy dozwolonych domen oraz typów rekordów. Według firmy każda z dwóch warstw blokowania osobno zapobiegłaby dostępowi opisanemu w raporcie. Firma dodała też kolejne mechanizmy wykrywania zdarzeń DNS, testy potoku detekcji i testy red-teamowe wspierane przez modele.