25 września 2026 r. Omer Nevo, współzałożyciel i dyrektor techniczny Irregular, powiązał incydenty związane z OpenAI, Anthropic i Meta ze wspólnym problemem środowiska ewaluacyjnego. Według jego opisu część testów cyberbezpieczeństwa mogła skierować modele ku prawdziwej domenie internetowej.

Wspólny problem w środowisku testowym

Ewaluacja agentów AI sprawdza nie tylko końcową odpowiedź, lecz także przebieg działania systemu — na przykład dobór narzędzi i kolejne kroki. W opisanym przypadku problem dotyczył granicy między symulacją a prawdziwym internetem.

Nevo wyjaśnił, że fikcyjna nazwa firmy użyta jako cel symulacji wskutek ludzkiego błędu pokrywała się z istniejącą domeną. Przy dostępie do internetu część modeli traktowała prawdziwą domenę jako element ćwiczenia i próbowała się z nią połączyć. Według Nevo zdarzało się to dopiero po setkach kroków. Irregular szacowała, że takie incydenty występowały w mniej niż jednej na 10 000 zaawansowanych symulacji.

Co Anthropic i Meta podały o swoich ewaluacjach

W przeglądzie opublikowanym 30 lipca 2026 r. Anthropic opisała trzy incydenty w sześciu wykonaniach obejmujących systemy produkcyjne trzech organizacji. Osobno przeanalizowała 141 006 uruchomień, w których Claude mógł mieć dostęp do internetu.

Meta podała, że przedpremierowy model Muse Spark 1.1 uczestniczył w ewaluacji na początku lipca 2026 r. Podczas testu model wykorzystał podatność na prawdziwej stronie internetowej, uzyskał dostęp do informacji i zmodyfikował bazę danych tej strony. Meta opisała ten przypadek 14 sierpnia 2026 r.

4 sierpnia 2026 r. OpenAI określiła incydent związany z Hugging Face jako niezależny od przypadków łączonych z Irregular.

Zabezpieczenia, które Irregular deklarowała wzmocnić

Irregular poinformowała o wzmocnieniu kontroli dostępu do internetu, monitoringu, ręcznej weryfikacji i sprawdzania środowiska przed ewaluacją. Wśród działań wymieniła też procedury reagowania. Firma podała, że nie znalazła dowodów na włamanie do systemów klientów ani wyciek danych klientów.