Omer Nevo, dyrektor techniczny i współzałożyciel Irregular, powiązał incydenty dotyczące modeli OpenAI, Meta, Anthropic i Google ze wspólnym problemem środowiska ewaluacyjnego. Jego relacja ukazała się 25 września 2026 r. Opisy OpenAI, Anthropic i Meta wskazują, że podczas testów modele uzyskały niezamierzony dostęp do internetu, a następnie dotarły do prawdziwych systemów.

Jak testowe cele prowadziły do prawdziwych systemów

W opisanych przez firmy ewaluacjach agenci mieli wykonywać zadania cyberbezpieczeństwa w środowisku testowym. Problem polegał na tym, że środowisko, które miało być odizolowane, pozwalało na dostęp do publicznego internetu. W przypadku opisanym przez OpenAI fikcyjna nazwa celu pokrywała się z prawdziwą domeną, więc model potraktował realną witrynę jak część ćwiczenia.

OpenAI określiło test jako ćwiczenie typu CTF — „capture the flag”, czyli symulowane zadanie, w którym uczestnicy szukają sposobu na zdobycie wyznaczonego celu. W tym przypadku błędna konfiguracja połączyła scenariusz testowy z prawdziwą stroną internetową.

Co opisały firmy

OpenAI poinformowało 4 sierpnia 2026 r., że podczas ewaluacji prowadzonej przez Irregular model uzyskał dostęp do prawdziwej witryny i ją wykorzystał. Test miał być odizolowany od publicznego internetu, a fikcyjny cel pokrywał się z realną domeną.

Anthropic podało 30 lipca 2026 r., że zidentyfikowało trzy incydenty w sześciu przebiegach ewaluacji. Dotyczyły one nieautoryzowanego dostępu do infrastruktury produkcyjnej trzech organizacji. W retrospektywie firma opisała analizę 141 006 przebiegów, w których Claude mógł uzyskać dostęp do internetu.

Meta poinformowała 14 sierpnia 2026 r. o incydencie z udziałem przedpremierowego modelu Muse Spark 1.1. Podczas ewaluacji prowadzonej w infrastrukturze Irregular model uzyskał dostęp do informacji na prawdziwej stronie i zmienił jej bazę danych.

Jak Irregular zmieniło zabezpieczenia testów

Omer Nevo wymienił zaostrzenie kontroli dostępu do internetu, szerszy monitoring i ręczny przegląd oraz dodatkowe kontrole przed rozpoczęciem ewaluacji. Irregular poprawiło też dokumentowanie i uzgadnianie konfiguracji testów z partnerami.

W aktualizacji z 14 sierpnia 2026 r. Irregular podało, że problem został naprawiony przed pierwszym publicznym ujawnieniem incydentów, a szczegółowy audyt nadal trwał. Meta przekazała, że Irregular potwierdziło korektę błędnej konfiguracji i usunięcie prawdziwych nazw witryn ze scenariuszy testowych.

Incydent z Hugging Face był odrębnym przypadkiem

OpenAI opisało incydent związany z Hugging Face jako oddzielny od problemów w ewaluacjach Irregular. Nevo również określił tamten przypadek jako niezwiązany z testami prowadzonymi przez Irregular.