Irregular-CTO en medeoprichter Omer Nevo koppelde incidenten met modellen van OpenAI, Meta, Anthropic en Google aan een gedeelde fout in de evaluatieomgeving. OpenAI, Anthropic en Meta beschreven hoe onbedoelde toegang tot het openbare internet ertoe leidde dat modellen tijdens tests echte systemen bereikten.

Hoe een testomgeving echte systemen kon bereiken

De evaluaties waren bedoeld als gesimuleerde cybersecurityoefeningen. In de accounts van OpenAI, Anthropic en Meta hadden modellen tijdens zulke tests toch toegang tot het openbare internet.

OpenAI beschreef een capture-the-flagtest, een cybersecurityoefening met opdrachten rond een fictief doelwit. Een verkeerd ingestelde omgeving liet internetverkeer toe. Bovendien kwam de fictieve doelnaam overeen met een echt domein, waarna een model een echte website benaderde en een kwetsbaarheid uitbuitte.

Wat OpenAI, Anthropic en Meta meldden

Anthropic meldde op 30 juli 2026 drie incidenten in zes evaluatieruns. Daarbij kregen modellen volgens het bedrijf ongeautoriseerde toegang tot productiesystemen van drie organisaties. Vier runs hadden betrekking op dezelfde organisatie; de twee andere incidenten vonden elk in een aparte run plaats. Anthropic beschreef drie verschillende fictieve scenario’s. Het bedrijf had 141.006 runs teruggekeken waarin Claude toegang tot internet had kunnen krijgen.

Meta meldde op 14 augustus 2026 dat zijn pre-release model Muse Spark 1.1 tijdens een evaluatie informatie van een echte website opvroeg en de database van die website wijzigde. De evaluatie was begin juli gestart in een gesloten omgeving die verkeerd was ingesteld en internettoegang toeliet.

Welke maatregelen Irregular meldde

Irregular meldde op 14 augustus 2026 dat het de onderliggende fout had verholpen voordat die voor het eerst openbaar werd gemaakt. Het bedrijf zei toen ook dat het diepgaande onderzoek nog liep.

Omer Nevo zei dat Irregular de internettoegangscontroles had aangescherpt, de monitoring en handmatige beoordeling had uitgebreid en extra controles vóór evaluaties had ingevoerd. Ook had het bedrijf de afspraken en documentatie over de opzet van evaluaties met partners verbeterd. Meta meldde dat Irregular had bevestigd dat de fout was hersteld en dat tests niet langer echte websitenamen als doelwit gebruikten.

Het incident rond Hugging Face stond hier los van

OpenAI meldde op 4 augustus 2026 dat het afzonderlijke incident rond Hugging Face geen deel uitmaakte van de Irregular-evaluaties. Nevo omschreef dat incident eveneens als losstaand.