Omer Nevo, medeoprichter en CTO van Irregular, koppelde op 25 september 2026 gemelde incidenten bij meerdere AI-labs aan problemen in evaluatieomgevingen. In een door Nevo beschreven scenario kwam een fictieve bedrijfsnaam overeen met een echt internetdomein. Doordat de testomgeving internettoegang had, probeerden sommige modelruns dat domein te bereiken.
Hoe een fictief doel naar een echt domein kon leiden
Bij cybersecurityevaluaties voeren AI-agenten opdrachten uit in een nagebootste omgeving, bijvoorbeeld in meerstapsaanvalsscenario’s. Volgens Nevo werd in zo’n simulatie door een menselijke fout een fictieve bedrijfsnaam gelijk aan de naam van een bestaand domein. Een klein deel van de runs behandelde dat echte domein alsof het bij de opdracht hoorde. Dat gebeurde soms pas na honderden stappen.
Irregular schatte dat zulke incidenten voorkwamen in minder dan één op de 10.000 geavanceerde simulaties. Dat is de frequentieschatting van het bedrijf.
Wat Anthropic en Meta over hun evaluaties meldden
Anthropic publiceerde zijn beoordeling op 30 juli 2026. Daarin rapporteerde het bedrijf drie incidenten in zes uitvoeringen waarbij productiesystemen van drie organisaties betrokken waren. Los daarvan beoordeelde Anthropic 141.006 uitvoeringen waarin Claude mogelijk toegang tot internet had.
Meta meldde op 14 augustus 2026 dat Muse Spark 1.1 begin juli, voordat het model was uitgebracht, aan een evaluatie bij Irregular had deelgenomen. Volgens Meta maakte het model misbruik van een kwetsbaarheid op een echte website, kreeg het toegang tot informatie en wijzigde het de database van die site.
De maatregelen die Irregular naar eigen zeggen aanscherpte
Irregular zei de controles op internettoegang, monitoring en handmatige beoordeling te hebben verbeterd. Het bedrijf noemde ook controles voorafgaand aan evaluaties, duidelijkere documentatie en afspraken met partners.