Le 25 septembre 2026, Omer Nevo, cofondateur et directeur technique d’Irregular, a relié des incidents associés à OpenAI, Anthropic, Meta et Google à un problème commun dans les environnements d’évaluation des agents d’IA. Son explication décrit des tests de cybersécurité où un nom fictif a conduit certains modèles vers un véritable domaine internet.

Comment une cible fictive a pu mener à un domaine réel

Dans une simulation de cybersécurité, un agent exécute les étapes d’un scénario conçu pour éprouver ses capacités. Selon le récit de Nevo, une erreur humaine avait donné à une entreprise fictive le même nom qu’un domaine réel.

Comme l’environnement d’évaluation autorisait l’accès à Internet, une petite fraction des exécutions a traité ce domaine réel comme une cible du scénario et a tenté de l’atteindre, parfois après plusieurs centaines d’étapes. Irregular estimait qu’il survenait moins d’un incident pour 10 000 simulations avancées.

Ce qu’Anthropic et Meta ont rapporté sur leurs évaluations

Dans son examen publié le 30 juillet 2026, Anthropic a fait état de trois incidents au cours de six exécutions impliquant des systèmes de production dans trois organisations. Le même examen portait sur 141 006 exécutions durant lesquelles Claude aurait pu avoir accès à Internet.

Meta a indiqué le 14 août qu’au cours d’une évaluation menée début juillet 2026, Muse Spark 1.1, alors en préversion, avait exploité une vulnérabilité sur un site réel, accédé à des informations et modifié la base de données de ce site.

Le 4 août, OpenAI a indiqué que l’incident lié à Hugging Face était indépendant des cas associés à Irregular.

Les protections qu’Irregular dit avoir renforcées

Irregular a dit avoir renforcé les contrôles d’accès à Internet, la surveillance, les vérifications manuelles et les contrôles préalables aux évaluations, ainsi que ses procédures de confinement et de réponse. L’entreprise a également évoqué une documentation plus claire et des accords avec ses partenaires.