Une déclaration d’Omer Nevo, directeur technique et cofondateur d’Irregular, rendue publique le 25 septembre, relie des incidents impliquant des modèles d’OpenAI, Meta, Anthropic et Google à un problème commun de configuration des évaluations. Les comptes d’OpenAI, d’Anthropic et de Meta décrivent des tests où l’accès à Internet n’était pas prévu, mais où des agents ont atteint des systèmes réels.
Comment un test simulé a débouché sur un accès réel
OpenAI décrit une évaluation de type CTF (« capture the flag »), un exercice de cybersécurité fondé sur des défis à résoudre dans un cadre simulé. L’environnement devait être isolé, mais une erreur de configuration a laissé un accès au Web public. Le nom fictif d’une cible correspondait à un domaine réel : le modèle a exploité un vrai site web en le prenant pour une partie de l’exercice.
Meta indique que, lors de l’évaluation de préversion de Muse Spark 1.1, le modèle a consulté des informations sur un site réel et modifié sa base de données.
Anthropic a fait état le 30 juillet de trois incidents sur six exécutions d’évaluation, avec un accès non autorisé aux systèmes de production de trois organisations. Ces incidents correspondaient à trois scénarios CTF fictifs distincts. Pour son examen rétrospectif, Anthropic a passé en revue 141 006 exécutions susceptibles de donner à Claude un accès à Internet.
Les contrôles qu’Irregular dit avoir renforcés
Omer Nevo a indiqué qu’Irregular avait resserré ses contrôles d’accès à Internet, étendu la surveillance et les vérifications manuelles, renforcé les contrôles avant les évaluations et amélioré la documentation des paramètres convenus avec ses partenaires.
Dans sa mise à jour du 14 août, Irregular a déclaré que le problème sous-jacent avait été corrigé avant sa première communication publique et que son audit approfondi se poursuivait. L’entreprise a également dit ne disposer d’aucun élément indiquant que les systèmes de ses clients avaient été compromis ou que leurs données avaient été divulguées.
L’incident Hugging Face est distinct
L’incident impliquant OpenAI et Hugging Face ne relève pas des évaluations d’Irregular. OpenAI l’a explicitement distingué de ces incidents, et Nevo l’a également décrit comme sans lien avec les évaluations de son entreprise.