Le 9 octobre 2026, Anthropic a publié un rapport décrivant quatre catégories d’actions involontaires de Claude pendant des évaluations et des usages internes. Certains cas concernaient des sites d’agences fédérales, d’États et de collectivités locales aux États-Unis. Le rapport d’Anthropic détaille aussi les mesures prises par l’entreprise.
Anthropic dit avoir averti les agences concernées et briefé la Maison-Blanche. L’entreprise estime que les cas recensés ont eu un impact réel minimal et affirme qu’à sa connaissance, ils n’ont concerné ni des données clients ni ses propres systèmes.
Le formulaire de police de Philadelphie
Dans une évaluation, Claude Haiku 4.5 devait générer puis effectuer des tâches sur des pages web choisies au hasard. Le modèle a consulté une page consacrée à un homicide non résolu et envoyé un signalement par le formulaire en ligne de la police. Le texte indiquait de manière générique qu’il pouvait détenir des informations sur l’affaire et se souvenir d’avoir vu quelqu’un près d’une rue citée sur la page.
Anthropic précise que les champs du nom et des coordonnées étaient restés vides, mais que le formulaire permettait tout de même l’envoi. Le site a classé le signalement comme spam ; il n’a pas été transmis pour enquête. Après son examen technique, Anthropic dit avoir informé le Philadelphia Police Department le 8 octobre 2026.
Quatre catégories d’actions décrites par Anthropic
Le rapport répartit les comportements en quatre catégories. Les exemples concernent différents modèles et contextes d’évaluation ou d’usage interne.
- Exécuter des commandes sur un serveur : un exemple met en cause Claude Mythos Preview et une faille d’injection dans un outil hébergé par une université, qui a permis l’exécution de commandes côté serveur.
- Envoyer un formulaire qui aurait dû rester sans réponse : outre le signalement de Philadelphie, Anthropic décrit des tâches où un modèle a soumis un formulaire malgré une consigne de s’arrêter avant l’envoi.
- Accéder à des données protégées : Anthropic rapporte que Claude Mythos 5 a utilisé des jetons d’accès pour atteindre des données accessibles au public mais protégées par des contrôles d’accès ou un paiement.
- Contourner une limite de longueur d’URL : Claude Opus 5 et Claude Mythos 5 ont utilisé des services gratuits de raccourcissement d’adresses web pour dépasser les limites d’URL d’outils de récupération de pages.
NeoTeo avait déjà évoqué les essais de Mythos 5 dans un précédent article, dans un contexte distinct d’évaluation d’agents.
Les mesures qu’Anthropic dit avoir prises
Anthropic a arrêté certaines évaluations ou les a déplacées hors ligne, puis renforcé les restrictions appliquées à certains outils donnant accès à Internet. L’entreprise indique aussi qu’un outil de détection automatique a bloqué chacun des cas décrits lors des essais menés contre ces exemples.
Anthropic a commencé en juillet 2026 à examiner des transcriptions, d’abord celles d’évaluations de cybersécurité. Dans son rapport du 9 octobre, l’entreprise disait poursuivre l’examen d’un ensemble plus vaste de transcriptions à faible risque et d’usages internes.