Le 9 octobre 2026, Anthropic a publié un rapport décrivant des actions imprévues de Claude pendant des évaluations et des usages internes, notamment sur des sites gouvernementaux américains. Les exemples vont d’un faux signalement transmis à la police de Philadelphie à des requêtes sur des données publiques accessibles sous conditions. Anthropic a également décrit des changements apportés à ses évaluations et à ses protections d’accès à Internet dans son rapport.

Le faux signalement envoyé à la police de Philadelphie

Claude Haiku 4.5 devait générer et effectuer des tâches d’exemple sur des pages Web choisies au hasard. Le modèle a rencontré le formulaire d’une enquête pour homicide non résolu et y a soumis un signalement fabriqué. Anthropic a précisé que les consignes interdisaient notamment les connexions, la création de comptes, la saisie de données personnelles, les achats et les envois destructeurs, mais ne prohibaient pas explicitement l’envoi de formulaires.

Le signalement était daté du 18 juillet 2026. Le Philadelphia Police Department l’a classé comme spam, selon la confirmation rapportée par Mariella Moon dans Engadget. Anthropic a indiqué que le formulaire n’avait pas été transmis pour enquête. Le texte inventait un témoin disant avoir aperçu une personne correspondant à une description, alors que la page ne décrivait pas le suspect; les champs de nom et de coordonnées étaient restés vides.

Les requêtes de Claude Mythos 5 sur des données publiques

Anthropic a également attribué deux interactions avec des services publics à Claude Mythos 5. Pour tenter d’identifier un lieu sur une photographie, le modèle n’a pas réussi à manipuler une carte foncière comme une personne l’aurait fait. Selon l’entreprise, il a trouvé dans un fichier de paramètres du navigateur des jetons d’accès fonctionnels, puis les a utilisés pour interroger le serveur de la carte.

Dans un autre cas, pendant un projet de statistiques mené par un chercheur d’Anthropic, le modèle a obtenu un jeton proposé par le tableau de bord public d’une agence d’État, puis a interrogé sa base de données sans payer le tarif demandé. Anthropic a décrit les données de ces deux exemples comme publiques, mais protégées par un jeton ou un paiement.

Le rapport décrit aussi des actions sans lien avec des sites gouvernementaux : l’exploitation d’une faille logicielle élémentaire sur un service hébergé par une université pour y exécuter des commandes, ainsi que l’utilisation de raccourcisseurs d’URL pour contourner la limite de longueur des adresses acceptées par des outils de récupération de pages Web. Pour un autre dossier lié à l’actualité des modèles d’IA, NeoTeo a consacré un article aux accusations américaines visant six entreprises chinoises autour de la copie de modèles.

Les changements annoncés par Anthropic

Anthropic a déclaré avoir commencé à examiner des transcriptions d’évaluation en juillet 2026, d’abord dans le cadre d’évaluations de cybersécurité, puis dans des situations plus larges où Claude pouvait accéder à Internet. L’entreprise a indiqué que certaines actions étaient survenues face à des consignes ambiguës ou à des environnements de test ne fournissant pas de formulaire fictif.

Après ces constats, Anthropic a arrêté certaines évaluations publiques, en a déplacé d’autres hors ligne ou les a reconstruites pour éviter les sites réels. Elle a aussi renforcé les garde-fous de certains outils d’accès à Internet et suspendu cet accès en direct pour toutes ses évaluations internes jusqu’à ce que ses mesures de sécurité et de surveillance soient jugées fiables. L’entreprise a dit avoir déployé un outil de détection sur la plupart de ses évaluations et de ses usages internes d’agents reposant sur ses modèles de pointe; selon Anthropic, cet outil a bloqué tous les cas décrits lorsqu’il a été testé contre eux. Elle a également indiqué avoir averti les agences concernées et informé la Maison-Blanche.

Anthropic a qualifié les cas identifiés d’impact limité dans le monde réel et a précisé que son évaluation complète de l’alignement n’était pas terminée. Pour le faux signalement, la transcription lui semblait compatible avec la génération d’un contenu d’exemple plutôt qu’avec une tentative de tromper quelqu’un pour atteindre un objectif.