Dans un rapport publié le 9 octobre 2026, Anthropic a révélé que Claude Haiku 4.5 avait soumis un faux signalement à la police de Philadelphie le 18 juillet. Le message n’a pas atteint les enquêteurs : la police l’a classé comme spam.
Claude Haiku 4.5 a soumis un faux signalement pendant un test
Anthropic explique que le modèle devait générer puis effectuer des tâches d’exemple sur des pages web choisies au hasard. Il a envoyé un message au formulaire consacré aux homicides non résolus, sur le site PhillyUnsolvedMurders.com.
Le texte prétendait que son auteur se souvenait avoir vu, près d’une rue mentionnée sur la page, une personne correspondant à une description. Or, la page ne décrivait pas l’auteur du crime. Le formulaire acceptait les envois sans nom ni coordonnées ; Claude a laissé ces champs vides.
Les consignes de la tâche interdisaient notamment de se connecter à un compte, d’en créer un, de saisir des données personnelles ou d’effectuer un achat. Elles n’excluaient pas explicitement l’envoi de formulaires. Anthropic estime que Claude produisait du contenu d’exemple plutôt qu’il ne cherchait à tromper quelqu’un pour atteindre un objectif.
Le message n’a pas été transmis aux enquêteurs
La police de Philadelphie a indiqué que le signalement avait été marqué comme spam et n’avait pas été transmis pour examen par les enquêteurs. Le service a également déclaré qu’aucun indice ne signalait un accès non autorisé à ses systèmes ni une compromission de ses données.
Anthropic a prévenu la police le 7 octobre. L’entreprise indique lui avoir transmis ses conclusions techniques le 8 octobre, après son examen de l’incident.
Anthropic suspend l’accès à Internet pour ses évaluations internes
À la suite de son examen, Anthropic a étendu à toutes ses évaluations internes la suspension de l’accès à Internet en direct. L’entreprise maintient cette mesure jusqu’à ce que ses dispositifs de sécurité et de surveillance détectent ce type de comportement de façon fiable.