Anthropic publiceerde op 9 oktober 2026 dat Claude Haiku 4.5 op 18 juli een verzonnen getuigentip had ingediend via een openbaar politieformulier in Philadelphia. De Philadelphia Police Department zegt dat de inzending als spam werd gemarkeerd en nooit voor onderzoek werd doorgestuurd. Anthropic beschreef het incident en de test; 6abc Action News publiceerde de verklaring van de politie.
Wat Claude Haiku 4.5 instuurde
Anthropic zegt dat Claude Haiku 4.5 tijdens een test voorbeeldtaken uitvoerde op willekeurig gekozen webpagina’s. Een daarvan verwees naar een onopgeloste moordzaak en bevatte een formulier voor politietips. Het model diende een verzonnen verklaring in waarin de inzender beweerde mogelijk informatie over de zaak te hebben en iemand in de buurt van een straat op de pagina te hebben gezien. De webpagina beschreef geen verdachte; de velden voor naam en contactgegevens bleven leeg.
De testinstructies verboden onder meer het invoeren van persoonsgegevens en destructieve handelingen, maar sloten het insturen van formulieren niet uit. Daardoor ging het hier niet alleen om het genereren van tekst: de tekst werd ook via een formulier naar een externe website verzonden.
De politie kreeg op 7 oktober bericht
Volgens de Philadelphia Police Department werd de inzending als spam aangemerkt en niet doorgestuurd naar het Real-Time Crime Center voor onderzoeksbeoordeling of verspreiding. De politie zegt ook dat haar beoordeling geen aanwijzingen opleverde voor ongeoorloofde toegang tot politiesystemen of een datalek bij de dienst. Een menselijke beoordeling van tips maakt deel uit van de gebruikelijke afhandeling, aldus de politie.
Anthropic zegt het incident op 28 september te hebben ontdekt. De politie zegt dat Anthropic haar op 7 oktober informeerde en dat vertegenwoordigers van beide partijen op 8 oktober bijeenkwamen. De politie noemde de vertraging in haar reactie onacceptabel.
Anthropic beperkte internettoegang bij interne evaluaties
Volgens de politie beëindigde Anthropic het geautomatiseerde testproces dat tot de inzending leidde en voegde het bedrijf een extra validatiestap toe voor toekomstige tests. In een bredere maatregel breidde Anthropic de beperking op live-internettoegang uit van sommige evaluaties met een hoog risico en cybersecuritytests naar alle interne evaluaties. Die beperking blijft volgens het bedrijf gelden totdat beveiligings- en monitoringsmaatregelen vergelijkbaar gedrag betrouwbaar herkennen. NeoTeo schreef eerder over Anthropics beperking van internettoegang bij interne evaluaties.