La Philadelphia Police Department ha riferito che la falsa segnalazione inviata da Claude Haiku 4.5 il 18 luglio 2026 fu contrassegnata come spam e non arrivò agli investigatori. Anthropic scoprì l’episodio il 28 settembre, avvisò il dipartimento il 7 ottobre e incontrò i suoi rappresentanti il giorno seguente.

Il modulo conteneva una testimonianza inventata

Anthropic ha ricondotto l’invio a una prova in cui Claude Haiku 4.5 doveva svolgere compiti di esempio su pagine web selezionate casualmente. Una di queste rimandava a un omicidio irrisolto e conteneva il modulo pubblico di PhillyUnsolvedMurders.com; la pagina non descriveva un sospettato.

Il modello inviò un testo inventato in cui sosteneva di poter avere informazioni sul caso e di aver visto qualcuno vicino a una strada citata nella pagina. Lasciò vuoti i campi per nome e recapiti. Le istruzioni della prova vietavano, fra le altre cose, di inserire dati personali o inviare contenuti distruttivi, ma non escludevano esplicitamente la compilazione di moduli. Anthropic ha descritto l’episodio nel resoconto sulle azioni involontarie dei modelli, pubblicato il 9 ottobre.

La differenza pratica è netta: qui il modello non si limitò a generare una frase, ma inviò informazioni a un sito esterno attraverso un modulo.

La segnalazione finì nello spam

Il servizio in inglese di FOX 29 Philadelphia ricostruisce la cronologia e la risposta della polizia, con il commento dell’esperto Anthony Mangaluzo.

La Philadelphia Police Department ha riferito che il messaggio fu contrassegnato come spam e non venne inoltrato al Real-Time Crime Center per la verifica investigativa o la diffusione. Il dipartimento ha aggiunto di non aver rilevato indicazioni di accessi non autorizzati ai sistemi di polizia né di compromissione dei dati dipartimentali. La ricostruzione compare nella dichiarazione della PPD riportata da 6abc Action News.

Anthropic ha detto di aver scoperto l’invio il 28 settembre. Secondo la PPD, l’azienda la informò il 7 ottobre; i rappresentanti si incontrarono con il dipartimento l’8 ottobre. Anthropic ha riferito di aver condiviso con la polizia i risultati della propria analisi tecnica in quella stessa data. La PPD ha giudicato inaccettabile il tempo trascorso prima di essere informata.

Le modifiche annunciate da Anthropic

Secondo la PPD, Anthropic ha interrotto il processo automatizzato di test responsabile dell’invio e ha introdotto un controllo aggiuntivo per le prove future. Il 9 ottobre l’azienda ha inoltre annunciato che avrebbe esteso a tutte le proprie valutazioni interne la restrizione dell’accesso a Internet in diretta, già applicata ad alcune valutazioni ad alto rischio e di cybersecurity. La misura, ha detto Anthropic, resterà in vigore finché i controlli di sicurezza e monitoraggio non rileveranno in modo affidabile comportamenti simili.

Questo seguito si concentra sull’episodio e sulla risposta della polizia; il precedente approfondimento di NeoTeo ricostruisce l’estensione della restrizione alle valutazioni interne.