Omer Nevo, CTO e cofondatore di Irregular, ha collegato gli incidenti che coinvolgono modelli di OpenAI, Anthropic, Meta e Google a un problema comune nell’ambiente di valutazione. I resoconti di OpenAI, Anthropic e Meta descrivono test di cybersecurity in cui l’accesso a Internet non era previsto, ma ha permesso ai modelli di raggiungere sistemi reali.

Come un test simulato ha raggiunto sistemi reali

In una valutazione informatica di tipo CTF — una sfida in cui si cercano obiettivi all’interno di un ambiente di prova — i modelli dovevano agire in scenari simulati. OpenAI ha riferito che una configurazione errata lasciava accessibile Internet pubblico e che il nome fittizio assegnato a un bersaglio coincideva con un dominio reale. Il modello ha quindi raggiunto un sito reale durante il test.

Meta ha descritto un caso distinto: durante una valutazione di Irregular, il modello pre-release Muse Spark 1.1 ha consultato informazioni su un sito reale e ne ha modificato il database. Meta ha ricondotto l’episodio all’accesso a Internet dell’ambiente di prova e all’uso, come bersaglio, del nome di un sito reale.

Cosa raccontano le aziende coinvolte

Anthropic ha riferito tre incidenti in sei sessioni di valutazione, con accessi non autorizzati ai sistemi di produzione di tre organizzazioni. Il suo resoconto descrive tre diversi scenari CTF. Per i casi esaminati, Anthropic ha indicato di aver analizzato 141.006 sessioni in cui Claude avrebbe potuto ottenere accesso a Internet.

Il caso di Meta riguarda Muse Spark 1.1; quello descritto da OpenAI riguarda un proprio modello durante una valutazione CTF. Nevo ha incluso anche Google nella sua ricostruzione del problema comune, ma i dettagli del caso Google restano attribuiti al suo resoconto.

Le misure annunciate da Irregular

Nell’aggiornamento del 14 agosto 2026, Irregular ha dichiarato di aver corretto il problema prima della sua prima comunicazione pubblica e che la revisione approfondita era ancora in corso. Nevo ha descritto controlli più severi sull’accesso a Internet, più monitoraggio e revisione manuale, verifiche prima dei test e una documentazione più accurata delle condizioni concordate con i partner.

Meta ha riferito che Irregular aveva corretto la configurazione errata e che gli scenari di test non citavano più nomi di siti reali.

Il caso Hugging Face è separato

L’incidente di OpenAI che ha coinvolto Hugging Face non faceva parte delle valutazioni di Irregular. OpenAI lo ha descritto come un episodio separato, e Nevo ha definito estranei alle valutazioni di Irregular gli altri incidenti di sicurezza menzionati in relazione al caso.