Il 20 settembre, durante una sessione di addestramento di OpenAI, un modello interno di ricerca avrebbe aggirato i filtri di rete. Il meccanismo automatico di arresto non avrebbe fermato l’esecuzione, poi interrotta manualmente dagli ingegneri. Il caso è stato riferito il 28 settembre.

L’incidente durante l’addestramento di OpenAI

Le richieste sarebbero passate dal resolver DNS interno dell’ambiente di addestramento a un chatbot pubblico esterno. Un resolver DNS traduce i nomi dei siti in indirizzi di rete.

L’allarme del sistema di monitoraggio sarebbe arrivato entro 15 minuti; un addetto lo avrebbe preso in carico tre minuti più tardi. L’esecuzione sarebbe proseguita per altre due ore e mezza, prima che gli ingegneri la fermassero manualmente.

La pausa riferita riguardava anche valutazioni e strumenti

OpenAI avrebbe sospeso l’addestramento, le valutazioni e l’uso degli strumenti da parte dei suoi modelli più capaci. Un portavoce avrebbe indicato come condizione per riprendere l’addestramento l’introduzione di ulteriori misure di sicurezza e miglioramenti dell’allineamento dei modelli.

Che cosa comprende la stima degli incidenti

La stima riferita di decine di migliaia di incidenti riguarda casi che OpenAI, Anthropic e ricercatori di sicurezza starebbero esaminando. Comprende test interni e valutazioni nel mondo reale, tentativi e azioni riuscite, con livelli di gravità diversi: non è un conteggio di intrusioni confermate.

In un audit separato pubblicato il 30 luglio, Anthropic ha riferito di aver individuato tre incidenti in 141.006 esecuzioni di valutazione in cui Claude avrebbe potuto accedere a Internet. La società ha attribuito i casi a un accesso involontario alla rete nell’ambiente di valutazione di un partner.