Josh Engels ha annunciato il 12 settembre 2026 di aver lasciato tre settimane prima il team di sicurezza AGI di Google DeepMind per entrare in METR, organizzazione non profit che valuta i sistemi di IA avanzati. Il ricercatore ha spiegato di essersi mosso perché teme che lo sviluppo delle capacità possa superare la capacità di allineare e valutare i modelli.
La sua valutazione più allarmante — la possibilità che i sistemi di IA causino danni enormi entro i prossimi cinque anni — resta però un giudizio personale. Non è una previsione scientifica consolidata né una certezza sul futuro.
Josh Engels passa da Google DeepMind a METR
Engels ha detto di aver lasciato il team di sicurezza AGI di Google DeepMind tre settimane prima del suo annuncio pubblico e di essere entrato in METR. Ha anche affermato di aver apprezzato il lavoro svolto a Google DeepMind e di aver rifiutato offerte di Anthropic e OpenAI.
Il timore per l’allineamento dell’IA
Il nodo tecnico è l’allineamento: il lavoro necessario per fare in modo che un sistema persegua obiettivi compatibili con le intenzioni e i vincoli umani, anche quando diventa più capace.
Engels ritiene che le aziende stiano puntando a sistemi molto più capaci degli esseri umani in numerosi ambiti. Il suo timore è che questo progresso proceda più rapidamente dei metodi necessari per valutare e controllare quei sistemi.
La sua stima temporale riguarda i prossimi cinque anni, ma non include una probabilità precisa. Engels ha detto di considerare il rischio abbastanza elevato da rendere il problema estremamente importante; questa resta la sua analisi personale, non un consenso del settore.
Che cosa studierà a METR
A METR, Engels ha indicato tre linee di lavoro:
- studiare da dove nasce il disallineamento durante l’addestramento;
- valutare se le mitigazioni attuali siano sufficienti;
- capire se la ricerca sull’allineamento sia davvero sulla strada giusta per risolvere il problema.
METR valuta sistemi di IA avanzati per capacità autonome e possibili rischi catastrofici. Il ruolo di Engels si concentrerà inoltre sugli incidenti di disallineamento e sul rapporto tra ciò che un modello può fare e i controlli disponibili per limitarne il comportamento.
Il punto non è soltanto rendere un modello più potente. È sapere quanto sia affidabile prima di affidargli compiti più complessi, soprattutto quando può contribuire allo sviluppo di sistemi successivi.
Che cos’è l’auto-miglioramento ricorsivo
L’auto-miglioramento ricorsivo descrive uno scenario in cui un sistema di IA aiuta a creare o migliorare un successore più capace. Il processo potrebbe formare un ciclo: ogni generazione contribuisce alla successiva, che a sua volta dispone di capacità maggiori.
Engels considera questo scenario particolarmente delicato perché i metodi di sicurezza dovrebbero tenere il passo con ogni aumento di capacità. Se il sistema contribuisse a progettare il proprio successore prima che i ricercatori sappiano valutarne l’allineamento, il margine di controllo potrebbe ridursi.
Questa è una preoccupazione sul possibile sviluppo futuro dell’IA, non la descrizione di una funzione già dimostrata in modo generalizzato dai sistemi pubblici attuali.