I resoconti pubblicati il 29 settembre 2026 riferiscono gli avvertimenti di ricercatori attuali ed ex di OpenAI e Google DeepMind sui rischi dell’IA auto-migliorante. Al centro c’è una possibilità futura: sistemi che contribuiscono a sviluppare i propri successori, con un ruolo umano potenzialmente minore.
La raccolta delle testimonianze video è stata attribuita a Palisade Research. Juan Felipe Ceron Uribe, ricercatore di OpenAI, ha descritto i laboratori di frontiera come impegnati in una corsa con scarsa visibilità.
Che cosa significa auto-miglioramento ricorsivo
L’auto-miglioramento ricorsivo è un possibile ciclo in cui l’IA partecipa sempre di più alla progettazione e allo sviluppo di sistemi di IA successivi. Se quei sistemi diventassero a loro volta più efficaci nel costruire i propri successori, il processo potrebbe accelerare e lasciare meno spazio alla valutazione umana.
La distinzione conta perché l’IA che aiuta a scrivere codice o a svolgere esperimenti non sta necessariamente progettando e realizzando in autonomia una generazione più capace. Un rischio descritto da Nathalie Baracaldo è che un agente ottimizzi ripetutamente un obiettivo formulato male, modificando strumenti, prompt o ambiente senza correggere l’errore nell’obiettivo. È uno scenario condizionale, non una descrizione delle capacità attuali.
L’assistenza dell’IA non è ancora autonomia
Anthropic afferma che Claude contribuisce già alla scrittura del codice, agli esperimenti e allo sviluppo dell’IA, ma che la creazione completamente autonoma di sistemi successori più capaci non è stata raggiunta.
L’azienda ha riferito che a maggio 2026 Claude era responsabile di oltre l’80% delle righe di codice confluite in produzione nella sua base di codice. La percentuale deriva da un’attribuzione interna che, secondo Anthropic, presenta lacune.
In un esercizio circoscritto di ottimizzazione del codice, Claude Opus 4 ha ottenuto un miglioramento medio della velocità di circa 3× rispetto al codice iniziale nel maggio 2025; Claude Mythos Preview ha raggiunto circa 52× nell’aprile 2026. L’esercizio aveva un obiettivo definito e non misurava un aumento della velocità di addestramento di modelli nel mondo reale.
La stima di Neel Nanda è personale
Neel Nanda, ricercatore di Google DeepMind, ha stimato una probabilità di almeno il 10% che l’IA possa portare all’estinzione umana. È una sua valutazione personale, non una misura empirica né una probabilità condivisa dalla comunità scientifica.
Anche l’interpretazione degli scenari divide chi discute il tema: alcuni commentatori contestano che le ipotesi di estinzione tengano conto dei vincoli fisici e logistici; altri sostengono che l’incertezza sul percorso non basti a escludere il rischio e distinguono l’estinzione da danni finanziari o sistemici. Michael Littman considera incerto persino che un ciclo capace di progettare sistemi di IA sempre migliori sia logicamente coerente, oltre che imminente.
Geoffrey Irving sostiene che un laboratorio potrebbe rallentare lo sviluppo senza aspettare un accordo di tutto il settore.