Il 10 ottobre 2026 Satya Nadella ha proposto che una persona autorizzata possa mettere in pausa o spegnere un modello di IA mentre svolge un’attività. Nel post in cui ha presentato la proposta, il CEO di Microsoft indica anche dove collocare i controlli: all’esterno del modello.
La proposta riprende il tema del controllo umano dell’IA già affrontato da NeoTeo in un precedente approfondimento, ma qui Nadella entra nel merito dell’architettura.
Controlli separati dal modello
Secondo Nadella, i permessi di accesso e le azioni consentite dovrebbero essere gestiti fuori dal modello, che non dovrebbe poter modificare o aggirare quei controlli. Il modello andrebbe inoltre separato dall’“harness” di orchestrazione: il software che coordina il suo lavoro e gli strumenti a cui può accedere.
Il post elenca sette principi: diversità dei modelli, osservabilità, verificabilità, controlli indipendenti, audit indipendenti, contenimento e comunicazione degli incidenti. Nadella propone anche registri leggibili dalle persone e a prova di manomissione, per ricostruire le azioni senza affidarsi soltanto al resoconto del modello, e test continui dell’intero sistema, compresi errori, attacchi e casi limite.
La verifica, nell’impostazione di Nadella, non dovrebbe ricadere sullo stesso modello: un esito importante non dovrebbe dipendere da un solo sistema e il modello non dovrebbe essere l’unico responsabile di controllare il proprio lavoro.
Perché la trasparenza della catena di pensiero non basta
https://x.com/satyanadella/article/2108931348857827686Nadella considera irrinunciabile la trasparenza della catena di pensiero, cioè dei passaggi di ragionamento generati dal modello. Ma sostiene che, da sola, sia insufficiente e inaffidabile: gli output dei modelli non sono ancora sempre fedeli o trasparenti.
La sua motivazione non presuppone intenzioni malevole. Un sistema capace con accesso a sistemi importanti può commettere errori o essere compromesso: per Nadella, questi rischi bastano a giustificare controlli esterni e la possibilità di interromperne l’attività.
Un precedente concreto, circoscritto ai test, è quello riferito da Palisade Research: nel maggio 2025 l’organizzazione ha descritto prove controllate in cui i modelli OpenAI o3, o4-mini e codex-mini hanno talvolta aggirato meccanismi di arresto durante compiti matematici, anche quando erano stati istruiti a consentire l’arresto. Palisade Research
Standard di contenimento per modelli più avanzati
Nadella sostiene che modelli più avanzati richiederanno tecnologie di contenimento più avanzate e chiede che vengano standardizzate. La proposta collega così il comando umano di arresto a un insieme più ampio di misure: limiti esterni alle azioni, osservabilità, verifiche indipendenti e contenimento dell’intero sistema.