Il 7 ottobre 2026 Microsoft ha annunciato che MAI-Code-1.1-Flash, il suo modello per la programmazione, può essere scaricato ed eseguito in locale su Windows senza costi d’inferenza per ogni chiamata locale. La versione quantizzata occupa 53 GB e, con un contesto di 256.000 token, Microsoft riporta un picco di memoria di 75,5 GB. Le opzioni locali integrate in GitHub Copilot erano invece previste per una fase sperimentale entro fine ottobre 2026.

NeoTeo aveva già raccontato l’evento Windows e IA previsto per il 7 ottobre in un precedente articolo; questo annuncio riguarda nello specifico il modello e i suoi requisiti di memoria.

Microsoft annuncia l’esecuzione locale di MAI-Code-1.1-Flash

Microsoft AI afferma che il modello è disponibile per il download e l’esecuzione locale. Le chiamate elaborate localmente non hanno un costo d’inferenza per richiesta, ma l’uso richiede un computer adeguato e comporta comunque costi per l’hardware e l’elettricità.

MAI-Code-1.1-Flash è un modello di programmazione basato sull’architettura mixture of experts: ha 137 miliardi di parametri complessivi, di cui 6,8 miliardi attivi. La versione destinata all’esecuzione locale mantiene una finestra di contesto massima di 256.000 token.

La memoria richiesta dal modello locale

Microsoft riporta un ingombro di 53 GB per il modello quantizzato e un picco di memoria di 75,5 GB quando viene usato con il contesto massimo di 256.000 token. Per ottenere le prestazioni migliori, Microsoft AI raccomanda un dispositivo con più di 120 GB di RAM.

Nelle configurazioni con memoria unificata, CPU e GPU condividono la stessa capacità. Una parte è inoltre utilizzata dal sistema operativo, dalle applicazioni, dal runtime d’inferenza e dalla cache; durante l’esecuzione, quindi, al modello si sommano anche queste esigenze di memoria.

I benchmark comunicati da Microsoft

Microsoft ha eseguito i test il 5 ottobre 2026. La configurazione descritta usa quantizzazione a precisione mista, decodifica speculativa DFlash2 a finestra scorrevole e un runtime llama.cpp CUDA su Windows ARM64. I risultati sono stati comunicati da Microsoft; l’azienda precisa che possono variare in base al dispositivo e alla configurazione.

Benchmark e dimensione del testMAI-Code-1.1-Flash quantizzato sul dispositivoMAI-Code-1.1-Flash a precisione completa
SWE-Bench Verified (500 attività)70,80%72,6%
Terminal-Bench 2.1 (89 attività)66,29%62,9%

Le opzioni previste in GitHub Copilot

Microsoft prevedeva di introdurre entro fine ottobre 2026 opzioni sperimentali per usare modelli locali in GitHub Copilot CLI, nell’app Copilot e in VS Code. Il piano comprendeva una modalità Auto, capace di instradare le richieste tra modelli locali e cloud, e la selezione manuale di un modello locale.

Microsoft descrive separatamente i controlli sandbox: gli sviluppatori devono configurarli per delimitare l’attività degli agenti su file e rete.