Microsoft maakte op 7 oktober 2026 bekend dat MAI-Code-1.1-Flash lokaal op Windows kan worden gedownload en uitgevoerd, zonder kosten per lokale modelaanroep. Het gequantiseerde model is 53 GB groot en gebruikt volgens Microsoft maximaal 75,5 GB geheugen bij een context van 256.000 tokens. Voor de beste prestaties adviseert Microsoft een apparaat met meer dan 120 GB RAM. De experimentele opties voor GitHub Copilot waren apart gepland voor eind oktober 2026.

NeoTeo schreef eerder over de geplande Windows- en pc-AI-bijeenkomst van 7 oktober.

Lokale uitvoering en de Copilot-plannen

MAI-Code-1.1-Flash is een codeermodel met een mixture-of-experts-architectuur: bij een modelaanroep is niet het volledige model actief. Microsoft noemt 137 miljard parameters in totaal en 6,8 miljard actieve parameters.

Lokale uitvoering betekent dat de berekeningen op het eigen apparaat plaatsvinden. Microsoft zegt dat daarvoor geen inferentiekosten per lokale aanroep gelden. Dat neemt de kosten van geschikte hardware en stroomverbruik niet weg.

De geheugenbehoefte van het lokale model

De drie geheugencijfers beschrijven verschillende zaken: het model zelf is 53 GB groot, het piekgeheugengebruik bedraagt 75,5 GB bij de maximale context van 256.000 tokens, en Microsoft adviseert meer dan 120 GB RAM voor de beste prestaties.

Een contextvenster bepaalt hoeveel tekst het model tegelijk kan meenemen in een opdracht. Het geheugenverbruik loopt daarbij niet alleen op door het model: Microsoft noemt ook het besturingssysteem, apps, de runtime en de cache als geheugengebruikers. Bij apparaten met gedeeld geheugen gebruiken CPU en GPU bovendien hetzelfde geheugen. De nominale geheugencapaciteit is dus niet volledig beschikbaar voor het model.

Microsofts gerapporteerde benchmarkresultaten

Microsoft voerde de tests uit op 5 oktober 2026. De lokale versie gebruikte gemengde-precisie-kwantisering, DFlash2-speculatief decoderen met een schuivend venster en een llama.cpp-CUDA-runtime op Windows ARM64.

Benchmark en datasetgrootteLokale, gequantiseerde MAI-Code-1.1-FlashMAI-Code-1.1-Flash in volledige precisie
SWE-Bench Verified (500 taken)70,80%72,6%
Terminal-Bench 2.1 (89 taken)66,29%62,9%

Dit zijn de resultaten die Microsoft voor de twee versies rapporteerde. De scores lopen uiteen: de lokale versie scoorde lager op SWE-Bench Verified en hoger op Terminal-Bench 2.1.

De geplande GitHub Copilot-opties

Microsoft kondigde experimentele lokale modelopties aan voor GitHub Copilot CLI, de Copilot-app en VS Code. Die zouden uiterlijk eind oktober 2026 beschikbaar komen. Volgens de aankondiging zou Copilot automatisch tussen lokale en cloudinferentie kunnen routeren; gebruikers zouden ook handmatig een lokaal model kunnen kiezen.

Microsoft beschrijft sandboxbeveiliging voor agentcommando's als een afzonderlijke instelling die ontwikkelaars zelf moeten configureren.