Microsoft erklärte am 7. Oktober 2026, dass MAI-Code-1.1-Flash lokal unter Windows heruntergeladen und ausgeführt werden kann – ohne Inferenzgebühr pro lokalem Aufruf. Für Ende Oktober stellte Microsoft außerdem experimentelle lokale Modelloptionen in GitHub Copilot in Aussicht.
NeoTeo hatte den für den 7. Oktober geplanten Windows- und KI-Termin bereits eingeordnet. Microsofts Mitteilung vom selben Tag stellte MAI-Code-1.1-Flash als lokal nutzbares Modell vor.
Lokale Ausführung ohne Gebühr pro Modellaufruf
MAI-Code-1.1-Flash ist ein für Programmieraufgaben ausgelegtes Mixture-of-Experts-Modell. Es umfasst laut Microsoft insgesamt 137 Milliarden Parameter, von denen 6,8 Milliarden aktiv sind. Microsoft AI erklärte, die quantisierte Version könne lokal ausgeführt werden; bei dieser Nutzung falle keine Inferenzgebühr pro Aufruf an. Microsofts Ankündigung bezieht sich auf Modellaufrufe – Kosten für den Rechner und den Stromverbrauch sind davon nicht umfasst.
Der Speicherbedarf des lokalen Modells
Die Modellgewichte der quantisierten Version belegen laut Microsoft 53 GB. Bei einem Kontextfenster von 256.000 Tokens meldete das Unternehmen einen Spitzenbedarf von 75,5 GB Arbeitsspeicher. Für beste Leistung empfiehlt Microsoft ein Gerät mit mehr als 120 GB RAM.
Das sind drei verschiedene Angaben: die Größe des Modells, der gemeldete Spitzenbedarf unter einer bestimmten Kontextlänge und eine Empfehlung für den Arbeitsspeicher. Bei gemeinsam genutztem Speicher teilen sich CPU und GPU denselben Vorrat. Auch Betriebssystem, Anwendungen, Laufzeitumgebung und Zwischenspeicher benötigen einen Teil davon.
Microsofts Benchmark-Ergebnisse
In Tests vom 5. Oktober 2026 meldete Microsoft für die quantisierte lokale Version 70,80 Prozent bei SWE-Bench Verified und 66,29 Prozent bei Terminal-Bench 2.1. Die Testdatensätze umfassten 500 beziehungsweise 89 Aufgaben.
| Benchmark und Datensatzgröße | MAI-Code-1.1-Flash, quantisiert auf dem Gerät | MAI-Code-1.1-Flash, volle Präzision |
| SWE-Bench Verified (500 Aufgaben) | 70,80 % | 72,6 % |
| Terminal-Bench 2.1 (89 Aufgaben) | 66,29 % | 62,9 % |
Microsoft beschrieb für die Tests gemischte Präzisionsquantisierung, DFlash2 Sliding-Window Speculative Decoding und eine Windows-ARM64-Laufzeit mit llama.cpp und CUDA. Die Werte stammen aus Microsofts Testaufbau; laut Unternehmen hängen tatsächliche Ergebnisse auch vom Gerät und dessen Konfiguration ab. Die technische Beschreibung nennt die Benchmarks und den verwendeten Aufbau.
Die geplanten Optionen in GitHub Copilot
Microsoft kündigte experimentelle lokale Modelloptionen für GitHub Copilot CLI, die Copilot-App und VS Code an, die bis Ende Oktober 2026 verfügbar werden sollten. Der angekündigte Automatikmodus sollte zwischen lokaler und Cloud-Inferenz wählen; außerdem war eine manuelle Auswahl lokaler Modelle vorgesehen.
Für Befehle von Agenten beschreibt Microsoft separate Sandbox-Steuerungen. Entwickler müssen diese konfigurieren; die lokale Ausführung eines Modells begrenzt Datei- oder Netzwerkzugriffe nicht automatisch.