7 października 2026 r. Microsoft ogłosił, że MAI-Code-1.1-Flash można pobrać i uruchamiać lokalnie w systemie Windows. Lokalne wywołania modelu nie wiążą się z opłatą za inferencję, ale jego pamięciożerne działanie stawia konkretne wymagania sprzętowe. Osobno Microsoft zapowiedział eksperymentalne opcje lokalnych modeli w GitHub Copilot, planowane do końca października 2026 r. Kontekst wcześniejszej zapowiedzi spotkania opisaliśmy w materiale o wydarzeniu Microsoftu dotyczącym Windows i lokalnego AI.

Microsoft udostępnia MAI-Code-1.1-Flash do lokalnego uruchamiania

MAI-Code-1.1-Flash to model językowy przeznaczony do zadań programistycznych. Microsoft opisuje go jako model oparty na architekturze mieszaniny ekspertów (MoE): ma 137 miliardów parametrów łącznie, z czego 6,8 miliarda jest aktywnych. Przy lokalnych wywołaniach użytkownik nie płaci opłaty za inferencję; komputer i zużywana przez niego energia nadal mają jednak swój koszt.

Pamięć wymagana przez lokalny model

Skwantyzowana wersja MAI-Code-1.1-Flash zajmuje 53 GB. Microsoft podaje osobno, że przy kontekście 256 000 tokenów szczytowe użycie pamięci wynosi 75,5 GB. Kontekst to ilość tekstu, którą model może uwzględniać w danej interakcji; większy limit pozwala objąć nią obszerniejszy fragment kodu lub rozmowy.

Microsoft zaleca urządzenie z ponad 120 GB RAM dla najlepszej wydajności. Pamięć zunifikowana jest współdzielona przez procesor i układ graficzny, a część zajmują także system operacyjny, aplikacje, środowisko uruchomieniowe modelu i pamięć podręczna. Pojemność urządzenia nie jest więc w całości dostępna dla samego modelu.

Wyniki benchmarków podane przez Microsoft

W testach przeprowadzonych 5 października 2026 r. skwantyzowana wersja lokalna uzyskała 70,80% w SWE-Bench Verified, obejmującym 500 zadań, oraz 66,29% w Terminal-Bench 2.1, obejmującym 89 zadań. W tabeli Microsoftu wersja o pełnej precyzji uzyskała odpowiednio 72,6% i 62,9%.

Benchmark i liczba zadańMAI-Code-1.1-Flash kwantyzowany na urządzeniuMAI-Code-1.1-Flash w pełnej precyzji
SWE-Bench Verified — 500 zadań70,80%72,6%
Terminal-Bench 2.1 — 89 zadań66,29%62,9%

Microsoft opisał testy jako wykorzystujące kwantyzację mieszaną o około 3,3 bitu na wagę, dekodowanie spekulatywne DFlash2 z oknem przesuwnym oraz środowisko uruchomieniowe llama.cpp CUDA dla Windows ARM64. W tych wynikach lokalna wersja osiągnęła niższy rezultat w SWE-Bench Verified, a wyższy w Terminal-Bench 2.1.

Planowane opcje GitHub Copilot

Microsoft zapowiedział, że do końca października 2026 r. planuje eksperymentalnie dodać wybór modeli lokalnych do Copilot CLI, aplikacji Copilot i VS Code. Opisany tryb Auto ma kierować zapytania do modelu lokalnego lub chmurowego, a ręczny wybór pozwoli wskazać model lokalny.

Microsoft opisał też osobne ustawienia piaskownicy (sandboxa) dla poleceń wykonywanych przez agenta. Deweloperzy muszą je skonfigurować; samo lokalne uruchamianie modelu nie wyznacza granic jego dostępu do plików ani sieci.