Le 7 octobre 2026, Microsoft a annoncé que MAI-Code-1.1-Flash pouvait être téléchargé et exécuté localement sous Windows, sans frais d’inférence par appel local. Mais le modèle quantifié occupe 53 Go et Microsoft rapporte un pic d’utilisation mémoire de 75,5 Go avec un contexte de 256 000 tokens. Les options expérimentales dans GitHub Copilot, elles, étaient prévues pour la fin du mois.

Nous avions présenté le contexte dans notre aperçu de l’événement Windows prévu le 7 octobre.

Microsoft annonce l’exécution locale de MAI-Code-1.1-Flash

Microsoft présente MAI-Code-1.1-Flash comme un modèle de programmation à mélange d’experts : cette architecture active une partie des paramètres pour produire chaque réponse. Le modèle compte 137 milliards de paramètres au total, dont 6,8 milliards actifs, selon les précisions techniques de Microsoft.

L’exécution locale évite les frais d’inférence facturés par appel. Elle ne supprime pas le coût du matériel ni celui de l’électricité : le modèle réclame beaucoup de mémoire pour fonctionner.

La mémoire nécessaire au modèle local

Microsoft donne trois chiffres distincts : une taille de 53 Go pour le modèle quantifié, un pic d’utilisation mémoire de 75,5 Go à la fenêtre de contexte maximale de 256 000 tokens, et une recommandation de plus de 120 Go de RAM pour obtenir les meilleures performances.

La quantification réduit la taille des paramètres pour faciliter l’exécution du modèle. Mais la mémoire disponible ne sert pas uniquement à les stocker : le système, les applications, le moteur d’inférence et le cache en utilisent également. Microsoft précise que la mémoire unifiée est partagée entre le processeur et le processeur graphique. La recommandation de RAM donne donc une indication plus utile que la seule taille du fichier du modèle.

Les résultats de benchmark rapportés par Microsoft

Microsoft indique avoir réalisé ses tests le 5 octobre 2026. Pour la version locale, sa configuration associait une quantification en précision mixte, le décodage spéculatif DFlash2 à fenêtre glissante et un environnement llama.cpp CUDA sous Windows ARM64. Les deux benchmarks portent sur des tâches différentes : 500 pour SWE-Bench Verified et 89 pour Terminal-Bench 2.1.

Benchmark et taille du jeu de tâchesMAI-Code-1.1-Flash quantifié en localMAI-Code-1.1-Flash pleine précision
SWE-Bench Verified — 500 tâches70,80 %72,6 %
Terminal-Bench 2.1 — 89 tâches66,29 %62,9 %

Dans le tableau publié par Microsoft, la version locale obtient un score inférieur à la version pleine précision sur SWE-Bench Verified, mais supérieur sur Terminal-Bench 2.1. Microsoft indique que les performances réelles peuvent varier selon l’appareil et sa configuration.

Les options GitHub Copilot annoncées

Le 7 octobre, Microsoft a également annoncé des options expérimentales de modèle local dans GitHub Copilot CLI, l’application Copilot et VS Code, prévues pour la fin octobre 2026. Le mode Auto devait pouvoir répartir les requêtes entre un modèle local et un modèle dans le cloud ; une sélection manuelle du modèle local était aussi prévue.

Microsoft décrit séparément des contrôles d’isolation pour les commandes de l’agent et précise que les développeurs doivent les configurer. L’exécution locale du modèle n’active pas, à elle seule, ces limites pour les activités de l’agent.