El 7 de octubre de 2026, Microsoft anunció que MAI-Code-1.1-Flash puede descargarse y ejecutarse localmente en Windows, sin pagar un cargo de inferencia por cada llamada. La versión cuantizada ocupa 53 GB y, con un contexto de 256.000 tokens, Microsoft midió un pico de memoria de 75,5 GB. La integración experimental en GitHub Copilot se anunció por separado, con opciones previstas para finales de octubre.
En la previa de NeoTeo sobre el encuentro de Windows e IA del 7 de octubre, la ejecución local aparecía como uno de los temas centrales. El nuevo anuncio concreta esa línea con un modelo de programación que Microsoft describe como disponible para uso local.
Microsoft anuncia la ejecución local de MAI-Code-1.1-Flash
MAI-Code-1.1-Flash es un modelo de programación con arquitectura de mezcla de expertos: cuenta con 137.000 millones de parámetros en total y 6.800 millones activos. Microsoft afirma que las llamadas al modelo ejecutado en local no tienen cargo de inferencia. Eso elimina ese coste por llamada, aunque el ordenador y la electricidad siguen formando parte del coste práctico.
La ejecución local y las opciones previstas para Copilot son dos vías distintas. Microsoft anunció la descarga y el uso local del modelo; para GitHub Copilot describió funciones experimentales que todavía tenía previsto ofrecer más adelante.
La memoria que exige el modelo local
Microsoft cifra en 53 GB el tamaño de la versión cuantizada, es decir, la que representa los parámetros con una precisión reducida para contener el modelo. Esa cifra corresponde al modelo; no es el máximo de memoria que puede utilizar al ejecutarse. Con un contexto de 256.000 tokens —la cantidad de texto y código que el modelo puede tener en cuenta a la vez—, Microsoft registró un pico de uso de memoria de 75,5 GB.
Para obtener el mejor rendimiento, Microsoft recomienda un dispositivo con más de 120 GB de RAM. La recomendación se refiere a la memoria del sistema. En equipos con memoria unificada, la CPU y la GPU comparten esa capacidad, que también necesitan el sistema operativo, las aplicaciones, el entorno de ejecución y la caché. Por eso, la cifra de memoria del modelo no equivale a toda la memoria disponible para el resto del equipo.
Los resultados de rendimiento comunicados por Microsoft
En pruebas realizadas el 5 de octubre de 2026, Microsoft comparó la versión local cuantizada con MAI-Code-1.1-Flash de precisión completa. La empresa indicó que utilizó cuantización de precisión mixta, decodificación especulativa DFlash2 de ventana deslizante y un entorno llama.cpp CUDA para Windows ARM64.
| Prueba y tamaño del conjunto | MAI-Code-1.1-Flash cuantizado en local | MAI-Code-1.1-Flash de precisión completa |
| SWE-Bench Verified (500 tareas) | 70,80 % | 72,6 % |
| Terminal-Bench 2.1 (89 tareas) | 66,29 % | 62,9 % |
Las cifras son resultados comunicados por Microsoft. En estos dos conjuntos, la versión local obtuvo una puntuación inferior a la de precisión completa en SWE-Bench Verified y superior en Terminal-Bench 2.1. Microsoft advierte que el rendimiento real varía según el dispositivo, la configuración y otros factores.
Las opciones previstas para GitHub Copilot
Microsoft anunció opciones experimentales de modelos locales para GitHub Copilot CLI, la aplicación de Copilot y VS Code, con el objetivo de incorporarlas antes de que terminara octubre de 2026. La propuesta incluía un modo Auto, que enrutaría las solicitudes entre la inferencia local y la nube, y una selección manual de modelos locales.
Microsoft también describió controles de sandbox para limitar la actividad de los comandos de agentes. El desarrollador debe configurar esos controles por separado: ejecutar el modelo en local no los activa por sí solo.