Em 7 de outubro de 2026, a Microsoft anunciou que o MAI-Code-1.1-Flash, modelo de programação, pode ser baixado e executado localmente no Windows, sem cobrança de inferência por chamada local. A empresa também planejou opções experimentais de modelos locais no GitHub Copilot para o fim de outubro. O anúncio detalha um dos temas do encontro de Windows e IA que a NeoTeo já havia abordado em uma matéria anterior.

O modelo pode rodar localmente; o Copilot ficou para uma etapa experimental

A execução local significa que as chamadas ao modelo são processadas no próprio computador, em vez de depender de inferência na nuvem. A Microsoft afirma que não cobra por essas chamadas locais. Isso elimina a cobrança de inferência por chamada, mas não os gastos com o computador e a energia necessária para mantê-lo funcionando.

O MAI-Code-1.1-Flash é um modelo de programação do tipo mixture of experts, ou mistura de especialistas. Segundo a Microsoft, ele tem 137 bilhões de parâmetros no total, dos quais 6,8 bilhões são ativos. A versão quantizada para execução local ocupa 53 GB. A Microsoft descreve a disponibilidade do modelo em seu anúncio sobre o MAI-Code-1.1-Flash.

A demanda de memória do modelo local

Os três números de memória divulgados pela Microsoft descrevem medidas diferentes: o modelo quantizado ocupa 53 GB; o pico de uso de memória chega a 75,5 GB quando o contexto está em 256.000 tokens; e a empresa recomenda dispositivos com mais de 120 GB de RAM para melhor desempenho.

Um contexto de 256.000 tokens permite ao modelo considerar uma quantidade extensa de texto e código em uma interação. A recomendação de RAM é voltada ao desempenho, não equivale ao tamanho do arquivo do modelo nem ao pico medido naquela configuração.

Em sistemas com memória unificada, CPU e GPU compartilham a memória disponível. O sistema operacional, os aplicativos, o ambiente de execução e o cache também usam parte dela, então a capacidade total do dispositivo não fica toda reservada ao modelo. A Microsoft detalha essas medidas e condições em sua publicação técnica sobre modelos locais no Windows e no GitHub Copilot.

Os resultados de benchmark divulgados pela Microsoft

Em testes realizados em 5 de outubro de 2026, a Microsoft comparou a versão local quantizada do MAI-Code-1.1-Flash com a versão em precisão completa nos benchmarks abaixo. Os conjuntos tinham 500 tarefas no SWE-Bench Verified e 89 no Terminal-Bench 2.1.

Benchmark e tamanho do conjuntoMAI-Code-1.1-Flash quantizado no dispositivoMAI-Code-1.1-Flash em precisão completa
SWE-Bench Verified — 500 tarefas70,80%72,6%
Terminal-Bench 2.1 — 89 tarefas66,29%62,9%

A Microsoft informa que os testes usaram quantização de precisão mista, decodificação especulativa DFlash2 com janela deslizante e o runtime llama.cpp CUDA em Windows ARM64. A versão local teve pontuação menor no SWE-Bench Verified e maior no Terminal-Bench 2.1 do que a versão em precisão completa nos resultados divulgados pela empresa.

As opções planejadas para o GitHub Copilot

A Microsoft planejou disponibilizar opções experimentais de modelos locais no Copilot CLI, no aplicativo do Copilot e no VS Code até o fim de outubro de 2026. A proposta inclui o modo Auto, que encaminharia solicitações para inferência local ou na nuvem, e a seleção manual de um modelo local.

A Microsoft também descreveu controles de sandbox para comandos de agentes. Os desenvolvedores precisam configurá-los: a inferência local, por si só, não aplica esses limites à atividade do agente.