Lançado pela DeepSeek em 10 de setembro de 2026, o DeepSeek V4.1 Flash é um modelo multimodal de pesos abertos que recebe texto e imagens, gera texto e trabalha com uma janela de contexto de até 1 milhão de tokens. O ponto central não é uma promessa de vencer todos os concorrentes: é a tentativa de servir um modelo enorme ativando apenas parte dele a cada etapa e comprimindo a memória necessária para contextos longos e agentes.

Para leitores no Brasil, a API usa preços globais em USD por 1 milhão de tokens. Não há uma tarifa específica em reais, varejista brasileiro ou data local de disponibilidade indicada para o modelo.

O que é o DeepSeek V4.1 Flash

O V4.1 Flash é um modelo de linguagem multimodal baseado em Mixture of Experts (MoE). Nesse tipo de arquitetura, o sistema mantém muitos especialistas, mas seleciona apenas alguns para cada token processado. Os pesos estão disponíveis no Hugging Face sob licença MIT, o que permite estudar e hospedar o modelo dentro dos termos dessa licença.

O identificador oficial da API é deepseek-flash. A DeepSeek também anunciou que solicitações enviadas ao identificador do V4 Pro seriam encaminhadas ao V4.1 Flash a partir de 14 de setembro de 2026, até o lançamento do V4.1 Pro. Essa é uma mudança anunciada para o funcionamento dos endpoints, não uma nova versão do modelo.

O modelo aceita texto e imagem como entrada, mas sua saída é textual. O contexto de 1 milhão de tokens é especialmente relevante para documentos extensos, bases de código e fluxos de agentes que precisam manter muitas informações na mesma sessão.

Por que 552 bilhões não significa ativar tudo ao mesmo tempo

O DeepSeek V4.1 Flash tem 552 bilhões de parâmetros em seu backbone. Esse número representa a capacidade total do modelo, não a quantidade processada simultaneamente em cada token.

Durante o processamento da entrada, aproximadamente 8 bilhões de parâmetros ficam ativos por token. Na decodificação — a etapa em que o modelo gera a resposta — são aproximadamente 16 bilhões por token. Essa ativação assimétrica é uma das escolhas técnicas que diferenciam o modelo: entrada e saída não exigem exatamente o mesmo caminho computacional.

A arquitetura é um Causal Encoder-Decoder de 40 camadas, dividido entre um codificador causal e um decodificador. Ela também combina atenção esparsa comprimida, geração especulativa DSpark e a memória condicional Engram. Em termos práticos, a ideia é reduzir trabalho repetido em tarefas longas sem reduzir o modelo a uma contagem simplista de parâmetros ativos.

Ativar 8 bilhões ou 16 bilhões por token também não transforma automaticamente o modelo em uma aplicação leve para qualquer computador. O armazenamento dos pesos, a quantização, o offloading, a largura de banda da memória e o runtime continuam afetando a implantação local.

Cache KV e contexto de 1 milhão de tokens

DeepSeek V4.1 Flash chega com contexto de 1 milhão de tokens e cache KV de 890 bytes

O cache KV guarda informações intermediárias já calculadas durante uma sessão. Em vez de refazer todo o processamento a cada novo token, o sistema reutiliza parte desse estado. Quanto maior o contexto, mais importante se torna controlar esse consumo de memória.

No V4.1 Flash, o cache KV global é informado em aproximadamente 890 bytes por token. A DeepSeek também descreve uma redução para cerca de um quarto do HBM e um oitavo do armazenamento SSD usado pelo modelo anterior em sua configuração comparada.

Essa é a razão técnica para o nome “Flash” ser mais interessante do que uma simples etiqueta de velocidade: a proposta mira o custo de servir contextos longos e cargas de trabalho com agentes. Ainda assim, eficiência de cache não equivale a baixo requisito de memória total. O modelo continua tendo 552 bilhões de parâmetros no backbone.

O que os benchmarks realmente mostram

Benchmark de programação com 24 prompts e análise de variação entre execuções do DeepSeek V4.1 Flash.

Os resultados da DeepSeek incluem avaliações de programação, cibersegurança, matemática e agentes. No maior nível de esforço de raciocínio, o V4.1 Flash aparece com 74,2 no DeepSWE v1.1, 88,1 no CyberGym, 90,6 no Terminal-Bench 2.1 e 31,2 no Terminal-Bench 4.0.

Esses números respondem a perguntas específicas. No Terminal-Bench 4.0, por exemplo, o resultado informado para o V4.1 Flash fica abaixo de 39,9 do GPT-5.6 Sol e 51,8 do Claude Opus 5 na tabela comparativa apresentada. Portanto, uma boa pontuação em programação ou segurança não autoriza concluir que o modelo seja melhor em todas as tarefas.

MétricaDeepSeek V4.1 FlashDeepSeek V4 Pro 0813GPT-5.6 SolClaude Opus 5
Parâmetros totais552B1,6T
Parâmetros ativos8B na entrada / 16B na saída49B
Terminal-Bench 2.190,687,988,889,1
CyberGym88,183,384,5
DeepSWE v1.174,262,773,074,0
Terminal-Bench 4.031,212,439,951,8
Velocidade de saída segundo a metodologia da Artificial Analysis206,3 tokens/s72,3 tokens/s111,9 tokens/s65,8 tokens/s

A Artificial Analysis informa, em sua própria metodologia, índice de inteligência de 39,5, velocidade mediana de saída de 206,3 tokens por segundo e 1,13 segundo até o primeiro bloco. Esses valores são uma avaliação independente com condições próprias; não são uma classificação universal de todos os modelos.

Um benchmark de programação com 24 prompts também repetiu execuções para observar a variação entre respostas. Esse tipo de procedimento é útil porque uma única rodada pode esconder oscilações de qualidade. O resultado, porém, continua pertencendo ao conjunto de prompts, configurações e critérios daquele ranking.

Preços da API e roteamento do V4 Pro

A estrutura da API separa tokens de entrada armazenados em cache, tokens de entrada sem cache e tokens de saída. Também há períodos de pico e fora de pico. Por isso, o custo final depende da quantidade de cada categoria e do horário de uso — não apenas do nome do modelo.

A cobrança global é apresentada em USD por 1 milhão de tokens, sem tarifa específica em BRL indicada para o Brasil. Para equipes que usam agentes de programação, a diferença entre entrada com cache, entrada sem cache e saída pode alterar bastante a conta, especialmente em sessões longas.

A DeepSeek anunciou ainda o roteamento de solicitações do V4 Pro para o V4.1 Flash a partir de 14 de setembro de 2026, até a chegada do V4.1 Pro. O que isso muda na prática é o modelo atendendo determinadas solicitações por trás de um identificador associado ao V4 Pro; a política anunciada não deve ser confundida com uma prova de superioridade geral do Flash.

Pesos abertos, hardware local e o grande porém

Implantação local do DeepSeek V4.1 Flash em quatro NVIDIA DGX Sparks, com offloading para SSD e medições específicas de throughput.

Ter pesos sob licença MIT facilita o acesso ao modelo, mas não significa que ele rode confortavelmente em um desktop comum. Uma demonstração de implantação local usou quatro NVIDIA DGX Sparks, offloading para SSD e uma configuração distribuída.

Nessa configuração específica, a execução ficou em aproximadamente 70 tokens por segundo em tarefas de programação e 54 tokens por segundo em tarefas com agentes. Esses números descrevem aquele conjunto de hardware, software e carga de trabalho; não são uma velocidade garantida para a API nem um requisito mínimo universal.

A pergunta sobre uma máquina local com 256 GB de memória não tem uma resposta única baseada nesses dados. A viabilidade depende da quantização, do offloading, da largura de banda e do runtime. O que a demonstração deixa claro é o tamanho do desafio: a ativação seletiva reduz o trabalho por token, mas não elimina o peso total do modelo.

Para quem o V4.1 Flash faz sentido

O modelo merece atenção de quem trabalha com agentes de programação, análise de código, tarefas de cibersegurança, compreensão de imagens e documentos muito extensos. O contexto de 1 milhão de tokens e o cache KV reduzido podem ser mais importantes para esses usos do que uma posição isolada em um ranking.

Para equipes que consomem a API, o ponto decisivo é medir o próprio padrão de uso: proporção entre entrada e saída, reaproveitamento de cache, horário de pico e tipo de tarefa. Para quem quer rodar localmente, os pesos abertos são uma oportunidade de experimentação, não uma promessa de execução simples em hardware doméstico.

O DeepSeek V4.1 Flash importa porque tenta conciliar escala, ativação seletiva e memória comprimida. Seus benchmarks mostram força em avaliações concretas, enquanto as medições práticas lembram que desempenho depende do ambiente. Para o leitor brasileiro, a decisão começa por duas perguntas bem menos glamourosas — mas muito mais úteis: quanto contexto seu trabalho realmente exige e quanto hardware ou consumo de API você está disposto a pagar.