A API do DeepSeek V4.1 Flash tem uma tabela global em dólares que torna o reaproveitamento de contexto decisivo: fora do horário de pico, 1 milhão de tokens de entrada em cache custa US$ 0,003, enquanto a mesma quantidade sem cache custa US$ 0,15. A saída custa US$ 0,60 por 1 milhão de tokens. A documentação oficial também informa que o serviço da API do DeepSeek V4 Pro continua após 14 de setembro de 2026, com o faturamento inalterado.
O preço oficial da API do DeepSeek V4.1 Flash
O identificador deepseek-flash atende o DeepSeek V4.1 Flash. A cobrança considera os tokens de entrada e de saída, separados entre entrada reutilizada em cache, entrada sem cache e texto gerado.
| Categoria de tokens | Fora do pico, por 1 milhão de tokens | No pico, por 1 milhão de tokens | Condição |
| Entrada com cache | US$ 0,003 | US$ 0,006 | Tokens de entrada reutilizados |
| Entrada sem cache | US$ 0,15 | US$ 0,30 | Tokens de entrada não reutilizados |
| Saída | US$ 0,60 | US$ 1,20 | Tokens gerados pelo modelo |
Os períodos de pico ocorrem das 01h às 04h e das 06h às 10h UTC, de segunda a sexta-feira. Todos os demais horários são considerados fora do pico, segundo a tabela da API.
A menor tarifa é a da entrada em cache fora do pico: US$ 0,003 por 1 milhão de tokens. Para colocar a escala em perspectiva, a entrada sem cache custa 50 vezes mais nessa mesma faixa de horário. A saída também é 200 vezes mais cara que a entrada em cache fora do pico.
Por que o cache pesa tanto para agentes
O cache guarda partes do contexto que já foram processadas. Em um agente que repete instruções, arquivos ou rastros de ferramentas, reaproveitar um prefixo elegível pode reduzir a parcela da conta destinada à entrada. O aplicativo precisa realmente reutilizar esse contexto para receber a tarifa de cache.
Em uma conta simples, 1 milhão de tokens de entrada em cache mais 1 milhão de tokens de saída custam US$ 0,603 fora do pico: US$ 0,003 + US$ 0,60. Se a entrada não for reutilizada, o mesmo volume chega a US$ 0,75: US$ 0,15 + US$ 0,60.
No horário de pico, essas combinações passam a US$ 1,206 com entrada em cache e US$ 1,50 sem cache. O horário e a proporção entre entrada e saída, portanto, importam tanto quanto o volume total de tokens.
O modelo por trás da tabela de preços
O DeepSeek V4.1 Flash é um modelo multimodal de Mixture of Experts (MoE). Seu backbone tem 552 bilhões de parâmetros, mas a documentação técnica informa que 8 bilhões ficam ativos por token durante o processamento da entrada e 16 bilhões durante a geração da resposta.
O modelo aceita texto e imagens como entrada e gera texto. Também oferece contexto de até 1 milhão de tokens, chamadas de ferramentas, saída em JSON, acesso pela Responses API e compatibilidade com a API no formato da Anthropic. O limite de concorrência informado para deepseek-flash é de 2.500.
A arquitetura descrita inclui 40 camadas, divididas entre 20 camadas de codificador causal e 20 de decodificador. O modelo também usa o mecanismo Compressed Sparse Attention 2 e a memória condicional Engram. A contagem de parâmetros ativos não define, por si só, requisitos universais de hardware, memória de vídeo, latência ou vazão.
Contexto longo e cache KV
O cache KV é uma memória intermediária usada durante o processamento da sequência. No DeepSeek V4.1 Flash, a documentação técnica informa um cache KV global de 890 bytes por token, além de descrever formatos comprimidos para esse armazenamento.
Esse número se relaciona ao desenho do modelo para contextos longos, mas não define o custo total de uma aplicação. A API cobra o volume efetivamente processado nas categorias de entrada e saída.
O cartão do modelo também informa saída máxima de 384 mil tokens e licença MIT para o repositório e os pesos.
O que muda para quem usava o V4 Pro
A documentação oficial da DeepSeek informa que o serviço da API do V4 Pro continua após 14 de setembro de 2026, com o método de cobrança inalterado. Isso substitui a informação anterior de que as solicitações seriam temporariamente encaminhadas ao V4.1 Flash.
Na prática, V4 Pro e V4.1 Flash permanecem como identificadores e serviços distintos na política apresentada. A data não representa o encerramento do serviço da API.
A DeepSeek também se reserva o direito de ajustar os preços. Por isso, a tabela publicada pela empresa é a referência para a tarifa vigente, enquanto o custo de uma aplicação depende do volume de tokens, do reaproveitamento de cache e do horário em que as chamadas são feitas.