Um pico reportado de 494 tokens por segundo (tok/s) para geração de código com DeepSeek V4.1-Flash foi associado a 32 solicitações simultâneas em quatro sistemas NVIDIA DGX Spark. O relato foi publicado em 5 de outubro de 2026.
Tok/s indica a quantidade de tokens gerados por segundo. Com 32 solicitações em paralelo, a taxa descreve a saída sob concorrência; para uma solicitação, foram reportados valores próprios.
O pico de 494 tok/s em contexto
O resultado de 494 tok/s foi reportado para código, com 32 solicitações simultâneas. Para a geração de prosa na mesma condição, a taxa indicada foi de 280 tok/s. A diferença entre essas medidas e as de uma solicitação aparece na condição de uso, não apenas na tarefa.
Taxas de saída reportadas por tarefa
| Tarefa | Taxa de saída reportada | Condição de solicitações informada |
| Código | 494 tok/s | 32 simultâneas |
| Prosa | 280 tok/s | 32 simultâneas |
| Código | Cerca de 96 tok/s | 1 solicitação |
| Prosa | Cerca de 58 tok/s | 1 solicitação |
As taxas para uma solicitação foram reportadas separadamente das medições com 32 pedidos simultâneos. Para avaliar uma carga paralela, os valores de 494 tok/s para código e 280 tok/s para prosa são os que correspondem a essa condição.
O que DeepSeek informa sobre o V4.1-Flash
Na apresentação oficial do modelo, datada de 10 de setembro de 2026, DeepSeek descreve o V4.1-Flash como um modelo de mistura de especialistas (MoE) com 552 bilhões de parâmetros. A empresa informa que 8 bilhões de parâmetros são ativados no processamento de entrada e 16 bilhões na geração de saída.
A configuração com quatro sistemas
A configuração reportada usava quatro NVIDIA DGX Spark, cada um descrito com 128 GB de memória unificada. Juntos, os sistemas somavam cerca de 512 GB de memória unificada agregada; a memória ocupada pelo modelo foi reportada em 476 GB. A conexão entre os quatro sistemas foi descrita como um anel QSFP sem switch.
Para mais contexto sobre o equipamento em projetos de IA local, veja a apresentação do NVIDIA DGX Spark na NeoTeo.