Le débit rapporté pour DeepSeek V4.1-Flash atteint 494 tokens par seconde en génération de code sur quatre NVIDIA DGX Spark, avec 32 requêtes simultanées. Ce pic correspond à une charge concurrente, et non à une requête isolée.

Le pic rapporté de 494 tok/s correspond à 32 requêtes simultanées

Une requête simultanée est une demande traitée en même temps que d’autres. Le chiffre de 494 tok/s concerne donc un scénario où 32 requêtes de code sont traitées en parallèle sur les quatre systèmes ; il ne décrit pas le débit d’une seule requête.

Les autres débits varient selon la tâche et le nombre de requêtes

Les autres valeurs rapportées pour cette configuration distinguent la génération de texte en prose de celle de code, ainsi que les charges à 32 requêtes de celles à une seule requête.

TâcheDébit de sortie rapportéCondition de requêtes indiquée
Code494 tok/s32 requêtes simultanées
Texte en prose280 tok/s32 requêtes simultanées
CodeEnviron 96 tok/s1 requête
Texte en proseEnviron 58 tok/s1 requête

Les spécifications officielles de DeepSeek V4.1-Flash

Dans son annonce officielle du 10 septembre 2026, DeepSeek décrit V4.1-Flash comme un modèle à mélange d’experts (MoE) de 552 milliards de paramètres. Selon l’entreprise, 8 milliards de paramètres sont actifs pour le traitement des entrées et 16 milliards pour la génération des sorties.

DeepSeek a également publié des scores d’évaluation distincts du débit en tokens par seconde : 90,6 à Terminal-Bench 2.1 et 74,2 à DeepSWE v1.1.

La configuration à quatre systèmes

La configuration associée au débit rapporté réunit quatre NVIDIA DGX Spark reliés en anneau QSFP sans commutateur. Chaque système est décrit avec 128 Go de mémoire unifiée, soit environ 512 Go agrégés pour l’ensemble. Une empreinte mémoire de 476 Go est également rapportée pour le modèle ; elle désigne une mesure distincte de la mémoire agrégée des systèmes.

Pour situer le matériel dans le contexte de l’IA locale, NeoTeo a déjà présenté le NVIDIA DGX Spark.