Le débit rapporté pour DeepSeek V4.1-Flash atteint 494 tokens par seconde en génération de code sur quatre NVIDIA DGX Spark, avec 32 requêtes simultanées. Ce pic correspond à une charge concurrente, et non à une requête isolée.
Le pic rapporté de 494 tok/s correspond à 32 requêtes simultanées
Une requête simultanée est une demande traitée en même temps que d’autres. Le chiffre de 494 tok/s concerne donc un scénario où 32 requêtes de code sont traitées en parallèle sur les quatre systèmes ; il ne décrit pas le débit d’une seule requête.
Les autres débits varient selon la tâche et le nombre de requêtes
Les autres valeurs rapportées pour cette configuration distinguent la génération de texte en prose de celle de code, ainsi que les charges à 32 requêtes de celles à une seule requête.
| Tâche | Débit de sortie rapporté | Condition de requêtes indiquée |
| Code | 494 tok/s | 32 requêtes simultanées |
| Texte en prose | 280 tok/s | 32 requêtes simultanées |
| Code | Environ 96 tok/s | 1 requête |
| Texte en prose | Environ 58 tok/s | 1 requête |
Les spécifications officielles de DeepSeek V4.1-Flash
Dans son annonce officielle du 10 septembre 2026, DeepSeek décrit V4.1-Flash comme un modèle à mélange d’experts (MoE) de 552 milliards de paramètres. Selon l’entreprise, 8 milliards de paramètres sont actifs pour le traitement des entrées et 16 milliards pour la génération des sorties.
DeepSeek a également publié des scores d’évaluation distincts du débit en tokens par seconde : 90,6 à Terminal-Bench 2.1 et 74,2 à DeepSWE v1.1.
La configuration à quatre systèmes
La configuration associée au débit rapporté réunit quatre NVIDIA DGX Spark reliés en anneau QSFP sans commutateur. Chaque système est décrit avec 128 Go de mémoire unifiée, soit environ 512 Go agrégés pour l’ensemble. Une empreinte mémoire de 476 Go est également rapportée pour le modèle ; elle désigne une mesure distincte de la mémoire agrégée des systèmes.
Pour situer le matériel dans le contexte de l’IA locale, NeoTeo a déjà présenté le NVIDIA DGX Spark.