Een op 5 oktober gepubliceerd bericht beschreef een piek van 494 tokens per seconde (tok/s) voor code met DeepSeek V4.1-Flash op vier NVIDIA DGX Spark-systemen, bij 32 gelijktijdige verzoeken. Voor één codeverzoek werd circa 96 tok/s genoemd.
De gemelde 494 tok/s gold voor code
Gelijktijdige verzoeken zijn aanvragen die op hetzelfde moment worden verwerkt. De 494 tok/s hoort bij zo’n parallelle codebelasting. Het is een andere conditie dan de afzonderlijk genoemde snelheid voor één verzoek.
Andere gerapporteerde uitvoersnelheden
Voor dezelfde opstelling werden ook snelheden voor proza en voor afzonderlijke verzoeken genoemd:
| Taak | Gerapporteerde uitvoersnelheid | Verzoekconditie |
| Code | 494 tok/s | 32 gelijktijdige verzoeken |
| Proza | 280 tok/s | 32 gelijktijdige verzoeken |
| Code | circa 96 tok/s | Eén verzoek |
| Proza | circa 58 tok/s | Eén verzoek |
Wat DeepSeek over V4.1-Flash vermeldt
DeepSeek beschreef V4.1-Flash op 10 september 2026 als een mixture-of-expertsmodel met 552 miljard parameters. Volgens de officiële modelaankondiging zijn er 8 miljard parameters actief voor inputverwerking en 16 miljard voor outputgeneratie. Actieve parameters zijn het deel van het model dat bij de betreffende verwerking wordt ingezet.
Deze modelcijfers beschrijven de architectuur; de tok/s-waarden hierboven gaan over uitvoer in een specifieke opstelling en onder verschillende verzoekcondities.
De opstelling met vier systemen
De beschreven configuratie bestond uit vier NVIDIA DGX Spark-systemen, elk met 128 GB unified memory. Samen komt dat neer op circa 512 GB gezamenlijk geheugen. Daarnaast werd voor het model een geheugenvoetafdruk van 476 GB gemeld. De verbinding tussen de systemen werd beschreven als een switchloze QSFP-ring.
Voor achtergrond over NVIDIA DGX Spark en lokale AI is er een aparte uitleg. Wie DeepSeek V4.1-Flash via de API gebruikt, vindt aanvullende context in de uitleg over de API-prijsstelling.