Een op 5 oktober gepubliceerd bericht beschreef een piek van 494 tokens per seconde (tok/s) voor code met DeepSeek V4.1-Flash op vier NVIDIA DGX Spark-systemen, bij 32 gelijktijdige verzoeken. Voor één codeverzoek werd circa 96 tok/s genoemd.

De gemelde 494 tok/s gold voor code

Gelijktijdige verzoeken zijn aanvragen die op hetzelfde moment worden verwerkt. De 494 tok/s hoort bij zo’n parallelle codebelasting. Het is een andere conditie dan de afzonderlijk genoemde snelheid voor één verzoek.

Andere gerapporteerde uitvoersnelheden

Voor dezelfde opstelling werden ook snelheden voor proza en voor afzonderlijke verzoeken genoemd:

TaakGerapporteerde uitvoersnelheidVerzoekconditie
Code494 tok/s32 gelijktijdige verzoeken
Proza280 tok/s32 gelijktijdige verzoeken
Codecirca 96 tok/sEén verzoek
Prozacirca 58 tok/sEén verzoek

Wat DeepSeek over V4.1-Flash vermeldt

DeepSeek beschreef V4.1-Flash op 10 september 2026 als een mixture-of-expertsmodel met 552 miljard parameters. Volgens de officiële modelaankondiging zijn er 8 miljard parameters actief voor inputverwerking en 16 miljard voor outputgeneratie. Actieve parameters zijn het deel van het model dat bij de betreffende verwerking wordt ingezet.

Deze modelcijfers beschrijven de architectuur; de tok/s-waarden hierboven gaan over uitvoer in een specifieke opstelling en onder verschillende verzoekcondities.

De opstelling met vier systemen

De beschreven configuratie bestond uit vier NVIDIA DGX Spark-systemen, elk met 128 GB unified memory. Samen komt dat neer op circa 512 GB gezamenlijk geheugen. Daarnaast werd voor het model een geheugenvoetafdruk van 476 GB gemeld. De verbinding tussen de systemen werd beschreven als een switchloze QSFP-ring.

Voor achtergrond over NVIDIA DGX Spark en lokale AI is er een aparte uitleg. Wie DeepSeek V4.1-Flash via de API gebruikt, vindt aanvullende context in de uitleg over de API-prijsstelling.