Ein am 5. Oktober 2026 veröffentlichter Bericht meldet für DeepSeek V4.1-Flash eine Spitzenrate von 494 tok/s bei der Code-Ausgabe auf vier NVIDIA DGX Spark. Der Wert gilt für 32 gleichzeitig laufende Anfragen. Für eine einzelne Code-Anfrage nennt derselbe Bericht rund 96 tok/s.

Gemeldete Ausgaberaten nach Aufgabe

Die Angaben unterscheiden zwischen Code und Prosa sowie zwischen 32 gleichzeitigen Anfragen und einer einzelnen Anfrage. „Gleichzeitig“ bezeichnet hier die Zahl der parallel laufenden Anfragen.

AufgabeGemeldete AusgaberateGleichzeitige Anfragen
Code494 tok/s32
Prosa280 tok/s32
Codeca. 96 tok/s1
Prosaca. 58 tok/s1

DeepSeek V4.1-Flash hat 552 Milliarden Parameter

DeepSeek beschreibt V4.1-Flash als Mixture-of-Experts-Modell (MoE) mit 552 Milliarden Parametern. Bei der Verarbeitung von Eingaben sind laut Unternehmen 8 Milliarden Parameter aktiv, bei der Ausgabe 16 Milliarden. Ein MoE-Modell verteilt Rechenarbeit auf verschiedene spezialisierte Teilnetze.

Vier Systeme mit gemeinsamem Speicher

Für den Viererverbund werden rund 512 GB gemeinsam nutzbarer Unified Memory angegeben. Der Modell-Footprint beträgt den Angaben zufolge 476 GB. Die vier Systeme waren in einem QSFP-Ring ohne Switch verbunden. NeoTeos Überblick zum NVIDIA DGX Spark bietet weitere Informationen zum System.