Ein am 5. Oktober 2026 veröffentlichter Bericht meldet für DeepSeek V4.1-Flash eine Spitzenrate von 494 tok/s bei der Code-Ausgabe auf vier NVIDIA DGX Spark. Der Wert gilt für 32 gleichzeitig laufende Anfragen. Für eine einzelne Code-Anfrage nennt derselbe Bericht rund 96 tok/s.
Gemeldete Ausgaberaten nach Aufgabe
Die Angaben unterscheiden zwischen Code und Prosa sowie zwischen 32 gleichzeitigen Anfragen und einer einzelnen Anfrage. „Gleichzeitig“ bezeichnet hier die Zahl der parallel laufenden Anfragen.
| Aufgabe | Gemeldete Ausgaberate | Gleichzeitige Anfragen |
| Code | 494 tok/s | 32 |
| Prosa | 280 tok/s | 32 |
| Code | ca. 96 tok/s | 1 |
| Prosa | ca. 58 tok/s | 1 |
DeepSeek V4.1-Flash hat 552 Milliarden Parameter
DeepSeek beschreibt V4.1-Flash als Mixture-of-Experts-Modell (MoE) mit 552 Milliarden Parametern. Bei der Verarbeitung von Eingaben sind laut Unternehmen 8 Milliarden Parameter aktiv, bei der Ausgabe 16 Milliarden. Ein MoE-Modell verteilt Rechenarbeit auf verschiedene spezialisierte Teilnetze.
Vier Systeme mit gemeinsamem Speicher
Für den Viererverbund werden rund 512 GB gemeinsam nutzbarer Unified Memory angegeben. Der Modell-Footprint beträgt den Angaben zufolge 476 GB. Die vier Systeme waren in einem QSFP-Ring ohne Switch verbunden. NeoTeos Überblick zum NVIDIA DGX Spark bietet weitere Informationen zum System.