Raportowany szczyt DeepSeek V4.1-Flash wynosi 494 tok/s dla generowania kodu na czterech systemach NVIDIA DGX Spark. Dotyczy 32 równoczesnych żądań — czyli pracy z wieloma żądaniami obsługiwanymi jednocześnie — a nie pojedynczej prośby o wygenerowanie odpowiedzi.
Raportowane 494 tokeny na sekundę
Wartość 494 tok/s opisuje szczytową przepustowość dla kodu przy 32 żądaniach. To ważny warunek: liczba mówi o wyniku w określonym obciążeniu, nie o szybkości pojedynczej odpowiedzi ani o każdej pracy modelu.
Pozostałe raportowane szybkości
Dla tekstu przy 32 równoczesnych żądaniach podano 280 tok/s. Przy pojedynczym żądaniu raportowane wartości są niższe: około 96 tok/s dla kodu i 58 tok/s dla tekstu.
| Zadanie | Raportowana szybkość wyjściowa | Warunek żądań |
| Kod | 494 tok/s | 32 równoczesne żądania |
| Tekst | 280 tok/s | 32 równoczesne żądania |
| Kod | około 96 tok/s | 1 żądanie |
| Tekst | około 58 tok/s | 1 żądanie |
Oficjalne parametry DeepSeek V4.1-Flash
DeepSeek opisuje V4.1-Flash jako model typu MoE (Mixture of Experts) o 552 mld parametrów. Według opublikowanej specyfikacji aktywuje 8 mld parametrów podczas przetwarzania wejścia i 16 mld podczas generowania odpowiedzi. Liczby te opisują architekturę modelu, a nie szybkość z testu na DGX Spark.
Raportowana konfiguracja czterech systemów
Cztery systemy NVIDIA DGX Spark miały łącznie około 512 GB pamięci zunifikowanej. Osobno podano 476 GB jako ślad pamięci modelu. Zestaw opisano jako połączony w pierścień QSFP bez przełącznika.