Un picco di 494 token al secondo per il codice è stato riportato per DeepSeek V4.1-Flash su quattro sistemi NVIDIA DGX Spark, con 32 richieste concorrenti. Il valore descrive il throughput del carico simultaneo, non la velocità di una singola richiesta.
Il dato riportato di 494 token al secondo
Quando più richieste sono concorrenti, il sistema le elabora nello stesso intervallo di tempo: il throughput esprime l’output complessivo del carico, non quello di una sola conversazione. È una distinzione importante per interpretare il picco riportato senza estenderlo a ogni attività o modalità d’uso.
Le altre velocità riportate
I valori indicati per la prosa e per una singola richiesta sono diversi da quelli ottenuti con 32 richieste concorrenti. La tabella mantiene insieme attività, velocità e condizione del carico.
| Attività | Velocità di output riportata | Condizione delle richieste |
| Codice | 494 token/s | 32 richieste concorrenti |
| Prosa | 280 token/s | 32 richieste concorrenti |
| Codice | Circa 96 token/s | Una richiesta |
| Prosa | Circa 58 token/s | Una richiesta |
Le specifiche ufficiali di DeepSeek V4.1-Flash
Nell’annuncio del 10 settembre 2026, DeepSeek descrive V4.1-Flash come un modello Mixture of Experts (MoE) da 552 miliardi di parametri. La società indica 8 miliardi di parametri attivi per l’elaborazione dell’input e 16 miliardi per la generazione dell’output: i due valori si riferiscono a fasi diverse.
La configurazione riportata a quattro sistemi
La configurazione comprende quattro NVIDIA DGX Spark da 128 GB ciascuno, per circa 512 GB di memoria unificata aggregata. Il footprint di memoria attribuito al modello è di 476 GB: è un valore distinto dalla capacità aggregata dei quattro sistemi. I nodi sono collegati in un anello QSFP senza switch.
Per approfondire il sistema e l’inferenza locale, c’è la panoramica di NeoTeo su NVIDIA DGX Spark. L’esecuzione locale e l’uso via API sono modalità diverse; il tema dei prezzi dell’API di DeepSeek V4.1-Flash è trattato separatamente.