Un picco di 494 token al secondo per il codice è stato riportato per DeepSeek V4.1-Flash su quattro sistemi NVIDIA DGX Spark, con 32 richieste concorrenti. Il valore descrive il throughput del carico simultaneo, non la velocità di una singola richiesta.

Il dato riportato di 494 token al secondo

Quando più richieste sono concorrenti, il sistema le elabora nello stesso intervallo di tempo: il throughput esprime l’output complessivo del carico, non quello di una sola conversazione. È una distinzione importante per interpretare il picco riportato senza estenderlo a ogni attività o modalità d’uso.

Le altre velocità riportate

I valori indicati per la prosa e per una singola richiesta sono diversi da quelli ottenuti con 32 richieste concorrenti. La tabella mantiene insieme attività, velocità e condizione del carico.

AttivitàVelocità di output riportataCondizione delle richieste
Codice494 token/s32 richieste concorrenti
Prosa280 token/s32 richieste concorrenti
CodiceCirca 96 token/sUna richiesta
ProsaCirca 58 token/sUna richiesta

Le specifiche ufficiali di DeepSeek V4.1-Flash

Nell’annuncio del 10 settembre 2026, DeepSeek descrive V4.1-Flash come un modello Mixture of Experts (MoE) da 552 miliardi di parametri. La società indica 8 miliardi di parametri attivi per l’elaborazione dell’input e 16 miliardi per la generazione dell’output: i due valori si riferiscono a fasi diverse.

La configurazione riportata a quattro sistemi

La configurazione comprende quattro NVIDIA DGX Spark da 128 GB ciascuno, per circa 512 GB di memoria unificata aggregata. Il footprint di memoria attribuito al modello è di 476 GB: è un valore distinto dalla capacità aggregata dei quattro sistemi. I nodi sono collegati in un anello QSFP senza switch.

Per approfondire il sistema e l’inferenza locale, c’è la panoramica di NeoTeo su NVIDIA DGX Spark. L’esecuzione locale e l’uso via API sono modalità diverse; il tema dei prezzi dell’API di DeepSeek V4.1-Flash è trattato separatamente.