Se reportó un pico de 494 tokens por segundo (tok/s) al generar código con DeepSeek V4.1-Flash en cuatro sistemas NVIDIA DGX Spark y 32 solicitudes concurrentes. La concurrencia indica que el equipo atiende varias solicitudes a la vez, así que esa cifra describe la salida del conjunto bajo esa carga simultánea.
Qué miden las tasas reportadas
Las tasas comunicadas para el montaje varían según la tarea y el número de solicitudes:
| Tarea | Tasa de salida reportada | Condición de solicitudes indicada |
| Código | 494 tok/s | 32 solicitudes concurrentes |
| Prosa | 280 tok/s | 32 solicitudes concurrentes |
| Código | ≈96 tok/s | Una solicitud |
| Prosa | ≈58 tok/s | Una solicitud |
También se reportaron unos 4.764 tok/s al procesar prompts —las instrucciones de entrada— y alrededor de 0,2 segundos hasta el primer token con el sistema en reposo.
Qué especifica DeepSeek sobre V4.1-Flash
DeepSeek presentó V4.1-Flash el 10 de septiembre de 2026 como un modelo de mezcla de expertos (MoE) con 552.000 millones de parámetros. Según la descripción oficial del modelo, activa 8.000 millones de parámetros para procesar entradas y 16.000 millones para generar salidas. La cifra total describe el tamaño del modelo; las cifras activas se refieren a los parámetros usados en cada fase.
Memoria y conexión del montaje
El equipo se describió como cuatro sistemas con 128 GB de memoria unificada cada uno, unos 512 GB agregados en total. También se reportó una huella de memoria de 476 GB para el modelo. La conexión entre los sistemas se describió como un anillo QSFP sin switch.
Para más contexto sobre el equipo, consulta el artículo de NeoTeo sobre NVIDIA DGX Spark.