DeepSeek V4.1 Flash llegó el 10 de septiembre de 2026 como un modelo multimodal de tipo mixture-of-experts (MoE), con pesos publicados bajo licencia MIT, entrada de texto e imágenes y una ventana de contexto de hasta un millón de tokens. Su apuesta técnica no consiste simplemente en hacer crecer el modelo: busca que una arquitectura de 552.000 millones de parámetros procese cada fase de forma selectiva y use menos caché para las cargas largas y los agentes.
Eso lo vuelve interesante para APIs, programación y tareas con mucho contexto. Pero hay que separar tres cosas que suelen acabar mezcladas en los titulares: las especificaciones del modelo, los resultados de cada benchmark y lo que exige ejecutarlo localmente.
Qué es DeepSeek V4.1 Flash
DeepSeek V4.1 Flash es un modelo multimodal MoE que acepta texto e imágenes y genera texto. Su contexto máximo alcanza 1.000.000 de tokens, una cifra pensada para conversaciones, documentos y flujos de agentes especialmente extensos.
Los pesos están disponibles en Hugging Face con licencia MIT. Eso facilita la descarga y el autoalojamiento desde el punto de vista de la licencia, pero no convierte el modelo en una aplicación ligera para cualquier ordenador.
Para quienes trabajan con la API, el identificador oficial es deepseek-flash. DeepSeek también anunció que las solicitudes dirigidas a deepseek-v4-pro pasarían a V4.1 Flash a partir del 14 de septiembre de 2026 y hasta la llegada de V4.1 Pro. Ese anuncio afecta al nombre del modelo que se solicita y a la facturación asociada, así que conviene tratarlo como una política anunciada, no como una garantía sobre cada integración.
En España, la tarifa disponible para la API es global y está expresada en dólares estadounidenses. No hay una tarifa específica en euros, un minorista español ni una fecha de disponibilidad local asociados al lanzamiento.
552.000 millones de parámetros no significa que todos trabajen a la vez
La cifra de 552.000 millones describe la capacidad total del backbone. V4.1 Flash activa aproximadamente 8.000 millones de parámetros durante el procesamiento de entrada y 16.000 millones durante la generación. Son cantidades distintas: los parámetros activos por token no equivalen al tamaño total de los pesos ni determinan por sí solos la memoria necesaria para ejecutar el modelo.
La arquitectura es un Causal Encoder-Decoder de 40 capas, dividido en 20 capas de codificador causal y 20 de decodificador. También incorpora una mezcla de expertos con un experto compartido y 384 expertos direccionados por capa MoE; seis expertos direccionados se activan por token. La idea es concentrar el trabajo en una parte del sistema en cada paso, en lugar de tratar todo el modelo como un bloque inseparable.
La arquitectura incluye además CSA2, DSpark y Engram. En términos prácticos, son piezas que DeepSeek integra para gestionar atención dispersa, decodificación especulativa y memoria condicional. No hace falta memorizar las siglas para entender la consecuencia: el diseño intenta reducir el coste de servir un modelo enorme sin reducirlo a una cifra engañosa de parámetros activos.
La caché KV y el contexto de un millón de tokens
La caché KV —la memoria que conserva claves y valores de la atención para no recalcular todo el contexto en cada paso— ocupa aproximadamente 890 bytes por token en la medida global comunicada para V4.1 Flash. DeepSeek V4 Flash registraba 3.514 bytes por token en esa comparación.
La reducción importa sobre todo cuando el contexto crece. Un agente que mantiene instrucciones, herramientas, resultados y documentos durante muchas interacciones presiona la memoria de forma distinta a una pregunta breve. Una caché más compacta puede aliviar ese coste de servicio; no significa que el modelo completo pese 890 bytes por token ni que el ordenador del usuario necesite únicamente esa cantidad.
El contexto máximo de un millón de tokens y la caché compacta apuntan al mismo problema: mantener sesiones largas sin que cada nuevo fragmento obligue a pagar una factura desproporcionada en memoria y latencia. La arquitectura, eso sí, no elimina el tamaño de los pesos ni garantiza el mismo comportamiento en todos los proveedores.
Los benchmarks necesitan apellido
DeepSeek publica resultados muy altos en varias pruebas con el máximo nivel de razonamiento. Entre ellos aparecen 90,6 en Terminal-Bench 2.1, 88,1 en CyberGym y 74,2 en DeepSWE v1.1. Son datos útiles para saber en qué tareas quiere competir el modelo, pero cada cifra pertenece a su propio conjunto de pruebas, configuración y arnés.
La misma tabla muestra una imagen menos uniforme: en Terminal-Bench 4.0, V4.1 Flash obtiene 31,2, frente a 39,9 de GPT-5.6 Sol y 51,8 de Claude Opus 5. No hay una clasificación única que convierta esos números en una respuesta válida para programación, agentes, razonamiento y visión al mismo tiempo.
Artificial Analysis sitúa la configuración de máximo razonamiento en 39,5 puntos de su Intelligence Index, con una velocidad mediana de salida de 206,3 tokens por segundo y 1,13 segundos hasta el primer fragmento. Son mediciones realizadas con otra metodología y otros proveedores, por lo que sirven como referencia independiente, no como una prueba de superioridad universal.
| Modelo | Parámetros totales | Parámetros activos | Contexto | Terminal-Bench 2.1 | CyberGym | DeepSWE v1.1 | Terminal-Bench 4.0 | Velocidad de salida según Artificial Analysis |
| DeepSeek V4.1 Flash | 552B | 8B entrada / 16B salida | Hasta 1.000.000 de tokens | 90,6 | 88,1 | 74,2 | 31,2 | 206,3 tokens/s |
| DeepSeek V4 Pro 0813 | 1,6T | 49B | — | 87,9 | 83,3 | 62,7 | 12,4 | 72,3 tokens/s |
| GPT-5.6 Sol | No divulgado | No divulgado | — | 88,8 | 84,5 | 73,0 | 39,9 | 111,9 tokens/s |
| Claude Opus 5 | No divulgado | No divulgado | — | 89,1 | — | 74,0 | 51,8 | 65,8 tokens/s |
Las puntuaciones de la tabla no son intercambiables: DeepSeek usa sus propios arneses y el máximo esfuerzo de razonamiento en la comparación oficial, mientras que Artificial Analysis emplea su propia batería y metodología para la velocidad. La lectura sensata es más modesta y más útil: V4.1 Flash parece especialmente competitivo en algunas pruebas de programación, ciberseguridad y agentes, pero el resultado depende del trabajo concreto.
El siguiente vídeo añade una prueba de programación de 24 prompts con ejecuciones repetidas para tener en cuenta la variación entre respuestas. Sus resultados pertenecen a la metodología de su propio leaderboard y no sustituyen a una medición general del modelo.
Precios de API y desvío de V4 Pro
La API de DeepSeek separa las tarifas por entrada con caché, entrada sin caché y salida, y además distingue entre periodos punta y valle. Esa estructura es importante para calcular el coste real: dos aplicaciones que envíen el mismo número total de tokens pueden pagar cantidades distintas si cambia la reutilización de la caché, el volumen de salida o la franja de uso.
En España no hay una conversión oficial específica a euros en los datos disponibles. Por tanto, el coste que debe mirar un equipo español es el de la tabla global en USD y sus condiciones de facturación, no una cifra redondeada en euros que dé una falsa sensación de precisión.
El cambio anunciado para V4 Pro tiene otra consecuencia práctica. Si una aplicación sigue llamando a un identificador antiguo, la ruta servida puede no coincidir con lo que el nombre parece prometer durante ese periodo de transición. Para evaluar el comportamiento de un agente, hay que considerar el identificador utilizado, la tarifa aplicable y el nivel de razonamiento, no solo el nombre comercial.
Pesos abiertos, pero no hardware sencillo
La licencia MIT abre la puerta al autoalojamiento, pero el tamaño total del modelo sigue siendo el dato incómodo. Una demostración de despliegue local utilizó cuatro NVIDIA DGX Spark, almacenamiento SSD para descargar parte de la carga y una configuración distribuida. En esa instalación concreta se observaron aproximadamente 70 tokens por segundo en programación y 54 tokens por segundo en un arnés de agentes.
Esas cifras describen esa configuración, no un mínimo universal ni el rendimiento de la API. También hay una diferencia fundamental entre activar 8.000 o 16.000 millones de parámetros por token y almacenar los 552.000 millones del modelo: una cifra explica el trabajo de cada paso; la otra condiciona el tamaño de los pesos y la infraestructura.
Por eso, la pregunta «¿funciona en un equipo local de 256 GB?» no tiene una respuesta universal con estos datos. La viabilidad depende de la cuantización, el offloading, el ancho de banda de memoria y el entorno de ejecución. La demostración con cuatro NVIDIA DGX Spark deja clara la dirección del problema: los pesos abiertos permiten experimentar, pero no prometen una instalación doméstica sencilla.
Para quién tiene sentido V4.1 Flash
V4.1 Flash resulta especialmente atractivo para tres perfiles:
- Equipos que construyen agentes, porque el contexto largo y la reducción de la caché atacan un coste relevante en sesiones extensas.
- Desarrolladores que usan la API, porque pueden elegir entre entrada con caché, entrada sin caché y salida, además de tener en cuenta las franjas punta y valle.
- Investigadores y aficionados al autoalojamiento, porque los pesos MIT permiten estudiar y desplegar el modelo, siempre que dispongan de una infraestructura acorde con su tamaño.
Para una aplicación de programación sencilla, un benchmark llamativo no basta para decidir. Conviene comprobar el modelo con los prompts reales, medir varias ejecuciones y separar el rendimiento del proveedor, la latencia y la tarifa del comportamiento del modelo. En IA, el apellido del benchmark suele ser más importante que el titular.
La novedad de DeepSeek V4.1 Flash está en esa combinación poco habitual: un modelo gigantesco, activación asimétrica, contexto de hasta un millón de tokens y una caché KV mucho más compacta. Sus resultados son sólidos en pruebas concretas y sus pesos son abiertos, pero la eficiencia de servicio no convierte automáticamente el modelo en un ganador universal ni en una opción local barata. Para los usuarios españoles, la decisión práctica pasa por la API global en USD o por contar con una infraestructura propia considerable. Ahí está el verdadero coste de la promesa.