La API de DeepSeek V4.1 Flash cobra 0,003 dólares por cada millón de tokens de entrada con caché durante el horario valle. La entrada sin caché cuesta 0,15 dólares y la salida, 0,60 dólares por el mismo volumen. En las horas punta, las tres tarifas se duplican. Para agentes que repiten instrucciones, documentos o trazas de herramientas, reutilizar el contexto puede importar más que el precio nominal del modelo.

La documentación de DeepSeek indicó que el servicio API de V4 Pro continuaría después del 14 de septiembre de 2026, con la facturación sin cambios.

La tarifa de DeepSeek V4.1 Flash, al detalle

El identificador API asociado al modelo es deepseek-flash. DeepSeek publica una tarifa global en dólares estadounidenses por millón de tokens, separada entre entrada almacenada en caché, entrada sin caché y tokens generados.

Categoría de tokensHorario valleHorario puntaCondición
Entrada con caché0,003 $ por millón0,006 $ por millónTokens de entrada reutilizados
Entrada sin caché0,15 $ por millón0,30 $ por millónTokens de entrada no reutilizados
Salida0,60 $ por millón1,20 $ por millónTokens generados

Las horas punta son de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. El resto del tiempo se considera valle.

En horario valle, un millón de tokens de entrada con caché más un millón de tokens de salida suman 0,603 dólares. Si esa entrada se factura como no almacenada en caché, el total asciende a 0,75 dólares. En horario punta, los totales equivalentes son 1,206 y 1,50 dólares.

Por qué la caché cambia la cuenta de los agentes

La diferencia principal está entre los 0,003 dólares de la entrada con caché y los 0,15 dólares de la entrada sin caché: 50 veces más por el mismo millón de tokens durante el horario valle. La entrada reutilizada también cuesta 200 veces menos que la salida, cuyo precio es de 0,60 dólares por millón.

En un agente, el prefijo repetido puede incluir instrucciones del sistema, documentación, archivos y resultados de herramientas. Cuando ese contexto vuelve a enviarse de forma elegible para la caché, la tarifa de entrada es mucho menor. La aplicación debe reutilizar realmente ese contexto: enviar contenido nuevo no convierte la entrada en una consulta con caché.

Por eso, calcular el coste solo a partir del número total de tokens puede llevar a una cuenta equivocada. También importan la proporción entre entrada y salida, la reutilización del contexto y la franja horaria en la que se procesa cada solicitud. DeepSeek advierte además de que puede modificar sus precios.

El modelo que hay detrás de la tarifa

DeepSeek V4.1 Flash es un modelo multimodal de tipo Mixture of Experts (MoE): acepta texto e imágenes y genera texto. Su contexto máximo llega a un millón de tokens, y la API ofrece llamadas a herramientas, salida JSON, acceso a Responses API y compatibilidad con la API de Anthropic. La lista oficial también fija un límite de concurrencia de 2.500 para deepseek-flash y un máximo de salida de 384.000 tokens.

La ficha técnica de DeepSeek-AI describe un backbone de 552.000 millones de parámetros, con 8.000 millones activos por token durante el procesamiento de entrada y 16.000 millones durante la generación. Esas cifras no son intercambiables: los parámetros activos describen cuánto participa en cada fase, mientras que el total se refiere al tamaño completo del modelo.

El modelo emplea una arquitectura Causal Encoder-Decoder de 40 capas, repartidas entre 20 capas de codificador causal y 20 de decodificador. La ficha técnica también comunica una caché KV global de 890 bytes por token. La caché KV conserva información intermedia de la atención para evitar recalcular todo el contexto en cada paso, una pieza especialmente relevante cuando las sesiones son largas.

La licencia del repositorio y de los pesos es MIT. Eso permite estudiar y desplegar el modelo bajo los términos de esa licencia, pero el número de parámetros activos no basta por sí solo para calcular la memoria necesaria, el rendimiento o la configuración de hardware de una instalación concreta.

Qué cambia con el estado de V4 Pro

La documentación oficial de DeepSeek indicó que el servicio API de V4 Pro continuaría después del 14 de septiembre de 2026 y que su método de facturación permanecería sin cambios.

Para una integración, conviene distinguir el identificador solicitado, el modelo servido y la tarifa asociada. deepseek-flash corresponde a DeepSeek V4.1 Flash; V4 Pro mantiene una línea de servicio separada en la documentación de DeepSeek.

Qué puede ofrecer V4.1 Flash a un equipo

La combinación de un contexto de un millón de tokens, entrada multimodal, llamadas a herramientas y precios diferenciados hace que el modelo resulte especialmente relevante para agentes que mantienen instrucciones y materiales durante varias interacciones. En esos flujos, diseñar una estrategia de reutilización del contexto puede tener un efecto directo sobre el coste de entrada.

Para una integración de API, la cuenta debe separar tres cantidades: tokens de entrada con caché, tokens de entrada sin caché y tokens de salida. Después hay que aplicar la franja horaria correspondiente. Una misma aplicación puede tener costes muy distintos si cambia la proporción de contenido reutilizado o si concentra el tráfico en las horas punta.

DeepSeek se reserva el derecho a modificar sus precios.