Le tarif API officiel de DeepSeek V4.1 Flash commence à 0,003 dollar par million de tokens d’entrée mis en cache pendant les heures creuses. Une entrée non mise en cache coûte 0,15 dollar par million de tokens, tandis que la sortie est facturée 0,60 dollar. Pour les agents qui réutilisent de longs contextes, la manière dont les tokens sont envoyés peut donc peser davantage que le prix d’appel du modèle.

La grille tarifaire de DeepSeek V4.1 Flash

L’API utilise l’identifiant deepseek-flash. DeepSeek facture séparément les tokens d’entrée qui bénéficient du cache, ceux qui n’en bénéficient pas et les tokens générés en sortie. Les montants sont exprimés en dollars américains par million de tokens.

Catégorie de tokensHeures creusesHeures de pointeCondition
Entrée, cache utilisé0,003 $ / million0,006 $ / millionTokens d’entrée mis en cache
Entrée, cache non utilisé0,15 $ / million0,30 $ / millionTokens d’entrée non mis en cache
Sortie0,60 $ / million1,20 $ / millionTokens générés par le modèle

Les heures de pointe sont fixées de 01 h 00 à 04 h 00 et de 06 h 00 à 10 h 00 UTC, du lundi au vendredi. Toutes les autres périodes sont considérées comme des heures creuses. Les tarifs de pointe correspondent exactement au double des tarifs hors pointe.

Le prix le plus bas est donc celui de l’entrée mise en cache en heures creuses : 0,003 dollar par million de tokens. DeepSeek précise toutefois que ses prix peuvent évoluer.

Pourquoi le cache compte autant pour les agents

Un cache de tokens conserve une partie réutilisable du contexte afin d’éviter de traiter à nouveau une séquence identique. C’est particulièrement intéressant pour un agent qui renvoie régulièrement les mêmes instructions, fichiers ou traces d’outils.

À tarif hors pointe, un million de tokens d’entrée mis en cache et un million de tokens de sortie coûtent 0,603 dollar : 0,003 + 0,60. Avec un million de tokens d’entrée non mis en cache, le même exemple atteint 0,75 dollar. Aux heures de pointe, les deux combinaisons passent respectivement à 1,206 dollar et 1,50 dollar.

La différence entre l’entrée mise en cache et l’entrée non mise en cache est de 50 fois en heures creuses : 0,003 contre 0,15 dollar par million de tokens. Le cache n’est donc pas un détail comptable. Il devient un paramètre d’architecture pour les applications qui répètent de longs préambules ou conservent des historiques volumineux.

Un modèle multimodal avec un contexte d’un million de tokens

DeepSeek V4.1 Flash accepte le texte et les images et génère du texte. Son contexte maximal atteint 1 000 000 de tokens. L’API prend également en charge les appels d’outils, les sorties JSON, la Responses API et l’accès via une API au format Anthropic. La limite de concurrence indiquée pour deepseek-flash est de 2 500.

SpécificationValeurIntérêt pratique
Identifiant APIdeepseek-flashNom à utiliser pour appeler le service Flash
Modèle serviDeepSeek-V4.1-FlashVersion associée à l’identifiant API
Contexte maximalJusqu’à 1 000 000 de tokensTraitement de documents et d’historiques très longs
Sortie maximale384 000 tokensPlafond de génération indiqué par l’API
EntréesTexte et imagesUtilisation multimodale
Fonctions APIAppels d’outils, JSON, Responses API, API au format AnthropicIntégration dans des flux applicatifs variés
Concurrence2 500 pour deepseek-flashNombre indiqué dans la fiche API
LicenceMIT pour le dépôt et les poids du modèleCadre logiciel et de distribution déclaré

La fiche technique décrit un backbone de 552 milliards de paramètres. Le modèle active 8 milliards de paramètres lors du traitement de l’entrée (prefill), puis 16 milliards pendant la génération (decoding). Ces chiffres décrivent le fonctionnement du modèle à chaque étape ; ils ne constituent pas à eux seuls une configuration matérielle universelle.

Ce que cela implique pour une intégration

Le coût final dépend du volume de tokens d’entrée et de sortie, du taux de réutilisation du contexte et de l’horaire d’appel. Une application qui produit de longues réponses peut donc dépenser davantage sur les sorties, même si ses instructions répétées profitent du cache.

Le cache KV du modèle est annoncé à 890 octets par token à l’échelle globale. Cette donnée concerne l’empreinte mémoire décrite pour l’architecture. Elle ne fournit pas une garantie universelle de latence, de débit ou de coût total pour une application donnée.

Les poids et le dépôt sont publiés sous licence MIT, mais le nombre de paramètres actifs ne suffit pas à déduire la mémoire vidéo nécessaire à une installation locale. La quantification, le cache, le moteur d’exécution et l’offloading entrent également en jeu. Pour un projet d’auto-hébergement, le chiffre de 8 ou 16 milliards de paramètres actifs ne remplace donc pas une estimation complète de l’infrastructure.

Le service V4 Pro continue après le 14 septembre 2026

La documentation officielle de DeepSeek indique que le service API de V4 Pro continue après le 14 septembre 2026, avec une facturation inchangée. Cette précision concerne le service V4 Pro et ne modifie pas la grille tarifaire présentée pour deepseek-flash.

Pour DeepSeek V4.1 Flash, le calcul le plus utile commence donc par trois questions très concrètes : quelle quantité d’entrée sera réellement réutilisée, combien de tokens le modèle devra-t-il générer et à quels horaires les appels seront-ils effectués ?