Le tarif API officiel de DeepSeek V4.1 Flash commence à 0,003 dollar par million de tokens d’entrée mis en cache pendant les heures creuses. Une entrée non mise en cache coûte 0,15 dollar par million de tokens, tandis que la sortie est facturée 0,60 dollar. Pour les agents qui réutilisent de longs contextes, la manière dont les tokens sont envoyés peut donc peser davantage que le prix d’appel du modèle.
La grille tarifaire de DeepSeek V4.1 Flash
L’API utilise l’identifiant deepseek-flash. DeepSeek facture séparément les tokens d’entrée qui bénéficient du cache, ceux qui n’en bénéficient pas et les tokens générés en sortie. Les montants sont exprimés en dollars américains par million de tokens.
| Catégorie de tokens | Heures creuses | Heures de pointe | Condition |
| Entrée, cache utilisé | 0,003 $ / million | 0,006 $ / million | Tokens d’entrée mis en cache |
| Entrée, cache non utilisé | 0,15 $ / million | 0,30 $ / million | Tokens d’entrée non mis en cache |
| Sortie | 0,60 $ / million | 1,20 $ / million | Tokens générés par le modèle |
Les heures de pointe sont fixées de 01 h 00 à 04 h 00 et de 06 h 00 à 10 h 00 UTC, du lundi au vendredi. Toutes les autres périodes sont considérées comme des heures creuses. Les tarifs de pointe correspondent exactement au double des tarifs hors pointe.
Le prix le plus bas est donc celui de l’entrée mise en cache en heures creuses : 0,003 dollar par million de tokens. DeepSeek précise toutefois que ses prix peuvent évoluer.
Pourquoi le cache compte autant pour les agents
Un cache de tokens conserve une partie réutilisable du contexte afin d’éviter de traiter à nouveau une séquence identique. C’est particulièrement intéressant pour un agent qui renvoie régulièrement les mêmes instructions, fichiers ou traces d’outils.
À tarif hors pointe, un million de tokens d’entrée mis en cache et un million de tokens de sortie coûtent 0,603 dollar : 0,003 + 0,60. Avec un million de tokens d’entrée non mis en cache, le même exemple atteint 0,75 dollar. Aux heures de pointe, les deux combinaisons passent respectivement à 1,206 dollar et 1,50 dollar.
La différence entre l’entrée mise en cache et l’entrée non mise en cache est de 50 fois en heures creuses : 0,003 contre 0,15 dollar par million de tokens. Le cache n’est donc pas un détail comptable. Il devient un paramètre d’architecture pour les applications qui répètent de longs préambules ou conservent des historiques volumineux.
Un modèle multimodal avec un contexte d’un million de tokens
DeepSeek V4.1 Flash accepte le texte et les images et génère du texte. Son contexte maximal atteint 1 000 000 de tokens. L’API prend également en charge les appels d’outils, les sorties JSON, la Responses API et l’accès via une API au format Anthropic. La limite de concurrence indiquée pour deepseek-flash est de 2 500.
| Spécification | Valeur | Intérêt pratique |
| Identifiant API | deepseek-flash | Nom à utiliser pour appeler le service Flash |
| Modèle servi | DeepSeek-V4.1-Flash | Version associée à l’identifiant API |
| Contexte maximal | Jusqu’à 1 000 000 de tokens | Traitement de documents et d’historiques très longs |
| Sortie maximale | 384 000 tokens | Plafond de génération indiqué par l’API |
| Entrées | Texte et images | Utilisation multimodale |
| Fonctions API | Appels d’outils, JSON, Responses API, API au format Anthropic | Intégration dans des flux applicatifs variés |
| Concurrence | 2 500 pour deepseek-flash | Nombre indiqué dans la fiche API |
| Licence | MIT pour le dépôt et les poids du modèle | Cadre logiciel et de distribution déclaré |
La fiche technique décrit un backbone de 552 milliards de paramètres. Le modèle active 8 milliards de paramètres lors du traitement de l’entrée (prefill), puis 16 milliards pendant la génération (decoding). Ces chiffres décrivent le fonctionnement du modèle à chaque étape ; ils ne constituent pas à eux seuls une configuration matérielle universelle.
Ce que cela implique pour une intégration
Le coût final dépend du volume de tokens d’entrée et de sortie, du taux de réutilisation du contexte et de l’horaire d’appel. Une application qui produit de longues réponses peut donc dépenser davantage sur les sorties, même si ses instructions répétées profitent du cache.
Le cache KV du modèle est annoncé à 890 octets par token à l’échelle globale. Cette donnée concerne l’empreinte mémoire décrite pour l’architecture. Elle ne fournit pas une garantie universelle de latence, de débit ou de coût total pour une application donnée.
Les poids et le dépôt sont publiés sous licence MIT, mais le nombre de paramètres actifs ne suffit pas à déduire la mémoire vidéo nécessaire à une installation locale. La quantification, le cache, le moteur d’exécution et l’offloading entrent également en jeu. Pour un projet d’auto-hébergement, le chiffre de 8 ou 16 milliards de paramètres actifs ne remplace donc pas une estimation complète de l’infrastructure.
Le service V4 Pro continue après le 14 septembre 2026
La documentation officielle de DeepSeek indique que le service API de V4 Pro continue après le 14 septembre 2026, avec une facturation inchangée. Cette précision concerne le service V4 Pro et ne modifie pas la grille tarifaire présentée pour deepseek-flash.
Pour DeepSeek V4.1 Flash, le calcul le plus utile commence donc par trois questions très concrètes : quelle quantité d’entrée sera réellement réutilisée, combien de tokens le modèle devra-t-il générer et à quels horaires les appels seront-ils effectués ?