DeepSeek V4.1 Flash kost buiten piekuren $0,003 per miljoen gecachte invoertokens, $0,15 per miljoen niet-gecachete invoertokens en $0,60 per miljoen uitvoertokens. Tijdens piekuren verdubbelen die tarieven. Voor agenttoepassingen is vooral het verschil tussen cache-hits en cache-misses belangrijk: wie dezelfde context opnieuw gebruikt, kan de invoerkosten sterk verlagen.
De officiële API-prijzen van DeepSeek V4.1 Flash
De API-identificatie van het model is deepseek-flash. DeepSeek rekent wereldwijd in Amerikaanse dollars per miljoen tokens. De factuur is gebaseerd op het totale aantal invoer- en uitvoertokens.
| Tokencategorie | Daluren per 1 miljoen tokens | Piekuren per 1 miljoen tokens | Voorwaarde |
| Invoer, cache-hit | $0,003 | $0,006 | De invoertokens komen uit de cache |
| Invoer, cache-miss | $0,15 | $0,30 | De invoertokens zijn niet gecachet |
| Uitvoer | $0,60 | $1,20 | Door het model gegenereerde tokens |
Piekuren lopen van 01:00 tot 04:00 UTC en van 06:00 tot 10:00 UTC, van maandag tot en met vrijdag. Alle andere uren gelden als daluren. Voor een Nederlandse ontwikkelaar is dus de UTC-tijd bepalend, niet automatisch de lokale klok.
Een eenvoudige berekening maakt het verschil zichtbaar. Eén miljoen gecachte invoertokens plus één miljoen uitvoertokens kost buiten piekuren $0,603. Met één miljoen niet-gecachete invoertokens komt hetzelfde voorbeeld uit op $0,75. Tijdens piekuren bedragen die totalen respectievelijk $1,206 en $1,50.
Waarom cachegebruik voor agents zwaar weegt
Een cache-hit voor invoer kost buiten piekuren $0,003 per miljoen tokens; een cache-miss kost $0,15. Dat is een verschil van 50 keer. Gecachte invoer is bovendien 200 keer goedkoper dan uitvoer, dat buiten piekuren $0,60 per miljoen tokens kost.
Dat prijsverschil is vooral relevant voor agents die bij iedere stap dezelfde systeeminstructies, bestanden of toolgeschiedenis meesturen. De lage cacheprijs geldt wanneer de toepassing daadwerkelijk een geschikt deel van de context opnieuw gebruikt. Alleen een lange prompt versturen maakt invoer dus niet automatisch goedkoop.
Een agent met veel hergebruikte context krijgt een ander kostenprofiel dan een chat die telkens een volledig nieuwe prompt aanlevert. Ook de hoeveelheid gegenereerde tekst telt mee: lange antwoorden kunnen de uitvoerkosten snel belangrijker maken dan de invoer.
Wat DeepSeek V4.1 Flash technisch biedt
DeepSeek V4.1 Flash is een multimodaal Mixture-of-Experts-model. Het accepteert tekst en afbeeldingen en genereert tekst. De API ondersteunt daarnaast toolaanroepen, JSON-uitvoer, de Responses API en toegang via een Anthropic-compatibele API. Voor deepseek-flash vermeldt de officiële API-lijst een gelijktijdigheidslimiet van 2.500.
| Specificatie | Waarde | Praktische betekenis |
| Modelidentificatie | deepseek-flash | De naam voor API-aanroepen |
| Backbone | 552 miljard parameters | De totale omvang van het model |
| Actieve parameters | 8 miljard tijdens prefill; 16 miljard tijdens decodering | Het aantal parameters dat per fase actief is |
| Contextvenster | Tot 1 miljoen tokens | Ruimte voor lange documenten, codebases en gesprekken |
| Maximale uitvoer | 384.000 tokens | De maximale uitvoerlengte voor de Flash-API |
| Invoer | Tekst en afbeeldingen | Het model verwerkt beide modaliteiten |
| Uitvoer | Autoregressieve tekst | Het model genereert tekst token voor token |
| Gelijktijdigheid | 2.500 voor deepseek-flash | De vermelde API-limiet voor gelijktijdige verzoeken |
| Licentie | MIT | De repository en modelgewichten vallen onder deze licentie |
De waarde van 552 miljard parameters beschrijft de volledige backbone. Per token worden niet al die parameters tegelijk geactiveerd: tijdens het verwerken van de invoer gaat het om 8 miljard parameters en tijdens het genereren om 16 miljard. Die aantallen vormen daarom geen complete hardwareconfiguratie.
KV-cache en een contextvenster van 1 miljoen tokens
Een KV-cache bewaart tussenresultaten van eerdere tokens. Daardoor kan een model bij een lange context eerdere berekeningen hergebruiken. DeepSeek V4.1 Flash vermeldt een globale KV-cache van ongeveer 890 bytes per token, ongeveer een kwart van de waarde die voor DeepSeek V4 Flash wordt vermeld.
Een contextvenster van 1 miljoen tokens maakt lange documenten, grote codebases en uitgebreide agentgeschiedenissen mogelijk. Het zegt op zichzelf niets over een universele VRAM-configuratie, latency of doorvoer.
De architectuur gebruikt 40 lagen: 20 lagen in de causale encoder en 20 decoderlagen. DeepSeek beschrijft daarnaast Compressed Sparse Attention 2, met Full-, Reindex- en Reuse-modi, en Engram-geheugen met 196 miljard parameters. De redeneerinspanning kan via reasoning_effort worden ingesteld met een geheel getal van 1 tot 100.
Wat de API-prijs voor ontwikkelaars betekent
De belangrijkste kostenkeuze is niet simpelweg hoeveel tokens een toepassing verwerkt, maar hoeveel daarvan opnieuw als cache-hit kunnen worden gebruikt. Dat maakt DeepSeek V4.1 Flash vooral interessant voor langdurige agenttaken met terugkerende instructies, bestanden en toolsporen.
DeepSeek vermeldt dat prijzen kunnen worden aangepast. De tarieven zijn dus actuele prijzen, geen permanente garantie. De API trekt kosten af van opgewaardeerd of toegekend saldo; wanneer beide beschikbaar zijn, wordt toegekend saldo eerst gebruikt.
De actuele status van de V4 Pro-API
De officiële DeepSeek-documentatie vermeldt dat de V4 Pro-API na 14 september 2026 doorgaat en dat de factureringsmethode ongewijzigd blijft.
Voor ontwikkelaars is dat onderscheid praktisch belangrijk. deepseek-flash verwijst naar DeepSeek V4.1 Flash, terwijl de V4 Pro-API volgens de actuele documentatie zijn dienstverlening voortzet. Modelnaam, API-identificatie en tarief horen dus bij elkaar in de configuratie van een integratie.
Wat de specificaties zeggen over lokale hardware
De MIT-licentie geldt voor de repository en modelgewichten. De genoemde parameterwaarden vormen geen universele uitspraak over benodigde VRAM, latency, doorvoer of het aantal GPU's. De 8 miljard actieve parameters tijdens prefill en 16 miljard tijdens decodering beschrijven de rekenactiviteit per fase; ze zijn geen complete lokale hardwareconfiguratie.
Voor een test of integratie via de API zijn de hoeveelheid nieuwe invoer, het aandeel cache-hits en de hoeveelheid uitvoer bepalend voor de kosten. Bij agenten die dezelfde context blijven hergebruiken, kan die tweede factor het verschil maken tussen goedkope invoer en een reeks duurdere cache-misses.