DeepSeek V4.1 Flash kost buiten piekuren $0,003 per miljoen gecachte invoertokens, $0,15 per miljoen niet-gecachete invoertokens en $0,60 per miljoen uitvoertokens. Tijdens piekuren verdubbelen die tarieven. Voor agenttoepassingen is vooral het verschil tussen cache-hits en cache-misses belangrijk: wie dezelfde context opnieuw gebruikt, kan de invoerkosten sterk verlagen.

De officiële API-prijzen van DeepSeek V4.1 Flash

De API-identificatie van het model is deepseek-flash. DeepSeek rekent wereldwijd in Amerikaanse dollars per miljoen tokens. De factuur is gebaseerd op het totale aantal invoer- en uitvoertokens.

TokencategorieDaluren per 1 miljoen tokensPiekuren per 1 miljoen tokensVoorwaarde
Invoer, cache-hit$0,003$0,006De invoertokens komen uit de cache
Invoer, cache-miss$0,15$0,30De invoertokens zijn niet gecachet
Uitvoer$0,60$1,20Door het model gegenereerde tokens

Piekuren lopen van 01:00 tot 04:00 UTC en van 06:00 tot 10:00 UTC, van maandag tot en met vrijdag. Alle andere uren gelden als daluren. Voor een Nederlandse ontwikkelaar is dus de UTC-tijd bepalend, niet automatisch de lokale klok.

Een eenvoudige berekening maakt het verschil zichtbaar. Eén miljoen gecachte invoertokens plus één miljoen uitvoertokens kost buiten piekuren $0,603. Met één miljoen niet-gecachete invoertokens komt hetzelfde voorbeeld uit op $0,75. Tijdens piekuren bedragen die totalen respectievelijk $1,206 en $1,50.

Waarom cachegebruik voor agents zwaar weegt

Een cache-hit voor invoer kost buiten piekuren $0,003 per miljoen tokens; een cache-miss kost $0,15. Dat is een verschil van 50 keer. Gecachte invoer is bovendien 200 keer goedkoper dan uitvoer, dat buiten piekuren $0,60 per miljoen tokens kost.

Dat prijsverschil is vooral relevant voor agents die bij iedere stap dezelfde systeeminstructies, bestanden of toolgeschiedenis meesturen. De lage cacheprijs geldt wanneer de toepassing daadwerkelijk een geschikt deel van de context opnieuw gebruikt. Alleen een lange prompt versturen maakt invoer dus niet automatisch goedkoop.

Een agent met veel hergebruikte context krijgt een ander kostenprofiel dan een chat die telkens een volledig nieuwe prompt aanlevert. Ook de hoeveelheid gegenereerde tekst telt mee: lange antwoorden kunnen de uitvoerkosten snel belangrijker maken dan de invoer.

Wat DeepSeek V4.1 Flash technisch biedt

DeepSeek V4.1 Flash is een multimodaal Mixture-of-Experts-model. Het accepteert tekst en afbeeldingen en genereert tekst. De API ondersteunt daarnaast toolaanroepen, JSON-uitvoer, de Responses API en toegang via een Anthropic-compatibele API. Voor deepseek-flash vermeldt de officiële API-lijst een gelijktijdigheidslimiet van 2.500.

SpecificatieWaardePraktische betekenis
Modelidentificatiedeepseek-flashDe naam voor API-aanroepen
Backbone552 miljard parametersDe totale omvang van het model
Actieve parameters8 miljard tijdens prefill; 16 miljard tijdens decoderingHet aantal parameters dat per fase actief is
ContextvensterTot 1 miljoen tokensRuimte voor lange documenten, codebases en gesprekken
Maximale uitvoer384.000 tokensDe maximale uitvoerlengte voor de Flash-API
InvoerTekst en afbeeldingenHet model verwerkt beide modaliteiten
UitvoerAutoregressieve tekstHet model genereert tekst token voor token
Gelijktijdigheid2.500 voor deepseek-flashDe vermelde API-limiet voor gelijktijdige verzoeken
LicentieMITDe repository en modelgewichten vallen onder deze licentie

De waarde van 552 miljard parameters beschrijft de volledige backbone. Per token worden niet al die parameters tegelijk geactiveerd: tijdens het verwerken van de invoer gaat het om 8 miljard parameters en tijdens het genereren om 16 miljard. Die aantallen vormen daarom geen complete hardwareconfiguratie.

KV-cache en een contextvenster van 1 miljoen tokens

Een KV-cache bewaart tussenresultaten van eerdere tokens. Daardoor kan een model bij een lange context eerdere berekeningen hergebruiken. DeepSeek V4.1 Flash vermeldt een globale KV-cache van ongeveer 890 bytes per token, ongeveer een kwart van de waarde die voor DeepSeek V4 Flash wordt vermeld.

Een contextvenster van 1 miljoen tokens maakt lange documenten, grote codebases en uitgebreide agentgeschiedenissen mogelijk. Het zegt op zichzelf niets over een universele VRAM-configuratie, latency of doorvoer.

De architectuur gebruikt 40 lagen: 20 lagen in de causale encoder en 20 decoderlagen. DeepSeek beschrijft daarnaast Compressed Sparse Attention 2, met Full-, Reindex- en Reuse-modi, en Engram-geheugen met 196 miljard parameters. De redeneerinspanning kan via reasoning_effort worden ingesteld met een geheel getal van 1 tot 100.

Wat de API-prijs voor ontwikkelaars betekent

De belangrijkste kostenkeuze is niet simpelweg hoeveel tokens een toepassing verwerkt, maar hoeveel daarvan opnieuw als cache-hit kunnen worden gebruikt. Dat maakt DeepSeek V4.1 Flash vooral interessant voor langdurige agenttaken met terugkerende instructies, bestanden en toolsporen.

DeepSeek vermeldt dat prijzen kunnen worden aangepast. De tarieven zijn dus actuele prijzen, geen permanente garantie. De API trekt kosten af van opgewaardeerd of toegekend saldo; wanneer beide beschikbaar zijn, wordt toegekend saldo eerst gebruikt.

De actuele status van de V4 Pro-API

De officiële DeepSeek-documentatie vermeldt dat de V4 Pro-API na 14 september 2026 doorgaat en dat de factureringsmethode ongewijzigd blijft.

Voor ontwikkelaars is dat onderscheid praktisch belangrijk. deepseek-flash verwijst naar DeepSeek V4.1 Flash, terwijl de V4 Pro-API volgens de actuele documentatie zijn dienstverlening voortzet. Modelnaam, API-identificatie en tarief horen dus bij elkaar in de configuratie van een integratie.

Wat de specificaties zeggen over lokale hardware

De MIT-licentie geldt voor de repository en modelgewichten. De genoemde parameterwaarden vormen geen universele uitspraak over benodigde VRAM, latency, doorvoer of het aantal GPU's. De 8 miljard actieve parameters tijdens prefill en 16 miljard tijdens decodering beschrijven de rekenactiviteit per fase; ze zijn geen complete lokale hardwareconfiguratie.

Voor een test of integratie via de API zijn de hoeveelheid nieuwe invoer, het aandeel cache-hits en de hoeveelheid uitvoer bepalend voor de kosten. Bij agenten die dezelfde context blijven hergebruiken, kan die tweede factor het verschil maken tussen goedkope invoer en een reeks duurdere cache-misses.