DeepSeek bracht DeepSeek V4.1 Flash op 10 september 2026 uit als open-weight multimodaal Mixture-of-Experts-model. Het model accepteert tekst en afbeeldingen, genereert tekst en heeft een contextvenster tot 1.000.000 tokens. De kern van het nieuws is de combinatie van een zeer groot model met selectieve activatie en een globale KV-cache van ongeveer 890 bytes per token — interessant voor lange documenten en agenttaken, maar geen vrijbrief om elke prestatieclaim als algemene waarheid te behandelen.

Wat DeepSeek V4.1 Flash is

DeepSeek V4.1 Flash heeft een backbone van 552 miljard parameters. Dat getal beschrijft de totale modelcapaciteit, niet het aantal parameters dat bij elk token tegelijk wordt gebruikt. De gewichten zijn beschikbaar op Hugging Face onder de MIT-licentie. Voor API-gebruik is deepseek-flash de officiële modelidentificatie.

Het model is multimodaal aan de invoerkant: je kunt tekst en afbeeldingen aanbieden. De uitvoer bestaat uit tekst. Daarnaast is de redeneerinspanning instelbaar met een reasoning_effort-waarde van 1 tot 100.

DeepSeek kondigde ook aan dat verzoeken aan deepseek-v4-pro vanaf 14 september 2026 naar V4.1 Flash zouden worden doorgestuurd totdat V4.1 Pro verschijnt. Dat is een aangekondigde routeringswijziging, geen bewijs van een algemene rangorde tussen de modellen.

Waarom totale en actieve parameters verschillen

DeepSeek lanceert V4.1 Flash met contextvenster van 1 miljoen tokens

V4.1 Flash gebruikt een Mixture-of-Experts-architectuur: per token wordt slechts een deel van de beschikbare experts aangesproken. Tijdens het verwerken van de invoer zijn ongeveer 8 miljard parameters actief; tijdens het genereren zijn dat er ongeveer 16 miljard.

Die asymmetrie is belangrijk. De waarden 8 miljard en 16 miljard zeggen iets over de rekenactiviteit per fase, terwijl 552 miljard de totale backbone beschrijft. Je kunt de actieve aantallen daarom niet rechtstreeks lezen als de hoeveelheid geheugen die je nodig hebt om het volledige model lokaal te laden.

De architectuur bestaat uit 40 lagen: een Causal Encoder-Decoder met 20 encoderlagen en 20 decoderlagen. DeepSeek combineert die opzet met onder meer Compressed Sparse Attention 2, DSpark-speculatieve decodering en Engram-geheugen. Voor gebruikers komt dat neer op één praktische belofte: minder geheugen- en rekenwerk per stap, zonder dat het onderliggende model klein is.

KV-cache en een contextvenster van 1 miljoen tokens

De KV-cache bewaart tussenresultaten van eerdere tokens, zodat een model bij een lange conversatie niet telkens alles opnieuw hoeft te berekenen. DeepSeek V4.1 Flash rapporteert een globale KV-cache van ongeveer 890 bytes per token. Bij DeepSeek V4 Flash was dat volgens DeepSeek 3.514 bytes per token.

Dat verschil is vooral relevant voor toepassingen met lange contexten: grote codebases, lange documenten en agenttaken waarin veel eerdere interacties beschikbaar moeten blijven. Het model ondersteunt maximaal 1.000.000 tokens context, maar die bovengrens maakt lokale uitvoering niet automatisch eenvoudig. Contextlengte, modelgewichten, kwantisering, opslag en geheugenbandbreedte blijven verschillende onderdelen van dezelfde puzzel.

De cacheclaim is dus geen magische versneller voor iedere prompt. Ze verklaart wel waarom DeepSeek V4.1 Flash zich richt op serving-kosten en geheugenverbruik bij lange invoer.

Wat de benchmarks wel en niet aantonen

Een 24-promptanalyse van DeepSeek V4.1 Flash laat zien hoe herhaalde runs, modelvariatie en API-kosten de beoordeling van codingprestaties beïnvloeden.

DeepSeek rapporteert sterke resultaten op specifieke evaluaties bij maximale redeneerinspanning. V4.1 Flash haalt bijvoorbeeld 74,2 op DeepSWE v1.1 en 88,1 op CyberGym. Op Terminal-Bench 2.1 staat het model op 90,6; op Terminal-Bench 4.0 is de score 31,2.

Dat laatste verschil is precies waarom één totaaloordeel misleidend zou zijn. Een model kan op de ene harness sterk scoren en op een andere duidelijk lager uitkomen. De officiële resultaten zijn bovendien gekoppeld aan specifieke prompts, evaluaties en redeneerinstellingen.

Een onafhankelijke Artificial Analysis-evaluatie rapporteert voor de configuratie met maximale redenering een Intelligence Index van 39,5, een mediane uitvoersnelheid van 206,3 tokens per seconde en 1,13 seconden tot het eerste tekstblok. Dat zijn metingen binnen een eigen methode en aanbiederscontext, geen universele eigenschappen van iedere API-aanroep.

ModelTotale parametersActieve parametersContextvensterTerminal-Bench 2.1CyberGymDeepSWE v1.1Terminal-Bench 4.0Uitvoersnelheid volgens Artificial Analysis
DeepSeek V4.1 Flash552B8B invoer / 16B uitvoerTot 1.000.000 tokens90,688,174,231,2206,3 tokens/s
DeepSeek V4 Pro 08131,6T49B87,962,712,472,3 tokens/s
GPT-5.6 SolNiet openbaarNiet openbaar88,884,573,039,9111,9 tokens/s
Claude Opus 5Niet openbaarNiet openbaar89,174,051,865,8 tokens/s

De tabel brengt verschillende meetdimensies samen, maar maakt er geen universele ranglijst van. De scores komen uit benoemde tests met hun eigen omstandigheden; vooral de benchmarknaam en de meetmethode bepalen wat een getal betekent.

Een afzonderlijke 24-prompt-codingleaderboard herhaalde prompts om variatie tussen runs mee te nemen. Dat is nuttige praktijkcontext voor ontwikkelaars, maar de uitkomst blijft gebonden aan die leaderboardmethode, configuratie en workloads. Kortom: V4.1 Flash verdient aandacht voor coding, cybersecurity en agenttaken, niet automatisch een kroon voor elk gebruik.

API-prijzen en V4 Pro-routing

DeepSeek hanteert voor de Flash-API prijsniveaus in Amerikaanse dollars per 1 miljoen tokens, met aparte tarieven voor gecachte invoer, niet-gecachete invoer en uitvoer. De rekening hangt bovendien af van het moment: DeepSeek onderscheidt piek- en daluren.

Voor een team dat veel dezelfde context opnieuw verstuurt, is het onderscheid tussen cache-hit en cache-miss belangrijker dan een losse prijsclaim. Ook de verhouding tussen invoer en uitvoer telt mee. Een agent die korte antwoorden genereert maar telkens grote bestanden meestuurt, heeft een ander kostenprofiel dan een chat met kleine prompts.

DeepSeek kondigde aan dat verzoeken via deepseek-v4-pro vanaf 14 september 2026 naar V4.1 Flash zouden worden gerouteerd totdat V4.1 Pro beschikbaar komt. Voor ontwikkelaars betekent zo’n wijziging dat een model-ID niet altijd hetzelfde onderliggende model hoeft te blijven bedienen; controleer daarom in je eigen integratie welke identifier en welk tarief actief zijn wanneer je een productieomgeving bouwt.

Open weights, lokale hardware en de praktische grens

Conceptuele illustratie van DeepSeek V4.1 Flash: een grote modelcapaciteit wordt via selectieve verwerking en gecomprimeerd geheugen naar lange-context- en agenttaken geleid.

De MIT-licentie maakt downloaden en zelf hosten mogelijk. Dat betekent niet dat een doorsnee desktop het volledige model efficiënt draait. De totale gewichten blijven groot, ook wanneer per token maar een deel van de experts actief is.

Een lokale demonstratie gebruikte vier NVIDIA DGX Sparks en SSD-offloading. In die specifieke opstelling werd ongeveer 70 tokens per seconde gemeld voor coding en ongeveer 54 tokens per seconde voor agenttaken. Dat zijn observaties van die configuratie, geen universele minimumvereisten of garanties voor andere hardware.

De praktische vraag is dus niet alleen hoeveel parameters actief zijn. Ook de opslag van de gewichten, de beschikbare geheugenruimte, de bandbreedte, de gekozen kwantisering en de softwarestack bepalen of lokaal draaien haalbaar is. Voor veel gebruikers is de API daarom de logische route; voor hardwareliefhebbers en ontwikkelaars met gespecialiseerde systemen zijn de open gewichten vooral een uitnodiging om verder te experimenteren.

Voor wie V4.1 Flash interessant is

API-gebruikers krijgen een model dat tekst en afbeeldingen accepteert, een zeer lange context ondersteunt en voor specifieke coding- en agenttests sterke resultaten laat zien. Let bij kosten vooral op cache-status, piek- of daluren en de hoeveelheid uitvoer.

Ontwikkelaars van coding- en agenttools profiteren mogelijk van de instelbare redeneerinspanning en de cache-aanpak. Test wel met je eigen prompts: benchmarkwinsten op Terminal-Bench of CyberGym voorspellen niet automatisch dezelfde uitkomst voor jouw codebase.

Lokale AI-enthousiastelingen krijgen open gewichten onder de MIT-licentie, maar geen eenvoudige desktopinstallatie. De vier-DGX-Spark-demonstratie maakt de schaal van de uitdaging tastbaar zonder een universele hardwaregrens vast te leggen.

De betekenis van DeepSeek V4.1 Flash zit daarmee in de combinatie: een model van 552 miljard parameters dat per stap selectief werkt, lange contexten met een compacte KV-cache wil bedienen en tegelijk open beschikbaar is. Of dat voor jou een betere keuze is, hangt uiteindelijk af van je workload, je API-budget en de hardware die je daadwerkelijk hebt staan.