DeepSeek V4.1 Flash ma oficjalny cennik API oparty na trzech stawkach: wejściu z trafieniem pamięci podręcznej, wejściu bez takiego trafienia oraz wygenerowanych tokenach. Najtańsza opcja kosztuje 0,003 USD za milion tokenów, ale dotyczy wyłącznie buforowanego wejścia poza godzinami szczytu. Dla agentów, które wielokrotnie wysyłają podobne instrukcje, pliki lub ślady działania narzędzi, sposób wykorzystania cache może więc mieć większe znaczenie niż sama nazwa modelu.
Cennik API DeepSeek V4.1 Flash
Oficjalny identyfikator modelu w API to deepseek-flash. DeepSeek rozlicza łącznie tokeny wejściowe i wyjściowe, a stawka zależy od pory oraz od tego, czy wejściowy kontekst został ponownie wykorzystany z pamięci podręcznej.
| Kategoria tokenów | Poza szczytem za 1 mln tokenów | W szczycie za 1 mln tokenów | Warunek |
| Wejście z trafieniem cache | 0,003 USD | 0,006 USD | Wykorzystanie buforowanych tokenów wejściowych |
| Wejście bez trafienia cache | 0,15 USD | 0,30 USD | Tokeny wejściowe bez użytego bufora |
| Wyjście | 0,60 USD | 1,20 USD | Wygenerowane tokeny |
Godziny szczytu obejmują przedziały 01:00–04:00 i 06:00–10:00 UTC od poniedziałku do piątku. Wszystkie pozostałe okresy są pozaszczytowe, a stawki w szczycie są dokładnie dwukrotnie wyższe.
Dla prostego przykładu: milion buforowanych tokenów wejściowych i milion tokenów wyjściowych kosztują poza szczytem 0,603 USD. Przy takim samym wyjściu, lecz z milionem tokenów wejściowych bez trafienia cache, rachunek wynosi 0,75 USD. W godzinach szczytu te same kombinacje kosztują odpowiednio 1,206 USD i 1,50 USD.
Dlaczego cache ma tak duże znaczenie dla agentów
Poza szczytem wejście z trafieniem pamięci podręcznej kosztuje 0,003 USD za milion tokenów, a wejście bez trafienia — 0,15 USD. To 50-krotna różnica. Jednocześnie buforowane wejście jest 200 razy tańsze niż tokeny wyjściowe przy stawce pozaszczytowej.
Nie każdy przebieg agenta automatycznie skorzysta z niższej ceny. Aplikacja musi ponownie wysyłać kwalifikujący się prefiks lub kontekst. W praktyce szczególne znaczenie zyskują więc powtarzalne elementy pracy: stałe instrukcje systemowe, te same dokumenty referencyjne oraz kolejne kroki długiego procesu z użyciem narzędzi.
To zmienia sposób liczenia kosztu. Samo „ile kosztuje milion tokenów?” nie wystarcza — trzeba jeszcze sprawdzić, jaka część wejścia będzie buforowana, ile tokenów wygeneruje model i w jakich godzinach będzie działać aplikacja.
Co oferuje sam model
| Specyfikacja | Wartość | Znaczenie dla użytkownika |
| Całkowita liczba parametrów | 552 mld | Opisuje pełną skalę modelu Mixture-of-Experts |
| Aktywne parametry | 8 mld podczas przetwarzania wejścia; 16 mld podczas dekodowania | Pokazuje, jaka część parametrów jest aktywowana w dwóch etapach pracy |
| Okno kontekstu | Do 1 mln tokenów | Umożliwia pracę z bardzo długimi kontekstami |
| Wejście | Tekst i obrazy | Model obsługuje zadania multimodalne |
| Funkcje API | Wywołania narzędzi, JSON, Responses API i dostęp w formacie Anthropic | Ułatwia wykorzystanie modelu w aplikacjach i agentach |
| Limit współbieżności deepseek-flash | 2500 | Określa limit równoległych żądań podany dla tego identyfikatora |
| Licencja wag i repozytorium | MIT | Dotyczy opublikowanych wag i repozytorium |
DeepSeek V4.1 Flash jest modelem Mixture-of-Experts. Całkowita liczba 552 mld parametrów opisuje jego pełną pojemność, natomiast 8 mld parametrów podczas przetwarzania wejścia i 16 mld podczas generowania odpowiedzi dotyczą aktywowanej części modelu. Te liczby nie wyznaczają uniwersalnych wymagań dotyczących pamięci, opóźnień ani przepustowości lokalnego wdrożenia.
DeepSeek podaje również globalny rozmiar pamięci podręcznej KV na poziomie 890 bajtów na token. Pamięć KV przechowuje informacje potrzebne przy pracy z kontekstem, więc ten parametr ma znaczenie przy długich sesjach, choć nie zastępuje danych o rzeczywistym koszcie konkretnej aplikacji.
Co zmienia status DeepSeek V4 Pro
Oficjalna dokumentacja DeepSeek podaje, że usługa API V4 Pro jest kontynuowana po 14 września 2026 roku, a sposób rozliczania pozostaje bez zmian. To ważne rozróżnienie dla aplikacji korzystających z identyfikatora V4 Pro: po tej dacie żądania nie są automatycznie obsługiwane przez V4.1 Flash.
DeepSeek zastrzega sobie możliwość zmiany cen. Aktualny cennik API pozostaje więc punktem odniesienia przy planowaniu kosztów, szczególnie gdy aplikacja ma duży udział tokenów wejściowych i korzysta z różnych okresów taryfowych.