DeepSeek V4.1 Flash ma oficjalny cennik API oparty na trzech stawkach: wejściu z trafieniem pamięci podręcznej, wejściu bez takiego trafienia oraz wygenerowanych tokenach. Najtańsza opcja kosztuje 0,003 USD za milion tokenów, ale dotyczy wyłącznie buforowanego wejścia poza godzinami szczytu. Dla agentów, które wielokrotnie wysyłają podobne instrukcje, pliki lub ślady działania narzędzi, sposób wykorzystania cache może więc mieć większe znaczenie niż sama nazwa modelu.

Cennik API DeepSeek V4.1 Flash

Oficjalny identyfikator modelu w API to deepseek-flash. DeepSeek rozlicza łącznie tokeny wejściowe i wyjściowe, a stawka zależy od pory oraz od tego, czy wejściowy kontekst został ponownie wykorzystany z pamięci podręcznej.

Kategoria tokenówPoza szczytem za 1 mln tokenówW szczycie za 1 mln tokenówWarunek
Wejście z trafieniem cache0,003 USD0,006 USDWykorzystanie buforowanych tokenów wejściowych
Wejście bez trafienia cache0,15 USD0,30 USDTokeny wejściowe bez użytego bufora
Wyjście0,60 USD1,20 USDWygenerowane tokeny

Godziny szczytu obejmują przedziały 01:00–04:00 i 06:00–10:00 UTC od poniedziałku do piątku. Wszystkie pozostałe okresy są pozaszczytowe, a stawki w szczycie są dokładnie dwukrotnie wyższe.

Dla prostego przykładu: milion buforowanych tokenów wejściowych i milion tokenów wyjściowych kosztują poza szczytem 0,603 USD. Przy takim samym wyjściu, lecz z milionem tokenów wejściowych bez trafienia cache, rachunek wynosi 0,75 USD. W godzinach szczytu te same kombinacje kosztują odpowiednio 1,206 USD i 1,50 USD.

Dlaczego cache ma tak duże znaczenie dla agentów

Poza szczytem wejście z trafieniem pamięci podręcznej kosztuje 0,003 USD za milion tokenów, a wejście bez trafienia — 0,15 USD. To 50-krotna różnica. Jednocześnie buforowane wejście jest 200 razy tańsze niż tokeny wyjściowe przy stawce pozaszczytowej.

Nie każdy przebieg agenta automatycznie skorzysta z niższej ceny. Aplikacja musi ponownie wysyłać kwalifikujący się prefiks lub kontekst. W praktyce szczególne znaczenie zyskują więc powtarzalne elementy pracy: stałe instrukcje systemowe, te same dokumenty referencyjne oraz kolejne kroki długiego procesu z użyciem narzędzi.

To zmienia sposób liczenia kosztu. Samo „ile kosztuje milion tokenów?” nie wystarcza — trzeba jeszcze sprawdzić, jaka część wejścia będzie buforowana, ile tokenów wygeneruje model i w jakich godzinach będzie działać aplikacja.

Co oferuje sam model

SpecyfikacjaWartośćZnaczenie dla użytkownika
Całkowita liczba parametrów552 mldOpisuje pełną skalę modelu Mixture-of-Experts
Aktywne parametry8 mld podczas przetwarzania wejścia; 16 mld podczas dekodowaniaPokazuje, jaka część parametrów jest aktywowana w dwóch etapach pracy
Okno kontekstuDo 1 mln tokenówUmożliwia pracę z bardzo długimi kontekstami
WejścieTekst i obrazyModel obsługuje zadania multimodalne
Funkcje APIWywołania narzędzi, JSON, Responses API i dostęp w formacie AnthropicUłatwia wykorzystanie modelu w aplikacjach i agentach
Limit współbieżności deepseek-flash2500Określa limit równoległych żądań podany dla tego identyfikatora
Licencja wag i repozytoriumMITDotyczy opublikowanych wag i repozytorium

DeepSeek V4.1 Flash jest modelem Mixture-of-Experts. Całkowita liczba 552 mld parametrów opisuje jego pełną pojemność, natomiast 8 mld parametrów podczas przetwarzania wejścia i 16 mld podczas generowania odpowiedzi dotyczą aktywowanej części modelu. Te liczby nie wyznaczają uniwersalnych wymagań dotyczących pamięci, opóźnień ani przepustowości lokalnego wdrożenia.

DeepSeek podaje również globalny rozmiar pamięci podręcznej KV na poziomie 890 bajtów na token. Pamięć KV przechowuje informacje potrzebne przy pracy z kontekstem, więc ten parametr ma znaczenie przy długich sesjach, choć nie zastępuje danych o rzeczywistym koszcie konkretnej aplikacji.

Co zmienia status DeepSeek V4 Pro

Oficjalna dokumentacja DeepSeek podaje, że usługa API V4 Pro jest kontynuowana po 14 września 2026 roku, a sposób rozliczania pozostaje bez zmian. To ważne rozróżnienie dla aplikacji korzystających z identyfikatora V4 Pro: po tej dacie żądania nie są automatycznie obsługiwane przez V4.1 Flash.

DeepSeek zastrzega sobie możliwość zmiany cen. Aktualny cennik API pozostaje więc punktem odniesienia przy planowaniu kosztów, szczególnie gdy aplikacja ma duży udział tokenów wejściowych i korzysta z różnych okresów taryfowych.