DeepSeek V4.1 Flash zadebiutował 10 września 2026 roku jako multimodalny model Mixture-of-Experts (MoE) z otwartymi wagami. Przyjmuje tekst i obrazy, generuje tekst, obsługuje kontekst do 1 mln tokenów i według dokumentacji wykorzystuje około 890 bajtów pamięci podręcznej KV na token. To połączenie dużej skali, selektywnej aktywacji i kompresji pamięci jest ważniejsze niż efektowne hasła o „pokonaniu wszystkich” — wyniki nadal zależą od zadania, ustawień i metodologii testu.

Czym jest DeepSeek V4.1 Flash

DeepSeek V4.1 Flash ma 552 mld parametrów w całym modelu, przyjmuje tekst oraz obrazy i zwraca tekst. Wagi są dostępne na Hugging Face na licencji MIT, więc model można pobrać i przygotować do samodzielnego wdrożenia. Nie oznacza to jednak, że pełne uruchomienie będzie łatwe na typowym komputerze.

Oficjalny identyfikator API to deepseek-flash. DeepSeek ogłosił również, że od 14 września 2026 roku żądania kierowane do deepseek-v4-pro mają być obsługiwane przez V4.1 Flash do czasu premiery V4.1 Pro. To zapowiedź zmiany routingu, a nie informacja o niezależnym wyniku testu modelu.

Dlaczego model ma 552 mld parametrów, ale aktywuje 8 i 16 mld

DeepSeek V4.1 Flash: milion tokenów kontekstu i mniejsze obciążenie pamięci

W architekturze MoE cały model zawiera wiele wyspecjalizowanych ekspertów, lecz przy konkretnym tokenie wykorzystywana jest tylko część z nich. W DeepSeek V4.1 Flash aktywnych jest około 8 mld parametrów podczas przetwarzania wejścia oraz 16 mld podczas generowania odpowiedzi.

To dwie różne miary. 552 mld parametrów opisuje całkowitą pojemność modelu, a wartości 8 i 16 mld — część aktywowaną w dwóch etapach pracy. Nie można na tej podstawie wyliczyć uniwersalnych wymagań pamięci lokalnej. Na zużycie zasobów wpływają między innymi sposób kwantyzacji, offloading i środowisko uruchomieniowe.

Model wykorzystuje 40-warstwową architekturę Causal Encoder-Decoder: 20 warstw enkodera przyczynowego i 20 warstw dekodera. Dokumentacja wymienia także Compressed Sparse Attention 2, mechanizm DSpark do dekodowania spekulatywnego oraz Engram — warunkową pamięć aktywowaną przez wyszukiwanie związane z tokenami.

Pamięć KV i kontekst miliona tokenów

Pamięć KV przechowuje informacje potrzebne modelowi podczas pracy z kontekstem. DeepSeek V4.1 Flash deklaruje globalny rozmiar około 890 bajtów na token, podczas gdy DeepSeek V4 Flash miał według zestawienia 3514 bajtów na token. Mniejszy rozmiar pamięci podręcznej może ograniczać obciążenie infrastruktury przy długich rozmowach, zadaniach agentowych i pracy z dużymi dokumentami.

Drugim elementem układanki jest kontekst do 1 000 000 tokenów. To nie oznacza automatycznie, że każde wdrożenie będzie działało z maksymalnym kontekstem przy tej samej szybkości i koszcie. W praktyce znaczenie mają konfiguracja, dostawca, sposób przechowywania pamięci oraz długość odpowiedzi.

Jak czytać wyniki benchmarków

Porównanie 24 promptów programistycznych i wpływu wielokrotnych uruchomień na ocenę DeepSeek V4.1 Flash.

DeepSeek podaje wysokie wyniki między innymi dla kodowania, cyberbezpieczeństwa i zadań agentowych przy maksymalnym poziomie rozumowania. V4.1 Flash uzyskał 74,2 w DeepSWE v1.1, 88,1 w CyberGym oraz 90,6 w Terminal-Bench 2.1. Każda z tych liczb odnosi się do konkretnego testu i ustawień, a nie do ogólnej „inteligencji” modelu.

W tym samym zestawieniu model otrzymał 31,2 w Terminal-Bench 4.0, podczas gdy Claude Opus 5 uzyskał 51,8, a GPT-5.6 Sol — 39,9. To dobry przykład, dlaczego pojedynczy zwycięski wynik nie wystarcza do ogłoszenia uniwersalnej przewagi.

ModelŁączna liczba parametrówAktywne parametryOkno kontekstuTerminal-Bench 2.1CyberGymDeepSWE v1.1Terminal-Bench 4.0Szybkość wyjściowa według metody Artificial Analysis
DeepSeek V4.1 Flash552 mld8 mld wejście / 16 mld wyjściedo 1 000 000 tokenów90,688,174,231,2206,3 tokena/s
DeepSeek V4 Pro 08131,6 bln49 mld87,962,712,472,3 tokena/s
GPT-5.6 Solnieujawnionenieujawnione88,884,573,039,9111,9 tokena/s
Claude Opus 5nieujawnionenieujawnione89,174,051,865,8 tokena/s

Dane Artificial Analysis przedstawiają osobną metodologię: 39,5 punktu Intelligence Index, 206,3 tokena wyjściowego na sekundę i 1,13 sekundy do pierwszego fragmentu odpowiedzi. Nie należy mieszać tych wartości z tabelą benchmarków DeepSeek, ponieważ różnią się zestawem testów, dostawcą i warunkami pomiaru.

Niezależny test obejmujący 24 prompty programistyczne powtarzał uruchomienia, aby uwzględnić zmienność odpowiedzi. To użyteczna perspektywa dla programistów, ale nadal wynik konkretnego rankingu, a nie gwarancja jakości w każdym projekcie.

Ceny API i przekierowanie V4 Pro

DeepSeek stosuje globalne ceny API wyrażone w USD za 1 mln tokenów. Stawka zależy od tego, czy wejście korzysta z trafienia w pamięci podręcznej, czy jest niebuforowane, a także od okresu szczytowego lub pozaszczytowego. W Polsce nie podano osobnej taryfy w PLN ani ceny u lokalnego sprzedawcy.

Dla użytkownika oznacza to, że sam koszt „za milion tokenów” nie wystarcza do oszacowania rachunku. Trzeba uwzględnić proporcję wejścia do wyjścia, trafienia pamięci podręcznej i porę korzystania z API. Ta sama aplikacja może więc generować inny koszt przy innym obciążeniu.

DeepSeek zapowiedział też, że żądania do deepseek-v4-pro będą od 14 września kierowane do V4.1 Flash do czasu premiery V4.1 Pro. Zmiana dotyczy obsługi istniejącego identyfikatora i powinna być czytana osobno od parametrów samego modelu.

Otwarte wagi, lokalne wdrożenie i sprzętowy haczyk

Demonstracja lokalnego wdrożenia DeepSeek V4.1 Flash na czterech NVIDIA DGX Spark z offloadingiem na SSD.

Licencja MIT ułatwia pobranie wag i eksperymentowanie z własnym środowiskiem. „Otwarty” nie znaczy jednak „lekki”. Demonstracja lokalnego wdrożenia wykorzystała cztery NVIDIA DGX Spark, offloading na SSD oraz konfigurację wielowęzłową. W tej konkretnej konfiguracji odnotowano około 70 tokenów na sekundę przy kodowaniu i około 54 tokeny na sekundę w zadaniach agentowych.

To obserwacje dla określonego zestawu sprzętu i trybu pracy. Nie wyznaczają minimalnej konfiguracji dla wszystkich użytkowników. Szczególnie ważne jest rozróżnienie między liczbą aktywnych parametrów a całkowitym ciężarem wag, pamięci podręcznej i dodatkowych struktur potrzebnych podczas lokalnego uruchomienia.

Dla kogo ten model ma sens

DeepSeek V4.1 Flash jest interesujący przede wszystkim dla zespołów korzystających z API, twórców agentów kodujących oraz osób pracujących z długim kontekstem i obrazami. Duża liczba parametrów, selektywna aktywacja i kompresja pamięci tworzą obiecujący kompromis między możliwościami modelu a kosztem obsługi — ale kompromis trzeba oceniać na własnym zadaniu.

Dla entuzjastów lokalnego AI otwarte wagi są ważną wiadomością, lecz bariera sprzętowa pozostaje realna. Cztery NVIDIA DGX Spark w demonstracji pokazują skalę konkretnego wdrożenia, nie uniwersalny wymóg. Jeśli zależy ci na lokalnym uruchomieniu, sama informacja o 8 lub 16 mld aktywnych parametrów nie wystarczy do zaplanowania pamięci i przepustowości.

Najuczciwszy werdykt jest więc mniej widowiskowy, ale bardziej użyteczny: DeepSeek V4.1 Flash wyróżnia się konstrukcją, kontekstem do 1 mln tokenów, otwartymi wagami i mocnymi wynikami w wybranych testach. O tym, czy będzie dobrym wyborem, zdecydują dopiero konkretny workload, warunki API albo realna konfiguracja lokalna.