Po doniesieniach, że DeepSeek potrzebuje mniej pamięci HBM, 11 września 2026 roku akcje Samsung Electronics spadły o 3,5%, a SK Hynix o 2,2%. To wyraźna reakcja rynku na obawy o popyt na pamięci dla sztucznej inteligencji, ale nie dowód, że globalne zapotrzebowanie na HBM trwale się zmniejszyło.

Dlaczego akcje producentów pamięci spadły

HBM, czyli pamięć o dużej przepustowości, jest zbudowana z warstw układów DRAM umieszczonych blisko akceleratora. Taka konstrukcja pozwala szybko przesyłać dane podczas trenowania i uruchamiania modeli AI. Samsung Electronics i SK Hynix należą do kluczowych producentów tego typu pamięci, dlatego każda informacja o mniejszym zapotrzebowaniu może natychmiast wpłynąć na wycenę ich akcji.

W opisywanym dniu rynek zareagował na informację o niższych wymaganiach pamięciowych DeepSeek. Nie oznacza to jednak, że jeden ruch kursu mierzy rzeczywiste, długoterminowe zużycie HBM przez całą branżę. Pokazuje przede wszystkim, czego obawiali się inwestorzy w krótkim terminie.

HBM, KV cache i Engram to różne rzeczy

DeepSeek ogranicza presję na pamięć. Akcje Samsung Electronics i SK Hynix spadają

Najważniejsze rozróżnienie dotyczy tego, jakiej pamięci dotyczą poszczególne liczby.

  • HBM to fizyczna pamięć DRAM o wysokiej przepustowości, montowana blisko akceleratora.
  • KV cache przechowuje kluczowe i wartościowe stany mechanizmu uwagi podczas inferencji. Jego rozmiar rośnie wraz z długością kontekstu.
  • Multi-Head Latent Attention (MLA) kompresuje informacje kluczowe i wartościowe do reprezentacji latentnych, które można przechowywać w pamięci podręcznej.
  • Engram korzysta z pamięci warunkowej i odciążonej hierarchii pamięci, przenosząc część przechowywanych informacji poza pamięć akceleratora.

To mechanizmy powiązane z ograniczaniem presji na pamięć, lecz nie są synonimami całkowitej pojemności HBM. Można zmniejszyć KV cache, a nadal potrzebować HBM na wagi modelu, aktywacje, operacje uwagi, komunikację między akceleratorami i obsługę wielu użytkowników.

Co naprawdę pokazują liczby DeepSeek

Według doniesień dotyczących DeepSeek V4, przy kontekście o długości miliona tokenów model miał wykorzystywać 10% KV cache DeepSeek V3.2 oraz 27% FLOPs inferencji pojedynczego tokenu względem tego modelu. To dane dotyczące określonych metryk i warunków, a nie procentowa miara całkowitego zapotrzebowania na HBM.

Osobny wykres dotyczący DeepSeek V4-Pro pokazuje 13,7 razy mniejszy skumulowany KV cache niż w DeepSeek V3.2 przy sekwencji 1 024K tokenów. Ta wartość opisuje porównanie pamięci podręcznej dla konkretnego wariantu i długości sekwencji. Nie należy łączyć jej automatycznie z wynikiem 10% dla DeepSeek V4: nazwy modeli, metryki i warunki porównania są różne.

W architekturze DeepSeek V4 omawiane są także Compressed Sparse Attention (CSA) i Heavily Compressed Attention (HCA). Ich wspólny cel polega na ograniczeniu ilości informacji przechowywanych w stanie uwagi. To może ułatwiać obsługę długich kontekstów przy mniejszej presji na pamięć inferencji, ale nie usuwa innych wymagań sprzętowych.

Mniejsza presja na pamięć nie oznacza mniej HBM

Czy DeepSeek przestał potrzebować HBM? Nie. Ograniczenie KV cache i odciążenie części pamięci nie oznaczają eliminacji HBM. W praktycznym wdrożeniu znaczenie mają również rozmiar wag, aktywacje, przepustowość, komunikacja między układami oraz liczba równocześnie obsługiwanych zapytań.

Dobrym przykładem jest różnica między NVIDIA H100 i NVIDIA H800. W przedstawionym porównaniu przepustowość połączenia między akceleratorami wynosi 900 GB/s dla NVIDIA H100 i 400 GB/s dla NVIDIA H800. Optymalizacje programowe, takie jak kompresja danych czy wykorzystanie FP8, mogą pomóc pracować w warunkach ograniczonej przepustowości. Nie zmienia to faktu, że pojemność pamięci pozostaje osobnym ograniczeniem.

Podobnie HBM i DDR5 nie są zamiennymi odpowiednikami. DDR5 jest pamięcią systemową ogólnego przeznaczenia, a HBM projektuje się z myślą o bardzo wysokiej przepustowości blisko akceleratora. O tym, która pamięć jest potrzebna, decyduje konkretny układ i obciążenie.

Rynek widzi ryzyko, nie rozstrzygnięcie

W dniu opisanej reakcji rynkowej akcje obu producentów znalazły się ponad 25% poniżej historycznych maksimów. Wycena Samsung Electronics wynosiła 2,7-krotność bieżącej wartości księgowej, a SK Hynix 5-krotność; dla indeksu Philadelphia Semiconductor Index podano 11-krotność wartości księgowej.

PodmiotZgłoszona zmiana kursu 11 września 2026 rokuCena do bieżącej wartości księgowejOdległość od historycznego maksimum
Samsung Electronics−3,5%2,7×ponad 25% poniżej
SK Hynix−2,2%ponad 25% poniżej
Philadelphia Semiconductor Index11×

Te wartości opisują konkretny kontekst rynkowy z 11 września 2026 roku, a nie rekomendację inwestycyjną ani prognozę dla producentów pamięci. Krótkoterminowa obawa jest prosta: jeśli modele AI będą potrzebować mniej pamięci, dostawcy akceleratorów mogą kupować mniej HBM. Techniczny obraz jest jednak szerszy.

Tańsza inferencja może zwiększyć skalę użycia AI

Istnieje też odwrotny scenariusz. Jeśli uruchamianie modeli stanie się tańsze dzięki mniejszym wymaganiom pamięciowym, firmy i użytkownicy mogą korzystać z AI częściej. Wtedy wzrost liczby zapytań może częściowo lub całkowicie zrównoważyć oszczędność pamięci na pojedynczej inferencji. To hipoteza znana jako paradoks Jevonsa, a nie zmierzony wynik dla rynku HBM.

Dlatego na dłuższą metę liczy się nie tylko efektywność jednego modelu. Znaczenie będzie miało także to, jak szeroko AI zostanie wdrożona i jak dużo obliczeń wygenerują kolejne usługi. Modele rozwijane przez Meta Platforms i OpenAI są wskazywane jako potencjalne czynniki zwiększające całkowite wykorzystanie AI, ale przyszły wpływ na rynek półprzewodników pozostaje otwarty.

Najwęższy wniosek, który potwierdzają dane

DeepSeek pokazuje, że kompresja KV cache, MLA i Engram mogą ograniczać presję na pamięć akceleratora w określonych warunkach inferencji. To ważny postęp architektoniczny. Nie jest jednak równoznaczny z 75-procentowym spadkiem całkowitego zużycia HBM, zniknięciem HBM z infrastruktury AI ani trwałym załamaniem globalnego popytu.

Dla rynku pamięci kluczowe będzie więc nie samo to, ile pamięci oszczędza pojedyncze żądanie, lecz czy ta oszczędność zmniejszy łączną skalę wdrożeń. Na razie reakcja akcji Samsung Electronics i SK Hynix pokazuje obawę inwestorów — nie ostateczny bilans popytu na HBM.