Le 11 septembre 2026, les actions de Samsung Electronics et de SK Hynix ont reculé de 3,5 % et 2,2 % en Corée du Sud après des informations selon lesquelles DeepSeek aurait besoin de moins de mémoire HBM. Le signal est important pour le marché des semi-conducteurs, mais il ne signifie pas que la demande mondiale de HBM a durablement baissé : les optimisations décrites concernent surtout certaines formes de pression mémoire pendant l’inférence.

La réaction des fabricants de mémoire

La baisse des deux groupes sud-coréens traduit une inquiétude immédiate des investisseurs face à la possibilité que chaque requête d’IA mobilise moins de mémoire spécialisée. Elle ne permet pas, à elle seule, de mesurer l’évolution des commandes de HBM, des capacités installées ou des revenus des fabricants.

Le contexte boursier reste d’ailleurs plus large que DeepSeek. Les deux actions étaient signalées à plus de 25 % sous leurs plus hauts historiques, tandis que les comparaisons de valorisation mentionnaient un ratio cours/valeur comptable de 2,7 pour Samsung Electronics et de 5 pour SK Hynix, contre 11 pour l’indice Philadelphia Semiconductor Index. Ces chiffres décrivent le contexte du 11 septembre 2026, pas une recommandation d’investissement.

HBM, KV cache et Engram : trois notions à ne pas confondre

DeepSeek fait reculer Samsung Electronics et SK Hynix, sans annoncer la fin de la HBM

La HBM est une mémoire DRAM constituée de puces empilées et placée au plus près d’un accélérateur. Elle fournit une bande passante élevée aux calculs d’IA. La DDR5, elle, sert de mémoire système généraliste : les deux technologies ne sont donc pas interchangeables dans tous les usages.

Le KV cache est une zone de mémoire utilisée pendant l’inférence pour conserver les états clé/valeur de l’attention. Sa taille augmente avec la longueur du contexte et peut peser lourd dans les besoins mémoire d’un modèle. Réduire ce cache allège la pression sur l’accélérateur, mais ne revient pas à supprimer les autres besoins de la machine.

DeepSeek s’appuie ici sur deux approches différentes :

  • Multi-Head Latent Attention (MLA) compresse les informations clé/valeur dans des représentations latentes qui sont ensuite conservées pendant l’inférence ;
  • Engram utilise une mémoire conditionnelle et une hiérarchie capable de déporter une partie des connaissances statiques ou récupérables hors de la mémoire de l’accélérateur.

Ces mécanismes ne décrivent donc pas la même chose. MLA agit sur les représentations mises en cache par l’attention ; Engram organise autrement le stockage d’une partie de l’information. Dans les deux cas, l’objectif est de réduire une pression mémoire précise, pas de faire disparaître la HBM.

Les chiffres de DeepSeek restent attachés à leur métrique

Des chiffres attribués à DeepSeek V4 évoquent 10 % du KV cache de DeepSeek V3.2 et 27 % de ses FLOPs d’inférence à jeton unique pour un contexte d’un million de tokens. Ils décrivent une comparaison précise entre deux versions, une métrique et une longueur de contexte données ; ils ne peuvent pas être transformés en « 90 % de HBM en moins ».

Un autre graphique associé à DeepSeek V4-Pro montre un KV cache cumulé 13,7 fois inférieur à celui de DeepSeek V3.2 à une longueur de séquence de 1 024K tokens. Cette valeur concerne le KV cache et cette condition de séquence. Elle ne constitue pas une mesure directe de la capacité physique totale de HBM installée dans un système.

C’est le point essentiel : KV cache, mémoire de l’accélérateur et capacité totale de HBM ne sont pas des synonymes. Les poids du modèle, les activations, les opérations d’attention, les échanges entre accélérateurs, le débit visé et la forme des charges de travail continuent de compter.

Pourquoi une pression mémoire plus faible ne suffit pas à prévoir la demande

Une architecture plus efficace peut permettre de faire tenir davantage de tâches dans une même enveloppe matérielle. Mais une infrastructure d’IA ne se résume pas à la mémoire consommée par une seule requête. Le nombre d’utilisateurs, la longueur des contextes, le parallélisme, l’entraînement et le débit recherché changent aussi l’équation.

Le raisonnement inverse est également possible : si l’inférence devient moins coûteuse, son usage peut s’étendre. Cette idée, souvent rapprochée du paradoxe de Jevons, pourrait compenser une partie de la mémoire économisée par requête. Elle reste une hypothèse sur l’évolution du marché, pas un résultat mesuré.

L’optimisation logicielle illustre la même limite. Les systèmes NVIDIA H100 et NVIDIA H800 sont présentés avec des bandes passantes d’interconnexion respectives de 900 GB/s et 400 GB/s dans une comparaison technique. Adapter les calculs, employer la précision FP8 ou compresser les données peut aider à composer avec une contrainte de bande passante ; cela ne supprime pas pour autant les besoins de capacité mémoire.

Ce que les chiffres boursiers montrent

Entreprise ou indiceVariation rapportée le 11 septembre 2026Ratio cours/valeur comptable rapportéÉcart par rapport au plus haut historique rapporté
Samsung Electronics−3,5 %2,7Plus de 25 % sous le plus haut
SK Hynix−2,2 %5Plus de 25 % sous le plus haut
Philadelphia Semiconductor Index11

Cette comparaison montre surtout la nervosité du marché autour des fabricants de mémoire. Elle ne permet pas de départager l’effet propre de DeepSeek, l’évolution de la demande liée à d’autres modèles ou les mouvements plus larges du secteur des semi-conducteurs.

Le prochain indicateur sera l’usage global de l’IA

À court terme, une baisse de la mémoire nécessaire par tâche peut alimenter les craintes sur la demande de composants. À plus long terme, l’effet dépendra de l’ampleur des usages supplémentaires rendus possibles par des modèles moins gourmands. Ha SeokKeun estime que les modèles de Meta Platforms et d’OpenAI pourraient peser davantage sur les fondamentaux du secteur s’ils favorisent une utilisation plus large de l’IA.

La conclusion solide est donc plus étroite que le titre de certaines annonces : DeepSeek peut réduire la pression exercée sur la mémoire lors de certaines inférences grâce à la compression du KV cache et au déport de mémoire. Cela ne prouve ni la disparition de la HBM, ni une baisse durable de sa demande mondiale. Pour les fabricants comme pour les utilisateurs d’IA, la vraie variable sera le volume total de calcul déployé — pas seulement la mémoire économisée par requête.