La reacción bursátil fue inmediata: el 11 de septiembre de 2026, las acciones de Samsung Electronics cayeron un 3,5% y las de SK Hynix un 2,2% en Corea del Sur después de que se difundiera que DeepSeek necesitaba menos memoria de alto ancho de banda (HBM) para sus modelos. El movimiento refleja una preocupación a corto plazo, no una prueba de que la demanda mundial de HBM haya entrado en una caída permanente.

La clave está en no mezclar tres cosas distintas: la HBM física instalada junto al acelerador, la memoria que un modelo utiliza durante la inferencia y la demanda total de chips para centros de datos. Parecen primas hermanas, pero no son la misma persona.

La reacción de Samsung Electronics y SK Hynix

HBM significa High-Bandwidth Memory: una DRAM formada por varios chips apilados y colocada cerca del acelerador para mover grandes volúmenes de datos con rapidez. Es especialmente importante en cargas de inteligencia artificial, donde el procesador puede avanzar a un ritmo que la memoria convencional no alcanza.

La noticia sobre DeepSeek puso el foco en el posible efecto sobre los fabricantes de memoria. Samsung Electronics y SK Hynix sufrieron las caídas mencionadas en la bolsa surcoreana, pero ese movimiento mide la reacción de los inversores ante una expectativa concreta: que una inferencia más eficiente reduzca parte de la memoria necesaria por servicio.

No mide, por sí solo, cuánta HBM necesitarán todos los modelos, centros de datos y cargas de trabajo de IA.

HBM, KV cache y Engram: tres piezas distintas

DeepSeek sacude a Samsung y SK Hynix por la memoria HBM

La KV cache es una zona de memoria que conserva estados de atención durante la generación de texto. Al reutilizar esos datos, el modelo evita recalcular parte del trabajo; el problema es que la caché crece a medida que aumenta el contexto. En conversaciones o documentos muy largos, puede convertirse en una presión importante para la memoria del acelerador.

Multi-Head Latent Attention (MLA) aborda ese problema comprimiendo las representaciones de claves y valores que se guardan durante la inferencia. El objetivo es reducir el tamaño de ese estado almacenado, no eliminar las necesidades de memoria del sistema completo.

Engram sigue otra ruta. Su arquitectura utiliza memoria condicional y una jerarquía externalizada para recuperar determinados conocimientos sin mantenerlo todo dentro de la memoria del acelerador. Es una forma de desplazar parte de la carga, no una declaración de que la HBM deje de ser necesaria.

La diferencia importa porque una reducción de la KV cache no se puede convertir automáticamente en un porcentaje equivalente de HBM física. La memoria también debe alojar pesos del modelo, activaciones y otros datos que participan en el cálculo.

Por qué una menor presión de memoria no significa menos HBM

La inferencia no es una operación aislada. Depende de la longitud del contexto, el número de solicitudes simultáneas, el rendimiento exigido, la comunicación entre aceleradores y la forma concreta del modelo.

Una optimización puede permitir que un acelerador trabaje con menos presión en una condición determinada. Eso puede mejorar la eficiencia del servicio, pero no implica que todos los despliegues necesiten menos capacidad física ni que los fabricantes vayan a vender menos HBM.

También hay una diferencia importante entre HBM y DDR5. La DDR5 es memoria principal de propósito general; la HBM está diseñada para ofrecer un ancho de banda mucho mayor y se integra cerca del acelerador. No son piezas intercambiables en cualquier carga de trabajo.

El contexto técnico también incluye optimizaciones de atención como Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA). Estas técnicas buscan reducir el volumen de información que debe conservarse o procesarse durante la inferencia. Su efecto pertenece a la eficiencia de una arquitectura y una carga concretas, no a una medición universal de la demanda de HBM.

Dos lecturas para la demanda de chips

La primera lectura es la que dominó el mercado el 11 de septiembre: si cada consulta de IA requiere menos memoria, los inversores pueden temer una menor demanda de chips a corto plazo. Esa preocupación explica el movimiento de Samsung Electronics y SK Hynix, pero no basta para convertir una reacción bursátil en una previsión industrial.

La segunda lectura apunta en dirección contraria. Si ejecutar modelos resulta más barato, podrían crecer el número de consultas, los servicios desplegados y el uso de IA. Esa posibilidad se conoce como paradoja de Jevons: una mejora de eficiencia puede impulsar el consumo total del recurso cuando amplía su uso. Aquí sigue siendo una hipótesis sobre el mercado, no un resultado medido.

El efecto final dependerá de qué crezca más: el ahorro de memoria por inferencia o la cantidad total de inferencias y sistemas que se pongan en funcionamiento.

Los números que vigilan los inversores

La reacción registrada en Corea del Sur fue distinta para cada fabricante. Las valoraciones y la distancia respecto a los máximos sirven como contexto de mercado, pero no constituyen una recomendación de inversión.

EmpresaMovimiento bursátil reportado el 11 de septiembre de 2026Precio/valor contableDistancia respecto al máximo histórico
Samsung Electronics−3,5%2,7×Más del 25% por debajo
SK Hynix−2,2%Más del 25% por debajo
Índice de semiconductores de Filadelfia11×

La tabla muestra por qué la reacción no debe leerse como una medición directa de la memoria que utilizarán los centros de datos. Una acción puede caer por las expectativas sobre beneficios futuros, por la valoración previa o por el temor a un cambio tecnológico sin que exista todavía una caída demostrada de la demanda física de HBM.

La conclusión que sí permiten los datos

DeepSeek ha puesto sobre la mesa técnicas capaces de reducir la presión de memoria durante determinadas inferencias. MLA comprime estados de atención; Engram externaliza parte del conocimiento condicional; y otros métodos de atención buscan reducir el trabajo y la memoria asociados a contextos largos.

Eso no equivale a decir que DeepSeek ya no necesite HBM. Los pesos, las activaciones, la atención, la comunicación y el rendimiento de despliegue siguen formando parte de la ecuación. Tampoco permite afirmar que la demanda mundial de HBM vaya a reducirse de forma permanente.

Lo que sí está claro tras la caída de Samsung Electronics y SK Hynix es que el mercado teme esa posibilidad. La respuesta tecnológica, sin embargo, es más precisa: menos memoria de inferencia en ciertas condiciones no significa automáticamente menos HBM para toda la industria.