A notícia de que a DeepSeek teria reduzido suas necessidades de memória provocou uma reação imediata na Coreia do Sul: em 11 de setembro de 2026, as ações da Samsung Electronics caíram 3,5%, enquanto as da SK Hynix recuaram 2,2%. O movimento revela o receio dos investidores com a demanda por chips para inteligência artificial — mas não comprova uma queda permanente no consumo global de HBM.

A distinção é essencial. As técnicas associadas à DeepSeek reduzem a pressão sobre a memória em determinadas condições de inferência, especialmente na KV cache. Isso não equivale a eliminar a HBM nem permite calcular, sozinho, quantos chips os fabricantes venderão no futuro.

A reação às ações de memória da Coreia do Sul

Samsung Electronics e SK Hynix estão entre os principais nomes ligados à produção de memória usada em aceleradores de IA. Quando uma arquitetura promete fazer mais com menos memória, o mercado naturalmente pergunta se cada sistema precisará de menos HBM.

Foi esse temor que apareceu no movimento das ações em 11 de setembro. A queda foi uma reação de curto prazo à perspectiva de menor demanda, não uma medição de uma redução global já consumada. O efeito financeiro de longo prazo continua ligado a fatores mais amplos: quantos modelos serão usados, com que frequência, em quais comprimentos de contexto e em que escala de atendimento.

HBM, KV cache e Engram não são a mesma coisa

DeepSeek derruba ações de memória, mas não prova queda na demanda por HBM

HBM, ou memória de alta largura de banda, é uma forma de DRAM empilhada e instalada próxima ao acelerador. Essa posição permite movimentar grandes volumes de dados rapidamente durante o treinamento e a inferência de modelos de IA. A DDR5, por outro lado, é uma memória de sistema de uso geral; as duas não são intercambiáveis em todos os tipos de carga.

A KV cache é outra peça do quebra-cabeça. Durante a geração de texto, ela guarda estados de chave e valor usados pela atenção do Transformer. Como seu tamanho cresce com o contexto, uma conversa muito longa pode aumentar bastante a pressão sobre a memória do acelerador.

A Multi-Head Latent Attention (MLA) aborda esse problema comprimindo as informações de chave e valor em representações latentes que podem ser armazenadas durante a inferência. É uma técnica voltada ao estado da atenção — não uma declaração de que todos os componentes do sistema passaram a exigir menos HBM.

O Engram segue uma rota diferente. Sua arquitetura usa memória condicional e uma hierarquia de memória externa para manter parte do conhecimento recuperável fora da memória imediata do acelerador. Na prática, isso pode aliviar a pressão sobre a memória local em situações específicas, mas não transforma a HBM em um componente dispensável.

O que os números de DeepSeek realmente medem

Uma divulgação atribuída à DeepSeek V4 foi associada a dois números em contexto de um milhão de tokens: 10% da KV cache da DeepSeek V3.2 e 27% dos FLOPs de inferência de um único token em relação à geração anterior. Esses valores dizem respeito a métricas específicas de inferência e não devem ser apresentados como uma redução equivalente na capacidade física total de HBM.

Outra comparação visual entre DeepSeek V4-Pro e DeepSeek V3.2 indica uma KV cache acumulada 13,7 vezes menor na sequência de 1.024K tokens. Esse número usa outro modelo identificado, outra apresentação e uma métrica própria. Ele não pode ser combinado automaticamente com o valor de 10% da KV cache como se ambos descrevessem exatamente a mesma configuração.

O ponto prático é simples: uma cache menor pode permitir que determinada carga de inferência use a memória com mais eficiência. Ainda permanecem na conta os pesos do modelo, as ativações, as operações de atenção, a comunicação entre aceleradores e o volume de solicitações atendidas ao mesmo tempo.

Por que menor pressão de memória não significa menos HBM

Imagine uma cozinha que reorganiza os ingredientes e libera espaço na bancada. Isso ajuda bastante durante o preparo, mas não elimina a geladeira, os armários nem a necessidade de cozinhar para mais pessoas. A otimização de memória funciona de maneira parecida.

A compressão da KV cache pode reduzir o espaço ocupado pelo estado da atenção. O Engram pode deslocar parte do conhecimento para outra camada da hierarquia de memória. Nenhuma dessas mudanças, isoladamente, informa quanta HBM será necessária para armazenar pesos, executar operações, trocar dados entre aceleradores ou sustentar uma implantação de alto rendimento.

Também existe uma possibilidade econômica na direção oposta. Se a inferência ficar mais barata, empresas e usuários podem ampliar o número de solicitações e aplicações de IA. Esse raciocínio, associado ao chamado paradoxo de Jevons, é uma hipótese — não uma medição do mercado. Eficiência por solicitação e demanda total podem caminhar em sentidos diferentes.

O que pode determinar a próxima reação do mercado

No curto prazo, a promessa de usar menos memória alimenta a preocupação com a venda de componentes para cada sistema de IA. No horizonte mais longo, porém, a demanda dependerá do crescimento efetivo do uso de modelos e da infraestrutura necessária para atendê-lo.

Ha SeokKeun, diretor de investimentos da Eugene Asset Management, separou esses dois horizontes ao apontar que a DeepSeek poderia aumentar a preocupação imediata com a demanda por semicondutores, enquanto modelos de empresas como Meta Platforms e OpenAI poderiam influenciar mais os fundamentos do setor ao ampliar o uso real de IA.

Essa leitura evita dois saltos fáceis — e igualmente arriscados. A eficiência da DeepSeek não prova que a demanda por HBM entrou em colapso; a reação das ações também não prova que o consumo de memória continuará crescendo sem limites.

O limite prático da conclusão

Para quem acompanha IA e semicondutores, a conclusão útil é esta: a DeepSeek pode reduzir a pressão sobre a memória de inferência em determinadas condições, mas isso não significa que deixou de precisar de HBM. KV cache, MLA e Engram atacam partes diferentes do problema, enquanto a infraestrutura completa continua dependendo do modelo, do contexto, do volume de usuários e do modo de implantação.

Por isso, os recuos de 3,5% da Samsung Electronics e 2,2% da SK Hynix em 11 de setembro devem ser lidos como uma reação às expectativas do mercado. O próximo dado realmente importante não é apenas uma porcentagem de compressão, mas o efeito combinado entre eficiência por tarefa e o número total de tarefas de IA que o setor conseguirá — ou desejará — executar.