O AI Infra Summit 2026, realizado de 15 a 17 de setembro no Santa Clara Convention Center, na Califórnia, mostrou que a corrida da inteligência artificial entrou em uma fase menos obcecada pelo acelerador isolado. Memória, energia, redes, automação do projeto de chips e sistemas especializados para inferência passaram a ocupar o mesmo palco que o poder computacional bruto.

Organizado pela Kisaco Research, o encontro foi presencial e reuniu apresentações sobre computação, movimentação de dados, data centers, armazenamento, software e IA física. A NVIDIA também programou sessões sobre infraestrutura para IA agentiva — sistemas capazes de executar sequências de tarefas — e publicou a agenda de Ian Buck, vice-presidente e gerente-geral de Hyperscale e HPC, para a abertura do evento.

O gargalo da IA deixou de ser apenas o processamento

O problema central discutido no encontro foi simples de explicar: um acelerador rápido não resolve tudo se os dados não chegam depressa, se a energia disponível não é bem aproveitada ou se os chips levam anos para ser projetados.

Em cargas agentivas, o processador precisa coordenar muitas etapas, chamadas de ferramentas e respostas de modelos. Isso aumenta a pressão sobre CPUs, memória e interconexões. Em data centers, a infraestrutura também precisa lidar com energia ociosa, transferência de dados entre máquinas e modelos com janelas de contexto cada vez maiores.

É por isso que as apresentações seguiram caminhos diferentes, mas conectados: a NVIDIA tratou de CPU e gestão de energia; d-Matrix e Qualcomm enfatizaram a memória; a Broadcom discutiu redes de escala; a Cognichip abordou o projeto de chips; e a Positron levou a conversa para aceleradores de inferência e implantação em nuvem.

NVIDIA combina Vera e gestão de energia

A NVIDIA apresentou dados do processador Vera para cargas de trabalho agentivas. Os números exibidos pela empresa indicaram uma vantagem de 50% a 100% sobre o AMD Turin nesse tipo de carga. A AMD, porém, apresentou uma afirmação concorrente de desempenho superior ao Vera, e as apresentações não estabeleceram um protocolo comum que permita transformar a disputa em um ranking universal.

A diferença é importante: os números servem para descrever as condições e as afirmações apresentadas no evento, não para decretar um vencedor geral entre as duas plataformas. Em infraestrutura, modelo utilizado, configuração, lote de processamento e métrica escolhida podem mudar bastante o resultado.

A NVIDIA também apresentou o DSX MaxLPS, um firmware de gerenciamento de energia para GPUs superdimensionadas. Segundo a apresentação, políticas de energia poderiam liberar capacidade ociosa do data center e permitir até 40% mais receita de AI Factory. Trata-se de uma projeção associada ao uso dessas políticas, não de uma medida universal de desempenho dos aceleradores.

d-Matrix e Qualcomm colocam a DRAM empilhada no centro da inferência

A DRAM empilhada apareceu como uma tentativa de aproximar memória e processamento. Na inferência, fase em que um modelo gera respostas, mover grandes volumes de dados pode se tornar tão limitante quanto executar as operações matemáticas. Mais largura de banda e mais capacidade por watt podem reduzir esse atrito.

A d-Matrix apresentou o Raptor, um acelerador planejado com DRAM empilhada. A empresa afirmou que o projeto poderia entregar dez vezes mais desempenho com um décimo do consumo de energia. Uma apresentação também registrou mais de 3.000 tokens por segundo no modelo GLM 5.2, em um contexto de 1 milhão de tokens. O gráfico indicou aproximadamente 3.153 tokens por segundo por usuário com lote de decodificação 8, 2.831 com lote 16 e 2.121 com lote 32.

O Raptor foi apresentado como um produto futuro, com previsão para 2027 em relação ao encontro de 2026. A d-Matrix também descreveu uma geração planejada para 2028 com múltiplos módulos de DRAM empilhada. O projeto Lightening, de prazo mais longo, foi associado a NVLink, ESUN e modelos na faixa de 20 trilhões de parâmetros.

A d-Matrix também descreveu uma arquitetura de inferência desagregada em parceria com a Parasail: GPUs NVIDIA H200 cuidariam do processamento de contexto, enquanto o d-Matrix Corsair faria a etapa de decodificação. A separação tenta usar cada tipo de hardware na parte do trabalho em que ele é mais adequado.

A Qualcomm apresentou o High Bandwidth Compute, com DRAM empilhada sobre um die lógico. A apresentação citou seis vezes mais largura de banda por watt que HBM e 200 vezes mais capacidade por watt que SRAM. São métricas apresentadas para essa arquitetura, ligadas ao desenho mostrado pela Qualcomm no evento.

A diferença entre as duas propostas está no estágio e no foco: a d-Matrix apresentou um acelerador futuro e números de inferência associados ao Raptor, enquanto a Qualcomm apresentou uma arquitetura de memória e sua relação entre largura de banda, capacidade e consumo.

ESUN tenta levar a rede de escala para além do rack

A Broadcom promoveu o Ethernet Scale-up Networking, ou ESUN, como uma abordagem aberta para conectar aceleradores em escala. Em vez de manter a comunicação de alto desempenho presa a tecidos proprietários, a proposta busca usar Ethernet em uma arquitetura associada ao Open Compute Project.

A série de switches Broadcom Tomahawk 6 foi apresentada com capacidade de 102,4 Tbps e descrita como silício em produção para o ecossistema. O objetivo mais amplo do ESUN é sair da comunicação dentro de um rack e avançar para ambientes com múltiplos racks e fileiras de equipamentos.

Essa transição não acontece com a simples instalação de um switch. Ela depende de padrões, software, cabos, óptica e compatibilidade entre fornecedores. A própria expansão de um ecossistema ESUN e UALink foi descrita como um processo de vários anos.

A iniciativa Optical Compute Interconnect segue uma direção semelhante, mas com interconexões ópticas para ampliar a escala entre racks e fileiras. A promessa prática é atacar o custo de transportar dados à medida que os clusters de IA crescem.

Cognichip mira o tempo necessário para criar novos chips

A Cognichip apresentou modelos de IA baseados em física para projeto de chips, em vez de usar modelos de linguagem de grande porte como solução principal. A empresa afirmou que sua abordagem poderia acelerar em até 100 vezes os ciclos de desenvolvimento.

A proposta ataca um gargalo menos visível que a velocidade de um acelerador: o tempo para projetar e fabricar o próprio hardware. Na apresentação, ciclos tradicionais de 18 a 30 meses foram comparados com uma projeção de três a seis meses para fluxos apoiados por ferramentas de IA.

Mesmo quando a arquitetura final não muda, encurtar o ciclo de projeto pode permitir mais iterações, correções e versões especializadas. Para fabricantes de chips, isso altera o cálculo entre esperar a próxima geração de silício e otimizar rapidamente uma plataforma para um tipo específico de modelo.

Positron leva aceleradores de inferência para a conversa sobre nuvem

A Positron AI afirmou ter levantado US$ 875 milhões com uma avaliação de US$ 5 bilhões. A empresa também declarou que estava implantando mais de 50 racks Atlas na Oracle Cloud Infrastructure.

O Atlas foi apresentado como um sistema de inferência com mais de 1 milhão de tokens de contexto. A Positron afirmou ainda que ele alcançaria mais de quatro vezes o throughput da NVIDIA e uma vantagem de três vezes em desempenho por dólar sobre a NVIDIA DGX H200. Esses números pertencem às comparações apresentadas pela empresa e dependem das condições de cada carga.

A Positron também mostrou o Titan como uma plataforma planejada. O roteiro descrito pela empresa prevê até 18,4 TB de memória por sistema, suporte a até 32 trilhões de parâmetros por servidor e janelas de contexto superiores a 10 milhões de tokens. São metas futuras de produto, não especificações de disponibilidade comercial corrente.

O que muda para quem constrói infraestrutura de IA

O AI Infra Summit 2026 deixou uma regra prática para arquitetos de data centers e equipes que implantam modelos: escolher hardware apenas pelo número bruto de operações pode levar a uma decisão incompleta.

Para cargas de inferência, a largura de banda e a capacidade da memória podem pesar mais que o pico teórico do acelerador. Para clusters maiores, a rede e a óptica determinam quanto do desempenho continua disponível quando os dados atravessam vários racks. Para operações em escala, o gerenciamento de energia pode definir quantos aceleradores cabem no limite físico do data center. E, no nível do fornecedor, ferramentas de projeto assistidas por IA podem reduzir o tempo entre uma necessidade nova e um chip especializado.

A disputa, portanto, está se espalhando por toda a pilha: CPU, memória, firmware, rede, óptica, software e aceleradores de inferência. É nesse conjunto — e não em uma única cifra de benchmark — que a próxima fase da infraestrutura de IA será decidida.