AI Infra Summit 2026, celebrada del 15 al 17 de septiembre de 2026 en el Santa Clara Convention Center de California, dejó una señal importante para la industria: el cuello de botella de la inteligencia artificial ya no está únicamente en fabricar aceleradores más rápidos. La memoria, el consumo eléctrico, las redes, el diseño de chips y la forma de ejecutar la inferencia pesan cada vez más en el coste y el rendimiento de un sistema completo.

La cumbre, organizada por Kisaco Research, reunió propuestas para la infraestructura de la IA agéntica y de producción: desde procesadores y memoria hasta centros de datos, almacenamiento, software, interconexión y sistemas de IA física. El evento fue presencial y sus sesiones cubrieron una cadena tecnológica mucho más amplia que la de una presentación de producto convencional.

El problema ya no es solo sumar aceleradores

La IA agéntica —sistemas capaces de encadenar tareas y llamadas a modelos— cambia la presión sobre los centros de datos. No basta con que una GPU procese muchos datos si el sistema pierde tiempo moviendo información, esperando memoria o gestionando energía sobrante.

Por eso, las propuestas presentadas en Santa Clara se concentraron en cuatro frentes: llevar los datos más rápido a los chips, aprovechar mejor la potencia disponible, conectar más aceleradores y acortar los ciclos de diseño. La velocidad bruta sigue importando, pero dejó de ser una métrica suficiente para describir el rendimiento de una plataforma completa.

NVIDIA apunta a las cargas agénticas y a la energía desperdiciada

NVIDIA presentó datos de su CPU Vera para cargas de trabajo agénticas. Según la comparación expuesta por NVIDIA, Vera ofrecía entre un 50 % y un 100 % más de rendimiento que AMD Turin en esas cargas. AMD, por su parte, presentó una afirmación de rendimiento superior al de Vera; las dos posiciones no están respaldadas por una metodología común que permita convertirlas en una clasificación general entre ambos procesadores.

La otra propuesta destacada fue DSX MaxLPS, un firmware de gestión energética para GPU sobredimensionadas. NVIDIA planteó que aplicar políticas de potencia para reducir la capacidad eléctrica infrautilizada podría permitir un 40 % más de ingresos en una AI Factory. Es una proyección asociada a la gestión de la energía, no una medición universal del rendimiento de los centros de datos.

La idea es relevante porque una instalación puede tener suficientes aceleradores instalados y, aun así, no poder mantenerlos todos a plena potencia por las limitaciones de la red eléctrica, la refrigeración o la distribución interna. En ese escenario, controlar el consumo forma parte del rendimiento efectivo.

d-Matrix y Qualcomm colocan la memoria en el centro de la inferencia

La inferencia es la fase en la que un modelo ya entrenado genera respuestas. En modelos grandes, el procesador puede pasar tanto tiempo esperando datos como calculándolos. La DRAM apilada intenta reducir ese problema colocando más memoria cerca de la lógica de procesamiento y aumentando el ancho de banda disponible.

d-Matrix presentó Raptor, un acelerador de inferencia planificado con DRAM apilada. La empresa afirmó que su diseño podría alcanzar diez veces más rendimiento con una décima parte del consumo frente a una referencia no especificada en la presentación. También mostró un resultado de más de 3.000 tokens por segundo con GLM 5.2 y un contexto de un millón de tokens; el gráfico asociado marcaba aproximadamente 3.153 tokens por segundo con un lote de decodificación de ocho usuarios.

Raptor no se presentó como un producto ya disponible. La hoja de ruta situaba su llegada después de la cumbre de 2026, mientras que una generación posterior, prevista para 2028, incorporaría varios troqueles de DRAM apilada. d-Matrix también describió Lightening como una dirección futura compatible con NVLink, ESUN y modelos de hasta 20 billones de parámetros.

Qualcomm mostró otra aproximación con High Bandwidth Compute (HBC). En este caso, la DRAM apilada se coloca sobre un troquel lógico. La presentación de Qualcomm citó seis veces más ancho de banda por vatio que HBM y 200 veces más capacidad por vatio que SRAM.

La diferencia entre ambas propuestas importa: d-Matrix habló de un acelerador de inferencia concreto y de una hoja de ruta, mientras que Qualcomm presentó una arquitectura de memoria junto con una CPU para centros de datos y relaciones de chips personalizados. En ambos casos, la promesa es atacar el movimiento de datos, no únicamente añadir unidades de cálculo.

ESUN busca sacar la interconexión del recinto propietario

Ethernet Scale-up Networking (ESUN) es una propuesta de red de escala superior basada en Ethernet abierto. Su objetivo es conectar procesadores y aceleradores dentro de sistemas de IA sin depender exclusivamente de una interconexión propietaria.

Broadcom vinculó ESUN al Open Compute Project y presentó la familia de conmutadores Tomahawk 6, con una capacidad comunicada de 102,4 Tbps. La compañía también situó esta tecnología dentro de una evolución hacia sistemas de varios bastidores y varias filas, apoyada por interconexiones ópticas.

La ventaja de una red abierta no aparece de la noche a la mañana. Un ecosistema de este tipo necesita hardware compatible, software, estándares y suficientes proveedores. La expansión de ESUN y de UALink se planteó como un proceso de varios años, no como un cambio instantáneo en los centros de datos existentes.

La IA también quiere acelerar el diseño de chips

Cognichip presentó modelos de IA basados en la física para diseñar chips, en lugar de utilizar únicamente grandes modelos de lenguaje. Estos sistemas pueden trabajar con restricciones eléctricas, térmicas y geométricas propias del diseño de semiconductores.

Cognichip afirmó que su tecnología puede acelerar hasta 100 veces los ciclos de diseño. La promesa apunta a uno de los límites menos visibles de la infraestructura: aunque exista demanda de nuevos procesadores, diseñarlos y fabricarlos sigue requiriendo ciclos largos. Acortar esa etapa permitiría adaptar antes los chips a nuevos modelos, memorias y topologías de red.

Positron lleva la conversación de los chips al despliegue en la nube

Positron comunicó una financiación de 875 millones de dólares con una valoración de 5.000 millones de dólares. La empresa también afirmó que estaba desplegando más de 50 bastidores Atlas en Oracle Cloud Infrastructure.

Atlas se presentó como un sistema de inferencia. Positron afirmó que ofrecía tres veces más rendimiento por dólar que NVIDIA DGX H200 y más de cuatro veces el rendimiento de NVIDIA en otra comparación de la compañía, además de ventanas de contexto superiores a un millón de tokens. Son cifras vinculadas a materiales de Positron y a sus condiciones de comparación.

La hoja de ruta de Titan, todavía futura, apunta a hasta 18,4 TB de memoria por sistema, hasta 32 billones de parámetros por servidor y ventanas de contexto superiores a 10 millones de tokens. Esas cifras describen el objetivo del producto, no una disponibilidad comercial actual.

Qué cambia para quienes diseñan infraestructura de IA

La cumbre dibujó una decisión más compleja que la de elegir el acelerador con la cifra de rendimiento más alta. Un sistema de IA debe evaluarse según el modelo que ejecutará, el tamaño del contexto, el patrón de inferencia, el ancho de banda de memoria, la potencia disponible y la red que conectará sus componentes.

En la práctica, eso desplaza la atención hacia métricas más concretas:

  • Memoria: capacidad, latencia y ancho de banda para evitar que los procesadores esperen datos.
  • Energía: rendimiento útil por vatio y capacidad de mantener la instalación dentro de sus límites eléctricos y térmicos.
  • Interconexión: velocidad y apertura de la red entre aceleradores, CPU y sistemas de almacenamiento.
  • Software: compatibilidad con los modelos, los compiladores y las herramientas de operación del centro de datos.
  • Carga de trabajo: tokens por segundo, tamaño de contexto y coste por inferencia bajo condiciones comparables.

AI Infra Summit 2026 no presentó una plataforma única ni un ganador definitivo. Presentó algo más útil para entender la siguiente fase del sector: aumentar la potencia de cálculo seguirá siendo necesario, pero el rendimiento real dependerá cada vez más de todo lo que ocurre alrededor del acelerador.