L’AI Infra Summit 2026, svolto dal 15 al 17 settembre 2026 al Santa Clara Convention Center di Santa Clara, in California, ha raccontato una competizione sull’intelligenza artificiale che ormai va ben oltre la velocità nominale degli acceleratori. Le presentazioni di NVIDIA, d-Matrix, Qualcomm, Broadcom, Cognichip e Positron AI hanno concentrato l’attenzione su memoria, potenza elettrica, reti, progettazione dei chip e sistemi di inferenza.
L’evento, organizzato da Kisaco Research, si è svolto interamente in presenza e ha affrontato l’infrastruttura necessaria per l’AI agentica e per i carichi di lavoro su scala produttiva. NVIDIA ha indicato un pubblico superiore alle 8.000 persone tra ingegneri, architetti, professionisti tecnici e dirigenti. Le sessioni registrate da NVIDIA sarebbero state pubblicate entro 72 ore dall’evento.
Il collo di bottiglia non è più soltanto il calcolo
La questione emersa con maggiore chiarezza è semplice: aggiungere acceleratori non basta se i dati non arrivano abbastanza rapidamente, se il data center non riesce ad alimentare tutti i componenti o se la rete limita la comunicazione tra i chip.
Questo vale soprattutto per i sistemi agentici, nei quali un modello può generare una sequenza di azioni e chiamate a strumenti invece di produrre una singola risposta. In questi scenari il processore, la memoria e l’interconnessione devono tenere il passo con un flusso continuo di dati. Per questo l’infrastruttura discussa a Santa Clara comprendeva calcolo, data center, storage, networking, software e physical AI, non soltanto GPU.
La conseguenza pratica è importante per chi progetta cluster: la scelta dell’acceleratore resta fondamentale, ma va valutata insieme a larghezza di banda della memoria, consumi, topologia di rete, software compatibile e tipo di inferenza richiesto.
NVIDIA porta Vera e DSX MaxLPS sul fronte dei carichi agentici
NVIDIA ha presentato dati sul processore Vera per i carichi di lavoro agentici. Secondo i dati illustrati da NVIDIA, Vera avrebbe ottenuto un vantaggio compreso tra il 50% e il 100% rispetto ad AMD Turin in quei carichi. AMD, attraverso Forrest Norrod, ha presentato a sua volta una valutazione favorevole alle proprie prestazioni rispetto a Vera: il confronto tra i due processori non si è quindi trasformato in un verdetto generale valido per ogni configurazione.
La distinzione conta perché prestazioni, numero di agenti, modelli utilizzati e configurazione del sistema possono cambiare il risultato. Un dato relativo a uno specifico carico agentico non equivale automaticamente a una classifica universale dei processori.
NVIDIA ha inoltre introdotto DSX MaxLPS, un firmware per la gestione della potenza delle GPU sovra-provisionate. La presentazione ha associato l’applicazione di politiche energetiche a un possibile aumento del 40% dei ricavi di un’AI Factory, riducendo la quota di potenza del data center che rimane inutilizzata. Si tratta di una stima legata alla gestione dell’infrastruttura, non di una prestazione computazionale del chip.
d-Matrix e Qualcomm puntano sulla DRAM impilata
La DRAM impilata è una memoria collocata in una configurazione tridimensionale molto vicina al componente logico che la utilizza. L’obiettivo è accorciare il percorso dei dati e aumentare la capacità o la banda disponibili per l’inferenza, cioè la fase in cui un modello già addestrato genera una risposta.
d-Matrix ha presentato Raptor, un acceleratore di inferenza pianificato con DRAM impilata. L’azienda ha dichiarato un obiettivo di 10 volte le prestazioni con un decimo della potenza, oltre a un risultato superiore a 3.000 token al secondo su GLM 5.2. La presentazione indicava circa 3.153 token al secondo per utente con un contesto da 1 milione di token e batch di decodifica pari a 8; con batch di 16 e 32, i valori mostrati scendevano rispettivamente a circa 2.831 e 2.121 token al secondo.
Raptor era indicato come prodotto previsto per il 2027. d-Matrix ha inoltre descritto una generazione del 2028 con più strati di DRAM impilata e una roadmap Lightening destinata a modelli nell’ordine dei 20.000 miliardi di parametri. Sono obiettivi di sviluppo, non caratteristiche di un prodotto già disponibile.
Qualcomm ha presentato invece High Bandwidth Compute, con DRAM impilata su un die logico. I dati della presentazione indicavano una banda per watt sei volte superiore rispetto a HBM e una capacità per watt 200 volte superiore rispetto a SRAM. Questi valori descrivono l’approccio illustrato da Qualcomm; non definiscono da soli le prestazioni di ogni prodotto o configurazione futura.
Le due proposte affrontano lo stesso problema da angolazioni diverse: d-Matrix ha collegato la memoria a un acceleratore dedicato all’inferenza, mentre Qualcomm ha presentato una piattaforma di memoria e calcolo pensata per aumentare banda e capacità per watt.
ESUN porta la rete tra rack al centro del progetto
Ethernet Scale-up Networking, o ESUN, è un approccio aperto alla rete scale-up, cioè alla connessione ad alta velocità tra i componenti che collaborano all’interno di un sistema AI. Broadcom lo ha promosso come alternativa aperta ai fabric proprietari e lo ha collegato al lavoro dell’Open Compute Project.
Nel contesto di ESUN, la serie di switch Broadcom Tomahawk 6 è stata associata a una capacità di commutazione di 102,4 Tbps e a una produzione in volume avviata all’inizio del 2026. L’adozione di un ecosistema ESUN e UALink richiede però più anni: switch, collegamenti, schede, firmware e software devono funzionare insieme prima che una rete aperta possa diventare una scelta diffusa nei cluster.
La stessa direzione riguarda l’ottica. L’Optical Compute Interconnect, presentato come iniziativa nata nel marzo 2026, punta a sviluppare standard ottici aperti per spostare le connessioni scale-up dai sistemi confinati in un singolo rack verso più rack e file di rack.
Cognichip prova ad accorciare il ciclo di progettazione dei chip
Cognichip ha mostrato modelli di IA basati sulla fisica per la progettazione dei chip, invece di grandi modelli linguistici generalisti. L’azienda ha dichiarato che il proprio approccio può accelerare fino a 100 volte i cicli di progettazione.
Il tema è particolarmente rilevante perché un nuovo chip richiede normalmente una lunga sequenza di progettazione, verifica, fabbricazione e validazione. La stima citata durante il summit colloca il ciclo tradizionale tra 18 e 30 mesi e ipotizza un intervallo di 3–6 mesi con strumenti di progettazione assistiti dall’IA.
Un’accelerazione di questo tipo cambierebbe la frequenza con cui le aziende possono adattare un chip a un modello, a un’interconnessione o a un vincolo energetico. Per ora, tuttavia, il vantaggio resta una dichiarazione legata alla soluzione presentata da Cognichip.
Positron porta gli acceleratori startup nella discussione cloud
Positron AI ha dichiarato di aver raccolto 875 milioni di dollari a una valutazione di 5 miliardi di dollari. L’azienda ha inoltre dichiarato di stare implementando più di 50 rack Atlas presso Oracle Cloud Infrastructure.
Atlas è il sistema di inferenza presentato da Positron. L’azienda ha rivendicato un vantaggio di tre volte nel rapporto prestazioni-prezzo rispetto a NVIDIA DGX H200, oltre a finestre di contesto superiori a 1 milione di token e una velocità più di quattro volte superiore a quella di NVIDIA nella propria comparazione.
Il progetto futuro Titan è stato descritto con un massimo di 18,4 TB di memoria per sistema, fino a 32.000 miliardi di parametri per server e finestre di contesto oltre 10 milioni di token. Sono specifiche di roadmap: descrivono il sistema pianificato da Positron AI, non una disponibilità commerciale già attiva.
Cosa cambia per chi costruisce infrastrutture AI
L’AI Infra Summit 2026 ha spostato il criterio di valutazione da una domanda unica — «quanti calcoli al secondo produce questo chip?» — a una serie di domande più concrete:
- quanta memoria è disponibile e con quale banda;
- quanta potenza richiede il sistema quando il carico cresce;
- come comunicano tra loro chip, rack e file di rack;
- quanto il software riesce a sfruttare l’hardware;
- quanto tempo serve per progettare e aggiornare un nuovo componente;
- se il sistema è ottimizzato per addestramento, inferenza o carichi agentici.
Per un cluster destinato all’inferenza, la latenza della memoria può contare più del picco teorico dell’acceleratore. Per un data center, la rete e la gestione della potenza possono determinare quanta capacità resta realmente utilizzabile. Per un produttore di chip, infine, il ciclo di progettazione può diventare un limite strategico quanto il processo produttivo.
È questa la trasformazione raccontata dalle presentazioni di Santa Clara: l’infrastruttura AI sta diventando un problema di sistema, nel quale memoria, energia, interconnessioni e software devono avanzare insieme al calcolo.