AI Infra Summit 2026 liet van 15 tot en met 17 september in Santa Clara zien dat de volgende fase van AI-infrastructuur niet alleen om snellere accelerators draait. De presentaties draaiden ook om geheugenbandbreedte, stroombenutting, netwerken, chipontwerp en de vraag hoe modellen efficiënt antwoorden genereren. De conferentie vond volledig fysiek plaats in het Santa Clara Convention Center, op 5001 Great America Parkway.
De organisator Kisaco Research bracht bedrijven samen die elk een ander knelpunt aanpakten. NVIDIA sprak over CPU-prestaties en energiebeheer, d-Matrix en Qualcomm over geheugen voor inferentie, Broadcom over scale-up-netwerken, Cognichip over chipontwerp en Positron AI over gespecialiseerde systemen voor cloudinfrastructuur.
De centrale verschuiving: AI heeft meer nodig dan rekenkracht
Bij agentische AI voert een systeem meerdere stappen achter elkaar uit. Daardoor telt niet alleen hoeveel berekeningen een accelerator per seconde uitvoert. Ook de snelheid waarmee data tussen processor, geheugen en netwerk beweegt, bepaalt hoe lang een taak duurt en hoeveel energie een datacenter verbruikt.
De conferentie legde daardoor een infrastructuurprobleem bloot dat breder is dan de bekende wedloop om de krachtigste GPU. Geheugen kan de rekenkernen laten wachten, stroombeperkingen kunnen geïnstalleerde capaciteit onbenut laten en een chipontwerp kan jaren kosten voordat het in een datacenter belandt.
NVIDIA richt Vera en DSX MaxLPS op agentische workloads en energie
NVIDIA presenteerde gegevens over Vera, zijn CPU-platform voor AI-infrastructuur. Volgens die presentatie lag Vera op agentische workloads 50 tot 100 procent boven AMD Turin. Forrest Norrod van AMD presenteerde tijdens dezelfde conferentie een tegengestelde prestatieclaim over Vera. De twee claims horen dus bij verschillende bedrijfsmetingen en geven geen eenvoudige, algemene ranglijst.
NVIDIA introduceerde daarnaast DSX MaxLPS, firmware voor het beheren van het vermogen van overgeprovisioneerde GPU’s. NVIDIA koppelde het systeem aan een mogelijke stijging van 40 procent in AI Factory-omzet, doordat datacentervermogen doelgerichter zou kunnen worden verdeeld.
Het praktische punt is belangrijker dan het spectaculaire percentage: in een AI-datacenter is beschikbare stroom zelf een productiefactor. Een gebouw kan veel accelerators bevatten, maar die capaciteit levert pas waarde op wanneer voeding, koeling en softwarebeleid de hardware tegelijk kunnen benutten.
Gestapeld DRAM moet inferentie minder afhankelijk maken van geheugenbandbreedte
Bij inferentie genereert een model antwoorden op basis van een ingevoerde prompt. Vooral bij lange contexten en grote batches moet het systeem voortdurend modeldata ophalen. Gestapeld DRAM plaatst geheugen fysiek dichter bij de logica, waardoor de afstand voor datatransport kleiner wordt en de geheugenvoorziening anders kan worden ontworpen dan met conventioneel SRAM of HBM.
d-Matrix Raptor: gepland voor hoge inferentiedoorvoer
d-Matrix presenteerde Raptor als een geplande accelerator met gestapeld DRAM. Het bedrijf claimde tien keer de prestaties bij een tiende van het vermogen. Een presentatie koppelde Raptor bovendien aan meer dan 3.000 tokens per seconde bij GLM 5.2 met een context van 1 miljoen tokens. De grafiek vermeldde ongeveer 3.153 tokens per seconde per gebruiker bij een decode-batchgrootte van 8, 2.831 bij 16 en 2.121 bij 32.
Raptor was tijdens de summit nog een toekomstig product. d-Matrix plaatste de komst na 2026 en beschreef voor 2028 een generatie met meerdere gestapelde DRAM-dies. De plannen laten zien waarom geheugen een concurrentiefactor wordt: bij inferentie is de vraag niet alleen hoe snel een chip rekent, maar ook hoe snel hij de juiste modeldata beschikbaar krijgt.
Qualcomm High Bandwidth Compute
Qualcomm koos eveneens voor gestapeld geheugen, maar beschreef High Bandwidth Compute met DRAM op een logicadie. De presentatie noemde zes keer meer bandbreedte per watt dan HBM en 200 keer meer capaciteit per watt dan SRAM.
Die twee cijfers gaan over verschillende eigenschappen. Bandbreedte per watt zegt iets over de hoeveelheid data die per verbruikte watt kan bewegen; capaciteit per watt gaat over de hoeveelheid geheugen die binnen hetzelfde energiebudget beschikbaar is. Samen wijzen ze op dezelfde ontwerpkeuze: geheugen wordt een actief onderdeel van de AI-architectuur, geen passieve opslag naast de processor.
ESUN brengt scale-up-netwerken buiten de chipkast
Broadcom presenteerde Ethernet Scale-up Networking, of ESUN, als een open benadering voor scale-up-netwerken. Scale-up koppelt accelerators en processors binnen één groot AI-systeem, zodat ze data kunnen delen alsof ze deel uitmaken van één rekenomgeving. Het initiatief werd in verband gebracht met het Open Compute Project.
Broadcom koppelde de discussie aan de Tomahawk 6-switchserie, met een gerapporteerde capaciteit van 102,4 Tbps. De bredere invoering van ESUN en UALink vraagt volgens de besproken route meerdere jaren, omdat niet alleen switches maar ook software, kabels, protocollen en systemen op elkaar moeten aansluiten.
De inzet is duidelijk: een AI-cluster wordt niet uitsluitend begrensd door de chips in de racks. Zodra de onderlinge verbindingen de accelerators ophouden, verdwijnt een deel van de theoretische rekenwinst. Optische scale-up-interconnects moeten die verbindingen uiteindelijk uitbreiden van één rack naar meerdere racks en rijen.
Cognichip pakt de lange cyclus van chipontwerp aan
Cognichip presenteerde natuurkundig geïnformeerde AI-modellen voor chipontwerp. Dat zijn modellen die bekende regels uit de natuurkunde in hun berekeningen verwerken, in plaats van alleen patronen uit grote tekstverzamelingen te leren.
Cognichip claimde dat zijn aanpak chipontwerpprocessen tot 100 keer kan versnellen. Tijdens de conferentie werd een traditionele ontwerp- en fabricagecyclus van 18 tot 30 maanden naast een mogelijke AI-ondersteunde cyclus van 3 tot 6 maanden gezet.
Dat raakt een minder zichtbare bottleneck in AI-infrastructuur. Zelfs wanneer een nieuwe architectuur technisch overtuigt, moet een fabrikant nog door ontwerp, verificatie, productie en implementatie. Kortere ontwerprondes kunnen de overstap naar nieuwe datacenterchips versnellen — als de geplande verkorting in de praktijk haalbaar blijkt.
Positron koppelt gespecialiseerde accelerators aan cloudinfrastructuur
Positron AI zei tijdens de summit dat het 875 miljoen dollar had opgehaald tegen een waardering van 5 miljard dollar. Het bedrijf zei ook dat meer dan 50 Atlas-racks bij Oracle Cloud Infrastructure werden ingezet.
Atlas is gericht op inferentie. Positron claimde daarbij meer dan vier keer de doorvoer van NVIDIA en een contextvenster van meer dan 1 miljoen tokens. Het bedrijf koppelde Atlas ook aan een voordeel van drie keer in prestaties per dollar tegenover NVIDIA DGX H200.
De geplande Titan-systemen moeten volgens Positron tot 18,4 TB geheugen per systeem, maximaal 32 biljoen parameters per server en contextvensters van meer dan 10 miljoen tokens ondersteunen. Dat zijn toekomstgerichte productdoelen en geen beschrijving van een algemeen beschikbare configuratie.
Wat dit verandert voor bouwers van AI-infrastructuur
De summit maakte duidelijk dat de juiste infrastructuurkeuze steeds meer afhangt van de workload. Een systeem voor training vraagt andere verhoudingen tussen rekenkracht, geheugen en netwerk dan een systeem dat miljoenen modelantwoorden genereert. Bij agentische AI komen daar veel korte, opeenvolgende modelbewerkingen en hogere eisen aan CPU- en datacentercoördinatie bij.
Voor bouwers verschuift de vergelijking daardoor van één topspecificatie naar een keten van vragen: hoeveel geheugenbandbreedte is beschikbaar, hoeveel vermogen blijft werkelijk bruikbaar, hoe snel bewegen gegevens tussen racks, hoe goed sluit de software aan en welke claims gelden voor precies het model en de batchgrootte die worden ingezet?
AI Infra Summit 2026 draaide uiteindelijk om die systeemgrens. De concurrentie speelt zich niet meer alleen af tussen acceleratorchips, maar tussen complete combinaties van geheugen, energiebeheer, interconnects, software en gespecialiseerde inferentie.