Der AI Infra Summit 2026 hat vom 15. bis 17. September in Santa Clara gezeigt, wohin sich die KI-Infrastruktur bewegt: Neben der reinen Rechenleistung entscheiden zunehmend Speicherbandbreite, Energieauslastung, Netzwerkarchitekturen, Chipdesign und spezialisierte Inferenzsysteme über die Praxistauglichkeit großer Modelle. NVIDIA, d-Matrix, Qualcomm, Broadcom, Cognichip und Positron AI präsentierten dafür unterschiedliche Ansätze.
Die von Kisaco Research veranstaltete Konferenz im Santa Clara Convention Center war vollständig auf Präsenz ausgelegt. Das Programm behandelte Rechenleistung, Datenbewegung, Speicher, Rechenzentren, Software, Netzwerke und physische KI. NVIDIA beschrieb die erwartete Zielgruppe mit mehr als 8.000 Ingenieuren, technischen Fachleuten, Architekten und Führungskräften.
Der Engpass liegt nicht mehr nur bei den Beschleunigern
Für agentische KI reicht ein schneller Beschleuniger allein nicht aus. Agenten rufen Modelle wiederholt auf, verarbeiten Zwischenergebnisse und erzeugen dadurch zusätzlichen Druck auf CPUs, Speicher und Datenverbindungen. Genau diese Kette stand beim AI Infra Summit im Mittelpunkt: Ein System kann beim Rechnen schnell sein und trotzdem ausgebremst werden, wenn Daten nicht schnell genug ankommen oder die verfügbare Energie nicht effizient genutzt wird.
Damit verschiebt sich der Wettbewerb. Die entscheidende Frage lautet nicht mehr nur, welcher Chip die meisten Operationen pro Sekunde schafft. Betreiber müssen ebenso prüfen, wie viel Speicherbandbreite eine Architektur bereitstellt, wie sie mit vorhandenen GPUs zusammenspielt und wie viele Daten sich zwischen Servern und Racks bewegen lassen.
NVIDIA setzt auf Vera und eine strengere Energielenkung
NVIDIA präsentierte Daten zur Vera-CPU für agentische Workloads. Die Präsentation stellte Vera mit einem Vorsprung von 50 bis 100 Prozent gegenüber AMD Turin dar. AMDs Forrest Norrod präsentierte bei derselben Veranstaltung eine Gegenposition zugunsten von AMD. Die beiden Aussagen beziehen sich damit auf unterschiedliche Unternehmensdarstellungen und nicht auf einen gemeinsamen, standardisierten Vergleich.
Zusätzlich kündigte NVIDIA DSX MaxLPS an, eine Firmware zur Steuerung der Leistungsaufnahme überprovisionierter GPUs. NVIDIA verband die vorgestellte Energiepolitik mit dem Ziel, durch die Verringerung ungenutzter Rechenzentrumsleistung bis zu 40 Prozent mehr Umsatz in einer sogenannten AI Factory zu ermöglichen.
Der praktische Punkt ist wichtiger als die große Prozentzahl: In einem KI-Rechenzentrum zählt nicht nur die theoretische Spitzenleistung eines Chips. Entscheidend ist auch, wie viel der installierten Leistung tatsächlich für produktive Modelle genutzt werden kann.
d-Matrix und Qualcomm rücken gestapelten DRAM ins Zentrum
Gestapelter DRAM bringt Speicher näher an die Rechenlogik und erhöht dadurch die verfügbare Bandbreite. Das ist für die Inferenz wichtig, weil ein Modell beim Erzeugen von Antworten laufend Gewichte und Zwischendaten aus dem Speicher abrufen muss. Wenn dieser Datenstrom stockt, wartet der Rechenkern trotz hoher Rechenleistung.
d-Matrix präsentierte den geplanten Beschleuniger Raptor, der gestapelten DRAM verwenden soll. Das Unternehmen stellte eine Leistung von 10× bei einem Zehntel der Leistungsaufnahme in Aussicht. Eine Präsentation zeigte außerdem mehr als 3.000 Token pro Sekunde mit GLM 5.2 bei einem Kontext von 1 Million Token. Für eine Stapelgröße von acht wurden dabei rund 3.153 Token pro Sekunde und Nutzer ausgewiesen; bei Stapelgrößen von 16 und 32 lagen die Angaben bei etwa 2.831 beziehungsweise 2.121 Token pro Sekunde.
Raptor gehört zur künftigen Produktplanung von d-Matrix. Für eine Generation im Jahr 2028 stellte das Unternehmen mehrere gestapelte DRAM-Dies in Aussicht. Die längerfristige Roadmap von d-Matrix namens Lightening soll außerdem NVLink, ESUN und Modelle mit bis zu 20 Billionen Parametern unterstützen.
Qualcomm verfolgte einen ähnlichen Grundgedanken mit High Bandwidth Compute (HBC). Dabei sitzt der gestapelte DRAM auf einem Logikchip. Eine Qualcomm-Präsentation nannte sechsmal mehr Bandbreite pro Watt gegenüber HBM und 200-mal mehr Kapazität pro Watt gegenüber SRAM.
Die Ansätze sind nicht identisch, aber sie zielen auf denselben Flaschenhals: Inferenzsysteme sollen weniger Zeit mit dem Verschieben von Modelldaten verbringen. Das macht Speichertechnik zu einem ebenso wichtigen Differenzierungsmerkmal wie der eigentliche Rechenkern.
ESUN soll die Vernetzung großer KI-Systeme öffnen
Broadcom stellte Ethernet Scale-up Networking (ESUN) als offenen Ansatz für die Vernetzung von Beschleunigern vor. Scale-up bezeichnet die Verbindung von Recheneinheiten innerhalb eines eng gekoppelten Systems – also nicht nur die klassische Verbindung einzelner Server über ein Rechenzentrumsnetzwerk.
In diesem Zusammenhang wurde der Broadcom-Switch Tomahawk 6 mit einer Übertragungsleistung von 102,4 Tbit/s genannt. Die ESUN-Initiative steht im Umfeld des Open Compute Project und soll eine Alternative zu proprietären Scale-up-Netzwerken schaffen.
Der Wechsel zu einem offenen Netzwerkstandard ist allerdings kein Schalter, den Betreiber einfach umlegen. Switches, Kabel, Protokolle, Treiber und Beschleuniger müssen zusammenspielen. Für vollständig native ESUN- und UALink-Umgebungen ist daher eine mehrjährige Einführung vorgesehen.
Eine weitere Richtung zeigte die Initiative Optical Compute Interconnect. Sie soll optische Scale-up-Verbindungen aus einzelnen Racks herausführen und Verbindungen über mehrere Racks und Reihen ermöglichen. Das ist besonders relevant, wenn KI-Systeme nicht mehr in einem kompakten Rack, sondern als größere Rechenverbünde betrieben werden.
Cognichip greift den Chipdesign-Zyklus an
Nicht nur die Hardware selbst wird zum Engpass. Auch die Entwicklung neuer Chips dauert lange. Cognichip präsentierte physikbasierte KI-Modelle für das Chipdesign, also Modelle, die technische Eigenschaften und physikalische Zusammenhänge berücksichtigen, statt ausschließlich wie ein großes Sprachmodell Textmuster zu verarbeiten.
Cognichip stellte eine Beschleunigung der Chipdesign-Zyklen um bis zu 100× in Aussicht. Der Ansatz zielt damit auf eine andere Ebene der Infrastruktur: Wenn neue Prozessoren, Speicherlösungen und Netzwerkchips schneller entworfen werden können, verkürzt sich auch die Zeit bis zur nächsten Hardwaregeneration.
Das ist für KI besonders wichtig, weil sich Modelle, Speicherbedarf und Rechenzentrumsarchitekturen schneller verändern als klassische Entwicklungszyklen. Ein schnellerer Designprozess könnte somit nicht nur einzelne Chips verbessern, sondern die gesamte Lieferkette beweglicher machen.
Positron verbindet Beschleuniger, Cloud und große Kontexte
Positron AI meldete beim Summit eine Finanzierung von 875 Millionen US-Dollar bei einer Bewertung von 5 Milliarden US-Dollar. Das Unternehmen erklärte außerdem, mehr als 50 Atlas-Racks bei Oracle Cloud Infrastructure einzusetzen.
Atlas ist als Inferenzsystem positioniert. Positron stellte gegenüber NVIDIA DGX H200 eine dreifache Leistung pro Dollar in Aussicht und nannte für Atlas Kontextfenster mit mehr als 1 Million Token sowie mehr als die vierfache Durchsatzleistung gegenüber NVIDIA. Diese Angaben stammen aus der Unternehmensdarstellung und beziehen sich auf deren jeweilige Vergleichsbedingungen.
Für Titan skizzierte Positron eine künftige Systemplattform mit bis zu 18,4 TB Speicher pro System, bis zu 32 Billionen Parametern pro Server und Kontextfenstern von mehr als 10 Millionen Token. Titan ist damit eine Roadmap für große Modelle und keine Beschreibung einer allgemein verfügbaren Plattform im September 2026.
Was sich für Betreiber und Entwickler ändert
Der Summit liefert keine einzelne Siegerarchitektur. Er zeigt vielmehr, dass KI-Infrastruktur aus mehreren miteinander verzahnten Entscheidungen besteht:
- Workload: Agentische Anwendungen stellen andere Anforderungen an CPUs und Datenbewegung als reine Trainingsläufe.
- Speicher: Gestapelter DRAM soll Bandbreite und Kapazität näher an die Rechenlogik bringen.
- Energie: Firmware wie DSX MaxLPS soll verhindern, dass installierte GPU-Leistung ungenutzt bleibt.
- Netzwerk: ESUN und optische Verbindungen sollen den Datenaustausch zwischen vielen Beschleunigern skalierbarer machen.
- Software und Integration: Ein neuer Chip bringt wenig, wenn er nicht in bestehende Racks, Protokolle und Cloud-Systeme passt.
- Entwicklungszeit: Physikbasierte KI-Modelle sollen den Entwurf künftiger Chips beschleunigen.
Die spannendste Entwicklung ist deshalb nicht ein einzelner Leistungsrekord. Der AI Infra Summit 2026 machte sichtbar, dass die nächste Generation von KI-Rechenzentren an mehreren Stellen gleichzeitig optimiert werden muss: im Speicher, bei der Energie, im Netzwerk und in der Zeit, die bis zum fertigen Chip vergeht.