AI Infra Summit 2026, który odbył się 15–17 września 2026 roku w Santa Clara Convention Center w Kalifornii, pokazał zmianę priorytetów w budowie infrastruktury dla sztucznej inteligencji. Firmy nadal walczą o większą moc obliczeniową, ale równie ważne stają się przepustowość pamięci, zużycie energii, komunikacja między układami, projektowanie chipów i sprawne uruchamianie modeli w chmurze.
Konferencja była wydarzeniem stacjonarnym poświęconym infrastrukturze dla agentowej i produkcyjnej AI. Program obejmował obliczenia, przesyłanie danych, centra danych, sieci, pamięć masową, oprogramowanie oraz fizyczną AI. Organizator, Kisaco Research, przeprowadził wydarzenie w Santa Clara Convention Center przy 5001 Great America Parkway.
Największym problemem nie jest już sama moc obliczeniowa
W przypadku agentowej AI procesor nie tylko wykonuje pojedyncze polecenie modelu. Obsługuje też kolejne kroki działania agenta, komunikację z narzędziami i przetwarzanie wyników. To zwiększa znaczenie opóźnień, przepustowości pamięci oraz efektywnego zasilania całego systemu.
Ten sam wzorzec pojawiał się w kilku różnych prezentacjach. NVIDIA koncentrowała się na procesorze i zarządzaniu energią, d-Matrix oraz Qualcomm na dostępie do pamięci podczas inferencji, Broadcom na połączeniach między systemami, a Cognichip na skróceniu cyklu projektowania układów. Positron AI pokazał z kolei, jak startupowy akcelerator może wejść do rozmowy o wdrożeniach chmurowych.
NVIDIA Vera i DSX MaxLPS: procesor oraz energia w centrum uwagi
NVIDIA przedstawiła dane dotyczące procesora Vera dla obciążeń agentowej AI. Na prezentacji pokazano przewagę od 50 do 100 proc. nad AMD Turin, ale Forrest Norrod z AMD przedstawił konkurencyjną tezę dotyczącą wydajności. Obie liczby pochodzą z różnych prezentacji, więc nie tworzą wspólnego, rozstrzygającego rankingu procesorów.
NVIDIA zaprezentowała także DSX MaxLPS — firmware do zarządzania energią w sytuacji, gdy nie wszystkie układy GPU mogą jednocześnie pracować z pełną mocą. Według przedstawionej kalkulacji odpowiednie sterowanie mocą mogłoby zwiększyć przychody AI Factory o 40 proc. dzięki ograniczeniu niewykorzystanej mocy centrum danych.
To istotna zmiana w sposobie patrzenia na centrum danych. Dodatkowy akcelerator nie zawsze rozwiązuje problem, jeśli ograniczeniem pozostają zasilanie, chłodzenie albo możliwość dostarczenia danych do układu w odpowiednim tempie.
d-Matrix i Qualcomm stawiają na stosowaną pamięć DRAM
Pamięć DRAM układana warstwowo blisko logiki ma skrócić drogę między obliczeniami a danymi. W inferencji, czyli generowaniu odpowiedzi przez już wytrenowany model, dostęp do pamięci często ogranicza tempo pracy bardziej niż sama liczba jednostek obliczeniowych.
d-Matrix przedstawiła planowany akcelerator Raptor ze stosowaną pamięcią DRAM. Firma deklaruje dziesięciokrotnie wyższą wydajność przy jednej dziesiątej poboru mocy. Na prezentacji Raptor osiągnął ponad 3000 tokenów na sekundę dla modelu GLM 5.2 przy kontekście obejmującym 1 mln tokenów. Wykres pokazywał około 3153 tokenów na sekundę przy partii o rozmiarze 8, 2831 przy rozmiarze 16 oraz 2121 przy rozmiarze 32.
Raptor pozostawał projektem planowanym po konferencji. d-Matrix opisywała również dalszą generację Lightening, która ma obsługiwać NVLink, ESUN, wiele warstw stosowanej pamięci DRAM oraz modele o skali do 20 bln parametrów. Są to założenia roadmapy, a nie opis gotowego produktu dostępnego na rynku.
Qualcomm pokazał High Bandwidth Compute, w którym stosowana pamięć DRAM znajduje się na warstwie logicznej. Prezentacja wskazywała sześciokrotnie większą przepustowość na wat niż HBM oraz 200 razy większą pojemność na wat niż SRAM. Te wartości opisują dane przedstawione podczas konferencji i dotyczą kierunku projektowego Qualcommu.
Różnica między tymi rozwiązaniami jest praktyczna: d-Matrix mówiła o konkretnym planowanym akceleratorze inferencyjnym i jego wynikach dla GLM 5.2, natomiast Qualcomm prezentował architekturę pamięci jako element szerszej platformy obliczeniowej dla centrów danych.
ESUN ma połączyć akceleratory bez zamykania ich w jednym ekosystemie
Broadcom promował Ethernet Scale-up Networking, czyli ESUN, jako otwarte podejście do łączenia układów w systemach AI. „Scale-up” oznacza komunikację wewnątrz jednej dużej infrastruktury obliczeniowej — między akceleratorami, procesorami i pamięcią — a nie tylko połączenia między niezależnymi serwerami.
W dyskusji dotyczącej ESUN pojawił się przełącznik Broadcom Tomahawk 6 o deklarowanej przepustowości 102,4 Tb/s. Projekt wiązano z Open Compute Project. Szersze wdrożenie otwartego ekosystemu ESUN i UALink ma jednak rozciągać się na wiele lat, ponieważ wymaga zgodności układów, oprogramowania, przełączników i systemów zarządzania.
Równolegle zaprezentowano Optical Compute Interconnect — inicjatywę rozwijaną od marca 2026 roku, której celem jest wykorzystanie optycznych połączeń do skalowania infrastruktury z poziomu pojedynczych szaf do wielu szaf i rzędów. To odpowiedź na rosnącą ilość danych przesyłanych między elementami klastra AI.
Cognichip chce skrócić projektowanie chipów
Cognichip pokazał modele AI oparte na informacjach o fizyce układów, a nie na dużych modelach językowych. Ich zadaniem jest wsparcie projektowania chipów, w którym trzeba jednocześnie uwzględnić m.in. układ elementów, pobór energii, opóźnienia i ograniczenia produkcyjne.
Firma deklarowała możliwość przyspieszenia cyklu projektowego nawet 100-krotnie. W trakcie konferencji zestawiono tę ambicję z szacowanym tradycyjnym cyklem projektowania i produkcji chipu wynoszącym 18–30 miesięcy oraz potencjalnym skróceniem go do 3–6 miesięcy przy użyciu narzędzi AI.
Jeśli takie narzędzia osiągną zakładany efekt, mogą wpływać na rynek równie mocno jak szybszy akcelerator. Krótszy cykl projektowy pozwala bowiem szybciej dostosować układ do konkretnego modelu, rodzaju pamięci albo ograniczeń centrum danych.
Positron AI wnosi startupowy akcelerator do rozmowy o chmurze
Positron AI poinformował o pozyskaniu 875 mln dolarów przy wycenie spółki wynoszącej 5 mld dolarów. Firma przedstawiła także informację o wdrażaniu ponad 50 szaf systemu Atlas w Oracle Cloud Infrastructure.
Positron deklarował dla Atlasa ponad milion tokenów w oknie kontekstowym, ponad czterokrotnie wyższą przepustowość niż NVIDIA oraz trzykrotnie lepszy stosunek wydajności do ceny względem NVIDIA DGX H200. Są to dane i porównania przedstawione przez firmę dla jej systemu, a nie uniwersalna charakterystyka wszystkich obciążeń AI.
Drugim kierunkiem jest planowany system Titan. Roadmapa Positron AI zakłada do 18,4 TB pamięci na system, obsługę do 32 bln parametrów na serwer oraz okna kontekstowe przekraczające 10 mln tokenów. Te wartości opisują przyszłościową platformę, a nie bieżącą dostępność komercyjną.
Co zmienia się dla twórców i operatorów infrastruktury AI
AI Infra Summit 2026 przesunął punkt ciężkości z pytania „który akcelerator jest najszybszy?” na szerszy zestaw decyzji. Przy wyborze infrastruktury trzeba brać pod uwagę co najmniej:
- przepustowość i pojemność pamięci dla konkretnego modelu;
- zużycie energii całego systemu, a nie pojedynczego układu;
- sposób łączenia akceleratorów w jednej szafie i między szafami;
- dojrzałość oprogramowania oraz zgodność z istniejącymi platformami;
- czas potrzebny na zaprojektowanie i wdrożenie wyspecjalizowanego chipu;
- różnicę między działającym systemem, prezentacją wyników a przyszłą roadmapą.
To właśnie dlatego konferencja nie sprowadzała się do jednego produktu ani jednej wojny producentów. Wąskie gardło może znajdować się w pamięci, zasilaniu, sieci, projekcie chipu albo sposobie uruchamiania modelu — a każdy z tych problemów wymaga innej odpowiedzi technicznej.