CoreWeave podał, że 16 września 2026 r. miał w produkcji siedem racków NVIDIA Vera Rubin NVL72 rozmieszczonych w dwóch regionach. To łącznie 504 procesory graficzne Rubin. Najważniejsza zmiana nie polega jednak na samym zsumowaniu kart: po przekroczeniu granicy jednego racka sieć, zasilanie, chłodzenie, pamięć masowa i obsługa awarii stają się częścią samego systemu obliczeniowego.

CoreWeave wychodzi poza pojedynczy rack

Jeden rack NVL72 zawiera 72 procesory graficzne Rubin. Siedem takich systemów daje 504 GPU — dokładnie 7 × 72. CoreWeave podał, że wdrożenie działa w dwóch regionach, których nazw firma nie ujawniła.

NVIDIA Vera Rubin to platforma infrastruktury AI w skali racka, przeznaczona do trenowania modeli, inferencji, zadań rozumowania i zastosowań agentowych. Nie jest to konsumencka karta graficzna do komputera gamingowego. W konfiguracji wielorackowej każdy element musi pracować w rytmie pozostałych: opóźnienie sieci albo problem z chłodzeniem może zatrzymać długotrwałe zadanie rozproszone na wielu GPU.

CoreWeave opisuje swoją topologię jako dwupoziomową i nieblokującą, z wieloma szynami oraz płaszczyznami sieciowymi. Każdy procesor graficzny Rubin ma według firmy dwa układy ConnectX-9 SuperNIC, zapewniające do 1,6 Tb/s przepustowości połączenia z infrastrukturą skalującą poza pojedynczy rack.

CoreWeave mówi też o możliwości skalowania architektury do około 128 000 GPU na jedną szynę. To docelowa skala architektury, a nie wielkość wdrożonego klastra: produkcyjna konfiguracja opisana dla CoreWeave obejmuje 504 GPU.

Co znajduje się w NVIDIA Vera Rubin NVL72

NVIDIA projektuje Vera Rubin jako system, a nie pojedynczy układ. Platforma obejmuje procesory graficzne Rubin, procesory Vera, przełączniki NVLink 6, karty sieciowe ConnectX-9 SuperNIC, układy BlueField-4 DPU oraz rozwiązania Ethernet Spectrum-X. Rack NVL72 korzysta również z chłodzenia cieczą i szybkiej pamięci masowej.

ElementWartość opublikowanaZakres
Procesory graficzne Rubin72Na jeden rack NVL72
Procesory Vera36Na jeden rack NVL72
Pamięć HBM420,7 TBKonfiguracja racka NVL72
Przepustowość pamięci1 400 TB/sKonfiguracja racka NVL72
Połączenie NVLinkNVLink 6. generacjiInterkonekt GPU w skali racka
Przepustowość NVLink216 TB/sWartość dwukierunkowa dla NVL72
Przepustowość NVLink-C2C65 TB/sOpublikowana wartość dla NVL72
Rdzenie CPU3 168 rdzeni NVIDIA Olympus i 6 336 wątkówKonfiguracja NVL72
Pamięć CPUDo 54 TB LPDDR5XKonfiguracja NVL72

W praktyce oznacza to połączenie ogromnej liczby układów obliczeniowych z równie istotną warstwą komunikacji. Rubin nie działa tu jak samotny akcelerator czekający na dane z serwera. Rack jest zaprojektowany tak, aby procesory, pamięć i interkonekt współpracowały jako jeden system.

Gdy sieć staje się częścią komputera

NVIDIA Vera Rubin pokazana jako modułowy system rackowy z chłodzeniem cieczą i wymiennymi tacami obliczeniowymi

W zadaniach AI rozłożonych na wiele GPU dane przemieszczają się między układami bez przerwy. Dlatego CoreWeave testuje systemy Rubin po wyłączeniu szybszych połączeń GPU–GPU i kieruje ruch przez sieć zaplecza. Taki test ma ujawniać problemy z przełącznikami, okablowaniem, oprogramowaniem i innymi elementami infrastruktury.

To ważna różnica względem klasycznego serwera: awaria pojedynczego przewodu albo przeciążenie jednej ścieżki może wpłynąć na cały przebieg zadania. Stephen Sopko z HyperFrame Research ujął tę granicę następująco: „Pojedynczy rack jest produktem NVIDIA. Domena wielorackowa jest produktem operatora”.

Zarządzanie rackiem też jest oprogramowaniem

CoreWeave wykorzystuje kilka własnych warstw operacyjnych, które mają utrzymywać rack na poziomie pojedynczej jednostki zarządzania. Racky służy do zunifikowanego zarządzania rackiem, Valvey steruje programowalnym układem zaworów chłodzenia cieczą, a Rack LifeCycle Controller obsługuje operacje związane z cyklem życia systemu.

Taki podział ma znaczenie przy wielu rackach. Operator nie zarządza wyłącznie 72 GPU w jednym miejscu, lecz musi przygotować powtarzalne procedury dla instalacji, chłodzenia, aktualizacji, diagnostyki i obsługi awarii. CoreWeave traktuje rack jako jednostkę operacyjną, którą można kontrolować przez wspólną warstwę oprogramowania.

NVIDIA pokazała w lutym 2026 r. modułową konstrukcję Vera Rubin i bezpośrednie chłodzenie cieczą elementów obliczeniowych. Dion Harris, starszy dyrektor ds. infrastruktury AI w NVIDIA, przekazał, że firma zakłada skrócenie wymiany tacy obliczeniowej z około dwóch godzin w systemie Blackwell do pięciu minut w Vera Rubin. To deklaracja NVIDIA dotycząca obsługi serwisowej platformy.

LOTA przenosi dane bliżej GPU

Wielorackowe obliczenia potrzebują nie tylko przepustowości między GPU, ale również szybkiego dostępu do danych. CoreWeave wykorzystuje w tym celu LOTA, czyli lokalny dla obliczeń punkt końcowy NVMe przeznaczony do buforowanych danych obiektowych.

Według deklaracji CoreWeave LOTA może zmniejszyć opóźnienie ośmiokrotnie względem bezpośredniego odczytu z tradycyjnej pamięci obiektowej i zapewnić do 7 GB/s na GPU. Druga wartość dotyczy odpowiednich warunków obciążenia i pamięci podręcznej. Rozwiązanie ma ograniczać sytuacje, w których GPU czekają na dane przechowywane zbyt daleko od właściwego miejsca obliczeń.

CoreWeave podał również, że migracja danych obiektowych między regionami zwykle kończy się w ciągu 72 godzin, podczas gdy zadania korzystają z lokalnej, trwałej kopii. W ten sposób przenoszenie danych odbywa się w tle, zamiast wymuszać zatrzymanie obliczeń.

Vera Rubin pozostaje więc przede wszystkim platformą dla centrów danych: jej wartość wynika z połączenia GPU, CPU, pamięci, sieci, chłodzenia i oprogramowania operacyjnego. Siedem racków CoreWeave pokazuje skalę wdrożenia, w której żadna z tych warstw nie jest już tylko dodatkiem do procesora graficznego.