Systemy AI mogą tworzyć, testować i wybierać kandydatów na kernele CUDA, a praca inżynierów obejmuje coraz częściej nadzorowanie tego procesu i weryfikację wyników. Kernel CUDA, czyli mały program wykonujący zadanie na GPU, może zastąpić lub zoptymalizować operację z frameworka takiego jak PyTorch. W testach na NVIDIA L40S i NVIDIA H100 odnotowano przyspieszenia dla konkretnych zadań; nie są to wyniki dla dowolnego programu ani rozmiaru danych.
AI generuje i testuje kandydatów na kernele
CUDA to platforma NVIDIA do programowania procesorów graficznych. Zamiast pisać ręcznie jeden kernel, system AI może przygotować wiele wariantów kodu, sprawdzić ich wyniki i zmierzyć czas wykonania, a potem wybrać szybszy. W opisywanych procesach liczba kandydatów może sięgać setek.
Jedno z podejść do poszukiwania optymalizacji rozgałęzia proces: system generuje pomysły, tworzy na ich podstawie różne implementacje, sprawdza ich poprawność i wykorzystuje pomiary wydajności w kolejnych etapach. To pętla generowania i testowania, a nie pojedyncza odpowiedź modelu.
Inżynierowie weryfikują wyniki i reagują na błędy
Inżynier wyznacza cel, ocenia rezultaty i interweniuje, gdy agent utknie. Część wygenerowanego kodu może być trudna do zrozumienia nawet wtedy, gdy da się sprawdzić jego poprawność. Weryfikacja nie sprowadza się więc do wybrania najszybszego wariantu: trzeba również sprawdzić, czy jego wyniki zgadzają się z oczekiwanymi.
W eksperymencie Stanford Scaling Intelligence Lab poprawność porównywano z wynikami referencyjnymi dla wielu losowych danych wejściowych. Punktem odniesienia była domyślnie precyzja FP32, ale dopuszczano rozwiązania o niższej precyzji w granicach tolerancji 1e-02. Takie sprawdzanie dotyczyło zadań objętych testem.
Co pokazały eksperymenty KernelBench
KernelBench to zestaw zadań do testowania kernelów. Stanford Scaling Intelligence Lab opisał eksperyment na NVIDIA L40S, w którym porównano wybrane operacje z ich referencjami PyTorch. Dla mnożenia macierzy 4096×4096 kernel osiągnął 101,3% wydajności referencji torch.matmul. Dla torch.softmax na wejściu o kształcie (4096, 65536) wynik wyniósł 111,8%, a dla torch.nn.LayerNorm na wejściu (16, 64, 256, 256) — 484,4% wydajności wskazanej referencji.
Gimlet Labs przeprowadziło osobny test na NVIDIA H100. W ocenianych zadaniach KernelBench z poziomów 1–3 firma podała średnie geometryczne przyspieszenie około 1,8× względem silniejszego, dobieranego dla każdego zadania wyniku eager PyTorch lub torch.compile. Wartości dla poszczególnych poziomów wyniosły 2,3×, 1,5× i 1,4×. W osobnym zestawie 124 zadań, w których torch.compile wyprzedzał eager mode, podane przyspieszenie względem torch.compile wyniosło 1,6×.
Wyniki Stanforda i Gimlet Labs pochodzą z różnych GPU i testów, więc nie tworzą bezpośredniego porównania. Gimlet Labs pominęło też kilka pierwotnych zadań, w których poprawne skróty dawały nieproporcjonalnie duże przyspieszenia. Każdy rezultat odnosi się zatem do określonego zestawu zadań i przyjętej metody pomiaru.
Zapotrzebowanie na umiejętności CUDA w USA
W USA liczba ogłoszeń o pracę wymagających umiejętności CUDA w pierwszych ośmiu miesiącach 2026 r. przewyższyła łączną liczbę takich ogłoszeń z całego 2025 r. Według stanu na wrzesień 2026 r. ponad 300 aktywnych ofert NVIDIA w USA wymagało CUDA.
Jak zmienia się praca inżyniera CUDA
Automatyzacja przesuwa część wysiłku z ręcznego pisania kodu na ustalanie kryteriów, ocenę kandydatów i kontrolę pomiarów. Znaczenie ma też zakres wejścia: kernel zoptymalizowany dla konkretnego rozmiaru danych nie musi być równie szybki dla innych rozmiarów.