KI-Systeme erzeugen, testen und wählen CUDA-Kernel-Kandidaten aus. Ein am 2. Oktober 2026 veröffentlichter Branchenbericht beschreibt, dass CUDA-Ingenieure dabei zunehmend Ziele vorgeben, Resultate prüfen und eingreifen, wenn ein Agent feststeckt. Ein Teil ihrer Arbeit verlagert sich damit auf die Kontrolle generierter Varianten.

KI erzeugt und testet Kernel-Kandidaten

CUDA ist die Softwareplattform von NVIDIA zur Programmierung von GPUs. Ein Kernel ist ein kleines GPU-Programm, das eine bestimmte Aufgabe ausführt. KI-generierte CUDA-Kernel sollen Abläufe aus Frameworks wie PyTorch umsetzen oder optimieren.

Ein beschriebenes Suchverfahren entwickelt zunächst Optimierungsideen und erstellt daraus verschiedene Code-Kandidaten. Anschließend werden deren Ergebnisse auf Korrektheit geprüft und ihre Laufzeiten gemessen. Diese Rückmeldungen lenken weitere Suchrunden.

Warum menschliche Prüfung weiter wichtig ist

CUDA-Fachkräfte setzen die Ziele, kontrollieren die Resultate und greifen ein, wenn ein KI-Agent nicht weiterkommt. In Brancheninterviews wurde außerdem beschrieben, dass sich manche generierten Codevarianten nur schwer nachvollziehen lassen – selbst dann, wenn ihre Korrektheit überprüft werden kann. Fachleute berichteten auch von ungewöhnlichen Fehlern und aufwendiger Prüfungsarbeit.

Ein bestandener Korrektheitstest für eine bestimmte Aufgabe ersetzt daher nicht die Beurteilung des Codes im jeweiligen Einsatz. Die beschriebenen Prüfungen beziehen sich auf konkrete Testfälle und Vergleichswerte.

Was die KernelBench-Experimente zeigen

Das Stanford Scaling Intelligence Lab berichtete über Suchversuche auf einer NVIDIA L40S: Mit OpenAI o3 und Gemini 2.5 Pro wurden in fünf Runden zehn Aufgaben aus KernelBench Level 1 bearbeitet. Die Eingabegrößen wurden dafür angepasst, sodass der Aufwand für Kernel-Aufrufe gegenüber der Laufzeit kaum ins Gewicht fiel.

Bei einer Matrixmultiplikation mit 4096 × 4096 Elementen erreichte der ausgewählte Kernel laut Versuch 101,3 % der PyTorch-Referenzleistung. Für eine LayerNorm-Aufgabe mit der Eingabeform (16, 64, 256, 256) wurden 484,4 % der Referenzleistung angegeben. Als Referenz diente standardmäßig FP32; auch Lösungen mit niedrigerer Genauigkeit konnten gelten, sofern sie innerhalb einer Toleranz von 1e-02 blieben. Die numerischen Ergebnisse wurden für viele zufällige Eingaben geprüft.

Gimlet Labs berichtete separat über Tests auf einer NVIDIA H100 mit Aufgaben aus den KernelBench-Stufen 1 bis 3. Über die ausgewerteten Aufgaben hinweg lag die geometrische mittlere Beschleunigung bei rund 1,8×. Als Vergleich diente für jede Aufgabe jeweils das stärkere Ergebnis aus dem direkt ausgeführten PyTorch und torch.compile, einem PyTorch-Compiler. Mehrere Aufgaben, bei denen technisch korrekte Abkürzungen unverhältnismäßig hohe Beschleunigungen ergaben, ließ Gimlet aus der Auswertung heraus.

Die Werte aus den beiden Versuchen sind keine direkten Vergleichsmessungen: Sie beruhen auf unterschiedlichen GPUs, Aufgabenauswahlen und Methoden. Beide beschreiben Ergebnisse für festgelegte Tests, nicht für beliebige GPU-Programme oder Eingabegrößen.

US-Stellenanzeigen für CUDA legten zu

Für die USA wurden in den ersten acht Monaten des Jahres 2026 mehr Stellenanzeigen mit CUDA-Anforderungen gezählt als im gesamten Jahr 2025. Im September 2026 waren außerdem mehr als 300 aktive NVIDIA-Stellenanzeigen in den USA mit CUDA-Kenntnissen verbunden. Die berichteten Zahlen betreffen den US-Arbeitsmarkt.