Des systèmes d’IA génèrent, testent et sélectionnent des candidats de kernels CUDA. Le travail des ingénieurs se déplace vers la définition des objectifs, la vérification des résultats et l’intervention lorsque l’agent bloque. Des expériences sur NVIDIA L40S et NVIDIA H100 rapportent des gains sur des tâches précises, sans établir de performances équivalentes pour n’importe quel programme ou GPU.

L’IA génère et teste des candidats de kernels

CUDA est la plateforme logicielle de NVIDIA pour programmer ses GPU. Un kernel, ou noyau GPU, est un petit programme chargé d’exécuter une opération. Un kernel généré par IA est donc du code conçu pour réaliser ou optimiser une opération, par exemple dans PyTorch.

Le processus peut explorer plusieurs versions : le système produit des candidats, vérifie leurs résultats et mesure leur performance avant de retenir une solution. Dans la méthode de recherche décrite par Stanford Scaling Intelligence Lab, des pistes d’optimisation sont déclinées en implémentations candidates ; les contrôles de correction et de vitesse orientent les étapes suivantes.

Les ingénieurs gardent la main sur la vérification

L’ingénieur fixe l’objectif, examine les résultats et intervient si l’agent cale. Le code généré peut être difficile à comprendre, même lorsque ses résultats passent des contrôles de correction. La vérification ne se résume donc pas à choisir le candidat le plus rapide : il faut aussi examiner ce que le programme produit.

Cette étape dépend du test retenu. Dans les évaluations KernelBench de Stanford, les sorties sont comparées à une référence sur de nombreuses entrées aléatoires. La référence utilise par défaut une précision FP32 ; des solutions de précision inférieure peuvent être acceptées si elles respectent une tolérance de 1e-02.

Ce que montrent les expériences KernelBench

Stanford Scaling Intelligence Lab rapporte des résultats obtenus sur un NVIDIA L40S pour des opérations précises, comparées à leurs références PyTorch. Pour une multiplication de matrices de 4096 × 4096, le résultat atteint 101,3 % de la performance de référence ; pour la tâche torch.nn.LayerNorm de forme (16, 64, 256, 256), il atteint 484,4 %.

Cette recherche a mobilisé OpenAI o3 et Gemini 2.5 Pro pendant cinq tours sur dix problèmes de niveau 1. Les tailles des problèmes avaient été modifiées afin que le temps de lancement des kernels soit négligeable par rapport à leur durée d’exécution. Ces conditions font partie du résultat : un kernel optimisé pour une taille donnée ne garantit pas la même performance sur d’autres entrées.

Gimlet Labs rapporte séparément une moyenne géométrique d’environ 1,8× sur ses tâches KernelBench de niveaux 1 à 3, exécutées sur un NVIDIA H100. Pour chaque tâche, la comparaison retient la meilleure des deux références — PyTorch en mode eager ou torch.compile. Les gains rapportés sont de 2,3× au niveau 1, 1,5× au niveau 2 et 1,4× au niveau 3. Plusieurs cas d’origine ont été écartés lorsque des raccourcis techniquement corrects produisaient des gains disproportionnés.

Ces deux expériences ne mesurent pas la même configuration : elles utilisent des GPU, des tâches et des méthodes de comparaison différents. Leurs résultats décrivent les benchmarks et les entrées retenus, pas une performance générale sur tous les programmes GPU.

La demande de compétences CUDA aux États-Unis

Aux États-Unis, le nombre d’offres d’emploi exigeant des compétences CUDA recensées durant les huit premiers mois de 2026 dépassait le total de toute l’année 2025. Plus de 300 offres actives de NVIDIA aux États-Unis exigeant ces compétences étaient également signalées pour septembre 2026. Ces indicateurs concernent le marché américain.

La génération automatique de kernels déplace une partie du travail vers l’encadrement des agents et le contrôle de leurs résultats. Les mesures rapportées montrent pourquoi la maîtrise de CUDA reste utile : les performances dépendent des tâches, des entrées et des références choisies, et chaque candidat doit être évalué dans ce cadre.