I sistemi di IA generano, testano e selezionano candidati kernel CUDA; gli ingegneri definiscono gli obiettivi, verificano i risultati e intervengono quando un agente si blocca. Alcuni test hanno registrato prestazioni superiori ai riferimenti PyTorch per operazioni specifiche, ma i risultati dipendono dalla GPU, dagli input e dal metodo di confronto.
L’IA genera e testa candidati kernel
CUDA è la piattaforma software di NVIDIA per programmare le GPU. Un kernel è un piccolo programma che esegue un’operazione sulla GPU; un sistema di IA può produrne varianti per sostituire o ottimizzare operazioni di un framework come PyTorch.
Nel metodo descritto dal Stanford Scaling Intelligence Lab, il sistema genera idee di ottimizzazione e le sviluppa in implementazioni candidate. Poi ne controlla la correttezza e le prestazioni, usando i risultati per guidare le prove successive. La ricerca riportata ha usato OpenAI o3 e Gemini 2.5 Pro in cinque round su 10 problemi KernelBench di livello 1. Le dimensioni dei problemi sono state modificate per rendere trascurabile, rispetto al tempo di esecuzione, il tempo necessario ad avviare i kernel.
Il ruolo della verifica umana
Gli ingegneri stabiliscono gli obiettivi, controllano gli output e le prestazioni e intervengono quando un agente si blocca. Il controllo resta importante anche quando il sistema propone molte varianti: parte del codice generato può essere difficile da comprendere pur risultando verificabile, e la revisione può richiedere più attenzione per individuare bug insoliti.
Che cosa mostrano i benchmark KernelBench
Il Stanford Scaling Intelligence Lab ha riportato risultati ottenuti su una NVIDIA L40S, confrontando i kernel con riferimenti PyTorch in FP32. Per una moltiplicazione di matrici torch.matmul da 4096 × 4096, il risultato selezionato ha raggiunto il 101,3% delle prestazioni del riferimento; per torch.softmax sull’input di forma (4096, 65536), il 111,8%; per torch.nn.LayerNorm sull’input (16, 64, 256, 256), il 484,4%.
Il riferimento era in FP32, ma il metodo ammetteva soluzioni a precisione inferiore entro una tolleranza di 1e-02. La correttezza veniva controllata confrontando gli output su numerosi input casuali. I risultati riguardano quindi quei compiti e quelle dimensioni, non qualsiasi codice o carico di lavoro.
Gimlet Labs ha riportato un esperimento distinto su NVIDIA H100, usando i livelli 1–3 di KernelBench. La media geometrica dei risultati è stata di 1,8× rispetto al migliore, per ciascun problema, tra PyTorch eager e torch.compile; i valori riportati sono 2,3× per il livello 1, 1,5× per il livello 2 e 1,4× per il livello 3. L’esperimento ha escluso alcuni casi in cui scorciatoie tecnicamente corrette producevano accelerazioni sproporzionate. Hardware, compiti e confronti differiscono da quelli del test su L40S.
La domanda di competenze CUDA negli Stati Uniti
Secondo Lightcast, nei primi otto mesi del 2026 gli annunci di lavoro negli Stati Uniti che richiedevano competenze CUDA hanno superato il totale registrato nell’intero 2025. Il dato riguarda il mercato statunitense.
Come cambia il lavoro dell’ingegnere CUDA
Quando l’IA genera e mette alla prova più implementazioni, il lavoro comprende anche scegliere che cosa ottimizzare e valutare se il risultato resta corretto per il compito previsto. La competenza tecnica entra così nel ciclo di verifica: interpretare i risultati e giudicare codice che può essere difficile da leggere, oltre a scriverlo.