Un reportaje publicado el 2 de octubre de 2026 describe cómo sistemas de IA generan, prueban y seleccionan cientos de candidatos a kernels CUDA, mientras los ingenieros supervisan el proceso y verifican los resultados. CUDA es la plataforma de NVIDIA para programar GPU; un kernel es un pequeño programa que ejecuta una tarea en el procesador gráfico.
La IA genera y prueba candidatos a kernel
El proceso no consiste simplemente en pedirle código a un modelo y darlo por bueno. En el método descrito por Stanford Scaling Intelligence Lab, la búsqueda propone ideas de optimización, crea distintas versiones del kernel y evalúa su corrección y rendimiento para orientar las siguientes rondas.
En sus pruebas con KernelBench, el laboratorio hizo cinco rondas de búsqueda en 10 problemas de nivel 1, con OpenAI o3 y Gemini 2.5 Pro. Usó una NVIDIA L40S y modificó los tamaños de los problemas para que el tiempo de lanzamiento del kernel apenas influyera frente al tiempo de ejecución.
La revisión humana sigue siendo parte del trabajo
El trabajo de ingeniería descrito incluye fijar objetivos, revisar resultados e intervenir cuando un agente se atasca. También implica comprobar código que puede ser difícil de entender y detectar errores poco habituales. Que una salida supere una comprobación de corrección en una prueba concreta no convierte esa comprobación en una garantía para cualquier uso.
Qué muestran las pruebas de KernelBench
En operaciones seleccionadas de KernelBench, Stanford Scaling Intelligence Lab comunicó un rendimiento del 101,3 % respecto a la referencia de PyTorch para una multiplicación de matrices de 4096 × 4096, y del 484,4 % para LayerNorm con una entrada de forma (16, 64, 256, 256). Son resultados de esas operaciones y condiciones, no una medida general para cualquier código o tamaño de entrada.
La referencia del experimento usaba FP32. El método admitía soluciones de menor precisión si quedaban dentro de una tolerancia de 1e-02, y comprobaba las salidas con muchas entradas aleatorias. KernelBench utiliza tamaños de entrada concretos, así que el resultado de una tarea puede depender del tamaño evaluado.
Gimlet Labs comunicó por separado una media geométrica de 1,8× en sus tareas evaluadas de KernelBench, ejecutadas en una NVIDIA H100. Para cada problema comparó el kernel generado con el mejor resultado entre eager PyTorch y torch.compile. La media fue de 2,3× en el nivel 1, 1,5× en el nivel 2 y 1,4× en el nivel 3. En un subconjunto de 124 tareas donde torch.compile superó a eager, Gimlet comunicó una media de 1,6× frente a torch.compile.
El conjunto de Gimlet dejó fuera varios casos originales de KernelBench en los que los agentes encontraron atajos técnicamente correctos que producían mejoras desproporcionadas. Sus cifras se refieren, por tanto, a las tareas evaluadas con ese criterio. Las pruebas de Stanford y Gimlet emplearon GPU, problemas y métodos distintos.
La demanda de CUDA en Estados Unidos
Lightcast contabilizó más anuncios de empleo en Estados Unidos que pedían conocimientos de CUDA durante los primeros ocho meses de 2026 que en todo 2025. Es una comparación del mercado estadounidense y de esos periodos; no describe la demanda laboral en España.
Qué cambia para los ingenieros CUDA
La generación automática amplía el número de versiones que se pueden evaluar, pero los experimentos también muestran por qué importa definir qué se comprueba: precisión, resultados y rendimiento para una carga concreta. La tarea técnica consiste en valorar tanto el candidato que sale más rápido como el alcance de la prueba que respalda ese resultado.