Shengyu Liu, machine-learning-systems- en kernelengineer bij DeepSeek, verwacht dat AI-gegenereerde GPU-kernels binnen zes tot twaalf maanden zijn eigen werk kunnen evenaren of overtreffen. Die voorspelling is persoonlijk, maar de techniek erachter bestaat al in een afgebakende workflow: NVIDIA liet DeepSeek-R1 kernels genereren, testen en verbeteren met een automatische verifier.
Wat Shengyu Liu voorziet
Liu beschrijft een verschuiving in zijn vakgebied. AI hielp eerst met documentatie, code lezen en debugging; inmiddels kan het volgens hem CUDA, PTX en SASS analyseren, instructiestalls onderzoeken en operators optimaliseren. Een kernel is zo’n afzonderlijke GPU-bewerking die een model voortdurend uitvoert, bijvoorbeeld matrixvermenigvuldiging, attention, quantisatie of expert-routing.
Liu verwacht niet dat zijn functie simpelweg verdwijnt. Hij ziet eerder een andere rol ontstaan: minder zelf elke regel CUDA schrijven en meer doelen bepalen, agents aansturen en de resultaten beoordelen. Hij koppelt die ontwikkeling ook aan de vraag wie toegang krijgt tot krachtige AI. Volgens Liu zou frontier-AI open en betaalbaar beschikbaar moeten zijn.
Waarom GPU-kernels zoveel verschil maken
Een model bestaat niet alleen uit grote gewichten en indrukwekkende architectuurdiagrammen. Tijdens training en inferentie voert de GPU duizenden keren gespecialiseerde bewerkingen uit. De manier waarop gegevens uit het geheugen worden gehaald, werk over threads wordt verdeeld en berekeningen worden gesynchroniseerd, beïnvloedt de doorvoersnelheid en wachttijd.
Daarom kan een kleine wijziging in tiling — het opdelen van werk in GPU-blokken — of in numerieke precisie een merkbaar effect hebben op een volledige modelrun. Bij mixture-of-experts-modellen komt daar routing bij: het systeem bepaalt welke experts een token verwerken en hoe de GPU’s die gegevens uitwisselen.
De engineering gaat dus dieper dan een prompt schrijven. Ze raakt aan CUDA, PTX en SASS, van relatief leesbare GPU-code tot instructies die dicht bij de hardware staan. Juist daar zit de aantrekkingskracht van automatisering: een model kan veel varianten voorstellen, terwijl een verifier controleert of de uitkomst numeriek klopt.
De workflow die al werkt
In een door NVIDIA beschreven experiment genereerde DeepSeek-R1 attention-kernels voor Hopper-GPU’s. De lus combineerde codegeneratie met automatische controle en herhaalde promptaanpassingen.
| Fase | Wat er gebeurt | Ondersteund resultaat of voorwaarde |
| Startprompt | DeepSeek-R1 ontvangt een opdracht om een GPU-kernel te genereren. | De workflow richt zich op attention-kernels. |
| Codegeneratie | Het model maakt een kandidaat in CUDA C++. | De kandidaat gaat naar een aparte verifier. |
| Controle | De verifier beoordeelt de numerieke uitkomst en de criteria. | Bij een mislukte controle wordt de prompt aangepast. |
| Iteratie | Het systeem genereert en controleert nieuwe varianten. | NVIDIA rapporteert een optimalisatielus van 15 minuten. |
| Resultaat | Een kandidaat die aan de criteria voldoet, wordt behouden. | De test haalde 100% numerieke correctheid op KernelBench Level 1 en 96% op Level 2. |
De cijfers horen bij de geteste KernelBench-niveaus en deze specifieke werkwijze. Ze beschrijven numerieke correctheid binnen de benchmark; ze zijn geen algemene prestatiemeting voor iedere GPU-kernel of modeltoepassing.
Van kernels schrijven naar agents aansturen
De praktische verandering zit mogelijk niet in een magische knop die een complete GPU-stack zelfstandig bouwt. De meer waarschijnlijke verschuiving is organisatorischer: engineers formuleren de doelstelling, kiezen de testcriteria en laten software veel kandidaatimplementaties onderzoeken.
Dat maakt menselijke expertise niet overbodig. Iemand moet bepalen welke uitkomst telt, begrijpen waarom een kernel faalt en beoordelen of een snellere variant dezelfde berekening uitvoert. Liu’s voorspelling gaat over het niveau van door AI geschreven kernels in verhouding tot zijn eigen werk; ze is geen algemene voorspelling over alle kernelengineers of alle hardware.
Voor modelgebruikers is het effect indirect maar concreet. Efficiëntere kernels kunnen de tijd tussen invoer en eerste output verkorten en de beschikbare GPU-capaciteit beter benutten. Dat voordeel ontstaat pas wanneer de kernel past bij de betreffende architectuur, precisie, geheugenindeling en modelbewerking.
DeepSeek bouwt aan een breder optimalisatie-ecosysteem
De kernelontwikkeling staat niet los van de rest van de infrastructuur. DeepSeek’s officiële TileKernels-repository bevat TileLang-gebaseerde kernels voor gating, MoE-routing, quantisatie, transpose, Engram en manifold hyper-connection-bewerkingen. De repository richt zich op NVIDIA SM90- en SM100-GPU’s en noemt onder meer Python 3.10+, PyTorch 2.10+, TileLang 0.1.9+ en CUDA Toolkit 13.1+ als vereisten.
Daarnaast wordt DeepGEMM in verband gebracht met FP8-GEMM-optimalisatie: matrixvermenigvuldiging in lage precisie, bedoeld voor workloads waarin snelheid en geheugengebruik zwaar wegen. Zulke bibliotheken laten zien waarom kernelwerk belangrijk blijft, ook als een AI-agent een groter deel van de code produceert.
De kern van Liu’s voorspelling is daarmee helder: het vak kan veranderen van handmatig optimaliseren naar het ontwerpen en bewaken van optimalisatielussen. De eerste demonstraties bestaan al, terwijl zijn termijn van zes tot twaalf maanden een persoonlijke verwachting blijft.