In een projectverslag van 20 september 2026 meldde ontwikkelaar Monty Bichouna dat zijn AI-planner vanuit een opgeslagen spelstatus in Professor Oak’s lab in 52 van 100 plannen een starter koos. De proef draaide om die ene taak; Pokémon Red werd niet uitgespeeld.
Hoe het model de gevolgen van knopdrukken voorspelde
Bichouna bouwde een klein wereldmodel met een aanpak die is geïnspireerd op JEPA, de Joint-Embedding Predictive Architecture. Een wereldmodel leert voorspellen hoe een omgeving verandert na een handeling. Hier kreeg het model gameplaybeelden en knopacties als input, en voorspelde het wat er daarna zou gebeuren.
Die voorspelling was geen volledig nieuw screenshot. Het model zette een beeld om in een compacte, interne representatie — een latent embedding — en voorspelde de volgende representatie als een reeks van 192 getallen. Zo richtte de voorspelling zich op veranderingen in de speltoestand, niet op het opnieuw tekenen van het hele beeld.
De trainingsset bestond volgens Bichouna uit 42.382 grijswaardeframes, verdeeld over 1.009 korte trajecten. Daarin zaten vooraf uitgestippelde routes, routes met willekeurige afwijkingen in de acties en meer willekeurige bewegingen. Tijdens het trainen kreeg het model geen beloning voor het bemachtigen van een Pokémon: het leerde eerst veranderingen in de speltoestand voorspellen. De starterdoelen kwamen pas later aan bod, toen de planner acties ging zoeken.
De uitkomst van 100 plannen
Voor de test hield Bichouna het model en de opgeslagen startstatus gelijk en gebruikte hij 100 verschillende willekeurige seeds. Iedere kandidaatplanning bestond uit 14 knopdrukken. De planner bemonsterde per zoekronde 512 plannen en behield de 64 plannen met de kleinste voorspelde afstand tot een starterdoel.
| Methode | Starterkeuzes | Geteste plannen |
| Getrainde planner | 52 | 100 |
| Willekeurige knopreeksen | 0 | 100 |
| Zoeken met een ongetrainde voorspeller | 1 | 100 |
De vergelijking laat zien dat de getrainde voorspeller binnen deze vaste startopstelling vaker tot een starterkeuze leidde dan de twee alternatieven. In de geslaagde run koos de planner Squirtle; het aantal Pokémon in het team van de emulator veranderde daarbij van nul naar één.
Een starter kiezen is niet hetzelfde als het spel uitspelen
De planner begon niet aan een nieuw spel: de test startte met een save in Professor Oak’s lab. Elke keuze uit de drie starters gold als succes. Daarmee meet de uitkomst hoe goed het model een korte reeks acties voor een afgebakend doel kon plannen, niet of het Pokémon Red zelfstandig vanaf het begin kon spelen of uitspelen.
Model, hardware en projectcode
Het uiteindelijke model telde volgens Bichouna ongeveer 12,5 miljoen parameters en werd lokaal getraind met één Nvidia GeForce RTX 3080 Ti. De open-source-implementatie van het project heet lePokeRed.