W opisie projektu opublikowanym 20 września 2026 r. Monty Bichouna (stmonty) podał, że jego model AI wybrał startera w 52 ze 100 planów. Każdy plan zaczynał się z tego samego zapisu w laboratorium Profesora Oaka. Zadaniem było zdobycie dowolnego Pokémona startowego — eksperyment nie obejmował ukończenia Pokémon Red.
Jak model przewidywał skutki naciśnięcia przycisku
Model świata oparty na JEPA (Joint-Embedding Predictive Architecture) uczy się przewidywać, jak zmieni się obserwowany stan po wykonaniu działania. W tym projekcie model nie tworzył obrazu następnego ekranu. Kodował bieżącą klatkę jako reprezentację — wektor 192 liczb — a następnie przewidywał kolejną reprezentację po naciśnięciu przycisku.
Według opisu Bichouny trening nie wykorzystywał nagrody za zdobycie Pokémona. Model uczył się przewidywać przejścia między stanami na podstawie klatek i działań. Startery stały się celami dopiero na etapie planowania.
Zbiór treningowy obejmował 42 382 klatki w skali szarości ułożone w 1009 krótkich trajektorii. Znalazły się wśród nich trasy zaprogramowane, z zaszumionymi działaniami oraz bardziej losowym ruchem. Bichouna wskazał LeWorldModel jako inspirację dla zastosowanego podejścia.
Wynik testu 100 planów
Bichouna utrzymał model i początkowy zapis bez zmian, a do kolejnych prób użył 100 nowych losowych ziaren. Po dostrojeniu predyktora do przewidywania wielu kroków naprzód planner znalazł startera w 52 planach. W tej samej próbie losowe sekwencje przycisków nie przyniosły sukcesu, a wyszukiwanie z niewytrenowanym predyktorem zakończyło się jednym wyborem startera.
| Metoda | Wybory startera | Sprawdzone plany |
| Planner z wytrenowanym modelem | 52 | 100 |
| Losowe sekwencje przycisków | 0 | 100 |
| Wyszukiwanie z niewytrenowanym predyktorem | 1 | 100 |
Zwycięski plan doprowadził do wyboru Squirtle’a; liczba Pokémonów w drużynie emulatora wzrosła z zera do jednego. To konkretny wynik w zadaniu ograniczonym do zapisu w laboratorium, a nie przejście gry od początku.
Wybór startera to nie ukończenie gry
Każdy kandydat obejmował 14 naciśnięć przycisków. W jednej rundzie wyszukiwania planner próbkował 512 planów i zachowywał 64, które według modelu znajdowały się najbliżej celu — reprezentacji jednego ze starterów. Następnie aktualizował rozkład, z którego losował kolejne sekwencje.
Takie planowanie dotyczyło krótkiego odcinka rozgrywki i zaczynało się od gotowego zapisu w laboratorium Profesora Oaka. Sukces oznaczał zdobycie któregokolwiek startera; model nie ukończył Pokémon Red.
Rozmiar modelu, sprzęt i kod projektu
Bichouna opisał końcowy model jako liczący około 12,5 miliona parametrów. Według jego relacji trenował go lokalnie na jednej karcie Nvidia GeForce RTX 3080 Ti. Projekt udostępniono jako otwartoźródłową implementację lePokeRed.