Monty Bichouna riferisce che il suo modello del mondo ispirato a JEPA ha selezionato uno starter in 52 piani su 100, partendo ogni volta dallo stesso salvataggio nel laboratorio del professor Oak. L’obiettivo era arrivare alla scelta di un Pokémon iniziale: l’esperimento non ha completato Pokémon Red.

Come il modello prevedeva gli effetti dei pulsanti

JEPA è un approccio di apprendimento che prevede come cambia una rappresentazione dei dati, invece di ricostruire ogni dettaglio dell’immagine successiva. Nel progetto di Bichouna, il modello riceveva fotogrammi di gioco e azioni e prevedeva il successivo embedding latente: una rappresentazione compressa dello stato, composta da 192 numeri. Non generava quindi l’intera schermata seguente.

Secondo Bichouna, l’addestramento ha usato 42.382 fotogrammi in scala di grigi, organizzati in 1.009 brevi traiettorie. I percorsi comprendevano sequenze programmate, azioni con elementi casuali e movimenti più esplorativi. In questa fase il modello imparava a prevedere le transizioni tra stati senza ricevere una ricompensa per la cattura di un Pokémon; gli starter diventavano obiettivi soltanto nella fase di pianificazione.

Il confronto dei 100 piani

Nel test descritto da Bichouna, il modello e il salvataggio iniziale restavano fissi mentre cambiavano i semi casuali usati per generare i piani. Il pianificatore addestrato ha selezionato uno starter in 52 casi su 100. Nel confronto dello sviluppatore, le sequenze casuali non ci sono riuscite; la ricerca con lo stesso approccio ma un predittore non addestrato ha avuto successo una volta.

MetodoPiani con selezione dello starterPiani testati
Pianificatore addestrato52100
Sequenze di pulsanti casuali0100
Ricerca con predittore non addestrato1100

Il piano riuscito ha selezionato Squirtle: nel gioco emulato, il conteggio dei Pokémon in squadra è passato da zero a uno. Il risultato riguarda quel compito e quel salvataggio di partenza.

Scegliere uno starter non significa finire Pokémon Red

La prova iniziava da un salvataggio già collocato nel laboratorio del professor Oak e considerava riuscita la scelta di uno qualsiasi dei tre starter. Non misurava la capacità di cominciare una partita da zero o di portarla a termine.

Ogni piano candidato conteneva 14 pressioni di pulsante. A ogni giro di ricerca, il sistema ne campionava 512 e conservava i 64 con la distanza prevista più bassa rispetto all’obiettivo di uno starter. Il pianificatore cercava quindi una sequenza breve verso un traguardo già definito, non un percorso attraverso l’intero gioco.

Modello, hardware e codice del progetto

Bichouna descrive il modello finale come composto da circa 12,5 milioni di parametri e riferisce di averlo addestrato localmente con una Nvidia GeForce RTX 3080 Ti. Il progetto open source collegato dallo sviluppatore si chiama lePokeRed.