Monty Bichouna informó de que su modelo inspirado en JEPA eligió un Pokémon inicial en 52 de 100 planes que partían de una partida guardada en el laboratorio del profesor Oak. El objetivo se limitó a escoger un inicial: el experimento no completó Pokémon Red. Bichouna publicó su relato del proyecto el 20 de septiembre de 2026; esa fecha corresponde a la publicación, no al momento de las pruebas.
Cómo el modelo predijo las consecuencias de cada botón
JEPA, sigla de Joint-Embedding Predictive Architecture, es una arquitectura que predice cambios en una representación comprimida de lo que observa. En este proyecto, el modelo convertía cada imagen del juego en una representación latente de 192 valores y predecía cómo cambiaría tras una acción. No generaba una captura completa de la siguiente pantalla.
El entrenamiento se basó en secuencias de observaciones y acciones, sin una recompensa por conseguir un Pokémon. El conjunto de datos, según Bichouna, reunió 42.382 fotogramas en escala de grises distribuidos en 1.009 trayectorias cortas, con rutas guionizadas, acciones ruidosas y movimientos más aleatorios. Los objetivos —las representaciones asociadas a los Pokémon iniciales— entraban en juego después, durante la planificación.
Qué ocurrió en los 100 planes
Bichouna mantuvo fijo el modelo y el estado guardado, y probó 100 planes generados con semillas aleatorias nuevas. Cualquier Pokémon inicial contaba como éxito. Estas fueron las selecciones de cada método en ese ensayo:
| Método | Pokémon iniciales obtenidos | Planes probados |
| Planificador con el modelo entrenado | 52 | 100 |
| Secuencias aleatorias de botones | 0 | 100 |
| Búsqueda con un predictor sin entrenar | 1 | 100 |
Un plan candidato constaba de 14 pulsaciones de botones. En cada ronda de búsqueda se generaban 512 planes y se conservaban los 64 que, según la predicción, quedaban más cerca de uno de los objetivos de inicial. En uno de los intentos exitosos, el modelo seleccionó a Squirtle y el contador del equipo del emulador pasó de cero Pokémon a uno.
El objetivo era elegir un inicial, no acabar el juego
El planificador partía de una partida ya guardada dentro del laboratorio del profesor Oak. Por tanto, esos 52 resultados describen la selección de un inicial desde ese punto concreto de la partida, no una ejecución desde el comienzo ni una partida completa de Pokémon Red.
El modelo y el código del proyecto
El modelo final tenía aproximadamente 12,5 millones de parámetros y, según Bichouna, se entrenó localmente con una Nvidia GeForce RTX 3080 Ti. El desarrollador enlazó lePokeRed como implementación de código abierto del proyecto.