Em relato publicado em 20 de setembro de 2026, Monty Bichouna diz que seu modelo de IA escolheu um Pokémon inicial em 52 de 100 planos para Pokémon Red. Todos partiram de um save fixo no laboratório do Professor Oak. A tarefa era escolher um inicial — não jogar até o fim.

Como o modelo previa o efeito dos botões

Bichouna desenvolveu um modelo de mundo inspirado em JEPA, sigla em inglês para uma arquitetura preditiva de incorporação conjunta. Em vez de tentar produzir a captura de tela inteira após cada ação, o modelo convertia a imagem do jogo em uma representação latente — um resumo numérico do estado — e previa como ela mudaria após um comando.

Essa representação tinha 192 números. O modelo aprendeu a prever transições entre estados a partir de sequências de imagens e ações, sem receber uma recompensa por capturar um Pokémon durante o treinamento. Os Pokémon iniciais entravam depois, como objetivos para o planejador.

O conjunto de treinamento descrito por Bichouna reunia 42.382 quadros em tons de cinza, organizados em 1.009 trajetórias curtas. Havia rotas programadas, rotas com ações ruidosas e movimentos mais aleatórios. Assim, o modelo aprendia com diferentes sequências de jogo, não apenas com um caminho fixo.

O resultado dos 100 planos

Bichouna manteve o modelo e o save inicial fixos e testou 100 planos com sementes aleatórias. O planejador treinado conseguiu escolher um Pokémon inicial em 52 tentativas. Na comparação descrita pelo desenvolvedor, sequências aleatórias de botões não tiveram sucesso, e a mesma busca com um preditor ainda não treinado acertou uma vez.

MétodoSeleções de Pokémon inicialPlanos avaliados
Planejador treinado52100
Sequências aleatórias de botões0100
Busca com preditor não treinado1100

O plano bem-sucedido selecionou Squirtle, e o número de Pokémon no grupo do jogador passou de zero para um. O resultado mede uma tarefa específica a partir de um estado salvo; não representa uma partida completa.

Escolher um inicial não é terminar Pokémon Red

O planejador procurava sequências de 14 pressionamentos de botão. A cada rodada de busca, avaliava 512 planos e mantinha os 64 com menor distância prevista até um dos objetivos — os estados associados aos Pokémon iniciais. Esse processo permitia procurar uma sequência promissora sem exigir que o modelo aprendesse a vencer o jogo inteiro.

O ponto de partida também importa: o save já estava no laboratório do Professor Oak, e qualquer um dos três iniciais contava como sucesso. A experiência de Bichouna, portanto, foi sobre planejar uma escolha dentro de uma situação delimitada, não sobre conduzir Pokémon Red desde o começo até o final.

O modelo, a GPU e o código do projeto

Bichouna relata que o modelo final tinha cerca de 12,5 milhões de parâmetros e foi treinado localmente com uma Nvidia GeForce RTX 3080 Ti. A implementação de código aberto do projeto se chama lePokeRed.