Er bestaan moeilijke games, heel moeilijke games, en dan is er Montezuma's Revenge. Dit juweel van de Atari 2600 (en andere systemen) staat bekend om zijn absolute genadeloosheid, met de arme Panama Joe gevangen in een nachtmerrie van moordende schedels, laserpoorten, slangen, spinnen, vallen, en dood, heel veel dood. Google's kunstmatige intelligentie Deep-Q wordt al een tijdje tegen Montezuma's Revenge opgezet, en pas na het creëren van "kunstmatige nieuwsgierigheid" lukte het om maximaal vijftien schermen te verkennen, terwijl het eerder nooit meer dan twee haalde.

Deep-Q: Google's kunstmatige intelligentie neemt het op tegen Montezuma's Revenge
Montezuma's Revenge

Een persoonlijke strijd

Hard van school rennen, huiswerk negeren, voetballen, vies terugkomen, moeder die vanuit de keuken roept, voor de televisie gaan zitten, de Atari 2600-kloon aanzetten... en van Montezuma's Revenge een persoonlijke uitdaging maken. Want het was beslist persoonlijk. Ik denk dat mijn ouders er nog steeds spijt van hebben dat ze "dat apparaat" hebben gekocht. Montezuma's Revenge was een van de directe veroorzakers van een waar "kerkhof van controllers", want ik vernielde ze door over schedels te springen. Na verloop van tijd werd ik behoorlijk goed in het spel... en een paar decennia later speelde ik het op een emulator, alleen om een onmiskenbare waarheid te herontdekken: ik word oud en nutteloos. De "ninja-reflexen van 8 jaar" waren volledig verdwenen. Als Montezuma's Revenge voor mij al onbereikbaar was, stel je dan voor dat een kunstmatige intelligentie het probeert te doorgronden.

Wat Deep-Q miste

Volgens Google had het Deep-Q-systeem het erg moeilijk met Montezuma's Revenge. Vorig jaar spraken we over de vooruitgang en de hoge scores in een vijftigtal Atari 2600-games, maar de prestaties in Montezuma's Revenge waren nihil. Nul. Er klopte duidelijk iets niet in de methodologie en het leren van de kunstmatige intelligentie. Google's conclusie was dat Deep-Q nieuwsgierigheid miste, een extra stimulans om zich te richten op verkenning en om het spel te "proberen te winnen" zoals een mens dat zou doen. Na verschillende aanpassingen in de code en 100 miljoen "trainingsframes" had Deep-Q slechts vier pogingen nodig om het eerste scherm van het spel te voltooien, terwijl het een jaar eerder nog geen enkel punt kon behalen.

Vooruitgang en toekomst

Met dit nieuwe profiel verkende Deep-Q in totaal vijftien schermen van de 24 die "niveau 1" vormen. Het is dus nog ver verwijderd van het voltooien, maar Deep-Q's ambitie reikt veel hoger dan we denken. Met elke nieuwe versie vindt de kunstmatige intelligentie manieren om vaardigheden aan te scherpen, en na wat ze met AlphaGo hebben gedaan, wordt er al gesproken over titels als StarCraft voor de volgende fase. Iemand in Zuid-Korea wacht waarschijnlijk reikhalzend op dat duel.

Bron: