In een studie die op 30 september 2026 verscheen, melden onderzoekers dat Ataraxos 15 van de 20 Stratego-partijen tegen Pim Niemeijer won. De AI verloor één keer en speelde vier keer remise. De evaluatie duurde drie weken.
Ataraxos tegen Pim Niemeijer
De partijen werden gespeeld op Strategus met de standaardtijdcontrole 15+3: beide spelers kregen een tijdsbuffer van 15 minuten en drie extra seconden per zet. Ataraxos paste zijn speelwijze gedurende de reeks niet aan; Niemeijer kon tussen partijen wel van strategie veranderen.
De onderzoekers merken op dat de uitslagen daardoor niet onafhankelijk van elkaar waren: menselijke strategieën veranderden tijdens de reeks. Volgens de maatstaf van het onderzoek kwam Ataraxos uit op een effectief winstpercentage van 85%, waarbij elke remise als een halve winst telde. Dat cijfer hoort bij deze reeks van 20 partijen.
Hoe Ataraxos verborgen stukken inschat
Stratego draait om informatie die je tegenstander niet prijsgeeft. Ataraxos gebruikt een belief network, een netwerk dat op basis van bekende informatie inschat welke verborgen stukken de tegenstander mogelijk heeft. Het systeem weet dus niet welke stukken er daadwerkelijk liggen.
Vervolgens onderzoekt Ataraxos mogelijke zetten in bemonsterde spelstanden: varianten van de bordtoestand die passen bij die inschattingen. De AI combineert die zoekmethode met zelfspeltraining, waarbij het systeem tegen zichzelf speelt om strategieën te ontwikkelen.
Een aparte demonstratie in 2025
De onderzoekers rapporteerden ook een afzonderlijke demonstratie tijdens het Stratego-wereldkampioenschap van 1 tot en met 3 augustus 2025. Ataraxos won daar 38 van de 40 partijen tegen bezoekers, verloor er twee en speelde geen enkele keer remise.
| Evaluatie | Periode | Tegenstanders | Resultaat van Ataraxos |
| Evaluatie van 20 partijen | Drie weken | Pim Niemeijer | 15 zeges, 1 nederlaag, 4 remises |
| Demonstratie op het Stratego-wereldkampioenschap | 1–3 augustus 2025 | Bezoekers | 38 zeges, 2 nederlagen, 0 remises |
Training en resultaten in andere spellen
De zelfspeltraining voor Stratego gebruikte 16 NVIDIA H100-GPU’s gedurende één week. Voor de training van het belief network werden daarnaast vier H100-GPU’s vier dagen ingezet. De Stratego-training omvatte 163 miljoen voltooide zelfspelpartijen en 208 miljard omgevingsstappen.
De onderzoekers testten de aanpak ook in andere spellen met onvolledige informatie. In Barrage Stratego won Ataraxos vier reeksen van elk 50 partijen tegen drie hoog gerangschikte spelers. In Hanabi rapporteerden de onderzoekers een nieuwe state of the art; in dou dizhu versloeg Ataraxos bots die eerder de beste resultaten hadden behaald.