L'Stratego és un joc de taula de guerra on cada jugador ignora quines fitxes té l'adversari, i per això és un dels grans reptes de la IA que ha de decidir sense veure-ho tot. Fins ara, el sistema de referència era el DeepNash de DeepMind, que necessitava uns recursos de càlcul enormes. Aquest dimecres, la revista Nature ha publicat un nou sistema, Ataraxos, firmat per investigadors de Carnegie Mellon, el MIT, la Universitat de Nova York i Stanford.
Segons l'article i la nota del MIT, Ataraxos combina dues peces. D'una banda, aprèn una estratègia de base jugant contra si mateix, amb fases separades per a la col·locació de les fitxes i per als moviments. De l'altra, una xarxa de creences estima on poden ser les fitxes ocultes de l'adversari i, a cada jugada, fa una cerca addicional sobre els escenaris més plausibles. En una sèrie de vint partides contra Pim Niemeijer, considerat el millor jugador de la història, va guanyar-ne 15, en va perdre una i en va empatar quatre; en total, contra jugadors de nivell de campionat porta un balanç de 39 victòries i dues derrotes.
El resultat important és l'eficiència. L'equip assegura que va superar el DeepNash amb menys d'una centèsima part dels exemples d'entrenament i menys d'una trentena part de les partides jugades contra si mateix, amb un cost d'entrenament d'uns quants milers de dòlars. Les mateixes tècniques també van donar resultats de primer nivell en altres jocs amb informació oculta: Barrage Stratego, Hanabi i el dou dizhu. Els autors suggereixen que el mètode podria servir en àmbits on no es poden enumerar tots els escenaris, com la ciberseguretat o la logística.
Cal posar-hi cautela: guanyar un joc de taula no és el mateix que decidir en un entorn real, i la mateixa nota del MIT reconeix que, abans de portar un sistema així a usos militars o empresarials, caldria que pogués explicar les decisions a les persones. De moment és una demostració, molt sòlida, que els jocs d'informació oculta es poden resoldre sense gastar milions.
