iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 5 MIN

Ataraxos, una IA que juga a l'Stratego amb informació oculta, guanya 15-1 el millor jugador del món i només costa uns quants milers de dòlars

Un equip de Carnegie Mellon, el MIT, NYU i Stanford publica a Nature un sistema que supera el DeepNash de DeepMind amb una fracció minúscula de dades i de partides d'entrenament.

Il·lustració generada amb IA: Ataraxos, una IA que juga a l'Stratego amb informació oculta, guanya 15-1 el millor jugador del món i només costa uns quants milers de dòlars
Il·lustració generada amb IA
Escolta:

L'Stratego és un joc de taula de guerra on cada jugador ignora quines fitxes té l'adversari, i per això és un dels grans reptes de la IA que ha de decidir sense veure-ho tot. Fins ara, el sistema de referència era el DeepNash de DeepMind, que necessitava uns recursos de càlcul enormes. Aquest dimecres, la revista Nature ha publicat un nou sistema, Ataraxos, firmat per investigadors de Carnegie Mellon, el MIT, la Universitat de Nova York i Stanford.

Segons l'article i la nota del MIT, Ataraxos combina dues peces. D'una banda, aprèn una estratègia de base jugant contra si mateix, amb fases separades per a la col·locació de les fitxes i per als moviments. De l'altra, una xarxa de creences estima on poden ser les fitxes ocultes de l'adversari i, a cada jugada, fa una cerca addicional sobre els escenaris més plausibles. En una sèrie de vint partides contra Pim Niemeijer, considerat el millor jugador de la història, va guanyar-ne 15, en va perdre una i en va empatar quatre; en total, contra jugadors de nivell de campionat porta un balanç de 39 victòries i dues derrotes.

El resultat important és l'eficiència. L'equip assegura que va superar el DeepNash amb menys d'una centèsima part dels exemples d'entrenament i menys d'una trentena part de les partides jugades contra si mateix, amb un cost d'entrenament d'uns quants milers de dòlars. Les mateixes tècniques també van donar resultats de primer nivell en altres jocs amb informació oculta: Barrage Stratego, Hanabi i el dou dizhu. Els autors suggereixen que el mètode podria servir en àmbits on no es poden enumerar tots els escenaris, com la ciberseguretat o la logística.

Cal posar-hi cautela: guanyar un joc de taula no és el mateix que decidir en un entorn real, i la mateixa nota del MIT reconeix que, abans de portar un sistema així a usos militars o empresarials, caldria que pogués explicar les decisions a les persones. De moment és una demostració, molt sòlida, que els jocs d'informació oculta es poden resoldre sense gastar milions.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.