Avaluar la intel·ligència d'un model de llenguatge s'ha tornat més difícil a mesura que els bancs de proves habituals es queden curts: un cop els models els resolen quasi tots, deixen de distingir quin és millor. Els jocs, en canvi, ofereixen un llindar que puja sol amb el nivell dels jugadors, cosa que en fa una mesura que no es queda obsoleta tan de pressa.
Un equip de prop de 45 investigadors de Kaggle, la plataforma de competicions de dades propietat de Google, encapçalat per Bovard Doerschuk-Tiberi, presenta a arXiv, el 25 de setembre, Game Arena: una infraestructura oberta on els models s'enfronten en partides cara a cara dins d'entorns estructurats. La primera versió inclou tres jocs pilot pensats per posar a prova capacitats diferents: els escacs (informació perfecta, on tots dos jugadors veuen el mateix tauler), el pòquer (informació imperfecta, amb un component de blef i gestió del risc) i «Werewolf», un joc social de múltiples jugadors que exigeix detectar mentides i coordinar-se. Els autors en destaquen la reproductibilitat i la transparència, i el disseny perquè s'hi puguin afegir nous jocs amb el temps.
La proposta interessa perquè, a diferència d'un examen fix que es pot memoritzar o que acaba saturant-se, la força relativa dels models en un joc es manté com a mesura útil mentre en surtin de nous i millorin: la classificació es pot anar refent contínuament. Aplicat als tres jocs pilot, el mètode permet distingir capacitats de planificació estratègica, adaptació a l'adversari i robustesa davant la incertesa que els bancs de proves estàtics no sempre capturen bé.
És un article encara sense revisió per parells, publicat pel mateix equip que ha construït la infraestructura, cosa que convida a llegir-ne les conclusions amb la cautela habitual quan és l'autor de l'eina qui en valora els resultats. De moment només cobreix tres jocs pilot, i guanyar a escacs, pòquer o «Werewolf» no garanteix que un model raoni igual de bé en tasques del món real allunyades del joc.
