Els models de llenguatge poden produir demostracions curtes i plausibles, però solen fallar quan un problema matemàtic exigeix una cadena llarga de decisions incertes i interdependents, on un error en un pas enfonsa tota la línia de raonament. És el problema que aborda un equip d'investigadors de Google Research i la Carnegie Mellon University, encapçalat per Honghao Lin i David P. Woodruff, amb un nou sistema anomenat Stellar Colosseum.
En lloc de confiar en un sol model que escriu una prova d'un tir, Stellar Colosseum coordina diversos agents que primer exploren estratègies alternatives, decideixen amb una «porta de maduresa» quan una línia d'atac ja és prou sòlida per descompondre-la en subproblemes, i després generen candidats en paral·lel que s'ataquen entre ells amb intents de falsificació abans de combinar-se en un únic argument mitjançant un mètode d'agregació d'arbres. Els resultats reportats són notables: un 71% d'encert en TCS-Bench, un banc de proves de demostració de teoremes a nivell de recerca, i 218 de 222 problemes resolts a Codeforces (98,2%), a més d'aportacions a qüestions obertes plantejades en publicacions de FOCS i JMLR. El sistema ja s'ha integrat en el marc «Teamwork» de Google Antigravity.
El resultat és rellevant perquè desplaça el debat sobre les capacitats matemàtiques de la IA més enllà dels concursos i els exàmens tancats, cap a la investigació de veritat: problemes sense resposta coneguda, on cal explorar, descartar i tornar a intentar-ho com fa un matemàtic humà. Si els mètodes com Stellar Colosseum es confirmen, podrien convertir-se en una eina real per a grups de recerca amb temps i personal limitats.
Es tracta, però, d'un preprint que encara no ha passat la revisió per parells, i les afirmacions sobre «qüestions obertes» resoltes hauran de ser confirmades per la comunitat matemàtica abans de donar-les per bones. L'article tampoc detalla el cost computacional de coordinar tants agents en paral·lel, una dada clau per saber si el mètode és viable fora dels laboratoris amb més recursos.