Els «models de món» són sistemes d'IA que aprenen a predir com evolucionarà una escena a partir d'una acció, i s'utilitzen cada cop més perquè robots i agents planifiquin els seus moviments sense haver de provar-los tots físicament. Un equip de recerca en robòtica ha detectat, però, un punt cec en aquest enfocament: un model pot predir amb molta precisió com serà el futur i, tot i així, ser incapaç de distingir quina de dues accions possibles és la millor per a una tasca concreta.
El nou mètode, batejat AD-WM, s'ha presentat en un article penjat el 24 de setembre a arXiv i combina una dinàmica latent amb un mecanisme que obliga el model a recuperar quina acció s'ha fet a partir de com ha canviat l'escena, en lloc de limitar-se a minimitzar l'error de predicció. En proves simulades amb blocs (l'entorn OGBench-Cube), el mètode ha passat d'un 3,7% a un 52% d'èxit en les tasques més difícils, i en un braç robòtic real de la marca Franka, la taxa d'èxit a l'hora d'agafar i col·locar objectes ha pujat del 42,2% al 71,1% sense haver-lo entrenat prèviament per a aquell escenari concret.
El resultat és rellevant perquè posa xifres a un problema conegut en robòtica —que un bon simulador intern no equival a una bona presa de decisions— i proposa una solució que no requereix més dades ni més potència de càlcul, sinó un canvi en com s'entrena el model; si es confirma en escenaris més complexos, podria fer que els robots físics necessitessin menys proves d'assaig i error abans de funcionar de manera fiable en un magatzem o una fàbrica.
És un article encara en preprint, sense revisió per parells, i els resultats es limiten a un entorn simulat de cubs i a un únic braç robòtic de laboratori; l'article tampoc no detalla encara les afiliacions institucionals dels autors, i caldrà veure com es comporta el mètode en tasques més variades i fora del control d'un laboratori.
