Els bancs de proves que avaluen com «veuen» l'espai els models d'IA multimodals se centren gairebé sempre en propietats mètriques —distàncies, angles, mides—, però la ciència cognitiva fa temps que assenyala que entendre l'espai també depèn de relacions topològiques, com ara si dos objectes estan connectats, si un embolcalla l'altre o si un cordó està nuat, relacions que es mantenen encara que la forma es deformi.
Un equip amb participació de Microsoft Research, la Universitat Northwestern i la Universitat de Stanford va presentar el 10 de setembre a arXiv MindTopo, un banc de proves amb 11.030 exemples i 13 tipus de tasca que avalua cinc propietats topològiques —continuïtat, separació, ordre, embolcallament i nusos— en dos nivells: reconèixer-les en una imatge estàtica, i mantenir-les mentre un agent d'IA actua en un entorn simulat, com ara un laberint, el muntatge de peces, ordenar boles, tancar un ramat o desfer un nus. Amb catorze models multimodals grans posats a prova, tots rendeixen millor en el reconeixement estàtic que quan han de planificar accions, i el millor de tots queda molt per sota del rendiment humà.
L'estudi distingeix dos tipus d'error: en el reconeixement, els models fallen sobretot per problemes de percepció, com ara no veure una paret; en la planificació, «perden» la relació topològica a mesura que canvia l'escena o proposen accions físicament impossibles. Els autors també van provar de donar als models eines de generació d'imatge i vídeo per ajudar-los a planificar, i van trobar que hi aporten poc: les imatges generades mantenen detalls locals però no segueixen de manera fiable la dinàmica de l'entorn ni conserven la topologia entre un fotograma i el següent.
És un banc de proves amb entorns i tasques generats de manera procedimental, no situacions del món real, i els autors adverteixen que un bon resultat en aquestes tasques no garanteix que un model sàpiga aplicar el mateix raonament topològic a un problema físic real, com ara manipular un objecte o moure's per un espai desconegut.