iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un nou banc de proves demostra que els models d'IA entenen la topologia d'una imatge però la perden de vista quan han d'actuar-hi

MindTopo, amb participació de Microsoft Research, Northwestern i Stanford, avalua 14 models multimodals amb més d'11.000 proves sobre nusos, tancaments i continuïtat, i troba que cap s'acosta al rendiment humà quan ha de planificar accions, no només reconèixer-les.

Il·lustració editorial de Un nou banc de proves demostra que els models d'IA entenen la topologia d'una imatge però la perden de vista quan han d'actuar-hi
Escolta:

Els bancs de proves que avaluen com «veuen» l'espai els models d'IA multimodals se centren gairebé sempre en propietats mètriques —distàncies, angles, mides—, però la ciència cognitiva fa temps que assenyala que entendre l'espai també depèn de relacions topològiques, com ara si dos objectes estan connectats, si un embolcalla l'altre o si un cordó està nuat, relacions que es mantenen encara que la forma es deformi.

Un equip amb participació de Microsoft Research, la Universitat Northwestern i la Universitat de Stanford va presentar el 10 de setembre a arXiv MindTopo, un banc de proves amb 11.030 exemples i 13 tipus de tasca que avalua cinc propietats topològiques —continuïtat, separació, ordre, embolcallament i nusos— en dos nivells: reconèixer-les en una imatge estàtica, i mantenir-les mentre un agent d'IA actua en un entorn simulat, com ara un laberint, el muntatge de peces, ordenar boles, tancar un ramat o desfer un nus. Amb catorze models multimodals grans posats a prova, tots rendeixen millor en el reconeixement estàtic que quan han de planificar accions, i el millor de tots queda molt per sota del rendiment humà.

L'estudi distingeix dos tipus d'error: en el reconeixement, els models fallen sobretot per problemes de percepció, com ara no veure una paret; en la planificació, «perden» la relació topològica a mesura que canvia l'escena o proposen accions físicament impossibles. Els autors també van provar de donar als models eines de generació d'imatge i vídeo per ajudar-los a planificar, i van trobar que hi aporten poc: les imatges generades mantenen detalls locals però no segueixen de manera fiable la dinàmica de l'entorn ni conserven la topologia entre un fotograma i el següent.

És un banc de proves amb entorns i tasques generats de manera procedimental, no situacions del món real, i els autors adverteixen que un bon resultat en aquestes tasques no garanteix que un model sàpiga aplicar el mateix raonament topològic a un problema físic real, com ara manipular un objecte o moure's per un espai desconegut.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.