iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un estudi suec destapa que els mètodes fets servir per mesurar si un model de llenguatge «comparteix» coneixement entre idiomes es contradiuen entre si

Investigadors de la Universitat de Linköping han comparat quatre mètriques d'interpretabilitat en 21 models de llenguatge i han trobat que gairebé totes discrepen sobre com de compartides són les representacions internes entre idiomes, un problema que atribueixen a l'anisotropia de l'espai d'incrustacions.

Il·lustració editorial de Un estudi suec destapa que els mètodes fets servir per mesurar si un model de llenguatge «comparteix» coneixement entre idiomes es contradiuen entre si
Escolta:

Els models de llenguatge multilingües es venen sovint com a sistemes que aprenen un idioma i en transfereixen part del coneixement a la resta: la promesa és útil especialment per a llengües amb pocs recursos, com el català, que es poden beneficiar del que el model ha après en anglès o en castellà. Per comprovar-ho, la recerca en interpretabilitat fa servir mètriques matemàtiques que intenten mesurar quant «comparteixen» realment els idiomes dins de les representacions internes del model.

Oskar Holmström, Marcel Bollmann i Marco Kuhlmann, de la Universitat de Linköping (Suècia), han posat a prova quatre d'aquestes mètriques —CKA, ANC, la dominància GMM per testimoni (token) i l'ILO— en 21 models base d'entre 125 milions i 14.000 milions de paràmetres, de cinc famílies diferents, i n'han correlacionat els resultats amb el rendiment real dels mateixos models en cinc tasques de transferència entre idiomes. El resultat és que les quatre mètriques sovint discrepen entre si sobre com de compartides són les representacions d'un mateix model, i que aquesta discrepància s'explica en bona part per l'anisotropia: la tendència de les representacions internes a agrupar-se dins d'un con estret de l'espai d'incrustacions, en lloc d'escampar-se-hi uniformement. Un cop controlat l'efecte de la mida, la família i la tasca de cada model, només l'ILO manté una correlació robusta —un coeficient de Spearman de 0,90— amb el rendiment real de transferència entre idiomes.

La notícia és rellevant perquè moltes afirmacions sobre la capacitat multilingüe d'un model —incloses les que es fan servir per decidir si val la pena invertir-hi recursos per millorar-ne el rendiment en una llengua concreta— es basen en mètriques d'aquest tipus; si la mètrica en si és poc fiable per culpa de l'anisotropia, les comparacions publicades entre models, o les afirmacions sobre «comprensió compartida» entre idiomes, poden estar mal fonamentades.

El treball és un preprint encara no revisat per parells, i els autors no proposen cap mètrica nova sinó que n'audita quatre d'existents: 21 models i cinc tasques és una mostra àmplia però no exhaustiva, i el resum de l'estudi no detalla quines llengües concretes s'han fet servir a les tasques de transferència, una informació rellevant per saber si les conclusions es poden extrapolar a llengües amb pocs recursos com el català.

Mateix tema

CIÈNCIA · 4 MIN

Una intel·ligència artificial revisa vuit milions de plecs d'herbari i confirma que la floració s'avança 2,5 dies cada dècada

L'informe «State of the World's Plants and Fungi 2026», dels Reial Jardins Botànics de Kew i 400 científics de 40 països, ha fet servir un model d'aprenentatge automàtic per detectar l'estat de floració en vuit milions d'espècimens digitalitzats, una feina que hauria requerit prop de 20 anys de treball humà i que s'ha completat en una setmana.

CIÈNCIA · 4 MIN

Un sistema del MIT i Motional tradueix les decisions d'un cotxe autònom a conceptes que una persona pot entendre i preveure

El CW-Net, publicat a Nature per investigadors del MIT i l'empresa de vehicles autònoms Motional, converteix el raonament intern —opac— d'un cotxe sense conductor en frases com «s'acosta a un vehicle aturat», i millora la capacitat de conductors de seguretat i usuaris sense experiència per preveure com es comportarà el vehicle en situacions inesperades.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.