iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un estudi qüestiona si les neurones assenyalades com a responsables de les al·lucinacions de la IA hi estan realment localitzades

Investigadors proposen un protocol de cinc proves per posar a prova els mètodes d'interpretabilitat que diuen haver trobat neurones concretes que detecten quan un model de llenguatge inventa informació, i troben que la majoria de les que s'havien assenyalat no estan aïllades, sinó molt correlacionades amb altres trets del model.

Il·lustració generada amb IA: Un estudi qüestiona si les neurones assenyalades com a responsables de les al·lucinacions de la IA hi estan realment localitzades
Il·lustració generada amb IA
Escolta:

Una part de la recerca en interpretabilitat de models de llenguatge busca aïllar neurones concretes, dins la xarxa, que semblen controlar comportaments com la seguretat, la memòria de fets o les al·lucinacions, amb la idea que, si es localitzen, es podrien corregir o auditar amb precisió quirúrgica. Aquestes troballes solen basar-se en tècniques de sondeig dit «esparses», però rares vegades es posen a prova contra els problemes coneguts d'aquest mètode quan els trets del model estan molt correlacionats entre si.

Un equip de cinc investigadors, encapçalat per Huseyin Cavus, proposa a arXiv, el 24 de setembre, un protocol de cinc proves de diagnòstic —correlació entre trets, estabilitat amb remostreig (bootstrap), comparació entre classificacions esparses i denses, una prova d'intervenció de referència i avaluació creuada entre conjunts de dades— i l'aplica a un treball anterior que deia haver trobat «neurones de l'al·lucinació» (H-neurons). Amb models oberts i tres bancs de proves de preguntes i respostes (TriviaQA, BioASQ i NQ-Open), la detecció es reprodueix bé i fins i tot millora (en el model Gemma 3 4B, l'indicador AUROC puja 0,311 punts a TriviaQA), però 19 de les 22 neurones assenyalades resulten estar fortament correlacionades amb altres trets del model, la selecció per remostreig només és moderadament estable, i la coincidència entre els mètodes esparsos i densos és feble.

La distinció que proposen els autors —entre «detectar» un comportament i «localitzar-lo» de debò en unes poques neurones concretes— importa perquè cada cop més eines d'auditoria i de correcció de models es basen en la idea que n'hi ha prou d'identificar i ajustar un grapat de neurones per canviar com es comporta un sistema d'IA. Si aquesta localització és més aparent que real, les intervencions que se'n deriven poden no generalitzar-se fora del conjunt de dades on es van provar, encara que el detector en si funcioni bé.

L'estudi és un preprint, encara sense revisió per parells, i es limita a un tipus de tasca (preguntes i respostes) i a un nombre reduït de models oberts, no pas a l'ecosistema sencer de grans models de llenguatge. Els autors no rebategen que existeixi cap patró relacionat amb les al·lucinacions, sinó que reclamen aplicar aquest protocol de validació abans de donar per bona qualsevol afirmació de «localització» en la recerca d'interpretabilitat.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.