iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un experiment amb accés "privilegiat" desmunta la idea que els grans models de llenguatge controlin la seva pròpia activitat interna

Un preprint publicat l'1 de setembre a arXiv redissenya els experiments de "neurofeedback en context" perquè el model no pugui deduir l'objectiu de control a partir de l'enunciat, i troba que els grans models de llenguatge deixen de mostrar aquest control.

Il·lustració editorial de Un experiment amb accés "privilegiat" desmunta la idea que els grans models de llenguatge controlin la seva pròpia activitat interna
Escolta:

Alguns treballs anteriors havien afirmat que els grans models de llenguatge poden aprendre a controlar la seva pròpia activitat interna quan se'ls dona una retroalimentació sobre l'estat de les seves representacions, un fenomen batejat "neurofeedback en context" que s'havia interpretat com un indici de metacognició genuïna: el model "sabria" què passa dins seu i podria ajustar-ho a voluntat.

Koshiro Aoki, Ryota Takatsuki, Gouki Minegishi, Yusuke Haruki i Daisuke Kawahara han publicat l'1 de setembre a arXiv un experiment que qüestiona aquesta interpretació. Els autors sostenen que els experiments anteriors permetien, sense voler-ho, que el model deduís l'objectiu de control a partir de pistes visibles en el mateix enunciat, i han redissenyat la prova perquè aquest objectiu només es pugui conèixer per "accés privilegiat" a la pròpia representació interna, imitant el disseny dels experiments de neurociència amb humans, on el subjecte no pot saber conscientment quin senyal cerebral se li demana que modifiqui. Amb aquest disseny més estricte, els models no van mostrar un control fiable sobre les seves pròpies representacions internes quan no en podien inferir l'objectiu a partir de l'enunciat.

El resultat és rellevant perquè posa en dubte que la capacitat de "neurofeedback" observada en treballs previs fos una prova de metacognició real dels models, en lloc d'un simple aprofitament de patrons superficials del text de l'enunciat. Els autors conclouen que avaluar si un model de llenguatge té una consciència genuïna del seu propi estat intern exigeix dissenys experimentals que requereixin explícitament aquest accés privilegiat, no proves que es puguin resoldre llegint només l'enunciat.

És un preprint encara no revisat per parells, i els autors no detallen si el resultat es mantindria amb models molt més grans que els que han fet servir en l'experiment. Tampoc queda clar si existeix cap disseny experimental que pugui distingir de manera concloent una metacognició genuïna d'un aprenentatge estadístic molt sofisticat del llenguatge.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.