iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un estudi troba que els models de llenguatge «saben» més gramàtica de la que arriben a fer servir quan responen

Un article acceptat a la conferència AACL-IJCNLP 2026 distingeix tres nivells per mesurar si un model ha après una estructura sintàctica: si la fa servir en la resposta, si la codifica internament i si un sensor extern la pot recuperar. En set models i tres llengües, el tercer nivell sempre supera els altres dos.

Il·lustració generada amb IA: Un estudi troba que els models de llenguatge «saben» més gramàtica de la que arriben a fer servir quan responen
Il·lustració generada amb IA
Escolta:

Quan un model de llenguatge falla una pregunta que depèn de la gramàtica —per exemple, saber a quin verb es refereix un pronom en una frase complexa—, no sempre queda clar si el model «no sap» aquella regla o si la sap però no l'aplica bé en aquell moment concret. Distingir les dues coses és important perquè avaluar un model només per les seves respostes pot amagar capacitats que hi són, latents, però que el model no desplega quan cal.

Un article penjat a arXiv el 24 de setembre, signat per Zhenyan Lu, He Wang i Xiaohui Huang i acceptat a la conferència AACL-IJCNLP 2026, proposa mesurar aquesta qüestió en tres nivells sobre el mateix cas: si el model dona la resposta correcta (nivell de comportament), si la capa de sortida del model ja assenyala la resposta correcta abans de decidir-se (lectura de la capa final) i si un sensor extern entrenat expressament pot recuperar aquella informació de dins de les capes intermèdies (recuperabilitat per sonda). Amb un banc de proves trilingüe (anglès, xinès i alemany) sobre dependències sintàctiques de control, i provant-ho en set models diferents, els autors troben que la recuperabilitat per sonda iguala o supera sempre la lectura de la capa final, que al seu torn iguala o supera sempre el comportament observat; la diferència més gran, de 0,653 punts, apareix al model Qwen3-0.6B Instruct en tasques de pregunta-resposta. Els autors també observen que, després d'afinar un model amb instruccions, la capa on la informació es fa «llegible» per a la sortida s'endarrereix uns deu nivells respecte d'on ja era recuperable per sonda.

El resultat és rellevant perquè posa xifres a una intuïció compartida per bona part de la recerca en interpretabilitat: avaluar un model únicament per les seves respostes en subestima el que realment «sap», mentre que llegir-ne només les representacions internes amb sondes en sobreestima la capacitat real de desplegar-ho quan cal. Per a qui avalua models —sigui per fiabilitat, per seguretat o per progrés científic—, la conclusió pràctica és que un sol nivell de mesura pot donar una imatge esbiaixada de la capacitat real del sistema.

Es tracta d'un article encara no publicat en una revista, tot i que ja ha estat acceptat en una conferència amb revisió per parells; el banc de proves es limita a dependències de control sintàctic en tres llengües i a set models de mida petita o mitjana, de manera que no es pot donar per fet que el mateix patró es repliqui igual en els grans models de frontera ni en altres fenòmens gramaticals.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.