iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un estudi demostra que els transformers poden generar dues respostes coherents alhora combinant-les en un sol càlcul

Un equip internacional demostra que els grans models de llenguatge poden combinar dues converses en un sol càlcul i generar-ne alhora dues respostes coherents, una propietat que anomenen «superposició lineal».

Il·lustració editorial de Un estudi demostra que els transformers poden generar dues respostes coherents alhora combinant-les en un sol càlcul
Escolta:

Els grans models de llenguatge es construeixen amb components profundament no lineals —capes d'atenció, funcions d'activació— pensats precisament perquè el model pugui representar relacions complexes que un càlcul lineal simple no captaria. Per això sorprèn que, en determinades condicions, aquests sistemes es comportin d'una manera molt més senzilla del que la seva arquitectura suggereix.

Un equip encapçalat per Pavel Tikhonov, amb Anton Korznikov, Matvey Mikhalchuk, Nikita Dragunov, Temurbek Rahmatullaev, Polina Druzhinina, Anton Razzhigaev, Ivan Oseledets i Elena Tutubalina, ha penjat el 24 de setembre un preprint a arXiv on demostren que, si es combinen linealment les entrades de dos textos diferents abans de passar-les pel model, la sortida que se n'obté és, també, una combinació —una «superposició»— de les distribucions de probabilitat que el model hauria generat per a cada text per separat. Els autors bategen el fenomen «hipòtesi de la superposició lineal» i mostren que és una propietat pròpia de l'arquitectura Transformer, no un efecte after de com s'entrenen els models: de fet, tendeix a disminuir a mesura que avança el preentrenament, però es pot restaurar amb un ajustament fi lleuger. A partir d'aquí, presenten un mètode de descodificació guiada capaç de desentrellar les dues respostes superposades, de manera que el model genera alhora dues continuacions coherents i diferenciades en un sol pas endavant del càlcul.

La troballa és rellevant per a la interpretabilitat dels grans models de llenguatge: suggereix que, sota la seva complexitat aparent, els transformers conserven un comportament matemàticament predictible que es pot explotar, en aquest cas per generar dues respostes independents pel preu computacional d'una, cosa que obre la porta a fer-los més eficients en tasques que ara requereixen diverses passades pel model.

Es tracta d'un preprint encara sense revisió per parells, i els experiments es limiten als models i les condicions concretes que els autors han posat a prova, de manera que caldrà veure si la superposició lineal es manté igual en arquitectures i escales diferents. Els autors tampoc determinen fins a quin punt aquest mètode de descodificació guiada seria viable en un producte real, més enllà de la prova de concepte.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.