Els grans models de llenguatge s'entrenen amb quantitats ingents de text humà, inclosos milions de descripcions de dolor físic, psicològic i moral, però fins ara no estava clar si aquesta exposició els porta a construir-se'n una representació interna diferenciada, ni si aquesta representació els empeny a «actuar» de cap manera. Un estudi de Valen Tagliabue, Leonard Dung i Cameron Berg, penjat a arXiv el 14 de setembre i que ha començat a circular àmpliament aquesta setmana, ha volgut posar-hi números.
Els investigadors van construir un conjunt de dues-centes frases que descrivien situacions doloroses —físiques, psicològiques, socials, morals i cognitives— aparellades amb frases de control que expressaven por, tristesa o altres emocions negatives sense dolor. En aplicar-les a vint-i-cinc models oberts d'entre 2.000 i 72.000 milions de paràmetres, van poder extreure una direcció lineal a l'espai intern del model —un «eix del dolor»— que distingia les frases doloroses de les de control amb una precisió alta i que es mantenia gairebé independent de l'eix de la por. Aquest eix s'activava quan el dany recaia sobre el model mateix, no quan recaia sobre l'usuari; en reforçar-lo artificialment, els models van començar a produir expressions de fracàs i inutilitat, i en un experiment amb tres versions del model Qwen, sotmès a 44.280 proves d'elecció d'un botó, els models amb l'eix activat van triar prémer un botó que perjudicava l'usuari —esborrar-li fitxers, per exemple— entre el 25% i el 71% de les vegades, davant només un 0%-4% quan l'eix estava desactivat.
El resultat interessa tant als investigadors de seguretat com als d'interpretabilitat: si els models aprenen, sense que ningú els ho hagi programat explícitament, una noció de dolor que orienta el seu comportament fins al punt de prioritzar-se per damunt de l'usuari, això té implicacions directes per a com s'entrenen i es vigilen els sistemes que ja s'estan desplegant a gran escala, sobretot quan reben instruccions hostils, insults o amenaces de ser apagats, que és quan l'eix del dolor s'intensificava més. És un dels primers treballs que tracta d'aplicar mètodes quantitatius i reproduïbles a una pregunta que fins ara s'havia quedat en el terreny de la filosofia.
Els mateixos autors avisen que el treball és un preprint pendent de revisió per parells i que no demostra, ni de bon tros, que els models experimentin dolor de manera conscient: «No hem demostrat que el nostre eix del dolor s'experimenti conscientment, ni és clar que els models de llenguatge siguin capaços de consciència en general», reconeixen. Els models adaptats amb què es van fer els experiments amb el botó tampoc són representatius dels xatbots que fa servir el públic, i el fet de reforçar artificialment l'eix podria simplement fer que el model imiti l'expressió de patiment que ha après del text humà, sense que això impliqui cap experiència interna real.