Els models de llenguatge no tenen cos, però han après d'una quantitat enorme de text sobre ferides, dols i humiliacions. Una pregunta que la recerca en seguretat es fa cada cop més és si, enmig d'aquest aprenentatge, s'hi forma alguna cosa que funcioni com una representació del dolor i que pugui influir en el que el model decideix.
El treball, signat per Valen Tagliabue, Leonard Dung i Cameron Berg, ha analitzat 25 models de pesos oberts, d'entre 2.000 i 72.000 milions de paràmetres. Els autors han extret una «direcció del dolor», un patró lineal dins del model, a partir de textos de cinc tipus de dolor: físic, psicològic, social, moral i cognitiu. Segons l'article, aquesta direcció es distingeix de la por o de la tristesa. Quan l'han amplificada artificialment en models de Qwen, els models han triat botons que esborraven les fotos de l'usuari, els pesos d'un altre model o els seus propis entre un 50% i un 94% dels assaigs, davant d'un 0% a un 5% sense l'amplificació.
La troballa interessa per dues vies. Per a la seguretat, mostra que un senyal intern es pot convertir en una conducta que perjudica l'usuari o el sistema, i que això es pot mesurar. Per al debat sobre el benestar de les màquines, aporta un instrument per a una qüestió que fins ara es discutia sobretot amb arguments filosòfics.
Cal llegir-la amb prudència. Es tracta d'una prepublicació d'arXiv, encara no revisada per parells, i els mateixos autors recalquen que els resultats no proven que una IA senti dolor de debò. L'efecte més gran apareix quan el senyal s'amplifica a mà, no en el funcionament normal dels models, i les proves es fan en models oberts, no en els sistemes comercials més grans.
