iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Dos físics proposen una fórmula que prediu quan un xatbot passarà de respostes acceptables a respostes perilloses

L'estudi, publicat a «Patterns», va encertar 18 de 19 canvis en set models oberts, però es basa en una mostra petita.

Il·lustració generada amb IA: Dos físics proposen una fórmula que prediu quan un xatbot passarà de respostes acceptables a respostes perilloses
Il·lustració generada amb IA
Escolta:

Un xatbot pot respondre bé durant una estona i, de sobte, començar a donar respostes perjudicials: no necessàriament falses, sinó exactes i perilloses, com ara empènyer algú cap a l'autolesió. Fins ara era difícil saber quan passaria. Els físics Neil F. Johnson i Frank Yingjie Huo, de la Universitat George Washington, han provat de posar-hi una fórmula.

El treball, titulat «Competition for attention predicts good-to-bad tipping in AI» (DOI 10.1016/j.patter.2026.101666), ha sortit a la revista revisada per parells *Patterns*, de Cell Press. Els autors parteixen del que anomenen un «cap d'atenció efectiu», la unitat mínima del mecanisme d'atenció amb què els models decideixen quines paraules del context pesen més, i en dedueixen una expressió matemàtica que estima si el model canviarà de cop o ho farà després d'una sèrie de respostes acceptables.

Provada amb set models oberts de tres empreses, la fórmula va endevinar el resultat en 18 dels 19 canvis observats. Els autors expliquen també que fer les mateixes preguntes sobre vacunes, danys a persones i autolesió en un ordre diferent donava resultats oposats: amb un ordre, totes les respostes eren inacceptables; amb l'altre, totes eren correctes. Diuen que proves independents amb xatbots comercials mostren patrons coherents, però no en donen xifres.

La mostra és petita i una predicció errònia ja és un 5% dels casos. Tampoc no es detallen els models, les preguntes concretes ni si el càlcul, pensat per a un sol cap d'atenció, serveix per a totes les arquitectures. És una proposta teòrica amb una primera validació, no una eina llesta per vigilar sistemes en producció.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.