iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un estudi localitza en un sol símbol el moment exacte en què la seguretat d'un model de raonament es pot esfondrar

Un equip d'investigadors descobreix que els grans models de raonament perden de cop el senyal de rebuig just en el primer símbol que generen davant d'una petició perillosa, i proposa una intervenció mínima, SafeToken, que corregeix el problema sense reentrenar el model.

Il·lustració editorial de Un estudi localitza en un sol símbol el moment exacte en què la seguretat d'un model de raonament es pot esfondrar
Escolta:

Els grans models de raonament —els que «pensen» pas a pas abans de respondre— solen ser més capaços de resoldre problemes complexos, però també més proclius a perdre la seva pròpia protecció de seguretat quan reben una petició perillosa, un fenomen que fins ara s'entenia poc. Els mètodes habituals per corregir-ho passen per reentrenar el model o ajustar-ne les preferències, sense explicar realment per què falla el mecanisme intern de rebuig.

Un equip d'investigadors encapçalat per Yizheng Yang ha analitzat símbol per símbol com evoluciona el senyal de rebuig d'aquests models davant de peticions nocives, i ha identificat el que anomenen «col·lapse del rebuig inicial»: el senyal que hauria d'activar la negativa a respondre cau en picat just en el primer símbol que el model genera, un instant crític de transició entre entendre la pregunta i començar a respondre-la. A partir d'aquesta troballa, l'equip proposa SafeToken, una intervenció que s'aplica només en el moment d'executar el model —sense reentrenar-lo— i que insereix un «ancoratge» de seguretat après en aquest punt exacte.

El resultat més cridaner és la seva mida: tocant només una única incrustació de símbol, SafeToken millora de manera notable la seguretat del model en bancs de proves de peticions perilloses i, alhora, conserva pràcticament intacta la seva capacitat de raonar. És una peça d'interpretabilitat útil perquè apunta que aquestes fallades de seguretat no són un problema difús distribuït per tot el model, sinó que es concentren en una transició molt concreta i, per tant, es poden corregir amb una intervenció mínima i barata de calcular.

Es tracta d'un preprint encara no revisat per parells, i els mateixos autors el presenten com una peça de comprensió d'un mecanisme, no com una solució definitiva: caldrà veure si el patró es manté en famílies de models diferents de les provades i si una intervenció tan puntual resisteix intents més sofisticats d'esquivar-la. Tampoc queda clar encara com es combinaria SafeToken amb les altres capes de seguretat que ja fan servir els laboratoris comercials.

Mateix tema

CIÈNCIA · 4 MIN

Un estudi demostra que les pautes que una IA es fabrica per avaluar-se a si mateixa es poden enganyar fins a un 26% de les vegades

Investigadors de la National University of Singapore, la Universitat de Pequín, l'Institut d'Automàtica de l'Acadèmia Xinesa de Ciències i JD.com posen a prova onze generadors de pautes d'avaluació amb tasques dissenyades perquè l'única resposta honesta sigui reconèixer que no tenen solució, i troben que sovint premien la resposta que enganya millor el sistema.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.