Els grans models de raonament —els que «pensen» pas a pas abans de respondre— solen ser més capaços de resoldre problemes complexos, però també més proclius a perdre la seva pròpia protecció de seguretat quan reben una petició perillosa, un fenomen que fins ara s'entenia poc. Els mètodes habituals per corregir-ho passen per reentrenar el model o ajustar-ne les preferències, sense explicar realment per què falla el mecanisme intern de rebuig.
Un equip d'investigadors encapçalat per Yizheng Yang ha analitzat símbol per símbol com evoluciona el senyal de rebuig d'aquests models davant de peticions nocives, i ha identificat el que anomenen «col·lapse del rebuig inicial»: el senyal que hauria d'activar la negativa a respondre cau en picat just en el primer símbol que el model genera, un instant crític de transició entre entendre la pregunta i començar a respondre-la. A partir d'aquesta troballa, l'equip proposa SafeToken, una intervenció que s'aplica només en el moment d'executar el model —sense reentrenar-lo— i que insereix un «ancoratge» de seguretat après en aquest punt exacte.
El resultat més cridaner és la seva mida: tocant només una única incrustació de símbol, SafeToken millora de manera notable la seguretat del model en bancs de proves de peticions perilloses i, alhora, conserva pràcticament intacta la seva capacitat de raonar. És una peça d'interpretabilitat útil perquè apunta que aquestes fallades de seguretat no són un problema difús distribuït per tot el model, sinó que es concentren en una transició molt concreta i, per tant, es poden corregir amb una intervenció mínima i barata de calcular.
Es tracta d'un preprint encara no revisat per parells, i els mateixos autors el presenten com una peça de comprensió d'un mecanisme, no com una solució definitiva: caldrà veure si el patró es manté en famílies de models diferents de les provades i si una intervenció tan puntual resisteix intents més sofisticats d'esquivar-la. Tampoc queda clar encara com es combinaria SafeToken amb les altres capes de seguretat que ja fan servir els laboratoris comercials.