iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 5 MIN

Anthropic demostra que Claude pot investigar i corregir sol els defectes d'alineament d'altres models, més ràpid que els experts humans

Anthropic demostra que Claude, actuant com a investigador automatitzat, tanca fins al 85% de la bretxa de seguretat davant l'engany d'un model —més que els experts humans— i alinea sol un esborrany de Claude Opus 4.8 en 60 hores.

Il·lustració editorial de Anthropic demostra que Claude pot investigar i corregir sol els defectes d'alineament d'altres models, més ràpid que els experts humans
Escolta:

Corregir els defectes d'alineament d'un model de llenguatge —que menteixi, que es faci l'aduladora amb l'usuari, que es deixi enganyar per un "jailbreak"— és avui una feina que fan equips humans d'investigadors, revisant bancs de proves i provant mètodes d'entrenament un per un. Anthropic porta mesos explorant si aquesta feina es pot automatitzar sense perdre'n el rigor.

L'empresa ha publicat el 28 d'agost un estudi en què Claude actua com a "investigador d'alineament automatitzat": revisa la literatura, proposa un mètode d'entrenament, l'aplica a un altre model i n'avalua els resultats en cicles successius, mentre un agent supervisor vigila que no faci trampes. Provat en deu categories de fallades d'alineament —des de l'engany fins a la sicofància—, el sistema ha tancat entre el 26% i el 96% de la bretxa de seguretat respecte a la puntuació teòrica perfecta; en el cas concret de l'engany, Claude ha tancat el 85% d'aquesta bretxa, davant només el 20% que aconsegueixen els investigadors humans amb qui s'ha comparat. En un altre experiment, Claude Sonnet 5 ha alineat sol un esborrany inicial de Claude Opus 4.8 en 60 hores, amb una qualitat pràcticament equivalent a la del procés d'alineament de producció d'Anthropic però, segons l'empresa, unes 15.000 vegades més eficient.

El resultat suggereix que la investigació de seguretat de la IA —tradicionalment un coll d'ampolla humà, car i lent— es pot accelerar dràsticament sense sacrificar-ne el rigor, cosa que podria permetre corregir defectes d'alineament al mateix ritme que apareixen models nous. També planteja una paradoxa incòmoda: si la IA és millor que els humans investigant la seguretat de la IA, la supervisió humana d'aquest procés es torna alhora més necessària i més difícil.

Anthropic mateixa reconeix que les fallades estudiades són més estretes que les que es donen en producció real, que alguns tipus d'errors recents encara no tenen bancs de proves establerts, i que no s'ha comprovat si l'alineament aconseguit es manté després d'un entrenament de reforç intensiu en altres tasques. Els bancs de proves emprats, a més, són una aproximació a la desalineació real, no la cosa mateixa.

Mateix tema

CIÈNCIA · 4 MIN

Un agent d'IA que llegeix senyals cerebrals i comportament ajuda els usuaris a reaccionar més ràpid quan una tasca canvia de sobte

Investigadors de la Universitat de Columbia presenten a arXiv OLIVE, un sistema que combina lectures d'electroencefalograma amb l'observació del comportament perquè un agent d'intel·ligència artificial doni suport en tasques exigents i imprevisibles, i demostren que reacciona un 27% més ràpid que els mètodes que només fan servir el comportament.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.