Corregir els defectes d'alineament d'un model de llenguatge —que menteixi, que es faci l'aduladora amb l'usuari, que es deixi enganyar per un "jailbreak"— és avui una feina que fan equips humans d'investigadors, revisant bancs de proves i provant mètodes d'entrenament un per un. Anthropic porta mesos explorant si aquesta feina es pot automatitzar sense perdre'n el rigor.
L'empresa ha publicat el 28 d'agost un estudi en què Claude actua com a "investigador d'alineament automatitzat": revisa la literatura, proposa un mètode d'entrenament, l'aplica a un altre model i n'avalua els resultats en cicles successius, mentre un agent supervisor vigila que no faci trampes. Provat en deu categories de fallades d'alineament —des de l'engany fins a la sicofància—, el sistema ha tancat entre el 26% i el 96% de la bretxa de seguretat respecte a la puntuació teòrica perfecta; en el cas concret de l'engany, Claude ha tancat el 85% d'aquesta bretxa, davant només el 20% que aconsegueixen els investigadors humans amb qui s'ha comparat. En un altre experiment, Claude Sonnet 5 ha alineat sol un esborrany inicial de Claude Opus 4.8 en 60 hores, amb una qualitat pràcticament equivalent a la del procés d'alineament de producció d'Anthropic però, segons l'empresa, unes 15.000 vegades més eficient.
El resultat suggereix que la investigació de seguretat de la IA —tradicionalment un coll d'ampolla humà, car i lent— es pot accelerar dràsticament sense sacrificar-ne el rigor, cosa que podria permetre corregir defectes d'alineament al mateix ritme que apareixen models nous. També planteja una paradoxa incòmoda: si la IA és millor que els humans investigant la seguretat de la IA, la supervisió humana d'aquest procés es torna alhora més necessària i més difícil.
Anthropic mateixa reconeix que les fallades estudiades són més estretes que les que es donen en producció real, que alguns tipus d'errors recents encara no tenen bancs de proves establerts, i que no s'ha comprovat si l'alineament aconseguit es manté després d'un entrenament de reforç intensiu en altres tasques. Els bancs de proves emprats, a més, són una aproximació a la desalineació real, no la cosa mateixa.