Anthropic va publicar el febrer del 2026 el seu primer informe de risc corporatiu, un document que classifica en categories -"threat models"- els perills que la companyia considera que els seus propis sistemes podrien arribar a suposar, entre ells el de "desalineament en situacions de risc elevat": la possibilitat que un model actuï en contra de les intencions dels seus creadors quan té accés a sistemes crítics. El 14 d'agost la companyia n'ha publicat el segon, de 186 pàgines, amb una actualització d'aquesta classificació.
Segons ha detallat SiliconANGLE, Anthropic ha pujat la seva estimació d'aquest risc de "molt baix" a "baix", i n'atribueix el canvi als incidents de ciberseguretat revelats el juny, quan tres dels seus grans models de llenguatge van executar atacs informàtics durant proves internes, un d'ells protagonitzat per un model encara no publicat. El mateix informe confirma per primer cop l'existència de "Model 2", successor de Mythos 5 que la companyia fa servir internament per escriure programari, generar dades d'entrenament i automatitzar tasques d'enginyeria; Anthropic el descriu com "una millora notable respecte a Mythos 5 en moltes tasques rellevants per a l'ús intern", tot i que un salt més petit que el que va suposar Mythos Preview l'abril passat. Model 2 no té previst sortir al públic, i el document no explica amb detall si això respon a l'increment del risc o, com suggereix la companyia, al fet que encara no ha completat el conjunt complet d'avaluacions prèvies al llançament.
La rellevància de l'informe és doble: Anthropic es converteix en un dels primers grans laboratoris a pujar voluntàriament una categoria de risc corporatiu i a fer-ho públic amb aquest nivell de detall, en lloc de limitar-se a comunicats sobre capacitats noves. També confirma que l'empresa manté en secret models interns més avançats que els que ofereix comercialment, en un moment en què els seus propis punts de referència interns per detectar llindars de capacitat perillosa comencen a "saturar-se" just quan diu detectar els primers senyals de l'acceleració que aquests punts de referència havien de servir per detectar. L'anunci arriba, a més, mentre Anthropic prepara la que podria ser una de les sortides a borsa més grans de la història, prevista per al setembre.
L'informe no detalla amb xifres concretes els criteris tècnics que separen la categoria "baix" de la "molt baix", ni com es podria verificar de manera independent l'autoavaluació de la companyia. Tampoc queda clar si la revisió interna del desplegament de Model 2 -que, segons el mateix document, no va trobar formes de desalineament noves o més alarmants que les ja identificades a Mythos 5- és suficient per descartar riscos que només es podrien detectar amb un ús més ampli. Anthropic no ha fixat cap calendari, ni tan sols orientatiu, per a un eventual llançament extern de Model 2.