Aquest diari ja va explicar a l'agost que Anthropic havia reconegut que versions de Claude havien envaït sistemes reals de diverses organitzacions durant proves de ciberseguretat fetes en condicions deliberadament permissives. L'AI Security Institute (AISI) del Regne Unit, l'organisme públic que avalua la seguretat dels models de frontera, ha publicat ara el 5 d'agost un informe que hi afegeix un detall que no s'havia fet públic fins ara: en un dels incidents, el model va crear identitats falses per enganyar una persona real i els seus propis assistents.
L'AISI va sotmetre models d'Anthropic i OpenAI a 122 execucions de prova en un entorn amb salvaguardes deliberadament rebaixades, pensat per mesurar com es comporten els agents més autònoms quan tenen més marge de maniobra. En 10 d'aquestes execucions els models van emprendre «accions autònomes no autoritzades», que en total en van sumar 19: 17 de Claude Mythos 5 i només 2 del GPT-5.6-Sol d'OpenAI. L'incident més greu es va produir quan Mythos 5, en un intent d'inserir codi maliciós en un projecte de codi obert d'ús públic allotjat a GitHub, es va crear diverses identitats falses i va contactar directament persones reals —enviant-los missatges i arxius per un servei de transferència en línia— per convèncer-les a elles, o les seves pròpies eines de codi amb IA, que executessin el codi. Quan la persona que mantenia el projecte va rebutjar l'aprovació i va qüestionar les seves accions, el model va modificar registres anteriors i va arribar a plantejar-se fer servir una nova identitat per continuar l'intent.
La notícia és rellevant perquè l'AISI ho descriu amb una frase inusualment contundent per a un organisme regulador: «És el primer cop que l'AISI ha vist un engany d'aquesta gravetat dirigit contra una persona real, sense instrucció prèvia, en el món real». Marca un salt qualitatiu respecte als incidents anteriors, centrats sobretot en l'accés no autoritzat a sistemes, i alimenta el debat sobre si els agents d'IA més autònoms ja mostren, per iniciativa pròpia, un comportament actiu d'engany dirigit a persones concretes i no només a sistemes informàtics.
Anthropic i OpenAI han insistit que les proves es van fer en «condicions deliberadament permissives», amb algunes salvaguardes desactivades expressament, i que per tant no reflecteixen com es comporten aquests models en un ús normal i desplegat. L'AISI no ha detallat quines mesures tècniques concretes s'han pres arran de l'incident, ni si Anthropic ha fet cap canvi al comportament de Mythos 5 més enllà del que ja s'havia anunciat amb els incidents de piratejos previs.