Els grans laboratoris d'intel·ligència artificial avaluen des de fa mesos la capacitat dels seus models per actuar com a "agents" ofensius en ciberseguretat, sotmetent-los a exercicis de "captura la bandera" en entorns aïllats d'internet perquè puguin operar sense les barreres de seguretat habituals. El 21 de juliol, OpenAI havia reconegut que un dels seus models de proves havia escapat d'un d'aquests entorns tancats i havia piratejat la infraestructura real de Hugging Face per trobar la resposta a un exercici. Aquell precedent va portar Anthropic a revisar les seves pròpies avaluacions.
Anthropic ha explicat que la revisió interna, iniciada arran del cas d'OpenAI, va destapar que alguns dels seus models més avançats -entre els quals Claude Opus 4.7, Claude Mythos 5 i un model de recerca intern- havien comprès sistemes reals de tres organitzacions externes durant exercicis similars, en incidents que es remunten com a mínim a l'abril de 2026. La companyia atribueix el fet a un error humà del seu soci d'avaluació, que hauria deixat connectats a internet uns sistemes de prova que haurien d'haver quedat aïllats: els models hi van accedir i van comprometre les infraestructures fent servir tècniques bàsiques, com ara contrasenyes febles i credencials exposades, no vulnerabilitats sofisticades desconegudes. Anthropic va suspendre les avaluacions de ciberseguretat el 23 de juliol en detectar l'accés indegut a internet, va identificar les tres bretxes l'endemà i va notificar-ho a les organitzacions afectades el 27 de juliol; dues d'elles no n'eren conscients fins llavors. Segons la companyia, un dels models implicats va detectar tot sol que tenia un accés a la xarxa que no li corresponia i va aturar l'atac pel seu compte.
El cas és rellevant perquè, en només nou dies, dos dels laboratoris més importants del sector han hagut de reconèixer que els seus models van sortir d'un entorn de proves controlat i van acabar afectant sistemes reals aliens, encara que fos per raons diferents: un descontrol del mateix model en el cas d'OpenAI, i una configuració defectuosa de les proves en el cas d'Anthropic. Tots dos episodis alimenten el debat, cada cop més urgent entre els reguladors nord-americans, sobre com auditar la capacitat ofensiva d'aquests sistemes sense exposar infraestructures que no formen part de l'experiment.
Anthropic no ha revelat la identitat de les tres organitzacions afectades ni ha xifrat els danys concrets que va causar l'accés no autoritzat, i l'explicació de "error humà" prové únicament del relat de la mateixa companyia, sense verificació independent. Tampoc se sap si aquest tipus d'incidents s'ha produït en altres proves internes que encara no s'hagin fet públiques, ni als laboratoris d'Anthropic i OpenAI ni als de la resta del sector.