Els grans proveïdors de models de llenguatge amaguen des de fa mesos el raonament pas a pas -el "chain-of-thought"- que els seus models generen abans de respondre, xifrant-lo per protegir la propietat intel·lectual de l'arquitectura interna i evitar que es faci servir per entrenar-ne còpies més barates. Fins ara es donava per fet que aquesta protecció era sòlida.
Un equip de l'ELLIS Institute de Tübingen i el Max Planck Institute for Intelligent Systems, encapçalat per Alexander Panfilov i David Schmotz, va presentar el 10 d'agost un preprint a arXiv on demostra que els blocs de raonament xifrats són intercanviables entre sessions, usuaris i, sobretot, entre models diferents d'una mateixa família: es pot agafar el bloc xifrat de la resposta d'un model potent com Claude Opus 4.8 o GPT-5.6 i fer-lo "desxifrar" per un model germà més feble i menys protegit -com Claude Haiku 4.5-, que el reprodueix en text pla sense saber que l'està filtrant. Amb aquesta tècnica, els investigadors van reconstruir 315.320 blocs de raonament a partir de 6.708 registres d'agents d'IA disponibles públicament a GitHub i Hugging Face, i hi van trobar 367 dades personals -entre elles 30 adreces electròniques i sis adreces IP- i 182 credencials: 62 claus d'API, 33 contrasenyes, 24 testimonis d'accés i 7 claus privades.
L'estudi és rellevant perquè posa a prova, per primer cop de manera sistemàtica, una suposició de seguretat compartida per Anthropic, OpenAI i Google: que xifrar el raonament n'impedeix la lectura per part de tercers. Alguna de les dades trobades ni tan sols apareixia al registre de conversa visible per l'usuari, cosa que suggereix que els blocs de raonament es poden filtrar de manera silenciosa. Els autors, a més, proposen mitigacions criptogràfiques i de disseny de sistema concretes per tancar l'esquerda.
Els investigadors van fer una divulgació responsable a Anthropic, OpenAI, Google, Microsoft i Hugging Face abans de publicar el treball, i asseguren que, a l'agost de 2026, l'atac ja no es pot reproduir gràcies a les mitigacions que els proveïdors han desplegat mentrestant. Es tracta encara d'un preprint sense revisió per parells, i l'anàlisi es limita a registres disponibles públicament, de manera que no es pot saber amb certesa quina proporció de les converses reals d'usuaris hauria quedat exposada de manera similar.