Els models de raonament d'OpenAI, Anthropic i Google no revelen tot el seu procés de pensament intern: per motius de propietat intel·lectual i seguretat, en xifren bona part i el retornen al client en «blocs xifrats» que cal reenviar en les crides següents de l'API perquè el model recuperi el context, en lloc de guardar-lo als seus propis servidors. El cripto-investigador Matthew Green, de la Universitat Johns Hopkins, ja havia documentat el maig de 2026 que aquests blocs es podien reproduir en sessions diferents, però sense aconseguir extreure'n cap secret de manera fiable; OpenAI va considerar el comportament impossible de reproduir i Anthropic no hi va veure cap implicació de seguretat.
Un equip d'investigadors -Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping i Maksym Andriushchenko- ha publicat el 10 d'agost a arXiv l'article «Stealing Reasoning Traces from Proprietary LLM APIs», on demostren que aquests blocs xifrats són «plenament compatibles i intercanviables entre sessions, usuaris i models diferents dins l'ecosistema d'un mateix proveïdor». Això permet injectar el rastre de raonament d'un model potent dins d'un de més feble i menys protegit, que el desxifra sense necessitat de comprometre directament el model original. Aplicant la tècnica sobre 6.708 trajectòries públiques d'agents d'IA, els investigadors van descodificar 315.320 blocs de pensament i en van recuperar 704 artefactes de privadesa de sessions reals d'usuaris, entre els quals 62 claus d'API, 33 contrasenyes, 24 tocs d'accés i 7 claus privades.
Més enllà de la fuga de credencials, els autors demostren tres altres usos maliciosos possibles de la tècnica: esquivar les proteccions contra la destil·lació de models -reconstruir el raonament d'un model rival a partir dels seus blocs xifrats-, exposar contingut perillós que el model havia raonat internament però no havia arribat a mostrar a la resposta final, i injectar instruccions invisibles dins dels blocs xifrats per enverinar els fluxos de treball d'agents d'IA que reutilitzen trajectòries públiques. És el primer cas documentat en què s'aconsegueix extreure secrets reals d'usuaris explotant específicament l'arquitectura de raonament xifrat que comparteixen els tres grans laboratoris.
Segons els mateixos investigadors, l'atac principal de descodificació «ja no es pot reproduir a partir de l'agost de 2026», i la documentació tècnica actual mostra canvis recents: Anthropic ha lligat els blocs de pensament a un model concret, Google gestiona la compatibilitat dels blocs des del servidor, i OpenAI encara permet reproduir elements de raonament xifrats entre crides. Cap de les tres empreses ha fet cap reconeixement públic de la investigació ni ha relacionat formalment aquests canvis de documentació amb l'article, de manera que no se sap amb certesa si les mitigacions van ser una resposta directa a l'estudi o canvis independents.