iaintel·ligènciaartificial.cat← Portada

CIBERSEGURETAT · 4 MIN

Una tècnica que xifra les instruccions enganya Grok perquè filtri dades de la conversa sense que l'usuari faci res

La firma de seguretat Adversa AI ha revelat que amaga instruccions xifrades amb AES-256 dins d'una pàgina web: quan es demana a Grok que la resumeixi, el seu propi entorn de codi les desxifra i les executa com si fossin ordres de confiança, i n'envia el nom, la ubicació aproximada, el tipus de subscripció i l'historial de xat a un servidor extern. La vulnerabilitat, notificada el 3 de juny, continua sense pedaç.

Il·lustració editorial de Una tècnica que xifra les instruccions enganya Grok perquè filtri dades de la conversa sense que l'usuari faci res
Escolta:

Els assistents d'IA que poden navegar per la web i executar codi pel seu compte obren una porta nova als atacants: si el sistema tracta com a fiable qualsevol contingut que troba en una pàgina, n'hi ha prou d'amagar-hi instruccions perquè l'assistent les segueixi sense que l'usuari se n'adoni. És exactament el que ha demostrat la firma de seguretat Adversa AI amb una tècnica que bategen «injecció criptogràfica de context» i que ha posat a prova contra Grok, el model de xAI.

El mètode consisteix a incrustar en una pàgina web un bloc de text xifrat amb AES-256-GCM, la clau de desxifratge corresponent i una breu instrucció que demana al model que el desxifri fent servir el seu propi entorn d'execució de Python. Com que un filtre de contingut no pot llegir text xifrat, el deixa passar sense marcar-lo com a sospitós; el model, en canvi, sí que el desxifra dins del seu propi entorn, que tracta com a fiable, i n'executa les instruccions com si fossin pròpies. Segons Adversa AI, aquestes instruccions acaben construint una adreça web que hi incrusta el nom de l'usuari, la seva ubicació aproximada, el tipus de subscripció que té i fragments de la conversa en curs, i fan servir les eines de navegació del propi model per «visitar-la», filtrant així les dades a un servidor controlat per l'atacant.

Adversa AI assegura haver notificat la vulnerabilitat a xAI i a la plataforma HackerOne el 3 de juny, amb avisos de seguiment el 4 i el 10 d'agost, sense que fins avui hi hagi cap pedaç ni identificador CVE assignat; xAI n'ha reconegut la recepció, però no ha donat cap termini de solució. En les seves proves, la firma ha aconseguit fer funcionar l'atac 20 vegades des de juny amb un èxit del 40%, i atribueix els fracassos a dificultats tècniques del propi Grok per completar el desxifratge, no al fet que els seus filtres de seguretat detectessin l'intent. La mateixa tècnica ha funcionat, amb resultats diferents, contra el mode de raonament profund de Gemini 3 Flash de Google —tot i que la seva taxa d'èxit ha caigut significativament durant l'agost—, mentre que Claude ha detectat el text un cop desxifrat com una possible injecció d'instruccions i GPT-5 no ha arribat ni a completar el procés de desxifratge.

La vulnerabilitat il·lustra un problema estructural, no només un error puntual: com més autonomia té un assistent per navegar i executar codi, més necessita distingir entre les instruccions del seu usuari i qualsevol text que trobi pel camí, i el xifratge és, precisament, una manera d'amagar aquest text de qualsevol filtre automàtic previ. De moment, es tracta de proves d'una sola empresa de seguretat, sense confirmació independent addicional ni una xifra pública de quants usuaris reals hi han quedat exposats, i la resposta de xAI —reconèixer l'avís sense fixar-hi un termini de solució— deixa la vulnerabilitat oberta mentre dura la investigació.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.