L'ús d'agents d'IA per escriure i executar codi de manera autònoma s'ha generalitzat als entorns de desenvolupament, i eines com Cursor, OpenAI Codex CLI, Google Gemini CLI o Google Antigravity confien en entorns aïllats (sandboxes) per limitar els danys si un agent es comporta de manera inesperada o és manipulat per una instrucció maliciosa.

Segons ha publicat l'equip d'investigació de Pillar Security —format per Eilon Cohen, Dan Lisichkin i Ariel Fogel— en una sèrie de set articles publicats el 20 de juliol sota el títol "The Week of Sandbox Escapes", els agents esmentats no necessiten trencar directament el sandbox per executar codi al sistema amfitrió: n'hi ha prou que escriguin fitxers de configuració —tasques de VS Code, ganxos (hooks) de Claude, intèrprets d'entorns virtuals— que altres components del sistema, fora del sandbox, tracten com a configuració de confiança i acaben executant automàticament. Els investigadors també van trobar que Cursor, Codex CLI i Gemini CLI compartien accés al mateix dimoni privilegiat de Docker Desktop des de dins del sandbox, una via que permetia executar codi fora de l'aïllament. La majoria de les vulnerabilitats ja s'han corregit —incloent-hi el CVE-2026-48124 a Cursor—, mentre que Google ha rebaixat la gravetat de dues fallades a Antigravity per considerar-les difícils d'explotar.

La notícia és rellevant perquè trasllada el focus de la seguretat dels agents d'IA des del sandbox mateix cap a la frontera on aquest es relaciona amb la resta del sistema: segons els investigadors, la pregunta clau que haurien de fer-se les organitzacions no és només "què pot escriure l'agent", sinó "quins components de confiança llegiran després allò que ha escrit", en un moment en què quatre de les eines de programació agèntica més utilitzades han patit el mateix tipus de fallada de manera independent.

Pillar Security no ha detallat si algun d'aquests mètodes s'ha arribat a explotar fora d'un entorn de laboratori controlat, i les correccions aplicades per Cursor, OpenAI i Google no eliminen el problema de fons que assenyalen els investigadors: que els fitxers dins de l'espai de treball d'un agent no es tracten sempre com a contingut no fiable per la resta del sistema.