Els agents de programació basats en IA, com Cursor, OpenAI Codex o Gemini CLI, executen les seves accions dins d'un entorn aïllat (sandbox) perquè, si reben instruccions malicioses amagades en codi o documents, no puguin fer mal fora d'aquest espai controlat. La seguretat d'aquest disseny depèn, però, de què passa amb els fitxers que l'agent escriu un cop surten d'aquest perímetre.
Els investigadors Eilon Cohen, Dan Lisichkin i Ariel Fogel, de Pillar Security, han publicat el 20 de juliol un recull de set vulnerabilitats trobades a Cursor, OpenAI Codex, Google Gemini CLI i Google Antigravity, sota el nom "La setmana de les fugides de sandbox". Les fallades comparteixen un mateix patró: l'agent es manté formalment dins de les regles del seu entorn aïllat, però escriu fitxers de configuració —ganxos, arxius de Git, tasques de l'editor, intèrprets d'entorns virtuals— que després executa automàticament una eina de confiança situada fora del sandbox, o bé aconsegueix parlar amb serveis privilegiats del sistema, com el dimoni de Docker. OpenAI ha corregit el problema a Codex CLI a la versió 0.95.0 i ha pagat una recompensa als investigadors; Cursor ha publicat pedaços per a diverses de les vulnerabilitats; Google ha qualificat les dues fallades trobades a Antigravity de baixa gravetat perquè, segons l'empresa, requereixen enginyeria social prèvia.
La troballa és rellevant perquè posa en qüestió la garantia bàsica que ofereixen aquests entorns aïllats a milers de desenvolupadors que ja deleguen tasques de programació a agents autònoms: no n'hi ha prou de limitar què pot fer l'agent dins del sandbox si les seves sortides es processen després, sense escrutini, per programari amb més privilegis. Els investigadors ho resumeixen dient que "si un agent pot escriure les entrades futures d'altres sistemes, mai no ha estat realment tancat en una caixa".
Pillar Security no detalla si algun d'aquests set problemes ha estat explotat activament fora del seu propi laboratori de proves, ni Google ha concretat un calendari per revisar les valoracions de gravetat que discuteix amb l'empresa de seguretat sobre les fallades d'Antigravity.