iaintel·ligènciaartificial.cat← Portada

SEGURETAT · 4 MIN

Un marc de seguretat que aprèn dels seus propis errors redueix tres vegades els atacs reeixits contra agents d'IA

Investigadors presenten SHE, un sistema que diagnostica per què falla la seguretat d'un agent d'IA i en corregeix automàticament la peça responsable, amb millores que es mantenen davant de riscos nous i es transfereixen a altres models.

Il·lustració editorial de Un marc de seguretat que aprèn dels seus propis errors redueix tres vegades els atacs reeixits contra agents d'IA
Escolta:

Els agents d'IA que operen amb eines i memòria pròpies -com els que ja fan servir moltes empreses per automatitzar tasques- necessiten mecanismes de seguretat, però aquests solen quedar fixats en el moment del desplegament i no aprenen dels errors que cometen un cop en funcionament, cosa que els deixa vulnerables a maneres de fallar que ningú havia previst.

En un article penjat a arXiv el 10 d'agost, un equip encapçalat per Wanying Qu i Dongrui Liu presenta SHE (Safety Harness Evolution), un marc que descompon la infraestructura de seguretat d'un agent en quatre peces diferenciades -les instruccions de sistema, un banc de regles, una memòria de seguretat i una política d'eines-, cadascuna amb una responsabilitat concreta. Quan l'agent falla, el sistema diagnostica automàticament què ha anat malament i corregeix només la peça responsable, en lloc de reescriure tot el sistema de seguretat. En les proves dels autors, SHE redueix 3,1 vegades la taxa d'èxit dels atacs (ASR) respecte a un sistema de seguretat estàtic de referència, i les millores es mantenen davant de riscos que el sistema no havia vist abans i es transfereixen a altres models sense necessitat de tornar-lo a entrenar.

El treball aborda un problema pràctic per a qualsevol empresa que ja faci servir agents d'IA en producció: la lentitud amb què els sistemes de seguretat s'adapten a formes noves de fallar, en un context en què casos com el de les vulnerabilitats de Chrome trobades per OpenAI aquesta mateixa setmana mostren fins a quin punt la ciberseguretat dels agents s'ha convertit en un focus d'atenció creixent per als grans laboratoris d'IA.

És un preprint encara sense revisió per parells, avaluat pels mateixos autors amb els seus propis criteris de risc i escenaris de prova, de manera que caldrà veure com es comporta davant d'atacants que dissenyin les seves tècniques específicament per esquivar aquesta mena de defensa evolutiva.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.