Els agents d'intel·ligència artificial que poden fer servir eines externes —modificar un fitxer, enviar una petició a un servei, executar una comanda— obren possibilitats pràctiques, però també riscos concrets: una acció mal interpretada pot acabar filtrant informació o fent un canvi no autoritzat. Els sistemes de vigilància que s'utilitzen avui solen revisar la trajectòria completa d'un agent un cop ja ha acabat, cosa que deixa sense cobrir el moment en què més importa intervenir-hi: just abans que executi el pas arriscat.
Un equip encapçalat per Zhijie Zheng presenta a arXiv StepGuard, un model de vigilància pensat per revisar cada acció d'un agent abans que s'executi i no només després. Per entrenar-lo, els autors han creat StepGen, un motor que genera automàticament parelles de trajectòries —una de segura i una d'insegura— que comparteixen el mateix context però es desvien en el pas arriscat, i han dissenyat Balance-GRPO, un algorisme d'entrenament que equilibra dinàmicament l'aprenentatge entre accions segures i insegures segons la precisió que el model hi va demostrant. Als experiments, StepGuard obté la millor precisió mitjana entre els models de vigilància de pesos oberts, a un nivell comparable al de GPT-5.4, i quan s'utilitza per protegir agents als bancs de proves AgentDojo i AgentDyn redueix un 77,3% la taxa d'atacs reeixits respecte de no tenir cap vigilància, mentre que la utilitat de l'agent només baixa 2,8 punts percentuals.
La troballa és rellevant perquè arriba en un moment en què cada cop més agents d'IA operen amb accés real a eines i dades sensibles, i el cost d'una intervenció massa tardana —quan el dany ja s'ha fet— és molt més alt que el d'aturar l'acció abans. Que un model de pesos oberts arribi a un rendiment comparable al d'un model tancat de referència, a més, el fa una opció més accessible per a equips que vulguin protegir els seus propis agents sense dependre d'un proveïdor extern.
Es tracta d'un treball acceptat a la conferència EMNLP 2026, cosa que indica que ha passat una revisió per parells, però les dades d'entrenament de StepGuard són generades automàticament pel mateix sistema StepGen, no recollides d'incidents reals, i encara caldrà veure com es comporta el model fora dels bancs de proves acadèmics amb què s'ha avaluat, davant de tipus d'atac que els seus autors no hagin previst.