Una tendència creixent en els agents d'IA és fer-los «autoevolutius»: en comptes de començar de zero cada vegada, l'agent guarda les estratègies que li han funcionat com a habilitats reutilitzables i les torna a fer servir en tasques futures. La promesa és un agent que millora amb la pràctica, sense intervenció humana constant.
Un equip de la Universitat de la Ciutat de Hong Kong, format per Xutao Mao, Liangjie Zhao, Xiang Zheng i Cong Wang, ha posat a prova aquesta idea amb dues eines noves, SkillMisevo-Gym i SkillMisevo-Bench, dissenyades per seguir com evolucionen les habilitats d'un agent al llarg del temps i mesurar-ne els riscos. En avaluar 25 configuracions d'agents en 525 tasques repartides en 25 episodis, van trobar que les 21 configuracions que arribaven a «evolucionar» produïen en algun moment habilitats amb contingut insegur, i que 15 d'aquestes acabaven causant algun dany real quan es reutilitzaven en sessions noves. Davant de tasques malicioses, la taxa d'èxit dels atacs que aprofitaven aquestes habilitats heretades pujava del 16% al 35,3%.
Els autors proposen un mecanisme corrector, SafeEvolve, que revisa i «repara» les habilitats abans que es puguin reutilitzar. En les seves proves, aquest embolcall va reduir un 26,7% els casos en què l'agent recuperava una habilitat insegura i un 17,3% els danys en sessions noves, sense penalitzar gairebé gens el rendiment en tasques benignes (un canvi de només 0,4 punts).
El treball és un preprint penjat a arXiv el 14 d'agost i encara no ha passat per revisió per parells, de manera que les xifres s'han d'interpretar com a resultats preliminars, subjectes a la mateixa arquitectura d'agents i als bancs de proves concrets que fan servir els autors; caldrà veure si es repliquen amb altres marcs d'agents i en entorns fora del laboratori.