iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un marc de vigilància en temps real millora un 24% l'èxit dels agents d'IA que fan servir habilitats de Claude Code i Codex

Investigadors de la Universitat Fudan presenten SkillSentry, un sistema que corregeix l'execució de les habilitats dels agents d'IA mentre treballen i redueix la inconsistència que fa que un mateix agent resolgui bé una tasca un dia i falli l'endemà davant d'una petició gairebé idèntica.

Il·lustració editorial de Un marc de vigilància en temps real millora un 24% l'èxit dels agents d'IA que fan servir habilitats de Claude Code i Codex
Escolta:

Els agents d'IA com Claude Code o Codex ja poden completar tasques complexes de programació, però un dels seus problemes menys visibles és la inestabilitat: sovint fallen una tasca que abans havien resolt correctament, per petites desviacions de procediment o errors en un pas concret, cosa que en limita la fiabilitat quan es fan servir en producció.

En un article penjat a arXiv el 10 d'agost, You Lu, Xinyu Huang, Bihuan Chen i Xin Peng, de la Universitat Fudan, presenten SkillSentry, un marc que defineix un llenguatge específic de domini per representar guiatge en temps real de l'execució d'habilitats. El sistema combina les especificacions documentades de cada habilitat amb patrons extrets de traces d'execucions anteriors, tant reeixides com fallides, i vigila i corregeix l'execució mentre l'agent treballa. En una avaluació sobre 15 habilitats amb agents Claude Code i Codex i diverses versions de model, els autors informen que SkillSentry millora la taxa d'èxit de les tasques un 24,1% de mitjana i redueix la variabilitat entre execucions repetides.

Aborda un problema pràctic que afecta qualsevol equip que ja fa servir agents d'IA en el dia a dia -la manca de consistència d'una execució a l'altra-, en un moment en què empreses com la mateixa Anthropic promouen l'ús autònom d'aquests agents en tasques de programació.

És un preprint encara sense revisió per parells, avaluat en un conjunt limitat de 15 habilitats i només dos agents concrets, i caldrà comprovar si la millora es manté amb altres tasques, altres agents i models diferents dels utilitzats en l'estudi.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.