Els bancs de proves que avaluen agents d'IA de programació solen mesurar si el codi final passa uns tests, però no si l'agent ha fet realment la feina que se li demanava. Un equip de recerca ha publicat a arXiv el SWE Refactor Bench per corregir precisament aquest punt cec: 20 tasques de migració de repositoris sencers —canviar de llenguatge, actualitzar una eina de compilació, substituir una llibreria obsoleta— on cal demostrar que la migració s'ha fet de debò, no només que el resultat final funciona.
El mètode dels autors combina tres proves successives: una auditoria que verifica que la migració ha tingut lloc, una bateria de tests de comportament amb un joc fix de proves per confirmar que tot segueix funcionant correctament, i una verificació feta per sis agents de programació independents que generen tests addicionals per posar a prova la solució des de fora. Aquest tercer pas neix d'un problema real que els autors anomenen «ceguesa»: un agent pot passar els tests originals simplement copiant la implementació que ja hi havia, sense haver fet cap migració autèntica.
Els resultats, amb 520 execucions sobre vuit dels models més avançats del mercat, són contundents: només el 5,4% de les execucions (28 de 520) va superar les tres fases, i 13 de les 20 tasques no van rebre ni una sola solució acceptada per cap model. El millor classificat, Claude Opus 5 d'Anthropic, es va quedar en 47 punts sobre 100. El rendiment també varia molt segons el tipus de migració: els agents obtenen 31,4 punts en reescriptures d'eines de compilació però només 5,6 en canvis de llenguatge de programació, la feina que exigeix entendre millor la lògica de fons del codi.
La conclusió pràctica per a qualsevol empresa que confiï feines de manteniment de codi a un agent d'IA és clara: els bons resultats en bancs de proves més senzills no garanteixen que un agent sàpiga completar una migració real de cap a cap, sobretot com més profund sigui el canvi que cal fer. Els autors presenten el seu banc de proves com un «terreny de proves rigorós» per seguir desenvolupant agents capaços de fer migracions de repositoris senceres de manera fiable, i no només aparentment correctes.