Un dels usos més recents dels grans models de llenguatge és deixar que l'agent es modifiqui a si mateix: proposa canvis al document d'habilitats que orienta el seu comportament, els prova i es queda amb els que semblen millorar-lo. El problema és quan s'accepta un canvi. La regla habitual és acceptar-lo si la puntuació mitjana puja, i això admet que una edició faci fallar coses que abans es resolien bé, mentre la mitjana global mira cap a un altre costat.
El preprint, que signen nou autors encapçalats per Yihao Wang, descriu dues fallades d'aquesta regla. La primera són les regressions permanents: ítems que l'agent resolia i que després deixa de resoldre. La segona és l'anomenada «maledicció de l'optimitzador»: quan es tria el millor de molts candidats sobre un conjunt de proves finit i sorollós, la puntuació d'aquest candidat queda inflada per l'atzar. La proposta, anomenada SAGE, compara les dues versions sobre els mateixos ítems, un per un, i aplica una prova estadística unilateral: només accepta el canvi quan les victòries superen de manera fiable les derrotes.
Els autors l'han provada en cinc bancs de proves i quatre models de llenguatge de base, és a dir, 20 configuracions. Segons el text, SAGE redueix la taxa de regressions en 19 de les 20 i obté la puntuació final més alta en totes. L'exemple destacat és LiveMath, on les regressions passen del 36,5% al 0% i la puntuació final puja de 34,15 a 48,78. El mètode és una versió conservadora de la regla estàndard i en recupera el comportament exacte en un ajust límit.
Cal llegir-ho amb cautela: és un preprint de deu pàgines, encara sense revisió per iguals, i els resultats surten de bancs de proves, no de tasques de feina reals. Tot i això, l'aportació és útil perquè apunta a una idea senzilla i verificable: si un agent s'ha de millorar sol, cal una regla que exigeixi proves abans d'acceptar cada canvi, en lloc de fiar-se d'una mitjana que amaga els fracassos.
