Entrenar un gran model de llenguatge amb aprenentatge per reforç exigeix fer servir dos sistemes de programari diferents: un que genera les respostes del model (el motor d'inferència) i un altre que n'ajusta els pesos a partir del resultat (el motor d'entrenament). Petites diferències numèriques entre tots dos —el que als laboratoris es coneix com a «training-inference mismatch» (TIM)— són conegudes des de fa temps per fer inestable el procés, però fins ara no hi havia una explicació clara de per què passava.
Martin Marek i Max Ryabinin, investigadors de Together AI, publiquen a arXiv un estudi que identifica la causa concreta: un «drift», un biaix persistent entre els dos motors que s'acumula a cada pas d'entrenament fins a desestabilitzar tot el procés. Com a solució, proposen un terme de correcció additiu que anomenen «score centering», pensat per cancel·lar aquest biaix directament. En proves amb models d'entre 600 milions i 30.000 milions de paràmetres, la correcció, aplicada tota sola, iguala o supera els mètodes existents basats en mostreig per importància quan el model funciona amb quantització, i l'avantatge creix com més gran és la discrepància entre motors. A més, es pot combinar amb les tècniques existents per obtenir-ne encara més estabilitat en escenaris on les dades d'entrenament es queden desactualitzades.
La rellevància del treball és pràctica més que espectacular: la inestabilitat del TIM és un dels motius pels quals entrenar models grans amb aprenentatge per reforç continua sent car i poc fiable, i una correcció additiva senzilla que es pot sumar a les tècniques que ja s'utilitzen pot estalviar recursos de còmput a qualsevol laboratori que entreni models de mida mitjana o gran amb aquest mètode.
Es tracta encara d'un preprint pendent de revisió per parells. Els autors el validen amb models de fins a 30.000 milions de paràmetres, una mida notable però per sota dels models de frontera que fan servir els grans laboratoris, de manera que encara no es pot donar per fet que els resultats s'escalin igual als sistemes més grans.