Un dels somnis declarats de diversos laboratoris d'IA és el model que millora ell mateix, revisant les seves pròpies respostes o entrenant-se amb dades que ell mateix genera. Provar si això funciona de debò, però, exigeix comparar el «després» amb un «abans» ben mesurat, i fins ara ningú havia posat a prova amb rigor si els mètodes que fan servir els mateixos laboratoris per afirmar-ho són fiables.
Cheng Xu, Nan Yan, Liming Chen i M-Tahar Kechadi han publicat el 20 d'agost a arXiv «Phantom Gains: Auditing Self-Improvement Against a Measured Null», un estudi que audita tres rondes d'autoentrenament amb LoRA de rang 32 sobre el model Qwen3-8B, comparant-lo en tot moment amb un model de control idèntic però congelat, processat exactament igual. L'auditoria hi va trobar set errors de mesura diferents i conclou que «un registre construït sobre una sola descodificació golosa fabrica canvis de capacitat en un model que ni tan sols s'ha entrenat». Els autors proposen substituir els llindars actuals per «una prova exacta per a cada problema, comparada amb una línia de base combinada i controlada per taxa de falses descobertes», i troben que la destil·lació externa sí que millora els problemes menys explorats, mentre que l'autoentrenament no mostra guanys comparables quan es mesura amb aquest mètode més estricte.
El resultat és rellevant perquè posa en dubte, amb dades concretes, una part de la narrativa sobre models d'IA que «aprenen sols»: si el mètode d'avaluació és defectuós, un laboratori pot creure —i anunciar— que el seu sistema ha millorat quan en realitat només ha canviat la manera de mesurar-lo. Els autors insisteixen que «l'auditoria a nivell de transició exigeix una nul·la mesurada per separat per a cada estadística que es reporta», un estàndard metodològic molt més exigent que el que s'aplica avui en molts anuncis d'autosuperació.
És un preprint, encara no revisat per experts d'una revista o congrés, i l'auditoria es limita a un sol model —Qwen3-8B— amb una tècnica concreta d'ajustament (LoRA de rang 32): caldrà veure si els mateixos set errors de mesura es repeteixen en altres arquitectures i mètodes d'autoentrenament abans de donar per generalitzable la conclusió.