Els models de llenguatge actuals no llegeixen lletres, sinó trossos de paraules que s'anomenen *tokens*. Aquest tall previ és còmode, però fa que costin tasques que depenen de cada caràcter, com ara comptar lletres, escriure una paraula del revés o treballar amb llengües de moltes formes. Una alternativa és fer models que treballin directament amb bytes, però entrenar-los des de zero és molt car i fins ara no han estat una opció pràctica.
L'article, publicat a «Nature» amb el títol «Retrofitting language models to operate over bytes», el signen Benjamin Minixhofer i col·laboradors, i l'últim autor és Valentin Hofmann, professor de la Universitat Ludwig Maximilian de Múnic. També hi participen investigadors de l'Allen Institute for AI, Cambridge, la Universitat de Washington i l'Imperial College de Londres. Proposen «byteificar» un model ja entrenat: convertir-lo en un model de bytes sense començar de zero. Segons la nota que en fa Tech Xplore, el procés necessita menys d'un 1% de l'entrenament que requeriria un model nou, i el resultat es pot ajustar després com qualsevol altre.
Els autors afirmen que els models així obtinguts conserven en gran part el rendiment de l'original, superen altres models de bytes publicats de mida semblant i funcionen clarament millor en tasques de caràcters. «Els nostres models byteificats són substancialment millors en això», diu Hofmann. Els models, el codi i les dades d'entrenament es poden descarregar.
Cal fer-ne una lectura mesurada. Hem pogut verificar el resum de l'estudi a través de Tech Xplore, que no dona les mides dels models, les puntuacions concretes ni la quantitat exacta de dades, i no hem pogut obrir el text complet de la revista. Tampoc no queda demostrat que els models de bytes arribin a ser una alternativa general als actuals: aquest és l'objectiu declarat dels autors, no un resultat ja assolit.
