La majoria dels bancs de proves que mesuren si un model d'intel·ligència artificial és fiable en l'àmbit mèdic es fan en anglès, cosa que amaga un problema real: un sistema que respon bé en anglès pot equivocar-se molt més quan la mateixa pregunta arriba en una altra llengua, precisament allà on menys recursos hi ha per detectar-ho.
Un equip de 41 investigadors, entre els quals hi ha metges i experts en llenguatge de nou països i regions, ha publicat el 20 d'agost a arXiv «HealMed», un banc de proves revisat per experts que avalua models de llenguatge en medicina amb 1.000 exemples per a cadascuna de nou llengües, procedents de nou conjunts de dades diferents i tres formats de pregunta (opció múltiple, inferència i resposta oberta). El projecte, desenvolupat durant dos anys per 23 metges i especialistes mèdics, va sotmetre cada traducció a la revisió de dos experts fluents en anglès i en la llengua de destinació.
El resultat més clar és que el rendiment dels models cau de manera desigual: baixa més en les llengües amb menys recursos digitals, però la mida d'aquesta davallada varia molt segons el model i la llengua concreta. Els models propietaris més potents es van mantenir més estables entre llengües, mentre que muntants models oberts i models especialitzats en medicina van mostrar diferències més grans i menys previsibles; tenir especialització mèdica, per si sola, no va garantir robustesa multilingüe. Un detall metodològic rellevant: la revisió experta de les traduccions va poder tant millorar com empitjorar el rendiment mesurat, cosa que demostra que la qualitat de la traducció condiciona de manera directa els resultats de qualsevol avaluació d'aquest tipus.
HealMed és, de moment, un preprint —encara no ha passat la revisió per parells d'una revista— però la seva metodologia, amb autoria clínica real i revisió creuada de traduccions, li dona un pes que no tenen els bancs de proves fets només amb traducció automàtica. La implicació pràctica és directa: un sistema d'IA mèdica validat en anglès no es pot donar per bo en altres llengües sense tornar-lo a provar, un advertiment rellevant també per al català i el castellà.