iaintel·ligènciaartificial.cat← Portada

SALUT · 5 MIN

Un equip internacional de 23 metges construeix el primer gran examen multilingüe per detectar quan la IA mèdica falla en llengües minoritzades

HealMed, un nou banc de proves publicat a arXiv i desenvolupat durant dos anys per especialistes de nou països, revela que el rendiment dels models de llenguatge en medicina cau de manera desigual segons l'idioma, i que la traducció experta pot canviar els resultats de l'avaluació.

Il·lustració editorial de Un equip internacional de 23 metges construeix el primer gran examen multilingüe per detectar quan la IA mèdica falla en llengües minoritzades
Escolta:

La majoria dels bancs de proves que mesuren si un model d'intel·ligència artificial és fiable en l'àmbit mèdic es fan en anglès, cosa que amaga un problema real: un sistema que respon bé en anglès pot equivocar-se molt més quan la mateixa pregunta arriba en una altra llengua, precisament allà on menys recursos hi ha per detectar-ho.

Un equip de 41 investigadors, entre els quals hi ha metges i experts en llenguatge de nou països i regions, ha publicat el 20 d'agost a arXiv «HealMed», un banc de proves revisat per experts que avalua models de llenguatge en medicina amb 1.000 exemples per a cadascuna de nou llengües, procedents de nou conjunts de dades diferents i tres formats de pregunta (opció múltiple, inferència i resposta oberta). El projecte, desenvolupat durant dos anys per 23 metges i especialistes mèdics, va sotmetre cada traducció a la revisió de dos experts fluents en anglès i en la llengua de destinació.

El resultat més clar és que el rendiment dels models cau de manera desigual: baixa més en les llengües amb menys recursos digitals, però la mida d'aquesta davallada varia molt segons el model i la llengua concreta. Els models propietaris més potents es van mantenir més estables entre llengües, mentre que muntants models oberts i models especialitzats en medicina van mostrar diferències més grans i menys previsibles; tenir especialització mèdica, per si sola, no va garantir robustesa multilingüe. Un detall metodològic rellevant: la revisió experta de les traduccions va poder tant millorar com empitjorar el rendiment mesurat, cosa que demostra que la qualitat de la traducció condiciona de manera directa els resultats de qualsevol avaluació d'aquest tipus.

HealMed és, de moment, un preprint —encara no ha passat la revisió per parells d'una revista— però la seva metodologia, amb autoria clínica real i revisió creuada de traduccions, li dona un pes que no tenen els bancs de proves fets només amb traducció automàtica. La implicació pràctica és directa: un sistema d'IA mèdica validat en anglès no es pot donar per bo en altres llengües sense tornar-lo a provar, un advertiment rellevant també per al català i el castellà.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.