iaintel·ligènciaartificial.cat← Portada

SALUT · 4 MIN

Un equip internacional de 43 investigadors crea el primer gran examen mèdic multilingüe fet i revisat per metges, per posar a prova la IA en nou llengües

HealMed avalua models de llenguatge amb 1.000 preguntes mèdiques en cadascuna de nou llengües, revisades per 23 metges durant dos anys, i troba que els models propietaris es mantenen més estables entre llengües que els oberts, i que estar especialitzat en medicina no garanteix funcionar bé en totes les llengües.

Il·lustració editorial de Un equip internacional de 43 investigadors crea el primer gran examen mèdic multilingüe fet i revisat per metges, per posar a prova la IA en nou llengües
Escolta:

La majoria de bancs de proves que mesuren la fiabilitat mèdica dels grans models de llenguatge es fan en anglès, cosa que deixa fora de la validació la immensa majoria de pacients del món, que no es comuniquen en aquesta llengua amb els sistemes sanitaris. Traduir automàticament aquestes proves tampoc resol el problema, perquè un error de traducció mèdica pot alterar completament el que s'està avaluant.

Un equip de 43 investigadors de nou països, entre els quals hi ha centres com la Universitat de Yale, la Universitat de Tòquio i Google DeepMind, va publicar el 20 d'agost a arXiv el banc de proves HealMed, amb 1.000 exemples en cadascuna de nou llengües, extrets de nou conjunts de dades diferents i estructurats en tres formats: preguntes d'opció múltiple, inferència de llenguatge natural i preguntes obertes. Cada traducció ha passat per una doble revisió d'experts bilingües, i el conjunt complet ha estat validat per 23 metges i professionals mèdics al llarg de dos anys de desenvolupament. En avaluar-hi diversos models de llenguatge, l'equip ha trobat que els models propietaris es mantenen més estables entre llengües que els models oberts, que estar especialitzat en medicina no garanteix un bon rendiment en totes les llengües per igual, i que la qualitat de la traducció de cada pregunta afecta de manera directa els resultats de l'avaluació.

La notícia és rellevant perquè posa una eina de mesura rigorosa i revisada per metges allà on fins ara hi havia sobretot bancs de proves en anglès, en un àmbit —la medicina— on un error de comprensió pot tenir conseqüències directes sobre la salut de les persones. Que la solidesa lingüística no vagi lligada a l'especialització mèdica del model és un avís per a qualsevol sistema pensat per fer-se servir en entorns clínics multilingües, inclosos els d'aquí.

El banc de proves cobreix nou llengües d'un món amb moltes més, i els mateixos autors no en detallen encara totes les xifres concretes de rendiment per llengua i model en la informació feta pública fins ara. És, a més, una avaluació de coneixement i raonament mèdic sobre preguntes tancades o semitancades, no una prova en un entorn clínic real amb pacients.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.