iaintel·ligènciaartificial.cat← Portada

SALUT · 5 MIN

Un agent d'IA clínic que s'executa a l'hospital encerta el 90% dels diagnòstics i deixa als metges els casos dubtosos

Un estudi de Nature Medicine, dirigit per Jakob Nikolas Kather, mostra que un model obert local s'acosta al GPT-5.2 al núvol i que la coherència entre repeticions és un bon senyal de fiabilitat.

Il·lustració generada amb IA: Un agent d'IA clínic que s'executa a l'hospital encerta el 90% dels diagnòstics i deixa als metges els casos dubtosos
Il·lustració generada amb IA
Escolta:

Els models d'IA més capaços per a la clínica solen funcionar al núvol d'una empresa, cosa que obliga els hospitals a enviar-hi dades de pacients. Un estudi publicat a Nature Medicine, amb Jakob Nikolas Kather com a autor sènior, prova l'alternativa contrària: un agent clínic que s'executa del tot als servidors de la mateixa institució, sense que les dades en surtin.

L'equip va avaluar diversos models oberts (Qwen-3.5, GLM-5, GLM-4.5-Air i GPT-OSS) en tres conjunts de casos: MIRA-v2, amb 551 casos de set malalties; CDM, amb 2.400 casos de quatre malalties abdominals, i VivaBench, amb 990 casos, com a validació externa. El millor model obert va arribar al 90,04% d'encert en la prova de set malalties i al 83,8% en la de quatre. Segons el resum de l'estudi que en fa AI Weekly, quedava a 0,7 punts del GPT-5.2 al núvol, que va assolir el 90,7%.

La novetat més útil és com decideix quan actuar sol. Els autors van comparar dues maneres de mesurar la fiabilitat i van veure que la coherència del diagnòstic entre execucions repetides discrimina millor els encerts que la probabilitat que el model assigna a la resposta (àrea sota la corba, AUC, de 0,860). Amb un llindar de coherència de 0,90, l'agent resolia sol el 49,4% dels casos amb un 98,9% d'encert, i derivava la resta a un clínic.

Els resultats venen de bancs de proves, no d'una prova amb pacients reals en un hospital, i els mateixos autors assenyalen que l'encert era menor en les persones grans que en les joves, un biaix que caldria auditar abans d'usar-lo a la pràctica. Aquest article es va publicar a mitjans de setembre; els detalls numèrics provenen de la fitxa de la revista i del resum d'AI Weekly, perquè el text complet de l'article és de pagament.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.