Els grans models de llenguatge s'assagen cada cop més com a suport a la decisió clínica —des del triatge d'urgències fins a la planificació oncològica—, però la pregunta de quin mètode els fa realment fiables en un entorn real, i no només en un examen mèdic, seguia sense resposta sistemàtica.
Un equip liderat per Anshum Patel i Joseph Cheung, amb col·legues del Departament d'Intel·ligència Artificial i Informàtica de la Clínica Mayo a Jacksonville (Florida), ha publicat a la revista Journal of Medical Internet Research una revisió sistemàtica de 35 estudis recents que comparen tres estratègies d'adaptació: el reentrenament amb dades mèdiques específiques, la connexió del model a bases de dades clíniques actualitzades (generació augmentada per recuperació, o RAG) i la combinació d'ambdues. Els resultats mostren que el reentrenament funciona millor per a tasques estretes com la detecció d'un tipus concret de càncer, la connexió a bases de dades és superior quan cal un raonament més complex, i els sistemes híbrids donen el millor resultat en fluxos de treball intricats, com el triatge d'un ictus.
La conclusió pràctica és que no hi ha una solució única: cal triar el mètode d'adaptació segons l'ús concret que se li vulgui donar al model, i alguns sistemes ben adaptats arriben a igualar el rendiment diagnòstic de metges humans en tasques delimitades. És una peça útil per a hospitals i desenvolupadors que decideixen com invertir els seus recursos d'adaptació abans de desplegar un assistent clínic.
Els mateixos autors adverteixen, però, d'una limitació important: la immensa majoria dels 35 estudis revisats es basen en historials mèdics passats i no en proves amb pacients reals en temps real, de manera que calen encara validacions prospectives en condicions clíniques autèntiques abans de generalitzar-ne l'adopció.