Avaluar si un model de llenguatge és fiable llegint un historial clínic és més difícil del que sembla: els bancs de proves fixos es queden ràpidament obsolets, es filtren a les dades d'entrenament dels models següents i sovint no reflecteixen com raona de debò un metge davant d'una història clínica llarga i plena de visites successives.
Un equip encapçalat per Jordan L. Cahoon, amb la participació d'investigadors com Nigam H. Shah i Emily Alsentzer, ha presentat BRIE (Benchmark for Retrieving Information in EHRs), un marc que genera de manera automàtica i contínua parelles de pregunta-resposta a partir d'historials clínics electrònics longitudinals reals, validades per dinou metges perquè admetin diverses respostes correctes que reflecteixin com varia el raonament clínic d'un professional a l'altre. El treball, publicat com a preprint el 24 de setembre, ha posat a prova nou grans models de llenguatge amb cinc estratègies d'inferència diferents i conclou que «els sistemes més avançats sovint ometen informació clínicament important», sobretot en les preguntes que exigeixen combinar dades de diversos documents i visites d'un mateix pacient, més que en les que es responen amb una sola dada aïllada.
El disseny «viu» del sistema —que es pot renovar contínuament amb historials nous— busca resoldre un problema estructural de l'avaluació de la IA clínica: si un banc de proves es manté fix massa temps, els models següents poden acabar-se'l memoritzant indirectament, i les xifres de precisió deixen de voler dir res. Poder mesurar amb regularitat si un model «llegeix» tot l'historial d'un pacient o només en respon la part més fàcil és rellevant de cara a qualsevol ús clínic real d'aquests sistemes, on ometre una dada rellevant pot tenir conseqüències directes per al pacient.
El treball és encara un preprint, sense revisió per parells, i les proves es limiten a nou models i a un conjunt concret d'historials, de manera que caldrà veure si el patró es repeteix amb els models que vagin sortint i amb dades d'altres sistemes sanitaris. Els autors no en treuen que aquests models s'hagin de descartar per a tasques clíniques, sinó que calen bancs de proves que es renovin al mateix ritme que ho fan els mateixos models.