Provar una IA amb historials clínics reals xoca sempre amb la privacitat dels pacients, i això frena que es pugui verificar què fan de veritat els models en medicina. Christine Park, Valerie Chen i Tim Dettmers proposen una sortida en un preprint publicat a arXiv el 24 de setembre: Synthetic Hospital, un banc de proves obert fet íntegrament amb dades inventades però verificables.
El conjunt inclou 1.268 pacients amb 5.602 visites al llarg del temps. Es va construir només a partir de material docent públic de medicina, sense cap dada protegida de pacients, i cada element clínic pot rastrejar-se fins a la font original i està lligat als codis mèdics habituals (ICD-10-CM, SNOMED CT i LOINC). El sistema imita també la infraestructura d'un hospital, amb les seves API d'intercanvi i els permisos per rols.
Per comprovar que els casos semblen reals, uns metges van intentar distingir-ne els historials dels de pacients de veritat i només van encertar el 53%, gairebé com llençar una moneda. Quan hi van posar a prova diversos models de llenguatge, el millor va obtenir una puntuació F1 de 0,73 reconstruint la llista de problemes d'un pacient al llarg del temps, igual que la mitjana dels metges però lluny dels millors, que arriben a 0,89. En resumir un historial, els models se'n deixen aproximadament la meitat dels fets clínicament rellevants.
Cal no confondre un banc de proves amb la pràctica clínica: uns pacients sintètics, per ben fets que estiguin, no recullen tota la complexitat d'un hospital real, i els resultats depenen dels models que s'hi han provat. És un preprint encara sense revisió per parells. Però tenir un banc obert, que qualsevol pot repetir, és justament el que ara falta per comparar la IA sanitària amb rigor.
