Saber si un nou algorisme d'intel·ligència artificial per interpretar historials clínics electrònics és realment millor que els anteriors és més difícil del que sembla: els estudis solen fer servir conjunts de dades, tasques i mètriques diferents, cosa que fa gairebé impossible comparar els resultats d'un article amb els d'un altre i distingir el progrés real del soroll metodològic.
Els investigadors Florent Pollet i Matthew McDermott han reimplementat dotze algorismes, entre històrics i recents, dins d'un mateix marc d'avaluació i els han posat a prova sobre dos conjunts de dades clínics reals, MIMIC-IV i NWICU, combinant tasques dissenyades per experts clínics amb tasques generades a l'atzar a partir de codis d'esdeveniments i horitzons de predicció diferents. Segons el preprint, penjat a arXiv el 16 de setembre i revisat per última vegada el 22, les comparacions relatives entre algorismes es mantenen consistents tant si es canvia de conjunt de dades com si es passa de tasques generades a l'atzar a tasques clínicament rellevants; alhora, els algorismes més nous no superen sistemàticament els més antics, i els arbres de decisió potenciats per gradient, combinats amb una representació moderna, àmplia i dispersa de l'historial clínic, es mantenen «altament competitius».
La troballa és rellevant perquè qüestiona una assumpció força estesa en el camp —que els mètodes més recents i sofisticats, com les xarxes neuronals profundes, superen per definició els mètodes més senzills— i suggereix que el que cal per fer avançar la IA clínica no és necessàriament dissenyar tasques d'avaluació cada cop més enginyoses, sinó entendre millor l'heterogeneïtat estructural que hi ha entre tasques i mètodes.
És un preprint encara sense revisió per parells, i l'estudi es limita a dos conjunts de dades clínics i dotze algorismes concrets, de manera que caldrà veure si el patró es repeteix amb altres historials i amb els models que vagin sortint. Els autors tampoc conclouen que els mètodes més nous siguin inútils, sinó que calen més proves per saber en quines condicions concretes aporten un avantatge real sobre els mètodes clàssics.