Els models de fundació en medicina tenen un problema pràctic: cal entrenar-los amb dades molt diverses i sovint privades, i adaptar-los a cada tasca costa. *Nature Medicine* ha publicat el 6 d'octubre la descripció revisada per parells de MedGemma, una col·lecció de models de visió i llenguatge per a l'àmbit mèdic que Google ha construït a partir de Gemma 3 i que ofereix de manera oberta.
Els autors expliquen que MedGemma entén imatges i text de diversos tipus d'imatge mèdica i supera els models generatius de mida comparable sense perdre les capacitats generals de Gemma. En tasques fora de la distribució d'entrenament, millora entre un 2,6 i un 10% en preguntes sobre imatges mèdiques, entre un 15,5 i un 18,1% en la classificació de troballes en radiografies de tòrax i un 10,8% en avaluacions amb agents, respecte dels models base. També presenten MedSigLIP, un codificador de visió ajustat per a medicina que fa de base de la part visual.
Una de les conclusions pràctiques és que ajustar MedGemma funciona millor que ajustar el Gemma 3 genèric per a tasques mèdiques, sobretot quan hi ha poques dades. Això abarateix el desenvolupament d'eines pròpies per a hospitals i grups de recerca que no poden compartir les seves dades de pacients.
Cal llegir-ho amb mesura: són millores en proves de referència i en avaluacions dissenyades pels mateixos autors, no en assajos amb pacients ni en pràctica clínica real. El resum de l'article tampoc no detalla com es comporta el model en poblacions o centres diferents d'aquells en què es va provar.
