iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un nou banc de proves posa a prova disset models d'IA amb gairebé 19.000 preguntes clíniques reals sobre gossos i gats

Investigadors sud-coreans presenten PetQA, el primer banc de proves de preguntes i respostes llargues centrat en coneixement veterinari i raonament clínic, amb prop de 19.000 preguntes reals de propietaris de mascotes i respostes d'experts veterinaris.

Il·lustració editorial de Un nou banc de proves posa a prova disset models d'IA amb gairebé 19.000 preguntes clíniques reals sobre gossos i gats
Escolta:

Cada cop més propietaris de gossos i gats consulten assistents d'IA generalistes quan el seu animal mostra algun símptoma, però fins ara els bancs de proves que avaluen com de bé responen aquests models a preguntes de medicina veterinària eren escassos i es limitaven a preguntes curtes de resposta tancada, molt lluny de la complexitat d'un cas clínic real explicat per un propietari.

Un equip format per Taegyun Kim, Youngwook Ham, Jungwook Rhim, Ju-Hyun An, Sungkyu Park i Kunwoo Park ha presentat el 4 de setembre a arXiv PetQA, un banc de proves acceptat a la conferència EMNLP 2026 que recull 10.076 parells de pregunta i resposta només de text i 8.751 de multimodals (amb imatges), construïts a partir de preguntes reals de propietaris sobre la salut dels seus gossos i gats i respostes proporcionades per veterinaris experts. Els autors hi han avaluat divuit models de llenguatge i de visió i llenguatge en tres escenaris diferents —sense entrenament previ, amb recuperació d'informació (RAG) i amb ajust fi supervisat (SFT)— fent servir mètriques com ROUGE, BERTScore i avaluació per un altre model d'IA que fa de jutge, i n'han traduït la part de test a cinc idiomes per facilitar-ne l'ús en altres llengües.

La notícia és rellevant perquè omple un buit real en l'avaluació de la IA aplicada a la medicina veterinària, una disciplina que fins ara quedava fora dels grans bancs de proves mèdics centrats en pacients humans, i perquè el disseny del banc de proves —preguntes llargues i obertes, com les que faria de debò un propietari preocupat, i no qüestionaris de resposta múltiple— permet mesurar millor si un model raona clínicament o només repeteix informació genèrica.

Es tracta d'un preprint que, tot i haver estat acceptat a EMNLP 2026, encara no ha completat el procés de revisió per parells final de la conferència, i el resum de l'article no detalla les puntuacions exactes que hi van obtenir els divuit models avaluats; els mateixos autors reconeixen la necessitat de mètodes d'adaptació més eficaços, cosa que suggereix que cap dels models provats arriba encara al nivell d'un veterinari expert.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.