Cada cop més propietaris de gossos i gats consulten assistents d'IA generalistes quan el seu animal mostra algun símptoma, però fins ara els bancs de proves que avaluen com de bé responen aquests models a preguntes de medicina veterinària eren escassos i es limitaven a preguntes curtes de resposta tancada, molt lluny de la complexitat d'un cas clínic real explicat per un propietari.
Un equip format per Taegyun Kim, Youngwook Ham, Jungwook Rhim, Ju-Hyun An, Sungkyu Park i Kunwoo Park ha presentat el 4 de setembre a arXiv PetQA, un banc de proves acceptat a la conferència EMNLP 2026 que recull 10.076 parells de pregunta i resposta només de text i 8.751 de multimodals (amb imatges), construïts a partir de preguntes reals de propietaris sobre la salut dels seus gossos i gats i respostes proporcionades per veterinaris experts. Els autors hi han avaluat divuit models de llenguatge i de visió i llenguatge en tres escenaris diferents —sense entrenament previ, amb recuperació d'informació (RAG) i amb ajust fi supervisat (SFT)— fent servir mètriques com ROUGE, BERTScore i avaluació per un altre model d'IA que fa de jutge, i n'han traduït la part de test a cinc idiomes per facilitar-ne l'ús en altres llengües.
La notícia és rellevant perquè omple un buit real en l'avaluació de la IA aplicada a la medicina veterinària, una disciplina que fins ara quedava fora dels grans bancs de proves mèdics centrats en pacients humans, i perquè el disseny del banc de proves —preguntes llargues i obertes, com les que faria de debò un propietari preocupat, i no qüestionaris de resposta múltiple— permet mesurar millor si un model raona clínicament o només repeteix informació genèrica.
Es tracta d'un preprint que, tot i haver estat acceptat a EMNLP 2026, encara no ha completat el procés de revisió per parells final de la conferència, i el resum de l'article no detalla les puntuacions exactes que hi van obtenir els divuit models avaluats; els mateixos autors reconeixen la necessitat de mètodes d'adaptació més eficaços, cosa que suggereix que cap dels models provats arriba encara al nivell d'un veterinari expert.