iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Els millors models d'IA només encerten entre un 3% i un 15% de les idees d'un article científic si només els dones la seva bibliografia

Un equip internacional presenta a arXiv «Reconstruction», un banc de proves que amaga l'article original i demana a set models de capdavantera que en reconstrueixin la hipòtesi central a partir només de les referències prèvies; combinar-los en un torneig hi puja el resultat fins al 42%.

Il·lustració editorial de Els millors models d'IA només encerten entre un 3% i un 15% de les idees d'un article científic si només els dones la seva bibliografia
Escolta:

Un dels arguments habituals a favor de fer servir IA per accelerar la recerca científica és que un model podria generar hipòtesis noves llegint només la literatura prèvia d'un camp, sense haver vist encara el resultat concret. Fins ara, però, ningú havia dissenyat una prova rigorosa que evités que el model «fes trampa» reconeixent l'article que se li demanava reconstruir a partir de fragments filtrats a les seves dades d'entrenament.

Shaolong Chen, Yanlin Fei i set coautors més han publicat el 17 d'agost a arXiv «Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies», un banc de proves que amaga l'article original i tota la literatura contemporània o posterior, i demana als models que proposin una hipòtesi que un altre model jutge, de manera independent, compara amb la idea real de l'article, mantinguda en secret. Per evitar filtracions, el protocol imposa un tall temporal de citacions, identificadors anònims de referència i bibliografies congelades per a cada article. Amb 643 articles avaluats en sis disciplines científiques, els set models de capdavantera assolits individualment només van encertar entre un 3% i un 15% de les idees originals; quan els investigadors van combinar els quatre millors models en una revisió creuada seguida d'un torneig de tipus suís sobre hipòtesis alineades, sense cap cerca externa a internet, la taxa d'encert va pujar fins a entre el 23% i el 42% segons la disciplina, una millora d'unes 2,4 vegades respecte del millor model individual.

El resultat és rellevant perquè posa una xifra concreta a una pregunta que fins ara es debatia sobretot amb anècdotes: la capacitat real dels models de llenguatge de generar idees científiques noves, no de reconèixer-les o de recombinar-les superficialment, és encara molt limitada quan es mesura amb un protocol que impedeix la filtració d'informació. La millora notable que aporta combinar diversos models en un torneig també suggereix que la manera d'organitzar el treball de diversos agents pot pesar tant com la potència de cada model per separat.

Els mateixos autors presenten el treball explícitament com un informe de protocol i de resultats preliminars —«aquest esborrany documenta el protocol, el disseny anticontaminació i els resultats actuals com una marca temporal d'arXiv»—, no com un article revisat per experts, i les xifres podran variar a mesura que s'ampliï el nombre d'articles i disciplines avaluades.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.