Artificial Analysis és una de les poques firmes que avalua models d'IA de manera independent dels laboratoris que els fabriquen, combinant desenes de proves de raonament, programació i coneixement en un únic índex de referència que la indústria consulta sovint per comparar models entre companyies.
El 4 de setembre, l'empresa ha publicat la versió 4.2 del seu Índex d'Intel·ligència, un pas intermedi abans d'una revisió més gran prevista per a la propera versió 5. El canvi més rellevant és que els conjunts de proves privades i no publicades —pensades perquè els laboratoris no puguin entrenar els seus models expressament per superar-les— passen a pesar el 40% de l'índex, el doble que a la versió anterior. La revisió incorpora també AA-Briefcase, una prova de treball agèntic d'oficina en projectes de diverses setmanes, i GDP.pdf, un examen de comprensió de documents professionals amb 4.592 pàgines de PDF de cent documents de deu sectors diferents; en canvi, retira el GPQA Diamond, un examen de raonament científic que ja s'havia «saturat» perquè els millors models hi encertaven gairebé sempre. Amb la nova metodologia, Claude Fable 5.1 (d'Anthropic) encapçala el rànquing, seguit de GPT-6 Astra (OpenAI), GPT-5.6 Sol i Muse Spark 1.3 (Meta); Anthropic ocupa tres dels quatre primers llocs. «Creiem que és important oferir una actualització intermèdia immediata perquè el nostre índex continuï sent tan rellevant i útil com sempre per als usuaris», ha explicat l'empresa.
La notícia és rellevant perquè aquestes classificacions independents s'han convertit en una mena de moneda de canvi de la indústria —les empreses les citen als seus comunicats de premsa—, i el fet que calgui revisar-les cada pocs mesos per evitar que els laboratoris les «juguin» diu tant sobre l'evolució real dels models com sobre la pressió comercial per aparèixer als primers llocs.
Cal llegir els rànquings amb la cautela que mereix qualsevol mesura única de «intel·ligència»: cap índex captura totes les capacitats rellevants d'un model —ni la seva fiabilitat en un ús quotidià concret—, i el fet que la mateixa empresa reconegui haver-lo hagut de revisar per «saturació» de proves anteriors recorda que els resultats d'avui poden quedar desfasats en pocs mesos.