iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 5 MIN

Anthropic mesura per primer cop quant de la seva pròpia investigació en IA ja fa la mateixa IA: un 26%

Un nou índex intern situa en un 26% la proporció de feina d'investigació i desenvolupament que Claude ja «lidera» de manera pràcticament autònoma, per sota de l'1% que hi havia el febrer passat, amb prop de 30.000 agents treballant-hi alhora.

Il·lustració editorial de Anthropic mesura per primer cop quant de la seva pròpia investigació en IA ja fa la mateixa IA: un 26%
Escolta:

Un dels debats més difícils de resoldre sobre la carrera de la intel·ligència artificial és com de ràpid avança realment la capacitat dels sistemes per millorar-se a si mateixos, una qüestió que fins ara es discutia sobretot amb exemples anecdòtics. Anthropic ha decidit publicar-hi una mesura pròpia i sistemàtica: un «Índex d'Automatització d'R+D» que classifica, tasca per tasca, quant hi participa el seu model Claude.

L'índex fa servir una escala de sis nivells (d'AL0 a AL5) segons el grau d'autonomia del model en cada tasca: a partir del nivell AL4, es considera que la IA «lidera» la feina —pot completar-la de cap a cap a partir d'una instrucció d'alt nivell, amb un humà supervisant, en lloc de limitar-se a col·laborar-hi. Segons les dades d'agost de 2026 que presenta l'informe, Claude ja «lidera» el 26% de la feina d'investigació i desenvolupament d'IA que es fa a la mateixa Anthropic, per sota de l'1% que hi havia el febrer del mateix any. La companyia xifra en uns 30.000 els agents que feien tasques de recerca i enginyeria de manera simultània a la seva plataforma d'agents interna més utilitzada durant aquell mes d'agost, i detalla que el seu sistema de supervisió en línia només va bloquejar un 0,002% de les decisions revisades —aproximadament una de cada 47.000—, mentre que la revisió fora de línia marca com a sospitosos entre un i dos de cada mil registres de conversa.

La notícia és rellevant perquè Anthropic proposa, a més d'aquesta primera xifra, un marc de tres indicadors per fer-ne seguiment regular en el futur: com d'automatitzada està la construcció de les properes versions dels models, com de supervisats estan els agents interns —amb quina cobertura, latència de revisió i taxa d'escalada a una persona— i quina part del còmput dedicat a R+D es destina específicament a seguretat, que la companyia xifra en un 6%. És el primer intent d'un laboratori de frontera de fer públiques, amb metodologia pròpia, xifres concretes sobre fins a quin punt els seus sistemes ja construeixen les seves pròpies successores.

Es tracta, amb tot, d'una mètrica dissenyada i publicada per la mateixa empresa que en surt avaluada, sense verificació independent de tercers per ara, encara que Anthropic diu que preveu publicar-la amb periodicitat regular. La companyia mateixa reconeix que «liderar» una tasca no equival a autonomia plena en cap categoria de la seva R+D, i no detalla quins criteris exactes fa servir el «jutge» basat en Claude per assignar cada tasca a un nivell d'automatització o un altre.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.