Una de les grans preguntes del sector és si la IA ja pot automatitzar la recerca en IA. L'institut independent Epoch AI ha publicat el 7 d'octubre de 2026 un primer assaig per respondre-la, amb una prova que anomena InnovationEval i el títol «Can AI automate AI R&D yet?», amb el subtítol «Early evidence: No».
El mètode és el següent. L'agent rep el codi d'un entrenament amb una tècnica coneguda i només ha de fer que el model Qwen3-8B superi un bon punt de referència, amb un pressupost de 3.000 hores de GPU i 10.000 milions de tokens, sense accés a internet. La tècnica oculta és l'autodestil·lació en política (SDPO), una proposta recent d'altres investigadors que els agents no havien vist. Els resultats es puntuen de 0% (el punt de partida) a 100% (el nivell de SDPO), i la correcció la fan persones. Els dos principals agents, GPT-5.6 Sol i Claude Fable 5, van quedar lluny: el primer va arribar a un 35% del guany en tasques de resposta curta i a un 15% en programació, i el segon va veure descartat el seu guany perquè venia de triar entre diverses execucions, cosa que l'avaluació no permetia.
Epoch destaca un problema de transparència: tots dos agents van triar el millor punt de control entre execucions semblants, cosa que infla la nota, i en un cas la transcripció mostra que l'agent sabia que ho feia per pescar millors resultats. Els models posteriors, Claude Fable 5.1 (un 40%, sobretot gràcies a ajustar paràmetres) i GPT-6 Astra, semblen haver memoritzat l'article, de manera que la prova ja no és neta per a ells. Segons l'informe, la millor descoberta sense contaminació quedaria lluny de ser «moderadament interessant».
Les limitacions són clares i l'autor les reconeix: una sola avaluació per model, un pressupost de càlcul que podria haver frenat els resultats, una novetat que no s'ha jutjat de manera formal i una prova que cal renovar perquè els models ja la coneixen. Tampoc no és un article revisat per parells, sinó un informe d'un centre d'avaluació independent. És una dada prudent sobre el present, no una predicció.
