ARC-AGI-3 és un benchmark de raonament interactiu, pensat com a successor dels populars tests ARC-AGI, que posa els agents d'IA davant d'entorns similars a videojocs sense donar-los cap instrucció, cap regla explícita ni cap objectiu declarat: han d'explorar-los per interacció, deduir com funcionen i planificar accions per superar nivells cada cop més difícils. A diferència d'un examen de coneixements, aquí no serveix haver memoritzat res: cal entendre un món nou sobre la marxa, cosa que fa que els grans models de llenguatge sols, per potents que siguin, hi obtinguin resultats mediocres.
Nvidia va anunciar el 21 d'agost que AVO (Agentic Variation Operators), una arquitectura pròpia d'agents pensada per a tasques llargues i autònomes, havia completat el 100% del conjunt públic del benchmark: els 183 nivells de les 25 categories d'entorns, amb 6.624 accions en total. El mateix model que fa funcionar AVO per sota, Claude Opus 5, només assoleix un 30% quan actua sense aquesta arquitectura al voltant. Comparat amb VISTA, el sistema que fins ara tenia el millor resultat conegut amb el mateix model, AVO hi ha arribat amb un 12% menys d'accions. Curiosament, AVO no es va dissenyar per a aquest tipus de proves: Nvidia el va construir originalment per optimitzar nuclis de codi CUDA per a GPU, i l'ha adaptat a un repte molt diferent. Com resumeix la mateixa companyia, «el model importa, però el model no és tot l'agent».
El resultat és rellevant perquè trasllada el focus de la cursa de la IA des dels models en si cap a l'arquitectura que els envolta: memòria persistent, supervisió i ús d'eines organitzats en un sistema capaç de sostenir tasques llargues, en lloc d'una sola resposta. Que un mateix model passi d'un 30% a un 100% simplement canviant l'«embolcall» agèntic que l'envolta suggereix que bona part del marge de millora immediat en capacitats no vindrà només d'entrenar models més grans, sinó de dissenyar millor els sistemes que els fan servir.
Nvidia només ha publicat resultats sobre el conjunt públic del benchmark, no sobre els conjunts semiprivats o privats que ARC-AGI reserva precisament per evitar que els sistemes es limitin a memoritzar solucions conegudes; sense aquestes dades, un 100% al conjunt públic és un resultat notable però incomplet com a mesura de raonament general. La mateixa companyia adverteix que la comparació amb VISTA no és una prova controlada, perquè els dos sistemes difereixen en el backend de l'agent, la manera de representar les observacions i la gestió de memòria i context; les proves amb GPT-5.6 Sol, a més, han estat limitades, i Nvidia deixa per a treball futur una comparació més àmplia entre models.