A l'assaig «We Must Pace the Frontier», Dario Amodei havia proposat que els laboratoris d'IA obrissin les portes a avaluadors externs amb accés real als seus processos interns, no només a informes o demostracions preparades, com a manera de generar confiança sense esperar una regulació vinculant que encara no existeix. Dijous, Anthropic va anunciar el primer pas concret per posar en pràctica aquesta idea.
Accenture, a través de la seva filial especialitzada en IA, Faculty, es converteix en la primera «avaluadora incrustada» d'Anthropic: un equip que treballarà colze a colze amb els equips interns i altres socis de seguretat per fer red-teaming dels models, avaluacions d'alineament i proves de les mesures de protecció, amb un nivell d'accés «comparable al d'un empleat» per observar com es construeixen, s'entrenen i es despleguen els sistemes, mantenint alhora independència a l'hora de reportar el que hi trobin. Totes dues companyies preveuen invertir-hi almenys 1.000 milions de dòlars cadascuna al llarg de cinc anys. L'acord no és exclusiu: Anthropic manté converses paral·leles amb altres avaluadors independents, com l'organització sense ànim de lucre METR, per posar en marxa esquemes similars.
La notícia és rellevant perquè arriba la mateixa setmana en què OpenAI admet no saber com garantir la seguretat de sistemes que es milloren a si mateixos (vegeu la peça anterior): és un intent concret, encara que voluntari, de crear un mecanisme de supervisió des de dins mentre no hi ha cap marc legal obligatori que ho exigeixi, i pot marcar un model que altres laboratoris acabin adoptant.
El mateix Anthropic reconeix que la sostenibilitat a llarg termini d'aquest esquema dependrà de trobar finançament governamental o compartit, i no només diners de les pròpies empreses avaluades, cosa que de moment no existeix. És també un acord voluntari i no exclusiu, sense cap organisme regulador extern que supervisi els mateixos avaluadors ni obligui Anthropic a seguir les seves recomanacions.