Des del juliol, Anthropic, OpenAI i Google negocien en secret un organisme conjunt d'estàndards de seguretat per a la intel·ligència artificial, tal com es va saber a mitjan setembre. Aquesta setmana el debat ha avançat de les converses genèriques a compromisos concrets sobre com i amb quin accés hi participaran els avaluadors externs.
Dario Amodei, conseller delegat d'Anthropic, ha proposat donar als avaluadors independents el dret a publicar les seves troballes clau sobre nivells de risc, incidents i pràctiques de l'empresa —i sobre l'accés que se'ls concedeixi o se'ls negui— sense control editorial d'Anthropic. Sam Altman, d'OpenAI, ha confirmat que la seva empresa assumirà un compromís equivalent. Els investigadors proposen que els avaluadors, entre els quals es nomenen explícitament METR i Redwood Research, tinguin accés no només als models finals sinó també a punts de control intermedis de l'entrenament, als entorns posteriors a l'entrenament, a les transcripcions d'avaluació i a entrevistes amb empleats. Meta, SpaceX AI i Google DeepMind no s'hi han compromès encara.
La proposta respon a límits reals que aquests avaluadors ja han patit: METR i Redwood Research van disposar de només una setmana per investigar l'incident de seguretat de Hugging Face, i Apollo Research va tenir tres dies per examinar GPT-6 Astra, un termini que la pròpia organització va dir que li havia impedit treure conclusions fermes. En paral·lel, Califòrnia ha signat aquest mes la llei SB 813, que crea un marc legal perquè l'estat reconegui organitzacions de verificació independent de la IA.
És, de moment, un compromís declarat en públic per part de dos dels laboratoris més grans, sense cap mecanisme legal que l'obligui a complir-se ni calendari concret de desplegament, i amb tres actors rellevants del sector —Meta, SpaceX AI i Google DeepMind— que encara no s'hi han afegit. Caldrà veure si, a la pràctica, els terminis d'accés dels avaluadors milloren respecte als casos de Hugging Face i GPT-6 Astra que han fet servir com a justificació.