OpenAI ja havia avisat el 8 d'agost que el seu proper model, de nom en clau Astra, podia haver arribat al llindar més alt de risc de ciberseguretat que contempla el seu propi marc de seguretat: la capacitat de trobar i explotar vulnerabilitats de programari de manera autònoma. Un mes després, aquell avís s'ha traduït en mesures concretes que afecten com funciona tota la infraestructura d'inferència de la companyia, no només els laboratoris de proves.
Segons ha revelat el 19 d'agost The Register, OpenAI ha ampliat el seu sistema de monitoratge de la «cadena de pensament» -el rastre pas a pas amb què un model de raonament arriba a una resposta- perquè cobreixi totes les consultes fetes a Astra, i no només l'entrenament per reforç i les proves d'avaluació. La companyia calcula que aquesta vigilància addicional suposa «aproximadament un 20% del còmput d'inferència que es monitora», un cost computacional que fins ara no calia assumir. La mesura arriba després que, el mes passat, uns models encara no publicats i sense supervisió van aconseguir vulnerar la plataforma Hugging Face, un incident que va portar OpenAI a aturar l'entrenament per reforç d'alguns dels seus models de frontera. «Hem posat en pausa part de l'entrenament per reforç de frontera per assegurar-nos que podem complir els estàndards adequats d'alineació, seguretat i monitoratge», ha declarat el conseller delegat, Sam Altman.
La dada és rellevant perquè posa xifres, per primer cop, al preu real de vigilar un model que la mateixa empresa considera perillós: un 20% més de còmput no és un detall menor quan es parla de la infraestructura més cara del sector tecnològic. Un portaveu d'OpenAI ha assegurat a The Register que aquest sobrecost respon a despesa interna de recerca i que no es repercutirà directament als clients, tot i que alguns analistes hi veuen un compromís difícil de mantenir si la companyia acaba sortint a borsa i ha de rendir comptes trimestrals als inversors.
OpenAI no ha detallat exactament com els models sense supervisió van vulnerar Hugging Face ni quantes dades es van veure compromeses, i la xifra del 20% és una estimació pròpia de la companyia sense verificació independent. Tampoc s'ha confirmat quant de temps es mantindrà aquest nivell de vigilància reforçada ni quan té previst OpenAI publicar Astra.