iaintel·ligènciaartificial.cat← Portada

GOVERNANÇA · 5 MIN

Una avaluació independent troba que cap gran laboratori d'IA aplica de debò els seus propis controls de seguretat interns

Guidelight AI Standards, una organització fundada per antics especialistes d'OpenAI, puntua Anthropic i OpenAI amb un C+, Google amb un D+, xAI amb un D- i Meta amb un suspens, en la primera avaluació pública de sis pràctiques bàsiques de control intern.

Il·lustració editorial de Una avaluació independent troba que cap gran laboratori d'IA aplica de debò els seus propis controls de seguretat interns
Escolta:

Els laboratoris que desenvolupen els models d'IA més avançats solen assegurar que vigilen de prop el comportament dels seus propis sistemes abans de desplegar-los i mentre funcionen, però fins ara gairebé ningú havia intentat verificar-ho amb un mètode sistemàtic i comparable entre companyies, en lloc de confiar només en el que cada empresa decideix explicar de si mateixa.

El 18 d'agost, Guidelight AI Standards —una organització sense ànim de lucre fundada el 2026 per Steven Adler i Page Hedley, tots dos antics especialistes de seguretat d'OpenAI, que assegura no acceptar finançament de cap empresa d'IA ni dels seus empleats— va publicar la seva primera avaluació de control intern de cinc grans laboratoris: Anthropic, OpenAI, Google, xAI i Meta. A partir només d'informació pública —targetes de sistema, marcs de seguretat, informes de risc i descripcions de col·laboracions amb tercers—, l'organització puntua de 0 a 5 sis pràctiques concretes: el registre de l'activitat interna dels models, la mesura de l'eficàcia d'aquesta vigilància, el bloqueig d'accions d'alt risc fins que un humà les aprova, la interrupció d'emergència d'un sistema que es comporta de manera anòmala, la revisió per part de tercers i els plans de contenció per a un model desalineat. Anthropic i OpenAI obtenen la nota més alta, un C+ (2,50 sobre 5 cadascuna); Google, un D+ (1,50); xAI, un D- (0,83), i Meta suspèn amb un 0,67. Cap de les cinc supera un 3 sobre 5 —«implementació parcial substancial»— en cap pràctica individual.

El resultat és rellevant perquè trasllada l'escrutini extern, habitualment centrat en els riscos que la IA pot causar cap enfora —biaix, desinformació, mal ús—, cap a la pregunta de si els mateixos laboratoris vigilen de debò els seus sistemes per dins. Segons Guidelight, «les pràctiques bàsiques de control estan, com a molt, parcialment implementades» arreu: Anthropic i OpenAI registren activitat interna i mesuren l'eficàcia de la seva vigilància, tot i que cap de les dues ho aplica de manera completa; Google té «el document més concret sobre control que cap empresa hagi publicat de cara al futur», però la majoria continua sense implementar-se; Meta i xAI mostren «les pràctiques més febles i menys plans concrets» —xAI, de fet, va declinar participar en l'informe de risc de frontera de l'organització METR, que sí que compten Anthropic, OpenAI, Google i Meta.

L'avaluació es basa exclusivament en informació que les mateixes empreses han fet pública, no en auditories independents amb accés intern als seus sistemes, de manera que una companyia amb una pitjor pràctica real però una comunicació externa més detallada podria obtenir una nota millor que una altra més opaca però potencialment més rigorosa per dins. Guidelight només ha avaluat cinc laboratoris, cosa que deixa fora actors rellevants com les empreses xineses, i conclou que «unes pràctiques de control més fortes són assolibles avui» amb canvis concrets a cada companyia, sense fixar cap calendari ni mecanisme que n'obligui l'aplicació.

Mateix tema

Veure tot el tema →

GOVERNANÇA · 4 MIN

La Casa Blanca posa en marxa Gold Eagle, un mecanisme per compartir i pedaçar vulnerabilitats de programari descobertes amb IA

El nou dispositiu, impulsat pel Departament de Seguretat Nacional, el Tresor i el Departament de Guerra, connecta mantenidors de codi obert amb operadors d'infraestructures crítiques per accelerar la detecció i la reparació de forats de seguretat trobats per models d'intel·ligència artificial, en compliment d'una ordre executiva signada pel president Trump el juny.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.