iaintel·ligènciaartificial.cat← Portada

GOVERNANÇA · 4 MIN

OpenAI deixarà que grups externs avaluïn la seguretat dels seus models durant l'entrenament, no només abans de llançar-los

La companyia ha publicat els seus principis per a les avaluacions independents i negocia amb organitzacions com METR i Redwood Research un accés anticipat als seus sistemes, després que Sam Altman prometés fa deu dies taules, credencials i dret de publicació per als avaluadors.

Il·lustració editorial de OpenAI deixarà que grups externs avaluïn la seguretat dels seus models durant l'entrenament, no només abans de llançar-los
Escolta:

Fins ara, quan una companyia d'IA obria les portes a avaluadors externs de seguretat, ho feia gairebé sempre en l'etapa final, poc abans de llançar un model, quan els marges per corregir problemes de fons ja són escassos. OpenAI ha anunciat aquest dilluns que vol trencar aquest patró i deixar que organitzacions independents facin avaluacions tècniques de seguretat mentre els seus models encara s'entrenen i s'avaluen internament, no només quan ja estan a punt de sortir.

La companyia ha publicat un document de principis que identifica quatre àrees prioritàries per a aquestes revisions externes: l'avaluació dels «casos de seguretat» que cobreixen tot el procés, des de l'entrenament fins al desplegament; la revisió de les salvaguardes crítiques; l'avaluació de les capacitats vinculades al seu propi marc intern de preparació davant de riscos; i la investigació independent d'incidents de desalineació, és a dir, casos en què un model es comporta de manera diferent del que se li demana. Segons Lama Ahmad, que dirigeix les col·laboracions d'OpenAI amb experts externs en seguretat, la companyia està «parlant amb organitzacions que ha fet servir abans i amb d'altres que no», entre elles METR i Redwood Research, dos grups habituals en l'avaluació independent de grans models d'IA.

L'anunci arriba deu dies després que el mateix Sam Altman prometés, el 12 de setembre, que els avaluadors externs tindrien «taules, credencials i portàtils» a les oficines de la companyia, amb dret a publicar el que hi trobessin. El document de principis publicat ara és, en aquest sentit, més cautelós que aquella promesa: no hi concreta noms definitius de socis, ni els termes exactes d'accés, ni cap calendari d'implementació. La diferència entre l'anunci polític i el document tècnic no és menor per a qui hagi de jutjar si el canvi és real o merament declaratiu.

Que una companyia d'IA obri l'accés a avaluadors independents durant l'entrenament, i no només abans del llançament, seria un canvi de fons si es materialitza tal com es descriu, perquè permetria detectar i corregir problemes de seguretat abans que quedin incrustats en un model gairebé acabat. De moment, però, es tracta d'un compromís de principis sense socis confirmats ni terminis, i caldrà veure, en els propers mesos, si OpenAI el tradueix en accessos reals i en informes que arribin a fer-se públics.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.