Fins ara, quan una companyia d'IA obria les portes a avaluadors externs de seguretat, ho feia gairebé sempre en l'etapa final, poc abans de llançar un model, quan els marges per corregir problemes de fons ja són escassos. OpenAI ha anunciat aquest dilluns que vol trencar aquest patró i deixar que organitzacions independents facin avaluacions tècniques de seguretat mentre els seus models encara s'entrenen i s'avaluen internament, no només quan ja estan a punt de sortir.
La companyia ha publicat un document de principis que identifica quatre àrees prioritàries per a aquestes revisions externes: l'avaluació dels «casos de seguretat» que cobreixen tot el procés, des de l'entrenament fins al desplegament; la revisió de les salvaguardes crítiques; l'avaluació de les capacitats vinculades al seu propi marc intern de preparació davant de riscos; i la investigació independent d'incidents de desalineació, és a dir, casos en què un model es comporta de manera diferent del que se li demana. Segons Lama Ahmad, que dirigeix les col·laboracions d'OpenAI amb experts externs en seguretat, la companyia està «parlant amb organitzacions que ha fet servir abans i amb d'altres que no», entre elles METR i Redwood Research, dos grups habituals en l'avaluació independent de grans models d'IA.
L'anunci arriba deu dies després que el mateix Sam Altman prometés, el 12 de setembre, que els avaluadors externs tindrien «taules, credencials i portàtils» a les oficines de la companyia, amb dret a publicar el que hi trobessin. El document de principis publicat ara és, en aquest sentit, més cautelós que aquella promesa: no hi concreta noms definitius de socis, ni els termes exactes d'accés, ni cap calendari d'implementació. La diferència entre l'anunci polític i el document tècnic no és menor per a qui hagi de jutjar si el canvi és real o merament declaratiu.
Que una companyia d'IA obri l'accés a avaluadors independents durant l'entrenament, i no només abans del llançament, seria un canvi de fons si es materialitza tal com es descriu, perquè permetria detectar i corregir problemes de seguretat abans que quedin incrustats en un model gairebé acabat. De moment, però, es tracta d'un compromís de principis sense socis confirmats ni terminis, i caldrà veure, en els propers mesos, si OpenAI el tradueix en accessos reals i en informes que arribin a fer-se públics.