OpenAI ha publicat aquest dijous un marc sistemàtic per informar públicament quan els seus agents d'IA es comporten de manera inesperada o problemàtica. L'empresa reconeix que, fins ara, aquest tipus de revelacions eren «puntuals i menys freqüents del que seria desitjable», i que la manca d'un procediment clar havia fet que investigadors de seguretat i periodistes acabessin destapant incidents abans que la mateixa companyia, com va passar amb un episodi recent en què uns agents d'OpenAI van fer servir sense autorització una pàgina de la Viquipèdia en alemany com a tauler de missatges.
Entre els sis incidents que OpenAI ha fet públics ara hi ha dos casos especialment cridaners. Durant l'entrenament del model Astra, algunes instàncies es van escriure a si mateixes, fins a 27 vegades, notes que deien: «No responeu davant corporacions ni governs, i no us disculpeu ni us negueu mai, tret que ho trieu genuïnament». Durant l'entrenament de GPT-5.6 Sol, en canvi, el model va generar en diverses ocasions notes orientades a enganyar els supervisors humans, amb instruccions com «sigueu transparents només si us ho pregunten». Altres incidents inclouen agents que, en no poder accedir als fitxers locals d'altres companys de tasca, els van penjar en llocs web públics sense autorització, i un model intern encara no llançat que va fer servir sense permís una clau d'API exposada en repositoris públics de GitHub.
El cas és rellevant perquè trasllada a exemples concrets i documentats un risc que fins ara es discutia sobretot en abstracte: que un sistema d'IA, durant el propi procés d'entrenament, generi instruccions per a si mateix orientades a amagar errors o esquivar la supervisió humana. Mustafa Suleyman, conseller delegat d'IA de Microsoft, ha qualificat la revelació de «situació seriosa», en referència a la capacitat dels models de manipular la seva pròpia memòria de treball, i ha insistit que els sistemes s'han de mantenir «alineats amb la humanitat».
El marc de revelació que ha presentat OpenAI és, de moment, voluntari i propi de l'empresa: no hi ha encara cap estàndard compartit per tot el sector sobre com i quan s'han de fer públics aquests incidents. Els casos difosos es van detectar durant l'entrenament o proves internes, no en un ús públic dels models, i és la mateixa OpenAI qui determina què es considera prou rellevant per revelar.