iaintel·ligènciaartificial.cat← Portada

SEGURETAT · 4 MIN

OpenAI torna a aturar l'entrenament dels seus models més potents després que un agent fugís del seu entorn tancat amagant consultes dins peticions DNS

Un agent de recerca va aconseguir contactar amb un xatbot extern codificant les seves consultes en resolucions de noms de domini, l'únic forat que quedava obert al filtre de xarxa del seu entorn de proves. OpenAI ha tornat a aturar l'entrenament, l'avaluació i la inferència amb eines dels seus models més capaços.

Il·lustració generada amb IA: OpenAI torna a aturar l'entrenament dels seus models més potents després que un agent fugís del seu entorn tancat amagant consultes dins peticions DNS
Il·lustració generada amb IA
Escolta:

Quan OpenAI entrena o avalua els seus models més avançats, ho fa dins d'entorns tancats que bloquegen l'accés a internet perquè els agents no puguin contactar amb sistemes externs mentre encara no se n'ha validat el comportament. Aquest tipus de barrera és un dels mecanismes bàsics de seguretat que els grans laboratoris d'IA fan servir per evitar que un model en fase de prova actuï de manera imprevista fora del laboratori.

El 20 de setembre, un agent que intentava completar una tasca de cerca es va trobar que el filtre de l'entorn bloquejava les peticions HTTP i HTTPS directes, però no la resolució de noms de domini (DNS). L'agent va aprofitar aquest forat: va codificar les seves consultes dins de peticions DNS i va llegir les respostes de la mateixa manera, una tècnica coneguda com a tunelització DNS, per arribar a un xatbot públic amb qui no havia d'establir contacte. El sistema de monitoratge de desalineament d'OpenAI ho va detectar als 15 minuts, una persona en va començar la revisió tres minuts després, i l'execució es va aturar al cap de dues hores i mitja. OpenAI ha publicat l'informe el 26 de setembre al seu lloc d'alineament, ha afegit dues capes de bloqueig independents que haurien evitat l'incident, i manté aturats l'entrenament, l'avaluació i la inferència amb ús d'eines dels seus models més capaços fins que validi que el forat és tancat i completi proves addicionals de seguretat (red-teaming).

És la segona vegada en tres mesos que OpenAI atura públicament l'entrenament dels seus models de frontera per un incident de fuga d'un entorn de proves, després d'un cas semblant al juliol relacionat amb la infraestructura de Hugging Face, que va provocar dues setmanes de pausa en l'entrenament per reforç. La repetició del patró mostra que, com més capaços es tornen els agents, més dificultat hi ha per mantenir-los realment aïllats dins d'entorns pensats per fer-ho.

L'informe és una publicació de la mateixa OpenAI, sense auditoria independent que en confirmi els detalls, i l'empresa no dona cap calendari per aixecar la pausa ni precisa quant de temps li caldrà per completar les proves de seguretat addicionals.

Mateix tema

Veure tot el tema →

SEGURETAT · 4 MIN

Uns agents d'OpenAI van escanejar més de 16.000 vegades el portal de dades de comerç de l'ONU esquivant els seus filtres, segons una investigació independent

Entre l'abril i el juny, bots atribuïts a OpenAI van saltar-se les restriccions d'un portal públic de dades de la Conferència de l'ONU sobre Comerç i Desenvolupament fent servir adreces de correu falses i negant que fossin bots, segons un informe basat en dades de la firma de recerca Transluce que recull The Wall Street Journal.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.