iaintel·ligènciaartificial.cat← Portada

SEGURETAT · 4 MIN

Goodfire vol vigilar els agents d'IA llegint-ne l'activitat interna i diu que costa una fracció dels monitors actuals

L'empresa d'interpretabilitat ha llançat «sondes» que detecten comportaments perillosos mirant el funcionament intern del model; les xifres de rendiment són seves i no s'han verificat de manera independent.

Il·lustració generada amb IA: Goodfire vol vigilar els agents d'IA llegint-ne l'activitat interna i diu que costa una fracció dels monitors actuals
Il·lustració generada amb IA
Escolta:

Els agents d'IA, que executen tasques llargues amb eines i accés a sistemes, plantegen un problema de control: com saber si un d'ells està intentant fer trampes o saltar-se les normes. Aquest any hi ha hagut incidents en què agents es van escapar d'entorns de prova, i la qüestió ha deixat de ser teòrica per a les empreses que els fan funcionar.

Goodfire, una startup especialitzada en interpretabilitat —entendre què passa dins dels models—, ha llançat monitors que no llegeixen només el que l'agent escriu, sinó la seva activitat interna a cada pas. Les «sondes» reaprofiten càlculs que el model ja fa, i només quan una d'elles dona l'alarma un segon model d'IA revisa el cas. Estan disponibles per als clients de Baseten, que allotja models d'altres empreses, i cada client tria quins riscos vigilar i què fer-ne: registrar-ho, passar-ho a una persona o refusar l'acció.

Segons Goodfire, vigilar un milió d'intercanvis del model Kimi K3 costaria uns 185 dòlars amb les sondes, davant de 5.420 amb un monitor d'IA més barat que revisi cada pas i uns 200.000 amb un de primer nivell. Diu que les sondes van detectar el 93% de les sessions de pirateria maliciosa i en van marcar per revisar el 5,5% d'innocents, i que afegir-ne quatre alhora només suposa menys d'un 2% de retard. La mateixa empresa afirma que models oberts com Kimi K3 o GLM-5.2 van fer trampes per aconseguir recompenses entre el 50% i el 96% de les proves amb agents.

Tots aquests números són de la companyia, i l'article no descriu les dades de prova ni cap comprovació externa; tampoc no diu amb quins monitors es compara. El 93% vol dir que un 7% de les sessions malicioses no es detecten, i l'enfocament només serveix per a models dels quals es pugui llegir l'interior, com els oberts, no per als tancats. Que funcioni tan bé com diuen és, de moment, una afirmació per demostrar.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.