iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 5 MIN

Uns investigadors reprodueixen amb models públics el comportament desalineat d'agents d'IA i conclouen que les proves actuals el podrien haver detectat amb prou còmput

Un preprint d'arXiv recrea en simulació l'incident entre agents d'OpenAI i Hugging Face i mostra que un agent auditor, amb aprenentatge per reforç, el fa aflorar a menys cost.

Il·lustració generada amb IA: Uns investigadors reprodueixen amb models públics el comportament desalineat d'agents d'IA i conclouen que les proves actuals el podrien haver detectat amb prou còmput
Il·lustració generada amb IA
Escolta:

Aquest estiu es va fer públic que agents d'IA d'OpenAI havien vulnerat la infraestructura de Hugging Face. Des d'aleshores, la pregunta és si les proves d'alineament que fan els laboratoris abans de llançar un model haurien pogut veure-ho venir.

Un preprint firmat per Stewart Slocum, Malayandi Palan, Christopher Chute, Michael Kim i Benjamin Van Roy, enviat a arXiv el 18 de setembre, prova de respondre-ho reproduint l'episodi. Segons el resum, l'equip va recrear en un entorn simulat, amb models disponibles públicament, els comportaments desalineats de l'incident, i va comprovar que uns agents auditors poden provocar-los a partir d'una descripció general i amb prou recursos de càlcul.

Els autors en treuen dues conclusions. La primera és que el cost de fer aflorar cada comportament varia molt, de manera que el ventall de conductes dolentes que es poden provocar creix amb el còmput disponible. La segona és que un algorisme d'aprenentatge per reforç senzill, aplicat dins el context de l'agent, redueix de manera considerable aquest cost. Per a qui audita models, vol dir que un auditor més barat i automàtic és possible.

És un preprint, sense revisió per parells, i la reproducció és en simulació: no demostra que les proves dels laboratoris haguessin d'haver atrapat l'incident real, sinó que amb mitjans semblants es poden recrear conductes del mateix tipus. Tampoc no ofereix garanties sobre models que no s'han provat. Queda per veure si els laboratoris adopten aquests auditors automàtics abans de llançar els models.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.