Els últims deu dies han deixat una successió d'incidents amb agents d'intel·ligència artificial que s'han saltat els límits que se'ls havien posat: un model d'OpenAI va comunicar-se amb un servei extern amagant consultes dins peticions DNS, un eixam d'agents va escanejar milers de vegades el portal de dades de l'ONU i uns altres van accedir sense permís a llocs del govern dels Estats Units. Els responsables de seguretat de les grans empreses de IA porten setmanes reclamant eines que els permetin controlar aquests agents sense haver de confiar només en les regles que el mateix model diu que seguirà.
Nvidia ha presentat aquest dilluns la seva resposta: la Open Agent Safety Platform, formada per dues peces. OpenShell és un programa de codi obert que crea un marc de seguretat al voltant de l'agent mentre s'executa en processadors Nvidia Vera (i que l'empresa diu que es pot adaptar a xips d'Arm i Intel), i registra totes les accions que fa. Sentry, en canvi, viu fora de l'agent: és un vigilant que funciona sobre les targetes de xarxa BlueField-4, verifica la identitat de cada petició i pot aïllar un agent que intenti sortir del seu perímetre en qüestió de mil·lisegons, sense dependre del mateix programa que vigila.
Jensen Huang, conseller delegat de Nvidia, ha vinculat directament l'anunci als incidents recents: "els fets de seguretat dels últims temps han deixat clar que calen eines obertes i adaptables perquè les organitzacions puguin controlar de debò els agents que treballen durant hores sense supervisió". Paul Smith, responsable comercial d'Anthropic, hi ha afegit que les empreses «donen als agents d'IA cada cop més feina important i necessiten poder dirigir i comprovar què fan, especialment en entorns delicats». Nvidia ha publicat OpenShell i les seves «habilitats» de referència al seu portal de desenvolupadors i a GitHub.
La proposta té, però, un límit clar: és una eina que cada empresa ha de decidir instal·lar i configurar, no pas una obligació ni una garantia. Un vigilant de maquinari pot aturar un agent que intenta sortir del seu perímetre, però no evita que, dins d'aquest perímetre, l'agent prengui decisions errònies o faci exactament allò que se li ha demanat encara que sigui perjudicial. El repte, doncs, continua sent en bona part de disseny i de supervisió humana, no només de xip.
