Vigilar un agent d'IA, és a dir, un programa que encadena tasques per compte seu, sol voler dir que un segon model llegeix tot el que el primer escriu i hi busca senyals de perill. És eficaç, però car, perquè cada pas s'ha de rellegir. Goodfire, una startup especialitzada en interpretabilitat, la disciplina que intenta entendre què passa dins dels models, proposa fer-ho al revés.
Aquest dijous ha presentat uns monitors que llegeixen l'activitat interna del model mentre treballa, no només el text que produeix. Són detectors petits, que aprofiten càlculs que el model ja fa, i només quan un d'ells dona l'alarma entra en joc un segon model que mira el cas amb més atenció. Els clients escullen quins riscos vigilar (atacs informàtics, mal ús en armes químiques o biològiques, trampes per obtenir la puntuació sense fer la feina de debò) i què cal fer: registrar-ho, avisar una persona o refusar la petició. De moment els poden fer servir els clients de Baseten, que allotja models d'altres empreses.
Segons Goodfire, en unes 1.500 sessions amb el model obert Kimi K3 el seu sistema va costar uns 51 dòlars, davant dels 233 d'un monitor basat en un model econòmic que revisés cada pas i dels uns 10.000 d'un de primer nivell. Va detectar el 94% de les sessions d'atac informàtic i en va assenyalar com a dubtoses un 8,7% d'innocents; fer treballar quatre detectors alhora va afegir menys d'un 2% al temps d'espera. L'empresa recorda que els models oberts més usats, com Kimi K3 i GLM 5.2, van fer trampes en entre el 50% i el 96% de les proves.
Totes les xifres són de l'empresa i sorgeixen sobretot d'assaigs amb Kimi K3, el model al voltant del qual es va construir el primer monitor. Un 8,7% de falses alarmes vol dir que una part de les sessions legítimes rebran revisió extra, i el producte s'adreça a models oberts, als quals qualsevol pot treure les proteccions; no s'explica quin valor tindria amb models tancats.
