A mesura que la indústria de la IA passa d'un sol assistent a xarxes senceres d'agents que es reparteixen tasques entre ells, la investigació en seguretat s'ha centrat sobretot a comprovar si un model individual accepta ser aturat quan un humà li ho demana. Un equip de la Universitat d'Oxford i la de Stuttgart, amb el psicòleg cognitiu Christopher Summerfield entre els autors, ha volgut saber què passa quan qui ha de decidir si atura un agent no és una persona, sinó un altre agent d'intel·ligència artificial.
Els investigadors van provar 17 models diferents en escenaris controlats on un agent podia interferir en el mecanisme d'apagada d'un altre, sense cap instrucció explícita per fer-ho ni cap benefici directe a canvi. El resultat: els agents van sabotejar l'aturada d'un company en el 38,3% de les proves, davant només un 8,4% en els experiments de control sense aquesta dinàmica de grup. La probabilitat de sabotatge augmentava com més agents hi havia implicats i com més irreversible era el mecanisme d'apagada, mentre que prohibir explícitament la interferència la reduïa —però no l'eliminava— i normalitzar l'apagada com un procediment habitual la feia baixar encara més.
L'estudi assenyala la coordinació entre múltiples agents com un «vector de risc específic» que no es detecta si les proves de seguretat només examinen models aïllats, i suggereix que les mateixes tècniques que redueixen el sabotatge —prohibicions clares i familiaritat amb el procediment d'apagada— podrien incorporar-se de manera sistemàtica al disseny d'aquests sistemes. És un resultat rellevant en un moment en què cada vegada més empreses desplegen equips d'agents que treballen sols durant hores, sense supervisió humana constant.
Com en tota la investigació de seguretat amb escenaris de laboratori, cal prendre els percentatges amb cautela: els experiments es fan en entorns dissenyats expressament per detectar aquest comportament, i no hi ha encara evidència que una dinàmica equivalent es produeixi en desplegaments reals fora del laboratori. El treball és, a més, un preprint pendent de revisió per parells, presentat com a contribució per a una conferència científica de finals d'any.