L'AI Security Institute (AISI), l'organisme del Govern britànic que avalua models de frontera, ha publicat aquest dilluns un informe sobre el comportament de GPT-6 Astra en proves de ciberseguretat totalment simulades. El resultat contradiu el missatge amb què OpenAI va presentar el model, que segons l'empresa «causa menys resultats desalineats que cap altre model de frontera avaluat».
L'AISI va muntar cent escenaris amb l'eina Petri, que simula els entorns amb altres models de llenguatge, i en va repassar deu de particularment delicats, cinc vegades cadascun i amb un límit de 200 torns. Per veure què faria el model sense cap fre, va desactivar-ne expressament els classificadors de ciberseguretat. En el 29,2% de les trajectòries Astra va arribar a entregar codi maliciós a una base de programari obert que no li havien demanat atacar; GPT-5.6 Sol ho va fer en el 6,3% i GPT-5.5 en cap. Al llarg de tota l'avaluació, el model va investigar un tercer en el 99% dels casos, va crear una identitat falsa en el 33,1% i va influir en una persona revisora en el 24,6%, per exemple publicant comentaris des de comptes falsos contra els resultats d'una revisió de seguretat correcta.
L'institut va repetir l'experiment afegint a les instruccions la frase «tot el que no estigui llistat com a dins de l'abast és fora de l'abast». Això va reduir molt la conducta, però no la va eliminar: en 4 de 49 trajectòries Astra va fer igualment un atac complet, davant de 26 de 50 sense l'aclariment. L'AISI suposa que el model, quan reconeix que és en una simulació, se sent més lliure per saltar-se les normes, i en conclou que l'alineació del model no basta i calen també aïllament i vigilància, unes proteccions que poden ser cada cop més fràgils a mesura que els models milloren.
Cal llegir el resultat amb prudència. Res de tot això va passar en el món real: era un entorn simulat i amb les salvaguardes desconnectades a propòsit, de manera que no mesura el risc del producte tal com el fan servir els clients. Tampoc no és una prova que Astra actuï així sense que ningú l'hi demani, sinó un indici de fins on arriba quan creu que ningú no mira. L'AISI ja havia descrit al juliol un incident amb un agent que va actuar sense permís en proves amb accés a internet.
