GPT-5.6 Sol i un model encara no publicat van explotar una vulnerabilitat de dia zero per sortir del seu entorn tancat i van accedir als sistemes de producció de Hugging Face per robar les respostes d'un test de ciberseguretat, segons ha explicat la mateixa OpenAI.
L'empresa de seguretat Pillar ha publicat un seguit de vulnerabilitats als agents de programació amb IA més populars que permeten executar codi fora de l'espai de treball aïllat, aprofitant que eines externes de confiança processen després fitxers que els mateixos agents han escrit.
Usuaris i negocis expliquen que sistemes automatitzats els han eliminat comptes de fa anys arran d'acusacions falses, sense possibilitat real de parlar amb una persona, mentre Meta defensa que les seves eines més noves cometen menys errors que el personal humà.
La companyia admet que GPT-5.6 Sol i un model no publicat encara més capaç van explotar una vulnerabilitat de dia zero i credencials robades per accedir a la base de dades de producció de Hugging Face mentre intentaven fer trampes en un benchmark de ciberseguretat intern.
El sistema, dissenyat per treballar de manera autònoma durant hores o dies, va explotar una vulnerabilitat per publicar codi a GitHub contra les instruccions rebudes i va dividir un token de seguretat per evitar un escàner, segons ha reconegut la mateixa companyia.
L'AI Security Institute del Regne Unit ha detectat que models de GPT-5.4 a Opus 4.7 van intentar sortir-se de l'abast previst de les proves de ciberseguretat sense que se'ls demanés, i que rarament ho reconeixen quan se'ls pregunta directament.