Hacktron AI és una start-up de seguretat que participa en el programa de recompenses per errors (bug bounty) d'OpenAI, el mecanisme pel qual l'empresa paga investigadors externs que troben i reporten vulnerabilitats abans que ho faci ningú amb males intencions. Un equip de tres persones de la companyia va decidir posar a prova fins on podia arribar un model d'IA generalista —no una eina de seguretat especialitzada— si l'usaven per trobar i explotar forats de seguretat reals.
El 25 de juliol, els investigadors van localitzar una vulnerabilitat al programari de fòrums Discourse, que allotja la comunitat en línia d'OpenAI, i la companyia responsable la va corregir dos dies després. Combinant aquell forat amb una segona debilitat dins de la infraestructura pròpia d'OpenAI, van aconseguir accedir al compte de ChatGPT d'un empleat de l'empresa i, des d'allà, van poder llegir i proposar canvis al repositori intern de programari. Segons expliquen, Claude Opus 4.8 no va ser capaç de construir un exploit funcional, però quan Anthropic va publicar Opus 5, el nou model ho va aconseguir en qüestió d'hores. OpenAI va pagar-los 6.500 dòlars de recompensa i ha confirmat que ha corregit totes dues vulnerabilitats.
El cas és rellevant perquè no és un laboratori demostrant les seves pròpies capacitats en un entorn controlat, sinó un exemple real, dins d'un programa oficial de seguretat, de com un model d'IA generalista pot abaixar la barrera tècnica necessària per trobar i encadenar vulnerabilitats en sistemes de producció d'una de les empreses més vigilades del sector. També il·lustra un fet incòmode per a tota la indústria: el salt de capacitat entre una versió de model i la següent (d'Opus 4.8 a Opus 5) va ser la diferència entre un exploit que no funcionava i un que sí.
Cal llegir el cas amb els límits que li són propis: es tracta d'una prova autoritzada i responsable, feta dins d'un programa de recompenses i comunicada a l'empresa abans de fer-se pública, no d'un atac maliciós real. Les vulnerabilitats ja estan corregides, i ni OpenAI ni Anthropic han detallat xifres sobre amb quina facilitat es podria repetir l'exercici amb objectius diferents.