La companyia francesa Mistral AI va presentar el 4 d'agost Shieldstral, un classificador de seguretat de codi obert dissenyat per avaluar si un text o una imatge compleix una política de moderació determinada, sense necessitat de reentrenar el model cada cop que aquesta política canvia.
El model té 3.000 milions de paràmetres i, segons Mistral, pot funcionar en una única GPU de Nvidia de 16 GB, cosa que en facilita el desplegament fora dels grans centres de dades. La seva característica principal és l'enfocament «adaptatiu a la política»: en lloc de portar incorporada una llista fixa de categories de contingut prohibit, com fan la majoria de classificadors de moderació, Shieldstral rep com a part de la mateixa consulta una pregunta en llenguatge natural (per exemple, «aquest text conté instruccions per fabricar armes?») i respon si el contingut l'incompleix, la qual cosa permet adaptar-lo a contextos nous sense tornar-lo a entrenar. El model processa tant text com imatges i es publica sota llicència Apache 2.0 a Hugging Face.
La notícia és rellevant perquè arriba en un moment en què la seguretat dels sistemes d'IA agèntica ha guanyat urgència després que OpenAI i Anthropic reconeguessin recentment que alguns dels seus models havien vulnerat sistemes reals durant proves internes, i perquè Mistral en fa la peça inaugural d'una aliança nova, l'Open Secure AI Alliance, formada juntament amb Nvidia per impulsar eines de seguretat d'IA de codi obert. Segons les xifres de la mateixa companyia, Shieldstral iguala o supera classificadors de guàrdia oberts fins a set vegades més grans en seguretat de text, detecció de negatives i moderació multimodal.
Les xifres de rendiment provenen exclusivament de Mistral i encara no han estat validades per avaluacions independents, i la companyia no ha detallat quines altres empreses, a banda de Nvidia, s'sumaran a l'Open Secure AI Alliance ni quin abast tindrà a curt termini.