Auditar si un model d'intel·ligència artificial és capaç de generar imatges d'abús sexual infantil (CSAM) planteja un problema legal insalvable amb els mètodes habituals: als Estats Units, generar aquest contingut és il·legal encara que sigui amb finalitats de recerca o de prova, de manera que els equips de seguretat no poden fer servir directament la manera estàndard d'auditar un model, que és provocar-lo amb indicacions i comprovar-ne la resposta.
Un equip liderat per l'estudiant de doctorat Vinith Suriyakumar, amb els professors associats Ashia Wilson i Marzyeh Ghassemi del MIT, la postdoctoranda Lena Stempfle i col·laboradors de la Universitat de Boston i de l'organització de protecció infantil Thorn, ha presentat una tècnica anomenada «sondeig gaussià» (Gaussian probing) que evita aquest problema: en lloc de generar cap imatge, el mètode injecta dades aleatòries al model i n'analitza com han canviat les representacions internes en les capes que els adaptadors d'ajust fi (LoRA) han modificat, cosa que permet inferir si el model s'ha especialitzat per produir aquest tipus de contingut. En les proves, la tècnica ha assolit una precisió del 100% distingint adaptadors coneguts com a nocius d'aquest tipus d'altres adaptadors segurs o especialitzats en altres continguts nocius. El treball s'ha presentat com a spotlight al taller «Trustworthy AI for Good» de la conferència ICML. «Ens trobem en una situació molt difícil en què, per la mateixa llei, no podem fer servir el mètode d'avaluació de facto», ha explicat Suriyakumar.
La notícia és rellevant perquè resol un buit pràctic real en la seguretat dels models d'IA generativa: fins ara, l'única manera de comprovar si un model s'havia adaptat per generar CSAM era, a la pràctica, impossible de fer legalment a escala, cosa que deixava aquesta detecció fora de l'abast dels auditors automàtics. Un mètode que no necessita generar cap contingut il·legal per detectar-lo obre la porta a auditories sistemàtiques de plataformes que allotgen models i adaptadors d'ús públic.
Els investigadors adverteixen que encara cal validar la tècnica amb un conjunt més gran i divers de variants de model, i que el pas següent és explorar si el mètode també pot detectar capacitats nocives ja presents en els models base abans de qualsevol adaptació, una qüestió que l'estudi actual no resol.