L'urdú és la desena llengua més parlada del món, amb uns 246 milions de parlants, i tot i així gairebé no apareix en les avaluacions de seguretat que les empreses d'IA fan servir per comprovar si els seus models detecten correctament contingut odiós o perillós. Els investigadors Fawzia Zehra Kara-Isitt, Sonal Khosla i Stephen Swift assenyalen, en un nou treball penjat a arXiv, que en nou anys d'actes de les principals conferències de processament del llenguatge natural no hi ha ni un sol article dedicat específicament a aquesta llengua.
L'equip va construir un conjunt de continguts d'odi en quatre variants —urdú en escriptura nastaliq (la tradicional), urdú transliterat en alfabet llatí, anglès i una barreja d'urdú i anglès habitual en xarxes socials del sud d'Àsia— i els va passar per cinc models d'ús comú: GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 i Llama-3.1. El resultat central és el que anomenen la taxa «Missed-in-Urdu»: contingut que els models marquen correctament com a odiós quan és en anglès, però que deixen passar quan és el mateix text en urdú original, sense traduir. Aquesta taxa oscil·la entre el 2,4% i el 9,9% segons el model, amb una mediana del 4,3%, i la inconsistència entre l'etiqueta assignada al text original i a la seva traducció a l'anglès arriba fins al 31,6% en el pitjor cas. Els models oberts de mida més petita es van comportar sistemàticament pitjor que els models tancats de capa frontera.
La troballa té implicacions directes per a la moderació de continguts a gran escala al Pakistan, l'Índia i les seves diàspores, on l'urdú i les seves variants transliterades s'usen intensivament a les xarxes socials: si un sistema automàtic deixa passar més odi quan el text no s'ha traduït a l'anglès, els parlants d'urdú queden, de facto, menys protegits que els parlants d'anglès pels mateixos filtres de seguretat. L'estudi suggereix que el problema no és només de cobertura d'idiomes, sinó també d'escriptura: el mateix idioma es comporta de manera diferent segons si es representa en nastaliq o en alfabet llatí.
Es tracta d'un preprint encara no revisat per parells, centrat només en discurs d'odi i no en altres categories de contingut perillós (incitació a l'autolesió, desinformació electoral, etc.), i els autors no en detallen públicament la mida exacta del conjunt de dades ni el procés de validació humana de les etiquetes. Caldrà una revisió per parells i proves amb altres idiomes minoritzats per saber si el patró es repeteix més enllà de l'urdú.