Els models de visió i llenguatge s'utilitzen cada cop més per classificar automàticament la gravetat dels danys després d'un desastre natural a partir d'imatges, una tasca útil per prioritzar l'ajuda d'emergència, però que sol topar amb un problema doble: els models encerten sovint la classificació sense que es pugui saber per què, i fallen més en els casos de dany menys freqüents, precisament els que poden passar més desapercebuts.
Yuanjun Zhang, Fuzel Ahamed Shaik, Suvojit Acharjee, Fahad Khalid i Mourad Oussalah han presentat un mètode, publicat a la revista Reliability Engineering & System Safety i penjat a arXiv l'1 de setembre, que combina un ajust supervisat inicial amb un segon pas d'optimització directa de preferències a partir de valoracions humanes, perquè el model no només encerti la gravetat del dany sinó que expliqui el seu raonament d'una manera alineada amb el judici de persones expertes. En les proves dels autors amb diversos models de visió i llenguatge, el mètode millora la precisió del 73,64% al 78,29% i la puntuació Macro-F1 en un 29% respecte als mètodes de referència, i millora en un 25% la qualitat de les explicacions generades.
El resultat és rellevant perquè els casos de dany extrem o inusual —els que un sistema d'emergències no es pot permetre passar per alt— solen ser també els menys freqüents en les dades d'entrenament, i el mètode millora especialment la detecció d'aquests casos infrarepresentats i redueix els errors de classificació més greus. Que el treball s'hagi publicat en una revista especialitzada en fiabilitat i seguretat de sistemes, no només a arXiv, aporta una capa addicional de revisió per parells poc habitual en la recerca d'IA aplicada.
Els autors no detallen amb quina rapidesa es podria desplegar el sistema en una emergència real, ni quantes dades humanes anotades calen per entrenar-lo per a un tipus de desastre nou. Tampoc queda clar com es comportaria el mètode amb imatges de qualitat molt més baixa que les del conjunt de proves, com les que sovint arriben durant una catàstrofe real des de xarxes socials o drons improvisats.