iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Nvidia publica en obert un model que identifica qui parla en una conversa amb la meitat d'errors que els sistemes anteriors

Nemotron 3 Diarization distingeix fins a vuit veus diferents en un àudio, en temps real o gravat, amb una sola passada d'un transformador de 31 capes. En el banc de proves independent VoiceArena queda primer entre dotze sistemes, amb una millora relativa d'un 24% respecte del segon.

Il·lustració generada amb IA: Nvidia publica en obert un model que identifica qui parla en una conversa amb la meitat d'errors que els sistemes anteriors
Il·lustració generada amb IA
Escolta:

La «diarització de parlants» és la tasca de determinar, en un enregistrament amb diverses veus, qui parla i en quin moment, sense necessàriament transcriure les paraules; és un pas previ imprescindible per a actes de reunions, anàlisi de trucades d'atenció al client o qualsevol assistent que hagi de recordar qui ha dit què en una conversa amb diverses persones. Fins ara, els sistemes més habituals combinaven per separat la detecció de segments de veu i la comparació d'identitats, un procés en dues fases que calia ajustar amb cura.

Nvidia ha publicat el 23 de setembre Nemotron 3 Diarization, un model en obert que substitueix aquest procés per una sola passada d'un transformador de 31 capes, capaç de distingir fins a vuit parlants simultàniament tant en àudio gravat com en temps real, amb una latència configurable des dels 30 segons fins a només 320 mil·lisegons. Segons les proves publicades, el model queda primer entre dotze sistemes al banc de proves independent VoiceArena, amb una taxa d'error de diarització (DER) del 14,72%, un 24% millor en termes relatius que el segon classificat; en el conjunt DIHARD III, l'error baixa del 19,09% al 12,73% en mode gravat i del 19,60% al 13,18% en mode de baixa latència, mantenint una velocitat de processament molt superior a la dels sistemes de referència. El model es publica amb la llicència oberta OpenMDW 1.1, i l'empresa Argmax ja l'ha incorporat al seu Argmax Pro SDK per fer transcripció amb identificació de parlants directament al dispositiu, sense passar per servidors.

La rellevància del resultat no és una capacitat nova, sinó l'eficiència: el mateix nivell d'error que abans requeria més temps de càlcul o més etapes de processament, ara s'aconsegueix amb una arquitectura més senzilla i uns temps de resposta prou curts per funcionar en temps real en un mòbil o un ordinador portàtil, un requisit clau perquè els assistents de veu puguin recordar «qui ha dit què» sense dependre d'un servidor central.

Els resultats provenen de proves fetes per la mateixa Nvidia, en col·laboració amb Argmax com a soci de referència del banc de proves, sense que hi hagi encara una replicació completament independent; a més, el model es limita a un màxim de vuit parlants per conversa, un límit que caldrà veure com es comporta en escenaris amb més participants.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.