iaintel·ligènciaartificial.cat← Portada

PRODUCTE · 4 MIN

Google presenta Gemini 3.5 Transcribe, un model de veu a text que redueix a la meitat el temps de transcripció

El nou model, en previsualització pública, promet gestionar sorolls de fons, autocorreccions i argot especialitzat en més de 85 idiomes, amb una taxa d'error de només el 2,6% en àudio pregravat i un 70% menys de temps fins al text final que el seu predecessor, Chirp 3.

Il·lustració editorial de Google presenta Gemini 3.5 Transcribe, un model de veu a text que redueix a la meitat el temps de transcripció
Escolta:

La transcripció automàtica de veu és un dels usos de la intel·ligència artificial menys vistosos però amb més volum real d'ús: subtítols, actes de reunions, accessibilitat, centres d'atenció telefònica. Fins ara, el model de referència de Google en aquest terreny era Chirp 3, un sistema que, com la majoria de motors de reconeixement de veu convencionals, tenia dificultats amb el soroll de fons, l'argot complex i les vacil·lacions pròpies de la parla espontània.

Google ha presentat el 26 d'agost Gemini 3.5 Transcribe, en previsualització pública, com el seu «model de veu a text més precís fins ara». El sistema es distribueix en dues variants: gemini-3.5-transcribe, per a àudio ja gravat a través de la seva API d'interaccions, i gemini-3.5-transcribe-live, per a àudio en directe a través de la Live API. A diferència d'un motor de transcripció convencional, el model no es limita a convertir so en text: elimina paraules de farciment, gestiona les autocorreccions de qui parla i formata automàticament el resultat, a més de permetre incorporar vocabulari personalitzat per a argot especialitzat i identificar fins a tres interlocutors diferents amb marques de temps. Admet més de 85 idiomes amb detecció automàtica. Segons les xifres que dona la mateixa Google, la taxa d'error de paraules és del 4,0% en transcripció en directe i del 2,6% en àudio pregravat, i el temps fins a obtenir el text final s'ha reduït un 70% respecte de Chirp 3. El model ja arriba a desenvolupadors via Google AI Studio i Google Antigravity, a empreses via la Gemini Enterprise Agent Platform, i a usuaris particulars a través de la funció Rambler a Android i l'aplicació Gemini de macOS, amb Chrome previst properament.

La rellevància de l'anunci és que Google aposta per aprofitar tota la seva pila multimodal Gemini per competir en un terreny —la transcripció— on fins ara dominaven eines més especialitzades i models com els successors de Whisper d'OpenAI, en un moment en què la precisió i la velocitat d'aquestes eines determinen directament la seva utilitat en entorns professionals reals, com sales de redacció, consultes mèdiques o serveis d'atenció al client.

Les xifres de rendiment que Google fa públiques —la taxa d'error i la millora de velocitat— provenen de mesures fetes o encarregades per la mateixa companyia, sense una verificació independent completa encara, i el model és, de moment, una previsualització pública, no una versió general disponible per a tothom. La identificació de parlants, a més, es limita per ara a un màxim de tres persones per conversa, i el rendiment real en els 85 idiomes que diu admetre no s'ha posat a prova de manera uniforme.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.