La transcripció automàtica de veu és un dels usos de la intel·ligència artificial menys vistosos però amb més volum real d'ús: subtítols, actes de reunions, accessibilitat, centres d'atenció telefònica. Fins ara, el model de referència de Google en aquest terreny era Chirp 3, un sistema que, com la majoria de motors de reconeixement de veu convencionals, tenia dificultats amb el soroll de fons, l'argot complex i les vacil·lacions pròpies de la parla espontània.
Google ha presentat el 26 d'agost Gemini 3.5 Transcribe, en previsualització pública, com el seu «model de veu a text més precís fins ara». El sistema es distribueix en dues variants: gemini-3.5-transcribe, per a àudio ja gravat a través de la seva API d'interaccions, i gemini-3.5-transcribe-live, per a àudio en directe a través de la Live API. A diferència d'un motor de transcripció convencional, el model no es limita a convertir so en text: elimina paraules de farciment, gestiona les autocorreccions de qui parla i formata automàticament el resultat, a més de permetre incorporar vocabulari personalitzat per a argot especialitzat i identificar fins a tres interlocutors diferents amb marques de temps. Admet més de 85 idiomes amb detecció automàtica. Segons les xifres que dona la mateixa Google, la taxa d'error de paraules és del 4,0% en transcripció en directe i del 2,6% en àudio pregravat, i el temps fins a obtenir el text final s'ha reduït un 70% respecte de Chirp 3. El model ja arriba a desenvolupadors via Google AI Studio i Google Antigravity, a empreses via la Gemini Enterprise Agent Platform, i a usuaris particulars a través de la funció Rambler a Android i l'aplicació Gemini de macOS, amb Chrome previst properament.
La rellevància de l'anunci és que Google aposta per aprofitar tota la seva pila multimodal Gemini per competir en un terreny —la transcripció— on fins ara dominaven eines més especialitzades i models com els successors de Whisper d'OpenAI, en un moment en què la precisió i la velocitat d'aquestes eines determinen directament la seva utilitat en entorns professionals reals, com sales de redacció, consultes mèdiques o serveis d'atenció al client.
Les xifres de rendiment que Google fa públiques —la taxa d'error i la millora de velocitat— provenen de mesures fetes o encarregades per la mateixa companyia, sense una verificació independent completa encara, i el model és, de moment, una previsualització pública, no una versió general disponible per a tothom. La identificació de parlants, a més, es limita per ara a un màxim de tres persones per conversa, i el rendiment real en els 85 idiomes que diu admetre no s'ha posat a prova de manera uniforme.