Fins ara, els assistents de veu amb intel·ligència artificial havien de triar entre respondre de seguida amb poc raonament o raonar bé a costa de pauses incòmodes que trencaven la sensació de conversa natural. Google intenta tancar aquesta bretxa amb dos models nous anunciats el 15 de setembre: Gemini 3.8 Live, pensat per a l'escala i l'eficiència de cost, i Gemini 3.8 Live Extended Thinking, per a tasques complexes que exigeixen més passos de raonament.
Tots dos models poden processar imatges gairebé en temps real dins la conversa, detectar i canviar entre 97 idiomes a mig diàleg sense intervenció de l'usuari, i executar eines i trucades a API en segon pla mentre la conversa continua, amb frases de transició («Deixa'm comprovar-ho...») que mantenen la naturalitat mentre s'espera el resultat. En els bancs de proves que cita la mateixa Google, la variant Extended Thinking encapçala l'índex de qualitat veu a veu d'Artificial Analysis amb 82,6 punts, obté un 97,7% a Big Bench Audio i un 68,6% a l'agent conversacional τ-Voice (35,1% en la variant bancària de Sierra), mentre que Gemini 3.8 Live queda segon a l'Speech Agent Arena. Els models es desplegaran a l'API de Gemini, Google AI Studio, Search Live, l'aplicació de Gemini, Google Workspace (Docs, Gmail, Keep) i, en accés anticipat, a Gemini Enterprise; tot l'àudio generat porta la marca d'aigua SynthID.
És un pas rellevant perquè la veu s'està convertint en el nou camp de batalla entre els grans assistents d'IA, i la capacitat de mantenir oberta una conversa mentre s'executen tasques en segon pla apropa aquests sistemes a un ús domèstic i professional més natural, més enllà del clàssic torn de pregunta-resposta.
Les xifres de rendiment provenen de bancs de proves triats i publicats per la mateixa Google, sense verificació independent, i la disponibilitat a Gemini Enterprise es limita de moment a un accés anticipat privat, sense calendari públic de desplegament general ni detalls de preu per a cada nivell de servei.