Google porta mesos ampliant les capacitats conversacionals de Gemini per competir amb OpenAI i Anthropic en assistents que es puguin fer servir dins de processos empresarials reals, no només en un xat de text. Gemini 3.8 Live, el seu model de veu que raona sense tallar la conversa, es va presentar el 17 de setembre; el 24 de setembre, Google n'ha anunciat una nova capa.
La companyia ha fet disponible amb caràcter general, dins de Gemini Enterprise i amb punts d'accés als Estats Units i la Unió Europea, «Live Avatar», una funció que genera vídeo gairebé en temps real sincronitzat amb la parla, amb sincronització labial i expressions en 97 llengües detectades automàticament. L'avatar pot mantenir una conversa mentre executa tasques de fons —consultes a bases de dades, crides a eines— i processar en directe una càmera o una pantalla compartida. Totes les transmissions d'àudio i vídeo generades porten marques d'aigua SynthID imperceptibles, i la creació d'avatars personalitzats només és accessible amb un procés de verificació per a clients autoritzats. Cox Automotive ja l'ha fet servir per crear un assistent de compra de cotxes per a Autotrader, i Salesforce ha anunciat que l'integrarà amb el seu Agentforce.
La funció confirma l'aposta de Google per convertir Gemini en una capa d'atenció al client amb presència visual, no només conversacional, en un moment en què empreses com Equal AI —que gestiona més d'un milió de trucades diàries en nou llengües índies— ja en depenen per a la seva operativa. Les marques d'aigua i el control d'accés als avatars personalitzats busquen respondre per endavant a la preocupació pels deepfakes conversacionals.
La funció és, de moment, només per a clients empresarials de Gemini Enterprise amb accés als Estats Units i la Unió Europea, no per al públic general de l'aplicació Gemini, i la creació d'avatars personalitzats es manté restringida a una llista tancada de clients verificats. Google no ha precisat el cost del servei més enllà de remetre a la seva pàgina de preus, ni ha ofert xifres independents sobre la precisió de la sincronització labial o la latència real en producció.