Microsoft AI ha ampliat l'1 d'octubre la família d'àudio MAI, que va estrenar al setembre amb MAI-Transcribe-2, amb tres models nous pensats perquè els agents d'IA puguin escoltar i parlar sense retard perceptible: un de transcripció en temps real, MAI-Transcribe-2-Streaming, i dos de síntesi de veu, MAI-Voice-2.1 i MAI-Voice-2.1-Flash.
El model de transcripció funciona en 60 llengües amb detecció contínua de l'idioma i comença a oferir transcripcions parcials poc més de 100 mil·lisegons després de rebre l'àudio. Microsoft assegura que encapçala la classificació d'Artificial Analysis, amb un 2,5% d'errors per paraula, i el preu de llançament és de 0,54 dòlars per hora d'àudio fins a final d'any. Els models de veu cobreixen 23 llengües en 26 variants locals, poden mantenir la mateixa veu en canviar d'idioma i clonar-la a partir de pocs segons d'àudio de referència.
La versió Flash genera 45 segons d'àudio amb 150 mil·lisegons de latència total, i la companyia diu que és un 55% més ràpida i un 60% més barata que models comparables. Els tres ja es poden fer servir a Microsoft Foundry, al MAI Playground, a Vercel i a Azure Voice Live; els de veu també a OpenRouter. La rapidesa és el que permet que un agent pugui començar a preparar una acció mentre l'usuari encara parla.
Cal llegir-ho amb cautela: la posició a la classificació és la que declara el mateix Microsoft i les proves independents encara són escasses. Tampoc no s'han detallat els resultats per llengua, i el rendiment en català o en parles amb accent pot ser molt diferent de la mitjana de 60 llengües. La clonació de veu, a més, planteja riscos de suplantació que l'empresa haurà d'abordar amb salvaguardes.
