Fins ara, processar text, imatges, àudio i vídeo amb IA solia requerir combinar diversos models especialitzats. L'equip Qwen d'Alibaba ha presentat Qwen3.8-Omni-Flash, el seu primer model «omnimodal natiu» construït des de zero perquè la comprensió d'àudio i vídeo, el raonament i l'ús d'eines convisquin dins d'un únic sistema, amb una finestra de context d'un milió de tokens.
Segons Alibaba, el nou model millora en més d'un 26% la puntuació mitjana obtinguda pel seu predecessor, Qwen3.5-Omni-Plus, en un conjunt de 30 avaluacions internes, amb guanys concentrats en tasques d'agents d'àudio i vídeo, programació, context llarg i interacció multimodal en temps real. A més, en costa un 98% menys processar una hora d'àudio i un 93% menys processar-ne una hora combinada amb vídeo. El model es pot fer servir com a API allotjada a QwenCloud, Alibaba Cloud Model Studio i Qwen Studio, publicat el 18 de setembre.
La rellevància de l'anunci és doble: consolida la cursa dels laboratoris xinesos per oferir models multimodals cada cop més barats i capaços —just la mateixa setmana en què StepFun i altres competidors locals llançaven les seves pròpies novetats—, i aposta per un disseny «omnimodal» en lloc del patró més habitual de connectar mòduls separats per a cada tipus de contingut, una arquitectura que Alibaba presenta com a més eficient per a agents que han d'escoltar, veure i actuar alhora.
A diferència d'altres models de la família Qwen, Alibaba no n'ha alliberat els pesos en aquest llançament: Qwen3.8-Omni-Flash només és accessible per API de pagament, de manera que no es pot autoallotjar ni verificar-ne el comportament intern de manera independent, i les xifres de millora del 26% provenen exclusivament de les avaluacions internes de la mateixa empresa.