iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 4 MIN

L'alemanya Black Forest Labs presenta FLUX 3, un model que genera vídeo, imatge i so alhora i ja mira cap a la robòtica

La companyia de Freiburg, fundada per antics creadors de Stable Diffusion, llança un model multimodal capaç de produir fins a vint segons de vídeo amb àudio sincronitzat en una sola passada, i presenta amb l'empresa mimic robotics un primer pas cap al control de robots.

Il·lustració editorial de L'alemanya Black Forest Labs presenta FLUX 3, un model que genera vídeo, imatge i so alhora i ja mira cap a la robòtica
Escolta:

Black Forest Labs, l'empresa alemanya fundada per antics investigadors de la difusió latent i creadors del model original de Stable Diffusion, amb seu a Freiburg i San Francisco, ha presentat aquest 23 de juliol FLUX 3, un model d'intel·ligència artificial que entrena conjuntament imatge, vídeo, àudio i predicció d'accions dins d'una mateixa arquitectura unificada. L'empresa, que va sortir de l'ombra el 2024 amb un equip d'un centenar de persones i una valoració de 3.250 milions de dòlars, presenta FLUX 3 com un salt qualitatiu respecte als seus models anteriors, centrats només en imatge.

El nou model pot generar fins a vint segons de vídeo amb diàleg, efectes de so i música de fons sincronitzats en una única passada d'inferència, a partir del mateix mecanisme de «flow matching» que produeix els fotogrames, i manté una notable consistència en l'edició d'imatges seguint instruccions en llenguatge natural. El conseller delegat, Robin Rombach, ho ha resumit dient que «l'entrenament conjunt dins d'una única arquitectura és el que ens hi portarà, perquè cada modalitat d'entrenament en reforça les altres». El llançament arriba en accés anticipat per a les versions FLUX 3 Video i Action, mentre que FLUX 3 Image es desplegarà en les properes setmanes; empreses com Canva, Burda, Magnific, Krea i Picsart ja el proven. Amb l'empresa de robòtica mimic robotics, Black Forest Labs presenta també FLUX-mimic, un model de vídeo-acció que, segons l'empresa, necessita només trenta minuts de dades d'un robot per aprendre una tasca, enfront de les més de trenta hores que calien fins ara, i que ja es prova amb fabricants com Audi.

La notícia és rellevant perquè situa una empresa europea al capdavant d'una cursa —la generació conjunta de vídeo i àudio amb IA— dominada fins ara sobretot per gegants nord-americans com Google (Veo) o OpenAI (Sora), i perquè l'aposta declarada per la robòtica apunta cap a un ús de la IA generativa que va més enllà del contingut audiovisual, cap al control físic de màquines en entorns industrials reals.

El llançament és, de moment, parcial i en fase de proves: només algunes funcions són d'accés anticipat, encara no hi ha benchmarks independents que confirmin el rendiment declarat per l'empresa, i la integració amb mimic robotics per a ús industrial es descriu com un desplegament encara en curs amb fabricants seleccionats, no com un producte ja disponible de manera general.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.