FLUX 3 apprend la vidéo, le son et le geste dans un seul modèle
Black Forest Labs lance FLUX 3 en accès anticipé, premier modèle du laboratoire allemand entraîné d'un seul tenant sur l'image, la vidéo et l'audio. Le système génère des clips jusqu'à 20 secondes, dialogues, bruitages et ambiances synchronisés à l'écran, et l'emporte en préférence humaine face à ses concurrents directs dans 77 à 93 % des duels à l'aveugle. Le volet image, attendu dans les prochaines semaines, affiche déjà une palette de styles bien au-delà du photoréalisme — un registre familier pour l'esthétique d'une pochette de disque. La même colonne vertébrale alimente FLUX-mimic, un modèle robotique conçu avec mimic robotics, qu'Audi teste sur la pose de joints de portières souples avec un temps de réaction d'environ 101 millisecondes. Vidéo et action restent derrière API et partenaires choisis ; seule la version Dev à poids ouverts est promise pour la fin 2026.
Le pari revendiqué est que prédire la vidéo revient à apprendre la physique — poids, contact, timing — et que le même modèle peut donc guider une pince de robot. Une démonstration sur ligne d'assemblage automobile pèse plus lourd qu'un papier de recherche. Reste que pour les créatifs, l'ouverture des poids arrive tard et au compte-gouttes : la génération locale demeure la seule promesse tangible de cette annonce, et elle n'est pas datée au jour près.