Takuya Studio — IA Bulletin

La chaîne créative réunie chez un seul acteur /
La génération rapatriée en local /
Le contrat et le certificat au centre

Semaine dominée par la consolidation et le droit. À sa conférence FORCE, ByteDance aligne une chaîne créative complète — Seedance 2.5 et son plan de trente secondes sans raccord, Seedream 5.0 qui raisonne avant de dessiner, Seed-Audio 1.0 pour le son d'un seul geste. En parallèle, la génération se rapatrie en local et en poids ouverts : NVIDIA Cosmos 3, NAVA, ComfyUI 0.25, dots.tts, le duplex de Thinking Machines. Le pouvoir se joue aussi dans les contrats et les preuves — la clause de silence de Suno Spark, le certificat signé par piste de RTM Audio, l'alliance A24 × Google DeepMind et le rachat de Topaz Labs par Adobe. En marge, Dataland ouvre le premier musée d'art IA, Grok Imagine casse le prix de la vidéo, Krea, ElevenLabs et Runway resserrent l'atelier. Sept éditions, du 22 au 28 juin 2026.

22 juin 2026
Le modèle de monde ouvert à la génération vidéo / La vidéo générative étendue à cinq minutes / Le son et l'image générés d'un seul geste
NVIDIA Cosmos 3 · modèle de monde ouvert · vidéo et son natifs · précision physique · OpenMDW — JD JoyAI-Echo · texte-vidéo · cinq minutes · plans multiples · LTX-2.3 — Baidu NAVA · génération son-image conjointe · synchronisation · 6,3 Md · Apache 2.0
NVIDIA ouvre Cosmos 3, premier modèle de monde entièrement ouvert capable de générer nativement vidéo et son ambiant avec une précision physique inédite. JD publie JoyAI-Echo, qui étend la vidéo générée en plans multiples jusqu'à cinq minutes sur la pile ouverte LTX-2.3. Baidu ouvre NAVA, modèle de 6,3 milliards de paramètres qui génère le son et l'image d'un seul geste, avec une synchronisation de premier plan.
23 juin 2026
Le modèle qui écoute et regarde en parlant / L'atelier local qui remplace un visage dans un plan / La voix clonée sans le moindre jeton
Thinking Machines · interaction model full-duplex · écoute, regarde et parle · 0,4 s de latence · Mira Murati — ComfyUI 0.25 · remplacement de personnage · Depth Anything 3 · Kling V3-Turbo · local — dots.tts · voix continue sans jetons · zéro-shot · 54 ms · Apache 2.0
Thinking Machines dévoile son premier modèle, un interaction model full-duplex qui écoute, regarde et parle en même temps avec une latence de quatre dixièmes de seconde. ComfyUI publie ses versions 0.25, qui ajoutent le remplacement de personnage, la profondeur Depth Anything 3 et le support Kling V3-Turbo en local. Hilab ouvre dots.tts, une synthèse vocale entièrement continue qui clone une voix en zéro-shot à 54 millisecondes sous licence Apache 2.0.
24 juin 2026
Le premier musée d'art IA à Los Angeles / La vidéo générative à prix cassé / La cohérence inter-plans en 4K native
Dataland · premier musée d'art IA · Refik Anadol · Google Cloud · Machine Dreams Rainforest — Grok Imagine Video 1.5 · n°1 Image-to-Video Arena · 4,20 $/min · -86 % vs Sora 2 Pro — Seedance 2.0 Native 4K · quad-modal · Universal Reference · cohérence inter-plans
Dataland, premier musée entièrement consacré aux arts de l'IA, ouvre à Los Angeles avec Refik Anadol et Google Cloud autour de l'exposition Machine Dreams : Rainforest. xAI fait passer Grok Imagine Video 1.5 en disponibilité générale, en tête de l'Image-to-Video Arena et à 4,20 dollars la minute, soit 86 % sous Sora 2 Pro. ByteDance met en ligne Seedance 2.0 Native 4K, dont l'Universal Reference verrouille la cohérence d'un personnage d'un plan à l'autre.
25 juin 2026
La 2K générée en deux secondes / La qualité audio relevée chez ElevenLabs / Le montage replié dans Runway
Krea 2 Turbo · 2K en deux secondes · 8 étapes · rapport technique 23 juin · LoRA pour tous — ElevenLabs Music v2 · mp3 320 kbps · défaut 192 · durées de section respectées — Runway Studio Trim · rogner, assembler, réordonner, exporter · Aleph 2.0 · Kling 3.0 · Veo 3.1
Krea met en ligne Krea 2 Turbo, qui génère une image en 2K en deux secondes environ, et publie le rapport technique de Krea 2 le 23 juin. ElevenLabs relève la qualité de Music v2 avec des formats mp3 240 et 320 kbps et des durées de section toujours respectées. Runway ajoute Studio Trim pour rogner, assembler, réordonner et exporter une vidéo finale sans quitter l'outil de génération.
26 juin 2026
La barre des trente secondes franchie / L'image qui raisonne avant de dessiner / La bande-son générée d'un seul tenant
Seedance 2.5 · plan unique de 30 secondes · 50 références simultanées · retouche après coup · bêta · Seedance 2.0 en 4K natif 10 bits — Seedream 5.0 Pro · l'image qui raisonne · Dreamina · Volcano Ark · version Lite — Seed-Audio 1.0 · dialogues, musique et bruitages en une passe · 2 minutes · API Ark
À la conférence FORCE de Volcano Engine, ByteDance présente une chaîne créative complète. Seedance 2.5 génère un plan unique de trente secondes sans recollage et accepte jusqu'à cinquante références simultanées, avec ouverture publique visée début juillet. Seedream 5.0 Pro mise sur un modèle d'image qui observe et raisonne avant de produire, tandis que Seed-Audio 1.0 fabrique dialogues, musique et bruitages en une seule passe.
27 juin 2026
Le mécénat sous clause de silence / Le certificat signé piste par piste / Le modèle d'image réglé en public
Suno Spark · bourses pour artistes indépendants · clause « Good Vibes Only » sans date de fin · non-concurrence 60 jours · approbation préalable — RTM Audio UAI · certificat signé par piste · ISRC · AI Act · DDEX — Midjourney V8.1 · 2K natif · défaut depuis le 10 juin · classement public pour la 8.2
Suno lance Spark, des bourses pour artistes indépendants assorties d'une clause de non-critique sans date de fin et d'une non-concurrence de soixante jours avec dix outils rivaux. RTM Audio sort UAI, un détecteur de musique IA qui émet un certificat cryptographiquement signé par piste, lié à l'ISRC et formaté pour l'AI Act européen. Midjourney impose V8.1 en 2K natif et ouvre un classement d'images communautaire pour calibrer les mises à jour esthétiques de la 8.2.
28 juin 2026
La vidéo générée d'un seul tenant / Le storyboard confié à la recherche / La restauration d'image rachetée
Seedance 2.5 · 30 sec sans raccord · 50 références multimodales · bêta entreprise · lancement public juillet — A24 × Google DeepMind · 75 M$ · A24 Labs · storyboards générés par IA — Adobe × Topaz Labs · upscale · débruitage · restauration · sur machine · Firefly · Creative Cloud
ByteDance présente Seedance 2.5, un modèle vidéo qui revendique un plan continu de trente secondes sans assemblage et jusqu'à cinquante références multimodales. Google investit environ 75 millions de dollars dans A24 et noue un partenariat de recherche avec DeepMind, dont A24 Labs tire d'abord une application de storyboards générés par IA. Adobe rachète Topaz Labs pour porter agrandissement, débruitage et restauration directement sur la machine, au sein de Firefly et Creative Cloud.