Archive 15 – 21 juin 2026
Takuya Studio — IA Bulletin

Le poids ouvert érigé en norme de la semaine /
La création générative rapatriée en local /
Midjourney au-delà de l'écran

Semaine placée sous le signe du poids ouvert et du local. Midjourney bascule la V8.1 en modèle par défaut, lui ajoute un mode brouillon, puis dévoile son premier objet matériel, un dispositif immersif dans lequel on entre. Côté image, Ideogram 4.0 ouvre ses poids pour le design quand MAI-Image-2.5 hisse l'édition au sommet des arènes. Le son se libère coup sur coup — Stable Audio 3.0 en local, Lyria 3 dans Gemini, Magenta RealTime 2 en temps réel, Higgs Audio v3 et ZONOS2 pour la voix qui chante et se clone. La vidéo générative atteint la qualité production en open source et devient entraînable sur mesure avec le LTX-2 Trainer, tandis que TripoSplat fait surgir le volume 3D d'une seule photo et qu'Adobe Firefly rassemble tout l'atelier. Six éditions, du 15 au 21 juin 2026.

15 juin 2026
La V8.1 par défaut chez Midjourney / Firefly en plateforme multi-modèles / La vidéo générative passée à la 4K native
Midjourney · V8.1 par défaut · HD 4x · OREF V7 en transition — Adobe Firefly · 30+ modèles tiers · Nano Banana Pro · FLUX.2 · Veo 3.1 · générations gratuites — Vidéo générative · Hailuo 02 4K native · Kling v3 · Runway Gen-4.5 · audio synchronisé
Midjourney fait de la V8.1 son modèle par défaut, avec un rendu HD quatre fois plus défini, et garde l’omni-référence V7 le temps d’entraîner sa version V8. Adobe Firefly consolide plus d’une trentaine de modèles tiers et ouvre des générations gratuites, pariant sur le hub plutôt que sur le modèle. La vidéo générative bascule vers la 4K native et l’audio synchronisé, portée par Hailuo 02, Kling v3 et Runway Gen-4.5.
16 juin 2026
La vidéo open-source au niveau production / ElevenLabs Music v2 et la licence comme arme / Sora referme son app et reconcentre le marché
Vidéo open-source · Wan · HunyuanVideo 1.5 · LTX-Video 13B · ComfyUI en local — ElevenLabs Music v2 · édition par sections · inpainting · licence commerciale — Sora · app grand public éteinte · API arrêtée le 24 septembre · Veo, Kling, Runway restent
La vidéo générative open-source — Wan, HunyuanVideo 1.5, LTX-Video 13B — atteint la qualité production en local dans ComfyUI, sans serveur ni abonnement. ElevenLabs Music v2 ajoute l’édition par sections et l’inpainting, et fait de la licence commerciale son argument face à Suno et Udio. Le retrait de l’application Sora grand public reconcentre la vidéo IA autour de Google Veo, Kling et Runway, et rappelle qu’un modèle propriétaire reste un service qui peut fermer.
17 juin 2026
Ideogram 4.0 et le poids ouvert pour le design / Lyria 3 et le morceau de trois minutes dans Gemini / Stable Audio 3.0 en local et sous licence
Ideogram 4.0 · modèle image à poids ouverts · prompting JSON · mise en page · 2K natif — Lyria 3 · Gemini · trois minutes · filigrane SynthID — Stable Audio 3.0 · génération locale · données sous licence · six minutes
Ideogram 4.0, premier modèle d'image à poids ouverts de l'éditeur, mise sur un prompting JSON, le contrôle de mise en page et le rendu de texte multilingue pour le design. Google DeepMind ouvre Lyria 3 dans Gemini, capable de tenir une structure cohérente sur près de trois minutes et signée par le filigrane SynthID. Stable Audio 3.0 fait tourner la génération musicale en local, sur des données sous licence, jusqu'à six minutes et vingt secondes.
18 juin 2026
Midjourney et son premier objet matériel / Le mode brouillon dans la V8.1 / Firefly et l'atelier créatif unifié
Midjourney · premier projet matériel · objet immersif · événement San Francisco — V8.1 · mode brouillon · 24 images · drapeau --preview — Adobe Firefly · atelier unifié · Firefly Graph · flux par nœuds
Midjourney dévoile son premier objet matériel lors d'un événement à San Francisco, un dispositif immersif dans lequel on peut entrer. La V8.1 gagne un mode brouillon qui génère vingt-quatre images à bas coût, doublé d'un drapeau --preview pour tester les modèles à venir. Adobe Firefly rassemble image, vidéo, audio et automatisation par nœuds dans un atelier créatif unique.
20 juin 2026
MAI-Image-2.5 au sommet de l'édition / TripoSplat et le volume 3D depuis une photo / ZONOS2 et la voix clonée ouverte
Microsoft · MAI-Image-2.5 · édition d'image · No.2 Arena · variantes Flash et fidélité — TripoSplat · image vers 3D · nuage gaussien · open source MIT · ComfyUI — ZONOS2 · Zyphra · synthèse vocale MoE · clonage zero-shot · Apache 2.0
Microsoft hisse MAI-Image-2.5 au deuxième rang de l'édition d'image, en variantes Flash et haute fidélité déjà déployées dans PowerPoint et OneDrive. TripoSplat, modèle open source sous licence MIT, transforme une seule photo en nuage 3D gaussien exportable, avec un gabarit natif dans ComfyUI. Zyphra ouvre ZONOS2, premier modèle de synthèse vocale open source à mélange d'experts, capable de cloner une voix à partir de quelques secondes.
21 juin 2026
La musique générative en temps réel / La voix de synthèse expressive ouverte / L'entraînement vidéo sur mesure
Magenta RealTime 2 · Google · musique temps réel · latence 200 ms · CC-BY · MIDI texte audio — Higgs Audio v3 · Boson AI · voix expressive · chant · clonage zero-shot · 100+ langues — LTX-2 Trainer · Lightricks · LoRA vidéo · 13 modes · Apache 2.0 · local
Google ouvre Magenta RealTime 2, modèle à poids ouverts qui génère de la musique en flux continu avec une latence de contrôle d'environ 200 millisecondes. Boson AI publie Higgs Audio v3, synthèse vocale capable de chuchoter, crier et chanter sur balises, en plus de cent langues. Lightricks ouvre le LTX-2 Trainer, qui rend reproductible l'entraînement de LoRA vidéo sur mesure en moins d'une heure et en local.