Archive 17 – 23 août 2026
Takuya Studio — IA Bulletin

Les bancs d'essai de la génération /
Les corpus et les latents repensés /
Les licences négociées plutôt qu'imposées

Semaine de la mesure. Là où les mois précédents empilaient les sorties de modèles, ces sept jours empilent les protocoles d'évaluation : RA-Bench et ses 17 886 vidéos de crise face à neuf générateurs, CPI-Bench sur l'édition multi-images, SemComp-Bench qui juge une vidéo à l'objectif atteint plutôt qu'à la jolie texture. En parallèle, les briques internes sont démontées et remontées : V-RAE ramène les latents vidéo à 2,13 rFVD sur K600 avec une convergence six fois plus rapide, PixRestore restaure une image en une étape avec 50 millions de paramètres, Abra fixe les lois d'échelle de la diffusion à 200 jetons par paramètre, Alibaba ordonne 440 millions d'images par capacité plutôt que par volume. Côté outils, MiniMax H3 ouvre son modèle musical puis retrouve sa timeline dans ComfyUI, EditBridge édite du 4K en 61 secondes, 4DAnyone reconstruit un humain en 4D depuis une vidéo de poche, l'alpha Midjourney encaisse une centaine de correctifs. Et le droit avance sans procès : la MPA signe un protocole avec ByteDance sur Seedance et Seedream, UMG ouvre trois millions d'enregistrements au remix licencié avec Hook — sans génération. Sept éditions, du 17 au 23 août 2026.

17 août 2026
Le modèle musical ouvert de MiniMax / La station Suno au format DAW / Le monde jouable en trois étapes / L'extinction d'Imagen 4
MiniMax Music 3 · poids ouverts et ComfyUI natif — Suno Studio 2.0 · MIDI et quotas au 3 septembre — EVOKE 14B · Apache-2.0 — Imagen 4 · endpoints coupés
MiniMax publie les poids ouverts de Music 3, modèle musical produisant jusqu'à cinq minutes en WAV stéréo 32 kHz, piloté par légende structurée et supporté nativement par ComfyUI dès le premier jour. Suno Studio 2.0 ajoute le MIDI complet, un synthétiseur wavetable et une barre de chat en bêta, pendant que les téléchargements passent sous quota rétroactif le 3 septembre. Alaya Lab livre EVOKE 14B sous Apache-2.0, monde interactif en trois étapes de débruitage sans classifier-free guidance, tandis que Google éteint aujourd'hui les trois endpoints Imagen 4 de l'API Gemini.
18 août 2026
Les vidéos de crise indétectables / Le planificateur sémantique de ByteDance / L'édition d'image mise à l'épreuve / Le multimodal local d'Alibaba
RA-Bench · 17 886 vidéos et 9 générateurs — Bernini-Diffusers-v2 · planificateur Qwen2.5-VL et rendeur Wan2.2 — CPI-Bench · édition multi-images — Qwen3.8-27B · Apache 2.0
RA-Bench mesure la détection de vidéos générées sur des scènes de crise à partir de 1 830 ancres réelles, et aucune des trois familles de détecteurs évaluées ne généralise, la diffusion sociale dégradant encore leur fiabilité. ByteDance publie Bernini-Diffusers-v2, chaîne vidéo complète où un planificateur sémantique décompose l'instruction avant qu'un rendeur Wan2.2 fabrique les images, sans support ComfyUI. Alibaba livre CPI-Bench, banc d'essai d'édition d'image qui introduit le multi-images et l'édition par raisonnement, et met en ligne les poids de Qwen3.8-27B sous Apache 2.0.
19 août 2026
La timeline retrouvée pour MiniMax H3 / L'accord de Hollywood avec ByteDance / L'animation humaine en flux continu / Les fils Reddit mis en voix
H3 Director · timeline et prompt par plan dans ComfyUI — MPA et ByteDance · protocole sur Seedance et Seedream — LiveAnimate · 19,63 images par seconde sur deux H100 — Reddit · fils convertis en clips narrés
ComfyUI-MiniMaxH3-Director installe un éditeur de montage dans ComfyUI, avec pistes, prompt par plan, fentes de référence pondérées et prompt compilé lisible avant le rendu. La Motion Picture Association et ByteDance signent un protocole d'accord couvrant tous les modèles génératifs du groupe, six mois après une mise en demeure visant Seedance 2.0. LiveAnimate porte un transformeur de diffusion de 14 milliards de paramètres à 19,63 images par seconde sur deux H100 grâce à un cache borné indexé sur la pose, pendant que Reddit teste la conversion de fils textuels en clips narrés par des voix de synthèse.
20 août 2026
L'édition d'image en 4K / Le montage vidéo à instructions multiples / Les lois d'échelle de la diffusion / Les corpus pensés par capacité
EditBridge · 4K édité en 61 secondes — CoinVE-200K · deux à cinq opérations par consigne — Abra · 200 jetons par paramètre — Alibaba · 440 millions d'images ordonnées par capacité
EditBridge traite la montée en définition comme une traduction de données à données conditionnée par la source, avec une accélération de 3,6 à 8,4 fois en 2K et une édition 4K en 61 secondes. Tencent ouvre CoinVE-200K, jeu de données de montage vidéo où chaque consigne enchaîne deux à cinq opérations sur des clips 1080p, accompagné d'un banc d'essai et d'un modèle de 22 milliards de paramètres. Luma AI situe l'optimum de la diffusion texte-image à 200 jetons par paramètre, dix fois la prescription Chinchilla, pendant qu'Alibaba organise 440 millions d'images selon les dépendances entre capacités.
21 août 2026
L'évaluation vidéo par l'objectif atteint / Les latents vidéo repensés / La restauration d'image sans autoencodeur / La création 3D pilotée par programme
SemComp-Bench · six domaines, scores OA et GR — V-RAE · 2,13 rFVD sur K600, convergence six fois plus rapide — PixRestore · 50 millions de paramètres, inférence en une étape — aDSL · opérateurs relationnels et boucle Plan-Exécute-Critique
SemComp-Bench juge une vidéo générée sur l'issue obtenue plutôt que sur son apparence, en séparant l'accomplissement de la tâche et la fiabilité de génération, et montre que les modèles actuels tiennent rarement les deux ensemble. V-RAE bâtit les latents vidéo sur des encodeurs visuels gelés, atteint 2,13 de rFVD sur K600, converge jusqu'à six fois plus vite et introduit tFVD, diagnostic temporel qui prédit mieux la qualité générative que la reconstruction. PixRestore restaure les images en espace pixel sans autoencodeur variationnel avec 50 millions de paramètres et une seule étape d'inférence, pendant qu'aDSL fait écrire des programmes 3D à des agents en remplaçant les coordonnées absolues par des opérateurs relationnels.
22 août 2026
L'humain en 4D depuis une vidéo de poche / L'image de groupe à dix identités / Les mondes vidéo jouables en peu d'étapes / La transcription calquée sur le barème
4DAnyone · humain 4D depuis une vidéo monoculaire non calibrée — WithEveryone · dix identités, 97,3 % couvertes, copier-coller à 0,055 — ForgeWM · mondes vidéo jouables en un à quatre pas — Hume AI · la reconnaissance vocale qui récite sa référence
4DAnyone reconstruit un humain en quatre dimensions à partir d'une simple vidéo monoculaire non calibrée, en compressant les vues déjà générées en un contexte de longueur fixe et en faisant tourner les groupes de vues cibles pendant le débruitage. WithEveryone génère des images de groupe jusqu'à dix identités de référence, portant la similarité de visage de 0,462 à 0,499 et faisant chuter les artefacts de copier-coller de 0,169 à 0,055. ForgeWM distille des modèles de monde vidéo jouables à un, deux ou quatre pas de débruitage avec raffinement à la relecture, pendant qu'une étude de Hume AI montre que les meilleurs modèles de reconnaissance vocale restituent mot pour mot la transcription de référence même lorsque l'audio la contredit.
23 août 2026
L'alpha Midjourney remise d'aplomb / Le remix licencié sans génération / Les générations chaînées d'ElevenLabs / Les garde-fous négociés de Seedance
Midjourney · une centaine de correctifs, Upscale Zoom et Vary restaurés — UMG et Hook · trois millions d'enregistrements ouverts au remix licencié — ElevenLabs · API Flows asynchrones et actifs chaînables — MPA et ByteDance · protocole d'accord sur Seedance et Seedream
Midjourney publie une centaine de correctifs sur son interface alpha, rend Upscale, Zoom et Vary à ses utilisateurs et répare les réglages de moodboards et de personnalisation qui s'appliquaient à contretemps. Universal Music Group ouvre à l'application Hook un catalogue de plus de trois millions d'enregistrements pour du remix sous licence, sans génération de morceaux nouveaux, avec un contrôle des ayants droit sur les titres, les outils et les plateformes. ElevenLabs livre des API Flows asynchrones produisant image, vidéo et parole avec des actifs réutilisables et chaînables, tandis que la Motion Picture Association et ByteDance signent un protocole d'accord inscrivant filigranes, C2PA et blocage de visages dans un cadre négocié pour Seedance et Seedream.