IA Bulletin — 17 août 2026

Le modèle musical ouvert de MiniMax /
La station Suno au format DAW /
Le monde jouable en trois étapes /
L'extinction d'Imagen 4

Le modèle musical ouvert de MiniMax

MiniMax a publié le 13 août les poids ouverts de Music 3, un modèle de génération musicale complet capable de produire des morceaux jusqu'à cinq minutes en WAV stéréo 32 kHz sur 16 bits. L'architecture abandonne le décodage depuis des tokens discrets : un LLM global de 8 milliards de paramètres, initialisé depuis Qwen3-8B, tient la structure sur la durée, pendant qu'un LLM local de 0,6 milliard travaille le détail acoustique image par image, avant un étage de flow matching de 2,4 milliards et un décodeur Flow-VAE de 123 millions. Les paroles s'écrivent avec des balises de structure explicites — [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Outro] — et la direction artistique passe par une légende structurée en trois sections : métadonnées globales (genre, tempo, tonalité, profil de production), détail vocal (timbre, interprétation, harmonies, effets) et arrangement (instruments, groove, spatialisation). ComfyUI a livré le support natif le jour même, en version 0.33.0, avec un template dédié et deux nœuds d'encodage. Les premiers tests indépendants rapportent des voix japonaises tenues sans accroc, et MiniMax annonce préparer dans la foulée un modèle image et un modèle d'upscaling vidéo.

Note éditoriale

Le vrai basculement n'est pas la durée mais la légende structurée : pour la première fois, un modèle musical ouvert accepte qu'on lui parle en termes de production plutôt qu'en adjectifs d'ambiance. Décrire un groove, une place de basse, une spatialisation, c'est le vocabulaire d'un arrangeur — et c'est exactement ce qui manquait aux boîtes noires commerciales, où l'on relance une graine en espérant mieux. Cinq minutes en local, sans quota ni conditions d'utilisation à relire, change aussi la nature du brouillon : on peut enfin se tromper cinquante fois sans compter.

Sources : ComfyUI Blog — MiniMax Music 3, state of the art open weight music generation — Gigazine — MiniMax a publié MiniMax-Music3 gratuitement — ComfyUI — Changelog v0.33.1

La station Suno au format DAW

Suno Studio 2.0, réservé aux abonnés Premier, a ajouté le 13 août le MIDI complet — import, enregistrement, édition sur la timeline — accompagné d'un synthétiseur wavetable intégré et d'un mode « Musical Typing » qui transforme le clavier d'ordinateur en instrument. Un clip MIDI peut désormais piloter la génération : on joue une mélodie, le modèle construit autour. La mise à jour livre aussi une séparation de stems à deux niveaux, sept effets classiques — compression, convolution, delay, distorsion, égaliseur, gate, réverbération —, l'automation du volume, du panoramique et des paramètres, le MIDI Learn pour mapper un contrôleur matériel, et une barre de chat en bêta capable de fabriquer des presets de synthé sur mesure au fil de la conversation. Manquent toujours le support VST et Audio Units : aucun plug-in tiers ne rentre, ce qui maintient l'outil du côté de l'esquisse plutôt que du mixage final — la finition, comme la conception visuelle d'un disque, reste à faire ailleurs. En parallèle, Suno plafonne ses téléchargements à compter du 3 septembre : sept fichiers à vie en gratuit, vingt par mois en Pro, soixante en Premier, sans report des quotas non utilisés et de façon rétroactive sur tout le catalogue déjà généré, les exports depuis Studio restant seuls illimités.

Note éditoriale

Deux annonces contradictoires la même semaine : d'un côté un outil qui se rapproche sérieusement d'une station de travail, de l'autre un compteur posé sur la porte de sortie. La logique est limpide — verrouiller l'export de masse tout en gardant les gros producteurs à l'intérieur du Studio — mais elle dit ce que devient l'objet : non plus un générateur de fichiers, une plateforme où l'on est censé rester. Pour qui travaille en studio, la question pratique est celle du format de sortie et de sa portabilité, pas celle du nombre de morceaux. Un outil qui refuse les VST et rationne les WAV assume qu'il est une destination, pas un maillon de chaîne.

Sources : RouteNote — Suno Studio 2.0 launches with MIDI support, AI chat and advanced stem separation — Digital Music News — Suno is getting closer to an actual DAW with Studio 2.0 — Suno Help — Upcoming changes FAQ : downloads, models and terms of service

Le monde jouable en trois étapes

Alaya Lab a publié le 15 août EVOKE, un modèle de monde interactif de 14 milliards de paramètres distribué sous licence Apache-2.0, qui produit du 384 × 640 à 24 images par seconde en trois étapes de débruitage seulement et sans classifier-free guidance — une seule passe avant par étape au lieu de deux. La cohérence tient sur des sessions de trente secondes, à raison d'une seconde et demie de vidéo générée toutes les 2,11 secondes sur un unique H200. La trouvaille est ailleurs que dans la vitesse : la géométrie de la scène est sortie du modèle et rangée dans une banque d'état indexée par caméra, où la profondeur monoculaire est dépliée en nuage de points persistant, puis relue en fusionnant jusqu'à huit sources classées par co-visibilité — de sorte que le contexte du débruiteur reste borné quelle que soit la durée de la session. On peut changer de prompt en cours de route sans coupe ni redémarrage, les démonstrations basculant au troisième bloc sur six. Trois modes sont livrés — vidéo vers vidéo avec trajectoire de caméra, image vers vidéo, texte vers vidéo — mais les modèles distillés n'ayant été entraînés qu'en vidéo vers vidéo, les deux autres restent du zero-shot, et rien n'est encore branché nativement dans ComfyUI.

Note éditoriale

Séparer la mémoire du monde du réseau qui l'affiche est une idée d'architecte, pas de chercheur en diffusion : c'est reconnaître qu'un décor n'a pas à être réinventé à chaque plan, seulement retrouvé. Cette bascule intéresse moins le film fini que le repérage — arpenter un lieu, tourner autour, y revenir après avoir changé d'intention, exactement ce qu'un storyboard tente laborieusement de fixer. Que le tout tienne sur une seule carte et sous Apache-2.0 rend la chose testable en atelier, avec la réserve d'usage : trois étapes de débruitage se paient quelque part, et 384 × 640 n'est pas une image de rendu.

Sources : ComfyUI Wiki — EVOKE 14B, Alaya Lab's open 3-step interactive world model — Alaya Lab — EVOKE, page projet officielle — Hugging Face — AlayaLab/Evoke

L'extinction d'Imagen 4

Google éteint aujourd'hui, 17 août 2026, les trois endpoints Imagen 4 de l'API Gemini — imagen-4.0-generate-001, sa déclinaison ultra et sa déclinaison fast — annoncés dépréciés depuis le début du mois. La migration officiellement recommandée pointe vers Gemini 3.1 Flash Image, le modèle que la documentation désigne sous le nom de Nano Banana. Le modèle sortant acceptait 480 tokens de prompt et rendait une à quatre images selon la déclinaison, pour une dernière mise à jour datée de juin 2025 : quatorze mois, ce qui commence à faire une éternité dans cette catégorie. La coupure n'est pas un simple changement d'identifiant, l'appel de génération d'images ne passant plus par la même méthode côté bibliothèque, ce qui impose de reprendre le code appelant et non seulement la configuration. Elle s'inscrit dans une série resserrée : Imagen 3 arrêté en novembre 2025, les instantanés de préversion d'Imagen 4 retirés en février, et le GPT DALL·E débranché de ChatGPT le 30 août.

Note éditoriale

Un générateur d'images n'est pas un logiciel : c'est un service, et un service s'éteint. La leçon vaut moins pour les développeurs, qui ont l'habitude, que pour les studios ayant construit une identité visuelle sur les particularités d'un modèle — sa façon de traiter les peaux, les matières, les lumières rasantes. Ces particularités-là ne se documentent pas et ne se transfèrent pas : elles disparaissent avec l'endpoint. La seule parade tient dans l'archivage systématique des sorties et des graines, et dans l'habitude de ne jamais faire reposer une charte sur un modèle qu'on ne peut pas héberger.

Sources : Google AI for Developers — Imagen, Gemini API — Digital Applied — AI model releases, August 2026 tracker
The Erased Tapes Collection — Studio Takuya
The Erased Tapes Collection — Studio Takuya