Le modèle musical ouvert de MiniMax
MiniMax a publié le 13 août les poids ouverts de Music 3, un modèle de génération musicale complet capable de produire des morceaux jusqu'à cinq minutes en WAV stéréo 32 kHz sur 16 bits. L'architecture abandonne le décodage depuis des tokens discrets : un LLM global de 8 milliards de paramètres, initialisé depuis Qwen3-8B, tient la structure sur la durée, pendant qu'un LLM local de 0,6 milliard travaille le détail acoustique image par image, avant un étage de flow matching de 2,4 milliards et un décodeur Flow-VAE de 123 millions. Les paroles s'écrivent avec des balises de structure explicites — [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Outro] — et la direction artistique passe par une légende structurée en trois sections : métadonnées globales (genre, tempo, tonalité, profil de production), détail vocal (timbre, interprétation, harmonies, effets) et arrangement (instruments, groove, spatialisation). ComfyUI a livré le support natif le jour même, en version 0.33.0, avec un template dédié et deux nœuds d'encodage. Les premiers tests indépendants rapportent des voix japonaises tenues sans accroc, et MiniMax annonce préparer dans la foulée un modèle image et un modèle d'upscaling vidéo.
Le vrai basculement n'est pas la durée mais la légende structurée : pour la première fois, un modèle musical ouvert accepte qu'on lui parle en termes de production plutôt qu'en adjectifs d'ambiance. Décrire un groove, une place de basse, une spatialisation, c'est le vocabulaire d'un arrangeur — et c'est exactement ce qui manquait aux boîtes noires commerciales, où l'on relance une graine en espérant mieux. Cinq minutes en local, sans quota ni conditions d'utilisation à relire, change aussi la nature du brouillon : on peut enfin se tromper cinquante fois sans compter.