IA Bulletin — 17 juin 2026

Ideogram 4.0 et le poids ouvert pour le design /
Lyria 3 et le morceau de trois minutes dans Gemini /
Stable Audio 3.0 en local et sous licence

Ideogram 4.0, le premier modèle d'image à poids ouverts pensé pour le design

Ideogram a publié le 3 juin son premier modèle texte-vers-image à poids ouverts, Ideogram 4.0, un Diffusion Transformer de 9,3 milliards de paramètres entraîné de zéro plutôt que dérivé d'un modèle existant. Sa singularité tient à une interface de prompt structurée en JSON, avec contrôle explicite de la mise en page par boîtes englobantes, gestion de la palette et rendu de texte multilingue parmi les plus fidèles du marché. Le modèle génère nativement en 2K et s'est hissé en tête du classement DesignArena parmi les modèles ouverts, derrière les seuls modèles fermés d'OpenAI et de Google. La nuance est juridique : le code d'inférence est sous licence Apache 2.0, mais les poids relèvent d'un accord non commercial qui réserve tout déploiement professionnel à une licence payante distincte. Pour un studio, l'intérêt n'est pas la magie d'une invite mais le contrôle d'un gabarit — typographie, zones et couleurs posées à l'avance —, une logique qui rapproche la génération du métier réel de mise en page et de conception graphique d'un album.

Note éditoriale

Le glissement le plus intéressant n'est pas l'ouverture des poids mais le déplacement du prompt vers le gabarit : décrire une intention cède la place à poser une structure. Là où le texte libre laisse le modèle improviser la composition, le JSON rend la mise en page négociable, inspectable, reproductible — exactement ce qu'un directeur artistique attend d'un outil de production.

Sources : i-scoop — Ideogram 4.0, open weight image model built for design — Build Fast with AI — Ideogram 4.0, best open-weight image model of 2026

Lyria 3 compose des morceaux de trois minutes directement dans Gemini

Google DeepMind a annoncé le 12 juin Lyria 3, son modèle de génération musicale le plus avancé, désormais accessible depuis l'application Gemini à partir d'une invite de texte ou d'image. La prouesse mise en avant est la capacité à tenir une structure cohérente sur près de trois minutes, là où la plupart des modèles perdent le fil au-delà de la minute. Chaque sortie embarque le filigrane SynthID, une signature inaudible destinée à identifier l'origine artificielle d'un morceau et à en tracer la diffusion. Google insiste sur une posture d'outil au service de la création, citant des collaborations avec des musiciens établis pour calibrer le modèle. La bataille s'est déplacée : après la qualité du rendu, c'est la durée tenue et la provenance vérifiable qui deviennent les terrains où se jouent les usages professionnels.

Note éditoriale

Tenir trois minutes n'est pas un détail de durée : c'est la différence entre une boucle d'ambiance et un morceau qui possède une introduction, un développement et une chute. Le filigrane SynthID, lui, dit autre chose — la valeur ne se loge plus seulement dans le son produit mais dans la traçabilité de son origine, un terrain où la machine documente désormais sa propre intervention.

Sources : AI Magazine — Lyria 3, Google DeepMind's high-fidelity sonic revolution — Google DeepMind — Models

Stable Audio 3.0 fait tourner la musique générative en local, sur des données sous licence

Stability AI a présenté Stable Audio 3.0, une famille de quatre modèles audio dont trois à poids ouverts, tous entraînés sur des données musicales intégralement sous licence. Les versions intermédiaire et large composent des pistes allant jusqu'à six minutes et vingt secondes, un horizon de durée rare dans la génération sonore. Un modèle plus léger écrit des morceaux complets directement sur un téléphone ou un ordinateur portable, sans aucune connexion au cloud. Les deux arguments combinés — exécution locale et corpus d'entraînement licencié — répondent précisément aux deux réserves qui freinent l'adoption des outils musicaux en studio. À l'heure où Suno reste empêtré dans ses litiges, la provenance des données d'entraînement devient un critère de choix au moins aussi décisif que la qualité du son.

Note éditoriale

Local et licencié forment un couple inattendu : l'un répond à la souveraineté technique, l'autre à la sécurité juridique, et c'est leur conjonction qui rend l'outil livrable à un client. La génération musicale cesse d'être un terrain d'expérimentation pour devenir une brique de production — à condition d'accepter que le critère décisif ne soit plus le timbre, mais d'où vient ce qui a servi à l'apprendre.

Sources : Music Business Worldwide — Stability AI launches new audio models — Stability AI — News
Moon Over Broadway — Studio Takuya
Moon Over Broadway — Studio Takuya