IA Bulletin — 7 octobre 2026

Suno Speech et la voix portée par sa musique /
ElevenLabs v4 au cœur de Runway /
Ideogram 4.5 et l'édition sans dérive

Suno Speech et la voix portée par sa musique

Le 1er octobre, Suno a lancé en bêta Speech, son premier modèle audio qui génère une voix parlée et une musique de fond originale en une seule prise. L'utilisateur saisit un texte, poème, idée ou note, puis choisit la voix et le style musical souhaités, directement dans la plateforme de Suno. Le modèle a d'abord été testé auprès d'un groupe restreint avant d'être ouvert à la communauté, et l'entreprise cite parmi ses usages les lectures dramatisées, les notes vocales enrichies, les méditations, les poèmes, les discours d'encouragement et les histoires du soir. L'annonce reconnaît des défauts de jeunesse : les accents britanniques peuvent « dériver vers l'Australie avant de revenir », et les pauses dramatiques peuvent l'être très dramatiquement. Suno présente ce modèle comme un pas hors de la chanson, vers un « divertissement créatif » où la voix et son habillage sonore naissent ensemble.

Note éditoriale

Une voix et son décor sonore livrés d'un seul bloc déplacent la frontière entre lecture, chanson et bande-son : le poème dit sur un lit musical devient un format à part entière.

Pour un musicien, la question est celle du mixage. Une voix et une musique nées ensemble ne se séparent pas, et le geste de studio qui pose l'une sur l'autre disparaît. Les accents qui errent rappellent que la bêta est une bêta.

Sources : Suno — Introducing Speech (beta) (1er octobre 2026) — AI Musicpreneur — Suno Speech Beta : spoken word et musique en une prise (octobre 2026)

ElevenLabs v4 au cœur de Runway

Runway a intégré ElevenLabs v4 à son application, de sorte que la narration et les dialogues de personnages se génèrent sans quitter l'espace de production vidéo. ElevenLabs a publié deux modèles : v4, orienté voix expressive pour la narration et le dialogue, que Runway reprend, et v4 Turbo, conçu pour les agents vocaux à faible latence. Le clonage de voix demande dix secondes d'audio de référence, une génération accepte jusqu'à 10 000 caractères avec un raccord de contexte pour les scripts plus longs, et la couverture passe à 90 langues, avec des progrès cités sur le japonais, le portugais brésilien, le mandarin et le cantonais. Dans les scènes à plusieurs voix, le modèle s'appuie sur le dialogue environnant pour régler la diction et le rythme. Les générations vocales consomment des crédits Runway, les développeurs pouvant aussi passer par l'API ElevenAPI, alors qu'il fallait jusqu'ici exporter les images vers ElevenLabs pour poser l'audio.

Note éditoriale

L'intégration compte moins par ses chiffres que par ce qu'elle supprime : l'aller-retour entre deux outils. Dix secondes d'audio suffisent à cloner une voix, qui devient un paramètre de montage parmi d'autres, réglé en crédits.

Le jugement de Tokyo évoqué hier vient de nommer la voix comme un attribut de la personne. L'outil, lui, la traite déjà comme une matière de timeline : l'écart entre les deux vitesses mérite d'être regardé.

Sources : AlphaSignal — Runway Brings ElevenLabs v4 Voice Into Its Visual Production Workflow (octobre 2026)

Ideogram 4.5 et l'édition sans dérive

Le 1er octobre, Ideogram a lancé la version 4.5 de son modèle, centrée sur l'édition multi-tours sans dérive d'image : les retouches répétées ne transforment plus le contenu de façon incontrôlée d'un passage à l'autre, ce qui compte pour une direction visuelle d'un disque retravaillée par itérations successives. Cette dérive, faite d'artefacts, de décalages de pixels et de changements de couleur non voulus, s'accumule d'ordinaire à chaque nouvelle consigne, et Ideogram affirme la réduire. Deux points d'accès API sont proposés, « Precise Edit » pour les modifications ciblées et « Generate + Edit » qui combine régénération et édition, avec une résolution native jusqu'à 2K et une démonstration sur des images de 24,2 mégapixels sans réduction préalable. Le modèle est accessible dans l'application, par l'API et chez des partenaires dont Picsart, Runway, Luma Labs et ComfyUI, à 0,008 à 0,22 dollar par image selon la qualité, de Turbo à High, et 0,03 à 0,10 dollar par édition. Un classement indépendant le place au 34e rang en génération texte-vers-image (1 014 points Elo) et au 23e en édition d'images.

Note éditoriale

Retoucher sans dériver est une promesse modeste et décisive : la plupart des images de travail sont des images retouchées dix fois. Les rangs (34e, 23e) décrivent un outil d'atelier plutôt qu'un champion de classement.

Sa présence dans ComfyUI, Runway et Picsart le place dans des chaînes déjà en place, là où l'on retouche au quotidien. Reste à vérifier, sur des séries longues, que la dérive annoncée comme réduite l'est vraiment.

Sources : Born City — Ideogram 4.5 : multi-turn editing contre la dérive d'image (octobre 2026) — OrcaRouter — Ideogram 4.5 launch, precise edit model (octobre 2026)
Rooftop view — Studio Takuya
Rooftop view — Studio Takuya