IA Bulletin — 29 septembre 2026

Dix secondes pour une voix /
Kling 4.0 Flash et le plan de trente secondes /
Suno v6 et l'arbre empoisonné

Dix secondes pour une voix

ElevenLabs a lancé le 28 septembre Eleven v4 et Eleven v4 Turbo, deux modèles de synthèse vocale qui succèdent à la version 3 et couvrent désormais plus de 90 langues, contre 70 auparavant. Le gain de qualité le plus net concerne le japonais, le portugais brésilien, le mandarin et le cantonais, selon l'entreprise. Le contrôle de l'expression passe par des balises intégrées au texte, que l'on peut empiler et enchaîner, tandis que l'identité de la voix reste plus stable sur les passages longs. Le clonage d'une voix ne demande plus que dix secondes d'audio. La variante Turbo, à latence réduite, vise les agents vocaux : elle commence à produire du son dès que le modèle de langage amorce sa réponse.

Note éditoriale

Dix secondes d'enregistrement suffisent désormais à emprunter un timbre, alors qu'il en faut souvent vingt ans pour en construire un — l'affaire Tsuda de la veille en a donné la mesure. La progression annoncée sur le japonais, le mandarin et le cantonais déplace aussi la question : les voix les plus exposées ne sont plus seulement anglophones.

Les balises d'expression, empilables et enchaînables, ressemblent à une direction d'acteur écrite. Encore faut-il savoir ce que l'on veut entendre : une voix dirigée sans vision reste une voix moyenne, très bien articulée, ce que la statistique esthétique produit de mieux.

Sources : TechCrunch — ElevenLabs' new v4 speech model supports more expression control and 90 languages — Unite.AI — ElevenLabs Launches Eleven V4 With Low-Latency Turbo Variant — ElevenLabs — Eleven v4 and Eleven v4 Turbo

Kling 4.0 Flash et le plan de trente secondes

Kling a présenté le 28 septembre Kling 4.0 Flash, version rapide de son modèle vidéo 4.0, d'abord ouverte aux abonnés de l'offre Ultra annuelle, la version standard étant attendue en octobre. La famille 4.0 annonce des séquences natives allant jusqu'à 30 secondes, une sortie en 4K, jusqu'à 10 images clés et 15 références mêlant images, vidéo et son. L'audio passe en stéréo avec une synchronisation labiale améliorée, et le modèle permet de prolonger un plan sans tout régénérer ou de modifier après coup un mouvement de caméra, un style ou un fond. Les caractéristiques exactes de la variante Flash divergent selon les sources : certaines évoquent 20 secondes et du 720p seulement, d'autres reprennent les chiffres de la famille entière. Aucun tarif n'est précisé dans les sources consultées, si bien que le coût par seconde de vidéo reste à connaître.

Note éditoriale

Quinze références et dix images clés : le vocabulaire de la vidéo générative se rapproche du storyboard, avec ce que cela suppose d'exigence en amont. Un plan de trente secondes ne se pilote pas au hasard ; il demande un découpage, une lumière, une intention — une culture visuelle avant d'être une commande.

L'accès réservé à l'offre annuelle la plus chère et les chiffres contradictoires de la variante Flash invitent à la prudence : une fiche technique n'est pas un plan tourné. Le jugement viendra avec la version standard d'octobre, sur pièces.

Sources : HuggingNews — Kling AI Launches Kling 4.0 with 30 Second Video Generations — AI Post Hub — Kling 4.0 : 30 secondes, 10 images clés, 4K et Flash — Kling AI — annonce du 28 septembre 2026

Suno v6 et l'arbre empoisonné

Universal Music Group et Sony Music ont déposé le 18 septembre devant le tribunal fédéral du Massachusetts une seconde plainte contre Suno, visant cette fois Suno v6, lancé neuf jours plus tôt avec des accords de licence signés par Warner, BMG et Believe. Les plaignants recensent 60 202 enregistrements prétendument copiés et présentent v6 comme « le fruit du même arbre empoisonné », faute de rupture avec les modèles précédents entraînés sur leurs catalogues sans autorisation. Suno a confirmé le 22 septembre que v6 a été entraîné en partie sur les « créations » de ses utilisateurs, en plus de contenus sous licence et de signaux de préférence, ce qui élargit la description donnée jusque-là par sa direction produit. Cette action s'ajoute à la première plainte des deux majors, déposée en juin 2024 et toujours en cours, à l'accord de Warner avec la plateforme, à une décision allemande défavorable à Suno en juillet 2026 et à la plainte d'artistes menés par Jason Isbell pour exploitation d'identité. Aucune audience n'est fixée à ce stade, alors que ces catalogues rassemblent des albums dont la musique comme le parti pris visuel d'un album restent des œuvres d'auteurs identifiés.

Note éditoriale

Le dossier Suno cesse d'être une querelle de catalogue : la plainte vise la filiation entre modèles, l'idée qu'un entraînement propre puisse laver un entraînement antérieur. L'aveu d'un apprentissage sur les créations des utilisateurs rend la question circulaire — des sorties de modèle nourrissant le modèle suivant, et la moyenne qui se resserre à chaque tour.

Les accords de Warner, BMG et Believe montrent que l'industrie négocie autant qu'elle plaide. Reste, pour les musiciens indépendants qui ne siègent à aucune de ces tables, la même absence de voix dans une discussion qui porte pourtant sur leur matière.

Sources : Boston.com — Major record labels sue Cambridge-based AI platform, again — Music Business Worldwide — Suno confirms V6 model was trained on ‘creations’ from users — Music Ally — UMG and Sony Music file new Suno complaint over v6 models
Passion Octopus — Studio Takuya
Passion Octopus — Studio Takuya