IA Bulletin — 27 septembre 2026

La voix sur mesure de Gemini 3.8 /
Le MIDI conversationnel de Suno Studio /
Les cent vingt images par seconde de Runway

La voix sur mesure de Gemini 3.8

Google a annoncé le 23 septembre deux nouveaux modèles vocaux, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, présentés comme les modèles de synthèse vocale les plus expressifs de la gamme Gemini. Le premier vise la direction créative fine : il permet de créer des voix entièrement inédites à partir d'une simple description en langage naturel et de diriger une performance ligne par ligne — rythme, émotion, accent, respiration. La bibliothèque embarque plus de 2 000 voix prêtes à l'emploi et peut reproduire un profil vocal cohérent à partir d'un échantillon audio de seulement 30 secondes, sous réserve de vérification du consentement. Les deux modèles couvrent plus de 100 langues et dialectes, avec des variantes régionales comme l'espagnol mexicain, le français québécois ou l'anglais écossais, et maintiennent leur qualité sur plusieurs heures de génération continue en dialogue à deux voix. Ils sont disponibles dès aujourd'hui via l'API Gemini et Google AI Studio pour les développeurs, arriveront prochainement sur Gemini Enterprise et sont déjà accessibles au grand public dans Gemini Notebook et Google Vids, pour des usages allant du livre audio au doublage en passant par les agents vocaux.

Note éditoriale

Faire naître une voix inédite depuis une simple phrase déplace le centre de gravité du casting vocal : le choix ne se fait plus parmi des comédiens existants, mais dans un espace de possibles généré à la demande. La vérification du consentement pour le clonage à partir de 30 secondes d'audio est un garde-fou nécessaire, mais elle ne dit rien de ce qui se passe une fois la voix clonée diffusée hors du cadre prévu.

Pour la production musicale et le doublage, la promesse d'une qualité stable sur plusieurs heures change surtout l'économie du travail : ce qui exigeait hier une session studio complète tient désormais dans un prompt et quelques ajustements de ligne. Reste à voir si l'oreille distingue encore, dans deux ans, une voix dirigée d'une voix vécue.

Sources : Google Blog — Gemini 3.8 text-to-speech says hello — Techmeme — Google releases Gemini 3.8 Flash TTS and Flash-Lite TTS

Le MIDI conversationnel de Suno Studio

Suno a mis à jour le 17 septembre son environnement de production Suno Studio, lancé en version 2.0 un mois plus tôt, avec une refonte de son moteur de transcription MIDI. La transcription gagne en vitesse et en précision, un point sensible pour tout musicien qui importe une mélodie jouée à la main et attend qu'elle soit retranscrite fidèlement en notes exploitables. Nouveauté plus notable : la barre de discussion de Suno Studio peut désormais générer de nouveaux stems audio à partir d'un simple clip MIDI, transformant une ligne mélodique écrite en piste sonore complète sur simple demande. Les clips peuvent également être renommés individuellement ou en groupe directement depuis cette même interface conversationnelle, sans repasser par les menus classiques d'un séquenceur. Cette mise à jour confirme la bascule de Suno vers un poste de travail complet plutôt qu'un simple générateur de morceaux, à mesure qu'il devient tout aussi courant de soigner la conception graphique d'une pochette d'album que la production du morceau lui-même.

Note éditoriale

Suno construit méthodiquement son passage du jukebox au studio complet, brique par brique — synthé, automations, MIDI, désormais un chat capable de générer une piste depuis une simple ligne mélodique. Le geste ressemble de plus en plus à celui d'un vrai producteur, mais la question de fond reste celle du matériau de départ : la v6 a été entraînée sur des données sous licence, un choix que Suno assume publiquement au moment même où les poursuites en droit d'auteur s'accumulent.

Pour un musicien qui travaille déjà en MIDI, l'intérêt est concret : transformer une esquisse mélodique en piste texturée sans quitter la fenêtre de chat change la vitesse d'itération, pas la nature du travail créatif en amont. C'est un outil de production, pas un raccourci vers l'inspiration.

Sources : Suno — Release Notes : Suno Studio, MIDI amélioré et plus — Music Business Worldwide — Suno launches Studio 2.0 with MIDI support

Les cent vingt images par seconde de Runway

Runway a ajouté le 17 septembre à son catalogue d'outils un modèle de retiming baptisé Enhance Frame Rate, capable de convertir n'importe quelle vidéo existante vers une nouvelle cadence d'images en générant les images intermédiaires manquantes. L'outil accepte des sources variées — une captation caméra, un montage déjà fini ou une vidéo produite par un autre modèle Runway — et ne se limite donc pas au contenu généré maison. Les cadences disponibles vont de 24 à 120 images par seconde, en passant par les standards broadcast 23,98, 29,97 et 59,94 fps, avec une résolution conservée jusqu'à 4K. Facturé 1 crédit pour 2 secondes de vidéo source quel que soit le débit d'images visé, l'outil revient à environ 1,50 dollar pour un clip de cinq minutes au tarif développeur de l'API, avec un plafond de 300 secondes par tâche. Runway recommande de segmenter les vidéos plus longues au niveau des coupes franches, faute de quoi le modèle peut produire des artefacts en tentant d'interpoler des images à travers un changement de plan brutal.

Note éditoriale

Interpoler des images pour lisser un mouvement n'est pas un geste neuf — les téléviseurs le font depuis quinze ans avec l'effet « soap opera » que tant de spectateurs détestent — mais l'appliquer à la demande, clip par clip, en change l'usage : ce n'est plus un réglage d'affichage subi, c'est une décision de montage assumée. Pour qui reçoit des rushes tournés à 24 fps et doit livrer en 60 ou 120, l'outil résout un problème réel sans repasser par une conversion logicielle dédiée.

La mise en garde sur les coupes franches rappelle que la technique reste une extrapolation statistique, pas une reconstruction fidèle du mouvement réel : elle fonctionne d'autant mieux que le plan est continu, et se dégrade précisément là où le montage exige de la précision.

Sources : Runway — Product Updates & Changelog — AlphaSignal — Runway Brings Broadcast Frame Rates up to 120fps to Its Video API
Passage — Studio Takuya
Passage — Studio Takuya