La voix sur mesure de Gemini 3.8
Google a annoncé le 23 septembre deux nouveaux modèles vocaux, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, présentés comme les modèles de synthèse vocale les plus expressifs de la gamme Gemini. Le premier vise la direction créative fine : il permet de créer des voix entièrement inédites à partir d'une simple description en langage naturel et de diriger une performance ligne par ligne — rythme, émotion, accent, respiration. La bibliothèque embarque plus de 2 000 voix prêtes à l'emploi et peut reproduire un profil vocal cohérent à partir d'un échantillon audio de seulement 30 secondes, sous réserve de vérification du consentement. Les deux modèles couvrent plus de 100 langues et dialectes, avec des variantes régionales comme l'espagnol mexicain, le français québécois ou l'anglais écossais, et maintiennent leur qualité sur plusieurs heures de génération continue en dialogue à deux voix. Ils sont disponibles dès aujourd'hui via l'API Gemini et Google AI Studio pour les développeurs, arriveront prochainement sur Gemini Enterprise et sont déjà accessibles au grand public dans Gemini Notebook et Google Vids, pour des usages allant du livre audio au doublage en passant par les agents vocaux.
Faire naître une voix inédite depuis une simple phrase déplace le centre de gravité du casting vocal : le choix ne se fait plus parmi des comédiens existants, mais dans un espace de possibles généré à la demande. La vérification du consentement pour le clonage à partir de 30 secondes d'audio est un garde-fou nécessaire, mais elle ne dit rien de ce qui se passe une fois la voix clonée diffusée hors du cadre prévu.
Pour la production musicale et le doublage, la promesse d'une qualité stable sur plusieurs heures change surtout l'économie du travail : ce qui exigeait hier une session studio complète tient désormais dans un prompt et quelques ajustements de ligne. Reste à voir si l'oreille distingue encore, dans deux ans, une voix dirigée d'une voix vécue.