ElevenLabs : Eleven v4 affine l’expression des voix IA
ElevenLabs présente Eleven v4, qui suit mieux les consignes d’émotion. Les démonstrations montrent ses nuances, mais le contrôle vocal reste imparfait.
Dans cet article
ElevenLabs, spécialiste de la génération de voix par IA, présente Eleven v4, son nouveau modèle de synthèse vocale. Il transforme du texte en parole, avec des consignes pour orienter l’interprétation. Ses démonstrations explorent les émotions, le rythme et les réactions vocales.
Le progrès demande toutefois une comparaison précise. La génération précédente savait déjà crier, chuchoter et jouer plusieurs personnages. L’enjeu concerne donc la finesse du rendu et la fiabilité des consignes.
V3 savait déjà jouer les émotions
Eleven v3 proposait déjà des balises d’émotion lors de son annonce, le 3 juin 2025. Ces indications ajoutées au texte orientent la manière de prononcer une réplique. Le modèle permettait aussi des dialogues à plusieurs voix.
Ses démonstrations comprenaient un commentaire sportif mêlant excitation et cris. Un monologue montrait des changements d’accent et des chuchotements. Ces registres expressifs existaient donc avant v4.
ElevenLabs précisait déjà que l’efficacité des balises dépendait de la voix et du contexte. Avec v4, l’entreprise annonce un suivi plus fidèle de ces indications. Elle reconnaît cependant que leur respect reste imparfait.
Les démonstrations de v4 élargissent les nuances de jeu
Le guide publié le 30 septembre 2026 présente une roue d’émotions accompagnée d’extraits de v4. Il montre aussi des variations de volume, de rythme, de réactions et d’effets sonores. Cette présentation permet d’explorer plusieurs dimensions d’une interprétation, au-delà d’une émotion isolée.
Les consignes peuvent combiner plusieurs qualités ou décrire librement une situation et un personnage. L’émotion demandée se prolonge dans la réplique jusqu’à une nouvelle indication. Pour une scène dialoguée, cela permet de diriger un passage entier sans répéter chaque consigne.
ElevenLabs indique aussi que v4 peut ajouter spontanément un bégaiement ou un grognement. Cette initiative peut enrichir un personnage. Elle demande une vérification lorsque la production exige une diction sans ajout.
La comparaison avec v2 éclaire surtout la narration
ElevenReader, l’application de lecture vocale d’ElevenLabs, présente des extraits comparant v4 à v2. Ils ont été générés en septembre 2026, avec les offres gratuites et les réglages par défaut. L’application attribue à v4 des pauses plus naturelles, un volume plus constant et une meilleure restitution du ton.
Ses réglages rendent le choix concret : Subtle utilise v2, tandis que Balanced et Expressive utilisent v4. Le lecteur peut donc choisir entre plusieurs rendus selon son goût pour l’interprétation.
Ces extraits comparent toutefois v4 à v2, et non directement à v3. Ils illustrent l’évolution de la narration, sans mesurer précisément le gain sur chaque capacité expressive de la génération précédente.
La voix choisie limite encore le contrôle des émotions
Une consigne fonctionne mieux lorsque le style demandé existe dans les données ayant servi à entraîner la voix. Un cri ou un chuchotement absent de ces données peut produire un résultat moins fiable. Le choix de la voix reste donc déterminant pour une scène.
Une balise peut aussi être comprise comme une demande d’effet sonore plutôt que de diction, ou inversement. Ni v4 ni v3 n’acceptent les balises SSML de pause, des instructions standardisées pour régler les silences. ElevenLabs recommande plutôt les balises audio, la ponctuation et la structure du texte.
La migration peut également modifier l’identité sonore perçue. Selon ElevenLabs, v4 reproduit plus fidèlement l’accent, la diction et le volume de l’enregistrement source. Mais une même voix peut sonner sensiblement différemment sous v3 et v4. L’entreprise reconnaît que certains utilisateurs peuvent préférer v3.
Le gain doit se vérifier sur la scène à produire
V4 offre davantage de nuances de direction et promet un meilleur respect des consignes. Les démonstrations donnent des pistes pour la narration et les personnages. Elles laissent à vérifier la régularité du résultat avec une voix et un texte précis.
Pour une production existante, comparer quelques passages représentatifs permet d’évaluer les émotions, les pauses et les ajouts spontanés. Cette vérification aide aussi à décider si le nouveau rendu conserve la voix attendue.
Sources
- elevenlabs.io /docs/overview/capabilities/text-to-speech/best-practices
- elevenlabs.io /blog/eleven-v3
- elevenlabs.io /blog/elevenlabs-audio-tags-list
- elevenreader.io /blog/introducing-elevenreader-v4
- elevenlabs.io /docs/overview/capabilities/text-to-speech/eleven-v4
- elevenlabs.io /blog/eleven-v3-is-now-generally-available