BENCHMARK TTS DESIGN DE VOIX

Les modèles TTS savent-ils vraiment donner vie aux personnages ?

Un benchmark ouvert qui mesure avec quelle conviction les modèles TTS créent des voix singulières et fidèles au rôle à partir de descriptions de personnages en langage naturel.

CLASSEMENT

Classement Design de voix

RangModèle
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

MÉTRIQUES

Trois mesures d’un design de voix de personnage réussi.

Nous évaluons l’adéquation au rôle, la diversité des voix et la validation du texte. Ensemble, elles rendent compte à la fois de la performance individuelle et de l’étendue de toute la distribution.

Obtenir la suite d’évaluation sur GitHub

Adéquation au rôle

La voix générée appartient-elle vraiment au personnage ? Les évaluateurs notent conjointement l’âge, le grain, le tempérament et l’interprétation de 1 à 5 au regard du profil complet du rôle. Les extraits qui échouent à la validation du texte sont exclus.

Diversité des voix

Le nombre de groupes de voix acoustiquement distincts sur l’ensemble de la distribution générée. Cela révèle si la distribution donne l’impression de personnes différentes ou si elle se réduit à quelques voix maison. Cette mesure complète l’adéquation au rôle : un modèle peut bien suivre chaque prompt tout en réutilisant sans cesse les mêmes voix.

Validation du texte

Chaque extrait prononce-t-il clairement la réplique prévue ? Ce critère est jugé séparément de la qualité du design de voix. Les petits problèmes de prononciation ou de clarté sont validés. Les substitutions, omissions ou insertions notables sont classées comme dégradées. Les répliques réécrites ou omises échouent. Le score publié correspond à la part des extraits classés « validés ».

DATASET

1 000 personnages issus de sept univers narratifs

Issue de CharacterCodex, chaque tâche associe un prompt de personnage anonymisé à un texte de prévisualisation naturel — de quoi tester la création de voix singulières sans s’appuyer sur des noms ou des franchises connus.

Littérature, scène et œuvres lyriques

18%

Romans • Pièces de théâtre • Nouvelles • Chansons • Poésie

Sources factuelles, presse et recherche

17%

Biographies · Documentaires · Journaux · Articles scientifiques · Revues de recherche

Mythes, folklore et traditions historiques

14%

Mythologie · Légendes urbaines · Textes historiques · Folklore · Contes de fées

Médias illustrés et animés

14%

Mangas · Romans graphiques · Animés · Bandes dessinées · Webcomics

Jeux et divertissement interactif

13%

Jeux vidéo · Jeux de société · Jeux de cartes · Jeux de rôle sur table

Périodiques et médias en ligne

13%

Magazines · Blogs · Articles en ligne

Cinéma et télévision

11%

Films · Séries télévisées

ÉCOUTEZ LA DIFFÉRENCE

Même personnage. Même texte. Quelle voix colle le mieux ?

Prompt de Design de voix

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

Texte

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

Voix A

0:000:00

Voix B

0:000:00