BENCHMARK TTS DIRECTION DE VOIX

Les modèles TTS savent-ils suivre une direction ?

Un benchmark ouvert qui mesure la fiabilité avec laquelle les modèles TTS suivent des instructions d’interprétation en langage naturel tout en préservant l’identité du locuteur à partir d’un audio de référence zero-shot.

CLASSEMENT

Classement de direction de voix

Score de direction de voix (VDS)

RangModèle
GlobalFondamentalSituationnelComplexeSPK_SIM
1BreezeBlue logoBreeze TTS 2
4.254.294.344.120.67
2Xiaomi logoMiMo-v2.5-TTS
3.763.813.863.620.66
3StepFun logoStepAudio 2.5 TTS
3.483.663.513.280.64
4Qwen logoQwen-Audio 3.0-TTS-Plus
3.333.883.122.980.65
5Inworld logoInworld TTS-2
3.012.863.482.700.71
6OpenBMB logoVoxCPM2
2.492.512.772.190.70

MÉTRIQUES

Deux mesures d’une direction de voix efficace

Nous évaluons le suivi de la direction et la préservation du locuteur. Ensemble, elles montrent à quel point un modèle transforme l’interprétation et avec quelle fiabilité il conserve la voix d’origine.

Obtenir la suite d’évaluation sur GitHub

Score de direction de voix

Mesure avec quel succès la parole générée réalise la direction formulée en langage naturel. L’évaluation utilise une échelle globale en cinq points qui prend en compte le respect des exigences explicites, l’intensité demandée, le rythme et les transitions, la préservation du sens visé, ainsi que la cohérence et l’utilisabilité pratique de l’interprétation.

Similarité du locuteur

Mesure dans quelle mesure l’audio généré préserve le locuteur de référence. Nous extrayons des embeddings de locuteur et calculons la similarité cosinus entre chaque échantillon généré et son audio de référence. Des valeurs plus élevées indiquent une préservation plus forte de la voix d’origine.

DATASET

700 cas. 9 axes. 25 voix.

Évaluez avec quelle fidélité les modèles TTS suivent une direction en langage naturel sur 9 axes de contrôle et 25 voix de référence distinctes. Le benchmark vérifie si le contrôle de la voix se généralise à différents locuteurs, instructions et scénarios.

Ouvrir Hugging Face
700Cas de direction de voix
9Axes de contrôle
25Voix de référence distinctes

Groupes de capacités

Contrôle fondamental de la parole

Contrôle direct des caractéristiques audibles de la parole

Accent50Attributs acoustiques100Événements vocaux50
200cas

Jeu vocal situationnel

Interprétation façonnée par l’émotion, l’état, l’intention et le rôle

Émotion150État physiologique50Intention communicative50Rôle100
350cas

Instruction complexe

Combiner plusieurs contrôles et faire évoluer l’interprétation dans le temps

Composition100Variation50
150cas

ÉCOUTEZ LA DIFFÉRENCE

Quel système suit le mieux la direction de voix ?

Direction de voix

A voice choking up, fighting against a tightening throat.

Voix prédéfinie

Audio du locuteur de référence

Script

It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.

Voix A

0:000:00

Voix B

0:000:00