TTS-STIMMREGIE-BENCHMARK

Wie gut befolgen TTS-Modelle Regieanweisungen?

Ein offener Benchmark, der misst, wie zuverlässig TTS-Modelle Regieanweisungen in natürlicher Sprache befolgen und dabei die Sprecheridentität aus Zero-Shot-Referenzaudio bewahren.

RANGLISTE

Stimmregie-Rangliste

Stimmregie-Score (VDS)

RangModell
GesamtGrundlagenSituativKomplexSPK_SIM
1BreezeBlue logoBreeze TTS 2
4.254.294.344.120.67
2Xiaomi logoMiMo-v2.5-TTS
3.763.813.863.620.66
3StepFun logoStepAudio 2.5 TTS
3.483.663.513.280.64
4Qwen logoQwen-Audio 3.0-TTS-Plus
3.333.883.122.980.65
5Inworld logoInworld TTS-2
3.012.863.482.700.71
6OpenBMB logoVoxCPM2
2.492.512.772.190.70

METRIKEN

Zwei Maße für wirksame Stimmregie

Wir bewerten die Befolgung der Regieanweisung und die Bewahrung der Stimme. Zusammen zeigen sie, wie stark ein Modell die Darbietung verändert und wie zuverlässig es die ursprüngliche Stimme beibehält.

Evaluations-Suite auf GitHub holen

Stimmregie-Score

Misst, wie erfolgreich die erzeugte Sprache die Regieanweisung in natürlicher Sprache umsetzt. Bewertet wird ganzheitlich auf einer Fünf-Punkte-Skala, die die Erfüllung der ausdrücklichen Vorgaben, die geforderte Intensität, Timing und Übergänge, die Bewahrung der beabsichtigten Bedeutung sowie die Stimmigkeit und praktische Verwendbarkeit der Darbietung berücksichtigt.

Sprecherähnlichkeit

Misst, wie gut das erzeugte Audio die Referenzstimme bewahrt. Wir extrahieren Sprecher-Embeddings und berechnen die Kosinus-Ähnlichkeit zwischen jeder erzeugten Probe und dem zugehörigen Referenzaudio. Höhere Werte bedeuten eine stärkere Bewahrung der ursprünglichen Stimme.

DATENSATZ

700 Fälle. 9 Achsen. 25 Stimmen.

Prüfe, wie gut TTS-Modelle Regieanweisungen in natürlicher Sprache über 9 Achsen der Steuerbarkeit und 25 verschiedene Referenzstimmen hinweg befolgen. Der Benchmark testet, ob sich die Stimmsteuerung über unterschiedliche Sprecher, Anweisungen und Szenarien hinweg verallgemeinern lässt.

Hugging Face öffnen
700Stimmregie-Fälle
9Achsen der Steuerbarkeit
25Verschiedene Referenzstimmen

Fähigkeitsgruppen

Grundlegende Sprachsteuerung

Direkte Steuerung hörbarer Sprachmerkmale

Akzent50Akustische Merkmale100Stimmlaute50
200Fälle

Situatives Stimmschauspiel

Darbietung, geprägt von Emotion, Zustand, Absicht und Rolle

Emotion150Physiologischer Zustand50Kommunikative Absicht50Rolle100
350Fälle

Komplexe Anweisung

Mehrere Steuerungen kombinieren und die Darbietung über die Zeit verändern

Komposition100Variation50
150Fälle

HÖR DEN UNTERSCHIED

Welches System folgt der Regieanweisung besser?

Regieanweisung

A voice choking up, fighting against a tightening throat.

Preset-Stimme

Audio der Referenzstimme

Skript

It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.

Stimme A

0:000:00

Stimme B

0:000:00