TTS-STIMMDESIGN-BENCHMARK

Wie gut erwecken TTS-Modelle Charaktere zum Leben?

Ein offener Benchmark, der misst, wie überzeugend TTS-Modelle aus Charakterbeschreibungen in natürlicher Sprache unverwechselbare, rollengerechte Stimmen erschaffen.

LEADERBOARD

Stimmdesign-Rangliste

RangModell
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

METRIKEN

Drei Maße für gelungenes Charakter-Stimmdesign.

Wir bewerten Rollenpassung, Stimmenvielfalt und Textprüfung. Zusammen erfassen sie sowohl die einzelne Leistung als auch die Bandbreite über die gesamte Besetzung.

Evaluation Suite auf GitHub holen

Rollenpassung

Ob die erzeugte Stimme wirklich zur Figur gehört. Die Prüfenden bewerten Alter, Klangfarbe, Temperament und Vortrag gemeinsam von 1 bis 5 anhand des vollständigen Rollenprofils. Clips, die die Textprüfung nicht bestehen, werden ausgeschlossen.

Stimmenvielfalt

Die Anzahl akustisch unterscheidbarer Stimmcluster über die gesamte erzeugte Besetzung. Das zeigt, ob die Besetzung nach verschiedenen Menschen klingt oder auf wenige Hausstimmen zusammenfällt. Es ergänzt die Rollenpassung, denn ein Modell kann einzelnen Prompts gut folgen und trotzdem immer wieder dieselben wenigen Stimmen verwenden.

Textprüfung

Ob jeder Clip seine vorgesehene Zeile klar spricht — getrennt von der Qualität des Stimmdesigns bewertet. Kleinere Aussprache- oder Verständlichkeitsprobleme bestehen. Auffällige Ersetzungen, Auslassungen oder Einfügungen gelten als beeinträchtigt. Umgeschriebene oder übersprungene Zeilen fallen durch. Der ausgewiesene Wert ist der Anteil der als bestanden bewerteten Clips.

DATASET

1.000 Charaktere aus sieben Welten des Erzählens

Kuratiert aus CharacterCodex, verbindet jede Aufgabe einen anonymisierten Charakter-Prompt mit einem natürlichen Vorschautext — so wird das Erschaffen unverwechselbarer Stimmen geprüft, ohne sich auf bekannte Namen oder Franchises zu stützen.

Literatur, Bühne und Lyrik

18%

Romane • Theaterstücke • Kurzgeschichten • Lieder • Lyrik

Sachtexte, Nachrichten und Forschung

17%

Biografien · Dokumentationen · Zeitungen · Wissenschaftliche Aufsätze · Fachzeitschriften

Mythos, Folklore und historische Überlieferung

14%

Mythologie · Moderne Sagen · Historische Texte · Volkskunde · Märchen

Illustrierte und animierte Medien

14%

Manga · Graphic Novels · Anime · Comics · Webcomics

Spiele und interaktives Spielen

13%

Videospiele · Brettspiele · Kartenspiele · Pen-and-Paper-Rollenspiele

Zeitschriften und Webmedien

13%

Magazine · Blogs · Onlineartikel

Film und Fernsehen

11%

Filme · Fernsehserien

HÖR DEN UNTERSCHIED

Gleiche Figur. Gleicher Text. Welche Stimme passt besser?

Stimmdesign-Prompt

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

Text

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

Stimme A

0:000:00

Stimme B

0:000:00