TTS 音声デザインベンチマーク

TTS モデルはキャラクターをどこまで生き生きと演じられるのか

自然言語のキャラクター説明から、TTS モデルがどれだけ説得力のある個性的で役柄に合った声を作れるかを測るオープンベンチマークです。

リーダーボード

音声デザインリーダーボード

順位モデル
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

評価指標

優れたキャラクター音声デザインを測る 3 つの指標

役柄適合、音声の多様性、テキスト合格率の 3 つを評価します。これらを合わせることで、1 本ごとの完成度とキャスト全体の幅の両方を捉えます。

GitHub で評価スイートを入手

役柄適合

生成された声がそのキャラクターのものと言えるかどうかです。評価者は役柄プロファイル全体に照らして、年齢、声質、気質、演技を合わせて 1 から 5 で採点します。テキスト判定を通過しなかったクリップは除外されます。

音声の多様性

生成されたキャスト全体で音響的に区別できる声のクラスタ数です。キャストが別々の人物に聞こえるのか、それとも少数の定番ボイスに収束してしまうのかが分かります。モデルは個々のプロンプトにうまく従いながら、同じ数種類の声を繰り返し使うことがあるため、この指標は役柄適合を補完します。

テキスト合格率

各クリップが指定されたセリフを明瞭に発話しているかを、音声デザインの品質とは切り離して判定します。軽微な発音や明瞭度の問題は合格とします。目立つ置換、脱落、挿入は劣化と評価します。書き換えられたセリフやスキップされたセリフは不合格です。掲載されるスコアは合格と評価されたクリップの割合です。

データセット

物語の 7 つの世界にまたがる 1,000 キャラクター

各タスクは CharacterCodex から精選され、匿名化されたキャラクタープロンプトと自然なプレビュー台本を組み合わせています。既知の名前や作品に頼らずに、個性的な声を作り出せるかを検証します。

文学・舞台・詩歌

18%

小説 • 戯曲 • 短編 • 楽曲 • 詩

事実・報道・研究の資料

17%

伝記 · ドキュメンタリー · 新聞 · 学術論文 · 研究誌

神話・伝承・歴史的説話

14%

神話 · 都市伝説 · 歴史文献 · 民間伝承 · おとぎ話

イラスト・アニメーション作品

14%

マンガ · グラフィックノベル · アニメ · アメコミ · ウェブコミック

ゲームとインタラクティブな遊び

13%

ビデオゲーム · ボードゲーム · カードゲーム · テーブルトーク RPG

雑誌とウェブメディア

13%

雑誌 · ブログ · オンライン記事

映画とテレビ

11%

映画 · テレビ番組

違いを聴く

同じキャラクター、同じ台本。どちらの声がより合っていますか

音声デザインプロンプト

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

台本

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

音声 A

0:000:00

音声 B

0:000:00