TTS 音色设计基准测试

TTS 模型能把角色演绎得多鲜活?

一个开放基准测试,衡量 TTS 模型根据自然语言角色描述,创造独特且贴合角色的声音的能力。

排行榜

音色设计排行榜

排名模型
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

评测指标

衡量角色音色设计的三个维度。

我们从角色契合度、音色多样性和文本通过率三方面评测。它们共同衡量单条表现与整套角色阵容的广度。

在 GitHub 获取评测套件

角色契合度

生成的声音是否真正属于这个角色。评审对照完整角色档案,从年龄、质感、性格与演绎方式综合给出 1–5 分。未通过文本关卡的样本不参与评分。

音色多样性

整套生成角色中声学上可区分的声音簇数量,反映这套角色听起来是不同的人,还是塌缩成少数几个「万能声线」。它与角色契合度互补:模型可能每条提示都执行得不错,却反复复用同几个声音。

文本通过率

每条音频是否清晰说出了指定台词,独立于音色设计质量单独评判。轻微发音或清晰度问题记为通过;明显替换、遗漏或插入记为降级;改写或跳过台词记为失败。报告分数为评为通过的样本占比。

数据集

1,000 个角色,横跨七大叙事世界

数据集精选自 CharacterCodex,每个任务将匿名化的角色提示与一段自然的预览台词配对——考察模型在不依赖知名角色与 IP 的前提下创造独特声音的能力。

文学、戏剧与诗歌

18%

小说 • 戏剧 • 短篇故事 • 歌曲 • 诗歌

纪实、新闻与研究来源

17%

传记 · 纪录片 · 报纸 · 科学论文 · 研究期刊

神话、民俗与历史传说

14%

神话 · 都市传说 · 历史文献 · 民间故事 · 童话

插画与动画媒体

14%

漫画 · 图像小说 · 动画 · 美漫 · 网络漫画

游戏与互动娱乐

13%

电子游戏 · 桌面游戏 · 卡牌游戏 · 桌上角色扮演

期刊与网络媒体

13%

杂志 · 博客 · 网络文章

影视

11%

电影 · 电视剧

听出差距

同一个角色,同一段台词,哪个声音更贴合?

音色设计提示

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

台词

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

声音 A

0:000:00

声音 B

0:000:00