TTS 指令遵循开放基准测试

TTS 模型能多好地听从演绎指令?

一个开放基准测试,衡量 TTS 模型在零样本参考音频下遵循自然语言演绎指令、同时保留说话人音色的可靠程度。

排行榜

指令遵循排行榜

指令遵循得分(VDS)

排名模型
总分基础控制情境演绎复合指令SPK_SIM
1BreezeBlue logoBreeze TTS 2
4.254.294.344.120.67
2Xiaomi logoMiMo-v2.5-TTS
3.763.813.863.620.66
3StepFun logoStepAudio 2.5 TTS
3.483.663.513.280.64
4Qwen logoQwen-Audio 3.0-TTS-Plus
3.333.883.122.980.65
5Inworld logoInworld TTS-2
3.012.863.482.700.71
6OpenBMB logoVoxCPM2
2.492.512.772.190.70

评测指标

衡量指令遵循的两个维度

我们从指令遵循与说话人保留两方面评测。它们共同衡量模型改变演绎的能力,以及保持原有音色的可靠程度。

在 GitHub 获取评测套件

指令遵循得分

衡量生成语音完成自然语言演绎指令的成功程度。采用整体化五分制,综合考量每项明确要求的完成度、要求的强度、时机与转换、原意的保留,以及演绎的连贯性与实际可用性。

说话人相似度

衡量生成音频对参考说话人的保留程度。我们提取说话人嵌入,计算每条生成样本与其参考音频的余弦相似度,数值越高表示对原声音的保留越强。

数据集

700 个任务,9 个维度,25 个声音。

评测 TTS 模型在 9 个可控性维度与 25 个不同参考声音上遵循自然语言演绎指令的能力,检验声音控制能否在不同说话人、指令与场景之间泛化。

打开 Hugging Face
700指令遵循任务
9可控性维度
25不同参考声音

能力分组

基础语音控制

对可听语音特征的直接控制

口音50声学属性100声音事件50
200个任务

情境声音演绎

由情绪、状态、意图与角色塑造的表达

情绪150生理状态50交流意图50角色100
350个任务

复合指令

组合多重控制并随时间改变演绎

组合100变化50
150个任务

听出差距

哪个系统更好地完成了演绎指令?

演绎指令

A voice choking up, fighting against a tightening throat.

预置声音

参考说话人音频

台词

It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.

声音 A

0:000:00

声音 B

0:000:00