排行榜
指令遵循排行榜
指令遵循得分(VDS)
排名模型
总分基础控制情境演绎复合指令SPK_SIM
1
Breeze TTS 2
Breeze TTS 24.254.294.344.120.67
2
MiMo-v2.5-TTS
MiMo-v2.5-TTS3.763.813.863.620.66
3
StepAudio 2.5 TTS
StepAudio 2.5 TTS3.483.663.513.280.64
4
Qwen-Audio 3.0-TTS-Plus
Qwen-Audio 3.0-TTS-Plus3.333.883.122.980.65
5
Inworld TTS-2
Inworld TTS-23.012.863.482.700.71
6
VoxCPM2
VoxCPM22.492.512.772.190.70
评测指标
衡量指令遵循的两个维度
我们从指令遵循与说话人保留两方面评测。它们共同衡量模型改变演绎的能力,以及保持原有音色的可靠程度。
指令遵循得分
衡量生成语音完成自然语言演绎指令的成功程度。采用整体化五分制,综合考量每项明确要求的完成度、要求的强度、时机与转换、原意的保留,以及演绎的连贯性与实际可用性。
说话人相似度
衡量生成音频对参考说话人的保留程度。我们提取说话人嵌入,计算每条生成样本与其参考音频的余弦相似度,数值越高表示对原声音的保留越强。
数据集
700 个任务,9 个维度,25 个声音。
评测 TTS 模型在 9 个可控性维度与 25 个不同参考声音上遵循自然语言演绎指令的能力,检验声音控制能否在不同说话人、指令与场景之间泛化。
700指令遵循任务
9可控性维度
25不同参考声音
能力分组
基础语音控制
对可听语音特征的直接控制
口音50声学属性100声音事件50
200个任务
情境声音演绎
由情绪、状态、意图与角色塑造的表达
情绪150生理状态50交流意图50角色100
350个任务
复合指令
组合多重控制并随时间改变演绎
组合100变化50
150个任务
听出差距
哪个系统更好地完成了演绎指令?
演绎指令
A voice choking up, fighting against a tightening throat.
预置声音
参考说话人音频
台词
It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.
声音 A
0:000:00
声音 B
0:000:00


