TTS 음성 디렉션 벤치마크

TTS 모델은 연기 지시를 얼마나 잘 따를까요?

제로샷 참조 음성에서 화자의 정체성을 유지하면서 TTS 모델이 자연어 연기 지시를 얼마나 안정적으로 따르는지 측정하는 공개 벤치마크예요.

리더보드

음성 디렉션 리더보드

음성 디렉션 점수(VDS)

순위모델
종합기초 제어상황 연기복합 지시SPK_SIM
1BreezeBlue logoBreeze TTS 2
4.254.294.344.120.67
2Xiaomi logoMiMo-v2.5-TTS
3.763.813.863.620.66
3StepFun logoStepAudio 2.5 TTS
3.483.663.513.280.64
4Qwen logoQwen-Audio 3.0-TTS-Plus
3.333.883.122.980.65
5Inworld logoInworld TTS-2
3.012.863.482.700.71
6OpenBMB logoVoxCPM2
2.492.512.772.190.70

평가 지표

효과적인 음성 디렉션을 재는 두 가지 지표

지시 이행과 화자 보존을 함께 평가합니다. 두 지표는 모델이 연기를 얼마나 바꿔 내는지, 그리고 원래 목소리를 얼마나 안정적으로 유지하는지를 보여 줍니다.

GitHub에서 평가 스위트 받기

음성 디렉션 점수

생성된 음성이 자연어 연기 지시를 얼마나 성공적으로 구현했는지 측정합니다. 명시된 요구 사항의 충족, 요청된 강도, 타이밍과 전환, 의도한 의미의 보존, 연기의 일관성과 실제 사용 가능성을 함께 고려해 5 점 척도로 종합 평가합니다.

화자 유사도

생성된 오디오가 참조 화자를 얼마나 잘 보존하는지 측정합니다. 화자 임베딩을 추출한 뒤 생성된 각 샘플과 해당 참조 음성 사이의 코사인 유사도를 계산합니다. 값이 높을수록 원래 목소리가 더 강하게 보존되었음을 뜻합니다.

데이터셋

700개 과제. 9개 축. 25개 음성.

9개 제어 축과 25개의 서로 다른 참조 음성에서 TTS 모델이 자연어 연기 지시를 얼마나 잘 따르는지 평가합니다. 화자와 지시, 상황이 달라져도 음성 제어가 일반화되는지 검증합니다.

Hugging Face 열기
700음성 디렉션 과제
9제어 축
25서로 다른 참조 음성

능력 그룹

기초 음성 제어

귀에 들리는 음성 특징의 직접 제어

억양50음향 속성100음성 이벤트50
200

상황 기반 보이스 연기

감정과 상태, 의도, 역할이 빚어내는 표현

감정150생리 상태50의사소통 의도50역할100
350

복합 지시

여러 제어를 결합하고 시간에 따라 표현을 바꾸는 지시

조합100변화50
150

차이를 들어 보기

어느 쪽이 음성 디렉션을 더 잘 따랐을까요?

음성 디렉션

A voice choking up, fighting against a tightening throat.

프리셋 음성

참조 화자 음성

스크립트

It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.

음성 A

0:000:00

음성 B

0:000:00