TTS 음성 디자인 벤치마크

TTS 모델은 캐릭터를 얼마나 생생하게 살려낼까요?

자연어로 쓴 캐릭터 설명만으로 TTS 모델이 얼마나 설득력 있게 개성 있고 역할에 맞는 음성을 만들어내는지 측정하는 공개 벤치마크예요.

리더보드

음성 디자인 리더보드

순위모델
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

평가 지표

효과적인 캐릭터 음성 디자인을 재는 세 가지 척도

역할 적합도, 음성 다양성, 텍스트 합격률을 평가해요. 이 세 지표를 함께 보면 개별 클립의 완성도와 캐스트 전체의 폭을 모두 파악할 수 있어요.

GitHub에서 평가 스위트 받기

역할 적합도

생성된 음성이 해당 캐릭터의 것이라고 할 수 있는지를 봅니다. 평가자는 전체 역할 프로필에 비추어 나이, 음색, 기질, 연기를 함께 1점에서 5점으로 평가합니다. 텍스트 관문을 통과하지 못한 클립은 제외됩니다.

음성 다양성

생성된 캐스트 전체에서 음향적으로 구별되는 음성 군집의 개수입니다. 캐스트가 서로 다른 사람처럼 들리는지, 아니면 몇 개의 대표 음색으로 수렴하는지를 보여줍니다. 모델이 개별 프롬프트는 잘 따르면서도 같은 음성 몇 개를 반복해 쓸 수 있기 때문에 역할 적합도를 보완합니다.

텍스트 합격률

각 클립이 의도한 대사를 명확하게 말하는지를 음성 디자인 품질과 분리해 판정합니다. 사소한 발음이나 명료도 문제는 합격입니다. 눈에 띄는 대체, 누락, 삽입은 저하로 평가합니다. 대사를 고쳐 쓰거나 건너뛴 경우는 불합격입니다. 보고되는 점수는 합격으로 평가된 클립의 비율입니다.

데이터셋

이야기의 일곱 세계를 아우르는 캐릭터 1,000명

모든 과제는 CharacterCodex에서 선별했으며, 익명화한 캐릭터 프롬프트와 자연스러운 미리듣기 대본을 짝지어 알려진 이름이나 프랜차이즈에 기대지 않고도 개성 있는 음성을 만들어내는지 확인해요.

문학, 무대, 노랫말

18%

소설 • 희곡 • 단편 • 노래 • 시

사실, 뉴스, 연구 자료

17%

전기 · 다큐멘터리 · 신문 · 학술 논문 · 연구 저널

신화, 민담, 역사 설화

14%

신화 · 도시 전설 · 역사 문헌 · 민담 · 동화

일러스트와 애니메이션 매체

14%

만화 · 그래픽 노블 · 애니메이션 · 코믹스 · 웹코믹

게임과 인터랙티브 플레이

13%

비디오 게임 · 보드 게임 · 카드 게임 · 테이블탑 롤플레잉 게임

정기 간행물과 웹 매체

13%

잡지 · 블로그 · 온라인 기사

영화와 텔레비전

11%

영화 · TV 프로그램

차이를 들어 보세요

같은 캐릭터, 같은 대본. 어느 음성이 더 잘 어울릴까요?

음성 디자인 프롬프트

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

대본

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

음성 A

0:000:00

음성 B

0:000:00