BENCHMARK DE DISEÑO DE VOZ TTS

¿Qué tan bien dan vida a los personajes los modelos TTS?

Un benchmark abierto que mide con cuánta convicción los modelos TTS crean voces distintivas y fieles al rol a partir de descripciones de personajes en lenguaje natural.

CLASIFICACIÓN

Clasificación de Diseño de voz

PuestoModelo
1BreezeBlue logoBreeze TTS 2
78.0270898.5%
2Xiaomi logoMiMo-V2.5-TTS
72.7820296.3%
3Inworld logoInworld Voice Design
64.6137898.2%
4FunAudioLLM logoFun-AudioGen-VD
63.8213698.6%
5ElevenLabs logoEleven v3
58.8811199.7%
6Alibaba logoQwen3-TTS-VD
58.488399.6%
7OpenBMB logoVoxCPM2
55.2850998.5%

MÉTRICAS

Tres medidas de un buen diseño de voz para personajes.

Evaluamos el ajuste al rol, la diversidad de voces y la aprobación de texto. En conjunto, capturan tanto el desempeño individual como el rango de todo el reparto.

Obtener la suite de evaluación en GitHub

Ajuste al rol

Si la voz generada le pertenece al personaje. Los evaluadores califican en conjunto la edad, la textura, el temperamento y la interpretación del 1 al 5 frente al perfil completo del rol. Se excluyen los clips que no superan el filtro de texto.

Diversidad de voces

La cantidad de grupos de voces acústicamente distintos en todo el reparto generado. Muestra si el reparto suena como personas diferentes o si colapsa en unas pocas voces genéricas. Complementa al ajuste al rol, porque un modelo puede seguir bien cada prompt y aun así reutilizar una y otra vez las mismas voces.

Aprobación de texto

Si cada clip dice con claridad la línea prevista, evaluado por separado de la calidad del diseño de voz. Los problemas menores de pronunciación o claridad se aprueban. Las sustituciones, omisiones o inserciones notorias se califican como degradadas. Las líneas reescritas u omitidas se reprueban. La puntuación reportada es la proporción de clips calificados como aprobados.

DATASET

1.000 personajes en siete mundos narrativos

Seleccionada de CharacterCodex, cada tarea combina un prompt de personaje anonimizado con un guion de vista previa natural: pone a prueba la creación de voces distintivas sin depender de nombres ni franquicias conocidos.

Literatura, teatro y obras líricas

18%

Novelas • Obras de teatro • Cuentos • Canciones • Poesía

Fuentes factuales, de noticias e investigación

17%

Biografías · Documentales · Periódicos · Artículos científicos · Revistas de investigación

Mito, folclore y tradición histórica

14%

Mitología · Leyendas urbanas · Textos históricos · Folclore · Cuentos de hadas

Medios ilustrados y animados

14%

Manga · Novelas gráficas · Anime · Cómics · Webcómics

Juegos y ocio interactivo

13%

Videojuegos · Juegos de mesa · Juegos de cartas · Juegos de rol de mesa

Medios periódicos y digitales

13%

Revistas · Blogs · Artículos en línea

Cine y televisión

11%

Películas · Series de televisión

ESCUCHA LA DIFERENCIA

Mismo personaje. Mismo guion. ¿Qué voz encaja mejor?

Prompt de Diseño de voz

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

Guion

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

Voz A

0:000:00

Voz B

0:000:00