BENCHMARK DE DIRECCIÓN DE VOZ TTS

¿Hasta qué punto siguen la dirección los modelos de TTS?

Un benchmark abierto que mide con qué fiabilidad los modelos de TTS siguen instrucciones de interpretación en lenguaje natural mientras preservan la identidad del hablante a partir de audio de referencia zero-shot.

CLASIFICACIÓN

Clasificación de dirección de voz

Puntuación de dirección de voz (VDS)

PuestoModelo
GlobalFundamentalSituacionalComplejoSPK_SIM
1BreezeBlue logoBreeze TTS 2
4.254.294.344.120.67
2Xiaomi logoMiMo-v2.5-TTS
3.763.813.863.620.66
3StepFun logoStepAudio 2.5 TTS
3.483.663.513.280.64
4Qwen logoQwen-Audio 3.0-TTS-Plus
3.333.883.122.980.65
5Inworld logoInworld TTS-2
3.012.863.482.700.71
6OpenBMB logoVoxCPM2
2.492.512.772.190.70

MÉTRICAS

Dos formas de medir una dirección de voz eficaz

Evaluamos el seguimiento de la dirección y la preservación del hablante. Juntas, reflejan hasta qué punto un modelo transforma la interpretación y con qué fiabilidad mantiene la voz original.

Obtener la suite de evaluación en GitHub

Puntuación de dirección de voz

Mide con cuánto éxito el habla generada cumple la dirección expresada en lenguaje natural. Usa una escala holística de cinco puntos que considera el cumplimiento de los requisitos explícitos, la intensidad solicitada, el momento y las transiciones, la preservación del sentido original, y la coherencia y la usabilidad práctica de la interpretación.

Similitud del hablante

Mide hasta qué punto el audio generado preserva al hablante de referencia. Extraemos embeddings de hablante y calculamos la similitud del coseno entre cada muestra generada y su audio de referencia. Los valores más altos indican una mayor preservación de la voz original.

DATASET

700 casos. 9 ejes. 25 voces.

Evalúa hasta qué punto los modelos de TTS siguen la dirección en lenguaje natural a lo largo de 9 ejes de control y 25 voces de referencia distintas. El benchmark comprueba si el control de la voz generaliza entre distintos hablantes, instrucciones y escenarios.

Abrir Hugging Face
700Casos de dirección de voz
9Ejes de control
25Voces de referencia distintas

Grupos de capacidades

Control fundamental del habla

Control directo de los rasgos audibles del habla

Acento50Atributos acústicos100Eventos vocales50
200casos

Actuación de voz situacional

Interpretación moldeada por la emoción, el estado, la intención y el rol

Emoción150Estado fisiológico50Intención comunicativa50Rol100
350casos

Instrucción compleja

Combinar varios controles y cambiar la interpretación a lo largo del tiempo

Composición100Variación50
150casos

ESCUCHA LA DIFERENCIA

¿Qué sistema sigue mejor la dirección de voz?

Dirección de voz

A voice choking up, fighting against a tightening throat.

Voz predefinida

Audio del hablante de referencia

Guion

It's just hard to say goodbye to this old house after living here for forty years and seeing everything change around us.

Voz A

0:000:00

Voz B

0:000:00