BENCHMARK DE LATENCIA DE TTS

¿Con qué rapidez empiezan a hablar los modelos de TTS?

Un benchmark abierto que mide el tiempo de extremo a extremo hasta el primer audio en distintos proveedores de TTS, protocolos y tres regiones de cliente en EE. UU.

CLASIFICACIÓN

Clasificación de latencia de TTS

Datos de la clasificación de latencia de TTS
ProveedorProtocoloTTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

MÉTRICAS

Medimos cada milisegundo antes de que empiece el habla.

Tres métricas complementarias separan el tiempo de transporte del silencio del audio devuelto, y muestran cuándo responde un proveedor y cuándo el oyente escucha realmente el habla.

Obtener el conjunto de evaluación en GitHub

Tiempo hasta el primer byte

Mide el tiempo desde el inicio de la solicitud hasta el primer fragmento de audio que recibe el cliente. Los mensajes de control y las confirmaciones no cuentan.

Silencio inicial

Mide el audio decodificado entre el comienzo del flujo devuelto y el primer inicio de voz detectado. Así se identifican los modelos que devuelven audio rápido pero retrasan el habla audible.

Tiempo hasta el primer audio

Mide el tiempo desde el inicio de la solicitud hasta la primera habla audible disponible para el cliente. Combina el tiempo de entrega con el silencio inicial del audio devuelto.

METODOLOGÍA

40 prompts. 3 regiones de EE. UU. Una metodología consistente.

Medimos la latencia de arranque de TTS del lado del cliente usando los mismos 40 prompts en inglés para cada proveedor. Las solicitudes se ejecutan en serie desde US West, US Central y US East. Cuando hay WebSocket y HTTP disponibles, el benchmark reporta el protocolo más rápido de ese proveedor.

40

Prompts fijos en inglés

3

Regiones cliente en EE. UU.

3

Calentamientos por cliente regional

Cómo se toman las mediciones

Preparar cada proveedor

Cuando hay WebSocket y HTTP disponibles se comparan ambos, y se usa el protocolo de menor latencia para el reporte. Las conexiones persistentes y los pools de conexiones HTTP se establecen con antelación. Después, cada cliente regional completa tres solicitudes de calentamiento, que quedan excluidas de la medición.

Ejecutar una carga controlada

Cada proveedor recibe los mismos 40 prompts. Los prompts son las 40 entradas más largas de Seed-TTS-Eval, lo que crea una carga más representativa de producción que las frases de prueba cortas.

Agrupar y resumir

Las muestras exitosas de las tres regiones se agrupan para calcular p50 y p95.

Condiciones de prueba: Breeze TTS 2 se probó usando su cola de máxima prioridad. Todos los demás proveedores se probaron en planes de pago.