BENCHMARK DE LATENCIA DE TTS
¿Con qué rapidez empiezan a hablar los modelos de TTS?
Un benchmark abierto que mide el tiempo de extremo a extremo hasta el primer audio en distintos proveedores de TTS, protocolos y tres regiones de cliente en EE. UU.
CLASIFICACIÓN
Clasificación de latencia de TTS
| Proveedor | Protocolo | TTFB p50 | TTFA p50 | TTFA p95 |
|---|---|---|---|---|
| Breeze TTS 2 | WS persistent | 119.4 ms | 133.6 ms | 163.3 ms |
| ElevenLabs Flash v2.5 | WS persistent | 134.8 ms | 154.5 ms | 207.6 ms |
| Fish Audio S2.1 Pro | HTTP warm pool | 173.6 ms | 175.3 ms | 271.4 ms |
| Inworld TTS-2 | WS persistent | 163.1 ms | 189.4 ms | 220.4 ms |
| Cartesia Sonic 3.5 | WS persistent | 106.8 ms | 241.9 ms | 344.2 ms |
| xAI TTS | WS persistent | 249.1 ms | 318.3 ms | 361.1 ms |
| Speechify Simba 3.2 | HTTP warm pool | 374.5 ms | 379.0 ms | 424.5 ms |
| Async Flash 1.5 | WS persistent | 247.0 ms | 438.1 ms | 479.6 ms |
| ElevenLabs v3 | HTTP warm pool | 544.0 ms | 628.7 ms | 917.9 ms |
MÉTRICAS
Medimos cada milisegundo antes de que empiece el habla.
Tres métricas complementarias separan el tiempo de transporte del silencio del audio devuelto, y muestran cuándo responde un proveedor y cuándo el oyente escucha realmente el habla.
Tiempo hasta el primer byte
Mide el tiempo desde el inicio de la solicitud hasta el primer fragmento de audio que recibe el cliente. Los mensajes de control y las confirmaciones no cuentan.
Silencio inicial
Mide el audio decodificado entre el comienzo del flujo devuelto y el primer inicio de voz detectado. Así se identifican los modelos que devuelven audio rápido pero retrasan el habla audible.
Tiempo hasta el primer audio
Mide el tiempo desde el inicio de la solicitud hasta la primera habla audible disponible para el cliente. Combina el tiempo de entrega con el silencio inicial del audio devuelto.
METODOLOGÍA
40 prompts. 3 regiones de EE. UU. Una metodología consistente.
Medimos la latencia de arranque de TTS del lado del cliente usando los mismos 40 prompts en inglés para cada proveedor. Las solicitudes se ejecutan en serie desde US West, US Central y US East. Cuando hay WebSocket y HTTP disponibles, el benchmark reporta el protocolo más rápido de ese proveedor.
40
Prompts fijos en inglés
3
Regiones cliente en EE. UU.
3
Calentamientos por cliente regional
Cómo se toman las mediciones
Preparar cada proveedor
Cuando hay WebSocket y HTTP disponibles se comparan ambos, y se usa el protocolo de menor latencia para el reporte. Las conexiones persistentes y los pools de conexiones HTTP se establecen con antelación. Después, cada cliente regional completa tres solicitudes de calentamiento, que quedan excluidas de la medición.
Ejecutar una carga controlada
Cada proveedor recibe los mismos 40 prompts. Los prompts son las 40 entradas más largas de Seed-TTS-Eval, lo que crea una carga más representativa de producción que las frases de prueba cortas.
Agrupar y resumir
Las muestras exitosas de las tres regiones se agrupan para calcular p50 y p95.
Condiciones de prueba: Breeze TTS 2 se probó usando su cola de máxima prioridad. Todos los demás proveedores se probaron en planes de pago.
RECURSOS

