BENCHMARK DE LATÊNCIA DE TTS
Quão rápido os modelos de TTS começam a falar?
Um benchmark aberto que mede o tempo de ponta a ponta até o primeiro áudio em diferentes provedores de TTS, protocolos e três regiões de cliente nos EUA.
RANKING
Ranking de latência de TTS
| Provedor | Protocolo | TTFB p50 | TTFA p50 | TTFA p95 |
|---|---|---|---|---|
| Breeze TTS 2 | WS persistent | 119.4 ms | 133.6 ms | 163.3 ms |
| ElevenLabs Flash v2.5 | WS persistent | 134.8 ms | 154.5 ms | 207.6 ms |
| Fish Audio S2.1 Pro | HTTP warm pool | 173.6 ms | 175.3 ms | 271.4 ms |
| Inworld TTS-2 | WS persistent | 163.1 ms | 189.4 ms | 220.4 ms |
| Cartesia Sonic 3.5 | WS persistent | 106.8 ms | 241.9 ms | 344.2 ms |
| xAI TTS | WS persistent | 249.1 ms | 318.3 ms | 361.1 ms |
| Speechify Simba 3.2 | HTTP warm pool | 374.5 ms | 379.0 ms | 424.5 ms |
| Async Flash 1.5 | WS persistent | 247.0 ms | 438.1 ms | 479.6 ms |
| ElevenLabs v3 | HTTP warm pool | 544.0 ms | 628.7 ms | 917.9 ms |
MÉTRICAS
Medindo cada milissegundo antes de a fala começar.
Três métricas complementares separam o tempo de transporte do silêncio no áudio retornado, mostrando quando o provedor responde e quando o ouvinte realmente escuta a fala.
Tempo até o primeiro byte
Mede o tempo do início da requisição até o primeiro trecho de áudio recebido pelo cliente. Mensagens de controle e confirmações não contam.
Silêncio inicial
Mede o áudio decodificado entre o começo do stream retornado e o primeiro início de voz detectado. Isso revela modelos que retornam áudio rapidamente, mas atrasam a fala audível.
Tempo até o primeiro áudio
Mede o tempo do início da requisição até a primeira fala audível disponível para o cliente. Combina o tempo de entrega com o silêncio inicial do áudio retornado.
METODOLOGIA
40 prompts. 3 regiões dos EUA. Uma metodologia consistente.
Medimos a latência de inicialização do TTS no lado do cliente usando os mesmos 40 prompts em inglês para cada provedor. As requisições rodam em série a partir de US West, US Central e US East. Quando WebSocket e HTTP estão disponíveis, o benchmark reporta o protocolo mais rápido daquele provedor.
40
Prompts fixos em inglês
3
Regiões de cliente nos EUA
3
Aquecimentos por cliente regional
Como as medições são coletadas
Preparar cada provedor
Quando WebSocket e HTTP estão disponíveis, os dois são comparados, e o protocolo de menor latência é usado no relatório. Conexões persistentes e pools de conexão HTTP são estabelecidos com antecedência. Depois, cada cliente regional completa três requisições de aquecimento, que ficam de fora da medição.
Executar uma carga controlada
Cada provedor recebe os mesmos 40 prompts. Os prompts são as 40 entradas mais longas do Seed-TTS-Eval, criando uma carga mais representativa de produção do que frases de teste curtas.
Agregar e resumir
As amostras bem-sucedidas das três regiões são agregadas para calcular p50 e p95.
Condições de teste: O Breeze TTS 2 foi testado usando sua fila de maior prioridade. Todos os outros provedores foram testados em planos pagos.

