BENCHMARK DE LATÊNCIA DE TTS

Quão rápido os modelos de TTS começam a falar?

Um benchmark aberto que mede o tempo de ponta a ponta até o primeiro áudio em diferentes provedores de TTS, protocolos e três regiões de cliente nos EUA.

RANKING

Ranking de latência de TTS

Dados do ranking de latência de TTS
ProvedorProtocoloTTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

MÉTRICAS

Medindo cada milissegundo antes de a fala começar.

Três métricas complementares separam o tempo de transporte do silêncio no áudio retornado, mostrando quando o provedor responde e quando o ouvinte realmente escuta a fala.

Obter o conjunto de avaliação no GitHub

Tempo até o primeiro byte

Mede o tempo do início da requisição até o primeiro trecho de áudio recebido pelo cliente. Mensagens de controle e confirmações não contam.

Silêncio inicial

Mede o áudio decodificado entre o começo do stream retornado e o primeiro início de voz detectado. Isso revela modelos que retornam áudio rapidamente, mas atrasam a fala audível.

Tempo até o primeiro áudio

Mede o tempo do início da requisição até a primeira fala audível disponível para o cliente. Combina o tempo de entrega com o silêncio inicial do áudio retornado.

METODOLOGIA

40 prompts. 3 regiões dos EUA. Uma metodologia consistente.

Medimos a latência de inicialização do TTS no lado do cliente usando os mesmos 40 prompts em inglês para cada provedor. As requisições rodam em série a partir de US West, US Central e US East. Quando WebSocket e HTTP estão disponíveis, o benchmark reporta o protocolo mais rápido daquele provedor.

40

Prompts fixos em inglês

3

Regiões de cliente nos EUA

3

Aquecimentos por cliente regional

Como as medições são coletadas

Preparar cada provedor

Quando WebSocket e HTTP estão disponíveis, os dois são comparados, e o protocolo de menor latência é usado no relatório. Conexões persistentes e pools de conexão HTTP são estabelecidos com antecedência. Depois, cada cliente regional completa três requisições de aquecimento, que ficam de fora da medição.

Executar uma carga controlada

Cada provedor recebe os mesmos 40 prompts. Os prompts são as 40 entradas mais longas do Seed-TTS-Eval, criando uma carga mais representativa de produção do que frases de teste curtas.

Agregar e resumir

As amostras bem-sucedidas das três regiões são agregadas para calcular p50 e p95.

Condições de teste: O Breeze TTS 2 foi testado usando sua fila de maior prioridade. Todos os outros provedores foram testados em planos pagos.