TTS 지연 시간 벤치마크

TTS 모델은 얼마나 빨리 말하기 시작할까요?

여러 TTS 제공업체와 프로토콜, 그리고 미국 내 3개 클라이언트 리전에 걸쳐 첫 오디오까지의 엔드투엔드 시간을 측정하는 공개 벤치마크입니다.

리더보드

TTS 지연 시간 리더보드

TTS 지연 시간 리더보드 데이터
제공업체프로토콜TTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

평가 지표

말이 시작되기 전의 모든 밀리초를 측정합니다.

세 가지 상호 보완적인 지표가 전송 시간과 반환된 오디오 앞부분의 무음을 분리해, 제공업체가 언제 응답하는지와 청자가 실제로 언제 음성을 듣는지를 함께 보여 줍니다.

GitHub에서 평가 스위트 받기

첫 바이트까지의 시간

요청 시작부터 클라이언트가 첫 오디오 청크를 받을 때까지의 시간을 측정합니다. 제어 메시지와 확인 응답은 포함하지 않습니다.

초기 무음

반환된 스트림의 시작부터 처음 감지된 음성 시작점까지의 디코딩된 오디오를 측정합니다. 오디오는 빠르게 반환하면서도 들리는 말은 늦게 시작하는 모델을 드러냅니다.

첫 오디오까지의 시간

요청 시작부터 클라이언트가 들을 수 있는 첫 음성을 얻을 때까지의 시간을 측정합니다. 전송 시간과 반환된 오디오 앞부분의 무음을 합한 값입니다.

평가 방법

프롬프트 40개, 미국 3개 리전, 하나의 일관된 방법.

모든 제공업체에 동일한 영어 프롬프트 40개를 사용해 클라이언트 측 TTS 시작 지연 시간을 측정합니다. 요청은 US West, US Central, US East에서 순차적으로 보냅니다. WebSocket과 HTTP를 모두 사용할 수 있는 경우, 벤치마크는 해당 제공업체에서 더 빠른 프로토콜을 보고합니다.

40

고정 영어 프롬프트

3

미국 클라이언트 리전

3

리전별 워밍업 요청

측정값 수집 방식

제공업체별 준비

WebSocket과 HTTP를 모두 사용할 수 있으면 두 가지를 비교하고, 지연 시간이 더 낮은 프로토콜을 보고에 사용합니다. 지속 연결과 HTTP 연결 풀은 미리 구성합니다. 이후 각 리전 클라이언트가 워밍업 요청을 세 번 수행하며, 이 요청은 측정에서 제외합니다.

통제된 부하 실행

모든 제공업체가 동일한 프롬프트 40개를 받습니다. 이 프롬프트는 Seed-TTS-Eval에서 가장 긴 40개 항목으로, 짧은 테스트 문장보다 실제 운영에 가까운 부하를 만듭니다.

취합 및 요약

세 리전의 성공 샘플을 모두 취합해 p50과 p95를 계산합니다.

테스트 조건: Breeze TTS 2는 최우선 순위 큐로 테스트했습니다. 그 외 제공업체는 모두 유료 플랜에서 테스트했습니다.