排行榜
TTS 延迟排行榜
| 提供商 | 协议 | TTFB p50 | TTFA p50 | TTFA p95 |
|---|---|---|---|---|
| Breeze TTS 2 | WS persistent | 119.4 ms | 133.6 ms | 163.3 ms |
| ElevenLabs Flash v2.5 | WS persistent | 134.8 ms | 154.5 ms | 207.6 ms |
| Fish Audio S2.1 Pro | HTTP warm pool | 173.6 ms | 175.3 ms | 271.4 ms |
| Inworld TTS-2 | WS persistent | 163.1 ms | 189.4 ms | 220.4 ms |
| Cartesia Sonic 3.5 | WS persistent | 106.8 ms | 241.9 ms | 344.2 ms |
| xAI TTS | WS persistent | 249.1 ms | 318.3 ms | 361.1 ms |
| Speechify Simba 3.2 | HTTP warm pool | 374.5 ms | 379.0 ms | 424.5 ms |
| Async Flash 1.5 | WS persistent | 247.0 ms | 438.1 ms | 479.6 ms |
| ElevenLabs v3 | HTTP warm pool | 544.0 ms | 628.7 ms | 917.9 ms |
评测指标
度量语音开始前的每一毫秒。
三个互补指标把传输耗时与返回音频开头的静音区分开来,既反映提供商何时开始响应,也反映听者何时真正听到语音。
首字节时间(TTFB)
衡量从请求开始到客户端收到第一个音频块的时间。控制消息与确认消息不计入。
初始静音(Initial Silence)
衡量返回流开头到检测出第一个语音起始点之间的已解码音频时长,用于识别音频返回很快、但可听语音姗姗来迟的模型。
首个可听音频时间(TTFA)
衡量从请求开始到客户端获得第一段可听语音的时间,由传输耗时与返回音频开头的静音共同构成。
评测方法
40 条提示词,3 个美国区域,一套一致的方法。
我们使用同一组 40 条英文提示词,测量各提供商的客户端 TTS 启动延迟。请求从 US West、US Central 与 US East 串行发起。当 WebSocket 与 HTTP 都可用时,基准报告该提供商更快的协议。
40
固定英文提示词
3
美国客户端区域
3
每区域客户端预热请求
测量如何采集
准备每个提供商
当 WebSocket 与 HTTP 都可用时会两者对比,并采用延迟更低的协议进行报告。持久连接与 HTTP 连接池会提前建立,每个区域客户端再完成三次预热请求,预热不计入计时。
运行受控负载
每个提供商接收完全相同的 40 条提示词。这些提示词是 Seed-TTS-Eval 中最长的 40 条,比简短的测试短语更贴近生产负载。
汇总并统计
三个区域的成功样本合并后计算 p50 与 p95。
测试条件: Breeze TTS 2 使用其最高优先级队列进行测试,其余提供商均在付费方案下测试。

