TTS 延迟基准测试

TTS 模型多快能开口说话?

一个开放基准测试,跨多家 TTS 提供商、多种协议与三个美国客户端区域,测量端到端首个可听音频时间。

排行榜

TTS 延迟排行榜

TTS 延迟排行榜数据
提供商协议TTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

评测指标

度量语音开始前的每一毫秒。

三个互补指标把传输耗时与返回音频开头的静音区分开来,既反映提供商何时开始响应,也反映听者何时真正听到语音。

在 GitHub 获取评测套件

首字节时间(TTFB)

衡量从请求开始到客户端收到第一个音频块的时间。控制消息与确认消息不计入。

初始静音(Initial Silence)

衡量返回流开头到检测出第一个语音起始点之间的已解码音频时长,用于识别音频返回很快、但可听语音姗姗来迟的模型。

首个可听音频时间(TTFA)

衡量从请求开始到客户端获得第一段可听语音的时间,由传输耗时与返回音频开头的静音共同构成。

评测方法

40 条提示词,3 个美国区域,一套一致的方法。

我们使用同一组 40 条英文提示词,测量各提供商的客户端 TTS 启动延迟。请求从 US West、US Central 与 US East 串行发起。当 WebSocket 与 HTTP 都可用时,基准报告该提供商更快的协议。

40

固定英文提示词

3

美国客户端区域

3

每区域客户端预热请求

测量如何采集

准备每个提供商

当 WebSocket 与 HTTP 都可用时会两者对比,并采用延迟更低的协议进行报告。持久连接与 HTTP 连接池会提前建立,每个区域客户端再完成三次预热请求,预热不计入计时。

运行受控负载

每个提供商接收完全相同的 40 条提示词。这些提示词是 Seed-TTS-Eval 中最长的 40 条,比简短的测试短语更贴近生产负载。

汇总并统计

三个区域的成功样本合并后计算 p50 与 p95。

测试条件: Breeze TTS 2 使用其最高优先级队列进行测试,其余提供商均在付费方案下测试。