TTS-LATENZ-BENCHMARK

Wie schnell fangen TTS-Modelle an zu sprechen?

Ein offener Benchmark, der die End-to-End-Zeit bis zum ersten Audio über TTS-Anbieter, Protokolle und drei US-Client-Regionen hinweg misst.

RANGLISTE

TTS-Latenz-Rangliste

Daten der TTS-Latenz-Rangliste
AnbieterProtokollTTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

METRIKEN

Jede Millisekunde messen, bevor die Sprache einsetzt.

Drei sich ergänzende Metriken trennen die Übertragungszeit von der Stille im zurückgegebenen Audio und zeigen, wann ein Anbieter antwortet und wann Zuhörende tatsächlich Sprache hören.

Evaluierungs-Suite auf GitHub holen

Zeit bis zum ersten Byte

Misst die Zeit vom Start der Anfrage bis zum ersten Audio-Chunk, den der Client empfängt. Steuernachrichten und Bestätigungen zählen nicht mit.

Anfangsstille

Misst das dekodierte Audio zwischen dem Beginn des zurückgegebenen Streams und dem ersten erkannten Stimmeinsatz. Das deckt Modelle auf, die zwar schnell Audio liefern, hörbare Sprache aber verzögern.

Zeit bis zum ersten Audio

Misst die Zeit vom Start der Anfrage bis zur ersten hörbaren Sprache, die dem Client zur Verfügung steht. Diese Metrik kombiniert die Übertragungszeit mit der Stille am Anfang des zurückgegebenen Audios.

METHODIK

40 Prompts. 3 US-Regionen. Eine einheitliche Methodik.

Wir messen die clientseitige TTS-Startlatenz mit denselben 40 englischen Prompts für jeden Anbieter. Die Anfragen laufen seriell aus US West, US Central und US East. Wenn WebSocket und HTTP verfügbar sind, berichtet der Benchmark das schnellere Protokoll dieses Anbieters.

40

Feste englische Prompts

3

US-Client-Regionen

3

Aufwärmläufe pro Regions-Client

Wie die Messungen erhoben werden

Jeden Anbieter vorbereiten

Wenn WebSocket und HTTP verfügbar sind, werden beide verglichen, und das Protokoll mit der geringeren Latenz wird für den Bericht verwendet. Persistente Verbindungen und HTTP-Verbindungspools werden vorab aufgebaut. Danach absolviert jeder Regions-Client drei Aufwärmanfragen, die nicht in die Zeitmessung eingehen.

Eine kontrollierte Last fahren

Jeder Anbieter erhält dieselben 40 Prompts. Die Prompts sind die 40 längsten Einträge aus Seed-TTS-Eval und ergeben eine produktionsnähere Last als kurze Testsätze.

Zusammenführen und auswerten

Erfolgreiche Messungen aus allen drei Regionen werden zusammengeführt, um p50 und p95 zu berechnen.

Testbedingungen: Breeze TTS 2 wurde mit seiner Queue höchster Priorität getestet. Alle anderen Anbieter wurden mit kostenpflichtigen Tarifen getestet.