TTS-LATENZ-BENCHMARK
Wie schnell fangen TTS-Modelle an zu sprechen?
Ein offener Benchmark, der die End-to-End-Zeit bis zum ersten Audio über TTS-Anbieter, Protokolle und drei US-Client-Regionen hinweg misst.
RANGLISTE
TTS-Latenz-Rangliste
| Anbieter | Protokoll | TTFB p50 | TTFA p50 | TTFA p95 |
|---|---|---|---|---|
| Breeze TTS 2 | WS persistent | 119.4 ms | 133.6 ms | 163.3 ms |
| ElevenLabs Flash v2.5 | WS persistent | 134.8 ms | 154.5 ms | 207.6 ms |
| Fish Audio S2.1 Pro | HTTP warm pool | 173.6 ms | 175.3 ms | 271.4 ms |
| Inworld TTS-2 | WS persistent | 163.1 ms | 189.4 ms | 220.4 ms |
| Cartesia Sonic 3.5 | WS persistent | 106.8 ms | 241.9 ms | 344.2 ms |
| xAI TTS | WS persistent | 249.1 ms | 318.3 ms | 361.1 ms |
| Speechify Simba 3.2 | HTTP warm pool | 374.5 ms | 379.0 ms | 424.5 ms |
| Async Flash 1.5 | WS persistent | 247.0 ms | 438.1 ms | 479.6 ms |
| ElevenLabs v3 | HTTP warm pool | 544.0 ms | 628.7 ms | 917.9 ms |
METRIKEN
Jede Millisekunde messen, bevor die Sprache einsetzt.
Drei sich ergänzende Metriken trennen die Übertragungszeit von der Stille im zurückgegebenen Audio und zeigen, wann ein Anbieter antwortet und wann Zuhörende tatsächlich Sprache hören.
Zeit bis zum ersten Byte
Misst die Zeit vom Start der Anfrage bis zum ersten Audio-Chunk, den der Client empfängt. Steuernachrichten und Bestätigungen zählen nicht mit.
Anfangsstille
Misst das dekodierte Audio zwischen dem Beginn des zurückgegebenen Streams und dem ersten erkannten Stimmeinsatz. Das deckt Modelle auf, die zwar schnell Audio liefern, hörbare Sprache aber verzögern.
Zeit bis zum ersten Audio
Misst die Zeit vom Start der Anfrage bis zur ersten hörbaren Sprache, die dem Client zur Verfügung steht. Diese Metrik kombiniert die Übertragungszeit mit der Stille am Anfang des zurückgegebenen Audios.
METHODIK
40 Prompts. 3 US-Regionen. Eine einheitliche Methodik.
Wir messen die clientseitige TTS-Startlatenz mit denselben 40 englischen Prompts für jeden Anbieter. Die Anfragen laufen seriell aus US West, US Central und US East. Wenn WebSocket und HTTP verfügbar sind, berichtet der Benchmark das schnellere Protokoll dieses Anbieters.
40
Feste englische Prompts
3
US-Client-Regionen
3
Aufwärmläufe pro Regions-Client
Wie die Messungen erhoben werden
Jeden Anbieter vorbereiten
Wenn WebSocket und HTTP verfügbar sind, werden beide verglichen, und das Protokoll mit der geringeren Latenz wird für den Bericht verwendet. Persistente Verbindungen und HTTP-Verbindungspools werden vorab aufgebaut. Danach absolviert jeder Regions-Client drei Aufwärmanfragen, die nicht in die Zeitmessung eingehen.
Eine kontrollierte Last fahren
Jeder Anbieter erhält dieselben 40 Prompts. Die Prompts sind die 40 längsten Einträge aus Seed-TTS-Eval und ergeben eine produktionsnähere Last als kurze Testsätze.
Zusammenführen und auswerten
Erfolgreiche Messungen aus allen drei Regionen werden zusammengeführt, um p50 und p95 zu berechnen.
Testbedingungen: Breeze TTS 2 wurde mit seiner Queue höchster Priorität getestet. Alle anderen Anbieter wurden mit kostenpflichtigen Tarifen getestet.
RESSOURCEN

