BENCHMARK DE LATENCE TTS

À quelle vitesse les modèles TTS commencent-ils à parler ?

Un benchmark ouvert qui mesure le temps de bout en bout jusqu’au premier audio, à travers plusieurs fournisseurs de TTS, plusieurs protocoles et trois régions client aux États-Unis.

CLASSEMENT

Classement de latence TTS

Données du classement de latence TTS
FournisseurProtocoleTTFB p50TTFA p50TTFA p95
Breeze TTS 2WS persistent119.4 ms133.6 ms163.3 ms
ElevenLabs Flash v2.5WS persistent134.8 ms154.5 ms207.6 ms
Fish Audio S2.1 ProHTTP warm pool173.6 ms175.3 ms271.4 ms
Inworld TTS-2WS persistent163.1 ms189.4 ms220.4 ms
Cartesia Sonic 3.5WS persistent106.8 ms241.9 ms344.2 ms
xAI TTSWS persistent249.1 ms318.3 ms361.1 ms
Speechify Simba 3.2HTTP warm pool374.5 ms379.0 ms424.5 ms
Async Flash 1.5WS persistent247.0 ms438.1 ms479.6 ms
ElevenLabs v3HTTP warm pool544.0 ms628.7 ms917.9 ms

MÉTRIQUES

Mesurer chaque milliseconde avant que la parole commence.

Trois métriques complémentaires séparent le temps de transport du silence présent dans l’audio renvoyé, et montrent quand un fournisseur répond et quand l’auditeur entend réellement la parole.

Obtenir la suite d’évaluation sur GitHub

Temps jusqu’au premier octet

Mesure le temps écoulé entre le début de la requête et le premier fragment audio reçu par le client. Les messages de contrôle et les accusés de réception ne comptent pas.

Silence initial

Mesure l’audio décodé entre le début du flux renvoyé et la première attaque de voix détectée. Cela révèle les modèles qui renvoient l’audio rapidement mais retardent la parole audible.

Temps jusqu’au premier audio

Mesure le temps écoulé entre le début de la requête et la première parole audible mise à disposition du client. Cette métrique combine le temps de livraison et le silence en tête de l’audio renvoyé.

MÉTHODOLOGIE

40 prompts. 3 régions américaines. Une méthodologie cohérente.

Nous mesurons la latence de démarrage TTS côté client avec les mêmes 40 prompts en anglais pour chaque fournisseur. Les requêtes sont exécutées en série depuis US West, US Central et US East. Lorsque WebSocket et HTTP sont tous deux disponibles, le benchmark retient le protocole le plus rapide pour ce fournisseur.

40

Prompts anglais fixes

3

Régions client US

3

Préchauffages par client régional

Comment les mesures sont collectées

Préparer chaque fournisseur

Lorsque WebSocket et HTTP sont tous deux disponibles, ils sont comparés et le protocole le moins latent est retenu pour le rapport. Les connexions persistantes et les pools de connexions HTTP sont établis à l’avance. Chaque client régional effectue ensuite trois requêtes de préchauffage, exclues du chronométrage.

Exécuter une charge contrôlée

Chaque fournisseur reçoit les mêmes 40 prompts. Ces prompts sont les 40 entrées les plus longues de Seed-TTS-Eval, ce qui crée une charge plus représentative de la production que de courtes phrases de test.

Regrouper et synthétiser

Les échantillons réussis des trois régions sont regroupés pour calculer les p50 et p95.

Conditions de test : Breeze TTS 2 a été testé sur sa file d’attente la plus prioritaire. Tous les autres fournisseurs ont été testés sur des offres payantes.