Breeze TTS 2 est n° 1 du classement TTS à poids ouverts d’Artificial Analysis

Breeze TTS 2 est le modèle de synthèse vocale à poids ouverts n° 1 de la Provider Voice Arena d’Artificial Analysis, avec un score Quality Elo de 1215 et 90 points d’avance sur le deuxième modèle à poids ouverts, sur la base de tests d’écoute humains en aveugle.

Breeze TTS 2 : n° 1 du classement des TTS à poids ouverts d’Artificial Analysis

Breeze TTS 2 est désormais le modèle de synthèse vocale à poids ouverts n° 1 du classement Provider Voice Arena d’Artificial Analysis, avec un score Quality Elo de 1215.

Dans l’instantané du classement du 26 août 2026, Breeze TTS 2 devançait tous les autres modèles TTS à poids ouverts évalués par Artificial Analysis. Il termine avec 90 points Elo d’avance sur Fish Audio S2 Pro, deuxième, et 113 points d’avance sur Step Audio EditX, troisième.

C’est une étape importante pour BreezeBlue et pour l’IA vocale à poids ouverts. Le classement repose sur les préférences d’auditeurs humains en aveugle, et non sur des scores choisis par les éditeurs ni sur des métriques audio automatisées ; il établit Breeze TTS 2 comme le modèle à poids ouverts le mieux noté de cette évaluation TTS indépendante.

Qu’est-ce que l’Arena TTS d’Artificial Analysis ?

L’Arena Text to Speech d’Artificial Analysis est un benchmark indépendant qui compare les modèles de génération de parole au moyen de tests d’écoute en aveugle, en face-à-face.

À chaque comparaison, les auditeurs entendent deux extraits audio générés à partir du même texte, sans savoir quels modèles les ont produits. Ils choisissent l’extrait qui leur semble le plus naturel, et Artificial Analysis agrège ces préférences en un score Quality Elo relatif. Plus le score Elo est élevé, plus les auditeurs ont préféré ce modèle par rapport aux autres modèles de l’Arena.

Le classement est conçu pour saisir la qualité de parole telle qu’elle est perçue par de vrais auditeurs. Cela recouvre des qualités telles que :

  • Le naturel

  • La qualité audio

  • La prononciation

  • Le rythme

  • La prosodie et l’expressivité

Pour la Provider Voice Arena, Artificial Analysis évalue chaque modèle à partir d’un ensemble représentatif de ses voix disponibles. L’objectif est de couvrir des voix masculines et féminines aux accents américain et britannique, avec jusqu’à huit voix par modèle. Le score obtenu reflète donc l’expérience globale des voix associées à chaque modèle, et non une seule démo triée sur le volet.

Artificial Analysis publie également le nombre d’échantillons, les intervalles de confiance, des filtres par catégorie et des filtres par accent pour aider les lecteurs à interpréter le classement. L’Elo est une mesure relative : les scores peuvent évoluer à mesure que de nouveaux votes sont collectés et que de nouveaux modèles entrent dans l’Arena.

Breeze TTS 2 en tête du classement à poids ouverts

Breeze TTS 2 s’élevant à la première place du classement TTS à poids ouverts d’Artificial Analysis
Breeze TTS 2 prend la première place du classement Provider Voice à poids ouverts d’Artificial Analysis.

Les cinq premiers modèles à poids ouverts de la Provider Voice Arena étaient :

RangModèleCréateurQuality Elo
1Breeze TTS 2BreezeBlue1215
2Fish Audio S2 ProFish Audio1125
3Step Audio EditX (March 2026)StepFun1102
4Voxtral TTSMistral1082
5Magpie-Multilingual 357MNVIDIA1066

Breeze TTS 2 conservait 90 points d’avance sur son concurrent à poids ouverts le plus proche. Dans un système fondé sur l’Elo, chaque score est déterminé par rapport aux préférences des auditeurs sur l’ensemble des modèles, ce qui fait de cet écart un signal significatif de la constance avec laquelle les auditeurs ont choisi Breeze TTS 2.

La Provider Voice Arena complète place aussi Breeze TTS 2 parmi les systèmes TTS les mieux notés toutes catégories confondues, aux côtés des meilleurs modèles propriétaires. Comme les scores de l’Arena sont mis à jour en continu à mesure que de nouveaux votes arrivent, l’image du classement complet ci-dessous reflète un instantané plus récent.

Breeze TTS 2 mis en évidence parmi les meilleurs modèles du classement complet Provider Voice Arena d’Artificial Analysis
Breeze TTS 2 figure parmi les cinq meilleurs modèles toutes catégories confondues dans cet instantané complet de la Provider Voice Arena.

Pourquoi cette première place compte

Nous pensons que les développeurs ne devraient pas avoir à choisir entre l’accessibilité et une qualité vocale exceptionnelle. Les modèles de parole à poids ouverts offrent plus de liberté pour inspecter, évaluer et exécuter un modèle dans l’infrastructure de son équipe, mais ils ont historiquement accusé un retard de qualité perçue face aux API commerciales les plus solides.

Le résultat d’Artificial Analysis dessine un autre tableau. Dans des comparaisons en aveugle, les auditeurs ont placé Breeze TTS 2 nettement devant le reste des modèles à poids ouverts, et dans le même groupe de tête que les meilleurs systèmes TTS propriétaires.

Ce classement est donc pertinent pour les équipes qui conçoivent :

  • Des agents vocaux conversationnels

  • Des personnages de jeux vidéo et d’animation

  • Des livres audio et des contenus narratifs

  • Des workflows de doublage IA et de localisation

  • Des podcasts et des outils pour créateurs

  • Des applications de service client

Pour ces produits, la parole doit faire plus que prononcer correctement les mots. Elle doit sonner naturelle, porter une intention, conserver une identité vocale convaincante et s’adapter au contexte de l’interaction. Les tests de préférence humaine sont précieux parce que les auditeurs jugent ces qualités ensemble, au lieu de les réduire à un seul signal automatisé.

Conçu pour créer une voix et diriger son interprétation

Nous avons conçu Breeze TTS 2 pour donner à chaque personnage la bonne voix et à chaque réplique la bonne interprétation. Il associe une qualité de parole très bien notée à des contrôles pour créer et diriger les voix :

  • Le [Design de voix](/voice-design) crée une voix distinctive à partir d’une description en langage naturel, sans audio de référence.

  • Le [Clonage de voix](/voice-cloning) utilise un audio de référence et sa transcription pour préserver le timbre, le rythme, l’émotion et le style d’un locuteur.

  • La Direction de voix utilise des instructions en langage naturel pour orienter le ton, l’émotion, le rythme et la diction, tout en gardant la voix de référence reconnaissable.

  • Les Événements vocaux ajoutent des moments expressifs comme des rires, des soupirs, des toux et des raclements de gorge directement dans le script.

  • Le streaming en temps réel prend en charge la génération audio en flux, avec un délai jusqu’au premier audio (TTFA) inférieur à 40 ms.

  • La génération en anglais et en chinois est prise en charge dans la version à poids ouverts.

Ces capacités font de Breeze TTS 2 bien plus qu’une collection de voix prédéfinies. Développeurs et créateurs peuvent concevoir un personnage, préserver son identité et diriger la façon dont il interprète une réplique donnée, le tout dans un seul et même modèle.

Le résultat de l’Arena ajoute un signal externe important à cet ensemble de capacités : lorsque les auditeurs ont comparé la parole générée sans connaître le nom du modèle, Breeze TTS 2 s’est imposé comme leur premier choix parmi les modèles à poids ouverts.

Une nouvelle référence pour l’IA vocale à poids ouverts

Aucun classement public ne peut représenter tous les scripts, tous les locuteurs, toutes les langues ni tous les environnements de production. Mais la préférence humaine en aveugle constitue l’un des tests les plus clairs de l’expérience qui compte le plus : la façon dont la voix générée sonne réellement à l’oreille d’un auditeur.

Ce résultat constitue un solide point de départ. Breeze TTS 2 a obtenu :

  • La première place parmi les modèles TTS à poids ouverts

  • Un score Quality Elo de 1215

  • 90 points d’avance sur le deuxième modèle à poids ouverts

Pour nous, ce résultat valide une idée fondatrice de Breeze TTS 2 : un modèle à poids ouverts peut produire une parole naturelle et expressive tout en donnant aux développeurs un contrôle plus poussé sur la création des voix, leur interprétation et leur déploiement.

Breeze TTS 2 est disponible dans BreezeBlue Creator et via l’API BreezeBlue. Les développeurs peuvent aussi accéder aux poids du modèle Breeze TTS 2 sur Hugging Face et au code d’inférence PyTorch officiel sur GitHub.

Sources

Écoutez le modèle vocal à poids ouverts n° 1

Concevez une voix, dirigez son interprétation et générez de la parole avec Breeze TTS 2 dans BreezeBlue Creator, via l’API ou à partir des poids ouverts.