Breeze TTS : le suivi d'instructions au service de la génération vocale

Breeze TTS est le modèle de parole à suivi d'instructions de BreezeBlue, pensé pour un design de voix IA contrôlable, la direction de voix et la génération expressive.

Research Demo

Démo de la motivation de la recherche Breeze TTS

Chez BreezeBlue, nous repensons ce à quoi devrait ressembler l'avenir de l'intelligence audio.

Les technologies vocales précédentes excellent dans la copie. Mais la nouvelle génération d'IA vocale doit aller plus loin : comprendre la nuance, s'adapter aux contextes et rester contrôlable.

Breeze TTS est notre premier pas dans cette direction : un modèle génératif de parole qui porte le suivi d'instructions à l'état de l'art dans la génération vocale.

01

Notre motivation

La génération de parole a été optimisée pour le réalisme. Nous pensons qu'elle doit désormais l'être pour l'intention.

Le domaine a accompli d'énormes progrès en naturel, en constance du locuteur et en clonage de voix. Mais reproduire avec une haute fidélité n'est pas générer de façon contrôlable. Une voix au rendu parfait n'est pas toujours une voix qui sonne juste, qui colle au contexte ou qui suit la direction donnée.

D'autres domaines génératifs ont déjà pris ce virage. Dans la génération de langage et la génération visuelle, le suivi d'instructions est aujourd'hui une capacité centrale. Les utilisateurs attendent des modèles qu'ils répondent aux prompts avec précision, souplesse et amplitude. La génération de parole ne devrait pas faire exception.

Avec Breeze TTS, nous faisons du suivi d'instructions une capacité de premier plan pour la parole. L'objectif n'est pas seulement de produire un audio naturel, mais une parole que l'intention créative peut façonner : une voix définie par un persona, une interprétation modelée par le contexte et une diction qui change avec la scène.


02

Breeze TTS — un nouveau type de modèle de parole

Au cœur de Breeze TTS se trouve un modèle de langage audio bâti sur un grand modèle de langage pré-entraîné. Il est ensuite entraîné sur des séquences entrelaçant texte et audio, ce qui permet de modéliser les deux dans un seul et même flux. Dans cette formulation, le texte fournit les instructions et le script, tandis que l'audio sert à la fois de signal de conditionnement et de cible de génération.

Breeze TTS dispose ainsi d'une forte capacité de suivi d'instructions dans deux cas de figure : créer une voix inédite à partir du seul texte, et diriger l'interprétation d'une voix existante à partir d'un extrait de parole de référence.


2.1

Concevoir : créer une voix inédite à partir d'un prompt textuel

Breeze TTS associe une connaissance du monde à une solide compréhension du langage naturel. Il sait suivre des prompts textuels ouverts — qu'ils décrivent le persona, le ton, le scénario ou le style — et générer une voix conforme au personnage visé.

Acoustic-Parameter SpecificationDescriptive-Style DirectiveRole-Play
Character 1Character 2Character 3Character 4

Instructions

Concevoir : créer une voix inédite à partir d'un prompt textuel

Nous évaluons Breeze TTS sur InstructTTSEval, un benchmark qui mesure le contrôle du style par des instructions complexes en langage naturel dans la génération de parole. InstructTTSEval couvre trois types d'instructions : la spécification de paramètres acoustiques (APS), la directive de style descriptive (DSD) et le jeu de rôle (RP), avec 1K cas de test chacun. Breeze TTS y atteint l'état de l'art, démontrant sa capacité à comprendre des instructions complexes et à générer des voix variées. Sauf mention contraire, Gemini-3.1-pro fait office de juge d'évaluation : d'après notre évaluation humaine interne, il note de façon moins biaisée que Gemini-2.5-pro.


2.2

Diriger : demander à une voix existante d'adopter un nouveau style d'élocution

La direction de voix émerge naturellement de l'entraînement sur des données audio de longue durée. Breeze TTS peut suivre des instructions en langage naturel pour modifier le style d'élocution d'un extrait de parole de référence, tout en préservant l'identité du locuteur d'origine. Point important : l'intensité du guidage est réglable, ce qui permet d'arbitrer entre constance du locuteur et suivi d'instructions.

LedaSadachbiaSchedarVindemiatrix

Reference Voice

Scene 1Scene 2Scene 3

Instructions

Diriger : demander à une voix existante d'adopter un nouveau style d'élocution

Nous évaluons ce cas de figure sur InstructTTSEval. Pour chacun des 3K cas de test, nous tirons au hasard l'une des 30 voix préréglées de Gemini TTS comme référence one-shot de Breeze TTS. Nous faisons varier l'intensité du guidage au moment du test afin de mesurer l'arbitrage entre suivi d'instructions et constance du locuteur. Breeze TTS établit une frontière de Pareto à l'état de l'art en direction de voix, avec une tendance d'échelle nette : à niveau de suivi d'instructions égal, les modèles plus grands préservent mieux la constance du locuteur.


03

Essayez Breeze TTS

La génération de parole dépasse la reproduction pour aller vers la création, la direction et l'interaction. Avec Breeze TTS, nous faisons un premier pas vers des modèles de parole capables de suivre une intention, de s'adapter au contexte et d'ouvrir un éventail bien plus large d'expériences vocales.

Ce n'est qu'un début. Notre mission est de créer, par la recherche et les produits, la nouvelle génération d'expériences nativement audio. Nous sommes heureux de partager Breeze TTS avec les créateurs, les développeurs et les équipes qui explorent ce que ces expériences pourraient devenir.