Le tournant
De la création de contenu aux expériences d'IA vocale en temps réel
La première vague d'IA générative a transformé la création de contenu. Texte, images, vidéo et parole se produisent désormais à la demande : un prompt suffit pour transformer une idée en contenu. Ce contenu reste pourtant, le plus souvent, un objet fini, produit une fois puis consommé. La vague suivante apporte l'interactivité : l'IA vocale en temps réel anime des personnages, des jeux, des compagnons, des récits interactifs et des agents vocaux qui réagissent en continu à chaque utilisateur, à chaque contexte, à chaque instant.
Le contenu répond désormais en continu à ceux qui en font l'expérience.
Ce changement de paradigme élargit ce que l'on attend des voix IA de synthèse vocale : le naturel ne suffit plus. Une parole au son naturel reste le socle d'une expérience vocale de qualité, mais les expériences interactives ajoutent trois exigences :
Diversité
Donnez à chaque personnage une voix qui lui est propre.
Contrôlabilité
Adaptez chaque interprétation à mesure que l'intention et le contexte évoluent.
Faible latence
Préservez le rythme naturel de l'interaction.
Réunies, ces capacités permettent de concevoir une voix pour le personnage, de la diriger pour l'instant présent et de la restituer en temps réel.
Le nouveau modèle
Breeze TTS 2, un nouveau modèle de parole conçu pour les expériences interactives.
Breeze TTS 2 réunit dans un seul modèle le design de voix en langage naturel, la direction de voix applicable à n'importe quelle voix et la génération en streaming à faible latence. Conçu pour la nouvelle génération d'IA vocale en temps réel, il permet de concevoir n'importe quelle voix, de diriger chaque interprétation et de lui donner vie en temps réel.
Faire progresser ces capacités suppose aussi de mieux les mesurer. L'évaluation des systèmes TTS s'est historiquement concentrée sur le naturel, laissant le design de voix, la direction de voix et la latence bien moins explorés de façon systématique. Breeze TTS 2 rassemble ces capacités dans un modèle unique, pensé pour les expériences vocales interactives, et donne aux créateurs comme aux développeurs plus de contrôle sur la manière dont les voix sont conçues, interprétées et livrées en temps réel. Pour soutenir les progrès dans ces domaines, nous publions également des benchmarks open source pour le Design de voix, la Direction de voix et la latence. Voyons maintenant de plus près les quatre capacités qui définissent Breeze TTS 2 : design de voix, direction de voix, faible latence et parole multilingue.
Capacité 01
Design de voix — la bonne voix IA pour chaque personnage
Breeze TTS 2 donne à chaque personnage une voix bien à lui, du protagoniste unique aux milliers de PNJ. Plutôt que de s'en remettre aux seules bibliothèques de voix préexistantes, les créateurs décrivent le personnage qu'ils ont en tête et génèrent des voix IA de synthèse vocale singulières, mieux accordées à chaque rôle, à chaque personnalité et à chaque univers.
Breeze TTS 2
MiMo-V2.5-TTS
Inworld Voice Design
Fun-AudioGen-VD
Eleven v3
Qwen3-TTS-VD
VoxCPM2Breeze TTS 2 se classe premier au Benchmark TTS Design de voix : meilleur score Role Fit (78.02), plus grande Voice Diversity (708) et taux de Transcript Pass de 98.5%. Il devance le deuxième modèle de 5.24 points en Role Fit et produit 39% de voix distinctes de plus que son concurrent le plus proche.
Animation & Comics
PROMPT
Masculine, mature adult. Massive heavy-set alien. Deep, gravelly, resonant bass-baritone. Gruff, authoritative, commanding, drill-sergeant cadence. Fast, high-intensity. Rough, weathered, immense power, stern mentorship.
SCRIPT
Chest up, eyes forward. Space does not care if you're tired, scared, or homesick; it only rewards discipline. Stay on my count, recruit, and I'll drag a champion out of you yet.
Film & TV
PROMPT
Young adult female, mid-20s, American accent. Professional broadcast journalist turning frantic. Clear, articulate but strained by panic. High tension, rapid pace, breathless. Polished to raw desperation.
SCRIPT
This is Elena Vance, reporting live from the east block where the crowd just broke the barricade—if anyone can hear me, we need medical teams now, please, they're getting closer.
Games
PROMPT
Female, young adult, ethereal trickster. High-pitched, breathy, mischievous. Fast, rhythmic delivery with giggles. Mocking sing-song riddles. Playful, taunting, otherworldly.
SCRIPT
Oh, you heard the whisper too? Clever little heartbeat. Follow the violet shimmer if you dare, but mind your shadow, love. It tends to trade secrets when the veil grows thin.
Literature & Stage
PROMPT
Male, mid-20s to early 30s. Smooth velvety tenor-range speaking voice with a light rasp. Soulful and deeply emotive, shifting from weary struggle to optimistic conviction. Impeccable diction, gentle Southern lilt, deliberate pace, and broad expressive pitch arcs.
SCRIPT
I've walked through too many long nights to mistake silence for peace, so when I speak of tomorrow, believe me, brother, I mean a dawn we can finally stand in together.
Myth & Folklore
PROMPT
Mature nomadic storyteller. Weathered, resonant speaking voice with rhythmic pacing and expressive pitch contours. Wide dynamic range from hushed whispers to booming proclamations; soulful.
SCRIPT
Come closer to the fire, child; the wind is telling old truths tonight. Hear how it bends the grass, then remember this: every road you take is also taking measure of you.
Research & News
PROMPT
Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.
SCRIPT
We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.
Web & Periodical
PROMPT
Ancient male, massive scale. Deep, resonant bass, gravelly, subterranean. Slow, deliberate, aristocratic. Terrifying power, sibilant, predatory intelligence.
SCRIPT
Careful where you place your little hands, treasure-seeker; every coin in this vault knows its master, and I am not inclined to forgive even the smallest theft.
Capacité 02
Direction de voix — la bonne interprétation à chaque instant
Utilisez des instructions en langage naturel et des balises en ligne pour façonner l'émotion, l'intention, le rythme et la diction, tout en gardant chaque personnage reconnaissable. Créateurs et développeurs contrôlent ainsi plus finement l'interprétation d'une voix IA d'un instant à l'autre, sans avoir à reconcevoir la voix elle-même.
Breeze TTS 2
MiMo-v2.5-TTS
StepAudio 2.5 TTS
Qwen-Audio 3.0-TTS-Plus
Inworld TTS-2
VoxCPM2Breeze TTS 2 obtient le score de direction de voix le plus élevé (4.25), soit 13% de mieux que le deuxième modèle. Associé à un score SIM de 0.67, ce résultat démontre sa capacité à suivre une direction formulée en langage naturel — émotion, intention, rythme, diction — tout en gardant la voix choisie reconnaissable d'une interprétation à l'autre.
Communicative Intent
PROMPT
Speak with an alluring, hushed intensity, using a hypnotic and persuasive rhythm to draw the listener in and convince them to acquire a rare item.
SCRIPT
You feel the energy radiating from it, don't you? This isn't just a piece of quartz. It's a conduit. For a small offering, you can take it home and finally clear that dark cloud hanging over your future. Trust me, you need this.
REFERENCE
OUTPUT
Composition
PROMPT
Speaking while heavily out of breath and gasping for air, trying to reassure the listener that everything is fine.
SCRIPT
[gasps] I'm okay... [pants] just give me a second to catch my breath. [gasps] I promise, I'm completely fine... just ran a little too fast.
REFERENCE
OUTPUT
Emotion
PROMPT
The speaker sounds acerbic and bitter, delivering the lines with heavy, passive-aggressive sarcasm.
SCRIPT
Enjoy your vacation while I stay here and clean up the mess you left behind for me. Have a wonderful time.
REFERENCE
OUTPUT
Role
PROMPT
Speak with a gritty, swaggering, and theatrical tone, projecting an aggressive and boastful attitude of a seafaring marauder.
SCRIPT
Drop the anchor and bring out the gold! If any of you scallywags think about crossing me, you'll be swimming with the sharks before sunset. This ocean belongs to me!
REFERENCE
OUTPUT
Variation
PROMPT
Start with a confident, reassuring tone. At the word 'Wait', suddenly shift to terrified, breathless alarm as if reacting to a frightening noise.
SCRIPT
There's absolutely nothing to worry about, I've done this a hundred times before. Wait... did you hear that sound? Something's definitely not right here.
REFERENCE
OUTPUT
Capacité 03
Faible latence — l'IA vocale en temps réel à la vitesse de la conversation
Breeze TTS 2 réunit le naturel, le design de voix et la direction de voix dans un modèle unique à faible latence, conçu pour les applications d'IA vocale en temps réel. Un délai très court jusqu'au premier audio garde les conversations réactives et préserve le rythme naturel des expériences vocales interactives.
Breeze TTS 2 se classe premier au Benchmark de latence TTS, avec le délai jusqu'au premier audio le plus court à la fois en p50 et en p95. Sa latence durablement basse garde les interactions en temps réel réactives et préserve le rythme naturel de la conversation.
Breeze TTS 2 en streaming temps réel
L'API temps réel maintient une seule session WebSocket ouverte d'un tour de conversation à l'autre : vous ajoutez le texte au fil de son arrivée et l'audio PCM brut vous revient en flux pendant que le modèle génère encore.
import { BreezeBlueClient } from "@breeze.blue/sdk";
const client = new BreezeBlueClient();
// One WebSocket session, many conversation turns.
const connection = await client.textToSpeech.realtime.connect("voc_...", {
modelId: "breeze-tts-2",
});
const consumer = (async () => {
for await (const message of connection) {
if (message.type === "audio") {
play(message.audio); // raw PCM, streamed while the model generates
} else if (message.type === "turn.done") {
return;
}
}
})();
connection.startTurn("turn_1");
connection.appendText("Hello from Breeze TTS 2.");
connection.flush();
connection.endTurn();
await consumer;
connection.close();Capacité 04
Parole multilingue
Créez des voix IA de synthèse vocale naturelles et expressives dans 50 langues, avec un contrôle de l'accent pour adapter la diction aux différentes régions et aux différents publics.
Choisissez une langue
Every journey finds its meaning when someone dares to take the first step.
Original : Every journey finds its meaning when someone dares to take the first step.



