Présentation de Breeze TTS 2

Concevez n'importe quelle voix. Dirigez chaque interprétation. En temps réel.

Voici Breeze TTS 2, notre nouveau modèle vocal phare

Le tournant

De la création de contenu aux expériences d'IA vocale en temps réel

La première vague d'IA générative a transformé la création de contenu. Texte, images, vidéo et parole se produisent désormais à la demande : un prompt suffit pour transformer une idée en contenu. Ce contenu reste pourtant, le plus souvent, un objet fini, produit une fois puis consommé. La vague suivante apporte l'interactivité : l'IA vocale en temps réel anime des personnages, des jeux, des compagnons, des récits interactifs et des agents vocaux qui réagissent en continu à chaque utilisateur, à chaque contexte, à chaque instant.

Le contenu répond désormais en continu à ceux qui en font l'expérience.

Ce changement de paradigme élargit ce que l'on attend des voix IA de synthèse vocale : le naturel ne suffit plus. Une parole au son naturel reste le socle d'une expérience vocale de qualité, mais les expériences interactives ajoutent trois exigences :

Diversité

Donnez à chaque personnage une voix qui lui est propre.

Contrôlabilité

Adaptez chaque interprétation à mesure que l'intention et le contexte évoluent.

Faible latence

Préservez le rythme naturel de l'interaction.

Réunies, ces capacités permettent de concevoir une voix pour le personnage, de la diriger pour l'instant présent et de la restituer en temps réel.


Le nouveau modèle

Breeze TTS 2, un nouveau modèle de parole conçu pour les expériences interactives.

Breeze TTS 2 réunit dans un seul modèle le design de voix en langage naturel, la direction de voix applicable à n'importe quelle voix et la génération en streaming à faible latence. Conçu pour la nouvelle génération d'IA vocale en temps réel, il permet de concevoir n'importe quelle voix, de diriger chaque interprétation et de lui donner vie en temps réel.

Faire progresser ces capacités suppose aussi de mieux les mesurer. L'évaluation des systèmes TTS s'est historiquement concentrée sur le naturel, laissant le design de voix, la direction de voix et la latence bien moins explorés de façon systématique. Breeze TTS 2 rassemble ces capacités dans un modèle unique, pensé pour les expériences vocales interactives, et donne aux créateurs comme aux développeurs plus de contrôle sur la manière dont les voix sont conçues, interprétées et livrées en temps réel. Pour soutenir les progrès dans ces domaines, nous publions également des benchmarks open source pour le Design de voix, la Direction de voix et la latence. Voyons maintenant de plus près les quatre capacités qui définissent Breeze TTS 2 : design de voix, direction de voix, faible latence et parole multilingue.


Capacité 01

Design de voix — la bonne voix IA pour chaque personnage

Breeze TTS 2 donne à chaque personnage une voix bien à lui, du protagoniste unique aux milliers de PNJ. Plutôt que de s'en remettre aux seules bibliothèques de voix préexistantes, les créateurs décrivent le personnage qu'ils ont en tête et génèrent des voix IA de synthèse vocale singulières, mieux accordées à chaque rôle, à chaque personnalité et à chaque univers.

#1 du Benchmark TTS Design de voix
RangModèle
Role FitVoice Diversity
1Breeze TTS 2
78.02708
2MiMo-V2.5-TTS
72.78202
3Inworld Voice Design
64.61378
4Fun-AudioGen-VD
63.82136
5Eleven v3
58.88111
6Qwen3-TTS-VD
58.4883
7VoxCPM2
55.28509

Breeze TTS 2 se classe premier au Benchmark TTS Design de voix : meilleur score Role Fit (78.02), plus grande Voice Diversity (708) et taux de Transcript Pass de 98.5%. Il devance le deuxième modèle de 5.24 points en Role Fit et produit 39% de voix distinctes de plus que son concurrent le plus proche.

Animation & Comics

PROMPT

Masculine, mature adult. Massive heavy-set alien. Deep, gravelly, resonant bass-baritone. Gruff, authoritative, commanding, drill-sergeant cadence. Fast, high-intensity. Rough, weathered, immense power, stern mentorship.

SCRIPT

Chest up, eyes forward. Space does not care if you're tired, scared, or homesick; it only rewards discipline. Stay on my count, recruit, and I'll drag a champion out of you yet.

0:11

Film & TV

PROMPT

Young adult female, mid-20s, American accent. Professional broadcast journalist turning frantic. Clear, articulate but strained by panic. High tension, rapid pace, breathless. Polished to raw desperation.

SCRIPT

This is Elena Vance, reporting live from the east block where the crowd just broke the barricade—if anyone can hear me, we need medical teams now, please, they're getting closer.

0:08

Games

PROMPT

Female, young adult, ethereal trickster. High-pitched, breathy, mischievous. Fast, rhythmic delivery with giggles. Mocking sing-song riddles. Playful, taunting, otherworldly.

SCRIPT

Oh, you heard the whisper too? Clever little heartbeat. Follow the violet shimmer if you dare, but mind your shadow, love. It tends to trade secrets when the veil grows thin.

0:11

Literature & Stage

PROMPT

Male, mid-20s to early 30s. Smooth velvety tenor-range speaking voice with a light rasp. Soulful and deeply emotive, shifting from weary struggle to optimistic conviction. Impeccable diction, gentle Southern lilt, deliberate pace, and broad expressive pitch arcs.

SCRIPT

I've walked through too many long nights to mistake silence for peace, so when I speak of tomorrow, believe me, brother, I mean a dawn we can finally stand in together.

0:11

Myth & Folklore

PROMPT

Mature nomadic storyteller. Weathered, resonant speaking voice with rhythmic pacing and expressive pitch contours. Wide dynamic range from hushed whispers to booming proclamations; soulful.

SCRIPT

Come closer to the fire, child; the wind is telling old truths tonight. Hear how it bends the grass, then remember this: every road you take is also taking measure of you.

0:12

Research & News

PROMPT

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

SCRIPT

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

0:15

Web & Periodical

PROMPT

Ancient male, massive scale. Deep, resonant bass, gravelly, subterranean. Slow, deliberate, aristocratic. Terrifying power, sibilant, predatory intelligence.

SCRIPT

Careful where you place your little hands, treasure-seeker; every coin in this vault knows its master, and I am not inclined to forgive even the smallest theft.

0:16
Explorez 15 000+ voix de personnages dans le Voice Galaxy →

Capacité 02

Direction de voix — la bonne interprétation à chaque instant

Utilisez des instructions en langage naturel et des balises en ligne pour façonner l'émotion, l'intention, le rythme et la diction, tout en gardant chaque personnage reconnaissable. Créateurs et développeurs contrôlent ainsi plus finement l'interprétation d'une voix IA d'un instant à l'autre, sans avoir à reconcevoir la voix elle-même.

#1 du Benchmark TTS Direction de voix
RangModèle
Score de direction de voixSPK_SIM
1Breeze TTS 2
4.250.67
2MiMo-v2.5-TTS
3.760.66
3StepAudio 2.5 TTS
3.480.64
4Qwen-Audio 3.0-TTS-Plus
3.330.65
5Inworld TTS-2
3.010.71
6VoxCPM2
2.490.70

Breeze TTS 2 obtient le score de direction de voix le plus élevé (4.25), soit 13% de mieux que le deuxième modèle. Associé à un score SIM de 0.67, ce résultat démontre sa capacité à suivre une direction formulée en langage naturel — émotion, intention, rythme, diction — tout en gardant la voix choisie reconnaissable d'une interprétation à l'autre.

Communicative Intent

PROMPT

Speak with an alluring, hushed intensity, using a hypnotic and persuasive rhythm to draw the listener in and convince them to acquire a rare item.

SCRIPT

You feel the energy radiating from it, don't you? This isn't just a piece of quartz. It's a conduit. For a small offering, you can take it home and finally clear that dark cloud hanging over your future. Trust me, you need this.

REFERENCE

0:20

OUTPUT

0:13

Composition

PROMPT

Speaking while heavily out of breath and gasping for air, trying to reassure the listener that everything is fine.

SCRIPT

[gasps] I'm okay... [pants] just give me a second to catch my breath. [gasps] I promise, I'm completely fine... just ran a little too fast.

REFERENCE

0:19

OUTPUT

0:15

Emotion

PROMPT

The speaker sounds acerbic and bitter, delivering the lines with heavy, passive-aggressive sarcasm.

SCRIPT

Enjoy your vacation while I stay here and clean up the mess you left behind for me. Have a wonderful time.

REFERENCE

0:31

OUTPUT

0:06

Role

PROMPT

Speak with a gritty, swaggering, and theatrical tone, projecting an aggressive and boastful attitude of a seafaring marauder.

SCRIPT

Drop the anchor and bring out the gold! If any of you scallywags think about crossing me, you'll be swimming with the sharks before sunset. This ocean belongs to me!

REFERENCE

0:28

OUTPUT

0:11

Variation

PROMPT

Start with a confident, reassuring tone. At the word 'Wait', suddenly shift to terrified, breathless alarm as if reacting to a frightening noise.

SCRIPT

There's absolutely nothing to worry about, I've done this a hundred times before. Wait... did you hear that sound? Something's definitely not right here.

REFERENCE

0:16

OUTPUT

0:09
Dirigez gratuitement votre propre voix dans BreezeBlue Creator →

Capacité 03

Faible latence — l'IA vocale en temps réel à la vitesse de la conversation

Breeze TTS 2 réunit le naturel, le design de voix et la direction de voix dans un modèle unique à faible latence, conçu pour les applications d'IA vocale en temps réel. Un délai très court jusqu'au premier audio garde les conversations réactives et préserve le rythme naturel des expériences vocales interactives.

#1 du Benchmark de latence TTS
0ms250ms500ms750ms1000msTTFB p50TTFA p50TTFA p95Breeze TTS 2Breeze TTS 2 — TTFB p50 119.4ms, TTFA p50 133.6ms, TTFA p95 163.3msElevenLabs Flash v2.5ElevenLabs Flash v2.5 — TTFB p50 134.8ms, TTFA p50 154.5ms, TTFA p95 207.6msFish Audio S2.1 ProFish Audio S2.1 Pro — TTFB p50 173.6ms, TTFA p50 175.3ms, TTFA p95 271.4msInworld TTS-2Inworld TTS-2 — TTFB p50 163.1ms, TTFA p50 189.4ms, TTFA p95 220.4msCartesia Sonic 3.5Cartesia Sonic 3.5 — TTFB p50 106.8ms, TTFA p50 241.9ms, TTFA p95 344.2msxAI TTSxAI TTS — TTFB p50 249.1ms, TTFA p50 318.3ms, TTFA p95 361.1msSpeechify Simba 3.2Speechify Simba 3.2 — TTFB p50 374.5ms, TTFA p50 379.0ms, TTFA p95 424.5msAsync Flash 1.5Async Flash 1.5 — TTFB p50 247.0ms, TTFA p50 438.1ms, TTFA p95 479.6msElevenLabs v3ElevenLabs v3 — TTFB p50 544.0ms, TTFA p50 628.7ms, TTFA p95 917.9ms

Breeze TTS 2 se classe premier au Benchmark de latence TTS, avec le délai jusqu'au premier audio le plus court à la fois en p50 et en p95. Sa latence durablement basse garde les interactions en temps réel réactives et préserve le rythme naturel de la conversation.

Breeze TTS 2 en streaming temps réel

L'API temps réel maintient une seule session WebSocket ouverte d'un tour de conversation à l'autre : vous ajoutez le texte au fil de son arrivée et l'audio PCM brut vous revient en flux pendant que le modèle génère encore.

import { BreezeBlueClient } from "@breeze.blue/sdk";

const client = new BreezeBlueClient();

// One WebSocket session, many conversation turns.
const connection = await client.textToSpeech.realtime.connect("voc_...", {
  modelId: "breeze-tts-2",
});

const consumer = (async () => {
  for await (const message of connection) {
    if (message.type === "audio") {
      play(message.audio); // raw PCM, streamed while the model generates
    } else if (message.type === "turn.done") {
      return;
    }
  }
})();

connection.startTurn("turn_1");
connection.appendText("Hello from Breeze TTS 2.");
connection.flush();
connection.endTurn();

await consumer;
connection.close();
Obtenez votre clé API BreezeBlue →

Capacité 04

Parole multilingue

Créez des voix IA de synthèse vocale naturelles et expressives dans 50 langues, avec un contrôle de l'accent pour adapter la diction aux différentes régions et aux différents publics.

Choisissez une langue

Every journey finds its meaning when someone dares to take the first step.

Original : Every journey finds its meaning when someone dares to take the first step.

Donnez vie à votre script dans BreezeBlue Creator →

BreezeBlue Creator

Concevez, dirigez et générez des voix dans un seul outil de création, directement dans le navigateur.

BreezeBlue Creator text-to-speech workspace

API et SDK de synthèse vocale

Intégrez la synthèse vocale BreezeBlue à votre produit via les API ou les SDK.

BreezeBlue Text to Speech API code sample

Solution entreprise

Apportez à votre organisation des expériences vocales de niveau production

Enterprise voice experience illustration