Wir stellen vor: Breeze TTS 2

Gestalte jede Stimme. Führe Regie bei jeder Performance. In Echtzeit.

Wir stellen Breeze TTS 2 vor – unser neues Flaggschiff-Sprachmodell

Der Wandel

Von der Content-Produktion zu Echtzeit-Erlebnissen mit Voice AI

Die erste Welle der generativen KI hat die Content-Produktion verändert. Text, Bild, Video und Sprache entstehen heute auf Abruf – ein Prompt genügt, um aus einer Idee fertigen Content zu machen. Das meiste davon bleibt jedoch ein abgeschlossenes Artefakt: einmal erzeugt, danach konsumiert. Die nächste Welle bringt Interaktivität. Voice AI in Echtzeit treibt Charaktere, Games, Companions, interaktive Geschichten und Voice-Agents an, die fortlaufend auf jeden Nutzer, jeden Kontext und jeden Moment reagieren.

Inhalte reagieren jetzt fortlaufend auf die Menschen, die sie erleben.

Dieser Paradigmenwechsel erweitert die Erwartungen an KI-Stimmen für Text-zu-Sprache weit über Natürlichkeit hinaus. Natürlich klingende Sprache bleibt die Grundlage jedes hochwertigen Stimmerlebnisses – interaktive Erlebnisse stellen jedoch drei zusätzliche Anforderungen:

Vielfalt

Jedem Charakter eine unverwechselbare Stimme geben.

Steuerbarkeit

Jede Performance anpassen, wenn Absicht und Kontext sich verändern.

Geringe Latenz

Den natürlichen Rhythmus der Interaktion bewahren.

Zusammen erlauben diese Fähigkeiten, eine Stimme für den Charakter zu gestalten, für den Moment zu inszenieren und in Echtzeit auszuliefern.


Das neue Modell

Breeze TTS 2: ein neues Modell für Sprachgenerierung, gebaut für interaktive Erlebnisse.

Breeze TTS 2 vereint Stimmdesign per natürlicher Sprache, Stimmregie für jede beliebige Stimme und Streaming-Generierung mit geringer Latenz in einem einzigen Modell. Gebaut für die nächste Generation von Voice AI in Echtzeit, macht es möglich, jede Stimme zu gestalten, jeder Performance Regie zu geben und sie in Echtzeit zum Leben zu erwecken.

Um diese Fähigkeiten voranzubringen, braucht es auch bessere Wege, sie zu messen. Die TTS-Evaluation kreiste historisch um Natürlichkeit, während Stimmdesign, Stimmregie und Latenz weit weniger systematisch untersucht wurden. Breeze TTS 2 führt diese Fähigkeiten in einem einzigen Modell für interaktive Stimmerlebnisse zusammen und gibt Creators und Entwicklern mehr Kontrolle darüber, wie Stimmen gestaltet, performt und in Echtzeit ausgeliefert werden. Damit die Fortschritte in diesen Bereichen weitergehen, veröffentlichen wir außerdem Open-Source-Benchmarks für Stimmdesign, Stimmregie und Latenz. Sehen wir uns nun die vier Fähigkeiten genauer an, die Breeze TTS 2 ausmachen: Stimmdesign, Stimmregie, geringe Latenz und mehrsprachige Sprachausgabe.


Fähigkeit 01

Stimmdesign – die passende KI-Stimme für jeden Charakter

Breeze TTS 2 gibt jedem Charakter eine eigene Stimme – von der einen Hauptfigur bis zu Tausenden von NPCs. Statt sich allein auf vorgefertigte Stimmbibliotheken zu verlassen, beschreiben Creators einfach den Charakter, den sie im Kopf haben, und erzeugen unverwechselbare KI-Stimmen für Text-zu-Sprache, die besser zu Rolle, Persönlichkeit und Welt passen.

Platz 1 im Benchmark für TTS-Stimmdesign
RangModell
Role FitVoice Diversity
1Breeze TTS 2
78.02708
2MiMo-V2.5-TTS
72.78202
3Inworld Voice Design
64.61378
4Fun-AudioGen-VD
63.82136
5Eleven v3
58.88111
6Qwen3-TTS-VD
58.4883
7VoxCPM2
55.28509

Breeze TTS 2 belegt den ersten Platz im Benchmark für TTS-Stimmdesign: höchster Role Fit Score (78.02), größte Voice Diversity (708) und eine Transcript Pass Rate von 98.5%. Bei Role Fit liegt es 5.24 Punkte vor dem zweitbesten Modell und erzeugt 39% mehr unterschiedliche Stimmen als der nächstplatzierte Wettbewerber.

Animation & Comics

PROMPT

Masculine, mature adult. Massive heavy-set alien. Deep, gravelly, resonant bass-baritone. Gruff, authoritative, commanding, drill-sergeant cadence. Fast, high-intensity. Rough, weathered, immense power, stern mentorship.

SCRIPT

Chest up, eyes forward. Space does not care if you're tired, scared, or homesick; it only rewards discipline. Stay on my count, recruit, and I'll drag a champion out of you yet.

0:11

Film & TV

PROMPT

Young adult female, mid-20s, American accent. Professional broadcast journalist turning frantic. Clear, articulate but strained by panic. High tension, rapid pace, breathless. Polished to raw desperation.

SCRIPT

This is Elena Vance, reporting live from the east block where the crowd just broke the barricade—if anyone can hear me, we need medical teams now, please, they're getting closer.

0:08

Games

PROMPT

Female, young adult, ethereal trickster. High-pitched, breathy, mischievous. Fast, rhythmic delivery with giggles. Mocking sing-song riddles. Playful, taunting, otherworldly.

SCRIPT

Oh, you heard the whisper too? Clever little heartbeat. Follow the violet shimmer if you dare, but mind your shadow, love. It tends to trade secrets when the veil grows thin.

0:11

Literature & Stage

PROMPT

Male, mid-20s to early 30s. Smooth velvety tenor-range speaking voice with a light rasp. Soulful and deeply emotive, shifting from weary struggle to optimistic conviction. Impeccable diction, gentle Southern lilt, deliberate pace, and broad expressive pitch arcs.

SCRIPT

I've walked through too many long nights to mistake silence for peace, so when I speak of tomorrow, believe me, brother, I mean a dawn we can finally stand in together.

0:11

Myth & Folklore

PROMPT

Mature nomadic storyteller. Weathered, resonant speaking voice with rhythmic pacing and expressive pitch contours. Wide dynamic range from hushed whispers to booming proclamations; soulful.

SCRIPT

Come closer to the fire, child; the wind is telling old truths tonight. Hear how it bends the grass, then remember this: every road you take is also taking measure of you.

0:12

Research & News

PROMPT

Mature male, 50s-60s, Japanese-accented English. Dignified, measured, stoic tone. Clear texture with slight age rasp. Deliberate pacing, significant pauses. Conveys wisdom, authority, and visionary caution.

SCRIPT

We do not rebuild a nation with noise or haste. We place each stone with care, and when doubt rises, we answer it with discipline, patience, and an unshaken sense of duty.

0:15

Web & Periodical

PROMPT

Ancient male, massive scale. Deep, resonant bass, gravelly, subterranean. Slow, deliberate, aristocratic. Terrifying power, sibilant, predatory intelligence.

SCRIPT

Careful where you place your little hands, treasure-seeker; every coin in this vault knows its master, and I am not inclined to forgive even the smallest theft.

0:16
Entdecke 15.000+ Charakterstimmen in der Voice Galaxy →

Fähigkeit 02

Stimmregie – die passende Performance für jeden Moment

Forme Emotion, Absicht, Tempo und Vortrag über Anweisungen in natürlicher Sprache und Inline-Tags – und halte dabei jeden Charakter wiedererkennbar. Creators und Entwickler steuern so genauer, wie eine KI-Stimme von einem Moment zum nächsten performt, ohne die Stimme selbst neu gestalten zu müssen.

Platz 1 im Benchmark für TTS-Stimmregie
RangModell
Stimmregie-ScoreSPK_SIM
1Breeze TTS 2
4.250.67
2MiMo-v2.5-TTS
3.760.66
3StepAudio 2.5 TTS
3.480.64
4Qwen-Audio 3.0-TTS-Plus
3.330.65
5Inworld TTS-2
3.010.71
6VoxCPM2
2.490.70

Breeze TTS 2 erreicht den höchsten Voice Direction Score (4.25) und liegt damit 13% vor dem zweitbesten Modell. Zusammen mit einem SIM Score von 0.67 zeigt das Ergebnis, dass es Regieanweisungen in natürlicher Sprache über Emotion, Absicht, Tempo und Vortrag hinweg umsetzt – und die gewählte Stimme dabei über verschiedene Performances hinweg wiedererkennbar bleibt.

Communicative Intent

PROMPT

Speak with an alluring, hushed intensity, using a hypnotic and persuasive rhythm to draw the listener in and convince them to acquire a rare item.

SCRIPT

You feel the energy radiating from it, don't you? This isn't just a piece of quartz. It's a conduit. For a small offering, you can take it home and finally clear that dark cloud hanging over your future. Trust me, you need this.

REFERENCE

0:20

OUTPUT

0:13

Composition

PROMPT

Speaking while heavily out of breath and gasping for air, trying to reassure the listener that everything is fine.

SCRIPT

[gasps] I'm okay... [pants] just give me a second to catch my breath. [gasps] I promise, I'm completely fine... just ran a little too fast.

REFERENCE

0:19

OUTPUT

0:15

Emotion

PROMPT

The speaker sounds acerbic and bitter, delivering the lines with heavy, passive-aggressive sarcasm.

SCRIPT

Enjoy your vacation while I stay here and clean up the mess you left behind for me. Have a wonderful time.

REFERENCE

0:31

OUTPUT

0:06

Role

PROMPT

Speak with a gritty, swaggering, and theatrical tone, projecting an aggressive and boastful attitude of a seafaring marauder.

SCRIPT

Drop the anchor and bring out the gold! If any of you scallywags think about crossing me, you'll be swimming with the sharks before sunset. This ocean belongs to me!

REFERENCE

0:28

OUTPUT

0:11

Variation

PROMPT

Start with a confident, reassuring tone. At the word 'Wait', suddenly shift to terrified, breathless alarm as if reacting to a frightening noise.

SCRIPT

There's absolutely nothing to worry about, I've done this a hundred times before. Wait... did you hear that sound? Something's definitely not right here.

REFERENCE

0:16

OUTPUT

0:09
Führe im BreezeBlue Creator kostenlos Regie bei deiner eigenen Stimme →

Fähigkeit 03

Geringe Latenz – Voice AI in Echtzeit, im Tempo eines Gesprächs

Breeze TTS 2 vereint Natürlichkeit, Stimmdesign und Stimmregie in einem einzigen Modell mit geringer Latenz, gebaut für Anwendungen mit Voice AI in Echtzeit. Die kurze Zeit bis zum ersten Audio hält Gespräche reaktionsschnell und bewahrt den natürlichen Rhythmus interaktiver Stimmerlebnisse.

Platz 1 im Benchmark für TTS-Latenz
0ms250ms500ms750ms1000msTTFB p50TTFA p50TTFA p95Breeze TTS 2Breeze TTS 2 — TTFB p50 119.4ms, TTFA p50 133.6ms, TTFA p95 163.3msElevenLabs Flash v2.5ElevenLabs Flash v2.5 — TTFB p50 134.8ms, TTFA p50 154.5ms, TTFA p95 207.6msFish Audio S2.1 ProFish Audio S2.1 Pro — TTFB p50 173.6ms, TTFA p50 175.3ms, TTFA p95 271.4msInworld TTS-2Inworld TTS-2 — TTFB p50 163.1ms, TTFA p50 189.4ms, TTFA p95 220.4msCartesia Sonic 3.5Cartesia Sonic 3.5 — TTFB p50 106.8ms, TTFA p50 241.9ms, TTFA p95 344.2msxAI TTSxAI TTS — TTFB p50 249.1ms, TTFA p50 318.3ms, TTFA p95 361.1msSpeechify Simba 3.2Speechify Simba 3.2 — TTFB p50 374.5ms, TTFA p50 379.0ms, TTFA p95 424.5msAsync Flash 1.5Async Flash 1.5 — TTFB p50 247.0ms, TTFA p50 438.1ms, TTFA p95 479.6msElevenLabs v3ElevenLabs v3 — TTFB p50 544.0ms, TTFA p50 628.7ms, TTFA p95 917.9ms

Breeze TTS 2 belegt den ersten Platz im Benchmark für TTS-Latenz und liefert sowohl bei p50 als auch bei p95 die kürzeste Zeit bis zum ersten Audio. Die durchgehend niedrige Latenz hält Interaktionen in Echtzeit reaktionsschnell und bewahrt den natürlichen Rhythmus eines Gesprächs.

Breeze TTS 2 in Echtzeit streamen

Die Realtime-API hält über alle Gesprächsrunden hinweg eine einzige WebSocket-Session offen: Text wird angehängt, sobald er eintrifft, und rohes PCM-Audio strömt zurück, während das Modell noch generiert.

import { BreezeBlueClient } from "@breeze.blue/sdk";

const client = new BreezeBlueClient();

// One WebSocket session, many conversation turns.
const connection = await client.textToSpeech.realtime.connect("voc_...", {
  modelId: "breeze-tts-2",
});

const consumer = (async () => {
  for await (const message of connection) {
    if (message.type === "audio") {
      play(message.audio); // raw PCM, streamed while the model generates
    } else if (message.type === "turn.done") {
      return;
    }
  }
})();

connection.startTurn("turn_1");
connection.appendText("Hello from Breeze TTS 2.");
connection.flush();
connection.endTurn();

await consumer;
connection.close();
Hol dir deinen BreezeBlue API Key →

Fähigkeit 04

Mehrsprachige Sprachausgabe

Erzeuge natürliche, ausdrucksstarke KI-Stimmen für Text-zu-Sprache in 50 Sprachen – mit Akzentsteuerung, um den Vortrag an unterschiedliche Regionen und Zielgruppen anzupassen.

Wähle eine Sprache

Every journey finds its meaning when someone dares to take the first step.

Original: Every journey finds its meaning when someone dares to take the first step.

Erwecke dein Skript im BreezeBlue Creator zum Leben →

BreezeBlue Creator

Stimmen gestalten, inszenieren und generieren – alles in einem Creator-Tool im Browser.

BreezeBlue Creator text-to-speech workspace

Text-zu-Sprache-API und SDKs

Integriere BreezeBlue Text-zu-Sprache über APIs oder SDKs in dein Produkt.

BreezeBlue Text to Speech API code sample

Enterprise-Lösung

Bring Stimmerlebnisse in Produktionsqualität in deine Organisation

Enterprise voice experience illustration