Breeze TTS: Anweisungstreue für die Sprachgenerierung

Breeze TTS ist das anweisungstreue Sprachmodell von BreezeBlue für steuerbares KI-Stimmdesign, Stimmregie und ausdrucksstarke Sprachgenerierung.

Research Demo

Demo zur Forschungsmotivation von Breeze TTS

Bei BreezeBlue denken wir neu darüber nach, wie die Zukunft der Audio-Intelligenz klingen sollte.

Bisherige Sprachtechnologien sind stark im Kopieren. Die nächste Generation von Voice AI sollte mehr können: Nuancen verstehen, sich über Kontexte hinweg anpassen und steuerbar bleiben.

Breeze TTS ist unser erster Schritt in diese Richtung – ein generatives Sprachmodell, das Anweisungstreue auf State-of-the-art-Niveau in die Sprachgenerierung bringt.

01

Unsere Motivation

Sprachgenerierung wurde bisher auf Realismus optimiert. Wir sind überzeugt: Jetzt muss sie auf Absicht optimiert werden.

Das Feld hat enorme Fortschritte bei Natürlichkeit, Sprecherkonsistenz und Stimmklonen gemacht. Doch originalgetreue Reproduktion ist nicht dasselbe wie steuerbare Generierung. Eine Stimme, die perfekt klingt, ist nicht automatisch eine Stimme, die sich richtig anfühlt, zum Kontext passt oder einer Regieanweisung folgt.

Andere generative Bereiche sind diesen Weg längst gegangen. In der Text- und Bildgenerierung ist Anweisungstreue heute eine Kernfähigkeit. Nutzer erwarten, dass Modelle auf Prompts präzise, flexibel und mit Bandbreite reagieren. Für die Sprachgenerierung sollte nichts anderes gelten.

Mit Breeze TTS behandeln wir Anweisungstreue als erstklassige Fähigkeit für Sprache. Ziel ist nicht nur natürlich klingendes Audio, sondern Sprache, die sich von kreativer Absicht formen lässt: eine Stimme, die durch eine Persona definiert wird, eine Performance, die der Kontext prägt, und ein Vortrag, der sich mit der Szene verändert.


02

Breeze TTS — eine neue Art von Sprachmodell

Im Kern ist Breeze TTS ein Audio-Sprachmodell, das auf einem vortrainierten großen Sprachmodell aufsetzt. Es wird zusätzlich auf verschränkten Text-Audio-Sequenzen trainiert, sodass Text und Audio in einem einzigen Stream modelliert werden. In dieser Formulierung liefert der Text Anweisungen und Skript, während Audio zugleich als Konditionierungssignal und als Generierungsziel dient.

Daraus ergibt sich für Breeze TTS eine ausgeprägte Anweisungstreue in zwei Szenarien: eine neue Stimme allein aus Text zu erschaffen und – ausgehend von einer Sprachreferenz – zu steuern, wie eine bestehende Stimme performt.


2.1

Gestalten: eine neue Stimme aus einem Text-Prompt erschaffen

Breeze TTS verbindet Weltwissen mit einem starken Verständnis natürlicher Sprache. Es folgt offen formulierten Text-Prompts — ob sie Persona, Tonfall, Szenario oder Stil beschreiben — und erzeugt eine Stimme, die zum gewünschten Charakter passt.

Acoustic-Parameter SpecificationDescriptive-Style DirectiveRole-Play
Character 1Character 2Character 3Character 4

Instructions

Gestalten: eine neue Stimme aus einem Text-Prompt erschaffen

Wir evaluieren Breeze TTS auf InstructTTSEval, einem Benchmark zur Messung komplexer Stilsteuerung per natürlicher Sprache in der Sprachgenerierung. InstructTTSEval deckt drei Arten von Anweisungsstilen ab: Acoustic-Parameter Specification (APS), Descriptive-Style Directive (DSD) und Role-Play (RP), jeweils mit 1K Testfällen. Breeze TTS erzielt auf diesem Benchmark State-of-the-art-Ergebnisse und zeigt damit eine ausgeprägte Fähigkeit, komplexe Anweisungen zu verstehen und vielfältige Stimmen zu erzeugen. Sofern nicht anders angegeben, dient Gemini-3.1-pro als bewertender Judge. Unserer internen menschlichen Evaluation zufolge bewertet es unvoreingenommener als Gemini-2.5-pro.


2.2

Regie führen: eine bestehende Stimme anweisen, in einem neuen Sprechstil zu performen

Stimmregie entsteht auf natürliche Weise aus dem Training auf Audiodaten mit langem Horizont. Breeze TTS folgt Anweisungen in natürlicher Sprache, um den Sprechstil eines Referenz-Clips zu verändern, und bewahrt dabei die zugrunde liegende Sprecheridentität. Wichtig dabei: Die Guidance-Stärke lässt sich anpassen, um zwischen Sprecherkonsistenz und Anweisungstreue abzuwägen.

LedaSadachbiaSchedarVindemiatrix

Reference Voice

Scene 1Scene 2Scene 3

Instructions

Regie führen: eine bestehende Stimme anweisen, in einem neuen Sprechstil zu performen

Dieses Szenario evaluieren wir auf InstructTTSEval. Für jeden der 3K Testfälle wählen wir zufällig eine der 30 voreingestellten Gemini-TTS-Stimmen als One-Shot-Referenz für Breeze TTS. Zur Testzeit variieren wir die Guidance-Stärke, um den Trade-off zwischen Anweisungstreue und Sprecherkonsistenz zu messen. Breeze TTS erreicht bei der Stimmregie eine Pareto-Front auf State-of-the-art-Niveau, mit einem klaren Skalierungstrend: Bei gleichem Grad an Anweisungstreue bewahren größere Modelle die Sprecherkonsistenz besser.


03

Breeze TTS ausprobieren

Sprachgenerierung geht über bloße Reproduktion hinaus – hin zu Erschaffen, Regie und Interaktion. Mit Breeze TTS machen wir einen frühen Schritt in Richtung Sprachmodelle, die einer Absicht folgen, sich dem Kontext anpassen und ein breiteres Spektrum an Stimmerlebnissen erschließen.

Das ist erst der Anfang. Unsere Mission ist es, mit Forschung und Produkten die nächste Generation audio-nativer Erlebnisse zu schaffen. Wir freuen uns, Breeze TTS mit Creators, Entwicklern und Teams zu teilen, die erkunden, was aus diesen Erlebnissen werden kann.