Beschreibe die Figur. Hör ihre Stimme.

Voice Design verwandelt eine geschriebene Beschreibung in eine originale, wiederverwendbare Stimme. Keine Aufnahmen, kein Referenzsprecher — beschreibe, wer die Figur ist, höre das Ergebnis und speichere es für ganz Breeze Blue.

Du beschreibst

Eine wettergegerbte Kapitänin in den Sechzigern. Tiefe, raue Stimme, langsames, bedächtiges Tempo, ein Hauch irischer Akzent, Wärme unter der rauen Schale.

Du hörst

Eine tiefe, kantige Frauenstimme mit gelassenem Vortrag und sanft irischem Einschlag — streng an der Oberfläche, gütig darunter.

Die gespielte Zeile

„Mach die Leine fest, Junge — das Meer verzeiht kein zweites Mal.“

Du beschreibst

Ein hyperaktiver Roboter-Sidekick aus einem Kinder-Cartoon. Hohe Stimme mit metallischem Klang, spricht schnell, immer kurz vorm Kichern.

Du hörst

Eine helle, sprunghafte synthetische Stimme mit hohem Tempo und kichriger Energie, die auch bei Geschwindigkeit glasklar bleibt.

Die gespielte Zeile

„Neuer Plan! Wie der alte Plan, nur mit viel mehr Jetpacks!“

Du beschreibst

Eine ruhige Meditationsstimme, androgyn, Mitte dreißig. Weich und hauchig, nah am Mikrofon, fast ein Flüstern, aber vollkommen klar.

Du hörst

Eine intime, luftige Stimme mit sanftem Tempo und warmen Tiefmitten — leise, ohne je an Verständlichkeit zu verlieren.

Die gespielte Zeile

„Lass den Gedanken vorbeiziehen wie eine Wolke am weiten Himmel.“

In drei Schritten von der Beschreibung zur gespeicherten Stimme

Der ganze Kreislauf — beschreiben, anhören, speichern — passiert in einem Arbeitsbereich, und die Stimme, die du behältst, wird ein dauerhaftes Asset.

1

Beschreiben

Beschreibe in natürlicher Sprache, wer die Figur ist — Alter, Klangfarbe, Tempo, Akzent, Haltung. Ist die Figur schon gezeichnet, lade das Artwork hoch und starte vom Bild.

2

Anhören

Erzeuge eine Kandidatenstimme und höre, wie sie eine Vorschauzeile spielt. Noch nicht ganz richtig? Schärfe die Beschreibung nach — tiefer, langsamer, weniger glatt — und generiere erneut, bis die Stimme der in deinem Kopf entspricht.

3

Speichern

Speichere den Favoriten in deiner Stimmenliste. Ab diesem Moment ist er ein wiederverwendbares Asset: in Text-to-Speech auswählbar, in Studio-Projekten besetzbar, per ID aus der API abrufbar.

So schreibst du eine Beschreibung, die funktioniert

Konkrete, hörbare Eigenschaften schlagen abstrakte Persönlichkeitswörter. Die stärksten Beschreibungen benennen einige dieser Punkte direkt:

Alter & Geschlecht
„eine Frau in den Sechzigern“
Klangfarbe
„rau“, „hauchig“, „metallisch“
Tempo
„langsam und bedächtig“, „spricht schnell“
Akzent
„ein Hauch irischer Akzent“
Rolle & Haltung
„ein müder Detektiv der Nachtschicht“

Ein bis zwei Sätze genügen. Beschreibe, wie die Stimme klingt — nicht, was die Figur in der Geschichte tut.

Wann Voice Design das richtige Werkzeug ist

Fünf Situationen, mit denen Creator zum Voice Design kommen — und was in jeder genau passiert.

01

Die vorgefertigte Stimme ist immer fast richtig

Du hörst die Stimme klar im Kopf, und jede fertige Option liegt knapp daneben — der richtige Ton, aber das falsche Alter; der richtige Akzent, aber zu glatt. Voice Design schließt genau diese letzte Lücke: Schreib die Stimme auf, die du hörst, höre das Ergebnis und schärfe die Beschreibung, bis es passt. Und wenn „nah genug“ wirklich reicht, bleibt der Start mit einer kuratierten Stimme der schnellere Weg.

Einen Startpunkt in der Voice Library wählen
02

Die Figur hat keinen Referenzsprecher

Spiel-NPCs, Romanfiguren, virtuelle Hosts — originale Figuren bringen keine Aufnahme mit, die man klonen könnte. Voice Design braucht überhaupt kein Ausgangsaudio: Die Beschreibung ist die Quelle. Verdichte das Charakterblatt auf ein, zwei Sätze, und heraus kommt eine originale Stimme ohne menschlichen Sprecher dahinter.

So bauen Creator komplette Figuren-Casts auf
03

Die Figur ist gezeichnet, aber noch nicht zu hören

Manchmal ist das Artwork vor der Stimme da. Im Voice-Design-Arbeitsbereich kannst du direkt vom Bild der Figur starten: Lade das Artwork hoch und erzeuge eine Stimme, die zu dem passt, was du siehst — ergänzt um eine geschriebene Beschreibung für alles, was das Bild nicht zeigen kann: Tempo, Akzent, Haltung.

Eine Stimme aus dem Charakter-Artwork starten
04

Bis zu 3 Kandidaten pro API-Request

Im Web hörst du einen Kandidaten nach dem anderen und verfeinerst die Beschreibung zwischen den Takes. Die Voice Design API arbeitet größer: Ein Request an den Design-Endpoint liefert bis zu 3 Kandidatenstimmen aus derselben Beschreibung — so kann eine Pipeline programmatisch eine Shortlist erzeugen, aus der ein Mensch den Favoriten wählt.

Die Voice-Design-API-Dokumentation lesen
POST /v1/text-to-voice/design
{
  "voice_description": "A weathered sea captain in her
    sixties, low and gravelly, with a faint Irish accent.",
  "text": "Tie that line down, lad.",
  "preview_count": 3
}
05

Die Stimme sitzt — du brauchst neue Performances

Dann ist das Design fertig. Wenn dieselbe Stimme eine Zeile flüstern und die nächste rufen soll, behalte die Stimme und führe stattdessen Regie: Breeze TTS 2 nimmt Zeile für Zeile Anweisungen in natürlicher Sprache entgegen. Voice Design entscheidet, wer spricht; Voice Direction entscheidet, wie jede Zeile gespielt wird.

Performances in Text-to-Speech dirigieren

Design, Library, Klonen oder Direction?

Vier Werkzeuge, vier Ausgangspunkte. Wähle danach, was du schon hast.

Voice Library

Starte mit einer fertigen Stimme. Durchstöbere kuratierte Stimmen nach Stil und Sprache, höre sofort rein und nutze sie direkt — der schnellste Weg, wenn eine fertige Stimme passt.

Die Voice Library entdecken

Voice Cloning

Starte mit einer echten Aufnahme. Wenn die Stimme bereits existiert und du die Erlaubnis der Sprecherin oder des Sprechers hast, reproduziert das Klonen genau diese Stimme aus einer kurzen autorisierten Probe.

So funktioniert 5-Sekunden-Voice-Cloning

Voice Design

Starte mit einer Beschreibung — genau diese Seite. Wenn die Stimme nur in deinem Kopf oder im Charakter-Artwork existiert, erschafft Design eine originale Stimme ohne Aufnahme und ohne Referenzsprecher.

Voice Direction

Starte mit einer Stimme, der du bereits vertraust. Direction ändert, wie eine Zeile vorgetragen wird — Emotion, Tempo, Vortragsstil — ohne zu ändern, wer spricht.

Jede Stimme mit Anweisungen in natürlicher Sprache dirigieren

Belege statt Adjektive

Der offene Voice Design Benchmark bewertet 1,000 Charakter-Voice-Design-Aufgaben über führende Modelle hinweg (Auswertung August 2026). Breeze TTS 2 liegt bei Rollenpassung und Stimmenvielfalt auf Platz eins:

78.02

Role Fit (Rollenpassung)

Wie genau generierte Stimmen zur beschriebenen Rolle passen, normalisiert auf 100 — der höchste Wert unter den ausgewerteten Modellen.

708

Distinkte Stimm-Cluster

Distinkte WavLM-Sprecher-Cluster über den gesamten Aufgabensatz — die größte Stimmenvielfalt der Auswertung.

98.5%

Transkript bestanden

Anteil der generierten Clips, die ihre Vorschauzeile klar und deutlich sprechen.

Das vollständige Voice-Design-Benchmark-Leaderboard und die Methodik ansehen

Voice Design Benchmark · ausgewertet im August 2026

Vom Browser bis zur API

Im Web-App gestalten

Beschreibe die Figur — oder lade ihr Artwork hoch —, höre Kandidaten an und speichere den Favoriten. Gespeicherte Stimmen erscheinen sofort in deiner Stimmenliste, bereit für Text-to-Speech und für die Besetzung in Studio-Projekten.

Mit der Voice Design API skalieren

Erzeuge Kandidaten mit POST /v1/text-to-voice/design und speichere den Favoriten mit POST /v1/text-to-voice. Gespeicherte Stimmen sind per ID über dieselben Endpoints erreichbar, die deine Text-to-Speech-Integration bereits nutzt.

Bis zu 3 Kandidaten pro Design-Request über die API; der Web-Arbeitsbereich hört jeweils einen Kandidaten an.

Häufig gestellte Fragen

Was ist KI-Voice-Design?

Voice Design erschafft eine originale Stimme aus einer geschriebenen Beschreibung oder einem Charakterbild statt aus einer Aufnahme. Du beschreibst die Sprecherin oder den Sprecher — Alter, Klangfarbe, Tempo, Akzent, Haltung —, hörst die generierte Stimme an und speicherst sie als wiederverwendbares Asset für Text-to-Speech, Studio-Projekte und die API.

Brauche ich eine Stimmprobe oder Aufnahme?

Nein. Voice Design braucht weder Ausgangsaudio noch einen Referenzsprecher — die Beschreibung allein ist der Input. Hast du hingegen eine autorisierte Aufnahme genau der Stimme, die du willst, ist Voice Cloning das passendere Werkzeug.

Wessen Stimme ist eine designte Stimme?

Niemandes. Eine designte Stimme wird aus deiner Beschreibung generiert; sie ist keine Aufnahme einer Person und nicht darauf ausgelegt, einen bestimmten Sprecher zu reproduzieren. Ähnliche Beschreibungen können zu ähnlich klingenden Ergebnissen führen — betrachte eine designte Stimme daher als originale Kreation, nicht als garantiert einmaligen Klang.

Bekomme ich mehrere Kandidatenstimmen aus einer Beschreibung?

In der Web-App hörst du einen Kandidaten nach dem anderen und verfeinerst die Beschreibung zwischen den Versuchen. Über die API kann ein einzelner Request an den Design-Endpoint bis zu 3 Kandidaten zurückgeben — ideal für Pipelines, die programmatisch vorauswählen, bevor ein Mensch die finale Stimme bestimmt.

Wo kann ich eine gespeicherte designte Stimme verwenden?

Überall in Breeze Blue. Nach dem Speichern erscheint die Stimme in deiner Stimmenliste: wähle sie in Text-to-Speech, besetze sie in Studio-Projekten mit mehreren Figuren und referenziere ihre ID in API-Aufrufen — dieselbe Stimme, dieselbe Figur, auf jeder Oberfläche.

Kann dieselbe designte Stimme verschiedene Emotionen liefern?

Ja — aber das ist Voice Direction, nicht Voice Design. Behalte die gespeicherte Stimme und gib in Text-to-Speech Anweisungen pro Zeile: diese Zeile flüstern, bei der nächsten die Spannung steigern. Design legt fest, wer spricht; Direction ändert, wie jede Zeile gespielt wird.

Was kostet Voice Design?

Voice Design läuft über dasselbe Credit-Guthaben wie der Rest von Breeze Blue, und du kannst kostenlos starten. Auf der Preisseite findest du die aktuellen Pläne und wie Credits in Generierung umgerechnet werden.