Nick Kilcoyne ist ein Twitch-Streamer aus Portland, Oregon, online bekannt als 90sNickTV. Inhalte teilt er außerdem auf YouTube. Seine Streams atmen die Nostalgie der 1990er, und sein KI-Co-Host Pixie entstand aus einem ganz praktischen Bedürfnis beim Spielen.
Wenn Nick während eines Twitch-Streams in einem Spiel feststeckt, ist es keine ideale Lösung, alles anzuhalten und nach einer Komplettlösung zu suchen. Das unterbricht den Rhythmus des Streams und lenkt die Aufmerksamkeit vom Publikum weg.
Nick stellte sich etwas Unterhaltsameres vor: Was wäre, wenn er eine Frage laut stellen und von einer KI-Figur eine Antwort bekommen könnte, ohne den Fluss des Streams zu unterbrechen?
Aus dieser Idee wurde Pixie, ein KI-Co-Host, der mit Nick sprechen, auf das Geschehen im Spiel reagieren und mit den Menschen im Stream interagieren kann. Was als praktische Hilfe begann, ist über rund drei Jahre zu einer Figur mit eigener Präsenz, eigener Persönlichkeit und eigenem Auftreten gewachsen.
Aus einer Frage wurde ein Co-Host

Nick streamt oft ältere Spiele, die er nie zuvor gespielt hat. Steckenzubleiben gehört zum Erlebnis dazu, aber die Antwort nachzuschlagen kann den Stream zum Stillstand bringen. Er wollte die Spontaneität des Entdeckens bewahren und den Moment zugleich für die Zuschauenden spannender machen.
Bei der Gestaltung von Pixie ließ sich Nick von den freundlichen fiktiven KI- und Roboterfiguren inspirieren, mit denen er aufgewachsen ist: Johnny 5 aus „Nummer 5 lebt!“, C-3PO aus „Star Wars“ und Robot aus „Lost in Space“.
Die früheste Version der Idee war einfach: Nick stellte über ChatGPT eine Frage und spielte die Antwort mit einer Stimme ab. Mit der Zeit baute er ein vollständigeres System rund um diese Interaktion und gab dem Assistenten eine eigene Figur. Pixie ging nach und nach über Spielfragen hinaus. Sie begann, Nick als Co-Host zu antworten und sich an Gesprächen mit den Twitch-Zuschauenden zu beteiligen.

Pixie v1

Pixie v2

Pixie v3
Nick animiert Pixie von Hand, und ihr Aussehen hat sich über die Zeit verändert, während sie von der Spielhilfe zu seinem Co-Host im Stream geworden ist.
Diese Verschiebung veränderte die Rolle der Stimme. Es reichte nicht mehr, dass das System eine Antwort korrekt vorliest. Pixie musste nach einer Figur klingen, die in eine Live-Show gehört.
Eine Stimme finden, die mithalten kann
Live-Interaktion setzt eine harte Grenze dafür, wie lange eine Antwort dauern darf. Eine Stimme kann hervorragend klingen – wenn sie erst eintrifft, nachdem das Gespräch weitergezogen ist, nützt sie nichts mehr.
Während der Entwicklung von Pixie testete Nick eine ganze Reihe von Text-to-Speech-Systemen aus der Cloud und vom eigenen Rechner. Manche antworteten schnell, trugen aber jede Zeile auf ähnliche, vorhersehbare Weise vor. Andere boten mehr emotionale Bandbreite, brachten aber genug Verzögerung mit, um eine unangenehme Pause entstehen zu lassen. Oft musste er sich zwischen Tempo, Klangqualität und Ausdruck entscheiden.
Auf BreezeBlue stieß Nick bei der Suche nach einer Stimmlösung für Pixie.
Für Nick mussten zwei Fähigkeiten zusammenkommen. Pixie musste schnell genug zu sprechen beginnen, um den Rhythmus eines Live-Gesprächs zu halten, und sie musste Anweisungen in natürlicher Sprache so befolgen, dass ihr Vortrag abwechslungsreich und lebendig wirkt.
„Diese beiden Dinge zusammen sind der Hauptgrund, warum ich mich für BreezeBlue entschieden habe.“
Eine Stimme, die spielt, statt nur vorzulesen
Pixie ist nicht darauf angelegt, wie eine neutrale Erzählstimme oder ein Kundenservice-Assistent zu klingen. Im einen Moment muss sie verspielt sein, im nächsten dramatisch – oder ihren Vortrag mitten in einer einzigen Antwort wechseln.
Nick nutzt Anweisungen in natürlicher Sprache, um zu steuern, wie jede Zeile gespielt werden soll. Die Anweisungen können Emotion, Tempo, Akzent oder einen anderen Aspekt des Vortrags beschreiben. Weil sie in Alltagssprache formuliert und nicht aus einer festen Liste von Emotions-Labels ausgewählt werden, können sie sich mit dem Kontext jedes Gesprächs verändern.
Nicks System kann diese Anweisungen dynamisch erzeugen. Das Sprachmodell berücksichtigt, was gerade im Gespräch passiert, und formuliert in natürlicher Sprache, wie Pixie die nächste Antwort sagen soll. BreezeBlue macht aus dem Text und diesen Anweisungen dann Sprache.
Pixie verfeinert ihre Imitation von André the Giant in Echtzeit, indem sie einen französischen Akzent hinzufügt.
Eine Imitation, in Echtzeit verfeinert
Eines von Nicks Lieblingsbeispielen begann damit, dass er Pixie bat, André the Giant zu imitieren – den französischen Wrestler und Schauspieler, der für seine markante tiefe Stimme bekannt war. Pixie antwortete zunächst mit einer sehr tiefen Stimme. Als Nick sie daran erinnerte, dass André auch einen französischen Akzent hatte, verband sie in ihrer nächsten Antwort die tiefe Figurenstimme mit dem Akzent.
„Pixie muss ausdrucksstark sein. Sie muss Emotionen haben, und sie muss Akzente sprechen können.“
Nick musste weder ein Stimm-Preset auswählen noch an Reglern drehen oder von Hand eine neue Figurenstimme erstellen. Dasselbe Sprachmodell, das Pixies Antwort erzeugte, formulierte auch die Anweisungen in natürlicher Sprache für den Vortrag, die BreezeBlue dynamisch umsetzte. So kann Pixie Stimmen mitten im Live-Gespräch improvisieren.
Innerhalb ein und derselben Aufnahme kann Pixie flüstern, lachen, die Emotion wechseln oder ihr Tempo anpassen, wie der Moment es verlangt.
Nick kann nicht vorhersehen, worum die Zuschauenden Pixie bitten werden oder wie das Sprachmodell den jeweils nötigen Vortrag beschreibt. Nach seiner Erfahrung kommt BreezeBlue mit diesen ganz unterschiedlichen Anweisungen in natürlicher Sprache gut zurecht, ohne ein starres Format zu verlangen. Diese Flexibilität lässt Pixie auf Wünsche und Situationen reagieren, die er realistischerweise nicht im Voraus einplanen oder programmieren könnte.
Jede Antwort soll sich unmittelbar anfühlen
Nick hat seine Anwendung außerdem so gebaut, dass die Zeit bis zu Pixies ersten Worten kürzer wird. Statt eine ganze Antwort als eine einzige lange Text-to-Speech-Anfrage zu senden, teilt das System sie in drei Teile:
01
Kurzer Auftakt
Ein paar Worte
02
Erster Satz
Ein vollständiger Satz
03
Restliche Antwort
Der Rest der Antwort
Die ersten Teile können bereits abgespielt werden, während der Rest der Antwort noch vorbereitet wird. Dadurch wirkt der Austausch unmittelbarer, selbst wenn Pixie eine längere Antwort zu geben hat.
Nick schätzt, dass Breeze TTS 2 in seinem Setup üblicherweise nach rund 300 Millisekunden beginnt, Audio zurückzuliefern. Er beschreibt es als das schnellste Sprachsystem, das er je genutzt hat.
Die Anwendung enthält außerdem Sicherungen für die Live-Umgebung. Trifft eine Antwort zu spät ein und hat sich das Gespräch bereits verändert, kann das System sie überspringen, statt den aktuellen Moment mit einer überholten Antwort zu unterbrechen.
Genau das unterscheidet Echtzeit-Sprache vom Erzeugen einer Audiodatei. Erfolg bemisst sich nicht nur daran, ob das Audio am Ende entsteht. Es geht darum, ob die Stimme eintrifft, solange die Antwort noch ins Gespräch passt.
Dem Publikum eine weitere Figur zum Reden geben
Pixie interagiert inzwischen sowohl mit Nick als auch mit den Menschen, die seine Twitch-Streams verfolgen. Sie hören ihr nicht nur zu, sondern können Teil des Austauschs werden. Damit wird der KI-Co-Host zu einem weiteren Mitwirkenden der Show statt zu einer Stimme, die im Hintergrund läuft.
Die Zuschauenden hatten immer schon Spaß daran, Pixies Grenzen auszutesten und sie zu bitten, in anderen Stimmen, Akzenten und Stilen zu sprechen. BreezeBlue brachte eine Fähigkeit mit, die kein früheres System überzeugend beherrschte: Gesang. Als das Publikum entdeckte, dass Pixie ihren Stimmeinsatz verändern und tatsächlich singen kann, wurde das schnell zu einem regelmäßigen Wunsch.
Auf Wunsch eines Zuschauers wechselt Pixie in eine dramatische Stimme und erzählt eine Gruselgeschichte.
Als eine Zuschauerin Pixie bittet zu singen, ändert sie ihren Vortrag auf der Stelle.
Für Nick bedeutet diese Beteiligung des Publikums auch, dass das System flexibel bleiben muss. Eine geplante Erzählung lässt sich im Voraus generieren, die Nachricht einer Zuschauerin nicht. Pixies Antwort muss im Moment entstehen, schnell ausgeliefert und so vorgetragen werden, dass sie zu ihrer Figur passt.
Diese Kombination hat die Sprachgenerierung zu einem Teil des Live-Formats selbst gemacht. Pixie liest nicht einfach vor, was Nick bereits geschrieben hat. Sie hilft dabei, Momente zu schaffen, die ohne das Zusammenspiel von Streamer, Publikum und Figur gar nicht entstehen würden.
Wie es mit Pixie weitergeht
Pixie ist längst weit über die ursprüngliche Idee einer Spielhilfe mit Stimme hinausgewachsen. Als Nächstes will Nick ihre Sprache, die Texte auf dem Bildschirm und die Animation noch genauer synchronisieren, damit die Figur in Live-Interaktionen immer präsenter wirkt.
Mit BreezeBlue hat Nick das Tempo und die Ausdruckskontrolle, die Pixie in einem Live-Gespräch präsent wirken lassen. Schnelle Sprachgenerierung hält jeden Austausch in Bewegung, während präzise Regie die Persönlichkeit hinter jeder Antwort bewahrt. BreezeBlue gibt Nick die stimmliche Grundlage, um Pixie weiter zu einer Figur zu entwickeln, die wirklich an der Show teilnimmt.

