Nick Kilcoyne est un streamer Twitch installé à Portland, dans l’Oregon, connu en ligne sous le nom de 90sNickTV. Il partage aussi du contenu sur YouTube. Ses streams baignent dans une nostalgie des années 1990, et sa co-animatrice IA, Pixie, est née d’un besoin très concret en pleine partie.
Quand Nick bloque sur un jeu pendant un stream Twitch, s’arrêter pour chercher une soluce n’a rien d’idéal. Cela casse le rythme du stream et détourne son attention du public.
Nick a imaginé quelque chose de plus divertissant : et s’il pouvait poser une question à voix haute et obtenir la réponse d’un personnage IA, sans interrompre le fil du stream ?
Cette idée est devenue Pixie, une co-animatrice IA capable de parler avec Nick, de réagir à ce qui se passe dans un jeu et d’échanger avec les personnes qui regardent le stream. Ce qui n’était au départ qu’un moyen pratique d’obtenir de l’aide est devenu, en trois ans environ, un personnage avec sa propre présence, sa personnalité et son style d’interprétation.
D’une simple question à une co-animatrice

Nick diffuse souvent de vieux jeux auxquels il n’a jamais joué. Rester bloqué fait partie de l’expérience, mais chercher la réponse peut mettre le stream à l’arrêt. Il voulait préserver la spontanéité de la découverte d’un jeu tout en rendant ces moments plus captivants pour les spectateurs.
Pour créer Pixie, Nick s’est inspiré des IA et des robots de fiction bienveillants avec lesquels il a grandi, parmi lesquels Johnny 5 dans Numéro 5, C-3PO dans Star Wars et Robot dans Perdus dans l’espace.
La toute première version de l’idée était simple. Nick posait une question à ChatGPT, puis faisait lire la réponse par une voix. Au fil du temps, il a construit un système plus complet autour de cette interaction et a donné une identité de personnage à son assistante. Pixie a peu à peu dépassé les questions de jeu. Elle s’est mise à répondre à Nick comme une co-animatrice et à participer aux conversations avec les spectateurs Twitch.

Pixie v1

Pixie v2

Pixie v3
Nick anime Pixie à la main, et son apparence a évolué à mesure qu’elle passait d’assistante de jeu à co-animatrice à l’antenne.
Ce glissement a changé le rôle de la voix. Il ne suffisait plus que le système lise une réponse avec exactitude. Pixie devait sonner comme un personnage à sa place dans une émission en direct.
Trouver une voix capable de suivre le rythme
L’interaction en direct impose une limite stricte au temps de réponse. Une voix peut sonner à merveille : si elle arrive une fois que la conversation est passée à autre chose, elle ne sert plus à rien.
Nick a testé toute une série de systèmes de synthèse vocale, dans le cloud comme en local, pendant le développement de Pixie. Certains répondaient vite, mais livraient chaque réplique de la même manière, sans surprise. D’autres offraient une palette émotionnelle plus large, mais introduisaient un délai suffisant pour créer un blanc gênant. Il se retrouvait souvent à devoir choisir entre la rapidité, la qualité sonore et l’expressivité.
Nick a découvert BreezeBlue en cherchant une solution vocale pour Pixie.
Pour Nick, deux capacités devaient fonctionner ensemble. Pixie devait prendre la parole assez vite pour préserver le rythme d’une conversation en direct, et elle devait suivre des instructions en langage naturel d’une manière qui rende son interprétation variée et vivante.
« Ces deux éléments réunis sont la principale raison pour laquelle j’ai conclu que BreezeBlue était le bon choix. »
Une voix qui interprète, pas seulement qui lit
Pixie n’est pas conçue pour sonner comme une voix off neutre ou une assistante du service client. Elle peut avoir besoin d’être espiègle à un moment, dramatique l’instant d’après, ou de changer d’interprétation au sein d’une même réponse.
Nick utilise des instructions en langage naturel pour diriger l’interprétation de chaque réplique. Ces instructions peuvent décrire l’émotion, le rythme, l’accent ou tout autre aspect du jeu. Comme elles s’écrivent dans un langage de tous les jours plutôt que de se choisir dans une liste figée d’étiquettes d’émotions, elles évoluent avec le contexte de chaque conversation.
Le système de Nick sait générer ces instructions de façon dynamique. Le modèle de langage tient compte de ce qui se passe dans la conversation et produit des instructions en langage naturel sur la façon dont Pixie doit dire la réponse suivante. BreezeBlue transforme ensuite le texte et ces instructions en parole.
Pixie affine en temps réel son imitation d’André the Giant en y ajoutant un accent français.
Une imitation affinée en temps réel
L’un des exemples préférés de Nick a commencé quand il a demandé à Pixie d’imiter André the Giant, le catcheur et acteur français connu pour sa voix très grave. Pixie a d’abord répondu avec une voix très grave. Quand Nick lui a rappelé qu’André avait aussi un accent français, elle a combiné cette voix de personnage grave et l’accent dans sa réponse suivante.
« Pixie doit être expressive. Elle doit avoir des émotions, et elle doit être capable de faire des accents. »
Nick n’a eu besoin ni de choisir une voix prédéfinie, ni de régler des curseurs, ni de créer manuellement une nouvelle voix de personnage. Le modèle de langage qui a généré la réponse de Pixie a aussi produit les instructions en langage naturel décrivant son interprétation, que BreezeBlue a interprétées de façon dynamique. Pixie peut ainsi improviser des voix au cours d’une conversation en direct.
Au sein d’un même fichier audio, Pixie peut chuchoter, rire, changer d’émotion ou ajuster son débit selon ce que le moment demande.
Nick ne peut pas prévoir ce que les spectateurs vont demander à Pixie, ni la façon dont le modèle de langage décrira l’interprétation vocale attendue à chaque requête. D’après son expérience, BreezeBlue gère bien ces instructions en langage naturel très variées, sans exiger qu’elles suivent un format rigide. Cette souplesse permet à Pixie de répondre à des demandes et à des situations qu’il ne pouvait raisonnablement ni anticiper ni programmer à l’avance.
Faire en sorte que chaque réponse arrive aussitôt
Nick a aussi conçu son application pour réduire le temps qui précède la prise de parole de Pixie. Plutôt que d’envoyer toute la réponse en une seule longue requête de synthèse vocale, le système la découpe en trois parties :
01
Courte amorce
Quelques mots
02
Première phrase
Une phrase complète
03
Reste de la réponse
La suite de la réponse
Les premiers segments peuvent commencer à être lus pendant que le reste de la réponse est encore en préparation. L’échange paraît ainsi plus immédiat, même lorsque Pixie a une réponse plus longue à livrer.
Nick estime que Breeze TTS 2 commence généralement à renvoyer de l’audio en 300 millisecondes environ dans sa configuration. Il le décrit comme le système vocal le plus rapide qu’il ait utilisé.
L’application prévoit aussi des garde-fous pour un environnement en direct. Si une réponse arrive trop tard et que la conversation a déjà changé, le système peut l’ignorer plutôt que d’interrompre le moment présent avec une réponse dépassée.
C’est ce qui distingue la voix en temps réel de la production d’un fichier audio. Le succès ne tient pas seulement au fait que l’audio finisse par être généré. Il tient à ce que la voix arrive tant que la réponse a encore sa place dans la conversation.
Donner au public un autre personnage à qui parler
Pixie interagit désormais avec Nick comme avec les personnes qui regardent ses streams Twitch. Les spectateurs ne font pas que l’écouter. Ils peuvent prendre part à l’échange, ce qui fait de la co-animatrice IA une participante de l’émission plutôt qu’une voix diffusée en fond.
Les spectateurs ont toujours aimé tester les limites de ce que Pixie sait faire, en lui demandant de parler avec d’autres voix, d’autres accents et d’autres styles. BreezeBlue a apporté une capacité qu’aucun système précédent n’avait gérée de façon convaincante : le chant. Dès que les spectateurs ont découvert que Pixie pouvait changer sa manière d’utiliser sa voix et vraiment chanter, la demande est vite devenue récurrente.
À la demande d’un spectateur, Pixie adopte une voix dramatique pour raconter une histoire d’horreur.
Quand un spectateur demande à Pixie de chanter, elle change d’interprétation sur-le-champ.
Pour Nick, cette participation du public signifie aussi que le système doit rester souple. Une narration prévue à l’avance peut être générée en amont, mais pas le message d’un spectateur. La réponse de Pixie doit être créée sur le moment, livrée rapidement et interprétée d’une manière fidèle à son personnage.
Cette combinaison a fait de la génération vocale une partie intégrante du format en direct. Pixie ne se contente pas de lire un contenu que Nick a déjà écrit. Elle contribue à créer des moments qui n’existeraient pas sans l’interaction entre le streamer, le public et le personnage.
La suite pour Pixie
Pixie a déjà largement dépassé l’idée initiale d’une assistante de jeu dotée d’une voix. Nick veut maintenant synchroniser encore plus précisément sa parole, le texte à l’écran et son animation, pour rendre le personnage toujours plus présent pendant les interactions en direct.
Avec BreezeBlue, Nick dispose de la rapidité et du contrôle expressif nécessaires pour que Pixie soit vraiment présente dans une conversation en direct. Une génération vocale rapide maintient chaque échange en mouvement, tandis qu’une direction précise préserve la personnalité derrière chaque réponse. BreezeBlue donne à Nick la base vocale dont il a besoin pour continuer à faire de Pixie un personnage capable de prendre réellement part à l’émission.

