Nick Kilcoyne es un streamer de Twitch afincado en Portland, Oregón, conocido en internet como 90sNickTV. También comparte contenido en YouTube. Sus directos tienen un aire nostálgico de los años noventa, y su copresentadora de IA, Pixie, nació de una necesidad práctica mientras jugaba.
Cuando Nick se queda atascado en un juego durante un directo en Twitch, detenerse a buscar una guía no es la solución ideal. Interrumpe el ritmo de la emisión y desvía la atención del público.
Nick imaginó algo más entretenido: ¿y si pudiera hacer una pregunta en voz alta y recibir la respuesta de un personaje de IA sin cortar el flujo del directo?
Esa idea se convirtió en Pixie, una copresentadora de IA capaz de hablar con Nick, reaccionar a lo que ocurre en un juego e interactuar con quienes ven el directo. Lo que empezó como una forma práctica de pedir ayuda se ha convertido, a lo largo de unos tres años, en un personaje con presencia, personalidad y estilo interpretativo propios.
De una pregunta a una copresentadora

Nick suele emitir juegos antiguos a los que nunca ha jugado. Quedarse atascado forma parte de la experiencia, pero buscar la respuesta puede detener el directo por completo. Quería conservar la espontaneidad de descubrir un juego y, al mismo tiempo, hacer que ese momento resultara más entretenido para quienes lo ven.
Al crear a Pixie, Nick se inspiró en los simpáticos personajes de IA y robots de ficción con los que creció, como Johnny 5 de Cortocircuito, C-3PO de La guerra de las galaxias y Robot de Perdidos en el espacio.
La primera versión de la idea era sencilla. Nick hacía una pregunta a través de ChatGPT y reproducía la respuesta con una voz. Con el tiempo construyó un sistema más completo en torno a esa interacción y dio al asistente una identidad de personaje. Poco a poco, Pixie dejó de limitarse a responder preguntas sobre juegos. Empezó a responder a Nick como copresentadora y a participar en las conversaciones con el público de Twitch.

Pixie v1

Pixie v2

Pixie v3
Nick anima a Pixie a mano, y su aspecto ha ido cambiando a medida que pasaba de ser una asistente de juego a su copresentadora en directo.
Ese cambio transformó el papel de la voz. Ya no bastaba con que el sistema leyera una respuesta con precisión. Pixie tenía que sonar como un personaje que pertenecía a un programa en directo.
Encontrar una voz capaz de seguir el ritmo
La interacción en tiempo real impone un límite estricto al tiempo que puede tardar una respuesta. Una voz puede sonar excelente, pero si llega cuando la conversación ya ha avanzado, deja de ser útil.
Mientras desarrollaba a Pixie, Nick probó todo tipo de sistemas de texto a voz, tanto en la nube como locales. Algunos respondían rápido, pero entregaban cada frase de una forma parecida y previsible. Otros ofrecían más rango emocional, pero introducían un retraso suficiente para generar una pausa incómoda. A menudo se veía obligado a elegir entre velocidad, calidad de sonido y expresividad.
Nick descubrió BreezeBlue mientras buscaba una solución de voz para Pixie.
Para Nick, dos capacidades tenían que funcionar juntas. Pixie debía empezar a hablar con la rapidez suficiente para mantener el ritmo de una conversación en directo, y debía seguir instrucciones en lenguaje natural de una forma que hiciera su interpretación variada y viva.
«Esas dos cosas juntas son la razón principal por la que decidí que BreezeBlue era la opción adecuada.»
Una voz que interpreta, no solo lee
Pixie no está diseñada para sonar como una narradora neutra ni como una asistente de atención al cliente. Puede necesitar ser juguetona en un momento, dramática al siguiente o cambiar su entrega dentro de una misma respuesta.
Nick usa instrucciones en lenguaje natural para guiar cómo debe interpretarse cada frase. Las instrucciones pueden describir la emoción, el ritmo, el acento u otro aspecto de la entrega. Como están escritas en lenguaje cotidiano y no elegidas de un conjunto fijo de etiquetas de emoción, pueden cambiar con el contexto de cada conversación.
El sistema de Nick puede generar esas instrucciones de forma dinámica. El modelo de lenguaje tiene en cuenta lo que está ocurriendo en la conversación y produce instrucciones en lenguaje natural sobre cómo debe decir Pixie la siguiente respuesta. BreezeBlue convierte después el texto y esas instrucciones en habla.
Pixie perfecciona en tiempo real su imitación de André the Giant añadiendo un acento francés.
Una imitación perfeccionada en tiempo real
Uno de los ejemplos favoritos de Nick empezó cuando le pidió a Pixie que imitara a André the Giant, el luchador y actor francés conocido por su característica voz grave. Pixie respondió primero con una voz muy grave. Cuando Nick le recordó que André también tenía acento francés, combinó esa voz grave de personaje con el acento en su siguiente respuesta.
«Pixie tiene que ser expresiva. Necesita tener emociones y necesita ser capaz de hacer acentos.»
Nick no tuvo que elegir un preajuste de voz, mover controles deslizantes ni crear manualmente una nueva voz de personaje. El mismo modelo de lenguaje que generaba la respuesta de Pixie producía también las instrucciones en lenguaje natural sobre cómo debía interpretarse, y BreezeBlue las interpretaba de forma dinámica. Esto permite a Pixie improvisar voces durante una conversación en directo.
Dentro de un mismo fragmento de audio, Pixie puede susurrar, reír, cambiar de emoción o ajustar su ritmo según lo pida el momento.
Nick no puede predecir qué le pedirá el público a Pixie ni cómo describirá el modelo de lenguaje la interpretación vocal que requiere cada solicitud. Según su experiencia, BreezeBlue maneja bien estas instrucciones en lenguaje natural tan variadas, sin exigir que sigan un formato rígido. Esa flexibilidad permite a Pixie responder a peticiones y situaciones que él no podría prever ni programar de antemano de forma realista.
Hacer que cada respuesta llegue al instante
Nick también diseñó su aplicación para reducir el tiempo que pasa antes de que Pixie empiece a hablar. En lugar de enviar la respuesta completa como una única solicitud larga de texto a voz, el sistema la divide en tres partes:
01
Preámbulo breve
Unas pocas palabras
02
Primera frase
Una frase completa
03
Respuesta restante
El resto de la respuesta
Las primeras partes pueden empezar a reproducirse mientras el resto de la respuesta todavía se está preparando. Así el intercambio resulta más inmediato, incluso cuando Pixie tiene una respuesta larga que dar.
Nick calcula que, en su configuración, Breeze TTS 2 suele empezar a devolver audio en unos 300 milisegundos. Lo describe como el sistema de voz más rápido que ha usado.
La aplicación también incluye salvaguardas pensadas para un entorno en directo. Si una respuesta llega demasiado tarde y la conversación ya ha cambiado, el sistema puede descartarla en lugar de interrumpir el momento actual con una respuesta desfasada.
Esto es lo que diferencia la voz en tiempo real de producir un archivo de audio. El éxito no depende solo de que el audio acabe generándose, sino de que la voz llegue cuando la respuesta todavía tiene sentido en la conversación.
Dar al público otro personaje con quien hablar
Ahora Pixie interactúa tanto con Nick como con quienes ven sus directos en Twitch. El público no solo la escucha: puede formar parte del intercambio, lo que convierte a la copresentadora de IA en una participante más del programa y no en una voz que suena de fondo.
Al público siempre le ha gustado poner a prueba los límites de lo que Pixie puede hacer pidiéndole que hable con distintas voces, acentos y estilos. BreezeBlue aportó una capacidad que ningún sistema anterior había resuelto de forma convincente: cantar. En cuanto los espectadores descubrieron que Pixie podía cambiar su forma de usar la voz y cantar de verdad, se convirtió enseguida en una petición habitual.
A petición de un espectador, Pixie cambia a una voz dramática para contar una historia de terror.
Cuando un espectador le pide a Pixie que cante, cambia su entrega sobre la marcha.
Para Nick, esa participación del público significa también que el sistema debe seguir siendo flexible. Una narración planificada puede generarse por adelantado, pero el mensaje de un espectador no. La respuesta de Pixie tiene que crearse en el momento, entregarse rápido e interpretarse de una forma coherente con su personaje.
Esa combinación ha convertido la generación de voz en parte del propio formato en directo. Pixie no se limita a leer contenido que Nick ya ha escrito. Ayuda a crear momentos que no existirían sin la interacción entre el streamer, el público y el personaje.
Qué le espera a Pixie
Pixie ha crecido mucho más allá de la idea original de un asistente de juego con voz. A continuación, Nick quiere sincronizar con aún más precisión su habla, el texto en pantalla y la animación, para que el personaje resulte cada vez más presente en las interacciones en directo.
Con BreezeBlue, Nick tiene la velocidad y el control expresivo necesarios para que Pixie esté realmente presente en una conversación en directo. La generación rápida de voz mantiene el ritmo de cada intercambio, mientras que una dirección precisa ayuda a conservar la personalidad detrás de cada respuesta. BreezeBlue le da a Nick la base de voz que necesita para seguir desarrollando a Pixie como un personaje capaz de participar de verdad en el programa.

