Nick Kilcoyne é um streamer da Twitch que mora em Portland, no Oregon, conhecido na internet como 90sNickTV. Ele também publica conteúdo no YouTube. Suas transmissões têm um clima nostálgico dos anos 1990, e Pixie, sua coapresentadora de IA, nasceu de uma necessidade prática enquanto ele jogava.
Quando Nick trava em um jogo durante uma transmissão na Twitch, parar para procurar um detonado não é a solução ideal. Isso interrompe o ritmo da transmissão e tira a atenção do público.
Nick imaginou algo mais divertido: e se ele pudesse fazer uma pergunta em voz alta e receber a resposta de um personagem de IA sem interromper o fluxo da transmissão?
Essa ideia virou Pixie, uma coapresentadora de IA que conversa com Nick, reage ao que acontece no jogo e interage com quem assiste à transmissão. O que começou como uma forma prática de pedir ajuda se transformou, ao longo de cerca de três anos, em uma personagem com presença, personalidade e estilo de interpretação próprios.
De uma pergunta a uma coapresentadora

Nick costuma transmitir jogos antigos que nunca jogou antes. Travar faz parte da experiência, mas procurar a resposta pode paralisar a transmissão. Ele queria preservar a espontaneidade de descobrir um jogo e, ao mesmo tempo, tornar esses momentos mais envolventes para quem assiste.
Ao criar Pixie, Nick se inspirou nos simpáticos personagens de IA e robôs da ficção com que cresceu, como Johnny 5, de Um Robô em Curto-Circuito, C-3PO, de Star Wars, e Robot, de Perdidos no Espaço.
A primeira versão da ideia era simples. Nick fazia uma pergunta pelo ChatGPT e reproduzia a resposta com uma voz. Com o tempo, ele construiu um sistema mais completo em torno dessa interação e deu ao assistente uma identidade de personagem. Aos poucos, Pixie foi além de responder dúvidas sobre jogos. Ela passou a responder a Nick como coapresentadora e a participar das conversas com o público da Twitch.

Pixie v1

Pixie v2

Pixie v3
Nick anima Pixie à mão, e o visual dela mudou com o tempo, à medida que ela deixou de ser uma assistente de jogos para virar sua coapresentadora na transmissão.
Essa mudança transformou o papel da voz. Já não bastava que o sistema lesse uma resposta com precisão. Pixie precisava soar como uma personagem que realmente pertencia a um programa ao vivo.
Em busca de uma voz que acompanhasse o ritmo
A interação ao vivo impõe um limite rígido ao tempo que uma resposta pode levar. Uma voz pode soar excelente, mas, se chega depois que a conversa já seguiu adiante, deixa de ser útil.
Nick testou vários sistemas de texto para voz, na nuvem e locais, enquanto desenvolvia Pixie. Alguns respondiam rápido, mas entregavam cada fala de um jeito parecido e previsível. Outros ofereciam mais alcance emocional, mas introduziam um atraso suficiente para criar uma pausa constrangedora. Muitas vezes ele se via tendo que escolher entre velocidade, qualidade de som e expressividade.
Nick descobriu o BreezeBlue enquanto procurava uma solução de voz para Pixie.
Para Nick, duas capacidades precisavam funcionar juntas. Pixie tinha que começar a falar rápido o bastante para preservar o ritmo de uma conversa ao vivo e precisava seguir instruções em linguagem natural de um jeito que deixasse sua interpretação variada e viva.
“Essas duas coisas juntas são os principais motivos pelos quais decidi que o BreezeBlue era a escolha certa.”
Uma voz que interpreta, não apenas lê
Pixie não foi pensada para soar como uma narradora neutra ou uma assistente de atendimento. Ela pode precisar ser brincalhona em um momento, dramática no seguinte, ou mudar a entrega dentro de uma mesma resposta.
Nick usa instruções em linguagem natural para orientar como cada fala deve ser interpretada. As instruções podem descrever emoção, ritmo, sotaque ou outro aspecto da entrega. Como são escritas em linguagem do dia a dia, em vez de selecionadas em um conjunto fixo de rótulos de emoção, elas podem mudar conforme o contexto de cada conversa.
O sistema de Nick consegue gerar essas instruções de forma dinâmica. O modelo de linguagem considera o que está acontecendo na conversa e produz instruções em linguagem natural sobre como Pixie deve dizer a próxima resposta. Em seguida, o BreezeBlue transforma o texto e essas instruções em fala.
Pixie aprimora sua imitação de André the Giant em tempo real, acrescentando um sotaque francês.
Uma imitação aprimorada em tempo real
Um dos exemplos favoritos de Nick começou quando ele pediu que Pixie imitasse André the Giant, o lutador e ator francês conhecido por sua voz grave característica. Pixie respondeu primeiro com uma voz bem grave. Quando Nick lembrou que André também tinha sotaque francês, ela combinou a voz grave do personagem com o sotaque na resposta seguinte.
“Pixie precisa ser expressiva. Ela precisa ter emoções e precisa conseguir fazer sotaques.”
Nick não precisou escolher uma voz predefinida, ajustar controles deslizantes nem criar manualmente uma nova voz de personagem. O mesmo modelo de linguagem que gerou a resposta de Pixie também produziu as instruções em linguagem natural sobre como ela deveria ser interpretada, e o BreezeBlue as interpretou de forma dinâmica. Isso permite que Pixie improvise vozes durante uma conversa ao vivo.
Dentro de um mesmo trecho de áudio, Pixie pode sussurrar, rir, mudar de emoção ou ajustar o ritmo conforme o momento pede.
Nick não tem como prever o que o público vai pedir a Pixie, nem como o modelo de linguagem vai descrever a interpretação vocal exigida por cada pedido. Na experiência dele, o BreezeBlue lida bem com essas instruções em linguagem natural tão variadas, sem exigir que elas sigam um formato rígido. Essa flexibilidade permite que Pixie responda a pedidos e situações que ele não teria como antecipar ou programar de antemão.
Fazer cada resposta parecer imediata
Nick também projetou seu aplicativo para reduzir o tempo até Pixie começar a falar. Em vez de enviar a resposta inteira como uma única e longa solicitação de texto para voz, o sistema a divide em três partes:
01
Abertura curta
Algumas palavras
02
Primeira frase
Uma frase completa
03
Resto da resposta
O restante da resposta
As primeiras partes já podem começar a tocar enquanto o restante da resposta ainda está sendo preparado. Isso faz a troca parecer mais imediata, mesmo quando Pixie tem uma resposta mais longa a entregar.
Nick estima que, na configuração dele, o Breeze TTS 2 costuma começar a devolver áudio em cerca de 300 milissegundos. Ele o descreve como o sistema de voz mais rápido que já usou.
O aplicativo também inclui proteções para um ambiente ao vivo. Se uma resposta chega tarde demais e a conversa já mudou, o sistema pode descartá-la em vez de interromper o momento atual com uma resposta desatualizada.
É isso que diferencia a voz em tempo real da produção de um arquivo de áudio. O sucesso não depende apenas de o áudio ser gerado em algum momento. Depende de a voz chegar enquanto a resposta ainda faz sentido na conversa.
Dar ao público outra personagem com quem conversar
Hoje Pixie interage tanto com Nick quanto com quem assiste às suas transmissões na Twitch. O público não apenas a escuta. Pode entrar na conversa, o que transforma a coapresentadora de IA em mais uma participante do programa, e não em uma voz tocando ao fundo.
O público sempre gostou de testar os limites do que Pixie consegue fazer, pedindo que ela fale com vozes, sotaques e estilos diferentes. O BreezeBlue trouxe uma capacidade que nenhum sistema anterior tinha resolvido de forma convincente: cantar. Assim que o público descobriu que Pixie podia mudar o jeito de usar a voz e cantar de verdade, o pedido rapidamente virou rotina.
A pedido de um espectador, Pixie muda para uma voz dramática para contar uma história de terror.
Quando um espectador pede que Pixie cante, ela muda a entrega na hora.
Para Nick, essa participação do público também significa que o sistema precisa continuar flexível. Uma narração planejada pode ser gerada com antecedência, mas a mensagem de um espectador não. A resposta de Pixie tem que ser criada na hora, entregue rapidamente e interpretada de um jeito coerente com a personagem dela.
Essa combinação transformou a geração de voz em parte do próprio formato ao vivo. Pixie não está simplesmente lendo um conteúdo que Nick já escreveu. Ela ajuda a criar momentos que não existiriam sem a interação entre o streamer, o público e a personagem.
O que vem a seguir para Pixie
Pixie já foi muito além da ideia original de uma assistente de jogos com voz. O próximo passo de Nick é sincronizar com ainda mais precisão a fala dela, o texto na tela e a animação, tornando a personagem cada vez mais presente nas interações ao vivo.
Com o BreezeBlue, Nick tem a velocidade e o controle expressivo necessários para fazer Pixie parecer presente em uma conversa ao vivo. A geração rápida de voz mantém cada troca em movimento, enquanto a direção precisa ajuda a preservar a personalidade por trás de cada resposta. O BreezeBlue dá a Nick a base de voz de que ele precisa para continuar desenvolvendo Pixie como uma personagem capaz de realmente participar do programa.

