Nick Kilcoyne 是一位住在美国俄勒冈州波特兰的 Twitch 主播,网名是 90sNickTV,也会在 YouTube 上分享内容。他打造了一个充满 90 年代怀旧氛围的直播间,而他的 AI 直播搭档 Pixie,最初源于玩游戏时的一个小需求。
直播中遇到难关时,停下来查攻略并不是理想的解法。它会打断直播的节奏,也让他顾不上和观众交流。
Nick 设想了更有意思的做法:能不能直接开口提问,让一个 AI 角色出声回答,这样就不用中断直播的节奏?
这个想法后来变成了 Pixie,一位能够与 Nick 交谈、对游戏中发生的事情作出反应,并与直播观众互动的 AI 联合主播。最初,她只是一个实用的求助工具;经过大约三年的发展,她逐渐成为一个拥有独特存在感、个性和表演风格的角色。
从一个问题,到一位联合主播

Nick 经常直播自己从未玩过的老游戏。遇到难关是体验的一部分,但停下来查答案可能让直播戛然而止。他希望保留探索游戏时的即兴感,同时让这些时刻对观众更有吸引力。
打造 Pixie 的灵感,来自 Nick 从小喜爱的影视作品中那些友善的 AI 和机器人角色,比如《霹雳五号》中的 Johnny 5、《星球大战》中的 C-3PO,以及《迷失太空》中的 Robot。
最早的想法很简单:Nick 通过 ChatGPT 提问,再把回答用语音播放出来。随着时间推移,他围绕这种互动搭建了更完整的系统,并赋予助手一个角色身份。Pixie 逐渐不再局限于回答游戏问题。她开始以联合主持人的身份回应 Nick,也参与 Twitch 观众的对话。

Pixie v1

Pixie v2

Pixie v3
Pixie 的动画由 Nick 亲手制作。随着她从游戏助手成长为他的直播搭档,她的外形也在不断变化。
这一转变也改变了声音的作用。系统仅仅准确地读出答案,已经不够了。Pixie 的声音需要让人觉得,她是一个真正属于这场直播的角色。
寻找跟得上直播节奏的声音
实时互动对响应时间有着严格的要求。一个声音即使听起来非常出色,如果等到对话已经进入下一个话题才出现,也就失去了意义。
在开发 Pixie 的过程中,Nick 测试了多种云端和本地的文本转语音系统。有些响应很快,但每句话的表达都相似而且容易预测;另一些能表达更丰富的情绪,却会带来足以造成尴尬停顿的延迟。他经常不得不在速度、音质和表现力之间作出取舍。
在为 Pixie 寻找语音解决方案时,Nick 发现了 BreezeBlue。
对 Nick 来说,两种能力缺一不可:Pixie 必须足够快地开口,才能保持实时对话的节奏;同时,她也需要遵循自然语言指令,让表演富于变化、鲜活生动。
“这两点结合在一起,是我认定 BreezeBlue 是合适选择的主要原因。”
不只是朗读,更是表演
Pixie 的声音并不是按照中性的旁白或客服助手来设计的。她可能上一刻还很俏皮,下一刻就需要充满戏剧感,甚至要在同一条回答中改变表达方式。
Nick 使用自然语言指令来指导每句话的表演方式。这些指令可以描述情绪、节奏、口音或其他表达细节。它们使用日常语言来编写,而不是从一组固定的情绪标签中选择,因此可以随着每次对话的语境而变化。
Nick 的系统能够动态生成这些指令。语言模型会结合对话中正在发生的事情,生成自然语言指令,说明 Pixie 应该如何说出下一条回答。BreezeBlue 随后将文本和这些指令转化为语音。
Pixie 实时调整对 André the Giant 的模仿,在低沉的声音中加入法国口音。
一次实时打磨出来的模仿
Nick 最喜欢的一个例子,是他让 Pixie 模仿 André the Giant。这位法国摔跤手兼演员以独特的低沉嗓音闻名。Pixie 先用非常低沉的声音作答。当 Nick 提醒她 André 还带有法国口音时,她便在下一条回答中,将低沉的角色声音与法国口音结合起来。
“Pixie 需要有表现力。她需要有情绪,也需要能够说出不同的口音。”
Nick 不需要选择预设音色、调整滑块,也不需要手动创建新的角色声音。同一个语言模型在生成 Pixie 回答的同时,也会生成指导表演的自然语言指令,由 BreezeBlue 动态理解和执行。这让 Pixie 能够在实时对话中即兴演绎不同的声音。
在同一段音频中,Pixie 可以根据当下的需要低声耳语、发笑、改变情绪,或调整说话节奏。
Nick 无法预先知道观众会让 Pixie 做什么,也无法预判语言模型会生成怎样的声音表演指令。根据他的使用体验,BreezeBlue 能灵活理解这些各不相同的自然语言指令,不要求它们遵循固定格式。这让 Pixie 能够应对各种临时出现的请求和状况,而 Nick 不必事先设想每一种可能,再逐一编写程序来处理。
让每次回应都来得及时
Nick 也对应用的设计进行了优化,以缩短 Pixie 开始说话前的等待时间。系统不会把完整回答作为一条很长的文本转语音请求发送出去,而是将其拆分为三个部分:
01
简短开场
由几个词组成
02
第一个句子
一个完整的句子
03
其余回答
回答的剩余部分
在其余回答仍在准备时,前面的部分就可以开始播放。这样,即使 Pixie 要给出较长的回答,整个交流过程也会显得更即时。
据 Nick 估计,在他的系统配置下,Breeze TTS 2 通常会在约 300 毫秒内开始返回音频。他表示,这是自己用过的速度最快的语音系统。
应用还为直播环境设计了保障机制。如果一条回答来得太迟,而对话已经发生变化,系统可以跳过它,避免用一条过时的答案打断当下的交流。
这正是实时语音与生成音频文件的不同之处。成功不仅取决于音频最终是否生成,还取决于声音出现时,这条回答是否仍然适合当下的对话。
让观众多一个可以交谈的角色
如今,Pixie 既与 Nick 互动,也与观看他 Twitch 直播的观众互动。观众不只是听她说话,也能参与交流,让这位 AI 联合主播成为节目中的另一位参与者,而不只是一个在背景中播放的声音。
观众一直喜欢通过要求 Pixie 使用不同的声音、口音和风格说话,来试探她的能力边界。BreezeBlue 带来了一项此前系统未能令人信服地实现的能力:唱歌。当观众发现 Pixie 可以改变发声方式、真正唱起来之后,唱歌很快就成了他们经常提出的请求。
应一位观众的要求,Pixie 切换到富有戏剧感的声音,讲起恐怖故事。
当一位观众请 Pixie 唱歌时,她当场改变了发声方式。
对 Nick 来说,观众的参与也意味着系统必须保持灵活。预先安排好的旁白可以提前生成,但观众的消息无法预先准备。Pixie 必须当场生成回答、迅速说出来,并让表演始终符合她的角色个性。
这些能力的结合,让语音生成成为直播形式本身的一部分。Pixie 并不只是朗读 Nick 已经写好的内容。她帮助创造了只有主播、观众与角色共同互动,才会出现的时刻。
Pixie 的下一步
Pixie 早已超越最初那个有声游戏助手的设想。接下来,Nick 希望让她的语音、屏幕文字和动画更加精确地同步,让这个角色在实时互动中更有存在感。
借助 BreezeBlue,Nick 获得了让 Pixie 在实时对话中拥有存在感所需的响应速度与声音表现控制能力。快速的语音生成让每次交流顺畅进行,而精确的表达指导则帮助每条回答保持角色个性。BreezeBlue 为 Nick 提供了语音基础,让他能够继续将 Pixie 打造为一个真正参与直播的角色。

