Breeze TTS:将指令遵循带入语音生成

Breeze TTS 是 BreezeBlue 的指令遵循语音模型,支持可控的 AI 音色设计、演绎控制与高表现力语音生成。

Research Demo

Breeze TTS 研究动机演示

在 BreezeBlue,我们正在重新思考音频智能的未来应该是什么样子。

过去的语音技术擅长复制。但下一代语音 AI 应该做到更多:理解细微差别、适应不同上下文,并始终保持可控。

Breeze TTS 是我们迈出的第一步——一个将先进指令遵循能力带入语音生成的生成式语音模型。

01

动机

语音生成长期围绕真实感优化。我们认为,下一步应该围绕意图优化。

这个领域在自然度、说话人一致性和音色克隆上取得了巨大进步,但高保真复现不等于可控生成。听起来完美的声音,未必适合角色、契合上下文或遵循指令。

其他生成式领域已经迈向这一方向。在语言和视觉生成中,指令遵循已成为核心能力。用户期待模型准确、灵活且富有表现力地回应提示词,语音生成也应该如此。

Breeze TTS 把指令遵循作为语音的一等能力。目标不只是生成自然音频,而是让创作意图真正塑造语音:用角色设定定义音色,用上下文塑造演绎,并让表达随场景变化。


02

Breeze TTS:一种全新的语音模型

Breeze TTS 的核心是一个建立在预训练大语言模型之上的音频语言模型。它进一步使用交错的文本与音频序列训练,让文本和音频可以在同一条序列中建模。在这种形式下,文本提供指令和台词,音频既作为条件信号,也作为生成目标。

因此,Breeze TTS 在两种场景中都具备强指令遵循能力:仅凭文本创造全新音色,以及根据参考语音控制既有音色的演绎方式。


2.1

音色设计:用文本提示创造全新音色

Breeze TTS 结合了世界知识和强大的自然语言理解能力。无论提示词描述角色身份、语气、场景还是风格,它都能遵循开放式文本提示,生成符合角色设定的音色。

Acoustic-Parameter SpecificationDescriptive-Style DirectiveRole-Play
Character 1Character 2Character 3Character 4

Instructions

音色设计:用文本提示创造全新音色

我们使用 InstructTTSEval 评测 Breeze TTS。该基准衡量语音生成对复杂自然语言风格指令的控制能力,覆盖声学参数说明、描述式风格指令和角色扮演三类任务,每类包含 1,000 个测试样本。Breeze TTS 在该基准上取得领先结果,展现了理解复杂指令并生成多样音色的能力。除非另有说明,评测使用 Gemini-3.1-pro 作为裁判;根据内部人工评估,它比 Gemini-2.5-pro 给出的分数更少偏差。


2.2

指令遵循:让既有音色呈现新的演绎风格

指令遵循能力自然产生于长时音频数据训练。Breeze TTS 可以根据自然语言指令改变参考语音的演绎风格,同时保留说话人的核心音色身份。引导强度还可以调节,在说话人一致性与指令遵循之间取得平衡。

LedaSadachbiaSchedarVindemiatrix

Reference Voice

Scene 1Scene 2Scene 3

Instructions

指令遵循:让既有音色呈现新的演绎风格

我们同样使用 InstructTTSEval 评测这一场景。对于 3,000 个测试样本中的每一个,我们从 30 个 Gemini TTS 预设音色中随机选择一个作为 Breeze TTS 的单样本参考,并在推理时调整引导强度,衡量指令遵循与说话人一致性之间的取舍。Breeze TTS 在指令遵循上形成领先的帕累托前沿,并呈现清晰的规模效应:在相同指令遵循水平下,更大的模型能更好地保留说话人一致性。


03

体验 Breeze TTS

语音生成正在从复现走向创造、控制与交互。Breeze TTS 是我们迈出的早期一步:让语音模型理解意图、适应上下文,并解锁更丰富的声音体验。

这只是开始。我们的使命是通过研究与产品创造下一代音频原生体验。我们期待与创作者、开发者和团队一起探索这些体验的可能性。