最具表现力、最可被指挥的 文本转语音模型

导演一场表演所需的一切

一整套控制力,用来塑造每一个声音、每一句台词。

压住怒火,用冷淡、带刺的反讽说;重读“你说的都对”和“是我错了”,最后两个问句逐渐尖锐,但不要喊。

“ 好吧,你说的都对,是我错了。这样总行了吧?你还想让我怎么样呢? ”

用大白话就能指挥的声音

我们接收一条自然语言指令——一句台词该有什么感觉、该像谁、该用什么节奏——再让模型照着演绎你的文稿。你可以像导演指挥演员那样塑造每一次表达,而不是只能接受一种固定的读法。

以下录音使用同一个声音,展示不同指令下的演绎。台词保留各段录音实际使用的标点和停顿。

表现力,可以被测量

在公开的 Voice Direction Benchmark(700 个演绎任务,2026 年 8 月评测)上,Breeze TTS 2 以 4.25 / 5 的综合 Voice Direction Score 领先,同时说话人相似度保持在 0.67——声音会跟随你的指挥去演,而不会漂移成另一种音色。

查看完整的 Voice Direction 基准评测
4.25
综合 Voice Direction Score(1–5 分制)
0.67
被指挥时保持的说话人相似度(0–1)
9
覆盖的控制维度,从口音、情绪到意图

实时,为低延迟而生

语音以毫秒级流式返回,足够支撑实时语音助手与互动媒体。你可以在用户开口的那一刻就给出回应,无需等待渲染。

会表演的声音

每一句都带着真实的情绪起伏——一声耳语、一段逐渐高涨的兴奋、一拍迟疑。最终听起来是被演出来的,而不是被机器念出来的。

真正有性格的音色库

从精选的声音里挑选,每一个都有自己的个性——也可以克隆和设计你自己的声音。每个声音都完全可被指挥,随时可以开演。

一个语音引擎,胜任各种创作

无论你在做什么内容,BreezeBlue 的声音都为它而生、为它而演。

有声书阅读界面正在朗读章节

有声书与旁白

把书稿和剧本转成自然的旁白,跨章节保持一致的角色与节奏,所需时间只是过去的一小部分。

带有配音字幕的视频画面

视频配音

为视频、节目和动画制作配音,语气与情绪都可被指挥,让朗读贴合画面,无需进棚录制。

两位主播之间的播客对话文字稿

播客

用可逐句指挥的、稳定专业的旁白制作播客,大幅减少手动录制的时间。

聊天助手用自然的声音回复

对话式智能体

为聊天机器人和虚拟助手赋予自然、拟人的声音,实时应答,让交互真正像在对话。

用情绪化演绎配音的游戏角色

游戏与角色

通过文本转语音 API 为游戏角色和原创群像配音,结合上下文、情绪精准的演绎贴合每一个场景。

网页应用与 API 双端可用

同一条指令,两条路径运行

把下面的指令和台词填入 Creator,或通过 API 提交,尝试用自己的声音演绎这段内容。

指令

压住怒火,用冷淡、带刺的反讽说;重读“你说的都对”和“是我错了”,最后两个问句逐渐尖锐,但不要喊。

文本

好吧,你说的都对,是我错了。这样总行了吧?你还想让我怎么样呢?

在 Creator 里,把它们分别填进指令栏和文稿栏;通过 API,则在一次合成请求里发送同样的两段文字,音频会流式返回。

BreezeBlue Creator

在一个浏览器创作工具里设计、指挥并生成声音。

BreezeBlue Creator 文本转语音工作台,含指令、文稿与播放器

文本转语音 API 与 SDK

通过 API 或 SDK 把 BreezeBlue 文本转语音集成进你的产品。

调用 BreezeBlue 文本转语音的 Python SDK 代码示例

常见问题

BreezeBlue 和其他文本转语音工具有什么不同?

在我们的语音模型里,你用大白话写下指令——“像深夜电台主持人那样,温暖而从容”——声音就会照着调整它的演绎。这是自然语言式的导演,就像你给配音演员说戏,而不是从一份固定的预设情绪清单里挑。

我可以微调某些台词的演绎吗?

可以。除了整体指令,你还能在文字任意位置插入像 [sob]、[sigh]、[giggle] 这样的简短括号提示,来塑造某一个瞬间。Instruction Commitment 控制项则让你设定声音对指令的执行力度——从稳定克制到大胆张扬。

文本转语音可以用什么样的参考声音?

平台上的任何声音都能作为你的参考。可以从精选音色库里挑选——每个声音都有自己的个性,而不是千篇一律的旁白——也可以用一小段样本克隆你自己的声音,或用一段文字提示设计全新的声音。

BreezeBlue 支持哪些语言?

Breeze TTS 2 Multilingual 支持 51 种语言。可用语言取决于你选择的模型,BreezeBlue 只会显示当前由该模型开放的语言。

生成的音频可以商用吗?

在 BreezeBlue 付费方案下生成的音频可用于商业项目,从视频、广告到游戏和有声书都可以。

价格如何?有免费方案吗?

有。BreezeBlue 免费即可上手,每位用户每天都能领取免费额度。付费方案在此基础上提供更多的月度额度、声音槽位和更快的生成速度,随你的需求扩展。完整明细见我们的定价页面。

我可以导出哪些音频格式?

在文本转语音和工作台中生成的音频以 WAV 下载,音色库里的声音以 MP3 下载。

AI 文本转语音真的能有情绪吗?

能——而且是测出来的,不是口头承诺。在公开的 Voice Direction Benchmark(2026 年 8 月)上,Breeze TTS 2 在情绪、意图、口音等 9 个控制维度上取得 4.25 / 5 的综合得分。实际使用时,你只需描述想要的感觉——强忍的悲伤、逐渐高涨的兴奋、干巴巴的讽刺——声音就会照着演,而不是套用一个现成的“开心”或“难过”预设。

怎样写出模型能执行的声音指令?

把它当成导演的说戏笔记:写清情绪、这句话背后的意图和节奏,而不是堆砌形容词。“用耳语的方式说,非常轻、非常紧张,仿佛害怕被人听见”就比“戏剧化地耳语”有效得多。本页每条示例都原样展示了完整指令,你可以从其中一条出发,只改一个细节,然后听听发生了什么变化。

API 能获得和网页版一样的指令控制吗?

能。文本转语音 API 与网页版 Creator 跑的是同一个模型,同一条自然语言指令在两边会得到同样的演绎。音频通过 API 流式返回,SDK 几行代码即可完成调用,而本页给出的完全相同的输入也方便你验证两条路径的结果一致。