预设声音总是差一点
你脑中有明确的声音,但每个现成选项都差一口气——音色对了年龄不对,口音对了又太字正腔圆。音色设计补上的就是这最后一步:把你听见的那个声音如实写下来,试听结果,再把描述打磨到严丝合缝。当然,如果“足够接近”真的够用,从精选声音出发依然是更快的路。
先去声音库挑一个起点音色设计把一段文字描述变成可复用的原创声音。不需要录音,也不需要参考音色——写清楚角色是谁,试听生成结果,保存后即可在 Breeze Blue 全站使用。
一位六十多岁、饱经风霜的女船长。声音低沉沙哑,语速缓慢而笃定,带一点爱尔兰口音,粗粝之下藏着温暖。
低沉、带砂砾感的女声,从容不迫,隐约的爱尔兰腔调——表面严厉,内里温柔。
“把缆绳系牢,小子——大海从不原谅第二次。”
儿童动画里过度兴奋的机器人小跟班。音调很高、带金属共鸣,语速飞快,随时都要笑出声。
明亮跳脱的合成音色,节奏轻快、带着咯咯笑的能量,语速再快也字字清晰。
“新计划!和旧计划一样,但喷气背包多得多!”
一位平静的冥想引导者,声线中性,三十五岁上下。轻柔带气息,贴近麦克风,近乎耳语却字字分明。
亲密、空气感十足的嗓音,节奏舒缓、中低频温暖——安静,却始终清晰可辨。
“让念头飘走吧,像一朵云掠过辽阔的天空。”
描述、试听、保存的完整闭环在同一个工作台完成,留下的声音会成为你的长期资产。
用自然语言写清角色是谁——年龄、质感、语速、口音、性格。如果角色已经有立绘,也可以直接上传图片,从画面出发。
生成候选声音,听它演绎一句预览台词。感觉不对?调整描述——更低沉、更慢、更粗糙——再生成,直到声音和你脑中的那个对上。
把满意的声音存入声音列表。从这一刻起它就是可复用资产:在文本转语音里选用、在 Studio 项目里选角、在 API 中按 ID 调用。
具体、可听见的特征远胜抽象的性格词。好的描述会直接点出以下几项:
一两句话就够了。写声音听起来是什么样,不用写角色在故事里做了什么。
创作者最常带着这五种情况来找音色设计——每一种会发生什么,说清楚。
你脑中有明确的声音,但每个现成选项都差一口气——音色对了年龄不对,口音对了又太字正腔圆。音色设计补上的就是这最后一步:把你听见的那个声音如实写下来,试听结果,再把描述打磨到严丝合缝。当然,如果“足够接近”真的够用,从精选声音出发依然是更快的路。
先去声音库挑一个起点游戏 NPC、小说人物、虚拟主播——原创角色不会自带一段可供克隆的录音。音色设计完全不需要源音频:描述本身就是源头。把角色设定浓缩成一两句话,得到的是一个背后没有任何真人说话者的原创声音。
看看创作者如何搭建完整角色声音阵容有时立绘先于声音存在。在音色设计工作台里可以直接从角色图片出发:上传立绘,生成一个与画面气质匹配的声音,再补一段文字描述去控制图片表达不了的部分——语速、口音、态度。
从角色立绘开始设计声音网页端一次试听一个候选,在多次生成之间打磨描述。Voice Design API 的颗粒度更大:对设计端点发起一次请求,同一段描述最多可返回 3 个候选声音——适合让流水线先程序化生成短名单,再交给人来拍板。
阅读 Voice Design API 文档POST /v1/text-to-voice/design
{
"voice_description": "A weathered sea captain in her
sixties, low and gravelly, with a faint Irish accent.",
"text": "Tie that line down, lad.",
"preview_count": 3
}那设计环节已经完成了。当同一个声音这句要耳语、下句要嘶吼时,保留声音、去指挥演绎:Breeze TTS 2 支持逐句的自然语言指令。音色设计决定“谁在说”;声音导演决定“这句怎么说”。
在文本转语音里指挥声音演绎四个工具,四种起点。按你手上已有的东西来选。
从一段描述出发——也就是本页。当声音只存在于你脑中或角色立绘里时,设计会创造一个没有录音、没有参考说话人的原创声音。
公开的 Voice Design Benchmark 用 1,000 个角色音色设计任务横向评测主流模型(2026 年 8 月评测)。Breeze TTS 2 在角色契合度与声音多样性上排名第一:
生成声音与描述角色的匹配程度,归一化到 100 分——为参评模型中的最高分。
全部任务产生的 WavLM 独立说话人簇数量——为本次评测中最广的声音多样性。
生成音频中清晰念出目标台词的比例。
Voice Design Benchmark · 2026 年 8 月评测
描述角色,或上传立绘,试听候选声音,保存满意的那一个。保存后的声音立即进入你的声音列表,可在文本转语音里选用,也可以和其他角色一起进入 Studio 项目。
音色设计用一段文字描述或一张角色图片——而不是录音——创造原创声音。你描述说话人的年龄、质感、语速、口音和性格,试听生成结果,保存后即可作为可复用资产用于文本转语音、Studio 项目和 API。
不需要。音色设计不需要任何源音频,也不需要参考说话人——描述本身就是全部输入。如果你恰好拥有目标声音的授权录音,那音色克隆才是更合适的工具。
不属于任何人。设计声音由你的描述生成,它不是任何真人的录音,也不以复现某个特定说话人为目标。相似的描述可能得到相似的结果,因此请把设计声音当作一次原创创作,而不是保证独一无二的音色。
网页端一次试听一个候选,在多次尝试之间打磨描述。通过 API,对设计端点的单次请求最多可返回 3 个候选,适合先程序化筛出短名单、再由人来选定最终声音的流程。
Breeze Blue 全站可用。保存后声音会出现在你的声音列表:在文本转语音里选用、在多角色 Studio 项目里选角、在 API 调用中按 ID 引用——同一个声音、同一个角色,贯穿所有场景。
能——但那属于声音导演,不是音色设计。保留已保存的声音,在文本转语音里逐句下指令:这句耳语、下句情绪推高。设计决定谁在说话;导演决定每句怎么演。
音色设计与 Breeze Blue 其他功能共用同一份积分余额,你可以从免费额度开始。当前方案与积分对应关系见价格页面。