最短 5 秒样本 克隆一个可复用的声音
上传或录制一段经过授权的语音样本——MP3 或 WAV,至少 5 秒——确认你拥有相应权利,先对照原声试听克隆效果,再决定是否保存。你不需要自己裁剪:我们会分析前 60 秒,并保留最合适的 30 秒用于克隆。保存后即可在 BreezeBlue 的任何地方使用:文本转语音、Studio 和 API。
四步,从样本到可复用的声音
- 1
添加授权样本
上传至少 5 秒的 MP3 或 WAV(不超过 5 MB),或直接在浏览器里录制 5 到 30 秒。单一说话人,尽量减少背景噪音——我们会分析前 60 秒,并保留最合适的 30 秒用于克隆。
- 2
确认同意与权利
只有在你确认拥有该声音的必要权利或授权、并同意不将其用于欺骗或伤害之后,克隆才会开始。
- 3
对照原声试听
生成试听版本,把克隆后的朗读与参考样本并排对比,再决定是否保留。
- 4
保存并投入使用
把声音保存到声音库,然后在文本转语音、Studio 项目或任何 /v1 API 请求中使用——随时可以删除。
样本需要什么,你能掌控什么
BreezeBlue 的音色克隆遵循一个简单的约定:输入是简短、干净、经过授权的音频,输出是一个私有、可随时删除的声音。
时长与格式
MP3 或 WAV,不超过 5 MB,时长至少 5 秒;浏览器内录制为 5 到 30 秒。你不需要自己裁剪或刻意凑时长:我们会分析前 60 秒,最多保留 30 秒,并在完整句子处切分、绝不切在词中间,再把这段音频统一到一致的响度。
好样本长什么样
安静的房间、单一说话人、自然的朗读节奏。避免音乐、音效和多人交谈。如果试听效果单薄,重录一段更干净的样本往往比录得更长更有效。
同意与权利
每一次克隆都从一份明确的确认开始:你拥有使用该声音的权利或授权——你自己的声音,或明确同意过的说话人。不确认,就不克隆。
删除与控制
克隆的声音只属于你的账号。随时可以在声音库中删除,或通过一个 API 调用删除;删除后的声音无法再用于生成音频。
先试听,再保存,然后随处可用
在正式保存之前你就能听到克隆效果;保存之后,它和 BreezeBlue 的其他声音完全一样——可指挥、可复用,Web 应用和 API 都能调用。
保存前先试听
克隆流程会生成一段试听朗读,可与参考样本并排播放。诚实地对比:如果相似度不够,先调整样本、重新生成,再考虑保存。
保存为可复用的声音
保存后的克隆会成为声音库里一个有名字的声音,跨会话、跨项目使用,无需重新上传样本——每次生成的音色都保持一致。
在文本转语音和 Studio 里指挥它
在文本转语音工作台或 Studio 项目中选择克隆声音,用大白话逐句指挥节奏、情绪和语气——音色本身保持不变。
短样本克隆,应该期待什么
诚实的预期比夸张的承诺更有用。
短样本足以捕捉一个声音的辨识度——音色、音域和整体气质——能胜任旁白、角色配音和日常创作。但它不会复刻说话人的每一个习惯:5 秒无法承载一个人完整的情绪与节奏变化,因此更干净、稍长一些的朗读能给我们更多可挑选的素材。不过素材并非越长越好——超过 30 秒的参考音频反而会让克隆偏离原声,所以我们分析前 60 秒、替你保留最合适的 30 秒,而不是让你自己动手裁剪。
保存后的克隆声音依然可以被指挥。在公开的 Voice Direction 基准测试(2026 年 8 月)中,Breeze TTS 2 在遵循自然语言表演指令上取得 4.25 的 Overall VDS,同时说话人相似度保持在 0.67——是参评模型中的最好成绩。这意味着你可以要求克隆声音读得更慢、更温暖或更疲惫,而它听起来仍然是原来的说话人。
查看 Voice Direction 基准测试结果克隆得好的部分
音色、音域、口音色彩和整体气质——让一个声音有辨识度的那些特质——即使是短样本也能很好地保留。
5 秒不够的部分
呼吸位置、独特的停顿节奏等细微习惯,需要更多可供挑选的素材。如果试听显得平淡,可以换一段更干净或稍长一些的录音——依然不用你自己裁剪,我们始终会保留最合适的 30 秒。
始终掌握在你手里的部分
克隆之后依然可以指挥演绎:像“更轻、更从容、带一点笑意”这样的指令会改变表演,而不会改变音色本身。
为授权而建,而不是为冒充
克隆工具的可信度取决于它的边界。这是我们的边界。
授权是硬性门槛
每一份样本在克隆开始前都必须明确确认你拥有权利或授权。未经说话人许可克隆声音违反 BreezeBlue 的使用条款。
禁止欺骗与伤害
平台生成的音频不得用于欺诈、误导或骚扰任何人。你在克隆时接受的授权确认正涵盖这一点,违规会失去使用资格。
默认私有
克隆的声音只属于你的账号,不会出现在公开声音库中,其他用户也无法用它生成音频。
没有可授权的样本?没有样本也能得到一个有辨识度的声音—— 用 AI Voice Design 描述一个原创声音
克隆声音的用武之地
保存后的克隆在 BreezeBlue 的每个产品面都是一等公民。
关于音色克隆的诚实回答
克隆一个声音需要多长的音频?
至少 5 秒。上传为 MP3 或 WAV(不超过 5 MB),不必担心时长上限;浏览器内录制为 5 到 30 秒。我们会分析上传音频的前 60 秒,最多保留 30 秒,并在完整句子处切分而不是切在词中间,所以你无需自己裁剪或凑时长。在此之外,音频干净比时长更重要——安静环境下的 20 秒样本,通常胜过嘈杂环境里的录音。
什么样的参考样本效果好?
在安静环境中由单一说话人自然朗读——不要背景音乐、音效或多人重叠。如果克隆试听显得单薄或发闷,重录样本通常是最有效的改进方式。
我可以克隆谁的声音?
只能克隆你拥有权利或书面授权的声音——你自己的,或明确同意过的说话人。每次克隆都从授权确认开始,未经许可克隆他人声音违反 BreezeBlue 的使用条款。
保存之前能先听到克隆效果吗?
可以。克隆流程会生成一段试听,可与原始样本并排播放。只有当试听让你满意时再保存;否则调整样本后重新生成。
克隆的声音可以删除吗?
随时可以。在应用的声音库中删除,或调用声音 API 的删除接口。删除后的声音无法再用于生成音频。
有音色克隆 API 吗?
有。Developer API 支持用授权样本创建克隆声音、列出并管理你的声音,并在任何 /v1 文本转语音请求中使用返回的 voice id——与 Web 应用中的声音完全一致。
克隆的声音可以商用吗?
BreezeBlue 付费方案生成的音频可用于商业项目,前提是你拥有该克隆声音本身的权利,并且用途符合你确认过的授权范围。
音色克隆的价格如何?
BreezeBlue 免费即可上手,每位用户每天都能领取免费额度。付费方案随声音库成长提供更多月度额度和音色位。完整对比见价格页面。