音色克隆会从真实录音中生成一个可复用的合成音色。VisionStory 会分析源样本、处理音频、识别语言与声线特征、生成克隆,并在你用于视频之前提供可预览的效果,方便你先评估再使用。
上传只是机械步骤。最终效果有多像、是否稳定,取决于源录音质量。 通常来说,1 分钟干净且一致的录音,比用不同麦克风或在不同房间里录的几分钟更有价值。
请负责任地使用音色。 只克隆你自己的声音,或你已获得明确授权可以使用的声音。不要用音色克隆去冒充他人、绕过同意,或误导受众。
- 最佳素材:1–2 分钟干净、单人说话的音频。
- 快速录制:在 Clone 弹窗内最多可录 15 秒。
- 可用范围:Pro 及以上订阅方案。
第 1 步:在 AI 视频中打开音色克隆
打开 AI 视频 并选择你要使用的头像。在 Script 框下方的音色一行中,点击当前音色旁的 Clone。Clone 弹窗会打开,同时不会更改该头像现有的音色。

第 2 步:选择上传或录制
弹窗提供两种素材来源。根据你是想快速走通流程,还是要尽可能接近原声来选择。
- 上传音频:更推荐用于追求质量。条件允许时,尽量使用 1–2 分钟的干净样本。
- 录制:适合快速测试。应用内录音目前最多可录 15 秒。
上传文件可使用 .avi、.mp3、.mp4、.m4a、.wav 或 .mov。所选音频片段至少为 3 秒,最长可达 120 秒。

步骤 3:准备更贴近原声的音频
音色克隆复制的不只是声音身份。它还会复现语速、语调、呼吸、房间环境声、麦克风音色特征,以及一些不想要的瑕疵。请按你希望克隆日后使用的风格来录制源音频。
- 只用一位说话者。去掉音乐、重叠人声和背景对话。
- 录制 1–2 分钟干净音频。提供足够的自然变化,但不要混用风格不一致的不同录音段。
- 选择安静、无回声的房间。软装有助于降低混响;避开风扇、车流和空调噪声。
- 保持麦克风稳定。整段样本保持相同的距离、角度、输入电平和录音环境。
- 自然且一致地说话。尽量让口音、响度、语速和表演风格保持稳定。
- 避免长时间静音。使用连续、有效的语音内容,不要用静音来凑时长。

经验提示:如果第一次克隆听起来偏弱,先用更干净、更一致的音频替换源文件,再考虑录更长的素材。混合质量的材料往往会把你想去掉的不一致也“教”给克隆音色。
步骤 4:上传、检查并命名样本
将文件拖入 Import Audio,或点击投放区域选择文件。波形出现后,播放所选片段,留意是否有其他说话者、音乐、削波失真、回声、突兀剪辑或长时间静音。如果这些问题很明显,请替换源音频。
输入一个不超过 20 个字符的描述性名称。加上地区/语言后缀能让多个教程或活动音色更易区分;例如 Tutorial Voice-en。

步骤 5:创建克隆,并让 VisionStory 自动识别语言
点击 Clone Now。VisionStory 会异步处理样本,并打开 Cloned Voice 标签页。处理期间条目会刷新,预览就绪后即可播放。
你无需手动选择源语言。VisionStory 会分析录音并自动分配识别到的语言。源样本尽量只使用一种语言,这样更容易判断识别到的地区、口音和预览效果。

第 6 步:预览、选择并测试克隆音色
在选择之前,先点击克隆行上的播放按钮进行试听。重点听音色特征、口音、语速、发音、房间回声、噪音,以及音调是否出现不稳定的变化。如果预览里有明显瑕疵,建议现在就优化源音频,而不是等视频成片后才发现问题。
选中克隆音色,在 Script 输入框里输入一句简短的句子,然后点击 预览音频。做一次短测试更方便对比,也能确认这个克隆是否适合你计划制作的内容类型。

音色克隆套餐与槽位上限
音色克隆在 Pro 及以上套餐可用。每个已保存的克隆音色会占用 1 个槽位,直到被删除。
| 套餐 | 当前可用的音色克隆额度 |
|---|---|
| Free | 不包含 |
| Pro | 10 个槽位 |
| Advanced | 20 个槽位 |
| Ultra | 50 个槽位 |
| Enterprise | 可定制 |
当你不再需要某个克隆时,打开 Cloned Voice,删除该音色并确认操作。删除克隆会释放其槽位。如果被删除的音色曾在编辑器中被选中,VisionStory 会自动切换到可用的默认音色。
支持的 88 种语言
88 种独立语言。VisionStory 会自动识别克隆样本的语言;可用的音色选项与输出效果会因语言而异。下方列表在合并地区变体与同义名称后,按“每种语言”计为 1 条。
- 🇿🇦 南非语(Afrikaans)
- 🇦🇱 阿尔巴尼亚语
- 🇪🇹 阿姆哈拉语
- 🇸🇦 阿拉伯语
- 🇦🇲 亚美尼亚语
- 🇮🇳 阿萨姆语
- 🇦🇿 阿塞拜疆语
- 🇪🇸 巴斯克语
- 🇧🇾 白俄罗斯语
- 🇧🇩 孟加拉语(Bangla)
- 🇧🇦 波斯尼亚语
- 🇧🇬 保加利亚语
- 🇲🇲 缅甸语
- 🇭🇰 粤语
- 🇪🇸 加泰罗尼亚语
- 🇵🇭 宿务语
- 🇲🇼 奇切瓦语
- 🇨🇳 中文(普通话)
- 🇭🇷 克罗地亚语
- 🇨🇿 捷克语
- 🇩🇰 丹麦语
- 🇳🇱 荷兰语
- 🇬🇧 英语
- 🇪🇪 爱沙尼亚语
- 🇵🇭 菲律宾语
- 🇫🇮 芬兰语
- 🇫🇷 法语
- 🇪🇸 加利西亚语
- 🇬🇪 格鲁吉亚语
- 🇩🇪 德语
- 🇬🇷 希腊语
- 🇮🇳 古吉拉特语
- 🇭🇹 海地克里奥尔语
- 🇳🇬 豪萨语
- 🇮🇱 希伯来语
- 🇮🇳 印地语
- 🇭🇺 匈牙利语
- 🇮🇸 冰岛语
- 🇮🇩 印度尼西亚语
- 🇮🇪 爱尔兰语
- 🇮🇹 意大利语
- 🇯🇵 日语
- 🇮🇩 爪哇语
- 🇮🇳 卡纳达语
- 🇰🇿 哈萨克语
- 🇮🇳 孔卡尼语
- 🇰🇷 韩语
- 🇰🇬 吉尔吉斯语
- 🇱🇦 老挝语
- 🇻🇦 拉丁语
- 🇱🇻 拉脱维亚语
- 🇨🇩 林加拉语
- 🇱🇹 立陶宛语
- 🇱🇺 卢森堡语
- 🇲🇰 马其顿语
- 🇮🇳 迈蒂利语
- 🇲🇬 马达加斯加语
- 🇲🇾 马来语
- 🇮🇳 马拉雅拉姆语
- 🇮🇳 马拉地语
- 🇲🇳 蒙古语
- 🇳🇵 尼泊尔语
- 🇳🇴 挪威语
- 🇮🇳 奥里亚语
- 🇦🇫 普什图语
- 🇮🇷 波斯语
- 🇵🇱 波兰语
- 🇵🇹 葡萄牙语
- 🇮🇳 旁遮普语
- 🇷🇴 罗马尼亚语
- 🇷🇺 俄语
- 🇷🇸 塞尔维亚语
- 🇵🇰 信德语
- 🇱🇰 僧伽罗语
- 🇸🇰 斯洛伐克语
- 🇸🇮 斯洛文尼亚语
- 🇸🇴 索马里语
- 🇪🇸 西班牙语
- 🇰🇪 斯瓦希里语
- 🇸🇪 瑞典语
- 🇮🇳 泰米尔语
- 🇮🇳 泰卢固语
- 🇹🇭 泰语
- 🇹🇷 土耳其语
- 🇺🇦 乌克兰语
- 🇵🇰 乌尔都语
- 🇻🇳 越南语
- 🇬🇧 威尔士语
统计方式:按“每种语言”计数,而非按地区/语言环境计数——例如,英语的各地区变体只计 1 次;挪威语的书面语(Bokmål)与新挪威语(Nynorsk)合并计 1 次;孟加拉语/Bangla 也合并计 1 次。
排查:音色克隆听起来不够像
音色辨识度不够
用一段更干净的 1-2 分钟样本替换源音频,且必须来自同一次不间断录制。尽量保持麦克风、环境、语速与演绎一致。
克隆声音嘈杂或带金属感
戴上耳机听源音频。去掉背景音乐、回声、风扇声、车流声、过度降噪、削波失真,以及反复的有损导出。通常,原始录音更干净,比额外处理更有效。
语速或情绪不对
克隆会从样本里学习这些表达方式。录制源音频时,请用你希望后续成品呈现的语气、能量、语速与说话风格。
语言或口音不符合预期
样本中尽量全程使用同一种语言,避免在克隆录制过程中切换语言。想获得最强的发音与口音匹配,建议用你计划发布时使用的语言来克隆并测试。
创建你的音色克隆
准备一段干净的源录音,打开 AI 视频,并在用于更长的制作前先预览效果。想了解更多自定义与多语言音色,请查看 VisionStory 音色克隆功能。
