音色克隆会从真实录音创建可重复使用的合成音色。VisionStory 会分析源样本、处理音频、识别语言与声音特征、生成克隆,并在你用于视频之前提供可预览的效果,方便你先评估。
上传只是机械步骤。源录音决定了成品听起来有多像、以及稳定性有多高。通常来说,1 分钟干净、稳定一致的录音,比起用不同麦克风或在不同房间录了好几分钟更有用。
请负责任地使用音色。只克隆你自己的音色,或你已获得明确许可可使用的音色。不要用音色克隆来冒充他人、绕过同意机制或误导观众。
- 最佳素材:1–2 分钟干净的单人音频。
- 快速录制:在 Clone 对话框内最多可录 15 秒。
- 适用范围:Pro 及以上订阅方案。
步骤 1:在 AI 视频中打开音色克隆
打开 AI 视频 并选择你要使用的头像。在 Script 框下方的音色一行,点击当前音色旁的 Clone。Clone 对话框会打开,同时不会更改该头像现有的音色。

步骤 2:选择上传或录制
对话框提供两种素材来源方式。你可以根据是要测试流程,还是想要尽可能贴近的实际效果来选择。
- 上传音频:更推荐用于追求音质。条件允许时,尽量使用 1–2 分钟的干净样本。
- 录制:适合快速测试。目前应用内录音最多可录 15 秒。
上传文件可使用 .avi、.mp3、.mp4、.m4a、.wav 或 .mov。所选音频片段至少需 3 秒,最长可达 120 秒。

第 3 步:准备更贴近的音频样本
音色克隆复制的不只是声音身份。它还会复现语速、语调起伏、呼吸声、房间环境声、麦克风音染,以及不想要的瑕疵。请以你希望克隆后续使用的风格来录制源音频。
- 只用一位说话者。去掉音乐、重叠人声和背景对话。
- 录制 1–2 分钟干净音频。提供足够的自然变化,但不要混入不一致的录制段落。
- 选择安静、无回声的房间。柔软的家具能减少混响;避开风扇、车流和空调噪音。
- 保持麦克风稳定。在整个样本中维持相同的距离、角度、输入电平和录音环境。
- 自然且一致地说话。保持口音、音量、语速和演绎风格稳定。
- 避免长时间静音空档。使用连续、有用的语音内容,不要用静音来填充文件。

小贴士:如果第一次克隆听起来不够像,请先用更干净、更一致的音频替换源文件,再考虑录制更长的素材。混合质量的录音往往会让克隆学到你原本想去除的不一致。
第 4 步:上传、检查并命名样本
将文件拖入 Import Audio,或点击投放区域选择文件。波形出现后,播放所选片段,留意是否有其他说话者、音乐、爆音(clipping)、回声、突兀剪辑或长时间静音。如果这些问题很明显,建议更换源音频。
输入一个不超过 20 个字符的描述性名称。添加地区后缀有助于区分多个教程或活动音色;例如 Tutorial Voice-en。

第 5 步:创建克隆,让 VisionStory 自动识别语言
点击 Clone Now。VisionStory 会异步处理样本,并打开 Cloned Voice 标签页。处理期间条目会刷新,预览准备好后即可播放。
你无需手动选择源语言。VisionStory 会分析录音并自动分配识别到的语言。建议在源样本中始终使用同一种语言,这样更容易判断识别到的地区、口音和预览效果。

步骤 6:预览、选择并测试克隆
在选择之前,先点击克隆行上的播放按钮进行试听。留意音色特征、口音、语速、发音、房间回声、噪音,以及音色不稳定的变化。若预览里出现明显的音频瑕疵,现在就先提升源音频质量,别等到视频完成后才发现问题。
选择克隆音色,在 Script 文本框输入一句简短的句子,然后点击 预览音频。用短句测试更便于对比,也能确认这个克隆是否适合你计划创作的内容类型。

Voice Clone 套餐与槽位上限
Voice Clone 适用于 Pro 及以上套餐。每个已保存的克隆音色在删除前都会占用 1 个槽位。
| 套餐 | 当前可用的音色克隆额度 |
|---|---|
| Free | 不包含 |
| Pro | 10 个槽位 |
| Advanced | 20 个槽位 |
| Ultra | 50 个槽位 |
| Enterprise | 可定制 |
当你不再需要某个克隆时,打开 Cloned Voice,删除该音色并确认操作。删除克隆会释放其槽位。若被删除的音色当时在编辑器中处于选中状态,VisionStory 将自动切换回可用的默认音色。
支持 88 种语言
88 种独立语言。VisionStory 会自动检测克隆样本的语言;可用的音色选项与输出特性会因语言而异。下方列表在合并地区变体与等价名称后,每种语言仅计 1 项。
- 🇿🇦 南非语
- 🇦🇱 阿尔巴尼亚语
- 🇪🇹 阿姆哈拉语
- 🇸🇦 阿拉伯语
- 🇦🇲 亚美尼亚语
- 🇮🇳 阿萨姆语
- 🇦🇿 阿塞拜疆语
- 🇪🇸 巴斯克语
- 🇧🇾 白俄罗斯语
- 🇧🇩 孟加拉语(Bangla)
- 🇧🇦 波斯尼亚语
- 🇧🇬 保加利亚语
- 🇲🇲 缅甸语
- 🇭🇰 粤语
- 🇪🇸 加泰罗尼亚语
- 🇵🇭 宿务语
- 🇲🇼 齐切瓦语
- 🇨🇳 中文(普通话)
- 🇭🇷 克罗地亚语
- 🇨🇿 捷克语
- 🇩🇰 丹麦语
- 🇳🇱 荷兰语
- 🇬🇧 英语
- 🇪🇪 爱沙尼亚语
- 🇵🇭 菲律宾语
- 🇫🇮 芬兰语
- 🇫🇷 法语
- 🇪🇸 加利西亚语
- 🇬🇪 格鲁吉亚语
- 🇩🇪 德语
- 🇬🇷 希腊语
- 🇮🇳 古吉拉特语
- 🇭🇹 海地克里奥尔语
- 🇳🇬 豪萨语
- 🇮🇱 希伯来语
- 🇮🇳 印地语
- 🇭🇺 匈牙利语
- 🇮🇸 冰岛语
- 🇮🇩 印度尼西亚语
- 🇮🇪 爱尔兰语
- 🇮🇹 意大利语
- 🇯🇵 日语
- 🇮🇩 爪哇语
- 🇮🇳 卡纳达语
- 🇰🇿 哈萨克语
- 🇮🇳 孔卡尼语
- 🇰🇷 韩语
- 🇰🇬 吉尔吉斯语
- 🇱🇦 老挝语
- 🇻🇦 拉丁语
- 🇱🇻 拉脱维亚语
- 🇨🇩 林加拉语
- 🇱🇹 立陶宛语
- 🇱🇺 卢森堡语
- 🇲🇰 马其顿语
- 🇮🇳 迈蒂利语
- 🇲🇬 马达加斯加语
- 🇲🇾 马来语
- 🇮🇳 马拉雅拉姆语
- 🇮🇳 马拉地语
- 🇲🇳 蒙古语
- 🇳🇵 尼泊尔语
- 🇳🇴 挪威语
- 🇮🇳 奥里亚语
- 🇦🇫 普什图语
- 🇮🇷 波斯语
- 🇵🇱 波兰语
- 🇵🇹 葡萄牙语
- 🇮🇳 旁遮普语
- 🇷🇴 罗马尼亚语
- 🇷🇺 俄语
- 🇷🇸 塞尔维亚语
- 🇵🇰 信德语
- 🇱🇰 僧伽罗语
- 🇸🇰 斯洛伐克语
- 🇸🇮 斯洛文尼亚语
- 🇸🇴 索马里语
- 🇪🇸 西班牙语
- 🇰🇪 斯瓦希里语
- 🇸🇪 瑞典语
- 🇮🇳 泰米尔语
- 🇮🇳 泰卢固语
- 🇹🇭 泰语
- 🇹🇷 土耳其语
- 🇺🇦 乌克兰语
- 🇵🇰 乌尔都语
- 🇻🇳 越南语
- 🇬🇧 威尔士语
统计方式:按“语言”而非“地区/本地化”计数——例如,英语的地区变体只算 1 次;挪威语 Bokmål 与 Nynorsk 合并算 1 次;孟加拉语/Bangla 也合并算 1 次。
排查音色克隆不像的问题
音色辨识度不够
用更干净的 1 到 2 分钟样本替换来源音频,且应来自一段不中断的录音。保持麦克风、房间环境、语速与演绎风格一致。
克隆结果听起来有噪声或金属感
戴上耳机听一遍源录音。去掉背景音乐、回声、风扇声、车流声、过度的降噪、削波失真,以及反复的有损导出。更干净的原始录音通常比额外处理更有效。
语速或情绪不对
克隆会从样本中学习这些表达选择。请用你希望之后听到的语气、能量、节奏与说话风格来录制源音频。
语言或口音不符合预期
样本全程使用同一种语言,并避免在克隆录制过程中切换语言。想要最强的发音与口音匹配,请用你计划发布的语言来克隆并测试。
创建你的音色克隆
准备一段干净的源录音,打开 AI 视频,并在用于更长的制作之前先预览效果。想了解更多自定义与多语言音色,请查看 VisionStory 音色克隆功能。
