在 YouTube 上观看本教程

YouTube

音色克隆会从真实录音中生成一个可复用的合成音色。VisionStory 会分析源样本、处理音频、识别语言与声线特征、生成克隆,并在你用于视频之前提供可预览的效果,方便你先评估再使用。

上传只是机械步骤。最终效果有多像、是否稳定,取决于源录音质量。 通常来说,1 分钟干净且一致的录音,比用不同麦克风或在不同房间里录的几分钟更有价值。

请负责任地使用音色。 只克隆你自己的声音,或你已获得明确授权可以使用的声音。不要用音色克隆去冒充他人、绕过同意,或误导受众。

  • 最佳素材:1–2 分钟干净、单人说话的音频。
  • 快速录制:在 Clone 弹窗内最多可录 15 秒。
  • 可用范围:Pro 及以上订阅方案。

第 1 步:在 AI 视频中打开音色克隆

打开 AI 视频 并选择你要使用的头像。在 Script 框下方的音色一行中,点击当前音色旁的 Clone。Clone 弹窗会打开,同时不会更改该头像现有的音色。

VisionStory AI Video editor with the Clone control highlighted beside the current voice
音色克隆从 AI 视频编辑器中的音色控制入口开始。

第 2 步:选择上传或录制

弹窗提供两种素材来源。根据你是想快速走通流程,还是要尽可能接近原声来选择。

  • 上传音频:更推荐用于追求质量。条件允许时,尽量使用 1–2 分钟的干净样本。
  • 录制:适合快速测试。应用内录音目前最多可录 15 秒。

上传文件可使用 .avi.mp3.mp4.m4a.wav.mov。所选音频片段至少为 3 秒,最长可达 120 秒。

VisionStory Clone dialog comparing audio upload with the built-in recorder
上传能提供足够的干净素材,从而更接近原声;录制则是更快的测试方式。

步骤 3:准备更贴近原声的音频

音色克隆复制的不只是声音身份。它还会复现语速、语调、呼吸、房间环境声、麦克风音色特征,以及一些不想要的瑕疵。请按你希望克隆日后使用的风格来录制源音频。

  • 只用一位说话者。去掉音乐、重叠人声和背景对话。
  • 录制 1–2 分钟干净音频。提供足够的自然变化,但不要混用风格不一致的不同录音段。
  • 选择安静、无回声的房间。软装有助于降低混响;避开风扇、车流和空调噪声。
  • 保持麦克风稳定。整段样本保持相同的距离、角度、输入电平和录音环境。
  • 自然且一致地说话。尽量让口音、响度、语速和表演风格保持稳定。
  • 避免长时间静音。使用连续、有效的语音内容,不要用静音来凑时长。
Voice clone recording checklist and current Pro, Advanced, and Ultra voice slot counts
相比单纯增加录音时长,更好的源音频更可靠地提升相似度。

经验提示:如果第一次克隆听起来偏弱,先用更干净、更一致的音频替换源文件,再考虑录更长的素材。混合质量的材料往往会把你想去掉的不一致也“教”给克隆音色。

步骤 4:上传、检查并命名样本

将文件拖入 Import Audio,或点击投放区域选择文件。波形出现后,播放所选片段,留意是否有其他说话者、音乐、削波失真、回声、突兀剪辑或长时间静音。如果这些问题很明显,请替换源音频。

输入一个不超过 20 个字符的描述性名称。加上地区/语言后缀能让多个教程或活动音色更易区分;例如 Tutorial Voice-en

Audio moving from the VisionStory upload area to a visible waveform ready for review and naming
先检查实际选中的片段,再用一个你在音色库里一眼就能认出来的短名称。

步骤 5:创建克隆,并让 VisionStory 自动识别语言

点击 Clone Now。VisionStory 会异步处理样本,并打开 Cloned Voice 标签页。处理期间条目会刷新,预览就绪后即可播放。

你无需手动选择源语言。VisionStory 会分析录音并自动分配识别到的语言。源样本尽量只使用一种语言,这样更容易判断识别到的地区、口音和预览效果。

A ready VisionStory cloned voice with English detected automatically and a preview button
克隆完成后会显示识别到的语言;克隆过程中不需要语言选择器。

第 6 步:预览、选择并测试克隆音色

在选择之前,先点击克隆行上的播放按钮进行试听。重点听音色特征、口音、语速、发音、房间回声、噪音,以及音调是否出现不稳定的变化。如果预览里有明显瑕疵,建议现在就优化源音频,而不是等视频成片后才发现问题。

选中克隆音色,在 Script 输入框里输入一句简短的句子,然后点击 预览音频。做一次短测试更方便对比,也能确认这个克隆是否适合你计划制作的内容类型。

VisionStory AI Video editor previewing a selected cloned voice with a short script
在用于更长的正式制作前,先用一段简短脚本测试克隆效果。

音色克隆套餐与槽位上限

音色克隆在 Pro 及以上套餐可用。每个已保存的克隆音色会占用 1 个槽位,直到被删除。

套餐当前可用的音色克隆额度
Free不包含
Pro10 个槽位
Advanced20 个槽位
Ultra50 个槽位
Enterprise可定制

当你不再需要某个克隆时,打开 Cloned Voice,删除该音色并确认操作。删除克隆会释放其槽位。如果被删除的音色曾在编辑器中被选中,VisionStory 会自动切换到可用的默认音色。

支持的 88 种语言

88 种独立语言。VisionStory 会自动识别克隆样本的语言;可用的音色选项与输出效果会因语言而异。下方列表在合并地区变体与同义名称后,按“每种语言”计为 1 条。

  • 🇿🇦 南非语(Afrikaans)
  • 🇦🇱 阿尔巴尼亚语
  • 🇪🇹 阿姆哈拉语
  • 🇸🇦 阿拉伯语
  • 🇦🇲 亚美尼亚语
  • 🇮🇳 阿萨姆语
  • 🇦🇿 阿塞拜疆语
  • 🇪🇸 巴斯克语
  • 🇧🇾 白俄罗斯语
  • 🇧🇩 孟加拉语(Bangla)
  • 🇧🇦 波斯尼亚语
  • 🇧🇬 保加利亚语
  • 🇲🇲 缅甸语
  • 🇭🇰 粤语
  • 🇪🇸 加泰罗尼亚语
  • 🇵🇭 宿务语
  • 🇲🇼 奇切瓦语
  • 🇨🇳 中文(普通话)
  • 🇭🇷 克罗地亚语
  • 🇨🇿 捷克语
  • 🇩🇰 丹麦语
  • 🇳🇱 荷兰语
  • 🇬🇧 英语
  • 🇪🇪 爱沙尼亚语
  • 🇵🇭 菲律宾语
  • 🇫🇮 芬兰语
  • 🇫🇷 法语
  • 🇪🇸 加利西亚语
  • 🇬🇪 格鲁吉亚语
  • 🇩🇪 德语
  • 🇬🇷 希腊语
  • 🇮🇳 古吉拉特语
  • 🇭🇹 海地克里奥尔语
  • 🇳🇬 豪萨语
  • 🇮🇱 希伯来语
  • 🇮🇳 印地语
  • 🇭🇺 匈牙利语
  • 🇮🇸 冰岛语
  • 🇮🇩 印度尼西亚语
  • 🇮🇪 爱尔兰语
  • 🇮🇹 意大利语
  • 🇯🇵 日语
  • 🇮🇩 爪哇语
  • 🇮🇳 卡纳达语
  • 🇰🇿 哈萨克语
  • 🇮🇳 孔卡尼语
  • 🇰🇷 韩语
  • 🇰🇬 吉尔吉斯语
  • 🇱🇦 老挝语
  • 🇻🇦 拉丁语
  • 🇱🇻 拉脱维亚语
  • 🇨🇩 林加拉语
  • 🇱🇹 立陶宛语
  • 🇱🇺 卢森堡语
  • 🇲🇰 马其顿语
  • 🇮🇳 迈蒂利语
  • 🇲🇬 马达加斯加语
  • 🇲🇾 马来语
  • 🇮🇳 马拉雅拉姆语
  • 🇮🇳 马拉地语
  • 🇲🇳 蒙古语
  • 🇳🇵 尼泊尔语
  • 🇳🇴 挪威语
  • 🇮🇳 奥里亚语
  • 🇦🇫 普什图语
  • 🇮🇷 波斯语
  • 🇵🇱 波兰语
  • 🇵🇹 葡萄牙语
  • 🇮🇳 旁遮普语
  • 🇷🇴 罗马尼亚语
  • 🇷🇺 俄语
  • 🇷🇸 塞尔维亚语
  • 🇵🇰 信德语
  • 🇱🇰 僧伽罗语
  • 🇸🇰 斯洛伐克语
  • 🇸🇮 斯洛文尼亚语
  • 🇸🇴 索马里语
  • 🇪🇸 西班牙语
  • 🇰🇪 斯瓦希里语
  • 🇸🇪 瑞典语
  • 🇮🇳 泰米尔语
  • 🇮🇳 泰卢固语
  • 🇹🇭 泰语
  • 🇹🇷 土耳其语
  • 🇺🇦 乌克兰语
  • 🇵🇰 乌尔都语
  • 🇻🇳 越南语
  • 🇬🇧 威尔士语

统计方式:按“每种语言”计数,而非按地区/语言环境计数——例如,英语的各地区变体只计 1 次;挪威语的书面语(Bokmål)与新挪威语(Nynorsk)合并计 1 次;孟加拉语/Bangla 也合并计 1 次。

排查:音色克隆听起来不够像

音色辨识度不够

用一段更干净的 1-2 分钟样本替换源音频,且必须来自同一次不间断录制。尽量保持麦克风、环境、语速与演绎一致。

克隆声音嘈杂或带金属感

戴上耳机听源音频。去掉背景音乐、回声、风扇声、车流声、过度降噪、削波失真,以及反复的有损导出。通常,原始录音更干净,比额外处理更有效。

语速或情绪不对

克隆会从样本里学习这些表达方式。录制源音频时,请用你希望后续成品呈现的语气、能量、语速与说话风格。

语言或口音不符合预期

样本中尽量全程使用同一种语言,避免在克隆录制过程中切换语言。想获得最强的发音与口音匹配,建议用你计划发布时使用的语言来克隆并测试。

创建你的音色克隆

准备一段干净的源录音,打开 AI 视频,并在用于更长的制作前先预览效果。想了解更多自定义与多语言音色,请查看 VisionStory 音色克隆功能

常见问题

  • 如果你更在意质量,建议使用 1 到 2 分钟干净且稳定的语音。产品支持从 3 到 120 秒中截取一段音频;而直接录制用于快速测试时,最长为 15 秒。