在 YouTube 上观看本教程

YouTube

每一条 AI 视频都从脚本开始,但真正决定脚本效果的是音色。它决定了主讲人的口音、年龄感、音质、活力与个性 — 而语速、停顿和演绎提示则决定了成片听起来像一个真人,还是像机器在念稿。

简单来说:挑选 AI 音色的方法是让语言和地区口音与你的受众相匹配,用资料标签筛出一份候选名单,用你自己的脚本试听每一个候选音色,然后在生成前用语速和停顿来打磨演绎效果。本指南接下来会带你在 VisionStory 中一步步走完这个流程,其 AI 音色库收录了涵盖 88 种语言的 1,000 多个音色。

本指南涵盖的内容:公共音色库,以及围绕它的演绎控制项。用你自己的录音打造专属音色属于另一套流程 — 请参阅如何用 AI 克隆你的音色

步骤 1:打开音色库,读懂音色条目

打开 AI 视频,选择你想使用的虚拟人,然后点击脚本框下方当前的音色。音色库会覆盖在编辑器上方打开。

每一行都带有四个信号,让你在按下播放键之前就能预判这个说话人听起来是什么样:

  • 语言标签 — 该音色所说的语言。
  • 国旗 — 代表地区口音,而不是第二种语言。英语音色可以带有美国、英国、加拿大等国旗。
  • 性别与年龄 — 说话人在听感上的身份。
  • 特质与使用案例 — 诸如清晰、温暖、口语化、旁白、教育或社交媒体等描述。
VisionStory 音色条目上的语言、地区口音、性别、年龄、特质和使用案例标签说明
国旗代表地区口音 — 当你比较同一种语言下的多个音色时,这是最重要的标签。

用这些标签筛出候选名单,而不是直接拍板。两个标签几乎完全相同的音色,在节奏、音质和活力上仍可能相差很大。

步骤 2:筛选、搜索并试听候选名单

先把范围放得足够宽,听出真正的差别,再逐步收窄。在还处于探索阶段时,使用语言性别年龄使用案例筛选器。如果你已经知道某个音色的名称,可以直接在搜索框中输入。

  1. 筛出候选名单。通过筛选或搜索,把结果收窄到几个候选音色,而不是一整份目录。
  2. 逐个试听候选名单。点击音色条目右侧的播放按钮,收听它的示例音频。
  3. 暂停并对比。在播放下一个之前,再次点击同一个按钮停止播放。
VisionStory 音色库,带有搜索框,语言、性别、年龄和使用案例筛选器,以及每个音色条目上的播放按钮
搜索和筛选器让拥有 1,000 个音色的音色库变得容易驾驭;而真正确认是否合适的,是试听。

试听时要围绕你的视频真正需要的东西来判断:地区口音、清晰度、活力、亲和力、权威感,以及这个音色说完一句话的快慢。一个单独听起来很棒的音色,用在教学、销售、新闻或角色驱动的脚本上,仍可能并不合适。

步骤 3:让音色匹配你的内容和受众

大多数令人失望的 AI 配音并不是质量问题,而是匹配问题。在最终确定之前,先想清楚这个音色要为这条视频承担什么任务。

如果你要制作优先选择尽量避开
教程、讲解视频、课程吐字清晰、节奏平稳、语气中性而温和情绪高亢的宣传式播报,会把专业术语念得太赶
广告、宣传片、社媒短视频有活力、有冲击力,自信且偏年轻的音色缓慢克制的旁白,会让开头的钩子失效
新闻、企业内容、产品更新有权威感、语速均匀、音色质感不过分突出过于随意或角色感很强的音色
故事讲述、访谈、播客有个性、表现力跨度大平铺直叙、毫无起伏的播音腔
同一条视频的多语言本地化版本为每个市场选一个当地母语口音用同一个英语音色去念翻译后的文案

口音是最常被选错的一项设置。如果你的受众在伦敦,而你的主讲人挂着美国国旗,听众是能听出来的 — 哪怕每个词都念对了。要按受众来选国旗,而不只是按语言。

步骤 4:先设定语速,再添加停顿

点击某一行音色,即可把它应用到当前设置。然后打开所选音色旁边的语速菜单,选择慢速正常快速

  • 慢速适合需要慢慢体会的讲解,以及任何理解比紧迫感更重要的内容。
  • 正常是大多数教程、演示和虚拟人口播视频的稳妥基准。
  • 快速能为短宣传片和社媒短片增添活力,但信息密集的脚本会变得更难跟上。

语速决定整段表演的节奏。若要在句子内部做控制,把光标放到需要停顿的位置,点击停顿控件。每点击一次增加 0.5 秒;再点一次即可延长停顿。

慢速、正常与快速三种语速的对比,旁边是脚本中插入的 0.5 秒停顿
用语速控制整体节奏,用停顿处理那些承载含义的具体节点。

实用技巧:在真人主播会换气、转换思路或让某个论点落地的地方加停顿。停顿过多会让表达变得支离破碎,所以编辑后要试听整句,而不只是你改动的那一部分。

步骤 5:用音色增强来指导表演

当文案已经写对、但想要的表演效果还不够明确时,点击音色增强。VisionStory 会在保留你原有措辞的前提下,加入情绪、节奏和重音方面的表演提示。

继续之前先检查增强后的脚本。如果这些提示符合你的意图,选择保留;想回到原稿则选择撤销。当脚本需要明确的情绪指导、又不能改动措辞时,这个功能最能发挥作用。

前后对比:音色增强在不改动文字的情况下,加入了平静、克制的表演提示
内容依然是你的;被指导的只是表演方式。

步骤 6:生成前,先用真实脚本预览一遍

音色、语速、停顿以及各项增强提示都设置好后,点击预览音频。请完整听完整段试听,而不是只凭开头几个字下判断,并逐项检查发音、口音、节奏、句尾处理、停顿以及情绪是否贴合。

还在比较多个候选时,先用一句有代表性的短句来试。等候选缩小到两三个后,再预览一段包含成片中最关键的人名、数字、专业术语或情绪转折的内容 — 音色之间的差别正是在这些地方拉开的。

预览额度:音频预览包含一定的免费字符额度,按滚动的 24 小时周期刷新。额度用完后,生成预览按每 500 个字符 1 积分计费。完整说明请见VisionStory 积分机制

步骤 7:先生成一次,让虚拟人记住这个音色

选择音色只会改变当前编辑器中的设置,但仅仅选择并不会把该音色保存到虚拟人上。请用选好的音色生成一条视频,VisionStory 才会记住这一配对,并在你下次使用同一个虚拟人时自动恢复。

三步示意图:选择音色、生成一条视频后保存下来、复用该虚拟人时自动恢复
分界点就是“有没有生成过”:选好音色,生成一次,之后复用该虚拟人时音色已经绑定好了。

这也是值得认真挑选的原因。虚拟人与音色一旦配对,往后的每条视频都从同一个稳定的出镜形象开始,而不必每次重新做决定。

AI 音色为什么听起来像机器人 — 以及如何解决

如果生成出来的配音有明显的合成感,原因通常是下面五个可以修正的问题之一,而不是音色模型本身。

  • 音色与脚本不匹配。用旁白类音色去念广告文案,听上去就是平的。先按使用案例重新筛一轮候选,再去质疑音质。
  • 完全没有停顿。真人说话是要换气的。一整段没有节奏点的文字读出来就像机器,所以要在语义分界处加上半秒停顿。
  • 语速设了一次就再没动过。快速会让信息密集的句子糊成一团;慢速会让短促的宣传片显得拖沓。语速要与内容类型匹配。
  • 标点含糊。句子一逗到底、缺逗号、缩写没有展开,都会把音色推向单调平板。先把脚本清理干净。
  • 没有情绪指引。如果文本里没有体现意图,音色也无从推断 — 这正是音色增强要解决的问题。

把这五点修正掉,大多数关于 AI 音色像机器人的抱怨都会消失,根本不用换音色。

如果供应商下架了你在用的音色

VisionStory 的音色来自多家供应商,供应商可能会把某个音色从自家目录中移除。一旦出现这种情况,该音色就无法再恢复到公开的音色库中。

如果你一直使用的音色消失了,可以从以往视频里找一段只包含该音色的干净语音,把它作为源音频用于音色克隆。克隆出来的音色可以做到比较接近,但不要期望听起来完全一样。

流程图展示如何用以往视频中的干净音频克隆出相近的替代音色
当目录中的音色被下架时,此前已审核通过的视频可以提供干净音频,帮助你保持声音的一致性。

需要授权:只克隆你拥有版权或已获得明确授权的音频,并在发布前用你实际要用的脚本试听替代音色。

生成前的 AI 音色检查清单

  • 按受众选择地区口音,而不只是选择语言。
  • 先用资料标签筛出候选,再用耳朵做最终决定。
  • 用你真实脚本中的人名、数字和难读术语做试听。
  • 先设定整体语速,再添加局部停顿。
  • 只在表达需要更明确的指引时才使用音色增强。
  • 完整听完试听,而不是只听第一句。
  • 如果希望虚拟人记住这个音色,就先生成一次。
  • 把选定的音色名称记入品牌或活动备忘中。

音色一旦确定,后面的流程就很快了。沿用同一套设置做出成片,请看如何创建 AI 口播虚拟人;如果只需要音频,可以打开文本转语音

常见问题

  • 先从受众出发:匹配语言以及国旗所代表的地区口音,再用性别、年龄、特质和使用案例标签筛出几个候选音色。试听时用你真实脚本里的一句话,而不是通用示例,选出节奏、活力和亲和感都契合内容类型的音色。最后设置语速并添加停顿,让朗读效果贴合你的意图。