每个 AI 视频都从脚本开始,但真正决定这份脚本呈现效果的是音色。它决定了讲述者的口音、年龄、质感、活力和个性——而语速、停顿和演绎提示,则决定了成片听起来像一个真人,还是像机器在照本宣科。

一句话版本:挑选 AI 音色的方法是:让语言和地区口音匹配你的受众,用属性标签筛出候选名单,用你自己的脚本逐个试听,然后在生成前用语速和停顿打磨演绎效果。本指南接下来会在 VisionStory 中一步步演示这个流程,它的 AI 音色库收录了 88 种语言、超过 1,000 个音色。

本指南涵盖的内容:公共音色库,以及围绕它的演绎控制项。用你自己的录音制作音色属于另一套流程——参见如何用 AI 克隆你的声音

第 1 步:打开音色库,读懂音色条目

打开 AI 视频,选择你要使用的头像,然后点击脚本框下方的当前音色。音色库会覆盖在编辑器上方打开。

每一行都带有四个信号,让你在按下播放键之前就能预判这个音色听起来是什么样:

  • 语言标签——该音色所说的语言。
  • 国旗——代表地区口音,而不是第二种语言。英语音色可能带有美国、英国、加拿大等国旗。
  • 性别与年龄——听感上的说话者身份。
  • 特点与使用场景——例如清晰、温暖、口语化、旁白、教育或社交媒体等描述。
VisionStory 音色条目上的语言、地区口音、性别、年龄、特点和使用场景标签说明
国旗代表的是地区口音——在同一种语言里比较多个音色时,这是最重要的标签。

用这些标签筛出候选名单,而不是据此拍板。两个标签几乎完全相同的音色,在节奏、质感和活力上仍可能相差很大。

第 2 步:筛选、搜索并试听候选名单

先把范围放得足够宽,好听出真实差异,再逐步收窄。还在摸索阶段时,使用语言性别年龄使用场景筛选器。如果你已经知道某个音色的名字,直接在搜索框里输入即可。

  1. 筛出候选名单。不断筛选或搜索,直到剩下几个候选音色,而不是一整份列表。
  2. 逐个试听。点击音色条目右侧的播放按钮,收听该音色的示例。
  3. 暂停并对比。在播放下一个之前,再次点击同一个按钮停止。
VisionStory 音色库:带搜索框,语言、性别、年龄和使用场景筛选器,每个音色条目上都有播放按钮
搜索和筛选让拥有 1,000 个音色的音色库变得好用;而真正确认是否合适,靠的是试听。

试听时要盯住视频真正需要的东西:地区口音、清晰度、活力、亲和力、权威感,以及这个音色读完一句话的快慢。单独听起来很棒的音色,放进教程、销售、新闻或角色驱动的脚本里,仍然可能并不合适。

第 3 步:让音色匹配你的内容与受众

大多数令人失望的 AI 配音并不是质量问题,而是匹配问题。在最终确定之前,先想清楚这条音色要为这支视频完成什么任务。

如果你要制作应该寻找应该避免
教程、讲解、课程咬字清晰、语速平稳、中性而温和高能量的促销式朗读,会把专业术语一带而过
广告、促销、社交短片有能量、有冲击力,自信且偏年轻的音色缓慢、四平八稳的旁白,会让开头的钩子失效
新闻、企业宣传、产品更新权威感、节奏均匀、音色质感不过分突出过于随意或角色化很强的音色
故事讲述、访谈、播客有个性、表现力跨度大毫无起伏的播报式平淡朗读
同一支视频的本地化版本为每个市场选择当地母语口音用一条英语音色去读翻译后的文案

口音是人们最常设置错的地方。如果你的受众在伦敦,而你的讲述者却带着美国国旗标识,听众依然会察觉——哪怕每个词都准确无误。选国旗要看受众,而不只是看语言。

第 4 步:设置语速,再添加停顿

点击音色条目即可将其应用到当前设置。然后打开所选音色旁边的语速菜单,选择慢速正常快速

  • 慢速适合需要沉下心讲解的内容,以及任何理解比紧迫感更重要的场景。
  • 正常是大多数教程、演示和口播头像视频的稳妥基准。
  • 快速能为短促销片和社交短片增加活力,但信息密集的脚本会变得更难跟上。

语速决定整段演绎的节奏。若想控制一句话内部的停顿,把光标放在需要停顿的位置,点击停顿控件。每点击一次增加 0.5 秒;再点一次可以停得更久。

慢速、正常、快速三种语速的对比,旁边是插入脚本中的 0.5 秒停顿
用语速控制整体节奏,用停顿处理那些承载含义的具体节点。

实用技巧:在真人讲述者会换气、转换观点或让一句主张落地的位置加停顿。停顿太多会让演绎变得零碎,所以编辑后要预览整句,而不只是你改动的那一部分。

第 5 步:用音色增强调校演绎方式

当文案已经到位、但想要的演绎效果还不够明确时,点击音色增强。VisionStory 会在保留你原有措辞的前提下,加入关于情绪、节奏和重音的演绎提示。

继续之前先检查增强后的脚本。如果提示符合你的意图,选择保留;想回到原稿则选择撤销。当脚本需要明确的情绪指导、又不希望被改写时,这个功能最有价值。

前后对比:音色增强在不改动文字的情况下加入了平静、沉稳的演绎提示
内容依然是你的,被调整的只是演绎方式。

第 6 步:生成之前,先用真实脚本试听

音色、语速、停顿以及各项增强提示都设置好之后,点击 预览音频。要完整听完整段,而不是只听开头几个词就下判断,重点检查发音、口音、节奏、句尾处理、停顿以及情绪是否贴合。

还在对比候选音色时,先用一句有代表性的短句试听。候选缩到两三个之后,再试听一段包含成片中最关键的人名、数字、专业术语或情绪转折的内容——音色之间的差距正是在这些地方拉开的。

试听额度:音频预览包含一定的免费字符额度,按 24 小时滚动周期刷新。额度用完后,生成预览按 每 500 字符 1 积分 计费。完整说明见VisionStory 积分如何使用

第 7 步:先生成一次,让头像记住这个音色

选择音色会改变当前编辑器的设置,但仅仅选择并不会把这个音色保存到头像上。用你选定的音色生成一条视频,VisionStory 才会记住这一配对,并在你下次使用同一个头像时自动恢复。

三步示意图:选中音色、生成一次视频后保存、再次使用该头像时自动恢复
分界点在于生成:先选音色,生成一次,之后再用这个头像时音色就已经绑定好了。

正因如此,这个选择值得认真对待。头像和音色一旦配对,之后每条视频都从一位固定的口播形象开始,而不必每次重新决定。

AI 音色为什么听起来像机器人——以及如何解决

当生成的配音显得机械时,原因通常是以下五个可修复的问题之一,而不是音色模型本身。

  • 音色与脚本不匹配。用旁白音色去念广告文案,听起来就是平的。先按使用场景重新筛一遍候选,再去怪音质。
  • 没有停顿。真人说话是要换气的。一整段文字没有任何停顿,听起来就像机器,所以要在语意分界处加上半秒的停顿。
  • 语速设了一次就再没管过。快速会让信息密集的句子糊成一团;慢速会让短促的推广片显得拖沓。语速要与内容类型匹配。
  • 标点含糊。一逗到底的长句、缺失的逗号、没有展开的缩写,都会把音色推向单调。先把脚本清理干净。
  • 没有情绪指引。如果文本里没有体现意图,音色就无从推断——而这正是音色增强要解决的问题。

把这五点修好,大多数关于 AI 音色像机器人的抱怨都会消失,甚至根本不用换音色。

如果供应商下架了你正在使用的音色

VisionStory 的音色来自多家供应商,供应商可能会把某个音色从自己的音色目录中移除。一旦发生这种情况,该音色就无法再恢复到公共音色库中。

如果你一直依赖的音色消失了,可以从以前的视频里找一段只包含该音色的干净音频,把它作为源音频用于音色克隆。克隆可以得到非常接近的替代音色,但不要期待它听起来完全一致。

流程图:展示如何用以往视频中的干净音频克隆出相近的替代音色
当目录中的音色被下架时,以往已确认的视频可以提供干净音频,帮助你保持声音的连贯性。

需获得授权:只克隆你拥有版权或已获得明确授权的音频,并在发布前用你实际要用的脚本试听替代音色。

生成前的 AI 音色检查清单

  • 按受众选择地区口音,而不只是选对语言。
  • 先用属性标签筛出候选,再用耳朵做最终判断。
  • 用真实脚本中的人名、数字和难读术语来试听。
  • 先设定整体语速,再添加局部停顿。
  • 只有当演绎需要更明确的指引时,才使用音色增强。
  • 完整听完一段试听,不要只听第一句。
  • 想让头像记住这个音色,就先生成一次。
  • 把选定的音色名称写进你的品牌或活动备注里。

音色一旦确定,后面的流程就很快了。用同样的设置一路做出成片,参见如何创建 AI 口播头像;如果你只需要音频部分,可以打开文本转语音

常见问题

  • 先从受众出发:匹配语言以及国旗所代表的地区口音,再用性别、年龄、特点和使用场景标签筛出几个候选。试听时用你真实脚本里的句子,而不是通用示例,选出语速、活力和亲和感都契合内容类型的那一个。最后设置语速并加入停顿,让演绎效果符合你的表达意图。