每支 AI 影片都始於一段腳本,但真正決定腳本效果的是音色。它決定了主講人的口音、年齡、質感、活力與個性 — 而語速、停頓與語氣提示,則決定了成品聽起來像真人,還是像機器在念稿。

簡單來說:挑選 AI 音色時,先讓語言與地區口音對上你的受眾,接著用音色的屬性標籤篩出候選名單,用自己的腳本試聽每一個候選音色,最後在生成前用語速與停頓調整表現方式。本指南接下來會以 VisionStory 為例,一步步帶你走完這個流程;VisionStory 的 AI 音色庫 收錄了涵蓋 88 種語言、超過 1,000 個音色。

本指南涵蓋的範圍:公開的音色庫,以及圍繞它的表現方式控制項。用自己的錄音建立音色屬於另一套流程 — 請參閱如何使用 AI 複製你的音色

步驟 1:開啟音色庫,讀懂音色列

開啟 AI 影片,選擇你要使用的虛擬人像,然後點擊腳本框下方目前的音色。音色庫就會覆蓋在編輯器上方開啟。

每一列都帶有四項訊息,讓你在按下播放之前,就能預判這位說話者聽起來如何:

  • 語言標籤 — 該音色所使用的語言。
  • 國旗 — 代表地區口音,而不是第二種語言。英語音色可能標上美國、英國、加拿大等不同國旗。
  • 性別與年齡 — 聽感上說話者的身分。
  • 特質與使用情境 — 例如清晰、溫暖、口語、旁白、教育或社群媒體等描述。
VisionStory 音色列上的語言、地區口音、性別、年齡、特質與使用情境標籤說明
國旗代表的是地區口音 — 當你比較同一種語言的多個音色時,這是最重要的標籤。

標籤是用來篩出候選名單,而不是用來做最後決定。兩個標籤幾乎相同的音色,在節奏、質感與活力上仍可能差很多。

步驟 2:篩選、搜尋並試聽候選名單

一開始把範圍拉得夠寬,才聽得出真正的差異,之後再逐步縮小。還在探索階段時,請善用語言性別年齡使用情境篩選器。如果你已經知道某個音色的名稱,直接在搜尋欄輸入即可。

  1. 篩出候選名單。持續篩選或搜尋,直到剩下少數幾個候選音色,而不是一整份清單。
  2. 逐一試聽候選音色。點擊音色列右側的播放按鈕,即可聽到試聽樣本。
  3. 暫停後再比較。播放下一個之前,再點一次同一個按鈕即可停止。
VisionStory 音色庫,含搜尋欄,語言、性別、年齡與使用情境篩選器,以及每一列音色的播放按鈕
搜尋與篩選器讓收錄 1,000 個音色的音色庫變得容易掌握;真正確認是否合適,還是要靠試聽。

試聽時,請針對影片真正需要的條件去聽:地區口音、清晰度、活力、溫度、權威感,以及這個音色講完一句話的速度。單獨聽起來很棒的音色,用在教學、銷售、新聞或角色導向的腳本上,仍可能不對味。

步驟 3:讓音色貼合你的內容與受眾

大多數令人失望的 AI 配音其實不是品質問題,而是合不合適的問題。在決定之前,先想清楚這支影片需要這個音色達成什麼。

如果你要做的是該找的特質該避開的
教學、說明影片、線上課程咬字清晰、節奏平穩、帶點中性的溫度高亢的宣傳式念法,容易把專業術語一帶而過
廣告、促銷、社群短片有活力、有爆發力,聽起來自信而年輕緩慢、四平八穩的旁白,會讓開場的鉤子失效
新聞、企業形象、產品更新具權威感、語速平均、聲音質地不過於花俏過於隨性或角色感太強的音色
故事敘述、訪談、播客有個人特色,表現張力足夠毫無起伏的播報式念法
同一支影片的多語版本每個市場都用當地母語口音用同一個英文音色念翻譯後的文案

口音是最常被設定錯的一項。如果你的受眾在倫敦,講者卻掛著美國國旗,聽眾一定會察覺 — 就算每個字都念對也一樣。選國旗時要看受眾,而不是只看語言。

步驟 4:設定語速,再加入停頓

點擊音色列,即可套用到目前的設定。接著開啟所選音色旁的語速選單,選擇慢速正常快速

  • 慢速適合需要沉澱思考的說明,以及任何理解比急迫感更重要的內容。
  • 正常是大多數教學、簡報與會說話虛擬人像影片的安全基準。
  • 快速能為短促銷與社群短片增添活力,但資訊密集的腳本會變得比較難跟上。

語速決定整段演繹的節拍。若要控制句子內部的停頓,把游標放在該有停頓的位置,然後點擊停頓控制項。每點一次會加入 0.5 秒;再點一次可拉長停頓。

慢速、正常與快速三種語速的比較,旁邊是腳本中插入的 0.5 秒停頓
用語速掌握整體節奏,用停頓抓住那些真正承載意義的斷點。

小技巧:在真人講者會換氣、轉換想法或讓一句話沉澱下來的地方加入停頓。停頓太多會讓語句支離破碎,所以編輯後請預覽整句,而不是只聽你改動的那一段。

步驟 5:用音色增強來指導演繹

當文字已經到位、但想要的演繹方式還不夠明確時,點擊音色增強。VisionStory 會在保留你原本用字的前提下,加入情緒、節奏與重音的演繹提示。

繼續之前先檢視增強後的腳本。如果提示符合你的意圖,選擇保留;想回到原稿則選擇復原。當腳本需要明確的情緒指導、卻不該更動文字時,這個功能最能派上用場。

前後對比:音色增強在不改動文字的情況下,加入沉穩、從容的演繹提示
訊息依然是你的,被指導的只是演繹方式。

步驟 6:正式生成前,先用真實腳本試聽

音色、語速、停頓與各項增強提示都設定好之後,點擊預覽音訊。請完整聽完一整段,別只憑前幾個字下判斷,並檢查發音、口音、節奏、句尾語氣、停頓與情緒是否契合。

還在比較候選音色時,先用一句具代表性的短句試聽即可。等名單縮到兩、三個之後,再試聽一段包含成片中最關鍵的人名、數字、專業術語或情緒轉折的內容 — 音色的差距就是在這裡拉開的。

預覽額度:音訊預覽包含一定的免費字元額度,並以滾動的 24 小時週期重置。額度用完後,預覽生成的費用為每 500 個字元 1 點數。完整說明請見 VisionStory 點數如何運作

步驟 7:先生成一次,讓虛擬人像記住這個音色

選擇音色會變更目前的編輯器設定,但光是選取並不會把該音色儲存到虛擬人像上。請用你挑好的音色生成一支影片,VisionStory 才會記住這組搭配,並在你下次使用同一個虛擬人像時自動還原。

三步驟示意圖,顯示音色被選取、在生成一支影片後儲存,並在重複使用該虛擬人像時還原
分界點在於「生成」:選好音色、生成一次,之後重複使用該虛擬人像時就已經帶著這個音色。

這正是值得花心思挑選的原因。虛擬人像與音色一旦配對完成,之後每一支影片都從同一位穩定的主講者開始,而不必重新做一次決定。

AI 音色為什麼聽起來很機械 — 以及該怎麼解決

當生成的配音聽起來很合成,原因通常是五個可修正的問題之一,而不是音色模型本身。

  • 音色和腳本不搭。用旁白型音色念廣告文案就是會顯得平板。先依「使用情境」重新篩一輪候選名單,再去怪音質。
  • 沒有停頓。真人說話會換氣。一整片沒有節拍的文字讀起來就像機器,所以請在語意分段處加上半秒停頓。
  • 語速設定一次就忘了。「快速」會讓資訊密集的句子糊成一團;「慢速」則會讓短篇宣傳影片變得拖沓。請依內容類型調整節奏。
  • 標點含糊。長句連寫、缺少逗號、縮寫沒展開,都會把音色推向單調。請先把腳本整理乾淨。
  • 沒有情緒指引。如果文字裡沒有表達意圖,音色就無從推斷 — 而這正是音色增強(Voice Enhance)存在的意義。

把這五點修好,大多數關於 AI 音色機械感的抱怨,根本不必換音色就會消失。

若供應商下架你使用的音色

VisionStory 的音色來自多家供應商,而供應商可能會將某個音色從自家目錄中移除。一旦發生這種情況,該音色就無法再回到公開的音色庫。

如果你一直仰賴的音色消失了,可以從先前的影片中找出一段只含該音色的乾淨片段,把它當作音色複製的來源音訊。複製出的音色可以做出相當接近的替代方案,但不應期待兩者聽起來完全一模一樣。

流程圖,說明如何以先前影片中的乾淨音訊做為來源,複製出相近的替代音色
當目錄中的音色被下架時,先前已定稿的影片可以提供乾淨音訊,維持聲音的一致性。

需取得授權:只複製你擁有或已明確取得使用授權的音訊,並在發布前用你實際要用的腳本試聽替代音色。

生成前的 AI 音色檢查清單

  • 依受眾選擇地區口音,而不只是挑對語言。
  • 先用音色的屬性標籤篩出候選名單,再用耳朵做最後決定。
  • 用實際腳本中的人名、數字和難唸的專有名詞試聽。
  • 先設定整體語速,再加入個別停頓。
  • 只有在表達方式需要更明確的指引時,才使用音色增強。
  • 完整試聽整段預覽,而不是只聽第一句。
  • 想讓虛擬人像記住這個音色時,先生成一次。
  • 把選定的音色名稱寫進你的品牌或行銷活動筆記。

音色一旦定下來,後續就很快了。你可以依照如何製作 AI 會說話虛擬人像,把同一套設定一路做成完整影片;若只需要音訊,也可以直接開啟文字轉語音

常見問題

  • 先從受眾出發:對上語言,以及國旗所代表的地區口音,再用性別、年齡、特質與使用情境標籤,篩出幾個候選音色。試聽時請用你真實腳本裡的句子,而不是通用範例,然後挑出語速、活力與親和感最符合內容類型的那一個。最後設定語速並加入停頓,讓詮釋方式貼近你的原意。