每支 AI 影片都始於一段腳本,但真正決定腳本效果的是音色。它決定了主講人的口音、年齡、質感、活力與個性 — 而語速、停頓與語氣提示,則決定了成品聽起來像真人,還是像機器在念稿。
簡單來說:挑選 AI 音色時,先讓語言與地區口音對上你的受眾,接著用音色的屬性標籤篩出候選名單,用自己的腳本試聽每一個候選音色,最後在生成前用語速與停頓調整表現方式。本指南接下來會以 VisionStory 為例,一步步帶你走完這個流程;VisionStory 的 AI 音色庫 收錄了涵蓋 88 種語言、超過 1,000 個音色。
本指南涵蓋的範圍:公開的音色庫,以及圍繞它的表現方式控制項。用自己的錄音建立音色屬於另一套流程 — 請參閱如何使用 AI 複製你的音色。
步驟 1:開啟音色庫,讀懂音色列
開啟 AI 影片,選擇你要使用的虛擬人像,然後點擊腳本框下方目前的音色。音色庫就會覆蓋在編輯器上方開啟。
每一列都帶有四項訊息,讓你在按下播放之前,就能預判這位說話者聽起來如何:
- 語言標籤 — 該音色所使用的語言。
- 國旗 — 代表地區口音,而不是第二種語言。英語音色可能標上美國、英國、加拿大等不同國旗。
- 性別與年齡 — 聽感上說話者的身分。
- 特質與使用情境 — 例如清晰、溫暖、口語、旁白、教育或社群媒體等描述。

標籤是用來篩出候選名單,而不是用來做最後決定。兩個標籤幾乎相同的音色,在節奏、質感與活力上仍可能差很多。
步驟 2:篩選、搜尋並試聽候選名單
一開始把範圍拉得夠寬,才聽得出真正的差異,之後再逐步縮小。還在探索階段時,請善用語言、性別、年齡與使用情境篩選器。如果你已經知道某個音色的名稱,直接在搜尋欄輸入即可。
- 篩出候選名單。持續篩選或搜尋,直到剩下少數幾個候選音色,而不是一整份清單。
- 逐一試聽候選音色。點擊音色列右側的播放按鈕,即可聽到試聽樣本。
- 暫停後再比較。播放下一個之前,再點一次同一個按鈕即可停止。

試聽時,請針對影片真正需要的條件去聽:地區口音、清晰度、活力、溫度、權威感,以及這個音色講完一句話的速度。單獨聽起來很棒的音色,用在教學、銷售、新聞或角色導向的腳本上,仍可能不對味。
步驟 3:讓音色貼合你的內容與受眾
大多數令人失望的 AI 配音其實不是品質問題,而是合不合適的問題。在決定之前,先想清楚這支影片需要這個音色達成什麼。
| 如果你要做的是 | 該找的特質 | 該避開的 |
|---|---|---|
| 教學、說明影片、線上課程 | 咬字清晰、節奏平穩、帶點中性的溫度 | 高亢的宣傳式念法,容易把專業術語一帶而過 |
| 廣告、促銷、社群短片 | 有活力、有爆發力,聽起來自信而年輕 | 緩慢、四平八穩的旁白,會讓開場的鉤子失效 |
| 新聞、企業形象、產品更新 | 具權威感、語速平均、聲音質地不過於花俏 | 過於隨性或角色感太強的音色 |
| 故事敘述、訪談、播客 | 有個人特色,表現張力足夠 | 毫無起伏的播報式念法 |
| 同一支影片的多語版本 | 每個市場都用當地母語口音 | 用同一個英文音色念翻譯後的文案 |
口音是最常被設定錯的一項。如果你的受眾在倫敦,講者卻掛著美國國旗,聽眾一定會察覺 — 就算每個字都念對也一樣。選國旗時要看受眾,而不是只看語言。
步驟 4:設定語速,再加入停頓
點擊音色列,即可套用到目前的設定。接著開啟所選音色旁的語速選單,選擇慢速、正常或快速。
- 慢速適合需要沉澱思考的說明,以及任何理解比急迫感更重要的內容。
- 正常是大多數教學、簡報與會說話虛擬人像影片的安全基準。
- 快速能為短促銷與社群短片增添活力,但資訊密集的腳本會變得比較難跟上。
語速決定整段演繹的節拍。若要控制句子內部的停頓,把游標放在該有停頓的位置,然後點擊停頓控制項。每點一次會加入 0.5 秒;再點一次可拉長停頓。

小技巧:在真人講者會換氣、轉換想法或讓一句話沉澱下來的地方加入停頓。停頓太多會讓語句支離破碎,所以編輯後請預覽整句,而不是只聽你改動的那一段。
步驟 5:用音色增強來指導演繹
當文字已經到位、但想要的演繹方式還不夠明確時,點擊音色增強。VisionStory 會在保留你原本用字的前提下,加入情緒、節奏與重音的演繹提示。
繼續之前先檢視增強後的腳本。如果提示符合你的意圖,選擇保留;想回到原稿則選擇復原。當腳本需要明確的情緒指導、卻不該更動文字時,這個功能最能派上用場。

步驟 6:正式生成前,先用真實腳本試聽
音色、語速、停頓與各項增強提示都設定好之後,點擊預覽音訊。請完整聽完一整段,別只憑前幾個字下判斷,並檢查發音、口音、節奏、句尾語氣、停頓與情緒是否契合。
還在比較候選音色時,先用一句具代表性的短句試聽即可。等名單縮到兩、三個之後,再試聽一段包含成片中最關鍵的人名、數字、專業術語或情緒轉折的內容 — 音色的差距就是在這裡拉開的。
預覽額度:音訊預覽包含一定的免費字元額度,並以滾動的 24 小時週期重置。額度用完後,預覽生成的費用為每 500 個字元 1 點數。完整說明請見 VisionStory 點數如何運作。
步驟 7:先生成一次,讓虛擬人像記住這個音色
選擇音色會變更目前的編輯器設定,但光是選取並不會把該音色儲存到虛擬人像上。請用你挑好的音色生成一支影片,VisionStory 才會記住這組搭配,並在你下次使用同一個虛擬人像時自動還原。

這正是值得花心思挑選的原因。虛擬人像與音色一旦配對完成,之後每一支影片都從同一位穩定的主講者開始,而不必重新做一次決定。
AI 音色為什麼聽起來很機械 — 以及該怎麼解決
當生成的配音聽起來很合成,原因通常是五個可修正的問題之一,而不是音色模型本身。
- 音色和腳本不搭。用旁白型音色念廣告文案就是會顯得平板。先依「使用情境」重新篩一輪候選名單,再去怪音質。
- 沒有停頓。真人說話會換氣。一整片沒有節拍的文字讀起來就像機器,所以請在語意分段處加上半秒停頓。
- 語速設定一次就忘了。「快速」會讓資訊密集的句子糊成一團;「慢速」則會讓短篇宣傳影片變得拖沓。請依內容類型調整節奏。
- 標點含糊。長句連寫、缺少逗號、縮寫沒展開,都會把音色推向單調。請先把腳本整理乾淨。
- 沒有情緒指引。如果文字裡沒有表達意圖,音色就無從推斷 — 而這正是音色增強(Voice Enhance)存在的意義。
把這五點修好,大多數關於 AI 音色機械感的抱怨,根本不必換音色就會消失。
若供應商下架你使用的音色
VisionStory 的音色來自多家供應商,而供應商可能會將某個音色從自家目錄中移除。一旦發生這種情況,該音色就無法再回到公開的音色庫。
如果你一直仰賴的音色消失了,可以從先前的影片中找出一段只含該音色的乾淨片段,把它當作音色複製的來源音訊。複製出的音色可以做出相當接近的替代方案,但不應期待兩者聽起來完全一模一樣。

需取得授權:只複製你擁有或已明確取得使用授權的音訊,並在發布前用你實際要用的腳本試聽替代音色。
生成前的 AI 音色檢查清單
- 依受眾選擇地區口音,而不只是挑對語言。
- 先用音色的屬性標籤篩出候選名單,再用耳朵做最後決定。
- 用實際腳本中的人名、數字和難唸的專有名詞試聽。
- 先設定整體語速,再加入個別停頓。
- 只有在表達方式需要更明確的指引時,才使用音色增強。
- 完整試聽整段預覽,而不是只聽第一句。
- 想讓虛擬人像記住這個音色時,先生成一次。
- 把選定的音色名稱寫進你的品牌或行銷活動筆記。
音色一旦定下來,後續就很快了。你可以依照如何製作 AI 會說話虛擬人像,把同一套設定一路做成完整影片;若只需要音訊,也可以直接開啟文字轉語音。
