每段 AI 影片都由一份講稿開始,但真正決定講稿呈現效果的,是音色。它定下主講者的口音、年齡、聲線質感、活力與個性 — 而語速、停頓和演繹提示,則決定成品聽起來像真人,還是像機器在讀稿。
簡單來說:揀選 AI 音色時,先按受眾配對語言和地區口音,再用資料標籤篩出候選名單,然後用自己的講稿逐一試聽,最後在生成前以語速和停頓調整演繹方式。本指南接下來會在 VisionStory 中逐步示範整個流程;VisionStory 的 AI 音色庫收錄超過 1,000 個音色,涵蓋 88 種語言。
本指南涵蓋的內容:公開的音色庫,以及圍繞它的演繹控制項。用自己的錄音建立音色屬於另一套流程 — 請參閱如何用 AI 複製你的音色。
步驟 1:開啟音色庫,讀懂音色列的資訊
開啟 AI 影片,選擇想用的虛擬人像,然後按一下講稿框下方顯示的目前音色。音色庫便會在編輯器上方開啟。
每一列都提供四項資訊,讓你在按下播放前,已能大致預測聲音效果:
- 語言標籤 — 該音色所講的語言。
- 國旗 — 代表地區口音,並非第二語言。英語音色可以帶有美國、英國、加拿大等不同國旗。
- 性別與年齡 — 聽眾感受到的說話者身分。
- 特質與使用情境 — 例如清晰、溫暖、對話感、旁白、教育或社交媒體等描述。

標籤只用來篩出候選名單,而不是用來下最終決定。兩個標籤幾乎相同的音色,在節奏、聲線質感和活力上仍可能相差很遠。
步驟 2:篩選、搜尋並試聽候選名單
一開始範圍要夠闊,先聽得出真正的差別,再逐步收窄。在探索階段,可善用語言、性別、年齡和使用情境篩選器。如果你已經知道音色的名稱,直接在搜尋欄輸入即可。
- 建立候選名單。持續篩選或搜尋,直至只剩下幾個候選音色,而不是一整個目錄。
- 逐一試聽候選名單。按一下音色列右方的播放按鈕,聽取試聽樣本。
- 暫停再比較。再按一次同一個按鈕停止播放,然後才播下一個。

試聽時要留意影片實際需要甚麼:地區口音、清晰度、活力、親和感、權威感,以及音色講完一句話的速度。單獨聽起來很出色的音色,用在教學、銷售、新聞或角色演繹類的講稿上,仍然可能並不合適。
步驟 3:讓音色配合你的內容與受眾
大部分令人失望的 AI 配音,問題並非出在質素,而是出在「夾唔夾」。落實選擇之前,先想清楚這把音色在這條影片裏要達成甚麼。
| 如果你要製作 | 建議選擇 | 應該避免 |
|---|---|---|
| 教學、解說、課程 | 咬字清晰、語速平穩、中性而帶暖意 | 高能量的宣傳式朗讀,會把專業術語讀得太急 |
| 廣告、宣傳片、社交平台短片 | 有活力、有衝擊力,自信而偏年輕的音色 | 緩慢、四平八穩的旁白,會令開場鈎子失效 |
| 新聞、企業、產品更新 | 具權威感、節奏均勻、聲音修飾少 | 過於隨意或角色感太強的音色 |
| 故事敘述、訪談、播客 | 有個性、表現力幅度大 | 平鋪直敘、毫無起伏的播報式朗讀 |
| 同一條影片的多語言本地化版本 | 為每個市場選用當地母語口音 | 用同一把英文音色讀所有翻譯後的講稿 |
口音是最多人設定錯的一項。如果你的受眾身處倫敦,而你的主講音色掛着美國國旗,觀眾一聽就會察覺 — 即使每一個字都讀得準確。選國旗要看受眾,而不只是看語言。
步驟 4:設定語速,再加入停頓
點擊某一行音色,即可套用到目前的設定。然後開啟已選音色旁邊的語速選單,選擇慢、正常或快。
- 慢適合需要沉澱思考的解說,以及任何理解比急迫感更重要的內容。
- 正常是大部分教學、簡報和說話虛擬人像影片的穩妥基準。
- 快能為短宣傳片和社交短片增添活力,但內容密集的講稿會變得難以跟上。
語速決定整段演繹的節奏。若想控制句子內部的停頓位置,把游標放在需要換氣的地方,再按停頓控制項。每按一次增加 0.5 秒;想要更長的停頓就再按一次。

實用技巧:在真人主講會換氣、轉換想法,或讓一句主張沉澱下來的位置加入停頓。停頓太多會令演繹變得零碎,所以編輯後要預覽整句,而不只是你改動的那一部分。
步驟 5:用音色增強調校演繹方式
當文字本身已經正確,但想要的演繹效果仍未清楚表達出來時,按音色增強。VisionStory 會在保留你原本用字的前提下,加入情緒、節奏與重音的演繹提示。
繼續之前,先檢視增強後的講稿。如果提示符合你的意圖,選保留;想回到原稿則選還原。當一份講稿需要明確的情緒指引、但又不應改動用字時,這個功能就最能發揮作用。

步驟 6:生成前先用真實講稿預覽
音色、語速、停頓和各項增強提示都設定好之後,按預覽音訊。整段聽完再作判斷,不要只憑開頭幾個字下定論,並逐一檢查發音、口音、節奏、句尾語調、停頓和情緒是否貼合。
仍在比較多個候選音色時,先用一句有代表性的短句試聽。當候選名單收窄到兩三個之後,再試聽一段包含成片中最關鍵的人名、數字、專業術語或情緒轉折的文字——差異正是在這些地方拉開的。
預覽額度:音訊預覽附有免費字元額度,以滾動的 24 小時週期重設。額度用完後,預覽生成費用為每 500 個字元 1 點數。完整說明請參閱VisionStory 點數運作方式。
步驟 7:先生成一次,讓虛擬人像記住音色
選擇音色會改動目前編輯器的設定,但單靠選擇並不會把該音色儲存到虛擬人像上。請用你挑好的音色生成一條影片,VisionStory 之後便會記住這組配對,下次再用同一個虛擬人像時自動還原。

正因如此,這個選擇值得花心思。虛擬人像和音色一旦配對,日後每條影片都由同一位一致的主講者開始,不必每次重新決定。
AI 音色為何聽起來很機械——以及如何解決
當生成的配音聽起來很合成,原因通常是以下五個可修正的問題之一,而非音色模型本身。
- 音色與講稿不匹配。用旁白音色讀廣告文案自然會顯得平淡。怪罪音質之前,先按使用情境重新篩選候選名單。
- 沒有停頓。真人說話會呼吸。一整片沒有節拍的文字讀出來就像機器,所以要在意思轉折處加入半秒停頓。
- 語速設定一次就忘了再調。語速調得太快會令資訊密集的句子含糊不清;太慢則會讓短篇宣傳片變得拖沓。節奏要配合內容類型。
- 標點模糊。句子連寫不斷、漏了逗號、縮寫沒有展開,都會把語音推向單調。先把講稿整理乾淨。
- 沒有情緒指示。文字裏若沒有帶出意圖,語音就無從推斷——而這正是音色增強的用途。
把這五點修好,大部分關於 AI 音色機械感的抱怨都會消失,甚至完全不用換音色。
若供應商下架你正在使用的音色
VisionStory 的音色來自多家供應商,而供應商有可能從自己的目錄中移除某個音色。一旦出現這種情況,該音色便無法重新加回公開的音色庫。
如果你一直沿用的音色消失了,可以從舊有影片中找一段只有該音色、乾淨無雜音的片段,用作 音色複製 的來源音訊。複製出來的音色可以相當接近原音,但不應期望兩者聽起來完全一樣。

必須取得授權:只可複製你擁有版權或已獲明確授權使用的音訊,並在發佈前用實際要用的講稿試聽替代音色。
生成前的 AI 音色檢查清單
- 按受眾選擇地區口音,而不只是選擇語言。
- 先用資料標籤篩出候選名單,再由耳朵作最後決定。
- 用真實講稿中的人名、數字和難讀術語試聽。
- 先設定整體語速,再加入局部停頓。
- 只在演繹需要更明確指示時,才使用音色增強。
- 完整聽一次試聽,不要只聽第一句。
- 想讓虛擬人像記住該音色,就先生成一次。
- 把選定的音色名稱記錄在品牌或宣傳活動的筆記中。
音色一旦定下來,之後的步驟就會很快。想把同一組設定做成完整影片,可參考如何製作 AI 說話虛擬人像;如果只需要音訊部分,可開啟文字轉語音。
