每段 AI 影片都由一份講稿開始,但真正決定講稿呈現效果的,是音色。它定下主講者的口音、年齡、聲線質感、活力與個性 — 而語速、停頓和演繹提示,則決定成品聽起來像真人,還是像機器在讀稿。

簡單來說:揀選 AI 音色時,先按受眾配對語言和地區口音,再用資料標籤篩出候選名單,然後用自己的講稿逐一試聽,最後在生成前以語速和停頓調整演繹方式。本指南接下來會在 VisionStory 中逐步示範整個流程;VisionStory 的 AI 音色庫收錄超過 1,000 個音色,涵蓋 88 種語言。

本指南涵蓋的內容:公開的音色庫,以及圍繞它的演繹控制項。用自己的錄音建立音色屬於另一套流程 — 請參閱如何用 AI 複製你的音色

步驟 1:開啟音色庫,讀懂音色列的資訊

開啟 AI 影片,選擇想用的虛擬人像,然後按一下講稿框下方顯示的目前音色。音色庫便會在編輯器上方開啟。

每一列都提供四項資訊,讓你在按下播放前,已能大致預測聲音效果:

  • 語言標籤 — 該音色所講的語言。
  • 國旗 — 代表地區口音,並非第二語言。英語音色可以帶有美國、英國、加拿大等不同國旗。
  • 性別與年齡 — 聽眾感受到的說話者身分。
  • 特質與使用情境 — 例如清晰、溫暖、對話感、旁白、教育或社交媒體等描述。
VisionStory 音色列上的語言、地區口音、性別、年齡、特質與使用情境標籤說明
國旗代表的是地區口音 — 當你比較同一語言的多個音色時,這個標籤最為關鍵。

標籤只用來篩出候選名單,而不是用來下最終決定。兩個標籤幾乎相同的音色,在節奏、聲線質感和活力上仍可能相差很遠。

步驟 2:篩選、搜尋並試聽候選名單

一開始範圍要夠闊,先聽得出真正的差別,再逐步收窄。在探索階段,可善用語言性別年齡使用情境篩選器。如果你已經知道音色的名稱,直接在搜尋欄輸入即可。

  1. 建立候選名單。持續篩選或搜尋,直至只剩下幾個候選音色,而不是一整個目錄。
  2. 逐一試聽候選名單。按一下音色列右方的播放按鈕,聽取試聽樣本。
  3. 暫停再比較。再按一次同一個按鈕停止播放,然後才播下一個。
VisionStory 音色庫,設有搜尋欄,語言、性別、年齡和使用情境篩選器,每個音色列都有播放按鈕
搜尋和篩選器令收錄 1,000 個音色的音色庫變得容易駕馭;真正確認是否合適,還是要靠試聽。

試聽時要留意影片實際需要甚麼:地區口音、清晰度、活力、親和感、權威感,以及音色講完一句話的速度。單獨聽起來很出色的音色,用在教學、銷售、新聞或角色演繹類的講稿上,仍然可能並不合適。

步驟 3:讓音色配合你的內容與受眾

大部分令人失望的 AI 配音,問題並非出在質素,而是出在「夾唔夾」。落實選擇之前,先想清楚這把音色在這條影片裏要達成甚麼。

如果你要製作建議選擇應該避免
教學、解說、課程咬字清晰、語速平穩、中性而帶暖意高能量的宣傳式朗讀,會把專業術語讀得太急
廣告、宣傳片、社交平台短片有活力、有衝擊力,自信而偏年輕的音色緩慢、四平八穩的旁白,會令開場鈎子失效
新聞、企業、產品更新具權威感、節奏均勻、聲音修飾少過於隨意或角色感太強的音色
故事敘述、訪談、播客有個性、表現力幅度大平鋪直敘、毫無起伏的播報式朗讀
同一條影片的多語言本地化版本為每個市場選用當地母語口音用同一把英文音色讀所有翻譯後的講稿

口音是最多人設定錯的一項。如果你的受眾身處倫敦,而你的主講音色掛着美國國旗,觀眾一聽就會察覺 — 即使每一個字都讀得準確。選國旗要看受眾,而不只是看語言。

步驟 4:設定語速,再加入停頓

點擊某一行音色,即可套用到目前的設定。然後開啟已選音色旁邊的語速選單,選擇正常

  • 適合需要沉澱思考的解說,以及任何理解比急迫感更重要的內容。
  • 正常是大部分教學、簡報和說話虛擬人像影片的穩妥基準。
  • 能為短宣傳片和社交短片增添活力,但內容密集的講稿會變得難以跟上。

語速決定整段演繹的節奏。若想控制句子內部的停頓位置,把游標放在需要換氣的地方,再按停頓控制項。每按一次增加 0.5 秒;想要更長的停頓就再按一次。

慢、正常與快三種語速的比較,旁邊是在講稿中插入的半秒停頓
用語速掌握整體節奏,用停頓拿捏那些真正帶出意義的關鍵位置。

實用技巧:在真人主講會換氣、轉換想法,或讓一句主張沉澱下來的位置加入停頓。停頓太多會令演繹變得零碎,所以編輯後要預覽整句,而不只是你改動的那一部分。

步驟 5:用音色增強調校演繹方式

當文字本身已經正確,但想要的演繹效果仍未清楚表達出來時,按音色增強。VisionStory 會在保留你原本用字的前提下,加入情緒、節奏與重音的演繹提示。

繼續之前,先檢視增強後的講稿。如果提示符合你的意圖,選保留;想回到原稿則選還原。當一份講稿需要明確的情緒指引、但又不應改動用字時,這個功能就最能發揮作用。

前後對比,展示音色增強在不改動文字的情況下加入平靜、沉穩的演繹提示
訊息依然屬於你;獲得調校的只是演繹方式。

步驟 6:生成前先用真實講稿預覽

音色、語速、停頓和各項增強提示都設定好之後,按預覽音訊。整段聽完再作判斷,不要只憑開頭幾個字下定論,並逐一檢查發音、口音、節奏、句尾語調、停頓和情緒是否貼合。

仍在比較多個候選音色時,先用一句有代表性的短句試聽。當候選名單收窄到兩三個之後,再試聽一段包含成片中最關鍵的人名、數字、專業術語或情緒轉折的文字——差異正是在這些地方拉開的。

預覽額度:音訊預覽附有免費字元額度,以滾動的 24 小時週期重設。額度用完後,預覽生成費用為每 500 個字元 1 點數。完整說明請參閱VisionStory 點數運作方式

步驟 7:先生成一次,讓虛擬人像記住音色

選擇音色會改動目前編輯器的設定,但單靠選擇並不會把該音色儲存到虛擬人像上。請用你挑好的音色生成一條影片,VisionStory 之後便會記住這組配對,下次再用同一個虛擬人像時自動還原。

三步驟示意圖:選擇音色、生成一條影片後儲存、再次使用該虛擬人像時還原
分界點在於生成:選好音色,先生成一次,之後再用該虛擬人像時音色已經綁定好。

正因如此,這個選擇值得花心思。虛擬人像和音色一旦配對,日後每條影片都由同一位一致的主講者開始,不必每次重新決定。

AI 音色為何聽起來很機械——以及如何解決

當生成的配音聽起來很合成,原因通常是以下五個可修正的問題之一,而非音色模型本身。

  • 音色與講稿不匹配。用旁白音色讀廣告文案自然會顯得平淡。怪罪音質之前,先按使用情境重新篩選候選名單。
  • 沒有停頓。真人說話會呼吸。一整片沒有節拍的文字讀出來就像機器,所以要在意思轉折處加入半秒停頓。
  • 語速設定一次就忘了再調。語速調得太快會令資訊密集的句子含糊不清;太慢則會讓短篇宣傳片變得拖沓。節奏要配合內容類型。
  • 標點模糊。句子連寫不斷、漏了逗號、縮寫沒有展開,都會把語音推向單調。先把講稿整理乾淨。
  • 沒有情緒指示。文字裏若沒有帶出意圖,語音就無從推斷——而這正是音色增強的用途。

把這五點修好,大部分關於 AI 音色機械感的抱怨都會消失,甚至完全不用換音色。

若供應商下架你正在使用的音色

VisionStory 的音色來自多家供應商,而供應商有可能從自己的目錄中移除某個音色。一旦出現這種情況,該音色便無法重新加回公開的音色庫。

如果你一直沿用的音色消失了,可以從舊有影片中找一段只有該音色、乾淨無雜音的片段,用作 音色複製 的來源音訊。複製出來的音色可以相當接近原音,但不應期望兩者聽起來完全一樣。

流程圖:展示如何以舊有影片中的乾淨音訊,複製出相近的替代音色
當目錄中的音色下架時,舊有已審批的影片可提供乾淨音訊,維持聲音的一致性。

必須取得授權:只可複製你擁有版權或已獲明確授權使用的音訊,並在發佈前用實際要用的講稿試聽替代音色。

生成前的 AI 音色檢查清單

  • 按受眾選擇地區口音,而不只是選擇語言。
  • 先用資料標籤篩出候選名單,再由耳朵作最後決定。
  • 用真實講稿中的人名、數字和難讀術語試聽。
  • 先設定整體語速,再加入局部停頓。
  • 只在演繹需要更明確指示時,才使用音色增強。
  • 完整聽一次試聽,不要只聽第一句。
  • 想讓虛擬人像記住該音色,就先生成一次。
  • 把選定的音色名稱記錄在品牌或宣傳活動的筆記中。

音色一旦定下來,之後的步驟就會很快。想把同一組設定做成完整影片,可參考如何製作 AI 說話虛擬人像;如果只需要音訊部分,可開啟文字轉語音

常見問題

  • 先由觀眾出發:對準語言,以及國旗顯示嘅地區口音,再用性別、年齡、特質同使用情境標籤篩出幾個候選音色。試聽時用你真實講稿入面嘅句子,而唔係通用示範內容,然後揀一把語速、能量同親和感都啱該內容類型嘅音色。最後設定語速並加入停頓,令演繹貼合你想表達嘅意思。