AI 變聲器就是用在「演出對了、聲音卻不對」的時刻。你已經有一段錄音—像是試錄旁白、角色配音或代言人音軌—但你需要換一個聲音身份,而且不想重錄任何一句。VisionStory 會把這段演出轉換成目標音色,並在同一次製作流程中用它驅動說話虛擬人像。
本教學會匯入一段 10 秒的英文產品旁白,把它轉成 Anika – Sweet and Lively,並輸出一支 16:9、1080p 的代言人影片。開始之前,請先確認你擁有該錄音、影片、角色圖片,以及你打算使用的目標音色之相關權利。
步驟 1:先選角色,再切換到 Import
打開 AI 影片工作區,挑選一位符合成片風格的數位主持人—可以從角色庫選擇,或上傳一張你有權利使用的照片。接著切換到右側的 Import 分頁,匯入錄音檔或影片的音軌。
VisionStory 目前支援匯入 AVI、MP3、MP4、M4A、WAV 和 MOV。若目標只是更換旁白音色,乾淨的音訊檔會是更好的來源;如果聲音在既有影片裡,就以支援的格式直接匯入影片。

步驟 2:匯入錄音並確認可用片段
點擊上傳區域,匯入來源錄音或影片。面板會顯示波形、總長度與選取範圍—此處為 10 秒旁白的完整 00:00–00:10。
先把原音聽一遍,確認開頭與結尾沒有被截斷。如果有明顯的環境雜音,可以啟用 去除雜音—但不要追求「完全無聲」;過度降噪會把呼吸、輕柔音節與情緒細節一併剝掉,讓轉換後的音色聽起來不夠像真人。

步驟 3:從 Voice Library 選擇目標音色
點擊 Change Voice 開啟 Voice Library。你可以用語言、性別、年齡與使用情境來篩選,並在每張音色卡片上按播放鍵預聽。
本範例選擇 Anika,讓原本平淡的產品旁白變成更明亮、適合社群的女聲。廣告、訓練、角色故事與解說片,對清晰度、能量與年齡感的權重都不一樣—請以內容要完成的任務為準,而不只是挑「樣本聽起來好聽」的那個。完整的挑選方法請見 how to choose an AI voice。

步驟 4:確認目標音色與輸出設定
回到製作頁面後,Change Voice 控制項會顯示你選好的目標音色。接著把其餘設定補齊:角色、長寬比、影片模型與解析度。本範例切換為 16:9,使用 V-Character 4.0 並輸出 1080p—很適合橫式產品解說或 YouTube。
變聲器只會替換聲音身份,並不會替你選好適合的主持人或構圖。生成前,請把目標音色和角色看起來的年齡、性別呈現與內容語氣做一次比對—如果不搭,就回到 Voice Library 或角色庫調整。

步驟 5:生成並檢查變聲後的影片
點擊 Generate Talking Video。VisionStory 會把原始演出轉成目標音色,並用它驅動角色的對嘴與表情。渲染完成後,請從頭到尾完整播放一次。
留意專有名詞、輕柔音節、停頓與句尾情緒,也要觀察快語速段落的嘴型。如果音色跟角色或內容在「打架」,就回去更換目標音色;如果問題出在雜音或剪裁不當,請先修正來源音訊—聲音轉換救不了壞掉的素材。

常見問題與解法
- 轉換後的聲音聽起來悶、或有雜音。 檢查來源是否有背景噪音、爆音或音量過低;啟用 去除雜音 或重錄得更乾淨。轉換無法修復嚴重失真或破音的素材。
- 聲音很自然,但不適合這個角色。 重新選一個更貼近角色年齡、性別呈現與能量感的音色—或直接換角色。音色與角色要當作同一個整體來檢視。
- 情緒跟原始錄音不一樣。 轉換會保留演出的節奏與情緒線索,但不同音色的音質與表現範圍不同。多比較幾個候選音色;必要時重錄一段更清楚的演出。
- 語速快的句子對嘴變鬆。 檢查來源是否有趕拍、含糊或連在一起的字詞。把句子縮短、重錄一段更乾淨的版本,通常比一直換更多音色更有效。
一支可用的變聲影片,從來不只是把音色 A 換成音色 B。它來自 乾淨的來源演出、合適的目標音色、匹配的角色,以及對成片的完整檢查。先把演出定下來,再選音色,最後檢查對嘴與角色—這個順序最能減少重錄。如果你想改做一個可重複使用的專屬音色,請參考 cloning your voice with AI。
