音色克隆會從真實錄音建立可重複使用的合成音色。VisionStory 會分析來源樣本、處理音訊、偵測其語言與聲音特徵、建立克隆,並在你用到影片前先產生可預覽的結果,讓你評估效果。
上傳只是機械流程。來源錄音決定了成果聽起來有多像、以及有多穩定。通常,一段乾淨、音質一致的 1 分鐘錄音,比起用不同麥克風或在不同房間錄了好幾分鐘,更有價值。
請負責任地使用音色。只克隆你自己的音色,或你已取得明確授權可使用的音色。請勿用音色克隆來冒充他人、規避同意,或誤導觀眾。
- 最佳來源:1–2 分鐘乾淨、單一說話者的音訊。
- 快速錄音:在 Clone 對話框內最多可錄 15 秒。
- 適用方案:Pro 與更高等級訂閱方案。
步驟 1:在 AI 影片中開啟音色克隆
開啟 AI 影片 並選擇你要使用的虛擬人物。在 Script 方塊下方的音色列中,點擊目前音色旁的 Clone。Clone 對話框會開啟,但不會變更該虛擬人物既有的音色。

步驟 2:選擇上傳或錄音
對話框提供兩種來源方式。請依你是要測試流程,或是想取得在實務上最接近的匹配效果來選擇。
- 上傳音訊:品質優先時建議使用。若可以,請使用 1 到 2 分鐘的乾淨樣本。
- 錄音:適合快速測試。App 內建錄音目前最多可錄 15 秒。
可上傳的檔案格式包含 .avi、.mp3、.mp4、.m4a、.wav 或 .mov。所選音訊片段至少需 3 秒,最長可到 120 秒。

步驟 3:準備更貼近原聲的音訊
音色克隆複製的不只是聲音身分。它也可能重現語速、語調起伏、呼吸聲、空間聲、麥克風音染,以及不想要的雜訊與瑕疵。請用你希望之後克隆採用的風格來錄製來源音檔。
- 只用一位說話者。移除音樂、重疊人聲與背景對話。
- 錄製 1–2 分鐘乾淨音檔。提供足夠的自然變化,但不要混用不一致的錄音場次。
- 選擇安靜、無回音的空間。柔軟的家具可降低混響;避開風扇、車流與冷氣噪音。
- 保持麥克風固定。整段樣本都維持相同的距離、角度、輸入音量與錄音環境。
- 自然且一致地說話。口音、音量、語速與表演方式都要保持穩定。
- 避免長時間空白。用連續、有效的語音內容,別用靜音把檔案硬湊長。

小技巧:如果第一次克隆聽起來偏弱,先用更乾淨、更一致的音訊替換來源,再考慮錄更長的版本。品質混雜的素材往往會讓克隆把你想去除的不一致也一併學起來。
步驟 4:上傳、檢查並為樣本命名
將檔案拖曳到 Import Audio,或點擊拖放區選擇檔案。波形出現後,播放你選取的區段,留意是否有其他說話者、音樂、破音、回音、突兀剪接或長時間靜音;若問題明顯,請更換來源音檔。
輸入最多 20 個字元的描述性名稱。加上語系後綴能讓多個教學或活動音色更好區分,例如:Tutorial Voice-en。

步驟 5:建立克隆,讓 VisionStory 自動偵測語言
點擊 Clone Now。VisionStory 會以非同步方式處理樣本,並開啟 Cloned Voice 分頁。處理期間項目會更新狀態,預覽就緒後即可播放。
你不需要手動選擇來源語言。VisionStory 會分析錄音並自動指派偵測到的語言。請在來源樣本中一致使用同一種語言,這樣偵測到的語系、口音與預覽效果會更容易判斷。

步驟 6:預覽、選擇並測試克隆
在選取之前,先使用克隆列上的播放按鈕進行試聽。請留意音色辨識度、口音、語速、發音、空間回音、雜音,以及音色不穩定的變化。如果預覽中出現明顯瑕疵,建議現在就先改善來源素材,而不是等到影片完成後才發現問題。
選擇克隆音色,在 Script 欄位輸入一個簡短句子,然後點擊 Preview Audio。短測試更容易做比較,也能確認這個克隆是否符合你打算製作的內容類型。

Voice Clone 方案與名額上限
Voice Clone 於 Pro 及以上方案提供。每個已儲存的克隆音色都會佔用 1 個名額,直到你將其刪除。
| 方案 | 目前可用的音色克隆名額 |
|---|---|
| Free | 不包含 |
| Pro | 10 個名額 |
| Advanced | 20 個名額 |
| Ultra | 50 個名額 |
| Enterprise | 可自訂 |
當你不再需要某個克隆時,開啟 Cloned Voice,刪除該音色並確認操作。刪除克隆後會釋出名額。若被刪除的音色原本已在編輯器中選用,VisionStory 會自動切回可用的預設音色。
支援 88 種語言
88 種獨特語言。VisionStory 會自動偵測音色克隆樣本的語言;可用的音色選項與輸出特性會因語言而異。下方清單已合併地區變體與同義名稱,並以「每種語言 1 筆」計數。
- 🇿🇦 南非語(Afrikaans)
- 🇦🇱 阿爾巴尼亞語
- 🇪🇹 阿姆哈拉語
- 🇸🇦 阿拉伯語
- 🇦🇲 亞美尼亞語
- 🇮🇳 阿薩姆語
- 🇦🇿 亞塞拜然語
- 🇪🇸 巴斯克語
- 🇧🇾 白俄羅斯語
- 🇧🇩 孟加拉語(Bangla)
- 🇧🇦 波士尼亞語
- 🇧🇬 保加利亞語
- 🇲🇲 緬甸語
- 🇭🇰 粵語
- 🇪🇸 加泰隆尼亞語
- 🇵🇭 宿霧語
- 🇲🇼 奇切瓦語
- 🇨🇳 中文(普通話)
- 🇭🇷 克羅埃西亞語
- 🇨🇿 捷克語
- 🇩🇰 丹麥語
- 🇳🇱 荷蘭語
- 🇬🇧 英語
- 🇪🇪 愛沙尼亞語
- 🇵🇭 菲律賓語
- 🇫🇮 芬蘭語
- 🇫🇷 法語
- 🇪🇸 加利西亞語
- 🇬🇪 喬治亞語
- 🇩🇪 德語
- 🇬🇷 希臘語
- 🇮🇳 古吉拉特語
- 🇭🇹 海地克里奧爾語
- 🇳🇬 豪薩語
- 🇮🇱 希伯來語
- 🇮🇳 印地語
- 🇭🇺 匈牙利語
- 🇮🇸 冰島語
- 🇮🇩 印尼語
- 🇮🇪 愛爾蘭語
- 🇮🇹 義大利語
- 🇯🇵 日語
- 🇮🇩 爪哇語
- 🇮🇳 卡納達語
- 🇰🇿 哈薩克語
- 🇮🇳 孔卡尼語
- 🇰🇷 韓語
- 🇰🇬 吉爾吉斯語
- 🇱🇦 寮語
- 🇻🇦 拉丁語
- 🇱🇻 拉脫維亞語
- 🇨🇩 林加拉語
- 🇱🇹 立陶宛語
- 🇱🇺 盧森堡語
- 🇲🇰 馬其頓語
- 🇮🇳 邁蒂利語
- 🇲🇬 馬達加斯加語
- 🇲🇾 馬來語
- 🇮🇳 馬拉雅拉姆語
- 🇮🇳 馬拉地語
- 🇲🇳 蒙古語
- 🇳🇵 尼泊爾語
- 🇳🇴 挪威語
- 🇮🇳 奧里亞語
- 🇦🇫 普什圖語
- 🇮🇷 波斯語
- 🇵🇱 波蘭語
- 🇵🇹 葡萄牙語
- 🇮🇳 旁遮普語
- 🇷🇴 羅馬尼亞語
- 🇷🇺 俄語
- 🇷🇸 塞爾維亞語
- 🇵🇰 信德語
- 🇱🇰 僧伽羅語
- 🇸🇰 斯洛伐克語
- 🇸🇮 斯洛維尼亞語
- 🇸🇴 索馬利語
- 🇪🇸 西班牙語
- 🇰🇪 斯瓦希里語
- 🇸🇪 瑞典語
- 🇮🇳 坦米爾語
- 🇮🇳 泰盧固語
- 🇹🇭 泰語
- 🇹🇷 土耳其語
- 🇺🇦 烏克蘭語
- 🇵🇰 烏爾都語
- 🇻🇳 越南語
- 🇬🇧 威爾斯語
計數方式:以「每種語言」而非「每個地區語系」計算——例如英語各地區變體只算 1 次、挪威語 Bokmål 與 Nynorsk 只算 1 次、孟加拉語/Bangla 也只算 1 次。
音色克隆不夠像?快速排解方式
音色辨識度不夠強
請用同一段不中斷錄音中更乾淨的 1 到 2 分鐘樣本替換來源。並保持麥克風、環境、語速與表現一致。
克隆聽起來很吵或帶金屬感
戴上耳機聽原始素材。移除背景音樂、回音、風扇聲、車流聲、過度的降噪、爆音,以及重複的有損匯出。通常「更乾淨的原檔」比再多後製更有幫助。
語速或情緒不對
克隆會從樣本中學到那些語氣與表達選擇。請用你之後想聽到的語調、能量、節奏與說話風格來錄製來源音檔。
語言或口音不如預期
樣本全程請使用同一種語言,避免在克隆錄製時切換語言。若想得到最準確的發音與口音匹配,請用你打算發布的語言來克隆並測試。
建立你的音色克隆
準備一段乾淨的來源錄音,打開 AI 影片,並在用於更長的製作前先預覽效果。想了解更多自訂與多語言音色,請參考 VisionStory 音色克隆功能。
