音色複製會由真實錄音建立一個可重用的合成音色。VisionStory 會分析來源樣本、處理音訊、偵測語言與聲線特徵、建立複製音色,並生成預覽,讓你在用於影片前先行評估。
上傳只係機械步驟。最終效果夠唔夠似、夠唔夠穩定,關鍵在於來源錄音。一段乾淨、一致嘅 1 分鐘錄音,通常比用唔同咪高峰、喺唔同房間錄咗幾分鐘更有用。
請負責任咁使用音色。只複製你自己嘅音色,或者你已獲清晰授權可以使用嘅音色。請勿用音色複製去冒充他人、繞過同意,或誤導觀眾。
- 最佳來源:1–2 分鐘乾淨、單一講者嘅音訊。
- 快速錄音:喺 Clone 對話框內最多可錄 15 秒。
- 可用性:Pro 及更高級訂閱方案。
步驟 1:喺 AI 影片中開啟 Voice Clone
打開 AI 影片,並揀選你打算使用嘅頭像(avatar)。喺 Script 方塊下方嘅音色列,按目前音色旁邊嘅 Clone。Clone 對話框會打開,而唔會改變頭像現有音色。

步驟 2:選擇上傳或錄音
對話框提供兩種來源方式。你可以按自己係測試流程,定係想拎到最接近、最實用嘅匹配效果去選擇。
- 上傳音訊:品質優先之選。可行嘅話,盡量用 1 到 2 分鐘嘅乾淨樣本。
- 錄音:適合快速測試。App 內置錄音器目前最多可錄 15 秒。
可上傳檔案格式包括 .avi、.mp3、.mp4、.m4a、.wav 或 .mov。所選音訊片段最少要 3 秒,最長可達 120 秒。

步驟 3:準備更貼近目標的音訊
音色複製不止會拷貝聲音身份,亦可以重現語速、語調起伏、呼吸聲、房間環境聲、咪高峰音色特性,以及不想要的雜訊與瑕疵。請用你之後希望複製音色採用的風格去錄製原始音檔。
- 只用一位講者。移除音樂、重疊人聲同背景對話。
- 錄 1–2 分鐘乾淨音訊。提供足夠自然變化,同時避免混入品質或狀態不一致的錄音段落。
- 選擇安靜、唔回音嘅房間。柔軟傢俬有助減少殘響;避免風扇、車聲同冷氣噪音。
- 保持咪高峰穩定。整段樣本都維持同一個距離、角度、輸入音量同房間環境。
- 自然而一致咁講。保持口音、音量、語速同表演風格穩定。
- 避免長時間靜音空檔。用連續而有用嘅說話內容,唔好用靜音去「填長」檔案。

小貼士:如果第一次複製聽落偏弱,建議先用更乾淨、更一致嘅音訊去換掉原始素材,再考慮錄更長。混合品質嘅素材往往會令複製音色學到你本來想消除嘅不一致。
步驟 4:上傳、檢查並命名樣本
將檔案拖入 Import Audio,或按一下投放區域去選擇檔案。波形出現後,播放已選取嘅片段,留意有冇其他人聲、音樂、爆音(clipping)、回音、突兀剪接或長時間靜音。如果呢啲問題好明顯,就換返原始音檔。
輸入一個最多 20 個字嘅描述性名稱。加上地區後綴可令多個教學或活動音色更易分辨;例如:Tutorial Voice-en。

步驟 5:建立複製音色,並交俾 VisionStory 自動偵測語言
按 Clone Now。VisionStory 會以非同步方式處理樣本,並打開 Cloned Voice 分頁。處理期間項目會自動更新;預覽準備好之後就可以播放。
你唔需要手動揀選原始語言。VisionStory 會分析錄音並自動指定偵測到嘅語言。建議原始樣本全程只用同一種語言,咁偵測到嘅語系、口音同預覽效果會更容易判斷。

步驟 6:預覽、選擇並測試複製音色
喺揀選之前,先用複製音色嗰一列上面嘅播放按鈕預聽。留意音色辨識度、口音、語速、發音、室內回音、雜音,以及音色有冇不穩定嘅變化。若預覽已有明顯瑕疵,建議即刻改善音源,唔好等到影片做完先發現問題。
揀選已複製嘅音色,喺 Script 方格輸入一句短句,然後按 Preview Audio。短時間測試更易比較,亦可以確認複製音色啱唔啱你打算製作嘅內容類型。

Voice Clone 方案與名額上限
Voice Clone 只適用於 Pro 及以上方案。每個已儲存嘅複製音色會佔用 1 個名額,直至你將佢刪除。
| 方案 | 目前可用嘅 voice clone 名額 |
|---|---|
| Free | 不包含 |
| Pro | 10 個名額 |
| Advanced | 20 個名額 |
| Ultra | 50 個名額 |
| Enterprise | 自訂 |
當你唔再需要某個複製音色時,打開 Cloned Voice,刪除該音色並確認操作。刪除複製音色後會釋放相應名額。若該已刪除音色曾喺編輯器中被選用,VisionStory 會自動切換到可用嘅預設音色。
支援 88 種語言
88 種獨立語言。 VisionStory 會自動偵測複製樣本嘅語言;可用嘅音色選項及輸出特性會因語言而異。以下清單會喺合併地區變體及等同名稱後,以每種語言只計 1 個項目。
- 🇿🇦 南非語(Afrikaans)
- 🇦🇱 阿爾巴尼亞語
- 🇪🇹 阿姆哈拉語
- 🇸🇦 阿拉伯語
- 🇦🇲 亞美尼亞語
- 🇮🇳 阿薩姆語
- 🇦🇿 阿塞拜疆語
- 🇪🇸 巴斯克語
- 🇧🇾 白俄羅斯語
- 🇧🇩 孟加拉語(Bangla)
- 🇧🇦 波斯尼亞語
- 🇧🇬 保加利亞語
- 🇲🇲 緬甸語
- 🇭🇰 粵語
- 🇪🇸 加泰隆尼亞語
- 🇵🇭 宿霧語
- 🇲🇼 奇切瓦語
- 🇨🇳 中文(普通話)
- 🇭🇷 克羅地亞語
- 🇨🇿 捷克語
- 🇩🇰 丹麥語
- 🇳🇱 荷蘭語
- 🇬🇧 英語
- 🇪🇪 愛沙尼亞語
- 🇵🇭 菲律賓語
- 🇫🇮 芬蘭語
- 🇫🇷 法語
- 🇪🇸 加利西亞語
- 🇬🇪 格魯吉亞語
- 🇩🇪 德語
- 🇬🇷 希臘語
- 🇮🇳 古吉拉特語
- 🇭🇹 海地克里奧爾語
- 🇳🇬 豪薩語
- 🇮🇱 希伯來語
- 🇮🇳 印地語
- 🇭🇺 匈牙利語
- 🇮🇸 冰島語
- 🇮🇩 印尼語
- 🇮🇪 愛爾蘭語
- 🇮🇹 意大利語
- 🇯🇵 日語
- 🇮🇩 爪哇語
- 🇮🇳 卡納達語
- 🇰🇿 哈薩克語
- 🇮🇳 孔卡尼語
- 🇰🇷 韓語
- 🇰🇬 吉爾吉斯語
- 🇱🇦 老撾語
- 🇻🇦 拉丁語
- 🇱🇻 拉脫維亞語
- 🇨🇩 林加拉語
- 🇱🇹 立陶宛語
- 🇱🇺 盧森堡語
- 🇲🇰 馬其頓語
- 🇮🇳 邁蒂利語
- 🇲🇬 馬達加斯加語
- 🇲🇾 馬來語
- 🇮🇳 馬拉雅拉姆語
- 🇮🇳 馬拉地語
- 🇲🇳 蒙古語
- 🇳🇵 尼泊爾語
- 🇳🇴 挪威語
- 🇮🇳 奧里亞語
- 🇦🇫 普什圖語
- 🇮🇷 波斯語
- 🇵🇱 波蘭語
- 🇵🇹 葡萄牙語
- 🇮🇳 旁遮普語
- 🇷🇴 羅馬尼亞語
- 🇷🇺 俄語
- 🇷🇸 塞爾維亞語
- 🇵🇰 信德語
- 🇱🇰 僧伽羅語
- 🇸🇰 斯洛伐克語
- 🇸🇮 斯洛文尼亞語
- 🇸🇴 索馬里語
- 🇪🇸 西班牙語
- 🇰🇪 斯瓦希里語
- 🇸🇪 瑞典語
- 🇮🇳 泰米爾語
- 🇮🇳 泰盧固語
- 🇹🇭 泰語
- 🇹🇷 土耳其語
- 🇺🇦 烏克蘭語
- 🇵🇰 烏爾都語
- 🇻🇳 越南語
- 🇬🇧 威爾斯語
計算方式:以語言為單位,而非以地區/語系為單位——例如英語不同地區變體只算 1 次;挪威語的 Bokmål 與 Nynorsk 只算 1 次;孟加拉語/Bangla 亦只算 1 次。
排解音色複製聽起來唔夠似嘅問題
音色辨識度偏弱
用一段更乾淨嘅 1 至 2 分鐘樣本取代來源音檔,最好係同一段無中斷錄音。保持咪高峰、環境、語速同演繹一致。
複製音色聽起來好多雜音或有金屬感
用耳機聽返原始音檔,移除背景音樂、回音、風扇聲、車流聲、過度去噪、爆音(clipping),以及重複以有損格式匯出。通常更乾淨嘅原檔,比再加工更有效。
語速或情緒唔啱
複製音色會由樣本學到你嘅講法同演繹選擇。錄來源音檔時,就用你之後想聽到嘅語氣、能量、節奏同講話風格。
語言或口音出乎意料
整段樣本盡量只用 1 種語言,避免喺複製錄音期間切換語言。想要最準嘅發音同口音匹配,請用你計劃發佈嘅語言去複製同測試。
建立你嘅音色複製
準備一段乾淨嘅來源錄音,打開 AI 影片,並喺用於更長製作之前先預覽效果。更多關於自訂及多語言音色,請參閱 VisionStory 音色複製功能。
