Viral Music 會把一段來源音軌和一張角色圖片,變成完整的音樂影片段落。你可以挑選精準片段、決定演出者的外觀、設定輸出格式,並在生成前查看即時預估。接著 VisionStory 會生成視覺演出,並依照歌曲來編排鏡頭。
這不是逐格編輯器。你最關鍵的控制項是來源片段、來源圖片與輸出格式 — 有意識地選好這些輸入,影響遠大於把它們當成設定細節。上方影片示範了以真實歌曲片段跑完整流程,並展示實際生成結果;下方步驟會逐一說明每個決策。
- 來源 — 一個音訊檔,或是一支其音軌會被當作來源音軌的影片。
- 片段長度 — 連續片段,15 秒到 10 分鐘。
- 輸出 — 9:16 或 16:9,解析度可選 720P、1080P 或 2K。
開始之前:準備音軌、片段時刻與演出者
先從你有權使用的歌曲開始,並清楚想好要把哪一段做成影片。副歌、hook 或其他能自成一段的片段,通常比隨意截取的時間範圍更能讓成片結構更扎實。
- 準備音軌 — 上傳音訊檔;若你只需要影片的聲音,也可以上傳影片。
- 確認片段 — 在開啟選取器前,先記下大致的起點與終點。
- 準備角色 — 使用清晰的臉部,並選擇符合主唱、曲風與氛圍的呈現方式。
- 選擇投放位置 — 直式短影音動態牆,或橫式播放器。
使用授權素材:只上傳你擁有或已取得使用許可的音樂與角色圖像。生成並不會取代你對底層權利進行授權/清權的需求。
步驟 1:開啟 Viral Music 並加入來源音軌
從 VisionStory 側邊欄開啟 Viral Music。你可以瀏覽 Explore 了解完成作品的效果,或把音軌拖曳到上傳區域來開始自己的專案。
音訊檔會直接使用;若你上傳影片,Viral Music 會擷取並使用其音軌 — 來源影片的畫面不會帶入生成結果。

接下來會發生什麼:上傳就緒後,VisionStory 會開啟片段選取器。先等波形載入完成,再開始設定範圍。
步驟 2:選出要轉成影片的精準片段
選取視窗是連續的。拖曳左側把手設定起點、拖曳右側把手設定終點。若要維持同樣時長但改用音軌的其他區段,沿著波形拖曳整段已選範圍即可。
使用播放按鈕聆聽你選的精準片段。停止預覽、確認顯示的時長,並只在所選音訊的起訖都乾淨俐落時才點擊 Confirm。

選擇音樂段落邊界:乾淨的樂句切點更容易做出令人滿意的段落。避免從一個字唱到一半開始,或在一段人聲/樂器樂句尚未收尾前就結束。
步驟 3:選擇角色並設定視覺方向
開啟角色選擇器。你可以上傳新圖片、重用你自己的虛擬人像,或瀏覽公開素材庫。被選中的圖片不只是身分參考:它會引導結果中可見的演出者、服裝、場景與整體風格。
使用清晰、無遮擋的臉部,並刻意選擇全身或半身構圖。把你希望 VisionStory 解讀的穿搭與環境也放進去 — 一張一致性高的來源圖片,能讓生成的鏡頭設計更有共同的視覺方向。

符合演出氛圍:選擇呈現方式符合歌手與曲風的角色。來源圖片不一定要有麥克風,但要能讓預期的演出看起來可信。
步驟 4:選擇長寬比與解析度,並檢視預估
在音軌與角色下方開啟輸出設定。直式短影音選 9:16,橫式播放選 16:9,再依所需細節程度選擇 720P、1080P 或 2K。
預估值會隨所選片段長度與解析度更新。送出任務前,先查看 Generate 旁顯示的最新數字。

| 選擇 | 適用情境 | 取捨 |
|---|---|---|
| 9:16 | 主要投放到直式動態牆或短影音平台。 | 來源角色要留出足夠的垂直空間,方便做出多樣的取景。 |
| 16:9 | 影片會在橫式播放器、簡報或寬螢幕剪輯中呈現。 | 檢視演出者與環境在更寬畫面中的比例與分配。 |
| 更高解析度 | 輸出需要更清晰的細節或更大的觀看尺寸。 | 即時預估會改變 — 生成前務必確認。 |
以最新價格為準:不要用舊截圖自行計算。片段時長與輸出解析度都會影響預估值,而目前介面才是最準確的依據 — 想了解完整概念可參考 VisionStory 點數如何運作。
步驟 5:生成、開啟並檢視完成的音樂影片
當音軌、角色、格式與預估都確認無誤後,點擊 Generate。Viral Music 會分析歌曲的節奏、能量、結構,以及在可取得時的歌詞,再用這些資訊塑造演出、建立一致的鏡頭設計,並依音樂來編排剪接。
任務完成後,從 Videos 區域開啟並用原曲播放結果。請評估整段成片,而不是只看某一張靜止畫面。

建議檢視重點:演出者是否一致、取景變化是否有幫助、演出與音樂的關係是否自然,以及剪接是否讓所選片段更有推進感。具節拍感的剪輯會以歌曲為依據 — 但不保證每一刀都剛好落在精準拍點上。
如果整支影片的視覺方向都不對,先更換來源圖片再重試;如果開頭或結尾覺得無力,回到片段選取器挑一段更乾淨的音樂段落。這些調整通常比在輸入不變的情況下反覆重新生成更有價值。
實用的 Viral Music 檢查清單
- 我已取得使用這段音軌與角色圖片的權限。
- 所選片段的開頭與結尾都落在乾淨的樂句邊界。
- 來源圖片的臉部清晰、無遮擋。
- 服裝、場景與角色呈現符合音樂。
- 長寬比符合投放平台。
- 我已在選定解析度下查看即時預估。
- 我已搭配音訊從頭到尾看完最終結果。
- 我把演出者連貫性、取景與剪接節奏一起評估。
最佳成果從你點下 Generate 之前就開始
Viral Music 會負責演出與剪輯,但創意方向始於你的輸入:一段音樂形狀清楚的片段、一張能傳達演出者與其世界觀的圖片,以及為實際觀看場景所選擇的輸出格式。把這些準備到位後,一段音軌加上一個角色,就能變成完整的視覺演出 — 不需要手動做鏡頭,也不用時間軸剪輯。
接下來你可以繼續探索:用 建立 AI 說話虛擬人像 把會說話的角色放到鏡頭前,在 選擇 AI 音色 中挑選合適的聲音身分,或直接深入體驗 AI music video generator。
