Viral Music 會將來源音軌同角色圖片,變成一段完整嘅音樂影片序列。你可以揀選精確片段、決定表演者應該點樣呈現、設定輸出格式,並喺生成之前先睇到即時估算。之後 VisionStory 會建立視覺演出,並按住歌曲去編排鏡頭。
呢個唔係逐格編輯器。你最有力嘅控制係 來源片段、來源圖片同輸出格式 — 有意識咁揀好呢啲輸入,比起當佢哋只係設定細節,影響大得多。上面嘅影片用真實歌曲節錄同實際生成結果,示範咗成個流程;以下步驟會逐一講解每個決定。
- 來源 — 音訊檔,或者一條影片(其配樂會被用作來源音軌)。
- 片段長度 — 由 15 秒到 10 分鐘嘅連續段落。
- 輸出 — 9:16 或 16:9,解像度可選 720P、1080P 或 2K。
開始之前:準備好音軌、時刻同表演者
先由一首你有權使用嘅歌曲開始,並清楚知道想將邊一段變成影片。副歌、hook 或其他自成一段嘅片段,通常比隨便揀一段時間範圍,更能令剪輯更有形狀同張力。
- 準備音軌 — 上載音訊檔;如果你只需要影片嘅配樂,亦可以上載影片。
- 掌握段落 — 打開選擇器之前,先記低大概開始同結束位置。
- 準備角色 — 用清晰面孔,並確保造型符合主唱、曲風同氣氛。
- 揀好目的地 — 直度短片動態,或者橫向播放器。
使用獲授權媒體:只上載你擁有或已獲授權使用嘅音樂同角色圖片。生成唔會取代你對底層權利作出清理/授權嘅需要。
步驟 1:打開 Viral Music,加入來源音軌
喺 VisionStory 側邊欄開啟 Viral Music。你可以瀏覽 Explore 睇下完成效果係點,或者將音軌拖入上載區,開始你自己嘅專案。
音訊檔會直接使用。如果你上載影片,Viral Music 會擷取並使用佢嘅配樂 — 來源影片嘅畫面唔會帶入生成結果。

接住會發生咩:上載完成後,VisionStory 會開啟片段選擇器。等波形圖出現先再設定範圍。
步驟 2:揀選要轉成影片嘅精確段落
選擇視窗係連續嘅。拖動左邊把手設定開始、右邊把手設定結束。如果想保持同一長度但用音軌嘅另一段,就將成個已選範圍沿住波形圖拖動。
用播放鍵聽清楚所選段落。停止預覽後,檢查顯示嘅時長;只喺所選音訊乾淨咁開始同結束時,先撳 Confirm。

揀音樂邊界:乾淨嘅樂句邊界更容易做出令人滿意嘅片段序列。避免喺一個字嘅中間開始,或者喺人聲/樂句未收尾就完。
步驟 3:選擇角色,設定視覺方向
打開角色選擇器。你可以上載新圖片、重用你自己嘅虛擬人像,或者瀏覽公開素材庫。揀好嘅圖片唔止係身份參考:佢會引導結果入面可見嘅表演者、服裝、場景同整體觀感。
用清晰、無遮擋嘅面孔,並選擇有意圖嘅全身或半身構圖。將你想 VisionStory 理解嘅穿搭同環境一併放入畫面 — 一張一致性高嘅來源圖片,會令生成出嚟嘅鏡頭設置更有共同方向。

配合演出:揀一個造型符合歌手同曲風嘅角色。來源圖片唔一定要有咪高峰,但要令你想像嘅演出看起來合理可信。
步驟 4:選擇畫面比例同解像度,再檢視估算
喺音軌同角色下方打開輸出設定。直度短片揀 9:16,橫向播放揀 16:9,再按需要嘅細節程度選 720P、1080P 或 2K。
估算會跟住你揀嘅片段長度同解像度而更新。提交任務之前,先睇清楚 Generate 旁邊嘅最新數字。

| 選擇 | 適合用喺 | 取捨 |
|---|---|---|
| 9:16 | 主要投放去直度動態或短片平台。 | 來源角色最好預留足夠垂直空間,方便做出多變構圖。 |
| 16:9 | 影片會喺橫向播放器、簡報或寬螢幕剪輯中出現。 | 留意表演者同環境點樣喺更闊畫面中分配。 |
| 更高解像度 | 輸出需要更清晰細節,或者要更大畫面觀看。 | 即時估算會變 — 生成之前要再檢查一次。 |
保持價格為最新:唔好用舊截圖去計。片段時長同輸出解像度都會影響估算,而而家嘅介面先係準則來源 — 想了解更多可參考 VisionStory 點數點樣運作。
步驟 5:生成、打開並檢視完成嘅音樂影片
當音軌、角色、格式同估算都正確無誤,就撳 Generate。Viral Music 會分析歌曲嘅節奏、能量、結構,同(如有)歌詞,再用呢啲資訊去塑造表演、建立一致嘅鏡頭設置,並按住音樂去編排剪接。
任務完成後,喺 Videos 區域打開,並配合原曲播放結果。要評估成段序列,而唔係淨係睇一張靜止畫面。

要檢視咩:表演者是否一致、構圖變化有冇用、演出同音樂嘅關係是否自然、剪接是否令所選段落更順暢。懂得跟拍點嘅剪輯會參考歌曲,但唔代表每一刀都一定精準落喺每一拍。
如果整體視覺方向都唔啱,重試之前先換來源圖片。如果開頭或結尾感覺薄弱,就返去片段選擇器,揀一段更乾淨嘅音樂段落。呢啲調整通常比起用同一組輸入反覆再生成更值得。
實用嘅 Viral Music 檢查清單
- 我已獲授權使用呢條音軌同角色圖片。
- 所選段落喺乾淨嘅樂句邊界開始同結束。
- 來源圖片展示清晰、無遮擋嘅面孔。
- 服裝、場景同角色都符合音樂。
- 畫面比例符合投放平台。
- 我已喺所選解像度下檢視即時估算。
- 我已配合音訊由頭到尾睇過最終結果。
- 我已將表演者連貫性、構圖同剪接節奏一齊評估。
最佳效果,喺你撳 Generate 之前已經開始
Viral Music 會處理表演同剪輯,但創作方向係由你嘅輸入開始:一段有清晰音樂形狀嘅片段、一張能表達表演者同其世界觀嘅圖片,以及按實際觀看場景而揀定嘅輸出格式。準備好呢啲之後,一條音軌加一個角色,就可以變成一段完整嘅視覺演出 — 無需手動建立鏡頭,亦無需時間線剪輯。
想繼續探索:可以去 建立 AI 會講嘢虛擬人像,將角色「擺上鏡頭」;到 揀選 AI 音色 物色合適嘅聲音身份;或者直接探索 AI music video generator 本身。
