Viral Music 将一段源音轨和一张角色图片,转化为一支完整的音乐视频序列。你可以选择精确片段、决定表演者该呈现的样子、设置发布格式,并在生成前查看实时预估。随后,VisionStory 会生成视觉表演,并围绕歌曲来编排镜头。
这不是逐帧编辑器。你最关键的控制项是源片段、源图片和输出格式 — 有意识地选好这些输入,远比把它们当作“设置细节”更能影响最终效果。上方视频用真实的歌曲片段和实际生成结果完整跑通了流程;下方步骤会逐一拆解每个决策点。
- Source — 音频文件,或其音轨将作为源音轨的视频文件。
- Clip length — 连续片段,长度从 15 秒到 10 分钟。
- Output — 9:16 或 16:9,分辨率为 720P、1080P 或 2K。
开始之前:准备音轨、片段时刻与表演者
先从一首你有权使用的歌曲开始,并明确想把哪一段做成视频。副歌、hook 或其他相对独立的段落,通常比随意截取一段时间范围更能让成片结构更有“形”。
- 准备音轨 — 上传音频文件;如果你只需要其中的音轨,也可以上传视频。
- 确认片段范围 — 打开选择器前,先大致记下起止位置。
- 准备角色 — 选择清晰的面部,并让整体呈现符合主唱、风格与氛围。
- 选择投放场景 — 竖屏短视频信息流,或横屏播放器。
使用合规素材:只上传你拥有或已获授权使用的音乐与角色图像。生成并不能替代对底层权利的授权与清理。
步骤 1:打开 Viral Music 并添加源音轨
在 VisionStory 侧边栏中打开 Viral Music。浏览 Explore 看看成片效果是什么样的;或将音轨拖入上传区域,开始你自己的项目。
音频文件会被直接使用。如果你上传的是视频,Viral Music 会提取并使用其中的音轨 — 源视频的画面不会带入生成结果。

接下来会发生什么:上传就绪后,VisionStory 会打开片段选择器。请先等待波形出现,再开始设置范围。
步骤 2:选出要生成视频的精确片段
选择窗口是连续的。拖动左侧把手设置起点,拖动右侧把手设置终点。若想保持时长不变但换到音轨的其他位置,可沿着波形拖动整个已选区间。
点击播放按钮试听所选片段。停止预览后,核对显示的时长,并仅在所选音频的起止都足够干净利落时,再点击 Confirm。

选择音乐边界:干净的乐句边界更容易生成令人满意的序列。避免从半个词中间开始,或在一句人声/器乐尚未收束前就结束。
步骤 3:选择角色并设定视觉方向
打开角色选择器。你可以上传新图片、复用你已有的头像,或浏览公共素材库。选定的图片不仅是身份参考:它还会引导结果中表演者的外观、服装、场景与整体风格。
尽量使用清晰无遮挡的脸部,并有意识地选择全身或半身视角。把你希望 VisionStory 解读的服装与环境也包含进去 — 更统一的源图片,会让生成的机位与镜头语言更有一致的方向感。

匹配表演感:选择整体呈现符合歌手与曲风的角色。源图片不必一定有麦克风,但应让预期的表演看起来可信。
步骤 4:选择宽高比与分辨率,然后查看预估
在音轨与角色下方打开输出设置。竖屏短视频选 9:16,横屏播放选 16:9,再根据所需细节选择 720P、1080P 或 2K。
预估会随所选片段时长与分辨率实时更新。提交任务前,请查看 Generate 旁边显示的最新数值。

| 选项 | 适用场景 | 取舍 |
|---|---|---|
| 9:16 | 主要投放在竖屏信息流或短视频平台。 | 源角色构图应预留足够的竖向空间,便于产生多样化的取景。 |
| 16:9 | 视频将用于横屏播放器、演示,或宽屏剪辑。 | 注意表演者与环境如何在更宽的画幅中分配空间。 |
| 更高分辨率 | 需要更明显的细节表现或更大的观看尺寸。 | 实时预估会变化 — 生成前务必检查。 |
以当前价格为准:不要用旧截图去推算。片段时长与输出分辨率都会影响预估,而当前界面才是准确信息来源 — 更全面的说明请参阅 VisionStory 积分如何计算。
步骤 5:生成、打开并复盘成片音乐视频
确认音轨、角色、格式与预估都正确后,点击 Generate。Viral Music 会分析歌曲的节奏、能量、结构,以及(可用时)歌词信息,并据此塑造表演、生成一致的机位设置,并围绕音乐编排镜头。
任务完成后,在 Videos 区域打开并播放结果,同时保留原歌曲音频一起观看。请评估完整序列,而不是只看某一帧。

重点检查:表演者是否一致、构图变化是否有用、表演与音乐的关系是否自然,以及剪切是否推动所选片段的节奏前进。节拍感剪辑会参考歌曲,但并不保证每一次剪切都严格落在某个精确拍点上。
如果整体视觉方向都不对,优先更换源图片再重试。如果开头或结尾显得乏力,就回到片段选择器,换一段更干净的音乐片段。与其在输入不变的情况下反复生成,这些改动通常更值得。
Viral Music 实用检查清单
- 我有权使用该音轨与角色图片。
- 所选片段在干净的乐句边界开始与结束。
- 源图片中的面部清晰无遮挡。
- 服装、场景与角色风格契合音乐。
- 宽高比与投放平台匹配。
- 我在所选分辨率下查看了实时预估。
- 我从头到尾、带原音频完整观看了最终结果。
- 我综合评估了表演连贯性、构图与剪切节奏。
最好的结果,在你点击 Generate 之前就已开始
Viral Music 负责表演与剪辑,但创意方向取决于你的输入:一段音乐结构清晰的片段、一张能表达表演者与其“世界”的图片,以及基于实际观看场景选择的输出格式。准备到位后,一条音轨和一个角色就能生成完整的视觉表演 — 无需手动做镜头、无需时间线剪辑。
接下来你可以继续:通过 创建 AI 说话头像 把会说话的角色放到镜头前;在 选择 AI 音色 中挑选合适的声音身份;或直接探索 AI music video generator 本身。
