视频换脸适用于这样的场景:表演本身已经到位——动作、台词呈现、镜头都没问题——但需要在获得授权的前提下更换画面中的人物。常见用途包括:为同一条广告镜头输出不同授权模特版本,让你的虚拟角色复用一段现成表演,或在不重拍动作与场景的情况下调整角色身份。

本教程以一段 6 秒、16:9 的虚构主持人口播片段作为源视频,并插入另一位虚构人物的参考人脸。文中涉及的所有人脸均为本教程生成,不对应任何真实人物。请勿上传未经授权的视频或人脸,也绝不要用视频换脸来冒充他人、误导观众或绕过身份验证。

第 1 步:打开 Face Swap 并选择 Video 模式

在 VisionStory 的 Face Swap 工具中,先在顶部选择 Video。页面支持上传 MP4、MOV、WEBM,Quick Start 示例也展示了期望的输入格式。

用于真实项目时,请只上传你拥有使用权的素材。优先选择单一主体、面部足够大且清晰、光线稳定的画面——多人同框、频繁遮挡以及剧烈运动都会让连续追踪更困难。

The Video tab highlighted in VisionStory Face Swap with the upload area and supported formats below
先选择高亮的 Video 标签页,再上传需要替换画面人物的片段。

第 2 步:上传源视频并从头到尾看一遍

点击 Choose Files or Drag & Drop 上传源片段。它会在左侧以 Source Video 的形式加载,并带有进度条和音频控制。示例是一段 6 秒的横屏镜头,主持人说话、眨眼并轻微转头。

不要只看第一帧就下结论。请播放完整片段,确认只有一个主要人物、脸部不会长时间离开画面,且没有任何东西——手、头发、麦克风、快速运动——长时间遮住脸。换脸会保留源视频的动作、服装、背景和音频,除了脸以外几乎都不变,所以在你花积分之前,这些元素必须本来就正确。

A six-second spokesperson clip loaded as the Source Video in VisionStory video face swap
用拖动进度条的方式检查 Source Video 的转头、眨眼、说话与遮挡情况,而不是只审一张封面帧。

第 3 步:上传目标人脸并确认积分消耗

点击右侧的 Upload/Select Avatar,在 Add Character 弹窗中添加已获授权的目标人脸。请使用清晰、无遮挡、角度尽量接近视频主要视角的参考图——避免厚重眼镜、手遮脸等情况。

回到页面后,左侧显示源视频,右侧显示目标人脸。生成按钮会按积分标出本次任务的价格;该 6 秒示例在提交时显示为 24 积分。以页面显示为准——它会随视频时长和产品规则变化。

VisionStory video face swap with the source clip on the left, the target face on the right, and the Generate Video button
生成前先确认输入顺序:Source Video 提供动作与场景,Target Avatar 提供新的身份。

第 4 步:生成并在 History 中找到结果

点击 Generate Video。任务会出现在下方 Videos 历史记录中——运行时显示 Generating,完成后会显示时长、分辨率与标题。示例输出为 00:06、720p,与提交的片段一致。

生成过程中不要重复提交同一个任务。等卡片变为可播放后,再在 Video Viewer 中打开查看。

The VisionStory Face Swap history showing a completed six-second 720p video face swap task
已完成的任务会保留在 Videos 列表中——打开卡片即可最终播放并下载。

第 5 步:分段检查人脸追踪,然后下载

从头播放结果,并分别拖动检查开头、中段与结尾。重点观察说话时的嘴角、眨眼、眉毛、发际线与下颌线——以及转头时身份是否依然稳定。

示例在接近结尾处暂停在一帧自然、睁眼的画面:目标人脸仍能跟随源视频的表情与角度,而橙色西装、肢体动作、沙发背景、音频与时长都未被改变。只有在确认没有原脸闪回、没有边缘漂移、没有肤色突变之后,再点击下载。

The VisionStory Video Viewer paused on a natural frame of a completed video face swap near the end of the clip
评估源视频与结果时都要以自然、清晰可见的画面为准——并且仍要拖动覆盖每个表情与头部角度。

常见问题与解决方法

  • 视频中途原脸闪回。 检查该时间点是否有快速转头、脸部离开画面、运动模糊或长时间遮挡。把视频裁剪到脸始终清晰可见的片段,往往比反复生成一段难追踪的素材更有效。
  • 运动时嘴部、眼睛或发际线漂移。 换用更清晰、更完整、角度更接近视频主视角的参考人脸,并确保源人脸像素足够——不要过度压缩或噪点太重。
  • 身份没问题,但与身体或穿着不协调。 换脸不会改变身体、头发、衣服或场景。请选择在年龄、肤色与整体气质上更贴合源角色的目标人脸——或更换源视频。
  • 音频没有变化。 正常现象。视频换脸只替换脸部;音色仍来自源视频。如需更换,请使用已获授权的 AI 变声流程 单独处理。

一次可靠的视频换脸需要同时满足三点:清晰且持续可见的源人脸、角度匹配且已获授权的参考人脸、以及对全时间线的复核。照片换脸只看一帧就能评判——而视频换脸必须经受每一次眨眼、每一个字、每一次转头的考验,所以绝不要用单张预览帧来代替对成片的判断。需要处理静态图片的话,可以从 照片换脸 开始。

常见问题

  • 它会在视频的每一帧中检测并跟踪人脸,并把目标身份应用到所有帧上——包括说话、眨眼和转头的全过程——同时保留源视频的动作、服装、背景和音频。