在 YouTube 上观看本教程

YouTube

想让一张静态照片开口说话—像人像照一样张嘴、眨眼,还能把你输入的内容说出来?用 VisionStory 你只需一张图片,就能直接在浏览器里做到:无需相机,也不需要任何剪辑经验。上方视频会带你走完整个流程,下面的一步一步指南则会把每个细节讲清楚。

跟着做的过程中,你会上传一张人像照,并把它准备成你自己的可复用虚拟人。其他用户看不到它;之后你也可以在新视频里再次选择它,不用每次都重复上传同一张图片。你只要用免费账号,就能在 VisionStory 的会说话照片工具 里完成全部操作。

第 1 步:上传一张清晰的人像照

打开 AI 视频。在 Characters 面板中选择 Upload,从设备里选一张图片,或直接把照片拖到拖拽区域。建议使用一张清晰、正面的人像照:脸部与肩膀可见,眼睛和嘴巴无遮挡,并在人物周围留一点空间,方便后续重新取景。

  • 支持的文件: JPG、JPEG、PNG、WebP、HEIC。
  • 最大文件大小:30 MB。
  • 建议起始尺寸:人像照至少 512 x 768 像素。
  • 上传方式:一次仅上传 1 张源图片。
Dragging a portrait onto the Upload control in the VisionStory Characters panel

尽量让源图片的构图贴近最终视频的用途。一张裁得很紧的人像照在 9:16 里可能还行,但到了 16:9 就会变成过于贴脸的特写,因为左右没有足够的画面区域来填满更宽的画幅。

第 2 步:让 VisionStory 校验并准备虚拟人

上传后,VisionStory 会检查图片里是否有人脸可用,并将其准备成角色。上传失败几乎都和源照片有关:人脸可能太小、遮挡严重、侧转角度太大、画面模糊,或离另一张脸太近。

如果准备失败,不要一直用同一个裁切反复重试。换一张更清晰的源图:单一更大的脸、更正的角度、肩膀可见、光线均匀、遮挡更少。

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

处理完成后,这个虚拟人会显示在公共角色库上方,并在预览中打开。它只对你可见。

第 3 步:预览或更换系统分配的音色

VisionStory 会根据人物看起来的年龄与性别,自动分配一个合适的初始音色。你可以直接用它,也可以预览或换成其他音色。

  1. 点击当前音色,打开音色库。
  2. 点击音色右侧的播放按钮,试听示例。
  3. 如果不合适,可按 Language、Gender、Age、Use Case 进行筛选。
  4. 多试听几个选项,再选择最符合虚拟人和视频用途的音色。
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

有些音色在年龄与性别上可能匹配,但用于旁白、教学、广告或对话内容时依然会显得不对。要匹配的是“人物 + 用途”,不只是人口特征。

第 4 步:为最终发布场景重新取景

在虚拟人预览中决定最终视频里要出现多少人物画面。拖动照片来调整主体位置,用缩放控件拉近或拉远。然后选择适合发布平台的宽高比:

  • 9:16 竖版:适合 TikTok、Instagram Reels、YouTube Shorts 等移动端优先的场景。
  • 1:1 方形:适合方形社媒贴文、以头像为中心的版式,以及更灵活的嵌入。
  • 16:9 横版:适合 YouTube、演示文稿、网站,以及宽屏课程。
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

缩放无法凭空“变出”不存在的像素。如果人物已经贴到源图边缘,建议换一张背景更多的图片,而不是强行拉出更宽的裁切。

第 5 步:了解 Change Look 和 Generate Image 的区别

虚拟人旁边有 2 个 AI 图像工具,使用前先弄清它们的差别会更顺手。

Change Look 会打开一个 AI 对话,并自动附上你当前的虚拟人作为起始图,让你描述新的服装、场景或风格。这是一个 image-to-image 工作流,原来的虚拟人仍会保留。Generate Image 则从文字角色描述开始而不是从照片开始,因此是 text-to-image 工作流。两种方式都可以继续对话来不断优化结果。

VisionStory Change Look chat opened with the current avatar attached as the starting image

简单来说:角色已存在但需要换造型时用 Change Look;想从提示词创建角色时用 Generate Image。

第 6 步:添加一段短文稿并生成会说话视频

选中你上传的虚拟人后,在 Script 输入框里写一句简短、口语化的句子。短句渲染更快,也更容易同时判断照片清晰度、裁切、音色、对口型和动作效果。

点击 Generate Talking Video。VisionStory 会用你选定的虚拟人、取景、文稿与音色为人脸做动画、对齐嘴型,并加入逼真的眨眼与头部动作。渲染通常只需几分钟。

A short VisionStory script generating a talking-avatar result from the uploaded portrait

把第一次生成的结果当作一次实用的源照片测试,重点检查 4 点:

  • 在最终尺寸下,人脸依然足够清晰。
  • 动作过程中,眼睛和嘴巴没有被遮挡。
  • 头部与肩膀在所选画幅里留白舒适。
  • 动起来的虚拟人依然像源照片里的人。

如果裁切太紧,或脸在动作里看起来发虚,先从源图或取景开始调整。改文稿并不能解决构图问题。

第 7 步:复用或移除你的会说话照片虚拟人

回到 Characters 列表,你上传的虚拟人会显示在公共角色库上方。之后只要想用同一个出镜人,随时都能选它。其他用户看不到它;订阅用户还能创建并保留无限数量的虚拟人。

  • 复用:直接选择该虚拟人,无需再次上传照片。
  • 切换造型:打开虚拟人,选择已保存的造型缩略图之一。
  • 移除:将鼠标悬停在虚拟人上,右上角会出现删除按钮;确认后会删除该虚拟人及其所有造型。
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

常见照片问题排查

VisionStory 找不到可用的人脸。换一张更亮、更清晰、正面且脸更大的照片。避免眼睛或嘴巴被遮挡、明显侧脸角度,以及有另一张脸紧贴主角的照片。

16:9 横版裁切太近。源人像照两侧可能没有足够的画面区域。换一张更宽的源图,或人物周围留白更多的照片。

虚拟人仍在准备中。等准备完成后再使用角色。如果一直卡住,刷新 Characters 视图,并先确认虚拟人是否已出现,再决定要不要重新上传。

效果看起来发软。尽量从更高分辨率、对焦清晰的照片开始,并避免把很小的脸放大得太夸张。输出分辨率无法补回源图缺失的细节。

让照片开口说话就是这么简单:上传一张人像照、匹配音色、调整取景,然后生成。你的照片现在已经变成一个可复用的会说话虚拟人,随时需要都能再用。

想了解完整的文稿、音色、设置、积分与生成流程?可以继续看 How to Create an AI Talking Avatar,或把完整文稿批量生成 AI 视频或者现在就开始:免费制作你的第一张会说话照片

常见问题

  • 把一张清晰的正面照片上传到 VisionStory 的会说话照片工具,输入一句简短台词,选择或沿用系统分配的音色,然后点击 Generate Talking Video。使用免费方案,你无需安装任何软件,几分钟内就能在浏览器里获得口型同步的会说话视频。