在 YouTube 上观看本教程

YouTube

想让一张静态照片开口说话—比如人像会张嘴、眨眼,还能把你输入的内容说出来?用 VisionStory,你只需一张图片,在浏览器里就能轻松做到——无需摄像头,也不需要任何剪辑经验。上方视频会带你走一遍完整流程,下方的分步指南则会把每个环节讲得更细。

跟着做的过程中,你会上传一张人像,并把它准备成你自己的可复用头像。其他用户看不到它;以后做视频时,你也可以直接再次选择它,不用每次都重复上传同一张图片。你只需一个免费账号,就能在 VisionStory 的照片说话工具里完成全部操作。

第 1 步:上传一张清晰的人像

打开 AI 视频。在 Characters 面板中选择 Upload,从设备中选取图片,或直接把照片拖到拖拽区域。建议使用一张清晰的正脸人物照,脸部和肩膀可见,眼睛和嘴巴无遮挡,并在人物四周留一点空间,方便后续重新取景。

  • 支持的文件:JPG、JPEG、PNG、WebP、HEIC。
  • 最大文件大小:30 MB。
  • 建议起始尺寸:人像至少 512 x 768 像素。
  • 上传规则:一次仅支持 1 张源图片。
Dragging a portrait onto the Upload control in the VisionStory Characters panel

让源图构图尽量贴近最终发布场景。一张裁得很紧的人像在 9:16 里可能刚好,但放到 16:9 就会变成过于贴脸的裁切,因为左右没有多余画面来填满更宽的画幅。

第 2 步:让 VisionStory 校验并准备头像

上传后,VisionStory 会检查图片中是否包含可用人物,并将其准备成角色。上传失败几乎都与源照片有关:可能脸太小、遮挡严重、侧脸角度过大、画面模糊,或与另一张脸靠得太近。

如果准备失败,不要反复重试同一个裁切。请换一张更清晰的源图:单张更大的脸、更正的角度、肩膀可见、光线均匀、遮挡更少。

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

处理完成后,你的头像会出现在公开角色库上方,并自动打开预览。它仅你可见。

第 3 步:预览或更换分配的音色

VisionStory 会根据人物看起来的年龄与性别,自动分配一个合适的初始音色。你可以直接使用它、预览它,或换成其他音色。

  1. 点击当前音色,打开音色库。
  2. 点击音色右侧的播放按钮,试听示例。
  3. 如果不合适,可按 Language、Gender、Age、Use Case 进行筛选。
  4. 多试听几个候选,选择既匹配头像、又符合视频用途的音色。
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

某个音色可能在年龄和性别上“对得上”,但用于旁白、教学、广告或对话内容时仍会显得不合适。要匹配的是“人物 + 用途”,而不只是人群特征。

第 4 步:按发布场景重新取景

在头像预览中决定最终视频里要展示人物的多少。拖动画面来调整人物位置,用缩放控制拉近或拉远。然后选择与你要发布的平台相匹配的宽高比:

  • 9:16 竖版:适用于 TikTok、Instagram Reels、YouTube Shorts 等移动端优先场景。
  • 1:1 方形:适用于方形社媒帖、以人物为中心的版式,以及灵活的嵌入展示。
  • 16:9 横版:适用于 YouTube、演示、网站与宽屏课程。
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

缩放无法“变出”不存在的像素。如果人物已经贴到源图四周边缘,别硬拉成更宽的裁切;换一张背景更多的图片会更好。

第 5 步:弄清楚 Change Look 和 Generate Image 的区别

头像旁边有两个 AI 图像工具,使用前先了解它们的差异会更省事。

Change Look 会打开一个 AI 对话,并自动附上你当前的头像,让你描述新的穿搭、场景或风格。它是图生图流程,同时原始头像仍会保留可用。Generate Image 则从文字角色描述开始,而不是从照片开始,因此是文生图流程。两种方式都支持继续对话来不断优化结果。

VisionStory Change Look chat opened with the current avatar attached as the starting image

简单来说:角色已存在但想换造型,就用 Change Look;想通过提示词从零创建角色,就用 Generate Image。

第 6 步:写一段短脚本并生成会说话视频

选中你上传的头像,在 Script 框中输入一句简短、口语化的台词。短句渲染更快,也更便于你同时判断照片清晰度、裁切、音色、口型同步与动作效果。

点击 Generate Talking Video。VisionStory 会使用你选择的头像、构图、脚本与音色来驱动面部动画,让口型与声音同步,并加入逼真的眨眼与头部运动。渲染通常需要几分钟。

A short VisionStory script generating a talking-avatar result from the uploaded portrait

把第一次生成的结果当作对源照片的实用测试,并重点检查 4 件事:

  • 最终尺寸下,脸部是否依然足够清晰。
  • 运动过程中,眼睛和嘴巴是否始终无遮挡。
  • 头部与肩膀在所选画幅里是否舒适不拥挤。
  • 动态头像是否仍像源图中的那个人。

如果裁切太紧或脸部在动作中显得发虚,优先修正源图或取景;改脚本解决不了构图问题。

第 7 步:复用或删除你的照片说话头像

回到 Characters 列表,你上传的头像会显示在公开角色库上方。之后只要你想再次使用同一个出镜者,随时都可以直接选它。其他用户看不到它;订阅用户还能创建并保留无限数量的头像。

  • 复用:直接选择该头像,无需再次上传照片。
  • 切换造型:打开头像,选择已保存的造型缩略图之一。
  • 删除:将鼠标悬停在头像上,右上角会出现删除按钮;确认后即可删除该头像及其所有造型。
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

常见照片问题排查

VisionStory 找不到可用的人脸。请使用更亮、更清晰的图片,确保只有 1 张更大、正脸的人脸。避免眼睛或嘴巴被遮挡、侧脸角度过大,以及其他人脸贴近主体的照片。

横版裁切太贴脸。很可能源图左右两侧画面不够。换一张更宽的源图,或人物周围留白更多的照片。

头像仍在准备中。在使用角色前先等待准备完成。若长时间卡住,刷新 Characters 视图,并确认头像是否已经出现,再决定是否需要重新上传。

生成效果看起来发虚。从更高分辨率、对焦清晰的照片开始,并避免把小脸过度放大。输出分辨率无法补回源图缺失的细节。

让照片开口说话其实就这么简单:上传一张人像、匹配音色、调整取景、点击生成。现在,你的照片已经变成一个可复用的会说话头像,随用随取。

想了解完整的脚本、音色、设置、积分与生成流程?继续阅读 How to Create an AI Talking Avatar,或将完整脚本批量生成 AI 视频也可以现在就开始:免费制作你的第一张会说话照片

常见问题

  • 将一张清晰的正脸照片上传到 VisionStory 的照片说话工具,输入一句简短台词,选择或保留系统分配的音色,然后点击 Generate Talking Video 即可。使用免费计划,你无需安装任何软件,几分钟内就能在浏览器里获得口型同步的会说话视频。