想让一张静态照片开口说话—像人像照一样张嘴、眨眼,还能把你输入的内容说出来?用 VisionStory 你只需一张图片,就能直接在浏览器里做到:无需相机,也不需要任何剪辑经验。上方视频会带你走完整个流程,下面的一步一步指南则会把每个细节讲清楚。
跟着做的过程中,你会上传一张人像照,并把它准备成你自己的可复用虚拟人。其他用户看不到它;之后你也可以在新视频里再次选择它,不用每次都重复上传同一张图片。你只要用免费账号,就能在 VisionStory 的会说话照片工具 里完成全部操作。
第 1 步:上传一张清晰的人像照
打开 AI 视频。在 Characters 面板中选择 Upload,从设备里选一张图片,或直接把照片拖到拖拽区域。建议使用一张清晰、正面的人像照:脸部与肩膀可见,眼睛和嘴巴无遮挡,并在人物周围留一点空间,方便后续重新取景。
- 支持的文件: JPG、JPEG、PNG、WebP、HEIC。
- 最大文件大小:30 MB。
- 建议起始尺寸:人像照至少 512 x 768 像素。
- 上传方式:一次仅上传 1 张源图片。

尽量让源图片的构图贴近最终视频的用途。一张裁得很紧的人像照在 9:16 里可能还行,但到了 16:9 就会变成过于贴脸的特写,因为左右没有足够的画面区域来填满更宽的画幅。
第 2 步:让 VisionStory 校验并准备虚拟人
上传后,VisionStory 会检查图片里是否有人脸可用,并将其准备成角色。上传失败几乎都和源照片有关:人脸可能太小、遮挡严重、侧转角度太大、画面模糊,或离另一张脸太近。
如果准备失败,不要一直用同一个裁切反复重试。换一张更清晰的源图:单一更大的脸、更正的角度、肩膀可见、光线均匀、遮挡更少。

处理完成后,这个虚拟人会显示在公共角色库上方,并在预览中打开。它只对你可见。
第 3 步:预览或更换系统分配的音色
VisionStory 会根据人物看起来的年龄与性别,自动分配一个合适的初始音色。你可以直接用它,也可以预览或换成其他音色。
- 点击当前音色,打开音色库。
- 点击音色右侧的播放按钮,试听示例。
- 如果不合适,可按 Language、Gender、Age、Use Case 进行筛选。
- 多试听几个选项,再选择最符合虚拟人和视频用途的音色。

有些音色在年龄与性别上可能匹配,但用于旁白、教学、广告或对话内容时依然会显得不对。要匹配的是“人物 + 用途”,不只是人口特征。
第 4 步:为最终发布场景重新取景
在虚拟人预览中决定最终视频里要出现多少人物画面。拖动照片来调整主体位置,用缩放控件拉近或拉远。然后选择适合发布平台的宽高比:
- 9:16 竖版:适合 TikTok、Instagram Reels、YouTube Shorts 等移动端优先的场景。
- 1:1 方形:适合方形社媒贴文、以头像为中心的版式,以及更灵活的嵌入。
- 16:9 横版:适合 YouTube、演示文稿、网站,以及宽屏课程。

缩放无法凭空“变出”不存在的像素。如果人物已经贴到源图边缘,建议换一张背景更多的图片,而不是强行拉出更宽的裁切。
第 5 步:了解 Change Look 和 Generate Image 的区别
虚拟人旁边有 2 个 AI 图像工具,使用前先弄清它们的差别会更顺手。
Change Look 会打开一个 AI 对话,并自动附上你当前的虚拟人作为起始图,让你描述新的服装、场景或风格。这是一个 image-to-image 工作流,原来的虚拟人仍会保留。Generate Image 则从文字角色描述开始而不是从照片开始,因此是 text-to-image 工作流。两种方式都可以继续对话来不断优化结果。

简单来说:角色已存在但需要换造型时用 Change Look;想从提示词创建角色时用 Generate Image。
第 6 步:添加一段短文稿并生成会说话视频
选中你上传的虚拟人后,在 Script 输入框里写一句简短、口语化的句子。短句渲染更快,也更容易同时判断照片清晰度、裁切、音色、对口型和动作效果。
点击 Generate Talking Video。VisionStory 会用你选定的虚拟人、取景、文稿与音色为人脸做动画、对齐嘴型,并加入逼真的眨眼与头部动作。渲染通常只需几分钟。

把第一次生成的结果当作一次实用的源照片测试,重点检查 4 点:
- 在最终尺寸下,人脸依然足够清晰。
- 动作过程中,眼睛和嘴巴没有被遮挡。
- 头部与肩膀在所选画幅里留白舒适。
- 动起来的虚拟人依然像源照片里的人。
如果裁切太紧,或脸在动作里看起来发虚,先从源图或取景开始调整。改文稿并不能解决构图问题。
第 7 步:复用或移除你的会说话照片虚拟人
回到 Characters 列表,你上传的虚拟人会显示在公共角色库上方。之后只要想用同一个出镜人,随时都能选它。其他用户看不到它;订阅用户还能创建并保留无限数量的虚拟人。
- 复用:直接选择该虚拟人,无需再次上传照片。
- 切换造型:打开虚拟人,选择已保存的造型缩略图之一。
- 移除:将鼠标悬停在虚拟人上,右上角会出现删除按钮;确认后会删除该虚拟人及其所有造型。

常见照片问题排查
VisionStory 找不到可用的人脸。换一张更亮、更清晰、正面且脸更大的照片。避免眼睛或嘴巴被遮挡、明显侧脸角度,以及有另一张脸紧贴主角的照片。
16:9 横版裁切太近。源人像照两侧可能没有足够的画面区域。换一张更宽的源图,或人物周围留白更多的照片。
虚拟人仍在准备中。等准备完成后再使用角色。如果一直卡住,刷新 Characters 视图,并先确认虚拟人是否已出现,再决定要不要重新上传。
效果看起来发软。尽量从更高分辨率、对焦清晰的照片开始,并避免把很小的脸放大得太夸张。输出分辨率无法补回源图缺失的细节。
让照片开口说话就是这么简单:上传一张人像照、匹配音色、调整取景,然后生成。你的照片现在已经变成一个可复用的会说话虚拟人,随时需要都能再用。
想了解完整的文稿、音色、设置、积分与生成流程?可以继续看 How to Create an AI Talking Avatar,或把完整文稿批量生成 AI 视频。或者现在就开始:免费制作你的第一张会说话照片。
