输入什么,输出什么

适用对象

叙事与 IP 团队

以“分集”方式讲故事的团队:角色驱动的短剧系列、动画叙事,以及需要下个月再登场、仍要被一眼认出的品牌 IP 角色。

起始素材

你已确定的角色

角色文字设定或参考图片、你的脚本或对白,以及角色所基于的任何真实面孔或声音的书面授权。

交付内容

可复用的 persona 及其镜头

一个固定的角色档案,以及基于它生成的场景图、动效镜头与交付规格的关键视觉素材,并以文件形式回传,方便你自行剪辑与发布。

当角色不再“漂移”,会发生什么变化

角色驱动作品的失败往往很“具体”:不是写得不好,也不是渲染不行,而是观众在某一刻不再相信——第 5 集屏幕上的那个人,就是他们在第 1 集认识的那个人。下面的内容,讲的就是如何在不同场景、不同季、以及每周换不同人制作的情况下,仍然把这种“相信”牢牢维持住;以及哪些环节可以交给工作流承担,哪些仍必须由人来做决定。

第 9 集看起来仍是第 1 集那个角色

第 3 集一上线,下面的第一条评论就在问:这还是第 1 集那个女孩吗?严格来说,是的。但下颌更窄了、刘海分到另一侧了、眼睛也浅了一点;观众一旦注意到这些变化,就开始盯着脸看,而不是看剧情。把第 1 集那段有效的提示词再输一遍,回来的不是她,而像是她的“表亲”。

解决办法是:别再反复“描述”角色,而是开始“复用”她。一次搭建好的 persona 会把面孔、音色与形象固化为固定参照;之后每一场戏都以这个参照来生成,而不是用某人凭记忆改写的一段设定文字。VisionStory 让角色更容易被认出来,但不会替你决定她是谁。你仍需要把角色设定写清楚,也仍需要盯住每个新场景的第一帧,检查那些最容易漂移的细节:服装、发际线、以及必须一直留在同一侧脸颊上的小疤痕。

把对话戏当作剪辑来写,而不是当作提示词

这个戏点很好描述,却很难一次生成到位:两个人坐在桌前,一个在撒谎,另一个晚了 1 秒才反应过来。把它当作一条提示词去生成,多角色场景往往会变成两个人同时对着镜头说话,彼此不看对方;承载整个戏点的那次停顿也消失了。画面里没有可供剪辑的点位,因为这个镜头从一开始就不是按“可剪辑”来搭建的。

用剪辑师接片的方式来搭建一场戏。每个角色都有自己独立的镜头,且都从各自锁定的角色档案生成——这样脸始终一致,而你可以决定哪句台词由谁出镜、台词落点时目光看向哪里。轮流接话、慢半拍的反应、回答前的沉默,这些都是你用剪辑做出来的“切”,不是去调的“参数”。VisionStory 负责生成镜头和音色;让这场戏成立的节奏,依然由导演来决定。

角色是一套规则,不是一堆截图

最了解这个角色的人往往只有一个自由职业者;他掌握的细节,一半在自己电脑里的参考文件夹里,一半在脑子里。两季之间合同一结束,下一位接手的人打开归档,只能从剧照倒推着猜:这件夹克到底是角色设定的一部分,还是只是第 4 集的造型?她在第一幕会不会说那句口头禅?观众应该把她“读”成几岁?拍到第 10 集,谁也没法不翻半天就给出答案。

把角色当成四样始终绑定在一起的东西:一张脸、一个音色、一种说话方式,以及一小份“外观不得更改”的规则清单。把它们作为一个可复用的人设保存下来,并配套一个有命名的场景库,这套“组合”就能顺畅交接。新协作者打开角色档案,直接从它生成下一场戏,而不是再去反向拆解上一场。规则由你来写——而且值得在第 2 集之前就写好,而不是拖到第 9 集之后。

当角色基于真实人物

很多故事角色都起源于某个真实的人:成为品牌吉祥物的创始人、被选来出演剧集的演员、或者一个大家一听就能联想到节目的同事音色。当初让一切开始的那句“同意”,往往只是在一次会议里,为一个没人确定能拍超过 6 集的试播集点了头。两季之后,同一张脸却在另一个市场为付费植入站台,用着当事人根本不会说的语言——而这些从未出现在最初那次对话里。

授权不是一次性通过的“门槛”,而是一段有边界的范围——而节目一旦增长,就会不断踩到这条边界。只有把角色、内容、投放市场与期限都写清楚的书面授权,作品才真正可用;因此每一次扩展,都应该在生成画面之前就回去补齐并扩大授权,而不是等到活动上线之后再补:新一季、新地区、付费植入、衍生篇、合作品牌。在边界之内,工作就很正常:把脸放进静帧里,保留原有光照与构图;把录制的念白保留节奏与重音,同时让输出的音色成为角色的声音。超出边界,再顺的流程也无法让素材合规发布。

会说话的角色,观众看的是嘴和眼睛

一张所有人都认可的角色设定图,可能在角色一开口的瞬间就“散架”。观众不再看画面是否好看,而是开始读嘴:口型是否对得上辅音,眼睛是在看对话对象还是飘到镜头旁边,台词都落下了头却还在慢慢漂移。这些在静帧里根本看不出来,也不是把静帧做得更精致就能解决的。

所以,把“说话镜头”当成有时长的镜头来设计,而不是一段跟着音频多长就跑多长的素材。生成角色的一条连续长镜头,通常只能稳住几秒台词;随后细小的误差会不断累积,脸就开始显得“合成感”强。长段台词最诚实的解决方式就是切:切到听者、切到反应、切到手部,再切回来。先在生成前确定视线方向,而不是生成后再跟它较劲;每条 take 控制得足够短以保持干净,在台词点上切,而不是把镜头硬拉到它承受不了的长度。某个瞬间真的必须拉长时,靠的是调度与导演选择,不是更长的渲染。

角色驱动的团队如何使用 VisionStory

制作 AI 角色视频的简单答案是:先把角色定下来,后面的一切都围绕它来生成。角色“档案”的价值远高于角色“描述”,差别就在你往里放了什么:一张脸、一个音色、一种说话方式,以及一份绝不允许变动的外观规则清单。把这四件事定好,后面大多就是执行。下面 6 个步骤也标出了仍需要人来做决定的节点——尤其是在涉及真实人脸或声音,以及最终对外发布的内容时。

在任何内容发布之前,内容负责人需要确认:角色人脸与音色背后的授权范围是否明确;源图片与录音是否已获准用于本次用途;以及生成的角色绝不会被包装成真实人物。

  1. 01

    在第一场戏出现之前就把角色定死

    把角色一次性建立成可反复登场的人设,让他的脸、音色与外观在由此生成的每条视频里都保持固定;然后把这套人设当作后续所有工作的参照。在产品里,这个人设就是一个 avatar:一个保存好的角色档案,你让之后每个场景都指向它,而不是反复重打描述。与此同时,把“绝不允许变动”的点写在旁边:角色应该被读成的年龄、发际线、服装规则、口音、以及让对白听起来像她的两种口头习惯。VisionStory 会在不同场景之间把人设稳稳保持一致。角色是谁、哪些特征让她一眼可辨——这部分决定权在你。

    工具 AI 虚拟网红
    AI 虚拟网红
    打造一个可持续出镜的虚拟人设:面孔、音色与整体风格一次定好,所有视频里都保持高辨识度。
  2. 02

    先让角色动起来,再去搭建周围的一切

    人设定下来后,下一步要验证的是:它能不能动。用 Image to Video 把一张已授权的角色图片做成动效可控的短片段——按镜头逐个生成,而不是一次做完整场景。可剪辑的镜头才是对话来回的基本单位,也给你留出空间去放那种“晚半拍才落下”的反应。动作只做当下这一刻需要的就好;角色在画面里漂来漂去,看起来更像特效而不是表演。越早看到角色动起来,也越能在还便宜、还来得及的时候判断造型是否对路。把这些片段剪成一场戏的方式,由你来定。

    工具 图像转视频
    图像转视频
    将一张已审核的人像、产品或场景图以可控动效制作成短视频片段。
  3. 03

    不用重演整场戏,也能给角色统一一把声音

    你可以自己把台词演出来,或复用已有的一条录音,然后用 变声器 处理,让输出的音色变成角色的,同时保留原始表演里演员放置的节奏、重音和停顿。它特别适合这样的情况:朗读在各方面都对,唯独声音不对;或者一季内容由不同的人在不同的日子录制,但角色必须始终“听起来是同一个人”。如果目标音色基于真实人物建模,在生成任何内容之前必须先拿到对方的书面许可。

    功能 变声器
    变声器
    在不改变原有时长对齐与演绎表现的前提下,替换现有录音的音色。
  4. 04

    搭建角色所处的世界

    当角色动起来已经“看着对”之后,就用 AI图像生成器 去生成它周围的一切:配角、场景所需的房间与街道、道具、封面图和每集缩略图。把结果按“集数 + 节拍”命名存进场景素材库,这样项目里第三个加入的编剧也能直接找到第二集的厨房,而不是再生成一个新的。连贯性更常在这些环境细节里出问题,而不一定在角色本身,所以每张新图进库前都要先对照角色规则检查一遍,再对照上一集核对观众会注意到的细节。

    工具 AI图像生成器
    AI图像生成器
    根据提示词或参考素材生成相关封面图、角色、场景与配套视觉素材。
  5. 05

    只替换你有授权使用的脸

    Face Swap 会把静态图片中的人脸替换为已授权的肖像,同时保留原图的光线与构图——这也是基于真实人物打造的角色,如何在主视觉与剧照之间保持一致的方式。它适用于静帧,不适用于已完成的视频片段。在第一帧出现之前,就要拿到当事人的书面授权,明确角色指向、内容范围以及投放渠道,并且绝不能把结果冒充为他们的真实影像。如果授权不清晰,那就改为直接生成角色。

    工具 换脸
    换脸
    在静态图片中用已授权的肖像替换人脸,同时保留原有光线与构图。
  6. 06

    把角色素材提升到可交付的尺寸

    把主视觉、角色肖像、场景参考图和缩略图都丢进 Upscale Image 进行增强,确保它们在成片母版的交付尺寸下依然扛得住——包括 4K 的大特写:脸几乎铺满整个屏幕。最容易在这里翻车的,往往是为了第一次测试随手做的角色设定图,尺寸太小细节不够。所以请在全尺寸下重点检查观众真正会盯着看的部位:眼睛、发际线、嘴型。图片增强能提升清晰度和可用尺寸,但不会凭空补出源图从未包含的细节;因此小图里脸不对,放大后只会更不对——正确做法是回到人设,重新生成。

    工具 图片增强
    图片增强
    提升人像、产品图、缩略图与参考图片的清晰度与可用尺寸。

常见问题

  • 别再一遍遍重新描述角色了,开始复用同一个人设。把脸、音色和整体风格一次性做成可保存的头像,后续每个场景都以这套人设为基准生成,而不是每次都从头写提示词;同时写一份简短的“不可变更清单”:她看起来几岁、头发分缝在哪、总是穿什么、听起来是什么感觉。然后把每个新场景的第一帧对照上一集检查,因为“漂移”往往先出现在一些细小到没人说得清的问题上。

用户喜爱 VisionStory

了解为什么内容创作者和营销人员信赖 VisionStory 来满足他们的 AI 视频需求。从强大的功能到轻松的用户体验,我们的社区对使用 VisionStory 所取得的成果赞不绝口。

在 G2 查看全部评价