输入什么,输出什么

适用对象

叙事与 IP 团队

以分集形式讲故事的团队:角色驱动的短剧系列、动画叙事,以及必须下个月再出现也依然能被认出来的品牌 IP 角色。

起始材料

你已确定的一个角色

角色文字设定或参考图片、你的剧本或对白,以及若角色基于真实人物的脸或音色所需的书面授权。

你将获得

可复用的角色设定与对应镜头

一个固定的角色档案,以及基于它生成的场景图片、动态镜头与可用于交付的主视觉素材,并以文件形式交付,便于你自行剪辑与发布。

当角色不再“跑偏”,会发生什么变化

角色驱动的作品往往会以一种很具体的方式“翻车”。不是写作不行,也不是渲染不行,而是在某个瞬间,观众不再相信:第 5 集屏幕上的那个人,就是他们在第 1 集认识的那个人。下面的内容,都是在讲如何把这种信念在不同场景、不同季、以及每周换不同人制作的情况下持续维系起来——以及哪些环节可以交给工作流程承载,哪些仍必须由人来做决定。

第 9 集看起来还是第 1 集的那个人

第 3 集一上线,底下第一条评论就问:这还是第 1 集的那个女生吗?严格来说,是的。但下颌变窄了,刘海分边换到了另一侧,眼睛也浅了一点;观众一旦注意到,就会盯着脸看而不是看剧情。把第 1 集用过且有效的描述再提示一遍,回来的往往是“表亲”,不是同一个角色。

解决方法是:别再一遍遍“描述”这个角色,而是开始“复用”她。角色设定只要建立一次,就能把脸、音色与外观作为固定参照;之后每个场景都以这个参照生成,而不是用某个人凭记忆重写的一段文字。VisionStory 负责让角色保持可识别;它不会决定她是谁。你仍要把角色设定写清楚,也仍要在每个新场景的第一帧检查那些容易跑偏的细节:服装、发际线、以及必须一直在同一侧脸颊的小疤痕。

把对白场景当作剪辑来写,而不是当作提示词

这个段落很好描述,却很难生成:两个人坐在桌前,一个在撒谎,另一个慢了半拍才反应过来。用一条提示词去生成多角色场景,结果常常变成两个人同时对着镜头说话,谁也不看谁;原本撑起整段戏的停顿也不见了。画面里没有任何可供剪辑的点,因为这个镜头从一开始就不是为“可剪”而搭出来的。

按剪辑师会接收到的方式来搭建场景。每个角色都有自己的镜头,并且从各自锁定的档案生成,因此你可以在脸部始终一致的前提下,决定每句台词由谁出镜,以及台词落点时他/她的视线看向哪里。轮流接话、慢半拍才到的反应、回答前的停顿——这些是你要剪出来的节奏,不是靠设置调出来的参数。VisionStory 负责生成镜头和音色;让场景成立的韵律,依然由你的导演决定。

角色是一套规则,不是一文件夹截图

真正了解这个角色的人往往只有一位自由职业者,而他/她掌握的信息,要么在自己笔记本里的参考文件夹里,要么在脑子里。季与季之间合同一结束,下一位接手的人打开归档,只能从静帧倒推、靠猜:这件外套是角色设定的一部分,还是只是第 4 集的造型?她会不会在第一幕就说口头禅?观众应该把她看作几岁?拍到第 10 集时,没有人能不翻半天就答得出来。

把角色当作四个一起“打包移动”的要素:一张脸、一个音色、一种说话方式,以及一小套不允许变动的外观规则。把它们作为一个可复用的人设保存下来,旁边再配一个命名好的场景库,这套设定就能顺利交接。新协作者打开档案,直接从档案生成下一场戏,而不是去反向拆解上一场。规则本来就该由你来写,而且值得在第 2 集之前就写好,而不是到第 9 集之后才补。

当角色基于真实人物打造

很多故事角色都始于某个真实的人:成为品牌吉祥物的创始人、被选角进剧集的演员、或是大家一听就知道是这档节目的人声的同事。让一切开始的那句“同意”,可能只是某次会议里,为一部没人确定能不能拍超过 6 集的试播集点了头。两季之后,同一张脸却在另一个市场做付费植入,甚至用的是那个人不会说的语言——而这些都不在当初的对话里。

授权不是过一次门就结束,而是一段有边界的范围;而节目越做越大,越会不断踩到这些边界。只有把角色、内容、市场范围与期限写清楚的书面授权,作品才真正可用。因此每一次扩张,都是在生成画面之前就回去把边界先扩大的理由,而不是等到活动上线后才补:新一季、新地区、付费植入、衍生剧、合作品牌。边界之内,工作就很常规:把脸放进静帧时保留原始光线与构图;把已录制的念白保留原有节奏与重音,同时让最终输出的音色成为角色的音色。边界之外,再顺畅的流程也无法让素材具备可发布性。

会说话的角色,观众看的是嘴和眼

大家都点头通过的角色设定表,可能在角色一开口的那一刻就崩了。观众不再“看图”,而是开始“读嘴”:口型是否对得上辅音,眼神是在看对话对象还是飘到镜头外一点,台词都落完了头还在不在继续漂移。这些在静帧里都看不出来,而把静帧做得更漂亮也解决不了。

所以,把说话镜头当作“有长度的镜头”,而不是“音频多长就跑多长的片段”。AI 生成角色的单一连续长镜头,通常只能稳定撑住几秒台词;再往后,小误差会累积,脸就开始显得“合成感”更重。面对长段独白,更诚实的解法是剪切:切到听者、切到反应、切到手部,再切回来。视线方向要在生成前就决定好,而不是生成后再跟它较劲;每个 take 控制得足够短,画面才会干净;在台词点上剪,而不是把一个镜头硬拉到它承受不了的长度。某个时刻真的必须拉长时,解决办法是导演调度,而不是渲染更久。

以角色为核心的团队如何使用 VisionStory

要做 AI 角色视频,最简洁的答案是:先把角色定下来,后面的一切都以它为基准生成。角色“档案”比角色“描述”更值钱,差别就在你往里放了什么:一张脸、一个音色、一种说话方式,以及一小套永远不允许变动的外观规则。把这四件事定住,后面大多就是执行。下面 6 个步骤也标出了仍需要人来做决定的地方,尤其是涉及真实的人脸或音色,以及最终要发布的内容。

在任何内容发布前,内容负责人需确认角色人脸与音色背后的授权范围,确认源图片与录音已获准用于该用途,并确保生成的角色绝不被呈现为真实人物。

  1. 01

    在第一场戏出现前先把角色定型

    一次性把角色做成可反复出镜的人设,让她的脸、音色与外观在由此生成的每支视频里都保持不变,然后把这个人设当作后续一切的参照。在产品里,这个人设就是一个虚拟人:你保存一份档案,让之后的每个场景都指向它,而不是每次重打一遍描述。并在旁边写清楚哪些东西不允许动:角色应该呈现的年龄感、发际线、服装规则、口音、以及让对白听起来像她的 2 个语言习惯。VisionStory 会在不同场景中稳住这套人设。角色是谁、哪些特征让她一眼可辨——这部分由你来定。

    工具 AI 网红
    AI 网红
    打造一个可持续复用的虚拟人设:固定脸部、音色与整体风格,让每支视频都一眼可认出来。
  2. 02

    先让角色动起来,再去搭建周围的一切

    角色人设定下来后,下一步要验证的就是:它是否能动起来。用 Image to Video 把一张已获授权的角色图片做成一段动作可控的短片段,按镜头逐个生成,而不是一次生成整场戏。对话往来就是由可剪辑的镜头组成的,它也给你留出空间放进“慢半拍”才落下的反应镜头。动作只做当下这一刻需要的量就好,因为角色在画面里漂来漂去,更像特效而不是表演。越早看到角色动起来,也越能在还很便宜、很好改的时候确认侧脸轮廓是否对。把这些片段剪成一场戏的剪辑方式,由你决定。

    工具 图片转视频
    图片转视频
    将一张已审核通过的人像、产品或场景图片动起来,生成可控运动的短视频片段。
  3. 03

    不用重演整场戏,也能给角色一把统一音色

    你可以自己把对白表演一遍,或复用你已有的一条录音,然后用 变声器 处理,让输出的声音变成角色的音色,同时保留原表演的节奏、重音与停顿位置——演员怎么演,它就怎么留。它在这样的场景最有价值:台词的读法各方面都对,唯独声音不对;或一整季由不同的人在不同的日子录制,但角色必须始终听起来是同一个人。若目标音色是以真实人物为原型,生成任何内容之前必须先取得对方的书面许可。

    功能 变声器
    变声器
    在不改变原有时长与表演节奏的前提下,为现有录音更换输出音色。
  4. 04

    搭建角色所处的世界

    当角色动起来看着对了,就用 AI图像生成器 把它周围的一切都做出来:配角、场景需要的房间与街道、道具、封面图和每集缩略图。把成果按“集数 + 节拍”命名整理进场景素材库,这样项目里的第三位编剧也能直接找到第二集的厨房,而不是再生成一个新的。连贯性更常在这里出问题而不是角色本身,所以每张新图进库前都要先对照角色规则检查,再对照上一集核对观众会注意到的细节。

    工具 AI 图片生成器
    AI 图片生成器
    根据提示词或参考素材生成相关封面图、角色、场景与配套视觉素材。
  5. 05

    只替换你有权使用的脸

    Face Swap 会把静态图片中的脸替换为已获授权的相貌,同时保留原本的光线与构图——这正是以真人为原型的角色,能在主视觉与场景剧照中保持一致的方式。它只适用于静态图,不适用于已完成的视频片段。在生成第一帧之前,就要取得当事人的书面许可,明确角色指向、内容用途以及投放/发布的平台与渠道,并且绝不要把结果当作对方的真实影像来呈现。若授权不清晰,就改为直接生成角色。

    工具 换脸
    换脸
    在静态图片中用已获授权的肖像替换人脸,同时保留原有的光线与构图。
  6. 06

    把角色美术提升到交付尺寸

    把主视觉、角色肖像、场景参考图和缩略图都用 图片放大 处理,让它们在最终成片母版的交付尺寸下依然站得住,包括脸部铺满屏幕的 4K 特写。最容易在这里“崩”的,往往是为了第一次测试随手做的角色设定图(尺寸怎么方便怎么来),所以请在全尺寸下重点检查观众真正会盯着看的地方:眼睛、发际线、嘴部。放大只会提升清晰度与可用尺寸;它不会凭空补出源素材里从未存在的细节,所以小尺寸就不对的脸,放大了也还是不对——正确做法是回到人设重新生成。

    工具 图片放大
    图片放大
    提升人像、产品图、缩略图与参考图片的清晰度与可用尺寸。

常见问题

  • 别再反复重新描述角色,改为复用同一套人设。把脸、音色和整体形象一次性做成可保存的虚拟人;后续每个场景都以这套人设为基准生成,而不是每次都重新写提示词。同时写一份简短的“不可变更清单”:她看起来多大、刘海/分发位置、她总穿什么、她听起来是什么感觉。然后把每个新场景的第一帧和上一集对照检查——因为跑偏总是先从那些细小到说不清、但观众会感觉到的细节开始。

用户喜爱 VisionStory

了解内容创作者和营销人员为何信赖 VisionStory 满足他们的 AI 视频需求。从强大功能到流畅体验,我们的用户社区对 VisionStory 的成果赞不绝口。

查看 G2 上的所有评价