AI漫剧推文短视频制作:分镜生成与角色一致性实战攻略
2026/9/20 22:38:21 网站建设 项目流程

这几年AI漫剧推文短视频几乎成了内容赛道最热的方向之一。做小说推文的、做影视解说的、甚至做IP账号的,都在往这个方向转型。按理说这赛道门槛不高,有AI绘图工具就够了,但真正上手跑过几轮你就会发现,决定一条漫剧能不能持续量产、能不能接得住剧本的,就两个关键命门——分镜生成的质量和角色一致性的稳定度。很多团队卡在第一步的分镜脚本转化上,更多个人创作者死在"第一集主角是什么脸,第二集就换了一张脸"的尴尬里。这篇文章把我自己从脚本拆解到成片发布的完整工作流,以及踩了大半年的坑,全部梳理出来,给准备入坑或正在瓶颈期的人一个可以直接参考的路线。

1. 为什么AI漫剧推文会火,以及制作它到底卡在哪里

1.1 内容形式的演变:从图文推文到AI漫剧

先聊清楚什么叫AI漫剧推文短视频。它本质上还是推文视频的一个变种,只是把原来"一张风景图加一段文字朗读"的形式,升级成了"漫画风格的画面加分镜切换加角色出镜"的动态剧集。观众刷到的时候,看到的是类似动态漫画的东西,但实际上每一帧画面都不是手绘的,而是AI生成的。

这个形态为什么能在短时间内迅速起量,到后来彻底卷成一个成熟赛道?我觉得有几个原因:

第一,平台对图文搬运类的推文视频压得越来越狠。单纯拿书封、风景照配上配音的伪原创内容,重复率太高,平台不推流。而漫剧这种形式因为每一帧画面都是AI生成的,天然有"原创"属性,完播率和互动率都明显好于传统推文视频。

第二,制作成本确实降到了一个人能扛得住的程度。早几年的动态漫画还需要找画师拆帧、手绘分镜,一部中等长度的短片成本少说几万块。现在的AI工作流,从脚本到成片,单人一天能做出一到两条完整内容,成本几乎只有会员费和电费。

第三,叙事容量变大了。推文视频原来只能念一段几百字的文案,而漫剧可以做成连续剧集,第一集留钩子,第二集填坑,观众追更粘性远高于单条视频。这就意味着它能接住小说推广、短剧引流、甚至是自有IP内容孵化等更多的商业化需求。

但是,当我真正下场做了半年之后发现,漫剧的制作远不是"写个提示词、点个生成"这么简单。

1.2 真正卡住量产的两个命门

至少在我和身边的同行那儿,大家遇到的瓶颈高度一致:分镜生成和角色一致性。

先说分镜。分镜这个词是从影视工业借来的,指把文字脚本转换成一个个镜头画面的过程。传统的分镜师要画草图、标景别、标运镜方式,而现在要做的是让AI来替代这个环节。难点在于,AI生图不是"你说什么它就画什么",它更像一个理解力有限但画技超群的画师。你的分镜提示词能不能准确传达镜头语言、人物状态和场景氛围,直接决定生出来的图能用不能用。

再说角色一致性,这个是所有漫剧创作者公认的噩梦。AI大模型本身是没有"同一个角色"的概念的。它每次生成图片,性别和大致外观也许能靠提示词控制住,但五官细节、发型发色、服装质感和颜色,都会在下一个镜头里悄悄漂移。一个镜头里男主角穿黑色皮衣,下一个镜头突然变成深蓝色夹克;刚才还是单眼皮,下个镜头就变成欧式大双。这类问题在单张生图时几乎无感知,但放在一条连续故事的短视频里,观众的违和感会被无限放大,直接判定你的内容粗糙、不用心。

这两个问题不解决,漫剧就永远是"能做出来,但做不快、做不精"的尴尬状态。下面我会用后面几个章节,把这两块各自拆开来讲,把我验证过有效的工作流和参数全部交代出来。

2. 分镜生成:从脚本到画面的第一道转化工序

2.1 脚本拆解:先让大模型帮你把叙事翻译成镜头语言

很多人做分镜的第一步就错了。他们拿着小说原文直接丢给AI绘图工具,想让它画出"他震惊地看着她"这种画面。结果画出来的是两个模糊人影,根本没法用。原因在于,小说叙事用的是情绪语言,而绘图模型要的是视觉语言。

正确做法是先用大语言模型(LLM)做一层"翻译"工作。我自己用的流程是这样的:

第一步,把小说章节或推文文案丢给大语言模型,让它按照镜头语言重新组织。我会给它一个明确的分镜表格式,要求输出以下字段:

  • 分镜序号(例如S01、S02)
  • 景别(远景、全景、中景、近景、特写)
  • 镜头角度(平视、俯视、仰视、斜角)
  • 画面内容(场景、人物位置、人物动作、表情状态)
  • 台词或旁白(这条镜头对应的文案内容)
  • 情绪氛围(紧张、温馨、悬疑、冷峻等)

举个例子,小说原文可能写着:"林晚推开咖啡店的门,看到窗边坐着的那个人,整个人都僵住了。"如果直接扔给绘图模型,大概率生成一个不知所云的画面。但经过LLM翻译后,它会变成:

镜头S03:中景,平视 画面内容:现代都市咖啡馆内景,门被推开,一位黑发年轻女性站在门口,手持包带,身体微微僵硬,视线投向窗边。窗边坐着一位穿深灰色大衣的男性,侧脸轮廓清晰。 情绪氛围:惊讶、时间凝固

这一步做完,生图的成功率至少翻一倍。因为大语言模型擅长做"语义到结构的转换",它会帮你把情绪描述补全成具体的画面要素:穿什么、站在哪、看什么、光线如何。你只需要在提示词里把这些要素组织好。

我个人还习惯让LLM一次性输出整个章节的全部分镜,然后我再人工删减。AI写的分镜会偏保守,镜头切换不频繁、缺少节奏感,但这没关系,初稿够用就行。你可以追加一条指令:"请确保每15到20秒的叙事中至少有一个景别变化,并在高潮段落使用特写镜头。"这样生成的分镜表会更接近短视频的节奏需求。

2.2 分镜提示词模板:人物、场景、景别、动作如何组合

LLM输出的分镜脚本还不是最终提示词。你需要按照绘图工具的语法习惯,把它重组成一套结构化的提示词。

我这半年用下来,最稳定的分镜提示词结构是四段式:

画面主体描述(人物+动作+表情) + 场景环境(地点+氛围+光线) + 镜头语言(景别+视角+构图) + 风格参数(画风+渲染质量+负面提示词)

用上面咖啡店的例子展开,最终提示词大概是这样的(以Stable Diffusion为例):

masterpiece, best quality, anime style, a young Chinese woman with black long hair, wearing a beige coat, standing at the entrance of a modern coffee shop, holding a bag strap, body slightly stiff, eyes wide looking toward the window, medium shot, eye level, shallow depth of field, warm interior lighting, coffee shop atmosphere,

后面还要接上负面提示词:

lowres, bad anatomy, bad hands, extra fingers, extra limbs, blurry, jpeg artifacts, watermark, text, signature

这里有几个点值得单独说一下:

人物描述一定要放在最前面,而且要固定描述词。这就是为后面要讲的角色一致性打基础——同一个角色在每条分镜里必须用同一段"外貌描述词",一个字都不能改。

场景描述要避免出现和人物描述冲突的词汇。比如人物的头发是黑色,场景里就不要出现"dark background"这种可能抢颜色的词,否则模型可能把头发也画成深色背景的一部分。

景别和镜头语言放在第三段。很多新手把景别写在最前面,模型往往会忽略。放在中间偏后的位置,配合"medium shot"、"close-up"这种明确的摄影词汇,遵守率要高很多。

风格参数里我会统一加"anime style"或者"illustration style",保证整套分镜的画风一致。这个点在后面讲画风统一的时候还会再展开。

2.3 工具选型:主流AI生图工具的分镜能力对比

分镜批量生成阶段,最常用的工具无非这么几类:Midjourney、Stable Diffusion生态(包括ComfyUI)、以及国内的可灵、即梦等一站式工具。

我用一个表格来对比它们在我实际项目中的表现:

工具分镜效率角色一致性支持批量生成原生中文理解适合人群
Midjourney高,单张速度快支持--cref角色参考通过Remix模式批量一般,需英文提示词有提示词基础的个人
Stable Diffusion(SD/ComfyUI)中,依赖显存支持IP-Adapter、InstantID支持批量出图一般追求可控性的进阶玩家
即梦高,界面友好支持角色记忆功能支持分镜脚本批量生成新手和小团队
可灵支持参考图锁定部分支持视频创作者

我的建议是:预算有限、追求效率的,可以直接用即梦或可灵的一站式方案,它们在国内网络环境下体验顺畅,角色的参考图锁定功能做得越来越成熟;如果对画风和质量有更高要求,并且愿意折腾,Stable Diffusion搭配ComfyUI是上限最高的路线。Midjourney的优势在于出图审美高,但它在分镜批量生产的流程化上弱一些,更适合做精品单图。

我自己目前的组合是:主力用ComfyUI加角色LoRA或InstantID的方案做核心镜头,快速验证镜头效果时用即梦的批量分镜功能,两条腿走路。这个组合在后面章节里会看到。

3. 角色一致性:AI漫剧最难啃的骨头

3.1 为什么AI生图总是"换脸"

要解决角色一致性问题,首先得理解AI生图的底层逻辑。扩散模型生成图片时,本质上是在一个"噪声"的基础上逐步去噪,最终得到图像。它并不是像画家那样记住一张脸然后画出来,而是根据你给的提示词,在它的"经验空间"里搜索一个最匹配的图像分布。

问题就在这里。大模型对"黑发女性"的理解是一个概率分布,不是一个确定的个体。同一句"a young Chinese woman with black long hair",它每次采样到的高维特征可能都不一样。虽然外观上都是"黑发年轻女性",但在具体五官、脸型、气质上,每次生成都相当于一次"重新投胎"。

漫画风格尤其明显。真人风格的照片会比较接近,因为人脸皮肤纹理、光影细节会把五官的差异稀释掉;但动漫风格高度依赖线稿和色块,五官特征就是那几笔线条的排列组合,稍微偏移一点,看起来就是不同的人。

理解了这一点,你就能明白为什么"提示词玄学"无法根治角色漂移——你没法用语言精确描述一个人的全部面部特征,更没法让模型每次都精确复现它。必须要用"参考图"这类显式的锚定手段。

3.2 保持角色一致性的四大主流方案

我把目前实际操作中有人验证过并且能稳定出片的方案,按自动化程度从低到高排了一个序:

方案一:固定种子值加统一提示词。这是最基础的做法,同一条分镜里所有图片都使用相同的随机种子(seed),同时角色描述词完全一致。它的逻辑是,种子值相同意味着初始噪声相同,模型在同样的起点上更容易落在相近的图像区域。但说实话,这个方案的稳定性有限,种子只能保证"大概像",无法精确锁定五官。它最大的价值是零成本,可以作为校验基准。

方案二:Midjourney的角色参考参数--cref。Midjourney支持角色参考图,用法是给一张角色设定图,加上--cref参数,并配合--cw(character weight,角色权重)来控制参考强度。我自己的经验是,--cw取80到100时,服装和发型的一致性最好,但构图会受参考图影响;--cw取40到60时,能保留更多自由度,适合需要动作变化较大的镜头。这个方案适合单角色镜头为主、对角色的动作要求不太高的场景。

方案三:Stable Diffusion加IP-Adapter FaceID或InstantID。这是目前可控性最高的一条路线。IP-Adapter的工作方式是把参考图的特征提取出来,注入到生成过程中,相当于给扩散模型加了一个"脸部记忆卡"。InstantID更进一步,只需要一张脸部照片就能提取身份特征,并在推理时保持稳定。这套方案下,角色的脸基本能做到多角度复用,表情和视角变化后的五官依然统一。

方案四:角色LoRA训练。这是最重但上限最高的方案。LoRA是一种低秩微调技术,你可以用同一个角色的大约30到50张不同角度的图片,训练出一个专属的角色模型文件。训练完成后,生成任何场景只要在提示词里挂上这个LoRA,模型就会稳定输出这个角色的长相。训练成本主要是算力,一张消费级显卡(12GB以上显存)就能跑,一次训练大约一到两小时。这个方案适合剧集比较长、角色出场次数多的项目,值得前期投入。

从我的实战来看,如果是快速验证和日更账号,方案二或方案三足够了;如果是连载超过50集的长剧集,强烈建议直接上方案四,长痛不如短痛。

3.3 参考图法与LoRA法的关键参数实测

我重点说两个我实测过的重要参数档位。

先看InstantID的实战配置。我用的环境是ComfyUI加InstantID,关键节点参数设置如下:

  • 参考图:用角色正脸清晰照,最好是平视、自然光、面部无遮挡的照片
  • identitynet_strength:0.8
  • adapter_strength:0.4(这个值太高会导致脸部贴图感明显,太低则一致性不足)
  • 生成步数:30步
  • 采样器:DPM++ 2M Karras
  • CFG:5.5

实际效果:identitynet_strength在0.7到0.9之间脸部相似度最高;adapter_strength建议保持在0.3到0.5之间,超过0.6时皮肤质感会变差,像贴了一张图。这个参数组合在侧脸、仰视、俯视等镜头里的表现都还比较稳定。

再看LoRA模型的训练参数。我用的训练脚本是kohya-ss/sd-scripts,关键参数:

  • 训练集:35张角色图,建议包含不同角度(正脸、侧脸、半侧脸)和不同表情
  • 图片分辨率:512x512(训练集统一裁剪,超出部分不拉伸)
  • 学习率:1e-4
  • 训练步数:1600步左右
  • 网络维度:64

训练完的LoRA文件大小只有几十到一百多MB,挂载到ComfyUI后,提示词里写上触发词(比如我训练时用了一个虚构名字"lw")就能稳定调出角色。这一步的坑在于训练集图片的质量,宁可要15张角度丰富、光线干净的图,也不要30张模糊、过曝、杂乱的图。素材干净比数量重要得多。

4. 从分镜到成片:完整制作流水线

4.1 图生视频:哪些镜头动态效果最好

分镜图和角色方案都搞定后,接下来的工序是把静态分镜转化成带动态的视频段。目前最主流的路线是用图生视频工具,把之前生成的分镜图作为首帧,让模型去补全后面的运动。

但图生视频不是所有图都能生得好。以我的实测经验,这几类镜头最容易出效果:

一是有明确主体的中景和近景镜头。人物坐在那里、转头、微笑、举起杯子这类动作,模型的预测能力很强,动态自然。

二是背景相对简单的镜头。比如室内局部、墙壁前、街道一角,模型只需要让人物动,不需要大量计算背景变化,出的效果稳定。

三是镜头运动幅度小的场景。缓慢推近、轻微平移,模型基本能hold住;大幅度的镜头旋转和物体剧烈运动,几乎必出怪异形变。

图生视频的动态幅度参数也要区分场景。在可灵里,我一般把运动幅度控制在3到6之间,日常对话场景取4,情绪爆发的段取6。太低的幅度会让人觉得是PPT,太高则会变形。

还有一个经验:一条视频里的镜头切换不要太碎。短视频的镜头如果平均时长低于2秒,观众会觉得画面一直在跳。我一般控制在3到5秒一个镜头,既保留了动态感,也给后续配音和字幕留了节奏空间。

4.2 配音与字幕:推文节奏怎么卡

AI漫剧的视频节奏,除了画面,配音和字幕占了更大的分量。漫剧在短视频上的爆点往往和画面的紧张感绑定,但观众真正接收信息靠的是耳朵和眼睛的双通道。

配音这一块,我目前用主流的TTS工具就能满足大部分需求。多角色对话时,人物音色要分开:主角用一个音色,配角和旁白各用另一个音色。这看起来是常识,但很多初稿会在多角色混驾的时候出现音色乱跳的问题,所以最好在脚本阶段就标注好每句台词的Speaker ID。

字幕是另一个容易被忽略的点。漫剧观众通常是在静音或低音量的场景下刷视频,字幕不仅要准确,还要带情绪。我习惯把关键词或者情绪词用大字号或高亮颜色标出来,比如"他猛地回头"里的"猛地回头"、震惊时的"什么?!",这类文字强调能极大提升完播率。

另外,口语化的旁白文案和字幕的断句是两回事。旁白句子可以长,但字幕必须断成短句,一行别超过12个字。这需要你在剪辑时单独做一层字幕稿,别直接把旁白稿丢进自动字幕工具。

4.3 素材管理:分镜素材命名与复用规范

做好分镜结构和角色方案后,脚本阶段就得设计素材管理规则。我自己用的命名规范是这样的:

项目名_场景编号_镜头编号_角色编号_版本号

举例:

yuedu_S03_L02_Main_v2

"Main"是主角角色编号,v2表示这一镜头的生成版本。这样做的好处是:后续找图时一眼就能看出是哪本书、哪个场景、哪条镜头、哪个角色、第几版。AI生图经常要反复抽卡,没有这个命名规范,几十张图一混,项目直接就乱了。

我还会单独建一个"角色设定"文件夹,里面放每个角色的标准参考图,以及对应的提示词模板。每次生图前先把该角色的固定描述词粘贴出来,对照检查一遍,避免因为手滑改了发型颜色导致后期发现角色漂移。

5. 制作过程中的高频翻车现场与排查链路

5.1 角色忽然换衣服:参考图权重与词法冲突

这个问题的翻车率极高,几乎每个刚上手的人都会遇到。表现是:第一幕里男主穿黑色皮衣,到了第二幕没有任何情节铺垫,突然变成卡其色风衣。

排查链路要分两条走。

第一条链是参考图权重。如果你用了--cref或InstantID,先检查角色权重参数是否设置合理。以Midjourney为例,--cw默认是100,这个值会锁定角色的服装细节。如果你希望角色换衣服,需要把cw降低到40到60,同时把新服装描述写进提示词。如果cw是100,模型会优先参考原图,你的"卡其色风衣"就会被压制,但服装又因为参考图含混不清而漂移到灰色调,最终出现"说不清什么颜色"的衣服。

第二条链是提示词词法冲突。如果提示词里同时出现了"black leather jacket"和"khaki coat",模型有可能随机选一个。你需要删除和旧服装相关的所有词,只保留新服装描述,并且把服装词放在提示词的主体描述区靠前的位置。

我自己的经验是,服装一致性和镜头多样性之间永远有一个平衡。如果你想流水线产图,就宁可让角色一直穿同一套衣服;如果剧情非要换装,那就先出一张新服装的角色设定图,再把这个设定图作为后续镜头的参考图。换装必须走"先定妆、再出镜"的流程,不要在同一个参考特征下直接改提示词。

5.2 手部崩坏与五官畸变:局部重绘的边界

AI生图的手部问题是老生常谈。纯生图阶段可以在负面提示词里加"bad hands, extra fingers",能大大降低崩坏率,但完全杜绝很难,特别是人物拿东西、手指交叠的镜头。

如果分镜图里手部崩坏了,不要整张图重抽,那样容易连脸带画风一起变。正确做法是局部重绘(inpainting)。Stable Diffusion的局部重绘、ComfyUI的Paint节点、即梦或PS的AI填充都能做。我的做法是:

  1. 用蒙版把崩坏的手部区域涂出来。
  2. 提示词里写"hands holding a coffee cup, realistic hand anatomy"之类具体描述。
  3. 重绘幅度(denoising strength)控制在0.4到0.6,太高会改变周边区域,太低则修不掉崩坏。

五官畸变的情况也类似。漫画风格的五官崩坏往往集中在眼部、嘴巴等细节,局部重绘时幅度可以更低一些,0.3到0.4就够,否则会换脸。

这里还有一个隐藏的坑:如果你此刻已经用了InstantID或者LoRA固定了角色脸,那么局部重绘时必须保持同一个角色控制网络开启,否则修完手,脸却变了,得不偿失。

5.3 多角色同框:谁在"抢"特征

多角色同框是漫剧里难度最大的一类镜头,因为一致性锚点之间会发生冲突。两个角色都用参考图注入特征时,生成结果容易出现"两脸纠葛",也就是A的鼻子安到了B脸上。

我自己常用的解法是分步合成:

第一步,先把画面里多个角色分别用单人镜头生成好,各自保持最佳一致性。

第二步,把两张单人图作为输入,放进局部重绘或者图生图中合成一张同框图。此时提示词里只写场景和构图,角色描述词各用一半,配合各自角色的LoRA或参考图节点,但权重都要调低,比如LoRA权重从1.0降到0.7。

第三步,检查合成图,如果局部崩坏,再用蒙版局部重绘修补。

这个方法的核心逻辑是"降低每一个特征注入源的强度,把它们从竞争者变成合作者"。你让两个角色同时以极高权重输出特征,模型根本不知道该听谁的;降低权重之后,反而能找到一个平衡点。

还有一个辅助技巧:构图时尽量让两个角色占据画面不同侧,位置不要重叠。模型在生成时会自然地按左右分工分配特征,重叠部分才是冲突的重灾区。

6. 从能出片到能稳定出片:我在量产阶段的几项优化

6.1 批量生产时提示词模板的工程化管理

当我从"做几条视频玩玩"转向"每天稳定出一到两条"的时候,最大的感受是:AI生图最怕的不是效果差,而是不稳定。今天调的参数明天就忘了,这个镜头用了什么提示词自己也说不清。

所以我把提示词做成了"模板加变量"的工程化管理方式。一个典型的分镜提示词模板长这样:

风格前缀:masterpiece, best quality, anime style, cinematic lighting 角色模块:{角色外貌描述} 场景模块:{场景地点描述, 光线氛围描述} 镜头模块:{景别, 视角, 构图描述} 渲染后缀:8k, detailed face, detailed eyes 负面提示词:lowres, bad anatomy, bad hands, blurry, watermark, text

每次生成新镜头时,只替换{}里面的变量,其他固定部分一个词都不动。这样能保证整套视频的画风和角色描述始终一致,排查问题时也能快速定位是哪一段变量出了问题。

我还会为每个项目维护一张"角色与场景提示词速查表",表格里记录每个角色固定描述词、服装设定、所属场景的关键词。新同事或者未来的自己,拿到这张表就能无缝接手项目。

6.2 画风统一的隐性参数:裁切、分辨率与推理步数

画风不一致是批量生产后期最容易出现的问题之一。很多人发现角色一致了,但这一集是明亮清新的风格,下一集水墨质感浓重,放在同一个剧集里非常突兀。

画风统一除了在提示词里写死风格前缀,更关键的其实是几个隐性参数:

一是裁切方式。生图时如果每张图的长宽比不统一,模型的构图重心会偏移,导致画面观感不一致。我会在项目开始时固定一个长宽比,比如9:16竖屏,之后所有分镜图都强制在这个比例下生成,不随手改。

二是分辨率。不同分辨率下的采样细节天差地别。我的习惯是,分镜图一律输出768x1344(或同等档位),不混用其他比例,否则视频转场时画质跳变很直观。

三是推理步数和采样器。同一套模型,30步和50步出图的"锐化程度"不一样;同一个步数,不同采样器的风格也有差异。生产阶段我会把生成参数完全固定,只在局部微调,不要每张图都换采样器。

6.3 单镜头抽卡策略:怎么决定一张分镜图算"过了"

抽卡是漫剧制作无法绕开的一步。我的策略不是"抽到好看为止",而是设定一个"可用清单",按下面的优先级判断镜头是否通过:

  1. 角色脸是否一致(权重最高,不符合直接淘汰)。
  2. 是否符合分镜脚本的关键要素(人物动作、场景、景别)。
  3. 手部是否有明显崩坏(轻微瑕疵可通过局部重绘修)。
  4. 画风是否符合项目基准(对比项目风格基准图判断)。

优先级是从1到4依次判断。角色脸不对,其他再好也没用;动作错了,就改了重抽;手部崩坏,保留后用局部重绘修;画风有偏差,通过生成参数校准。

我自己的经验是,一条常规剧集大约需要生成50到60张分镜图,最终入片的可能在35到40张,入片率在60%到70%之间是正常水平。如果你90%以上的图都一次通过,那大概率说明你的画面表达比较保守,可以适当增加镜头张力;如果入片率低于50%,检查提示词结构,大概率是描述太模糊。

写到这里,其实我把一套完整的AI漫剧推文短视频工作流都过了一遍。从脚本到分镜,从分镜到角色控制,从角色控制到批量生产,每一步都有它自己的逻辑和坑。这套流程不是一步到位的,我也是从"天天抽卡抽到崩溃"的状态一路调整过来,最终跑成了一条稳定出片的流水线。如果你正准备入坑,别想着第一次就做出完美作品,先把分镜生成和角色一致性这两个地基打好,后面的效率提升都是水到渠成的事。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询