
AI漫剧是最近半年很吃香的一种内容形态。它把网文里常见的穿书、系统、攻略、打脸情节用 AI 绘制的画面加上微动态、配音和字幕做成几分钟一集的短内容。很多人最开始以为 AI 漫剧的难点在画图真正上手之后才会发现最卡人的其实是角色一致性、分镜编排、配音情绪和剪辑节奏。这篇内容我拿一个典型题材来完整拆一遍制作流程就是“穿成将军嫡女绑定废柴攻略系统直接摆烂躺平系统惩罚全部转嫁到战神身上高冷将军反倒开启疯狂自我攻略模式”。适合谁看想做 AI 漫剧但还没有跑通过完整流程的新手以及已经能生成单张图、但一进到多镜头叙事就乱套的人。最值得关注的点是AI 漫剧不是“一键生成视频”它是一条可以拆开控制的流水线你不需要把每个环节都做到极致但必须把角色、情绪和叙事节奏这三件事控住。下面按实际落地顺序拆一遍。1. 先想明白AI漫剧到底在做什么和短剧、动态漫有什么区别1.1 为什么“穿书攻略系统摆烂躺平”适合做 AI 漫剧这段剧情非常有代表性。穿书、系统、攻略、摆烂、转嫁惩罚、自我攻略每一个元素都是网文平台验证过的高热度标签。AI漫剧不需要像真人短剧那样搭实景、找演员、跟组拍摄也不需要像传统动画那样逐帧手绘。它只需要把文字剧情按镜头拆开生成静态画面再让画面产生一点点动态就可以叙事。因为观众看这类内容时脑补能力在线只要情绪和台词给到一点轻微的动态就会觉得“它在演”。这类题材对动作连贯性的要求不高。动作戏、打斗场面在AI漫剧里最容易翻车但摆烂、躺平、系统惩罚弹窗、高冷将军自我攻略这类戏大多是室内对话和情绪反应镜头数量少人物切换少制作压力会小很多。1.2 完整生产流程一览一条AI漫剧的生产链路可以这样拆从剧本到分镜再到角色设定、AI绘画、素材动态化、配音配乐、剪辑字幕最后才是发布。这个顺序不建议乱。先定剧本和分镜再做人设和出图然后是动态化、配音、剪辑。为什么一定要按这个顺序因为 AI 漫剧本质上是用画面去完成叙事。你先把故事拆成镜头才知道需要生成哪些图先把角色定住才知道每个镜头里的人物长什么样先把台词写好才知道配音的情绪在哪里。很多新人经常反过来先到处生成好看的图再凑剧情。这样最容易出现两个问题图很漂亮但剧情连接不上角色不统一每张图都像换了一个人。正确的做法是先画流程再填内容。1.3 工具清单与硬件条件AI漫剧不需要每个人都使用同一套工具但需要覆盖以下能力。环节常用工具/方案用途AI绘图Midjourney、Stable Diffusion、通义万相、即梦生成角色、场景、关键帧图生视频可灵、即梦、Runway、Stable Video Diffusion让静态图产生小幅度动态配音剪映自带配音、Edge TTS、ChatTTS、ElevenLabs生成角色台词剪辑剪映、必剪、PR、DaVinci合成视频、字幕、音效项目管理Excel、飞书表格、Notion维护分镜表、角色卡、批次记录硬件条件不需要很高。纯用云端工具普通笔记本就可以做。如果要在本地跑 Stable Diffusion推荐显存 8GB 以上内存 16GB 以上磁盘至少留 30GB。显存不够时把分辨率降到 512×768 或 720p把批量数量调小也可以出素材。注意工具名和具体功能会随版本变化。这里不评价谁最好建议先把手头能免费用或已买的工具跑通再决定要不要换。2. 剧本和分镜怎么拆把穿书爽文变成可执行的镜头表2.1 从小说梗概到一页纸剧本标题只给了故事走向实际制作前需要把它展开成“一页纸剧本”。一页纸剧本不是文学创作而是按时间顺序列出主角是谁、发生了什么、情绪如何变化、转折点在哪里、结尾停在哪个钩子。对于“穿成将军嫡女绑定废柴攻略系统”这个题材可以这样展开女主苏晚穿越到将军府嫡女身上绑定“废柴攻略系统”。系统要求她去攻略高冷战神将军女主选择摆烂躺平。系统惩罚出现但被转移到了战神身上。战神被惩罚搞得生活各种不顺反而开始注意到女主开启自我攻略。结尾停在一个钩子战神主动来找女主女主内心慌但表面无所谓。一页纸剧本里要标出不同段落的节奏。前 3 秒必须出人物和冲突中间每隔 10 到 15 秒要有一个笑点或情绪点结尾留钩子。这样观众才不会划走。2.2 分镜表要包含哪些字段好的分镜表可以让后期避免大量返工。建议一开始就包含这些字段镜号时长景别画面内容台词情绪音频/音效提示词要点13s全景将军府门前女主醒来内心OS我怎么在这里茫然风声、鸟鸣古代府邸、清晨、雾气23s近景系统面板凭空出现系统请攻略战神惊愕弹窗提示音蓝色半透明面板、古风房间34s中景女主听完任务翻白眼躺倒女主麻烦不想干摆烂轻快音效女主躺床、无奈表情分镜表不需要写得像文学剧本那样长但要能直接喂给AI绘图工具。也就是说“画面内容”要能转成提示词不能只写“女主很漂亮”。2.3 用标题里的剧情做一套分镜示例下面给一个 60 秒左右的分镜示例适合做成第 1 集的引子。时长是估算值实际按配音节奏调整。镜号时长景别内容情绪14s全景古风将军府清晨女主坐在床边茫然23s近景系统面板弹出惊讶34s中景女主听完任务翻白眼躺倒摆烂43s近景系统警告惩罚启动紧张54s中景战神在校场打喷嚏长枪脱手困惑64s近景女主发现惩罚被转移偷笑得意75s近景战神回头看了一眼女主方向若有所思83s特写女主眼神躲闪内心OS别看我慌乱这套分镜的节奏是建立身份、出现任务、女主反套路、系统惩罚、意外转移、钩子。第一集不一定讲完整个攻略停在“战神开始注意到女主”就够了。2.4 每个镜头的“为什么”为什么要先定景别因为 AI 绘图对景别非常敏感。同样一句“女主在房间”近景和全景生成的构图完全不同。先定景别提示词才有的放矢。为什么要先定情绪因为情绪决定光影、表情和动作描述。比如“女主偷笑”和“女主翻白眼”是两个完全不同的画面方向先写情绪可以避免生成表情时不知道往哪个方向调整。在实际操作中我一般会把分镜表放到表格里每一行对应一个镜头。出图时把“提示词要点”单独提出来生成然后回到表格里标记哪些镜头成功、哪些需要重出。这个表格做完后面的工作就不再依赖记忆而是按表执行。3. 角色设定与提示词先锁死形象再谈画面质量3.1 角色一致性为什么是 AI 漫剧的第一道坎AI 漫剧翻车率最高的问题不是画面不够精致而是同一个角色在不同镜头里长得不一样。前一秒鹅蛋脸杏眼后一秒长脸圆下巴上一场是浅蓝长裙下一场变成深色短打。观众很难建立代入感。解决办法不是靠运气反复抽卡而是做一张“角色卡”。角色卡包含外貌、服装、发型、标识物、表情方向以及固定关键词。之后每个镜头都使用同一套角色描述关键镜头用参考图垫图。这个步骤不能省。尤其是系统面板、惩罚特效这类后期要叠加的元素如果角色不稳定叠加得越多越违和。3.2 人设提示词怎么写提示词不是写得越多越好但关键属性要写清楚。拿“苏晚”举例一份可复制的角色卡可以这样组织角色苏晚将军府嫡女穿越者 外貌黑色长发高马尾银色发簪鹅蛋脸杏眼眉尾略上扬 服装浅蓝色窄袖长裙袖口银白云纹白色束腰 气质慵懒微挑眉眼带狡黠偶尔无语望天 固定标记银色发簪浅蓝长裙云纹袖口每次出图时把这段描述放在提示词开头然后再加当前镜头的场景、景别和动作。比如镜头 3苏晚角色卡躺在古代雕花床上翻白眼双手枕在脑后 表情不耐烦阳光从窗棂照进来中景中国古风插画柔和光影这里不要只写“一个美女”。AI 会把“美女”理解成一切能想到的形象气质完全不受控。写得越具体越容易维持统一。3.3 参考图、垫图、局部重绘的配合方式光靠文字提示词很难做到百分之百一致。更稳妥的做法是先用角色卡生成 3 到 5 张正面正脸图选一张最接近预期的作为“角色基准图”。出正式分镜时把基准图作为参考图/垫图再叠加当前镜头的提示词。如果参考图风格太强导致镜头表情僵硬就用局部重绘只改表情或动作不要整图重来。有些工具支持种子值锁定找到稳定的种子后后续同角色镜头尽量沿用。这里不同工具的功能名称不一样。有的叫参考图有的叫垫图有的叫角色特征没有统一的行业命名。但思路是一致的先固定基准形象再通过局部调整控制情绪和动作。注意不要一上来就追求所有镜头完全一致。完全一致会损失动态感和叙事感只要观众能认出“这是同一个人”制作效率就够用了。4. 从静态图到动态镜头生成素材的三种路线4.1 路线A只做微动态AI 漫剧不是每一帧都靠视频模型生成。很多镜头只需要“微动态”头发飘一下、衣摆动一下、眼睛眨一下、镜头缓慢推近。这类镜头用图生视频里的低幅度运动参数就可以完成。优点速度快、不容易崩、画质保持好。缺点动作幅度小不能表达激烈冲突。适合对话、情绪戏、系统面板出现、将军发呆这些场景。4.2 路线B图生视频如果剧情里需要明显的动作比如战神长枪脱手、女主倒头躺下、系统面板震动可以让模型生成 2 到 5 秒的短视频片段。图生视频的输入是静态图加一段动作提示词输出是带动态的视频素材。常见参数可以这样设置参数建议值说明分辨率720p 起步先保证能跑通再考虑1080p帧率12fps 到 16fps漫剧不需要30帧帧率太高反而容易崩运动幅度低或中幅度大时脸和手容易变形镜头运动推、拉、摇避免复杂的穿越机镜头时长3秒左右太长了内容不可控提示词示例镜头缓慢推进女主的头微微转过来眼神从无辜变成狡黠 长发和袖口轻轻飘动窗帘在风中摆动古风房间浅蓝色长裙这里最容易犯的错是运动幅度拉满。画面确实动了但脸也跟着变形后期根本没法修。宁可让动作保守一点多切一个镜头也不要在一个镜头里要求太多。4.3 路线C局部重绘转场并不是每个镜头都需要生成完整动态。转场可以用剪辑完成画面平移、缩放、淡入淡出、叠加系统 UI 动画都会让观众觉得“有动态”。比如“系统惩罚被转嫁到战神身上”这个点不需要直接画“惩罚转移”的完整过程可以拆成两个镜头女主这边出现惩罚提示战神那边长枪脱手。两组画面快速切换就能让观众理解因果同时绕开动态生成的难点。4.4 资源占用低配机器怎么试如果机器只有 8GB 显存先把分辨率降到 512×768 或 720p一次只生成一个镜头。不要开大批量10 张一批容易爆显存。云端工具则优先考虑免费额度先用小尺寸参数验证提示词确认效果后再生成最终素材。判断标准很简单单镜头出片时间在可接受范围内、五官没有明显崩坏、动态合理就可以继续下一镜。如果单镜头反复失败先按第 7 章的排查路线处理。5. 配音、配乐和字幕让观众“看进去”而不是只看画面5.1 配音情绪怎么调画面合格只是第一步。AI 漫剧能不能吸引人往下看配音情绪影响非常大。拿这个题材来说女主的语气要懒洋洋、不耐烦带一点“你随便罚我都不在乎”的松弛感。战神的声音要低沉、克制不能炸因为他是高冷人设。自我攻略时的语气是“嘴上冷静内心开始在意”。系统的提示音要机械、冷冰冰和女主情绪形成反差。使用 TTS 工具时我会先选一个接近角色的声音然后分别试听三句话。不要整段一次读完。第一遍只用一句话测试语速和音色确定满意后再生成全部台词。情绪不对时可以通过标点符号、停顿词、速度参数来调整。比如“系统麻烦你下次换个人坑。”比“系统麻烦你下次换个人坑”更容易让模型读出停顿感。5.2 音效与 BGM 节奏AI 漫剧不能只看画面和台词音效决定了“爽点”能不能落地。系统弹窗用急促的电子提示音。惩罚启动用低鼓或警报音。战神长枪脱手用金属碰撞声加一个停顿。女主偷笑用轻快的拨弦或木鱼声。BGM 选择前期轻快、中期悬疑、结尾留一个轻挑的收拍。卡点位置通常在镜头切换处。我的习惯是先把配音轨道放好再把 BGM 的鼓点对准每个镜头的第一帧最后用淡入淡出处理音效不要所有声音一起压上去。声音堆太满反而会让爽点变糊。5.3 字幕与画面同步的三个检查点字幕是 AI 漫剧里容易被忽视但影响很大的环节。导出前至少检查三个点字幕不要压住人脸尤其是下半张脸。系统设置里可以调整安全边距。字幕断句要跟配音一致。不要出现配音已经说完、字幕还停在上一句。错别字和标点。自动识别容易出现同音字错误发布前必须肉眼扫一遍。如果用了自动字幕不要默认它能一次全对。自动字幕只是初稿最终还是要手动过一遍。6. 剪辑成片与发布前检查先跑通单集再谈批量生产6.1 单集剪辑顺序我推荐的剪辑顺序是先排镜头再配音再配乐然后加音效和字幕最后统一调色。先排镜头把分镜素材按时间轴顺序放好粗剪成一条叙事线此时不纠结细节。 再配音把旁白、台词、内心 OS 放上去同时调整每个镜头的时长让画面配合声音。 再配乐根据配音节奏铺 BGM不要让 BGM 盖过人声。 然后加音效和字幕系统提示音、环境音、转场音逐个加。 最后调色导出保持统一色调。不要每个镜头都是完全不同的明暗。这个顺序的好处是任何一步出问题都不需要从头再来。比如配音超时只需要动画面时长不需要重新构图。6.2 批量生产时最容易忽略的问题当你要做很多集时节奏会变成另一个问题。常见坑点有文件命名混乱。建议每集一个目录素材按“集数_镜头号_版本”命名比如 S01E03_005_v2。没有失败重试机制。单集可以手动重出批量时必须有重新生成的批次记录。输出目录不统一后期找图找不到。建议建一个“分镜表/角色卡/素材/成片”的固定目录结构。没有验证清单。别指望上一集顺利这一集就能直接发布。每集都要过一遍画面、声音、字幕。如果流程足够稳定可以把剪辑模板设定好后续每一集只需要替换素材和配音就能接近一键成片。这里的“一键”不是 AI 工具自动帮你把整部剧写出来而是把你自己的生产 SOP 固化下来减少重复操作。6.3 成品验证清单导出成片之前可以按这个清单过一遍角色是否还认得出是同一个发型、服装、脸型有没有明显变化。画面是否出现大面积崩坏手指、眼睛、文字、兵器。配音是否清楚有没有喷麦、吞字、音量不平衡。字幕是否遮挡人脸上下边缘是否安全。时长是否合适单集控制在 60 到 120 秒流量效率更高。结尾是否有钩子如果没有观众看完不会关注下一集。发布到平台前还要注意标题、封面、简介是否符合平台规则不要使用诱导性话术。生成内容如果涉及肖像、版权、敏感素材要提前规避。7. 常见翻车现场和排查链路7.1 人物脸崩、服装变化、眼睛变形现象同一角色在不同镜头里长得不一样或者同一个镜头里五官变形。排查顺序先检查参考图。角色基准图是否足够清晰、正面、无遮挡。如果基准图本身是侧脸后面各镜头都会跑偏。再检查提示词。角色卡是否放在开头有没有被长场景描述冲淡。有些工具提示词越长前半段权重越高。检查采样参数。分辨率过低、运动幅度过大、批量过小都会让脸部崩坏。检查是否用了不同的工具。不同模型对“大眼睛”“高马尾”的理解不同同一集尽量固定一个绘图模型。7.2 声音和情绪不匹配、口型对不上现象画面是高冷战神配音却像推销员画面是女主偷笑配音却像念课文。排查顺序先重新听一遍配音确认角色音色是否符合人设。再看台词文本是否有标点、断句、语气词。TTS 很依赖文本分层。口型不一致AI 漫剧不需要完美口型只要说话时嘴部有轻微动态即可。如果嘴部完全不动切一个近景嘴巴特写镜头来补。最后看时间轴判断配音和画面对没对上可能是素材时长不够需要拉长镜头或加转场。7.3 导出失败、画质差、时长不够现象剪辑预览正常导出一半失败或者导出后画质下降严重或者内容不足 60 秒。排查顺序先检查磁盘空间和导出路径。磁盘满、中文路径、权限不足都会导致导出失败。检查工程分辨率。预览用 720p导出却选 4K可能造成卡死或内存不足。时长不够通常不是技术问题是分镜数不够。60 秒大约需要 12 到 16 个镜头每个镜头 4 到 5 秒。如果镜头太少就补过渡镜头不要硬拉长单个镜头。画质差先确认原始素材分辨率再看导出码率。很多平台会压缩二次编码原始素材 1080p导出码率 8Mbps 以上压缩后才会比较清楚。7.4 排错顺序总结AI 漫剧的报错很多看起来像工具问题实际是前置条件问题。我的习惯排错顺序是先看输入材料再看提示词和参考图接着看参数设置然后看工具版本最后才怀疑模型能力。大多数翻车都发生在输入侧。分镜表写得模糊、角色卡不统一、参考图质量差再好的工具也会输出不稳定结果。踩过几次之后会发现AI 漫剧真正考察的不是哪个模型更强而是你有没有把内容流程管清楚。先跑通一条 60 秒单集再优化画质和批量是目前最稳的上手路径。