尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI漫剧制作全流程拆解:从分镜脚本到角色一致性再到成片

AI漫剧制作全流程拆解:从分镜脚本到角色一致性再到成片 最近 AI 漫剧AI 动态漫画在短视频平台上的热度一直很高。这类视频制作周期短、画面风格统一、叙事节奏快适合做成连载内容也适合接定制商单。我也经常在后台收到私信问得最多的是这几个问题“AI 漫剧到底是怎么做的”“用的什么工具”“角色脸怎么保持一致”“流程能不能完整讲一遍”。这篇文章不聊虚的直接围绕 AI 漫剧制作的核心链路来拆分镜脚本、人物设计、生成视频、剪辑配音每一步都会给出提示词模板、工具选择思路和实操细节。即使你没有任何绘画基础和视频基础按这套流程走完也能独立产出一条可以发布的 AI 漫剧视频。1. AI 漫剧是什么和 AI 短剧有什么区别在开始实操之前先把这个概念理清楚。很多人会把 AI 漫剧和 AI 短剧混在一起但这两者从画风、制作逻辑到工具侧重点都不一样。AI 漫剧本质上是“漫画视频化”。它所有画面都是静态图片或者轻微动态化的图像通过镜头推拉、人物微动、粒子特效、配音和字幕来表现出剧情节奏。很多经典网文漫画、动态漫画都属于这个范畴。AI 漫剧的核心是图片质量也就是单帧画面的精度、角色一致性、场景氛围感。AI 短剧则更接近真人短剧的视频化替代方案画面是连续的视频流人物有完整的转身、走位、对话动作。它依赖视频生成模型的连续性对运动一致性要求很高。这个区别决定了制作流程形态核心素材主要痛点覆盖工具AI 漫剧高质量图像 局部动态角色一致性、分镜叙事AI 绘画 AI 视频AI 短剧连续视频片段人物连续运动、场景稳定AI 视频生成为主一句话总结AI 漫剧更吃“美术控制力”AI 短剧更吃“视频模型能力”。本文接下来的整套流程都是围绕第一条路线展开。目标很明确用 AI 生成一套视觉统一的漫画画面再通过工具让画面“动起来”最后剪辑配音成片。2. 制作 AI 漫剧需要准备什么2.1 硬件要求AI 漫剧制作对硬件要求没有想象中高。如果你的电脑配置是 16GB 内存、独立显卡 4GB 显存以上本地运行 Stable Diffusion 是可以的只是出图速度偏慢。如果没有独立显卡也没有关系当前主流的 AI 绘画工具和视频生成工具都提供了云端服务浏览器打开就能用对电脑配置几乎无要求。我个人的建议是新手阶段优先使用云端工具先把流程跑通再决定要不要本地部署。2.2 工具清单根据当前工具生态一条完整可落地的 AI 漫剧生产线大致依赖这些能力剧本与分镜脚本生成大语言模型ChatGPT、Claude、文心一言、通义千问等人物设计与一致性参考图Midjourney、Stable Diffusion WebUI、即梦 AI、LiblibAI图片转动态视频可灵 AI、即梦 AI、Runway、Pika、海螺 AI剪辑与配音剪映、必剪、魔音工坊这里需要说明一点AI 工具迭代速度非常快上面这类名单可能每个月都会变化。本文重点不是推荐哪一个具体产品而是带你理解这条链路里每个节点需要解决什么问题以及如何判断一个工具是否适合你。3. 全流程总览从创作角度拆解 AI 漫剧生产线AI 漫剧看起来是个视频作品但它的生产本质是“批量造图 批量配音 剪辑拼接”。我们把它拆成五个环节每个环节对应明确的交付物环节一剧本与分镜脚本输出一份分镜表格包含镜头编号、景别、画面描述、台词、情绪、大概时长。环节二人物设计输出角色正面、侧面、表情等参考图保证后续每张图都长同一个角色。环节三单张画面生成按分镜表逐镜头生成漫画风格图像。环节四图像转动态视频用图生视频工具让单帧画面产生运镜和动态效果。环节五剪辑、配音、字幕合成最终导出 MP4 成片。五个环节里真正消耗时间和注意力的其实是第一、二、三环节。只要分镜足够清楚、角色足够固定后面的视频生成和剪辑环节基本都是流水线操作。4. 第一步分镜脚本的 AI 生成方法分镜脚本是整个 AI 漫剧的“施工图纸”。很多新手一上来就疯狂生图结果做了十几张画面后才发现剧情连不上根源就是没有先写分镜。4.1 分镜表包含哪些字段分镜不是写小说每个镜头都要有明确的可执行信息。我常用的分镜表字段如下镜头编号SC001、SC002景别远景、全景、中景、近景、特写画面描述这一帧画面里可以看到什么内容人物状态角色的表情、动作、位置台词当前镜头的配音文本情绪基调紧张、悲伤、轻松、悬疑预估时长3 秒、5 秒等4.2 用大模型生成分镜脚本的提示词模板下面是一条可以直接复制使用的提示词模板适用于大多数大语言模型你是一位专业的动漫分镜师和漫剧导演。请根据以下故事大纲生成一份完整的 AI 漫剧分镜脚本。 故事大纲 [在这里填写你的故事梗概] 要求 1. 输出 Markdown 表格包含镜头编号、景别、画面描述、人物状态、台词、情绪、时长。 2. 每个镜头描述必须具体到画面构图、角色动作、表情、环境元素方便后续 AI 绘画工具生成。 3. 台词要口语化符合人物性格。 4. 镜头时长控制在 3-6 秒一集控制在 60-90 秒共设计 12-15 个镜头。 5. 第 1 个镜头必须是环境或人物引入镜头第 12-15 个镜头必须包含悬念或转折。如果你有固定的故事剧本可以直接粘贴进去。如果只有故事想法也可以先让 AI 帮你扩充剧情再生成分镜。4.3 批量生成分镜的 Python 脚本当你有大量剧情分镜需求时纯复制粘贴进网页不够效率。下面提供一个 Python 脚本思路通过调用大模型 API 批量生成分镜表并保存为 CSV 文件。 文件路径generate_storyboard.py 说明调用 OpenAI 兼容接口生成分镜脚本并保存为 CSV。 注意不同平台的 API 地址、模型名、key 均不同请以你的实际服务商文档为准。 import csv import time import os try: from openai import OpenAI except ImportError: raise SystemExit(请先执行 pip install openai) # 初始化客户端如果你使用的是国内大模型平台请在这里修改 base_url 和 api_key client OpenAI( api_keyos.getenv(LLM_API_KEY, 你的API-KEY), base_urlos.getenv(LLM_BASE_URL, https://api.openai.com/v1), ) # 每个剧情的分镜需求 STORY_EPISODE 主角林小北是一个普通高中生某天放学后意外进入了一个神秘的漫画世界必须完成三关挑战才能回到现实。 第一关她在旧校舍里遇到一只会说话的黑色猫咪猫咪告诉她这个世界的规则。 第二关黑猫指引她找到一把发光的钥匙但钥匙被一个影子怪物看守。 第三关她用计谋引开影子怪物成功拿起钥匙却发现钥匙的背面刻着主角自己的名字。 PROMPT_TEMPLATE 你是专业动漫分镜师请根据以下剧情生成一集 AI 漫剧的主要镜头分镜 {story} 输出格式 镜头编号,景别,画面描述,人物状态,台词,情绪,时长(秒) 每行一个镜头不要输出额外解释。 def generate_storyboard(story: str): response client.chat.completions.create( modelos.getenv(LLM_MODEL, gpt-4o-mini), messages[ {role: system, content: 你只输出表格数据不输出任何多余文本。}, {role: user, content: PROMPT_TEMPLATE.format(storystory)}, ], temperature0.7, ) return response.choices[0].message.content def save_to_csv(raw_text: str, filename: str): lines [line.strip() for line in raw_text.splitlines() if line.strip()] with open(filename, w, newline, encodingutf-8-sig) as f: writer csv.writer(f) writer.writerow([镜头编号, 景别, 画面描述, 人物状态, 台词, 情绪, 时长(秒)]) for line in lines: # 按逗号拆分时文本内容中不要包含英文逗号否则需要更严谨解析 parts [part.strip() for part in line.split(,)] if len(parts) 7: writer.writerow(parts) if __name__ __main__: result generate_storyboard(STORY_EPISODE) save_to_csv(result, storyboard_episode01.csv) print(分镜表已生成storyboard_episode01.csv)需要注意的是上面的脚本只是一个工程化示例。不同大模型平台的接口鉴权、模型名称、响应格式都不一样你需要根据自己实际使用的平台调整。如果你不使用 Python也没关系直接让 ChatGPT 或通义千问输出 Markdown 分镜表再手动复制到 Excel 里即可。5. 第二步AI 人物设计与角色一致性5.1 为什么角色一致性是 AI 漫剧的重中之重AI 漫剧是多个镜头拼接起来的观众很容易看出“上一张图和这一张图不是一个人”。人脸不一致是 AI 漫剧最劝退的问题。所以在批量出图之前必须先把角色参考图定下来。5.2 人物一致性方案对比当前主流角色一致性方案有三条路线路线一参考图权重方法这是 Midjourney 等工具里比较常见的能力。你先生成一张满意的角色图后续生成其他图片时把这张角色图作为参考图传入模型会参考它的五官和特征。不同平台的具体参数叫法不同有些叫角色参考有些叫风格参考本质都是让 AI 在保持原角色特征的情况下生成新画面。路线二训练角色 LoRA如果你使用 Stable Diffusion WebUI 或类似的本地工具可以通过训练 LoRA 模型控制角色。这种方法效果最稳定同一个角色在任何场景、任何表情下都能保持五官一致。缺点是学习成本高需要准备角色图片的数据集并完成训练。路线三固定种子 固定提示词描述通过固定相同的随机种子和完整提示词尽量让每次生成的角色接近。这个方法简单但很不稳定一般只适合特别简单的画风。从效率和效果平衡来看推荐新手先试路线一如果你的项目是长期连载或者角色要出现在大量镜头里再考虑路线二。5.3 人物设计提示词示例假设我们要设计一个女主角“林小北”一个高中生角色使用 Midjourney 风格平台生成人物设定图提示词可以这样写anime style character design, female high school student, age 17, short black hair, yellow eyes, white shirt, dark blue school uniform, gentle expression, full body shot, front view, clean background, character reference sheet, consistent face, high detail, 2D anime style动漫风格人物设定女高中生17岁黑色短发黄色瞳孔白衬衫深蓝色校服表情温柔全身正面照纯色背景人物设定图脸部特征一致高细节2D动漫风格生成满意结果后把这张原始参考图保存到项目目录中后续每一个镜头的画面生成都要带上这张参考图。5.4 建立项目角色资产目录在工程视角里角色图就是你的生产资产。强烈建议按以下目录管理ai-manju-project/ ├── storyboard/ │ ├── storyboard_episode01.csv │ └── script_episode01.txt ├── characters/ │ ├── girl_lin_xiaobei_front.png │ ├── girl_lin_xiaobei_expression.png │ ├── cat_black_front.png │ └── shadow_monster_front.png ├── scenes/ │ ├── sc001_old_school_gate.png │ ├── sc002_corridor_inside.png │ └── sc003_shadow_room.png ├── videos/ │ ├── sc001.mp4 │ └── sc002.mp4 └── final/ └── episode01_final.mp4这个习惯非常重要。实际做连载时人物、场景、分镜、成片文件都是几十个起步没有清晰的目录很容易混乱。6. 第三步从分镜表逐镜头生成漫画画面分镜表和角色参考图准备好之后正式进入批量出图阶段。6.1 单镜头画面提示词组织逻辑每个镜头的提示词不是凭空写的而是由分镜表里的“画面描述 人物状态 环境风格 角色设定”组合而成。我推荐的提示词固定结构如下角色描述继承自人物设定图 当前动作与表情 场景与构图 景别 画风 画质关键词以分镜 SC003“影子怪物看守发光的钥匙”为例参考提示词character reference: [girl_lin_xiaobei_front.png], girl short black hair yellow eyes white shirt dark blue school uniform, standing in old school corridor, facing a dark shadow monster, monster guarding a glowing golden key on a pedestal, cinematic lighting, mysterious atmosphere, medium shot, anime style, 2d illustration, high resolution提示词里有一条核心原则角色外貌描述尽量固定不要每次改。你把人物设定那一段当成“公共模板”每次生成镜头时只修改动作、表情、场景和镜头语言。这样能最大程度减少角色漂移。6.2 批量生成画面的两种工作流如果你用的是 WebUI 类工具可以把每个镜头的提示词整理成一个 txt 文档导入到批量生成功能中。或者写一个 Python 脚本使用 API 逐条调用生成并保存到 scenes 目录。云端工具批量能力较弱一个个手动生成也可以接受但要注意每张图生成后立刻归档不要等全部生成完再整理否则很容易混素材。6.3 画面质量检查清单每张图生成后对照以下清单快速判断是否可用角色是否与参考图一致五官有没有明显变化手部、眼睛是否崩坏构图是否符合分镜要求的景别画面是否包含多余文字或水印风格是否和其他镜头统一不合格的图重画的成本远低于后期修复千万不要把所有希望寄托在后期处理上。7. 第四步用 AI 让漫画画面动起来单张静态画面不能满足漫剧需求还需要通过图生视频工具把画面转成动态片段。7.1 动态化可以做到什么程度目前图生视频工具可以对静态图片产生几秒到十几秒的微动效果常见能力包括镜头推拉画面从远到近或从近到远相机横移镜头左右移动人物微动头发飘动、衣角摆动、呼吸起伏局部动作角色抬手、转身、眨眼特效元素粒子、光效、天气对漫剧来说不需要让角色像真人视频那样连续行动因为漫剧本身是“漫画 微动感”的形式。每张图按 3 到 6 秒生成一段视频就足够了。7.2 图生视频的操作流程不同工具的操作流程大同小异核心步骤是上传你已经生成的漫画图片。输入视频动态提示词描述希望画面产生的运动方式。设置视频比例一般默认 9:16 或 3:4。生成并预览满意后导出。以“镜头缓缓推进 落叶飘动 人物头发微飘”为例视频动态提示词可以写镜头缓慢推进女孩头发微微飘动周围有落叶飘落光线柔和电影感景深变化camera slowly zoom in, girls hair slightly waving, leaves falling around, soft light, cinematic depth of field7.3 视频生成的成本控制视频生成是整条链路里最消耗算力的环节大部分工具的免费额度有限生成失败也会消耗点数。为了控制成本建议先挑一两个关键镜头做测试等确认风格和动态效果符合预期后再批量处理剩余镜头。同时生成前一定要确认画面没有明显崩坏否则视频生成会放大画幅问题。8. 第五步剪辑、配音与字幕合成所有镜头的动态视频生成完之后进入后期合成阶段。这里我以剪映为例其他剪辑软件流程类似。8.1 剪辑顺序剪辑时按分镜表的先后顺序导入视频片段然后做几件事修剪每个片段的长度对应分镜表里的“时长”字段。在片段之间添加转场漫画风格常用的是交叉溶解或轻微缩放。根据剧情加入背景音乐和音效。按台词添加字幕。8.2 AI 配音的选择配音有两种主流方式一是使用剪辑软件自带的 AI 朗读功能像剪映里的“文本朗读”就支持多种音色操作简单适合新手。二是使用专门的 AI 配音工具可以手动调整断句、重音和情绪生成后导出音频文件再拖入剪辑轨道。适合需要对台词情绪有更高要求的场景。这里有两个细节值得强调第一漫剧的配音节奏要比真人剧更“播音腔”一些因为画面本身是静态图声音需要承担更多叙事任务。第二涉及配音时不要使用真人声音进行克隆或模仿除非你获得了明确的授权。真实项目中因为声音侵权引发的纠纷并不少见这个底线不要碰。8.3 添加字幕字幕建议直接使用 AI 自动识别语音后再手动修改错别字。自动识别通常能识别普通话但专有名词、古文台词、科幻名词容易出错。字幕风格选择简洁的字体优先保证可读性而不是花哨。8.4 导出设置导出平台通常是短视频平台推荐参数如下分辨率1080x1920竖屏或 1920x1080横屏帧率30fps格式MP4编码H.264导出前多做一次整体预览重点检查音画是否同步、字幕是否遮挡人脸、转场是否突兀。9. 常见问题与排查思路AI 漫剧制作过程中几乎每个节点都有高频问题。我整理了一份排查表你按顺序对照即可。问题现象常见原因解决思路角色每张图长得都不一样没有使用角色参考图或外貌描述每次改动固定角色模板提示词使用参考图功能画面出现崩坏的手指或眼睛模型在复杂结构上能力不足重新抽卡修改提示词强调完整结构或局部修复视频生成后人物脸变形原图已包含轻微问题视频模型放大了瑕疵生成视频前严格检查原图不合格图不进入视频流程生成速度太慢本地显卡性能不足使用云端服务或调低出图分辨率镜头之间不连贯分镜表不够细场景描述不统一完善分镜表场景和角色提示词保持固定配音情绪不对工具默认朗读没有情感参数换用一种 AI 配音工具或手动调整标点和停顿视频被平台判定低质/搬运画面风格单一、重复素材多提升原创度重新剪辑节奏增加独特转场和字幕10. 最佳实践与工程化建议当你完整跑通一条流程后接下来要关注的就是效率、质量和可持续性。这里分享几条工程化建议。10.1 建立提示词资产管理库不要每次创作都从零开始写提示词。把角色描述、环境描述、画风关键词、动态描述分类整理成模板文件。下一次创作时只需要改动剧情部分。templates/ ├── character_prompts.md ├── scene_prompts.md ├── motion_prompts.md └── style_prompts.md这个资产库是你最核心的效率杠杆。10.2 保持单集制作节奏稳定一集 60 到 90 秒的漫剧镜头数一般在 12 到 15 个之间。按个人熟练度不同完整制作时间大约在 1 到 3 天。如果你是在做系列内容最好固定一个标准生产节奏比如每周更新一集避免一次性囤积太多素材导致管理混乱。10.3 注意内容原创与版权边界AI 漫剧制作中有三个版权问题需要重视不直接改编未经授权的知名小说、漫画作品。不使用真实艺人的肖像、声音进行 AI 生成。生成的画面尽量避免出现具有明确原版作品特征的标志性角色。如果做商业接单和甲方沟通需求时也要在合同里明确 AI 生成内容的授权范围。这是 AI 时代内容创作的底线常识。10.4 项目文件命名规范统一、可搜索的命名规范能让你在几十个素材中快速定位文件。推荐格式集数_镜头编号_内容类型_版本号 示例 E01_SC03_girl_face_v2.png E01_SC04_cat_run_v3.mp410.5 关注工具更新保持流程弹性AI 工具迭代速度极快今天用的工具下个月可能就有更好的替代品。不要把自己绑定在一两个工具上。判断工具的标准永远是它是否能在当前节点解决角色一致性、动态生成、配音质量等问题。11. 总结与下一步学习方向通过这篇文章你已经掌握了 AI 漫剧制作的完整链路先写分镜脚本再设计角色然后逐镜头生成漫画画面用图生视频工具做动态化最后剪辑配音合成成片。这套流程的核心不仅是某个具体工具而是一套可复用、可管理、可扩展的生产闭环。下一步我建议你开始动手做一集 30 秒以内的小样片不需要太复杂3 到 5 个镜头即可把“分镜→人物→出图→动态→剪辑”完整走一遍。只有在亲手跑通流程后你才能真正理解每个环节的瓶颈在哪里也才能在大量实践中形成自己的效率和风格。如果你后续在角色一致性、批量出图、配音节奏等环节遇到具体问题也可以带着你的分镜表和截图来交流。动手做出的第一个作品永远比收藏的教程更有价值。
返回列表