尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI短剧制作全流程拆解:提示词设计到自动化脚本

AI短剧制作全流程拆解:提示词设计到自动化脚本 简介面向AI内容创作者和对AIGC工具链感兴趣的开发者这份源码包提供了一套基于AiPy的短剧自动化创作流程参考。资源共3个文件以HTML运行页面为主辅以inscode环境配置与gitignore规则说明整体仅7KB轻量清晰便于直接查看核心逻辑。已有1084人学习/下载。教程覆盖从提示词剧本生成、旁白与分镜头视频制作到音视频合成出片的完整链路并针对人物和场景一致性给出具体操作建议。通过这份源码用户不仅能掌握用AI工具生成短剧的具体步骤和提示词写法还能理解短剧创作中剧本结构、镜头设计、视频编辑与音频合成的基本思想为后续自主开发或改造AI创作工具提供基础。 这段时间AI短剧的讨论度确实高我身边几个做短视频的朋友都来问同一个问题AI短剧到底是不是玄学有人一个月产几十条数据还不错自己上手却发现问题一堆画面不可控、人物长相前后不一致、剧情前言不搭后语最后只能放弃。我自己在这条赛道上跑了两个月踩了不少坑也沉淀出一套从选题、剧本、分镜到成片的完整工作流并且把重复性的环节脚本化了。这篇就把这套流程完整拆开提示词怎么设计、分镜表怎么拆、配音和剪辑的节奏怎么把控、哪些环节适合用代码批量处理以及一个能直接改改就用的源码骨架。适合准备入局AI短剧的内容编导、短视频运营以及第一次想用AI做创作工具的程序员。1. AI短剧的本质它不只是“输入提示词生成视频”1.1 为什么“纯AI生成”是个伪命题很多人一听说AI短剧第一反应是“让AI直接生成一整集”。这个想法不太现实。以目前文生视频模型的能力生成一段连续、有台词、有情节推进的十分钟成片成本高、可控性差。更通用的做法是把传统短剧的生产流程拆开用AI替换其中几个环节剧本让大语言模型起草画面用文生图/图生视频生成配音用语音合成剪辑仍然在剪映或专业剪辑软件里完成。我实测下来真正能稳定产出短剧的团队几乎都是“AI负责生产素材人负责决定素材”。这不是工具不够强的问题而是短剧本质上是一种叙事体裁它需要连贯的情感逻辑和节奏控制这个层面的工作目前仍然要人来把关。1.2 一条AI短剧从0到成片的完整路径传统短剧剧组有编剧、导演、摄影、美术、演员、后期等岗位AI短剧把这些岗位全部“虚拟化”但对应的环节一个都不少传统环节AI短剧的替代方式产出物选题策划人工定方向模型辅助拓展梗概选题表剧本撰写大语言模型生成台词和剧情剧本文本分镜脚本大模型按剧本文本拆成镜头表分镜表画面拍摄文生图模型生成画面图生视频模型动起来镜头素材演员表演AI虚拟角色/数字人形象角色一致化参考图配音语音合成可选情感音色配音文件字幕/剪辑剪辑软件半自动处理成片这条链路里最容易被卡住的是分镜拆解和角色一致性后面我会专门展开讲。先把整体流程看明白后面每一节就好理解了。2. 一套能直接上手的AI短剧创作工作流2.1 选题与剧本模型需要你喂给它“套路”大语言模型写剧本的能力已经很强了但它并不知道“短剧”和“小说”的区别。短剧的核心是“三秒钩子连续反转强情绪”这些网感是模型不具备的所以第一步是人工定框架模型负责填肉。我的通常做法是给模型两个输入一个是短剧类型逆袭、悬疑、都市情感、重生等另一个是对标爆款的开头结构。比如“三秒内必须出现冲突”我一般用类似这样的提示词你是一位有五年短剧经验的编剧。请根据以下故事梗概写出第一集的完整剧本。 要求 1. 开场3秒内必须有一个冲突或悬念 2. 每300字左右设置一次反转 3. 台词要短适合竖屏短视频 4. 结尾停在悬念处引导用户点开下一集 故事梗概……这里填你的选题这里有个容易被忽略的点剧本输出格式要提前定义好。我一般要求模型输出“角色场景动作台词”的结构化文本方便下一步拆分成镜头表。如果直接输出纯叙事文本后面拆镜头会非常痛苦。2.2 分镜与画面把文字变成镜头语言的关键一步剧本拿到手之后最核心的一步是拆解分镜。分镜表需要包含这些字段镜头序号、景别近景/中景/远景、画面描述、人物台词、字幕内容、音效建议。AI短剧对画面描述的要求比传统分镜更高因为文生图模型不理解“女主生气地走进办公室”这种概括性描述它需要更精准的视觉元素。画面提示词我总结了一个公式主体动作构图光影风格。举一个例子不要写女主走进电梯 而要写一位穿深色风衣的年轻女性独自走进电梯按亮顶层按钮 镜头从电梯门内侧拍低角度冷色调紧张的氛围电影感光影拆好分镜之后再把每行“画面描述”喂给文生图模型。这里建议先用图生图而不是直接文生图因为第一次生成的构图往往不理想用参考图微调能省很多时间。图生成好之后再用图生视频模型让静态图动起来时长一般控制在3到6秒太长了画质会下降太短了剪辑没空隙。2.3 配音与剪辑节奏感决定了观众能不能看完画面有了之后声音和剪辑是决定观众耐心的重要因素。很多新手只重视画面忽略配音和音效导致成品像“PPT配朗读”。配音我一般先在语音合成工具里选好角色音色再按分镜表的台词逐条生成。需要注意语速短剧的对白节奏明显快于日常说话建议把语速调到1.1倍左右情绪激动处再单独调整。背景音乐可以配合剧情氛围选但人声轨和背景音轨要分开方便混音时控制比例。剪辑方面我常用的节奏参考是每个镜头3到6秒对话密集处可以切得更碎字幕一定要大、要清晰竖屏视频用户多数时候在通勤或碎片场景观看声音不一定开字幕就是第二语言。这些细节做到位了完播率会有明显变化。3. 从“教程”到“源码”我用的自动化脚本骨架3.1 最小可用脚本用API把“剧本-分镜-待办”串起来标题里的“源码”并不只是指某个完整的开源项目更是指一个可以复用的工作流脚本。我写了一个最小可用的Python脚本作用是读取一集剧本文本调用大模型API生成结构化的分镜表输出为CSV文件。这个CSV可以直接作为后续文生图、配音步骤的输入清单。import csv import os import json import requests TEXT_PATH episode_01.txt OUTPUT_CSV storyboard_episode_01.csv def read_script(path): with open(path, r, encodingutf-8) as f: return f.read() def build_prompt(script): return f 你是短剧导演请把下面的剧情拆成适合AI短剧制作的镜头表。 要求 1. 每个镜头包含序号、景别、画面描述、人物台词、字幕、音效建议 2. 画面描述请同时输出用于文生图模型的英文提示词 3. 一集8-12个镜头 4. 直接输出JSON数组不要输出其他内容 剧情如下 {script} def gen_storyboard(script, api_key, base_url, model): resp requests.post( f{base_url}/chat/completions, headers{Authorization: fBearer {api_key}}, json{ model: model, messages: [{role: user, content: build_prompt(script)}], temperature: 0.6 }, timeout120 ) resp.raise_for_status() content resp.json()[choices][0][message][content] start content.find([) end content.rfind(]) 1 return json.loads(content[start:end]) def write_csv(items): with open(OUTPUT_CSV, w, newline, encodingutf-8-sig) as f: writer csv.DictWriter(f, fieldnames[no, shot, visual, prompt, dialogue, subtitle, audio]) writer.writeheader() writer.writerows(items) if __name__ __main__: api_key os.getenv(LLM_API_KEY) base_url os.getenv(LLM_BASE_URL, https://api.example.com/v1) model os.getenv(LLM_MODEL, your-model) script read_script(TEXT_PATH) items gen_storyboard(script, api_key, base_url, model) write_csv(items) print(fsaved {len(items)} shots to {OUTPUT_CSV})使用方法和注意事项如下把episode_01.txt里的内容换成你的剧本文本。设置环境变量LLM_API_KEY指向一个提供OpenAI兼容接口的大模型服务。LLM_MODEL换成你实际使用的模型名。运行后生成storyboard_episode_01.csv用Excel打开即可看到分镜表。为什么输出CSV而不是直接生成所有图片因为CSV是中间格式方便人工校对和修改。依赖大模型一次性输出完美结果很容易翻车中间的检查步骤能帮你拦截大量废稿。3.2 为什么脚本要预留“人工确认节点”我最早写这个脚本的时候想的是“一条命令从文本到图片全部搞定”。后来发现不现实模型偶尔会漏解析、把镜头数量搞错、甚至输出非法JSON。如果把这条链路做成全自动任何一个环节出问题后续所有结果都白费。所以脚本里我特意做了两个设计一是只请求大模型输出JSON数组不掺额外文字方便解析二是即使解析失败也不会中断整个流程而是打印出原始返回内容方便排查。代码里就是靠find和rfind定位第一个方括号和最后一个方括号这个朴素的写法在大多数情况下比正则更不容易出错。另外提醒一句API密钥不要写死在代码里更不要提交到公开仓库。我见过不少人把密钥贴在Gitee或GitHub上然后被扫描抓走的。用环境变量或本地配置文件都行自己用怎么方便怎么来。3.3 从脚本骨架继续扩展的方向如果分镜表能稳定生成接下来可以继续扩展接入文生图API逐行读取CSV里的prompt字段批量生成镜头图片保存到本地目录。接入语音合成API读取dialogue字段自动生成配音文件按镜头号命名。接入字幕生成工具把subtitle字段批量转成SRT字幕文件导入剪辑软件直接使用。扩展的关键是保持模块化每个环节独立输入、独立输出不要耦合在一起。这样某个环节升级工具时不会牵连其他流程。4. 实测踩坑连贯性、废稿率和成本控制4.1 长剧本拆解时模型“忘记”前情怎么办短剧一集通常几百字到上千字模型在生成完整剧本时还能Hold住但如果你让它直接识别剧本文本里的角色关系和伏笔来拆镜头它的上下文窗口长了之后容易混乱例如把A角色的台词安到B角色身上。我的处理方案是先让模型做一次“剧情摘要”把每段对话的角色、说话对象、情绪明确标记出来再按摘要去生成分镜表。这样等于人为把任务切成两步模型的任务更聚焦出错率明显下降。如果你的剧本更长可以按场景切分为若干段逐段处理。4.2 角色一致性同一个角色换了三次脸AI短剧最大的痛点之一就是角色不一致。同一集里同一个角色在不同镜头中可能长相完全不一样观众很容易出戏。这个问题我试过几种方案简单排序如下固定角色描述词在画面提示词里始终携带同一段特征描述发色、脸型、服装颜色在人物特写镜头中很有效但不适合复杂机位。参考图生图先选定一张角色正面照作为参考图后续所有镜头都基于这张图生成一致性大幅提升。使用支持角色一致性的模型或外挂调用OpenAI兼容接口后再用图生图/视频模型里的人物一致性功能甚至可以用专门的数字人模型。这类方案最省心但成本也高。我的个人建议至少让每个角色的服装固定下来。观众对“衣服颜色”的记忆比对脸的记忆更持久衣服统一了角色辨识度就能守住大半。4.3 版权边界别把风险带进内容做AI短剧必须注意素材版权问题。不要用真人演员的照片生成虚拟形象很容易涉及肖像权不要直接使用影视剧截图作为参考图二次生成也有侵权风险。建议使用可商用的素材库里的图片作为参考底图或者干脆自建虚拟角色形象。另外各平台对AI合成内容有相应的标识要求发布时主动打上AI生成标识既符合规范也能避免后续账号被限制。还要注意不要批量搬运他人原创脚本做“洗稿式”改编短剧行业现在对原创性越来越看重被投诉后轻则下架重则封号。5. 从单条爆款到可持续更新工程化思路5.1 素材库与提示词沉淀做AI短剧和做传统内容一样最怕每次从零开始。我有一条经验每完成一个项目就把可复用的提示词、参考图、BGM列表、爆款开头结构整理进素材库。比如上面分镜脚本里用到的画面提示词公式凡是生成效果好的我都会记录下来。后续新项目如果场景相似直接改主体描述就能复用不用重新试错。这样一来做第二条、第三条的成本会明显低于第一条。5.2 批量产出的“人机分工”当一条链路跑通后批量产出就有章可循了。我的团队配置是一个人负责选题和审核成片AI负责写初稿、拆镜头、生成画面、配音剪辑由人工完成。一周产出一条稳定质量的短剧和一周产出七条但每条都很粗糙后者往往更不利。人机分工上我的原则是凡是“生成后可验证”的环节交给AI凡是“需要审美判断”的环节交给人工。比如剧本初稿、画面初稿、语音生成都可以自动化但哪个镜头该保留、哪个镜头需要重出、剪辑节奏对不对这些必须人工过一遍。5.3 数据反馈怎么回灌给创作最后想聊一个容易被忽略的点数据反馈。短剧发布后完播率、点赞率、第几秒跳出最多这些数据非常珍贵。我一般会把后台数据拉到脚本里和分镜表做对照看看每一集的钩子放在第几个镜头哪段转折观众流失最多。把这些规律总结出来再回到提示词层面做调整比如把反转前移、压缩铺垫性台词才是可持续优化的路径。我最近的习惯是每周把上一周的废稿和跑通的提示词一起归档隔段时间复盘总能发现新的可复用套路。做AI短剧真正值钱的不是某一条视频而是你手里这套越用越顺的流程和方法。本文还有配套的精品资源点击获取
返回列表