尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

MiniMax H3提示词实战指南:从案例拆解到Skill模板

MiniMax H3提示词实战指南:从案例拆解到Skill模板 分享一套 MiniMax H3 提示词的完整实战思路。最近社区里关于 H3 的讨论越来越多从本地部署、ComfyUI 整合包到 REF2VA 参考模式、导演台工作流大家都发现同一个问题模型能力很强但提示词写不好出片质量天差地别。这篇文章我会拆解 7 类高热度社区案例整理出可以复用、落地的提示词方法论并解释 Skill 模板的组织方式适合正在做 AI 视频创作、漫剧分镜、角色一致性项目的开发者参考。1. MiniMax H3 提示词为什么值得专门研究1.1 H3 在视频生成里的定位MiniMax H3 是 MiniMax 在视频生成方向上受到社区关注的模型系列。社区习惯用“H3”代指这套模型多数讨论集中在本地部署、ComfyUI 工作流、角色一致性、镜头语言控制这些方向。它并不是一个只能“输入一句话出视频”的玩具模型而是更接近“可以通过结构化描述精确控制画面内容”的生成工具。从大量社区案例来看H3 对以下信息特别敏感主体身份与外观描述动作起止关系镜头运动轨迹光影和情绪氛围画面节奏与时间变化这意味着提示词不再只是一句“一只猫在窗台上”而是一套“导演指令 美术描述 动态控制”的组合。谁能把画面要素拆解清楚谁就能更好地发挥模型能力。1.2 提示词在出片质量中的占比很多新手拿到 H3 后第一反应是换模型、调 seed、加采样步数但实际影响最大的往往是输入侧的描述质量。社区里同样的底模、同样的工作流只改提示词出片效果可以从“AI 味严重”变成“电影感十足”。这不是玄学。视频生成模型的输入空间很大如果提示词没有把主体、动作、镜头、光影、节奏说清楚模型就会在多个合理答案之间“猜”结果就是主体漂移、动作变形、镜头乱跳。提示词的本质是把模型的猜测空间压缩到我们想要的范围内。所以研究 H3 提示词不是背模板而是学会一套描述画面的语言。2. 写 H3 提示词前的三个基础准备2.1 先写“一句话故事”再做结构化扩展直接上手写长提示词容易漏信息。比较稳妥的做法是先用一句话说清楚画面里发生了什么一位剑客在废弃城市广场上与机械守卫对峙腾空反击剑气震碎地面。然后把这句话拆成六个维度维度要回答的问题示例主体谁在画面里黑风衣剑客、机械守卫动作发生了什么腾空、挥剑、剑气扩散环境在什么地方废弃城市广场、局部燃烧光影光线怎么打黄昏逆光、金色边缘光镜头摄影机怎么动低角度仰拍、推进节奏快慢怎么变化蓄力 0.5 秒后爆发落地定格这个表格就是我日常写提示词的第一张草稿。先填表再扩写成一段完整描述出片稳定性会明显提升。2.2 中文提示词和英文提示词选择H3 社区里中文提示词和英文提示词都有人在用。从实际效果看中文直接描述动作和氛围往往更自然因为模型训练语料覆盖了大量中文影视解说、短视频脚本和漫画分镜内容英文提示词在写“电影感”“浅景深”“胶片颗粒”这类术语时更成熟。推荐做法主体描述、动作描述用中文画质和镜头术语可以中英混用但不要一句话里来回切换语种。例如一名身披黑色风衣的剑客左手持剑右手凝聚蓝色火焰低角度广角cinematic lighting, 8k detail这种混用方式在社区里很常见既能保证内容具体又能触发模型对电影级画质词汇的响应。2.3 负面提示词要写“具体错误”而不是写“不要崩”很多新手在负面提示词里写“bad quality, ugly, deformed”这种写法效果有限。模型并不知道“ugly”具体指什么。更有效的做法是把我们看到的典型生成错误写进负面提示词手指变形、多余手指、面部扭曲、五官错位、文字水印、多余肢体、场景穿帮、画面抖动、过渡磨皮、塑料皮肤写负面提示词的原则是“描述错误本身而不是描述正确状态的反面”。例如“手指变形”比“不要坏手”更直接。3. 七个社区优秀提示词案例拆解3.1 案例一AI 超燃战斗打斗场景战斗场景是 H3 社区里热度最高的方向之一。难点在于快节奏动作很容易让模型生成肢体错乱所以我们必须在提示词里给出明确的“动作阶段”。参考模板镜头低角度广角从地面仰拍人物腾空而起 主体一名身披黑色风衣的剑客左手持剑右手凝聚蓝色火焰 动作以剑为轴快速旋转三周落地瞬间剑气呈环形扩散震碎周围石板 环境废旧城市广场背景建筑局部燃烧尘土飞扬 光影黄昏逆光人物轮廓带金色边缘光蓝色火焰照亮面部 氛围紧张、激烈、压迫感强 节奏起势时缓慢蓄力腾空旋转加速落地瞬间爆发随后短暂定格 画质电影感8k细节浅景深运动模糊适度 负面手指变形、面部扭曲、多余肢体、场景穿帮这里最关键的是“节奏”字段。它把动作拆成了“蓄力—加速—爆发—定格”四个阶段模型生成时就有了时间轴意识不会所有动作都挤在一起。如果生成结果仍然崩坏优先减少主体数量。战斗场景里主体越少模型越能分配计算资源给动作细节。没有把握的多人战斗场景可以用“一打多但镜头聚焦前景主体”的描述方式。3.2 案例二压抑情绪人像与慢动作这类题材适合氛围感短剧和情绪 MV。社区里有句经验总结得很好“情绪靠肌肉手部靠结构接触靠阴影真实靠受力。”这句话的意思是表现人物情绪不能只写“他很悲伤”要写肌肉状态、手部动作、光影切割和力的传递。参考模板镜头固定机位50mm浅景深缓慢推进 主体一名年轻女性独坐窗边窗外阴天细雨 动作她低头手指无意识按住杯中水面水波缓缓荡开 情绪压抑、疲惫、克制眼眶微红但不流泪 节奏慢动作整体帧率感放慢只有水波有细微加速 光影室内低照度冷色调窗外灰蓝色自然光脸部半明半暗 画质胶片颗粒轻微肤色真实头发碎发位置自然手部结构准确 负面过度磨皮、塑料感皮肤、五官变形、动作刻意煽情注意这里“眼眶微红但不流泪”是一个精确的表情控制比“悲伤”更容易让模型产生正确表现。同时慢动作不是靠关键词“slow motion”硬撑而是把节奏信息写进提示词让模型在生成阶段就规划好运动曲线。如果希望复用这类模板建议把“情绪—肌肉—手部—光影”作为四个固定槽位不管什么角色都按这个结构去填。3.3 案例三REF2VA 全能参考模式保持角色一致性H3 社区里很多人讨论 REF2VA也就是“全能参考模式”。它的核心价值是通过参考图约束角色的脸型、发型、服装颜色让不同场景里同一个角色保持一致。这是漫剧、连续短视频最需要的能力。REF2VA 提示词的关键不是描述角色长什么样而是描述“参考图里哪些属性必须保留哪些属性允许变化”参考图模式启用 REF2VA使用 actor_001.png 作为角色参考 必须保留脸型、发型、瞳色、服装颜色、体型比例 允许变化表情、手势、视线方向、部分服装破损细节 场景替换参考图中的空背景替换为废弃车站 镜头从全景缓慢推到中景跟随角色移动 光线保持参考图主光方向但增加站台顶灯冷光这种写法的好处是模型明确了哪些是锚点、哪些是自由项不会因为场景变化导致角色彻底换脸。如果发现角色还是不稳定可以检查参考图本身正面清晰、光线均匀、五官无遮挡的参考图通常效果最好侧面或大幅遮挡的参考图会明显降低一致率。3.4 案例四AI 三视图与人物设定三视图提示词常用于角色设计、游戏原画、服装概念图。H3 生成三视图时容易出“三格人物长得不像同一个人”的问题所以提示词里要强调“跨视角一致”。参考模板主体一名东方男性冒险家 视角正面视图、侧面视图、背面视图三格并列尺寸一致 服装深棕色皮质风衣银色金属护肩腰间三枚道具袋 发型黑色短发刘海向左偏发梢轻微翘起 配饰左耳单枚铜色耳环右手腕机械装置表面带蓝色光纹 要求三格人物比例一致服装纹样在各视角能对应拼接光线一致 光影棚拍均匀光无强烈阴影背景浅灰色 负面五官比例不一致、服装纹理对不上、透视错乱生成后如果三个视角差异较大可以把“三格并列”改成“分别生成三个单格提示词再拼接”虽然步骤变多但每个视角的稳定度会提升。三视图本质上是在考验模型对“同一角色的多视角理解”提示词里必须给出足够多的服装锚点。3.5 案例五漫剧分镜与连续叙事漫剧是 H3 的高频用途。漫剧提示词不是单张提示词而是一组分镜提示词体系。写的时候至少要考虑角色设定、场景库、分镜列表、每镜的画面描述。参考结构整体设定现代都市奇幻漫剧第三话时长 7 分 30 秒约 18 个分镜 主要角色 - 林宇男25 岁黑发深蓝色外套银色项链 - 苏晓女23 岁白裙红色发圈 分镜 01 全景 城市夜景林宇站在天台边缘风吹起外套衣角 02 中景 苏晓从背后跑来神色焦急 03 近景 林宇回头眼神复杂气泡框我说过别跟来 04 特写 苏晓攥紧拳头指节发白 ... 关键要求所有分镜中林宇与苏晓的外貌必须一致场景连续构图有漫画感对白使用气泡框漫剧的核心难点是“跨分镜一致性”不是单个分镜的质量。所以分镜提示词里每个镜头都要写明角色姓名、位置关系、时间连续性。用“林宇站在天台边缘”而不是“一个人站在边缘”模型才不会把角色换掉。实践上建议先做角色设定卡片再写分镜不要直接在分镜里补人物外貌。人物外貌只写在设定卡里分镜里引用角色名即可。3.6 案例六导演台与镜头语言控制“导演台”是社区对 H3 工作流中镜头控制模块的称呼常见于 ComfyUI 自定义工作流。导演台的价值是让用户以参数方式控制镜头运动而不是把镜头描述塞进自然语言提示词里。常见的导演台参数思路起始帧固定机位全景 中段镜头向左平移速度约每秒 8 度跟随主体移动 落幅缓慢推进至人物面部特写 节奏曲线缓入缓出避免镜头急停把这些参数和提示词结合起来出片会有更明确的“导演意识”。如果工作流不支持导演台也可以在提示词里用文字描述镜头变化例如“镜头从全景向左平移最后推进到面部特写”。需要说明的是不同版本的 ComfyUI 整合包对导演台的支持程度不同。建议在实际项目里先跑一个简短的镜头测试确认镜头控制生效后再批量出片。3.7 案例七真实感与“去 AI 化”很多创作者追求“AI 味少一点”的效果。社区里流传的经验是“去 AI 化”不是靠提示词硬贴“真实”标签而是要靠物理细节和材质描述。参考模板主体一名中年渔夫站在木船头手撑竹篙 皮肤脸部有日晒形成的粗糙纹理眼角和嘴角有明显皱纹毛孔可见 手部指节粗大指甲缝有细微泥渍握篙位置掌心发红 服装深灰色麻布上衣袖口磨损衣领被汗浸湿后颜色略深 光线傍晚河面反光脸部受光面暖背光面冷 镜头中景偏近轻微手持呼吸感站位略微不平稳 负面皮肤过度光滑、五官对称得异常、衣服过于崭新、光线过于均匀“真实”的关键在于不对称和不完美皱纹、磨损、汗渍、轻微手持感这些信息会让模型生成更接近实拍的结果。相反如果提示词写“完美皮肤”“精致妆容”出图就会很“AI”。4. H3 提示词方法论总结4.1 提示词的“五层结构”综合社区优秀案例我总结了一个可复用的五层提示词结构第一层镜头与画幅 - 描述景别、角度、镜头运动方式 第二层主体与动作 - 主体身份、外观特征、动作起点和终点 第三层环境与光照 - 场景空间、时间、天气、主光方向 第四层表演与情绪 - 情绪状态、肌肉表现、手部细节 第五层画质与节奏 - 画质风格、运动节奏、动态变化每次写提示词时按这五层填充内容就不会出现“画面太空”或“关键信息缺失”的问题。4.2 动态节奏控制让画面“活”起来静态描述容易让模型生成“画面感强但缺少运动”的结果。社区里表现力强的提示词几乎都有动态节奏设定节奏先缓慢后加速最后定格这句话在视频生成中非常重要。它相当于给模型一个时间轴上的参考让模型知道动作不是匀速的而是有张弛的。战斗中适合“快起—爆发—定格”情绪戏适合“缓慢—更慢—细微加速”场景演示适合“匀速连贯”。4.3 物理真实感公式受力、接触、阴影社区里一个被反复验证的公式是“真实靠受力”。意思是只要画面里出现了力与反作用力AI 味就会下降人坐在椅子上椅面织物要出现轻微凹陷手按在桌面上指尖要有一点泛白风吹动衣服衣服的摆动方向要与风的方向一致脚踩在湿润地面要有细微的压力痕迹这些细节单独看很小但叠加起来会大幅提升画面的真实度和可信度。4.4 提示词与工作流配合提示词不是孤立地起作用。H3 的完整出片流程通常包括文本提示词、参考图、二采、放大和后期处理。社区里提到的“二采”通常指第二次采样或二次渲染目的是在初稿基础上补充细节、稳定结构。尤其是角色一致性要求高的场景二采比“一次成片”更可靠。工作流方面ComfyUI 整合包是社区常用的工具H3 相关的节点生态还在快速更新建议保持工作流版本与模型版本匹配。如果提示词没问题但出片一般不要盲目改提示词先检查参考图质量、采样器参数和分辨率是否合理。5. 官方 Skill 模板把提示词交给 Agent5.1 什么是 Skill 模板“Skill 模板”是提示词工程中一种更上层的组织方式。它不是单条提示词而是把“角色设定、任务拆解、输入输出格式、示例”打包成一个可复用的模板文件。在 H3 场景里Skill 模板通常用来解决“如何把一句话故事自动扩展成结构化视频提示词”的问题。你可以把模板交给 AI 助手或工作流中的 LLM 节点让它自动完成分镜扩展。5.2 Skill 模板的核心组成一个适用于 H3 视频生成的 Skill 模板通常包含以下部分name: h3-video-prompt-generator description: 将一句话故事扩展为 H3 视频生成提示词 fields: story: description: 用户输入的故事或创意 duration: description: 期望视频长度 style: description: 视觉风格如电影感、漫剧、写实 output_template: | 镜头... 主体... 动作... 环境... 光影... 氛围... 节奏... 画质... 负面...实际使用中模板还会加入“角色一致性保持建议”“镜头运动参数”等字段。官方 Skill 模板的原始格式会随版本更新但“结构化输入 结构化输出 示例”的框架是通用的。5.3 如何设计自己的 Skill 模板建议从一张完整的提示词开始反向提炼模板。例如前面案例里战斗场景的提示词可以提炼成这样的模板对于一个战斗场景输出包含 1. 镜头景别、角度、运动方式 2. 主体角色身份、外观、武器或道具 3. 动作动作起点、过程、结束 4. 环境空间、天气、破坏程度 5. 光影主光、轮廓光、色调 6. 氛围情绪关键词 7. 节奏张弛变化 8. 画质风格与细节要求 9. 负面常见错误拒绝项有了模板后每次只需填入不同的故事就可以快速生成结构一致的提示词。这对于批量制作短视频、漫剧分镜、角色服装参考图特别实用。6. 高频问题与排查思路问题现象常见原因解决思路生成的人脸每次都不一样参考图不够清晰或被遮挡使用正面、光线均匀、五官无遮挡的参考图多人场景动作崩坏主体过多模型无法同时精确控制减少同时出现的主体或用“前景主体 背景群体”描述慢动作不自然缺少节奏字段模型默认匀速在提示词中写明“缓慢—细微加速—定格”的曲线提示词写了但没生效关键词权重不足或被长描述稀释把关键信息靠前写避免 300 字以上超长提示词本地部署显存不足模型体量较大图片分辨率偏高降低输出分辨率先跑短片段再逐段生成中英文混用导致语义漂移句型切换过多保持主体描述同一种语言术语单独混用二采后细节反而变糊采样参数或重绘幅度不合适降低二采强度只针对局部区域重绘这些问题是社区里最常见的遇到时不要急着换模型先按表格顺序排查输入侧、参考图、工作流参数和模型版本。7. 工程实践与生产环境建议7.1 建立个人提示词库并版本化高频创作的团队建议把提示词当代码管理。每个提示词文件包含版本号、适用场景、模型版本、参数组合、效果示例图。这样下次需要同类效果时可以直接回到某个稳定版本而不是重新调参。prompts/ combat/ v1-wind-sword.md v2-blood-knight.md emotion/ v1-rainy-window.md character/ ref2va-actor-001.md每次修改提示词就复制新版本不覆盖原文件。这个习惯能省下大量重复调试时间。7.2 合规与版权注意事项使用 H3 生成视频时要注意素材合规。具体来说不要使用未经授权的明星、动漫角色、品牌形象作为参考图生成内容不要涉及违法、暴力、歧视或他人隐私自己的原创角色建议保存角色设定文档明确创作归属批量作品发布前检查内容是否包含水印、敏感文字或不适宜画面这也是生产环境的基本要求。创作自由建立在合规边界之上。7.3 从“抄模板”到“写模板”最后一条建议不要长期停留在“复制别人的提示词”阶段。别人的提示词是针对别人的工作流、参考图和模型版本调优过的直接搬到自己的环境可能出现偏差。正确的方式是用优秀案例作为起点在自己的工作流里跑通基础版修改关键描述测试不同写法的差异把有效写法沉淀进自己的 Skill 模板当你开始自己写模板时才算真正理解 H3 提示词。这也是从“AI 生成用户”变成“AI 导演”的分水岭。可以准备一个专门的文档把每次测试的“提示词 出片结果 修改原因”记录下来几周后你就能得到一份完全属于自己的创作资产。
返回列表