尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ComfyUI + MiniMax H3 实战教程:全模态视频生成,API 和本地两种玩法

ComfyUI + MiniMax H3 实战教程:全模态视频生成,API 和本地两种玩法 发布日期2026-08-10 | 适用版本ComfyUI 0.30.0 | 话题MiniMax H3 · ComfyUI 视频生成 · AI 视频工作流MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频生成模型开放权重能在同一上下文中同时接收文本、最多 9 张图片、3 段视频和 3 段音频作为输入输出最高 2K 分辨率、最长 15 秒的带原生立体声音频视频人声、音效和音乐在单次前向传播中一并生成无需后期叠加在 ComfyUI 中有两条接入路径——通过七牛云 MaaS 调 API无需本地 GPU或下载开放权重本地运行覆盖文生视频、图生视频、参考生视频三种工作流模式。MiniMax H3 能生成什么在视频生成模型里H3 的差异点在于真正的全模态输入——不是单纯的文生视频或图生视频而是能把图片、视频片段、音频素材混合给进去让模型理解它们之间的关系后再生成。几个关键参数输出规格最高 2K 分辨率24fps单次最长 15 秒原生音频不是后期配音是模型生成视频时直接合成立体声对白 音效 背景音乐文本编码器Qwen3VL 32B量化为 nvfp4_awq具备强大的多语言和视觉理解能力三种生成模式文生视频T2V、首尾帧生视频FLF2V、参考生视频R2V模型以 int8 量化权重pruned_int8_convrot格式开放本地部署显存要求较高如果不想买 GPU走 API 调用是更省心的选择。两条接入路径对比维度API 模式推荐本地权重模式硬件要求无计算在云端高显存 GPUQwen3VL 32B 编码器体量大上手难度低导入工作流模板即可需下载多个权重文件并手动配置节点费用结构按视频秒数计费一次下载本地电费网络依赖是下载后离线可运行适合场景快速验证、小批量生成大批量生产、需要完全控制方式一API 模式零 GPU七牛云 MaaS 接入第一步获取 API Key在七牛云 MaaS 平台sufy.com注册账户进入 AI 推理服务找到 MiniMax-H3 模型模型 IDminimax/minimax-h3在账户中生成 API Key。平台价格人民币计费计费类型单价视频输出2K¥0.80 / 秒视频输入2K 输出¥0.80 / 秒视频输出768P¥0.50 / 秒视频输入768P 输出¥0.50 / 秒图片输入¥0.20 / 张以一条 10 秒 768P 视频为例视频输出费用约 ¥5。第二步在 ComfyUI 中导入工作流模板打开 ComfyUI确保版本 ≥ 0.30.0在模板库搜索以下关键词导入对应 JSON生成模式模板搜索词文生视频MiniMax H3 T2V首尾帧生视频MiniMax H3 FLF2V参考生视频MiniMax H3 R2V也可直接从 Comfy-Org 的 GitHub 仓库下载对应 JSON 文件拖入导入。第三步填入 API Key运行生成在工作流的 API Key 节点填入从 sufy.com 获取的 Key配置提示词和参数点击运行即可。生成在云端完成本地只收返回的视频文件。方式二本地权重模式本地模式要求 ComfyUI 最低0.30.0 版本否则 MiniMax H3 的原生节点不可用。需要下载的权重文件从 Hugging FaceComfy-Org/MiniMax-H3仓库下载放入对应目录ComfyUI/ ├── models/ │ ├── diffusion_models/ │ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors # T2V/I2V 用 │ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 用与上面二选一 │ ├── text_encoders/ │ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors │ └── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors │ └── minimax_h3_audio_vae_fp32.safetensors注意R2V 模式参考生视频使用ref2va扩散模型与 T2V/I2V 使用的fl2va不同需单独下载文本编码器和 VAE 两种模式共用。核心节点说明ComfyUI 节点名对应功能MiniMaxH3TextToVideo文生视频MiniMaxH3ImageToVideo图生视频支持首帧 / 尾帧输入MiniMaxH3ReferenceToVideo参考驱动生成Resolution Selector选择宽高比和分辨率Patch Sage Attention KJ可选需 KJNodes 插件加速推理三种生成模式详解文生视频T2V最简单的模式一段提示词出一段视频。提示词建议按整体场景 → 分镜头描述 → 音频期望的结构写H3 会根据对音频的描述自动合成立体声。宽高比预设16:9横屏、9:16竖屏、1:1时长 5–15 秒可调分辨率最高 2K。首尾帧生视频FLF2V给定首帧图片必填和尾帧图片可选让模型补全中间的运动过程。图片尺寸限制宽高均在 256–5760 px 之间宽高比在 2:5 到 5:2 之间两帧需保持一致的宽高比否则会强制裁切。参考生视频R2V最强大也最复杂的模式可以混合多个视觉和音频参考源让模型理解它们之间的关系后生成新视频。输入上限参考图片最多 9 张参考视频最多 3 段每段 2–15 秒总长 ≤15 秒帧率需在 23.976–60 FPS 之间参考音频最多 3 段总长 ≤15 秒至少需要搭配一张图片或一段视频提示词中引用参考素材的格式Picture 1 是主角穿蓝色上衣表情自然。 Video 1 展示她的走路姿态需要保持这个运动节奏。 Audio 1 是背景音乐整个视频延续这个风格。 镜头从她的正面缓慢推进伴随轻微脚步声。编号严格对应节点连接顺序从 1 开始不可跳号。提示词写作要点H3 的音频生成质量高度依赖提示词中对声音的描述很多人忽略这一点导致输出音频平淡。建议每段视频的提示词包含三类声音描述对白或人声说了什么、语气、情绪环境音效场景中应有的自然声音背景音乐风格、节奏、情绪基调分辨率设置短边建议 768px推荐全质量设置在 16:9 比例下约 100 万像素1344×768分辨率数值须为 32 的倍数。时长注意H3 的时长参数会吸附到模型内部的帧块网格24fps 下每块 17 帧填入的秒数会自动取最近的有效值不是所有整数秒都有效。常见问题QComfyUI 用了 API 模式生成结果保存在哪里API 模式下生成在 MiniMax 的云端服务器执行结果以视频文件形式返回到本地 ComfyUI 的输出目录与本地生成结果存放路径相同。Q本地模式至少需要多大显存官方文档未给出明确数值但文本编码器 Qwen3VL 32B量化为 nvfp4_awq体量较大加上扩散模型和两个 VAE建议至少 24GB 显存实际需求以社区测试为准。目前已有 RTX 408016GB搭配 int8 量化权重运行的案例但需要启用显存优化选项。Q通过七牛云 MaaS 调 API模型 ID 怎么填在 API 请求中model字段填minimax/minimax-h3接口端点参考 sufy.com 的接入文档apidocs.qnaigc.com。QR2V 模式的参考视频需要什么格式帧率在 23.976–60 FPS 之间单段时长 2–15 秒三段合计不超过 15 秒。格式建议 mp4分辨率建议与目标输出分辨率接近。小结MiniMax H3 是目前少数真正实现输入什么模态都能理解、输出带原生音频的开放权重视频生成模型。ComfyUI 提供了两条接入路径API 模式适合快速出片不需要本地 GPU通过七牛云 MaaS 按秒计费门槛极低本地权重模式适合需要完全控制的场景但对硬件要求较高。三种生成模式中R2V 的多参考融合能力是 H3 最有价值的差异化功能值得重点探索。本文数据基于 MiniMax 2026 年 7 月 31 日发布的模型权重和 ComfyUI 0.30.0 版本如遇界面差异以官方最新文档为准。延伸阅读ComfyUI 官方 MiniMax H3 工作流文档https://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3MiniMax H3 官方发布博客https://www.minimaxi.com/blog/minimax-h3MaaS 模型广场含 MiniMax-H3 接入信息https://sufy.com/zh-CN/services/ai-inference/modelsComfyUI 节点权重下载仓库https://huggingface.co/Comfy-Org/MiniMax-H3
返回列表