尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

超越试错法:面向图生视频一致性的智能体优化框架

超越试错法:面向图生视频一致性的智能体优化框架 超越试错法面向图生视频一致性的智能体优化框架arXiv2608.12290v1发布时间2026年8月12日开源协议CC BY 4.0摘要现有黑盒图生视频I2V模型生成能力强大但精细可控性差在专业内容制作管线中落地困难。生成模型具有强随机性文本提示词、超参数微小改动都会造成成片巨大差异从业者只能依靠暴力反复试错计算开销高、效率低下。针对该痛点本文提出智能体自优化框架Agentic Self-Improvement将视频生成重构为闭环目标导向优化流程采用两段式方案系统性遍历生成参数空间提示词优化阶段多模态大模型mLLM驱动迭代提示词精炼设计两套自动化评测体系戴维森场景图DSG查询校验语义匹配度、通用缺陷问题CMQ检测生成瑕疵超参数优化阶段基于贝叶斯搜索协同优化随机种子、分类自由引导CFG尺度整套搜索由全新视频-文本对齐分数VTA等多维度质量指标引导。人工偏好实验证明本文框架生成视频相较基线优势显著最高优选率达69%。本文提供一套通用、可扩展方案大幅提升SOTA视频生成模型的可控性与输出稳定性将视频生成从随机试错升级为工业化可靠创作工具。目录1 引言2 相关工作2.1 文生/图生视频模型发展2.2 视频生成可控性研究2.3 自动化提示工程2.4 超参数优化与智能体AI3 方法体系3.1 基于结构化评测的提示词优化3.1.1 语义锚定问题生成DSG3.1.2 迭代提示词精炼闭环3.1.3 mLLM视觉问答可靠性验证3.2 基于贝叶斯搜索的超参数优化3.2.1 自动化评测指标套件4 实验4.1 提示词优化消融实验4.2 贝叶斯搜索完整对比实验5 讨论6 结论参考文献7 附录7.1 自动化指标完整定量结果8 问题生成配套提示词8.1 DSG场景图生成提示词8.2 CMQ通用缺陷生成提示词1 引言大规模黑盒文生/图生视频模型极大释放了自动化内容创作潜力但生成效果与专业影视制作需求之间存在巨大鸿沟。专业创作核心诉求是成片严格贴合创作文案与参考输入图而现有模型存在固有随机性随机种子、CFG尺度等超参数轻微变动成片画面、人物、运动逻辑会发生剧烈不可控变化。从业者只能暴力生成大量视频随机筛选符合预期结果该流程算力成本极高、创作效率极低。亟需一套系统化框架智能遍历参数空间摆脱盲目试错模式。本文提出智能体自优化闭环框架将开放式随机生成改造为目标导向优化流程分两大阶段解决两大变量来源文本提示词、模型生成超参数。提示词迭代优化多模态大模型自动生成DSG语义校验问题、CMQ缺陷检测问题基于VQA打分循环重写提示词消除语义歧义贝叶斯协同超参数搜索联合优化随机种子与CFG引导值以VTA对齐分数、感知质量、时序一致性多目标为优化方向。整套框架输出视频在画面、叙事、人物运动层面高度贴合用户创作意图。本文四大核心贡献提出面向黑盒图生视频的智能体自优化闭环框架系统化实现目标导向可控生成设计基于DSG/CMQ结构化评测的迭代提示词优化方案依靠多模态大模型自动校验语义完整性采用高斯过程贝叶斯搜索协同优化随机种子与CFG尺度大幅减少试错次数提出VTA视频-文本对齐指标基于DSG/CMQ问答结果量化成片与文案匹配程度作为优化统一反馈信号。2 相关工作2.1 文生/图生视频模型发展视频生成技术从GAN、VAE逐步过渡到扩散模型早期方案存在时序断裂、分辨率低问题以Veo为代表的大规模DiT扩散模型依托海量数据集实现高保真、时序连贯视频生成。近期自回归多模态统一模型可原生处理图文交替序列但黑盒特性、数据集不可控带来可控性、可复现性难题。2.2 视频生成可控性研究仅依靠文本提示词无法满足专业精细创作需求现有可控方案分为两类附加条件输入参考图、深度图、人体姿态图等约束画面结构与人物运动解耦生成控制分离内容、运动、风格维度但同时精准控制多要素仍是难点。本文不改动底层生成模型通过上层智能体优化提示词与超参数兼容任意主流I2V模型。2.3 自动化提示工程提示词优化分为三类路线梯度优化将提示词嵌入作为连续向量最大化区分性奖励强化学习训练策略网络根据生成图像反馈改写提示LLM自动迭代黑盒场景下依靠大模型根据生成结果循环改写提示。本文在LLM自动提示优化基础上引入DSG结构化语义校验针对视频时序缺陷新增CMQ缺陷检测问题提升图文、时序双重对齐能力。2.4 超参数优化与智能体AI扩散模型生成质量高度依赖CFG、随机种子等超参数传统网格搜索算力消耗巨大贝叶斯优化通过概率模型拟合目标函数以更少评估次数找到最优参数。智能体AI核心是自主规划、推理、执行闭环大模型拆解高层目标、调用生成工具、评估结果迭代方案。本文框架完全符合智能体定义自主生成评测标准、推理缺陷根源、分别在文本提示词、数值超参数空间执行优化动作。3 方法体系图1 智能体自优化框架整体架构上层提示词优化闭环下层贝叶斯超参数搜索闭环。图2 DSG场景图与CMQ缺陷问题生成示例输入提示词一群女性坐在建筑台阶上上半部分DSG逐层拆解实体、动作、位置的是/否校验问题下半部分CMQ针对人物肢体变形、面部闪烁、物体消失等视频典型瑕疵设计校验问题。整套框架为闭环目标导向系统分两大独立协同模块提示词优化器、超参数优化器分步消除提示歧义、随机生成波动稳定输出匹配用户创意的视频。3.1 基于结构化评测的提示词优化视频生成核心痛点是用户自然提示词与模型训练数据分布存在语义鸿沟。本文采用多轮迭代方案自动精炼模糊提示词输出无歧义精准生成指令。3.1.1 语义锚定问题生成DSGCMQ输入图文后调用mLLM生成两类可机器核验的结构化是/否问题戴维森场景图DSG问题基于戴维森场景图理论拆解画面核心实体、动作、位置、从属关系逐层校验基础语义是否完整。示例是否存在女性群体、人物是否坐于台阶、台阶是否属于建筑。作用确保文案全部核心视觉要素在视频中完整呈现。通用缺陷问题CMQ专门针对视频生成固有瑕疵设计校验问题覆盖物体恒存、人体解剖畸变、画面闪烁、无逻辑跳变、重复卡顿等动态缺陷。示例人物五官是否无扭曲闪烁、肢体结构是否正常。3.1.2 迭代提示词精炼闭环完整迭代流程使用当前提示词调用I2V模型生成视频mLLM执行VQA对全部DSG/CMQ问题输出是/否答案正确回答占比作为对齐分数针对回答为“否”的缺陷问题引导大模型改写提示词补充约束条件固定迭代轮次循环优化保存对齐分数最高的提示词送入下一阶段超参数搜索。3.1.3 mLLM视觉问答可靠性验证整套优化闭环依赖mLLM打分可信度本文开展人工标注对照实验随机抽取100组视频-问答样本50条DSG、50条CMQ两名标注人工给出真值对比Gemini 2.5 Pro模型输出结果。问题类型模型准确率DSG语义问题92%CMQ缺陷问题82%整体平均87%结论DSG客观实体识别精度极高CMQ时序运动类问题存在少量主观偏差但整体与人工标注高度匹配可作为自动化评测可靠代理。3.2 基于贝叶斯搜索的超参数优化获取最优提示词后采用Vizier高斯过程贝叶斯算法协同优化CFG尺度搜索区间1~15、随机种子。随机种子属于无序分类变量传统网格/随机搜索效率极低贝叶斯UCB探索策略优先评估高潜力参数组合快速淘汰劣质种子节省算力。优化目标为多目标奖励函数由三套自动化指标共同构成。3.2.1 自动化评测指标套件完整评测体系覆盖三大维度画面感知质量、时序连贯性、图文语义对齐。感知质量指标RAHF多模态Transformer模拟人类画质打分均匀采样10帧取最低分代表视频整体画质UVQCNN通用视频质量指标综合失真、压缩维度输出MOS分时序连贯性指标光流突变检测量化无逻辑镜头跳转循环卡顿检测惩罚2秒静态画面、无意义循环片段VTA视频-文本对齐指标本文核心创新指标复用DSG、CMQ问答树打分分层加权计算全局匹配分数VTA(V)1∑wi∑wi⋅Si\text{VTA}(V)\frac{1}{\sum w_i}\sum w_i \cdot S_iVTA(V)∑wi​1​∑wi​⋅Si​其中SiI(mLLM判定正确)⋅Sp(i)S_i \mathbb{I}(\text{mLLM判定正确}) \cdot S_{p(i)}Si​I(mLLM判定正确)⋅Sp(i)​子节点分数被父节点结果掩码若上层实体不存在下层动作/细节直接归零统一权重wi1w_i1wi​1。优势基础叙事要素缺失会连锁拉低整体分数精准量化文案完整还原度。4 实验实验基础配置底层图生视频模型Veo 2.0统一生成4秒96帧视频评测数据集VBench图生图文样本集共100组独立图文对基线方案固定提示词随机生成、全随机超参数搜索、最优随机样本筛选评估方式双人专家盲对比人工偏好测试统计二项检验95%威尔逊置信区间所有结果p值小于1e-6具备统计显著性。4.1 提示词优化消融实验实验控制所有超参数不变仅对比原始VBench提示词、本文迭代优化提示词生成视频。人工对比结果优化后视频优选占比27%基线仅5%剩余68%无明显差异证明提示词迭代优化可显著提升成片匹配度。4.2 贝叶斯搜索完整对比实验设置两种算力预算10轮搜索、100轮搜索对比基线1同预算完全随机超参数采样对比基线2100轮随机后筛选最优样本强基线。打分筛选策略RAHF、VTA、UV、四项平均分人工偏好统计结果如下表1 人工偏好对比数值本方案优选占比剩余为平局| 筛选指标 | 10轮 vs 随机基线 | 100轮 vs 随机基线 | 100轮 vs 最优随机基线 || ---- | ---- | ---- || RAHF | 47% | 69% | 42% || VTA | 45% | 63% | 39% || UVQ | 42% | 60% | 38% || 四项均值 | 45% | 66% | 28% |实验结论算力越多贝叶斯搜索优势越明显100轮下RAHF筛选方案优选率达69%即便对比“随机后筛选最优”强基线本文贝叶斯优化仍显著领先证明搜索过程主动挖掘优质参数而非仅靠后期筛选RAHF人类感知对齐度最高是最优单维度筛选指标。5 讨论核心价值将提示词、超参数两大波动源统一纳入闭环优化摆脱随机试错mLLM作为自动化评测器无需人工介入即可迭代生成方案框架扩展性底层I2V模型无绑定可无缝适配任意扩散式图生/文生视频后续可拓展多轮叙事、情感风格等高阶评测维度现存局限多轮迭代带来额外推理算力开销当前提示词、超参数分两阶段串行优化未实现联合搜索未来方向轻量化小模型替代大评测mLLM降低成本提示词超参数联合贝叶斯协同优化增加3D空间、物理逻辑校验问题提升视频真实性。6 结论针对黑盒图生视频可控性差、只能暴力试错的行业痛点本文提出两段式智能体自优化框架。第一阶段依托DSG/CMQ结构化问答迭代精炼提示词消除语义歧义第二阶段贝叶斯协同搜索CFG与随机种子以多目标指标引导生成参数优化。大规模人工偏好实验验证同等算力下本文方案生成视频显著优于随机基线最高优选率69%。整套框架通用可拓展为工业化可控视频生成提供完整闭环优化方案。参考文献详见原文arxiv完整引用列表https://arxiv.org/html/2608.12290v17 附录7.1 自动化指标完整定量结果基于VBench官方自动化评测套件测算不同优化方案各项量化指标差异极小现有数值指标对细微画面、时序瑕疵敏感度不足这也是本文以人工偏好作为核心评估标准的原因。完整分项指标见下表表2 VBench自动化量化结果均值±标准差| 配置 | 画面美感 | 背景一致性 | 动态程度 | 成像质量 | 运动平滑度 | 主体一致性 || ---- | ---- | ---- | ---- | ---- | ---- || 100轮-RAHF筛选 | 0.616±0.08 | 0.961±0.028 | 42.9% | 69.35±8.46 | 0.991±0.011 | 0.948±0.064 || 100轮-VTA筛选 | 0.616±0.079 | 0.961±0.022 | 44.9% | 70.13±7.94 | 0.991±0.008 | 0.957±0.040 || 10轮均值筛选 | 0.618±0.079 | 0.965±0.021 | 32.3% | 70.35±7.61 | 0.992±0.011 | 0.964±0.039 || 原始基线 | 0.615±0.081 | 0.968±0.025 | 23.0% | 68.90±8.88 | 0.994±0.004 | 0.967±0.042 |8 问题生成配套完整提示词8.1 DSG戴维森场景图生成提示词分析用户文本提示词与可选首尾参考图按照戴维森场景图理论生成树形分层是/否问题。 识别画面核心主体、动作、地点、属性每条问题仅校验单一视觉要素。 输出JSON格式顶层key为scene_graph每条节点包含 id唯一标识element_type主体/动作/物体/地点/属性description要素简述question是/否校验问题children子节点列表空则[] 限制总问题不超过20条输出纯合法JSON无多余文字。 示例节点 { id:agent_red_bird_1, element_type:agent, description:红色小鸟, question:画面中存在红色小鸟吗, children:[{id:action_bird_flying_1,element_type:action,description:小鸟飞行,question:红色小鸟正在飞行吗,children:[]}] } 输入提示词[用户原始提示词]8.2 CMQ通用缺陷生成提示词分析图文输入生成树形校验问题专门检测图生视频高频瑕疵覆盖 不自然镜头跳转、人体肢体畸变、物体凭空消失/出现、镜头内无逻辑变化、静态物体无合理运动、多余人物物体、无台词人物开口、纹理细节不一致。 输出JSON顶层key为common_mistakes每条节点字段同DSG 所有问题设计逻辑回答“是”代表无瑕疵“否”代表存在生成缺陷 总问题不超过20条输出完整合法JSON禁止额外说明文字。 示例节点 { id:mistake_transition_1, element_type:缺陷大类, description:镜头过渡不自然, question:所有镜头切换流畅无突兀跳切吗, children:[] } 输入提示词[用户原始提示词]资源链接论文原文网页https://arxiv.org/html/2608.12290v1开源协议CC BY 4.0完整评测提示词、贝叶斯搜索超参配置、实验复现代码、VBench数据集使用规范存放于arxiv论文附录底层生成模型Veo 2.0官方接口https://developers.googleblog.com/en/veo-2-video-generation-now-generally-available/Vizier贝叶斯优化工具https://arxiv.org/abs/2408.11527Gemini 2.5 Pro评测模型官方文档可作为VQA推理基座。
返回列表