尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【ICML2026】Video-DeepResearch

【ICML2026】Video-DeepResearch noteVideo-DeepResearcharXiv:2608.03979把“Deep Research”从文本/静态图推到连续视频流 开放网页检索的场景核心不是堆参数而是用训练范式和评测设计逼模型先“看视频”、再“搜网页”。这篇的价值不在 SOTA 数字而在把“视频里的 deep research”定义成先时序 grounding 再网页验证的强制闭环并给出可复现的数据-训练-评测三件套。30B 打平 Claude-4.5 这点基本宣告视频 agent 方向“训法 参数量”的范式切换。数据构造pipeline如果模型不用工具就能答出来这道题直接扔掉。他们对每个问题做 4 次 tool-free rollout只要其中一次正确就认为存在 parametric knowledge leakage因此删除。最终得到约 30K VQA。然后再用强模型生成 Agent trajectory通过 rejection sampling只保留最终成功回答的轨迹最终得到 7K correct trajectories整体架构视频 → 【Select Frame → Crop → Image Search → Web Search顺序不一定Agentic】 → AnswerStage-wise Tool Unlocking先强制视觉探索再开放文本搜索。解决“多模态 Agent 不愿意用视觉工具”的 modality bias。初始阶段只允许Select_Keyframe和Crop_Search等视觉信息足够或者达到最大 perception horizon再把Search和Visit加入 action space训练pipeline7K trajectory SFT → 2K moderate-hard QA 做 GRPO。文章目录note一、研究动机视频 Deep Research二、论文核心解耦感知-探索 分阶段解锁工具 SFT→GRPO1. 任务形式化2. 数据引擎30K QA 7K 轨迹3. 两阶段训练4. 新基准 VIDEODR-BENCH200 题三、实验结果Agentic 设置平均VideoDR 与 Bench 总体均工具行为治没治好评模态偏置消融30B四、分析与启发五、相关PE和工具1、Deep Research Agent2、可用的工具一、研究动机视频 Deep Researchgithubhttps://github.com/Osilly/Vision-DeepResearchVideo-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agenthttps://costaliya.github.io/Video-DeepResearch/此前的 deep research agent 走两条线文本线WebGPT、AutoGPT 这类靠搜索迭代合成知识图像线Vision-DeepResearch 等用反向图搜在静态图里做多步检索但视频和这两者都不同——关键信息散落在时间轴上实体会移动、遮挡、重入镜单帧截图会丢时序证据。作者先在 VideoDR 基准上做了“朴素尝试”直接暴露出当前模型的两个病灶模态偏置Modality Bias哪怕最强的开源模型 Qwen3.5-397B-A17B每题平均只调0.10 次视觉工具文本搜索却调1.27 次GPT-5 视觉调用直接是 0。模型默认走“文本搜索捷径”不去帧里抠实体。参数知识泄漏Parametric Knowledge LeakageGPT-5 在 VideoDR 上靠零工具调用拿到 57% 准确率。说明老基准里大量题用世界知识死记硬背就能蒙对根本测不出“有没有真看视频 真去网上验”。一句话动机现有 agent 和基准都测不出“视频里的真 grounding”要把视觉先于文本做成强制工作流并建一个“不用工具就答不对”的基准。二、论文核心解耦感知-探索 分阶段解锁工具 SFT→GRPO1. 任务形式化给定问题 Q 和视频帧序列 V{v₁…v_T}agent 走马尔可夫式决策a i ∼ π θ ( a ∣ H i ) , H i [ Q , V , a 1 , o 1 , … , a i − 1 , o i − 1 ] a_i \sim \pi_\theta(a \mid \mathcal{H}_i),\quad \mathcal{H}_i[Q,V,a_1,o_1,\dots,a_{i-1},o_{i-1}]ai​∼πθ​(a∣Hi​),Hi​[Q,V,a1​,o1​,…,ai−1​,oi−1​]动作空间里关键自有工具是两个Select_Keyframe挑信息帧Crop_Search在帧上画 bbox 裁出实体 → 拿去反向图搜后面才放开Search、Visit等文本网页工具。2. 数据引擎30K QA 7K 轨迹视频过滤时长规则 Qwen3.5-35B 代理判复杂度丢掉太水/太简单的关键帧实体CLIP 帧间相似度抽帧相似0.8 丢弃最多 20 帧大模型标 bbox 和实体名crop 出去做视觉搜索验证对齐VQA 生成单实体事实题 / 多实体组合多跳题明禁“图里什么颜色”这种纯感知题防泄漏过滤每题跑 4 次无工具 rollout只要一次答对就永久丢弃保证留下来 30K QA 必须靠工具轨迹生成7K用大模型采轨迹 拒绝采样关键是分阶段解锁工具——阶段一动作空间只放Select_KeyframeCrop_Search强迫跨帧把实体搜透阶段二视觉上下文够或到感知步数上限才放开Search/Visit只有最终答对的轨迹留下来训3. 两阶段训练SFT冷启动7K 视频轨迹 额外 7K 纯文本 deep-research 数据来自 Vision-DeepResearch混合让模型先学会“先视觉后文本”的语法不偏文本。GRPO破模仿天花板2K 中等难度题每题 4 rollout只留 Pass4 在 (0,1) 的奖励稀疏二元Qwen3-VL 判对错对 1 错 0组内相对优势格式/重复坏样本梯度降权到 20%。用 4×8×H800 80G80K 上下文Megatron 训。两个尺寸共用 recipe35B-A3Bbase Qwen3.5-35B-A3B30B-A3Bbase Qwen3-VL-30B-A3B-Instruct4. 新基准 VIDEODR-BENCH200 题人标关键帧 → 人用Crop_Search验网上证据 → 起草种子题 → 多 agent 扩成多跳如“勒布朗→他球队→该队某年总决赛对手”→ 过滤掉无工具能答的 → 人复核 → 排序 agent 留最优还可递归当新种子。视频时长分布短(≤2min)46% / 中(2-10min)34% / 长(≥10min)20%覆盖知识、娱乐、日常、游戏体育、新闻等。三、实验结果Agentic 设置平均VideoDR 与 Bench 总体均要点35B 比 Claude-4.5 高5.0 点比 GPT-5 高11.5 点30B 与 Claude 持平但比自家 base 分别涨21.2和18.8点细分类35B 在 Knowledge 66.1%、Entertainment 65.9% 全场最高Daily Life 从 base 涨 16.3 点到 56.8%新闻类反常30B 新闻 58.3% 35B 41.7%作者自己说时序动态内容有 transfer 脆性需后续修工具行为治没治好评模态偏置VideoDR 上平均单次任务工具调用GPT-5视觉 0.00 / 文本 0.12Qwen3.5-397B视觉 0.10 / 文本 1.27Video-DR-30B视觉 2.33 / 文本 4.24Video-DR-35B视觉 2.98 / 文本 3.81Bench 上即从“几乎不看图”变成“先抠 2-3 个实体再开搜”行为模式被训过来了。消融30Bbase 40.5 → 4K-SFT 46.0 → 7K-SFT 53.0 → 7K 文本 SFT 56.8 → 2K GRPO59.3每一步都正向纯视频轨迹给 grounding加文本数据补检索偏置GRPO 再抬 2.5 点泛化。四、分析与启发不是尺度赢是课程赢397B 开源模型平均 52.830B 特训后 59.3。Video-DR 能力是“解耦感知-探索”课程教出来的不是参数堆出来的。“真理解”能对环境行动GPT-5 零工具拿 57% 恰恰说明老基准在测记忆本文把“无工具 4 次能答对”的题删光评测才逼近真实 agentic 能力。模态平权是数据/训练问题不是架构问题偏文本是分布伪影靠 stage-wise tool unlocking 可纠。局限人标 200 题成本高、不可大规模扩4×8 H800 训一轮不轻新闻类时效内容 35B 反水“无工具 4 rollout 答对就删”假设裁判模型能全覆盖泄漏极端冷门事可能漏判。五、相关PE和工具1、Deep Research Agent2、可用的工具
返回列表