尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【ICML 2026】Video2GUI:从无标注视频到 1200 万条 GUI 交互轨迹|从 GUI 智能体数据供给视角

【ICML 2026】Video2GUI:从无标注视频到 1200 万条 GUI 交互轨迹|从 GUI 智能体数据供给视角 摘要本文解读 ICML 2026 论文《Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining》。该论文提出Video2GUI 全自动数据合成框架与 WildGUI 大规模预训练数据集通过融合元数据粗筛 视频质量细筛的两级过滤、VLM 驱动的轨迹抽取与三帧原分辨率动作空间落点把人工关键词检索 人工标注替换为元数据分类器 多模态模型标注其特别之处在于把时间推理与空间落点显式解耦——被压缩的视频帧只用于判断发生了什么坐标一律来自未被压缩的高分辨率截图。实验表明在 WildGUI 上持续预训练后Qwen2.5-VL-7B 与 Mimo-VL-7B 在四类基准上一致提升 5–20%Mimo-VL-7B 的 OSWorld-G 平均分达 67.6超过 320 亿参数的 Qwen3-VL-32B60.6AndroidWorld 端到端成功率从基座 16.4% 翻倍到 31.9%为 GUI 智能体的规模化数据供给提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机GUI 智能体的天花板为什么是数据研究主线从问题到结论基准/方法设计一条三段式数据流水线分类全景与方法细节每一环都选够用的最强实验设计与结果7B 模型追平 32B附录数据统计与定性案例结果对比总结关键发现局限性常见问题FAQVideo2GUI 的核心贡献是什么WildGUI 到底有多大为什么要把时间推理和空间落点分开做只用离线数据训练的模型能用在线上交互环境吗数据继续扩大还有收益吗这个方法有什么风险或代价参考链接论文基本信息项目内容标题英文Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining标题中文从无标注视频到 1200 万条 GUI 交互轨迹作者Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li†, Hao Tian†机构北京大学 计算机学院 · 多媒体信息处理全国重点实验室 · 小米 LLM-Core · 香港大学 · 中国人民大学会议ICML 2026PMLR v306arXivhttps://arxiv.org/abs/2605.14747项目网站https://weiminxiong.github.io/Video2GUI/背景与动机GUI 智能体的天花板为什么是数据GUI 智能体要跨网页、桌面与移动端完成任务前提是模型见过足够多真实用户的操作轨迹。论文把交互形式化为 POMDP智能体 π_θ 在时刻 $t$ 依据交互历史 $e_{t-1} (u, a_1, o_1, \ldots, a_{t-1}, o_{t-1})$ 选择动作 $a_t (\tau_t, b_t)$其中 $\tau_t$ 是动作类型、$b_t$ 是坐标或输入文本等参数。要学好这个策略数据必须同时满足三个条件规模大、平台广、动作带精确空间落点。而现有数据供给的两条路线各自卡死在不同的瓶颈上人工标注与模拟环境质量高但成本不可扩展。AITW 提供 30,378 条指令与 715,142 张图AndroidControl 有 14,538 条指令GUI-Odyssey 只有 7,735 条模拟环境如 OSWorld 覆盖 369 个真实桌面任务但环境数受限于人工搭建。从网络视频挖掘TongUI 用前后景检测、VideoAgentTrek 用逆动力学证明视频可以挖但它们依赖低层视觉线索与短期推断并且检索环节依赖人工枚举关键词规模普遍停留在十万级、以单平台为主。论文明确指出网络视频的巨大异质性使得从大规模开放域集合里可靠筛出高质量 GUI 教学录屏本身就是难题而原始视频又缺少显式交互标注如何抽取结构化动作并精确落点到屏幕坐标同样没有现成答案。这张表把 WildGUI 与既有数据集的差距摆得很清楚数据集平台覆盖环境数指令/轨迹数图像数平均轮数MiniWoBWebMobile11410017,9713.6MIND2WEBWeb1372,3502,3507.3AITWMobile35730,378715,1426.5AndroidControlMobile83314,53815,2834.8GUI-OdysseyMobile2017,735118,79115.4GUI-NetWebMobileDesktop2801M1M4.7WildGUI本文WebMobileDesktop1,50012.7M124.5M9.7从附录的历史视角看这正是数据供给的第四次迁移2023–2024 年靠人工标注与模拟环境奠基2024–2025 年 UI-TARS、Aguvis 把 HTML 解析换成像素级推理但数据仍靠人工采集2025 年 TongUI 与 VideoAgentTrek 证明视频可挖2026 年本文用元数据分类器取代关键词检索把规模推到千万级。图 1WildGUI 的数据分布——平台、软件类别与网站类别的构成多样性来自元数据分类器的自动检索而非人工枚举关键词研究主线从问题到结论图 12Video2GUI 研究主线——从数据瓶颈出发经两级过滤、轨迹抽取与空间落点建成 WildGUI再以两阶段训练验证其泛化价值Mermaid 流程图基准/方法设计一条三段式数据流水线论文给出的答案是 Video2GUI一个把原始互联网视频转成结构化交互轨迹 $\mathcal{D}{(u,e)^{(i)}}$ 的全自动框架。它由三段渐进式流水线组成输出的是可直接用于训练的指令–轨迹序列。图 13GUI 预训练数据供给的四条路线——本文属于第四条也是唯一同时做到千万级规模与跨三平台覆盖的一条Mermaid 分类图三段流水线各自解决一个层面的问题粗到细视频过滤先在元数据层面做低成本粗筛再用内容级模型做细筛。前者保证规模可行后者保证质量可用。轨迹抽取把视频转成任务指令 操作时间戳 动作类型 动作理由的结构化序列并额外输出界面对齐友好的低层落点指令。动作空间落点把低层指令映射到精确的 UI 目标坐标或包围盒补上原始视频帧因压缩而缺失的像素级精度。图 2Video2GUI 流水线——(A) 粗到细视频过滤(B) 轨迹抽取把视频片段转成指令–轨迹序列(C) 动作空间落点把低层指令映射到精确 UI 目标分类全景与方法细节每一环都选够用的最强元数据分类器粗筛。论文先用 DeepSeek-V3 标注 1 万条元数据样本约 400 条正例、9K 条负例再做上采样平衡给 Qwen2.5-7B 挂一个二分类头用交叉熵、学习率 $2\times10^{-5}$ 训练 3 个 epoch。分类器只需输入标题、描述、关键词、频道名、分类与字幕就能把5 亿条元数据压到约 2,000 万候选——这是整条流水线里性价比最高的一环避免了下载数百 PB 视频的存储与算力开销。视频质量打分器细筛。元数据过滤无法识别只有软件介绍或广告、或者录屏分辨率低的视频因此论文改用 Qwen2.5-Omni 做内容级打分从每个候选视频取第一分钟在主题相关、指令清晰、录屏质量三个维度打分用 200 小时 Gemini-3-Pro 标注数据以 MSE 损失训练三个回归头。三维分数均需 ≥ 4.2 才保留最终从 2,000 万候选筛到416 万条视频、约 30 万小时。图 3视频质量打分器在测试集上的表现——主题相关、指令清晰、录屏质量三个维度与人工标注高度一致是细筛阶段的质量守门人轨迹抽取与空间落点。抽取阶段由 Gemini-3-Pro 承担采用4 分钟滑窗 历史记忆策略处理第 $j$ 段时把前序段落的抽取结果 $\mathcal{D}(S_{1:j-1})$ 作为文本上下文一并输入因此跨越分段边界的任务、依赖前序操作的任务都不会断链。落点阶段则对每个动作取 $t-0.5$s、$t$、$t0.5$s 三帧原分辨率截图逐帧判断该动作能否在当前帧被定位取第一个成功的结果三帧全部失败就丢弃该动作。这种设计把时间推理与空间定位解耦人工抽检 200 条随机动作落点准确率超过 95%。两阶段训练。Stage 1 在 WildGUI 上做持续预训练混合三个互补目标$\mathcal{L}{ground}$ 训练 UI 元素定位、$\mathcal{L}{action}$ 训练单帧动作预测、$\mathcal{L}{traj}$ 训练多轮交互建模总目标为 $\mathcal{L}{pretrain} \mathcal{L}{ground} \mathcal{L}{action} \mathcal{L}_{traj}$。Stage 2 再在 Rico、SeeClickWeb、OSWorld 系列、AndroidControl、AITW、GUI-Odyssey 等精选开源数据上做后训练。实现上用 Megatron 做分布式训练AdamW 加余弦学习率最大视觉 token 4,096、序列长度 32,768Stage 1 训练 24,000 步、约 2,000 亿 tokenStage 2 训练 3 个 epoch、2,000 步、约 150 亿 token总算力为 256 张 NVIDIA GPU。实验设计与结果7B 模型追平 32B评测分三类。GUI grounding用 ScreenSpot-Pro1,581 个专家标注任务、23 个专业应用、3 个操作系统与 OSWorld-G564 个样本覆盖文本匹配、元素识别、布局理解、细粒度操作离线智能体用 AndroidControl 的高/低两层加中文界面的 CAGUI线上智能体用 OSWorld 的 369 个真实桌面任务与 AndroidWorld 的 116 个任务。骨干是 Qwen2.5-VL-7B 与 Mimo-VL-7B均走完整两阶段训练。模型ScreenSpot-ProΔOSWorld-GΔQwen2.5-VL-7B26.8—27.3— WildGUI41.915.153.726.4Mimo-VL-7B41.2—54.7— WildGUI56.915.767.612.9Qwen3-VL-32B54.9—60.6—Seed1.5-VL60.9—62.9—模型AC-Low 类型准确率AC-Low 步级成功率AC-High 步级成功率CAGUI 类型准确率CAGUI 步级成功率UI-TARS-7B98.090.872.588.670.3Qwen2.5-VL-7B94.185.062.974.255.2 WildGUI94.990.364.588.365.4Mimo-VL-7B92.987.965.682.263.4 WildGUI95.591.871.490.371.0消融实验Mimo-VL-7B则说明三个预训练目标各司其职设置ScreenSpot-ProCAGUIAndroidWorld完整方案56.971.031.9w/o $\mathcal{L}_{ground}$49.869.828.4w/o $\mathcal{L}_{action}$50.565.327.6w/o $\mathcal{L}_{traj}$54.670.224.1w/o Stage 149.364.223.3w/o Stage 228.245.76.0去掉 $\mathcal{L}{traj}$ 后静态任务几乎不掉54.6但 AndroidWorld 崩到 24.1说明轨迹建模是长程规划的关键去掉 $\mathcal{L}{ground}$ 则 grounding 掉到 49.8验证了显式落点监督的必要性而完全没有 Stage 2 时全面崩塌AndroidWorld 只剩 6.0。图 4预训练数据规模的影响——token 从 0 增至 2,000 亿ScreenSpot-Pro 由约 41% 升至 56.9%、OSWorld-G 由约 55% 升至 67.6%约 500 亿 token 后即超越仅做 Stage 2 的基线图 5线上评测——加入 WildGUI 的 Stage 1 预训练后桌面端 OSWorld 与移动端 AndroidWorld 均优于仅用开源数据后训练的基线图 6人工评测平均分——视频质量随过滤级别从 1.22 升到 2.12 再到 4.45轨迹质量 WildGUI 达 4.62高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05附录数据统计与定性案例附录的统计进一步支撑了上面的结论。WildGUI 的过滤漏斗是5 亿条元数据 → 约 2,000 万候选 → 416 万条高质量视频约 30 万小时→ 1,270 万条轨迹平均每条轨迹 9.7 轮并覆盖 1,500 多个应用与网站。与既有数据集横向对比它在轨迹数与平台覆盖上同时领先也是少数同时覆盖网站、移动与桌面三类平台的预训练数据集。图 7WildGUI 数据统计——视频时长分布、轨迹步数分布以及桌面 (c) 与移动 (d) 环境的动作类型分布动作空间方面论文沿用 OSWorld 与 CAGUI 的规范为桌面定义 13 类动作click、doubleClick、rightClick、press、input、hotkey、scroll、drag、moveTo、wait、finished 等为移动定义 10 类click、longpress、pinch、input、drag、open、multi_touch、finished 等。附录中的定性案例展示了抽取得到的真实轨迹图 8WildGUI 示例轨迹——每一步都能与具体时间戳和界面状态对齐这是它能作为预训练监督信号的前提图 9WildGUI 示例轨迹——每步同时给出语义层面的低层描述与空间层面的落点坐标图 10WildGUI 示例轨迹——桌面专业软件场景下的交互序列体现流水线对复杂界面的覆盖能力图 11WildGUI 示例轨迹——移动端场景下的交互序列两套动作空间分开建模使同一数据集可服务两类平台结果对比总结图 14从基座到 WildGUI——grounding 追平 32B 模型线上成功率近乎翻倍Mermaid 对比图关键发现数据规模的确带来了跨平台泛化Qwen2.5-VL-7B 在 ScreenSpot-Pro 上从 26.8 提升到 41.915.1在 OSWorld-G 上从 27.3 提升到 53.726.4Mimo-VL-7B 对应从 41.2 到 56.9、从 54.7 到 67.6。7B 规模靠数据补齐了与 32B 模型之间的参数量差距。纯离线数据能迁移到需要闭环交互的线上环境AndroidWorld 成功率从基座 16.4% 经仅 Stage 2 的 23.3%提升到完整两阶段的 31.9%几乎翻倍OSWorld 从 10.4% 提升到 12.3%。这说明模型学到的是可迁移的界面操作先验而非对特定环境的过拟合。扩展曲线在 2,000 亿 token 处仍未见饱和ScreenSpot-Pro 从约 41% 升到 56.9%OSWorld-G 从约 55% 升到 67.6%且大约在 500 亿 token 处就超过了仅做后训练的基线之后持续上升——这为继续扩数据提供了直接依据。中英文界面同时受益CAGUI 中文界面下Mimo-VL-7B 的类型准确率从 82.2% 提升到 90.3%Qwen2.5-VL-7B 从 74.2% 提升到 88.3%说明跨语言泛化并未被单语视频源限制。三个监督目标各自承载一种能力$\mathcal{L}{traj}$ 支撑长程规划去掉后 AndroidWorld 31.9→24.1$\mathcal{L}{ground}$ 支撑落点精度去掉后 56.9→49.8$\mathcal{L}_{action}$ 支撑单步决策去掉后 CAGUI 71.0→65.3。数据侧的三个目标都对应了明确的失败模式。数据质量经过了独立验证人工评测中视频质量随过滤级别从 1.22 升到 2.12 再到 4.45轨迹质量 4.62 高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05五位标注员的 Krippendorff α 为 0.84且落点人工抽检准确率超过 95%。论文的贡献重心落在可复用基础设施、跨领域适用性与大规模受控实验上这也解释了它为何能拿到高评价。局限性数据源单一元数据与视频全部来自 YouTube跨语言、跨地区的平台偏差没有被量化1,500 多个应用相对真实软件生态仍然只是长尾的一小片。强依赖闭源标注器轨迹抽取与空间落点的核心标注都使用 Gemini-3-Pro单样本 API 成本约0.0763 美元轨迹抽取 0.0653 落点 0.011视频打分由自建 Qwen2.5-Omni 承担。一旦标注模型升级或下线复现性与成本都会受影响。验证是抽样而非全量落点准确率来自 200 条随机动作数据质量来自 5 位标注员、300 条样本规模放大之后仍存在未量化的噪声。线上成功率仍然很低即使完整两阶段OSWorld 也仅 12.3%、AndroidWorld 为 31.9%距离可用部署仍有明显差距。作者把扩大离线交互数据 后续在线强化学习作为下一步路径。写作层面也有可改进之处论文用让步转折 → 瓶颈命名 → 承诺兑现的叙事弧推进证据框架与新颖性立场都很强consistent improvements of 5–20%、we propose Video2GUI但正文中 Qwen2.5-VL 在 ScreenSpot-Pro 的提升一处写作 41.2、主表为 41.9图题把方法名写成 VideoGUI漏掉数字 2另有一处 improves improves 的重复词。常见问题FAQVideo2GUI 的核心贡献是什么一句话把 GUI 预训练数据的获取从人工关键词检索 人工标注换成元数据分类器 多模态模型标注从而在成本可控的前提下把规模推到互联网级。产物是一套可复用的三段式流水线以及 1,270 万条轨迹、1.245 亿张截图的 WildGUI 数据集。WildGUI 到底有多大从 5 亿条 YouTube 元数据出发经元数据粗筛留下约 2,000 万候选再用视频质量打分器筛出 416 万条视频约 30 万小时最终产出 1,270 万条交互轨迹与 1.245 亿张截图覆盖 1,500 多个应用与网站平均每条轨迹 9.7 轮。横向看它的轨迹规模约为 GUI-Net 的 12 倍、AndroidControl 的 800 倍以上。为什么要把时间推理和空间落点分开做因为长视频输入必须压缩帧以满足上下文长度压缩后的帧不足以支撑像素级定位。论文的做法是让 Gemini-3-Pro 在压缩视频上判断发生了什么再回到 $t-0.5$s、$t$、$t0.5$s 三帧原分辨率截图上去定位点在哪儿。这样既保住了长程理解又拿到了精确坐标——人工抽检 200 条动作的落点准确率超过 95%。只用离线数据训练的模型能用在线上交互环境吗实验证明可以而且增益明显。AndroidWorld 的端到端成功率从基座 16.4% 提升到 31.9%OSWorld 从 10.4% 提升到 12.3%两者都优于只用开源数据做后训练的基线。论文的解释是WildGUI 提供的是可迁移的界面操作先验而不是对特定环境的过拟合。数据继续扩大还有收益吗有。论文的规模曲线显示预训练 token 从 0 增到 2,000 亿时ScreenSpot-Pro 从约 41% 升到 56.9%、OSWorld-G 从约 55% 升到 67.6%且到 2,000 亿都没有出现饱和迹象大约 500 亿 token 处就已超越只做后训练的基线。这个方法有什么风险或代价主要是三点一是数据源单一全部来自 YouTube二是核心标注强依赖 Gemini-3-Pro约每样本 0.0763 美元三是质量验证基于抽样200 条动作、300 条数据全量错误率未被量化。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2605.14747项目主页含数据与代码https://weiminxiong.github.io/Video2GUI/开源仓库https://github.com/WeiminXiong/Video2GUITongUI从多模态网页教程构建通用 GUI 智能体https://arxiv.org/abs/2504.12679UI-TARS原生 GUI 交互智能体https://arxiv.org/abs/2501.12326OSWorld真实计算机环境智能体评测基准https://arxiv.org/abs/2404.07972给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表