清华智谱开源发布ScaleCUA:可扩展的任务合成和在线强化学习 GUI Agent框架,9B模型刷新开源SOTA

发布时间:2026/7/31 17:32:57

清华智谱开源发布ScaleCUA:可扩展的任务合成和在线强化学习 GUI Agent框架,9B模型刷新开源SOTA 一句话讲清楚清华大学与 Z.AI 提出 ScaleCUA 用 VeriGen 在真实桌面容器里规模化合成可验证 GUI 任务再配合前沿采样与视觉上下文切分把开源计算机使用智能体做到 OSWorld 68.7%、 ScienceBoard 54.0%。计算机使用智能体 Computer Use Agent CUA 看屏幕截图、点鼠标敲键盘想把「装主题、改表格、跨应用搬文件」这类桌面流程自动化。商业 Demo 已经能跑通要继续往上推研究侧更押可验证奖励的在线强化学习 RLVR 环境终态可被确定性函数打分再用在线交互更新策略。论文里有个 47 步装 GNOME 主题的例子逛主题站、下载解压、终端安装、再用gsettings切换。中间点错一次目录后面几十步往往白烧。 GUI 强化学习难首先是因为这种题通常只有指令和环境没有数学题那种现成判题器。Figure 2 训练后的 ScaleCUA 端到端完成 47 步跨应用任务从浏览 gnome-look.org 、下载 Orchis 主题到终端解压并用 gsettings 切换直到环境裁判给出 score1.0 。第二个坑在训练本身。多轮截图又长又贵同一题采一组轨迹做相对比较时如果全成功或全失败组内就学不到有效信号。若把每一步都拆成单独训练样本样本数又会跟着交互轮数直线涨——用 条轨迹、平均每条 步估算量级大约是 。把「可验证任务能不能规模化」「采样是否有效」「能不能做大规模在线 RL 」「多轮训练是否高效」这四条拆开看既往 GUI Agent 方法往往只覆盖其中一两项。 ScaleCUA 在表上四项都勾上了Table 1 代表性 GUI Agent 方法在四条缩放维度上的对比 ScaleCUA 是唯一四项全覆盖的一行。ScaleCUA 的做法是把「造可验证题」和「省着训」绑在同一条流水线上。 Qwen3.5-9B 版本 OSWorld 到68.7%开源侧此前较强的 Kimi K2.5 为 63.3% Claude Sonnet 4.5 为 62.9% ScienceBoard 到54.0%。代码、模型与数据集已开源。开源模型在 OSWorld 上的成功率对比 ScaleCUA 9B 68.7%高于更大参数的若干开源基线。同一训练流水线下可验证合成任务规模扩大 OSWorld 成功率同步抬升。框架数据侧造裁判训练侧盯能力边界ScaleCUA 分三块。VeriGen在 live Docker 桌面里迭代写出「指令 可执行裁判」。 Frontier Sampling 按每道题的实时成功率把采样压到「半会不会」的难度区。 Visual Context Segmentation 只保留最近 张截图做视觉输入文字历史不断档——避免 rollout 侧硬堆全部历史截图、训练侧又被超长多模态样本拖死。流程分三阶段先在 VeriGen 初期任务池上暖起来收集 rollout 后再做轨迹引导合成失败拆细、成功拼难最后在精炼池上跑带前沿采样与滑动窗的在线 RL 。ScaleCUA 总览左端 VeriGen 并行造可验证任务右端前沿采样 大规模 rollout 中间用视觉上下文切分喂训练引擎。VeriGen 在 Docker 里把 GUI 题写成可跑的裁判可验证 GUI 任务的标准很硬必须带确定性裁判例如查文件是否存在、读浏览器状态、跑一段 Python 根据终态打分不靠人或大模型口头判。VeriGen 用三个独立 Agent 闭环。 proposer 根据环境知识文档和容器接口起草题面与裁判 judger 做静态审查看指令是否歧义、裁判逻辑是否自洽 checker 在容器里实际点选读截图和无障碍树检验目标是否可达、裁判是否给终态打对分。两边都过才留下否则回灌下一轮。「写得出」还不够适合 RL 。轨迹引导阶段会读模型在旧题上的成功率和逐步反馈失败任务从最早偏题步切开变成更短的子目标成功任务在同应用内聚类再把目标与裁判串成更难的多目标题。环境侧有一层共享探头 docker interaction probe 合成 Agent 一律经这层接口取状态、下发动作才能撑到 100 合成工人并发对 100 环境。论文报告产出24K可验证候选最终约 3K 条进入高质量 RL 池。VeriGen 产出的可验证任务量相对既有桌面 CUA 方法高出约一个数量级。RL 池加入轨迹引导合成任务后训练过程中的任务级通过率更高。人工抽查里可执行裁判与专家标注在抽样轨迹上约 82.5% 一致有无轨迹引导时 OSWorld 测试从 64.6% 提到 68.7%。完整流水线裁判可执行率 94.5%去掉 LLM Judge 跌到 62.3%。独立审查和修复角色对「奖励函数能不能真跑」影响很大。Frontier Sampling 优先抽成功率贴近五成的题池子一大均匀抽题很快浪费。像 GRPO 这类「同一题采多条轨迹、比相对好坏」的算法若一组里全过或全挂学不到信号。课程学习固定难度表又跟不上「同一题过几天就从难变易」。Frontier Sampling 给每道题维护成功率的指数滑动平均 EMA 。训练前先全库试探丢掉过易或过难的题例如成功率落在 之外。之后每轮优先抽成功率贴近 50% 附近的题并约留两成名额随便抽免得采样盯死一小撮题。效果是采样会跟着能力边界滑太容易的少抽一时全挂的也少抽主要押在模型「半会不会」的那一批。Frontier Sampling 相对均匀采样、 DAPO 、课程学习能在更长训练步数里维持更高的平均通过率。Visual Context Segmentation 截图只留近窗文字历史不断GUI 轨迹有两种极端包装。整条当一个样本截图堆满上下文在线交互侧推理变慢每一步单独切样本、只留末帧截图训练条数又跟交互轮数一起涨。Visual Context Segmentation 的直觉是聊天文字全文保留屏幕图只盯最近 张。图太多就先把当前这段存成一条训练样本丢掉最早若干张再继续滚。文字链路不断档视觉 token 有上界样本数大约从 收到 。滑动窗切分示意截图只保留最近若干帧更早视觉丢掉可训部分主要覆盖助手回复。预先在窗口大小取 1 、 3 、 5 、 8 、 10 、 15 并在 2/4/8 节点规模上扫过单局最多 50 步时 取 5 到 8 对端到端步时最友好。相对「一步一切」的步进分解滑动窗在实验设定下给出2.83×加速策略更新段从 485s 降到 154s 参考模型前向从 241s 降到 88s 单步总计从 750s 到 265s 。滑动窗相对步进分解的分阶段耗时端到端约 2.83 倍加速。加速没有明显伤正确率。 OSWorld 上单次采样通过率 pass1 在 约 58.9%高于 的 56.4% 和 的 56.8%。个案呈倒 U 形把若干 Chrome 博文另存为 PDF 并按标题命名时 八次里过七次 容易忘掉命名约定 又被早期无关界面拖进循环。中等窗口更像是在「记得住目标」和「不被旧截图干扰」之间取折中。不同视觉窗口 下的 passk 中等窗口约 3–5 最好窗口过大并不自动更好。主结果开源桌面与科学软件两条线训练走在线强化学习一边大规模采样轨迹一边用相对比较类算法 GRPO 一族更新策略。骨干覆盖 GLM-4.6V-Flash 、 Qwen3-VL-8B-Thinking 、 Qwen3.5-9B 评测看桌面开放任务 OSWorld 和专业科研软件 ScienceBoard 。OSWorld 分域成功率。 ScaleCUA-Qwen3.5-9B 总体 68.7% Professional 89.5%、 Workflow 48.1%长流程相关子域抬得更明显。Qwen3.5-9B 从基座 41.8% 到 68.7%跳了 26.9 个百分点 GLM 与 Qwen3-VL 骨干上也是同向抬升。读这个数字时要连边界一起记可验证任务池扩起来之后 8B–9B 级可以上桌面公开榜但仍锁在 Ubuntu 、单局大约 50 步上限里。ScienceBoard 覆盖符号计算、分子可视化、 GIS 、 Lean 证明、天文模拟、 TeX 写作等。 ScaleCUA-Qwen3.5-9B 总体 54.0%略高于 Claude Opus 4.6 的 52.7%文档写作域 86.7% Lean 证明 19.0%论文列出的闭源对比最高不超过 15.4%。办公 GUI 之外专业科研软件也能配上可跑裁判这是 VeriGen 更值得记的一点。模型总体文档LeanClaude Opus 4.652.787.515.4ScaleCUA-9B54.086.719.0消融对照也很直接。完整 ScaleCUA 68.7%去掉 VeriGen 回到基座 43.9%去掉前沿采样 63.7%去掉视觉上下文切分 62.2%。三块各自掉分说明没有哪一块是单纯加戏。边界单局交互上限 50 步覆盖多数 OSWorld / ScienceBoard 题但代表不了超长流程。评测环境是 Ubuntu 桌面 Windows / macOS 应用栈没有直接结论。验证主要落在 8B–9B 级视觉语言模型更大或更小规模的行为还缺刻画。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻