尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Cua-Bench 任务 oracle 与评估器验证完整指南

Cua-Bench 任务 oracle 与评估器验证完整指南 Cua-Bench 任务 oracle 与评估器验证完整指南【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua拿到一个新写的 Cua-Bench 任务目录先别急着交给 agent 跑分。本文教你用cb命令行验证 Cua-Bench 任务检查生命周期是否完整、用 oracle参考解驱动评估器确认它真的能打出成功奖励再手动把交互路径走一遍。全部完成后这个任务可以放心用于数据集构建与模型评测。先确认你的任务属于 Cua-Bench 验证边界以下情况需要照本文操作任务目录是本地目录且含main.py准备用于 agent 评测或编入数据集你尚未确认过该任务的 oracle 能拿到成功奖励或不确定人工操作路径是否走得通任务是模拟桌面simulatedprovider或你本机能直接打开桌面的类型。跳过验证的后果oracle 打不出分属于任务或环境自身的验证失败此时 agent 的得分没有意义若某个 variant 的 setup 没准备好整个批次的结果都要重跑。若你只是跑已有 agent 成绩分析、不接触任务本体不需要本文。一条命令装好 cb 与浏览器依赖需要 Python 3.12 或 3.13 与uv。安装命令只出现这一次且必须在首次使用cb之前执行uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium第一条子命令以独立 tool 环境安装 Cua-Bench CLI入口为cb[browser]是模拟任务所需的浏览器自动化附加依赖第二条用同一环境安装 Chromium避免运行任务时 Playwright 找不到浏览器可执行文件。确认 CLI 可用cb --help预期输出中应能看到run、interact、task、trace、dataset等命令组完整命令表见 CLI 参考。看不到这些分组说明安装环境没进入 PATH先处理这一步再继续。仓库自带可直接用来练习的示例任务例如 libs/cua-bench/example_tasks/basic_gui_env/main.py含cb.tasks_config、cb.setup_task、cb.solve_task、cb.evaluate_task四个装饰器函数只有一个 variant。用 cb task info 确认任务生命周期完整启动任何环境之前先让 CLI 加载任务定义并核对生命周期。cb task info不会启动桌面只读main.py里的装饰器声明签名与字段含义见 任务定义参考cb task info task-pathtask-path是任务目录的相对或绝对路径练习时可用libs/cua-bench/example_tasks/basic_gui_env。输出中核对四点provider 与操作系统类型是你预期的你要跑的 variant 存在--variant-id取的是零基索引setup 与 evaluate 两行有 check mark若任务应当带 oraclesolve 一行也必须有 check mark。四项里任何一项缺失先修任务定义不要进入下一步。用 cb interact 跑 oracle 验证评估器对选定的 variant 运行参考解。--oracle让 Cua-Bench 执行任务自带的 oracle 而不是等待人工输入--no-wait让流程在评估结束后自动关闭环境cb interact task-path \ --variant-id 0 \ --oracle \ --no-wait执行时会打开一个桌面窗口Cua-Bench 依次完成 setup、oracle、evaluate 三段生命周期。判定依据最后一行输出官方文档示例任务的输出为✓ Solution complete ✓ Evaluation result: [1.0] **✓ Task completed successfully!****关键判定口径报告出的评估值必须等于该任务定义的成功奖励值。**任务可返回多个奖励分量见任务定义参考需逐分量对照。按 run-a-task 指南 的口径oracle 打不出成功奖励属于任务或环境验证失败这个结果不能当作 agent 分数使用——先修任务再谈评测。不带 oracle 手动演练交互路径oracle 通过后去掉--oracle重跑同一个 variant自己在可见环境里完成目标cb interact task-path --variant-id 0任务窗口中把描述里的目标做完回到终端按 EnterCua-Bench 会调用同一个cb.evaluate_task函数打分并关闭环境。手动奖励值应与 oracle 一致一致说明人工操作路径 评估逻辑都按预期工作不一致则说明评估器对状态判定偏严或偏松需要回头检查evaluate的判定条件。多 variant 任务对每个 variant 重复 oracle 与手动两步只替换--variant-id——换 id 复用同一组生命周期函数但 prompt、metadata 和 computer 配置各自独立因此每个 variant 都必须单独验证。当验证报错时按现象定位现象Playwright 提示缺少浏览器可执行文件模拟任务。原因Chromium 没装进cb所在的 tool 环境。修复uv tool run --from cua-bench[browser] playwright install chromium注意--from必须指向同一安装来源装到别的环境无效。现象cb task info中 setup / solve / evaluate 某行没有 check mark。原因main.py中该生命周期函数缺失或装饰器声明的 split 与你运行的 split 不一致。修复对照 任务定义参考 的装饰器表确认四个函数均用同一 split 声明任务至少要有cb.tasks_config、cb.setup_task、cb.evaluate_taskcb.solve_task可选但 oracle 验证依赖它。现象提示 variant 不存在或索引越界。原因--variant-id超出了tasks_config返回的Task列表长度。修复以cb task info输出的 variant 数为准把索引改回实际存在的零基编号。可逐条打勾的验证完成清单以下每条都对应本文已给出的命令全部满足即可把任务交给 agent 或编入数据集cb --help能看到task、interact、run、dataset等命令组cb task info task-path中 setup 与 evaluate 均有 check mark应含 oracle 的任务 solve 也有每个 variant 的cb interact ... --oracle --no-wait输出的评估值与任务定义的成功奖励一致手动演练不带--oracle能走通操作 → 回车 → 评估 → 关闭闭环且奖励值与 oracle 一致多 variant 任务已对每个--variant-id重复 oracle 检查无一遗漏【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表