尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Cua-Bench 任务验证完整指南:oracle 评估与手动演练实操

Cua-Bench 任务验证完整指南:oracle 评估与手动演练实操 Cua-Bench 任务验证完整指南oracle 评估与手动演练实操【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua拿到一个现成的 Cua-Bench 任务在交给 agent 跑分或编入数据集之前必须完成一轮Cua-Bench 任务验证先用任务自带的参考解oracle触发oracle 评估确认参考答案确实能拿到成功奖励再脱离 oracle 亲手操作一遍确认交互路径可用。产出物是一份可交付的验证结论——任务可信、评估器可信、环境可信。开工前 30 秒自检Python 3.12 或 3.13 已就绪uv 可用依赖已装好CLI 本体 该任务 provider 要求的组件模拟任务还要补上浏览器支持手头有一个本地任务目录内含main.py后文所有task-path都指向它uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium cb --help最后一条输出里应能看到run、interact、task、trace、dataset等命令组。命令全集见 CLI 参考。先看后动cb task info 检查生命周期直接拉起环境再发现问题代价是浪费一轮完整的启动与回收。所以上手前先用 run-a-task 指南里的核对口径过一遍定义cb task info task-path逐项确认provider 与操作系统类型符合预期准备运行的 variant 真实存在setup 与 evaluation 两项都带 ✓任务理应包含 oracle 时solve 同样有 ✓生命周期函数都写在main.py里靠cb.tasks_config、cb.setup_task、cb.solve_task、cb.evaluate_task声明其中 tasks 的返回值是一组TaskCLI 按零基索引逐个选用。字段与签名细节查 任务定义参考。双路径验证参考解与手动演练互为镜像这两条路径共用同一个环境、同一个 variant、同一个评估器唯一差别是谁在操作。先看路径一的结果是否符合预期再走路径二核对一致性——任何一边掉链子都不能把锅甩给 agent。关键口径只有一条记牢oracle 跑挂是任务或环境自身的验证失败该结果不能作为 agent 分数使用。oracle 跑分一行命令出评估结果选定 variant加--oracle与--no-wait跑完立即关环境cb interact task-path \ --variant-id 0 \ --oracle \ --no-wait执行过程会弹出一个可见桌面setup 铺状态 → oracle 动手 → evaluate 收尾。教程里示例任务的文档化输出长这样实际数值以你的任务为准✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!拿报告的评估结果去对任务定义里认定成功的奖励值一致才算这一关通过。手动走通不靠 oracle 的评估闭环路径一绿灯后去掉--oracle重跑同一个 variantcb interact task-path --variant-id 0在弹出的任务窗口里亲手把目标做完回终端按 Enter评估执行、环境关闭。既然评估器与 oracle 那次完全相同手动得分若与 oracle 对齐说明从操作到计分的整条链路都在预期之内——这就是 run-a-task 指南要求的手动演练评估闭环。逐个 variant 验证别漏掉任何一个任务往往不止一个 variant。对剩下的每一个重复同一动作只动--variant-idcb interact task-path --variant-id variant --oracle --no-wait注意只换 id 不换逻辑的边界同一组生命周期函数被复用但 prompt、metadata、computer 配置各走各的。换句话说variant 0 全绿推不出 variant 1 全绿——每个都得单独验证别想当然。踩坑速查QPlaywright 提示找不到浏览器可执行文件模拟任务A在与 Cua-Bench 同一环境里补装 Chromiumuv tool run --from cua-bench[browser] playwright install chromiumQcb task info里 solve 没有 check markoracle 无从跑起A回main.py核对每个生命周期函数的装饰器与拆分是否正确对照 任务定义参考里的支持列表还没写过任务的按 构建第一个 Cua-Bench 任务 把完整结构补齐。Qoracle 通过了agent 跑却零分怀疑评估器有问题A先按本文双路径流程重验一遍手动演练确认评估器对正确操作确实给成功奖励仍复现就检查任务侧状态判定而不是直接归因 agent。交付自查按 run-a-task 指南 的口径三项全勾任务即可放心交给 agent 或编入数据集cb task infosetup、evaluate 均带 ✓应有 oracle 时 solve 也带 ✓每个 variant 的cb interact 命令oracle 运行报告的评估结果与任务定义的成功奖励一致手动演练完整走通操作 → 回车 → 评估并关闭且结果与 oracle 对齐【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表