ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Cua-Bench 任务验证指南:先核对参考解与评估器,再交给 agent 跑分

Cua-Bench 任务验证指南:先核对参考解与评估器,再交给 agent 跑分 Cua-Bench 任务验证指南先核对参考解与评估器再交给 agent 跑分【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua把 Cua-Bench 任务交给 agent 跑分、或编进数据集之前先做两项任务验证确认任务自带的参考解oracle能拿到成功奖励并确认环境、交互路径可用。本指南围绕cb命令行展开逐步给出可对照的判定口径跑通后再交付。开始前先明确三件事本节回答验证通过到底指什么让你边操作边对照判定。oracle参考解任务作者写好的标准作答脚本用来证明评估器在正确操作下会给出成功奖励。variant同一个main.py里的一组任务配置提示词、元数据、计算机环境各不相同CLI 用零基索引选择它。生命周期函数定义在main.py中、分别负责配置/准备/作答/打分的四个函数由装饰器登记。oracle 失败属于任务或环境本身的验证失败这个结果不能当作 agent 的分数使用。安装 CLI 与浏览器依赖本节解决工具链是否就位先确认命令可用再补齐模拟任务需要的浏览器。确认本机装有 Python 3.12/3.13 与uv然后安装带浏览器扩展的 Cua-Benchuv tool install cua-bench[browser]在同一环境下安装 Playwright 的 Chromium供模拟任务渲染页面uv tool run --from cua-bench[browser] playwright install chromium查看命令组输出里应能看到run、interact、task、trace、dataset等分组cb --help判定五个命令组都在说明 CLI 已正确安装。用 cb task info 检查生命周期是否完整本节在启动环境前核对任务定义是否声明齐全省掉后续空跑。cb task info task-pathtask-path是包含main.py的本地任务目录。对照以下清单逐项确认provider环境提供方与操作系统类型符合预期你要跑的那个 variant 确实存在setup与evaluate都带 check mark若该任务本应包含参考解solve也需带 check mark。四个生命周期函数分别由cb.tasks_config、cb.setup_task、cb.solve_task、cb.evaluate_task装饰器声明各自返回一个可被 CLI 按索引选中的Task。签名与字段含义见 任务定义参考。用参考解验证评估器本节判定参考答案能否稳定拿到成功奖励跑完立即评估并关环境。cb interact task-path \ --variant-id 0 \ --oracle \ --no-wait--variant-id 0指定要验证的 variant--oracle让 CLI 代跑参考解而非等人操作--no-wait跳过交互提示、跑完即评估并关闭。执行时会弹出一个桌面窗口Cua-Bench 依次执行 setup、oracle、evaluate。判定口径把报告出的评估值与该任务定义的成功奖励值比对一致才算通过。文档示例输出具体数值以你的任务为准✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!若此处失败说明问题出在任务或环境需先修复而不是去调 agent。手动演练任务一次本节在 oracle 通过后去掉--oracle复跑同一 variant亲自在可见环境里完成目标。cb interact task-path --variant-id 0在任务窗口里把目标做完回到终端按 EnterCua-Bench 随即执行评估并关闭环境。这里调用的是同一个评估器因此手动结果与 oracle 结果一致即可证明交互路径与评估逻辑都按预期工作。逐个 variant 复核本节处理多配置任务只改索引、逐组重跑 oracle避免漏验。cb interact task-path --variant-id variant --oracle --no-wait仅改动--variant-id会复用同一套生命周期函数但走的是该 variant 自己的 prompt、metadata 与 computer 配置所以每个 variant 都必须单独验证不能靠一个通过推导其余。常见失败与处理下表覆盖两类高频故障按现象定位到原因与处理。失败现象可能原因处理方式Playwright 提示缺少浏览器可执行文件模拟任务所需的 Chromium 未装在 Cua-Bench 同一环境在与 Cua-Bench 相同的环境内重装uv tool run --from cua-bench[browser] playwright install chromiumcb task info中某项无 check mark如缺 solve对应生命周期函数未声明或 split 不一致检查main.py各函数是否按同一 split 加对了装饰器签名对照 任务定义参考完整命令选项见 CLI 参考若任务尚未编写可先按教程补齐结构。交付前自检清单本节给出放行标准全部满足才算任务验证完成。cb task info中setup、evaluate均带 check mark本应含 oracle 的任务solve也带 check mark每个 variant 的 oracle 运行报告值与任务定义的成功奖励一致手动演练能完整走通操作 → 回车 → 评估 → 关闭闭环。三项都满足后即可把该任务交给 agent 跑分或编入数据集。下一步把通过验证的任务加入数据集构建流程或为它配置一个待测 agent 开始首轮跑分。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表