ClawBench 浏览器智能体评测
在真实网站上运行并评估浏览器智能体的日常任务能力。
这个 Agent 能做什么,适合哪些场景?
ClawBench 是一个开源基准,用于评估 AI 浏览器智能体完成订餐、旅行预订、求职、邮件管理等真实在线任务的能力。它提供 V1 的 153 个任务、V2 的 130 个任务,以及覆盖 144 个网站的任务定义、评分规则和元数据;另有 20 题的 V1 Lite 子集与 19 题 Claw-Eval 套件。每次运行会在 Docker 或 Podman 隔离容器中启动 Chromium,并通过 CDP 记录和拦截浏览器活动。输出包含视频或远程回放链接、截图、浏览器动作、HTTP 请求、智能体消息和拦截结果,可用于后续复评。它通过 `clawbench`、`clawbench-run`、`clawbench-batch` 等命令提供交互式、单任务与批量评测流程,并支持多种已文档化的智能体 harness。
用户从 test-cases/v1/、test-cases/v2/、test-cases/v1-lite/ 或 test-cases/claw-eval/ 选择任务后,ClawBench 启动容器化 Chromium 和运行时。智能体通过浏览器完成任务,CDP 的 Fetch、Runtime 与 Page 事件被 FastAPI 服务记录;关键的不可逆 HTTP 请求会按 url_pattern、method 及可选 body/params 规则被拦截。运行结果写入 test-output/,其中包含 recording.mp4 或 run-meta.json 回放 URL、screenshots/、actions.jsonl、requests.jsonl、agent-messages.jsonl 和 interception.json。批量运行后可用 clawbench-rescore 依据已记录轨迹进行复评;评测会将智能体轨迹与人工参考轨迹对照,并输出带证据的 PASS/FAIL 结果。
- 正在开发 Chrome 浏览器智能体的团队,希望在真实消费网站上的端到端任务中比较模型或 harness。
- 研究人员需要下载 V1、V2 的任务定义和完整执行轨迹,复核浏览器智能体评分方法。
- 模型平台工程师希望用 `clawbench-batch` 在 V2 全量任务上并发运行已配置模型,并生成批次汇总。
- 评测工程师希望以 `--human` 模式完成任务,录制人工参考轨迹后与智能体运行进行比较。
- 使用 Harbor Framework 的团队,希望将 V2 任务转换为本地 Harbor 数据集,并通过 CDP 连接浏览器运行时。
- 需要观察智能体浏览过程的研究者,可打开单任务运行输出的 noVNC 地址查看实时浏览器会话。
这个 Agent 有哪些优点和局限?
- 在真实网站而非自托管网页副本上执行日常任务,并通过请求拦截降低结账、提交表单和发送邮件等不可逆操作的风险。
- 一次运行保留视频、截图、浏览器动作、HTTP 流量和智能体消息五层记录,便于复核失败原因与重新评分。
- 同时提供任务数据集、V1/V2 轨迹数据集、命令行评测、人工模式和 Harbor 任务导出,而非只提供排行榜。
- 已文档化支持 Codex、Claude Code、OpenClaw、browser-use、Hermes、Pi 等不同 harness,并可选择 Docker 或 Podman。
- 运行依赖 Python 3.11+、uv 和 Docker 或 Podman;首次运行需要构建包含 Chromium 等组件的容器镜像。
- 基准依赖实时网站,网站界面、登录、可用性或流程变化可能影响可复现性与任务结果。
- 为获得一致的任务正确性判断,文档要求配置 `deepseek-v4-pro` 的 API 凭据和兼容的评分端点。
- 支付墙后的任务可能使用永不匹配的拦截规则,因此会持续运行到超时,而不会出现可机械判定的请求拦截。
如何安装或部署这个 Agent?
常规安装:uv tool install clawbench-eval。也可使用 pipx install clawbench-eval 或 python -m pip install clawbench-eval。运行需要 Python 3.11+、uv,以及 Docker 或 Podman。首次运行 clawbench 会创建本地 models/ 配置模板;配置模型后,在 models/models.yaml 中为评分使用的 deepseek-v4-pro 填写 api_key、base_url 和 api_type: openai-completions。从源码运行时,执行 cp models/models.example.yaml models/models.yaml 后编辑该文件。
如何使用这个 Agent?
启动交互式界面:clawbench;源码检出中使用 uv run clawbench。运行单个任务:uv run clawbench-run test-cases/v1/001-daily-life-food-uber-eats claude-sonnet-4-6。运行 V2 全量任务:clawbench-batch --models your-model --cases-suite v2 --all-cases。若只想生成运行记录而不评分,可添加 --no-judge;之后用 clawbench-rescore ./my-run --judge-model deepseek-v4-pro --rubric both 复评。以人工方式创建参考运行可执行:uv run clawbench-run test-cases/v1/001-daily-life-food-uber-eats --human。
这个 Agent 与同类方案有什么区别?
ClawBench 将自己定位为真实消费网站上的端到端浏览器任务评测。与 WebArena、VisualWebArena 和 TheAgentCompany 的自托管环境不同,它使用真实网站;与 Mind2Web 的静态轨迹不同,它执行动态在线任务;与 WebVoyager 相比,它强调请求拦截评分和五层运行记录。