Open Operator Evals

用可复现的多次运行评估开源网页操作智能体。

Star 数
★ 47
最近更新
1 年前
主语言
Python

30 秒速览

可在哪里用
兼容但需适配
开始前需要
Python 3.11uvShell / 命令行网络访问本地文件系统
典型场景
网页智能体团队在发布前,用 WebVoyager30 的多次运行检查成功率和单任务耗时是否稳定。
主要局限
资料只展示了 30 个任务、15 个网站的 WebVoyager30 子集,不能证明结果可代表完整约 600 任务数据集或其他网页场景。

这个 Agent 能做什么,适合哪些场景?

Open Operator Evals 是一个用于评估网页操作智能体的开源基准仓库,而不是面向终端用户执行网页任务的智能体产品。它以 WebVoyager30 为评测集:这是从约 600 个 WebVoyager 任务中抽取的 30 项任务,覆盖 15 个网站。仓库记录了 Notte、Browser-Use 和 Convergence 的多次运行结果,并用智能体自报成功率、GPT-4 LLM 评估、单任务耗时和任务可靠性进行比较。评测通过 Python 模块 `eval.run` 启动,结果按数据集、提供方、时间戳和任务目录分层保存,包含 JSON 结果和 `summary.webp` 回放摘要。适合需要审查网页智能体表现、复现给定评测配置或分析运行轨迹的工程与研究团队;它没有在给定资料中提供通用安装流程或把任意网页智能体接入基准的接口说明。

评测配置通过 configs/notte.headless.gemini 等文件提供,并可用 cat configs/notte.headless.gemini | uv run python -m eval.run 运行。基准让提供方在 WebVoyager30 的任务上执行;README 所述评测限制为每个任务最多 6 分钟或 20 步,并以 8 次尝试衡量波动。智能体返回成功状态和答案,评测同时汇总其自报状态,并使用 WebVoyager 的 GPT-4 评估提示词判定任务完成情况。输出目录采用 dataset/provider/timestamp/task_name 结构,单个任务目录可包含 results.jsonresults_no_screenshot.jsonsummary.webp,便于查看结果、无截图结果和回放摘要。

  1. 网页智能体团队在发布前,用 WebVoyager30 的多次运行检查成功率和单任务耗时是否稳定。
  2. 研究人员审查 Notte、Browser-Use 与 Convergence 在仓库所列版本和推理配置下的可验证评测记录。
  3. 负责智能体质量的工程师查看 results_no_screenshot.jsonsummary.webp,分析某一任务的失败轨迹。
  4. 需要处理网页智能体高方差问题的评测人员,以每项任务 8 次尝试和任务可靠性指标替代单次运行结论。
  5. 比较自报成功与 GPT-4 判定差异的团队,使用 Alignment 和 Mismatch 识别过度自信的执行结果。

如何安装或部署这个 Agent?

给定资料未说明克隆后的安装步骤、依赖锁定文件、环境变量或凭据配置,因此无法提供可验证的完整安装命令。资料明确给出的运行环境是 Python 3.11,并使用 uv;公开的首次调用示例为:cat configs/notte.headless.gemini | uv run python -m eval.run。不同提供方所需的访问凭据和配置项未在资料中说明。

如何使用这个 Agent?

在具备 Python 3.11、uv、网络访问和仓库文件写入能力的环境中,选择现有配置并运行:cat configs/notte.headless.gemini | uv run python -m eval.run。运行后,按 dataset/provider/timestamp/task_name 查找输出;查看 results.jsonresults_no_screenshot.json 获取结果,查看 summary.webp 审阅任务回放摘要。README 仅展示了 Notte 的具体命令,其他提供方配置的运行命令和凭据要求未明确记录。

这个 Agent 有哪些优点和局限?

优点
  • 采用 WebVoyager30 的 30 项任务和每任务 8 次尝试,明确针对网页智能体运行结果的高方差问题。
  • 同时提供智能体自报、GPT-4 判定、耗时、可靠性、Alignment 和 Mismatch,能区分完成能力与自我评估偏差。
  • 保留按任务组织的 JSON 结果和 summary.webp,可审查具体执行轨迹而不只依赖汇总分数。
  • README 给出了 Notte、Browser-Use 和 Convergence 在指定版本或提交及推理配置下的逐次运行明细。
局限
  • 资料只展示了 30 个任务、15 个网站的 WebVoyager30 子集,不能证明结果可代表完整约 600 任务数据集或其他网页场景。
  • 完整安装、依赖解析、密钥配置及新增提供方接入方式均未说明,复现和扩展需要自行补齐工程信息。
  • 评测结果受不断变化的网页、非确定性模型、网络行为、Cookie 弹窗、CAPTCHA 与机器人检测影响。
  • README 所列 Browser-Use 评测约需 20 美元,而该成本只对应 WebVoyager30、每任务 8 次尝试及文中指定的 GPT-4o 用量。

这个 Agent 与同类方案有什么区别?

仓库比较了三种已记录配置:Notte v1.3.3(gemini/gemini-2.0-flash)、Browser-Use v0.1.40(openai/gpt-4o)和 Convergence Proxy-lite 提交 a4389c5。在 README 汇总中,Notte 的 LLM Evaluation 为 79.0%、平均 47 秒;Browser-Use 为 60.2%、113 秒;Convergence 为 31.4%、83 秒。这些是该仓库的 WebVoyager30 多次运行结果,不代表所有版本、模型、网络环境或任务集。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
Open Operator Evals 当前 29 · 缺口较多 ★ 47 1 年前 Python
Webwright 浏览器编程代理 66 · 存在缺口 ★ 6k 1 个月前 Python Codex · Claude Code · OpenAI API · Claude API
Chrome DevTools MCP 79 · 存在缺口 ★ 53k 今天 TypeScript Codex · Claude Code
browser-control 72 · 存在缺口 ★ 3.1k 28 天前 Rust

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
29/ 100 五分制 1.5 / 5
信任安全 0/29
可靠稳定 3/14
适用触发 6/18
规范维护 7/18
有效结果 9/13
证据核验 4/8
查看各维度的扣分理由
信任安全0 / 29 · 0.0/5

证据显示仓库未提供任何权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均缺失,故评分为0。

可靠稳定3 / 14 · 1.1/5

自一致性:README中多次重复相同结果表格,但未提供原始数据或代码验证,仅部分支持。依赖可用性:requirements.txt固定版本,但未说明依赖的可用性或维护状态,仅部分支持。失败消息:未提供任何失败处理或错误消息的文档,评分为0。

适用触发6 / 18 · 1.7/5

受众与场景:明确面向研究者和开发者,提供基准测试场景,评分为2。能力边界:仅说明基准测试范围,未明确Agent的能力限制,评分为1。触发精度:未提供任何触发机制或精确指令,评分为0。环境适配:提及在Macbook M1和Python 3.11上运行,但未提供其他环境支持,评分为1。

规范维护7 / 18 · 1.9/5

信息架构:README结构清晰,包含表格、章节和链接,评分为2。安装说明:提供运行命令,但未提供完整安装步骤,评分为1。命名稳定性:版本号明确,但未说明命名约定,评分为1。示例与FAQ:提供示例任务和重放链接,但无FAQ,评分为2。已知限制:提及高方差和CAPTCHA问题,但未系统列出,评分为1。许可证:未提供许可证信息,评分为0。版本与变更日志:提及版本号,但无变更日志,评分为1。维护责任:未明确维护者或贡献指南,评分为1。

有效结果9 / 13 · 3.5/5

输出可用性:提供结果表格和重放文件,便于使用,评分为2。边际价值:提供独立评估,对比不同Agent,具有价值,评分为2。成本效益:提供成本估算,显示低成本,评分为2。

证据核验4 / 8 · 2.5/5

声明可追溯性:提供结果文件和重放链接,但未提供原始数据,评分为2。跨来源佐证:提及Browser-Use的博客,但未提供其他独立来源,评分为1。事实与推断分离:区分了自报和LLM评估,但未明确区分事实和推断,评分为1。

风险与缓解建议
  • 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
  • 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
  • 仓库未提供许可证,使用前需确认法律风险。
  • 评估结果可能受环境因素影响(如IP地理位置),复现时需注意。
  • 依赖列表庞大且固定版本,可能存在安全漏洞,需定期更新。
证据充分度: 评估于 2026年8月9日 审查版本 50f8e472230c
查看完整评分方法 →

常见问题

这是一个能替我自动操作浏览器的智能体吗?
不是。给定资料将其描述为网页操作智能体的评测仓库;它运行并比较提供方的智能体配置,产出评测结果和回放文件。
评测一次需要多长时间和多少成本?
README 的设置为每任务最多 6 分钟或 20 步。WebVoyager30 以每任务 8 次尝试运行时,文中估算 Notte 配合 Gemini 和 Convergence Proxy-lite 为 0 美元,Browser-Use 配合 GPT-4o 约 20 美元。
为什么需要重复运行同一任务?
资料指出模型非确定性、网页内容变化、推理与执行错误及网络行为会造成高方差;因此该基准以 8 次尝试汇总,并用任务至少成功一次的比例表示可靠性。
可能遇到哪些失败因素?
文中记录了 Google CAPTCHA 和机器人检测会影响 Convergence,瑞士住宅 IP 触发的 Cookie 同意弹窗也会增加完成难度。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents