Open Operator Evals
用可复现的多次运行评估开源网页操作智能体。
- Star 数
- ★ 47
- 最近更新
- 1 年前
- 主语言
- Python
- FA 评分
- 29/100 · 缺口较多
30 秒速览
- 可在哪里用
- 兼容但需适配
- 开始前需要
- 典型场景
- 网页智能体团队在发布前,用 WebVoyager30 的多次运行检查成功率和单任务耗时是否稳定。
- 主要局限
- 资料只展示了 30 个任务、15 个网站的 WebVoyager30 子集,不能证明结果可代表完整约 600 任务数据集或其他网页场景。
这个 Agent 能做什么,适合哪些场景?
Open Operator Evals 是一个用于评估网页操作智能体的开源基准仓库,而不是面向终端用户执行网页任务的智能体产品。它以 WebVoyager30 为评测集:这是从约 600 个 WebVoyager 任务中抽取的 30 项任务,覆盖 15 个网站。仓库记录了 Notte、Browser-Use 和 Convergence 的多次运行结果,并用智能体自报成功率、GPT-4 LLM 评估、单任务耗时和任务可靠性进行比较。评测通过 Python 模块 `eval.run` 启动,结果按数据集、提供方、时间戳和任务目录分层保存,包含 JSON 结果和 `summary.webp` 回放摘要。适合需要审查网页智能体表现、复现给定评测配置或分析运行轨迹的工程与研究团队;它没有在给定资料中提供通用安装流程或把任意网页智能体接入基准的接口说明。
评测配置通过 configs/notte.headless.gemini 等文件提供,并可用 cat configs/notte.headless.gemini | uv run python -m eval.run 运行。基准让提供方在 WebVoyager30 的任务上执行;README 所述评测限制为每个任务最多 6 分钟或 20 步,并以 8 次尝试衡量波动。智能体返回成功状态和答案,评测同时汇总其自报状态,并使用 WebVoyager 的 GPT-4 评估提示词判定任务完成情况。输出目录采用 dataset/provider/timestamp/task_name 结构,单个任务目录可包含 results.json、results_no_screenshot.json 与 summary.webp,便于查看结果、无截图结果和回放摘要。
- 网页智能体团队在发布前,用 WebVoyager30 的多次运行检查成功率和单任务耗时是否稳定。
- 研究人员审查 Notte、Browser-Use 与 Convergence 在仓库所列版本和推理配置下的可验证评测记录。
- 负责智能体质量的工程师查看
results_no_screenshot.json和summary.webp,分析某一任务的失败轨迹。 - 需要处理网页智能体高方差问题的评测人员,以每项任务 8 次尝试和任务可靠性指标替代单次运行结论。
- 比较自报成功与 GPT-4 判定差异的团队,使用 Alignment 和 Mismatch 识别过度自信的执行结果。
如何安装或部署这个 Agent?
给定资料未说明克隆后的安装步骤、依赖锁定文件、环境变量或凭据配置,因此无法提供可验证的完整安装命令。资料明确给出的运行环境是 Python 3.11,并使用 uv;公开的首次调用示例为:cat configs/notte.headless.gemini | uv run python -m eval.run。不同提供方所需的访问凭据和配置项未在资料中说明。
如何使用这个 Agent?
在具备 Python 3.11、uv、网络访问和仓库文件写入能力的环境中,选择现有配置并运行:cat configs/notte.headless.gemini | uv run python -m eval.run。运行后,按 dataset/provider/timestamp/task_name 查找输出;查看 results.json 或 results_no_screenshot.json 获取结果,查看 summary.webp 审阅任务回放摘要。README 仅展示了 Notte 的具体命令,其他提供方配置的运行命令和凭据要求未明确记录。
这个 Agent 有哪些优点和局限?
- 采用 WebVoyager30 的 30 项任务和每任务 8 次尝试,明确针对网页智能体运行结果的高方差问题。
- 同时提供智能体自报、GPT-4 判定、耗时、可靠性、Alignment 和 Mismatch,能区分完成能力与自我评估偏差。
- 保留按任务组织的 JSON 结果和
summary.webp,可审查具体执行轨迹而不只依赖汇总分数。 - README 给出了 Notte、Browser-Use 和 Convergence 在指定版本或提交及推理配置下的逐次运行明细。
- 资料只展示了 30 个任务、15 个网站的 WebVoyager30 子集,不能证明结果可代表完整约 600 任务数据集或其他网页场景。
- 完整安装、依赖解析、密钥配置及新增提供方接入方式均未说明,复现和扩展需要自行补齐工程信息。
- 评测结果受不断变化的网页、非确定性模型、网络行为、Cookie 弹窗、CAPTCHA 与机器人检测影响。
- README 所列 Browser-Use 评测约需 20 美元,而该成本只对应 WebVoyager30、每任务 8 次尝试及文中指定的 GPT-4o 用量。
这个 Agent 与同类方案有什么区别?
仓库比较了三种已记录配置:Notte v1.3.3(gemini/gemini-2.0-flash)、Browser-Use v0.1.40(openai/gpt-4o)和 Convergence Proxy-lite 提交 a4389c5。在 README 汇总中,Notte 的 LLM Evaluation 为 79.0%、平均 47 秒;Browser-Use 为 60.2%、113 秒;Convergence 为 31.4%、83 秒。这些是该仓库的 WebVoyager30 多次运行结果,不代表所有版本、模型、网络环境或任务集。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Open Operator Evals 当前 | 29 · 缺口较多 | ★ 47 | 1 年前 | Python | — |
| Webwright 浏览器编程代理 | 66 · 存在缺口 | ★ 6k | 1 个月前 | Python | Codex · Claude Code · OpenAI API · Claude API |
| Chrome DevTools MCP | 79 · 存在缺口 | ★ 53k | 今天 | TypeScript | Codex · Claude Code |
| browser-control | 72 · 存在缺口 | ★ 3.1k | 28 天前 | Rust | — |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示仓库未提供任何权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均缺失,故评分为0。
自一致性:README中多次重复相同结果表格,但未提供原始数据或代码验证,仅部分支持。依赖可用性:requirements.txt固定版本,但未说明依赖的可用性或维护状态,仅部分支持。失败消息:未提供任何失败处理或错误消息的文档,评分为0。
受众与场景:明确面向研究者和开发者,提供基准测试场景,评分为2。能力边界:仅说明基准测试范围,未明确Agent的能力限制,评分为1。触发精度:未提供任何触发机制或精确指令,评分为0。环境适配:提及在Macbook M1和Python 3.11上运行,但未提供其他环境支持,评分为1。
信息架构:README结构清晰,包含表格、章节和链接,评分为2。安装说明:提供运行命令,但未提供完整安装步骤,评分为1。命名稳定性:版本号明确,但未说明命名约定,评分为1。示例与FAQ:提供示例任务和重放链接,但无FAQ,评分为2。已知限制:提及高方差和CAPTCHA问题,但未系统列出,评分为1。许可证:未提供许可证信息,评分为0。版本与变更日志:提及版本号,但无变更日志,评分为1。维护责任:未明确维护者或贡献指南,评分为1。
输出可用性:提供结果表格和重放文件,便于使用,评分为2。边际价值:提供独立评估,对比不同Agent,具有价值,评分为2。成本效益:提供成本估算,显示低成本,评分为2。
声明可追溯性:提供结果文件和重放链接,但未提供原始数据,评分为2。跨来源佐证:提及Browser-Use的博客,但未提供其他独立来源,评分为1。事实与推断分离:区分了自报和LLM评估,但未明确区分事实和推断,评分为1。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
- 仓库未提供许可证,使用前需确认法律风险。
- 评估结果可能受环境因素影响(如IP地理位置),复现时需注意。
- 依赖列表庞大且固定版本,可能存在安全漏洞,需定期更新。