AgentLab 网页智能体实验室

面向 BrowserGym 基准的网页智能体开发、评测与复现实验框架。

Star 数
★ 638
最近更新
2 个月前
License
NOASSERTION
主语言
Python

30 秒速览

可在哪里用
通用 · 跨平台OpenAI API
开始前需要
Python 3.11 or 3.12PlaywrightShell / 命令行网络访问本地文件系统
典型场景
网页智能体研究人员要在 MiniWoB 上比较多个 AgentArgs 配置和随机种子时,可用 Study 批量运行并汇总结果。
主要局限
项目明确不是消费级产品,使用者需要自行准备基准环境、模型凭据和实验运行条件。

这个 Agent 能做什么,适合哪些场景?

AgentLab 是用于开发、运行和评估网页智能体的研究框架,围绕 BrowserGym 支持的多种基准组织实验。它以 Study 和 make_study 为核心接口,可在 MiniWoB、WebArena、WorkArena、VisualWebArena、AssistantBench、OSWorld 等基准上执行实验。框架可通过 Ray 并行调度大量任务,并提供 OpenAI、Azure OpenAI、OpenRouter 及自托管 TGI 的统一 LLM API 路径。实验结果可用 ExpResult、load_result_df 和 AgentXray 查看,涵盖任务轨迹、截图、动作和汇总数据。该项目明确定位为加速网页智能体研究的框架,而非面向普通用户的消费级产品。

开发者先按对应基准的要求准备环境,再用 make_study(benchmark=..., agent_args=..., comment=...) 创建 Study,并通过 study.run(n_jobs=...) 执行任务。每个“一个智能体在一个任务上运行”的组合对应一个 job;Ray 后端可在超时后终止卡住的 job,并支持大规模并行。运行后可用 Study.load() 加载既有实验、find_incomplete(include_errors=True) 找出未完成或报错任务,并再次运行。分析时,inspect_results.load_result_df() 将实验摘要汇总为 dataframe;bgym.ExpResult 可读取单次实验的 screenshots 与 steps_info 中的 action。agentlab-xray 会以 Gradio 界面加载 AGENTLAB_EXP_ROOT 下的实验,按实验、智能体、任务和 seed 查看轨迹及步骤。

  1. 网页智能体研究人员要在 MiniWoB 上比较多个 AgentArgs 配置和随机种子时,可用 Study 批量运行并汇总结果。
  2. 评测团队要在 WebArena 或 VisualWebArena 上执行实验时,可利用 Ray 后端处理任务依赖并为超时任务设置自动终止。
  3. 开发者正在实现自定义 BrowserGym 智能体时,可参考 MostBasicAgent,并实现 AgentArgs API 与扩展的 bgym.AbstractAgentArgs。
  4. 需要排查某个网页任务失败原因的研究者,可在 AgentXray 中选择具体任务和 seed,查看截图、动作与 profiling 步骤。
  5. 希望复现实验结果的团队,可记录 Study 中的基准版本、包版本与 commit hash,并使用 ReproducibilityAgent 重跑相同任务种子上的动作。

如何安装或部署这个 Agent?

需要 Python 3.11 或 3.12。

pip install agentlab
playwright install

随后按所选基准的 setup 指引准备其运行环境。使用 OpenAI 模型时设置凭据;也可按需配置 OpenRouter 或 Azure OpenAI:

export AGENTLAB_EXP_ROOT=<实验结果目录>
export OPENAI_API_KEY=<你的 OpenAI API 密钥>

如何使用这个 Agent?

配置好默认 OpenAI 凭据后,可先启动网页助手:

agentlab-assistant --start_url https://www.google.com

运行第一个实验:

from agentlab.agents.generic_agent import AGENT_4o_MINI
from agentlab.experiments.study import make_study

study = make_study(
    benchmark="miniwob",
    agent_args=[AGENT_4o_MINI],
    comment="My first study",
)
study.run(n_jobs=5)

查看已运行或进行中的结果:

agentlab-xray

这个 Agent 有哪些优点和局限?

优点
  • 将 BrowserGym 支持的多种网页基准放入统一的 Study 工作流,避免为每个基准单独组织实验运行与结果结构。
  • Ray 后端针对大规模并行实验提供 job 超时终止机制,适合包含大量任务、种子或消融组合的研究。
  • 统一覆盖 OpenAI、Azure OpenAI、OpenRouter 和自托管 TGI 的 LLM API 路径。
  • 结果分析既有 dataframe 汇总和 ExpResult 的细粒度访问,也提供 AgentXray 的交互式轨迹查看。
  • Study 可保存基准版本、包版本和 commit hash,并提供 ReproducibilityAgent 辅助检查重跑差异。
局限
  • 项目明确不是消费级产品,使用者需要自行准备基准环境、模型凭据和实验运行条件。
  • 部分基准要求自托管服务、Docker、静态文件或 live web;不同部署方式带来额外环境维护工作。
  • WebArena 与 VisualWebArena 的任务状态可能相互影响;实例会在评测前自动重置,且当前不支持跨多个实例评测。
  • API 模型更新、动态网站、地区差异和随机性都会影响复现;temperature 设为 0 也只能减少大部分随机性。
  • AgentXray 依赖 Gradio,文档指出该界面可能出现异常显示,建议必要时刷新并重新选择实验。

这个 Agent 与同类方案有什么区别?

BrowserGym 是 AgentLab 所依赖的网页基准生态,而非独立替代品:BrowserGym 提供被支持的基准,AgentLab 则负责智能体配置、实验运行、并行执行、结果分析与复现记录。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
AgentLab 网页智能体实验室 当前 53 · 缺口较多 ★ 638 2 个月前 Python OpenAI API
BrowserGym 网页智能体实验场 54 · 缺口较多 ★ 1.4k 1 天前 Python OpenAI API
Open Operator Evals 29 · 缺口较多 ★ 47 1 年前 Python
CamoFox Browser Server 72 · 存在缺口 ★ 396 1 个月前 JavaScript Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
53/ 100 五分制 2.7 / 5
信任安全 10/29
可靠稳定 9/14
适用触发 10/18
规范维护 11/18
有效结果 9/13
证据核验 4/8
查看各维度的扣分理由
信任安全10 / 29 · 1.7/5

证据显示:框架设计为研究用途,明确警告非消费产品;使用环境变量管理API密钥,未硬编码;提供实验回放和结果分析功能,但未发现用户确认机制或敏感数据处理的明确说明。扣分:缺少用户确认机制,敏感数据处理说明不足,依赖安全未明确审计。

可靠稳定9 / 14 · 3.2/5

证据显示:有单元测试覆盖关键路径,错误处理有重试机制,但未发现故障消息的详细文档。扣分:故障消息文档不充分。

适用触发10 / 18 · 2.8/5

证据显示:面向研究人员,支持多种基准测试,提供多种配置选项,但触发精度(如任务依赖处理)说明有限。扣分:触发精度说明不足。

规范维护11 / 18 · 3.1/5

证据显示:README结构清晰,安装说明详细,命名稳定,有示例和FAQ,已知限制有提及,许可证明确,但版本变更日志缺失。扣分:版本变更日志缺失。

有效结果9 / 13 · 3.5/5

证据显示:输出结果可加载和分析,提供可视化工具,边际价值高(加速研究),成本效益合理(开源免费)。扣分:无显著扣分。

证据核验4 / 8 · 2.5/5

证据显示:README引用论文和基准,但未提供详细实验复现步骤,跨来源验证有限。扣分:跨来源验证不足,事实与推断分离不明确。

风险与缓解建议
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 框架明确警告非消费产品,使用时需谨慎。
  • API密钥通过环境变量管理,但需确保环境安全。
  • 依赖较多,需定期更新以保持安全。
证据充分度: 评估于 2026年8月9日 审查版本 cbc35a9bc0fa
查看完整评分方法 →

常见问题

运行 AgentLab 是否会产生模型费用?
会。网页助手按“自担成本和风险”提供;使用 OpenAI、OpenRouter 或 Azure OpenAI 模型时需要相应 API 凭据,费用取决于所用服务与实验规模。
可以不使用 OpenAI 吗?
可以。文档列出 OpenRouter、Azure OpenAI 和自托管 TGI 作为统一 LLM API 支持路径。
它能保证结果完全可复现吗?
不能。框架记录版本和 commit 信息并提供复现工具,但 API 模型变更、动态网站、地域差异及随机性仍可能造成差异。
任务卡住时怎么办?
Ray 并行后端可自动终止超过设定超时的 job;对于调试,文档建议使用 n_jobs=1 并通过 VSCode 断点检查。
仓库采用什么许可证?
提供的仓库元数据标注为 NOASSERTION,无法据此确认具体许可证条款。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents