AgentLab 网页智能体实验室
面向 BrowserGym 基准的网页智能体开发、评测与复现实验框架。
- Star 数
- ★ 638
- 最近更新
- 2 个月前
- License
- NOASSERTION
- 主语言
- Python
- FA 评分
- 53/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台OpenAI API
- 开始前需要
- 典型场景
- 网页智能体研究人员要在 MiniWoB 上比较多个 AgentArgs 配置和随机种子时,可用 Study 批量运行并汇总结果。
- 主要局限
- 项目明确不是消费级产品,使用者需要自行准备基准环境、模型凭据和实验运行条件。
这个 Agent 能做什么,适合哪些场景?
AgentLab 是用于开发、运行和评估网页智能体的研究框架,围绕 BrowserGym 支持的多种基准组织实验。它以 Study 和 make_study 为核心接口,可在 MiniWoB、WebArena、WorkArena、VisualWebArena、AssistantBench、OSWorld 等基准上执行实验。框架可通过 Ray 并行调度大量任务,并提供 OpenAI、Azure OpenAI、OpenRouter 及自托管 TGI 的统一 LLM API 路径。实验结果可用 ExpResult、load_result_df 和 AgentXray 查看,涵盖任务轨迹、截图、动作和汇总数据。该项目明确定位为加速网页智能体研究的框架,而非面向普通用户的消费级产品。
开发者先按对应基准的要求准备环境,再用 make_study(benchmark=..., agent_args=..., comment=...) 创建 Study,并通过 study.run(n_jobs=...) 执行任务。每个“一个智能体在一个任务上运行”的组合对应一个 job;Ray 后端可在超时后终止卡住的 job,并支持大规模并行。运行后可用 Study.load() 加载既有实验、find_incomplete(include_errors=True) 找出未完成或报错任务,并再次运行。分析时,inspect_results.load_result_df() 将实验摘要汇总为 dataframe;bgym.ExpResult 可读取单次实验的 screenshots 与 steps_info 中的 action。agentlab-xray 会以 Gradio 界面加载 AGENTLAB_EXP_ROOT 下的实验,按实验、智能体、任务和 seed 查看轨迹及步骤。
- 网页智能体研究人员要在 MiniWoB 上比较多个 AgentArgs 配置和随机种子时,可用 Study 批量运行并汇总结果。
- 评测团队要在 WebArena 或 VisualWebArena 上执行实验时,可利用 Ray 后端处理任务依赖并为超时任务设置自动终止。
- 开发者正在实现自定义 BrowserGym 智能体时,可参考 MostBasicAgent,并实现 AgentArgs API 与扩展的 bgym.AbstractAgentArgs。
- 需要排查某个网页任务失败原因的研究者,可在 AgentXray 中选择具体任务和 seed,查看截图、动作与 profiling 步骤。
- 希望复现实验结果的团队,可记录 Study 中的基准版本、包版本与 commit hash,并使用 ReproducibilityAgent 重跑相同任务种子上的动作。
如何安装或部署这个 Agent?
需要 Python 3.11 或 3.12。
pip install agentlab
playwright install随后按所选基准的 setup 指引准备其运行环境。使用 OpenAI 模型时设置凭据;也可按需配置 OpenRouter 或 Azure OpenAI:
export AGENTLAB_EXP_ROOT=<实验结果目录>
export OPENAI_API_KEY=<你的 OpenAI API 密钥>如何使用这个 Agent?
配置好默认 OpenAI 凭据后,可先启动网页助手:
agentlab-assistant --start_url https://www.google.com运行第一个实验:
from agentlab.agents.generic_agent import AGENT_4o_MINI
from agentlab.experiments.study import make_study
study = make_study(
benchmark="miniwob",
agent_args=[AGENT_4o_MINI],
comment="My first study",
)
study.run(n_jobs=5)查看已运行或进行中的结果:
agentlab-xray这个 Agent 有哪些优点和局限?
- 将 BrowserGym 支持的多种网页基准放入统一的 Study 工作流,避免为每个基准单独组织实验运行与结果结构。
- Ray 后端针对大规模并行实验提供 job 超时终止机制,适合包含大量任务、种子或消融组合的研究。
- 统一覆盖 OpenAI、Azure OpenAI、OpenRouter 和自托管 TGI 的 LLM API 路径。
- 结果分析既有 dataframe 汇总和 ExpResult 的细粒度访问,也提供 AgentXray 的交互式轨迹查看。
- Study 可保存基准版本、包版本和 commit hash,并提供 ReproducibilityAgent 辅助检查重跑差异。
- 项目明确不是消费级产品,使用者需要自行准备基准环境、模型凭据和实验运行条件。
- 部分基准要求自托管服务、Docker、静态文件或 live web;不同部署方式带来额外环境维护工作。
- WebArena 与 VisualWebArena 的任务状态可能相互影响;实例会在评测前自动重置,且当前不支持跨多个实例评测。
- API 模型更新、动态网站、地区差异和随机性都会影响复现;temperature 设为 0 也只能减少大部分随机性。
- AgentXray 依赖 Gradio,文档指出该界面可能出现异常显示,建议必要时刷新并重新选择实验。
这个 Agent 与同类方案有什么区别?
BrowserGym 是 AgentLab 所依赖的网页基准生态,而非独立替代品:BrowserGym 提供被支持的基准,AgentLab 则负责智能体配置、实验运行、并行执行、结果分析与复现记录。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| AgentLab 网页智能体实验室 当前 | 53 · 缺口较多 | ★ 638 | 2 个月前 | Python | OpenAI API |
| BrowserGym 网页智能体实验场 | 54 · 缺口较多 | ★ 1.4k | 1 天前 | Python | OpenAI API |
| Open Operator Evals | 29 · 缺口较多 | ★ 47 | 1 年前 | Python | — |
| CamoFox Browser Server | 72 · 存在缺口 | ★ 396 | 1 个月前 | JavaScript | Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:框架设计为研究用途,明确警告非消费产品;使用环境变量管理API密钥,未硬编码;提供实验回放和结果分析功能,但未发现用户确认机制或敏感数据处理的明确说明。扣分:缺少用户确认机制,敏感数据处理说明不足,依赖安全未明确审计。
证据显示:有单元测试覆盖关键路径,错误处理有重试机制,但未发现故障消息的详细文档。扣分:故障消息文档不充分。
证据显示:面向研究人员,支持多种基准测试,提供多种配置选项,但触发精度(如任务依赖处理)说明有限。扣分:触发精度说明不足。
证据显示:README结构清晰,安装说明详细,命名稳定,有示例和FAQ,已知限制有提及,许可证明确,但版本变更日志缺失。扣分:版本变更日志缺失。
证据显示:输出结果可加载和分析,提供可视化工具,边际价值高(加速研究),成本效益合理(开源免费)。扣分:无显著扣分。
证据显示:README引用论文和基准,但未提供详细实验复现步骤,跨来源验证有限。扣分:跨来源验证不足,事实与推断分离不明确。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 框架明确警告非消费产品,使用时需谨慎。
- API密钥通过环境变量管理,但需确保环境安全。
- 依赖较多,需定期更新以保持安全。