自动化与运维 browser-automationweb-form-fillingdata-extractionqa-automationplaywrightpython

Browser Use

让 AI 代理像用户一样打开网页、点击、输入并完成在线任务。

FollowAgents 评估 · FARS-2.1
不推荐
47/ 100 五分制 2.4 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全7 / 29 · 1.2/5

证据显示:项目提供CLI和Python库,允许用户自定义工具和LLM,但未明确实现最小权限原则;用户确认机制缺失,没有看到任何用户确认步骤;数据流透明度有限,README提到遥测但未详细说明数据流向;敏感数据处理方面,README提到处理认证和CAPTCHA,但未说明如何保护敏感数据;依赖安全性方面,pyproject.toml固定了依赖版本,但未提供漏洞扫描或安全审计证据;外部影响方面,项目能自动执行浏览器操作,但未明确限制或警告;回滚机制未提及;来源归属方面,README和pyproject.toml提供了作者信息,但发布者未验证。扣分原因:缺少用户确认、回滚机制,数据流和敏感数据处理说明不足。

2可靠稳定8 / 14 · 2.9/5

证据显示:项目内部一致性较好,README、pyproject.toml和测试文件相互对应;依赖可用性方面,依赖列表完整且固定版本,但未提供依赖可用性保证;失败消息方面,测试文件中有错误处理,但未提供用户友好的失败消息。扣分原因:失败消息设计未充分展示。

3适用触发10 / 18 · 2.8/5

证据显示:README明确区分了CLI和Python库的使用场景,适合不同受众;能力边界方面,README说明了CLI和库的适用场景,但未明确限制;触发精度方面,CLI通过命令触发,但未详细说明触发条件;环境适配方面,pyproject.toml支持多平台,但未提供详细的系统要求。扣分原因:触发精度和系统要求说明不足。

4规范维护10 / 18 · 2.8/5

证据显示:信息架构清晰,README结构良好;安装说明详细,提供了多种安装方式;命名稳定性方面,项目提供了多个CLI别名,但未说明命名稳定性;示例和FAQ丰富,提供了多个使用案例;已知限制方面,README提到生产环境的内存问题,但未全面列出;许可证为MIT,清晰;版本和变更日志方面,pyproject.toml有版本号,但未提供变更日志;维护责任方面,README提供了作者和社区链接。扣分原因:缺少变更日志和全面的已知限制。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性方面,README展示了多种输出格式(如CSV、表格);边际价值方面,项目提供了独特的浏览器自动化能力;成本效益方面,README提到免费开源,但未提供详细的成本分析。扣分原因:成本效益分析不足。

6证据核验3 / 8 · 1.9/5

证据显示:README中的声明(如基准测试)未提供具体数据来源;跨来源验证方面,README提到基准测试和排行榜,但未提供链接;事实与推断分离方面,README将事实和营销语言混合。扣分原因:声明缺乏可追溯性,事实与推断未清晰分离。

证据充分度: 评估于 2026年8月9日 审查版本 32601887cfbc
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:执行前用户确认、回滚或恢复路径
使用前请注意
  • 发布者身份未验证,需谨慎对待。
  • 缺少用户确认机制,自动化操作可能带来风险。
  • 数据流和敏感数据处理说明不足,需进一步审查。
  • 依赖版本固定但未提供安全审计,需关注依赖漏洞。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Browser Use 是一个用于网页自动化的 Python 库和命令行工具,核心接口包括 Agent、ChatBrowserUse 与 Tools。开发者向 Agent 提供任务文本和 LLM,随后通过 await agent.run() 执行浏览器任务并取得执行历史。README 展示了表单填写、结构化数据提取与本地网站 QA 等任务,并提供自定义工具扩展方式。它可在本机免费运行并允许选择 LLM;对于复杂或大规模场景,项目同时提供托管 Cloud Agent 与云端浏览器服务。CLI 面向已在使用 Codex 或 Claude Code 等代理的用户,Python 库面向需要在软件中嵌入可重复网页自动化的开发者。

使用者创建 Agent(task=..., llm=...),其中 task 是自然语言网页任务,llm 可为 ChatBrowserUse、ChatOpenAI 或 ChatAnthropic。Agent 会在浏览器中打开页面、点击按钮、输入内容并填写表单;示例任务包括用简历填写职位申请、提取关注者的结构化数据并导出 CSV、测试本地网站并报告缺陷、可用性问题和视觉不一致。执行时调用 await agent.run(),其结果保存为 history。若需要浏览器外能力,可创建 Tools(),用 @tools.action(description=...) 注册 Python 函数,再将 tools 传给 Agent。

  1. 求职者需要根据自己的简历和资料填写线上职位申请时,可将该任务交给浏览器代理执行。
  2. 运营或研究人员需要提取关注者的结构化信息并导出 CSV 时,可使用数据提取任务。
  3. 开发团队在发布前需要测试本地网站,并收集缺陷、可用性问题和视觉不一致时,可运行 QA 自动化任务。
  4. 正在构建定时或并行网页自动化的软件团队,可将 Python 库嵌入抓取、监控或 QA 工作流。
  5. 已使用 Codex 或 Claude Code 的个人,需要一次性完成网页操作,例如比较多台笔记本价格或上传视频时,可使用 CLI 工作流。

这个 Agent 有哪些优点和局限?

优点
  • 同一 Agent 接口覆盖网页打开、点击、输入和表单填写,并以自然语言 task 驱动执行。
  • Python 库支持 ChatBrowserUse、ChatOpenAI 和 ChatAnthropic,并允许通过 Tools 和 @tools.action 添加自定义 Python 工具。
  • 同时提供一次性任务的 CLI 路径与适合嵌入、调度或并行运行的 Python 库路径。
  • 托管 Cloud Agent 提供代理轮换、验证码处理、持久化文件系统和内存等能力,README 还列出 1000 多项集成。
局限
  • 运行 Python 库需要 Python 3.11 以上以及可用的 LLM 提供商凭证;开源库免费,但模型服务可能产生费用。
  • 在本机并行运行多个浏览器代理会消耗大量 Chrome 内存,README 明确指出这类生产部署较难管理。
  • 验证码处理、浏览器指纹规避和代理轮换被指向 Cloud 服务,开源本地路径未在 README 中说明提供这些能力。
  • README 将更复杂任务、更易扩展和生产级浏览器基础设施定位为托管 Cloud Agent 的优势,采用本地库可能需要自行承担这些运维工作。

如何安装或部署这个 Agent?

Python 库要求 Python 3.11 或更高版本。安装:

uv add browser-use

或:

pip install browser-use

在 .env 中配置至少一个可用的模型凭证,例如:

BROWSER_USE_API_KEY=your-key

也可配置 GOOGLE_API_KEY 或 ANTHROPIC_API_KEY。若要让已有的 Codex、Claude Code 等代理使用浏览器能力,README 给出的设置提示包含:browser-use skill install。

如何使用这个 Agent?

创建并运行首个代理:

import asyncio
from browser_use import Agent, ChatBrowserUse

async def main():

agent = Agent(

task="Find the number of stars of the browser-use repo",
llm=ChatBrowserUse(model="openai/gpt-5.5"),
)

history = await agent.run()

if __name__ == "__main__":

asyncio.run(main())

也可将 llm 替换为 ChatOpenAI 或 ChatAnthropic;使用 ChatBrowserUse 时,可传入带供应商前缀的模型标识,例如 anthropic/claude-sonnet-4-6、openai/gpt-5.5 或 google/gemini-3-pro。

这个 Agent 与同类方案有什么区别?

CLI 适合让已有的 Codex、Claude Code 等代理完成一次性浏览器任务;Python 库适合在代码中构建可重复的自动化、监控、抓取或 QA。开源 Agent 可在自己的机器上运行并允许深度定制;托管 Cloud Agent 被定位为更适合复杂任务和规模化运行的选项。

常见问题

可以免费使用吗?
可以。开源 Browser Use 可免费使用,但仍需选择 LLM 提供商,例如 OpenAI、Google、ChatBrowserUse 或本地 Ollama。
需要哪个模型或密钥?
示例使用 ChatBrowserUse 和 BROWSER_USE_API_KEY,也展示了 ChatOpenAI、ChatAnthropic,以及 Google 和 Anthropic 的环境变量选项。
CLI 与 Python 库该如何选择?
已有 Codex 或 Claude Code 等代理并希望完成一次性网页任务时使用 CLI;需要在产品或定时、并行工作流中重复执行时使用 Python 库。
如何处理登录和验证码?
README 提供复用真实 Chrome 用户配置文件以保留登录状态的示例。验证码、代理和更强浏览器指纹能力被指向 Browser Use Cloud。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents