Browser Use
让 AI 代理像用户一样打开网页、点击、输入并完成在线任务。
按维度查看评分与理由
证据显示:项目提供CLI和Python库,允许用户自定义工具和LLM,但未明确实现最小权限原则;用户确认机制缺失,没有看到任何用户确认步骤;数据流透明度有限,README提到遥测但未详细说明数据流向;敏感数据处理方面,README提到处理认证和CAPTCHA,但未说明如何保护敏感数据;依赖安全性方面,pyproject.toml固定了依赖版本,但未提供漏洞扫描或安全审计证据;外部影响方面,项目能自动执行浏览器操作,但未明确限制或警告;回滚机制未提及;来源归属方面,README和pyproject.toml提供了作者信息,但发布者未验证。扣分原因:缺少用户确认、回滚机制,数据流和敏感数据处理说明不足。
证据显示:项目内部一致性较好,README、pyproject.toml和测试文件相互对应;依赖可用性方面,依赖列表完整且固定版本,但未提供依赖可用性保证;失败消息方面,测试文件中有错误处理,但未提供用户友好的失败消息。扣分原因:失败消息设计未充分展示。
证据显示:README明确区分了CLI和Python库的使用场景,适合不同受众;能力边界方面,README说明了CLI和库的适用场景,但未明确限制;触发精度方面,CLI通过命令触发,但未详细说明触发条件;环境适配方面,pyproject.toml支持多平台,但未提供详细的系统要求。扣分原因:触发精度和系统要求说明不足。
证据显示:信息架构清晰,README结构良好;安装说明详细,提供了多种安装方式;命名稳定性方面,项目提供了多个CLI别名,但未说明命名稳定性;示例和FAQ丰富,提供了多个使用案例;已知限制方面,README提到生产环境的内存问题,但未全面列出;许可证为MIT,清晰;版本和变更日志方面,pyproject.toml有版本号,但未提供变更日志;维护责任方面,README提供了作者和社区链接。扣分原因:缺少变更日志和全面的已知限制。
证据显示:输出可用性方面,README展示了多种输出格式(如CSV、表格);边际价值方面,项目提供了独特的浏览器自动化能力;成本效益方面,README提到免费开源,但未提供详细的成本分析。扣分原因:成本效益分析不足。
证据显示:README中的声明(如基准测试)未提供具体数据来源;跨来源验证方面,README提到基准测试和排行榜,但未提供链接;事实与推断分离方面,README将事实和营销语言混合。扣分原因:声明缺乏可追溯性,事实与推断未清晰分离。
- 发布者身份未验证,需谨慎对待。
- 缺少用户确认机制,自动化操作可能带来风险。
- 数据流和敏感数据处理说明不足,需进一步审查。
- 依赖版本固定但未提供安全审计,需关注依赖漏洞。
这个 Agent 能做什么,适合哪些场景?
Browser Use 是一个用于网页自动化的 Python 库和命令行工具,核心接口包括 Agent、ChatBrowserUse 与 Tools。开发者向 Agent 提供任务文本和 LLM,随后通过 await agent.run() 执行浏览器任务并取得执行历史。README 展示了表单填写、结构化数据提取与本地网站 QA 等任务,并提供自定义工具扩展方式。它可在本机免费运行并允许选择 LLM;对于复杂或大规模场景,项目同时提供托管 Cloud Agent 与云端浏览器服务。CLI 面向已在使用 Codex 或 Claude Code 等代理的用户,Python 库面向需要在软件中嵌入可重复网页自动化的开发者。
使用者创建 Agent(task=..., llm=...),其中 task 是自然语言网页任务,llm 可为 ChatBrowserUse、ChatOpenAI 或 ChatAnthropic。Agent 会在浏览器中打开页面、点击按钮、输入内容并填写表单;示例任务包括用简历填写职位申请、提取关注者的结构化数据并导出 CSV、测试本地网站并报告缺陷、可用性问题和视觉不一致。执行时调用 await agent.run(),其结果保存为 history。若需要浏览器外能力,可创建 Tools(),用 @tools.action(description=...) 注册 Python 函数,再将 tools 传给 Agent。
- 求职者需要根据自己的简历和资料填写线上职位申请时,可将该任务交给浏览器代理执行。
- 运营或研究人员需要提取关注者的结构化信息并导出 CSV 时,可使用数据提取任务。
- 开发团队在发布前需要测试本地网站,并收集缺陷、可用性问题和视觉不一致时,可运行 QA 自动化任务。
- 正在构建定时或并行网页自动化的软件团队,可将 Python 库嵌入抓取、监控或 QA 工作流。
- 已使用 Codex 或 Claude Code 的个人,需要一次性完成网页操作,例如比较多台笔记本价格或上传视频时,可使用 CLI 工作流。
这个 Agent 有哪些优点和局限?
- 同一 Agent 接口覆盖网页打开、点击、输入和表单填写,并以自然语言 task 驱动执行。
- Python 库支持 ChatBrowserUse、ChatOpenAI 和 ChatAnthropic,并允许通过 Tools 和 @tools.action 添加自定义 Python 工具。
- 同时提供一次性任务的 CLI 路径与适合嵌入、调度或并行运行的 Python 库路径。
- 托管 Cloud Agent 提供代理轮换、验证码处理、持久化文件系统和内存等能力,README 还列出 1000 多项集成。
- 运行 Python 库需要 Python 3.11 以上以及可用的 LLM 提供商凭证;开源库免费,但模型服务可能产生费用。
- 在本机并行运行多个浏览器代理会消耗大量 Chrome 内存,README 明确指出这类生产部署较难管理。
- 验证码处理、浏览器指纹规避和代理轮换被指向 Cloud 服务,开源本地路径未在 README 中说明提供这些能力。
- README 将更复杂任务、更易扩展和生产级浏览器基础设施定位为托管 Cloud Agent 的优势,采用本地库可能需要自行承担这些运维工作。
如何安装或部署这个 Agent?
Python 库要求 Python 3.11 或更高版本。安装:
uv add browser-use或:
pip install browser-use在 .env 中配置至少一个可用的模型凭证,例如:
BROWSER_USE_API_KEY=your-key也可配置 GOOGLE_API_KEY 或 ANTHROPIC_API_KEY。若要让已有的 Codex、Claude Code 等代理使用浏览器能力,README 给出的设置提示包含:browser-use skill install。
如何使用这个 Agent?
创建并运行首个代理:
import asyncio
from browser_use import Agent, ChatBrowserUseasync def main():
agent = Agent(task="Find the number of stars of the browser-use repo",
llm=ChatBrowserUse(model="openai/gpt-5.5"),
)
history = await agent.run()if __name__ == "__main__":
asyncio.run(main())也可将 llm 替换为 ChatOpenAI 或 ChatAnthropic;使用 ChatBrowserUse 时,可传入带供应商前缀的模型标识,例如 anthropic/claude-sonnet-4-6、openai/gpt-5.5 或 google/gemini-3-pro。
这个 Agent 与同类方案有什么区别?
CLI 适合让已有的 Codex、Claude Code 等代理完成一次性浏览器任务;Python 库适合在代码中构建可重复的自动化、监控、抓取或 QA。开源 Agent 可在自己的机器上运行并允许深度定制;托管 Cloud Agent 被定位为更适合复杂任务和规模化运行的选项。