BrowserAct Skills:AI 代理的真实浏览器自动化
为 AI 代理提供突破反爬、真实多会话隔离的浏览器自动化与数据提取能力。
证据显示:README 声称敏感操作(如浏览器创建/删除、Profile 导入、代理更改、安全和隐私开关)需要用户明确批准,且批准不延续,在 Skill 层强制执行。这支持 user_confirmation 得 2 分。但缺少具体实现细节,无法验证是否真正执行。least_privilege 得 1 分:README 提到权限最小化,但未提供具体机制。data_flow_transparency 得 1 分:README 提到数据流,但未详细说明。sensitive_data_handling 得 1 分:提到敏感操作,但未说明如何处理敏感数据。dependency_security 得 1 分:requirements.txt 仅列出 requests 和 python-dotenv,未提供版本锁定或安全审计。external_effects 得 1 分:README 提到外部效果(如代理、CAPTCHA),但未详细说明。rollback 得 0 分:未提及回滚机制。source_attribution 得 1 分:README 提到 BrowserAct 团队,但未验证。
self_consistency 得 2 分:README 内部一致,命令示例与描述相符。dependency_availability 得 1 分:依赖简单,但未提供版本锁定,可能影响可复现性。failure_messages 得 1 分:README 提到错误处理,但未提供具体错误消息示例。
audience_and_scenarios 得 2 分:README 明确目标用户(AI 代理)和场景(反爬、多任务、多账户)。capability_boundaries 得 2 分:README 区分了免费和付费功能,以及不同模式。trigger_precision 得 2 分:README 提供了具体命令和参数。environment_fit 得 2 分:README 列出兼容的 OS 和代理。
information_architecture 得 2 分:README 结构清晰,有目录。install_notes 得 2 分:README 提供安装说明。naming_stability 得 1 分:命令名称稳定,但未提供版本历史。examples_and_faq 得 2 分:README 提供多个示例。known_limitations 得 1 分:README 提到一些限制,但不全面。license 得 2 分:MIT 许可证文件存在。versioning_changelog 得 0 分:未提供版本号或变更日志。maintenance_responsibility 得 1 分:README 提到社区支持,但未明确维护责任。
output_usability 得 2 分:README 声称输出为紧凑文本格式,适合代理。marginal_value 得 2 分:提供独特功能(反爬、远程协助)。cost_benefit 得 2 分:免费功能丰富,付费功能明确。
claim_traceability 得 1 分:README 中的声明未提供证据。cross_source_corroboration 得 1 分:仅依赖 README,无其他来源。fact_inference_separation 得 1 分:README 混合事实和推断,未明确区分。
- README 中的安全声明(如用户确认)未在代码中验证,可能未实际执行。
- 依赖未锁定版本,可能引入供应链风险。
- 未提供版本号或变更日志,难以追踪更新。
- 发布者身份未验证,需谨慎对待。
这个 Agent 能做什么,适合哪些场景?
BrowserAct Skills 是一个浏览器自动化 CLI,专为 AI 代理设计,使其能够执行真实浏览器操作、数据提取和基于账户的工作流。它提供三层反检测机制(环境、执行、人工),支持 CAPTCHA 自动解决、远程人工接管以及多会话并行任务。支持云端托管和本地两种模式,兼容多种 AI 代理(如 Claude Code、Cursor、Codex、Gemini CLI)。其核心输出为索引化的紧凑文本,优化了 LLM 的令牌效率。项目采用 MIT 许可证,大部分功能免费,仅有部分高级功能(如托管代理、超过 5 个的隐身浏览器)需要付费。
BrowserAct Skills 通过名为 browser-act 的 CLI 提供浏览器自动化能力。核心命令包括:stealth-extract 提取受保护页面内容;browser-act --session <id> browser open 打开浏览器;state 显示可点击元素索引列表;click <index> 按索引点击;input <index> "text" 输入文本;solve-captcha 自动解决验证码;remote-assist 生成供人工接管的实时 URL。代理通过 browser-act get-skills core --skill-version 2.0.2 初始化会话,获取环境状态、浏览器列表和命令。支持 chrome 模式(复用本地 Chrome 登录状态)和 stealth 模式(隐私或固定身份)。支持跨浏览器并行、同浏览器多会话和隐私模式,零干扰并发。所有浏览器操作返回紧凑的文本格式,通过索引与元素交互。
- 数据提取者:需要从受反爬保护的网站提取数据,如产品价格、招聘信息等。
- 运营人员:管理多个社交媒体或电商账户,需要隔离每个账户的浏览器环境以防止关联。
- AI 开发者:在 Claude Code 或 Cursor 中集成浏览器自动化,使代理能执行真实的网页操作。
- 需要人工介入的场景:代理遇到验证码或复杂流程时,生成链接让用户从任何设备接管。
- 大规模数据采集:使用 Skill Forge 生成可复用的爬虫技能,定期采集同一网站的数据。
这个 Agent 有哪些优点和局限?
- 多层反检测机制(指纹、TLS 轮换、代理)能突破大多数反爬墙
- 支持多浏览器并行和多会话隔离,避免账户关联
- 针对 LLM 优化:紧凑文本输出、索引化交互、语义记忆,令牌效率高
- 安全确认门控:敏感操作需用户批准,增强安全性
- 与多种主流 AI 代理(Claude Code, Cursor, Codex 等)直接集成
- 高级功能(托管代理、超过 5 个隐身浏览器)需要付费,且部分需要登录
- 依赖外部云服务或本地网络,可能需要稳定的网络环境
- 隐身浏览器仅提供前 5 个免费,超出需订阅
- 文档中提到 'Skill Forge' 等扩展,但具体功能可能未充分验证
- 对本地 Chrome 登录状态的复用依赖于 CDP 或配置文件导入,可能有限制
如何安装或部署这个 Agent?
- 确保已安装 Node.js(版本要求未明确)。
- 让你的 AI 代理(如 Claude Code)安装技能:
> Install browser-act. Skill source: https://github.com/browser-act/skills/tree/main/browser-act . Verify it works after installation.
代理会执行相应命令下载并安装 CLI。
- 无需注册即可开始使用,但某些功能(如隐身浏览器)需要登录账户。
如何使用这个 Agent?
安装后,在你的 AI 代理会话中运行以下命令:
# 提取受保护页面内容(零配置)
browser-act stealth-extract https://example.com
# 启动浏览器并导航
browser-act --session my-task browser open <id> https://example.com
# 查看可交互元素
browser-act --session my-task state
# 按索引点击(例如点击第 3 个元素)
browser-act --session my-task click 3
# 在输入框输入文本
browser-act --session my-task input 2 "hi"启动新会话时,先运行 browser-act get-skills core 获取环境状态和命令。
这个 Agent 与同类方案有什么区别?
替代方案包括 Playwright 或 Puppeteer 等传统浏览器自动化库,但 BrowserAct 专门为 AI 代理设计,提供反检测和人工接管等独特功能。其他类似工具如 ScrapingBee 或 ScraperAPI 也提供代理解决方案,但可能不具备与 AI 代理的原生集成。
常见问题
使用 BrowserAct 需要什么成本?
如何解决验证码问题?
solve-captcha 命令可自动解决验证码。若自动解决失败,可使用 remote-assist 生成链接,让人类远程接管浏览器完成验证。是否支持本地浏览器?
chrome 模式复用本地 Chrome 的登录状态,通过配置文件导入或 CDP 附加。