Oxylabs Browser Agent
用自然语言执行多步骤网页操作并提取结构化结果。
- Star 数
- ★ 1.6k
- 最近更新
- 5 个月前
- FA 评分
- 27/100 · 缺口较多
30 秒速览
- 可在哪里用
- 平台专用
- 开始前需要
- 典型场景
- 电商运营人员在商品站点搜索指定商品,并提取商品名称、平台、评分和价格。
- 主要局限
- 必须使用 Oxylabs AI Studio API key,核心使用路径绑定该产品与 oxylabs-ai-studio Python 包。
这个 Agent 能做什么,适合哪些场景?
Browser Agent 是 Oxylabs AI Studio 提供的浏览器自动化工具,通过 Python SDK 中的 BrowserAgent 类调用。它以起始 URL 和用户提示为输入,可执行点击、输入、导航、滚动、等待及信息提取等多步骤浏览流程。调用方可选择 JSON、Markdown、HTML 或 PNG 截图输出;JSON 输出需要提供 OpenAPI schema。示例将结果从 result.data 读取,截图内容以 Base64 数据返回并可写入 PNG 文件。它适合希望减少静态选择器和手工浏览脚本的自动化场景,但使用依赖 Oxylabs AI Studio API 密钥与其服务环境。
应用先创建 BrowserAgent(api_key="<API_KEY>"),再调用 browser_agent.run(url=..., user_prompt=..., output_format=..., schema=..., geo_location=...)。其中 url 指定起始页面,user_prompt 用自然语言描述网页操作;文档也说明可使用由 click、type、navigate、wait、extract 组成的结构化步骤列表。Agent 可在页面中点击链接、填写表单、滚动、导航、等待并提取数据。若需要结构化 JSON,可先调用 browser_agent.generate_schema(prompt=...) 生成 schema,再在 run 中传入 schema;结果通过 result.data 获取。选择 output_format="screenshot" 时,返回内容可从 result.data.content["data"] Base64 解码为 PNG。
- 电商运营人员在商品站点搜索指定商品,并提取商品名称、平台、评分和价格。
- 测试人员在结账流程中加入商品、应用优惠券并确认页面流程是否可完成。
- 旅行服务团队在航班或酒店网站输入目的地、应用筛选条件并收集价格。
- 招聘研究人员搜索目标职位、进入职位详情页并提取招聘信息。
- 活动运营人员浏览票务网站,收集活动标题、日期与票价。
如何安装或部署这个 Agent?
需要 Python 3.10 或更高版本,以及 Oxylabs AI Studio API key(可注册免费试用)。在终端运行:
pip install oxylabs-ai-studio如何使用这个 Agent?
最小调用方式:
from oxylabs_ai_studio.apps.browser_agent import BrowserAgentbrowser_agent = BrowserAgent(api_key="<API_KEY>")
result = browser_agent.run(url="https://sandbox.oxylabs.io/",
user_prompt="Go to the website and take a screenshot of the home page",
output_format="screenshot",
)
如需 JSON,先用 browser_agent.generate_schema(prompt="...") 生成 schema,并在 run 中设置 output_format="json" 和 schema=schema。
这个 Agent 有哪些优点和局限?
- 用自然语言描述多步骤浏览任务,文档明确将其定位为无需为每项操作编写静态规则或手工脚本的方式。
- 一个 BrowserAgent.run 调用可覆盖点击、输入、导航、滚动、等待和提取,并支持 JavaScript 渲染页面。
- 输出可选 JSON、Markdown、HTML 和 PNG;JSON 可结合 schema 获得结构化数据。
- 必须使用 Oxylabs AI Studio API key,核心使用路径绑定该产品与 oxylabs-ai-studio Python 包。
- 文档要求 Python 3.10 或更高版本,采用其他语言需转向另行提到的 JavaScript SDK 指南。
- JSON 输出必须提供 OpenAPI schema;需要额外生成或定义数据结构。
- 文档提示具备高级机器人检测的网站可能需要高级设置,未承诺对所有网站都可用。
这个 Agent 与同类方案有什么区别?
文档将其与 Puppeteer 和 Selenium 对比:后两者通常需要为每个动作编写选择器和脚本;Browser Agent 使用自然语言指令执行浏览任务。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Oxylabs Browser Agent 当前 | 27 · 缺口较多 | ★ 1.6k | 5 个月前 | — | — |
| Browser Use | 47 · 缺口较多 | ★ 116k | 今天 | Python | Codex · Claude Code · OpenAI API · Claude API |
| Browser4 智能浏览器自动化 | 47 · 缺口较多 | ★ 1.1k | 6 天前 | Kotlin | OpenAI API |
| Flyto2 Core | 64 · 存在缺口 | ★ 481 | 2 天前 | Python | Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示仓库仅提供README,无代码、测试或配置文件。因此无法评估权限最小化、用户确认、数据流透明度、敏感数据处理、依赖安全、外部影响、回滚或来源归属。所有标准得0分,因为没有证据支持。
自一致性:README描述的功能与示例一致,但缺乏代码验证,得1分。依赖可用性:提及Python 3.10和pip安装,但未提供依赖列表或版本,得1分。失败消息:无错误处理或失败消息文档,得0分。
受众与场景:明确列出多种使用场景(电商、旅行、招聘等),得2分。能力边界:提及支持JavaScript和动态内容,但未明确限制,得1分。触发精度:自然语言提示和结构化步骤列表,但未详细说明,得1分。环境适配:要求Python 3.10,但未说明其他环境要求,得1分。
信息架构:README结构清晰,有标题、功能、安装、示例、FAQ,得2分。安装说明:提供pip安装命令,得2分。命名稳定性:包名和类名一致,但未提及版本,得1分。示例与FAQ:提供代码示例和FAQ,得2分。已知限制:提及高级机器人检测可能需要高级设置,但未全面,得1分。许可证:未提及,得0分。版本与变更日志:未提及,得0分。维护责任:提供支持邮箱和Discord,但未明确维护者,得1分。
输出可用性:支持多种输出格式(JSON、Markdown、HTML、截图),并提供示例,得2分。边际价值:与传统框架相比,强调自然语言控制,得2分。成本效益:提及免费试用和定价,但未详细分析,得1分。
声明可追溯性:README中的声明未提供证据或链接,得1分。跨来源佐证:仅依赖README,无其他来源,得0分。事实与推断分离:部分区分事实和推断,但不够明确,得1分。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
- 仓库仅包含README,无代码或测试,无法验证功能和安全声明。
- 未提供许可证信息,使用前需确认法律合规性。
- 依赖外部API和云服务,可能涉及数据隐私和成本问题。