Oxylabs Browser Agent
用自然语言执行多步骤网页操作并提取结构化结果。
这个 Agent 能做什么,适合哪些场景?
Browser Agent 是 Oxylabs AI Studio 提供的浏览器自动化工具,通过 Python SDK 中的 BrowserAgent 类调用。它以起始 URL 和用户提示为输入,可执行点击、输入、导航、滚动、等待及信息提取等多步骤浏览流程。调用方可选择 JSON、Markdown、HTML 或 PNG 截图输出;JSON 输出需要提供 OpenAPI schema。示例将结果从 result.data 读取,截图内容以 Base64 数据返回并可写入 PNG 文件。它适合希望减少静态选择器和手工浏览脚本的自动化场景,但使用依赖 Oxylabs AI Studio API 密钥与其服务环境。
应用先创建 BrowserAgent(api_key="<API_KEY>"),再调用 browser_agent.run(url=..., user_prompt=..., output_format=..., schema=..., geo_location=...)。其中 url 指定起始页面,user_prompt 用自然语言描述网页操作;文档也说明可使用由 click、type、navigate、wait、extract 组成的结构化步骤列表。Agent 可在页面中点击链接、填写表单、滚动、导航、等待并提取数据。若需要结构化 JSON,可先调用 browser_agent.generate_schema(prompt=...) 生成 schema,再在 run 中传入 schema;结果通过 result.data 获取。选择 output_format="screenshot" 时,返回内容可从 result.data.content["data"] Base64 解码为 PNG。
- 电商运营人员在商品站点搜索指定商品,并提取商品名称、平台、评分和价格。
- 测试人员在结账流程中加入商品、应用优惠券并确认页面流程是否可完成。
- 旅行服务团队在航班或酒店网站输入目的地、应用筛选条件并收集价格。
- 招聘研究人员搜索目标职位、进入职位详情页并提取招聘信息。
- 活动运营人员浏览票务网站,收集活动标题、日期与票价。
这个 Agent 有哪些优点和局限?
- 用自然语言描述多步骤浏览任务,文档明确将其定位为无需为每项操作编写静态规则或手工脚本的方式。
- 一个 BrowserAgent.run 调用可覆盖点击、输入、导航、滚动、等待和提取,并支持 JavaScript 渲染页面。
- 输出可选 JSON、Markdown、HTML 和 PNG;JSON 可结合 schema 获得结构化数据。
- 必须使用 Oxylabs AI Studio API key,核心使用路径绑定该产品与 oxylabs-ai-studio Python 包。
- 文档要求 Python 3.10 或更高版本,采用其他语言需转向另行提到的 JavaScript SDK 指南。
- JSON 输出必须提供 OpenAPI schema;需要额外生成或定义数据结构。
- 文档提示具备高级机器人检测的网站可能需要高级设置,未承诺对所有网站都可用。
如何安装或部署这个 Agent?
需要 Python 3.10 或更高版本,以及 Oxylabs AI Studio API key(可注册免费试用)。在终端运行:
pip install oxylabs-ai-studio
如何使用这个 Agent?
最小调用方式:
from oxylabs_ai_studio.apps.browser_agent import BrowserAgent
browser_agent = BrowserAgent(api_key="<API_KEY>")
result = browser_agent.run(
url="https://sandbox.oxylabs.io/",
user_prompt="Go to the website and take a screenshot of the home page",
output_format="screenshot",
)
如需 JSON,先用 browser_agent.generate_schema(prompt="...") 生成 schema,并在 run 中设置 output_format="json" 和 schema=schema。
这个 Agent 与同类方案有什么区别?
文档将其与 Puppeteer 和 Selenium 对比:后两者通常需要为每个动作编写选择器和脚本;Browser Agent 使用自然语言指令执行浏览任务。