开发与工程 javascript-sdkdom-manipulationbrowser-automationchrome-extensionmcp-servertypescript

Page Agent

为网页嵌入可用自然语言操作界面的 GUI 智能体。

FollowAgents 评估 · FARS-2.1
不推荐
48/ 100 五分制 2.4 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全8 / 29 · 1.4/5

证据显示:项目在浏览器内运行,无需特殊权限,但未明确说明权限最小化原则;有用户确认机制(如确认对话框)但未详细说明;数据流透明度不足,未说明数据如何被处理;敏感数据处理未明确;依赖安全未提供审计信息;外部影响(如DOM操作)有说明但未深入;回滚机制未提及;来源归属有MIT许可证和致谢,但发布者未验证。扣分原因:缺乏具体实现细节和证据。

2可靠稳定8 / 14 · 2.9/5

证据显示:项目结构清晰,文档与代码一致;依赖通过npm管理,有CI流程;错误消息未详细说明。扣分原因:错误处理细节不足。

3适用触发10 / 18 · 2.8/5

证据显示:面向多种场景(SaaS、表单填充、无障碍等),能力边界有说明(如仅客户端),触发方式明确(自然语言),环境适配良好(支持多种模型)。扣分原因:触发精度未详细说明。

4规范维护10 / 18 · 2.8/5

证据显示:信息架构清晰,安装说明详细,命名稳定,有示例和FAQ,已知限制部分提及,许可证明确,版本号存在但无changelog,维护责任有说明。扣分原因:缺少changelog和已知限制的详细说明。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性高(自然语言指令),边际价值明显(简化交互),成本效益合理(无需后端)。扣分原因:缺乏实际运行验证。

6证据核验3 / 8 · 1.9/5

证据显示:部分声明有文档支持,但缺乏独立验证;事实与推断未明确区分。扣分原因:缺乏可追溯性和交叉验证。

证据充分度: 评估于 2026年8月9日 审查版本 632424befdf0
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • 发布者身份未验证,需谨慎对待。
  • 依赖安全未提供审计信息,建议检查依赖漏洞。
  • 数据流和敏感数据处理细节不足,需进一步审查。
  • 回滚机制未提及,操作可能不可逆。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Page Agent 是一个可嵌入任意网页的 JavaScript GUI 智能体库。开发者可通过一个脚本或 npm 包把 PageAgent 加入客户端网页,并用自然语言驱动页面操作。它以文本方式处理 DOM,不依赖截图、多模态模型或特殊权限。默认工作边界是客户端网页增强,而非服务端自动化;跨标签页任务可借助可选 Chrome 扩展,仓库还提供处于 Beta 阶段的 MCP Server。它支持自带模型,README 表示可接入主流模型及本地部署模型。

页面加载 Page Agent 后,应用可创建 new PageAgent(...),传入 modelbaseURLapiKey 和可选的 language。随后调用 await agent.execute('Click the login button'),由智能体基于页面 DOM 的文本表示执行相应界面操作。最快的试用方式是加载 page-agent.demo.js,它会自动创建演示智能体;在 URL 后加入 ?autoInit=false 可关闭自动初始化并自行实例化 window.PageAgent。可选 Chrome 扩展用于跨浏览器标签页任务,Beta MCP Server 用于让外部 MCP 客户端控制浏览器。

  1. SaaS 产品团队在现有 Web 应用中嵌入自然语言 Copilot,而不重写后端。
  2. ERP、CRM 或管理后台的用户用一句指令完成原本需要多次点击的表单流程。
  3. 需要语音命令或屏幕阅读器辅助的用户,以自然语言操作 Web 应用。
  4. 需要在多个浏览器标签页之间完成任务的用户,配合可选 Chrome 扩展使用。
  5. 使用 MCP 客户端的团队,通过 Beta MCP Server 控制浏览器。

这个 Agent 有哪些优点和局限?

优点
  • 直接在页面内运行,无需浏览器扩展、Python 或无头浏览器即可完成基础集成。
  • 采用文本式 DOM 操作,不要求截图、多模态 LLM 或特殊权限。
  • 既提供 npm API,也提供可直接嵌入的 IIFE 演示脚本。
  • 可通过 Chrome 扩展扩展到多标签页任务,并提供 Beta MCP Server 对接外部客户端。
局限
  • 明确定位为客户端网页增强,不是服务端自动化方案。
  • 自带模型接入需要应用配置模型服务地址、模型名和 API 密钥。
  • 演示 CDN 所用免费测试 LLM API 仅供技术评估,使用时须接受相应条款。
  • 跨页面任务依赖可选 Chrome 扩展;从外部控制浏览器的 MCP Server 仍为 Beta。

如何安装或部署这个 Agent?

安装包:npm install page-agent。在浏览器端代码中导入 PageAgent,并准备可访问的模型服务、模型名、baseURLapiKey。也可直接加载演示脚本:<script src="https://cdn.jsdelivr.net/npm/[email protected]/dist/iife/page-agent.demo.js" crossorigin="anonymous"></script>;该演示 API 仅供技术评估,并受其条款约束。

如何使用这个 Agent?

import { PageAgent } from 'page-agent'

const agent = new PageAgent({
  model: 'qwen3.5-plus',
  baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
  apiKey: 'YOUR_API_KEY',
  language: 'en-US',
})

await agent.execute('Click the login button')

这个 Agent 与同类方案有什么区别?

README 说明其 DOM 处理组件和提示词源自 browser-use,并对该项目的网页自动化与 DOM 交互模式表示致谢。

常见问题

Page Agent 是在服务器上运行的吗?
不是。README 明确将其定位为客户端网页增强,而非服务端自动化。
是否必须使用某一家模型供应商?
README 表示可以自带模型,并支持主流模型及本地部署模型;示例使用 qwen3.5-plus 和兼容模式 API 地址。
试用演示脚本需要什么?
加载指定 CDN 脚本即可自动初始化演示智能体,但其免费测试 LLM API 仅供技术评估并受条款约束。
能否处理多个浏览器标签页?
可以通过可选 Chrome 扩展支持多页面或跨标签页任务。
它依赖截图识别页面吗?
README 说明它进行文本式 DOM 操作,不使用截图或多模态 LLM。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents