自动化与运维 browser-automationchrome-extensionfirefox-extensionlocal-llmmcp-serverworkflow-automationwebgpuslash-commands

WebBrain

开源浏览器 AI 智能体:在侧边栏读取页面、点击输入、执行多步任务,模型可用本地 llama.cpp/Ollama 或任意云端 API。

FollowAgents 评估 · FARS-2.1
谨慎使用
65/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全16 / 29 · 2.8/5

证据显示最小权限与外部效应仅停留在文档声明层面:SECURITY.md 自述使用 <all_urls>、debugger、downloads、tabCapture 等大权限,且驱动已登录会话,这对浏览器代理有其必要性,但所提供的源文件中没有 manifest 或权限实现代码可核实其收敛性,故 least_privilege 与 external_effects 各记 1。用户确认方面证据较强:Ask/Act/Dev 模式分层、Act 前置计划审批、按站点授权请求,但存在 /dangerously-skip-permissions 旁路,记 2。数据流与敏感数据有 privacy-and-data-flow、security-model、trace isolation 等文档指向,属声明而非可静态核验的实现,记 2。依赖安全证据薄弱:仅有两个 devDependencies,无 lockfile 审计或依赖扫描证据,记 1。回滚仅有 Dev 模式'可逆编辑'的说法,记 1。署名充分:作者具名、BibTeX 引用、许可历史清晰,记 3。

2可靠稳定8 / 14 · 2.9/5

自一致性尚可:README 的 GPL≥33.0.0 与 package. 34.1.6、GPL-3.0 字段一致,但 registry 元数据为 NOASSERTION 存在轻微不一致,记 2。依赖可用性:npm ci 进 CI、devDeps 精简,记 2。失败消息证据薄弱:仅有停止按钮、继续按钮和重复尝试预算的提及,未见具体错误文案或降级行为的实现证据,记 1。

3适用触发15 / 18 · 4.2/5

受众与场景划分非常清晰:Ask/Act/Dev 三模式、compact/mid/full 工具分级适配小模型本地推理、大量示例提示词,记 3。能力边界是本项目最突出的优点:已知问题章节详细列出 Firefox 无 CDP 导致的 shadow DOM、可信鼠标事件、SPA 重注入等具体缺失,记 3。触发精度:slash 命令带参数、/watch 基线与去重逻辑描述具体,但多为文档断言,记 2。环境适配:Chrome/Firefox/Edge 三端、本地与云端 106 张供应商卡、16k 上下文最低要求明确,但 Firefox 明显降级,记 2。

4规范维护14 / 18 · 3.9/5

信息架构优秀:monorepo 目录说明、三语文档、按主题(架构、工具、安全、注入防御、隐私)组织的文档索引,记 3。安装说明完整覆盖商店安装与 Chrome/Firefox 源码加载的具体步骤及 Firefox 临时签名限制,记 3。已知限制详尽具体,记 3。许可证:LICENSE 内含完整 GPL-3.0 文本且解释了 MIT→GPL 的历史转变,但 registry 元数据 NOASSERTION 与此不完全对齐,记 2。版本管理有 bump/release 脚本与 CHANGELOG.md 引用但 changelog 内容未在证据中,格式带版本号(webbrain-config/1),记 2。维护责任具名([email protected])、响应时限明确、CONTRIBUTING 存在,记 2。示例丰富但无 FAQ,记 2。命名稳定一致,记 2。

5有效结果7 / 13 · 2.7/5

输出可用性较好:流式 Ask 回答、复制按钮、/export 导出对话与 trace、版本化导出格式,记 2。边际价值:浏览器代理赛道拥挤,但多供应商(106 卡)、本地 llama.cpp/Ollama 支持、LM Studio 独立插件与离线相关性基准构成一定差异化,记 2。成本收益证据薄弱:提到温度设定、token 感知压缩与步数上限(195/130),但无 token 消耗或成本量化的实测数据,记 1。

6证据核验5 / 8 · 3.1/5

主张可追溯性尚可:README 各声明均链接到具体文档(agent-tools、slash-commands、providers 等),记 2。跨源印证中等:package. 的 test:security 与 README 的注入防御语料、SECURITY.md 的披露范围相互印证,CI 工作流与声明一致,但测试实现本体未在证据中,记 2。事实与推断区分:文档明确标注注入防御的'已知极限'与 Firefox 功能差异,避免绝对化表述,记 2。

证据充分度: 评估于 2026年9月7日 审查版本 72d60c0b4812
使用前请注意
  • 静态审查:本评分仅基于仓库文件,未执行任何测试或运行验证,core 行为(授权弹窗、注入防御、数据流)均为文档断言,需自行核实 docs/security-model.md 与 docs/privacy-and-data-flow.md。
  • 该扩展申请 <all_urls>、debugger、downloads、tabCapture 等大权限并操作已登录会话,权限与其功能相称但仍属高风险面;不使用 /dangerously-skip-permissions 旁路,谨慎对待 Act/Dev 模式。
  • 发布者身份未经企业注册库验证,来源为个人维护者(Emre Sokullu),安装前请核对 Chrome/Firefox 商店签名与本仓库源码一致性。
  • registry 许可元数据为 NOASSERTION,而仓库为 GPL-3.0-or-later(33.0.0 起因打包 Xapian/libzim),合规使用前请自行确认许可边界。
  • Firefox 版本功能明显弱于 Chrome(无 shadow DOM 遍历、无 CDP 截图等),关键工作流请在 Chrome 上验证。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

WebBrain 是一个开源浏览器扩展(monorepo:webbrain-one/webbrain),在 Chrome、Firefox 和 Edge 的侧边面板中提供 AI 智能体,可读取当前页面并代你点击、输入、导航、上传和下载。它通过无障碍树而非脆弱的选择器读取页面,运行在用户自选的模型上:默认的 WebBrain Compass 1.0 无需配置,也可指向本地 llama.cpp、Ollama、vLLM 等任意 OpenAI 兼容服务器,或接入 OpenAI、Claude、Gemini、Bedrock 等 106 张内置云服务商卡片。仓库包含 Chrome(Manifest V3)与 Firefox(Manifest V2)两套构建、MCP 服务器、LM Studio 插件、中英法三语文档和 Node 测试套件。许可证为 GPL-3.0-or-later(33.0.0 起),由 Emre Sokullu 维护。

智能体在侧边面板接收自然语言指令,通过无障碍树读取页面文本、链接、表单、表格和 PDF,再以工具调用循环执行点击、输入、滚动、导航、上传、下载等操作,多步任务最多可配置 195 步(默认 130)。三种模式控制权限:Ask(只读)、Act(可操作页面)、Dev(额外暴露页面源码、控制台、网络与可回滚编辑)。Act/Dev 可先生成结构化计划供用户批准再执行,且在关键操作前弹出按站点的权限确认。支持 /schedule 定时任务、/watch 轮询页面、/teach 与 /workflow 保存可复用工作流、/memory 记忆偏好、/screenshot 截图等斜杠命令。模型侧通过 providers/manager.js 中的 BaseLLMProvider 子类统一为 { content, toolCalls, usage },并按 compact/mid/full 工具分层适配小参数本地模型;另提供 MCP 服务器(@webbrain/mcp-server,WebSocket 端口 17374)让 Claude Code 等编码智能体把浏览器任务委托给用户已登录的浏览器。

  1. 需要总结、问答或从当前标签页提取链接与表格内容的用户,使用只读的 Ask 模式即可完成,无需把页面内容复制给聊天机器人。
  2. 需要在已登录 SSO 的站点上自动填表、批量操作或抓取数据(如 Stripe 后台拉取失败付款列表)的用户——MCP 服务器让 Claude Code、Cursor 等复用浏览器会话中的 cookie。
  3. 在意隐私、无法使用云端 API 的用户,可将 WebBrain 指向本地 llama.cpp/Ollama/LM Studio 服务器(建议至少 16k 上下文窗口),全程离线运行。
  4. 需要定期盯页面变化(如新 commit 出现)并自动触发动作的用户,可用 /watch 每 30–120 秒轮询。
  5. 重复性多步网页流程的操作者,可用 /teach 演示录制并保存为可导出、可分享的工作流,之后一键重跑。
  6. 希望自定义模型接入的开发者,可继承 BaseLLMProvider 实现 chat() 并在 providers/manager.js 注册,同时镜像到 Chrome 和 Firefox 构建。

这个 Agent 有哪些优点和局限?

优点
  • 模型完全自主:默认 Compass 无需密钥,同时支持 106 张服务商卡片、本地 llama.cpp/Ollama/vLLM/LM Studio 及无端点的 WebGPU 选项,无供应商锁定。
  • 通过无障碍树而非脆弱的 CSS 选择器读取页面,对 React/Vue 等客户端渲染页面更稳健,并按 compact/mid/full 分层适配小参数本地模型。
  • 安全设计具体可审计:Act/Dev 先出计划待批准、关键操作前按站点弹权限确认、专门的提示注入防御与隐私文档,权限门控在智能体循环内。
  • 提供 MCP 服务器,可把浏览器任务委托给用户已登录的真实浏览器会话,绕开 headless 框架在登录墙前卡死的常见问题。
局限
  • Firefox 构建能力明显弱于 Chrome:无 chrome.debugger/CDP,缺少 shadow DOM 穿透、真实可信鼠标事件、SPA 导航感知重试和像素级截图,依赖这些功能的场景应选 Chromium。
  • 本地模型有实际门槛:上下文窗口至少 16k token(8k 仅限 Compact 档,4k 不够),否则对话会被过度压缩或失败。
  • 许可证从 33.0.0 起改为 GPL-3.0-or-later(因捆绑 Xapian/libzim WASM),商业集成需评估合规;更早版本为 MIT。
  • MCP 桥接为 Chromium 专属且扩展同一时间只持有一条桥接 socket(17373/17374/17375 三选一),多工具并发委托受限。

如何安装或部署这个 Agent?

方式一:从商店安装——Chrome Web Store、Firefox Add-ons 或 Edge Add-ons(README 提供直达链接)。方式二:从源码加载——git clone https://github.com/webbrain-one/webbrain.git 后,Chrome 打开 chrome://extensions/,开启开发者模式,点击“加载已解压的扩展程序”选择 webbrain/src/chrome 文件夹;Firefox 打开 about:debugging#/runtime/this-firefox,选择“临时载入附加组件”并指向 src/firefox/manifest.(临时加载重启后失效,永久安装需经 addons.mozilla.org 签名)。模型:默认 WebBrain Compass 1.0 无需任何密钥;本地模型启动任一 OpenAI 兼容服务器,如 llama-server -m your-model.gguf --port 8080 或 ollama serve(:11434/v1)。

如何使用这个 Agent?

点击工具栏 WebBrain 图标打开侧边面板,直接输入指令,如“总结这个页面”“把搜索框填入 AI agents 并点击搜索”“导航到 github.com 找热门仓库”。用 Ctrl+Shift+A/X/D(Mac 用 Cmd)切换 Ask/Act/Dev 模式,/help 查看全部命令签名;Escape 停止当前运行。模型在 Settings 中选择:可填本地服务器地址、选 106 张云服务商卡片之一,或用内置 WebGPU 选项(LFM2.5 2.6B 预设)。MCP 委托:运行 npx -y @webbrain/mcp-server,在 WebBrain → Settings → General → Advanced → MCP 填 ws://127.0.0.1:17374/extension 并启用(仅 Chromium)。LM Studio 插件:lms clone webbrain/web-tools。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents