数据与分析 web-scrapingweb-crawlingdata-extractionbrowser-automationplaywrightweb-searchstructured-apimcp

Maxun

用无代码机器人把网站转成结构化数据与 API。

FollowAgents 评估 · FARS-2.1
不推荐
48/ 100 五分制 2.4 / 5
1 2 3 4 5 6
1信任安全8 / 29 · 1.4/5

README披露了抓取、登录后提取、定时运行、API及Google Sheets/Airtable等外部集成,SECURITY.md也给出了负责任披露渠道;但现有材料未说明最小权限、操作前确认、凭据存储与日志脱敏、数据保留或各外部传输路径。依赖清单可见且有安全报告流程,但没有锁文件、审计结果或依赖更新政策证据,并包含外部URL tarball。仅数据库迁移脚本提供撤销命令,未见机器人运行或外部写入的回滚方案。项目、作者、贡献者入口和维护邮箱清楚,但发布者身份未获企业注册验证。

2可靠稳定5 / 14 · 1.8/5

README中的产品能力、package脚本和相关依赖大体一致,足以形成连贯的产品描述。依赖版本多使用宽松范围,依赖大量第三方包、托管服务和文档站点,并有直接CDN包,因此可用性保障证据有限。材料未展示面向用户的失败消息、重试、超时、降级或错误分类设计。

3适用触发12 / 18 · 3.3/5

材料明确覆盖无代码用户、开发者、AI工作流以及线索生成、市场研究和内容聚合等场景,并区分Extract、Scrape、Crawl、Search、SDK和CLI。能力分类较清楚,但“任何网站”、登录后提取和自动恢复等宽泛表述缺少适用边界。定时和CLI触发被提及,却没有触发条件、幂等性或冲突规则。Docker、本地运行、自托管和环境变量均有入口,但具体兼容矩阵与资源要求未包含在所给文件中。

4规范维护12 / 18 · 3.3/5

README结构清晰,提供生态、工作方式、快速开始、功能、演示、许可证和支持入口。安装、升级和环境配置主要链接到外部文档,当前证据中缺少完整步骤。核心术语总体稳定且有具体演示,但没有FAQ。已披露小团队的安全响应限制和无赏金计划,却未系统记录产品限制。AGPLv3-or-later在README、LICENSE和package元数据中充分一致。只有0.0.45版本与升级入口,未提供变更日志或发布政策。维护邮箱、贡献者与社区入口明确,但责任人、支持承诺和长期更新路径不完整。

5有效结果7 / 13 · 2.7/5

输出形态包括结构化数据、REST API、电子表格、Markdown、HTML和截图,且提供SDK、CLI与调度入口,普通使用的可消费性较好。将录制、AI提取、抓取、爬取和搜索统一在无代码平台中体现了明确增量价值。不过性能、准确率、规模、资源消耗和托管价格没有可核查数据,赞助商性能声明也不能证明本产品的成本收益。

6证据核验4 / 8 · 2.5/5

功能声明通常指向文档或演示,但所给材料没有这些目标页面内容、实现代码、测试或逐项证据映射,因此可追溯性有限。package中的Playwright、LLM SDK、Google API、Airtable、MCP及调度依赖对README部分能力构成交叉佐证,许可证也由三处一致支持。营销性表述如“可靠数据”“自动恢复”“任何网站”和“规模化”未与已证实事实或限制明确分开。

证据充分度: 评估于 2026年8月16日 审查版本 e3ddc31d6a8e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认
使用前请注意
  • 在处理登录态网站或个人数据前,应核实凭据加密、会话隔离、日志脱敏、数据保留和删除机制。
  • 定时机器人、API及电子表格集成会产生外部网络或写入效果;现有材料未证明逐次确认、幂等性或可恢复性。
  • 应审查完整锁文件和软件物料清单,尤其关注宽松版本范围及通过CDN URL获取的xlsx包。
  • “任何网站”“自动恢复”和规模化能力属于未经所给源文件充分验证的宣传性声明。
  • 商业部署或网络服务修改需评估AGPLv3-or-later的源代码提供义务。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Maxun 是一个开源的无代码 Web 数据平台,覆盖数据提取、整页抓取、站点爬取和网页搜索。它通过 Extract、Scrape、Crawl 和 Search 四类机器人处理网站,并可把执行流程保存为可复用的自动化任务。用户既能用 Recorder Mode 录制浏览操作,也能在 AI Mode 中用自然语言描述所需字段。输出包括结构化数据、Markdown、HTML、网页截图、RESTful API 以及 Google Sheets 或 Airtable 数据。项目还提供 SDK、CLI、定时运行、登录态页面提取、MCP 支持和网站布局变化后的自动恢复能力。它可直接使用托管版,也可通过 Docker Compose 或本地安装进行自托管,采用 AGPL-3.0 许可证。

Extract 机器人模拟真实用户行为并从网页采集结构化字段;Recorder Mode 把用户浏览时的操作记录成可复用机器人,AI Mode 则根据自然语言要求执行 LLM 驱动的提取。Scrape 读取完整网页并生成干净的 Markdown 或 HTML,也能保存截图。Crawl 在设定的范围和发现规则内遍历整个网站,从相关页面提取内容。Search 自动执行网页搜索、发现或抓取搜索结果,并支持按时间过滤。SDK 用于编程式执行提取、调度和机器人管理;CLI 可在终端创建机器人、触发运行并取回结果。运行结果还可通过 RESTful 端点发布为 API,或导出至 Google Sheets 与 Airtable。

  1. 销售或增长团队需要从网站批量收集潜在客户资料,并希望通过录制浏览操作建立无需编程的重复采集流程。
  2. 市场研究人员需要定期抓取商品、房源、评分或其他公开网页字段,并将结果整理成结构化数据。
  3. AI 应用开发者需要把网页转换成干净的 Markdown、HTML 或结构化内容,供代理、检索或文档处理流程使用。
  4. 数据团队需要在受控范围内爬取整个站点,并从所有相关页面汇集内容。
  5. 运营团队需要按计划运行机器人,并通过 RESTful API、Google Sheets 或 Airtable 分发采集结果。
  6. 需要登录后数据的团队希望让自动化流程处理身份验证并提取受登录保护的页面内容。

这个 Agent 有哪些优点和局限?

优点
  • 同一平台同时提供 Extract、Scrape、Crawl 和 Search,能够覆盖字段级提取、整页转换、全站发现和搜索结果采集。
  • Recorder Mode 与 AI Mode 提供两种建模方式,既可精确复现浏览操作,也可通过自然语言描述提取目标。
  • 支持托管服务、本地安装和 Docker 自托管,并提供 SDK、CLI、RESTful API 与 MCP 接入路径。
  • 可处理分页、滚动和登录态页面,并声称能在网站布局变化后自动恢复。
  • 可直接生成结构化数据、Markdown、HTML 和截图,并支持输出至 Google Sheets 与 Airtable。
局限
  • 所给材料没有列出本地运行所需的具体语言运行时、版本、服务依赖、环境变量或完整启动命令,部署前仍需查阅外部安装文档。
  • AI Mode 依赖 LLM 驱动的提取,但材料未说明支持哪些模型提供商、如何配置凭据、调用成本或数据发送边界。
  • 虽然提到自动适应网站布局变化,材料没有提供恢复成功条件、失败策略或准确率证据,关键流程仍需自行验证。
  • 登录态提取意味着系统可能处理敏感会话或凭据,但材料没有说明权限隔离、密钥存储或审计机制。
  • AGPL-3.0 对修改、部署和商业集成可能带来合规义务,采用前需要评估许可证影响。

如何安装或部署这个 Agent?

最快的入口是托管版 https://app.maxun.dev。项目也支持本地运行,README 列出两条安装路径:Docker Compose 安装和不使用 Docker 的本地安装,并另列环境变量配置;自托管章节提供 Docker 部署及两种安装方式对应的升级流程。源码材料没有给出可复制的 Docker Compose、包管理器或本地启动命令,也没有列出具体运行时版本、必填环境变量或凭据名称,因此无法据此提供准确的命令级安装步骤。SDK 位于 https://github.com/getmaxun/node-sdk。

如何使用这个 Agent?

在托管版或完成自托管后,根据目标选择机器人:用 Extract 的 Recorder Mode 录制浏览和字段选择操作,或用 AI Mode 以自然语言说明需要的数据;需要整页内容时选择 Scrape,需要遍历站点时选择 Crawl,需要自动检索网页时选择 Search。保存机器人后可直接触发或设置定时运行,并通过界面、SDK 或 CLI 取回结果;还可将结果暴露为 RESTful API,或导出到 Google Sheets 与 Airtable。CLI 明确支持创建机器人、触发运行和获取数据,但源码材料未提供具体命令语法、首次调用示例或认证变量名称。

常见问题

必须使用 Maxun 的托管服务吗?
不必。项目明确支持托管版、本地安装、Docker Compose 安装和 Docker 自托管。
能否抓取需要登录的网站?
可以。功能列表明确包含登录后提取和身份验证处理,但没有说明凭据保存、安全隔离或受支持认证方式的细节。
它能输出哪些格式?
材料明确列出结构化数据、Markdown、HTML 和网页截图;结果还可通过 RESTful API 提供,或导出到 Google Sheets 与 Airtable。
使用 AI Mode 需要哪一家模型服务?
材料只说明它使用 LLM 驱动的提取,没有列出受支持的模型提供商、凭据配置或费用,因此采用前需要进一步确认。
网站改版后机器人会怎样?
项目列出了针对网站布局变化的自动恢复能力,但没有给出保证范围、失败通知或恢复准确率;生产使用时应设置验证和监控。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents