数据与分析 document-aipdf-extractionstructured-outputetl-pipelineprompt-studiomcp-serverdjangoreact

Unstract 非结构化数据提取平台

用 LLM 将 PDF、图片等非结构化文档转化为结构化 JSON,可部署为 API 或 ETL 流水线。

FollowAgents 评估 · FARS-2.1
不推荐
44/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全8 / 29 · 1.4/5

证据显示:README 提到加密密钥用于加密适配器凭据,测试验证了元数据加密存储(adapter_metadata_b),表明对敏感数据处理有基本考虑。但缺少用户确认机制、数据流透明性描述有限、依赖安全仅通过 CI 和 lint 间接体现,外部影响(如 Posthog 分析)有提及但未深入,回滚机制未提及,来源归属仅通过 README 中的 Zipstack 品牌,但发布者未验证。扣分原因:用户确认缺失,数据流透明性不足,依赖安全证据薄弱,外部影响描述不完整,回滚缺失,来源归属仅基于品牌。

2可靠稳定6 / 14 · 2.1/5

证据显示:项目有详细的 CI 测试流程(单元、集成、端到端),测试文件覆盖关键路径,表明内部一致性较好。但依赖可用性仅通过 Docker 镜像和外部服务(如 LLM 提供商)间接体现,失败消息未在文档中明确说明。扣分原因:依赖可用性证据不足,失败消息文档缺失。

3适用触发10 / 18 · 2.8/5

证据显示:README 明确目标受众(金融、保险、医疗等),提供多种部署方式(本地、Docker、云),支持多种 LLM 提供商和向量数据库,环境适配良好。但触发精度(如 API 端点、ETL 触发条件)未详细说明,能力边界(如支持的文档类型、限制)部分提及但不完整。扣分原因:触发精度描述不足,能力边界不完整。

4规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,提供安装说明(run-platform.sh),有示例和 cookbook,许可证为 AGPL-3.0,维护责任通过贡献指南和社区渠道体现。但命名稳定性未明确,已知限制未单独列出,版本变更日志未提供。扣分原因:命名稳定性未说明,已知限制缺失,版本变更日志缺失。

5有效结果7 / 13 · 2.7/5

证据显示:输出为结构化 JSON,可直接用于数据库,边际价值通过对比表体现,但成本效益未量化,仅提及企业版功能。扣分原因:成本效益缺乏具体数据。

6证据核验3 / 8 · 1.9/5

证据显示:README 中的声明(如支持格式、提供商)有文档链接,但未提供独立验证来源,事实与推断未明确区分。扣分原因:声明可追溯性有限,交叉验证不足,事实与推断分离不清晰。

证据充分度: 评估于 2026年8月11日 审查版本 6b916eac0f42
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:执行前用户确认、回滚或恢复路径
使用前请注意
  • 发布者身份未验证,应谨慎对待品牌声明。
  • 默认凭据(用户名/密码 unstract/unstract)存在安全风险,部署后应立即更改。
  • Posthog 分析默认启用,需确认是否符合隐私要求。
  • 加密密钥管理不当可能导致适配器凭据丢失。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Unstract 是一个开源平台,利用 LLM 从文档中提取结构化 JSON。它提供 Prompt Studio 用自然语言定义提取模式,支持通过 REST API 部署,也能作为 ETL 流水线处理文件夹中的文档并加载到数据仓库。平台包含 React 前端、Django 后端、Celery 工作进程和 FastAPI 平台服务,依赖 PostgreSQL、Redis 和 RabbitMQ。它内置多种 LLM、向量数据库和文本提取器适配器(如 OpenAI、Anthropic、Qdrant、LLMWhisperer),并支持 MCP 服务器和 n8n 节点集成。采用 AGPL-3.0 许可证,可通过 Docker 快速部署。

Unstract 通过一个完整的平台执行文档提取:用户通过前端 Prompt Studio 用自然语言定义提取模式(如字段、格式);系统调用所选 LLM 处理器(OpenAI、Anthropic、Bedrock 等)对上传的 PDF、图片等文件进行解析;提取结果以 JSON 格式返回。部署方式包括 API 部署(通过 REST API 发送文档,返回 JSON)和 ETL 流水线(从 AWS S3、SFTP 等源拉取文档,处理后加载到 Snowflake、BigQuery 等目的地)。还提供 MCP 服务器供 Claude 等 AI 代理连接,以及 n8n 节点用于自动化流程。后端组件包括 Django API、Celery worker 和 FastAPI 平台服务,并支持文本提取器(如 LLMWhisperer、Unstructured.io)进行 OCR 和文本预处理。

  1. 金融团队自动从发票、银行对账单中提取数据到数据库。
  2. 保险理赔部门从 PDF 理赔单中提取结构化信息。
  3. 医疗机构处理患者表格和医疗记录。
  4. KYC/合规人员从证件中提取身份信息。
  5. 数据工程师构建 ETL 流水线,将大量非结构化文件导入数据仓库。
  6. AI 开发者通过 MCP 服务器让 Claude 等助手直接读取文档并结构化输出。

这个 Agent 有哪些优点和局限?

优点
  • 无代码提取模式定义,通过 Prompt Studio 用自然语言即可创建,降低开发成本。
  • 支持多 LLM 提供商(OpenAI、Anthropic、Bedrock、Ollama 等),可自由切换,避免供应商锁定。
  • 提供 API、ETL、MCP Server、n8n 节点多种部署集成方式,灵活适配不同工作流。
  • 支持多种文档格式(PDF、DOCX、图片、表格等),覆盖常见非结构化数据。
  • 可自托管,通过 Docker 一键部署,数据隐私可控。
局限
  • 依赖 Docker 环境和至少 8GB 内存,资源需求较高。
  • 默认凭据(unstract/unstract)存在安全风险,需及时修改。
  • 部分高级功能(如人类审查、SSO)为商业版功能,开源版可能限制。
  • LLM API 调用会产生 token 成本,且大规模处理可能增加费用。
  • 社区和支持依赖开源社区,相比商业产品可能缺少保障。

如何安装或部署这个 Agent?

  1. 系统要求:Linux 或 macOS,Docker 和 Docker Compose,至少 8GB 内存,Git。
  2. 克隆仓库并启动:
git clone https://github.com/Zipstack/unstract.git
cd unstract
./run-platform.sh
  1. 访问 http://frontend.unstract.localhost,使用默认账号 unstract / unstract 登录。

可通过脚本参数指定版本、构建镜像、更新等,例如 ./run-platform.sh -v v0.1.0-u 升级。

如何使用这个 Agent?

  1. 登录后,使用 Prompt Studio 创建提取项目,用自然语言定义要提取的字段和格式。
  2. 在 API Deployment 中,通过 REST API 发送文档,接收 JSON 响应。
  3. 或配置 ETL Pipeline,设置源和目标(如 S3 到 Snowflake),自动处理文档。
  4. 可选:配置 MCP 服务器,让 AI 代理通过模型上下文协议调用;或集成 n8n 节点到自动化工作流。
  5. 适配器配置:在平台设置中配置 LLM 提供商(如 OpenAI)和向量数据库。

常见问题

Unstract 支持哪些 LLM 提供商?
支持 OpenAI、Azure OpenAI、Anthropic Claude、Google Gemini、AWS Bedrock、Ollama 等,可通过适配器配置。
部署 Unstract 需要什么硬件?
至少 8GB 内存,Docker 和 Docker Compose,Linux 或 macOS(Intel 或 M 系列芯片)。
提取的数据格式是什么?
输出为结构化 JSON,可直接用于数据库或下游应用。
如何处理大量文档?
可以使用 ETL 流水线,从文件夹或云存储批量拉取文档,处理并加载到目标数据库。
是否有免费版本?
Unstract 使用 AGPL-3.0 许可证,开源版可免费使用,但高级功能(如 SSO、人类审查)可能需商业订阅。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents