DeepAnalyze

面向多源数据的自主分析与专业报告生成助手。

Star 数
★ 4.6k
最近更新
1 天前
License
MIT
主语言
Python

30 秒速览

可在哪里用
兼容但需适配
开始前需要
Python 3.12PyTorchTransformersvLLM >=0.8.5Node.jsJupyterLabShell / 命令行网络访问本地文件系统MCP Server
典型场景
数据分析师需要把多个 CSV 和 Excel 文件放入同一工作目录,并生成一份可供业务阅读的综合分析报告。
主要局限
本地运行依赖 DeepAnalyze-8B、vLLM、PyTorch 和 Transformers,并需要按 GPU 显存选择量化、上下文长度及 FP8 KV Cache 配置。

这个 Agent 能做什么,适合哪些场景?

DeepAnalyze 是一个用于自主数据科学的 8B 参数 agentic LLM 项目,覆盖数据准备、分析、建模、可视化和报告生成。它面向数据库、CSV、Excel、JSON、XML、YAML、TXT 和 Markdown 等结构化、半结构化及非结构化数据源。项目提供 Python 调用入口 DeepAnalyzeVLLM,以及 WebUI、WebUI v2、JupyterUI、CLI 和 OpenAI 风格 HTTP API。其执行边界是本地部署的 DeepAnalyze-8B 推理服务;文档示例通过 vLLM 启动模型,并由用户提供工作目录和数据文件。输出可以是包含推理过程和分析结果的数据科学报告,示例说明报告可渲染为 PDF。

用户先通过 vLLM 部署 DeepAnalyze-8B,再将任务说明、文件名和工作目录传给 DeepAnalyzeVLLM.generate(prompt, workspace=workspace)。该流程可探索多个数据文件并完成数据准备、分析、建模与可视化,最终返回 reasoning 等结果并生成数据科学报告。WebUI 支持上传数据后在浏览器中交互;JupyterUI 会把 <Analyze>、<Understand>、<Answer> 转为 Markdown 单元,把 <Code> 转为代码单元并以 <Execute> 执行。API/start_server.py 可提供 /v1/files 文件上传和 /v1/chat/completions 对话接口;CLI 提供文件上传及流式响应。

  1. 数据分析师需要把多个 CSV 和 Excel 文件放入同一工作目录,并生成一份可供业务阅读的综合分析报告。
  2. 研究人员需要探索数据库、JSON、XML、YAML、文本和 Markdown 等混合资料,并开展开放式数据研究。
  3. 熟悉 Jupyter Notebook 的数据科学团队希望在 JupyterLab 中查看分析说明、生成代码单元并执行代码。
  4. 内部平台开发者需要用 OpenAI 风格的文件上传与聊天完成接口,将本地部署的 DeepAnalyze-8B 接入现有应用。
  5. 命令行用户需要通过英文或中文 CLI 上传文件,并查看实时流式分析响应。

如何安装或部署这个 Agent?

本地部署需先准备 Python 3.12 环境并安装依赖:conda create -n deepanalyze python=3.12 -yconda activate deepanalyzepip install -r requirements.txt。下载 DeepAnalyze-8B 后,用 vLLM 启动:vllm serve DeepAnalyze-8B。启动 WebUI 时,运行 cd demo/chat/frontend && npm install && cd .. && bash start.sh,然后访问 http://localhost:4000。WebUI v2 使用 cd demo/chat_v2/frontend && npm install && cd .. && cp .env.example .env && bash start.sh;其文档还说明支持 Docker 沙箱代码执行。若使用项目提供的 API key 服务,需要通过文档列出的 Google 或 Feishu 表单申请密钥。

如何使用这个 Agent?

模型服务启动后,可用 from deepanalyze import DeepAnalyzeVLLM 创建实例,并调用 generate(prompt, workspace=workspace);prompt 中可列出数据文件和任务,例如“Generate a data science report.”。CLI 场景下,在一个终端执行 cd API && python start_server.py,另一个终端执行 cd demo/cli && python api_cli.py,中文界面使用 python api_cli_ZH.py。HTTP API 场景下,先向 http://localhost:8200/v1/files 上传文件,再携带返回的 file_id 调用 http://localhost:8200/v1/chat/completions

这个 Agent 有哪些优点和局限?

优点
  • 覆盖从数据准备到报告生成的完整数据科学流程,而不只提供问答或单步代码生成。
  • 明确支持多种文件和数据格式,并可在一次任务中探索任意数量的数据源。
  • 提供 Python、浏览器界面、JupyterLab、CLI 和 OpenAI 风格 API 等多种交付方式。
  • WebUI v2 文档明确提供 Docker 化沙箱代码执行支持。
局限
  • 本地运行依赖 DeepAnalyze-8B、vLLM、PyTorch 和 Transformers,并需要按 GPU 显存选择量化、上下文长度及 FP8 KV Cache 配置。
  • 文档建议将训练与推理环境分开,以避免依赖冲突,增加了运维与环境管理成本。
  • WebUI 前端需要 npm 安装依赖;JupyterUI 还依赖 JupyterLab 和 jupyter-mcp-server 相关集成。
  • 项目声称可处理广泛的数据科学任务,但提供材料未给出任务失败处理、权限隔离细节或跨环境可靠性指标。

这个 Agent 与同类方案有什么区别?

项目将 DeepSeek-R1-0528-Qwen3-8B 作为可用于训练的基础模型,也允许直接基于 DeepAnalyze-8B 微调;DeepAnalyze 本身额外定义了面向数据科学任务的训练、推理与交互组件。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
DeepAnalyze 当前 35 · 缺口较多 ★ 4.6k 1 天前 Python
智析 Agent 60 · 存在缺口 ★ 2.6k 6 天前 JavaScript OpenAI API
DATAGEN 多智能体研究助手 44 · 缺口较多 ★ 1.8k 7 天前 Python OpenAI API · Claude API
FinRobot 51 · 缺口较多 ★ 8.1k 12 天前 Jupyter Notebook OpenAI API

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
35/ 100 五分制 1.8 / 5
信任安全 5/29
可靠稳定 3/14
适用触发 9/18
规范维护 9/18
有效结果 7/13
证据核验 2/8
查看各维度的扣分理由
信任安全5 / 29 · 0.9/5

证据显示:README 描述了数据科学任务,但未提及权限最小化或沙箱机制;WebUI v2 支持 Docker 沙箱,但未说明默认启用或强制。用户确认机制未提及。数据流透明度部分:README 说明了数据上传和文件处理,但未详细说明数据流向或存储。敏感数据处理未提及。依赖安全:requirements.txt 列出依赖但无版本锁定或安全审计。外部影响:代码执行可能产生副作用,但未说明限制。回滚机制未提及。来源归属:README 列出了作者和机构,但未验证。扣分原因:缺乏权限控制、用户确认、敏感数据保护、依赖安全、回滚机制等关键安全措施。

可靠稳定3 / 14 · 1.1/5

证据显示:README 和代码示例在任务描述上基本一致,但未提供错误处理或失败消息的细节。依赖可用性:requirements.txt 列出了常用库,但未指定版本,可能影响可复现性。失败消息:未提供任何错误处理或用户提示。扣分原因:缺乏失败处理文档和版本锁定。

适用触发9 / 18 · 2.5/5

证据显示:README 明确了目标用户(数据科学家、开发者)和多种场景(数据分析、报告生成)。能力边界:README 提到支持多种数据格式,但未明确限制。触发精度:通过自然语言指令触发,但未定义精确的触发条件。环境适配:提供了多种部署方式(WebUI、CLI、Jupyter),但未说明系统要求。扣分原因:能力边界和触发条件描述不精确。

规范维护9 / 18 · 2.5/5

证据显示:README 结构清晰,包含安装、使用、开发指南。安装说明详细,包括依赖和命令。命名稳定性:模型名称和 API 名称一致。示例和 FAQ:提供了多个示例,但无 FAQ。已知限制:未明确列出。许可证:MIT 许可证。版本变更:README 有新闻更新,但无正式 changelog。维护责任:作者和联系方式明确。扣分原因:缺少 FAQ、已知限制和正式 changelog。

有效结果7 / 13 · 2.7/5

证据显示:输出为数据科学报告,可渲染为 PDF,具有实用性。边际价值:自动化数据分析可节省时间,但需用户部署模型。成本效益:需要 GPU 资源,但未提供成本估算。扣分原因:成本效益分析不足。

证据核验2 / 8 · 1.3/5

证据显示:README 声称是首个 agentic LLM,但未提供独立验证。交叉来源:提供了 arXiv 论文和 Hugging Face 模型,但未交叉验证。事实与推断分离:未明确区分。扣分原因:缺乏独立验证和事实/推断分离。

风险与缓解建议
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 该仓库未提供权限最小化、用户确认、敏感数据保护等安全机制,部署时需自行加强。
  • 依赖未锁定版本,可能影响可复现性和安全性。
  • 代码执行可能产生外部影响,建议在沙箱环境中运行。
证据充分度: 评估于 2026年8月9日 审查版本 0b54741848df 评估后仓库已有新提交,评分可能未覆盖最新改动
查看完整评分方法 →

常见问题

本地运行一定需要 API key 吗?
文档给出的本地 vLLM、WebUI、CLI 和 Python 调用流程没有列出 API key 作为前置条件。项目同时提供可申请的 DeepAnalyze API key,用于其 API key 服务。
需要什么硬件配置?
文档给出 16GB、24GB、40GB 和 80GB GPU 显存下的模型类型与 max-model-len 建议;低于 24GB 时建议使用 4-bit 量化版本和 FP8 KV Cache。
能处理哪些数据?
文档明确列出数据库、CSV、Excel、JSON、XML、YAML、TXT 和 Markdown,并支持在一个任务中指定多个数据源。
是否能接入现有应用?
可以通过 API/start_server.py 启动 OpenAI 风格接口,使用文件上传端点和聊天完成端点;接入方仍需自行适配自己的鉴权、部署和调用逻辑。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents