数据与分析 deep-researchweb-scrapinglocal-documentsmcp-integrationcitation-reportslangsmith

GPT Researcher

将网页与本地资料汇总为带引用的深度研究报告。

FollowAgents 评估 · FARS-2.1
不推荐
52/ 100 五分制 2.6 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全10 / 29 · 1.7/5

证据显示:项目明确说明后端无内置认证,依赖操作者自行部署防护,这降低了最小权限得分;用户确认机制未见,故为0;数据流透明度部分体现(如来源追踪),但未详细说明数据流向;敏感数据处理有提及(如API密钥),但未深入;依赖安全有CVE注释(如brotli),但未全面审计;外部影响有网络抓取和API调用,但未明确限制;回滚机制未见;来源归属有追踪来源的功能,但未明确验证。扣分原因:缺乏用户确认、回滚机制,权限控制依赖操作者。

2可靠稳定8 / 14 · 2.9/5

证据显示:README与pyproject.toml中版本一致(0.14.7),但README中许可证为MIT,而pyproject.toml中许可证为MIT,但LICENSE文件为Apache-2.0,存在不一致;依赖声明完整,但未验证可用性;失败消息未详细说明。扣分原因:许可证不一致,失败处理未充分说明。

3适用触发10 / 18 · 2.8/5

证据显示:面向广泛用户(个人和组织),支持多种LLM和搜索提供商,场景多样;能力边界有说明(如研究任务),但未明确限制;触发精度一般,未详细说明触发条件;环境适配有Docker、本地运行等。扣分原因:触发精度不足,能力边界未完全明确。

4规范维护11 / 18 · 3.1/5

证据显示:信息架构清晰(README、文档链接),安装说明详细,命名稳定(版本号),示例和FAQ有提供,已知限制有免责声明,许可证文件存在但版本不一致,版本变更日志未见,维护责任有作者信息。扣分原因:许可证不一致,缺少变更日志。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性高(支持PDF、Word等),边际价值明显(自动化研究),成本效益有说明(约0.1美元/任务)。扣分原因:成本数据未验证,边际价值未量化。

6证据核验4 / 8 · 2.5/5

证据显示:声称基于论文,但未提供具体引用;跨源验证有提及(聚合多个来源),但未详细说明;事实与推断分离未明确。扣分原因:缺乏具体引用,事实与推断分离不明确。

证据充分度: 评估于 2026年8月9日 审查版本 5d84d2f5553e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:执行前用户确认、回滚或恢复路径
使用前请注意
  • 后端无内置认证,暴露到公网前必须自行添加认证和网络控制。
  • 许可证声明不一致:README和pyproject.toml为MIT,但LICENSE文件为Apache-2.0,需确认实际许可。
  • 依赖众多,需定期审计安全漏洞,特别是涉及网络抓取和文档处理的库。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

GPT Researcher 是一个面向网页和本地资料研究的开源深度研究代理。它采用规划器与执行代理的流程:先围绕查询生成研究问题,再由爬虫代理收集资料、生成摘要并追踪来源,最后由发布环节汇总为报告。该项目提供 Python 包中的 GPTResearcher 类、FastAPI 服务,以及轻量静态前端和 NextJS 前端两种界面选择。它可处理网页研究与指定目录中的 PDF、文本、CSV、Excel、Markdown、PowerPoint 和 Word 文档,并支持导出 PDF、Word 等格式。项目也提供递归式 Deep Research 工作流、MCP 数据源接入及 LangSmith 可观测性配置。

通过 GPTResearcher(query=query) 创建研究任务后,调用 await researcher.conduct_research() 执行研究,再调用 await researcher.write_report() 生成报告。其架构会生成覆盖任务的研究问题,针对每个问题由 crawler agent 收集信息,对资源进行摘要和来源追踪,并过滤、聚合这些摘要形成最终报告。默认部署可用 pip install -r requirements.txt 后运行 python -m uvicorn main:app --reload;本地文档研究通过 DOC_PATH 指向资料目录。设置 RETRIEVER=tavily,mcp 后,可在 mcp_configs 中配置命令、参数和环境变量,把 GitHub、数据库或自定义 API 等 MCP 数据源与网页检索结合。

  1. 需要针对当前议题撰写带引用长篇研究报告的分析师,可让系统从多个网页来源收集和汇总资料。
  2. 拥有一组 PDF、Excel、Word 或 Markdown 文件的团队,可设置 DOC_PATH,对本地资料执行研究任务。
  3. 需要把 GitHub 仓库或数据库内容与网页资料一并研究的开发者,可通过 RETRIEVER=tavily,mcp 和 mcp_configs 接入 MCP 数据源。
  4. 希望从浏览器界面发起研究并查看实时进度的用户,可部署 FastAPI 服务及静态或 NextJS 前端。
  5. 需要递归探索复杂主题的研究人员,可使用 Deep Research 的可配置深度和广度进行树状研究。

这个 Agent 有哪些优点和局限?

优点
  • 规划器、执行代理和发布环节构成明确流程,覆盖问题生成、资料收集、来源追踪和报告汇总。
  • 同时支持网页与多种本地文件格式,适合把内部资料和外部信息放入同一研究流程。
  • 可通过 MCP 配置接入 GitHub、数据库和自定义 API 等专用数据源。
  • 既能作为 Python 包调用,也能通过 FastAPI、静态前端、NextJS 前端或 Docker 部署使用。
局限
  • 标准安装步骤要求 Python 3.11+,并需要配置 OpenAI API Key 与 Tavily API Key。
  • Deep Research 文档估计单次约需 5 分钟;使用高推理强度 o3-mini 的示例成本约为 0.4 美元。
  • 项目明确说明其为实验性应用,按“现状”提供,不保证消除偏见或错误事实。
  • MCP 功能需要额外设置 RETRIEVER 和 mcp_configs,并且具体数据源通常还需要各自的凭证。

如何安装或部署这个 Agent?

准备 Python 3.11 或更高版本,克隆仓库后设置 API 密钥:

export OPENAI_API_KEY={Your OpenAI API Key here}
export TAVILY_API_KEY={Your Tavily API Key here}

然后安装并启动:

pip install -r requirements.txt
python -m uvicorn main:app --reload

服务默认访问 http://localhost:8000。也可安装包:

pip install gpt-researcher

如何使用这个 Agent?

Python 包的最小调用方式为:

from gpt_researcher import GPTResearcher
query = "why is Nvidia stock going up?"
researcher = GPTResearcher(query=query)
research_result = await researcher.conduct_research()
report = await researcher.write_report()

进行本地资料研究时,先设置 export DOC_PATH="./my-docs";使用前端时选择 “My Documents”,或创建 GPTResearcher 时传入 report_source="local"。需要 MCP 与网页检索混合时,设置 export RETRIEVER=tavily,mcp,并在 mcp_configs 中提供 MCP 服务配置。

常见问题

它会保证研究结论完全无偏或绝对正确吗?
不会。项目目标是通过抓取多个站点并汇总常见信息来降低错误和偏见,但明确表示并不以消除偏见为目标,且软件按“现状”提供。
运行一次 Deep Research 的时间和成本是多少?
文档给出的估计是每次约 5 分钟;以高推理强度的 o3-mini 为例,成本约为 0.4 美元。实际结果会受所选模型和研究配置影响。
能否研究公司内部文件?
可以。设置 DOC_PATH 指向资料目录后,可研究 PDF、纯文本、CSV、Excel、Markdown、PowerPoint 和 Word 文件。
能接入受限或专业数据源吗?
可以通过 MCP 集成配置专用数据源,例如 GitHub、数据库和自定义 API;相关服务的命令、参数和所需环境变量需要放入 mcp_configs。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents