数据与分析 multi-agentself-evolving-memoryscheduled-tasksscientific-workflowauto-skillscliwebuimcp

EvoScientist:自我进化的 AI 科学家

通过自我进化的 AI 科学家实现“氛围研究”,自主探索、生成洞察并持续改进。

FollowAgents 评估 · FARS-2.1
不推荐
51/ 100 五分制 2.6 / 5
1 2 3 4 5 6
1信任安全11 / 29 · 1.9/5

证据显示:README 提到 human-in-the-loop 审批(v0.2.5 统一审批),Docker 容器以非 root 用户运行并限制 shell 访问,但未提供具体权限最小化细节。扣分:未详细说明工具权限范围、数据流透明性不足、敏感数据处理细节缺失、依赖安全未提及漏洞扫描、外部影响(如网络请求)未明确、回滚机制未说明、来源归属仅作者信息。

2可靠稳定8 / 14 · 2.9/5

证据显示:README 和 pyproject.toml 版本一致(0.2.6),依赖有版本约束,测试文件存在。扣分:失败消息处理未在文档中说明,依赖可用性未提供镜像或缓存策略。

3适用触发12 / 18 · 3.3/5

证据显示:README 描述了多种使用场景(CLI、WebUI、移动端、Docker),支持多提供商和多渠道,能力边界有说明(如 iMessage 不可用)。扣分:触发精度(如命令语法)未详细说明,环境适配(如 Windows 问题)仅部分提及。

4规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,安装说明详细,命名稳定(evosci 等),有版本变更日志,许可证为 Apache-2.0。扣分:示例和 FAQ 较少,已知限制未系统列出,维护责任未明确(仅作者信息)。

5有效结果7 / 13 · 2.7/5

证据显示:输出格式有 stream-json 选项,功能丰富(多智能体、记忆、技能),边际价值高。扣分:成本效益未讨论,如 API 费用、资源消耗。

6证据核验3 / 8 · 1.9/5

证据显示:README 声称排名和奖项,但未提供可验证的复现步骤或数据。扣分:声明缺乏可追溯性,交叉验证不足,事实与推断未明确分离。

证据充分度: 评估于 2026年8月11日 审查版本 3f45ebd6fa95
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 发布者身份未验证,需谨慎对待来源。
  • 依赖较多且部分未固定精确版本,存在供应链风险。
  • README 中的排名和奖项声明缺乏可验证的复现数据。
  • 敏感数据处理和权限最小化细节不足,需自行审查。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

EvoScientist 是一个基于 Python 的、用于自动化科学研究的多代理框架,采用“人在环上”范式,AI 作为研究伙伴与人类研究人员共同进化。它包含一个由 6 个子代理(规划、研究、编码、调试、分析、写作)组成的多代理团队,一个在对话中自动蒸馏并自链接为知识图谱的自进化记忆系统,以及 AutoSkills,它从记忆中提炼可重用技能供用户审查。它支持多个 LLM 提供商(Anthropic、OpenAI、Google、MiniMax、NVIDIA)和多种渠道(CLI/TUI、WebUI、Telegram、Slack、飞书、微信等)。工作流遵循科学流程:输入→规划→执行→评估→写作→验证。EvoScientist 在 DeepResearch Bench、AstaBench 等基准测试中名列前茅,并在 ICAIS 2025 上获得最佳论文奖。安装通过 pip 或 uv 进行,也提供 Docker 镜像。

运行一个遵循科学工作流的多代理系统:首先接收研究主题,然后由规划代理制定计划,研究代理收集信息,代码代理编写和调试代码以进行分析,分析代理评估结果,最后由写作代理生成报告。代理可以执行 shell 命令(需人工审批),从 Tavily 等工具进行网络搜索,并通过 MCP 服务器访问外部工具。记忆系统将观察结果蒸馏成知识图谱,AutoSkills 从中提炼可复用的技能。用户可以计划定时任务(cron 风格),通过 CLI /schedule 命令管理,也可以与代理交互,代理可在需要澄清时主动提问。EvoScientist 提供 CLI (EvoSci)、交互式 TUI、基于 Web 的工作区 UI (--ui webui) 和用于外部 SDK 客户端的独立 LangGraph 服务器 (serve/deploy)。

  1. 研究人员可自动化整个研究生命周期,从文献综述到数据分析再到论文撰写,并通过 EvoScientist 的 WebUI 或 CLI 进行监控和交互。
  2. 数据科学家可以进行探索性数据分析,利用代理生成的 Python 代码自动发现数据中的模式,并可通过 AskUser 功能获得代理主动提问的协助。
  3. 团队负责人可以安排定时任务(如 cron 风格),让代理定期检查实验状态或向指定消息渠道汇报每日论文摘要。
  4. 开发者可以将 EvoScientist 作为 AI 编码代理集成到他们的工作流程中,利用其代码生成、调试以及通过 MCP 服务器和技能安装实现的外部工具集成能力。
  5. 需要长期、持续研究项目的用户可以利用自进化记忆功能,该功能在多次会话中保留领域知识并累积知识图谱,从而实现更明智的后续研究。

这个 Agent 有哪些优点和局限?

优点
  • 在多学科基准测试中持续排名第一(例如,DeepResearch Bench、AstaBench、ResearchClawBench),并被 6/6 会议接受,其中包括最佳论文奖。
  • 提供多代理结构和科学工作流模板,针对研究现实,包括根据记忆自动提炼技能。
  • 支持多种 LLM 提供商和多种消息渠道,实现灵活部署和交互便利。
  • 包含自进化记忆知识图谱,使知识跨会话累积。
局限
  • 强烈依赖外部 LLM API(Anthropic、OpenAI、Google 等),意味着持续成本和潜在的网络依赖性。
  • 若使用 WebUI,则要求 Node.js 24+,否则 TUI/CLI 也有一定运行时要求。
  • 默认需要人工审批 shell 命令,增加摩擦,尽管可配置自动审批。
  • 文档中列出的 WebUI 或移动功能与演示视频相关,但构建/部署的具体细节仍需从仓库中推断。

如何安装或部署这个 Agent?

通过 uv 或 pip 安装:uv tool install EvoScientistpip install EvoScientist。可选渠道:uv pip install "EvoScientist[telegram]" 等。或者,使用 Docker:docker run -it --rm --env-file .env -v "$(pwd)/workspace:/workspace" -v evosci-data:/home/evosci/.evoscientist ghcr.io/evoscientist/evoscientist:latest。需要 Python 3.11 或更高版本(<3.14)。初始化配置:EvoSci onboard 以交互方式设置 API 密钥和模型选择。确保至少设置一个 LLM API 密钥(例如 ANTHROPIC_API_KEY、OPENAI_API_KEY)。

如何使用这个 Agent?

配置 API 密钥后,通过运行 EvoSci 启动交互式 TUI,或使用 EvoSci --ui webui 启动浏览器 UI,再或使用 EvoSci serveEvoSci deploy 以无头模式启动。使用 EvoSci -p "你的问题" 进行单次查询。使用 /schedule add 命令安排定时任务。使用 /skills 管理技能,使用 /mcp 管理 MCP 服务器。对于编程访问,可以使用 EvoScientist.EvoScientist_agent.stream() 传递消息并从返回值中读取状态。

这个 Agent 与同类方案有什么区别?

在 AI 研究代理领域,根据公开基准,EvoScientist 在 DeepResearch Bench 等 Benchmarks 上排名第一,超越了其他知名的深度研究代理。其自我进化的记忆和 AutoSkills 功能与其他静态代理不同。

常见问题

EvoScientist 需要哪些 API 密钥?
需要至少一个 LLM 提供商的 API 密钥:Anthropic (ANTHROPIC_API_KEY)、OpenAI (OPENAI_API_KEY)、Google (GOOGLE_API_KEY)、MiniMax (MINIMAX_API_KEY) 或 NVIDIA (NVIDIA_API_KEY)。对于网络搜索功能,可选添加 TAVILY_API_KEY。
运行代理涉及哪些成本?
主要成本是每次运行消耗的 LLM token。定时任务会累积 token 使用量,因此建议使用 /schedule remove 命令取消不需要的定时任务。此外,代理执行的 shell 命令和外部工具也可能带来成本。
EvoScientist 是否安全?
默认情况下,shell 命令需要人工审批后才能执行。提供危险模式,允许不受限制的文件系统访问,但需谨慎使用。WebUI 的 LangGraph 后端未认证,如果暴露在不可信网络中,可能导致未授权访问。建议在可信网络上使用,或通过 SSH 隧道访问。
我能否在现有代码库上使用 EvoScientist?
是的,EvoScientist 针对特定工作目录进行编程,可设置 --workdir。它支持代码生成和改进,可集成到现有开发工作流程中。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents