数据与分析 deep-learningexperiment-automationpytorchgpu-monitoringhyperparameter-tuningslurmresearch-automation

Deep Researcher Agent

让深度学习实验能在 GPU 上自主规划、执行、监控与迭代的研究运维代理。

FollowAgents 评估 · FARS-2.1
不推荐
52/ 100 五分制 2.6 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全10 / 29 · 1.7/5

证据显示:安装脚本有所有权检查,SSH/Slurm后端有路径逃逸防护,监控循环有终止保障,但权限最小化、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚、来源归属均只有部分证据或未充分说明。扣分原因:未提供明确的权限最小化设计,用户确认机制不明确,数据流和敏感数据处理细节不足,依赖未锁定版本,外部影响(如Slurm提交)缺乏回滚机制,来源归属仅通过GitHub Actions强制单一作者,但未验证。

2可靠稳定8 / 14 · 2.9/5

证据显示:代码结构一致,测试覆盖了关键路径,失败消息明确(如Slurm状态映射),但依赖可用性未验证,失败消息在部分场景下可能不完整。扣分原因:依赖未锁定版本,无法保证可用性;失败消息在部分场景下可能不完整。

3适用触发12 / 18 · 3.3/5

证据显示:面向明确受众(深度学习研究者),能力边界清晰(实验操作层),触发方式明确(CLI命令),环境适配良好(本地、SSH、Slurm)。扣分原因:能力边界未明确说明限制,触发精度依赖用户输入,环境适配未覆盖所有可能场景。

4规范维护10 / 18 · 2.8/5

证据显示:信息架构清晰,安装说明详细,命名稳定,示例丰富,许可证明确,版本更新记录详细,但已知限制未明确列出,维护责任未明确。扣分原因:已知限制未明确列出,维护责任未明确。

5有效结果9 / 13 · 3.5/5

证据显示:输出可用性高(状态报告、进度跟踪),边际价值高(自动化实验循环),成本效益好(零成本监控)。扣分原因:输出可用性依赖用户配置,边际价值未量化,成本效益基于声称的数据。

6证据核验3 / 8 · 1.9/5

证据显示:README中的声明有部分测试支持,但缺乏独立验证,事实与推断未明确分离。扣分原因:声明缺乏独立验证,事实与推断未明确分离。

证据充分度: 评估于 2026年8月9日 审查版本 dbf3df816c60
使用前请注意
  • 依赖未锁定版本,存在供应链风险。
  • API密钥处理细节未充分说明,需谨慎配置。
  • Slurm提交等外部操作缺乏回滚机制。
  • 发布者身份未验证,需谨慎使用。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Deep Researcher Agent 是面向深度学习实验的 24/7 自动化框架,而非通用编程助手。其核心由 core.loop 的 THINK→EXECUTE→REFLECT 循环、Leader-Worker 调度、零 LLM 成本的 core.monitor 监控器,以及两层内存组成。它以 PROJECT_BRIEF.md 定义目标和约束,并在工作区维护 MEMORY_LOG.md、state.json、experiments.jsonl、DEAD_ENDS.md 与 INSIGHTS.md 等运行记录。实验可在本地、单台 SSH 远程主机,或通过 Slurm 提交到集群执行;控制器保持在本地。项目同时提供 Claude Code 斜杠命令和 Codex 本地技能,并支持 Anthropic/OpenAI 兼容 API 与部分 CLI 订阅模式。

每个周期先读取 PROJECT_BRIEF.md、HUMAN_DIRECTIVE.md、MEMORY_LOG.md 和实验账本,由 Leader 规划下一项实验,并按需调用 Idea、Code 或 Writing worker。Code worker 可读取和修改项目工作区中的代码与配置,执行 dry-run,然后通过 launch_experiment 启动训练;core.monitor 使用进程检查、日志读取和 nvidia-smi 在训练期间轮询,不调用 LLM。训练结束后,REFLECT 解析日志和指标,将假设、指标与结果追加到 workspace/experiments.jsonl,并更新 state.json、记忆和研究日志;Slurm 后端还会通过 sacct 取得 FAILED、TIMEOUT、CANCELLED 等终态。辅助技能包括 /experiment-status、/gpu-monitor、/progress-report、/obsidian-sync、/daily-papers、/paper-analyze 与 /conf-search。

  1. 有现成 PyTorch 训练项目的研究者,希望在固定 GPU、训练轮数和搜索范围内连续运行消融实验。
  2. 负责 CIFAR-100、ImageNet 等模型训练的工程师,需要让系统根据日志结果继续调整优化器、学习率或数据增强。
  3. 使用单台远程 GPU 服务器的个人或团队,希望控制器留在本地,而代码修改、训练和 GPU 检查经 SSH 在远端完成。
  4. 在 Slurm GPU 集群上工作的研究人员,希望通过 sbatch 提交训练,并用 sacct 跟踪作业真实终态。
  5. 需要长期记录实验假设、指标、失败方向和可复用观察的项目负责人。
  6. 希望通过 Claude Code 或 Codex 的本地技能启动实验、查看状态并生成进度报告的用户。

这个 Agent 有哪些优点和局限?

优点
  • 训练期间由进程、日志和 GPU 状态轮询,monitor.zero_llm 支持零 LLM 调用的监控阶段。
  • 本地、SSH 与 Slurm 后端覆盖个人 GPU、单机远程服务器和集群提交;Slurm 使用 sacct 记录真实终态。
  • 实验账本 experiments.jsonl、DEAD_ENDS.md 和 INSIGHTS.md 为长期迭代保留结构化结果和失败经验。
  • 两层内存设置字符上限,并以单 worker 调度控制上下文与并发 LLM 成本。
局限
  • 运行真实训练需要 Python 3.10+、NVIDIA GPU、项目目录和可执行训练命令;它不替你提供数据集或研究代码。
  • API 模式依赖 Anthropic 或 OpenAI 兼容端点及凭据;CLI 订阅模式还依赖本机已安装并登录的 Claude 或 Codex CLI。
  • codex_cli 只适合不需要工具调用的 Leader/THINK 路径,项目明确说明其内部循环会使框架无法恢复它启动实验的 PID。
  • 默认单次只运行一个 worker,experiment.max_parallel 默认值为 1,不适合追求大规模并行实验调度的场景。

如何安装或部署这个 Agent?

准备 Python 3.10+、至少一张 NVIDIA GPU,以及 Anthropic/OpenAI 兼容 API 密钥,或已登录的 Claude/Codex CLI。执行:

git clone https://github.com/Xiangyue-Zhang/auto-deep-researcher-24x7.git
cd auto-deep-researcher-24x7
pip install -r requirements.txt
python install.py
python -m core.loop --check

创建项目目录并至少提供 PROJECT_BRIEF.md。API 模式可在项目 config.yaml 设置 agent.provider 为 "anthropic" 或 "openai"、设置 model,并配置相应密钥环境变量。

如何使用这个 Agent?

直接启动的最小调用为:

python -m core.loop --project /path/to/project --gpu 0 --max-cycles 5

移除 --max-cycles 可持续运行。Claude Code 中可使用 /auto-experiment --project /path/to/project --gpu 0;安装后 Codex 可使用匹配的本地技能。要将训练移至远端,在 config.yaml 设置 execution.mode: "ssh"、ssh_host 和 remote_workspace;使用 Slurm 时设置 execution.mode: "slurm",并提供 ssh_host、remote_workspace、slurm_partition 与 slurm_time。运行中可用 /experiment-status 查看进度,并通过 workspace/HUMAN_DIRECTIVE.md 在下一周期调整方向。

这个 Agent 与同类方案有什么区别?

项目将自己与 Claude Scholar、AI Scientist、OpenHands 和 SWE-Agent 并列比较,重点区分连续实验运行、训练期零成本监控、GPU 管理与常量大小内存;该表也显示其论文写作和通用编程定位较弱。

常见问题

训练时会持续消耗模型调用费用吗?
不会。项目将训练期监控设计为进程检查、日志读取和 nvidia-smi 轮询;LLM 主要用于 THINK 和 REFLECT。README 给出的示例估算是 8 小时训练的 24 小时周期约 0.08 美元。
它会修改已有代码吗?
会。Code Agent 可在项目工作区读取、写入和修改代码与配置,先执行 dry-run 再启动训练;README 表示 PROJECT_BRIEF.md 与 MEMORY_LOG.md 属于受保护文件。
训练崩溃或 Slurm 超时时如何处理?
监控器会在进程结束时收集日志供 REFLECT 分析。Slurm 模式通过 sacct 获取 FAILED、TIMEOUT、CANCELLED 等终态,并把结果写入状态、账本和反思上下文。
可以把控制器放在笔记本、训练放在服务器或集群吗?
可以。ssh 模式让远端承担代码操作、训练、日志、PID 与 GPU 查询;slurm 模式通过 SSH 调用 sbatch 提交作业,控制器状态仍保留在本地。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents