数据与分析 deep-learningexperiment-automationpytorchgpu-monitoringhyperparameter-tuningslurmresearch-automation

Deep Researcher Agent

让深度学习实验能在 GPU 上自主规划、执行、监控与迭代的研究运维代理。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Deep Researcher Agent 是面向深度学习实验的 24/7 自动化框架,而非通用编程助手。其核心由 core.loop 的 THINK→EXECUTE→REFLECT 循环、Leader-Worker 调度、零 LLM 成本的 core.monitor 监控器,以及两层内存组成。它以 PROJECT_BRIEF.md 定义目标和约束,并在工作区维护 MEMORY_LOG.md、state.json、experiments.jsonl、DEAD_ENDS.md 与 INSIGHTS.md 等运行记录。实验可在本地、单台 SSH 远程主机,或通过 Slurm 提交到集群执行;控制器保持在本地。项目同时提供 Claude Code 斜杠命令和 Codex 本地技能,并支持 Anthropic/OpenAI 兼容 API 与部分 CLI 订阅模式。

每个周期先读取 PROJECT_BRIEF.md、HUMAN_DIRECTIVE.md、MEMORY_LOG.md 和实验账本,由 Leader 规划下一项实验,并按需调用 Idea、Code 或 Writing worker。Code worker 可读取和修改项目工作区中的代码与配置,执行 dry-run,然后通过 launch_experiment 启动训练;core.monitor 使用进程检查、日志读取和 nvidia-smi 在训练期间轮询,不调用 LLM。训练结束后,REFLECT 解析日志和指标,将假设、指标与结果追加到 workspace/experiments.jsonl,并更新 state.json、记忆和研究日志;Slurm 后端还会通过 sacct 取得 FAILED、TIMEOUT、CANCELLED 等终态。辅助技能包括 /experiment-status、/gpu-monitor、/progress-report、/obsidian-sync、/daily-papers、/paper-analyze 与 /conf-search。

  1. 有现成 PyTorch 训练项目的研究者,希望在固定 GPU、训练轮数和搜索范围内连续运行消融实验。
  2. 负责 CIFAR-100、ImageNet 等模型训练的工程师,需要让系统根据日志结果继续调整优化器、学习率或数据增强。
  3. 使用单台远程 GPU 服务器的个人或团队,希望控制器留在本地,而代码修改、训练和 GPU 检查经 SSH 在远端完成。
  4. 在 Slurm GPU 集群上工作的研究人员,希望通过 sbatch 提交训练,并用 sacct 跟踪作业真实终态。
  5. 需要长期记录实验假设、指标、失败方向和可复用观察的项目负责人。
  6. 希望通过 Claude Code 或 Codex 的本地技能启动实验、查看状态并生成进度报告的用户。

这个 Agent 有哪些优点和局限?

优点
  • 训练期间由进程、日志和 GPU 状态轮询,monitor.zero_llm 支持零 LLM 调用的监控阶段。
  • 本地、SSH 与 Slurm 后端覆盖个人 GPU、单机远程服务器和集群提交;Slurm 使用 sacct 记录真实终态。
  • 实验账本 experiments.jsonl、DEAD_ENDS.md 和 INSIGHTS.md 为长期迭代保留结构化结果和失败经验。
  • 两层内存设置字符上限,并以单 worker 调度控制上下文与并发 LLM 成本。
局限
  • 运行真实训练需要 Python 3.10+、NVIDIA GPU、项目目录和可执行训练命令;它不替你提供数据集或研究代码。
  • API 模式依赖 Anthropic 或 OpenAI 兼容端点及凭据;CLI 订阅模式还依赖本机已安装并登录的 Claude 或 Codex CLI。
  • codex_cli 只适合不需要工具调用的 Leader/THINK 路径,项目明确说明其内部循环会使框架无法恢复它启动实验的 PID。
  • 默认单次只运行一个 worker,experiment.max_parallel 默认值为 1,不适合追求大规模并行实验调度的场景。

如何安装或部署这个 Agent?

准备 Python 3.10+、至少一张 NVIDIA GPU,以及 Anthropic/OpenAI 兼容 API 密钥,或已登录的 Claude/Codex CLI。执行:
git clone https://github.com/Xiangyue-Zhang/auto-deep-researcher-24x7.git
cd auto-deep-researcher-24x7
pip install -r requirements.txt
python install.py
python -m core.loop --check

创建项目目录并至少提供 PROJECT_BRIEF.md。API 模式可在项目 config.yaml 设置 agent.provider 为 "anthropic" 或 "openai"、设置 model,并配置相应密钥环境变量。

如何使用这个 Agent?

直接启动的最小调用为:
python -m core.loop --project /path/to/project --gpu 0 --max-cycles 5

移除 --max-cycles 可持续运行。Claude Code 中可使用 /auto-experiment --project /path/to/project --gpu 0;安装后 Codex 可使用匹配的本地技能。要将训练移至远端,在 config.yaml 设置 execution.mode: "ssh"、ssh_host 和 remote_workspace;使用 Slurm 时设置 execution.mode: "slurm",并提供 ssh_host、remote_workspace、slurm_partition 与 slurm_time。运行中可用 /experiment-status 查看进度,并通过 workspace/HUMAN_DIRECTIVE.md 在下一周期调整方向。

这个 Agent 与同类方案有什么区别?

项目将自己与 Claude Scholar、AI Scientist、OpenHands 和 SWE-Agent 并列比较,重点区分连续实验运行、训练期零成本监控、GPU 管理与常量大小内存;该表也显示其论文写作和通用编程定位较弱。

常见问题

训练时会持续消耗模型调用费用吗?
不会。项目将训练期监控设计为进程检查、日志读取和 nvidia-smi 轮询;LLM 主要用于 THINK 和 REFLECT。README 给出的示例估算是 8 小时训练的 24 小时周期约 0.08 美元。
它会修改已有代码吗?
会。Code Agent 可在项目工作区读取、写入和修改代码与配置,先执行 dry-run 再启动训练;README 表示 PROJECT_BRIEF.md 与 MEMORY_LOG.md 属于受保护文件。
训练崩溃或 Slurm 超时时如何处理?
监控器会在进程结束时收集日志供 REFLECT 分析。Slurm 模式通过 sacct 获取 FAILED、TIMEOUT、CANCELLED 等终态,并把结果写入状态、账本和反思上下文。
可以把控制器放在笔记本、训练放在服务器或集群吗?
可以。ssh 模式让远端承担代码操作、训练、日志、PID 与 GPU 查询;slurm 模式通过 SSH 调用 sbatch 提交作业,控制器状态仍保留在本地。

相关 Agents