Deep Researcher Agent
让深度学习实验能在 GPU 上自主规划、执行、监控与迭代的研究运维代理。
这个 Agent 能做什么,适合哪些场景?
Deep Researcher Agent 是面向深度学习实验的 24/7 自动化框架,而非通用编程助手。其核心由 core.loop 的 THINK→EXECUTE→REFLECT 循环、Leader-Worker 调度、零 LLM 成本的 core.monitor 监控器,以及两层内存组成。它以 PROJECT_BRIEF.md 定义目标和约束,并在工作区维护 MEMORY_LOG.md、state.json、experiments.jsonl、DEAD_ENDS.md 与 INSIGHTS.md 等运行记录。实验可在本地、单台 SSH 远程主机,或通过 Slurm 提交到集群执行;控制器保持在本地。项目同时提供 Claude Code 斜杠命令和 Codex 本地技能,并支持 Anthropic/OpenAI 兼容 API 与部分 CLI 订阅模式。
每个周期先读取 PROJECT_BRIEF.md、HUMAN_DIRECTIVE.md、MEMORY_LOG.md 和实验账本,由 Leader 规划下一项实验,并按需调用 Idea、Code 或 Writing worker。Code worker 可读取和修改项目工作区中的代码与配置,执行 dry-run,然后通过 launch_experiment 启动训练;core.monitor 使用进程检查、日志读取和 nvidia-smi 在训练期间轮询,不调用 LLM。训练结束后,REFLECT 解析日志和指标,将假设、指标与结果追加到 workspace/experiments.jsonl,并更新 state.json、记忆和研究日志;Slurm 后端还会通过 sacct 取得 FAILED、TIMEOUT、CANCELLED 等终态。辅助技能包括 /experiment-status、/gpu-monitor、/progress-report、/obsidian-sync、/daily-papers、/paper-analyze 与 /conf-search。
- 有现成 PyTorch 训练项目的研究者,希望在固定 GPU、训练轮数和搜索范围内连续运行消融实验。
- 负责 CIFAR-100、ImageNet 等模型训练的工程师,需要让系统根据日志结果继续调整优化器、学习率或数据增强。
- 使用单台远程 GPU 服务器的个人或团队,希望控制器留在本地,而代码修改、训练和 GPU 检查经 SSH 在远端完成。
- 在 Slurm GPU 集群上工作的研究人员,希望通过 sbatch 提交训练,并用 sacct 跟踪作业真实终态。
- 需要长期记录实验假设、指标、失败方向和可复用观察的项目负责人。
- 希望通过 Claude Code 或 Codex 的本地技能启动实验、查看状态并生成进度报告的用户。
这个 Agent 有哪些优点和局限?
- 训练期间由进程、日志和 GPU 状态轮询,monitor.zero_llm 支持零 LLM 调用的监控阶段。
- 本地、SSH 与 Slurm 后端覆盖个人 GPU、单机远程服务器和集群提交;Slurm 使用 sacct 记录真实终态。
- 实验账本 experiments.jsonl、DEAD_ENDS.md 和 INSIGHTS.md 为长期迭代保留结构化结果和失败经验。
- 两层内存设置字符上限,并以单 worker 调度控制上下文与并发 LLM 成本。
- 运行真实训练需要 Python 3.10+、NVIDIA GPU、项目目录和可执行训练命令;它不替你提供数据集或研究代码。
- API 模式依赖 Anthropic 或 OpenAI 兼容端点及凭据;CLI 订阅模式还依赖本机已安装并登录的 Claude 或 Codex CLI。
- codex_cli 只适合不需要工具调用的 Leader/THINK 路径,项目明确说明其内部循环会使框架无法恢复它启动实验的 PID。
- 默认单次只运行一个 worker,experiment.max_parallel 默认值为 1,不适合追求大规模并行实验调度的场景。
如何安装或部署这个 Agent?
准备 Python 3.10+、至少一张 NVIDIA GPU,以及 Anthropic/OpenAI 兼容 API 密钥,或已登录的 Claude/Codex CLI。执行:
git clone https://github.com/Xiangyue-Zhang/auto-deep-researcher-24x7.git
cd auto-deep-researcher-24x7
pip install -r requirements.txt
python install.py
python -m core.loop --check
创建项目目录并至少提供 PROJECT_BRIEF.md。API 模式可在项目 config.yaml 设置 agent.provider 为 "anthropic" 或 "openai"、设置 model,并配置相应密钥环境变量。
如何使用这个 Agent?
直接启动的最小调用为:
python -m core.loop --project /path/to/project --gpu 0 --max-cycles 5
移除 --max-cycles 可持续运行。Claude Code 中可使用 /auto-experiment --project /path/to/project --gpu 0;安装后 Codex 可使用匹配的本地技能。要将训练移至远端,在 config.yaml 设置 execution.mode: "ssh"、ssh_host 和 remote_workspace;使用 Slurm 时设置 execution.mode: "slurm",并提供 ssh_host、remote_workspace、slurm_partition 与 slurm_time。运行中可用 /experiment-status 查看进度,并通过 workspace/HUMAN_DIRECTIVE.md 在下一周期调整方向。
这个 Agent 与同类方案有什么区别?
项目将自己与 Claude Scholar、AI Scientist、OpenHands 和 SWE-Agent 并列比较,重点区分连续实验运行、训练期零成本监控、GPU 管理与常量大小内存;该表也显示其论文写作和通用编程定位较弱。