Deep Researcher Agent
让深度学习实验能在 GPU 上自主规划、执行、监控与迭代的研究运维代理。
按维度查看评分与理由
证据显示:安装脚本有所有权检查,SSH/Slurm后端有路径逃逸防护,监控循环有终止保障,但权限最小化、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚、来源归属均只有部分证据或未充分说明。扣分原因:未提供明确的权限最小化设计,用户确认机制不明确,数据流和敏感数据处理细节不足,依赖未锁定版本,外部影响(如Slurm提交)缺乏回滚机制,来源归属仅通过GitHub Actions强制单一作者,但未验证。
证据显示:代码结构一致,测试覆盖了关键路径,失败消息明确(如Slurm状态映射),但依赖可用性未验证,失败消息在部分场景下可能不完整。扣分原因:依赖未锁定版本,无法保证可用性;失败消息在部分场景下可能不完整。
证据显示:面向明确受众(深度学习研究者),能力边界清晰(实验操作层),触发方式明确(CLI命令),环境适配良好(本地、SSH、Slurm)。扣分原因:能力边界未明确说明限制,触发精度依赖用户输入,环境适配未覆盖所有可能场景。
证据显示:信息架构清晰,安装说明详细,命名稳定,示例丰富,许可证明确,版本更新记录详细,但已知限制未明确列出,维护责任未明确。扣分原因:已知限制未明确列出,维护责任未明确。
证据显示:输出可用性高(状态报告、进度跟踪),边际价值高(自动化实验循环),成本效益好(零成本监控)。扣分原因:输出可用性依赖用户配置,边际价值未量化,成本效益基于声称的数据。
证据显示:README中的声明有部分测试支持,但缺乏独立验证,事实与推断未明确分离。扣分原因:声明缺乏独立验证,事实与推断未明确分离。
- 依赖未锁定版本,存在供应链风险。
- API密钥处理细节未充分说明,需谨慎配置。
- Slurm提交等外部操作缺乏回滚机制。
- 发布者身份未验证,需谨慎使用。
这个 Agent 能做什么,适合哪些场景?
Deep Researcher Agent 是面向深度学习实验的 24/7 自动化框架,而非通用编程助手。其核心由 core.loop 的 THINK→EXECUTE→REFLECT 循环、Leader-Worker 调度、零 LLM 成本的 core.monitor 监控器,以及两层内存组成。它以 PROJECT_BRIEF.md 定义目标和约束,并在工作区维护 MEMORY_LOG.md、state.json、experiments.jsonl、DEAD_ENDS.md 与 INSIGHTS.md 等运行记录。实验可在本地、单台 SSH 远程主机,或通过 Slurm 提交到集群执行;控制器保持在本地。项目同时提供 Claude Code 斜杠命令和 Codex 本地技能,并支持 Anthropic/OpenAI 兼容 API 与部分 CLI 订阅模式。
每个周期先读取 PROJECT_BRIEF.md、HUMAN_DIRECTIVE.md、MEMORY_LOG.md 和实验账本,由 Leader 规划下一项实验,并按需调用 Idea、Code 或 Writing worker。Code worker 可读取和修改项目工作区中的代码与配置,执行 dry-run,然后通过 launch_experiment 启动训练;core.monitor 使用进程检查、日志读取和 nvidia-smi 在训练期间轮询,不调用 LLM。训练结束后,REFLECT 解析日志和指标,将假设、指标与结果追加到 workspace/experiments.jsonl,并更新 state.json、记忆和研究日志;Slurm 后端还会通过 sacct 取得 FAILED、TIMEOUT、CANCELLED 等终态。辅助技能包括 /experiment-status、/gpu-monitor、/progress-report、/obsidian-sync、/daily-papers、/paper-analyze 与 /conf-search。
- 有现成 PyTorch 训练项目的研究者,希望在固定 GPU、训练轮数和搜索范围内连续运行消融实验。
- 负责 CIFAR-100、ImageNet 等模型训练的工程师,需要让系统根据日志结果继续调整优化器、学习率或数据增强。
- 使用单台远程 GPU 服务器的个人或团队,希望控制器留在本地,而代码修改、训练和 GPU 检查经 SSH 在远端完成。
- 在 Slurm GPU 集群上工作的研究人员,希望通过 sbatch 提交训练,并用 sacct 跟踪作业真实终态。
- 需要长期记录实验假设、指标、失败方向和可复用观察的项目负责人。
- 希望通过 Claude Code 或 Codex 的本地技能启动实验、查看状态并生成进度报告的用户。
这个 Agent 有哪些优点和局限?
- 训练期间由进程、日志和 GPU 状态轮询,monitor.zero_llm 支持零 LLM 调用的监控阶段。
- 本地、SSH 与 Slurm 后端覆盖个人 GPU、单机远程服务器和集群提交;Slurm 使用 sacct 记录真实终态。
- 实验账本 experiments.jsonl、DEAD_ENDS.md 和 INSIGHTS.md 为长期迭代保留结构化结果和失败经验。
- 两层内存设置字符上限,并以单 worker 调度控制上下文与并发 LLM 成本。
- 运行真实训练需要 Python 3.10+、NVIDIA GPU、项目目录和可执行训练命令;它不替你提供数据集或研究代码。
- API 模式依赖 Anthropic 或 OpenAI 兼容端点及凭据;CLI 订阅模式还依赖本机已安装并登录的 Claude 或 Codex CLI。
- codex_cli 只适合不需要工具调用的 Leader/THINK 路径,项目明确说明其内部循环会使框架无法恢复它启动实验的 PID。
- 默认单次只运行一个 worker,experiment.max_parallel 默认值为 1,不适合追求大规模并行实验调度的场景。
如何安装或部署这个 Agent?
准备 Python 3.10+、至少一张 NVIDIA GPU,以及 Anthropic/OpenAI 兼容 API 密钥,或已登录的 Claude/Codex CLI。执行:
git clone https://github.com/Xiangyue-Zhang/auto-deep-researcher-24x7.git
cd auto-deep-researcher-24x7
pip install -r requirements.txt
python install.py
python -m core.loop --check创建项目目录并至少提供 PROJECT_BRIEF.md。API 模式可在项目 config.yaml 设置 agent.provider 为 "anthropic" 或 "openai"、设置 model,并配置相应密钥环境变量。
如何使用这个 Agent?
直接启动的最小调用为:
python -m core.loop --project /path/to/project --gpu 0 --max-cycles 5移除 --max-cycles 可持续运行。Claude Code 中可使用 /auto-experiment --project /path/to/project --gpu 0;安装后 Codex 可使用匹配的本地技能。要将训练移至远端,在 config.yaml 设置 execution.mode: "ssh"、ssh_host 和 remote_workspace;使用 Slurm 时设置 execution.mode: "slurm",并提供 ssh_host、remote_workspace、slurm_partition 与 slurm_time。运行中可用 /experiment-status 查看进度,并通过 workspace/HUMAN_DIRECTIVE.md 在下一周期调整方向。
这个 Agent 与同类方案有什么区别?
项目将自己与 Claude Scholar、AI Scientist、OpenHands 和 SWE-Agent 并列比较,重点区分连续实验运行、训练期零成本监控、GPU 管理与常量大小内存;该表也显示其论文写作和通用编程定位较弱。