AutoResearchClaw
把研究主题转化为含实验、引文核验与 LaTeX 交付物的论文流水线。
按维度查看评分与理由
证据显示:README 描述了沙箱隔离(Docker 网络策略)、用户确认门(gate stages)、回滚机制(rollback on rejection)、成本护栏和人工介入模式。但缺少对最小权限原则的明确说明,数据流透明度有限,敏感数据处理(如 API 密钥)仅提及环境变量,依赖安全未提及漏洞扫描。扣分原因:未明确最小权限、数据流不透明、敏感数据处理细节不足、依赖安全未验证。
证据显示:README 声称 2699 个测试通过,但未提供测试文件内容;存在 e2e_docker_sandbox.py 测试脚本,但未包含在测试套件中。依赖可用性:pyproject.toml 列出了依赖,但未提供锁定文件或版本范围。失败消息:README 描述了自愈和错误诊断,但未提供具体错误消息示例。扣分原因:测试声明未验证,依赖锁定缺失,失败消息示例不足。
证据显示:README 描述了多种使用场景(CLI、OpenClaw、ACP 代理)、多种干预模式、跨平台支持。能力边界:描述了 23 阶段流水线和门控,但未明确限制。触发精度:提供了命令示例和配置,但未详细说明触发条件。环境适配:提到了硬件检测和 Docker 沙箱,但未提供详细的环境要求。扣分原因:能力边界和触发条件描述不够精确。
证据显示:README 结构清晰,包含安装说明、示例、变更日志(News 部分)、许可证(MIT)。命名稳定性:提供了版本号(v0.5.0)和发布标签。已知限制:未明确列出。维护责任:未明确说明维护者或贡献指南。扣分原因:已知限制缺失,维护责任不明确。
证据显示:README 描述了输出(论文、LaTeX、引用等)和功能(多源文献、验证等),但未提供实际输出示例或用户反馈。边际价值:声称自动化研究,但未与现有工具比较。成本效益:提到了成本护栏,但未提供成本数据。扣分原因:缺乏实际输出证据和成本数据。
证据显示:README 声称有 arXiv 论文和 ARC-Bench 数据集,但未提供验证方法。声称 2699 个测试通过,但未提供测试结果。事实与推断分离:README 区分了功能描述和声称,但未明确标注哪些是已验证的。扣分原因:声称缺乏可验证的证据,事实与推断未明确分离。
- README 声称 2699 个测试通过,但未提供测试文件或结果,无法验证。
- 依赖未锁定版本,可能影响可重现性。
- 未明确列出已知限制,用户可能对能力边界产生误解。
- 维护责任不明确,更新路径不清晰。
这个 Agent 能做什么,适合哪些场景?
AutoResearchClaw 是一个面向研究工作的 23 阶段自动化流水线,可从一个研究主题推进到论文草稿、实验结果和可编译的 LaTeX 交付物。它通过命令行运行,也可接入 OpenClaw,或将 Claude Code、Codex CLI、Copilot CLI、Gemini CLI、OpenCode、Kimi CLI 等 ACP 兼容编码代理作为后端。流水线按研究界定、文献发现、知识综合、实验设计与执行、结果决策、论文写作和最终导出组织,并在第 15 阶段作出 PROCEED、REFINE 或 PIVOT 决策。其产物包括 Markdown 与 LaTeX 论文、BibTeX、引文核验报告、实验代码和结构化指标、图表、同行评审、知识归档及可用于 Overleaf 的 deliverables 文件夹。它适合愿意配置模型凭据、接受实验在本地沙箱或 Docker 等执行环境中运行,并审阅自动生成研究结果的团队。
用户以 researchclaw run --topic "..." --auto-approve 或 Co-Pilot 模式启动任务。管线先分解主题,并从 OpenAlex、Semantic Scholar 和 arXiv 搜索、去重、筛选文献;随后提取知识、生成并辩论假设、设计实验,生成硬件感知的 Python 代码并执行。执行阶段可检测 NaN/Inf 和运行错误,进行定向修复与迭代;结果分析后,Stage 15 可回到 Stage 13 进行 REFINE,或回到 Stage 8 进行 PIVOT。写作阶段生成提纲、论文草稿和多代理同行评审,之后导出 paper.tex、references.bib、verification_report.json、图表、实验结果和 deliverables/。引文核验描述为 arXiv ID、CrossRef/DataCite DOI、Semantic Scholar 标题匹配和 LLM 相关性评分四层检查;可选 MetaClaw bridge 会把跨运行的失败与警告转为可复用技能。
- 机器学习研究者希望把一个可检验的研究主题推进为带基线、实验代码、统计结果和 NeurIPS/ICLR/ICML LaTeX 模板的初稿。
- 需要系统搜集 OpenAlex、Semantic Scholar 与 arXiv 文献,并在写作前检查引用完整性与相关性的研究团队。
- 希望在假设、实验设计和论文起草等关键节点参与决策,而不想手动执行全部阶段的导师或研究工程师。
- 拥有 CUDA、Apple MPS 或仅 CPU 环境,需让代码生成和实验规模适配本机硬件的用户。
- 开展高能物理、 biology、统计或通用 Docker 实验,且需要按研究领域路由执行代理的团队。
这个 Agent 有哪些优点和局限?
- 23 个明确阶段覆盖从文献检索、实验到论文导出的完整研究流程,而不只是文本生成。
- 通过 OpenAlex、Semantic Scholar、arXiv 和四层引用核验流程处理文献与引文,并会移除描述为幻觉的参考文献。
- 提供全自动、关卡审批、检查点、Co-Pilot、逐步执行和自定义等多种人工介入方式。
- 支持 ACP 兼容编码代理及 OpenClaw bridge,同时保留独立 CLI 和 Python API 路径。
- 实验执行包含硬件检测、沙箱或 Docker 配置、NaN/Inf 快速失败和迭代修复机制。
- 运行需要配置 LLM 提供商或 ACP 编码代理;OpenAI 兼容路径要求 API 端点、密钥环境变量和模型配置。
- 文献检索、外部 API 和可选网页搜索依赖网络可用性;Semantic Scholar 的更高速率限制还需要可选 API 密钥。
- 实验结果取决于生成代码、可用硬件、沙箱或 Docker/远程 SSH 配置,README 未保证每个研究主题都能产生有效结论。
- 论文虽支持自动导出,但质量关卡与部分模式要求人工审批;默认安全配置不允许未获批准就发布。
- MetaClaw、OpenClaw bridge、特定领域执行器和 OpenCode 等功能均为可选集成,采用时增加部署与配置复杂度。
如何安装或部署这个 Agent?
需要 Python 3.11+。执行:git clone https://github.com/aiming-lab/AutoResearchClaw.git,cd AutoResearchClaw,python3 -m venv .venv && source .venv/bin/activate,pip install -e .,然后运行 researchclaw setup 和 researchclaw init。初始化会创建配置;也可复制 config.researchclaw.example.yaml 为 config.arc.yaml。使用 OpenAI 兼容接口时,在配置中设置 llm.base_url、llm.api_key_env、llm.primary_model,并例如执行 export OPENAI_API_KEY="sk-..."。README 将 Docker 和 LaTeX 列为 researchclaw setup 检查的项目;实验模式和导出需求决定是否需要它们。
如何使用这个 Agent?
首次运行可使用:researchclaw run --config config.arc.yaml --topic "Your research idea" --auto-approve。若要在关键节点协作,使用:researchclaw run --topic "Your research idea" --mode co-pilot;可通过 researchclaw attach artifacts/rc-2026-xxx 重新连接暂停任务,并用 researchclaw approve、researchclaw reject 或 researchclaw guide 处理阶段决策。若使用 ACP 后端,将 llm.provider 设为 acp,并配置 llm.acp.agent,例如 claude;README 也列出 codex 等兼容命令。完成后的交付物位于 artifacts/rc-YYYYMMDD-HHMMSS-<hash>/deliverables/。
常见问题
它一定会产出可靠的新研究结论吗?
运行是否必须使用 OpenAI API?
可以控制自动化程度和成本吗?
cost_budget_usd;README 说明管线会在超过配置预算时暂停。