数据与分析 autonomous-researchpaper-generationcitation-verificationliterature-searchhuman-in-the-looplatex-exportopenclawmetaclaw

AutoResearchClaw

把研究主题转化为含实验、引文核验与 LaTeX 交付物的论文流水线。

FollowAgents 评估 · FARS-2.1
不推荐
52/ 100 五分制 2.6 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全12 / 29 · 2.1/5

证据显示:README 描述了沙箱隔离(Docker 网络策略)、用户确认门(gate stages)、回滚机制(rollback on rejection)、成本护栏和人工介入模式。但缺少对最小权限原则的明确说明,数据流透明度有限,敏感数据处理(如 API 密钥)仅提及环境变量,依赖安全未提及漏洞扫描。扣分原因:未明确最小权限、数据流不透明、敏感数据处理细节不足、依赖安全未验证。

2可靠稳定8 / 14 · 2.9/5

证据显示:README 声称 2699 个测试通过,但未提供测试文件内容;存在 e2e_docker_sandbox.py 测试脚本,但未包含在测试套件中。依赖可用性:pyproject.toml 列出了依赖,但未提供锁定文件或版本范围。失败消息:README 描述了自愈和错误诊断,但未提供具体错误消息示例。扣分原因:测试声明未验证,依赖锁定缺失,失败消息示例不足。

3适用触发12 / 18 · 3.3/5

证据显示:README 描述了多种使用场景(CLI、OpenClaw、ACP 代理)、多种干预模式、跨平台支持。能力边界:描述了 23 阶段流水线和门控,但未明确限制。触发精度:提供了命令示例和配置,但未详细说明触发条件。环境适配:提到了硬件检测和 Docker 沙箱,但未提供详细的环境要求。扣分原因:能力边界和触发条件描述不够精确。

4规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,包含安装说明、示例、变更日志(News 部分)、许可证(MIT)。命名稳定性:提供了版本号(v0.5.0)和发布标签。已知限制:未明确列出。维护责任:未明确说明维护者或贡献指南。扣分原因:已知限制缺失,维护责任不明确。

5有效结果7 / 13 · 2.7/5

证据显示:README 描述了输出(论文、LaTeX、引用等)和功能(多源文献、验证等),但未提供实际输出示例或用户反馈。边际价值:声称自动化研究,但未与现有工具比较。成本效益:提到了成本护栏,但未提供成本数据。扣分原因:缺乏实际输出证据和成本数据。

6证据核验3 / 8 · 1.9/5

证据显示:README 声称有 arXiv 论文和 ARC-Bench 数据集,但未提供验证方法。声称 2699 个测试通过,但未提供测试结果。事实与推断分离:README 区分了功能描述和声称,但未明确标注哪些是已验证的。扣分原因:声称缺乏可验证的证据,事实与推断未明确分离。

证据充分度: 评估于 2026年8月9日 审查版本 e2e23c93b494
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • README 声称 2699 个测试通过,但未提供测试文件或结果,无法验证。
  • 依赖未锁定版本,可能影响可重现性。
  • 未明确列出已知限制,用户可能对能力边界产生误解。
  • 维护责任不明确,更新路径不清晰。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

AutoResearchClaw 是一个面向研究工作的 23 阶段自动化流水线,可从一个研究主题推进到论文草稿、实验结果和可编译的 LaTeX 交付物。它通过命令行运行,也可接入 OpenClaw,或将 Claude Code、Codex CLI、Copilot CLI、Gemini CLI、OpenCode、Kimi CLI 等 ACP 兼容编码代理作为后端。流水线按研究界定、文献发现、知识综合、实验设计与执行、结果决策、论文写作和最终导出组织,并在第 15 阶段作出 PROCEED、REFINE 或 PIVOT 决策。其产物包括 Markdown 与 LaTeX 论文、BibTeX、引文核验报告、实验代码和结构化指标、图表、同行评审、知识归档及可用于 Overleaf 的 deliverables 文件夹。它适合愿意配置模型凭据、接受实验在本地沙箱或 Docker 等执行环境中运行,并审阅自动生成研究结果的团队。

用户以 researchclaw run --topic "..." --auto-approve 或 Co-Pilot 模式启动任务。管线先分解主题,并从 OpenAlex、Semantic Scholar 和 arXiv 搜索、去重、筛选文献;随后提取知识、生成并辩论假设、设计实验,生成硬件感知的 Python 代码并执行。执行阶段可检测 NaN/Inf 和运行错误,进行定向修复与迭代;结果分析后,Stage 15 可回到 Stage 13 进行 REFINE,或回到 Stage 8 进行 PIVOT。写作阶段生成提纲、论文草稿和多代理同行评审,之后导出 paper.texreferences.bibverification_report.json、图表、实验结果和 deliverables/。引文核验描述为 arXiv ID、CrossRef/DataCite DOI、Semantic Scholar 标题匹配和 LLM 相关性评分四层检查;可选 MetaClaw bridge 会把跨运行的失败与警告转为可复用技能。

  1. 机器学习研究者希望把一个可检验的研究主题推进为带基线、实验代码、统计结果和 NeurIPS/ICLR/ICML LaTeX 模板的初稿。
  2. 需要系统搜集 OpenAlex、Semantic Scholar 与 arXiv 文献,并在写作前检查引用完整性与相关性的研究团队。
  3. 希望在假设、实验设计和论文起草等关键节点参与决策,而不想手动执行全部阶段的导师或研究工程师。
  4. 拥有 CUDA、Apple MPS 或仅 CPU 环境,需让代码生成和实验规模适配本机硬件的用户。
  5. 开展高能物理、 biology、统计或通用 Docker 实验,且需要按研究领域路由执行代理的团队。

这个 Agent 有哪些优点和局限?

优点
  • 23 个明确阶段覆盖从文献检索、实验到论文导出的完整研究流程,而不只是文本生成。
  • 通过 OpenAlex、Semantic Scholar、arXiv 和四层引用核验流程处理文献与引文,并会移除描述为幻觉的参考文献。
  • 提供全自动、关卡审批、检查点、Co-Pilot、逐步执行和自定义等多种人工介入方式。
  • 支持 ACP 兼容编码代理及 OpenClaw bridge,同时保留独立 CLI 和 Python API 路径。
  • 实验执行包含硬件检测、沙箱或 Docker 配置、NaN/Inf 快速失败和迭代修复机制。
局限
  • 运行需要配置 LLM 提供商或 ACP 编码代理;OpenAI 兼容路径要求 API 端点、密钥环境变量和模型配置。
  • 文献检索、外部 API 和可选网页搜索依赖网络可用性;Semantic Scholar 的更高速率限制还需要可选 API 密钥。
  • 实验结果取决于生成代码、可用硬件、沙箱或 Docker/远程 SSH 配置,README 未保证每个研究主题都能产生有效结论。
  • 论文虽支持自动导出,但质量关卡与部分模式要求人工审批;默认安全配置不允许未获批准就发布。
  • MetaClaw、OpenClaw bridge、特定领域执行器和 OpenCode 等功能均为可选集成,采用时增加部署与配置复杂度。

如何安装或部署这个 Agent?

需要 Python 3.11+。执行:git clone https://github.com/aiming-lab/AutoResearchClaw.gitcd AutoResearchClawpython3 -m venv .venv && source .venv/bin/activatepip install -e .,然后运行 researchclaw setupresearchclaw init。初始化会创建配置;也可复制 config.researchclaw.example.yamlconfig.arc.yaml。使用 OpenAI 兼容接口时,在配置中设置 llm.base_urlllm.api_key_envllm.primary_model,并例如执行 export OPENAI_API_KEY="sk-..."。README 将 Docker 和 LaTeX 列为 researchclaw setup 检查的项目;实验模式和导出需求决定是否需要它们。

如何使用这个 Agent?

首次运行可使用:researchclaw run --config config.arc.yaml --topic "Your research idea" --auto-approve。若要在关键节点协作,使用:researchclaw run --topic "Your research idea" --mode co-pilot;可通过 researchclaw attach artifacts/rc-2026-xxx 重新连接暂停任务,并用 researchclaw approveresearchclaw rejectresearchclaw guide 处理阶段决策。若使用 ACP 后端,将 llm.provider 设为 acp,并配置 llm.acp.agent,例如 claude;README 也列出 codex 等兼容命令。完成后的交付物位于 artifacts/rc-YYYYMMDD-HHMMSS-<hash>/deliverables/

常见问题

它一定会产出可靠的新研究结论吗?
不会。它会运行生成的实验、进行质量检查和引文核验,并可在失败时修复或转向;但输出仍应由研究人员审阅,README 未承诺任意主题都能得到有效结论。
运行是否必须使用 OpenAI API?
不必须。配置列出 openai、openrouter、deepseek、minimax、acp 和 openai-compatible 等提供商;ACP 路径可使用已认证的兼容编码代理。
可以控制自动化程度和成本吗?
可以。HITL 提供多种暂停与协作模式,并可设置 cost_budget_usd;README 说明管线会在超过配置预算时暂停。
实验失败会怎样?
执行阶段会检测 NaN/Inf、运行错误和不完整条件,支持定向代码修复与迭代;第 15 阶段还可选择 REFINE 或 PIVOT。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents