开发与工程 markdown-skillsml-researchcross-model-reviewcodex-clianti-autoresearchresearch-automation

ARIS ⚔️🌙 自动研究入睡

纯 Markdown 技能库,用跨模型评审循环实现自动化 ML 研究(想法发现、实验、写作),零框架、零锁定。

FollowAgents 评估 · FARS-2.1
不推荐
45/ 100 五分制 2.3 / 5
1 2 3 4 5 6
1信任安全10 / 29 · 1.7/5

证据显示仓库包含多个组件(如 llm-chat、feishu-bridge)需要 API 密钥和网络访问,但未明确说明权限最小化或用户确认机制。数据流透明度有限,敏感数据处理(如 API 密钥)有提及但未详细说明。依赖安全性未充分评估,外部影响(如网络调用)存在但未明确控制。回滚机制未提及。来源归属部分明确(如 MIT 许可证、作者信息),但未验证。

2可靠稳定6 / 14 · 2.1/5

仓库内部一致性较好,README 与代码结构基本一致,但依赖可用性未明确(如需要外部 API 密钥)。失败消息有部分示例(如错误处理),但不够全面。

3适用触发9 / 18 · 2.5/5

目标受众明确(AI 研究人员、开发者),场景多样(研究自动化、面试准备等)。能力边界部分说明(如技能列表),但触发精度(如技能触发条件)未详细说明。环境适配性较好(支持多种 CLI 和操作系统)。

4规范维护10 / 18 · 2.8/5

信息架构清晰(README、docs、skills 目录),安装说明存在(如 ARIS-Code CLI 安装),命名稳定性一般(版本号频繁更新),示例和 FAQ 有提供,已知限制部分提及(如输出折叠),许可证明确(MIT),版本变更日志详细,维护责任部分明确(作者和贡献者)。

5有效结果7 / 13 · 2.7/5

输出可用性较好(如生成报告、HTML 等),边际价值较高(自动化研究流程),成本效益未充分评估(如 API 成本)。

6证据核验3 / 8 · 1.9/5

声明可追溯性一般(如技术报告链接),跨来源佐证有限(如外部推荐),事实与推断分离不明确。

证据充分度: 评估于 2026年8月9日 审查版本 e3aa6f83b09d
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 仓库包含需要 API 密钥的组件,请确保密钥安全存储,避免泄露。
  • 依赖外部服务(如 OpenAI、Feishu),使用时请注意网络和成本。
  • 版本更新频繁,请关注变更日志以了解行为变化。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

ARIS 是一个轻量级、纯 Markdown 的技能集合,用于自主 ML 研究。它编排跨模型协作:Claude Code 驱动研究,外部 LLM(通过 Codex MCP)作为关键评审者。其核心方法是对抗性评审循环,避免单一模型自我审视的盲区。整个技能层是可移植的,可在 Claude Code、Codex CLI、Cursor、Trae、Antigravity 和 GitHub Copilot CLI 中使用。它已打包为独立的 ARIS-Code CLI(Rust),提供 REPL、MCP 工具分发、无 API 密钥的跨模型评审以及可捆绑的技能。仓库包含 81 个技能、12 条命名工作流以及扩展工具,如 Anti-Autoresearch 完整性取证和 ARIS-Movie-Director。许可证为 MIT。

它以纯 Markdown 形式提供一系列技能,每个技能定义了一个自主研究步骤:想法生成(/research-idea)、文献综述(/research-lit)、论文写作(/paper-writing)、实验设计(/experiment-bridge)和提交后任务,如生成幻灯片(/paper-slides)和反驳(/rebuttal)。核心机制是跨模型评审:Claude Code 执行,而另一个模型(通过 Codex MCP 或 LLM API)审查输出。技能可组合成管道,例如 /research-pipeline,它接受一个研究方向、读取参考论文、克隆仓库、生成想法、运行实验并撰写论文。独立的 ARIS-Code CLI 提供 REPL(/plan 模式、/tasks 持久跟踪)、工具调用、MCP 服务器集成以及包含技能捆绑的自动设置。它还包括 Research Wiki,用于跨会话持久化笔记、想法和实验。

  1. 一位 ML 研究员,想要在夜间自动生成研究想法、运行实验并起草论文,醒来时能看到已评分的论文。
  2. 一位研究生,手头有论文草稿和评论,需要生成结构化的反驳,满足字符限制,并带有防捏造保障。
  3. 一位研究员,拥有代码库和想法,希望使用 /research-pipeline 自动化改进方法的完整流程。
  4. 一个团队,想要利用跨模型对抗评审,避免单一模型自我审视的盲区,选择 Claude + Codex 或 Claude + 其他模型。
  5. 一位开发者,想要将相同的技能工作流带到非 Claude 环境:Codex CLI、Cursor、Trae 或其他与 SKILL.md 兼容的代理。
  6. 一位教师或作者,想要使用 /render-html 协作撰写教学材料或结构化文档,生成带有交叉评审的 HTML。

这个 Agent 有哪些优点和局限?

优点
  • 跨模型评审打破自我审视盲区:使用两个模型(速度和严谨度)能产生更好的结果,而非单一模型
  • 完全可移植:纯 Markdown SKILL.md 可以在 Claude Code、Codex CLI、Cursor、Trae、Copilot CLI 等之间移动,零锁定
  • 自带争议安全护栏:/rebuttal 具有防捏造、防过度承诺和完全覆盖门
  • 无 API 密钥跨模型评审:通过 Codex MCP 和 ChatGPT 订阅,您无需 OpenAI API 密钥即可拥有评审者(或仅使用替代模型如 Kimi、DeepSeek)
  • 活跃的开发具有透明度:详细变更日志,引用真实用户问题,定期发布
局限
  • 陡峭的学习曲线:多个工作流、技能和配置选项,对初学者可能不知所措
  • 依赖外部模型 API:确保可靠性需要 API 凭证或多个提供商;成本可能因计划而异
  • 与任何 AI 工具一样可能存在幻觉:尽管有保障,输出需要人工验证,尤其对于至关重要的研究
  • 需要兼容的代理运行时:虽然不是锁定,但需要 SKILL.md 兼容的代理,如 Claude Code 或 Codex CLI

如何安装或部署这个 Agent?

有几种安装方式:

  1. 轻量技能:将仓库克隆到本地,然后运行 bash tools/install_skills.sh(或适用于您的代理的相关安装脚本,如 install_skills_codex.sh)。安装程序将技能复制到 ~/.claude/skills~/.config/codex/skills
  2. 独立 CLI:从 releases 下载最新版本的 ARIS-Code 二进制,或从源码(需要 Rust)构建。运行 aris setup 配置提供者和模型。
  3. 使用 Homebrew:brew tap wanshuiyin/aris && brew install aris?实际上,源码仅记录安装方法:释出的二进制和 tools/install_skills.sh。请参阅 repo 文档获取准确说明。

如何使用这个 Agent?

对于技能:在 Claude Code 中启动,使用 /research-pipeline "研究方向" 启动完整管道,或使用 /research-idea/research-lit/paper-writing 等独立技能。跨模型评审需要配置第二个模型:通过 aris setup(选项:Codex MCP 使用 ChatGPT 订阅,无 API 密钥)或使用 OpenAI/Anthropic API 密钥。对于 ARIS-Code CLI:运行 aris "你的提示",或 aris 启动 REPL。使用 /plan 进行规划,/tasks 跟踪任务,/research-wiki 持久记忆。

这个 Agent 与同类方案有什么区别?

它与 Anthropic 的 Claude Science skills 和 OpenAI 的 Codex CLI 原生技能进行比较。它鼓励在 Codex CLI 中使用,而不是 Claude Code,以实现更大的模型灵活性。它将自己与“ChatGPT 无人驾驶研究”等商业工具区分开来,强调了无锁定的方法。

常见问题

使用 ARIS 的成本是多少?
技能本身是免费的(MIT),但您需要模型访问:Claude 通过 API 或订阅,GPT 通过 OpenAI API 或 ChatGPT 订阅(通过 Codex MCP)。ARIS 支持多种模型,因此您可以选择成本最低的选项。
在什么权限下 ARIS 运行?
它作为本地技能或 CLI 运行,可以访问您的文件系统、shell 和网络,由您配置。对于 CLI,有一个批准模式(PermissionMode::Prompt)默认会提示批准,尽管早期版本在提示模式下错误地允许一切(已在 v0.4.6 中修复)。当使用 MCP 工具时,您必须批准。
ARIS 如何处理故障和错误?
它包含重试逻辑、流式超时、MCP 协议版本验证以及复现测试。它还有防止生成虚假结果的护栏,并使用跨模型评审来捕捉错误。但是,与任何自动化系统一样,您应该验证关键输出。
ARIS 是针对一般写作还是仅针对研究?
虽然专注于研究,但已扩展到非学术研究(ARIS-Anything)和教学(ARIS-in-AI-Offer)。核心方法(计划-起草-审查-迭代-保留)是通用的,可用于投资、法律和其他领域。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents