数据与分析 scientific-discoveryhypothesis-generationexperiment-automationalgorithm-discoverypaper-reproductiondeep-researchpersistent-memory

InternAgent 科研发现框架

面向长周期科研的自主框架,串联假设生成、实验执行与文献驱动问答。

FollowAgents 评估 · FARS-2.1
不推荐
27/ 100 五分制 1.4 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全0 / 29 · 0.0/5

证据显示:仓库未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。README仅提及API密钥配置,但未说明最小权限原则或用户确认机制。依赖列表庞大且未提供安全审计。因此所有信任标准得分为0。

2可靠稳定3 / 14 · 1.1/5

证据显示:README和代码示例在任务描述上基本一致,但未提供错误处理或失败消息的文档。依赖列表完整但未验证可用性。因此自一致性得1分,依赖可用性得1分,失败消息得0分。

3适用触发8 / 18 · 2.2/5

证据显示:README明确了目标受众(科研人员)和多种使用场景(算法发现、论文复现、深度研究),但能力边界描述模糊,触发条件(如任务类型)未详细说明,环境适配仅提及Python 3.11和API密钥。因此受众和场景得2分,能力边界得1分,触发精度得1分,环境适配得1分。

4规范维护8 / 18 · 2.2/5

证据显示:README结构清晰,包含安装、配置、运行示例,但缺少已知限制、版本变更日志和维护责任说明。许可证为Apache 2.0,但元数据为NOASSERTION。因此信息架构得2分,安装说明得2分,命名稳定性得1分,示例和FAQ得2分,已知限制得0分,许可证得2分,版本变更日志得1分,维护责任得1分。

5有效结果6 / 13 · 2.3/5

证据显示:README描述了输出(答案、报告)和多种任务,但未提供成本效益分析或性能基准。因此输出可用性得1分,边际价值得2分,成本效益得1分。

6证据核验2 / 8 · 1.3/5

证据显示:README引用了论文和基准,但未提供可复现的验证步骤或事实与推断的区分。因此声明可追溯性得1分,跨来源佐证得1分,事实推断分离得0分。

证据充分度: 评估于 2026年8月9日 审查版本 fa8c3eedfa97
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 仓库未提供权限管理、用户确认或数据流透明性文档,存在安全风险。
  • 依赖列表庞大且未提供安全审计,可能引入已知漏洞。
  • 缺少已知限制和版本变更日志,用户难以评估适用性。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

InternAgent-1.5 是一个通过本地命令行运行的自主科学研究框架,覆盖发现实验与深度研究问答两种模式。发现模式可围绕 tasks/ 中的算法发现任务执行从创意生成到实验的流程;每个任务可包含 prompt.json、基线 code/ 与 launcher.sh。sci_tasks 模式面向论文复现:系统接收已发表论文及其数据,并尝试自主复现关键发现。QA 模式由深度研究管线处理研究问题,分解子任务、并行检索学术数据库和网页,再生成综合答案或结构化报告。运行结果写入 results/,日志写入 logs/;框架以本地 Python 环境、配置文件和外部模型服务凭据为部署边界。

通过 launch.py 选择 discovery 或 qa 模式:discovery 模式可运行 AutoDebug 等任务,也可使用 --skip_idea_generation 与 --idea_path 从既有 ideas.json 直接开始实验;qa 模式由 launch_qa.py 接收 --question,并可用 -o 将答案保存为 Markdown 文件。任务定义位于 tasks/,其中包含任务提示、基线代码和启动脚本。论文复现任务位于 sci_tasks/tasks/,并以论文及其数据为输入。Deep Research 模块将问题拆分为子任务,分别从学术数据库和网页收集资料后合成答案或报告;持久化 Memory Module 会跨会话记录实验结果,用于回避已失败方向并延续成功方向。模型连接通过 .env 与 config/ 配置,包括 OpenAI 兼容端点、OpenRouter,以及用于 Claude 实验后端的 Anthropic 凭据。

  1. 研究人员想先验证本地环境时,可运行无需下载数据集或模型的 AutoDebug 任务。
  2. 算法研究团队需要在 tasks/ 中已有任务、基线代码和任务提示的基础上开展自动化方案探索时,可运行 discovery 模式。
  3. 需要从已有 ideas.json 开始执行实验、而不重新生成创意的用户,可使用 --skip_idea_generation 和 --idea_path。
  4. 希望根据一篇已发表论文及配套数据自主尝试复现关键结论的科研人员,可使用 sci_tasks/tasks/ 中的论文复现任务。
  5. 需要针对“memory-augmented LLMs 的近期进展”等研究问题生成文献综合答案的用户,可使用 QA 模式。

这个 Agent 有哪些优点和局限?

优点
  • 通过 launch.py 在同一框架中提供发现实验与深度研究问答两种明确的运行模式。
  • 持久化 Memory Module 会跨会话保留实验结果,设计目标是减少重复尝试已失败方向。
  • 同时覆盖算法发现任务与基于论文和数据的科学论文复现任务,而不是只提供问答流程。
  • 提供 OpenAI 兼容端点、OpenRouter 和 Claude 实验后端的已文档化配置路径。
局限
  • 运行依赖本地 Conda、Python 3.11、命令行和外部 API 凭据;深度研究还会访问学术数据库和网页。
  • 不同任务的数据集和环境设置并不统一,需要逐个查看 tasks/ 内对应任务的代码和配置。
  • 已提供的材料未说明容器镜像、托管服务、稳定的程序化服务 API 或集群部署方案。
  • 许可元数据为 NOASSERTION,采用前需要自行确认可用的许可条款。

如何安装或部署这个 Agent?

创建并启用环境后安装依赖:

conda create -n InternAgent python=3.11
conda activate InternAgent
pip install -r requirements.txt

然后创建配置文件:

mv .env.example .env

在 .env 中按所选后端填写凭据。OPENAI_API_KEY 和 OPENAI_API_BASE_URL 用于 OpenAI 或兼容端点的嵌入与记忆;使用 OpenRouter 时填写 OPENROUTER_API_KEY 并采用 config/openrouter_config.yaml;使用 Claude 实验后端时填写 ANTHROPIC_API_KEY。

如何使用这个 Agent?

首次验证可运行:

python launch_discovery.py --config ./config/default_config.yaml --task AutoDebug --exp_backend claudecode

统一入口也支持:

python launch.py --mode discovery --task AutoDebug --exp_backend claudecode
python launch.py --mode qa --question "What are recent advances in memory-augmented LLMs?"

如需保存 QA 输出:

python launch_qa.py -q "What are recent advances in memory-augmented LLMs?" -o answer.md

主配置从 config/default_config.yaml 开始;结果和日志分别位于 results/ 与 logs/。

常见问题

首次运行应选哪个任务?
AutoDebug 被列为推荐的首次验证任务;它无需下载数据集或模型。
必须配置哪类模型服务?
框架文档列出 OpenAI 或兼容端点用于嵌入和记忆、OpenRouter 作为模型网关,以及用于 Claude 实验后端的 Anthropic API。应按所选配置填写相应密钥。
QA 模式会运行实验循环吗?
不会。QA 模式使用深度研究管线直接回答研究问题,并生成基于文献收集与综合的答案。
能否复现实验论文?
可以使用 sci_tasks/tasks/ 中的科学论文复现任务;该模式以已发表论文及其数据为输入,目标是自主复现关键发现。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents