GenoMAS
面向基因表达分析的代码驱动多智能体自动化框架。
- Star 数
- ★ 134
- 最近更新
- 5 个月前
- License
- MIT
- 主语言
- Python
- FA 评分
- 51/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台OpenAI API · Claude API
- 开始前需要
- 典型场景
- 计算基因组学研究人员需要对 GenoTEX 中的大量性状—条件组合执行一致的基因表达预处理和回归分析。
- 主要局限
- 完整 GenoTEX 基准需要约 42 GB 输入数据;README 估计全量运行需连续 3–5 天且成本超过 300 美元。
这个 Agent 能做什么,适合哪些场景?
GenoMAS 包含一个用于科学工作流自动化的极简多智能体框架,以及一个面向基因表达数据分析的专用实现。框架采用类型化消息通信和类似 Notebook 的工作流,使智能体能够规划、编写代码、执行、调试并在多步骤任务中回溯。专用系统处理来自 GEO 与 TCGA 的转录组数据,目标是在考虑混杂因素的前提下识别与性状相关的显著基因。实验通过命令行运行,结果按 GenoTEX 约定写入 output/preprocess、output/regress 和日志文件。它需要本地数据目录、Python 环境及至少一个模型提供商的 API 密钥;也可通过 Ollama 使用本地模型。
用户以 python main.py 启动实验,并通过 --version、--model、--api 和 --data-root 指定运行配置。系统读取 GenoTEX 输入数据,执行队列式的基因表达预处理与回归分析,并将预处理 cohort 数据写入 output/preprocess/{trait_name}/、将回归结果写入 output/regress/{trait_name}/。它支持为 Code Review、Domain Expert、Data Engineer、Statistician 和 planning 机制分别设置模型及 API 索引;--parallel-mode cohorts 可并发处理 cohort。--generate-action-units 会依据智能体 guidelines 生成 Action Unit 提示词,默认允许人工编辑后确认,配合 --non-interactive 时可无交互继续。运行日志保存为 ./output/log_{version}.txt,若中断,以相同命令重跑可利用检查点恢复。
- 计算基因组学研究人员需要对 GenoTEX 中的大量性状—条件组合执行一致的基因表达预处理和回归分析。
- 拥有 GEO 或 TCGA 转录组数据的生物信息团队希望在控制混杂因素时筛选与目标性状相关的显著基因。
- 研究工程师希望为代码审查、领域专家和统计任务分配不同模型,测试异构模型配置。
- 需要先验证 cohort 预处理质量、暂不运行完整统计分析的团队可使用 --quick-test 进行小规模测试。
- 受 API 速率限制约束但希望缩短墙钟时间的用户,可用 --parallel-mode cohorts 和有限的 --max-workers 并行处理。
如何安装或部署这个 Agent?
创建环境并安装依赖:
conda create -n genomas python=3.10
conda activate genomas
pip install -r requirements.txt复制配置模板并至少填写一个模型提供商的 API 密钥:
cp env.example .env使用 OpenAI 模型时还需要组织 ID。输入数据需另行下载到数据根目录;默认数据根目录为 ../data。
如何使用这个 Agent?
先检查已下载数据:
cd download
python validator.py --data-dir /path/to/data --validate随后从项目根目录运行一个基础实验:
python main.py --version exp1 --model gpt-5-mini-2025-08-07 --api 1如需指定数据位置,可追加 --data-root /path/to/data。小规模预处理验证可使用 --quick-test;本地 Ollama 模型可通过例如 --model llama3.1 运行。
这个 Agent 有哪些优点和局限?
- 同时提供通用多智能体工作流框架和面向 GEO、TCGA 转录组分析的专用实现。
- Notebook 式执行模型明确覆盖计划、代码生成、执行、调试和回溯,而非仅输出分析建议。
- 支持全局模型配置及按 Code Review、Domain Expert、Data Engineer、Statistician、planning 角色覆盖模型与 API 索引。
- 输出路径、运行日志和中断恢复机制均有明确约定,便于长时间批量实验排查与续跑。
- 完整 GenoTEX 基准需要约 42 GB 输入数据;README 估计全量运行需连续 3–5 天且成本超过 300 美元。
- 云端运行至少需要一个模型提供商 API 密钥;使用 OpenAI 模型还要求组织 ID,且并行度会受 API 速率限制影响。
- 本地运行大型模型存在显著 GPU 内存和延迟压力;DeepSeek-R1 671B 被说明为需要多张高端 GPU。
- 完整回归依赖相关数据集均已完成预处理,README 建议先用 --quick-test 验证预处理,因此快速端到端评估范围有限。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| GenoMAS 当前 | 51 · 缺口较多 | ★ 134 | 5 个月前 | Python | OpenAI API · Claude API |
| GenoTEX 基因表达分析基准 | 36 · 缺口较多 | ★ 65 | 4 个月前 | Jupyter Notebook | — |
| BambooAI 数据分析师 | 85 · 表现良好 | ★ 790 | 7 天前 | Python | OpenAI API · Claude API |
| MiroFish Offline | 30 · 缺口较多 | ★ 2.5k | 6 个月前 | Python | OpenAI API · Claude API |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:README 要求用户自行配置 API 密钥(.env),未发现硬编码密钥或过度权限;有 --generate-action-units 交互模式,会暂停等待人工编辑和确认;输出结构清晰,日志可追踪;未发现敏感数据处理细节;依赖列表未固定版本,无安全审计;外部效果主要是 API 调用和本地文件写入,未发现恶意行为;有 checkpoint 恢复机制,可视为回滚支持;作者身份在 README 和 LICENSE 中明确。扣分:依赖未固定版本,无安全审计;敏感数据处理未说明;外部效果未明确限制。
证据显示:README 与代码结构一致,参数说明详细;依赖列表存在但未固定版本,可能影响可复现性;错误处理有提示(如模型名错误会列出支持模型),但未提供完整错误消息示例。扣分:依赖版本未固定,错误消息覆盖有限。
证据显示:面向科研用户,提供了多种使用场景(基础、异构模型、开源模型、并行、AU 生成);能力边界通过参数和角色配置说明;触发条件明确(命令行参数);环境要求(Python 3.10、conda、API 密钥)清晰。扣分:未提供详细的系统要求(如内存、GPU),环境适配性有限。
证据显示:README 结构完整,包含目录、使用说明、输出结构、故障排除;安装步骤清晰;命名稳定(参数名一致);提供了多个示例和故障排除;已知限制(如内存、超时)有说明;MIT 许可证完整;无版本号或变更日志;维护责任未明确(未说明维护者或贡献指南)。扣分:无版本号/变更日志,维护责任不明确。
证据显示:输出结构遵循 GenoTEX 约定,便于使用;提供了基准测试结果(F1 分数)和成本估算,显示边际价值;成本效益有估算($300+ 全量运行),但未提供详细对比。扣分:成本效益分析较粗略。
证据显示:README 引用了 arXiv 论文和基准测试,可追溯;但未提供独立验证数据;事实与推断未明确区分(如性能声明未提供详细实验数据)。扣分:交叉验证不足,事实与推断混合。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 依赖未固定版本,可能引入安全漏洞或兼容性问题。
- API 密钥管理依赖用户自行配置,需确保 .env 文件安全。
- 全量运行成本高($300+),需谨慎评估资源。
- 未提供版本号或变更日志,难以追踪更新。