GenoTEX 基因表达分析基准
用于评估自动化基因表达与基因—性状关联分析方法的专家标注基准。
- Star 数
- ★ 65
- 最近更新
- 4 个月前
- License
- NOASSERTION
- 主语言
- Jupyter Notebook
- FA 评分
- 36/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台
- 开始前需要
- 典型场景
- 开发基因表达分析代理的研究团队,需要在统一 GTA 问题集上评估数据集筛选、预处理和显著基因识别。
- 主要局限
- 数据下载总量标为 82.0 GB,安装前需要充足本地磁盘空间;README 中另列输入数据为 41.5 GB,容量口径需要自行确认。
这个 Agent 能做什么,适合哪些场景?
GenoTEX 是面向基因表达数据自动分析的基准数据集,重点评估基于 LLM 的代理方法。它包含 1,384 个基因—性状关联(GTA)问题、911 个数据集,以及由生物信息学专家整理的分析代码和结果。仓库代码以按性状组织的 Jupyter Notebook 完成队列预处理,并由 code/regress.py 集中执行关联分析与模型选择。大体量 input、output 和 metadata 数据需从单独的云存储下载;项目也提供 Kaggle 和 Hugging Face 上的代码加数据打包版本。评估通过本地 eval.py 对数据集选择、预处理和统计分析输出进行格式与结果比较,而非提供在线服务或聊天界面。
预处理 Notebook 从按性状存放的 GEO 和 TCGA 输入数据中清洗、标准化并连接临床信息与基因表达数据,生成 output/preprocess/ 下的 clinical_data、gene_data、链接后的 CSV 及 cohort_info.json。code/regress.py 在预处理队列中自动选择适合每个性状—条件问题的队列,应用统计模型和超参数调优,并在 output/regress/ 生成 significant_genes_condition_{condition name}.json。结果 JSON 包含按重要性排序的基因、回归系数、绝对系数和 cv_performance。用户方法须按相同 output 目录结构产生结果,再运行 python eval.py -p {prediction_directory} -r {reference_directory} -t selection preprocessing analysis -s gene clinical linked 进行评估。
- 开发基因表达分析代理的研究团队,需要在统一 GTA 问题集上评估数据集筛选、预处理和显著基因识别。
- 生物信息学研究者需要检查按队列保存的预处理 Notebook,并复现实验中的关联分析流程。
- 构建自动化 GEO 与 TCGA 队列处理方法的团队,需要输出可与 benchmark 参考目录直接比较的 CSV 和 JSON。
- 方法评测人员需要按 selection、preprocessing、analysis 三类任务,或按 gene、clinical、linked 预处理子任务拆分评分。
- 需要研究性状、年龄、性别或共存性状条件下基因关联问题的计算基因组学用户。
如何安装或部署这个 Agent?
克隆仓库后进入目录:git clone https://github.com/Liu-Hy/GenoTEX.git && cd GenoTEX。下载 metadata、input 和 output 数据目录并放在仓库根目录;README 列出的数据来源为 Google Drive 或百度网盘,完整代码加数据版本也提供于 Kaggle 和 Hugging Face。创建环境并安装依赖:conda create -n genotex python=3.10,conda activate genotex,pip install -r requirements.txt。使用 Kaggle 版本时,先运行 python recompress_files.py 重新压缩所需文件。
如何使用这个 Agent?
先运行 ./code/{trait_name}/ 中对应队列的 Jupyter Notebook,生成预处理数据;随后从仓库根目录运行 python code/regress.py 执行 GTA 关联分析。评估自定义方法时,确保其输出遵循 output 的目录和 JSON/CSV 格式,然后运行:python eval.py -p {prediction_directory} -r {reference_directory} -t selection preprocessing analysis -s gene clinical linked。-p 为必填预测目录;-r 默认为 ./output;省略 -t 或 -s 可评估全部任务或全部预处理子任务。
这个 Agent 有哪些优点和局限?
- 覆盖 1,384 个无条件和条件 GTA 问题,并将评估拆分为数据集选择、预处理和统计分析三个明确环节。
- 提供 911 个队列、专家整理的 237,907 行分析代码,以及每队列可交互查看输出的 Jupyter Notebook。
- 参考输出定义了临床、基因表达、样本链接数据和显著基因结果的具体文件结构,便于可重复的离线比较。
- 同时包含 GEO 与 TCGA 数据,并通过 gene_synonym.json 支持基因符号标准化。
- 数据下载总量标为 82.0 GB,安装前需要充足本地磁盘空间;README 中另列输入数据为 41.5 GB,容量口径需要自行确认。
- 完整流程依赖外部云存储或 Kaggle、Hugging Face 数据平台,以及本地 conda、Python 3.10 和文件系统。
- 预处理主要以大量按队列组织的 Notebook 提供,README 未说明单一命令即可批量运行全部预处理步骤。
- 仓库元数据标示 License 为 NOASSERTION,而 README 声明数据集采用 CC BY 4.0;采用前应核实适用许可。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| GenoTEX 基因表达分析基准 当前 | 36 · 缺口较多 | ★ 65 | 4 个月前 | Jupyter Notebook | — |
| GenoMAS | 51 · 缺口较多 | ★ 134 | 5 个月前 | Python | OpenAI API · Claude API |
| Open Science 开源科研工作台 | 52 · 缺口较多 | ★ 4.9k | 今天 | TypeScript | Codex · Claude Code |
| 科学智能体技能库(Scientific Agent Skills) | 51 · 缺口较多 | ★ 46k | 3 天前 | Python | Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:仓库提供了数据来源(GEO、TCGA、Open Targets、NCBI)和许可证(CC BY 4.0),但未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全、外部影响或回滚机制。扣分原因:这些方面在静态审查中未发现任何实现或文档。
证据显示:README 和 datasheet 提供了详细的数据结构说明,内部一致性较好;依赖列表明确,但未提供版本锁定或完整性校验;错误处理仅提及 eval.py 会报告格式错误,但未提供详细的失败消息机制。扣分原因:依赖可用性未验证,失败消息不充分。
证据显示:面向生物信息学家和 LLM 代理,提供了多种使用场景(探索基准、评估方法);但能力边界未明确说明,触发条件(如 eval.py 的参数)有文档但不够精确;环境要求(Python 3.10、conda)已说明。扣分原因:能力边界和触发精度不足。
证据显示:README 结构清晰,包含安装说明、使用示例、许可证和引用;命名规范(如 trait 名称标准化)有说明;但缺少版本历史、变更日志和明确的维护责任。扣分原因:版本控制和维护责任缺失。
证据显示:输出格式有详细说明,便于使用;基准提供了专家注释的数据和代码,具有边际价值;但成本效益未讨论,且数据下载量大(82GB),可能增加使用成本。扣分原因:成本效益未评估。
证据显示:README 引用了 arXiv 论文和外部数据源,但未提供具体的数据处理步骤或验证结果;交叉验证不足,事实与推断未明确分离。扣分原因:交叉验证和事实推断分离不足。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 静态审查无法验证数据下载链接的可用性和数据完整性。
- 依赖未固定版本,可能影响可复现性。
- 未提供明确的权限管理和安全审计,使用时应谨慎处理敏感数据。