GenoTEX 基因表达分析基准

用于评估自动化基因表达与基因—性状关联分析方法的专家标注基准。

Star 数
★ 65
最近更新
4 个月前
License
NOASSERTION
主语言
Jupyter Notebook

30 秒速览

可在哪里用
通用 · 跨平台
开始前需要
Python 3.10condapackages in requirements.txtShell / 命令行网络访问本地文件系统
典型场景
开发基因表达分析代理的研究团队,需要在统一 GTA 问题集上评估数据集筛选、预处理和显著基因识别。
主要局限
数据下载总量标为 82.0 GB,安装前需要充足本地磁盘空间;README 中另列输入数据为 41.5 GB,容量口径需要自行确认。

这个 Agent 能做什么,适合哪些场景?

GenoTEX 是面向基因表达数据自动分析的基准数据集,重点评估基于 LLM 的代理方法。它包含 1,384 个基因—性状关联(GTA)问题、911 个数据集,以及由生物信息学专家整理的分析代码和结果。仓库代码以按性状组织的 Jupyter Notebook 完成队列预处理,并由 code/regress.py 集中执行关联分析与模型选择。大体量 input、output 和 metadata 数据需从单独的云存储下载;项目也提供 Kaggle 和 Hugging Face 上的代码加数据打包版本。评估通过本地 eval.py 对数据集选择、预处理和统计分析输出进行格式与结果比较,而非提供在线服务或聊天界面。

预处理 Notebook 从按性状存放的 GEO 和 TCGA 输入数据中清洗、标准化并连接临床信息与基因表达数据,生成 output/preprocess/ 下的 clinical_data、gene_data、链接后的 CSV 及 cohort_info.json。code/regress.py 在预处理队列中自动选择适合每个性状—条件问题的队列,应用统计模型和超参数调优,并在 output/regress/ 生成 significant_genes_condition_{condition name}.json。结果 JSON 包含按重要性排序的基因、回归系数、绝对系数和 cv_performance。用户方法须按相同 output 目录结构产生结果,再运行 python eval.py -p {prediction_directory} -r {reference_directory} -t selection preprocessing analysis -s gene clinical linked 进行评估。

  1. 开发基因表达分析代理的研究团队,需要在统一 GTA 问题集上评估数据集筛选、预处理和显著基因识别。
  2. 生物信息学研究者需要检查按队列保存的预处理 Notebook,并复现实验中的关联分析流程。
  3. 构建自动化 GEO 与 TCGA 队列处理方法的团队,需要输出可与 benchmark 参考目录直接比较的 CSV 和 JSON。
  4. 方法评测人员需要按 selection、preprocessing、analysis 三类任务,或按 gene、clinical、linked 预处理子任务拆分评分。
  5. 需要研究性状、年龄、性别或共存性状条件下基因关联问题的计算基因组学用户。

如何安装或部署这个 Agent?

克隆仓库后进入目录:git clone https://github.com/Liu-Hy/GenoTEX.git && cd GenoTEX。下载 metadata、input 和 output 数据目录并放在仓库根目录;README 列出的数据来源为 Google Drive 或百度网盘,完整代码加数据版本也提供于 Kaggle 和 Hugging Face。创建环境并安装依赖:conda create -n genotex python=3.10,conda activate genotex,pip install -r requirements.txt。使用 Kaggle 版本时,先运行 python recompress_files.py 重新压缩所需文件。

如何使用这个 Agent?

先运行 ./code/{trait_name}/ 中对应队列的 Jupyter Notebook,生成预处理数据;随后从仓库根目录运行 python code/regress.py 执行 GTA 关联分析。评估自定义方法时,确保其输出遵循 output 的目录和 JSON/CSV 格式,然后运行:python eval.py -p {prediction_directory} -r {reference_directory} -t selection preprocessing analysis -s gene clinical linked。-p 为必填预测目录;-r 默认为 ./output;省略 -t 或 -s 可评估全部任务或全部预处理子任务。

这个 Agent 有哪些优点和局限?

优点
  • 覆盖 1,384 个无条件和条件 GTA 问题,并将评估拆分为数据集选择、预处理和统计分析三个明确环节。
  • 提供 911 个队列、专家整理的 237,907 行分析代码,以及每队列可交互查看输出的 Jupyter Notebook。
  • 参考输出定义了临床、基因表达、样本链接数据和显著基因结果的具体文件结构,便于可重复的离线比较。
  • 同时包含 GEO 与 TCGA 数据,并通过 gene_synonym.json 支持基因符号标准化。
局限
  • 数据下载总量标为 82.0 GB,安装前需要充足本地磁盘空间;README 中另列输入数据为 41.5 GB,容量口径需要自行确认。
  • 完整流程依赖外部云存储或 Kaggle、Hugging Face 数据平台,以及本地 conda、Python 3.10 和文件系统。
  • 预处理主要以大量按队列组织的 Notebook 提供,README 未说明单一命令即可批量运行全部预处理步骤。
  • 仓库元数据标示 License 为 NOASSERTION,而 README 声明数据集采用 CC BY 4.0;采用前应核实适用许可。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
GenoTEX 基因表达分析基准 当前 36 · 缺口较多 ★ 65 4 个月前 Jupyter Notebook
GenoMAS 51 · 缺口较多 ★ 134 5 个月前 Python OpenAI API · Claude API
Open Science 开源科研工作台 52 · 缺口较多 ★ 4.9k 今天 TypeScript Codex · Claude Code
科学智能体技能库(Scientific Agent Skills) 51 · 缺口较多 ★ 46k 3 天前 Python Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
36/ 100 五分制 1.8 / 5
信任安全 2/29
可靠稳定 6/14
适用触发 9/18
规范维护 8/18
有效结果 7/13
证据核验 4/8
查看各维度的扣分理由
信任安全2 / 29 · 0.3/5

证据显示:仓库提供了数据来源(GEO、TCGA、Open Targets、NCBI)和许可证(CC BY 4.0),但未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全、外部影响或回滚机制。扣分原因:这些方面在静态审查中未发现任何实现或文档。

可靠稳定6 / 14 · 2.1/5

证据显示:README 和 datasheet 提供了详细的数据结构说明,内部一致性较好;依赖列表明确,但未提供版本锁定或完整性校验;错误处理仅提及 eval.py 会报告格式错误,但未提供详细的失败消息机制。扣分原因:依赖可用性未验证,失败消息不充分。

适用触发9 / 18 · 2.5/5

证据显示:面向生物信息学家和 LLM 代理,提供了多种使用场景(探索基准、评估方法);但能力边界未明确说明,触发条件(如 eval.py 的参数)有文档但不够精确;环境要求(Python 3.10、conda)已说明。扣分原因:能力边界和触发精度不足。

规范维护8 / 18 · 2.2/5

证据显示:README 结构清晰,包含安装说明、使用示例、许可证和引用;命名规范(如 trait 名称标准化)有说明;但缺少版本历史、变更日志和明确的维护责任。扣分原因:版本控制和维护责任缺失。

有效结果7 / 13 · 2.7/5

证据显示:输出格式有详细说明,便于使用;基准提供了专家注释的数据和代码,具有边际价值;但成本效益未讨论,且数据下载量大(82GB),可能增加使用成本。扣分原因:成本效益未评估。

证据核验4 / 8 · 2.5/5

证据显示:README 引用了 arXiv 论文和外部数据源,但未提供具体的数据处理步骤或验证结果;交叉验证不足,事实与推断未明确分离。扣分原因:交叉验证和事实推断分离不足。

风险与缓解建议
  • 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
  • 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 静态审查无法验证数据下载链接的可用性和数据完整性。
  • 依赖未固定版本,可能影响可复现性。
  • 未提供明确的权限管理和安全审计,使用时应谨慎处理敏感数据。
证据充分度: 评估于 2026年8月9日 审查版本 2ce91ce8fe32
查看完整评分方法 →

常见问题

它是可直接部署的分析服务或聊天代理吗?
不是。已提供的接口是本地 Notebook、Python 脚本、数据目录和 eval.py 评估命令;没有文档说明在线服务、API 或聊天产品集成。
运行完整流程需要哪些数据?
GitHub 版本需额外下载 metadata、input 和 output 并置于仓库根目录。代码和数据的打包版本也可从 Kaggle 或 Hugging Face 获取。
如何评估自己的自动化方法?
将结果组织为与 output 相同的目录结构和 CSV/JSON 格式,再用 eval.py 的 -p 指定预测目录;可按任务和预处理子任务筛选评分。
是否支持条件关联分析?
支持。问题由性状—条件对定义;条件可为预定义性状、Age、Gender 或 None,其中 None 表示无条件问题。
许可是否明确?
README 声明数据集为 CC BY 4.0,但所提供的仓库元数据为 NOASSERTION。这两项信息不一致,使用或再分发前应确认。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents