信息速览

GTEx — 人类组织基因表达调控图谱 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | GTEx(Genotype-Tissue Expression) |
| 英文全称 | Genotype-Tissue Expression Project |
| 别名/简称 | GTEx、Adult GTEx、GTEx v8、基因型-组织表达计划 |
| 疾病分类 | 非疾病专病数据集——健康供体多组织参考图谱,支撑全疾病谱复杂疾病 GWAS 功能解读(典型应用:ICD-11 5A11 2型糖尿病 / BA41 急性心肌梗死 / 6A20 精神分裂症 / 8A20 阿尔茨海默病,详见 §2.1) |
| SNOMED CT | 44054006 Type 2 diabetes mellitus / 22298006 Myocardial infarction / 58214004 Schizophrenia / 26929004 Alzheimer’s disease / 363346000 Malignant neoplastic disease(应用场景映射,详见 §2.2) |
| 数据模态 | 基因组(WGS 基因型)、转录组(bulk RNA-seq 表达)、QTL 汇总统计、组织学图像;扩展含 smallRNA-seq、深度体细胞 WGS(V10)与 eGTEx 表观数据 |
| AI 任务类型 | eQTL/sQTL 定位、GWAS 共定位与 TWAS、组织特异性表达分析、基因型→表达预测(表达插补)、细胞组成反卷积、变异功能注释、基因组基础模型预训练 |
| 样本总数 | V8:948 名供体 / 17,382 个 RNA-seq 样本 / 54 个组织部位(52 组织 + 2 细胞系);V10:19,616 个 RNA-seq 样本 / 19,466 个 eQTL 分析样本(官方 API 汇总,约 960 名供体) |
| 数据大小 | 开放汇总数据数 GB 级(表达矩阵 + QTL 汇总统计);受控原始序列(RNA-seq/WGS BAM、VCF)百 TB 量级 |
| 数据格式 | GCT(表达矩阵)/ TSV(注释与 QTL 汇总)/ BED(QTL 输入矩阵)/ VCF、BAM、CRAM(受控,经 AnVIL/Terra) |
| 许可证 | GTEx Portal Data License(开放数据,免费但须规范致谢)+ dbGaP 受控访问协议(个体级数据) |
| 访问级别 | 开放(汇总表达矩阵与 QTL 统计,免注册下载)/ 申请审核(dbGaP phs000424 受控个体级数据) |
| DUO 标签 | GRU, PUB |
| 语言 | 英文 |
| 首发日期 | 2010(NIH Common Fund 项目启动)/ 2015-05-08(pilot 论文,Science 348:648-660) |
| 最后更新 | 2026-01-16(V11:GENCODE v47 注释升级;2026-05-28 bulk 文件修订);门户可视化当前展示 V10 |
| 发布机构 | NIH Common Fund(项目资助与协调)/ Broad Institute(LDACC 数据分析协调中心)/ NCI、NHGRI、NIMH 等参与研究所 |
| 官方主页 | https://gtexportal.org/home/ |
| 下载地址 | https://gtexportal.org/home/downloads/adult-gtex(开放数据)/ dbGaP phs000424.v8.p2 与 phs000424.v10.p1(受控数据,经 AnVIL) |
| DOI | 10.1126/science.aaz1776(V8 旗舰论文)/ 10.1126/science.1262110(2015 pilot)/ 10.1038/nature24277(2017 中期) |
| 引用次数 | 4,840+(Google Scholar,截至 2026-09;Science 2020 旗舰论文);pilot 2015 论文 OpenAlex 5,516 |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 开放矩阵 + 统一管道 + 官方 API + 云端 AnVIL;扣分项:个体级基因型需 dbGaP 审批、无 ML 任务划分(非监督基准集)、死后样本混杂需协变量校正 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 应用映射、临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(GCT 结构、SAMPID 主键体系、eQTL 汇总字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NIH Common Fund、Broad Institute、GTEx Consortium、dbGaP/AnVIL 无任何商业利益关联。本页面不销售 GTEx 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GTEx 开放数据须按 GTEx Portal Data License 规范致谢;受控数据(个体级基因型、原始序列、精确表型)须通过 dbGaP 申请并遵守数据使用协议,禁止任何形式的重识别尝试。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
GTEx(Genotype-Tissue Expression,基因型-组织表达计划)是 NIH Common Fund 于 2010 年启动、Broad Institute 牵头分析的大型人类参考图谱:从约 1,000 名美国死后供体身上快速采集 54 个组织部位的样本,旗舰 V8 版包含 948 名供体、17,382 个 RNA-seq 样本,并为每位供体做了全基因组测序(中位深度 32×),系统测定了"哪些遗传变异在哪个组织里调控哪个基因"(eQTL/sQTL 目录)。
它解决的问题是基因组学的"最后一公里":GWAS 找到的致病变异 90% 以上落在非编码区,不知道它们干什么。GTEx 给出的答案范式是——把变异和组织特异性的基因表达/剪接联系起来。这一范式如今是功能基因组学的默认基础设施:旗舰论文(Science 2020)被引 4,800 余次(截至 2026-09),你读到的几乎每一篇"GWAS 位点机制解读"论文,都直接或间接用了 GTEx。
你可以用它来:查任意一个 GWAS 变异在哪个组织调控哪个基因、给 TWAS/孟德尔随机化提供表达参考面板、分析基因的组织特异性、训练"基因型→表达量"预测模型、或作为 TCGA 肿瘤研究的正常组织基线。
§1.1 摘要
GTEx 的技术设计可以概括为"四个统一":统一采集——多家生物样本来源站点(BSS)按标准化尸检 SOP 在死后数小时内完成多器官取材,每块组织分 PAXgene 固定与冷冻双份;统一测序——polyA 筛选链特异性 RNA-seq(Illumina,V8 中位 82.6M reads/样本)+ 全基因组测序(中位 32×);统一管道——STAR 比对、RSEM 定量、RNASeQC 质控(V8 基于 GRCh38 + GENCODE v26);统一分析——FastQTL + PEER 协变量的顺式 eQTL/sQTL(LeafCutter 剪接比)定位,qvalue 控制 5% FDR。V8 旗舰分析在 49 个样本量 ≥70 的组织中鉴定出 23,268 个 cis-eGene(覆盖 94.7% 的蛋白编码基因)与 427 万个 cis-eVariant,并发现细胞类型组成是组织调控差异的关键因素。2024 年 11 月发布的 V10 将 RNA-seq 样本扩至 19,616(官方 API 汇总,较 V8 +12%)、eQTL 分析样本 19,466(+23%),新增 16,760 个 smallRNA-seq 样本与 ~195× 深度体细胞 WGS(55 名供体 × 5-7 组织共 199 样本);2026 年 1 月的 V11 将注释升级至 GENCODE v47。数据双轨分发:汇总表达矩阵与 QTL 统计在 GTEx Portal 免注册开放下载;个体级基因型、原始序列与精确表型经 dbGaP 审批后在 AnVIL/Terra 云端提供。
§1.2 战略价值分析
范式开创维度:GTEx 之前,eQTL 研究基本局限在血液或淋巴母细胞系等易获取样本,"这个调控变异在肝脏还是大脑里起作用"无从回答。GTEx 首次把 eQTL 定位扩展到全身 50 余种组织,并定量证明了调控效应的强组织特异性——这直接改写了 GWAS 功能解读的方法论:从此"相关组织"成为机制研究的第一问。Science 2020 以整整一期特刊(旗舰论文 + 约 15 篇配套论文 + Perspective)发布 V8 结果,是功能基因组学领域罕见的待遇。
基础设施维度:GTEx 的产出早已超越"一个数据集",成为一组被嵌入全球分析流水线的标准件——PredictDB/S-PrediXcan 与 FUSION 的 TWAS 权重全部以 GTEx 为训练集;FUMA、Open Targets、LDlink 等 GWAS 注释平台内置 GTEx eQTL;UCSC Xena 与 recount3 用统一管道把 GTEx 与 TCGA 重算为可联合分析的矩阵;Enformer 等基因组深度模型以 GTEx 表达/QTL 为评测基准;GTEx Portal 与 API V2 则把"查一个变异/基因"做成免注册的公共查询服务。2024-2026 年,项目又通过 dGTEx(人类发育)与 NHP-dGTEx(灵长类)把同一范式扩展到发育时间轴与跨物种比较。
方法学溢出维度:GTEx 同时是统计遗传学方法的"练兵场"——PEER 因子混杂校正、FastQTL 的 beta 近似置换、MASH 跨组织效应共享、eCAVIAR/coloc 共定位、PrediXcan 表达插补,这些方法几乎都先在 GTEx 上建立再推广到整个领域。对 AI 从业者而言,GTEx 提供了罕见的"基因型→分子表型"监督信号:约 960 个个体 × 数万基因 × 54 组织,是训练与评测基因组基础模型(表达预测、变异效应预测、反卷积)最干净的公开监督数据源之一。
§1.3 横向对比
| 数据集 | 供体数 | 组织/细胞类型 | 模态 | 核心差异化 |
|---|---|---|---|---|
| GTEx v8 | 948 | 54 个组织部位 | WGS + bulk RNA-seq + QTL | 多组织 eQTL 事实标准;组织广度无可替代 |
| eQTLGen | 31,684 | 仅全血 | 芯片基因型 + 表达芯片/RNA-seq | 血液 eQTL 样本量最大,适合血液性状 |
| BLUEPRINT | 约 200 | 3 种血细胞 | RNA-seq + 表观(ChIP/甲基化) | 血细胞类型分辨率 + 表观多层 |
| Geuvadis | 462 | 仅 LCL 细胞系 | RNA-seq + 1000G 基因型 | 经典方法学基准,欧洲/非洲人群对照 |
| TCGA(正常组织) | 约 11,000 肿瘤 + 约 730 癌旁正常 | 33 癌种 | 多组学 | 癌症场景;正常样本为癌旁非健康组织 |
| Tabula Sapiens | 15 | 24 组织 | 单细胞 RNA-seq | 细胞类型分辨率,但无基因型、供体少 |
| Human Cell Atlas / GTEx snRNA | 16(GTEx 部分) | 8 组织 | 单核 RNA-seq | 细胞类型 eQTL 起点,规模尚小 |
GTEx 的不可替代性在三点:组织广度(54 部位,含 13 个脑区与性别特异组织)、统一的基因型-表达配对(同供体 WGS + 多组织 RNA-seq,支撑"个体 × 组织"二维设计)、以及汇总统计完全开放(免注册即可下载全部 eQTL 结果)。它的短板同样清晰:bulk 分辨率、死后样本、欧洲裔为主(详见 §7)。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2008 | GTEx 项目提议(Nature 编辑部回顾称其为"近十年的努力") |
| 2010 | NIH Common Fund 正式启动 GTEx;LDACC 设于 Broad Institute |
| 2013-05 | 项目描述论文发表(Nat Genet 45:580-585) |
| 2015-05-08 | pilot 旗舰论文(Science 348:648-660):175 供体 / 43 组织 / 1,641 样本;DOI: 10.1126/science.1262110 |
| 2017-10-11 | 中期旗舰论文(Nature 550:204-213):449 供体 / 44 组织(V6p);DOI: 10.1038/nature24277 |
| 2019-07-24 | V8 受控数据上 dbGaP(phs000424.v8.p2);原始序列改经 AnVIL 分发 |
| 2019-08-26 | V8 公开数据上 GTEx Portal(较 V7 样本 +49%、供体 +33%;新增 sQTL;“Transformed fibroblasts” 更名 “Cultured fibroblasts”) |
| 2020-09-11 | V8 旗舰论文(Science 369:1318-1330):838 供体 / 49 组织 / 15,201 样本的 QTL 分析;DOI: 10.1126/science.aaz1776 |
| 2020-11-20 | AnVIL 支持 V8 受控数据免费 egress 下载 |
| 2021-07 | snRNA-seq 试点数据发布(8 组织 / 16 供体 / 25 样本) |
| 2022-05 | Eraslan et al. 单核跨组织细胞图谱(Science,HCA 特刊之一) |
| 2022-07 | GTEx 16 组织样本映射至 HuBMAP 通用坐标框架(CCF) |
| 2023-02 | Portal API V2 发布(V1 于 2023-10-01 停用) |
| 2024-11-07 | V10 发布:RNA-seq 样本 +12%、eQTL 样本 +23%;新增 smallRNA-seq 16,760 样本与 ~195× 体细胞 WGS 199 样本;GENCODE v39;dbGaP phs000424.v10.p1 |
| 2024-12-18 | V10 完成全部门户可视化整合 |
| 2025-01-15 | dGTEx 前瞻论文发表(Nature 637:557-564;DOI: 10.1038/s41586-024-08244-9) |
| 2026-01-16 | V11 发布:样本同 V10,注释升级 GENCODE v47 |
| 2026-05-05 | dGTEx V1(342 RNA-seq + 37 WGS,40 供体;phs003838.v1.p1)与 NHP-dGTEx V1(421 猕猴 + 333 狨猴样本)发布 |
| 2026-05-28 | V11 bulk 文件修订:误并入的 LCM 试点 172 样本(5 组织)拆分为独立文件 |
§1.5 典型 AI 应用场景
- GWAS 位点功能解读:对任意 GWAS 显著变异,查询其在 49-54 个组织中的 eQTL/sQTL 效应,结合共定位(coloc/eCAVIAR)判断"变异→基因→组织→性状"链条,是复杂疾病机制研究的标配第一步。
- TWAS 与孟德尔随机化:以 GTEx 为表达参考面板训练弹性网络/SuShiE 权重(PredictDB、FUSION),把 GWAS 汇总统计转换为基因-性状关联,或作为 MR 的暴露工具变量。
- 组织特异性与疾病组织定位:利用 54 组织的中位表达与组织共享模式(mashR),为罕见病基因、药物靶点定位"最相关组织"。
- 基因型→表达预测模型:训练与评测序列/基因型到表达量的深度模型(如 Enformer 类架构以 GTEx eQTL 一致性作外部评测),或按供体分组的组织分类/表达插补基准。
- 肿瘤研究的正常基线:经 UCSC Xena Toil 或 recount3 统一重处理后,与 TCGA 联合做"肿瘤 vs 正常"差异表达与剪接分析。
- 细胞类型反卷积参考:bulk 表达 + 组织学 + snRNA-seq 试点构成训练反卷积模型(如 CIBERSORTx 类)的多层参照。
§2 医学背景
§2.1 ICD-11 应用锚定
GTEx 本身不是疾病专病数据集——它采集的是生前无组织特异性疾病指征的死后供体的"正常"组织。其医学价值在于为全疾病谱的复杂疾病遗传研究提供调控参考基线。下表按 ICD-11 锚定 GTEx 文献中最高频的应用疾病领域:
| 应用疾病领域 | ICD-11 | GTEx 的典型贡献 |
|---|---|---|
| 2 型糖尿病 | 5A11 | 胰岛/胰腺、脂肪、肌肉、肝脏 eQTL 解读 GWAS 位点(如 CDKAL1、TCF7L2 相关调控研究) |
| 急性心肌梗死 / 冠心病 | BA41 / BA52.Z | 冠状动脉、左心室、主动脉 eQTL;SORT1 肝脏特异性调控是降脂靶点发现的经典案例 |
| 原发性高血压 | BA00.Z | 血管(主动脉/胫动脉)与肾脏组织特异性表达与 eQTL 定位 |
| 精神分裂症 | 6A20 | 13 个脑区的 eQTL/sQTL;与 PGC GWAS 共定位是精神疾病机制研究标准流程 |
| 阿尔茨海默病 | 8A20 | 脑区特异性 sQTL 与小胶质细胞相关调控解读 |
| 哮喘 | CA23 | 肺、全血、EBV 转化淋巴细胞 eQTL 与免疫相关性状共定位 |
| 慢性阻塞性肺疾病 | CA22 | 肺组织 eQTL/sQTL 与 COPD GWAS 位点机制 |
| 恶性肿瘤(泛癌) | 2A00-2F9Z | 作为 TCGA 33 癌种的正常组织基线(须经统一重处理,见 §6.5 坑点 4);肿瘤易感性 GWAS 的组织定位 |
为什么"正常"二字要加引号:GTEx 供体死于各种急性事件与疾病(心脑血管意外、外伤等),采集的组织在解剖学上无该组织的特异性疾病,但绝非活体健康人——濒死期(agonal phase)、缺血与死后降解都写在数据里(见 §7.1 与 §6.5 坑点 6)。把它当"健康人参考"使用时必须理解这一前提。
§2.2 SNOMED CT 应用映射
| 应用疾病 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 2 型糖尿病 | 5A11 | 44054006 | Type 2 diabetes mellitus (disorder) |
| 急性心肌梗死 | BA41 | 22298006 | Myocardial infarction (disorder) |
| 冠状动脉粥样硬化 | BA52.Z | 53741008 | Coronary arteriosclerosis (disorder) |
| 原发性高血压 | BA00.Z | 38341003 | Hypertensive disorder, systemic arterial (disorder) |
| 精神分裂症 | 6A20 | 58214004 | Schizophrenia (disorder) |
| 阿尔茨海默病 | 8A20 | 26929004 | Alzheimer’s disease (disorder) |
| 哮喘 | CA23 | 195967001 | Asthma (disorder) |
| 慢性阻塞性肺疾病 | CA22 | 13645005 | Chronic obstructive airway disease (disorder) |
| 恶性肿瘤 | 2A00-2F9Z | 363346000 | Malignant neoplastic disease (disorder) |
§2.3 领域背景简介
人类基因组约 0.1% 的序列在个体间存在常见变异,其中绝大多数位于非编码区。GWAS 已在数万个位点上建立了变异与复杂性状/疾病的统计关联,但"关联"不等于"机制"——一个非编码变异可能影响某个基因在肝脏的表达、另一个基因在胰岛的剪接,也可能只是搭车(连锁不平衡)在真正的因果变异旁边。**eQTL(expression quantitative trait locus,表达数量性状位点)**正是连接变异与基因的统计桥梁:在人群尺度上检验"基因型是否预测表达量"。GTEx 把这座桥建到了全身 54 个组织部位——V8 证明 94.7% 的蛋白编码基因至少在 一个组织中受顺式调控,且调控效应高度组织特异:同一变异对 SORT1 的调控只见于肝脏,直接解释了该位点为何只与血脂和冠心病关联。对 AI 而言,GTEx 是少数同时具备"输入(基因型)—输出(表达量)—场景标签(组织/供体)"三元监督结构的公开数据,规模足以训练深度模型,干净程度足以做严格评测。
§2.4 临床/研究任务定义
| 研究任务 | 统计定义 | 标准参考 | 在 GTEx 中的操作化 |
|---|---|---|---|
| cis-eQTL 定位 | 基因型对表达量的线性回归(±1 Mb 窗口) | GTEx Consortium 2020 | FastQTL 名义扫描 + beta 近似置换;协变量 = 5 个基因型 PC + PEER + 平台/protocol;FDR 5%(qvalue) |
| cis-sQTL 定位 | 基因型对内含子剪接比的回归 | LeafCutter(Li et al. 2018) | LeafCutter intron excision ratio + FastQTL |
| 独立 eQTL 判定 | 条件性逐步回归剔除连锁信号 | GTEx Consortium 2020 | *_eQTL_independent.tar 逐步回归结果 |
| 跨组织效应共享 | 多组织联合效应估计 | Urbut et al. 2019 (MASH) | mashR:按效应大小与方向的模式聚类,LFSR 控制 |
| GWAS 共定位 | eQTL 与 GWAS 信号同因果变异的后验概率 | eCAVIAR / coloc / fastENLOC | 以 GTEx 各组织 eQTL 为一方输入 |
| TWAS | 表达插补后的基因-性状关联 | PrediXcan / FUSION | GTEx 训练的表达预测权重 + GWAS 汇总统计 |
| 组织特异性评分 | 表达在组织间的相对富集 | 文献惯例 | 中位 TPM 矩阵 + tau/TSI 指数 |
| 细胞类型反卷积 | bulk 表达 = 细胞比例 × 细胞类型表达的混合 | CIBERSORTx / MuSiC | GTEx bulk + 组织学/snRNA-seq 参考 |
§2.5 供体人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 美国多家生物样本来源站点(BSS)与器官获取组织统一采集;LDACC(Broad Institute)集中测序分析;NCI BBRB 负责生物样本库 |
| 采集时间 | 2010 年启动,持续收集至约 2018 年(V8 冻结);V9/V10 完成全部供体基因分型与追加测序 |
| 供体数(V8) | 948 名死后供体(其中 838 名同时有 WGS + RNA-seq,进入 Science 2020 QTL 分析) |
| 样本数(V8) | 17,382 个 RNA-seq 样本;15,201 个进入 49 组织 QTL 分析 |
| 样本数(V10) | 19,616 个 RNA-seq 样本 / 19,466 个 eQTL 分析样本(官方 API V2 汇总,截至 2026-09) |
| 年龄 | 20-70 岁(均值 52.8 ± 12.9);公开表型仅提供 10 岁区间(20-29、30-39、…、60-70),精确年龄属受控数据 |
| 性别 | 男性 67.1% / 女性 32.9%(V8 分析口径) |
| 祖源 | 欧洲裔 85.3% / 非裔 12.3% / 亚裔 1.4%(838 供体口径);精确种族属受控数据 |
| BMI | 入组要求 18.5-35(组织学评估研究口径,956 供体) |
| 死亡方式(Hardy 评分) | DTHHRDY 0-4 级:0 = 猝死(fast death)、4 = 长病程(slow death);公开表型含此字段 |
| 组织覆盖 | 并非每位供体都有全部 54 组织——取材受死亡情形与后勤限制,单供体组织数为部分观测(这是组织间配对分析的结构性限制) |
V10 组织样本量示例(官方 API V2,2026-09 抓取):最大为骨骼肌 818、全血 803、日晒皮肤(小腿)754、皮下脂肪 714、甲状腺 684、胫动脉 691、胫神经 670、培养成纤维细胞 652;最小为肾髓质 11、宫颈内膜 23、宫颈外膜 24、输卵管 29、膀胱 77、肾皮质 104。组织间样本量相差约 74 倍——这是理解 GTEx 一切统计功效差异的第一事实(见 §6.5 坑点 5)。
§2.6 金标准/参考标准
GTEx 无诊断标签,其"金标准"体现在统一采集与处理管道的多层质控上:
| 数据层 | 产生方式 | 产生者/工具 | 参考标准性质 |
|---|---|---|---|
| RNA-seq 定量 | STAR 比对 + RSEM 定量 + RNASeQC 质控(V8:GRCh38 + GENCODE v26;V10:v39;V11:v47) | GTEx LDACC(Broad Institute),gtex-pipeline 开源 | 社区事实标准的参考表达矩阵 |
| 基因型 | WGS 中位 32×;GATK 最佳实践 + SHAPEIT 定相;QC 后 43,066,422 SNV + 3,459,870 indel | LDACC | 个体级变异金标准(受控获取) |
| eQTL/sQTL 目录 | FastQTL + PEER 协变量 + qvalue(FDR 5%);外部数据集高复制率(Science 2020 附图 S12-S13) | GTEx Consortium | 领域默认参考 QTL 目录 |
| 组织病理评估 | 尸检组织学审查、自溶评分(AS 0-3)、病理注释(SMPTHNTS) | GTEx 项目病理学家团队 | 样本纳入/排除与混杂校正依据 |
| 组织学图像 | PAXgene 固定石蜡切片数字化扫描,50+ 组织类型 | NCI BBRB;经 NCI Imaging Data Commons 开放 | 公开可视化质控与影像研究资源 |
| 死亡急缓分级 | 改良 Hardy 评分(0-4) | GTEx 临床数据团队 | 濒死期混杂的关键协变量 |
采样协议(理解数据的前提):供体由家属决策者签署知情同意;死亡后数小时内按标准手术流程完成多器官取材;每块组织分两份——PAXgene 固定(组织学/RNA)与 -80°C 冷冻;RIN 由 Bioanalyzer 测定;脑部分 13 个亚区取材;全部 RNA-seq 用 polyA 筛选链特异性建库在 Illumina 平台完成。
§3 数据集规格
§3.0 版本抉择矩阵
GTEx 多版本并存且各有用途,30 秒选型:
| 你的需求 | 推荐版本 | 注释/坐标 | 理由 |
|---|---|---|---|
| 复现 Science 2020 旗舰分析与绝大多数教程、使用现成 TWAS 权重(PredictDB/FUSION 多数基于 V8) | V8 | GRCh38 / GENCODE v26 | 生态最成熟:broadinstitute/gtex-v8 官方复现仓库、全部旗舰图表、API 稳定支持;论文可比性最好 |
| 最大 RNA-seq 样本量、smallRNA 与体细胞突变、门户最新可视化 | V10 | GRCh38 / GENCODE v39 | 样本 +12%、eQTL 功效 +23%;eQTL Dashboard/Calculator 等新工具仅支持 V10 |
| 需要最新 GENCODE v47 基因模型 | V11 | GRCh38 / GENCODE v47 | 样本同 V10 仅注释升级;注意 API 尚未接入、LCM 样本已拆分(2026-05-28 修订) |
| 与 GRCh37 时代的旧文献/旧权重对接 | V7 | GRCh37 / GENCODE v19 | 最后一版旧坐标系;新工作不建议 |
| 发育阶段(出生到成年)研究 | dGTEx V1 | GRCh38 | 2026-05 首发,342 RNA-seq + 37 WGS、40 供体;phs003838.v1.p1 |
| 灵长类跨物种比较 | NHP-dGTEx V1 | — | 猕猴 + 狨猴 754 样本;AnVIL 公开 workspace |
一句话结论:做 eQTL/TWAS 复现与工具链对接选 V8;开新课题且要吃满样本量选 V10(注意下游工具仍以 V8 为主);仅在注释版本是硬需求时上 V11。
V8 vs V10 vs V11 关键差异速查:
| 维度 | V8 | V10 | V11 |
|---|---|---|---|
| 发布 | 2019(公开)/ 2020-09 旗舰论文 | 2024-11-07 | 2026-01-16 |
| GENCODE 注释 | v26 | v39 | v47 |
| RNA-seq 样本 | 17,382 | 19,616(+12%,API 汇总) | 同 V10(LCM 172 样本已拆分) |
| eQTL 分析样本 | 15,201(49 组织) | 19,466(+23%) | 同 V10 |
| smallRNA-seq | 无 | 16,760 样本(含 cis-QTL) | 同 V10 |
| 体细胞 WGS | 无 | ~195×,55 供体 × 5-7 组织 = 199 样本 | 同 V10 |
| 供体基因分型 | 838/948(分析口径) | 全部供体(V9 补齐) | 同 V10 |
| dbGaP | phs000424.v8.p2 | phs000424.v10.p1(支持 DUOS) | phs000424.v10.p1 |
| Portal API V2 | ✅ gtex_v8 | ✅ gtex_v10 | ❌ 未接入 |
| 门户可视化 | 历史版本 | 当前展示 | 整合中 |
§3.1 模态详细说明
GTEx 包含四大数据模态:
- bulk RNA-seq 表达(核心):polyA 筛选链特异性建库,Illumina 平台;V8 中位 82.6M reads/样本。产出三个层次的矩阵:原始 counts(gene_reads)、TPM(gene_tpm)、按组织中位 TPM(gene_median_tpm);定量器为 RSEM/RNASeQC,基因 ID 为带版本后缀的 Ensembl ID。
- 全基因组基因型:每供体 WGS 中位 32×,GATK + SHAPEIT;V8 分析含 4,307 万 SNV 与 346 万 indel(受控获取 VCF)。V9 补齐全部供体分型。
- QTL 汇总统计(开放):49-54 组织的 cis-eQTL/cis-sQTL 显著对与全扫描、独立 eQTL、trans-eGene、精细定位(CAVIAR/CaVEMaN/DAPG)、协变量与表达 BED 输入矩阵。
- 扩展模态:组织学图像(50+ 组织,NCI IDC);eGTEx 表观数据(H3K27ac ChIP-seq、m6A、WGBS);V10 新增 smallRNA-seq 16,760 样本与 ~195× 体细胞 WGS 199 样本;snRNA-seq 试点(8 组织 / 16 供体)。
§3.2 样本量拆分(按组织,V10 官方 API 口径)
V10 共 54 个组织条目(52 组织 + 2 细胞系),下表按 RNA-seq 样本量降序列出全部 54 项(官方 API V2 tissueSiteDetail 汇总,2026-09 抓取):
| 组织 | RNA-seq | eQTL | 组织 | RNA-seq | eQTL |
|---|---|---|---|---|---|
| Muscle - Skeletal | 818 | 816 | Brain - Cerebellar Hemisphere | 277 | 276 |
| Whole Blood | 803 | 800 | Spleen | 277 | 277 |
| Skin - Sun Exposed (Lower leg) | 754 | 751 | Brain - Cortex | 270 | 268 |
| Adipose - Subcutaneous | 714 | 711 | Brain - Frontal Cortex (BA9) | 269 | 268 |
| Artery - Tibial | 691 | 689 | Artery - Coronary | 268 | 268 |
| Thyroid | 684 | 681 | Liver | 262 | 261 |
| Nerve - Tibial | 670 | 667 | Brain - Hypothalamus | 257 | 256 |
| Cells - Cultured fibroblasts | 652 | 649 | Brain - Hippocampus | 255 | 254 |
| Skin - Not Sun Exposed | 651 | 649 | Brain - Putamen | 254 | 253 |
| Esophagus - Mucosa | 614 | 614 | Brain - Anterior cingulate (BA24) | 233 | 233 |
| Lung | 604 | 601 | Small Intestine - Terminal Ileum | 207 | 206 |
| Adipose - Visceral (Omentum) | 587 | 584 | Brain - Spinal cord (cervical c-1) | 204 | 203 |
| Esophagus - Muscularis | 561 | 561 | Ovary | 193 | 192 |
| Breast - Mammary Tissue | 514 | 511 | Brain - Substantia nigra | 183 | 183 |
| Colon - Transverse | 479 | 478 | Brain - Amygdala | 181 | 180 |
| Heart - Atrial Appendage | 461 | 460 | Minor Salivary Gland | 181 | 180 |
| Heart - Left Ventricle | 452 | 450 | Vagina | 170 | 170 |
| Colon - Sigmoid | 419 | 418 | Uterus | 153 | 152 |
| Testis | 414 | 413 | Kidney - Cortex | 104 | 103 |
| Stomach | 407 | 407 | Bladder | 77 | 77 |
| Esophagus - Gastroesophageal Jct. | 403 | 403 | Fallopian Tube | 29 | — |
| Pancreas | 362 | 362 | Cervix - Ectocervix | 24 | — |
| Cells - EBV-transformed lymphocytes | 327 | 326 | Cervix - Endocervix | 23 | — |
| Pituitary | 313 | 311 | Kidney - Medulla | 11 | — |
| Brain - Caudate | 300 | 298 | Adrenal Gland | 295 | 295 |
| Brain - Nucleus accumbens | 285 | 284 | Prostate | 282 | 281 |
| Brain - Cerebellum | 266 | 264 | (合计) | 19,616 | 19,466 |
注:4 个组织(输卵管、宫颈两处、肾髓质)样本量过小,仅提供 RNA-seq 数据、不做 eQTL 分析;脑共 13 个亚区。V8(Science 2020)分析口径为 49 组织 × 15,201 样本 × 838 供体,要求每组织 ≥70 人且同时具备 WGS 与 RNA-seq。
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 表达矩阵 | GCT(gzip 文本) | 第 1 行 #1.2,第 2 行 行数\t列数,表头 Name\tDescription\t各 SAMPID;pandas 读法见 §6.1 |
| 样本/供体注释 | TSV | SampleAttributesDS(样本级 ~30 列)、SubjectPhenotypesDS(供体级 4 列) |
| eQTL 汇总 | TSV(每组织一对文件) | *.signif_variant_gene_pairs.txt.gz(显著对)+ *.egenes.txt.gz(基因级,含阈值) |
| eQTL 输入 | BED + covariates TXT | 标准化表达 BED(含 TSS 注释列)与协变量文件,可直接喂 tensorQTL |
| 受控个体级 | VCF / BAM / CRAM / ASE TSV | dbGaP 审批后经 AnVIL/Terra 获取 |
| 注释参考 | GTF | gencode.v26.GRCh38.genes.gtf(V8)等 |
| 云端表格 | Parquet / PFB(AnVIL Gen3) | Terra Data Explorer 导出 |
| 程序化访问 | GTEx Portal API V2(REST/JSON) | datasetId:gtex_v8 / gtex_v10 / gtex_snrnaseq_pilot |
§3.4 存储大小
| 形态 | 量级 | 备注 |
|---|---|---|
| V8 开放下载全集 | 数 GB | TPM 矩阵 gzip 数百 MB;counts 矩阵 gzip 约 1-2 GB;49 组织 eQTL/sQTL 汇总解压后十余 GB 量级 |
| V10 开放下载全集 | 十余 GB | 新增 smallRNA 计数矩阵 |
| 受控 RNA-seq BAM/CRAM | 数十至百 TB 量级 | 17,000-19,600 样本 × 中位 82.6M reads |
| 受控 WGS VCF/BAM | 百 TB 量级 | 约 960 供体 × 32×;V10 体细胞 WGS 另有 ~195× 深测序 |
| 单机工作集建议 | 16-32 GB 内存 | TPM 矩阵 float32 载入约 4 GB;counts 更大,建议按列分块或转 Parquet(见 §6.8) |
§3.5 标注方式
GTEx 没有人工"标签",其标注是三层计算产物:
- 定量标注(自动):RNA-seq 经统一管道转成基因/转录本表达量与剪接比;WGS 经 GATK/SHAPEIT 转成定相基因型——这是全部下游分析的"原始标签"。
- 关联标注(统计):FastQTL 把"变异-基因"关联显著性固化为 eQTL 目录(FDR 5%),相当于给 427 万个变异打上"在某组织调控某基因"的机器标注。
- 质量标注(专家):项目病理学家对每块组织做组织学审查与自溶评分;样本属性表中的 RIN、缺血时间、Hardy 评分构成质量协变量层。
尸体供体 ──取材──> 组织样本(SAMPID)
├─ PAXgene 固定 ──> 组织学图像 + 病理学家自溶评分
└─ 冷冻 ──> RNA-seq ──> STAR/RSEM ──> 表达矩阵
供体血液/组织 ──> WGS ──> GATK/SHAPEIT ──> 定相基因型
表达矩阵 × 基因型 × 协变量(PEER/PC/平台) ──> FastQTL ──> eQTL/sQTL 目录
§3.6 标注者资质
不适用众包标注概念。组织病理评估由 GTEx 项目病理学家团队完成(自溶评分与病理注释);分子定量全部由 LDACC(Broad Institute)统一管道自动完成,管道代码开源(broadinstitute/gtex-pipeline);QTL 分析由 GTEx Consortium 分析工作组(Aguet 等)以公开可复现代码完成(broadinstitute/gtex-v8,BSD-3-Clause)。Science 2020 旗舰分析在外部数据集上验证了 eQTL 的高复制率(论文附图 S12-S13)。
§3.7 数据采集时间范围
2010 年项目启动后持续收集,V8 冻结前的采集构成 948 供体主体(组织学评估研究口径为 956 名合格供体);V9/V10 阶段无新增供体募集,而是补齐基因分型并追加 smallRNA 与深度体细胞测序。数据的"时间属性"主要是死后的:缺血时间(SMTSISCH,组织离体到固定的小时数)与死后间隔(PMI)是质量而非时间轴变量。
§3.8 地理覆盖
单国(美国)多站点:供体招募与取材由多家生物样本来源站点与器官获取组织完成,统一送 LDACC 测序。地理覆盖的局限不在采样点数量,而在人群代表性——供体以美国欧洲裔为主(85.3%),对非洲、亚洲、拉丁美洲人群的代表性有限(详见 §7.3 跨人群泛化)。
§3.9 采集设备规格
| 环节 | 平台/试剂 | 说明 |
|---|---|---|
| RNA 提取与质控 | Qiagen PAXgene Tissue RNA/miRNA Kit;Bioanalyzer(RIN) | 组织学评估研究:956 供体、40 组织类型 |
| RNA-seq 建库 | polyA 筛选、链特异性 | Illumina TruSeq 体系 |
| RNA-seq 测序 | Illumina HiSeq 2000 / HiSeq X(协变量含平台) | V8 中位 82.6M reads/样本 |
| WGS | Illumina,中位 32× | GATK best practices + SHAPEIT 定相 |
| 体细胞 WGS(V10) | ~195× 深度 | 55 供体 × 5-7 组织 = 199 样本 |
| 组织固定 | PAXgene 固定 + 石蜡包埋(PFPE)/ -80°C 冷冻双份 | 组织学图像经 NCI IDC 开放 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 供体招募与知情同意 | 生物样本来源站点(BSS)+ 器官获取组织;家属决策者签署同意 | 死亡后数小时内启动;ELSI 研究(Siminoff 等)专门优化了死后捐献的知情沟通 |
| 2. 尸检取材 | 标准化手术 SOP,最多 54 组织部位/供体;PAXgene + 冷冻双份 | 记录缺血时间、自溶评分、Hardy 评分——后续一切混杂校正的源头 |
| 3. 分子测定 | LDACC(Broad)集中:polyA 链特异性 RNA-seq(82.6M reads 中位)+ WGS 32× | 统一批次设计;平台/批次变量写入协变量 |
| 4. 定量管道 | gtex-pipeline:STAR → RSEM → RNASeQC;GATK + SHAPEIT | V7(GRCh37/v19)→ V8(GRCh38/v26)→ V10(v39)→ V11(v47)坐标与注释演进 |
| 5. QTL 分析 | FastQTL + PEER(n<150→15;150-249→30;≥250→35)+ 5 基因型 PC | 产出开放 eQTL/sQTL 目录、独立信号、精细定位、MASH 跨组织共享 |
| 6. 双轨发布 | GTEx Portal(开放汇总)+ dbGaP/AnVIL(受控个体级) | V8 → phs000424.v8.p2;V10 → phs000424.v10.p1;门户可视化 + API V2 |
| 7. 二次分发 | UCSC Xena / recount3 / Expression Atlas(E-GTEX-8)/ FUMA / Open Targets / PredictDB | 与 TCGA 统一重算、嵌入 GWAS 注释平台与 TWAS 权重库 |
§4 数据结构详解
§4.0 目录结构预览
gtex_v8_open_access/
├── rna_seq_data/
│ ├── GTEx_Analysis_2017-06-05_v8_RNASeQCv1.1.9_gene_tpm.gct.gz # 基因级 TPM(56,200 基因 × 17,382 样本,最常用)
│ ├── GTEx_Analysis_2017-06-05_v8_RNASeQCv1.1.9_gene_reads.gct.gz # 基因级原始 counts(差异表达请用它)
│ ├── GTEx_Analysis_2017-06-05_v8_RNASeQCv1.1.9_gene_median_tpm.gct.gz # 按组织中位 TPM(组织特异性速查)
│ └── ...(转录本级 TPM/reads、exon、junction 矩阵)
├── annotations/
│ ├── GTEx_Analysis_v8_Annotations_SampleAttributesDS.txt # 样本属性(SAMPID/组织/RIN/缺血时间/批次,约 30 列)
│ ├── GTEx_Analysis_v8_Annotations_SubjectPhenotypesDS.txt # 供体表型(SUBJID/SEX/AGE 区间/DTHHRDY)
│ └── GTEx_Analysis_v8_Annotations_SampleAttributesDD.xlsx # 字段定义数据字典
├── single_tissue_qtl_data/
│ ├── GTEx_Analysis_v8_eQTL.tar # 49 组织:*.signif_variant_gene_pairs.txt.gz + *.egenes.txt.gz
│ ├── GTEx_Analysis_v8_sQTL.tar # 49 组织 sQTL(LeafCutter)
│ ├── GTEx_Analysis_v8_eQTL_independent.tar # 逐步回归的独立 eQTL
│ ├── GTEx_Analysis_v8_eQTL_covariates.tar.gz # 每组织 PEER + PC + 平台协变量
│ ├── GTEx_Analysis_v8_eQTL_expression_matrices.tar# 每组织标准化表达 BED(tensorQTL 可直接用)
│ ├── GTEx_Analysis_v8_trans_eGenes_fdr05.txt # trans-eQTL 基因
│ └── GTEx_v8_finemapping_{CAVIAR,CaVEMaN,DAPG}.tar# 三种方法精细定位
├── reference/
│ └── gencode.v26.GRCh38.genes.gtf # V8 基因模型(⚠️ 与 V10 的 v39 不通用)
└── protected(dbGaP 审批后,经 AnVIL/Terra workspace AnVIL_GTEx_V8_hg38)
├── phg000881.v1.GTEx_WGS.genotype-calls-vcf.c1/ # WGS 定相 VCF
├── RNA-seq / WES / WGS BAM-CRAM # 原始序列
├── ASE 表(等位基因特异性表达)
└── 扩展表型(精确年龄、精确种族、未过 QC 样本的表达矩阵)
§4.1 DAIMS 标准化字段描述表
核心表:SampleAttributesDS(样本级,每行一个 RNA-seq 样本)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SAMPID | TEXT | 样本 ID:GTEX-{供体}-{组织码}-{等分}-SM-{批次} |
GTEX-1117F-0226-SM-5GZZ7 | 主键;前两段解析出 SUBJID | 无 | 不允许缺失 | 定长分段格式 |
| SMTS | TEXT | 组织大类(约 30 类) | “Brain” | 粗粒度组织标签 | 无 | 不允许缺失 | 枚举 |
| SMTSD | TEXT | 组织明细(54 类) | “Brain - Cortex” | 最常用组织标签 | 无 | 不允许缺失 | 54 枚举 |
| SMRIN | FLOAT | RNA 完整性(越高越好) | 7.3 | 质量过滤/协变量 | Bioanalyzer 测定误差 ±0.5 | 极少数缺失 | 约 2-10 |
| SMTSISCH | FLOAT | 组织缺血时间(分钟) | 510 | 死后混杂协变量 | 记录误差 | 部分缺失(MNAR:死亡情形相关) | 0-2000+ |
| SMATSSCR | FLOAT | 自溶评分(0-3) | 1 | 质量协变量 | 病理学家间差异 | 部分缺失 | 0/1/2/3 |
| SMGEBTCH | TEXT | 表达批次 | “GTEx_Batch_1” | 批次校正 | 无 | 不允许缺失 | 枚举 |
| SMNABTCH | TEXT | 核酸批次 | — | 批次校正 | 无 | 部分缺失 | 枚举 |
| SMCENTER | TEXT | 采集中心编码 | “B1” | 站点效应分析 | 无 | 部分缺失 | 枚举 |
核心表:SubjectPhenotypesDS(供体级,每行一个供体)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SUBJID | TEXT | 供体 ID | GTEX-1117F | 供体级分组/防泄漏主键 | 无 | 不允许缺失 | GTEX-XXXXX |
| SEX | INT | 生理性别 | 1 | 协变量/公平性分层 | 记录 | 不允许缺失 | 1=男 / 2=女 |
| AGE | TEXT | 年龄段(10 岁区间) | “50-59” | 协变量;精确年龄属受控 | 区间化脱敏 | 不允许缺失 | 20-29 … 60-70 |
| DTHHRDY | INT | 改良 Hardy 死亡急缓评分 | 2 | 濒死期混杂校正 | 临床判定 | 部分缺失(=0 突发死亡者常缺) | 0-4 |
核心表:eGenes(每组织一个文件,基因级 QTL 结果)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| gene_id | TEXT | Ensembl ID + 版本后缀 | ENSG00000012048.20 | 主键;后缀随 GENCODE 版本变化 | 无 | 不允许缺失 | v26/v39/v47 |
| gene_name | TEXT | 基因符号 | BRCA1 | 可读标识 | 别名歧义 | 少数缺失 | HGNC |
| pval_nominal | FLOAT | 最优变异的名义 p 值 | 1.2e-40 | 关联强度 | 多重检验前 | — | (0,1] |
| slope | FLOAT | ALT 等位基因效应量(beta) | 0.42 | 效应方向与大小 | 标准化表达单位 | — | 实数 |
| slope_se | FLOAT | 效应量标准误 | 0.03 | MR/共定位输入 | — | — | >0 |
| qval | FLOAT | 基因级 FDR q 值 | 3.1e-12 | eGene 判定(<0.05) | — | — | [0,1] |
| pval_nominal_threshold | FLOAT | 该基因 5% FDR 对应的名义 p 阈值 | 2.9e-5 | 从 all-pairs 中取显著对的组织特异阈值 | 随组织样本量变化 | — | (0,1) |
核心表:表达 GCT(基因 × 样本矩阵)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Name | TEXT | Ensembl ID + 版本后缀 | ENSG00000012048.20 | 行主键 | 无 | 不允许缺失 | 56,200 行(V8) |
| Description | TEXT | 基因符号 | BRCA1 | 可读标识 | 同名别名 | — | HGNC |
| 各 SAMPID 列 | FLOAT | 该样本 TPM(或 counts) | 12.37 | 特征矩阵 | 定量误差随表达量下降增大 | 未表达=0(结构零,非缺失) | TPM ≥0 |
§4.2 标签/关键结果分布统计
| 维度 | 数值 | 说明 |
|---|---|---|
| cis-eGene 总数(V8) | 23,268 | 18,262 蛋白编码(占可检出的 94.7%)+ 5,006 lincRNA;FDR 5% |
| cis-eVariant 总数(V8) | 4,278,636 | 占 MAF≥0.01 变异的 43% |
| cis-sGene 总数(V8) | 14,424 | 12,828 蛋白编码(66.5%)+ 1,600 lincRNA |
| 单组织 eGene 最高(V10) | Testis:22,694 | 官方 API eGeneCount;脑区普遍较低 |
| eQTL 发现数 vs 组织样本量 | Spearman ρ = 0.95(eQTL)/ 0.92(sQTL) | 功效由样本量主导;大效应 eGene 在 n>200 组织即饱和(约 1,500 个) |
| 大效应 eQTL 占比 | 各组织平均 22% 的 cis-eQTL 效应 >2 倍 | 多数 eQTL 效应小 |
| 性别特异组织 | 卵巢/子宫/阴道/宫颈/输卵管(女);前列腺/睾丸(男) | 单性别设计,非缺失 |
| 组织样本量极差(V10) | 11(肾髓质)至 818(骨骼肌) | 相差约 74 倍 |
| 细胞系 | LCL(EBV 转化淋巴细胞)327、培养成纤维细胞 652(V10) | 非 in vivo 组织,解释时注意 |
§4.3 关键字段描述性统计
- 每供体平均组织数约 17-18 个(17,382 样本 / 948 供体),但分布长尾——组织覆盖为部分观测,组织间两两配对的共享供体数常远小于单组织样本量。
- RIN 组织差异显著(NCI 组织学评估,956 供体):骨骼肌均值 7.70、小唾液腺 7.48、食管黏膜 7.18 最高;肾皮质 4.34、肾髓质 4.73、脾 4.63、胰腺 5.20 最低;40 组织中 24 个均值 RIN ≥6。
- 表达组织间方差远大于个体间方差(Melé et al. 2015, Science 348:660-665)——组织是表达数据第一主成分。
- 高个体间差异基因富集性别、祖源与年龄相关信号(同上文)。
- 测序深度:RNA-seq 中位 82.6M reads;WGS 中位 32×;体细胞 WGS(V10)~195×。
§4.4 数据层级关系(ID 体系)
SUBJID 供体(GTEX-1117F,V8 = 948 人)
├─ WGS 基因型(每人 1 份,受控 VCF)
└─ SAMPID 组织样本(GTEX-1117F-0226-SM-5GZZ7,每人 1-54 个)
├─ 第 2 段 = 组织采样部位码(0226)
├─ 第 4 段起 SM-* = 测序批次
├─ 表达矩阵列名 = SAMPID
└─ SampleAttributesDS 中 SAMPID → SMTS/SMTSD 组织标签、RIN、批次
eQTL 文件:按 SMTSD 组织每组织一套(signif pairs + eGenes + covariates + BED)
- SAMPID 解析是高频踩坑点:供体 ID = 前两段(
GTEX-1117F),第 3 段是组织码而非供体的一部分;同一供体的多组织样本必须视为同一样本来源(见 §6.5 坑点 3)。 - 组织标签两级:SMTS(大类,如 “Brain”)/ SMTSD(明细,如 “Brain - Cortex”);eQTL 文件命名用下划线版(
Brain_Cortex)。 - GCT 行键
Name含 GENCODE 版本后缀(.20= v26、.39对应 v39 体系)——跨版本/跨工具连接前必须统一或剥离后缀(见 §6.5 坑点 1)。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 表现 | 机制 | 对 AI 的影响与处理 |
|---|---|---|---|
| 结构性缺失(设计) | 供体组织覆盖不全(无人拥有全部 54 组织) | 死亡情形与取材后勤 | 跨组织分析用共享供体子集或 mashR 借信息共享;勿当 MCAR 丢弃 |
| 结构性缺失(设计) | 性别特异组织单性别 | 生物学 | 性别比较分析须排除这 7 个组织 |
| QC 排除(信息性) | 低 RIN/高自溶样本被移出 Analysis Freeze | 质量过滤 | 门户矩阵只有 QC 通过样本;全量(含未过 QC)矩阵在受控层 |
| 字段缺失(MNAR) | SMTSISCH 缺血时间、SMATSSCR 自溶评分部分缺失 | 死亡情形相关(如院外猝死记录不全) | 缺失指示变量 + 协变量模型;勿均值填充后当完整协变量 |
| 表型区间化(脱敏) | AGE 仅 10 岁区间、精确种族不可得 | 隐私保护 | 精细年龄/种族分析须申请 dbGaP 受控表型 |
| 表达零值(非缺失) | 未表达基因 TPM=0 | 生物/技术检测限 | counts 差异表达模型天然处理;勿把 0 当缺失填充 |
§5 数据划分与使用建议
§5.1 官方数据划分
GTEx 官方不提供 train/validation/test 划分。 这与其定位一致:它是关联分析与参考面板资源,不是监督学习竞赛集。不同用途的"标准做法"分别是:
- eQTL/sQTL 关联分析:不做 ML 式划分,用全样本 + FDR 控制(qvalue 5%);显著性以置换检验校准。
- 表达插补(TWAS 权重训练):PrediXcan/FUSION 惯例为每组织内嵌交叉验证(如 10 折)选择弹性网络超参,报交叉验证 R² 并只发布 CV 显著的基因模型。
- 监督学习基准(组织分类、表达预测):社区惯例为按 SUBJID 分组的随机划分(见 §5.2)或按染色体留出(序列→表达模型,如 chr8/9/10 作测试的 Enformer 惯例)。
- 外部复现:用独立队列(Geuvadis、BLUEPRINT、eQTLGen、CommonMind)做 π1 复制率评估(见 §7.8)。
§5.2 推荐划分策略
- 按 SUBJID 分组(最重要):同一供体的多组织样本同属一个"个体",必须落在同一侧——否则模型靠"认出这个人"作弊(§6.5 坑点 3)。scikit-learn 用
GroupShuffleSplit(groups=subjid)。 - 按祖源分层:欧洲裔占 85.3%,随机划分会让少数祖源在测试集几乎缺席;跨人群泛化研究应做"留一族群验证"(train EUR → test AFR)。
- 按染色体留出(序列模型):基因型/序列→表达模型按整条染色体划分 train/test,避免顺式窗口泄漏(±1 Mb 邻域内的序列上下文共享)。
- 按组织留出(跨组织泛化):留一组织验证(如 47 组织训练 → 睾丸/脑皮质测试),评估模型对新组织的迁移。
- 时间不可划分:数据无时间轴(死后快照),不存在时序外验证;最近的"准外部"轴是采集中心(SMCENTER)与表达批次(SMGEBTCH)。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
attr = pd.read_csv("GTEx_Analysis_v8_Annotations_SampleAttributesDS.txt",
sep="\t", low_memory=False)
attr["SUBJID"] = attr["SAMPID"].str.split("-").str[:2].str.join("-")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(attr, groups=attr["SUBJID"]))
train_donors = set(attr.iloc[tr]["SUBJID"])
test_donors = set(attr.iloc[te]["SUBJID"])
assert len(train_donors & test_donors) == 0 # 供体级零泄漏验证
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 按 SAMPID 而非 SUBJID 划分,同一供体多组织跨两侧 | 高 | GroupShuffleSplit(groups=SUBJID) + 断言零交集 |
| 2 | 序列→表达模型中同源基因/邻近基因跨两侧共享顺式序列上下文 | 高 | 按染色体划分(Enformer 惯例) |
| 3 | 用全部 49 组织 eQTL 汇总统计训练"组织特异性"分类器,再在其中部分组织上评估 | 中高 | 留出组织完全不参与训练与特征选择 |
| 4 | TWAS 权重训练集(GTEx)与 GWAS 样本重叠 | 中 | 选用声明样本独立的 GWAS 汇总统计 |
| 5 | 反卷积模型的参考谱(snRNA)与待解卷 bulk 来自同一供体且未声明 | 中 | 按供体留出参考谱构建 |
§5.4 交叉验证建议
- 通用:5 折或 10 折按 SUBJID 分组交叉验证。
- 表达插补模型:组织内嵌套 CV(外层报性能、内层调超参),与 PrediXcan 口径保持一致以便横向比较。
- 小样本组织(<70,如肾皮质 104、膀胱 77):优先留一供体交叉验证(LODO),避免单次划分的运气成分。
§5.5 外部验证
GTEx 结果的经典外部验证路径:Geuvadis(LCL,含 YRI 非洲人群)、BLUEPRINT(血细胞)、eQTLGen(31,684 人全血)、CommonMind(背外侧前额叶)、TCGA 正常组织(癌旁,注意非健康基线)。Science 2020 已系统证明 GTEx cis-eQTL 在外部数据集中的高复制率(附图 S12-S13)——复现实验应把"与 GTEx 方向的 π1/符号一致性"作为第一指标。
§6 AI 就绪指南
§6.0 云端快速启动
零门槛入口一:GTEx Portal 网页查询(免注册)。Gene Page 查任意基因的组织表达小提琴图;Locus Browser 查任意变异的 eQTL/sQTL;eQTL Dashboard 批量查询;eQTL Calculator 测试自定义变异-基因对(V10)。适合"只查几个位点"的场景,完全不需要下载。
零门槛入口二:GTEx Portal API V2(免注册)。REST/JSON 接口,
datasetId支持gtex_v8/gtex_v10/gtex_snrnaseq_pilot:# 查 BRCA1 在各组织的中位表达(V8) curl "https://gtexportal.org/api/v2/expression/medianGeneExpression?gencodeId=ENSG00000012048.20&datasetId=gtex_v8" # 查某变异在甲状腺的 eQTL curl "https://gtexportal.org/api/v2/association/singleTissueEqtl?variantId=chr17_43071077_G_A_b38&datasetId=gtex_v8"零门槛入口三:第三方重算矩阵(免申请)。Expression Atlas 的 E-GTEX-8 实验页可在线浏览并下载归一化矩阵;UCSC Xena 提供 GTEx + TCGA 统一 Toil 重算矩阵;recount3 提供统一 recount 的 counts/大矩阵 R 接口。
受控云端:AnVIL/Terra。dbGaP 审批通过后,在 Terra workspace
AnVIL_GTEx_V8_hg38中直接对 VCF/BAM 做云端计算(免下载);V8 受控数据自 2020-11 起支持免费 egress 下载到本地。
§6.1 快速上手
# ========================================
# GTEx 快速上手 — 开放表达矩阵版
# 环境要求: pandas, numpy
#
# ⚠️ 目录结构预期(从 GTEx Portal 开放下载页获取):
# ./data/gtex_v8/
# ├── GTEx_Analysis_2017-06-05_v8_RNASeQCv1.1.9_gene_tpm.gct.gz
# └── GTEx_Analysis_v8_Annotations_SampleAttributesDS.txt
#
# GCT 格式:第 1 行 "#1.2",第 2 行 "56200\t17382"(维度),
# 第 3 行才是表头 → 必须 skiprows=2 且按 \t 分隔。
# 矩阵列名 = SAMPID,需经 SampleAttributes 映射组织标签。
# ========================================
import pandas as pd
DATA = "./data/gtex_v8"
# 1) 读 TPM 矩阵(约 4 GB 内存,float32 转换后约 2 GB)
tpm = pd.read_csv(f"{DATA}/GTEx_Analysis_2017-06-05_v8_RNASeQCv1.1.9_gene_tpm.gct.gz",
sep="\t", skiprows=2)
tpm = tpm.rename(columns={"Name": "gene_id", "Description": "gene_symbol"})
print(tpm.shape) # (56200, 17384) 基因 × (2 + 样本)
# 2) 读样本属性并解析供体 ID
attr = pd.read_csv(f"{DATA}/GTEx_Analysis_v8_Annotations_SampleAttributesDS.txt",
sep="\t", low_memory=False)
attr["SUBJID"] = attr["SAMPID"].str.split("-").str[:2].str.join("-")
tissue_of = dict(zip(attr["SAMPID"], attr["SMTSD"]))
# 3) 示例:BRCA1 在 5 个组织的中位表达
row = tpm.loc[tpm["gene_symbol"] == "BRCA1"].iloc[0, 2:]
expr = row.rename(index=tissue_of).astype(float)
print(expr.groupby(level=0).median().sort_values(ascending=False).head())
# 4) 示例:构建"组织分类"特征表(样本 × 基因子集)
genes = tpm["gene_symbol"].head(500)
X = tpm.set_index("gene_symbol").loc[genes].T # 样本 × 基因
X.insert(0, "tissue", [tissue_of[s] for s in X.index])
print(X.shape)
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| 开放汇总数据(Portal 下载页) | https://gtexportal.org/home/downloads/adult-gtex | 数 GB(V8)/ 十余 GB(V10) | 免注册直接下载;亦可 wget 直链 GCS bucket(storage.googleapis.com/gtex_analysis_v8/...) |
| Portal API V2 | https://gtexportal.org/api/v2/redoc | 按需 | 免注册;分页参数控制大批量查询 |
| 受控个体级数据 | dbGaP phs000424.v8.p2 / phs000424.v10.p1 | 百 TB 量级 | ① PI 身份在 dbGaP “Request Access” 提交研究用途声明(RUS)与机构 signatory;② DAC 审核(数周);③ 创建 AnVIL/Terra 账号并绑定 eRA Commons ID;④ 在 Terra Data Explorer 打开 GTEx workspace 云端分析,或按官方免费 egress 指引(Gen3 PFB/manifest)下载到机构集群 |
| DUOS 通道(V10) | AnVIL DUOS | — | V10 支持经 Data Use Oversight System 的简化申请 |
| 第三方重算 | UCSC Xena(Toil GTEx+TCGA)/ recount3 / Expression Atlas E-GTEX-8 | 数 GB | 免申请;适合与 TCGA 联合分析 |
| 生物样本 | GTEx Portal Biospecimens | — | 按 GTEx Biospecimens Access Policy 申请剩余组织 |
开放数据许可核心义务(GTEx Portal Data License):免费、无版税;发表时须按固定句式致谢——“The data used for the analyses described in this manuscript were obtained from: the GTEx Portal on MM/DD/YY and/or dbGaP accession number phs000424.vN.pN on MM/DD/YYYY”;不得暗示 GTEx 官方背书;再分发须保持最新版本。受控数据额外遵守 dbGaP DUA:禁止重识别、禁止转发给未授权者。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 4 步预处理代码(Python 版:TPM 分析向 + counts 差异表达向)</b></summary>
# 步骤 1:载入与组织映射(接 §6.1 的 tpm / attr)
import numpy as np
import pandas as pd
sample_cols = tpm.columns[2:]
tpm_mat = tpm.set_index("gene_id")[sample_cols].astype("float32")
# 步骤 2:样本级过滤——去细胞系、去小样本组织、去低质量样本
keep_tissues = attr.groupby("SMTSD")["SAMPID"].count()
keep_tissues = keep_tissues[keep_tissues >= 70].index # eQTL 分析口径 ≥70
attr_qc = attr[
attr["SMTSD"].isin(keep_tissues)
& ~attr["SMTS"].str.startswith("Cells") # 排除 2 个细胞系
& (attr["SMRIN"] >= 6.0) # 质量收紧(按研究需要)
]
mat = tpm_mat[attr_qc["SAMPID"]]
# 步骤 3:表达转换——分析用 log1p(TPM);跨样本比较勿直接用原始 TPM 做差异检验
logtpm = np.log1p(mat)
# 组织特异性评分(tau 指数):输入为中位 TPM
med = logtpm.groupby(attr_qc["SMTSD"].values, axis=1).median()
med01 = med.div(med.max(axis=0), axis=1) # 归一到最大组织
tau = (1 - med01).sum(axis=1) / (med01.shape[1] - 1) # 0=普遍表达, 1=完全组织特异
# 步骤 4(counts 差异表达向):用 DESeq2 而非 TPM
# counts = pd.read_csv("..._gene_reads.gct.gz", sep="\t", skiprows=2)
# → 导出 counts + colData 到 R:DESeqDataSetFromMatrix → DESeq()
# 设计公式务必含协变量:~ SMRIN + SMTSISCH + DTHHRDY + SEX + AGE + tissue
# (RIN/缺血时间/Hardy 评分是死后样本的已知混杂,见 §6.5 坑点 6)
</details>
推荐直接使用官方/社区成熟产物替代手写:QTL 重跑用官方 BED + covariates + tensorQTL(GPU);TWAS 权重直接用 PredictDB 现成的 V8 模型;与 TCGA 联合分析直接用 UCSC Xena Toil 或 recount3 的统一重算矩阵,不要自己拼接两个项目的原始矩阵(见 §6.5 坑点 4)。
§6.4 框架加载
import torch
from torch.utils.data import Dataset, DataLoader
class GTExExpression(Dataset):
"""组织分类任务:log1p(TPM) 基因子集 → SMTSD 组织标签(按供体划分后使用)"""
def __init__(self, X, y):
self.X = torch.tensor(X, dtype=torch.float32)
self.y = torch.tensor(y, dtype=torch.long)
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return self.X[i], self.y[i]
loader = DataLoader(GTExExpression(X_train, y_train),
batch_size=256, shuffle=True, num_workers=4)
# 基因型 → 表达(eQTL 风格)张量构建:基因型 0/1/2 → 单基因表达
# 注意基因型 VCF 属受控数据;此处示意张量形状约定
# geno: (n_donors, n_variants) uint8; expr: (n_donors, n_genes) float32
geno_t = torch.from_numpy(geno.astype("float32"))
expr_t = torch.from_numpy(expr.astype("float32"))
ds = torch.utils.data.TensorDataset(geno_t, expr_t)
§6.5 常见坑点
⚠️ 坑点 1:基因 ID 版本后缀——跨版本/跨工具静默失配(分类:工程陷阱)
问题:GTEx 的
gene_id是带 GENCODE 版本后缀的 Ensembl ID(如 BRCA1 =ENSG00000012048.20,.20表示 v26)。V8(v26)、V10(v39)、V11(v47)后缀不同;GENCODE 升级还会拆分/合并/弃用基因模型。与 dbSNP、Biomart、自家注释表直接 join 时大量行静默丢失。症状:join 后行数神秘减少 10-40%;同一基因在 V8 与 V10 表里"对不上"。
解决:连接前统一处理后缀——要么全部剥离(
id.str.replace(r"\.\d+$", "", regex=True)),要么按官方gencode.vXX.genes.gtf建立版本映射表;论文中声明所用 GENCODE 版本;跨版本合并时检查被弃用/改名的基因。参考:GTEx Portal Release History;gencodegenes.org 各版本 release notes。
⚠️ 坑点 2:用 TPM 做跨样本差异表达检验(分类:预处理陷阱)
问题:TPM 是样本内归一化(每样本总和恒为 1e6),组成性数据特性使跨样本/跨组织直接比较有偏;测序深度与文库组成差异会制造假差异。用 TPM 做 t 检验"找差异基因"是 GTEx 数据最常见的误用。
症状:高表达管家基因"差异"虚高;结果无法复现官方或 DESeq2 口径。
解决:差异表达一律用
gene_reads.gct.gz的原始 counts + DESeq2/edgeR/limma-voom(TMM 归一化);TPM 仅用于:组织内相对丰度展示、中位 TPM 组织特异性速查、作为回归/预测的输入特征(此时建议 log1p)。参考:GTEx Portal 文档(表达矩阵说明);DESeq2/edgeR 官方 vignette 关于归一化的章节。
⚠️ 坑点 3:供体泄漏——同一供体的多组织样本被拆到训练/测试两侧(分类:数据泄漏)
问题:17,382 个样本来自 948 名供体,人均约 18 个组织样本。按 SAMPID 随机划分,同一供体的基因型背景、批次、死亡情形同时出现在训练与测试集,模型可"认人"。
症状:组织分类/表达预测测试集指标异常漂亮(准确率 98%+),换供体即崩;特征重要性被供体特异信号主导。
解决:始终以 SAMPID 前两段解析 SUBJID 做
GroupShuffleSplit(groups=SUBJID)并断言零交集(§5.2 代码);序列模型另按染色体划分防顺式上下文泄漏(§5.3)。参考:§5.3 泄漏模式表;MIMIC-III 百科同型坑点(患者级划分)。
⚠️ 坑点 4:GTEx 与 TCGA 直接拼接做"肿瘤 vs 正常"(分类:评估误用)
问题:GTEx(尸检、PAXgene、LDACC 管道)与 TCGA(手术、冷冻、JHU 管道)在取材、建库、比对定量上系统不同;直接拼接两个项目的官方矩阵,批次效应远大于肿瘤-正常生物差异。
症状:差异表达 top 基因全是批次/核糖体/线粒体伪信号;PCA 第一主成分按项目而非组织分开。
解决:只用统一重处理产物——UCSC Xena 的 Toil 重算(GTEx + TCGA 同一 STAR/RSEM 管道)或 recount3;比较时纳入组织来源协变量;报告前做 PCA/密度图检查。
参考:UCSC Xena Toil 文档;recount3 论文(Collado-Torres 组)。
⚠️ 坑点 5:把"某组织未检出 eQTL"当作"该组织无效应"(分类:标签理解)
问题:组织样本量从 11(肾髓质)到 818(骨骼肌)相差约 74 倍,eQTL 发现数与样本量 Spearman ρ=0.95。小组织没检出不是无效应,是没功效;肾髓质等 4 个组织甚至根本不做 eQTL 分析。
症状:宣称"该变异仅在肝脏有调控作用",但该变异在小组织里只是没达到 5% FDR;跨组织"特异"结论被审稿人推翻。
解决:跨组织比较用 mashR(按效应大小+方向联合建模,可在组织间借信息)而非"显著/不显著"二分;引用效应量与置信区间而非 p 值有无;小组织结论措辞为"当前样本量下未检出"。
参考:Urbut et al. 2019, Nat Genet(MASH);Science 2020 旗舰论文组织共享章节。
⚠️ 坑点 6:死后/濒死混杂被当作活体生物信号(分类:偏倚陷阱)
问题:PMI、缺血时间(SMTSISCH)、Hardy 评分(DTHHRDY,死亡急缓)、呼吸机使用都系统性地改变组织转录组;RIN 均值从骨骼肌 7.70 到肾皮质 4.34 不等。把它们驱动的表达差异当作"年龄/性别/疾病的活体效应"是机制解读的高危错误。
症状:"年龄相关基因"富集缺氧/应激通路;组织间差异基因与自溶评分轨迹重合。
解决:差异/关联模型纳入 SMRIN、SMTSISCH、DTHHRDY(以及官方 covariates 文件的 PEER/平台项);组织间比较前检查 RIN 分布;对死亡过程敏感的结论用 Ferreira et al. 2018 的死后变化目录做对照排除。
参考:Ferreira et al. 2018, Nat Commun 9:490(死亡与冷缺血对转录组的影响);Am J Pathol 2024(49 组织非想要变异来源调查);NCI BBRD 2024 组织学质量评估。
⚠️ 坑点 7:自己重跑 eQTL 时协变量与阈值口径错误(分类:工程陷阱)
问题:官方口径是 5 个基因型 PC + PEER 因子(n<150→15;150-249→30;≥250→35)+ 测序平台/protocol;漏 PEER 会假性膨胀,加错 PC 会校正掉真实祖源效应。此外"显著"的组织特异名义 p 阈值在每个组织的
.egenes.txt.gz里(pval_nominal_threshold),不能用统一 1e-5。症状:eGene 数与官方相差数倍;从 all-pairs 文件取显著对时组织间标准不一。
解决:直接用官方
*_eQTL_expression_matrices.tar(BED)+*_eQTL_covariates.tar.gz喂 tensorQTL;显著对 = all-pairs 中 p < 该组织pval_nominal_threshold;需要个体级基因型时走 dbGaP(没有 VCF 就别想精确复现)。参考:broadinstitute/gtex-v8 复现仓库 README;tensorQTL 文档(Taylor-Weiner et al. 2019, Genome Biol 20:228)。
⚠️ 坑点 8:欧洲裔 + 男性 + 死后供体三重代表性偏倚外推(分类:偏倚陷阱)
问题:85.3% 欧洲裔、67.1% 男性、20-70 岁、死后供体。eQTL 的等位基因频率与 LD 结构是祖源特异的——欧洲裔里检出的 eQTL/精细定位信号,在非裔/亚裔人群中可能因 LD 不同而定位偏移;男性为主的样本让性别交互效应功效不足;死后供体的"正常"不等于活人健康。
症状:TWAS/MR 在非欧人群中复制率低;性别偏向的结论在平衡队列中消失;体外/活体实验验证失败。
解决:跨人群结论先查等位基因频率与 LD(1000G/LDlink);用 AFR 子集(12.3%)或多祖先参考(如 MAGE、Geuvadis YRI)做敏感性分析;性别相关结论限定在充分功效的组织;活体机制结论以细胞/动物模型或活体活检队列(如 MILIEU/免疫队列)验证。
参考:GTEx Consortium 2020(祖源构成表);Mogil et al. 2018(eQTL 跨祖源可复制性讨论);dGTEx/NHP-dGTEx 前瞻(Nature 2025)。
版本提示:引用数字必须带版本——"GTEx v8"的 948/17,382/23,268 eGene 与 V10 的 19,616/19,466 不可混用;门户可视化当前展示 V10,而多数工具权重仍是 V8;V11 仅改注释(GENCODE v47)不改样本。投稿时在方法部分写明 “GTEx v8 (dbGaP phs000424.v8.p2)” 及下载日期。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 对 log1p(TPM) 加小幅高斯噪声做鲁棒性训练 | 对 counts 直接加噪后喂 DESeq2(破坏离散分布假设) |
| 按已知组织比例 in silico 混合 bulk 谱训练反卷积模型 | 跨供体随机混合表达谱制造"虚拟供体"(制造不存在的基因型-表达配对) |
| 下采样大组织模拟小样本组织做功效研究 | 对小组织 SMOTE/上采样后做 eQTL 功效结论 |
| 基因型窗口内随机掩蔽做自监督(序列模型) | 对基因型做"随机翻转等位基因"增强(产生不存在/致死单倍型) |
| 按供体重采样(bootstrap donors)估计置信区间 | 按样本 bootstrap(同供体重复计入,低估方差) |
§6.7 模型推荐
| 任务 | 推荐方案 | 预期性能/产出 |
|---|---|---|
| 组织分类(54 类) | 逻辑回归 / 小 MLP on logTPM top 可变基因 | 按供体划分下准确率 90%+;混淆集中在脑亚区与食管三段 |
| 基因型→表达插补 | 弹性网络(PrediXcan)/ SuShiE / transformer(Enformer 类) | 交叉验证 R² 中位数偏低(<0.1 常见),仅发布 CV 显著基因 |
| cis-eQTL 重跑 | tensorQTL(GPU,比 FastQTL 快数十倍)+ 官方 covariates | 与官方目录高一致 |
| 跨组织效应估计 | mashR(metashr) | 组织共享模式 + LFSR |
| 共定位/TWAS | coloc / eCAVIAR / S-PrediXcan / FUSION | 基因-性状关联 + PP4/PIP |
| 细胞类型反卷积 | CIBERSORTx / MuSiC(snRNA 参考) | 细胞比例估计 |
| 基因组基础模型 | Enformer / Borzoi(GTEx eQTL 作评测)/ Geneformer(表达谱) | 变异效应预测与零样本评测 |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 内存 | 16 GB(TPM 矩阵 float32 载入约 4 GB) | 64 GB(counts 全矩阵 + 多组织并行) |
| 磁盘 | 50 GB(V8 开放全集 + 工作区) | 500 GB(V10 全集 + 中间矩阵/Parquet 缓存) |
| GPU | 不需要(查询/统计分析) | 1 × 16 GB+(tensorQTL 全基因组扫描;深度学习表达模型) |
| 训练时间 | 组织分类 MLP < 1 小时 | 全基因组 tensorQTL 单组织数十分钟(GPU);Enformer 类预训练为集群级 |
| 云端替代 | Portal/API 零本地 | Terra/AnVIL 云端分析受控数据,免本地下载 |
§6.9 评估指标
import numpy as np
from scipy import stats
def eqtl_replication(qtl_effects_discovery, qtl_effects_replication):
"""方向一致性:发现集显著 eQTL 在复制集中的符号一致率(社区口径)"""
sign_concordance = np.mean(np.sign(qtl_effects_discovery) == np.sign(qtl_effects_replication))
return sign_concordance
def pi1_estimate(pvals):
"""π1 = 1 - π0:复制集中真信号比例(Storey qvalue 口径,需 qvalue 包)"""
from qvalue import qvalues # R 的 qvalue 更常用
return 1 - qvalues(pvals)["pi0"]
社区共识:eQTL 复制报 π1(Storey)与符号一致率;跨组织共享报 mashR 的 LFSR 与效应相关性;TWAS 报 Bonferroni/FDR 校正的 Z 分与共定位后验(PP4 > 0.5-0.8 或 PIP);表达插补报交叉验证 R² 与实测-预测相关;组织分类报宏平均 F1(按供体划分)。
§6.10 MLOps 笔记
- 版本锁定:方法部分必须写清 “GTEx v8 / v10 / v11 + dbGaP 版本(phs000424.v8.p2 / v10.p1)+ 下载日期”;致谢句式是许可义务(§6.2)。
- 注释锁定:GENCODE 版本(v26/v39/v47)与基因 ID 后缀处理策略写入补充方法;产物文件随注释版本归档。
- 矩阵转 Parquet:GCT 大文本反复解析极慢,一次性转 Parquet(行基因 × 列样本,float32)后所有实验共用。
- API 稳定性:API V2 的 V10 端点曾出现部分端点空结果(社区 2026-08 实测反馈),批量任务以下载文件为准、API 仅作交互查询;
variantByLocation端点已于 2025-12 移除。 - 受控数据合规:VCF/BAM 不出 Terra workspace 即无 egress;本地保存须符合 dbGaP 安全要求;结果发布遵循基因组汇总数据政策。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 死后样本偏倚 | 供体为死者而非活体健康人;濒死期(Hardy 评分)、缺血时间、PMI 系统性改变表达;胰腺/肾/脾 RIN 显著低于肌肉 | 高 | 模型纳入 RIN/缺血时间/Hardy 协变量;机制结论用活体数据验证 |
| 祖源偏倚 | 85.3% 欧洲裔、12.3% 非裔、1.4% 亚裔;等位基因频率与 LD 祖源特异 | 高 | 跨人群结论用 AFR 子集/多祖先参考敏感性分析(§6.5 坑点 8) |
| 性别偏倚 | 67.1% 男性;性别交互 eQTL 功效不足 | 中高 | 性别相关结论限定功效充足组织;参考 Oliva et al. 2020 性别特刊论文 |
| 年龄覆盖偏倚 | 仅 20-70 岁;儿童/青少年与 70+ 完全缺失 | 中 | 发育研究转 dGTEx;老年结论不外推 |
| 组织功效偏倚 | 样本量 11-818;eQTL 发现数与样本量 ρ=0.95 | 中高 | mashR 借信息;措辞区分"未检出"与"无效应" |
| 取材/批次偏倚 | 采集中心、表达批次、平台(HiSeq 2000 vs X)、细胞系 vs 组织 | 中 | 官方 covariates(PEER/PC/平台/protocol);站点/批次作协变量 |
| 细胞组成偏倚 | bulk 混合细胞类型;取材位置与修剪差异造成组成变异(组织学评估证实几乎每个组织存在) | 中高 | 细胞比例反卷积后作协变量;参考 snRNA-seq |
| 死亡原因选择偏倚 | 供体死因以急性心脑血管事件与外伤为主,非随机人群 | 中 | 明确研究适用人群为"成人死后组织参考" |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 表达定量(RSEM/RNASeQC) | 高(统一管道、公开复现) | 批次内高;批次间有已知批次效应 | 基因模型随 GENCODE 版本变化 |
| 基因型(WGS 32× + SHAPEIT) | 高(GATK best practices) | 高 | 受控获取;低频变异定相不确定 |
| cis-eQTL 目录 | 外部数据集高复制率(Science 2020 附图 S12-S13) | 组织内高;跨组织功效不齐 | 小组织功效不足;多重检验后小效应仍可能遗漏 |
| 组织病理评估(自溶评分) | 项目病理学家团队 | 评分者间一致性中等(0-3 四级) | 脑部 13 亚区无匹配组织学图像(Am J Pathol 2024 指出) |
| 表型(年龄/性别/Hardy) | 临床记录 | 区间化脱敏 | 精确年龄/种族受控;Hardy 部分缺失 |
| 组织标签(SMTS/SMTSD) | 高(SOP 取材) | 高 | 食管三段、脑亚区间存在取材位置变异 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨祖源(EUR → AFR/ASN) | 高 | LD 与等位基因频率差异;GTEx 以 EUR 为主,精细定位在非欧人群中偏移 |
| 跨生命阶段(成人 → 儿童/胎儿) | 高 | 发育阶段调控不同;dGTEx 正是为此立项(Nature 2025 前瞻) |
| 死后 → 活体 | 中高 | PMI/缺血/Hardy 驱动的转录变化(Ferreira et al. 2018) |
| bulk → 细胞类型 | 中高 | 细胞组成是关键混杂(Science 2020 细胞类型论文);snRNA 试点仅 16 供体 |
| 跨平台/管道(GTEx ↔ TCGA/其他 RNA-seq) | 高(未重处理时) | 批次大于生物信号;统一重处理(Toil/recount3)后可用 |
| 正常参考 → 疾病组织 | 中 | 疾病组织存在炎症/坏死/治疗暴露;GTEx 只能作基线参照 |
§7.4 伦理考量
- 数据来自约 1,000 名去世供体及其家属决策者的捐献——GTEx 的 ELSI 研究(Siminoff 等)专门建立了死后捐献的知情同意沟通范式;引用数据时应保持对捐献者的尊重。
- 开放数据虽为汇总统计,个体级基因型本质上不可匿名化;受控数据的 dbGaP 协议禁止任何重识别尝试,使用者须承担基因组隐私保护义务。
- 欧洲裔主导意味着基于 GTEx 的临床应用(药物靶点、风险评分)可能系统性地更有利于欧洲裔人群——在精准医学公平性议题上必须主动声明。
- 性别特异组织与 Hardy 评分等字段涉及敏感生理与临终信息,分析结果呈现应避免对个体死因的可识别推断。
- 将 GTEx 用作"正常对照"时,需意识到供体经历了死亡过程与各种疾病终末期——"正常"是解剖学而非生理学概念。
§7.5 公平性评估
# 祖源分层的 eQTL 复制率评估(需受控基因型确定祖源)
# 思路:在 EUR 供体中定义 eQTL → 在 AFR 供体中估计 π1 复制率与效应相关性
import numpy as np
from scipy import stats
def cross_ancestry_concordance(beta_eur, beta_afr):
rho, _ = stats.spearmanr(beta_eur, beta_afr)
sign_concordance = np.mean(np.sign(beta_eur) == np.sign(beta_afr))
return {"effect_corr": rho, "sign_concordance": sign_concordance}
已知公平性事实:GTEx 主分析以全部供体混合并校正 5 个基因型 PC(本质上是欧洲裔主导的联合分析);非裔子集(约 12%)单独功效有限;门户/API 不提供按祖源分层的现成 eQTL 结果,分层分析须申请受控数据自行完成。文献共识是常见 cis-eQTL 的方向在祖源间高度一致,但效应大小与精细定位因 LD 差异而不可直接搬运。
§7.6 数据漂移提示
- GTEx 的主要"漂移"不是时间而是注释与坐标版本:V7(GRCh37/v19)→ V8(GRCh38/v26)→ V10(v39)→ V11(v47)。基因模型在版本间会被拆分、合并、弃用,旧管线在新注释下静默漂移(§6.5 坑点 1)。
- 门户可视化版本切换(2024-12 起展示 V10)导致"网页截图证据"与下载文件版本不一致——引用网页结果时注明 datasetId。
- 测序技术漂移:HiSeq 2000 → HiSeq X → NovaSeq 的读长与错误谱差异已编码进平台协变量;跨版本合并分析须保留该平台字段。
- 监控信号:同基因在 v26/v39/v47 的表达量系统偏移(UTR 注释变化影响 polyA 定量)、eGene 数的注释敏感性。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | GCT 基因 × 样本矩阵与逐样本属性表结构清晰 |
| 2 | 有唯一标识符列 | ✅ | SAMPID / SUBJID 两级主键 + variant_id / gene_id |
| 3 | 无 Unicode 或特殊字符 | ✅ | 结构化字段为 ASCII;GCT 首两行须正确跳过(文档化格式) |
| 4 | 无重复行 | ✅ | 官方 QC 去除重复与污染样本(含 relatedness/sex check) |
| 5 | 缺失值已识别并编码 | ✅ | §4.5 结构性缺失与 MNAR 分类 |
| 6 | 标签列被明确标识 | ✅ | 组织标签 SMTS/SMTSD;eGene 判定 qval 明确 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 小组织(11-29 样本)保留独立标签未合并;eQTL 分析以 ≥70 组织为口径 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 八类偏倚 + 官方系统协变量体系 |
| 9 | 有完整的数据字典 | ✅ | SampleAttributesDD/SubjectPhenotypesDD 官方字典 + Portal 文档 |
| 10 | 对"信息性缺失"有明确编码解释 | ✅ | §4.5(组织覆盖、QC 排除、区间化脱敏) |
| 11 | 数据采集设备和设置已记录 | ✅ | §3.9 建库/测序/固定平台完整记录 |
| 12 | 已移除完全共线性变量 | ⚠️ | 发布矩阵保留全部基因(含伪基因冗余);未做主成分级共线清理 |
| 13 | 对编码的映射标准已说明 | ✅ | Ensembl/GENCODE + GRCh38 + dbSNP rsID;版本演进有 Release History |
| 14 | 对时间戳的处理已明确说明 | ✅ | 无个体时间轴(死后快照);缺血时间/PMI 作为质量变量记录 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无划分(定位决定);本百科 §5 给出社区惯例补位 |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 五种 GTEx 特有泄漏模式 |
| 17 | 标签分布已被分析 | ✅ | §4.2 组织样本量/eGene 分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | §7.1 取材/组织功效偏倚 + §6.5 坑点 5/6 |
| 19 | 外部验证建议已给出 | ✅ | §5.5 + §7.8(Geuvadis/BLUEPRINT/eQTLGen/CommonMind/TCGA) |
| 20 | 数据更新和版本信息已记录 | ✅ | V1-V11 Release History 完整;V11 的 LCM 拆分有专项说明 |
| 21 | 最小必要预处理脚本已提供 | ✅ | gtex-pipeline + broadinstitute/gtex-v8 官方复现仓库(BSD-3) |
| 22 | 合规使用要求已明确 | ✅ | Portal License 致谢义务 + dbGaP 受控流程双轨清晰 |
| 23 | 多模态对齐方法已说明 | ✅ | WGS-表达经 SUBJID 配对;组织学图像经 SAMPID 链接;HuBMAP CCF 空间映射 |
| 24 | 去标识化方法已被记录 | ⚠️ | 汇总开放数据已脱敏(年龄区间化、种族受控);但基因型本质不可匿名——个体级数据完全依赖 dbGaP 制度性保护而非技术性匿名 |
DAIMS 评分:19 / 24
评分解读:良好偏优——文档、溯源与合规体系是领域标杆,扣分集中在结构性残留:无 ML 划分(定位使然)、小组织类别未合并、死后混杂不可完全校正、个体级数据依赖制度性保护。
对你意味着什么:GTEx 的 18 个 ✅ 来自其教科书级的工程化——统一管道、完整数据字典、双轨合规、官方复现仓库,在组学参考数据集中无出其右。4 个 ⚠️/❌ 中有两个是"定位性缺失"而非缺陷(无官方划分、无共线清理——它是参考图谱不是竞赛集),用本百科 §5 的社区惯例即可补位;真正需要在实验中主动管理的是:小组织功效(用 mashR 而非有无显著性说话)、死后混杂(协变量必加 RIN/缺血时间/Hardy)、以及注释版本漂移(基因 ID 后缀处理写入方法学)。若你的研究涉及非欧洲裔人群或活体机制,GTEx 应是起点而非终点——配一层多祖先参考与一层活体验证,是 2026 年该领域的审稿标配。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 多外部 eQTL 数据集综合 | Science 2020 附图 S12-S13 | cis-eQTL 复制 | 高复制率(官方定性结论) | — | GTEx cis-eQTL 在外部数据集系统性复现,是目录可信度的官方证据 |
| Geuvadis(462 LCL,含 YRI) | 1000 Genomes / EMBL-EBI | LCL eQTL 复制 | 方向一致性高 | — | LCL 是 GTEx 两细胞系之一,与 Geuvadis 构成经典互相复制对 |
| eQTLGen(31,684 人全血) | 多中心联盟 | 全血 cis-eQTL 复制 | 大样本高复制 | — | 血液 eQTL 在大样本 meta 分析中复现;小效应检出反超 GTEx |
| CommonMind(DLPFC 约 600+ 脑样本) | Mount Sinai 等 | 脑区 eQTL 复制 | 方向一致性高 | — | 背外侧前额叶与 GTEx 脑皮质 eQTL 高度一致;脑亚区间差异真实存在 |
| TCGA 癌旁正常(经 Toil 统一重算) | UCSC Xena | 组织表达基线一致性 | 组织聚类保真 | — | 统一重处理后 GTEx 与 TCGA 正常组织按组织类型聚类,支持联合分析 |
| snRNA-seq 试点(16 供体 8 组织) | GTEx/HCA(Eraslan et al. 2022) | bulk eQTL 的细胞类型归属 | 细胞类型 eQTL 比例 | — | 相当部分 bulk eQTL 可归属到特定细胞类型,证实细胞组成机制 |
约束:本矩阵仅收录有同行评审论文或官方补充材料支撑的外部评估。GTEx 的特殊性在于——它本身就是全球其他数据集的"外部验证对象",上表的方向是"别人复制 GTEx",而非反之。
§8 基准性能与生态
§8.1 资源产出与代表性结果
GTEx 不是竞赛型数据集,没有传统排行榜;它的"基准"是旗舰分析产出的资源数字与方法学基线。以下数值均来自 Science 2020 旗舰论文(V8 口径,49 组织 / 838 供体 / 15,201 样本):
| 指标 | 数值 | 说明 |
|---|---|---|
| cis-eGene | 23,268(94.7% 蛋白编码基因至少在 1 个组织有 eQTL) | FDR 5%;1% FDR 见论文附图 |
| cis-eVariant | 4,278,636(占 MAF≥0.01 变异的 43%) | 至少在 1 个组织显著 |
| cis-sGene | 14,424(66.5% 蛋白编码基因) | LeafCutter 剪接比 |
| 大效应 eQTL | 各组织平均 22% 效应 >2 倍 | 多数 eQTL 效应较小 |
| eQTL 发现-样本量相关 | Spearman ρ = 0.95 | 功效由组织样本量主导 |
| 独立 eQTL | 逐步回归鉴定,见 *_eQTL_independent.tar |
每基因可多个独立信号 |
方法学基线(复现实验的对照点):
| 方法 | 任务 | 关键结论/性能 | 完整引用 | 代码 |
|---|---|---|---|---|
| FastQTL | cis-QTL 扫描 | beta 近似置换,V8 官方引擎 | Ongen et al. 2016, Bioinformatics 32:1479-1481 | https://github.com/francois-a/fastqtl |
| tensorQTL | cis-/trans-QTL | GPU 加速数十倍,结果与 FastQTL 一致 | Taylor-Weiner, Aguet et al. 2019, Genome Biol 20:228 | https://github.com/broadinstitute/tensorqtl |
| LeafCutter | 可变剪接 | 无注释依赖的 intron excision 定量,sQTL 基础 | Li et al. 2018, Nat Genet 50:151-158 | https://github.com/davidaknowles/leafcutter |
| MASH/mashR | 跨组织效应 | 效应模式共享优于"显著性二分" | Urbut et al. 2019, Nat Genet 51:187-195 | https://github.com/stephenslab/mashr |
| PrediXcan/S-PrediXcan | TWAS | GTEx 训练的表达插补 + GWAS 关联 | Gamazon et al. 2015, Nat Genet 47:1091-1098;Barbeira et al. 2018, Nat Commun 9:1825 | https://github.com/hakyimlab/PredictDB |
阅读提示:GTEx 的"性能"不是某个模型的 AUC,而是目录的可复制性(§7.8)与使用率(§8.6)。任何声称"优于 GTEx"的新 eQTL 方法,审稿人要求的第一对照就是与官方目录的 π1/符号一致性。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 查几个变异/基因 | Portal 网页 + API V2(gtex_v8) | 免注册、秒级、可引用 |
| 重跑/定制 eQTL | tensorQTL + 官方 BED/covariates | 与官方口径一致、GPU 快 |
| 做 TWAS/MR | PredictDB V8 权重 + S-PrediXcan / SMR | 现成权重、文献可比 |
| 跨组织机制 | mashR on V8 all-pairs | 避免"显著性二分"陷阱 |
| 精细定位 | 官方 CAVIAR/CaVEMaN/DAPG 结果先行,再用 SuSiE/FINEMAP 定制 | 三套官方结果已是强基线 |
| 肿瘤-正常联合 | Xena Toil / recount3 重算矩阵 | 唯一无批次方案 |
§8.3 官方评测协议
无 ML 竞赛协议。QTL 官方口径(Science 2020):cis 窗口 ±1 Mb;协变量 = 5 基因型 PC + PEER(n<150→15;150-249→30;≥250→35)+ 平台 + protocol;FastQTL 名义扫描 + 置换(beta 近似);基因级 qvalue FDR 5% 定义 eGene;组织特异名义 p 阈值见各组织 eGenes 文件;chrX/PAR 不纳入 V8 QTL 分析;trans 分析另行报告(trans_eGenes_fdr05)。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| dGTEx V1 | 直系扩展 | 人类发育 GTEx(出生到成年):342 RNA-seq + 37 WGS、40 供体;dbGaP phs003838.v1.p1;前瞻 Nature 637:557-564(2025) |
| NHP-dGTEx V1 | 直系扩展 | 猕猴(421 样本/50 个体)+ 狨猴(333 样本/20 个体);AnVIL 公开 workspace |
| GTEx snRNA-seq 试点 | 子项目 | 8 组织 16 供体 25 样本;Eraslan et al. 2022 Science 单核图谱 |
| eGTEx | 扩展层 | H3K27ac ChIP-seq、m6A、WGBS(Nat Genet 2023 等),经 Portal/AnVIL |
| eQTLGen | 同类互补 | 31,684 人全血 eQTL;血液功效最大化 |
| BLUEPRINT / Geuvadis | 同类/验证集 | 血细胞与 LCL 的经典复制集 |
| TCGA | 互补 | 肿瘤多组学;GTEx 为其正常基线(经统一重处理) |
| Tabula Sapiens / HCA | 互补 | 单细胞分辨率;GTEx snRNA 已是 HCA 一部分 |
§8.5 关键论文 Top 10
- GTEx Consortium (2020), Science 369:1318-1330. “The GTEx Consortium atlas of genetic regulatory effects across human tissues.” — V8 旗舰,权威引用入口。DOI: 10.1126/science.aaz1776。PMID: 32913098。
- GTEx Consortium (2015), Science 348:648-660. “The Genotype-Tissue Expression (GTEx) pilot analysis: multitissue gene regulation in humans.” — pilot 开山,175 供体/43 组织。DOI: 10.1126/science.1262110。PMID: 25954001。
- GTEx Consortium (2017), Nature 550:204-213. “Genetic effects on gene expression across human tissues.” — 中期旗舰(V6p,449 供体/44 组织;2018 勘误 Nature 553:530)。DOI: 10.1038/nature24277。PMID: 29022597。
- GTEx Consortium (2013), Nat Genet 45:580-585. “The Genotype-Tissue Expression (GTEx) project.” — 项目设计与伦理框架奠基文献。
- Melé M et al. (2015), Science 348:660-665. “The human transcriptome across tissues and individuals.” — "组织间方差 >> 个体间方差"的奠基观察。
- Oliva M et al. (2020), Science 369:eaba3066. “The impact of sex on gene expression across human tissues.” — V8 特刊性别维度,性别偏向分析的必读。
- Kim-Hellmuth S et al. (2020), Science 369:eaaz8528. “Cell type-specific genetic regulation of gene expression across human tissues.” — 细胞类型组成是调控差异关键因素的官方论证。
- Urbut SM et al. (2019), Nat Genet 51:187-195. “Flexible statistical methods for estimating and testing effects in genomic studies with multiple conditions.” — MASH,跨组织效应共享的方法学基石。
- Gamazon ER et al. (2015), Nat Genet 47:1091-1098. “A gene-based association method for mapping traits using reference transcriptome data.” — PrediXcan/TWAS 起点,GTEx 下游最具影响力的应用范式。
- Ferreira PG et al. (2018), Nat Commun 9:490. “The effects of death and post-mortem cold ischemia on human tissue transcriptomes.” — 死后混杂的权威目录,使用 GTEx 必读。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| 旗舰论文引用(Science 2020) | 4,840+(Google Scholar,截至 2026-09)/ 5,496(OpenAlex,2026-09 快照) |
| pilot 论文引用(Science 2015) | 5,516(OpenAlex,2026-09 快照) |
| 项目总影响 | GTEx 数据被引用于 5,000+ 篇出版物(项目回顾口径);Science 2020 特刊约 15 篇配套论文 |
| 门户与 API | Portal 免注册;API V2(2023-02 上线,V1 已停用) |
| 官方复现仓库 | broadinstitute/gtex-v8:49★ / 13 fork(截至 2026-09),BSD-3-Clause |
| 二次分发 | Expression Atlas(E-GTEX-8)、UCSC Xena、recount3、FUMA、Open Targets、LDlink、PredictDB 内置 |
| 后继项目 | dGTEx 与 NHP-dGTEx V1 均于 2026-05 首发,门户持续活跃维护(2026-06 仍在修 IGV 问题) |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/Fork(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| GTEx Portal + API V2 | 官方门户 | https://gtexportal.org/home/ | — | 免注册查询/下载/可视化;eQTL Dashboard 与 Calculator(V10) |
| broadinstitute/gtex-v8 | 官方代码 | https://github.com/broadinstitute/gtex-v8 | 49★ / 13 fork | Science 2020 全部主图复现 notebook,含完整下载清单 |
| broadinstitute/gtex-pipeline | 官方管道 | https://github.com/broadinstitute/gtex-pipeline | 活跃 | STAR/RSEM/RNASeQC 定量管道源头,可复现官方矩阵 |
| broadinstitute/tensorqtl | 工具库 | https://github.com/broadinstitute/tensorqtl | 活跃 | GPU 版 QTL 引擎,社区重跑 eQTL 默认选择 |
| PredictDB / S-PrediXcan | 权重库 + 工具 | https://github.com/hakyimlab | 活跃 | TWAS 现成 V8 权重与软件 |
| stephenslab/mashr | 工具库 | https://github.com/stephenslab/mashr | 活跃 | 跨组织效应共享官方实现 |
| UCSC Xena(Toil GTEx+TCGA) | 重算矩阵 | https://xenabrowser.net | — | 肿瘤-正常联合分析唯一无批次入口 |
| recount3 | 重算矩阵 | https://rna.recount.bio | — | 统一 recount 的 counts,R 生态友好 |
| Expression Atlas E-GTEX-8 | 二次分发 | https://www.ebi.ac.uk/gxa/experiments/E-GTEX-8/ | — | EBI 侧浏览与归一化矩阵下载(已更新至 V8) |
| AnVIL/Terra workspace | 云端受控 | AnVIL_GTEx_V8_hg38 | — | dbGaP 审批后云端直接计算 VCF/BAM,V8 免费 egress |
§9 相关资源与引用
官方资源
- GTEx Portal 主页:https://gtexportal.org/home/
- 开放数据下载页:https://gtexportal.org/home/downloads/adult-gtex
- Portal 数据许可:https://gtexportal.org/home/license
- 受控数据访问指南:https://gtexportal.org/home/protectedDataAccess
- API V2 文档:https://gtexportal.org/api/v2/redoc
- dbGaP 研究页:phs000424.v8.p2(V8)/ phs000424.v10.p1(V10,支持 DUOS)
- 官方复现仓库:https://github.com/broadinstitute/gtex-v8
- 官方管道:https://github.com/broadinstitute/gtex-pipeline
- NIH Common Fund 项目页:https://commonfund.nih.gov/genotype-tissue-expression-gtex
- 组织学图像:Portal Histology Viewer + NCI Imaging Data Commons
- 生物样本申请:GTEx Portal Biospecimens Access
致谢与引用(许可义务)
按 GTEx Portal Data License,发表时须在显著位置写明(替换日期与版本号):
“The data used for the analyses described in this manuscript were obtained from: the GTEx Portal on MM/DD/YY and/or dbGaP accession number phs000424.vN.pN on MM/DD/YYYY.”
BibTeX 引用
% 1) V8 旗舰论文(首选)
@article{gtex2020atlas,
title={The GTEx Consortium atlas of genetic regulatory effects across human tissues},
author={{GTEx Consortium}},
journal={Science},
volume={369},
number={6509},
pages={1318--1330},
year={2020},
doi={10.1126/science.aaz1776}
}
% 2) pilot 论文(方法学引用)
@article{gtex2015pilot,
title={The Genotype-Tissue Expression (GTEx) pilot analysis: multitissue gene regulation in humans},
author={{GTEx Consortium}},
journal={Science},
volume={348},
number={6235},
pages={648--660},
year={2015},
doi={10.1126/science.1262110}
}
% 3) 中期旗舰(V6p,引用旧结果时)
@article{gtex2017nature,
title={Genetic effects on gene expression across human tissues},
author={{GTEx Consortium}},
journal={Nature},
volume={550},
number={7675},
pages={204--213},
year={2017},
doi={10.1038/nature24277}
}
% 4) 项目奠基(设计/伦理引用)
@article{gtex2013project,
title={The Genotype-Tissue Expression (GTEx) project},
author={{GTEx Consortium}},
journal={Nature Genetics},
volume={45},
pages={580--585},
year={2013}
}
使用第三方工具/权重时另引对应论文(§8.1 方法学基线表):tensorQTL、LeafCutter、MASH、PrediXcan/S-PrediXcan 等。漏引工具论文是 GTEx 相关投稿的常见返修点。
教程与学习资源
- 官方复现 notebook(最佳上手教材):https://github.com/broadinstitute/gtex-v8(Fig2 汇总统计 → Fig6 组织特异性逐图复现)
- ASHG GTEx Workshop 材料(2017):https://gtexportal.org/home/workshop.html
- AnVIL Terra 上手(Getting Started / Intro to Terra Workshop):terra.bio 帮助中心;GTEx V8 免费 egress 官方指引(anvilproject.org)
- tensorQTL 官方示例:https://github.com/broadinstitute/tensorqtl
- Portal 下载页官方演示视频(2023-11 改版)
原始论文
- GTEx Consortium (2020). Science 369:1318-1330. DOI: 10.1126/science.aaz1776. PMID: 32913098.
- GTEx Consortium (2015). Science 348:648-660. DOI: 10.1126/science.1262110. PMID: 25954001. PMCID: PMC4547484.
- GTEx Consortium (2017). Nature 550:204-213. DOI: 10.1038/nature24277. PMID: 29022597.
- GTEx Consortium (2013). Nat Genet 45:580-585.
- Coorens THH et al. (2025). “The human and non-human primate developmental GTEx projects.” Nature 637:557-564. DOI: 10.1038/s41586-024-08244-9.
- Eraslan G et al. (2022). “Single-nucleus cross-tissue molecular reference maps toward understanding disease gene function.” Science 376:eabl4290.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:官方主页与新闻、旗舰论文引用快照、dbGaP/AnVIL 获取流程、Portal License、局限性与坑点文献、V10/V11 版本核实 |
| WebFetch(官方 API 实测) | 2026-09-05 | GTEx Portal API V2 tissueSiteDetail(V10 全组织样本量汇总)与 OpenAlex 引用页 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 GTEx Portal、NIH Common Fund、dbGaP/AnVIL 官方页面与旗舰论文中整理结构化信息;(2) 生成 §6 的 Python/Bash 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- GTEx Consortium (2020), Science 369:1318-1330 — V8 旗舰论文(DOI: 10.1126/science.aaz1776)
- GTEx Portal 官方页面(首页 / 新闻 / License / Protected Data Access / Release History)
- NIH Common Fund GTEx 项目页(V8 规模官方口径:948 供体 / 17,382 样本 / 54 组织)
- GTEx Portal API V2 实测(
tissueSiteDetail?datasetId=gtex_v10:54 组织、eQTL 19,466、RNA-seq 19,616,2026-09-05 抓取) - GTEx Consortium (2015), Science 348:648-660(pilot;PMID 25954001)
- GTEx Consortium (2017), Nature 550:204-213(中期;PMID 29022597)
- OpenAlex / Google Scholar 引用快照(2020 旗舰 4,840/5,496;2015 pilot 5,516;截至 2026-09)
- broadinstitute/gtex-v8 官方复现仓库(文件名清单、star 数、BSD-3-Clause)
- AnVIL 官方新闻(2024-11-20 V10 发布细节;2020-11-20 V8 免费 egress)
- Ferreira et al. (2018), Nat Commun 9:490(死后/冷缺血转录组效应)
- Am J Pathol 2024(49 组织非想要变异来源调查)
- NCI BBRD 2024 组织学质量评估(956 供体 RIN/自溶/PMI/Hardy 数据)
- PMC12141818(GTEx 人口学与 PMI 局限性引述)
- Coorens et al. (2025), Nature 637:557-564(dGTEx/NHP-dGTEx 前瞻)
- GTEx Portal 新闻(2026-01-16 V11;2026-05-05 dGTEx/NHP-dGTEx V1;2026-05-28 V11 LCM 拆分)
- Urbut et al. (2019), Nat Genet 51:187-195(MASH)
- Gamazon et al. (2015), Nat Genet 47:1091-1098(PrediXcan)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 应用映射、人群统计、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(V8/V10/V11 数字、版本矩阵) | 千方病案医学编辑部 | 与 NIH Common Fund 页、Portal 新闻、API 实测交叉比对 | ✅ 已验证 |
| §4 数据结构(SAMPID 体系、DAIMS 字段字典) | 千方病案医学编辑部 | 与官方文件格式及 broadinstitute/gtex-v8 清单交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方文档及社区实践比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar/OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
