TOPMed — 心肺血液睡眠多组学旗舰 AI-Ready Wikipedia | 千方病案医数集

逾 18 万份 30x 全基因组 + 深度表型的心肺血液睡眠精准医学资源

来源 National Heart, Lung, and Blood Institute (NHLBI), NIH url: https://topmed.nhlbi.nih.gov发布时间: 2026-09-08最后更新: 2026-09-08 阅读 6

信息速览

数据集名称TOPMed — 心肺血液睡眠多组学旗舰 AI-Ready Wikipedia | 千方病案医数集
数据类型96,620 份 30x WGS(freeze 8),约 4.28 亿过 QC 变异,RNA-seq/甲基化/代谢组多组学,dbGaP 受控访问
规模逾 18 万名参与者(WGS freeze 8 为 96,620 人)
接入方式National Heart, Lung, and Blood Institute (NHLBI), NIH url: https://topmed.nhlbi.nih.gov
AI 就绪度

数据集封面

TOPMed — 心肺血液睡眠多组学旗舰 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 TOPMed(跨组学精准医学计划)
英文全称 Trans-Omics for Precision Medicine Program
别名/简称 TOPMed;NHLBI TOPMed WGS Program;TOPMed2.0(Map to Mechanism 阶段)
疾病分类(ICD-11) 循环系统 BA00-BE2Z(如原发性高血压 BA00);呼吸系统 CA00-CA4Z(如哮喘 CA23);血液与造血器官 3A00-3B0Z(如镰状细胞病 3A5);睡眠-觉醒障碍 7A00-7B0Z(如阻塞睡眠呼吸暂停 7A42)
SNOMED CT 高血压 38341003;心肌梗死 22298006;心房颤动 49436004;哮喘 195967001;慢性阻塞性肺疾病 13645005;睡眠呼吸暂停 73430006
数据模态 约 30x 全基因组测序(WGS)、RNA-seq、DNA 甲基化、代谢组学、蛋白质组学、纵向临床表型、部分队列影像(如 COPDGene CT)
AI 任务类型 常见/罕见变异 GWAS、多基因风险评分(PRS)、基因型填充、多组学整合建模、疾病风险预测、ancestry 感知方法开发
样本总数 逾 180,000 份 WGS(85+ 项研究);freeze 8 合并 call set 为 96,620 人
数据大小 PB 级(30x WGS + 多组学 + 影像);freeze 8 单队列 call set 数十 GB 至数 TB
数据格式 BCF/VCF(multi-sample,按 consent group 打包)、GDS(Genomic Data Structure)、CRAM(BDC 独有)、表型 CSV/SAS
许可证 NIH Genomic Data Sharing(GDS)Policy — dbGaP 受控访问
访问级别 申请审核(dbGaP DAR:eRA Commons + 机构 Signing Official + NIH DAC 审批)
DUO 标签 依队列而异:GRU / HMB / DS-*(疾病特定),常叠加 IRB、PUB、NPU/NCU 等修饰符
语言 英语
首发日期 2016-10(Phase 1 约 20,000 份 WGS 进入 dbGaP)
最后更新 Freeze 9/9b(约 206,000 样本)与组学数据持续发布,截至 2023 已有多轮;组学处理仍在进行
发布机构 National Heart, Lung, and Blood Institute(NHLBI, NIH); Informatics Research Center(密歇根大学)与 Data Coordinating Center(华盛顿大学)
官方主页 topmed.nhlbi.nih.gov
下载地址 dbGaP TOPMed GSR phs001974BioData Catalyst
DOI 主方法论文 10.1038/s41586-021-03205-y(无单一数据集 DOI)
引用次数 1,312+(主方法论文,截至 2024-08,UK Biobank 出版记录统计)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 有集中 QC 的联合 call set、GDS/VCF 标准格式与开源 pipeline(GotCloud),扣分项:无官方跨队列宽表与一键划分脚本,表型 harmonization 需研究者自行实现
页面状态 published

§0 E-E-A-T 可信度声明

医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、心肺血液睡眠疾病流行病学)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。TOPMed 要求研究者通过 dbGaP 完成 Data Access Request 并遵守各研究的 Data Use Limitations 与 consent group 限制。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? TOPMed 是美国国家心肺血液研究所(NHLBI)2014 年启动的旗舰精准医学计划。它没有从零招募新人,而是把 Framingham 心脏研究、Jackson 心脏研究(JHS)、CARDIA、西班牙裔社区健康研究(HCHS/SOL)、MESA、女性健康倡议(WHI)等 90 多个有几十年随访积累的经典队列搬进测序中心,为逾 18 万名参与者补上约 30x 的全基因组测序,以及 RNA、甲基化、代谢物等多组学数据(NHLBI 官方页)。

为什么重要? 复杂疾病(高血压、哮喘、血栓、睡眠呼吸暂停等)的遗传信号大多藏在低频和罕见变异里,而罕见变异研究需要两样东西:海量样本 + 极深测序。TOPMed 的 freeze 5 就在 53,831 份基因组中检出超过 4 亿个变异,其中 46% 是只在一个人身上出现的 singleton(Taliun et al., 2021, Nature)——这种罕见变异密度是全球独有的,同时约 60% 参与者来自非欧裔人群,极大改善了遗传研究的族群多样性。

我能用它做什么? 三类核心用途:其一,对心肺血液睡眠性状做常见+罕见变异的全基因组关联(GWAS/burden 检验);其二,用 TOPMed 单倍型做基因型填充——TOPMed r2 参考面板(97,256 人、3.08 亿位点)已成为全球 GWAS 的默认填充面板;其三,把 WGS 与深度纵向表型、多组学整合,构建疾病风险预测与机制解释模型。注意:数据经 dbGaP 受控访问,申请通常需要 2-6 个月。

核心数字速查(细节与出处见 §3-§4):

你想快速知道 答案
有多少人测了 WGS? 逾 18 万(85+ 研究);freeze 8 合并集 96,620 人
检出了多少变异? freeze 5:>4 亿;freeze 8(21 队列子集):4.28 亿过 QC;freeze 9:7.81 亿 SNV
多深? 平均约 30x;样本 QC 标准:污染 <10%、≥95% 基因组 ≥10x
怎么拿? dbGaP DAR(eRA Commons,2-6 个月)或 BDC 云;r2 填充面板免费在线
多少数据量? 全计划 PB 级;freeze 8 单队列 call set 数十 GB-数 TB
主论文? Taliun et al., 2021, Nature 590:290-299(freeze 5)

§1.1 技术摘要

TOPMed 的技术路线是"旧队列、新组学、集中式加工"。测序在 7 个 NIH 资助的测序中心完成(Broad、Northwest Genomics Center、NYGC、Illumina Genomics Services、PSOMAGEN、Baylor HGSC、McDonnell Genome Institute),同一研究在同一 Phase 内固定同一中心以压低批次效应;所有 reads 用统一 BWA-MEM pipeline 比对到 GRCh38,由密歇根大学 Informatics Research Center(IRC)跨全部样本做联合变异检测(GotCloud pipeline),变异过滤采用孟德尔一致性评分 + SVM 分类器,样本级 QC 标准为污染率 <10% 且 ≥95% 基因组覆盖 ≥10x(Nat Commun 2022)。加工产物按"data freeze"版本化发布:freeze 5(53,831 人,配套 Nature 主论文)、freeze 8(96,620 人,Phases 1-4 合并)、freeze 9/9b(约 206,000 样本,检出 7.81 亿 SNV)。freeze 8 的 BCF 按研究×consent group 拆分发往 dbGaP,并转制 GDS 格式;CRAM 原始比对文件仅在 BioData Catalyst(BDC)云平台托管。Phase 4 起计划扩展至 RNA-seq、甲基化组、代谢组与蛋白质组(PAR-22-194),TOPMed2.0 的定位从"基因图谱"转向"机制(Map to Mechanism)"。

§1.2 战略价值

维度一:复杂疾病遗传建模的方法学试验场。 TOPMed 同时包含前瞻性队列(大量风险因素与结局事件)、病例-对照研究(大量 prevalent cases)、扩展家系与隔离群体(提升罕见变异检验功效),这使它成为 REGENIE、BOLT-LMM、SAIGE 等全基因组混合模型方法的主战场。freeze 8 血脂分析中,研究者在 66,329 人的 21 个队列上按五个 ancestry 分层做单变异 GWAS(MAC>20)与 ancestry-specific rare variant burden 检验,再在 UK Biobank 约 13 万全基因组中复制——这种"多 ancestry 内部分层 + 外部 WGS 复制"的范式已成为行业标准(Nat Commun 2022)。

维度二:全球 GWAS 基础设施(imputation panel)。 TOPMed r2 填充参考面板含 97,256 人、308,107,085 个 SNV+indel(GRCh38),只能通过 TOPMed Imputation Server / Michigan Imputation Server 免费在线使用。对非裔(r²>0.8 可填充至 MAF 0.14%)与西裔人群(0.11%)的填充精度远超 HRC 与 1000 Genomes,截至 2022 年已完成逾 3,800 万基因组的填充,基本取代了 HRC/1000G 面板的地位(ASHG 2022 MIS Workshop)。这意味着即使你永远不申请 TOPMed 原始数据,你的研究也可能已经在受益于它。

维度三:族群公平性的现实样本。 约 60% 参与者为非欧裔,这在大型 WGS 资源中极为罕见。对开发 PRS 与疾病风险模型的研究者,TOPMed 提供了评估跨 ancestry 迁移性的真实底座:同一血压/血脂性状下,欧裔面板训练的 PRS 在混血群体中衰减、而多族群加权后恢复的完整证据链可直接在此复现(Nat Commun 2022)。

维度四:家系 × 纵向深表型的组合稀缺性。 英国生物银行规模更大但以无关个体为主;TOPMed 独有地同时提供扩展家系(FHS 三代、Amish、SAMAFS)、数十年纵向随访与全基因组测序。这使孟德尔一致性 QC(以家系为真值来源)、亲缘校正的混合模型、以及"家系内传播失衡检验"等只有家系数据才能支撑的方法在此有真实应用场域。对方法学研究者,这是开发与验证新一代遗传分析算法的首选试验台。

§1.3 同类数据集横向对比

数据集 规模 模态 深度表型 访问方式 与 TOPMed 的差异化
TOPMed >180,000 WGS(freeze 8: 96,620) WGS 30x + 多组学 + 纵向表型 数十年随访 + 家系 dbGaP 受控 / BDC 云 罕见变异密度全球最高;多 ancestry;imputation panel 全球默认
UK Biobank 约 500,000 人(500k WGS 在 RAP 内受控) 30x WGS + 影像 + 表型 深度但随访尚短 部分开放(表型)+ RAP 受控 规模更大但 ancestry 以英裔为主;无开放 WGS 分发
All of Us 目标 100 万(已发布 24.5 万 WGS) WGS + EHR + 可穿戴 EHR 为主 受控工作台 前瞻性新招募,随访历史短;多样性政策相近
1000 Genomes 2,504 人(phase 3) 低覆盖 WGS 无深度表型 完全开放 开放参照系;样本量与表型不可与 TOPMed 比
HRC r1.1 32,470 人 基因分型数据合并 服务器/EGA 注册 SNP-only、欧裔为主、不含 indel
gnomAD >76,000 基因组(v4) WGS/WES 汇总频率库 无个体级表型 开放汇总 频率参考而非关联分析资源,无个体级基因型表型配对

§1.4 版本时间轴

时间 版本/里程碑 规模 关键变化
2014 TOPMed 计划启动(源于 2014 NHLBI workshop) Phase 1 规划 20 项研究 WGS 优先战略确立
2016-10 Phase 1 WGS 进入 dbGaP 约 20,000 样本 首批数据发布
2017-03 Phase 2 测序完成 约 52,000 样本(Phase 1+2) 多 ancestry、多表型覆盖
2021-02 Nature 主论文(freeze 5) 53,831 基因组 >4 亿变异、46% singleton、TOPMed r2 填充面板上线
2021 Freeze 8(Phases 1-4 合并) 96,620 样本 / 约 4.28 亿过 QC 变异 GRCh38 统一、GDS 分发、主流分析基准
2022-2023 Freeze 9/9b + 组学 releases 约 206,000 样本、7.81 亿 SNV TOPMed2.0(PAR-22-194)转向多组学机制研究

§1.5 典型应用场景

  1. 性状级 WGS GWAS + rare variant burden:以 freeze 8 为底座,REGENIE/SAIGE 做单变异 + 基因级聚集检验(参考血脂分析范式)。
  2. 多基因风险评分(PRS)开发与迁移性评估:利用多 ancestry 结构训练、校准、评估跨族群 PRS(参考多族群高血压 PRS 范式)。
  3. 填充参考面板构建与评估:TOPMed r2 面板的复现研究、区域面板比较(HRC vs 1000G vs TOPMed)。
  4. 多组学机制研究(TOPMed2.0):RNA-seq eQTL、甲基化 EWAS、代谢组 mQTL 与 WGS 变异整合,做变异→功能解释。
  5. 方法学基准:混合模型(家系)、admixture-aware GWAS、超大规模联合调用与 QC 算法的对照实验场。

场景 → 数据子集 → 工具链的对应关系(与 §6 各节呼应):

场景 所需数据子集 推荐工具链 对应章节
WGS GWAS freeze 8 GDS + harmonize 表型 REGENIE + SAIGE-GENE §6.3/§6.7
PRS 开发 freeze 8 + 外部 UKB 复制集 PRSice-2/PRS-CS §6.7/§8.4
填充面板研究 自有芯片数据(无需 TOPMed 原始数据) TOPMed Imputation Server 坑点 7
家系方法 FHS/Amish 家系结构 + kinship 表 GENESIS/SeqArray §6.1
多组学整合 对应 omics accession + WGS tensorQTL + MR §3.1

§2 医学背景

§2.1 ICD-11 编码映射表

TOPMed 覆盖心肺血液睡眠(HLBS)四大系统疾病,下表列出 Working Groups 活跃研究方向的代表性疾病与 ICD-11 编码:

标签 ICD-11 编码 ICD-11 中文名 研究方向说明
Essential hypertension BA00 原发性高血压 TOPMed BP 跨族群血压遗传研究核心表型
Acute myocardial infarction BA41 急性心肌梗死 前瞻性队列结局事件(FHS/ARIC/CHS)
Atrial fibrillation and flutter BC81 心房颤动和心房扑动 10,000 例房颤病例-对照(Phase 计划目标)
Heart failure BD11 心力衰竭 纵向随访 incident heart failure
Asthma CA23 哮喘 约 26,000 哮喘病例与家系(Phase 计划目标)
Chronic obstructive pulmonary disease CA22 慢性阻塞性肺疾病 COPDGene 深度影像+表型子集
Obstructive sleep apnoea 7A42 阻塞性睡眠呼吸暂停 walk_PhaSST 等睡眠研究
Sickle cell disorders 3A50 镰状细胞病 约 6,300 镰状细胞病例(Phase 计划目标)
Hyperlipidaemia 5C80 高脂血症 freeze 8 血脂 GWAS 的四性状(LDL-C/HDL-C/TC/TG)

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 SNOMED 术语
原发性高血压 BA00 38341003 Hypertensive disorder, systemic arterial
急性心肌梗死 BA41 22298006 Myocardial infarction
心房颤动 BC81 49436004 Atrial fibrillation
哮喘 CA23 195967001 Asthma
慢性阻塞性肺疾病 CA22 13645005 Chronic obstructive pulmonary disease
阻塞睡眠呼吸暂停 7A42 73430006 Obstructive sleep apnea
高脂血症 5C80 55822004 Hyperlipidemia
镰状细胞病 3A50 417357006 Sickle cell disease

§2.2 疾病简介与流行病学

TOPMed 的靶标是心肺血液睡眠(HLBS)系统疾病——美国与全球的首要疾病负担来源。心血管疾病长期位居美国死因首位;COPD 与哮喘影响着数千万美国人,其中哮喘患病率在非裔与波多黎各裔人群中显著更高;镰状细胞病主要累及非裔群体;阻塞性睡眠呼吸暂停在成年人中的患病率估计达两位数百分比且与心血管结局强关联。这些疾病共同的遗传学特征是:全基因组常见变异只能解释一小部分遗传力(“missing heritability”),剩余部分大量分布于低频与罕见变异(MAF<1%)——这正是 TOPMed 的设计靶点(Taliun et al., 2021)。

流行病学意义上的关键差异化在于人群结构:非裔与西裔/拉丁裔人群承受着不成比例的 HLBS 疾病负担,但历史上遗传研究对其覆盖严重不足。TOPMed 约 60% 的非欧裔构成(freeze 8 血脂子集中 Black 25.60%、Hispanic 21.02%、Asian 7.11%、Samoan 1.78%)使其成为评估"遗传研究结果跨族群可迁移性"的最现实场所。

TOPMed 各 Working Group 聚焦的代表性表型域与其医学定位:

表型域 代表性状/疾病 遗传研究价值锚点
心血管 血压、血脂、心梗、房颤、心衰 遗传力 20-50%;TOPMed BP 跨族群范式发源地
哮喘、COPD、肺功能(FEV1/FVC)、肺纤维化 COPDGene 深度影像+WGS 配对全球独有
血液 血细胞计数、镰状细胞病、止血与血栓 隔离群体 founder 变异富集(如 Amish APOB 单倍型)
睡眠 OSA、睡眠时长与结构(walk_PhaSST) 遗传研究起步晚、表型采集成本高、样本稀缺
代谢 身高、BMI、脂蛋白(a)、尿酸 数量性状遗传架构的模型系统

§2.3 临床任务定义

任务类型 定义 TOPMed 支撑方式
风险筛查 识别无症状期高危个体 纵向队列提供 incident 事件终点,支撑 PRS 与临床风险因子联合模型
诊断分型 分子亚型划分(如哮喘内型) 多组学(代谢组/RNA-seq)+ 深度表型支撑分子亚型发现
预后评估 疾病进展与再发预测 数十年随访事件记录支撑生存建模
药物靶点发现 变异→蛋白→性状因果链 WGS + 蛋白组/代谢组 pQTL/mQTL 整合(孟德尔随机化)
罕见变异功能解释 基因级负担与 variant-to-gene 46% singleton 密度 + 家系/隔离群体放大效应

§2.4 患者人群构成

freeze 8 中 21 个血脂分析队列(66,329 人)给出了跨队列人群结构的典型画像(Nat Commun 2022):

维度 构成 备注
来源 前瞻性队列(FHS、ARIC、CARDIA、CHS、MESA、WHI 等)+ 病例-对照(COPDGene 等)+ 家系/隔离群体(Amish、Samoan、HCHS/SOL) 21 个队列合计 66,329 人
采集时间 各队列起始 1948(FHS 原始队列)至 2010 年代;随访延续至今 纵向 visit 结构跨数十年
年龄 全体平均 53 岁(SD 15);CARDIA 平均 25 岁 → CHS 平均 73 岁 跨队列年龄设计差异极大
性别 女性 41,182 人(62%) 多数队列女性偏多
自报 ancestry White 29,502(44.46%);Black 16,983(25.60%);Hispanic 13,943(21.02%);Asian 4,719(7.11%);Samoan 1,182(1.78%) 遗传 ancestry 比例在个体层面连续分布
就医/招募类型 社区人群招募为主 + 专科病例募集(如肺纤维化 LTRC、镰状细胞 OMG-SCD) 非临床连续流

构成这一联邦体的核心家长队列画像(各队列公开口径,入 TOPMed 测序的为其中子集):

家长队列 启动年份 设计 原始招募规模 在 TOPMed 中的角色
Framingham Heart Study(FHS) 1948 三代纵向家系队列 原始队列 5,209 人,后扩展 Offspring/Third Generation 心血管表型金标准;家系结构支撑罕见变异分析
Jackson Heart Study(JHS) 2000 单城市非裔社区队列 约 5,300 人 非裔人群深表型代表
CARDIA 1985 年轻成人纵向队列 约 5,100 人 长期生命历程血压/代谢轨迹
CHS 1989 老年心血管队列 约 5,900 人 高龄段结局事件密度高
ARIC 1987 社区动脉粥样硬化风险队列 约 15,800 人 中年-老年事件随访主力
MESA 2000 多族群亚临床动脉粥样硬化队列 约 6,800 人(四族群) 影像亚临床表型 + 多族群平衡
HCHS/SOL 2008 西裔/拉丁裔多中心队列 约 16,400 人 西裔人群代表(古巴/墨西哥/波多黎各等背景)
WHI 1991 女性健康倡议(临床试验+观察) 约 161,000 名女性 女性为主的绝经后健康资源
COPDGene 2008 病例-对照(COPD/对照吸烟者) 约 10,000 人 影像定量 CT + 深度肺表型
Amish HAPI/Longevity 1993 起 隔离群体家系 约 7,000+ 参与 founder 罕见变异放大器

§2.5 临床价值

对临床转化的价值路径有三条:第一,风险分层——TOPMed 血压/血脂等性状的多族群 PRS 已被证明在非裔与西裔人群中独立于传统风险因子提供增量预测(Nat Commun 2022),为"按基因组背景分层筛查"提供证据;第二,药物靶点——变异与蛋白/代谢物 QTL 的整合支持孟德尔随机化,为 HLBS 疾病提供因果级靶点候选;第三,疾病重新定义——基于分子签名的亚型划分(NHLBI 官方列出的预期成果之一)可能改写 HLBS 疾病的分类学与临床试验入组标准。

从数据集到临床应用的距离评估:TOPMed 产出的 PRS/靶点属于"研究级证据",距离临床部署还差 prospective validation(前瞻验证)、临床效用研究(是否改善结局)与监管审批三步。适合的定位是把它当作"证据生成引擎",而非可直接落地的模型来源——这也与 §7.4 的伦理边界一致。

§2.6 金标准参考表

维度 内容
任务划分 无固定 train/test 划分;Working Group 按 paper proposal 逐项定义分析集
标注方式 表型来自家长研究协议化采集(医师判读事件、标准化测量),非 AI 标注;变异调用为 pipeline 自动 + ML 过滤
标注者 各队列经验证的结局 adjudication 委员会(事件终点);变异 QC 由 IRC/DCC 集中完成
标注性质 纵向随访中的前瞻性事件判定(prospective adjudication),部分亚型表型为回顾性协议化
参考基准 freeze 5 主论文(variant catalog 与 QC 基线);freeze 8 血脂分析(GWAS 流程基线);Hanks et al. 2022(填充质量基线)

§3 数据集规格

§3.0 版本抉择矩阵

TOPMed 数据以 freeze 版本化,且 WGS 与表型常分属不同 dbGaP accession。选错版本是新手最高频错误:

你的需求 推荐版本 大小 理由
复现 Taliun 2021 主论文 / variant catalog 分析 Freeze 5(53,831 人) 数 TB 与 Nature 主论文方法与数字严格对应
2022 年后的标准 WGS GWAS / rare variant 分析 Freeze 8(96,620 人,Phases 1-4) 单队列数十 GB-数 TB 当前社区主流基准;GDS/BCF 齐备;血脂等范例均基于它
最大样本量(含新 Phase) Freeze 9/9b(约 206,000 样本,7.81 亿 SNV) 更大 覆盖最广,但方法文档与范例相对少、审稿人熟悉度低
只做基因型填充(无原始数据需求) TOPMed r2 参考面板(97,256 人 / 3.08 亿位点) 在线免费,无需下载 经 TOPMed/Michigan Imputation Server 使用,不占用 DAR 名额
需要汇总级 GWAS 结果做 meta/复用 phs001974 Genomic Summary Results 数百 GB 受控共享的跨研究汇总统计
教学原型 / 算法调试 1000 Genomes + TOPMed r2 填充 GB 级 开放数据开发,TOPMed 面板在线填充,避免 DAR 等待

§3.1 模态详情

模态 规格 说明
WGS 平均约 30x;Illumina 短读长(7 中心);BWA-MEM / GRCh38 联合 calling 跨全样本;GDS + multi-sample BCF 分发;CRAM 仅在 BDC
RNA-seq Phase 4 起分批生成 组织/批次依子研究;经 dbGaP 独立 accession 发布
DNA 甲基化 芯片与测序混合(依子研究) epigenomics 工作组协调
代谢组学 靶向代谢谱(Phase 4 起) 与表型时间点需跨 accession 对齐
蛋白质组学 部分队列(SomaScan 等平台,依子研究) 支持 pQTL 与孟德尔随机化
纵向临床表型 各家长研究原始协议(生化、影像、事件 adjudication) 与 WGS 分属不同 accession,需自行合并
影像 部分队列(如 COPDGene 约 10,000 人 2,200 万张 CT) 非全样本覆盖

§3.2 按子集样本数

子集(freeze 8 相关) 样本数 dbGaP accession(WGS) 表型 accession
Framingham Heart Study(FHS) 数千人 phs000974 phs000007
Jackson Heart Study(JHS) 3,403(面板口径) phs000964 phs000286
CARDIA 3,449(面板口径) phs001612 phs000285
HCHS/SOL 6,514(面板口径) phs001395 phs000810
MESA 5,347(面板口径) phs001211 phs000209
WHI 11,039(面板口径) phs001237 phs000200
ARIC 8,426(面板口径) phs001416 phs000090
CHS 3,528(面板口径) phs001368 phs000287
BioMe 11,570(面板口径) phs001644 phs001644
COPDGene 10,514(面板口径) 独立 accession
Amish 1,123(consented subjects) phs000956
Genomic Summary Results(汇总) 覆盖全计划 phs001974

注:表中"面板口径"数字来自 TOPMed r2 填充面板的队列构成统计(ASHG 2022),与各队列在 freeze 8 中的实际入集样本数可能不同;每个 accession 的确切人数以 dbGaP 对应版本页面为准。

§3.3 数据格式

格式 内容 获取渠道 说明
multi-sample BCF/VCF freeze 联合 call set(按研究×consent group 拆分,tar 打包) dbGaP 每染色体一个文件
GDS(Genomic Data Structure) freeze 8 转制版 dbGaP SeqArray/SeqVarTools(R)高效读取,推荐大样本分析
CRAM + 单样本 VCF 原始比对与单样本基因型 仅 BioData Catalyst dbGaP 无 CRAM
表型 CSV/SAS 家长研究表型数据集 dbGaP(另一 accession) 各队列 schema 不同
汇总统计 GSR(GWAS summary statistics) phs001974 受控共享

§3.4 存储大小

  • 全计划体量为 PB 级:30x WGS 单人 CRAM 在 30-100 GB 量级,逾 18 万人仅比对文件即超 10 PB 量级,加多组学与影像后更高(BDC 云托管、按项目计费)。
  • freeze 8 每队列 multi-sample BCF(约 4.28 亿变异 × 数千-万人)典型为数十 GB 至数 TB/队列;下载 dbGaP tar bundle 需按队列×consent group 逐包下载。
  • 本地全量分析 freeze 8 的一个中型队列(如 5,000 人 GDS 约 0.5-1 TB)需要 ≥2 TB 工作盘;跨队列合并建议直接在 BDC 云或机构 HPC 进行。

存储量级速算(规划用):

对象 单位大小 规模 量级
30x CRAM 30-100 GB/人 >180,000 人 ≥10 PB
freeze 8 全部 BCF(含 all-of-sample) 数十 GB-数 TB/队列 数十个队列×consent group 数十 TB
单队列 GDS(5,000 人) 0.5-1 TB TB
汇总统计(GSR,全计划) 数十-数百 GB phs001974 数百 GB
表型 CSV/SAS MB-GB/队列 90+ 队列 GB 级

§3.5 标注方式

TOPMed 不含 AI 模型标注。其"标签"分两类:变异调用标注为 pipeline 自动产出(GotCloud 联合 calling + 孟德尔一致性 SVM 过滤,方法开源),表型标注为家长研究协议化采集与终点 adjudication(如心血管事件由委员会按标准化标准判读)。二者质量体系不同:前者有重复测序一致性指标(SNV 重复样本 alt-allele concordance 0.9995、indel 0.9930,Taliun et al., 2021),后者有各队列独立验证的判读协议。

§3.6 标注者资质与一致性

  • 变异调用:密歇根大学 IRC 集中执行,7 个测序中心实验室方法标准化;SVM 过滤器以已知家系孟德尔一致性训练。
  • 结局事件:各前瞻性队列沿用各自的 adjudication 委员会与标准化判读手册(如 FHS/ARIC 的心血管事件判读),跨队列判读标准并非完全一致——这是跨队列合并时必须核对的一环。
  • 重复测序一致性与外显子数据交叉比对(0.9995/0.9930)提供了可引用的定量一致性证据。

§3.7 采集周期

测序于 2014 年起分 Phase 推进(Phase 1 约 20,000 人 → 2017 年 Phase 2 约 52,000 人 → Phases 3-4 至逾 14 万 → 累计约 18-20 万);表型采集则可追溯至各队列建队(FHS 1948 年起、CARDIA 1985 年起、MESA 2000 年起等),纵向随访持续至今。temporalCoverage 跨越 1948 年至今。

Phase 推进与数据发布节奏(NHLBI 顾问委员会与官方口径):

阶段 时间 测序规模 数据发布
Phase 1 2014-2016 约 20,000 人 2016-10 入 dbGaP
Phase 2 2016-2017 约 52,000 人(累计) 2017 年起分批
Phase 3 2017-2018 约 47,000 人(本阶段) 2018 年目标累计 120,000
Phase 4+ 2018 起 累计逾 14 万-18 万 组学(RNA/甲基化/代谢/蛋白)加入
Freeze 5/8/9 2021-2023 53,831 / 96,620 / 约 206,000 Nature 主论文与现行分析基准

§3.8 地域覆盖

美国本土各州 + 夏威夷(Samoan 队列)+ 波多黎各等;HCHS/SOL 覆盖布朗克斯、芝加哥、迈阿密、圣迭戈四个拉美裔聚集城市圈;JHS 覆盖密西西比州杰克逊市。非美国站点极少(个别 sub-study),总体为美国人群资源。

§3.9 设备规格

  • 测序:Illumina 短读长平台(各中心 NovaSeq/HiSeq 系列设备),7 个中心清单见 §1.1;同一研究同一 Phase 固定单一中心。
  • 表型:各队列标准化临床测量(血压 standardized protocol、血脂空腹采血等);影像子集使用各队列 CT/MRI 协议(如 COPDGene 肺 CT)。
  • 组学:Phase 4+ 的 RNA/甲基化/代谢/蛋白平台依子研究而定,方法文档在 TOPMed Methods 页按 omics type×phase 提供。

§3.10 深度溯源链

样本 → 家长研究生物样本库(含采集协议与冻存记录)→ 测序中心(研究×Phase 固定,实验室方法标准化)→ IRC 统一比对(BWA-MEM/GRCh38)与联合 calling(GotCloud)→ DCC QC 与 GDS 转制 → dbGaP Exchange Area(按 accession×consent group 打包)→ NIH DAC 审批 → 研究者(dbGaP 下载或 BDC 云工作区)。每一环节的方法文档公开:变异 calling 流程在 statgen/topmed_variant_calling,各 freeze 方法在 nhlbiwgs.org/data-sets,组学 pipeline 在 TOPMed Methods 页。


§4 数据结构

§4.0 目录树

dbGaP 下载解压后的典型结构(以单队列 freeze 8 WGS accession 为例;不同研究目录命名有差异,以 accession 内 README 为准):

phsXXXXXX.vN.pN/
├── RELEASE_NOTES.txt                  # freeze、样本量、QC 摘要
├── TOPMed_WGS_Freeze8_Phases1-4_methods.pdf   # freeze 8 跨研究方法文档
├── pheno/
│   ├── subject_consent.csv            # subject_id, consent_group (GRU/HMB/DS-…)
│   └── phenotype_dataset_*.csv        # 家长研究表型(或指向另一 accession)
├── genomic/
│   ├── chr1.bcf (+ .csi)              # multi-sample 联合 call set,按染色体
│   ├── chr2.bcf
│   ├── ...
│   ├── chr22.bcf
│   ├── chrX.bcf
│   └── *.gds                          # GDS 转制版(SeqArray 结构)
├── sample_info/
│   ├── ancestry_pcs.csv               # 遗传 ancestry 主成分(IRC 计算)
│   └── kinship_relatedness.csv        # KING/PC-Relate 亲缘估计
└── docs/
    └── data_dictionary_*.pdf          # 表型变量字典(逐变量定义)

BioData Catalyst 云端的等价物则为平台对象模型:file(CRAM / 单样本 VCF / 多样本 VCF / 表型)挂在 participant 实体下,可按 study×consent group 检索(Seven Bridges 说明)。

§4.1 DAIMS 字段字典

核心基因型文件(GDS/SeqArray 结构)与配套文件的 8 列字段字典:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
sample.id Text WGS 样本编号(NWD-NWDID 系列) NWD123456 样本主键,串联表型 身份解析错误已在 QC 修正 字符串
chromosome Text 染色体(GRCh38 命名) 12 / chr12 定位、过滤 1-22, X
position Integer GRCh38 位置 111827559 区间合并、注释 liftOver 误差已规避 ≥1
allele.ref Text 参考等位基因 A 填充与链方向核对 链翻转需自查 ACGT
allele.alt Text 替代等位基因 G 剂量计算 多等位位点拆分 ACGT
genotype Integer 基因型(剂量矩阵,0/1/2/NA) 0 GWAS/ML 特征 SVM 过滤后残留少量误差 NA = 缺失
annotation.id Text 变异 ID(rs 或位点 ID) rs2066844 与 dbSNP/外部面板对齐 freeze 间 ID 更新 字符串
ancestry_pc1…k Float 遗传 ancestry 主成分 -0.0123 分层校正/分层分析 依赖参考集选择 连续值
consent_group Text 该样本所属同意组 HMB-IRB-PUB 合规过滤(必须先于分析) GRU/HMB/DS-*/…
kinship Float 亲缘系数估计 0.25 家系结构建模、划分去泄漏 远亲估计噪声大 [0,1]

§4.2 标签分布

TOPMed 无单一生成式"标签";以性状分析视角看(freeze 8 血脂子集为例):连续性状(LDL-C/HDL-C/TC/TG)经降脂药校正 + 逆秩正态化后跨队列可比;二分类结局在 case-control 子研究(如 COPDGene)中接近 1:1,在前瞻队列中事件率低至个位数百分比。rare variant 分析中 4.28 亿变异里 2.02 亿为 singleton、4.17 亿 MAF<1%(97.3%),这是标签(变异)分布的核心事实(Nat Commun 2022)。

§4.3 关键统计

统计量 数值 来源
freeze 5 检出变异 >4 亿(SNV+indel) Taliun et al. 2021
singleton 占比 46%(无关个体中 53%) Taliun et al. 2021
MAF<1% 占比 97% Taliun et al. 2021
未见于 dbSNP 的比例 约 78.7%(发表时) Nat Genet 评述 s41576-021-00343-x
freeze 8 过 QC 变异(21 队列) 4.28 亿;singleton 2.02 亿 Nat Commun 2022
freeze 9 变异发现 7.81 亿 SNV + 6,200 万 indel 过 QC(约 206,000 样本) topmed.nhlbi.nih.gov
重复测序一致性 SNV 0.9995 / indel 0.9930(alt-allele concordance) Taliun et al. 2021

§4.4 数据层级

participant(subject_id)→ consent group → WGS sample(NWD-NWDID)→ 染色体 BCF/GDS → 变异位点(chromosome:position:ref:alt);表型侧为 participant → visit/exam(跨数十年)→ 测量值/事件 adjudication。两个层级的连接键是 WGS sample ↔ participant 映射表(subject_consent.csv 类文件)。多组学数据(RNA/甲基化/代谢)各自有独立 accession 与样本映射,需通过该映射表人工对齐。

# 层级连接示例:GDS 样本 ID ↔ 表型 subject_id ↔ consent 过滤(R)
library(SeqArray); library(data.table)
gds  <- seqOpen(file.path(data_root, "phs000974/genomic/freeze8_fhs.gds"))
samp <- data.table(wgs_sample = seqGetData(gds, "sample.id"))
map  <- fread(file.path(data_root, "phs000974/pheno/subject_consent.csv"))
# subject_consent.csv 通常含 subject_id, wgs_sample(NWD-ID), consent_group
merged <- merge(samp, map, by.x = "wgs_sample", by.y = "NWD_ID")
keep   <- merged[consent_group %in% approved_groups]$wgs_sample
seqSetFilter(gds, sample.id = keep)   # 分析前强制 consent 过滤(坑点 8)

§4.5 缺失值与信息性缺失

场景 表现 处理建议
基因型缺失 联合 call set 中个别位点/样本缺失(GDS 记为 NA) 大样本下位点级缺失率极低;样本级高缺失已在 QC 剔除
表型跨队列缺失 同名变量定义不同或仅部分队列采集 按队列分层分析或 harmonization 后合并;缺失模式与队列身份高度相关(信息性缺失)
纵向访视缺失 参与者缺某次 visit 注意存活偏倚:缺访视与结局风险相关,非随机
consent 排除 部分 consent group 不允许特定用途 不得填补或"借用",必须整组排除(合规缺失)

信息性缺失是 TOPMed 表型合并的最大陷阱:数据缺失与队列设计(谁被测了什么)强相关,简单 complete-case 分析会引入设计偏倚。


§5 数据划分与使用建议

官方划分:无。TOPMed 以 freeze 版本为单位发布全量数据,不存在 train/val/test 官方划分。

社区惯例:GWAS 是推断型任务不做泛化划分;预测建模(PRS/ML)通常按队列分层抽样划分,并强制以家系为单元划分(同一家系的样本必须同侧,否则亲缘泄漏导致虚高性能)。

划分策略建议:① 以 kinship 表做连通分量聚类,保证跨划分无一等/二等亲;② ancestry 分层保持各划分的族群比例一致;③ 报告时按自报 race/ethnicity 与遗传 ancestry 双口径分层评估。

泄漏风险(§5.3 重点):TOPMed 的三大泄漏源——家系(FHS/JHS/Amish 均为家族设计)、重复测序(同一人多次测序用于 QC,部分保留在 call set 中)、队列间重叠随访(同一参与者在不同 sub-study)。任何预测模型若忽略第①点,AUC 可虚高数个百分点。

三种典型任务的建议划分方式:

任务 划分单位 保障措施 报告要求
GWAS/统计推断 全样本(无划分) 混合模型 + PCs 校正 λGC、QQ、效应值与 CI
PRS 构建 ancestry × 队列分层 权重训练集与调参集隔离 分 ancestry AUC/C-index
ML 表型预测 家系连通分量 leave-family-out 各折性能分布而非单点

交叉验证建议:家系数据用 leave-family-out;跨 ancestry 评估用 leave-ancestry-out 或按 ancestry 内部 CV;冻结面板(如 PRS 权重)必须在外部队列(UK Biobank、All of Us)验证而非内部重复使用。对混血样本,个体内 ancestry 组分连续分布,划分时需检查各折的 ancestry 组成漂移(可用 PERMANOVA 快速检验)。

外部验证建议:优先 UK Biobank(约 13 万 WGS 可复制 rare variant 信号);All of Us 用于美国人群 EHR 表型迁移;独立临床试验数据用于临床级验证。跨库验证前先统一基因组构建(TOPMed 为 GRCh38)与表型映射(PheCodes/OMOP),并在数据可用性声明中注明双方 accession。


§6 AI 就绪指南

§6.0 云端快速启动

对多数用户,不下载原始 WGS、直接在 BioData Catalyst(BDC)云端分析是更优路径:BDC 在 AWS/GCP 上提供 Terra 与 Seven Bridges 两种工作区,托管 CRAM、单样本/多样本 VCF 与表型文件,自带 WDL/Cromwell workflow 生态;dbGaP DAR 批准后账户权限约 1 周内同步至 BDC(BDC 文档)。本节代码默认本地 GDS/PLINK 路径,云端等价操作在 §6.10 说明。

§6.1 快速上手

目录结构预期:假定你已获得某队列 freeze 8 GDS 文件,目录布局为 data_root/phsXXXXXX/genomic/*.gds + data_root/phsXXXXXX/pheno/subject_consent.csv。以下代码中 data_root 变量与该布局拼接。最小可用子集:单队列 GDS(数十 GB-数 TB)+ 同队列表型 CSV——先用单队列跑通全流程,再扩展跨队列。

R(SeqArray)读取 GDS 并做样本级 QC:

# 依赖:BiocManager::install(c("SeqArray","SeqVarTools","SNPRelate","GENESIS"))
library(SeqArray); library(SNPRelate)

data_root <- "/data/topmed"                       # data_root 拼接关系:
gds_fn   <- file.path(data_root, "phs000974",     #   data_root/<phs accession>/genomic/*.gds
                      "genomic", "freeze8_fhs.gds")
gds <- seqOpen(gds_fn)

# 样本级 QC(IRC 已做过集中 QC,此处为二次保守检查)
sample.depth <- seqSummary(gds, "read.depth", check="none")
seqSetFilterCond(gds, maf=0.01, missing.rate=0.05)   # 变异级二次过滤
pca <- snpgdsPCA(gds, num.snp=200000)                 # 快速 ancestry PCA
head(pca$eigenvect[,1:4])
seqClose(gds)

PLINK2 路线(BCF → PLINK2,适合 batch 导出 dosage):

# 前置:dbGaP tar 包解压后每染色体一个 bcf;先建索引
bcftools index -t chr22.bcf
# 提取 MAF>1% 常见变异做快速 PCA/PRS 原型(罕见变异分析走 REGENIE/SAIGE)
plink2 --bcf chr22.bcf --maf 0.01 --make-bed --out chr22_common

§6.2 数据获取

申请流程(dbGaP 受控访问)

步骤 内容 要点
1 取得 eRA Commons ID 经所在机构科研管理部门注册;非 PI 需挂靠有 DAR 权限的 PI
2 在 dbGaP Authorized Access 系统创建 Project 一次最多勾选 200 个 study,按 accession×consent group 勾选
3 撰写 Research Use Statement 需与所勾数据的 Data Use Limitations 一致
4 机构 Signing Official(SO)签批 提前联系 SO,避免排队延误
5 NHLBI Data Access Committee(DAC)审批 视是否需本地 IRB,通常 2-6 个月
6 批准后下载或接入 BDC dbGaP 同步至 BDC 约 1 周;PI 指派 downloader 约 24 小时
7 每年续期 DAR 过期将失去数据权限,云端托管数据亦受影响

来源:dbGaP 申请 FAQ(NBK570242)BDC Data Access 文档

获取渠道对比

渠道 格式 适合人群 成本
dbGaP 下载 tar 包(BCF/GDS/表型) 本地 HPC 用户 存储+传输(数 TB-数十 TB)
BioData Catalyst CRAM/VCF 云对象 无本地集群用户 云计算按量计费(NHLBI 有时提供 credit)
TOPMed/Michigan Imputation Server 在线填充 只需填充面板者 免费(TOPMed r2 面板)
phs001974 GSR 汇总统计 meta 分析/方法复用 DAR 受控

BDC 云端起步(获批后)

1. 注册 BDC 账号并用 eRA Commons 登录 → 等待 dbGaP 权限自动索引(约 1 周)
2. 选择工作区平台:Terra(Gen3 数据模型)或 Seven Bridges(Data Browser 检索)
3. 按 Study × Consent Group × File Type 检索(如 freeze 8 多样本 VCF)
4. 创建 Project,把文件加入工作区(无下载,云内引用)
5. 运行公共 Gallery 中的 QC/调用 workflow,或用 WDL/CWL 提交自定义流程
6. 导出结果(汇总统计、图表)而非原始数据;注意导出物同样受 DUL 约束

提示:BDC 数据浏览器对所有人展示开放元数据(文件存在性可查),但把文件加入项目做分析需要 dbGaP 权限,权限服务会自动校验(Seven Bridges 说明)。

§6.3 预处理全流程

从 freeze 8 原始 call set 到可建模矩阵的标准流程(以单队列定量性状 GWAS 为例):

# 1. 格式统一:BCF -> PLINK2 pgen(保留 dosage)
plink2 --bcf chr1.bcf --make-pgen --out chr1

# 2. 样本/变异二次 QC(IRC 已集中 QC,此处保守阈值)
plink2 --pgen chr1.pgen --psam cohort.psam \
  --mind 0.05 --geno 0.05 --maf 0.005 --make-bed --out qc_chr1

# 3. 合并染色体后计算亲缘(KING-robust)与 PCA
plink2 --bfile all_qc --make-king --out king
plink2 --bfile all_qc --pca 10 --out pca10
# 4. 表型 harmonization(示例:降脂药校正的 LDL-C,逆秩正态化)
pheno$ldl_adj <- with(pheno,
  ifelse(lipid_med == 1, ldl_raw / 0.75, ldl_raw))   # 用药校正系数按论文协议
pheno$ldl_rank <- qnorm((rank(pheno$ldl_adj, ties.method="random")
                          - 0.5) / length(pheno$ldl_adj))  # inverse rank normalize

# 5. REGENIE step 1(全基因组混合模型:吸收家系+分层结构)
# regenie --step 1 --bed all_qc --phenoFile pheno.txt --phenoCol ldl_rank \
#   --covarFile cov.txt --covarColList age,sex,PC1-PC10 \
#   --qt --bsize 1000 --loocv --out regenie_step1
# 6. REGENIE step 2(按染色体做关联,rare variant 用 -- burdens)
# regenie --step 2 --bgen chr1.bgen --covarFile cov.txt \
#   --phenoFile pheno.txt --phenoCol ldl_rank --qt \
#   --pred regenie_step1_pred.list --minMAC 20 --out regenie_step2_chr1

要点:IRC 提供的 ancestry PCs 与亲缘文件可直接使用(sample_info/),但跨队列合并时应重算而非直接拼接(各队列 PCA 参考集不同)。

<details>
<summary>跨队列合并的扩展流程(多队列 meta 与合并分析的选择)</summary>

# 方案 A:跨队列 meta 分析(各队列独立跑 GWAS,再合并汇总统计)
# 各队列内(保证 case 数、MAC 过滤在队列内完成):
plink2 --bfile all_qc --pheno pheno.txt --pheno-name ldl_rank \
  --glm cols=chrom,pos,ax,nobs,af,beta,se,p --out cohortA_ldl
plink2 --bfile all_qc --pheno pheno.txt --pheno-name ldl_rank \
  --glm cols=chrom,pos,ax,nobs,af,beta,se,p --out cohortB_ldl

# 合并(metal 或 python 简易实现,按样本量加权):
metal --input cohortA_ldl ... cohortB_ldl ... SCHEME STDERR
# 必查:各队列效应方向一致性、Cochran Q / I² 异质性

# 方案 B:合并样本联合分析(REGENIE 直接吃合并 bed,队列指示变量作协变量)
# regenie --step 1 --bed merged_all --covarColList ...,cohort_indicators
# 优点:单变异功效更高;缺点:受队列结构残余影响更大,必须报告按队列分层结果

选择建议:跨队列表型定义差异大时用方案 A(meta 对协议差异更鲁棒);表型已严格 harmonize 且需最大功效时用方案 B。
</details>

§6.4 PyTorch DataLoader

基因组数据的深度学习通常是"剂量矩阵 → 表型预测"。以下完整可运行示例假定已用 PLINK2 --export A 或 R 导出 dosage 矩阵为 .npy(变体×样本),配合表型 CSV:

"""
目录预期:
data_root/
├── dosage.npy          # shape (n_variants, n_samples), float16, 0/1/2 dosage
├── variant_ids.txt     # 每行一个 chr:pos:ref:alt
└── phenotypes.csv      # 列: sample_id, y (0/1), cohort
data_root 为你的 TOPMed 导出目录;先用 §6.3 流程把 GDS/BCF 导出为 npy。
"""
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader

class TopMedDosageDataset(Dataset):
    """TOPMed 剂量矩阵 → 二分类表型的最小 Dataset。
    纵向读取(mmap)避免将数 TB 矩阵载入内存;按样本列切片。"""
    def __init__(self, data_root: str, dosage="dosage.npy",
                 pheno="phenotypes.csv"):
        self.X = np.load(f"{data_root}/{dosage}", mmap_mode="r")  # (n_var, n_subj)
        self.ph = pd.read_csv(f"{data_root}/{pheno}")
        self.y = torch.tensor(self.ph["y"].values, dtype=torch.float32)
        self.cohort = self.ph["cohort"].values                     # 用于分层划分

    def __len__(self):
        return self.X.shape[1]

    def __getitem__(self, idx):
        x = torch.from_numpy(np.ascontiguousarray(
                self.X[:, idx].astype(np.float32)))                # (n_var,)
        return x, self.y[idx]

# 家系安全的分层划分(示意:按队列分层;家系列需自行并入 group 列)
ds = TopMedDosageDataset("/data/topmed")
loader = DataLoader(ds, batch_size=256, shuffle=True,
                    num_workers=4, pin_memory=True)

x, y = next(iter(loader))
print(x.shape, y.dtype)   # torch.Size([256, n_variants]) torch.float32

注意:直接把数百万变异喂入 MLP 通常是低效的;实用做法是先做 variant filtering(MAF/LD 剪枝)或用 REGENIE 类线性模型出 scores 再做下游 ML(§6.7)。

§6.5 坑点清单

⚠️ 坑点 1:低估 dbGaP 受控访问与机构资质的时间成本(分类:工程陷阱)

问题:TOPMed 原始数据完全受控,DAR 需要 eRA Commons ID + PI 身份 + 机构 Signing Official 签字 + NHLBI DAC 审批,BDC 官方文档明示周期通常 2-6 个月;若还需本地 IRB 审批则更长。
症状:按"下周就能拿到数据"排项目计划,结果 grant 开题两个月后仍在等 SO 签字;或非 PI 学生/博后发现自己根本无法提交 DAR,只能等 PI 指派 downloader(约 24 小时同步,但前置是 PI 已有对应数据权限)。
解决

  1. 简单方法:立项即启动 DAR;用 1000 Genomes(开放)+ TOPMed r2 在线填充先完成代码原型,把"真数据调试"压缩到获批后一周内。
  2. 进阶方法:加入已有 TOPMed 权限的实验室走 downloader 路线;或申请 phs001974 汇总统计(审批更轻)先行 meta 层验证。
  3. SOTA 方法:直接在 BDC 云上规划分析(获批后数据零传输),并把 DAR 年度续期写入项目管理日历——过期会导致云端托管数据一并失权。
    参考BDC Data Access 文档dbGaP 申请流程 NBK570242

⚠️ 坑点 2:freeze 版本间样本集与 call set 不一致,数字不可跨 freeze 比较(分类:预处理陷阱)

问题:freeze 5(53,831 人)、freeze 8(96,620 人)、freeze 9/9b(约 206,000 样本)是不同的联合调用批次:样本集不同、variant set 不同、QC 规则细节不同。同一 dbGaP accession 的版本号(v1/v2/v3…)分别对应不同 freeze,极易错配。
症状:把 freeze 5 论文的"4 亿变异"与 freeze 9 的"7.81 亿 SNV"并列比较得出错误结论;审稿人指出你的样本数与所引方法文档不符;同一 rs ID 在两个 freeze 间等位基因注释更新导致填充/合并错位。
解决

  1. 简单方法:锁定单一 freeze(当前主流为 freeze 8),全文统一并在方法学写明 “TOPMed freeze 8, Phases 1-4”;引用任何数字前核对它属于哪个 freeze。
  2. 进阶方法:下载时核对 accession 内的 “TOPMed Whole Genome Sequencing Project - Freeze 8, Phases 1-4” 方法文档附带的清单,确认该文档覆盖你的 accession 版本(官方明确要求"check the study list")。
  3. SOTA 方法:为分析代码建立 freeze 级配置文件(freeze 名、GRCh38、accession 版本号、下载日期),分析产物元数据自动携带,跨 freeze 对比一律重跑而非拼数字。
    参考nhlbiwgs.org/data-sets;phs000956 dbGaP 页方法说明

⚠️ 坑点 3:跨队列合并的批次效应与表型协议差异(分类:偏倚陷阱)

问题:TOPMed 是 90+ 队列的联邦体:WGS 虽由 IRC 统一比对与联合调用(同研究同 Phase 固定测序中心),但家长研究的表型采集协议、测量设备、随访长度、基因分型芯片历史各不相同;直接把各队列文件按行拼接会产生队列主效应淹没真实信号。
症状:GWAS Manhattan 图上出现与队列指示变量强相关的"伪峰";合并分析中年龄/性别系数与单队列显著不同;ML 模型学会预测"来自哪个队列"而非疾病。
解决

  1. 简单方法:所有模型加入队列指示变量 + ancestry PCs + 年龄性别;连续表型先做队列内逆秩正态化再合并(血脂论文的标准做法)。
  2. 进阶方法:表型 harmonization 逐变量核对各队列协议(如高血压定义、空腹要求、用药校正系数),采用 REGENIE step 1 的混合模型吸收跨队列结构;对核心协变量做跨队列分布诊断表。
  3. SOTA 方法:分层 GWAS(ancestry-specific)+ 跨族群 meta(异质性检验),而不是 naive 全合并;ML 场景用 domain-adversarial 训练或 leave-cohort-out 交叉验证检验队列不变性。
    参考Nat Commun 2022 血脂分析 Methods;Taliun et al. 2021(批次控制设计)

⚠️ 坑点 4:30x WGS 的存储与算力是 PB 级工程问题(分类:工程陷阱)

问题:全计划体量 PB 级(单人 30x CRAM 达数十 GB);dbGaP 侧 freeze call set 按研究×consent group 打包为 tar bundle,单队列可达数 TB;joint calling 与跨队列 burden 检验的 CPU/内存需求远超普通工作站。
症状:本地磁盘在解压第二个队列时耗尽;把全部 GDS 读入内存导致 OOM;用笔记本跑全基因组 PCA 数天不出结果。
解决

  1. 简单方法:只取所需染色体/MAF 阈值子集(plink2 --maf/--extract)落地本地;单队列原型 → 再扩展。
  2. 进阶方法:在 BDC 云端工作区直接分析托管数据(免下载),任务级用 Cromwell/WDL 批处理;本地 HPC 用户用 SeqArray 的块式读取(R)或 bcftools view -R 区间检索,保持内存常数。
  3. SOTA 方法:遵循社区 HPC 实践——freeze 8 级联合分析使用数百-数千核并行(REGENIE 的 step 1 分块回归设计正是为此),并把 CRAM 原始比对分析限制在云端(dbGaP 本就没有 CRAM)。
    参考Seven Bridges TOPMed 云托管说明BDC 文档

⚠️ 坑点 5:混合 ancestry 群体的 GWAS 分层处理(分类:偏倚陷阱)

问题:TOPMed 参与者包含非裔、西裔、萨摩亚等混血与隔离群体,个体内遗传 ancestry 比例连续变化;等位基因频率与 LD 结构随 ancestry 漂移,naive 全样本合并会产生分层伪信号,欧裔面板训练的模型在混血群体中性能骤降。
症状:λGC 膨胀因子 >1.05 且 QQ 图早翘;PRS 在训练族群 AUC 正常、在非裔/西裔验证集中跌至接近随机; burden 检验在 pooled 分析中"消失"而 ancestry-specific 分析中显著。
解决

  1. 简单方法:使用 IRC 提供的 ancestry PCs 作协变量 + 按自报族群分层检查 λGC;混血群体内部再做 ancestry 内 PCA。
  2. 进阶方法:ancestry-specific GWAS 后 trans-ancestry meta(含异质性统计);PRS 按 ancestry 分层加权/校准(多族群高血压 PRS 论文的 stage 2 设计)。
  3. SOTA 方法:admixture-aware 模型(TRACTOR、 genetics-aware LMM);rare variant 用 ancestry-stratified burden + 共同尺度聚合,保留族群特异等位基因的解释力。
    参考Nat Commun 2022 多族群 PRS;Taliun et al. 2021 population groups 分析

⚠️ 坑点 6:表型定义跨队列不一致(harmonization 陷阱)(分类:预处理陷阱)

问题:“高血压”“糖尿病”"哮喘"在 90+ 队列里各有自己的判读标准、测量次数与用药环境;事件终点由各队列自己的委员会 adjudicate。同名变量并不等于同义变量。
症状:合并后的疾病患病率随队列剧烈跳变;效应值方向在不同队列相反;模型在某队列训练、另一队列验证时性能塌陷——根因不是泛化失败而是定义漂移。
解决

  1. 简单方法:优先使用已有跨队列 harmonization 成果的性状(如 TOPMed BP/血脂工作组的协议,含用药校正系数与空腹规则)。
  2. 进阶方法:对目标表型建立逐队列映射表(变量名/单位/时点/判读标准),二分类性状报告各队列定义差异表;测量值先队列内标准化再合并。
  3. SOTA 方法:采用 PheCodes/OMOP 类标准映射并公开映射脚本;对定义敏感性做 epi 风险分析(两套定义并行报告),或用多变量 latent model 处理定义不确定性。
    参考Nat Commun 2022 Methods(血脂校正细节);phs000974 等各 accession 数据字典

⚠️ 坑点 7:混淆 TOPMed imputation panel 与 TOPMed 原始数据的边界(分类:标签理解)

问题:TOPMed r2 填充面板(97,256 人 / 3.08 亿位点)可免费在线使用,而 TOPMed 原始 WGS 受控;两者常被混为一谈——以为"用过 TOPMed 面板"就等于获得原始数据授权,或反过来以为面板也需要 DAR 而错过免费资源。面板不可下载,且经美国服务器上传基因型数据对欧洲用户有 GDPR 合规顾虑。
症状:论文数据可用性声明写错(称"TOPMed 面板数据可下载");团队为"用一下填充面板"申请了半年 DAR;欧洲合作机构法务否决把基因型上传 TOPMed Imputation Server。
解决

  1. 简单方法:明确三分——原始 WGS(DAR 受控)、r2 面板(服务器免费在线)、freeze 汇总统计(phs001974 受控);论文中分别表述。
  2. 进阶方法:填充前核对服务器输入规范(GRCh37 染色体无 chr 前缀、GRCh38 带 chr 前缀;先做 strand/allele harmonization),用 Hanks et al. 2022 的 r² 表预估你的芯片+ancestry 组合的填充质量。
  3. SOTA 方法:数据不能出境/上传的场景改用可下载面板(1000G、HGDP+1kGP)或在本地部署 Minimac4 + 获授权的面板子集;跨服务器结果做一致性校验。
    参考TOPMed Imputation Server;Hanks et al. 2022 AJHG(doi: 10.1016/j.ajhg.2022.07.012);imputationserver.readthedocs.io

⚠️ 坑点 8:consent group 与 Data Use Limitations 的合规红线(分类:工程陷阱)

问题:每个 dbGaP study 再按 consent group 细分(GRU、HMB、疾病特定 DS- 等,常叠加 IRB/PUB/非营利修饰符);DAR 按 study×consent group 粒度审批。TOPMed 内部协作另有"paper proposal 需 Working Group 批准、使用未批准数据集的稿件会被 Publications Committee 拒绝发布"的规则;对外部 dbGaP 用户,DAR 批准范围即法律边界。
症状:分析代码把不同 consent group 的样本无意合并,超出获批用途;投稿时发现所用的某个 consent group 未在 DAR 中勾选,被迫返工重新申请(又一轮数月);年度 DAR 过期导致项目中断。
解决

  1. 简单方法:分析管线第一步即按 consent_group 列过滤到获批集合,并把该集合快照写入版本控制;申请时按研究计划一次性勾全所需 consent group(一次 DAR 可含 200 个 study)。
  2. 进阶方法:为每个数据文件挂 DUO/consent 元数据,分析输出自动携带 provenance;日历化 DAR 续期(每年),SO 联系人信息存档。
  3. SOTA 方法:采用带合规检查的 workflow(BDC 工作区由服务程序读取 dbGaP 权限自动判定文件可见性),CI 中加入 consent 范围断言测试。
    参考Taliun et al. 2021 Box 1(consent 结构)TOPMed 工作组与 paper proposal 流程

§6.6 数据增强

操作 判定 说明
Variant masking(随机遮蔽位点做自监督预训练) ✅ 安全 保留剂量语义,训练基因型表征
MAF 分层重采样(均衡罕见变异 exposure) ✅ 安全 配合 burden 任务加权损失
跨队列 leave-cohort-out 采样 ✅ 安全且推荐 同时是偏倚诊断手段
随机翻转基因型剂量(0↔2) ❌ 危险 破坏等位基因语义,等价于伪造遗传数据
把 ancestry PCA 坐标做插值"扩充"样本 ❌ 危险 伪造不存在的单倍型组合,破坏 allele frequency 结构
用填充不确定度加权而非硬 dosage 阈值 ✅ 安全 保留稀有位点信息量

§6.7 模型推荐

任务 首选工具 备选 理由
定量/二分类大规模 GWAS(含家系) REGENIE BOLT-LMM、GEMMA 分块回归 + ML 预测器,为 UKB/TOPMed 规模设计
不平衡 case-control + rare variant burden SAIGE / SAIGE-GENE STAAR 稳健 Type I 控制(血脂论文即用 SAIGE)
填充 Minimac4(TOPMed r2 面板) Beagle 5.4、IMPUTE5 服务器免费、GRCh38、含 indel
PRS PRSice-2 / PRS-CS lassosum 多族群分层校准流程成熟
eQTL/多组学整合 tensorQTL FastQTL TOPMed2.0 组学阶段的社区标配
表型预测 ML XGBoost + 队列校正 线性混合模型 先解释队列结构再上深度模型

§6.8 硬件需求

场景 CPU 内存 存储 说明
单队列原型(GDS 子集) 16 核 64 GB 2 TB SSD SeqArray 块式读取
单队列全基因组 REGENIE 64-128 核 256 GB 5 TB step 1 数小时-1 天
跨队列(freeze 8 级)合并分析 HPC 500+ 核或云端批处理 ≥512 GB/节点 20-50 TB 建议直接 BDC
原始 CRAM 重比对/QC 云端大规模 PB 级对象存储 仅 BDC 托管 CRAM

§6.9 评估指标

"""GWAS / 填充质量 / PRS 的核心诊断(可直接运行的小工具集)
输入:REGENIE/PLINK2 输出的 GWAS 汇总表(列含 pvalue)"""
import numpy as np
import pandas as pd
from scipy.stats import chi2

def genomic_inflation(pvals: np.ndarray) -> float:
    """λGC:>1.05 且无明确原因 → 检查分层/批次/亲缘/病例错配"""
    x = chi2.isf(np.clip(pvals, 1e-300, 1.0), df=1)
    return float(x.mean() / 0.4549364)          # 0.4549 = chi2(1) 中位数

def qq_intercept(pvals: np.ndarray) -> float:
    """QQ 截距(预计 p 值):标准化膨胀,>0.05 需警惕"""
    obs = -np.log10(np.sort(np.asarray(pvals)))
    exp = -np.log10(np.linspace(1.0 / len(pvals), 1.0, len(pvals)))
    return float(obs[0])                         # 最显著点的预计膨胀

def rare_variant_summary(gwas_df: pd.DataFrame, mac_col="MAC") -> dict:
    """单变异 vs burden 检验的覆盖诊断:MAC 分布决定检验选择"""
    return {
        "n_singletons_tested": int((gwas_df[mac_col] < 2).sum()),
        "n_mac_ge20": int((gwas_df[mac_col] >= 20).sum()),  # 单变异 GWAS 有效集
        "lambda_gc": genomic_inflation(gwas_df["pvalue"].values),
    }

def stratified_report(per_ancestry_auc: dict) -> pd.DataFrame:
    """PRS/ML 跨族群性能表:AUC + 迁移衰减率(相对最优族群)"""
    df = pd.DataFrame(list(per_ancestry_auc.items()),
                      columns=["ancestry", "auc"])
    best = df["auc"].max()
    df["transfer_decay"] = 1.0 - df["auc"] / best
    return df.sort_values("auc", ascending=False)

核心指标约定:GWAS 报 λGC + QQ 截距(分 ancestry);填充报 r²>0.8 的最低 MAF(分芯片×ancestry);PRS/ML 报按 ancestry 分层的 AUC/C-index 及迁移衰减率;家系数据一律报 leave-family-out 性能(非随机 CV)。

§6.10 MLOps 笔记

  • 版本即合规:任何产物注明 freeze 名、accession 版本(phs…vN.pN)、下载日期、consent 集合快照;这是复现与合规审计的唯一锚点。
  • DAR 生命周期自动化:年度续期前 60 天提醒;权限过期监测脚本检查 BDC 文件可见性。
  • 数据不可出境:dbGaP 数据原则上留在获批机构环境;跨机构共享需 DTA 与 DAC 附加批准,不得用公开网盘中转。
  • 流水线可复现:REGENIE/SAIGE 版本锁定(如 Docker 镜像哈希),BDC 上用 WDL 固化 workflow;QC 阈值变更需重跑全部下游。
  • 云端成本治理:BDC 按量计费,freeze 8 级任务先在单队列小样本上做 profile,再放大;NHLBI 周期性提供云 credit 申请窗口。
  • 实验跟踪建议:以"freeze × 表型协议版本 × 工具版本"三元组为实验命名空间,同一实验空间内的结果才可互比——这是 freeze 版本混乱问题的 MLOps 解法。
  • 发表前检查单:数据可用性声明(accession + freeze)→ 致谢模板(TOPMed 承办机构与资助号)→ consent 范围核对 → 汇总统计是否需回流 phs001974。
MLOps 项 TOPMed 特有要求 落地方式
数据版本化 freeze 名 + accession 版本号 数据清单文件随代码库提交
权限管理 DAR 年续 + consent 范围 CI 断言 + BDC 自动可见性
计算环境 GRCh38 工具链一致性 统一容器镜像
结果复用 汇总统计受控回流 GSR 提交流程

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
族群不均衡 全计划约 60% 非欧裔,但个体子表型(如血脂子集)欧裔仍占 44% ancestry 分层分析;报告跨族群迁移性
队列设计异质 前瞻队列/病例-对照/家系混合,患病率不反映总体 设计感知模型(混合模型、加权)
幸存者偏倚 纵向队列缺访视与死亡/失访相关 生存分析 + IPW 校正
批次效应 7 测序中心 × 多 Phase(研究×Phase 内固定中心缓解) 低-中 中心指示变量敏感性分析
表型定义漂移 同名变量跨队列判读标准不同 harmonization 协议 + 敏感性分析
奠基者效应 Amish/Samoan 等隔离群体等位基因谱特异 单独分析层,不外推至总体

§7.2 标注质量

变异调用质量有定量基线:重复样本 SNV/indel alt-allele concordance 0.9995/0.9930;与既有 WES 数据交叉比对一致(Taliun et al., 2021)。表型侧质量取决于各队列判读协议,事件终点(心梗、中风等)经委员会标准化判读,质量普遍高但不可跨队列假设同质;连续测量(血压/血脂)协议成熟。无第三方独立"金标注"覆盖全数据集——这是推断型资源的共同属性而非缺陷,但用户需在方法学中声明。

质量证据链一览:

质量维度 定量证据 出处
基因型准确性 重复测序 SNV/indel concordance 0.9995/0.9930 Taliun 2021
变异过滤 孟德尔一致性 SVM 分类器(家系样本训练) freeze 8 方法文档
样本级 QC 污染 <10% 且 ≥95% 基因组 ≥10x 双阈值 Nat Commun 2022
性别核验 X/Y 深度核验,性别错配者剔除或身份解析 Nat Commun 2022
事件终点 各队列委员会标准化 adjudication 各 accession 数据字典

局限说明:以上证据描述的是"集中加工层"的质量;家长研究表型的采集质量随年代、设备与协议而异,TOPMed 未对全表型空间做统一重测验证。

§7.3 泛化性

目标场景 失效风险 证据/机制
欧裔训练 → 非裔/西裔部署 PRS 等位频率与 LD 差异;需分层校准(Nat Commun 2022 PRS 范式)
成人队列 → 儿科 TOPMed 多为成人队列,儿科外推无支撑
美国 → 其他区域人群 中-高 频率谱差异; singleton 主导的 rare variant 外推性有限
社区队列 → 临床连续流 参与者健康状态与依从性偏高(志愿者效应)
冻结表型 → 当代临床实践 数十年随访中诊疗标准演变(如血压分期定义变化)

§7.4 伦理考量

全基因组序列本质上不可去标识化,因此 TOPMed 采取受控访问而非开放分发;consent group 体系直接继承各家长研究原始知情同意(含疾病特定用途限制);NIH DAC 独立审批,研究者不参与决定(个别研究需协作信)。敏感群体(如萨摩亚人群、精神相关子研究)的汇总结果也走受控共享通道(phs001974 设立的原因之一)。使用者不得尝试重识别,发表前需遵守 Data Use Limitations(Taliun et al. 2021 Box 1)。

§7.5 公平性

TOPMed 是遗传学领域改善族群代表性的标志性投资,但"更多样"不等于"均衡":freeze 8 血脂子集内欧裔仍占 44.46%,而某些 singletons 高度集中于特定隔离群体。下游 AI 模型若按总体指标优化,会系统性牺牲少数群体精度——应把按 ancestry 分层的性能差距作为一等公民指标报告(NHLBI 官方亦将健康差异研究列为 TOPMed 目标)。

可操作的公平性检查单:

检查项 做法 不做的后果
训练集族群构成披露 报告各 ancestry 样本量与占比 读者无法判断适用范围
分层性能报告 按 ancestry 分别报 AUC/校准斜率 总体 AUC 掩盖少数群体失效
校准而非只看判别 报告各群体校准曲线 高 AUC 但系统性高/低估风险
变异频率上下文 查 gnomAD/TOPMed 面板确认目标人群频率 把族群特异变异当噪声删掉
隔离群体隔离分析 Amish/Samoan 单独报告 founder 变异污染总体估计

§7.6 数据漂移

三个时间维度的漂移需要监控:① 队列内时间漂移(随访数十年间诊疗标准、测量协议演变);② freeze 间版本漂移(variant set/样本集变化);③ 真实世界分布漂移(把 TOPMed 训练的模型用于当代临床数据时,人口结构与诊疗模式已变)。建议冻结分析基线为单一 freeze + 单一 harmonization 协议,变更即触发重训评估。

漂移源 典型表现 监测信号 缓解
协议演变 同一血压分期定义在随访期跨代变更 分 era 效应值翻转 era 指示变量
freeze 迭代 variant set 更新、部分样本重调用 跨 freeze 复现失败 冻结单一 freeze 基线
队列老化 参与者年龄结构逐年偏移 年龄-事件率曲线漂移 年龄分段建模
真实世界部署 临床数据与队列分布不一致 上线后 AUC 递减 部署后监控 + 定期校准

§7.7 DAIMS 24 项数据质量自评

# 检查项 状态 说明
1 宽格式 ⚠️ 无官方跨队列宽表;各家长研究 schema 独立,合并需自行 harmonize
2 唯一标识 NWD-NWDID WGS 样本编号 + 各队列 subject_id,映射表齐备
3 特殊字符 变异 ID/样本 ID 均为 ASCII 规范格式
4 重复行 集中 QC 含重复测序识别与身份解析;无重复行问题
5 缺失编码 ⚠️ GDS 基因型 NA 规范;但表型侧 -9/NA/空白混用随队列而异
6 标签标识 ⚠️ 结局标签定义跨队列不一致,需按协议映射
7 罕见类分组 rare variant burden 正是本资源核心能力;46% singleton 有完整治理
8 偏倚评估 大量方法论文系统讨论 ancestry/批次/设计偏倚
9 数据字典 每个 accession 附数据字典与方法 PDF,变量级定义
10 信息性缺失解释 ⚠️ 缺访视与结局相关(存活偏倚),文档提示但无自动修正
11 设备记录 ⚠️ 测序中心与实验室方法有记录;临床测量设备跨队列文档粒度不一
12 共线性 ⚠️ 高维剂量矩阵需自行 LD 剪枝/正则;无预置共线性诊断
13 编码映射 dbGaP 变量字典 + rs ID 对齐 dbSNP;GRCh38 统一坐标系
14 时间戳处理 ⚠️ 纵向 visit 跨数十年,各队列时间索引体系不同
15 划分建议 社区已建立家系安全划分惯例;freeze 结构利于版本级留出
16 泄漏讨论 家系/重复测序泄漏在方法文献中讨论充分(本文 §5.3 汇总)
17 标签分布 ancestry/性别/年龄分布有发表级统计(如血脂子集)
18 测量偏倚 测量协议差异被工作组系统识别与校正(用药/空腹等)
19 外部验证建议 UKB/All of Us 外部复制路径在多篇论文中示范
20 版本记录 freeze 版本体系 + dbGaP accession 版本号,业界标杆
21 预处理脚本 GotCloud 变异 calling 全流程开源;REGENIE/SAIGE 官方流程文档
22 合规要求 GDS Policy + consent group + DAC 审批体系完备清晰
23 多模态对齐 ⚠️ WGS 与各 omics 分属不同 accession,跨模态对齐需人工映射
24 去标识化 标识符移除 + 受控访问双层保护(序列不可去标识属本质限制)

DAIMS 评分:20.0 / 24(✅ 16 项 × 1.0 + ⚠️ 8 项 × 0.5 + ❌ 0 项)

评分解读:TOPMed 的治理体系(freeze 版本、集中 QC、consent 管理、方法文档)是大型基因组资源的标杆,基因型侧近乎无短板;失分集中在表型侧的跨队列一致性——宽表缺失、标签定义漂移、时间索引异质。这不是数据"缺陷",而是联邦式队列资源的固有形态。

对你意味着什么:① 计划中把至少 30% 工时预算给表型 harmonization 与跨 accession 对齐,而非基因型处理;② 一切分析从单队列原型起步,合并动作放在 pipeline 最后一步;③ 直接采用社区已 harmonize 的性状协议(血压/血脂)可省去最贵的摸索;④ 交付物中显式写明 freeze 与 consent 集合,让合规审查成为流水线的固定环节而非事后补救。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
UK Biobank 约 13 万 WGS UK Biobank rare variant 信号复制 复制一致性(方向/显著性) TOPMed 血脂 rare variant aggregates 在 UKB WGS 中复制成功
UK Biobank 芯片数据填充 UK Biobank TOPMed 面板填充增益 r²>0.8 的 MAF 下限 非裔 0.14%/西裔 0.11%/欧裔 0.35% TOPMed 面板显著优于 HRC/1000G(Hanks et al. 2022 AJHG)
MGB Biobank 等独立队列 Mass General Brigham 多族群高血压 PRS 迁移 关联方向与分层效应 非裔/西裔中单族群 PRS 衰减 多族群加权 PRS 在整个成年期与高血压进展关联(Nat Commun 2022)
TOPMed 内部 45,000 芯片填充样本 NHLBI TOPMed 新位点复制 显著性复现 WGS 发现的新血脂位点在独立填充样本中复制

§8 基准性能与生态

§8.1 关键研究"排行榜"

TOPMed 是研究资源而非竞赛数据集,无统一排行榜;下表列出按 freeze 版本定义的里程碑研究,数字不可直接互比(样本集、表型、freeze 各不相同):

排名 研究 关键数字 年份 关键技术 完整引用 代码
1 主论文:variant catalog 53,831 基因组、>4 亿变异、46% singleton 2021 集中联合 calling + ML QC Taliun et al., 2021, Nature. DOI 10.1038/s41586-021-03205-y topmed_variant_calling
2 血脂 WGS GWAS 66,329 人/21 队列、4.28 亿变异 2022 SAIGE + ancestry-specific burden Graham et al., 2022, Nature Communications. DOI 10.1038/s41467-022-33510-7 随文公开
3 多族群高血压 PRS 多队列 TOPMed freeze 8 + 外部复制 2022 分层 PRS + trans-ancestry 校准 Kurniansyah et al., 2022, Nature Communications. DOI 10.1038/s41467-022-31080-2 Hypertension_PRS
4 填充面板系统评估 97,256 人参考面板 2022 Minimac4 + r² 分箱基准 Hanks et al., 2022, American Journal of Human Genetics. DOI 10.1016/j.ajhg.2022.07.012 服务器在线
5 跨族群血压遗传(750,000 人级) TOPMed BP 联盟 2019 多族群 meta-GWAS Giri et al., 2019, Nature Genetics. DOI 10.1038/s41588-018-0305-5

§8.2 SOTA 总结与选型建议

要点三条:① 大样本 GWAS 的默认栈已是 REGENIE(step1/step2)+ SAIGE-GENE(rare burden),自行实现线性混合模型已无必要;② 填充一律优先 TOPMed r2(多族群、含 indel、免费在线),仅当数据不能上传时退回可下载面板;③ PRS 研究必须内嵌跨 ancestry 评估,单一 ancestry 的 SOTA 已不再被视为充分证据。

§8.3 评测协议

社区公认协议要素:声明 freeze 版本与 accession 版本号;MAC≥20 的单变异检验 + MAF<1% 的 burden/SKAT 聚合检验;λGC 与 QQ 报告;ancestry 分层报告;发现-复制二元结构(TOPMed 发现 → UKB 复制为主流)。预测建模附加家系安全 CV。

协议检查表(投稿前逐项核对):

协议要素 社区标准 常见违规
freeze 声明 “TOPMed freeze 8, Phases 1-4” + accession 版本 只写 “TOPMed 数据” 不写 freeze
单变异阈值 MAC ≥ 20(WGS 分析) 沿用芯片时代 MAF>5% 习惯
rare variant 检验 burden + SKAT 类双轨,基因级 MAF<1% 只报单变异漏掉基因级信号
分层报告 按自报族群 + 遗传 ancestry 双口径 只报合并结果
膨胀诊断 分 ancestry 的 λGC + QQ 截距 只报全体 λGC 掩盖分层
复制 TOPMed 发现 → UKB(或 All of Us)复制 无外部复制的单一库声明
预测模型 leave-family-out + 外部队列验证 随机 CV 导致家系泄漏虚高
数据集 与 TOPMed 的关系 适用场景
UK Biobank 最大外部复制池(约 13 万 WGS) 复制与跨库泛化
All of Us 美国人群多样性互补 EHR 表型迁移
1000 Genomes / HGDP 开放频率参照 面板对照、原型开发
gnomAD 汇总频率库 变异解释、约束指标
Framingham(本站条目) TOPMed 内核心家长队列 单队列学习入口
GTEx 组织表达参照 WGS-eQTL 机制解释

§8.5 关键论文 Top 8

  1. Taliun et al., 2021, Nature. DOI 10.1038/s41586-021-03205-y — 主论文:53,831 基因组变异目录、QC 体系与填充面板。
  2. Graham et al., 2022, Nature Communications. DOI 10.1038/s41467-022-33510-7 — freeze 8 血脂 WGS GWAS 的完整方法学范本。
  3. Kurniansyah et al., 2022, Nature Communications. DOI 10.1038/s41467-022-31080-2 — 多族群 PRS 开发与迁移性评估范式。
  4. Hanks et al., 2022, American Journal of Human Genetics. DOI 10.1016/j.ajhg.2022.07.012 — TOPMed 面板 vs HRC/1000G 填充质量系统评估。
  5. Giri et al., 2019, Nature Genetics. DOI 10.1038/s41588-018-0305-5 — TOPMed BP 跨族群血压大规模 GWAS。
  6. Das et al., 2016, Nature Genetics. DOI 10.1038/ng.3656 — Michigan Imputation Server(TOPMed 面板托管方)方法论文。
  7. Mbatchou et al., 2021, Nature Methods. DOI 10.1038/s41592-021-01106-w — REGENIE:TOPMed 规模混合模型回归。
  8. Mailman et al., 2007, Nucleic Acids Research. DOI 10.1093/nar/gkl943 — dbGaP 数据库本体(TOPMed 的分发基础设施)。

§8.6 社区活跃度

TOPMed 已支撑近 150 篇发表论文与 200+ 会议摘要(NHLBI 官方口径);30+ Working Groups 覆盖心肺血液睡眠各表型域;Taliun 2021 主论文引用 1,312 次(截至 2024-08,UK Biobank 出版记录);TOPMed r2 面板经两大 imputation server 已服务逾 3,800 万基因组填充(截至 2022,ASHG 报告)。分析生态由密歇根 IRC(statgen 工具链)与 BDC 云(Terra/Seven Bridges)双轮驱动,工作坊与教程定期更新于 nhlbiwgs.org

活跃度维度 现状 入口
发表产出 近 150 篇论文、200+ 摘要 NHLBI 官方页
协作组织 30+ Working Groups、约 1,000 名研究者 nhlbiwgs.org/working-groups-public
引用热度 主论文 1,312+(截至 2024-08,UKB 记录) UK Biobank pub 9551
服务规模 填充服务 >3,800 万基因组(截至 2022) TOPMed Imputation Server
工具生态 statgen 全家桶 + BDC workflow 持续维护 GitHub / BDC 文档站

§8.7 生态快照

资源 类型 链接 热度(截至 2026-09) 推荐理由
TOPMed 官网 官方门户 topmed.nhlbi.nih.gov freeze/方法/组学发布第一入口
nhlbiwgs.org 方法与数据集页 nhlbiwgs.org/data-sets 各 freeze 方法文档与访问指南
topmed_variant_calling 开源 pipeline GitHub 长期维护 变异 calling 溯源
REGENIE GWAS 工具 regenie GitHub 持续更新 大规模混合模型标准
SAIGE GWAS/burden 工具 saige GitHub 持续更新 不平衡表型稳健检验
TOPMed Imputation Server 在线服务 imputation.biodatacatalyst.nhlbi.nih.gov >3,800 万基因组 免费使用 r2 面板
BioData Catalyst 云平台 biodatacatalyst.nhlbi.nih.gov 持续扩容 云端免下载分析
dbGaP 受控数据仓库 NCBI dbGaP 申请与 accession 管理

§9 相关资源与引用

官方文档与入口

教程、工具与社区

  • 变异 calling 开源流水线:statgen/topmed_variant_calling(GotCloud 全流程)
  • REGENIE 文档:rgcgithub.github.io/regenie(step 1/2 教程齐备)
  • SAIGE:saigegit/SAIGE(case-control 稳健 + SAIGE-GENE burden)
  • SeqArray/SeqVarTools(R 大规模 GDS 读取):Bioconductor
  • TOPMed 分析工作坊讲义(Genetic Analysis Center,含数据共享与 paper proposal 流程演示)
  • BDC 入门工作区教程(Terra / Seven Bridges 双平台,含 TOPMed 数据检索示例)
  • 密歇根 statgen 工具族:KING、PC-Relate、Minimac4、Metal(跨队列 meta)

BibTeX 引用块

@article{taliun2021sequencing,
  title   = {Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program},
  author  = {Taliun, Daniel and Harris, Daniel N and Kessler, Michael D and Carlson, Jedidiah and Szpiech, Zachary A and Torres, Raul and Taliun, Sarah A Gagliano and Corvelo, Andr{\'e} and Gogarten, Stephanie M and Kang, Hyun Min and others},
  journal = {Nature},
  volume  = {590},
  number  = {7845},
  pages   = {290--299},
  year    = {2021},
  doi     = {10.1038/s41586-021-03205-y}
}

@article{graham2022lipids,
  title   = {Whole genome sequence analysis of blood lipid levels in >66,000 individuals},
  author  = {Graham, Steven E and Clarke, Stephanie L and Wu, Kuan-Han H and others},
  journal = {Nature Communications},
  volume  = {13},
  year    = {2022},
  doi     = {10.1038/s41467-022-33510-7}
}

@article{kurniansyah2022prs,
  title   = {A multi-ethnic polygenic risk score is associated with hypertension prevalence and progression throughout adulthood},
  author  = {Santos Ferreira, Daniele and Kurniansyah, Nicholas and others},
  journal = {Nature Communications},
  volume  = {13},
  year    = {2022},
  doi     = {10.1038/s41467-022-31080-2}
}

@article{hanks2022imputation,
  title   = {Reference panel improves polygenic and rare variant imputation accuracy},
  author  = {Hanks, Morgan E and others},
  journal = {American Journal of Human Genetics},
  year    = {2022},
  doi     = {10.1016/j.ajhg.2022.07.012}
}

@article{giri2019bp,
  title   = {Trans-ethnic association study of blood pressure determinants in over 750,000 individuals},
  author  = {Giri, Ayush and others},
  journal = {Nature Genetics},
  volume  = {51},
  pages   = {51--62},
  year    = {2019},
  doi     = {10.1038/s41588-018-0305-5}
}

@article{das2016mis,
  title   = {Next-generation genotype imputation service and methods},
  author  = {Das, Sayantan and Forer, Lukas and Sch{\"o}nherr, Sebastian and others},
  journal = {Nature Genetics},
  volume  = {48},
  pages   = {1284--1287},
  year    = {2016},
  doi     = {10.1038/ng.3656}
}

@article{mbatchou2021regenie,
  title   = {Computationally efficient whole-genome regression for quantitative and binary traits},
  author  = {Mbatchou, Joelle and Barnard, Leland and Backman, Joshua and others},
  journal = {Nature Methods},
  volume  = {18},
  pages   = {543--548},
  year    = {2021},
  doi     = {10.1038/s41592-021-01106-w}
}

@article{mailman2007dbgap,
  title   = {The NCBI dbGaP database of genotypes and phenotypes},
  author  = {Mailman, Matthew D and Feolo, Michael and Jin, Yumi and others},
  journal = {Nature Genetics},
  volume  = {39},
  pages   = {1181--1186},
  year    = {2007},
  doi     = {10.1093/nar/gkl943}
}

引用指南:使用 TOPMed 数据时,方法学必须同时引用主论文(Taliun 2021)、所用 freeze 的方法文档(nhlbiwgs.org)与具体 accession 编号;使用 TOPMed r2 面板填充时引用 Hanks 2022 与 server 文档;基于 Working Group 协作的成果还需按 Publications Policy 致谢。


§10 AI 使用声明卡

§10.1 本页面生产中使用的 AI 模型

模型 用途
通用大语言模型(CodeBuddy) 资料整合、结构化撰写、代码示例生成

§10.2 AI 参与范围

AI 参与:章节初稿撰写、公开资料(官方页/dbGaP 页/已发表论文)的信息抽取与整合、代码示例起草、表格组织。AI 不参与:医学编码(ICD-11/SNOMED)的最终判定、对原始数据的任何分析、合规解释的权威裁定。

§10.3 输入来源列表

  1. Taliun, D. et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature 590, 290-299 (2021). DOI 10.1038/s41586-021-03205-y
  2. NHLBI. Trans-Omics for Precision Medicine (TOPMed) Program. https://www.nhlbi.nih.gov/science/trans-omics-precision-medicine-topmed-program
  3. TOPMed 门户. http://topmed.nhlbi.nih.gov
  4. NIH. NHLBI TOPMed: Omics Phenotypes of Heart, Lung, and Blood Disorders (PAR-22-194). https://grants.nih.gov/grants/guide/pa-files/PAR-22-194.html
  5. NCBI dbGaP. NHLBI TOPMed: Genomic Summary Results (phs001974). https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs001974.v6.p1
  6. Graham, S. E. et al. Whole genome sequence analysis of blood lipid levels in >66,000 individuals. Nat Commun 13 (2022). DOI 10.1038/s41467-022-33510-7
  7. Santos Ferreira, D. et al. A multi-ethnic polygenic risk score is associated with hypertension prevalence and progression throughout adulthood. Nat Commun 13 (2022). DOI 10.1038/s41467-022-31080-2
  8. Michigan Imputation Server ASHG 2022 Workshop slides. https://github.com/genepi/imputationserver-ashg22/raw/master/slides/MIS_Workshop_22.pdf
  9. NHLBI BioData Catalyst Documentation — Data Access. https://biodatacatalyst.gitbook.io/biodata-catalyst-documentation/
  10. NCBI. Applying for Controlled Access Data (NBK570242). https://www.ncbi.nlm.nih.gov/books/NBK570242/
  11. Seven Bridges. What Makes TOPMed Datasets So Special? https://www.sevenbridges.com/topmed-datasets-special/
  12. NCBI dbGaP. NHLBI TOPMed: Genetics of Cardiometabolic Health in the Amish (phs000956). https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs000956
  13. University of Innsbruck Genepi. Michigan Imputation Server 项目页. https://genepi.i-med.ac.at/projects/computational-genomics/imputationserver/
  14. UK Biobank Publication 9551(Taliun 2021 引用统计). https://biobank.ndph.ox.ac.uk/ukb/pub.cgi?id=9551
  15. NHLBI Advisory Council Meeting Summary (2017-02). https://www.nhlbi.nih.gov/events/2017/national-heart-lung-and-blood-advisory-council-february-2017-meeting-summary
  16. TOPMed Analysis Workshop — Genetic Analysis Center(数据共享与 paper proposal 流程). https://slidetodoc.com/topmed-analysis-workshop-genetic-analysis-center-biostatistics-department-2/

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字 千方病案医学编辑部 逐条对照 NHLBI 官方页与 Taliun 2021 ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED 映射) 千方病案医学编辑部 编码表人工核对 ✅ 已通过/已验证
§3-§4 规格与数据结构 千方病案医学编辑部 对照 dbGaP accession 页与 freeze 方法文档 ✅ 已通过/已验证
§6 代码与坑点 千方病案医学编辑部(数据工程) 代码逻辑复核 + 坑点来源溯源 ✅ 已通过/已验证
§7-§8 质量与生态 千方病案医学编辑部 引用逐条核验 DOI ✅ 已通过/已验证

§10.5 AI 生成章节标注

本页面全部章节由 AI 起草、人工逐模块校验后发布;§2 编码表与 §7.7 DAIMS 评分经人工复核修正;无未校验的 AI 直发段落。

具体而言:AI 负责从 16 项公开来源抽取事实并起草结构;人工负责三类判断——数字与来源的对应(每个关键数字回溯到检索来源)、医学编码的准确性(ICD-11/SNOMED 人工核对)、坑点的可操作性(拒绝与该数据集无关的泛化建议)。代码示例经人工逻辑复核但不保证在特定环境下开箱即用,见 §0 技术免责声明。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集