信息速览
gnomAD — 基因组聚合数据库 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | Genome Aggregation Database(gnomAD),基因组聚合数据库;前身 ExAC |
| 发布方 | gnomAD Project Consortium——Broad Institute 主导(MacArthur/Rehm/Neale/Daly/Luria/Tiao 等),国际多机构联盟 |
| 版本 | 现行 v4.1(2024-05,GRCh38);v4 主论文 medRxiv 2026-03;历史:ExAC(2016)→ v2(2019,GRCh37)→ v3(2022) |
| 核心规模 | 807,162 人 = 730,947 外显子组(含 UKB 416,555)+ 76,215 全基因组 |
| 变异规模 | 短变异约 9.09 亿(SNV 786,500,648 + InDel 122,583,462);SV 1,199,117 个 |
| 数据类型 | sites-only VCF + Hail Table + TSV——等位频率(AF/AC/AN/grpmax/FAF95)、约束(LOEUF/错义 Z/区域约束)、QC 指标、SV 目录、mtDNA、coverage |
| 载体 | 浏览器 gnomad.broadinstitute.org + GraphQL API + Google Cloud(gs://gcp-public-data–gnomad)+ AWS Open Data(s3://gnomad-public-us-east-1) |
| 许可 | CC0 1.0 公共领域(without restriction on use);配套代码 gnomad_methods 为 MIT |
| 访问门槛 | 无注册、无 DAC、无费用——全开放 |
| 贡献面 | 308 家数据贡献机构 / 100+ 研究 / IRB 至少 25 国;性别 406,265 XX / 400,897 XY |
| ancestry | NFE 622,057(77.07%)/ SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031(v4 新增) |
| 本库关联 | / MID 3,031(v4 新增) |
| 本库关联 | uk-biobank(v4 最大数据源)、clinvar(致病性解释下游)、hp(v4 最大数据源)、 |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、版本信息与许可表述均核实自一手来源:gnomAD 官方统计页(broad.io/gnomad_stats)、gnomAD v4 主论文(medRxiv 2026-03, DOI 10.64898/2026.03.23.26349081)、AWS Open Data Registry 的 gnomAD 条目、gnomAD 下载页与 gnomad_methods 仓库,以及四篇里程碑论文(Lek 2016 Nature 536、Karczewski 2020 Nature 581、Collins 2021 Nature 591、Chen 2024 Nature 625)。检索核实时间为 2026-09-19。
gnomAD 的数字口径与版本耦合紧密(v2/v3/v4 样本集与坐标均不同),本页在各处显式标注「版本 + 口径」;官方统计页与论文快照存在时间差时以论文口径为准并注明。本页为技术参考文档,不构成临床诊断依据——gnomAD 频率只是变异解读的证据维度之一,临床分级须按 ACMG/AMP 框架结合分离分析、功能实验等综合判定(§5.2)。
关于数据人群:gnomAD 的 ancestry 构成严重偏斜(非芬兰欧洲 NFE 占 77.07%),对非欧洲人群的频率估计与约束推断天然受限,本页在 §2.5 与 §7.4 讨论其对 AI 与临床外推的影响。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:人类遗传变异的「频率与约束参考标准」——80 万+ 人测序的聚合统计库,回答「这个变异在人群里有多常见、它所在基因对功能缺失突变有多敏感」。
- 体量:约 9.09 亿短变异(SNV+InDel)+ 120 万结构变异;sites-only——无个体基因型。
- 版本:v4.1(2024-05,GRCh38)现行;v2(GRCh37)在临床过滤与 chrX/Y 约束上仍被广泛引用——版本选择本身就是第一坑(§3.7)。
- 访问:免注册、免费、CC0——浏览器点选、GraphQL API、云存储直下,全球最「零门槛」的大规模基因组资源。
- 旗舰指标:LOEUF(基因功能缺失约束)、FAF95(频率置信上限)、grpmax(最大 ancestry 组频率)。
- 适用:ACMG 变异过滤、罕见病诊断的频率排除、基因约束优先级、SV 背景频率、AI 模型频率特征。
- 不适用:个体级基因型-表型关联(用 UKB/队列数据)、体细胞突变频率(用 TCGA/PCAWG)、非欧洲人群的精确频率推断(ancestry 偏斜,§2.5)。
§1.1 摘要
2016 年,一个原本为了疾病研究而聚合的 6 万外显子组数据库(ExAC)意外成为医学遗传学的支柱设施:研究者们发现,把各家疾病研究里「对照组」的测序数据聚合成一个统一处理的人群频率库,能让「这个变异是否罕见到值得怀疑」从拍脑袋变成查表——单这一件事就消灭了变异解读文献里一大类假阳性。这个思路的延续体就是 gnomAD:到 v4.1,它聚合了 807,162 人的测序数据,覆盖约 9.09 亿短变异与 120 万结构变异,是全球变异解读事实上的频率标准源。
对 AI 团队,gnomAD 的价值在三个维度:
- 变异过滤的自动化基座:ACMG/AMP 指南的 BA1(AF>5% 即良性)、BS1/BS2 证据都以 gnomAD 频率为量化标准——任何变异分级流水线的第一步都是查 gnomAD,API 化后就是一行调用。
- 约束度量的特征供给:LOEUF、错义 Z、区域约束把「基因对 LoF 突变的敏感程度」变成连续特征——基因优先级、变异致病性预测(EVE、AlphaMissense 类模型)的关键输入。
- 群体遗传学的规模极限:9 亿变异 × 80 万人的聚合频谱让突变率、选择系数、人群历史的统计推断达到前所未有的精度(2026 年 PIES 方法用 v4 数据估计精子的选择热点)。
架构上必须先说清的一点:gnomAD 是 sites-only——它发布每个变异位点的聚合统计(多少人携带、什么频率、什么质量),不发布任何个体的基因型与表型。这使它成为隐私风险最低的基因组大资源,也决定了它「能做什么/不能做什么」的边界(§1.6、§7)。
§1.2 战略价值
-
临床变异解读的标准参照:ic-value}
-
临床变异解读的标准参照:ClinGen/ClinVar/ACMG 生态的频率证据源;诊断实验室的过/ClinVar/ACMG 生态的频率证据源;诊断实验室的过滤流水线(无论自研还是商业)都以 gnomAD 为默认频率库——接入它等于接入行业标准的「共识层」。
-
开放度的天花板:CC0 + 免注册 + 双云分发 + GraphQL API——对比 dbGaP 类受控资源数月的申请周期,gnomAD 是唯一可以「今天想到、今天用上」的 80 万人级基因组资产;这也使它成为教学、原型验证、方法论文的默认数据源。
-
罕见病基因发现的漏斗上游:v4 主论文的 DisPo 评分(约束强 × 临床表征少 → 发现潜力高)把「下一个致病基因在哪」变成可排序的清单——对基因发现团队是路线图,对药物研发是靶点学证据。
-
方法学的公共战场:从 pLI 到 LOEUF、从 NMD 预测到 LoF 管线的 90% 精度,gnomAD 每一次指标升级都会重塑变异解读工具链——盯住它的 release 就是盯住行业标准的演进。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模 | 与 gnomAD 的关系 |
|---|---|---|---|
| gnomAD | 变异频率 + 约束(聚合) | 807,162 人 / 9.09 亿短变异 | — |
| ExAC | gnomAD 前身 | 60,706 外显子组 | 仍被旧文献引用;v2 已含其全部样本 |
| UK Biobank | 个体级队列(可关联) | 503,317 人 / WGS 490,640 | gnomAD v4 的最大数据源(416,555 exomes);个体级分析去 UKB |
| 16,555 exomes);个体级分析去 UKB | |||
| 1000 Genomes | 参考面板 | 2,504 人 | 深度有限;gnomA |
| dbSNP | 变异存在性目录 | 10 亿+ rsID | 只回答「存在」,不回答「多常见」 |
| ClinVar | 致病性注释 | 数百万提交 | 下游消费者:用 gnomAD 频率做良性证据 |
| TOPMed/ NHLBI | 心肺血液队列(受控) | 数百万人 WGS | 个体级+受控;频率口径与 gnomAD 互补 |
| CKB/ChinaMAP | 亚洲人群频率 | 数万-51 万 | 非欧洲频率的对照源(gnomAD 偏斜的补位) |
| TCGA/PCAWG | 体细胞突变 | 万级肿瘤 | 不同范畴:体细胞 vs 胚系;v4 明确不含 TCGA |
§1.4 版本时间轴
2014-2016 ExAC 聚合(60,706 exomes;Nature 537 宣告 + 536 分析论文)
2019-05 gnomAD v2 发布(141,456 = 125,748 exomes + 15,708 genomes;GRCh37)
2020-04 v2 constraint 主论文(Karczewski Nature 581:434-443;LOEUF 取代 pLI)
2021-05 gnomAD-SV(Collins Nature 591:444-451;结构变异参考图谱)
2022-10 v3.1.2(76,156 genomes only;GRCh38;非编码约束基础)
2024-01 v3 constraint 论文(Chen Nature 625:92-100;基因组约束地图)
2023-11 v4.0(807,162 = 730,947 exomes + 76,215 genomes;并入 UKB exomes)
2024-05 v4.1(修正 v4.0 AN 低估——稀有 AF 高估 5-10%;新增 joint callset;SV 更新)
2026-03 v4 主论文(730,947 exomes;LoF 管线 90% 精度;DisPo 评分;medRxiv)
§1.5 应用场景矩阵
- 临床变异分级:实验室自建 VCF → gnomAD 频率标注 → ACMG BA1/BS1/BS2 自动打分。
- 罕见病诊断排除:新发变异按 FAF95/grpmax 过滤——频率高于疾病最大可信频率(Whiffin 框架)即降级。
- 基因约束画像:候选基因清单 → LOEUF/错义 Z 排序 → 约束强的基因优先深挖(或按 DisPo 找空白)。
- SV 背景库:疑似致病 CNV → v4 SV 目录频率对照——「这个缺失在健康人里有多少」。
- AI 特征工程:变异/基因级频率与约束特征注入模型(见 §7 四喂法)。
- 群体遗传学推断:频谱 → 突变率/选择/人群历史(PIES、Roulette 类方法)。
§1.6 组件全景
gnomAD 的六个数据层:
- sites 层:v4.1 exome/genome/joint 三套 sites 表——每个变异的 AF/AC/AN(全人群 + 10 组 ancestry + 性别分层)、质量指标(RF/AS 管线标志)、VEP/LOFTEE 注释。
- SV 层:v4 SV callset(1,199,117 个)——缺失/重复/插入/倒位/复杂/易位,含各 ancestry 频率。
- 约束层:基因级 LOEUF、错义 Z、转录本级约束;区域级非编码约束(NDR,源自 v3 论文的 genome 口径)。
- coverage 层:exome coverage(v4.0 口径)与 genome coverage(v3.0.1 口径)——「这个区域没测到」与「这个区域没变异」的区分依据。
- mtDNA 层:线粒体变异频率(v3.1.2/v4 口径)——母系遗传与异质性分析用。
- 浏览器/API 层:variants/genes/transcripts/structural-variants/mitochondrial 页面 + GraphQL API——程序化接入的零门槛通道。
§1.7 零访问门槛的经济学
gnomAD 是大型基因组资源里唯一「零门槛」的:无申请费(对比 UKB £3,000+)、无 DAC 周期(对比 dbGaP 数月)、无注册(对比多数 biobank)——但它把成本转移到了别处:
- 计算成本自担:9 亿变异的 sites VCF 压缩后数百 GB 起,全量操作离不开 Hail/Spark 集群——「免费的数据 + 昂贵的计算」,预算进基础设施而非访问费。
- 版本管理成本:v2/v3/v4 不可互换(§3.7)——团队需要版本纪律,否则同一基因座在 v2 与 v4 的频率差异会直接进论文。
- 合规成本极低但仍存在:CC0 不等于无伦理约束——聚合数据的成员推断研究(从频率反推群体归属)在学界有争议,产品化使用前过一遍法务(§8)。
反面账:样本是「疾病研究 + 群体项目」的混合体而非人群抽样——特定基因座的频率可能被疾病队列过代表征抬高(如心肌病基因在心肌病研究富集样本里),官方为此提供 non-neuro/non-cancer 等子集口径——用对子集是使用者的责任。
§1.9 gnomAD 在临床诊断流程中的位置
把 gnomAD 放进一条典型罕见病诊断流水线,看它站在哪一环:
患者表型 + 家族史
→ 测序(WES/WGS)
→ 变异 calling(GATK 等) ← gnomAD 的 QC 管线(gnomad_qc)是 calling 质控的参考实现
→ 变异注释(VEP + in-silico) ← gnomAD sites 表自带 VEP/LOFTEE 注释可对照
→ ★ 人群频率过滤(FAF95/grpmax) ← gnomAD 主战场:ACMG BA1/BS1/BS2 自动化
→ 约束画像(LOEUF/DisPo) ← gnomAD 副战场:候选优先级排序
→ 疾病特异判级(ClinVar + 文献) ← gnomAD 退出:判级是社区/临床层职责
→ 分离分析(家系验证)
→ 功能验证(实验)
→ 临床报告
三个工程要点:
- 频率过滤在注释之后、判级之前——它不产生最终结论,但决定哪 1% 的变异值得人工看——过滤层的假阴(误杀致病变异)是全流程最昂贵的错误,宁可多放 VUS 进人工队列。
- 约束画像与频率过滤并行而非串联——约束低不是放行理由,约束高也不是致病证据——两者都是排序先验,判级发生在疾病语境里。
- 版本一致性贯穿全流程——calling 参考实现、频率参照、约束指标应锁定同一 gnomAD 版本口径,混版本会让「同一变异」在不同环节拿到不同数字。
§2 医学与科学背景
§2.1 为什么「人群频率」是变异解读的第一道闸
人类基因组每代每碱基约 1.2×10⁻⁸ 的突变率意味着:任何两个人之间都有数百万个差异,其中绝大多数无害。变异解读的核心不对称是——致病突变稀有,但稀有突变不致病。频率因此成为最硬的初步证据:
- 隐性疾病的健康携带者:经典致病变异在人群中以携带者状态存在(如 CFTR ΔF508 频率约 2%)——「存在频率」不排除隐性致病;显性疾病则不同:高频率直接与致病性矛盾。
- BA1 的量化:ACMG/AMP 把「AF > 5%」设为良性独立证据(stand-alone)——一个变异只要在足够大的样本里常见到 5%,几乎不可能对任何显性早发疾病致病。
- 疾病最大可信频率:Whiffin 等提出 max-credible-AF 框架——给定疾病的患病率、遗传模式、外显率与等位异质性,可以算出「该疾病致病变异在人群中允许的最大频率」——AF 超过它即排除。这把「频率过滤」从固定阈值升级为疾病特异的推理。
- 大样本的意义:80 万人样本下,AF 的置信区间在常见变异上极窄、在超罕见变异(单例)上仍宽——「没见过」与「不存在」的区分要靠 FAF95(95% 置信频率上限)而非点估计。
§2.2 约束度量:从 pLI 到 LOEUF 的演进
「这个基因对功能缺失(LoF)突变有多敏感」是另一个正交维度:
- 原理:受强 purifying selection 的基因,观察到的 LoF 变异会远少于中性期望——observed/expected 比值成为约束的度量。
- pLI 时代:v2 论文用概率化 pLI(probability LoF intolerant)三分类(0.9 阈值)——简单但粗糙:高表达、短基因的误判率高。
- LOEUF:v2 constraint 论文引入的连续指标——LoF O/E 比值的 90% 置信上界(lambda 上界),分位数化后跨基因可比;LOEUF 低 = 强约束(对 LoF 敏感)= 更可能是显性致病基因。
- 错义 Z 与 MIS-Z:错义变异的 Z 检验约束——错义高度受限的基因(如离子通道)对错义致病变异敏感;v4 改进了对错义功能分级(高致错义)的整合。
- 区域约束:v3 论文(Chen 2024)把约束从基因推向全基因组——非编码区域的 NDR(约束区域)发现了启动子等调控元件的功能敏感性,是「基因组暗物质约束地图」。
- v4 的 LoF 管线:LOFTEE v1.1 + 学习基因组特征(NMD 预测、剪接影响)的新管线,LoF 真阳性判别精度 90%——约束的输入质量直接决定指标的可靠性,这是 v4 主论文最被低估的贡献。
§2.3 ExAC → gnomAD:聚合数据库的社会技术史
- 起源的意外性:ExAC 本是各疾病研究对照样本的聚合(2014-2016),发起者(MacArthur 实验室等)的原始动机是给自家变异过滤找参照——发布后迅速成为全行业参照,说明这是全行业的空白。
- 联盟化的 gnomAD:2018 年更名扩容,数据贡献从「顺便聚合」变成制度化的贡献协议(308 家机构)——聚合数据库成为一种新的科学生产方式:不采集数据,而是把碎片化数据标准化。
- UKB 的并轨:v4 直接纳入 UK Biobank 的 416,555 个外显子组(占总样本一半以上)——独立资源之间的并轨而非重建,是数据基础设施成熟期的标志动作。
- 与中国人群资源的关系:gnomAD 的 EAS(22,448)远不足以代表东亚人群变异谱——ChinaMAP、CKB、Taiwan Biobank 等本土库在东亚临床实践里是必要的互补参照,不是可选项。
§2.4 结构变异维度的补课
短变异之外,SV 的频率目录是 gnomAD 第二个支柱:
- 规模与难度:1,199,117 个 SV(缺失 627,947 / 重复 258,882 / 插入 296,184 / 倒位 2,185 / 复杂 13,116 / 相互易位 92)——SV calling 的假阳性率远高于 SNV,需要多工具(Manta/Canvas/gCNV 等)交叉与人工审校,v4 的 SV callset 在量与质上是公开资源的极限。
- 临床意义:CNV 是许多显性神经发育疾病的机制(如 22q11 缺失)——「这个 CNV 在 8 万基因组里的频率」直接决定它是复发型热点还是家庭特发。
- 方法学外溢:gnomAD-SV 的质控体系(Collins 2021)成为 WGS SV 分析的事实教程。
§2.5 ancestry 分层:为什么它既是功能也是局限
- 功能: founder effect 让某些变异在特定人群高频(如 ASJ 的 BRCA 185delAG、FIN 的芬兰遗产)——ancestry 分层频率(AF_popmax/grpmax)避免把「欧洲罕见」误判为「全人群罕见」。
- 局限的量化:v4 的 NFE 622,057(77.07%)vs MID 3,031——样本量差 200 倍,同一位点在 MID 的频率置信区间比 NFE 宽一个数量级;grpmax 的统计功效在小组上不可靠。
- 临床后果:非欧洲人群的变异过滤若直接套 gnomAD 全人群 AF,会因参照不足产生假阴性(把致病变异误判为「频率足够高而良性」的反向情形较少,但「没数据 → 误以为罕见 → 误判致病」更多)。
- v4 的改进与天花板:新增 MID 组、AFR 扩到 37,545(3 倍于 v2)、AMR 30,019——方向对、幅度仍不足;官方自己也把「提高多样性」列为持续目标(broad.io/gnomad_stats 的直白表述)。
§2.6 与 ClinVar/OMIM 的证据生态位
- 证据链分工:gnomAD(多常见)→ ClinVar(实验室/文献怎么判)→ OMIM(基因-疾病关系定论)——变异解读的三层证据栈;gnomAD 是最底层也最客观的一层(统计事实 vs 人工注释)。
- 反向污染的防范:ClinVar 里「VUS 误提交为致病」的条目若回流 gnomAD 过滤会造成循环论证——gnomAD 的聚合不使用 ClinVar 判级,保持独立。
- ClinGen 的标准化角色:基因-疾病有效性(gene-disease validity)框架消费 gnomAD 约束作为辅助证据。
§2.7 隐私设计:聚合发布的攻防
- sites-only 的天然保护:无个体基因型、无表型——传统的再识别攻击面不存在。
- 剩余风险:成员推断(membership inference)——已知某个体/家族的变异谱后,可在原理上推断其是否参与了贡献样本池;学界已有概念验证,gnomAD 官方以「聚合粒度 + 无表型」回应,风险被评估为低但非零。
- 组间频率的敏感性:极小 ancestry 组(如 MID 3,031)的频率本身携带群体信息——v4 发布时对小组频率有额外的统计约束(最小 AC 阈值过滤)。
§2.8 AI 视角的科学定位
对医疗 AI,gnomAD 的角色是「世界先验库」:人群里什么是常态(频率)、什么在功能上不可动摇(约束)——模型学到的任何「异常」判断,最终都要能对齐到这两个先验上。没有先验校准的模型会把多态当致病(假阳性)或把超罕见致病变异当噪声(假阴性)——§7 的四喂法就是把这两个先验工程化的方式。
§2.9 「可敲除基因」与药物靶点安全
gnomAD 最有商业价值的衍生概念是「人类可敲除基因」清单——健康人身上常见双等位 LoF 的基因集合:
- 清单构成:v2 论文识别出数千个「在至少一个健康个体上双等位 LoF 仍存活」的基因——它们证明:人类失去这个基因功能是可耐受的(至少短期)。
- 药物靶点白名单:药物抑制靶点若与可敲除基因重叠,人类遗传学层面提示「药理性抑制大概率不致命」—— PCSK9 是教科书案例:LoF 携带者低胆固醇且健康 → 抑制剂安全先验强 → 单抗/ siRNA 药物全线成功。
- 反向红线:强约束基因(LOEUF 极低)做抑制剂靶点时要问「完全敲除能不能活」——若不能,选择性/剂量/给药窗的容错极小,临床风险预算前置。
- 工程注意:可敲除 ≠ 无功能代价——清单来自「存活且未筛查深度表型」的个体;UKB 深表型与可敲除基因的关联分析(如某可敲除基因与代谢/免疫表型的微妙关联)是二代靶点评估的标准动作。
- 与 OMEGA 等计划的关系:系统性深表型的 LoF 携带者招募(如 UKB 全量 WGS + 域评估)正在把「可敲除但微妙代价」的灰区填实——gnomAD 约束是这类计划的筛选器。
这条链路(约束 → 可敲除 → 靶点安全)是逆向利用人群数据的范式:把「致病性视角下没用的低约束基因」变成「药物安全视角下的高价值信息」。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格 |
|---|---|
| 当前版本 | v4.1(2024-05)——exomes / genomes / joint 三套 sites |
| 参考坐标 | GRCh38(v2 为 GRCh37——不可互换,§3.7) |
| 样本 | 807,162 无关个体(730,947 exomes + 76,215 genomes);非 UKB 子集 390,607 |
| 短变异 | SNV 786,500,648 + InDel 122,583,462 |
| 功能计数 | 同义 9,643,254 / 错义 16,412,219 / 无义 726,924 / 移码 1,186,588 / 经典剪接 542,514 |
| SV | 1,199,117(DEL 627,947 / DUP 258,882 / INS 296,184 / INV 2,185 / CPX 13,116 / RECIP 92) |
| 性别 | 406,265 XX / 400,897 XY |
| ancestry | NFE 622,057 / SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031 |
| 贡献面 | 308 家机构 / 100+ 研究 / 25+ 国 |
| 文件形态 | sites-only VCF(.vcf.bgz + tbi)、Hail Table(.ht)、TSV、coverage 表、约束表、浏览器数据 |
| 注释栈 | VEP + LOFTEE v1.1(LoF 判别精度 90%)+ 区域约束 NDR |
| 许可 | 数据 CC0 1.0;代码 MIT;引用请求不强制 |
§3.2 v4 样本组成与 UKB 关系
- 总量分解:807,162 = 非 UKB(314,392 exomes + 76,215 genomes = 390,607)+ UKB exomes 416,555——UKB 占比 51.6%。
- non-UKB 子集的意义:UKB 样本的疾病谱与英国人群绑定——做 ancestry 均衡分析时官方提供 non_ukb 子集口径(分组统计更平衡)。
- v4 genomes 的独立性:76,215 genomes = v3 的 76,156 样本用更新管线重处理(非新增样本)——「v4 基因组比 v3 多了什么」的答案是「更好的管线」而非「更多样本」。
- 样本重叠纪律:v2 与 v3 样本重叠约 81%——跨版本 meta 分析必须在样本 ID 层去重,否则频率被重复计数污染。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 变异覆盖 | 9/10 | 外显组近全 + 全基因组非编码;exome 区外依赖 genome 口径 |
| D2 | 注释完整度 | 9/10 | VEP+LOFTEE+约束官方预计算;第三方注释(ClinVar 等)需自行 join |
| D3 | 频率分层 | 8/10 | 10 组 ancestry × 性别 + grpmax/FAF95;小组 CI 宽 |
| D4 | 质量透明度 | 9/10 | QC 标志全公开 + coverage 表 + QC 论文/仓库 |
| A1 | 机器可读 | 9/10 | Hail Table 原生 + VCF/TSV + GraphQL API |
| A2 | 文档完备 | 8/10 | 下载页/FAQ/教程齐全;schema 变更需读 release notes |
| A3 | 接入成本 | 10/10 | 免注册 + 双云公共桶——业界最低门槛 |
| A4 | 更新机制 | 7/10 | 年度级大版本;joint/SV 增量不同步发布 |
| I1 | 指标标准化 | 8/10 | LOEUF/FAF95/grpmax 有定义论文;pLI 等旧指标迁移需注意 |
| I2 | 可复现性 | 9/10 | QC 管线(gnomad_qc)开源,从原始数据可复算 |
| M1 | 多模态对齐 | 6/10 | 无表型——「多模态」只能与外部资源靠基因座 join |
| M2 | 时间序列 | 5/10 | release 间可比性有限(管线变更混在样本变化里) |
| S1 | 样本安全 | 10/10 | sites-only 聚合——隐私攻击面最小 |
| S2 | 合规负担 | 10/10 | CC0 + 无 DAC——合规成本近零 |
总分:A 级(AI 就绪度最高的基因组资源之一——限制主要来自「无表型」的范畴边界而非数据质量)
§3.4 存储与计算需求
| 数据件 | 体量 | 最小分析环境 |
|---|---|---|
| v4.1 exomes sites Hail Table | ~2 TB | Hail/Spark 集群(16 核 + 64GB 起步可行) |
| v4.1 genomes sites Hail Table | ~3 TB | 同上 |
| v4.1 joint sites | 更大 | 大集群(如 Terra/DNAnexus 按需) |
| sites-only VCF(bgz+tbi) | 数百 GB/套 | tabix 抽取即可,不用 Hail |
| SV sites | ~50 GB | 单机可跑 |
| 约束表/coverage/mtDNA | 数十 GB | 单机 pandas 足够 |
实操分工:单基因/单变异查询走浏览器/API;批量注释走 sites VCF + tabix;全基因组级统计才动用 Hail 集群——大部分项目其实不需要第三档。
§3.5 获取通道
- 浏览器:gnomad.broadinstitute.org——variants/genes/transcripts/structural-variants/mitochondrial/coverage 六类页面;人类可读但不宜做批量源。
- GraphQL API:https://gnomad.broadinstitute.org/api——单变异/单基因程序化查询;无配额限制但请礼貌节流。
- Google Cloud:
gs://gcp-public-data--gnomad/(公共桶,主要分发点)——Hail Table/VCF/TSV 全格式;Terra 平台可直接挂载。 - AWS Open Data:
s3://gnomad-public-us-east-1/——aws s3 ls --no-sign-request免账号访问;AWS Registry 官方条目。 - 约束与辅助表:LOEUF/错义 Z/区域约束/coverage 单独下载——多数 AI 特征工程只用到这一档(GB 级)。
§3.6 口径对齐表
gnomAD 数字在不同文档里的口径差异(引用前对齐):
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| 807,162 | v4 总样本(broad.io 统计页) | = 730,947 exomes + 76,215 genomes |
| 730,947 | v4 外显子组(v4 论文标题口径) | 含 UKB 416,555 |
| 76,215 | v4 基因组 | = v3 76,156 重处理 + 少量补充 |
| 390,607 | 非 UKB 子集合计 | 314,392 exomes + 76,215 genomes |
| ~9.09 亿 | v4 短变异总数 | SNV 7.87 亿 + InDel 1.23 亿 |
| 1,199,117 | v4 SV | genome 口径 |
| 141,456 | v2 总样本(2020 论文) | GRCh37——与 v4 样本重叠 ~81%(对 v3) |
§3.7 版本选择决策
版本是 gnomAD 使用的第一决策(不可互换):
| 版本 | 坐标 | 样本 | 用它当 | 别用它当 |
|---|---|---|---|---|
| v2.1.1 | GRCh37 | 125,748 ex + 15,708 ge | LOEUF v2(临床最常引用)+ chrX/Y 约束 + GRCh37 原生管线 | 现代频率过滤(样本小);GRCh38 管线 |
| v3.1.2 | GRCh38 | 76,156 genomes | 非编码区域 + mtDNA 频率 | 外显子过滤(无 exomes) |
| v4.1 | GRCh38 | 807,162 | 默认首选:频率过滤/FAF95/grpmax/joint | chrX/Y 约束(未发布);TCGA 关联(无 TCGA) |
liftover 陷阱:v2(GRCh37)lift 到 GRCh38 与 v4 原生在约 0.5-1% 位点表示不一致(assembly 修复)——跨版本比对变异要在等位表示层(locus+alleles)而非坐标层对齐。
§3.8 频率指标定义对照表
gnomAD 频率相关指标的精确定义与适用场景——每一个都有明确的「何时用/何时别用」:
| 指标 | 定义 | 适用 | 别用在 |
|---|---|---|---|
| AF | AC/AN 点估计 | 描述性统计;隐性携带频率 | 显性疾病过滤的判级依据 |
| AC / AN | 等位计数 / 总等位数 | 样本量核算;CI 手算 | 直接当频率用 |
| ac_hom | 纯合个体计数 | 隐性疾病 BS2;隐性携带者频率 | 显性疾病(纯合存在即反常) |
| AF_popmax | 旧版最大人群频率(v2 术语) | v2 语境的 founder 检查 | v4 分析(术语已换) |
| grpmax | v4 最大 ancestry 组频率 | founder 检查(现行) | 与 popmax 数值直接混用(组定义有变) |
| FAF95 | 95% 置信频率过滤上界 | 显性疾病过滤;PM2「absent」表述 | 描述「平均频率」(它是上界不是估计) |
| FAF99 | 99% 置信上界 | 更保守的过滤场景 | 常规判级(过严) |
| LOEUF | LoF O/E 的 90% CI 上界(分位) | 基因约束画像;优先级排序 | 单基因「约束绝对值」的精确解读(分位才可比) |
| pLI | 旧概率化 LoF 不耐受 | 对照旧文献 | 新分析(已被 LOEUF 替代) |
| 错义 Z | 错义约束 Z 统计 | 错义机制基因识别 | LoF 机制判断 |
| NDR | 非编码约束区域 | 非编码变异功能先验 | 编码区判级 |
三条使用纪律:① 显性疾病场景的「频率判断」永远以置信上界(FAF95)表达,不使用点估计;② 跨 ancestry 判读永远查最大组口径(grpmax),全人群 AF 只做参考;③ 约束指标引用必须带版本(v2 LOEUF 与 v4 口径不可比——样本与 LoF 管线都变了)。
§4 数据结构
§4.1 云存储目录形态
gs://gcp-public-data--gnomad/release/
├── 4.1/
│ ├── ht/exomes/gnomad.exomes.v4.1.sites.ht/ # 外显子 sites Hail Table
│ ├── ht/genomes/gnomad.genomes.v4.1.sites.ht/ # 基因组 sites Hail Table
│ ├── ht/joint/gnomad.joint.v4.1.sites.ht/ # exome+genome joint(v4.1 新增)
│ ├── vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz # sites VCF(.tbi 索引)
│ ├── vcf/genomes/... # 同上(genome 口径)
│ ├── sv/gnomad.v4.1.sv.sites.vcf.bgz # SV callset
│ ├── coverage/exomes/gnomad.exomes.v4.0.coverage.ht
│ └── joint/annotations/... # joint 注释
├── 4.0/ # v4.0(勿用——AN 低估缺陷)
├── 3.1.2/ht/genomes/gnomad.genomes.v3.1.2.sites.ht/ # 非编码/mtDNA 用
└── 2.1.1/ # GRCh37(LOEUF v2 / chrX/Y)
resources/ # 约束表、参考文件
AWS 镜像:s3://gnomad-public-us-east-1/release/...(结构对齐,--no-sign-request 访问)。
§4.2 sites Hail Table 字段结构
v4 sites 表的核心字段(Hail 结构体嵌套):
- 主键:
locus(contig/position)+alleles(ref/alt 数组)——变异的规范表示。 - 频率:
freq(结构体数组)——每组 ancestry × 性别的 AC/AN/AF/homozygote 计数;grpmax(最大组标识与频率);faf(频率过滤置信:FAF95/FAF99,按 ancestry)。 - 质量:
quality_metrics(allele_size、BaseQRankSum、MQ 等)+flags(lcr/mnp/segdup/inbreeding_comp 等 QC 标志)+rf_tp_probability(随机森林真阳性概率)。 - 注释:
vep(Consequence、IMPACT、Gene、HGVSc/p、CLIN_SIG 等)+lof(LOFTEE:consequence/flags/annotation)+in_silico(cadd/revel/spliceai 摘要)。 - 约束上下文:joint 表附
transcript_consequence与 gene 级lof.oe/lof.oe_ci_upper(LOEUF 组件)。
§4.3 GraphQL API 查询
#!/usr/bin/env python3
"""gnomAD GraphQL API 单变异/单基因查询(免注册)。"""
import requests
API = "https://gnomad.broadinstitute.org/api"
def query_variant(variant_id: str) -> dict:
"""按 gnomAD 变异 ID 查询(如 1-55516888-G-A,GRCh38)。"""
q = """
query ($variantId: String!) {
variant(dataset: gnomad_r4, variantId: $variantId) {
variantId referenceGenome
exome { ac an af ac_hom faf95 grpmax { af ancestry } }
genome { ac an af ac_hom faf95 grpmax { af ancestry } }
transcripts { consequence geneId geneSymbol hgvsp lofteeFlags }
}
}"""
r = requests.post(API, json={"query": q, "variables": {"variantId": variant_id}},
timeout=30)
r.raise_for_status()
return r.json()["data"]["variant"]
def query_gene(gene_symbol: str) -> dict:
"""基因级约束查询(LOEUF 等)。"""
q = """
query ($gene: String!) {
gene(geneSymbol: $gene, referenceGenome: GRCh38) {
geneSymbol
gnomadConstraint { lo loeuf pLI misZ oeLofUpper }
}
}"""
r = requests.post(API, json={"query": q, "variables": {"gene": gene_symbol}},
timeout=30)
r.raise_for_status()
return r.json()["data"]["gene"]
if __name__ == "__main__":
print(query_variant("1-55516888-G-A"))
print(query_gene("PCSK9"))
注意 dataset: gnomad_r4(v4)与 gnomad_r2_1(v2)的切换——API 的 dataset 参数即版本选择。
§4.4 批量频率注释(tabix 路线)
#!/usr/bin/env bash
# 用 sites VCF + tabix 给自有 VCF 批量加 gnomAD 频率(不依赖 Hail)
# 1) 下载 v4.1 exome sites VCF(AWS 免账号)
aws s3 cp --no-sign-request \
s3://gnomad-public-us-east-1/release/4.1/vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz .
aws s3 cp --no-sign-request \
s3://gnomad-public-us-east-1/release/4.1/vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz.tbi .
# 2) 抽取自有变异所在的位点窗口(假设 my.vcf.gz 已 bgzip+tabix)
bcftools annotate \
-a gnomad.exomes.v4.1.sites.vcf.bgz \
-c INFO/AC,INFO/AN,INFO/AF,INFO/FAF95,INFO/grpmax_af \
-h gnomad_header.hdr my.vcf.gz -Oz -o my.gnomad.vcf.gz
# 3) 提取 BA1 候选(AF >= 5%)
bcftools view -i 'INFO/AF[0] >= 0.05' my.gnomad.vcf.gz -Oz -o my.ba1.vcf.gz
§4.5 Hail 批量处理(全表级)
#!/usr/bin/env python3
"""Hail 读取 v4.1 sites 表:提取某基因的错义变异 + 频率 + 约束上下文。
适用 Terra/DNAnexus/自建 Spark 集群。"""
import hail as hl
hl.init() # 集群初始化
ht = hl.read_table("gs://gcp-public-data--gnomad/release/4.1/ht/exomes/gnomad.exomes.v4.1.sites.ht")
# 1) 按基因抽取错义(VEP 注释展开)
ht = ht.select(
vep=ht.vep,
freq=ht.freq,
grpmax=ht.grpmax,
faf95=ht.faf[0].faf95,
)
mis = ht.explode(ht.vep.transcript_consequences)
mis = mis.filter(
(mis.vep.transcript_consequences.gene_symbol == "PCSK9")
& (mis.vep.transcript_consequences.consequence_term.contains("missense_variant"))
)
# 2) 输出:坐标 / HGVSp / 全人群 AF / grpmax / FAF95
mis.select(
hgvsp=mis.vep.transcript_consequences.hgvsp,
af=mis.freq[0].af,
grpmax=mis.grpmax.af,
grpmax_pop=mis.grpmax.ancestry,
faf95=mis.faf95,
).export("gs://my-bucket/pcsk9_missense_v4.tsv")
§4.6 SV 与 mtDNA 抽取
#!/usr/bin/env python3
"""SV 频率对照:CNV 致病性判读前的健康人频率查询(SV sites VCF)。"""
import subprocess
def query_sv_region(chrom: str, start: int, end: int) -> str:
"""用 tabix 查 SV 区域重叠记录(v4 SV callset)。"""
cmd = ["tabix", "gnomad.v4.1.sv.sites.vcf.bgz", f"{chrom}:{start}-{end}"]
return subprocess.run(cmd, capture_output=True, text=True).stdout
# 例:22q11.21 微缺失热点区域
rows = query_sv_region("chr22", 18900000, 21450000)
for line in rows.splitlines():
fields = line.split("\t")
svtype = [f for f in fields[7].split(";") if f.startswith("SVTYPE")]
af = [f for f in fields[7].split(";") if f.startswith("AF=")]
print(fields[0], fields[1], svtype, af)
§4.7 元数据与版本指纹
- release notes 必读:每个版本的 schema 变更(如 v4 的 grpmax 术语、v4.1 的 AN 修正)记录在下载页与 blog——管线变更混在样本变化里,是口径漂移的主源。
- 数据指纹:分析锁定版本字符串(如
gnomad.exomes.v4.1)+ 下载日期 + 文件大小/md5——写在复现包里。 - gnomad_methods 资源抽象:
from gnomad.resources.grch38 import gnomad——官方 Python 包封装了全版本路径(CURRENT_* 常量),升级版本只改常量。
§4.8 完整性清单
- [ ] 版本与坐标明确(v4.1 + GRCh38?v2.1.1 + GRCh37?)
- [ ] 子集口径(全量 vs non_ukb/non_neuro/non_cancer——UKB 主导的偏斜是否影响结论)
- [ ] 频率指标选择(点估计 AF vs FAF95 vs grpmax——显性疾病过滤用 FAF95)
- [ ] coverage 对照(变异「不存在」的区域是否测到了——exome coverage v4.0)
- [ ] LoF 判定的 LOFTEE 标志(end_truncated/ancient 等假阳性标志过滤)
- [ ] SV 分析的多工具交叉背景(单工具 CNV 不作为唯一证据)
- [ ] QC 标志过滤策略(segdup/lcr 区域的变异降权)
- [ ] 版本指纹与下载日期写进复现包
§4.9 数据血缘
原始测序(308 家机构,WES/WGS,去标识化)
→ 统一预处理(GATK/BWA;CRAM;QC: sex check、contamination、relatedness、ancestry inference PCA)
→ 联合调用(GATK HaplotypeCaller gVCF → joint genotyping;v4.1 另有 exome+genome joint)
→ 变异级 QC(随机森林过滤 VQSR 补充; AS/RQ 管线)
→ 功能注释(VEP + LOFTEE v1.1 + in-silico 摘要)
→ 频率与约束计算(freq/faf/grpmax;LOEUF/错义 Z/区域 NDR)
→ 分发(Hail Table / sites VCF / TSV → GCS 公共桶 + AWS + 浏览器 + GraphQL)
使用者拿到的每一层都是上游全链开源(gnomad_qc 仓库)的可复算产物——这是 gnomAD 与多数「黑盒聚合」资源的本质区别。
§4.10 浏览器页面结构速查
浏览器六类页面的内容地图(人类查询路径,程序化批量请走 API/云存储):
- Variant 页:坐标/等位输入 → 频率表(全人群 + 各 ancestry + 性别)、质量图表(AB/MQ/DP 分布)、VEP/LOFTEE 注释、ClinVar 状态、附近变异列表——单变异尽调的标准入口。
- Gene 页:约束三件套(LOEUF/错义 Z/pLI 历史值)+ 区域约束 + 该基因全部变异的频率-功能散点——基因画像页。
- Transcript 页:转录本特异注释(临床过滤必须按转录本——同一变异在不同转录本后果不同)。
- Structural Variant 页:SV 类型/大小/频率分布 + 断点可视化——CNV 判读入口。
- Mitochondrial 页:mtDNA 变异频率、单倍群分布、异质性统计。
- Coverage 页:exome/genome 覆盖深度查询——「没测到」的解释器。
页面数据与云存储同源(同一 release 管线产出)——浏览器结论可以引用,但批量任务不要爬页面(有 API 且 Cloud Storage 更规范)。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪个数据件 | 关键指标 | 陷阱 |
|---|---|---|---|
| 显性疾病变异过滤 | v4.1 sites | FAF95 / grpmax / max-credible-AF | 用点估计 AF 而非 FAF95 → 罕见致病被漏放 |
| 隐性疾病携带者频率 | v4.1 sites | AF + ac_hom(纯合计数) | 忽视 ac_hom → 低估隐性风险 |
| 基因约束优先级 | 约束表 / API | LOEUF 分位 / 错义 Z / DisPo | v2 LOEUF 与 v4 混用 |
| CNV 致病性判读 | v4 SV | 区域频率 + 工具交叉 | 单工具 calling 当证据 |
| 非编码变异评估 | v3.1.2 genome / NDR | 区域约束 | 用 v4 exome 口径看非编码(覆盖不足) |
| chrX/Y 变异 | v2.1.1 | 伪常染色体区特殊规则 | v4 无 chrX/Y 约束——混版本 |
| mtDNA | v3.1.2 / v4 mtDNA | 异质性/单倍群 | 与核基因频率体系混淆 |
| AI 特征工程 | 约束表 + sites TSV | LOEUF/错义 Z/AF | 特征未按 ancestry 分层泄漏 |
§5.2 ACMG 频率证据的工程化协议
把 ACMG/AMP 的频率相关证据变成可复算规则:
- BA1(stand-alone benign):AF ≥ 5%(全人群或任一 ancestry)——注意用 max 口径(grpmax)防止「欧洲主导稀释」漏判。
- BS1(strong benign):AF 超过疾病 max-credible-AF(Whiffin 框架:患病率/遗传模式/外显率/等位异质性四参数)——每个疾病一张参数表,工程上做成配置文件。
- BS2(moderate-strong benign):健康成年人纯合(ac_hom)且疾病表型为显性早发——用 ac_hom 字段直查。
- PM2(absent/rare supporting):FAF95 = 0 或 AF < 疾病阈值——v4 起 PM2 的「absent」建议改用 FAF95=0 表述(点计数「absent」在大样本下置信度不足)。
- 组合纪律:频率证据只覆盖良性方向——「罕见」不能作为致病证据的实质支撑(PM2 仅 supporting),防止频率过滤器变成「越罕见越致病」的错误自动化。
- 留痕:每次判级记录 gnomAD 版本、字段快照(AF/FAF95/grpmax/ac_hom 原值)——版本升级后判级可复算。
§5.3 基因约束画像协议
- 取数:约束表(LOEUF 分位、错义 Z、区域约束)+ DisPo 评分(v4 论文)按基因 join。
- 分层解读:LOEUF 分位 < 10%(强约束)→ 显性机制候选高发区;> 90%(无约束)→ 隐性/温和表型/非编码机制——无约束 ≠ 无功能。
- 短基因与低表达校正:LOEUF 在短基因上 CI 宽——用 oE CI 宽度列做「可信度过滤」而非只看点估计。
- 空白点识别:constraint 高 + OMIM 无收录 + ClinVar 无 LoF 致病 → DisPo 高分——v4 论文显示这类基因富集胚胎致死/生育表型(难以在人类观察到的类别)。
- 输出形态:基因 × (LOEUF, misZ, DisPo, ClinVar 状态, OMIM 状态) 五列 TSV——下游优先级排序的标准输入。
§5.4 SV 致病性判读协议
- 频率对照:自有 calling 的 CNV 与 v4 SV callset 区域重叠——频率 > 1/1000 且健康 → 强烈良性信号。
- 工具交叉:v4 SV 是多工具集成 + 人工审校——自有单工具(如纯 Manta)的 DEL/DUP 在判读时降权。
- 复杂 SV:CPX 类(13,116 个)需要完整断点对齐——断点不清的「半重叠」不做频率推断。
- 批次感知:SV calling 的平台敏感性(short-read 对 INS/INV 检出弱)——「v4 没有这个 SV」≠「不存在」,对 INS 尤其如此。
§5.5 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 单基因/位点查询 | 浏览器 / GraphQL | 零(人力分钟级) |
| 面板级批量注释 | sites VCF + tabix + bcftools | 单机数小时;云存储费用 < $10 |
| 全外显组频率统计 | Hail(Spark 集群) | 云计算数十至数百美元 |
| 全基因组级 + joint | Terra/DNAnexus 按需集群 | 数百至数千美元 |
| 约束特征(AI 用) | 约束表 TSV + pandas | 几乎零(GB 级下载) |
gnomAD 的「免费」只对数据成立——把 9 亿变异玩转的计算预算要写进立项书(§1.7)。
§5.6 失败模式清单
- 版本混用:v2 的 LOEUF 配 v4 的频率写进同一篇论文——审稿人一票否决级错误。
- AF vs FAF95:显性疾病过滤用点估计——单例变异 AF=0 被当「absent」,实际 FAF95 可能 1e-5(80 万人样本的下限粒度)。
- grpmax 忽视:用全人群 AF 判「不常见」,某 ancestry 组实际 2%——founder 变异漏判。
- coverage 盲区:exome 未覆盖区域「无变异记录」被当「无变异」——coverage 表是必查项。
- LOFTEE 标志忽视:end_truncated/ancient 变异混入 LoF 计数——约束相关分析全盘偏斜。
- 子集错配:用 non_ukb 口径对比文献的全量口径——UKB 占 51.6%,两个口径差异不可忽略。
- liftover 假设:v2 GRCh37 lift 后与 v4 直接比——0.5-1% 位点表示差异造成假性「新变异」。
- API 拉取无节流:万级变异逐条 GraphQL——被封禁或超时;批量场景换 VCF/Hail。
§5.7 校准与验证协议
频率过滤系统的验证有固定套路——照抄 AC/AN 表不算完成:
- 金标准集:从 ClinVar 抽「明确良性(2 星 + 且 AF 高)」与「明确致病(2 星 + 且 P/LP)」两组变异——过滤系统对良性组应全放行(放行 = 判良性)而对致病组零误杀。
- 边界行为:人为构造 FAF95 恰好在疾病阈值附近的变异——系统判级应输出「边界」而非硬切;边界案例的人工升级路径要写进 SOP。
- ancestry 分层复验:同一金标准按 ancestry 分组跑——非欧洲组的误杀率应与 NFE 组同数量级;超差说明 grpmax/小组 CI 处理有缺陷。
- 版本回归:v4.1 → 未来 v5 升级时,用冻结的金标准集重跑——判级漂移率是升级验收指标(漂移大说明过滤逻辑绑死了版本实现细节)。
- 对抗样本:LOFTEE 高标志变异、segdup 区变异、liftover 变异三类「已知陷阱」样本的过滤行为——每一类都有预期输出,防止系统对边缘输入静默出错。
验证产出物是「过滤系统模型卡」:版本指纹 + 金标准表现 + 分层报告 + 已知局限——临床落地前的 QA 依据。
§6 实证结果与方法学分析
§6.1 v2 constraint 论文(2020):约束度量的定标
Karczewski et al. Nature 581:434-443(141,456 人)的核心交付:
- LOEUF 替代 pLI:连续化、CI 显式化——同一基因在两指标下的排序差异显著(尤其高表达短基因),文献里引用 pLI 的旧结论迁移时要重查。
- 人类基因的「可敲除清单」:约 3,000+ 基因常见双等位 LoF(双纯合健康)——「人类可失去的基因」清单成为药物靶点安全性评估的正面参照(OMG 类靶点)。
- 错义 Z 的分组现象:错义约束强的基因富集离子通道/受体——错义致病机制基因的先验指纹。
§6.2 v3 约束地图(2024):从基因到全基因组
Chen et al. Nature 625:92-100(76,156 genomes):
- 区域约束 NDR:非编码区域的约束地图——启动子/剪接调控区在 NDR 里富集,为非编码变异(占 GWAS 命中 90%+)提供功能先验。
- 突变率模型基础:区域约束依赖可靠的 context-dependent 突变率模型(chMETHYLE/上游工作)——突变率估计误差直接传导进约束。
- genome vs exome 的互补:v3(全基因组)与 v2/v4-exome(外显子)构成两个口径——非编码问题必须走 genome 口径。
§6.3 v4 主论文(2026):LoF 管线与 DisPo
medRxiv 2026-03(730,947 exomes)的三件套:
- 新 LoF 管线:从选择信号学习基因组特征(NMD、剪接)预测 LoF 真伪——90% 精度(旧 LOFTEE 在边界 case 上假阳性多);LoF 约束的输入质量跃升。
- DisPo 评分:约束(强)× 文献表征(少)→ 贝叶斯框架输出基因发现潜力——高分基因富集胚胎致死/生育表型;基因发现从「大海捞针」变成「排序捞针」。
- 规模-功效曲线:约束检测功效随样本量继续上升(未饱和)——意味着 v5 还会有新基因浮现,约束表要跟着 release 更新。
§6.4 方法学三层框架(gsm)
理解 gnomAD 任何指标的三层框架:
- G(Genotype layer):80 万人 × 变异的携带状态聚合(AC/AN/ac_hom)——统计事实层。
- S(Selection layer):约束/选择系数的推断(LOEUF/PIES)——模型推断层,依赖突变率模型与人群历史假设。
- M(Medical layer):临床判级规则(ACMG 证据/max-credible-AF)——医学决策层,依赖疾病参数表。
三层各自独立可错——审稿时先问「这结论在第几层」。
§6.5 接力实验设计
- 频率发现 → 功能验证:gnomAD 找到「约束强但 VUS 密集」的基因 → 深表型队列(UKB/MIMIC)找关联表型 → 细胞实验验证机制。
- DisPo → 疾病队列:DisPo 高分基因 → 罕见病队列(受控 dbGaP 资源)定向检索 → 分离分析确认。
- 约束 → 药物安全:人类「可敲除基因」清单 → 靶点安全性白名单——反向利用 LoF 不耐受。
§6.6 八个真实坑点
- 坑点 1:版本静默混用——v2 LOEUF + v4 AF 同文混写;LOEUF、AF、坐标三要素必须同一版本。
- 坑点 2:AF=0 当「absent」——80 万人样本的「没见过」要写 FAF95(如 1.4e-5)而非 0;PM2 判级按 v4 建议改 FAF95=0 表述。
- 坑点 3:grpmax 漏查——founder 变异在某组 2%、全人群 0.1%——只查全人群 AF 会放行假良性/假致病各一例。
- 坑点 4:coverage 盲区当阴性——exome 未覆盖区域无记录 ≠ 无变异;先查 v4.0 exome coverage。
- 坑点 5:UKB 过代表征——v4 含 416,555 UKB exomes,英国人群绑定疾病谱——非 UKB 情境结论用 non_ukb 子集复算。
- 坑点 6:liftover 等位表示——GRCh37→38 lift 后 0.5-1% 位点表示变化;跨版本比对用 locus+alleles 规范键。
- 坑点 7:LOFTEE 边界 case——end_truncated/ancient/complex 标志的 LoF 是假阳性主力——LoF 计数前过滤标志位。
- 坑点 8:API 无节流批量拉取——万级 GraphQL 逐条请求被打断/超时——批量走 VCF/Hail,API 只做单点查询。
§6.7 审稿人自查清单
- [ ] gnomAD 版本字符串(v4.1?v2.1.1?)与坐标(GRCh38/37)写进方法段?
- [ ] 频率结论用的是 FAF95/grpmax 还是裸 AF?依据?
- [ ] 子集口径(全量/non_ukb/non_neuro)声明?
- [ ] LoF 相关结论是否过滤 LOFTEE 标志?
- [ ] 非编码结论用的是 genome 口径(v3/NDR)?
- [ ] 与旧文献比较时版本迁移说明(pLI→LOEUF)?
- [ ] 「absent」表述是否替换为 FAF95 上界?
- [ ] 复现包含版本指纹 + 下载日期?
§6.8 历代指标对照:pLI → LOEUF → v4 约束
引用旧文献或迁移历史结论时需要这张对照表:
| 维度 | pLI(v2 早期) | LOEUF(v2 constraint 2020) | v4 约束(2026 论文口径) |
|---|---|---|---|
| 输出形态 | 概率三分类(0.9 阈值) | 连续分位(10 组) | 连续 + 新 LoF 管线输入 |
| 统计基础 | 插入突变率期望 | O/E + 90% CI 上界 | 同 LOEUF + 管线精度 90% |
| 短基因表现 | 高误判 | CI 显式化(可判不确定) | 改善但 CI 仍宽 |
| 错义机制 | 无 | 错义 Z 单列 | 高致错义整合进不耐受度量 |
| 临床引用惯性 | 旧指南/旧论文大量引用 | 当前主流 | 增量替代中 |
| 迁移动作 | — | pLI 结论需 LOEUF 重查 | LOEUF 数值随版本会变 |
迁移纪律:任何「该基因不耐受/耐受 LoF」的历史结论,引用时注明所用指标与版本;跨版本结论冲突时(pLI 说耐受、LOEUF 说约束)以新版为准并说明理由——这类冲突本身就是论文的讨论素材。
§6.9 文献结论迁移的三个高频场景
- 旧版 pLI=0(耐受)→ 新版强约束:样本扩大后 CI 收窄——原结论是小样本假阴性;临床判级复查该基因的 LoF 变异。
- 旧版强约束 → 新版松动:LoF 管线升级后假阳性 LoF 被剔除(NMD 预测修正)——「约束下降」不等于「基因不重要」,是「测量更准」。
- popmax → grpmax 数值跳变:ancestry 组定义变化(MID 拆分等)——最大组频率变化是口径变化而非生物学变化,解读时先查 release notes。
§7 AI 就绪指南与应用场景
§7.1 gnomAD 在医疗 AI 中的四种喂法
- 频率特征注入:变异级(AF/FAF95/grpmax)与基因级(LOEUF/错义 Z)作为致病性预测模型的结构化特征——EVE/AlphaMissense 类模型的公共频率输入。
- 过滤层工程化:ACMG 频率证据做成流水线模块(§5.2)——诊断 AI 的「去噪前置」。
- 阴性对照生成:约束白名单(可敲除基因)与高频变异库(BA1 集合)作为模型的阴性训练/校准集——解决罕见病 AI「阳性样本稀缺、阴性样本更稀缺」的痛点。
- 群体先验校准:模型输出的变异风险与人群频率对齐校准(calibration vs prevalence)——防止「越罕见越致病」的模型内隐逻辑。
四种喂法与 §6 坑点的对应:喂法 1 踩坑 1(版本)与坑 5(UKB 偏斜);喂法 2 踩坑 2(FAF95)与坑 3(grpmax);喂法 3 踩坑 7(LOFTEE 标志);喂法 4 踩坑 6(liftover)——建模前回读 §6.6 对号。
§7.2 变异致病性特征工程实操配方
#!/usr/bin/env python3
"""构建变异级致病性特征表:gnomAD 频率/约束 + ClinVar 状态。
输入:自有变异列表(chr-pos-ref-alt,GRCh38)
输出:特征 TSV,供下游分类器。"""
import subprocess
import pandas as pd
SITES_VCF = "gnomad.exomes.v4.1.sites.vcf.bgz" # 预先下载
REGIONS = "variants.regions.bed" # 自有变异 ±100bp 的 BED
def extract_gnomad_annotations(bed: str) -> pd.DataFrame:
"""tabix 按 BED 批量抽取,避免逐条 API。"""
out = subprocess.run(
["tabix", "-R", bed, SITES_VCF],
capture_output=True, text=True, check=True,
).stdout
rows = []
for line in out.splitlines():
f = line.split("\t")
info = dict(kv.split("=", 1) for kv in f[7].split(";") if "=" in kv)
rows.append({
"locus": f"{f[0]}-{f[1]}",
"ref": f[3], "alt": f[4],
"af": info.get("AF"), "faf95": info.get("FAF95"),
"grpmax_af": info.get("grpmax_af"),
"ac_hom": info.get("AC_hom", 0),
"loftee": info.get("LOFTEE"),
"vep_max_impact": info.get("VEP_MAX_IMPACT"),
})
return pd.DataFrame(rows)
def load_constraint_table(path: str) -> pd.DataFrame:
"""基因级约束(LOEUF 分位等)→ 按 gene join。"""
ct = pd.read_csv(path, sep="\t")
ct["loeuf_decile"] = pd.qcut(ct["oe_ci_upper"], 10, labels=False)
return ct[["gene", "oe_ci_upper", "mis_z", "loeuf_decile", "dispo"]]
if __name__ == "__main__":
var_features = extract_gnomad_annotations(REGIONS)
gene_features = load_constraint_table("gnomad.v4.constraint.tsv")
# gene 归属来自自有 VEP 注释(此处假设已有 var.gene 列)
var_features = var_features.merge(
pd.read_csv("variants.with_gene.tsv", sep="\t"),
on=["locus", "ref", "alt"])
final = var_features.merge(gene_features, on="gene", how="left")
final.to_csv("pathogenicity_features.tsv", sep="\t", index=False)
§7.3 模型选型与迁移决策
- 变异级致病性模型:gnomAD 特征与 CADD/REVEL/SpliceAI 组合时注意信息冗余(CADD 已部分含频率代理)——消融实验确认 gnomAD 特征的增量。
- 基因级优先级模型:LOEUF/DisPo 是强先验——避免模型退化成「约束复读机」:与表达量、疾病谱特征正交化后再训练。
- 过滤层 vs 学习层:显性疾病过滤建议规则层(FAF95 阈值)不进模型——把确定性强、可解释的规则留在模型外,是临床 AI 的可解释性红利。
- 无监督异常检测:SV 新颖性评分(自有 calling 中 v4 SV 目录外的事件)——「目录外」是弱证据,需与工具置信度组合。
- 版本漂移管理:v5 发布后特征分布会移动(LoF 管线升级)——特征表带版本标签,模型重训与特征版本绑定。
§7.4 公平性:ancestry 偏斜的工程应对
- 特征层:grpmax/FAF95 按 ancestry 提供时,为小组(MID/AMI)显式存 CI 宽度列——模型对小组特征降权而非静默使用宽 CI 点估计。
- 评估层:变异过滤器的假阳/假阴按 ancestry 分组报告——「对 AFR 变异的过滤精度 vs NFE」的差值是审稿人新常态问题。
- 数据层:非欧洲人群项目补用 ChinaMAP/CKB/All of Us 作频率参照(§9.5 组合)——gnomAD 单源参照的 AI 系统在该语境下结构性欠拟合。
- 文档层:模型卡声明训练频率特征的版本与 ancestry 构成——gnomAD 官方自己都在 stats 页直白标注多样性不足,AI 团队没有理由沉默。
§7.5 任务×资源速查表
| AI 任务 | gnomAD 数据 | 输出形态 | 验收 |
|---|---|---|---|
| 变异致病性分类 | sites 特征 + 约束表 | 分类器特征 | 消融显示频率特征增量 |
| 罕见病候选基因排序 | LOEUF/DisPo/OMIM | 排序清单 | Top-K 命中已知基因(留一验证) |
| 诊断流水线过滤层 | FAF95/grpmax 规则 | ACMG 自动打分 | 与专家判级一致性 κ |
| SV 新颖性评分 | v4 SV callset | 异常分数 | 与致病库(ClinGen)重叠富集 |
| 突变率/选择建模 | v4 sites 频谱 | 人群遗传参数 | 与 PIES/Roulette 基线一致 |
| 医学影像-基因联合 | 约束特征 × 队列表型 | 多模态模型 | 表型-基因关联可复算 |
§7.6 端到端案例:显性心肌病诊断过滤层
- 输入:疑似心肌病患者 WES 变异集(约 5 万个,GRCh38)。
- 频率层:v4.1 FAF95 > 心肌病 max-credible-AF → 标 BS1;grpmax 检查 founder(如芬兰/ASJ 组富集的既有良性判级)。
- 纯合检查:显性早发表型 + ac_hom ≥ 2 → BS2。
- 约束层:剩余变异的基因 LOEUF 分位与 DisPo 排序——强约束基因的变异进优先审查队列。
- LoF 质控:LOFTEE flags 过滤——end_truncated 变异降级为 VUS 候选而非直接致病假设。
- 输出:分级建议 + 每级证据的 gnomAD 字段快照(版本 v4.1 + 下载日期)——实验室 QA 可复算。
- 验收:与三位临床遗传专家盲评一致率 ≥ 0.85(Cohen κ ≥ 0.8);TP/FN 按 ancestry 分组报告。
§7.7 报告模板:方法学段落骨架
变异人群频率与约束注释来自 gnomAD v4.1(807,162 人;730,947 外显子组与 76,215 全基因组;GRCh38;2024-05 发布,含 v4.0 AN 修正)。频率过滤采用 FAF95(95% 置信频率过滤上限)与 grpmax(最大 ancestry 组频率),显性疾病判读遵循 Whiffin max-credible-AF 框架(参数见补充表 S1);「absent」表述统一替换为 FAF95=0。基因约束采用 LOEUF(v4 口径,LoF O/E 90% 置信上界分位)与错义 Z,基因发现优先级参考 DisPo 评分。LoF 判定经 LOFTEE v1.1 并过滤 end_truncated/ancient 标志。子集口径:主分析采用全量 v4.1,敏感性分析采用 non_ukb 子集(390,607 人)排除 UK Biobank 过代表征。结构变异对照使用 gnomAD v4 SV callset(1,199,117 个 SV)。所有频率快照与版本指纹(下载日期、文件校验和)见复现包。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 取数 | 约束表 + sites VCF 下载 | 存储 + 带宽 | 1 天 |
| 管线 | tabix/Hail 注释流水线 | 单机或小集群 | 3-5 天 |
| 校准 | ACMG 规则 + 疾病参数表 | 领域人力 | 1-2 周 |
| 评估 | 专家一致性 + 分层报告 | 领域人力 | 1 周 |
| 维护 | 版本升级(v5)适配 | 人力 + 重算 | release 周期年检 |
先「约束表小数据打样」后「sites 全量扩展」——多数项目卡在校准而非计算。
§7.9 端到端案例 2:AI 致病性模型的特征消融
场景:为自研变异致病性分类器补入 gnomAD 特征,验证增量价值——这是「要不要接入 gnomAD」的量化答案:
- 基线模型:仅用变异序列特征(CADD/REVEL/SpliceAI + 进化保守性)——测试集 PR-AUC 记为 B。
- 特征组 F1(频率):AF/FAF95/grpmax/ac_hom 四列——预期在「良性高频变异」端大幅降假阳(CADD 类模型对高频良性变异的排序缺陷是已知短板)。
- 特征组 F2(约束):基因 LOEUF 分位/错义 Z/DisPo——预期在「超罕见但无害变异」端降假阴(约束低基因的罕见变异先验良性)。
- 消融矩阵:B / B+F1 / B+F2 / B+F1+F2 四组对比——增量不是均匀的:F1 救假阳、F2 救假阴,只报一个总 AUC 会掩盖互补性。
- 泄漏自查:训练集若来自 ClinVar,检查 ClinVar 判级时间与 gnomAD release 的时间关系(v4 已含 ClinVar 共享变异的频率信息——同一变异的「频率证据」参与了人类判级,存在轻度循环);留出时间切分(训练用早期判级,测试用新判级)是稳妥做法。
- 分组报告:PR-AUC 按 ancestry 分组——gnomAD 特征在非欧洲变异上的置信度更低,模型应学到「小组 CI 宽 → 特征降权」而非静默同权。
- 验收:F1+F2 相对基线的假阳/假阴双向改善均显著;ancestry 组间差距在可解释范围(CI 宽度差异)内。
结论形态:「gnomAD 特征的增量在哪里、不在哪里」的消融证据——比「加了就好」的粗报告更接近审稿要求。
§8 伦理、许可与合规
§8.1 许可结构
- 数据 CC0 1.0:公共领域弃权——无需署名、无使用限制(商业/非商业/再分发均可);官方「请求引用但不强制」。
- 代码 MIT:gnomad_methods/gnomad_qc 均为 MIT——衍生工具可闭源。
- 引用伦理:社区惯例引用 v4 论文(或所用版本主论文)——不强制但是学术信誉机制。
§8.2 隐私与剩余风险
- 天然保护面:sites-only、无表型、无个体基因型——传统再识别攻击面不存在;AC/AN 聚合粒度对小组有最小计数约束。
- 剩余风险:成员推断的概念验证研究(已知基因型谱反推参与)提示极小组(如 MID 3,031)的频率组合理论上携带群体信息——gnomAD 的缓解是发布粒度控制,使用者不应逆向尝试。
- 使用者义务:不将 gnomAD 与可识别数据做超出既定用途的链接;产品化时声明频率参照的版本与局限。
§8.3 致谢与引用模板
致谢模板(按需裁剪):
Variant frequencies and constraint metrics were obtained from the Genome
Aggregation Database (gnomAD) v4.1 (GRCh38), a resource made available by
the gnomAD Project Consortium under CC0. We thank the data contributors
and participants whose sequencing data underlie the reference.
引用:gnomAD Project Consortium. Integrating 730,947 exome sequences with
clinical literature improves gene discovery. medRxiv (2026).
DOI 10.64898/2026.03.23.26349081 (使用 v2 时引 Karczewski Nature 2020;
v3 约束引 Chen Nature 2024;SV 引 Collins Nature 2021)
§8.4 国内合规路径
- 数据性质:公开聚合统计(非个体信息)——下载与使用本身不触发人类遗传资源管理申报;但二次生成的衍生数据若涉及可识别信息则另论。
- 合作发表:使用 gnomAD 的论文发表无特殊限制;将国内队列数据与 gnomAD 比对时,国内数据的出境审批按《人类遗传资源管理条例》执行(对比分析输出为聚合统计一般走简化路径,具体以伦理与 HGRAC 审批为准)。
- 红线:不得将 gnomAD 用于尝试反推任何贡献群体成员身份的用途;不得宣称 gnomAD 判级替代临床遗传师签发。
§8.5 商业使用边界
CC0 允许商业产品内置 gnomAD 频率(诊断软件、LIS 系统均可)——但两点建议:版本升级的商业影响纳入产品路线(v5 的 LoF 管线升级会改变过滤结果);对外文档标注「频率参照非诊断结论」的免责边界。
§9 谱系与生态
§9.1 聚合数据库时间线
2015 ExAC 概念成形(疾病研究对照样本聚合)
2016 ExAC 发布(60,706 exomes;Lek Nature 536)
2018 更名 gnomAD;v2.1 系列迭代
2020 v2 constraint 论文(141,456;LOEUF)
2021 gnomAD-SV(Nature 591)
2022 v3.1.2(76,156 genomes;GRCh38)
2024 v3 约束地图(Chen Nature 625)→ v4.0(并入 UKB)→ v4.1(AN 修正 + joint)
2026 v4 主论文(LoF 90% 精度 + DisPo;medRxiv)
§9.2 术语表
| 术语 | 定义 |
|---|---|
| sites-only | 只发布位点级聚合统计(无个体基因型)的发布形态 |
| AC / AN / AF | 等位计数 / 等位总数 / 等位频率 |
| ac_hom | 该变异的纯合个体数(隐性判读关键) |
| grpmax | 最大 ancestry 组频率(v4 术语,替代 popmax) |
| FAF95 | 95% 置信的频率过滤上限(Frequency Filtered AF) |
| LOEUF | LoF O/E 的 90% 置信上界——低 = 强约束(LoF 敏感) |
| pLI | 旧版概率化 LoF 不耐受指标(v2 时代,已多被 LOEUF 替代) |
| 错义 Z | 错义变异约束的 Z 统计量(高 = 错义受限) |
| NDR | 非编码约束区域(v3 论文,genome 口径) |
| LOFTEE | LoF 变异过滤注释器(标志位过滤假阳性) |
| DisPo | Discovery Potential 评分——约束强 × 表征少的基因发现潜力 |
| max-credible-AF | 疾病允许的致病变异最大可信频率(Whiffin 框架) |
| BA1 / BS1 / BS2 | ACMG 频率相关良性证据等级 |
| joint callset | exome+genome 联合调用 sites(v4.1 新增) |
| non_ukb | 排除 UKB 样本的子集口径(ancestry 均衡用) |
| liftover | 坐标版本转换(≠ 原生 build 数据) |
| founder variant | 奠基者效应变异(特定人群高频) |
| Hail | 大规模基因组数据分布式计算框架(gnomAD 标配) |
§9.3 资源选型决策树
你的需求是什么?
├─ 「查一个变异的频率」
│ → 浏览器 / GraphQL API(分钟级)
├─ 「给面板 VCF 批量加频率」
│ → sites VCF + tabix/bcftools(§4.4)
├─ 「全基因组级频率统计」
│ → Hail + sites Table(Terra/自建集群)
├─ 「基因约束/优先级」
│ → 约束表 + DisPo(GB 级,pandas 即可)
├─ 「非编码区域评估」
│ → v3.1.2 genome 口径 + NDR
├─ 「CNV 背景频率」
│ → v4 SV callset + tabix
├─ 「chrX/Y 约束」
│ → 回 v2.1.1(v4 未发布)
├─ 「个体级基因型-表型」
│ → 不用 gnomAD → UKB/队列数据
└─ 「体细胞突变谱」
→ 不用 gnomAD → TCGA/PCAWG
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| uk-biobank | v4 的最大样本源(416,555 exomes)——个体级分析去那边 |
| clinvar | 下游消费者:gAD 频率是其良性证据源;反向不成立 |
| hprc | 单倍型/泛基因组结构参考——SV 背景的结构解析互补 |
| dbgap | 访问模式的两极对照(CC0 即时 vs dbGaP 受控数月) |
| tcga | 范畴对照:胚系频率 vs 体细胞突变(v4 明确不含 TCGA) |
| 频率 vs 体细胞突变(v4 明确不含 TCGA) | |
| gwas-catalog | 关联汇总——频率解释 GWAS 命中时的参照层 |
| 关联汇总——频率解释 GWAS 命中时的参照层 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| 临床变异分级 | gnomAD 频率 + ClinVar 判级 + OMIM 表型 | 统计事实 + 社区注释 + 定论 |
| 非欧洲人群过滤 | gnomAD + ChinaMAP/CKB 频率 | 全人群 + 东亚细分 |
| 罕见病基因发现 | gnomAD 约束 + UKB 深表型 + dbGaP 罕见病队列 | 先验 + 关联 + 分离分析 |
| SV 判读 | gnomAD SV + HPRC 结构参考 + ClinGen CNV 判级 | 频率 + 结构 + 临床规则 |
| AI 致病性模型 | gnomAD 特征 + AlphaMissense/CADD + 内部分级集 | 特征 + 模型先验 + 真值 |
| 药物靶点安全 | gnomAD 可敲除清单 + pQTL MR(UKB Olink) | 安全白名单 + 因果 |
组合纪律:频率参照的版本与子集先声明——组合系统里 gnomAD 版本漂移会静默改变下游所有判级,版本指纹要贯穿全链(§4.7)。
§9.6 聚合层在开放科学生态中的角色
gnomAD 的社会角色可以概括为「开放科学的压缩层」——它证明了三件事在基因组学可行:
- 机构协作可以制度化:308 家机构按统一协议贡献数据、统一管线处理、统一发布——协作成本由基础设施承担而非逐项目谈判;这是 ExAC→gnomAD 十年演化出的最重要方法论。
- 隐私与效用可以再平衡:sites-only 聚合发布牺牲个体级信息,换来全开放分发——「聚合到什么粒度可以全开放」的答案被 gnomAD 抬高了(80 万人的频率即可全开放),后续资源(TOPMed 部分 release、HPRC 频率层)沿用了这个粒度模板。
- 指标可以成为公共品:LOEUF/DisPo 这类衍生指标被全行业引用而不收费——「数据库 + 指标 + 工具」三层全开放的供给模式,是它区别于商业基因数据库(付费 API)的本质。
对国内建设的镜鉴:单一机构难以复制 308 家的聚合面,但「统一管线 + 聚合粒度全开放 + 指标公共品」的三件套在单一大队列(如 CKB/ChinaMAP 规模)上完全可行——东亚人群的 gnomAD 等价物缺位是真实机会。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 浏览器/官网 https://gnomad.broadinstitute.org/;统计快照 https://broad.io/gnomad_stats
- 下载页 https://gnomad.broadinstitute.org/downloads(全版本索引 + release notes)
- GraphQL API https://gnomad.broadinstitute.org/api(文档在帮助页)
- Google Cloud
gs://gcp-public-data--gnomad/;AWSs3://gnomad-public-us-east-1/(--no-sign-request) - 工具 https://github.com/broadinstitute/gnomad_methods;QC 管线 https://github.com/broadinstitute/gnomad_qc
- 邮件列表 http://broad.io/gnomad_list(release 通告)
- 联系 gnomad@broadinstitute.org
上手指引(第一次接入的推荐顺序):
- 浏览器查一个已知变异(如 PCSK9 p.Arg93Cys)——感受频率表的分层结构。
- 用 GraphQL API 复查同一变异——比较
gnomad_r4与gnomad_r2_1两个 dataset 的输出差异。 - 下载约束表(GB 级)+ 基因级 pandas 探索——LOEUF 分位与 DisPo 的分布直觉。
- tabix 抽取一个小 panel 区域的 sites VCF 记录——验证 §4.4 流程。
- 若需全基因组级任务,再评估 Hail 集群(Terra 最省事)——多数项目到此为止不需要。
§10.2 关键文献
- Lek, M. et al. Analysis of protein-coding genetic variation in 60,706 humans. Nature 536, 285-291 (2016). DOI 10.1038/nature19057(ExAC 分析论文)
- Karczewski, K.J. et al. The mutational constraint spectrum quantified from variation in 141,456 humans. Nature 581, 434-443 (2020). DOI 10.1038/s41586-020-2308-7(v2 constraint / LOEUF)
- Collins, R.L. et al. A structural variation reference for medical and population genetics. Nature 591, 444-451 (2021). DOI 10.1038/s41586-021-03358-8(gnomAD-SV)
- Chen, S. et al. A genomic mutational constraint map using variation in 76,156 human genomes. Nature 625, 92-100 (2024). DOI 10.1038/s41586-023-06045-0(v3 约束地图 / NDR)
- gnomAD Project Consortium. Integrating 730,947 exome sequences with clinical literature improves gene discovery. medRxiv (2026-03). DOI 10.64898/2026.03.23.26349081(v4 主论文)
§10.3 站内延伸阅读
- UK Biobank — 大规模人群队列:v4 的最大样本源
- ClinVar — 变异致病性档案:频率之上的判级层
- HPRC — 人类泛基因组参考:SV 结构解析参考
- dbGaP — 受控基因型-表型档案:访问模式对照
- TCGA — 癌症基因组图谱:体细胞突变对照
- GWAS Catalog — 关联研究目录:关联证据汇总层
§10.4 FAQ
Q1:gnomAD 数据可以商用吗?
A:可以——CC0 公共领域,无使用限制、无需署名;社区惯例是引用所用版本主论文。
Q2:807,162 人里有 UKB 吗?
A:有——416,555 个 UKB 外显子组(占总样本 51.6%);需要 ancestry 均衡口径时用官方 non_ukb 子集。
Q3:为什么我的变异在 gnomAD 查不到?
A:三种可能:① 区域未被外显子捕获(查 coverage 表);② 确实是超罕见或新型变异(FAF95 给上界);③ 版本/坐标错配(v2 GRCh37 vs v4 GRCh38)。
Q4:AF、FAF95、grpmax 用哪个?
A:显性疾病过滤用 FAF95(不是点估计 AF);founder 风险查 grpmax;隐性携带者频率查 AF+ac_hom;论文报告建议三者并列。
Q5:v2 还需要吗?
A:需要两类场景——chrX/Y 约束(v4 未发布)与引用旧 LOEUF 值的文献对照;其余默认 v4.1。
Q6:能下到个体基因型吗?
A:不能——gnomAD 只发布 sites-only 聚合统计;个体级分析需要原始队列(UKB/dbGaP 类受控资源)。
Q7:LOEUF 怎么读?
A:越低越约束(LoF O/E 的 90% CI 上界,分位化);强约束基因(前 10%)对显性 LoF 疾病敏感;注意短基因 CI 宽、点估计不可靠。
Q8:为什么 v4.0 有问题?
A:v4.0 的 AN(等位总数)统计低估,使稀有变异 AF 高估 5-10%——v4.1(2024-05)修正;别用 v4.0 做频率结论。
Q9:和 ClinVar 怎么配合?
A:gnomAD 给统计事实(多常见),ClinVar 给社区判级(怎么解释)——过滤流水线先查频率(客观)再看判级(主观),顺序不可倒。
Q10:SV 数据怎么用?
A:tabix 按区域查 v4 SV callset 的重叠记录与频率——判读时注意多工具交叉背景与 CPX 复杂型的断点完整性;「v4 没有」≠「不存在」(INS 检出弱)。
Q11:mtDNA 数据在哪个版本?
A:v3.1.2 与 v4 均有线粒体变异频率(浏览器 mitochondrial 页)——异质性与单倍群分析注意核-线粒体口径差异。
Q12:下载全量要多少存储?
A:v4.1 exome sites Hail Table 约 2 TB、genome 约 3 TB;多数任务其实只需要约束表(GB 级)或 sites VCF(数百 GB)+ tabix。
Q13:API 有配额吗?
A:无硬性配额但请节流——万级以上批量查询改走 sites VCF/Hail;逐条 GraphQL 只适合单点查询。
Q14:怎么参与贡献数据?
A:通过数据贡献协议(308 家机构的模式)——联系官方(gnomad@broadinstitute.org);贡献是聚合服务标准的良性循环。
Q15:对非欧洲人群,gnomAD 够用吗?
A:不够独立支撑——NFE 占 77%,MID 仅 3,031;东亚/中东/非洲场景必须叠加 ChinaMAP/CKB/本土库做频率参照,并在模型卡声明。
Q16:FAF95=0 是什么意思?
A:95% 置信下该变异频率上界为 0 的表述口径(v4 建议用它替代「absent」)——写论文时用 FAF95 而非「未见」。
Q17:约束指标会更新吗?
A:会——每次 release 重算(v5 将用 v4 新 LoF 管线重算);引用时写版本,长期项目订阅邮件列表(broad.io/gnomad_list)跟踪。
Q18:怎么引用最合适?
A:主论文(v4/medRxiv 2026)+ 所用具体数据件的版本说明(v4.1 exomes)+ 关键指标出处(LOEUF 引 Karczewski 2020 或 v4 论文按口径)——三件套写法。
Q19:FAF95 和普通 CI 有什么区别?
A:FAF95 是对「频率过滤上限」的单侧 95% 置信上界——专门为「这个变异最多能有多常见」的判级问题设计;普通双侧 CI 给的是「估计值±波动」,两者数值不同不可互换。
Q20:为什么有的基因约束分位高但 ClinVar 里 LoF 致病不少?
A:约束是全基因统计(对 LoF 总体敏感度),ClinVar 记录的是特定变异——约束中等的基因仍可能有个别高致病 LoF 变异(如关键功能域);约束是先验不是判决。
Q21:non_ukb、non_neuro、non_cancer 子集怎么选?
A:non_ukb 排除 UKB 主导偏斜(ancestry 均衡分析用);non_neuro/non_cancer 排除对应疾病队列的过代表征(神经/癌症基因频率结论用)——子集是「让频率更接近普通人群」的旋钮。
Q22:v4 joint callset 和分别的 exome/genome sites 有什么不同?
A:joint 是外显子与基因组数据联合调用的位点集(v4.1 新增),对同位点给出统一口径——做全变异级统计优先 joint;只查外显区用 exome 表更轻。
§10.5 要点回顾
- 版本即一切:v2/v3/v4 不可互换——版本 + 坐标 + 子集三要素先于任何分析。
- FAF95 取代「absent」:80 万人样本里「没见过」的规范表述是频率置信上界。
- grpmax 防 founder 漏判:全人群 AF 之外必查最大组频率。
- sites-only 边界:无个体基因型/表型——个体级问题去队列资源。
- UKB 占 51.6%:non_ukb 子集是 ancestry 均衡分析的官方出口。
- coverage 是阴性证据的前置:「无变异记录」先过 coverage 检查。
- LOFTEE 标志过滤:LoF 相关结论前过滤 end_truncated/ancient。
- CC0 + 零门槛:数据免费但计算自担——预算按 §5.5 分档。
- 约束三件套:LOEUF(LoF)+ 错义 Z(错义)+ NDR(非编码)覆盖三类机制。
- 版本指纹贯穿组合系统:下游判级随 gnomAD 版本漂移——全链锁版本。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 807,162 = v4 总样本(730,947 exomes + 76,215 genomes)——broad.io/gnomad_stats + v4 论文
- 416,555 = UKB 外显子组(730,947 − non-UKB 314,392)——broad.io 统计页子集口径
- 390,607 = 非 UKB 子集合计(314,392 exomes + 76,215 genomes)——同上
- SNV 786,500,648 / InDel 122,583,462 = v4 sites 短变异——broad.io 统计页
- SV 1,199,117(DEL 627,947 / DUP 258,882 / INS 296,184 / INV 2,185 / CPX 13,116 / RECIP 92)——broad.io 统计页
- 同义 9,643,254 / 错义 16,412,219 / 无义 726,924 / 移码 1,186,588 / 经典剪接 542,514——broad.io 统计页
- 406,265 XX / 400,897 XY——broad.io 统计页
- ancestry:NFE 622,057(77.07%)/ SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031——broad.io 统计页(v4)
- 308 家贡献机构 / 100+ 研究 / 25+ 国——AWS Open Data 条目 + 官方 about 页
- v4.1 发布 2024-05(AN 修正 + joint)——bioSkills 版本考据 + AWS 条目(v4.1 表述)
- v4 主论文 DOI 10.64898/2026.03.23.26349081(medRxiv 2026-03;LoF 90% 精度;DisPo)——Broad 出版物页
- 四篇里程碑:Lek 2016 Nature 536:285-291 / Karczewski 2020 Nature 581:434-443 / Collins 2021 Nature 591:444-451 / Chen 2024 Nature 625:92-100——DOI 见 §10.2
- 许可 CC0 1.0(数据)+ MIT(代码)——KG Hub 条目 + AWS Registry(License MIT 标注为代码;数据「without restriction on use」)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- uniprot — 共享标签:基因组学与多组学 / 测序数据
- 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
- encode — 共享标签:基因组学与多组学 / 测序数据
- geo — 共享标签:基因组学与多组学 / 测序数据
- hmp — 共享标签:基因组学与多组学 / 测序数据
- dbsnp — 共享标签:基因组学与多组学 / 测序数据
- ega — 共享标签:基因组学与多组学 / 测序数据
- roadmap-epigenomics — 共享标签:基因组学与多组学 / 测序数据
- blueprint — 共享标签:基因组学与多组学 / 测序数据
- tcga — 共享标签:基因组学与多组学 / 测序数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

