gnomAD 基因组聚合数据库 — AI-Ready Wikipedia

807,162 人 · 9 亿+ 短变异 · 120 万结构变异:人类变异频率与约束度量的参考标准

来源 https://gnomad.broadinstitute.org/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 28
gnomAD 基因组聚合数据库 — AI-Ready Wikipedia

信息速览

数据集名称gnomAD 基因组聚合数据库 — AI-Ready Wikipedia
数据类型807,162 人,9.09 亿短变异,120 万 SV,CC0 开放,LOEUF 约束
规模807,162 名去标识无关个体(聚合统计,无个体基因型)
接入方式https://gnomad.broadinstitute.org/
AI 就绪度

gnomAD — 基因组聚合数据库 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 Genome Aggregation Database(gnomAD),基因组聚合数据库;前身 ExAC
发布方 gnomAD Project Consortium——Broad Institute 主导(MacArthur/Rehm/Neale/Daly/Luria/Tiao 等),国际多机构联盟
版本 现行 v4.1(2024-05,GRCh38);v4 主论文 medRxiv 2026-03;历史:ExAC(2016)→ v2(2019,GRCh37)→ v3(2022)
核心规模 807,162 人 = 730,947 外显子组(含 UKB 416,555)+ 76,215 全基因组
变异规模 短变异约 9.09 亿(SNV 786,500,648 + InDel 122,583,462);SV 1,199,117 个
数据类型 sites-only VCF + Hail Table + TSV——等位频率(AF/AC/AN/grpmax/FAF95)、约束(LOEUF/错义 Z/区域约束)、QC 指标、SV 目录、mtDNA、coverage
载体 浏览器 gnomad.broadinstitute.org + GraphQL API + Google Cloud(gs://gcp-public-data–gnomad)+ AWS Open Data(s3://gnomad-public-us-east-1)
许可 CC0 1.0 公共领域(without restriction on use);配套代码 gnomad_methods 为 MIT
访问门槛 无注册、无 DAC、无费用——全开放
贡献面 308 家数据贡献机构 / 100+ 研究 / IRB 至少 25 国;性别 406,265 XX / 400,897 XY
ancestry NFE 622,057(77.07%)/ SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031(v4 新增)
本库关联 / MID 3,031(v4 新增)
本库关联 uk-biobank(v4 最大数据源)、clinvar(致病性解释下游)、hp(v4 最大数据源)、

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、版本信息与许可表述均核实自一手来源:gnomAD 官方统计页(broad.io/gnomad_stats)、gnomAD v4 主论文(medRxiv 2026-03, DOI 10.64898/2026.03.23.26349081)、AWS Open Data Registry 的 gnomAD 条目、gnomAD 下载页与 gnomad_methods 仓库,以及四篇里程碑论文(Lek 2016 Nature 536、Karczewski 2020 Nature 581、Collins 2021 Nature 591、Chen 2024 Nature 625)。检索核实时间为 2026-09-19。

gnomAD 的数字口径与版本耦合紧密(v2/v3/v4 样本集与坐标均不同),本页在各处显式标注「版本 + 口径」;官方统计页与论文快照存在时间差时以论文口径为准并注明。本页为技术参考文档,不构成临床诊断依据——gnomAD 频率只是变异解读的证据维度之一,临床分级须按 ACMG/AMP 框架结合分离分析、功能实验等综合判定(§5.2)。

关于数据人群:gnomAD 的 ancestry 构成严重偏斜(非芬兰欧洲 NFE 占 77.07%),对非欧洲人群的频率估计与约束推断天然受限,本页在 §2.5 与 §7.4 讨论其对 AI 与临床外推的影响。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:人类遗传变异的「频率与约束参考标准」——80 万+ 人测序的聚合统计库,回答「这个变异在人群里有多常见、它所在基因对功能缺失突变有多敏感」。
  • 体量:约 9.09 亿短变异(SNV+InDel)+ 120 万结构变异;sites-only——无个体基因型。
  • 版本:v4.1(2024-05,GRCh38)现行;v2(GRCh37)在临床过滤与 chrX/Y 约束上仍被广泛引用——版本选择本身就是第一坑(§3.7)。
  • 访问:免注册、免费、CC0——浏览器点选、GraphQL API、云存储直下,全球最「零门槛」的大规模基因组资源。
  • 旗舰指标:LOEUF(基因功能缺失约束)、FAF95(频率置信上限)、grpmax(最大 ancestry 组频率)。
  • 适用:ACMG 变异过滤、罕见病诊断的频率排除、基因约束优先级、SV 背景频率、AI 模型频率特征。
  • 不适用:个体级基因型-表型关联(用 UKB/队列数据)、体细胞突变频率(用 TCGA/PCAWG)、非欧洲人群的精确频率推断(ancestry 偏斜,§2.5)。

§1.1 摘要

2016 年,一个原本为了疾病研究而聚合的 6 万外显子组数据库(ExAC)意外成为医学遗传学的支柱设施:研究者们发现,把各家疾病研究里「对照组」的测序数据聚合成一个统一处理的人群频率库,能让「这个变异是否罕见到值得怀疑」从拍脑袋变成查表——单这一件事就消灭了变异解读文献里一大类假阳性。这个思路的延续体就是 gnomAD:到 v4.1,它聚合了 807,162 人的测序数据,覆盖约 9.09 亿短变异与 120 万结构变异,是全球变异解读事实上的频率标准源。

对 AI 团队,gnomAD 的价值在三个维度:

  1. 变异过滤的自动化基座:ACMG/AMP 指南的 BA1(AF>5% 即良性)、BS1/BS2 证据都以 gnomAD 频率为量化标准——任何变异分级流水线的第一步都是查 gnomAD,API 化后就是一行调用。
  2. 约束度量的特征供给:LOEUF、错义 Z、区域约束把「基因对 LoF 突变的敏感程度」变成连续特征——基因优先级、变异致病性预测(EVE、AlphaMissense 类模型)的关键输入。
  3. 群体遗传学的规模极限:9 亿变异 × 80 万人的聚合频谱让突变率、选择系数、人群历史的统计推断达到前所未有的精度(2026 年 PIES 方法用 v4 数据估计精子的选择热点)。

架构上必须先说清的一点:gnomAD 是 sites-only——它发布每个变异位点的聚合统计(多少人携带、什么频率、什么质量),不发布任何个体的基因型与表型。这使它成为隐私风险最低的基因组大资源,也决定了它「能做什么/不能做什么」的边界(§1.6、§7)。

§1.2 战略价值

  1. 临床变异解读的标准参照:ic-value}

  2. 临床变异解读的标准参照:ClinGen/ClinVar/ACMG 生态的频率证据源;诊断实验室的过/ClinVar/ACMG 生态的频率证据源;诊断实验室的过滤流水线(无论自研还是商业)都以 gnomAD 为默认频率库——接入它等于接入行业标准的「共识层」。

  3. 开放度的天花板:CC0 + 免注册 + 双云分发 + GraphQL API——对比 dbGaP 类受控资源数月的申请周期,gnomAD 是唯一可以「今天想到、今天用上」的 80 万人级基因组资产;这也使它成为教学、原型验证、方法论文的默认数据源。

  4. 罕见病基因发现的漏斗上游:v4 主论文的 DisPo 评分(约束强 × 临床表征少 → 发现潜力高)把「下一个致病基因在哪」变成可排序的清单——对基因发现团队是路线图,对药物研发是靶点学证据。

  5. 方法学的公共战场:从 pLI 到 LOEUF、从 NMD 预测到 LoF 管线的 90% 精度,gnomAD 每一次指标升级都会重塑变异解读工具链——盯住它的 release 就是盯住行业标准的演进。

§1.3 同类数据集横向对比

资源 定位 规模 与 gnomAD 的关系
gnomAD 变异频率 + 约束(聚合) 807,162 人 / 9.09 亿短变异 —
ExAC gnomAD 前身 60,706 外显子组 仍被旧文献引用;v2 已含其全部样本
UK Biobank 个体级队列(可关联) 503,317 人 / WGS 490,640 gnomAD v4 的最大数据源(416,555 exomes);个体级分析去 UKB
16,555 exomes);个体级分析去 UKB
1000 Genomes 参考面板 2,504 人 深度有限;gnomA
dbSNP 变异存在性目录 10 亿+ rsID 只回答「存在」,不回答「多常见」
ClinVar 致病性注释 数百万提交 下游消费者:用 gnomAD 频率做良性证据
TOPMed/ NHLBI 心肺血液队列(受控) 数百万人 WGS 个体级+受控;频率口径与 gnomAD 互补
CKB/ChinaMAP 亚洲人群频率 数万-51 万 非欧洲频率的对照源(gnomAD 偏斜的补位)
TCGA/PCAWG 体细胞突变 万级肿瘤 不同范畴:体细胞 vs 胚系;v4 明确不含 TCGA

§1.4 版本时间轴

2014-2016  ExAC 聚合(60,706 exomes;Nature 537 宣告 + 536 分析论文)
2019-05    gnomAD v2 发布(141,456 = 125,748 exomes + 15,708 genomes;GRCh37)
2020-04    v2 constraint 主论文(Karczewski Nature 581:434-443;LOEUF 取代 pLI)
2021-05    gnomAD-SV(Collins Nature 591:444-451;结构变异参考图谱)
2022-10    v3.1.2(76,156 genomes only;GRCh38;非编码约束基础)
2024-01    v3 constraint 论文(Chen Nature 625:92-100;基因组约束地图)
2023-11    v4.0(807,162 = 730,947 exomes + 76,215 genomes;并入 UKB exomes)
2024-05    v4.1(修正 v4.0 AN 低估——稀有 AF 高估 5-10%;新增 joint callset;SV 更新)
2026-03    v4 主论文(730,947 exomes;LoF 管线 90% 精度;DisPo 评分;medRxiv)

§1.5 应用场景矩阵

  1. 临床变异分级:实验室自建 VCF → gnomAD 频率标注 → ACMG BA1/BS1/BS2 自动打分。
  2. 罕见病诊断排除:新发变异按 FAF95/grpmax 过滤——频率高于疾病最大可信频率(Whiffin 框架)即降级。
  3. 基因约束画像:候选基因清单 → LOEUF/错义 Z 排序 → 约束强的基因优先深挖(或按 DisPo 找空白)。
  4. SV 背景库:疑似致病 CNV → v4 SV 目录频率对照——「这个缺失在健康人里有多少」。
  5. AI 特征工程:变异/基因级频率与约束特征注入模型(见 §7 四喂法)。
  6. 群体遗传学推断:频谱 → 突变率/选择/人群历史(PIES、Roulette 类方法)。

§1.6 组件全景

gnomAD 的六个数据层:

  1. sites 层:v4.1 exome/genome/joint 三套 sites 表——每个变异的 AF/AC/AN(全人群 + 10 组 ancestry + 性别分层)、质量指标(RF/AS 管线标志)、VEP/LOFTEE 注释。
  2. SV 层:v4 SV callset(1,199,117 个)——缺失/重复/插入/倒位/复杂/易位,含各 ancestry 频率。
  3. 约束层:基因级 LOEUF、错义 Z、转录本级约束;区域级非编码约束(NDR,源自 v3 论文的 genome 口径)。
  4. coverage 层:exome coverage(v4.0 口径)与 genome coverage(v3.0.1 口径)——「这个区域没测到」与「这个区域没变异」的区分依据。
  5. mtDNA 层:线粒体变异频率(v3.1.2/v4 口径)——母系遗传与异质性分析用。
  6. 浏览器/API 层:variants/genes/transcripts/structural-variants/mitochondrial 页面 + GraphQL API——程序化接入的零门槛通道。

§1.7 零访问门槛的经济学

gnomAD 是大型基因组资源里唯一「零门槛」的:无申请费(对比 UKB £3,000+)、无 DAC 周期(对比 dbGaP 数月)、无注册(对比多数 biobank)——但它把成本转移到了别处:

  1. 计算成本自担:9 亿变异的 sites VCF 压缩后数百 GB 起,全量操作离不开 Hail/Spark 集群——「免费的数据 + 昂贵的计算」,预算进基础设施而非访问费。
  2. 版本管理成本:v2/v3/v4 不可互换(§3.7)——团队需要版本纪律,否则同一基因座在 v2 与 v4 的频率差异会直接进论文。
  3. 合规成本极低但仍存在:CC0 不等于无伦理约束——聚合数据的成员推断研究(从频率反推群体归属)在学界有争议,产品化使用前过一遍法务(§8)。

反面账:样本是「疾病研究 + 群体项目」的混合体而非人群抽样——特定基因座的频率可能被疾病队列过代表征抬高(如心肌病基因在心肌病研究富集样本里),官方为此提供 non-neuro/non-cancer 等子集口径——用对子集是使用者的责任。

§1.9 gnomAD 在临床诊断流程中的位置

把 gnomAD 放进一条典型罕见病诊断流水线,看它站在哪一环:

患者表型 + 家族史
  → 测序(WES/WGS)
  → 变异 calling(GATK 等)          ← gnomAD 的 QC 管线(gnomad_qc)是 calling 质控的参考实现
  → 变异注释(VEP + in-silico)       ← gnomAD sites 表自带 VEP/LOFTEE 注释可对照
  → ★ 人群频率过滤(FAF95/grpmax)    ← gnomAD 主战场:ACMG BA1/BS1/BS2 自动化
  → 约束画像(LOEUF/DisPo)           ← gnomAD 副战场:候选优先级排序
  → 疾病特异判级(ClinVar + 文献)    ← gnomAD 退出:判级是社区/临床层职责
  → 分离分析(家系验证)
  → 功能验证(实验)
  → 临床报告

三个工程要点:

  1. 频率过滤在注释之后、判级之前——它不产生最终结论,但决定哪 1% 的变异值得人工看——过滤层的假阴(误杀致病变异)是全流程最昂贵的错误,宁可多放 VUS 进人工队列。
  2. 约束画像与频率过滤并行而非串联——约束低不是放行理由,约束高也不是致病证据——两者都是排序先验,判级发生在疾病语境里。
  3. 版本一致性贯穿全流程——calling 参考实现、频率参照、约束指标应锁定同一 gnomAD 版本口径,混版本会让「同一变异」在不同环节拿到不同数字。

§2 医学与科学背景

§2.1 为什么「人群频率」是变异解读的第一道闸

人类基因组每代每碱基约 1.2×10⁻⁸ 的突变率意味着:任何两个人之间都有数百万个差异,其中绝大多数无害。变异解读的核心不对称是——致病突变稀有,但稀有突变不致病。频率因此成为最硬的初步证据:

  1. 隐性疾病的健康携带者:经典致病变异在人群中以携带者状态存在(如 CFTR ΔF508 频率约 2%)——「存在频率」不排除隐性致病;显性疾病则不同:高频率直接与致病性矛盾。
  2. BA1 的量化:ACMG/AMP 把「AF > 5%」设为良性独立证据(stand-alone)——一个变异只要在足够大的样本里常见到 5%,几乎不可能对任何显性早发疾病致病。
  3. 疾病最大可信频率:Whiffin 等提出 max-credible-AF 框架——给定疾病的患病率、遗传模式、外显率与等位异质性,可以算出「该疾病致病变异在人群中允许的最大频率」——AF 超过它即排除。这把「频率过滤」从固定阈值升级为疾病特异的推理。
  4. 大样本的意义:80 万人样本下,AF 的置信区间在常见变异上极窄、在超罕见变异(单例)上仍宽——「没见过」与「不存在」的区分要靠 FAF95(95% 置信频率上限)而非点估计。

§2.2 约束度量:从 pLI 到 LOEUF 的演进

「这个基因对功能缺失(LoF)突变有多敏感」是另一个正交维度:

  1. 原理:受强 purifying selection 的基因,观察到的 LoF 变异会远少于中性期望——observed/expected 比值成为约束的度量。
  2. pLI 时代:v2 论文用概率化 pLI(probability LoF intolerant)三分类(0.9 阈值)——简单但粗糙:高表达、短基因的误判率高。
  3. LOEUF:v2 constraint 论文引入的连续指标——LoF O/E 比值的 90% 置信上界(lambda 上界),分位数化后跨基因可比;LOEUF 低 = 强约束(对 LoF 敏感)= 更可能是显性致病基因。
  4. 错义 Z 与 MIS-Z:错义变异的 Z 检验约束——错义高度受限的基因(如离子通道)对错义致病变异敏感;v4 改进了对错义功能分级(高致错义)的整合。
  5. 区域约束:v3 论文(Chen 2024)把约束从基因推向全基因组——非编码区域的 NDR(约束区域)发现了启动子等调控元件的功能敏感性,是「基因组暗物质约束地图」。
  6. v4 的 LoF 管线:LOFTEE v1.1 + 学习基因组特征(NMD 预测、剪接影响)的新管线,LoF 真阳性判别精度 90%——约束的输入质量直接决定指标的可靠性,这是 v4 主论文最被低估的贡献。

§2.3 ExAC → gnomAD:聚合数据库的社会技术史

  1. 起源的意外性:ExAC 本是各疾病研究对照样本的聚合(2014-2016),发起者(MacArthur 实验室等)的原始动机是给自家变异过滤找参照——发布后迅速成为全行业参照,说明这是全行业的空白。
  2. 联盟化的 gnomAD:2018 年更名扩容,数据贡献从「顺便聚合」变成制度化的贡献协议(308 家机构)——聚合数据库成为一种新的科学生产方式:不采集数据,而是把碎片化数据标准化。
  3. UKB 的并轨:v4 直接纳入 UK Biobank 的 416,555 个外显子组(占总样本一半以上)——独立资源之间的并轨而非重建,是数据基础设施成熟期的标志动作。
  4. 与中国人群资源的关系:gnomAD 的 EAS(22,448)远不足以代表东亚人群变异谱——ChinaMAP、CKB、Taiwan Biobank 等本土库在东亚临床实践里是必要的互补参照,不是可选项。

§2.4 结构变异维度的补课

短变异之外,SV 的频率目录是 gnomAD 第二个支柱:

  1. 规模与难度:1,199,117 个 SV(缺失 627,947 / 重复 258,882 / 插入 296,184 / 倒位 2,185 / 复杂 13,116 / 相互易位 92)——SV calling 的假阳性率远高于 SNV,需要多工具(Manta/Canvas/gCNV 等)交叉与人工审校,v4 的 SV callset 在量与质上是公开资源的极限。
  2. 临床意义:CNV 是许多显性神经发育疾病的机制(如 22q11 缺失)——「这个 CNV 在 8 万基因组里的频率」直接决定它是复发型热点还是家庭特发。
  3. 方法学外溢:gnomAD-SV 的质控体系(Collins 2021)成为 WGS SV 分析的事实教程。

§2.5 ancestry 分层:为什么它既是功能也是局限

  1. 功能: founder effect 让某些变异在特定人群高频(如 ASJ 的 BRCA 185delAG、FIN 的芬兰遗产)——ancestry 分层频率(AF_popmax/grpmax)避免把「欧洲罕见」误判为「全人群罕见」。
  2. 局限的量化:v4 的 NFE 622,057(77.07%)vs MID 3,031——样本量差 200 倍,同一位点在 MID 的频率置信区间比 NFE 宽一个数量级;grpmax 的统计功效在小组上不可靠。
  3. 临床后果:非欧洲人群的变异过滤若直接套 gnomAD 全人群 AF,会因参照不足产生假阴性(把致病变异误判为「频率足够高而良性」的反向情形较少,但「没数据 → 误以为罕见 → 误判致病」更多)。
  4. v4 的改进与天花板:新增 MID 组、AFR 扩到 37,545(3 倍于 v2)、AMR 30,019——方向对、幅度仍不足;官方自己也把「提高多样性」列为持续目标(broad.io/gnomad_stats 的直白表述)。

§2.6 与 ClinVar/OMIM 的证据生态位

  1. 证据链分工:gnomAD(多常见)→ ClinVar(实验室/文献怎么判)→ OMIM(基因-疾病关系定论)——变异解读的三层证据栈;gnomAD 是最底层也最客观的一层(统计事实 vs 人工注释)。
  2. 反向污染的防范:ClinVar 里「VUS 误提交为致病」的条目若回流 gnomAD 过滤会造成循环论证——gnomAD 的聚合不使用 ClinVar 判级,保持独立。
  3. ClinGen 的标准化角色:基因-疾病有效性(gene-disease validity)框架消费 gnomAD 约束作为辅助证据。

§2.7 隐私设计:聚合发布的攻防

  1. sites-only 的天然保护:无个体基因型、无表型——传统的再识别攻击面不存在。
  2. 剩余风险:成员推断(membership inference)——已知某个体/家族的变异谱后,可在原理上推断其是否参与了贡献样本池;学界已有概念验证,gnomAD 官方以「聚合粒度 + 无表型」回应,风险被评估为低但非零。
  3. 组间频率的敏感性:极小 ancestry 组(如 MID 3,031)的频率本身携带群体信息——v4 发布时对小组频率有额外的统计约束(最小 AC 阈值过滤)。

§2.8 AI 视角的科学定位

对医疗 AI,gnomAD 的角色是「世界先验库」:人群里什么是常态(频率)、什么在功能上不可动摇(约束)——模型学到的任何「异常」判断,最终都要能对齐到这两个先验上。没有先验校准的模型会把多态当致病(假阳性)或把超罕见致病变异当噪声(假阴性)——§7 的四喂法就是把这两个先验工程化的方式。

§2.9 「可敲除基因」与药物靶点安全

gnomAD 最有商业价值的衍生概念是「人类可敲除基因」清单——健康人身上常见双等位 LoF 的基因集合:

  1. 清单构成:v2 论文识别出数千个「在至少一个健康个体上双等位 LoF 仍存活」的基因——它们证明:人类失去这个基因功能是可耐受的(至少短期)。
  2. 药物靶点白名单:药物抑制靶点若与可敲除基因重叠,人类遗传学层面提示「药理性抑制大概率不致命」—— PCSK9 是教科书案例:LoF 携带者低胆固醇且健康 → 抑制剂安全先验强 → 单抗/ siRNA 药物全线成功。
  3. 反向红线:强约束基因(LOEUF 极低)做抑制剂靶点时要问「完全敲除能不能活」——若不能,选择性/剂量/给药窗的容错极小,临床风险预算前置。
  4. 工程注意:可敲除 ≠ 无功能代价——清单来自「存活且未筛查深度表型」的个体;UKB 深表型与可敲除基因的关联分析(如某可敲除基因与代谢/免疫表型的微妙关联)是二代靶点评估的标准动作。
  5. 与 OMEGA 等计划的关系:系统性深表型的 LoF 携带者招募(如 UKB 全量 WGS + 域评估)正在把「可敲除但微妙代价」的灰区填实——gnomAD 约束是这类计划的筛选器。

这条链路(约束 → 可敲除 → 靶点安全)是逆向利用人群数据的范式:把「致病性视角下没用的低约束基因」变成「药物安全视角下的高价值信息」。

§3 数据集规格

§3.1 规格总表

维度 规格
当前版本 v4.1(2024-05)——exomes / genomes / joint 三套 sites
参考坐标 GRCh38(v2 为 GRCh37——不可互换,§3.7)
样本 807,162 无关个体(730,947 exomes + 76,215 genomes);非 UKB 子集 390,607
短变异 SNV 786,500,648 + InDel 122,583,462
功能计数 同义 9,643,254 / 错义 16,412,219 / 无义 726,924 / 移码 1,186,588 / 经典剪接 542,514
SV 1,199,117(DEL 627,947 / DUP 258,882 / INS 296,184 / INV 2,185 / CPX 13,116 / RECIP 92)
性别 406,265 XX / 400,897 XY
ancestry NFE 622,057 / SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031
贡献面 308 家机构 / 100+ 研究 / 25+ 国
文件形态 sites-only VCF(.vcf.bgz + tbi)、Hail Table(.ht)、TSV、coverage 表、约束表、浏览器数据
注释栈 VEP + LOFTEE v1.1(LoF 判别精度 90%)+ 区域约束 NDR
许可 数据 CC0 1.0;代码 MIT;引用请求不强制

§3.2 v4 样本组成与 UKB 关系

  1. 总量分解:807,162 = 非 UKB(314,392 exomes + 76,215 genomes = 390,607)+ UKB exomes 416,555——UKB 占比 51.6%。
  2. non-UKB 子集的意义:UKB 样本的疾病谱与英国人群绑定——做 ancestry 均衡分析时官方提供 non_ukb 子集口径(分组统计更平衡)。
  3. v4 genomes 的独立性:76,215 genomes = v3 的 76,156 样本用更新管线重处理(非新增样本)——「v4 基因组比 v3 多了什么」的答案是「更好的管线」而非「更多样本」。
  4. 样本重叠纪律:v2 与 v3 样本重叠约 81%——跨版本 meta 分析必须在样本 ID 层去重,否则频率被重复计数污染。

§3.3 DAIMS 数据AI就绪度评估

维度 D 数据完整性 评分 说明
D1 变异覆盖 9/10 外显组近全 + 全基因组非编码;exome 区外依赖 genome 口径
D2 注释完整度 9/10 VEP+LOFTEE+约束官方预计算;第三方注释(ClinVar 等)需自行 join
D3 频率分层 8/10 10 组 ancestry × 性别 + grpmax/FAF95;小组 CI 宽
D4 质量透明度 9/10 QC 标志全公开 + coverage 表 + QC 论文/仓库
A1 机器可读 9/10 Hail Table 原生 + VCF/TSV + GraphQL API
A2 文档完备 8/10 下载页/FAQ/教程齐全;schema 变更需读 release notes
A3 接入成本 10/10 免注册 + 双云公共桶——业界最低门槛
A4 更新机制 7/10 年度级大版本;joint/SV 增量不同步发布
I1 指标标准化 8/10 LOEUF/FAF95/grpmax 有定义论文;pLI 等旧指标迁移需注意
I2 可复现性 9/10 QC 管线(gnomad_qc)开源,从原始数据可复算
M1 多模态对齐 6/10 无表型——「多模态」只能与外部资源靠基因座 join
M2 时间序列 5/10 release 间可比性有限(管线变更混在样本变化里)
S1 样本安全 10/10 sites-only 聚合——隐私攻击面最小
S2 合规负担 10/10 CC0 + 无 DAC——合规成本近零

总分:A 级(AI 就绪度最高的基因组资源之一——限制主要来自「无表型」的范畴边界而非数据质量)

§3.4 存储与计算需求

数据件 体量 最小分析环境
v4.1 exomes sites Hail Table ~2 TB Hail/Spark 集群(16 核 + 64GB 起步可行)
v4.1 genomes sites Hail Table ~3 TB 同上
v4.1 joint sites 更大 大集群(如 Terra/DNAnexus 按需)
sites-only VCF(bgz+tbi) 数百 GB/套 tabix 抽取即可,不用 Hail
SV sites ~50 GB 单机可跑
约束表/coverage/mtDNA 数十 GB 单机 pandas 足够

实操分工:单基因/单变异查询走浏览器/API;批量注释走 sites VCF + tabix;全基因组级统计才动用 Hail 集群——大部分项目其实不需要第三档。

§3.5 获取通道

  1. 浏览器:gnomad.broadinstitute.org——variants/genes/transcripts/structural-variants/mitochondrial/coverage 六类页面;人类可读但不宜做批量源。
  2. GraphQL API:https://gnomad.broadinstitute.org/api——单变异/单基因程序化查询;无配额限制但请礼貌节流。
  3. Google Cloud:gs://gcp-public-data--gnomad/(公共桶,主要分发点)——Hail Table/VCF/TSV 全格式;Terra 平台可直接挂载。
  4. AWS Open Data:s3://gnomad-public-us-east-1/——aws s3 ls --no-sign-request 免账号访问;AWS Registry 官方条目。
  5. 约束与辅助表:LOEUF/错义 Z/区域约束/coverage 单独下载——多数 AI 特征工程只用到这一档(GB 级)。

§3.6 口径对齐表

gnomAD 数字在不同文档里的口径差异(引用前对齐):

数字 出处口径 澄清
807,162 v4 总样本(broad.io 统计页) = 730,947 exomes + 76,215 genomes
730,947 v4 外显子组(v4 论文标题口径) 含 UKB 416,555
76,215 v4 基因组 = v3 76,156 重处理 + 少量补充
390,607 非 UKB 子集合计 314,392 exomes + 76,215 genomes
~9.09 亿 v4 短变异总数 SNV 7.87 亿 + InDel 1.23 亿
1,199,117 v4 SV genome 口径
141,456 v2 总样本(2020 论文) GRCh37——与 v4 样本重叠 ~81%(对 v3)

§3.7 版本选择决策

版本是 gnomAD 使用的第一决策(不可互换):

版本 坐标 样本 用它当 别用它当
v2.1.1 GRCh37 125,748 ex + 15,708 ge LOEUF v2(临床最常引用)+ chrX/Y 约束 + GRCh37 原生管线 现代频率过滤(样本小);GRCh38 管线
v3.1.2 GRCh38 76,156 genomes 非编码区域 + mtDNA 频率 外显子过滤(无 exomes)
v4.1 GRCh38 807,162 默认首选:频率过滤/FAF95/grpmax/joint chrX/Y 约束(未发布);TCGA 关联(无 TCGA)

liftover 陷阱:v2(GRCh37)lift 到 GRCh38 与 v4 原生在约 0.5-1% 位点表示不一致(assembly 修复)——跨版本比对变异要在等位表示层(locus+alleles)而非坐标层对齐。

§3.8 频率指标定义对照表

gnomAD 频率相关指标的精确定义与适用场景——每一个都有明确的「何时用/何时别用」:

指标 定义 适用 别用在
AF AC/AN 点估计 描述性统计;隐性携带频率 显性疾病过滤的判级依据
AC / AN 等位计数 / 总等位数 样本量核算;CI 手算 直接当频率用
ac_hom 纯合个体计数 隐性疾病 BS2;隐性携带者频率 显性疾病(纯合存在即反常)
AF_popmax 旧版最大人群频率(v2 术语) v2 语境的 founder 检查 v4 分析(术语已换)
grpmax v4 最大 ancestry 组频率 founder 检查(现行) 与 popmax 数值直接混用(组定义有变)
FAF95 95% 置信频率过滤上界 显性疾病过滤;PM2「absent」表述 描述「平均频率」(它是上界不是估计)
FAF99 99% 置信上界 更保守的过滤场景 常规判级(过严)
LOEUF LoF O/E 的 90% CI 上界(分位) 基因约束画像;优先级排序 单基因「约束绝对值」的精确解读(分位才可比)
pLI 旧概率化 LoF 不耐受 对照旧文献 新分析(已被 LOEUF 替代)
错义 Z 错义约束 Z 统计 错义机制基因识别 LoF 机制判断
NDR 非编码约束区域 非编码变异功能先验 编码区判级

三条使用纪律:① 显性疾病场景的「频率判断」永远以置信上界(FAF95)表达,不使用点估计;② 跨 ancestry 判读永远查最大组口径(grpmax),全人群 AF 只做参考;③ 约束指标引用必须带版本(v2 LOEUF 与 v4 口径不可比——样本与 LoF 管线都变了)。

§4 数据结构

§4.1 云存储目录形态

gs://gcp-public-data--gnomad/release/
├── 4.1/
│   ├── ht/exomes/gnomad.exomes.v4.1.sites.ht/        # 外显子 sites Hail Table
│   ├── ht/genomes/gnomad.genomes.v4.1.sites.ht/      # 基因组 sites Hail Table
│   ├── ht/joint/gnomad.joint.v4.1.sites.ht/          # exome+genome joint(v4.1 新增)
│   ├── vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz   # sites VCF(.tbi 索引)
│   ├── vcf/genomes/...                                # 同上(genome 口径)
│   ├── sv/gnomad.v4.1.sv.sites.vcf.bgz               # SV callset
│   ├── coverage/exomes/gnomad.exomes.v4.0.coverage.ht
│   └── joint/annotations/...                          # joint 注释
├── 4.0/                                               # v4.0(勿用——AN 低估缺陷)
├── 3.1.2/ht/genomes/gnomad.genomes.v3.1.2.sites.ht/  # 非编码/mtDNA 用
└── 2.1.1/                                             # GRCh37(LOEUF v2 / chrX/Y)
resources/                                              # 约束表、参考文件

AWS 镜像:s3://gnomad-public-us-east-1/release/...(结构对齐,--no-sign-request 访问)。

§4.2 sites Hail Table 字段结构

v4 sites 表的核心字段(Hail 结构体嵌套):

  1. 主键:locus(contig/position)+ alleles(ref/alt 数组)——变异的规范表示。
  2. 频率:freq(结构体数组)——每组 ancestry × 性别的 AC/AN/AF/homozygote 计数;grpmax(最大组标识与频率);faf(频率过滤置信:FAF95/FAF99,按 ancestry)。
  3. 质量:quality_metrics(allele_size、BaseQRankSum、MQ 等)+ flags(lcr/mnp/segdup/inbreeding_comp 等 QC 标志)+ rf_tp_probability(随机森林真阳性概率)。
  4. 注释:vep(Consequence、IMPACT、Gene、HGVSc/p、CLIN_SIG 等)+ lof(LOFTEE:consequence/flags/annotation)+ in_silico(cadd/revel/spliceai 摘要)。
  5. 约束上下文:joint 表附 transcript_consequence 与 gene 级 lof.oe/lof.oe_ci_upper(LOEUF 组件)。

§4.3 GraphQL API 查询

#!/usr/bin/env python3
"""gnomAD GraphQL API 单变异/单基因查询(免注册)。"""
import requests

API = "https://gnomad.broadinstitute.org/api"

def query_variant(variant_id: str) -> dict:
    """按 gnomAD 变异 ID 查询(如 1-55516888-G-A,GRCh38)。"""
    q = """
    query ($variantId: String!) {
      variant(dataset: gnomad_r4, variantId: $variantId) {
        variantId referenceGenome
        exome { ac an af ac_hom faf95 grpmax { af ancestry } }
        genome { ac an af ac_hom faf95 grpmax { af ancestry } }
        transcripts { consequence geneId geneSymbol hgvsp lofteeFlags }
      }
    }"""
    r = requests.post(API, json={"query": q, "variables": {"variantId": variant_id}},
                      timeout=30)
    r.raise_for_status()
    return r.json()["data"]["variant"]

def query_gene(gene_symbol: str) -> dict:
    """基因级约束查询(LOEUF 等)。"""
    q = """
    query ($gene: String!) {
      gene(geneSymbol: $gene, referenceGenome: GRCh38) {
        geneSymbol
        gnomadConstraint { lo loeuf pLI misZ oeLofUpper }
      }
    }"""
    r = requests.post(API, json={"query": q, "variables": {"gene": gene_symbol}},
                      timeout=30)
    r.raise_for_status()
    return r.json()["data"]["gene"]

if __name__ == "__main__":
    print(query_variant("1-55516888-G-A"))
    print(query_gene("PCSK9"))

注意 dataset: gnomad_r4(v4)与 gnomad_r2_1(v2)的切换——API 的 dataset 参数即版本选择。

§4.4 批量频率注释(tabix 路线)

#!/usr/bin/env bash
# 用 sites VCF + tabix 给自有 VCF 批量加 gnomAD 频率(不依赖 Hail)
# 1) 下载 v4.1 exome sites VCF(AWS 免账号)
aws s3 cp --no-sign-request \
  s3://gnomad-public-us-east-1/release/4.1/vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz .
aws s3 cp --no-sign-request \
  s3://gnomad-public-us-east-1/release/4.1/vcf/exomes/gnomad.exomes.v4.1.sites.vcf.bgz.tbi .

# 2) 抽取自有变异所在的位点窗口(假设 my.vcf.gz 已 bgzip+tabix)
bcftools annotate \
  -a gnomad.exomes.v4.1.sites.vcf.bgz \
  -c INFO/AC,INFO/AN,INFO/AF,INFO/FAF95,INFO/grpmax_af \
  -h gnomad_header.hdr my.vcf.gz -Oz -o my.gnomad.vcf.gz

# 3) 提取 BA1 候选(AF >= 5%)
bcftools view -i 'INFO/AF[0] >= 0.05' my.gnomad.vcf.gz -Oz -o my.ba1.vcf.gz

§4.5 Hail 批量处理(全表级)

#!/usr/bin/env python3
"""Hail 读取 v4.1 sites 表:提取某基因的错义变异 + 频率 + 约束上下文。
适用 Terra/DNAnexus/自建 Spark 集群。"""
import hail as hl

hl.init()  # 集群初始化

ht = hl.read_table("gs://gcp-public-data--gnomad/release/4.1/ht/exomes/gnomad.exomes.v4.1.sites.ht")

# 1) 按基因抽取错义(VEP 注释展开)
ht = ht.select(
    vep=ht.vep,
    freq=ht.freq,
    grpmax=ht.grpmax,
    faf95=ht.faf[0].faf95,
)
mis = ht.explode(ht.vep.transcript_consequences)
mis = mis.filter(
    (mis.vep.transcript_consequences.gene_symbol == "PCSK9")
    & (mis.vep.transcript_consequences.consequence_term.contains("missense_variant"))
)
# 2) 输出:坐标 / HGVSp / 全人群 AF / grpmax / FAF95
mis.select(
    hgvsp=mis.vep.transcript_consequences.hgvsp,
    af=mis.freq[0].af,
    grpmax=mis.grpmax.af,
    grpmax_pop=mis.grpmax.ancestry,
    faf95=mis.faf95,
).export("gs://my-bucket/pcsk9_missense_v4.tsv")

§4.6 SV 与 mtDNA 抽取

#!/usr/bin/env python3
"""SV 频率对照:CNV 致病性判读前的健康人频率查询(SV sites VCF)。"""
import subprocess

def query_sv_region(chrom: str, start: int, end: int) -> str:
    """用 tabix 查 SV 区域重叠记录(v4 SV callset)。"""
    cmd = ["tabix", "gnomad.v4.1.sv.sites.vcf.bgz", f"{chrom}:{start}-{end}"]
    return subprocess.run(cmd, capture_output=True, text=True).stdout

# 例:22q11.21 微缺失热点区域
rows = query_sv_region("chr22", 18900000, 21450000)
for line in rows.splitlines():
    fields = line.split("\t")
    svtype = [f for f in fields[7].split(";") if f.startswith("SVTYPE")]
    af = [f for f in fields[7].split(";") if f.startswith("AF=")]
    print(fields[0], fields[1], svtype, af)

§4.7 元数据与版本指纹

  1. release notes 必读:每个版本的 schema 变更(如 v4 的 grpmax 术语、v4.1 的 AN 修正)记录在下载页与 blog——管线变更混在样本变化里,是口径漂移的主源。
  2. 数据指纹:分析锁定版本字符串(如 gnomad.exomes.v4.1)+ 下载日期 + 文件大小/md5——写在复现包里。
  3. gnomad_methods 资源抽象:from gnomad.resources.grch38 import gnomad——官方 Python 包封装了全版本路径(CURRENT_* 常量),升级版本只改常量。

§4.8 完整性清单

  • [ ] 版本与坐标明确(v4.1 + GRCh38?v2.1.1 + GRCh37?)
  • [ ] 子集口径(全量 vs non_ukb/non_neuro/non_cancer——UKB 主导的偏斜是否影响结论)
  • [ ] 频率指标选择(点估计 AF vs FAF95 vs grpmax——显性疾病过滤用 FAF95)
  • [ ] coverage 对照(变异「不存在」的区域是否测到了——exome coverage v4.0)
  • [ ] LoF 判定的 LOFTEE 标志(end_truncated/ancient 等假阳性标志过滤)
  • [ ] SV 分析的多工具交叉背景(单工具 CNV 不作为唯一证据)
  • [ ] QC 标志过滤策略(segdup/lcr 区域的变异降权)
  • [ ] 版本指纹与下载日期写进复现包

§4.9 数据血缘

原始测序(308 家机构,WES/WGS,去标识化)
  → 统一预处理(GATK/BWA;CRAM;QC: sex check、contamination、relatedness、ancestry inference PCA)
  → 联合调用(GATK HaplotypeCaller gVCF → joint genotyping;v4.1 另有 exome+genome joint)
  → 变异级 QC(随机森林过滤 VQSR 补充; AS/RQ 管线)
  → 功能注释(VEP + LOFTEE v1.1 + in-silico 摘要)
  → 频率与约束计算(freq/faf/grpmax;LOEUF/错义 Z/区域 NDR)
  → 分发(Hail Table / sites VCF / TSV → GCS 公共桶 + AWS + 浏览器 + GraphQL)

使用者拿到的每一层都是上游全链开源(gnomad_qc 仓库)的可复算产物——这是 gnomAD 与多数「黑盒聚合」资源的本质区别。

§4.10 浏览器页面结构速查

浏览器六类页面的内容地图(人类查询路径,程序化批量请走 API/云存储):

  1. Variant 页:坐标/等位输入 → 频率表(全人群 + 各 ancestry + 性别)、质量图表(AB/MQ/DP 分布)、VEP/LOFTEE 注释、ClinVar 状态、附近变异列表——单变异尽调的标准入口。
  2. Gene 页:约束三件套(LOEUF/错义 Z/pLI 历史值)+ 区域约束 + 该基因全部变异的频率-功能散点——基因画像页。
  3. Transcript 页:转录本特异注释(临床过滤必须按转录本——同一变异在不同转录本后果不同)。
  4. Structural Variant 页:SV 类型/大小/频率分布 + 断点可视化——CNV 判读入口。
  5. Mitochondrial 页:mtDNA 变异频率、单倍群分布、异质性统计。
  6. Coverage 页:exome/genome 覆盖深度查询——「没测到」的解释器。

页面数据与云存储同源(同一 release 管线产出)——浏览器结论可以引用,但批量任务不要爬页面(有 API 且 Cloud Storage 更规范)。

§5 下游分析协议

§5.1 任务×资源速查表

任务 用哪个数据件 关键指标 陷阱
显性疾病变异过滤 v4.1 sites FAF95 / grpmax / max-credible-AF 用点估计 AF 而非 FAF95 → 罕见致病被漏放
隐性疾病携带者频率 v4.1 sites AF + ac_hom(纯合计数) 忽视 ac_hom → 低估隐性风险
基因约束优先级 约束表 / API LOEUF 分位 / 错义 Z / DisPo v2 LOEUF 与 v4 混用
CNV 致病性判读 v4 SV 区域频率 + 工具交叉 单工具 calling 当证据
非编码变异评估 v3.1.2 genome / NDR 区域约束 用 v4 exome 口径看非编码(覆盖不足)
chrX/Y 变异 v2.1.1 伪常染色体区特殊规则 v4 无 chrX/Y 约束——混版本
mtDNA v3.1.2 / v4 mtDNA 异质性/单倍群 与核基因频率体系混淆
AI 特征工程 约束表 + sites TSV LOEUF/错义 Z/AF 特征未按 ancestry 分层泄漏

§5.2 ACMG 频率证据的工程化协议

把 ACMG/AMP 的频率相关证据变成可复算规则:

  1. BA1(stand-alone benign):AF ≥ 5%(全人群或任一 ancestry)——注意用 max 口径(grpmax)防止「欧洲主导稀释」漏判。
  2. BS1(strong benign):AF 超过疾病 max-credible-AF(Whiffin 框架:患病率/遗传模式/外显率/等位异质性四参数)——每个疾病一张参数表,工程上做成配置文件。
  3. BS2(moderate-strong benign):健康成年人纯合(ac_hom)且疾病表型为显性早发——用 ac_hom 字段直查。
  4. PM2(absent/rare supporting):FAF95 = 0 或 AF < 疾病阈值——v4 起 PM2 的「absent」建议改用 FAF95=0 表述(点计数「absent」在大样本下置信度不足)。
  5. 组合纪律:频率证据只覆盖良性方向——「罕见」不能作为致病证据的实质支撑(PM2 仅 supporting),防止频率过滤器变成「越罕见越致病」的错误自动化。
  6. 留痕:每次判级记录 gnomAD 版本、字段快照(AF/FAF95/grpmax/ac_hom 原值)——版本升级后判级可复算。

§5.3 基因约束画像协议

  1. 取数:约束表(LOEUF 分位、错义 Z、区域约束)+ DisPo 评分(v4 论文)按基因 join。
  2. 分层解读:LOEUF 分位 < 10%(强约束)→ 显性机制候选高发区;> 90%(无约束)→ 隐性/温和表型/非编码机制——无约束 ≠ 无功能。
  3. 短基因与低表达校正:LOEUF 在短基因上 CI 宽——用 oE CI 宽度列做「可信度过滤」而非只看点估计。
  4. 空白点识别:constraint 高 + OMIM 无收录 + ClinVar 无 LoF 致病 → DisPo 高分——v4 论文显示这类基因富集胚胎致死/生育表型(难以在人类观察到的类别)。
  5. 输出形态:基因 × (LOEUF, misZ, DisPo, ClinVar 状态, OMIM 状态) 五列 TSV——下游优先级排序的标准输入。

§5.4 SV 致病性判读协议

  1. 频率对照:自有 calling 的 CNV 与 v4 SV callset 区域重叠——频率 > 1/1000 且健康 → 强烈良性信号。
  2. 工具交叉:v4 SV 是多工具集成 + 人工审校——自有单工具(如纯 Manta)的 DEL/DUP 在判读时降权。
  3. 复杂 SV:CPX 类(13,116 个)需要完整断点对齐——断点不清的「半重叠」不做频率推断。
  4. 批次感知:SV calling 的平台敏感性(short-read 对 INS/INV 检出弱)——「v4 没有这个 SV」≠「不存在」,对 INS 尤其如此。

§5.5 成本模型

场景 技术路线 成本量级
单基因/位点查询 浏览器 / GraphQL 零(人力分钟级)
面板级批量注释 sites VCF + tabix + bcftools 单机数小时;云存储费用 < $10
全外显组频率统计 Hail(Spark 集群) 云计算数十至数百美元
全基因组级 + joint Terra/DNAnexus 按需集群 数百至数千美元
约束特征(AI 用) 约束表 TSV + pandas 几乎零(GB 级下载)

gnomAD 的「免费」只对数据成立——把 9 亿变异玩转的计算预算要写进立项书(§1.7)。

§5.6 失败模式清单

  1. 版本混用:v2 的 LOEUF 配 v4 的频率写进同一篇论文——审稿人一票否决级错误。
  2. AF vs FAF95:显性疾病过滤用点估计——单例变异 AF=0 被当「absent」,实际 FAF95 可能 1e-5(80 万人样本的下限粒度)。
  3. grpmax 忽视:用全人群 AF 判「不常见」,某 ancestry 组实际 2%——founder 变异漏判。
  4. coverage 盲区:exome 未覆盖区域「无变异记录」被当「无变异」——coverage 表是必查项。
  5. LOFTEE 标志忽视:end_truncated/ancient 变异混入 LoF 计数——约束相关分析全盘偏斜。
  6. 子集错配:用 non_ukb 口径对比文献的全量口径——UKB 占 51.6%,两个口径差异不可忽略。
  7. liftover 假设:v2 GRCh37 lift 后与 v4 直接比——0.5-1% 位点表示差异造成假性「新变异」。
  8. API 拉取无节流:万级变异逐条 GraphQL——被封禁或超时;批量场景换 VCF/Hail。

§5.7 校准与验证协议

频率过滤系统的验证有固定套路——照抄 AC/AN 表不算完成:

  1. 金标准集:从 ClinVar 抽「明确良性(2 星 + 且 AF 高)」与「明确致病(2 星 + 且 P/LP)」两组变异——过滤系统对良性组应全放行(放行 = 判良性)而对致病组零误杀。
  2. 边界行为:人为构造 FAF95 恰好在疾病阈值附近的变异——系统判级应输出「边界」而非硬切;边界案例的人工升级路径要写进 SOP。
  3. ancestry 分层复验:同一金标准按 ancestry 分组跑——非欧洲组的误杀率应与 NFE 组同数量级;超差说明 grpmax/小组 CI 处理有缺陷。
  4. 版本回归:v4.1 → 未来 v5 升级时,用冻结的金标准集重跑——判级漂移率是升级验收指标(漂移大说明过滤逻辑绑死了版本实现细节)。
  5. 对抗样本:LOFTEE 高标志变异、segdup 区变异、liftover 变异三类「已知陷阱」样本的过滤行为——每一类都有预期输出,防止系统对边缘输入静默出错。

验证产出物是「过滤系统模型卡」:版本指纹 + 金标准表现 + 分层报告 + 已知局限——临床落地前的 QA 依据。

§6 实证结果与方法学分析

§6.1 v2 constraint 论文(2020):约束度量的定标

Karczewski et al. Nature 581:434-443(141,456 人)的核心交付:

  1. LOEUF 替代 pLI:连续化、CI 显式化——同一基因在两指标下的排序差异显著(尤其高表达短基因),文献里引用 pLI 的旧结论迁移时要重查。
  2. 人类基因的「可敲除清单」:约 3,000+ 基因常见双等位 LoF(双纯合健康)——「人类可失去的基因」清单成为药物靶点安全性评估的正面参照(OMG 类靶点)。
  3. 错义 Z 的分组现象:错义约束强的基因富集离子通道/受体——错义致病机制基因的先验指纹。

§6.2 v3 约束地图(2024):从基因到全基因组

Chen et al. Nature 625:92-100(76,156 genomes):

  1. 区域约束 NDR:非编码区域的约束地图——启动子/剪接调控区在 NDR 里富集,为非编码变异(占 GWAS 命中 90%+)提供功能先验。
  2. 突变率模型基础:区域约束依赖可靠的 context-dependent 突变率模型(chMETHYLE/上游工作)——突变率估计误差直接传导进约束。
  3. genome vs exome 的互补:v3(全基因组)与 v2/v4-exome(外显子)构成两个口径——非编码问题必须走 genome 口径。

§6.3 v4 主论文(2026):LoF 管线与 DisPo

medRxiv 2026-03(730,947 exomes)的三件套:

  1. 新 LoF 管线:从选择信号学习基因组特征(NMD、剪接)预测 LoF 真伪——90% 精度(旧 LOFTEE 在边界 case 上假阳性多);LoF 约束的输入质量跃升。
  2. DisPo 评分:约束(强)× 文献表征(少)→ 贝叶斯框架输出基因发现潜力——高分基因富集胚胎致死/生育表型;基因发现从「大海捞针」变成「排序捞针」。
  3. 规模-功效曲线:约束检测功效随样本量继续上升(未饱和)——意味着 v5 还会有新基因浮现,约束表要跟着 release 更新。

§6.4 方法学三层框架(gsm)

理解 gnomAD 任何指标的三层框架:

  1. G(Genotype layer):80 万人 × 变异的携带状态聚合(AC/AN/ac_hom)——统计事实层。
  2. S(Selection layer):约束/选择系数的推断(LOEUF/PIES)——模型推断层,依赖突变率模型与人群历史假设。
  3. M(Medical layer):临床判级规则(ACMG 证据/max-credible-AF)——医学决策层,依赖疾病参数表。

三层各自独立可错——审稿时先问「这结论在第几层」。

§6.5 接力实验设计

  1. 频率发现 → 功能验证:gnomAD 找到「约束强但 VUS 密集」的基因 → 深表型队列(UKB/MIMIC)找关联表型 → 细胞实验验证机制。
  2. DisPo → 疾病队列:DisPo 高分基因 → 罕见病队列(受控 dbGaP 资源)定向检索 → 分离分析确认。
  3. 约束 → 药物安全:人类「可敲除基因」清单 → 靶点安全性白名单——反向利用 LoF 不耐受。

§6.6 八个真实坑点

  1. 坑点 1:版本静默混用——v2 LOEUF + v4 AF 同文混写;LOEUF、AF、坐标三要素必须同一版本。
  2. 坑点 2:AF=0 当「absent」——80 万人样本的「没见过」要写 FAF95(如 1.4e-5)而非 0;PM2 判级按 v4 建议改 FAF95=0 表述。
  3. 坑点 3:grpmax 漏查——founder 变异在某组 2%、全人群 0.1%——只查全人群 AF 会放行假良性/假致病各一例。
  4. 坑点 4:coverage 盲区当阴性——exome 未覆盖区域无记录 ≠ 无变异;先查 v4.0 exome coverage。
  5. 坑点 5:UKB 过代表征——v4 含 416,555 UKB exomes,英国人群绑定疾病谱——非 UKB 情境结论用 non_ukb 子集复算。
  6. 坑点 6:liftover 等位表示——GRCh37→38 lift 后 0.5-1% 位点表示变化;跨版本比对用 locus+alleles 规范键。
  7. 坑点 7:LOFTEE 边界 case——end_truncated/ancient/complex 标志的 LoF 是假阳性主力——LoF 计数前过滤标志位。
  8. 坑点 8:API 无节流批量拉取——万级 GraphQL 逐条请求被打断/超时——批量走 VCF/Hail,API 只做单点查询。

§6.7 审稿人自查清单

  • [ ] gnomAD 版本字符串(v4.1?v2.1.1?)与坐标(GRCh38/37)写进方法段?
  • [ ] 频率结论用的是 FAF95/grpmax 还是裸 AF?依据?
  • [ ] 子集口径(全量/non_ukb/non_neuro)声明?
  • [ ] LoF 相关结论是否过滤 LOFTEE 标志?
  • [ ] 非编码结论用的是 genome 口径(v3/NDR)?
  • [ ] 与旧文献比较时版本迁移说明(pLI→LOEUF)?
  • [ ] 「absent」表述是否替换为 FAF95 上界?
  • [ ] 复现包含版本指纹 + 下载日期?

§6.8 历代指标对照:pLI → LOEUF → v4 约束

引用旧文献或迁移历史结论时需要这张对照表:

维度 pLI(v2 早期) LOEUF(v2 constraint 2020) v4 约束(2026 论文口径)
输出形态 概率三分类(0.9 阈值) 连续分位(10 组) 连续 + 新 LoF 管线输入
统计基础 插入突变率期望 O/E + 90% CI 上界 同 LOEUF + 管线精度 90%
短基因表现 高误判 CI 显式化(可判不确定) 改善但 CI 仍宽
错义机制 无 错义 Z 单列 高致错义整合进不耐受度量
临床引用惯性 旧指南/旧论文大量引用 当前主流 增量替代中
迁移动作 — pLI 结论需 LOEUF 重查 LOEUF 数值随版本会变

迁移纪律:任何「该基因不耐受/耐受 LoF」的历史结论,引用时注明所用指标与版本;跨版本结论冲突时(pLI 说耐受、LOEUF 说约束)以新版为准并说明理由——这类冲突本身就是论文的讨论素材。

§6.9 文献结论迁移的三个高频场景

  1. 旧版 pLI=0(耐受)→ 新版强约束:样本扩大后 CI 收窄——原结论是小样本假阴性;临床判级复查该基因的 LoF 变异。
  2. 旧版强约束 → 新版松动:LoF 管线升级后假阳性 LoF 被剔除(NMD 预测修正)——「约束下降」不等于「基因不重要」,是「测量更准」。
  3. popmax → grpmax 数值跳变:ancestry 组定义变化(MID 拆分等)——最大组频率变化是口径变化而非生物学变化,解读时先查 release notes。

§7 AI 就绪指南与应用场景

§7.1 gnomAD 在医疗 AI 中的四种喂法

  1. 频率特征注入:变异级(AF/FAF95/grpmax)与基因级(LOEUF/错义 Z)作为致病性预测模型的结构化特征——EVE/AlphaMissense 类模型的公共频率输入。
  2. 过滤层工程化:ACMG 频率证据做成流水线模块(§5.2)——诊断 AI 的「去噪前置」。
  3. 阴性对照生成:约束白名单(可敲除基因)与高频变异库(BA1 集合)作为模型的阴性训练/校准集——解决罕见病 AI「阳性样本稀缺、阴性样本更稀缺」的痛点。
  4. 群体先验校准:模型输出的变异风险与人群频率对齐校准(calibration vs prevalence)——防止「越罕见越致病」的模型内隐逻辑。

四种喂法与 §6 坑点的对应:喂法 1 踩坑 1(版本)与坑 5(UKB 偏斜);喂法 2 踩坑 2(FAF95)与坑 3(grpmax);喂法 3 踩坑 7(LOFTEE 标志);喂法 4 踩坑 6(liftover)——建模前回读 §6.6 对号。

§7.2 变异致病性特征工程实操配方

#!/usr/bin/env python3
"""构建变异级致病性特征表:gnomAD 频率/约束 + ClinVar 状态。
输入:自有变异列表(chr-pos-ref-alt,GRCh38)
输出:特征 TSV,供下游分类器。"""
import subprocess
import pandas as pd

SITES_VCF = "gnomad.exomes.v4.1.sites.vcf.bgz"  # 预先下载
REGIONS = "variants.regions.bed"                 # 自有变异 ±100bp 的 BED

def extract_gnomad_annotations(bed: str) -> pd.DataFrame:
    """tabix 按 BED 批量抽取,避免逐条 API。"""
    out = subprocess.run(
        ["tabix", "-R", bed, SITES_VCF],
        capture_output=True, text=True, check=True,
    ).stdout
    rows = []
    for line in out.splitlines():
        f = line.split("\t")
        info = dict(kv.split("=", 1) for kv in f[7].split(";") if "=" in kv)
        rows.append({
            "locus": f"{f[0]}-{f[1]}",
            "ref": f[3], "alt": f[4],
            "af": info.get("AF"), "faf95": info.get("FAF95"),
            "grpmax_af": info.get("grpmax_af"),
            "ac_hom": info.get("AC_hom", 0),
            "loftee": info.get("LOFTEE"),
            "vep_max_impact": info.get("VEP_MAX_IMPACT"),
        })
    return pd.DataFrame(rows)

def load_constraint_table(path: str) -> pd.DataFrame:
    """基因级约束(LOEUF 分位等)→ 按 gene join。"""
    ct = pd.read_csv(path, sep="\t")
    ct["loeuf_decile"] = pd.qcut(ct["oe_ci_upper"], 10, labels=False)
    return ct[["gene", "oe_ci_upper", "mis_z", "loeuf_decile", "dispo"]]

if __name__ == "__main__":
    var_features = extract_gnomad_annotations(REGIONS)
    gene_features = load_constraint_table("gnomad.v4.constraint.tsv")
    # gene 归属来自自有 VEP 注释(此处假设已有 var.gene 列)
    var_features = var_features.merge(
        pd.read_csv("variants.with_gene.tsv", sep="\t"),
        on=["locus", "ref", "alt"])
    final = var_features.merge(gene_features, on="gene", how="left")
    final.to_csv("pathogenicity_features.tsv", sep="\t", index=False)

§7.3 模型选型与迁移决策

  1. 变异级致病性模型:gnomAD 特征与 CADD/REVEL/SpliceAI 组合时注意信息冗余(CADD 已部分含频率代理)——消融实验确认 gnomAD 特征的增量。
  2. 基因级优先级模型:LOEUF/DisPo 是强先验——避免模型退化成「约束复读机」:与表达量、疾病谱特征正交化后再训练。
  3. 过滤层 vs 学习层:显性疾病过滤建议规则层(FAF95 阈值)不进模型——把确定性强、可解释的规则留在模型外,是临床 AI 的可解释性红利。
  4. 无监督异常检测:SV 新颖性评分(自有 calling 中 v4 SV 目录外的事件)——「目录外」是弱证据,需与工具置信度组合。
  5. 版本漂移管理:v5 发布后特征分布会移动(LoF 管线升级)——特征表带版本标签,模型重训与特征版本绑定。

§7.4 公平性:ancestry 偏斜的工程应对

  1. 特征层:grpmax/FAF95 按 ancestry 提供时,为小组(MID/AMI)显式存 CI 宽度列——模型对小组特征降权而非静默使用宽 CI 点估计。
  2. 评估层:变异过滤器的假阳/假阴按 ancestry 分组报告——「对 AFR 变异的过滤精度 vs NFE」的差值是审稿人新常态问题。
  3. 数据层:非欧洲人群项目补用 ChinaMAP/CKB/All of Us 作频率参照(§9.5 组合)——gnomAD 单源参照的 AI 系统在该语境下结构性欠拟合。
  4. 文档层:模型卡声明训练频率特征的版本与 ancestry 构成——gnomAD 官方自己都在 stats 页直白标注多样性不足,AI 团队没有理由沉默。

§7.5 任务×资源速查表

AI 任务 gnomAD 数据 输出形态 验收
变异致病性分类 sites 特征 + 约束表 分类器特征 消融显示频率特征增量
罕见病候选基因排序 LOEUF/DisPo/OMIM 排序清单 Top-K 命中已知基因(留一验证)
诊断流水线过滤层 FAF95/grpmax 规则 ACMG 自动打分 与专家判级一致性 κ
SV 新颖性评分 v4 SV callset 异常分数 与致病库(ClinGen)重叠富集
突变率/选择建模 v4 sites 频谱 人群遗传参数 与 PIES/Roulette 基线一致
医学影像-基因联合 约束特征 × 队列表型 多模态模型 表型-基因关联可复算

§7.6 端到端案例:显性心肌病诊断过滤层

  1. 输入:疑似心肌病患者 WES 变异集(约 5 万个,GRCh38)。
  2. 频率层:v4.1 FAF95 > 心肌病 max-credible-AF → 标 BS1;grpmax 检查 founder(如芬兰/ASJ 组富集的既有良性判级)。
  3. 纯合检查:显性早发表型 + ac_hom ≥ 2 → BS2。
  4. 约束层:剩余变异的基因 LOEUF 分位与 DisPo 排序——强约束基因的变异进优先审查队列。
  5. LoF 质控:LOFTEE flags 过滤——end_truncated 变异降级为 VUS 候选而非直接致病假设。
  6. 输出:分级建议 + 每级证据的 gnomAD 字段快照(版本 v4.1 + 下载日期)——实验室 QA 可复算。
  7. 验收:与三位临床遗传专家盲评一致率 ≥ 0.85(Cohen κ ≥ 0.8);TP/FN 按 ancestry 分组报告。

§7.7 报告模板:方法学段落骨架

变异人群频率与约束注释来自 gnomAD v4.1(807,162 人;730,947 外显子组与 76,215 全基因组;GRCh38;2024-05 发布,含 v4.0 AN 修正)。频率过滤采用 FAF95(95% 置信频率过滤上限)与 grpmax(最大 ancestry 组频率),显性疾病判读遵循 Whiffin max-credible-AF 框架(参数见补充表 S1);「absent」表述统一替换为 FAF95=0。基因约束采用 LOEUF(v4 口径,LoF O/E 90% 置信上界分位)与错义 Z,基因发现优先级参考 DisPo 评分。LoF 判定经 LOFTEE v1.1 并过滤 end_truncated/ancient 标志。子集口径:主分析采用全量 v4.1,敏感性分析采用 non_ukb 子集(390,607 人)排除 UK Biobank 过代表征。结构变异对照使用 gnomAD v4 SV callset(1,199,117 个 SV)。所有频率快照与版本指纹(下载日期、文件校验和)见复现包。

§7.8 成本与排期模板

阶段 内容 成本构成 周期
取数 约束表 + sites VCF 下载 存储 + 带宽 1 天
管线 tabix/Hail 注释流水线 单机或小集群 3-5 天
校准 ACMG 规则 + 疾病参数表 领域人力 1-2 周
评估 专家一致性 + 分层报告 领域人力 1 周
维护 版本升级(v5)适配 人力 + 重算 release 周期年检

先「约束表小数据打样」后「sites 全量扩展」——多数项目卡在校准而非计算。

§7.9 端到端案例 2:AI 致病性模型的特征消融

场景:为自研变异致病性分类器补入 gnomAD 特征,验证增量价值——这是「要不要接入 gnomAD」的量化答案:

  1. 基线模型:仅用变异序列特征(CADD/REVEL/SpliceAI + 进化保守性)——测试集 PR-AUC 记为 B。
  2. 特征组 F1(频率):AF/FAF95/grpmax/ac_hom 四列——预期在「良性高频变异」端大幅降假阳(CADD 类模型对高频良性变异的排序缺陷是已知短板)。
  3. 特征组 F2(约束):基因 LOEUF 分位/错义 Z/DisPo——预期在「超罕见但无害变异」端降假阴(约束低基因的罕见变异先验良性)。
  4. 消融矩阵:B / B+F1 / B+F2 / B+F1+F2 四组对比——增量不是均匀的:F1 救假阳、F2 救假阴,只报一个总 AUC 会掩盖互补性。
  5. 泄漏自查:训练集若来自 ClinVar,检查 ClinVar 判级时间与 gnomAD release 的时间关系(v4 已含 ClinVar 共享变异的频率信息——同一变异的「频率证据」参与了人类判级,存在轻度循环);留出时间切分(训练用早期判级,测试用新判级)是稳妥做法。
  6. 分组报告:PR-AUC 按 ancestry 分组——gnomAD 特征在非欧洲变异上的置信度更低,模型应学到「小组 CI 宽 → 特征降权」而非静默同权。
  7. 验收:F1+F2 相对基线的假阳/假阴双向改善均显著;ancestry 组间差距在可解释范围(CI 宽度差异)内。

结论形态:「gnomAD 特征的增量在哪里、不在哪里」的消融证据——比「加了就好」的粗报告更接近审稿要求。

§8 伦理、许可与合规

§8.1 许可结构

  1. 数据 CC0 1.0:公共领域弃权——无需署名、无使用限制(商业/非商业/再分发均可);官方「请求引用但不强制」。
  2. 代码 MIT:gnomad_methods/gnomad_qc 均为 MIT——衍生工具可闭源。
  3. 引用伦理:社区惯例引用 v4 论文(或所用版本主论文)——不强制但是学术信誉机制。

§8.2 隐私与剩余风险

  1. 天然保护面:sites-only、无表型、无个体基因型——传统再识别攻击面不存在;AC/AN 聚合粒度对小组有最小计数约束。
  2. 剩余风险:成员推断的概念验证研究(已知基因型谱反推参与)提示极小组(如 MID 3,031)的频率组合理论上携带群体信息——gnomAD 的缓解是发布粒度控制,使用者不应逆向尝试。
  3. 使用者义务:不将 gnomAD 与可识别数据做超出既定用途的链接;产品化时声明频率参照的版本与局限。

§8.3 致谢与引用模板

致谢模板(按需裁剪):
Variant frequencies and constraint metrics were obtained from the Genome
Aggregation Database (gnomAD) v4.1 (GRCh38), a resource made available by
the gnomAD Project Consortium under CC0. We thank the data contributors
and participants whose sequencing data underlie the reference.
引用:gnomAD Project Consortium. Integrating 730,947 exome sequences with
clinical literature improves gene discovery. medRxiv (2026).
DOI 10.64898/2026.03.23.26349081 (使用 v2 时引 Karczewski Nature 2020;
v3 约束引 Chen Nature 2024;SV 引 Collins Nature 2021)

§8.4 国内合规路径

  1. 数据性质:公开聚合统计(非个体信息)——下载与使用本身不触发人类遗传资源管理申报;但二次生成的衍生数据若涉及可识别信息则另论。
  2. 合作发表:使用 gnomAD 的论文发表无特殊限制;将国内队列数据与 gnomAD 比对时,国内数据的出境审批按《人类遗传资源管理条例》执行(对比分析输出为聚合统计一般走简化路径,具体以伦理与 HGRAC 审批为准)。
  3. 红线:不得将 gnomAD 用于尝试反推任何贡献群体成员身份的用途;不得宣称 gnomAD 判级替代临床遗传师签发。

§8.5 商业使用边界

CC0 允许商业产品内置 gnomAD 频率(诊断软件、LIS 系统均可)——但两点建议:版本升级的商业影响纳入产品路线(v5 的 LoF 管线升级会改变过滤结果);对外文档标注「频率参照非诊断结论」的免责边界。

§9 谱系与生态

§9.1 聚合数据库时间线

2015  ExAC 概念成形(疾病研究对照样本聚合)
2016  ExAC 发布(60,706 exomes;Lek Nature 536)
2018  更名 gnomAD;v2.1 系列迭代
2020  v2 constraint 论文(141,456;LOEUF)
2021  gnomAD-SV(Nature 591)
2022  v3.1.2(76,156 genomes;GRCh38)
2024  v3 约束地图(Chen Nature 625)→ v4.0(并入 UKB)→ v4.1(AN 修正 + joint)
2026  v4 主论文(LoF 90% 精度 + DisPo;medRxiv)

§9.2 术语表

术语 定义
sites-only 只发布位点级聚合统计(无个体基因型)的发布形态
AC / AN / AF 等位计数 / 等位总数 / 等位频率
ac_hom 该变异的纯合个体数(隐性判读关键)
grpmax 最大 ancestry 组频率(v4 术语,替代 popmax)
FAF95 95% 置信的频率过滤上限(Frequency Filtered AF)
LOEUF LoF O/E 的 90% 置信上界——低 = 强约束(LoF 敏感)
pLI 旧版概率化 LoF 不耐受指标(v2 时代,已多被 LOEUF 替代)
错义 Z 错义变异约束的 Z 统计量(高 = 错义受限)
NDR 非编码约束区域(v3 论文,genome 口径)
LOFTEE LoF 变异过滤注释器(标志位过滤假阳性)
DisPo Discovery Potential 评分——约束强 × 表征少的基因发现潜力
max-credible-AF 疾病允许的致病变异最大可信频率(Whiffin 框架)
BA1 / BS1 / BS2 ACMG 频率相关良性证据等级
joint callset exome+genome 联合调用 sites(v4.1 新增)
non_ukb 排除 UKB 样本的子集口径(ancestry 均衡用)
liftover 坐标版本转换(≠ 原生 build 数据)
founder variant 奠基者效应变异(特定人群高频)
Hail 大规模基因组数据分布式计算框架(gnomAD 标配)

§9.3 资源选型决策树

你的需求是什么?
├─ 「查一个变异的频率」
│    → 浏览器 / GraphQL API(分钟级)
├─ 「给面板 VCF 批量加频率」
│    → sites VCF + tabix/bcftools(§4.4)
├─ 「全基因组级频率统计」
│    → Hail + sites Table(Terra/自建集群)
├─ 「基因约束/优先级」
│    → 约束表 + DisPo(GB 级,pandas 即可)
├─ 「非编码区域评估」
│    → v3.1.2 genome 口径 + NDR
├─ 「CNV 背景频率」
│    → v4 SV callset + tabix
├─ 「chrX/Y 约束」
│    → 回 v2.1.1(v4 未发布)
├─ 「个体级基因型-表型」
│    → 不用 gnomAD → UKB/队列数据
└─ 「体细胞突变谱」
     → 不用 gnomAD → TCGA/PCAWG

§9.4 与本库其他条目的关系

条目 关系
uk-biobank v4 的最大样本源(416,555 exomes)——个体级分析去那边
clinvar 下游消费者:gAD 频率是其良性证据源;反向不成立
hprc 单倍型/泛基因组结构参考——SV 背景的结构解析互补
dbgap 访问模式的两极对照(CC0 即时 vs dbGaP 受控数月)
tcga 范畴对照:胚系频率 vs 体细胞突变(v4 明确不含 TCGA)
频率 vs 体细胞突变(v4 明确不含 TCGA)
gwas-catalog 关联汇总——频率解释 GWAS 命中时的参照层

| 关联汇总——频率解释 GWAS 命中时的参照层 |

§9.5 组合使用建议

研究设计 推荐组合 分工
临床变异分级 gnomAD 频率 + ClinVar 判级 + OMIM 表型 统计事实 + 社区注释 + 定论
非欧洲人群过滤 gnomAD + ChinaMAP/CKB 频率 全人群 + 东亚细分
罕见病基因发现 gnomAD 约束 + UKB 深表型 + dbGaP 罕见病队列 先验 + 关联 + 分离分析
SV 判读 gnomAD SV + HPRC 结构参考 + ClinGen CNV 判级 频率 + 结构 + 临床规则
AI 致病性模型 gnomAD 特征 + AlphaMissense/CADD + 内部分级集 特征 + 模型先验 + 真值
药物靶点安全 gnomAD 可敲除清单 + pQTL MR(UKB Olink) 安全白名单 + 因果

组合纪律:频率参照的版本与子集先声明——组合系统里 gnomAD 版本漂移会静默改变下游所有判级,版本指纹要贯穿全链(§4.7)。

§9.6 聚合层在开放科学生态中的角色

gnomAD 的社会角色可以概括为「开放科学的压缩层」——它证明了三件事在基因组学可行:

  1. 机构协作可以制度化:308 家机构按统一协议贡献数据、统一管线处理、统一发布——协作成本由基础设施承担而非逐项目谈判;这是 ExAC→gnomAD 十年演化出的最重要方法论。
  2. 隐私与效用可以再平衡:sites-only 聚合发布牺牲个体级信息,换来全开放分发——「聚合到什么粒度可以全开放」的答案被 gnomAD 抬高了(80 万人的频率即可全开放),后续资源(TOPMed 部分 release、HPRC 频率层)沿用了这个粒度模板。
  3. 指标可以成为公共品:LOEUF/DisPo 这类衍生指标被全行业引用而不收费——「数据库 + 指标 + 工具」三层全开放的供给模式,是它区别于商业基因数据库(付费 API)的本质。

对国内建设的镜鉴:单一机构难以复制 308 家的聚合面,但「统一管线 + 聚合粒度全开放 + 指标公共品」的三件套在单一大队列(如 CKB/ChinaMAP 规模)上完全可行——东亚人群的 gnomAD 等价物缺位是真实机会。

§10 资源导航与 FAQ

§10.1 官方资源导航

上手指引(第一次接入的推荐顺序):

  1. 浏览器查一个已知变异(如 PCSK9 p.Arg93Cys)——感受频率表的分层结构。
  2. 用 GraphQL API 复查同一变异——比较 gnomad_r4 与 gnomad_r2_1 两个 dataset 的输出差异。
  3. 下载约束表(GB 级)+ 基因级 pandas 探索——LOEUF 分位与 DisPo 的分布直觉。
  4. tabix 抽取一个小 panel 区域的 sites VCF 记录——验证 §4.4 流程。
  5. 若需全基因组级任务,再评估 Hail 集群(Terra 最省事)——多数项目到此为止不需要。

§10.2 关键文献

  1. Lek, M. et al. Analysis of protein-coding genetic variation in 60,706 humans. Nature 536, 285-291 (2016). DOI 10.1038/nature19057(ExAC 分析论文)
  2. Karczewski, K.J. et al. The mutational constraint spectrum quantified from variation in 141,456 humans. Nature 581, 434-443 (2020). DOI 10.1038/s41586-020-2308-7(v2 constraint / LOEUF)
  3. Collins, R.L. et al. A structural variation reference for medical and population genetics. Nature 591, 444-451 (2021). DOI 10.1038/s41586-021-03358-8(gnomAD-SV)
  4. Chen, S. et al. A genomic mutational constraint map using variation in 76,156 human genomes. Nature 625, 92-100 (2024). DOI 10.1038/s41586-023-06045-0(v3 约束地图 / NDR)
  5. gnomAD Project Consortium. Integrating 730,947 exome sequences with clinical literature improves gene discovery. medRxiv (2026-03). DOI 10.64898/2026.03.23.26349081(v4 主论文)

§10.4 FAQ

Q1:gnomAD 数据可以商用吗?
A:可以——CC0 公共领域,无使用限制、无需署名;社区惯例是引用所用版本主论文。

Q2:807,162 人里有 UKB 吗?
A:有——416,555 个 UKB 外显子组(占总样本 51.6%);需要 ancestry 均衡口径时用官方 non_ukb 子集。

Q3:为什么我的变异在 gnomAD 查不到?
A:三种可能:① 区域未被外显子捕获(查 coverage 表);② 确实是超罕见或新型变异(FAF95 给上界);③ 版本/坐标错配(v2 GRCh37 vs v4 GRCh38)。

Q4:AF、FAF95、grpmax 用哪个?
A:显性疾病过滤用 FAF95(不是点估计 AF);founder 风险查 grpmax;隐性携带者频率查 AF+ac_hom;论文报告建议三者并列。

Q5:v2 还需要吗?
A:需要两类场景——chrX/Y 约束(v4 未发布)与引用旧 LOEUF 值的文献对照;其余默认 v4.1。

Q6:能下到个体基因型吗?
A:不能——gnomAD 只发布 sites-only 聚合统计;个体级分析需要原始队列(UKB/dbGaP 类受控资源)。

Q7:LOEUF 怎么读?
A:越低越约束(LoF O/E 的 90% CI 上界,分位化);强约束基因(前 10%)对显性 LoF 疾病敏感;注意短基因 CI 宽、点估计不可靠。

Q8:为什么 v4.0 有问题?
A:v4.0 的 AN(等位总数)统计低估,使稀有变异 AF 高估 5-10%——v4.1(2024-05)修正;别用 v4.0 做频率结论。

Q9:和 ClinVar 怎么配合?
A:gnomAD 给统计事实(多常见),ClinVar 给社区判级(怎么解释)——过滤流水线先查频率(客观)再看判级(主观),顺序不可倒。

Q10:SV 数据怎么用?
A:tabix 按区域查 v4 SV callset 的重叠记录与频率——判读时注意多工具交叉背景与 CPX 复杂型的断点完整性;「v4 没有」≠「不存在」(INS 检出弱)。

Q11:mtDNA 数据在哪个版本?
A:v3.1.2 与 v4 均有线粒体变异频率(浏览器 mitochondrial 页)——异质性与单倍群分析注意核-线粒体口径差异。

Q12:下载全量要多少存储?
A:v4.1 exome sites Hail Table 约 2 TB、genome 约 3 TB;多数任务其实只需要约束表(GB 级)或 sites VCF(数百 GB)+ tabix。

Q13:API 有配额吗?
A:无硬性配额但请节流——万级以上批量查询改走 sites VCF/Hail;逐条 GraphQL 只适合单点查询。

Q14:怎么参与贡献数据?
A:通过数据贡献协议(308 家机构的模式)——联系官方(gnomad@broadinstitute.org);贡献是聚合服务标准的良性循环。

Q15:对非欧洲人群,gnomAD 够用吗?
A:不够独立支撑——NFE 占 77%,MID 仅 3,031;东亚/中东/非洲场景必须叠加 ChinaMAP/CKB/本土库做频率参照,并在模型卡声明。

Q16:FAF95=0 是什么意思?
A:95% 置信下该变异频率上界为 0 的表述口径(v4 建议用它替代「absent」)——写论文时用 FAF95 而非「未见」。

Q17:约束指标会更新吗?
A:会——每次 release 重算(v5 将用 v4 新 LoF 管线重算);引用时写版本,长期项目订阅邮件列表(broad.io/gnomad_list)跟踪。

Q18:怎么引用最合适?
A:主论文(v4/medRxiv 2026)+ 所用具体数据件的版本说明(v4.1 exomes)+ 关键指标出处(LOEUF 引 Karczewski 2020 或 v4 论文按口径)——三件套写法。

Q19:FAF95 和普通 CI 有什么区别?
A:FAF95 是对「频率过滤上限」的单侧 95% 置信上界——专门为「这个变异最多能有多常见」的判级问题设计;普通双侧 CI 给的是「估计值±波动」,两者数值不同不可互换。

Q20:为什么有的基因约束分位高但 ClinVar 里 LoF 致病不少?
A:约束是全基因统计(对 LoF 总体敏感度),ClinVar 记录的是特定变异——约束中等的基因仍可能有个别高致病 LoF 变异(如关键功能域);约束是先验不是判决。

Q21:non_ukb、non_neuro、non_cancer 子集怎么选?
A:non_ukb 排除 UKB 主导偏斜(ancestry 均衡分析用);non_neuro/non_cancer 排除对应疾病队列的过代表征(神经/癌症基因频率结论用)——子集是「让频率更接近普通人群」的旋钮。

Q22:v4 joint callset 和分别的 exome/genome sites 有什么不同?
A:joint 是外显子与基因组数据联合调用的位点集(v4.1 新增),对同位点给出统一口径——做全变异级统计优先 joint;只查外显区用 exome 表更轻。

§10.5 要点回顾

  1. 版本即一切:v2/v3/v4 不可互换——版本 + 坐标 + 子集三要素先于任何分析。
  2. FAF95 取代「absent」:80 万人样本里「没见过」的规范表述是频率置信上界。
  3. grpmax 防 founder 漏判:全人群 AF 之外必查最大组频率。
  4. sites-only 边界:无个体基因型/表型——个体级问题去队列资源。
  5. UKB 占 51.6%:non_ukb 子集是 ancestry 均衡分析的官方出口。
  6. coverage 是阴性证据的前置:「无变异记录」先过 coverage 检查。
  7. LOFTEE 标志过滤:LoF 相关结论前过滤 end_truncated/ancient。
  8. CC0 + 零门槛:数据免费但计算自担——预算按 §5.5 分档。
  9. 约束三件套:LOEUF(LoF)+ 错义 Z(错义)+ NDR(非编码)覆盖三类机制。
  10. 版本指纹贯穿组合系统:下游判级随 gnomAD 版本漂移——全链锁版本。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 807,162 = v4 总样本(730,947 exomes + 76,215 genomes)——broad.io/gnomad_stats + v4 论文
  • 416,555 = UKB 外显子组(730,947 − non-UKB 314,392)——broad.io 统计页子集口径
  • 390,607 = 非 UKB 子集合计(314,392 exomes + 76,215 genomes)——同上
  • SNV 786,500,648 / InDel 122,583,462 = v4 sites 短变异——broad.io 统计页
  • SV 1,199,117(DEL 627,947 / DUP 258,882 / INS 296,184 / INV 2,185 / CPX 13,116 / RECIP 92)——broad.io 统计页
  • 同义 9,643,254 / 错义 16,412,219 / 无义 726,924 / 移码 1,186,588 / 经典剪接 542,514——broad.io 统计页
  • 406,265 XX / 400,897 XY——broad.io 统计页
  • ancestry:NFE 622,057(77.07%)/ SAS 45,546 / AFR 37,545 / REMAINING 31,712 / AMR 30,019 / EAS 22,448 / ASJ 14,804 / MID 3,031——broad.io 统计页(v4)
  • 308 家贡献机构 / 100+ 研究 / 25+ 国——AWS Open Data 条目 + 官方 about 页
  • v4.1 发布 2024-05(AN 修正 + joint)——bioSkills 版本考据 + AWS 条目(v4.1 表述)
  • v4 主论文 DOI 10.64898/2026.03.23.26349081(medRxiv 2026-03;LoF 90% 精度;DisPo)——Broad 出版物页
  • 四篇里程碑:Lek 2016 Nature 536:285-291 / Karczewski 2020 Nature 581:434-443 / Collins 2021 Nature 591:444-451 / Chen 2024 Nature 625:92-100——DOI 见 §10.2
  • 许可 CC0 1.0(数据)+ MIT(代码)——KG Hub 条目 + AWS Registry(License MIT 标注为代码;数据「without restriction on use」)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据
  • hmp — 共享标签:基因组学与多组学 / 测序数据
  • dbsnp — 共享标签:基因组学与多组学 / 测序数据
  • ega — 共享标签:基因组学与多组学 / 测序数据
  • roadmap-epigenomics — 共享标签:基因组学与多组学 / 测序数据
  • blueprint — 共享标签:基因组学与多组学 / 测序数据
  • tcga — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集