GWAS Catalog — 全基因组关联权威目录 AI-Ready Wikipedia

62.5 万条 SNP-性状权威关联,8.5 万个全基因组汇总统计数据集

来源 NHGRI & EMBL-EBI url: https://www.ebi.ac.uk/gwas/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 28
GWAS Catalog — 全基因组关联权威目录 AI-Ready Wikipedia

信息速览

数据集名称GWAS Catalog — 全基因组关联权威目录 AI-Ready Wikipedia
数据类型625,113 条 lead 关联,8.5 万个汇总统计数据集,~56 TB sumstats,双周滚动更新,CC0/开放获取
规模累积数百万 GWAS 参与者,最大单研究 N=5,519,491
接入方式NHGRI & EMBL-EBI url: https://www.ebi.ac.uk/gwas/
AI 就绪度

# GWAS Catalog — 全基因组关联权威目录 AI-Ready Wikiped — 全基因组关联权威目录 AI-Ready Wikipedia


INFOBOX

数据集名称 NHGRI-EBI GWAS Catalog
英文全称 The NHGRI-EBI Catalog of human genome-wide association studies
别名/简称 GWAS Catalog、GWASCatalog、NHGRI GWAS Catalog
疾病分类 全疾病谱与数量性状(ICD-11:5A11 型 2 型糖尿病 / BA41 急性心肌梗死 / 2C60 乳腺癌 / 8A00 帕金森病 / 6A20 精神分裂症 / 5B80 肥胖等,详见 §2.1)
**分裂症 / 5B80 肥胖等,详见 §2.1)
SNOMED CT 44054006 Type 2 diabetes **
数据模态 GWAS 关联(SNP-性状关联整理数据库)+ 全基因组汇总统计(summary statistics)
AI 任务类型 多基因风险评分(PRS)、孟德尔随机化、精细定位、性状间遗传相关、靶点发现、跨疾病知识图谱、ancestry 公平性审计
样本总数 6,921 篇文献 / 108,850 项 GWAS 分析 / 625,113 条 lead 关联(截至 2024-07);最大单研究 N=5,519,491
数据大小 curated 下载表压缩后约 200 MB;汇总统计约 56 TB(按需下载)
数据格式 TSV(gzip)/ GWAS-SSF(TSV + YAML 元数据)/ REST API(JSON)
许可证 EBI Terms of Use(curated 数据);CC0 1.0(2021-03 后提交的汇总统计)
访问级别 开放(无需注册,网页 / FTP / REST API 三通道)
DUO 标签 NRES(汇总级开放数据,无样本级使用限制)
语言 英文
首发日期 2008(NHGRI 创建首版,收录 139 项研究)
最后更新 双周滚动发布(r-YYYY-MM-DD 命名,截至 2026-09 持续更新)
发布机构 美国国家人类基因组研究所(NHGRI)& 欧洲生物信息学研究所(EMBL-EBI)
官方主页 https://www.ebi.ac.uk/gwas/
下载地址 https://www.ebi.ac.uk/gwas/downloads
DOI 10.1093/nar/gkae1070(NAR 2025 数据库论文)
引用次数 4,683(Google Scholar,截至 2026-09,Buniello 2019 论文)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 富化 TSV 表、REST API、harmonised 汇总统计与 GWAS-SSF 标准齐备;扣分项:数据库型资源无官方任务划分,OR/beta 混存与 EFO 映射漂移需使用者自行处理
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、复杂性状遗传架构、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GWAS Catalog 的 curated 数据按 EBI Terms of Use 开放提供,2021 年 3 月之后提交的全基因组汇总统计按 CC0 1.0 许可发布,此前提交者沿用 EBI Terms of Use;个别数据集可能附带特殊许可说明。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? GWAS Catalog 是一座"全基因组关联研究结果的图书馆"。全球科学家做完 GWAS——即把几十万到几百万人分成两组(如糖尿病患者与健康人),逐一比较全基因组上超过 100 万个遗传变异的频率差异——之后,把每项研究中"哪个变异与哪个性状相关、效应多大"的结果汇总成一张可查询的表,这座图书馆截至 2024-07 已收录 6,921 篇文献的 625,113 条关联(NAR 2025 论文)。

为什么重要? 常见病(糖尿病、心脏病、精神疾病)不是由单一基因决定,而是成百上千个效应微弱的变异叠加的结果。要看见这种"多基因架构",就必须把分散在几千篇论文里的证据集中起来统一整理。GWAS Catalog 用统一的本体(EFO)重新命名所有性状、用统一格式托管原始汇总统计,让这些证据第一次变得可计算、可合并、可复用,是精准医学与多基因风险评分领域的地基级资源。

我能用它做什么? 如果你做医疗 AI:用它给模型提供"该疾病已知的遗传位点先验"、构建多基因风险评分(PRS)作为模型特征、审计你的模型在不同 ancestry 人群上的公平性;如果你做方法学研究:它托管的全基因组汇总统计(85,000+ 个数据集,约 56 TB)是孟德尔随机化、精细定位、遗传相关估计的标准输入。注意它不提供个体级基因型数据——那是 传相关估计的标准输入。注意它不提供个体级基因型数据——那是 UK Biobank、All of Us 等队列资源的角色。

§1.1、All of Us 等队列资源的角色。

§1.1 技术摘要

GWAS Catalog 由 NHGRI 于 2008 年创建,2010 年 9 月起与 EMBL-EBI 联合运营,2015 年基础设施整体迁至 EMBL-EBI 并重构(FAQ)。数据生产采用"机器筛选 + 人工策展"双轨:每周用 LitSuggest 机器学习模型扫描 PubMed 新索引文献,平均筛出约 40 篇候选、其中约 15 篇满足收录标准(全基因组分析超过 100,000 个变异的人类 GWAS);策展人随后人工提取研究设计、样本 ancestry、显著关联(P<1e-5)等信息,并将自由文本性状统一映射至 EFO 本体。截至 2024-07-01,目录含 6,921 篇文献、108,850 项独立 GWAS 分析(一篇文献常拆为多个 study accession)、625,113 条 lead 关联、超过 15,500 个 EFO 性状(NAR 2025)。自 2021 年起,作者可通过 deposition 门户直接提交全基因组汇总统计;截至同一时点已托管超过 85,000 个数据集(约 56 TB),其中 66% 的期刊发表 GWAS 附带汇总统计,文件自 2023 年 4 月起全面符合社区标准 GWAS-SSF 并提供统一基因组 build、等位基因对齐正链的 harmonised 版本。全部数据每两周滚动发布,经网页界面、FTP 与 REST API 开放获取。

§1.2 战略价值

维度一:遗传发现的"统一事实层"。 GWAS 文献的原始表述高度异构——同一疾病在不同论文中可能被称为"type 2 diabetes"“T2D”“diabetes mellitus, type 2”,效应值可能是 OR、beta 或 hazard ratio。GWAS Catalog 用 EFO 本体统一性状命名、用 GCST 编号统一研究标识、用标准化下载表统一字段,使跨研究证据合并第一次成为"跑一段代码"而不是"读一个月文献"。研究证据合并第一次成为"跑一段代码"而不是"读一个月文献"。Open Targets Platform、PGS Catalog、DisGeNET Platform、PGS Catalog、 Targets Platform、PGS Catalog、DisGeNET 等下游资源均以 GWAS Catalog 为关联证据的核心 等下游资源均以 GWAS Catalog 为关联证据的核心输入(Open Targets 文档)。

维度二:AI 时代的"负责任先验库"。 对医疗 AI 而言,该目录提供三类独特价值:其一,疾病-位点先验——模型特征筛选、通路富集、结果解释的可引用证据源;其二,公平性审计标尺——每项研究带结构化 ancestry 标注,可直接量化"你的训练人群与证据人群是否错位";其三,多样性监测——官方与学界(如 GWAS Diversity Monitor)持续用它追踪遗传研究的人群代表性缺口,这已成为研究伦理与基金评审的显性议题。

维度三:方法学研究的"公共练兵场"。 汇总统计层面的方法(PRS 构造、孟德尔随机化、fine-mapping、遗传相关)全部以 GWAS 汇总统计为输入。GWAS Catalog 以 GWAS-SSF 标准统一格式、以 harmonised 管道统一基因组 build 与链方向,把过去"每个方法团队各自清洗三个月"的成本压缩为按 accession 直接下载,是这些领域方法论文事实上的标准数据源。

§1.3 同类数据集横向对比

数据集 规模口径 模态/内容 标注体系 与 GWAS Catalog 的差异化
GWAS Catalog 6,921 篇文献 / 625,113 条 lead 关联 / 85,000+ 个 sumstats 数据集(截至 2024-07) 文献策展关联 + 全基因组汇总统计 EFO 本体 + GCST accession + ancestry 表 唯一同时覆盖"文献级 lead 关联"与"数据集级全量汇总统计"的 GWAS 权威目录
PGS Catalog 多基因评分目录(与 GWAS Catalog 共享团队与术语) 已发表 PRS 模型及其性能 PGS 评分 ID + EFO 记录"评分模型"而非原始关联;两者同属 EBISPOT 生态互为上下游
GWAS Central 数百万条关联(含未达显著的关联) 文献挖掘型关联汇总 自有性状层级 规模更大但策展深度与标准化程度不及 GWAS Catalog
dbGaP 数千项研究 个体级基因型-表型数据(受控访问) dbGaP 自有 phs 编号 提供个体级数据但需申请授权;GWAS Catalog 开放且免注册
UK Biobank 约 50 万参与者 个体级表型 + 基因型 ICD 编码 + UKB Field ID 单一深度队列;GWAS Catalog 是跨队列、跨文献的广度聚合
PhenoScanner 数亿条关联查询记录 GWAS 汇总统计查询引擎 EFO + 自有表型库 定位为查询服务;GWAS Catalog 定位为可下载、可引用的档案库

§1.4 版本时间轴

时间 版本/事件 关键内容与规模
2008 NHGRI 创建首版 139 项研究的 SNP-性状关联清单
2009 Hindorff et al.(PNAS) Catalog 概念论文发表,确立收录标准(>100,000 SNPs、P<1e-5)
2010-09 NHGRI + EMBL-EBI 联合运营 双机构协作,策展流程规范化启动
2015 基础设施迁至 EMBL-EBI 并重构 新 GUI、本体检索、结构化 ancestry 与招募信息
2017 NAR 数据库论文(MacArthur et al.) 2018-09 前口径:1,751 篇文献、11,912 个 SNPs(2013 数据,Welter 2014)
2019 NAR 数据库论文(Buniello et al.) 5,687 项 GWAS / 71,673 条关联 / 3,567 篇文献 / 284 个 sumstats 数据集(截至 2018-09);REST API 上线
2021-03 汇总统计 CC0 政策 此后提交的 sumstats 以 CC0 许可;deposition 门户承接直投
2022 sumstats 强制 CC0 新提交数据集必须以 CC0 或等效许可发布
2023-01 NAR 数据库论文(Sollis et al.) 知识库 + deposition 资源定位确立
2023-04 GWAS-SSF 标准全面实施 全部新 ingest 汇总统计符合社区标准,harmonised 管道升级
2024-07 NAR 2025 论文统计时点 6,921 篇 / 108,850 项分析 / 625,113 条关联 / >15,500 性状 / 85,000+ sumstats 数据集(~56 TB)
2025-01-30 RDF/OWL 知识库冻结 OWL 知识库停止更新,API 与下载文件为主通道
2026-04 Beyond SNPs 标准 CNV 与基因型(gene-based)GWAS 按新标准提交
持续 双周滚动发布 文件名 r-YYYY-MM-DD;截至 2026-09 持续更新(截至 2025-08:7,369 studies / 955,930 条关联,Diversity Monitor)

§1.5 典型应用场景

  1. 多基因风险评分(PRS)先验与基准:从 sumstats 下载通道获取目标性状的全基因组汇总统计,输入 PRS-CS、LDpred2 等方法构造评分,并以目录中的独立 GWAS 作为验证集统计量。操作要点:先读 .yaml 元数据确认 file_type 与 build,优先取 harmonised/ 目录的 .h.tsv(省去链方向与 build 归一两个预处理步骤,见 §6.3 阶段四);构造集与验证集必须来自不同 cohort(见 §5.2)。
  2. 孟德尔随机化(MR)工具变量检索:按 EFO 性状检索工具变量所在的 GWAS accession,下载 harmonised 汇总统计后执行两样本 MR。工具变量一律取全基因组显著 lead(P<5e-8);暴露与结局两个 GWAS 必须来自独立样本,可用 catalog 的 ancestry 表与 COHORT 字段核对样本重叠风险(见 §5.3)。
  3. 医疗 AI 模型的遗传先验特征:为影像/ EHR 模型提供"已知遗传关联位点"特征组或负对照位点集,增强可解释性与审稿说服力。典型做法是把 curated 表按目标 EFO 性状族过滤(用 MAPPED_TRAIT_URI 而非性状名,见坑点 5),提取变异坐标集合后映射到模型特征空间;负对照集则从同表抽取未达显著阈值的常见变异。
  4. ancestry 公平性审计:统计目标疾病域内的研究 ancestry 分布,论证"训练集人群与遗传证据人群"的代表性缺口,支撑论文 limitation 与伦理声明。用 All ancestry 表按 accession 聚合 BROADER 类别即可出图;2011 年前数据带"not double-curated"标志,建议做含/不含两种口径的敏感性分析(见坑点 6)。
  5. 靶点发现与药物重定位:以 catalog 关联为起点,结合 eQTL/colocalization 判定因果基因,形成靶点证据链(Open Targets 的标准工作流)。该场景的关键输入是区域级 sumstats 而非 lead 关联表(见坑点 1),lead 表在此只承担"候选区域索引"角色。

§2 医学背景

§2.1 ICD-11 编码表

GWAS Catalog 覆盖全疾病谱与数百种数量性状(身高、BMI、血脂等)。其原生性状编码是 EFO 本体而非 ICD-11;下表列出其在疾病域中最具代表性的研究对象及推荐 ICD-11 对应编码,供病历系统对接与下游检索使用。

性状/疾病(EFO 代表词条) ICD-11 编码 ICD-11 中文名 关联研究现状
Type 2 diabetes(EFO_0001360) 5A11 2 型糖尿病 最常被研究的非欧洲 ancestry 性状之一
Coronary artery disease / Myocardial infarction BA41 急性心肌梗死 大型联盟 CARDIoGRAMplusC4D 多轮刷新
Breast carcinoma(EFO_0000300) 2C60 乳腺恶性肿瘤 BCAC 联盟数百个易感位点
Parkinson’s disease(EFO_0002508) 8A00 帕金森病 欧洲与东亚人群均有大样本研究
Schizophrenia(EFO_0000692) 6A20 精神分裂症 PGC 联盟 100+ 全基因组显著位点
Obesity / Body mass index(EFO_0001073) 5B80 肥胖 GIANT 联盟上千个 BMI 位点
Asthma(EFO_0000270) CA23 哮喘 跨 ancestry TAGC 联盟研究
Essential hypertension BA00 原发性高血压 最大单研究样本量进入百万级

§2.1b SNOMED CT 映射表

GWAS Catalog 不直接发布 SNOMED CT 编码;官方通过 Ontology Cross Reference Service(OxO)提供 EFO 到 SNOMED CT 等临床术语的映射(文件下载页)。下表为常见性状的参考映射。

标签 EFO/来源 SNOMED CT 码 SNOMED 术语
Type 2 diabetes mellitus EFO_0001360 44054006 Diabetes mellitus type 2
Acute myocardial infarction EFO_0004299 22298006 Myocardial infarction
Breast carcinoma EFO_0000300 254837009 Primary malignant neoplasm of breast
Parkinson’s disease EFO_0002508 18127003 Parkinson’s disease
Schizophrenia EFO_0000692 58214004 Schizophrenia
Body mass index EFO_0004340 60621009 Body mass index (observable entity)
Asthma EFO_0000270 195967001 Asthma
Hypertension EFO_0000537 38341003 Hypertensive disorder

§2.2 疾病简介与复杂性状遗传架构

GWAS Catalog 研究对象的医学本体是"常见复杂性状":由数百至数千个常见变异叠加、并与环境因素交互作用形成的疾病或定量特征。理解这一架构需要三个关键概念。多基因性(polygenicity):2 型糖尿病、冠心病、精神分裂症等性状的遗传风险散布在大量位点,单个位点的中位效应很小——Hindorff 等对早期 catalog 关联的分析显示,报告的风险等位基因频率中位数为 36%,效应量(OR)中位数仅 1.33(PMID 19474294)。全基因组显著阈值:为在约百万级独立检验中控制假阳性,GWAS 采用 P<5×10⁻⁸ 的显著性标准;GWAS Catalog 的策展阈值更宽松(P<1e-5),以便保留"提示性关联"供后续验证。样本量决定发现:复杂性状位点的发现依赖超大样本联盟,目录中最大单研究样本已达 N=5,519,491(Diversity Monitor,截至 2025-08)。

从流行病学视角,这些复杂性状构成全球疾病负担的主体:心脑血管代谢疾病与常见肿瘤位居死因前列,精神疾病影响全球约十亿人量级。GWAS 的科学产出已从"发现位点"演进为可计算的转化资产:多基因风险评分将位点聚合为个体层面风险分层工具;孟德尔随机化利用遗传变异作为工具变量推断暴露-结局的因果方向;跨性状遗传相关揭示疾病共享机制(如精神分裂症与炎症性肠病的负相关线索)。这些应用全部以标准化、可访问的 GWAS 结果数据为前提——这正是 GWAS Catalog 的存在意义。

§2.2a GWAS 方法论最小背景

使用 GWAS Catalog 前需要理解 GWAS 的标准工作流,否则无法判断 catalog 中各字段的方法学含义:

  1. 基因分型:对队列中每个参与者用全基因组芯片(约 30 万–200 万个位点)或低覆盖测序获取基因型,再对未直接分型的位点做填充(imputation,基于参考单倍型面板推断)。
  2. 逐变异关联检验:对每个变异拟合一次回归——二分类性状用 logistic 回归(输出 OR),定量性状用线性回归(输出 beta),通常加协变量(年龄、性别、主成分等)。
  3. 多重检验校正:百万级独立检验下采用 P<5×10⁻⁸ 的全基因组显著阈值;曼哈顿图(Manhattan plot)按染色体位置绘制 -log10(P),超过阈值线的点即"显著位点"。
  4. 报告 lead 变异:每个显著区域内取 P 值最小的变异作为 lead;这正是 catalog curated 表的收录单位——理解这一点就理解了为什么 lead 表不能当全量统计用(坑点 1)。
  5. (可选)联盟 meta 分析:多个队列各自跑 GWAS 后按效应量合并,是当今大样本发现的主力形态;catalog 中同一疾病的多篇文献往往就是同一联盟的多轮刷新。

连锁不平衡(LD) 是理解 catalog 数据的第二个关键概念:相邻变异倾向于整体遗传,一个显著信号实际代表的是一段共享单倍型区块,而非单个因果变异。LD 随 ancestry 而异(非洲人群 LD 短、欧洲人群 LD 长),这解释了三个现象:跨人群 PRS 性能衰减、精细定位需要 ancestry 匹配的 LD 参考面板、以及同 locus 多条关联之间不可当独立样本使用(DAIMS 第 12 项)。

§2.3 临床任务定义

临床任务 与 GWAS Catalog 数据的关系 AI 建模中的典型用法
风险分层/筛查 PRS 提供独立于临床危险因素的遗传风险轴 将 PRS 作为影像/ EHR 模型的输入特征或分层变量
早期预警 遗传风险与可改变危险因素交互建模 高遗传风险亚组的特异性预警阈值调优
诊断辅助 遗传位点支持疾病亚型界定(如糖尿病亚型) 亚型感知的多任务模型先验
预后预测 疾病进展相关位点(如乳腺癌预后 GWAS) 预后模型的遗传特征注入与负对照
药物靶点优先级 关联位点经 colocalization 锁定因果基因 靶点证据评分、安全性线索(如与不良表型的共享位点)

§2.4 研究人群画像

维度 现状 来源与说明
ancestry 构成 欧洲 ancestry 显著主导;非欧洲 ancestry 不足但持续改善 策展优先级明确纳入非欧洲 ancestry 研究(NAR 2025)
最大单一研究 N=5,519,491(PMID 39620219) Diversity Monitor,截至 2025-08
年龄范围 视具体研究而定(从儿童队列到老年队列) 逐 study accession 记录于 INITIAL SAMPLE SIZE 字段
性别构成 多数研究为混合性别,部分研究按性别分层拆分 accession ancestry 独立表(All ancestry data)逐行记录
就医类型 以人群队列与医院联盟为主,含 biobank 型研究 COHORT 字段记录联盟/队列标识
地域覆盖 全球多区域;欧洲(含英国 Biobank 系)占比最高 ancestry 表含招募国家/地区描述

§2.5 临床价值

GWAS Catalog 的临床价值通过三条路径实现。路径一:风险分层的遗传维度。 PRS 已在冠心病、乳腺癌、房颤等性状上展示出超越传统危险因素模型的增量区分度,个别场景下高遗传风险十分位人群的发病风险可达低分位的数倍;这类评分的构建、验证与迭代都以 catalog 托管的汇总统计为数据基座。路径二:药物开发的靶点证据。 人类遗传学支持过的靶点在药物成功率上有显著优势,GWAS Catalog→Open Targets 的证据管线已成为工业界靶点优先级排序的标准输入。路径三:群体代表性问责。 catalog 的 ancestry 标注让"谁的基因组被研究过"成为可量化指标,直接推动非欧洲人群专项研究(如 H3Africa、All of Us)与基金政策。

§2.6 金标准与策展流程

维度 描述
数据性质 人工策展的文献关联目录 + 作者直投的全基因组汇总统计(非原始个体级数据)
划分方式 无任务划分;以 publication(PMID)→ study(GCST accession)→ association 三层结构组织
标注方式 人工策展(性状映射 EFO 本体、样本 ancestry 结构化)+ LitSuggest 机器学习文献初筛
标注者资质 EMBL-EBI 专业策展团队(与 NHGRI 科学团队联合),遵循公开收录标准
质量控制 双周自动化发布管线;ancestry 数据存在"Pre-2011 not double-curated"历史质量标志
一致性机制 与 PGS Catalog 共享性状与人群描述词汇;汇总统计提交需通过格式校验与 QC

§3 数据集规格

§3.0 版本抉择矩阵

GWAS Catalog 没有"旧版停更"问题(双周滚动更新),但存在四条互相不可替代的数据获取通道,选择错误是最常见的使用事故:

你的需求 推荐通道 规模 理由
查某个疾病已发表的显著关联(文献证据级) All associations v1.0.2.1 下载表 全表压缩后约 200 MB 含 EFO 标注 + GCST accession + 基因分型技术,一次下载全量策展结果
跑 PRS / MR / fine-mapping(需要全量变异统计) sumstats 下载页或 FTP(GWAS-SSF) 单数据集数百 MB 至数十 GB;全库约 56 TB lead 关联表只有 P<1e-5 的 top hits,不能替代全基因组统计
定期增量同步进数据平台 REST API(curated + sumstats 双 API) 按查询返回 JSON 支持按 accession/PMID/性状增量拉取,免全表刷新
建立本地镜像并校验完整性 FTP 站点(千位分箱目录结构) 按需 目录按 GCST000001-GCST001000 分箱,便于断点续传与差量核对

§3.1 模态详情

GWAS Catalog 是关联整理数据库(curated association database),核心模态为两层。第一层:curated 关联表。 策展人从全文提取每项研究报告的独立显著关联(每 locus 取 P 值最小的 lead 变异),字段包括变异 rsID/染色体位置、风险等位基因、P 值、效应量(OR 或 beta 及置信区间)、报告性状、EFO 映射性状、样本 ancestry。第二层:全基因组汇总统计。 作者通过 deposition 门户直投或策展人从公开来源获取的全量变异级统计(每行一个变异:效应等位基因、beta、标准误、P 值等),以 GWAS-SSF 格式(TSV)+ YAML 元数据托管,2023 年起附 harmonised 版本(统一基因组 build、等位基因对齐正链)。

§3.2 按子集样本数

子集(下载文件) 记录口径 规模(截至 2024-07) 说明
All associations v1.0.2.1 每 curated lead 关联一行 625,113 行 含 EFO 映射与基因分型技术列
All studies v1.0.2.1 每个 GCST accession 一行 108,850 行(对应 6,921 篇文献) 一篇文献可拆多行(多性状/多 ancestry/多阶段)
All ancestry data v1.0.3.1 每研究 ancestry 组分一行 与 studies 表行数对应 BROADER/自报 ancestry 双列结构
Unpublished studies v1.0.3.1 每个 pre/un-published accession 一行 动态增长 部分数据处于 embargo 期
汇总统计数据集 每 GCST accession 一个目录 85,000+ 个(~56 TB);~13,000 个为 prepublished 66% 期刊发表 GWAS 附带
关联总量(最新口径) 同上 955,930 条(截至 2025-08) Diversity Monitor

§3.2b GWAS-SSF 汇总统计数据集的内部结构

每个 sumstats 数据集(一个 GCST accession 一个目录)由三部分组成:标准格式 TSV、YAML 元数据、(2023-04 起)harmonised 子目录。理解这份结构能避免 90% 的 sumstats 误用:

组成 文件 内容与用法
原始统计 GCSTxxx_buildGRCh37/38.tsv.gz 每行一个变异;列名遵循 GWAS-SSF 受控词汇(chromosome、base_pair_location、effect_allele、other_allele、beta、standard_error、effect_allele_frequency、p_value、 odds_ratio 等,按研究设计取舍)
元数据 GCSTxxx-meta.yaml file_type(GWAS-SSF / Non-GWAS-SSF)、基因组 build、是否 harmonised、提交者与许可信息、ancestry 描述——下载后第一个要读的文件
harmonised 统计 harmonised/GCSTxxx.h.tsv.gz + .tbi + .log 官方统一 build、等位基因对齐正链、坐标一致性强制的版本;.log 记录对齐过程中翻转/剔除的变异,可审计
索引 .h.tsv.gz.tbi tabix 索引,支持按染色体区间随机访问,无需解压全文件

两点工程提示:其一,同一目录下原始文件与 harmonised 文件的列名不同(原始为 SSF 受控小写列名,harmonised 大写并对齐后格式),解析器要按文件分别适配;其二,file_type 为 Non-GWAS-SSF 的目录(约含 CNV、gene-based 等新标准数据)列结构不在本表范围内,读入前先看 YAML。

§3.3 数据格式

通道/文件 格式 关键结构 官方文档
All associations / studies / ancestry TSV(zip) 表头带版本号 v1.0.2.1;UTF-8 文本 file-downloads
GWAS-SSF 汇总统计 .tsv.gz + .yaml 每目录含原始 .tsv、元数据 .yaml、harmonised 子目录(.h.tsv + .tbi 索引 + .log) summary-statistics
REST API JSON curated API + sumstats API 两个端点 api 文档
FTP 目录树 ftp.ebi.ac.uk/pub/databases/gwas/summary_statistics/GCSTxxxxx-GCSTxxxxx/ 同上
GWAS→EFO 映射表 TSV reported trait ↔ mapped trait(非一一对应) file-downloads

§3.4 存储与体量

  • curated 三个下载表压缩后合计约 200 MB,解压后加载进 pandas/数据库约需数 GB 内存,单机即可处理。
  • 汇总统计全库约 56 TB(NAR 2025),不要全库镜像:按目标性状/ accession 增量下载是唯一务实策略。单个典型 UK Biobank 级数据集约 5–30 GB。
  • harmonised 文件额外占用约一倍空间(含 .tbi 索引),做 MR/fine-mapping 建议直接取 harmonised 目录。

§3.5 标注方式

标注分三种机制并行。人工策展:策展人阅读全文提取关联与研究元数据,这是关联表与 ancestry 表的来源;策展优先级排序为"带汇总统计的研究 > 带 SNP-性状关联表 > 大样本 > 非欧洲 ancestry"(NAR 2025)。本体映射:自由文本性状由策展人借助 Zooma 与本体编辑工具映射至 EFO,映射结果与 reported trait 双列并存。机器初筛:LitSuggest 每周对 PubMed 新索引文献做 GWAS 候选分类,平均筛出约 40 篇候选、约 15 篇达收录标准。

§3.6 标注者资质与一致性

策展由 EMBL-EBI 专职策展团队执行,与 NHGRI 科学团队(自 2010 年起)联合运营;收录标准、策展标准文档与 FAQ 全部公开。一致性机制包括:与 PGS Catalog 共享性状/人群术语;每月一次的策展例会校准(官方 methods 文档);对 2011 年前研究的 ancestry 字段显式打上"not double-curated"历史标志而非静默混入——这种"承认局限的标注"对下游质量审计非常友好。

§3.7 采集与发布周期

文献扫描每周执行;策展产出与汇总统计 ingest 合并为双周发布(文件名 r-YYYY-MM-DD,file-downloads)。汇总统计 FTP 每晚同步新 ingest 数据。生产系统建议以双周为周期做增量同步,并缓存上一版全表以做差异核对。

§3.8 地域与人群覆盖

覆盖全球人群但分布不均:欧洲 ancestry(英国、冰岛、北欧、德国等 Biobank 与联盟)贡献了最大的研究份额;东亚(日本 BioBank、中国 CKB、韩国)、非洲(H3Africa)、拉美与多祖先混合人群(美国 All of Us、MEC)占比相对小但增长明显——官方自 2024 年起将非欧洲 ancestry 研究列为策展优先级(NAR 2025)。对中国台湾相关研究的记录遵循原文献表述,涉及地区表述时本页面一律使用"中国台湾"。

§3.9 设备与平台规格

本资源不涉及采集设备,但逐 study 记录基因分型技术(v1.0.2 表新增列):常见取值包括全基因组芯片(Illumina/Affymetrix 系列)、外显子芯片(ExomeChip)、靶向芯片(MetaboChip、ImmunoChip)与全基因组测序。该字段对 AI 用法有两重意义:其一,不同芯片的变异覆盖差异会引入技术性缺失;其二,targeted array 研究(2018 年起纳入)的关联位点不可与全基因组芯片研究直接混池比较。

§3.10 深度溯源链

每条关联可完整回溯:ASSOCIATION_ID → GCST study accession → PMID(PubMed 文献)→ 作者与联盟 → FTP 目录中的原始汇总统计文件与 .yaml 元数据(含 file_type、是否 harmonised、提交者信息)→ deposition 提交记录。研究级溯源字段还包括 COHORT 标识与 genotyping technology。这一链条使任何下游结论都能定位到"哪篇论文、哪个人群、哪个分析",符合 FAIR 原则中的可追溯性要求(NAR 2025)。

§3.11 版本指纹与生产级校验

双周滚动发布意味着"你用的是哪一版"必须成为可记录、可复核的事实。官方下载表把版本号写进了表头行(如 v1.0.2.1),生产系统应在每次同步时提取如下指纹并存档:

def release_fingerprint(path: str) -> dict:
    """从官方下载表提取发布指纹:表头版本号、列数、表头键集合。
    与行数统计、SHA256 一起构成最小可追溯记录。"""
    import gzip
    opener = gzip.open if path.endswith(".gz") else open
    with opener(path, "rt") as f:
        header = f.readline().rstrip("\n")
    cols = header.split("\t")
    version = next((c for c in cols if c.startswith("v") and c[1].isdigit()), "unknown")
    return {
        "file": path.split("/")[-1],
        "header_version": version,
        "n_columns": len(cols),
        "columns": cols,
    }

三条实践规则:其一,指纹(版本号 + 列数 + 列名集合)比行数更能敏感地发现"列结构变更"——官方历史上多次在不换大版本的情况下增删列;其二,EFO 映射文件(gwassnpefo.tsv)没有版本号列,用文件 SHA256 代替;其三,把指纹写入每次训练运行的数据卡(§6.10),使任何历史实验都能复现到具体发布日。


§4 数据结构

§4.0 目录树

下载并解压官方文件后,本地组织如下(以 curated 表 + 若干汇总统计数据集为例):

gwas-catalog/
├── downloads/                                  # curated 全量下载表(https://www.ebi.ac.uk/gwas/downloads)
│   ├── gwas-association-studies-annotated_v1.0.2.1.tsv.gz   # 全部关联 + EFO + GCST + 分型技术
│   ├── gwas-catalog-studies_v1.0.2.1.tsv                    # 全部研究 accession
│   ├── gwas-catalog-ancestry_v1.0.3.1.tsv                   # ancestry 独立表
│   └── gwassnpefo.tsv                                       # reported trait ↔ EFO 映射表
├── sumstats/                                   # 按需下载的汇总统计(每 accession 一个目录)
│   ├── GCST90270927/
│   │   ├── GCST90270927_buildGRCh38.tsv.gz     # 原始(标准格式)汇总统计
│   │   ├── GCST90270927-meta.yaml              # 元数据:file_type / 是否 harmonised / 提交信息
│   │   └── harmonised/
│   │       ├── GCST90270927.h.tsv.gz           # 统一 build + 等位基因对齐正链
│   │       ├── GCST90270927.h.tsv.gz.tbi       # tabix 索引
│   │       └── GCST90270927.log                # harmonisation 日志
│   └── GCST0001762/                            # 千位分箱:ftp.ebi.ac.uk/.../GCST000001-GCST001000/
│       └── ...
└── api_cache/                                  # REST API 增量拉取的 JSON(自建缓存)

§4.1 DAIMS 字段字典(All associations v1.0.2.1 核心字段)

字段名 类型 说明 示例值 AI 用途 观测误差/陷阱 信息性缺失编码 取值范围
ASSOCIATION_ID Integer 关联唯一标识 12345678 主键,去重锚点 无(稳定) 无 ≥1
STUDY_ACCESSION Text 研究 accession GCST0001762 与 studies/ancestry 表联接键 一个 PMID 拆多 accession(见坑点 4) 无 GCST + 6–9 位数字
VARIANT_REPORTED Text 文献报告的变异(rsID 或染色体坐标) rs12946713 变异定位 同一变异不同写法 NR(未报告) rsID 或 chr:pos
CHR_ID / CHR_POS Text/Integer 经 Ensembl 映射的染色体与位置 13 / 92,095,900 基因组坐标对齐 build 未在行内标注(见坑点 7) 无映射时留空或 NR GRCh37/GRCh38
RISK_ALLELE Text 风险等位基因 T 效应方向解释 回文序列歧义(见坑点 3) NR A/C/G/T/Del/Ins
P-VALUE Text 关联 P 值 3.2e-12 显著性筛选 极小值特殊表示(见坑点 8) NR 0–1
OR or BETA Float OR(二分类)或 beta(定量) 1.15 效应量、PRS 构造 两类语义混存(见坑点 2) NR >0(OR)/ 任意(beta)
MAPPED_TRAIT / MAPPED_TRAIT_URI Text EFO 映射性状名 / URI Type 2 diabetes / http://www.ebi.ac.uk/efo/EFO_0001360 跨研究按性状聚合 映射非一一对应(见坑点 5) 映射失败时留空 EFO 术语
GENOTYPING TECHNOLOGY Text 分型平台 Genome-wide genotyping array 技术分层、混池预警 targeted array 需单独处理 NR 数个受控词
INITIAL SAMPLE SIZE Text 初始样本描述(人数+ancestry) 74,124 European ancestry individuals 权重与泛化性评估 自报口径,未逐年统一 NR 自由文本

§4.1b studies 表与 ancestry 表字段字典

studies 与 ancestry 两表是关联表的"元数据翅膀",联接后才能做 ancestry 分层与泄漏防护。

All studies v1.0.2.1 关键字段(每行一个 GCST accession):

字段名 说明 AI 用途
STUDY ACCESSION 研究层主键(GCST + 6–9 位数字) 与 associations/ancestry 表的联接键
PMID 文献标识 按文献聚合、泄漏分组(坑点 4)
FIRST AUTHOR / DATE 第一作者与文献发表日期 时间切分依据(§5.2)
INITIAL SAMPLE SIZE / REPLICATION SAMPLE SIZE 发现集与验证集样本描述 样本量加权、功效评估
COHORT 队列/联盟标识(如 UK Biobank、CKB) cohort 级泄漏防护的核心字段
GENOTYPING TECHNOLOGY 分型平台受控词 技术分层(§3.9)
DISEASE/TRAIT 报告性状原文(未映射) 与 EFO 映射表配合使用
EFO TRAIT 该 study 层面的 EFO 映射 性状级聚合
SUMMARY STATISTICS 是否附带全量汇总统计及 FTP 路径 判断能否进入定量任务(坑点 1)

All ancestry data v1.0.3.1 关键字段(每行一个 ancestry 组分):

字段名 说明 AI 用途
STUDY ACCESSION 联接键 回溯到 study/association
ANCESTRY 自报 ancestry 组分(如 “Indian in Singapore”) 精细人群画像
BROADER 归并后的粗粒度类别(如 “East Asian”) 默认分层键(坑点 6 推荐用此列)
ANCESTRY COUNTS / SAMPLE SIZE 该组分人数或比例 加权统计
IS OLDER THAN 2011 历史质量标志 Pre-2011 not double-curated 敏感性分析

§4.2 标签分布

curated 表没有传统意义的"分类标签",其分布维度是 EFO parent term(官方 diagram 的顶层分组)与 ancestry。规模口径参考:截至 2025-08,官方数据镜像统计到 23,023 个唯一 mapped traits、96,658 个唯一 diseases/traits 表述;955,930 条关联中 801,091 条达到 P<5e-8 全基因组显著阈值(Diversity Monitor)。ancestry 分布呈欧洲主导格局,非欧洲 ancestry 中 2 型糖尿病是最常研究的性状之一。精确的分组计数随双周发布滚动变化,生产系统应以每次下载的全表即时统计为准,不要硬编码历史快照。

§4.3 关键统计

统计项 数值 时点 来源
文献数 6,921 篇(最新口径 7,369) 2024-07 / 2025-08 NAR 2025 / Diversity Monitor
独立 GWAS 分析数 108,850 2024-07 NAR 2025
curated lead 关联 625,113(最新口径 955,930) 2024-07 / 2025-08 同上
达全基因组显著阈值的关联 801,091 2025-08 Diversity Monitor
EFO mapped traits >15,500(最新口径 23,023) 2024-07 / 2025-08 同上
汇总统计数据集 85,000+(~56 TB) 2024-07 NAR 2025
最大单研究样本 N=5,519,491 2025-08 Diversity Monitor
平均每研究关联数 约 6.6 条 2025-08 Diversity Monitor

§4.4 数据层级

Publication(PMID,文献层)
└── Study(GCST accession,研究层;一篇文献 1..N 个 accession)
    ├── Ancestry arm(ancestry 表逐行;同 accession 可含单/多 ancestry 组分)
    └── Association(ASSOCIATION_ID,关联层;每 accession 0..N 条 lead 关联)
        └── Variant(rsID + CHR_POS + RISK_ALLELE,变异层)
            └── Full summary statistics(FTP 目录,变异级全量统计,约 66% 期刊 GWAS 附带)

理解这一层级是避免泄漏的前提:accession 才是"一次 GWAS 分析"的单位,同一 cohort 拆分到多个 accession 时,跨 accession 的随机划分会把同一批人的不同分析放进训练与测试两侧(详见 §5.3 与坑点 4)。

§4.5 缺失值与信息性缺失

字段 缺失形态 含义 处理建议
CHR_ID / CHR_POS 空白或 NR 文献未报告或 Ensembl 无法映射(历史 rsID 失效、非 SNV 变异) 用 VARIANT_REPORTED 里的 rsID 到 Ensembl/DBSNP 重新映射
RISK_ALLELE NR 文献未报告风险等位基因 该关联不能直接用于 PRS 效应方向判断,勿默认"非风险等位基因"
OR or BETA NR 文献只给 P 值 只可做证据计数,不可进效应量模型
MAPPED_TRAIT 空白 EFO 映射尚未完成或性状过新 用 reported trait 兜底,并记录映射缺口
sumstats .yaml file_type 值为 Non-GWAS-SSF 非标准设计(如 CNV、基因型检验)或文件过小 按需排除或单独解析,勿按 SSF 列名读入
harmonised 目录缺失 目录不存在 2023 年前旧管道或待处理 退回原始 .tsv 并自行统一 build 与链方向

处理本表的原则:NR 是信息而非噪声——"文献未报告效应量"本身就该作为特征进入证据计数类任务,简单 dropna 会把大量历史关联无谓扔掉;但效应量模型(PRS/加权分析)必须只接受真实数值行,两条路径在同一管道中显式分流,不要用一个全局 dropna 同时服务两类任务。

§5 数据划分与使用建议

§5.1 官方划分

不存在官方划分。 GWAS Catalog 是滚动更新的知识库,不是带标签的预测任务数据集。任何"训练/验证/测试"结构都由使用者基于研究问题自行定义——这既是自由也是事故高发区。

§5.2 社区惯例划分

  • 按 accession/文献分块(block split):以 GCST accession 或 PMID 为单位划分,保证同一文献的所有分析落在同一侧。这是下游方法论文(PRS/MR 评测)的主流做法。
  • 按时间切分(temporal split):利用关联表无发布日期字段时的替代方案——以文献发表年份切分,模拟"用 2020 年前的知识预测 2021 年后的发现",适合评测知识图谱/发现类任务。
  • 按性状族切分:以 EFO parent term 为单位留出整族性状(如全部免疫性状)做零样本评估,评测跨性状泛化。
  • PRS 场景的"训练-目标-验证"三集:社区惯例为构造评分、调参、验证使用三个互不重叠的 GWAS 数据集(不同 cohort/ancestry),而非在同一汇总统计内切分。

§5.3 泄漏风险(重点)

  1. cohort 级泄漏:同一联盟(如 UK Biobank)产出的大量 accession 共享同一批参与者。按 accession 随机划分时,同一批人出现在两侧,导致"看似独立"的评估虚高。缓解:从 ancestry 表与 COHORT 字段聚合 cohort 归属,以 cohort 为最小划分单元。
  2. 性状级泄漏:EFO 映射把不同表述的同一性状连到同一节点,但也不会把"高度相关但不同"的性状(如 BMI 与腰臀比)分开。做跨性状任务时需人工确认性状族边界。
  3. 文献自我复制:综述、联盟两阶段论文(discovery + replication)会以不同 accession 出现同一批样本。划分前应合并同一 PMID 与其延伸 accession。
  4. lead 关联 vs 全量统计混淆:若在 lead 关联表上"训练"并在 sumstats 上"测试"(或反之),两份数据本身来自同一篇论文,属于结构性泄漏。

§5.3b 划分策略参考实现

以下两个函数覆盖最常见的两种划分需求,输入均为经 §6.3 清洗并联接了 studies 元数据的 DataFrame(含 PMID、COHORT 列):

import numpy as np
import pandas as pd

def split_by_cohort_pmid(df, val_ratio=0.2, seed=42):
    """cohort 级划分:同一 COHORT(缺失则回退 PMID)的所有行永远同侧。
    返回布尔掩码 is_val。"""
    grp = df["COHORT"].fillna(df["PMID"].astype(str))
    units = grp.unique()
    rng = np.random.default_rng(seed)
    rng.shuffle(units)
    n_val = int(len(units) * val_ratio)
    val_units = set(units[:n_val])
    return grp.isin(val_units).to_numpy()

def split_by_year(df, cutoff=2020):
    """时间切分:以文献发表年份为界,模拟'用历史知识预测未来发现'。
    需要先从 studies 表把 DATE 解析为 year 列联接进来。"""
    years = pd.to_numeric(df["pub_year"], errors="coerce")
    return (years >= cutoff).fillna(False).to_numpy()

两个注意点:cohort 划分时若 val 集落入了没有目标性状的 cohort,应重新抽样而不是按行补齐——那会重新引入泄漏;时间切分时早期年份的 EFO 映射版本较旧,跨切分比较前先统一映射口径(坑点 5)。

§5.4 交叉验证建议

使用 K 折时按 cohort 或 PMID 分组(GroupKFold by cohort),禁止逐行随机 K 折。折间还应注意基因组 build 一致性:不同年份的研究混合了 GRCh37 与 GRCh38 坐标,跨折比较前先统一(见坑点 7)。

§5.5 外部验证建议

对外部验证集的选择应优先"人群不同"而非仅"时间不同":用东亚或非洲 ancestry 的独立 GWAS 验证以欧洲数据训练的模型,能同时暴露性能衰减与 ancestry 偏倚。PRS 类任务建议同时报告分层 R²/AUC 与衰减比。目录本身的 harmonised sumstats 是最便捷的外部验证素材来源。


§6 AI 就绪指南

§6.1 快速上手

以下代码预期目录结构:data_root/gwas-catalog/downloads/ 下放官方三个 TSV(见 §4.0 目录树);data_root 为你的数据根目录,与 DATA_ROOT 变量拼接。最小可用子集是 All associations 表 + ancestry 表(约 200 MB),不需要碰 56 TB 的 sumstats 即可完成大多数"证据聚合类"任务。

import pandas as pd, os

DATA_ROOT = os.environ.get("DATA_ROOT", "./data")
BASE = os.path.join(DATA_ROOT, "gwas-catalog", "downloads")

# 官方表为大文件,按需指定 dtype 并注意低内存读取
assocs = pd.read_csv(
    os.path.join(BASE, "gwas-association-studies-annotated_v1.0.2.1.tsv.gz"),
    sep="\t", compression="gzip", low_memory=False,
)
print(assocs.shape)   # ~62.5 万行 x 40+ 列(随双周发布浮动)

# 三条最高频操作
t2d = assocs[assocs["MAPPED_TRAIT"].str.contains("type 2 diabetes", case=False, na=False)]
sig = assocs[assocs["P-VALUE"] != "NR"]                      # 剔除未报告 P 值行
big = assocs[pd.to_numeric(sig["OR or BETA"], errors="coerce").notna()]  # 有效应量的子集

§6.2 数据获取

通道 获取方式 体量 前置条件
curated 表 downloads 页直接下载 zip ~200 MB 无(开放)
汇总统计 sumstats 页或 FTP 按 accession 下载 单个数百 MB–数十 GB 无(2021-03 后 CC0;此前 EBI Terms of Use)
REST API API 文档按 accession/PMID/性状查询 按需 无(注意限速,建议缓存)
deposition(提交向) deposition 门户 — 仅数据提交者使用
# 示例:按 accession 下载 harmonised 汇总统计(千位分箱路径)
ACC=GCST90270927
FTP_BASE="https://ftp.ebi.ac.uk/pub/databases/gwas/summary_statistics"
BIN="GCST90270901-GCST90271000"      # accession 所在千位分箱目录
curl -O "${FTP_BASE}/${BIN}/${ACC}/harmonised/${ACC}.h.tsv.gz"
curl -O "${FTP_BASE}/${BIN}/${ACC}/harmonised/${ACC}.h.tsv.gz.tbi"
curl -O "${FTP_BASE}/${BIN}/${ACC}/${ACC}-meta.yaml"   # 先读元数据确认 file_type 与 build

§6.3 预处理全流程

目标:把 curated 表清洗为"每行一条可信关联、效应方向明确、性状与 ancestry 可聚合"的分析就绪表。四个阶段依次执行。

阶段一:格式转换与基础清洗。 处理 NR 占位、数值列类型转换、去重(同一变异同一研究可能因复合性状出现多行)。

阶段二:效应量语义分离。 OR 与 beta 混在 OR or BETA 一列,必须先按 P-VALUE_UNIT/置信区间列与关联性状类型判断语义,再拆成两列(见坑点 2)。

阶段三:ancestry 展开。 关联表的 INITIAL SAMPLE SIZE 是自由文本;结构化 ancestry 在独立表。把两表按 accession 联接,把"多 ancestry 混合"行拆解为单 ancestry 组分(见坑点 6)。

阶段四:坐标与链方向统一。 历史数据混合 GRCh37/GRCh38;curated 表的坐标经 Ensembl 映射但未在行内标 build。做跨研究比较前统一 build,或直接改用 harmonised sumstats(见坑点 7)。

import re

def clean_associations(df: pd.DataFrame) -> pd.DataFrame:
    df = df.copy()
    # 1) NR -> NaN 统一化
    df = df.replace({"NR": pd.NA, "NR ": pd.NA})
    # 2) P 值数值化(极小值表示见坑点 8)
    df["pval"] = pd.to_numeric(df["P-VALUE"], errors="coerce")
    df["pval"] = df["pval"].mask(df["pval"] <= 0, pd.NA)   # 防御:0 表示溢出极小值
    # 3) OR/beta 语义拆分:置信区间下限含 "% CI" 的为 OR(95% CI)表述;
    #    定量性状(EFO 含 measurement 类)多为 beta,残余歧义行单独落审计表
    eff = pd.to_numeric(df["OR or BETA"], errors="coerce")
    is_or = (eff > 1) & df["OR or BETA"].notna()            # 粗筛:OR>0 且典型在 (0.5, 5)
    df["or_value"] = eff.where(is_or)
    df["beta_value"] = eff.where(~is_or & eff.notna())
    audit = df[eff.notna() & df["or_value"].isna() & df["beta_value"].isna()]
    # 4) EFO URI 标准化,便于按本体 ID 聚合
    df["efo_id"] = df["MAPPED_TRAIT_URI"].fillna("").str.extract(r"(EFO_\d+)")
    # 5) 去重:同研究同变异同性状保留 P 值最小行
    df = df.sort_values("pval").drop_duplicates(
        subset=["STUDY_ACCESSION", "VARIANT_REPORTED", "efo_id"], keep="first")
    return df, audit

阶段三与阶段四的参考实现(承接上文产物):

def expand_ancestry(assocs: pd.DataFrame, ancestry: pd.DataFrame) -> pd.DataFrame:
    """联接 ancestry 独立表:以 BROADER 粗类别为主分层键,
    保留 accession 级组分原文,不强行拆成单 ancestry 行(坑点 6)。"""
    anc = ancestry.rename(columns={"STUDY ACCESSION": "STUDY_ACCESSION"})
    merged = assocs.merge(
        anc[["STUDY_ACCESSION", "BROADER", "ANCESTRY", "ANCESTRY COUNTS"]],
        on="STUDY_ACCESSION", how="left",
    )
    merged["ancestry_code"] = merged["BROADER"].fillna("Unspecified")
    return merged

def attach_studies(assocs: pd.DataFrame, studies: pd.DataFrame) -> pd.DataFrame:
    """联接 studies 表,补齐泄漏防护所需元数据(§5.3b 依赖 PMID/COHORT 列)。"""
    st = studies.rename(columns={
        "STUDY ACCESSION": "STUDY_ACCESSION", "PUBMEDID": "PMID"})
    return assocs.merge(
        st[["STUDY_ACCESSION", "PMID", "COHORT", "pub_year"]],
        on="STUDY_ACCESSION", how="left")

阶段四(build 统一) 对 curated 表通常退化为"用 VARIANT_REPORTED 的 rsID 重新映射坐标":CHR_ID/CHR_POS 行内不带 build 标注(坑点 7),任何跨库坐标联接前先以 dbSNP/Ensembl 的 rsID→坐标服务归一到目标 build。对 sumstats 则直接采用 harmonised 文件,不自行 liftOver。

需要读 sumstats 时用流式策略,避免把 UKB 级大文件整个载入内存:

import gzip

def iter_sumstats_h(path: str, region: tuple[str, str, int, int] | None = None):
    """逐块读取 harmonised 汇总统计;region=(chrom, 窗口起止) 时仅 yield 区间内变异。
    列名以实际文件表头为准(同目录原始与 harmonised 列名不同,见 §3.2b)。"""
    opener = gzip.open if path.endswith(".gz") else open
    with opener(path, "rt") as f:
        header = f.readline().rstrip("\n").split("\t")
        for line in f:
            row = dict(zip(header, line.rstrip("\n").split("\t")))
            if region:
                chrom, chrun, start, end = region
                if row.get("CHR_ID") != chrom:
                    continue
                if not (start <= int(row["CHR_POS"] or -1) <= end):
                    continue
            yield row

§6.4 PyTorch DataLoader

以"疾病域遗传位点分类器"为例:用 curated 表构造 (位点, 性状族, ancestry, 效应量) 的张量输入,训练一个模型预测关联所属 EFO 大类。数据加载层负责泄漏安全的分组划分。

import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.preprocessing import LabelEncoder

class GWASAssocDataset(Dataset):
    """输入:清洗后的 curated 关联 DataFrame(§6.3 产物)。
    目标列:efo 大类标签;特征:效应量、P 值(-log10)、样本量、ancestry 编码。"""

    def __init__(self, df: pd.DataFrame, group_col: str = "cohort_or_pmid"):
        self.df = df.reset_index(drop=True)
        self.y = LabelEncoder().fit_transform(df["efo_parent"].astype(str))
        feats = df[["or_value", "neg_log10_p", "n_initial", "ancestry_code"]].copy()
        feats = feats.fillna(feats.median(numeric_only=True))
        self.X = torch.tensor(feats.to_numpy(dtype="float32"))
        self.groups = df[group_col].to_numpy()          # 泄漏安全的分组键

    def __len__(self): return len(self.df)
    def __getitem__(self, i): return self.X[i], int(self.y[i])

def group_split(dataset: GWASAssocDataset, val_ratio=0.2, seed=42):
    """按组(cohort/PMID)划分,杜绝 cohort 级泄漏(§5.3)。"""
    import numpy as np
    rng = np.random.default_rng(seed)
    groups = pd.unique(dataset.groups)
    rng.shuffle(groups)
    n_val = int(len(groups) * val_ratio)
    val_groups = set(groups[:n_val])
    is_val = pd.Series(dataset.groups).isin(val_groups).to_numpy()
    return is_val

loader = DataLoader(GWASAssocDataset(clean_df), batch_size=256, shuffle=True, num_workers=2)

§6.5 坑点 8 个

⚠️ 坑点 1:把 lead 关联表当全基因组结果用(分类:评估误用)

问题:curated 表只收录文献报告的独立显著关联(P<1e-5,每 locus 取 lead 变异),全库 62.5 万条记录只覆盖约 66% 研究的汇总统计所代表的极小部分变异。用它做孟德尔随机化、精细定位或 PRS 构造会系统性偏差。
症状:MR 中工具变量数量异常少;fine-mapping 区域内"只有几个可用 SNP";PRS 效应远低于文献基准。
解决:

  1. 简单方法:MR/PRS/fine-mapping 任务一律改从 sumstats 下载页按 accession 取全量统计。
  2. 进阶方法:用 .yaml 元数据确认 file_type 为 GWAS-SSF 且存在 harmonised/ 目录,直接取 .h.tsv(已统一 build 与链方向)。
  3. SOTA 方法:批量任务写 FTP 千位分箱下载器 + tabix 按 region 随取随用,避免整文件落盘。
    参考:官方 summary-statistics 方法文档

⚠️ 坑点 2:OR 与 beta 混存同一列(分类:预处理陷阱)

问题:OR or BETA 列把二分类性状的比值比(OR)与定量性状的回归系数(beta)混在一起,且列名本身不告诉你语义。直接把整列当同一量纲进模型会污染所有依赖效应量的下游计算(如加权 PRS)。
症状:效应分布出现双峰;以 beta 求和的 PRS 中混入 OR 行后权重爆炸或符号翻转;按 OR 解释定量性状关联得出荒谬结论。
解决:

  1. 简单方法:按 P-VALUE 之外附带的置信区间列(95% CI 括号对)与 UNIT 类信息区分;无把握行丢弃进审计表。
  2. 进阶方法:对 OR 统一取 log(OR) 化到加性量纲后再与 beta 并列;注意标准化 beta(per-allele, SD units)与非标准化 beta 仍不同质。
  3. SOTA 方法:跳过 curated 表的效应量列,直接从 harmonised sumstats 重建效应量(beta/SE/等位基因频率齐备且口径统一)。
    参考:GWAS Catalog FAQ:如何区分 OR 与 beta

⚠️ 坑点 3:回文序列与多等位基因位点的链歧义(分类:预处理陷阱)

问题:A/T、C/G 型回文位点的"风险等位基因"在正/负链上无法凭文本区分;多等位基因位点同一 rsID 对应多个 alt allele。下游合并不同研究的效应量时,链不一致会让等位基因对错位,效应方向随机翻转。Open Targets 在对 catalog 数据的工程化 QC 中专门标记了 palindromic alleles、risk allele 无法映射参考基因组等问题(Open Targets 文档)。
症状:合并后同一变异在两研究中效应符号相反;meta 分析异质性 I² 异常高;PRS 评分方向错误且与文献相反。
解决:

  1. 简单方法:合并前用等位基因频率做链一致性校验(EAF 与文献差 >0.5 即疑翻转)。
  2. 进阶方法:以参考基因组(GRCh37/38 FASTA)核对 REF/ALT;回文位点且 EAF 接近 0.5 的行直接剔除。
  3. SOTA 方法:用 harmonised sumstats(官方已对齐正链并统一 build),或复用 Open Targets Gentropy 的 QC flag 清单(palindromic、坐标不一致、lead 重复等)作为剔除规则。
    参考:GWAS-SSF 社区标准

⚠️ 坑点 4:一个论文拆多个 accession 引发的 cohort 泄漏(分类:数据泄漏)

问题:catalog 的最小研究单位是 GCST accession 而非论文——同一 PMID 会因多性状、多 ancestry、discovery/replication 两阶段拆出多个 accession;不同 accession 又可能来自同一 cohort(如同一 UK Biobank 论文族)。按行或按 accession 随机划分训练/测试集会把同一批参与者放进两侧。
症状:验证指标显著虚高且跨 seed 方差极小;模型"学会"的是 cohort 特征而非生物学信号。
解决:

  1. 简单方法:按 PMID 分组划分(同一文献的 accession 永远同侧)。
  2. 进阶方法:解析 ancestry 表与 COHORT 字段聚合 cohort 归属,按 cohort 做 GroupKFold;同一联盟不同论文合并成一个组。
  3. SOTA 方法:时间切分 + cohort 切分双重约束;对 UK Biobank 系超大 cohort 单独留出做"外部集"。
    参考:GWAS Catalog FAQ:publication 与 study 的区别

⚠️ 坑点 5:EFO 映射漂移与复合性状(分类:标签理解)

问题:catalog 的性状有 reported trait(文献原文)与 mapped trait(EFO 术语)两层;映射不是一一对应——一个 EFO 术语可对应多个 reported trait,反之亦然;还有 compound trait(如 “obesity-related traits”)与 background trait(作为协变量背景的性状)特殊形态。版本更迭中映射还会修正,历史快照与最新库不同。
症状:按字符串精确匹配 reported trait 统计出的疾病研究数与他人对不上;聚合后某 EFO 节点下混入了意图之外的性状(如把 “BMI z-score change” 计入肥胖);两次拉取数据图谱结构不同导致下游 ID 断链。
解决:

  1. 简单方法:永远以 MAPPED_TRAIT_URI(EFO ID)而非性状名做聚合键。
  2. 进阶方法:利用官方 GWAS→EFO 映射文件先建 reported↔mapped 全量字典;对 compound trait 用 Open Targets 式的"按关联级 trait 注注解拆分"策略。
  3. SOTA 方法:固定数据版本(记录 r-YYYY-MM-DD)+ 每次同步后对 EFO 图谱做 diff 报告,把映射修正显式纳入数据契约。
    参考:文件下载页的 EFO 映射说明

⚠️ 坑点 6:ancestry 标注的两层结构与 2011 年断点(分类:偏倚陷阱)

问题:结构化 ancestry 不在关联表里,而在独立的 All ancestry 表中(FAQ F);同一 accession 可能报告多个 ancestry 组分(如 “NR, 50% European 50% East Asian”);2011 年前研究的 ancestry 字段未做二次策展,带"Pre-2011 ancestry not double-curated"标志。
症状:直接用 INITIAL SAMPLE SIZE 正则抽 ancestry 会漏掉大量非标准表述;按 ancestry 过滤后样本数对不上 studies 表;做 ancestry 多样性统计时 2011 年前数据系统性低估非欧洲占比。
解决:

  1. 简单方法:改用独立 ancestry 表联接 accession,BROADER 类别列做粗粒度分层。
  2. 进阶方法:保留 accession 级 ancestry 组分表(不强行拆成单 ancestry 行),分析时按组分加权。
  3. SOTA 方法:对 Pre-2011 断点做敏感性分析(含/不含两种口径都报告);引用 GWAS Diversity Monitor 的 wrangled 口径做交叉核对。
    参考:GWAS Catalog FAQ F:population descriptors

⚠️ 坑点 7:双基因组 build 并存与坐标不一致(分类:工程陷阱)

问题:原始汇总统计按提交者所用 build 原样托管(GRCh37 与 GRCh38 混合),curated 表的 CHR_POS 经 Ensembl 映射但行内不带 build 标注;部分行坐标与染色体记录互相矛盾(Open Targets QC 中同样标记了 chromosome/position inconsistent 案例)。
症状:与其他资源(eQTL、ClinVar)坐标联接后大量错配;按 region 提取 sumstats 提取到错误区段;tabix 查询静默返回空。
解决:

  1. 简单方法:统一先跑 rsID→坐标的 Ensembl remapping,不信任行内坐标。
  2. 进阶方法:用 CrossMap/liftOver 对全表做 build 归一,并用基因区间重叠率做质检。
  3. SOTA 方法:直接采用官方 harmonised 文件(统一 build + 正链 + tabix 索引),把 build 记入数据卡元信息。
    参考:summary-statistics 文档的 harmonisation 章节

⚠️ 坑点 8:极小 P 值的表示陷阱(分类:工程陷阱)

问题:文献对超强关联常用"P < 1e-300"类下界表述,catalog 对超出浮点精度的 P 值有特殊表示(FAQ:extremely small p-values 与 p-value annotation 机制);部分汇总统计把溢出的 P 值记为 0。
症状:pd.to_numeric 后出现 0 或异常值;取 -log10 时产生 inf;把 P 值当连续特征训练时极端值主导梯度。
解决:

  1. 简单方法:把 P 值转成 log10p = -log10(max(p, 1e-323)) 前先 clip 到 IEEE754 最小正规范数。
  2. 进阶方法:识别"P < …"式的下界表述,保留为独立布尔特征("是否超出表示精度"本身是信息)。
  3. SOTA 方法:以 chi-square 统计量或 Z 分数(beta/SE)替代 P 值作为强度特征,彻底绕开浮点下界。
    参考:GWAS Catalog FAQ:P 值表示

§6.5b 上线前坑点自查清单

把以下 10 项并入数据卡签发流程,全部通过才算"处理过 catalog 数据":

  • [ ] 定量任务用的是 sumstats 通道而非 lead 关联表(坑点 1)
  • [ ] OR or BETA 列已做语义拆分或整列弃用(坑点 2)
  • [ ] 回文位点与 EAF≈0.5 的变异已剔除或做链校验(坑点 3)
  • [ ] 划分单元是 cohort/PMID 而非行或 accession(坑点 4,§5.3b)
  • [ ] 性状聚合键是 MAPPED_TRAIT_URI 而非 reported trait 字符串(坑点 5)
  • [ ] ancestry 用独立表 BROADER 列,Pre-2011 做了敏感性分析(坑点 6)
  • [ ] 跨库坐标联接前统一了 build,或已改用 harmonised 文件(坑点 7)
  • [ ] P 值经 clip 处理,无 0/inf 进入特征(坑点 8)
  • [ ] 记录了发布版本号 r-YYYY-MM-DD 与文件校验值(§6.10)
  • [ ] 输出按 ancestry 分层报告了指标(§6.9、§7.5)

§6.6 数据增强

安全 ✅:负采样(从基因组随机或按 MAF 匹配抽取非关联位点构造负例); ancestry 加权重采样(缓解欧洲主导);按 EFO 图谱层级做标签平滑(父类软化);对 sumstats 做 LD 区域内的 block jackknife。
危险 ❌:对关联行做 SMOTE 式"合成位点"(位点空间不是度量空间);把同一研究的关联复制到其他性状下当增广(结构性标签污染);在 lead 关联表上做任何形式的"过采样少数 ancestry"后仍当 census 使用(会扭曲多样性别审计结论)。

§6.7 模型推荐

下游任务 推荐方法 输入 说明
多基因风险评分 PRS-CS / LDpred2 / lassosum2 harmonised sumstats + LD 参考面板 贝叶斯或收缩估计,跨 ancestry 需专版参数
孟德尔随机化 TwoSampleMR / IVW + MR-Egger 两个独立性状的 sumstats 工具变量取自 lead 关联(P<5e-8)
精细定位 SuSiE / FINEMAP 区域级 sumstats + LD Open Targets 生产管线同款
关联知识图谱/GNN 异构图模型(publication-study-variant-trait) curated 表 + EFO 图 节点特征用 §6.4 张量化产物
遗传相关 LD Score Regression(LDSC) sumstats 群体级统计 需 Population Prevalence 等元数据

§6.8 硬件需求

任务 最低配置 建议配置
curated 表清洗与统计 8 GB 内存笔记本 32 GB 内存 + NVMe SSD
单个 sumstats 下载与 QC 16 GB 内存 64 GB 内存(大 UKB 级文件需流式读取)
批量 PRS/MR(百数据集级) 16 vCPU 64 vCPU 或 Spark/Dask 集群;磁盘 ≥2 TB
区域级 fine-mapping 32 GB 内存 128 GB 内存 + LD 面板本地缓存

§6.9 评估指标

import numpy as np

def prs_report(y_true, prs, group):
    """PRS 评估三件套:分层 AUC、OR 十分位比、组间衰减比。"""
    from sklearn.metrics import roc_auc_score
    out = {}
    out["auc_overall"] = roc_auc_score(y_true, prs)
    dec = pd.qcut(prs, 10, labels=False)
    out["or_top_bottom_decile"] = (
        (y_true[dec == 9].mean() + 1e-9) / (y_true[dec == 0].mean() + 1e-9))
    for g in pd.unique(group):                      # 按 ancestry 分层报告,暴露偏倚
        m = (group == g)
        out[f"auc_{g}"] = roc_auc_score(y_true[m], prs[m])
    return out

def evidence_coverage(clean_df, efo_id: str) -> float:
    """性状证据覆盖度:该 EFO 性状下带效应量关联占比(数据卡必备项)。"""
    sub = clean_df[clean_df["efo_id"] == efo_id]
    return float(sub[["or_value", "beta_value"]].notna().any(axis=1).mean())

§6.10 MLOps 笔记

  • 版本化是第一原则:每次同步记录 r-YYYY-MM-DD、下载文件 SHA、行数指纹;下游任何指标都要能追回当时的库版本(双周滚动意味着"最新"永远在变)。
  • 数据契约:EFO 映射修正与策展回填会让历史行变化;对 ID 级断链做监控,把 accession 总量、关联总量、EFO 节点量三曲线纳入数据看板(参考 §4.3 基线)。
  • 增量同步:curated 走 REST API 增量、sumstats 按 accession 清单差量下载;FTP 每晚更新,日级任务可挂夜间窗口。
  • 许可合规入流水线:sumstats 的 CC0 与 EBI Terms of Use 分发要求随 accession 元数据一起存档,输出数据卡时自动附许可声明。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
ancestry 代表性偏倚 欧洲 ancestry 研究主导,非欧洲 ancestry 欠采样;PRS 跨人群性能衰减 高 策展优先级已纳入非欧洲 ancestry;使用时按 BROADER ancestry 分层评估
发表与联盟偏倚 大联盟、大样本研究更易发表与被收录;小型单中心研究覆盖不足 中 结合目标域文献人工补充;对"收录≠领域全貌"保持清醒
显著性截断 curated 表仅收 P<1e-5 lead 关联,不反映全基因组架构 高(视任务) 定量任务改用全量 sumstats(坑点 1)
效应量口径混杂 OR/beta 混存、标准化与非标准化 beta 并存 高(视任务) 按 §6.3 阶段二拆分或改用 harmonised sumstats
历史策展深度不均 2011 前 ancestry 未双重策划;EFO 映射随版本修正 中 用官方质量标志做敏感性分析(坑点 6)
性状映射漂移 EFO 版本演进导致跨版本可比性下降 中 锁定数据版本 + 映射 diff 监控(坑点 5)

§7.1b 偏倚自查代码

对目标性状族跑一次 ancestry 分布审计,是使用本资源的第一课(输出可直接进数据卡):

def ancestry_audit(df, efo_ids: list[str] | None = None) -> pd.DataFrame:
    """统计目标 EFO 性状族的 ancestry 分布与 Pre-2011 占比。
    df 为 §6.3 阶段三产物(已联接 ancestry 表)。"""
    sub = df[df["efo_id"].isin(efo_ids)] if efo_ids else df
    audit = (
        sub.groupby("ancestry_code")
        .agg(n_assoc=("ASSOCIATION_ID", "count"),
             n_studies=("STUDY_ACCESSION", "nunique"))
        .sort_values("n_assoc", ascending=False)
    )
    audit["share_pct"] = (audit["n_assoc"] / audit["n_assoc"].sum() * 100).round(2)
    return audit

解读规则:若目标疾病的证据 share 中欧洲 ancestry 占比超过 80%,任何"总体 AUC/R²"数字对非欧洲人群都不具外推性,必须在模型卡写明;ancestry_code == "Unspecified" 占比过高说明联接环节有误(通常是 accession 前后版本不一致),先修数据再谈结论。

§7.2 标注质量

策展质量的整体信誉由三个机制支撑:专业策展团队 + 公开收录标准(criteria)、与 PGS Catalog 的共享词汇校准、以及汇总统计提交的强制格式校验。已知的质量洼地包括:2011 年前 ancestry 字段(显式打标)、早期研究的 rsID 随 dbSNP 版本退役(Ensembl 重映射可救)、以及 compound trait 的粒度不均。总体而言,curated 表的"存在即有出处"特性(每行可回溯 PMID)使其标注可审计性显著优于多数二手聚合资源。

§7.3 泛化性

场景 失效风险 证据/说明
欧洲训练 → 东亚/非洲人群应用 高 遗传效应与 LD 结构跨人群漂移;PRS 跨 ancestry 衰减为公认现象
成人常见病 → 儿童罕见病 高 收录以常见复杂性状为主,罕见病关联覆盖稀疏
文献级证据 → 实时临床风险计算 高 catalog 无个体级数据;临床落地必须叠加本地队列验证
同 ancestry 内跨时间段应用 中 队列世代效应(出生队列、环境变迁)未在本资源内建模
定量性状 → 疾病终点转换 中 EFO 定量性状与 ICD 疾病终点映射需人工审核阈值口径

§7.4 伦理考量

本资源只分发聚合级关联结果与汇总统计,不含个体级基因型或表型,因此不落入样本级基因组数据的管控框架(如 GA4GH Beacon 类隐私议题仍适用于底层队列本身)。需要关注的伦理点:其一,汇总统计在理论上可参与 membership inference 攻击,官方 FAQ 专门讨论了分享汇总统计的隐私风险,提交需通过机构审查;其二,ancestry 标注体系涉及人群命名的敏感性,官方在 NAR 2025 论文中明确讨论了"人群与队列描述符的敏感性使用";其三,遗传风险信息的临床使用涉及知情同意与遗传咨询规范,任何把 PRS 推向临床的动作都受所在辖区监管约束。

§7.5 公平性

catalog 是观察"遗传研究公平性"的最佳标尺:ancestry 表使研究者可以量化每个疾病域的证据分布。对 AI 团队的操作建议:训练任何遗传相关模型前,先按 §6.3 产物统计目标 EFO 性状族的 ancestry 分布;若训练人群与证据人群错位,在模型卡与论文 limitation 中显式声明;对欧洲以外人群的性能预期应基于分层评估而非总量指标。

§7.6 数据漂移

漂移来源有三种:规模性漂移(双周发布使关联数稳定增长,截至 2025-08 已从 62.5 万增至 95.6 万口径);映射性漂移(EFO 版本演进、策展回填导致行级内容修正);结构性漂移(2023-04 起的 GWAS-SSF 与 2026-04 起的 beyond SNPs 标准改变了 sumstats 的形态)。MLOps 层面的对策见 §6.10:版本锚定 + 增量 diff + 三条规模曲线监控。

§7.7 DAIMS 数据集评估

# 检查项 状态 说明
1 宽格式 ✅ curated 表单表宽格式,TTF/CSV 直读
2 唯一标识 ✅ ASSOCIATION_ID 主键 + GCST accession 研究键,三层溯源
3 特殊字符 ⚠️ 自由文本列(性状名、样本描述)含括号/逗号/百分号,TSV 解析需引号策略
4 重复行 ⚠️ 复合性状与多 ancestry 场景产生合法重复,需按(accession, variant, EFO)语义去重
5 缺失编码 ✅ 统一 NR 占位,FAQ 明文解释(§4.5)
6 标签标识 ✅ EFO URI 与 reported trait 双列并存
7 罕见类分组 ✅ 官方 diagram 的 EFO parent term 提供现成分组树
8 偏倚评估 ⚠️ ancestry 偏倚官方承认但无逐性状量化,需使用者自查
9 数据字典 ✅ 下载页每文件附列头说明 + 版本号体系(v1.0.2.1)
10 信息性缺失解释 ✅ NR、Non-GWAS-SSF、not double-curated 标志均有文档含义
11 设备记录 ✅ GENOTYPING TECHNOLOGY 列逐研究记录分型平台
12 共线性 ⚠️ 同 locus 多关联存在 LD 相关,入库层无共线性处理,需下游 LD 修剪
13 编码映射 ✅ GWAS→EFO 映射文件独立提供;OxO 支持 SNOMED 等外联
14 时间戳处理 ⚠️ 无行级时间戳;以发布版本号(r-YYYY-MM-DD)为时间锚
15 划分建议 ❌ 数据库型资源,无官方任务划分(§5)
16 泄漏讨论 ⚠️ FAQ 讨论 publication/study 关系但未讨论 ML 泄漏;本页 §5.3 给出对策
17 标签分布 ✅ 官方 diagram + Diversity Monitor 提供即时分布
18 测量偏倚 ⚠️ 分型芯片差异逐研究记录但无跨平台校准
19 外部验证建议 ✅ harmonised sumstats 即外部验证素材;官方倡导独立复现
20 版本记录 ✅ 双周发布 + FTP 历史版本可回溯
21 预处理脚本 ✅ 官方 harmonisation 管道开源(github.com/EBISPOT/goci,Apache 2.0)
22 合规要求 ✅ 许可分层清晰:EBI Terms of Use / CC0(2021-03 后 sumstats)
23 多模态对齐 ❌ 单模态(GWAS 关联/汇总统计);跨模态需外部资源(eQTL、ClinVar)
24 去标识化 ✅ 聚合级数据,无个体级信息;提交经机构数据共享审查

DAIMS 评分:18.5 / 24

评分解读:作为文献策展型数据库,GWAS Catalog 在标识体系、字典完备、版本管理与许可分层上达到了知识库类资源的最高水准;失分集中在"预测任务适配"维度——无官方划分、无 ML 视角的泄漏讨论、单模态限制、以及历史口径不均(ancestry 断点、映射漂移、OR/beta 混存)。这四类问题全部有可操作的工程对策(本页 §5-§6),不构成弃用理由。

对你意味着什么:若你的任务是证据聚合、知识图谱、遗传先验注入,可以放心直接采用(扣分项基本不触发);若任务是定量建模(PRS/MR/fine-mapping),必须绕过 curated 表直接用 harmonised sumstats,并把 §5.3 的 cohort 级划分与 §6.5 的坑点清单写进你的数据卡;无论哪种任务,ancestry 分层评估都应作为默认动作而非可选动作。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
PGS Catalog 评分评估集 PGS Catalog(EBISPOT) 已发表 PRS 的复现评估 分层 AUC/OR 非欧洲目标人群普遍衰减 与 GWAS Catalog 共享 accession 体系,可直接比对训练-验证数据对
UK Biobank 目标性状 UK Biobank 以 catalog sumstats 构造的 PRS 在 UKB 个体级验证 R² / AUC 视性状与 ancestry 而定 个体级验证的社区标准场景
Open Targets Platform EMBL-EBI/工业联盟 GWAS 关联→靶点优先级管线 靶点证据评分 GCCA/GCSS 双通道摄入 真实生产级下游消费案例(含 QC flag 体系)
GWAS Diversity Monitor 牛津 Leverhulme Centre 对 catalog 全库 ancestry 分布的独立 wrangled 复算 覆盖率/占比指标 与官方口径偶有滞后 独立口径交叉核对的最佳参照(截至 2025-08:955,930 关联)

§8 基准性能与生态

§8.1 排行榜与代表性结果

GWAS Catalog 是数据资源而非竞赛基准,不存在官方排行榜。社区实际使用的"基准"是各方法团队在 catalog sumstats 上的可复现结果。下表列出最常被复现引用的代表性结果;各行数据来自不同研究、不同性状、不同人群,绝对数值不可直接比较,仅供方法选型参考。

任务/性状 方法 代表性结果 年份 关键技术 完整引用 代码
冠心病 PRS LDpred2 高遗传风险十分位 OR 数倍于低十分位(独立验证集) 2020 LD 参考面板 + 贝叶斯收缩 Privat et al., 2020, Bioinformatics. doi:10.1093/bioinformatics/btz982 bigsnpr
多性状 PRS PRS-CS 跨数据集稳定优于 clumping+p 值阈值法 2019 连续 shrinkage 先验 Ge et al., 2019, Nature Genetics. doi:10.1038/s41588-019-0485-9 prscs
遗传相关 LD Score Regression 数十性状两两遗传相关估计 2015 LD score 校正混杂 Bulik-Sullivan et al., 2015, Nature Genetics. doi:10.1038/ng.3407 ldsc
精细定位 SuSiE 区域内可信集估计 2020 迭代求粗去细 Wang et al., 2020, Nature Genetics. doi:10.1038/s41588-020-0697-6 susieR
2 型糖尿病 GWAS DIAMANT 联盟 数百个独立位点(含多种族 meta) 2022 跨 ancestry meta 分析 Mahajan et al., 2022, Nature Genetics. doi:10.1038/s41588-022-01119-5 —
精神分裂症 GWAS PGC 2022 287 个全基因组显著位点 2022 7.6 万病例大联盟 Trubetskoy et al., 2022, Nature. doi:10.1038/s41586-022-04434-5 PGC

§8.2 SOTA 总结与选型建议

  • PRS 方法选型:跨人群目标首选 PRS-CS 系列(含 PRS-CSx 多人群版);单人群精细调参用 LDpred2;需要鲁棒基线用 lassosum2。
  • MR 选型:TwoSampleMR 是事实标准工作流;工具变量一律取全基因组显著 lead(P<5e-8);多方法交叉验证(IVW + MR-Egger + 加权众数)后再下结论。
  • fine-mapping 选型:SuSiE 为主流默认;必须配 LD 参考面板且注意面板人群与 sumstats 人群一致。
  • 共性原则:所有方法都要求"构造集、调参集、验证集"三分离(§5.2),且一律从 sumstats 通道取数(坑点 1)。

§8.3 评测协议

社区评测的收敛协议:同一性状取两个独立 GWAS(不同 cohort);方法在 A 数据集构造评分、在 B 数据集验证;报告分层 R²(定量)或 AUC/OR 十分位比(二分类),并按 ancestry 分层重复。任何只报总量指标、不报分层的评测结论在投稿评审中会遭遇挑战。

投稿级复现清单(评审人通常会逐项核对):

  1. 两个 GWAS 的 GCST accession 与各自样本量、ancestry 构成;
  2. 构造集与验证集的样本重叠声明(零重叠才有因果/泛化结论效力);
  3. 汇总统计版本(r-YYYY-MM-DD)与是否用 harmonised 文件;
  4. LD 参考面板的身份与人群匹配声明(如 1000G EUR / UKB EUR);
  5. 品质控制阈值(P 值阈值、MAF 阈值、clumping 参数或先验参数);
  6. 分层结果:主 ancestry + 每个非欧洲 ancestry 组分的 R²/AUC 衰减比;
  7. 代码与随机种子(PRS-CS/LDpred2 的 MCMC seed 会影响可复现性)。
数据集 关系 场景搭配
PGS Catalog 姊妹资源(共享团队/术语) PRS 评分检索与性能复现
Open Targets Platform 下游消费方 靶点优先级、药物重定位
dbGaP / UK Biobank / All of Us 个体级队列 个体级验证与跨 ancestry 复制
GTEx / eQTL Catalogue 分子层资源 关联位点的因果基因 colocalization
ClinVar / OMIM 变异-疾病临床注释 高外显率变异与常见变异证据合并
PhenoScanner 表型查询引擎 暴露-结局快速检索(MR 前置筛选)

§8.5 关键论文 Top 7

  1. Cerezo M, Sollis E, Ji Y, et al. The NHGRI-EBI GWAS Catalog: standards for reusability, sustainability and diversity. Nucleic Acids Research, 2025, 53(D1): D998-D105. doi:10.1093/nar/gkae1070 — 最新数据库论文,确立 GWAS-SSF 与多样性策略。
  2. Sollis E, Mosaku A, Abid A, et al. The NHGRI-EBI GWAS Catalog: knowledgebase and deposition resource. Nucleic Acids Research, 2023, 51(D1): D977-D985. doi:10.1093/nar/gkac1010 — deposition 门户与知识库定位。
  3. Buniello A, MacArthur JAL, Cerezo M, et al. The NHGRI-EBI GWAS Catalog of published genome-wide association studies, targeted arrays and summary statistics 2019. Nucleic Acids Research, 2019, 47(D1): D1005-D1012. doi:10.1093/nar/gky1120 — 引用量最高的版本(Google Scholar 4,683,截至 2026-09)。
  4. MacArthur J, Bowler E, Cerezo M, et al. The new NHGRI-EBI Catalog of published genome-wide association studies (GWAS Catalog). Nucleic Acids Research, 2017, 45(D1): D896-D901. doi:10.1093/nar/gkw1133 — 2015 重构与新基础设施。
  5. Welter D, MacArthur J, Morales J, et al. The NHGRI GWAS Catalog, a curated resource of SNP-trait associations. Nucleic Acids Research, 2014, 42(D1): D1001-D1006. doi:10.1093/nar/gkt1229 — EFO 映射体系奠基。
  6. Hindorff LA, Sethupathy P, Junkins HA, et al. Potential etiologic and functional implications of genome-wide association loci for human diseases and traits. PNAS, 2009, 106(23): 9362-9367. doi:10.1073/pnas.0903103106 — catalog 概念起源与复杂性状架构首证。
  7. Karjalainen MK, et al. (GWAS-SSF working group) A community driven GWAS summary statistics standard. bioRxiv 2022.07.15.500230 — GWAS-SSF 标准全文。

§8.6 社区活跃度

官方渠道:Twitter/X 账号 @GWASCatalog 发布更新公告;GitHub(EBISPOT/goci)开源仓库持续接受 issue;帮助邮箱 gwas-info@ebi.ac.uk。引用轨迹(Europe PMC,截至 2026-06-27):Buniello 2019 被引 3,170 次、Welter 2014 被引 2,173 次、MacArthur 2017 被引 1,723 次,说明其作为方法学基础设施的持续高消耗。2019 论文自述的界面年独立用户约 9 万(截至 2018-09 的 12 个月窗口),此后未再公布同口径数字。

§8.7 生态快照

资源 类型 链接 Star/热度口径(截至 2026-09) 推荐理由
EBISPOT/goci 官方代码仓库 https://github.com/EBISPOT/goci 开源(Apache 2.0),issue 活跃 策展与 harmonisation 管道透明可审计
GWAS-SSF 规范 社区标准 https://github.com/EBISPOT/gwas-ssf 标准规范库 sumstats 解析器的对齐目标
TwoSampleMR R 包 https://github.com/MRCIEU/TwoSampleMR MR 事实标准 直接消费 catalog sumstats
bigsnpr/LDpred2 R 包 https://github.com/privefl/bigsnpr PRS 主流实现 内置 UKB/LD 面板工作流
GWAS Diversity Monitor 独立监测面板 https://gwasdiversitymonitor.com 持续更新(截至 2025-08 数据) ancestry 多样性的独立口径
PGS Catalog 姊妹数据库 https://www.pgscatalog.org 与 catalog 同步演化 PRS 检索与评分元数据

§9 相关资源与引用

§9.1 官方资源

资源 链接 说明
主页与检索界面 https://www.ebi.ac.uk/gwas/ 按文献/研究/性状/变异/基因检索
文件下载中心 https://www.ebi.ac.uk/gwas/downloads curated 三表 + EFO 映射文件
汇总统计下载 https://www.ebi.ac.uk/gwas/downloads/summary-statistics 按 accession 浏览与下载
REST API 文档 https://www.ebi.ac.uk/gwas/docs/api curated 数据程序化访问
汇总统计 API https://www.ebi.ac.uk/gwas/summary-statistics/api/ sumstats 程序化访问
FAQ https://www.ebi.ac.uk/gwas/docs/faq 使用者必读,含坑点官方答案
收录标准 https://www.ebi.ac.uk/gwas/docs/methods/criteria 文献纳入判据
汇总统计方法文档 https://www.ebi.ac.uk/gwas/docs/methods/summary-statistics GWAS-SSF、harmonisation、许可
deposition 门户 https://www.ebi.ac.uk/gwas/deposition 作者直投 sumstats
代码仓库 https://github.com/EBISPOT/goci 开源基础设施(Apache 2.0)

§9.1b 高频问题 FAQ

以下问题来自官方 FAQ 与社区最高频的使用争议,答案均以官方文档为准:

问题 答案
catalog 收录个体级基因型数据吗? 不收录。catalog 只有文献策展的 lead 关联与聚合级汇总统计;个体级数据需去 dbGaP、UK Biobank、All of Us 等队列申请。
"7 万项研究"的说法对吗? 不对,常见混淆来源有二:144,387 是 study accessions 相关的计数口径,而实际独立 GWAS 分析约 10.9 万项(截至 2024-07),文献约 7 千篇(最新口径 7,369)。引用时以 NAR 数据库论文口径为准。
lead 关联表为什么比某些论文报告的位点数多? 策展阈值为 P<1e-5(比全基因组显著的 5e-8 宽松),且一篇文献的多性状、多 ancestry 分析分别收录;955,930 条关联中 801,091 条达 5e-8(截至 2025-08)。
同一性状在不同版本下关联数变了,是错了吗? 不是。EFO 映射会随本体版本修正,策展也会回填历史条目;请锁定版本号并做 diff(坑点 5、§6.10)。
可以下载全部 56 TB 汇总统计建本地镜像吗? 技术上可行但不务实:文件每晚新增、双周滚动发布;请按性状/accession 增量下载,配 tabix 索引按区域取数(§3.4、§6.2)。
引用 catalog 该引哪篇论文? 引与你使用版本时代最近的数据库论文(2026 年使用引 Cerezo 2025),并注明下载日期与发布版本号(§9.3)。
ancestry 字段里的 “NR” 是什么意思? 文献未报告 ancestry;2011 年前研究的 ancestry 字段未做二次策展,相关行带历史质量标志(坑点 6)。

§9.2 BibTeX 引用块

@article{cerezo2025gwas,
  title   = {The {NHGRI-EBI} {GWAS} Catalog: standards for reusability, sustainability and diversity},
  author  = {Cerezo, Maria and Sollis, Elliot and Ji, Yue and Lewis, Elizabeth and Abid, Ala and Bircan, Karatu{\u{g}} Ozan and Hall, Peggy and Hayhurst, James and John, Sajo and Mosaku, Abayomi and Ramachandran, Santhi and Foreman, Amy and Ibrahim, Arwa and McLaughlin, James and Pendlington, Zo{\"e} and Stefancsik, Ray and Lambert, Samuel A and McMahon, Aoife and Morales, Joannella and Keane, Thomas and Inouye, Michael and Parkinson, Helen and Harris, Laura W},
  journal = {Nucleic Acids Research},
  volume  = {53},
  number  = {D1},
  pages   = {D998--D1005},
  year    = {2025},
  doi     = {10.1093/nar/gkae1070}
}

@article{sollis2023gwas,
  title   = {The {NHGRI-EBI} {GWAS} Catalog: knowledgebase and deposition resource},
  author  = {Sollis, Elliot and Mosaku, Abayomi and Abid, Ala and Buniello, Annalisa and Cerezo, Maria and Gil, Laurent and Groza, Tudor and G{\"u}nes, Osman and Hall, Peggy and Hayhurst, James and Ibrahim, Arwa and Ji, Yue and John, Sajo and Lewis, Elizabeth and MacArthur, Jacqueline A L and McMahon, Aoife and Osumi-Sutherland, David and Panoutsopoulou, Kalliope and Pendlington, Zo{\"e} and Ramachandran, Santhi and Stefancsik, Ray and Stewart, Jonathan and Whetzel, Patricia and Wilson, Robert and Hindorff, Lucia and Cunningham, Fiona and Lambert, Samuel A and Inouye, Michael and Parkinson, Helen and Harris, Laura W},
  journal = {Nucleic Acids Research},
  volume  = {51},
  number  = {D1},
  pages   = {D977--D985},
  year    = {2023},
  doi     = {10.1093/nar/gkac1010}
}

@article{buniello2019gwas,
  title   = {The {NHGRI-EBI} {GWAS} Catalog of published genome-wide association studies, targeted arrays and summary statistics 2019},
  author  = {Buniello, Annalisa and MacArthur, Jacqueline A L and Cerezo, Maria and Harris, Laura W and Hayhurst, James and Malangone, Cinzia and McMahon, Aoife and Morales, Joannella and Mountjoy, Edward and Sollis, Elliot and Suveges, Daniel and Vrousgou, Olga and Whetzel, Patricia L and Amode, Ridwan and Guillen, Jose A and Riat, Harpreet S and Trevanion, Stephen J and Hall, Peggy and Junkins, Heather and Flicek, Paul and Burdett, Tony and Hindorff, Lucia A and Cunningham, Fiona and Parkinson, Helen},
  journal = {Nucleic Acids Research},
  volume  = {47},
  number  = {D1},
  pages   = {D1005--D1012},
  year    = {2019},
  doi     = {10.1093/nar/gky1120}
}

§9.3 引用指南

  • 引用关联数据本体:引 Cerezo 2025(或与你使用的版本时代最近的数据库论文),并注明数据下载日期与发布版本号(r-YYYY-MM-DD)。
  • 引用单个汇总统计数据集:在正文中给出 GCST accession,并按官方 FAQ"如何引用下载的汇总统计"指引注明原始论文。
  • 引用本页面:千方病案医数集条目页(qianfanghub.com/ai-ready-dataset/gwas-catalog/564),注明访问日期。

§10 AI 使用声明卡

§10.1 AI 模型列表

本页面由千方病案医学编辑部生产管线使用大型语言模型辅助撰写;检索核实使用 WebSearch 工具。具体模型版本随生产批次记录于编辑部内部台账。

§10.2 AI 参与范围

AI 参与:资料聚合与结构化、初稿撰写、代码示例生成、表格整理。AI 不参与:医学事实与数字的最终判定(全部数字须经检索来源核实)、审核签发、免责声明内容。

具体到本页面:

生产环节 AI 角色 人工把关点
规模数字与版本时间轴 检索聚合、初稿 逐数对照 NAR 论文与 Diversity Monitor 原始口径
种子信息证伪 提出"7 万+研究"存疑并给出反证 复核检索链条后确认证伪结论(§10.4)
数据结构与字段字典 依官方文档整理 对照官方列头说明逐列核对
代码示例(§6、§7、§3.11) 生成与走查 可运行性人工复核、官方 API/路径核对
医学背景(§2) 初稿 ICD-11/SNOMED 编码人工复核
免责声明与审核签发 不参与 编辑部定稿

§10.3 输入来源列表

  1. Cerezo M, et al. The NHGRI-EBI GWAS Catalog: standards for reusability, sustainability and diversity. Nucleic Acids Research, 2025, 53(D1): D998-D1005. doi:10.1093/nar/gkae1070
  2. Sollis E, et al. The NHGRI-EBI GWAS Catalog: knowledgebase and deposition resource. Nucleic Acids Research, 2023, 51(D1): D977-D985. doi:10.1093/nar/gkac1010
  3. Buniello A, et al. The NHGRI-EBI GWAS Catalog of published genome-wide association studies, targeted arrays and summary statistics 2019. Nucleic Acids Research, 2019, 47(D1): D1005-D1012. doi:10.1093/nar/gky1120
  4. MacArthur J, et al. The new NHGRI-EBI Catalog of published genome-wide association studies (GWAS Catalog). Nucleic Acids Research, 2017, 45(D1): D896-D901. doi:10.1093/nar/gkw1133
  5. Welter D, et al. The NHGRI GWAS Catalog, a curated resource of SNP-trait associations. Nucleic Acids Research, 2014, 42(D1): D1001-D1006. doi:10.1093/nar/gkt1229
  6. Hindorff LA, et al. Potential etiologic and functional implications of genome-wide association loci for human diseases and traits. PNAS, 2009, 106(23): 9362-9367. doi:10.1073/pnas.0903103106
  7. Karjalainen MK, et al. A community driven GWAS summary statistics standard. bioRxiv 2022.07.15.500230. doi:10.1101/2022.07.15.500230
  8. GWAS Catalog FAQ. https://www.ebi.ac.uk/gwas/docs/faq(检索于 2026-09)
  9. GWAS Catalog file-downloads 文档. https://www.ebi.ac.uk/gwas/docs/file-downloads(检索于 2026-09)
  10. GWAS Catalog summary-statistics 方法文档. https://www.ebi.ac.uk/gwas/docs/methods/summary-statistics(检索于 2026-09)
  11. GWAS Diversity Monitor Additional Information. https://gwasdiversitymonitor.com/additional-information(检索于 2026-09)
  12. Open Targets Platform 数据源文档(Gentropy). https://platform-docs.opentargets.org/gentropy/data-sources(检索于 2026-09)
  13. NHGRI-EBI GWAS Catalog 主页. https://www.ebi.ac.uk/gwas/(检索于 2026-09)
  14. NGDC Database Commons:GWAS Catalog 条目(引用数口径). https://ngdc.cncb.ac.cn/databasecommons/database/id/1865(检索于 2026-09)

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
规模数字(§1、§3、§4.3) 千方病案医学编辑部 对照 NAR 2025 论文与 Diversity Monitor 逐数核对 ✅ 已通过
医学背景与 ICD-11/SNOMED 映射(§2) 千方病案医学编辑部 标准编码人工复核 ✅ 已通过
数据结构与 DAIMS 字段字典(§4) 千方病案医学编辑部 对照官方列头说明与 FAQ ✅ 已通过
预处理 Pipeline 与坑点(§6) 千方病案医学编辑部 代码走查 + 官方文档逐条溯源 ✅ 已通过
许可与合规(§0、§7.4、§9) 千方病案医学编辑部 对照官方许可政策声明 ✅ 已通过
种子规模核对结论 千方病案医学编辑部 检索证伪记录(7 万+研究 → 实为约 7 千篇文献) ✅ 已通过

§10.5 AI 生成章节标注

§1-§10 各章初稿由 AI 生成;§0 免责声明与 §10.4 校验结论为编辑部人工定稿。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)。

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • 1000-genomes — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • gwas-catalog — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • hprc — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • gtex — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • gtex — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • vanderbilt-sd-biovu — 共享标签:基因组学与多组学 / GWAS / 测序数据
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集