信息速览
INFOBOX
| 数据集名称 | 1000 Genomes Project (1KGP) |
| 英文全称 | The 1000 Genomes Project Consortium |
| 别名 / 简称 | 1KGP、1000G、千基因组、Phase 3、30× 重测序 |
| 疾病分类 | 非疾病特定——全人类遗传变异参考图谱。覆盖所有 ICD-11 章节的常见病、罕见病和药物基因组学变异 |
| SNOMED CT | 不直接映射——1KGP 为群体遗传学参考资源,非临床诊断数据 |
| 数据模态 | 全基因组测序 (WGS) + 全外显子测序 (WES) + SNP 微阵列基因分型 |
| AI 任务类型 | 基因型填补参考面板、多基因风险评分 (PRS) LD 参考、群体遗传学推断、变异致病性过滤、深度学习变异检出训练 |
| 样本总数 | 2,504 人 (Phase 3) / 3,202 人 (2022 30× 重测序, 含 602 三人组) |
| 数据大小 | Phase 3: ~16 TB (BAM) / ~500 GB (VCF); 30× 重测序: ~40 TB (CRAM) |
| 数据格式 | VCF (变异调用) / BAM (序列比对) / CRAM (高压缩比对) / PED (样本信息) |
| 许可证 | Phase 1: CC BY-NC-SA; Phase 3 及 30×: 完全开放 (无使用限制) |
| 访问级别 | 完全开放 (FTP / IGSR / ENA / SRA 直接下载) |
| DUO 标签 | N/A (无表型数据, 纯基因组变异数据) |
| 语言 | 英文 (元数据与文档) |
| 首发日期 | 2008-01 (项目启动); 2010-10 (Pilot 论文, Nature); 2015-10 (Phase 3 旗舰论文, Nature) |
| 最后更新 | 2022-05 (30× 高深度重测序, Byrska-Bishop et al., Cell) |
| 发布机构 | 1000 Genomes Project Consortium (Wellcome Sanger Institute, Broad Institute, BGI-Shenzhen, NHGRI, EMBL-EBI 等) |
| 官方主页 | https://www.internationalgenome.org/ |
| 下载地址 | ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/ |
| DOI | 10.1038/nature15393 (Phase 3) / 10.1016/j.cell.2022.08.004 (30× 重测序) |
| 引用次数 | 19,700+ (Phase 3 旗舰论文, Google Scholar, 截至 2026-07) |
| AI 就绪度评分 | ⭐⭐⭐⭐⭐ (5/5) — 全球 GWAS 基因型填补事实标准参考面板; 5,008 分阶段单倍型; 完全开放; 多种格式; 持续维护 (IGSR) |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
权威来源:本条目所有事实、统计数字与方法学描述均直接溯源至以下一手权威来源:
- Phase 3 旗舰论文:The 1000 Genomes Project Consortium (Auton A, Brooks LD, Durbin RM, Garrison EP, Kang HM, Korbel JO, Marchini JL, McCarthy S, McVean GA, Abecasis GR). A global reference for human genetic variation. Nature 526:68–74, 2015. DOI: 10.1038/nature15393. (19,700+ 引用)
- 结构变异论文:Sudmant PH, Rausch T, Gardner EJ, et al. An integrated map of structural variation in 2,504 human genomes. Nature 526:75–81, 2015. DOI: 10.1038/nature15394. (2,300+ 引用)
- 30× 高深度重测序论文:Byrska-Bishop M, Evani US, Zhao X, et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell 185(18):3426–3440, 2022. DOI: 10.1016/j.cell.2022.08.004.
- Pilot 论文:The 1000 Genomes Project Consortium. A map of human genome variation from population-scale sequencing. Nature 467:1061–1073, 2010. DOI: 10.1038/nature09508.
- Phase 1 论文:The 1000 Genomes Project Consortium. An integrated map of genetic variation from 1,092 human genomes. Nature 491:56–65, 2012. DOI: 10.1038/nature11632.
- IGSR (国际基因组样本资源):https://www.internationalgenome.org/ — 数据托管与持续维护方 (EMBL-EBI + NHGRI)。
作者团队来自 Wellcome Sanger Institute (Gonçalo Abecasis, Richard Durbin)、Broad Institute (Eric Banks, Stacey Gabriel)、BGI-Shenzhen (Jun Wang)、NHGRI (Lisa Brooks)、EMBL-EBI (Laura Clarke, Paul Flicek) 等国际顶尖基因组学机构。
医学审核者:[千方病案医学编辑部]交叉审核:§2 群体遗传学背景(变异分类、选择信号、疾病关联)、§7 已知偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 生物信息学数据工程师,审核范围:§3 变异检出流程、§4 VCF 数据结构、§6 AI 就绪指南代码和坑点。
审核日期:2026-08-03
利益冲突声明:千方病案医数集与 1000 Genomes Project Consortium 或 IGSR 无商业利益关联。本页面不销售 1KGP 数据集本身,仅提供 AI 就绪指南与学术信息服务。
医疗免责声明:本页面提供的遗传学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。1KGP 的变异频率数据应用于临床决策时必须结合 ACMG/AMP 变异分类标准和专业遗传咨询。种群等位基因频率不能单独用于判定变异致病性。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。
数据使用合规:1KGP Phase 3 及 30× 重测序数据为完全开放获取,无使用限制。Phase 1 数据的 CC BY-NC-SA 许可要求使用时注明来源。样本 DNA 可通过 Coriell Institute for Biomedical Research 购买用于实验验证。
§1 数据集概览
1.1 30 秒速览
1000 Genomes Project(1KGP,千人基因组计划)是人类基因组学史上最具影响力的群体遗传变异数据集。项目于 2008 年启动,由 Wellcome Sanger Institute、Broad Institute、BGI-Shenzhen 等机构联合执行,目标是通过大规模全基因组测序构建人类遗传变异的完整目录。Phase 3(2015 年发表于 Nature)对来自全球 26 个群体的 2,504 名个体进行了 7.4× 低覆盖全基因组测序和 65.7× 深度外显子测序,鉴定出 8,800 万+ 变异位点(84.7M SNP + 3.6M indel + 68,818 SV),构建了 5,008 条分阶段单倍型参考面板。2022 年,Byrska-Bishop 等人在 Cell 上发布了 30× 高深度重测序数据,将样本扩展至 3,202 人并包含 602 个三人组家系。
1KGP 的核心战略价值在于它定义了人类遗传变异的"通用语言":它不仅是 GWAS 基因型填补的事实标准参考面板(通过 Minimac4、IMPUTE5、Beagle 5 等工具服务于全球数万项遗传学研究),还是多基因风险评分(PRS)的 LD 参考矩阵、ACMG/AMP 变异致病性分类的群体频率过滤基准、以及群体遗传学推断(LD 衰减、FST 群体分化、自然选择信号检测)的首选数据源。Phase 3 旗舰论文已获 19,700+ 引用,是人类遗传学领域被引最高的论文之一。
1.2 战略价值分析
| 价值维度 | 具体体现 | 影响范围 |
|---|---|---|
| 基因型填补参考面板 | 5,008 条分阶段单倍型覆盖 26 群体,全球 GWAS 研究的标准参考面板 | 服务于 10,000+ GWAS 研究,TOPMed/HRC/gnomAD 面板均以 1KGP 为基础或校准对象 |
| 变异频率数据库 | 84.7M SNP 的群体分层等位基因频率,5 超群 × 26 群体分层 | gnomAD、ClinVar 变异解释的频率交叉验证基准;ACMG BA1 标准(≥5%)的默认数据源 |
| 群体遗传学基准 | LD 衰减曲线、FST 群体分化系数、单倍型多样性、选择信号(iHS/XP-EHH) | 人类迁徙历史重建、群体 bottleneck 分析、正向选择位点鉴定 |
| 方法学开发平台 | 变异检出算法(GATK/DeepVariant)、分阶段算法(SHAPEIT/Beagle)、填补算法(Minimac/IMPUTE)的基准测试数据集 | 几乎所有基因组学分析工具的发布均以 1KGP 数据验证 |
| 临床变异过滤 | 群体常见变异(MAF≥1%)的过滤,排除良性多态性 | ACMG/AMP 变异分类 BA1/BS1 标准的直接数据来源 |
| 跨群体 PRS 校准 | 26 群体 LD 结构差异为 PRS-CSx 等跨群体方法提供校准基础 | 解决 PRS 在非欧洲血统群体中性能下降的关键参考 |
1.3 横向对比:1KGP 与主要基因组变异数据库
| 维度 | 1000 Genomes (Phase 3) | gnomAD v4 | UK Biobank | TOPMed |
|---|---|---|---|---|
| 样本量 | 2,504 | 807,162 | 500,000 (WES) / 50,000 (WGS) | 132,345 |
| 测序策略 | WGS 7.4× + WES 65.7× | WES (~100×) / WGS (~30×) | WES (~100×) / WGS (~30×) | WGS (~30×) |
| 群体多样性 | 26 群体 / 5 超群(最佳) | 8 群体(有限) | 以欧洲血统为主 (~94%) | 多群体但偏非裔 |
| 变异总数 | 88M (84.7M SNP + 3.6M indel) | 12M+ SNP (exome) | 22M+ variant (WGS) | 461M variant |
| 分阶段单倍型 | 5,008(完全分阶段) | 无(仅等位基因频率) | 部分(50K WGS 有) | 无(仅基因型) |
| 数据类型 | WGS + WES + 微阵列 | WES + WGS | WES + WGS + 微阵列 + 表型 | WGS + 表型 |
| 表型深度 | 无表型数据 | 极有限(仅遗传祖先) | 极深(医疗记录、影像、生活方式) | 中等(队列特异性) |
| SV 数据 | 68,818 SV(9 算法集成) | ~500K SV (gnomAD-SV v4) | ~50K SV (UKB-SV) | ~130K SV (TOPMed-SV) |
| 许可 | 完全开放 | �开但需数据访问协议 | 受控访问(申请审批) | 受控访问(dbGaP) |
| 核心用途 | 填补参考面板 + 群体遗传学 | 变异频率过滤 + 罕见病诊断 | GWAS + PRS + 流行病学 | 罕见变异发现 + 多群体 GWAS |
| 引用数 | 19,700+ | 5,000+ | 15,000+ | 3,000+ |
关键区别:1KGP 的独特优势在于其无与伦比的群体多样性(26 个精细标注的全球群体)和完全分阶段的单倍型数据(5,008 条)。虽然样本量远小于 gnomAD 或 UK Biobank,但 1KGP 仍然是基因型填补和群体遗传学分析的首选参考面板——因为填补质量取决于参考面板的群体匹配度和单倍型多样性,而非纯粹样本量。gnomAD 在变异频率过滤(特别是罕见变异频率)方面已超越 1KGP,但在填补参考和群体遗传学分析中 1KGP 仍不可替代。
1.4 版本演进时间轴
| 版本 | 年份 | 样本量 | 关键里程碑 | 论文 |
|---|---|---|---|---|
| Pilot 阶段 | 2008–2010 | 179–800 | 3 个 Pilot 策略验证:低覆盖 WGS (4×)、高覆盖 WGS (42×)、三群体 WES (50×) | Nature 467:1061, 2010 |
| Phase 1 | 2011–2012 | 1,092 | 14 群体整合 WGS (4.6×) + WES (57×) + 微阵列;38M SNP | Nature 491:56, 2012 |
| Phase 3 | 2013–2015 | 2,504 | 26 群体 WGS (7.4×) + WES (65.7×);88M 变异;5,008 单倍型;SV 图谱 | Nature 526:68, 2015 |
| 30× 重测序 | 2019–2022 | 3,202 | 30× 高深度 WGS(GRCh38);602 三人组家系;新变异检出流程 | Cell 185:3426, 2022 |
| IGSR 持续维护 | 2015–至今 | — | 数据重注释、新群体样本添加、CRAM 格式迁移、持续质量改进 | https://www.internationalgenome.org/ |
1.5 典型 AI 应用场景
| 应用场景 | 描述 | 依赖的 1KGP 特性 |
|---|---|---|
| GWAS 基因型填补 | 将微阵列基因型数据填补至全基因组变异,大幅提升变异覆盖率和有效样本量 | 5,008 分阶段单倍型参考面板 |
| 多基因风险评分 (PRS) | 计算 LD 参考矩阵,校准效应量 shrinkage,评估多基因模型 | LD 结构(R² 矩阵)、26 群体分层 |
| 变异致病性过滤 | 利用群体等位基因频率排除常见良性多态性,辅助罕见病变异优先级排序 | 26 群体分层等位基因频率 |
| 群体遗传学推断 | 重建人类迁徙历史,检测自然选择信号,估计群体分化时间 | FST、LD 衰减、单倍型多样性 |
| 跨群体 PRS 校准 | 使用 26 群体 LD 差异校准跨血统多基因评分模型 | 多群体 LD 参考(PRS-CSx) |
| 深度学习变异检出 | 训练 DeepVariant 等深度学习变异检出器,使用 1KGP 作为真值集 | 高置信度变异集合 (GIAB 合并) |
| 变异注释频率基准 | 为 VEP/ANNOVAR 等注释工具提供群体频率注释源 | 84.7M SNP 频率数据库 |
| 结构变异分析 | SV 基因型填补和频率估计参考 | 68,818 SV 集成图谱 |
§2 群体遗传学背景
理解 1KGP 数据的科学价值,需要掌握群体遗传学的核心概念框架。本节系统介绍变异分类、等位基因频率谱、连锁不平衡与单倍型、人类迁徙历史以及自然选择信号——这些概念直接决定了 1KGP 数据的使用方式和解读逻辑。
2.1 变异分类与生物学基础
人类基因组变异按结构特征分为三大类,1KGP Phase 3 对每类均有系统性鉴定:
| 变异类型 | 定义 | 1KGP 数量 | 检出方法 | 功能影响 |
|---|---|---|---|---|
| SNP(单核苷酸多态性) | 单个碱基替换(A→G, C→T 等) | 84,801,999 | GATK HaplotypeCaller + 24 工具集成 | 编码区:同义/错义/无义突变;调控区:表达量调控 |
| Indel(插入缺失) | 1–50 bp 的插入或缺失 | 3,599,134 | GATK HaplotypeCaller + Scalpel (微卫星) | 移码突变、阅读框改变、剪切位点破坏 |
| SV(结构变异) | >50 bp 的基因组重排 | 68,818 | 9 算法集成(read-pair、read-depth、split-read、组装) | 基因融合、拷贝数变异、位置效应、调控元件破坏 |
SNP 进一步分类:
- 转换(Transition, Ti):嘌呤→嘌呤(A↔G)或嘧啶→嘧啶(C↔T)。在人类基因组中 Ti 发生频率约为 Tv 的 2 倍,因为 CpG 位点的甲基化胞嘧啶自发脱氨导致 C→T 转换。1KGP 数据中 Ti/Tv 比约为 2.0–2.1,是变异检出质量的关键质控指标。
- 颠换(Transversion, Tv):嘌呤↔嘧啶(A↔C, A↔T, G↔C, G↔T)。
按功能区域分类:
| 区域 | 变异后果 | 1KGP 鉴定方法 | 临床意义 |
|---|---|---|---|
| 编码区 - 同义突变 | 氨基酸序列不变 | VEP/SnpEff 注释 | 通常中性,但可影响 mRNA 稳定性 |
| 编码区 - 错义突变 | 氨基酸改变 | VEP/SnpEff 注释 + SIFT/PolyPhen 预测 | 可能影响蛋白功能,需 ACMG 评估 |
| 编码区 - 无义突变 | 提前终止密码子 | VEP/SnpEff 注释 | 常导致功能丧失(LoF),高致病风险 |
| 编码区 - 移码 indel | 阅读框改变 | VEP/SnpEff 注释 | 功能丧失,高致病风险 |
| 剪切位点 | RNA 剪切异常 | VEP 注释(±1,2 bp) | 影响转录本结构,高致病风险 |
| 5’‘’‘’‘’‘’‘’‘’‘’‘/3’‘’‘’‘’‘’‘’‘’‘’’ UTR | mRNA 稳定性和翻译效率 | VEP 注释 | 可能影响基因表达水平 |
| 启动子/增强子 | 调控元件功能改变 | ENCODE/Roadmap 注释 | 影响基因表达调控 |
| 内含子 | 通常中性 | VEP 注释 | 多数中性,深度内含子变异可能影响剪切 |
| 基因间区 | 通常无直接功能 | VEP 注释 | 多数中性,可能含远程调控元件 |
2.2 等位基因频率谱
等位基因频率(MAF, Minor Allele Frequency)是群体遗传学最基础的描述量,也是 1KGP 数据最核心的信息维度。1KGP 按频率将变异分为四类:
| 频率类别 | MAF 范围 | 1KGP 变异数量 | 特征 | 检测可靠性 |
|---|---|---|---|---|
| 常见变异 | MAF ≥ 5% | ~15M | 古老变异,跨群体分布广,多数中性 | 极高(7.4× 即可可靠检测) |
| 低频变异 | 0.5% ≤ MAF < 5% | ~25M | 群体特异性较强,部分受选择压力 | 高 |
| 罕见变异 | 0.1% ≤ MAF < 0.5% | ~20M | 近期突变,高度群体特异 | 中等(7.4× 有 ~75% 检测率) |
| 单例 | MAF < 0.1%(仅 1 杂合子) | ~28M | 个体特异性突变 | 较低(假阳性率较高) |
关键注意:1KGP Phase 3 的 7.4× 低覆盖测序对罕见变异(MAF < 0.1%)的检测率约 75%,意味着约有 25% 的真实罕见变异被遗漏。这是 30× 重测序项目(2022)的核心动机之一——30× 深度将罕见变异检测率提升至 95%+。对于需要完整罕见变异目录的应用(如罕见病诊断),应使用 gnomAD 或 30× 重测序数据而非 Phase 3。
频率谱的群体差异:
非洲群体(AFR)拥有最高水平的遗传多样性,其变异总数约为非非洲群体的 2 倍。这是因为现代人类在非洲起源并经历了最长的演化历史,积累了更多的遗传变异。走出非洲的群体仅携带了非洲多样性的一部分(“瓶颈效应”),因此非非洲群体的罕见变异比例较低但常见变异比例较高。
2.3 连锁不平衡(LD)与单倍型
连锁不平衡(Linkage Disequilibrium, LD)是指基因组中不同位点的等位基因之间非随机关联的现象。LD 是基因型填补的理论基础——如果两个位点高度连锁(R² > 0.8),则知道一个位点的基因型就可以高度准确地推断另一个位点的基因型。
1KGP 提供了 26 群体的 LD 结构图谱,其核心价值体现在:
| LD 指标 | 定义 | 1KGP 应用 |
|---|---|---|
| R²(决定系数) | 两位点间的相关性平方,范围 0–1 | 填补质量评估、LD clumping |
| D’‘’‘’‘’‘’‘’‘’‘’'(Lewontin 系数) | 标准化的连锁不平衡系数 | 重组历史推断、单倍型块界定 |
| LD 衰减距离 | R² 降至基线(通常 R²=0.2)所需的物理距离 | 评估群体遗传多样性、选择填补标记密度 |
LD 衰减的群体差异(1KGP Phase 3 数据):
| 超群 | LD 衰减至 R²=0.2 的距离 (kb) | 含义 |
|---|---|---|
| AFR(非洲) | ~10–15 | 衰减最快,遗传多样性最高 |
| EUR(欧洲) | ~30–40 | 中等衰减 |
| SAS(南亚) | ~25–35 | 中等衰减 |
| EAS(东亚) | ~30–40 | 中等衰减 |
| AMR(美洲) | ~35–45 | 衰减最慢(群体混合 + 瓶颈) |
这一差异对 GWAS 和 PRS 有直接影响:非洲群体 LD 衰减快意味着需要更密集的标记来覆盖全基因组变异(填补参考面板需要更多单倍型),但也意味着更精细的因果变异定位能力(LD 范围小,关联信号更接近因果位点)。相反,欧洲群体 LD 衰减慢有利于用稀疏标记捕捉关联信号,但因果变异定位精度较低。
单倍型与分阶段:
1KGP 提供的 5,008 条完全分阶段单倍型(2,504 人 × 2 条染色体)是基因型填补的核心资产。“分阶段”(phasing)是指确定每个个体两条同源染色体上等位基因的来源——即哪些变异来自父系染色体,哪些来自母系染色体。分阶段信息使得填补算法可以利用单倍型级别的连锁模式,大幅提升填补精度。
1KGP 使用 SHAPEIT2(统计分阶段)结合三人组家系信息(家系分阶段)实现高精度分阶段,switch error rate < 0.5%——即每 1,000 个变异间转换中错误不到 5 个。
2.4 人类迁徙与瓶颈效应
1KGP 的 26 个群体覆盖了人类主要迁徙路线的关键节点。现代人类起源于非洲(约 20–30 万年前),约 5–7 万年前走出非洲,随后扩散至全球。这一迁徙过程在基因组上留下了清晰的信号:
| 迁徙事件 | 时间估计 | 基因组信号 | 1KGP 群体证据 |
|---|---|---|---|
| 非洲起源 | 200–300 KYA | 最高遗传多样性、最古老谱系 | YRI(尼日利亚约鲁巴)、ESN(埃塞俄比亚)、GWD(冈比亚)等 AFR 群体多样性远超其他群体 |
| 走出非洲瓶颈 | 50–70 KYA | 非洲外群体多样性下降 ~30% | EUR、EAS、SAS 群体的变异总数约为 AFR 的 60–70% |
| 欧洲-亚洲分离 | 40–50 KYA | EUR 与 EAS/SAS 间 FST ~0.05–0.07 | CEU(犹他州欧洲裔)、CHB(北京汉族)、GIH(古吉拉特印度裔)间的分化 |
| 美洲迁移 | 15–25 KYA | AMR 群体多样性进一步下降 | PEL(秘鲁)、MXL(墨西哥)、CLM(哥伦比亚)群体多样性最低,且混有欧洲血统 |
| 近期混合 | 500 年内 | 长范围 LD 染色体段 | ASW(非裔美国人)、ACB(加勒比海)、PUR(波多黎各)等混合群体 |
瓶颈效应对数据使用的影响:
非洲外群体的瓶颈效应导致:(1) 罕见变异数量减少但常见变异频率升高;(2) LD 范围扩大(单倍型块更长);(3) 部分有害变异因漂变达到较高频率(“奠基者效应”)。这些特征解释了为何欧洲群体的 GWAS 发现率较高(LD 范围大有利于关联信号检测),但精细定位因果变异更具挑战性。
2.5 自然选择信号
1KGP 数据是检测人类基因组自然选择信号的核心资源。通过比较群体间等位基因频率差异和单倍型长度分布,可以鉴定受正向选择(positive selection)的基因组区域。1KGP 数据中已确认的经典选择信号包括:
| 基因/区域 | 选择压力 | 群体 | 表型效应 | 选择信号类型 |
|---|---|---|---|---|
| LCT(乳糖酶基因) | 乳制品农业文化选择 | EUR(北欧) | 成人乳糖耐受 | 近期正向选择(iHS 极值) |
| EPAS1(缺氧通路) | 高海拔适应 | EAS(藏族/夏尔巴) | 血红蛋白调节、高原适应 | 跨群体选择(XP-EHH 极值) |
| G6PD(葡萄糖-6-磷酸脱氢酶) | 疟疾抗性 | AFR(撒哈拉以南非洲) | G6PD 缺乏症、疟疾抗性 | 平衡选择 |
| SLC24A5(皮肤色素沉着) | 肤色适应 | EUR | 浅肤色 | 正向选择(FST 极值) |
| EDAR(外胚层发育) | 毛发/汗腺形态 | EAS(东亚) | 头发粗细、汗腺密度 | 正向选择(iHS + XP-EHH) |
| DARC(Duffy 抗原) | 疟疾抗性 | AFR | Duffy-null 表型、间日疟抗性 | 平衡选择 / 近期正向选择 |
| HERC2-OCA2(眼睛颜色) | 性选择/环境适应 | EUR | 蓝眼睛 | 正向选择 |
选择信号检测方法(均使用 1KGP 数据):
| 方法 | 原理 | 适用时间尺度 | 1KGP 优势 |
|---|---|---|---|
| iHS(Integrated Haplotype Score) | 比较高频/低频单倍型的长度差异 | 近期选择(<30K 年) | 5,008 分阶段单倍型提供高精度单倍型频率 |
| XP-EHH(Cross-Population EHH) | 比较两群体间单倍型衰减速度 | 近期到中期选择 | 26 群体可做任意群体对比较 |
| FST(群体分化系数) | 比较等位基因频率的群体间差异 | 中长期选择 | 26 群体×5 超群的精细群体分层 |
| Tajima’‘’‘’‘’‘’‘’‘’‘’'s D | 比较核苷酸多样性与分离位点数 | 古代选择平衡 | 全基因组变异密度覆盖 |
2.6 疾病关联变异的群体分布
1KGP 的群体分层频率数据对临床变异分类至关重要。同一变异在不同群体中的频率可能差异巨大,直接影响其致病性判断:
| 临床变异 | 基因 | 疾病 | AFR 频率 | EUR 频率 | EAS 频率 | ACMG 分类影响 |
|---|---|---|---|---|---|---|
| rs334 (HbS) | HBB | 镰状细胞贫血 | ~10% (AFR) | <0.01% | 0% | AFR 群体中杂合子有疟疾抗性(平衡选择) |
| rs1800562 | HFE | 遗传性血色素沉着症 | <0.1% | ~6% (EUR) | 0% | EUR 常见,AFR 罕见 → BS1 仅适用于 EUR |
| rs74315229 | APOL1 | 慢性肾病 | ~15–35% (AFR) | 0% | 0% | AFR 特异性风险等位基因 |
| rs28939679 | F5 (Factor V Leiden) | 深静脉血栓 | <0.1% | ~5% (EUR) | 0% | EUR 常见变异,ACMG BA1 标准 |
| rs121908002 | SLC24A5 | 肤色(非疾病) | ~100% (AFR) | ~2% | ~0% | 非致病性多态性,群体间极端频率差异 |
ACMG/AMP 频率规则与 1KGP 的角色:
| ACMG 标准 | 频率阈值 | 含义 | 1KGP 角色 |
|---|---|---|---|
| BA1(Benign Stand-Alone) | MAF ≥ 5% | 任意群体中 ≥5% 即自动判为良性 | 1KGP 26 群体频率是默认数据源 |
| BS1(Benign Strong) | MAF > 1% 且高于疾病预期 | 强良性证据 | 1KGP 群体分层频率 |
| BS2 | 健康个体中观察到 | 群体数据库中存在 | 1KGP 无表型,仅提供频率 |
| PM2(Pathogenic Moderate) | 群体数据库中缺失 | 罕见变异支持致病性 | 1KGP 阴性结果有参考价值(但 7.4× 有遗漏风险) |
关键注意:ACMG BA1 标准要求检查所有群体的频率——如果某变异在 AFR 群体中频率为 6% 但在 EUR 中为 0.1%,仍应判为良性(BA1)。仅检查单一群体频率可能导致错误分类。1KGP 的 26 群体分层使得跨群体频率检查变得简单可靠。
§3 技术规格与方法学
3.1 测序策略与版本抉择
1KGP 的测序策略经历了从 Pilot 到 Phase 3 再到 30× 重测序的演化,每个版本在覆盖深度、样本量和技术路线上均有显著差异。理解这些差异对于选择正确版本进行分析至关重要。
| 版本 | 覆盖深度 | 测序平台 | 基因组版本 | 样本量 | 核心优势 | 核心局限 |
|---|---|---|---|---|---|---|
| Pilot 低覆盖 | ~4× | Illumina GA IIx | NCBI36 | 179 | 项目可行性验证 | 低深度、高假阴性 |
| Pilot 三群体 WES | ~50× | Illumina GA IIx | NCBI36 | 69 | 外显子深度验证 | 仅外显子区 |
| Pilot 高覆盖 | ~42× | Illumina GA IIx + 454 | NCBI36 | 2 | 深度参考 | 极少样本 |
| Phase 1 | WGS 4.6× / WES 57× | Illumina HiSeq 2000 | GRCh37 | 1,092 | 14 群体整合 | 中等深度、有限群体 |
| Phase 3 | WGS 7.4× / WES 65.7× | Illumina HiSeq 2000/2500 | GRCh37 | 2,504 | 26 群体完整覆盖 | 低覆盖仍有遗漏 |
| 30× 重测序 | WGS 30× | Illumina NovaSeq 6000 | GRCh38 | 3,202 | 高深度、GRCh38、含家系 | 仅 BAM/CRAM(无 VCF 重新发布) |
版本选择指南:
- 基因型填补参考面板 → Phase 3(5,008 单倍型,GRCh37,支持 Minimac4/IMPUTE5/Beagle)
- 群体遗传学分析 → Phase 3(26 群体,完全分阶段,VCF 格式)
- 罕见变异发现 → 30× 重测序(高深度检测率 95%+)或 gnomAD v4
- ACMG 频率过滤 → Phase 3 + gnomAD v4 交叉验证
- SV 分析 → Phase 3 SV 图谱(68,818 SV)+ gnomAD-SV v4
- GRCh38 对齐分析 → 30× 重测序(原生 GRCh38)或使用 NCBI Remap 转换 Phase 3
3.2 变异检出流程(Phase 3)
1KGP Phase 3 的变异检出流程是基因组学史上最复杂的集成分析管线之一,整合了 24 种不同的序列分析工具:
流程概览:
原始测序数据 (BAM, 7.4×)
│
├──→ 路线 A: GATK HaplotypeCaller (Broad Institute)
│ ├── UnifiedGenotyper (SNP + indel)
│ └── HaplotypeCaller (de novo assembly)
│
├──→ 路线 B: Samtools + BCFTools (Sanger Institute)
│ ├── mpileup (SNP + indel)
│ └── de novo assembly (indel)
│
├──→ 路线 C: Glia (BGI-Shenzhen)
│ └── SOAPsnp + assembly
│
├──→ 路线 D: Atlas2 (Baylor)
│ └── Atlas2 SNP + indel
│
└──→ 路线 E: 其他工具 (Canu, FermiKit, 等)
└── 组装型变异检出
│
▼
24 工具原始变异调用集合
│
▼
共识整合 (Consensus Merge)
├── SNP: 多工具投票 + 质量阈值过滤
└── Indel: de novo assembly 结果整合
│
▼
机器学习质控 (VQSR)
├── Variant Quality Score Recalibration
├── 训练集: HapMap 3 + 1000G Omni 2.5 + dbSNP
└── 过滤: Tranche 99.5 (SNP) / 99.0 (Indel)
│
▼
最终变异集合 (VCF)
├── 84.7M SNP + 3.6M Indel
└── 基因型填补 (imputation-ready)
VQSR(变异质量分数校准)详解:
VQSR 是 GATK 的机器学习质控方法,通过已知真变异集(HapMap、Omni 阵列)训练高斯混合模型(GMM),对原始变异调用按质量打分并分层过滤。VQSR 使用以下特征:
| 特征 | 含义 | 区分能力 |
|---|---|---|
| QD (QualByDepth) | 质量分数/深度 | 低质量堆积变异 |
| FS (FisherStrand) | 链偏倚 Fisher 精确检验 | 链特异性假阳性 |
| SOR (StrandOddsRatio) | 链偏倚比值比 | 方向性测序假阳性 |
| MQ (RMSMappingQuality) | 比对质量均方根 | 多比对位点 |
| MQRankSum | 参考vs替代等位基因比对质量差 | 比对偏差 |
| ReadPosRankSum | 读段位置偏差 | 读段末端假阳性 |
3.3 分阶段方法(Phasing)
分阶段(Phasing)是 1KGP 数据生产的核心环节,直接决定了填补参考面板的质量。Phase 3 采用三步分阶段策略:
步骤 1:统计分阶段(SHAPEIT2)
SHAPEIT2 使用隐马尔可夫模型(HMM)结合条件 Gibbs 采样,从群体基因型数据推断每个个体的单倍型阶段。SHAPEIT2 的优势在于:(1) 利用群体 LD 模式提高分阶段精度;(2) 可处理大样本量;(3) 计算效率高。
步骤 2:家系分阶段(Pedigree Phasing)
对于 602 个三人组家系(30× 重测序版本),利用孟德尔遗传法则直接确定父系/母系单倍型来源。家系分阶段的精度极高(switch error rate < 0.1%),但仅适用于有家系信息的样本。
步骤 3:整合与改进(Beagle + 内部交叉验证
将统计分阶段和家系分阶段结果整合,使用 Beagle 的 phasing refinement 进一步优化单倍型边界。最终通过内部交叉验证(randomly masked variants)评估 switch error rate。
分阶段质量指标:
| 指标 | Phase 3 (7.4×) | 30× 重测序 | 含义 |
|---|---|---|---|
| Switch error rate | < 0.5% | < 0.3% | 相邻变异间阶段翻转错误率 |
| Hamming error rate | < 0.1% | < 0.05% | 总体阶段错误率 |
| 填补质量 (r²) | > 0.9 (常见) / > 0.7 (低频) | > 0.95 (常见) | 填补基因型与真实基因型的相关性 |
3.4 结构变异检出(SV Calling)
1KGP Phase 3 的 SV 检出是当时最全面的 SV 整合分析(Sudmant et al., Nature 2015),整合了 9 种算法覆盖不同的 SV 检出策略:
| 算法 | SV 检出策略 | SV 类型 | 检出范围 |
|---|---|---|---|
| BreakSeq | 断点序列比对 | INS/DEL/INV | 已知断点 SV |
| BreakDancer | 读对距离 | INS/DEL/INV/ITX | 中等大小 SV (>100bp) |
| cnMOPS | 读深度 | CNV | 大范围拷贝数变异 |
| DELLY | 读对 + 分裂读 | INS/DEL/INV/TRA | 精确断点 SV |
| GenomeSTRiP | 读深度 + 读对 | CNV/DEL/DUP | 大范围 SV (>500bp) |
| Hypothesis tester | 读深度 | CNV | 拷贝数变异 |
| LUMPY | 读对 + 分裂读 + 读深度 | INS/DEL/INV/TRA | 全类型 SV |
| PEHyper | 读对 | INS/DEL/INV | 读对异常检测 |
| SoftSearch | 软剪切 + 读对 | INS/DEL/INV/TRA | 软剪切信号 |
SV 分类与数量:
| SV 类型 | 数量 | 定义 | 检出可靠性 |
|---|---|---|---|
| DEL(缺失) | ~27,000 | >50bp 缺失 | 高(多算法共识) |
| DUP(重复) | ~12,000 | >50bp 重复 | 中等(读深度依赖) |
| INS(插入) | ~14,000 | >50bp 插入 | 中等(组装依赖) |
| INV(倒位) | ~1,000 | 片段反向 | 低(大范围倒位难检测) |
| TRA(易位) | ~14,000 | 染色体间重排 | 中等(平衡易位难验证) |
| CNV(拷贝数变异) | ~800 | 大范围拷贝数改变 | 高(读深度共识) |
| 总计 | 68,818 | — | — |
3.5 数据格式与坐标系统
| 数据类型 | 格式 | 坐标系统 | 文件特征 |
|---|---|---|---|
| 变异调用 (Phase 3) | VCF 4.1/4.2 | GRCh37 (hg19) | 分染色体,每条 ~1–5 GB |
| 变异调用 (30×) | VCF 4.3 | GRCh38 (hg38) | 仅多态性位点(未正式发布完整 VCF) |
| 序列比对 (Phase 3) | BAM | GRCh37 | 每样本 ~5–15 GB |
| 序列比对 (30×) | CRAM | GRCh38 | 每样本 ~30–50 GB |
| 分阶段单倍型 | VCF (phased) | GRCh37 | GT 字段 `1 |
| 微阵列基因型 | PED/MAP | GRCh37 | ~2.5M SNP 位点 |
| 样本信息 | PED/TSV | — | 群体/超群/性别/家系 |
| SV 调用 | VCF (SV) | GRCh37 | SVTYPE/END/CN 字段 |
| 填补参考面板 | VCF (phased, no GT) | GRCh37 | M3D/IMPUTE5/Beagle 格式 |
坐标转换:Phase 3 数据基于 GRCh37。如果分析流程基于 GRCh38,需要使用 NCBI Remap 工具或 UCSC LiftOver 进行坐标转换。注意:坐标转换可能导致部分变异丢失(~1–2%),特别是着丝粒和端粒附近的变异。
VCF 文件结构详解:
##fileformat=VCFv4.1
##reference=GRCh37
##conevent-blocked=<ID=1,length=249250621,assembly=GRCh37>
##INFO=<ID=AC,Number=A,Type=Integer,Description="Allele count in genotypes">
##INFO=<ID=AF,Number=A,Type=Float,Description="Allele frequency">
##INFO=<ID=AN,Number=1,Type=Integer,Description="Total number of alleles">
##INFO=<ID=NS,Number=1,Type=Integer,Description="Number of samples with data">
##FORMAT=<ID=GT,Number=1,Type=String,Description="Genotype">
##FORMAT=<ID=DS,Number=1,Type=Float,Description="Genotype dosage (imputed)">
##FORMAT=<ID=GP,Number=G,Type=Float,Description="Genotype probabilities">
#CHROM POS ID REF ALT QUAL FILTER INFO FORMAT HG00096 HG00097 ...
1 10177 rs367896724 A AC 100 PASS AC=306;AF=0.122072;AN=5008;NS=2504 GT 0|0 0|1 ...
1 10235 rs540431307 T TA 100 PASS AC=3;AF=0.000599042;AN=5008;NS=2504 GT 0|0 0|0 ...
关键字段说明:
| 字段 | 含义 | 1KGP 特定说明 |
|---|---|---|
| CHROM/POS | 染色体/位置 | GRCh37 坐标(1-based) |
| ID | rsID(dbSNP 编号) | ~70% SNP 有 rsID;新变异以 . 标记 |
| REF/ALT | 参考等位基因/替代等位基因 | 基于 GRCh37 参考序列 |
| QUAL | 变异质量分数 | VQSR 校准后分数 |
| FILTER | 过滤状态 | PASS = 通过质控 |
| INFO | 变异级信息 | AC(等位基因计数)、AF(频率)、AN(总等位基因数)、NS(样本数) |
| FORMAT | 基因型格式 | GT(基因型:0 |
| 样本列 | 各样本基因型 | 分阶段格式(\ |
§4 数据结构与样本组成
4.1 26 群体详解
1KGP Phase 3 的 2,504 名个体来自全球 26 个群体,归为 5 个超群(super-population)。每个群体的缩写、全称、来源地域和样本量如下:
| 超群 | 群体缩写 | 群体全称 | 采样地域 | 样本量 | 特征 |
|---|---|---|---|---|---|
| AFR | ASW | African Ancestry in Southwest US | 美国 | 61 | 近期混合群体 |
| ACB | African Caribbean in Barbados | 巴巴多斯 | 96 | 近期混合群体 | |
| GWD | Gambian in Western Division, The Gambia | 冈比亚 | 113 | 西非代表 | |
| ESN | Esan in Nigeria | 尼日利亚 | 99 | 西非代表 | |
| MSL | Mende in Sierra Leone | 塞拉利昂 | 85 | 西非代表 | |
| YRI | Yoruba in Ibadan, Nigeria | 尼日利亚 | 108 | 1KGP 核心群体 | |
| LWK | Luhya in Webuye, Kenya | 肯尼亚 | 97 | 东非代表 | |
| EUR | CEU | Utah Residents (CEPH) with Northern/Western European Ancestry | 美国(犹他州) | 99 | HapMap 核心群体 |
| TSI | Toscani in Italia | 意大利(托斯卡纳) | 107 | 南欧代表 | |
| FIN | Finnish in Finland | 芬兰 | 99 | 北欧代表,瓶颈群体 | |
| GBR | British in England and Scotland | 英国 | 91 | 西欧代表 | |
| IBS | Iberian Population in Spain | 西班牙 | 107 | 南欧代表 | |
| EAS | CHB | Han Chinese in Beijing, China | 中国(北京) | 103 | HapMap 核心群体 |
| JPT | Japanese in Tokyo, Japan | 日本(东京) | 104 | 东亚代表 | |
| CHS | Southern Han Chinese | 中国(南方) | 105 | HapMap3 群体 | |
| CDX | Chinese Dai in Xishuangbanna, China | 中国(云南) | 93 | 东南亚大陆群体 | |
| KHV | Kinh in Ho Chi Minh City, Vietnam | 越南 | 99 | 东南亚代表 | |
| SAS | GIH | Gujarati Indian in Houston, Texas | 美国(休斯顿) | 103 | 南亚移民群体 |
| PJL | Punjabi in Lahore, Pakistan | 巴基斯坦 | 96 | 南亚代表 | |
| BEB | Bengali in Bangladesh | 孟加拉国 | 86 | 南亚代表 | |
| STU | Sri Lankan Tamil in the UK | 英国 | 102 | 南亚移民群体 | |
| ITU | Indian Telugu in the UK | 英国 | 102 | 南亚移民群体 | |
| AMR | MXL | Mexican Ancestry in Los Angeles, California | 美国(洛杉矶) | 64 | 欧洲与美洲原住民混合 |
| PUR | Puerto Rican in Puerto Rico | 波多黎各 | 104 | 三方混合(EUR/AFR/AMR) | |
| CLM | Colombian in Medellín, Colombia | 哥伦比亚 | 94 | 欧洲与美洲原住民混合 | |
| PEL | Peruvian in Lima, Peru | 秘鲁 | 85 | 美洲原住民比例最高 |
超群样本量汇总:
| 超群 | 群体数 | 样本量 | 占比 | 遗传多样性 | LD 衰减速度 |
|---|---|---|---|---|---|
| AFR | 7 | 659 | 26.3% | 最高 | 最快 |
| EUR | 5 | 503 | 20.1% | 中等 | 中等 |
| EAS | 5 | 504 | 20.1% | 中等 | 中等 |
| SAS | 5 | 489 | 19.5% | 中等 | 中等 |
| AMR | 4 | 347 | 13.9% | 最低(混合群体) | 最慢 |
| 总计 | 26 | 2,504 | 100% | — | — |
群体选择的设计原则:
- 非洲多样性优先:7 个非洲群体覆盖西非(YRI/ESN/GWD/MSL)、东非(LWK)和近期非洲移民群体(ASW/ACB),因为非洲是人类遗传多样性最高的地区。
- 核心群体与扩展群体:HapMap 核心群体(YRI/CEU/CHB/JPT)作为基准,其余群体扩展覆盖范围。
- 移民群体vs本地群体:部分群体(ASW/ACB/MXL/GIH/STU/ITU)为移民群体,保留了源群体的遗传特征但可能经历近期混合。
- 样本量权衡:每群体 60–110 人,在群体代表性和项目可行性之间取得平衡。
4.2 数据目录结构
1KGP 数据通过 EMBL-EBI FTP(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/)和 IGSR 网站分发。核心目录结构如下:
ftp/
├── release/ # 正式发布版本
│ ├── 20130502/ # Phase 3 最终发布 (2013-05-02)
│ │ └── ALL/
│ │ ├── chr1/ # 按染色体分目录
│ │ │ ├── ALL.chr1.phase3_...
│ │ │ │ .shapeit2_integrated_v5a.20130502.genotypes.vcf.gz
│ │ │ └── ALL.chr1.phase3_...
│ │ │ .shapeit2_integrated_v5a.20130502.genotypes.vcf.gz.tbi
│ │ └── ...
│ │
│ ├── 20130828/ # 结构变异发布 (2013-08-28)
│ │ └── ALL/
│ │ └── ALL.wgs.integrated_sv...
│ │ .map_v2.20130502.svs.genotypes.vcf.gz
│ │
│ ├── 20140502/ # 30× 重测序相关文件
│ │
│ └── 20220416/ # 30× 高深度重测序 (2022)
│ └── HG002/ # HG002 等参考样本
│
├── phase3/ # Phase 3 数据分目录
│ ├── data/ # 按样本分目录
│ │ ├── HG00096/ # 每个样本一个目录
│ │ │ ├── alignment/ # BAM 比对文件
│ │ │ │ ├── HG00096.chrom11.ILLUMINA.bwa.GBR...
│ │ │ │ │ .low_coverage.20120522.bam
│ │ │ │ └── HG00096.chrom20.ILLUMINA.bwa.GBR...
│ │ │ │ .low_coverage.20120522.bam
│ │ │ └── sequence_read/ # FASTQ 原始数据
│ │ └── ...
│ │
│ └── integrated_sv_map/ # SV 整合图谱
│ └── ALL.wgs.integrated_sv...
│
├── technical/ # 技术文档
│ ├── reference/ # 参考基因组文件
│ └── working/ # 工作文件
│
├── vol1/ftp/ # FTP 根目录别名
│
└── README.txt # 数据使用说明
4.3 变异分布统计
| 维度 | 数量 | 占比 | 说明 |
|---|---|---|---|
| 总变异 | 88,469,951 | 100% | Phase 3 全部变异 |
| SNP | 84,801,999 | 95.9% | 单核苷酸多态性 |
| Indel | 3,599,134 | 4.1% | 1–50bp 插入缺失 |
| SV | 68,818 | 0.08% | >50bp 结构变异 |
| 按频率 | |||
| 常见 (MAF≥5%) | ~15,000,000 | ~17% | 跨群体分布 |
| 低频 (0.5–5%) | ~25,000,000 | ~28% | 部分群体特异 |
| 罕见 (0.1–0.5%) | ~20,000,000 | ~23% | 群体特异 |
| 单例 (<0.1%) | ~28,000,000 | ~32% | 个体特异 |
| 按功能 | |||
| 编码区变异 | ~800,000 | ~0.9% | 外显子区域 |
| 同义 | ~250,000 | — | 氨基酸不变 |
| 错义 | ~400,000 | — | 氨基酸改变 |
| LoF (无义+移码+剪切) | ~15,000 | — | 功能丧失 |
| UTR | ~50,000 | — | 非翻译区 |
| 内含子 | ~45,000,000 | ~51% | 内含子区域 |
| 基因间区 | ~40,000,000 | ~45% | 基因之间 |
| 按超群 | |||
| AFR 特有 | ~20,000,000 | — | 非洲群体特有变异 |
| EUR 特有 | ~5,000,000 | — | 欧洲群体特有 |
| EAS 特有 | ~6,000,000 | — | 东亚群体特有 |
| SAS 特有 | ~5,000,000 | — | 南亚群体特有 |
| AMR 特有 | ~1,000,000 | — | 美洲群体特有 |
| 全部群体共享 | ~10,000,000 | ~11% | 5 超群均存在 |
LoF 变异(功能丧失变异)的特别说明:
1KGP 鉴定了约 15,000 个 LoF 变异(无义突变 + 移码 indel + 剪切位点破坏),这些变异是罕见病遗传学研究的核心资源。关键发现包括:(1) 平均每人携带 ~100 个 LoF 变异,其中 ~20 个为纯合;(2) 大多数 LoF 变异位于非必需基因或基因冗余通路中;(3) 纯合 LoF 变异中 ~80% 无明显表型效应——这是人类基因组"耐受性"的直接证据。
4.4 30× 重测序扩展数据
2022 年 Byrska-Bishop 等发布的 30× 高深度重测序数据在 Phase 3 基础上进行了显著扩展:
| 维度 | Phase 3 | 30× 重测序 | 改进 |
|---|---|---|---|
| 样本量 | 2,504 | 3,202 | +698 新样本 |
| 覆盖深度 | 7.4× | 30× | 4× 提升 |
| 基因组版本 | GRCh37 | GRCh38 | 更新坐标系 |
| 三人组家系 | 少量 | 602 | 完整家系信息 |
| 测序平台 | HiSeq 2000/2500 | NovaSeq 6000 | 更高准确率 |
| 变异检出流程 | 24 工具集成 | GATK Best Practices (DeepVariant) | 现代化流程 |
| SV 检出 | 9 算法集成 | Manta + Delly + Sniffles | 更精确断点 |
| 数据格式 | BAM + VCF | CRAM + VCF (limited) | 更高压缩比 |
新增样本的群体覆盖:30× 重测序增加了部分群体的样本量(如追加 AFR 和 SAS 群体),并引入了一些新群体(如部分大洋洲群体),但核心 26 群体框架保持不变。
§5 数据划分与基准协议
5.1 官方数据划分
1KGP 本身不是一个机器学习训练数据集,因此没有官方的训练/验证/测试划分。但社区形成了若干约定俗成的数据使用模式:
| 使用模式 | 划分方式 | 用途 | 注意事项 |
|---|---|---|---|
| 基因型填补基准 | 以微阵列位点为"已知",1KGP 全基因组基因型为"真值" | 评估填补算法精度 | 仅评估微阵列覆盖位点的填补 |
| 变异检出基准 | NIST GIAB (Genome in a Bottle) 真值集(含 1KGP 样本 HG001-HG007) | 评估变异检出工具 | 仅限 GIAB 样本有真值集 |
| 分阶段基准 | 三人组家系分阶段结果为"真值",统计分阶段结果为"预测" | 评估分阶段算法 | 602 三人组可用于交叉验证 |
| PRS 基准 | 1KGP 群体作为 LD 参考,外部 GWAS 效应量用于计算 | 评估 PRS 方法 | 1KGP 无表型,需外部数据 |
| 群体遗传学基准 | 全部 2,504 样本用于 LD/FST 计算 | 群体结构分析 | 无需划分 |
5.2 推荐数据划分策略
对于使用 1KGP 数据开发机器学习模型的研究者,推荐以下划分策略:
策略 1:按群体划分(跨群体泛化评估)
| 集合 | 群体 | 样本量 | 用途 |
|---|---|---|---|
| 训练集 | EUR (CEU+TSI+FIN+GBR+IBS) | 503 | 模型训练 |
| 验证集 | EAS (CHB+JPT+CHS+CDX+KHV) | 504 | 超参数调优 |
| 测试集 | AFR (全部 7 群体) | 659 | 跨群体泛化评估 |
策略 2:按超群留一法(Leave-One-Super-Population-Out)
循环将 5 个超群中 4 个用于训练,1 个用于测试。这种策略评估模型在未见群体上的泛化能力,特别适合评估跨群体 PRS 模型。
策略 3:按染色体划分(标准基因组学划分)
| 集合 | 染色体 | 用途 |
|---|---|---|
| 训练集 | chr1-chr20 | 模型训练 |
| 验证集 | chr21 | 超参数调优 |
| 测试集 | chr22 | 最终评估 |
策略 4:按样本随机划分(5 折交叉验证)
将 2,504 样本随机等分为 5 份,每次 4 份训练/1 份测试。适用于群体内部预测任务。注意:随机划分可能导致群体间不平衡,应使用分层抽样确保每折中各群体比例一致。
§6 AI 就绪指南
6.1 数据获取与预处理管道
6.1.1 快速下载指南
# 1. 下载 Phase 3 全基因组 VCF (分染色体)
# 推荐使用 wget 或 rsync,约 ~500 GB 总计
wget -c ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/ALL.chr1.phase3_shapeit2_mvncall_integrated_v5a.20130502.genotypes.vcf.gz
wget -c ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/ALL.chr1.phase3_shapeit2_mvncall_integrated_v5a.20130502.genotypes.vcf.gz.tbi
# 2. 下载 SV VCF
wget -c ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/ALL.wgs.integrated_sv_map_v2.20130502.svs.genotypes.vcf.gz
# 3. 下载样本信息
wget -c ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/integrated_call_samples_v3.20130502.ALL.panel
# 4. 下载 30× 重测序 CRAM (按样本)
wget -c ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/data_collections/1000G_30X_on_GRCh38/data/HG00096/GRCh38/alignment/HG00096.alt.awg.mergedGRCh38_stage2.GRCh38.30x.cram
# 5. 仅提取特定群体的样本
# 先创建样本列表文件
grep -w "CEU\|TSI\|GBR\|FIN\|IBS" integrated_call_samples_v3.20130502.ALL.panel | cut -f1 > eur_samples.txt
# 提取 EUR 样本的 chr22 基因型
bcftools view -S eur_samples.txt \
ALL.chr22.phase3_shapeit2_mvncall_integrated_v5a.20130502.genotypes.vcf.gz \
-Oz -o chr22_eur.vcf.gz
6.1.2 样本信息解析
# Python: 解析 1KGP 样本信息面板
import pandas as pd
# 读取样本面板文件
panel = pd.read_csv(
''''''''''''''''integrated_call_samples_v3.20130502.ALL.panel'''''''''''''''',
sep=''''''''''''''''\t''''''''''''''''
)
# 列: sample | sex | population | super_population | phase
print(f"总样本数: {len(panel)}")
print(f"\n超群分布:")
print(panel[''''''''''''''''super_population''''''''''''''''].value_counts())
print(f"\n群体分布:")
print(panel[''''''''''''''''population''''''''''''''''].value_counts())
# 获取特定超群的样本列表
afr_samples = panel[panel[''''''''''''''''super_population''''''''''''''''] == ''''''''''''''''AFR''''''''''''''''][''''''''''''''''sample''''''''''''''''].tolist()
print(f"\nAFR 样本数: {len(afr_samples)}")
# 保存样本列表供 bcftools 使用
with open(''''''''''''''''afr_samples.txt'''''''''''''''', ''''''''''''''''w'''''''''''''''') as f:
f.write(''''''''''''''''\n''''''''''''''''.join(afr_samples))
6.1.3 PCA 群体结构分析代码
# Python: 使用 scikit-allel 进行 PCA 分析
# pip install scikit-allel
import numpy as np
import pandas as pd
import scikit_allel as allel
import matplotlib.pyplot as plt
# 1. 读取 VCF 文件
callset = allel.read_vcf(''''''''''''''''chr22_phase3.vcf.gz'''''''''''''''', fields=[''''''''''''''''calldata/GT'''''''''''''''', ''''''''''''''''samples'''''''''''''''', ''''''''''''''''variants/POS'''''''''''''''', ''''''''''''''''variants/REF'''''''''''''''', ''''''''''''''''variants/ALT''''''''''''''''])
# 2. 获取基因型矩阵
gt = callset[''''''''''''''''calldata/GT''''''''''''''''] # shape: (n_variants, n_samples, 2)
# 3. 转换为等位基因计数 (0, 1, 2)
gn = allel.GenotypeArray(gt).to_n_alt() # shape: (n_variants, n_samples)
# 4. LD 修剪(避免连锁位点导致的 PCA 偏倚)
# 计算滑动窗口内的 LD,移除 R² > 0.2 的位点之一
ac = allel.GenotypeArray(gt).count_alleles()
loc_unlinked = allel.locate_unlinked(gn, size=500, step=200, threshold=0.2)
print(f"LD 修剪前: {gn.shape[0]} 个变异")
print(f"LD 修剪后: {gn[loc_unlinked].shape[0]} 个变异")
gn_pruned = gn[loc_unlinked]
# 5. 执行 PCA
coords, model = allel.pca(gn_pruned, n_componevent-blocked=10)
# 6. 读取群体信息
panel = pd.read_csv(''''''''''''''''integrated_call_samples_v3.20130502.ALL.panel'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''')
# 7. 可视化
fig, axes = plt.subplots(1, 2, figsize=(16, 6))
# 超群着色
colors = {''''''''''''''''AFR'''''''''''''''': ''''''''''''''''#EF4444'''''''''''''''', ''''''''''''''''EUR'''''''''''''''': ''''''''''''''''#2563EB'''''''''''''''', ''''''''''''''''EAS'''''''''''''''': ''''''''''''''''#10B981'''''''''''''''', ''''''''''''''''SAS'''''''''''''''': ''''''''''''''''#F59E0B'''''''''''''''', ''''''''''''''''AMR'''''''''''''''': ''''''''''''''''#8B5CF6''''''''''''''''}
for spop, color in colors.items():
mask = panel[''''''''''''''''super_population''''''''''''''''] == spop
axes[0].scatter(coords[mask, 0], coords[mask, 1], c=color, label=spop, alpha=0.6, s=15)
axes[0].set_xlabel(f''''''''''''''''PC1 ({model.explained_variance_ratio_[0]:.1%})'''''''''''''''')
axes[0].set_ylabel(f''''''''''''''''PC2 ({model.explained_variance_ratio_[1]:.1%})'''''''''''''''')
axes[0].legend()
axes[0].set_title(''''''''''''''''1KGP PCA — Super Population'''''''''''''''')
# 群体着色 (仅 AFR 为例)
for pop in [''''''''''''''''YRI'''''''''''''''', ''''''''''''''''ESN'''''''''''''''', ''''''''''''''''GWD'''''''''''''''', ''''''''''''''''MSL'''''''''''''''', ''''''''''''''''LWK'''''''''''''''', ''''''''''''''''ASW'''''''''''''''', ''''''''''''''''ACB'''''''''''''''']:
mask = panel[''''''''''''''''population''''''''''''''''] == pop
axes[1].scatter(coords[mask, 0], coords[mask, 1], label=pop, alpha=0.6, s=15)
axes[1].set_xlabel(f''''''''''''''''PC1'''''''''''''''')
axes[1].set_ylabel(f''''''''''''''''PC2'''''''''''''''')
axes[1].legend(fonevent-blocked=7)
axes[1].set_title(''''''''''''''''1KGP PCA — AFR Populations'''''''''''''''')
plt.tight_layout()
plt.savefig(''''''''''''''''1kgp_pca.png'''''''''''''''', dpi=150)
plt.show()
# 8. 输出 PC 坐标供后续分析
pca_df = pd.DataFrame(coords[:, :10], columns=[f''''''''''''''''PC{i+1}'''''''''''''''' for i in range(10)])
pca_df[''''''''''''''''sample''''''''''''''''] = panel[''''''''''''''''sample'''''''''''''''']
pca_df[''''''''''''''''super_population''''''''''''''''] = panel[''''''''''''''''super_population'''''''''''''''']
pca_df[''''''''''''''''population''''''''''''''''] = panel[''''''''''''''''population'''''''''''''''']
pca_df.to_csv(''''''''''''''''1kgp_pca_coords.csv'''''''''''''''', index=False)
6.1.4 基因型填补管道代码
# Bash: 使用 Minimac4 进行基因型填补
# 前提: 已安装 Minimac4 + bcftools + plink
# 1. 下载 1KGP 参考面板 (以 chr22 为例)
# 从 https://imputationserver.sph.umich.edu/index.html#!pages/home 下载
# 或从 IGSR 获取 M3D 格式参考面板
wget https://imputationserver.sph.umich.edu/static/shared/resources/m3vcf/1000G.phase3.v5.shapeit2.m3vcf.chr22.gz
# 2. 准备目标数据 (VCF 格式)
# 确保目标数据已分阶段 (phased)
# 如果未分阶段,使用 SHAPEIT4 或 Eagle 进行分阶段
eagle vcf target_chr22.vcf.gz \
geneticMapFile genetic_map_chr22_combined_b37.txt \
out target_chr22.phased \
numThreads 16
# 3. 使用 Minimac4 填补
minimac4 \
refHaps 1000G.phase3.v5.shapeit2.m3vcf.chr22.gz \
haps target_chr22.phased.vcf.gz \
prefix target_chr22.imputed \
chr 22 \
format GT,DS,GP \
allSites \
cpus 16
# 4. 填补后质量控制
# 过滤低质量填补结果 (info < 0.3)
bcftools filter -i ''''''''''''''''INFO/INFO>=0.3'''''''''''''''' \
target_chr22.imputed.dose.vcf.gz \
-Oz -o target_chr22.imputed.filtered.vcf.gz
# 5. 计算填补质量统计
bcftools query -f ''''''''''''''''%CHROM\t%POS\t%INFO/INFO\n'''''''''''''''' \
target_chr22.imputed.dose.vcf.gz | \
awk ''''''''''''''''BEGIN{OFS="\t"} $3<0.3{low++} $3>=0.3&&$3<0.8{mid++} $3>=0.8{high++} END{print "Low(<0.3):",low; print "Mid(0.3-0.8):",mid; print "High(>=0.8):",high}''''''''''''''''
6.1.5 多基因风险评分(PRS)计算代码
# Python: 使用 PRSice-2 计算 PRS
# 前提: 已安装 PRSice-2 + PLINK 1.9 + 1KGP LD 参考
# 1. 准备 LD 参考数据 (从 1KGP 提取 EUR 样本)
# bash: plink vcf chr22_phase3.vcf.gz keep eur_samples.txt make-bed out 1kgp_eur_chr22
# 2. 使用 PRSice-2 计算 PRS
# PRSice-2 支持 LD clumping + P-value thresholding (P+T 方法)
import subprocess
subprocess.run([
''''''''''''''''PRScs'''''''''''''''',
''''''''''''''''ref'''''''''''''''', ''''''''''''''''1kgp_eur_chr22'''''''''''''''', # LD 参考 (1KGP EUR)
''''''''''''''''base'''''''''''''''', ''''''''''''''''gwas_summary.txt'''''''''''''''', # GWAS 汇总统计
''''''''''''''''target'''''''''''''''', ''''''''''''''''target_genotypes'''''''''''''''', # 目标基因型
''''''''''''''''pheno'''''''''''''''', ''''''''''''''''target_pheno.txt'''''''''''''''',
''''''''''''''''out'''''''''''''''', ''''''''''''''''prs_output'''''''''''''''',
''''''''''''''''bar-levels'''''''''''''''', ''''''''''''''''0.001,0.05,0.1,0.2,0.3,0.4,0.5,1'''''''''''''''',
''''''''''''''''fastscore'''''''''''''''',
''''''''''''''''num-threads'''''''''''''''', ''''''''''''''''16''''''''''''''''
])
# 3. 使用 PRS-CS (贝叶斯回归) — 更高精度
# PRS-CS 使用 1KGP LD 参考矩阵进行效应量收缩
import numpy as np
import scipy.sparse as sp
# PRS-CS 需要的输入:
# (1) GWAS 汇总统计 (beta, se, SNP, A1, A2)
# (2) 1KGP LD 参考矩阵 (每条染色体的 SNP×SNP R² 矩阵)
# (3) 目标基因型数据
# 运行 PRS-CS
# python PRScs.py ref_dir=1kgp_eur_ref bim_prefix=target_genotypes \
# sst=gwas_summary.txt n_gwas=sample_size out=prscs_output
# 4. 使用 PRS-CSx (跨群体) — 利用 1KGP 多群体 LD
# PRS-CSx 同时使用多个群体的 LD 参考矩阵
# python PRScsx.py ref_dir=1kgp_multi_pop \
# bim_prefix=target_genotypes \
# sst_list=pop1_sst.txt,pop2_sst.txt \
# n_gwas_list=n1,n2 \
# pop_list=EUR,AFR \
# out=prscsx_output
# 5. 读取 PRS 结果并评估
prs_scores = np.loadtxt(''''''''''''''''prs_output.sscore'''''''''''''''', skiprows=1, usecols=[5])
phenotypes = np.loadtxt(''''''''''''''''target_pheno.txt'''''''''''''''', skiprows=1, usecols=[1])
from scipy.stats import pearsonr
r, p = pearsonr(prs_scores, phenotypes)
r2 = r ** 2
print(f"PRS R² = {r2:.4f} (p = {p:.2e})")
print(f"解释方差比例: {r2*100:.2f}%")
6.1.6 连锁不平衡(LD)计算代码
# Python: 使用 PLINK 计算 LD 矩阵
import subprocess
import numpy as np
# 1. 使用 PLINK 计算 LD R² 矩阵
# 从 1KGP 提取特定群体 + 特定区域
subprocess.run([
''''''''''''''''plink'''''''''''''''',
''''''''''''''''vcf'''''''''''''''', ''''''''''''''''chr22_phase3.vcf.gz'''''''''''''''',
''''''''''''''''keep'''''''''''''''', ''''''''''''''''eur_samples.txt'''''''''''''''',
''''''''''''''''chr'''''''''''''''', ''''''''''''''''22'''''''''''''''',
''''''''''''''''from-bp'''''''''''''''', ''''''''''''''''20000000'''''''''''''''',
''''''''''''''''to-bp'''''''''''''''', ''''''''''''''''21000000'''''''''''''''',
''''''''''''''''r2'''''''''''''''', ''''''''''''''''inter-chr'''''''''''''''',
''''''''''''''''ld-window-r2'''''''''''''''', ''''''''''''''''0.2'''''''''''''''',
''''''''''''''''ld-window'''''''''''''''', ''''''''''''''''999999'''''''''''''''',
''''''''''''''''ld-window-kb'''''''''''''''', ''''''''''''''''1000'''''''''''''''',
''''''''''''''''out'''''''''''''''', ''''''''''''''''ld_chr22_20mb_21mb_eur''''''''''''''''
])
# 2. 解析 LD 结果
ld_data = []
with open(''''''''''''''''ld_chr22_20mb_21mb_eur.ld'''''''''''''''') as f:
next(f) # skip header
for line in f:
parts = line.strip().split()
ld_data.append({
''''''''''''''''snp_a'''''''''''''''': parts[2],
''''''''''''''''snp_b'''''''''''''''': parts[5],
''''''''''''''''r2'''''''''''''''': float(parts[6])
})
ld_df = pd.DataFrame(ld_data)
print(f"LD 配对数: {len(ld_df)}")
print(f"平均 R²: {ld_df[''''''''''''''''r2''''''''''''''''].mean():.4f}")
print(f"R² > 0.8 的配对数: {(ld_df[''''''''''''''''r2''''''''''''''''] > 0.8).sum()}")
# 3. 计算 LD 衰减曲线
from collections import defaultdict
ld_decay = defaultdict(list)
for _, row in ld_df.iterrows():
# 获取两个 SNP 的位置
pos_a = int(row[''''''''''''''''snp_a''''''''''''''''].split('''''''''''''''':'''''''''''''''')[1]) if '''''''''''''''':'''''''''''''''' in row[''''''''''''''''snp_a''''''''''''''''] else 0
pos_b = int(row[''''''''''''''''snp_b''''''''''''''''].split('''''''''''''''':'''''''''''''''')[1]) if '''''''''''''''':'''''''''''''''' in row[''''''''''''''''snp_b''''''''''''''''] else 0
dist_kb = abs(pos_a - pos_b) / 1000
bucket = int(dist_kb) // 5 * 5 # 5kb 窗口
ld_decay[bucket].append(row[''''''''''''''''r2''''''''''''''''])
distances = sorted(ld_decay.keys())
mean_r2 = [np.mean(ld_decay[d]) for d in distances]
import matplotlib.pyplot as plt
plt.figure(figsize=(10, 5))
plt.plot(distances, mean_r2, ''''''''''''''''b-'''''''''''''''', linewidth=2)
plt.axhline(y=0.2, color=''''''''''''''''r'''''''''''''''', linestyle='''''''''''''''''''''''''''''''', label=''''''''''''''''R²=0.2 threshold'''''''''''''''')
plt.xlabel(''''''''''''''''Distance (kb)'''''''''''''''')
plt.ylabel(''''''''''''''''Mean R²'''''''''''''''')
plt.title(''''''''''''''''LD Decay — 1KGP EUR chr22:20-21Mb'''''''''''''''')
plt.legend()
plt.savefig(''''''''''''''''ld_decay.png'''''''''''''''', dpi=150)
plt.show()
6.1.7 群体分化(FST)计算代码
# Python: 使用 scikit-allel 计算 FST
import scikit_allel as allel
import numpy as np
# 1. 读取 VCF 并按群体分组
callset = allel.read_vcf(''''''''''''''''chr22_phase3.vcf.gz'''''''''''''''', fields=[''''''''''''''''calldata/GT'''''''''''''''', ''''''''''''''''samples''''''''''''''''])
panel = pd.read_csv(''''''''''''''''integrated_call_samples_v3.20130502.ALL.panel'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''')
# 2. 提取各群体的等位基因计数
pop1_samples = panel[panel[''''''''''''''''population''''''''''''''''] == ''''''''''''''''YRI''''''''''''''''][''''''''''''''''sample''''''''''''''''].tolist()
pop2_samples = panel[panel[''''''''''''''''population''''''''''''''''] == ''''''''''''''''CEU''''''''''''''''][''''''''''''''''sample''''''''''''''''].tolist()
pop1_idx = [list(callset[''''''''''''''''samples'''''''''''''''']).index(s) for s in pop1_samples]
pop2_idx = [list(callset[''''''''''''''''samples'''''''''''''''']).index(s) for s in pop2_samples]
gt = allel.GenotypeArray(callset[''''''''''''''''calldata/GT''''''''''''''''])
ac1 = gt[:, pop1_idx].count_alleles(max_allele=1)
ac2 = gt[:, pop2_idx].count_alleles(max_allele=1)
# 3. 计算 Hudson''''''''''''''''s FST(适用于两群体比较)
num, den = allel.hudson_fst(ac1, ac2)
fst = num / den
fst = np.nan_to_num(fst)
# 4. 滑动窗口平均
# 按物理位置分组计算窗口 FST
pos = callset[''''''''''''''''variants/POS'''''''''''''''']
window_size = 100000 # 100kb 窗口
fst_windows = []
window_starts = []
for start in range(pos.min(), pos.max(), window_size):
mask = (pos >= start) & (pos < start + window_size)
if mask.sum() > 10: # 至少 10 个变异
fst_windows.append(np.nanmean(fst[mask]))
window_starts.append(start)
print(f"平均 FST (YRI vs CEU): {np.nanmean(fst):.4f}")
print(f"最大窗口 FST: {max(fst_windows):.4f}")
print(f"FST > 0.5 的位点数: {(fst > 0.5).sum()}")
# 5. 识别高 FST 区域(选择信号候选)
high_fst_regionevent-blocked= [(start, fst_val) for start, fst_val in zip(window_starts, fst_windows) if fst_val > 0.3]
print(f"\n高 FST 区域 (>0.3): {len(high_fst_regions)} 个窗口")
6.1.8 变异注释代码
# Python: 使用 VEP (Variant Effect Predictor) 注释 1KGP 变异
# 前提: 已安装 VEP + 自定义插件
# 1. 使用 VEP 命令行注释
import subprocess
# bash: vep input_file chr22_phase3.vcf.gz output_file chr22_annotated.vcf \
# cache assembly GRCh37 everything af af_1kg pubmed \
# plugin CADD,/path/to/cadd.tsv.gz \
# plugin REVEL,/path/to/revel.tsv.gz \
# fork 16
# 2. 使用 1KGP 频率作为 ACMG BA1 过滤
# VEP 的 af_1kg 选项会从内置 1KGP 频率数据库添加 AF 注释
# 3. Python 解析 VEP 注释结果
def parse_vep_annotated(vcf_file):
annotationevent-blocked= []
with subprocess.Popen([''''''''''''''''bcftools'''''''''''''''', ''''''''''''''''query'''''''''''''''', ''''''''''''''''-f'''''''''''''''',
''''''''''''''''%CHROM\t%POS\t%REF\t%ALT\t%INFO/AF\t%INFO/AC\t%INFO/AN\t[%INFO/CSQ]\n'''''''''''''''',
vcf_file], stdout=subprocess.PIPE, text=True) as p:
for line in p.stdout:
parts = line.strip().split(''''''''''''''''\t'''''''''''''''')
chrom, pos, ref, alt = parts[:4]
af, ac, an = parts[4:7]
csq = parts[7] if len(parts) > 7 else ''''''''''''''''''''''''''''''''
# 解析 CSQ 字段
csq_fields = csq.split(''''''''''''''''|'''''''''''''''')
conevent-blocked= csq_fields[1] if len(csq_fields) > 1 else ''''''''''''''''''''''''''''''''
gene = csq_fields[3] if len(csq_fields) > 3 else ''''''''''''''''''''''''''''''''
annotations.append({
''''''''''''''''chrom'''''''''''''''': chrom,
''''''''''''''''pos'''''''''''''''': int(pos),
''''''''''''''''ref'''''''''''''''': ref,
''''''''''''''''alt'''''''''''''''': alt,
''''''''''''''''af'''''''''''''''': float(af) if af != ''''''''''''''''.'''''''''''''''' else 0.0,
''''''''''''''''ac'''''''''''''''': int(ac) if ac != ''''''''''''''''.'''''''''''''''' else 0,
''''''''''''''''an'''''''''''''''': int(an) if an != ''''''''''''''''.'''''''''''''''' else 0,
''''''''''''''''consequence'''''''''''''''': consequence,
''''''''''''''''gene'''''''''''''''': gene
})
return pd.DataFrame(annotations)
# 4. ACMG BA1 过滤
annot_df = parse_vep_annotated(''''''''''''''''chr22_annotated.vcf.gz'''''''''''''''')
ba1_variants = annot_df[annot_df[''''''''''''''''af''''''''''''''''] >= 0.05]
print(f"BA1 过滤后保留变异数: {len(annot_df) - len(ba1_variants)}")
print(f"被 BA1 过滤的变异数: {len(ba1_variants)}")
6.2 推荐模型与计算资源
| 任务 | 推荐模型/方法 | 输入 | 输出 | 计算资源需求 |
|---|---|---|---|---|
| 基因型填补 | Minimac4 / IMPUTE5 / Beagle 5 | 分阶段 VCF + 1KGP 参考面板 | 填补后 VCF (含 DS/GP) | 16 CPU + 32 GB RAM/染色体 |
| 单群体 PRS | PRS-CS / SBayesR / LDpred2 | GWAS 汇总统计 + 1KGP LD 参考 | PRS 评分 | 4 CPU + 8 GB RAM |
| 跨群体 PRS | PRS-CSx | 多群体 GWAS + 多群体 1KGP LD | 跨群体校准 PRS | 8 CPU + 16 GB RAM |
| 群体结构分析 | PCA (flashpca2 / PLINK2) | 1KGP VCF (LD 修剪后) | PC 坐标 | 16 CPU + 64 GB RAM |
| FST 计算 | VCFtools / scikit-allel | 1KGP VCF + 群体信息 | 全基因组 FST | 4 CPU + 16 GB RAM |
| 选择信号检测 | selscan / hapbin | 1KGP 分阶段 VCF | iHS / XP-EHH 分数 | 8 CPU + 32 GB RAM |
| SV 分析 | Manta / Delly / Sniffles | 30× CRAM/BAM | SV VCF | 8 CPU + 16 GB RAM |
| 变异注释 | VEP + CADD + REVEL | 1KGP VCF | 注释 VCF | 16 CPU + 32 GB RAM |
| 深度学习变异检出 | DeepVariant | 30× CRAM/BAM | 变异 VCF | 1 GPU (NVIDIA) + 16 GB RAM |
| 单倍型推断 | SHAPEIT4 / Eagle | 未分阶段 VCF | 分阶段 VCF | 8 CPU + 16 GB RAM |
6.3 关键坑点与注意事项
| 坑点 | 描述 | 解决方案 |
|---|---|---|
| 基因组版本不匹配 | Phase 3 = GRCh37,30× = GRCh38,混用导致坐标偏移 | 使用 NCBI Remap 或 UCSC LiftOver 统一坐标系 |
| 低覆盖深度假阴性 | 7.4× 遗漏 ~25% 罕见变异 | 罕见变异分析使用 30× 或 gnomAD |
| LCL 体外培养伪影 | 淋巴母细胞系培养可能引入体细胞突变 | 高频变异检查多个样本一致性 |
| 群体标签混淆 | AMR 群体为混合群体,"PUR"含 EUR/AFR/AMR 三方成分 | 使用 PCA 确认群体归属,而非仅依赖标签 |
| 分阶段错误传递 | 统计分阶段 switch error ~0.5%,填补后错误累积 | 高精度需求使用家系分阶段(30× 数据) |
| SV 检出假阳性 | 9 算法集成仍有 ~5% 假阳性率 | 使用 PCR/Sanger 验证关键 SV |
| rsID 版本漂移 | dbSNP 版本更新可能改变 rsID 映射 | 使用坐标 + REF/ALT 而非 rsID 匹配 |
| 微卫星区域不可靠 | 重复序列区域比对质量低 | 排除低 mappability 区域(ENCODE Duke map35_50%) |
§7 质量评估与已知偏倚
7.1 已知偏倚与局限性
1KGP 作为里程碑式的数据集,仍存在多个已知的偏倚和局限性。使用者必须充分理解这些限制以避免分析中的系统性错误:
| 偏倚类型 | 严重程度 | 详细描述 | 影响范围 | 缓解措施 |
|---|---|---|---|---|
| 低覆盖测序偏倚 | ⭐⭐⭐ 高 | 7.4× 深度对 MAF<0.1% 的变异检测率 ~75%,~25% 真实罕见变异被遗漏 | 罕见变异发现、ACMG PM2 判定 | 使用 30× 重测序或 gnomAD v4 补充 |
| LCL 体外培养伪影 | ⭐⭐ 中 | DNA 来源自 EB 病毒转化的淋巴母细胞系(LCL),培养过程可能引入体细胞突变 | 变异真实性验证 | 对关键变异使用原始血液 DNA 验证 |
| 群体代表性不足 | ⭐⭐⭐ 高 | 26 群体远不能覆盖全球 ~7,000 个语言群体;大洋洲、安达曼、原住民群体缺失 | 跨群体泛化、全球代表性 | 结合其他数据集(SGDP、HGDP)补充 |
| AMR 群体混合偏倚 | ⭐⭐ 中 | AMR 群体为近期混合(EUR×AMR×AFR),不同个体混合比例差异大 | 群体遗传学推断 | 使用 PCA + ADMIXTURE 估计个体血统比例 |
| 样本量偏倚 | ⭐⭐ 中 | 每群体 60–110 人,对群体内罕见变异发现能力有限 | 群体内变异频率估计 | 使用更大规模数据集(gnomAD/UKB) |
| 采样偏倚 | ⭐ 低 | 部分群体为移民群体(ASW/MXL/GIH/STU/ITU),可能不代表源群体 | 群体遗传学推断 | 参考原住民数据集(HGDP) |
| SV 检出假阳性 | ⭐⭐ 中 | 9 算法集成仍存在 ~5% 假阳性率,大范围倒位和平衡易位难检测 | SV 分析 | 关键 SV 用 PCR/Sanger 验证 |
| 坐标系统老化 | ⭐⭐ 中 | Phase 3 基于 GRCh37,与当前 GRCh38 流程不兼容 | 跨版本分析 | 使用 NCBI Remap 转换坐标 |
| 无表型数据 | ⭐⭐⭐ 高 | 1KGP 纯基因组数据,无任何表型/临床信息 | GWAS/PRS 需结合外部数据 | 使用 UKB/All of Us 补充表型 |
| 性别偏倚 | ⭐ 低 | 部分群体性别比例不完全均衡(整体 ~50:50) | X/Y 染色体分析 | 检查样本性别比例并加权 |
| 家系样本有限 | ⭐ 低 | Phase 3 家系样本有限,30× 含 602 三人组 | 家系分析 | 使用 30× 数据的三人组 |
7.2 质量控制指标
1KGP 数据的质量控制指标已成为基因组学领域的标准参考:
| QC 指标 | 阈值 | 1KGP 典型值 | 含义 |
|---|---|---|---|
| Ti/Tv 比值 | >2.0 (WGS) / >3.0 (exome) | ~2.1 (全基因组) | 转换/颠换比,低值提示假阳性 |
| Het/Hom 比值 | 1.5–2.5 (WGS) | ~1.8 | 杂合/纯合比,过高提示污染 |
| 单例比例 | <40% (WGS) | ~32% | 单例比例过高提示假阳性 |
| 缺失率 | <5% | <2% | 基因型缺失率 |
| HWE p 值 | >1e-6 | >1e-6 | Hardy-Weinberg 平衡检验 |
| VQSR Tranche | 99.5 (SNP) / 99.0 (indel) | 99.5/99.0 | 变异质量分层阈值 |
| 分阶段 switch error | <1% | <0.5% | 分阶段错误率 |
| 填补 info score | >0.3 | >0.8 (常见) / >0.5 (低频) | 填补质量评分 |
7.3 DAIMS 数据就绪度评估
按照 DAIMS(Data AI-Readiness Measurement System)24 项评估体系,1KGP 的 AI 就绪度评估如下:
| 评估维度 | 评分 | 说明 |
|---|---|---|
| D1 数据可发现性 | ⭐⭐⭐⭐⭐ | IGSR 官网 + EMBL-EBI FTP + SRA + Ensembl + 多镜像 |
| D2 数据可访问性 | ⭐⭐⭐⭐⭐ | 完全开放下载,无申请流程,FTP/HTTP/Aspera |
| D3 数据格式标准化 | ⭐⭐⭐⭐⭐ | VCF 4.1/4.2 + BAM + CRAM + PED,社区标准格式 |
| D4 元数据完整性 | ⭐⭐⭐⭐⭐ | 样本群体/超群/性别/家系完整标注 |
| D5 文档质量 | ⭐⭐⭐⭐⭐ | Nature 论文 + IGSR 文档 + 方法论文详细描述 |
| D6 数据版本控制 | ⭐⭐⭐⭐ | 有明确版本(Pilot/Phase1/Phase3/30×),但无差异版本管理 |
| D7 数据许可 | ⭐⭐⭐⭐⭐ | Phase 3 完全开放,无使用限制 |
| D8 数据溯源 | ⭐⭐⭐⭐⭐ | 每个版本有明确论文引用和方法文档 |
| D9 数据一致性 | ⭐⭐⭐⭐ | 不同版本间有明确对应关系,但坐标系统变化需注意 |
| D10 数据时效性 | ⭐⭐⭐⭐ | Phase 3 (2015) 仍为标准参考,30× (2022) 更新及时 |
| A1 任务适配性 | ⭐⭐⭐⭐⭐ | 填补参考 + PRS + 群体遗传学 + 变异频率——多任务核心数据 |
| A2 特征完整性 | ⭐⭐⭐⭐ | 基因型数据完整,但无表型数据 |
| A3 标注质量 | ⭐⭐⭐⭐⭐ | 群体标签精准(采集地 + 自我认同 + 语言群体) |
| A4 样本多样性 | ⭐⭐⭐⭐ | 26 群体覆盖主要血统,但大洋洲和原住民缺失 |
| A5 数据量充分性 | ⭐⭐⭐ | 2,504 人对于群体内罕见变异发现有限 |
| A6 数据平衡性 | ⭐⭐⭐⭐ | 5 超群样本量较均衡(659:503:504:489:347) |
| I1 互操作性 | ⭐⭐⭐⭐⭐ | VCF 格式与所有基因组学工具兼容 |
| I2 可机器读取性 | ⭐⭐⭐⭐⭐ | VCF 为纯文本格式,可被 bcftools/PLINK/Python 直接解析 |
| I3 API 可用性 | ⭐⭐⭐ | EBI Ensembl API 可查询,但无专用 1KGP REST API |
| I4 数据链接性 | ⭐⭐⭐⭐ | 与 dbSNP/ClinVar/HapMap/Ensembl 交叉链接 |
| M1 数据维护 | ⭐⭐⭐⭐⭐ | IGSR 持续维护,定期更新注释 |
| M2 社区支持 | ⭐⭐⭐⭐⭐ | 全球最广泛使用的基因组参考数据集 |
| M3 方法基准 | ⭐⭐⭐⭐⭐ | 几乎所有基因组学工具的基准测试数据 |
| M4 可复现性 | ⭐⭐⭐⭐⭐ | 数据完全公开,分析可复现 |
总评分:⭐⭐⭐⭐⭐ (5/5) — 全球基因组学研究的 AI 就绪度标杆
7.4 1KGP 与其他参考面板的填补质量对比
| 参考面板 | 样本量 | 群体覆盖 | 常见变异填补 r² | 罕见变异填补 r² | 推荐场景 |
|---|---|---|---|---|---|
| 1KGP Phase 3 | 2,504 | 26 群体/5 超群 | >0.90 | >0.50 | 通用填补、多群体分析 |
| HRC (Haplotype Reference Consortium) | 32,470 | 以 EUR 为主 | >0.95 | >0.70 | 欧洲血统单群体分析 |
| TOPMed | 132,345 | 多群体(偏 AFR) | >0.95 | >0.75 | 高精度多群体填补 |
| gnomAD | 807,162 | 有限群体标注 | N/A (无单倍型) | N/A | 变异频率查询(非填补) |
| 1KGP + HRC 合并 | 34,974 | 扩展群体 | >0.95 | >0.65 | 平衡群体覆盖和样本量 |
| 30× 重测序 | 3,202 | 26 群体 | >0.95 | >0.65 | 高精度多群体填补(GRCh38) |
§8 基准与生态
8.1 基因型填补基准排行榜
以下为使用 1KGP 参考面板的主要填补算法基准比较(基于公开评估数据):
| 填补算法 | 版本 | 速度 (chr20, 1K 样本) | 常见变异 r² | 罕见变异 r² | 内存需求 | 并行性 |
|---|---|---|---|---|---|---|
| Minimac4 | 1.0.2 | ~2 小时 | 0.92 | 0.55 | ~8 GB | 多线程 |
| IMPUTE5 | 1.1.0 | ~1.5 小时 | 0.93 | 0.58 | ~4 GB | 多线程 |
| Beagle 5.4 | 5.4 | ~3 小时 | 0.91 | 0.52 | ~16 GB | 多线程 |
| QUIMP | 0.1 | ~0.5 小时 | 0.90 | 0.50 | ~2 GB | GPU 加速 |
| PBWT-Impute | 2.0 | ~1 小时 | 0.92 | 0.55 | ~4 GB | 多线程 |
填补质量的关键影响因素:
- 目标样本与参考面板的群体匹配度:群体匹配度越高,填补质量越好。使用错误群体的参考面板(如用 EUR 面板填补 AFR 样本)可使罕见变异 r² 下降 20%+。
- 微阵列标记密度:标记密度越高,填补质量越好。Illumina GSA (~650K 标记) vs Affymetrix Axiom (~800K 标记) vs 全基因组低密度阵列 (~50K 标记)。
- 参考面板版本:HRC > 1KGP Phase 3(对 EUR 群体),但 1KGP 在多群体场景中更优。
8.2 PRS 方法基准
以下为主要 PRS 方法使用 1KGP LD 参考的基准比较:
| PRS 方法 | 类型 | LD 参考来源 | EUR R² | AFR R² | EAS R² | 跨群体优势 |
|---|---|---|---|---|---|---|
| P+T (LD clumping) | 频率方法 | 1KGP EUR | 0.05 | 0.02 | 0.03 | 无 |
| LDpred2 | 贝叶斯 | 1KGP EUR | 0.08 | 0.03 | 0.04 | 无 |
| PRS-CS | 贝叶斯回归 | 1KGP EUR | 0.09 | 0.03 | 0.05 | 无 |
| PRS-CSx | 跨群体贝叶斯 | 1KGP 多群体 | 0.09 | 0.05 | 0.06 | ✅ 显著提升 |
| SBayesR | 贝叶斯 | 1KGP EUR | 0.09 | 0.03 | 0.05 | 无 |
| lassosum | LASSO | 1KGP EUR | 0.07 | 0.02 | 0.03 | 无 |
关键发现:PRS-CSx 是当前唯一利用 1KGP 多群体 LD 结构的 PRS 方法,在非欧洲群体中将 PRS 性能提升 40–100%。这直接体现了 1KGP 26 群体 LD 数据的独特价值。
8.3 关键论文 Top 10
| 排名 | 论文 | 引用数 | 核心贡献 |
|---|---|---|---|
| 1 | Auton et al., Nature 526:68, 2015 | 19,700+ | Phase 3 旗舰论文——88M 变异图谱 |
| 2 | Sudmant et al., Nature 526:75, 2015 | 2,300+ | SV 整合图谱——68,818 SV |
| 3 | The 1000G Consortium, Nature 491:56, 2012 | 6,800+ | Phase 1 论文——1,092 基因组整合 |
| 4 | The 1000G Consortium, Nature 467:1061, 2010 | 5,400+ | Pilot 论文——项目设计与可行性验证 |
| 5 | Byrska-Bishop et al., Cell 185:3426, 2022 | 800+ | 30× 高深度重测序——3,202 人含 602 三人组 |
| 6 | Loh et al., Nat Genet 48:811, 2016 | 900+ | SAIGE——使用 1KGP 参考的低频变异关联方法 |
| 7 | Das et al., Am J Hum Genet 98:1270, 2016 | 1,100+ | 填补方法综述——1KGP 参考面板使用指南 |
| 8 | Ge et al., Nat Genet 51:1330, 2019 | 500+ | PRS-CS——使用 1KGP LD 的贝叶斯 PRS |
| 9 | Ruan et al., Nat Genet 54:137, 2022 | 300+ | PRS-CSx——使用 1KGP 多群体 LD 的跨群体 PRS |
| 10 | Chang et al., Nat Genet 47:1118, 2015 | 1,500+ | LDpred——使用 1KGP LD 的贝叶斯 PRS |
§9 参考文献
9.1 核心数据集论文
@article{auton2015global,
title={A global reference for human genetic variation},
author={Auton, Adam and Brooks, Lisa D and Durbin, Richard M and Garrison, Erik P and Kang, Hyun Min and Korbel, Jan O and Marchini, Jonathan L and McCarthy, Shane and McVean, Gil A and Abecasis, Goncalo R},
journal={Nature},
volume={526},
number={7571},
pages={6874},
year={2015},
doi={10.1038/nature15393}
}
@article{sudmant2015integrated,
title={An integrated map of structural variation in 2,504 human genomes},
author={Sudmant, Peter H and Rausch, Tobias and Gardner, Erik J and Handsaker, Robert E and Abyzov, Alexej and Huddleston, John and Zhang, Yan and Ye, Kai and Jun, Goo and Hsi-Yang, Fritz and others},
journal={Nature},
volume={526},
number={7571},
pages={7581},
year={2015},
doi={10.1038/nature15394}
}
@article{byrskabishop2022high,
title={High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios},
author={Byrska-Bishop, Marta and Evani, Uday S and Zhao, Xuefang and Basile, Anna O and Abel, Haley J and Regier, Allison A and Corvelo, Andre and Clarke, Wayne E and Rajeevan, Harindra and Kumar, Dinesh and others},
journal={Cell},
volume={185},
number={18},
pages={34263440},
year={2022},
doi={10.1016/j.cell.2022.08.004}
}
@article{1000g2012integrated,
title={An integrated map of genetic variation from 1,092 human genomes},
author={{The 1000 Genomes Project Consortium}},
journal={Nature},
volume={491},
number={7422},
pages={5665},
year={2012},
doi={10.1038/nature11632}
}
@article{1000g2010map,
title={A map of human genome variation from population-scale sequencing},
author={{The 1000 Genomes Project Consortium}},
journal={Nature},
volume={467},
number={7319},
pages={10611073},
year={2010},
doi={10.1038/nature09508}
}
9.2 方法学论文
@article{das2016next,
title={Next-generation genotype imputation service and methods},
author={Das, Sayan and Forer, Lukas and Sch{\"o}nherr, Sebastian and Sidore, Carlo and Locke, Adam E and Kwong, Anthony and Vrieze, Scott I and Chew, Emily Y and Levy, Sage and McGue, Matt and others},
journal={Nature Genetics},
volume={48},
number={10},
pages={12841287},
year={2016},
doi={10.1038/ng.3643}
}
@article{ge2019polygenic,
title={Polygenic prediction via Bayesian regression and continuous shrinkage priors},
author={Ge, Tian and Chen, Yi-Yu and Ni, Yen-Chen and Feng, Yun-Chun and Smoller, Jordan W},
journal={Nature Communications},
volume={10},
pages={1776},
year={2019},
doi={10.1038/s41467-019-09718-5}
}
@article{ruan2022improving,
title={Improving polygenic prediction in ancestrally diverse populations},
author={Ruan, Yinqing and Lin, Yen-Feng and Feng, Yun-Chun Anna and Chen, Chia-Yen and Lam, Max and Guo, Zhonghao and He, Liang and Sawa, Akira and Martin, Alicia R and Qin, Zhaohui S and Ge, Tian},
journal={Nature Genetics},
volume={54},
number={5},
pages={573580},
year={2022},
doi={10.1038/s41588-022-01054-7}
}
@article{chang2015accelerating,
title={Accelerating GWAS discovery using a powerful, cost-effective genotyping and imputation pipeline},
author={Chang, Christopher C and Chow, Carson C and Tellier, Laurent CAM and Vattikuti, Shashaank and Purcell, Shaun M and Lee, James J},
journal={Nature Genetics},
volume={47},
number={11},
pages={13371343},
year={2015},
doi={10.1038/ng.3484}
}
@article{loh2016efficient,
title={Efficient Bayesian mixed-model analysis for genome-wide association studies},
author={Loh, Po-Ru and Tucker, George and Bulik-Sullivan, Brendan K and Vilhjalmsson, Bjarni J and Finucane, Hilary K and Salem, Rounak M and Chasman, Daniel I and Ridker, Paul M and Neale, Benjamin M and Berger, Bonnie and others},
journal={Nature Genetics},
volume={47},
number={3},
pages={284290},
year={2015},
doi={10.1038/ng.3190}
}
@article{delaneau2013improved,
title={Improved whole-chromosome phasing for disease and population genetic studies},
author={Delaneau, Olivier and Marchini, Jonathan and Zagury, Jean-Francois},
journal={Nature Methods},
volume={10},
number={1},
pages={56},
year={2013},
doi={10.1038/nmeth.2307}
}
@article{browning2016improving,
title={Improving the accuracy and efficiency of genotype imputation},
author={Browning, Brian L and Browning, Sharon R},
journal={American Journal of Human Genetics},
volume={99},
number={2},
pages={400401},
year={2016},
doi={10.1016/j.ajhg.2016.07.005}
}
@article{browning2018one,
title={Genotype imputation with millions of reference samples},
author={Browning, Brian L and Zhou, Ying and Browning, Sharon R},
journal={American Journal of Human Genetics},
volume={103},
number={3},
pages={344353},
year={2018},
doi={10.1016/j.ajhg.2018.07.015}
}
9.3 变异检出与工具论文
@article{van2013fast,
title={Fast and accurate short read alignment with Burrows-Wheeler transform},
author={Li, Heng and Durbin, Richard},
journal={Bioinformatics},
volume={25},
number={14},
pages={17541760},
year={2009},
doi={10.1093/bioinformatics/btp324}
}
@article{mckenna2010genome,
title={The Genome Analysis Toolkit: a MapReduce framework for analyzing next-generation DNA sequencing data},
author={McKenna, Aaron and Hanna, Matthew and Banks, Eric and Sivachenko, Andrey and Cibulskis, Kristian and Kernytsky, Andrew and Garimella, Kiran and Altshuler, David and Gabriel, Stacey and Daly, Mark and DePristo, Mark A},
journal={Genome Research},
volume={20},
number={9},
pages={12971303},
year={2010},
doi={10.1101/gr.107524.110}
}
@article{poplin2018universal,
title={A universal SNP and small-indel variant caller using deep neural networks},
author={Poplin, Ryan and Chang, Pi-Chuan and Alexander, David and Schwartz, Scott and Colthurst, Thomas and Ku, Alexander and Newburger, Dan and Dijamco, Jojo and Nguyen, Nam and Afshar, Pardis and others},
journal={Nature Biotechnology},
volume={36},
number={10},
pages={983987},
year={2018},
doi={10.1038/nbt.4235}
}
9.4 群体遗传学论文
@article{voight2006mapping,
title={Mapping of positive selection in the human genome from haplotype structure},
author={Voight, Benjamin F and Kudaravalli, Sridhar and Wen, Xiaoquan and Pritchard, Jonathan K},
journal={PLoS Biology},
volume={4},
number={3},
pages={e72},
year={2006},
doi={10.1371/journal.pbio.0040072}
}
@article{pickrell2009signals,
title={Signals of recent positive selection in humans from genome-wide SNP data},
author={Pickrell, Joseph K and Coop, Graham and Novembre, John and Kudaravalli, Sridhar and Li, Jun Z and Absher, Devin and Srinivasan, Balaji S and Barsh, Gregory S and Myers, Richard M and Feldman, Marcus W and Pritchard, Jonathan K},
journal={Genome Research},
volume={19},
number={5},
pages={826837},
year={2009},
doi={10.1101/gr.087577.108}
}
@article{gravel2013reconstructing,
title={Reconstructing Indian population history},
author={Reich, David and Thangaraj, Kumarasamy and Patterson, Nick and Price, Alkes L and Singh, Lalji},
journal={Nature},
volume={461},
pages={489494},
year={2009},
doi={10.1038/nature08365}
}
9.5 数据库与工具资源
| 资源 | URL | 类型 | 描述 |
|---|---|---|---|
| IGSR (1KGP 官方) | https://www.internationalgenome.org/ | 数据库 | 数据下载、文档、FAQ |
| EMBL-EBI FTP | ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/ | FTP | 原始数据下载 |
| NCBI SRA | https://www.ncbi.nlm.nih.gov/sra | 数据库 | 序列读取存档 |
| Ensembl | https://www.ensembl.org/Homo_sapiens/Info/Index | 数据库 | 基因组浏览器含 1KGP 变异 |
| Michigan Imputation Server | https://imputationserver.sph.umich.edu/ | 在线工具 | 免费 1KGP 参考面板填补服务 |
| TOPMed Imputation Server | https://imputation.biodatacatalyst.nhlbi.nih.gov/ | 在线工具 | TOPMed 参考面板填补 |
| GWAS Catalog | https://www.ebi.ac.uk/gwas/ | 数据库 | GWAS 结果汇总(1KGP 填补后) |
| dbSNP | https://www.ncbi.nlm.nih.gov/snp/ | 数据库 | SNP 编号与频率(含 1KGP 频率) |
| ClinVar | https://www.ncbi.nlm.nih.gov/clinvar/ | 数据库 | 变异临床意义(1KGP 频率注释) |
| PLINK 2.0 | https://www.cog-genomics.org/plink/2.0/ | 工具 | 基因型分析工具包 |
| BCFtools | https://samtools.github.io/bcftools/ | 工具 | VCF 文件处理 |
| VEP | https://www.ensembl.org/vep | 工具 | 变异效应预测 |
| scikit-allel | https://github.com/cggh/scikit-allel | Python 库 | 群体遗传学分析 |
| hail | https://hail.is/ | Python 库 | 大规模基因组分析框架 |
§10 声明卡
| 项目 | 内容 |
|---|---|
| 数据集名称 | 1000 Genomes Project (1KGP) |
| 数据维护方 | IGSR (International Genome Sample Resource) — EMBL-EBI + NHGRI |
| 数据许可 | Phase 3 及 30× 重测序:完全开放获取,无使用限制;Phase 1:CC BY-NC-SA |
| 商业使用 | 允许(Phase 3 及 30×);Phase 1 需遵守 CC BY-NC-SA 限制 |
| 数据引用格式 | Auton A, et al. A global reference for human genetic variation. Nature 526:68–74, 2015. |
| DOI | 10.1038/nature15393 (Phase 3) / 10.1016/j.cell.2022.08.004 (30×) |
| 数据下载 | ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/ |
| 在线浏览 | https://www.internationalgenome.org/ |
| 样本获取 | Coriell Institute for Biomedical Research (https://www.coriell.org/) |
| 数据格式 | VCF 4.1/4.2 (Phase 3) / CRAM (30×, GRCh38) |
| 基因组版本 | GRCh37 (Phase 3) / GRCh38 (30×) |
| 更新频率 | 不定期(IGSR 持续维护) |
| 最后审核日期 | 2026-08-03 |
| 审核者 | 千方病案医学编辑部 |
| 利益冲突 | 无 |
| 版本 | v1.0 |
