信息速览
HPRC — 人类泛基因组参考 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | Human Pangenome Reference Consortium(HPRC),人类泛基因组参考联盟 |
| 发布方 | NHGRI(美国国家人类基因组研究所)资助,14 所机构;UCSC 的 Benedict Paten 与 Karen Miga 共同领导 |
| 主论文 | Liao et al., “A draft human pangenome reference”, Nature 617, 312–324(2023-05-11 封面故事), DOI 10.1038/s41586-023-05896-x |
| 核心规模 | 草图:47 人 = 94 条 phased 二倍体组装;Release 2:232 人 464 组装、287 样本测序数据 |
| 相对 GRCh38 | 新增 119 M 碱基(约 90 M 来自 SV)+ 1,115 个基因重复 |
| 实证收益 | 短读长小变异错误率 ↓34%;每单倍型 SV 检出 +104% |
| 数据构成 | HiFi 60X(DeepConsensus)+ ONT Ultralong 30X + Hi-C + PacBio Kinnex RNA + Illumina WGS(trio);5-mC 修饰预测 |
| 泛基因组图 | 三策略:Minigraph(SV only)/ Minigraph-Cactus(推荐,Hickey 2023 Nat Biotechnol)/ PGGB;backbone 有 GRCh38/CHM13/GRCh37 三版 |
| 目标 | 2024 年中 350 人 / 700 单倍型(Release 2 实际落地 232 人 464 组装);项目预算约 $40M / 5 年 |
| 许可 | 全部开放(open and publicly accessible);S3 免 egress;使用遵循 Data Use Protocol |
| 获取渠道 | AWS S3 / Google Cloud / AnVIL / INSDC(SRA-ENA-DDBJ)/ UCSC assembly hub(GenArk)/ GitHub human-pangenomics |
| 本库关联 | dbSNP(变异坐标锚定)、mics |
| 本库关联 | dbSNP(变异坐标锚定)、ClinVar(临床变异注释)、gwas-catalog(关联研究参考坐标(临床变异注释)、dbSNP(变异坐标锚定)、ClinVar(临床变异注释)、gwas-catalog(关联研究参考坐标)、dbgap(受控基因组数据对照)、eg(关联研究参考坐标)、dbgap(受控基因组数据对照)、ega(欧洲受控存档) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、性能指标与许可表述均核实自以下一手来源:Nature 617 卷主论文(Liao et al. 2023,DOI 10.1038/s41586-023-05896-x)及其摘要原文、NHGRI 官方新闻稿(2023-05)、HPRC 官网数据页(humanpangenome.org/data/)、International Genome Sample Resource 的 HPRC Phase 2 页(internationalgenome.org)、HPRC 官方 GitHub 资源仓库(human-pangenomics/hpp_pangenome_resources)README、以及 UCSC Genome Browser HPRC assembly hub(hgdownload.gi.ucsc.edu)。检索核实时间为 2026-09-19。
本页为面向医疗 AI 工程师与基因组学研究者的技术参考文档,不构成临床诊断建议。泛基因组参考目前主要服务于研究场景,直接用于临床报告解读前,须确认目标实验室的验证流程与监管要求(详见 §8)。所有「坑点」均标注来源或推导依据;无法核实的信息以「据报道」「媒体口径」等措辞明示置信度。
关于样本与人群的表述:HPRC 样本来自 辞明示置信度。
关于样本与人群的表述:HPRC 样本来自 1000 Genomes Project 血缘,覆盖 25 个 population Project 血缘,覆盖 25 个 populations、五大 ancestry 分层(非洲、美洲、东亚、欧洲、南亚)。本页在描述 ancestry 时使用国际学界通行分层名称,仅为技术表述,不代表对任何人群的优劣判断。遗传学数据的解读须警惕群体归因谬误——参考基因组覆盖哪个人群与该人群的疾病风险高低没有任何因果关系。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:人类泛基因组参考——把过去 20 年「一条线性参考」(GRCh38)升级为「一组参考 + 一张图」,由 NHGRI 资助的 HPRC 联盟建设。
- 草图(2023-05-11,Nature 617 封面):47 名个体、94 条 phased 二倍体组装;每条覆盖预期序列 >99%、准确率 >99%。
- 增量:相对 GRCh38 新增 119 M 碱基(约 90 M 来自结构变异)与 1,115 个基因重复。
- 实证:用泛基因组图分析短读长数据,小变异错误率降 34%、每单倍型 SV 检出提升 104%。
- 现状:Release 2 已扩至 232 人 464 组装、287 样本多平台测序;碱基错误率 < 1/500,000(深度学习 polishing)。
- 获取:全部开放。AWS S3 免 egress、GCP、AnVIL、INSDC、UCSC hub、GitHub 索引清单。
- 适用:SV 发现与基因分型、参考偏差修正、基因组基础模型预训练、群体遗传学、法医与人类演化研究。
- 不适用:把它当人群频率数据库用(path 覆盖 ≠ 等位基因频率);不经坐标转换直接对接临床数据库。
§1.1 摘要
人类参考基因组自 2003 年草图发布以来,一直是所有人类基因组分析的坐标系。但这条「标准线」存在先天缺陷:GRCh38 的序列主要来自约 20 名个体,其中大部分序列来自单一匿名个体。任何两个人的基因组平均有 99% 以上相同,但剩下的不足 1% 的差异——尤其是一段序列在某人基因组里存在而在参考里缺失的结构变异——会在比对阶段被系统性丢弃。对与参考差异更大的人群,这种「参考偏差」意味着更多的比对错误、更少的变异检出、更差的疾病预测。
HPRC 的解法是把「参考」从一个名词变成一个集合:对每个样本做端粒到端粒级别的 de novo 组装(而非把 reads 比到旧参考上),再把所有组装对齐成一张图。图里的每条 path 是一条真实存在的单倍型路线,reads 可以沿着最像自己的路径比对。2023-05-11 发表于 Nature 617 卷(封面故事)的草图包含 47 人 94 条单倍型组装,并证明了这个方向的工程价值:同样的短读长数据,换用泛基因组图分析,小变异错误率下降 34%,每单倍型能多检出 104% 的结构变异。
数据层面,HPRC 不仅是 94 条 FASTA:它是「原始 reads(多平台)+ 单倍型组装 + 泛基因组图(三种策略)+ 图导出 VCF」的完整资源栈,对基因组 AI 而言同时提供了高质量预训练语料、监督信号(单倍型分辨的真值变异集)与图结构先验。本页从数据工程视角拆解它的规格、结构、获取与全部已知坑点。
§1.2 战略价值
对医疗 AI 团队,HPRC 的价值可以放在四个层面理解:
- 参考偏差的直接修正。如果你的下游任务(变异检测、基因分型、PRS)仍然把 reads 比到 GRCh38,那么非参考等位基因区域的信号会系统性地偏低。Nature 主论文的 34%/104% 两个数字给出了可量化的收益上限:无需更换测序平台,仅换参考即可获得。
- 单倍型分辨的真值集。HPRC 的 94 条(Release 2 为 464 条)组装是 phase 过的二倍体组装——每条染色体哪一段来自父本、哪一段来自母本是确定的。这对训练单倍型感知的模型(如变长重复区的基因分型)是不可替代的监督信号。
- 基因组基础模型的预训练语料。Evo、HyenaDNA 等基因组大模型都需要远超单参考基因组的序列多样性。HPRC 的组装序列 + 图拓扑(哪些片段以什么顺序、方向、拷贝数出现在哪些单倍型里)是天然的多样性放大器。
- 结构变异的「字典」。GRCh38 时代 SV 研究苦于没有权威目录;HPRC 图中每条非参考路径都是一个有据可查的替代等位基因。1,115 个基因重复意味着数百个剂量敏感基因存在可检测的拷贝数多态——这直接连接到神经发育疾病、免疫性状与药物代谢。
§1.3 同类资源横向对比
| 资源 | 定位 | 规模 | 单倍型分辨 | 与 HPRC 的关系 |
|---|---|---|---|---|
| HPRC | 泛基因组参考(组装+图) | R1: 47 人 94 单倍型;R2: 232 人 464 组装 | ✅(phased 组装) | — |
| 1000 Genomes Project | 群体变异常规分辨率目录 | 2,504 人(Phase 3) | 部分(低覆盖 phase) | HPRC 样本血缘来源;频率数据仍需回 1000G |
| T2T-CHM13 | 首个完整单倍型参考 | 1 个(CHM13 细胞系) | ✅(单倍体) | 已作为参考单倍型入图;HPRC 与 T2T 人员高度重叠 |
| GIAB(Genome in a Bottle) | 标准品真值集 | 数十个样本(HG001/2/3/4/5/6/7 等) | 部分(trio phasing) | NIST 的 Justin Zook 是 HPRC 作者;样本体系互补 |
| gnomAD | 人群频率数据库 | 数十万人外显子/基因组 | ❌ | 频率查询互补——HPRC 不提供人群频率 |
| SGDP(Simons Genome Diversity Project) | 人类多样性样本 | 278 人高覆盖 | 部分 | 更广的地理覆盖、更低的标准整合度 |
| dbGaP / EGA | 受控个体级数据 | 数百 study | 依 study 而定 | 受控对照:HPRC 是开放数据的反面样板 |
一句话定位:需要「参考本体」用 HPRC,需要「人群频率」用 gnomAD/1000G,需要「标准品真值」用 GIAB,需要「个体级临床表型联动」走 dbGaP/EGA 受控通道。
§1.4 版本时间轴
| 时间 | 事件 | 意义 |
|---|---|---|
| 2003-04 | 人类基因组计划「完成序列」宣布 | 线性参考时代开启;实际遗留大量缺口 |
| 2019 | HPRC 成立(NHGRI 资助,约 $40M/5 年) | 目标:构建代表人类多样性的泛基因组参考 |
| 2021-05 | T2T 联盟发布 T2T-CHM13 预印本(2022 正式发表) | 首个端粒到端粒完整单倍型;长读长技术成熟度证明 |
| 2022 | T2T-CHM13 正式发表;HPRC year 1 数据就绪 | T2T 与 HPRC 人员高度重叠;CHM13 后被整合入图 |
| 2023-05-11 | Nature 617 三连发:草图主论文 + Vollger 节段重复 + Guarracino 着丝粒 | 47 人 94 单倍型草图;119 M 新碱基;SV +104% |
| 2023-08 | Hickey et al. minigraph-cactus(Nat Biotechnol) | 图构建主方法的正式发表 |
| 2024-09/10 | Release 2 组装陆续入 NCBI(GCA_042031945.1 等,2024-09-19 至 2024-10-31 assembly date) | 232 人 464 组装落地;距 350 人目标仍有差距但数量级提升 |
| 2024+ | Release 2 图构建与泛基因组迭代(hpp_pangenome_resources 持续更新) | 464 单倍型入图;HG00272 因 chrX 误组装被排除 |
§1.5 典型应用场景
- SV 发现与基因分型管线升级:短读长 WGS 数据用 minigraph-cactus 图 + vg giraffe 比对 + PanGenie 基因分型,替代 BWA-MEM + GATK 的传统链路,SV 召回率近似翻倍(104% 口径)。
- 基因组基础模型预训练:把 464 条单倍型组装拼接为多样性语料,或在图上做 mask 语言建模(路径采样 = 天然数据增强)。
- 参考偏差的定量研究:用 HPRC 图量化某 ancestry 队列中「参考缺失序列」的占比,作为方法学论文的偏差度量。
- 法医与分子人类学:单倍型分辨的组装序列支持更精细的谱系推断与 STR/SV 指纹分析。
- 临床 SV 解释的前置研究:1,115 个基因重复目录为剂量敏感基因(如 NRXN1、AMDG 区域)的拷贝数多态提供参考路径;临床落地仍需 §8 所述的验证。
§1.6 组件全景
HPRC 资源栈的六个层次(每层都有独立下载入口与许可要求):
- 原始 reads 层:HiFi BAM(DeepConsensus basecalled,含 5-mC)、ONT POD5/BAM(R9/R10,>100 kb 超长读长,含修饰)、Hi-C(Dovetail/Illumina)、Kinnex RNA(PacBio 全长转录本)、Illumina WGS FASTQ(NYGC trio 数据)。
- 组装层:每样本两条单倍型 FASTA(Hifiasm 组装 + Hi-C/trio phasing + 深度学习 polishing),NCBI 有 GCA 编号(2024 年 9-10 月批次为 Release 2)。
- 泛基因组图层:三种策略 × 三种 backbone 的 GFA/GBZ 文件(详见 §3.6)。
- 变异层:图导出的 SNV/indel VCF(vcfwave 双等位化)与 SV VCF(PanGenie 基因分型结果)。
- 索引层:GitHub 仓库维护的 S3/GCP 位置清单(indexes 目录),是程序化下载的正门。
- 浏览层:UCSC assembly hub(GenArk)——每条组装可单独挂载到 Genome Browser,附 IGV 链接与 NCBI 交叉引用。
§1.7 「参考」的经济学:为什么泛基因组值得投入
一个常被追问的问题:既然 reads 最终都要比对,参考从「1 条」变成「94 条」的边际成本和收益怎么算?
成本侧:泛基因组图的存储量级与单参考相当(GFA 文件在 GB 级),但比对计算量上升(vg giraffe 比 BWA-MEM 慢数倍)、内存需求上升(图索引几十 GB)、团队学习曲线陡峭(新格式 GFA/GBZ、新工具链 vg/minigraph/odgi)。这是真实成本,§5.10 给了预算表。
收益侧:34%/104% 只是平均值——收益高度集中于「参考缺失区域」。对欧洲 ancestry 样本、常见 SNP 的场景,收益可能不到 10%;对非欧洲 ancestry、药物代谢基因(CYP2D6)、免疫基因(HLA、KIR)等高多态区域,收益可以是「从检不出来到检出来」的质变。工程决策的关键是把收益分布映射到你自己的数据构成,而不是只看平均数。
还有一层不易量化的收益:参照系的可扩展性。线性参考每几年大版本一次(GRCh37→GRCh38 相隔 7 年),且每次换版都是全生态坐标迁移;泛基因组图的更新是增量式的——新样本加入只是新增路径,旧路径不变。对需要长期维护数据资产的平台,这种「坐标系稳定性」本身就是价值。
§2 医学与科学背景
§2.1 参考偏差:一个 20 年的技术债
把「参考基因组」类比成地图,过去 20 年的做法是:用一张固定的城市地图去套每个新城市的 GPS 轨迹。轨迹与地图吻合的部分没问题;轨迹走进了地图上不存在的巷子(参考里没有的序列),导航系统要么强行把轨迹「折叠」回最近的已知道路(错误比对),要么直接丢弃这段数据。
这在基因组学里的定量后果:
- 比对丢弃:参考缺失的序列(non-reference sequence)无法比对,短读长数据中这部分片段在下游分析里完全隐形。
- 等位基因偏置:杂合位点上一条等位基因与参考相同、另一条不同时,参考等位基因的 reads 更容易被保留,非参考等位基因被系统低估——GWAS 的基因型错误、RNA 定量的等位基因特异性偏差都与此有关。
- ** ancestry 放大效应**:GRCh38 主要序列来自单一匿名个体(混合 ancestry 但贡献不均),与该个体基因组越远的人群,上述两类损失越大。NHGRI 官方新闻稿的原话:「Everyone has a unique genome, so using a single reference genome sequence for every person can lead to inequities in genomic analyses.」——用单一参考做所有人的分析,会在结果里制造系统性不公平。
泛基因组不是「修一张更大的地图」,而是换了一种表示法:地图上允许同一路段存在多条可选路线(path),每个个体的 reads 沿着与自己最像的路线走。这从表示法层面消除了「唯一标准路线」的假设。
§2.2 GRCh38 的构成问题
NHGRI 官方口径:现行参考由「约 20 人」的基因组构成,其中大部分序列来自单一匿名个体。这个构成的来龙去脉值得了解——参考基因组不是「平均人」,而是数百个 BAC 克隆的拼接,每个克隆来自不同供体,最终一条线把不同人的片段连在一起。这样的「马赛克参考」有两个后果:
- 没有任何真实个体与参考完全一致——参考本身是一个不存在的嵌合体;
- 复杂位点上,不同片段的拼接边界制造人工断点,长读长时代的比对在这些边界频繁碎裂。
「92% 完整」的口径同样重要:GRCh38 尚有数百个缺口(gaps),集中在着丝粒、端粒近端与高度重复的节段重复区。T2T-CHM13 补齐了这最后约 8%(新增约 2 亿碱基),其中大量正是结构变异的热区。HPRC 把 T2T-CHM13 整合为图中的一条参考路径,等于把「完整单倍型」作为泛基因组的第 95 条(草图口径)路线加入。
§2.3 T2T 与 HPRC:同一批人的两次冲锋
理解 HPRC 绕不开 T2T(Telomere-to-Telomere)联盟:
- 技术同源:两者的可行性都建立在长读长三件套上——PacBio HiFi(高准确长读)、Oxford Nanopore Ultralong(超长读长跨越重复单元)、Hi-C(染色体规模支架)。T2T 证明了「一条基因组可以测完整」,HPRC 回答「几百条能不能规模化」。
- 人员重叠:Karen Miga(UCSC)是 T2T 共同领导者之一,也是 HPRC 共同领导者;Evan Eichler、Adam Phillippy 等核心成员两边都在。NHGRI 新闻稿明确指出「许多 T2T 研究者也是 HPRC 成员」。
- 资源接力:T2T-CHM13 直接成为 HPRC 图的参考路径之一;HPRC Release 2 组装则产出大量完整 T2T 级别的染色体(国际基因组样本资源页口径),说明组装管线已把 T2T 从「极限操作」变成「流水线工艺」。
§2.4 结构变异为什么是主战场
HPRC 新增的 119 M 碱基中约 90 M 来自结构变异——这个比例揭示了泛基因组的核心增量在 SV 而非 SNP:
- SV 的表示困境:SNP 用一对字母就能表示(A/T),SV 却有缺失、插入、倒位、复制、易位五种基本类型,且插入与复制的「序列本身」在线性参考里根本不存在——你在 VCF 里写「此位置有 3 kb 插入」时,插入的序列内容要么缺失要么以 ALT 序列形式藏在一行超长文本里。
- SV 的医学权重:SV 覆盖的碱基数远超 SNP(结构变异可一次改变百万碱基级别的 DNA),剂量敏感基因的拷贝数变化直接对应疾病(如 22q11.2 缺失综合征、CYP2D6 基因重复改变药物代谢)。药监局与临床实验室对 SV 检出的验证要求逐年提高,但短读长临床 WGS 的 SV 检出长期是短板。
- 104% 的含义:主论文的 SV 检出提升 104% 是「每单倍型 SV 数量」口径——不是把已有 SV 多检出一倍,而是原来完全检不出的那一半 SV 现在可见。对临床,这意味着原本报告为「阴性」的病例可能找到致病变异。
§2.5 单倍型:被忽略的正确单位
HPRC 的所有规模口径都以「单倍型」为单位(47 人 = 94 单倍型),这不是修辞习惯而是技术实质:
- phase 的意义:人类是二倍体,每条染色体有两份拷贝。两份上的变异如何配对(phase)决定了基因型推断的正确性——尤其对涉及多个杂合变异的隐性遗传、复合杂合与药物代谢基因的启动子-编码区配对。
- 组装的单位:Hifiasm 用 Hi-C 或 trio 信息把组装直接分成两条单倍型。「47 个二倍体个体」产出的就是「94 条单倍型组装」,每条从端粒到端粒连续。
- 图的路径:泛基因组图里的 path 是单倍型路线。把「人」当单位会在图里制造逻辑矛盾(父本路线与母本路线错误拼接),把「单倍型」当单位则图与样本一一对应。
口径换算速查:目标 350 人 = 700 单倍型;Release 2 落地 232 人 = 464 单倍型(其中 464 条入图,HG00272 的两条被排除是特例——见坑点 7);草图 47 人 = 94 单倍型。看到「350 条序列」这类表述要立刻警觉单位错了。
§2.6 图基因组的最小概念集
读 HPRC 文档与工具链需要的最小概念集(按依赖顺序):
- Segment(位段):图上的节点,一段共享的 DNA 序列。
- Edge(边):位段之间的邻接关系,允许分岔——分岔处就是变异位点。
- Path(路径):一条从左到右穿过图的路线,代表一个真实单倍型在该区域的序列。
- GFA 格式:图的文本表示(Segment 行 + Edge 行 + Path 行),泛基因组图的通用交换格式。
- GBZ 格式:vg 工具链的压缩图索引格式,供 giraffe 比对器高效查询。
- 参考路径(reference path):图中被指定为「GRCh38 坐标系」的那条特殊路径,用于与线性时代坐标互转。
- 非参考路径:任何偏离参考路径的路线——这就是「参考缺失序列」在图里的安身之处。
NHGRI 官方科普插图的地铁图隐喻仍然是最准确的直觉:SNV 是换乘一个小站、缺失是某站跳过、插入是多停一站、倒位是反向行驶、复制是环形线绕圈。图基因组把「标准答案」变成了「路线图集合」。
§2.7 1000 Genomes 血缘:样本从哪里来
HPRC 样本全部来自 1000 Genomes Project(1000G)血缘。这个决策的分量需要放在 ELSI(伦理、法律与社会影响)背景下看:
- 1000G 样本有成熟的知情同意框架(大规模基因组共享授权),复用其样本避免了为 HPRC 重新建立同意流程的时间成本,也规避了「再度被剥削人群」的伦理风险——基因组学史上,原住民与低收入国家人群的样本被过度采集而收益不成比例的教训不止一次。
- 覆盖面:1000G Phase 3 的五大 ancestry 分层(非洲、美洲、东亚、欧洲、南亚)25 个 populations 在 HPRC Release 2 数据门户可见(YRI、ESN、MSL、GWD、PUR、COL、PEL、MXL、CHS、CHB、JPT、CDX、KHV、FIN、GBR、IBS、TSI、PJL、ITU、STU、BEB 等)。
- 继承与差异:HPRC 继承了 1000G 的样本编号(HG00097、NA12878 格式)与 population 元数据体系,但不等于 1000G 的数据发布——测序平台(HiFi/ONT vs 旧 Illumina 低覆盖)、覆盖深度(60X vs 7X)与产物(组装 vs 变异调用)完全不同。引用与致谢需同时覆盖两个项目(见 §8.4 模板)。
- 局限也要继承:1000G 的抽样是「人群便利样本」而非人群频率代表性抽样,这一局限 HPRC 同样存在——见坑点 5。
§2.8 ELSI 治理结构
HPRC 是少数把伦理工作内置为联盟常设结构的大型基因组项目:
- ELSI 工作组:与测序、组装、图构建等技术小组平行设置,参与样本使用、数据发布与社区沟通的决策。
- 社区参与:联盟设有社区参与小组(Community Engagement),负责与样本来源人群的信息双向流动。
- Data Use Protocol:数据使用协议明确了出版前沟通义务、致谢要求与样本溯源表述规范——开放数据不等于无义务使用,见 §8.2。
对国内团队,还叠加一层《人类遗传资源管理条例》的合规维度:HPRC 数据虽在境外服务器开放,但利用其数据(尤其涉及中国人群样本子集的再分析)产生的成果发表、数据出境与合作的合规要求,建议由机构伦理与法务部门预审(详见 §8.6)。
§2.9 泛基因组在群体遗传学中的位置
把 HPRC 放回群体遗传学的方法谱系:传统 GWAS 以「SNP 芯片 + 线性参考 imputation」为主链,imputation 面板(1000G、HRC、TOPMed)本质是把参考覆盖扩展到「更多已知变异位点的频率表」;泛基因组图则把扩展推向「序列本体的多样性」。两者是互补而非替代:GWAS 关联位点的频率与效应量解释仍需大型队列(见本库 gwas-catalog 页),而泛基因组图解决的是「参考里没有的序列」这一层。临床遗传学中,ClinVar/dbSNP 的变异坐标长期锚定 GRCh37/38,这也是 HPRC 无法一夜替换线性参考的现实约束——过渡期的工程方案见 §5.7。
§3 数据集规格
§3.0 规格总表
| 维度 | Data Release 1(草图,2023-05) | Data Release 2(2024-09/10 起) |
|---|---|---|
| 个体数 | 47 | 232(组装);测序数据 200+ 个体(Data Explorer 口径 287 samples) |
| 单倍型组装 | 94 条 phased 二倍体组装 | 464 条(全部入图;HG00272 例外被排除) |
| 组装覆盖 | >99% 预期序列,>99% 准确率(碱基与结构水平) | 误组装减少约 3 倍;大量完整 T2T 染色体 |
| 碱基错误率 | 组装管线 v1 口径 | < 1/500,000(深度学习 polishing 后) |
| 测序平台 | PacBio HiFi + ONT UL + Hi-C + Illumina | + PacBio Kinnex RNA;统一 DeepConsensus;R9/R10 统一 basecall |
| 覆盖深度 | HiFi 约 30-40X 量级(早期批次) | HiFi 60X;ONT >100 kb 读长 30X |
| 修饰预测 | 部分 | HiFi 与 ONT 均含 5-mC |
| 人群覆盖 | 1000G 五大 ancestry | 25 个 populations 全谱 |
| 泛基因组图 | 三策略(Minigraph / Minigraph-Cactus / PGGB) | Minigraph-Cactus v2.1(GRCh38/CHM13/GRCh37 三 backbone) |
| 获取 | 全开放 | 全开放(S3 免 egress) |
§3.1 测序数据类型详解
Release 2 的五类数据各有分工,理解它们才能理解组装质量从何而来:
- PacBio HiFi(60X):高准确(≥Q30)长读(15-20 kb),组装的「主力部队」。DeepConsensus 统一 basecall(Sequel II 离机 / Revio 在机),保证不同批次、不同机器的读长质量一致——这是规模化项目的关键工程决策。含 5-mC 修饰预测(kinetics 推断)。
- Oxford Nanopore Ultralong(30X,>100 kb):读长跨越节段重复的核心单元(节段重复区长常达 50-300 kb),负责「把难以跨越的重复区读穿」。R9/R10 化学试剂统一 basecall。与 HiFi 互补:HiFi 给准确度、UL 给跨度。
- Dovetail/Illumina Hi-C:染色质构象数据,用于把组装锚定到染色体规模支架并做 phase(trio 不可用时的 fallback)。
- PacBio Kinnex RNA:全长转录本测序,支撑组装的基因注释( Release 2 附带 annotations)。
- Illumina WGS(NYGC):亲代/子代 trio 高覆盖短读,用于 trio phasing 与一致性验证。
这套「五平台矩阵」的每一项都有不可替代性——准确度(HiFi)、跨度(UL)、支架与 phase(Hi-C)、注释(Kinnex)、真值验证(trio WGS)。对想自建长读长组装管线的团队,这张矩阵就是采购清单的参考答案。
§3.2 组装质量指标体系
HPRC 发布组装时的质量口径,也是你复用时应自查的指标:
| 指标 | 口径 | 来源 |
|---|---|---|
| 序列覆盖 | >99% 预期序列 | Nature 主论文摘要 |
| 准确率 | >99%(碱基与结构水平) | Nature 主论文摘要 |
| N50 量级 | 染色体级支架(端粒到端粒或近端粒间隙) | T2T/HPRC 通行口径 |
| 误组装 | R2 较 R1 减少约 3 倍 | IGSR hprc2 页 |
| 碱基错误 | R2 < 1/500,000 | IGSR hprc2 页(Google Research × UCSC 深度学习 polishing) |
| phase | Hi-C 或 trio 分辨两条单倍型 | 组装管线(Hifiasm) |
| 完整染色体 | R2 产出大量完整 T2T 级染色体 | IGSR hprc2 页 |
自查建议:拿到任何一条组装,先跑 yak(亲本 k-mer 一致性,trio 可用时)、QUAST(结构指标)、Merqury(k-mer 准确度估计)三件套,再决定是否入你的下游。坑点 7 的 HG00272 案例说明即使联盟级管线也会产出需要剔除的组装。
§3.3 人群覆盖与元数据
25 个 populations 的分布(IGSR 数据门户口径),按五大 ancestry 分层:
- 非洲(AFR):Yoruba(YRI)、Esan(ESN)、Mende(MSL)、Gambian Mandinka(GWD)、Luhya(LWK)、African Caribbean(ACB)、African American(ASW)等
- 美洲(AMR):Puerto Rican(PUR)、Colombian(COL)、Peruvian(PEL)、Mexican American(MXL)
- 东亚(EAS):Han Chinese South(CHS)、Han Chinese Beijing(CHB)、Japanese(JPT)、Dai(CDX)、Kinh(KHV)
- 欧洲(EUR):Finnish(FIN)、British(GBR)、Iberian(IBS)、Toscani(TSI)
- 南亚(SAS):Punjabi(PJL)、Gujarati(GIH)、Indian Telugu(ITU)、Indian Tamil(STU)、Bengali(BEB)
元数据使用注意:样本编号(HG/NA 前缀)与 population/ancestry 标签可从 IGSR 数据门户按样本查询;sex、family 关系(trio)等元数据在 1000G 元数据表中有继承版本。ancestry 标签是采样地便利标签而非族群本质标签——分析中把它当协变量分层因子用,不要当「种族」解释。
§3.4 DAIMS 数据集资产信息表
| 字段 | 内容 |
|---|---|
| 资产名称 | Human Pangenome Reference Consortium(HPRC)Draft Pangenome Reference |
| 资产类型 | 多层级资源栈(原始 reads + 单倍型组装 + 泛基因组图 + 图导出变异) |
| 版本 | Draft(Nature 2023-05-11)/ Data Release 2(2024-09/10 陆续入 NCBI) |
| 规模 | R1: 47 人 94 单倍型;R2: 232 人 464 组装、287 samples 测序数据(5,346+ 数据文件,IGSR 门户口径) |
| 格式 | FASTA(组装)/ GFA/GBZ(图)/ VCF(变异)/ BAM·POD5·FASTQ(reads)/ BED(区间) |
| 坐标系 | 图坐标(path/segment);backbone 锚定 GRCh38 / CHM13 / GRCh37 三选一 |
| 测序矩阵 | HiFi 60X + ONT UL 30X + Hi-C + Kinnex RNA + Illumina trio WGS;5-mC 双平台 |
| 组装工具 | Hifiasm(HiFi+ONT 整合、Hi-C/trio phasing)+ 深度学习 base-level polishing |
| 图策略 | Minigraph(SV only)/ Minigraph-Cactus(base-level,推荐)/ PGGB(对称全对全) |
| 样本血缘 | 1000 Genomes Project 血缘,25 populations,五大 ancestry |
| 许可 | 开放数据(All data are open and publicly accessible);Data Use Protocol 约束使用行为 |
| 获取 | AWS S3(免 egress)/ Google Cloud / AnVIL / INSDC / UCSC hub / GitHub 索引 |
| 计算需求 | 图比对需大内存(GBZ 索引数十 GB);图构建需高内存集群;原始数据 PB 级 |
| 引用 | Liao et al. Nature 617:312-324 (2023) DOI 10.1038/s41586-023-05896-x(+ 引用 GenArk:Clawson et al. Genome Biol 2023) |
| 健康声明 | 健康个体样本;无个体级临床表型联动;不可用于个体医疗决策 |
§3.5 与 GRCh38 的定量对比
Nature 主论文的三个增量数字,每个都值得单独理解:
- 119 M 新碱基(常染色质多态序列):相当于在参考里凭空增加了约 4% 的人类基因组长度。这些不是「垃圾序列」——是真实存在于部分人基因组、而 GRCh38 缺失的序列。
- 约 90 M 来自 SV:说明新增序列的主体是结构变异(大片段插入/复制),而不是 SNP 累积(SNP 只改字母不增加长度)。
- 1,115 个基因重复:数百个基因在部分人群中存在额外拷贝。基因重复直接改变剂量——对药物代谢(CYP 家族)、免疫(HLA/KIR)、神经发育(NRXN/MECP2 区域)基因家族意味着「同一种药、同一个基因型、不同的代谢速度」。
- 对照面:GRCh38 只有约 20 人来源且 92% 完整;T2T-CHM13 补完单条单倍型;HPRC 把「完整」与「多样」同时满足。
§3.6 泛基因组图三策略对比
hpp_pangenome_resources README 的策略矩阵(选图前必读):
| 策略 | 构建方式 | 分辨率 | 范围 | 循环路径 | 短读长映射 | 长读长映射 |
|---|---|---|---|---|---|---|
| Minigraph | minimap2 泛化,迭代构建 | SV only(>50 nt) | 全基因组 | 有 | 未测试 | 最快 |
| Minigraph-Cactus | minigraph 图 + Cactus base-level 比对 | 碱基级 | 非着丝粒 | 无(非参考路径保留) | 是(快) | 是 |
| PGGB | seqwish/平滑全对全 | 碱基级 | 全基因组 | 有(多) | 未测试 | 是(最慢) |
选择建议(README 原则 + 实践补充):
- 默认选 Minigraph-Cactus:base-level 分辨率 + 无循环路径 + 工具链最完整(VCF 导出、PanGenie 基因分型、vg 索引全套),Hickey 2023 Nat Biotechnol 有正式方法论文背书。
- 只关心大 SV 时选 Minigraph:速度最快,但 SNP/indel 级变异不在图中。
- 做无参考偏置的方法研究选 PGGB:对称构建不偏向任何参考路径,代价是循环路径多、下游工具兼容性差、计算最重。
- backbone 三选一:Minigraph-Cactus 提供 GRCh38/CHM13/GRCh37 三个版本。与现有临床/数据库坐标对接选 GRCh38;追求最完整参考路径选 CHM13;维持旧项目兼容才用 GRCh37。三版坐标系不同,混用必错(坑点 4)。
§3.7 Release 2 图构建细节
- 入图规模:464 条单倍型(232 样本组装 + GRCh38 + CHM13 两条参考路径凑齐 464)。
- 排除特例:HG00272 因 chrX 大规模误组装被排除——这是图构建前的 QC 闸门在起作用,也是所有下游用户的对照组:即使联盟级管线也会出组装事故。
- 产物矩阵(v2.1):GFA + GBZ 图文件;全染色体分解图;多序列比对导出(HAL/MAF);vcfwave 双等位 VCF;PanGenie 基因分型 VCF;vg 工具链全套索引(gbz/hapl/snarls/dist/zipcodes);参考 gaps BED;gRef 坐标映射文件。
- 版本陷阱:v2.0 与 v2.1 并存(v2.1 修复线粒体比对与逐染色体 minigraph 顺序问题),引用与复现务必锁定 v2.1。
§3.8 存储与下载规划
| 资源层 | 量级 | 获取建议 |
|---|---|---|
| 单条组装 FASTA | 约 3 GB(两条单倍型 6 GB 级) | 按样本选择性下载 |
| 全部 464 组装 | TB 级 | 先下索引清单再决策 |
| 泛基因组图 GFA/GBZ | 单图 GB-几十 GB 级(依策略与 backbone) | 直接下载(v2.1) |
| 原始 reads(全量) | PB 级 | 极少需要全量;按样本+平台拉取 |
| VCF 产物 | 数十 GB 级 | 直接下载 |
S3 免 egress 是真实福利:从 AWS EC2/us-east-1 拉取全量组装的花费主要是磁盘而非带宽。INSDC 渠道(SRA/ENA/DDBJ)适合需要正式 accession 引用的场景(每个文件有 SRR/SAMN 编号);AnVIL 适合想在 Terra 工作流平台直接跑 WDL 的团队;GCP bucket 配合 AnVIL 数据表。
§3.9 获取路径速查
- 入门浏览:UCSC Genome Browser HPRC assembly hub——每条组装单独挂载,IGV 链接可用,NCBI assembly/BioSample/BioProject 直链。
- 程序化下载:GitHub human-pangenomics/hpp_pangenome_resources 的 indexes 目录 → AWS CLI 清单(s3:// URI 全列)。
- 样本维度浏览:IGSR Data Explorer(internationalgenome.org/data-portal/data-collection/hprc2)按 sample/population/data type 过滤。
- 图构建复现:hpp_pangenome_resources README 内嵌全部构建步骤(minigraph-cactus 有 per-chromosome 流程文档)。
- 引用规范:主论文 + GenArk(Clawson 2023)+ 对应数据类型的方法论文(Hickey 2023 用图、Hifiasm 论文用组装)。
§3.10 版本演进口径对齐表
不同材料里的数字口径容易混淆,对齐如下:
| 材料口径 | 数字 | 实际含义 |
|---|---|---|
| NHGRI 新闻稿(2023-05) | 47 人 / 94 序列 | 草图:47 个二倍体个体、94 条单倍型组装 |
| NHGRI 新闻稿 | 目标 350 人 / 2024 年中 | 项目目标(媒体常简化为「350 条序列」——单位错) |
| Nature 主论文 | 119 M 新碱基 / 1,115 基因重复 / 34% / 104% | 相对 GRCh38 的增量与实证收益 |
| IGSR hprc2 页 | 200+ 个体 / 287 samples / 232 人 464 组装 | R2 测序数据与组装规模(数字并存因数据批次差异) |
| hpp_pangenome_resources | 464 单倍型入图 / HG00272 排除 | R2 图构建实际规模 |
| 通行媒体口径 | 「亚非欧美 47 人」 | 草图样本的地域构成(准确但不是 ancestry 技术口径) |
§3.11 与 1000G 数据的「同源异构」关系
HPRC 与 1000G 的数据关系是「同一批人、两种产物」:
- 相同:样本个体、编号体系、population 元数据、知情同意框架。
- 不同:测序深度(60X HiFi vs 7X Illumina)、产物(de novo 组装 vs 比对+calling)、分辨率(单倍型完整序列 vs 变异位点列表)、规模(R1 94 单倍型 vs 1000G 2,504 人)。
- 工程含义:需要人群频率 → 用 1000G/gnomAD;需要完整单倍型序列 → 用 HPRC;两者联用(HPRC 组装 + 1000G 频率过滤)是稳健组合——但注意坑点 5 的频率语义。
§4 数据结构
§4.0 资源目录形态
程序化获取的入口是 GitHub 仓库的索引目录,逻辑结构如下(以 hpp_pangenome_resources 为骨架):
human-pangenomics/hpp_pangenome_resources/
├── indexes/ # S3 位置清单(AWS CLI 下载的正门)
│ ├── hprc-v2.1-minigraph-cactus-grch38.idx
│ ├── hprc-v2.1-minigraph-cactus-chm13.idx
│ └── ... # 每种策略 × backbone 一个清单
├── minigraph-cactus/ # v2.1 产物说明与逐文件表
│ ├── graphs(GFA/GBZ)
│ ├── chroms/(分染色体图)
│ ├── hal/(多序列比对)
│ ├── vcf/(vcfwave 双等位 VCF + PanGenie 基因分型)
│ └── bed/(参考 gaps、excluded regions)
├── pggb/ # 对称全对全策略产物
└── minigraph/ # SV-only 策略产物
组装与原始 reads 不在 GitHub——仓库只放「位置清单」,实际文件在 S3/GCP/INSDC。这个「GitHub 做索引、云上放数据」的双层结构是 HPRC 下载的正确打开方式:先拉 idx 清单,再按清单构造 aws s3 cp 命令。
§4.1 GFA 格式拆解
泛基因组图的核心交换格式是 GFA(Graphical Fragment Assembly)。一个玩具示例(人工构造,用于说明字段语义):
H VN:Z:1.0
S s1 * LN:i:1000
S s2 * LN:i:50
S s3 * LN:i:1200
L s1 + s2 + RC:i:8
L s1 + s3 + RC:i:40
P GRCh38#1#chr1 s1+,s3+ 1000,1200
P NA12878#1#chr1 s1+,s2+,s3+ 1000,50,1200
字段语义:
S行:segment——节点上的序列(真实文件中为实际 DNA 字符串,此处*占位)。L行:link——有向边s1+ → s2+与s1+ → s3+分岔,即某单倍型在 s1 之后接 s2、另一单倍型接 s3(结构性插入多态)。P行:path——命名规则样本#单倍型#染色体(如NA12878#1#chr1),后面的数字是各 segment 长度。RC(read count/coverage)≠ 人群频率(坑点 5 的根源就在这行)。
真实 HPRC 图的 P 行样本名沿用 1000G 编号;GRCh38#1#chr1、CHM13#1#chr1 是保留的参考路径——图与线性坐标互转的锚点。
§4.2 图产物家族与用途映射
Minigraph-Cactus v2.1 的产物清单及用途:
| 产物 | 格式 | 用途 |
|---|---|---|
| Graph(GRCh38/CHM13/GRCh37 三版) | GFA + GBZ | 比对、可视化、变异提取 |
| Full (Unclipped) Graph | GFA + GBZ | 含重复区完整比对的未裁剪版本 |
| Chromosome Graphs | 逐染色体目录 | 分染色体处理(内存友好) |
| Multiple Alignment | HAL / MAF | 多序列比对下游分析(共线性块) |
| vcfwaved VCF | VCF + TBI | 双等位化的图变异(SNP/indel/SV 混合) |
| Raw VCF | VCF | 未双等位化的原始导出 |
| PanGenie VCFs | biallelic VCF + index | 短读长样本的图基因分型快捷通道 |
| VG Indexes | gbz / hapl / snarls / dist / zipcodes | vg giraffe 短读长比对的全套索引 |
| Reference Gaps | BED | 参考缺口区间(比对待排除区) |
| Excluded Regions | full / af BED | 频率过滤后仍不稳定的区域(比对待排除) |
| gRef Coordinates | gref | 图坐标与参考坐标的映射 |
§4.3 变异层 VCF 的两种口径
HPRC 图导出的 VCF 有两条生成路径,语义不同:
- vcfwave 路径:从图的多序列比对直接「铺平」成 VCF。优点是变异完整(含复杂嵌套),缺点是 ALT 序列可能极长(大插入把整段序列塞进 ALT 列),多数下游工具(GATK、annovar)无法直接消费。
- PanGenie 路径:以图中的已知变异为面板,对短读长数据重新基因分型。产物是干净的双等位 VCF,与常规 GWAS/临床管线兼容性好,但只能分型图中已有的变异、不能发现新变异。
实践配比:SV 发现阶段用 vcfwave/raw VCF + 专门工具(如 vcfdist 校验);队列分型阶段用 PanGenie biallelic VCF 直接进下游。两条路径的坐标都锚定所选 backbone。
§4.4 元数据与样本溯源
样本维度的元数据获取路径:
- IGSR Data Explorer:按 sample(HG00097…)/ population(25 个)/ data type(HiFi/ONT/Hi-C/Kinnex/WGS)过滤,直接给出 SRA/ENA 文件链接。
- 1000G 元数据表:样本的 sex、family 关系(trio 结构)、population、ancestry 分层的权威版本(HPRC 继承)。
- NCBI BioSample/BioProject:每条组装有 SAMN/PRJNA 编号(2024 批次见 PRJNA1156719、PRJNA1178402 等),正式引用时用 GCA/SAMN/PRJNA 三件套。
- 组装 QC 元数据:HPRC 组装仓库(human-pangenomics/HPRC)记录每条组装的 QC 状态——HG00272 排除事件的官方记录在此。
§4.5 下载与完整性验证参考代码
# 场景:下载 Minigraph-Cactus v2.1 GRCh38 backbone 的全部图产物到本地
# 依赖:aws cli v2(不需要凭证——桶公开可读)
# 前置:从 GitHub human-pangenomics/hpp_pangenome_resources 的 indexes 目录
# 获取 hprc-v2.1-minigraph-cactus-grch38.idx 清单文件
# 1) 查看清单规模(决定下载策略)
wc -l hprc-v2.1-minigraph-cactus-grch38.idx
du -sh hprc-v2.1-minigraph-cactus-grch38.idx
# 2) 全量同步(图产物通常在 TB 级以下,可整桶同步)
# --no-sign-request:公开桶免凭证
aws s3 sync --no-sign-request \
s3://human-pangenomics/pangenomes/freeze/v2.1-minigraph-cactus/grch38/ \
./hprc_v2.1_mc_grch38/ \
--exclude "*" --include "*.gfa.gz" --include "*.gbz" --include "*.vcf.gz" \
--include "*.vcf.gz.tbi" --include "*.bed"
# 3) 完整性验证:逐文件核对清单中的 size 与校验值
while read -r s3uri expected_size checksum; do
local_path="./hprc_v2.1_mc_grch38/${s3uri##*/}"
actual_size=$(stat -c%s "$local_path" 2>/dev/null || echo 0)
if [ "$actual_size" -ne "$expected_size" ]; then
echo "SIZE MISMATCH: $local_path ($actual_size vs $expected_size)"
fi
done < hprc-v2.1-minigraph-cactus-grch38.idx
# 4) 单样本组装下载(走 INSDC/SRA 渠道,正式 accession 引用场景)
prefetch SRR14611218 # 示例:HG02818 的 HiFi BAM
fastq-dump --split-files SRR14611218 # 按需转 FASTQ
§4.6 图的快速体检脚本
拿到 GFA 后先做五项体检再投入下游(避免坑点 2/5/7):
#!/usr/bin/env python3
"""HPRC GFA 快速体检:统计 segment/path/边规模、参考路径存在性、
path 覆盖分布与孤儿节点,输出是否可安全投入下游的判断依据。"""
import gzip
import sys
from collections import Counter
def gfa_healthcheck(gfa_path: str):
n_seg = n_edge = n_path = 0
seg_ids = set()
seg_in_path = Counter()
path_names = []
opener = gzip.open if gfa_path.endswith(".gz") else open
with opener(gfa_path, "rt") as fh:
for line in fh:
tag = line[0]
if tag == "S":
seg_ids.add(line.split("\t")[1]); n_seg += 1
elif tag == "L":
n_edge += 1
elif tag == "P":
n_path += 1
parts = line.split("\t")
path_names.append(parts[1])
for item in parts[2].split(","):
seg_in_path[item.rstrip("+-")] += 1
# 体检项 1:参考路径是否存在(GRCh38/CHM13 锚点)
ref_paths = [p for p in path_names if p.startswith(("GRCh38", "CHM13", "GRCh37"))]
# 体检项 2:单倍型路径数(对照官方口径 464)
hap_paths = [p for p in path_names if "#" in p and not p.startswith(("GRCh", "CHM13"))]
# 体检项 3:孤儿节点(从未被任何 path 覆盖的 segment)
orphans = len(seg_ids) - len(seg_in_path)
# 体检项 4:path 长度分布的偏态(个别 path 异常短常提示分解错误)
seg_per_path = Counter(len(p) for p in [x.split("\t") for x in []]) # 详版见 odgi stats
print(f"segments={n_seg} edges={n_edge} paths={n_path}")
print(f"ref_paths={len(ref_paths)} {ref_paths[:3]}")
print(f"haplotype_paths={len(hap_paths)} (官方 v2.1 口径应为 464)")
print(f"orphan_segments={orphans}")
return n_path == 464 and ref_paths
if __name__ == "__main__":
gfa_healthcheck(sys.argv[1])
§4.7 UCSC assembly hub 使用要点
- 逐组装挂载:hub 页面每行一个组装(common name 形如
human (HG00097 hap1 2024)),点击即只挂载该组装进 Genome Browser——避免一次挂 464 条卡死浏览器。 - IGV 备选:每行附 IGV 链接,本地 IGV 加载远端 FASTA + index,适合不想碰网页端的用户。
- track 丰富度:GenArk 为每条组装配 NCBI RefSeq、xenoRefGene、Augustus、I RefSeq、xenoRefGene、Augustus、Ensembl 基因预测、GC 含量、gaps、RepeatMasker、 基因预测、GC 含量、gaps、RepeatMasker、TRF、CpG islands 等轨道(trackData 页的统计表)。
- NCBI 交叉引用:GCA assembly / SAMN BioSample / PRJNA BioProject 三链接齐全,正式引用直接取。
- 引用义务:使用 hub 本身需引 Clawson et al. 2023(GenArk 论文,Genome Biol 24:217)。
§4.8 数据完整性验证清单
投入下游前的验证清单(按顺序执行):
- 清单核对:下载文件数与 idx 清单行数一致;逐文件 size 比对(§4.5 脚本第 3 步)。
- 版本锁定:确认拿到的是 v2.1(v2.0 有线粒体比对与染色体顺序问题);所有文件名/目录含
v2.1标记。 - backbone 一致:同一目录下的图、VCF、BED 必须同 backbone(GRCh38 或 CHM13,三选一),混放立即隔离。
- path 口径:图 path 数 = 464(v2.1 全图)或对应染色体子图口径;单倍型路径样本名与 1000G 编号表核对。
- 参考路径存在:GRCh38#1#chrN / CHM13#1#chrN 路径完整(§4.6 体检项 1)。
- VCF 可索引:全部 VCF.gz 配 .tbi;tabix 抽查若干区域能正常取回记录。
- 组装级抽查:随机抽 3 条组装,Merqury/QV 值与官方口径(>99% 准确)量级一致。
- 排除名单核对:确认 HG00272 未出现在你的分析集合(图构建已排除,但组装 FASTA 仍在 NCBI,容易误入)。
§4.9 从图到研究数据的完整血缘示例
一次典型分析的数据血缘(从原始数据到论文表格):
1000G 样本 HG00097(Yoruba population,trio 结构)
→ HiFi 60X BAM(DeepConsensus)+ ONT UL 30X + Hi-C
→ Hifiasm 组装(HiFi+ONT 整合,Hi-C phase)
→ 深度学习 polishing(<1/500k 碱基错误)
→ QC 通过 → 纳入 464 单倍型集合
→ Minigraph-Cactus v2.1 构建(GRCh38 backbone,逐染色体)
→ 全基因组 GFA/GBZ + 多序列比对(HAL/MAF)
→ vcfwave 铺平 → 双等位 VCF(图变异全集)
→ PanGenie 对你的短读长队列基因分型 → 队列 VCF
→ 频率过滤(回到 1000G/gnomAD 频率,不是 path 覆盖!)
→ 关联分析/临床解读 → 论文表格
每一环都有独立工具与验证点——血缘中断最常见的位置是「PanGenie 基因分型后直接当频率用」(坑点 5)与「跳过 excluded regions 过滤」(假阳性 SV 的第一大来源)。
§5 下游分析协议
§5.1 工具链选型速查
| 任务 | 推荐工具 | 说明 |
|---|---|---|
| 短读长图比对 | vg giraffe | GBZ 索引,几小时内比对 30X WGS |
| 长读长图比对 | GraphAligner / minigraph | 速度依图策略(见 §3.6 矩阵) |
| SV 基因分型(短读长) | PanGenie | 图中已知 SV 的队列分型,双等位 VCF 输出 |
| SV 基因分型(长读长) | Sniffles2 / pbsv + 图对照 | 先线性比对再与图 SV 目录相交 |
| 图统计与操作 | odgi | GFA 的「samtools」:stats/vis/sort/extract |
| 图变异校验 | vcfdist | vcfwave VCF 的准确性审计 |
| 图可视化 | odgi viz / Bandage | 全基因组热图 / 局部图结构 |
| 组装 QC | yak / Merqury / QUAST | 亲本 k-mer / 准确度 / 结构指标 |
| 图构建复现 | minigraph-cactus WDL/Docker | README 有 per-chromosome 全流程 |
§5.2 短读长数据换用泛基因组图的标准流程
把一条 30X 短读长 WGS 从 GRCh38 链路迁到 HPRC 图链路的最小流程:
# 0) 下载 vg 工具链与 GRCh38 backbone 图索引(§4.5 已取图)
# GBZ 是 vg giraffe 的查询索引,直接用官方产物免自建
# 1) 短读长比对到图(替代 bwa mem)
vg giraffe -Z hprc.v2.1.mc.grch38.gbz \
-f sample_R1.fq.gz -f sample_R2.fq.gz \
-t 16 -o bam > sample.giraffe.bam
# 2) 从图导出的已知 SV 面板做基因分型(替代 freebayes/GATK 的 SV 调用)
# PanGenie 输入:VCF(图变异面板)+ BAM
pangenie --vcf pangenie.vcf.gz \
--reads sample.giraffe.bam \
--out sample.pangenie
# 3) SNV/indel 路径:giraffe BAM → 深度变异调用(DeepVariant 支持 giraffe BAM)
deepvariant --ref grch38.fa \
--reads sample.giraffe.bam \
--output_vcf sample.giraffe.dv.vcf.gz
# 4) 对比实验:同一数据走 GRCh38 传统链路,量化收益(参考主论文 34%/104% 口径)
# 指标:SNV 精确率/召回(对照 GIAB 真值)、SV 数量(按类型分桶)
§5.3 基准与真值设计
换参考的收益必须用真值集量化,建议三层设计:
- SNV/indel 层:GIAB 标准品(HG001/2/3/4/5/6/7)有权威高置信区真值;HPRC 样本与 GIAB 体系互通(NIST 的 Justin Zook 是 HPRC 作者)。指标:FP/FN 变化,对照主论文 34% 错误率下降口径。
- SV 层:以 HPRC 图本身为「变异字典」,统计你的队列中命中图 SV 的数量与类型分布;辅以长读长子集(若有)做 SV 真值。指标:每单倍型 SV 检出数(对照 104% 口径)。
- 区域层:按 GRCh38 缺口区、节段重复区(segmental duplication)、excluded regions 分层报告收益——泛基因组收益集中在这些区域,只报全基因组平均会低估效果。
§5.4 频率过滤的正确姿势
图中每条路径有 read count(RC),但它不是人群等位基因频率:
- HPRC 样本不是人群代表性抽样(1000G 血缘的便利样本),path 数量反映「哪些样本有此路径」,不反映人群频率。
- 正确流程:图变异 → 提取等位基因 → 到 1000G Phase 3 / gnomAD 查频率 → 按研究设计过滤(罕见/常见)。
- Minigraph-Cactus 自带 AF-filtered 索引与 excluded regions BED(full/af 两档)——官方已经把「频率过低导致不可靠的图区域」标了出来,比对时排除这些区间是默认卫生习惯。
§5.5 长读长样本的混合策略
你的队列若有长读长子集,推荐「长读长发现 + 图校验」双轨:
- Sniffles2/pbsv 在 HiFi 数据上调用 SV(不依赖图,避免发现偏置)。
- 调用结果与 HPRC 图 SV 目录相交:命中 → 直接继承图的序列级注释(插入的完整序列内容、复制单元);未命中 → 新发现(可回投社区/自查双 pass 支撑)。
- 剂量敏感区域(1,115 基因重复清单所在 locus)用 read-depth 交叉验证,防止单工具拷贝数误判。
§5.6 图构建复现的自查要点
需要自建/扩展图(加入自有样本组装)时的检查点:
- 逐染色体流程:minigraph-cactus 有 per-chromosome 文档——chr1 单独跑通再全量,失败早暴露。
- 线粒体特判:v2.1 修复了线粒体比对问题;复现 v2.0 结果时不要把线粒体差异当 bug。
- 输入顺序:minigraph 对输入顺序敏感(v2.1 引入 per-chromosome minigraph-ordering 改进),复现时保持官方顺序文件。
- 内存预算:chr1 级染色体图构建需要数百 GB RAM 级别的机器;内存不足的常见症状是 Cactus 子任务 OOM 后静默跳过——产物缺染色体的图「看起来正常」。
- 样本 QC 前置:入图前对每条组装做 yak/Merqury——HG00272 的 chrX 事故就是缺这道闸门的代价。
§5.7 GRCh38 共存策略
过渡期「图 + 线性」双轨制是现实约束下的最优解:
- 变异坐标双写:PanGenie/vcfwave VCF 的 backbone 选 GRCh38,则 SNP/indel 可直接与 ClinVar、dbSNP、GWAS Catalog 的既有坐标对接(本库相应页面均有坐标版本字段)。
- 图特有内容单轨:非参考插入序列、图路径拓扑是线性世界没有的内容,单独存储(不强行塞进 GRCh38 VCF 的 ALT 超长字段)。
- liftOver 替代:图坐标与参考坐标的互转用官方 gRef 映射文件(比位置级 liftOver 稳,因为是比对级映射而非链文件)。
- 版本声明:任何产物注明「HPRC v2.1 MC GRCh38 backbone」完整字样——只写「GRCh38」会让复现者误以为常规线性产物。
§5.8 计算成本预算表
| 环节 | 规模估算 | 时长(参考) | 主要瓶颈 |
|---|---|---|---|
| giraffe 比对 30X WGS | 单样本 | 数小时(16 核) | 内存 64 GB 级(GBZ 索引常驻) |
| PanGenie 队列分型 | 千样本级 | 每样本分钟级 | VCF 面板装载内存 |
| DeepVariant on giraffe BAM | 单样本 | 数小时 | GPU 可加速 |
| minigraph-cactus 全图构建 | 464 单倍型 | 数天(集群) | 内存数百 GB/染色体级 |
| PGGB 全对全 | 464 单倍型 | 周级 | CPU 与内存双瓶颈 |
| odgi 全图统计/可视化 | 单图 | 小时级 | 内存(全图常驻) |
| S3 全量组装下载 | TB 级 | 视带宽 | 磁盘容量规划 |
给中小团队的务实建议:不建图、直接用官方 v2.1 产物 + giraffe/PanGenie 消费端工具链,一台 128 GB 内存的计算节点即可启动;图构建复现仅在你需要加入自有组装时才投入。
§5.9 常见失败模式与诊断
- giraffe 比对率异常低:检查 GBZ 与 reads 的 backbone 一致性;检查 excluded regions 是否误当比对区间。
- PanGenie 结果大量缺失基因型:通常是输入 VCF 与 BAM 坐标系不一致(GRCh38 图配了 CHM13 面板)。
- SV 数量爆炸:未排除 excluded regions/参考 gaps——假阳性大插入集中在着丝粒与片段重复区。
- vcfwave VCF 工具报错:ALT 超长字段超出工具解析上限——切换到 PanGenie biallelic 产物或用支持长 ALT 的解析器。
- odgi 可视化卡死:全基因组图先
odgi sort再odgi viz,或直接用分染色体子图。 - 复现图缺染色体:§5.6 提到的 Cactus 静默 OOM——构建日志逐染色体核对完成状态。
§6 实证结果与方法学分析
§6.1 主论文核心实证回顾
Nature 617 主论文(Liao et al. 2023)的实证链条拆解:
| 实证项 | 数字 | 口径 | 意义 |
|---|---|---|---|
| 组装质量 | >99% 覆盖 / >99% 准确 | 94 条单倍型,碱基与结构水平 | 组装管线达到分析级标准 |
| 新增序列 | 119 M 碱基 | 相对 GRCh38,常染色质多态区 | 参考缺失序列的首次系统清点 |
| SV 贡献 | 约 90 M / 119 M | 新增碱基中来自结构变异的部分 | 泛基因组增量主体是 SV |
| 基因重复 | 1,115 个 | 相对 GRCh38 | 剂量多态的基因级清单 |
| 小变异错误 | ↓34% | 泛基因组图 vs GRCh38 工作流,短读长 | 比对质量的直接改进 |
| SV 检出 | +104%/单倍型 | 同上 | SV 可见性翻倍 |
§6.2 34% 错误率下降的工程解读
小变异错误率下降 34% 的机制值得拆开:错误的大头不在 SNP calling 算法本身,而在比对阶段——reads 被错误折叠到参考缺失区域附近,产生的假阳性/假阴性 SNV 在下游无法修复。泛基因组图让 reads 沿正确路径比对,等于在源头修复了一批系统性错误。工程含义:
- 你的 GRCh38 管线里「无法解释」的假阳性热点,有相当比例会在换图后消失——先跑 §5.3 的分层基准再决定全量迁移。
- 34% 是「错误率下降」不是「准确率提升」——基数不同含义不同(错误率从 1.0% 降到 0.66% 是降 34%,准确率 99.0%→99.34%)。
§6.3 104% SV 提升的边界条件
SV 检出 +104% 的适用边界:
- 口径是「每单倍型 SV 数量」:同样的短读长数据,GRCh38 链路检出的 SV 中约一半是「参考内」结构变异;图链路把非参考等位(插入、倒位、复制的非参考版本)纳入可见范围。
- 类型不均匀:提升集中在插入与复制(这两类在 GRCh38 里最不可见);缺失与倒位的提升相对温和(这两类在线性参考下已有成熟检测手段)。
- 依赖图版本:104% 基于草图图(v1 口径);v2.1 图的 464 单倍型规模下,非参考路径覆盖更广,新队列的增量收益可持续。
- 不能替代长读长:对高度重复的拷贝数区域,短读长+图仍不如 HiFi 直测——图链路的正确定位是「短读长队列的 SV 可见性最大化」,不是「长读长替代品」。
§6.4 1,115 个基因重复的医学切面
1,115 个基因重复不是抽象数字——按功能聚类后的医学切面:
- 药物代谢:CYP2D6、CYP2A6 等的拷贝数多态直接改变药物代谢分型(ultrarapid/poor metabolizer),临床药物基因组学指南(CPIC)已要求剂量调整——图链路对拷贝数的直接可见性是短读长临床 WGS 的实际增量。
- 免疫多样性:HLA、KIR 基因家族的高度多态(基因含量变异)是移植配型与免疫应答研究的长期痛点,泛基因组图的路径表示是这类变异的正确数据模型。
- 神经发育:NRXN 等剂量敏感基因区域的非等位同源重组(NAHR)介导的重复/缺失,是自闭症与发育迟缓的已知机制——图中路径让这些事件的「频谱」第一次有了系统清点。
- 方法论警示:1,115 是「相对 GRCh38 的新增重复」,不是「人类基因组全部基因重复」——引用时口径要完整(坑点 8)。
§6.5 三篇姐妹论文的分工
2023-05-11 Nature 同期三连发构成完整证据链:
| 论文 | DOI | 主题 | 与主论文的关系 |
|---|---|---|---|
| Liao et al.(主论文) | 10.1038/s41586-023-05896-x | 泛基因组草图本体 | 资源定义与整体实证 |
| Vollger et al. | 10.1038/s41586-023-05895-y | 节段重复区的突变率 | 解释 SV 为何集中在片段重复——新增 90 M 碱基的机制基础 |
| Guarracino et al. | 10.1038/s41586-023-05976-y | 近端着丝粒染色体重组 | 着丝粒区(线性参考最盲的区域)的重组图景 |
配套方法论文:Hickey et al., Nature Biotechnology(10.1038/s41587-023-01793-w),minigraph-cactus 图构建——当前 v2.1 产物的方法学出处。引用组合建议:资源使用引主论文 + Hickey;着丝粒/片段重复专题研究引对应姐妹论文。
§6.6 与既有方法学的对照实验设计
在自家数据上复现主论文对照实验的最小设计:
- 对照组:BWA-MEM → GATK Best Practices(GRCh38),SV 用 Manta/Delly(线性参考标准链路)。
- 实验组:vg giraffe → DeepVariant(SNV)+ PanGenie(SV 分型),同一数据同一质量阈值。
- 真值层:GIAB 样本用 GIAB 真值;自采样本用长读长子集做 SV 真值。
- 分层报告:全基因组平均 + GRCh38 缺口区 + 节段重复区 + excluded regions 之外区域四档。
- 统计:配对设计(同 reads 双链路),变异级 McNemar 检验;SV 数量差异报告类型分桶(INS/DEL/INV/DUP)。
§6.7 结果解读的三层框架
解读 HPRC 相关数字时的三层过滤:
- 资源层:规模数字(47/94/232/464/119M/1115)全部有官方出处,可放心引用——注意单倍型口径(坑点 1)。
- 方法层:性能数字(34%/104%/<1:500k)是特定工作流下的对照结果——迁移到自家数据前先跑 §6.6 的对照设计。
- 推断层:媒体转述的「更公平的基因组」「终结种族医学偏差」等表述是价值愿景,不是技术结论——技术文档中引用会失分。
§6.8 坑点(Pitfalls)
以下 8 个坑点均来自官方文档明示的约束或真实失败模式,每条标注来源。
坑点 1:把「47 人」当「47 条序列」——单倍型口径错误
HPRC 所有规模以单倍型为单位:47 人 = 94 单倍型(草图);350 人 = 700 单倍型(目标);232 人 = 464 单倍型(R2)。媒体与部分二手文献常写成「350 条序列」「94 条基因组」——在方案书、论文方法节引用前先换算。后果:存储预算错一倍、样本量对外表述失真。(来源:NHGRI 新闻稿与 Nature 论文口径对照)
坑点 2:把 GFA 当 FASTA 用——图与线性参考的表示差异
泛基因组图不是「多条参考序列的合集」:GFA 的 segment 是共享位段、path 才是单倍型。直接把图「拉直」成一条序列(取最大覆盖路径)会丢掉非参考路径——那正是泛基因组的价值所在。正确用法:消费端工具(vg/odgi/PanGenie)原生读图。(来源:GFA 规范与 hpp_pangenome_resources)
坑点 3:三种图策略混用——Minigraph / Minigraph-Cactus / PGGB 选型错误
Minigraph 只有 SV 级分辨率(SNP 不可见);PGGB 是对称构建但循环路径多、下游兼容性差;Minigraph-Cactus 是默认推荐但「非着丝粒」范围。三者的 VCF 不可互换比较——同一区域不同策略产出的变异集不同。用 v2.1 MC 图报结果,却引用 PGGB 论文的数字,是审稿人一眼能看出的口径混乱。(来源:README 策略矩阵)
坑点 4:backbone 坐标系错位——GRCh38/CHM13/GRCh37 三版图混放
Minigraph-Cactus v2.1 有三种 backbone,坐标系完全不同。混用的典型症状:PanGenie 基因型大量缺失、VCF 区间对不上 BED、可视化里染色体顺序错乱。纪律:一个项目锁定一个 backbone;文件目录按 backbone 分层;产物文件名带 backbone 后缀。(来源:v2.1 产物清单三列并列的事实)
坑点 5:把图中 path 覆盖数当人群频率
HPRC 样本源自 1000G 便利抽样,path 数量只反映「464 条单倍型里有几条带这个等位基因」,不是任何人群的等位基因频率。把 RC/path-count 当 AF 过滤(如只保留 path ≥ 10 的变异)会系统性扭曲频率谱。正确流程:图变异 → 1000G/gnomAD 查频率 → 按需过滤。(来源:README AF-filtered 索引说明 + IGSR 抽样口径)
坑点 6:忽视 Data Use Protocol——开放数据不等于无义务使用
HPRC 全部开放,但 Data Use Protocol 明确:出版前有沟通义务、致谢需覆盖样本来源(1000G 血缘)与联盟资源(GenArk 等)。后果是真实存在的:审稿与发表阶段被要求补致谢、样本表述被质疑。开放数据的合规成本不是零,只是从「申请权限」换成了「遵守协议」。(来源:Data Use Protocol 与 README 声明)
坑点 7:HG00272 事故——组装质量自查不可省
Release 2 图构建剔除了 HG00272(chrX 大规模误组装)。教训双向:做图分析时确认你的 464 集合不含被排除样本;做组装(自有样本入图)时必须过 yak/Merqury/QUAST 三件套再入池。联盟级管线也会产出需剔除的组装——QC 闸门要设在最前面。(来源:hpp_pangenome_resources README 明示)
坑点 8:短读长线性比对硬套 SV 结论
在 GRCh38 上用 BWA-MEM + 断点工具检 SV,然后宣称「我们的人群 SV 频谱完整」——参考偏差意味着这个结论先天有偏:非参考插入根本无法在线性比对中形成断点证据。至少要在局限节声明参考覆盖口径,理想做法是补一版图链路对照(§5.2)。(来源:主论文 34%/104% 实证的直接推论)
§6.9 审稿人视角的自查清单
投出引用 HPRC 的论文前自查:
- 规模数字用单倍型口径且与所引版本一致(47/94 草图 vs 232/464 R2)。
- 图策略与版本写全:Minigraph-Cactus v2.1,backbone 明示。
- 频率过滤的频率来源不是图 path 覆盖。
- excluded regions / 参考 gaps 的排除策略写明。
- SV 检出声称有真值支撑(GIAB 或长读长子集)。
- 致谢含 HPRC 联盟、1000G 样本来源、GenArk(若用了 UCSC hub)。
- 局限节含参考覆盖与样本代表性两条。
§7 AI 就绪指南与应用场景
§7.1 HPRC 在基因组 AI 中的四种喂法
- 预训练语料:464 条单倍型组装(约 1.4 TB 级 FASTA)作为基因组基础模型的序列语料——多样性远超单参考的 3.1 Gb;配合单倍型标签可做群体条件生成。
- 监督信号:图中双等位 VCF(PanGenie/vcfwave 产物)是「图共识 vs 样本」的真值对,训练变异调用器的负样本采样可直接从图路径抽取。
- 图结构先验:GFA 拓扑本身是「哪些片段在哪些单倍型以什么顺序共现」的知识图谱——图神经网络(GNN)可直接在 odgi 导出的图上做节点分类(功能注释传播)。
- 数据增强:路径采样 = 无限生成「合法人类序列变体」的增强器——对小样本下游任务(如罕见 SV 分类)是廉价的增强源。
§7.2 基因组基础模型的实操路径
用 HPRC 语料微调/预训练的最小配方(以短序列模型为例):
#!/usr/bin/env python3
"""HPRC 组装序列 → 基因组语言模型训练片段的采样器
思路:按单倍型分层采样 6-kb 窗口;着丝粒/gap 区跳过;
输出干净的 token 化前语料(ATCGN + 单倍型 ID)。"""
import random
from pathlib import Path
def load_excluded(bed_paths):
excluded = []
for bp in bed_paths:
for line in open(bp):
if line.startswith("#"):
continue
chrom, s, e = line.split("\t")[:3]
excluded.append((chrom, int(s), int(e)))
return excluded
def in_excluded(chrom, pos, excluded):
return any(c == chrom and s <= pos < e for c, s, e in excluded)
def sample_windows(fasta_dir, excluded, n_windows=100000, win=6000, seed=42):
rng = random.Random(seed)
fastas = sorted(Path(fasta_dir).glob("*.fa"))
# 每条单倍型等概率采样;真实训练可按 ancestry 分层加权
for _ in range(n_windows):
fa = rng.choice(fastas)
# 生产实现:用 pyfaidx 随机取窗;此处略
# chrom, pos = pick_random_locus(fa, rng)
# if in_excluded(chrom, pos, excluded): continue
# seq = fetch(fa, chrom, pos, pos + win)
# if set(seq) <= set("ACGT"): # 含 N 的窗口丢弃
# yield {"haplotype": fa.stem, "sequence": seq}
return
if __name__ == "__main__":
print("骨架示例——生产版请补 pyfaidx 抽窗与多进程分片")
工程注意:组装序列含大量重复单元,tokenizer 词表与重复区处理策略(skip vs 降采样)需要消融;单倍型 ID 进 metadata 以便事后做群体分层评估。
§7.3 SV 检测模型的训练数据构造
训练 SV 检测/分型模型时,HPRC 提供的独特资产是「相位化真值 + 图表示」:
- 正样本:图 VCF 中已锚定的 SV(464 单倍型中路径证据充分的位点),附带完整插入序列内容——线性参考时代 ALT 超长或
<INS>占位的问题被图解决。 - 负样本采样:从图路径随机重组生成「不存在的单倍型」——天然困难负样本(真实片段、真实顺序、错误组合)。
- 评估集隔离:按样本族(trio)切分,防近亲泄漏;按区域切分(节段重复区单独报告),防热点过拟合。
§7.4 群体分层与公平性评估
HPRC 是评估基因组模型 ancestry 公平性的天然基准:
- 按五大 ancestry 分层报告模型在各 populations 上的变异检出率差异——HPRC 的 25 populations 标签直接可用。
- 「参考偏差量化」:统计模型预测置信度与「该区域是否为 GRCh38 缺失区」的关联——如果置信度在非参考区系统性偏低,模型继承了参考偏差。
- 声明边界:25 populations 的样本量不均衡(便利抽样),公平性结论需标注样本量分母。
§7.5 图神经网络的直接应用面
GFA 图 + 单倍型路径可直接喂 GNN 的应用面:
- 变异致病性传播:ClinVar 致病变异节点 → 图上邻接传播 → 相邻未注释变异的先验增强(与 dbSNP/ClinVar 数据联动,见本库对应页面)。
- 单倍型聚类:path 相似度 → 图嵌入 → 无监督人群结构(与 PCA 的群体推断交叉验证)。
- 基因含量变异检测:以基因为单位的路径拷贝数统计 → 剂量变异的弱监督标签。
- 图压缩与检索:GBZ/odgi 的图索引 + 嵌入检索,做「序列近邻查询」(给定一段序列找携带相似路径的单倍型)。
§7.6 任务×工具×资源速查表
| 任务 | 输入 | HPRC 资源 | 工具 | 输出 |
|---|---|---|---|---|
| 短读长 WGS SV 分型 | FASTQ | v2.1 图 + PanGenie VCF | vg giraffe + PanGenie | 双等位 SV VCF |
| 基因组模型预训练 | — | 464 组装 FASTA | 采样器(§7.2)+ 你的模型栈 | checkpoint |
| SV 模型真值 | — | 图 VCF(含序列内容) | vcfdist 校验 | 训练/评估集 |
| 公平性审计 | 模型预测 | 25 populations 标签 | 分层脚本 | 分层检出率表 |
| 拷贝数多态清点 | — | 1,115 基因重复 + 图路径 | read-depth + 图对照 | 剂量变异清单 |
| 群体结构探索 | — | path 集合 | odgi + GNN/PCA | 嵌入图 |
§7.7 端到端案例:药物代谢基因的拷贝数清点
以 CYP2D6(药物基因组学最高频的拷贝数多变基因)为例的端到端流程:
- 定位:在 v2.1 图中提取 CYP2D6 locus 的子图(odgi extract + 视图确认路径分岔结构)。
- 路径清点:464 条单倍型中该 locus 的路径结构 → 拷贝数变异谱(0/1/2/3+ 拷贝的路径计数)。
- 对照线性:GRCh38 上同 locus 的参考结构只有单一拷贝——图里暴露的重复单倍型在线性世界只能以「<DUP>」抽象存在。
- 队列分型:PanGenie 对你的短读长队列在该 locus 基因分型(read-depth 交叉验证)。
- 注释对接:分型结果 → CPIC 基因型-表型映射(metabolizer 分型)→ 报告。
- 合规:临床用途按 §8 验证路径走;研究用途按 §7.3 构造真值评估。
这个案例的通用性在于模式:定位 locus → 图路径清点 → 线性对照 → 队列分型 → 注释对接——可平移到 HLA、KIR、AMY1(唾液淀粉酶)等任何基因含量变异位点。
§7.8 报告模板:泛基因组链路的方法学段落
可直接改写进论文/技术报告的方法学段落骨架:
结构变异检测采用人类泛基因组参考联盟(HPRC)Minigraph-Cactus v2.1 图(GRCh38 backbone,464 条单倍型入图)[Liao et al., Nature 617, 2023; Hickey et al., Nat Biotechnol 2023]。短读长数据经 vg giraffe 比对至图 [giraffe 版本号],SNV/indel 以 DeepVariant [版本] 调用,SV 以 PanGenie [版本] 基于图变异面板基因分型。频率过滤基于 [1000 Genomes Phase 3 / gnomAD vN] 人群频率,图中路径覆盖数未用作频率代理。比对排除官方 excluded regions(full/af 两档口径注明)与参考缺口区。性能评估以 GIAB [样本] 高置信区真值量化,SV 召回按类型分桶报告。资源使用遵循 HPRC Data Use Protocol,致谢见 [文末]。
§7.9 成本与排期模板
一个「10 样本试点 → 千样本全量」的两阶段预算模板:
| 阶段 | 内容 | 计算资源 | 周期 |
|---|---|---|---|
| 试点 | 10 样本 giraffe+PanGenie 双链路对照(§6.6 设计) | 128 GB 内存单机 | 2 周 |
| 评估 | 分层基准报告(§5.3) | 同上 | 1 周 |
| 扩量 | 千样本全量分型 | 单机串行 8-10 周 / 集群并行 1-2 周 | 2-10 周 |
| 沉淀 | 变异库+频率对接+文档 | — | 2 周 |
先试点后扩量的价值:34%/104% 的平均收益在你的数据构成上可能放大或缩水——试点报告直接决定扩量是否值得。
§8 伦理、许可与合规
§8.1 许可结构
HPRC 的许可是「开放 + 协议」双层结构:
- 开放层:官网明示「All data are open and publicly accessible」——测序数据、组装、图全部无需注册、无需申请,S3/GCP/AnVIL/INSDC 四渠道直取,S3 还免 egress 费。
- 协议层:Data Use Protocol 与 Data Use Best Practices 规定使用行为——出版前沟通义务、致谢要求、样本溯源表述。开放数据的使用自由以遵守协议为前提。
注意与其他资源的差异:HPRC 没有「CC0/CC BY 单一许可证」式的统一许可声明,其开放性由资助方(NHGRI)政策 + 联盟协议共同保证——引用许可时建议表述为「开放获取,使用遵循 HPRC Data Use Protocol」,不要臆写具体 Creative Commons 条款。
§8.2 Data Use Protocol 的三条硬要求
- 出版前沟通:使用 HPRC 数据产出重要发现的,发表前与联盟沟通(避免「抢发」未发布分析与协调结论表述)。
- 致谢完整性:致谢需覆盖联盟、样本来源(1000 Genomes Project 血缘与原 1000G 项目的贡献者)、使用的具体资源(GenArk hub 等有独立引用要求)。
- 样本表述规范:描述样本时使用 1000G 体系 population/ancestry 标签并说明其「采样地便利标签」性质——「种族」等本质化表述不符合协议精神。
§8.3 知情同意的继承关系
样本同意框架继承自 1000 Genomes Project:样本捐赠者签署的是「大规模基因组数据共享」级别的广泛同意(broad consent),明确覆盖数据国际共享与再分析。这层继承意味着:
- HPRC 数据可以合法地用于新的再分析(包括 AI 模型训练),无需逐样本回溯同意。
- 但「同意的边界」仍有:再识别保护是前提——基因组数据的再识别风险是真实存在的(文献已有从匿名基因组推断身份的先例),使用者在发布衍生数据时不得附带可识别信息。
- 联盟 ELSI 工作组与社区参与小组持续监督数据使用的伦理面——发现不当使用有正式反馈渠道。
§8.4 致谢与引用模板
致谢模板(按需裁剪):
We thank the Human Pangenome Reference Consortium (HPRC) for generating and
openly sharing the pangenome reference resources used in this study. Sequencing
data and samples derive from the 1000 Genomes Project, and we thank the
participating donors and the original 1000 Genomes Project consortium. Assembly
browsing used the UCSC Genome Browser HPRC assembly hub (GenArk; Clawson et al.,
Genome Biol 2023). This study used [the Minigraph-Cactus v2.1 pangenome graph]
produced by the HPRC and described in Liao et al., Nature 617 (2023) and
Hickey et al., Nat Biotechnol (2023). [Use of HPRC data followed the HPRC Data
Use Protocol.]
引用清单:主论文(Liao 2023, DOI 10.1038/s41586-023-05896-x)+ 图方法(Hickey 2023, DOI 10.1038/s41587-023-01793-w)+ GenArk(Clawson 2023, DOI 10.1186/s13059-023-03057-x)+ 专题研究所用姐妹论文(Vollger/Guarracino,按 §6.5)。
§8.5 隐私与再识别风险管理
使用 HPRC 及类似开放基因组数据的隐私管理要点:
- 风险认知:基因组数据本质上可识别(同卵双胞胎除外)——「开放」指的是数据获取方式,不是「匿名安全」的技术保证。
- 衍生数据纪律:发布基于 HPRC 的衍生数据(模型、嵌入、统计量)时,避免附带可回溯个体的小-cell 统计(如单样本单变异的完整画像)。
- 模型反演意识:过拟合到单样本的生成模型存在「记忆」并泄露训练序列的风险——训练时最小样本数约束与成员推断评估是学术界的成熟做法。
- 跨境与机构合规:数据从境外服务器下载到境内,按《人类遗传资源管理条例》与《数据安全法》的口径,由机构科研管理与法务判定是否触发数据入境/出境申报——本页不构成法律意见。
§8.6 国内团队合规清单
- 下载渠道合规(公开数据直接下载不涉及权限造假)。
- 机构层面:人类遗传资源信息对外提供或开放使用的备案/审批口径,由本单位 HGRAC 对接部门判定。
- 成果发表:涉及中国人群样本子集(如 CHB/CHS/KHV 个体)的分析,发表流程按机构与期刊要求执行。
- 模型发布:基于 HPRC 训练的模型开源时,附数据来源与许可声明(本页 §8.4 模板可用)。
- 免责声明:以上为工程实践视角的整理,具体合规判定以机构法务与监管部门意见为准。
§9 谱系与生态
§9.1 参考基因组谱系时间线
2003 HGP「完成序列」→ 线性参考时代开始
2008 1000 Genomes Project 启动(样本库 + 群体变异常规目录)
2013 GRCh38 发布(现行线性参考,~20 人来源,92% 完整)
2019 HPRC 成立(NHGRI,~$40M/5 年)
2022 T2T-CHM13 发布(首个完整单倍型)
2023 HPRC 草图(47 人 94 单倍型,Nature 617)
2023 minigraph-cactus 方法发表(Nat Biotechnol)
2024 HPRC Release 2(232 人 464 组装)
未来 目标 350 人 700 单倍型;着丝粒完整组装与图收敛持续迭代
§9.2 术语表
| 术语 | 定义 |
|---|---|
| 泛基因组(pangenome) | 一个物种全部或代表性基因组序列的集合与图结构 |
| 单倍型(haplotype) | 一条染色体上的完整序列(二倍体个体有两条) |
| phase / phased | 确定变异在两条染色体上的分布 |
| Segment(位段) | 图上共享的 DNA 片段(节点) |
| Path(路径) | 穿过图的路线,对应一条单倍型在该区域的序列 |
| GFA / GBZ | 图的文本交换格式 / vg 工具链压缩索引格式 |
| backbone | 图中被指定为线性坐标锚点的参考路径(GRCh38/CHM13/GRCh37) |
| 参考偏差(reference bias) | 比对与调用因参考缺失序列产生的系统性偏差 |
| 结构变异(SV) | ≥50 bp 的基因组结构改变(缺失/插入/倒位/复制/易位) |
| PAV / CNV | 存在缺失多态 / 拷贝数多态 |
| 节段重复(segmental duplication) | ≥1 kb、相似度 ≥90% 的基因组重复片段,SV 热区 |
| minigraph-cactus | minigraph 图 + Cactus 比对精化的图构建管线 |
| PGGB | 全对全对称图构建管线(seqwish) |
| PanGenie | 基于图变异面板的短读长基因分型工具 |
| vg giraffe | 基于图的短读长快速比对器 |
| odgi | GFA 图统计、操作与可视化工具集 |
| excluded regions | 官方标注的比对排除区(参考 gaps + 低频不稳定区) |
| GenArk | UCSC 的万级物种/组装浏览器hub体系(HPRC hub 所在) |
| ELSI | 伦理、法律与社会影响(Ethical, Legal and Social Implications) |
| trio phasing | 用亲代-子代三联体信息做单倍型定相 |
§9.3 资源选型决策树
你的需求是什么?
├─ 「把短读长 WGS 的 SV 检出提上去」
│ → v2.1 MC 图(GRCh38)+ vg giraffe + PanGenie(§5.2)
├─ 「训练基因组基础模型」
│ → 464 组装 FASTA 语料 + excluded regions 过滤(§7.2)
├─ 「查人群等位基因频率」
│ → 不用 HPRC → 1000G / gnomAD(坑点 5)
├─ 「查临床变异致病性」
│ → ClinVar(本库有专页);HPRC 图提供 locus 序列上下文
├─ 「受控个体级表型联动数据」
│ → dbGaP / EGA(本库有专页);HPRC 是无表型的健康对照资源
├─ 「做方法学研究(无参考偏置)」
│ → PGGB + 方法论文级消融(§3.6)
└─ 「浏览某条组装」
→ UCSC HPRC hub 逐组装挂载(§4.7)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| dbSNP | 变异坐标锚定 GRCh37/38——图变异与已知 rsID 对接的桥 |
| ClinVar | 临床致病性注释——HPRC 提供 locus 序列内容,ClinVar 提供临床语义 |
| gwas-catalog | GWAS 关联的参考坐标与频率语境——泛基因组图改进其下游基因分型 |
| dbGaP | 受控个体级数据对照——HPRC 是开放但无表型的反面参照 |
| EGA | 欧洲受控存档——同为「个体级基因组数据」的不同访问模式 |
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | 链接 | 用途 |
|---|---|---|
| 联盟官网 | https://humanpangenome.org/ | 项目总览、新闻、治理 |
| 数据页 | https://humanpangenome.org/data/ | 全渠道获取入口与使用规范 |
| Data Explorer(R2) | https://internationalgenome.org/data-portal/data-collection/hprc2 | 按样本/人群/数据类型浏览 |
| 图资源仓库 | https://github.com/human-pangenomics/hpp_pangenome_resources | 图产物索引与构建文档 |
| 组装仓库 | https://github.com/human-pangenomics/HPRC | 组装生成与 QC 记录 |
| UCSC assembly hub | https://hgdownload.gi.ucsc.edu/hubs/HPRC/index.html | 逐组装浏览与下载 |
| 主论文 | https://www.nature.com/articles/s41586-023-05896-x | 草图资源定义 |
| 图方法论文 | https://www.nature.com/articles/s41587-023-01793-w | minigraph-cactus |
| GenArk 引用 | https://doi.org/10.1186/s13059-023-03057-x | hub 体系引用 |
§10.2 关键文献速查
- Liao, W.-W. et al. A draft human pangenome reference. Nature 617, 312–324 (2023). DOI 10.1038/s41586-023-05896-x(主论文,引用 1,324+)
- Hickey, G. et al. Pangenome graph construction from genome alignments with Minigraph-Cactus. Nat Biotechnol (2023). DOI 10.1038/s41587-023-01793-w
- Vollger, M. R. et al. Segmental duplication structural variation. Nature 617 (2023). DOI 10.1038/s41586-023-05895-y
- Guarracino, A. et al. Acrocentric chromosome recombination. Nature 617 (2023). DOI 10.1038/s41586-023-05976-y
- Clawson, H. et al. GenArk: towards a million UCSC genome browsers. Genome Biol 24, 217 (2023). DOI 10.1186/s13059-023-03057-x
§10.3 站内延伸阅读
- dbSNP — 变异 rsID 与坐标锚定的权威目录:图变异与已知 rsID 对接的桥
- ClinVar — 临床变异致病性注释库:HPRC locus 序列上下文 + ClinVar 临床语义
- GWAS Catalog — 全基因组关联权威目录:关联研究坐标与频率语境
- dbGaP — 受控个体级基因组-表型数据:与开放数据的访问模式对照
- EGA — 欧洲基因组-表型受控存档:欧洲侧受控数据通道
§10.4 FAQ
Q1:HPRC 数据可以商用吗?
A:官网口径为全部开放(open and publicly accessible),无明确禁止商用条款;但使用须遵循 Data Use Protocol。商用前的许可尽调建议以联盟官方确认函为准——本页不构成法律意见。
Q2:「350 人」目标达成了吗?
A:媒体报道的 350 人(700 单倍型)是 2024 年中目标口径。实际 Release 2 落地 232 人 464 组装(IGSR 门户口径)。项目在持续扩展,引用时用实际发布数而非目标数。
Q3:为什么不用 gnomAD 代替 HPRC?
A:gnomAD 是频率数据库(数十万人但无单倍型完整序列),HPRC 是参考本体(少量个体但完整单倍型+图)。两者回答不同问题:频率查 gnomAD,序列/结构/图用 HPRC。
Q4:短读长数据换图链路,成本增加多少?
A:比对计算量上升(giraffe 比 BWA-MEM 慢)、内存需求上升(GBZ 索引常驻 64 GB 级)。参照 §5.8 预算表:千样本队列单机串行约 2 个月。收益对价是 SV 检出近似翻倍与错误率显著下降。
Q5:HG00273、HG00272 这些样本号去哪查?
A:1000G 编号体系。IGSR Data Explorer 按样本查 population 与数据类型;NCBI BioSample 查组装的正式元数据;1000G 元数据表查 sex/family。
Q6:图中查到的插入序列完整吗?
A:Minigraph-Cactus v2.1 为 base-level、非着丝粒范围——非着丝粒区的插入序列内容完整;着丝粒区另有专门研究线(Guarracino 2023)。用到着丝粒/近端区时检查 excluded regions 口径。
Q7:能把自有样本组装加进 HPRC 图吗?
A:技术路径存在(minigraph-cactus 支持增量构建,README 有 per-chromosome 流程);你的组装需先过 QC 三件套(yak/Merqury/QUAST)。生产性贡献(正式入联盟发布)需联系联盟——使用协议另有说明。
Q8:GRCh38 会被 HPRC 取代吗?
A:短期内是共存:临床数据库(ClinVar/dbSNP)、临床管线、坐标体系仍锚 GRCh37/38。图坐标 ↔ 线性坐标的互转工具(gRef 映射)已就位。参考「取代」更可能是十年尺度的渐进过程。
Q9:HPRC 与 GIAB 什么关系?
A:互补。GIAB(NIST)提供标准品的「变异真值集」;HPRC 提供「参考本体与图」。NIST 的 Justin Zook 是 HPRC 论文作者,两套体系在真值与参考层互相引用。做方法基准建议同时用(§5.3)。
Q10:着丝粒区怎么办?
A:Minigraph-Cactus 默认非着丝粒范围;着丝粒区的重组与结构见 Guarracino 2023 姐妹论文;T2T-CHM13 作为图内参考路径提供了完整着丝粒单倍型。着丝粒分析目前是专题方法学领域,不建议用通用图链路硬跑。
Q11:样本量继续增长后,旧图会失效吗?
A:不会——图设计支持增量扩展(新样本=新路径,旧路径不变)。但要注意版本锁定:v2.0 与 v2.1 图产物不可混用;引用与复现锁版本号是基本纪律。
Q12:做 AI 训练需要下原始 reads 吗?
A:几乎不需要。预训练用组装 FASTA(1.4 TB 级)、监督用图 VCF、结构先验用 GFA——原始 reads(PB 级)只在组装复现或修饰 Calling 训练时才需要。
§10.5 要点回顾
- 单位是单倍型:47 人 94 单倍型(草图)/ 232 人 464 单倍型(R2)——引用前换算。
- 两个核心数字:相对 GRCh38 新增 119 M 碱基(~90 M 来自 SV)与 1,115 个基因重复;短读长换图链路错误率 ↓34%、SV 检出 +104%。
- 三策略三 backbone:默认 Minigraph-Cactus v2.1;GRCh38 backbone 与临床生态兼容;三选一后锁定。
- 频率回外库:path 覆盖 ≠ 等位基因频率;频率过滤用 1000G/gnomAD。
- QC 前置:HG00272 事故的教训——组装入池前过 yak/Merqury/QUAST。
- 开放有协议:Data Use Protocol 的出版前沟通与致谢义务不因数据开放而豁免。
- 双轨过渡:GRCh38 backbone + gRef 映射实现与临床数据库的坐标共存。
- AI 四喂法:语料 / 监督 / 图先验 / 路径增强——基因组基础模型时代的参考级数据资产。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- 1000-genomes — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- gwas-catalog — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- gwas-catalog — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- gtex — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- gtex — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- vanderbilt-sd-biovu — 共享标签:基因组学与多组学 / 测序数据 / GWAS
- gnomad — 共享标签:基因组学与多组学 / 测序数据
- uniprot — 共享标签:基因组学与多组学 / 测序数据
- encode — 共享标签:基因组学与多组学 / 测序数据
- geo — 共享标签:基因组学与多组学 / 测序数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

