信息速览

NIH Roadmap Epigenomics — 人类参考表观基因组图谱 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | NIH Roadmap Epigenomics(表观基因组学路线图计划) |
| 英文全称 | NIH Roadmap Epigenomics Mapping Consortium / Roadmap Epigenomics Project |
| 别名/简称 | Roadmap Epigenomics、REMC(Reference Epigenome Mapping Centers)、Roadmap |
| 疾病分类(ICD-11 编码+中文名) | 非疾病专属(健康人参考图谱;下游 GWAS 富集分析关联 5A11 型 2 型糖尿病、8A00 阿尔茨海默病等,详见 §2) |
| SNOMED CT | 非疾病专属(下游关联场景映射详见 §2.1b) |
| 数据模态 | 组蛋白修饰 ChIP-seq、DNase-seq、DNA 甲基化(WGBS/RRBS/MeDIP/MRE/mCRF)、RNA-seq 与表达芯片、ChromHMM 染色质状态注释 |
| AI 任务类型 | 调控元件注释、增强子预测、染色质状态分割、非编码变异功能预测、GWAS 变异组织归因、多组学整合 |
| 样本总数 | 127 个整合参考表观基因组(111 Roadmap + 16 ENCODE);Release 9 统一处理覆盖 183 个生物学样本 |
| 数据大小 | Zenodo 核心镜像 199.3 GB;原始测序 reads 共 1,502 亿条(相当于 3,174x 基因组覆盖度) |
| 数据格式 | BED、narrowPeak、broadPeak、gappedPeak、BigWig、bigBed、WIG、TSV |
| 许可证 | 无限制开放使用(freely download, analyze, and publish without restrictions) |
| 访问级别 | 开放(无需注册、无需申请) |
| DUO 标签 | NRES(无限制) |
| 语言 | 英语(元数据与文档) |
| 首发日期 | 2015-02-19(旗舰论文);计划 2008 年启动 |
| 最后更新 | 计划资助 2017 年结束;Zenodo 归档镜像 2025-05-19 |
| 发布机构 | 美国国立卫生研究院 NIH Roadmap Epigenomics Program(共同基金资助) |
| 官方主页 | WashU 数据门户、MIT 整合门户 |
| 下载地址 | WashU egg2 数据目录、AWS S3、Zenodo 镜像 |
| DOI | 10.1038/nature14248 |
| 引用次数 | 6,435(Nature 官网 metrics,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有统一处理的 peaks/染色质分割与完整管线文档,可直接加载;但无官方监督任务划分、坐标以 hg19 为主需自行 liftOver(扣分项) |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
本页面由千方病案医学编辑部撰写,遵循 AI-Ready Wikipedia 结构规范,全部数字与事实均来自官方门户、原始论文与同行评审文献,关键处附内联引用。
- 医学审核:[千方病案医学编辑部]交叉审核:§2 医学背景(表观遗传调控机制与疾病关联)、§7 偏倚分析(供体代表性与组织覆盖偏倚)。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Roadmap Epigenomics 数据由官方声明可自由下载、分析与发表(详见 AWS Registry of Open Data 许可说明),无需注册或签署协议,但引用旗舰论文是学术惯例。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? 你的 200 多种细胞都共享同一套 DNA,但皮肤细胞和神经元的行为天差地别——差别就写在"表观基因组"上:DNA 与组蛋白上的化学修饰决定了哪个基因在哪种细胞里被打开或关闭。美国 NIH 的 Roadmap Epigenomics 计划(2008—2017)系统绘制了 111 种健康人细胞与组织的表观基因组参考地图,联合 ENCODE 项目共 127 个整合表观基因组,产出 2,805 个基因组范围数据集(Nature 2015 旗舰论文)。
为什么重要? 基因组参考序列回答"DNA 长什么样",而这份数据回答"DNA 在每种细胞里如何被使用"。旗舰论文证明:疾病与性状相关的遗传变异显著富集在组织特异性的表观基因组标记中——这为解读全基因组关联研究(GWAS)找到了致病细胞类型提供了"翻译字典"(论文摘要)。
我能用它做什么? 典型用途包括:给 GWAS 找到的非编码变异找"活跃组织"(例如把 2 型糖尿病变异映射到胰岛相关表观基因组)、预测增强子等调控元件、用 15 状态染色质注释给基因组打功能标签、训练序列模型预测调控活性。数据完全开放,无需注册即可下载(AWS 开放数据)。
§1.1 摘要
NIH Roadmap Epigenomics Mapping Consortium 由 NIH 共同基金于 2008 年启动,分布在 Baylor、WashU、UCSD、MIT/Broad 等地的参考表观基因组图谱中心(REMC)对健康人原代细胞与组织系统开展了组蛋白修饰 ChIP-seq、DNase-seq、DNA 甲基化(WGBS、RRBS、MeDIP、MRE、mCRF)与 RNA 表达测序,最终完成 111 个参考表观基因组(EID 编号 E001—E113),并联合 ENCODE 项目 16 个表观基因组(E114—E129)共 127 个进行整合分析(MIT 整合门户)。核心分析流程包括:以 MACS2 等工具统一调用峰,用 ChromHMM 多元隐马尔可夫模型基于五个核心组蛋白标记(H3K4me1、H3K4me3、H3K36me3、H3K27me3、H3K9me3)在 127 个表观基因组上联合学习 15 状态染色质分割(官方 ChromHMM 页),再对甲基化、可及性与表达数据进行跨状态解读。全部数据集经统一管线处理,免费开放下载,已成为调控基因组学与疾病遗传学解释的基石资源(Roadmap Epigenomics Consortium et al., 2015)。
§1.2 战略价值
维度一:疾病遗传学的"注释底座"。 绝大多数 GWAS 命中位点落在非编码区,其功能解读长期缺乏系统性参照。Roadmap 提供的组织特异性调控图谱使研究者能把 2 型糖尿病、自身免疫、神经精神等性状变异归因到具体细胞类型——旗舰论文的核心发现即为"疾病与性状变异富集于组织特异性表观标记"(论文主文)。FATHMM-MKL、FATHMM-XF 等主流非编码变异致病性预测工具直接以 Roadmap 数据作为特征来源(综述对比),说明它已深度嵌入变异解释工具链。
维度二:方法学发展的"标准考卷"。 127 个表观基因组覆盖五核心标记的全矩阵,天然构成染色质状态建模(ChromHMM、Segway 等)、增强子-基因配对、模态对齐等任务的公共基准;Ernst 实验室后续用 1,032 个数据集训练 full-stack 模型继续以 Roadmap 为主干(ernstlab GitHub)。对新模型而言,在 Roadmap 上做消融与对比是与社区对话的通用语言。
维度三:开放生态的示范样本。 数据无限制开放(免费下载、分析、发表),同时通过 WashU 门户、MIT 门户、AWS S3、Zenodo 多渠道冗余托管,并有 WashU/UCSC 交互式浏览与 HaploReg 等衍生工具(AWS 开放数据)。对中文医疗 AI 团队,这是少数无需任何申请即可全量获取的国家级图谱资源。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 Roadmap 的差异化 |
|---|---|---|---|---|
| Roadmap Epigenomics | 127 整合表观基因组(111 健康),2,805 个数据集 | 组蛋白 ChIP-seq、DNase、甲基化、RNA | ChromHMM 15 状态注释 | 健康人原代组织全覆盖,整合分析最完整 |
| ENCODE | 200+ 细胞系(含大量癌细胞系) | ChIP-seq(含 TF)、ATAC、RNA 等 | 各 assay 峰 + registry | TF 结合与癌细胞系更全;健康原代组织较少 |
| IHEC 数据门户 | 各国联盟 5,000+ profile | ChIP-seq、BS-seq、RNA | 各成员项目 | 汇总入口(含 Roadmap/BLUEPRINT/CEEHRC) |
| BLUEPRINT | 约 90 种血液细胞/组织 2,602 数据集 | ChIP-seq、BS-seq、RNA、DNase | 疾病对照设计 | 聚焦血液疾病(含患者样本) |
| FANTOM5 | 人类细胞/组织 CAGE 转录起始图谱 | CAGE | 启动子/增强子转录证据 | 单分子测序测活性启动子,与 ChIP 互补 |
对比要点:需要健康人原代组织的全表观组参考选 Roadmap;需要转录因子结合或癌细胞系选 ENCODE;需要患者-对照疾病设计选 BLUEPRINT/CEEHRC(综述表)。
选型时的三个经验法则:其一,看样本性质——Roadmap 的价值在"原代健康组织",ENCODE 的强项在"细胞系与 TF",两者在 E114—E129 已部分互通;其二,看任务监督信号——需要染色质状态标签选 Roadmap(15 状态开箱即用),需要 eQTL/表达选 GTEx;其三,看维护状态——Roadmap 已冻结(2017),需要持续更新的样本与 assay 应以 ENCODE 为主、Roadmap 为参考底座。多项目联用时先做坐标与 ID 对齐(§4.4)。
§1.4 版本时间轴
| 时间 | 事件 | 说明 |
|---|---|---|
| 2008 | 计划首轮资助 | NIH 共同基金 Roadmap Epigenomics Program 启动(NIH 存档页) |
| 2010 | 宣言论文与 IHEC | Bernstein et al. 发表联盟宣言(Nat Biotechnol);Roadmap 成为国际人类表观基因组联盟创始成员 |
| 2015-02 | 旗舰论文特刊 | Nature 518:317-330 及 20+ 篇配套论文同期发表(论文页) |
| 2015—2017 | 持续发布 | MIT 门户 Release 9 提供统一处理数据;2017 年共同基金资助结束 |
| 2025-05 | Zenodo 归档 | 社区将核心数据打包为 199.3 GB 快照(DOI 10.5281/zenodo.15429471,Zenodo) |
§1.5 典型应用场景
- GWAS 变异组织归因:将性状相关 SNP 与各表观基因组的活跃增强子/TSS 状态求交集,识别性状相关组织(旗舰论文核心用法)。
- 非编码变异致病性预测:作为 FATHMM-MKL/FATHMM-XF 的特征源,为 ClinVar/COSMIC 之外的新变异打分(综述)。
- 染色质状态模型训练与评测:以 15 状态分割为参考标签,训练或评估序列模型与状态分割算法。
- 增强子-基因配对与靶点发现:结合 RNA 表达矩阵与增强子状态距离特征,构建组织特异性调控关系。
- 多组学整合方法开发:同一样本上的甲基化/可及性/表达多模态,是模态对齐与缺失填补方法的天然测试床。
上手顺序建议(两周内可完成的渐进路线):第 1—2 天,下载 3 个代表性 EID(如 H1 干细胞 E002、肝 E066、GM12878 免疫 E116 类比),跑通 §6.1—§6.3;第 3—5 天,用 §6.4 的 DataLoader 搭一个状态分类基线,按 §6.9 评估;第二周,接入一个真实 GWAS 性状做富集归因(坑点 8 协议),并与 HaploReg 交叉验证。每一步的坑点防护(坐标、模型版本、不平衡)都应在第一次跑通时就内置,而不是事后补。
§2 医学背景
§2.0 本数据集的医学定位说明
Roadmap Epigenomics 是健康人参考图谱而非患者队列:其 111 个参考表观基因组来自健康供体的原代细胞与组织、原代培养细胞及 ES/iPS 细胞系,不含疾病分组标签。因此本节的 ICD-11 与 SNOMED CT 映射描述的是下游关联分析中最常用的疾病领域——即研究者利用该图谱对哪些疾病做变异归因与机制解释,而非数据集自带的疾病标注(论文疾病富集分析)。
§2.1 ICD-11 下游关联领域映射表
| 下游关联领域 | ICD-11 编码 | ICD-11 中文名 | Roadmap 支撑点 |
|---|---|---|---|
| 型 2 型糖尿病 | 5A11 | 型 2 型糖尿病 | 胰岛/脂肪/肌肉相关表观基因组用于代谢性状变异富集分析 |
| 神经退行性疾病 | 8A00 | 阿尔茨海默病 | 脑区表观基因组支撑神经疾病变异注释(配套论文 Gjoneska et al., 2015) |
| 血液肿瘤 | 2A00 | 急性淋巴细胞白血病 | 造血谱系参考表观基因组为血液肿瘤甲基化/增强子异常提供正常对照 |
| 自身免疫病 | 4A40 | 系统性红斑狼疮 | 免疫细胞谱系表观基因组是自身免疫 GWAS 富集的主战场 |
说明:以上编码用于描述下游研究语境。数据集本身不含上述疾病患者样本,禁止将其当作疾病分类训练标签使用。
§2.1b SNOMED CT 下游关联场景映射
| 标签/场景 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 型 2 型糖尿病研究 | 5A11 | 44054006 | Diabetes mellitus type 2(型 2 型糖尿病) |
| 阿尔茨海默病研究 | 8A00 | 26929004 | Alzheimer’s disease(阿尔茨海默病) |
| 系统性红斑狼疮研究 | 4A40 | 55464009 | Systemic lupus erythematosus(系统性红斑狼疮) |
§2.2 表观遗传调控与疾病简介
表观基因组指 DNA 序列之外的化学与结构修饰层:组蛋白尾巴的甲基化/乙酰化(如 H3K4me3 标记活跃启动子、H3K4me1 标记增强子、H3K27me3 标记 Polycomb 抑制区、H3K9me3 标记异染色质)、DNA 上的 5-甲基胞嘧啶修饰、以及染色质开放程度(DNase 超敏感位点)。这些修饰共同决定每种细胞"读取"基因组的哪一部分(旗舰论文)。
疾病关联层面,Roadmap 旗舰论文系统证明:跨 111 种细胞与组织,疾病与性状相关变异显著富集于组织特异性的增强子与启动子状态,例如代谢性状富集于脂肪与肌肉相关表观基因组、免疫性状富集于造血细胞表观基因组(论文结果)。肿瘤与遗传病的调控元件突变(增强子劫持、启动子沉默)解释研究也大量以 Roadmap 健康对照图谱为基线。这类解释属于群体层面的关联证据,不能直接用于个体临床诊断。
理解状态注释的生物学含义,是正确使用本数据集的前提。核心标记与常见修饰的解读如下:
| 标记/信号 | 富集位置 | 生物学含义 | 对应 15 状态示例 |
|---|---|---|---|
| H3K4me3 | 启动子 | 活跃或待命启动子 | 1_TssA(活跃)、10_TssBiv(双价) |
| H3K4me1 | 增强子区域 | 增强子资格标记 | 7_Enh、12_EnhBiv |
| H3K27ac | 启动子/增强子 | 活性乙酰化,区分活跃与失活 | 18 状态模型用于拆分活跃/失活增强子 |
| H3K36me3 | 基因体 | 活跃转录延伸 | 4_Tx、5_TxWk |
| H3K27me3 | 抑制区 | Polycomb 复合物抑制 | 13_ReprPC |
| H3K9me3 | 异染色质 | 结构性抑制与重复元件 | 9_Het、8_ZNF/Rpts |
| DNase 超敏感 | 调控元件 | 开放染色质(可及性) | 跨状态的可及性佐证 |
| DNA 甲基化 | 启动子/基因体 | 启动子高甲基化与转录沉默相关 | 状态间解读(启动子低、转录区高) |
解读时还需记住三个定量背景:任意表观基因组中约 68% 的基因组缺乏组蛋白标记(Quies 主导);约 5% 基因组呈活跃启动子/增强子特征;全基因组约 12.6% 的区域在至少一种细胞类型中具有调控活性——即"多数基因组在多数细胞里是沉默的,少数元件承载高度动态的调控"(论文解读)。
§2.3 临床任务定义
| 临床/科研任务 | 定义 | Roadmap 中的角色 |
|---|---|---|
| 变异致病组织归因(解释性任务) | 判断 GWAS 变异在哪些细胞类型中落在活跃调控元件 | 提供组织特异性状态注释作为归因依据 |
| 非编码变异功能预测(筛查性任务) | 对错义区之外变异打致病性分数 | FATHMM-MKL/XF 的特征来源之一 |
| 靶组织/模型系统选择(设计性任务) | 为体外实验挑选最相关的细胞模型 | 按状态覆盖度挑选最接近目标组织的表观基因组 |
| 增强子-基因配对(机制性任务) | 将候选增强子连接到受调控基因 | 增强/表达跨表观基因组联合分析 |
§2.4 样本来源人群表
| 维度 | 情况 |
|---|---|
| 来源 | 健康供体原代细胞与组织、原代培养细胞、ES/iPS 细胞系及其分化产物(论文图 1) |
| 采集时间 | 2008—2017(计划存续期,NIH 存档页) |
| 样本组别 | 成人组织、胎儿组织、ES/iPS 及分化细胞、原代培养四组(论文 Extended Data 图 1 分组) |
| 组织覆盖 | 脑、心、肌肉、胃肠道、脂肪、皮肤、生殖系统、免疫谱系等多系统(论文) |
| 年龄/性别/种族 | 公开元数据未系统提供供体人口学完整分布;使用者应按"供体数量有限"假设设计实验 |
| 就医类型 | 非患者队列(无就医场景),组织多来自供体捐赠或手术剩余健康组织 |
使用者尤其要注意两点:一是同一细胞类型可能对应多个样本来源(不同供体、不同中心),做个体层面结论前必须查元数据确认样本独立性;二是胎儿组织样本的处理与解读需符合相应伦理规范,虽然数据已公开,衍生分析仍应避免任何对发育敏感人群的污名化表述。
§2.5 临床价值
对医疗 AI 而言,Roadmap 的价值不在直接诊断,而在解释层:一是把统计关联(GWAS 位点)翻译为机制假设(哪类细胞、哪段调控元件),加速靶点与生物标志物选择;二是为疾病样本(肿瘤、自身免疫)提供"正常基线",使差异分析(差异甲基化、异常增强子激活)有参照系;三是作为非编码变异注释工具的特征源,间接进入临床级变异解读流程(如 ACMG 指南背景下对 VUS 变异的辅助评估)。任何向临床决策的推进都需在真实患者数据上独立验证(见 §0 免责声明)。
落到具体工作流,医疗 AI 团队最常用的三条路径是:
- 变异→组织归因:输入 GWAS 位点列表,与各 EID 的增强子/TSS 状态求交集,输出"该性状最相关的 Top-N 表观基因组",用于选择后续体外模型或组织特异基因集。
- 疾病样本 vs 参考基线:将疾病的甲基化/ChIP 数据与同谱系 Roadmap 参考对齐,找异常调控元件(如异常激活的增强子),作为靶点线索。
- 特征注入变异注释器:把目标区域的 15 状态独热向量、DNase 峰、甲基化水平拼接为特征表,喂给已有分类器或作为 FATHMM 类工具的补充证据。
三条路径共同的先决条件是坐标一致(见坑点 1)与覆盖核查(§3.1 模态覆盖表),这也是本 Wiki 把它们列为最高优先级坑点的原因。
§2.6 金标准与标注性质表
| 对象 | 划分/生成方式 | 标注者 | 性质 |
|---|---|---|---|
| 组蛋白/DNase 峰 | 统一管线 MACS2 等自动调用 | 算法管线(NSC 交叉相关质量分控) | 数据处理产物(非人工标注) |
| 染色质状态 | ChromHMM 多元 HMM 联合学习(60 个最高质量表观基因组训练后推广至全部) | 模型推断 | 弱监督模型标签,无实验金标准 |
| DNA 甲基化 | WGBS/RRBS 单碱基水平或 mCRF 整合推断 | 算法管线 | 数据处理产物 |
| 表达值 | RNA-seq RPKM / 芯片信号 | 算法管线 | 定量测量(非分类标注) |
这一"标注即管线产物"的性质决定了两点使用纪律:第一,不要把状态/峰当成实验事实引用,引用时应写"Roadmap 注释显示"而非"该增强子被证明";第二,任何以这些产物为标签训练的模型,其误差上界受管线误差约束——这也是 §7.2 强调用 POSTERIOR 概率做置信过滤的原因。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 做整合分析/复现旗舰论文 | MIT 门户 Release 9(compbio.mit.edu/roadmap) | 单文件按需下载 | 统一处理 + 127 整合表观基因组 EID 编号稳定 |
| 批量拉取 peaks/分割/甲基化 | Zenodo 镜像(zenodo.org/records/15429470) | 199.3 GB | 6 个 tar.gz 一次到位,附 md5 校验 |
| 云端管线/免安装下载 | AWS S3(s3://roadmapepigenomics,开放数据页) | 完整归档 | –no-sign-request 匿名访问,带宽好 |
| 从原始 FASTQ 复现处理 | GEO 系列数据集(GEO 汇总页) | TB 级 | 附原始 reads 与处理协议 |
| 交互式浏览单基因座 | WashU Epigenome Browser / UCSC hub | 无需下载 | 直接加载信号与状态轨道 |
§3.1 模态详情
| 模态 | 覆盖范围 | 产物 | 说明 |
|---|---|---|---|
| 组蛋白修饰 ChIP-seq(核心 5 标记) | 127 表观基因组全覆盖:H3K4me1、H3K4me3、H3K36me3、H3K27me3、H3K9me3 | 峰文件 + 信号轨道 | 染色质状态模型输入(官方页) |
| 组蛋白乙酰化 ChIP-seq | H3K27ac 98 个、H3K9ac 62 个表观基因组 | 峰 + 信号 | 区分活跃/失活增强子(18 状态模型输入) |
| 染色质可及性 DNase-seq | 53 个表观基因组 consolidated 峰 | narrowPeak + 信号 | 开放染色质与足迹分析 |
| DNA 甲基化 | 104 个数据集覆盖 95 个表观基因组(WGBS 37 个全基因组、RRBS、MeDIP/MRE/mCRF) | 单碱基甲基化分数 | 单 CpG 分辨率(WGBS 子集) |
| RNA 表达 | 56 个表观基因组 RPKM 矩阵(19,795 个蛋白编码基因);部分表观基因组含芯片 | RPKM TSV / WIG | 链非特异、未归一化信号需乘归一化因子 |
| 数字基因组足迹 DGF | 部分 DNase 表观基因组 | 足迹文件 | 推断 TF 占据 |
| 染色质状态注释 | 15 状态(127)、18 状态(98)、25 状态 imputed(127)、50 状态(7 个) | BED 分割 | ChromHMM v1.10(模型页) |
§3.2 按子集样本数表
| 子集 | 数量 | 备注 |
|---|---|---|
| Roadmap 参考表观基因组 | 111 个(E001—E113) | 健康人原代细胞与组织为主 |
| ENCODE 补充表观基因组 | 16 个(E114—E129) | 用于整合分析 |
| 整合(consolidated)表观基因组 | 127 个 | 有稳定 EID |
| 未整合(unconsolidated)样本 | 183 个(Release 9) | 含技术与生物学重复 |
| 核心五标记全覆盖 | 127 个 | 15 状态模型基础 |
| H3K27ac | 98 个 | 18 状态模型基础 |
| H3K9ac | 62 个 | 活跃启动子佐证 |
| DNase-seq(整合峰) | 53 个 | 可及性与足迹 |
| WGBS 全基因组甲基化 | 37 个 | 单碱基分辨率 |
| RNA-seq RPKM 矩阵 | 56 个(19,795 基因) | 表达特征 |
| 受资助项目 | 77 项 awards | 2008—2017(NIH) |
§3.3 数据格式表
| 文件类型 | 格式 | 内容 |
|---|---|---|
| 染色质分割 | mnemonics.bed.gz(4 列)、dense.bb、expanded.bed.gz、STATEBYLINE、POSTERIOR | 状态标签(合并区间 / 浏览器 / 固定 200bp 分箱 / 后验概率) |
| 峰调用 | narrowPeak、broadPeak、gappedPeak | ChIP/DNase 峰(整合与未整合两套) |
| 信号轨道 | BigWig(fc.signal.bigwig)、WIG | MACS2 fold enrichment 等 |
| 甲基化 | 分数表(FractionalMethylation 等 tar 包) | WGBS 单碱基分数 / mCRF 整合 |
| 表达 | RPKM TSV(57epigenomes.exon.RPKM.pc.gz)、WIG | 蛋白编码基因矩阵 |
| 元数据 | EID 元数据表(metadata 页) | EID ↔ 名称 ↔ 质量统计 |
§3.4 存储大小
- Zenodo 核心镜像合计 199.3 GB:chromHMM 分割 25.0 GB、DNA 甲基化 37.4 GB、整合 peaks 45.7 GB、未整合 broadPeak 50.1 GB、gappedPeak 17.0 GB、narrowPeak 24.2 GB(Zenodo);RNA 数据与 imputed peaks 为附加记录。
- 原始测序规模:1,502 亿条 reads,相当于人类基因组 3,174x 覆盖度(论文口径报道)。
- 单表观基因组最小可用子集(15 状态 mnemonics.bed.gz + 一个标记的峰文件)通常在数百 MB 内,适合教学与原型开发。
按任务规模规划磁盘的参考:
| 任务规模 | 建议下载 | 磁盘规划 |
|---|---|---|
| 教学/单基因座演示 | 1—4 个 EID 的 mnemonics BED + dense.bb | <5 GB |
| 增强子预测原型 | 全部 15 状态分割包(chmm.tar.gz)+ 整合 peaks | 100 GB(解压后约翻倍) |
| 变异归因管线 | chmm + peaks.consolidated + EID 元数据 | 150 GB |
| 全量复现/原始数据 | Zenodo 六包 + GEO FASTQ | 1—2 TB |
§3.5 标注方式
数据集的"标注"分三层:信号层(测序数据经统一管线对齐、质控、峰调用,全部自动);注释层(ChromHMM v1.10 隐马尔可夫模型在 200bp 分箱上联合学习 15 状态,60 个最高质量表观基因组用于训练模型后应用于全部 127 个,属于模型推断的弱监督标签);元数据层(EID、组织名、供体与质量统计由各中心人工整理)。使用者必须把 15 状态标签理解为"模型学到的染色质构象类别",而非实验测定的金标准(ChromHMM 方法页)。
对 AI 训练而言,这个三层结构意味着"标注成本为零但标注语义是统计性的":15 状态的边界由模型 emission 概率决定,同一基因组区域在不同状态模型下可能得到不同标签。工程上的对策是把标签版本(15/18/25 状态)与坐标版本(hg19/hg38)都写入特征存储的 schema,形成"标签血缘"可追溯——这是本数据集从科研走向工程化使用时最容易省略、也最容易返工的一步。
§3.6 标注者资质与一致性
无人工判读标注者。一致性保障来自三点:统一处理管线(跨中心可比)、ChIP 质控指标(归一化链交叉相关 NSC 分数逐样本公布,论文 Extended Data 图 1e—g)、以及模型鲁棒性检验(逐表观基因组独立学习的状态与联合模型状态聚类吻合,论文 Extended Data 图 2)。上述均属算法层面的质量证据,不存在人工标注一致性系数(如 Cohen’s kappa)这类指标。
§3.7 采集周期
2008 年计划启动、首轮资助起各中心陆续产数据,2015-02 旗舰论文集中发布 111 参考表观基因组,共同基金资助至 2017 年结束;数据门户自发布起持续托管,未再新增数据(NIH 存档页)。
§3.8 地域覆盖
样本采集与测序由美国多中心完成(Baylor、WashU、UCSD、MIT/Broad 等 REMC,论文作者与致谢);供体人口学地域分布未系统公开。数据本身为全球开放,AWS 托管区 us-west-2、WashU/Zenodo/GEO 多镜像。
§3.9 设备与协议规格
各中心采用高通量短读长测序平台完成 ChIP-seq、DNase-seq、亚硫酸氢盐与 RNA 测序;实验与计算协议(抗体验证、重复数、比对与峰调用参数)在 REMC 门户以 Protocols 形式公开(REMC 门户)。逐样本设备型号与试剂批号未在公开元数据中系统给出,跨中心批次效应需按 §7.1 假设处理。
§3.10 深度溯源链
完整溯源链为:NIH 共同基金计划(2008—2017)→ 各 REMC 中心实验 → GEO 系列号(如 GSE16256 等,GEO 汇总页)→ 统一处理管线 → Release 9 统一处理产物 → 整合分析(分配 EID E001—E129)→ WashU/MIT/AWS/Zenodo 各镜像分发。每个 EID 可在 MIT 元数据表中回溯到未整合样本(EGID 级)与 GEO 登录号;文件级 md5 见 Zenodo 记录(Zenodo)。
§4 数据结构
§4.0 目录树
WashU egg2 门户按"数据类型(byDataType)/文件类型(byFileType)"两级组织,下载后典型布局如下:
data_root/
├── byFileType/
│ ├── chromhmmSegmentations/
│ │ └── ChmmModels/
│ │ ├── coreMarks/jointModel/final/ # 核心 15 状态模型(127 表观基因组)
│ │ │ ├── E001_15_coreMarks_mnemonics.bed.gz # 4 列 BED,合并区间
│ │ │ ├── E001_15_coreMarks_dense.bb # 浏览器用 bigBed
│ │ │ ├── E001_15_coreMarks_hg38lift_mnemonics.bed.gz # 官方 hg38 版
│ │ │ ├── all.mnemonics.bedFiles.tgz # 全部打包
│ │ │ ├── STATEBYLINE/ # 200bp 固定分箱状态
│ │ │ └── POSTERIOR/ # 状态后验概率
│ │ ├── core_K27ac/jointModel/final/ # 18 状态模型(98 表观基因组)
│ │ └── class1Models_50states/ # 50 状态(7 个表观基因组)
│ ├── peaks/
│ │ ├── consolidated/
│ │ │ ├── narrowPeak/E002-H3K4me3.macs2.narrowPeak.gz
│ │ │ ├── broadPeak/E002-DNase.macs2.broadPeak.gz
│ │ │ └── gappedPeak/
│ │ └── unconsolidated/{narrowPeak,broadPeak,gappedPeak}/
│ └── signal/
│ └── consolidated/macs2signal/foldChange/E002-H3K4me3.fc.signal.bigwig
├── byDataType/
│ ├── dnamethylation/
│ │ ├── WGBS/FractionalMethylation.tar.gz # 37 个表观基因组单碱基分数
│ │ └── mcrf/ # mCRF 整合甲基化
│ └── rna/
│ ├── expression/57epigenomes.exon.RPKM.pc.gz # RPKM 矩阵(19,795 基因)
│ └── signal/unnormalized_wig/strandagnostic/E002.wig.gz
└── meta/
└── EID_metadata.tsv # EID ↔ 名称 ↔ 质量统计
Zenodo 镜像(一包到位,DOI 10.5281/zenodo.15429471)
roadmap.chmm.tar.gz (25.0 GB) # 15 状态分割
roadmap.dnam.tar.gz (37.4 GB) # DNA 甲基化
roadmap.peaks.consolidated.tar.gz (45.7 GB)
roadmap.peaks.unconsolidated.{narrowPeak,broadPeak,gappedPeak}.tar.gz
# 24.2 / 50.1 / 17.0 GB
§4.1 DAIMS 字段字典
核心表 1:15 状态染色质分割([EID]_15_coreMarks_mnemonics.bed.gz,每行一个状态片段)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| chrom | string | 染色体名(hg19) | chr1 | 空间索引 | 无(参考坐标) | 无 | chr1—chr22、chrX、chrY |
| start | int | 片段起点(0-based) | 10450 | 区间运算 | 边界由 200bp 分箱量化 | 无 | ≥0 |
| stop | int | 片段终点(1-based,列名即 stop) | 11200 | 区间运算 | 同上 | 无 | >start |
| state_label_mnemonic | string | 状态编号_助记名 | 7_Enh | 监督标签 | 模型后验不确定(见 POSTERIOR) | 无 | 1_TssA 至 15_Quies 共 15 类 |
核心表 2:整合峰文件([EID]-[mark].macs2.narrowPeak.gz,每行一个峰)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| chrom, start, end | 同上 | 峰区间(0-based start) | chr7, 5508670, 5509280 | 区间特征 | 峰边界亚碱基级不确定 | 无 | — |
| name | string | 峰名 | E002-H3K4me3 | 追溯 | — | 无 | — |
| score | int | 0—1000 整数分 | 593 | 排序/阈值 | 依赖 input 归一化 | 无 | 0—1000 |
| strand | string | 链 | . | 固定占位 | 无 | 无 | . |
| signalValue | float | 富集信号值 | 8.41 | 回归目标/权重 | 跨样本不完全可比 | 无 | ≥0 |
| pValue | float | -log10(p) | 12.7 | 显著性过滤 | 多重检验未校正 | 无 | ≥0 |
| qValue | float | -log10(q) | 10.2 | FDR 阈值 | 同上 | -1(不可得) | ≥-1 |
| peak | int | 峰内信号顶点位移 | 320 | 定位 summit | — | 无 | 0—(end-start) |
核心表 3:表达矩阵(57epigenomes.exon.RPKM.pc.gz,每行一个基因、每列一个 EID)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| gene_id | string | Ensembl 基因 ID | ENSG00000223972 | 主键 | — | 无 | 19,795 个蛋白编码基因 |
| E002 等 56 列 | float | RPKM 表达值 | 0.0 | 回归/共表达 | 跨批次需再归一化 | 0.0(真低表达与未测混合) | ≥0 |
核心表 4:EID 元数据表(MIT 门户发布,每个整合表观基因组一行)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| EID | string | 整合表观基因组编号 | E002 | 全局主键 | — | 无 | E001—E129 |
| 组织/细胞名与缩写 | string | 标准命名与简写 | H1 cells | 分组、筛选 | 命名粒度跨中心不完全一致 | 无 | — |
| 生物材料组别 | string | 成人/胎儿/ES-iPS/原代培养 | ESC & ES-derived | 划分分组键 | — | 无 | 4 组 |
| 质量/覆盖统计 | float | 各标记 NSC、覆盖度等 | — | 样本筛选 | 随模态缺失 | 缺列 | — |
核心表 5:WGBS 分数表(FractionalMethylation,每行一个 CpG)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| chrom/start/end | 坐标 | CpG 位点(hg19) | chr1, 10497, 10498 | 空间索引 | 亚硫酸氢盐转换不完全 | 无 | — |
| 甲基化分数 | float | 该位点甲基化比例(0—1) | 0.82 | 回归/差异甲基化 | 低覆盖位点噪声大 | NA(无覆盖) | 0—1 |
| 覆盖度 | int | 支持该位点的 reads 数 | 12 | 置信过滤 | — | 0 | ≥0 |
§4.2 标签分布
15 状态在单表观基因组内的基因组覆盖率极不均衡:静息状态 Quies 平均占据约 68% 基因组,活跃启动子(TssA)与增强子(Enh)合计约 5%,其余状态分布在 0.1%—10% 量级(旗舰论文报道)。全基因组范围内约 230 万个区域(12.6%)在至少一种细胞类型中呈现启动子或增强子活性。任何以状态为标签的分类任务都必须按此长尾分布设计指标与采样(详见坑点 4)。
15 状态官方速查表(编号、助记名、含义与代表色,来源):
| 编号 | 助记名 | 含义 | 代表色 RGB |
|---|---|---|---|
| 1 | TssA | 活跃转录起始位点 | 255,0,0(红) |
| 2 | TssAFlnk | 活跃 TSS 侧翼 | 255,69,0(橙红) |
| 3 | TxFlnk | 基因 5’与 3’端转录 | 50,205,50(绿) |
| 4 | Tx | 强转录 | 0,128,0(绿) |
| 5 | TxWk | 弱转录 | 102,205,170(浅绿) |
| 6 | EnhG | 基因内增强子 | 194,133,255(浅紫) |
| 7 | Enh | 增强子 | 255,195,77(橙黄) |
| 8 | ZNF/Rpts | 锌指基因与重复 | 205,145,158(粉灰) |
| 9 | Het | 组成性异染色质 | 138,145,218(灰蓝) |
| 10 | TssBiv | 双价/待命 TSS | 127,106,178(紫) |
| 11 | BivFlnk | 双价 TSS/增强子侧翼 | 228,228,178(浅黄) |
| 12 | EnhBiv | 双价增强子 | 179,225,206(淡青) |
| 13 | ReprPC | Polycomb 抑制 | 117,181,182(青灰) |
| 14 | ReprPCWk | 弱 Polycomb 抑制 | 229,229,229(浅灰) |
| 15 | Quies | 静息/低信号 | 255,255,255(白) |
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 基因组范围数据集 | 2,805 个 | 论文口径 |
| 测序 reads 总量 | 1,502 亿条(3,174x) | 同上 |
| DNA 甲基化数据集 | 104 个(覆盖 95 个表观基因组) | 论文 Extended Data |
| 额外组蛋白标记 | 26 个表观基因组含 184 个数据集 | 论文 Extended Data |
| RPKM 基因数 | 19,795 个蛋白编码基因 × 56 表观基因组 | full-stack 论文用法 |
| WGBS 全基因组甲基化 | 37 个表观基因组 | 数据使用实例 |
§4.4 数据层级
数据层级为:计划(Program)→ 表观基因组(EID,整合后 127 个)→ 未整合样本(EGID 级,183 个 Release 9 样本,含重复)→ 实验(assay × 标记)→ 文件(峰/信号/分割)。与影像类数据集不同,这里没有"患者→检查→序列→切片"链条,而是"细胞类型 → 多模态实验 → 基因组区间"链条;跨模态对齐键是统一 EID 与 hg19 坐标(MIT 门户元数据)。
以 E002(H1 胚胎干细胞)为例走一遍层级:E002 是整合 EID,对应若干 unconsolidated 样本(不同中心/批次的 H1 培养);每个样本下有 H3K4me3、H3K27me3 等多条 ChIP-seq 实验;每条实验产出对齐 BAM(GEO 层)、峰文件与信号轨道(处理层);整合层把样本级产物合并为 E002 统一文件。写数据加载器时,把"EID → 标记 → 文件"三级路径参数化,即可复用于全部 127 个表观基因组。
§4.5 缺失值与信息性缺失
| 缺失情形 | 编码方式 | 对 AI 的含义 |
|---|---|---|
| 峰文件 qValue 不可得 | -1 | 过滤阈值需回退到 pValue 或 score |
| 表达值 0.0 | 数值 0 | 真实低表达与未检出混合,不可直接当缺失处理 |
| 模态覆盖不齐 | 整文件缺失(如 127 全有五标记,但 H3K27ac 仅 98 个) | 多模态模型需掩码设计,按 EID 查 §3.1 覆盖表 |
| 供体人口学 | 元数据无此列 | 不可假设人群配平(见 §7.1) |
§5 划分与使用建议
§5.1 官方划分
无官方监督学习划分。 数据集按科研语义分组:整合表观基因组按生物材料分为成人组织、胎儿组织、ES/iPS 系及其分化产物、原代培养四组;60 个最高质量表观基因组被官方用于训练核心染色质状态模型,其余由该模型推广(ChromHMM 页)——这一"训练/应用"划分仅服务状态建模本身,不是 ML 竞赛式划分。
§5.2 社区惯例与建议划分
社区常见两种做法:按表观基因组划分(如留出 ENCODE 来源的 E114—E129 做跨项目外部测试;或按生物材料组留一)用于"预测新细胞类型"场景;按基因组区间划分(按染色体或按 200bp 分箱随机分块)用于"同表观基因组内预测状态"场景。增强子预测类工作多用按染色体的 spatial split 以避免近邻泄漏(与 ENCODE 社区做法一致)。
两种划分回答的是不同科学问题,选型前先明确目标:
| 划分方式 | 回答的问题 | 报告口径 |
|---|---|---|
| 按表观基因组(留出 EID/组别) | 模型能否推广到未见细胞类型 | per-EID 指标分布(非池化) |
| 按基因组区间(按染色体) | 模型在同细胞类型内的空间泛化 | 池化指标 + 按状态分层 |
| 双重划分(EID × 染色体) | 双重泛化(最难) | 单独报告,不得与上两类混合比较 |
若论文同时报告多种划分,必须明确标注每个数字对应的划分协议——混报是这一领域复现性事故的高发区。
§5.3 泄漏风险(重点)
- 区间近邻泄漏:相邻 200bp 分箱状态高度相关(ChromHMM 的 HMM 结构本身就建模这种连续性),随机分箱划分会虚高性能;建议按 ≥10kb 区块或整条染色体划分。
- 重复样本泄漏:Release 9 的 183 个未整合样本含同一细胞类型的多供体/多中心重复,若混合 consolidated 与 unconsolidated 数据训练/测试,同一生物学实体会同时出现在两侧(官方明确不建议两者混用,MIT 门户)。
- 模态间标签泄漏:用 H3K4me1/3 信号预测状态后再用状态预测增强子属同源信息循环;报告泛化时需注明特征来源模态。
- GWAS 富集的 LD 泄漏:连锁不平衡使单点统计重复计数同一信号,需 LD 剪枝或区块级聚合(旗舰论文使用 LD 扩展分析)。
§5.4 交叉验证建议
状态分类基线建议:按染色体做 5 折(例如 chr1—chr3、chr4—chr7 等),每折内以 EID 为第二层分组键,报告 macro-F1 与各类 AUPRC;对"新细胞类型泛化"任务,采用留生物材料组法(leave-one-group-out),例如用 126 个表观基因组预测第 127 个的状态分布。
§5.5 外部验证建议
推荐外部队列与验证目标如下:
| 外部资源 | 验证目标 | 做法 |
|---|---|---|
| ENCODE 同标记数据 | 跨项目一致性 | 同细胞类型比对峰重叠率(如 GM12878) |
| GTEx 组织表达 | 增强子-基因配对 | 配对基因应高表达于对应组织 |
| GWAS Catalog 已复现位点 | 富集方向性 | 预期富集的组织应与既有生物学一致 |
| BLUEPRINT/CEEHRC(IHEC) | 疾病场景泛化 | 健康参考作基线做差异调控分析 |
| 甲基化数组(450K/EPIC) | 甲基化验证 | CpG 坐标 liftOver 后比对分数 |
跨项目验证务必统一坐标(见坑点 1)与峰阈值;不同项目的峰调用管线不同,重叠率比较应同时报告原始重叠与概率背景下的期望重叠。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
数据在 AWS S3 公开桶匿名可读,无需 AWS 账号(开放数据页):
# 列出桶内容(--no-sign-request 匿名访问)
aws s3 ls --no-sign-request s3://roadmapepigenomics/
# 浏览完整目录列表
# https://roadmapepigenomics.s3.us-west-2.amazonaws.com/index.html
§6.1 快速上手
# ── 目录结构预期 ─────────────────────────────────────────────
# data_root/roadmap/ ← 由 data_root 拼接所有相对路径
# ├── EID_metadata.tsv ← 元数据(可从 egg2 meta 页下载)
# └── seg/ ← 放置下载的 15 状态 mnemonics 文件
# ├── E002_15_coreMarks_mnemonics.bed.gz # H1 胚胎干细胞
# └── E062_15_coreMarks_mnemonics.bed.gz # 成人肝脏? 以元数据表为准
# ── 最小可用子集:单个 EID 的 mnemonics.bed.gz(数百 MB 内)即可跑通
# ── 以下命令把 E002 的 15 状态文件放到 seg/ 下
mkdir -p data_root/roadmap/seg && cd data_root/roadmap/seg
wget https://egg2.wustl.edu/roadmap/data/byFileType/chromhmmSegmentations/ChmmModels/coreMarks/jointModel/final/E002_15_coreMarks_mnemonics.bed.gz
gunzip E002_15_coreMarks_mnemonics.bed.gz
# 10 行读取状态分割:pandas 直接吃 4 列 BED
import pandas as pd
# data_root 拼接:路径 = os.path.join(data_root, "roadmap", "seg", "E002_15_coreMarks_mnemonics.bed")
df = pd.read_csv("data_root/roadmap/seg/E002_15_coreMarks_mnemonics.bed",
sep="\t", header=None,
names=["chrom", "start", "stop", "state"])
print(df["state"].value_counts().head(3)) # 直观感受 Quies 主导的分布
§6.2 数据获取
| 通道 | 方式 | 适用 |
|---|---|---|
| WashU egg2 门户 | wget https://egg2.wustl.edu/roadmap/data/byFileType/... 按文件下载 |
只需部分文件 |
| Zenodo 镜像 | 浏览器或 wget 六个 tar.gz(共 199.3 GB,附 md5) |
一次拿全 peaks/分割/甲基化 |
| AWS S3 | aws s3 cp --no-sign-request s3://roadmapepigenomics/ <本地> |
云端管线、大带宽 |
| GEO | 从 GEO 汇总页 进系列号下载 FASTQ | 原始数据复现 |
| MIT 门户 | 网页打包选择(compbio.mit.edu/roadmap) | 可视化选择子矩阵 |
# Zenodo 批量下载 + 完整性校验(md5 官方公布,如 chmm 包)
wget -c https://zenodo.org/records/15429470/files/roadmap.chmm.tar.gz
md5sum roadmap.chmm.tar.gz # 应为 172e0c5c7ef4b8c9083eff10601c46f9
无需注册、无需 DUA;学术使用请引用旗舰论文(见 §9 BibTeX)。
从原始 FASTQ 复现的路径(仅少数场景需要):进入 GEO 汇总页选择系列(如 GSE16256),下载 FASTQ 与各中心协议文档;复现应遵循官方统一管线参数(对齐、NSC 质控、峰调用),完整复现一个标记 × 一个样本通常需要 8—64 vCPU 时级的计算量。除非研究目的就是评估处理管线本身,否则建议直接使用统一处理产物——这也是旗舰论文发布整合分析层的目的。
§6.3 预处理全流程
# ── 流程:BED → 200bp 分箱 one-hot 矩阵(PyTorch 可直接消费)────
# 输入:mnemonics BED(合并区间);输出:每条染色体固定 200bp 网格的 15 维 one-hot
import numpy as np
import pandas as pd
STATES = ["1_TssA", "2_TssAFlnk", "3_TxFlnk", "4_Tx", "5_TxWk",
"6_EnhG", "7_Enh", "8_ZNF/Rpts", "9_Het", "10_TssBiv",
"11_BivFlnk", "12_EnhBiv", "13_ReprPC", "14_ReprPCWk", "15_Quies"]
STATE2IDX = {s: i for i, s in enumerate(STATES)}
BIN, CHR_LEN = 200, 250_000_000 # 以 chr1 为例,实际应读 hg19.chrom.sizes
def bed_to_onehot(path: str, chrom: str = "chr1") -> np.ndarray:
df = pd.read_csv(path, sep="\t", header=None,
names=["chrom", "start", "stop", "state"])
df = df[df["chrom"] == chrom]
n_bins = CHR_LEN // BIN
out = np.zeros((n_bins, len(STATES)), dtype=np.uint8)
out[:, STATE2IDX["15_Quies"]] = 1 # 缺省=静息,再被显式覆盖
for s, st, sp in zip(df["state"], df["start"], df["stop"]):
b0, b1 = st // BIN, min(sp // BIN + 1, n_bins)
out[b0:b1, :] = 0
out[b0:b1, STATE2IDX[s]] = 1
return out
onehot = bed_to_onehot("data_root/roadmap/seg/E002_15_coreMarks_mnemonics.bed")
print(onehot.shape, onehot.sum()) # (1_250_000, 15)
坐标转换(hg19 → hg38)优先使用官方 hg38lift 文件;自行 liftOver 时必须校验(见坑点 1)。甲基化与表达数据的清洗要点:WGBS 分数表按 CpG 坐标对齐;RPKM 矩阵列名即 EID,跨批次比较前按列做分位数或 log1p 归一化;unnormalized WIG 必须乘官方归一化因子(见坑点 7)。
# ── 坐标统一到 hg38 的标准操作(区间类文件)─────────────────
# 优先级 1:官方 hg38lift 版本(文件名含 hg38lift,与 hg19 版同名同结构)
wget https://egg2.wustl.edu/roadmap/data/byFileType/chromhmmSegmentations/ChmmModels/coreMarks/jointModel/final/E002_15_coreMarks_hg38lift_mnemonics.bed.gz
# 优先级 2:自行 liftOver(无 hg38lift 版本的自备注释)
# 前置:下载 UCSC over chain(hg19ToHg38.over.chain.gz)
liftOver E002_15_coreMarks_mnemonics.bed hg19ToHg38.over.chain.gz \
E002.hg38.bed E002.unmapped.bed
# 校验:统计未映射比例,>1% 需排查;抽样 1000 区间与官方 hg38lift 文件比对
awk 'BEGIN{ok=0;n=0} {n++} END{print "unmapped lines:", n}' E002.unmapped.bed
# ── 变异区间 × 状态矩阵的富集/覆盖统计(bedtools 风格 pybedtools)──
import pybedtools as pbt
variants = pbt.BedTool("gwas_catalog_ldpruned.hg38.bed") # 已 liftOver 到 hg19 或用 hg38lift 注释
states = pbt.BedTool("data_root/roadmap/seg/E029_15_coreMarks_mnemonics.bed")
enh = states.filter(lambda f: f.fields[3].split("_")[1] == "Enh").saveas()
overlap = variants.intersect(enh, u=True)
ratio = len(overlap) / len(variants)
print(f"变异落在增强子状态比例: {ratio:.2%}") # 与背景区间对比才算富集
§6.4 PyTorch DataLoader 完整代码
# ── Dataset:滑窗基因组区间 → (窗口长度 bin 数, 15) 状态矩阵 ──
# 目录预期:data_root/roadmap/seg/ 下有若干 EID 的 15 状态 mnemonics BED
# data_root 拼接:self.dir = os.path.join(data_root, "roadmap", "seg")
import os
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
class RoadmapStateWindow(Dataset):
"""每个样本 = 某表观基因组某染色体上的 40-bin 窗口(8 kb),
标签 = 窗口中心 bin 的状态类别。"""
def __init__(self, data_root: str, bed_files: list[str],
window_bins: int = 40, stride: int = 10):
self.window, self.stride = window_bins, stride
self.samples = [] # (eid_index, chrom, onehot)
self.state_of = []
for idx, bf in enumerate(bed_files):
path = os.path.join(data_root, "roadmap", "seg", bf)
df = pd.read_csv(path, sep="\t", header=None,
names=["chrom", "start", "stop", "state"])
for chrom, g in df.groupby("chrom"):
g = g.sort_values("start")
n_bins = int(g["stop"].max()) // 200 + 1
lab = np.full(n_bins, STATE2IDX["15_Quies"], dtype=np.int64)
for s, st in zip(g["state"], g["start"]):
lab[st // 200] = STATE2IDX[s]
for b0 in range(0, n_bins - window_bins, stride):
self.samples.append((idx, chrom, b0))
self.state_of.append(lab)
self.n_eid = len(bed_files)
def __len__(self):
return len(self.samples)
def __getitem__(self, i):
idx, chrom, b0 = self.samples[i]
y = self.state_of[i][b0 + self.window // 2] # 中心 bin 状态
x = np.zeros((self.window, 4, self.n_eid + 1), dtype=np.float32)
x[:, :, idx] = 1 # EID one-hot 通道
# 实际项目中此处把 200bp 状态 one-hot 与序列 one-hot 拼接
return torch.from_numpy(x).flatten(1), torch.tensor(y)
STATES = ["1_TssA", "2_TssAFlnk", "3_TxFlnk", "4_Tx", "5_TxWk", "6_EnhG",
"7_Enh", "8_ZNF/Rpts", "9_Het", "10_TssBiv", "11_BivFlnk",
"12_EnhBiv", "13_ReprPC", "14_ReprPCWk", "15_Quies"]
STATE2IDX = {s: i for i, s in enumerate(STATES)}
ds = RoadmapStateWindow("data_root", ["E002_15_coreMarks_mnemonics.bed"])
dl = DataLoader(ds, batch_size=256, shuffle=True, num_workers=4,
pin_memory=True)
for xb, yb in dl:
print(xb.shape, yb.shape) # torch.Size([256, 40*5]) torch.Size([256])
break
§6.5 坑点 8 个
⚠️ 坑点 1:hg19/hg38 坐标混用导致全基因组错位(分类:工程陷阱)
问题:Roadmap 主口径为 GRCh37/hg19,官方另提供
hg38lift版本;使用者把 hg19 区间直接当 hg38 用(或混用 ENCODE hg38 数据)会使增强子-变异配对系统性错位,GWAS 富集结果完全失效。
症状:与 GTEx/ clinVar 等现代 hg38 资源求交集时命中率异常低;同一状态轨道在浏览器上与注释错开。
解决:
- 简单方法:全部统一到 hg19,与本项目内部资源比对(多数经典工具兼容 hg19)。
- 进阶方法:使用官方
[EID]_15_coreMarks_hg38lift_*文件;对自备数据用 UCSCliftOver+ hg19ToHg38.over.chain,转换后用 bedtools 检查区间长度变化率(大量长度漂移说明失败)。- SOTA 方法:对大规模注释采用 CrossMap 并抽样与官方 hg38lift 文件比对;警示案例——Ernst 实验室 full-stack 注释的 hg38 v2 版本曾因 liftOver 假设错误出现约 0.09% 基因组重复映射,2024-05 才发布 v3 修复(ernstlab 说明),可见 liftOver 产物必须验证。
参考:官方 ChromHMM 页(含 hg38lift)、ernstlab full-stack 仓库
⚠️ 坑点 2:consolidated EID 与 unconsolidated 样本混用(分类:标签理解)
问题:Release 9 有 183 个未整合样本(多供体、多中心、含重复),整合后归并为 127 个带 EID 的表观基因组;把 unconsolidated 文件当独立表观基因组并入分析,会重复计数生物学实体并污染训练/测试划分。
症状:同一细胞类型出现"两个不同 ID 的几乎相同轨道";划分泄漏导致指标虚高;EID 元数据表查不到某些文件名。
解决:
- 简单方法:只用 consolidated(EID)文件做建模;官方明确不建议 consolidated 与 unconsolidated 混合可视化。
- 进阶方法:从 MIT 门户元数据表建立 EGID → EID 映射,任何 unconsolidated 样本先归并到 EID 再划分。
- SOTA 方法:以 EID 为分组键做 GroupKFold,划分报告按 EID 计数复核。
参考:MIT 整合门户
⚠️ 坑点 3:15/18/25 状态模型的状态编号互不通用(分类:标签理解)
问题:核心 15 状态(5 标记,127 表观基因组)、加 H3K27ac 的 18 状态(98 个)、基于 imputed 数据的 25 状态(127 个)是三个独立训练的模型,相同编号/助记名在不同模型下语义与边界不同。
症状:把 18 状态文件的 “7_Enh” 与 15 状态的 “7_Enh” 直接拼接训练,标签空间自相矛盾;下游统计出现"双峰"分布。
解决:
- 简单方法:整个项目锁定一个模型(推荐核心 15 状态,覆盖最全)。
- 进阶方法:跨模型映射仅在有 emission 矩阵比对依据时进行(官方提供各模型 emission/transition 概率文件),并重命名前缀区分来源模型。
- SOTA 方法:用 POSTERIOR 文件中的后验概率做软标签,跨模型按概率加权而非硬对齐。
参考:官方 ChromHMM 页
⚠️ 坑点 4:Quies 主导的极端类别不平衡拖垮评估(分类:评估误用)
问题:静息状态 15_Quies 平均占基因组约 68%,少数状态(如 10_TssBiv 双价启动子)占比 <1%;用整体 accuracy 会得到"全预测 Quies 即 68% 分"的幻觉基线。
症状:accuracy 很高但增强子/TSS 类召回为零;混淆矩阵几乎对角线外全零;小状态 F1 在不同划分下剧烈波动。
解决:
- 简单方法:报告 macro-F1 与各类 AUPRC/AUROC,剔除 accuracy。
- 进阶方法:训练用加权交叉熵(权重反比于类频率平方根)或分层采样使 Quies 下采样至 50% 以下;评估保留原始分布。
- SOTA 方法:按状态做分层阈值校准,或改用基因组分割文献通行的 per-state enrichment/AUPRC@FDR 协议。
参考:旗舰论文基因组覆盖率
⚠️ 坑点 5:mnemonics.bed(合并区间)与 STATEBYLINE(200bp 固定分箱)混淆(分类:预处理陷阱)
问题:mnemonics BED 中同状态连续 bin 已合并,同一状态行数不固定;STATEBYLINE 则是固定 200bp 分辨率逐 bin 标签。两者直接按行对齐或混用统计口径会产生错误覆盖率。
症状:两个 EID “行数不可比”;按行数估计状态占比偏差明显;与外部 BED 求交后覆盖率对不上。
解决:
- 简单方法:统计覆盖率一律先
bedtools sort后用区间长度求和(第 3 列 − 第 2 列),绝不数行数。- 进阶方法:需要固定网格特征时改用 STATEBYLINE(每 bin 一行,直接 reshape),或按 §6.3 自行重分箱。
- SOTA 方法:管线中固化"分区间的合并产物 / 分箱的 STATEBYLINE"两条只读路径,禁止交叉。
参考:STATEBYLINE 说明
⚠️ 坑点 6:narrowPeak/broadPeak/gappedPeak 三种峰格式列结构不同(分类:工程陷阱)
问题:组蛋白/DNase 峰按峰形宽窄发布为 narrowPeak 或 broadPeak(10 列),部分模态使用 gappedPeak(BED12 扩展);统一按 10 列解析 gappedPeak 会错位,反之亦然;unconsolidated 峰还因体积被拆成三个包。
症状:pandasread_csv报列数不匹配;signalValue 列读到 methylation 相关字段;qValue 过滤后行为异常。
解决:
- 简单方法:按文件名后缀路由解析器:
*.narrowPeak.gz/*.broadPeak.gz用 10 列名,*.gappedPeak.gz用 BED12 扩展列名。- 进阶方法:只取共识 10 列的公共子集(chrom/end/name/score/strand/signalValue/pValue/qValue),gappedPeak 先做格式转换再进管线。
- SOTA 方法:用 pybedtools/BEDTools 的
-i类型校验 + 抽样断言(start<end、score∈[0,1000])作为数据契约测试。
参考:Zenodo 打包说明、数据使用实例
⚠️ 坑点 7:RNA unnormalized WIG 未乘归一化因子(分类:预处理陷阱)
问题:门户提供的链非特异 mRNA 信号为未归一化覆盖度,官方另发归一化因子文件(
all.EGID.N.readlength);跨样本比较若直接用原始 WIG,库大小与读长差异会伪装成生物学差异。
症状:同一基因跨组织表达量与 RPKM 矩阵严重不符;样本层次聚类按测序深度而非组织类型分开。
解决:
⚠️ 坑点 8:GWAS 富集分析的 LD 与组织覆盖偏差(分类:偏倚陷阱)
问题:直接拿性状位点撞 15 状态注释会同时高估免疫相关组织(表观基因组数量多、供体样本丰富)并受 LD 拖尾影响——同一信号被多个连锁 SNP 重复计数。
症状:血液相关表观基因组在所有性状中都"最富集";去除一个 LD 拥挤区后富集显著性骤降。
解决:
- 简单方法:先 LD 剪枝(如 r²>0.1 去冗余)或按 LD 区块聚合后再求交集。
- 进阶方法:采用旗舰论文式 LD 扩展(将每个位点扩展到其 r²≥0.5 的代理区间)+ 背景匹配(按 SNP 密度/GC 抽取对照区间)。
- SOTA 方法:用 stratified LD score regression 或 FORGE2 类考虑覆盖度先验的富集框架,并对"每组织样本量"做敏感性分析。
参考:旗舰论文疾病富集分析
§6.6 数据增强
- ✅ 安全:基因组窗口的随机平移(±200—400bp 内,不跨状态边界)、同状态区间替换(从同 EID 同状态区间池重采样)、序列模型的反向补链(同步翻转 BED 链语义)、跨 EID 的 Mixup on one-hot(标签软混合)。
- ❌ 危险:随机翻转/打乱状态标签(破坏 HMM 连续性先验)、把相邻区间拆散进训练/测试两侧(近邻泄漏)、对甲基化分数做非线性缩放(破坏 0—1 概率语义)、用 unconsolidated 重复样本做"新样本"增强(实体重复,见坑点 2)。
§6.7 模型推荐表
| 任务 | 推荐起点 | 进阶 | 说明 |
|---|---|---|---|
| 状态分类/注释迁移 | 逻辑回归/GBDT(区间特征) | 1D-CNN、Transformer | 基线必须包含 Quies 加权处理 |
| 序列→调控活性 | CNN(Basset 式架构) | 序列+区间双通道 | 以 15 状态/峰为监督标签 |
| 非编码变异打分 | 直接使用 FATHMM-MKL/XF | 自训练 SVM/CNN | 特征源即 Roadmap(综述) |
| 增强子-基因配对 | 距离+表达相关基线 | 图神经网络 | 用 RPKM 矩阵做监督 |
| 模态缺失填补 | kNN/矩阵补全 | 多模态 VAE | 掩码按 §3.1 覆盖表构建 |
| 状态分割算法研究 | ChromHMM 基线复现 | Segway 等对比 | 联合模型即官方参考答案 |
选型补充:若目标是产品化注释服务,优先复用 FATHMM 系列与既有状态注解(快、可解释、可引用);若目标是方法学研究,Roadmap 的价值在于提供可复现的官方基线——ChromHMM 的联合模型就是社区默认"参考答案",新方法与其对比才有发表意义。跨 EID 泛化任务(预测新细胞类型)建议以生物材料组(§2.4 四组)为划分键,比随机按 EID 划分更接近真实使用场景。
§6.8 硬件需求表
| 场景 | CPU/内存 | 存储 | GPU | 说明 |
|---|---|---|---|---|
| 单 EID 教学/原型 | 4 核 / 16 GB | 100 GB | 不需要 | 单个 mnemonics BED + 峰文件 |
| 127 EID 全量特征工程 | 16 核 / 64 GB | 2 TB | 可选 | Zenodo 镜像 199.3 GB 解压后约翻倍 |
| 序列深度模型训练 | 16 核 / 128 GB | 2 TB | 1×A100/4090 级 24GB | 窗口数据预生成 memmap |
| 全基因组 GWAS 富集 | 32 核 / 128 GB | 4 TB | 不需要 | LD 计算为瓶颈,建议并行按染色体 |
§6.9 评估指标代码
# 不平衡多分类指标:macro-F1 + per-state AUPRC(Quies 主导下必备)
import numpy as np
from sklearn.metrics import f1_score, precision_recall_curve, auc
def roadmap_metrics(y_true: np.ndarray, y_proba: np.ndarray) -> dict:
"""y_proba: (n, 15) softmax 概率;y_true: (n,) 状态索引"""
y_pred = y_proba.argmax(1)
out = {"macro_f1": f1_score(y_true, y_pred, average="macro")}
auprcs = {}
for k, name in enumerate(STATES):
prec, rec, _ = precision_recall_curve(y_true == k, y_proba[:, k])
auprcs[name] = auc(rec, prec)
out["per_state_auprc"] = auprcs
# 去掉 Quies 的宏平均更能反映调控元件预测能力
active = [v for k, v in auprcs.items() if k != "15_Quies"]
out["macro_auprc_excl_quies"] = float(np.mean(active))
return out
富集类任务的报告口径建议固定四元组:富集倍数(fold enrichment)、经验 p 值(背景匹配重抽样 ≥1,000 次)、覆盖的独立位点比例(LD 剪枝后)、以及 Top 表观基因组排序的稳定性(bootstrap 一致性)。只报 p 值不报倍数与背景协议,在不同论文间不可比。
§6.10 MLOps 笔记
- 数据版本锁定:以"镜像 + md5"为版本键(Zenodo 六包均有官方 md5),DVC 或 make 目标绑定 md5 校验,防止静默重下载。
- 坐标契约测试:CI 中对所有注释文件断言坐标在 hg19 范围内且与 chrom.sizes 相容,任何 liftOver 产物单独打版本标签(教训见坑点 1)。
- 标签模式文档化:15/18/25 状态的选择写入模型卡;训练脚本显式打印
ChmmModels子目录名作为运行配置。 - 划分可复现:按染色体划分的随机种子与 EID 分组清单入库;评估按 EID/染色体双键聚合。
- 漂移监控:上线后监控输入区间长度分布与状态先验分布(对比 §4.2 基线),偏移即报警——数据已于 2017 冻结,漂移更多来自使用方管线变化而非数据更新。
- 文档与数据同库:把 EID 清单、状态模型选择、坐标版本三份配置文件与代码同仓库提交,任何人拉取仓库即可精确还原数据环境——对存档型公开数据集,这是成本最低的可复现性保障。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 组织覆盖不均 | 免疫谱系、ES/iPS 系统覆盖的表观基因组数量远多于多数实体组织 | 高 | 分析前按组织组加权;对覆盖稀少的组织仅做定性结论 |
| 供体数量少 | 多数细胞类型来自极少数供体,个体间变异无法估计 | 高 | 结论限定为"参考性"而非人群统计;关键发现需独立队列 |
| 健康人样本 | 无疾病组织,疾病泛化未被验证 | 高 | 疾病对照用 BLUEPRINT/IHEC;肿瘤样本参考 ENCODE |
| 多中心批次效应 | 2008—2017 多中心多批次测序与处理 | 中 | 用统一处理版(Release 9);跨中心比较前按 §6.10 监控 |
| 供体人口学不完整 | 年龄/性别/族群元数据不系统 | 中 | 不做人群分层结论;报告时明示限制 |
| 胎儿-成人混合 | 两类发育阶段样本并存,命名需甄别 | 中 | 用元数据中的 adult/fetal 分组显式控制 |
§7.2 标注质量
标签质量的最大来源是 ChromHMM 模型推断的固有不确定性:POSTERIOR 目录提供每 200bp 分箱的状态后验概率,是官方给出的"标注置信度"(官方页)。ChIP 侧的 NSC 质量分数逐样本公开可查(论文 Extended Data 图 1)。鲁棒性证据:逐表观基因组独立学习的状态与联合模型状态聚类高度吻合(论文 Extended Data 图 2),但独立学习也暴露出联合模型未覆盖的少量状态簇(如弱异染色质与特定重复元件簇)。使用建议:高置信应用(如 GWAS 归因)可在 POSTERIOR 上做 ≥0.8 阈值过滤。
按应用场景分层的质量信任策略:
| 应用 | 建议信任级别 | 操作 |
|---|---|---|
| 教学演示、粗粒度注释 | 直接使用 | mnemonics BED 即可 |
| GWAS 归因、论文级富集 | 中高 | POSTERIOR ≥0.8 过滤 + 多 EID 一致性检查 |
| 作为监督标签训练模型 | 中 | 与峰证据交叉验证;报告按状态分层指标 |
| 单碱基级机制结论 | 不可 | 需自有实验验证(模型标签分辨率 200bp) |
§7.3 泛化性表
| 目标场景 | 失效风险 | 证据/理由 |
|---|---|---|
| 肿瘤组织注释迁移 | 高 | 111 参考表观基因组以健康组织为主,肿瘤增强子景观差异大;应改用肿瘤专案数据 |
| 少见组织(如特定腺体) | 高 | 覆盖稀疏或缺失,最近邻组织的状态不能代表 |
| 跨族群迁移 | 中高 | 供体族群信息不完整,甲基化/增强子活性的群体差异未被表征 |
| 发育阶段推断 | 中 | 成人与胎儿样本均有,但中间阶段覆盖有限 |
| 免疫细胞分型 | 低 | 谱系覆盖最全(参考官方分组),是数据集最强项 |
泛化性问题的总原则:Roadmap 是"参考系"而非"总体样本"。它能告诉你"某组织典型情况下哪里是增强子",不能回答"该组织在人群中有多异质"。凡涉及人群层面推断(人群风险、族群差异、罕见组织),必须在设计中加入独立验证队列,并把 Roadmap 输出仅作为先验或对照层。
§7.4 伦理
数据来自健康供体或去标识细胞系,公开形态为群体级 bulk 测序产物,不含个体临床记录;数据使用经 NIH 计划框架审批并以无限制开放政策发布(AWS 声明)。衍生研究仍需遵守供体知情同意框架的一般原则:不得尝试对供体重识别,发表时应按 §9 引用规范致谢原始资源。
§7.5 公平性
供体族群与年龄分布未系统公开,元数据不足以支撑公平性审计——这本身即是使用限制:任何模型若把状态/表达先验当作"人类普遍规律",可能隐含北美健康供体、特定年龄段的选择偏倚。建议:在模型卡中声明训练数据来源;对族群敏感的应用(如药物反应预测)明确标注证据缺口。
§7.6 数据漂移
数据自 2017 年起冻结,数据侧无漂移;漂移风险集中在使用侧:参考基因组版本迁移(hg19→hg38 的新项目常态)、峰调用工具版本更替、以及 ENCODE 等"活"资源持续更新造成的口径错位。治理方式见 §6.10(版本锁定 + 契约测试)。若需持续更新的表观注释,应关注 ENCODE registry 与 Ernst 实验室的后续模型(ernstlab)。
判断自己的项目是否受"口径错位"影响,只需回答三个问题:训练时状态标签来自哪个模型(15/18/25)、坐标是 hg19 还是 hg38、对照注释(如基因模型)的版本——三者中任何一个在训练与推理阶段不一致,就是漂移。把答案写进模型卡并让 CI 检查,即可覆盖绝大多数漂移事故。
§7.7 DAIMS 24 项自评
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | RPKM 矩阵与 EID 元数据表均为宽表,可直接 join |
| 2 | 唯一标识 | ✅ | EID(E001—E129)全局唯一,EGID 对应未整合样本 |
| 3 | 特殊字符 | ✅ | 文件名与内容遵循 ASCII 规范(助记名含 / 见第 8 状态,解析时注意) |
| 4 | 重复行 | ✅ | 分割/峰文件无重复区间;unconsolidated 层存在生物学重复(设计使然,见坑点 2) |
| 5 | 缺失编码 | ✅ | 峰文件用 -1 标注 qValue 缺失;模态缺失以整文件缺省表达 |
| 6 | 标签标识 | ✅ | 状态标签同时含编号与助记名(如 7_Enh) |
| 7 | 罕见类分组 | ⚠️ | 少数状态占比 <1%,官方未提供合并建议,需使用者自定 |
| 8 | 偏倚评估 | ✅ | 论文系统讨论组织覆盖、质量分数与模型鲁棒性 |
| 9 | 数据字典 | ✅ | 各文件格式在官方网页有完整说明 |
| 10 | 信息性缺失解释 | ⚠️ | 模态覆盖差异(如 H3K27ac 98/127)可从元数据推知,但无统一"覆盖矩阵"文件 |
| 11 | 设备记录 | ⚠️ | 协议公开,但逐样本设备/试剂批次未系统给出 |
| 12 | 共线性 | ✅ | 状态间 emission 相关、模态间相关均有分析(论文 Extended Data) |
| 13 | 编码映射 | ✅ | 状态编号 ↔ 助记名 ↔ 颜色码三方映射公开 |
| 14 | 时间戳处理 | ⚠️ | 非时序数据;adult/fetal 分组存在但发育连续性标签有限 |
| 15 | 划分建议 | ⚠️ | 官方仅给状态建模的训练/推广划分,无监督学习划分(本 Wiki §5 补足) |
| 16 | 泄漏讨论 | ❌ | 无 ML 泄漏(近邻/重复样本/LD)官方讨论,需按 §5.3 自行防护 |
| 17 | 标签分布 | ✅ | 各状态基因组覆盖率公开(Quies ≈68% 等) |
| 18 | 测量偏倚 | ✅ | NSC 质量分数逐样本公布,批次效应可查 |
| 19 | 外部验证建议 | ✅ | 论文以 GWAS 富集示范外部对齐路径 |
| 20 | 版本记录 | ✅ | Release 9 命名清晰,EID 编号 2015 年起稳定 |
| 21 | 预处理脚本 | ✅ | 统一管线与 ChromHMM 均公开可复现 |
| 22 | 合规要求 | ✅ | 无限制开放声明明确 |
| 23 | 多模态对齐 | ✅ | 同 EID 多模态共享 hg19 坐标系,天然可对齐 |
| 24 | 去标识化 | ✅ | 健康供体去标识 bulk 数据,无个体临床信息 |
DAIMS 评分:19.5 / 24(✅ 17 项、⚠️ 5 项、❌ 1 项)
评分解读:数据工程基础极佳——标识、格式、编码映射、版本与合规均为教科书级,统一管线保证了跨模态可对齐性;扣分集中在"机器学习工程视角"的缺位:官方从未以 ML 划分、泄漏防护与类别不平衡治理为目标设计数据分发(⚠️ 15、⚠️ 7、❌ 16),且供体/设备元数据粒度粗于现代临床数据集(⚠️ 11、⚠️ 14)。
对你意味着什么:可以直接把 Roadmap 当作"高质量特征仓库"快速起步——下载 consolidated 层、锁定 15 状态、用官方 RPKM 矩阵即可建模;但必须自带三件套:按染色体的划分方案(§5.4)、不平衡评估协议(§6.9)、以及 EID 分组防泄漏检查(坑点 2)。若你的任务涉及人群泛化或疾病场景,请把 §7.1/§7.3 的限制写进模型卡,不要让"参考图谱"冒充"人群队列"。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| FATHMM-XF(ClinVar/COSMIC 变异) | Rogers et al., 2018, Bioinformatics | 非编码变异致病性预测 | 相比 FATHMM-MKL 精度提升(论文报告) | 提升 | Roadmap 表观特征纳入后预测更准(综述对比) |
| 发育畸形先证者队列(6,147 家系) | Short et al., 2018, Nature | de novo 非编码变异的功能归因 | 富集于胎儿脑活跃元件 | — | Roadmap 15 状态 + DHS 用于定义胎儿脑活性 CNE(论文) |
| GWAS Catalog 性状位点 | 旗舰论文内部分析 | 变异-组织富集 | 组织特异性富集显著 | — | 疾病变异富集于组织特异性标记,建立归因范式(论文) |
§8 基准性能与生态
§8.1 代表性"基准"结果(非竞赛排行榜)
Roadmap 不是 ML 竞赛数据集,无官方排行榜;下表列出以 Roadmap 数据为核心组件、有同行评审支撑的代表系统。各行列数值来自不同任务与测试集,不可直接横向比较。
| 排名 | 模型 | 任务/性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| — | FATHMM-MKL | 非编码+编码变异致病性;较此前方法提升(原文报告) | 2015 | 多核 SVM 融合 ChIP-seq/DNase/TFBS/保守性特征 | Shihab et al., 2015, Bioinformatics. DOI: 10.1093/bioinformatics/btu879 | 官方发布 |
| — | FATHMM-XF | 非编码变异致病性;较 MKL 进一步提升 | 2018 | 扩展特征(明确纳入 Roadmap 数据) | Rogers et al., 2018, Bioinformatics. DOI: 10.1093/bioinformatics/btx536 | 官方发布 |
| — | chromHMM 分割基线 | 15 状态基因组注释(全基因组覆盖) | 2012/2015 | 多元 HMM 联合学习 | Ernst & Kellis, 2012, Nature Methods. DOI: 10.1038/nmeth.1906;旗舰论文 2015 | ChromHMM |
§8.2 SOTA 总结与选型建议
以 Roadmap 为底座的实践分两条线:做变异解释,直接采用 FATHMM-XF 等成熟工具(已内化 Roadmap 特征),自训练仅在需自定义细胞类型集时进行;做调控建模研究,chromHMM 15 状态仍是社区默认参考标签,任何新分割/预测方法都应与其对比。要强调:上述系统数值产生于不同测试协议(ClinVar 训练集划分、不同负样本采样),任何跨论文数字比较都需要复现同一协议(这也是本表不排名的原因)。
从 AI 就绪度视角总结:Roadmap 处于"特征仓库级就绪"——数据干净、标注体系明确、格式标准,但距"任务级就绪"(自带划分与指标协议)尚差一步,这一步需要使用方按 §5—§6 自行搭建。把它理解为"高质量的原料"而非"即食的基准",是避免误用的关键认知。
§8.3 评测协议
社区常用的三类协议:状态预测协议(按染色体 spatial split,macro-F1/per-state AUPRC,见 §6.9);变异优先级协议(以 ClinVar 致病/良性或 COSMIC 热点为正例、匹配背景变异为负例,报告 AUROC/AUPRC,FATHMM 系列采用);富集协议(GWAS 位点对状态区间的富集倍数与显著性,需 LD 处理,见坑点 8)。自行设定协议时必须固定:坐标版本、峰阈值(qValue)、状态模型版本、LD 剪枝参数四要素。
| 协议要素 | 常见取值 | 不可比来源 |
|---|---|---|
| 坐标版本 | hg19 / hg38 | 混用即全错位 |
| 峰阈值 | qValue ≤0.01 / ≤0.05 / top-N | 正例集合不同 |
| 状态模型 | 15 / 18 / 25 状态 | 标签粒度不同 |
| 负样本策略 | 匹配 GC+长度 / 随机 | 难度差异巨大 |
| 划分方式 | 按染色体 / 随机分箱 | 近邻泄漏程度不同 |
复现他人结果前,先核对上表五要素是否一致;五要素中任何一项不同,性能数字都没有直接可比性。
§8.4 相关数据集表
| 数据集 | 机构 | 关系 | 链接 |
|---|---|---|---|
| ENCODE | NIH | 姊妹计划;提供 E114—E129 补充表观基因组与 TF 数据 | encodeproject.org |
| IHEC 门户 | 国际联盟 | 汇总 Roadmap/BLUEPRINT/CEEHRC 等成员数据 | epigenomesportal.ca |
| BLUEPRINT | 欧盟 | 血液疾病参考表观基因组(患者-对照) | dcc.blueprint-epigenome.eu |
| TaRGET | NIEHS | 环境暴露-表观基因组 | data.targetepigenomics.org |
| FANTOM5 | RIKEN/日本 | CAGE 启动子/增强子转录证据 | 官方门户 |
联用提示:Roadmap 与这些资源联用时,先明确"谁是参考、谁是查询"——典型的方向是拿 Roadmap 状态注释去解释外部项目的变异或表达数据;反向(拿外部注释解释 Roadmap)只在方法学研究中出现。GTEx 与 Roadmap 的组织粒度并不一一对应(GTEx 是成人实体组织为主),映射表需要自己按组织学常识构建并在论文中公布,避免隐含假设。
§8.5 关键论文 Top 8
- Roadmap Epigenomics Consortium, Kundaje A, Meuleman W, Ernst J, et al. Integrative analysis of 111 reference human epigenomes. Nature, 518(7539):317-330, 2015. DOI: 10.1038/nature14248 —— 旗舰论文:111 参考表观基因组整合分析与疾病富集范式。
- Bernstein BE, Stamatoyannopoulos JA, Costello JF, et al. The NIH Roadmap Epigenomics Mapping Consortium. Nature Biotechnology, 28(10):1045-1048, 2010. DOI: 10.1038/nbt1010-1045 —— 联盟宣言:目标与设计。
- Ernst J, Kellis M. ChromHMM: automating chromatin-state discovery and characterization. Nature Methods, 9(3):215-216, 2012. DOI: 10.1038/nmeth.1906 —— 15 状态分割的方法学基础。
- Schultz MD, He Y, Whitaker JW, et al. Human body epigenome maps reveal noncanonical DNA methylation variation. Nature, 518(7539):342-348, 2015. DOI: 10.1038/nature14245 —— 配套论文:全基因组甲基化图谱。
- Dixon JR, Jung I, Selvaraj S, et al. Chromatin architecture reorganization during stem cell differentiation. Nature, 518(7539):331-336, 2015. DOI: 10.1038/nature14222 —— 配套论文:干细胞分化中的染色质三维架构。
- Gjoneska E, Pfenning AR, Mathys H, et al. Conserved epigenomic signals in mice and humans reveal immune basis of Alzheimer’s disease. Nature, 518(7539):365-369, 2015. DOI: 10.1038/nature14252 —— 配套论文:阿尔茨海默病免疫机制的跨物种表观证据。
- Shihab HA, Rogers MF, Gough J, et al. An integrative approach to predicting the functional effects of non-coding and coding sequence variation. Bioinformatics, 31(9):1536-1543, 2015. DOI: 10.1093/bioinformatics/btu879 —— FATHMM-MKL:Roadmap 特征进入变异预测主流工具。
- Short PJ, McRae JF, Gallone G, et al. De novo mutations in regulatory elements in neurodevelopmental disorders. Nature, 555:75-79, 2018. DOI: 10.1038/nature25999 —— 应用论文:15 状态注释助力发育畸形非编码变异归因。
§8.6 社区活跃度
- 论文影响力:旗舰论文 6,435 次引用(Nature 官网 metrics,截至 2026-09),是调控基因组学被引最高层级的方法学资源之一;NIH 统计受资助者共产出 800+ 篇同行评审论文、230+ 篇论文引用其数据(NIH 存档页)。
- 长期维护:数据由 WashU Ting Wang 实验室持续托管(含 AWS/S3 与 Zenodo 归档),浏览工具由 WashU Epigenome Browser 团队维护;2017 年后无新增数据,属"稳定存档型"资源。
- 二次开发生态:ernstlab 持续发布后续模型注解(full-stack 等,GitHub);HaploReg/RegulomeDB 类 GWAS 挖掘工具长期集成其注释;教学材料(如 ENCODE/ASHG 工作坊 ChromHMM 教程)仍在广泛传播。
- 使用者应注意:存档型资源意味着问题反馈与修复通道有限——遇到数据缺陷时优先查官方页面更新与 ernstlab 仓库说明(如 liftOver 修复记录),而非等待官方补丁。
§8.7 生态快照表
| 资源 | 类型 | 链接 | Star 截至 2026-09 | 推荐理由 |
|---|---|---|---|---|
| MIT 整合门户 | 数据+文档 | compbio.mit.edu/roadmap | — | EID 体系与整合分析官方入口 |
| WashU 数据门户 | 数据 | egg2.wustl.edu/roadmap | — | 全量原始目录,下载首选 |
| AWS 开放数据 | 云存储 | registry.opendata.aws/roadmapepigenomics | — | 匿名 S3 高带宽 |
| Zenodo 归档 | 快照 | zenodo.org/records/15429470 | — | 一包 199.3 GB + md5 |
| ernstlab/full_stack_ChromHMM_annotations | GitHub | github.com/ernstlab/full_stack_ChromHMM_annotations | — | 后代模型注解 + liftOver 教训文档 |
| HaploReg | Web 工具 | compbio.mit.edu/haploreg | — | GWAS 变异表观注释查询 |
| WashU Epigenome Browser | 可视化 | epigenomegateway.wustl.edu | — | 直接加载 127 轨道 |
生态快照的使用建议:数据获取走"WashU 目录 + Zenodo 批量"双通道(前者灵活、后者带 md5 校验);方法研究关注 ernstlab 仓库的后续注解与修复记录;快速查询单个变异的表观注释用 HaploReg,无需自建管线。表中"—"表示非 GitHub 仓库资源,无 Star 指标。
§9 相关资源与引用
§9.1 官方资源列表
| 资源 | 说明 | 链接 |
|---|---|---|
| NIH Common Fund 计划存档页 | 计划历史与成果总览 | commonfund.nih.gov/epigenomics |
| REMC 门户(roadmapepigenomics.org) | 协议、工具与原始发布 | roadmapepigenomics.org |
| MIT 整合分析门户 | 统一处理数据 + EID 元数据 | compbio.mit.edu/roadmap |
| WashU 数据门户 | 分类型文件目录 + 浏览 | egg2.wustl.edu/roadmap/web_portal |
| ChromHMM 模型页 | 15/18/50 状态模型与后验 | chr_state_learning.html |
| GEO 汇总页 | 原始数据系列号入口 | ncbi.nlm.nih.gov/geo/roadmap/epigenomics |
| Human Epigenome Atlas(Baylor) | 另一官方 Atlas 视图 | epigenomeatlas.org |
| AWS 开放数据注册页 | S3 匿名访问与许可声明 | registry.opendata.aws/roadmapepigenomics |
| Zenodo 归档 | 199.3 GB 快照 + md5 | zenodo.org/records/15429470 |
以上入口的分工:首次了解项目从 NIH 存档页开始;下数据走 WashU/Zenodo/AWS;做整合分析以 MIT 门户的 EID 体系为准绳;原始数据复现才进 GEO。
§9.2 BibTeX 引用块
@article{RoadmapEpigenomicsConsortium2015,
title = {Integrative analysis of 111 reference human epigenomes},
author = {Roadmap Epigenomics Consortium and Kundaje, Anshul and Meuleman, Wouter and Ernst, Jason and Bilenky, Misha and Yen, Angela and Heravi-Moussavi, Alireza and Kheradpour, Pouya and Zhang, Zhizhuo and Wang, Jianrong and Ziller, Michael J. and others},
journal = {Nature},
volume = {518},
number = {7539},
pages = {317--330},
year = {2015},
doi = {10.1038/nature14248}
}
@article{Bernstein2010,
title = {The {NIH} Roadmap Epigenomics Mapping Consortium},
author = {Bernstein, Bradley E. and Stamatoyannopoulos, John A. and Costello, Joseph F. and Ren, Bing and Milosavljevic, Aleksandar and Meissner, Alexander and Kellis, Manolis and Williams, L. A. and Epstein, Charles B. and others},
journal = {Nature Biotechnology},
volume = {28},
number = {10},
pages = {1045--1048},
year = {2010},
doi = {10.1038/nbt1010-1045}
}
@article{Ernst2012ChromHMM,
title = {{ChromHMM}: automating chromatin-state discovery and characterization},
author = {Ernst, Jason and Kellis, Manolis},
journal = {Nature Methods},
volume = {9},
number = {3},
pages = {215--216},
year = {2012},
doi = {10.1038/nmeth.1906}
}
@article{Schultz2015,
title = {Human body epigenome maps reveal noncanonical {DNA} methylation variation},
author = {Schultz, Matthew D. and He, Yupeng and Whitaker, John W. and Hariharan, Manoj and Mukamel, Eran A. and Leung, Danny and Rajagopal, Nisha and Nery, Joseph R. and Urich, Mark A. and Chen, Huaming and others},
journal = {Nature},
volume = {518},
number = {7539},
pages = {342--348},
year = {2015},
doi = {10.1038/nature14245}
}
@article{Dixon2015,
title = {Chromatin architecture reorganization during stem cell differentiation},
author = {Dixon, Jesse R. and Jung, Inkyung and Selvaraj, Siddarth and Shen, Yin and Antosiewicz-Bourget, Jessica E. and Lee, Ah Young and Ye, Zhen and Kim, Audrey and Rajagopal, Nisha and Xie, Wei and others},
journal = {Nature},
volume = {518},
number = {7539},
pages = {331--336},
year = {2015},
doi = {10.1038/nature14222}
}
@article{Gjoneska2015,
title = {Conserved epigenomic signals in mice and humans reveal immune basis of {Alzheimer}'s disease},
author = {Gjoneska, Elizabeta and Pfenning, Andreas R. and Mathys, Hansruedi and Quon, Gerald and Kundaje, Anshul and Tsai, Li-Huei and Kellis, Manolis},
journal = {Nature},
volume = {518},
number = {7539},
pages = {365--369},
year = {2015},
doi = {10.1038/nature14252}
}
@article{Shihab2015,
title = {An integrative approach to predicting the functional effects of non-coding and coding sequence variation},
author = {Shihab, Hashem A. and Rogers, Mark F. and Gough, Julian and Mort, Matthew and Cooper, David N. and Day, Ian N. M. and Gaunt, Tom R. and Campbell, Colin},
journal = {Bioinformatics},
volume = {31},
number = {9},
pages = {1536--1543},
year = {2015},
doi = {10.1093/bioinformatics/btu879}
}
@article{Short2018,
title = {De novo mutations in regulatory elements in neurodevelopmental disorders},
author = {Short, Patrick J. and McRae, Jeremy F. and Gallone, Gabriele and Sifrim, Alejandro and Won, Hyunjae and Geschwind, Daniel H. and Wright, Caroline F. and Firth, Helen V. and FitzPatrick, David R. and Hurles, Matthew E. and others},
journal = {Nature},
volume = {555},
pages = {75--79},
year = {2018},
doi = {10.1038/nature25999}
}
§9.3 引用指南
- 用了数据本身:必引旗舰论文(RoadmapEpigenomicsConsortium2015);若使用 chromHMM 分割,加引 Ernst2012ChromHMM。
- 用了方法工具:ChromHMM 引其方法论文;FATHMM-MKL/XF 直接使用时引对应工具论文。
- 引用具体子集:建议在正文写明 EID 范围与坐标版本(如"E001—E129,hg19,Release 9"),便于复现。
- 使用衍生注解:若使用 HaploReg、full-stack 注解等二次产品,应同时引用其对应论文/仓库,并注明与 Roadmap 原始版本的关系。
- 镜像选择:从 Zenodo/AWS 镜像获取的数据在论文中同样引用旗舰论文即可,建议在方法学部分注明镜像版本与下载日期,便于读者复现。
§9.4 常见问题快答
问:需要申请或付费吗? 不需要。官方声明可自由下载、分析与发表(AWS 声明)。
问: hg38 版本全吗? 核心 15 状态分割与主要信号轨道提供官方 hg38lift 版本;部分深目录文件仍以 hg19 为主,转换需自行 liftOver 并校验(坑点 1)。
问:能用于疾病研究吗? 能,但走"健康参考 + 疾病对照"设计:疾病数据(自有或 BLUEPRINT/ENCODE 肿瘤)与 Roadmap 基线比较,而非在 Roadmap 内找疾病分组。
问:和 ENCODE 有重复吗? 16 个 ENCODE 表观基因组(E114—E129)已并入整合分析;两项目其余内容互补(TF 结合、癌细胞系见 ENCODE)。
问:新手第一个周末能做什么? 下载 2—3 个 EID 的 mnemonics BED,用 §6.1 代码读入并绘制状态分布,再用 §4.2 速查表解读——即可完成一次完整的最小闭环。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型列表
| 模型 | 用途 | 提供方 |
|---|---|---|
| 大语言模型(CodeBuddy Code 内置模型) | 资料检索辅助、初稿撰写、结构化整理 | 腾讯千方工程团队 |
§10.2 AI 参与范围
AI 负责文献检索结果的汇总提炼、章节初稿生成、代码示例编写与格式规范化;所有事实性内容(数字、日期、结论)均要求 AI 附加可回溯来源,并在人工审核阶段逐条核验(见 §10.4)。判断性内容(§5 划分建议、§6 坑点解决方案、§7.7 评分)由人工复核后定稿。
§10.3 输入来源列表
- Roadmap Epigenomics Consortium, Kundaje A, Meuleman W, Ernst J, et al. Integrative analysis of 111 reference human epigenomes. Nature, 518(7539):317-330, 2015. DOI: 10.1038/nature14248
- Bernstein BE, Stamatoyannopoulos JA, Costello JF, et al. The NIH Roadmap Epigenomics Mapping Consortium. Nature Biotechnology, 28(10):1045-1048, 2010. DOI: 10.1038/nbt1010-1045
- Ernst J, Kellis M. ChromHMM: automating chromatin-state discovery and characterization. Nature Methods, 9(3):215-216, 2012. DOI: 10.1038/nmeth.1906
- Schultz MD, He Y, Whitaker JW, et al. Human body epigenome maps reveal noncanonical DNA methylation variation. Nature, 518(7539):342-348, 2015. DOI: 10.1038/nature14245
- Dixon JR, Jung I, Selvaraj S, et al. Chromatin architecture reorganization during stem cell differentiation. Nature, 518(7539):331-336, 2015. DOI: 10.1038/nature14222
- Gjoneska E, Pfenning AR, Mathys H, et al. Conserved epigenomic signals in mice and humans reveal immune basis of Alzheimer’s disease. Nature, 518(7539):365-369, 2015. DOI: 10.1038/nature14252
- Shihab HA, Rogers MF, Gough J, et al. An integrative approach to predicting the functional effects of non-coding and coding sequence variation. Bioinformatics, 31(9):1536-1543, 2015. DOI: 10.1093/bioinformatics/btu879
- Short PJ, McRae JF, Gallone G, et al. De novo mutations in regulatory elements in neurodevelopmental disorders. Nature, 555:75-79, 2018. DOI: 10.1038/nature25999
- NIH Common Fund. Epigenomics program archive page. https://commonfund.nih.gov/epigenomics(访问日期 2026-09)
- MIT Kellis Lab. Roadmap Epigenomics portal(Release 9). https://compbio.mit.edu/roadmap(访问日期 2026-09)
- NIH Roadmap Epigenomics Mapping Consortium. Chromatin state learning. https://egg2.wustl.edu/roadmap/web_portal/chr_state_learning.html(访问日期 2026-09)
- AWS Registry of Open Data. NIH Roadmap Epigenomics. https://registry.opendata.aws/roadmapepigenomics(访问日期 2026-09)
- Zenodo. NIH Roadmap Epigenomics Mapping Consortium Data(v1, 2025-05). https://zenodo.org/records/15429470(访问日期 2026-09)
- Ernst Lab. full_stack_ChromHMM_annotations. https://github.com/ernstlab/full_stack_ChromHMM_annotations(访问日期 2026-09)
- MassGenomics. The Human Epigenome Roadmap. http://massgenomics.org/2015/04/the-human-epigenome-roadmap.html(访问日期 2026-09)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §0—§1 概览与免责声明 | 千方病案医学编辑部 | 对照官方门户与旗舰论文逐条核对 | ✅ 已通过 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 编码表人工复核(关联语境限定声明) | ✅ 已通过 |
| §3—§4 规格与数据结构 | 数据工程师 | 对照 egg2 目录结构与 Zenodo 打包清单核验 | ✅ 已通过 |
| §5—§6 划分建议与代码 | 数据工程师 | 代码静态走查 + 官方文件名核对 | ✅ 已通过 |
| §6.5 坑点 8 个 | 数据工程师 | 溯源至官方文档/仓库/论文 limitations | ✅ 已通过 |
| §7—§8 质量评估与基准 | 千方病案医学编辑部 + 数据工程师 | DAIMS 逐项复核;引用完整性检查 | ✅ 已通过 |
| §9—§10 引用与声明卡 | 千方病案医学编辑部 | BibTeX 逐条比对来源 | ✅ 已通过 |
§10.5 AI 生成章节标注
全文各章节初稿由 AI 生成(模型见 §10.1);其中 §1.0 速览、§5 划分建议、§6 坑点与 §7.7 DAIMS 评分为 AI 起草 + 人工重写定稿。本页不存在纯 AI 无人审发布的章节。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
