信息速览

BLUEPRINT — 欧盟血液表观基因组计划 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | BLUEPRINT 血液表观基因组参考图谱 |
| 英文全称 | BLUEPRINT — A BLUEPRINT of Haematopoietic Epigenomes |
| 别名/简称 | Blueprint Epigenome、EU FP7 BLUEPRINT、BLUEPRINT epigenome project |
| 疾病分类 | 血液肿瘤与自身免疫病(ICD-11:2A60 急性髓系白血病 / 2A80.4 慢性淋巴细胞白血病 / 2A81.0 弥漫性大 B 细胞淋巴瘤 / 5A10 1 型糖尿病)+ 健康造血细胞参考表观基因组 |
| SNOMED CT | 91861009 Acute myeloid leukemia / 428841006 Chronic B-cell lymphocytic leukaemia / 46635009 Type 1 diabetes mellitus(详见 §2.1) |
| 数据模态 | 组蛋白修饰 ChIP-seq(H3K4me1、H3K4me3、H3K27ac、H3K27me3、H3K36me3、H3K9me3)、WGBS、RNA-seq、DNase-seq、WGS |
| AI 任务类型 | 细胞类型分类、染色质状态分割、增强子/启动子注释、疾病亚型表观遗传分层、mQTL/eQTL 共定位、基因组深度学习预训练 |
| 样本总数 | 约 3,500 个数据集 / 2,558 个实验 / 约 100 种造血与免疫细胞类型 / 100+ 完整参考表观基因组 |
| 数据大小 | 处理后数据按冻结批次发布(BigWig/BigBed/GTF);EGA 原始数据 TB 级(单个 WGBS 子集即达 630.7 GB) |
| 数据格式 | BigWig(信号)、BigBed(峰/甲基化区域)、GTF(转录定量)、FASTQ.gz、BAM |
| 许可证 | Fort Lauderdale 原则(处理后数据开放);原始序列数据 EGA 受控访问 |
| 访问级别 | 分层——处理后数据开放下载;原始数据申请审核(BLUEPRINT DAC) |
| DUO 标签 | GRU, PUB(处理后数据);IRB(EGA 原始数据需 DAC 审批) |
| 语言 | 英文 |
| 首发日期 | 2011-10(项目启动)/ 2012-03(宣言论文发表) |
| 最后更新 | 2016-08-16(最终数据冻结,此后归档维护) |
| 发布机构 | Radboud University(牵头)领衔的 42 家欧洲机构联盟(EU FP7 项目编号 282510) |
| 官方主页 | http://dcc.blueprint-epigenome.eu/ |
| 下载地址 | ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/ |
| DOI | 10.1038/nbt.2153 |
| 引用次数 | 411+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— IHEC 标准化管线与全量 QC 元数据、处理后数据免申请下载;扣分项:需 BigBed/BigWig 格式转换、无官方 ML 划分、原始数据需 EGA 受控申请 |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(造血分化、白血病与自身免疫病术语体系)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
利益冲突声明:千方病案医数集与 BLUEPRINT Consortium、Radboud University、EMBL-EBI、欧盟委员会无任何商业利益关联。本页面不销售 BLUEPRINT 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BLUEPRINT 处理后数据遵循 Fort Lauderdale 原则开放获取;原始序列与比对数据存于欧洲基因组-表型档案(EGA),须向 BLUEPRINT 数据访问委员会(DAC)提交申请并遵守供者知情同意条款。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
BLUEPRINT 是欧盟第七框架计划(FP7)于 2011-2016 年资助的血液表观基因组旗舰计划,编号 282510,EU 资助约 3,000 万欧元,由荷兰 Radboud 大学的 Henk Stunnenberg 教授牵头,联合 12 个国家、42 家大学、研究所与企业共同完成(CORDIS 最终报告)。它回答一个核心问题:同一个人体内携带完全相同 DNA 的造血干细胞,是如何被表观遗传"开关"塑造成几十种功能迥异的血细胞,又在白血病中走向失控的?
它为什么重要?BLUEPRINT 是国际人类表观基因组联盟(IHEC)的欧洲基石,对约 100 种健康与疾病状态下的造血及免疫细胞类型完成了组蛋白修饰、DNA 甲基化、转录组与染色质开放性的全基因组测绘,共产出约 3,500 个数据集、100 余个完整参考表观基因组与 1,000 余个部分参考表观基因组(CORDIS;Beck & Ecker 评述)。它是迄今最大规模的原代人免疫细胞参考表观基因组资源之一,也是"训练免疫"(trained immunity)这一免疫学范式转移的数据源头。
你能用它做什么?训练细胞类型分类器与染色质状态分割模型、为 GWAS 位点做增强子层面的功能注释、研究 AML/CLL 等白血病的表观遗传失控、或把它当作基因组深度学习模型(如增强子预测器)的高质量预训练语料。注意:处理后数据可直接下载,但原始序列数据需向 EGA 申请。
§1.1 摘要
BLUEPRINT 的技术路线是"高纯度原代细胞 + IHEC 标准化多组学测绘"。联盟用密度梯度离心与磁珠/FACS 分选从成人外周血、脐带血和患者样本中分离约 100 种造血与免疫细胞类型(纯度按 IHEC 标准须超过 90%),对每个细胞类型施加一套标准化 assay 组合:6 种组蛋白修饰的 ChIP-seq(H3K4me1/me3、H3K27ac、H3K27me3、H3K36me3、H3K9me3)、全基因组亚硫酸氢盐测序(WGBS,单碱基分辨率甲基化)、polyA RNA-seq 与 DNase-seq(项目设计)。数据在 7 个生产中心(剑桥、EBI、Sanger、奈梅亨、UCL、McGill、MPIMG)产生,经统一分析管线处理后按"冻结"(freeze)批次向公众发布,最终冻结为 2016-08-16(GRCh38)。其人群层面的标志性成果是 Chen 等 2016 年发表于 Cell 的多组学变异图谱:对 200 名英国献血者的单核细胞、中性粒细胞与初始 CD4+ T 细胞完成基因组、表观基因组与转录组的联合测绘,将分子性状 QTL 共定位到 345 个免疫疾病位点(Chen et al., 2016)。
§1.2 战略价值分析
原代免疫细胞覆盖维度:在 ENCODE 与 NIH Roadmap 主要依赖细胞系的时代,BLUEPRINT 把测绘对象锁定在高纯度原代造血细胞上——这恰恰是 GWAS 免疫疾病位点功能解读最需要的细胞背景。2026 年一项整合分析即基于 BLUEPRINT 数据构建了覆盖 31 种原代造血细胞类型的 107 个表观基因组图谱,并生成 1,100 个增强子-复杂性状关联,直言这是"迄今最大、最全的造血参考表观基因组合集"(bioRxiv 2026)。对 AI 研究者而言,这是免疫细胞背景下的增强子预测与变异注释任务中不可替代的训练与评估语料。
多组学遗传变异维度:BLUEPRINT 与加拿大 IHEC 伙伴合作,在 200 名健康献血者中完成了"基因组(WGS,约 7×)+ 表观基因组(ChIP-seq、WGBS/450K)+ 转录组(RNA-seq)"的三层联合测绘,定量回答了遗传与表观遗传因素对转录的相对贡献,并通过 cross-over 实验显式校正了 7 个生产中心的批次效应(Chen et al., 2016)。这套"多中心 + 交叉验证 + 分子 QTL"的设计,至今仍是多组学数据集质量工程的教科书案例。
临床转化维度:BLUEPRINT 在常见白血病(AML、CLL)与儿童 ALL 上产出了系列"game changing"研究,发现并验证了用于诊断的表观遗传标志物;其揭示的先天免疫细胞"训练记忆"的表观基因组基础直接推动了 sepsis、类风湿关节炎等免疫疾病的新疗法探索;项目还孵化了 Cambridge Epigenetix(Google Ventures 领投 2,100 万美元)并提交 3 项专利申请(EC 专题报道;CORDIS 最终报告)。
数据架构维度:BLUEPRINT 对"如何让 3,500 个数据集保持十年可机读"给出了一套教科书式答案——三门户分工:DCC 作权威入口、DeepBlue 作程序化 API、BDAP 作零代码分析界面;EpiRR 作参考表观基因组注册"护照";冻结批次 + 文件名自描述(sample.mark.algorithm.freeze_date.ext)作版本体系。项目结束近十年后,这套架构仍支撑着跨联盟整合(EpiAtlas)与 2026 年级别的再分析工作。对任何要规划"长寿命数据基础设施"的团队,BLUEPRINT 本身就是可拆解研究的样板工程。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 样本背景 | 核心差异化 |
|---|---|---|---|---|
| BLUEPRINT | 约 3,500 数据集、100+ 细胞类型 | ChIP-seq + WGBS + RNA-seq + DNase-seq + WGS | 原代造血/免疫细胞 + 白血病患者 | 免疫细胞类型最全;含疾病表观基因组;含 200 人多组学变异队列 |
| ENCODE | 数十万实验(累计) | ChIP-seq、ATAC-seq、RNA-seq 等 | 细胞系为主 + 部分原代 | 覆盖面广但原代免疫细胞深度不及 BLUEPRINT |
| NIH Roadmap Epigenomics | 111 个参考表观基因组 | ChIP-seq + RRBS/WGBS + RNA-seq | 多组织(含血液) | 组织谱广,但血液细胞亚型粒度较粗 |
| DEEP(德国 IHEC) | 70 个目标参考表观基因组 | 与 BLUEPRINT 同类 | 多组织 | 德国对应计划,与 BLUEPRINT 同属 IHEC 数据生态 |
| IHEC EpiAtlas | 多联盟联合再处理 | 各成员联盟 assay | 多组织 | 2020 年代对 IHEC 数据的统一重处理与元数据协调 |
BLUEPRINT 的不可替代性集中在两点:一是血液谱系的原代细胞分辨率——从 HSC 到各系终末细胞的约 100 种类型,是免疫 GWAS 注释的首选背景;二是疾病与健康对照同平台——AML、CLL、DLBCL、多发性骨髓瘤样本与正常细胞类型共享同一套管线与元数据标准,可直接做病例-对照表观遗传比较。
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 2011-10 | 项目正式启动(EU FP7 高影响力计划,编号 282510) |
| 2012-03 | 宣言论文发表:Adams et al., Nature Biotechnology 30:224-226(DOI: 10.1038/nbt.2153) |
| 2013 | 项目设计与方法学综述发表(Martens & Stunnenberg, Haematologica) |
| 2014-04 | 早期数据冻结开始发布(文件名冻结日期例:20130415) |
| 2015-08-20 | 2015 年 8 月冻结发布(GRCh38,含多发性骨髓瘤等疾病 ChIP-seq) |
| 2016-09-08 | IHEC 布鲁塞尔大会发布项目最终成果(CRG 报道) |
| 2016-11-17 | IHEC 41 篇论文专辑于 Cell 等期刊同步发表;Chen et al. 人群多组学图谱同期见刊 |
| 2016-08-16 | 最终数据冻结(20160816,GRCh38),此后项目归档,数据经 EpiRR/IHEC 门户持续开放 |
| 2021 | 下游成果持续发表(例:Watt et al., Nature Communications,PU.1 与自身免疫病) |
§1.5 典型应用场景
- 免疫细胞类型分类器:以 6 种组蛋白修饰信号为输入,训练区分约 100 种造血细胞类型的深度模型,服务单细胞数据的类型注释与反卷积。
- GWAS 变异功能注释:用 H3K27ac/H3K4me1 增强子图谱为 345 个免疫疾病位点(Chen et al. 2016 已示范)及更广泛的自身免疫/心血管性状位点做细胞类型特异的机制解释。
- 白血病表观遗传分层:以正常细胞类型为参照,比较 AML、CLL、DLBCL 患者样本的甲基化与组蛋白修饰模式,研究疾病亚型与"细胞起源"识别。
- 染色质状态分割基准:将 BLUEPRINT 的多 mark ChIP-seq 作为 ChromHMM/Segway 类工具的输入,构建跨细胞类型一致的 12-15 状态分割。
- 基因组深度学习预训练:BigWig 信号轨迹可转化为模型回归目标(如 Enformer 风格的多任务预测),用于增强子活性预训练。
§2 医学背景
§2.1 疾病与术语映射
BLUEPRINT 覆盖的核心疾病标签与健康对照的编码映射如下:
| 标签 | ICD-11 | SNOMED CT | 术语 |
|---|---|---|---|
| 急性髓系白血病(AML) | 2A60 | 91861009 | Acute myeloid leukaemia |
| 慢性淋巴细胞白血病(CLL) | 2A80.4 | 428841006 | Chronic lymphocytic leukaemia of B-cell type |
| 弥漫性大 B 细胞淋巴瘤(DLBCL) | 2A81.0 | — | Diffuse large B-cell lymphoma |
| 多发性骨髓瘤 | 2A83.0 | 109989006 | Plasma cell myeloma |
| 1 型糖尿病(T1DM) | 5A10 | 46635009 | Type 1 diabetes mellitus |
| 健康造血/免疫细胞参考 | —(不适用) | — | Normal haematopoietic reference epigenome |
§2.2 造血与表观遗传学简介
造血系统是表观基因组研究的理想对象:一个造血干细胞通过谱系承诺分化为髓系(单核细胞/巨噬细胞、中性粒细胞、树突状细胞、红细胞、巨核细胞)与淋巴系(T、B、NK 细胞)等数十种功能细胞,分化全程由组蛋白修饰景观与 DNA 甲基化程序驱动,而细胞 DNA 序列几乎不变(BLUEPRINT 综述)。这带来两个研究抓手:其一,每种细胞类型拥有可识别的"表观指纹",使表观基因组能反推细胞身份——BLUEPRINT 用它识别血液肿瘤的起源细胞类型;其二,白血病普遍携带表观遗传调控因子突变(如 AML 中的 MLL 影响组蛋白修饰、DNMT3A 影响 DNA 甲基化、TET2 影响主动去甲基化),使疾病成为"表观基因组被改写"的自然实验(Haematologica 综述)。
流行病学层面,血液肿瘤是一组在全球范围内累及数以百万计患者的疾病家族(白血病、淋巴瘤、骨髓瘤等),而 1 型糖尿病等自身免疫病同样以免疫细胞为效应舞台——这正是 BLUEPRINT 同时纳入白血病与 T1DM 的医学逻辑(CORDIS)。需要说明:BLUEPRINT 本身是机制与资源型项目,不设疾病发病率统计任务;使用本数据集做疾病流行病学推断超出了其设计边界。
§2.2b BLUEPRINT 覆盖的造血细胞层级
BLUEPRINT 的细胞类型选择覆盖了造血分化的完整层级。以 2026 年一项基于 BLUEPRINT 数据的整合分析为参照,其共识细胞类型构成如下(bioRxiv 2026):
| 谱系 | 覆盖的细胞类型 | 数量 |
|---|---|---|
| T 细胞系 | 5 个亚型(初始/记忆/调节性等) | 5 |
| B 细胞系 | 6 个亚型(初始/生发中心/浆细胞样等) | 6 |
| NK 细胞 | 成熟 NK | 1 |
| 粒细胞系 | 成熟中性粒细胞及其 4 个前体状态 | 5 |
| 单核-巨噬系 | 单核细胞及 6 个单核分化细胞类型(巨噬/树突方向) | 7 |
| 基质与血管 | 间充质干细胞、内皮细胞类型 | 若干 |
| 前体与干性 | 造血干细胞与各系祖细胞 | 覆盖于上述多个层级 |
这棵"细胞类型树"对 AI 建模的直接意义:任务设计可以按谱系分组评估(同谱系内细分类 vs 跨谱系粗分类),也可以按分化深度分层(干/祖/成熟),从而把"细胞类型分类"细化为有生物学梯度的多粒度基准。
§2.3 临床任务定义
| 任务 | 定义 | 在本数据集中的形态 |
|---|---|---|
| 细胞类型识别 | 由分子特征判定细胞身份 | 表观指纹分类;疾病样本的起源细胞回溯 |
| 诊断分层 | 按分子特征细分疾病 | 白血病表观亚型识别与诊断标志物验证 |
| 预后/治疗响应 | 关联表观状态与临床演化 | CLL 临床演化预测专利方向;AML 表观药物治疗监测 |
| 靶点发现 | 寻找可干预的表观调控环节 | 表观遗传靶点鉴定与 epidrug 评估 |
| 变异功能解读 | 将非编码风险变异归因到调控元件 | 免疫疾病位点与增强子/转录因子结合共定位 |
§2.4 患者与供者人群
| 人群 | 来源 | 时间 | 年龄/性别 | 种族/地域 | 就医类型 |
|---|---|---|---|---|---|
| 200 名健康献血者队列(Chen 2016) | 英国地方献血者群体 | 项目中期 | 平均 55 岁;54% 女性 | 英国代表性人群 | 无偿献血(健康筛查合格) |
| 脐带血供者 | 产科协作 | 项目期内 | 新生儿脐血 | 欧洲各中心 | 产科采集 |
| 白血病患者(AML/CLL/DLBCL/骨髓瘤) | 欧洲血液病研究中心 | 项目期内 | 成人为主(儿童 ALL 另列) | 欧洲 12 国 | 血液科诊治样本 |
| T1DM 免疫细胞供者 | 欧洲糖尿病队列 | 项目期内 | 儿童青少年与成人 | 欧洲 | 内分泌/免疫门诊 |
§2.5 临床价值
BLUEPRINT 的临床价值沿三条路径兑现。第一,诊断:表观基因组反映细胞身份,使病理形态学难以判断的肿瘤起源可通过甲基化/组蛋白指纹判定,项目产出了经验证的诊断用表观标志物(CORDIS 最终报告)。第二,治疗:表观修饰可逆,使表观基因组成为药物靶点库——项目推进了 epidrug 相关的靶点鉴定与疗效评估,训练免疫的表观机制则为 sepsis 等疾病的免疫干预提供了新思路(EC 报道)。第三,风险预测:分子 QTL 与疾病位点共定位(345 个免疫疾病位点)为把遗传风险转化为机制假说、进而设计靶向干预提供了模板(Chen et al., 2016)。
§2.6 标注金标准
| 维度 | 内容 |
|---|---|
| 划分方式 | 无 ML 划分;按"细胞类型 × 疾病状态 × assay"组织,分冻结批次发布 |
| 标注方式 | 结构化元数据标注(IHEC 元数据标准 + 受控词表:Cell Type Ontology、EFO、Uberon) |
| 标注者 | 各生产中心实验室(样本采集/分选由血液学实验室完成);细胞纯度经 FACS/免疫细胞化学评估 |
| 性质 | IHEC 定义下的"参考表观基因组"体系:单一供者为一套,推荐至少 2 个生物学重复;复合表观基因组视作 1 个 |
§3 数据集规格
§3.0 版本抉择矩阵
BLUEPRINT 没有"v1/v2"式版本号,而以冻结批次与访问层级组织。选择建议:
| 你的需求 | 推荐版本 | 大小量级 | 理由 |
|---|---|---|---|
| 训练细胞分类/增强子模型 | 20160816 冻结(FTP 处理数据) | 数十 GB 起 | 最终最全批次,GRCh38,免申请直接下载 |
| 复现联盟论文原始分析 | 20160816 + 各 assay README | 数十 GB + 文档 | README 记录管线参数,与论文一致 |
| 呼叫级分析(重比对、变异) | EGA 原始数据(EGAS00001000326 等) | TB 级 | FASTQ/BAM 需 DAC 申请 |
| 跨联盟横向比较 | IHEC 门户 / DeepBlue / EpiRR | 按需 | 统一入口拉取 BLUEPRINT 与 ENCODE/Roadmap/DEEP |
§3.1 模态详情
| 模态 | 内容 | 分辨率 | 典型输出 |
|---|---|---|---|
| ChIP-seq | 6 种组蛋白修饰 + input(H3K4me1、H3K4me3、H3K27ac、H3K27me3、H3K36me3、H3K9me3) | 峰级(150-500 bp 修饰域) | 信号 BigWig;峰调用 BigBed |
| WGBS | 全基因组单碱基甲基化 | 单碱基(CpG) | 甲基化 call 信号 BigWig;高/低甲基化区域 BigBed |
| RNA-seq | polyA mRNA 转录定量 | 基因/转录本 | 定量 GTF;比对信号 BigWig |
| DNase-seq | 染色质开放性 | 热点级 | 热点 BigBed;信号 BigWig |
| WGS | 供者全基因组(人群队列) | 约 7×(Chen 2016 队列) | EGA 原始数据(受控) |
IHEC 最小参考表观基因组要求 WGBS 必做,且 6 种组蛋白修饰(含 input)必备,DNase/FAIRE 等开放性 assay 可选(IHEC 标准);BLUEPRINT 完整覆盖了该组合并在部分细胞类型上叠加额外标记。
各组蛋白修饰的调控语义(染色质状态分割的领域基础):
| 标记 | 调控语义 | 典型富集位置 |
|---|---|---|
| H3K4me3 | 活性启动子 | 转录起始位点(TSS)附近 |
| H3K4me1 | 增强子"预备"标记 | 潜在/增强子区域 |
| H3K27ac | 活性增强子与活性启动子 | 活跃调控元件 |
| H3K27me3 | Polycomb 复合体介导的抑制 | 发育调控基因位点 |
| H3K36me3 | 活跃转录的基因体 | 转录区 |
| H3K9me3 | 异染色质/重复序列抑制 | 着丝粒旁、转座子富集区 |
上述"标记-语义"组合正是 ChromHMM 类工具做 12-15 状态分割的先验输入,也是细胞类型分类器能够仅凭 6 通道信号区分约 100 种细胞类型的生物学原因。
§3.2 按子集的样本数
| 子集 | 规模(有来源者给具体数) | 来源 |
|---|---|---|
| 健康造血/免疫细胞类型 | 约 100 种(2,558 个实验的主体) | CORDIS 最终报告 |
| 人群变异队列(单核/中性粒/初始 T) | 200 名献血者(T 细胞覆盖 169/200) | Chen et al. 2016 |
| 中性粒/单核参考表观基因组 | 12 样本 ×(RNA-seq + 6 mark ChIP-seq + WGBS) | 联盟比较分析 |
| AML ChIP-seq | 38 样本(244 runs) | EGA EGAD00001002418 |
| ABC-DLBCL ChIP-seq | 3 样本 | EGA EGAD00001002307 |
| 多发性骨髓瘤 ChIP-seq | 2 样本 | EGA EGAD00001001592 |
| 中性粒细胞 WGBS | 3 样本(630.7 GB) | EGA EGAD00001002378 |
| 全部疾病 + 健康数据集 | 约 3,500 个数据集 | CORDIS 最终报告 |
§3.3 数据格式
| 数据类型 | 文件格式 | 示例文件名(官方命名规则) |
|---|---|---|
| RNA-seq 转录定量 | GTF | C0010K.…quantification.20130415.gtf |
| RNA-seq 比对信号 | BigWig | C0010K.…plus_strand_signal.20130415.bw |
| ChIP-seq 峰调用 | BigBed | C0010K.H3K4me1_peaks.…20160816.bb |
| ChIP-seq 比对信号 | BigWig | C002TWH1.H3K4me3.bwa_filtered.20130415.bw |
| DNase 热点 | BigBed | …Dnase_hotspots.….bb |
| DNase 信号 | BigWig | …Dnase_signal.….bw |
| WGBS 高/低甲基化区域 | BigBed | …hyper_methylated_regions.….bb / …hypo….bb |
| WGBS 甲基化信号 | BigWig | …methylation_call_signal.….bw |
命名规则为 sample_name.experiment.algorithm_or_pipeline_name.freeze_date.file_extension(官方数据说明)。
§3.4 存储大小
- 处理后数据(FTP,开放):按冻结批次发布,量级数十 GB;适合分析型工作站。
- EGA 原始数据(受控):TB 级。单个 WGBS BAM 可达 90-180 GB(EGA 数据集页)。
- 建议磁盘规划:仅分析处理数据预留 200 GB;含 2-3 个疾病 WGBS 原始子集预留 3-5 TB。
EGA 侧可查证的子集体量实例(均为 2016-08 冻结、GRCh38):
| EGA 数据集 | 子集 | 体量 |
|---|---|---|
| EGAD00001002378 | band form neutrophil WGBS(3 样本,40 文件) | 630.7 GB |
| EGAD00001002437 | conventional dendritic cell WGBS(2 样本) | 430.7 GB |
| EGAD00001002511 | germinal center B cell WGBS(3 样本) | 925.0 GB |
| EGAD00001002418 | AML ChIP-seq(38 样本,244 runs) | 单文件 0.4-3.2 GB(FASTQ.gz) |
| EGAD00001002307 | ABC-DLBCL ChIP-seq(3 样本) | 38.8 GB |
可见体量分布规律:WGBS 是存储大头(全基因组高覆盖 BAM),ChIP-seq/RNA-seq 相对轻量——规划下载顺序时应先 ChIP/RNA 后 WGBS,或仅对 WGBS 下载 methylation call 产物而非全 BAM。
§3.5 标注方式
标注为结构化元数据而非传统分类标签:每个样本携带 biosource(细胞来源)、disease state、assay、platform、analysis pipeline 等字段,词表遵循 IHEC 元数据标准与本体(Cell Type Ontology、EFO、Uberon),并录入 EpiRR 注册库与 IHEC 门户(CORDIS)。DeepBlue 等下游服务进一步把这些元数据索引为可程序化查询的字段(Albrecht et al., 2016)。
§3.6 标注者资质与一致性
样本质量由 IHEC 标准背书:正常表型须经宏观与微观确认,细胞纯度须超过 90%(以分选/免疫细胞化学评估),RNA 质量以 RIN 记录(细胞系 > 8,原代细胞 > 4),组蛋白修饰测序深度超过 2,000 万比对读段,WGBS 甲基化 C 覆盖约 30×(IHEC 标准);各 assay 优先配备至少 2 个生物学重复。多中心一致性由 cross-over 实验(同一样本跨中心平行测定)显式验证(Chen et al., 2016)。
§3.7 采集周期
2011-10 至 2016-09(项目全周期);数据分冻结批次持续发布,最终冻结 2016-08-16。
§3.8 地域覆盖
样本采集与测序分布于欧洲 12 国(荷兰牵头,英国、德国、西班牙、意大利、法国、瑞典、瑞士、比利时、丹麦、奥地利等),另有加拿大 McGill 大学(CEEHRC/Epigenomics Mapping Centre)承担人群队列的 T 细胞层测绘(EC 报道;Chen et al., 2016)。
§3.9 测序平台与设备
主力平台为 Illumina HiSeq 2000(EGA 记录的标准配置),另使用 HiSeq 2500 与 MiSeq(EGA 研究 EGAS00001000586)。ChIP-seq 深度约 ≥ 3,000 万读段/样本(人群队列),RNA-seq 约 8,000 万读段/样本(Chen et al., 2016)。
§3.10 深度溯源链
| 环节 | 载体 | 可引用标识 |
|---|---|---|
| 供者知情同意与采集 | 各生产中心 + 伦理批准 | 研究级(EGA Study) |
| 原始数据归档 | EGA(受控)或 ENA(开放样本) | EGAS/EGAD/ERP 编号 |
| 统一管线处理 | EBI(ChIP)、CRG(RNA)、CNAG(WGBS)等 | README_analysis 文档 |
| 冻结发布 | DCC / FTP | freeze_date(如 20160816) |
| 参考表观基因组注册 | EpiRR | 参考表观基因组 ID |
| 对外分发 | IHEC 门户 / DeepBlue / BDAP | 实验 ID + 受控词表术语 |
每一级都有稳定的访问批次可引用:任何论文级的数字都应能回溯到"EGA accession + freeze_date"二元组——这是 BLUEPRINT 溯源体系对 AI 数据治理最有价值的示范(CORDIS;EpiRR)。
§4 数据结构
§4.0 目录树
FTP 处理数据解压后的典型结构(示意,具体以各 release 目录索引文件为准):
blueprint/
├── releases/
│ ├── 20150820/ # 2015 年 8 月冻结(GRCh38)
│ └── 20160816/ # 最终冻结(GRCh38)
│ └── homo_sapiens/
│ ├── index* # 本冻结全量文件清单(文件级索引)
│ ├── README_chipseq_analysis_ebi_20160816
│ ├── README_rnaseq_analysis_crg_20160816
│ ├── README_bisulphite_analysis_CNAG_20160816
│ ├── C0010K/ # 以 sample_id 分目录
│ │ ├── C0010K.RNA-seq.quantification.20130415.gtf
│ │ ├── C0010K.H3K4me1.bwa_filtered.20160816.bw
│ │ ├── C0010K.H3K4me1_peaks.macs2.20160816.bb
│ │ ├── C0010K.Dnase.hotspots.20160816.bb
│ │ └── C0010K.WGBS.hyper_methylated_regions.20160816.bb
│ └── C002TWH1/
│ └── C002TWH1.H3K4me3.bwa_filtered.20130415.bw
├── metadata/ # 实验/样本元数据导出
└── reference/ # GENCODE 基因集、参考序列等
§4.1 DAIMS 字段字典
核心元数据字段(整合自 DCC/DeepBlue 元数据模型与 EGA 记录):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| sample_id | 文本 | 样本唯一标识,编码细胞类型与重复 | C0010K、C002TWH1 | 主键/分组键 | 无(官方 ID) | 无缺失 | 官方 ID 体系 |
| biosource | 受控词表 | 细胞来源(Cell Type Ontology 术语) | CD14-positive monocyte | 分类标签 | 术语映射差异 | 无缺失 | 本体词表 |
| disease_state | 受控词表 | 健康或疾病(含 AML/CLL/DLBCL 等) | normal、acute myeloid leukemia | 疾病分层标签 | 病理确认误差 | 无缺失 | IHEC 疾病词表 |
| assay_type | 受控词表 | 实验类型 | ChIP-seq、WGBS、RNA-seq | 模态路由 | 无 | 无缺失 | IHEC assay 词表 |
| epigenetic_mark | 受控词表 | 靶标(组蛋白修饰/甲基化) | H3K4me1、H3K27ac | 通道选择 | 抗体批次差异 | 无缺失 | Histome/ENCODE 词表 |
| donor_id | 文本 | 供者/患者标识 | 人群队列编号 | donor 级划分 | 无 | 部分历史样本不公开 | 官方 ID 体系 |
| genome_assembly | 枚举 | 参考基因组 | GRCh38(2015-2016 冻结) | 坐标系统一 | 无 | 无缺失 | hg19/GRCh37、GRCh38 |
| freeze_date | 日期 | 数据冻结批次 | 20160816 | 版本控制 | 无 | 无缺失 | 2013-2016 各冻结 |
| signal_track | 文件 | 信号轨迹(BigWig) | …bwa_filtered.20160816.bw | 回归目标 | 管线版本差异 | 无缺失 | FTP 文件集 |
| peak_call | 文件 | 峰区域(BigBed) | …H3K4me1_peaks…20160816.bb | 二值化区域特征 | 峰调用算法差异 | 无缺失 | FTP 文件集 |
| quantification | 文件 | 转录定量(GTF) | …quantification.20130415.gtf | 表达回归/聚类 | 定量算法差异 | 无缺失 | FTP 文件集 |
| cell_purity | 数值 | 分选纯度(IHEC 要求 > 90%) | 0.93 | 质量加权 | 流式测量误差 | 未报告者缺失 | 0-1 |
§4.2 标签分布
数据沿三个轴分布:谱系轴(HSC/祖细胞 → 髓系 → 淋巴系,含 T 细胞 5 个亚型、B 细胞 6 个亚型、NK、中性粒细胞及其 4 个前体、单核细胞及 6 个巨噬分化态等,共 31 个共识细胞类型曾用于下游整合——2026 整合分析);疾病轴(健康参考为主体,AML/CLL/DLBCL/骨髓瘤/T1DM 为疾病层);assay 轴(6 mark ChIP-seq + WGBS + RNA-seq + DNase 的完备程度随细胞类型而异:完整参考表观基因组 100+ 个,部分参考表观基因组 1,000+ 个——Beck & Ecker 评述)。
按 IHEC 完备性对"参考表观基因组"分级的结构:
| 层级 | 定义(IHEC) | BLUEPRINT 数量 | 对建模的含义 |
|---|---|---|---|
| 完整参考表观基因组 | 单供者、覆盖 IHEC 必做 assay 组合(WGBS + 6 mark ChIP-seq + RNA-seq) | 100+ | 可直接做多模态对齐与分割任务 |
| 部分参考表观基因组 | 覆盖部分 assay | 1,000+ | 需按可用性掩码构建任务(见 §4.5) |
| 人群多组学队列 | 200 供者 × 3 细胞 × 基因组/表观/转录三层 | 1 套(169-200 供者/层) | QTL 与变异功能研究专属 |
§4.3 关键统计
- 约 3,500 个数据集、2,558 个实验、2,500+ 分析产物(CORDIS)。
- 100+ 完整参考表观基因组、1,000+ 部分参考表观基因组(Beck & Ecker)。
- 人群队列:200 名献血者、3 种免疫细胞、约 7× WGS、约 8,000 万 RNA-seq 读段/样本、345 个疾病位点共定位(Chen et al., 2016)。
- 项目论文 280+ 篇,其中 80 篇发表于 Nature/Science/Cell 等高影响期刊(CORDIS/EC)。
§4.4 数据层级
Consortium(282510)
└── Study(EGA 研究,如 EGAS00001000326 ChIP-seq / EGAS00001000418 WGBS)
├── Experiment(sample × assay,共 2,558 个)
│ ├── Sample(供者 × 细胞类型,sample_id 唯一)
│ │ └── Donor(供者/患者;人群队列 200 人)
│ └── Analysis(峰调用/信号/定量,共 2,500+)
│ └── File(BigWig/BigBed/GTF,带 freeze_date)
§4.5 缺失值与信息性缺失
本数据集的"缺失"主要不是单元格空值,而是结构性缺失:(1) 部分细胞类型只有部分 assay(部分参考表观基因组);(2) 同一 sample 的某些 mark 因抗体/测序质量问题被撤下(元数据中保留实验记录);(3) 人群队列的 T 细胞层只覆盖 169/200 名供者(Chen et al., 2016);(4) 历史 sample 的部分字段(如分选纯度数值)未回填。建议在数据加载时以"该 sample 在 release 索引中的实际文件集合"为准构建可用性掩码,切勿按"每细胞类型应有一套完整 assay"的假设生成缺失值。
可用性掩码的最小实现:
import os, pandas as pd
def build_availability_mask(release_dir, sample_ids, marks):
"""以 release 目录实际文件为准,构建 sample x mark 可用性布尔表"""
rows = []
for sid in sample_ids:
sdir = os.path.join(release_dir, sid)
files = set(os.listdir(sdir)) if os.path.isdir(sdir) else set()
rows.append({"sample_id": sid, **{
mk: any(mk in f for f in files) for mk in marks}})
return pd.DataFrame(rows).set_index("sample_id")
# mask = build_availability_mask("data_root/blueprint/20160816/homo_sapiens",
# ["C0010K", "C002TWH1"],
# ["H3K4me1", "H3K4me3", "H3K27ac"])
# 训练前 dropna / 分组聚合均以 mask 为唯一事实来源
§5 数据划分与使用建议
§5.1 官方划分
无。BLUEPRINT 是资源型数据集,官方按冻结批次发布,不提供 train/val/test 划分。
§5.2 社区惯例划分
社区常见做法有三种:(1) 按染色体划分(如 chr1-8 训练、chr9-12 验证、其余测试),适合基因组信号回归任务,可近似控制邻近泄漏;(2) 按细胞类型划分(留出若干细胞类型做零样本/小样本评估),适合细胞类型分类与迁移研究;(3) 按冻结批次划分(20150820 训练、20160816 测试),天然模拟"新版本数据"的分布漂移。
三种方案的取舍对比:
| 方案 | 优点 | 主要风险 | 适用任务 |
|---|---|---|---|
| 按染色体 | 控制基因组邻近泄漏;划分可复现 | 染色体间存在大尺度共享结构 | 增强子回归、信号预测 |
| 按细胞类型 | 直接度量对未见细胞类型的泛化 | 训练分布变窄,指标偏保守 | 细胞类型分类、迁移学习 |
| 按冻结批次 | 模拟真实"新数据到货"场景 | 两批次样本构成不对等 | 数据集版本升级回归测试 |
| 按供者(推荐叠加) | 杜绝遗传背景泄漏 | 可用供者数有限(人群队列 200) | 一切涉及人群队列的任务 |
§5.3 划分策略与泄漏风险
本数据集特有的三大泄漏陷阱:
- 供者级泄漏:人群队列中同一供者最多提供 3 种细胞 × 多种 assay。若按"样本"随机划分,同一供者的单核细胞与中性粒细胞会分居训练/测试集,细胞类型分类任务会因共享供者遗传背景而虚高。必须按 donor_id 划分。
- 重复与后缀泄漏:sample_id 的后缀数字区分重复/批次(如 C0010K 体系),同一生物学样本的重复实验必须整体归入同一侧。
- 病例-对照泄漏:疾病分析中,患者样本与其"自体健康对照类型"(同一供者的正常细胞,若存在)必须同侧;跨任务预训练-微调场景下,预训练集与微调集也应按供者去重。
§5.4 交叉验证建议
分组 5 折交叉验证(group = donor_id),细胞类型分类任务按"供者内分层"(保持每折细胞类型比例);染色质状态分割任务在分组 CV 之上再按染色体分块,避免同一基因组区域的不同窗口分居两折。
§5.5 外部验证建议
以 NIH Roadmap 的血液相关表观基因组、ENCODE 的免疫细胞数据或 DEEP 联盟数据为外部队列;跨联盟比较时注意统一基因组版本(hg19 vs GRCh38 需 liftOver)与峰调用管线。IHEC 的 EpiAtlas 再处理工程为跨联盟协调提供了官方途径。
落地顺序建议:(1) 先在内部完成 donor 级 CV 并锁定模型与超参;(2) 将外部队列按同样的窗口/通道/标准化流程重处理(任何差异都可能被误读为"泛化差");(3) 报告内外部性能差距并按细胞类型分解——差距集中在单一谱系时通常是数据构成问题而非模型问题。
§6 AI 就绪指南
§6.0 云端快速启动
不想下载任何文件?DeepBlue Epigenomic Data Server 提供 BLUEPRINT 全部处理数据的程序化访问(XML-RPC/Python API),可在服务器端完成区域选择、过滤与聚合,仅回传结果(Albrecht et al., 2016):
# pip install deepblue # 官方 Python 客户端
import deepblue
# 匿名访问公开数据(含 BLUEPRINT 全部峰值/信号文件)
deepblue.info("user_key")
# 拉取 BLUEPRINT 单核细胞 H3K27ac 峰与启动子区域的交集计数
experiments = deepblue.list_experiments(
genome="GRCh38", epigenetic_mark="H3K27ac", project="BLUEPRINT",
biosource="CD14-positive monocyte")
# 后续可用 select_regions / intersection / aggregate 等命令在服务器端完成
§6.1 快速上手
以下代码假设你已通过 FTP 下载 20160816 冻结的一个子目录,目录结构为:
data_root/ # 你自己的数据根目录
└── blueprint/20160816/homo_sapiens/
└── C0010K/ # 官方按 sample_id 分目录
├── *.bw / *.bb / *.gtf # 官方原始文件
└── ...
最小可用子集建议:任选 2-3 个健康细胞类型目录(如 C0010K 单核细胞),只取 H3K4me3(启动子)与 H3K27ac(增强子)两种信号 BigWig —— 两个文件即可跑通"信号读取 → 窗口矩阵 → 分类"全流程。
# pip install pyBigWig pandas numpy
import pyBigWig, numpy as np
# data_root 与官方目录拼接:{data_root}/blueprint/20160816/homo_sapiens/{sample_id}/
DATA_ROOT = "data_root/blueprint/20160816/homo_sapiens"
def read_bw_windows(bw_path, chrom, start, end, win=1000):
"""把一个 BigWig 区间切成固定窗口矩阵(nan→0)"""
bw = pyBigWig.open(bw_path)
vals = bw.values(chrom, start, end) # 每碱基信号
n = (end - start) // win
mat = np.nan_to_num(np.array(vals[:n*win], dtype=np.float32)
.reshape(n, win).mean(axis=1))
bw.close()
return mat
sig = read_bw_windows(
f"{DATA_ROOT}/C0010K/C0010K.H3K4me3.bwa_filtered.20160816.bw",
"chr1", 1_000_000, 2_000_000)
print(sig.shape, sig.mean()) # (1000, …) 每窗口平均 H3K4me3 信号
§6.2 数据获取
| 层级 | 获取方式 | 大小 | 条件 |
|---|---|---|---|
| 处理数据(BigWig/BigBed/GTF) | FTP:ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/ |
按批次数十 GB 起 | 免申请,开放 |
| 原始 FASTQ/BAM | EGA 研究:EGAS00001000326(ChIP-seq)、EGAS00001000418(WGBS)等 | TB 级 | DAC 申请(blueprint-dac@ebi.ac.uk) |
| 元数据/索引 | DCC 门户 + 各 release 索引文件 | MB 级 | 免申请 |
| 程序化访问 | DeepBlue / IHEC 门户 / BDAP | 按需 | 免申请 |
# 1) 下载最终冻结的文件清单(先只下索引,确认所需 sample)
curl -O ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/20160816/homo_sapiens/index*
# 2) 按需下载某个 sample 目录(示例:单核细胞 C0010K)
wget -r -np -nH --cut-dirs=4 \
"ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/20160816/homo_sapiens/C0010K/"
# 3) 原始数据:在 EGA 数据集页提交申请 → DAC(blueprint-dac@ebi.ac.uk)审批
# 批准后用官方 pyega3 客户端下载:
pip install pyega3
pyega3 fetch EGAD00001002418 --credentials username:password
EGA 申请流程:在 EGA 数据集页注册账号 → 填写数据访问申请(说明研究目的、供者数据保护措施)→ 等待 BLUEPRINT DAC 审核 → 签署条款后获得下载权限。研究用申请通常获得批准,但须遵守供者同意书(不得尝试再识别供者)。
§6.3 预处理全流程
目标:把官方 BigWig/BigBed/GTF 转成训练友好的数值矩阵。格式转换依赖 UCSC Kent tools(bigWigToBigWig、bigBedToBed)或 pyBigWig/pyBigBed。
<details>
<summary>展开完整预处理脚本(约 45 行)</summary>
# 前提:pyBigWig、pandas;UCSC tools 在 PATH 中
import pyBigWig, numpy as np, pandas as pd, subprocess, os
DATA = "data_root/blueprint/20160816/homo_sapiens"
OUT = "work/blueprint_mat"
os.makedirs(OUT, exist_ok=True)
MARKS = ["H3K4me1", "H3K4me3", "H3K27ac", "H3K27me3", "H3K36me3", "H3K9me3"]
WIN, CHROM_LEN = 1000, {"chr1": 248956422} # 其余染色体同理(GRCh38 长度表)
def bigbed_to_bed(bb_path, bed_path):
"""坑点 2 相关:BigBed 不是表格格式,必须先转 BED"""
subprocess.run(["bigBedToBed", bb_path, bed_path], check=True)
return pd.read_csv(bed_path, sep="\t", header=None,
names=["chrom","start","end","name","score","strand",
"signalValue","pValue","qValue","peak"]) \
if os.path.getsize(bed_path) else None
def stack_marks(sample_dir, sample_id, chrom, start, end, win=1000):
"""一个 sample 的 6 通道窗口矩阵:cells x windows → (6, n_windows)"""
chans = []
for mk in MARKS:
bw = pyBigWig.open(f"{sample_dir}/{sample_id}.{mk}.bwa_filtered.20160816.bw")
v = np.nan_to_num(np.array(bw.values(chrom, start, end), dtype=np.float32))
bw.close()
chans.append(v.reshape(-1, win).mean(axis=1))
return np.stack(chans) # (6, n_windows)
def methylation_signal(sample_dir, sample_id, chrom, start, end, win=1000):
"""WGBS 信号 BigWig:值域近似 0-1(β 值);高/低甲基化区域另存 BigBed"""
bw = pyBigWig.open(f"{sample_dir}/{sample_id}.WGBS.methylation_call_signal.20160816.bw")
v = np.nan_to_num(np.array(bw.values(chrom, start, end), dtype=np.float32))
bw.close()
return v.reshape(-1, win).mean(axis=1)
def rna_quantification(sample_dir, sample_id):
"""GTF 定量 → gene × tpm 矩阵(按 GENCODE 基因 ID 对齐)"""
gtf = pd.read_csv(f"{sample_dir}/{sample_id}.RNA-seq.quantification.20130415.gtf",
sep="\t", comment="#", header=None,
names=["seqname","src","feat","start","end","score","strand","frame","attr"])
genes = gtf[gtf.feat == "gene"].attr.str.extract(r'gene_id "([^"]+)"')
genes["tpm"] = gtf[gtf.feat == "gene"].score.values
return genes.set_index(0).tpm
mat = stack_marks(f"{DATA}/C0010K", "C0010K", "chr1", 1_000_000, 100_000_000)
meth = methylation_signal(f"{DATA}/C0010K", "C0010K", "chr1", 1_000_000, 100_000_000)
np.save(f"{OUT}/C0010K_chr1.npy", np.vstack([mat, meth[None, :]])) # (7, n_windows)
</details>
要点:(1) 染色质分割任务可直接把 6 通道矩阵喂给 ChromHMM(bin = 200-1,000 bp);(2) 深度学习任务建议做 log1p 变换并按染色体长度滑窗;(3) 甲基化通道与组蛋白通道量纲不同(β 值 0-1 vs 信号浮点),须分别标准化。
§6.3b 下载后的快速质量自检
在投入训练前,先用 10 行代码判断下载的 BigWig 是否"值得用"——异常信号(全零、极端峰值、坐标错位)在这一步就能暴露:
import pyBigWig, numpy as np
def sanity_check_bw(path, chrom="chr1", n_probe=5):
"""探针式抽查:染色体头部/中部随机区间的信号统计"""
bw = pyBigWig.open(path)
assert bw.isBigWig(), f"不是合法 BigWig: {path}"
clen = bw.chroms()[chrom]
stats = []
for s in np.linspace(0, clen - 1_000_000, n_probe, dtype=int):
v = np.array(bw.values(chrom, int(s), int(s) + 100_000), dtype=np.float32)
stats.append((round(float(np.nanmean(v)), 4), round(float(np.nanmax(v)), 2)))
bw.close()
return stats # [(mean, max), ...] 全 0 或 max 异常 → 回查文件与版本
# print(sanity_check_bw("data_root/blueprint/20160816/homo_sapiens/"
# "C0010K/C0010K.H3K4me3.bwa_filtered.20160816.bw"))
建议把 sanity_check 纳入下载脚本的固定步骤:任一探针区间均值为 0(信号全空)或 max 高出同类样本 2 个数量级(疑似未归一/坏 track)时,先核对 freeze_date 与元数据再排查管线。
§6.4 PyTorch DataLoader
以下 Dataset 把"6 mark 信号 + 甲基化"7 通道窗口作为输入、细胞类型作为标签,实现一个可运行的细胞类型分类器训练入口。
<details>
<summary>展开完整 PyTorch 代码(约 55 行)</summary>
# pip install torch pyBigWig pandas
import torch, numpy as np, pandas as pd
from torch.utils.data import Dataset, DataLoader
# 目录注释:data_root 拼接关系
# {DATA_ROOT}/blueprint/20160816/homo_sapiens/{sample_id}/{file} ← 官方结构
# 预处理产物:{WORK}/blueprint_mat/{sample_id}_{chrom}.npy (7, n_windows)
DATA_ROOT = "data_root/blueprint/20160816/homo_sapiens"
WORK = "work/blueprint_mat"
WINDOW = 1000
CELL_TYPES = { # 标签表:从 release 元数据的 biosource 字段建立
"C0010K": 0, # classical monocyte(示例映射,实际以元数据为准)
"C002TWH1": 1, # 另一细胞类型
}
class BlueprintChromatin(Dataset):
"""最小可用子集:7 通道信号窗口 → 细胞类型分类"""
def __init__(self, sample_ids, chrom="chr1", transform=None):
self.mats, self.labels = [], []
for sid in sample_ids:
m = np.load(f"{WORK}/{sid}_{chrom}.npy") # (7, n_windows)
self.mats.append(torch.from_numpy(m.T)) # (n_windows, 7)
self.labels += [CELL_TYPES[sid]] * m.shape[1]
self.X = torch.cat(self.mats)
self.y = torch.tensor(self.labels)
self.transform = transform
def __len__(self):
return len(self.X)
def __getitem__(self, i):
x = self.X[i].float()
x = torch.log1p(x) # 信号对数压缩;甲基化 β 值 0-1 不受破坏
if self.transform:
x = self.transform(x)
return x, self.y[i]
class ChannelNoise:
"""安全增强:训练时对通道施加轻微高斯噪声"""
def __init__(self, sigma=0.02):
self.sigma = sigma
def __call__(self, x):
return x + torch.randn_like(x) * self.sigma
ds = BlueprintChromatin(["C0010K", "C002TWH1"], transform=ChannelNoise())
loader = DataLoader(ds, batch_size=256, shuffle=True, num_workers=2, pin_memory=True)
model = torch.nn.Sequential(
torch.nn.Linear(7, 64), torch.nn.ReLU(),
torch.nn.Linear(64, 32), torch.nn.ReLU(),
torch.nn.Linear(32, len(CELL_TYPES)))
opt = torch.optim.Adam(model.parameters(), lr=1e-3)
lossf = torch.nn.CrossEntropyLoss()
model.train()
for epoch in range(3):
for xb, yb in loader:
opt.zero_grad()
loss = lossf(model(xb), yb)
loss.backward(); opt.step()
print(f"epoch {epoch} loss {loss.item():.4f}")
</details>
§6.5 坑点 8 个
⚠️ 坑点 1:FTP 找不到 FASTQ 就以为数据缺失(分类:工程陷阱)
问题:BLUEPRINT 采用"处理后开放 + 原始受控"双层架构。FTP 上只有 BigWig/BigBed/GTF 处理数据,原始 FASTQ/BAM 全部在 EGA 受控访问,直接在 FTP 目录里找原始数据只会一无所获。
症状:在 release 目录遍历后得出"该样本没有测序数据"的错误结论;或从第三方镜像拿到无授权的原始数据链接后下载失败。
解决:
- 简单方法:先在 DCC/Ensembl 项目页用 experiment grid 查该 sample 的 raw data 归属(EGA 或 ENA),再决定走 DAC 申请还是直接下载。
- 进阶方法:向 blueprint-dac@ebi.ac.uk 提交 EGA 访问申请(附研究目的与数据保护声明),批准后用 pyega3 按数据集 accession 批量拉取。
- SOTA 方法:不需要呼叫级数据时,用 DeepBlue API 在服务器端完成区域级分析,完全绕开原始数据申请。
参考:官方数据访问说明;EGA 数据集页与 DAC 政策
⚠️ 坑点 2:把 BigBed 峰文件当 BED/narrowPeak 直接读(分类:工程陷阱)
问题:官方峰调用(ChIP-seq peaks、DNase hotspots、甲基化区域)发布为 UCSC BigBed 二进制格式,pandas/numpy 无法直接读取,且各 mark 的 BigBed 内部字段(signalValue/pValue/qValue/peak)顺序因分析管线而异。
症状:pd.read_csv读 BigBed 报二进制解析错误;或用错字段顺序把 pValue 当成信号强度。
解决:
- 简单方法:用 UCSC tools 转换——
bigBedToBed in.bb out.bed,再按 BED 通用列解析。- 进阶方法:Python 端用 pyBigBed 或先转 BED 后入 DuckDB/Parquet,统一 10 列 schema(chrom/start/end/name/score/strand/signalValue/pValue/qValue/peak)。
- SOTA 方法:批量任务改用 DeepBlue 的 region API,服务器端返回表格化区域,跳过本地格式转换。
参考:官方数据类型/格式表
⚠️ 坑点 3:把甲基化"高/低甲基化区域"当连续 β 值矩阵用(分类:标签理解)
问题:BLUEPRINT 的 WGBS 输出被拆成三个产物——methylation call 信号 BigWig(近似连续 β 值)+ hyper-methylated regions BigBed + hypo-methylated regions BigBed(离散区域)。很多使用者只下载两个 BigBed,得到的是"离散二值区域"而非连续甲基化水平。
症状:做甲基化回归/年龄预测时目标变量退化成 0/1 区域计数;病例-对照差分甲基化分析的分辨率从单碱基掉到区域级。
解决:
- 简单方法:回归任务改用 methylation call 信号 BigWig(0-1 值域),按 CpG 或窗口取样。
- 进阶方法:用
bigWigToWig/pyBigWig 抽取 CpG 位点级值,与 GENCODE 启动子/增强子注释对齐成 CpG × 样本矩阵。- SOTA 方法:区域与信号结合——BigBed 区域做特征选择掩码,BigWig 信号做回归目标,兼顾稀疏性与分辨率。
参考:官方 WGBS 数据类型说明
⚠️ 坑点 4:只看文件名猜疾病/细胞类型标签(分类:标签理解)
问题:文件名
C002TWH1.H3K4me3.bwa_filtered.20130415.bw只含 sample_id、mark、算法与冻结日期;疾病状态、供者性别年龄、供者 ID、分选方案等全部在元数据中,且细胞类型藏在 sample_id 编码里。
症状:把患者样本误当健康对照混入训练集;把同一细胞类型的不同重复当两个类;疾病亚型分析里标签噪声导致 AUC 掉 10 个点以上。
解决:
- 简单方法:下载 release 索引与元数据,用 sample_id 为主键 join 出 biosource/disease_state,再映射 ICD-11/SNOMED(见 §2.1)。
- 进阶方法:在数据加载层强制"元数据优先"——任何文件必须先通过 sample_id → 元数据校验,缺失元数据的样本进隔离目录人工核对。
- SOTA 方法:把 DeepBlue 受控词表(Cell Type Ontology/EFO 同义词层级)接入你的标签体系,自动把 biosource 归一化到标准术语及其父类。
参考:官方命名规则;DeepBlue 元数据模型
⚠️ 坑点 5:新旧冻结批次混用(分类:工程陷阱)
问题:同一 sample 的同一 assay 在不同冻结批次会重复出现(算法升级/重跑),文件名中 freeze_date 是唯一版本线索;混用批次会引入管线版本噪声。
症状:同一峰区间在两次实验中位置漂移;重复样本被当作独立生物学重复,统计功效虚高。
解决:
- 简单方法:全体实验锁定单一冻结(推荐 20160816),文件名按 freeze_date 过滤。
- 进阶方法:用 release 索引文件构建"sample × assay → 最新文件"映射表,任何下载脚本先查映射再抓文件。
- SOTA 方法:把映射表纳入 DVC/LakeFS 数据版本控制,冻结版本作为数据集版本号(对应 frontmatter version: 20160816)。
参考:官方 release 目录说明
⚠️ 坑点 6:忽视 7 个生产中心的批次效应(分类:偏倚陷阱)
问题:数据由 UCAM、EBI、WTSI、NCMLS、UCL、McGill、MPIMG 七个中心分工产生(assay × 细胞类型分配不同),中心效应与生物学效应纠缠;联盟自己在 Cell 论文中就为此设计了 cross-over 实验(同一样本跨中心平行测定)并应用严格质量过滤。
症状:细胞类型分类器学到的可能是"中心指纹"而非生物学信号;跨中心泛化时性能骤降。
解决:
- 简单方法:把 production centre 作为协变量加入回归/模型,或按中心分层划分验证集。
- 进阶方法:ComBat/顺序归一化校正信号分布后重训;对人群队列优先使用联盟提供的 cross-over 校正结论。
- SOTA 方法:域对抗训练(中心为域标签)或按 center-conditional 标准化,使表征对中心不变。
参考:Chen et al., Cell 2016(多中心设计与批次处理)
⚠️ 坑点 7:成人外周血与脐带血样本不加区分地合并(分类:偏倚陷阱)
问题:同一细胞类型的样本同时来自成人外周血与脐带血(EGA 研究标题明确"from adult and cord blood samples"),两类来源的细胞组成与表观状态存在系统差异(脐带血细胞更"年轻")。
症状:脐带血来源样本在降维图中形成独立聚簇,被误判为"新细胞类型";年龄相关甲基化信号被误读为疾病效应。
解决:
- 简单方法:从元数据提取样本来源字段,训练时加入 source 协变量或分层采样。
- 进阶方法:仅在同类来源内做病例-对照比较;跨来源比较时报告来源敏感性分析。
- SOTA 方法:把"来源"并入域自适应框架,学习来源不变表征后再做下游任务。
参考:EGA EGAD00001002418(adult and cord blood)
⚠️ 坑点 8:供者级信息在随机划分中泄漏(分类:数据泄漏)
问题:人群队列的每名供者最多贡献 3 种细胞类型 × 多种 assay(WGS/450K/RNA-seq/ChIP-seq),生物学重复与多 assay 同源。按样本随机划分会让同一供者的"遗传指纹"(WGS 检出的 QTL 效应)同时出现在训练与测试侧。
症状:细胞类型分类与分子 QTL 预测的指标虚高;论文评审阶段被发现同供者跨集而要求重做。
解决:
- 简单方法:以 donor_id 为分组键做 GroupKFold(见 §5.4)。
- 进阶方法:划分后做泄漏审计脚本——校验 train/test 的 donor、生物学重复与"同样本跨 assay"三重不相交。
- SOTA 方法:对必须跨任务迁移的场景(预训练→微调),建立供者级黑白名单数据库,任何新实验先过名单校验。
参考:Chen et al., Cell 2016(队列与重复设计);§5.3
§6.6 数据增强
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ 安全 | 通道高斯噪声(σ ≈ 0.01-0.05) | 模拟测序/免疫沉淀噪声,不改变峰位结构 |
| ✅ 安全 | 窗口随机裁剪(crop)与低速滑窗(jitter,≤ 窗宽) | 增强位置鲁棒性,须保持峰中心在窗内 |
| ✅ 安全 | 信号 log1p/分位数标准化 | 量纲统一,属预处理的一部分 |
| ✅ 安全 | 通道 dropout(随机屏蔽 1 个 mark) | 提高对缺失 assay 的鲁棒性(呼应 §4.5 结构性缺失) |
| ❌ 危险 | 水平翻转/反向互补 | 组蛋白信号无链方向问题(双链对称),但与链特异的 RNA-seq 通道混用时会破坏配对语义 |
| ❌ 危险 | 染色体间随机"平移拼接" | 跨真实调控边界拼接制造假增强子,标签随之失真 |
| ❌ 危险 | 对病例-对照差分任务做类别混叠增强 | 疾病标签语义脆弱,混叠会抹平亚型差异 |
§6.7 模型推荐
| 任务 | 推荐模型/工具 | 适配理由 |
|---|---|---|
| 染色质状态分割 | ChromHMM / Segway | 多 mark 组合的标准工具,BLUEPRINT 多 mark 设计天然适配 |
| 细胞类型分类 | 1D-CNN / Transformer over 6+1 通道 | 窗口级信号输入,样本量(约 100 类)适合监督训练 |
| 增强子/启动子回归 | Enformer 风格长序列模型 | BigWig 信号可作回归目标;BLUEPRINT 提供免疫细胞专属目标 |
| 甲基化回归/年龄 | 弹性网、CpG Transformer | WGBS 信号 BigWig 提供 0-1 连续目标 |
| 变异功能评分 | eFORGE + 深度模型集成 | 官方生态工具,直接吃 BLUEPRINT 表观信号做细胞类型特异归因 |
| 多组学整合 | MOFA+/totalVI 风格因子模型 | 同一样本多 assay 配对设计支持跨模态因子分解 |
§6.8 硬件需求
| 场景 | CPU | 内存 | GPU | 磁盘 |
|---|---|---|---|---|
| 单细胞类型探索(2-3 sample) | 4 核 | 16 GB | 无 | 100 GB |
| 全细胞类型矩阵构建 | 16 核 | 64 GB | 无 | 500 GB |
| 染色质分割全流程 | 16 核 | 64 GB | 无 | 1 TB |
| 深度学习训练(序列模型) | 32 核 | 128 GB | 1× A100 40GB(或等效) | 2 TB |
| 含 EGA 原始数据重处理 | 32 核 | 128 GB | 无 | 5 TB+ |
§6.9 评估指标
import numpy as np, torch
from sklearn.metrics import roc_auc_score, average_precision_score, f1_score
def eval_cell_classifier(model, loader, device="cuda"):
"""细胞类型分类:宏平均 AUROC/AUPRC + F1(类不平衡下 AUPRC 优先)"""
model.eval(); ys, ps = [], []
with torch.no_grad():
for xb, yb in loader:
p = torch.softmax(model(xb.to(device)), dim=1).cpu().numpy()
ys.append(yb.numpy()); ps.append(p)
y = np.concatenate(ys); p = np.concatenate(ps)
Y = np.eye(p.shape[1])[y] # one-hot
return {
"macro_auroc": roc_auc_score(Y, p, average="macro", multi_class="ovr"),
"macro_auprc": average_precision_score(Y, p, average="macro"),
"macro_f1": f1_score(y, p.argmax(1), average="macro"),
}
染色质分割任务另报告状态一致性(ChromHMM 内置 concordance)与每状态的精召;甲基化回归报告 CpG 级 RMSE/Pearson r。所有指标建议在 donor 级分组验证上计算(见 §5.4)。
§6.10 MLOps 笔记
- 数据版本:以冻结批次(20160816)作为数据集版本号贯穿实验跟踪;任何新实验在 MLflow/W&B run 中记录 freeze_date。
- 合规流水线:EGA 原始数据的下载与使用凭证(DAC 批准编号)须写入实验日志,满足供者同意条款审计。
- 重算幂等性:BigBed→BED、BigWig→矩阵的转换结果按
sample_id + assay + freeze_date + 哈希命名,保证重跑不污染。 - 血缘:元数据 join(sample_id → biosource/disease)单独成层,供下游模型审计标签来源。
- 漂移监控:把"新细胞类型/新批次加入"建模为数据漂移事件,触发特征分布监控告警。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 地域偏倚 | 样本以欧洲供者为主(人群队列来自英国献血者体系) | 中 | 跨联盟外推时引入 Roadmap/DEEP 数据;报告地域限制 |
| 中心/批次偏倚 | 7 中心分工生产,assay-中心部分纠缠 | 高 | cross-over 实验 + 协变量建模(坑点 6) |
| 来源混杂 | 成人外周血与脐带血并存 | 中 | 来源协变量/分层分析(坑点 7) |
| 细胞类型覆盖不均 | 100+ 类型中完整 vs 部分参考表观基因组并存 | 中 | 按 assay 可用性掩码构建任务 |
| 技术时代局限 | HiSeq 2000 时代读长/深度,无单细胞与长读数据 | 中 | 明确任务边界;需要单细胞粒度时另寻数据 |
| 疾病样本便利抽样 | 白血病样本来自特定欧洲研究队列,非流行病学抽样 | 中 | 不做发病率推断;仅作机制比较 |
§7.2 标注质量
标注质量由 IHEC 体系背书,关键阈值全部可查证:
| QC 维度 | IHEC 阈值/要求 | 对 AI 使用的影响 |
|---|---|---|
| 细胞纯度 | > 90%(分选/FACS 评估) | 低于阈值样本的信号含混合细胞污染,建模前应过滤或加权 |
| RNA 完整性 | RIN > 8(细胞系)/ > 4(原代细胞) | 原代血液样本 RIN 天然偏低,RNA-seq 定量比较需警惕降解差异 |
| ChIP-seq 深度 | > 2,000 万比对读段/mark | 深度不足的 mark 通道信噪比低,建议按深度分层评估 |
| WGBS 覆盖 | 约 30× 甲基化 C 覆盖 | 决定单碱基 β 值的置信度;低覆盖 CpG 应加 Binomial 过滤 |
| 生物学重复 | 优先 ≥ 2(IHEC 参考) | 单重复样本不宜做差异比较的主证据 |
元数据采用受控词表(Cell Type Ontology、EFO、Uberon)并录入 EpiRR,实现参考表观基因组级"护照"(IHEC 标准;CORDIS)。剩余风险在于历史样本的部分数值字段未回填(见 §4.5)。
§7.3 泛化性评估
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 非欧洲人群外推 | 中-高:等位基因频率与甲基化谱随人群差异 | 人群队列限于英国献血者(Chen 2016) |
| 单细胞粒度任务 | 高:bulk 表观基因组无法直接下放到单细胞 | 项目时代未含单细胞表观数据 |
| 新型测序平台数据 | 中:HiSeq 2000 时代系统偏差与新平台不同 | 平台记录(EGA) |
| 儿童血液肿瘤 | 高:成人与儿童白血病表观机制差异大 | 项目疾病样本以成人为主(儿童 ALL 为专项) |
| 跨联盟模型迁移 | 中:峰调用管线差异引入系统噪声 | IHEC 各联盟管线独立 |
§7.4 伦理与合规
供者样本均附知情同意;原始序列与基因型数据按"管理访问"存入 EGA,由 BLUEPRINT DAC(EGAC00001000135)向合格研究者审批发放,禁止再识别供者;处理后聚合数据按 Fort Lauderdale 原则与 IHEC 数据共享政策开放(EGA 政策;CORDIS)。IHEC 专辑同期发表了表观遗传数据隐私保护专论,项目在数据共享与隐私平衡上的实践具有政策参照价值。
§7.5 公平性
人群队列性别构成 54% 女性、平均年龄 55 岁(英国献血者结构);疾病样本的性别/年龄构成未统一披露。构建跨人群模型时,应把"欧洲中老年为主"的供者结构作为默认先验,并优先在非欧洲队列上做外部校准。
§7.6 数据漂移
数据冻结于 2016-08-16,此后无新样本注入——漂移风险不在数据侧而在任务侧:当今单细胞表观组学(scBS-seq、scATAC-seq 等)已把分辨率基准推高,bulk 参考图谱的角色从"主战场"转为"锚点/先验"。以 BLUEPRINT 预训练、单细胞数据微调的迁移范式是当前推荐用法。
§7.7 DAIMS 24 项自评
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 区域型数据非传统宽表;DeepBlue/BDAP 提供服务端聚合弥补 |
| 2 | 唯一标识 | ✅ | sample_id/experiment_id/EGA accession 三级标识完整 |
| 3 | 特殊字符 | ✅ | 官方命名规则严格(字母数字+点分隔) |
| 4 | 重复行 | ⚠️ | 同一样本跨冻结批次重复出现,须按 freeze_date 去重 |
| 5 | 缺失编码 | ❌ | 历史 sample 部分字段(纯度数值等)无统一缺失标记 |
| 6 | 标签标识 | ⚠️ | 疾病/细胞类型标签仅存元数据,文件名不含 |
| 7 | 罕见类分组 | ✅ | 稀有/超稀有细胞类型有专门低输入方案与工作包覆盖 |
| 8 | 偏倚评估 | ✅ | 多中心 cross-over 实验显式评估批次效应 |
| 9 | 数据字典 | ✅ | IHEC 元数据标准 + 各 assay README 文档 |
| 10 | 信息性缺失解释 | ⚠️ | assay 结构性缺失可从文件集合推断,但无官方说明文档 |
| 11 | 设备记录 | ✅ | 平台(HiSeq 2000/2500、MiSeq)与深度随 EGA/元数据记录 |
| 12 | 共线性 | ⚠️ | 多 assay/多标记高度相关,需用户自行处理协变量共线 |
| 13 | 编码映射 | ✅ | 受控词表挂接 Cell Type Ontology/EFO/Uberon |
| 14 | 时间戳处理 | ✅ | freeze_date 全局一致且入库即定 |
| 15 | 划分建议 | ⚠️ | 无官方划分;社区惯例存在但未标准化 |
| 16 | 泄漏讨论 | ✅ | 供者级/重复级泄漏结构清晰可审计(本 Wiki §5.3) |
| 17 | 标签分布 | ✅ | 细胞类型 × 疾病 × assay 分布可由索引文件完整还原 |
| 18 | 测量偏倚 | ⚠️ | QC 阈值统一(纯度/RIN/深度),但历史批次数值不齐 |
| 19 | 外部验证建议 | ⚠️ | 无内置外部队列;需自行接入 Roadmap/ENCODE/DEEP |
| 20 | 版本记录 | ✅ | 冻结批次体系 + release 索引 + EpiRR 护照 |
| 21 | 预处理脚本 | ✅ | 各 assay 管线参数以 README 公开(EBI/CNAG/CRG) |
| 22 | 合规要求 | ✅ | Fort Lauderdale + EGA DAC 双轨明确 |
| 23 | 多模态对齐 | ⚠️ | 参考表观基因组内多 assay 配对良好,跨样本对齐需自行构建 |
| 24 | 去标识化 | ✅ | EGA 管理访问 + 供者同意书双重保护 |
DAIMS 评分:18.5 / 24
评分解读:这是一个"结构纪律极佳、工程抽象偏弱"的资源型数据集——标识体系、版本体系、元数据词表与合规架构达到联盟级标杆(11 项全过),失分集中在面向机器学习的便利层:无官方划分、无宽表抽象、历史字段缺失标记不统一。这些问题全部可以通过本 Wiki §6.3 的预处理层解决,而非数据本身的缺陷。
对你意味着什么:(1) 若你的任务是细胞类型分类或增强子回归,直接用 20160816 冻结 + 本 Wiki 的预处理脚本,可在 1 天内得到训练就绪矩阵;(2) 若需要疾病-对照比较,务必先补齐元数据 join(坑点 4)再做任何建模;(3) 若需要呼叫级或单样本重处理,预留 EGA 申请周期,并把 DAC 批准纳入项目时间线;(4) 若追求开箱即用的宽表体验,优先走 DeepBlue API 而非本地自建。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| McGill T 细胞层(人群队列) | McGill EMC(CEEHRC) | 跨中心一致性 | cross-over 平行测定一致性 | 与主中心无显著系统差 | 三样品跨中心复测证明中心效应可控(Chen et al., 2016, Cell) |
| 345 个免疫疾病 GWAS 位点 | 国际 GWAS 目录 | 分子 QTL 共定位 | 共定位位点数 | — | 多层分子性状 QTL 与 7 种自身免疫病位点共定位(Chen et al., 2016, Cell. DOI: 10.1016/j.cell.2016.10.026) |
| 自身免疫病增强子 | BLUEPRINT 中性粒数据 + Nat Commun 评审 | PU.1 结合扰动与增强子环 | 遗传关联验证 | — | 中性粒增强子上 PU.1 结合/染色质环的遗传扰动与自身免疫病相关(Watt et al., 2021, Nat Commun 12:2298) |
| ENCODE/Roadmap 信号 | 跨联盟 | 细胞类型特异信号识别(eFORGE) | 富集显著性 | — | eFORGE 以 BLUEPRINT 信号为参照成功识别实验数据的细胞类型特异甲基化信号(Breeze et al., 2016, Cell Rep. DOI: 10.1016/j.celrep.2016.10.059) |
| 31 种造血细胞类型整合 | 2026 整合分析(bioRxiv) | 跨细胞类型染色质状态统一分割 | 12 状态 ChromHMM 模型 | — | 基于 BLUEPRINT 的 107 个表观基因组图谱支撑 1,100 个增强子-性状关联(bioRxiv 2026.06.02.728745) |
§8 基准性能与生态
§8.1 排行榜与代表性结果
BLUEPRINT 是资源型数据集,没有官方竞赛排行榜。领域内以"论文级定量结果"为基准载体:
| 排名 | 模型/研究 | 任务与性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Chen et al. 人群多组学图谱 | 三细胞多组学 QTL 图谱;345 个免疫疾病位点共定位 | 2016 | WGS+ChIP-seq+WGBS/450K+RNA-seq 联合 QTL/AS 分析 | Chen L. et al., Cell 167(5):1398-1414.e24, 2016. DOI: 10.1016/j.cell.2016.10.026 | 未随文发布统一基准代码 |
| 2 | BLUEPRINT 参考表观基因组体系 | 100+ 完整参考表观基因组 | 2016 | IHEC 标准化管线 + EpiRR 注册 | Adams D. et al., Nat Biotechnol 30(3):224-226, 2012. DOI: 10.1038/nbt.2153(项目宣言) | 官方管线文档(README) |
| 3 | Watt et al. PU.1 增强子研究 | 中性粒增强子遗传扰动-自身免疫关联 | 2021 | ChIP/Capture 相关遗传扰动分析 | Watt S. et al., Nat Commun 12:2298, 2021 | — |
| 4 | DeepBlue 数据服务 | 33,061 数据集统一 API | 2016 | XML-RPC 服务器端区域运算 | Albrecht F. et al., NAR 44(W1):W581-W586, 2016. DOI: 10.1093/nar/gkw211 | 官方客户端(Python/R) |
| 5 | BDAP/EPICO 门户 | 造血表观基因组比较分析门户 | 2016 | EPICO 网络框架 | Fernández J.M. et al., Cell Systems 3(6), 2016 | GitHub: inab/epico-data-analysis-portal |
数值不可直接比较的原因:各行任务、目标与统计口径完全不同(QTL 共定位 vs 资源规模 vs 关联验证),且 BLUEPRINT 无固定测试集;任何"性能比较"须在自建固定划分上重跑。
§8.2 SOTA 总结与选型建议
- 做免疫细胞变异数据功能注释:选 Chen 2016 图谱思路 + eFORGE,BLUEPRINT 信号作参照系——这是把 GWAS 位点翻译成"哪种细胞类型的哪个增强子"的标准路径。
- 做染色质状态与增强子标注:ChromHMM 全细胞类型统一分割仍是可复现基线;深度模型(Enformer 风格)适合作为有监督升级,其多任务输出可直接对齐 6 mark 通道。
- 做疾病表观遗传学:以健康细胞类型为锚,AML/CLL/DLBCL 患者数据做差分与起源回溯,参照联盟"细胞起源识别"范式——表观指纹比对常能修正形态学误判。
- 做预训练语料:BLUEPRINT 的免疫细胞覆盖是对 ENCODE 细胞系偏向的补集,与 Roadmap 组合使用效果最佳;序列模型预训练建议以 H3K27ac + H3K4me3 双通道为首要目标。
- 做方法学基准(如新的峰调用/插补算法):利用"同一样本多 assay"配对结构构造自监督任务(用一个 mark 预测另一个),这是 BLUEPRINT 相对单 assay 数据集独有的便利。
§8.3 评测协议
推荐协议:(1) 数据锁定 20160816 冻结;(2) donor 级 GroupKFold(5 折);(3) 指标:分类用宏 AUROC/AUPRC/F1,回归用 Pearson r + RMSE,分割用状态 concordance;(4) 报告每细胞类型分层指标;(5) 外部校准集固定为 Roadmap 血液表观基因组(统一 liftOver 到 GRCh38)。所有协议要点应随论文发布以保证可复现。
§8.4 相关数据集
| 数据集 | 机构 | 与 BLUEPRINT 的关系 | 互补性 |
|---|---|---|---|
| NIH Roadmap Epigenomics | NIH 路线图联盟 | 同为 IHEC 成员 | 多组织覆盖,血液亚型粒度较粗 |
| ENCODE | NHGRI ENCODE | 同为 IHEC 数据贡献方 | 细胞系为主 + 转录因子 ChIP 深度更大 |
| DEEP | 德国 BMBF | IHEC 德国计划 | 多组织表观基因组,管线同源 |
| CEEHRC/加拿大 IHEC | 加拿大 | BLUEPRINT 人群队列合作方 | T 细胞层测绘(McGill) |
| IHEC EpiAtlas | IHEC | 跨联盟再处理 | 统一重处理与元数据协调的"新版本"视角 |
§8.5 关键论文 Top 8
- Adams D. et al. BLUEPRINT to decode the epigenetic signature written in blood. Nature Biotechnology 30(3):224-226, 2012. DOI: 10.1038/nbt.2153 — 项目宣言:目标、范围与 IHEC 定位。引用 411+(Google Scholar,截至 2026-09)。
- Martens J.H.A. & Stunnenberg H.G. BLUEPRINT: mapping human blood cell epigenomes. Haematologica, 2013. DOI: 10.3324/haematol.2013.094243 — 技术蓝图:细胞类型清单、assay 组合与疾病计划。
- Chen L. et al. Genetic drivers of epigenetic and transcriptional variation in human immune cells. Cell 167(5):1398-1414.e24, 2016. DOI: 10.1016/j.cell.2016.10.026 — 200 人三细胞多组学变异图谱;345 个免疫疾病位点。引用 794+(截至 2026-09)。
- Albrecht F., List M., Bock C., Lengauer T. DeepBlue epigenomic data server. Nucleic Acids Research 44(W1):W581-W586, 2016. DOI: 10.1093/nar/gkw211 — BLUEPRINT 数据的程序化访问中枢。
- Fernández J.M. et al. EPICO platform / The BLUEPRINT Data Analysis Portal. Cell Systems 3(6), 2016 — 造血表观基因组比较分析门户与参考网络框架。
- Breeze C.E. et al. eFORGE: a tool for identifying cell type-specific signal in epigenomic data. Cell Reports 17, 2016. DOI: 10.1016/j.celrep.2016.10.059 — 以 BLUEPRINT 数据为参照的细胞类型特异信号归因工具。
- Farlik M. et al. DNA methylation dynamics of human hematopoietic stem cell differentiation. Cell Stem Cell 19, 2016 — 造血干细胞分化甲基化动态(IHEC 专辑成员工作)。
- Watt S. et al. Genetic perturbation of PU.1 binding and chromatin looping at neutrophil enhancers associates with autoimmune disease. Nature Communications 12:2298, 2021 — BLUEPRINT 中性粒数据的遗传扰动成果。
§8.6 社区活跃度
项目层面 280+ 篇论文(CORDIS);宣言论文与人群图谱论文分别累计 411+ 与 794+ 引用(Google Scholar,截至 2026-09)——后者至今仍是免疫多组学 QTL 研究的必引文献。数据门户(EpiRR、IHEC 门户、DeepBlue)在项目结束后仍在维护并持续被跨联盟工具(eFORGE、EpiAtlas)依赖;EGA 的 BLUEPRINT 数据集页仍按需接受访问申请。社区讨论集中于 IHEC 门户与 DeepBlue 用户渠道,GitHub 生态以 inab(CNIO/INB)组织的 EPICO 系列仓库为主。
活跃度的三个时间层次:
| 时期 | 活跃形态 | 现状 |
|---|---|---|
| 2011-2016(项目期) | 数据生产 + 280+ 论文 + IHEC 专辑 | 已收官,最终冻结 20160816 |
| 2016-2021(消化期) | 下游再分析(Watt 2021 PU.1、eFORGE、单细胞衔接研究) | 持续发表 |
| 2020 年代至今(整合期) | IHEC EpiAtlas 重处理、2026 年 31 类型整合分析 | 资源仍被当作免疫表观基座引用 |
判断一个"冻结"联盟资源是否仍然可信:BLUEPRINT 的答案是——数据不再新增,但元数据标准(IHEC)、注册体系(EpiRR)与程序化入口(DeepBlue)让其保持机器可读,这正是它比许多"一次性发布"数据集更长寿的原因。
§8.7 生态快照
| 资源 | 类型 | 链接 | 维护方 | 推荐理由 |
|---|---|---|---|---|
| BLUEPRINT DCC | 数据门户 | http://dcc.blueprint-epigenome.eu/ | 联盟(Radboud/EBI) | 官方主入口:实验网格 + 元数据 |
| 处理数据 FTP | 数据分发 | ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/ | EMBL-EBI | 免申请下载全部处理数据 |
| DeepBlue | 程序化 API | http://deepblue.mpi-inf.mpg.de/ | MPI-INF/CeMM | 服务器端区域运算,跨联盟检索 |
| EpiRR | 注册库 | http://www.ebi.ac.uk/vg/epirr | EMBL-EBI | 参考表观基因组"护照"与状态追踪 |
| IHEC Data Portal | 联合门户 | http://epigenomesportal.ca/ihec/ | IHEC | 跨联盟统一浏览与下载 |
| BDAP (EPICO) | 分析门户 | http://blueprint-data.bsc.es/ | BSC/CNIO/INB | 网页端比较分析,无代码探索 |
| eFORGE | 工具 | Cell Reports 2016(见 §8.5) | UCL/EBI 团队 | 变异/实验信号归因到 BLUEPRINT 细胞类型 |
| UCSC/Ensembl Track Hubs | 浏览器轨道 | 见 Ensembl 项目页 | 联盟 | 基因组浏览器直接叠加 BLUEPRINT 轨道 |
§9 相关资源与引用
§9.1 官方资源清单
- 项目主页与宣言论文:Nature Biotechnology 2012
- 最终报告摘要(CORDIS):Final Report Summary
- 项目数据说明(Ensembl 托管):Data Reuse & Access
- 处理数据 FTP:
ftp://ftp.ebi.ac.uk/pub/databases/blueprint/releases/(各冻结批次 + README 管线文档) - EGA 访问申请:数据集页提交,DAC 邮箱 blueprint-dac@ebi.ac.uk
- IHEC 参考表观基因组标准:Reference Epigenome Standards
- EC 专题报道(成果与转化):BLUEPRINT for research success
§9.2 BibTeX 完整引用
@article{Adams2012BLUEPRINT,
author = {Adams, David and Altucci, Lucia and Antonarakis, Stylianos E. and
Ballesteros, Juan and Beck, Stephan and Bird, Adrian and Bock, Christoph and
Stunnenberg, Hendrik G. and {BLUEPRINT Consortium}},
title = {BLUEPRINT to decode the epigenetic signature written in blood},
journal = {Nature Biotechnology},
year = {2012},
volume = {30},
number = {3},
pages = {224--226},
doi = {10.1038/nbt.2153}
}
@article{Martens2013BLUEPRINT,
author = {Martens, Joost H. A. and Stunnenberg, Hendrik G.},
title = {BLUEPRINT: mapping human blood cell epigenomes},
journal = {Haematologica},
year = {2013},
doi = {10.3324/haematol.2013.094243}
}
@article{Chen2016GeneticDrivers,
author = {Chen, Lu and Ge, Bing and Casale, Francesco Paolo and Vasquez, Louella and
Kwan, Tony and Garrido-Mart{\'i}n, Diego and Pastinen, Tomi and Soranzo, Nicole and
others},
title = {Genetic Drivers of Epigenetic and Transcriptional Variation in Human Immune Cells},
journal = {Cell},
year = {2016},
volume = {167},
number = {5},
pages = {1398--1414.e24},
doi = {10.1016/j.cell.2016.10.026}
}
@article{Albrecht2016DeepBlue,
author = {Albrecht, Felipe and List, Markus and Bock, Christoph and Lengauer, Thomas},
title = {DeepBlue epigenomic data server: programmatic data retrieval and analysis
of epigenome region sets},
journal = {Nucleic Acids Research},
year = {2016},
volume = {44},
number = {W1},
pages = {W581--W586},
doi = {10.1093/nar/gkw211}
}
@article{Fernandez2016EPICO,
author = {Fern{\'a}ndez, Jos{\'e} Mar{\'i}a and de la Torre, V{\'i}ctor and Richardson, Daniel and
Rico, Daniel and {BLUEPRINT consortium}},
title = {EPICO platform: a reference cyber-infrastructure for comparative epigenomics.
The BLUEPRINT Data Analysis Portal as a practical case},
journal = {Cell Systems},
year = {2016},
volume = {3},
doi = {10.1016/j.cels.2016.10.019}
}
@article{Breeze2016eFORGE,
author = {Breeze, Charles E. and Paul, Dirk S. and van Dongen, Jenny and Butcher, Lee M. and
Rakyan, Vardhman K. and Beck, Stephan and others},
title = {eFORGE: a tool for identifying cell type-specific signal in epigenomic data},
journal = {Cell Reports},
year = {2016},
volume = {17},
doi = {10.1016/j.celrep.2016.10.059}
}
@article{Watt2021PU1,
author = {Watt, Stephen and Vasquez, Louella and Walter, Klaudia and Mann, Alice L. and
Javierre, Bernardo M. and Spivakov, Mikhail and Soranzo, Nicole and others},
title = {Genetic perturbation of {PU.1} binding and chromatin looping at neutrophil
enhancers associates with autoimmune disease},
journal = {Nature Communications},
year = {2021},
volume = {12},
pages = {2298},
doi = {10.1038/s41467-021-22550-7}
}
§9.3 引用指南
使用本数据集时:(1) 引项目宣言 Adams et al. 2012 作为资源出处;(2) 使用人群队列数据必须引 Chen et al. 2016;(3) 经 DeepBlue/BDAP 获取的数据引对应工具论文;(4) 尊重 Fort Lauderdale 原则——允许数据自由研究,但全局性首发分析留给数据产出方,并按 EGA 条款处理受控数据。
最小引用组合速查:
| 你用了什么 | 必引条目 |
|---|---|
| 任何 BLUEPRINT 数据 | Adams et al. 2012(Nat Biotechnol) |
| 200 人人群队列 / QTL 结果 | Chen et al. 2016(Cell) |
| 经 DeepBlue 获取 | Albrecht et al. 2016(NAR) |
| 经 BDAP 分析 | Fernández et al. 2016(Cell Systems) |
| 细胞类型特异信号归因 | Breeze et al. 2016(Cell Reports,eFORGE) |
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 版本 |
|---|---|---|
| 大语言模型(千方病案写作 Agent) | 资料整合、初稿撰写、代码示例生成 | fast-model(2026-09) |
§10.2 AI 参与范围
AI 参与了:检索结果的整合与去重、章节结构组织、正文与代码示例撰写、DAIMS 自评初稿。AI 未参与:事实的最终裁定(全部规模数字与日期以检索来源为准)、医学与数据工程审核、最终发布决定。
§10.3 输入来源列表
- Adams D. et al. BLUEPRINT to decode the epigenetic signature written in blood. Nat Biotechnol 30(3):224-226, 2012. DOI: 10.1038/nbt.2153
- Martens J.H.A. & Stunnenberg H.G. BLUEPRINT: mapping human blood cell epigenomes. Haematologica, 2013. DOI: 10.3324/haematol.2013.094243
- Chen L. et al. Genetic drivers of epigenetic and transcriptional variation in human immune cells. Cell 167(5):1398-1414.e24, 2016. DOI: 10.1016/j.cell.2016.10.026
- Albrecht F. et al. DeepBlue epigenomic data server. NAR 44(W1):W581-W586, 2016. DOI: 10.1093/nar/gkw211
- Fernández J.M. et al. EPICO platform / The BLUEPRINT Data Analysis Portal. Cell Systems 3(6), 2016
- Breeze C.E. et al. eFORGE. Cell Reports 17, 2016. DOI: 10.1016/j.celrep.2016.10.059
- Watt S. et al. Nat Commun 12:2298, 2021
- BLUEPRINT CORDIS Final Report Summary(项目 282510). https://cordis.europa.eu/project/id/282510/reporting
- European Commission. BLUEPRINT for research success in blood disease therapy. https://ec.europa.eu/research/infocentre/article_en.cfm?artid=45436
- Ensembl Projects. BLUEPRINT Data Reuse & Access. https://projects.ensembl.org/blueprint
- EGA. BLUEPRINT release datasets(EGAD00001002418 等). https://www.ebi.ac.uk/ega/datasets/EGAD00001002418
- EGA. EGAD00001002378(中性粒细胞 WGBS). https://ega-archive.org/datasets/EGAD00001002378
- EGA. EGAS00001000586(人类变异工作包). https://ega-archive.org/studies/EGAS00001000586
- IHEC. Reference Epigenome Standards. https://ihec-epigenomes.org/index.php/research/reference-epigenome-standards
- Genomics & Informatics. Perspectives of IHEC(IHEC 量化 QC 标准). https://www.genominfo.org/journal/view.php?number=82&viewtype=pubreader
- Ecker S. & Beck S. Epigenetic variation taking center stage in immunological research(UCL Discovery). https://discovery.ucl.ac.uk/1546904/1/Beck_opinion_epigenetics_accepted.pdf
- CRG. ‘Blueprint’ study of epigenetics of blood cells(IHEC 大会报道). http://www.crg.cat/en/node/16454
- bioRxiv 2026.06.02.728745(107 表观基因组整合分析). https://www.biorxiv.org/content/10.64898/2026.06.02.728745v1.full
- Google Scholar 引用统计(nbt.2153:411+;Cell 2016:794+,截至 2026-09)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 事实字段 | 千方病案医学编辑部 | 对照 FACTS.md 逐项核对 | ✅ 已通过 |
| §2 医学背景与术语映射 | 千方病案医学编辑部 | ICD-11/SNOMED 码人工复核 | ✅ 已通过 |
| §4 DAIMS 字典与 §5 划分策略 | 千方病案医学编辑部(数据工程) | 对照官方文档与 EGA 记录 | ✅ 已通过 |
| §6 代码示例 | 千方病案医学编辑部(数据工程) | 语法审查 + 依赖清单核对 | ✅ 已通过 |
| §7-§8 质量与生态章节 | 千方病案医学编辑部 | 引用链接与数字溯源 | ✅ 已通过 |
| 三段免责与合规声明 | 千方病案医学编辑部 | 与金标准文本逐字比对(第三段按数据集定制) | ✅ 已通过 |
§10.5 AI 生成章节标注
全篇正文由 AI 起草;§2.1 编码映射、§3.2 样本数表、§7.7 DAIMS 评分与 §7.8 外部验证矩阵为 AI 初稿 + 人工复核修订;三段免责声明使用平台固定文本(第三段按本数据集访问模式定制后人工确认)。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
