ENCODE

ENCODE — DNA 元素百科全书 AI-Ready Wikipedia | 千方病案医数集

来源 ENCODE Project Consortium (NHGRI/NIH) https://www.encodeproject.org发布时间: 2026-08-04最后更新: 2026-08-04 阅读 2

信息速览

数据集名称ENCODE
数据类型23,000+ 功能基因组学实验, 2,373,014 人类 cCRE, 1.3 PB 数据总量
规模人类与小鼠基因组
接入方式ENCODE Project Consortium (NHGRI/NIH) https://www.encodeproject.org
AI 就绪度

INFOBOX

数据集名称 ENCODE
英文全称 Encyclopedia of DNA Elements
别名 / 简称 ENCODE、ENCODE Project、ENC、人类基因组功能元件百科
疾病分类 全基因组调控元件注释,跨疾病应用。核心映射:4A00–4A0Z 染色体异常 / 20 遗传性发育障碍 / 多疾病 GWAS 非编码变异关联
SNOMED CT 718360006 基因组注释 / 76476002 遗传信息 / 27710007 基因组 DNA / 410606002 染色质免疫沉淀
数据模态 多组学高通量测序:ChIP-seq / RNA-seq / DNase-seq / ATAC-seq / Hi-C / WGBS / eCLIP / STARR-seq / MPRA / CRISPR screens
物种覆盖 人类(Homo sapiens, GRCh38)+ 小鼠(Mus musculus, mm10)
数据规模 23,330+ 功能基因组学实验;800+ 功能表征实验;60,000+ 整合计算分析;>1.3 PB
cCRE 注册库 2,373,014 人类(覆盖 21% 基因组)+ 926,843 小鼠(覆盖 9% 基因组)
版本 ENCODE Pilot (2003-2007) → ENCODE2 (2007-2012) → ENCODE3 (2012-2020) → ENCODE4 (2017-2022)
访问方式 ENCODE Portal(Web)/ REST API / AWS S3(Registry of Open Data)/ UCSC Track Hubs
许可证 CC BY 4.0(完全开放,学术与商业均可免费使用)
DUO 标签 DUO:0000004 无限制使用(open access)
数据来源 NHGRI/NIH 资助,全球 ENCODE 联盟实验室生成,DCC(Stanford)统一处理
官方 DOI 10.1038/s41586-020-2493-4(ENCODE3,Nature 2020)
AI 就绪度 DAIMS 评分 23/24(详见 §7.7)
核心论文 Nature 2007 / Nature 2012 (30 篇) / Nature 2020 (15 篇) / Nature 2026 / Nat Commun 2025 / Nat Methods 2024
HuggingFace 暂无官方镜像
引用次数 Nature 2012 主论文 15,000+(Google Scholar,截至 2026-07)

§0 E-E-A-T 信任声明与免责声明

权威来源溯源

本条目内容基于以下权威来源,均为同行评审论文或官方文档:

序号 来源 类型 关键贡献
1 ENCODE Project Consortium. Nature 489:57-74, 2012 同行评审论文 ENCODE2 整合百科全书,30 篇配套论文
2 ENCODE Project Consortium. Nature 583:699-710, 2020 同行评审论文 ENCODE3 扩展百科全书,926,535 人类 cCRE 注册库
3 Moore JE et al. Nature (2026) 同行评审论文 ENCODE4 扩展 cCRE 注册库,2.37M 人类 cCRE
4 Kagda MS et al. Nat Commun 16:9592, 2025 同行评审论文 ENCODE Portal 数据导航最新更新
5 Yao D et al. Nat Methods 21:723-734, 2024 同行评审论文 ENCODE4 非编码 CRISPRi 筛选多中心整合分析
6 Avsec Ž et al. Nat Methods 18:1196-1203, 2021 同行评审论文 Enformer 序列模型,基于 ENCODE 数据训练
7 Kelley DR et al. Genome Res 28:739-750, 2018 同行评审论文 Basenji 跨染色体调控活性预测
8 Luo Y et al. Nucleic Acids Res 48:D884-D893, 2020 同行评审论文 ENCODE Portal 新功能更新

审核声明

本条目由 [千方病案医学编辑部] 交叉审核:基因组学数据资源准确性 + AI 工程实践可行性 + 国际数据标准合规性。

免责声明

  1. 非临床诊断工具:ENCODE 提供基因组功能元件注释与多组学数据,不构成临床诊断依据。GWAS 变异注释结果需结合实验验证。
  2. 数据时效性:ENCODE4 于 2022 年 12 月完成数据生产,后续整合分析持续至 2026 年发表。本条目引用的数据统计截至 2026 年 7 月。
  3. 预测模型局限:基于 ENCODE 训练的深度学习模型(Enformer/Basenji/DeepSEA 等)的预测结果为计算推断,非实验验证,用于假设生成而非结论。

§1 数据集概览

§1.0 30 秒速览

ENCODE(Encyclopedia of DNA Elements) 是由美国国家人类基因组研究所(NHGRI)资助、持续逾二十年的国际联盟项目,目标是系统鉴定人类与小鼠基因组中的全部功能元件——从蛋白编码基因、非编码 RNA 到启动子、增强子、绝缘子等顺式调控元件(cCRE)。

项目跨越四个阶段:试点期(2003-2007,聚焦 1% 基因组)→ 第二阶段(2007-2012,全基因组,2012 年 Nature 30 篇论文)→ 第三阶段(2012-2020,5,992 新数据集,926,535 人类 cCRE)→ 第四阶段(2017-2022,2,373,014 人类 cCRE 覆盖 21% 基因组,600+ 功能表征实验)。

截至 2025 年,ENCODE Portal 托管 23,330+ 功能基因组学实验800+ 功能表征实验60,000+ 整合计算分析结果,总数据量超过 1.3 PB,以 CC BY 4.0 许可完全开放。ENCODE 是基因组学深度学习(Enformer、Basenji、DeepSEA)的核心训练数据,也是 GWAS 非编码变异功能注释的事实标准资源。

§1.1 战略价值分析

维度 具体内容 战略意义
功能元件注释 237 万人类 cCRE + 92.7 万小鼠 cCRE,覆盖 21%/9% 基因组 首次系统化标注人类基因组非编码功能区域
多组学整合 ChIP-seq/RNA-seq/ATAC-seq/Hi-C/WGBS/eCLIP 等 10+ 种实验类型 单一资源提供多层级基因组功能视图
统一处理管线 DCC 维护的标准化流水线,所有实验统一处理 跨实验、跨实验室数据可比性
功能验证 108 CRISPRi 筛选、STARR-seq、MPRA、转基因小鼠 从"生化标记"升级为"功能验证"
GWAS 桥梁 cCRE 注册库 + 变异功能评分(cV2F) 连接 GWAS 位点与因果基因,AUPRC 0.82
AI 训练基石 Enformer 5,313 轨道、Basenji 4,229 轨道均以 ENCODE 为训练集 基因组学基础模型的核心数据底座
完全开放 CC BY 4.0,学术与商业均免费使用 降低进入门槛,加速转化研究

§1.2 ENCODE 与同类资源横向对比

维度 ENCODE Roadmap Epigenomics FANTOM5 GTEx GEUVADIS
核心目标 全基因组功能元件 人类表观基因组图谱 哺乳动物启动子 组织 eQTL 群体转录组
物种 人类 + 小鼠 人类 人类 + 小鼠 人类 人类
实验类型 10+ 种多组学 ChIP-seq/DNase-seq/RNA-seq CAGE RNA-seq + WGS RNA-seq
实验数 23,330+ ~2,800 ~2,000 ~17,000 样本 465 个体
特色 cCRE 注册库 + 功能验证 111 种参考表观基因组 精确 TSS 定位 组织特异性 eQTL 群体转录变异
许可 CC BY 4.0 CC BY 4.0 CC BY 4.0 受控访问(dbGaP) 公开
整合关系 托管 Roadmap 数据 被 ENCODE 整合 独立 独立 独立

定位差异:ENCODE 是唯一同时覆盖多种组学类型、大规模功能验证、且以系统化注册库(cCRE Registry)形式输出的资源。Roadmap 数据已被整合进 ENCODE Portal。FANTOM5 的 CAGE 数据被 Enformer 等模型纳入训练。

§1.3 版本演进时间轴

阶段 时间 核心成果 代表论文
ENCODE Pilot 2003-2007 1% 人类基因组(ENm001-ENm013 + ENr 系列),微阵列技术 Nature 447:799-816, 2007
modENCODE 2007-2012 秀丽隐杆线虫 + 黑腹果蝇功能元件 Science 330 全套,2010
ENCODE2 2007-2012 全基因组,测序技术替代微阵列;30 篇 Nature 配套论文 Nature 489:57-74, 2012
Mouse ENCODE 2009-2015 小鼠基因组多组织多时间点分析 Nature 515 全套,2014
ENCODE3 2012-2020 5,992 新数据集;926,535 人类 cCRE + 339,815 小鼠 cCRE;SCREEN 工具 Nature 583:699-710, 2020
ENCODE4 2017-2022 2,373,014 人类 cCRE(21% 基因组);600+ 功能表征实验;108 CRISPRi 筛选;cV2F 变异评分 Nature (2026), Nat Methods 21:723, 2024
Portal 更新 2025 重新设计首页、购物车功能、Encyclopaedia Browser Nat Commun 16:9592, 2025

§1.4 典型 AI 应用场景

场景 数据子集 任务类型 代表模型/工具
序列→表观信号预测 ChIP-seq + DNase-seq + ATAC-seq 轨道 多任务回归 Enformer / Basenji2 / DeepSEA
GWAS 变异功能注释 cCRE 注册库 + eQTL + CRISPRi 变异效应预测 RegulomeDB / HaploReg / cV2F
增强子-启动子连接 Hi-C + CRISPRi 元素-基因互作 图预测 CRISPRi-guided eQTL
转录本异构体检测 long-read RNA-seq 序列分析 FLAIR / IsoQuant
DNA 基序发现 ChIP-seq peaks + 染色质可及性 模式发现 ChromBPNet / BPNet
细胞类型特异性调控 scATAC-seq + scRNA-seq 细胞聚类 + 调控推断 ArchR / Signac
3D 基因组建模 Hi-C 接触矩阵 结构预测 Juicebox / HiCBrowser
疾病调控机制 GWAS + cCRE + CRISPRi 因果推断 cV2F 评分 + 精细定位

§2 基因组学背景

§2.1 人类基因组的功能元件图谱

人类基因组含约 32 亿碱基对,其中仅约 1.5% 编码蛋白质。ENCODE 的核心使命是注释剩余 98.5% 的非编码区域中的功能元件。这些功能元件包括:

元件类型 定义 检测方法 ENCODE cCRE 分类
启动子(Promoter) 转录起始位点(TSS)附近的 DNA 序列,招募 RNA 聚合酶 RAMPAGE / CAGE / H3K4me3 ChIP-seq promoter-like cCRE (CA-TSS)
增强子(Enhancer) 远距离增强基因转录的顺式元件 H3K27ac ChIP-seq / DNase-seq / STARR-seq enhancer-like cCRE (CA-CTCF)
沉默子(Silencer) 抑制基因转录的顺式元件 CRISPRi 筛选 / MPRA silencer cCRE(ENCODE4 新发现)
绝缘子(Insulator) 阻断增强子-启动子异常互作,常结合 CTCF CTCF ChIP-seq / Hi-C CTCF-only cCRE (CA-CTCF)
染色质开放区(DHS) 核小体缺失区域,标志潜在调控活性 DNase-seq / ATAC-seq 所有 cCRE 均含 DHS 信号
DNA 甲基化区域 CpG 位点甲基化状态影响基因表达 WGBS(全基因组亚硫酸氢盐测序) 独立轨道
三维染色质结构域 TAD(拓扑关联结构域)与染色质环 Hi-C / ChIA-PET / 5C 独立轨道

§2.2 顺式调控元件(CRE)与 cCRE 注册库

顺式调控元件(CRE) 是位于同一染色体上、调控邻近基因表达的非编码 DNA 序列。ENCODE 通过整合多种组学信号定义候选 CRE(candidate CRE, cCRE)

ENCODE3 注册库(2020):

  • 926,535 人类 cCRE,覆盖基因组 7.9%
  • 339,815 小鼠 cCRE,覆盖基因组 3.4%
  • 基于 rDHS(代表性 DNase 超敏感位点)+ 转录因子聚类

ENCODE4 注册库(2026):

  • 2,373,014 人类 cCRE,覆盖基因组 21%
  • 926,843 小鼠 cCRE,覆盖基因组 9%
  • 较 ENCODE3 三倍扩展
  • 功能表征覆盖 >97% 人类 cCRE
  • 新发现数千个沉默子 cCRE——部分在不同细胞类型中表现为增强子(双功能元件)
  • 整合 5,712 人类实验 + 758 小鼠实验

cCRE 分类体系:

cCRE 类别 染色质特征 预测功能 人类数量(ENCODE4)
CA-TSS DHS + H3K4me3 + TF cluster 启动子 ~180,000
CA-CTCF DHS + CTCF only 绝缘子/结构 ~340,000
CA-H3K4me1 DHS + H3K4me1 + H3K27ac 活性增强子 ~760,000
CA-TF DHS + TF cluster (non-TSS) 转录因子结合 ~1,090,000
低 DNase 低 DHS 信号 弱/潜在调控 持续更新

§2.3 GWAS 变异与调控元件

全基因组关联研究(GWAS)已鉴定超过 10 万个与人类性状和疾病相关的遗传变异,其中 >90% 位于非编码区域。ENCODE 的 cCRE 注册库是解读这些非编码变异的关键资源:

关联类型 方法 ENCODE 角色 案例
变异-调控元件重叠 GWAS SNP ∩ cCRE 提供元件类型与活性细胞类型注释 红细胞性状 GWAS → KLF1 调控元件
变异功能评分 cV2F(combined variant-to-function) 整合 CRISPRi + eQTL + 深度学习预测 AUPRC 0.82 预测复杂疾病位点
元件-基因连接 CRISPRi 元素-基因互作 + Hi-C 提供功能验证的调控关系 332 个 K562 细胞系确认 CRE-基因对
等位基因效应 等位特异性分析 + 合成报告基因 验证变异的调控效应方向 150 万变异中 10% 有显著等位效应

ENCODE4 变异分析成果:

  • 评估 150 万常见/低频非编码变异
  • 10% 具有显著等位基因效应
  • 预测 1,000 万变异效应
  • cV2F 评分预测复杂疾病位点 AUPRC 达 0.82
  • 显著提升多祖先人群精细定位精度

§2.4 ICD-11 疾病关联

ENCODE 调控元件数据跨疾病应用:

ICD-11 章节 疾病示例 ENCODE 应用
4A00–4A0Z 染色体异常 唐氏综合征、染色体微缺失 非编码区域调控元件注释
20 遗传性发育障碍 先天性心脏缺陷 胎儿心脏调控图谱(734,000 单细胞)
3A30–3A3Z 血液系统疾病 红细胞性状、地中海贫血 KLF1 调控元件 → 红细胞生成
2A00–2A0Z 神经系统疾病 阿尔茨海默病、精神分裂症 脑组织 ChIP-seq + GWAS 变异注释
2A20–2A2Z 免疫系统疾病 自身免疫疾病 免疫细胞 cCRE 活性图谱
XA2J6 恶性肿瘤 各类癌症 癌细胞系调控元件异常
5A00–5A0Z 内分泌疾病 糖尿病、甲状腺疾病 胰岛/甲状腺组织调控网络
BA00–BA4Z 心血管疾病 冠心病、心律失常 心脏发育调控图谱

§2.5 ENCODE4 基因注释扩展

ENCODE4 利用长读长 RNA 测序(long-read RNA-seq)大幅扩展了基因注释:

维度 ENCODE4 成果 意义
新 lncRNA 基因 人类 +17,931 个(140,268 转录本);小鼠 +22,784 个(136,169 转录本) 填补高度细胞类型特异性转录本的注释空白
转录本异构体 400+ 组织/发育样本全长转录组测序 87% 人类蛋白编码基因有全长转录本,89% 存在多种异构体
新剪接事件 20 万+ polyA+ 转录本,35% 相比 GENCODE v40 有新剪接方式 揭示组织特异性可变剪接图谱
疾病变异定位 疾病相关变异、孤独启动子与增强子定位在新 lncRNA 上 提升疾病非编码变异解读能力

§2.6 蛋白质-DNA 相互作用与基序统一目录

ENCODE4 整合 ChIP-seq、染色质可及性及报告基因数据,利用 ChromBPNet/BPNet 深度学习模型构建了包含 3,384 个非冗余 DNA 基序的统一目录

基序类别 数量 功能
锌指蛋白基序 ~1,200 序列特异性 DNA 识别
染色质状态调控因子基序 ~400 染色质重塑与修饰
协同结合基序 ~300 转录因子协同结合
已知数据库基序(JASPAR/CIS-BP 等) ~1,400 与现有数据库重叠验证
新增基序 ~100 首次鉴定

§2.7 ENCODE 联盟组织架构与历史

ENCODE 是人类基因组计划完成后 NHGRI 启动的首个大规模功能基因组学项目,其组织架构对后续联盟项目(如 Roadmap Epigenomics、GTEx、All of Us)产生了深远影响:

组成部分 职责 代表机构
资助方 项目规划与资金分配 NHGRI/NIH
数据生产中心 执行高通量实验 Broad Institute、Stanford、UCSD、UW、Baylor 等
数据协调中心 (DCC) 数据收集、统一处理、Portal 维护 Stanford University (J. Michael Cherry)
数据分析中心 (DAC) 整合分析、cCRE 注册库构建 UMass Chan (Zhiping Weng)、Stanford (Anshul Kundaje)
功能表征中心 CRISPRi/MPRA/STARR-seq 功能验证 Broad Institute、UCSF、UW 等
外部顾问委员会 科学方向指导 国际基因组学专家

历史意义:ENCODE 开创了"联盟级大规模功能基因组学"范式——统一实验标准、统一数据处理、统一数据发布、完全开放共享。这一范式被 Roadmap Epigenomics、4D Nucleome、CETP 等后续项目继承。ENCODE 也是首个将"功能元件注册库"(cCRE Registry)作为核心产出而非仅原始数据的联盟项目,为基因组功能注释提供了可追溯、可更新、可验证的标准化资源。

§3 技术规格

§3.0 版本抉择矩阵

使用场景 推荐版本 理由
GWAS 变异注释 ENCODE4 cCRE Registry (v4) 覆盖最广(21% 基因组),功能验证最充分
训练序列预测模型 ENCODE3/4 整合轨道(Enformer 格式) 5,313 人类轨道已标准化
3D 基因组分析 ENCODE3+ Hi-C 数据 含 Juicebox 可视化
比较基因组学 ENCODE3 + Mouse ENCODE 人鼠同源 cCRE 对比
开发时序调控模型 ENCODE4 小鼠胚胎发育数据 E10.5-P0 系统性时间序列
单细胞调控分析 ENCODE4 scATAC-seq + scRNA-seq 最新细胞类型特异性数据
历史复现(2012 论文) ENCODE2 数据 原始全基因组分析

§3.1 实验类型与技术架构

ENCODE 覆盖的 10+ 种核心实验类型:

实验类别 代表实验 检测目标 统一管线
DNA 结合 TF ChIP-seq / Histone ChIP-seq 转录因子或组蛋白修饰的基因组结合位置 ENCODE3/4 ChIP-seq Pipeline
转录 Bulk RNA-seq / RAMPAGE / miRNA-seq / long-read RNA-seq RNA 丰度、TSS 定位、microRNA 定量、全长异构体 ENCODE3/4 RNA-seq Pipeline
DNA 可及性 DNase-seq / ATAC-seq 染色质开放区域 ENCODE3/4 DNase/ATAC Pipeline
3D 染色质 Hi-C / ChIA-PET / 5C 染色质三维接触与远程互作 Juicer + hictools
RNA 结合 eCLIP / RBNS(RNA Bind-N-Seq) RNA 结合蛋白靶标 eCLIP Pipeline
DNA 甲基化 WGBS(全基因组亚硫酸氢盐测序) CpG/CHG/CHH 甲基化状态 WGBS Pipeline
功能表征 STARR-seq / MPRA / CRISPRi/CRISPRa screens 调控元件功能活性验证 多中心整合分析
转基因验证 Transgenic mouse enhancer assays 体内增强子活性 lacZ 报告基因

§3.2 统一处理管线(Uniform Processing Pipelines)

ENCODE DCC 维护的标准化数据处理管线是数据可比性的核心保障:

管线 输入 关键步骤 输出
TF ChIP-seq FASTQ + control STAR/BWA 比对 → 去重 → MACS2 peak calling → IDR 重复性评估 BAM / bigWig / narrowPeak (IDR thresholded)
Histone ChIP-seq FASTQ + control 同上但 broad peak calling BAM / bigWig / broadPeak
RNA-seq (bulk) FASTQ STAR 比对 → RSEM 定量 → 差异表达 BAM / bigWig / gene quantification (TSV)
long-read RNA-seq FASTQ (PacBio/ONT) Minimap2 比对 → FLAIR/IsoQuant 异构体分析 BAM / ISO-Seq / transcript GTF
DNase-seq FASTQ BWA 比对 → Hotspot2 peak calling BAM / bigWig / hotspots / footprints
ATAC-seq FASTQ BWA 比对 → MACS2 peak calling → IDR BAM / bigWig / IDR thresholded peaks
WGBS FASTQ Bismark 比对 → 甲基化提取 BAM / methylation state at CpG/CHG/CHH (bed/bigBed)
Hi-C FASTQ pairs Juicer 比对 → 接触矩阵生成 → 环/TAD/区室注释 hic 文件
eCLIP FASTQ STAR 比对 → 去重复 → peak calling BAM / bigWig / peaks

管线版本管理:管线分为 major/minor 版本。Minor 版本向后兼容,直接可比;Major 版本变更时所有下游步骤同步版本化。管线代码开源在 GitHub,并已部署到 Dockstore、Terra、AnVIL、Seven Bridges 等平台。

§3.3 重复性标准与质量控制

ENCODE 对实验重复性有严格标准:

标准 方法 阈值
生物学重复 每个实验至少 2 个独立生物学重复 强制要求
IDR(不可重复发现率) 比较 2 个重复的 peak 一致性 IDR < 0.05(TF ChIP-seq)/ < 0.01(histone)
技术重复 同一生物学样本的多次测序 评估技术变异
抗体验证 ENCODE 抗体验证标准(4 类验证) 至少 2 类验证通过
文库复杂度 PBC/NRF/LC 指标 NRF > 0.8, PBC > 0.5
比对率 比对到参考基因组的读段比例 > 70%(因实验类型而异)
exclusion list 已知异常高信号区域排除 强制应用

§3.4 数据格式

格式 用途 特点
FASTQ 原始测序读段 文本格式,含序列与质量分数
BAM 序列比对结果 SAM 的二进制索引版本
bigWig 信号覆盖轨道 二进制,UCSC Genome Browser 可视化
bigBed 注释/peak 区域 BED 的二进制索引版本
narrowPeak / broadPeak ChIP-seq peak 含 peak summit 与统计量
hic Hi-C 接触矩阵 高度压缩二进制,含多分辨率矩阵与标准化向量
TSV/CSV 定量结果 基因/转录本表达量、CRISPR 筛选结果
GTF/GFF 基因注释 基因/转录本/外显子坐标
bed 区域注释 通用基因组坐标格式

§3.5 访问渠道

渠道 地址 特点 适用场景
ENCODE Portal encodeproject.org Web 界面、搜索、购物车、基因组浏览器 探索性查询
REST API https://www.encodeproject.org/search/?type=Experiment&amp;format=json JSON/TSV 程序化访问 批量下载、自动化管道
AWS S3 s3://encode-project/ AWS Registry of Open Data 云计算直接读取
UCSC Track Hubs 动态生成 一键将筛选结果加载到 UCSC Genome Browser 可视化
SCREEN screen.encodeproject.org cCRE 注册库专用浏览器 调控元件查询

§3.6 ENCODE 生态工具

工具 功能 链接
SCREEN cCRE 注册库浏览与查询 screen.encodeproject.org
RegulomeDB 非编码变异调控潜力评分 regulomedb.org
HaploReg 单倍型区块非编码注释 broadinstitute.org/mammals/haploreg
Juicebox Hi-C 数据可视化 aidenlab.org/juicebox
Valis Browser 内嵌基因组浏览器 ENCODE Portal 内
Enformer 序列→表观信号预测 TF-Hub
Basenji2 跨染色体调控活性预测 storage.googleapis.com/basenji_barnyard
DeepSEA 染色质可及性预测 deepsea.princeton.edu
ChromBPNet 碱基分辨率 ChIP-seq 预测 GitHub
BPNet 转录因子结合预测 GitHub
ArchR scATAC-seq 分析 GitHub
Signac scATAC-seq 分析(Seurat 生态) GitHub

§4 数据结构详解

§4.1 ENCODE 条目标识系统

ENCODE 使用层次化标识系统:

标识符 格式 含义 示例
Experiment accession ENCSR + 6 字母 实验唯一标识 ENCSR000EGQ
Biological replicate ENCFF + 6 字母 (file-level) 生物学重复文件 ENCFF000AAA
File accession ENCFF + 6 字母 文件唯一标识 ENCFF265BLX
Biosample accession ENCBS + 6 字母 生物样本标识 ENCBS000AAA
Library accession ENCLB + 6 字母 测序文库标识 ENCLB000AAA
Series accession ENCSR + 系列 实验系列 ENCSR系列
Document accession ENCD + 6 字母 实验协议文档 ENCD000AAA

§4.2 单条目数据组件

一个完整的 ENCODE 实验条目包含以下组件:

组件 内容 必需性
实验元数据 实验类型、目标(TF/组蛋白)、生物样本、装配版本、实验室 必需
生物样本信息 细胞系/组织/原代细胞、供体、处理方式、分化方案 必需
文库信息 建库策略、重复结构、读长、配对方式 必需
原始数据 FASTQ 文件(按重复与技术重复分开) 必需
比对结果 BAM 文件(过滤/未过滤) 必需
信号轨道 bigWig 文件(单重复 + 池化) 必需
注释文件 peak/footprint/methylation(因实验类型而异) 必需
质量控制 文库复杂度、IDR 评分、重复相关性 必需
实验协议 PDF 文档(详细实验步骤) 推荐
管线来源 管线版本、软件版本、参数 必需

§4.3 元数据模型

ENCODE 使用 JSON Schema 定义的元数据模型,共 118 种对象类型。核心对象层次:

Donor(供体)
  └── Biosample(生物样本)
       └── Library(测序文库)
            └── Replicate(重复)
                 └── Experiment(实验)
                      └── File(文件)
                           ├── FASTQ(原始)
                           ├── BAM(比对)
                           ├── bigWig(信号)
                           ├── bigBed/narrowPeak(注释)
                           └── TSV(定量)

元数据查询示例(REST API):

# 查询所有 K562 细胞系的 TF ChIP-seq 实验
curl -s "https://www.encodeproject.org/search/\
?type=Experiment&amp;assay_title=TF+ChIP-seq\
&amp;biosample_ontology.term_name=K562\
&amp;status=released&amp;format=json" | \
python -m json.tool | head -50

# 获取特定实验的文件列表
curl -s "https://www.encodeproject.org/experiments/ENCSR000EGQ/\
?format=json" | \
python -c "import sys,json; d=json.load(sys.stdin); \
[print(f[''''''''''''''''''''''''''''''''accession''''''''''''''''''''''''''''''''], f[''''''''''''''''''''''''''''''''file_format''''''''''''''''''''''''''''''''], f[''''''''''''''''''''''''''''''''output_type'''''''''''''''''''''''''''''''']) \
for f in d[''''''''''''''''''''''''''''''''files'''''''''''''''''''''''''''''''']]"

§4.4 cCRE 注册库数据结构

ENCODE4 cCRE 注册库以 BED + TSV 格式发布,每条 cCRE 记录包含:

字段 类型 说明
chrom string 染色体(chr1-chr22, chrX, chrY)
start int 起始坐标(0-based, GRCh38)
end int 终止坐标
cCRE_id string 元件唯一标识(EH37E + 数字)
cCRE_class string 分类(CA-TSS / CA-CTCF / CA-H3K4me1 / CA-TF)
dnase_signal float DNase-seq 最大信号
h3k4me3_signal float H3K4me3 ChIP-seq 信号
h3k27ac_signal float H3K27ac ChIP-seq 信号
ctcf_signal float CTCF ChIP-seq 信号
rDHS_id string 代表性 DHS 标识
tf_cluster string 转录因子聚类标识
nearest_gene string 最近基因符号
distance_to_tss int 到最近 TSS 的距离(bp)
grace_tag string GROUP_TSS / GROUP_ENH / GROUP_CTCF / GROUP_DNase

§4.5 数据覆盖统计

维度 人类 小鼠
功能基因组学实验 ~18,000 ~5,300
cCRE 数量 2,373,014 926,843
基因组覆盖率 21% 9%
细胞/组织类型 ~500+ ~300+
转录因子 ChIP-seq ~160 TFs ~50 TFs
组蛋白修饰 ~15 marks ~10 marks
功能表征实验 ~600
CRISPRi 筛选 108 screens
Hi-C 实验 ~100 ~200(含发育时序)

§4.6 不覆盖的数据类型

不覆盖类型 说明 替代资源
个体级基因组变异 ENCODE 使用参考基因组装配,非个体测序 1000 Genomes / gnomAD
临床表型数据 无患者随访或临床结局 UK Biobank / All of Us
蛋白质组数据 无大规模蛋白质定量 PRIDE / Human Protein Atlas
代谢组数据 无代谢物谱 MetaboLights
药物响应数据 无系统性药敏测试 DepMap / GDSC
活体动态数据 静态快照,无实时动态监测

§5 数据划分与使用建议

§5.1 ENCODE 数据的组织方式

与影像或临床数据集不同,ENCODE 不提供预定义的 train/val/test 划分。数据按以下维度组织,用户需根据任务自定义划分:

组织维度 说明 典型用途
按实验类型 ChIP-seq / RNA-seq / ATAC-seq 等 训练特定任务模型
按生物样本 细胞系 / 组织 / 原代细胞 跨细胞类型迁移学习
按基因组区域 按染色体或基因组坐标 留一染色体交叉验证
按阶段 ENCODE2/3/4 历史复现或增量更新
按系列 时间序列或分化系列 时序建模

§5.2 推荐划分策略

策略 训练集 验证集 测试集 适用任务
留染色体法 chr1-chr21 chr22 chrX 序列预测模型(Enformer 范式)
留细胞类型法 多数细胞类型 1-2 个 1-2 个 细胞类型泛化评估
留实验类型法 多数 TF ChIP-seq 留出 TF 留出 TF TF 结合泛化
按阶段留出 ENCODE2/3 ENCODE4 子集 ENCODE4 子集 时间维度泛化
随机区域划分 基因组 80% 10% 10% 区域级预测

§5.3 序列预测模型的轨道选择

Enformer 等模型使用标准化轨道进行训练。推荐轨道选择策略:

轨道类别 来源 轨道数 分辨率 推荐用途
CAGE(TSS) FANTOM5 + ENCODE RAMPAGE ~1,000 128 bp 转录起始预测
DNase-seq ENCODE ~500 128 bp 染色质可及性
ATAC-seq ENCODE ~300 128 bp 染色质可及性
TF ChIP-seq ENCODE ~1,500 128 bp TF 结合预测
Histone ChIP-seq ENCODE ~1,000 128 bp 组蛋白修饰预测
Hi-C ENCODE ~100 区域级 3D 互作预测

Enformer 标准配置:5,313 人类轨道 + 1,643 小鼠轨道,输入序列 200 kb,输出分辨率 128 bp。

§5.4 CRISPRi 筛选数据划分

ENCODE4 的 108 个非编码 CRISPRi 筛选数据(>540,000 perturbations)的推荐使用方式:

用途 数据子集 策略
CRE-基因关系训练 K562 细胞系 332 个确认 CRE-基因对 训练集
CRE 功能预测 跨细胞类型筛选 留一细胞类型法
gRNA 设计优化 3,275,697 个预设 gRNA 独立验证
筛选方法基准 5 种分析工具对比 CASA 最保守

§6 AI 就绪指南

§6.0 快速体验:5 分钟查询 cCRE

# 通过 ENCODE REST API 查询特定基因组区域的 cCRE
import requests

# 查询 chr1:1000000-2000000 区域的 cCRE
url = "https://www.encodeproject.org/search/"
params = {
    "type": "FunctionalCharacterization",
    "assembly": "GRCh38",
    "chromosome": "chr1",
    "format": "json",
    "limit": "10"
}
resp = requests.get(url, params=params, headers={"Accept": "application/json"})
data = resp.json()
print(f"Found {data.get(''''''''''''''''''''''''''''''''total'''''''''''''''''''''''''''''''', 0)} results")
for item in data.get("@graph", [])[:5]:
    print(f"  - {item.get(''''''''''''''''''''''''''''''''accession'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''N/A'''''''''''''''''''''''''''''''')}: {item.get(''''''''''''''''''''''''''''''''description'''''''''''''''''''''''''''''''', '''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')[:80]}")

§6.1 REST API 批量下载实验数据

import requests
import os
import json
from urllib.parse import urljoin

BASE_URL = "https://www.encodeproject.org"
HEADERS = {"Accept": "application/json"}

def search_experiments(assay_title, biosample, assembly="GRCh38",
                       status="released", limit="all"):
    """搜索 ENCODE 实验并返回 accession 列表"""
    url = f"{BASE_URL}/search/"
    params = {
        "type": "Experiment",
        "assay_title": assay_title,
        "biosample_ontology.term_name": biosample,
        "assembly": assembly,
        "status": status,
        "limit": limit,
        "format": "json"
    }
    resp = requests.get(url, params=params, headers=HEADERS)
    resp.raise_for_status()
    data = resp.json()
    experiments = []
    for item in data.get("@graph", []):
        experiments.append({
            "accession": item["accession"],
            "assay_title": item.get("assay_title", ""),
            "biosample": item.get("biosample_summary", ""),
            "lab": item.get("lab", {}).get("title", ""),
            "files": len(item.get("files", []))
        })
    return experiments

def download_experiment_files(accession, output_dir="encode_data",
                              file_format="bigWig",
                              output_type="signal p-value",
                              assembly="GRCh38",
                              preferred_replicate="pooled"):
    """下载指定实验的特定格式文件"""
    url = f"{BASE_URL}/experiments/{accession}/?format=json"
    resp = requests.get(url, headers=HEADERS)
    resp.raise_for_status()
    exp = resp.json()

    os.makedirs(output_dir, exist_ok=True)
    downloaded = []

    for f in exp.get("files", []):
        if (f.get("file_format") == file_format and
            f.get("output_type") == output_type and
            f.get("assembly") == assembly and
            f.get("biological_replicates") == [] or preferred_replicate == "pooled"):

            file_url = f["href"]
            if not file_url.startswith("http"):
                file_url = urljoin(BASE_URL, file_url)

            filename = f"{accession}_{f[''''''''''''''''''''''''''''''''accession'''''''''''''''''''''''''''''''']}_{file_format}_{output_type.replace('''''''''''''''''''''''''''''''' '''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''_'''''''''''''''''''''''''''''''')}.{file_format}"
            filepath = os.path.join(output_dir, filename)

            print(f"Downloading {filename} ({f.get(''''''''''''''''''''''''''''''''file_size'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''unknown'''''''''''''''''''''''''''''''')} bytes)...")
            file_resp = requests.get(file_url)
            file_resp.raise_for_status()
            with open(filepath, "wb") as fh:
                fh.write(file_resp.content)
            downloaded.append(filepath)

    return downloaded

# 示例:下载 K562 细胞系的所有 CTCF ChIP-seq bigWig 信号文件
experiments = search_experiments("TF ChIP-seq", "K562")
print(f"Found {len(experiments)} K562 TF ChIP-seq experiments")

for exp in experiments[:3]:  # 前 3 个实验
    print(f"\nProcessing {exp[''''''''''''''''''''''''''''''''accession'''''''''''''''''''''''''''''''']}: {exp[''''''''''''''''''''''''''''''''biosample'''''''''''''''''''''''''''''''']}")
    files = download_experiment_files(exp["accession"])
    print(f"  Downloaded {len(files)} files")

§6.2 AWS S3 高性能批量下载

import boto3
import os

# ENCODE 数据在 AWS Registry of Open Data 公开可用
# 无需 AWS 认证即可读取
s3 = boto3.client("s3", regionevent-blocked="us-west-2")
BUCKET = "encode-project"

def list_encode_files(prefix=""):
    """列出 ENCODE S3 存储桶中的文件"""
    paginator = s3.get_paginator("list_objects_v2")
    for page in paginator.paginate(Bucket=BUCKET, Prefix=prefix):
        for obj in page.get("Contents", []):
            yield obj["Key"], obj["Size"]

def download_from_s3(key, local_path):
    """从 ENCODE S3 下载文件"""
    os.makedirs(os.path.dirname(local_path), exist_ok=True)
    s3.download_file(BUCKET, key, local_path)
    print(f"Downloaded: {key} -> {local_path}")

# 示例:下载特定实验的所有 bigWig 文件
# ENCODE S3 路径格式: experiments/{accession}/{file_accession}.bigWig
for key, size in list_encode_files("experiments/ENCSR000EGQ/"):
    if key.endswith(".bigWig"):
        local = f"encode_s3/{os.path.basename(key)}"
        download_from_s3(key, local)

§6.3 pLDDT 式信号轨道解析与可视化

import pyBigWig
import numpy as np
import matplotlib.pyplot as plt

def load_bigwig_signal(bw_path, chrom, start, end):
    """加载 bigWig 信号轨道"""
    bw = pyBigWig.open(bw_path)
    signal = bw.values(chrom, start, end, numpy=True)
    bw.close()
    # 处理 NaN
    signal = np.nan_to_num(signal, nan=0.0)
    return signal

def plot_multi_track(tracks, chrom, start, end, gene_name=""):
    """多轨道叠加可视化(ChIP-seq + DNase-seq + ATAC-seq)"""
    fig, axes = plt.subplots(len(tracks), 1, figsize=(14, 3 * len(tracks)),
                              sharex=True)
    if len(tracks) == 1:
        axes = [axes]

    for ax, (name, path) in zip(axes, tracks.items()):
        signal = load_bigwig_signal(path, chrom, start, end)
        positionevent-blocked= np.linspace(start, end, len(signal))
        ax.fill_between(positions, 0, signal, alpha=0.7, linewidth=0.5)
        ax.set_ylabel(name, fonevent-blocked=10)
        ax.set_ylim(0, np.percentile(signal[signal > 0], 99) * 1.1)

    axes[-1].set_xlabel(f"{chrom}:{start:,}-{end:,}")
    fig.suptitle(f"ENCODE Multi-track Signal: {gene_name}", fonevent-blocked=12)
    plt.tight_layout()
    return fig

# 示例:可视化 K562 细胞系 MYC 基因座的多组学信号
tracks = {
    "CTCF ChIP-seq": "encode_data/ENCSR000EGQ_bigWig.bigWig",
    "H3K27ac ChIP-seq": "encode_data/ENCSR000AKB_bigWig.bigWig",
    "DNase-seq": "encode_data/ENCSR000EMT_bigWig.bigWig",
    "ATAC-seq": "encode_data/ENCSR868FGK_bigWig.bigWig"
}
# fig = plot_multi_track(tracks, "chr8", 127735434, 127742951, "MYC")

§6.4 Hi-C 接触矩阵可视化

import numpy as np
import matplotlib.pyplot as plt
import h5py

def load_hic_matrix(hic_path, chrom, start, end, resolution=5000):
    """加载 Hi-C 接触矩阵(需 cooler/hicstraw 库)"""
    try:
        import hicstraw
        hic = hicstraw.HiCFile(hic_path)
        mzd = hic.getMatrixZoomData(chrom, chrom, "observed", "KR",
                                     "BP", resolution)
        matrix = mzd.getRecordsAsMatrix(start, end, start, end)
        return matrix
    except ImportError:
        print("Install hicstraw: pip install hicstraw")
        return None

def plot_hic_heatmap(matrix, chrom, start, end, resolution=5000):
    """绘制 Hi-C 热力图"""
    fig, ax = plt.subplots(figsize=(8, 8))
    log_matrix = np.log1p(matrix)
    im = ax.imshow(log_matrix, cmap="YlOrRd", aspect="auto",
                    extent=[start//resolution, end//resolution,
                           end//resolution, start//resolution])
    ax.set_xlabel(f"{chrom} position (bin={resolution//1000}kb)")
    ax.set_ylabel(f"{chrom} position (bin={resolution//1000}kb)")
    ax.set_title("Hi-C Contact Matrix (observed, KR normalized)")
    plt.colorbar(im, ax=ax, label="log(contact frequency + 1)")
    return fig

§6.5 cCRE 注册库查询与 GWAS 变异注释

import pandas as pd
import requests

def download_ccre_registry(organism="human", version="v4"):
    """下载 ENCODE cCRE 注册库"""
    # SCREEN 下载链接
    url = f"https://downloads.wenglab.org/\
ENCODE4-cCREs.{organism}.{version}.bed"
    # 或从 ENCODE Portal 获取
    print(f"Download from: {url}")
    return url

def annotate_gwas_variants(gwas_file, ccre_file):
    """用 cCRE 注册库注释 GWAS 变异"""
    # 加载 cCRE 注册库
    ccre = pd.read_csv(ccre_file, sep="\t", header=None,
                       names=["chrom", "start", "end", "cCRE_id",
                              "dnase", "h3k4me3", "h3k27ac",
                              "ctcf", "class", "rDHS_id",
                              "nearest_gene", "distance_to_tss"])
    ccre["chrom"] = ccre["chrom"].astype(str)

    # 加载 GWAS 变异
    gwas = pd.read_csv(gwas_file, sep="\t")
    gwas["chrom"] = gwas["chrom"].astype(str)

    # 交集分析
    annotated = []
    for _, snp in gwas.iterrows():
        chrom = snp["chrom"]
        pos = snp["pos"]
        overlapping = ccre[
            (ccre["chrom"] == chrom) &amp;
            (ccre["start"] <= pos) &amp;
            (ccre["end"] >= pos)
        ]
        if len(overlapping) > 0:
            for _, cre in overlapping.iterrows():
                annotated.append({
                    "snp_id": snp.get("snp_id", ""),
                    "chrom": chrom,
                    "pos": pos,
                    "cCRE_id": cre["cCRE_id"],
                    "class": cre["class"],
                    "nearest_gene": cre["nearest_gene"],
                    "dnase_signal": cre["dnase"],
                    "h3k27ac_signal": cre["h3k27ac"],
                    "p_value": snp.get("pval", "")
                })

    return pd.DataFrame(annotated)

# 使用 RegulomeDB API 进行单变异查询
def query_regulomedb(snp_id):
    """通过 RegulomeDB API 查询变异调控注释"""
    url = f"https://regulomedb.org/regulome-search/?regionevent-blocked={snp_id}&amp;format=json"
    resp = requests.get(url)
    if resp.status_code == 200:
        return resp.json()
    return None

§6.6 Enformer 序列预测模型

# Enformer: 从 DNA 序列预测 5,313 个表观基因组轨道
# 需安装: pip install tensorflow tensorflow-hub

import tensorflow_hub as hub
import numpy as np

def load_enformer_model():
    """加载预训练 Enformer 模型"""
    model = hub.load("https://tfhub.dev/deepmind/enformer/1")
    return model

def predict_sequence_tracks(model, sequence, organism="human"):
    """
    从 200kb DNA 序列预测表观基因组轨道
    sequence: 200,000 bp 的 one-hot 编码 (200000, 4)
    """
    # Enformer 要求输入序列长度为 196,608 bp (196kb)
    # 超出部分截断,不足部分补零
    target_len = 196608
    if len(sequence) > target_len:
        sequence = sequence[:target_len]
    else:
        sequence = np.pad(sequence, ((0, target_len - len(sequence)), (0, 0)))

    # 添加 batch 维度
    sequence = sequence[np.newaxis, ...]

    # 预测
    if organism == "human":
        predictionevent-blocked= model(sequence)["human"]  # (1, 896, 5313)
    else:
        predictionevent-blocked= model(sequence)["mouse"]  # (1, 896, 1643)

    return predictions.numpy()

def score_variant(model, ref_seq, alt_seq, track_idx=None):
    """
    变异效应评分:参考 vs 替代等位基因的预测差异
    """
    ref_pred = predict_sequence_tracks(model, ref_seq)
    alt_pred = predict_sequence_tracks(model, alt_seq)

    if track_idx is not None:
        diff = alt_pred[0, :, track_idx] - ref_pred[0, :, track_idx]
    else:
        diff = (alt_pred - ref_pred).squeeze()  # (896, 5313)

    return diff

# 示例:将 DNA 序列转为 one-hot 编码
def dna_to_onehot(sequence):
    """DNA 序列转 one-hot 编码"""
    mapping = {"A": [1,0,0,0], "C": [0,1,0,0],
               "G": [0,0,1,0], "T": [0,0,0,1],
               "N": [0,0,0,0]}
    return np.array([mapping.get(base, [0,0,0,0]) for base in sequence.upper()])

§6.7 CRISPRi 筛选数据分析

import pandas as pd
import numpy as np

def load_crispri_screen(file_path):
    """加载 ENCODE CRISPRi 筛选结果"""
    data = pd.read_csv(file_path, sep="\t")
    return data

def analyze_cre_gene_interactions(screen_data, fdr_threshold=0.05):
    """分析 CRE-基因调控关系"""
    significant = screen_data[screen_data["FDR"] < fdr_threshold]

    # 按效应方向分类
    activators = significant[significant["log2FC"] < 0]  # CRISPRi 敲低后表达下降=增强子
    silencers = significant[significant["log2FC"] > 0]   # CRISPRi 敲低后表达上升=沉默子

    results = {
        "total_significant": len(significant),
        "enhancers": len(activators),
        "silencers": len(silencers),
        "dual_function": len(set(activators["cCRE_id"]) &amp;
                            set(screen_data[screen_data["FDR"] < fdr_threshold]
                                [screen_data["log2FC"] > 0]["cCRE_id"]))
    }
    return results

# ENCODE4 CRISPRi 筛选关键发现:
# - 108 个筛选,>540,000 个扰动,覆盖 24.85 Mb
# - K562 细胞系:332 个功能确认的 CRE-基因对
# - CASA 分析工具最保守,对低特异性 gRNA 假阳性最鲁棒
# - 转录区域存在 DNA 链偏倚(影响 CRISPRi 效率)

§6.8 ENCODE + GWAS 精细定位管道

import pandas as pd
import numpy as np

def finemapping_with_encode(gwas_summary, ccre_registry, eqtl_data,
                             tissue="blood"):
    """
    整合 ENCODE cCRE + eQTL + GWAS 进行精细定位
    """
    # 步骤 1: GWAS 位点与 cCRE 重叠
    gwas_hits = gwas_summary[gwas_summary["pval"] < 5e-8]
    ccre_overlap = annotate_gwas_variants(gwas_hits, ccre_registry)

    # 步骤 2: 筛选组织特异性活跃 cCRE
    tissue_active = ccre_overlap[
        ccre_overlap["dnase_signal"] > 1.0  # 该组织有 DNase 信号
    ]

    # 步骤 3: cCRE → 靶基因(通过 CRISPRi 或 eQTL)
    cre_gene_links = tissue_active.merge(
        eqtl_data[eqtl_data["tissue"] == tissue],
        left_on="nearest_gene", right_on="gene_id"
    )

    # 步骤 4: 计算 cV2F 评分(变异-功能综合评分)
    cre_gene_links["cV2F_score"] = (
        -np.log10(cre_gene_links["pval"]) *
        np.log1p(cre_gene_links["dnase_signal"]) *
        np.log1p(cre_gene_links["h3k27ac_signal"])
    )

    # 步骤 5: 排序候选因果基因
    candidates = cre_gene_links.sort_values("cV2F_score", ascending=False)
    return candidates[["snp_id", "cCRE_id", "nearest_gene",
                        "class", "cV2F_score"]].head(20)

# ENCODE4 报告:cV2F 评分在多祖先人群精细定位中
# 预测复杂疾病位点 AUPRC 达 0.82

§6.9 计算资源需求

任务 CPU 内存 GPU 存储 时间
API 查询与元数据下载 2 核 4 GB 1 GB 分钟级
单实验 bigWig 下载与可视化 2 核 8 GB 10 GB 分钟级
cCRE 注册库全量加载 4 核 32 GB 5 GB 分钟级
GWAS 变异注释(10K SNP) 4 核 16 GB 2 GB < 1 小时
Hi-C 矩阵加载与可视化 4 核 32 GB 50 GB 分钟级
Enformer 推理(单序列) 4 核 16 GB 1×V100 秒级
Enformer 全基因组变异扫描 32 核 128 GB 4×V100 500 GB 天级
Basenji2 训练(从零) 64 核 256 GB 8×V100 10 TB 周级
CRISPRi 筛选分析 8 核 32 GB 50 GB 小时级
ENCODE 全量 S3 数据同步 8 核 16 GB >1.3 PB 不推荐

§6.10 已知坑点与解决方案

序号 坑点 影响 解决方案
1 基因组装配版本 ENCODE2 使用 hg19,ENCODE3/4 使用 GRCh38 优先使用 GRCh38;如需 hg19 使用 liftOver 转换
2 细胞系偏倚 K562/HepG2 等癌症细胞系过度代表 注意外推到原代细胞/组织的局限性
3 重复数不足 部分早期实验仅 2 个生物学重复 检查 IDR 评分,谨慎处理低重复性数据
4 管线版本差异 不同版本管线输出不完全兼容 记录管线版本,同一分析使用同一版本
5 exclusion list 遗漏 已知异常区域可能影响分析 始终应用 ENCODE exclusion list
6 bigWig 分辨率 信号轨道为固定分辨率,非碱基级 需要碱基级精度时使用 BAM
7 cCRE 版本更新 ENCODE3(0.9M)vs ENCODE4(2.37M)差异大 使用最新版 v4,注明版本号
8 Hi-C 分辨率 低分辨率(50kb)vs 高分辨率(1kb) 根据分析需求选择合适分辨率
9 REST API 速率限制 大量请求可能被限流 添加 rate limiting;使用 S3 直接下载
10 元数据复杂性 118 种对象类型,学习曲线陡 Experiment 对象入手,逐步深入
11 受控访问数据 部分人类原代组织数据需 dbGaP 授权 检查 accession 前缀;申请 dbGaP
12 功能验证 ≠ 生化标记 DHS/ChIP-seq 信号不代表功能 优先使用 CRISPRi 验证结果

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 影响程度 缓解策略
细胞系偏倚 K562、HepG2 等永生化细胞系实验远多于原代组织 ENCODE4 增加原代细胞与疾病样本
物种偏倚 人类实验远多于小鼠 Mouse ENCODE 补充发育时序数据
组织覆盖不均 免疫细胞与胚胎组织近年才补充 ENCODE4 增加免疫细胞系列
癌症细胞系异常 K562(CML)、HepG2(肝癌)的表观基因组异常 谨慎外推到正常细胞
培养传代效应 长期培养导致表观遗传漂移 使用低代数细胞;标注 passage number
批次效应 不同实验室间存在技术变异 统一管线处理;IDR 评估
抗体质量差异 不同批次抗体特异性和效价不同 ENCODE 抗体验证标准(4 类)
时间覆盖有限 缺乏长期时序数据(除小鼠发育系列) 小鼠 E10.5-P0 系统覆盖
ENCODE3 cCRE 不完整 仅覆盖 7.9% 基因组 升级到 ENCODE4(21%)
功能验证覆盖 非 cCRE 区域缺乏功能验证 ENCODE4 >97% cCRE 有功能数据
个体变异缺失 使用参考基因组,无个体变异信息 结合 1000 Genomes/gnomAD
动态数据缺失 静态快照,无实时动态调控监测 结合时间序列实验

§7.2 质量控制指标

指标 方法 标准 用途
IDR(不可重复发现率) 比较生物学重复 peak 一致性 < 0.05(TF)/ < 0.01(histone) 评估 ChIP-seq 重复性
NRF(非冗余比例) 非冗余读段 / 总读段 > 0.8 文库复杂度
PBC(PCR 瓶颈系数) 基因组位置 1 次读段 / 最大位置读段 > 0.5 PCR 瓶颈检测
LC(文库复杂度) unique reads / total reads 随深度递增 文库质量
FRiP(peak 内读段比例) peak 区域读段 / 总读段 > 1% ChIP-seq 富集质量
比对率 比对读段 / 总读段 > 70% 测序质量
exclusion list 已知异常区域排除 强制应用 去除伪影

§7.3 ENCODE vs 其他功能基因组学资源质量对比

维度 ENCODE Roadmap Epigenomics FANTOM5 BLUEPRINT
统一管线 ✅ DCC 维护 部分
生物学重复 ✅ 强制 ≥ 2 部分
IDR 评估
抗体验证 ✅ 4 类标准 部分 部分
功能验证 ✅ CRISPRi/MPRA
cCRE 注册库 ✅ 系统化
元数据标准 ✅ JSON Schema 部分

§7.4 SCREEN 工具验证

SCREEN(Search Candidate cis-Regulatory Elements by ENCODE)是 cCRE 注册库的官方查询工具:

功能 说明
基因组区域搜索 输入坐标或基因名查看区域内的 cCRE
cCRE 分类浏览 按类别(启动子/增强子/绝缘子/沉默子)筛选
信号叠加可视化 DNase-seq + ChIP-seq + ATAC-seq 多轨道叠加
CRISPRi 验证标注 显示有功能验证数据的 cCRE
GWAS 变异叠加 上传 VCF/BED 文件查看变异与 cCRE 重叠
跨物种比较 人鼠同源 cCRE 对比

§7.5 外部验证

验证场景 方法 结果
ENCODE cCRE vs eQTL cCRE 与 GTEx eQTL 重叠 显著富集(p < 1e-100)
ENCODE cCRE vs GWAS GWAS SNP 与 cCRE 重叠 >90% GWAS 变异落在 cCRE 内
CRISPRi vs 报告基因 CRISPRi 筛选结果 vs STARR-seq 一致性 ~70%(阈值差异)
Enformer vs 实验数据 预测轨道 vs ENCODE 实验轨道 Pearson R ~0.65(CAGE)
cV2F vs 精细定位 cV2F 评分 vs 已知因果变异 AUPRC 0.82

§7.6 数据局限性深度分析

局限 详述 影响
体外 vs 体内 多数实验在体外培养细胞中进行 体内调控可能不同
快照 vs 动态 每个实验是一个时间点快照 无法捕捉调控动力学
群体 vs 个体 使用参考基因组,无个体变异 忽略个体间调控差异
线性 vs 三维 多数实验为线性基因组 3D 组织影响未完全覆盖
单一分子 vs 互作 每个实验检测单一分子类型 多组学互作需整合分析

§7.7 DAIMS 24 项数据就绪度评估

序号 DAIMS 维度 评分 (0-1) 评注
1 数据来源透明度 1.0 NHGRI/NIH 官方资助,全部实验室可溯源
2 采集协议文档 1.0 每个实验附带 PDF 协议文档
3 伦理审查 1.0 IRB 审查,受控访问数据通过 dbGaP
4 知情同意 0.5 去标识化样本,具体同意条款因样本而异
5 数据格式标准化 1.0 FASTQ/BAM/bigWig 等标准格式 + JSON Schema 元数据
6 元数据完整性 1.0 118 种对象类型,全面覆盖实验全生命周期
7 数据字典 1.0 官方 profiles 页面 + glossary
8 质量控制流程 1.0 DCC 统一管线 + IDR + QC 指标
9 生物学重复 1.0 强制 ≥ 2 个生物学重复
10 技术重复 0.8 部分实验有,非强制
11 批次效应控制 0.8 统一管线 + exclusion list
12 已知偏倚文档 0.8 文档分散在论文中,无集中偏倚报告
13 训练/验证/测试划分 0.5 不提供预定义划分,需用户自定义
14 数据版本管理 1.0 管线 major/minor 版本 + 文件 accession
15 许可证 1.0 CC BY 4.0,完全开放
16 访问方式 1.0 Portal + API + S3 + UCSC Track Hubs
17 下载稳定性 1.0 多渠道冗余(Portal + AWS S3)
18 API 可用性 1.0 REST API 支持 JSON/TSV
19 计算工具链 1.0 管线开源 + Dockstore/Terra/AnVIL 部署
20 AI/ML 基准 0.8 Enformer/Basenji 标准化轨道,但无官方排行榜
21 文档与教程 1.0 完整 help 页面 + 交互式教程
22 社区活跃度 1.0 >2,000 篇社区论文,25,000 月活用户
23 跨数据集互操作 0.8 整合 Roadmap/modENCODE;与 GTEx/gnomAD 需手动桥接
24 功能验证 1.0 CRISPRi/MPRA/STARR-seq/转基因验证

DAIMS 总分:23.0/24 (95.8%) → AI 就绪度 5/5

评估总结:ENCODE 是功能基因组学领域 AI 就绪度最高的公共资源。唯一显著扣分项是缺乏预定义训练/验证/测试划分(#13)和部分样本知情同意细节分散(#4),这些是联盟级多中心项目的固有挑战。

§8 基准性能与生态

§8.1 序列预测模型基准

模型 输入长度 架构 轨道数 训练数据 关键指标 发表年份
DeepSEA 1 kb CNN 919 ENCODE + Roadmap AUC ~0.85 2015
Basenji 131 kb Dilated CNN 2,001 ENCODE Pearson R ~0.55 2018
Basenji2 131 kb Dilated CNN 4,229 ENCODE + Roadmap Pearson R ~0.60 2020
Enformer 200 kb Transformer + CNN 5,313 ENCODE + FANTOM5 Pearson R ~0.65 (CAGE) 2021
ChromBPNet ~1 kb BPNet ( dilated CNN) 1 ENCODE ChIP-seq 碱基级分辨率 2024
Xpresso 2 kb CNN ENCODE RNA-seq Pearson R ~0.57 (mRNA) 2020

关键趋势:从 1 kb 输入(DeepSEA)到 200 kb(Enformer),感受野扩大 200 倍,捕捉远端增强子-启动子互作能力大幅提升。Transformer 架构优于纯 CNN。

§8.2 CRISPRi 筛选分析工具基准

ENCODE4 对 5 种 CRISPRi 筛选分析工具进行了系统基准测试:

工具 CRE 检出保守性 假阳性率 推荐场景
CASA 最保守 最低 高置信度 CRE 鉴定(推荐)
MAGeCK 中等 中等 通用筛选分析
BAGEL2 中等 中等 必需性基因筛选
CRISPRi-peak 较宽松 较高 探索性分析
PINTS 最宽松 最高 敏感性优先分析

§8.3 关键论文 Top 10

排名 论文 期刊 年份 引用 核心贡献
1 ENCODE Project Consortium. An integrated encyclopedia of DNA elements in the human genome Nature 2012 15,000+ ENCODE2 全基因组功能元件图谱
2 ENCODE Project Consortium. Expanded encyclopaedias of DNA elements in the human and mouse genomes Nature 2020 3,000+ ENCODE3 扩展百科 + cCRE 注册库
3 Moore JE et al. An expanded registry of candidate cis-regulatory elements Nature 2026 ENCODE4 2.37M cCRE + 功能验证
4 ENCODE Project Consortium. Identification and analysis of functional elements in 1% of the human genome by the ENCODE pilot project Nature 2007 3,500+ ENCODE Pilot 1% 基因组
5 Avsec Ž et al. Effective gene expression prediction from sequence by integrating long-range interactions (Enformer) Nat Methods 2021 800+ Transformer 序列预测模型
6 Yao D et al. Multicenter integrated analysis of noncoding CRISPRi screens Nat Methods 2024 108 个 CRISPRi 筛选整合分析
7 Kagda MS et al. Data navigation on the ENCODE portal Nat Commun 2025 Portal 最新功能更新
8 Luo Y et al. New developments on the ENCODE data portal NAR 2020 200+ Portal 购物车/浏览器功能
9 Kelley DR et al. Sequential regulatory activity prediction across chromosomes (Basenji) Genome Res 2018 400+ 跨染色体调控预测
10 Vierstra J et al. Global reference mapping of human transcription factor footprints Nature 2020 300+ 243 种细胞类型 TF 足迹图谱

§8.4 ENCODE 在 AI 生态系统中的角色

生态层 角色 具体应用
数据底座 基因组学基础模型训练数据 Enformer / Basenji / DeepSEA 的核心训练集
标注资源 cCRE 注册库提供功能注释 GWAS 变异注释、调控元件分类
验证基准 实验数据作为 ground truth 序列预测模型评估
工具生态 管线与分析工具 统一处理管线、SCREEN、RegulomeDB
社区枢纽 联盟级数据共享范式 25,000 月活用户、2,000+ 社区论文
标准制定 实验与元数据标准 IDR、抗体验证、JSON Schema
教育平台 教程与文档 交互式教程、help 页面

§8.5 ENCODE4 关键发现案例

案例 发现 意义
红细胞性状 → KLF1 GWAS 变异 → cCRE → KLF1 基因调控 首次通过 cCRE 注册库鉴定红细胞生成新因果基因
沉默子双功能 数千 cCRE 在一种细胞类型中为增强子,另一种为沉默子 挑战增强子/沉默子二元分类范式
MAFF/MAFK 应急响应 MAFF/MAFK 结合的 cCRE 在应激条件下从静态转为活跃 揭示应激响应调控机制
lncRNA 疾病关联 17,931 新 lncRNA 基因含疾病相关变异 扩展非编码疾病遗传学
3,384 基序统一目录 整合多数据库 + 新发现基序 最完整的 DNA 基序参考
cV2F 变异评分 AUPRC 0.82 预测复杂疾病位点 GWAS 精细定位新工具
CRISPRi 链偏倚 转录区域 CRISPRi 存在 DNA 链偏倚 影响筛选设计与分析
胎儿心脏调控图谱 734,000 单细胞,90 种心脏细胞类型 先天性心脏病遗传基础
小鼠发育时序 E10.5-P0 全组织系统发育调控 发育生物学时序调控参考

§8.6 功能基因组学数据生态图

                    ┌─────────────────────────────────────┐
                    │        人类基因组功能元件生态          │
                    └─────────────┬───────────────────────┘
                                  │
          ┌───────────────────────┼───────────────────────┐
          │                       │                       │
    ┌─────┴─────┐          ┌─────┴─────┐          ┌─────┴─────┐
    │  ENCODE   │          │  Roadmap  │          │  FANTOM5  │
    │  (核心)   │◄────────►│ Epigenomics│         │  (CAGE)   │
    │ 23K+ 实验 │  整合    │ 111 参考  │          │ ~2,000 实验│
    │ 2.37M cCRE│          │  表观基因组 │          │ 精确 TSS  │
    └─────┬─────┘          └───────────┘          └───────────┘
          │
    ┌─────┴──────────────────────────────────────────┐
    │                                                 │
┌───┴───┐  ┌─────────┐  ┌──────────┐  ┌──────────┐  ┌─────────┐
│SCREEN │  │RegulomeDB│  │HaploReg  │  │ Enformer │  │Basenji2 │
│cCRE   │  │变异评分  │  │单倍型注释 │  │序列预测  │  │序列预测  │
│浏览器 │  │          │  │          │  │5,313 轨道│  │4,229 轨道│
└───────┘  └──────────┘  └──────────┘  └──────────┘  └─────────┘
    │                                                 │
    └─────────────────┬───────────────────────────────┘
                      │
              ┌───────┴───────┐
              │  GWAS 变异    │
              │  功能注释     │
              │  精细定位     │
              └───────────────┘

§9 相关资源与引用

§9.1 核心论文 BibTeX

@article{encode2012,
  title={An integrated encyclopedia of DNA elements in the human genome},
  author={ENCODE Project Consortium},
  journal={Nature},
  volume={489},
  number={7414},
  pages={5774},
  year={2012},
  doi={10.1038/nature11247}
}

@article{encode2020,
  title={Expanded encyclopaedias of DNA elements in the human and mouse genomes},
  author={ENCODE Project Consortium and Moore, Jill E and Purcaro, Michael J and Pratt, Henry E and Epstein, Charles B and others},
  journal={Nature},
  volume={583},
  number={7818},
  pages={699710},
  year={2020},
  doi={10.1038/s41586-020-2493-4}
}

@article{moore2026,
  title={An expanded registry of candidate cis-regulatory elements},
  author={Moore, Jill E and Weng, Zhiping and others},
  journal={Nature},
  year={2026},
  doi={10.1038/s41586-025-09909-9}
}

@article{kagda2025,
  title={Data navigation on the ENCODE portal},
  author={Kagda, Meenakshi S and Lam, Bonita R and Litton, Casey and others},
  journal={Nature Communications},
  volume={16},
  pages={9592},
  year={2025},
  doi={10.1038/s41467-025-64343-9}
}

@article{yao2024,
  title={Multicenter integrated analysis of noncoding CRISPRi screens},
  author={Yao, David and Tycko, Josh and Oh, Jin Woo and others},
  journal={Nature Methods},
  volume={21},
  number={4},
  pages={723734},
  year={2024},
  doi={10.1038/s41592-024-02216-7}
}

@article{avsec2021,
  title={Effective gene expression prediction from sequence by integrating long-range interactions},
  author={Avsec, {\v{Z}}iga and Agarwal, Vikram and Visentin, Daniel and others},
  journal={Nature Methods},
  volume={18},
  pages={11961203},
  year={2021},
  doi={10.1038/s41592-021-01252-x}
}

@article{kelley2018,
  title={Sequential regulatory activity prediction across chromosomes with convolutional neural networks},
  author={Kelley, David R and Reshef, Yakir A and Bileschi, Maxwell and others},
  journal={Genome Research},
  volume={28},
  pages={739750},
  year={2018},
  doi={10.1101/gr.227819.117}
}

@article{encode2007,
  title={Identification and analysis of functional elements in 1\% of the human genome by the ENCODE pilot project},
  author={ENCODE Project Consortium},
  journal={Nature},
  volume={447},
  pages={799816},
  year={2007},
  doi={10.1038/nature05874}
}

@article{luo2020,
  title={New developments on the ENCODE data portal},
  author={Luo, Yun and Hitz, Benjamin C and Gabdank, Idan and others},
  journal={Nucleic Acids Research},
  volume={48},
  pages={D884D893},
  year={2020},
  doi={10.1093/nar/gkz1062}
}

@article{vierstra2020,
  title={Global reference mapping of human transcription factor footprints},
  author={Vierstra, Jeff and Lazar, Alec T and Sandstrom, Richard and others},
  journal={Nature},
  volume={583},
  pages={729736},
  year={2020},
  doi={10.1038/s41586-020-2528-x}
}

§9.2 资源 URL 汇总

资源 URL 类型
ENCODE Portal https://www.encodeproject.org 主门户
SCREEN cCRE 浏览器 https://screen.encodeproject.org 工具
ENCODE GitHub (DCC) https://github.com/ENCODE-DCC 代码
ENCODE 管线 https://www.encodeproject.org/pages/pipelines 处理管线
AWS Registry of Open Data https://registry.opendata.aws/encode-project/ 云数据
RegulomeDB https://regulomedb.org 变异注释
HaploReg https://broadinstitute.org/mammals/haploreg 变异注释
Enformer (TF-Hub) https://tfhub.dev/deepmind/enformer/1 AI 模型
Basenji2 https://github.com/calico/basenji AI 模型
DeepSEA https://deepsea.princeton.edu AI 模型
Juicebox (Hi-C) https://aidenlab.org/juicebox 可视化
Dockstore (管线) https://dockstore.org 管线执行
ENCODE Profiles https://www.encodeproject.org/profiles/ 元数据 Schema
ENCODE Help https://www.encodeproject.org/help/getting-started/ 教程
modENCODE https://www.modencode.org 线虫/果蝇

§10 AI 使用声明卡

§10.1 数据来源声明

本条目描述的 ENCODE 数据由 NHGRI/NIH 资助的 ENCODE Project Consortium 生成,数据由 Stanford University Data Coordination Center (DCC) 统一处理与发布。所有数据通过 ENCODE Portal (encodeproject.org) 公开访问。

§10.2 许可证声明

ENCODE 数据以 CC BY 4.0 许可发布。学术与商业使用均免费,需署名来源。受控访问数据(部分人类原代组织)需通过 dbGaP 申请授权。

§10.3 引用建议

使用 ENCODE 数据时请引用:

  • ENCODE Project Consortium (2020). Nature 583:699-710. doi:10.1038/s41586-020-2493-4
  • Moore JE et al. (2026). Nature. doi:10.1038/s41586-025-09909-9
  • Kagda MS et al. (2025). Nat Commun 16:9592. doi:10.1038/s41467-025-64343-9

§10.4 人工校验表

检查项 状态
frontmatter 9 字段完整
JSON-LD @graph 含 MedicalWebPage + Dataset
INFOBOX 含 ICD-11 / SNOMED CT / DUO
§0 E-E-A-T 含权威来源 + 审核声明 + 免责
§1 含 30 秒速览 + 战略价值 + 对比表 + 时间轴
§2 含基因组学背景 + cCRE + GWAS + ICD-11
§3 含版本矩阵 + 实验类型 + 管线 + 格式 + 访问
§4 含标识系统 + 组件 + 元数据 + cCRE 结构
§5 含划分策略 + 轨道选择 + CRISPRi
§6 含 9 段代码 + 计算资源表 + 坑点表
§7 含偏倚 + QC + DAIMS 24 项 + 外部验证
§8 含基准 + 论文 Top 10 + 生态图 + 案例
§9 含 10 篇 BibTeX + 15 个资源 URL
§10 含声明 + 许可 + 引用 + 校验
页面状态:published(无未定稿字样)

§10.5 页面状态

本页面状态:published。所有模块已通过千方病案医学编辑部交叉审核。

返回 AI Ready 数据集