信息速览
ENCODE — 基因组功能元件百科全书 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | Encyclopedia of DNA Elements(ENCODE Project) |
| 发布方 | NHGRI 资助多机构联合体;Data Coordination Center(DCC)维护门户 |
| 启动/阶段 | 2003 pilot → 2007 生产 → 2012 Phase II(Nature 489:57-74)→ Phase III(Nature 583:699-710, 2020)→ ENCODE4(最终阶段,2025-2026 集中产出) |
| 门户规模 | 23,000+ 功能基因组学实验 / 800+ 功能表征实验 / 60,000+ 计算整合分析(Nat Commun 2025 口径) |
| cCRE 注册表 | 人类 237 万 + 小鼠 96.7 万候选顺式调控元件(ENCODE4,Nature 2026;UCSC track 精确数 2,348,854);八类分类 |
| biosamples | 1,679 个人类 biosamples(42 器官/组织;ENCODE3 为 839);四核心 assay 深度集 170 个 |
| 数据类型 | DNase/ATAC-seq、TF+组蛋白 ChIP-seq、RNA-seq(bulk+单细胞)、WGBS/RRBS、Hi-C/ChIA-PET、eCLIP、STARR-seq/MPRA/CRISPR |
| 处理方式 | DCC 统一处理管线(uniformly processed)——跨实验可比性 |
| 访问 | 门户检索 + REST API + 文件下载——无访问限制 |
| 使用规范 | 引用 Kagda 2025(门户)+ Moore 2026/2020(注册表)+ dataset accession(ENCSR/ENCFF) |
| 姊妹资源 | SCREEN(cCRE 检索服务器)、EN-TEx(配对组织)、REEN(cCRE 检索服务器)、EN-TEx(配对组织)、Roadmap Epigenomics、ENCORE/degron |
| 本库关联 | GTEx、ENCORE/degron |
| 本库关联 | GTEx(表达)、gnomAD/on |
| 本库关联 | GTEx(表达)、gnomAD/ClinVar(非编码变异)、TCGA(癌症表观) |
§0 E-(非编码变异)、TCGA(癌症表观) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、注册表口径与许可表述均核实自一手来源:ENCODE 数据门户(encodeproject.org,2026-09-19 检索)、ENCODE4 注册表论文(Moore et al. Nature, 2026-01-07;DOI 10.1038/s41586-025-09909-9)、门户论文(Kagda et al. Nat Commun 16:9592, 2025;DOI 10.1038/s41467-025-64343-9)、Phase III 论文(Moore et al. Nature 583:699-710, 2020)与 UCSC Genome Browser 新闻档案(2026-01-15 cCREs track 通告)。检索核实时间为 2026-09-19。
ENCODE 的数字随阶段与注册表版本滚动(「92.7 万 vs 237 万 cCREs」「839 vs 1,679 biosamples」等新旧口径并存),本页在各处显式标注版本;「237 万」是 ENCODE4 注册表论文口径,「2,348,854」是 UCSC track 的精确计数,两者指向同一数据集的不同呈现。本页为技术参考文档,不构成生物学或临床决策依据——cCRE 是「候选」顺式调控元件:生化信号注释不等于已验证的调控功能(§2.3、§6.5);任何「某 cCRE 调控某基因」的因果结论需要扰动实验(CRISPR/MPRA)闭环。
关于「功能」定义:ENCODE 2012 年「80% 基因组有生化活性」的新闻稿口径曾被广泛误读为「80% 基因组有功能」——这场著名争议的教训(定义先于数字)贯穿本页的口径纪律(§6.2)。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:调控基因组的功能元件公共底座——23,000+ 实验把「基因组哪里有调控活动」测成了结构化数据。
- 体量:23,000+ 实验 / 800+ 功能表征实验 / 60,000+ 整合分析;cCRE 注册表 237 万人类 + 96.7 万小鼠元件。
- 许可:无访问限制开放——门户/API/文件全免费;使用规范是引用论文与 accession。
- 杀手锏:统一处理管线(跨实验可比)+ cCRE 八类分类 + biosample 结构化元数据——「大规模功能基因组数据的可复现整合」的教科书。
- 适用:调控元件注释、非编码变异解释、GWAS 靶基因定位、调控预测模型训练域、细胞类型特异调控图谱。
- 不适用:表达定量主源(GTEx 更标准)、变异频率(gnomAD)、临床致病分类(ClinVar)。
§1.1 摘要
人类基因组编码约 2 万个蛋白,但与遗传性状关联的变异 90% 以上落在非编码区——「基因组哪里在调控、怎么调控」是后基因组时代的核心问题。ENCODE(Encyclopedia of DNA Elements)从 2003 年起用二十年时间系统回答它:NHGRI 资助的多机构联合体以标准化的 assay 矩阵(染色质可及性、TF 占用、组蛋白修饰、甲基化、3D 染色质、RNA-蛋白互作)扫描数百种细胞类型与组织,把「调控活动」变成可检索、可下载、可复现的公共数据。到 ENCODE4(最终阶段),数据门户开放 23,000+ 实验与 60,000+ 整合分析,注册表整合出 237 万人类候选顺式调控元件(cCREs,八类分类,覆盖 1,679 个 biosamples),功能表征实验(MPRA/CRISPR/转基因小鼠)覆盖超 90% 的人类 cCREs。
对 AI 团队,ENCODE 的价值在三个维度:
- 调控预测模型的标准训练域:cCRE 注册表 + 23,000 实验的信号矩阵是 Basenji/Enformer 类调控基因组深度模型的训练与评测底座——「序列 → 调控活性」监督数据的最大公共来源。
- 变异解释的调控证据层:GWAS/罕见非编码变异 → cCRE 注释 → 靶基因(3D 环 + eQTL)——Nature 2026 论文示范了 KLF1 与红细胞性状的因果定位全流程。
- 统一管线的可复现红利:DCC 对全部实验跑统一处理管线——「同一算法同一参数」的 processed 产物使跨实验室聚合从方法论冒险变成常规操作(对比各家 lab 自处理的不可比性)。
数据的第一性事实:ENCODE 的信号是调控活性的生化代理——DNase/ATAC 可及性、H3K27ac、CTCF 结合都是「调控正在发生」的证据而非「调控了什么」的证明;cCRE 是候选标签(candidate cis-Regulatory Element 的 C 是 candidate),因果链的最后一公里属于扰动实验。
§1.2 战略价值
- 非编码基因组的功能地图:人类基因组 98%+ 不编码蛋白——ENCODE 的 cCRE 注册表是「非编码空间的结构化注释」最系统的公共供给(237 万元件 ≈ 每 1 万 bp 基因组约 0.8 个候选调控元件)。
- 遗传学到功能的第一跳:GWAS hits(多数非编码)→ cCRE 富集 → 染色质环靶基因——「关联 → 机制」翻译管线的标准起点。
- 细胞类型分辨的调控参考:1,679 biosamples 的深度集——「同一 cCRE 在哪些细胞里活动」的语境层是疾病细胞特异性假设的原料。
- 方法学的公共基准:统一管线 + 标准元数据 schema(experiment/biosample/file 三层)——ENCODE 的数据治理模式被 GTEx/单细胞图谱等公共项目继承。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模量级 | 与 ENCODE 的关系 |
|---|---|---|---|
| ENCODE | 功能元件全谱(assay 矩阵 + cCRE registry) | 23,000+ 实验 / 237 万 cCREs | — |
| Roadmap Epigenomics | 参考表观基因组(组蛋白/甲基化) | 数十 reference epigenomes | 已并入 ENCODE 门户(历史资源) |
| FANTOM | CAGE 启动子/增强子转录图谱 | 万级启动子/增强子 | 转录层面互补(CAGE vs ChIP/可及性) |
| GTEx | 组织表达与 eQTL | 数十供体 × 数十组织 | 表达与 eQTL 层(ENCODE 提供元件层) |
| 表达与 eQTL 层(ENCODE 提供元件层) | |||
| BLUEPRINT | 血液表观基因组(欧洲) | 血液系样本 | 造血系统的 |
| EN-TEx | ENCODE4 配对组织项目 | 16 供体多组织 | ENCODE 子项目(等基因供体内比较) |
| SCREEN | cCRE 检索服务器 | ENCODE registry 的 Web 前端 | ENCODE 的查询入口(非独立数据源) |
| JASPAR | TF 结合 motif 库 | 数百 TF motif | motif 层(ENCODE ChIP-seq 的解释词典) |
| cistrome/ChIP-Atlas | ChIP-seq 聚合库 | 万级 ChIP-seq | 更大但无统一管线——ENCODE 策展度优先 |
§1.4 版本时间轴
2003 ENCODE pilot 启动(NHGRI;1% 基因组试点)
2007 生产阶段(scale-up 立项)
2012 Phase II 主论文(Birney et al. Nature 489:57-74;1,640 datasets/147 cell types;
「80% 生化活性」新闻稿口径引发功能定义争议)
2020 Phase III 论文(Moore et al. Nature 583:699-710;5,992 新数据集;
cCRE registry v1:92.7 万人类 + 33.98 万小鼠;SCREEN 上线)
2024 ENCODE4 数据生产高峰(ATAC/TF ChIP 扩容 2.3 倍)
2025 门户论文(Kagda et al. Nat Commun 16:9592;23,000+ 实验口径;
单细胞/新合集页/degron 矩阵上线)
2026-01 ENCODE4 cCRE 注册表(Moore et al. Nature;237 万人类 + 96.7 万小鼠;
八类分类;功能表征覆盖 90%+;KLF1 因果定位示范)
2026-01 UCSC 上线 ENCODE4 cCREs track(2,348,854;ENCODE3 track 存档保留)
§1.5 应用场景矩阵
- 调控元件注释:任何基因组区间 → cCRE 分类(promoter/enhancer/CTCF 等)+ 跨 biosample 活性。
- 非编码变异解释:罕见/常见变异 → cCRE 落点 + 细胞类型活性 → 调控破坏假设。
- GWAS 靶基因定位:性状位点 → cCRE 富集 → 3D 环/eQTL 连接基因(KLF1 示范流程)。
- 调控模型训练:序列 → 活性信号矩阵(Basenji/Enformer 类)训练域与评测集。
- 细胞图谱构建:biosample 分层的调控指纹——细胞类型特异性标记元件。
- 实验设计定位:CRISPR 靶点/报告基因构建的元件候选池(先 registry 后实验)。
§1.6 组件全景
ENCODE 的七个数据层:
- 实验层:23,000+ 实验——assay(ChIP/ATAC/RNA/WGBS/Hi-C/eCLIP)× biosample × target 的结构化矩阵;ENCSR 编号。
- 文件层:统一管线产物(bam/bigWig/bigBed/bed)——ENCFF 编号;原始 + processed 双形态。
- cCRE 注册表层:237 万人类 + 96.7 万小鼠候选元件——八类分类 + 跨 biosample 活性排名(SCREEN 提供 Web/API 检索)。
- 整合分析层:60,000+ 结果——imputation、预测、基因组注释(Encyclopedia 版本化发布)。
- 功能表征层:800+ 实验——STARR-seq/MPRA/CRISPR 扰动/转基因小鼠增强子测定(cCRE 的功能验证子集)。
- 专题合集层:deeply profiled cell lines、immune cells、Alzheimer’s(Rush 队列)、EN-TEx 配对组织、degron/ENCORE 蛋白 knockdown、human donors、单细胞实验。
- 元数据层:biosample/replicate/library/管线版本的结构化 schema——ENCODE 数据治理的核心资产。
§1.7 开放治理的经济学
- 资助结构:NHGRI 长期资助(生产实验室 + DCC 双轨)——「联邦资助 → 无限制开放」的美国模式代表;二十年不辍是「持续公共品」的罕见样本。
- 开放的网络效应:无访问限制使 ENCODE 成为 UCSC/的网络效应**:无访问限制使 ENCODE 成为 UCSC/Ensembl/AnnotationHub 等二级平台的标准数据源——「被/AnnotationHub 等二级平台的标准数据源——「被集成」比「被引用」更能固化生态位。
- 统一管线的隐性投入:DCC 维护管线本身是大量工程投入——它把「数据可比性」从每个使用者的负担变成公共品,这是 ENCODE 区别于聚合库的本质。
- 使用者的隐性成本:数据开放但「用好」有成本——biosample 分层、管线版本核对、cCRE 候选属性的正确理解是方法学工作量(§5、§6.5)。
§1.8 ENCODE 在研究流程中的定位
GWAS/变异发现 → 元件注释 → 靶基因定位 → 机制假设 → 实验验证
│ │ │ │
│ ├─ ENCODE:cCRE 落点与分类(元件层)
│ ├─ ENCODE:biosample 活性谱(细胞语境层)
│ ├─ ENCODE:Hi-C/ChIA-PET(空间连接层)
│ └─ ENCODE:MPRA/CRISPR 先例(验证方法参照)
└─ gnomAD/ClinVar(变异主源)→ GTEx(表达与 eQTL)→ 实验闭环
| 流程阶段 | ENCODE 角色 | 典型用法 | 验收标准 |
|---|---|---|---|
| 变异注释 | 元件层注释 | 变异是否落入 cCRE + 何类 | 与 VEP/ANNOVAR 管线一致 |
| 细胞语境 | 活性谱分层 | 疾病相关细胞类型的元件活性 | biosample 分层不混样 |
| 靶基因 | 空间连接 | cCRE-启动子环 + eQTL 共证据 | 双证据(3D + eQTL) |
| 假设排序 | 功能先验 | 表征实验覆盖的 cCRE 优先 | 候选池收敛率 |
| 验证设计 | 方法参照 | MPRA/CRISPR 方案的既有协议 | 引用先例实验 |
定位纪律:ENCODE 覆盖「哪里有调控」最厚,「调控了什么、怎么调控」要靠 GTEx/扰动实验补全——元件层不背靶基因结论的全责。
§2 医学与科学背景
§2.1 功能基因组学矩阵:assay 家族语义
- 染色质可及性(DNase/ATAC):「哪里有开放染色质」——调控活性的第一道代理;DNase 是历史主 assay(注册表锚定 rDHSs),ATAC 在 ENCODE4 扩容(低起始量、新增 biosample 的主力)。
- TF ChIP-seq:「哪个转录因子在这里结合」——cCRE 分类里的 TF/CA-TF 类的来源;ENCODE4 纳入数千 TF ChIP 数据集使「无组蛋白修饰但有 TF 结合」的元件浮出。
- 组蛋白修饰 ChIP:H3K4me3(启动子)/H3K27ac(活性增强子)/CTCF(绝缘锚)——cCRE 八类分类的三大信号轴;全修饰 panel 用于深层注释。
- 表达(RNA-seq/CAGE):基因/转录本定量——调控证据的「下游读出」;与元件层连接成 cis 调控假设。
- 甲基化(WGBS/RRBS):启动子甲基化与沉默——抑制性语境层。
- 3D 染色质(Hi-C/ChIA-PET):「谁连着谁」——cCRE 到靶基因的空间桥;ChIA-PET 以 CTCF/Pol II 为锚的环 call 是靶基因定位的主力。
- RNA-蛋白(eCLIP):RBP 结合位点——RNA 调控层(剪接/稳定性)。
- 功能表征(MPRA/STARR/CRISPR/转基因):「扰动后活性变化」——从相关性到因果的桥梁(800+ 实验,覆盖 90%+ cCREs 的表征数据是 ENCODE4 的跃升点)。
§2.2 cCRE 注册表:从信号堆到元件词典
- 构造逻辑:锚定 rDHSs(代表性 DNase 超敏位点)→ 跨 biosample 的可及性/修饰信号整合 → 按信号组合 + TSS 距离分类——「先收敛到候选位点,再按语境分类」。
- 八类分类:promoter(启动子样)/TSS-proximal enhancer-like(dELS 近端)/TSS-distal enhancer-like(dELS 远端)/CA-H3K4me3/CA-CTCF/CA-TF/CA/TF——前三类继承 ENCODE3,后三类(CA-TF/CA/TF)是 ENCODE4 新增(纳入 TF ChIP + ATAC 后「低修饰但有 TF 结合」区域被识别)。
- ENCODE4 的扩容从哪来:数据扩容(实验 2.3 倍、biosamples 839→1,679)+ 管线改进(重复位点/Alu 区恢复)+ 分类新增——237 万 vs 92.7 万的差不是同一集合的膨胀,是覆盖与分辨率的升级。
- 正确读法:cCRE 数量增加 ≠「基因组 90% 是调控元件」的翻版——分类标签是「生化信号组合」的描述,不是功能断言(§2.3)。
§2.3 候选与验证的鸿沟
- 生化信号 vs 调控功能:H3K27ac 高 + 可及性开 =「像活性增强子」,但「这个元件在 this 语境调控 that 基因」需要扰动证据——ENCODE4 的功能表征层(MPRA/CRISPR 覆盖 90%+ cCREs)正是填这条沟的规模化尝试。
- 双角色元件:ENCODE4 发现数千个 silencer(沉默子)cCREs——同一元件在不同细胞语境可扮演增强子与沉默子——「一元一功能」的心智模型过时了。
- 语境是变量:同一 cCRE 在 1,679 biosamples 里的活性分布是宽谱到特异的连续谱——「细胞类型特异调控」的声明必须给出活性排名证据(SCREEN 的 dnase 排名层)。
- 报告纪律:引用 cCRE 时带 accession + 分类 + 证据类型(生化/表征)——只写「ENCODE 增强子」是审稿人常见的退回理由。
§2.4 「80% 功能」争议:口径先于数字
- 事件:2012 Phase II 论文同时发布的新闻稿称「80% 的基因组有生化活性(biochemical activity)」——媒体转译为「80% 基因组是有功能的(functional)」——引发「垃圾 DNA 之死」的传播与学术反弹。
- 分歧本质:「生化活性」(有转录/结合/修饰信号)≠「选择压力下的功能」(进化意义上的 functional)——ENCODE 的宽定义把随机转录噪声与弱结合也计入「活性」。
- 对 AI 团队的教训:① 引用数字先查定义域(活性/功能/效应);② 「标签泄漏」同构问题——把代理指标当目标语义训练,模型的「功能预测」其实是「信号预测」;③ 这场争议使后来所有 ENCODE 文档在措辞上极度谨慎(本页全部沿用「候选元件/生化信号」语言)。
§2.5 与遗传变异的连接层
-
非编码丰富度:nt-connection}
-
非编码丰富度:GWAS catalog 的显著位点 90%+ 在非编码区——cCRE 落点是它们的 的显著位点 90%+ 在非编码区——cCRE 落点是它们的第一层功能注释。
-
三条连接路径:① 位置(变异在 cCRE 内)→ ② 语境(该 cCRE 在疾病相关细胞类型有活性)→ ③ 机制(3D 环连接启动子 + eQTL 共定位)——KLF1/红细胞性状是 ENCODE4 论文的端到端示范(位置+语境+机制全通)。
-
工程要点:cCRE 落点注释要锁 genome build(hg38);活性语境要用 SCREEN 的 biosample 分层数据而非聚合 track;3D 连接用 ENCODE ChIA-PET/Hi-C 子集或外部(pcHi-C)数据。
-
边界:cCRE 富集是关联证据——临床变异分级(ACMG)中只能作辅助(PS4 类比层面),不构成致病独立证据。
§2.6 与监管/疾病语义的边界
ENCODE 提供「元件与活性」——疾病语义(哪个元件的破坏导致什么病)需要 eQTL/GTEx/ClinVar/文献闭环:元件层(ENCODE)+ 表达层(GTEx)+ 变异层(gnomAD/ClinVar)三栈组合是当前非编码遗传解释的事实标准——本库条目间互链即按此分工设计。
§2.7 AI 视角的科学定位
对医疗 AI,ENCODE 是「调控空间的经验密度图」:23,000 实验的信号矩阵 + 237 万元件的分类标签——调控预测(序列→活性)的监督源、变异解释的证据层、细胞图谱的元件字典。它的短板(候选属性、biosample 异质、相关性非因果)都是「生化扫描」范式的固有代价——用它的方法论核心与 ChEMBL/AFDB 同构:「带证据等级用数据」——生化/表征/因果三档证据的显式区分是 ENCODE 世界的 confidence 分级。
§2.8 单细胞与新合集的扩展语义
- 单细胞实验层(2025 门户升级):bulk 的「平均信号」对混合细胞群会稀释细胞特异调控——单细胞层把「哪个细胞类型开哪个元件」的分辨率推到簇级。
- EN-TEx 配对组织:同基因供体的多组织配对(16 供体)——个体内组织差异的干净比较(消除个体基因型混杂)。
- 疾病合集(Rush Alzheimer’s):疾病脑区的表观组数据——神经退行研究的调控语境。
- degron/ENCORE:蛋白 knockdown 后的转录响应——调控网络的因果扰动层(从「结合」到「敲掉后怎样」)。
§2.9 调控破坏与疾病的语义链
- 疾病语义的四级链:变异 → 元件破坏(cCRE 落点 + 语境)→ 基因失调(eQTL/表达)→ 疾病表型——ENCODE 覆盖中间两级,两头(变异主源/表型主源)靠 gnomAD/ClinVar/疾病数据库。
- 多效性与 pleiotropy:同一 cCRE 在不同细胞语境驱动不同基因——「一个元件多种疾病」的共享位点现象(如免疫性状簇)在 cCRE 语境层有直接解释。
- 癌症的调控重编程:肿瘤的增强子重编程(super-enhancer 劫持)使 ENCODE 的正常语境成为「基线」——TCGA 差异是疾病分支(本库 TCGA 条目)。
- 药理归宿:靶基因确认后 → 成药语义(DrugBank)/活性证据(ChEMBL)——调控链的最终价值出口;元件本身也可成药(靶向 TF-DNA 结合的分子),但那是另一门技术。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格(ENCODE4 口径,另注明旧版) |
|---|---|
| 阶段 | ENCODE4(最终阶段;2025-2026 集中发布) |
| 门户实验 | 23,000+ 功能基因组学实验 |
| 表征实验 | 800+(STARR/MPRA/CRISPR/转基因小鼠) |
| 整合分析 | 60,000+ 结果(imputation/预测/注释) |
| cCRE(人类) | 237 万(UCSC track 精确数 2,348,854;ENCODE3:92.7 万) |
| cCRE(小鼠) | 96.7 万(ENCODE3:33.98 万) |
| biosamples | 1,679(42 器官组织;ENCODE3:839);核心集 170 |
| 分类 | 8 类(5 类继承 + CA-TF/CA/TF 新增) |
| 功能表征覆盖 | >90% 人类 cCREs |
| 基因组版本 | hg38/GRCh38(新);hg19/GRCh37(旧存档) |
| 访问 | 门户 + REST API + 文件——无访问限制 |
| 使用规范 | 引用 Kagda 2025 + Moore 2026 + accession |
| 门户版本 | v134.5-hotfix-1(2026-09 检索时点) |
§3.2 ENCODE4 相对 ENCODE3 的增量地图
| 维度 | ENCODE3(2020) | ENCODE4(2025-2026) | 含义 |
|---|---|---|---|
| 人类 cCREs | 926,535 | 2,348,854(2.37M 论文口径) | 数据扩容 + 管线改进 + 分类新增 |
| 小鼠 cCREs | 339,815 | 967,000 | 同步扩容 |
| biosamples | 839 | 1,679(42 器官) | 组织/细胞状态覆盖翻倍 |
| 核心集(四 assay) | 25 | 170(近 7 倍) | 深度表征的跨细胞可比性 |
| 可及性+ChIP 实验 | — | 2.3 倍于 ENCODE3 | ATAC/TF ChIP 是扩容主力 |
| 分类 | 5 类 | 8 类(+CA-TF/CA/TF) | 低修饰 TF 结合区的识别 |
| 功能表征 | 散点 | >90% cCREs 覆盖 | 候选→功能特征化的跃升 |
| 新科学 | — | silencer cCREs;KLF1 因果示范 | 双角色元件 + GWAS 整合闭环 |
解读:ENCODE4 的主题是「从信号地图到功能词典」——数量翻倍只是表象,真正的跃升是「功能表征覆盖 90%+」使每个 cCRE 附近都有扰动证据可查,以及八类分类对 TF 驱动元件的识别。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 元件覆盖 | 10/10 | 237 万 cCREs——非编码注释最系统 |
| D2 | 信号深度 | 9/10 | 23,000 实验 + 1,679 biosamples |
| D3 | 功能验证 | 8/10 | 表征覆盖 90%+ 但多为批量 readout |
| D4 | 语境元数据 | 10/10 | biosample/replicate/管线版本 schema 标杆 |
| A1 | 机器可读 | 10/10 | REST API + 结构化文件 + 统一格式 |
| A2 | 文档完备 | 9/10 | 门户 help/tutorials + 论文 |
| A3 | 接入成本 | 10/10 | 无注册无门槛 |
| A4 | 更新机制 | 9/10 | 滚动发布 + 版本化 Encyclopedia |
| I1 | 指标标准化 | 9/10 | 统一管线;管线版本演进需注意 |
| I2 | 可复现性 | 10/10 | accession 体系 + 管线开源 |
| M1 | 多模态对齐 | 9/10 | assay×biosample×元件三层对齐 |
| M2 | 时间序列 | 7/10 | 阶段快照可考;单实验无时间序列 |
| S1 | 数据安全 | 10/10 | 无个体可识别数据(供体匿名) |
| S2 | 合规负担 | 10/10 | 无限制开放 |
总分:A 级(数据治理与开放度双满分档;扣分项集中在「候选属性与因果鸿沟」这一科学固有属性)
§3.4 存储与计算需求
| 数据件 | 体量 | 最小分析环境 |
|---|---|---|
| cCRE registry(bed/tsv) | 数百 MB | 笔记本 |
| 单实验 processed(bigWig/bed) | 数百 MB-数 GB | 单机 |
| 全部信号矩阵切片(SCREEN) | 按需 | 单机 |
| 数百实验批量(建模语料) | TB 级 | 对象存储 + 并行 |
| 门户 API 抽取 | 按需 | 笔记本即可 |
ENCODE 是「子集友好」型资源——绝大多数任务(注释/落点/检索)只需 registry + 少量 bigWig;建模语料才需要批量对象存储。
§3.5 获取通道
- 门户检索:encodeproject.org——experiment/biosample/assay/target 组合过滤 + cart 批量。
- SCREEN:screen.encodeproject.org——cCRE 注册表的专用检索(按坐标/分类/biosample 活性)。
- REST API:/search/?type=Experiment&format=json——元数据与文件 URL 编程化获取。
- 文件直链:ENCFF 编号 → bigWig/bed 直接下载(HTTPS/FTP)。
- UCSC/Ensembl track:ENCODE4 cCREs track(2026-01-15 上线 hg38)——浏览器与 AnnotationHub 生态入口。
§3.6 口径对齐表
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| 23,000+ 实验 / 800+ 表征 / 60,000+ 整合分析 | Kagda et al. Nat Commun 2025(门户论文) | 2025 时点官方口径 |
| 人类 237 万 cCREs / 小鼠 96.7 万 | Moore et al. Nature 2026(注册表论文) | 论文四舍五入口径 |
| 人类 2,348,854 | UCSC ENCODE4 cCREs track(2026-01-15) | 精确计数 |
| 92.7 万 / 33.98 万(7.9%/3.4% 基因组) | Moore et al. Nature 2020(ENCODE3) | 注册表 v1 基线 |
| 5,992 新数据集 | ENCODE3 论文 | Phase III 增量 |
| 1,640 datasets / 147 cell types | Birney et al. Nature 2012 | Phase II 历史口径 |
| 839 → 1,679 biosamples / 25 → 170 核心集 | Nature 2026 论文 | ENCODE3→4 对比 |
| 「80% 基因组生化活性」 | 2012 新闻稿(争议口径) | 活性 ≠ 功能——§2.4 |
§3.7 版本选择纪律
- 注册表版本:cCRE 落点注释声明 registry 版本(ENCODE3 vs ENCODE4)——两个版本元件集合不可混拼。
- genome build:新任务一律 hg38;旧 hg19 数据 liftover 或重拉——cCRE 坐标对 build 敏感。
- 管线版本:bigWig/bed 文件页标 pipeline version——跨实验聚合时记录; uniform pipeline 演进期(如 ENCODE4 新版)旧产物不重算,注意版本混层。
- Encyclopedia 版本:整合注释(含 imputation)按 release 检索——引用锁 release 号。
§3.8 cCRE 八类分类工程详表
| 类别 | 信号组合(TSS 距离 + 修饰/可及性) | 典型解释 | 使用建议 |
|---|---|---|---|
| promoter | 高可及性 + H3K4me3 + 近 TSS(±) | 启动子/近启动子 | 与基因表达联动分析 |
| TSS-proximal enhancer-like(PLS) | H3K27ac + 近 TSS(1-2kb 内) | 近端增强子样 | 表达 cis 影响优先 |
| TSS-distal enhancer-like(dELS) | H3K27ac + 远端 | 远端增强子样 | 3D 环连接靶基因的主场 |
| CA-H3K4me3 | 可及性 + H3K4me3(远端) | 远端启动子样 | 非经典启动子假设 |
| CA-CTCF | 可及性 + CTCF | 绝缘/拓扑锚 | TAD 边界分析 |
| CA-TF(新) | 可及性 + TF 结合(无修饰富集) | TF 驱动调控 | 低修饰调控区——ENCODE4 新识别 |
| CA(新) | 仅可及性 | 未分化角色 | 探索层 |
| TF(新) | TF 结合(低可及性) | 弱占用/长尾结合 | 证据最弱层——仅参考 |
- 统计基准:PLS/dELS 是 enhancer 主体(占多数);CA-TF/CA/TF 三类是 ENCODE4 新增的「长尾层」——用它们做强结论要慎重。
- 分类是描述不是断言:类别 = 信号组合的命名——「enhancer-like」直译「像增强子」;审稿对措辞敏感(§2.3)。
- 与活性排名联动:同一类元件在 1,679 biosamples 的活性差异巨大——分类回答「像什么」,SCREEN 排名回答「哪里开」。
§4 数据结构
§4.1 门户元数据 schema
ENCODE 门户对象模型(REST API)
├── Experiment(ENCSR…) # 实验主对象
│ ├── assay_term_name # ChIP-seq / ATAC-seq / total RNA-seq / ...
│ ├── biosample_terminology # 组织/细胞系/供体/状态
│ ├── target # ChIP 的 TF 或组蛋白修饰
│ ├── replicates # 生物学重复(≥2 为标准)
│ └── related_files # → File 对象
├── File(ENCFF…) # 文件对象
│ ├── file_format # bam / bigWig / bigBed / bed / tsv
│ ├── output_type # aligned / signal p-value / peaks / ...
│ ├── assembly # GRCh38 / mm10
│ ├── pipeline_version # 统一管线版本号
│ └── dataset(→ Experiment)
├── Biosample # 供体/组织/处理的结构化描述
├── Annotation(ENC- 集合) # 整合产物(cCRE registry / Encyclopedia)
└── Publication / Award # 文献与资助溯源
ENCSR(实验)/ENCFF(文件)/ENC-(整合集)三级编号体系是引用与复现的锚——任何分析产物都应能回溯到这三级。
§4.2 cCRE 落点注释批量代码
#!/usr/bin/env python3
"""变异位点 → cCRE 落点注释:registry bed + pybedtools/手写区间树。
registry 下载:https://screen.encodeproject.org/(ENCODE4 cCREs bed)。"""
import pandas as pd
from intervaltree import IntervalTree
# 1) 载入 registry(hg38;八类分类在 name 列)
reg = pd.read_csv("encod4_ccres_hg38.bed", sep="\t", header=None,
names=["chrom", "start", "end", "ccre_id", "plddt_like_class"])
trees = {c: IntervalTree() for c in reg.chrom.unique()}
for r in reg.itertuples(index=False):
trees[r.chrom[r.chrom.find("chr"):] if r.chrom.startswith("chr") else r.chrom][r.start:r.end] = (r.ccre_id, r.plddt_like_class)
# 2) 变异位点注释
variants = pd.read_csv("variants_hg38.tsv", sep="\t") # chrom/pos 列
def annotate(row):
hits = trees.get(row.chrom, IntervalTree()).at(row.pos - 1)
if not hits:
return "intergenic_no_ccre"
_, (cid, cls) = sorted(hits)[0]
return f"{cid}|{cls}"
variants["ccre_annotation"] = variants.apply(annotate, axis=1)
print(variants.ccre_annotation.str.split("|").str[-1].value_counts())
§4.3 REST API 批量抽取
#!/usr/bin/env python3
"""ENCODE 门户 REST API:按 assay+biosample 拉实验与文件清单(无鉴权)。"""
import requests, pandas as pd
BASE = "https://www.encodeproject.org/search/"
def search_experiments(assay: str, biosample: str, limit: int = 200) -> pd.DataFrame:
rows, offset = [], 0
while offset < limit:
r = requests.get(BASE, params={
"type": "Experiment", "assay_term_name": assay,
"biosample_ontology.term_name": biosample,
"status": "released", "format": "json",
"limit": 50, "offset": offset},
headers={"Accept": "application/json"}, timeout=60)
r.raise_for_status()
batch = r.json()["@graph"]
if not batch:
break
rows.extend(batch)
offset += 50
return pd.DataFrame([{
"accession": e.get("accession"),
"assay": e.get("assay_term_name"),
"biosample": (e.get("biosample_summary") or ""),
"target": (e.get("target") or {}).get("label") if e.get("target") else None,
} for e in rows])
if __name__ == "__main__":
df = search_experiments("ATAC-seq", "K562")
df.to_csv("encode_atac_k562.tsv", sep="\t", index=False)
print(len(df), "experiments")
§4.4 bigWig 信号切片
#!/usr/bin/env python3
"""跨 biosample 的 cCRE 信号矩阵:bigWig 切片(pyBigWig)。"""
import pyBigWig, pandas as pd, numpy as np
reg = pd.read_csv("encod4_ccres_hg38.bed", sep="\t", header=None,
names=["chrom", "start", "end", "id", "cls"])
bw_paths = { # biosample → 统一管线 bigWig(DNase 或 H3K27ac)
"K562": "ENCFFxxxxxxx.bigWig",
"GM12878": "ENCFFyyyyyyy.bigWig",
"hepatocyte": "ENCFFzzzzzzz.bigWig",
}
mat = {}
for sample, path in bw_paths.items():
bw = pyBigWig.open(path)
vals = [bw.values(r.chrom, r.start, r.end, numpy=True).mean()
for r in reg.itertuples(index=False)]
mat[sample] = np.nan_to_num(np.array(vals), nan=0.0)
bw.close()
sig = pd.DataFrame(mat, index=reg.id)
sig.to_csv("ccre_signal_matrix.tsv", sep="\t")
print(sig.shape, "| top biosample:", sig.idxmax(axis=1).value_counts().head(3).to_dict())
(该矩阵即「元件 × 细胞」活性表——变异语境解释与细胞特异假设的主原料。)
§4.5 元数据与版本指纹
- accession 双戳:分析引用每个实验/文件的 ENCSR/ENCFF 编号——方法段列 accession 清单。
- registry 版本:cCRE bed 的发布版本(ENCODE4 2026-01)+ SCREEN 下载日期。
- 管线版本:批量下载时记录每文件的 pipeline_version 字段——版本混层是复现隐患。
§4.6 完整性清单
- [ ] genome build(hg38)与 registry 版本双声明
- [ ] cCRE 分类含义(八类)引用与措辞(「候选」「like」)
- [ ] biosample 分层策略(细胞系/原代/类器官分开)
- [ ] 文件 pipeline_version 记录
- [ ] accession 清单进方法段或补充材料
- [ ] GWAS 整合的三证据链(位置/语境/机制)逐级报告
- [ ] 「候选元件」limitation 段落
- [ ] 重复 biosample 的非独立性问题处理
§4.7 数据血缘
NHGRI 资助生产实验室(测序实验)
→ DCC 接收与元数据建模(ENCSR/ENCFF)
→ 统一处理管线(比对/峰值/信号;版本化)
→ 整合计算(rDHS 锚定 → cCRE 分类 → registry)
→ 功能表征实验(MPRA/CRISPR/转基因;>90% 覆盖)
→ 发布(门户/SCREEN/UCSC track/API)
「实验 → 管线 → 整合 → 表征 → 发布」五级血缘以 accession 为键全部可溯——与 ChEMBL 的「文献 → 策展 → 发布」同构,都是「每个数字有裁决史」的策展型数据库。
§4.8 三证据链整合代码:GWAS 位点 → 靶基因
#!/usr/bin/env python3
"""三证据链整合:cCRE 落点(位置)× biosample 活性(语境)× 环连接/eQTL(机制)。
输入:GWAS lead SNPs(hg38)、ENCODE4 registry、信号矩阵、ChIA-PET 环、GTEx eQTL。"""
import pandas as pd
snps = pd.read_csv("gwas_leads_hg38.tsv", sep="\t") # chrom/pos/snp/trait
reg = pd.read_csv("encod4_ccres_hg38.bed", sep="\t", header=None,
names=["chrom", "start", "end", "ccre_id", "cls"])
sig = pd.read_csv("ccre_signal_matrix.tsv", sep="\t", index_col=0) # cCRE × biosample(§4.4)
loops = pd.read_csv("chiapet_immune_loops_hg38.tsv", sep="\t") # chrom_a/start_a/end_a/chrom_b/start_b/end_b
eqtl = pd.read_csv("gtex_eqtl_immune.tsv", sep="\t") # variant_id/gene_id/pval
# 链 1(位置):SNP → cCRE 落点
hits = []
for s in snps.itertuples(index=False):
m = reg[(reg.chrom == s.chrom) & (reg.start <= s.pos - 1) & (s.pos - 1 < reg.end)]
for r in m.itertuples(index=False):
hits.append({"snp": s.snp, "ccre": r.ccre_id, "cls": r.cls})
pos = pd.DataFrame(hits)
# 链 2(语境):落点 cCRE 在免疫 biosample 的活性排名(取矩阵列的前 10% 为「开」)
immune_cols = [c for c in sig.columns if c.startswith(("T_cell", "B_cell", "monocyte"))]
open_thr = sig[immune_cols].stack().quantile(0.90)
pos["immune_active"] = pos.ccre.map(lambda c: bool((sig.loc[c, immune_cols] >= open_thr).any()))
# 链 3(机制):cCRE 与启动子的环连接 → 靶基因;eQTL 共定位交叉
def target_genes(row):
l = loops[(loops.chrom_a == "chrX") & (loops.start_a <= 2e9)] # 实际按 cCRE 坐标过滤
return tuple(sorted(set(l.gene_b))) # 环 B 端的基因
pos["loop_targets"] = [target_genes(r) for r in pos.itertuples(index=False)]
pos["eqtl_support"] = pos.snp.isin(set(eqtl.variant_id))
# 汇总:三链全通 = 强假设
pos["evidence_grade"] = pos.apply(
lambda r: "strong" if (r.immune_active and r.loop_targets and r.eqtl_support)
else ("moderate" if (r.immune_active and (r.loop_targets or r.eqtl_support)) else "annotation"),
axis=1)
print(pos.evidence_grade.value_counts())
pos.to_csv("gwas_ccre_evidence_chain.tsv", sep="\t", index=False)
(此表即 §7.6 案例的核心产物——evidence_grade 列直接进实验验证队列排序。)
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪些数据件 | 关键过滤 | 陷阱 |
|---|---|---|---|
| 变异元件注释 | cCRE registry bed | build 一致 | 忘记「候选」措辞 |
| 细胞语境 | SCREEN 信号矩阵 | biosample 分层 | 混样聚合 |
| GWAS 靶基因 | registry + Hi-C/ChIA-PET + eQTL | 三证据链 | 单位置证据当结论 |
| 调控模型训练 | 信号矩阵 + 序列 | 管线版本统一 | 跨版本混训 |
| 增强子优先级 | registry + 表征实验 | 功能证据档位 | CA/TF 长尾层当强证据 |
| 细胞图谱 | 全 biosample 信号 | 核心集优先 | 非核心 biosample 稀疏偏差 |
§5.2 非编码变异解释协议
- 位置层:变异 → cCRE 落点(§4.2)——记录分类与坐标(hg38)。
- 语境层:该 cCRE 的跨 biosample 活性 → 疾病相关细胞类型的活性排名——「在对的细胞里开着吗」。
- 机制层:3D 连接(ENCODE ChIA-PET/外部 pcHi-C)+ eQTL 共定位(GTEx)→ 候选靶基因。
- 证据分级:三链全通 = 强假设(KLF1 模式);只通位置 = 注释事实;审稿口径按档报告。
- 验证设计:候选收敛后 → MPRA/CRISPRi 方案(引用 ENCODE 表征实验的既有协议)。
§5.3 调控模型训练协议
- 输入:参考基因组序列窗(如 1kb/2kb);标签:cCRE 分类 one-hot 或跨 biosample 活性回归(SCREEN 矩阵)。
- 切分:按基因组坐标分块切分(如按染色体/按 Mb 块)防近邻泄漏——随机切分在基因组任务是经典错误(同 ChEMBL 的 scaffold 纪律)。
- 基线:序列 one-hot + CNN(Basenji 简化版)与梯度提升(k-mer 特征)双基线。
- 评测:分类 AUC/PR 分 cCRE 类别报告 + 回归 RMSE 分 biosample 报告——长尾类(CA/TF)单独列。
- 版本声明:registry 版本 + 信号文件 pipeline_version + build 三件套进方法段。
§5.4 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 变异注释批次 | registry bed + 区间树 | 零;分钟级 |
| 单 biosample 信号 | bigWig 切片 | 单机;小时级 |
| 数十 biosample 矩阵 | 并行切片 | 单机;天级 |
| 全基因组模型训练 | GPU 单卡-多卡 | GPU 小额;数天 |
| MPRA 验证设计 | 引用先例 + oligo 合成外包 | 实验预算;数周 |
§5.5 失败模式清单
- build 混拼:hg19 变异 vs hg38 registry——落点全错;build 一致性第一检查。
- 候选当结论:cCRE 分类直接写成「增强子」——措辞纪律(like/candidate)。
- 混样聚合:1,679 biosamples 不分层求平均——细胞特异信号被稀释。
- 长尾类当强证据:CA/TF 类做核心结论——信号组合最弱层。
- 单证据链靶基因:只有位置没有 3D/eQTL——KLF1 模式要求三链。
- 基因组任务随机切分:近邻泄漏——坐标块切分。
- 管线版本混层:新旧 pipeline 产物同矩阵——版本记录与敏感性分析。
- 聚合 track 当分层数据:用 aggregated signal 回答细胞特异问题——SCREEN 分层是正解。
§5.6 校准与验证协议
| 验证层 | 数据源 | 指标 | 通过线(参考) |
|---|---|---|---|
| L1 注释一致性 | 重叠外部库(Roadmap/FANTOM) | 落点重叠率 | 与文献口径一致 |
| L2 活性排名校准 | 表达数据(GTEx)交叉 | 元件活性-基因表达相关 | cis 对相关显著 |
| L3 功能表征对照 | MPRA/CRISPR 结果 | 分类与功能活性一致性 | PLS/dELS 富集于活性 |
| L4 模型校准 | 保留染色体 | 分类别 AUC/RMSE | 长尾类单独报告 |
| L5 前瞻衔接 | 扰动实验队列 | 假设验证率 | 与模型排序正相关 |
- L2 是性价比之王:cCRE 活性与最近基因表达的 cis 相关是「信号-功能」连接的最快体检——不相关批次的下游分析应叫停。
- L3 的读法:表征覆盖 90%+ 意味着多数类别的 MPRA readout 可查——分类与功能活性不一致的元件群(如部分 dELS 无活性)是「生化信号 ≠ 功能」的直接案例,进 limitation。
§5.7 MPRA/CRISPRi 验证设计协议
- 候选收敛:证据链分级(strong/moderate/annotation)→ 验证预算内的 Top-N(典型 100-1,000 元件)——表征先例(ENCODE 800+ 实验)优先。
- MPRA 设计:每个候选元件 200bp 窗 + 参考与变异等位双 oligo(若做变异效应)× 10+ barcodes——oligo 合成外包,文库转染进语境匹配的细胞(§7.9:语境错配是主坑)。
- CRISPRi 设计:dCas9-KRAB 靶向元件中心 + 表型/表达 readout——验证内源性语境下的调控作用(比 MPRA 更接近真实染色质)。
- 对照体系:已知增强子(ENCODE 表征实验的正例)+ scrambled 序列——每批次带对照是审稿底线。
- 统计:barcode 级混合模型(不是 oligo 均值 t 检验);多重校正按 BH;效应方向与预测排序的秩相关是主指标。
§6 实证结果与方法学分析
§6.1 ENCODE4 注册表的核心信号(2026-01)
- 规模信号:237 万人类 cCREs / 1,679 biosamples——非编码调控空间的公共注释达到「每元件可按细胞查询」的分辨率。
- 方法信号:功能表征(MPRA/CRISPR/转基因)覆盖 >90% cCREs——「候选注册表」开始自带功能证据层,是 2020 版无法想象的跃升。
- 科学信号:数千 silencer cCREs + 双角色元件——「元件功能是语境函数」的直接证据;TF 三新类的加入使「低修饰调控区」第一次进词典。
- 转化信号:KLF1/红细胞性状的因果定位示范——GWAS→cCRE→靶基因→因果的全链在注册表论文内完成,成为领域方法学模板。
§6.2 功能基因组学公共化的系统教训
- 「80% 争议」的余波:2012 年的口径风波使 ENCODE 后续所有文档采用「候选/活性/like」措辞——公共数据库的表述纪律直接来自传播事故。
- 统一管线的胜利:跨实验室数据可比性从「不可能」变成「默认」——DCC 模式被 GTEx/单细胞图谱复刻,证明「处理即治理」。
- 候选→功能的渐进闭环:从 2012(信号目录)→ 2020(cCRE registry)→ 2026(90% 功能表征覆盖)——公共项目用两轮迭代完成「相关性数据到功能性词典」的升级,速度不快但方向从未动摇。
- AGCT 之外的治理资产:biosample schema/管线版本/accession 体系——ENCODE 的数据治理模式本身是它最重要的副产品。
§6.3 方法学三层框架(gsm)
- G(Ground layer):实验信号(peaks/bigWig)——机器可测,低争议。
- S(Synthesis layer):cCRE 分类/活性排名/整合注释——推断层(分类是信号组合的命名)。
- M(Medical layer):靶基因/疾病机制/临床解释——语义层(需三证据链与实验闭环)。
越层引用是常见错误:用 S 层分类说「该元件调控该基因」(M 层)、用 G 层单一 peak 说「增强子确认」——审稿按层问责,与 ChEMBL/AFDB 的纪律同构。
§6.4 接力实验设计
- ENCODE → GTEx:cCRE 语境 → eQTL/表达连接(靶基因闭环)。
- ENCODE → gnomAD/ClinVar:元件落点 → 变异频率/致病性(变异主源核对)。
- ENCODE → TCGA:调控元件 → 癌症表观(增强子重编程语境)。
- ENCODE → MPRA/CRISPR 实验:注册表 → 扰动验证(因果最后一公里)。
§6.5 八个真实坑点
- 坑点 1:候选当已验证——cCRE 的 C 是 candidate;表述与结论分级都要带「候选」。
- 坑点 2:build 混拼——hg19/hg38 落点全错;build 一致性先于一切。
- 坑点 3:混样聚合——不分 biosample 层的平均是信号稀释器。
- 坑点 4:长尾类当强证据——CA/TF 新类是探索层。
- 坑点 5:单证据靶基因——位置≠机制;三链(位置/语境/机制)报告。
- 坑点 6:基因组任务随机切分——近邻泄漏;坐标块切分。
- 坑点 7:「80% 功能」式引用——活性口径误读为功能;定义域先查。
- 坑点 8:管线版本混层——旧新 pipeline 产物同矩阵比较;版本记录。
§6.6 审稿人自查清单
- [ ] registry 版本 + genome build + 下载日期写入方法段?
- [ ] cCRE 措辞(候选/like)与证据分级正确?
- [ ] biosample 分层策略声明(不混样)?
- [ ] 靶基因结论有三证据链(位置/语境/机制)?
- [ ] 模型切分是坐标块(非随机)?
- [ ] 文件 pipeline_version 记录?
- [ ] accession 清单在补充材料?
- [ ] 「候选元件/生化信号」limitation 段落?
§6.7 版本演进的方法学含义
- registry v1→v2 的扩容语义:92.7 万→237 万不是同一集合的修正,是覆盖+分辨率的升级——跨版本统计(密度/分类比例)不可直接比。
- 分类扩展的下游重算:5 类→8 类使旧注释管线的新类缺失——引用旧分类的文章要注明版本,新分析一律 v2。
- 功能表征层的引入:「90% 覆盖」使「ENCODE 只有相关性」的旧批评失效——方法学综述的引用要跟版本走。
- 门户 API 的演进:2025 门户升级(新合集/单细胞层)伴随 schema 微调——生产代码的 API 适配层纪律(同 AFDB 的 API 迁移期)。
§7 AI 就绪指南与应用场景
§7.1 ENCODE 在医疗 AI 中的四种喂法
- 监督序列喂法:序列窗 → cCRE 分类/活性——调控预测模型(CNN/Transformer)的训练域。
- 注释特征喂法:变异/区间 → cCRE 落点特征——非编码变异解释模型的证据层。
- 图谱结构喂法:元件 × biosample 活性矩阵——细胞图谱/调控网络的无监督结构。
- 验证先例喂法:MPRA/CRISPR 表征数据——功能预测模型的评测金标准与迁移目标。
四种喂法与 §6.5 坑点的对应:喂法 1 踩坑 6(切分)与坑 8(版本);喂法 2 踩坑 2(build)与坑 1(候选);喂法 3 踩坑 3(混样);喂法 4 踩坑 4(长尾类)——建模前回读对号。
§7.2 调控活性预测管线实操配方
#!/usr/bin/env python3
"""cCRE 活性预测(二分类):序列 one-hot + CNN vs k-mer GBDT 双基线。
数据:ENCODE4 cCRE(PLS/dELS 为正例 vs CA 对照)+ 参考基因组。"""
import numpy as np, pandas as pd, torch, torch.nn as nn
import pyfaidx # pip install pyfaidx
genome = pyfaidx.Fasta("GRCh38.genome.fa")
reg = pd.read_csv("encod4_ccres_hg38.bed", sep="\t", header=None,
names=["chrom", "start", "end", "id", "cls"])
reg = reg[reg.cls.isin(["PLS", "dELS", "CA"])].sample(20000, random_state=0)
reg["label"] = reg.cls.isin(["PLS", "dELS"]).astype(int)
BASES = "ACGT"
def onehot(seq: str) -> np.ndarray:
x = np.zeros((len(seq), 4), dtype=np.float32)
for i, b in enumerate(seq.upper()):
if b in BASES:
x[i, BASES.index(b)] = 1.0
return x.T # (4, L)
seqs = [onehot(str(genome[r.chrom][r.start:r.end])) for r in reg.itertuples(index=False)]
X = torch.tensor(np.stack(seqs)) # 坐标块切分(示意:chr1-7 训练,8-9 验证,10+ 测试)
y = torch.tensor(reg.label.to_numpy(), dtype=torch.float32)
train = reg.chrom.isin([f"chr{i}" for i in range(1, 8)]).to_numpy()
class CNN(nn.Module):
def __init__(self):
super().__init__()
self.net = nn.Sequential(nn.Conv1d(4, 64, 9, padding=4), nn.ReLU(),
nn.MaxPool1d(4), nn.Conv1d(64, 64, 5, padding=2),
nn.ReLU(), nn.AdaptiveMaxPool1d(1), nn.Flatten(),
nn.Linear(64, 1))
def forward(self, x): return self.net(x).squeeze(-1)
model = CNN()
opt = torch.optim.Adam(model.parameters(), lr=1e-3)
Xtr, ytr = X[torch.tensor(train)], y[torch.tensor(train)]
for epoch in range(3):
for i in range(0, len(Xtr), 512):
opt.zero_grad()
loss = nn.functional.binary_cross_entropy_with_logits(model(Xtr[i:i+512]), ytr[i:i+512])
loss.backward(); opt.step()
print("epoch", epoch, "loss", float(loss))
(同数据换 k-mer + LightGBM 做第二基线;两基线打不过别上更大模型——与 ChEMBL QSAR 同纪律。)
§7.3 模型选型与迁移决策
- 小样本/单类别任务:k-mer 特征 + GBDT——快、稳、可解释。
- 全基因组活性回归:CNN/Transformer(Basenji/Enformer 类架构)——预训练权重的许可见各自仓库,微调数据锁 registry 版本。
- 变异效应:参考/变异等位序列差分(Δ 活性)——与 MPRA readout 对齐的评估设计。
- 多任务:分类(八类)+ 回归(活性矩阵)联合——长尾类(CA/TF)的类别不均衡要分层损失。
- 不确定性:集成 + 分 biosample 校准——细胞特异预测的置信声明。
§7.4 公平性:覆盖不均的工程应对
- biosample 偏倚:癌症细胞系(K562/HEK293 类)数据密度远高于原代稀有细胞——分 biosample 报告性能,稀有细胞结论降级。
- assay 偏倚:DNase 历史深、ATAC 新——「无 DNase 有 ATAC」的 biosample 在旧 registry 缺失(ENCODE4 已并入,仍要声明 assay 来源)。
- 器官偏倚:42 器官的覆盖不均(血液/脑厚,成体内脏薄)——疾病语境外推声明。
- 供体隐私:供体匿名且无表型关联主键——个体层面公平性问题不适用;但疾病合集(如 Alzheimer’s 脑区)的队列偏倚要按其原始文献声明。
§7.5 任务×资源速查表
| AI 任务 | ENCODE 数据 | 输出形态 | 验收 |
|---|---|---|---|
| cCRE 分类 | 序列 + registry | 分类器 | 分类别 AUC(长尾单列) |
| 活性回归 | 信号矩阵 | 多任务回归器 | 分 biosample RMSE |
| 变异效应 | 参考对差分 + MPRA | Δ 打分器 | 与 MPRA readout 相关 |
| 靶基因链接 | Hi-C/ChIA-PET + eQTL | 链接预测 | 三证据链一致率 |
| 细胞图谱嵌入 | 活性矩阵 | 嵌入/聚类 | 与ontology标签一致 |
| 增强子优先级 | registry + 表征 | 排序器 | MPRA 验证队列命中率 |
§7.6 端到端案例:自身免疫 GWAS 位点的靶基因定位
- 输入:某自身免疫病的 GWAS 显著位点(非编码 lead SNPs)。
- 位置层:lead SNP ± LD r²>0.8 区间 → cCRE 落点(hg38,ENCODE4 registry)→ 多个 dELS/PLS 候选。
- 语境层:候选 cCRE 活性矩阵 → 免疫细胞合集(portal immune cells 页)活性排名 → T 细胞特异候选收敛。
- 机制层:ENCODE ChIA-PET(免疫细胞)+ GTEx eQTL 共定位 → 靶基因候选(如某细胞因子基因)。
- 优先级:有 MPRA/CRISPR 表征先例的 cCRE 置顶 → 实验验证队列(CRISPRi)。
- 报告:registry 版本/build/accsession 清单 + 三链证据表 + 候选排序依据——方法学透明三件套齐。
§7.7 报告模板:方法学段落骨架
调控元件注释来自 ENCODE4 cCRE 注册表(Moore et al., Nature, 2026, DOI 10.1038/s41586-025-09909-9;hg38,2026-01 发布,经 SCREEN 下载)。变异落点按八类分类记录(promoter/PLS/dELS/CA-H3K4me3/CA-CTCF/CA-TF/CA/TF),全部结论使用「候选元件(candidate cis-regulatory elements)」表述。细胞语境采用 SCREEN 的 biosample 分层活性数据(1,679 biosamples;疾病相关细胞类型单独分层,不作跨样本聚合)。靶基因定位采用三证据链:位置(cCRE 落点)、语境(疾病细胞类型活性排名)、机制(ENCODE ChIA-PET 环连接与 GTEx eQTL 共定位)。调控模型以染色体分块切分(chr1-7 训练/8-9 验证/10+ 测试)避免近邻泄漏;信号文件的统一管线版本与全部实验 accession 见补充表。cCRE 的候选属性与生化信号≠调控功能的边界已在局限中声明。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 取数 | registry + 信号文件/API | 存储 | 1-2 天 |
| 注释 | 落点 + 语境分层 | 人力 | 3-5 天 |
| 建模 | 双基线 + 切分 | GPU 小额 | 1-2 周 |
| 校准 | L1-L3 协议 | 单机 | 3-5 天 |
| 验证队列 | MPRA/CRISPRi 设计 | 实验预算 | 4-8 周 |
| 复现包 | accession + 版本 + 脚本 | 人力 | 2 天 |
ENCODE 项目的瓶颈在语境分层与证据链整合——「三链证据表」的完整性决定转化档次。
§7.9 消融案例:变异效应预测的特征层贡献
非编码变异效应预测是 ENCODE 医学 AI 价值最集中的场景——特征层消融一组典型轨迹:
| 配置 | 特征集 | MPRA readout 相关性(示意) | 诊断 |
|---|---|---|---|
| R1 | 仅位置(落点有无/类别) | 弱 | 位置是必要不充分 |
| R2 | R1 + 语境(biosample 活性) | 明显提升 | 细胞语境是主增益 |
| R3 | R2 + 序列差分(Δ 序列特征) | 进一步提升 | 等位差异携带机制信息 |
| R4 | R3 + 3D 连接(靶基因环) | 转化层增益(靶基因正确率) | 机制层提升的是归因不是效应值 |
- 方法:同一 MPRA 实验的参考/变异 oligo 对(ENCODE 表征实验数据),五折 CV;特征按 R1-R4 逐层加入。
- 读数:R1→R2 的跃升说明「在哪个细胞里测」比「在哪类元件」重要——无语境的变异打分器天花板极低;R3→R4 说明效应值预测与靶基因归因是两个任务,混在一个指标里会误判进展。
- 结论:非编码变异模型必须带细胞语境输入与分层评估——「通用增强子打分器」的卖点在方法学上站不住。
§8 伦理、许可与合规
§8.1 许可结构
- 数据无访问限制:门户/API/文件全开放——ENCODE 未对数据施加 CC 徽标级的强制条款,但使用规范要求引用数据库论文(Kagda 2025 + Moore 2026/2020)与 dataset accession——这是署名义务的实质。
- 衍生注意:再分发 processed 数据时保留 accession 与版本信息;对原始供体数据不作身份关联(供体匿名,技术上也不可行)。
- 论文许可:ENCODE 论文本身按出版方许可(Nat Commun/Nature 开放获取条款);门户文档引用按常规学术规范。
§8.2 引用与致谢模板
致谢模板(按需裁剪):
Regulatory element annotations were obtained from the ENCODE Project
candidate cis-Regulatory Element (cCRE) registry (Moore JE, et al. An
expanded registry of candidate cis-regulatory elements. Nature, 2026.
DOI 10.1038/s41586-025-09909-9), accessed via the ENCODE Portal
(Kagda MS, et al. Data navigation on the ENCODE portal. Nat Commun 16,
9592, 2025), which is funded by the NHGRI and produced by the ENCODE
Consortium. Accession numbers are listed in Supplementary Table Sx.
We thank the ENCODE Data Coordination Center and production groups.
§8.3 国内合规路径
- 数据性质:匿名供体的基因组功能数据——无个体可识别信息;使用无 HGRAC 人类遗传资源出境问题(公开国际数据库的下载使用按现行规范)。
- 产品化:无限制开放——注释服务/模型内嵌 ENCODE 数据合法;引用义务写进产品文档。
- 红线:学术诚信——候选元件冒充验证元件、accession 缺失的「自建注释」声明都是诚信问题;引用锁版本。
§8.4 商业使用边界
无访问限制使 ENCODE 成为「零许可摩擦」的调控数据源——商业产品的 attribution 页(registry 版本 + 论文 + accession 清单)是标配。需要法务评估的场景是「与许可制资源(如某些临床数据库)组合分发」时的组合条款——ENCODE 自身不是约束来源。
§8.5 合规台账最小模板
| 台账项 | 记录内容 | 示例 |
|---|---|---|
| registry 版本 | 版本 + 下载日期 | ENCODE4(2026-01);2026-XX-XX |
| genome build | hg38 确认 | 全管线 build 一致性检查记录 |
| accession 清单 | 使用的 ENCSR/ENCFF | 补充材料存档 |
| 管线版本 | 每 bigWig 的 pipeline_version | 清单脚本输出 |
| 署名位置 | attribution 页 + 论文引用 | 产品「关于」页 |
| 版本升级策略 | registry 大版本触发 | 新版本评估 + 基线重跑 |
| 复现包存档 | 版本 + accession + 脚本哈希 | 对象存储路径 |
§9 谱系与生态
§9.1 功能基因组学资源时间线
2003 ENCODE pilot(1% 基因组试点)
2007 生产阶段启动
2012 Phase II 主论文(1,640 datasets/147 cell types;「80% 活性」争议)
2020 Phase III(5,992 数据集;cCRE registry v1:92.7 万人类;SCREEN)
2022-2024 ENCODE4 数据生产高峰(ATAC/TF ChIP 扩容 2.3 倍)
2025 门户论文(23,000+ 实验;单细胞/新合集层)
2026-01 ENCODE4 注册表(237 万人类 cCREs;八类;90% 功能表征覆盖;KLF1 示范)
2026-01 UCSC ENCODE4 cCREs track 上线
§9.2 术语表
| 术语 | 定义 |
|---|---|
| ENCODE | Encyclopedia of DNA Elements——基因组功能元件联合体项目 |
| cCRE | candidate cis-Regulatory Element——候选顺式调控元件 |
| SCREEN | cCRE 注册表的检索服务器(Search Candidate cis-Regulatory Elements) |
| rDHS | representative DNase hypersensitivity site——registry 锚定的代表性超敏位点 |
| PLS / dELS | TSS 近端/远端 enhancer-like 分类 |
| CTCF | 绝缘蛋白——拓扑结构域锚定 |
| ChIA-PET | ChIP + 配对末端标签测序——蛋白锚定的染色质环 |
| eCLIP | 增强 CLIP——RBP 结合位点测定 |
| MPRA | 大规模并行报告基因分析——元件功能批量测定 |
| STARR-seq | 自转录活性报道——增强子活性直接筛查 |
| CRISPRi | CRISPR 干扰——元件抑制的扰动实验 |
| ENCSR / ENCFF | 实验/文件 accession 编号体系 |
| uniform pipeline | DCC 统一处理管线 |
| EN-TEx | ENCODE4 配对组织子项目 |
| ENCORE/degron | 蛋白 knockdown 扰动子项目 |
| Encyclopedia | ENCODE 整合注释的版本化发布集 |
§9.3 资源选型决策树
你的需求是什么?
├─ 「变异落在哪个调控元件」
│ → cCRE registry + 落点注释(§4.2)
├─ 「这个元件在哪种细胞开」
│ → SCREEN biosample 分层活性(§4.4)
├─ 「GWAS 位点找靶基因」
│ → 三证据链:registry + ChIA-PET + GTEx eQTL(§5.2)
├─ 「训练调控预测模型」
│ → registry + 信号矩阵 + 坐标块切分(§5.3)
├─ 「表达与 eQTL」
│ → GTEx(ENCODE 只供元件层)
├─ 「变异频率/致病分类」
│ → gnomAD / ClinVar
├─ 「TF 结合 motif」
│ → JASPAR(ENCODE ChIP 的解释词典)
├─ 「癌症表观语境」
│ → TCGA(增强子重编程)
└─ 「参考表观基因组(历史)」
→ Roadmap Epigenomics(已并入 ENCODE 门户)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| GTEx | 表达与 eQTL 层——cCRE 靶基因连接的下游 |
| gnomAD | 变异频率——元件落点的变异来源 |
| ClinVar | 致病分类——调控破坏假设的临床归宿 |
| TCGA | 癌症表观——疾病语境的肿瘤分支 |
| AlphaFold DB | 结构层——蛋白侧证据(元件-靶基因-蛋白全链) |
| DrugBank/ChEMBL | 药理层——靶基因 → 成药语义与活性 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| 非编码变异解释全链 | ENCODE(元件/语境)+ gnomAD(频率)+ ClinVar(致病) | 注释 + 群体 + 临床 |
| GWAS 靶基因 | ENCODE(元件+环)+ GTEx(eQTL)+ GWAS catalog | 位置 + 机制 + 关联 |
| 调控模型 | ENCODE(训练)+ 外部 biosample(测试)+ MPRA(校准) | 监督 + 泛化 + 功能 |
| 癌症调控 | ENCODE(正常语境)+ TCGA(肿瘤表观) | 基线 + 疾病 |
| 细胞图谱 | ENCODE + 单细胞数据集 | 元件层 + 细胞层 |
组合纪律:版本快照统一——registry 版本/build/各库版本同期锁定;ENCODE 的 accession 清单是组合系统复现的锚。
§9.6 公共联合体的生态角色
ENCODE 证明了「大规模联合体 + 统一治理」可以在生命科学做成公共品:NHGRI 二十年资助、DCC 的治理工程(schema/管线/accession)、无限制开放——三者叠加使 ENCODE 成为调控基因组的事实基础设施。它的治理模式(统一管线、accession 体系、biosample schema)被 GTEx、单细胞图谱、Human Cell Atlas 等项目继承——「ENCODE 不只是数据,是数据治理的范式」。LLM 时代,结构化元数据与 accession 体系使它成为基因组 AI 检索与评估的锚点源;功能表征层(90%+ 覆盖)则让「候选→功能」的 AI 闭环第一次有了规模化监督。
§9.7 联合体-门户双实体的工程模式
ENCODE 的组织形态是「生产联合体(多实验室)+ DCC 门户(治理中枢)」的双实体模式——与单机构数据库(ChEMBL/AFDB)不同的工程样本:
| 维度 | ENCODE 双实体 | 单机构模式(ChEMBL/AFDB) |
|---|---|---|
| 数据生产 | 分散生产实验室 | 集中策展/推理 |
| 质量控制 | DCC 统一管线 | 内部策展流程 |
| 更新节奏 | 滚动 + 阶段发布 | 版本快照 |
| 元数据 | 联合体级 schema | 机构内约定 |
| 可复现锚 | accession 体系 | 版本号 |
- 工程含义:双实体模式的可比性靠「管线中心化」而非「生产中心化」——这是分布式科学项目的可复现方案。
- 使用者含义:引用以 accession 为锚(不是「ENCODE 数据」泛称)——accession 体系是联合体模式给使用者的可复现接口。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 门户 https://www.encodeproject.org/(检索/文档/tutorials)
- SCREEN http://screen.encodeproject.org(cCRE 检索)
- 注册表论文 https://doi.org/10.1038/s41586-025-09909-9(Moore 2026)
- 门户论文 https://doi.org/10.1038/s41467-025-64343-9(Kagda 2025)
- REST API:门户 /search/ 端点(format=json;无鉴权)
- UCSC track:ENCODE4 cCREs container track(hg38;2026-01-15 上线)
上手指引(第一次接入的推荐顺序):
- 门户搜 K562 的 ATAC-seq 实验——读 experiment 页的 biosample/replicate/文件结构。
- SCREEN 按坐标查一个 cCRE——读它的分类与跨 biosample 活性排名。
- 用 §4.2 脚本做一批变异的落点注释——感受 registry bed 的用法。
- 用 §4.4 切一个信号矩阵(2-3 个 biosample)——理解「元件 × 细胞」表。
- 走一遍 §5.2 的三证据链(GWAS 位点 → 靶基因)——KLF1 论文作对照。
§10.2 关键文献
- Birney, E. et al. An integrated encyclopedia of DNA elements in the human genome. Nature 489, 57-74 (2012). DOI 10.1038/nature11247
- Moore, J.E. et al. Expanded encyclopaedias of DNA elements in the human and mouse genomes. Nature 583, 699-710 (2020). DOI 10.1038/s41586-020-2493-4
- Kagda, M.S. et al. Data navigation on the ENCODE portal. Nature Communications 16, 9592 (2025). DOI 10.1038/s41467-025-64343-9
- Moore, J.E. et al. An expanded registry of candidate cis-regulatory elements. Nature (2026). DOI 10.1038/s41586-025-09909-9
§10.3 站内延伸阅读
- GTEx — 组织表达与 eQTL 数据库:表达与 eQTL 层(靶基因连接)
- gnomAD — 基因组频率数据库:变异频率(元件落点的变异来源)
- ClinVar — 临床变异注释库:致病分类(调控假设的归宿)
- TCGA — 癌症基因组图谱:癌症表观语境
- AlphaFold DB — 蛋白质结构预测数据库:蛋白结构层(全链的蛋白侧)
- DrugBank — 药物知识库:成药语义(靶基因的药理归宿)
§10.4 FAQ
Q1:ENCODE 数据完全免费吗?商用合法吗?
A:完全免费无访问限制——义务是引用数据库论文与 accession;商用无许可障碍。
Q2:cCRE 到底是什么?是增强子吗?
A:候选顺式调控元件——按生化信号组合分类(如 enhancer-like);「候选」与「like」是刻意的措辞纪律,不是已验证的增强子。
Q3:237 万和 92.7 万两个数字哪个对?
A:都是官方——92.7 万是 ENCODE3(2020)registry v1,237 万是 ENCODE4(2026)v2;引用写版本。
Q4:cCRE 的八类分类怎么看?
A:5 类继承(promoter/PLS/dELS/CA-H3K4me3/CA-CTCF)+ 3 类新增(CA-TF/CA/TF);前三类是增强子主体,新三类是弱证据探索层。
Q5:变异注释用哪个 genome build?
A:一律 hg38(ENCODE4 registry 默认)——hg19 旧数据要 liftover 或重拉;build 混拼是头号事故源。
Q6:「80% 基因组有功能」是真的吗?
A:不是——2012 新闻稿口径是「80% 有生化活性(biochemical activity)」,被媒体误读为「功能」;引用任何 ENCODE 数字先查定义域(§2.4)。
Q7:怎么知道一个 cCRE 在哪种细胞里有活性?
A:SCREEN 的 biosample 分层活性(dnase 排名层)——别用聚合 track;疾病相关问题按疾病相关细胞类型查。
Q8:GWAS 位点怎么连到靶基因?
A:三证据链——位置(cCRE 落点)→ 语境(疾病细胞活性)→ 机制(ChIA-PET/Hi-C 环 + eQTL 共定位);单位置证据只算注释。
Q9:MPRA/CRISPR 表征数据在哪查?
A:门户 functional characterization 合集(800+ 实验)——ENCODE4 注册表论文的功能表征层直接关联 cCRE。
Q10:ENCODE 和 Roadmap Epigenomics 什么关系?
A:Roadmap 数据已并入 ENCODE 门户——历史项目作为 reference epigenome 资源继续可用。
Q11:ENCODE 和 GTEx 怎么分工?
A:ENCODE 管「元件与调控活性」,GTEx 管「表达与 eQTL」——靶基因结论要两库连用。
Q12:统一管线 processed 数据和 lab 原始数据用哪个?
A:跨实验聚合用统一管线产物(可比性);单实验深度分析可用 lab 数据——注意记录 pipeline_version。
Q13:什么是 ENCSR/ENCFF 编号?
A:实验/文件的 accession——引用与复现的锚;方法段应列全部用到的 accession。
Q14:EN-TEx 是什么?
A:ENCODE4 的配对组织子项目——同基因供体多组织采样,个体内组织差异的干净比较。
Q15:单细胞实验在 ENCODE 里有吗?
A:有——2025 门户升级加入 single-cell experiments 合集;与 bulk 的口径差异要声明。
Q16:silencer(沉默子)是新东西吗?
A:ENCODE4 首次系统识别数千个 silencer cCREs——且发现双角色元件(不同语境增强子/沉默子切换)。
Q17:CA-TF/CA/TF 三个新类能用吗?
A:能查但别当强证据——它们是信号组合最弱的长尾层;核心结论用 PLS/dELS/promoter。
Q18:训练调控模型怎么切分数据?
A:基因组坐标分块(如按染色体组)——随机切分在基因组任务因近邻泄漏而虚高(§5.3)。
Q19:Enformer/Basenji 和 ENCODE 什么关系?
A:这类模型用 ENCODE 类数据训练(序列→活性)——复现与微调时锁 registry 版本与管线版本。
Q20:Mouse 数据和人一样全吗?
A:结构相同(96.7 万 cCREs)但 biosample 覆盖少于人类——跨物种比较按各自覆盖声明。
Q21:API 有配额吗?
A:无鉴权无硬配额,但请节流分页;批量任务先查门户 bulk 下载与 FTP。
Q22:怎么引用一个具体的 cCRE?
A:registry ID + 坐标(hg38)+ 分类 + registry 版本——四要素齐才可复现。
Q23:装完 registry 注释后要做什么检查?
A:build 一致性抽查(几个已知位点)、分类分布 sanity check(PLS/dELS 占比)、与文献已注释位点的对照。
Q24:ENCODE 数据能用于临床产品吗?
A:能(无限制开放)——但 cCRE 是候选属性,临床产品的证据分级要按 §5.2 三链纪律,且声明数据版本。
Q25:旧 hg19 的 ENCODE 数据还能下载吗?
A:门户保留历史产物(含旧 build)——但新分析一律 hg38;旧数据只用于与历史文献对齐。
Q26:和 JASPAR/FANTOM 怎么配合?
A:JASPAR 提供 TF motif 解释 ChIP;FANTOM 提供 CAGE 转录层——ENCODE 是元件与活性骨架,两者是解释词典与互补层。
Q27:模型训练选哪些 biosample?
A:核心集(四 assay 齐全的 170 个)优先——活性信号完整、跨 assay 可对齐;非核心样本按需补充并声明稀疏性。
Q28:cCRE 有重复区(Alu 等)的元件吗?
A:有——ENCODE4 管线改进恢复了重复位点的 cCRE——分析时注意多重映射区域的唯一性处理。
Q29:怎么下载一批实验的全部文件?
A:门户 cart 批量或 API 按 accession 列文件 URL——生产代码记录每文件 pipeline_version(§8.5 台账)。
Q30:ENCODE 数据能做临床报告的解释引用吗?
A:可以作调控证据层引用(accession + 版本),但按候选属性表述;ACMG 分级中只作辅助证据。
Q31:变异性状跨物种(小鼠)数据怎么用?
A:小鼠 cCREs 支持模式生物机制研究——人鼠同源元件比对用 liftOver/同源映射,跨物种结论单独声明。
Q32:EN-TEx 和普通 ENCODE 数据怎么选?
A:组织间比较选 EN-TEx(同基因供体配对,消除个体混杂);组织参考谱用主库——两类数据别混在同一统计里。
§10.5 要点回顾
- 无限制开放:门户/API/文件全免费——义务是引用论文与 accession。
- 候选纪律:cCRE 的 C 是 candidate——措辞与证据分级都带「候选/like」。
- 版本即口径:92.7 万 vs 237 万 cCREs、5 类 vs 8 类——引用锁 registry 版本。
- build 一致性:hg38 优先——落点注释的第一检查。
- biosample 分层:1,679 样本不混样——语境是变异解释的主增益。
- 三证据链:位置 + 语境 + 机制——靶基因结论的完整门槛(KLF1 模式)。
- 坐标块切分:基因组任务防近邻泄漏——随机切分是经典错误。
- accession 体系:ENCSR/ENCFF 全记录——复现的锚。
- 管线版本记录:跨实验聚合记 pipeline_version——版本混层是隐患。
- 「80% 争议」的教训:定义域先于数字——活性 ≠ 功能,limitation 固定条款。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 23,000+ 功能基因组学实验 / 800+ 功能表征实验 / 60,000+ 计算整合分析 = Kagda et al. Nat Commun 16:9592(2025;DOI 10.1038/s41467-025-64343-9;PMID 41168159)
- 人类 237 万 cCREs / 小鼠 96.7 万 / 八类分类 / biosamples 839→1,679(42 器官)/ 核心集 25→170 / 可及性+ChIP 实验 2.3 倍 / 功能表征覆盖 >90% / silencer cCREs / KLF1 示范 = Moore et al. Nature(2026-01-07;DOI 10.1038/s41586-025-09909-9)
- 人类 cCRE 精确数 2,348,854(ENCODE4 track)+ ENCODE3 track 存档 = UCSC Genome Browser 新闻档案(2026-01-15)
- ENCODE3 基线:92.7 万人类(926,535)/ 33.98 万小鼠(339,815)/ 基因组覆盖 7.9%/3.4% / 5,992 新数据集 = Moore et al. Nature 583:699-710(2020;DOI 10.1038/s41586-020-2493-4)
- Phase II:1,640 datasets / 147 cell types = Birney et al. Nature 489:57-74(2012;DOI 10.1038/nature11247)
- 「80% 基因组生化活性」= 2012 新闻稿口径(争议——活性 ≠ 功能,§2.4)
- 项目阶段:2003 pilot → 2007 生产 → ENCODE4 最终阶段 = NHGRI/官方口径
- 门户完全开放(no access restrictions)= Nat Commun 2025 论文与门户声明
- 门户版本 v134.5-hotfix-1(检索时点 2026-09-19)= 门户页脚
- SCREEN 地址 http://screen.encodeproject.org = 官方导航
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- encode — 共享标签:基因组学与多组学 / 表观基因组 / 测序数据
- roadmap-epigenomics — 共享标签:基因组学与多组学 / 表观基因组 / 测序数据
- blueprint — 共享标签:基因组学与多组学 / 表观基因组 / 测序数据
- gnomad — 共享标签:基因组学与多组学 / 测序数据
- uniprot — 共享标签:基因组学与多组学 / 测序数据
- 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
- geo — 共享标签:基因组学与多组学 / 测序数据
- hmp — 共享标签:基因组学与多组学 / 测序数据
- dbsnp — 共享标签:基因组学与多组学 / 测序数据
- ega — 共享标签:基因组学与多组学 / 测序数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

