FANTOM5 — 哺乳动物转录调控元件图谱 AI-Ready Wikipedia | 千方病案医数集

975 人类样本启动子图谱 + 43,011 增强子,CAGE 单碱基分辨率转录调控参考

来源 FANTOM Consortium / RIKEN Center for Integrative Medical Sciences url: https://fantom.gsc.riken.jp/5/发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称FANTOM5 — 哺乳动物转录调控元件图谱 AI-Ready Wikipedia | 千方病案医数集
数据类型2,832 个 CAGE 样本,201,802 个人类 CAGE 峰,65,423 个增强子,CC BY 4.0 开放获取,核心表达表 4.1 GB
规模2,832 个样本(1,816 人 + 1,016 小鼠,phase 1+2)
接入方式FANTOM Consortium / RIKEN Center for Integrative Medical Sciences url: https://fantom.gsc.riken.jp/5/
AI 就绪度

数据集封面

FANTOM5 — 单碱基分辨率的哺乳动物转录调控图谱 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 FANTOM5 哺乳动物转录调控元件图谱
英文全称 Functional ANnoTation Of the Mammalian genome 5
别名/简称 FANTOM5、FANTOM5 promoter atlas、FANTOM5 enhancer atlas、FANTOM5 CAGE panel
疾病分类(ICD-11) 非疾病特异数据集;核心应用跨 2A00-2F7Z(肿瘤)、3A00-3C9Z(血液及造血器官疾病)
SNOMED CT 非疾病特异;肿瘤关联概念 55342001(Neoplastic disease)
数据模态 CAGE 转录起始位点图谱(启动子/增强子活性,单碱基分辨率)+ 原始 BAM/FASTQ
AI 任务类型 启动子/增强子活性预测、细胞类型识别与反卷积、增强子-GWAS 变异解读、调控序列建模
样本总数 2,832 个样本(phase 1+2:1,816 个人类 + 1,016 个小鼠;phase 1:975 个人类 + 399 个小鼠)
数据大小 核心表达与注释表约 4.1 GB;原始档案 basic 约 2.5 TB
数据格式 TSV(表达/注释矩阵)、BED(CTSS/peaks/enhancers)、BAM、FASTQ、MAGE/ISA-tab 元数据
许可证 CC BY 4.0(Creative Commons Attribution 4.0 International)
访问级别 开放获取(无需注册与申请)
DUO 标签 NRES(无限制使用,注明出处即可)
语言 英语(全部元数据、注释与文档)
首发日期 2014-03-27(Nature 507:462-470 与 507:455-461 两篇主刊同期发布)
最后更新 2019-03-29(dbarchive V3;NAR 47:D752-D758 更新论文)
发布机构 FANTOM Consortium / RIKEN(理化学研究所,横滨生命科学相关中心)
官方主页 https://fantom.gsc.riken.jp/5/
下载地址 https://fantom.gsc.riken.jp/5/datafiles/latest/
DOI 10.1038/nature13182(主论文);数据档案 DOI 10.18908/lsdba.nbdc01389-000.V003
引用次数 3,040+(Google Scholar,截至 2026-09,Andersson et al. 增强子论文);1,574+(Scopus,Forrest et al. 主论文)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 提供开箱即用的 peak×sample TPM 表达矩阵与 CC BY 4.0 许可,但无官方 ML 任务划分,且需自行处理 hg19/hg38 双版本坐标与两套 RLE 归一化
页面状态 published

§0 E-E-A-T 专业审核声明

医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(转录调控生物学、增强子与疾病关联、ICD-11 与 SNOMED CT 映射)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。FANTOM5 数据以 CC BY 4.0 许可开放获取,署名引用官方推荐文献(Lizio et al., Nucleic Acids Res 2019 及相关主刊论文)即可使用,无需注册或签署协议。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? FANTOM5 是由日本理化学研究所(RIKEN)牵头、260 名研究者组成的国际联盟绘制的一张"人类身体所有细胞类型的基因开关地图"。它使用一项叫 CAGE(帽分析基因表达)的技术,测量 2,832 个样本——从神经细胞、免疫细胞到血液、肿瘤细胞系——中每一段 DNA 被当作"起点"(启动子)或"油门"(增强子)来启动基因读取的活跃程度,精确到单个碱基。它回答的不是"基因表达有多少",而是"基因从哪里、由哪个开关开始被读取"——这正是细胞身份的决定性信息。

为什么重要? 人体 400 多种细胞共用同一套基因组,差别只在于"读了哪些基因、从哪里开始读"。FANTOM5 首次系统性地把这个"从哪里开始读"(转录起始位点)画了出来,发现 18 万多个活跃启动子和 4 万多个活跃增强子,并证明大多数启动子是"复合结构"(同一个基因有多个独立的开关)。它还是理解常见病的关键钥匙:绝大多数疾病遗传位点不在基因内部,而在这类调控开关上——FANTOM5 是把"开关"变成可测量、可检索数据的最大参考之一。

我能用它做什么? 直接下载约 4.1 GB 的"峰 × 样本"表达矩阵做机器学习:预测一段 DNA 序列是不是增强子、训练细胞类型分类器、把 GWAS 疾病位点映射到活跃调控元件上,或用它给单细胞 RNA-seq 数据做细胞身份注释。数据以 CC BY 4.0 完全开放,无需申请;本 Wiki 的 §6 提供可运行的下载与加载代码,§6.5 的 8 个坑点能帮你避开数据复用中最常见的失败模式。

§1.1 技术摘要

FANTOM5 的技术核心是 HeliScopeCAGE:为 RNA 的 5′ 帽子结构接上接头,反转录后用 HeliScope 单分子测序仪直接测序(无 PCR 扩增),每个 read 的 5′ 端位置即一次转录起始事件。数据经 rRNAdust 去核糖体序列、Delve 比对到参考基因组(MAPQ ≥ 20、序列同一性 ≥ 85%),5′ 端频次按单碱基聚合为 CTSS(CAGE tag starting site)。在全部样本的联合 CAGE 信号上,DPI(decomposition-based peak identification)算法把相邻相关的 TSS 分解为非重叠的 CAGE 峰;满足"某 CTSS 在至少一个样本中 >10 read counts 且 ≥1 TPM"的峰构成 robust 集合。Phase 1 扫描 975 个人类样本(573 个原代细胞、152 个人体组织、250 个细胞系)与 399 个小鼠样本,识别人类 184,827 个 CAGE 峰;Phase 2 追加 19 个人类与 14 个小鼠时间序列(408 个时间点),两阶段合计 1,816 个人类与 1,016 个小鼠样本、人类 201,802 个峰(平均每样本约 400 万条比对 reads)。表达定量仅对通过 QC(RIN > 6、>50 万比对 reads、>50% reads 靠近 RefSeq 5′ 端)的样本进行,经 edgeR 的 RLE 相对表达量归一化后以 tags per million(TPM)输出。增强子通过"平衡的双向 CAGE 信号"识别:Andersson et al. 在 432 个原代细胞、135 个组织与 241 个细胞系的人类样本中识别出 43,011 个增强子候选,phase 1+2 汇总达 65,423 个。

§1.2 战略价值

维度一:非编码基因组的功能标注基准。 人类基因组 98% 以上不编码蛋白质,而绝大多数 GWAS 疾病位点落在非编码区。FANTOM5 用转录活性(而非染色质状态推断)直接证明某段 DNA 正在行使调控功能,给出的是"in vivo 正在活跃转录"的证据。这使它成为增强子目录(43,011 → 65,423 个)、启动子目录(约 18.4 万个 robust 峰)与疾病非编码变异解读的金参照:任何一段候选调控序列,都可以先问"它在哪个细胞类型里活跃"。

维度二:以原代细胞为核心的细胞身份图谱。 与 ENCODE 以永生化细胞系为主不同,FANTOM5 早期即决策以正常原代细胞与组织为主——573 个人类原代细胞样本覆盖了绝大多数可分离的细胞类型,并证明细胞类型身份由启动子的使用模式(而非基因总量)定义。这对 AI 的价值在于:它提供了"同一参考框架下、横跨全身细胞类型"的调控活性矩阵,是细胞类型分类器、反卷积工具和"从 DNA 序列预测表达模式"模型(如 Enformer 一类 CAGE 标签模型)的理想训练源。

维度三:时间序列维度上的调控动力学。 Phase 2 的 19 个人类与 14 个小鼠时间序列(408 个时间点)追踪细胞分化、激活与发育过程,揭示"增强子转录是细胞状态转变中最早的转录事件"这一可泛化规律。对 AI 研究者而言,这是少有的、由同一技术平台与统一流程产出的调控活性时间序列,适合做调控动力学建模与早期状态预警模型。

维度四:合规摩擦最低的基因组参考数据。 数据集家族中,临床数据(MIMIC 类)与人类遗传数据(UKB/100K 类)分别受 DUA 与伦理审查约束,而 FANTOM5 以 CC BY 4.0 开放、无注册无申请,模型产出(含商用)只需署名。对需要快速迭代、公开发表与商业转化的团队,这是把"合规成本"从数周降到零的稀缺属性。

维度五:方法论上的"单平台一致性"。 ENCODE/Roadmap/GTEx 由多平台多协议拼合,跨样本比较常需批次校正;FANTOM5 的 2,832 个样本出自同一种 CAGE 协议、同一条 MOIRAI 流水线与同一套归一化框架,细胞类型间的差异几乎全部来自生物学而非技术——这让它是少数可以直接做"细胞类型间因果比较"的图谱级数据。

§1.3 同类数据集横向对比

数据集 规模 模态/技术 标注类型 与 FANTOM5 的差异化
FANTOM5 2,832 样本;201,802 人类 CAGE 峰;65,423 增强子 CAGE + HeliScope 单分子测序(单碱基分辨率) 转录活性直接测量(启动子/增强子 eRNA) 以原代细胞为主;启动子与增强子活性同平台统一测量;CC BY 4.0
ENCODE Phase 2 数百种细胞系/组织的多组学 RNA-seq、ChIP-seq、DNase、ATAC 等 染色质状态与转录因子结合推断 细胞系为主、多模态互补;FANTOM5 提供更细的 TSS 分辨率
Roadmap Epigenomics 100+ 人类细胞/组织表观基因组 ChIP-seq(组蛋白修饰)、DNase、甲基化 表观遗传状态推断(ChromHMM 等) 染色质标记是间接证据;FANTOM5 是直接转录证据,二者常联合使用
GTEx v8 约 900 名供体、近 2 万份组织样本 RNA-seq 基因水平表达 + eQTL 个体差异维度强但基因水平聚合;FANTOM5 提供启动子水平精度
FANTOM CAT 由 FANTOM5 数据派生 CAGE + CAGEscan + 长读长 27,919 个人类 lncRNA 基因的准确 5′ 端目录 FANTOM5 的下游延伸产品(Hon et al. 2017, Nature)
miRNA atlas(De Rie 2017) 由 FANTOM5 数据派生 短 RNA-seq + CAGE miRNA 与其启动子整合表达谱 与 FANTOM5 主面板同框架,可直接交叉引用
跨物种面板(rat/dog/chicken) FANTOM5 子项目 同为 CAGE 同细胞类型跨物种比较 与人/鼠主面板同流程,物种间可直接对齐

§1.4 版本时间轴

时间 版本/事件 说明
2014-03-27 Phase 1.0 首发 Nature 507:462-470(启动子图谱)与 507:455-461(增强子图谱)两篇主刊;975 个人类样本,184,827 个 CAGE 峰,43,011 个增强子,坐标 hg19/mm9
2015-01 Gateway 论文 Lizio et al., Genome Biol 16:22——资源全景介绍与官方初始引用文献
2015-02-27 Phase 2 时间序列 Arner et al., Science 347:1010-1014;19 个人类 + 14 个小鼠时间序列,增强子先行波模型
2017(Database issue) Web 资源更新 Lizio et al., NAR 45:D738-D744;phase 1+2 汇总(1,816 人 + 1,016 小鼠、201,802 峰、65,423 增强子);发布 GRCh38/GRCm38 重处理与 liftOver 一致性数据集
2017-07 数据描述论文 Abugessaisa et al., Scientific Data 4:170112;2,832 个样本的完整流程与质量指标
2017-08 FANTOM CAT / lncRNA 图谱 Hon et al., Nature(27,919 个人类 lncRNA 基因准确 5′ 端)与 NAR FANTOM5 collection 数据系列
2019-03-29 dbarchive V3 Lizio et al., NAR 47:D752-D758(官方最新引用文献);档案镜像持续提供 hg19/hg38 双版本数据

时间轴的三条解读线索:主刊发布(2014)与资源更新(2017/2019)之间隔着一次重要的坐标迁移(hg19 → hg38)与一次峰集扩充(phase 1 → phase 1+2),引用任何"数字"前先确认它在时间轴上的口径;Science 2015 时间序列论文在版本谱系上属于 phase 2,其样本不全部包含在 phase 1 峰集内;dbarchive V3 之后项目进入冻结维护,2019 年至今无新的 phase 代际。

§1.5 典型应用场景

  1. 从 DNA 序列预测调控活性:以 FANTOM5 启动子/增强子活性矩阵为标签训练卷积/Transformer 模型(Enformer 一类 CAGE 标签模型的标签来源之一),实现"给序列、出活性谱"。
  2. GWAS 非编码变异解读:把疾病关联 SNP 与细胞类型特异的活跃增强子取交集,定位"哪个细胞里的哪个开关"致病(Andersson et al. 2014 的原生用法)。
  3. 细胞类型识别与反卷积:用启动子使用模式(而非基因总表达)作为细胞身份指纹,为 bulk 或单细胞数据做注释。
  4. 增强子-启动子配对与基因调控网络构建:利用 eRNA 与 mRNA 启动子的相关性与时间先后(增强子先行)推断调控关系。
  5. 疾病模型时间序列的早期预警:在 iPS 分化、免疫激活等时间序列中,以增强子转录波为先导指标建模状态转变。
  6. 合成与再生医学的元件设计:挑选在目标细胞类型中特异活跃的启动子/增强子序列作为基因治疗或细胞工程的表达调控元件候选库。

§2 医学背景

§2.1 ICD-11 编码映射表

FANTOM5 本身是"正常细胞参考"而非疾病数据集,但它的两大核心应用域对应 ICD-11 如下:

应用标签 ICD-11 编码 中文名称 说明
肿瘤调控元件异常(250 个人类细胞系,多来自癌症) 2A00-2F7Z 肿瘤 Andersson et al. 2014 的 241 个细胞系样本含大量癌症来源细胞系
血液与免疫细胞转录参考(造血原代细胞面板) 3A00-3C9Z 血液及造血器官疾病 提供正常造血细胞谱系的启动子使用参照
其他章节(自身免疫、内分泌、神经发育等) 全书各章 依研究目标而定 通过增强子-SNP 交集分析映射至相应疾病章节,无固定单一编码

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 术语
肿瘤疾病(癌症细胞系面板对应应用域) 2A00-2F7Z 55342001 Neoplastic disease(肿瘤性疾病)
血液及造血器官疾病(造血细胞面板对应应用域) 3A00-3C9Z 64572001 Disease(疾病,通用上位概念,供临床链接)
非编码调控变异相关表型解读 依疾病而定 404684003 Clinical finding(临床所见,作为变异-表型链接的通用入口概念)

§2.2 疾病背景简介与流行病学

FANTOM5 的医学背景不是某一种疾病,而是转录调控与疾病的一般关系。人体约 400 种细胞类型共用同一基因组(Forrest et al. 2014 的问题陈述),细胞身份由启动子的选择性使用决定;而决定"何时、何地、用多强"的增强子,正是多数人类常见病的非编码风险变异富集的场所。Andersson et al. 2014 直接展示了 FANTOM5 增强子图谱与疾病关联 SNP 的交集:疾病相关的调控 SNP 显著富集在细胞类型特异的活跃增强子中,而非泛表达增强子中。这一范式随后成为 GWAS 后验注释(fine-mapping 与 functional annotation)的标准步骤之一。

流行病学层面,FANTOM5 没有自身队列人群——它的人群属性来自样本来源:原代细胞多购自商业供应商(记录 catalog/lot 号)或由 114 家合作机构提供;组织样本含 152 个人类尸体解剖组织(其中脑组织来自荷兰脑库);小鼠组织覆盖 271 个发育组织样本。因此,"流行病学"在该数据集中的对应物是样本本体学分布:每一种主要细胞类型都自带 CL(Cell Ontology)标签,供下游与疾病队列匹配。

从疾病谱系看,FANTOM5 对三类医学问题提供了直接参考:

  1. 肿瘤:250 个人类细胞系样本中大量为癌症来源,Andersson et al. 2014 的 241 个细胞系增强子分析可直接用于比较"癌细胞与其来源正常细胞"的增强子差异,定位异常激活的癌基因开关(如 MYC、SPI1 家族的 p1@/p2@ 双峰即论文中的示范案例之一)。
  2. 免疫与血液疾病:造血谱系(单核细胞、树突细胞、B/T 细胞、NK 细胞等)是原代面板中覆盖最深的谱系之一,免疫细胞分化时间序列(phase 2)提供了感染/因子刺激下的调控动力学参照。
  3. 发育与儿科:271 个小鼠发育组织样本与 E17.5 内控体系使发育时间窗口的调控参考可量化,为先天性发育异常的非编码变异解释提供跨物种参照。

为什么"非编码"成为医学问题:全基因组关联研究(GWAS)累积的常见病风险位点绝大多数位于非编码区,而增强子决定基因表达的时空模式——"疾病位点在哪个增强子上、该增强子在哪种细胞里活跃、它驱动哪个基因"构成一条完整的机制推断链。FANTOM5 同时供给这条链的两端证据:增强子活性(哪个开关开着)与启动子活性(哪个基因被驱动),因此成为非编码变异功能解读的标准参照系之一。同理,eRNA 的发现(双向、外切酶敏感、短不剪接转录与增强子活性强相关)把"增强子是否活跃"变成了可直接测量的分子事件,为高通量疾病研究提供了新的测量轴。

§2.3 临床任务定义

FANTOM5 支持的不是"筛查/诊断"这种直接临床任务,而是三类间接支撑临床的建模任务:

  1. 调控元件功能注释(诊断前知识层):给定候选非编码区段,输出其在各细胞类型中的启动子/增强子活性。等价于给临床变异解释系统(如 ACMG/AMP 变异评级中的功能证据)提供"该元件在相关组织中是否活跃"的先验。
  2. 细胞类型身份判定(筛查/分型的计算底座):以启动子使用模式分类细胞状态,可迁移到肿瘤分型(肿瘤样本的调控图谱偏离其来源组织的正常参考)与移植物成分分析。
  3. 疾病风险变异的功能优先级排序:将 GWAS/EQTL 位点与活跃增强子、相关启动子配对,输出候选靶基因与机制假设,辅助药物靶点选择。
  4. 细胞治疗与再生医学的元件选型:为载体构建提供"目标细胞中特异活跃"的启动子/增强子候选,降低脱靶表达风险(属于工程设计用途,非临床决策本身)。

三项任务的成熟度不同:任务 1 与任务 3 已有同行评审范式(Andersson et al. 2014 直接示范疾病 SNP 与增强子的交集分析);任务 2 属于"参考系迁移",其临床效度取决于目标场景的验证队列。任何一项都不能替代任务特异性临床数据。

§2.4 患者人群表

维度 描述
来源 商业采购原代细胞/组织 RNA、合作机构提供的原代细胞与冻存组织、商业细胞系库;人类尸体解剖组织部分来自荷兰脑库
时间 2011-2013 年集中采样与建库(phase 1),2013-2014 年时间序列(phase 2)
年龄/性别 供体年龄、性别等以 MAGE/ISA-tab 元数据逐样本记录(00_.assay_sdrf.txt),无统一人口分层设计
种族 未作为设计变量系统记录;机构来源分布于 20 多个国家和地区
就医类型 非患者队列——以健康供体原代细胞、尸体解剖组织与永生化细胞系为主;该数据集不包含个体级临床结局
重复结构 多数细胞类型含多个供体/批次;部分稀有细胞类型仅单样本——划分与统计功效评估前必查(坑点 8)
质量分层 RNA 质检三指标(RIN、A260/280、A260/230)逐样本记录;未过 QC 样本保留在峰识别证据中但无表达值
对照体系 每个测序 run 加入 E17.5 小鼠全胚胎 RNA 内控;跨 run 校正以此为锚

§2.5 临床价值

对临床 AI 而言,FANTOM5 的价值是"参照系":(1) 为肿瘤样本提供来源组织的正常调控基线——偏离基线的启动子/增强子活性即候选病理开关;(2) 为变异解读提供"证据强度分层"——落在泛表达增强子的变异与落在组织特异增强子的变异,致病机制解释完全不同;(3) 为再生医学与细胞治疗提供细胞定义库——FANTOM 项目总监林崎(Hayashizaki)在 2014 年发布时即定位该库为"操作细胞的必备用库"。这些用途均属于知识间接支撑,任何直接临床落地仍需任务特异性数据与验证。

临床方向 FANTOM5 提供什么 落地距离
肿瘤分型/溯源 来源组织的正常启动子使用基线 中:需肿瘤队列联合建模
变异致病性评级(非编码) 组织特异活跃增强子证据 近:可直接进入 ACMG/AMP 功能证据讨论
细胞治疗质控 目标细胞类型的调控指纹 中:需与工艺样本的检测平台对齐
药物靶点发现 增强-启动子配对与共表达簇 近-中:富集分析即可启动
诊断模型训练 非直接(无患者结局标签) 远:仅作特征来源之一

§2.6 金标准参考表

要素 内容
划分 无官方 ML 划分;生物学分组为 phase 1(稳态快照)/ phase 2(时间序列),物种分为 human/mouse/rat/dog/chicken(后四者样本量递减)
标注方式 全部为测量值而非人工标注:CAGE 信号即"活性"标签;peak 由 DPI 算法自动识别;增强子由双向信号规则自动判定
标注者 FANTOM Consortium(260 名研究者、114 家机构);数据生产在 RIKEN GeNAS 机器人化流水线完成;ZENBU 人工巡检质量
性质 客观测量型参考数据(reference atlas),不是标注竞赛基准;"金标准"地位来自同平台统一流程与 2014 年 Nature 主刊同行评审

"金标准"在两个具体意义上成立:其一,作为增强子判定的方法学参照——"FANTOM5 式双向 CAGE 增强子"成为后续 eRNA 与增强子图谱研究的比较基线;其二,作为启动子注释的坐标参照——18.4 万个 robust 峰被广泛用作"这个位置有活跃 TSS"的先验。同时要警惕它的边界:它是 2011-2015 年技术与采样范围的快照,对其未覆盖的细胞类型与"金标准未收录"不等于"不存在"这一点,任何下游论文都应明示。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
机器学习用的现成表达矩阵 latest(phase 1+2)robust CAGE peaks 表达/注释表(TSV) 约 4.1 GB 201,802 个人类峰 × 全部样本 TPM,pandas 一行读入
与 ENCODE/Roadmap/现代表格对齐坐标 GRCh38(hg38)/GRCm38(mm10)重处理数据集 视子集而定 与现行主流注释版本一致,避免 liftOver 误差
复现 2014 主刊或与旧资源对比 phase 1.3(hg19/mm9 原始坐标) 视子集而定 与 2014 年论文、ZENBU 历史视图坐标一致
训练序列模型要最大样本多样性 phase 2.0(含时间序列全部样本) 视子集而定 含 408 个时间点的动态活性谱
从头比对/自建管线 basic 原始档案(BAM + CTSS BED + FASTQ) 约 2.5 TB 含全部比对与单碱基 CTSS,允许自定义阈值重处理
只要增强子 Enhancers 目录(phase 1 与 phase 1+2 双套) 数百 MB 43,011(phase 1)与 65,423(phase 1+2)两套坐标 + 活性

§3.1 模态详情

  • CAGE(Cap Analysis of Gene Expression):捕获带 5′ 帽子的完整 RNA,测序 read 的 5′ 端即转录起始位置。HeliScope 单分子测序免 PCR,绝对定量能力优于早期两步 PCR 版 CAGE(Lizio et al. 2015 Gateway 论文明确论证)。hCAGE 标准流程需 5 µg 总 RNA 起始;LQhCAGE 低量流程约 100 ng,用于珍贵的原代细胞样本。
  • CTSS(CAGE tag starting site):单碱基分辨率的转录起始计数单元。每样本一个 CTSS BED 文件(第 4 列为该碱基的 tag 计数)。
  • CAGE 峰(promoter):DPI 算法在全部样本联合信号上识别的非重叠峰区间,是启动子级表达分析的单位。命名 p1@SPI1 表示 SPI1 基因相关峰中全项目 tag 证据最高的第 1 名;与已知基因 5′ 端不邻近的峰命名 p@chr:start..end
  • 增强子(eRNA):活跃增强子产生双向、外切酶敏感、短而不剪接的 eRNA,在 CAGE 中表现为平衡的双向信号。Andersson et al. 据此识别 43,011 个(phase 1)增强子候选。
  • 派生资源:共表达聚类(MCL)、motif 富集(JASPAR)、样本本体注释(FANTOM5 本体,基于 OBO 家族的 CL、Uberon、DO)、连接体图(144 种主要原代细胞间的配体-受体信号图)。

CAGE 与邻近技术的对照(帮助选择正确的对比基线):

技术 测什么 分辨率 与 CAGE 的关系
CAGE(HeliScope) 5′ 帽端转录活性(TSS 频次) 单碱基 本数据集;免 PCR 绝对定量
RNA-seq 转录本丰度(全转录本) 外显子/转录本 提供"总量",不提供"起点选择";两者互补
ChIP-seq(H3K4me3/H3K27ac) 组蛋白修饰(调控状态推断) 数百 bp 峰 间接证据;FANTOM5 峰识别曾以之为支持性证据
ATAC/DNase 染色质开放性 数百 bp “可及"不等于"在转录”;CAGE 给直接证据
PRO-seq/GRO-seq 延伸中的 Pol II 数十 bp 测转录进行态;CAGE 测起始态,配对可区分"启动"与"延伸"
5′ RACE/单细胞 5′ 端方法 单细胞级别 TSS 单碱基 细胞类型内验证工具;FANTOM5 提供批量级参考

一个实用推论:任何"序列 → 表达"模型若只学 RNA-seq 总量,学的是"读多少";换用 FANTOM5 CAGE 标签,学的是"从哪读、开关选哪个"——后者才与调控元件一一对应。

CAGE 数据的四级形态(从粗到细,选对分析层级):

层级 数据形态 典型用途
基因层 Gene_level_expression 汇总表 与 RNA-seq/GTEx 对接、通路分析
峰层(promoter) 201,802 峰 × 样本 TPM 矩阵 细胞类型建模、序列活性预测的主力输入
单碱基层(CTSS) 每样本 CTSS BED TSS 精细结构(复合启动子内移位)、新 TSS 发现
增强子层 43,011/65,423 双向信号集合 增强子目录、eRNA 与 GWAS 解读

§3.2 按子集样本数表

子集 人类 小鼠 说明
原代细胞 573 128 phase 1 核心;覆盖绝大多数可分离细胞类型
人体组织 152 含尸体解剖组织(脑组织来自荷兰脑库)
癌症/永生化细胞系 250 Andersson et al. 增强子分析用 241 个细胞系
小鼠发育组织 271 phase 1 小鼠组织样本
时间序列(phase 2) 含于 1,816 含于 1,016 19 个人类 + 14 个小鼠时间序列,408 个时间点
phase 1 合计 975 399 2014 主刊口径
phase 1+2 合计 1,816 1,016 2,832 个 profiled 样本(Abugessaisa et al. 2017)

(另有少量大鼠、犬、恒河猴、鸡的跨物种比较样本,见官方主页 atlas 链接。)

两个口径陷阱提醒:其一,新闻与宣传材料中的"180,000 promoters / 44,000 enhancers"是早期宣传口径(约数),正式引用一律用论文数字(184,827/201,802 峰、43,011/65,423 增强子);其二,“mouse phase 1 = 399”(128 原代 + 271 组织)与 phase 1+2 的 1,016 不要混写——部分二手资料把不同子集相加后出现 401 等口径,引用时以 Scientific Data 2017 与 NAR 2017 的官方表格为准。

§3.3 格式表

文件类型 格式 内容
CTSS 文件 BED(*.ctss.bed.gz 每行一个单碱基 TSS,第 4 列 tag 计数
CAGE peak 注释表 TSV(OSC 风格) 00 Annotation01 Description02 Chromosomal position03 EntrezGeneID04 GeneSymbol05 Description 等列
CAGE peak 表达表 TSV/矩阵 robust 峰 × 样本的 read counts 或 RLE 归一化 TPM
增强子坐标与活性 BED/TSV 43,011(phase 1)与 65,423(phase 1+2)套
原始比对 BAM + BAI Delve 比对结果(basic 档案)
CAGEscan(部分人类样本) FASTQ/BED12 5′/3′ tag 序列与聚类结果
元数据 MAGE/ISA-tab(00_.assay_sdrf.txt 提取物 ID、本体标签、RNA 质量指标、协议、测序运行信息

§3.4 存储大小

组件 大小
basic 原始档案(BAM/CTSS/FASTQ/元数据) 约 2.5 TB
CAGE peaks(峰坐标 + 注释 + 表达) 4.1 GB
共表达聚类与通路富集 86 MB
增强子套件 数百 MB 量级(随版本)
实验细节补充包(fantom5_new_experimental_details.zip) 273 KB

容量规划提示:ML 常规工作只需 10 GB 级磁盘(核心表 + 增强子 + 元数据);仅当需要重新比对(自建 Delve/STAR 管线)或复现 rRNAdust 过滤时才需要 2.5 TB 级 basic 档案,此时建议在对象存储挂载而非本地全量落盘。

§3.5 标注方式

全部"标签"为仪器测量与算法推导,非人工勾画:活性 = CAGE tag 计数(TPM);peak = DPI 分解(含独立成分分析与 TSS 分类器富集步骤,辅以 EST、H3K4me3 与 DNase 证据支持峰为真实 TSS);增强子 = 平衡双向 CAGE 信号规则;共表达簇 = MCL 聚类;motif = JASPAR PWMatrix + 新 motif 发现。

这套"测量即标注"的体系与传统医学影像/电子病历数据集的根本差别在于:不存在"标注者协议"与"标注者间信度"问题,替代它的是方法可复现性问题——DPI 与归一化的全部参数公开(DPI 源码在 GitHub),任何人都可用原始数据重跑同一标注。因此质检的焦点从"标注对不对"转移为"QC 门槛执行得对不对"(RIN、reads 数、5′ 端占比三重门槛,见 §4.5)。

§3.6 标注者资质与一致性

DPI 峰识别与增强子判定为确定性算法(可复现,参数公开);人工环节限于:(1) RIKEN GeNAS 流水线工程师的两轮 RNA 质量检查(BioAnalyzer RIN、Nanodrop A260/230 与 A260/280);(2) ZENBU 浏览器中的逐样本人工质量巡检;(3) 260 名来自 114 家机构的合作者按领域分工完成样本采集与生物学注释。无标注者间一致性系数(不适用)。

§3.7 采集周期

2011 年 10 月 FANTOM5 项目会议启动;phase 1 样本采集与建库集中于 2011-2013 年;phase 2 时间序列采集至 2014 年初;2014-03-27 主刊发布;2017 年后资源进入维护更新(2019-03-29 dbarchive V3)。对时间敏感的应用(如以"样本年龄"为协变量),SDRF 元数据中的采集与建库时间字段是唯一权威来源。

§3.8 地域覆盖

样本由分布于 20 多个国家和地区的 114 家机构提供或商业采购;数据生产集中于 RIKEN GeNAS(横滨)与 Helicos Biosciences(测序);组织样本含荷兰脑库来源。数据集为"物种图谱"而非人群队列,无地理代表性设计——用它回答任何"人群分布"问题都是对数据集语义的误用;正确用法是以其为"细胞类型 × 调控活性"的参考面,与地理分层的疾病队列另行对接。

§3.9 设备规格

环节 设备/系统 关键参数
测序 HeliScope 单分子测序仪(RIKEN 与 Helicos Biosciences) 每 run 加入一份 E17.5 小鼠全胚胎 RNA 内控
RNA 质检 Agilent BioAnalyzer + Nanodrop RIN 值;A260/280 与 A260/230 比值
建库 RIKEN GeNAS 机器人化流水线(hCAGE) ≥1 µg 总 RNA 起始
建库(低量) LQhCAGE 手工流程 约 100 ng 总 RNA 起始
文库定量 OliGreen 荧光 assay 建库后浓度测定
数据处理 MOIRAI 自动化系统 rRNAdust 去核糖体 → Delve 比对(MAPQ ≥ 20、identity ≥ 85%)→ CTSS 计数
质量巡检 ZENBU 浏览器 逐样本人工检查 CAGE profile 统计

§3.10 深度溯源链

样本 →(MAGE/ISA-tab 元数据:提取物 ID、FF 本体 ID、供应商 catalog/lot、RNA 质检指标)→ CAGE 文库 →(HeliScope run 记录 + E17.5 内控)→ MOIRAI 处理(rRNAdust/Delve/CTSS)→ DDBJ DRA 原始存档 + FANTOM5 档案处理后数据 →(DPI peaks + RLE 归一化表达)→ ZENBU/SSTAR/TET 交互访问。每一层均有独立文件与 accession,可逐级回溯至原始 reads。

溯源链上每一段的"防伪锚点":样本层看 SDRF 的 catalog/lot 与 RNA 质检三指标(RIN、A260/280、A260/230);文库层看 library/sequence protocol 字段与 LQhCAGE/hCAGE 分支;测序层看 run/flowcell channel 字段并核对 E17.5 内控是否在 run 内;处理层看 Delve 参数(MAPQ ≥ 20、identity ≥ 85%)与 rRNAdust 版本;统计层看是否使用 hybrid 峰集与哪套归一化。任何一环对不上,都应中止下游分析先做数据对账。


§4 数据结构

§4.0 目录树

fantom.gsc.riken.jp/5/datafiles/latest/     # 官方批量下载根(lftp 可镜像)
├── basic/                                  # 原始档案(约 2.5 TB)
│   ├── 00_.assay_sdrf.txt                  # 全项目样本元数据(MAGE/ISA-tab SDRF)
│   ├── <实验组子目录>/
│   │   ├── <sample>.bam / .bam.bai         # Delve 比对结果(HeliScopeCAGE)
│   │   ├── <sample>.ctss.bed.gz            # 单碱基 CTSS 计数(BED,第 4 列 = tag 计数)
│   │   ├── <sample>.rdna.fa.gz             # rDNA 序列(去核糖体参考)
│   │   └── (仅人类 CAGEscan 子目录)
│   │       ├── <sample>.5prime.fq.gz       # CAGEscan 5′ tag(FASTQ)
│   │       ├── <sample>.3prime.fq.gz       # CAGEscan 3′ tag(FASTQ)
│   │       ├── <sample>.pairs.bed.gz       # 读对比对(BED12)
│   │       └── <sample>.clusters.bed.gz    # CAGEscan 聚类(BED12,第 4 列 tag 名/第 5 列 pair 数)
│   └── fantom5_new_experimental_details.zip  # 实验细节补充(273 KB)
├── CAGE_peaks/                             # 峰坐标 + 注释 + 表达(4.1 GB)
│   ├── <genome>.cage_peak_*_ann.osc.txt    # 注释表(00 Annotation/01 Description/02 位置/03 EntrezGeneID/04 GeneSymbol…)
│   └── <genome>.cage_peak_*_expr*          # 表达表(read counts 与 RLE 归一化两套)
├── Enhancers/                              # 增强子套件(phase 1 与 phase 1+2 双套,hg19/hg38 与 mm9/mm10)
├── CAGE_peaks_annotation/                  # 样本本体、GOstat 与本体富集
├── Co-expression_clusters/                 # MCL 共表达聚类与通路富集(86 MB)
├── Gene_level_expression/                  # 基因水平汇总
├── DRA_accession_tables/                   # DDBJ Read Archive accession 对照表
└── pooled_ctss/ 与 TSS 分类器重处理集      # 联合 CTSS 池与真 TSS 重打分数据

(目录名为官方 README 组件名;具体文件名随 hg19/hg38、phase 1/phase 1+2 组合变化,以 datafiles/latest 实际清单为准。)

文件命名约定解码(读懂一个文件名 = 知道要不要下载):

名称片段 含义 对你的决策
hg19 / hg38(或 mm9 / mm10 参考基因组版本 全项目锁一个,见坑点 2
phase1 / phase1and2combined 峰集合代际 combined = hybrid 集(201,802 峰)
ann 注释表(OSC 风格) 必下;含峰 ID、坐标、基因符号
expr + norm/raw 表达表(RLE 归一化 TPM / raw counts) ML 用 norm;重归一化才用 raw
ctss 单碱基层计数 仅 TSS 精细结构分析需要
assay_sdrf 样本元数据表 必下;划分与 QC 都靠它

§4.1 DAIMS 字段字典(核心表达表)

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
peak_id string 峰短名:pN@GENE 或匿名 p@chr:start..end p1@SPI1 主键;区分同一基因的复合启动子 N 系全局证据排名,非样本内排名 201,802 个人类峰内唯一
chromosomal_position string chr:坐标 链 chr1:12,345,678+ 坐标对齐、序列提取 hg19 与 hg38 版本不可混用 GRCh37/hg19 或 GRCh38
strand char 峰代表的 TSS 方向 + 链特异建模 增强子套件中方向为双向 + / -
EntrezGeneID int 关联基因 Entrez ID 6688 跨库映射 5′ 端邻近规则关联,可能多对多 “.”(无关联) NCBI Gene 空间
GeneSymbol string 官方基因符号 SPI1 标签来源 依赖注释版本 “.” HGNC 符号
description string 人类可读峰描述 SPI1 proto-oncogene… 文档/检索 人工整理 自由文本
short_description string 峰短描述(OSC 01 Description 列) promoter; protein_coding 快速过滤峰类别 依赖注释规则 受控短词
misc/附加注释列 string 与已知注释集(RefSeq/GENCODE/Ensembl)的关系标记 known/novel 新颖 TSS 挖掘 随注释版本变化 受控值
CNhsXXXXXX 列 × N float 每样本 TPM(RLE 归一化)或 raw count 12.4 表达矩阵主载荷 TPM 相对量,跨版本两套归一化 空白(样本未过 QC,非零表达) ≥ 0
robust 标志 bool 是否满足 >10 counts 且 ≥1 TPM 阈值 true 过滤低置信峰 由全项目证据决定 true/false
co-expression cluster string/int MCL 共表达簇归属(聚类组件内) cluster_0427 弱监督分组、功能富集 聚类组件空间
DRA accession string 原始数据 DDBJ 存档号 DRR00xxxx 回溯原始 reads DDBJ DRA 空间
FF ontology ID string 样本本体标签(SDRF 内) FF:0000111 细胞类型分组/映射 CL 自有本体,需人工映射 UMLS FANTOM5 本体空间

§4.2 标签分布

FANTOM5 没有"类别标签",其分布结构体现在三个层面:(1) 表达矩阵:TPM 高度稀疏,多数峰仅在少数细胞类型活跃——这是数据集的核心信号(细胞类型特异性);(2) 峰-基因关联:一个基因可关联多个 p1@/p2@… 峰(复合启动子),人类约 18.4 万 robust 峰对应远少于峰数的基因座;(3) 增强子集合:43,011/65,423 个增强子中,绝大多数为细胞类型特异,泛表达增强子占少数(Andersson et al. 2014 的核心分类)。

分布层 结构 对 ML 的含义
峰 × 样本 TPM 高度稀疏、长尾分布 用 log2(TPM+1) 后再标准化;稀疏模式本身是标签而非噪声
基因 → 峰 一对多(复合启动子) 建模单位取峰,聚合取基因(顺序不可颠倒)
增强子集合 细胞型特异为主 分类任务中"特异 vs 泛表达"是自然二分标签
样本 → 谱系 SDRF 本体可分组 GroupKFold 的分组依据

§4.3 关键统计

  • 2,832 个 profiled 样本;平均每样本约 400 万条 reads 成功比对到基因组。
  • 人类 CAGE 峰:phase 1 = 184,827;phase 1+2 = 201,802;robust 集约 18.4 万(184,476,Gateway 论文口径)。
  • 小鼠 CAGE 峰:158,966(phase 1+2 混合集);robust 约 11.6 万。
  • 活跃增强子:43,011(phase 1)→ 65,423(phase 1+2)。
  • 表达定量 QC 通过门槛:RIN > 6、比对 reads > 500,000、>50% reads 靠近 RefSeq 5′ 端。
  • 时间序列:33 个数据集、408 个时间点(19 人类 + 14 小鼠)。
  • 细胞连接体:144 种主要原代细胞类型的配体-受体信号网络。
  • Peak 关联注释来源:RefSeq、UCSC known gene、GENCODE、Ensembl 与全长 cDNA 克隆(mRNA),并附官方基因符号、Entrez Gene ID 与 UniProt 蛋白 ID。
  • lncRNA 延伸:FANTOM CAT 为 27,919 个人类 lncRNA 基因给出准确 5′ 端。

§4.4 数据层级

项目(FANTOM5 phase 1 / phase 2)
└── 样本(sample:CNhs 编号人类 / 小鼠编号,MAGE/ISA-tab 逐条元数据)
    └── 文库(HeliScopeCAGE 或 LQhCAGE;CAGEscan 子集)
        └── 测序 run(含 E17.5 内控)
            └── CTSS(单碱基 TSS 计数,BED)
                └── CAGE peak(DPI 非重叠峰;启动子分析单位)
                    └── 增强子(双向信号子集)与共表达簇(跨样本聚合层)

§4.4b 与外部资源的对齐字段

外部资源 对齐键 注意点
GENCODE/Ensembl 04 GeneSymbol 或 EntrezGeneID → HGNC/Ensembl ID 关联基于 5′ 端邻近规则,非精确转录本对应
GWAS Catalog 峰坐标(选 hg38 版本)与增强子集合 富集分析需用 LD 感知方法或先验 SNP 列表
ENCODE/Roadmap 坐标交集 用官方 liftOver 一致峰集最稳(坑点 2)
GTEx 基因符号或坐标 组织 vs 细胞类型语义不同,比较需映射表
UCSC/Ensembl 浏览器 官方 Track Hub URL hg19/hg38 双 hub 勿混挂同一 session
单细胞数据(scRNA-seq) 基因符号 + 谱系映射 CAGE 无单细胞分辨率,只能做聚合级锚定

§4.5 缺失值与信息性缺失

现象 编码/表现 正确解读
表达表某样本列对某峰为空 空白/缺失 该样本未过 QC(RIN ≤ 6、reads 不足或 5′ 端占比低),不是零表达——它与 0 的语义完全不同
未过 QC 样本仍在 CTSS 池中 CTSS BED 存在但无表达值 官方有意为之:低质量 profile 仍代表独立的 5′ 端观测,参与峰识别但不参与定量
峰无基因符号 . 或匿名 p@chr:… 未与已知转录本 5′ 端邻近,多为 novel TSS 或深层增强子,勿在基因级分析中丢弃
phase 1 与 phase 1+2 表达不可混 两套归一化 phase 2 以 phase 1 几何均值作参考,保持 phase 1 数值不变;混合两表会引入系统性尺度漂移

QC 掩码的快速生成与核查(与 §6.3 的加载函数配套):

# 生成样本级 QC 概览:每样本的有效峰数、缺失率与中位 TPM
qc_summary = pd.DataFrame({
    "n_obs_peaks": expr.notna().sum(axis=0),          # 该样本有表达值的峰数
    "missing_rate": expr.isna().mean(axis=0),          # 缺失率(= 未过 QC 峰占比)
    "median_tpm": expr.median(axis=0, skipna=True),    # 有效观测的中位 TPM
})
low_cov = qc_summary[qc_summary["n_obs_peaks"] < 10_000]
print(f"有效峰数 < 10,000 的样本数:{len(low_cov)}")    # 这些样本建模时应谨慎使用

§5 数据划分与使用建议

§5.1 官方划分

无 ML 划分。官方生物学划分:phase 1(稳态快照,975 人 + 399 小鼠)与 phase 2(时间序列);峰集为 phase 1 与 phase 1+2 混合集(hybrid:phase 1 全部过阈峰 + phase 2 未重叠子集,注释沿用 phase 1,保证启动子定义一致性)。

官方划分的两点设计意图值得注意:其一,hybrid 峰集保证了"启动子定义"在时间序列加入前后不变,使 phase 2 样本可以直接与 phase 1 参考对比;其二,QC 未过样本保留在峰识别证据中但不出表达值(§4.5),这是"证据集"与"定量集"的显式分离——ML 数据划分应沿用同一思想。

一个常见的反模式:把 phase 2 时间序列的数百个时间点当作独立样本与 phase 1 合并后随机划分。时间点之间的自相关远高于普通样本间相关(数小时间隔的分化过程几乎连续),任何此类划分都会让模型"背时间曲线"而非学习调控规律;正确做法是把整条时间曲线作为不可分割的分组单位(leave-one-time-course-out,见 §5.4)。

§5.2 社区惯例划分

序列模型(启动子/增强子活性预测)通行做法:按染色体划分 train/val/test(如 chr1-8/9-12/13-22 或保留 chr1、chr2、chr11 整条为测试),严禁随机按峰划分——同基因复合 TSS 与相邻增强子序列高度同源,随机划分即泄漏。细胞类型建模常用 leave-one-cell-type-out 或 leave-one-cell-lineage-out;表达矩阵聚类/降维任务的惯例是用 SSTAR 的细胞本体层级(CL 术语的祖先节点)做分层采样,保证每个 fold 覆盖主要谱系。

§5.3 泄漏风险重点

  1. 复合启动子家族:同一基因的 p1@/p2@ 峰序列相似、活性相关,按峰随机划分必然泄漏。
  2. 重复细胞来源:同一细胞类型的多个供体/批次样本高度相似;以"样本"为随机单位划分会让近乎相同的样本分属训练与测试。
  3. 时间序列相邻时间点:分化/激活时间点间隔数小时,相邻时间点几乎相同,必须整条时间序列划入同一侧。
  4. 增强子与启动子的近邻关系:同一座位的增强子与其靶启动子活性相关,且部分区域在两套目录中坐标紧邻。

§5.4 交叉验证建议

细胞类型预测任务用 GroupKFold(group = 细胞谱系或供体);序列活性预测用染色体级划分 + 内部验证染色体;时间序列任务用 leave-one-time-course-out。所有划分应在样本元数据(SDRF)核对 cell lot 与 provider 后再定。

三个实用细节:(1) 划分索引要与 QC mask 一起冻结存档,中途"补样本"必须重开新实验;(2) 增强子分类任务的负样本(非增强子区段)应从同一染色体划分内采样,避免负样本侧泄漏;(3) 跨物种验证时物种间不做随机混合,固定"人训练 → 小鼠测试"或反向的单向迁移协议。

§5.5 外部验证建议

  • 与 ENCODE/Roadmap 同细胞类型的 H3K4me3/H3K27ac、DNase/ATAC 峰交叉验证启动子/增强子判定;
  • 与 GTEx 组织表达验证启动子-组织一致性;
  • 用 GWAS Catalog 疾病位点富集做"细胞类型正确性"的间接验证(Andersson et al. 2014 原生范式);
  • 跨物种:利用 FANTOM5 自带的大鼠/犬/鸡面板与小鼠数据做物种保守性验证;
  • miRNA/lncRNA 联动:用官方 miRNA atlas 与 FANTOM CAT 目录验证"启动子活性 ↔ 功能产物"的一致性(两套目录均出自同一 CAGE 框架,对齐成本最低)。

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

FANTOM5 无官方云镜像;在任意 Linux 云主机上 5 分钟内可拿到核心表:

# 10-60 秒拿到人类 phase 1+2 robust 峰表达/注释表(无需注册、无需 token)
mkdir -p fantom5 && cd fantom5
wget -c https://fantom.gsc.riken.jp/5/datafiles/latest/extra/CAGE_peaks/hg19.cage_peak_phase1and2combined_ann.osc.txt.gz
# 也可用 lftp 镜像整个 latest 目录(约 2.5 TB,仅在需要原始数据时)
lftp -e 'mirror --parallel=4 /datafiles/latest/ ./fantom5-latest; bye' https://fantom.gsc.riken.jp

目录结构预期:CAGE_peaks/(注释 + 表达 TSV)、Enhancers/(增强子套件)、basic/(BAM/CTSS 原始档案);data_roothttps://fantom.gsc.riken.jp/5/datafiles/latest/ 本地镜像目录。最小可用子集 = 人类 *_ann.osc.txt 注释表 + 对应 *_expr 表达表(合计 GB 级),单机内存充足时可直接 pd.read_csv

若服务不可达:官方在 https://dbarchive.biosciencedbc.jp/data/fantom5/ 提供完整镜像(组件化打包,含 README 与版本历史),下载逻辑相同;镜像间文件命名一致,脚本无需改动即可切换。

§6.1 快速上手

# 目录结构预期(data_root 下):
#   data_root/
#     hg19.cage_peak_phase1and2combined_ann.osc.txt   # 注释表(OSC 风格,前两行为列名定义)
#     hg19.cage_peak_phase1and2combined_expr.norm     # RLE 归一化 TPM 矩阵(行 = 峰,列 = CNhs 样本)
# 最小可用子集:上述两文件即可完成"峰 × 细胞类型"表达分析
# data_root 拼接关系:所有路径相对 data_root,勿混入 basic/ 原始档案
import pandas as pd

data_root = "fantom5"
ann = pd.read_csv(f"{data_root}/hg19.cage_peak_phase1and2combined_ann.osc.txt",
                  sep="\t", dtype=str)
# 注释表前几列:00 Annotation(峰 ID,如 p1@SPI1)、01 Description、
#              02 Chromosomal position、03 EntrezGeneID、04 GeneSymbol、05 Description…
# 之后每列 = 一个样本(列名形如 CNhs10237,人类样本编号体系)
peak_id_col = "00:000000" if "00:000000" in ann.columns else ann.columns[0]
expr_cols = [c for c in ann.columns if c.startswith("CNhs")]  # CNhs = 人类样本列
mat = ann[expr_cols].apply(pd.to_numeric, errors="coerce")     # 空白 -> NaN(未过 QC)
top_peaks = mat.mean(axis=1).nlargest(10)
for i in top_peaks.index:
    print(ann.loc[i, "04:000000"], round(top_peaks[i], 1))  # 全项目平均活性最高的 10 个峰

# 预期输出形态(数值因版本而异):
#   SPI1 1234.5
#   MYC  987.6
#   ...(转录因子与管家基因通常占据头部)
print(f"矩阵规模:{mat.shape[0]} 峰 × {mat.shape[1]} 样本")  # 约 20 万 × 近千(人类)

§6.2 数据获取

渠道 链接 内容 大小 条件
官方批量下载 https://fantom.gsc.riken.jp/5/datafiles/latest/ phase 2.0 与 phase 1.3 全套 核心 4.1 GB / 全量约 2.5 TB
dbarchive 镜像 https://dbarchive.biosciencedbc.jp/data/fantom5/ README + 组件化数据包 4.1 GB(peaks)+ 86 MB(聚类)等
DDBJ DRA DRA_accession_tables 索引 原始 reads TB 级
交互访问 ZENBU / SSTAR / TET / FANTOM CAT / UCSC Track Hub 可视化与子集导出 按需
小鼠/跨物种面板 官方主页 organism atlas 区 mouse/rat/dog/chicken 峰与启动子表 视物种

获取策略建议(按研究阶段递进):

  1. 探索期:用 TET 在线抽取目标峰/样本子表,零下载验证想法。
  2. 建模期:下载 CAGE_peaks + Enhancers 两个组件(GB 级),本地全量建模。
  3. 生产期:确需原始 reads(自建比对、方法学改造)才镜像 basic(2.5 TB),并用 DRA_accession_tables 对齐原始存档。
# lftp 批量镜像(官方推荐)
lftp https://fantom.gsc.riken.jp/5/datafiles/latest/ -e 'mirror; bye'
# 增强子套件
wget -r -np -nH --cut-dirs=3 https://fantom.gsc.riken.jp/5/datafiles/latest/extra/Enhancers/
# 断点续传单个大表
wget -c https://fantom.gsc.riken.jp/5/datafiles/latest/extra/CAGE_peaks/hg19.cage_peak_phase1and2combined_ann.osc.txt.gz

§6.3 预处理全流程

# 从注释表构建"干净"的机器学习矩阵:峰 ID、坐标、基因符号、TPM 矩阵
import numpy as np
import pandas as pd

def load_fantom5_expression(ann_tsv: str) -> pd.DataFrame:
    """解析 FANTOM5 OSC 风格注释表,返回 index=peak_id、columns=样本 的 TPM 矩阵。
    关键点:前两行是列名定义行(00 Annotation、01 Description…),
    非数据;样本列以 CNhs 开头;空白 = 未过 QC,须保留为 NaN 而非填 0。"""
    raw = pd.read_csv(ann_tsv, sep="\t", dtype=str, low_memory=False)
    cols = {c: c.split(" ")[-1] if " " in c else c for c in raw.columns}
    raw = raw.rename(columns=cols)
    sample_cols = [c for c in raw.columns if c.startswith("CNhs")]
    expr = raw[sample_cols].apply(pd.to_numeric, errors="coerce")
    expr.index = raw["00 Annotation"].values          # p1@SPI1 / p@chr:...
    meta = raw[["02 Chromosomal position", "04 GeneSymbol" if "04 GeneSymbol" in raw.columns else raw.columns[4]]]
    return expr, meta

def split_position(pos: str):
    """'chr1:12345678+' -> (chr, start, strand);坐标为 0-based 起点。"""
    chrom, rest = pos.rsplit(":", 1)
    return chrom, int(rest[:-1]), rest[-1]

expr, meta = load_fantom5_expression("fantom5/hg19.cage_peak_phase1and2combined_ann.osc.txt")
expr = expr.dropna(how="all")                          # 全空行剔除
log_expr = np.log2(expr.fillna(0) + 1)                 # log2(TPM+1);注意保留原始 NaN mask 用于 QC 追踪
qc_mask = expr.notna()                                 # 样本×峰的"有效观测"掩码

格式转换与清洗清单(在 §6.3 代码之上逐项核对):(1) OSC 表头两行定义行剥离;(2) 空白 → NaN 而非 0(坑点 7);(3) 峰 ID 保留原样(p1@X@ 在 Parquet/SQL 层再转义);(4) 坐标列拆分为 chrom/start/strand 三列便于区间运算;(5) 若与增强子集合取交集,先确认双方坐标版本一致(坑点 2);(6) 输出前冻结 QC mask 与版本 manifest。

标准化与增强的边界:FANTOM5 表达表已做过 RLE 归一化,使用者的"标准化"通常只剩 log2(TPM+1) 与按任务的特征缩放;不建议对官方归一化值再做 quantile normalization(会破坏其跨样本相对结构)。增强策略见 §6.6。

hg19 → hg38 迁移的官方路径(不要自跑 liftOver 的原因在坑点 2):

# 官方已发布 hg38 重处理集,迁移 = 换文件前缀,而非 liftOver
# hg19: hg19.cage_peak_phase1and2combined_ann.osc.txt
# hg38: 官方重处理目录内对应 hg38 前缀文件(坐标 + 表达已随迁移重算)
data_root = "fantom5-hg38"          # 单独目录,避免与 hg19 混存
manifest = {                        # 把版本决策显式写进配置,供 MLOps 追踪
    "genome": "GRCh38",
    "phase": "phase 1+2",
    "normalization": "RLE(官方 phase 1+2 表)",
    "source": "https://fantom.gsc.riken.jp/5/datafiles/latest/",
}

§6.4 PyTorch DataLoader 完整代码

# 任务示例 1:细胞类型指纹自监督(表达矩阵重建 + 对比学习)
# 任务示例 2:序列->活性(配合从 02 列提取的坐标抓取序列,此处给出矩阵侧 Dataset)
import torch
from torch.utils.data import Dataset, DataLoader

class Fantom5PeakDataset(Dataset):
    """每条样本 = 一个 CAGE 峰的跨样本活性向量(log2 TPM+1,NaN→0 并给出掩码)。
    index_by:'peak' 返回向量;'sample' 返回跨峰向量(细胞类型指纹)。"""
    def __init__(self, expr: pd.DataFrame, log_expr: pd.DataFrame,
                 qc_mask: pd.DataFrame, min_obs: int = 5, index_by: str = "peak"):
        self.index_by = index_by
        if index_by == "peak":
            keep = qc_mask.sum(axis=1) >= min_obs          # 至少 5 个有效样本,过滤孤儿峰
            self.X = torch.tensor(log_expr[keep].to_numpy(dtype=np.float32))
            self.M = torch.tensor(qc_mask[keep].to_numpy(dtype=np.float32))
        else:
            keep = qc_mask.sum(axis=0) >= 1000             # 至少 1000 个有效峰的样本
            self.X = torch.tensor(log_expr.loc[:, keep].to_numpy(dtype=np.float32)).T
            self.M = torch.tensor(qc_mask.loc[:, keep].to_numpy(dtype=np.float32)).T

    def __len__(self):
        return self.X.shape[0]

    def __getitem__(self, i):
        return self.X[i], self.M[i], i                     # x、valid mask、索引

train_ds = Fantom5PeakDataset(expr, log_expr, qc_mask, index_by="sample")
train_loader = DataLoader(train_ds, batch_size=16, shuffle=True, num_workers=2)
x, m, idx = next(iter(train_loader))
print(x.shape, m.shape)    # torch.Size([16, n_peaks]) —— 细胞类型指纹批
# 用法提示:
# - index_by="peak" 时 batch 为 (B, n_samples),适合"峰 -> 活性谱"的自监督重建
# - index_by="sample" 时 batch 为 (B, n_peaks),适合细胞类型对比学习/反卷积
# - mask m 必须随 x 一起进入损失函数(如 masked MSE),禁止把 NaN 填 0 后算全量损失

§6.5 坑点 8 个

⚠️ 坑点 1:CTSS BED 第 4 列是 tag 计数,不是 BED score(分类:预处理陷阱)

问题*.ctss.bed.gz 的第 4 列为该单碱基位点的 CAGE tag 计数,而 UCSC BED 规范中 score 的语义是 0-1000 的可视化灰度。直接把计数当 score 用,或用 bedtools intersect -scores 聚合,会得到语义错误的数值(单点计数可远超 1000)。
症状:下游工具(IGV/UCSC track 渲染、bedtools 合并)出现 score 溢出、截断或告警;自建管线中"表达式"与"可视化值"不一致。
解决

  1. 简单方法:读入时显式命名第 4 列为 count,任何要写回 BED score 的场景用 min(count, 1000)
  2. 进阶方法:按 peak 聚合时以 TPM 归一化表达表为准(官方已按 RLE 归一化),CTSS 仅用于峰内精细定位。
  3. SOTA 方法:用 ZENBU 或官方 pooled_ctss 重处理集,避免手写 BED 解析逻辑。
    参考:dbarchive README(https://dbarchive.biosciencedbc.jp/data/fantom5/LATEST/README_e.html );UCSC BED 规范。

⚠️ 坑点 2:hg19(GRCh37)与 hg38(GRCh38)双版本坐标混用(分类:工程陷阱)

问题:原始主刊数据基于 hg19/mm9,2016 年后官方发布 GRCh38/GRCm38 重处理集与"liftOver 一致性"峰集。混用两套坐标做训练标签或与 ENCODE/GWAS 数据交集,会产生系统性错位。
症状:与 hg38 注释取交集时大量峰"找不到";GWAS SNP 富集结果莫名偏低;跨数据集模型标签错配。
解决

  1. 简单方法:全项目锁定一个版本(新项目选 hg38 重处理集)。
  2. 进阶方法:确需跨版本时,用官方 liftOver 一致性峰集(同峰双版本坐标),不要对 184,827 个峰自己跑 liftOver(会引入坐标漂移与链丢失)。
  3. SOTA 方法:以官方重处理表达表为准(它随坐标迁移重算了表达与基因-启动子关联)。
    参考:Lizio et al., NAR 2017(10.1093/nar/gkw995)"Upgrade to the latest genome assemblies"一节。

⚠️ 坑点 3:两套 RLE 归一化不可混表(分类:预处理陷阱)

问题:phase 1 表达表在 phase 1 样本内部做 RLE 归一化;phase 1+2 表中 phase 2 样本以 phase 1 峰计数的几何均值为参考重新归一化(保持 phase 1 数值不变)。把 phase 1 的某样本列与 phase 1+2 的另一样本列拼成"一张矩阵"输入模型,会引入两套尺度。
症状:跨表拼接后样本间中位表达漂移;PCA/UMAP 出现按 phase 分簇的假象;对比学习里 phase 成为最强方向。
解决

  1. 简单方法:只用 phase 1+2 一张表(201,802 峰 × 全样本)。
  2. 进阶方法:必须混用时重新做同尺度归一化(对两表公共峰做 TMM/RLE 重估)。
  3. SOTA 方法:以原始 count 表出发,用 edgeR 一把重算 RLE 因子。
    参考:Abugessaisa et al., Scientific Data 2017(10.1038/sdata.2017.112)Quantification of promoter activities 一节。

⚠️ 坑点 4:p1@/p2@ 排序是全项目证据排名,不是样本内排名(分类:标签理解)

问题p1@GENE 表示该基因相关峰在全项目 tag 证据中的第 1 名,与"在你当前研究的样本里哪个峰最强"无关。把 p1@ 默认当作"主要转录本"是误读。
症状:某个细胞类型里 p2@ 的 TPM 远高于 p1@;组织特异启动子研究被 p1@ 偏置主导,漏掉真正的状态特异开关。
解决

  1. 简单方法:按你目标样本的 TPM 对各基因的 pN@ 峰重新排序。
  2. 进阶方法:保留基因内全部峰(复合启动子),把"哪个峰主导"作为模型输出而非先验。
  3. SOTA 方法:以 DPI 峰为单位建模,禁止在输入侧把同基因峰合并(见坑点 5)。
    参考:官方 FAQ(https://fantom2.gsc.riken.jp/faq/ )p1@MYB/p2@MYB 条目。

⚠️ 坑点 5:复合启动子——按基因聚合会摧毁核心信号(分类:标签理解)

问题:Forrest et al. 2014 的核心发现即"许多哺乳动物启动子是由多个紧邻 TSS 组成的复合实体,各自有独立的细胞型特异表达"。把同一基因的多个峰合并(求和/取最大)再做 ML,会把"开关选择"这一数据集最有价值的信息抹平。
症状:细胞类型分类器准确率低于文献;反卷积矩阵秩异常;增强子-启动子配对全部指向同一基因座。
解决

  1. 简单方法:任何基因级汇总只放在展示层,建模层用峰级表达。
  2. 进阶方法:用峰-峰相关性(官方共表达聚类,MCL)作为弱监督结构。
  3. SOTA 方法:把"启动子使用(promoter usage)"本身作为预测目标(多 TSS 选择任务)。
    参考:Forrest et al., Nature 2014(10.1038/nature13182)摘要与图 2。

⚠️ 坑点 6:增强子是双向转录的——方向性分析必错(分类:标签理解)

问题:活跃增强子产生平衡的双向 eRNA(外切酶敏感、短、不剪接)。把增强子峰当链特异启动子做方向性/链特异序列分析,或用其"链"去推断靶基因方向,从数据语义上就不成立。
症状:增强子两侧链信号几乎相等(这正是判定依据);链特异模型在增强子标签上退化为随机。
解决

  1. 简单方法:增强子建模一律用双向/无向表征(双向对称池化)。
  2. 进阶方法:用"双向平衡度"本身作为增强子置信特征(Andersson 判据)。
  3. SOTA 方法:链特异分支仅在启动子任务启用,增强子分支共享权重并翻转对称。
    参考:Andersson et al., Nature 2014(10.1038/nature12787)。

⚠️ 坑点 7:CTSS 存在 ≠ 有表达值——缺失不是零(分类:预处理陷阱)

问题:官方有意让未过 QC(RIN ≤ 6、比对 reads < 50 万、5′ 端占比 < 50%)的 profile 参与峰识别但不出表达值。表达表中的空白是"未定量",填 0 会把仪器/样本质量问题变成"沉默"的生物学叙事。
症状:填 0 后出现大量"细胞类型特异沉默"假象;缺失模式与建库批次强相关。
解决

  1. 简单方法:矩阵保持 NaN,模型用 mask 机制(PyTorch 示例中已内置)。
  2. 进阶方法:缺失 imputation 前先用 SDRF 的 RIN、reads 数做"可观测性"协变量建模。
  3. SOTA 方法:只用 QC 通过样本子集训练,再对外部数据做迁移。
    参考:Abugessaisa et al., Scientific Data 2017,QC 阈值原文。

⚠️ 坑点 8:以"样本"为单位随机划分 = 数据泄漏(分类:数据泄漏)

问题:FANTOM5 中同一细胞类型常有多个供体/批次样本,时间序列相邻时间点间隔仅数小时。按样本随机划分 train/test,会让近乎相同的观测分属两侧。
症状:测试指标虚高(细胞类型分类接近完美);换外部队列立刻失效。
解决

  1. 简单方法:GroupKFold,group = 细胞类型(最保守)或供体。
  2. 进阶方法:时间序列任务 leave-one-time-course-out;先读 00_.assay_sdrf.txt 核对 cell lot/provider 再分组。
  3. SOTA 方法:双层评估——内部分组 CV + 外部数据集(ENCODE/GTEx 同细胞类型)迁移验证。
    参考:本 Wiki §5.3;Abugessaisa et al. 2017 Table 1(样本重复结构)。

§6.6 数据增强

  • ✅ 安全:log2(TPM+1) 变换、样本 bootstrap、按 QC 掩码的 masked-token dropout、同细胞类型多供体视图对比学习、序列侧反向互补(仅启动子任务)。
  • ❌ 危险:对增强子做单链翻转(破坏双向语义,见坑点 6);跨 phase 混表后的"尺度增强"(见坑点 3);把 QC 失败样本当负样本增强;同基因峰混洗交换标签(见坑点 4/5)。
  • ✅ 安全(时间序列):相邻时间点插值、时间方向保留的滑动窗口切片。
  • ❌ 危险(时间序列):打乱时间点顺序、把不同时间序列的同名时间点视为同一样本。

§6.7 模型推荐表

任务 推荐模型 理由
序列→启动子/增强子活性 CNN 残差网络(Basenji 风格)或 Enformer 类长程 Transformer CAGE 轨迹是这类模型的原生标签,FANTOM5 提供最大的细胞类型覆盖
细胞类型指纹/反卷积 变分自编码器 + mask;或 NMF/NNLS 反卷积 峰级稀疏矩阵 + QC 掩码天然适配
增强子-启动子配对 峰活性相关 + 距离先验的图模型 增强子先行波(Arner 2015)提供时间方向约束
GWAS 变异优先级 增强-SNP 富集 + 细胞类型特异回归(LDSC 类) Andersson 2014 原生范式
时间序列动力学 神经 ODE/自回归模型 408 个时间点统一平台测量
增强子目录扩充 半监督一致性模型(双向信号 + 染色质先验) 以 65,423 集合为正样本锚,向新数据外推
跨物种调控保守性 正交对齐 + 同源峰映射 FANTOM5 自带 rat/dog/chicken 面板可直接起步

§6.8 硬件需求

场景 最低配置 推荐
读表 + 统计(4.1 GB TSV) 16 GB RAM 32 GB RAM
表达矩阵全量训练(201,802 × 2,832) 64 GB RAM + 单卡 12 GB 128 GB RAM + 单卡 24 GB
序列模型(抓序列 + 多任务头) 单卡 24 GB 多卡 A100/40 GB + 序列预处理缓存 SSD 1 TB
原始数据自建管线(2.5 TB basic) 大容量 HDD + 64 GB RAM NVMe 4 TB + 并行流水线
全项目 lftp 镜像(latest 全目录) 磁盘 ≥ 3 TB 对象存储中转 + 校验和清单

§6.9 评估指标代码

# 启动子/增强子活性预测的标准指标:跨样本 Pearson/Spearman + 分类 AUROC
import numpy as np
from scipy.stats import pearsonr, spearmanr
from sklearn.metrics import roc_auc_score

def activity_corr(y_true: np.ndarray, y_pred: np.ndarray) -> dict:
    """y_true/y_pred: (n_peaks, n_samples),仅在双方均有值处计算。"""
    m = ~np.isnan(y_true) & ~np.isnan(y_pred)
    return {
        "pearson": float(pearsonr(y_true[m], y_pred[m])[0]),
        "spearman": float(spearmanr(y_true[m], y_pred[m])[0]),
        "obs_frac": float(m.mean()),                       # 有效观测占比,防"高相关靠少量点"
    }

def enhancer_auroc(y_bin, y_score):                        # 增强子 vs 启动子分类
    return float(roc_auc_score(y_bin, y_score))

def timecourse_lead(aug: np.ndarray, prm: np.ndarray) -> float:
    """增强子先行检验(Arner et al. 2015 思路):
    对每个增强子-启动子对,计算增强子达峰时间早于启动子的比例。"""
    assert aug.shape == prm.shape
    def peak_t(x):
        t = np.nanargmax(x)                                # 首个最大值时间点
        return t
    leads = [peak_t(a) < peak_t(p)
             for a, p in zip(aug, prm)
             if not (np.all(np.isnan(a)) or np.all(np.isnan(p)))]
    return float(np.mean(leads)) if leads else float("nan")

时间序列任务额外报告两档外推(leave-last-time-point 与 leave-one-time-course-out);跨物种任务报告物种内/物种间相关差(§7.8 的 Alam et al. 口径)。

§6.10 MLOps 笔记

  • 数据版本化:把"hg19 phase 1+2"或"hg38 重处理"写进数据卡(data card)与 DVC 路径,训练产物必须可追溯版本——两版本坐标不可互查是本项目最常见的复现事故。
  • QC 掩码入库:QC mask(qc_mask)与表达矩阵同版本存档;评估脚本的 obs_frac 必须随指标一起上报。
  • 许可合规:CC BY 4.0 只要求署名——在模型卡引用 Lizio et al. 2019 与主刊 DOI 即可商用;无需额外授权。
  • 监控漂移:新应用数据(如新批次 RNA-seq)与 FANTOM5 参考的分布距离(MMD/每峰分位偏移)纳入监控,参考数据 2011-2015 年采集,试剂与批次效应需警惕。
  • 复现包结构:建议每个实验固定携带四件套——manifest.json(§6.3 的版本决策)、qc_mask.npz、解析脚本(§6.3)与划分索引(§5.2)。评审或复现者最常问的三个问题(哪个版本、哪些样本过 QC、如何划分)都由这四件套直接回答。
  • 上游变更监控:dbarchive 更新历史(2019-03-29 V3)表明资源为低频维护态;在 CI 中对下载 URL 做 checksum 固定,避免镜像端文件变更悄悄污染训练数据。
  • 多语言命名规范:峰 ID 中的 @、坐标中的 +/- 与样本列 CNhs 前缀在 SQL/Parquet 转换时是保留字符重灾区——入库前统一把峰 ID 映射为带下划线的安全 ID,同时保留原 ID 映射表。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
样本可及性偏倚 原代细胞依赖可采购/可采集的细胞类型,稀有细胞类型缺失或仅单批次 分析前查 SDRF 的 cell lot/provider;避免对单样本细胞类型下强结论
永生化模型偏倚 250 个细胞系多为癌症来源,调控图谱偏离正常细胞 细胞系与原代分开建模;用原代子集做参考基线
组织来源偏倚 尸体解剖组织(部分来自荷兰脑库)偏向成人供体;无儿科分层设计 儿科应用需外部验证;利用小鼠发育时间序列做发育参照
检测技术偏倚 CAGE 只测 5′ 帽端转录;HeliScope 短读(MAPQ ≥ 20、identity ≥ 85% 过滤)在重复区灵敏度受限 与 RNA-seq/ChIP/ATAC 互补使用;重复区结论降级为弱证据
归一化结构偏倚 两套 RLE 参考(坑点 3)造成跨 phase 尺度差 单表使用;必要时重归一化
增强子判定偏倚 双向信号判据对低活性增强子欠灵敏,robust 阈值截断弱信号 低-中 阈值敏感度分析;用 phase 1+2 集合(65,423)扩大召回
单样本细胞类型无重复 部分稀有细胞类型仅 1 个样本,无法区分生物学与技术方差 分析前按 SDRF 统计每 CL 术语样本数;单样本细胞类型结论降级为探索性
时间序列覆盖有限 408 个时间点集中于特定分化/激活协议,不覆盖全部生物学转变 外推到新协议前先做协议内验证;引用 Arner 2015 的协议清单

§7.2 标注质量

测量型数据无标注一致性系数,质量由流程保障:两轮 RNA 质检(本地 + RIKEN)、每 run E17.5 内控、DPI 确定性算法(参数与代码公开:https://github.com/hkawaji/dpi1/ )、TSS 分类器用 EST/H3K4me3/DNase 外部证据富集真 TSS、ZENBU 逐样本人工巡检。表达定量仅纳入满足 RIN > 6 等三重门槛的 profile(§3.7/§4.5)。

对"标注质量"的三点结构性评述:第一,峰识别是确定性算法,同一输入永远同一输出——这比人工标注更可复现,但错误也是系统性的(DPI 的分解边界由全部样本联合信号决定,个别样本中的罕见 TSS 可能被并入邻近峰);第二,增强子判定规则(平衡双向信号)灵敏度与特异度之间存在权衡,弱活性增强子可能被 robust 阈值漏掉;第三,样本本体注释由 114 家机构合作者按各自领域提供,术语粒度不完全一致,SSTAR 页面是核对单个样本注释的最快途径。

§7.3 泛化性表

场景 失效风险 证据
稀有细胞类型/新批次原代细胞 中——单样本细胞类型无重复,批次效应不可分 SDRF 元数据可查 cell lot;官方 FAQ 建议联系 fantom-help@riken.jp 补样
跨物种(人 → 大鼠/犬/鸡) 中-高——同细胞类型转录组在物种间差异显著,但核心调控网络保守 官方主页跨物种比较结论(Alam et al., Genome Research, 10.1101/gr.255679.119)
癌症样本 中——细胞系图谱不能直接替代肿瘤微环境 Andersson et al. 2014 明确将细胞系与原代分开分析
转录后层面(剪接/蛋白丰度) 高——CAGE 不含该信息 方法学边界(Forrest et al. 2014)
时间序列外的动态过程 中-高——408 个时间点覆盖特定分化/激活协议 phase 2 设计范围(Arner et al. 2015)
单细胞分辨场景 高——FANTOM5 为批量图谱,无单细胞分辨率 仅可做聚合级锚定(§4.4b);单细胞注释需移植验证
临床直接诊断 高——无患者结局标签,非诊断数据集 §2.3 任务边界与 §0 医疗免责声明

§7.4 伦理

样本为原代细胞、细胞系与尸体解剖组织,非可识别患者;元数据记录性别、年龄段与组织来源(供应商以 catalog/lot 号记录);人组织通过合作机构与脑库等匿名渠道获取;原始 reads 存于 DDBJ DRA(联盟 accession 体系)。使用时遵守 CC BY 4.0 署名义务与来源机构任何附加条款。

四点延伸提示:(1) 商业采购细胞虽无个体身份,但供应商条款可能限制再分发衍生资源,对外发布模型与数据产物时注明"基于 FANTOM5 训练"即可,不必转售原始数据;(2) 尸体解剖组织样本的元数据若与外部供体登记信息交叉,理论上存在重识别面,下游发布可视化时应避免展示原始样本 ID 与来源机构组合;(3) 小鼠与其他动物样本不涉及人类伦理审查,但跨物种使用时应遵守实验动物来源国的相关规范;(4) 若将 FANTOM5 数据用于构建临床决策支持工具,请回到 §0 的医疗免责声明重新评估监管路径。

§7.5 公平性

数据集无人群分层设计(种族未系统记录),故不做人口统计公平性承诺;下游用其做疾病变异解读时,公平性风险来自"哪些细胞类型被测过"的可及性偏倚(§7.1 第一行)——对覆盖薄弱的细胞类型,模型先验自然稀薄。两点可操作的建议:(1) 报告细胞类型覆盖度表(每 CL 术语的样本数)作为任何下游模型的公平性附录;(2) 对单样本细胞类型,输出应标注"无重复参考",避免在临床解说中给出过度自信的置信度。

§7.6 数据漂移

参考图谱的"采集时代"为 2011-2015 年(HeliScope 平台时代)。新批次数据的建库试剂、测序平台(如新一代 CAGE 协议)会带来协议性漂移;建议以 QC 通过的稳健峰集合为锚做跨平台校准(同细胞类型 CAGE/RNA-seq 关联校准),并把 2014-2015 峰目录的坐标版本(hg19 vs hg38)作为静态版本化资产而非滚动更新对象。

三个漂移监控点位:(1) 平台漂移——从 HeliScope 到新测序仪的 5′ 端偏好差异;(2) 协议漂移——hCAGE 与 LQhCAGE 两条建库支线的灵敏度差(官方以约 100 ng 起始的 LQhCAGE 覆盖珍贵样本);(3) 注释漂移——GENCODE 版本演进使"novel 峰"比例随时间变化,做基因关联统计时应固定注释版本。

§7.7 DAIMS 24 项自评

# 检查项 状态 说明
1 宽格式支持 峰 × 样本 TPM 矩阵为标准宽表,pandas/R 直接读
2 唯一标识 pN@GENE/p@chr:start..end 全局唯一;样本 CNhs 编号唯一
3 特殊字符处理 ⚠️ OSC 注释表首两行是列名定义行,需自定义解析(§6.3)
4 重复行 DPI 非重叠峰保证无重复坐标;phase 1/1+2 双套需显式选择
5 缺失编码 ⚠️ 空白 = 未过 QC(非零),语义需 mask 机制承载(坑点 7)
6 标签可识别性 ⚠️ p1@/p2@ 为全局证据排名,非样本内(坑点 4)
7 罕见类分组 ⚠️ 单样本细胞类型存在;建议按谱系聚合(坑点 8)
8 偏倚评估 §7.1 六类偏倚逐条给出缓解路径
9 数据字典 dbarchive README + SDRF + 本 Wiki §4.1
10 信息性缺失解释 QC 三重门槛官方明文(§4.5)
11 设备记录 测序仪、run、内控、flowcell channel 逐样本记录于 SDRF
12 共线性 ⚠️ 同基因多峰活性强相关(复合启动子),建模需防共线(坑点 5)
13 编码映射 ⚠️ FF 本体非 UMLS,需人工映射 CL/Uberon/DO(§2.1b)
14 时间戳处理 时间序列 408 个时间点有系统标注;33 个数据集可索引
15 划分建议 §5 官方/社区/防泄漏三层建议
16 泄漏讨论 §5.3 四类泄漏 + 坑点 8
17 标签分布 §4.2 三层分布结构说明
18 测量偏倚 CAGE 技术边界与 HeliScope 过滤参数明文(§3.1/§7.1)
19 外部验证建议 §5.5 + §7.8 矩阵
20 版本记录 phase 1.0/1.3/2.0 与 dbarchive V3 时间轴(§1.4)
21 预处理脚本 ⚠️ 官方提供 DPI/rRNAdust 源码与 MOIRAI 流程,但无"一键 ML 预处理"脚本
22 合规要求 CC BY 4.0,开放获取,署名即用
23 多模态对齐 ⚠️ 单一模态(CAGE)为主;跨模态(ENCODE/GTEx)需自行坐标对齐(坑点 2)
24 去标识化 无个体可识别信息;供体以 catalog/lot 与匿名脑库来源记录(§7.4)

DAIMS 评分:17.5 / 24

评分解读:作为 2014-2019 年代的全基因组参考图谱,FANTOM5 在标识体系、元数据完备度(MAGE/ISA-tab + SDRF)、溯源链(DRA accession)与合规性上达到教科书级;失分集中在"机器学习友好层"——非标准 OSC 表头解析、QC 空白语义、FF 本体映射与双版本/双归一化结构,这些都需要使用者一次性构建适配层。

对你意味着什么:(1) 上手当天即可用 pandas 载入表达矩阵做分析,但请先照抄 §6.3 的解析函数(OSC 表头与空白语义);(2) 所有模型输入用 QC mask + 峰级表达,永远不要填 0;(3) 开工前锁定坐标版本(建议 hg38)与单一表达表(建议 phase 1+2),把版本号写进实验追踪;(4) 划分用 GroupKFold(组 = 细胞谱系/时间序列),不要用样本随机划分;(5) 若做临床方向应用,预留 FF 本体 → CL/SNOMED 的映射表工程。

按角色分解:算法研究员——你最需要的是坑点 3/4/5(归一化、峰命名、复合启动子),它们直接决定你的基线是否公平;数据工程师——坑点 1/2/7(BED 语义、坐标版本、缺失语义)是你的第一天工作清单,SDRF 解析器是必建件;临床/转化同事——§2.1b 的映射表与 §7.5 的覆盖度建议决定了你的结论能对外说多满;合规同事——CC BY 4.0 意味着无需 DUA 流程,但请把署名文献清单固化进发布模板。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
GWAS Catalog 疾病 SNP 多中心 疾病 SNP 在细胞型特异 vs 泛表达增强子中的富集 富集倍数 疾病调控 SNP 显著富集于细胞型特异活跃增强子(Andersson et al. 2014 原生验证)
H3K4me3/DNase 外部证据(ENCODE/Roadmap) ENCODE/Roadmap CAGE 峰为真 TSS 的支持度 证据重叠率 DPI 峰识别即以 EST/H3K4me3/DNase 做富集支持(Forrest et al. 2014 方法)
跨物种同细胞类型比较 FANTOM5 自带 rat/dog/chicken 面板 细胞类型转录保守性 同细胞类型物种间 vs 物种内相关 同细胞类型转录组物种间差异大,但核心调控网络保守(Alam et al., Genome Res, 10.1101/gr.255679.119)
miRNA 与启动子整合验证 FANTOM5 miRNA atlas(De Rie et al. 2017, Nat Biotechnol, 10.1038/nbt.3947) miRNA 启动子活性与成熟 miRNA 表达一致性 相关性 成熟 miRNA 与其 primary transcript 启动子活性高度相关,同 polycistron 内 miRNA 高度共表达
lncRNA 5′ 端注释验证 FANTOM CAT(Hon et al. 2017, Nature, 10.1038/nature21374) lncRNA 启动子活性图谱 目录一致性 27,919 个人类 lncRNA 基因获得准确 5′ 端,多数与增强子活性模式一致,支持功能相关性
GTEx 组织表达 GTEx 联盟 启动子-组织活性一致性 相关性 常用做法:以 FANTOM5 启动子活性校验 GTEx 组织表达方向(社区惯例,需自行坐标对齐)

§8 基准性能与生态

§8.1 排行榜与代表性下游基准

FANTOM5 是参考图谱而非竞赛基准,无官方排行榜。它的"性能数字"以三种身份出现在文献中:(a) 作为序列模型的多任务训练标签(Enformer/Basenji2 一系);(b) 作为增强子目录的比较基线(任何新增强子预测器都要与 FANTOM5 集合算重叠/精度);© 作为 GWAS 富集分析的注释库。下表列出代表性工作(数值口径各异,不可直接比较——训练序列范围、标签集合、物种与评估协议均不同):| 排名 | 模型 | 任务与性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|—|—|—|—|—|—|—|
| 1 | Enformer | 序列→人类/小鼠多轨迹表达(CAGE 轨迹为其标签来源之一),较前代显著提升远程增强子活性预测 | 2021 | 长程 Transformer(200 kb 感受野)+ 多任务头 | Avsec Ž. et al., Nat Methods, DOI 10.1038/s41592-021-01252-x | https://github.com/google-deepmind/deepmind-research/tree/master/enformer |
| 2 | Basenji2 | 序列→细胞类型 CAGE/RNA-seq 轨迹回归,跨细胞类型泛化 | 2020 | 一维卷积残差 + 多尺度池化 | Kelley D.R. et al., Genome Research, DOI 10.1101/gr.242784.118 | https://github.com/calico/basenji |
| 3 | FANTOM5 增强子-GWAS 范式 | 疾病 SNP 细胞类型富集分析(分析型基准) | 2014 | 双向 CAGE 增强子判定 + 富集检验 | Andersson R. et al., Nature 507(7493):455-461. DOI 10.1038/nature12787 | 无官方代码 |
| 4 | 增强子先行波模型 | 时间序列中增强子转录早于启动子的次序检验 | 2015 | 时间序列配对秩检验 | Arner E. et al., Science 347(6225):1010-1014. DOI 10.1126/science.1259418 | 无官方代码 |
| 5 | FANTOM CAT | lncRNA 与全转录本目录整合(27,919 个人类 lncRNA 基因) | 2017 | CAGE + CAGEscan + 长读长拼接 | Hon C.C. et al., Nature, DOI 10.1038/nature21374 | 数据见官方主页 |

数值不可直接比较的原因:各行任务定义、标签集合(哪些 CAGE 轨迹)、序列窗口、评估协议(峰级/基因级、物种、held-out 染色体方案)互不相同;表中仅第 1、2 行给出了跨数据集协议的正式论文结果。

§8.2 SOTA 总结与选型建议

若目标是"序列→调控活性",直接采用/微调 Enformer 类模型并以 FANTOM5 峰活性做迁移头是当前性价比最高的路径;若目标是细胞类型建模,建议自建 mask-aware VAE(§6.7)而非套用序列模型;若做 GWAS 解读,直接复用 Andersson 范式(富集 + 细胞类型特异回归)即可获得可发表结果。不要在 201,802 峰上全量训练重型模型——先用 robust 子集(约 18.4 万)与高表达峰降维。

两条经验性建议:第一,序列模型的多任务头按"细胞谱系"分组比按样本分组更稳——FANTOM5 的谱系内样本共享调控语法,谱系头数(数十)也在工程可控范围;第二,评估集里务必保留一定比例的"匿名峰"(p@chr),因为模型若只在 p1@ 这类高证据峰上表现好,说明它记住的是基因身份而非调控语法。

§8.3 评测协议

社区通行协议:(1) 染色体级划分(见 §5.2);(2) 以"峰级跨样本 Pearson/Spearman"为主指标、"增强子 vs 启动子 AUROC"为分类指标(§6.9);(3) 上报 obs_frac 防止高相关假象;(4) 跨数据集评估固定用官方 liftOver 一致峰集;(5) 时间序列任务报告时间点外推(leave-last-time-point)与整序列外推(leave-one-time-course-out)两档。

向他人报告结果时的三条纪律:先声明所用的坐标版本与表达表版本(坑点 2/3);先声明 robust 子集还是全集;先声明增强子定义用的是 phase 1(43,011)还是 phase 1+2(65,423)集合。三者不写清,结果不可比也不可复现。

数据集 关系 互补点
ENCODE(人类) 同域、多模态 提供染色质状态与 TF 结合,解释 FANTOM5 活性信号的机制
Roadmap Epigenomics 同域、表观 组蛋白修饰参照,增强子目录交叉验证
GTEx 个体/组织维度 供体级 eQTL 与组织表达,补充个体差异
FANTOM CAT / lncRNA 图谱 下游派生 更完整的转录本目录(含 lncRNA 5′ 端)
FANTOM4 前代项目 分化模型(THP-1)调控网络,历史对照
FANTOM6 后继项目 长非编码 RNA 敲降(RADICL-seq 等互动图谱),机制验证

§8.5 关键论文 Top 9

  1. Forrest A.R.R., Kawaji H., Rehli M. et al. (FANTOM Consortium and the RIKEN PMI and CLST (DGT)). A promoter-level mammalian expression atlas. Nature 507(7493):462-470 (2014). DOI: 10.1038/nature13182. — 项目主论文:复合启动子发现与启动子级表达图谱(Scopus 引用 1,574+)。
  2. Andersson R. et al. An atlas of active enhancers across human cell types and tissues. Nature 507(7493):455-461 (2014). DOI: 10.1038/nature12787. — 43,011 个活跃增强子图谱与双向 eRNA 判定(Google Scholar 引用 3,040+,截至 2026-09)。
  3. Arner E. et al. Transcribed enhancers lead waves of coordinated transcription in transitioning mammalian cells. Science 347(6225):1010-1014 (2015). DOI: 10.1126/science.1259418. — Phase 2 时间序列;增强子转录为状态转变最早事件。
  4. Lizio M. et al. Gateways to the FANTOM5 promoter level mammalian expression atlas. Genome Biology 16:22 (2015). DOI: 10.1186/s13059-014-0560-6. — 资源全景与官方初始引用文献。
  5. Lizio M. et al. Update of the FANTOM web resource: high resolution transcriptome of diverse cell types in mammals. Nucleic Acids Research 45(D1):D738-D744 (2017). DOI: 10.1093/nar/gkw995. — phase 1+2 汇总数字、GRCh38 重处理与工具矩阵。
  6. Abugessaisa I. et al. FANTOM5 CAGE profiles of human and mouse samples. Scientific Data 4:170112 (2017). DOI: 10.1038/sdata.2017.112. — 2,832 样本数据描述论文:流程、QC 阈值与归一化细节。
  7. Hon C.C. et al. An atlas of human long non-coding RNAs with accurate 5′ ends. Nature (2017). DOI: 10.1038/nature21374. — FANTOM CAT:27,919 个人类 lncRNA 基因准确 5′ 端。
  8. Lizio M. et al. Update of the FANTOM web resource: expansion to provide additional transcriptome atlases. Nucleic Acids Research 47(D1):D752-D758 (2019). DOI: 10.1093/nar/gky1099. — 官方"最新版"引用文献(FAQ 指定)。
  9. Alam T. et al. Comparative transcriptomics of primary cells in vertebrates. Genome Research (2019). DOI: 10.1101/gr.255679.119. — 跨物种主细胞比较:转录组物种间差异大而核心调控网络保守。

§8.6 社区活跃度

项目本体已于 2019 年后进入维护态(dbarchive V3,2019-03-29),但数据仍被持续大规模使用:主刊论文 Scopus 引用 1,574+(Forrest 2014)与 1,561+(机构库快照口径),增强子论文 Google Scholar 3,040+(截至 2026-09 快照)。社区支持渠道:官方 FAQ(https://fantom2.gsc.riken.jp/faq/ )与联系邮箱 fantom-help@riken.jp;DPI 源码托管于 GitHub(https://github.com/hkawaji/dpi1/ )。衍生工具生态(Mogrify、SlideBase、RefEx、CAGEd-oPOSSUM 等)自 NAR 2016/2017 更新起独立维护。

活跃度的三层结构值得注意:核心数据层稳定冻结(适合作为基准参照);派生资源层(FANTOM CAT、连接体、跨物种比较)随论文持续更新;下游使用层(序列模型、GWAS 注释、单细胞注释)活跃度最高且由 ENCODE/GTEx 等并行生态带动。对使用者的含义:不必担心"项目停更数据失效"——恰恰相反,冻结正是参考图谱成为基准的前提;需要跟踪的是衍生工具与浏览器端点(ZENBU/SSTAR)的可及性。

§8.7 生态快照表

资源 类型 链接 Star/热度截至 2026-09 推荐理由
ZENBU 数据整合与可视化浏览器 https://fantom.gsc.riken.jp/zenbu/ 官方主可视化系统(引用导向热度) 峰/增强子/time course 一站式浏览与导出
SSTAR 样本语义目录 https://fantom.gsc.riken.jp/5/sstar/ 官方 查单个样本的供体信息、RNA 质量与调控注释
TET 表格提取工具 官方主页工具区 官方 不下载全量数据即可抽取表达子表
FANTOM CAT Browser 基因/位点浏览 官方主页 官方 按 lncRNA/CAT 目录筛选与下载
dpi1(GitHub) 峰识别源码 https://github.com/hkawaji/dpi1/ 小众维护 复现 DPI 峰识别
UCSC Track Hub 基因组浏览器轨 官方主页(GRCh37/GRCh38,with ChIP-Atlas) 官方 与 ENCODE 轨道同屏对照
Cell/Ligand-Receptor Connectome 可视化 + 下载 官方主页 官方 144 种原代细胞的配体-受体信号图
CAGEd-oPOSSUM Motif 富集 Web 工具 官方主页工具区(NAR 2017 更新收录) 官方 基于 CAGE TSS 的 motif 富集,无需本地建模
RefEx / SlideBase / Mogrify 派生工具 独立站点(官方主页 partner 列表) 独立维护 基因表达参考、元件筛选与重编程因子目录

§9 相关资源与引用

§9.1 官方资源清单

阅读顺序建议:新手先读官方 FAQ 与 Genome Biol 2015 Gateway 论文(资源全景);建模者直接读 Scientific Data 2017(流程与 QC);做增强子先读 Andersson 2014 方法部分;做时间序列先读 Arner 2015。

§9.2 BibTeX 引用块

@article{Forrest2014promoter,
  title   = {A promoter-level mammalian expression atlas},
  author  = {Forrest, Alistair R. R. and Kawaji, Hideya and Rehli, Michael and Baillie, J. Kenneth and de Hoon, Michiel J. L. and Haberle, Vanja and Lassmann, Timo and Kulakovskiy, Ivan V. and Lizio, Marina and Itoh, Masayoshi and others},
  journal = {Nature},
  volume  = {507},
  number  = {7493},
  pages   = {462--470},
  year    = {2014},
  doi     = {10.1038/nature13182}
}

@article{Andersson2014enhancers,
  title   = {An atlas of active enhancers across human cell types and tissues},
  author  = {Andersson, Robin and Gebhard, Claudia and Miguel-Escalada, Irene and Hoof, Ilka and Bornholdt, Jette and Boyd, Mette and Chen, Yun and Zhao, Xiaobei and Schmidl, Christian and Suzuki, Takahiro and others},
  journal = {Nature},
  volume  = {507},
  number  = {7493},
  pages   = {455--461},
  year    = {2014},
  doi     = {10.1038/nature12787}
}

@article{Arner2015enhancerwaves,
  title   = {Transcribed enhancers lead waves of coordinated transcription in transitioning mammalian cells},
  author  = {Arner, Erik and Daub, Carsten O. and Vitting-Seerup, Kristoffer and Andersson, Robin and Lilje, Berit and Drabl{\o}s, Finn and Lennartsson, Andreas and R{\"o}nnerblad, Magnus and Hrydziuszko, Olga and Vitezic, Morana and others},
  journal = {Science},
  volume  = {347},
  number  = {6225},
  pages   = {1010--1014},
  year    = {2015},
  doi     = {10.1126/science.1259418}
}

@article{Lizio2015gateways,
  title   = {Gateways to the {FANTOM5} promoter level mammalian expression atlas},
  author  = {Lizio, Marina and Harshbarger, Jayson and Shimoji, Hisashi and Severin, Jessica and Kasukawa, Takeya and Sahin, Suleyman and Abugessaisa, Imad and Fukuda, Satoru and Hori, Fumi and Ishikawa-Kato, Sachi and others},
  journal = {Genome Biology},
  volume  = {16},
  pages   = {22},
  year    = {2015},
  doi     = {10.1186/s13059-014-0560-6}
}

@article{Lizio2017update,
  title   = {Update of the {FANTOM} web resource: high resolution transcriptome of diverse cell types in mammals},
  author  = {Lizio, Marina and Harshbarger, Jayson and Severin, Jessica and Kasukawa, Takeya and Sahin, Suleyman and Abugessaisa, Imad and Shimoyama, Megumi and Meehan, Terrence F. and Lassmann, Timo and others},
  journal = {Nucleic Acids Research},
  volume  = {45},
  number  = {D1},
  pages   = {D738--D744},
  year    = {2017},
  doi     = {10.1093/nar/gkw995}
}

@article{Abugessaisa2017datapaper,
  title   = {{FANTOM5} {CAGE} profiles of human and mouse samples},
  author  = {Abugessaisa, Imad and Noguchi, Shoko and Böttcher, Marie and Hombach, Vivian and Akalin, Altuna and Kavak, Pinar and Lin, Yuichi and Itoh, Masayoshi and Kawaji, Hideya and Lizio, Marina and others},
  journal = {Scientific Data},
  volume  = {4},
  pages   = {170112},
  year    = {2017},
  doi     = {10.1038/sdata.2017.112}
}

@article{Hon2017lncrna,
  title   = {An atlas of human long non-coding {RNAs} with accurate 5{'} ends},
  author  = {Hon, Chung-Chau and Ramilowski, Jordan A. and Harshbarger, Jayson and Bertin, Nicolas and Rackham, Owen J. L. and Gough, Julian and Denisenko, Elena and Schmeier, Sebastian and Poulsen, Thomas M. and Severin, Jessica and others},
  journal = {Nature},
  volume  = {543},
  pages   = {199--204},
  year    = {2017},
  doi     = {10.1038/nature21374}
}

@article{Lizio2019update,
  title   = {Update of the {FANTOM} web resource: expansion to provide additional transcriptome atlases},
  author  = {Lizio, Marina and Abugessaisa, Imad and Noguchi, Shoko and Kondo, Akira and Hasegawa, Akira and Hon, Chung-Chau and Carninci, Piero and Kasukawa, Takeya and others},
  journal = {Nucleic Acids Research},
  volume  = {47},
  number  = {D1},
  pages   = {D752--D758},
  year    = {2019},
  doi     = {10.1093/nar/gky1099}
}

@article{DeRie2017mirna,
  title   = {An integrated expression atlas of {miRNAs} and their promoters in human and mouse},
  author  = {De Rie, Diederik and Abugessaisa, Imad and Alam, Tanvir and Arner, Erik and Ashford, Sarah and Borkowski, Michal and Harshbarger, Jayson and Hasegawa, Akira and Kawaji, Hideya and Lizio, Marina and others},
  journal = {Nature Biotechnology},
  year    = {2017},
  doi     = {10.1038/nbt.3947}
}

§9.3 引用指南

  • 使用数据:官方指定引用 Lizio et al. 2019(latest)与 Lizio et al. 2015(initial),并按使用内容引用对应主刊论文(启动子 → Forrest 2014;增强子 → Andersson 2014;时间序列 → Arner 2015;数据细节 → Abugessaisa 2017)。
  • 使用 ZENBU/SSTAR/TET 工具:同上并注明官方主页。
  • 使用 dbarchive 镜像:注明其档案 DOI 10.18908/lsdba.nbdc01389-000.V003。
  • 论文方法节的标准写法示例:“CAGE profiles were obtained from the FANTOM5 consortium (Forrest et al., 2014; Lizio et al., 2019), processed as described in Abugessaisa et al. (2017)”; 增强子相关研究再加 “enhancers identified as balanced bidirectional CAGE peaks (Andersson et al., 2014)”。
  • 版本披露义务:无论投稿还是发布模型卡,必须写明所用坐标版本(hg19/hg38)、峰集代际(phase 1 或 phase 1+2)与表达表(norm/raw)——三者任一不写都会让结果不可复现。

§10 AI 使用声明卡

§10.1 AI 模型列表

本页面内容由大语言模型辅助起草(CodeBuddy 写作 agent,fast-model),未使用其他生成式模型。

§10.2 AI 参与范围

AI 参与:WebSearch 事实检索与整理、章节草稿撰写、代码示例编写、表格结构化。人工参与:事实核对(全部规模数字均对照官方主页、NAR/Scientific Data 论文与 dbarchive README)、医学与数据工程交叉审核(§0)、最终发布决定。

边界声明:AI 未编造任何规模数字——正文出现的每一个数字(样本数、峰数、增强子数、QC 阈值、文件大小、引用数)都可回溯到 §10.3 输入来源列表中的对应条目;检索无法核实的字段(如部分下载页未标注的文件大小)一律省略而非估算。代码示例经过人工走查但未在本地对官方文件逐一试跑,运行前请以实际文件表头为准(OSC 表头可能随版本微调)。

§10.3 输入来源列表

  1. Forrest A.R.R. et al. A promoter-level mammalian expression atlas. Nature 507(7493):462-470 (2014). DOI: 10.1038/nature13182.
  2. Andersson R. et al. An atlas of active enhancers across human cell types and tissues. Nature 507(7493):455-461 (2014). DOI: 10.1038/nature12787.
  3. Arner E. et al. Transcribed enhancers lead waves of coordinated transcription in transitioning mammalian cells. Science 347(6225):1010-1014 (2015). DOI: 10.1126/science.1259418.
  4. Lizio M. et al. Gateways to the FANTOM5 promoter level mammalian expression atlas. Genome Biology 16:22 (2015). DOI: 10.1186/s13059-014-0560-6.
  5. Lizio M. et al. Update of the FANTOM web resource: high resolution transcriptome of diverse cell types in mammals. Nucleic Acids Research 45(D1):D738-D744 (2017). DOI: 10.1093/nar/gkw995.
  6. Abugessaisa I. et al. FANTOM5 CAGE profiles of human and mouse samples. Scientific Data 4:170112 (2017). DOI: 10.1038/sdata.2017.112.
  7. Hon C.C. et al. An atlas of human long non-coding RNAs with accurate 5′ ends. Nature (2017). DOI: 10.1038/nature21374.
  8. De Rie D. et al. An integrated expression atlas of miRNAs and their promoters in human and mouse. Nature Biotechnology (2017). DOI: 10.1038/nbt.3947.
  9. Lizio M. et al. Update of the FANTOM web resource: expansion to provide additional transcriptome atlases. Nucleic Acids Research 47(D1):D752-D758 (2019). DOI: 10.1093/nar/gky1099.
  10. FANTOM5 官方主页. https://fantom.gsc.riken.jp/5/
  11. FANTOM5 Data Summary(批量下载说明). https://read.gsc.riken.jp/5/data
  12. FANTOM5 dbarchive README 与数据库描述(含许可与版本). https://dbarchive.biosciencedbc.jp/data/fantom5/LATEST/README_e.htmlhttps://dbarchive.biosciencedbc.jp/en/fantom5/desc.html
  13. FANTOM5 官方 FAQ(peak 命名与引用指南). https://fantom2.gsc.riken.jp/faq/
  14. FANTOM5 datahub track 描述页(HeliScopeCAGE 方法). https://fantom.gsc.riken.jp/5/datahub/mm9/TSS_peaks_and_counts.html
  15. Avsec Ž. et al. Effective gene expression prediction from sequence by integrating long-range interactions. Nature Methods (2021). DOI: 10.1038/s41592-021-01252-x.
  16. Kelley D.R. et al. Sequential regulatory activity prediction across chromosomes with convolutional neural networks. Genome Research (2020). DOI: 10.1101/gr.242784.118.
  17. Alam T. et al. Comparative transcriptomics of primary cells in vertebrates. Genome Research (2019). DOI: 10.1101/gr.255679.119.

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览与版本时间轴 千方病案医学编辑部 对照官方主页与 NAR 2017 官方表格逐数核对 ✅ 已通过
§2 医学背景与编码映射 千方病案医学编辑部(医学编辑) ICD-11/SNOMED 映射与生物学陈述复核 ✅ 已通过
§3 规格(样本数/格式/设备) 千方病案医学编辑部(数据工程师) 对照 Scientific Data 2017 与 dbarchive README ✅ 已通过
§4 数据结构与 DAIMS 字段字典 千方病案医学编辑部(数据工程师) 对照官方文件格式说明与 FAQ ✅ 已通过
§6 AI 就绪指南与 8 坑点 千方病案医学编辑部(数据工程师) 代码逻辑走查;坑点溯源至官方文档与论文原文 ✅ 已通过
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部 逐项对照原文证据评级 ✅ 已通过
§8-§9 引用与生态 千方病案医学编辑部 DOI/引用数逐条核对检索快照 ✅ 已通过
frontmatter 与 JSON-LD 千方病案医学编辑部(数据工程师) schema 校验与 URL 占位核查 ✅ 已通过

§10.5 AI 生成章节标注

全部章节由 AI 起草;§0 声明、§2.1/§2.1b 编码映射、§7.7 DAIMS 评级与 §10.4 校验结论由人工编辑终审修改后定稿。

区块 生成方式 人工介入程度
frontmatter 与 JSON-LD AI 起草 逐字段核对(含 URL 占位与 Croissant 结构)
§1-§5 叙述与表格 AI 起草 数字逐条对照官方来源
§6 代码与坑点 AI 起草 逻辑走查;坑点溯源至官方文档
§7 DAIMS 评级 AI 初评 人工复核每项状态与评分
§8-§9 引用与生态 AI 起草 DOI 与引用数逐条核对
§10 声明卡 AI 起草 人工终审

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集