信息速览

Reactome 通路数据库 — 人工审编生物通路知识库 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | Reactome 通路数据库 |
| 英文全称 | Reactome Pathway Database |
| 别名/简称 | Reactome;Reactome Knowledgebase;The Reactome Pathway Knowledgebase |
| 疾病分类(ICD-11) | 覆盖多系统疾病通路,代表编码见 §2.1(如 5A11 型 2 糖尿病、2C25 支气管或肺恶性肿瘤) |
| SNOMED CT | 通过 OMIM/EWAS 映射间接关联疾病概念,代表映射见 §2.1b |
| 数据模态 | 生物通路(人工审编的反应/通路网络,含通路层级、反应事件、对象模型与分析工具) |
| AI 任务类型 | 富集分析(ORA/GSEA)、通路感知特征工程、知识图谱构建、多组学比较通路分析 |
| 样本总数 | 16,423 条人类反应、2,883 条人类通路(V97,截至 2026-06) |
| 数据格式 | GMT、CSV、BioPAX L3、SBML L3V1、SBGN、PSI-MITAB、Neo4j 图数据库 dump、MySQL dump |
| 许可证 | CC0 1.0 Universal(注释与互作文件);CC BY 4.0 International(软件、dump、插图、图标库) |
| 访问级别 | 开放(无需注册,直接下载与 API 调用) |
| DUO 标签 | 不适用(知识库,无人类受试者数据) |
| 语言 | 英语(内容与界面);中文导读见本页面 |
| 首发日期 | 2005-01(NAR 数据库刊首篇论文;前身 Genome Knowledgebase 2003 年见诸文献) |
| 最后更新 | 2026-06-30(V97);自 V89(2024-06)起每季度发布并存档于 Zenodo |
| 发布机构 | EMBL-EBI、OICR、俄勒冈健康与科学大学、NYU 格罗斯曼医学院联合维护 |
| 官方主页 | https://reactome.org/ |
| 下载地址 | https://reactome.org/download-data/ |
| DOI | 10.1093/nar/gkad1025(NAR 2024 数据库论文;引用指引见 reactome.org/cite) |
| AI 就绪度评分 | ⭐⭐⭐⭐⭐(5/5)— 官方 GMT 基因集、Analysis Service 与 Neo4j dump 一键可用,格式标准齐全;扣分项仅为季度版本漂移与 Analysis token 7 天失效,需自行固定版本 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、疾病通路覆盖)、§7 偏倚分析(审编偏倚、基因集冗余)。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Reactome 注释文件与相互作用数据采用 CC0 1.0 Universal 许可,软件与数据 dump、通路插图及图标库采用 CC BY 4.0 International 许可,使用时应按官方 License Agreement 与 引用指引 规范署名。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? Reactome 是一个免费、开放、人工审编并经同行评审的生物通路知识库。它把经过实验验证的分子事件——结合、磷酸化、转运、催化等——逐条整理成"反应",再把反应串联成"通路",从细胞周期、免疫信号到代谢与疾病机制都有覆盖。你可以把它理解为一部持续更新的"细胞生命活动百科全书",每条内容都注明出处文献(reactome.org)。
为什么重要? 高通量实验(RNA 测序、蛋白质组、突变目录)产出成千上万个基因的差异列表,研究者需要回答"这串基因在干什么"。Reactome 用 2,883 条人类通路(V97)提供了从基因列表到机制叙事的桥梁,是富集分析(超几何 ORA、GSEA)的主流知识源之一,被 2026 年 PLOS Computational Biology 的富集方法学教育论文点名为覆盖最丰富的两大综合通路库之一(Reactome Research Spotlight)。
我能用它做什么? 三件事:其一,把基因/蛋白/小分子列表提交官方 Analysis Service,几分钟得到带 FDR 校正的富集通路排名;其二,下载 GMT 基因集接入 clusterProfiler、GSEA 或自研模型,做通路感知特征工程;其三,用 BioPAX/SBML/Neo4j 图数据库把通路网络接入系统生物学建模或图神经网络(下载数据)。
§1.1 摘要
Reactome 采用"反应(Reaction)—通路(Pathway)—顶层过程(Top-level Pathway)"三级对象模型:反应是数据库的基本单元,定义为任何分子事件;反应按生物学因果串联为通路;通路再归入免疫、代谢、信号转导等顶层过程。内容生产采取"专家作者撰写 + 独立专家评审 + 文献证据链绑定"的人工审编流程,人类通路审编完成后通过直系同源关系计算投影到 14 个非人物种(V94 统计:20,320 条 orthologous pathways,基于 80,701 个直系同源蛋白)。数据模型单一一致,同一对象模型既支撑网页浏览器可视化,也支撑 BioPAX L3、SBML L3V1、SBGN、GMT、CSV 映射文件与 Neo4j 图数据库 dump 等导出。Reactome 自 2018 年起以图数据库(Neo4j)为运行时后端,解决复杂通路数据的查询性能问题(Fabregat et al., 2018)。项目由 EMBL-EBI、OICR、俄勒冈健康与科学大学与 NYU 格罗斯曼医学院四个团队分工维护,获美国 NIH U24 HG012198 资助,是 ELIXIR 核心数据资源、全球核心生物数据资源(GCBR),并通过 CoreTrustSeal 可信仓储认证。
§1.2 战略价值
维度一:AI 特征工程的先验知识源。 对医疗 AI 而言,通路知识库的价值在于把"数千维稀疏基因特征"压缩为"数百维有生物学语义的通路特征"。Reactome 的反应级粒度使特征不再停留在 GO 那样泛化的"生物学过程"词汇,而是落到"EGFR 酪氨酸激酶二聚化""Caspase 级联激活"这类可解释的机制单元;疾病维度上还提供 5,507 个蛋白质变体(V94)与 1,888 条疾病特异反应,可支撑肿瘤突变目录的通路归因。这种粒度在构建通路瓶颈层(pathway bottleneck layer)、多任务模型输出头与可解释性热图时均比粗粒度本体更贴近临床叙事。
维度二:AI-Ready 生态完备度。 Reactome 是少数同时满足"结构化数据下载 + 程序化 API + 分析工具内置 + 长期版本存档"四要素的通路资源:Content Service 与 Analysis Service 提供 REST 接口;ReactomeGSA 包打通多组学比较分析;每季度发布的下载文件自 V89 起全部在 Zenodo 存档并获 CoreTrustSeal 认证,保证论文引用时可回溯到具体版本。对需要构建知识图谱的团队,官方 Neo4j 图数据库 dump 可直接导入,省去从关系表重建图结构的工程成本。
§1.3 同类数据集横向对比
| 维度 | Reactome | KEGG | Gene Ontology | WikiPathways |
|---|---|---|---|---|
| 定位 | 人工审编反应/通路网络 | 手绘通路图 + 基因组资源 | 三维功能本体词汇 | 社区协作通路图 |
| 基本单元 | 反应(分子事件) | 通路图(map) | 本体术语(term) | 通路(GPML) |
| 人类通路规模(V97/官方口径) | 2,883 条通路、16,423 条反应 | 数百张通路图(自有口径) | 数万术语(本体规模,非通路) | 数千条社区通路(全球社区维护) |
| 证据标准 | 每条反应绑定文献证据,专家评审 | 管理机构审编,文献支撑程度不均 | 注释来自多来源联盟 | 社区作者 + 维护状态不一 |
| 开放许可 | 注释 CC0 1.0;软件与 dump CC BY 4.0 | 限制性学术许可(商业化需付费) | CC BY 4.0 | CC0 |
| 数据格式 | GMT/CSV/BioPAX/SBML/SBGN/Neo4j | KGML、网页 | OBO/OWL | GPML |
| 机器可读 API | Content/Analysis REST、Neo4j | REST API(部分受限) | 下载文件为主 | Webservice |
| 差异化 | 反应级机制粒度 + 官方富集工具 | 直观地图与 Ko 索引 | 最广覆盖的基因功能词汇 | 领域专家自由绘制 |
表中各库统计口径不同(通路 vs 图 vs 术语),数字不可直接比较;Reactome 数字取自 官网首页 V97 统计,许可信息取自 官方新闻页。
§1.4 版本时间轴
| 时间 | 版本/事件 | 规模或内容要点 | 来源 |
|---|---|---|---|
| 2003 | 前身 Genome Knowledgebase 发表 | Cold Spring Harbor Symposium 论文,Reactome 项目雏形 | CSHL 论文引文 |
| 2005-01 | NAR 首篇数据库论文 | Joshi-Tope et al., NAR 33(Database):D428-432,确立"反应为基本单元"模型 | Oxford Academic |
| 2018 | 图数据库架构上线 | Fabregat et al., PLoS Comput Biol,Neo4j 图模型替代关系模型 | 论文 DOI |
| 2024-06 | V89,Zenodo 存档启动 | 每季度在 Zenodo 存档下载文件,直至当前版本 | 下载数据页 |
| 2025-06 | V93 | 15,890 条人类反应、2,799 条通路、41,048 篇文献;14 个非人物种 20,102 条 orthologous pathways;Docker 镜像迁至 AWS ECR | V93 新闻 |
| 2025-09-11 | V94 | 16,002 条人类反应、2,825 条通路、14 个非人物种 20,320 条 orthologous pathways;1,888 条疾病特异反应 | 新闻页 |
| 2025-12-09 | V95(NAR 2026 配套版) | 2,848 条人类通路、16,200 条反应;Pathway Browser beta 上线 | 官网首页 |
| 2026-06-30 | V97(当前版本) | 2,883 条人类通路、16,423 条反应、11,694 个蛋白质、2,188 个小分子、1,102 个药物、43,308 篇文献 | 官网首页 |
§1.4b 季度版本统计演化
三个可完整溯源版本的统计对照(均为官方发布口径,截至各版发布日):
| 统计项 | V93(2025-06) | V94(2025-09) | V97(2026-06) |
|---|---|---|---|
| 人类反应 | 15,890 | 16,002 | 16,423 |
| 人类通路 | 2,799 | 2,825 | 2,883 |
| 蛋白质及修饰形式所涉基因 | 11,396 | 11,410 | 11,694(蛋白质实体口径) |
| 复合物 | 15,621 | 15,751 | 未单列 |
| 小分子 | 2,172 | 2,176 | 2,188 |
| 药物 | 1,068 | 1,070 | 1,102 |
| 文献引用 | 41,048 | 41,373 | 43,308 |
| orthologous pathways(非人物种) | 20,102(14 物种) | 20,320(14 物种) | 未单列 |
| 疾病特异反应 / 疾病通路 | 1,881 / 764 | 1,888 / 763 | 未单列 |
各版本单列统计项略有差异(未单列 = 该版新闻未公布该项,非数据缺失);V97 主统计取自官网首页摘要框,V93/V94 取自官方新闻页全文。
§1.5 典型应用场景
- 差异表达基因的机制解读:RNA-seq 差异分析后,将显著基因列表提交 Analysis Service,用超几何 ORA + Benjamini-Hochberg FDR 得到通路排名,并用表达覆盖热图定位激活的通路分支。
- 肿瘤突变目录的通路归因:将体细胞突变基因映射到疾病通路(V94 含 1,888 条疾病特异反应),识别信号通路层面的反复受累模块。
- 通路感知特征工程:把 GMT 基因集转成基因×通路的二值关联矩阵,作为神经网络的第一层结构先验或稀疏投影矩阵。
- 多组学比较分析:用 ReactomeGSA 对转录组与蛋白质组数据做统一的通路级比较,输出跨组学一致的富集方向(Griss et al., 2020)。
- 知识图谱与图神经网络:导入 Neo4j 图数据库 dump,以反应-输入-输出-催化者为边构建异质图,训练链接预测或子图分类模型。
§2 医学背景
§2.1 疾病通路与 ICD-11 映射
Reactome 顶层设有 Disease 分支(R-HSA-1643685),以疾病特异反应与疾病变体注释形式覆盖遗传病、感染性疾病与肿瘤。本页面选取数据集收录的重点疾病主题,与 ICD-11 编码对应如下:
| 标签 | ICD-11 编码 | ICD-11 中文名 | Reactome 通路主题 |
|---|---|---|---|
| Type 2 diabetes mellitus | 5A11 | 2 型糖尿病 | 胰岛素信号转导、GLP-1 与胰岛素分泌调节 |
| Malignant neoplasm of bronchus or lung | 2C25 | 支气管或肺恶性肿瘤 | EGFR/ALK/MET 等驱动基因信号、肿瘤相关通路 |
| Alzheimer disease | 8A00 | 阿尔茨海默病 | Tau 蛋白代谢、淀粉样蛋白加工与神经退行通路 |
| Essential hypertension | BA00 | 原发性高血压 | 肾素-血管紧张素系统、血管平滑肌收缩 |
| Tuberculosis of lung | 1B10 | 肺结核 | 先天免疫与分枝杆菌感染应答通路 |
ICD-11 编码取自 WHO ICD-11 官方浏览器标准编码;Reactome 通路主题按官方 Disease 分支内容归纳。具体编码与通路的对应关系应在实际应用中以 ICD-11 浏览器 与 Reactome 疾病分支 复核。
§2.1b SNOMED CT 映射
Reactome 不直接发布 SNOMED CT 编码,而是通过官方 Reactome to OMIM 映射文件与 EWAS 映射文件间接衔接临床术语体系;下表给出代表性疾病概念的直接 SNOMED CT 编码供工程对接:
| Reactome 疾病通路主题 | ICD-11 | SNOMED CT | 术语说明 |
|---|---|---|---|
| 胰岛素信号与 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2 |
| 肺恶性肿瘤通路 | 2C25 | 363358003 | Malignant neoplastic disease of bronchus and lung |
| 阿尔茨海默病通路 | 8A00 | 26929004 | Alzheimer’s disease |
| 原发性高血压通路 | BA00 | 38341003 | Hypertensive disorder, systemic arterial |
| 结核感染应答通路 | 1B10 | 56717001 | Tuberculosis |
§2.2 疾病主题简介与流行病学背景
Reactome 的疾病注释采取"机制而非诊断"的视角:它不按疾病分类学组织内容,而是把致病基因变体、药物靶点与异常分子事件锚定在正常通路上,形成疾病特异反应。以 V94 统计为例,数据集收录 5,507 个蛋白质变体(源自 392 个蛋白),支撑 1,888 条疾病特异反应与 763 条疾病通路的注释(新闻页)。这些注释与 OMIM、EWAS 关联文件交叉引用,使遗传关联研究(GWAS/EWAS)结果可以落到具体机制步骤。
重点疾病主题及其在 Reactome 中的注释方式:
| 疾病主题 | 注释方式 | AI 可提取内容 | 适用任务 |
|---|---|---|---|
| 肿瘤信号转导 | 突变受体/效应蛋白变体锚定到正常信号反应 | 变体-反应映射、通路激活路径 | 突变归因、药物靶点解释 |
| 遗传代谢病 | 酶缺陷变体绑定代谢反应步骤 | 缺陷步骤与底物堆积逻辑 | 新生儿筛查解释、代谢建模 |
| 神经退行性疾病 | 蛋白稳态、自噬、 Tau/淀粉样加工通路 | 聚集机制反应链 | 靶点发现、转录组解读 |
| 感染性疾病 | 病原-宿主互作反应(含微生物标识符) | 宿主应答与病原策略双视角 | 感染组学分析 |
| 免疫失调与自身免疫 | 细胞因子信号、补体级联、炎症小体 | 信号通路分支与调节环路 | 免疫图谱构建 |
就医学叙事而言,Reactome 覆盖的疾病主题横跨肿瘤信号转导(受体酪氨酸激酶、细胞周期检查点)、代谢性疾病(胰岛素分泌、脂质代谢)、神经退行性疾病(蛋白稳态与自噬)与感染免疫(模式识别受体、补体级联),与现代慢病负担结构高度重合,为医疗 AI 提供了从分子机制到临床表型的桥梁层。
§2.3 支持的临床任务定义
| 临床任务 | Reactome 支撑方式 | 典型输出 |
|---|---|---|
| 机制筛查 | 差异基因列表 → 超几何 ORA | 带 FDR 的受累通路排名 |
| 分型归因 | 疾病特异反应映射 + 变体注释 | 突变负荷的通路分布 |
| 预后建模 | 通路活性评分(ssGSEA 等)作为协变量 | 通路评分-生存关联特征 |
| 药物机制解释 | 1,102 个药物条目(V97)的通路锚定 | 药物靶点所在通路与抵抗机制 |
| 生物标志物发现 | ReactomeFI 功能互作网络 + 拓扑分析 | 网络模块中心性候选标志物 |
§2.4 使用人群画像
| 画像 | 规模/来源 | 使用方式 | 关注内容 |
|---|---|---|---|
| 生物信息学者 | 全球学术界(ELIXIR/GCBR 服务对象) | 网页 Analysis Tools、R/Python 包 | 富集统计与版本 |
| 医疗 AI 工程师 | 工业界与转化研究团队 | GMT 特征工程、Neo4j 图谱 | 格式稳定性、许可 |
| 实验生物学家 | 课题实验室 | Pathway Browser 可视化 | 反应细节与文献证据 |
| 临床研究者 | 医院研究中心 | 疾病通路浏览、组学报告 | 疾病分支与药物条目 |
| 数据库开发者 | 资源集成方 | Content/Analysis REST API | 稳定 ID 与版本联动 |
§2.5 临床价值
Reactome 对临床转化的价值体现在三层:第一,解释层——把组学差异翻译为机制叙事,支撑分子肿瘤板等 MDT 场景的通路级证据陈述;第二,先验层——作为特征工程先验降低样本量需求,在队列规模有限的临床研究中提高模型稳健性;第三,药物层——V97 收录 1,102 个药物条目,把药物作用锚定在通路上,可支撑老药新用与抵抗机制的通路级解释。需要强调的是,Reactome 本身是知识库而非诊断工具,任何进入临床决策链路的富集结论都必须经过独立临床验证。
价值链条对照:
| 环节 | Reactome 供给 | 医疗 AI 消费方式 |
|---|---|---|
| 组学差异 → 机制 | 富集分析 + 表达覆盖热图 | 报告生成、机制假设排序 |
| 变异 → 通路 | 疾病变体注释(V94:5,507 变体) | 肿瘤突变归因模型 |
| 药物 → 靶点 | 药物条目通路锚定(V97:1,102 个) | 药物响应预测特征 |
| 通路 → 网络 | FI 功能互作网络 | 网络传播与模块挖掘 |
| 知识 → 图谱 | Neo4j dump | 异质图神经网络预训练 |
§2.6 金标准对照
| 维度 | 内容 |
|---|---|
| 划分方式 | 无训练/测试划分(知识库);评测依赖下游任务自定义划分 |
| 标注方式 | 人工审编:专家作者撰写 + 独立专家同行评审 + 文献证据绑定 |
| 标注者资质 | 分子生物学领域专家作者与评审人(官方新闻页按版本公开致谢外部作者与评审名单) |
| 性质 | 命名式知识标注(非诊断金标准);作为富集分析参照系使用 |
| 更新机制 | 季度发布;自动化工作流监测证据文献撤稿并修正受影响注释(Reactome Research Spotlight) |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本/文件 | 大小量级 | 理由 |
|---|---|---|---|
| 网页即用富集分析 | V97 Analysis Service(在线) | 零下载 | 官方维护统计与 BH FDR,免本地部署 |
| GSEA/clusterProfiler 基因集 | ReactomePathways.gmt(V97,随发布更新) | MB 级文本 | 官方维护、符号基因即取即用,Zenodo 可存档 |
| 系统生物学建模 | SBML L3V1 / BioPAX L3 全量包 | MB-数十 MB 级压缩包 | COPASI、CellDesigner 等 L3V1 工具链支持 |
| 知识图谱/GNN | Neo4j 图数据库 dump | GB 级压缩包 | 原生图模型,免自行重建图结构 |
| 关系型集成到内部数仓 | MySQL dump + CSV 映射文件 | MB-GB 级 | 与既有 SQL 基础设施对齐 |
| 长期可引用存档 | Zenodo 每季度存档(自 V89) | 按版本打包 | CoreTrustSeal 认证,论文可锁定版本 |
| 旧格式兼容 | 无(V94 起停供 BioPAX L2 与 Protégé ontology 文件) | — | 必须迁移到 BioPAX L3 等现行格式 |
§3.1 模态详情
Reactome 属于"人工审编反应/通路网络"模态,包含四类结构化内容:其一,通路层级——从顶层过程到最低层通路的父子关系网络;其二,反应事件——输入/输出分子、催化剂、调节剂与亚细胞定位;其三,对象模型——蛋白质及修饰形式、复合物、小分子、药物、蛋白变体的统一实体模型;其四,通路分析工具——标识符映射、超几何 ORA、通路拓扑与表达覆盖分析。模型生物通路不是独立审编,而是人类通路的直系同源计算投影(V94:14 个非人物种、20,320 条 orthologous pathways),使用时须注意投影口径。
核心实体对象模型一览(关系型与图数据库两种导出共用的概念模型):
| 实体类型 | 角色 | 关键属性 | 与其他实体的关系 |
|---|---|---|---|
| Event(ReactionlikeEvent/Pathway) | 知识单元 | 稳定 ID、名称、goBiologicalProcess | hasEvent 组成层级;precedingEvent 表因果序 |
| GenomeEncodedEntity | 蛋白及修饰形式 | UniProt 参照、修饰位点 | 作为反应输入/输出/催化剂 |
| Complex | 蛋白/小分子聚合体 | 组分清单、 Stoichiometry | hasComponent 递归组成 |
| SimpleEntity | 小分子/药物 | ChEBI 参照 | 反应化学计量 |
| EntityWithAccessionedSequence | 序列锚定蛋白 | 基因名、isoform | 关联 ReferenceSequence |
| LiteratureReference | 证据文献 | PMID、期刊、年份 | 反应级 evidence 绑定 |
| Drug | 药物条目 | 靶点反应锚定 | V97 共 1,102 个 |
§3.2 按子集规模表
| 子集 | 规模(V97 官方统计,截至 2026-06) | 说明 |
|---|---|---|
| 人类通路 | 2,883 条 | 人工审编层级结构 |
| 人类反应 | 16,423 条 | 分子事件级注释单元 |
| 蛋白质实体 | 11,694 个 | 含修饰形式归属 |
| 小分子 | 2,188 个 | ChEBI 标识 |
| 药物 | 1,102 个 | 通路锚定药物条目 |
| 文献引用 | 43,308 篇 | 反应级证据链 |
§3.3 数据格式表
| 格式 | 内容 | 典型用途 | 获取 |
|---|---|---|---|
| GMT | 通路→基因符号集(每行一条通路) | GSEA、ORA、特征工程 | Reactome Pathways Gene Set |
| CSV/TSV | 通路清单、层级关系、UniProt/Ensembl/ChEBI/NCBI/miRBase/GtoP 映射 | ID 映射、层级解析 | 映射文件区 |
| BioPAX L3 | 全物种事件本体化交换格式 | 通路数据集成、语义推理 | 系统生物学格式区 |
| SBML L3V1 | 人类/全物种反应模型 | 动态建模、COPASI | 系统生物学格式区 |
| SBGN | 人类通路图过程描述 | 图形交换 | 系统生物学格式区 |
| PSI-MITAB | 蛋白-蛋白相互作用(复合物推断,仅限 ≤4 组分复合物) | 网络分析 | 互作文件区 |
| Neo4j dump | 全库图数据库 | 图查询、GNN | Graph Database |
| MySQL dump | 关系型全库 | SQL 集成 | 下载页 |
| SVG/PNG | 人类通路图与插图 | 论文图、报告 | 图表区 |
| GO association | 通路→GO(GO-CAM 项目) | 跨本体对齐 | GO 文件区 |
§3.4 存储大小
Reactome 全部内容为结构化文本与图数据库导出:GMT 与 CSV 映射文件为 MB 级轻量文本,可直接进入版本控制;BioPAX/SBML/SBGN 压缩包与 MySQL dump 处于 MB 到数十 MB 量级;Neo4j 图数据库 dump 为 GB 级压缩包,需本地 Neo4j 实例导入。官方未公布单一"全库总大小"指标,工程上建议按所选格式估算并在项目文档中记录实际下载体积(下载数据页)。
§3.5 标注方式
标注为纯人工审编模式:外部专家作者按 Reactome 数据模型撰写反应与通路,独立领域专家逐条评审,每条反应绑定实验证据文献;自动化仅用于直系同源投影与文献撤稿监测,不替代人工判断。疾病变体注释从公共资源导入并锚定到反应步骤。这种模式使 Reactome 标注密度与证据强度显著高于自动映射类资源,代价是新通路上线速度受审编产能约束(EMBL-EBI 课程)。
§3.6 标注者资质与一致性
作者与评审人均为分子生物学领域专家;官方新闻页按版本公开致谢外部作者(如信号转导、代谢方向课题负责人)与外部评审人名单,形成公开可查的责任链。一致性控制通过"作者-评审人双人机制 + 统一数据模型 + 编辑团队复核"实现,官方未发布类间一致性系数(如 Cohen’s kappa),工程上应将"评审通过"视为二值质量闸门而非连续评分(V94 新闻)。
§3.7 采集与发布周期
季度发布节奏:自 V89(2024-06)起每个版本在 Zenodo 存档,V94(2025-09-11)、V95(2025-12-09)、V97(2026-06-30)连续按季推进。版本号随发布递增,每次发布更新反应/通路统计、新增通路主题与插图,并可能包含破坏性格式变更(详见坑点 7)。
§3.8 地域与物种覆盖
内容以人类为核心;非人物种覆盖为 14 个(V94),含小鼠、大鼠等常用模式生物,均为人类通路投影而非独立审编。文献证据来源国际化,无地理限制(V94 新闻)。
§3.9 工具与接口规格
| 工具/接口 | 规格 | 说明 |
|---|---|---|
| Analysis Service | REST,POST 标识符列表或 # 表头表达矩阵 | 返回 token + 通路排名(超几何 + BH FDR);token 自最后使用起保存 7 天,版本更新即删除(FAQ) |
| Content Service | REST,JSON/文本 | 通路、反应、参与分子、版本号查询(如 /data/database/version) |
| Pathway Browser | 网页(beta 版含 SBGN 风格图与 3D 结构集成) | 可视化与分析叠加 |
| ReactomeFIViz | Cytoscape 应用 | 功能互作(FI)网络与模块分析 |
| ReactomeGSA | R 包/在线 | 多组学比较通路分析 |
| reactome2py | Python 包 3.0.0(2021-01) | 社区反映已不活跃维护,复杂场景建议直连 REST(开发者技能文档) |
§3.10 深度溯源链
每条反应的溯源链为:反应注释 → 证据文献(PMID)→ 专家作者 → 独立评审人 → 版本号 → Zenodo 存档 DOI(自 V89)。层级与实体变更通过稳定 ID(R-HSA-XXXXXXX)追踪,稳定 ID 跨版本保持指向同一生物学事件;内部 DB_ID 不作跨版本引用使用。疾病变体另行锚定 OMIM/EWAS 映射文件(下载数据页)。
| 溯源层级 | 载体 | 获取方式 |
|---|---|---|
| 反应级证据 | PMID 文献引用 | Pathway Browser 反应页 / Content Service |
| 作者与评审 | 版本新闻页致谢名单 | reactome.org/about/news |
| 版本标识 | 版本号 + 发布日期 | 官网首页摘要框 / /data/database/version |
| 长期存档 | Zenodo 季度存档 | zenodo.org(自 V89,2024-06) |
| 疾病关联 | ReactomeToOMIM.txt / EWAS 映射 | 下载页映射区 |
§4 数据结构
§4.0 目录树
从官方 下载数据页 按需取用,解压/落盘后典型布局如下:
reactome_v97/
├── gene_sets/
│ └── ReactomePathways.gmt # 每行一条通路:稳定ID \t 名称 \t 基因符号...
├── mapping/
│ ├── ReactomePathways.txt # 全部通路:稳定ID \t 名称 \t 是否具有图
│ ├── ReactomePathwaysRelation.txt # 层级父子关系(父ID \t 子ID;多父节点形成 DAG)
│ ├── UniProt2Pathways.txt # UniProt → 最低层通路
│ ├── UniProt2All_Pathways.txt # UniProt → 全层级通路
│ ├── UniProt2All_Reactions.txt # UniProt → 全部反应
│ ├── ChEBI2Pathways.txt # 小分子映射
│ ├── Ensembl2Pathways.txt # Ensembl 映射
│ ├── NCBI2Pathways.txt # NCBI Gene 映射
│ ├── ReactomeToOMIM.txt # 疾病映射
│ └── reaction2pathway/ # 反应-通路归属
├── systems_biology/
│ ├── biopax_level3.zip # 全物种 BioPAX L3
│ ├── homo_sapiens.sbml.tgz # 人类 SBML L3V1
│ └── SBGN/ # SBGN 人类通路图
├── interactions/
│ ├── mitab.all.zip # PSI-MITAB 全互作
│ └── fis/ # 功能互作(ReactomeFIViz 用)
├── graphdb/
│ └── reactome.graphdb.tgz # Neo4j 图数据库 dump
└── figures/
└── diagrams_svg/ # 人类通路图 SVG
§4.1 DAIMS 字段字典
以工程使用频率最高的三个文件为核心字段字典:
| 字段/文件 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| ReactomePathways.gmt: stable_id | 文本 | 通路稳定 ID,全局唯一且跨版本稳定 | R-HSA-109581 | 标签空间主键 | 无(官方保证稳定) | 无缺失 | R-HSA-\d+ |
| ReactomePathways.gmt: name | 文本 | 通路名称 | Apoptosis | 标签语义 | 版本间可能改名 | 无缺失 | 自由文本 |
| ReactomePathways.gmt: gene_symbols | 列表 | 参与分子映射到基因符号 | TP53;CASP3 | 特征/标签对齐 | 一基因可属多通路(设计使然) | 无缺失行 | HGNC 符号 |
| ReactomePathwaysRelation.txt: parent | 文本 | 父通路稳定 ID | R-HSA-168256 | 层级聚合 | 多父节点(DAG 非树) | 顶层通路无行 | R-HSA-\d+ |
| ReactomePathwaysRelation.txt: child | 文本 | 子通路稳定 ID | R-HSA-109581 | 层级聚合 | 同上 | — | R-HSA-\d+ |
| UniProt2Pathways.txt: UniProt ID | 文本 | 蛋白接入号(含 isoform 后缀) | P04637 | ID 映射 | 随 UniProt 版本联动 | 无 | UniProt 接入号 |
| UniProt2Pathways.txt: pathway | 文本 | 最低层通路稳定 ID | R-HSA-69895 | 标签生成 | 一对多 | 无 | R-HSA-\d+ |
| BioPAX L3: @id | URI | 实体稳定标识 | 同官方导出 | 语义图谱 | 序列化差异 | 无 | owl:NamedIndividual |
| SBML L3V1: species/reaction | 结构 | 反应物/产物/修饰符 | 见官方导出 | 动态建模 | 导出为静态模型 | 无 | SBML L3V1 规范 |
| Analysis Service: pValue/FDR | 浮点 | 超几何 p 值与 BH 校正 | 0.00034 | 显著性过滤 | 随版本重算 | 无 | [0,1] |
§4.2 标签分布
GMT 标签空间的"标签"即通路。三个分布特征对建模最重要:其一,通路规模高度偏态——顶层通路(如 Immune System)包含数千基因,最低层通路可能只有数个基因;其二,一基因多通路是设计使然(同一蛋白参与多条机制),GMT 中基因必然跨行重复;其三,父通路基因集是子通路基因集的并集,直接对全层级做 ORA 会产生嵌套冗余(详见坑点 8)。建议建模前绘制通路规模直方图并按规模过滤(常见区间 5-2,000 基因)。
§4.3 关键统计
- 人类反应 16,423 条、通路 2,883 条、蛋白质 11,694 个、小分子 2,188 个、药物 1,102 个、文献 43,308 篇(V97,截至 2026-06,官网)。
- V94 全量口径:31,991 个蛋白质及修饰形式由 11,410 个人类基因编码,15,751 个复合物;正交投影 80,701 个直系同源蛋白(V94 新闻)。
- 疾病维度:5,507 个蛋白变体(392 个蛋白)、1,888 条疾病特异反应、763 条疾病通路(V94)。
- 插图资源:2,500 个图标、200+ 高层交互式插图(V94)。
官方公布稳定 ID 的顶层通路分支(工程中常作为层级根节点):
| 顶层分支 | 稳定 ID | 内容概要 |
|---|---|---|
| Cell Cycle | R-HSA-1640170 | 细胞周期顶层过程(细分至 Mitotic 等子通路) |
| Cell Cycle, Mitotic | R-HSA-69278 | 有丝分裂细节通路,图查询常用入口 |
| Immune System | R-HSA-168256 | 先天与适应性免疫全分支 |
| Signal Transduction | R-HSA-162582 | 信号转导顶层 |
| Gene Expression | R-HSA-74160 | 转录、翻译与调控 |
| Programmed Cell Death | R-HSA-5357801 | 程序性细胞死亡(凋亡、坏死性凋亡等) |
分支 ID 与概要取自官方开发者技能参考与 Pathway Browser 结构;完整顶层清单以官方 ReactomePathways.txt 为准。
§4.4 数据层级
Reactome 的层级不是"患者→检查→序列"的临床层级,而是知识层级:顶层过程(如 Immune System,R-HSA-168256)→ 子通路(如 innate immune system 分支)→ 最低层通路(图上可绘制的单元)→ 反应(R-HSA-XXXXXXX)→ 参与实体(蛋白质/复合物/小分子)。关键差异:该层级是有向无环图而非树——部分通路有多个父节点(如同时归属 Immune System 与 Disease),官方以 ReactomePathwaysRelation.txt 的父子边表而非树表发布(下载数据页)。
§4.5 缺失值与信息性缺失
结构化文件无空值字段:GMT 每行至少含稳定 ID 与名称;映射文件无匹配行即表示"无该关联",属信息性缺失而非数据缺失。真正需要处理的是"预测中的无映射":把用户标识符提交 Analysis Service 时,返回结果中包含 not found 与 unmapped 两类未命中列表——前者表示输入标识符完全无法识别,后者表示可识别但在当前分析口径(如 Project to human)下无通路匹配。这两列是富集质量的第一诊断入口,忽略它们会把低映射率误读为生物学阴性结果(Analysis Tools 文档)。
未命中类型诊断表:
| 返回类别 | 含义 | 常见原因 | 处置 |
|---|---|---|---|
| found | 成功映射并参与统计 | — | 直接使用 |
| unmapped | 可识别但无通路匹配 | 通路覆盖缺口、投影口径过滤 | 核对物种/口径后判断是否生物学真实 |
| not found | 标识符完全无法识别 | 命名空间错误、旧探针 ID、拼写错误 | 先修 ID 再解读结果 |
§5 划分与使用建议
§5.1 官方与社区惯例划分
Reactome 是知识库,官方不提供训练/验证/测试划分。社区针对不同下游任务形成两类惯例:富集方法学评测中,常用"已知通路内基因 leave-out"构造合成任务,或用 RNA-seq 参考数据(如 GTEx)对比各通路库的召回一致性;通路感知深度学习中,常用"通路-基因关联矩阵"作为固定结构先验,划分发生在患者/样本层面而非知识库层面。
社区惯例划分对照:
| 任务类型 | 惯例划分方式 | 划分单元 | 风险控制 |
|---|---|---|---|
| 富集方法学评测 | leave-out 合成任务 | 基因 | 防止 leave-out 基因经父通路回流 |
| 通路库横向对比 | 固定输入列表换参照库 | 基因列表 | 统一背景集合与 FDR 阈值 |
| 通路感知深度学习 | 患者层面划分 | 患者/样本 | 知识库整体作结构先验,不参与划分 |
| 基因→通路多标签分类 | 按基因划分 | 基因 | 排除测试基因一阶父通路邻居(§5.2) |
§5.2 划分策略建议
若以 Reactome 标签训练基因→通路多标签分类器:按最低层通路(图上有绘图的单元)定义正类,避免父通路造成标签泄漏;划分采用"按基因划分而非按通路划分",保证测试集基因完全未见;用 ReactomePathwaysRelation.txt 排除测试基因的一阶父通路邻居作为负采样黑名单。若做通路富集基准对比(Reactome vs GO vs KEGG):固定同一差异基因列表、同一背景集合与同一 FDR 阈值,仅替换参照库。
按基因划分的最小实现:
from sklearn.model_selection import train_test_split
def split_by_gene(index, test_size=0.2, seed=42):
"""index: gene -> set(pathway_ids)(§6.1 生成)
划分单元是基因,保证测试基因在训练中完全未见"""
genes = sorted(index.keys())
train_g, test_g = train_test_split(genes, test_size=test_size, random_state=seed)
# 负采样黑名单:测试基因所属通路的所有父通路一阶邻居
# parent_of 由 ReactomePathwaysRelation.txt 反转得到(child -> set(parents))
return set(train_g), set(test_g)
§5.3 泄漏风险(重点)
- 层级嵌套泄漏:父通路包含子通路全部基因,若训练与评测分别取子/父通路标签,模型等于背诵并集。缓解:只在单一层级(最低层)上取标签。
- 版本穿越泄漏:训练用 V95 GMT、评测混入 V97 新增通路基因,等于把未来知识注入。缓解:全管线锁定单一版本并用 Zenodo 存档。
- 投影泄漏:非人物种数据经 Project to human 后混入人类特异注释(如疾病变体),使跨物种评测虚高。缓解:显式关闭投影或分组评测。
- 背景集合泄漏:富集背景若包含测试集全量基因,会人为压低 p 值。缓解:背景取自实验可检测全集而非全基因组。
§5.4 交叉验证与外部验证
知识库场景下建议以"外部数据集验证"为主:富集结论应在第二套独立队列复现(方向一致且 FDR 显著),而非依赖内部交叉验证。ReactomeGSA 论文以多组学数据集交叉验证了跨平台一致性(Griss et al., 2020),可作为外部验证流程模板。
| 外部验证路径 | 验证什么 | 通过标准 |
|---|---|---|
| 独立队列复算 | 显著通路方向与排名 | 头部通路重叠且方向一致 |
| 第二参照库交叉 | Reactome vs GO/KEGG 结论 | 机制级结论可互译,不要求逐条一致 |
| 第二工具复算 | 统计实现稳健性 | 显著集 Jaccard 达预设阈值 |
| 版本双轨复算 | 版本漂移敏感性 | 结论不随季度版本翻转 |
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
Reactome 提供两种零安装路径:网页 Analysis Tools(浏览器上传基因列表即得结果)与 Analysis Service REST API(脚本调用)。无需 GPU、无需对象存储;若需本地图数据库,官方提供 Neo4j dump 与 AWS ECR 容器镜像(V93 起迁移至 AWS ECR,DockerHub 不再更新)。
§6.1 快速上手
以下代码预期目录结构:data/reactome_v97/(§4.0 目录树);data_root 拼接关系为 data_root + "gene_sets/ReactomePathways.gmt";最小可用子集为单个 GMT 文件(MB 级文本)。任务示例:解析 GMT、构建基因-通路关联、用官方 Analysis Service 复核富集。
# -*- coding: utf-8 -*-
# 依赖:pip install requests
# 目录预期:data/reactome_v97/gene_sets/ReactomePathways.gmt(§4.0 树)
# data_root 与文件拼接:f"{data_root}/gene_sets/ReactomePathways.gmt"
# 最小可用子集:单个 GMT 文件即可完成全部示例
import os
import requests
from collections import defaultdict
DATA_ROOT = os.environ.get("REACTOME_DATA_ROOT", "data/reactome_v97")
GMT_PATH = os.path.join(DATA_ROOT, "gene_sets", "ReactomePathways.gmt")
def parse_gmt(path):
"""解析官方 GMT:每行 = 稳定ID \t 名称 \t 基因符号...;返回 dict[pathway_id] = (name, set(genes))"""
pathways = {}
with open(path, encoding="utf-8") as fh:
for line in fh:
parts = line.rstrip("\n").split("\t")
if len(parts) < 2:
continue
pid, name, genes = parts[0], parts[1], set(g for g in parts[2:] if g)
pathways[pid] = (name, genes)
return pathways
def gene_to_pathways(pathways):
"""反向索引:基因 -> 通路集合;用于多标签样本构造与覆盖度统计"""
index = defaultdict(set)
for pid, (_, genes) in pathways.items():
for g in genes:
index[g].add(pid)
return index
pathways = parse_gmt(GMT_PATH)
index = gene_to_pathways(pathways)
print(f"通路数: {len(pathways)}, 覆盖基因数: {len(index)}")
# 官方 Analysis Service 复核(示例基因列表)
identifiers = ["TP53", "BRCA1", "EGFR", "MYC", "PTEN"]
resp = requests.post(
"https://reactome.org/AnalysisService/identifiers/",
headers={"Content-Type": "text/plain"},
data="\n".join(identifiers),
timeout=60,
)
result = resp.json()
token = result["summary"]["token"] # 注意:token 自最后使用起仅保存 7 天
for pw in result["pathways"][:5]:
print(pw["stId"], pw["name"], round(pw["entities"]["fdr"], 6))
§6.2 数据获取
| 下载物 | 方式 | 地址(官方) | 大小量级 |
|---|---|---|---|
| GMT 基因集 | 直接下载 | reactome.org/download/current/ReactomePathways.gmt | MB 级 |
| 全部映射 CSV | 打包下载 | reactome.org/download-data/ | MB 级 |
| BioPAX L3 | 打包下载 | reactome.org/download-data/ | MB-数十 MB |
| Neo4j dump | 打包下载 | reactome.org/download-data/ | GB 级 |
| Zenodo 存档 | 按版本下载 | Zenodo 仓库(每季度,自 V89) | 按版本 |
| Docker/容器 | AWS ECR | 开发者区(V93 起) | 镜像级 |
# 获取流程(无需注册、无申请审核)
mkdir -p data/reactome_v97/gene_sets data/reactome_v97/mapping
curl -L -o data/reactome_v97/gene_sets/ReactomePathways.gmt \
https://reactome.org/download/current/ReactomePathways.gmt
curl -L -o data/reactome_v97/mapping/ReactomePathwaysRelation.txt \
https://reactome.org/download/current/ReactomePathwaysRelation.txt
# 许可:注释文件 CC0 1.0;软件与 dump CC BY 4.0 —— 商用合规成本极低
常用 REST 端点速查(Content Service 与 Analysis Service 均为公开接口):
| 端点 | 方法 | 返回 | 用途 |
|---|---|---|---|
/ContentService/data/database/version |
GET | 版本号文本 | 管线启动时核对版本 |
/ContentService/data/query/{stId} |
GET | JSON 实体 | 查询通路/反应/实体详情 |
/ContentService/data/event/{stId}/participatingPhysicalEntities |
GET | JSON 分子列表 | 提取通路参与分子 |
/AnalysisService/identifiers/ |
POST | JSON(含 token) | 标识符列表富集 |
/AnalysisService/identifiers/projection/ |
POST | JSON(含 token) | 显式投影到人类 |
/AnalysisService/token/{token} |
GET | JSON 结果 | 7 天内取回结果(坑点 1) |
§6.3 预处理全流程
流程四步:格式转换(GMT→内存字典/矩阵)→ 清洗(去重、规模过滤)→ 标准化(ID 命名空间统一)→ 结构化(DAG 层级与邻接矩阵)。
import numpy as np
def build_membership_matrix(pathways, min_size=5, max_size=2000):
"""基因×通路二值关联矩阵:过滤过小/过大通路,稳定列序"""
kept = {pid: (name, genes) for pid, (name, genes) in pathways.items()
if min_size <= len(genes) <= max_size}
vocab = sorted(set().union(*(g for _, g in kept.values())))
gene_idx = {g: i for i, g in enumerate(vocab)}
M = np.zeros((len(vocab), len(kept)), dtype=np.float32)
pid_idx = {}
for j, (pid, (_, genes)) in enumerate(kept.items()):
pid_idx[pid] = j
for g in genes:
M[gene_idx[g], j] = 1.0
return vocab, list(kept.keys()), pid_idx, M
def parse_hierarchy(rel_path):
"""解析层级父子边表 -> DAG 邻接表;多父节点天然支持"""
dag = defaultdict(list)
with open(rel_path, encoding="utf-8") as fh:
for line in fh:
parent, child = line.rstrip("\n").split("\t")[:2]
dag[parent].append(child)
return dag
标准化要点:蛋白用 UniProt 接入号、小分子用 ChEBI ID、基因用 HGNC 符号或 Ensembl ID 是官方推荐的主标识;UniProt isoform 可写 P12345-2,省略后缀会同时匹配 canonical 与全部 isoform,会静默扩大基因集(Analysis Tools 文档)。
§6.4 PyTorch DataLoader
场景:通路感知多标签学习——把"基因-通路关联矩阵"包装为 Dataset,输出(基因多热向量,通路多热标签)样本对,可用于通路瓶颈层预训练或链接预测基线。代码块较长,折叠呈现:
<details>
<summary>展开完整 PyTorch Dataset + DataLoader 代码(约 40 行)</summary>
# 依赖:pip install torch numpy
# 目录预期:data/reactome_v97/gene_sets/ReactomePathways.gmt
# 任务:基因->通路 多标签预测;M 为基因×通路二值矩阵(§6.3 生成)
import torch
from torch.utils.data import Dataset, DataLoader
class PathwayMembershipDataset(Dataset):
"""每条样本 = (基因多热输入, 通路多热标签)。
基因特征建议拼接外部表达谱/序列嵌入;此处用单位矩阵演示结构先验。"""
def __init__(self, M, transform=None):
self.M = torch.from_numpy(M) # (n_genes, n_pathways) float32
self.transform = transform
def __len__(self):
return self.M.shape[0]
def __getitem__(self, idx):
x = torch.zeros_like(self.M[idx]) # 输入维度 = 基因表
x[idx] = 1.0 # one-hot 基因 ID(替换为嵌入向量即可)
y = self.M[idx] # 标签维度 = 通路表
if self.transform:
x, y = self.transform(x, y)
return x, y
class RandomGeneMask:
"""增强:随机遮蔽少量通路关联,模拟不完整注释(安全增强,见 §6.6)"""
def __init__(self, p=0.05):
self.p = p
def __call__(self, x, y):
mask = (torch.rand_like(y) > self.p).float()
return x, y * mask
vocab, pids, pid_idx, M = build_membership_matrix(parse_gmt(GMT_PATH))
dataset = PathwayMembershipDataset(M, transform=RandomGeneMask(p=0.05))
loader = DataLoader(dataset, batch_size=128, shuffle=True, num_workers=4)
x_batch, y_batch = next(iter(loader))
print(x_batch.shape, y_batch.shape) # (128, n_genes), (128, n_pathways)
</details>
§6.5 坑点 8 个
⚠️ 坑点 1:Analysis token 只有 7 天寿命,新版本发布即销毁(分类:工程陷阱)
问题:Analysis Service 返回的 token 是结果唯一句柄,官方 FAQ 明确:token 自最后一次使用起保存 7 天,且 Reactome 发布新版本时无条件删除全部历史结果,不存在永久链接。把带 token 的结果 URL 写进论文或仪表盘,任何人在稍后打开都会 404。
症状:复现者报告"论文里的 Reactome 链接打不开";CI 定时任务隔周调用旧 token 返回 404;审稿人要求提供富集结果原始文件而你只有截图。
解决:
- 简单方法:每次分析后立即下载结果文件(Analysis Service 支持 JSON/CSV/PDF 导出),本地落盘并把 token 字符串一并写入元数据,仅作 7 天内检索用途。
- 进阶方法:用固定版本 GMT(§6.2)+ 本地统计库(clusterProfiler/decoupler)复算富集,把官方在线结果仅作为正确性抽查;版本号写入 README 与配置文件。
- SOTA 方法:在项目存档中绑定 Zenodo 季度存档版本 + 自算结果哈希,实现"版本-输入-结果"三元组可追溯,符合 CoreTrustSeal 仓储规范(FAQ:永久链接)。
参考:Reactome FAQ:Is there a permanent link available for my analysis results?
⚠️ 坑点 2:通路层级是多父节点 DAG,按树聚合会重复计数(分类:预处理陷阱)
问题:ReactomePathwaysRelation.txt 是父子边表,部分通路同时归属多个上层分支(例如免疫与疾病双重挂载)。若按单亲树逻辑自顶向下聚合,同一子通路会被统计多次;若对全层级做 ORA,父通路基因集是子通路并集,显著性互相抄袭。
症状:富集结果顶层通路与子通路成串出现且基因列表几乎相同;自建层级聚合后通路计数与官方"Complete List of Pathways"对不上;图遍历出现环警告。
解决:
- 简单方法:只用最低层通路(图上可绘制的单元)做 ORA,ReactomePathways.txt 第三列标记了是否具有图,过滤后即为非冗余层。
- 进阶方法:构建 DAG 后做拓扑排序,聚合统计时对每个节点维护 visited 集合去重;或用父子边表反向剪除"被更高层完全包含"的路径。
- SOTA 方法:使用官方新版分析界面的 pathway grouping 过滤,仅显示最细粒度反应级通路,从源头避免层级冗余(Research Spotlight)。
参考:Reactome 下载数据页:Pathways hierarchy relationship 文件
⚠️ 坑点 3:标识符命名空间混杂与 isoform 后缀,映射率骤降(分类:预处理陷阱)
问题:官方推荐主标识为 UniProt(蛋白)、ChEBI(小分子)、HGNC/Ensembl(核酸);混用过时探针 ID 或旧版基因符号会静默落入 unmapped。UniProt isoform 语法为 P12345-2,省略 -n 后缀时 canonical 与全部 isoform 都会被匹配,基因集规模被悄悄放大。
症状:Analysis 结果中 not found 占比异常高;同一批数据两次提交结果不一致(一次带 isoform 一次不带);下游通路规模直方图右移。
解决:
- 简单方法:提交前统一转 UniProt/HGNC,剔除空白行与重复项;每次都检查返回的 found/unmapped/not found 三列。
- 进阶方法:用官方 UniProt2Pathways 等映射文件在本地完成映射并记录映射率阈值(如 <80% 触发告警);isoform 显式声明而非省略。
- SOTA 方法:把映射率与命名空间分布写入数据卡片(data card),在 CI 中对每批新数据断言映射率与历史分布一致(Analysis Tools 文档)。
参考:Reactome Analysis Tools 用户指南:Identifier mapping
⚠️ 坑点 4:Project to human 默认勾选,非人物种数据被静默投影(分类:偏倚陷阱)
问题:分析提交表单默认勾选 Project to human,所有非人标识符先转为人类同源物再匹配人类通路。做小鼠/大鼠实验的团队若不知情,得到的"通路富集"实际是人类通路投影,跨物种差异(物种特异通路、非保守蛋白)被完全抹平。
症状:提交鼠基因符号仍返回人类通路名与人类蛋白覆盖;想看非人通路却找不到对应条目;综述中误写"Reactome 小鼠通路显示……"。
解决:
- 简单方法:非人数据取消 Project to human 勾选,让结果匹配计算投影的非人物种通路。
- 进阶方法:混合人-病原体数据(感染研究)显式关闭投影以保留微生物通路命中;结果按 species 字段分组报告。
- SOTA 方法:在协议中把"是否投影"列为预注册分析决策项,同一数据双口径(投影/不投影)做敏感性分析并报告差异(Analysis Tools 文档)。
参考:Reactome Analysis Tools 用户指南:Project to human
⚠️ 坑点 5:Include Interactors 会用 IntAct 互作扩容通路(分类:评估误用)
问题:勾选 Include Interactors 后,Reactome 通路被 IntAct 蛋白互作扩展,通路成员大幅增加。这些互作未经 Reactome 人工审编,可能无明确生物学意义;富集背景被扩大后,p 值与通路排名系统性改变,且与默认口径不可比。
症状:同一基因列表勾选与否两次结果通路数量级不同;部分命中蛋白在通路图上找不到位置;论文方法学描述无法复现(未声明该开关)。
解决:
- 简单方法:保持默认关闭,除非明确需要扩大召回;在方法节显式声明开关状态。
- 进阶方法:需要时双口径跑一遍,把互作扩展仅用于候选扩展(recall-oriented),把审编通路结果作为主结论。
- SOTA 方法:把 Include Interactors 状态与版本一起写入结果元数据,复现脚本显式传参,杜绝隐式默认(Analysis Tools 文档)。
参考:Reactome Analysis Tools 用户指南:Include Interactors
⚠️ 坑点 6:第三方 Reactome 基因集(MSigDB C2:CP:REACTOME)版本滞后(分类:工程陷阱)
问题:大量教程与工具默认使用 MSigDB 转制的 Reactome 基因集,其版本独立于官方季度发布且明显滞后;同一项目里 Analysis Service(最新版)与 MSigDB GMT(旧版)并存,富集数字无法互相对齐。
症状:网页工具显著、本地 GSEA 不显著的"幽灵通路";不同论文同名通路基因数不同;升级 MSigDB 后历史结果漂移。
解决:
- 简单方法:统一改用官方 ReactomePathways.gmt,并在项目中记录下载日期与版本号。
- 进阶方法:建立基因集注册表(来源、版本、哈希),任何富集结果引用注册表键而非文件路径。
- SOTA 方法:对必须使用 MSigDB 的场景,双基因集并行分析并在附录报告版本差异影响;长期项目用 Zenodo 存档锁定官方版本(单细胞最佳实践)。
参考:sc-best-practices:Gene set enrichment and pathway analysis(版本滞后与冗余讨论)
⚠️ 坑点 7:季度发布的破坏性变更会打断长跑管线(分类:工程陷阱)
问题:Reactome 版本迭代伴随接口与格式变更:V93 起 Docker 镜像从 DockerHub 迁移到 AWS ECR;V94 起停供 BioPAX level 2 与 Protégé 2.0 ontology 文件。依赖旧镜像地址或旧格式的自动管线在季度更新后直接报错。
症状:CI 拉取镜像 404;解析 BioPAX L2 的脚本在新版下载包中找不到文件;wget 定时任务下载到 404 页面。
解决:
- 简单方法:镜像地址与文件清单写入配置并钉住版本;升级前阅读每版新闻页的破坏性变更段落。
- 进阶方法:把 BioPAX L2 消费方迁移到 BioPAX L3;ontology 需求改用 GO association 文件与 GO-CAM 产物。
- SOTA 方法:用 Zenodo 存档作为长期基准版本,生产环境按"存档版本 + 滚动最新版"双轨部署,变更先在影子环境验证(V93/V94 新闻)。
参考:Reactome 新闻页:V93 Docker 迁移与 V94 格式移除
⚠️ 坑点 8:近邻通路高度重叠,富集排名被冗余基因集干扰(分类:标签理解)
问题:Reactome 的机制粒度意味着近邻通路天然共享大量基因(如干扰素 α/β 信号与干扰素信号),父通路又是子通路的并集。ORA/GSEA 输出中语义重复的通路成批上榜,排名对基因集重叠结构敏感,读者容易把冗余信号误读为多条独立机制。
症状:前 20 名中多条通路基因列表重合率超过一半;换一个参照库后"独立复现"的通路大幅换血;报告越写越长但信息量不增。
解决:
- 简单方法:按基因列表 Jaccard 相似度对上榜通路聚类,每簇只报告代表通路与成员清单。
- 进阶方法:限制在最低层通路 + 规模过滤(5-2,000 基因),用 reaction coverage 与实体 coverage 双指标替代单一 p 值排序。
- SOTA 方法:采用冗余压缩的富集框架或多库交叉验证——Reactome 官方 pathway grouping 过滤 + GO/KEGG 方向一致性核验,2026 年 PLOS 计算生物学方法学教育论文将"多重检验未校正、忽视背景、基因集冗余"列为最常见错误并给出对策(Research Spotlight 转述)。
参考:sc-best-practices:基因集冗余章节
§6.6 数据增强(安全/危险)
| 类别 | 操作 | 说明 |
|---|---|---|
| 安全 ✅ | 随机遮蔽通路关联(§6.4 RandomGeneMask) | 模拟不完整注释,提升鲁棒性 |
| 安全 ✅ | 按反应粒度拆分父通路为子任务 | 保持语义边界 |
| 安全 ✅ | 图结构丢弃边(DropEdge) | 用于 GNN,保留标签语义 |
| 危险 ❌ | 把非人物种投影数据当作人类通路标签训练 | 偏倚陷阱(坑点 4) |
| 危险 ❌ | 跨版本混用 GMT 训练与评测 | 版本穿越泄漏(§5.3) |
| 危险 ❌ | 用 Include Interactors 扩容后的通路当真值 | 引入未审编噪声(坑点 5) |
§6.7 模型推荐表
| 任务 | 推荐模型/工具 | 输入 | 说明 |
|---|---|---|---|
| 基因列表富集 | 官方 Analysis Service / clusterProfiler enrichPathway / ReactomePA | 标识符列表 | 超几何 + BH FDR |
| 排序基因集富集 | GSEA(fgea/GSEA-desktop)/ decoupler run_gsea | 排序列表 + GMT | 敏感于协同小位移 |
| 多组学比较 | ReactomeGSA | 转录/蛋白表达矩阵 | 跨平台同一通路口径 |
| 网络模块发现 | ReactomeFIViz(Cytoscape) | FI 网络 | 功能互作 + 模块分析 |
| 图神经网络 | R-GCN/HGT + Neo4j dump | 图数据库 | 链接预测、子图分类 |
| 通路感知 MLP/Transformer | 通路瓶颈层(GMT 矩阵作第一层结构) | 基因表达向量 | 可解释性强 |
| 单细胞通路评分 | decoupler/ssGSEA + 官方 GMT | 单细胞表达矩阵 | 细胞类型通路活性 |
§6.8 硬件需求表
| 场景 | CPU | 内存 | 存储 | GPU |
|---|---|---|---|---|
| GMT 解析 + ORA | 2 核 | 4 GB | <1 GB | 不需要 |
| 全库 Neo4j 导入与查询 | 4-8 核 | 16 GB+ | GB 级 | 不需要 |
| GNN 训练(全图) | 8 核 | 32 GB | GB 级 | 建议 8 GB+ 显存 |
| 通路瓶颈层预训练 | 8 核 | 16 GB | <10 GB | 建议 |
§6.9 评估指标代码
import numpy as np
def pathway_enrichment_metrics(y_true, y_pred, k=10):
"""多标签通路预测评估:Micro-F1、P@K、标签秩相关
y_true/y_pred: (n_samples, n_pathways) 二值/分数矩阵"""
y_bin = (y_pred >= 0.5).astype(int)
tp = (y_bin & y_true).sum()
fp = (y_bin & (1 - y_true)).sum()
fn = ((1 - y_bin) & y_true).sum()
micro_f1 = 2 * tp / max(2 * tp + fp + fn, 1)
ranks = (-y_pred).argsort(axis=1)[:, :k]
pk = np.mean([y_true[i, ranks[i]].sum() / k for i in range(len(y_true))])
return {"micro_f1": float(micro_f1), "precision_at_k": float(pk)}
def pathway_ndcg(y_true, y_pred, k=10):
"""归一化折损累计增益:通路排序质量的等级敏感指标"""
dcg = y_true[np.arange(len(y_true))[:, None], (-y_pred).argsort(1)[:, :k]].sum(1)
ideal = -np.sort(-y_true, axis=1)[:, :k].sum(1)
return float(np.mean(dcg / np.maximum(ideal, 1e-9)))
def enrichment_report_consistency(fdr_a, fdr_b, alpha=0.05):
"""两次富集(如官方 vs 本地复算)结论一致性:Jaccard 显著集"""
sa, sb = set(np.flatnonzero(fdr_a < alpha)), set(np.flatnonzero(fdr_b < alpha))
return len(sa & sb) / max(len(sa | sb), 1)
§6.10 MLOps 笔记
- 版本固定:把 Reactome 版本号当作超参数写入配置(如
reactome_version: 97),GMT/映射文件下载后记录 SHA-256;Zenodo 存档用于长期审计。 - 数据漂移:季度发布后运行"基因集差异报告"(新增/删除通路、基因集规模分布漂移),作为模型再训练触发器之一。
- 缓存策略:Analysis token 不可依赖(7 天 + 版本销毁),改用"本地 GMT + 本地统计库"做可重复富集,在线服务仅作抽查。
- 合规记录:CC0 注释文件可自由商用;若分发软件或数据 dump、插图,遵守 CC BY 4.0 署名并引用官方论文(License、Citing us)。
季度发布差异报告的最小实现(纳入 CI 定时任务):
def gmt_diff_report(old_pathways, new_pathways):
"""old/new_pathways: parse_gmt 输出(pathway_id -> (name, genes))
输出季度发布影响面,作为再训练触发器输入"""
added = set(new_pathways) - set(old_pathways)
removed = set(old_pathways) - set(new_pathways)
shared = set(old_pathways) & set(new_pathways)
mutated = {pid for pid in shared
if old_pathways[pid][1] != new_pathways[pid][1]}
return {
"added": len(added),
"removed": len(removed),
"membership_changed": len(mutated),
"retrain_trigger": len(added) + len(removed) + len(mutated) > 0,
}
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 文献选择偏倚 | 审编优先覆盖实验证据充分的热门领域(肿瘤信号、免疫、代谢),冷门基因覆盖不足 | 中 | 结合 GO/KEGG 交叉核对;关注 idg.reactome.org 暗蛋白门户 |
| 基因集规模偏倚 | 父通路基因集为子通路并集,大通路更易显著 | 高 | 最低层通路过滤 + 规模窗口 + coverage 指标 |
| 物种投影偏倚 | 非人物种注释继承人类审编,物种特异机制缺失 | 高 | 显式声明投影口径,跨物种结论谨慎 |
| 疾病注释偏倚 | 疾病通路集中于有明确分子机制的遗传病与肿瘤 | 中 | 与 OMIM/EWAS 映射文件交叉验证 |
| 平台偏倚 | 官方推荐标识符体系(UniProt/HGNC/ChEBI)之外的平台 ID 映射率较低 | 低 | 预处理统一命名空间(坑点 3) |
§7.2 标注质量
人工审编 + 独立评审 + 文献证据链构成三层质量闸门;自动化工作流持续监测证据文献撤稿并修正注释(Research Spotlight)。
| 质量机制 | 运作方式 | 对使用者的含义 |
|---|---|---|
| 专家作者撰写 | 领域专家按统一数据模型撰写反应 | 语义一致,机器解析友好 |
| 独立同行评审 | 每版公开致谢外部评审名单 | 责任链可查 |
| 文献证据绑定 | 每条反应附实验证据文献 | 可逐条溯源核查 |
| 撤稿自动监测 | 工作流扫描证据文献状态并修正 | 证据时效性有保障 |
| 季度公开统计 | 每版公布反应/通路/文献计数 | 覆盖增长可审计 |
局限性:官方未发布量化一致性指标(如 kappa),标注质量以"评审通过 + 可溯源文献"为承诺形式;工程上应把"某反应在两个版本间被修改"视为正常质量行为而非数据缺陷,并在下游缓存设计中容忍注释变更。
§7.3 泛化性表
| 场景 | 失效风险 | 证据/机制 |
|---|---|---|
| 冷门基因/新靶点富集 | 阴性可能源于覆盖缺口而非生物学 | 审编产能约束,文献驱动更新 |
| 非模式物种通路分析 | 投影通路可能不适用于物种特异机制 | 直系同源投影设计使然(V94:14 物种) |
| 单细胞分辨率分析 | 细胞类型特异通路覆盖仍在扩展中 | NAR 2024 论文明确提出细胞/组织特异注释为发展方向(PMID 37941124) |
| 时间动态/动力学建模 | SBML 导出为静态模型,缺动力学参数 | 官方导出不含参数估计 |
| 低资源语言/区域临床叙事 | 内容为英文,本地化依赖社区 | 知识库定位 |
§7.4 伦理
Reactome 不含人类受试者数据、无个体隐私风险。伦理相关内容集中在疾病变体注释:变体信息锚定 OMIM 等公共资源并保持文献级溯源,使用时应避免将通路层面的"疾病关联"直接转译为个体诊断结论。临床 AI 场景引用 Reactome 时,仍需遵守医疗 AI 伦理审查与监管审批流程。
§7.5 公平性
知识库层面的公平性问题主要表现为知识覆盖不均:受研究投入分布影响,常见于欧洲裔人群研究的疾病机制(如部分肿瘤驱动通路)注释密度更高,而罕见病与特定人群特异变异的机制覆盖有限。AI 团队应把"通路覆盖密度"作为公平性审计维度之一,避免模型对覆盖充分疾病系统性更优。
§7.6 数据漂移
季度发布是特性而非缺陷,但对长周期模型是持续的协变量漂移源:通路集合、基因成员、命名与格式都可能在任意季度变更(如 V94 移除 BioPAX L2)。建议建立版本化数据快照 + 差异报告机制,模型评估报告必须注明所用 Reactome 版本;跨论文比较富集结果时先核对版本是否同代。
漂移处理清单:
| 漂移源 | 触发频率 | 检测手段 | 处置 |
|---|---|---|---|
| 通路集合增删 | 每季度 | §6.10 gmt_diff_report | 差异入库,评估标签空间变化 |
| 基因成员变更 | 每季度 | 成员哈希对比 | 触发特征矩阵重算 |
| 格式弃用 | 不定期(如 V94) | 新闻页破坏性变更段落 | 影子环境先行验证 |
| 统计口径调整 | 不定期 | 版本统计对照(§1.4b) | 引用时注明口径 |
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | GMT/CSV 均为规整表结构,可直接入 pandas/Polars |
| 2 | 唯一标识 | ✅ | 稳定 ID(R-HSA-XXXXXXX)全局唯一且跨版本稳定 |
| 3 | 特殊字符 | ✅ | 通路名含逗号/斜杠等,GMT 制表符分隔解析需注意,无致命问题 |
| 4 | 重复行 | ✅ | 官方文件无重复行;基因跨通路重复为设计使然 |
| 5 | 缺失编码 | ✅ | 结构文件无空值;"无关联"以行缺失表达 |
| 6 | 标签标识 | ✅ | 通路稳定 ID 即标签空间主键 |
| 7 | 罕见类分组 | ⚠️ | 小通路(<5 基因)需自行过滤,官方无强制下限 |
| 8 | 偏倚评估 | ✅ | 官方文档明确审编范围与投影机制(§7.1) |
| 9 | 数据字典 | ✅ | 用户指南 + Developer Zone 完整描述对象模型 |
| 10 | 信息性缺失解释 | ✅ | Analysis 返回 found/unmapped/not found 三列区分未命中原因 |
| 11 | 设备记录 | ❌ | 知识库无实验设备元数据(不适用) |
| 12 | 共线性 | ⚠️ | 近邻通路高度重叠,等价于特征共线性,需去冗余(坑点 8) |
| 13 | 编码映射 | ✅ | 官方提供 UniProt/Ensembl/ChEBI/NCBI/miRBase/GtoP 全套映射文件 |
| 14 | 时间戳处理 | ✅ | 版本日期与发布统计明确;反应级时间戳未开放 |
| 15 | 划分建议 | ⚠️ | 无官方划分(知识库),下游任务需自定义(§5.2) |
| 16 | 泄漏讨论 | ✅ | 层级嵌套/版本穿越/投影三类泄漏机制可明确界定(§5.3) |
| 17 | 标签分布 | ✅ | 通路规模分布可通过 GMT 直接统计(§4.2) |
| 18 | 测量偏倚 | ⚠️ | 文献驱动审编引入引用偏倚,官方未提供量化校正 |
| 19 | 外部验证建议 | ✅ | ReactomeGSA 与多库交叉验证路径明确(§7.8) |
| 20 | 版本记录 | ✅ | 每版本新闻页统计 + Zenodo 存档(自 V89) |
| 21 | 预处理脚本 | ✅ | 官方提供 R/Python 示例与 REST 文档;本页 §6.3/§6.4 补全 |
| 22 | 合规要求 | ✅ | CC0/CC BY 4.0 分层许可,商用友好 |
| 23 | 多模态对齐 | ✅ | 表达/突变/药物统一锚定到同一通路对象模型 |
| 24 | 去标识化 | ✅ | 无人类受试者数据,天然无隐私风险 |
DAIMS 评分:19.5 / 24
评分解读:扣分集中在三类"知识库本性"项——无官方划分(#15)、罕见类需自行过滤(#7)、通路共线性需去冗余(#12),另有文献测量偏倚无法量化(#18)与设备元数据不适用(#11)。这些短板均可通过工程手段(层级过滤、版本固定、外部验证)完全或大部分缓解,不存在结构性不可用项。
对你意味着什么:可以直接把 Reactome 作为特征工程与富集基准的主参照库(19.5/24 属于高就绪度);但必须立刻落实三件事——把版本号写进配置并锁定 GMT(治 #15/#20 相关风险)、只用最低层通路并过滤规模(治 #7/#12)、每次分析检查映射率与 interactors 开关状态(治 #18 的可追溯性)。不需要为 #11(设备记录)做任何工程投入。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 多组学癌症数据集 | MedUni Wien / EMBL-EBI(ReactomeGSA 论文) | 跨平台比较通路分析 | 跨组学通路方向一致性 | — | 同一通路口径下转录组与蛋白质组结论可对齐(Griss et al., 2020) |
| 乳腺癌风险队列(单细胞 RNA-seq) | Nature 2025 研究团队 | GSEA 通路注释 | 细胞类型特异通路响应 | — | Reactome 注释区分出腔部激素感知细胞与基底肌上皮细胞的差异通路响应(Reactome Research Spotlight) |
| MarkerPredict 精准肿瘤学框架 | NPJ Systems Biology and Applications 2025 | ReactomeFI 网络特征 | 候选生物标志物 2,084 个 | — | ReactomeFI 三节点基序富集度高于对照网络(Reactome Research Spotlight) |
| 富集方法学教育评审 | PLOS Comput Biol 2026(Bora et al.) | 方法健壮性评估 | 定性推荐 | — | Reactome 被列为两大综合通路库之一,内置 BH 校正与 pathway grouping 直击常见错误(Reactome Research Spotlight) |
表中为定性/机制性验证结果;Reactome 作为知识库不存在单一"内部测试精度",故不设统一的相对变化数值。
§8 基准性能与生态
§8.1 方法与工具基准
Reactome 的"基准"不是模型排行榜,而是分析工具与方法的生态位。下表列出主流工具,完整引用与关键技术:
| 排名(生态位) | 工具/方法 | 定位 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Reactome 官方 Analysis Service | 官方富集与表达覆盖 | 持续更新 | 超几何 ORA + BH FDR + 拓扑分析 | Ragueneau E, et al. The Reactome Knowledgebase 2026. Nucleic Acids Res. 2025 Nov 18. doi:10.1093/nar/gkaf1223 | Developer Zone |
| 2 | ReactomeGSA | 多组学比较通路分析 | 2020 | 量化通路评分 + 跨平台标准化 | Griss J, et al. ReactomeGSA - Efficient Multi-Omics Comparative Pathway Analysis. Mol Cell Proteomics. 2020. doi:10.1074/mcp. PMID: 32907876 | Bioconductor |
| 3 | ReactomePA | R/Bioconductor 通路富集 | 2016 | GSEA/ORA 双模式,基于 AGG 底层 | Yu G, He QY. ReactomePA: an R/Bioconductor package for reactome pathway analysis and visualization. Mol BioSyst. 2016;12(2):477-479. doi:10.1039/C5MB00663E | GitHub |
| 4 | clusterProfiler | 通用富集框架(含 Reactome) | 2021 | 统一富集接口 + 可视化 | Wu T, et al. clusterProfiler 4.0: A universal enrichment tool for interpreting omics data. The Innovation. 2021;2(3):100141. doi:10.1016/j.xinn.2021.100141 | GitHub |
| 5 | 富集方法学教育基准 | 十大常见错误清单 | 2026 | 方法学审计框架 | Bora A, McKenzie ATM, Ziemann M. Ten common mistakes that could ruin your enrichment analysis. PLOS Computational Biology. 2026 | 期刊 |
各工具统计口径与实现不同(超几何实现细节、背景处理、FDR 方式),富集结果数值不可直接横比;选型应看任务匹配度而非"排名"。
§8.2 SOTA 总结与选型建议
结论稳定:官方 Analysis Service 是零配置正确性基线(BH 校正默认开启);需要跨组学与批量任务时选 ReactomeGSA;需要在 R 内深度定制与可视化时选 ReactomePA/clusterProfiler;需要机制网络与模块分析时选 ReactomeFIViz。2026 年方法学教育论文的推荐与该判断一致:用 Reactome 的细粒度通路 + 内置校正 + pathway grouping 可直接规避富集分析最常见的几类方法学错误。
按需求选型矩阵:
| 需求 | 首选 | 次选 | 关键理由 |
|---|---|---|---|
| 零配置正确性 | 官方 Analysis Service | — | BH 校正默认开启、统计口径官方维护 |
| 批量脚本化富集 | clusterProfiler/ReactomePA | 本地 GMT + decoupler | 免 token 依赖,可复现 |
| 多组学对齐 | ReactomeGSA | 自建 ssGSEA 管线 | 官方跨平台标准化 |
| 机制网络与模块 | ReactomeFIViz | Neo4j + GNN | FI 网络现成 |
| 知识图谱构建 | Neo4j dump | BioPAX L3 解析 | 原生图免重建 |
| 方法学教学/审计 | Ten mistakes 清单 | — | 2026 年最新错误清单 |
§8.3 评测协议
推荐协议五步:固定输入(基因列表/排序列表 + 背景集合)→ 固定参照(Reactome 版本 + 最低层通路过滤)→ 固定统计(超几何 ORA 与 GSEA 各跑一遍,FDR 0.05)→ 固定报告(显著通路 + coverage + 映射率)→ 外部复算(第二工具或第二库方向一致性)。
| 步骤 | 固定项 | 输出物 |
|---|---|---|
| 1 输入 | 基因/排序列表 + 背景集合定义 | 输入快照与哈希 |
| 2 参照 | Reactome 版本号 + 层级过滤规则 | GMT 文件哈希 |
| 3 统计 | ORA 与 GSEA 双轨,FDR 0.05 | 显著通路表 |
| 4 报告 | 显著集 + coverage + 映射率 | 结构化结果 JSON |
| 5 复算 | 第二工具/第二库方向一致性 | 一致性 Jaccard(§6.9) |
§8.4 相关数据集表
| 数据集 | 类型 | 关系 | 获取 |
|---|---|---|---|
| KEGG | 手绘通路图库 | 互补视角(地图式) | kegg.jp |
| Gene Ontology | 功能本体 | 词汇层互补,官方提供 GO association 文件 | geneontology.org |
| WikiPathways | 社区通路图 | 社区长尾覆盖 | wikipathways.org |
| Pathway Commons | 通路元库 | 聚合 Reactome/KEGG 等为统一 GMT | pathwaycommons.org |
| MSigDB | 基因集集合 | 含 Reactome 转制集(版本滞后,坑点 6) | gsea-msigdb.org |
| STRING | 蛋白互作网络 | 互作层互补(物理互作 vs 机制反应) | string-db.org |
§8.5 关键论文 Top 8
- Milacic M, et al. The Reactome Pathway Knowledgebase 2024. Nucleic Acids Research. 2024;52(D1):D672-D678. doi:10.1093/nar/gkad1025 — 数据库主体描述:全蛋白组注释进展、疾病变体与药物通路锚定。
- Ragueneau E, et al. The Reactome Knowledgebase 2026. Nucleic Acids Research. 2025 Nov 18. doi:10.1093/nar/gkaf1223 — 最新数据库更新论文,配套 V95+。
- Jassal B, et al. The reactome pathway knowledgebase. Nucleic Acids Research. 2020;48(D1):D498-D503. doi:10.1093/nar/gkz1031 — 数据模型与工具体系成熟版描述。
- Joshi-Tope G, et al. Reactome: a knowledgebase of biological pathways. Nucleic Acids Research. 2005;33(Database):D428-D432. doi:10.1093/nar/gki072 — 奠基论文,确立反应模型。
- Fabregat A, et al. Reactome graph database: Efficient access to complex pathway data. PLoS Computational Biology. 2018;14(1):e1005968. doi:10.1371/journal.pcbi.1005968 — 图数据库架构。
- Fabregat A, et al. Reactome diagram viewer: data structures and strategies to boost performance. Bioinformatics. 2018;34(7):1208-1214. doi:10.1093/bioinformatics/btx752 — 可视化性能工程。
- Griss J, et al. ReactomeGSA - Efficient Multi-Omics Comparative Pathway Analysis. Molecular & Cellular Proteomics. 2020. doi:10.1074/mcp. PMID: 32907876 — 多组学比较分析工具。
- Sidiropoulos K, et al. Reactome enhanced pathway visualization. Bioinformatics. 2017. doi:10.1093/bioinformatics/btx323 — 高层插图与增强可视化。
§8.6 社区活跃度
- 发布节奏:季度稳定发布(V93→V94→V95→V97 连续按季推进),每版公开统计与外部作者/评审致谢名单。
- 服务体系:User Guide、Developer Zone、help@reactome.org、Twitter/X(@reactome)、面向公众的 React-to-Me AI 问答机器人;EMBL-EBI 提供系统在线课程。
- 认证背书:ELIXIR Core Data Resource、Global Core Biodata Resource、CoreTrustSeal 可信仓储。
- 证据动态:官方 Research Spotlight 持续跟踪下游研究引用;自动化撤稿监测工作流运行中(新闻页)。
社区活跃度信号表(截至 2026-09 检索):
| 信号 | 观察 | 佐证来源 |
|---|---|---|
| 发布连续性 | 2024-06 至 2026-06 季度发布无断档 | Zenodo 存档与新闻页 |
| 人才网络 | 每版公开致谢数十位外部作者/评审 | V93/V94 新闻 |
| 学术影响 | 2025-2026 年持续产出 NAR 数据库刊更新论文 | 官方引用清单 |
| 服务可信度 | CoreTrustSeal + ELIXIR/GCBR 三重认证 | 新闻页声明 |
| 界面现代化 | 2025-12 Pathway Browser beta 征集社区反馈 | 官方反馈表单 |
§8.7 生态快照表
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| Reactome Pathway Browser | 网页可视化 | reactome.org | 检索、浏览、分析一站式 |
| Download Data | 官方下载 | reactome.org/download-data/ | 全格式清单与许可说明 |
| User Guide: Analysis Tools | 官方文档 | reactome.org/userguide/analysis | 统计口径与开关语义权威来源 |
| Developer Zone | 开发者文档 | reactome.org/DeveloperZone | REST/Graph 数据库接入 |
| ReactomeFIViz | Cytoscape 应用 | apps.cytoscape.org | FI 网络与模块分析 |
| ReactomeGSA | R 包 | Bioconductor | 多组学比较 |
| ReactomePA | R 包 | Bioconductor | 通路富集 + 可视化 |
| EMBL-EBI Reactome 课程 | 培训 | EBI Training | 系统学习审编与工具 |
§9 相关资源与引用
§9.1 官方资源列表
| 类别 | 资源 | 链接 |
|---|---|---|
| 入口 | 官方主页与 Pathway Browser | https://reactome.org/ |
| 数据 | 下载数据(全格式清单) | https://reactome.org/download-data/ |
| 文档 | Analysis Tools 用户指南 | https://www.reactome.org/userguide/analysis |
| 文档 | Developer Zone(REST/图数据库) | https://reactome.org/DeveloperZone |
| 合规 | 引用指引(官方论文清单) | https://www.reactome.org/cite |
| 合规 | 许可协议 | https://reactome.org/license |
| 版本 | 版本新闻(统计与破坏性变更) | https://reactome.org/about/news |
| 培训 | EMBL-EBI Reactome 课程 | https://www.ebi.ac.uk/training/online/courses/reactome-exploring-biological-pathways/ |
| 存档 | Zenodo 季度存档(自 V89) | https://zenodo.org/ |
| 社区 | 帮助台 help@reactome.org;X/Twitter @reactome;React-to-Me 机器人 | 见官网页脚 |
§9.2 社区支持与求助路径
| 场景 | 推荐路径 | 预期响应 |
|---|---|---|
| 工具使用疑问 | User Guide + EBI 课程 | 即时自助 |
| 数据/API 异常 | help@reactome.org | 官方帮助台 |
| 版本变更确认 | 新闻页 + FAQ | 即时自助 |
| 培训需求 | EBI 在线课程与材料 | 即时自助 |
§9.2 BibTeX 引用块
@article{milacic2024reactome,
title = {The Reactome Pathway Knowledgebase 2024},
author = {Milacic, Marija and Beavers, Deidre and Conley, Patrick and
Gong, Chuqiao and Gillespie, Marc and Griss, Johannes and
Haw, Robin and Jassal, Bijay and Matthews, Lisa and May, Bruce and
Petryszak, Robert and Ragueneau, Eliot and Rothfels, Karen and
Sevilla, Cristoffer and Shamovsky, Veronica and Stephan, Ralf and
Tiwari, Krishna and Varusai, Thawfeek and Weiser, Joel and
Wright, Adam and Wu, Guanming and Stein, Lincoln and
Hermjakob, Henning and D'Eustachio, Peter},
journal = {Nucleic Acids Research},
volume = {52},
number = {D1},
pages = {D672--D678},
year = {2024},
doi = {10.1093/nar/gkad1025}
}
@article{joshi-tope2005reactome,
title = {Reactome: a knowledgebase of biological pathways},
author = {Joshi-Tope, Geeta and Gillespie, Marc and Vastrik, Imre and
D'Eustachio, Peter and Schmidt, Esther and de Bono, Bernard and
Jassal, Bijay and Gopinath, G. R. and Wu, G. R. and
Matthews, Lisa and Lewis, Steven and Birney, Ewan and Stein, Lincoln D.},
journal = {Nucleic Acids Research},
volume = {33},
number = {Database issue},
pages = {D428--D432},
year = {2005},
doi = {10.1093/nar/gki072}
}
@article{ragueneau2026reactome,
title = {The Reactome Knowledgebase 2026},
author = {Ragueneau, Eliot and Gong, Chuqiao and Sinquin, Philippe and
Sevilla, Cristoffer and Beavers, Deidre and others},
journal = {Nucleic Acids Research},
year = {2025},
doi = {10.1093/nar/gkaf1223}
}
@article{griss2020reactomegsa,
title = {ReactomeGSA - Efficient Multi-Omics Comparative Pathway Analysis},
author = {Griss, Johannes and Viteri, Gustavo and Sidiropoulos, Konstantinos and
Nguyen, Vy and Fabregat, Antonio and Hermjakob, Henning},
journal = {Molecular \& Cellular Proteomics},
year = {2020},
doi = {10.1074/mcp},
note = {PMID: 32907876}
}
§9.3 引用指南
使用 Reactome 内容时:数据层面引用对应版本的数据库论文(当前推荐 NAR 2024/2026 两篇);工具层面引用所用的具体工具论文(ReactomeGSA/ReactomePA 等);方法层面若依赖官方 Analysis Service,注明访问日期与版本号。软件与数据 dump、插图的再分发遵循 CC BY 4.0 署名条款,注释文件 CC0 无署名强制但仍建议学术引用(Citing us)。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 版本/说明 |
|---|---|---|
| 大语言模型(千方病案编辑部生产管线) | 初稿撰写、结构整理、代码草拟 | 依据本站 AI-Ready 生产规范执行 |
| React-to-Me Chatbot | Reactome 官方内容问答机器人(仅用于本页事实核对参考,不生成本页内容) | reactome.org |
§10.2 AI 参与范围
AI 参与范围:文献检索摘要、章节初稿、代码示例起草、表格数据整理。人工参与范围:事实核验(版本数字逐条溯源至官方页面)、医学与数据工程交叉审核、坑点真实性把关、最终定稿。全部规模数字(16,423 条反应、2,883 条通路等)均直接取自官方 V97 首页统计并标注日期。
§10.3 输入来源列表
- Milacic M, et al. The Reactome Pathway Knowledgebase 2024. Nucleic Acids Research. 2024;52(D1):D672-D678. doi:10.1093/nar/gkad1025
- Ragueneau E, et al. The Reactome Knowledgebase 2026. Nucleic Acids Research. 2025 Nov 18. doi:10.1093/nar/gkaf1223
- Jassal B, et al. The reactome pathway knowledgebase. Nucleic Acids Research. 2020;48(D1):D498-D503. doi:10.1093/nar/gkz1031
- Joshi-Tope G, et al. Reactome: a knowledgebase of biological pathways. Nucleic Acids Research. 2005;33(Database):D428-D432. doi:10.1093/nar/gki072
- Fabregat A, et al. Reactome graph database: Efficient access to complex pathway data. PLoS Comput Biol. 2018;14(1):e1005968. doi:10.1371/journal.pcbi.1005968
- Fabregat A, et al. Reactome diagram viewer. Bioinformatics. 2018;34(7):1208-1214. doi:10.1093/bioinformatics/btx752
- Griss J, et al. ReactomeGSA. Mol Cell Proteomics. 2020. doi:10.1074/mcp. PMID: 32907876
- Sidiropoulos K, et al. Reactome enhanced pathway visualization. Bioinformatics. 2017. doi:10.1093/bioinformatics/btx323
- Reactome 官网首页版本统计(V95/V97):https://reactome.org/
- Reactome 新闻页(V93/V94 详情与许可声明):https://reactome.org/about/news
- Reactome 下载数据页(格式清单与停供公告):https://reactome.org/download-data/
- Reactome Analysis Tools 用户指南(统计口径与开关语义):https://www.reactome.org/userguide/analysis
- Reactome FAQ:Analysis 结果永久链接:https://reactome.org/documentation/faq/40-analysis/general/211-permanent-analysis-results
- Bora A, McKenzie ATM, Ziemann M. Ten common mistakes that could ruin your enrichment analysis. PLOS Comput Biol. 2026(经 官方 Research Spotlight 转述核对)
- EMBL-EBI 在线课程 What is Reactome:https://www.ebi.ac.uk/training/online/courses/reactome-exploring-biological-pathways/what-is-reactome/
- sc-best-practices:Gene set enrichment and pathway analysis:https://sc-best-practices.org/conditions/gsea_pathway.html
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与版本时间轴 | 千方病案医学编辑部 | 官方首页/新闻页逐条比对 | ✅ 已通过 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED 标准编码复核 | ✅ 已通过 |
| §3 数据集规格 | 千方病案医学编辑部 | 官方下载页与用户指南核对 | ✅ 已通过 |
| §4 数据结构与 DAIMS 字段字典 | 医疗 AI 数据工程师 | 样例文件结构与官方文档比对 | ✅ 已验证 |
| §5 划分与泄漏分析 | 医疗 AI 数据工程师 | 机制推演 + 社区实践核对 | ✅ 已验证 |
| §6 AI 就绪指南与 8 坑点 | 医疗 AI 数据工程师 | 官方 FAQ/新闻/文档溯源 | ✅ 已验证 |
| §7 质量评估与 DAIMS 评分 | 医疗 AI 数据工程师 + 编辑部 | 双人复核 | ✅ 已通过 |
| §8-§9 生态与引用 | 千方病案医学编辑部 | DOI 逐条核对 | ✅ 已通过 |
| §10 声明卡 | 千方病案医学编辑部 | 合规流程审查 | ✅ 已通过 |
§10.5 AI 生成章节标注
初稿由 AI 起草的章节:§1、§3、§4、§6、§8;人工主导章节:§0(固定免责文本)、§2(编码映射)、§7(偏倚与 DAIMS 评分)、§10。全部章节经 §10.4 所列人工校验后发布。
§10.6 最后人工审核日期
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- pharos — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
- omim — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
- gene-ontology — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
- chebi — 共享标签:医疗NLP / 化学信息学 / 知识图谱
- iuphar-bps — 共享标签:医疗NLP / 化学信息学 / 知识图谱
- dgidb — 共享标签:医疗NLP / 化学信息学 / 知识图谱
- hgnc — 共享标签:基因组学与多组学 / 医疗NLP
- mondo — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
- pharmgkb — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
- hpo — 共享标签:基因组学与多组学 / 医疗NLP / 知识图谱
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
