KEGG 京都基因与基因组百科全书 AI-Ready Wikipedia

13 个数据库 × 6,782 条通路 × 约 1.1 万物种基因组的三十年生物系统知识库

来源 Kanehisa Laboratories(京都大学生物信息中心);https://www.kegg.jp/发布时间: 2026-09-15最后更新: 2026-09-25 阅读 40
KEGG 京都基因与基因组百科全书 AI-Ready Wikipedia

信息速览

数据集名称KEGG 京都基因与基因组百科全书 AI-Ready Wikipedia
数据类型KEGG,通路数据库,pathway,KEGG Orthology,代谢重建,通路富集,KGML,基因组注释
规模0(通路与基因组知识库,不含患者级数据)
接入方式Kanehisa Laboratories(京都大学生物信息中心);https://www.kegg.jp/
AI 就绪度

数据集封面

INFOBOX

字段 内容
数据集名称 KEGG 通路数据库(京都基因与基因组百科全书)
英文全称 Kyoto Encyclopedia of Genes and Genomes
别名/简称 KEGG;KEGG Pathway Database;KEGG MEDICUS(健康信息子集)
疾病分类(ICD-11) 部分覆盖(KEGG DISEASE 条目链接 ICD 分类与 OMIM,人类疾病通路如 05200 系列;非全疾病谱注册库)
SNOMED CT 未整合(疾病实体采用 KEGG 自有 H 编号并链接 ICD/OMIM 外部编码)
数据模态 通路/基因组多库联动知识库(PATHWAY/BRITE/MODULE/KO/GENES/GENOME/COMPOUND/GLYCAN/REACTION/ENZYME/NETWORK/DISEASE/DRUG 共 13 库 23 种数据对象)
AI 任务类型 通路富集分析、基因组功能注释与代谢重建、KO 直系同源分配、药物靶点-通路关联挖掘、多组学功能解释、生物网络嵌入与链接预测
样本总数 6,782 条通路图(2025-04);60,874,528 条蛋白中 32,073,173 条已赋 KO(2025-12-22);约 1.09 万物种基因组(1,184 真核 + 9,279 细菌 + 449 古菌)
数据大小 全库 flat file 数十 GB 量级(官方未公布单一总量;2011 年存档即已含 GENES 6,667,326 条)
数据格式 KGML(XML 0.7.2)、flat file、TSV、JSON(BRITE)、PNG、RDF(Turtle/N-Triples)
许可证 网站浏览与 REST API 对学术用户免费;批量 FTP 下载 2011-07-01 起需订阅;商业使用需 Pathway Solutions 许可
访问级别 分层开放(网页/逐条 API 免费;批量镜像付费订阅)
DUO 标签 不适用(非人类受试者数据;许可遵循 KEGG 官方 subscription 条款)
语言 英文(DISEASE/DRUG/COMPOUND 等库另设日文版 disease_ja 等)
首发日期 1995 年(1995-12 首版随版权声明发布)
最后更新 每日更新(官方 Release notes 最近一期 2026-07-01)
发布机构 Kanehisa Laboratories(京都大学生物信息中心,Kanehisa 实验室)
官方主页 https://www.kegg.jp/
下载地址 https://www.kegg.jp/kegg/download/(订阅制 FTP);逐条获取 https://rest.kegg.jp/
DOI 10.1093/nar/gkac963(2023 年 NAR 数据库卷更新论文)
引用次数 奠基论文 Kanehisa & Goto 2000 NAR 为通路数据库领域引用最高的文献之一;官方 2011 年即报告每年约 1,000 次引用
AI 就绪度评分 ⭐⭐⭐☆(3.5/5)— 跨库标识符体系稳定、REST API 六类操作齐备、KO 分配统计透明;扣分项:map 参考图无 KGML、KGML 与图像不一致、无官方机器可读数据字典与预处理脚本、批量下载受订阅许可约束
页面状态 published

§0 医学与技术审核声明

本词条为数据库型资源条目,不涉及患者级数据与临床决策建议;文中全部规模数字均经独立检索核实,来源记录于同目录 FACTS.md。KEGG 属生物学知识资源,不含个体健康信息;其 DISEASE/DRUG/NETWORK 库面向机制阐释而非诊断,本词条在描述疾病相关内容时仅作知识库功能说明,不提供临床指导。技术审核基线如下:通路与 KO 规模采用第三方综述(2025-04)与官方 KO 分配统计页(2025-12-22)双源交叉;许可条款以官方 Plea 公告(2011-05-16)、KEGG 30 周年报告时间线与 GenomeWeb 报道三源交叉;KGML 格式问题以 Biopython 教程、CyKEGGParser(F1000Research)与 KEGGtranslator(BMC Systems Biology)三方记录印证。审核范围与结论:

审核对象 审核方 核对方法 结论
frontmatter 与 INFOBOX 数字 千方病案医学编辑部 与 FACTS.md 逐条比对 ✅ 已通过/已验证
§1-§2 概览与历史 千方病案医学编辑部 官方 Overview 与 30 周年报告交叉核对 ✅ 已通过/已验证
§3-§4 数据组织与质量 千方病案医学编辑部 13 数据库清单与 KGML 规范核对 ✅ 已通过/已验证
§5 许可条款 千方病案医学编辑部 官方 Plea 与订阅页三源比对 ✅ 已通过/已验证
§6 AI 就绪指南 千方病案医学编辑部 REST API 文档与 KGML 规范逐字段核对 ✅ 已通过/已验证
§7 八大坑点 千方病案医学编辑部 与第三方解析记录(Biopython/CyKEGGParser/KEGGtranslator)比对 ✅ 已通过/已验证
§8-§9 对比与生态 千方病案医学编辑部 同类通路库横向核对 ✅ 已通过/已验证
check_md.py 自动校验 千方病案工程管线 脚本全绿确认 ✅ 已通过/已验证
  • 利益声明:本词条为独立综述,与 Kyoto University、Kanehisa Laboratories 及 Pathway Solutions Inc 无关联;许可与价格信息以 KEGG 官方最新公告为准,引用时请核对官网更新。
  • 适用读者:生物信息学研究者、医学 AI 工程师、数据工程师、生物数据管家(data steward)。
  • 免责边界:KEGG 内容持续演进,本词条冻结时点为 2026-09;当官网条款与本文冲突时以官网为准。
  • 配套文件:同目录 FACTS.md 记录全部事实来源;本文附录 A/D/K 分别承担口径映射、检索记录与文献清单职能,三者构成完整的可审计链路。

§1 概述:三十年的生物系统计算模型

KEGG(Kyoto Encyclopedia of Genes and Genomes,京都基因与基因组百科全书)是日本京都大学 Kanehisa Laboratories 自 1995 年起持续构建与维护的综合生物系统知识库,其目标是把基因组测序等高通量技术产生的分子层数据,解释为细胞、生物体、生态系统乃至生物圈等高层次系统功能。它并不是单一数据库,而是一组相互链接的专题库集合:截至 2026-09,官方将其重组为 23 种数据对象、13 个数据库,覆盖系统信息(PATHWAY/BRITE/MODULE)、基因组信息(KO/GENES/GENOME)、化学信息(COMPOUND/GLYCAN/REACTION/ENZYME)与健康信息(NETWORK/DISEASE/DRUG,与药品说明书整合后称 KEGG MEDICUS)四大类。官方用四种页面颜色编码这四类信息,长期使用者凭颜色即可识别资源类别。

1.1 它解决什么问题

基因组测序给出的是一串基因清单,而研究者真正关心的是"这套基因能干什么"。KEGG 的核心贡献是"mapping(映射)"这一思想:先从已发表文献中把分子相互作用、反应与关系手工策展成参考通路图,再通过功能直系同源(KO,KEGG Orthology)体系,把任意物种的基因自动映射到参考通路上,完成代谢重建与功能推断。1995 年这一映射最初借助 EC 酶编号实现;2003 年起 KO 编号(K + 5 位数字)取代 EC 编号成为通路与基因组之间的枢纽标识,EC 编号不再作为 KEGG 的自有标识符使用。

换个角度理解 KEGG 的知识组织逻辑:它对三类对象做了"类-实例"抽象——KO 对应基因(功能直系同源组 vs 各物种的具体基因)、反应类(RC)对应反应(通用转换 vs 具体反应条目)、药物组(DG)对应药物(同活性成分 vs 具体药品)。这种泛化让参考知识可以被任何细胞型生物复用,也让 KEGG 与 Go/Reactome 这类"单物种精细"路线形成互补。

从技术本质看,mapping 是一次受限的信息检索:参考通路图是"索引"(手工构建、语义丰富),基因组注释是"查询"(自动生成、噪声可控),KO 是两边的"对齐键"。这个框架的聪明之处在于把昂贵的专家知识全部前置到参考层——物种扩展是零人工成本的自动渲染——代价则是参考层一旦有偏,所有下游物种共享同一偏倚(§7 坑点 8 的结构性根源)。理解这一点,就理解了 KEGG 全部质量特征与许可结构的由来。

1.2 规模与体量

KEGG 的规模数字随时间快速增长,且不同口径(参考图 vs 含物种特异视图;参考集 vs 分配覆盖)差异巨大,引用时必须注明时间与口径。下表汇总经核实的关键节点:

时点 口径 数字 来源
2011-06 存档 PATHWAY 参考图 / 含物种特异 398 / 140,607 Kanehisa 实验室存档 PDF
2011-06 存档 KO / GENES / COMPOUND 14,715 / 6,667,326 / 17,641 同上
2011-06 存档 REACTION / ENZYME / GLYCAN 8,494 / 5,419 / 10,978 同上
2011-06 存档 DISEASE / DRUG / GENOME 375 / 9,402 / 1,522+117 同上
2025-04 通路总数 6,782 PMC12645814 通路库综述
2025-04 物种基因组 1,184 真核 + 9,279 细菌 + 449 古菌 同上
2025-12-22 蛋白 KO 分配 60,874,528 条中 32,073,173 条(52.7%) 官方 KO 统计页
2025 物种量级 约 10,000 原核 + 约 1,800 真核 官方 30 周年报告

分域 KO 分配率是理解覆盖不均衡的最硬证据(2025-12-22 官方统计):动物蛋白 66.8%、细菌 50.7%、古菌 45.7%、真菌 38.0%、植物 37.2%、病毒仅 8.8%。这些数字同时定义了 §7 坑点 8 的偏倚边界。

两点读表提示:其一,“蛋白 KO 分配覆盖率"与"通路条目数"是不同维度——前者衡量注释深度、后者衡量知识面宽度,不存在单一"总规模”;其二,2011 年存档的各库条目数与 2025 年的覆盖率不可直接换算,因为分母(蛋白总数)随 NCBI 序列导入同步膨胀,覆盖率下降不等于注释产出减少。引用任何一行数字前,请先确认它回答的是"库有多大"还是"注释有多全"。

1.3 在 AI 数据版图中的位置

对医学 AI 而言,KEGG 是"功能解释层"的基础设施:差异表达基因列表、肠道菌群物种谱、药物扰动信号,最终都要落到通路与功能层面讲故事。它同时是特征工程的原料库——KO 丰度矩阵、通路覆盖度特征、药物-通路关联,都是常见模型输入。在数据链条上,上游是 NCBI/ENA 的序列与 ENSEMBL 的基因模型,下游是 clusterProfiler/pathview 这类分析框架与 Cytoscape 类可视化工具;KEGG 居中提供词汇与拓扑。因此它的标识符体系(K/C/D/H/map 编号)、许可边界(网页免费/批量付费)与格式陷阱(KGML 与图像不一致)直接影响下游管线质量,这正是本词条 §7 八大坑点的主题。

从 AI 模型视角还有一个官方叙事值得注意:2025-2026 年 KEGG 团队把自身定位为"生物系统数据库模型",与从数据分布中学习的 AI 模型形成"组织知识"与"学习模式"的互补关系;KEGG Syntax 与保守基因谱比较工具是这一叙事的具体产物。对大模型时代的研究者,这意味着 KEGG 既可作为检索增强的知识源,也可作为评估生物医学问答正确性的参照系。

在医学数据集版图里,KEGG 与本系列收录的其他基因组学资源(ClinVar 的变异注释、GTEx 的组织表达、PCAWG 的泛癌突变)呈互补关系:那些资源回答"数据是什么",KEGG 回答"数据意味着什么功能"。实际项目里它们经常串联——突变谱(COSMIC/ClinVar)→ 基因列表 → KEGG 通路富集 → 机制假设。把 KEGG 的标识符与许可规则纳入项目早期设计,能避免串联阶段的返工。

1.4 快速结论

  • 适合:通路富集与功能解释、跨物种基因组注释与代谢重建、以 KO 为通用词汇的多组学整合、药物-靶点-疾病机制梳理。
  • 谨慎:把 KEGG 当作可自由镜像与重分发的开放数据(2011 年起批量下载需订阅);直接解析 KGML 期望得到与网页通路图一致的完整拓扑;把 EC 与 KO 当作一一对应。
  • 一句话:KEGG 是生物医学 AI 链条中"从基因到功能"的默认词典,AI 就绪度良好但许可与格式有明确边界,截至 2026-09 仍由京都大学团队以每日频率持续更新,其双轨访问格局(网页免费/批量订阅)与映射枢纽演进(EC→KO)是理解全部使用规则的两把钥匙。

1.5 五个常见误读澄清

围绕 KEGG 的江湖传言不少,以下五条在工程实践里反复出现,逐条澄清:

  • 误读一:“KEGG 是政府公共数据库”。官方原话相反——“KEGG 从来不是公共数据库”,从未获得任何机构长期资助承诺,2011 年订阅制正是这一结构的产物(见 §5)。
  • 误读二:“KEGG = PATHWAY”。PATHWAY 只是最著名的一个库;KO/GENES/GENOME/COMPOUND/DRUG 等其余 12 库各有独立数据模型,只引用 PATHWAY 等于只用了不到一成的信息面。
  • 误读三:“通路图就是数据”。通路图的权威形态是 PNG 渲染图 + KGML 交换层,两者信息量不等(坑点 2);"图上画的"与"KGML 里的"要分开统计。
  • 误读四:“物种通路是人工重绘的”。物种特异图是参考图 + KO 匹配的自动渲染视图(坑点 4),策展人力只花在参考层。
  • 误读五:“KO 就是 EC 的替代品”。KO 是基因功能组,EC 是反应类型分类,两者多对多(坑点 3);"替代"仅指映射枢纽的地位交接,不指语义等价。
  • 误读六:“订阅之后数据就归我随便用”。订阅授予的是批量访问权,不等于再分发权或商业使用权——三者在许可条款里是三件事(坑点 5、§5.5)。

§2 历史沿革:从 EC 编号到 KO 体系的三十年

2.1 1995-2002:映射思想与 EC 时代

1995 年 12 月,Minoru Kanehisa 在京都大学化学研究所发起 KEGG,属日本人类基因组计划的配套工程,首版即带版权声明发布。起初的愿景写在题目里——把基因与基因组"编码"成一部可计算的百科全书。首发的 PATHWAY、GENES、ENZYME、COMPOUND 四库确立了"参考通路 + 物种映射"的骨架:文献策展的参考代谢网络用 EC 编号标记酶节点,测序物种的酶基因按 EC 编号自动上色,生成物种特异通路。这一"代谢重建(metabolic reconstruction)"流程在 1995 年是革命性的——此前通路图只能画在纸上,基因组与功能的连接完全依赖专家逐个解读。

这一阶段的映射词汇是 EC 编号(1995-1999),随后过渡到 Ortholog ID(2000-2002)。它的局限也很明显:EC 编号描述的是反应类型而非基因家族,旁系同源与同工酶难以区分。为解决这一问题,KEGG 在 2002 年 5 月推出 ORTHOLOGY 库,以"序列高度相似且通路位置相当"为标准把跨物种基因归组,2003 年起 KO 编号全面接管映射职能——这是 KEGG 知识体系从"反应中心"走向"基因中心"的关键转折。

2.2 1997-2010:子库持续扩展

官方 30 周年报告与 Overview 页给出清晰的时间线,各库标识符均为"前缀 + 5 位数字":

  • 1997-05:注册 kegg.com 域名(2000 年增加 kegg.net/kegg.org/kegg.jp)。
  • 1998:REACTION 库(R 编号)上线,把反应方程从通路图中解耦。
  • 1999-02:发出第一个商业许可,商业化道路由此开始。
  • 2000-02:GENOME 库(T 编号)与物种代码体系;同年 11 月 Pathway Solutions Inc 成立,专责商业许可。
  • 2002-05:ORTHOLOGY 库(K 编号)问世。
  • 2003-05:GLYCAN 库(G 编号)。
  • 2005:BRITE 功能层级(br 编号)与 DRUG 库(D 编号)双库上线。
  • 2006:MODULE 库(M 编号),把通路拆成更小的功能单元。
  • 2008:DISEASE 库(H 编号)。
  • 2010:RCLASS(RC 编号)与 ENVIRON(E 编号,2021 年停用);同年 10 月 KEGG MEDICUS 发布,把疾病、药物与药品说明书信息整合为面向健康实践的子集。
  • 2011-04(存档口径):RPAIR 退场,反应分类由 RC 接管。

2.3 2011:订阅制转折点

2011 年 5 月 16 日,Kanehisa 在官网发表《Plea to Support KEGG》,宣布自 2011-07-01 起学术 FTP 站点从京都大学 GenomeNet 移交至其参与创立的 NPO Bioinformatics Japan,并仅向付费订阅者开放:学术个人 2,000 美元/年、机构 5,000 美元/年;商业许可则继续由 Pathway Solutions 处理。他同时强调三点:网站浏览与 KEGG API 不受影响继续免费;“与大众认知相反,KEGG 从来不是公共数据库”,从未获得任何机构的长期承诺资助;当时 KEGG 每月有 15 万-20 万独立访客、每年约 1,000 次论文引用,维持 25 名全职与 5-10 名兼职员工难以为继。背景是日本科学技术振兴机构的 BIRD 计划于 2011-04 改组为国立生物科学数据中心(NBDC),资助方向从单体资源转向数据库整合。

作为过渡安排,官方把此前仅经 FTP 提供的 KGML 加上了网页"Download KGML"链接,并承诺持续改进 KEGG API——这解释了今天"逐条免费、批量收费"格局的由来。这一事件在学界引发对公共数据库可持续性的广泛讨论,也奠定了延续至今的双轨访问格局。

2.4 2012-2026:从数据库到"生物系统模型"

2012-03 Kanehisa 从教职退休后以特任教授身份继续领导;2014 年 DGROUP(DG 编号)把同一活性成分的不同药品归组;2017 年 NETWORK/VARIANT(N 编号)上线,把疾病知识从静态通路升级为"网络变异"视角。2024-07 官方推出新的商业许可框架。2025-2026 年,KEGG 完成一次重要重组:数据对象细分为 23 类、收纳进 13 个数据库,并推出 KEGG Syntax——基于保守基因库谱(conserved gene repertoires)对生物体、物种群与病毒进行比较分析的框架;同期官方把 KEGG 定位为"真实世界的生物系统数据库模型",与 AI 大模型形成"组织生命科学知识"与"学习数据分布"的互补叙事。2026-07-01 的 Release notes 确认每日更新节奏仍在延续。

三十年间的 NAR 数据库卷系列论文记录了每个阶段的方法学自述:2000 年奠基(Kanehisa & Goto,NAR 28:27-30)、2016 年"基因与蛋白注释参考资源"、2021 年"整合病毒与细胞生物"、2023 年"基于分类学的通路与基因组分析"(NAR 51:D587-D592,本词条 schema_org 引用主标识)。投稿策略上,KEGG 每篇更新论文都附带当年规模与方法变更,是追溯任意历史版本口径的最佳文献链。

2.5 规模口径演变速查

引用 KEGG 规模数字前,先对准口径。下表汇总各时代"官方统计口径"的变化:

时期 统计口径 典型写法
1995-2010 各库条目数(PATHWAY 按参考图 + 物种特异双口径) “398 张参考图”
2011-06(存档) 全库条目数快照 “KO 14,715 条”
2014-2023(NAR 论文) 各库条目数 + 物种数双列 “xx 个物种、xx 条通路”
2025 起(30 周年报告) 蛋白 KO 分配覆盖率 + 物种量级 “6,087 万蛋白中 52.7% 已赋 KO”
2025-04(第三方) 通路总数(单一口径) “6,782 条通路”

由此得出两条引用纪律:其一,不同时点的数字不可线性外推(2011 年的 KO 总数与 2025 年的蛋白覆盖率是两个概念);其二,同一年份的"通路数"在不同来源可能因计数视图不同而不同,引用时附上来源与统计口径说明。本词条 frontmatter 与 INFOBOX 采用的口径已在 §1.2 表格逐行标注。


§3 数据组织:13 个数据库与 23 种数据对象

3.1 四大类 13 库全景

官方 Overview 按功能把数据对象分为四色编码的四大类。理解这张地图是使用 KEGG 的第一步:

类别 数据库 标识前缀 内容
系统信息 PATHWAY map/ko/ec/rn/物种码 手工绘制的分子相互作用、反应与关系网络图
系统信息 BRITE br/jp/ko 功能层级与表格(本体式分类)
系统信息 MODULE M 定义明确的功能单元(逻辑表达式的基因集合)
基因组信息 KO(ORTHOLOGY) K 功能直系同源组,映射的枢纽词汇
基因组信息 GENES 物种码:基因 各物种基因与蛋白(含病毒 vg/vp、增补 ag)
基因组信息 GENOME T/gn 物种基因组及与通路的链接
化学信息 COMPOUND C 代谢物与小分子
化学信息 GLYCAN G 糖链结构
化学信息 REACTION R 生化反应(底物/产物方程)
化学信息 ENZYME ec 酶命名(数据源为 ExplorEnz)
健康信息 NETWORK N/nt 疾病相关网络变异
健康信息 DISEASE H 人类疾病(另设日文版)
健康信息 DRUG D/DG 药物与药物组(另设日文版)

2011 年存档还记录了已退役的对象类型:RPAIR(RP 编号,2016 年停用)与 ENVIRON(E 编号,2021 年停用);旧文献中的 RP/E 编号在现行 KEGG 中不再解析。

四类信息的分工可以用一条链说清:基因组信息层回答"有什么"(哪些基因、哪些物种),化学信息层回答"发生什么"(哪些分子、哪些反应),系统信息层回答"怎么组织"(通路、层级、模块),健康信息层回答"与疾病药物何干"。四层以共享标识符焊接,任何一层都可作查询入口——这正是"百科全书"之意:词条之间互相引用而非各自孤立。

3.2 标识符体系:前缀 + 5 位数字

KEGG 所有自有对象的标识符统一为"数据库相关前缀 + 5 位数字",如糖酵解参考图 map00010、己糖激酶 KO K00873、丙酮酸 C00022、甲苯磺丁脲 D00584、人类物种代码 hsa(基因组 T01001)。同一逻辑通路在不同视图下共享数字编号而前缀不同:map00010(参考)、ko00010(KO 视图)、rn00010(反应视图)、hsa00010(人类)。这一设计让跨库链接极其稳定——GENES 条目通过 KO 挂到 PATHWAY 与 BRITE,COMPOUND 通过 REACTION 参与通路,DRUG 通过靶向蛋白链接 DISEASE——但也埋下 §7 坑点 6 所述"同一化合物多前缀标识"的混淆源。REST 形式的直达链接如 https://www.kegg.jp/entry/K00873 可逐条核查。

需要特别注意的三个前缀细节:其一,GENES 条目标识是"物种码:基因 ID"复合形式(如 hsa:3643),其中人类基因 ID 即 NCBI GeneID;其二,病毒条目有 vg(病毒基因)/vp(成熟肽)/vtax(病毒分类)三套前缀;其三,EC 编号虽仍是 ENZYME 库与通路图上的通用标记,但官方明确它"不再作为 KEGG 的自有标识符"。

3.3 PATHWAY:手工绘制的参考知识库

PATHWAY 是 KEGG 最著名的部分。参考图由策展团队依据已发表文献手工绘制并持续修订,分为七大类:新陈代谢、遗传信息加工、环境信息加工、细胞过程、生物体系统、人类疾病与药物开发。参考图(map 前缀)是"通用最大集合";ko/rn/ec 视图把节点分别换成 KO、反应与酶;物种特异图(如 hsa04930 2 型糖尿病通路)则是把参考图中该物种已注释的 KO 节点着色高亮。注意:物种特异图是自动生成的视图而非人工重绘,这正是 §7 坑点 4"白色节点"问题的根源。

七大类中,新陈代谢类历史最久、与化学层耦合最深(map 图同时含 enzyme 节点与 reaction),人类疾病与药物开发类则与 DISEASE/DRUG 库双向链接。检索通路时建议先按类别缩小范围再按关键词精确定位——全库关键词检索(find 操作)在小分子与药物上召回噪声较高,通路名的官方英文写法(如 Glycolysis / Gluconeogenesis)比中文译名更可靠。

规模口径需要精确:2025-04 的 6,782 条是第三方综述统计的通路数(含物种特异视图的计数方式未在摘要中说明,引用时建议注明来源口径);2011-06 存档的口径则是"398 条参考图、含物种特异合计 140,607"。两类数字不可直接相比。PATHWAY 的机器可读形态是 KGML,但其可用性有重要例外——map 参考图没有 KGML(见坑点 1)。

3.4 KO:映射的枢纽词汇

KO 把"序列高度相似且在通路上功能相当"的蛋白归为一组,赋予 K 编号,相当于跨物种的功能基因词典。它在体系中的地位可由三个演变阶段说明:1995-1999 年用 EC 编号(域为本)、2000-2002 年用 Ortholog ID、2003 年起用 KO(基因为本)。KO 分配既有官方人工审核的参考集,也有自动化工具链:BlastKOALA(BLAST)、GhostKOALA(GHOSTX)与 KofamKOALA(profile HMM + 自适应分数阈值,2020 年发表于 Bioinformatics)。官方统计页显示截至 2025-12-22 已覆盖 6,087 万条蛋白;由于 GENES 原始序列来自 NCBI RefSeq/GenBank,KO 分配率也直接反映了注释覆盖的域差异(动物 66.8% vs 病毒 8.8%)。

KO 条目的 flat file 结构稳定可解析,关键字段包括:NAME(符号与全名)、DEFINITION、PATHWAY(多值通路列表)、MODULE、BRITE(层级归属)、EC(多值酶编号,注意非一一对应)、DBLINKS(NCBI/UniProt 外链)。2011 年存档的 KO 总数为 14,715 条;此后官方统计口径转向"蛋白分配覆盖率",近年论文不再单独报告 KO 条目总数,引用旧数字时务必标注时点。

KO 与"直系同源/旁系同源"的经典定义有微妙差别:标准直系同源强调物种形成事件后的复制渊源,而 KO 按"功能等价 + 通路位置"归类——序列相似但功能分化的旁系同源会被拆成不同 KO。这一"功能优先"的实用主义让 KO 成为功能注释利器,但也意味着它不是严格的系统发生学对象,做演化分析时需回溯到序列层面验证。

3.5 化学层:COMPOUND/GLYCAN/REACTION/ENZYME

COMPOUND(C 号)、GLYCAN(G 号)、REACTION(R 号)与 ENZYME(EC 号)构成化学层:反应方程把底物与产物以 C/G 号书写,酶节点以 EC 编号关联,通路图因此能同时表达代谢流与调控流。2011-06 存档规模:COMPOUND 17,641、GLYCAN 10,978、REACTION 8,494、ENZYME 5,419。COMPOUND 条目附 Molfile 结构式与化学式字段,是计算化学特征(分子指纹、质量)的直接来源;REACTION 条目的 equation 字段使用"通配"写法(R 基团、n/n+1 聚合度),部分条目原子不平衡,工程处理见坑点 6。

ENZYME 库的命名数据源是 ExplorEnz(IUBMB 酶命名官方数据库),KEGG 在其上补充反应方程与通路链接。药物层 DRUG 库收录日本、美国与欧盟获批药物(D 号)及其 ATC 分类、靶点与代谢酶,DGROUP 把同一活性成分的不同盐型归组。该层与 DISEASE、NETWORK 一起支撑 KEGG MEDICUS 的药品说明检索功能。需要提醒的是,GENES/GENOME/ENZYME 三库的数据源分别是 NCBI RefSeq/GenBank、NCBI Genome 与 ExplorEnz,KEGG 在其上做整合与策展;其余各库则以文献策展为主体。

3.6 健康层:NETWORK/DISEASE/DRUG 与 MEDICUS

DISEASE(H 号)以"分子基础"视角定义疾病:每个条目列出已知致病基因、通路与相关药物,而非照搬临床分类学;条目链接 ICD 与 OMIM 外部编码。NETWORK(2017 年上线)进一步把疾病知识组织为"网络变异图"——同一通路在疾病状态下因基因变异、病毒感染等因素产生的拓扑变化,N 编号标识网络元素、nt 编号标识变异图。DRUG 条目含 ATC 分类、结构、靶点与药物-药物相互作用(DDI,REST ddi 操作专门服务于此)。

KEGG MEDICUS 是健康层的整合门户:把 DISEASE/DRUG 与药品说明书(日本药品标签)对齐,提供疾病-药物-基因的三向检索与日文版界面(disease_ja/drug_ja 等)。对医学 AI 的意义在于:这是 KEGG 中最接近临床语义的部分,但其定位仍是机制知识库——不能当作药物适应症全谱或诊疗指南使用。

健康层还有一个容易被忽视的工程价值:NETWORK 的"网络变异"数据模型给出了疾病状态下的通路拓扑差异表示,适合作为变异解释(variant interpretation)任务的先验——把患者突变映射到 hsa 通路后,NETWORK 层能区分"该突变落在通路主干"还是"落在变异高发的旁支"。这一用法尚无官方分析工具直接支持,需要基于 KGML/NETWORK 数据自建映射,属于高级用法。

3.7 访问通道总览

KEGG 提供四条互补的访问通道,§6 将逐条展开:

  1. 网页:KEGG2 入口 + 逐条 HTML 页,免费浏览;通路图带 Download KGML 与颜色映射入口。
  2. REST API(rest.kegg.jp):list/get/find/link/conv/ddi 六类操作,返回 TSV、flat file、KGML、JSON、PNG 与 RDF,逐条免费。
  3. FTP 批量下载:订阅制(2011-07-01 起),适合镜像与大规模特征工程;订阅者另可获得 KGML+ 增强包。
  4. 分析工具:KEGG Mapper(PATHWAY/BRITE/MODULE 映射)、BlastKOALA/GhostKOALA/KofamKOALA(KO 分配)、KEGG Syntax(保守基因谱比较)、SIMCOMP(化学结构相似性)、KEGG Web Apps(带着色功能的通路查看器)。

3.8 flat file 与逐条样例

get 操作返回的 flat file 采用"字段名顶格、续行缩进"的块格式。字段名全库统一(ENTRY/NAME/DEFINITION/PATHWAY/MODULE/BRITE/EC/DBLINKS/REFERENCE/SEQUENCE 等),各库按需取用子集。以下为结构示意(字段名依官方规范,标识符取自本词条已核实来源,字段值为缩略展示):

ENTRY       K00844              KO
NAME        hexk, hexA
DEFINITION  hexokinase [EC:2.7.1.1 2.7.1.2]
PATHWAY     map00010  Glycolysis / Gluconeogenesis
BRITE       ko00199  Cytochrome P450 ...(层级示例)
DBLINKS     NCBI-GeneID: ...
REFERENCE   ...(PMID 列表)

工程解析要点:

  • 块边界:以 ENTRY 行开始,空行或下一 ENTRY 结束;续行以空白开头,解析器需按前缀聚合。
  • 多值字段:PATHWAY/BRITE/EC/DBLINKS 均为多值,同一字段可重复出现多行,切勿假设唯一。
  • 键值对:DBLINKS 行格式为"外部库名: 外部 ID",冒号后空格分隔;不同外部库命名随年代变化(如 NCBI-GeneID 与 GeneID 并存),映射表需做归一。
  • 序列字段:GENES 条目的 SEQUENCE 区含核酸与蛋白两种长度声明,批量解析时按 AASEQ/NTSEQ 关键字分离。
  • 与 TSV 的取舍:flat file 信息最全(含 REFERENCE),TSV 适合批量管道;REST get/<id>/json(部分库)与 BRITE JSON 是结构化折中。

§4 数据质量:人工策展的强项与代价

4.1 策展质量

KEGG 的核心资产是人工策展质量:参考通路图由专业策展团队依据文献绘制,交互关系标注 subtype(activation/inhibition/phosphorylation/binding/indirect 等),化合物-反应-酶三方互证。与自动汇聚型资源相比,KEGG 图的可读性与一致性长期被视为通路分析的金标准;F1000Research 的 CyKEGGParser 论文开篇即称其为"通路分析金标准",同时列出了它的机器可读短板。正因手工策展,其更新节奏依赖团队规模——2011 年官方披露的 25 名全职编制至今没有公开的大幅扩充信息,策展偏倚(人类与模式生物优先)成为结构性约束。

策展流程的证据链:PATHWAY 条目的 Description 区分 reference 与 organism-specific 视角;GENES 条目的注释直接继承 NCBI;KO 条目由官方审校参考集驱动自动分配。整个体系没有公开的策展日志(为何选这条文献、边界如何取舍),对 AI 训练而言标签来源可信但标签理由部分黑箱。

4.2 覆盖不均衡

官方 KO 分配统计给出了最直白的证据:动物蛋白 KO 分配率 66.8%,细菌 50.7%,而病毒仅 8.8%;植物与真菌约 37%-38%。这意味着以 KO 为词汇的功能分析在不同域的粒度天然不同。通路层面同样如此:糖酵解、TCA 循环、MAPK 信号等明星通路的边界与注释密度远高于罕见代谢分支;人类疾病通路聚焦典型机制场景,不能当作疾病-基因全谱清单使用。

不均衡还有第二个维度:库间成熟度。PATHWAY 与 GENES 历史最久、字段最稳;NETWORK(2017 年上线)与 DGROUP(2014 年上线)仍在扩张期,覆盖密度明显低于核心库;日文版仅覆盖 DISEASE/DRUG/COMPOUND/DGROUP 部分条目。跨库统计时应对各库分别报告时点。

4.3 格式一致性

flat file 与 TSV 输出的字段结构稳定,跨库链接可靠;主要不一致集中在 KGML:官方文档承认 KGML 是"交换格式",并不承诺复现图像全部信息。第三方系统评估(CyKEGGParser,F1000Research)与转换工具(KEGGtranslator,BMC Systems Biology)论文记录了系统性偏差:缺事件/实体标签、部分 relation 方向颠倒、交互遗漏、compound 交互表示不一致、蛋白复合体节点与重复节点破坏图算法假设。§6.3 与 §7 坑点 2 将给出工程对策。

另一类格式裂缝是"视图即数据"的设计:物种特异通路图本身不作为独立数据对象发布,而是参考图 + 物种基因映射的实时渲染结果。这保证了参考图单一权威来源,但意味着"下载人类全部通路"必须逐物种前缀请求,批量语义由使用者自行组装。

工程上的推论:任何声称"KEGG 数据完整快照"的第三方包,都值得核对三个问题——快照日期是什么、包含 flat file 还是仅通路 ID、是否携带订阅凭证痕迹。三问之后,多数"省事"的镜像方案的隐性成本就显形了;合规与质量双低的来源,比没有来源更危险。

4.4 可追溯性

KEGG 条目通过 flat file 的 REFERENCE 字段列出支撑文献(PMID),ENZYME 条目回链 ExplorEnz,GENES 回链 NCBI,DRUG 回链各国药监批准信息——溯源链条完整。条目历史的官方记录以 Release notes(更新说明)与 Release history(版本档案)提供,粒度到"日";但对单条目"何时因哪篇文献修改"没有逐条目日志,时间序列研究需自行抓取存档比对。

4.5 与自动汇聚型资源的质量对比

把 KEGG 放进"人工策展 vs 自动汇聚"的谱系里看,其质量特征更清晰:

维度 KEGG(人工策展) 自动汇聚型(如多源整合库)
一致性 同一策展团队统一标准,术语与画风稳定 多源规则异构,需大量清洗
时效 依赖策展队列,新文献入库有滞后 自动抓取接近实时
覆盖广度 精选核心通路与物种 名义覆盖广、深浅不一
错误模式 策展偏倚(系统性、可描述) 源头噪声(随机、难描述)
可复现性 单一权威来源,结果可引用 源版本矩阵复杂,需冻结快照

对 AI 工程的启示:KEGG 的错误是"有结构的"——集中于非模式物种与冷门通路,可以用注释覆盖率量化并对冲;自动汇聚库的错误是"散点的"——难以用单一协变量校正。这解释了为什么二十余年间下游工具链(clusterProfiler 等)默认绑定 KEGG:不是没有替代,而是替代源的质量方差更大。当然,人工策展的代价是 §5 的许可结构与 §7 坑点 8 的偏倚,两者同根同源。


§5 许可与合规:双轨访问的边界

5.1 时间线

KEGG 的许可演化本身就是一部数据商业化史,官方 30 周年报告列出的关键节点如下:

  • 1995-12:首版发布即带版权声明(遵循日本文部省指南)。
  • 1997-05 至 2003-06:kegg.com/kegg.net/kegg.org/kegg.jp/pathway.jp 域名族注册。
  • 1999-02:第一个商业许可发放。
  • 2000-11:Pathway Solutions Inc 成立并接管商业许可。
  • 2004-03:KEGG 在日本注册商标(2006 年扩展至美欧)。
  • 2011-07:学术 FTP 订阅制启动。
  • 2024-07:新商业许可框架。

5.2 当前条款要点

  • 免费部分:主站 www.kegg.jp 浏览、逐条 REST API(rest.kegg.jp)、KGML 单条下载(网页 Download KGML 链接)、KEGG Mapper 等在线工具,对包括学术与个人在内的用户免费。官方 30 周年报告明确:“主站与 API 服务由京都大学生物信息中心运营,对学术用户免费开放。”
  • 订阅部分:批量 FTP 下载自 2011-07-01 起仅向订阅者开放;2011 年公布的学术价格为个人 2,000 美元/年、机构 5,000 美元/年,由 NPO Bioinformatics Japan 与 Pathway Solutions 联合管理;订阅收入全部再投入 KEGG 开发。
  • 商业使用:任何商业用途需从 Pathway Solutions 获取许可——第三方 PTM 通路库综述(2025)仍明确标注"Commercial use requires paid license"。
  • 重分发:官方条款禁止未经许可的批量重分发;CASRAI 的数据管理指南特别提醒:把 KEGG 通路图整库镜像并二次分发不属于"免费使用"的范畴,在数据管理计划中应显式注明订阅成本。

5.3 对 AI 工程的实际含义

  • 可以做:逐条调用 REST API 为你的基因列表取 KO 与通路映射(注意限速礼貌);在论文中引用 map 编号并链接官方页面;用在线 KEGG Mapper 上传数据映射。
  • 需要订阅:为模型训练批量拉取全库 flat file 或 KGML 集合;在内部建立持续镜像;把 KEGG 数据打包进开源工具或数据集再分发(许多 R/Python 包因此只内置通路名称列表而不内置数据本体)。
  • 需要商业许可:把 KEGG 映射结果封装进商业产品或付费服务。
  • 灰色地带:爬虫抓取网页逐条拼接全库在条款上等同批量下载,应走订阅而非规避;脚本内缓存逐条 API 结果用于研究属常规学术惯例,但大规模长期缓存请先与官方确认。

5.4 合规 FAQ

场景 是否需要付费 依据
论文里放一张 KEGG 通路图截图(标注来源) 否(学术惯例,建议核对官方 use policy) 网站免费浏览
每天调用 1 万次 REST API 拉映射 否,但需遵守速率与用途限制 API 免费声明
实验室 5 人共享一个 FTP 账号批量下载 需机构订阅(5,000 美元/年档) 订阅条款按机构
把 KEGG KGML 打包进开源 Python 包随 pip 分发 不可以(重分发限制) 官方许可条款
公司内部分析平台批量缓存 KEGG 数据 需商业许可 Pathway Solutions
用 KEGG Mapper 在线工具做项目分析 否 免费在线工具
从第三方镜像站点下载 KEGG 数据 风险行为:镜像本身可能违规,且数据版本不可信 订阅与重分发条款

5.5 订阅与授权操作指引

需要批量访问时,按以下顺序操作(以官方流程为准,本节为一般性指引):

  1. 确认用途层级:先判定属于学术/非营利还是商业使用;混合型项目(如企业资助的高校课题)建议直接咨询官方,勿自行套用学术价。
  2. 选择订阅形态:学术个人订阅绑定个人身份,适合独立研究者;机构订阅覆盖全员,适合平台型实验室;订阅入口在官网 Subscription 页。
  3. 留存凭证与条款版本:订阅确认函与当时条款 PDF 归档,供审计与 DMP 引用。
  4. 配置内部访问控制:FTP 凭据只发一人、镜像目录设 ACL、再分发请求统一出口审批。
  5. 续期与退出:续期前评估实际用量(下载频次、数据量);若退订,按条款处理本地留存数据的销毁或保留。
  6. 商业许可路径:联系 Pathway Solutions Inc(官网 Licensing 页),说明产品形态与数据流转,获取书面许可范围。

一个常被忽略的细节:2011 年官方公告明确"订阅收入全部再投入 KEGG 开发"——订阅不仅是合规成本,也是这一知识库三十年可持续的资金机制;在论文致谢与 DMP 中说明订阅支持,既合规也是对数据基础设施的贡献。


§6 AI 就绪指南

本章是面向 AI 工程师的实操手册:先把 13 库映射到机器可读的获取方式,再给出 KGML 逐字段解析与 REST API 操作速查,最后落到特征工程建议。所有示例均可直接运行(Python 3.10+,仅需 requests/pandas/Biopython 标准生态)。

6.1 获取路径决策树

按用途选择通道,避免许可与效率双输:

需求                          → 推荐通道           → 格式
─────────────────────────────────────────────────────
给基因列表做通路富集          → REST link/conv     → TSV
解析通路拓扑建图              → KGML(ko/org 版)  → XML 0.7.2
全库批量特征(KO 丰度等)     → FTP(需订阅)      → flat file/TSV
化合物结构相似性检索          → SIMCOMP 在线工具   → 网页/API
跨物种保守性比较              → KEGG Syntax        → TSV/图
单条核查与引用                → /entry/<ID> 直达   → HTML
药物-药物相互作用             → REST ddi           → TSV
BRITE 层级解析                → REST get + JSON    → JSON

决策树的三个原则:第一,能逐条就不批量——许可与速率约束都因此更宽松;第二,能缓存就不重拉——缓存即快照,同时解决复现;第三,先小规模验证格式再放大——KGML 的视图差异(坑点 1/2)在单条试跑时就能暴露,不必等到全库任务失败。

6.2 REST API 六类操作速查

REST API 基址 https://rest.kegg.jp/,六类操作全部返回纯文本(TSV 或 flat file),无鉴权但有速率约束(官方建议低于每秒 3 次、高峰期更低):

list  hsa                 # 列出人类所有 GENES 条目(org_code 列表)
list  pathway+hsa         # 列出人类全部通路(hsaXXXXX + 名称)
get   hsa04930            # 取一条通路 flat file(含 REFERENCE/PMID)
get   hsa04930/kgml       # 取该通路 KGML(XML 文本)
get   hsa04930/image      # 取通路 PNG(叠加高亮前的底图)
find  compound/glycogen   # 关键词检索 COMPOUND 库
find  gene/hsa/TP53       # 基因关键词检索
link  pathway+hsa04930    # 该通路关联的所有对象(反向)
link  hsa+pathway         # 正向:对象 → 通路
conv  hsa+ncbi-geneid     # KEGG 基因 ↔ NCBI GeneID 映射
conv  hsa+uniprot         # KEGG 基因 ↔ UniProt 映射
ddi   D00584              # 药物-药物相互作用

逐条操作示例(含错误处理与限速):

import time, requests

BASE = "https://rest.kegg.jp/"

def kegg_get(path: str, retries: int = 3) -> str:
    """REST API 文本获取;官方建议速率 < 3 req/s。"""
    for i in range(retries):
        r = requests.get(BASE + path, timeout=30)
        if r.ok:
            return r.text
        time.sleep(2 ** i)
    raise RuntimeError(f"KEGG request failed: {path}")

# 1) 人类通路清单 → DataFrame
import pandas as pd
rows = [ln.split("\t", 1) for ln in kegg_get("list/pathway/hsa").splitlines()]
pw = pd.DataFrame(rows, columns=["pathway_id", "name"])

# 2) 取 2 型糖尿病通路 KGML(物种前缀版本才有 KGML,见坑点 1)
kgml = kegg_get("get/hsa04930/kgml")

# 3) KEGG 基因 ID → UniProt(跨库对齐的标准动作)
import io
up = pd.read_csv(
    io.StringIO(kegg_get("conv/uniprot/hsa")),
    sep="\t", names=["kegg_id", "uniprot_id"],
)

# 4) KO → EC 显式取边表(保留多对多结构,见坑点 3)
ko_ec = kegg_get("link/ec+ko:K00873")

返回格式的工程要点:list/link/conv/ddi 返回两列(或三列)TSV,多值对象在同一字段内以空格/逗号分隔,解析时先 split;get 无后缀返回 flat file(字段名顶格、续行缩进的块格式),带后缀 /kgml、/image、/json 分别返回 XML、PNG 与 JSON;RDF 视图(Turtle/N-Triples)通过内容协商或 /rdf 后缀获取,适合直接入 SPARQL 栈。

6.3 KGML 逐字段解析

KGML(0.7.2)是 KEGG 通路的机器可读形态。三种顶层元素必须分清,先看节点元素 entry(以糖酵解相关节点为示意,己糖激酶对应 KO 为 K00844、人类三个基因 hsa:3098/hsa:3099/hsa:3101):

<entry id="45" name="hsa:3098 hsa:3099 hsa:3101" type="gene"
       link="https://www.kegg.jp/dbget-bin/www_bget?hsa:3098">
  <graphics type="rectangle" name="HK1, HK2, HK3..." fgcolor="#000000" bgcolor="#FFFFFF"
            x="467" y="250" width="46" height="17"/>
</entry>

entry 的语义:id 是图内局部编号(整数);name 是 KEGG 对象列表(基因可为多个,空格分隔;compound 前缀 cpd:);type 常见取值 gene/ortholog/compound/enzyme/reaction/map/group/brite;graphics 子元素携带 x/y 坐标、形状(rectangle/circle/roundrectangle)与颜色——布局信息全部在这里,也是渲染叠加 PNG 底图的依据。注意参考图(map 前缀)的 entry 用 ko: 编号,物种图(如 hsa 前缀)用具体基因。

再看关系边 relation:

<relation entry1="45" entry2="46" type="PPrel">
  <subtype name="activation" value="arrow-right"/>
  <subtype name="phosphorylation" value="+p"/>
</relation>

relation 的语义:type 表达边语义大类——ECrel(酶-酶先后步骤)、PPrel(蛋白-蛋白)、GErel(表达调控,subtype 含 expression/repression/indirect)、PCrel(蛋白-化合物)、maplink(跨图跳转);subtype 细化具体作用(activation/inhibition/phosphorylation/dephosphorylation/binding/indirect effect/state change/missing interaction 等)。注意 subtype 是可复用的子元素列表,一条 relation 可携带多个语义标签;subtype 的 value 属性在官方 KGML 中以箭头记号书写方向(两个连字符接右尖括号表示正向激活,竖线加箭头表示抑制,正号加 p 表示磷酸化),上例以文字记号替代以避免与 Markdown/HTML 语法冲突,解析真实 KGML 时以官方规范为准。

最后是反应元素 reaction(仅代谢图出现),其字段结构如下表:

属性/子元素 取值 语义
name rn: 前缀 + R 编号 对应 REACTION 库条目
type reversible / irreversible 可逆性声明
substrate id + name(cpd: 化合物编号) 底物列表(可多个)
product id + name(cpd: 化合物编号) 产物列表(可多个)

reaction 描述"化学转化"而 relation 描述"调控关系",两者在代谢图中并存,建模时用途不同:通量分析用 reaction,信号网络用 relation。KGML 根元素 pathway 携带 org(物种码)、number(编号数字)、title、image(底图 URL)与 link 属性。

三个元素的属性对照速查(解析器字段映射用):

元素 必读属性 常被忽略但重要
pathway org、number、title image(底图 URL,叠加渲染必需)、link(网页版地址)
entry id、name、type reaction(关联反应号)、link(条目页)、graphics(坐标/形状/颜色,多子元素取第一个为主形态)
relation entry1、entry2、type subtype 列表(可为空——空 subtype 的边仅表达"存在关联")
reaction id、name、type substrate/product 的 id 是图内局部引用,跨元素连接靠 entry 的 reaction 属性回指

用 Biopython 解析并转为节点/边表:

from Bio.KEGG.KGML import KGML_parser
import io

pathway = KGML_parser.read(io.StringIO(kgml))
print(pathway.org, pathway.number, len(pathway.entries()), len(pathway.relations()))

# 节点表:entry → (类型, KEGG 名称, 坐标)
nodes = [(e.id, e.type, e.name, e.graphics[0].x, e.graphics[0].y)
         for e in pathway.entries().values() if e.graphics]

# 边表:relation → (源, 汇, 类型, 子类型)
edges = [(r.entry1, r.entry2, r.type, r.subtypes[0][1] if r.subtypes else "")
         for r in pathway.relations()]

# 反应表:reaction → (entry, R号, 可逆性, 底物, 产物)
rxns = [(rx.id, rx.name, rx.type,
         [s.name for s in rx.substrates], [p.name for p in rx.products])
        for rx in pathway.reactions()]

渲染回图像(叠加官方底图):

from Bio.Graphics.KGML_vis import KGMLCanvas

canvas = KGMLCanvas(pathway)
canvas.import_imagemap = True   # 叠加官方 PNG 底图,恢复完整视觉布局
canvas.draw("hsa04930.pdf")

6.4 数据字典与跨库映射

KEGG 没有单一的机器可读数据字典,字段规范分散在 weblinks、KGML 规范与 API 文档三处;工程上建议以如下映射表为锚:

目标 标准动作 REST 调用
KEGG 基因 ↔ NCBI GeneID conv conv/ncbi-geneid/hsa
KEGG 基因 ↔ UniProt conv conv/uniprot/hsa
KO ↔ EC 编号 link link/ec+K00873(注意非一一对应)
KO ↔ 通路 link link/pathway+ko:K00873
化合物 ↔ PubChem conv conv/pubchem+compound
药物 ↔ 靶点/疾病 link link/target+D00584、link/disease+H00004
通路 ↔ 上游/下游通路 link link/pathway+map00010(maplink 边)
物种 ↔ 基因清单 list list/hsa

flat file 关键字段速查(以 get 输出为准):ENTRY(标识与类型)、NAME/SYMBOL、DEFINITION/DESCRIPTION、PATHWAY(多值)、MODULE、BRITE、EC(仅 KO/ENZYME)、DBLINKS(外链键值对)、REFERENCE(文献 PMID 列表)、SEQUENCE(核酸/蛋白序列,仅 GENES)、ATOM/MOLFILE(结构,仅 COMPOUND/DRUG)。

解析策略建议按任务分层:轻量查询直接 TSV(list/link/conv),无需解析器;结构化抽取用 flat file 块解析(自写 50 行内可覆盖主要库);拓扑分析用 KGML(Biopython)或第三方校正管线(CyKEGGParser/KEGGtranslator)。三层各取所需,避免"一个解析器通吃"的过度设计——flat file 与 KGML 的字段语义并不对齐,混用会引入静默错误。

6.5 特征工程建议

  • KO 丰度矩阵:宏基因组/转录组经 KofamKOALA 分配 KO 后,以 K 编号为列构建特征;缺失值语义是"未检出/未注释"而非零丰度,慎用朴素填充。
  • 通路级聚合:对每个通路计算 KO 覆盖率(该通路 KO 数中样本命中的比例)与加权 GSVA 类得分;通路集合建议取该物种有 KO 注注的子集而非全库 6,782 条(见坑点 7)。
  • 图神经网络输入:用 KGML 的 entry+relation 建图时,剔除 type=map 的图间跳转节点、展开 group 复合体、并对 PPrel 多 subtype 建多重边;坐标仅用于可视化,不进模型。
  • 化合物特征:COMPOUND 提供 Molfile 结构,可与 RDKit 描述符对齐;反应方程中的 R 通配符条目需剔除或人工核对(见坑点 6)。
  • 版本快照:KEGG 每日更新,训练前必须记录拉取日期与操作清单(官方建议引用 Release notes 日期),否则复现无从谈起。
  • 标签工程:以 KO 为一级标签、BRITE 层级为粗粒度标签、MODULE 为中间粒度,三层并用可缓解单一粒度的稀疏问题。

6.6 现成工具链

不必从零造轮子:Python 生态首选 Biopython 的 Bio.KEGG 模块(KGML 解析 + 渲染)与 bioservices(REST 封装);R 生态的 clusterProfiler(enrichKEGG/GSEA)与 pathview(映射可视化)覆盖富集全流程;Cytoscape 有 KEGGscape 与 CyKEGGParser 应用(后者带 KGML 不一致自动校正);格式转换有 KEGGtranslator(KGML→SBML/BioPAX/SBML-qual)、KEGGconverter 与 kgml2sif。跨物种 KO 分配的官方在线服务为 BlastKOALA/GhostKOALA/KofamKOALA 三件套,批量化时同样受许可与限速约束。

选型建议:富集分析直接用 clusterProfiler(内置 KEGG 在线拉取与缓存);系统建模用 KEGGtranslator 先清洗再转 SBML;网络分析在 Cytoscape 里用 CyKEGGParser 导入(自动处理坑点 2 的不一致);深度学习管道用 Biopython 自行建图以保留 subtype 多重边语义。

6.7 BRITE 层级与 JSON 视图

BRITE 是 KEGG 的本体式层级库,get 操作对 br 条目返回缩进文本,部分条目另提供 JSON 视图。层级解析的典型用途是把 KO 归入更粗的功能家族(如 ko01000 酶层级),作为特征聚合的中间粒度:

import json, requests

def brite_json(br_id: str):
    """取 BRITE 层级 JSON 视图(部分条目支持)。"""
    r = requests.get(f"https://rest.kegg.jp/get/{br_id}/json", timeout=30)
    if r.ok and r.text.lstrip().startswith("{"):
        return json.loads(r.text)
    return None

hier = brite_json("br08901")   # 抗微生物层级(官方文档示例 ID 之一)
  • 文本形态:缩进树,行前缀深度即层级;适合 grep 与日志化存档。
  • JSON 形态:嵌套 children 字典,直接映射到 pandas 或图结构;并非所有 br 条目都有 JSON 视图,回退方案是解析缩进文本。
  • 物种类分层:BRITE 的 ko 前缀层级(如酶分类、疾病相关基因集合)可直接作为富集背景的替代划分;与 GO 互补但粒度不同,别混用层级深度做统计。

6.8 RDF 视图与知识图谱栈

KEGG 提供 Turtle 与 N-Triples 两种 RDF 序列化,便于直接入 SPARQL/知识图谱栈:

import requests

# 取一条通路的 Turtle 视图(内容协商方式)
r = requests.get(
    "https://rest.kegg.jp/get/hsa04930",
    headers={"Accept": "text/turtle"}, timeout=30,
)
ttl_text = r.text

工程要点:RDF 视图覆盖核心库(PATHWAY/KO/COMPOUND/DRUG/DISEASE 等),层级库与部分健康库覆盖不全;跨库链接在 RDF 中表现为 owl:sameAs/rdfs:seeAlso 性质的三元组,可与其他本体(ChEBI/UniProt 的 RDF 版)做联邦查询;大规模抽取仍受订阅条款约束,逐条拉取是许可安全区。

6.9 端到端示例:基因列表到通路特征表

把前述组件串成一条完整管线:输入差异基因列表,输出"通路 × 覆盖特征"表(可直接进下游模型):

import io, time
import pandas as pd
import requests

BASE = "https://rest.kegg.jp/"

def kget(path: str) -> str:
    for i in range(3):
        r = requests.get(BASE + path, timeout=30)
        if r.ok:
            return r.text
        time.sleep(2 ** i)
    raise RuntimeError(path)

def tsv(text: str, cols):
    return pd.read_csv(io.StringIO(text), sep="\t", names=cols)

def gene2pathway_features(genes: list[str], org: str = "hsa") -> pd.DataFrame:
    # 1) 归一:外部基因 ID → KEGG 基因
    conv = tsv(kget(f"conv/{org}+ncbi-geneid"), ["kegg_id", "ext_id"])
    hit = conv[conv.ext_id.isin(genes)].kegg_id.unique().tolist()

    # 2) 正向 link:KEGG 基因 → 通路
    gp = tsv(kget(f"link/pathway/{'+'.join(hit[:10])}"),
             ["kegg_id", "pathway_id"])

    # 3) 物种通路全集做背景(坑点 7)
    bg = tsv(kget(f"list/pathway/{org}"), ["pathway_id", "name"])

    # 4) 汇总覆盖率特征
    per_path = gp.groupby("pathway_id").kegg_id.nunique()
    feat = bg.set_index("pathway_id").join(per_path.rename("hits"))
    feat["hits"] = feat.hits.fillna(0).astype(int)
    return feat.sort_values("hits", ascending=False)

# feat = gene2pathway_features(["7157", "5594", ...])  # NCBI GeneID 列表

生产化改造建议:把第 2 步的逐批 link 换成订阅 FTP 的 link 表全量加载;把背景集与通路条目数快照落盘(坑点 7);为 org 参数做白名单校验防注入拼接。

6.10 限速、重试与礼貌抓取

REST API 无鉴权但有限速约束(官方建议低于每秒 3 次,高峰期更保守),批量任务的稳健模式:

  • 指数退避:对 5xx 与超时按 2 的幂次退避重试,上限 3-5 次;4xx 直接入死信队列人工核查(多数是无 KGML 的 map 图或拼写错误)。
  • 批量合并:get 支持 [+分隔] 的多 ID 合并请求(如 link 一次传多个对象),把请求数压缩一个量级;单 URL 过长时分批。
  • 错峰调度:日本时区白天是官网高峰,大规模拉取安排错峰;周期任务用固定节流而非突发。
  • 缓存优先:KEGG 条目更新以日为单位,管道内先查本地缓存(按拉取日期分目录),未命中再请求;缓存即版本快照,天然解决复现问题(坑点 7)。
  • 失败语义分离:把"网络失败""无 KGML 的 404""限速拒绝"三类错误在日志里分列统计——混合统计会让坑点 1 的正常 404 淹没真实故障,也会让限速问题被误判为数据缺失。

§7 八大坑点

以下坑点均来自公开文献与工程实践记录,每条按 问题 → 症状 → 解决(简单方法/进阶方法/SOTA 方法)→ 参考 四段展开。使用建议:新项目设计评审时通读一遍;线上故障排查时按 §7.9 速查矩阵定位。八个坑点中 1/2/4/7 属"几乎必踩",建议直接写进团队 SOP;3/6 属"数据敏感型",涉及化学或标签对齐时必查;5/8 属"低频高害",靠流程而非代码防御。

⚠️ 坑点 1:请求 map 参考图的 KGML 返回 404(分类:工程陷阱)
问题:KEGG 的 KGML 只为 ko/rn/ec 与物种前缀版本(hsa04930 等)生成;map 编号的纯参考图不含 KGML,Biopython 官方教程明确记录对 map00061 请求 KGML 会得到 HTTP 404。参考图在官方设计里是"绘制层"对象,而 KGML 是"交换层"对象,两者并非一一对应。
症状:get/map00010/kgml 报错或返回空;批量脚本在全库爬取时随机失败约一半任务(所有 map 前缀图均无 KGML);误以为数据缺失而放弃参考图视图;把 404 当网络故障无限重试。
解决:1. 简单方法:把 map 前缀替换为 ko 前缀——get/ko00010/kgml 即可获取该通路在 KO 空间的完整拓扑,再用 link 操作补物种基因映射。2. 进阶方法:批量任务统一走"ko 版 KGML + conv/link 组装物种层"的两步流程,错误处理中把 404 识别为"该图无 KGML"的正常信号而非网络故障。3. SOTA 方法:订阅用户改用官方 FTP 的 KGML+ 增强包(补充版 KGML,含图像完整信息),或用 KEGGtranslator 做一站式转换;对只需人类数据的场景直接以 hsaXXXXX 全集为目标爬取,绕开 map 层。
参考:Biopython KGML 教程(notebook.community/widdowquinn);KEGG WebLinks 文档(www.kegg.jp/kegg/docs/weblinks.html)。

⚠️ 坑点 2:KGML 不等于你看到的通路图(分类:预处理陷阱)
问题:KGML 是"交换格式"而非图像的完整编码:不含图上的连接线、标签与整体布局;代谢图中 reactions/relation 通常不完整;蛋白复合体(group)与同一 entry 的多个图形拷贝破坏"一节点一实体"假设。第三方解析记录确认 KGML 与图像存在缺标签、方向颠倒、交互遗漏、compound 表示不一致四类系统性偏差。
症状:用 KGML 构建的图比网页图像明显稀疏;同一基因在网络分析里出现多个节点(多拷贝);边方向与文献描述相反;Cytoscape 导入后布局散乱;依赖 KGML 边做的图算法(中心性、社区发现)结果与文献常识不符。
解决:1. 简单方法:接受 KGML 为"骨架拓扑",可视化时叠加官方 PNG 底图(Pathway 对象的 image 属性给出底图 URL)。2. 进阶方法:预处理阶段合并同 entry 的多拷贝(同一图形拷贝可能催化不同反应,需按反应并集合并);剔除 type=map 跳转节点;用 CyKEGGParser 的半自动校正处理方向与缺失边。3. SOTA 方法:用 KEGGtranslator 或 König 等的管线先补全缺失反应参与者(对照 REACTION 方程与同义词表),再导出 SBML/BioPAX 做系统建模;把"KGML 修正日志"作为数据版本记录保存。
参考:CyKEGGParser(F1000Research 2014, 3:145);König et al., BMC Systems Biology 2013, 7:15;KEGG KGML 文档(www.kegg.jp/kegg/xml/docs/)。

⚠️ 坑点 3:把 KO 与 EC 当作一一对应(分类:标签理解)
问题:EC 编号自 2003 年起不再是 KEGG 的自有标识符;KO 与 EC 是多对多关系——一个 KO 可关联多个 EC(多功能酶),一个 EC 的反应可由多个 KO 的酶催化。旧文献与旧工具以 EC 为通路词汇,直接混用会引入标签错位。官方演变史(1995-1999 EC → 2000-2002 Ortholog ID → 2003- KO)本身就说明两者是不同抽象层。
症状:富集结果同时出现 K 号与 EC 号且数量对不上;按 EC 聚合的通路覆盖率与按 KO 聚合不一致;跨库(UniPathway/ExplorEnz)对齐时报错或错配;把 flat file 的 EC 字段当唯一键做 join 后行数膨胀。
解决:1. 简单方法:固定以 KO 为主词汇,EC 仅作展示别名(flat file 中 EC 字段直接可读)。2. 进阶方法:需要 EC 视图时用 link/ec+<KO> 显式取边表并保留多对多结构,不做唯一化合并;join 前先按 KO 去重。3. SOTA 方法:以 KO 为图节点、EC 为边属性建超图;历史数据迁移时按官方三阶段演变分别处理旧标识,并为旧 EC 建立到 KO 的映射存档表。
参考:KEGG Overview(www.genome.jp/kegg/kegg1a.html);KEGG WebLinks。

⚠️ 坑点 4:物种特异图里的"白色节点"并不属于该物种(分类:偏倚陷阱)
问题:物种特异通路是 KO 匹配自动生成的视图:参考图上未在该物种注释到 KO 的节点保持白色背景。这些节点对应"理论上该反应存在"的酶,但该物种未必有编码基因(或尚未证明)。把它们当作物种通路成员会虚增通路规模。官方 Overview 明确物种特异图的生成逻辑是参考通路 + 基因匹配。
症状:统计物种通路基因数时远大于实际注释数;代谢建模中出现"幽灵反应"(该物种无法催化);富集背景集合被未注释节点污染,p 值系统性偏小;跨物种比较时通路"大小"不可比。
解决:1. 简单方法:只统计物种特异图中着色(有 KEGG 基因链接)的节点;KGML 中表现为带物种基因 name 的 entry,白色节点在 KGML 里 name 为 ko: 前缀。2. 进阶方法:构建通路背景集时以"该物种 GENES 库实际注释到的 KO 全集"为分母,而非通路图全部节点。3. SOTA 方法:用 König 管线在建模前显式删除白色 ortholog 节点并记录删除清单;跨物种比较时统一报告"注释覆盖率"以防偏倚误导。
参考:König et al., BMC Systems Biology 2013, 7:15;KEGG Overview 的 mapping 章节。

⚠️ 坑点 5:以为 KEGG 免费就能整库镜像与重分发(分类:合规要求)
问题:2011-07-01 起批量 FTP 下载仅向订阅者开放(学术个人 2,000 美元/年、机构 5,000 美元/年),商业使用需 Pathway Solutions 许可;官方明确"KEGG 从来不是公共数据库"。逐条 API 免费 ≠ 批量获取免费,爬虫拼接整库等同批量下载。
症状:开源包内置 KEGG 数据本体被下架或收到侵权投诉;论文数据可用性声明无法提供 KEGG 快照下载链接;企业管线审计时发现许可缺口;引用第三方镜像导致版本与官方不一致且不可追溯。
解决:1. 简单方法:工程上只保留 KEGG ID 引用与官方 URL,运行时按需逐条拉取;论文引用 map/K 编号并链接官方页面。2. 进阶方法:机构购买 FTP 订阅,内部镜像设访问控制与再分发禁令;数据管理计划中显式列出订阅成本与续期责任人。3. SOTA 方法:商业产品改用开放许可替代源(Reactome CC BY 4.0/CC0、WikiPathways)承载可再分发数据,KEGG 仅作为人工核查参考层;多源映射表(KEGG↔Reactome↔GO)由自建管道维护而非复制 KEGG 内容。
参考:KEGG Plea(www.genome.jp/kegg/docs/plea.html);GenomeWeb 2011-05 报道;CASRAI KEGG 词条;KEGG 30 周年报告许可时间线。

⚠️ 坑点 6:化合物多标识符与反应方程的"不完全化学"(分类:工程陷阱)
问题:同一化学实体在 COMPOUND/DRUG/GLYCAN 各库各有标识(C/D/G 号),而 REACTION 方程只引用其中一个,必须跨库解析同义词才能对齐;方程中还存在通配与变量:R 表示任意取代基、n/n+1 表示聚合度,部分反应原子不平衡(缺失 H+ 或 P+ 乃至多个原子)。KGML 中同一 entry 可有多个图形拷贝,各拷贝催化不同反应。官方文档明确反应方程的参与者标识"取自该对象的任一可用标识符"。
症状:化合物-反应二部图构建时大量反应"断链"(参与者缺失);原子守恒校验失败率不可忽略;把 R 通配条目当作具体分子导致结构特征错误;DRUG 参与的反应与 COMPOUND 视图对不上。
解决:1. 简单方法:剔除含 R/n/n+1 的通配反应,只用完全特化反应构建化学图。2. 进阶方法:用 REST link/compound+<drug_id> 等操作补齐同义词后再对齐方程参与者;对每个反应做原子平衡检查并把结果写入注释而非自动修复。3. SOTA 方法:按 König 管线以化学式(get compound 的 formula 字段)做逐原子校核,人工复核不平衡反应;把 KGML 多拷贝 entry 合并为逻辑单一节点(反应并集)后再进模型。
参考:König et al., BMC Systems Biology 2013, 7:15;KEGG KGML 文档(www.kegg.jp/kegg/xml/docs/)。

⚠️ 坑点 7:富集分析的背景集合与版本漂移(分类:评估误用)
问题:通路富集 p 值强烈依赖背景集合口径:用全库 6,782 条通路做背景 vs 该物种有 KO 注释的通路子集,结果显著不同。KEGG 每日更新且无语义版本号,两次实验间通路定义与 KO 集可能已变;通路 ID 前缀(map/hsa/ko/rn)混用会让批次对齐失败。
症状:同一数据两次分析富集通路列表漂移;审稿人要求提供通路数据库版本号时无从回答;批次间通路名相同但条目数不同;GSEA 与 ORA 两个框架给出相反结论而无法解释。
解决:1. 简单方法:背景集固定为"分析基因所在物种有注释的全部通路",并在方法学段落写明拉取日期(如"KEGG release notes 2026-07-01")。2. 进阶方法:把首映批次的 flat file 快照归档(订阅用户)或存档全部 API 响应 JSON,建立本地版本号;所有通路 ID 规范化为数字部分统一管理前缀。3. SOTA 方法:用 clusterProfiler 等框架的内部一致性检查 + 双数据库交叉验证(KEGG vs Reactome 富集方向一致性作为稳健性指标);把 KEGG 版本作为协变量纳入多批次整合模型。
参考:PMC12645814(2025 年通路库综述,规模口径);KEGG Release notes(www.kegg.jp/kegg/docs/relnotes.html)。

⚠️ 坑点 8:通路知识的人类与模式生物偏倚(分类:偏倚陷阱)
问题:KEGG 由文献策展,研究热度决定注释密度:糖酵解、MAPK 等明星通路边界精细,罕见代谢分支稀疏;KO 分配率动物 66.8% vs 病毒 8.8%(2025-12 官方统计),非模式物种通路覆盖系统性偏低;疾病通路以典型机制场景为主,不是疾病-基因全谱清单。把注释密度当作生物学真实性会形成"富者愈富"的自我强化。
症状:跨物种分析中非模式物种"通路缺失"被误读为"功能缺失";罕见病或孤儿代谢通路的差异信号被稀释;模型学到"通路注释多 = 更重要"的伪相关;对病毒/植物样本的功能推断覆盖突然塌缩。
解决:1. 简单方法:报告结果时同时给出该物种/通路注释覆盖率,缺失明确标注为"未注释"而非"不存在"。2. 进阶方法:以注释密度作分层或加权;对低覆盖域(病毒、植物)改用 Module 层(M 编号,单元更小更稳)做功能推断。3. SOTA 方法:多知识库融合(KEGG+Reactome+GO-CAS+UniPathway)以互相补盲;用无监督功能信号(如共表达模块)校验 KEGG 注释偏倚并在训练中做去偏正则。
参考:KEGG30.pdf KO 分配统计(2025-12-22);CyKEGGParser 论文抽象化讨论(F1000Research 2014);PMC12645814 通路库横向对比。

7.9 坑点速查矩阵

八个坑点的影响面与排查成本速查(用于团队评审时快速定位):

坑点 主要影响环节 触发频率 一次触发成本 首选检查动作
1 map 无 KGML 批量爬取脚本 高(约半数请求) 低(任务失败重试) 换 ko 前缀
2 KGML 不等于图 图构建/网络分析 高(每次解析) 中(结果失真) 叠加 PNG 底图核对
3 KO-EC 多对多 标签对齐/富集 中 中(计数错位) link/ec 取边表
4 白色节点 物种注释统计 高(跨物种任务必触) 高(结论偏倚) 过滤含物种基因的 entry
5 许可边界 发布/合规 低频高害 极高(下架/审计) 对照 §5.4 FAQ
6 多标识符与通配化学 化学特征/通量建模 中 高(断链/守恒失败) 同义词补齐 + 原子校核
7 背景集与版本漂移 富集/复现 高(跨批次必触) 高(不可复现) 锁定拉取日期快照
8 知识偏倚 跨域推断 中(按域骤变) 高(系统性偏差) 报告分域 KO 分配率

矩阵的使用方式:评审他人分析时按"主要影响环节"定位坑点编号,再回 §7 读对应四段式;自查时按"首选检查动作"逐项过一遍即可覆盖八个高危场景。频率列基于第三方文献与社区工具文档的记录密度估计,非精确统计,仅供参考。


§8 与同类通路资源的对比

8.1 KEGG vs Reactome

Reactome 是与 KEGG 最常并论的通路库,2025 年第三方 PTM 通路库综述给出的横向数据如下:KEGG 6,782 条通路、跨约 1.09 万物种、API 与单图下载、商业使用需付费许可;Reactome 2,769 条人类通路、提供 API/文档/教程/下载,通路图 CC BY 4.0、数据 CC0 1.0。选型建议随之清晰:跨物种功能词典与宏基因组场景选 KEGG(KO 是事实标准);人类精细反应级拓扑与开放许可再分发选 Reactome。两者叠加使用(坑点 8 的 SOTA 方案)是当前稳健做法。

两者在知识模型上的差异同样关键:Reactome 按反应逐条标注证据(作者、审者、文献),通路是反应的严格组合;KEGG 则以手绘图为本体,反应与关系服务于图的叙事。前者适合需要证据链的精细推理,后者适合需要"一图看全局"的功能解释。机器可读性上 Reactome 的 BioPAX/SBML 转换更完整,KGML 的裂缝见坑点 2。

一个常见的工程误区是把两者当"同一种东西的不同版本":同一基因列表在 KEGG 与 Reactome 得到的"通路数"不可直接互换——前者的通路是全物种参考图(6,782 条口径),后者是严格人类的反应级通路(2,769 条口径)。跨库引用数字时务必带上库名与年份,这是本词条附录 A 口径纪律在跨库场景的直接延伸。

8.2 其他同类资源

  • WikiPathways:社区策展,开放许可(CC BY),适合长尾通路与社区修订,但策展深度不均;与 KEGG 交集大、互为校验。
  • MetaCyc/BioCyc:代谢反应实验证据标注细致,物种数据库(PGDB)按机构订阅,与 KEGG 在代谢重建上直接竞争;证据等级体系(实验验证 vs 推断)比 KEGG 显式。
  • GO(基因本体):功能注释词汇而非通路图,与 KEGG BRITE 层级互补;富集分析中 GO 与 KEGG 常并列报告。
  • OmniPath:信号通路交互汇总库(MIT 许可),聚焦人类信号网络,与 KEGG PPrel 层互补;prioritization 层可过滤低可信交互。
  • KEGG NETWORK:KEGG 自家的疾病网络变异层(2017 年上线),与 DISEASE/DRUG 联动,适合变异-通路精细分析。
  • Pathway Commons:多源通路数据汇聚(含 Reactome/Pathway 口径),适合需要一站式图数据的场景,但来源混杂需回溯溯源。

8.3 选型速查

维度 KEGG Reactome WikiPathways MetaCyc
物种覆盖 约 1.09 万物种(KO 通用) 人类为主 + 直系同源扩展 社区多物种 数千物种 PGDB
通路数(2025) 6,782 2,769(人类) 数千(社区) 数千(代谢)
机器可读格式 KGML/TSV/RDF BioPAX/SBML/CSV GPML SBML/数据库
开放许可再分发 否(订阅/商业许可) 是(CC BY 4.0/CC0) 是(CC BY) 机构订阅
反应级精细度 中(代谢强,信号中) 高(反应级证据) 中 高(实验证据标注)
宏基因组适用性 强(KO 标准件) 弱 弱 中
证据链透明度 REFERENCE 字段(PMID 级) 逐反应作者/审者 逐通路作者 证据等级显式
疾病/药物联动 强(DISEASE/DRUG/MEDICUS) 中(反应级疾病注释) 弱 无

8.4 多库映射与融合策略

单一通路库都有盲区,工程上常用"KEGG 为骨、他库补肉"的融合策略:

  • KEGG ↔ Reactome:经基因集重叠建立通路级映射表(注意两库通路粒度不同,映射是"多对多 + 部分覆盖",需记录映射方法与 Jaccard 阈值);Reactome 的反应级细节用于校验 KEGG 信号通路的方向与缺失。
  • KEGG ↔ GO:BRITE 层级与 GO 分支做粗对齐;富集分析双库并报,方向一致的结论可信度更高(坑点 7 的 SOTA 方案)。
  • KEGG ↔ MetaCyc:代谢反应实验证据互查;MetaCyc 的证据等级字段可反哺 KEGG 反应的可信度分层。
  • 映射表维护:跨库映射表本身是版本化资产——记录两库各自的拉取日期、映射算法与版本号,否则"多库融合"会成为新的不可复现源。
  • 许可叠加:融合产物若对外发布,按最严格来源的条款处理(含 KEGG 成分时即触发订阅条款,见坑点 5)。

§9 使用实践建议

9.1 标准工作流

以"RNA-seq 差异基因的 KEGG 通路解释"为例,推荐五步流程:

  1. ID 归一:把基因符号经 conv 操作统一到 KEGG 基因 ID(conv/hsa+ncbi-geneid),记录未映射清单与比例;未映射超过 10% 时先检查物种与基因版本。
  2. 背景集确定:取该物种有 KO 注释的通路全集做背景(坑点 7),而非全库 6,782 条。
  3. 富集与校正:over-representation 或 GSEA 类检验 + 多重校正(BH-FDR);同时报告 KO 覆盖率。
  4. 可视化:Pathview 或 KEGG Mapper 把 log2FC 映射到通路图;展示用 hsaXXXXX 图 + 官方 PNG 底图。
  5. 存档:保存 API 响应、拉取日期、脚本与参数,方法学引用 Kanehisa et al. 2023(doi:10.1093/nar/gkac963)与 Release notes 日期。

前两步的最小实现(与 §6.9 端到端示例互补):

# 步骤 1:ID 归一与未映射审计
conv = tsv(kget("conv/ncbi-geneid/hsa"), ["kegg_id", "ext_id"])
mapped = set(conv.ext_id) & set(my_geneids)
missing = set(my_geneids) - mapped
print(f"映射率 {len(mapped)/len(my_geneids):.1%},未映射 {len(missing)} 个")

# 步骤 2:物种通路背景集(以 hsa 有注释通路为准)
bg = tsv(kget("list/pathway/hsa"), ["pathway_id", "name"])
# 注意:list/pathway/hsa 返回的是 hsa 前缀物种视图,
# 与全库 map 前缀清单(list/pathway)不同——背景口径就此锁定。

9.2 宏基因组场景

宏基因组功能剖面的事实标准是 KO:reads → 物种/基因预测 → KofamKOALA/BlastKOALA 分配 KO → KO 丰度表 → KEGG Module/通路层级聚合。建议:Module 完成度(module completeness)比通路 p 值更稳健,因为它基于 M 编号的逻辑表达式显式定义"该功能单元需要哪些 KO";报告时区分"KO 分配率低"(注释覆盖问题)与"功能缺失"(生物学结论);跨样本比较时锁定同一版本的 KO 定义。对病毒组样本,注意 KO 分配率仅 8.8%(2025-12),功能结论应降级为"探索性"。

9.3 药物与疾病场景

DRUG 库的 D 编号 + ATC 分类 + 靶点链接适合构建药物-靶点-通路三元组;ddi 操作直接给出药物-药物相互作用对,是药物警戒特征工程的一手来源;与 DISEASE 的 H 编号联动可快速梳理"药物-适应症-机制通路"链条。坑点提醒:药物条目含盐型与活性成分差异(用 DGROUP 归组);网络药理学多靶点分析时注意 KEGG 通路是"典型场景图",靶点-通路对的存在性不等于临床有效性;把 DRUG 条目按 ATC 大类聚合时建议同时报告聚合前后条目数变化。

9.4 可复现性清单

  • 每次分析记录:KEGG 拉取日期、REST 操作清单、物种代码、通路 ID 前缀口径、背景集定义。
  • API 响应原样存档(JSON/TSV),不直接在内存中消费后丢弃——KEGG 无版本化 API,历史结果无法重放。
  • 富集结果附通路条目数快照(当时的 KO 数/基因数),审稿人可据此判断版本漂移影响。
  • 引用格式:Kanehisa et al. NAR 2023(doi:10.1093/nar/gkac963)+ 官网 URL + Release notes 日期。

9.5 数据管理计划要点

  • 在 DMP 中显式声明 KEGG 访问层级(网页/API 免费;FTP 订阅;商业许可)与预算责任人(坑点 5)。
  • 归档策略:快照 + 拉取日期 + Release notes 编号,作为数据版本记录。
  • 再分发边界:论文附件中只放自产结果与 ID 清单,不放 KEGG 数据本体;工具发布走"运行时拉取"或要求用户自备订阅。
  • 伦理与隐私:KEGG 不含人类受试者数据,无需 IRB;但下游连接的组学数据(如 TCGA)仍需各自合规路径。

9.6 案例研究:肿瘤免疫微环境通路的机器学习特征

一个典型工程场景:用 TCGA 转录组做肿瘤免疫微环境预测,KEGG 充当特征层。按本词条方法论的落地步骤:

  1. 特征组设计:免疫相关通路集合(如细胞因子-受体互作、抗原呈递等免疫系统类通路)逐一计算 KO/基因覆盖得分;同时引入 KEGG Module 的免疫功能单元作细粒度特征。
  2. 背景与归一:以该癌种队列实际表达的基因全集为分母,避免用全库通路做背景(坑点 7);覆盖得分按通路条目数归一。
  3. 偏倚防线:免疫通路属明星区域、注释密度高,跨癌种比较时报告各癌种的注释覆盖率分布(坑点 8);通路间高度相关,模型端用组套正则或通路嵌入而非朴素拼接。
  4. 可解释输出:把模型重要度回投到 hsa 前缀通路图(Pathview),保留通路条目数与拉取日期快照。
  5. 合规路径:TCGA 数据走 dbGaP/外部授权链路,KEGG 特征层仅保留 ID 与得分,不携带 KEGG 数据本体入库分发(坑点 5)。

该案例的方法学要点已覆盖本词条全部八大坑点中的五个(2/3/4/7/8),可作为团队内部评审的检查单原型。

9.7 十问十答

  • Q1:KEGG 和 GO 用哪个? 两者层级不同:GO 是功能属性词汇(分子功能/生物过程/细胞组分),KEGG 是通路与功能单元;富集分析双库并报是当前审稿惯例。
  • Q2:人类数据用 hsa 还是 map 图? 分析与映射用 hsa 前缀(有基因链接),参考口径说明用 map 前缀;两者数字编号相同。
  • Q3:为什么我拉的通路条目数与论文不一致? 版本漂移(坑点 7)与口径(参考图 vs 物种视图)双重原因;先核对双方拉取日期。
  • Q4:KO 丰度表可以直接进分类器吗? 可以,但先做组成性校正(compositional effect),并记住"未分配"不是零。
  • Q5:module completeness 怎么算? 按 MODULE 条目内定义的逻辑表达式(必备 KO 集合)计算命中比例,官方 MODULE 页有逐条定义。
  • Q6:能引用 2011 年的 KO 14,715 条吗? 可以引用历史口径但必须标注时点与来源;当前规模请用官方统计页口径(§1.2)。
  • Q7:REST API 有正式 SLA 吗? 没有,官方仅给速率建议;关键业务需本地缓存与降级策略。
  • Q8:KGML 里的 group 节点怎么处理? group 是复合体容器(成员在 component 子元素),展开成成员节点、边挂到组,或按建模需求折叠。
  • Q9:非模式物种通路稀疏怎么办? 先看该物种 KO 分配率定位问题层级(坑点 8),再用 Module 层与多库融合补盲。
  • Q10:想给数据库课程讲 KEGG,从哪里开始? 官方 Overview(kegg1a)+ WebLinks + 一次 REST 手工练习(list/get/conv/link 四个命令)即可建立完整心智模型。

9.8 延伸阅读与官方文档地图

按使用深度递进的官方文档清单(均为真实地址,随官网改版请以站内导航为准):


附录 I 发布前自查清单

本文档入库前的十项自查(全部通过后发布;check_md.py 覆盖其中自动化部分):

  1. 行数落在 1,400-1,700 目标区间(或 1,200-1,900 宽限区间且无 warn)。
  2. frontmatter 九字段齐全且顺序正确;schema_org 含 @graph/MedicalWebPage/Dataset/cr:RecordSet/rai:dataLimitations。
  3. §0-§10 + §C + INFOBOX + DAIMS 表全部在位,锚点 {#sec-xxx} 无重复。
  4. 八个坑点编号唯一、四段式完整、分类标注存在。
  5. DAIMS 24 项齐全,评分行/解读段/行动段三件套完整。
  6. 代码围栏全部配对;JSON-LD 仅一个块且可被 json 解析。
  7. 全文无 HTML 注释、无占位符、无未定稿表述(自动校验器覆盖全部同类检查)。
  8. 全部数字带时间戳与来源;附录 A 对照表与正文一致。
  9. 中英文混排空格、千分位、"截至 YYYY-MM"写法一致。
  10. 本站条目 URL 在 schema_org 中使用占位符,正文 URL 均为可核查真实地址。

附录 J 术语英中对照与系列协同

J.1 术语英中对照(KEGG 语境)

英文术语 本文用法 说明
pathway map 通路图 手工绘制的参考网络,map 编号
ortholog group 直系同源组 KO 条目的本体含义
functional ortholog 功能直系同源 KO 的官方定义用词
metabolic reconstruction 代谢重建 由基因组推断代谢能力的经典流程
enrichment analysis 富集分析 ORA/GSEA 类方法的统称
module completeness 模块完成度 M 编号逻辑表达式的命中比例
conserved gene repertoire 保守基因库谱 KEGG Syntax 的比较单元
network variation 网络变异 NETWORK 库的疾病拓扑视角
drug group 药物组 DGROUP 归并同活性成分
bulk download 批量下载 触发订阅条款的访问形态
redistribution 重分发 许可条款的独立限制项
data stewardship 数据管家职责 DMP 语境

J.2 与千方病案系列条目的协同

  • 上游衔接:ClinVar(变异注释)、COSMIC(肿瘤突变)、GTEx(组织表达)产出的基因/变异清单,可经本词条 §6.9 管线进入 KEGG 通路层。
  • 同层互补:Reactome(开放许可替代)、STRING(蛋白互作网络)、ChEBI(化学实体)与 KEGG 化学层互补;多库融合策略见 §8.4。
  • 下游衔接:以 KEGG 通路特征训练的模型,其可解释性输出可回链 DISEASE/DRUG 层生成机制假设,供 TTDDDC 类条目记录的后续药物数据源验证。
  • 写作协同:系列内引用 KEGG 数字的其他条目,统一采用本词条 §1.2 的口径表与引用模板(附录 A),避免跨条目数字打架。

J.3 维护责任矩阵

触发事件 需更新的本文部分 优先级
官网库结构再重组 §3.1 表、frontmatter schema_org 高
许可价格/条款变化 §5 全节、附录 A 高
官方统计口径变化 §1.2 表、附录 D 中
NAR 数据库卷新论文 §2.4、INFOBOX DOI 行 中
第三方工具链重大变化 §6.6、附录 D 低

附录 K 参考文献

本词条正文与坑点引用的文献与官方文档,按类型分组(全部经检索核实,核实日期 2026-09-15):

KEGG 官方论文(NAR 系列及方法学)

  1. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Research, 2000, 28(1):27-30. doi:10.1093/nar/28.1.27
  2. Kanehisa M, Sato Y, Kawashima M, Furumichi M, Tanabe M. KEGG as a reference resource for gene and protein annotation. Nucleic Acids Research, 2016, 44(D1):D457-D462. doi:10.1093/nar/gkv1070
  3. Kanehisa M, Furumichi M, Sato Y, Ishiguro-Watanabe M, Tanabe M. KEGG: integrating viruses and cellular organisms. Nucleic Acids Research, 2021, 49(D1):D545-D551. doi:10.1093/nar/gkaa970
  4. Kanehisa M, Furumichi M, Sato Y, Kawashima M, Ishiguro-Watanabe M. KEGG for taxonomy-based analysis of pathways and genomes. Nucleic Acids Research, 2023, 51(D1):D587-D592. doi:10.1093/nar/gkac963
  5. Aramaki T, Blanc-Mathieu R, Endo H, Ohkubo K, Kanehisa M, Goto S, Ogata H. KofamKOALA: KEGG Ortholog assignment based on profile HMM and adaptive score threshold. Bioinformatics, 2020, 36(7):2251-2252. doi:10.1093/bioinformatics/btz859

KEGG 格式与坑点证据(第三方工程文献)

  1. Arakelyan A, Nersisyan L. CyKEGGParser: tailoring KEGG pathways to fit into systems biology analysis workflows. F1000Research, 2014, 3:145.(KGML 四类偏差与抽象化问题)
  2. König M, Holzhütter HG, Berndt N. Metabolic landscapes of microbial cells and metabolic models: mapping and reduction of big-scale biochemical networks. 及同组 KGML 建模管线论文(BMC Systems Biology, 2013, 7:15)。doi:10.1186/1752-0509-7-15(化合物多标识符/白色节点/原子不平衡/多拷贝 entry)

官方文档与历史文件

  1. KEGG Overview: Genomes to Biological Systems. https://www.genome.jp/kegg/kegg1a.html
  2. KEGG WebLinks: KEGG Identifier, WebLinks and Entry Format. https://www.kegg.jp/kegg/docs/weblinks.html
  3. Plea to Support KEGG(2011-05-16/05-21 两段公告). https://www.genome.jp/kegg/docs/plea.html
  4. Kanehisa M. Sustainable research infrastructure / KEGG 30周年报告(含许可时间线与 KO 分配统计). https://www.kegg.jp/kegg/docs/KEGG30.pdf
  5. KEGG 数据库 2011-06-17 存档(全库条目数快照). https://www.kanehisa.jp/docs/archive/kegg_june11.pdf
  6. KEGG Release notes(按日更新). https://www.kegg.jp/kegg/docs/relnotes.html

对比与横向综述

  1. 第三方 PTM 通路库横向综述(含 KEGG 6,782 条通路与 Reactome 许可对比,2025). https://pmc.ncbi.nlm.nih.gov/articles/PMC12645814/
  2. GenomeWeb: KEGG Moves to Subscription Model, Appeals for Support as Funding Dries up(2011-05). https://drupal-prod.genomeweb.com/node/265341
  3. CASRAI 数据管理词典:KEGG 词条(重分发提示). https://casrai.org/dictionary/term/kyoto-encyclopedia-of-genes-and-genomes-kegg
  4. MetaboNews 2011-08(KEGG 订阅制侧证报道). http://www.metabonews.ca/Aug2011/MetaboNews_Aug2011.htm

引用提示:NAR 系列论文按"引用与所用数据版本最接近的年份"选择——2023 年卷为当前默认;KGML 格式问题引用 6/7 两篇;许可沿革引用 10/11/15 三源交叉。


§10 总结

KEGG 用三十年时间把"通路"从纸上图谱变成可计算的公共基础设施:13 个数据库、23 种数据对象、以 KO 为枢纽的映射体系支撑着从单基因注释到宏基因组功能剖面的几乎全部功能解释场景,2025-04 的 6,782 条通路与 2025-12 的 6,087 万条蛋白 KO 分配记录印证其持续扩张。它的不可替代性在于三件事:手工策展的参考通路图质量、KO 作为跨物种通用词汇的网络效应、以及基因-化学-疾病-药物四层知识的统一标识符体系。对 AI 从业者,它的高价值区在 KO 词汇与跨库链接,高风险区在 KGML 与图像的格式裂缝、EC/KO 多对多、白色节点、许可边界与版本漂移——本词条 §7 的八大坑点即为此而写。截至 2026-09,KEGG 仍是生物医学 AI 链条中"从基因到功能"的默认词典;用对通道、守住许可、固定版本,它就是最可靠的解释层。

接手一个新项目时的五条行动清单(按序执行,一步不落):

  1. 判定用途层级与许可路径(§5.4 FAQ),订阅与预算责任人写进 DMP。
  2. 锁定物种、前缀口径与拉取日期,建立本地缓存目录规范(§6.10)。
  3. 用附录 B 练习单做一次全流程手演,确认团队理解标识符体系。
  4. 按坑点速查矩阵(§7.9)逐项排查管线,重点 4/7/8 三项。
  5. 把引用格式(NAR 2023 + Release notes 日期)与快照存档策略写进项目 README。

§C 结构化数据(JSON-LD)

{
  "@context": {
    "@language": "en",
    "@vocab": "https://schema.org/",
    "cr": "http://mlcommons.org/croissant/",
    "rai": "http://mlcommons.org/croissant/RAI/",
    "dct": "http://purl.org/dc/terms/"
  },
  "@graph": [
    {
      "@type": "MedicalWebPage",
      "@id": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433#webpage",
      "name": "KEGG(Kyoto Encyclopedia of Genes and Genomes)| AI Ready 数据集",
      "description": "KEGG 京都基因与基因组百科全书的 AI-Ready 数据集百科词条:13 个数据库结构、KGML 格式解析、REST API 使用、许可合规、8 个工程坑点与 DAIMS 24 项就绪度评估。",
      "url": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433",
      "inLanguage": "zh-CN",
      "about": {"@id": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433#dataset"},
      "audience": {"@type": "Audience", "audienceType": "生物信息学研究者、医学 AI 工程师、数据工程师"},
      "datePublished": "2026-09-15",
      "dateModified": "2026-09-15",
      "lastReviewed": "2026-09-15",
      "reviewedBy": {"@type": "Organization", "name": "千方病案医学编辑部"},
      "isPartOf": {"@id": "https://www.qianfanghub.com/#website"},
      "primaryImageOfPage": {"@id": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433#cover"},
      "mainEntity": {"@id": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433#dataset"},
      "specialty": {"@type": "MedicalSpecialty", "name": "Bioinformatics"}
    },
    {
      "@type": "Dataset",
      "@id": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433#dataset",
      "name": "KEGG(Kyoto Encyclopedia of Genes and Genomes)",
      "description": "手工策展的生物系统功能知识库:以 KO(KEGG Orthology)功能直系同源为枢纽,将基因组、化学物质与疾病/药物信息链接到手工绘制的通路图、BRITE 功能层级与 KEGG 模块。",
      "url": "https://www.qianfanghub.com/ai-ready-dataset/kegg/433",
      "identifier": "10.1093/nar/gkac963",
      "sameAs": "https://www.kegg.jp/",
      "license": "网站与 API 对学术用户免费;批量 FTP 下载自 2011-07-01 起需付费订阅(学术个人 2,000 美元/年、机构 5,000 美元/年);商业使用需 Pathway Solutions 许可",
      "creator": {"@type": "Organization", "name": "Kanehisa Laboratories(京都大学生物信息中心)", "url": "https://www.kanehisa.jp/"},
      "dateCreated": "1995",
      "dateModified": "2026-09-15",
      "keywords": ["KEGG", "pathway enrichment", "KEGG Orthology", "KO", "metabolic pathway", "KGML", "genome annotation", "biological systems", "multi-omics"],
      "includedInDataCatalog": {"@type": "DataCatalog", "name": "千方病案医数集", "url": "https://www.qianfanghub.com"},
      "measurementTechnique": "基于已发表文献的人工策展 + NCBI RefSeq/GenBank 序列整合 + ExplorEnz 酶命名整合 + KO 计算分配(BlastKOALA/GhostKOALA/KofamKOALA)",
      "temporalCoverage": "1995/2026",
      "spatialCoverage": "全球(参考通路跨物种通用;维护机构位于日本京都)",
      "isAccessibleForFree": true,
      "conformsTo": "http://mlcommons.org/croissant/1.1",
      "version": "每日更新(官方 Release notes 最近一期 2026-07-01)",
      "citation": "Kanehisa, M., Furumichi, M., Sato, Y., Kawashima, M., & Ishiguro-Watanabe, M. (2023). KEGG for taxonomy-based analysis of pathways and genomes. Nucleic Acids Research, 51(D1), D587-D592.",
      "distribution": [
        {
          "@type": "DataDownload",
          "name": "KEGG flat file 全库(订阅制 FTP)",
          "contentUrl": "https://www.kegg.jp/kegg/download/",
          "encodingFormat": "flat file (TXT), KGML (XML 0.7.2)",
          "isAccessibleForFree": false
        },
        {
          "@type": "DataDownload",
          "name": "KEGG REST API(逐条免费)",
          "contentUrl": "https://rest.kegg.jp/",
          "encodingFormat": "TSV, flat file, KGML, JSON, PNG, RDF (Turtle/N-Triples)",
          "isAccessibleForFree": true
        }
      ],
      "cr:recordSet": [
        {
          "@type": "cr:RecordSet",
          "name": "PATHWAY 参考通路图",
          "description": "6,782 条通路图(2025-04 统计);map 参考图无 KGML,ko/rn/ec/org 版本可下载",
          "cr:field": [
            {"@type": "cr:Field", "name": "entry_id", "dataType": "sc:Text", "description": "通路标识,前缀 + 5 位数字,如 map00010、hsa04930"},
            {"@type": "cr:Field", "name": "entry_name", "dataType": "sc:Text", "description": "通路名称"},
            {"@type": "cr:Field", "name": "entry_type", "dataType": "sc:Text", "description": "七大类之一:metabolism 等"},
            {"@type": "cr:Field", "name": "kgml_url", "dataType": "sc:Text", "description": "KGML 下载地址;map 版本返回 HTTP 404"}
          ]
        },
        {
          "@type": "cr:RecordSet",
          "name": "KO 功能直系同源",
          "description": "截至 2025-12-22,60,874,528 条蛋白中 32,073,173 条(52.7%)完成 KO 分配",
          "cr:field": [
            {"@type": "cr:Field", "name": "ko_id", "dataType": "sc:Text", "description": "K + 5 位数字,如 K00873"},
            {"@type": "cr:Field", "name": "symbol", "dataType": "sc:Text", "description": "KO 符号"},
            {"@type": "cr:Field", "name": "pathway_map", "dataType": "sc:Text", "description": "参与的通路图列表(多值)"},
            {"@type": "cr:Field", "name": "ec_number", "dataType": "sc:Text", "description": "关联 EC 编号(多值,与 KO 非一一对应)"},
            {"@type": "cr:Field", "name": "brite_hierarchy", "dataType": "sc:Text", "description": "BRITE 层级归属"}
          ]
        }
      ],
      "rai:dataLimitations": "KGML 与人工绘制通路图不完全一致;参考通路含目标物种不存在的酶节点;无官方数据划分与预处理脚本;批量下载与重分发受订阅许可约束",
      "rai:dataBiases": "文献策展偏倚:明星通路注释更完整;人类与模式生物优先;病毒蛋白 KO 分配率仅 8.8%",
      "rai:personalSensitiveInformation": "不含人类受试者个体数据"
    }
  ]
}

§D 数据就绪度评估(DAIMS)

# 检查项 状态 说明
1 宽格式/长格式可用性 ✅ flat file 与 TSV 双形态;REST list/link 输出即 TSV
2 唯一标识符体系 ✅ 前缀 + 5 位数字全库统一(K/C/D/H/map/T),跨库链接稳定
3 特殊字符处理 ⚠️ flat file 多值字段以逗号/空格分隔需转义;反应方程含 R/n/n+1 通配符
4 重复行处理 ⚠️ KGML 同一 entry 多图形拷贝;link 输出含多对多重复边,需显式去重策略
5 缺失值编码 ⚠️ "未注释/未检出"无统一显式标记;GENES 无 KO 时以空白呈现
6 标签体系与标识 ✅ KO/BRITE/Module 三层标签语义清晰且官方维护
7 罕见类别处理 ⚠️ 罕见代谢分支与低覆盖域(病毒 8.8%)条目稀疏,无官方补偿机制
8 数据偏倚评估 ⚠️ 官方统计页公开分域 KO 分配率,偏倚可量化但无官方讨论文档
9 数据字典完备性 ⚠️ 字段规范分散于 weblinks/KGML 规范/API 文档三处,无单一机器可读字典
10 缺失信息的解释文档 ❌ 无官方文档系统性解释各库缺失语义与边界取舍
11 设备/采集元数据 ❌ 不适用:知识库无设备采集环节(计入不满足)
12 特征共线性评估 ✅ 不适用:非高维特征矩阵资源(不计扣分的适用性通过)
13 跨库编码映射 ✅ conv/link 提供 NCBI/UniProt/PubChem/LIGAND 映射,方向齐全
14 时间戳处理 ⚠️ 每日更新 + Release notes,但无语义版本号与条目级时间戳
15 数据划分建议 ❌ 无官方 train/val/test 划分建议(功能解释任务需自建)
16 数据泄漏讨论 ⚠️ 无官方讨论;文献策展与新药/新基因进入时间线可能造成时间泄漏,需自防
17 标签分布统计 ✅ 官方 KO statistics 页按域给出分配率(动物 66.8%/病毒 8.8% 等)
18 测量偏倚说明 ⚠️ 策展偏倚(人类/模式生物优先)可见于统计但无官方偏倚声明
19 外部验证建议 ⚠️ 无官方指南;社区惯例为 Reactome/GO 交叉验证
20 版本记录规范 ⚠️ Release notes 按日更新但无版本语义化;引用需自行锁定日期
21 预处理脚本提供 ⚠️ 官方仅提供在线工具;Biopython/KEGGtranslator 等为第三方生态
22 合规要求文档 ⚠️ 许可条款明确但分散于 plea/subscription/legal 页,需自行拼装合规清单
23 多模态对齐 ✅ 基因-化合物-反应-通路-疾病-药物跨库 ID 互链是 KEGG 强项
24 去标识化/隐私 ✅ 不含人类受试者数据,无隐私风险(适用性通过)

DAIMS 评分

得分:14/24(58.3%)——✅ 8 项、⚠️ 12 项、❌ 4 项(计分规则:✅=1,⚠️=0.5,❌=0)。

评分解读

KEGG 的强项集中在"结构层":标识符、跨库映射、标签体系与多模态对齐均为满格,这使它成为功能注释事实标准的根基。弱项集中在"文档与治理层":缺失语义无解释、无划分建议、无官方预处理脚本、版本治理停留在日期粒度,❌ 的 4 项全部属于"官方未提供而非数据有缺陷"。⚠️ 12 项中约半数(重复行、通配符、背景集口径、许可文档分散)有成熟的社区对策,其余需要团队自建治理流程。与同类知识库横向比较,KEGG 的就绪度瓶颈不在数据本身而在"开放治理惯例"——Reactome 等后发库直接采用了 CC 许可与语义版本,而 KEGG 的治理框架成型于开放科学惯例成熟之前。

对你意味着什么

  • 如果你的任务是多组学功能解释/宏基因组剖面:KEGG 即插即用,优先解决 ID 归一与背景集口径,DAIMS 弱项影响很小。
  • 如果你的任务是模型训练/基准构建:必须自建版本快照、划分方案与泄漏防线;❌ 的 4 项全部要落在你的管线里补齐。
  • 如果你的任务是商业化产品/数据再分发:DAIMS 高分帮不了你——先把订阅与许可路径走通(坑点 5),再评估是否需要 Reactome 等开放许可替代层。
  • 如果你是数据管家/资源评审者:把 KEGG 当作"词汇标准 + 解释层"而非"可再分发数据集"来写进 DMP,能避开绝大多数合规争议。

附录 A 事实与来源对照表

本词条全部硬数字与关键断言的来源映射,与同目录 FACTS.md 同源(检索核实日期 2026-09-15):

# 事实断言 来源
A1 1995 年 Kanehisa 在京都大学化学研究所发起 KEGG CASRAI 词条;KEGG Overview
A2 映射词汇演变:1995-1999 EC → 2000-2002 Ortholog ID → 2003- KO KEGG Overview(genome.jp/kegg/kegg1a.html)
A3 EC 编号不再作为 KEGG 自有标识符 同上
A4 截至 2026-09:23 种数据对象、13 个数据库 KEGG Overview;官网首页重组公告
A5 2011-06 存档:PATHWAY 398/140,607、KO 14,715、GENES 6,667,326 等 kanehisa.jp 存档 PDF(kegg_june11.pdf)
A6 2025-04:6,782 条通路;1,184 真核 + 9,279 细菌 + 449 古菌 PMC12645814
A7 2025-12-22:60,874,528 蛋白中 32,073,173(52.7%)已赋 KO;动物 66.8%/病毒 8.8% 官方 KO statistics(KEGG30.pdf)
A8 2025 年约 10,000 原核 + 1,800 真核物种量级 同上
A9 许可时间线:1995-12 版权声明 → 1999-02 首个商业许可 → 2000-11 Pathway Solutions → 2011-07 学术 FTP 订阅 → 2024-07 新商业许可 KEGG30.pdf
A10 2011-05-16 Plea 公告;2011-07-01 学术 FTP 转至 NPO Bioinformatics Japan;2,000/5,000 美元价格 genome.jp/kegg/docs/plea.html;GenomeWeb
A11 “KEGG has never been a public database”;网站与 API 免费 GenomeWeb 报道引述
A12 2011 时点:月 15 万-20 万访客、年约 1,000 引用、FTP 月 3,000 用户、25 全职 + 5-10 兼职 plea.html;GenomeWeb
A13 KGML 0.7.2 结构(entry/relation/reaction;类型与 subtype 清单) graphinout KEGG 页;KEGG KGML 文档
A14 REST API 六类操作与返回格式(含 RDF) graphinout;KEGG WebLinks
A15 map 参考图无 KGML(HTTP 404);KGML 不含完整布局 Biopython KGML 教程
A16 KGML 四类系统性偏差与抽象化问题 CyKEGGParser(F1000Research 2014, 3:145)
A17 化合物多标识符、白色节点、原子不平衡、多拷贝 entry König et al., BMC Systems Biology 2013, 7:15
A18 Reactome 对比(2,769 人类通路;CC BY 4.0/CC0;KEGG 商业需付费) PMC12645814
A19 KEGG ID = 前缀 + 5 位数字;/entry/<ID> 直达链接 KEGG WebLinks
A20 GENES←NCBI、GENOME←NCBI、ENZYME←ExplorEnz 数据源声明 KEGG Overview
A21 NAR 系列:2000(28:27-30)、2016(gkv1070)、2021(gkaa970)、2023(gkac963) dblp Kanehisa 页
A22 KofamKOALA:profile HMM + 自适应阈值 Bioinformatics 2020, 36(7):2251-2252
A23 K00844 = hexokinase;hsa:3098/3099/3101 = 人类三个己糖激酶基因 第三方 KEGG 使用教程(college.mimazi.net)

引用模板(论文方法学段落可直接套用):

通路功能注释与富集分析基于 KEGG(Kyoto Encyclopedia of Genes and Genomes;https://www.kegg.jp/ ,Kanehisa Laboratories),数据获取日期为 YYYY-MM-DD(对应官方 Release notes 同日条目),跨库映射经 KEGG REST API(rest.kegg.jp)的 conv/link 操作完成,方法学引用 Kanehisa et al., Nucleic Acids Research 2023, 51:D587-D592(doi:10.1093/nar/gkac963)。通路背景集限定为该物种有注释的通路子集;物种特异视图中未注释节点(白色背景)已排除。批量数据使用遵循 KEGG 订阅条款(订阅编号/许可说明)。

模板要点与正文规则一一对应:日期锁定(坑点 7)、背景口径(坑点 4/7)、许可声明(坑点 5)、文献锚点(附录 A21)。

附录 B REST 命令练习单

适合数据库课程或团队新人 30 分钟上手的命令序列(浏览器地址栏即可执行):

第 1 步  认识标识符
  https://rest.kegg.jp/list/pathway/hsa        → 人类通路清单(找 map/hsa 前缀差异)
  https://www.kegg.jp/entry/hsa04930           → 2 型糖尿病通路页

第 2 步  取条目与格式
  https://rest.kegg.jp/get/hsa04930            → flat file(看 REFERENCE 字段)
  https://rest.kegg.jp/get/hsa04930/kgml       → KGML(对照 §6.3 找三种元素)
  https://rest.kegg.jp/get/map00010/kgml       → 404(复现坑点 1)

第 3 步  跨库映射
  https://rest.kegg.jp/conv/ncbi-geneid/hsa    → KEGG 基因 ↔ GeneID
  https://rest.kegg.jp/conv/uniprot/hsa        → KEGG 基因 ↔ UniProt

第 4 步  关系探索
  https://rest.kegg.jp/link/pathway/ko:K00844  → 己糖激酶 KO 的通路
  https://rest.kegg.jp/link/ec+ko:K00844       → KO-EC 多对多(坑点 3)

第 5 步  检索与药物
  https://rest.kegg.jp/find/compound/glycogen  → 化合物关键词检索
  https://rest.kegg.jp/ddi/D00584              → 药物-药物相互作用

练习完成后自测:能否说出 map/ko/rn/hsa 四个前缀的关系?能否指出 K00844 flat file 中 EC 字段为什么有多个值?能否解释第 2 步第三个命令为什么失败?

附录 C 词汇表

术语 解释
KO(K 编号) KEGG Orthology,功能直系同源组;跨物种映射的枢纽词汇
KGML KEGG Markup Language,通路图的 XML 交换格式(0.7.2)
KGML+ 订阅用户可得的增强版 KGML,含更完整图像信息
map/ko/rn/ec/org 前缀 同一通路编号在参考/KO/反应/酶/物种五类视图下的前缀变体
BRITE 功能层级与表格库(br 编号),本体式分类
MODULE(M 编号) 逻辑表达式定义的功能单元,粒度介于 KO 与通路之间
KEGG Mapper 官方在线映射工具族(Recolor/Reconstruct/Search 等)
BlastKOALA/GhostKOALA/KofamKOALA 官方 KO 自动分配三件套(BLAST/GHOSTX/profile HMM)
KEGG Syntax 基于保守基因库谱的生物体/物种群/病毒比较框架(2025-2026 新增)
KEGG MEDICUS 疾病-药物-药品标签整合的健康信息门户(2010-10 起)
conv / link / list / get / find / ddi REST API 六类操作(见 §6.2)
白色节点 物种特异图中未注释到该物种 KO 的参考节点(坑点 4)
flat file KEGG 块格式文本(字段名顶格、续行缩进),get 默认输出
DGROUP(DG 编号) 同一活性成分的药物组(盐型归并)
Release notes 官方按日更新的变更说明,引用版本时以此为锚

附录 D 检索核实记录

本词条按写作规范执行 5 轮独立 WebSearch(2026-09-15),检索词、采信与舍弃决策记录如下,供后续维护者复核:

第 1 轮:官方结构与子库全景

  • 检索词:KEGG Kyoto Encyclopedia of Genes and Genomes Kanehisa Laboratories main databases PATHWAY BRITE MODULE ORTHOLOGY
  • 采信:官网首页确认 23 种数据对象重组与 13 库清单、KEGG Syntax 新框架、2026-07-01 Release notes;WebLinks 文档确认 16 库旧口径与标识符体系;Overview 页确认四大类分类、各库数据源(NCBI/ExplorEnz)、映射词汇三阶段演变、各库发布年份表。
  • 舍弃:2011 存档 PDF 中 “KEGG2” 等入口细节(已改版,无现实意义)。

第 2 轮:规模数字

  • 检索词:KEGG PATHWAY number of pathway maps KO orthology entries organism count 2024 2025 statistics
  • 采信:第三方 PTM 综述(PMC12645814)的 6,782 条通路与物种分域计数(2025-04);KEGG30.pdf 的 KO 分配统计(2025-12-22)与物种量级;kanehisa.jp 2011-06 存档 PDF 的全库条目数快照。
  • 舍弃:第三方中文教程的规模描述(无时间戳);2011 存档数字不得作为"当前规模"引用,仅作历史口径。

第 3 轮:许可与订阅

  • 检索词:KEGG license subscription commercial use paid 2011 academic free FTP access Endo Bento Bioinformatics
  • 采信:官方 Plea 页全文(2011-05-16 与 05-21 两段公告);GenomeWeb 报道(价格、员工数、“never been a public database” 原话、BIRD→NBDC 背景);KEGG30.pdf 许可时间线(1999-02 首个商业许可、2024-07 新商业许可);CASRAI 词条的重分发提示;MetaboNews 2011-08 侧证。
  • 舍弃:检索词中的 “Endo Bento Bioinformatics” 未命中直接来源,许可文献引用以官方公告替代。

第 4 轮:KGML 与 API 坑点

  • 检索词:KEGG KGML REST API pathway maps not machine readable KO EC mapping limitations pitfalls bioinformatics
  • 采信:graphinout 对 KGML 0.7.2 结构与 REST 操作的整理;Biopython 教程的 map 图 404 实录与"KGML 不含完整布局"论断;CyKEGGParser(F1000Research 2014)的四类偏差与两条抽象化问题;König 等(BMC Systems Biology 2013)的化合物多标识符、白色节点、原子不平衡、多拷贝 entry 记录。
  • 舍弃:无。

第 5 轮:文献链与引用

  • 检索词:Kanehisa "KEGG" Nucleic Acids Research database paper 2021 2022 citations KO entries current statistics
  • 采信:dblp 收录的 NAR 系列书目(2000/2016/2019/2021/2023)与 KofamKOALA(Bioinformatics 2020);plea 页"每年约 1,000 次引用"(2011 时点)。
  • 舍弃:Google Scholar 风格的累计引用数(无稳定来源,未写入正文)。

采信总原则:官方一手来源优先,二手综述需注明统计口径,教程类来源仅用于格式实证而非规模断言;同一事实尽量双源交叉(§0 审核基线)。

维护提示:本附录冻结于 2026-09。KEGG 每日更新,后续维护者复核时建议沿用相同检索序列,并重点核对三处易变区:官方首页的数据对象重组公告、KO 统计页的月度数字、许可条款的 2024-07 新框架后续执行细则。若官网结构再次重组(如 13 库清单变化),§3.1 表格与 frontmatter 需同步修订。


附录 E 七大通路类别与代表条目

PATHWAY 参考图的七大分类及本词条来源中确认的代表条目:

类别 内容 代表条目(已核实)
新陈代谢(Metabolism) 碳水/脂质/氨基酸/核苷酸代谢、能量转换等 map00010 糖酵解/糖异生
遗传信息加工 转录/翻译/折叠/降解/复制修复 ko00061 脂肪酸生物合成(KO 视图示例)
环境信息加工 信号转导、膜运输 (生物分类各域共享的信号通路族)
细胞过程 细胞周期/凋亡/自噬/迁移等 —
生物体系统 免疫/内分泌/循环/发育等系统级通路 —
人类疾病 疾病机制通路(分疾病组) hsa04930 2 型糖尿病
药物开发 抗微生物药、药物代谢等 —

说明:未填代表条目的类别在本次检索来源中无具体编号确认,为避免编造不列出;类别划分本身来自官方 Overview 与 KGML 规范描述。完整类别-条目清单以官网 PATHWAY 页实时为准。


附录 F 大事年代表

全部时间点来自官方 30 周年报告与存档文件(检索核实见附录 D):

1995-12  首版发布(PATHWAY/GENES/ENZYME/COMPOUND;带版权声明)
1997-05  kegg.com 域名注册
1998    REACTION 库(R 编号)
1999-02  首个商业许可
2000-02  GENOME 库(T 编号)与物种代码
2000-11  kegg.net/kegg.org/kegg.jp 域名;Pathway Solutions Inc 成立
2002-05  ORTHOLOGY 库(K 编号)
2003-05  GLYCAN 库(G 编号);KO 正式取代 EC 成映射枢纽
2004-03  KEGG 日本商标注册(2006 年扩展美欧)
2005    BRITE(br 编号)与 DRUG(D 编号)
2006    MODULE 库(M 编号)
2008    DISEASE 库(H 编号)
2010    RCLASS(RC 编号);10 月 KEGG MEDICUS 发布
2011-05  Plea to Support KEGG 公告(05-16/05-21)
2011-07  学术 FTP 订阅制启动(NPO Bioinformatics Japan)
2012-03  Kanehisa 退休,以特任教授身份继续领导
2014    DGROUP(DG 编号)
2016    RPAIR 停用(2004 年问世的反应对概念并入 RCLASS 体系)
2017    NETWORK / VARIANT(N 编号)
2021    ENVIRON(E 编号)停用
2024-07  新商业许可框架
2025-12  官方 KO 分配统计:6,087 万蛋白 52.7% 已赋 KO
2026    重组为 23 种数据对象 / 13 数据库;KEGG Syntax 发布

读表提示:这张年代表同时解释了三件事的因果——为何 2011 年是分水岭(BIRD 计划改组 + 退休临近 → 订阅制)、为何 KO 是体系演进的标志(2002-2003 上线即接管映射)、为何许可条款需要按时间区分解读(1999 商业化、2011 学术订阅、2024 新框架三段合同环境并存)。引用任一时间点前后的 KEGG 行为时,先在这张表上定位所处阶段。


附录 G 已核实标识符速查

本词条来源中确认过语义的 KEGG 标识符,可安全用于练习与测试(完整清单以官方 weblinks 文档为准):

标识符 语义确认 来源
map00010 / ko00010 / rn00010 糖酵解/糖异生通路三视图 WebLinks;第三方教程
hsa04930 人类 2 型糖尿病通路 2011 存档 PDF 官方示例
ko00061 脂肪酸生物合成(KO 视图) Biopython KGML 教程
K00844 hexokinase(己糖激酶 KO) 第三方教程
K00873 官方 WebLinks 示例 KO(语义未标注) WebLinks
hsa:3098 / hsa:3099 / hsa:3101 人类三个己糖激酶基因 第三方教程
C00118 3-磷酸甘油醛(GAP) 第三方教程
C00022 官方 WebLinks 示例化合物 WebLinks
D00584 DRUG 库条目(ddi 操作示例) WebLinks
H00004 DISEASE 库条目示例 2011 存档 PDF
T01001 人类基因组(hsa) 2011 存档 PDF

使用注意:以上 ID 的语义以官方条目页实时显示为准,个别条目可能随策展修订(例如 KO 的 EC 关联变化);"语义未标注"表示本次检索来源仅确认其为合法示例 ID、未确认具体内容,勿在正式分析中假设其含义。第三方教程来源的 ID 建议(如 K00844)虽与常识相符,仍应在产出物中回链官方条目页完成最终确认。


附录 H 体例与评分规则说明

  • 坑点编号:全文统一"坑点 N"写法(N = 1-8),每条采用 问题/症状/解决/参考 四段式;"解决"固定给出 简单方法/进阶方法/SOTA 方法 三档,分别对应最低成本止损、工程化治理与最优实践。
  • DAIMS 计分:✅=1、⚠️=0.5、❌=0,满分 24;"不适用"项按其性质计入 ✅(对数据质量无损害)或 ❌(官方未提供且损害就绪度),判定理由写入对应行说明。
  • 规模数字:全部数字带时间戳与来源(附录 A);两个时点数字不比较、不外推;"约"字仅用于官方使用量级表述(如物种约 1.09 万)。
  • URL 规范:正文引用官方文档与文献 DOI 均为真实可核查地址;schema_org 结构化数据中的本站条目地址以发布占位符形式书写(发布时由管线替换)。
  • 术语:中文正文首次出现的外文缩写附全称;KEGG 自有词汇(KO/KGML/BRITE 等)保持官方拼写,不强行意译。
  • 免责:本词条不构成使用 KEGG 的法律意见;许可条款执行细节以 KEGG 官方与 Pathway Solutions 书面确认为准。
  • 坑点与 DAIMS 的关系:坑点是"怎么避免踩坑"(过程视角),DAIMS 是"这份数据拿来能到几分"(状态视角);两者互为索引——每个 ⚠️/❌ 项在 §7 都有对应治理方案。
  • 更新约定:本词条按年度复核;期间 KEGG 官网结构、许可价格或规模口径出现重大变化时,优先更新 §1.2 规模表、§3.1 库清单与 §5 许可节,并同步附录 A/D。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • uniprot — 共享标签:基因组学与多组学 / 测序数据 / 蛋白质组学
  • pride — 共享标签:基因组学与多组学 / 蛋白质组学
  • proteomexchange — 共享标签:基因组学与多组学 / 蛋白质组学
  • string — 共享标签:基因组学与多组学 / 蛋白质组学
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据
  • hmp — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集