MSigDB 分子特征数据库 — AI-Ready Wikipedia

35,361 个人类基因集 · 17,068 个小鼠基因集 · 50 个 Hallmark:GSEA 富集分析二十年的标准底座

来源 https://www.gsea-msigdb.org/gsea/msigdb发布时间: 2026-09-20最后更新: 2026-09-25 阅读 26
MSigDB 分子特征数据库 — AI-Ready Wikipedia

信息速览

数据集名称MSigDB 分子特征数据库 — AI-Ready Wikipedia
数据类型35,361 人类基因集,17,068 小鼠基因集,50 Hallmark,CC BY 4.0,GSEA 标准底座
规模不适用(基因集/通路注释数据;无人类患者数据)
接入方式https://www.gsea-msigdb.org/gsea/msigdb
AI 就绪度

MSigDB — 分子特征数据库 AI-Ready Wikipedia

INFOBOX

项目 内容
全名 Molecular Signatures Database(MSigDB,分子特征数据库)
维护机构 UC San Diego + Broad Institute(联合项目;NIH NCI 资助 U24CA220341)
创立 2005(随 GSEA 方法论文 PNAS 102:15545-15550 诞生)
当前版本 Human v2026.1.Hs / Mouse v2026.1.Mm(2026-01-30;Ensembl 115)
人类规模 35,361 个基因集(九大集合 H+C1-C9)
小鼠规模 17,068 个基因集(MH+M1/M2/M3/M5/M7/M8)
旗舰集合 H Hallmark 50(4,022 founders 提炼;Liberzon 2015)
本体集合 C5 16,283(GO 10,490:BP 7,538/CC 1,080/MF 1,872 + HPO 5,793)
免疫集合 C7 5,219(ImmuneSigDB 4,872 + VAX 347);M7 787(2025.1 新增)
数据格式 GMT / GRP / XML / JSON / TSV / JSON bundle / SQLite
标识符 HGNC(Human)/ MGI(Mouse)符号 或 NCBI Entrez ID
许可 数据 CC BY 4.0(© 2004-2026 Broad/MIT/UC);GSEA 软件 BSD-style
配套方法 GSEA / ssGSEA / GSVA / fgsea / camera / fry / singscore
官方入口 https://www.gsea-msigdb.org/gsea/msigdb
本库条目 order 483 · record_id 583 · 类别:基因组学与多组学 × 药物发现与化学

§0 E-E-A-T 信任声明与免责声明

  • 经验:本条目基于 MSigDB 官网(首页/Collections 页/Human 与 Mouse 浏览页/gene set 详情页)、Release Notes(2024.1/2025.1/2026.1)、msigdbr Changelog 与 Bioconductor msigdb 包文档核对;集合数全部标注版本口径。
  • 专业性:Hallmark 提炼方法论依据 Liberzon 2015 Cell Systems 原文;GSEA 方法依据 Subramanian 2005 PNAS;Mouse 构建机制依据 Castanza 2023 Nature Methods 与 Bioconductor 文档;许可例外(BioCarta/KEGG)依据官方 license 页与包文档原文。
  • 权威性:MSigDB 为 UC San Diego 与 Broad Institute 官方资源、GSEA 富集分析的事实标准;本条目为第三方百科解读,不替代官方文档与各来源数据库的原始许可。
  • 可信度:文内数字进入文末「口径存照」;v2026.1 与 v2025.1/2024.1 的口径差异(C9 新增、M7 新增)已显式标注。
  • 免责:基因集是"生物学状态的语言学封装"而非因果图——富集结果依赖输入排序质量与集合选择;使用 MSigDB 发表需按官方引用规范(2005 PNAS 必引)。
  • 时效:口径锁定 2026-09-19/20(v2026.1 发布后);下一次发布以官网为准。

§1 数据集概览

§1.0 📌 30 秒速览

  1. 是什么:UC San Diego 与 Broad Institute 维护的注释基因集库——把"通路、本体、扰动签名、免疫状态、细胞类型"翻译成基因列表,供 GSEA 及其变体消费。
  2. 多大:Human v2026.1 共 35,361 个基因集(九大集合);Mouse v2026.1 共 17,068 个。
  3. 为什么重要:GSEA 是转录组分析引用量最高的方法之一(2005 PNAS 论文数万次引用)——MSigDB 是它的事实标准底座;绝大多数富集分析论文的通路结果最终都能溯源到这里。
  4. 怎么用:CC BY 4.0(免费注册后下载 GMT/SQLite)→ fgsea/clusterProfiler/GSVA 直接消费 → 得到通路活性。
  5. 一句话:如果你有一张排序的基因表,MSigDB 决定了你说的"这条通路富集了"到底是什么意思。

§1.1 摘要

MSigDB(Molecular Signatures Database)是 UC San Diego 与 Broad Institute 的联合项目,为 GSEA(Gene Set Enrichment Analysis)软件提供注释基因集。它把分子生物学知识组织成"基因集"单元:一条通路(Reactome 的某一步骤)、一个本体术语(GO:BP/CC/MF、HPO 表型)、一个扰动签名(某个基因被敲除/过表达/药物处理后上调与下调的基因)、一种免疫细胞状态、一种单细胞类型 marker、甚至一段染色体细胞遗传带。

Human v2026.1.Hs(2026-01-30 发布,基因数据对齐 Ensembl 115)含 35,361 个基因集,分九大集合:H(Hallmark,50 个"提炼集"——从 C1-C6 的 8,380 个集合经聚类与人工评审得到 50 个生物学主题)、C1(positional,302 个染色体带集合)、C2(curated,7,670 个精选通路与扰动集合,内含 Reactome 1,839、WikiPathways 925、KEGG MEDICUS 658、BioCarta 292、PID 196 等子集)、C3(regulatory,3,714 个转录因子/miRNA 靶点集合)、C4(computational,1,006 个癌症数据挖掘集合)、C5(ontology,16,283 个 GO 10,490 + HPO 5,793)、C6(oncogenic signatures,189)、C7(immunologic signatures,5,219:ImmuneSigDB 4,872 + 疫苗响应 VAX 347)、C8(cell type,866 个单细胞 marker 集合),以及 2026 年 1 月新增的 C9(computational perturbation signatures,62 个癌基因依赖转录签名)。

Mouse v2026.1.Mm 同步发布,含 17,068 个集合(MH 50、M1 341、M2 2,771、M3 2,047、M5 10,839、M7 787、M8 ~233);M7 免疫集合于 2025.1 引入,全部 787 集来自 Mouse Immune Dictionary(Cui et al. 2023)。Mouse 集合多数经 MGI 同源映射从 Human 翻译,M1/M5 因物种特异性重建。

许可为 CC BY 4.0(© 2004-2026 Broad Institute, Inc., MIT 与 UC Regents),GSEA 软件开源(BSD-style);两个许可例外要记牢:BioCarta 子集带独立免责声明、KEGG 子集受 KEGG 许可限制(Bioconductor 分发不含)。下载需免费注册(邮箱,用于资助报告)。数据格式覆盖 GMT(GSEA 原生)、GRP、XML、JSON、TSV、整库 JSON bundle 与 SQLite 单文件库,标识符提供 HGNC/MGI 符号与 NCBI Entrez 双版本。

§1.2 战略价值

  1. 富集分析语义的"货币":全世界说"这条通路富集了"时,多数场景里的"通路"就是 MSigDB 里的一个基因集——它定义了转录组学十几年来的公共语义;语义统一的价值超过集合本身。
  2. Hallmark 的"提炼工程":面对 3 万+ 集合的冗余海啸,50 个 Hallmark 用计算 + 人工混合方法把 4,022 个 founder 压缩成 50 个协调表达主题——这是"知识库降噪"的教科书案例。
  3. 转录响应知识的资产化:CGP 子集(3,555 个化学/遗传扰动签名)把二十年 GEO 微阵列实验的扰动响应变成可复用结构化数据——单组学时代的"扰动知识图谱"。
  4. 单细胞时代的桥接:C8/M8 把单细胞簇 marker 变成 bulk 富集可消费的基因集——bulk 与单细胞两种世界因此能对话。
  5. 许可清晰的再分发:CC BY 4.0 + 明确例外(BioCarta/KEGG)——工具链(Bioconductor/CRAN/Python 包)得以零摩擦集成,这是它成为"事实标准"的工程前提。

§1.3 同类数据集横向对比

维度 MSigDB Reactome KEGG GO WikiPathways
性质 基因集聚合库(含他源) 单一通路数据库 通路+疾病+药物 本体 社区通路
集合粒度 万级(多源混合) 千级(结构化反应) 数百级 万级(术语) 千级
上游 文献/数据库/计算 自建 curator 团队 京都大学团队 GO 联盟 社区编辑
配套方法 GSEA 生态 自家分析+可入 MSigDB 自家工具 语义推理 富集
许可 CC BY 4.0(例外:KEGG/BioCarta) CC BY 4.0 非商业限制(KEGG) CC BY 4.0 CC BY 4.0
更新节奏 年度-半年 持续 持续(月) 持续(月) 持续
  1. MSigDB 是"层"不是"源":它把 Reactome/KEGG/GO 等源数据库"扁平化"为基因集——分析者用 MSigDB 免去逐库格式适配;但版本滞后于上游是代价。
  2. KEGG 的双重身份:MSigDB 里 KEGG_MEDICUS(658)是新一代,KEGG_LEGACY(186)标注为 legacy——KEGG 本身的许可限制不随 CC BY 4.0 扩散。
  3. 与 GSVA/fgsea 的关系:这些是分析方法(消费方),MSigDB 是数据(供给方)——"GSEA 方法 + MSigDB 数据"组合是完整工作流。

§1.4 版本时间轴

时间 里程碑
2003 Mootha et al. Nat Genet(GSEA 前身方法,人类线粒体疾病应用)
2005 Subramanian et al. PNAS 102(43):15545-15550——GSEA 方法论文 + MSigDB 诞生
2011 Liberzon et al. Bioinformatics——MSigDB 3.0(规范化集合结构)
2015 Liberzon et al. Cell Systems 1(6):417-425——Hallmark collection 方法论
2020-09 v7.2 时代(v7.2.Hs 口径)
2023-09 Castanza et al. Nature Methods——Mouse MSigDB 原生化(doi 10.1038/s41592-023-02014-7)
2024-08-09 MSigDB 2024.1:GO/Reactome/WikiPathways 更新;Ensembl 112
2025-03-08 GSEA 4.4.0(Java 21 运行时)
2025-06-06 MSigDB 2025.1:Mouse M7 免疫集合引入(787 sets,Mouse Immune Dictionary);Ensembl 114
2026-01-30 MSigDB 2026.1:Human C9 扰动签名集合引入(62 sets,癌基因依赖);Ensembl 115

§1.5 应用场景矩阵

场景 用什么集合 典型动作
bulk RNA-seq 差异表达解读 H 或 C2:CP fgsea/clusterProfiler 富集 + leading edge 分析
单样本通路活性 H/C2 ssGSEA/GSVA 打分 → 样本 × 通路矩阵 → 建模
药物机制研究 C2:CGP + C6 药物扰动签名 ↔ 疾病签名反向富集
免疫浸润/免疫治疗 C7/M7 免疫签名打分 + TME 分析
单细胞注释 C8/M8 marker 集 overlap → 细胞类型标签
罕见病/表型 C5:HPO 表型 → 基因集 → 候选基因
TF/miRNA 调控推断 C3 靶点集合富集 → 上游调控因子假设
染色体区域效应 C1 细胞带集合 → CNV 区域活性

§1.6 组件全景

  • H Hallmark:50 个提炼集——多数分析的默认起点;
  • C1 位置:302 个细胞遗传带集合——CNV/区域效应;
  • C2 精选:7,670 = CGP 3,555(扰动)+ CP 4,115(通路:Reactome 1,839/WikiPathways 925/KEGG_MEDICUS 658/BioCarta 292/PID 196/KEGG_LEGACY 186);
  • C3 调控:3,714 = MIR 2,598(miRDB 2,377 + legacy 221)+ TFT 1,116(GTRD 506 + legacy 610);
  • C4 计算:1,006 = 3CA 148 + CGN 427 + CM 431;
  • C5 本体:16,283 = GO 10,490(BP/CC/MF)+ HPO 5,793;
  • C6 癌症签名:189 个癌基因扰动 microarray 签名;
  • C7 免疫:5,219 = ImmuneSigDB 4,872 + VAX 347;
  • C8 细胞类型:866 个单细胞 marker 集;
  • C9 扰动签名:62 个(2026.1 新增,癌基因依赖转录响应);
  • Mouse 侧:MH/M1/M2/M3/M5/M7/M8(17,068)。

§1.7 Hallmark:知识库降噪的教科书工程

Liberzon 2015 描述的方法论(Cell Systems):

C1-C6 全库 8,380 个 gene sets
        │ 按成员基因重叠聚类
        ▼
     600 clusters
        │ 人工评审(专家赋主题)
        ▼
  43 clusters → 50 个生物学主题
(7 个异质性 cluster 各分两个主题)
        │ founder 并集 → raw set
        ▼
 表达数据中不区分表型的基因剔除
        │ 只保留协调表达成员
        ▼
   50 个 HALLMARK_* gene sets
(founder 来源 4,022 个原集合)

每个 hallmark 的语义是"well-defined biological state/process + coherent expression"——例如 HALLMARK_APOPTOSIS 不是"文献里所有凋亡相关基因",而是"在多种扰动数据中协调响应凋亡程序的基因核心"。这一步"计算聚类 + 人工命名 + 表达验证"的三段式,是后来所有"精简集"(如 DoRothEA regulons 分级)的方法学模板。

§1.8 GMT 格式速记

GMT(Gene Matrix Transposed)每行一个基因集:

HALLMARK_APOPTOSIS<TAB>Gene set in GSEA analysis...<TAB>AKT1<TAB>BAX<TAB>...(基因列表)
       ↑名称(唯一键)           ↑描述(简短)                ↑成员基因(HGNC 符号)
  • 全部行数 = 集合总数;tab 分隔;无表头;
  • 变体:GRP(单集合纯列表)、GMX(列式)、XML/JSON(带完整元数据);
  • SQLite 版把 GMT 扁平表化(gene_set/gene 对 + 元数据)——SQL 消费最方便。

§1.9 独特视角:基因集是"可执行的生物学摘要"

MSigDB 的每个基因集都是一段生物学知识的可执行封装:“凋亡程序”、“E2F 靶点”、“IL6-JAK-STAT3 信号”。这种封装让统计检验可以直接在"知识单元"层运行——它是转录组学从"基因列表"走向"机制语句"的关键一步。AI 时代它的价值进一步放大:通路活性矩阵(样本 × 基因集)是天然的低维语义空间,比原始 2 万基因表达更适合作为下游模型的特征层。

§2 医学与科学背景

§2.1 从单基因到基因集的范式转变

微阵列/RNA-seq 时代的困境:差异表达给出数千个基因的排序,但单个基因的变化常常温和且不独立——疾病扰动的是"程序"而非"单个基因"。功能类评分(FCS)思想:把基因按排序聚合到知识单元(通路/本体),检验单元层的协调变化。GSEA(Subramanian 2005)是 FCS 的里程碑实现:全排序 + 加权富集得分 + 排列检验 + leading edge 提取。

§2.2 GSEA 方法要点

  1. 输入:全部基因按统计量排序(不是阈值筛选后的清单)——避免"阈值敏感";
  2. 富集得分(ES):沿排序走一遍,集合成员命中 +权重、非成员 - 权重,最大偏移即 ES;归一化 NES;
  3. 显著性:基因集置换/排列检验(排布保持基因相关结构);
  4. leading edge:贡献 ES 的成员子集——机制的"前锋"基因;
  5. 变体:ssGSEA(单样本打分)、GSVA(样本级通路活性矩阵)、fgsea(R 快速实现)、camera/fry(limma 家族,考虑基因间相关)。

§2.3 富集统计的陷阱语义

  • competitive vs self-contained:多数富集检验是 competitive(该集合基因 vs 其它基因),假设基因独立——但基因间相关会膨胀 I 类错误(camera 为此校正);
  • 集合大小效应:超小集合方差大、超大集合稀释——惯例过滤(10 ≤ size ≤ 500);
  • 多重检验:FDR(Benjamini-Hochberg)为默认——但集合间相关使 BH 保守性变化;
  • 排序指标选择:log2FC 排序 vs signed -log10(p) 排序 vs Wald z 排序——结果可差很大,报告须声明。

§2.4 C2:CGP 扰动签名的医学语义

3,555 个 CGP 集合大多成对出现(xxx_UP / xxx_DN):某基因过表达/敲除/药物处理后上调或下调的基因。医学用途:

  1. 机制映射:疾病签名与扰动签名重叠 → 提示疾病模块被该通路/药物影响;
  2. 药物再利用:药物签名"逆转"疾病签名(Connectivity Map 思想的 MSigDB 版本);
  3. 致癌通路激活:C6(189 个 oncogenic signatures)直接来自癌症基因扰动的 microarray 数据。

注意其局限:单细胞系、单时间点、microarray 平台——签名是"条件性事实"。

§2.5 C7/M7 免疫集合与免疫肿瘤学

  • ImmuneSigDB(4,872):免疫细胞谱系/状态/扰动的表达签名(GSEAs 平台系统化产出);
  • VAX(347):疫苗响应签名——接种前后转录变化;
  • Mouse M7(787):Mouse Immune Dictionary(Cui et al. 2023)——小鼠免疫细胞状态的系统词典;2025.1 引入使小鼠免疫学分析不再依赖人源映射。

应用:肿瘤免疫微环境(TME)解卷积、免疫治疗响应预测、疫苗免疫监测研究。

§2.6 C5:HPO 表型-基因集的罕见病语义

C5 的 HPO 子集(5,793)把人类表型本体术语展开为关联基因集:“肾功能异常”、"感音神经性聋"各成一个集合。罕见病工作流:患者表型 → HPO 编码 → 对应基因集与患者外显子组排序基因的富集/重叠 → 候选基因。这与 Exomiser 类工具的语义一致——MSigDB 把这种"表型侧信息"提供给富集框架。

§2.7 C8/M8:单细胞与 bulk 的桥

C8(Human,866)与 M8(Mouse)来自单细胞测序研究的簇 marker:一个集合 = 一种细胞类型的 marker 基因。bulk 样本经 C8 富集/打分 → 细胞组成推断(与 CIBERSORT/xCell 类思想互补);单细胞数据反过来用 C8 做跨研究标签传递。

§2.8 C3 调控靶点与上游因子推断

  • MIR(2,598):miRNA seed 序列靶点预测(miRDB v6.0 主力 + legacy)——miRNA 活性推断(批量靶点的协调下调 = 该 miRNA 激活证据);
  • TFT(1,116):转录因子结合位点靶点(GTRD ChIP-seq 预测,TSS -1000/+100 bp 窗口 + legacy)——TF 活性推断。

与 DoRothEA/VIPER 等 regulon 资源的分工:C3 是"位点证据"层,DoRothEA 是"置信分级"层——两者可互校。

§2.9 C1 位置集合与染色体效应

302 个集合对应人类染色体细胞遗传带(如 chr1p36)——区域效应分析:CNV 片段内基因的协调变化常是"位置效应"而非通路效应。C1 在富集中作为"阴性对照/背景结构"使用可防止把 CNV 误读为通路激活——这是肿瘤数据分析的隐蔽坑。

§2.10 富集方法家族的对比语义

方法 框架 输入 相关性处理 何时用
经典 GSEA FCS(competitive) 全排序 置换检验保持基因相关 全排序 + 需 leading edge
fgsea GSEA 的多级近似实现 全排序 同 GSEA R 管线默认(快)
GSVA 单样本打分 表达矩阵 无(打分层) 特征工程/无组设计
ssGSEA 单样本排序打分 表达矩阵 无 快速打分/跨平台
camera FCS(competitive+correction) 全排序 基因间相关校正 相关结构明显的数据
fry 残留旋转检验 表达矩阵 有 limma 生态小样本
ORA(超几何) 过表达分析 阈值清单 无 只有清单时(降级使用)
singscore 秩打分 表达矩阵 无 签名评分/单细胞

选择纪律:有全排序 → fgsea/camera;要样本级特征 → GSVA/ssGSEA;只有基因清单 → ORA(并声明其局限);报告方法名 + 参数 + 集合版本。

§3 数据集规格

§3.1 规格总表

项目 规格
数据库名 Molecular Signatures Database(MSigDB)
维护方 UC San Diego + Broad Institute
资助 NIH NCI(U24CA220341)
当前版本 Human v2026.1.Hs / Mouse v2026.1.Mm(2026-01-30)
基因数据 Ensembl 115
Human 集合数 35,361(H + C1-C9 九大集合)
Mouse 集合数 17,068(MH + M1/M2/M3/M5/M7/M8)
Hallmark 50(Human H 与 Mouse MH 同步)
最大集合 C5 ontology 16,283(GO 10,490 + HPO 5,793)
格式 GMT/GRP/XML/JSON/TSV/JSON bundle/SQLite
标识符 HGNC/MGI 符号 或 NCBI Entrez ID
注册 免费注册后下载(邮箱)
许可 数据 CC BY 4.0;GSEA 软件 BSD-style
例外 BioCarta 子集免责;KEGG 子集许可限制
引文 Subramanian 2005 PNAS 必引 + 按需 Liberzon 2011/2015、Castanza 2023
官方入口 https://www.gsea-msigdb.org/gsea/msigdb

§3.2 数据发布口径的地图

  1. 版本命名:年份.序号(2024.1 → 2025.1 → 2026.1);Human 加 .Hs、Mouse 加 .Mm 后缀——引用必须带全(如 v2026.1.Hs)。
  2. 集合数滚动:35,361(v2026.1.Hs)随每次发布变化——历史论文中的"31,322"(v7.5.1)或"33,196"是当时口径,不可直接对比。
  3. Ensembl 对齐:基因数据随 Ensembl 年度更新(2024.1→112、2025.1→114、2026.1→115)——ID 映射表的版本也是口径的一部分。
  4. 双物种口径:Human 与 Mouse 分别计数与发布;Mouse 集合 ≠ Human 集合的直译(M1/M5 重建、M7 独立来源)。
  5. 新集合的版本戳:M7(2025.1 引入)、C9(2026.1 引入)——版本历史在 gene set 页面可查(如 CUI_ILC_IL15_RESPONSE_UP “2025.1.Mm: First Introduced”)。

§3.3 DAIMS 数据AI就绪度评估

# 维度 指标 评分(1-5) 依据
1 A 可获得 免费获取 4 CC BY 4.0;下载需免费注册(邮箱)
2 A 可获得 获取流程 4 网页逐集 + 全量 GMT 包 + SQLite;无匿名 FTP
3 A 可获得 分发格式 5 GMT/GRP/XML/JSON/TSV/JSON bundle/SQLite 全覆盖
4 A 可获得 历史版本回溯 4 release notes 完整;旧版直接下载入口一般
5 D 文档 官方文档 5 集合详情页/方法指南/Data Formats/培训
6 D 文档 方法透明度 5 Hallmark 方法论论文 + 每集合 attribution
7 D 文档 引用规范 5 官网明确引文组合(2005 必引+按需)
8 I 互操作 标识符 FAIR 4 HGNC/MGI/Entrez 双轨;符号改名静默漂移
9 I 互操作 本体对齐 5 GO/HPO 原生内嵌;来源数据库全标注
10 I 互操作 跨资源整合 5 R/Python 生态全接入(msigdbr/fgsea/GSVA)
11 M 元数据 参数元数据 4 集合名/描述/来源/版本;成员级证据分层弱
12 M 元数据 版本元数据 5 版本历史 per gene set + Ensembl 对齐戳
13 S 可持续 治理机制 5 UCSD+Broad 双机构;NCI 资助;20+ 年连续
14 S 可持续 资源持续供给 5 GSEA 生态标准地位;年度发布稳定

综合 63/70(4.5/5)——格式与生态互操作是满分项(SQLite/JSON/多语言包全接);扣分在注册墙与符号漂移两个工程细节。

§3.4 存储与计算需求

  1. 全量体积:GMT/JSON 全库数十 MB 级(压缩);SQLite 单文件——笔记本全装无压力。
  2. 内存:35,361 集全量入内存做富集(fgsea)< 2 GB——单机全谱分析完全可行。
  3. 打分矩阵:GSVA/ssGSEA 输出为样本 × 集合矩阵(如 5,000 样本 × 10,000 集合 = 千万级单元格)——列存格式(Parquet)推荐。
  4. 置换计算:GSEA 排列检验(1,000 次)在大集合多集合时计算上升——fgsea 的多级近似把成本压到秒级。
  5. 注册与合规:注册一次后脚本内使用本地快照——避免分析中途重下导致版本漂移。

§3.5 获取通道

  1. 网页浏览:Browse by collection/name、Search by keyword、gene set 详情页(成员/来源/版本历史/overlap 工具/表达谱视图)。
  2. 下载页:每个集合的 GMT(符号版/Entrez 版)+ JSON bundle;全库 SQLite。
  3. R/Bioconductor:msigdb 包(ExperimentHub,GeneSetCollection 对象;KEGG 需 appendKEGG());msigdbr(CRAN,tibble,多物种 ortholog)。
  4. GSEA desktop / GenePattern:图形界面运行 GSEA/ssGSEA(Java;4.4.0 需 Java 21)。
  5. Python 生态:gseapy(fgsea 算法 Python 实现 + msigdbr 数据桥)、decoupler(集合打分)。
  6. NDEx:gene set 以网络形式导出互动查看。

§3.6 口径对齐表

数字 口径 A 口径 B 使用建议
Human 总集数 35,361(v2026.1.Hs) 31,322(v7.5.1)/33,196(v7.x) 永远带版本号
Mouse 总集数 17,068(v2026.1.Mm) 2025.1 前无 M7 版本戳
Hallmark 50(H 与 MH 同构) “数百个癌症集合”(C6 189) 50 是精选不是全部
GO 集合 10,490(C5:GO) GO 官网 4 万+ 术语 MSigDB 只收有基因注释的术语
免疫集合 C7 5,219(Human) M7 787(Mouse) 数字悬殊是来源不同
扰动签名 C2:CGP 3,555 C9 62(计算扰动) 来源与粒度不同

§3.7 版本选择纪律

  1. 新分析:用当前版(v2026.1)——除非复现旧结果。
  2. 方法学三元组:MSigDB 版本 + 标识符版本(HGNC 日期/Ensembl 版)+ 集合过滤规则——写入论文方法节。
  3. 跨版本对比:gene set 页的 Version history 查集合级变更;集合成员 diff 是跨版本比较的前置动作。
  4. 快照存档:下载即存(文件名带版本)——分析中途不重下。
  5. Mouse 独立口径:不要用 Human v2026.1.Hs 配 Mouse v2025.1.Mm——双物种版本对齐。

§3.8 数据文件与字段详表

数据面 粒度 关键字段
GMT 文件 每集合一行 name、description、成员基因(符号/Entrez)
JSON bundle 每集合一对象 name、systematicName、pmid、sourceDatabase、description、geneSymbols、msigdbVersion
SQLite 基因集×基因 对 gene_set、gene、collection、subcollection、version
gene set 详情页 每集合 成员表(符号/Entrez/描述)、来源文献、贡献者、平台命名空间、版本历史、overlap 工具、表达谱
Release notes 每 release 新增/更新集合清单、Ensembl 版本、集合数变化
Mouse 侧 同上 + mapping 方式(MGI ortholog vs native rebuild)

§4 数据结构

§4.1 对象模型

MSigDB(版本 v2026.1)
├── Human(.Hs)
│   ├── H(50)      hallmark:提炼集
│   ├── C1(302)    positional:细胞遗传带
│   ├── C2(7,670)  curated:CGP 3,555 + CP 4,115
│   │       └── CP 子集:REACTOME/WIKIPATHWAYS/KEGG_MEDICUS/BIOCARTA/PID/KEGG_LEGACY
│   ├── C3(3,714)  regulatory:MIR 2,598 + TFT 1,116
│   ├── C4(1,006)  computational:3CA/CGN/CM
│   ├── C5(16,283) ontology:GO:BP/CC/MF + HPO
│   ├── C6(189)    oncogenic signatures
│   ├── C7(5,219)  immunologic:ImmuneSigDB + VAX
│   ├── C8(866)    cell type signatures
│   └── C9(62)     computational perturbation signatures(2026.1 新增)
└── Mouse(.Mm)
    ├── MH(50)     ortholog hallmark
    ├── M1/M2/M3/M5  物种特异或映射
    ├── M7(787)    免疫词典(2025.1)
    └── M8           单细胞类型

§4.2 下载与 GMT 解析(Python)

#!/usr/bin/env python3
"""MSigDB GMT 下载与解析(以 Hallmark 为例)
官方下载页:https://www.gsea-msigdb.org/gsea/downloads.jsp
(免费注册后可获得直接下载链接;此处示例本地已有 GMT 文件)
"""
from pathlib import Path

def read_gmt(path: str) -> dict[str, tuple[str, list[str]]]:
    """GMT → {gene_set: (description, genes)}"""
    out = {}
    for line in Path(path).read_text().splitlines():
        if not line.strip():
            continue
        parts = line.split("\t")
        out[parts[0]] = (parts[1], [g for g in parts[2:] if g])
    return out

h = read_gmt("msigdb_v2026.1.Hs_H.txt")
print("Hallmark 集数:", len(h))                      # 50
name, genes = h["HALLMARK_APOPTOSIS"]
print("HALLMARK_APOPTOSIS:", len(genes), "genes")    # 典型 ~160
print("样例成员:", genes[:5])

§4.3 msigdbr 全库获取(R/Python 双轨)

#!/usr/bin/env python3
"""gseapy 内置 msigdbr 数据桥(Python)"""
import gseapy as gp

# 全部 Human 集合(tibble 形式)
df = gp.get_library_name()                 # 可用库列表(版本随 gseapy 打包)
h = gp.get_library("MSigDB_Hallmark_2020") # Hallmark
c5 = gp.get_library("MSigDB_Gene_Ontology")
print("Hallmark 集数:", len(h))

# 富集分析一行流(enrichr 后端)
enr = gp.enrichr(gene_list=["TP53","BAX","CASP3","BCL2","FAS"],
                  gene_sets="MSigDB_Hallmark_2020",
                  outdir=None)
print(enr.res2d[["Term","Adjusted P-value","Overlap"]].head())
# R 侧:msigdbr + fgsea 标准管线
library(msigdbr); library(fgsea)
mdf <- msigdbr(species = "Homo sapiens", category = "H")   # Hallmark
pathways <- split(mdf$gene_symbol, mdf$gs_name)
stats  <- rnorm(20000, sd = 2); names(stats) <- sprintf("GENE%d", 1:20000)
fg <- fgseaMultilevel(pathways, stats, minSize = 15, maxSize = 500)
fg[order(fg$pval), ][1:5, c("pathway", "NES", "pval", "padj")]

§4.4 GSVA 通路活性矩阵构建

#!/usr/bin/env python3
"""GSVA:样本 × 通路活性矩阵(AI 特征化核心步骤)"""
import pandas as pd
from gsva import gsva   # 或 R: GSVA::gsva()

# expr: DataFrame(基因 × 样本),index 为 HGNC 符号
# pathways: {gene_set: [genes]}
act = gsva(expr, pathways, method="gsva", min_sz=15, max_sz=500)
# act: DataFrame(通路 × 样本)——后续可直接接 ML 管线
act.T.to_parquet("pathway_activity.parquet")
print(act.shape)   # (集合数, 样本数)

§4.5 Hallmark 与全库的集合选择策略

def choose_collections(analysis_goal: str) -> list[str]:
    """场景 → 集合选择策略(减少多重检验与语义稀释)"""
    map_ = {
        "差异表达解读":  ["H", "C2:CP"],          # 主题级 + 通路级
        "药物机制":      ["C2:CGP", "C6"],        # 扰动签名
        "免疫分析":      ["C7"] if True else ["M7"],
        "细胞组成":      ["C8"],
        "表型-基因":     ["C5:HPO"],
        "调控推断":      ["C3"],
        "全谱探索":      ["H", "C2", "C5", "C7"],  # 慎用:多重检验翻倍
    }
    return map_.get(analysis_goal, ["H"])

# 纪律:每加一个集合,FDR 负担翻倍——"H first, expand only with reason"

§4.6 Overlap 与集合冗余检测

#!/usr/bin/env python3
"""集合间重叠度:识别"伪独立"的重复集合"""
import itertools
import numpy as np

def jaccard(a: set, b: set) -> float:
    return len(a & b) / max(1, len(a | b))

sets = {k: set(v[1]) for k, v in read_gmt("msigdb_v2026.1.Hs_C2_CGP.txt").items()}
keys = list(sets)[:500]   # 抽样演示
J = np.zeros((len(keys), len(keys)))
for i, j in itertools.combinations(range(len(keys)), 2):
    J[i, j] = jaccard(sets[keys[i]], sets[keys[j]])
hi = np.argwhere(J > 0.5)
print("Jaccard>0.5 的集合对数:", len(hi))   # CGP 里大量同源对(xxx_UP/DN 系列等)

§4.7 元数据与可复现指纹

import hashlib, json

fingerprint = {
    "msigdb_version": "v2026.1.Hs",
    "ensembl": 115,
    "identifier": "HGNC_symbol",
    "collections_used": ["H", "C2:CP"],
    "filters": {"minSize": 15, "maxSize": 500},
    "gmt_sha256": hashlib.sha256(open("msigdb_v2026.1.Hs_H.txt","rb").read()).hexdigest()[:16],
}
print(json.dumps(fingerprint, ensure_ascii=False, indent=1))

§4.8 完整性清单

发布/分析即检:

  1. GMT 行数 = 期望集合数(对照 release notes);
  2. 集合名唯一(重复名检测);
  3. 成员符号全部命中当前命名空间(未命中列表人工复核——HGNC 改名漂移);
  4. 集合大小分布报告(<15 与 >500 的比例);
  5. 版本三元组(MSigDB/Ensembl/下载日期)写入指纹。

§4.9 数据血缘

上游来源                      MSigDB 处理            消费方
─────────                    ──────────            ──────
Reactome/WikiPathways/KEGG ─▶ C2:CP 通路集 ─┐
BioCarta/PID                ─▶ C2:CP        │
PubMed 文献扰动实验          ─▶ C2:CGP/C6   ├─▶ GSEA/fgsea/ssGSEA/GSVA
GO/HPO 本体                 ─▶ C5 本体集    │    clusterProfiler/camera/fry
miRDB/GTRD 靶点预测          ─▶ C3 调控集    │    AI 特征层(通路活性矩阵)
ImmuneSigDB/VAX             ─▶ C7 免疫集    │
单细胞簇 marker             ─▶ C8/M8       ┘
Mouse Immune Dictionary     ─▶ M7(2025.1)
癌基因依赖转录响应           ─▶ C9(2026.1)

§4.10 集合过滤与统计指纹(实战代码)

#!/usr/bin/env python3
"""集合大小过滤 + 分析指纹生成(可复现性的最小实现)"""
import json
import hashlib
from collections import Counter

gmt = read_gmt("msigdb_v2026.1.Hs_all.txt")     # §4.2 的解析函数

# 1) 大小过滤(惯例 15-500)
keep = {k: v for k, v in gmt.items() if 15 <= len(v[1]) <= 500}
sizes = Counter(len(v[1]) for v in gmt.values())
print(f"原始 {len(gmt)} 集 → 过滤后 {len(keep)} 集")

# 2) 重复成员检测(完全相同的集合)
seen, dup = {}, []
for k, (_, genes) in gmt.items():
    sig = tuple(sorted(genes))
    if sig in seen:
        dup.append((k, seen[sig]))
    seen[sig] = k
print("完全重复集合对:", dup[:5])

# 3) 分析指纹(写入实验记录/论文补充材料)
fingerprint = {
    "msigdb": "v2026.1.Hs",
    "n_sets_raw": len(gmt),
    "n_sets_used": len(keep),
    "size_filter": [15, 500],
    "gmt_sha256": hashlib.sha256(
        open("msigdb_v2026.1.Hs_all.txt", "rb").read()).hexdigest(),
}
Path("msigdb_fingerprint.json").write_text(
    json.dumps(fingerprint, indent=1))

§5 下游分析协议

§5.1 任务×资源速查表

任务 集合 方法 输出
DEG 结果解读 H + C2:CP fgsea/clusterProfiler 富集表 + leading edge
单样本通路活性 H ssGSEA/GSVA 样本×通路矩阵
药物机制假设 C2:CGP + C6 反向富集(疾病签名 vs 药物签名) 逆转/同向得分
免疫表型 C7/M7 打分 + 解卷积 TME 组成/状态
细胞注释 C8/M8 marker overlap 类型标签
TF/miRNA 活性 C3 靶点集合打分 调控因子活性
罕见病候选 C5:HPO 表型集富集 候选基因表
CNV 区域检查 C1 带集合富集 区域效应报告

§5.2 差异表达 → 通路解读协议

  1. 全基因排序统计量选择(推荐 Wald z 或 signed -log10 p);
  2. 集合选择:H 起步(50 集,多重检验轻)→ 发现弱信号再扩 C2:CP;
  3. 过滤:minSize 15 / maxSize 500;
  4. 富集:fgseaMultilevel(R)或 gseapy(Python);FDR 0.05;
  5. leading edge 提取 → 核心驱动基因清单;
  6. 集合冗余检查:高重叠集合合并解释(如 E2F 系列集);
  7. 报告:版本三元组 + 排序统计量 + 过滤参数。

§5.3 通路活性特征化协议(AI 前置)

  1. 表达矩阵归一化(log/TMM/TPM 决策声明);
  2. GSVA/Hallmark 打分 → 通路活性矩阵(样本 × 50);
  3. 批次校正(如 ComBat)在打分后执行——通路层校正更稳;
  4. 模型输入(分类/生存/聚类)+ 特征重要性 → 通路级解释;
  5. 验证:置换标签 + 跨队列外部验证;
  6. 解读回到基因层:top 通路取 leading edge 溯源。

§5.4 药物-疾病反向富集协议

  1. 疾病签名:病例 vs 对照 top 差异基因(UP/DN 各 N 个);
  2. 药物签名库:C2:CGP 中的 xxx_UP/xxx_DN 对;
  3. 打分:连接性得分(UP 重叠 - DN 重叠);
  4. 逆转候选 = 药物签名与疾病签名反相关的集合;
  5. 文献复核 + 独立队列验证——候选只是假设。

§5.5 失败模式清单

  1. 阈值化输入:用 DEG 清单而非全排序——GSEA 的统计学前提被破坏;
  2. 集合滥用:一次跑 3.5 万集合——FDR 全线 0.9+;从 H 起步;
  3. 未声明排序统计量:log2FC vs z 排序结果不同;
  4. 小集病态:<15 基因的集合假阳性集中;
  5. CNV 混淆:肿瘤数据不查 C1 区域效应——把拷贝数变化当通路激活;
  6. 跨物种直推:Human 集合直接用于小鼠基因符号—— ortholog 映射缺失;
  7. 版本漂移:半年后重跑集合数变了——快照存档;
  8. 冗余误读:高重叠集合被当成独立证据——overlap 检查。

§5.6 校准与验证协议

  1. 阳性对照:已知机制的扰动数据应命中预期集合(如 EGF 刺激 → HALLMARK_EGFR_SIGNALING 类);
  2. 阴性对照:随机排序统计量下的 FDR 分布应为均匀;
  3. 敏感性:minSize/maxSize 扫描 → 结果集合稳定性;
  4. 跨集合家族:H 与 C2:CP 对同一数据的结果一致性检查;
  5. 外部复现:第二队列/GEO 公共数据重跑 → top 集合重现率。

§6 实证结果与方法学分析

§6.1 二十年增长的三段结构

  • 2005-2011(方法期):GSEA 方法 + 初始集合(3.0 版本规范化);
  • 2011-2020(扩张期):C1-C8 陆续成型(v7.x 时代 3 万+ 集合)——冗余问题显现;
  • 2015/2020-2026(提炼与原生化期):Hallmark 提炼(2015)、Mouse 原生化(2023 论文)、M7 免疫(2025)、C9 扰动签名(2026)——从"多"到"精"再到"物种完整"。

§6.2 Hallmark 提炼的实证收益

  • 8,380 → 50:压缩 167 倍,覆盖 C1-C6 的 4,022 个 founder 集合;
  • 多重检验负担从万级降到 50——单次分析的计算与 FDR 成本同步下降;
  • 表达验证剔除"不协调"基因——每集成为"协调响应单元";
  • 后果:H 成为论文方法节的默认选择——"用 Hallmark 做 GSEA"成为可复现短语。

§6.3 集合冗余的实证规模

C2:CGP 中同源集合对大量存在(同一 GEO 数据集的不同截止阈值、UP/DN 对、系列时间点)——Jaccard>0.5 的集合对成百上千。直接全库富集的后果:top 结果被"一个生物学事件 × 十个集合变体"占据。纪律:overlap 检查或从 H 起步。

§6.4 Mouse 原生化的实证意义

Castanza 2023(Nature Methods)之前:小鼠数据研究者的选择是"把数据映射到人类集合"(ortholog 映射损耗)或"不用 GSEA"。之后:M1-M8 原生集合 + M7 免疫词典(2025)——小鼠免疫学研究获得与人类同等的富集基础设施。M1/M5 的"重建而非映射"决策(positional/ontology 物种特异)是方法论诚实:映射只在语义可映射处使用。

§6.5 八个真实坑点

  1. 坑点 1:阈值化输入——把 DEG 清单当 GSEA 输入;全排序才是方法前提。
  2. 坑点 2:全库轰炸——3.5 万集合一次跑完;FDR 稀释 + 冗余淹没;从 H 起步。
  3. 坑点 3:版本不写——"MSigDB 基因集"没有版本号不可复现;写 v2026.1.Hs。
  4. 坑点 4:跨物种直推——Human 集合用于小鼠符号;经 msigdbr ortholog 或用 M 系。
  5. 坑点 5:CNV 当通路——肿瘤数据不做 C1 区域检查;拷贝数区域效应污染结果。
  6. 坑点 6:冗余当独立——高重叠集合的重复命中当多证据;overlap 检查。
  7. 坑点 7:符号漂移——HGNC 改名使成员静默变化;标识符版本入指纹。
  8. 坑点 8:许可例外忽略——BioCarta/KEGG 子集的再分发限制;产品集成前核对。

§6.6 审稿人自查清单

  • [ ] MSigDB 版本(v2026.1.Hs)+ Ensembl 版 + 下载日期?
  • [ ] 排序统计量与方向约定(UP/DN 语义)?
  • [ ] 集合选择及理由(为何 H 而非全库)?
  • [ ] minSize/maxSize 与 FDR 方法?
  • [ ] Mouse 数据用了 M 系或声明 ortholog 映射?
  • [ ] leading edge 成员可溯源?
  • [ ] CNV 数据的区域效应检查?
  • [ ] 引文含 Subramanian 2005(+Castanza 2023 若用 Mouse)?

§6.7 版本治理的方法学含义

年度-半年发布 + Ensembl 对齐使 MSigDB 是"活的语义层":集合成员会因符号改名/来源更新而变化。可复现最小实践:版本三元组 + GMT 文件 SHA256 指纹 + 快照存档。gene set 页的 Version history 是集合级变更的权威记录。

§6.8 与其它本体资源的整合张力

MSigDB 内嵌 GO/HPO,但 C5 是"扁平化"(术语 → 基因集),丢失本体层级与证据码(IEA/EXP)。需要层级感知的分析(如 GO 所有子节点汇总)应回 GO 官方工具(topGO/GOstats);MSigDB 的价值在"跨源统一"不在"本体精读"。同理 HPO 的稀有度与深度信息需回 HPO 官方。

§6.9 集合语义的解读纪律

  • C2:CP 是"专家版通路快照":Reactome 集合是上游版本的投影——引用机制细节回 Reactome 官网;
  • CGP 是"条件性签名":xxx_UP 是"该扰动下上调"不是"该通路基因";
  • H 是"协调响应核心":成员经表达验证,不是文献全收;
  • C8 是"簇 marker":一个集合一种细胞类型,但 marker 跨研究不总一致。

§7 AI 就绪指南与应用场景

§7.1 MSigDB 在医疗 AI 中的四种喂法

  1. 特征工程:GSVA/ssGSEA → 样本 × 通路活性矩阵 → 低维语义特征(50 Hallmark 特征往往优于 2 万基因特征);
  2. 先验结构:基因集作为图/模型先验(通路约束的神经网络、group lasso 的组结构);
  3. 解释层:基因级模型的输出聚合到通路层——模型解释从"基因重要性"升维到"机制语句";
  4. 标签源:C6/CGP 扰动签名做弱监督("该样本像 MYC 激活"分类器)。

§7.2 通路活性挖掘管线实操配方

表达矩阵(基因×样本)→ 归一化 → GSVA 打分(H/C2:CP)
   → 批次校正 → 通路活性矩阵(Parquet)
   → ML 任务(分类/生存/聚类)→ 通路级特征重要性
   → leading edge 溯源 → 机制假设 → 外部验证

§7.3 模型选型与迁移决策

模型 何时用 注意
group lasso(组=集合) 特征选择 + 通路选择 组间重叠需处理(overlap group lasso)
通路约束 GNN 有基因-通路二部图 用 H 减少节点冗余
GSVA + 梯度提升 小样本表格任务 50-1000 维输入最优
PLM/基因嵌入 有序列/网络信息 通路打分作为协变量融合
弱监督(CGP 标签) 无标注队列 标签噪声显式建模

§7.4 公平性:集合宇宙的覆盖偏倚

MSigDB 继承文献偏倚:癌症/免疫/代谢通路集合远多于罕见病与少数族裔健康研究通路;HPO 集合覆盖临床表型但颗粒不均。AI 后果:通路特征模型对"文献热点疾病"性能好、"冷门表型"失效。对策:per-disease 分桶评测;冷门场景补充原生本体(HPO 官方全量)而非依赖 MSigDB 投影。

§7.5 任务×资源速查表

AI 任务 MSigDB 用法 关键集合 评测要点
表型分类 GSVA 特征 H 跨队列验证
生存预测 通路评分 Cox H+C2:CP C 指数 + 通路稳定性
药物响应 扰动签名特征 C2:CGP+C6 IC50 外部验证
细胞类型解卷积 marker 集打分 C8/M8 与流式/单细胞对照
免疫治疗响应 免疫签名 C7/M7 队列 + 生境分层
机制发现 反向富集 C2:CGP 文献 + 独立数据验证

§7.6 端到端案例:肿瘤分型的通路级解释

1) TCGA RNA-seq(n=500)→ 归一化
2) GSVA × Hallmark 50 → 通路活性矩阵(500×50)
3) 共识聚类 → 3 个亚型
4) 亚型差异通路:HALLMARK_EMT(亚型A↑)、HALLMARK_INTERFERON_GAMMA_RESPONSE(亚型B↑)
5) leading edge 溯源 → EMT 驱动基因(VIM/CDH1 轴)
6) 外部验证:独立队列同管线 → 两通路重现
7) 产出:分型 + 机制语句 + 可复现管线(版本三元组入方法节)

§7.7 报告模板:方法学段落骨架

通路富集分析使用 MSigDB v2026.1.Hs(2026-01-30 发布,基因数据
对齐 Ensembl 115,标识符为 HGNC 符号;下载日期 <DATE>,GMT 文件
SHA256 <HASH>)。主分析使用 Hallmark 集合(n=50);扩展分析使用
C2 canonical pathways 子集(n=4,115)。基因集大小过滤为
15 ≤ size ≤ 500。GSEA 实现采用 fgseaMultilevel(R 4.x),
排序统计量为 DESeq2 Wald z,FDR 采用 Benjamini-Hochberg 校正
(阈值 0.05)。小鼠同源分析使用 msigdbr ortholog 映射(声明:
映射损耗已在补充材料讨论)。

§7.8 成本与排期模板

阶段 工作 预算
周 1 下载注册 + GMT 解析 + 版本指纹 0.5 人日
周 1-2 富集/打分管线搭建 + 对照验证 1-2 人日
周 2 集合选择实验(H vs CP vs 扩展) 1 人日
周 3 ML 任务接入(GSVA 特征)+ 调参 2-4 人日
周 4 外部验证 + 方法学写作 1-2 人日

§7.9 消融案例:特征层选择对分类性能的影响

同一 TCGA 分型任务的三档特征(示意性结论方向,具体以自算为准):

  • 原始 2 万基因:过拟合风险高、解释为零;
  • GSVA × 全库 1.6 万集合:维度灾难、FDR 冗余干扰特征选择;
  • GSVA × Hallmark 50:维度最低、每维有机制名、性能常与全基因持平或更好。

教训:集合选择本身是超参数——H 是稳健默认,扩展需要理由与验证。

§8 伦理、许可与合规

§8.1 许可与义务结构

资产 许可 义务
MSigDB 基因集(全部集合) CC BY 4.0(© 2004-2026 Broad/MIT/UC) 署名(引 Subramanian 2005 等)
GSEA 软件 BSD-style 开源 许可声明
BioCarta 子集 BioCarta 免责声明附加(© 2000-2017) 遵守其免责条款
KEGG 子集 受 KEGG 许可限制 不违反 KEGG 非商业条款;Bioconductor 分发不含
注册账号 免费 邮箱用于资助报告

§8.2 引用与致谢模板

基因集注释来自 Molecular Signatures Database (MSigDB) v2026.1.Hs,
UC San Diego + Broad Institute(https://www.gsea-msigdb.org)。
方法引用:Subramanian A, Tamayo P, et al. Gene set enrichment
analysis: a knowledge-based approach for interpreting genome-wide
expression profiles. PNAS 2005;102(43):15545-15550.
集合引用:Liberzon A, et al. Cell Syst. 2015;1(6):417-425 (Hallmark)。
(使用 Mouse:另引 Castanza AS, et al. Nat Methods 2023.)
各基因集的原始来源文献见其详情页。

§8.3 国内合规路径

  • CC BY 4.0 开放许可:科研/商业均可,署名义务必须履行;
  • 数据为知识注释(无人类受试者数据)——不涉人类遗传资源出境审批;
  • 产品集成(如生信云平台内置 MSigDB):CC BY 4.0 允许,署名页 + 版本声明 + KEGG/BioCarta 子集的单独处理(可剔除或替换);
  • 商业软件内置建议:剔除 KEGG 子集或按 KEGG 商业许可另行授权。

§8.4 商业使用边界

  • 允许:商业分析服务、生信软件集成、数据库产品(CC BY 4.0);
  • 边界 1:KEGG_MEDICUS/KEGG_LEGACY 子集——KEGG 本体许可为非商业,商业产品应剔除或授权;
  • 边界 2:BioCarta 子集免责条款随附;
  • 边界 3:商标(GSEA/MSigDB 名称)按官方品牌惯例使用。

§8.5 合规台账最小模板

字段 示例
数据集 MSigDB v2026.1.Hs(2026-01-30)
下载 URL/日期 gsea-msigdb.org/downloads / 2026-09-20
许可 CC BY 4.0(Broad/MIT/UC)
例外处理 KEGG 子集已剔除(商业产品)
署名方式 Subramanian 2005 PNAS + 版本声明
使用场景 通路富集模块
再分发 附许可文本 + 版本戳

§8.6 治理语义

MSigDB 的治理是"双机构 + 方法论文驱动":UC San Diego(方法发明方)与 Broad(数据工程方)共建;每次方法论升级(GSEA 2005/Hallmark 2015/Mouse 2023)都伴随同行评议论文——数据演进有论文级的透明度。NCI 资助保证连续性;免费注册(资助报告)形成轻量问责闭环。

§9 谱系与生态

§9.1 基因集资源时间线

年份 事件
2003 Mootha(GSEA 前身)Nat Genet
2005 GSEA/MSigDB 诞生(PNAS)
2007-2011 GO/KEGG/Reactome 集合陆续纳入;3.0 规范化
2011-2015 C7 免疫/C8 细胞类型扩张;Hallmark 提炼(2015)
2015-2022 v7.x 时代:集合数破 3 万;单细胞 C8
2023 Mouse 原生化(Nature Methods)
2024 版本命名切换为年份制(2024.1,Ensembl 112)
2025 M7 免疫引入(Ensembl 114)
2026 C9 扰动签名引入(Ensembl 115)

§9.2 术语表

术语 含义
GSEA 基因集富集分析(全排序加权检验)
GMT Gene Matrix Transposed——每行一集合的 tab 格式
Hallmark 50 个提炼的协调表达主题集合
NES 归一化富集得分
Leading edge 贡献 ES 的成员子集
ssGSEA 单样本 GSEA 打分
GSVA 基因集变异分析(样本级通路活性)
CGP chemical and genetic perturbations(化学/遗传扰动签名)
ImmuneSigDB 免疫签名子库(C7 主体,4,872)
Ortholog mapping 直系同源映射(人→鼠基因对应)
FDR 假发现率(BH 校正)
HPO 人类表型本体
Competitive test 集合基因 vs 其它基因的检验框架
Connectivity score 疾病签名与药物签名的逆转得分

§9.3 资源选型决策树

需要通路/基因集分析?
├─ 想要"开箱即用"的统一语义 ──▶ MSigDB(H 起步)
│   ├─ 有全排序 ──▶ GSEA/fgsea
│   ├─ 只有单样本 ──▶ ssGSEA/GSVA 打分
│   └─ Mouse 数据 ──▶ M 系原生集合(M7 免疫)
├─ 需要通路层级/反应细节 ──▶ Reactome 官方
├─ 需要本体精读(证据码/层级)──▶ GO/HPO 官方工具
├─ 需要调控因子活性分级 ──▶ DoRothEA/VIPER(可与 C3 互校)
└─ 商业产品需 KEGG ──▶ 向 KEGG 申请授权(勿用 MSigDB 内嵌子集绕许可)

§9.4 与本库其他条目的关系

  • Reactome 条目:MSigDB CP:REACTOME(1,839 集)的上游——细节回源;
  • GO 条目:C5:GO 的源头;MSigDB 是其"富集友好投影";
  • HPO 条目:C5:HPO 的源头——罕见病富集的语义层;
  • TCGA/GTEx 条目:典型消费方——表达数据 + MSigDB = 通路分析标准组合;
  • IntAct 条目:蛋白互作网络与基因集的两层语义(边 vs 组)。

§9.5 组合使用建议

  1. MSigDB + TCGA:癌症分型/通路激活的标准管线;
  2. MSigDB + GTEx:正常组织基准 → 肿瘤偏离度;
  3. MSigDB + scRNA-seq:C8/M8 marker 打分做跨研究标签传递;
  4. MSigDB + DrugBank/CMap:扰动签名 + 药物靶点 = 再利用推理;
  5. MSigDB + HPO 官方:罕见病候选基因流程(富集 + 语义相似度)。

§9.6 基因集资源的生态角色

MSigDB 是基因集语义的"清算层":上游(本体/通路库/文献/计算)→ 统一封装(GMT)→ 下游(全部富集工具与 AI 管线)。它不追求上游的细节保真(那是源库的事),而追求"一次接入、处处可用"——与 IntAct 在互作领域的清算所角色同构。

§9.7 通路资源家族的光谱定位

结构精细 ◀────────────────────────▶ 使用便捷
Reactome   KEGG   GO   WikiPathways   MSigDB(CP)   MSigDB(H)
(反应级)        (本体级)           (集合级)   (主题级)

§9.8 MSigDB 生态的圈层地图

圈层 成员 关系
核心 Human/Mouse MSigDB + GSEA 软件 同团队
上游 Reactome/KEGG/WikiPathways/BioCarta/PID/GO/HPO/miRDB/GTRD 来源库
签名源 GEO 扰动实验/ImmuneSigDB/Mouse Immune Dictionary 数据源
方法层 fgsea/GSVA/ssGSEA/camera/fry/singscore/clusterProfiler 消费算法
语言绑定 msigdbr(CRAN)/msigdb(Bioconductor)/gseapy(PyPI) 工程接入
终端 TCGA/GTEx 分析、药物发现、AI 特征层 应用

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 URL
MSigDB 首页 https://www.gsea-msigdb.org/gsea/msigdb
Human Collections https://www.gsea-msigdb.org/gsea/msigdb/human/collections.jsp
Mouse Collections https://www.gsea-msigdb.org/gsea/msigdb/mouse/collections.jsp
下载页 https://www.gsea-msigdb.org/gsea/downloads.jsp
GSEA 软件 https://www.gsea-msigdb.org/gsea/downloads.jsp
Release Notes https://www.gsea-msigdb.org/gsea/msigdb/notes.html
GitHub(GSEA-MSigDB) https://github.com/GSEA-MSigDB
msigdbr(CRAN) https://igordot.github.io/msigdbr/
msigdb(Bioconductor) https://bioconductor.org/packages/msigdb/

§10.2 关键文献

论文 价值 标识
Subramanian 2005(方法) GSEA + MSigDB 诞生 PNAS 102(43):15545-15550; doi:10.1073/pnas.0506580102
Mootha 2003(前身) 方法雏形(线粒体疾病) Nat Genet 34:267-273
Liberzon 2011 MSigDB 3.0 规范化 Bioinformatics 27(12):1739-1740
Liberzon 2015 Hallmark 方法论 Cell Systems 1(6):417-425
Castanza 2023 Mouse 原生化 Nat Methods; doi:10.1038/s41592-023-02014-7
Cui 2023 Mouse Immune Dictionary(M7 源) M7 引文

§10.4 FAQ

Q1:MSigDB 和 GSEA 是什么关系?
GSEA 是方法/软件(UC San Diego + Broad),MSigDB 是配套基因集库——"方法 + 数据"一体两面;绝大多数 GSEA 论文用的集合来自 MSigDB。

Q2:当前版本有多少基因集?
Human v2026.1.Hs 共 35,361 个(九大集合);Mouse v2026.1.Mm 共 17,068 个(2026-01-30 发布,Ensembl 115)。

Q3:Hallmark 是什么?为什么大家都用它?
50 个提炼集合:从 C1-C6 的 8,380 集合聚类(600 簇)+ 人工评审得到 50 个生物学主题,成员经表达协调性验证(4,022 个 founder)。用它是因为低冗余 + 主题清晰 + 多重检验负担轻。

Q4:九大集合分别是什么?
H(Hallmark 50)、C1(位置 302)、C2(精选 7,670:扰动 CGP + 通路 CP)、C3(调控靶点 3,714)、C4(计算 1,006)、C5(本体 16,283:GO+HPO)、C6(癌症签名 189)、C7(免疫 5,219)、C8(细胞类型 866)、C9(扰动签名 62,2026.1 新增)。

Q5:Mouse 侧有哪些集合?
MH(50,对应 H)、M1(341)、M2(2,771)、M3(2,047)、M5(10,839)、M7(787 免疫,2025.1 引入)、M8(细胞类型)。多数经 MGI 同源映射,M1/M5 物种特异重建。

Q6:怎么引用?
必引 Subramanian et al. 2005 PNAS(方法);按需加 Liberzon 2011/2015;用 Mouse 必加 Castanza 2023 Nat Methods;每个基因集的来源文献见其详情页。

Q7:许可证是什么?
数据 CC BY 4.0(© 2004-2026 Broad/MIT/UC);GSEA 软件 BSD-style。两个例外:BioCarta 子集有独立免责声明;KEGG 子集受 KEGG 许可限制(商业产品应剔除或另授权)。

Q8:需要注册吗?
需要免费注册(邮箱)——目的仅是资助报告统计;注册后可下 GMT/SQLite/GSEA 软件。

Q9:GMT 格式是什么?
每行一个基因集:名称 + 描述 + 成员基因列表(tab 分隔)。GSEA 原生格式;fgsea/clusterProfiler 等都直接读。

Q10:基因用什么标识符?
双版本:HGNC(Human)/ MGI(Mouse)基因符号,或 NCBI Entrez ID——下载时选择;混用会导致映射失败。

Q11:ssGSEA 和 GSVA 的区别?
两者都是单样本通路打分:ssGSEA 用排序权重打分;GSVA 用核密度估计把表达转为"通路活性"。输出都是样本 × 通路矩阵——AI 特征工程的标准原料。

Q12:fgsea 和经典 GSEA 的区别?
fgsea 是 R 快速实现(多级近似置换),结果与经典 GSEA 一致但快几个量级;gseapy 是 Python 对应物。

Q13:应该用哪些集合做富集?
从 H(50 集)起步;有明确理由再扩(免疫→C7、调控→C3、表型→C5:HPO)。全库 3.5 万集合一次跑会让 FDR 稀释且冗余淹没结果。

Q14:集合大小怎么过滤?
惯例 15 ≤ size ≤ 500——小于 15 的集合方差大、大于 500 的稀释信号;参数入方法节。

Q15:C2:CGP 里的 xxx_UP/xxx_DN 是什么?
同一扰动(基因过表达/敲除/药物)的上调与下调基因集,成对出现——用于双向富集与"逆转签名"(药物再利用)分析。

Q16:C6 与 C2:CGP 的区别?
C6(189)是癌症基因扰动的 oncogenic signatures 专门集(microarray 直接定义);CGP 更大(3,555)且含非癌症扰动。

Q17:C9 是什么?什么时候有的?
computational perturbation signature gene sets——2026.1 新增(2026-01,62 集),初始为癌基因依赖的转录签名;与 CGP 的区别是来源为计算扰动签名管线。

Q18:Mouse M7 是什么?什么时候有的?
Mouse 免疫签名集合——2025.1 引入(787 集),全部来自 Mouse Immune Dictionary(Cui et al. 2023);使小鼠免疫分析不再依赖人源映射。

Q19:怎么把基因集用于机器学习?
GSVA/ssGSEA 把表达转为通路活性矩阵(样本 × 集合)——比 2 万基因特征低维且有机制名;Hallmark 50 是最常用的稳健特征层。

Q20:肿瘤数据为什么要查 C1?
拷贝数变异使染色体区域基因协调升降——这是"位置效应"不是通路激活;C1(302 个细胞带集合)作为区域效应检查可防止误读。

Q21:版本怎么管理?
版本三元组(MSigDB 版 + Ensembl 版 + 下载日期)+ GMT 文件 SHA256 指纹 + 快照存档;gene set 详情页有 per-集合版本历史。

Q22:跨物种怎么处理?
Mouse 数据用 M 系原生集合;必须用 Human 集合时经 msigdbr ortholog 映射(声明映射损耗);不要把人符号直接塞鼠基因。

Q23:KEGG 集合为什么有 LEGACY?
MSigDB 引入基于 KEGG MEDICUS(658 集)的新集合后,旧 KEGG 集合(186)标注为 legacy 保留——旧分析可复现,新分析建议 MEDICUS。

Q24:Bioconductor 的 msigdb 包为什么没有 KEGG?
许可限制:KEGG 不允许经第三方再分发;包提供 appendKEGG() 从 MSigDB 官方单独下载追加。

Q25:全排序输入是什么意思?
GSEA 假设输入是全部基因的排序(按统计量),不是阈值筛选后的 DEG 清单——阈值化破坏统计前提并损失"温和但协调"的信号。

Q26:leading edge 是什么?
贡献富集得分的成员子集——“机制前锋”;从集合级结果回到基因级解释的桥梁。

Q27:多重检验怎么控?
Benjamini-Hochberg FDR 为默认;集合间高度相关时 BH 会保守——集合选择(H 起步)比换校正方法更有效。

Q28:C8 的 marker 集和 xCell/CIBERSORT 什么关系?
思路同族(marker → 细胞组成推断);C8 是"基因集形态"——任何富集/打分工具都能消费;xCell/CIBERSORT 是封装好的打分引擎。

Q29:历史论文里的集合数对不上怎么办?
v7.5.1(31,322)、v7.x(33,196)、v2026.1(35,361)都是当时的正确口径——引用历史结果用当时版本;新分析用当前版。

Q30:怎么检查集合冗余?
对候选集合算 Jaccard/PWM 重叠(§4.6 代码);C2:CGP 内同源对极多——top 结果中的"一个事件 × 多集合"要合并解释。

Q31:MSigDB 里有 miRNA/TF 靶点吗?
有:C3(3,714)= MIR 2,598(miRDB 预测)+ TFT 1,116(GTRD ChIP-seq 预测)——用于调控因子活性推断;与 DoRothEA 互校更稳。

Q32:HPO 集合怎么用于罕见病?
患者表型 → 对应 HPO 术语基因集(C5,5,793)→ 与外显子组排序基因做富集/重叠 → 候选基因;与 Exomiser 类工具语义一致。

Q33:GSEA 4.4.0 有什么变化?
2025-03-08 发布:运行时更新到 Java 21、修 macOS 启动问题——算法与核心功能不变。

Q34:可以再分发 MSigDB 吗?
CC BY 4.0 允许(附署名与许可文本);但 KEGG 子集除外(许可限制)——再分发前剔除或单独处理;BioCarta 子集附其免责。

Q35:数据多久更新一次?
年-半年一版(2024.1 → 2025.1 → 2026.1);每次含来源库更新(GO/Reactome/WikiPathways/HPO)、Ensembl 对齐与新增集合。

Q36:一句话总结 MSigDB 的 AI-Ready 价值?
它把 3.5 万条生物学知识封装成统一的可计算单元(基因集),并提供了许可清晰、格式齐全、生态全接的工程底座——是"知识 → 特征"转换的标准桥梁。

Q37:camera/fry 和 GSEA 有什么区别?
camera/fry(limma 家族)显式校正基因间相关(inter-gene correlation)——样本量小或相关结构强时更稳;经典 GSEA 用置换检验部分覆盖该问题。报告时说明所用框架即可。

Q38:ORA(超几何富集)什么时候还能用?
只有阈值化基因清单(无全排序)时的降级选择——例如纯候选基因列表;它丢弃"温和协调变化"信息,应在论文中声明该局限。

Q39:C5 的 GO 集合和 GO 官方富集(topGO 等)怎么选?
需要证据码过滤、层级感知(父节点汇总子节点)或 IEA 剔除时用 GO 官方工具;MSigDB C5 是扁平化的"有注释基因"投影——快但丢失本体细节。

Q40:怎么快速把 MSigDB 接进已有 Python 管线?
两条路:gseapy 的 get_library(内置 msigdbr 数据)或直接读官方 GMT/SQLite 文件;都做大小过滤(15-500)与版本指纹后进入 fgsea 等价算法。

§10.5 要点回顾

  1. 定位:GSEA 生态的标准基因集库——UCSD + Broad 双机构二十年。
  2. 双物种双口径:Human 35,361 / Mouse 17,068(v2026.1)——分开计数、分开引用。
  3. Hallmark 优先:50 集 = 4,022 founders 提炼——低冗余的稳健起点。
  4. 集合选择是超参:从 H 起步、按理由扩展——全库轰炸是第一大坑。
  5. 全排序输入:阈值化 DEG 清单破坏 GSEA 前提。
  6. 版本三元组:MSigDB 版 + Ensembl 版 + 日期——可复现最小集。
  7. 许可例外:KEGG/BioCarta 子集单独处理——商业产品必查。
  8. 跨物种纪律:M 系原生或声明 ortholog 映射——别直推。
  9. CNV 检查:C1 区域效应——肿瘤数据的隐蔽坑。
  10. AI 特征层:GSVA × Hallmark = 50 维机制命名特征——比原始表达更稳。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • Human v2026.1.Hs 35,361 集合/9 大 collections;Mouse v2026.1.Mm 17,068 集合;2026-01-30 发布;Ensembl 115 = MSigDB 官网首页 + Human/Mouse Collections 页(gsea-msigdb.org)
  • 集合明细:H 50 / C1 302 / C2 7,670(CGP 3,555 + CP 4,115:BIOCARTA 292/KEGG_MEDICUS 658/PID 196/REACTOME 1,839/WIKIPATHWAYS 925/KEGG_LEGACY 186)/ C3 3,714(MIR 2,598:MIRDB 2,377+legacy 221;TFT 1,116:GTRD 506+legacy 610)/ C4 1,006(3CA 148/CGN 427/CM 431)/ C5 16,283(GO 10,490:BP 7,538/CC 1,080/MF 1,872;HPO 5,793)/ C6 189 / C7 5,219(ImmuneSigDB 4,872+VAX 347)/ C8 866 / C9 62 = Human Collections 浏览页(v2026.1 口径)
  • Mouse 明细:MH 50 / M1 341 / M2 2,771(CGP 984+CP 1,787:BIOCARTA 252/REACTOME 1,333/WIKIPATHWAYS 202)/ M3 2,047(miRDB 1,768+GTRD 279)/ M5 10,839 / M7 787 = Mouse Collections 页(v2026.1.Mm 口径)
  • Hallmark 方法论:8,380 founder 候选 → 600 clusters → 43 clusters/50 主题(7 双主题)→ 4,022 founders → 表达验证提炼 = Liberzon 2015 Cell Systems 1(6):417-425(经 RNA Biosciences 指南交叉核对)
  • 版本时间线:2024.1(2024-08-09,Ensembl 112)/ GSEA 4.4.0(2025-03-08,Java 21)/ 2025.1(2025-06-06,M7 787 集,Ensembl 114)/ 2026.1(2026-01-30,C9 62 集癌基因依赖签名,Ensembl 115)= 官网 What’s New + Release Notes + msigdbr Changelog
  • 许可:CC BY 4.0(© 2004-2026 Broad Institute, Inc., MIT, Regents of UC);GSEA BSD-style(github.com/GSEA-MSigDB);BioCarta 免责(© 2000-2017 BioCarta);KEGG 许可限制(Bioconductor msigdb 不含,appendKEGG 追加);注册免费(资助报告)= 官网 License Terms + Bioconductor msigdb 手册
  • 引文体系:Subramanian 2005 PNAS 102(43):15545-15550 必引 / Liberzon 2011 Bioinformatics 27(12):1739-1740 / Liberzon 2015 Cell Systems / Castanza 2023 Nat Methods(Mouse,doi:10.1038/s41592-023-02014-7)/ Cui 2023(Mouse Immune Dictionary)= 官网 Citing + Nature Methods 论文(PMC11397807)
  • Mouse 构建机制:MGI 同源映射为主;M1(NCBI 基因信息)/M5(org.Mm.eg.db)物种特异重建 = Bioconductor msigdb 手册 + Castanza 2023
  • M7 示例集合 CUI_ILC_IL15_RESPONSE_UP(“2025.1.Mm: First Introduced”;CC-BY-4.0 标注)= Mouse gene set 详情页
  • 历史规模:v7.5.1 时代 31,322 集(Bioconductor vignette “31322 total”);v7.x 33,196(NCI CCR 课件);>25,000 签名描述(Bioconductor vignette)——历史口径随版本滚动
  • msigdbr:26.1.0(2026-03-12,更新至 MSigDB v2026.1)/25.1.0(2025-07-03,v2025.1)/版本绑定 MSigDB release(自 24.1.0 起)= msigdbr Changelog(igordot.github.io/msigdbr)
  • GSEA 方法:全排序 + 加权 ES + 置换检验 + leading edge = Subramanian 2005 PNAS(经多来源交叉核对)
  • 资助:NIH NCI(Mouse 论文致谢 U24CA220341;官网 Funding “grant from the National Cancer Institute”)= 官网 + PMC11397807

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • intact — 共享标签:基因组学与多组学 / 药物发现与化学
  • lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
  • open-targets — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • pdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • hmdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • lincs-l1000 — 共享标签:基因组学与多组学 / 药物发现与化学
  • ctd — 共享标签:基因组学与多组学 / 药物发现与化学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集