信息速览
MSigDB — 分子特征数据库 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | Molecular Signatures Database(MSigDB,分子特征数据库) |
| 维护机构 | UC San Diego + Broad Institute(联合项目;NIH NCI 资助 U24CA220341) |
| 创立 | 2005(随 GSEA 方法论文 PNAS 102:15545-15550 诞生) |
| 当前版本 | Human v2026.1.Hs / Mouse v2026.1.Mm(2026-01-30;Ensembl 115) |
| 人类规模 | 35,361 个基因集(九大集合 H+C1-C9) |
| 小鼠规模 | 17,068 个基因集(MH+M1/M2/M3/M5/M7/M8) |
| 旗舰集合 | H Hallmark 50(4,022 founders 提炼;Liberzon 2015) |
| 本体集合 | C5 16,283(GO 10,490:BP 7,538/CC 1,080/MF 1,872 + HPO 5,793) |
| 免疫集合 | C7 5,219(ImmuneSigDB 4,872 + VAX 347);M7 787(2025.1 新增) |
| 数据格式 | GMT / GRP / XML / JSON / TSV / JSON bundle / SQLite |
| 标识符 | HGNC(Human)/ MGI(Mouse)符号 或 NCBI Entrez ID |
| 许可 | 数据 CC BY 4.0(© 2004-2026 Broad/MIT/UC);GSEA 软件 BSD-style |
| 配套方法 | GSEA / ssGSEA / GSVA / fgsea / camera / fry / singscore |
| 官方入口 | https://www.gsea-msigdb.org/gsea/msigdb |
| 本库条目 | order 483 · record_id 583 · 类别:基因组学与多组学 × 药物发现与化学 |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目基于 MSigDB 官网(首页/Collections 页/Human 与 Mouse 浏览页/gene set 详情页)、Release Notes(2024.1/2025.1/2026.1)、msigdbr Changelog 与 Bioconductor msigdb 包文档核对;集合数全部标注版本口径。
- 专业性:Hallmark 提炼方法论依据 Liberzon 2015 Cell Systems 原文;GSEA 方法依据 Subramanian 2005 PNAS;Mouse 构建机制依据 Castanza 2023 Nature Methods 与 Bioconductor 文档;许可例外(BioCarta/KEGG)依据官方 license 页与包文档原文。
- 权威性:MSigDB 为 UC San Diego 与 Broad Institute 官方资源、GSEA 富集分析的事实标准;本条目为第三方百科解读,不替代官方文档与各来源数据库的原始许可。
- 可信度:文内数字进入文末「口径存照」;v2026.1 与 v2025.1/2024.1 的口径差异(C9 新增、M7 新增)已显式标注。
- 免责:基因集是"生物学状态的语言学封装"而非因果图——富集结果依赖输入排序质量与集合选择;使用 MSigDB 发表需按官方引用规范(2005 PNAS 必引)。
- 时效:口径锁定 2026-09-19/20(v2026.1 发布后);下一次发布以官网为准。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:UC San Diego 与 Broad Institute 维护的注释基因集库——把"通路、本体、扰动签名、免疫状态、细胞类型"翻译成基因列表,供 GSEA 及其变体消费。
- 多大:Human v2026.1 共 35,361 个基因集(九大集合);Mouse v2026.1 共 17,068 个。
- 为什么重要:GSEA 是转录组分析引用量最高的方法之一(2005 PNAS 论文数万次引用)——MSigDB 是它的事实标准底座;绝大多数富集分析论文的通路结果最终都能溯源到这里。
- 怎么用:CC BY 4.0(免费注册后下载 GMT/SQLite)→ fgsea/clusterProfiler/GSVA 直接消费 → 得到通路活性。
- 一句话:如果你有一张排序的基因表,MSigDB 决定了你说的"这条通路富集了"到底是什么意思。
§1.1 摘要
MSigDB(Molecular Signatures Database)是 UC San Diego 与 Broad Institute 的联合项目,为 GSEA(Gene Set Enrichment Analysis)软件提供注释基因集。它把分子生物学知识组织成"基因集"单元:一条通路(Reactome 的某一步骤)、一个本体术语(GO:BP/CC/MF、HPO 表型)、一个扰动签名(某个基因被敲除/过表达/药物处理后上调与下调的基因)、一种免疫细胞状态、一种单细胞类型 marker、甚至一段染色体细胞遗传带。
Human v2026.1.Hs(2026-01-30 发布,基因数据对齐 Ensembl 115)含 35,361 个基因集,分九大集合:H(Hallmark,50 个"提炼集"——从 C1-C6 的 8,380 个集合经聚类与人工评审得到 50 个生物学主题)、C1(positional,302 个染色体带集合)、C2(curated,7,670 个精选通路与扰动集合,内含 Reactome 1,839、WikiPathways 925、KEGG MEDICUS 658、BioCarta 292、PID 196 等子集)、C3(regulatory,3,714 个转录因子/miRNA 靶点集合)、C4(computational,1,006 个癌症数据挖掘集合)、C5(ontology,16,283 个 GO 10,490 + HPO 5,793)、C6(oncogenic signatures,189)、C7(immunologic signatures,5,219:ImmuneSigDB 4,872 + 疫苗响应 VAX 347)、C8(cell type,866 个单细胞 marker 集合),以及 2026 年 1 月新增的 C9(computational perturbation signatures,62 个癌基因依赖转录签名)。
Mouse v2026.1.Mm 同步发布,含 17,068 个集合(MH 50、M1 341、M2 2,771、M3 2,047、M5 10,839、M7 787、M8 ~233);M7 免疫集合于 2025.1 引入,全部 787 集来自 Mouse Immune Dictionary(Cui et al. 2023)。Mouse 集合多数经 MGI 同源映射从 Human 翻译,M1/M5 因物种特异性重建。
许可为 CC BY 4.0(© 2004-2026 Broad Institute, Inc., MIT 与 UC Regents),GSEA 软件开源(BSD-style);两个许可例外要记牢:BioCarta 子集带独立免责声明、KEGG 子集受 KEGG 许可限制(Bioconductor 分发不含)。下载需免费注册(邮箱,用于资助报告)。数据格式覆盖 GMT(GSEA 原生)、GRP、XML、JSON、TSV、整库 JSON bundle 与 SQLite 单文件库,标识符提供 HGNC/MGI 符号与 NCBI Entrez 双版本。
§1.2 战略价值
- 富集分析语义的"货币":全世界说"这条通路富集了"时,多数场景里的"通路"就是 MSigDB 里的一个基因集——它定义了转录组学十几年来的公共语义;语义统一的价值超过集合本身。
- Hallmark 的"提炼工程":面对 3 万+ 集合的冗余海啸,50 个 Hallmark 用计算 + 人工混合方法把 4,022 个 founder 压缩成 50 个协调表达主题——这是"知识库降噪"的教科书案例。
- 转录响应知识的资产化:CGP 子集(3,555 个化学/遗传扰动签名)把二十年 GEO 微阵列实验的扰动响应变成可复用结构化数据——单组学时代的"扰动知识图谱"。
- 单细胞时代的桥接:C8/M8 把单细胞簇 marker 变成 bulk 富集可消费的基因集——bulk 与单细胞两种世界因此能对话。
- 许可清晰的再分发:CC BY 4.0 + 明确例外(BioCarta/KEGG)——工具链(Bioconductor/CRAN/Python 包)得以零摩擦集成,这是它成为"事实标准"的工程前提。
§1.3 同类数据集横向对比
| 维度 | MSigDB | Reactome | KEGG | GO | WikiPathways |
|---|---|---|---|---|---|
| 性质 | 基因集聚合库(含他源) | 单一通路数据库 | 通路+疾病+药物 | 本体 | 社区通路 |
| 集合粒度 | 万级(多源混合) | 千级(结构化反应) | 数百级 | 万级(术语) | 千级 |
| 上游 | 文献/数据库/计算 | 自建 curator 团队 | 京都大学团队 | GO 联盟 | 社区编辑 |
| 配套方法 | GSEA 生态 | 自家分析+可入 MSigDB | 自家工具 | 语义推理 | 富集 |
| 许可 | CC BY 4.0(例外:KEGG/BioCarta) | CC BY 4.0 | 非商业限制(KEGG) | CC BY 4.0 | CC BY 4.0 |
| 更新节奏 | 年度-半年 | 持续 | 持续(月) | 持续(月) | 持续 |
- MSigDB 是"层"不是"源":它把 Reactome/KEGG/GO 等源数据库"扁平化"为基因集——分析者用 MSigDB 免去逐库格式适配;但版本滞后于上游是代价。
- KEGG 的双重身份:MSigDB 里 KEGG_MEDICUS(658)是新一代,KEGG_LEGACY(186)标注为 legacy——KEGG 本身的许可限制不随 CC BY 4.0 扩散。
- 与 GSVA/fgsea 的关系:这些是分析方法(消费方),MSigDB 是数据(供给方)——"GSEA 方法 + MSigDB 数据"组合是完整工作流。
§1.4 版本时间轴
| 时间 | 里程碑 |
|---|---|
| 2003 | Mootha et al. Nat Genet(GSEA 前身方法,人类线粒体疾病应用) |
| 2005 | Subramanian et al. PNAS 102(43):15545-15550——GSEA 方法论文 + MSigDB 诞生 |
| 2011 | Liberzon et al. Bioinformatics——MSigDB 3.0(规范化集合结构) |
| 2015 | Liberzon et al. Cell Systems 1(6):417-425——Hallmark collection 方法论 |
| 2020-09 | v7.2 时代(v7.2.Hs 口径) |
| 2023-09 | Castanza et al. Nature Methods——Mouse MSigDB 原生化(doi 10.1038/s41592-023-02014-7) |
| 2024-08-09 | MSigDB 2024.1:GO/Reactome/WikiPathways 更新;Ensembl 112 |
| 2025-03-08 | GSEA 4.4.0(Java 21 运行时) |
| 2025-06-06 | MSigDB 2025.1:Mouse M7 免疫集合引入(787 sets,Mouse Immune Dictionary);Ensembl 114 |
| 2026-01-30 | MSigDB 2026.1:Human C9 扰动签名集合引入(62 sets,癌基因依赖);Ensembl 115 |
§1.5 应用场景矩阵
| 场景 | 用什么集合 | 典型动作 |
|---|---|---|
| bulk RNA-seq 差异表达解读 | H 或 C2:CP | fgsea/clusterProfiler 富集 + leading edge 分析 |
| 单样本通路活性 | H/C2 | ssGSEA/GSVA 打分 → 样本 × 通路矩阵 → 建模 |
| 药物机制研究 | C2:CGP + C6 | 药物扰动签名 ↔ 疾病签名反向富集 |
| 免疫浸润/免疫治疗 | C7/M7 | 免疫签名打分 + TME 分析 |
| 单细胞注释 | C8/M8 | marker 集 overlap → 细胞类型标签 |
| 罕见病/表型 | C5:HPO | 表型 → 基因集 → 候选基因 |
| TF/miRNA 调控推断 | C3 | 靶点集合富集 → 上游调控因子假设 |
| 染色体区域效应 | C1 | 细胞带集合 → CNV 区域活性 |
§1.6 组件全景
- H Hallmark:50 个提炼集——多数分析的默认起点;
- C1 位置:302 个细胞遗传带集合——CNV/区域效应;
- C2 精选:7,670 = CGP 3,555(扰动)+ CP 4,115(通路:Reactome 1,839/WikiPathways 925/KEGG_MEDICUS 658/BioCarta 292/PID 196/KEGG_LEGACY 186);
- C3 调控:3,714 = MIR 2,598(miRDB 2,377 + legacy 221)+ TFT 1,116(GTRD 506 + legacy 610);
- C4 计算:1,006 = 3CA 148 + CGN 427 + CM 431;
- C5 本体:16,283 = GO 10,490(BP/CC/MF)+ HPO 5,793;
- C6 癌症签名:189 个癌基因扰动 microarray 签名;
- C7 免疫:5,219 = ImmuneSigDB 4,872 + VAX 347;
- C8 细胞类型:866 个单细胞 marker 集;
- C9 扰动签名:62 个(2026.1 新增,癌基因依赖转录响应);
- Mouse 侧:MH/M1/M2/M3/M5/M7/M8(17,068)。
§1.7 Hallmark:知识库降噪的教科书工程
Liberzon 2015 描述的方法论(Cell Systems):
C1-C6 全库 8,380 个 gene sets
│ 按成员基因重叠聚类
▼
600 clusters
│ 人工评审(专家赋主题)
▼
43 clusters → 50 个生物学主题
(7 个异质性 cluster 各分两个主题)
│ founder 并集 → raw set
▼
表达数据中不区分表型的基因剔除
│ 只保留协调表达成员
▼
50 个 HALLMARK_* gene sets
(founder 来源 4,022 个原集合)
每个 hallmark 的语义是"well-defined biological state/process + coherent expression"——例如 HALLMARK_APOPTOSIS 不是"文献里所有凋亡相关基因",而是"在多种扰动数据中协调响应凋亡程序的基因核心"。这一步"计算聚类 + 人工命名 + 表达验证"的三段式,是后来所有"精简集"(如 DoRothEA regulons 分级)的方法学模板。
§1.8 GMT 格式速记
GMT(Gene Matrix Transposed)每行一个基因集:
HALLMARK_APOPTOSIS<TAB>Gene set in GSEA analysis...<TAB>AKT1<TAB>BAX<TAB>...(基因列表)
↑名称(唯一键) ↑描述(简短) ↑成员基因(HGNC 符号)
- 全部行数 = 集合总数;tab 分隔;无表头;
- 变体:GRP(单集合纯列表)、GMX(列式)、XML/JSON(带完整元数据);
- SQLite 版把 GMT 扁平表化(gene_set/gene 对 + 元数据)——SQL 消费最方便。
§1.9 独特视角:基因集是"可执行的生物学摘要"
MSigDB 的每个基因集都是一段生物学知识的可执行封装:“凋亡程序”、“E2F 靶点”、“IL6-JAK-STAT3 信号”。这种封装让统计检验可以直接在"知识单元"层运行——它是转录组学从"基因列表"走向"机制语句"的关键一步。AI 时代它的价值进一步放大:通路活性矩阵(样本 × 基因集)是天然的低维语义空间,比原始 2 万基因表达更适合作为下游模型的特征层。
§2 医学与科学背景
§2.1 从单基因到基因集的范式转变
微阵列/RNA-seq 时代的困境:差异表达给出数千个基因的排序,但单个基因的变化常常温和且不独立——疾病扰动的是"程序"而非"单个基因"。功能类评分(FCS)思想:把基因按排序聚合到知识单元(通路/本体),检验单元层的协调变化。GSEA(Subramanian 2005)是 FCS 的里程碑实现:全排序 + 加权富集得分 + 排列检验 + leading edge 提取。
§2.2 GSEA 方法要点
- 输入:全部基因按统计量排序(不是阈值筛选后的清单)——避免"阈值敏感";
- 富集得分(ES):沿排序走一遍,集合成员命中 +权重、非成员 - 权重,最大偏移即 ES;归一化 NES;
- 显著性:基因集置换/排列检验(排布保持基因相关结构);
- leading edge:贡献 ES 的成员子集——机制的"前锋"基因;
- 变体:ssGSEA(单样本打分)、GSVA(样本级通路活性矩阵)、fgsea(R 快速实现)、camera/fry(limma 家族,考虑基因间相关)。
§2.3 富集统计的陷阱语义
- competitive vs self-contained:多数富集检验是 competitive(该集合基因 vs 其它基因),假设基因独立——但基因间相关会膨胀 I 类错误(camera 为此校正);
- 集合大小效应:超小集合方差大、超大集合稀释——惯例过滤(10 ≤ size ≤ 500);
- 多重检验:FDR(Benjamini-Hochberg)为默认——但集合间相关使 BH 保守性变化;
- 排序指标选择:log2FC 排序 vs signed -log10(p) 排序 vs Wald z 排序——结果可差很大,报告须声明。
§2.4 C2:CGP 扰动签名的医学语义
3,555 个 CGP 集合大多成对出现(xxx_UP / xxx_DN):某基因过表达/敲除/药物处理后上调或下调的基因。医学用途:
- 机制映射:疾病签名与扰动签名重叠 → 提示疾病模块被该通路/药物影响;
- 药物再利用:药物签名"逆转"疾病签名(Connectivity Map 思想的 MSigDB 版本);
- 致癌通路激活:C6(189 个 oncogenic signatures)直接来自癌症基因扰动的 microarray 数据。
注意其局限:单细胞系、单时间点、microarray 平台——签名是"条件性事实"。
§2.5 C7/M7 免疫集合与免疫肿瘤学
- ImmuneSigDB(4,872):免疫细胞谱系/状态/扰动的表达签名(GSEAs 平台系统化产出);
- VAX(347):疫苗响应签名——接种前后转录变化;
- Mouse M7(787):Mouse Immune Dictionary(Cui et al. 2023)——小鼠免疫细胞状态的系统词典;2025.1 引入使小鼠免疫学分析不再依赖人源映射。
应用:肿瘤免疫微环境(TME)解卷积、免疫治疗响应预测、疫苗免疫监测研究。
§2.6 C5:HPO 表型-基因集的罕见病语义
C5 的 HPO 子集(5,793)把人类表型本体术语展开为关联基因集:“肾功能异常”、"感音神经性聋"各成一个集合。罕见病工作流:患者表型 → HPO 编码 → 对应基因集与患者外显子组排序基因的富集/重叠 → 候选基因。这与 Exomiser 类工具的语义一致——MSigDB 把这种"表型侧信息"提供给富集框架。
§2.7 C8/M8:单细胞与 bulk 的桥
C8(Human,866)与 M8(Mouse)来自单细胞测序研究的簇 marker:一个集合 = 一种细胞类型的 marker 基因。bulk 样本经 C8 富集/打分 → 细胞组成推断(与 CIBERSORT/xCell 类思想互补);单细胞数据反过来用 C8 做跨研究标签传递。
§2.8 C3 调控靶点与上游因子推断
- MIR(2,598):miRNA seed 序列靶点预测(miRDB v6.0 主力 + legacy)——miRNA 活性推断(批量靶点的协调下调 = 该 miRNA 激活证据);
- TFT(1,116):转录因子结合位点靶点(GTRD ChIP-seq 预测,TSS -1000/+100 bp 窗口 + legacy)——TF 活性推断。
与 DoRothEA/VIPER 等 regulon 资源的分工:C3 是"位点证据"层,DoRothEA 是"置信分级"层——两者可互校。
§2.9 C1 位置集合与染色体效应
302 个集合对应人类染色体细胞遗传带(如 chr1p36)——区域效应分析:CNV 片段内基因的协调变化常是"位置效应"而非通路效应。C1 在富集中作为"阴性对照/背景结构"使用可防止把 CNV 误读为通路激活——这是肿瘤数据分析的隐蔽坑。
§2.10 富集方法家族的对比语义
| 方法 | 框架 | 输入 | 相关性处理 | 何时用 |
|---|---|---|---|---|
| 经典 GSEA | FCS(competitive) | 全排序 | 置换检验保持基因相关 | 全排序 + 需 leading edge |
| fgsea | GSEA 的多级近似实现 | 全排序 | 同 GSEA | R 管线默认(快) |
| GSVA | 单样本打分 | 表达矩阵 | 无(打分层) | 特征工程/无组设计 |
| ssGSEA | 单样本排序打分 | 表达矩阵 | 无 | 快速打分/跨平台 |
| camera | FCS(competitive+correction) | 全排序 | 基因间相关校正 | 相关结构明显的数据 |
| fry | 残留旋转检验 | 表达矩阵 | 有 | limma 生态小样本 |
| ORA(超几何) | 过表达分析 | 阈值清单 | 无 | 只有清单时(降级使用) |
| singscore | 秩打分 | 表达矩阵 | 无 | 签名评分/单细胞 |
选择纪律:有全排序 → fgsea/camera;要样本级特征 → GSVA/ssGSEA;只有基因清单 → ORA(并声明其局限);报告方法名 + 参数 + 集合版本。
§3 数据集规格
§3.1 规格总表
| 项目 | 规格 |
|---|---|
| 数据库名 | Molecular Signatures Database(MSigDB) |
| 维护方 | UC San Diego + Broad Institute |
| 资助 | NIH NCI(U24CA220341) |
| 当前版本 | Human v2026.1.Hs / Mouse v2026.1.Mm(2026-01-30) |
| 基因数据 | Ensembl 115 |
| Human 集合数 | 35,361(H + C1-C9 九大集合) |
| Mouse 集合数 | 17,068(MH + M1/M2/M3/M5/M7/M8) |
| Hallmark | 50(Human H 与 Mouse MH 同步) |
| 最大集合 | C5 ontology 16,283(GO 10,490 + HPO 5,793) |
| 格式 | GMT/GRP/XML/JSON/TSV/JSON bundle/SQLite |
| 标识符 | HGNC/MGI 符号 或 NCBI Entrez ID |
| 注册 | 免费注册后下载(邮箱) |
| 许可 | 数据 CC BY 4.0;GSEA 软件 BSD-style |
| 例外 | BioCarta 子集免责;KEGG 子集许可限制 |
| 引文 | Subramanian 2005 PNAS 必引 + 按需 Liberzon 2011/2015、Castanza 2023 |
| 官方入口 | https://www.gsea-msigdb.org/gsea/msigdb |
§3.2 数据发布口径的地图
- 版本命名:年份.序号(2024.1 → 2025.1 → 2026.1);Human 加 .Hs、Mouse 加 .Mm 后缀——引用必须带全(如 v2026.1.Hs)。
- 集合数滚动:35,361(v2026.1.Hs)随每次发布变化——历史论文中的"31,322"(v7.5.1)或"33,196"是当时口径,不可直接对比。
- Ensembl 对齐:基因数据随 Ensembl 年度更新(2024.1→112、2025.1→114、2026.1→115)——ID 映射表的版本也是口径的一部分。
- 双物种口径:Human 与 Mouse 分别计数与发布;Mouse 集合 ≠ Human 集合的直译(M1/M5 重建、M7 独立来源)。
- 新集合的版本戳:M7(2025.1 引入)、C9(2026.1 引入)——版本历史在 gene set 页面可查(如 CUI_ILC_IL15_RESPONSE_UP “2025.1.Mm: First Introduced”)。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 4 | CC BY 4.0;下载需免费注册(邮箱) |
| 2 | A 可获得 | 获取流程 | 4 | 网页逐集 + 全量 GMT 包 + SQLite;无匿名 FTP |
| 3 | A 可获得 | 分发格式 | 5 | GMT/GRP/XML/JSON/TSV/JSON bundle/SQLite 全覆盖 |
| 4 | A 可获得 | 历史版本回溯 | 4 | release notes 完整;旧版直接下载入口一般 |
| 5 | D 文档 | 官方文档 | 5 | 集合详情页/方法指南/Data Formats/培训 |
| 6 | D 文档 | 方法透明度 | 5 | Hallmark 方法论论文 + 每集合 attribution |
| 7 | D 文档 | 引用规范 | 5 | 官网明确引文组合(2005 必引+按需) |
| 8 | I 互操作 | 标识符 FAIR | 4 | HGNC/MGI/Entrez 双轨;符号改名静默漂移 |
| 9 | I 互操作 | 本体对齐 | 5 | GO/HPO 原生内嵌;来源数据库全标注 |
| 10 | I 互操作 | 跨资源整合 | 5 | R/Python 生态全接入(msigdbr/fgsea/GSVA) |
| 11 | M 元数据 | 参数元数据 | 4 | 集合名/描述/来源/版本;成员级证据分层弱 |
| 12 | M 元数据 | 版本元数据 | 5 | 版本历史 per gene set + Ensembl 对齐戳 |
| 13 | S 可持续 | 治理机制 | 5 | UCSD+Broad 双机构;NCI 资助;20+ 年连续 |
| 14 | S 可持续 | 资源持续供给 | 5 | GSEA 生态标准地位;年度发布稳定 |
综合 63/70(4.5/5)——格式与生态互操作是满分项(SQLite/JSON/多语言包全接);扣分在注册墙与符号漂移两个工程细节。
§3.4 存储与计算需求
- 全量体积:GMT/JSON 全库数十 MB 级(压缩);SQLite 单文件——笔记本全装无压力。
- 内存:35,361 集全量入内存做富集(fgsea)< 2 GB——单机全谱分析完全可行。
- 打分矩阵:GSVA/ssGSEA 输出为样本 × 集合矩阵(如 5,000 样本 × 10,000 集合 = 千万级单元格)——列存格式(Parquet)推荐。
- 置换计算:GSEA 排列检验(1,000 次)在大集合多集合时计算上升——fgsea 的多级近似把成本压到秒级。
- 注册与合规:注册一次后脚本内使用本地快照——避免分析中途重下导致版本漂移。
§3.5 获取通道
- 网页浏览:Browse by collection/name、Search by keyword、gene set 详情页(成员/来源/版本历史/overlap 工具/表达谱视图)。
- 下载页:每个集合的 GMT(符号版/Entrez 版)+ JSON bundle;全库 SQLite。
- R/Bioconductor:msigdb 包(ExperimentHub,GeneSetCollection 对象;KEGG 需 appendKEGG());msigdbr(CRAN,tibble,多物种 ortholog)。
- GSEA desktop / GenePattern:图形界面运行 GSEA/ssGSEA(Java;4.4.0 需 Java 21)。
- Python 生态:gseapy(fgsea 算法 Python 实现 + msigdbr 数据桥)、decoupler(集合打分)。
- NDEx:gene set 以网络形式导出互动查看。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| Human 总集数 | 35,361(v2026.1.Hs) | 31,322(v7.5.1)/33,196(v7.x) | 永远带版本号 |
| Mouse 总集数 | 17,068(v2026.1.Mm) | 2025.1 前无 M7 | 版本戳 |
| Hallmark | 50(H 与 MH 同构) | “数百个癌症集合”(C6 189) | 50 是精选不是全部 |
| GO 集合 | 10,490(C5:GO) | GO 官网 4 万+ 术语 | MSigDB 只收有基因注释的术语 |
| 免疫集合 | C7 5,219(Human) | M7 787(Mouse) | 数字悬殊是来源不同 |
| 扰动签名 | C2:CGP 3,555 | C9 62(计算扰动) | 来源与粒度不同 |
§3.7 版本选择纪律
- 新分析:用当前版(v2026.1)——除非复现旧结果。
- 方法学三元组:MSigDB 版本 + 标识符版本(HGNC 日期/Ensembl 版)+ 集合过滤规则——写入论文方法节。
- 跨版本对比:gene set 页的 Version history 查集合级变更;集合成员 diff 是跨版本比较的前置动作。
- 快照存档:下载即存(文件名带版本)——分析中途不重下。
- Mouse 独立口径:不要用 Human v2026.1.Hs 配 Mouse v2025.1.Mm——双物种版本对齐。
§3.8 数据文件与字段详表
| 数据面 | 粒度 | 关键字段 |
|---|---|---|
| GMT 文件 | 每集合一行 | name、description、成员基因(符号/Entrez) |
| JSON bundle | 每集合一对象 | name、systematicName、pmid、sourceDatabase、description、geneSymbols、msigdbVersion |
| SQLite | 基因集×基因 对 | gene_set、gene、collection、subcollection、version |
| gene set 详情页 | 每集合 | 成员表(符号/Entrez/描述)、来源文献、贡献者、平台命名空间、版本历史、overlap 工具、表达谱 |
| Release notes | 每 release | 新增/更新集合清单、Ensembl 版本、集合数变化 |
| Mouse 侧 | 同上 | + mapping 方式(MGI ortholog vs native rebuild) |
§4 数据结构
§4.1 对象模型
MSigDB(版本 v2026.1)
├── Human(.Hs)
│ ├── H(50) hallmark:提炼集
│ ├── C1(302) positional:细胞遗传带
│ ├── C2(7,670) curated:CGP 3,555 + CP 4,115
│ │ └── CP 子集:REACTOME/WIKIPATHWAYS/KEGG_MEDICUS/BIOCARTA/PID/KEGG_LEGACY
│ ├── C3(3,714) regulatory:MIR 2,598 + TFT 1,116
│ ├── C4(1,006) computational:3CA/CGN/CM
│ ├── C5(16,283) ontology:GO:BP/CC/MF + HPO
│ ├── C6(189) oncogenic signatures
│ ├── C7(5,219) immunologic:ImmuneSigDB + VAX
│ ├── C8(866) cell type signatures
│ └── C9(62) computational perturbation signatures(2026.1 新增)
└── Mouse(.Mm)
├── MH(50) ortholog hallmark
├── M1/M2/M3/M5 物种特异或映射
├── M7(787) 免疫词典(2025.1)
└── M8 单细胞类型
§4.2 下载与 GMT 解析(Python)
#!/usr/bin/env python3
"""MSigDB GMT 下载与解析(以 Hallmark 为例)
官方下载页:https://www.gsea-msigdb.org/gsea/downloads.jsp
(免费注册后可获得直接下载链接;此处示例本地已有 GMT 文件)
"""
from pathlib import Path
def read_gmt(path: str) -> dict[str, tuple[str, list[str]]]:
"""GMT → {gene_set: (description, genes)}"""
out = {}
for line in Path(path).read_text().splitlines():
if not line.strip():
continue
parts = line.split("\t")
out[parts[0]] = (parts[1], [g for g in parts[2:] if g])
return out
h = read_gmt("msigdb_v2026.1.Hs_H.txt")
print("Hallmark 集数:", len(h)) # 50
name, genes = h["HALLMARK_APOPTOSIS"]
print("HALLMARK_APOPTOSIS:", len(genes), "genes") # 典型 ~160
print("样例成员:", genes[:5])
§4.3 msigdbr 全库获取(R/Python 双轨)
#!/usr/bin/env python3
"""gseapy 内置 msigdbr 数据桥(Python)"""
import gseapy as gp
# 全部 Human 集合(tibble 形式)
df = gp.get_library_name() # 可用库列表(版本随 gseapy 打包)
h = gp.get_library("MSigDB_Hallmark_2020") # Hallmark
c5 = gp.get_library("MSigDB_Gene_Ontology")
print("Hallmark 集数:", len(h))
# 富集分析一行流(enrichr 后端)
enr = gp.enrichr(gene_list=["TP53","BAX","CASP3","BCL2","FAS"],
gene_sets="MSigDB_Hallmark_2020",
outdir=None)
print(enr.res2d[["Term","Adjusted P-value","Overlap"]].head())
# R 侧:msigdbr + fgsea 标准管线
library(msigdbr); library(fgsea)
mdf <- msigdbr(species = "Homo sapiens", category = "H") # Hallmark
pathways <- split(mdf$gene_symbol, mdf$gs_name)
stats <- rnorm(20000, sd = 2); names(stats) <- sprintf("GENE%d", 1:20000)
fg <- fgseaMultilevel(pathways, stats, minSize = 15, maxSize = 500)
fg[order(fg$pval), ][1:5, c("pathway", "NES", "pval", "padj")]
§4.4 GSVA 通路活性矩阵构建
#!/usr/bin/env python3
"""GSVA:样本 × 通路活性矩阵(AI 特征化核心步骤)"""
import pandas as pd
from gsva import gsva # 或 R: GSVA::gsva()
# expr: DataFrame(基因 × 样本),index 为 HGNC 符号
# pathways: {gene_set: [genes]}
act = gsva(expr, pathways, method="gsva", min_sz=15, max_sz=500)
# act: DataFrame(通路 × 样本)——后续可直接接 ML 管线
act.T.to_parquet("pathway_activity.parquet")
print(act.shape) # (集合数, 样本数)
§4.5 Hallmark 与全库的集合选择策略
def choose_collections(analysis_goal: str) -> list[str]:
"""场景 → 集合选择策略(减少多重检验与语义稀释)"""
map_ = {
"差异表达解读": ["H", "C2:CP"], # 主题级 + 通路级
"药物机制": ["C2:CGP", "C6"], # 扰动签名
"免疫分析": ["C7"] if True else ["M7"],
"细胞组成": ["C8"],
"表型-基因": ["C5:HPO"],
"调控推断": ["C3"],
"全谱探索": ["H", "C2", "C5", "C7"], # 慎用:多重检验翻倍
}
return map_.get(analysis_goal, ["H"])
# 纪律:每加一个集合,FDR 负担翻倍——"H first, expand only with reason"
§4.6 Overlap 与集合冗余检测
#!/usr/bin/env python3
"""集合间重叠度:识别"伪独立"的重复集合"""
import itertools
import numpy as np
def jaccard(a: set, b: set) -> float:
return len(a & b) / max(1, len(a | b))
sets = {k: set(v[1]) for k, v in read_gmt("msigdb_v2026.1.Hs_C2_CGP.txt").items()}
keys = list(sets)[:500] # 抽样演示
J = np.zeros((len(keys), len(keys)))
for i, j in itertools.combinations(range(len(keys)), 2):
J[i, j] = jaccard(sets[keys[i]], sets[keys[j]])
hi = np.argwhere(J > 0.5)
print("Jaccard>0.5 的集合对数:", len(hi)) # CGP 里大量同源对(xxx_UP/DN 系列等)
§4.7 元数据与可复现指纹
import hashlib, json
fingerprint = {
"msigdb_version": "v2026.1.Hs",
"ensembl": 115,
"identifier": "HGNC_symbol",
"collections_used": ["H", "C2:CP"],
"filters": {"minSize": 15, "maxSize": 500},
"gmt_sha256": hashlib.sha256(open("msigdb_v2026.1.Hs_H.txt","rb").read()).hexdigest()[:16],
}
print(json.dumps(fingerprint, ensure_ascii=False, indent=1))
§4.8 完整性清单
发布/分析即检:
- GMT 行数 = 期望集合数(对照 release notes);
- 集合名唯一(重复名检测);
- 成员符号全部命中当前命名空间(未命中列表人工复核——HGNC 改名漂移);
- 集合大小分布报告(<15 与 >500 的比例);
- 版本三元组(MSigDB/Ensembl/下载日期)写入指纹。
§4.9 数据血缘
上游来源 MSigDB 处理 消费方
───────── ────────── ──────
Reactome/WikiPathways/KEGG ─▶ C2:CP 通路集 ─┐
BioCarta/PID ─▶ C2:CP │
PubMed 文献扰动实验 ─▶ C2:CGP/C6 ├─▶ GSEA/fgsea/ssGSEA/GSVA
GO/HPO 本体 ─▶ C5 本体集 │ clusterProfiler/camera/fry
miRDB/GTRD 靶点预测 ─▶ C3 调控集 │ AI 特征层(通路活性矩阵)
ImmuneSigDB/VAX ─▶ C7 免疫集 │
单细胞簇 marker ─▶ C8/M8 ┘
Mouse Immune Dictionary ─▶ M7(2025.1)
癌基因依赖转录响应 ─▶ C9(2026.1)
§4.10 集合过滤与统计指纹(实战代码)
#!/usr/bin/env python3
"""集合大小过滤 + 分析指纹生成(可复现性的最小实现)"""
import json
import hashlib
from collections import Counter
gmt = read_gmt("msigdb_v2026.1.Hs_all.txt") # §4.2 的解析函数
# 1) 大小过滤(惯例 15-500)
keep = {k: v for k, v in gmt.items() if 15 <= len(v[1]) <= 500}
sizes = Counter(len(v[1]) for v in gmt.values())
print(f"原始 {len(gmt)} 集 → 过滤后 {len(keep)} 集")
# 2) 重复成员检测(完全相同的集合)
seen, dup = {}, []
for k, (_, genes) in gmt.items():
sig = tuple(sorted(genes))
if sig in seen:
dup.append((k, seen[sig]))
seen[sig] = k
print("完全重复集合对:", dup[:5])
# 3) 分析指纹(写入实验记录/论文补充材料)
fingerprint = {
"msigdb": "v2026.1.Hs",
"n_sets_raw": len(gmt),
"n_sets_used": len(keep),
"size_filter": [15, 500],
"gmt_sha256": hashlib.sha256(
open("msigdb_v2026.1.Hs_all.txt", "rb").read()).hexdigest(),
}
Path("msigdb_fingerprint.json").write_text(
json.dumps(fingerprint, indent=1))
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 集合 | 方法 | 输出 |
|---|---|---|---|
| DEG 结果解读 | H + C2:CP | fgsea/clusterProfiler | 富集表 + leading edge |
| 单样本通路活性 | H | ssGSEA/GSVA | 样本×通路矩阵 |
| 药物机制假设 | C2:CGP + C6 | 反向富集(疾病签名 vs 药物签名) | 逆转/同向得分 |
| 免疫表型 | C7/M7 | 打分 + 解卷积 | TME 组成/状态 |
| 细胞注释 | C8/M8 | marker overlap | 类型标签 |
| TF/miRNA 活性 | C3 | 靶点集合打分 | 调控因子活性 |
| 罕见病候选 | C5:HPO | 表型集富集 | 候选基因表 |
| CNV 区域检查 | C1 | 带集合富集 | 区域效应报告 |
§5.2 差异表达 → 通路解读协议
- 全基因排序统计量选择(推荐 Wald z 或 signed -log10 p);
- 集合选择:H 起步(50 集,多重检验轻)→ 发现弱信号再扩 C2:CP;
- 过滤:minSize 15 / maxSize 500;
- 富集:fgseaMultilevel(R)或 gseapy(Python);FDR 0.05;
- leading edge 提取 → 核心驱动基因清单;
- 集合冗余检查:高重叠集合合并解释(如 E2F 系列集);
- 报告:版本三元组 + 排序统计量 + 过滤参数。
§5.3 通路活性特征化协议(AI 前置)
- 表达矩阵归一化(log/TMM/TPM 决策声明);
- GSVA/Hallmark 打分 → 通路活性矩阵(样本 × 50);
- 批次校正(如 ComBat)在打分后执行——通路层校正更稳;
- 模型输入(分类/生存/聚类)+ 特征重要性 → 通路级解释;
- 验证:置换标签 + 跨队列外部验证;
- 解读回到基因层:top 通路取 leading edge 溯源。
§5.4 药物-疾病反向富集协议
- 疾病签名:病例 vs 对照 top 差异基因(UP/DN 各 N 个);
- 药物签名库:C2:CGP 中的 xxx_UP/xxx_DN 对;
- 打分:连接性得分(UP 重叠 - DN 重叠);
- 逆转候选 = 药物签名与疾病签名反相关的集合;
- 文献复核 + 独立队列验证——候选只是假设。
§5.5 失败模式清单
- 阈值化输入:用 DEG 清单而非全排序——GSEA 的统计学前提被破坏;
- 集合滥用:一次跑 3.5 万集合——FDR 全线 0.9+;从 H 起步;
- 未声明排序统计量:log2FC vs z 排序结果不同;
- 小集病态:<15 基因的集合假阳性集中;
- CNV 混淆:肿瘤数据不查 C1 区域效应——把拷贝数变化当通路激活;
- 跨物种直推:Human 集合直接用于小鼠基因符号—— ortholog 映射缺失;
- 版本漂移:半年后重跑集合数变了——快照存档;
- 冗余误读:高重叠集合被当成独立证据——overlap 检查。
§5.6 校准与验证协议
- 阳性对照:已知机制的扰动数据应命中预期集合(如 EGF 刺激 → HALLMARK_EGFR_SIGNALING 类);
- 阴性对照:随机排序统计量下的 FDR 分布应为均匀;
- 敏感性:minSize/maxSize 扫描 → 结果集合稳定性;
- 跨集合家族:H 与 C2:CP 对同一数据的结果一致性检查;
- 外部复现:第二队列/GEO 公共数据重跑 → top 集合重现率。
§6 实证结果与方法学分析
§6.1 二十年增长的三段结构
- 2005-2011(方法期):GSEA 方法 + 初始集合(3.0 版本规范化);
- 2011-2020(扩张期):C1-C8 陆续成型(v7.x 时代 3 万+ 集合)——冗余问题显现;
- 2015/2020-2026(提炼与原生化期):Hallmark 提炼(2015)、Mouse 原生化(2023 论文)、M7 免疫(2025)、C9 扰动签名(2026)——从"多"到"精"再到"物种完整"。
§6.2 Hallmark 提炼的实证收益
- 8,380 → 50:压缩 167 倍,覆盖 C1-C6 的 4,022 个 founder 集合;
- 多重检验负担从万级降到 50——单次分析的计算与 FDR 成本同步下降;
- 表达验证剔除"不协调"基因——每集成为"协调响应单元";
- 后果:H 成为论文方法节的默认选择——"用 Hallmark 做 GSEA"成为可复现短语。
§6.3 集合冗余的实证规模
C2:CGP 中同源集合对大量存在(同一 GEO 数据集的不同截止阈值、UP/DN 对、系列时间点)——Jaccard>0.5 的集合对成百上千。直接全库富集的后果:top 结果被"一个生物学事件 × 十个集合变体"占据。纪律:overlap 检查或从 H 起步。
§6.4 Mouse 原生化的实证意义
Castanza 2023(Nature Methods)之前:小鼠数据研究者的选择是"把数据映射到人类集合"(ortholog 映射损耗)或"不用 GSEA"。之后:M1-M8 原生集合 + M7 免疫词典(2025)——小鼠免疫学研究获得与人类同等的富集基础设施。M1/M5 的"重建而非映射"决策(positional/ontology 物种特异)是方法论诚实:映射只在语义可映射处使用。
§6.5 八个真实坑点
- 坑点 1:阈值化输入——把 DEG 清单当 GSEA 输入;全排序才是方法前提。
- 坑点 2:全库轰炸——3.5 万集合一次跑完;FDR 稀释 + 冗余淹没;从 H 起步。
- 坑点 3:版本不写——"MSigDB 基因集"没有版本号不可复现;写 v2026.1.Hs。
- 坑点 4:跨物种直推——Human 集合用于小鼠符号;经 msigdbr ortholog 或用 M 系。
- 坑点 5:CNV 当通路——肿瘤数据不做 C1 区域检查;拷贝数区域效应污染结果。
- 坑点 6:冗余当独立——高重叠集合的重复命中当多证据;overlap 检查。
- 坑点 7:符号漂移——HGNC 改名使成员静默变化;标识符版本入指纹。
- 坑点 8:许可例外忽略——BioCarta/KEGG 子集的再分发限制;产品集成前核对。
§6.6 审稿人自查清单
- [ ] MSigDB 版本(v2026.1.Hs)+ Ensembl 版 + 下载日期?
- [ ] 排序统计量与方向约定(UP/DN 语义)?
- [ ] 集合选择及理由(为何 H 而非全库)?
- [ ] minSize/maxSize 与 FDR 方法?
- [ ] Mouse 数据用了 M 系或声明 ortholog 映射?
- [ ] leading edge 成员可溯源?
- [ ] CNV 数据的区域效应检查?
- [ ] 引文含 Subramanian 2005(+Castanza 2023 若用 Mouse)?
§6.7 版本治理的方法学含义
年度-半年发布 + Ensembl 对齐使 MSigDB 是"活的语义层":集合成员会因符号改名/来源更新而变化。可复现最小实践:版本三元组 + GMT 文件 SHA256 指纹 + 快照存档。gene set 页的 Version history 是集合级变更的权威记录。
§6.8 与其它本体资源的整合张力
MSigDB 内嵌 GO/HPO,但 C5 是"扁平化"(术语 → 基因集),丢失本体层级与证据码(IEA/EXP)。需要层级感知的分析(如 GO 所有子节点汇总)应回 GO 官方工具(topGO/GOstats);MSigDB 的价值在"跨源统一"不在"本体精读"。同理 HPO 的稀有度与深度信息需回 HPO 官方。
§6.9 集合语义的解读纪律
- C2:CP 是"专家版通路快照":Reactome 集合是上游版本的投影——引用机制细节回 Reactome 官网;
- CGP 是"条件性签名":xxx_UP 是"该扰动下上调"不是"该通路基因";
- H 是"协调响应核心":成员经表达验证,不是文献全收;
- C8 是"簇 marker":一个集合一种细胞类型,但 marker 跨研究不总一致。
§7 AI 就绪指南与应用场景
§7.1 MSigDB 在医疗 AI 中的四种喂法
- 特征工程:GSVA/ssGSEA → 样本 × 通路活性矩阵 → 低维语义特征(50 Hallmark 特征往往优于 2 万基因特征);
- 先验结构:基因集作为图/模型先验(通路约束的神经网络、group lasso 的组结构);
- 解释层:基因级模型的输出聚合到通路层——模型解释从"基因重要性"升维到"机制语句";
- 标签源:C6/CGP 扰动签名做弱监督("该样本像 MYC 激活"分类器)。
§7.2 通路活性挖掘管线实操配方
表达矩阵(基因×样本)→ 归一化 → GSVA 打分(H/C2:CP)
→ 批次校正 → 通路活性矩阵(Parquet)
→ ML 任务(分类/生存/聚类)→ 通路级特征重要性
→ leading edge 溯源 → 机制假设 → 外部验证
§7.3 模型选型与迁移决策
| 模型 | 何时用 | 注意 |
|---|---|---|
| group lasso(组=集合) | 特征选择 + 通路选择 | 组间重叠需处理(overlap group lasso) |
| 通路约束 GNN | 有基因-通路二部图 | 用 H 减少节点冗余 |
| GSVA + 梯度提升 | 小样本表格任务 | 50-1000 维输入最优 |
| PLM/基因嵌入 | 有序列/网络信息 | 通路打分作为协变量融合 |
| 弱监督(CGP 标签) | 无标注队列 | 标签噪声显式建模 |
§7.4 公平性:集合宇宙的覆盖偏倚
MSigDB 继承文献偏倚:癌症/免疫/代谢通路集合远多于罕见病与少数族裔健康研究通路;HPO 集合覆盖临床表型但颗粒不均。AI 后果:通路特征模型对"文献热点疾病"性能好、"冷门表型"失效。对策:per-disease 分桶评测;冷门场景补充原生本体(HPO 官方全量)而非依赖 MSigDB 投影。
§7.5 任务×资源速查表
| AI 任务 | MSigDB 用法 | 关键集合 | 评测要点 |
|---|---|---|---|
| 表型分类 | GSVA 特征 | H | 跨队列验证 |
| 生存预测 | 通路评分 Cox | H+C2:CP | C 指数 + 通路稳定性 |
| 药物响应 | 扰动签名特征 | C2:CGP+C6 | IC50 外部验证 |
| 细胞类型解卷积 | marker 集打分 | C8/M8 | 与流式/单细胞对照 |
| 免疫治疗响应 | 免疫签名 | C7/M7 | 队列 + 生境分层 |
| 机制发现 | 反向富集 | C2:CGP | 文献 + 独立数据验证 |
§7.6 端到端案例:肿瘤分型的通路级解释
1) TCGA RNA-seq(n=500)→ 归一化
2) GSVA × Hallmark 50 → 通路活性矩阵(500×50)
3) 共识聚类 → 3 个亚型
4) 亚型差异通路:HALLMARK_EMT(亚型A↑)、HALLMARK_INTERFERON_GAMMA_RESPONSE(亚型B↑)
5) leading edge 溯源 → EMT 驱动基因(VIM/CDH1 轴)
6) 外部验证:独立队列同管线 → 两通路重现
7) 产出:分型 + 机制语句 + 可复现管线(版本三元组入方法节)
§7.7 报告模板:方法学段落骨架
通路富集分析使用 MSigDB v2026.1.Hs(2026-01-30 发布,基因数据
对齐 Ensembl 115,标识符为 HGNC 符号;下载日期 <DATE>,GMT 文件
SHA256 <HASH>)。主分析使用 Hallmark 集合(n=50);扩展分析使用
C2 canonical pathways 子集(n=4,115)。基因集大小过滤为
15 ≤ size ≤ 500。GSEA 实现采用 fgseaMultilevel(R 4.x),
排序统计量为 DESeq2 Wald z,FDR 采用 Benjamini-Hochberg 校正
(阈值 0.05)。小鼠同源分析使用 msigdbr ortholog 映射(声明:
映射损耗已在补充材料讨论)。
§7.8 成本与排期模板
| 阶段 | 工作 | 预算 |
|---|---|---|
| 周 1 | 下载注册 + GMT 解析 + 版本指纹 | 0.5 人日 |
| 周 1-2 | 富集/打分管线搭建 + 对照验证 | 1-2 人日 |
| 周 2 | 集合选择实验(H vs CP vs 扩展) | 1 人日 |
| 周 3 | ML 任务接入(GSVA 特征)+ 调参 | 2-4 人日 |
| 周 4 | 外部验证 + 方法学写作 | 1-2 人日 |
§7.9 消融案例:特征层选择对分类性能的影响
同一 TCGA 分型任务的三档特征(示意性结论方向,具体以自算为准):
- 原始 2 万基因:过拟合风险高、解释为零;
- GSVA × 全库 1.6 万集合:维度灾难、FDR 冗余干扰特征选择;
- GSVA × Hallmark 50:维度最低、每维有机制名、性能常与全基因持平或更好。
教训:集合选择本身是超参数——H 是稳健默认,扩展需要理由与验证。
§8 伦理、许可与合规
§8.1 许可与义务结构
| 资产 | 许可 | 义务 |
|---|---|---|
| MSigDB 基因集(全部集合) | CC BY 4.0(© 2004-2026 Broad/MIT/UC) | 署名(引 Subramanian 2005 等) |
| GSEA 软件 | BSD-style 开源 | 许可声明 |
| BioCarta 子集 | BioCarta 免责声明附加(© 2000-2017) | 遵守其免责条款 |
| KEGG 子集 | 受 KEGG 许可限制 | 不违反 KEGG 非商业条款;Bioconductor 分发不含 |
| 注册账号 | 免费 | 邮箱用于资助报告 |
§8.2 引用与致谢模板
基因集注释来自 Molecular Signatures Database (MSigDB) v2026.1.Hs,
UC San Diego + Broad Institute(https://www.gsea-msigdb.org)。
方法引用:Subramanian A, Tamayo P, et al. Gene set enrichment
analysis: a knowledge-based approach for interpreting genome-wide
expression profiles. PNAS 2005;102(43):15545-15550.
集合引用:Liberzon A, et al. Cell Syst. 2015;1(6):417-425 (Hallmark)。
(使用 Mouse:另引 Castanza AS, et al. Nat Methods 2023.)
各基因集的原始来源文献见其详情页。
§8.3 国内合规路径
- CC BY 4.0 开放许可:科研/商业均可,署名义务必须履行;
- 数据为知识注释(无人类受试者数据)——不涉人类遗传资源出境审批;
- 产品集成(如生信云平台内置 MSigDB):CC BY 4.0 允许,署名页 + 版本声明 + KEGG/BioCarta 子集的单独处理(可剔除或替换);
- 商业软件内置建议:剔除 KEGG 子集或按 KEGG 商业许可另行授权。
§8.4 商业使用边界
- 允许:商业分析服务、生信软件集成、数据库产品(CC BY 4.0);
- 边界 1:KEGG_MEDICUS/KEGG_LEGACY 子集——KEGG 本体许可为非商业,商业产品应剔除或授权;
- 边界 2:BioCarta 子集免责条款随附;
- 边界 3:商标(GSEA/MSigDB 名称)按官方品牌惯例使用。
§8.5 合规台账最小模板
| 字段 | 示例 |
|---|---|
| 数据集 | MSigDB v2026.1.Hs(2026-01-30) |
| 下载 URL/日期 | gsea-msigdb.org/downloads / 2026-09-20 |
| 许可 | CC BY 4.0(Broad/MIT/UC) |
| 例外处理 | KEGG 子集已剔除(商业产品) |
| 署名方式 | Subramanian 2005 PNAS + 版本声明 |
| 使用场景 | 通路富集模块 |
| 再分发 | 附许可文本 + 版本戳 |
§8.6 治理语义
MSigDB 的治理是"双机构 + 方法论文驱动":UC San Diego(方法发明方)与 Broad(数据工程方)共建;每次方法论升级(GSEA 2005/Hallmark 2015/Mouse 2023)都伴随同行评议论文——数据演进有论文级的透明度。NCI 资助保证连续性;免费注册(资助报告)形成轻量问责闭环。
§9 谱系与生态
§9.1 基因集资源时间线
| 年份 | 事件 |
|---|---|
| 2003 | Mootha(GSEA 前身)Nat Genet |
| 2005 | GSEA/MSigDB 诞生(PNAS) |
| 2007-2011 | GO/KEGG/Reactome 集合陆续纳入;3.0 规范化 |
| 2011-2015 | C7 免疫/C8 细胞类型扩张;Hallmark 提炼(2015) |
| 2015-2022 | v7.x 时代:集合数破 3 万;单细胞 C8 |
| 2023 | Mouse 原生化(Nature Methods) |
| 2024 | 版本命名切换为年份制(2024.1,Ensembl 112) |
| 2025 | M7 免疫引入(Ensembl 114) |
| 2026 | C9 扰动签名引入(Ensembl 115) |
§9.2 术语表
| 术语 | 含义 |
|---|---|
| GSEA | 基因集富集分析(全排序加权检验) |
| GMT | Gene Matrix Transposed——每行一集合的 tab 格式 |
| Hallmark | 50 个提炼的协调表达主题集合 |
| NES | 归一化富集得分 |
| Leading edge | 贡献 ES 的成员子集 |
| ssGSEA | 单样本 GSEA 打分 |
| GSVA | 基因集变异分析(样本级通路活性) |
| CGP | chemical and genetic perturbations(化学/遗传扰动签名) |
| ImmuneSigDB | 免疫签名子库(C7 主体,4,872) |
| Ortholog mapping | 直系同源映射(人→鼠基因对应) |
| FDR | 假发现率(BH 校正) |
| HPO | 人类表型本体 |
| Competitive test | 集合基因 vs 其它基因的检验框架 |
| Connectivity score | 疾病签名与药物签名的逆转得分 |
§9.3 资源选型决策树
需要通路/基因集分析?
├─ 想要"开箱即用"的统一语义 ──▶ MSigDB(H 起步)
│ ├─ 有全排序 ──▶ GSEA/fgsea
│ ├─ 只有单样本 ──▶ ssGSEA/GSVA 打分
│ └─ Mouse 数据 ──▶ M 系原生集合(M7 免疫)
├─ 需要通路层级/反应细节 ──▶ Reactome 官方
├─ 需要本体精读(证据码/层级)──▶ GO/HPO 官方工具
├─ 需要调控因子活性分级 ──▶ DoRothEA/VIPER(可与 C3 互校)
└─ 商业产品需 KEGG ──▶ 向 KEGG 申请授权(勿用 MSigDB 内嵌子集绕许可)
§9.4 与本库其他条目的关系
- Reactome 条目:MSigDB CP:REACTOME(1,839 集)的上游——细节回源;
- GO 条目:C5:GO 的源头;MSigDB 是其"富集友好投影";
- HPO 条目:C5:HPO 的源头——罕见病富集的语义层;
- TCGA/GTEx 条目:典型消费方——表达数据 + MSigDB = 通路分析标准组合;
- IntAct 条目:蛋白互作网络与基因集的两层语义(边 vs 组)。
§9.5 组合使用建议
- MSigDB + TCGA:癌症分型/通路激活的标准管线;
- MSigDB + GTEx:正常组织基准 → 肿瘤偏离度;
- MSigDB + scRNA-seq:C8/M8 marker 打分做跨研究标签传递;
- MSigDB + DrugBank/CMap:扰动签名 + 药物靶点 = 再利用推理;
- MSigDB + HPO 官方:罕见病候选基因流程(富集 + 语义相似度)。
§9.6 基因集资源的生态角色
MSigDB 是基因集语义的"清算层":上游(本体/通路库/文献/计算)→ 统一封装(GMT)→ 下游(全部富集工具与 AI 管线)。它不追求上游的细节保真(那是源库的事),而追求"一次接入、处处可用"——与 IntAct 在互作领域的清算所角色同构。
§9.7 通路资源家族的光谱定位
结构精细 ◀────────────────────────▶ 使用便捷
Reactome KEGG GO WikiPathways MSigDB(CP) MSigDB(H)
(反应级) (本体级) (集合级) (主题级)
§9.8 MSigDB 生态的圈层地图
| 圈层 | 成员 | 关系 |
|---|---|---|
| 核心 | Human/Mouse MSigDB + GSEA 软件 | 同团队 |
| 上游 | Reactome/KEGG/WikiPathways/BioCarta/PID/GO/HPO/miRDB/GTRD | 来源库 |
| 签名源 | GEO 扰动实验/ImmuneSigDB/Mouse Immune Dictionary | 数据源 |
| 方法层 | fgsea/GSVA/ssGSEA/camera/fry/singscore/clusterProfiler | 消费算法 |
| 语言绑定 | msigdbr(CRAN)/msigdb(Bioconductor)/gseapy(PyPI) | 工程接入 |
| 终端 | TCGA/GTEx 分析、药物发现、AI 特征层 | 应用 |
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | URL |
|---|---|
| MSigDB 首页 | https://www.gsea-msigdb.org/gsea/msigdb |
| Human Collections | https://www.gsea-msigdb.org/gsea/msigdb/human/collections.jsp |
| Mouse Collections | https://www.gsea-msigdb.org/gsea/msigdb/mouse/collections.jsp |
| 下载页 | https://www.gsea-msigdb.org/gsea/downloads.jsp |
| GSEA 软件 | https://www.gsea-msigdb.org/gsea/downloads.jsp |
| Release Notes | https://www.gsea-msigdb.org/gsea/msigdb/notes.html |
| GitHub(GSEA-MSigDB) | https://github.com/GSEA-MSigDB |
| msigdbr(CRAN) | https://igordot.github.io/msigdbr/ |
| msigdb(Bioconductor) | https://bioconductor.org/packages/msigdb/ |
§10.2 关键文献
| 论文 | 价值 | 标识 |
|---|---|---|
| Subramanian 2005(方法) | GSEA + MSigDB 诞生 | PNAS 102(43):15545-15550; doi:10.1073/pnas.0506580102 |
| Mootha 2003(前身) | 方法雏形(线粒体疾病) | Nat Genet 34:267-273 |
| Liberzon 2011 | MSigDB 3.0 规范化 | Bioinformatics 27(12):1739-1740 |
| Liberzon 2015 | Hallmark 方法论 | Cell Systems 1(6):417-425 |
| Castanza 2023 | Mouse 原生化 | Nat Methods; doi:10.1038/s41592-023-02014-7 |
| Cui 2023 | Mouse Immune Dictionary(M7 源) | M7 引文 |
§10.3 站内延伸阅读
- Reactome 通路数据库 — CP:REACTOME 的上游(若已发布)
- Gene Ontology — C5:GO 的源头(若已发布)
- HPO 人类表型本体 — C5:HPO 的源头(若已发布)
- TCGA 癌症基因组图谱 — 标准消费方
- GTEx 组织表达数据库 — 正常组织基准
- IntAct 分子相互作用数据库 — 互作边与基因集的两层语义
§10.4 FAQ
Q1:MSigDB 和 GSEA 是什么关系?
GSEA 是方法/软件(UC San Diego + Broad),MSigDB 是配套基因集库——"方法 + 数据"一体两面;绝大多数 GSEA 论文用的集合来自 MSigDB。
Q2:当前版本有多少基因集?
Human v2026.1.Hs 共 35,361 个(九大集合);Mouse v2026.1.Mm 共 17,068 个(2026-01-30 发布,Ensembl 115)。
Q3:Hallmark 是什么?为什么大家都用它?
50 个提炼集合:从 C1-C6 的 8,380 集合聚类(600 簇)+ 人工评审得到 50 个生物学主题,成员经表达协调性验证(4,022 个 founder)。用它是因为低冗余 + 主题清晰 + 多重检验负担轻。
Q4:九大集合分别是什么?
H(Hallmark 50)、C1(位置 302)、C2(精选 7,670:扰动 CGP + 通路 CP)、C3(调控靶点 3,714)、C4(计算 1,006)、C5(本体 16,283:GO+HPO)、C6(癌症签名 189)、C7(免疫 5,219)、C8(细胞类型 866)、C9(扰动签名 62,2026.1 新增)。
Q5:Mouse 侧有哪些集合?
MH(50,对应 H)、M1(341)、M2(2,771)、M3(2,047)、M5(10,839)、M7(787 免疫,2025.1 引入)、M8(细胞类型)。多数经 MGI 同源映射,M1/M5 物种特异重建。
Q6:怎么引用?
必引 Subramanian et al. 2005 PNAS(方法);按需加 Liberzon 2011/2015;用 Mouse 必加 Castanza 2023 Nat Methods;每个基因集的来源文献见其详情页。
Q7:许可证是什么?
数据 CC BY 4.0(© 2004-2026 Broad/MIT/UC);GSEA 软件 BSD-style。两个例外:BioCarta 子集有独立免责声明;KEGG 子集受 KEGG 许可限制(商业产品应剔除或另授权)。
Q8:需要注册吗?
需要免费注册(邮箱)——目的仅是资助报告统计;注册后可下 GMT/SQLite/GSEA 软件。
Q9:GMT 格式是什么?
每行一个基因集:名称 + 描述 + 成员基因列表(tab 分隔)。GSEA 原生格式;fgsea/clusterProfiler 等都直接读。
Q10:基因用什么标识符?
双版本:HGNC(Human)/ MGI(Mouse)基因符号,或 NCBI Entrez ID——下载时选择;混用会导致映射失败。
Q11:ssGSEA 和 GSVA 的区别?
两者都是单样本通路打分:ssGSEA 用排序权重打分;GSVA 用核密度估计把表达转为"通路活性"。输出都是样本 × 通路矩阵——AI 特征工程的标准原料。
Q12:fgsea 和经典 GSEA 的区别?
fgsea 是 R 快速实现(多级近似置换),结果与经典 GSEA 一致但快几个量级;gseapy 是 Python 对应物。
Q13:应该用哪些集合做富集?
从 H(50 集)起步;有明确理由再扩(免疫→C7、调控→C3、表型→C5:HPO)。全库 3.5 万集合一次跑会让 FDR 稀释且冗余淹没结果。
Q14:集合大小怎么过滤?
惯例 15 ≤ size ≤ 500——小于 15 的集合方差大、大于 500 的稀释信号;参数入方法节。
Q15:C2:CGP 里的 xxx_UP/xxx_DN 是什么?
同一扰动(基因过表达/敲除/药物)的上调与下调基因集,成对出现——用于双向富集与"逆转签名"(药物再利用)分析。
Q16:C6 与 C2:CGP 的区别?
C6(189)是癌症基因扰动的 oncogenic signatures 专门集(microarray 直接定义);CGP 更大(3,555)且含非癌症扰动。
Q17:C9 是什么?什么时候有的?
computational perturbation signature gene sets——2026.1 新增(2026-01,62 集),初始为癌基因依赖的转录签名;与 CGP 的区别是来源为计算扰动签名管线。
Q18:Mouse M7 是什么?什么时候有的?
Mouse 免疫签名集合——2025.1 引入(787 集),全部来自 Mouse Immune Dictionary(Cui et al. 2023);使小鼠免疫分析不再依赖人源映射。
Q19:怎么把基因集用于机器学习?
GSVA/ssGSEA 把表达转为通路活性矩阵(样本 × 集合)——比 2 万基因特征低维且有机制名;Hallmark 50 是最常用的稳健特征层。
Q20:肿瘤数据为什么要查 C1?
拷贝数变异使染色体区域基因协调升降——这是"位置效应"不是通路激活;C1(302 个细胞带集合)作为区域效应检查可防止误读。
Q21:版本怎么管理?
版本三元组(MSigDB 版 + Ensembl 版 + 下载日期)+ GMT 文件 SHA256 指纹 + 快照存档;gene set 详情页有 per-集合版本历史。
Q22:跨物种怎么处理?
Mouse 数据用 M 系原生集合;必须用 Human 集合时经 msigdbr ortholog 映射(声明映射损耗);不要把人符号直接塞鼠基因。
Q23:KEGG 集合为什么有 LEGACY?
MSigDB 引入基于 KEGG MEDICUS(658 集)的新集合后,旧 KEGG 集合(186)标注为 legacy 保留——旧分析可复现,新分析建议 MEDICUS。
Q24:Bioconductor 的 msigdb 包为什么没有 KEGG?
许可限制:KEGG 不允许经第三方再分发;包提供 appendKEGG() 从 MSigDB 官方单独下载追加。
Q25:全排序输入是什么意思?
GSEA 假设输入是全部基因的排序(按统计量),不是阈值筛选后的 DEG 清单——阈值化破坏统计前提并损失"温和但协调"的信号。
Q26:leading edge 是什么?
贡献富集得分的成员子集——“机制前锋”;从集合级结果回到基因级解释的桥梁。
Q27:多重检验怎么控?
Benjamini-Hochberg FDR 为默认;集合间高度相关时 BH 会保守——集合选择(H 起步)比换校正方法更有效。
Q28:C8 的 marker 集和 xCell/CIBERSORT 什么关系?
思路同族(marker → 细胞组成推断);C8 是"基因集形态"——任何富集/打分工具都能消费;xCell/CIBERSORT 是封装好的打分引擎。
Q29:历史论文里的集合数对不上怎么办?
v7.5.1(31,322)、v7.x(33,196)、v2026.1(35,361)都是当时的正确口径——引用历史结果用当时版本;新分析用当前版。
Q30:怎么检查集合冗余?
对候选集合算 Jaccard/PWM 重叠(§4.6 代码);C2:CGP 内同源对极多——top 结果中的"一个事件 × 多集合"要合并解释。
Q31:MSigDB 里有 miRNA/TF 靶点吗?
有:C3(3,714)= MIR 2,598(miRDB 预测)+ TFT 1,116(GTRD ChIP-seq 预测)——用于调控因子活性推断;与 DoRothEA 互校更稳。
Q32:HPO 集合怎么用于罕见病?
患者表型 → 对应 HPO 术语基因集(C5,5,793)→ 与外显子组排序基因做富集/重叠 → 候选基因;与 Exomiser 类工具语义一致。
Q33:GSEA 4.4.0 有什么变化?
2025-03-08 发布:运行时更新到 Java 21、修 macOS 启动问题——算法与核心功能不变。
Q34:可以再分发 MSigDB 吗?
CC BY 4.0 允许(附署名与许可文本);但 KEGG 子集除外(许可限制)——再分发前剔除或单独处理;BioCarta 子集附其免责。
Q35:数据多久更新一次?
年-半年一版(2024.1 → 2025.1 → 2026.1);每次含来源库更新(GO/Reactome/WikiPathways/HPO)、Ensembl 对齐与新增集合。
Q36:一句话总结 MSigDB 的 AI-Ready 价值?
它把 3.5 万条生物学知识封装成统一的可计算单元(基因集),并提供了许可清晰、格式齐全、生态全接的工程底座——是"知识 → 特征"转换的标准桥梁。
Q37:camera/fry 和 GSEA 有什么区别?
camera/fry(limma 家族)显式校正基因间相关(inter-gene correlation)——样本量小或相关结构强时更稳;经典 GSEA 用置换检验部分覆盖该问题。报告时说明所用框架即可。
Q38:ORA(超几何富集)什么时候还能用?
只有阈值化基因清单(无全排序)时的降级选择——例如纯候选基因列表;它丢弃"温和协调变化"信息,应在论文中声明该局限。
Q39:C5 的 GO 集合和 GO 官方富集(topGO 等)怎么选?
需要证据码过滤、层级感知(父节点汇总子节点)或 IEA 剔除时用 GO 官方工具;MSigDB C5 是扁平化的"有注释基因"投影——快但丢失本体细节。
Q40:怎么快速把 MSigDB 接进已有 Python 管线?
两条路:gseapy 的 get_library(内置 msigdbr 数据)或直接读官方 GMT/SQLite 文件;都做大小过滤(15-500)与版本指纹后进入 fgsea 等价算法。
§10.5 要点回顾
- 定位:GSEA 生态的标准基因集库——UCSD + Broad 双机构二十年。
- 双物种双口径:Human 35,361 / Mouse 17,068(v2026.1)——分开计数、分开引用。
- Hallmark 优先:50 集 = 4,022 founders 提炼——低冗余的稳健起点。
- 集合选择是超参:从 H 起步、按理由扩展——全库轰炸是第一大坑。
- 全排序输入:阈值化 DEG 清单破坏 GSEA 前提。
- 版本三元组:MSigDB 版 + Ensembl 版 + 日期——可复现最小集。
- 许可例外:KEGG/BioCarta 子集单独处理——商业产品必查。
- 跨物种纪律:M 系原生或声明 ortholog 映射——别直推。
- CNV 检查:C1 区域效应——肿瘤数据的隐蔽坑。
- AI 特征层:GSVA × Hallmark = 50 维机制命名特征——比原始表达更稳。
口径存照(数字均注明口径与来源,写入正文前已核对)
- Human v2026.1.Hs 35,361 集合/9 大 collections;Mouse v2026.1.Mm 17,068 集合;2026-01-30 发布;Ensembl 115 = MSigDB 官网首页 + Human/Mouse Collections 页(gsea-msigdb.org)
- 集合明细:H 50 / C1 302 / C2 7,670(CGP 3,555 + CP 4,115:BIOCARTA 292/KEGG_MEDICUS 658/PID 196/REACTOME 1,839/WIKIPATHWAYS 925/KEGG_LEGACY 186)/ C3 3,714(MIR 2,598:MIRDB 2,377+legacy 221;TFT 1,116:GTRD 506+legacy 610)/ C4 1,006(3CA 148/CGN 427/CM 431)/ C5 16,283(GO 10,490:BP 7,538/CC 1,080/MF 1,872;HPO 5,793)/ C6 189 / C7 5,219(ImmuneSigDB 4,872+VAX 347)/ C8 866 / C9 62 = Human Collections 浏览页(v2026.1 口径)
- Mouse 明细:MH 50 / M1 341 / M2 2,771(CGP 984+CP 1,787:BIOCARTA 252/REACTOME 1,333/WIKIPATHWAYS 202)/ M3 2,047(miRDB 1,768+GTRD 279)/ M5 10,839 / M7 787 = Mouse Collections 页(v2026.1.Mm 口径)
- Hallmark 方法论:8,380 founder 候选 → 600 clusters → 43 clusters/50 主题(7 双主题)→ 4,022 founders → 表达验证提炼 = Liberzon 2015 Cell Systems 1(6):417-425(经 RNA Biosciences 指南交叉核对)
- 版本时间线:2024.1(2024-08-09,Ensembl 112)/ GSEA 4.4.0(2025-03-08,Java 21)/ 2025.1(2025-06-06,M7 787 集,Ensembl 114)/ 2026.1(2026-01-30,C9 62 集癌基因依赖签名,Ensembl 115)= 官网 What’s New + Release Notes + msigdbr Changelog
- 许可:CC BY 4.0(© 2004-2026 Broad Institute, Inc., MIT, Regents of UC);GSEA BSD-style(github.com/GSEA-MSigDB);BioCarta 免责(© 2000-2017 BioCarta);KEGG 许可限制(Bioconductor msigdb 不含,appendKEGG 追加);注册免费(资助报告)= 官网 License Terms + Bioconductor msigdb 手册
- 引文体系:Subramanian 2005 PNAS 102(43):15545-15550 必引 / Liberzon 2011 Bioinformatics 27(12):1739-1740 / Liberzon 2015 Cell Systems / Castanza 2023 Nat Methods(Mouse,doi:10.1038/s41592-023-02014-7)/ Cui 2023(Mouse Immune Dictionary)= 官网 Citing + Nature Methods 论文(PMC11397807)
- Mouse 构建机制:MGI 同源映射为主;M1(NCBI 基因信息)/M5(org.Mm.eg.db)物种特异重建 = Bioconductor msigdb 手册 + Castanza 2023
- M7 示例集合 CUI_ILC_IL15_RESPONSE_UP(“2025.1.Mm: First Introduced”;CC-BY-4.0 标注)= Mouse gene set 详情页
- 历史规模:v7.5.1 时代 31,322 集(Bioconductor vignette “31322 total”);v7.x 33,196(NCI CCR 课件);>25,000 签名描述(Bioconductor vignette)——历史口径随版本滚动
- msigdbr:26.1.0(2026-03-12,更新至 MSigDB v2026.1)/25.1.0(2025-07-03,v2025.1)/版本绑定 MSigDB release(自 24.1.0 起)= msigdbr Changelog(igordot.github.io/msigdbr)
- GSEA 方法:全排序 + 加权 ES + 置换检验 + leading edge = Subramanian 2005 PNAS(经多来源交叉核对)
- 资助:NIH NCI(Mouse 论文致谢 U24CA220341;官网 Funding “grant from the National Cancer Institute”)= 官网 + PMC11397807
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- intact — 共享标签:基因组学与多组学 / 药物发现与化学
- lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
- open-targets — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- pdb — 共享标签:基因组学与多组学 / 药物发现与化学
- hmdb — 共享标签:基因组学与多组学 / 药物发现与化学
- lincs-l1000 — 共享标签:基因组学与多组学 / 药物发现与化学
- ctd — 共享标签:基因组学与多组学 / 药物发现与化学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

