COSMIC — 肿瘤体细胞突变数据库 AI-Ready Wikipedia | 千方病案医数集

全球最大肿瘤体细胞突变知识库 · 3,205 万变异 · 20 年策展

来源 Wellcome Sanger Institute(英国) url: https://cancer.sanger.ac.uk/cosmic发布时间: 2026-09-06最后更新: 2026-09-06 阅读 11

信息速览

数据集名称COSMIC — 肿瘤体细胞突变数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型约 3,205 万唯一变异(v104),156.6 万份癌症样本,750+ 癌症基因(CGC),GRCh37/GRCh38 双装配,学术注册免费,商业需 QIAGEN 许可
规模156.6 万份癌症样本
接入方式Wellcome Sanger Institute(英国) url: https://cancer.sanger.ac.uk/cosmic
AI 就绪度

数据集封面

COSMIC — 全球最大肿瘤体细胞突变知识库 AI-Ready Wikipedia


INFOBOX

数据集名称 COSMIC(Catalogue of Somatic Mutations in Cancer)
英文全称 Catalogue of Somatic Mutations in Cancer
别名/简称 COSMIC、COSMIC Knowledgebase、cosmickb
疾病分类 肿瘤全谱(ICD-11 第二章 2A00–2F9Z 恶性肿瘤);重点映射:2C25 肺恶性肿瘤 / 2C60 乳腺恶性肿瘤 / 2B90 结肠恶性肿瘤 / 2B72 胃恶性肿瘤 / 2B70 食管恶性肿瘤(详见 §2.1)
SNOMED CT 363346000 Malignant neoplastic disease / 254837009 Malignant neoplasm of breast / 363406005 Malignant tumor of colon / 363358000 Malignant neoplasm of lung / 93655004 Malignant melanoma(详见 §2.2)
数据模态 基因组(体细胞变异注释知识库:点突变/插入缺失、拷贝数变异、基因融合、基因表达、甲基化)
AI 任务类型 变异注释与优先级排序、驱动基因/驱动突变识别、突变签名提取与拟合、生物标志物发现、药物靶点与耐药突变挖掘、面板设计
样本总数 v104(2026-05):约 3,205 万唯一基因组变异(COSV)/ 约 156.6 万份癌症样本 / 逾 30,206 篇文献 / 约 55,900 份全基因组筛查样本(按 v103 官方值 + v104 官方增量推算,详见 §3.2)
数据大小 核心 TSV/VCF 导出合计数十 GB(gzip,随版本增长;GRCh37 与 GRCh38 双装配分开下载)
数据格式 TSV(gzip)/ VCF(gzip)/ CSV / Web 查询与可视化
许可证 COSMIC Terms and Conditions:学术非营利注册免费;商业使用(含非营利机构的患者检测服务)须经 QIAGEN 付费许可;未经书面许可禁止再分发与 AI 模型训练
访问级别 注册后开放(学术)/ 商业许可(QIAGEN 独家发行)
DUO 标签 HMB, NPUNCU
语言 英文
首发日期 2004-02-04(Bamford et al., Br J Cancer;最初仅 4 个癌症基因)
最后更新 2026-05-19(v104;当前每年 5 月与 11 月两更)
发布机构 Wellcome Sanger Institute(Genome Research Limited,英国剑桥 Hinxton);商业发行:QIAGEN
官方主页 https://cancer.sanger.ac.uk/cosmichttps://www.cosmickb.org/
下载地址 https://cancer.sanger.ac.uk/cosmic/download(注册登录后;GRCh37grch37-cancer.sanger.ac.uk
DOI 10.1093/nar/gky1015(Tate 2019 主引用)/ 10.1093/nar/gkad986(Sondka 2024 当前版本论文)
引用次数 4,400+(Tate et al. 2019 单篇,OpenAlex/SciSpace 口径,截至 2026-09);COSMIC 系列论文累计被引超 10,000 次(QIAGEN 官方口径)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 专家策展质量与机器可读导出顶尖、稳定 COSV 标识符;扣分项:许可禁止无授权 AI 训练、无官方 ML 划分、双装配与实例/唯一变异口径需自行处理
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、肿瘤分子分型与临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(COSV 标识符体系、导出文件字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点(含许可合规)。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Wellcome Sanger Institute、Genome Research Limited、QIAGEN 无任何商业利益关联。本页面不分发 COSMIC 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 Sanger 或 QIAGEN 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。COSMIC 官方亦声明其数据仅供研究使用,不用于临床决策依据。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。COSMIC 学术用户须在 https://cancer.sanger.ac.uk/cosmic/register 注册并接受条款;条款 4.6 明确禁止在未获书面同意的情况下使用 COSMIC 数据训练任何人工智能模型;商业用途须经 QIAGEN 购买商业许可。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

COSMIC(肿瘤体细胞突变目录)是英国 Wellcome Sanger Institute 自 2004 年起维护的肿瘤体细胞突变专家策展知识库,当前版本 v104(2026 年 5 月)收录约 3,205 万个唯一基因组变异、约 156.6 万份癌症样本,全部由博士级策展团队从超过 3 万篇同行评审文献和 TCGA/ICGC 等大型队列中手工解读、标准化而来。

它是肿瘤基因组学的"黄页":当你在自己的样本里发现一个突变,第一个问题——“这个突变在别的癌症里见过吗?多常见?是不是驱动?有没有对应的药?”——几乎都要到 COSMIC 里查。其 Cancer Gene Census(750+ 癌症基因)与 Mutational Signatures(突变签名)两个子模块本身就是各自领域的国际标准,整个系列论文累计被引超过 10,000 次。

你可以用它来:给肿瘤测序变异做注释和驱动优先级排序、用突变签名推断肿瘤的致癌暴露史(吸烟、紫外线、HRD 等)、查询某个突变对应已上市或在研的靶向药物(Actionability 模块)。学术用户注册即免费使用;但请注意——未经许可,禁止用它训练 AI 模型。

§1.1 摘要

COSMIC 以"核心变异目录 + 六大解读模块"的架构组织:核心目录收录编码/非编码点突变与插入缺失(每个变异带稳定 COSV 标识符、HGVS 标准命名、GRCh37/GRCh38 双坐标)、拷贝数变异、基因融合、基因表达与差异甲基化数据;六大模块——Cancer Gene Census(癌症基因分级目录)、Hallmarks of Cancer(基因功能注释)、Cancer Mutation Census(驱动突变可能性分级)、Mutational Signatures(突变签名目录,当前 v3.6)、COSMIC-3D(蛋白三维结构可视化)、Actionability(精准肿瘤药物知识库,当前 v20)——在原始变异之上叠加专家解读层。数据来源分三条管线:手工策展(靶向筛查文献与 CGC 基因,这是 COSMIC 质量的根基)、半自动导入(TCGA/ICGC/PCGP/Sanger 的 WES/WGS 系统筛查)、计算整合(TCGA 表达与甲基化)。全部变异经 Ensembl VEP 标准化注释,交叉引用 HGNC/RefSeq/UniProt/CCDS,表型映射 NCI Thesaurus 与 EFO 编码。更新节奏为每年 5 月与 11 月两更,官方支持最新版加前三个版本。

§1.2 战略价值分析

策展质量维度:在自动化抓取大行其道的时代,COSMIC 反其道而行——每条核心变异都由博士级科学策展人阅读原文、解读图表、按统一术语(组织部位-组织学配对体系、HGVS 命名、体细胞状态分级)手工录入,每份样本最多附 45 个策展元数据点。这种"慢工艺"使其成为临床变异解读的事实金标准:当实验室需要判断一个变异是体细胞还是胚系、是驱动还是乘客时,COSMIC 的 “Confirmed somatic variant” 标记与 CGC 基因分级是最常被引用的裁决依据。v104 的 release notes 甚至记录了将两篇既往文献的 658 条变异改判为 “Variant of unknown origin” 的质量回溯——这种持续的纠错机制是纯计算数据库无法提供的。

标准制定维度:COSMIC 的子模块多次定义了整个领域的参考系。Cancer Gene Census 从 2004 年 Futreal 等人的 291 基因普查起步,如今 750+ 基因的 Tier 1/Tier 2 分级是所有癌症基因 panel 设计与驱动基因工具(IntOGen、dNdScv)评估的对照基准;Mutational Signatures 与 Alexandrov 实验室合作维护,96 通道 SBS 签名目录(v3.6)是"突变签名学"这一子学科的共同语言——从 HRD 检测到 PARP 抑制剂用药决策,全球的签名分析都在引用 COSMIC 版本号。

可持续模式维度:COSMIC 还是学术基础设施商业化的教科书案例。2015 年起建立商业许可,2021 年 2 月将独家商业发行权授予 QIAGEN,用商业收入反哺免费学术访问——95% 以上的用户(学术界与医疗系统)继续免费。这套"学术免费 + 商业付费"的混合模式使其摆脱了对短期慈善拨款的依赖,团队从 9 人扩张到 28 人,成为少数能自我维持的超大规模生物信息学资源。

§1.3 横向对比

资源 规模 策展方式 许可 核心差异化
COSMIC ~3,205 万唯一变异 / 156.6 万样本(v104) 博士级手工策展 + 半自动 WGS 导入 学术注册免费;商业 QIAGEN 付费;禁无授权 AI 训练 规模最大、覆盖全部变异类型;CGC + 签名 + Actionability 全栈解读
ClinVar ~数百万变异(以胚系为主) 提交者申报 + 专家小组 完全开放(公共领域) 胚系变异临床解读标准;体细胞覆盖弱
CIViC ~数千变异-疾病-药物证据项 社区众包策展 CC0 完全开放 临床证据条目精细、可自由再分发;规模远小于 COSMIC
OncoKB ~数千变异(临床级注释) MSK 专家策展 学术免费/商业付费 治疗导向的证据分级(Level 1-4);覆盖窄而深
TCGA/MC3 ~330 万变异(约 1 万患者) 统一多 callers 重新call 开放(受控数据除外) 原始队列数据可重分析;无跨文献整合
AACR GENIE ~数十万样本的 panel 测序 多中心真实世界汇总 研究使用协议 真实世界临床-panel 数据;非知识库
IntOGen 驱动基因计算分析平台 计算 pipeline 开放 驱动基因发现工具;数据多源自 COSMIC/TCGA

COSMIC 的不可替代性在于三点:跨文献的手工策展规模(3 万余篇论文是任何单一队列无法比拟的知识密度)、"变异 → 基因 → 功能 → 签名 → 药物"的全栈解读层、以及二十年的版本连续性(2004 年创立以来的每一版都可追溯)。

§1.4 版本演进时间轴

时间 事件
2004-02-04 COSMIC 上线(Mike Stratton 团队,Wellcome Sanger Institute);初始仅 BRAF/HRAS/KRAS2/NRAS 四个癌症基因的体细胞突变普查;Bamford et al., Br J Cancer 91:355-358
2004 Futreal et al. 发表 “A census of human cancer genes”(Nat Rev Cancer 4:177-183,291 基因)——Cancer Gene Census 起点
2011 Forbes et al. “COSMIC: mining complete cancer genomes”(NAR)——进入全基因组时代
2013-03 Alexandrov et al.(Nature 500:415-421)发表 21 种突变签名——签名学奠基,后纳入 COSMIC
2015-03 启动商业许可计划(学术继续免费)
2017-01 Forbes et al. 高分辨率版(NAR 45:D777-D783)
2017 COSMIC-3D 发布(Jubb et al., Nat Genet 49:1076-1078)
2018-08 v86:约 600 万编码突变 / 140 万样本 / 2.6 万文献(Tate 2019 论文对应版本)
2018-11 Sondka et al. CGC 论文(Nat Rev Cancer 18:696-705,719 基因 + Hallmarks 注释)
2019-01-08 Tate et al. 当前主引用论文发表(NAR 47:D941-D947,DOI: 10.1093/nar/gky1015)
2019-05 v89:Mutational Signatures v3.0 正式并入 COSMIC
2020-02 Alexandrov et al.(Nature 578:94-101)PCAWG 签名图谱(v3 目录核心依据)
2021-02 QIAGEN 获得 COSMIC 独家商业发行权(GenomeWeb 报道)
2021-03 v93:签名 v3.2
2022-05 v95:签名 v3.3
2023 v98:签名 v3.4(86 SBS / 11 DBS / 18 ID / 21 CN / 16 SV)
2024-01-05 Sondka et al. 当前版本论文发表(NAR 52:D1210-D1217,DOI: 10.1093/nar/gkad986)
2024-05-21 v100:20 周年、第 100 版;新增 Experimental Signatures 集合;BRAF/RAS 策展焦点;更新节奏转为每年两更
2025-11-18 v103:结直肠癌(含早发型)策展焦点;CGC 净增 5 基因(APOBEC3B 移出);签名 v3.5;Actionability v18
2026-05-19 v104:胃癌/食管癌策展焦点;+680 万变异;CGC +5 基因(GNA13/PRKCI Tier 1);签名 v3.6;Actionability v20(843 基因)

§1.5 典型 AI 应用场景

  1. 肿瘤变异注释与驱动优先级排序:将患者 VCF 与 COSMIC 比对,标注变异在多少癌症样本中出现过、是否位于 CGC 基因、CMC 驱动可能性等级——这是肿瘤 NGS 报告生成的标准环节。
  2. 突变签名分析:用 COSMIC v3.6 参考签名对肿瘤 WGS/WES 做 refit,推断 HRD(SBS3)、MMR 缺陷(SBS6/15/20/21/26/44)、吸烟(SBS4)、紫外线(SBS7a-d)等致癌过程,辅助 PARP 抑制剂与免疫治疗决策。
  3. 精准肿瘤学与药物研发:经 Actionability 模块查询"变异 → 疾病 → 药物"证据链(843 基因、7,571 种治疗组合、8,493 项有结果临床试验),支持临床试验入组筛选与伴随诊断开发。
  4. 癌症基因 panel 与生信流程基准:以 CGC Tier 1 基因为金标准评估驱动基因预测工具(dNdScv、MutSigCV、机器学习打分器)的召回率与假阳性。
  5. 细胞系模型选择:用 Cell Lines Project(1,020 个细胞系)按突变谱挑选携带目标变异的实验模型,或评估细胞系与患者队列的代表性差距。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

COSMIC 覆盖 ICD-11 第二章(Neoplasms)全部恶性肿瘤谱系,v103 口径达 6,800 种精确癌症分型(解剖部位-组织学配对)。重点癌种映射如下:

ICD-11 中文名称 COSMIC 中的代表性内容
2C25 肺恶性肿瘤 EGFR/KRAS/ALK 变异全集;吸烟签名 SBS4;TRACERx 来源 RNA 签名
2C60–2C6Z 乳腺恶性肿瘤 PIK3CA/TP53/GATA3 高频变异;HRD 签名 SBS3 与 BRCA1/2
2B90 结肠恶性肿瘤 v103 策展焦点;APC/KRAS/BRAF;早发型结直肠癌(EOCRC)专题;colibactin 签名 SBS88
2B93 直肠恶性肿瘤 同上(结直肠合并策展)
2B72 胃恶性肿瘤 v104 策展焦点;40% 新增文献集中于胃与食管癌
2B70 食管恶性肿瘤 v104 策展焦点
2C30 皮肤恶性黑色素瘤 BRAF V600E/NRAS;紫外线签名 SBS7a-d
2C12 肝恶性肿瘤 黄曲霉毒素签名 SBS24;肝硬化等癌前状态亦收录
2A60–2B3Z 白血病/淋巴瘤等血液肿瘤 GNA13(v104 新增,Burkitt/DLBCL);UBTF、RELA(v103 新增)
2C82 前列腺恶性肿瘤 SPOP/FOXA1;TMPRSS2-ERG 融合
2C10 胰腺恶性肿瘤 KRAS G12 系列高频突变

除恶性肿瘤外,COSMIC 还收录部分癌前状态(如肝硬化)与肿瘤生物学相关综合征(如 Proteus 过度生长综合征)的体细胞变异。

§2.2 SNOMED CT 映射

临床场景 ICD-11 SNOMED CT SNOMED CT 术语
恶性肿瘤(总称) 2A00–2F9Z 363346000 Malignant neoplastic disease (disorder)
肿瘤(总称) 见各部位 55342001 Neoplastic disease (disorder)
肺癌 2C25 363358000 Malignant neoplasm of lung (disorder)
乳腺癌 2C60 254837009 Malignant neoplasm of breast (disorder)
结肠癌 2B90 363406005 Malignant tumor of colon (disorder)
前列腺癌 2C82 399068003 Malignant tumor of prostate (disorder)
黑色素瘤 2C30 93655004 Malignant melanoma (disorder)
体细胞变异(概念) 49755003 Mutation, somatic (morphologic abnormality)

§2.3 疾病简介

癌症是一组由体细胞突变积累驱动的基因组疾病:正常细胞在致癌物暴露、DNA 修复缺陷或复制错误的作用下累积变异,其中极少数"驱动突变"赋予细胞生长优势,经克隆选择最终形成肿瘤。据 WHO/GLOBOCAN 估计,全球每年新发癌症约 2,000 万例、死亡约 1,000 万例,癌症是仅次于心血管疾病的第二大死因。过去二十年,测序技术把肿瘤诊疗从"按器官分类"推向"按分子分型"——同一个 KRAS G12C 突变可以出现在肺癌、结直肠癌和胰腺癌中,并对应同一款靶向药(sotorasib)。这种"以突变为中心"的诊疗范式,正是 COSMIC 这类跨癌种变异知识库存在和发展的根本动因。

§2.4 临床任务定义

任务 临床定义 标准参考 在 COSMIC 中的操作化
体细胞变异确认 区分肿瘤特有变异与胚系/测序伪影 AMP/ASCO/CAP 2017 指南(Li et al., J Mol Diagn) MUTATION_SOMATIC_STATUS = "Confirmed somatic variant" 过滤
驱动基因判定 有因果证据的癌症基因 CGC Tier 1/Tier 2 分级(Sondka 2018) cancer_gene_census.csv 的 Tier 列
驱动突变分级 编码突变的致病可能性排序 CMC(Cancer Mutation Census)统计 + 多源证据 CMC 模块的 driver likelihood 分层(当前仅 GRCh37)
致癌暴露推断 从突变谱反推突变过程 COSMIC Mutational Signatures v3.6 96 通道 SBS 签名 refit(SigProfilerAssignment)
治疗靶点匹配 变异-疾病-药物证据链 AMP/ASCO/CAP Tier I-IV;COSMIC Actionability Actionability v20 的 mutation-disease-drug 三元组
耐药机制识别 治疗后出现的耐药突变 COSMIC Resistance Mutations 目录 CosmicResistanceMutations.tsv.gz 查询

§2.5 患者与样本人群特征

COSMIC 是文献与队列的整合知识库,而非单一人群队列。其"人群"特征如下:

维度 特征
数据来源 30,206 篇同行评审文献(v104 口径推算)+ TCGA、ICGC、PCGP(儿童癌症基因组计划)、Sanger 内部研究的系统筛查 + 1,020 个癌症细胞系
样本规模 约 156.6 万份癌症样本(v104 推算;其中全基因组筛查样本约 55,900 份)
癌症分型粒度 6,800 种解剖部位-组织学精确分型(v103 口径)
策展元数据 每样本最多 45 个数据点:种族、年龄、性别、肿瘤分期、药物反应、激素受体状态(如 HER2)等
样本类型 原发肿瘤、转移灶、复发灶、细胞系、异种移植模型(PDX);同一患者可有多个样本
地理/人群 全球文献整合;WGS/WES 部分受 TCGA/ICGC 队列构成影响,欧洲祖源占比偏高(详见 §7.1)
时间跨度 文献覆盖 2004 年至今的持续策展;收录数据本身跨越测序技术多个时代(Sanger 测序 → 芯片 → NGS panel → WES/WGS)

重要提醒:156.6 万是"样本"而非"患者"——同一患者的原发/复发/转移样本分别计数,1,020 个细胞系亦计入;且同一肿瘤可能同时经文献与 TCGA/ICGC 两条路径入库。任何涉及"人数"的统计都必须先理解这一点(见 §6.5 坑点 6)。

§2.6 金标准/参考标准

数据层 产生方式 产生者 金标准性质
核心体细胞变异(手工策展) 博士级策展人阅读原文,按统一术语与 HGVS 命名手工录入,每条可回溯至文献与图表 COSMIC 科学策展团队(Wellcome Sanger Institute) 领域公认的手工策展金标准;含持续纠错回溯(如 v104 对 658 条记录的体细胞状态改判)
系统筛查变异(半自动) TCGA/ICGC/PCGP/Sanger 的 WES/WGS 统一管道导入 各原始联盟 + COSMIC 半自动管线 计算策展,覆盖全基因组;未经逐条人工复核
Cancer Gene Census 文献证据规则化评审 + 定期重审(可增删基因、调整 Tier) COSMIC 策展团队 癌症基因领域最权威的分级目录(Tier 1 = 充分证据)
Mutational Signatures SigProfiler 系列在 2,780 个 WGS 上提取 + 1,800 基因组/19,000 外显子稳定性验证 + 实验验证 Alexandrov Lab(UCSD)与 COSMIC 联合维护 突变签名学国际标准(v3.6)
Actionability 证据 从临床试验数据库、监管机构、文献手工策展"变异-疾病-药物"关系 COSMIC 策展团队 精准肿瘤学结构化证据库(v20,843 基因)
变异标准化注释 Ensembl VEP 统一注释,HGVS 命名,HGNC/RefSeq/UniProt/CCDS 交叉引用 COSMIC 数据管线 机器可读标准层;COSV 稳定标识符

§3 数据集规格

§3.0 版本抉择矩阵

COSMIC 的"版本抉择"首先是许可抉择,其次是装配与模块抉择。30 秒选型:

你的需求 推荐版本/路径 大小 理由
学术研究(论文、内部生信分析) 最新版 v104(GRCh38)cancer.sanger.ac.uk 注册下载 数十 GB(gzip) 官方仅支持最新版 + 前三个版本;GRCh38 为当代管线默认装配
复现 2023-2025 年签名分析论文 v3.4 签名 + 对应 COSMIC 版本(v98-v103) 签名矩阵仅 MB 级 签名目录独立版本化;论文多基于 v3.4,跨版本比较须注明(见 §6.5 坑点 7)
驱动突变分级(CMC) GRCh37 站点下载 随模块 CMC 当前仅在 GRCh37 装配更新,勿在 GRCh38 站点寻找
商业产品/患者检测/诊断 QIAGEN 商业许可(QDI 门户) 按订阅 任何营利使用、以及非营利机构面向个人健康的检测服务,均属商业用途
仅浏览/单个变异核查 网站在线查询(COSMIC-3D 与签名站免注册) 零成本;批量使用必须注册并走官方下载
教学/演示 官网 sample data(QIAGEN 提供免费样例数据) MB 级 免注册体验文件结构

一句话结论:学术新课题一律用最新版 GRCh38;签名分析锁定论文所用签名版本;CMC 去 GRCh37 站点;商用找 QIAGEN。

§3.1 模态详细说明

COSMIC 的核心是变异注释知识库,包含五大变异模态:

  1. 点突变与插入缺失(编码):v104 约 588 万唯一编码变异(推算),每条带 HGVS 基因组/cDNA/蛋白三级命名、Ensembl VEP 后果预测、体细胞状态、样本与组织学关联。
  2. 非编码变异:v104 约 2,193 万唯一非编码变异(推算),含内含子与基因间区变异(约 1,223 万位于内含子及其他基因内区域)。
  3. 拷贝数变异(CNA):120.7 万条(v103 口径),源自 TCGA 管道,以基因级 gain/loss 标记。
  4. 基因融合与结构变异:19,428 个基因融合(v103 口径),含断点坐标与组织来源。
  5. 基因表达与甲基化:921.5 万条表达变异与 793.0 万差异甲基化 CpG(均源自 TCGA,v103 口径),以过表达/低表达与高低甲基化标记。

叠加其上的六大解读模块见 §1.1;其中 Cell Lines Project 提供 1,020 个癌症细胞系的突变、CNA、融合与表达谱。

§3.2 样本量拆分

v103(2025-11-18)官方精确统计cancer.sanger.ac.uk/cosmic/release_notes):

指标 数量 较 v102 增量
唯一基因组变异总数(COSV) 25,245,182 +230,921
其中:非编码基因组变异 17,188,599 +151,523
其中:外显子编码变异 5,599,374 +99,229
其中:内含子及其他基因内区域变异 9,442,453 +77,520
癌症样本 1,552,265 +9,869
策展文献 30,023 +173
全基因组筛查样本 52,896 +3,394

v104(2026-05-19)官方增量与推算总量

指标 v104 增量 v104 推算总量
唯一基因组变异(COSV) +6,805,494 ≈ 32,050,676
非编码基因组变异 +4,737,298 ≈ 21,925,897
外显子编码变异 +283,535 ≈ 5,882,909
内含子及其他基因内区域变异 +2,789,065 ≈ 12,231,518
癌症样本 +14,100 ≈ 1,566,365
策展文献 +183 ≈ 30,206
全基因组筛查样本 +3,004 ≈ 55,900

其他模态(v103,QIAGEN 数据表口径):19,428 基因融合;1,207,190 CNV;9,215,470 表达变异(TCGA);7,930,489 差异甲基化 CpG(TCGA);6,800 种精确癌症分型;1,020 个细胞系;突变-样本实例(legacy 计数口径)超 3,800 万条。

§3.3 数据格式详情

形态 格式 说明
下载导出 TSV(.tsv.gz)/ VCF(.vcf.gz + .tbi)/ CSV 按 GRCh37 与 GRCh38 两个站点分别提供;含随附 README 说明文件结构与版本
Web 查询 cancer.sanger.ac.uk/cosmic 基因/变异/样本/组织多维度交互查询,核心内容需注册
免注册模块 COSMIC-3D(cosmic3d)、Mutational Signatures(signatures) 蛋白结构可视化与签名目录在线浏览
商业通道 QIAGEN Digital Insights(QDI 门户) 商业许可用户的下载与 API 支持
在线工具 Signature Assignment(签名拟合)、COSMIC-3D 上传自有突变谱在线分析(注册)

§3.4 存储大小

形态 大小 备注
核心 TSV/VCF 导出(单装配) 数十 GB(gzip) CosmicMutantExport.tsv.gz 为最大单文件;随版本持续增长
GRCh37 + GRCh38 双装配全套 约两倍单装配 多数用户只需其一
签名矩阵与 CGC MB 级 轻量,可直接进 R/Python
本地分析建议磁盘 ≥200 GB 含解压、中间结果与 DuckDB/索引文件

§3.5 标注方式

COSMIC 采用三分支策展(Sondka et al. 2024, Fig 2):

数据产生源头
├─ 靶向筛查文献(1–400 基因 panel 研究)
│    └─ 全手工策展:策展人读原文 → 标准化组织学/命名 → 录入(最高质量层)
├─ CGC 基因相关文献
│    └─ 全手工策展(含 Hallmarks 功能注释、耐药突变解读)
├─ 系统性 WES/WGS 筛查(TCGA / ICGC / PCGP / Sanger)
│    └─ 半自动导入:统一变异调用 → VEP 注释 → 元数据手工标准化
└─ TCGA 表达 / 甲基化 / CNA
     └─ 计算整合:按基因-样本对齐导入,阈值化标记

所有变异统一经 Ensembl VEP 注释并赋予稳定 COSV 标识符(关联 GRCh37/GRCh38 双坐标);legacy COSM(编码)与 COSN(非编码)标识符提供到 COSV 的官方映射。

§3.6 标注者资质

核心策展由 COSMIC 内部博士级科学策展团队完成,成员专长于癌症遗传学;团队规模约 28 人(2021 年 GenomeWeb 报道口径)。每版发布前经内部质量控制流程;并设有"每版聚焦一个癌种/基因主题"的深度策展机制(v103 = 结直肠癌、v104 = 胃癌/食管癌)。Hallmarks、CGC 分级、耐药突变等解读型内容须经多源实验证据交叉评审;CGC 基因定期重审,不符合证据标准的基因会被移出(如 v103 移出 APOBEC3B)。

§3.7 数据采集时间范围

文献策展自 2004 年持续进行(逾 20 年);收录的底层数据横跨 Sanger 测序时代至当代 WGS。数据库本体 2004-02-04 上线,当前每年 5 月与 11 月两次发布;官方仅支持最新版与前三个版本(条款 4.12)。

§3.8 地理覆盖

全球文献与公共队列整合;策展中心位于英国剑桥 Hinxton 的 Wellcome Genome Campus。系统性筛查部分(TCGA 以美国人群为主、ICGC 多国)带来人群构成上的欧洲祖源偏斜(见 §7.1)。

§3.9 采集设备规格

环节 系统/方法 说明
变异标准化 Ensembl VEP 统一转录本后果注释、HGVS 命名
参考装配 GRCh37 / GRCh38 双站点 坐标与文件分站点发布,CMC 仅 GRCh37
签名提取 SigProfiler 工具链(SigProfilerMatrixGenerator/Extractor/Assignment) v3.6 目录的技术基础
结构可视化 COSMIC-3D(基于 PDBe 结构数据) 免注册
数据交付 官方网站下载中心 + QIAGEN QDI 门户 禁止爬虫(条款 4.4.6/4.4.7)

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 原始证据 同行评审论文(30,206 篇)、TCGA/ICGC/PCGP/Sanger 数据集 变异与表型以异构格式发表于全球文献
2. 策展解读 博士级策展人手工阅读 + 半自动导入管线 统一组织部位-组织学配对、样本元数据(最多 45 点/样本)、体细胞状态判定
3. 标准化注释 Ensembl VEP + HGVS + HGNC/RefSeq/UniProt/CCDS 交叉引用 异构命名 → 标准变异描述;GRCh37/38 双坐标
4. 标识符赋码 COSV 稳定基因组变异 ID(legacy COSM/COSN 官方映射) 变异跨版本可追踪、跨装配可互操作
5. 解读层叠加 CGC / Hallmarks / CMC / Signatures / Actionability / Resistance 变异 → 基因角色 → 功能机制 → 突变过程 → 药物证据
6. 发布 cancer.sanger.ac.uk(GRCh38)+ grch37 站点 + QIAGEN QDI 每年 5/11 月两更;学术注册免费、商业付费

§4 数据结构详解

§4.0 目录结构预览

注册登录后,下载中心按"装配 → 版本 → 文件"组织(示意,实际文件名以当版为准):

cosmic_v104_GRCh38/
├── CosmicMutantExport.tsv.gz              # 编码突变全量导出(最大文件;每行 = 突变×样本实例)
├── CosmicMutantExportCensus.tsv.gz        # 仅 CGC 基因的编码突变子集
├── CosmicCodingMuts.vcf.gz                # 编码突变 VCF(+ .tbi 索引)
├── CosmicNonCodingVariants.vcf.gz         # 非编码变异 VCF(+ .tbi 索引)
├── CosmicCompleteCNA.tsv.gz               # 拷贝数变异(TCGA 管道)
├── CosmicCompleteGeneExpression.tsv.gz    # 基因表达变异(TCGA)
├── CosmicCompleteDifferentialMethylation.tsv.gz  # 差异甲基化(TCGA)
├── CosmicFusionExport.tsv.gz              # 基因融合
├── CosmicStructExport.tsv.gz              # 结构变异/断点
├── CosmicResistanceMutations.tsv.gz       # 耐药突变目录
├── CosmicSample.tsv.gz                    # 样本元数据(组织部位/组织学/来源/文献关联)
├── cancer_gene_census.csv                 # Cancer Gene Census(750+ 基因)
├── cell_lines/                            # Cell Lines Project 专项文件(1,020 细胞系)
├── signatures/                            # Mutational Signatures v3.6 矩阵与定义
├── CosmicHGNC.tsv.gz                      # 基因字典(HGNC 交叉引用)
└── README                                 # 当版文件结构与变更说明(必读)

§4.1 DAIMS 标准化字段描述表

核心文件:CosmicMutantExport.tsv(编码突变导出)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
GENE_SYMBOL TEXT HGNC 基因符号 “BRAF” 特征键/基因面板过滤 旧符号已归一 极少数为空 HGNC 受控词表
GENOMIC_MUTATION_ID TEXT 稳定基因组变异 ID “COSV56056643” 唯一变异键(去重基准) v97 后为主键;旧文献用 COSM 不允许缺失 COSV+数字
LEGACY_MUTATION_ID TEXT 旧版 COSM ID “COSM476” 与历史文献/管道对接 多实例共享同一 COSM 部分为空 COSM+数字
MUTATION_CDS / MUTATION_AA TEXT cDNA 与蛋白 HGVS “c.1799T>A” / “p.V600E” 变异命名标准化 历史文献命名经重映射 部分缺失 HGVS 语法
MUTATION_DESCRIPTION TEXT VEP 后果注释 “missense_variant” 功能后果特征 转录本选择相关 不允许缺失 SO 术语
MUTATION_SOMATIC_STATUS TEXT 体细胞状态 “Confirmed somatic variant” 标签/过滤键 部分为 “Variant of unknown origin” 或疑似胚系 见状态枚举 枚举值
SAMPLE_NAME / ID_SAMPLE / ID_TUMOUR TEXT/INT 样本与肿瘤标识 “COSS…” 样本级聚合 同患者多样本分别计 不允许缺失 内部键
PRIMARY_SITE / SITE_SUBTYPE / PRIMARY_HISTOLOGY / HISTOLOGY_SUBTYPE TEXT 组织部位与组织学四级分类 “lung” / “adenocarcinoma” 癌种分层特征 手工标准化;不同年代粒度不一 “NS”(not specified)即信息性缺失 受控词表(6,800 种配对)
GENOME_WIDE_SCREEN BOOLEAN 是否来自系统性 WES/WGS 筛查 “y” 区分策展来源(频率校正关键) 不允许缺失 y/n
PUBMED_PMID INTEGER 来源文献 23831921 溯源/去重 跨源重复样本需人工识别 部分 TCGA 样本无 PMID PubMed ID
GRCH38 坐标列(CHR/START/END) TEXT/INT 基因组坐标 “7:140753336” 与 VCF/区间工具对接 装配相关(勿与 GRCh37 混用) 不允许缺失 装配坐标

核心文件:cancer_gene_census.csv(癌症基因目录)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
Gene Symbol TEXT HGNC 基因符号 “GNA13” 面板/标签 定期重审可增删 不允许缺失 750+ 基因
Tier INTEGER 证据等级 1 金标准标签 Tier 2 证据较弱 不允许缺失 1 / 2
Role in Cancer TEXT 致癌机制 “TSG” / “oncogene” / “fusion”(可组合) 多标签分类标签 同一基因不同癌种角色可相反 不允许缺失 受控枚举组合
Mutation Types TEXT 致病变异类型 “Mis, N, F” 机制特征 允许为空 缩写枚举
Hallmark TEXT 癌症特征功能注释 “Genome instability” 机制标签 覆盖约 60% Tier 1 基因 未注释为空 10 大 Hallmarks
Somatic / Germline TEXT 变异来源类型 “yes” 胚系/体细胞任务分流 允许为空 yes/no

§4.2 标签分布统计

标签维度 分布 说明
体细胞状态 Confirmed somatic variant 为主体;含 Variant of unknown origin、疑似胚系等 必须过滤(§6.5 坑点 5);v104 曾对 658 条记录回溯改判
CGC Tier 约 75% Tier 1 / 25% Tier 2(官网 modules 页口径) v104 后 750+ 基因
变异后果 错义突变为编码变异最大类;另有同义、无义、移码、剪接位点等 VEP SO 术语
策展来源 手工策展(靶向文献)与半自动(WES/WGS)混合;热点基因被靶向研究高度富集 GENOME_WIDE_SCREEN 列区分
签名病因(v3.4/v3.6 SBS) 86→90 个 SBS 签名中约 2/3 有生物学病因,其余含疑似测序伪影组 Artifact 组(SBS27/43/45–60/95 等)分析时须排除
癌种覆盖 6,800 种部位-组织学配对;常见癌种深、罕见癌种逐年加强 v103 补 EOCRC、v104 补胃/食管

§4.3 关键字段描述性统计

  • 每份样本最多 45 个策展元数据点(种族、年龄、性别、分期、药物反应、HER2 状态等)。
  • 手工策展覆盖:靶向筛查文献(1–约 400 基因)+ CGC 基因文献(截至 2025-11 已策展 256/728 个 CGC 基因,持续扩充)。
  • 全库 50+ 种标准化策展数据点类型(QIAGEN 数据表口径)。
  • 高频突变基因(常识性排序,以官网基因页实时计数为准):TP53、KRAS、APC、PIK3CA、BRAF、EGFR 等长期占据变异计数榜首——这同时是选择偏倚的直接体现(§7.1)。
  • Actionability v20:843 个基因(484 个全策展)、7,571 种治疗组合、8,493 项有结果的临床试验。

§4.4 数据层级关系

PUBLICATION(COSP / PUBMED_PMID,30,206 篇)
  └─ SAMPLE(COSS,约 156.6 万份;含组织部位/组织学/患者属性)
      └─ VARIANT OBSERVATION(每行 = 变异 × 样本实例)
          ├─ GENOMIC VARIANT(COSV 唯一变异,约 3,205 万;GRCh37/38 双坐标)
          │    └─ GENE(HGNC;CGC 子集 750+,Tier 1/2)
          ├─ CNA / EXPRESSION / METHYLATION(TCGA 管道,基因 × 样本)
          └─ FUSION / STRUCT(断点对)
  • 核心对齐键:GENOMIC_MUTATION_ID(COSV,变异层)、ID_SAMPLE/COSS(样本层)、GENE_SYMBOL(基因层)、PUBMED_PMID(文献层)。
  • 高频踩坑:导出文件的行单位是"变异 × 样本实例"而非"唯一变异"——直接对行计数会把热点突变重复计数数万次(见 §6.5 坑点 4)。

§4.5 缺失值情况与信息性缺失编码

缺失类型 字段示例 缺失原因 信息性缺失编码 对 AI 的影响
文献未报告 SITE/HISTOLOGY 亚型、年龄、种族 原文未写或不可标准化 “NS”(not specified) NS 本身提示文献年代与报告质量,宜作特征而非丢弃
装配限制 CMC 驱动分级 仅 GRCh37 更新 GRCh38 站点无该文件 需 liftover 或直接用 GRCh37 站点
命名迁移 LEGACY_MUTATION_ID 新导入变异无 COSM 老管道 join 失败主因(坑点 2)
机制未注释 Hallmark 列 仅约 60% Tier 1 基因已注释 不可作为"无该功能"的证据
TCGA 管道口径 CNA/表达/甲基化 z-score/阈值化标记,非绝对定量 阈值内不出现 不能与原始定量值混用(坑点 8)

§5 数据划分与使用建议

§5.1 官方数据划分

COSMIC 官方不提供 train/validation/test 划分。 它是参考知识库而非基准数据集,社区也没有统一的 ML 划分。若你的目标是构建"以 COSMIC 为标签源"的监督任务(如驱动突变预测、CGC 基因分类),需自行设计划分并防御知识库特有的泄漏模式(见 §5.3)。

§5.2 推荐划分策略

  1. 按基因划分(推荐主策略):以 GENE_SYMBOL 为组做 GroupKFold,避免同一基因的不同变异同时出现在训练与测试侧(基因级特征会泄漏)。
  2. 按版本的时间外验证:用 v100(2024-05)之前的数据训练、v103-v104 新增内容测试——COSMIC 每版发布新增文献清单(release notes 含 PMID),可精确构造"未来知识"测试集,这是知识库独有的准时间外验证。
  3. 按策展来源分层:GENOME_WIDE_SCREEN = y(系统筛查)与 n(靶向文献)分别评估——两者的变异频率分布截然不同。
  4. 按装配隔离:GRCh37 与 GRCh38 文件不可混合训练(坐标系不同,坑点 3)。
  5. 按癌种分层:以 PRIMARY_SITE 分层抽样,用于评估跨癌种泛化。
import pandas as pd
from sklearn.model_selection import GroupKFold

cgc = pd.read_csv("cancer_gene_census.csv")
gkf = GroupKFold(n_splits=5)
for fold, (tr, te) in enumerate(gkf.split(cgc, groups=cgc["Gene Symbol"])):
    train_genes = set(cgc.iloc[tr]["Gene Symbol"])
    test_genes = set(cgc.iloc[te]["Gene Symbol"])
    assert not (train_genes & test_genes)  # 基因级零泄漏验证

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 同源变异近重复:同一 COSV 的不同样本实例被切到训练/测试两侧 按 COSV/HGVSG 去重后再划分;或按变异分组划分
2 基因级泄漏:CGC 成员资格、基因长度、既往突变计数等基因级特征在同基因变异间共享 按 GENE_SYMBOL 分组划分(§5.2)
3 “答案在标签里”:用 CMC 驱动分级当特征去预测驱动状态 CMC/CGC 列只能做标签或过滤键,严禁入模
4 文献主题泄漏:同一 PMID 的多个样本/变异跨侧分布 按 PMID 分组划分(leave-one-study-out 更严格)
5 频率特征穿越:用"该变异在 COSMIC 出现的样本数"当特征,但该计数本身包含测试侧样本 用训练侧版本(如 v100)计算频率,模拟知识截止

§5.4 交叉验证建议

  • 标准:5 折 GroupKFold(gene 级)+ 一次"版本时间外验证"(v100 → v104)。
  • 报告驱动突变预测时,建议同时报 gene-holdout 与 variant-holdout 两种口径,前者严格得多。

§5.5 外部验证

以 COSMIC 为训练/标签来源的模型,经典外部验证路径:CIViC(独立策展的证据库)、OncoKB(MSK 临床注释)、IntOGen(计算驱动基因目录)、以及 TCGA/ICGC 原始队列的重新 call 变异集(如 MC3)。跨知识库比较时注意各库体细胞判定与基因分级口径不同(§7.3)。


§6 AI 就绪指南

§6.0 云端快速启动

零注册体验:Mutational Signatures 网站(https://cancer.sanger.ac.uk/signatures/)与 COSMIC-3D(https://cancer.sanger.ac.uk/cosmic3d/)无需注册即可在线浏览全部签名矩阵与蛋白结构突变分布;QIAGEN 另提供免注册的 sample data 供体验导出文件结构。

在线签名拟合:注册登录后使用官网 Signature Assignment 工具,直接上传 96 通道突变谱即可获得 COSMIC v3.6 签名权重——无需本地安装 SigProfiler,适合 5 分钟完成首个分析。

§6.1 快速上手

# ========================================
# COSMIC 快速上手 — pandas 版
# 环境要求: pandas>=2.0(另荐 duckdb,见 §6.3)
#
# ⚠️ 目录结构预期(下载后解压至 ./cosmic_v104_GRCh38/):
#   ./cosmic_v104_GRCh38/
#   ├── CosmicMutantExport.tsv.gz      # 编码突变导出(数十 GB 级,勿全量入内存)
#   ├── cancer_gene_census.csv         # CGC 基因目录(轻量)
#   └── README                         # 当版字段说明
#
# 注意:CosmicMutantExport 每行是「变异 × 样本实例」,
#       统计唯一变异必须按 GENOMIC_MUTATION_ID 去重(坑点 4)。
# ========================================
import pandas as pd

# 步骤 1:读取 CGC(轻量,直接入内存)
cgc = pd.read_csv("./cosmic_v104_GRCh38/cancer_gene_census.csv")
tier1 = cgc[cgc["Tier"] == 1]
print(f"CGC Tier 1 基因数: {len(tier1)}")  # v104 约 550+(占 ~75%)

# 步骤 2:分块扫描编码突变导出,统计 BRAF V600E 的样本实例数
hits = []
for chunk in pd.read_csv("./cosmic_v104_GRCh38/CosmicMutantExport.tsv.gz",
                         sep="\t", chunksize=2_000_000, low_memory=False):
    sub = chunk[(chunk["GENE_SYMBOL"] == "BRAF") &
                (chunk["MUTATION_AA"] == "p.V600E") &
                (chunk["MUTATION_SOMATIC_STATUS"] == "Confirmed somatic variant")]
    hits.append(sub)
braf = pd.concat(hits)
print(f"BRAF V600E 体细胞确认实例: {len(braf)}")
print(f"唯一变异数(应为 1): {braf['GENOMIC_MUTATION_ID'].nunique()}")
print(braf["PRIMARY_SITE"].value_counts().head())  # 癌种分布

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
学术注册下载(GRCh38) https://cancer.sanger.ac.uk/cosmic/download 数十 GB ① 在 /cosmic/register 用机构邮箱注册;② 接受许可条款;③ 登录下载中心选择版本与文件;④ 浏览器下载或使用登录后获得的下载链接配合 wget/curl 批量获取
学术注册下载(GRCh37) https://grch37-cancer.sanger.ac.uk/cosmic/download 数十 GB 同上;CMC 等仅在此站点更新的模块须来此下载
商业许可 QIAGEN(COSMIC 产品页 / bioinformaticssales@qiagen.com 按订阅 购买商业许可后经 QDI 门户下载;含一年更新与支持
免注册模块 signatures / cosmic3d 网站 MB 级 直接在线浏览与下载签名矩阵
免费样例 QIAGEN cosmic-release 页 “Free sample data” MB 级 免注册体验文件结构

合规红线(条款原文):禁止再分发或向第三方共享(出版论文所必需的披露除外,且须注明版本号);禁止爬虫与系统性批量抓取,只能使用官方下载功能;未经 GRL 或 QIAGEN 书面同意,禁止使用 COSMIC 数据训练任何 AI 模型(条款 4.6);非营利机构若将数据用于面向个人健康的检测服务,同样构成商业用途。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 4 步预处理代码(DuckDB 版,避免全量入内存)</b></summary>

# 步骤 1:DuckDB 直接查询巨型 TSV(CosmicMutantExport 数十 GB 级,勿用 pandas 全量读)
import duckdb

con = duckdb.connect()
con.execute("""
CREATE VIEW muts AS
SELECT * FROM read_csv('./cosmic_v104_GRCh38/CosmicMutantExport.tsv.gz',
                       delim='\t', header=true, sample_size=200000)
""")

# 步骤 2:体细胞状态过滤 + 唯一变异去重(坑点 4/5 的组合防御)
drivers = con.execute("""
WITH confirmed AS (
  SELECT * FROM muts
  WHERE MUTATION_SOMATIC_STATUS = 'Confirmed somatic variant'
),
uniq AS (
  SELECT GENOMIC_MUTATION_ID, GENE_SYMBOL, MUTATION_AA, MUTATION_DESCRIPTION,
         COUNT(DISTINCT ID_SAMPLE) AS n_samples,
         COUNT(DISTINCT PUBMED_PMID) AS n_papers
  FROM confirmed
  GROUP BY GENOMIC_MUTATION_ID, GENE_SYMBOL, MUTATION_AA, MUTATION_DESCRIPTION
)
SELECT * FROM uniq ORDER BY n_samples DESC
""").df()

# 步骤 3:关联 CGC 打标签(Tier 1 = 强证据癌症基因)
cgc = con.execute("""
SELECT "Gene Symbol" AS gene, "Tier" AS tier, "Role in Cancer" AS role
FROM read_csv('./cosmic_v104_GRCh38/cancer_gene_census.csv', header=true)
""").df()
drivers = drivers.merge(cgc, left_on="GENE_SYMBOL", right_on="gene", how="left")
drivers["in_cgc_tier1"] = (drivers["tier"] == 1).astype(int)

# 步骤 4:按癌种统计变异频率(注意:这是知识库频率,非人群频率,见坑点 6)
site_freq = con.execute("""
SELECT GENE_SYMBOL, PRIMARY_SITE, COUNT(DISTINCT ID_SAMPLE) AS n
FROM muts
WHERE MUTATION_SOMATIC_STATUS = 'Confirmed somatic variant'
  AND GENOME_WIDE_SCREEN = 'n'      -- 仅靶向文献口径
GROUP BY GENE_SYMBOL, PRIMARY_SITE
ORDER BY n DESC LIMIT 100
""").df()

</details>

推荐直接使用成熟工具替代手写:Ensembl VEP / ANNOVAR / OpenCRAVAT 的 COSMIC 注释插件(变异注释进 VCF);SigProfilerAssignment / MutationalPatterns(签名 refit);maftools(R,MAF 层面整合 COSMIC/CGC 标记);cBioPortal 与 UCSC Xena(已整合 COSMIC 注释的在线分析)。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class VariantDataset(Dataset):
    """驱动突变二分类示例:特征 = VEP 后果 one-hot + 基因级统计;标签 = CGC Tier 1 成员"""
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(VariantDataset(X_train, y_train), batch_size=1024, shuffle=True)
import xgboost as xgb  # XGBoost 基线:变异级特征 + 基因级特征,基因分组划分
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "aucpr",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
          "max_depth": 6, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=500)
# 突变签名 refit(SigProfilerAssignment 官方工具)
from SigProfilerAssignment import Analyzer as Analyze
Analyze.cosmic_fit(samples="matrix_96.txt", output="sig_out",
                   genome_build="GRCh38", cosmic_version=3.6,
                   exome=False, input_type="matrix")
# panel/WES 数据必须 exome=True 或按三核苷酸背景重标定(坑点 7)

§6.5 常见坑点

⚠️ 坑点 1:学术免费 ≠ 可自由使用——AI 训练被条款明确禁止(分类:评估误用 / 合规)

问题:COSMIC 条款 4.6 规定:未经 Genome Research Limited 或其许可合作伙伴(QIAGEN)明确书面同意,不得使用 COSMIC 数据训练任何人工智能模型。同时禁止再分发(含放入公开 GitHub 仓库、公开镜像站、随模型权重发布)与爬虫抓取。许多团队默认"能下载就能用",在论文或开源项目中违规。

症状:法务/伦理审查阶段被拦下;论文被要求撤下衍生数据;开源仓库收到 takedown;商业产品面临许可追溯。

解决:(1) 纯学术研究:注册后使用,论文中注明使用 COSMIC 及具体版本号(Publication Enablement 允许的必要披露范围内);(2) 训练 AI 模型:先向 cosmic@sanger.ac.uk 或 QIAGEN 申请书面许可;(3) 需要完全开放替代品时,评估 CIViC(CC0)、ClinVar、TCGA/MC3、IntOGen 等可自由再分发的资源;(4) 任何"非营利但面向患者检测"的使用属商业用途,须购买 QIAGEN 许可。

参考https://cancer.sanger.ac.uk/cosmic/terms (条款 2.1.2、4.4.6、4.4.7、4.6);www.cosmickb.org/licensing

⚠️ 坑点 2:COSM 时代 ID 与 COSV 新标识符断裂(分类:工程陷阱)

问题:老文献、老数据库与老管道(如早期 maftools、临床报告)使用 legacy COSM ID(如 COSM476 = BRAF V600E);v97 之后的导出文件以 COSV(如 COSV56056643)为主键,COSM 仅存于 LEGACY 映射列且新变异不再有 COSM。直接按 COSM join 会大面积落空。

症状:与老注释表 join 后匹配率骤降;同一变异在新旧文件中"找不到"。

解决:统一以 GENOMIC_MUTATION_ID(COSV)或 HGVSG 为主键;需要对接历史数据时使用官方 COSM→COSV 映射(导出文件自带 LEGACY_MUTATION_ID 列及独立映射文件);与基因组坐标 triple-check(配合坑点 3)。

参考:Sondka et al. 2024(NAR 52:D1210-D1217,稳定 COSV 标识符引入说明);当版 README。

⚠️ 坑点 3:GRCh37 与 GRCh38 双装配混用(分类:预处理陷阱)

问题:COSMIC 按两个参考装配分站点发布(cancer.sanger.ac.uk = GRCh38;grch37-cancer.sanger.ac.uk = GRCh37),同一 COSV 在两套坐标下列值不同。混用坐标做区间 join 会造成错位注释;此外 Cancer Mutation Census 当前仅在 GRCh37 更新。

症状:变异落在错误基因/基因间区;与自家 GRCh38 VCF 的匹配率异常低;在 GRCh38 站点找不到 CMC 文件。

解决:项目内统一装配并记录;跨装配转换用 UCSC liftOver / Ensembl Assembly Converter 后重跑 VEP,不要只改坐标字符串;需要 CMC 驱动分级时直接使用 GRCh37 站点下载。

参考:v104 release notes(“Cancer Mutation Census: updated for all coding genes present in GRCh37”)。

⚠️ 坑点 4:导出文件的行单位是「变异 × 样本实例」而非「唯一变异」(分类:标签理解)

问题:CosmicMutantExport.tsv 中一个热点突变(如 BRAF V600E)可出现数万行(每个携带样本一行)。直接对行数做"变异频率"统计,会把实例数误当变异数,或把高频突变重复计入特征。

症状:"唯一变异数"虚高数十倍;KRAS/BRAF 等热点在统计图中比例失真;与官方公布的 COSV 总量(v104 约 3,205 万)对不上。

解决:任何变异级统计先 GROUP BY GENOMIC_MUTATION_ID(或 HGVSG);样本级统计用 COUNT(DISTINCT ID_SAMPLE);明确区分"实例数"“唯一变异数”"样本数"三个口径并在论文方法学中写明(§6.3 步骤 2 给出模板)。

参考:§3.2 官方统计口径(COSV 唯一变异)vs QIAGEN “38M mutation instances” 营销口径的差异。

⚠️ 坑点 5:不过滤体细胞状态,把"来源不明"变异当体细胞用(分类:标签理解)

问题:导出文件包含 MUTATION_SOMATIC_STATUS 为 “Confirmed somatic variant”、“Variant of unknown origin”、疑似胚系等多种状态的记录;历史文献中部分"体细胞"结论后被推翻(v104 将两篇论文的 658 条记录回溯改判为 unknown origin)。不过滤直接分析会污染体细胞结论,尤其在做签名或驱动分析时。

症状:签名中出现莫名其妙的"胚系样"组分;队列突变负荷虚高;与严格体细胞管道(如双样本 tumor-normal call)结果对不上。

解决:默认过滤 MUTATION_SOMATIC_STATUS = 'Confirmed somatic variant';做敏感性分析时可对比"含 unknown origin"口径;引用具体变异时注明其状态与版本。

参考:v104 release notes(PMID 23831921 / 27288520 的 658 条状态改判记录)。

⚠️ 坑点 6:知识库频率 ≠ 人群频率——选择偏倚与样本重复(分类:偏倚陷阱)

问题:(1) 靶向文献天然富集热点基因与常见癌种——"KRAS 在 COSMIC 结直肠癌样本中的突变率"高于真实人群流行病学;(2) 样本 ≠ 患者(同一患者原发/复发/转移分别计,细胞系计入);(3) 同一肿瘤可能经文献与 TCGA/ICGC 双路径重复入库。把 COSMIC 频率当人群频率是审稿人最常抓的错误之一。

症状:某基因突变率显著高于流行病学报告;按 PRIMARY_SITE 统计时出现不可能的亚型比例。

解决:频率结论只用 GENOME_WIDE_SCREEN = y 的系统筛查子集(更接近无偏抽样),并在方法学声明残余偏倚;人群频率以 TCGA/ICGC 原始队列或流行病学文献为准;论文中避免"COSMIC 显示 X% 患者携带"这类表述。

参考:§7.1 偏倚表;Sondka et al. 2024 对数据来源与策展范围的界定。

⚠️ 坑点 7:突变签名版本漂移与通道背景误用(分类:评估误用)

问题:(1) 签名目录持续演进:SBS40 在 v3.4 被拆为 SBS40a/b/c(旧 SBS40 弃用),v3.6 又新增 4 个 SBS 并修正 ID16、精化 SBS41——不同论文的"SBS40"可能不是同一个东西;(2) COSMIC 签名基于全基因组三核苷酸背景推导,直接对 panel/WES 数据 refit 会因背景组成不同而失真;(3) Artifact 签名组(SBS27/43/45–60/95 等)是疑似测序伪影,不排出会稀释生物学签名权重。

症状:复现他人签名结果时权重系统性偏移;WES 队列中 SBS 组成异常;审稿质疑签名版本未注明。

解决:(1) 方法学中写明 “COSMIC Mutational Signatures v3.x (COSMIC vNN)”;(2) panel/WES 用 SigProfilerAssignment 的 exome 模式或按目标区域三核苷酸背景重标定参考矩阵;(3) 默认排除 Artifact 组与淋巴系统特异签名以外的非候选签名,限制候选集到该组织已知签名(NNLS 过拟合防御);(4) 跨研究比较用余弦相似度对齐版本差异。

参考https://cancer.sanger.ac.uk/signatures/(版本说明与 SBS40 弃用公告);Alexandrov et al. 2020, Nature 578:94-101。

⚠️ 坑点 8:巨型导出文件的工程误用 + TCGA 衍生轨道的口径混淆(分类:工程陷阱)

问题:(1) CosmicMutantExport.tsv.gz 为数十 GB 级单文件,pandas 全量 read_csv 在普通工作站上直接 OOM;(2) CNA/表达/甲基化三个轨道来自 TCGA 统一管道的阈值化标记(gain/loss、over/under-expression、高/低甲基化),并非绝对定量值,与文献手工策展数据的精度层级不同。

症状:内存爆炸/进程被杀;把 ±2 z-score 阈值标记当连续表达量做回归;CNA 与突变数据按样本 join 时出现口径错位。

解决:(1) 用 DuckDB/polars streaming/pandas chunksize 分块处理(§6.3 模板),只裁剪需要的列;(2) 三个 TCGA 轨道只作"有无异常"的离散特征使用,需要定量值时回 TCGA/GDC 原始数据;(3) 任何 join 前确认键的层级(变异级 COSV / 样本级 COSS / 基因级 symbol)。

参考:§3.1 模态说明;Sondka et al. 2024 对三轨数据源的描述。

版本提示:引用任何计数(变异总量、样本数、CGC 基因数)时必须注明 COSMIC 版本——该库每半年增长一次,v100(2024-05)与 v104(2026-05)的总变异量相差约 800 万。官方仅支持最新版与前三个版本(条款 4.12),论文建议统一使用投稿时的最新版并锁定版本号。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
用 COSMIC 频率加权采样构建变异分类训练集 将 COSMIC 导出数据整体镜像进公开仓库或模型权重(违反许可)
按三核苷酸背景对签名矩阵做 panel/WES 重标定 混用 GRCh37/GRCh38 坐标"扩充"样本
用同源蛋白家族特征做基因级数据扩充 对 HGVS 命名做字符串级"同义改写"增强(破坏标准命名)
版本滚动验证(v100 训练 → v104 测试) 用 CMC 驱动分级当输入特征预测驱动标签(标签泄漏)

§6.7 模型推荐

任务 推荐方案 特征/数据 说明
变异致病性打分 成熟工具优先:CADD / REVEL / AlphaMissense 变异级特征 COSMIC 作评估标签源(CGC/CMC),勿直接当训练标签而不防泄漏
驱动基因分类 XGBoost / 图神经网络 基因级突变谱 + 复制修复特征 以 CGC Tier 1 为正标签,按基因分组划分
突变签名 refit SigProfilerAssignment / MutationalPatterns / MuSiCal 96 通道矩阵 + COSMIC v3.6 低突变量样本用带惩罚 NNLS 或贝叶斯方法
变异注释生产管线 Ensembl VEP + COSMIC 插件 / OpenCRAVAT VCF 临床实验室主流路径
药物匹配 Actionability 查询 + OncoKB/CIViC 交叉验证 变异-疾病-药物证据 临床决策必须多库交叉

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 100 GB(单装配核心文件 + 解压空间) 250 GB(双装配 + DuckDB 索引 + 中间结果)
内存 16 GB(分块/DuckDB 处理) 64 GB(全量聚合、签名批量 refit)
GPU 不需要(注释/统计任务) 签名深度学习方法或大规模变异打分模型时 1 × 16 GB
网络 稳定国际带宽(数十 GB 下载) 断点续传工具(wget -c / aria2)

§6.9 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             precision_recall_curve)
import numpy as np

def evaluate_driver_pred(y_true, y_prob):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")  # 驱动稀缺,必报
    prec, rec, thr = precision_recall_curve(y_true, y_prob)
    f1 = 2 * prec * rec / (prec + rec + 1e-9)
    print(f"Best F1: {f1.max():.4f}")

def cosine_similarity(a, b):  # 签名分析标准指标
    return float(np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b)))

社区共识:驱动/致病预测报 AUROC + AUPRC(类别极不平衡);签名重构报 cosine similarity(>0.90 为高置信重构)与重构误差;跨库一致性(如 vs CIViC/OncoKB)报 Cohen’s kappa 或证据级一致率。

§6.10 MLOps 笔记

  • 版本锁定:方法学必须写明 “COSMIC v104, GRCh38”(或 GRCh37)与下载日期;签名分析额外锁定签名版本(如 v3.6)。COSMIC 每半年一更,复现时版本差异可致计数显著不同。
  • 引用规范:引用 COSMIC 使用 Tate et al. 2019(DOI: 10.1093/nar/gky1015)与/或 Sondka et al. 2024(DOI: 10.1093/nar/gkad986);用 CGC 加引 Sondka et al. 2018(Nat Rev Cancer);用签名加引 Alexandrov et al. 2020(Nature)。论文中须注明使用 COSMIC 及版本号(许可条款 2.1.2)。
  • 合规存档:留存注册账号的许可接受记录;AI 训练用途务必先取得书面许可(条款 4.6)。
  • 双装配审计:管线中对坐标列做一次装配自检(如检查已知变异坐标:BRAF V600E 在 GRCh38 为 7:140753336 附近、GRCh37 为 7:140453136 附近),防止静默混用。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
ascertainment/选择偏倚 靶向文献富集热点基因(KRAS/BRAF/EGFR/TP53)与常见癌种;知识库频率 ≠ 人群频率 频率类结论只用 GENOME_WIDE_SCREEN 子集;以 TCGA/ICGC 原始队列为频率金标准
出版偏倚 仅收录同行评审文献(且策展为英文文献导向);阴性/低显著性结果覆盖少 中高 结合预印本与注册报告;方法学声明
人群祖源偏倚 WGS/WES 系统筛查主体(TCGA/ICGC)欧洲祖源占比高 跨祖源结论用区域队列外部验证(如中国/日本肿瘤图谱)
罕见癌种欠代表 常见癌种深策展,罕见癌种/儿童肿瘤覆盖薄 关注每版聚焦主题(v103 EOCRC、v104 胃/食管在持续改善);补 PCGP 等专项
技术时代偏倚 数据横跨 Sanger 测序到 WGS 时代,检测灵敏度与坐标体系不一 按 GENOME_WIDE_SCREEN 与文献年代分层分析
策展范围偏倚 手工策展优先 CGC 基因与当期主题癌种(截至 2025-11 为 256/728 个 CGC 基因深度策展) 低-中 非 CGC 基因的深度信息不可默认完备
用户提交未策展数据 用户提交变异发布前不经策展(官方明示) 以 Confirmed somatic 状态与 PMID 溯源过滤

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
手工策展变异(核心层) 高:博士级策展 + QC + 版本回溯纠错 统一术语与 HGVS 命名 原文报告错误的"继承性错误"仍可能存在(v104 曾回溯改判 658 条)
半自动 WGS/WES 导入 依赖原始联盟管道质量 统一 VEP 注释 未经逐条人工复核;不同联盟 callers 差异
CGC Tier 分级 领域金标准;定期重审(可增删/调级) 规则化证据标准 Tier 2 证据强度弱;Hallmarks 仅覆盖约 60% Tier 1
CMC 驱动分级 统计 + 多源证据整合 版本间 tier 可能微调(v104 曾调整部分变异分级) 仅 GRCh37
体细胞状态 Confirmed 标记高可信 多状态枚举清晰 unknown origin 占比不可忽视,必须显式处理
签名目录 多队列 + 实验验证(最严格层级) 版本演进中签名拆分/修正 含疑似伪影签名组;panel 适用性需重标定

§7.3 泛化性讨论

场景 失效风险 证据
知识库频率 → 流行病学推断 靶向筛查富集偏倚(§7.1);频率结论须限 GENOME_WIDE_SCREEN 子集
欧洲祖源为主的筛查数据 → 其他祖源人群 TCGA/ICGC 队列构成;区域性突变谱差异(如 2025 年 Nature 结直肠癌多国研究提示 SBS89 等的地理富集)
签名模型(WGS 训练) → panel/WES 三核苷酸背景差异;需重标定(§6.5 坑点 7)
旧版本结论 → 新版本 签名拆分(SBS40)、CGC 增删(APOBEC3B 移出)、状态回溯改判;版本锁定可解
COSMIC 标签 → 其他知识库(CIViC/OncoKB) 各库体细胞判定与证据分级口径不同;临床使用须多库交叉

§7.4 伦理考量

  1. COSMIC 为聚合级文献知识库,不含患者标识符;样本级仅有文献报告的脱敏分类属性(年龄段、性别、种族、分期)。研究者仍应避免对极小亚群做可反推个体的展示。
  2. 数据来自全球已发表研究的患者样本,原始知情同意由各来源研究负责;COSMIC 以许可协议约束下游使用(禁止重识别、禁止未授权再分发)。
  3. 商业与临床使用须走 QIAGEN 许可——该机制本身也是伦理治理的一部分(使用可追溯)。
  4. 将知识库用于"人群易感性"或祖源差异结论时须谨慎:筛查队列的祖源构成偏斜可能放大群体间表观差异(§7.1)。
  5. AI 训练的许可限制(条款 4.6)意味着未经许可的模型产物(权重、嵌入)存在合规风险,下游使用者应审查上游训练的授权链。

§7.5 公平性评估

# 以 CGC 基因为例:检查驱动基因目录在不同癌种/人群研究中的覆盖均衡性
import pandas as pd

cgc = pd.read_csv("cancer_gene_census.csv")
coverage = (cgc.groupby("Role in Cancer")["Tier"]
              .value_counts(normalize=True).unstack())
print(coverage)  # Tier 1/2 在不同机制(oncogene/TSG/fusion)间的构成差异

已知公平性相关事实:COSMIC 本身不提供个体级结局数据,公平性风险主要沿"数据入口"传导——TCGA/ICGC 的欧洲祖源偏斜与英文文献的出版偏倚会使基于 COSMIC 训练的模型在欠代表人群(非洲、拉丁美洲祖源;罕见癌种)上证据稀疏。缓解:模型报告分祖源/分癌种性能,并用区域性队列(如中国肿瘤图谱、日本 HGVD 等)做外部校准。

§7.6 数据漂移提示

  • 知识漂移:COSMIC 是"活库"——每半年新增数十万至数百万变异,CGC 基因可增删、签名可拆分、体细胞状态可回溯改判。任何静态快照都会随时间偏离当前共识,生产系统应随官方节奏(5/11 月)滚动升级并记录版本。
  • 装配漂移:GRCh37 内容(尤其 CMC)与 GRCh38 的更新深度不同,长期项目应规划向 GRCh38(乃至未来 T2T-CHM13)迁移的 liftover 验证。
  • 技术漂移:底层证据从 panel 时代向 WGS/长读长时代演进,旧文献的检测灵敏度与当代不可比——跨年代合并分析时按技术平台分层。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 导出文件每行一个变异×样本实例,键清晰
2 有唯一标识符列 COSV / COSS / COSP + legacy COSM 官方映射
3 无 Unicode 或特殊字符 ⚠️ 核心字段 ASCII;个别文献来源文本字段含特殊符号,需清洗
4 无重复行 ⚠️ 实例行为设计使然;唯一变异需按 COSV 自行去重
5 缺失值已识别并编码 “NS” 等信息性缺失编码明确(§4.5)
6 标签列被明确标识 体细胞状态、CGC Tier、CMC 分级、GENOME_WIDE_SCREEN
7 已对罕见类别(<3%)进行分组 ⚠️ 6,800 种部位-组织学细分未归并,罕见癌种需自行合并
8 偏倚评估已完成 §7.1 七类偏倚与缓解措施
9 有完整的数据字典 随版 README + 官网文档 + Sondka 2024 论文
10 对"信息性缺失"有明确编码解释 §4.5 缺失机制分类
11 数据采集设备和设置已记录 ⚠️ 来源研究平台各异,COSMIC 不统一记录测序平台;有 GENOME_WIDE_SCREEN 标志
12 已移除完全共线性变量 知识库保留全部原始列,未执行
13 对编码的映射标准已说明 HGVS/HGNC/RefSeq/UniProt/CCDS/VEP/SO 术语 + NCI/EFO 表型映射
14 对时间戳的处理已明确说明 ⚠️ 无采样时间维度;以文献与版本(release notes 含 PMID 清单)为时间锚
15 训练/验证/测试划分建议已给出 官方无 ML 划分;§5.2 给出社区策略
16 数据泄漏风险已被讨论 §5.3 五种知识库特有泄漏模式
17 标签分布已被分析 §4.2 体细胞状态/Tier/后果分布
18 选择性测量偏倚已被讨论 §7.1 + §6.5 坑点 6(靶向富集)
19 外部验证建议已给出 §5.5 CIViC/OncoKB/IntOGen/TCGA-MC3
20 数据更新和版本信息已记录 每版详细 release notes;支持最新版 + 前三个版本
21 最小必要预处理脚本已提供 ⚠️ 无官方预处理脚本;§6.3 提供 DuckDB 模板,社区工具(VEP 插件等)成熟
22 合规使用要求已明确 学术注册 + 条款(含 AI 训练限制)+ QIAGEN 商业通道
23 多模态对齐方法已说明 ⚠️ 突变/CNA/表达/甲基化经基因-样本键对齐;TCGA 衍生轨道与文献轨道精度层级不同(§6.5 坑点 8)
24 去标识化方法已被记录 聚合级知识库,无 PHI;样本级仅文献报告的脱敏分类属性

DAIMS 评分:18.5 / 24

评分解读良好——策展质量、标识符体系、版本治理与合规透明度顶尖;失分集中在"知识库不是 ML 数据集"的结构性问题上。

对你意味着什么:COSMIC 的 15 个 ✅ 项来自其二十年积累的工程纪律——稳定 COSV 标识符、双装配发布、逐版 release notes、明确的体细胞状态枚举与许可条款。扣分项大多不可也不应由 COSMIC 自己修复:它是参考知识库而非基准数据集,官方不提供划分与预处理脚本。建议在使用前执行以下操作:(1) 任何统计先按 COSV 去重并过滤 Confirmed somatic;(2) 频率类结论限用 GENOME_WIDE_SCREEN 子集;(3) 训练 AI 模型前先解决条款 4.6 的书面授权,或改用 CIViC/TCGA 等开放替代;(4) 全部产物锁定版本号(COSMIC 版本 + 装配 + 签名版本)。

§7.8 外部验证矩阵

知识库的"外部验证"体现为其核心目录在独立队列与独立策展库中的可复现性。以下仅收录有同行评审支撑的证据:

外部数据集/场景 来源机构 评估任务 结果 相对内部结论变化 关键发现
PCAWG(2,658 全基因组) ICGC/TCGA 联盟 突变签名独立提取与复现 签名目录在多中心、多 callers、WES+WGS 间稳定复现 Alexandrov et al. 2020(Nature 578:94-101)奠定 v3 目录;多数签名经实验验证
Genomics England(10,731 WGS) Genomics England SV 签名独立推导 推导出 16 个 SV 签名并纳入 COSMIC 目录 结构变异签名从独立国家队列产生,验证目录可扩展性
TCGA SNP6(9,873 样本,33 癌种) TCGA CN 签名独立推导 21 个 CN 签名(48 通道) 拷贝数签名同样经独立队列系统化
多国结直肠癌 WGS(802 例,11 国) 多中心(Nature 2025) 以 COSMIC v3.4 参考签名分解 de novo 签名 16 个 de novo SBS 中 15 个可由 COSMIC v3.4 重构 发现 1 个潜在新签名(SBS_O,后被证实为 SBS41 精化版,v3.6 已收录) 参考目录在全球队列中重构率高,同时驱动目录迭代
CIViC / OncoKB(独立策展库) CIViC 社区 / MSK 变异-药物证据交叉 高频可操作变异高度重叠,边缘证据分级口径不同 临床使用须多库交叉验证(§6.7)

COSMIC 在 2026 年还值得用吗? 值得,且地位仍在增强:v104 一年新增近 700 万变异,签名目录演进至 v3.6,Actionability 保持月度级活更新。但它正从"可直接下载使用"转向"强许可治理"模式——对 AI 社区而言,最大变化不是数据而是规则:训练用途的书面授权成为硬性前置条件。


§8 基准性能与生态

§8.1 排行榜与知识库对比

COSMIC 不是竞赛数据集,没有官方排行榜。其"性能"由两类社区评估刻画:

A. 突变签名工具对比(同一 COSMIC 参考目录下的方法学比较)

工具 方法 适用场景 完整引用 代码
SigProfilerAssignment 带优化惩罚的 NNLS refit 官方推荐,WGS/WES/panel Diaz-Gay M et al. (2023). “Assigning mutational signatures…” Nat Commun(SigProfiler 系列;另见 Alexandrov et al. 2020, Nature 578:94-101) https://github.com/AlexandrovLab/SigProfilerAssignment
SigProfilerExtractor de novo NMF 提取 + 分解 大队列新签名发现 Islam SMA et al. (2022), Nat Commun 13:3240 https://github.com/AlexandrovLab/SigProfilerExtractor
MutationalPatterns 严格 refit(R 生态) Bioconductor 管线 Manders F et al. (2022), Nat Protoc 17:485-510 Bioconductor
MuSiCal mvNMF 处理非唯一解 签名歧义问题 Jin H et al. (2024), Nat Genet https://github.com/parklab/MuSiCal
HRDetect 6 特征 BRCA 缺陷分类器 HRD 检测/PARP 决策 Davies H et al. (2017), Nat Med 23:517-525 多实现

B. 知识库覆盖对比(选型决策用,定性)

维度 COSMIC CIViC OncoKB ClinVar
变异总量 ~3,205 万唯一变异 数千证据项 数千变异 数百万(胚系为主)
策展深度/变异 高(手工) 高(社区) 极高(临床级) 中(提交者申报)
治疗证据 Actionability v20 核心功能 核心功能(Level 分级)
再分发自由 ❌(许可限制) ✅(CC0) ❌(类似 COSMIC)
AI 训练许可 须书面授权 ✅ 自由 须授权 ✅ 自由

注意:上表数值口径不同(唯一变异 vs 证据条目),不可直接比较"谁更大";临床注释场景三库(COSMIC/CIViC/OncoKB)应联合使用。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
做临床变异注释 VEP/OpenCRAVAT + COSMIC(v104)+ OncoKB/CIViC 交叉 覆盖 + 证据深度兼得
复现签名分析论文 锁定论文的签名版本(多为 v3.4)+ SigProfilerAssignment 版本漂移是复现失败首因
构建驱动突变 ML 模型 CGC Tier 1 标签 + 基因分组划分 + 版本时间外验证 防泄漏的默认配置
需要可自由再分发的替代 CIViC(CC0)+ ClinVar + TCGA/MC3 + IntOGen 无许可障碍,覆盖较弱
查询变异-药物证据 Actionability v20(学术注册免费) 843 基因、8,493 项有结果试验的活库

§8.3 官方评测协议

无官方 ML 评测协议。社区事实标准:签名重构以 cosine similarity > 0.90 为高置信;驱动基因工具以 CGC Tier 1 为正标签、按基因分组交叉验证;变异注释一致性以多库(COSMIC/CIViC/OncoKB)证据级一致率评估。

数据集 关系 说明
Cancer Gene Census 子模块 750+ 癌症基因 Tier 分级目录(cancer_gene_census.csv)
COSMIC Mutational Signatures 子模块 v3.6 签名目录,与 Alexandrov Lab 联合维护
COSMIC Actionability 子模块 精准肿瘤药物知识库,独立版本号(v20)
COSMIC Cell Lines Project 子模块 1,020 个癌症细胞系组学;姊妹资源 Cell Model Passports
GDSC(Genomics of Drug Sensitivity in Cancer) 关联 细胞系药敏数据,与 CLP 联动做药物基因组学
TCGA / ICGC / PCGP 上游来源 COSMIC 系统筛查数据的原始队列
CIViC / OncoKB / IntOGen 同类/互补 临床证据与驱动基因目录,许可各异
ClinVar / gnomAD 互补 胚系变异与人群频率,体细胞分析的对照

§8.5 关键论文 Top 10

  1. Tate JG et al. (2019), Nucleic Acids Research 47(D1):D941-D947. “COSMIC: the Catalogue Of Somatic Mutations In Cancer.” — 当前主引用论文(v86 版本)。DOI: 10.1093/nar/gky1015。PMID: 30371878。
  2. Sondka Z et al. (2024), Nucleic Acids Research 52(D1):D1210-D1217. “COSMIC: a curated database of somatic variants and clinical data for cancer.” — 当前版本论文:COSV 稳定标识符、七大资源架构、三轨策展。DOI: 10.1093/nar/gkad986。PMID: 38183204。
  3. Sondka Z, Bamford S, Cole CG, Ward SA, Dunham I, Forbes SA (2018), Nature Reviews Cancer 18:696-705. “The COSMIC Cancer Gene Census: describing genetic dysfunction across all human cancers.” — CGC 719 基因 + Hallmarks 功能注释体系。DOI: 10.1038/s41568-018-0060-1。
  4. Bamford S et al. (2004), British Journal of Cancer 91:355-358. “The COSMIC (Catalogue of Somatic Mutations in Cancer) database and website.” — 创世论文。DOI: 10.1038/sj.bjc.6601894。
  5. Futreal PA et al. (2004), Nature Reviews Cancer 4:177-183. “A census of human cancer genes.” — Cancer Gene Census 的思想源头(291 基因)。
  6. Alexandrov LB et al. (2020), Nature 578:94-101. “The repertoire of mutational signatures in human cancer.” — PCAWG 签名图谱,COSMIC 签名 v3 目录的科学基础。
  7. Alexandrov LB et al. (2013), Nature 500:415-421. “Signatures of mutational processes in human cancer.” — 突变签名学奠基论文。
  8. Forbes SA et al. (2017), Nucleic Acids Research 45(D1):D777-D783. “COSMIC: somatic cancer genetics at high-resolution.” — 高分辨率时代版本论文。DOI: 10.1093/nar/gkw1121。
  9. Jubb HC et al. (2017), Nature Genetics 49:1076-1078. “COSMIC-3D provides structural perspectives on cancer genetics for drug discovery.” — 蛋白结构可视化模块。
  10. Forbes SA et al. (2015), Nucleic Acids Research 43(D1):D805-D811. “COSMIC: exploring the world’s knowledge of somatic mutations in human cancer.” — 知识库架构成型期的关键版本。

§8.6 社区活跃度

维度 数据
COSMIC 系列论文累计被引 超 10,000 次(QIAGEN 官方口径,截至 2026)
Tate 2019 单篇被引 4,400+(OpenAlex/SciSpace 口径,截至 2026-09);Google Scholar 口径更高
Forbes 2017 单篇被引 1,456(ScholarGPS/OpenAlex 口径,截至 2026-09)
注册用户 37,000+ 活跃用户(2024-05 v100 新闻稿)→ 50,000+ 科学家信赖使用(QIAGEN 2026 口径);约 95% 为学术/医疗系统用户
更新节奏 每年 5 月与 11 月两更;官方支持最新版 + 前三个版本
团队 约 28 人(策展、工程、产品;2021 报道口径)
教学地位 肿瘤基因组学与精准医学课程的标配参考库

§8.7 生态快照

资源 类型 链接 活跃度(截至 2026-09) 为什么值得关注
SigProfiler 工具链 工具库 https://github.com/AlexandrovLab 活跃(MatrixGenerator/Extractor/Assignment 多仓库,数千 star 合计) 签名分析官方实现,与 COSMIC 目录同步
MutationalPatterns R 包 Bioconductor 活跃 R 生态签名 refit 标准
maftools R 包 https://github.com/PoisonAlien/maftools 3,000+ 引用 MAF 整合分析与 COSMIC/CGC 标记联动
Ensembl VEP COSMIC 插件 注释工具 https://www.ensembl.org/vep 随 Ensembl 季度更新 生产级变异注释管线标配
OpenCRAVAT 注释平台 https://opencravat.org 活跃 可插拔注释商店,含 COSMIC 模块
cBioPortal 在线平台 https://www.cbioportal.org 活跃 已整合 COSMIC/CGC 注释的队列探索
UCSC Xena 在线平台 https://xenabrowser.net 活跃 TCGA 等队列与 COSMIC 注释交叉分析
Cell Model Passports 姊妹资源 https://cellmodelpassports.sanger.ac.uk 活跃 1,020 细胞系的模型选择与 CLP 互补
QIAGEN COSMIC 产品页 商业通道 https://www.qiagen.com/.../cosmic 年度订阅 商业许可、样例数据与网络研讨会

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) 主引用论文(Tate 2019)
@article{tate2019cosmic,
  title={COSMIC: the Catalogue Of Somatic Mutations In Cancer},
  author={Tate, John G and Bamford, Sally and Jubb, Harry C and Sondka, Zbyslaw and Beare, David M and Bindal, Nidhi and Boutselakis, Harry and Cole, Charlotte G and Creatore, Celestino and Dawson, Elisabeth and others},
  journal={Nucleic Acids Research},
  volume={47}, number={D1}, pages={D941--D947},
  year={2019}, doi={10.1093/nar/gky1015}
}

% 2) 当前版本论文(Sondka 2024)
@article{sondka2024cosmic,
  title={COSMIC: a curated database of somatic variants and clinical data for cancer},
  author={Sondka, Zbyslaw and Dhir, Nidhi Bindal and Carvalho-Silva, Denise and Jupe, Steven and Madhumita and McLaren, Karen and Starkey, Mike and Ward, Sari and Wilding, Jennifer and others},
  journal={Nucleic Acids Research},
  volume={52}, number={D1}, pages={D1210--D1217},
  year={2024}, doi={10.1093/nar/gkad986}
}

% 3) Cancer Gene Census(使用 CGC 时加引)
@article{sondka2018census,
  title={The COSMIC Cancer Gene Census: describing genetic dysfunction across all human cancers},
  author={Sondka, Zbyslaw and Bamford, Sally and Cole, Charlotte G and Ward, Sari A and Dunham, Ian and Forbes, Simon A},
  journal={Nature Reviews Cancer},
  volume={18}, pages={696--705},
  year={2018}, doi={10.1038/s41568-018-0060-1}
}

% 4) 突变签名(使用签名目录时加引)
@article{alexandrov2020signatures,
  title={The repertoire of mutational signatures in human cancer},
  author={Alexandrov, Ludmil B and Kim, Jaegil and Haradhvala, Nicholas J and Huang, Mi Ni and Tian Ng, Alvin Wei and Wu, Yang and Boot, Arnoud and Covington, Kyle R and Gordenin, Dmitry A and Bergstrom, Erik N and others},
  journal={Nature},
  volume={578}, pages={94--101},
  year={2020}, doi={10.1038/s41586-020-1943-3}
}

% 5) 创世论文(历史性引用)
@article{bamford2004cosmic,
  title={The COSMIC (Catalogue of Somatic Mutations in Cancer) database and website},
  author={Bamford, Sally and Dawson, Elisabeth and Forbes, Simon and Clements, John and Pettett, Ross and Dogan, Ahmet and Flanagan, Adrienne and Teague, Jon and Futreal, P Andrew and Stratton, Michael R and Wooster, Richard},
  journal={British Journal of Cancer},
  volume={91}, pages={355--358},
  year={2004}, doi={10.1038/sj.bjc.6601894}
}

许可要求:论文中披露 COSMIC 数据时须注明使用 COSMIC 及相关部分的具体版本号(条款 2.1.2 Publication Enablement)。

教程与学习资源

  • COSMIC 官方教程与演示(含 Actionability Tutorial and Demo):https://www.cosmickb.org/
  • QIAGEN cosmic-release 页(版本说明 + 免费样例数据 + 网络研讨会):https://digitalinsights.qiagen.com/cosmic-release
  • Sondka et al. 2024 全文(PMC10767972):架构与策展流程的最佳单一文档
  • 签名分析实战:SigProfilerAssignment GitHub README 与 AlexandrovLab 文档
  • Forbes et al. 2016, Current Protocols in Human Genetics 91:11.15.1-11.15.27(官方使用协议教程)

原始论文

  1. Tate JG et al. (2019). “COSMIC: the Catalogue Of Somatic Mutations In Cancer.” Nucleic Acids Research 47(D1):D941-D947. DOI: 10.1093/nar/gky1015. PMID: 30371878.
  2. Sondka Z et al. (2024). “COSMIC: a curated database of somatic variants and clinical data for cancer.” Nucleic Acids Research 52(D1):D1210-D1217. DOI: 10.1093/nar/gkad986. PMID: 38183204. PMCID: PMC10767972.
  3. Sondka Z et al. (2018). “The COSMIC Cancer Gene Census.” Nature Reviews Cancer 18:696-705. DOI: 10.1038/s41568-018-0060-1. PMID: 30293088.
  4. Bamford S et al. (2004). “The COSMIC database and website.” British Journal of Cancer 91:355-358. DOI: 10.1038/sj.bjc.6601894.
  5. Alexandrov LB et al. (2020). “The repertoire of mutational signatures in human cancer.” Nature 578:94-101. DOI: 10.1038/s41586-020-1943-3.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索:版本规模核实(v100-v104)、CGC/签名/Actionability 口径、许可条款原文、引用量快照、发布历史交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 COSMIC 官方 release notes、Sondka 2024/Tate 2019 论文、Sanger 新闻稿、QIAGEN 产品页与许可条款原文中整理结构化信息;(2) 生成 §6 的 pandas/DuckDB/SigProfiler 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. cancer.sanger.ac.uk/cosmic/release_notes — v103/v104 官方统计与变更记录
  2. Sanger 新闻稿 “Largest genomic cancer resource accelerating research and drug development”(v100,2024-05-21)
  3. Tate et al. (2019), NAR 47:D941-D947(DOI: 10.1093/nar/gky1015)
  4. Sondka et al. (2024), NAR 52:D1210-D1217(DOI: 10.1093/nar/gkad986;PMC10767972)
  5. Sondka et al. (2018), Nat Rev Cancer 18:696-705(CGC;DOI: 10.1038/s41568-018-0060-1)
  6. cancer.sanger.ac.uk/cosmic/termscosmickb.org/terms-and-conditions-chinese — 许可条款原文(学术/商业/AI 训练限制)
  7. GenomeWeb “Qiagen Takes Over Commercial Sales of Sanger’s COSMIC Database”(2021;含 2004-02-04 上线与 2015 商业许可史)
  8. QIAGEN COSMIC 产品页与 COSMIC Datasheet(2026-05 版数据表,v103 规模口径)
  9. cancer.sanger.ac.uk/signatures/ 与签名版本说明页(v3.0-v3.6 版本链、SBS40 弃用公告)
  10. QIAGEN “COSMIC v104 and Actionability v20 now available” 博客(2026-05)
  11. COSMIC Knowledgebase LinkedIn 发布(v103/v104 要点、CGC 新基因清单)
  12. Alexandrov et al. (2020), Nature 578:94-101(签名目录科学基础)
  13. Nature 2025 结直肠癌多国签名研究(s41586-025-09025-8,外部验证证据)
  14. ScholarGPS / SciSpace / Google Scholar 引用快照(截至 2026-09-05)
  15. skillmd.ai COSMIC 技能参考与 decision.ai 签名技能页(下载文件清单与签名构成复核)
  16. phe-culturecollections.org.uk(Cell Lines Project 与 ECACC 细胞系)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、临床任务、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(v103/v104 统计、版本矩阵) 千方病案医学编辑部 与官方 release notes 交叉比对 ✅ 已验证
§4 数据结构(COSV 标识符、DAIMS 字段字典) 千方病案医学编辑部 与 Sondka 2024 及官方文档交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点(含许可合规) 千方病案医学编辑部 逻辑审查 + 与许可条款原文比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及 Scholar 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集