信息速览

ICGC — 国际癌症基因组联盟数据门户 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ICGC Data Portal(国际癌症基因组联盟数据门户) |
| 英文全称 | International Cancer Genome Consortium Data Portal |
| 别名/简称 | ICGC、ICGC 25K、DCC Data Portal、ICGC-ARGO、dcc.icgc.org |
| 疾病分类 | 泛癌种(ICD-11 第 02 章 肿瘤;代表映射:2C25 肺恶性肿瘤 / 2C6Z 乳腺恶性肿瘤 / 2B90 结肠恶性肿瘤 / 2C10 胰腺恶性肿瘤 / 2C12.0 肝细胞癌 / 2C30 皮肤黑色素瘤等,详见 §2.1) |
| SNOMED CT | 363346000 Malignant neoplastic disease / 363358007 Malignant tumor of lung / 254837009 Malignant tumor of breast / 399068003 Malignant tumor of prostate(详见 §2.2) |
| 数据模态 | 基因组(WGS / WES / Panel)、转录组(RNA-Seq、miRNA)、表观组(DNA 甲基化)、结构化临床表型 |
| AI 任务类型 | 体细胞突变检测与注释、驱动基因发现、突变特征(mutational signatures)提取、肿瘤突变负荷(TMB)评估、分子分型、生存/预后建模、多组学整合 |
| 样本总数 | ICGC 25K Release 28:24,289 名供体(22,330 名含分子数据)、81,782,588 个体细胞突变 / PCAWG:2,658 个全基因组、38 种肿瘤类型 / ICGC ARGO:7,056 名供体(截至 2026-06) |
| 数据大小 | 开放突变目录 GB 级(TSV.gz);PCAWG 全量原始数据数百 TB 量级;ARGO 平台 179,000+ 分子分析文件 |
| 数据格式 | TSV(DCC 规格,gzip)/ VCF / BAM / CRAM / JSON(API) |
| 许可证 | ICGC Data Access Framework:开放层自由使用;受控层经 DACO 审核签署 Data Access Agreement |
| 访问级别 | 分级访问:开放层免注册直接下载;受控层申请审核(DACO,约 10 个工作日,授权 2 年) |
| DUO 标签 | GRU(开放层)/ HMB, PUB(受控层) |
| 语言 | 英文 |
| 首发日期 | 2010-04(联盟宣言,Nature 2010)/ 2011(DCC 数据门户上线) |
| 最后更新 | ICGC 25K 冻结于 Release 28(2019-11-26);ICGC ARGO Data Release 14.0(2026-03-09) |
| 发布机构 | ICGC 联盟 / 安大略癌症研究所(OICR,加拿大多伦多) |
| 官方主页 | https://www.icgc-argo.org/(原 dcc.icgc.org 已于 2024-06 退役) |
| 下载地址 | 开放数据:https://object.genomeinformatics.org(桶名 icgc25k-open)/ ARGO 平台:https://platform.icgc-argo.org/ |
| DOI | 10.1038/s41587-019-0055-9(门户论文)/ 10.1038/nature08987(联盟宣言)/ 10.1038/s41586-020-1969-6(PCAWG 旗舰论文) |
| 引用次数 | PCAWG 旗舰论文 3,200+(Google Scholar,截至 2026-09);门户论文 684 次(OpenAlex,截至 2026-09);联盟宣言 2,431 次(OpenAlex,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 开放层免认证即取、PCAWG 统一重分析质量顶尖、DACO 治理成熟;扣分项:25K 已冻结且为 GRCh37 坐标、原始数据分散于多个仓库、无官方 ML 划分 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(泛癌 ICD-11 与 SNOMED CT 映射、临床任务定义、体细胞变异金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(donor/specimen/sample 层级、SSM 字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 ICGC 联盟、OICR、ICGC ARGO、DACO 无任何商业利益关联。本页面不销售 ICGC 数据,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 ICGC、OICR 或其成员机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守 ICGC Data Access Framework 与数据使用政策。开放层数据可自由用于研究;受控层数据(原始序列、生殖系数据、详细临床字段)必须经 DACO 申请批准,禁止重识别供体。DUO 标签仅供参考,具体使用限制以 ICGC 官方协议为准。
§1 数据集概览
§1.0 30 秒速览
ICGC(国际癌症基因组联盟)是 2008 年成立、由全球数十个国家的癌症基因组项目组成的国际联盟,其数据门户汇集了 86 个癌症项目、24,289 名供体的分子与临床数据,包含 8,178 万个体细胞突变记录——是全球最大的泛癌体细胞突变开放目录之一。它的皇冠明珠是 PCAWG 计划:2,658 个肿瘤全基因组经统一流程重分析,覆盖 38 种肿瘤类型。
它的独特性在于**"联盟 + 门户 + 治理"三位一体**:ICGC 不只产数据,还定义了跨国癌症基因组数据的共享规则——DACO 数据访问合规办公室 15 年间支持了 38 个国家近 6,000 个研究项目的受控数据申请。2024 年 6 月原互动门户退役后,数据整体迁入 ICGC-ARGO 生态,继续以"开放层免认证 + 受控层 DACO 审核"的双轨方式服务全球研究者。
你可以用它来:做泛癌体细胞突变注释与驱动基因挖掘、复现 PCAWG 的突变特征与肿瘤演化分析、在 2,658 个全基因组上研究非编码区变异,或者作为 TCGA/COSMIC 的互补数据源训练泛癌机器学习模型。
§1.1 摘要
ICGC 的历史分三个阶段。第一阶段(2008-2019,ICGC 25K):联盟协调各国项目对 25,000 例原发未治癌症进行基因组表征,最终经数据协调中心(DCC,设于多伦多 OICR)发布 Release 28(2019-11-26)——86 个项目、22 个原发部位、24,289 名供体、8,178 万个简单体细胞突变(SSM),数据类型涵盖体细胞点突变、拷贝数变异、结构重排、基因表达、miRNA、DNA 甲基化与外显子连接。第二阶段(2013-2020,PCAWG):对 2,658 个全基因组(肿瘤+配对正常)用统一流程在多云环境下重新比对与变异识别,2020 年 2 月以 Nature 同期 6 篇、系列 23 篇论文收官,是癌症全基因组研究迄今最深的一次协同分析。第三阶段(2021 至今,ICGC ARGO):转向前瞻性、临床试验关联的高质量临床+分子数据,目标统一分析 10 万名供体,全部数据统一比对至 GRCh38;截至 2026 年 6 月平台已收录 7,056 名供体、179,000+ 分子分析文件。2024 年 6 月,原互动门户 dcc.icgc.org 正式退役,ICGC 25K 最终版与 PCAWG 数据以对象存储(开放)+ SFTP(受控)形式永久保留。
§1.2 战略价值分析
范式开创维度:ICGC 是继人类基因组计划之后第一个真正意义上的全球生物医学数据联盟。它证明了"成员国各自出资测序、统一数据中心汇总、分级访问治理"这条跨国协作路径可行——DACO 单点合规通道把分散在数十个法域的伦理与数据使用审查整合为一个流程,15 年支持近 6,000 个项目。这套"联邦式数据治理"模板后来被 ICGC ARGO、乃至 GA4GH 生态广泛借鉴,其 WGS 质控工作流更被采纳为 GA4GH 参考实现。
科学贡献维度:PCAWG 是癌症基因组学的"深水区"工程。此前的泛癌分析(TCGA PanCanAtlas)主要覆盖约 1% 的编码区,PCAWG 把视野扩展到全基因组其余 99%——顺式调控元件、非编码 RNA、大规模结构变异。旗舰论文证实平均每个癌症基因组携带 4-5 个驱动突变、约 5% 病例找不到已知驱动(提示驱动发现尚未完成),并系统建立了突变特征(mutational signatures)与肿瘤演化时间线的分析框架。这些成果已成为癌症 WGS 分析的公共基座。
AI 基础设施维度:对机器学习社区,ICGC 提供了三样稀缺资产:一是免认证即可批量获取的、跨 86 项目的体细胞突变大表(天然适合表征学习与迁移学习);二是 PCAWG 统一重分析产生的"无批次"金标准变异集(评估任何新 caller 的参照系);三是 ICGC ARGO 持续增长的、带治疗和随访信息的高质量临床-基因组配对数据(预后与疗效预测模型的训练场)。三者分别对应"规模、质量、临床深度"三种训练数据需求。
§1.3 横向对比
| 数据集 | 供体规模 | 模态 | 坐标体系 | 核心差异化 |
|---|---|---|---|---|
| ICGC 25K(Release 28) | 24,289 | WGS/WES + 转录组 + 甲基化 | GRCh37 | 最大泛癌体细胞突变开放目录;86 项目;已冻结 |
| PCAWG | 2,658(全基因组) | WGS 统一重分析 | GRCh38 | 统一 caller 共识变异集;非编码区覆盖最深 |
| ICGC ARGO | 7,056(截至 2026-06,目标 10 万) | WGS/Panel + 高质量临床 | GRCh38 | 临床试验关联、治疗与随访系统化;活跃更新 |
| TCGA / GDC | 约 11,000 患者、33 癌种 | 多组学 + 影像 + 病理切片 | GRCh38 | 美国单国项目;含组织病理图像;dbGaP 治理 |
| COSMIC | 140 万+样本(v90+) | 策展突变知识库 | GRCh37/38 | 人工策展的体细胞突变百科全书;商业授权 |
| AACR GENIE | 约 20 万样本 | 临床级 Panel 测序 | GRCh37 | 真实世界临床靶向测序,国际多中心 |
ICGC 的不可替代性在于:开放层无需任何注册即可批量下载(COSMIC 需授权、GENIE 需申请),PCAWG 是全基因组尺度唯一的统一重分析泛癌资源(TCGA 以 WES 为主),且与 TCGA 互补而非重复——两者合计覆盖欧美亚主要人群,PCAWG 本身就是两家的联合分析。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2008-04-29 | ICGC 于英国伦敦成立,目标对 50 种肿瘤类型、25,000 个癌症基因组进行系统表征 |
| 2010-04 | 联盟宣言论文发表(International network of cancer genome projects, Nature 464:993-998) |
| 2011 | DCC Data Portal 上线(Zhang et al., Database 2011, bar026),开始汇总各项目数据 |
| 2013 | PCAWG 计划启动,对 ICGC 全基因组进行统一泛癌分析 |
| 2015 | ICGCmed 白皮书发布,联盟战略转向临床关联(ICGC ARGO 的前身) |
| 2019-03-15 | 门户论文发表(Zhang et al., Nat Biotechnol 37:367-369) |
| 2019-11-26 | Release 28 发布——ICGC 25K 最终版:86 项目、24,289 供体、8,178 万 SSM |
| 2020-02-05 | PCAWG 收官:Nature 同期 6 篇 + 子刊共 23 篇论文(旗舰 Nature 578:82-93) |
| 2021 起 | ICGC ARGO Data Platform 上线,开始接收成员项目数据提交 |
| 2024-06 | dcc.icgc.org 互动门户正式退役;Release 28 与 PCAWG 数据迁移至对象存储 + SFTP 长期保留 |
| 2025-09-26 | ARGO Data Release 13.0(5,528 供体,130,000+ 文件) |
| 2026-03-09 | ARGO Data Release 14.0(新增 1,528 供体) |
| 2026-06 | 第 23 届 ICGC 科学年会(维罗纳):平台达 7,056 供体、179,000+ 分子文件;承诺供体 63,116 |
§1.5 典型 AI 应用场景
- 泛癌体细胞突变注释与驱动基因挖掘:以 8,178 万条 SSM 为底座训练突变功能预测或驱动识别模型(如 dNdScv、MutSigCV、深度学习变异效应预测)的特征与标签来源。
- 突变特征(Mutational Signatures)分析:用 SigProfiler 系列在 PCAWG 队列上提取 SBS/DBS/ID/SV 签名,做病因归因与分层。
- 全基因组非编码变异研究:PCAWG 是罕见开放的大规模肿瘤 WGS 资源,适合训练调控区变异效应模型(如启动子、增强子突变)。
- 泛癌分子分型与预后建模:结合表达、拷贝数与临床字段做无监督亚型发现与生存分析(注意 25K 临床字段稀疏,见 §6.5 坑点 8)。
- 临床试验基因组学与疗效预测(ARGO):ICGC ARGO 的高质量治疗与随访数据支持生物标志物发现、耐药机制与真实世界疗效建模。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
ICGC 覆盖泛癌谱系(ICD-11 第 02 章 肿瘤)。Release 28 的 86 个项目按 22 个原发部位组织,代表性部位到 ICD-11 的映射如下(以 ICD-11 官方浏览器为准):
| ICGC 项目示例(部位) | 中文名称 | ICD-11 对应 |
|---|---|---|
| BRCA(乳腺) | 乳腺恶性肿瘤 | 2C6Z 乳腺恶性肿瘤,未特指 |
| LUAD / LUSC(肺) | 肺恶性肿瘤 | 2C25.Z 支气管或肺恶性肿瘤,未特指 |
| COAD / READ(结直肠) | 结肠/直肠恶性肿瘤 | 2B90 结肠恶性肿瘤 / 2B92 直肠恶性肿瘤 |
| PACA / PAAD(胰腺) | 胰腺恶性肿瘤 | 2C10 胰恶性肿瘤 |
| LICA / LIHC(肝) | 肝细胞癌 | 2C12.0 肝细胞癌 |
| MELA / SKCM(皮肤) | 皮肤黑色素瘤 | 2C30 皮肤黑色素瘤 |
| PRAD(前列腺) | 前列腺恶性肿瘤 | 2C61 前列腺恶性肿瘤 |
| OV(卵巢) | 卵巢恶性肿瘤 | 2C73 卵巢恶性肿瘤 |
| KIRC / KIRP(肾) | 肾恶性肿瘤 | 2C90 肾恶性肿瘤,未特指 |
| BTCA(胆道) | 胆道恶性肿瘤 | 2C13.Z 胆囊恶性肿瘤,未特指 |
ICGC 项目代码规则为"癌种缩写-国家代码"(如 PACA-CA = 加拿大胰腺癌、BRCA-EU = 欧盟乳腺癌、LICA-FR = 法国肝癌),一个癌种往往由多个国家项目分别贡献。库内肿瘤形态学采用 ICD-O-3 编码,跨库映射时需注意 ICD-O-3(形态+部位)与 ICD-10/11(部位为主)语义不同。
§2.2 SNOMED CT 映射
| 临床场景 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 恶性肿瘤(总体) | 2D4Z | 363346000 | Malignant neoplastic disease (disorder) |
| 肺恶性肿瘤 | 2C25.Z | 363358007 | Malignant tumor of lung (disorder) |
| 乳腺恶性肿瘤 | 2C6Z | 254837009 | Malignant neoplasm of breast (disorder) |
| 前列腺恶性肿瘤 | 2C61 | 399068003 | Malignant tumor of prostate (disorder) |
| 结肠恶性肿瘤 | 2B90 | 363406005 | Malignant tumor of colon (disorder) |
| 皮肤黑色素瘤 | 2C30 | 2092003 | Malignant melanoma (disorder) |
| 肿瘤分子检测 | — | 397744000 | Molecular genetic analysis (procedure) |
| 新一代测序 | — | 432600000 | Sequencing, next generation (procedure) |
§2.3 疾病简介
癌症是一组由体细胞基因组变异驱动的疾病。据 WHO GLOBOCAN 估计,全球每年新发癌症约 2,000 万例、死亡约 970 万例,癌症负担仍在持续增长。几乎所有肿瘤的发生发展都伴随体细胞突变(点突变、插入缺失、拷贝数变异、结构重排)的累积,而每个肿瘤的突变谱既携带致癌驱动信号,也刻着诱变暴露(紫外线、吸烟、APOBEC、错配修复缺陷等)的"指纹"。系统性编目这些突变,是理解癌变机制、发现诊断标志物与开发靶向治疗的基础——这正是 ICGC 成立的初衷,也是其数据至今被数万篇论文使用的根本原因。
§2.4 临床任务定义
| AI 任务 | 临床定义 | 标准参考 | 在 ICGC 中的操作化 |
|---|---|---|---|
| 驱动基因/位点识别 | 显著正选择的复发突变 | IntOGen pipeline(dNdScv、MutSigCV、OncodriveFM 等集成) | 按 project_code 分组统计 SSM 复发性与功能后果 |
| 突变特征归因 | 96 三核苷酸上下文的突变过程分解 | COSMIC SBS/DBS/ID 参考签名(Alexandrov et al. 2020) | SigProfilerExtractor 在 PCAWG WGS 上提取 |
| 肿瘤突变负荷(TMB) | 每兆碱基非同义突变数 | 临床 TMB 以 Panel 口径为准;研究口径 WES/WGS 全量 | 按供体聚合 SSM 计数 ÷ 有效覆盖(注意 WGS/WES 不可直接比,见坑点 7) |
| 分子分型 | 基于多组学相似性的无监督亚型 | PCAWG 与各癌种 marker paper | 表达矩阵 + 突变矩阵联合聚类(MOFA、iCluster 类方法) |
| 预后/生存建模 | 总生存期与事件结局 | Cox 比例风险、DeepSurv | donor_vital_status + donor_survival_time(25K 缺失率高,ARGO 显著改善) |
| 疗效/生物标志物 | 基因型-药物反应关联 | ICGC ARGO 临床试验框架 | ARGO 治疗与随访字段 + 分子数据联合建模 |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 全球多中心:ICGC 25K 由 86 个成员国项目贡献(含与 TCGA、Sanger 癌症基因组项目的共建);ICGC ARGO 为 13 国 24 个成员项目 |
| 采集时间 | 2008 年至 2019 年(25K 各项目陆续采样测序);PCAWG 分析 2013-2020;ARGO 2021 起持续入组 |
| 规模(25K 口径) | 24,289 名供体、22,330 名有分子数据、81,782,588 条 SSM、57,905 个突变基因(Release 28) |
| 规模(PCAWG 口径) | 2,658 个肿瘤-正常配对全基因组、38 种肿瘤类型 |
| 规模(ARGO 口径) | 7,056 名供体、14,800 个样本、179,000+ 分子分析文件(截至 2026-06);成员承诺 63,116 供体 |
| 疾病构成 | 以原发未治肿瘤为主(25K 设计原则);ARGO 重点覆盖晚期疾病与临床试验人群 |
| 地域/人群 | 欧美人群占比偏高,东亚(日本、中国项目)次之;罕见癌种队列很小 |
| 年龄/性别 | 各癌种分布差异大,统一汇总统计意义有限;按项目查询 donor_age_at_diagnosis / donor_sex |
§2.6 金标准/参考标准
| 数据层 | 产生方式 | 产生者 | 金标准性质 |
|---|---|---|---|
| 体细胞突变(25K SSM) | 各项目自行测序与变异识别后提交 DCC | 各成员国基因组中心(Illumina 平台为主) | 项目间 caller 与流程异质——目录价值高,但不能当统一金标准 |
| PCAWG 共识变异集 | 统一比对 GRCh38 + 多 caller 集成共识(SNV/Indel/SV/CNA 各有专门工作组) | PCAWG Technical Working Group,跨云计算执行 | 泛癌 WGS 变异识别的参考基准;广泛用于评估新 caller |
| 突变特征目录 | SigProfiler 系列在 PCAWG 全队列提取并经跨方法验证 | PCAWG Mutational Signatures Working Group | COSMIC v3 签名的主要数据来源 |
| 驱动基因目录 | IntOGen 集成 7 种驱动发现算法的共识 | PCAWG Drivers & Functional Interpretation Group | 泛癌驱动发现的社区共识目录 |
| 临床结局(25K) | 各项目按 DCC 字典提交 vital status / survival time | 成员项目临床团队 | 缺失率高、随访定义不一,须按项目筛选使用 |
| 临床结局(ARGO) | 标准化临床字典(诊断-治疗-随访全流程)+ 提交端 QC | ARGO 成员项目 + OICR 数据质控 | 质量显著优于 25K;为精准肿瘤学建模设计 |
§3 数据集规格
§3.0 版本抉择矩阵
ICGC 生态今天实际存在四个可选入口,30 秒选型:
| 你的需求 | 推荐版本 | 获取方式 | 理由 |
|---|---|---|---|
| 快速获取泛癌突变大表做特征工程/教学 | ICGC 25K Release 28 开放层 | 对象桶免认证(S3 协议) | 8,178 万条 SSM 即下即用,无需任何申请;适合突变注释、签名教学 |
| 研究全基因组/非编码变异、复现 PCAWG | PCAWG 结果目录 | 对象桶开放结果 + DACO 受控原始数据 | 唯一统一重分析的 2,658 WGS;共识 SNV/Indel/CNV/SV 金标准 |
| 需要治疗、随访、临床试验关联的新课题 | ICGC ARGO 平台 | DACO 申请(受控) | 唯一系统化收集治疗与结局的版本;GRCh38 统一工作流;持续增长 |
| 需要组织病理图像或 TCGA 特有组学 | GDC(TCGA) | GDC 门户 + dbGaP | ICGC 不含病理切片图像;TCGA 与 ICGC 供体有部分重叠需注意去重 |
一句话结论:要"快"用 25K 开放层,要"准"用 PCAWG,要"临床深度"用 ARGO,要"图像"去 GDC。
§3.1 模态详细说明
- 体细胞基因组变异:简单体细胞突变(SSM,SNV+小 Indel,8,178 万条)、体细胞拷贝数变异(CNSM)、体细胞结构重排(STSM)——25K 为各项目提交结果(GRCh37);PCAWG 为统一流程共识结果(GRCh38)。
- 转录组:基因表达(exp_seq / exp_array)、miRNA 表达、外显子连接(JCN);PCAWG 另有 RNA 改变专题(表达异常、可变剪接、融合基因)。
- 表观组:DNA 甲基化(meth_array / meth_seq,27K/450K 芯片与 WGBS 混合)。
- 结构化临床:donor(人口学、诊断、vital status、生存时间)、specimen(取材部位、ICD-O-3 形态、肿瘤含量)、sample(文库层级)三层临床-样本元数据;ARGO 扩展为诊断-治疗-随访全病程字典。
§3.2 样本量拆分
按计划分层(截至 2026-06):
| 计划 | 供体 | 分子数据 | 癌种覆盖 | 状态 |
|---|---|---|---|---|
| ICGC 25K Release 28 | 24,289(22,330 含分子数据) | SSM 81,782,588 条、57,905 个突变基因 | 86 项目 / 22 原发部位 | 已冻结(2019-11-26) |
| PCAWG | 2,658(含配对正常) | 全基因组统一重分析全套共识结果 | 38 种肿瘤类型 | 已冻结(2020-02 发布) |
| ICGC ARGO | 7,056 | 179,000+ 分子分析文件、14,800 样本 | 22 种肿瘤类型 / 24 项目 | 活跃(DR 14.0,2026-03-09) |
Release 28 数据类型分布(开放层):
| 数据类型 | DCC 代码 | 说明 |
|---|---|---|
| 简单体细胞突变 | SSM | 开放层主力,覆盖几乎全部含分子数据供体 |
| 拷贝数变异 | CNSM | 开放层 |
| 结构重排 | STSM | 开放层 |
| 基因表达 | EXPD/EXPM(exp_seq/exp_array) | 部分开放、部分受控,按项目而异 |
| miRNA 表达 | MIRM | 部分项目 |
| DNA 甲基化 | METH | 部分项目 |
| 外显子连接 | JCN | 部分项目 |
| 原始序列(BAM/FASTQ) | — | 全部受控,分散于 EGA/GDC/Collaboratory 等仓库 |
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 25K 开放层 | TSV.gz(DCC 规格) | 按"项目 × 数据类型"一个文件;制表符分隔,含 DCC 字典定义的列头 |
| PCAWG 结果 | VCF / TSV / BEDPE / 矩阵文件 | 按工作组目录组织(consensus_snv_indel、consensus_cnv、consensus_sv、mutational_signatures 等) |
| 原始序列 | BAM / FASTQ / CRAM | 受控层,按仓库分别下载(EGA、GDC、Collaboratory) |
| ARGO 平台 | VCF / CRAM / TSV + JSON API | File Repository 浏览 + score-client 下载 + 平台 API |
| 文件映射 | TSV 映射文件 | ICGC 25K File ID → 各仓库当前位置的官方映射(门户退役后必备) |
§3.4 存储大小
| 形态 | 量级 | 备注 |
|---|---|---|
| 25K 开放突变目录(全项目 SSM/CNSM/STSM TSV.gz) | GB 级 | 笔记本即可处理 |
| PCAWG 开放结果(共识 VCF、签名矩阵、驱动目录) | GB 级 | 对象桶直接下载 |
| PCAWG 全量原始数据(BAM 层级) | 数百 TB 量级 | 受控层,按需在仓库/云端分析,不建议整体下载 |
| ARGO 平台单项目分子文件 | 项目而异(GB-TB) | score-client 按 manifest 下载 |
§3.5 标注方式
ICGC 无人工标注——"标签"全部由生物信息学算法产生,分三个层级:
- 项目级变异识别(25K):各成员项目用自有流程测序、比对(GRCh37)并调用体细胞变异,按 DCC 数据字典提交。质量与灵敏度因项目而异。
- 统一重分析(PCAWG/ARGO):全部原始数据经统一流程重新比对 GRCh38;PCAWG 对每个变异类型采用多算法集成共识(如 SNV/Indel 由多个 caller 投票),ARGO 则执行标准化工作流(DNA 比对 BWA、变异调用 Mutect2/Sanger、RNA 比对 Hisat2/STAR),其 QC 管道被 GA4GH 采纳为 WGS 质控参考实现。
- 功能注释:consequence type、基因/转录本影响由 DCC 用统一基因构建版本(Ensembl)注释;驱动、签名等高层标签由 PCAWG 工作组以共识方法产生。
§3.6 标注者资质
不适用传统标注者概念。数据产生者是各成员国基因组测序中心与病理团队;变异"标注"的算法责任主体为各项目分析团队(25K)与 PCAWG/ARGO 技术工作组(统一流程);临床字段由成员项目临床团队按 DCC/ARGO 字典提交,ARGO 另设提交端自动 QC 与人工审核。
§3.7 数据采集时间范围
25K 项目样本采集与测序横跨 2008-2019 年;PCAWG 统一分析于 2013-2020 年执行;ARGO 自 2021 年起持续入组,每年约 4 次累积式数据发布(最新 DR 14.0,2026-03-09)。临床时间字段以诊断/入组为锚的相对时间表示,绝对日期已脱敏。
§3.8 地理覆盖
ICGC 25K 由全球数十个国家的 86 个项目贡献(美、加、英、法、德、西班牙、澳大利亚、日本、中国等);ICGC ARGO 覆盖 13 个国家 24 个成员项目,协调与数据中心位于加拿大多伦多 OICR。人群构成以欧美为主,是泛化性讨论(§7.3)必须考虑的因素。
§3.9 采集设备规格
| 环节 | 平台/流程 | 说明 |
|---|---|---|
| 测序平台 | Illumina 为主(HiSeq/NovaSeq 各代) | 各项目平台代际不一,25K 内存在 WGS/WES/Panel 混合 |
| 25K 比对 | 各项目自有流程,GRCh37 | 坐标体系统一为 hg19/GRCh37 |
| PCAWG 流程 | 统一比对 GRCh38 + 多 caller 共识,跨多云执行 | 旗舰论文 Fig.1 报告了各 caller 灵敏度/精度验证 |
| ARGO 流程 | BWA(DNA)、Mutect2/Sanger(SNV)、Hisat2/STAR(RNA)、含 FoundationOne CDx 数据整合 | QC 管道为 GA4GH WGS QC 参考实现 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 临床取样 | 成员项目肿瘤-配对正常组织采集,本地伦理批准 | 原发未治为主(25K);ARGO 扩展至晚期/试验人群 |
| 2. 测序 | 各国基因组中心(Illumina 平台为主) | WGS / WES / Panel / RNA-Seq / 甲基化芯片按项目设计 |
| 3. 项目级分析 | 各项目比对(GRCh37)与变异识别 | 结果按 DCC 数据字典格式化提交 |
| 4. DCC 汇总 | OICR 数据协调中心校验、统一注释、分级(开放/受控) | 生成 DO/SP/SA/MU 系列 ICGC 标识符;Release 1→28 累积发布 |
| 5. 统一重分析 | PCAWG(2013-2020)/ ARGO(2021 起)统一比对 GRCh38 + 共识调用 | 消除项目级流程异质性;产出共识金标准 |
| 6. 发布与迁移 | dcc.icgc.org(2011-2024.6)→ 对象桶 + SFTP(2024.6 起)+ ARGO 平台 | 原始文件保留于 EGA/GDC/Collaboratory 等仓库,官方映射文件串联 File ID |
| 7. 访问治理 | DACO(非美项目)/ dbGaP(美国项目) | 项目制申请、10 个工作日审核、2 年授权 |
§4 数据结构详解
§4.0 目录结构预览
ICGC 25K 开放对象桶(s3://icgc25k-open,S3 协议,免认证)结构如下(层级示意,以桶内实际 listing 为准):
icgc25k-open/
├── release_28/ # ICGC 25K 最终版(2019-11-26)
│ └── Projects/
│ ├── BRCA-EU/ # 示例项目:欧盟乳腺癌
│ │ ├── donor.BRCA-EU.tsv.gz # 供体临床(人口学/结局)
│ │ ├── specimen.BRCA-EU.tsv.gz # 标本(部位/ICD-O-3/肿瘤含量)
│ │ ├── sample.BRCA-EU.tsv.gz # 样本(文库层级)
│ │ ├── simple_somatic_mutation.*.tsv.gz # SSM 主表(开放层最大资产)
│ │ ├── copy_number_somatic_mutation.*.tsv.gz
│ │ ├── structural_somatic_mutation.*.tsv.gz
│ │ └── exp_seq.*.tsv.gz / meth_array.*.tsv.gz ...(按项目可得性)
│ ├── PACA-CA/ ... (共 86 个项目目录)
├── PCAWG/ # 泛癌全基因组分析结果
│ ├── consensus_snv_indel/ # 共识 SNV/Indel VCF(含 README)
│ ├── consensus_cnv/ # 共识拷贝数
│ ├── consensus_sv/ # 共识结构变异
│ ├── mutational_signatures/ # SBS/DBS/ID/SV 签名矩阵
│ ├── drivers_and_functional_interpretation/
│ ├── clinical_and_histology/ # PCAWG 供体临床与组织学汇总
│ └── rnaseq/ # 转录组改变结果
└── Supplemental/ # LICA-FR、PRAD-UK 更正临床与 RNA-Seq 计数(2019-10-16)
§4.1 DAIMS 标准化字段描述表
核心表:donor(每行一名供体)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| icgc_donor_id | TEXT | ICGC 供体唯一标识 | DO220886 | 全库主键 | 无 | 不允许缺失 | DO 前缀编号 |
| project_code | TEXT | 所属项目(癌种-国家) | BRCA-EU | 分层/批次变量 | 无 | 不允许缺失 | 86 个项目代码 |
| donor_sex | TEXT | 性别 | female | 协变量/公平性 | 偶有缺失 | -777 等约定缺失码 | male / female |
| donor_age_at_diagnosis | INTEGER | 诊断年龄(岁) | 58 | 协变量 | 按项目定义 | 约定缺失码 | 非负整数 |
| donor_vital_status | TEXT | 末次随访生存状态 | deceased | 生存分析结局 | 随访口径不一 | 缺失率高 | alive / deceased |
| donor_survival_time | INTEGER | 生存时间(天) | 1025 | 生存分析时间变量 | 各项目起算点不一 | 缺失率高 | 非负整数 |
| donor_diagnosis_icd10 | TEXT | ICD-10 诊断码 | C50.9 | 癌种映射 | 编码深度不一 | 部分缺失 | ICD-10 码 |
核心表:specimen / sample(取材层级)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| icgc_specimen_id | TEXT | 标本唯一标识 | SP103063 | 二级主键 | 无 | 不允许缺失 | SP 前缀 |
| icgc_sample_id | TEXT | 样本唯一标识 | SA542011 | 三级主键(关联测序) | 无 | 不允许缺失 | SA 前缀 |
| specimen_type | TEXT | 标本类型 | Primary tumour - solid tissue | 配对设计/过滤 | 文本取值按字典 | 不允许缺失 | DCC 字典枚举 |
| tumour_histological_type | TEXT | ICD-O-3 形态学编码 | 8500/3 | 病理亚型 | 按项目填报 | 部分缺失 | ICD-O-3 码 |
| percentage_cellularity | FLOAT | 肿瘤细胞含量 | 0.7 | 纯度校正(caller 灵敏度关键协变量) | 病理评估主观性 | 部分缺失 | 0-1 |
核心表:simple_somatic_mutation(每行一条"供体 × 突变"记录)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| icgc_mutation_id | TEXT | 突变唯一标识 | MU9151132 | 突变级主键 | 同一突变多供体共现会重复出现 | 不允许缺失 | MU 前缀 |
| icgc_donor_id | TEXT | 供体(外键) | DO220886 | 供体聚合 | 无 | 不允许缺失 | DO 前缀 |
| chromosome / chromosome_start / chromosome_end | TEXT / INT | 基因组坐标 | 17 / 7674220 / 7674220 | 特征工程 | 25K 为 GRCh37(见坑点 2) | 不允许缺失 | 合法坐标 |
| mutated_from_allele / mutated_to_allele | TEXT | 参考/变异等位基因 | C / T | 96 上下文构建 | 链方向需规范化 | 不允许缺失 | ACGT / Indel 序列 |
| mutation_type | TEXT | 突变类型 | single base substitution | SNV/Indel 分类 | 无 | 不允许缺失 | substitution / insertion / deletion |
| consequence_type | TEXT | 功能后果 | missense | 标签/过滤 | 依赖基因构建版本 | 部分缺失 | Ensembl 后果枚举 |
| gene_affected / transcript_affected | TEXT | 受影响基因/转录本 | ENSG00000141510 | 基因级聚合 | 版本相关 | 部分缺失 | Ensembl ID |
| total_read_count / mutant_allele_read_count | INTEGER | 总深度/变异支持读数 | 85 / 37 | VAF 计算 | 项目间灵敏度差异大 | 部分缺失(WES 区外) | 非负整数 |
| sequencing_strategy | TEXT | 测序策略 | WGS | 覆盖校正 | 无 | 不允许缺失 | WGS / WES / RNA-Seq 等 |
§4.2 标签分布统计
| 统计口径 | 数值 | 说明 |
|---|---|---|
| SSM 总量 | 81,782,588 条(Release 28) | 含全部 86 项目"供体 × 突变"记录 |
| 突变基因数 | 57,905 个 | 至少被一条 SSM 影响的基因 |
| 高突变负荷癌种 | 黑色素瘤、肺癌(紫外线/吸烟相关签名主导) | 与 PCAWG 及 COSMIC 文献一致 |
| 低突变负荷癌种 | 儿童肿瘤、血液肿瘤 | 每基因组突变数低 1-2 个数量级 |
| 高频突变基因 | TP53、KRAS、APC、PIK3CA 等 | 与泛癌驱动目录一致(IntOGen 共识) |
| 功能后果构成 | 同义与内含子突变占大头;非同义约小头 | WES 项目则非同义占比显著偏高——跨策略比较必须分层 |
§4.3 关键字段描述性统计
- 供体层级:24,289 名供体中 22,330 名(约 92%)至少有一种分子数据;单个供体可有多个 specimen(原发/复发/转移)与多个 sample。
- 突变层级:81,782,588 条 SSM 按 22,330 名分子数据供体折算,平均每供体约 3,663 条——但这是 WGS(全基因组计数)与 WES(仅编码区)混合的均值,不能直接解读。
- PCAWG:2,658 个基因组平均每个携带 4-5 个驱动突变(编码+非编码),约 5% 病例未发现已知驱动(PCAWG 旗舰论文)。
- ARGO:179,000+ 分子分析文件 / 14,800 样本 ≈ 每样本约 12 个分析文件(比对、SNV、RNA 等多工作流产出)。
§4.4 数据层级关系
PROJECT(如 PACA-CA,86 个项目)
└─ DONOR(icgc_donor_id,DO 前缀;一名供体 = 一名患者)
└─ SPECIMEN(icgc_specimen_id,SP 前缀;原发/复发/转移/正常对照)
└─ SAMPLE(icgc_sample_id,SA 前缀;一次建库)
└─ ANALYSIS / FILES(BAM、VCF;25K 原始文件分散于各仓库)
└─ simple_somatic_mutation 等分子表:以 icgc_donor_id + icgc_specimen_id + icgc_sample_id 三键关联
- 同一 icgc_mutation_id 可出现在多名供体记录中(复发突变),统计"独立突变数"须按基因组坐标+等位基因去重。
- 高频踩坑:TCGA 供体与 ICGC 部分项目(如美国来源项目)存在重叠,跨库合并必须按分子指纹或官方映射去重(见 §6.5 坑点 5)。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 字段示例 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| 结构性缺失 | donor_survival_time | 项目未收集或未随访 | DCC 约定缺失码(-777 等) | 25K 全库做生存分析会大幅丢样本;改用 ARGO 或按项目筛队列 |
| MAR(项目流程驱动) | percentage_cellularity | 部分项目未做病理评估 | 约定缺失码 | 纯度校正模型在这些项目上不可用 |
| MNAR(测序策略驱动) | total_read_count | WES 不覆盖内含子/基因间区 | 区外位点天然无读数 | 误以为"该区无变异"→ 漏报;必须按策略分层 |
| 版本性缺失 | 治疗/疗效字段 | 25K 字典不含系统治疗信息 | — | 疗效建模只能转用 ARGO |
| 编码性缺失 | ICD-O-3 形态码 | 填报深度不一 | 约定缺失码 | 病理亚型分析需先按项目评估完整度 |
§5 数据划分与使用建议
§5.1 官方数据划分
ICGC 不提供任何官方 train/validation/test 划分。社区惯例有两种:按项目留出(leave-one-project-out)评估跨队列泛化;或按供体随机分组。PCAWG 的分析以全队列描述性统计与跨方法一致性验证为主,不涉及 ML 划分。
§5.2 推荐划分策略
- 按 icgc_donor_id 分组随机划分(基线):同一供体的多 specimen/sample 必须落在同一侧。
- 按 project_code 留一项目验证:检验模型跨测序中心、跨人群的泛化性——这是 ICGC 数据最有信息量的评估方式。
- 按 sequencing_strategy 分层:WGS 与 WES 队列分开建模或作为协变量,绝不混合计算 TMB。
- 跨库去重后划分:与 TCGA/COSMIC 联合使用时,先去重再划分,否则同一肿瘤可能同时出现在训练与测试两侧。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
donors = pd.read_csv("donor.BRCA-EU.tsv.gz", sep="\t")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(donors, groups=donors["icgc_donor_id"]))
train_donors = set(donors.iloc[tr]["icgc_donor_id"])
test_donors = set(donors.iloc[te]["icgc_donor_id"])
assert len(train_donors & test_donors) == 0 # 供体级零泄漏验证
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 同一供体多 specimen(原发+复发)分属两侧 | 高 | GroupShuffleSplit(groups=icgc_donor_id) |
| 2 | 与 TCGA 重叠供体在跨库合并时重复出现 | 高 | 按坐标+等位基因分子指纹去重,或只保留一个来源 |
| 3 | 用配对正常组织(germline 背景)特征预测肿瘤表型 | 中 | 配对正常样本仅用于变异过滤,不作独立训练样本 |
| 4 | 全基因组特征(含治疗后才产生的突变)预测基线结局 | 中 | 明确采样时点;ARGO 纵向数据按时间窗切分 |
§5.4 交叉验证建议
- 标准:5-10 折按 icgc_donor_id 分组交叉验证。
- 稳健性:以 project_code 为折叠轴的留一项目验证(相当于跨机构外部验证的库内替代)。
- 报告:泛癌模型除总体指标外,必须按癌种与测序策略分层报告,避免高突变负荷癌种主导均值。
§5.5 外部验证
经典外部验证路径:TCGA/GDC(最常用配对验证集,注意重叠供体)、AACR GENIE(临床 Panel 人群,检验研究级发现向临床级检测的迁移)、COSMIC(独立策展目录,验证突变频率先验)、ICGC ARGO ↔ 25K/PCAWG(GRCh38 统一流程下的跨计划验证)。
§6 AI 就绪指南
§6.0 云端快速启动
零认证极速体验:ICGC 25K 开放层与 PCAWG 开放结果托管在 S3 兼容对象桶,无需注册、无需申请,一条 AWS CLI 命令即可列出与下载(注意必须带
--endpoint-url与--no-sign-request):# 浏览桶内容 aws s3 ls s3://icgc25k-open --endpoint-url https://object.genomeinformatics.org --no-sign-request # 下载 PCAWG 共识 SNV/Indel 目录说明 aws s3 cp s3://icgc25k-open/PCAWG/consensus_snv_indel/README.md . \ --endpoint-url https://object.genomeinformatics.org --no-sign-request # 递归下载某一目录 aws s3 cp s3://icgc25k-open/PCAWG/consensus_snv_indel . --recursive \ --endpoint-url https://object.genomeinformatics.org --no-sign-request受控层(SFTP):主机
icgc-legacy-sftp.platform.icgc-argo.org:2222,用户名为 DACO 批准邮箱,密码为 ARGO 平台个人页的 ICGC API Key,可用任意 SFTP 客户端连接。
§6.1 快速上手(Python 版:下载开放 SSM 并计算供体突变负荷)
# ========================================
# ICGC 25K 快速上手 — 开放层 SSM 突变负荷分析
# 环境要求: pandas, awscli(已配置好 endpoint 用法)
#
# ⚠️ 目录结构预期:
# 先用 aws cli 把目标项目目录同步到本地:
# aws s3 cp s3://icgc25k-open/release_28/Projects/BRCA-EU ./data/BRCA-EU \
# --recursive --endpoint-url https://object.genomeinformatics.org --no-sign-request
# ./data/BRCA-EU/
# ├── donor.BRCA-EU.tsv.gz
# ├── specimen.BRCA-EU.tsv.gz
# └── simple_somatic_mutation.*.tsv.gz
#
# 25K 坐标为 GRCh37;PCAWG/ARGO 为 GRCh38,混用前必须 liftover(见坑点 2)
# ========================================
import glob
import pandas as pd
data_root = "./data/BRCA-EU"
# 1. 读取 SSM 主表(文件名带通配,以实际为准)
ssm_path = glob.glob(f"{data_root}/simple_somatic_mutation*.tsv.gz")[0]
ssm = pd.read_csv(ssm_path, sep="\t", low_memory=False)
# 2. 供体级突变负荷(仅 WGS 供体间可比;WES 请单独分层)
tmb = (ssm[ssm["sequencing_strategy"] == "WGS"]
.groupby("icgc_donor_id").size().rename("mutation_count"))
# 3. 功能后果分布
print(ssm["consequence_type"].value_counts().head(10))
print(tmb.describe())
# 4. 构建 96 三核苷酸上下文(突变签名输入的第一步)
snv = ssm[ssm["mutation_type"] == "single base substitution"].copy()
snv["sub"] = snv["mutated_from_allele"] + ">" + snv["mutated_to_allele"]
print(snv["sub"].value_counts())
§6.2 数据获取流程
| 获取方式 | 位置 | 认证要求 | 适用内容 |
|---|---|---|---|
| 开放对象桶 | s3://icgc25k-open @ object.genomeinformatics.org |
无(--no-sign-request) |
25K 开放层全部 TSV + PCAWG 开放结果 |
| 受控 SFTP | icgc-legacy-sftp.platform.icgc-argo.org:2222 | DACO 批准邮箱 + ICGC API Key | 25K 受控层 release_28 / PCAWG / Supplemental |
| DACO 申请 | daco.icgc-argo.org | Google 邮箱 + 机构代表签署 | 一切非美国项目受控数据的总入口 |
| EGA | ega-archive.org(DAC:EGAC00001000010) | DACO 批准后开通 EGA 权限 | 原始序列与 PCAWG 再处理文件 |
| GDC / dbGaP | gdc.cancer.gov | dbGaP 申请 | 美国来源项目(含 TCGA 重叠部分) |
| ARGO 平台 | platform.icgc-argo.org | 注册浏览;受控下载需 DACO + score-client + API Token | ARGO 全部临床与分子数据 |
DACO 申请要点(以官方 FAQ 为准):申请人须为隶属研究机构/公司的独立研究者;须有机构授权签字代表;须提交科学摘要(明确提及 ICGC Controlled Data);须为至少 3 篇合格论文的作者/共同作者;如所在法域要求须附伦理批件。在线填写后由 PI 与机构代表签署提交,审核约 10 个工作日,批准后授予 2 年访问权。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 5 步预处理代码(SSM → 突变矩阵 → 签名输入)</b></summary>
# 步骤 1:读入并规范化等位基因(统一嘧啶参考约定,签名分析必需)
import pandas as pd
ssm = pd.read_csv("simple_somatic_mutation.open.BRCA-EU.tsv.gz",
sep="\t", low_memory=False)
purine_flip = {"A>G": "T>C", "A>C": "T>G", "A>T": "T>A",
"G>A": "C>T", "G>C": "C>G", "G>T": "C>A"}
snv = ssm[ssm["mutation_type"] == "single base substitution"].copy()
snv["sub"] = snv["mutated_from_allele"] + ">" + snv["mutated_to_allele"]
snv["sub_pyr"] = snv["sub"].replace(purine_flip) # C/T 为参考的 6 类
# 步骤 2:供体 × 突变类型计数矩阵
mat = (snv.groupby(["icgc_donor_id", "sub_pyr"]).size()
.unstack(fill_value=0))
print(f"突变矩阵: {mat.shape}") # 行=供体,列=6 类替换(加上下文即 96 类)
# 步骤 3:测序策略分层——WGS/WES 分开
wgs_donors = set(ssm.loc[ssm["sequencing_strategy"] == "WGS", "icgc_donor_id"])
mat_wgs = mat.loc[mat.index.isin(wgs_donors)]
# 步骤 4:合并临床协变量(donor 表)
donor = pd.read_csv("donor.BRCA-EU.tsv.gz", sep="\t")
feat = mat_wgs.join(donor.set_index("icgc_donor_id")[
["donor_age_at_diagnosis", "donor_vital_status"]], how="left")
# 步骤 5:供体级分组划分(复用 §5.2 代码)
from sklearn.model_selection import GroupShuffleSplit
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(feat, groups=feat.index))
</details>
96 上下文与签名提取:用 SigProfilerMatrixGenerator 直接从 VCF/MAF 生成 96/78/83 通道矩阵,再用 SigProfilerExtractor 做 de novo 提取并对标 COSMIC v3 签名——这是 PCAWG 签名分析的标准复现路径。驱动基因分析推荐 IntOGen pipeline(dNdScv + MutSigCV + Oncodrive 系列集成)。
§6.4 框架加载
import torch
from torch.utils.data import Dataset, DataLoader
class MutationDataset(Dataset):
"""供体 × 96 通道突变计数矩阵 → torch"""
def __init__(self, X, y):
self.X = torch.FloatTensor(X) # [N, 96]
self.y = torch.FloatTensor(y)
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return self.X[i], self.y[i]
loader = DataLoader(MutationDataset(X_train, y_train),
batch_size=64, shuffle=True)
import xgboost as xgb # 基线:突变矩阵 + 临床协变量 → 结局预测
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "auc",
"scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
"max_depth": 4, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=400)
§6.5 常见坑点
⚠️ 坑点 1:dcc.icgc.org 已退役——旧教程、旧 API、旧下载链接全部失效(分类:工程陷阱)
问题:2024 年 6 月原互动门户关闭,2015-2023 年间大量教程与论文方法学中的 dcc.icgc.org 链接、REST API 调用、icgc-get 旧命令均已失效。
症状:按文献复现时下载脚本 404;门户 API 无响应;找不到熟悉的 Data Repository 界面。
解决:改用两条现行通道——开放数据走 S3 对象桶(
s3://icgc25k-open,endpointhttps://object.genomeinformatics.org,--no-sign-request);受控数据走 SFTP(icgc-legacy-sftp.platform.icgc-argo.org:2222,用户名 = DACO 邮箱,密码 = ARGO 平台个人页 ICGC API Key)。新课题直接评估 ICGC ARGO 平台。参考:https://docs.icgc-argo.org/docs/data-access/icgc-25k-data
⚠️ 坑点 2:GRCh37(25K)vs GRCh38(PCAWG/ARGO)坐标体系错配(分类:预处理陷阱)
问题:ICGC 25K Release 28 的突变坐标基于 GRCh37(hg19),而 PCAWG 共识结果与 ICGC ARGO 全部为 GRCh38。直接按坐标合并两套数据会产生大规模假阳性"独有突变"。
症状:同一供体的 25K 与 PCAWG 突变按坐标 JOIN 重合率异常低;与 GDC/COSMIC v38 注释比对时位点系统性偏移。
解决:统一坐标体系再合并——对 25K TSV 用 CrossMap/pyliftover 做 liftover(GRCh37→GRCh38),并丢弃映射失败或链翻转的位点;或直接使用已统一为 GRCh38 的 PCAWG/ARGO 数据。注释时锁定单一参考版本(如 Ensembl release)。
参考:PCAWG 旗舰论文 Methods(统一比对 GRCh38);docs.icgc-argo.org 工作流文档。
⚠️ 坑点 3:误以为"全部数据免费下载"——open/controlled 分级误判(分类:工程陷阱)
问题:ICGC 采用分级访问:突变目录等聚合结果为开放层,但原始序列(BAM/FASTQ)、生殖系数据与详细临床字段属受控层,且原始文件分散在 EGA/GDC/Collaboratory 等不同仓库,各有独立账号体系。
症状:在对象桶里找不到 BAM;以为 DACO 批准后能直接下载 TCGA 美国项目原始数据(实际归 dbGaP 管辖)。
解决:先确定所需文件层级与所在仓库——用官方 File ID 映射文件定位;非美国项目走 DACO(daco.icgc-argo.org),美国项目走 dbGaP;DACO 批准后 EGA 权限会自动开通(DAC:EGAC00001000010)。
参考:https://docs.icgc-argo.org/docs/data-access/icgc-25k-data(仓库映射文件说明)
⚠️ 坑点 4:项目间批次效应——86 个项目 = 86 套测序与调用流程(分类:偏倚陷阱)
问题:25K 各项目测序平台代际、覆盖深度、caller 与过滤阈值各不相同;突变检出灵敏度差异可达数倍。"项目"与"癌种"高度混杂(同癌种多国项目),模型很容易学到"这是哪个中心测的"而非生物学信号。
症状:无监督聚类按 project_code 而非癌种聚集;某项目突变负荷整体偏高/偏低;跨项目 AUC 明显低于项目内 AUC。
解决:把 project_code 作为批次协变量(ComBat/条件归一化)或分层变量;评估一律做留一项目验证;对灵敏度敏感的分析优先用 PCAWG 统一重分析数据。
参考:PCAWG 旗舰论文 Fig.1(各 caller 灵敏度/精度系统验证,正是为解决此问题)。
⚠️ 坑点 5:ICGC 与 TCGA 供体重叠导致跨库重复计数(分类:数据泄漏)
问题:ICGC 与 TCGA 在人员与样本上有历史重叠,部分美国来源供体同时存在于两库(PCAWG 本身就是两家联合分析)。跨库合并统计突变频率或训练模型时,同一肿瘤会被计两次。
症状:合并后某些突变频率虚高;测试集与训练集出现"同一肿瘤的两个 ID",性能虚高。
解决:合并前按"染色体+坐标+参考/变异等位基因"的分子指纹去重,或只保留单一来源;PCAWG 场景直接使用其官方供体白名单(已含两库去重结果)。
参考:PCAWG 旗舰论文(ICGC + TCGA 联合队列构建方法)。
⚠️ 坑点 6:低估 DACO 申请门槛与时间成本(分类:工程陷阱)
问题:受控数据申请有硬门槛——机构隶属、机构代表签字、科学摘要、至少 3 篇本人署名的合格论文,且必须提供 Google/GSuite 邮箱;学生不能作为 PI(可列为 collaborator)。审核约 10 个工作日,授权 2 年到期需续期。
症状:临近投稿才申请导致进度受阻;用机构邮箱注册发现系统要求 Google 邮箱;早期文献中"24-48 小时批准"的说法已过时。
解决:项目启动即提交申请;由 PI 以 Google 邮箱注册;提前联系机构研究管理部门确定签字代表;把时间线按"提交→签署→10 个工作日审核"排期。
参考:https://docs.icgc-argo.org/docs/data-access/daco/daco-faq
⚠️ 坑点 7:WGS 与 WES 混合比较肿瘤突变负荷(TMB)(分类:评估误用)
问题:25K 同一癌种常同时有 WGS 与 WES 供体。WGS 计数全基因组突变(每供体数千条),WES 仅编码区(数十至数百条);混合计算"平均突变负荷"毫无意义,模型会直接把测序策略当成最强特征。
症状:TMB 分布呈双峰;TMB 与结局的关联在按策略分层后消失;特征重要性首位是"总突变数"。
解决:按 sequencing_strategy 分层分析;WES 队列按目标区域大小折算"每兆碱基突变数";跨策略合并时只用编码区交集并注明口径;报告中必须声明覆盖范围假设。
参考:TMB 标准化文献(如 Friends of Cancer Research TMB Harmonization 项目方法学框架)。
⚠️ 坑点 8:25K 临床字段稀疏——全库直接做生存分析会踩空(分类:标签理解)
问题:25K 的 donor_vital_status / donor_survival_time / 治疗字段缺失率高,且各项目随访起点与口径不一;25K 字典基本不含系统治疗信息。
症状:生存分析可用样本量远小于供体总数;不同项目生存曲线基线漂移;疗效关联分析完全无法开展。
解决:先按项目统计临床字段完整度,只对完整度达标的项目子集做生存建模;删失处理用 Kaplan-Meier/Cox 并注明随访口径;需要治疗与结局的课题直接转向 ICGC ARGO(其临床字典专为精准肿瘤学设计)。
版本提示:引用 25K 数据时务必注明 “ICGC Data Portal Release 28 (2019-11-26)”;引用 ARGO 数据注明 Data Release 号(如 DR 14.0)。早期论文基于 Release 1-27 的数字与 Release 28 可能有出入。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 对突变计数矩阵做 bootstrap 重采样评估签名稳定性 | 对基因组坐标做"抖动"制造新突变 |
| 按项目做群集级数据增强(群集重采样) | 跨项目混合后打乱 project_code 标记 |
| 降采样高突变负荷供体模拟低深度 | 把 WES 供体的编码区外位点填零当"无突变" |
| 序列上下文随机掩蔽做自监督预训练 | 对供体级 ID 做任何变换 |
§6.7 模型推荐
| 任务 | 推荐方案 | 输入 | 预期产出 |
|---|---|---|---|
| 突变特征提取 | SigProfilerExtractor(NMF) | 96 通道供体矩阵 | de novo 签名 + COSMIC 对标 |
| 驱动基因发现 | IntOGen pipeline(7 算法共识) | 按癌种分组的 SSM | 驱动基因目录与 q 值 |
| 变异效应预测 | 预训练基因组模型(如 Enformer 类)微调 | 突变位点上下文序列 | 功能影响打分 |
| 预后建模 | Cox / DeepSurv | 突变矩阵 + 临床协变量 | C-index(ARGO 数据优先) |
| 泛癌分型 | MOFA+ / autoencoder 多组学整合 | 突变 + 表达 + 甲基化 | 潜因子与亚型 |
| 快速基线 | XGBoost / 逻辑回归 | 基因级突变指示矩阵 | 任务 AUC 基线 |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 50 GB(单项目开放层) | 500 GB(多项目 + PCAWG 结果) |
| 内存 | 16 GB | 64 GB(全库 SSM 聚合,8,178 万行级) |
| GPU | 不需要(统计/签名分析) | 1 × 16 GB(基因组深度模型微调) |
| 时间参考 | 单项目 TMB 分析分钟级 | SigProfiler 全队列小时级 |
| 云端替代 | 对象桶 + Colab 直接流式读取 | PCAWG 原始数据建议在所在云/仓库侧分析 |
§6.9 评估指标
from sklearn.metrics import roc_auc_score, average_precision_score
from lifelines.utils import concordance_index
def evaluate_driver_pred(y_true, y_prob):
print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}") # 驱动位点极不平衡,必报
def evaluate_survival(time, event, risk):
print(f"C-index: {concordance_index(time, -risk, event):.4f}")
社区共识:驱动发现报 q 值(BH 校正)与跨算法一致性;签名提取报余弦相似度(对 COSMIC 参考)与稳定性(bootstrap);生存模型报 C-index 与校准曲线;所有泛癌指标必须按癌种分层报告。
§6.10 MLOps 笔记
- 版本锁定:方法学部分必须注明数据版本——"ICGC 25K Release 28 (2019-11-26)“或"ARGO Data Release 14.0 (2026-03-09)”,以及坐标体系(GRCh37/GRCh38)。
- 引用规范:使用 25K 门户数据引 Zhang et al. 2019(Nat Biotechnol);使用 PCAWG 数据引旗舰论文 Nature 2020;使用 ARGO 平台按其 Publication Guidelines 引用(见 §9)。
- DACO 合规:受控数据不得分享给未授权人员;批准后项目信息(姓名/机构/通俗摘要)可能进入 DACO 公开注册表;授权 2 年到期前安排续期。
- 门户退役的复现性风险:凡是方法学写"downloaded from dcc.icgc.org"的旧论文,复现时一律改走对象桶/SFTP 通道并核对 Release 号。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 流程异质偏倚 | 25K 各项目测序平台、caller、过滤阈值不同 | 高 | 用 PCAWG/ARGO 统一流程数据;project_code 作协变量 |
| 人群构成偏倚 | 欧美人群为主,东亚次之,非洲/拉丁美洲稀疏 | 高 | 公平性分析按祖源分层;关注 P1000-US 等多族裔新项目 |
| 癌种长尾偏倚 | 常见癌种数千供体,罕见癌种仅数十例 | 高 | 罕见癌种合并或仅做描述性分析 |
| 测序策略偏倚 | WGS/WES/Panel 混合,覆盖范围不可比 | 高 | 按策略分层(见坑点 7) |
| 疾病阶段偏倚 | 25K 以原发未治为主,晚期/转移/治疗后样本少 | 中 | 晚期疾病研究用 ARGO |
| 临床注释偏倚 | 随访与治疗信息项目间完整度差异大 | 中 | 按完整度筛队列;优先 ARGO |
| 发表/选择偏倚 | 项目入组受各中心病理可得性影响 | 中 | 明确声明队列来源构成 |
§7.2 标注质量评估
| 数据层 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| PCAWG 共识变异集 | 高(多 caller 投票 + 系统验证) | 跨中心统一流程 | 仅 2,658 例;低频亚克隆仍有漏检 |
| ARGO 工作流产出 | 高(GA4GH 参考级 QC) | 统一 GRCh38 流程 | 队列仍在增长,当前规模有限 |
| 25K 项目级 SSM | 中(项目间灵敏度差异大) | 低-中 | 假阳性/假阴性率按项目而异;无统一验证 |
| 突变功能注释 | 高(统一 Ensembl 基因构建) | 高 | 版本锁定后新注释不追溯 |
| 25K 临床结局 | 中-低 | 低(口径不一) | 缺失率高;治疗信息基本缺失 |
| ARGO 临床结局 | 高(标准化字典 + 提交 QC) | 高 | 随访时间尚短 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨人群(欧美 → 非洲/拉丁裔) | 高 | 签名研究已证实祖源相关突变过程差异;25K 人群构成单一 |
| 跨测序策略(WGS → 临床 Panel) | 高 | Panel 仅覆盖数百基因,全基因组特征(签名、SV)不可迁移 |
| 跨疾病阶段(原发 → 转移/耐药) | 中高 | 25K 原发队列发现的标志物在晚期疾病中频率与效应均改变;ARGO 正在补齐 |
| 跨癌种迁移 | 中 | 驱动与签名有强癌种特异性;泛癌模型须按癌种分层评估 |
| 跨时间(2008-2019 流程 → 当代) | 中 | 测序深度与 caller 代际进步使历史灵敏度口径过时 |
§7.4 伦理考量
- 数据来自真实癌症患者,相当部分供体已去世;研究者应保持对患者与家属的尊重。
- 开放层为去标识聚合结果;受控层(原始序列、生殖系、详细临床)含潜在可识别信息——DACO 协议明确禁止任何重识别尝试,违规将被撤销权限并通报机构。
- 生殖系变异信息即使" incidental finding "也受严格管控,不在开放层发布。
- DACO 批准后项目信息进入公开注册表是透明度设计,申请前应知悉。
- 基因组数据跨境流动受各法域(GDPR、人类遗传资源管理条例等)约束,跨国协作项目需提前评估合规路径;ICGC 正在建设多伦多-日本-中国联邦数据系统以应对这一挑战。
§7.5 公平性评估
from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score
frame = MetricFrame(
metrics={"AUROC": roc_auc_score},
y_true=y_test, y_pred=y_prob,
sensitive_features=test_df["project_code"] # 项目≈人群/中心的代理变量
)
print(frame.by_group)
print("差异:", frame.difference())
已知公平性要点:项目即人群代理变量,by_group 结果应同时按癌种解读;罕见癌种与少数族裔亚群样本量小,子群指标置信区间极宽,不宜单独建模下结论。
§7.6 数据漂移提示
- 25K 已冻结,不会漂移但也永远不会更新——任何"最新 ICGC 数据"需求都应指向 ARGO。
- ARGO 每年约 4 次累积发布,队列构成随新项目加入而变化(如 DR 14.0 大幅扩充 MUTO-INTL),纵向建模需锁定 Data Release 号。
- 测序技术代际漂移(短读长 → 长读长、深度提升)会改变突变检出下限,跨年代比较需做灵敏度校正。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | TSV 表每行一个供体/标本/突变事件 |
| 2 | 有唯一标识符列 | ✅ | DO/SP/SA/MU 系列 ICGC 标识符三级主键 |
| 3 | 无 Unicode 或特殊字符 | ⚠️ | 结构化字段基本 ASCII;自由文本与基因符号字段偶有特殊字符 |
| 4 | 无重复行 | ⚠️ | 同一突变多供体共现为设计使然;但 ICGC/TCGA 重叠供体需自行去重 |
| 5 | 缺失值已识别并编码 | ✅ | DCC 字典约定缺失码(-777 等) |
| 6 | 标签列被明确标识 | ✅ | 突变记录/功能后果/结局字段定义清晰 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 罕见癌种队列极小,未合并 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 七类偏倚与缓解措施 |
| 9 | 有完整的数据字典 | ✅ | DCC 字典 + ARGO Dictionary(docs.icgc-argo.org/dictionary) |
| 10 | 对"信息性缺失"有明确编码解释 | ✅ | §4.5 五类缺失机制 |
| 11 | 数据采集设备和设置已记录 | ⚠️ | 项目级平台代际记录不全;PCAWG/ARGO 流程记录完整 |
| 12 | 已移除完全共线性变量 | ⚠️ | 原始发布不处理,需下游自行评估 |
| 13 | 对编码的映射标准已说明 | ✅ | ICD-O-3 形态学 + GRCh37/38 坐标 + Ensembl 注释版本均明示 |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 临床时间为相对时间,绝对日期脱敏不可恢复 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 无官方划分;§5.2 给出社区惯例 |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 四种泄漏模式 |
| 17 | 标签分布已被分析 | ✅ | §4.2 突变负荷与功能后果分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | WGS/WES 覆盖差异(坑点 7)+ §4.5 |
| 19 | 外部验证建议已给出 | ✅ | §5.5 TCGA/GENIE/COSMIC/ARGO 路径 |
| 20 | 数据更新和版本信息已记录 | ✅ | Release 1-28 历史 + ARGO DR1-14 release notes 完整 |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 无官方 ML 管道;社区 SigProfiler/IntOGen 补位 |
| 22 | 合规使用要求已明确 | ✅ | Data Access Framework + DACO 政策文档完整 |
| 23 | 多模态对齐方法已说明 | ⚠️ | 同供体多组学需按 DO/SP/SA 三键自行对齐;PCAWG 已完成统一对齐 |
| 24 | 去标识化方法已被记录 | ✅ | 开放/受控分级 + DACO 治理框架完整文档化 |
DAIMS 评分:19 / 24
评分解读:良好——接近优秀——治理与文档化世界一流,扣分集中在 25K 遗产的固有异质性与 ML 工程层的缺位。
对你意味着什么:ICGC 的 15 个 ✅ 项几乎全部来自其教科书级的数据治理——三级标识符体系、完整数据字典、明确的缺失编码约定、完整的版本史与 DACO 合规框架,在同类联盟数据中无出其右。扣分项都有明确的工程补位:无官方划分(用 §5.2 供体分组 + 留一项目验证)、项目间异质(用 PCAWG/ARGO 统一流程数据)、WGS/WES 混合(按策略分层)、TCGA 重叠(分子指纹去重)、临床稀疏(生存/疗效课题转 ARGO)。与 MIMIC-III(18.5/24)相比,ICGC 的分更高在治理与更新通路(ARGO 活跃发布),更低在无 ML 原生基准——它是一座"科研矿藏"而非"开箱即用的 ML 数据集"。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能/结果 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| TCGA PanCanAtlas | NCI/NIH(美国) | 泛癌驱动与签名交叉验证 | 驱动目录与签名高度一致 | — | ICGC/TCGA 联合(PCAWG)即最大的相互验证 |
| COSMIC 签名库 | Sanger Institute(英国) | PCAWG de novo 签名对标 | 大部分 PCAWG 签名被收入 COSMIC v3 参考 | — | PCAWG 签名成为社区参考标准本身 |
| AACR GENIE | AACR(国际多中心) | 驱动频率向临床 Panel 人群迁移 | 常见驱动频率方向一致,绝对值受 Panel 覆盖与晚期构成影响 | 中 | 研究级发现可迁移,但需按覆盖与分期校正 |
| MSK-IMPACT 临床队列 | MSK(美国) | TMB 口径标准化 | 研究口径与临床 Panel 口径需线性折算 | 高 | TMB 跨平台不可直接比(呼应坑点 7) |
| ICGC ARGO(GRCh38) | OICR(加拿大) | 25K 项目队列在统一流程下重分析 | 检出灵敏度与一致性显著提升 | 中 | 统一流程是消除项目批次的最有效手段 |
2026 年还值得用 25K 遗产数据吗? 值得——按用途分层:突变注释、签名教学、泛癌描述性统计,Release 28 开放层仍是免认证即可获取的最大泛癌突变目录;任何对 caller 灵敏度、坐标体系、临床深度有要求的课题,直接用 PCAWG(统一重分析)或 ARGO(活跃临床队列)。
§8 基准性能与生态
§8.1 排行榜(PCAWG 工作组旗舰成果)
ICGC 没有 Kaggle 式 ML 排行榜。它的"排行榜"是 PCAWG 各工作组 2020 年 2 月集中发表的旗舰成果——至今仍是各自方向被引最高的参考基线:
| 方向 | 核心成果 | 年份 | 关键结论 | 完整引用 | 引用量(截至 2026-09) |
|---|---|---|---|---|---|
| 泛癌整合(旗舰) | 2,658 全基因组统一分析框架与资源 | 2020 | 平均每基因组 4-5 个驱动;约 5% 病例无已知驱动 | ICGC/TCGA PCAWG Consortium. “Pan-cancer analysis of whole genomes.” Nature 578:82-93. DOI: 10.1038/s41586-020-1969-6 | 3,200+(Google Scholar) |
| 肿瘤演化 | 38 癌种演化时间线重建 | 2020 | 驱动突变常早于诊断数十年;40% 样本突变谱随演化改变 | Gerstung M et al. (PCAWG Evolution & Heterogeneity WG). “The evolutionary history of 2,658 cancers.” Nature 578:122-128. DOI: 10.1038/s41586-019-1907-7 | 约 780+ |
| 突变特征 | SBS/DBS/ID 签名全集 | 2020 | 系统建立 COSMIC v3 签名参考 | Alexandrov LB et al. “The repertoire of mutational signatures in human cancer.” Nature 578:94-101. DOI: 10.1038/s41586-020-1943-3 | 2,000+(Google Scholar 量级) |
| 非编码驱动 | 全基因组非编码驱动筛选 | 2020 | TERT 启动子之外非编码驱动罕见但存在 | Rheinbay E et al. “Analyses of non-coding somatic drivers in 2,658 cancer whole genomes.” Nature 578:102-111. DOI: 10.1038/s41586-020-1965-x | 600+(量级) |
| RNA 改变 | 体细胞突变的转录后果 | 2020 | 1,000+ 例 RNA 改变与 DNA 变异关联目录 | PCAWG Transcriptome Core Group et al. “Genomic basis for RNA alterations in cancer.” Nature 578:129-136. DOI: 10.1038/s41586-020-1970-0 | 500+(量级) |
注:后三篇引用量为量级估计(精确数随数据库与时间波动),前两篇为检索核实值。不同论文结论不可脱离其工作组口径直接横比——各工作组使用不同的子队列与过滤标准。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 做突变特征研究 | PCAWG 签名矩阵 + SigProfilerExtractor 复现 | COSMIC v3 签名的原始出处,可比性最强 |
| 做驱动发现 | IntOGen 共识流程 + PCAWG 驱动目录作基准 | 7 算法共识是当前社区最稳基线 |
| 评估新变异 caller | PCAWG 共识 SNV/Indel 集作金标准 | 唯一多 caller 投票的泛癌 WGS 基准集 |
| 训练临床预后模型 | ICGC ARGO(勿用 25K) | 唯一有系统治疗与随访数据的版本 |
| 做教学/快速原型 | 25K 开放层单项目 SSM + §6.1 代码 | 免认证、GB 级、30 分钟跑通 |
§8.3 官方评测协议
无 ML 官方协议。社区事实标准:(1) 变异 caller 评估以 PCAWG 共识集为参照,报灵敏度/精度(参照旗舰论文 Fig.1 方法);(2) 签名分析以 COSMIC 参考签名的余弦相似度与重构误差为准;(3) 驱动发现以 IntOGen 共识 q 值与跨算法一致性为准;(4) 泛癌预测模型按癌种分层 + 留一项目验证报告。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| PCAWG | 子计划/核心资产 | ICGC+TCGA 联合的 2,658 WGS 统一重分析 |
| ICGC ARGO | 后继 | 临床试验关联的 10 万供体计划,活跃发布中 |
| TCGA / GDC | 姊妹库 | 美国国家队列;部分供体与 ICGC 重叠;含病理图像 |
| COSMIC | 互补知识库 | 策展突变百科全书,签名参考库源头;商业授权 |
| AACR GENIE | 互补 | 临床 Panel 真实世界队列 |
| cBioPortal | 下游平台 | 托管 ICGC/TCGA 泛癌研究的可视化入口 |
| IntOGen | 下游平台 | 基于 ICGC/TCGA 等数据的驱动发现流水线与目录 |
| EGA | 托管仓库 | ICGC 受控原始数据的主要归档(DAC:EGAC00001000010) |
§8.5 关键论文 Top 10
- ICGC/TCGA PCAWG Consortium (2020), Nature 578:82-93. “Pan-cancer analysis of whole genomes.” — PCAWG 旗舰论文,癌症 WGS 统一分析的最高引用基线。DOI: 10.1038/s41586-020-1969-6
- International Cancer Genome Consortium (2010), Nature 464:993-998. “International network of cancer genome projects.” — 联盟宣言,理解 ICGC 设计哲学的起点。DOI: 10.1038/nature08987
- Zhang J et al. (2019), Nature Biotechnology 37:367-369. “The International Cancer Genome Consortium Data Portal.” — 门户本体论文,引用 25K 数据的标准入口。DOI: 10.1038/s41587-019-0055-9
- Gerstung M et al. (2020), Nature 578:122-128. “The evolutionary history of 2,658 cancers.” — 肿瘤演化时间线重建。DOI: 10.1038/s41586-019-1907-7
- Alexandrov LB et al. (2020), Nature 578:94-101. “The repertoire of mutational signatures in human cancer.” — COSMIC v3 签名的奠基论文。DOI: 10.1038/s41586-020-1943-3
- Rheinbay E et al. (2020), Nature 578:102-111. “Analyses of non-coding somatic drivers in 2,658 cancer whole genomes.” — 非编码驱动发现的方法学参照。DOI: 10.1038/s41586-020-1965-x
- PCAWG Transcriptome Core Group (2020), Nature 578:129-136. “Genomic basis for RNA alterations in cancer.” — DNA 变异→RNA 改变的泛癌关联目录。DOI: 10.1038/s41586-020-1970-0
- Zhang J et al. (2011), Database 2011:bar026. “International Cancer Genome Consortium Data Portal—a one-stop shop for cancer genomics data.” — DCC 门户首篇论文,理解 Release 体系演进。
- Campbell PJ et al. (2020), Nature 578:82-93 同期系列. PCAWG 结构变异工作组成果(SV 共识调用方法学基线)。
- ICGC ARGO 平台 Publication Guidelines(持续更新) — 使用 ARGO 数据的官方引用要求,见 platform.icgc-argo.org。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| PCAWG 旗舰论文引用 | 3,200+(Google Scholar,截至 2026-09) |
| 联盟宣言论文引用 | 2,431 次(OpenAlex,截至 2026-09) |
| 门户论文引用 | 684 次(OpenAlex,截至 2026-09) |
| DACO 支持项目 | 近 6,000 个研究项目、38 个国家(15 年累计,截至 2026-06) |
| ARGO 成员规模 | 24 个成员项目、13 个国家、承诺供体 63,116(截至 2026-06) |
| 治理影响 | ARGO QC 管道被采纳为 GA4GH WGS 质控参考实现 |
| 年会 | ICGC 科学年会已连续举办 23 届(第 24 届将于 2027-05 在北京举办) |
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| ICGC ARGO Data Platform | 官方平台 | https://platform.icgc-argo.org/ | 活跃(DR 14.0) | 现行官方入口:File Repository、Data Discovery、API |
| ICGC 25K 数据文档 | 官方文档 | https://docs.icgc-argo.org/docs/data-access/icgc-25k-data | 活跃 | 门户退役后唯一的权威获取指南(对象桶/SFTP/映射文件) |
| Overture 软件栈 | 开源基础设施 | https://www.overture.bio/ | 活跃 | ARGO 平台的全部开源组件(score-client、SONG、SCORE 等) |
| SigProfiler 套件 | 工具库 | https://github.com/AlexandrovLab | 活跃 | 突变签名分析事实标准,PCAWG 签名论文官方实现 |
| IntOGen | 工具平台 | https://www.intogen.org/ | 活跃 | 驱动发现共识流水线,内置 ICGC/TCGA 数据 |
| cBioPortal | 可视化平台 | https://www.cbioportal.org/ | 活跃 | ICGC/TCGA 泛癌研究的零代码探索入口 |
| COSMIC | 知识库 | https://cancer.sanger.ac.uk/cosmic | 活跃(部分授权) | 突变功能策展与签名参考库 |
| EGA | 数据仓库 | https://ega-archive.org/ | 活跃 | ICGC 受控原始数据归档(DAC:EGAC00001000010) |
| icgc-get | 旧下载工具 | https://github.com/icgc-dcc/icgc-get | 已归档 | 仅供理解旧文献;现行通道见坑点 1 |
§9 相关资源与引用
官方资源
- 联盟主页(ICGC ARGO):https://www.icgc-argo.org/
- ARGO 数据平台:https://platform.icgc-argo.org/
- 文档中心(含 25K 获取指南、DACO、字典):https://docs.icgc-argo.org/
- DACO 申请入口:http://daco.icgc-argo.org/
- 开放数据对象桶:https://object.genomeinformatics.org(桶名 icgc25k-open)
- 受控 SFTP:icgc-legacy-sftp.platform.icgc-argo.org:2222
- 原门户(已退役,仅留说明页):https://dcc.icgc.org/
- 许可证框架:ICGC Data Access Framework(见 docs.icgc-argo.org 数据访问政策)
BibTeX 引用
% 1) ICGC 25K 数据门户(使用门户数据必引)
@article{zhang2019icgc,
title={The International Cancer Genome Consortium Data Portal},
author={Zhang, Junjun and Bajari, Rosita and Andric, Dusan and Gerthoffert, Francois and Lepsa, Alexandru and Nahal-Bose, Hardeep and Stein, Lincoln D and Ferretti, Vincent},
journal={Nature Biotechnology},
volume={37}, number={4}, pages={367--369}, year={2019},
doi={10.1038/s41587-019-0055-9}
}
% 2) 联盟宣言(联盟本体引用)
@article{icgc2010network,
title={International network of cancer genome projects},
author={{International Cancer Genome Consortium}},
journal={Nature},
volume={464}, pages={993--998}, year={2010},
doi={10.1038/nature08987}
}
% 3) PCAWG 旗舰论文(使用 PCAWG 数据必引)
@article{pcawg2020pan,
title={Pan-cancer analysis of whole genomes},
author={{ICGC/TCGA Pan-Cancer Analysis of Whole Genomes Consortium}},
journal={Nature},
volume={578}, number={7793}, pages={82--93}, year={2020},
doi={10.1038/s41586-020-1969-6}
}
% 4) 肿瘤演化(如使用演化分析结果)
@article{gerstung2020evolution,
title={The evolutionary history of 2,658 cancers},
author={{PCAWG Evolution and Heterogeneity Working Group} and {PCAWG Consortium}},
journal={Nature},
volume={578}, pages={122--128}, year={2020},
doi={10.1038/s41586-019-1907-7}
}
% 5) 突变特征(如使用签名结果)
@article{alexandrov2020signatures,
title={The repertoire of mutational signatures in human cancer},
author={Alexandrov, Ludmil B and others},
journal={Nature},
volume={578}, pages={94--101}, year={2020},
doi={10.1038/s41586-020-1943-3}
}
使用 ICGC ARGO 平台数据时,另须遵循其 Publication Guidelines(platform.icgc-argo.org)中的致谢与引用格式。
教程与学习资源
- ICGC 25K 数据获取官方指南:https://docs.icgc-argo.org/docs/data-access/icgc-25k-data
- DACO 申请指南与 FAQ:https://docs.icgc-argo.org/docs/data-access/daco/applying
- ARGO 平台下载指南(score-client):https://docs.icgc-argo.org/docs/data-access/data-download
- ARGO 数据发布说明(DR1-14):https://docs.icgc-argo.org/docs/release-notes/data-releases
- ARGO 临床数据字典:https://docs.icgc-argo.org/docs/dictionary
原始论文
- International Cancer Genome Consortium (2010). “International network of cancer genome projects.” Nature 464:993-998. DOI: 10.1038/nature08987. PMID: 20393554.
- ICGC/TCGA PCAWG Consortium (2020). “Pan-cancer analysis of whole genomes.” Nature 578:82-93. DOI: 10.1038/s41586-020-1969-6. PMID: 32025007.
- Zhang J et al. (2019). “The International Cancer Genome Consortium Data Portal.” Nature Biotechnology 37:367-369. DOI: 10.1038/s41587-019-0055-9. PMID: 30877282.
- Zhang J et al. (2011). “International Cancer Genome Consortium Data Portal—a one-stop shop for cancer genomics data.” Database 2011:bar026.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 8 组检索:官方文档、迁移公告、DACO 政策、ARGO 年会通报、论文引用快照 |
| OpenAlex API | 2026-09-05 | 两篇关键论文引用数精确核实(nature08987 → 2,431;s41587-019-0055-9 → 684) |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 docs.icgc-argo.org 官方文档、ICGC ARGO 年会通报、PCAWG 论文记录与 OpenAlex 中整理结构化信息;(2) 生成 §6 的 bash/Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- ICGC 25K Legacy Data 官方文档(docs.icgc-argo.org/docs/data-access/icgc-25k-data)——门户退役、Release 28 规模、对象桶/SFTP 通道、仓库映射
- DACO 申请官方文档与 FAQ(docs.icgc-argo.org/docs/data-access/daco/applying、daco-faq)——申请门槛、10 个工作日、2 年授权
- ICGC ARGO 第 23 届科学年会通报(icgc-argo.org/news/43/verona2026)——7,056 供体、179,000+ 文件、63,116 承诺供体、DACO 6,000 项目
- ARGO Data Releases 官方说明(docs.icgc-argo.org/docs/release-notes/data-releases)——DR 13.0/14.0 明细
- ICGC Initiatives 官方页(icgc-argo.org/page/65/icgc-initiatives-)——25K 目标与 PCAWG 23 篇论文
- PCAWG 旗舰论文记录(Nature 2020, 578:82-93, DOI: 10.1038/s41586-020-1969-6)与引用快照(Google Scholar 3,240)
- PCAWG 演化论文记录(Nature 2020, 578:122-128, DOI: 10.1038/s41586-019-1907-7,引用约 784)
- ICGC Data Portal 论文(Zhang et al., Nat Biotechnol 2019, DOI: 10.1038/s41587-019-0055-9;OpenAlex 引用 684)
- ICGC 联盟宣言(Nature 2010, 464:993-998, DOI: 10.1038/nature08987;OpenAlex 引用 2,431)
- Golden Helix 博客(ICGC v28 数据构成复核:57,905 突变基因)
- BBG Lab Wiki(ICGC 仓库分布与访问管辖:dbGaP/DACO 分工)
- KGHub KG-Registry ICGC 条目(GRCh38 统一分析与 DACO 治理复核)
- OICR Courtot Lab(ARGO 数据集迁移 Alliance Cloud 项目背景)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(Release 28 规模、版本矩阵) | 千方病案医学编辑部 | 与 docs.icgc-argo.org 官方文档交叉比对 | ✅ 已验证 |
| §4 数据结构(三级 ID、DAIMS 字段字典) | 千方病案医学编辑部 | 与 DCC 数据字典交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方获取指南比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 成果表与引用数表述 | 千方病案医学编辑部 | 与 Scholar/OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
