TCGA 癌症基因组图谱 — AI-Ready Wikipedia

33 癌种 · 11,000+ 患者 · 2.5 PB 多组学:二十年癌症分子图谱的参考级语料库

来源 https://portal.gdc.cancer.gov/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 52
TCGA 癌症基因组图谱 — AI-Ready Wikipedia

信息速览

数据集名称TCGA 癌症基因组图谱 — AI-Ready Wikipedia
数据类型33 癌种,11,000+ 患者,约 2.5 PB 多组学,WSI 约 11 TB,TCGA-CDR 四终点
规模11,000+ 名去标识癌症患者(多中心采集,含配对正常组织)
接入方式https://portal.gdc.cancer.gov/
AI 就绪度

TCGA — 癌症基因组图谱 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 The Cancer Genome Atlas(TCGA),癌症基因组图谱
发布方 NCI(美国国家癌症研究所)+ NHGRI(国家人类基因组研究所)联合;TCGA Research Network 多中心执行
启动/完成 2005 Pilot 启动;数据生成 2018 正式完成冻结;此后 GDC 持续 harmonized 后处理
主论文 Hoadley et al., Cell 173:291-304.e6(2018-04-05), DOI 10.1016/j.cell.2018.03.022(pan-cancer atlas);Liu et al., Cell 173:400-416(2018),DOI 10.1016/j.cell.2018.02.052(TCGA-CDR)
核心规模 33 癌种 / 11,000+ 患者(CDR 口径);约 10,000 聚类标本(atlas 口径);>20,000 组织样本(含配对正常)
数据量 约 2.5 PB;诊断 H&E WSI 约 11 TB(SVS 格式)
数据类型 WES/WGS + RNA-seq + miRNA-seq + 甲基化 450K + SNP6 CNV + RPPA 蛋白 + WSI + 临床四终点
载体 Genomic Data Commons(GDC,portal.gdc.cancer.gov);Data Release 46.0(2026-08-10)
坐标 GDC harmonized 统一 GRCh38;legacy/Firehose 产物为 hg19
访问 双层级:open access 免注册;个体级变异 dbGaP 受控(phs000178)
配套矩阵 mc3 MAF(PUBLIC/CONTROLLED)、EB++ mRNA batch-corrected、450K beta 合并矩阵、RPPA clean 矩阵、GISTIC 阈值化 CNV
本库关联 dbGaP(受控通道)、pcawg(泛癌 WGS 姐妹)、 dbGaP(受控通道)、pcawg(泛癌 WGS 姐妹)、human-protein-atlas(蛋白对照)、tcia(影像对照)、ClinVar(变异注释(蛋白对照)、tcia(影像对照)、rotein-atlas(蛋白对照)、tcia(影像对照)、ClinVar(变异注释)

§0 E-E-A-T 信任声明与免(变异注释) |

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、版本信息与许可表述均核实自一手来源:GDC 数据门户首页统计(Data Release 46.0,2026-08-10)、Cell 2018-04-05 pan-cancer 三连发论文(Hoadley et al. DOI 10.1016/j.cell.2018.03.022 与 Liu et al. DOI 10.1016/j.cell.2018.02.052)、GDC 官方 pan-cancer atlas 资源页(gdc.cancer.gov/node/977)、NCI TCGA 项目页,以及 GDC 文档站。检索核实时间为 2026-09-19。

TCGA 的数字口径复杂(患者/样本/标本/文件四层),本页在各处显式标注口径来源;「引用量」等无法精确核实的数字以「量级口径」表述。本页为技术参考文档,不构成临床决策依据——TCGA 是研究性、去标识、多平台科研数据,直接支撑临床报告前须按目标机构验证流程另行确认(§8.1)。

关于数据人群:TCGA 样本以北美多中心采集为主,ancestry 构成不均衡(欧洲 ancestry 主导),本页在公平性小节(§7.4)讨论其对 AI 外推的影响。使用 TCGA 时对样本贡献者的致谢与隐私保护义务见 §8。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:癌症研究的「参考级多组学语料库」——33 癌种、11,000+ 患者,每人一套 WES/RNA/miRNA/甲基化/CNV/蛋白/临床(多数另有病理 WSI)的完整分子档案。
  • 体量:约 2.5 PB;WSI 约 11 TB;文件百万级。
  • 坐标系:GDC harmonized 统一 GRCh38;legacy(Firehose)产物是 hg19——两套不能混用。
  • 访问:open access 免注册直下;个体级变异走 dbGaP(phs000178)受控申请。
  • 里程碑论文:2018-04-05 Cell pan-cancer atlas 三连发(cell-of-origin 分类 + TCGA-CDR 四终点临床资源)。
  • 适用:分子亚型发现、预后建模、多组学融合、病理 AI(WSI 弱监督)、变异注释与 signature 分析。
  • 不适用:免疫治疗时代结局推断(数据冻结于 2018)、人群频率查询(用 gnomAD)、非癌症人群健康建模。

§1.1 摘要

2005 年,NCI 与 NHGRI 联合启动了一个在当时看来极富野心的计划:对每一种主要人类癌症,采集数百名患者的肿瘤与配对正常组织,用当时最全的多平台分子技术(基因组、转录组、表观基因组、蛋白组)做完整分子表征,并全部公开。二十年后回看,TCGA 交付的不只是 33 个癌种的分子图谱,而是一种范式:**「分子表征 + 开放数据 + 多中心协作网络」**成为此后所有大型癌症组学项目(PCAWG、CPTAC、ICGC、HCMI)的模板。

对 AI 团队,TCGA 的价值在三个维度:

  1. 样本-组学配对完整性:同一患者身上同时有突变、表达、甲基化、拷贝数、蛋白与(多数情况)临床终点——多模态融合学习的「对齐样本」在别处极难凑齐。
  2. 规模与多样性平衡:单个癌种数百样本足够训练中等复杂度模型,33 个癌种又提供了跨癌种泛化与 meta-learning 的空间。
  3. 基准效应:TCGA 已是分子亚型、预后建模、WSI 弱监督等任务的事实基准——在 TCGA 上没有对照的癌症 AI 论文很难通过审稿。

数据规模的三档口径先立此存照:11,000+ 患者(临床资源口径)、约 10,000 肿瘤标本(泛癌聚类口径)、20,000+ 组织样本(含配对正常与重复取样)——后文所有引用数字都会标注属于哪一档。

成本侧:数据冻结(2018 后无新样本)限制了时序外推;受控/开放分层让全变异级分析需要 dbGaP 流程;barcode 与多版本临床数据的学习曲线陡峭。本页的坑点体系(§6.8)就是为压缩这条学习曲线而写。

§1.2 战略价值

  1. 多组学融合的教科书数据:突变-表达-甲基化-蛋白的同患者对齐是 MOFA、DIABLO、跨模态自监督等方法的理想试验场;pan-cancer batch-corrected 矩阵(EB++ mRNA、450K beta、RPPA clean)官方直接发布,免自建归一化。
  2. WSI 病理 AI 的奠基语料:约 11 TB 诊断切片 + 分子标签(亚型、突变状态、生存终点)构成弱监督学习(MIL)的天然标注——Camelyon 类数据集只给转移标签,TCGA 给的是「全分子谱」标签空间。
  3. 临床终点的可复现基准:TCGA-CDR 把 OS/DSS/PFI/DFI 四终点标准化并给出 per-cancer 使用建议,使预后模型的跨论文比较成为可能——这是 TCGA 对 AI 方法论最被低估的贡献。
  4. 变异解释的体细胞对照面:与 gnomAD(胚系频率)、ClinVar(临床致病性)互补,TCGA 的 mc3 MAF 是体细胞突变谱分析(mutational signature、driver 发现)的公共参考。

§1.3 同类数据集横向对比

资源 定位 规模 与 TCGA 的关系
TCGA 多组学 + WSI + 临床全矩阵 33 癌种 / 11,000+ 患者 / 2.5 PB —
PCAWG/ICGC 泛癌全基因组(WGS 优先) 2,658 例肿瘤 WGS / 26 癌种 WGS 深度补充 TCGA 的 WES 主线(本库有专页)
CPTAC 蛋白基因组学 数十癌种队列、蛋白+磷酸化 TCGA 同一批肿瘤的蛋白组纵深(GDC 同门)
HCMI 癌症模型(类器官/PDX/细胞系) 数百模型 GDC 内的新一代模型资源
ICGC 全库 国际泛癌队列 数万例、多国 与 TCGA 有样本重叠,策略互补
GEO/ArrayExpress 单实验数据 百万级 series 碎片化——TCGA 是「已整合」的价值
SEER 人群级癌症登记 数百万例 只有流行病学口径,无分子数据
记 数百万例 只有流行病学口径,无分子数据
cBioPortal TCGA 等的可视化前端 300+ studies TCGA 等的可视化前端
UCSC Xena 列式矩阵 + 分析 TCGA 全矩阵镜像 编程访问的轻量替代

一句话定位:要「全矩阵 + 病理图像 + 临床终点」的整合参考,用 TCGA;要 WGS 深度,看 PCAWG;要蛋白组纵深,看 CPTAC;要人群流行病学口径,用 SEER。

§1.4 版本时间轴

时间 事件 意义
2005-12 NCI+NHGRI 启动 Pilot(GBM/卵巢/肺鳞) 三癌验证多平台分子图谱可行性
2008-09 Nature 455:1061 GBM 分子图谱 首篇主论文;新亚型(proneural 等)确认
2012-09 Nature 490:61 乳腺癌 portraits 扩展期代表成果
2014-2017 逐癌种论文密集发表(Nature/Cell/NEJM 系列) 33 癌种网络论文完成
2018-04-05 Cell pan-cancer 三连发(atlas + CDR 等) 跨癌种整合:cell-of-origin 分类 + 标准化临床资源
2018 数据生成正式完成冻结 原始样本/测序不再新增
2021→ GDC 接管 harmonized 后处理 GRCh38 统一坐标、统一管线版本化
2025-12-04 GDC Data Release 45.0 harmonized 更新持续
2026-08-10 GDC Data Release 46.0 本页核实口径(GDC 全体 50,571 cases)

§1.5 典型应用场景

  1. 分子亚型发现与验证:用多组学聚类复现/扩展 pan-cancer 分类(pan-kidney、pan-gyn、pan-squamous 轴)。
  2. 预后与治疗反应建模:CDR 四终点 + 分子特征训练生存模型(Cox 深度学习、随机生存森林)。
  3. WSI 弱监督病理 AI:DX 切片 + 分子标签(MSI 状态、突变 burden、亚型)训练 MIL 模型。
  4. mutational signature 分析:mc3 MAF 提取 SBS/CNV signature,对照 COSMIC 参考谱。
  5. 跨组学调控推断:甲基化-表达、CNV-表达关联的泛癌 atlas。
  6. 基准方法学论文:任何「新多组学整合算法」都需在 TCGA 上与既有方法对照。

场景与验收口径的匹配(立项时先定验收,再选数据):

场景 主数据 验收指标 外部验证资源
分子亚型聚类 batch-corrected 多矩阵 一致性聚类稳定性 + 临床关联 PCAWG 同癌种
生存预测 EB++ 表达 + CDR c-index + 校准曲线 CPTAC
MSI 形态学预测 DX WSI + mc3 AUC + 患者分层 CPTAC WSI
signature 解卷积 mc3 MAF 与 COSMIC 余弦相似度 GENIE
跨组学调控推断 450K + 表达 增强子-启动子富集 HTAN 空间数据
突变效应预测 mc3 + 多矩阵 稀疏位点分层 AUC ClinVar 功能注释

§1.6 组件全景

TCGA 在 GDC 上的六个层次:

  1. 项目层:33 个 TCGA-XXX 项目(TCGA-LUAD、TCGA-BRCA…),各癌种独立 project 页。
  2. 患者/样本层:case → sample → portion → analyte → aliquot 的生物样本层级,16 位 barcode 贯穿。
  3. 文件层:百万级文件,每文件有 UUID、数据类别(Data Category/Type)、experimental strategy、access 分层。
  4. 临床层:GDC harmonized clinical TSV(人口学/诊断/治疗/随访)+ legacy XML + TCGA-CDR 四终点表。
  5. 管线层:GDC harmonized workflows(GRCh38:STAR 2-pass、MuTect2、VarScan2、CNVkit 类)+ legacy Firehose 产物。
  6. 配套分析层:pan-cancer atlas 官方产物(batch-corrected 矩阵、GISTIC 调用、stemness signatures、PARADIGM 矩阵)。

§1.7 「参考语料库」的经济学

TCGA 为什么 20 年不过时?三个经济学视角:

  1. 固定成本已沉没,边际成本趋零:2.5 PB 数据由 NIH 资助生成,后人免费用——任何团队获得「11,000 患者全矩阵」的成本只是一块磁盘。这使它成为所有癌症 AI 论文的默认对照组。
  2. 长尾价值:原始论文回答了当时的生物学问题(亚型、driver),但「分子数据 + 图像 + 临床」的组合价值随方法学进步持续增长——2018 年没人料到 ViT/MIL 会让 WSI 成为主角,2021 年后 WSI 引用量激增。
  3. 基准锁定效应:方法学论文在 TCGA 上报告结果 → 后续论文必须同场对照 → TCGA 地位自我强化。对新项目(如 CPTAC、HCMI)而言,既是流量入口也是「必须超越」的标尺。

反面也成立:数据冻结 + 北美人群 + 癌症中心富集采样意味着 TCGA 不能回答人群外推、时序漂移与医疗可及性差异问题——这些是新一代项目(All of Us、PCAWG-DX 国际扩展)的分工。

§2 医学与科学背景

§2.1 「分子图谱」范式的由来

TCGA 之前,癌症分子研究的典型形态是「一个实验室、一个基因、一个通路」。2000 年前后两项技术变化改变了格局:微阵列让全基因组表达测量成为常规,Sanger/二代测序让全外显子测序在 2008 年后进入千美元级。Perou et al. 2000 年的乳腺癌「molecular portraits」证明:肿瘤可以按全基因组表达谱聚类出有临床意义的亚型(Luminal A/B、HER2、Basal-like)——亚型间的生存差异远超传统分期。

TCGA 把这个范式推到极限:不止表达,还有突变、拷贝数、甲基化、蛋白,且样本量从数十例扩到每癌种数百例。Pilot 阶段(2005-2008,GBM/卵巢/肺鳞)回答了三个方法学问题——多平台数据能否整合(能)、数百样本是否够(够)、跨中心采集是否引入不可控偏差(可控)——随后扩展期铺开 30 个癌种。

§2.2 项目治理:Research Network 的「民主化」设计

TCGA-CDR 论文原话:「TCGA clinical data contain key features representing the democratized nature of the data collection process.」这个「民主化」指治理结构:

  • 多中心平权:数十个 BD2P(Biospecimen Core Resource)、测序中心、数据中心、分析中心组成 TCGA Research Network,样本与数据生产按癌种分包,没有单一中心垄断。
  • 统一 SOP:样本采集、病理质控(肿瘤细胞占比阈值)、分析物处理有统一协议——这是 TCGA 数据「批间可比」的基础。
  • 数据即时公开:与「分析完再发论文」的传统相反,TCGA 数据生成即入库公开(通过 dbGaP/GDC),论文是数据的「导出物」而非前提。
  • 网络署名制度:TCGA Network 作为集体作者——数百人署名成为大科学时代的标志性产物。

对后来者(PCAWG、CPTAC、国内的早期癌症队列),这套治理结构是可复制的模板。

§2.3 33 癌种的全景与命名

TCGA 的 33 个项目按解剖部位分组(项目代码 = TCGA-四个字母缩写):

  • 消化系统:COAD/READ(结直肠)、STAD(胃)、LIHC(肝)、PAAD(胰)、ESCA(食管)、CHOL(胆管)
  • 呼吸/胸部:LUAD(肺腺)、LUSC(肺鳞)、MESO(间皮瘤)、THYM(胸腺)
  • 女性生殖:BRCA(乳腺)、OV(卵巢)、UCEC(子宫内膜)、UCS(子宫肉瘤)、CESC(宫颈)、UCEC 家族另有 UVM 之外的 UCS
  • 泌尿:KIRC/KIRP/KICH(肾透明/乳头/嫌色)、BLCA(膀胱)、PRAD(前列腺)、TGCT(睾丸生殖细胞)
  • 神经:GBM(胶质母细胞瘤)、LGG(低级别胶质瘤)、PCPG(嗜铬细胞瘤)
  • 头颈/内分泌:HNSC(头颈鳞)、THCA(甲状腺)
  • 皮肤/软组织/骨:SKCM(黑色素瘤)、SARC(肉瘤)、UVM(葡萄膜黑色素瘤)
  • 血液/淋巴:DLBC(弥漫大 B)、LAML(急性髓系白血病)
  • 其他:ACC(肾上腺皮质)、PCPG、LAML、DLBC、MESO、UVM、TGCT、THYM、CHOL

每癌种样本量分布极不均匀:BRCA(~1,100)、LUAD(~500+)到 UVM/DLBC/CHOL(~50-80)。规划建模项目时以 GDC 项目页实查为准——「33 癌种」不代表每癌种都有足够训练量。

§2.4 cell-of-origin:pan-cancer atlas 的核心洞见

Hoadley et al. 2018 对约 10,000 标本做五平台独立聚类(非整倍体、甲基化、mRNA、miRNA、RPPA),发现:除非整倍体外,所有平台的聚类都被组织学/组织类型/解剖起源主导——即「细胞起源模式主导分子分类」。三个推论:

  1. 跨癌种的分子相似性是真实的:pan-gastrointestinal、pan-gynecological、pan-kidney、pan-squamous 轴内的癌种在分子上互为近邻——为泛癌轴研究提供依据。
  2. 组织起源 > 突变谱:同样是 TP53 突变,在胶质瘤与在胰腺癌里的分子语境完全不同——单基因泛癌分析容易产生伪相关。
  3. 对 AI 的含义:跨癌种预训练模型需要把「组织来源」作为分层变量;跨癌种迁移学习的「域偏移」主要来自 cell-of-origin 而非测序批次。

§2.5 亚型发现的历史收获

TCGA 网络论文的亚型级发现(举三例说明数据价值):

  1. GBM(2008):确认 proneural/neural/classical/mesenchymal 四亚型;发现高频 MDM2/CDK4 扩增与 NF1 失活——直接影响后续靶向试验分组。
  2. BRCA(2012):四亚型之外发现 Basal-like 与卵巢浆液性癌的分子接近性——跨癌种治疗假设的来源之一。
  3. UCEC(2013):把子宫内膜癌重划为 POLE 超突变、MSI 高突变、低拷贝数、p53 异常四型——这个分类后来被 WHO 分类采纳,是 TCGA「从论文进临床分类」的典型案例。

这些发现的共性:多平台数据 + 足量样本 + 公开。AI 时代的亚型发现(深度聚类、多模态对比学习)站在同一地基上。

§2.6 WSI 病理切片的语境

TCGA 的病理 WSI 是诊断切片(DX)的 Aperio 扫描(40X,SVS 格式),共约 11 TB。它的独特价值:

  • 分子标签免费配对:每张切片背后是完整分子档案——「形态 → 突变/亚型/生存」的监督信号不需要额外标注。
  • 弱监督的天然场景:切片级标签(如 MSI 高/低)+ 千万级 patch,正是 MIL(多实例学习)的标准输入结构。
  • ** limitations**:只有 DX 口径(冰冻/追加切片不在公开层);扫描仪单一(Aperio)——扫描仪域偏移要在 CPTAC/内部数据上补充;部分癌种 slide 缺失,样本量按 slide 元数据实查。

§2.7 与姐妹项目的关系

项目 关系 互补点
PCAWG ICGC 下的泛癌 WGS 项目 WGS 全谱(结构变异、非编码区)补充 TCGA WES 主线;约 2,658 例
CPTAC 蛋白基因组学联盟 对 TCGA 部分肿瘤做质谱级蛋白/磷酸化纵深;GDC 同门托管
HCMI 癌症模型计划 类器官/PDX/细胞系——从「档案」到「活模型」
GENIE AACR 泛癌临床测序注册 真实世界临床测序(非科研采集),与 TCGA 形成研究/临床对照
SEER 人群登记 提供流行病学分母——TCGA 是「被研究的选择性人群」

§2.8 冻结数据的时序含义

TCGA 数据生成冻结于 2018,这带来三个时序性局限:

  1. 治疗范式滞后:免疫检查点抑制剂(2014 后上市)时代的患者结局不在数据中——ICI 生物标志物研究(PD-L1/TMB)在 TCGA 上只能做「相关性推演」。
  2. 分期/分类版本滞后:部分癌种的 WHO/AJCC 分期已更新(如前列腺 Grade Group 取代 Gleason 分级口语化、胶质瘤的 IDH/1p19q 分子分类),GDC 临床字段保留的是采集时口径——跨版本映射要自查。
  3. 技术代差:WES 主线(而非 WGS)是 2010s 中期前的最优性价比选择;单细胞、空间组学等新技术不在数据中——TCGA 是「bulk 时代的天花板」,与单细胞时代资源(HCA 等)是互补不是替代。

§2.9 从分子分类到临床分类:TCGA 的转化路径

TCGA 亚型研究进入临床分类体系的三条典型路径,展示了「论文发现 → 临床实践」的完整链条:

  1. WHO 分类采纳:子宫内膜癌(UCEC)的 POLE 超突变/MSI/低拷贝/p53 异常四分型被 2020 版 WHO 女性生殖肿瘤分类采纳;中枢神经系统的 IDH 突变/1p19q 共缺失分类框架与 TCGA LGG/GBM 研究互相印证。
  2. 检测指南引用:MSI 状态作为泛癌 dMMR/MSI-H 免疫治疗标志物(2017 FDA 泛癌批准)的文献基础中有 TCGA 的 MSI 频谱与 TMB 分布数据。
  3. 临床试验分层:TCGA 亚型成为后续靶向试验的分层依据(如 BRCA Basal-like 与化疗反应、GBM 亚型与临床试验设计)。

对 AI 团队的含义:TCGA 分子标签不只是「数据集标签」——它是与临床决策体系有真实连接的分类系统。用这些标签训练的模型,其输出有进入临床对话的语义合法性(但仍需独立验证,见 §8 红线)。

§3 数据集规格

§3.0 规格总表

维度 口径
癌种 33 个 TCGA-XXX 项目
患者 11,000+(TCGA-CDR 口径);11,160 为常引精确值
聚类标本 约 10,000(pan-cancer atlas 口径)
组织样本 >20,000(含配对正常、转移、复发与重复取样)
总数据量 约 2.5 PB
WSI 诊断切片约 11 TB(SVS,Aperio 40X)
数据类型 WES/WGS、RNA-seq、miRNA-seq、450K 甲基化、SNP6 CNV、RPPA、临床
临床终点 TCGA-CDR:OS / DSS / PFI / DFI
坐标 GDC harmonized:GRCh38;legacy:hg19
访问 open + controlled(dbGaP phs000178)
门户版本 GDC Data Release 46.0(2026-08-10)
更新节奏 harmonized 后处理滚动更新;原始数据冻结

§3.1 数据类型矩阵与平台细节

平台 产物 归一/调用 注意
WES(Illumina) BAM(受控)/ mc3 MAF(双版) MuTect2 + VarScan2 双调用合并 TCGA 主线;WGS 仅部分癌种
RNA-seq BAM(受控)/ counts / FPKM-UQ STAR 2-pass + HTSeq 泛癌合并用 EB++ batch-corrected 矩阵
miRNA-seq mature miRNA 表达矩阵 mirna 调用 batch-corrected 版 pancanMiRs
甲基化 450K beta 值 Noob/functional 归一 少数 27K;合并版含平台归一
SNP6 CNV seg / GISTIC 调用 Birdseed + GISTIC2.0 ISAR 校正版官方发布
RPPA 蛋白丰度 SuperCurve + batch correction TCGA-RPPA-pancan-clean.txt
WSI SVS(DX) 无(原图) slide 元数据在 biospecimen slide.tsv
临床 harmonized TSV + CDR GDC 标准化 与 legacy XML 有字段差异

§3.2 TCGA-CDR 临床资源

Liu et al. 2018 发布的 TCGA-CDR 是临床分析的推荐起点:

  • 四终点定义:OS(总体生存)、DSS(疾病特异生存)、PFI(进展/复发间期,含新发肿瘤)、DFI(无病间期,仅 I-III 期无残留者)。
  • per-cancer 建议:各癌种终点质量不一(死亡登记差异、随访长度)——论文按癌种给出「推荐终点 + 数据质量评级」,生存分析前必读。
  • 字段:age_at_initial_pathologic_diagnosis、gender、race、ajcc_pathologic_tumor_stage、treatment_outcome_first_course 等标准化列 + 四终点的 time/status 对。
  • 获取:GDC pan-cancer atlas 资源页配套下载;亦在 UCSC Xena 镜像。

§3.3 GDC harmonized vs legacy

维度 GDC harmonized legacy(Firehose 时代)
坐标 GRCh38 hg19
RNA 管线 STAR 2-pass + HTSeq MapSplice/RSEM(旧)
变异调用 MuTect2/VarScan2(统一版) MuTect/VarScan(旧版)
获取 portal.gdc.cancer.gov GDC legacy archive
适用 新项目(推荐) 复现 2012-2017 论文

决策规则:新项目一律 harmonized;只有复现老论文数字时才回 legacy——并在论文里明示,避免混用两套坐标/管线比较结果。

§3.4 DAIMS 数据集资产信息表

字段 内容
资产名称 The Cancer Genome Atlas(TCGA)
资产类型 多组学 + 病理 WSI + 临床终点的参考级语料库
版本 数据生成冻结(2018);GDC Data Release 46.0(2026-08-10)harmonized 更新
规模 33 癌种 / 11,000+ 患者 / >20,000 组织样本 / 约 2.5 PB / WSI 约 11 TB
格式 BAM/VCF/MAF/TSV/SVS/beta 值矩阵/seg/GISTIC 表
标识 16 位 TCGA barcode + GDC UUID 双体系
平台 WES(MuTect2/VarScan2)、STAR 2-pass RNA、450K、SNP6、RPPA、Aperio 40X WSI
临床 GDC harmonized TSV + TCGA-CDR 四终点
访问 open(免注册)+ controlled(dbGaP phs000178)
门户 portal.gdc.cancer.gov(93 projects / 50,571 cases 为 GDC 全体口径)
计算需求 WSI 处理需 OpenSlide/大内存;矩阵分析单机可跑;全量下载需 TB 级存储
引用 Hoadley 2018 Cell(atlas)、Liu 2018 Cell(CDR)、Network 2008 Nature(GBM)、per-cancer 网络论文
健康声明 去标识研究数据;无再识别信息随附;临床外推须验证

§3.5 存储与下载规划

资源 量级 获取建议
全部 WSI(DX) ~11 TB gdc-client 按项目/癌种分批;SSD 缓存热数据
open 矩阵(counts/beta/seg/MAF 公开版) 数十 GB REST API 批量或 GDC 仓库过滤下载
受控 BAM PB 级中的一部分 仅获授权后按需,不建议全量
临床 + biospecimen TSV 每项目 MB 级 先下这个做样本规划
GDC 配套 pan-cancer 矩阵 单文件 GB 级 直接 node 977 资源页

§3.6 获取路径速查

  1. 交互探索:GDC Portal Cohort Builder(过滤项目/数据类型/临床特征)→ Cart → 下载 manifest 或直接下 cart。
  2. 编程访问:REST API(api.gdc.cancer.gov)+ gdc-client(大文件断点续传);R 生态用 TCGAbiolinks。
  3. 矩阵捷径:GDC pan-cancer atlas 资源页(node 977)官方配套矩阵;UCSC Xena 全矩阵镜像。
  4. 受控数据:dbGaP(phs000178)申请 → eRA Commons 授权 → GDC token 下载受控文件。
  5. WSI:Repository 过滤 experimental strategy=Slide Image 或 tissue Provenance;manifest + gdc-client 批量。

§3.7 版本与口径对齐表

你看到的数字 实际口径
「11,160 患者」 TCGA-CDR 精确患者口径(11,000+ 的常引值)
「10,000 tumors」 pan-cancer atlas 聚类标本口径
「20,000+ samples」 组织样本(含 normal/转移/重复取样)
「50,571 cases」 GDC 全体(含 CPTAC/HCMI/FMI),不是 TCGA
「2.5 PB」 TCGA 全数据量级口径
「93 Projects」 GDC 全体项目数(TCGA 占 33)

§3.8 与 legacy 时代产物的兼容性

复现 2012-2017 经典论文的实操要点:

  1. Firehose 产物(Broad GDAC)仍是矩阵级复现的最快路径(已封装 GISTIC/RSEM 产物)。
  2. legacy clinical XML 与 harmonized TSV 字段名不同(如 vital_status 语义一致但枚举细节有差)。
  3. 老论文的「RNASeqV2」对应 legacy RSEM 产物——与 harmonized HTSeq counts 数值不可直接比较。
  4. mc3 MAF 是泛癌合并变异的「终版」,替代各癌种论文附录的早期 MAF——signature 分析用 mc3。

§4 数据结构

§4.0 双标识体系:barcode 与 UUID

TCGA 同时使用两套标识,理解它们的分工是所有操作的地基:

  • TCGA barcode(16 位连字符格式):TCGA-XX-XXXX-01A-11D-xxxx-xx-xxxxx,编码患者到分子的层级语义。人类可读,跨 legacy/harmonized 稳定。
  • GDC UUID:每个 case/sample/aliquot/file 的 opaque 标识——API 与文件名的世界。文件名是 UUID(不可读),映射靠 sample sheet。

§4.1 barcode 语义拆解

TCGA - 02 - 7051 - 01A - 11D - 1731 - 08 - 8745 - 03
  |     |     |     |    |    |     |    |      |
 project participant sample vial portion plate center分析物…
段位 示例 语义
1-3 TCGA-02-7051 患者(project + participant)
4 01A sample type + 结果码:01 原发瘤、02 复发、06 转移、11 正常、40 类器官等;A/B/C 为同一 vial 的分装序列
5 11D portion/analyte:01 原始、10 未冻存部分、11 冻存组织(D=DNA)
6 1731 plate 序号
7 08 center(测序/分析中心代码)

关键规则:01 与 11(肿瘤-正常配对)共享患者前缀;02A/01A 是同一患者的不同取样(vial)——不做 sample type 过滤就把文件当独立样本,是样本数膨胀的第一大坑。

§4.2 目录与文件形态

GDC 下载后的典型目录形态:

gdc_download_xxx/
├── 0041c152-ad52-4c62-.../          # 每个文件一个 UUID 目录
│   ├── 0041c152-ad52-4c62-...htseq.counts.gz
│   └── 0041c152-ad52-4c62-....counts.gz.md5
├── 00f3a5c4-9f8d-.../
│   └── ...
└── gdc_manifest_20260919_xxxx.txt   # uuid → filename → md5 清单

注意:GDC 文件名不含患者信息——把 UUID 目录「扁平化合并」后必须靠 sample sheet / metadata 映射回 barcode,否则矩阵列名全是 UUID,临床对不上。

§4.3 DAIMS 字段字典(核心文件级)

文件/字段 语义 备注
cases.case_id GDC 患者 UUID 关联 clinical TSV 的 key
cases.submitter_id TCGA 患者 barcode 跨系统稳定主键
data_category / data_type 文件分类 如 Raw Sequencing Data / Masked Somatic Mutation
experimental_strategy WXS / RNA-Seq / Genotyping Array / Slide Image 下载过滤主轴
access open / controlled 受控文件需 dbGaP token
clinical.tsv 的 demographic.* 人口学 race/ethnicity 为采集时自报口径
diagnoses.ajcc_pathologic_stage AJCC 分期 采集时版本口径(§2.8 时序局限)
CDR 的 PFI.time/PFI 进展间期 time/status 对 per-cancer 使用建议见 CDR 论文
slide.tsv 的 slide_submitter_id 切片条码 后缀 DX/BS/TS/MS 区分切片类型

§4.4 临床与生物样本 TSV

每项目的打包 TSV(clinical.project-tcga-*.tar.gz 与 biospecimen 对应包)是样本规划的第一站:

  • clinical 包:clinical.tsv(主表)、exposure.tsv(吸烟饮酒)、family_history.tsv、follow_up.tsv、pathology_detail.tsv。
  • biospecimen 包:sample.tsv、portion.tsv、analyte.tsv、aliquot.tsv、slide.tsv——WSI 研究的 slide 过滤就在 slide.tsv。
  • 口径:一患者多行(多 diagnosis/follow_up)——按 case_id 聚合前先想清楚表的粒度。

§4.5 下载与映射参考代码

# 场景:下载 TCGA-LUAD 的 open 级 RNA-seq counts + 临床 TSV,并把 UUID 映射回 barcode
# 依赖:gdc-client(GDC 官网下载)或直接用 REST API

# 1) 用 GDC API 查询文件清单(open 的 HTSeq counts,LUAD 项目)
curl -s 'https://api.gdc.cancer.gov/files?filters=%7B%22op%22%3A%22and%22%2C%22content%22%3A%5B%7B%22op%22%3A%22in%22%2C%22content%22%3A%7B%22field%22%3A%22cases.project.project_id%22%2C%22value%22%3A%5B%22TCGA-LUAD%22%5D%7D%7D%2C%7B%22op%22%3A%22in%22%2C%22content%22%3A%7B%22field%22%3A%22files.data_type%22%2C%22value%22%3A%5B%22Gene%20Expression%20Quantification%22%5D%7D%7D%2C%7B%22op%22%3A%22in%22%2C%22content%22%3A%7B%22field%22%3A%22files.access%22%2C%22value%22%3A%5B%22open%22%5D%7D%7D%5D%7D&size=1000&format=TSV' > luad_rna_manifest.tsv

# 2) 生成 manifest 后用 gdc-client 批量下载(支持断点续传)
gdc-client download -m luad_rna_manifest.tsv -d ./luad_rna/

# 3) 直接 GET 单文件(小文件场景)
#    curl -o file.htseq.counts.gz 'https://api.gdc.cancer.gov/data/<uuid>'

# 4) 临床与 biospecimen 打包 TSV(项目页直接下载压缩包)
#    https://portal.gdc.cancer.gov/projects/TCGA-LUAD → clinical / biospecimen
#!/usr/bin/env python3
"""UUID → barcode 映射 + sample type 过滤:GDC 下载结果变成患者级矩阵的第一步。"""
import gzip, re, glob
from collections import defaultdict
import pandas as pd

BARCODE_RE = re.compile(r"TCGA-\w\w-\w{4}-(\d{2})([A-Z])")

def collect_counts(download_root: str, sample_types=("01",)) -> pd.DataFrame:
    """遍历 GDC 下载目录,按 barcode 聚合 HTSeq counts。
    sample_types 默认只收原发瘤(01);要配对分析改成 ("01", "11")。"""
    rows = {}
    meta = defaultdict(list)
    for path in glob.glob(f"{download_root}/**/*htseq.counts.gz", recursive=True):
        with open(path.replace(".gz", ".txt"), "r") as fh:  # GDC 附带 uuid→文件名映射
            pass  # 实际映射文件为 GDC 下载包内的 metadata;此处以目录名取 uuid
        uuid = path.split("/")[-2]
        # 简化示例:真实实现应从 metadata.tsv 读 cases.submitter_id 与 sample_type
        # 这里假设有 metadata.csv: uuid, submitter_id, sample_type_code
        rows[uuid] = path
    meta_df = pd.read_csv(f"{download_root}/metadata.csv")  # 由 API 导出
    keep = meta_df[
        meta_df["sample_type_code"].isin(sample_types)
        & meta_df["uuid"].isin(rows)
    ]
    counts = {}
    for _, r in keep.iterrows():
        bc = r["submitter_id"][:12]  # 患者 12 位前缀
        d = {}
        with gzip.open(rows[r["uuid"]], "rt") as fh:
            for line in fh:
                gene, val = line.rstrip("\n").split("\t")
                if not gene.startswith("__"):
                    d[gene] = int(val)
        counts[f"{r['submitter_id']}-{r['sample_type_code']}"] = d
    return pd.DataFrame(counts)  # gene x sample 矩阵,列名含 barcode+sample type

if __name__ == "__main__":
    print("骨架示例——生产版请补 GDC API metadata 导出与多进程读取")

§4.6 WSI 的检索与过滤

#!/usr/bin/env python3
"""从 biospecimen slide.tsv 过滤诊断切片(DX)并生成下载清单。
DX=诊断切片;BS=冰冻(biopsy/frozen);TS=追加肿瘤切片;MS=巨切片。"""
import pandas as pd

slide_df = pd.read_csv("biospecimen/slide.tsv", sep="\t")

def slide_kind(slide_submitter_id: str) -> str:
    # TCGA-XX-XXXX-01A-01-DX1 → 取第 5 段前两位字母
    seg = slide_submitter_id.split("-")
    return seg[4][:2] if len(seg) > 4 else "??"

slide_df["kind"] = slide_df["slide_submitter_id"].map(slide_kind)
dx = slide_df[slide_df["kind"] == "DX"].copy()
print(f"诊断切片 {len(dx)} / 全部 {len(slide_df)}")

# 与 manifest 合并生成 WSI 下载清单(uuid → api 直链)
manifest = pd.read_csv("gdc_manifest.txt", sep="\t")
merged = dx.merge(manifest, left_on="slide_submitter_id", right_on="filename", how="inner")
merged["url"] = merged["id"].map(lambda u: f"https://api.gdc.cancer.gov/data/{u}")
merged[["url", "md5"]].to_csv("wsi_download_list.tsv", sep="\t", index=False)

§4.7 泛癌配套矩阵清单

pan-cancer atlas 官方配套(GDC node 977)中最常用的矩阵:

文件 内容 典型用途
EBPlusPlusAdjustPANCAN_IlluminaHiSeq_RNASeqV2.geneExp.tsv mRNA batch-corrected 泛癌矩阵 跨癌种表达分析
pancanMiRs_EBadj...csv miRNA batch-corrected 矩阵 miRNA 泛癌聚类
jhu-usc.edu_PANCAN_HumanMethylation450.betaValue_whitelisted.tsv 450K beta 合并矩阵 甲基化聚类/EPK 分析
broad.mit.edu_PANCAN_Genome_Wide_SNP_6_whitelisted.seg CNV seg GISTIC/ISAR 校正
all_thresholded.by_genes_whitelisted.tsv GISTIC2 基因级 -2/-1/0/1/2 调用 拷贝数特征工程
TCGA-RPPA-pancan-clean.txt RPPA batch-corrected 蛋白层融合
mc3.v0.2.8.PUBLIC.maf.gz 泛癌合并 MAF(公开版) signature/驱动基因
TCGA_mastercalls.abs_tables_JSedit.fixed.txt ABSOLUTE 纯度/倍性 肿瘤纯度校正

§4.8 数据完整性验证清单

  1. md5 全检:GDC 每文件附 .md5——批量下载后逐文件核对(manifest 含 md5 列)。
  2. 样本数对账:你的样本数 vs GDC 项目页口径(LUAD 应为 ~585 患者);差异常来自 sample type 过滤遗漏。
  3. barcode 合法性:正则校验 TCGA-\w\w-\w{4}-\d{2}[A-Z];不匹配的行是解析错误。
  4. 开放/受控对齐:公开版 mc3 与受控版样本数不同——论文里写清用的哪个版本。
  5. 矩阵版本:batch-corrected 矩阵有日期戳版本(08_04_16 等)——复现锁定版本。
  6. 临床表对账:clinical.tsv 患者数 = CDR 表患者数(LUAD 例);缺失多为随访文件合并差异。
  7. WSI md5 + OpenSlide 打开抽检:随机 10 张 SVS 用 OpenSlide 读 level-0 尺寸非零、无截断。
  8. 坐标版本:受控 BAM 的 .bai 索引与 GRCh38 .fai 对齐;hg19 参考会比对失败。

§4.9 数据血缘示例

一次典型 WSI-分子融合研究的数据血缘:

TCGA-STAD 项目(胃癌)
  → slide.tsv 过滤 DX 诊断切片 + mc3 MAF 过滤 MSI 状态标签
  → WSI 下载(gdc-client)+ OpenSlide patch 切片(256x256, 20X 等效)
  → MIL 聚合(CLAM 类)→ 预测 MSI 高/低 + EBV/CIN/GS 亚型
  → 分子标签来自 mc3 MAF + GDC harmonized clinical
  → 生存分析用 CDR 四终点(STAD 建议 DSS/PFI)
  → 报告注明:受控/公开版本、坐标 GRCh38、CDR 版本、WSI 仅 DX 口径

§5 下游分析协议

§5.1 任务-数据-工具速查

任务 数据 推荐工具
编程访问全流程 全部 R TCGAbiolinks / Python gdc-api
差异表达 + 生存 counts + CDR DESeq2/edgeR + survival/survminer
体细胞变异谱 mc3 MAF maftools、SigProfiler
CNV 特征 GISTIC 表 / seg CNVkit、GISTIC2 复跑
甲基化聚类 450K beta minfi、ChAMP
多组学整合 多矩阵 MOFA2、mixOmics(DIABLO)、iClusterPlus
WSI 弱监督 SVS + 标签 OpenSlide、CLAM、PatchGCN
频率对照 — gnomAD(胚系)/ COSMIC(体细胞)
可视化探索 矩阵 cBioPortal、UCSC Xena

§5.2 差异表达 + 生存的最小流程

# R 环境(Bioconductor)
# 1) TCGAbiolinks 拉取 harmonized counts + 临床
#    GDCquery(project="TCGA-LUAD", data.category="Transcriptome Profiling",
#             data.type="Gene Expression Quantification", workflow.type="STAR - Counts")
# 2) sample type 过滤:只留 01(原发瘤),配对分析加 11
# 3) DESeq2 归一 + 感兴趣分组比较(如分期 III/IV vs I/II)
# 4) survival::coxph(Surv(OS.time, OS) ~ expression + age + stage, data=clinical_cdr)
#    —— 临床协变量与表达同模型,避免「单变量生存假象」
# 5) 多重检验:BH FDR;报告 HR + CI + p.adjusted

要点(错一次亏一篇的细节):

  1. 终点选择按 CDR per-cancer 建议(如 LUAD 用 OS/DSS,PFI 质量一般)。
  2. 样品级 vs 患者级:同患者多 vial 要去重(留 01A 或随机)。
  3. 批次协变量:plate/center 进 cox 模型或 ComBat 前置。
  4. FPKM-UQ 不适合 DE(组间不可比),组内筛查可用;DE 用 counts。

§5.3 mutational signature 分析协议

  1. 输入:mc3 MAF(公开版足够 SBS 分析——signature 用的是体细胞 SNV,不含受控敏感信息场景除外)。
  2. 流程:SigProfilerExtractor 提取 de novo signature → 与 COSMIC v3.5 参考谱余弦相似度匹配 → per-sample signature exposure 矩阵。
  3. 分层验证:按 APOBEC/Tobacco/UV/MSI 等已知 signature 的癌种分布 sanity check(SKCM 应见 UV、LUAD/LUSC 应见 Tobacco)。
  4. 坑点:FFPE artifact signature(SBS94 类)在 FFPE 样本富集——先过滤 artifact,再做生物学解读。

§5.4 多组学整合协议

以 MOFA2 为例的推荐管线:

  1. 样本对齐:以「同时有 RNA+甲基化+CNV+临床」的患者交集为准(pan-cancer 约 6,000+ 量级);barcode 12 位前缀对齐。
  2. 特征标准化:表达用 log2(counts+1) 或 EB++ 矩阵;beta 值按探针标准化;GISTIC 用阈值化类别值。
  3. 特征筛选:每平台选 MAD top N(如 5,000)防单平台维度淹没。
  4. 训练与解读:MOFA 因子 → 因子-临床终点关联(Cox/logistic)→ 因子-loadings 溯源平台与通路。
  5. 报告:per-platform variance explained + 因子稳定性(多 seed)。

§5.5 WSI 弱监督(MIL)协议

  1. 标签源:分子标签(MSI、TMB 二分、亚型)或 CDR 终点(时间到事件用 ordinal/分层处理)。
  2. patch 化:OpenSlide 读 level-1/2(20X/10X 等效),256x256,组织掩膜内采样;每切片 top-N patch(attention 采样)。
  3. 特征提取:预训练 encoder(CTransPath/UNI/CONCH 类病理预训练模型或 ImageNet 预训练 ViT)→ patch embedding。
  4. 聚合:ABMIL/TransMIL/DSMIL;k-fold 按患者分层(防同患者切片跨 fold 泄漏)。
  5. 评估:AUC(分类)或 c-index(生存);外部验证用 CPTAC 同癌种切片。
  6. 坑点预读:patch 级标签泄漏(中心坏死区)、扫描仪单一导致的外推虚高、标签不平衡(MSI 高占比低)。

§5.6 计算成本预算

环节 量级 时长参考 瓶颈
API 查询 + open 矩阵下载 数十 GB 数小时 磁盘
单癌种 WSI 下载(如 LUAD) ~500 GB 数天 带宽/磁盘
patch 提取(单癌种) 10万+ patch 单卡数天 IO
MIL 训练(单癌种单标签) — 单 GPU 数小时-天 显存
MOFA2 多组学(6,000 样本) — 服务器数小时 内存
全泛癌 signature(mc3) — 单机数小时 CPU

§5.7 常见失败模式与诊断

  1. 样本数「暴增」:sample type 未过滤——按 barcode 第 4 段重算。
  2. 临床对不上:混用 harmonized/legacy/CDR 三套临床——锁定一套并声明。
  3. 矩阵列全 UUID:下载后未做 metadata 映射——§4.5 脚本补上。
  4. 生存曲线诡异:终点混用(PFI 算了复发+新发肿瘤)或未按 CDR 建议选终点。
  5. WSI 下载缺文件:部分 slide 元数据存在但图像受控/缺失——manifest 回读核对。
  6. 跨版本比较:hg19/hg38 坐标混用——BED 区间先 liftOver 或统一来源。
  7. 泛癌聚类「全按癌种分开」:未用 batch-corrected 矩阵——换官方 EB++/beta 合并版。
  8. signature 解读失真:FFPE artifact 未过滤。

§5.8 可复现性操作清单

发表 TCGA 分析前的复现性自检(工程级):

  1. 版本三元组声明:GDC Data Release 版本号 + 坐标版本(GRCh38)+ 临床版本(CDR 日期)。
  2. 种子固定:所有随机过程(train/test 划分、特征选择、模型初始化)写入 seed。
  3. 样本清单外置:最终样本列表(barcode 级)作为附表发布——审稿人核对样本数的第一入口。
  4. 中间产物哈希:关键矩阵(训练矩阵、标签表)存 MD5——防止「代码一样数据不同」的复现争议。
  5. 环境快照:R/Python 包版本(renv/conda env 导出)随代码发布。
  6. 随机对照记录:每次打乱 train/test 的结果分布(而非单次)——TCGA 样本量下单次划分的指标波动可达 ±0.03 AUC。
  7. 数据来源脚本化:下载过程(API query + manifest + gdc-client 命令)作为脚本入库——三个月后连自己都能重跑。

§6 实证结果与方法学分析

§6.1 pan-cancer atlas 核心实证回顾

Hoadley et al. 2018(Cell 173:291-304)的实证设计值得方法论级学习:

实证项 设计 结论
五平台独立聚类 非整倍体/甲基化/mRNA/miRNA/RPPA 各自聚类 除非整倍体外,全部按组织学/起源主导
整合聚类(iCluster) 多平台联合 cell-of-origin 模式进一步强化
泛癌轴 Pan-GI/Pan-Gyn/Pan-Kidney/Pan-Squamous 跨癌种分子相似性可指导治疗策略
stemness 干性 signatures 与分化谱系一致性

方法论要点:每个平台先独立聚类再整合——直接「大杂烩融合」会被维度最大的平台劫持。这个教训直接适用于任何多模态 AI 的「先单模态基线再融合」纪律。

§6.2 TCGA-CDR 的终点质量实证

Liu et al. 2018 对 11,000+ 患者临床数据的整合给出三层次质量结论:

  1. 终点可用性分层:OS 全癌种可用;DSS 依赖死亡原因登记质量;PFI 在有复发登记的癌种(乳腺/结直肠等)质量高;DFI 仅 I-III 期无残留患者。
  2. 常见错误模式:随访时间截断差异、死亡原因歧义(癌症 vs 并发症)、新发肿瘤 vs 复发混淆——论文给出修正规则。
  3. per-cancer 建议:如 LUAD 推荐 OS/DSS、UCEC 推荐 PFI、THCA 因预后极好需长随访——忽视建议的生存分析会系统性失真。

§6.3 亚型发现的方法学公式

从 GBM 2018 到 pan-cancer 2018,TCGA 亚型研究的可复制公式:

足量样本(数百)+ 多平台(≥3)+ 无监督聚类(一致性聚类/Non-negative Matrix)
→ 亚型稳定性验证(多平台交叉支持)
→ 临床关联(生存/治疗反应)
→ 生物学命名(起源细胞/通路富集)

深度学习时代的扩展(深度聚类、对比学习)仍需通过「多平台交叉支持 + 临床关联」两道验证才被认为超越统计基线——这是 TCGA 二十年沉淀的方法学底线。

§6.4 结果解读的三层框架

  1. 资源层:规模/版本数字有官方出处可引用(注意 §3.7 口径表)。
  2. 发现层:亚型/driver/signature 结论绑定当时的平台与样本——复现前检查平台版本。
  3. 推断层:媒体转述的「AI 诊断癌症」「TCGA 证明 XX」多为过度简化——技术写作引用原始论文结论。

§6.5 与后续资源的接力

后续资源 接力内容
PCAWG WGS 深度补充(结构变异/非编码)
CPTAC 蛋白/磷酸化纵深 + FFPE 队列
GENIE 临床真实世界测序对照
HCMI 活模型(验证 TCGA 发现的可操作平台)
Human Tumor Atlas Network(HTAN) 空间/单细胞/多时点的下一代 atlas

§6.6 坑点(Pitfalls)

以下 8 个坑点均来自官方文档约束或真实失败模式,每条标注来源。

坑点 1:样本数口径混乱——患者/标本/样本/文件四级跳
11,000+ 患者(CDR)≠ 约 10,000 聚类标本(atlas)≠ >20,000 组织样本(含 normal/转移/重复取样)≠ 百万级文件。GDC 门户的 50,571 cases 是GDC 全体(含 CPTAC/HCMI/FMI),不是 TCGA。方案书与论文引用前先对齐口径,否则审稿人一眼识破。(来源:CDR 论文 / atlas 论文 / GDC 首页)

坑点 2:barcode 第 4 段不解析——样本膨胀与配对错乱
TCGA-XX-XXXX-01A 的 01 是原发瘤、06 是转移、11 是正常;A/B 是同 vial 分装。不过滤 sample type 直接聚文件 → 同一患者被计成多个样本;配对分析漏掉 11 → 肿瘤-正常配对缺失。(来源:TCGA barcode 规范)

坑点 3:三套临床数据混用——生存分析失真
GDC harmonized TSV、legacy XML、TCGA-CDR 三套临床字段与语义有差异(尤其终点定义)。CDR 是四终点标准化版且带 per-cancer 建议——生存分析锁定 CDR 并声明版本;harmonized 用于诊断/治疗字段。(来源:CDR 论文 / GDC 文档)

坑点 4:坐标体系混用——hg19/hg38 错位
GDC harmonized 是 GRCh38;legacy/Firehose 是 hg19。BED 区间、变异位点跨体系比较必然错位——先 liftOver 或统一来源。(来源:GDC 文档)

坑点 5:open/controlled 版本混淆——mc3 两个版本样本数不同
mc3 MAF 有 PUBLIC 与 CONTROLLED 双版本;公开版不含部分受控变异。用公开版复现受控分析的样本数对不上;反之,未获 dbGaP 授权却使用受控数据违反数据政策。(来源:GDC node 977 / dbGaP phs000178)

坑点 6:WSI 口径误判——只有 DX 且扫描仪单一
公开 WSI 是诊断切片(DX),slide.tsv 后缀 BS/TS/MS 不是同一口径;扫描仪以 Aperio 为主——单扫描仪数据上训练的域外推要在 CPTAC/多中心数据上验证。部分癌种/患者缺 slide,样本量按 slide 元数据实查。(来源:UW Hyak 文档 / GDC slide 元数据)

坑点 7:泛癌分析用原始矩阵——batch 效应劫持聚类
跨癌种合并表达/甲基化/RPPA 必须用官方 batch-corrected 矩阵(EB++ mRNA、pancanMiRs、450K 合并 beta、RPPA clean)——原始矩阵的 plate/center 批次会完全主导聚类结果,「发现」的全是批次而非生物学。(来源:node 977 配套矩阵说明 / atlas 论文方法)

坑点 8:数据冻结时序外推——免疫治疗时代结论错位
数据生成冻结于 2018:ICI 时代结局、新分期版本(IDH 胶质瘤分类、前列腺 Grade Group)不在数据中。引用 TCGA 做「当前临床标准」论证时要标注数据时点;ICI 生物标志物只能做相关性推演。(来源:CDR 论文与 NCI 项目页口径)

§6.7 审稿人视角自查清单

  1. 样本数口径(患者/标本/样本)明确且与所引版本一致。
  2. 临床数据版本声明(harmonized / legacy / CDR 日期)。
  3. 坐标版本声明(GRCh38 / hg19)。
  4. open/controlled 数据版本与授权说明。
  5. batch correction 策略(官方矩阵或自建 ComBat,注明)。
  6. WSI 研究声明 DX 口径与扫描仪局限。
  7. per-cancer 终点选择依据(引用 CDR 建议)。
  8. 人群局限(北美为主、ancestry 不均衡)在局限节明示。
  9. 致谢含 NCI/GDC/TCGA Research Network 与样本贡献者。

§7 AI 就绪指南与应用场景

§7.1 TCGA 在医疗 AI 中的四种喂法

  1. 多组学融合监督学习:突变/表达/甲基化/CNV/蛋白为多模态输入,CDR 终点为标签——预后模型(多模态 Cox、DeepSurv 变体)的标准训练场。
  2. WSI 弱监督:DX 切片 + 分子标签(MSI/TMB/亚型/生存)——MIL 系列方法的奠基数据;patch 级 self-supervised 预训练(DINO 类)的公开大语料。
  3. 自监督预训练语料:全泛癌表达矩阵(约 1 万样本)与 WSI(约 11 TB)分别是 tabular 组学与病理视觉两支预训练的公共基准语料。
  4. 变异解释先验:mc3 突变谱 + COSMIC signature 对照——突变效应预测(如 DeepMutation 类)的体细胞训练集。

§7.2 多组学融合模型实操配方

#!/usr/bin/env python3
"""TCGA 多组学 → 多模态生存模型的数据准备骨架。
输入:EB++ mRNA 矩阵、450K beta 矩阵(或 GISTIC 调用)、CDR 临床表。
输出:样本 x (各平台 top-N 特征 + 终点) 的训练矩阵。"""
import pandas as pd
import numpy as np

def prepare_multimodal_survival(
    expr_tsv: str,
    meth_tsv: str,
    cdr_tsv: str,
    top_n: int = 3000,
) -> pd.DataFrame:
    expr = pd.read_csv(expr_tsv, sep="\t", index_col=0)
    meth = pd.read_csv(meth_tsv, sep="\t", index_col=0).T  # 探针 x 样本 → 样本 x 探针
    cdr  = pd.read_csv(cdr_tsv, sep="\t", index_col=0)

    # 1) 样本 ID 统一:矩阵列/行常为 barcode 前 12-16 位;CDR 为主 barcode
    def norm_id(x: str) -> str:
        parts = x.split("-")
        return "-".join(parts[:3]) if parts[0] == "TCGA" else x[:12]

    expr.columns = [norm_id(c) for c in expr.columns]
    meth.index   = [norm_id(i) for i in meth.index]
    expr = expr.T.groupby(level=0).first()          # 患者级去重(同患者多列取首个)
    meth = meth.groupby(level=0).first()

    # 2) 平台内特征筛选(MAD top N,防维度劫持)
    keep_expr = expr.std(axis=0).nlargest(top_n).index
    keep_meth = meth.std(axis=0).nlargest(top_n).index
    expr, meth = expr[keep_expr], meth[keep_meth]

    # 3) 与 CDR 终点求交集并拼接
    common = cdr.index.intersection(expr.index).intersection(meth.index)
    y = cdr.loc[common, ["OS", "OS.time"]].copy()
    X = pd.concat([expr.loc[common], meth.loc[common]], axis=1)
    return X.join(y)

if __name__ == "__main__":
    print("骨架示例——生产版补 ComBat 批次协变量与缺失值策略")

工程注意:患者级去重必须在特征筛选之前(否则重复样本抬高方差);CDR 的 OS.time 单位为天;训练集/测试集按患者切分。

§7.3 WSI 弱监督(MSI 预测)标准配方

  1. 标签:mc3 MAF 统计重复序列 indel → MSI 高/低标签(或直接用公开 MSI 表如 MANTIS 产物)。
  2. 数据:DX 切片(slide.tsv 过滤)→ OpenSlide patch(10X 等效 256x256)→ 病理预训练 encoder 特征。
  3. 模型:ABMIL(attention MIL)为主力基线;患者分层 5-fold;AUC 报告 + per-fold 稳定性。
  4. 基线对照:临床协变量 baseline(年龄/分期)与 patch-count baseline——证明「模型在学形态而非元数据」。
  5. 外推验证:CPTAC 同癌种(不同扫描仪/中心)——单扫描仪外推虚高的补丁。

§7.4 公平性与人群外推

  • TCGA ancestry 以欧洲为主导(CDR race 字段可分层);小 ancestry 组(亚裔/原住民)样本量小,分层结论不稳——公平性审计时分母必须透明。
  • 跨 ancestry 的模型性能差异可先在 TCGA 内分层评估,再到 PCAWG(含更多国际人群)或 All of Us 验证。
  • 声明边界:race 是社会构建变量,作为「proxy 层」审计用,不作为生物学因果解释。

§7.5 任务×资源速查表

任务 TCGA 数据 标签 基线 外推验证
预后建模 EB++ 表达 + GISTIC + CDR OS/DSS Cox(临床协变量) CPTAC/内部
分子亚型预测 多矩阵 atlas 亚型 一致性聚类 PCAWG
MSI/TMB 形态学预测 DX WSI + mc3 MSI/TMB 二分 临床 baseline CPTAC WSI
signature 解卷积 mc3 MAF COSMIC 匹配 de novo 提取 GENIE
甲基化-表达调控 450K + 表达 增强子-启动子对 相关性筛选 CPTAC 甲基化
跨组学对比学习 多矩阵 — MOFA2 因子 HTAN 空间数据

§7.6 端到端案例:跨癌种免疫治疗响应推断

目标:预测 ICI 响应性(TCGA 无 ICI 结局——做「分子代理标签」推断):

  1. 代理标签构造:TMB(mc3 非同义突变负荷)+ 效应 T 细胞信号(表达签名)+ 新抗原负荷——ICI 响应三要素的 TCGA 内代理。
  2. 形态学映射:DX WSI → ABMIL 预测代理标签(H&E 形态能否反映免疫原性微环境)。
  3. 交叉验证闭环:TCGA 分层 5-fold → 外部 CPTAC 复现 → 与已发表 ICI 队列的 WSI 结论方向对照(不做数值比较——队列差异)。
  4. 报告纪律:全文声明「TCGA 无 ICI 结局,结论为代理推断」;避免「模型预测免疫治疗疗效」的过度声明(坑点 8)。

这个案例展示 TCGA 的「负向能力」用法:明知数据不能直接回答什么,构造可辩护的代理标签与推断链。

§7.7 报告模板:方法学段落骨架

多组学数据来自 The Cancer Genome Atlas(TCGA)经 Genomic Data Commons(GDC)harmonized 的数据发布(Data Release 46.0,2026-08-10;GRCh38 坐标)。基因表达使用泛癌 EB++ batch-corrected 矩阵,DNA 甲基化使用 450K 合并 beta 值矩阵,体细胞变异来自 mc3 合并调用(open access 版本)。临床终点使用 TCGA Pan-Cancer Clinical Data Resource(Liu et al., Cell 2018),终点选择遵循其 per-cancer 使用建议。样本按 TCGA barcode 第 4 段过滤为原发肿瘤(01),患者级去重后共纳入 N 例。所有分析基于 open access 数据,遵循 NCI 数据使用政策;致谢 TCGA Research Network 与样本贡献者。

§7.8 成本与排期模板

阶段 内容 资源 周期
立项 样本对账(项目页 + slide.tsv + CDR) 单机 3 天
数据 open 矩阵 + 目标癌种 WSI TB 级磁盘 1-2 周
基线 临床 Cox + 单平台模型 CPU 1 周
模型 多模态/MIL 训练 1-2 GPU 2-4 周
验证 CPTAC/内部外部验证 同上 2 周

先「临床基线」后「深度模型」的顺序不可省——TCGA 上大量深度模型论文的增益在临床协变量基线面前缩水,审稿人必查。

§7.9 模型选型的务实建议

TCGA 场景下的模型选型经验法则:

  1. 样本量决定模型上限:单癌种数百样本——Cox/elastic net/随机森林先跑满;上千样本的多癌种任务才考虑深度模型。样本数百级时 Transformer 类参数量会过拟合到噪声。
  2. 表格组学的强基线:XGBoost/LightGBM 在 TCGA 矩阵任务上常年是最难击败的基线——深度模型论文必须带这个对照。
  3. WSI 的特征层选择:ImageNet 预训练 encoder 已被病理预训练模型(CTransPath/UNI 等)显著超越——直接用后者,省下的算力投给聚合层。
  4. 多模态融合的次序:先单模态基线(各自 AUC/c-index)→ 简单拼接 → 门控/交叉注意力。跳过前两步的「端到端融合」论文无法归因增益。
  5. 生存任务的评估:c-index + 时间相关 AUC + 校准曲线三件套;只报 c-index 会漏掉校准问题。

§8 伦理、许可与合规

§8.1 双层级访问的政策结构

TCGA 的访问设计是「开放最大化 + 敏感最小化」的范本:

  1. open access 层:去标识临床信息、聚合级矩阵(counts/beta/seg/公开版 MAF)、WSI 图像——免注册直接下载。判定标准:无法从该数据本身重建个体级基因型。
  2. controlled access 层:个体级变异(VCF/MAF 受控版)、比对 BAM(reads 可重构基因型)——经 dbGaP(phs000178)申请,机构 PI 提交、数据访问委员会(DAC)批准、eRA Commons 账户授权。
  3. 政策文本:NCI TCGA 数据使用政策(TCGA Data Use Policy)——开放数据的使用义务主要是致谢与不得再识别;受控数据另有年度合规确认。

§8.2 dbGaP 受控申请流程要点

  1. 机构 PI 持 eRA Commons 账户在 dbGaP 提交项目申请(study accession:phs000178,TCGA controlled)。
  2. 机构签署 Data Access Agreement(DUA),指定 signing official。
  3. DAC(NCI 主持)按批次审阅——申请需说明研究目的与数据用途一致性。
  4. 批准后 PI 与 lab members 获授权,GDC 下载需 NIH 认证 token(gdc-client 携带)。
  5. 年度合规更新;项目变更需再申请。

§8.3 致谢与引用模板

致谢模板(按需裁剪):
The results shown here are in whole or part based upon data generated by the
TCGA Research Network: https://www.cancer.gov/tcga. We thank the patients and
families who contributed samples to TCGA, the NCI and NHGRI for funding the
program, and the Genomic Data Commons for data hosting (GDC Data Release 46.0).
Controlled-access data were obtained under dbGaP accession phs000178 with
approval from the [institution] Institutional Data Access Committee.

引用清单(按用途选择):Hoadley 2018 Cell(pan-cancer atlas)、Liu 2018 Cell(CDR)、TCGA Network 2008 Nature(GBM 与项目定义)、所研究癌种的网络论文、GDC(文档与门户)。

§8.4 隐私与再识别

  1. 数据侧:TCGA 已做去标识(患者为编号、临床细节泛化、采集时间平移)——但基因组数据本质可识别,受控层设计正是为此。
  2. 衍生数据纪律:发布基于 TCGA 的衍生资源(如模型、patch 库)时不得附带可回溯个体的组合信息;WSI 衍生的 patch 库要注意 slide 元数据组合的间接识别风险。
  3. 模型成员推断:基因组模型过拟合存在记忆风险——训练最小样本约束与成员推断评估是学术界的成熟做法。

§8.5 国内团队合规清单

  1. open 数据直接下载使用——注意 TCGA 数据不属《人类遗传资源管理条例》中「中方资源」(为美方公开科研数据),但使用中方患者数据训练后再对比发布等场景需机构伦理审查。
  2. 机构伦理:TCGA 为去标识公开数据,多数机构按「免知情同意的二次数据研究」类别审批。
  3. 成果发表:按期刊要求致谢 NCI/TCGA/GDC。
  4. 模型开源:附数据来源声明与许可表述(本页 §8.3 模板可改写)。
  5. 免责声明:具体合规判定以机构法务与伦理委员会意见为准。

§8.6 数据使用红线速记

  1. 不尝试再识别患者(含组合查询外部数据反推)。
  2. 受控数据不转存未授权人员可访问位置。
  3. 不把 TCGA 结论直接包装为临床决策依据(数据时点与研究性质)。
  4. 商业产品使用 open 数据:政策允许但需自查 NCI 数据政策最新文本与产品合规口径。
  5. 衍生数据库再分发:遵循 open 数据本身的政策,保留来源声明。

§9 谱系与生态

§9.1 癌症组学项目时间线

2000  Perou 乳腺癌 molecular portraits(范式起点)
2005  TCGA Pilot 启动(NCI+NHGRI)
2008  GBM Nature 论文;ICGC 成立
2010  PCAWG 启动(ICGC 下泛癌 WGS)
2012  乳腺癌/肺鳞 Nature;Firehose 管线成熟
2014  CPTAC2 蛋白基因组学推进;ICI 药物上市(时序分界)
2018  TCGA 数据冻结;Cell pan-cancer 三连发;GDC 全面接管
2020+ HTAN(空间/单细胞下一代 atlas);CPTAC/HCMI 扩展
2026  GDC Data Release 46.0;TCGA 仍是癌症 AI 事实基准

§9.2 术语表

术语 定义
TCGA barcode 16 位层级标识:患者-样本-部分-分析物-板-中心
sample type code barcode 第 4 段前两位:01 原发瘤 / 06 转移 / 11 正常等
GDC Genomic Data Commons,NCI 的癌症基因组数据公共体
harmonized pipeline GDC 统一版本的分析管线(GRCh38,STAR/MuTect2 等)
legacy Firehose 时代(Broad GDAC)的分析产物(hg19)
mc3 Multi-Center Mutation Calling,泛癌合并体细胞变异调用
TCGA-CDR Pan-Cancer Clinical Data Resource,四终点标准化临床资源
OS/DSS/PFI/DFI 总体生存/疾病特异生存/进展间期/无病间期
cell-of-origin 细胞起源模式——pan-cancer atlas 的主导分类原则
RPPA 反相蛋白阵列(蛋白层定量)
GISTIC2 拷贝数显著区域调用算法(SNP6 产物)
ABSOLUTE 肿瘤纯度与倍性推断(mastercalls 文件)
WSI 全切片图像(whole slide image),SVS 格式
DX 切片 诊断切片(slide.tsv 后缀 DX)
MIL 多实例学习(WSI 弱监督主流框架)
EB++ Empirical Bayes++ batch correction(mRNA 泛癌矩阵)
dbGaP NCBI 基因型-表型档案(受控访问载体,phs000178)
Firehose Broad 的 TCGA 分析流水线(历史产物名 GDAC)
HTAN Human Tumor Atlas Network(下一代空间/单细胞 atlas)

§9.3 资源选型决策树

你的需求是什么?
├─ 「训练癌症多模态/多组学模型」
│    → GDC harmonized 矩阵 + CDR 终点(§7.2 配方)
├─ 「做病理 AI(WSI)」
│    → slide.tsv 过滤 DX + 分子标签 MIL(§7.3 配方)
├─ 「突变谱/signature 分析」
│    → mc3 MAF(声明版本)+ SigProfiler(§5.3)
├─ 「复现 2012-2017 经典论文」
│    → legacy/Firehose 产物(声明 hg19)(§3.8)
├─ 「个体级变异/reads」
│    → dbGaP phs000178 受控申请(§8.2)
├─ 「快速浏览某个基因在某癌种的行为」
│    → cBioPortal / UCSC Xena(免下载)
├─ 「蛋白层纵深」
│    → CPTAC(GDC 同门)
└─ 「WGS 全谱(SV/非编码)」
     → PCAWG(本库专页)

§9.4 与本库其他条目的关系

条目 关系
dbGaP TCGA 受控层的申请通道与访问模式参照
pcawg 泛癌 WGS 姐妹项目(结构变异/非编码纵深)
ClinVar 体细胞(TCGA)vs 胚系致病性(ClinVar)注释对照
CGA)vs 胚系致病性(ClinVar)注释对照
gwas-catalog 胚系关联(GWAS)与体细胞图谱(TCGA)的互补
human-protein-atlas 蛋白表达组织学参照(RPPA 的可视化对照面)
tcia 癌症影像对照(TCGA 的 WSI 是病理形态,TCIA 是放射影像)
A 的 WSI 是病理形态,TCIA 是放射影像)
human-cell-atlas 单细胞时代资源(TCGA 是 bulk 时代天花板)

§9.5 多资源组合使用建议

常见研究设计下 TCGA 与姊妹资源的组合姿势:

研究设计 推荐组合 分工
形态学→分子预测(泛癌) TCGA WSI(训练)+ CPTAC(外部验证) TCGA 给规模与标签,CPTAC 给扫描仪/中心域外推
结构变异发现 TCGA WES(广度)+ PCAWG WGS(深度) WES 频谱 + WGS 全谱断点
蛋白组验证 TCGA RPPA + CPTAC 质谱 阵列通量 + 质谱特异性互证
胚系-体细胞对照 TCGA + gnomAD/ClinVar 等位基因频率背景与致病性注释
单细胞尺度化 TCGA bulk + HCA/HTAN 单细胞 bulk 反卷积的单细胞参考
人群外推 TCGA + PCAWG/All of Us 北美富集样本 + 国际/多样化队列

组合的通用纪律:先声明各资源的版本与口径,再声明合并键(barcode/donor 映射/基因 ID 版本)——跨库合并的失败几乎都出在「键没对齐」。

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 链接 用途
GDC 数据门户 https://portal.gdc.cancer.gov/ Cohort Builder/仓库/项目页
GDC 文档 https://docs.gdc.cancer.gov/ API/管线/数据字典
GDC API https://api.gdc.cancer.gov/ 编程访问
NCI TCGA 项目页 https://www.cancer.gov/tcga 项目定义与政策
Pan-cancer atlas 资源页 https://gdc.cancer.gov/about-tcga/pan-cancer-atlas 官方配套矩阵
dbGaP phs000178 https://dbgap.ncbi.nlm.nih.gov/ 受控申请
cBioPortal https://www.cbioportal.org/ 快速探索
UCSC Xena https://xenabrowser.net/ 矩阵镜像与可视化
主论文 https://doi.org/10.1016/j.cell.2018.03.022 pan-cancer atlas

§10.2 关键文献速查

  1. Hoadley, K.A. et al. Cell-of-Origin Patterns Dominate the Molecular Classification of 10,000 Tumors from 33 Types of Cancer. Cell 173, 291-304.e6 (2018). DOI 10.1016/j.cell.2018.03.022
  2. Liu, J. et al. An Integrated TCGA Pan-Cancer Clinical Data Resource to Drive High-Quality Survival Outcome Analytics. Cell 173, 400-416.e11 (2018). DOI 10.1016/j.cell.2018.02.052
  3. Cancer Genome Atlas Research Network. Comprehensive genomic characterization defines human glioblastoma genes and core pathways. Nature 455, 1061-1068 (2008). DOI 10.1038/nature07385
  4. Cancer Genome Atlas Network. Comprehensive molecular portraits of human breast tumours. Nature 490, 61-70 (2012). DOI 10.1038/nature11412
  5. 各癌种网络论文(Nature/Cell/NEJM 2012-2017 系列)与 GDC harmonized 管线文档。

§10.4 FAQ

Q1:TCGA 数据可以商用吗?
A:open access 数据按 NCI 数据使用政策允许广泛使用(含商业分析),但需保留来源与致谢;受控数据的用途受 dbGaP 批准范围约束。商用前自查 NCI 政策最新文本。

Q2:「11,160 患者」这个精确数字哪来的?
A:TCGA-CDR 论文的 11,000+ 口径的常引精确值。不同资源统计时点不同会有 ±几十的浮动——引用时标注口径与来源比精确值本身重要。

Q3:GDC 门户的 50,571 cases 是 TCGA 的吗?
A:不是——那是 GDC 全体(含 CPTAC/HCMI/FMI 等 93 个项目)。TCGA 是其中 33 个项目、11,000+ 患者。

Q4:WSI 能下载全部 2.5 PB 吗?
A:2.5 PB 是 TCGA 全部数据(含受控 BAM 等)量级。open 层里 WSI 约 11 TB;普通矩阵分析只需数十 GB。按需下载,别全量。

Q5:为什么有的患者没有配对正常组织?
A:采集时部分患者未取正常对照(血液正常或正常组织)——WES 调用依赖配对的项目样本会少一些。以 GDC 实查为准。

Q6:甲基化 27K 和 450K 能一起分析吗?
A:能但要用官方合并版(含 between-platform normalization,node 977)——自建交集探针法也可(两者共有的探针子集)。

Q7:生存分析用哪个终点?
A:按 TCGA-CDR per-cancer 建议(论文附表)。通用排序:OS 最全 → DSS 次之 → PFI 依赖登记质量 → DFI 仅限 I-III 期无残留。

Q8:受控数据申请要多久?
A:dbGaP 流程依机构与 DAC 排期,通常数周到数月。open 层够用时优先 open——很多研究(矩阵级、signature 级)不需要受控数据。

Q9:TCGA 亚型标签从哪拿?
A:pan-cancer atlas 配套文件与各癌种论文附表;UCSC Xena 有常用亚型标签跟踪集。用第三方标签(如 iCluster 聚类结果)要标注出处版本。

Q10:可以把自己的 WSI 模型在 TCGA 上「测一下就发表」吗?
A:不建议——TCGA 已是高度饱和基准(大量已发表方法),且扫描仪单一/患者分层问题使「TCGA 单数据集」论文难以支撑泛化声明。审稿标准已升级到「TCGA + 外部独立验证」。

Q11:数据会更新吗?
A:原始数据冻结,但 GDC harmonized 后处理滚动更新(2025-12 v45.0 → 2026-08 v46.0)。引用时注明 Data Release 版本号。

Q12:和 PCAWG 怎么选?
A:变异深度(SV、非编码)选 PCAWG;多模态全矩阵 + WSI + 临床终点选 TCGA。两者样本有重叠但不完全相同——合并分析时按 donor 映射对齐。

Q13:FFPE 样本占比多少?影响什么?
A:TCGA 主体为冻存组织(fresh frozen),部分癌种含 FFPE(如部分肺腺/肺鳞)——FFPE 的 DNA/RNA 有 C>T 脱氨伪影、WSI 染色风格差异。signature 分析要过滤 FFPE artifact;形态学模型注意染色域。

Q14:能拿到正常组织的 WSI 吗?
A:公开层主要是肿瘤 DX 切片;正常组织切片覆盖有限。做「肿瘤 vs 正常形态」研究要实查 slide.tsv,或用 GDC 过滤 tissue type。

Q15:TMB 怎么算才和其他论文可比?
A:口径=非同义体细胞 SNV+indel / 所测外显子区 Mb 数。mc3 MAF(声明版本)+ GDC 捕获区间口径是主流;不同区间定义差异可达数倍——报告公式与区间来源。

Q16:Xena、cBioPortal、GDC 三者数据一致吗?
A:矩阵级基本一致(Xena 镜像 GDC/legacy 双版),但版本节奏不同(Xena 跟进有延迟);探索用前端,正式分析回 GDC 并锁定 Release 版本。

Q17:能把 TCGA 的 WSI patch 直接用于商用模型训练吗?
A:open access 数据按 NCI 政策允许广泛使用,但商用部署前建议:①自查 NCI 数据政策最新文本;②模型输出不得暗示临床诊断资质;③保留数据来源声明。受控数据(BAM/受控 MAF)用途严格限定于申请范围。

Q18:TCGA 与我自己的医院数据「批次差距太大」怎么办?
A:这是常态而非例外——固定/冻存 vs FFPE、扫描仪、染色 protocol、人群差异都会进来。务实战法:①TCGA 上只报相对结论与排序稳定性;②自己数据上重训/微调而非零样本外推;③用 CPTAC/GENIE 做中间过渡域。

§10.5 要点回顾

  1. 四级口径:11,000+ 患者 / 约 10,000 标本 / >20,000 样本 / 百万级文件——引用前对齐。
  2. 双标识体系:16 位 barcode(语义)+ GDC UUID(操作),映射靠 sample sheet。
  3. 三套临床:harmonized / legacy / CDR——生存分析锁定 CDR 并声明版本。
  4. 两套坐标:GRCh38(harmonized)vs hg19(legacy)——不混用。
  5. batch 矩阵优先:泛癌分析用官方 EB++/beta 合并/RPPA clean 矩阵。
  6. WSI 只有 DX:扫描仪单一,外推需 CPTAC/多中心验证。
  7. 数据冻结于 2018:免疫治疗时代结论只能做代理推断。
  8. open/controlled 分层:矩阵研究多用不到受控;要受控走 dbGaP phs000178。
  9. 基准纪律:TCGA 是「必答对照」——新方法先过临床基线,再谈深度模型增益。
  10. 可复现三件套:Data Release 版本号 + 种子固定 + 样本清单附表——审稿与三个月后的自己都靠它。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • tabula-muris — 共享标签:基因组学与多组学 / 病理图像 / 测序数据
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据
  • hmp — 共享标签:基因组学与多组学 / 测序数据
  • dbsnp — 共享标签:基因组学与多组学 / 测序数据
  • ega — 共享标签:基因组学与多组学 / 测序数据
  • roadmap-epigenomics — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集