信息速览
CPTAC 影像 — 泛癌影像-组学配对 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | CPTAC Imaging Collections(TCIA 托管) |
| 英文全称 | Clinical Proteomic Tumor Analysis Consortium Imaging Collections |
| 别名/简称 | CPTAC-CCRCC、CPTAC-LUAD、CPTAC-LSCC、CPTAC-GBM、CPTAC-PDA、CPTAC-UCEC、CPTAC-HNSCC、CPTAC-CM、CPTAC-BRCA、CPTAC-COAD、CPTAC-OV |
| 疾病分类 | 10 大癌种(ICD-11:2C25.0 肺腺癌 / 2C25.2 肺鳞癌 / 2C90 肾透明细胞癌 / 2A00 组 胶质母细胞瘤 / 2C10.Z 胰腺癌 / 2C7x 区间 子宫内膜癌 / 2B6x、2D2x 头颈鳞癌等,详见 §2.1) |
| SNOMED CT | 254626006(肺腺癌)/ 1187306007(肾透明细胞癌)/ 393563007(胶质母细胞瘤)/ 188192002(子宫体内膜恶性肿瘤)/ 363418001(胰腺恶性肿瘤)/ 716659002(头颈鳞癌)等,详见 §2.1b |
| 数据模态 | CT、MR、病理全切片(H&E SVS);部分队列含 CR/DX/PET(PT)/超声/核医学(NM/SR) |
| AI 任务类型 | 影像-基因组/蛋白组关联(radiogenomics)、肿瘤分割、影像组学预后建模、组织学亚型分类、生存分析 |
| 样本总数 | 11 个 TCIA 队列合计约 1,726 名受试者(放射影像约 437+ 例、病理 WSI 约 800+ 例,口径见 §3.2) |
| 数据大小 | 约 1.1 TB+(TCIA 已核实集合合计;LUAD 等未计入,全量更大) |
| 数据格式 | DICOM(放射)、SVS/Aperio(病理)、CSV/TSV(临床,经 PDC/GDC 导出) |
| 许可证 | 多数集合 CC BY 3.0/4.0;脑、头、头颈部集合自 2022-01-06 起 TCIA Limited Access License |
| 访问级别 | 开放(CC BY 队列)+ 注册签署许可(Limited 队列);组学矩阵经 PDC 开放、原始基因组数据 dbGaP 受控 |
| DUO 标签 | GRU(关联 dbGaP 受控基因组数据时适用) |
| 语言 | 英文(数据与元数据);中文为本页面表述 |
| 首发日期 | 2018 年(CCRCC、GBM、LSCC、LUAD、PDA 等首批集合在 TCIA 上线) |
| 最后更新 | 2025-07-07(CPTAC-CCRCC 修订;CPTAC-PDA 于 2025-02-26 更新至 V15) |
| 发布机构 | 美国国家癌症研究所(NCI)CPTAC 联盟;TCIA 托管 |
| 官方主页 | TCIA CPTAC 影像总览 |
| 下载地址 | 各队列 TCIA 集合页(如 CPTAC-CCRCC) |
| DOI | 无单一 DOI;按队列引用(如 CCRCC 10.7937/k9/tcia.2018.oblamn27、GBM 10.7937/K9/TCIA.2018.3RJE41Q1,全部见 §9) |
| 引用次数 | 17–28+(各队列 TCIA Data DOI 被引,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— DICOM 标准规范、官方提供 radiomics notebook;扣分项:无官方 ML 划分、影像-组学配对率有限、放射模态异质、脑/头/颈队列受限访问 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、10 癌种流行病学、临床任务定义、金标准描述)、§7 偏倚分析与伦理公平性。审核日期:2026-09-18。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。审核日期:2026-09-18。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CPTAC 影像多数集合按 CC BY 3.0/4.0 开放,脑、头、头颈部集合须注册 TCIA 账户并签署 Limited Access 许可协议;蛋白组矩阵与临床注释经 PDC 开放获取,原始基因组测序数据须通过 dbGaP 申请授权。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
审核记录:本条目基于 2026-09-18 时点的 TCIA 集合页公开统计与同行评审文献撰写;各队列独立版本化(如 PDA V15、CCRCC 2025-07 修订),后续版本发布后本页将随之修订并更新审核日期。事实类内容均带来源链接,读者可逐条回溯。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? CPTAC 影像是美国国家癌症研究所(NCI)癌症蛋白基因组计划(CPTAC)产生的放射与病理影像集合,由癌症影像档案馆(TCIA)托管发布。它覆盖肺腺癌、肺鳞癌、肾透明细胞癌、胶质母细胞瘤、胰腺导管腺癌、子宫内膜癌、头颈鳞癌等 10 个癌种、11 个 TCIA 队列、合计约 1,726 名受试者,含 CT/MR 放射影像(TCIA 总览页)与 H&E 染色病理全切片(TCIA CPTAC-CCRCC 页)。
为什么重要? 它是极少数把"影像"与"蛋白组-基因组"放进同一个 ID 体系的公开资源:TCIA 的去标识 PatientID 与 PDC/GDC 及临床数据库完全一致(TCIA CPTAC-CCRCC 页),使"影像特征 ↔ 分子分型 ↔ 生存结局"的三方关联成为可能,而不需要自建映射。
我能用它做什么? 做影像基因组学(radiogenomics)关联研究、在 4 个队列上做肿瘤 3D 分割、做病理组织学亚型分类、把影像组学特征与蛋白组学签名一起做生存建模;CPTAC-GBM 的 DICOM 还被 BraTS 2021 用作分割与 MGMT 分类器训练数据的原始影像来源(TCIA wiki)。
§1.1 技术摘要
CPTAC(Clinical Proteomic Tumor Analysis Consortium)是 NCI 资助的癌症蛋白基因组学计划,通过大规模蛋白质组与基因组联合分析理解癌症的分子基础,并把基因组、蛋白组、影像与试剂数据作为社区资源(Community Resource)公开(TCIA 总览页)。影像侧由 TCIA 与 CPTAC 合作托管,发布日程与 CPTAC 蛋白组/基因组数据在 PDC/GDC 的发布相协调。放射影像取自病理诊断前即刻的标准诊疗扫描与随访扫描,因此设备、厂商与协议天然异质(TCIA CPTAC-CCRCC 页);病理影像来自 CPTAC qualification workflow 的 H&E 玻片数字化。队列按 Discovery/Confirmatory 两阶段设计与论文发布绑定,在 TCIA 集合页以独立的下载链接区分。截至 2026-09,各集合独立版本化维护(CCRCC 2025-07-07 修订、PDA 2025-02-26 V15),NCI 已为其中 4 个集合生成 3D 分割标注与种子点。
§1.2 战略价值
维度一:影像基因组学的"官方配对"资源。 多数公开影像库(如 LIDC-IDRI)不含分子层信息,多数组学库(如 TCGA)不含系统性影像;CPTAC 影像是 NCI 官方层面把两者用同一受试者 ID 焊接起来的资源,且蛋白组学维度(磷酸化、乙酰化、糖基化等翻译后修饰)是 TCGA 不具备的。对研究"影像表型是否携带分子信息"这一问题,它是目前结构最完整的公开数据源之一(Cancer Cell 2023 泛癌资源论文)。
维度二:多癌种、多模态的"真实世界"试验场。 因为扫描协议取自标准诊疗而非研究专设,数据天然携带多厂商、多协议、多时点的真实分布,是检验模型跨站点泛化与模态鲁棒性的高保真环境;2021 年快照显示放射模态覆盖 CR/DX/CT/MR/PT/US/NM/SR(2021 快照统计)。对以临床落地为目标的团队,这种异质性是资产而非缺陷——前提是按 §6.5 的坑点正确处理。
维度三:与泛癌蛋白基因组资源的协同。 CPTAC 已系统刻画 10 种癌症、逾 1,000 例原发肿瘤(Cancer Cell 2023),且 TCIA 是 NCI 癌症研究数据共享生态(CRDC)的组成部分,与 PDC、GDC、CDS 并列。这意味着影像不是孤立数据,而是泛癌多组学体系中"表型层"的官方接口;研究者可以把影像特征直接接入既有组学分析管线,而不必自建数据底座。这一协同价值在泛癌 PTM 分析这类跨 1,110 例、11 种癌症类型的研究中尤为明显(Geffen et al., Cell Reports 2018)。
维度四:开放许可带来的可复现性优势。 多数集合采用 CC BY 3.0/4.0,允许再分发与商业使用(脑、头、头颈部队列除外),这在医学影像领域并不常见(TCIA API guides)。对需要公开发布训练数据、要求审稿人复现、或计划产出衍生产品的研究与团队,开放许可能显著降低合规成本;代价是必须在发布物中携带官方要求的 Data Citation 与 CPTAC 致谢声明(见 §9.3)。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 分子/组学层 | 标注 | 与 CPTAC 影像的差异化 |
|---|---|---|---|---|---|
| CPTAC Imaging(本条目) | 约 1,726 名受试者、11 队列、10 癌种 | CT/MR/WSI 等 | 蛋白组+基因组(PDC/GDC,ID 一致) | 4 队列 3D 分割+种子点 | 泛癌、影像-蛋白组-基因组三方配对 |
| TCGA | 33 癌种、逾 1.1 万例 | 组学为主,病理切片部分开放 | 基因组/转录组 | 组织学诊断 | 无系统性放射影像 |
| NSCLC-Radiogenomics(TCIA) | 211 例 | CT/PET(NSCLC) | 基因突变子集 | 病理确认 | 单中心斯坦福、单一癌种(Sci Data 2018) |
| LIDC-IDRI | 1,018 例 | 胸部 CT | 无 | 4 名放射医师标注结节 | 影像标注深但无组学层 |
| BraTS | 数千例 | MR(脑肿瘤) | MGMT 等有限标签 | 专家分割金标准 | 单疾病、分割金标深;CPTAC-GBM 为其 2021 训练数据源之一 |
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 2018 | CPTAC-CCRCC、CPTAC-GBM、CPTAC-LSCC、CPTAC-LUAD、CPTAC-PDA 等首批集合在 TCIA 上线并注册 DOI(集合页) |
| 2020 | TCIA 设立 CPTAC Imaging Special Interest Group(SIG)并举办系列 webinar(2020-02-04 CCRCC 专场、2020-05-13 GBM 专场)(CCRCC 页) |
| 2021 | 社区快照统计:7 个队列放射影像受试者 33–98 例/队列,合计约 437 例(2021 快照) |
| 2022-01-06 | 所有脑、头、头颈部 TCIA 集合(含 CPTAC-GBM、CPTAC-HNSCC)由 CC 许可转为 TCIA Limited Access License(TCIA API guides) |
| 2024-07-08 | CPTAC-GBM 修订更新(GBM 页) |
| 2025-02-26 | CPTAC-PDA 更新至 V15(PDA 页) |
| 2025-07-07 | CPTAC-CCRCC 修订更新(CCRCC 页) |
§1.5 典型应用场景
- 影像-分子关联(radiogenomics):用 CT/MR 影像组学特征预测转录组/蛋白组亚型或通路活性(如 LSCC 中 NSD3 与 FGFR1 扩增的替代驱动关系,Satpathy et al., Cell 2021)。
- 肿瘤 3D 分割:在 NCI 已标注的 CPTAC-UCEC、CPTAC-PDA、CPTAC-CCRCC(HNSCC 受限)上训练与评测分割模型(TCIA 总览页)。
- 病理全切片分类:H&E WSI 组织学亚型分类与肿瘤区检测,配合 PDC 临床标签。
- 生存预后建模:影像特征 + 蛋白组学签名联合建模预测总生存/无病生存。
- 跨站点泛化研究:利用多中心、多厂商异质性做 domain shift 与协议归一化方法研究。
每个场景的最小可行起点:场景 1 建议从单个队列的"影像体积/纹理特征 vs 蛋白组通路评分"做秩相关,验证方向后再上复杂模型;场景 2 建议先跑通 nnU-Net 默认配置得到基线 Dice,再讨论改进;场景 3 建议先用 level 2 patch 训练一个轻量 MIL 模型确认标签可利用,再考虑基础模型特征;场景 4 建议先用 Cox 比例风险模型配合影像组学特征建立可解释基线;场景 5 建议先用最简单的直方图归一化对比"不做归一化"与"做归一化"的性能差,量化异质性的实际影响。
§1.6 本页面的阅读路径
- 只想快速判断是否可用:读 §1.0 与 §7.7 的 DAIMS 评分,约 5 分钟可得结论。
- 准备开始下载与实验:直接到 §6.2 数据获取与 §6.1 快速上手,跳过医学背景。
- 需要写论文的方法学部分:重点读 §5.3 泄漏风险、§7.1 偏倚表、§8.3 评测协议。
- 需要理解数据为何长这样:读 §1.1 技术摘要、§2.3b 临床路径位置、§3.10 溯源链。
- 需要评估合规风险:读 §0 三段免责、§7.4 伦理、§9.3 引用与致谢指南。
§2 医学背景
§2.1 ICD-11 编码映射
CPTAC 影像覆盖 10 个癌种、11 个 TCIA 队列。下表给出核心队列的 ICD-11 参照编码(依据 WHO ICD-11 MMS;跨多个解剖部位编码的癌种给出区间并在正文说明):
| 队列标签 | ICD-11 编码 | ICD-11 名称 | 说明 |
|---|---|---|---|
| 肺腺癌(LUAD) | 2C25.0 | 支气管或肺腺癌 | CPTAC-2 确证队列,影像 2021 快照约 33 例放射 |
| 肺鳞状细胞癌(LSCC) | 2C25.2 | 支气管或肺鳞状细胞癌 | 独立队列,212 例受试者 |
| 乳腺浸润性癌(BRCA) | 2C61 | 乳腺浸润性癌 | CPTAC-2 病理-only 队列(134 例) |
| 结肠腺癌(COAD) | 2B5B.0 | 结肠恶性肿瘤(腺癌为主) | CPTAC-2 病理-only 队列(106 例、373 幅 WSI) |
| 胰腺导管腺癌(PDA) | 2C10.Z | 胰恶性肿瘤 | 放射 110 例 + 病理 168 例(有重叠) |
| 肾透明细胞癌(CCRCC) | 2C90 | 肾恶性肿瘤(除外肾盂) | 262 例,发现+确证队列 |
| 胶质母细胞瘤(GBM) | 2A00(组) | 弥漫性星形细胞与少突胶质细胞肿瘤 | 200 例,现 Limited Access |
| 卵巢浆液性囊腺癌(OV) | 2C7x(区间) | 女性生殖器官恶性肿瘤 | CPTAC-2 病理-only 队列(102 例) |
| 子宫体/子宫内膜癌(UCEC) | 2C7x(区间) | 女性生殖器官恶性肿瘤 | 250 例,含 NCI 3D 分割标注 |
| 头颈鳞癌(HNSCC) | 2B6x/2D2x(跨编码) | 唇/口腔、喉等恶性肿瘤 | 112 例,Limited Access |
| 皮肤黑色素瘤(CM) | 2C31 | 皮肤恶性黑色素瘤 | 94 例,外部队列(仅配临床数据) |
§2.1b SNOMED CT 映射
以下 SNOMED CT 码经 FHIR 术语服务(tx.fhir.org,SNOMED CT 国际版 20250201)逐一核实为现行活跃概念(与站内 CPTAC 蛋白基因组主条目共用同一套已审定映射):
| 标签 | SNOMED CT 码 | 术语 | 对应队列 |
|---|---|---|---|
| 肺腺癌 | 254626006 | Adenocarcinoma of lung | LUAD |
| 非小细胞肺癌(LSCC 归属大类) | 254637007 | Non-small cell lung cancer | LUAD/LSCC |
| 乳腺癌 | 254837009 | Malignant neoplasm of breast | BRCA |
| 结肠恶性肿瘤 | 363406005 | Malignant tumour of colon | COAD |
| 胰腺恶性肿瘤 | 363418001 | Malignant neoplasm of pancreas | PDA |
| 肾透明细胞癌 | 1187306007 | Clear cell renal cell carcinoma | CCRCC |
| 胶质母细胞瘤 | 393563007 | Glioblastoma multiforme | GBM |
| 卵巢恶性肿瘤 | 363443007 | Malignant neoplasm of ovary | OV |
| 子宫体内膜恶性肿瘤 | 188192002 | Malignant neoplasm of endometrium of corpus uteri | UCEC |
| 头颈鳞癌 | 716659002 | Squamous cell carcinoma of head and neck | HNSCC |
§2.2 疾病简介与流行病学
CPTAC 影像覆盖的 10 个癌种均为全球高发或高致死瘤种:肺腺癌与肺鳞癌合计构成非小细胞肺癌的主体,是全球癌症死亡的首要原因;肾透明细胞癌是成人肾恶性肿瘤最常见的组织学类型;胶质母细胞瘤是成人最常见的原发性恶性脑肿瘤,中位生存以月计;胰腺导管腺癌五年生存率长期低于 10%,是预后最差的常见实体瘤之一;子宫内膜癌在发达国家发病率持续上升;头颈鳞癌与烟草、酒精及 HPV 状态密切相关;皮肤黑色素瘤虽占皮肤肿瘤比例不高但转移潜能强。CPTAC 计划已系统刻画 10 种癌症、逾 1,000 例原发肿瘤的蛋白基因组图谱(Cancer Cell 2023),为上述瘤种提供了分子层面的统一参照系。泛癌层面的蛋白翻译后修饰研究亦覆盖 1,110 例、11 种癌症类型(Geffen et al., Cell Reports 2018)。本条目不誊抄具体发病率与死亡率数字以免过时,读者可经各队列论文与 PDC Clinical 导出获取入组人群的精确分布。
§2.3 临床任务定义
结合影像与组学两层信息,本数据集支持的临床任务可归纳为四类:(1)诊断与鉴别——从标准诊疗 CT/MR 中识别肿瘤、界定原发灶范围,病理 WSI 上区分组织学亚型(如 LUAD 与 LSCC 的区分直接决定一线治疗路径);(2)分期与分割——肿瘤体积定量与关键器官风险分割,NCI 已为 4 个队列提供 3D 分割参考;(3)分子表型推断——以影像特征非侵入式预测分子亚型、关键驱动事件(如 FGFR1 扩增/NSD3 关联通路)或蛋白组学签名,这是 radiogenomics 的核心命题;(4)预后与随访——把影像组学特征与生存结局、治疗反应关联,纵向扫描(术前基线 + 术后随访时点,经 (0012,0050) 标签对齐)支持治疗反应评估研究。
四类任务的标签可得性差异极大,落地前须分别核对:
| 临床任务 | 所需标签 | 本数据集标签来源 | 可得性 |
|---|---|---|---|
| 肿瘤检出/分割 | 3D 轮廓 | NCI 标注(仅 UCEC/PDA/CCRCC/HNSCC) | 部分受试者,HNSCC 受限 |
| 组织学亚型分类 | 病理诊断术语 | PDC/GDC Clinical 导出 | 基本全覆盖(病理队列) |
| 分子表型推断 | 蛋白组/基因组亚型 | PDC 蛋白组矩阵 + GDC 变体 | 组学队列内覆盖,影像配对率有限 |
| 生存预测 | 生存时间 + 事件状态 | PDC/GDC Clinical 随访字段 | 随队列与随访时长而异 |
§2.3b 临床路径中的位置
理解数据在诊疗路径中的位置,能避免把任务定义错位。CPTAC 的入组前提是"拟行根治性手术的原发肿瘤患者",因此数据天然处于术前诊断 → 手术切除 → 术后随访这条链路上:放射影像对应术前分期的标准扫描,病理 WSI 对应手术标本,蛋白基因组对应切除组织的分子测定,随访字段对应术后结局。这意味着本数据集不适合做"筛查场景"(无无症状筛查人群,无阴性对照)、不适合做"晚期不可手术患者的疗效预测"(此类患者不在入组范围内)、也不适合做"急诊/危重场景"的快速分诊研究。把研究问题映射到"术前可手术患者"这一人群,是使用本数据集时最基本的口径校准。
§2.3c 影像-组学关联的生物学前提
Radiogenomics 的隐含假设是:肿瘤的宏观影像表型(密度、纹理、强化模式、形态)在某种程度上被其分子状态(驱动突变、通路活性、蛋白表达谱)所决定。CPTAC 的设计恰好为该假设提供了检验环境——同一受试者的影像与组学是在不同时间点、用不同技术、在同一生物实体上测得的(影像在术前、组学在切除标本上)。但必须清醒认识两个限制:其一,影像反映的常是肿瘤的宏观异质性与微环境(坏死、血供、纤维化),而非单个驱动事件;其二,LSCC 论文发现 NSD3 可作为 FGFR1 扩增肿瘤的替代驱动(Satpathy et al., Cell 2021),这类"分子层面的替代关系"恰恰说明影像-分子映射往往不是一对一的。因此建模时把目标设为"预测通路活性评分"通常比"预测单个基因突变状态"更稳健。
§2.4 患者人群特征
| 维度 | 描述 |
|---|---|
| 来源 | NCI CPTAC 联盟多中心学术医疗中心(美国为主,含国际合作位点) |
| 入组标准 | 原发性肿瘤、经病理确诊、接受根治性手术切除并采集新鲜冻存组织与匹配正常组织 |
| 招募时间 | CPTAC-2 队列约 2011 年前后启动,CPTAC-3 于 2016-09 启动并延续至 2020 年前后 |
| 影像时点 | 病理诊断前即刻的标准诊疗扫描 + 术后随访扫描(经 DICOM (0012,0050) 距病理诊断天数标注) |
| 年龄/性别/种族 | 以 PDC/GDC Clinical 标签页导出为准(CSV/TSV 或 TSV/JSON),本条目不誊抄以免过时 |
| 就医类型 | 三级转诊学术中心、拟行根治手术的患者(可能存在转诊偏倚,见 §7.1) |
§2.5 临床价值
对临床 AI 而言,这批数据的价值在于把"看片"与"测分子"连成一条可学习的链路:如果影像特征能可靠预测分子亚型或通路状态,就能在不做活检的情况下辅助治疗决策(例如从平扫 CT 推断可能获益于特定靶向通路的患者群);如果影像组学签名与蛋白组学预后签名收敛,就能以更低成本实现高危患者分层。同时,病理 WSI 与蛋白基因组配对支持"形态学→分子机制"的可解释性研究,为多模态模型提供比对锚点。需要强调:所有上述价值均为研究方向,任何临床应用前须按 §0 免责声明完成独立验证。
§2.6 金标准与参考标准
| 参考标准 | 内容 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| 组织学诊断 | 各队列的肿瘤类型与亚型 | CPTAC qualification workflow 下病理复核 | CPTAC 病理质控团队 | 研究级金标准(支撑论文发表) |
| 分子标签 | 蛋白组/基因组亚型、驱动事件 | 质谱+测序实验产出 | CPTAC 各中心实验室 | 实验测定值(非人工标注) |
| 3D 分割 | 4 个队列的肿瘤/器官轮廓与种子点 | NCI 组织的标注项目 | NCI 影像标注团队 | 参考标注(非全例覆盖) |
| 生存结局 | 总生存/无病生存 | 临床随访登记 | 各站点研究协调员 | 真实随访数据 |
§3 数据集规格
§3.0 版本抉择矩阵
本数据集无单一全局版本,各队列独立版本化。按需求选择切入集合:
| 你的需求 | 推荐集合/版本 | 大小 | 理由 |
|---|---|---|---|
| 快速上手 radiogenomics 流程 | CPTAC-CCRCC(2025-07 版) | 280.22 GB | 体量适中、文档完善、有 3D 分割标注 |
| 脑肿瘤分割/MGMT 研究 | CPTAC-GBM(2024-07 版) | 192.6 GB | BraTS 2021 训练数据源;注意 Limited Access |
| 大规模病理 WSI 分类 | CPTAC-LSCC 或 CPTAC-PDA 病理 | 444.58 GB / 88 GB | WSI 数量多、临床标签经 PDC 可取 |
| 多模态体数据预处理研究 | CPTAC-PDA(V15) | 放射 67.24 GB + 病理 88 GB | 放射+病理双模态、134 检查/1,133 序列结构完整 |
| 泛癌影像-组学联合分析 | LSCC + LUAD + CCRCC + PDA 组合 | 1 TB 级 | 论文级分析的四主队列组合 |
§3.1 模态详情
放射影像:以多层螺旋 CT 与 MR 为主体;因取自标准诊疗,2021 快照显示还包含 CR/DX(胸片等)、PT(PET)、US(超声)、NM/SR(核医学)等模态(2021 快照)。每个受试者通常有术前基线检查,部分含术后随访检查;检查-序列-实例三层 DICOM 结构。
病理影像:H&E 染色玻片经 CPTAC qualification workflow 数字化为 SVS/Aperio 全切片,金字塔多分辨率存储;部分集合另有 DICOM 转换的切片显微数据(如 LUAD 的 SM 数据类型,IDC 集合页)。
关联层:影像不含组学文件本体;蛋白组矩阵、基因组变体与临床数据经 PDC/GDC 以 TSV/JSON 获取,经 PatientID 与影像配对。
§3.2 按子集样本数
| TCIA 集合 | 受试者数 | 数据类型 | 大小 | 数据 DOI | 最近更新 |
|---|---|---|---|---|---|
| CPTAC-CCRCC | 262 | CT/MR/病理/WSI | 280.22 GB | 10.7937/k9/tcia.2018.oblamn27 | 2025-07-07 |
| CPTAC-LSCC | 212 | CT/PT/病理/WSI | 444.58 GB | 10.7937/K9/TCIA.2018.6EMUB5L2 | 2024-04-05 |
| CPTAC-LUAD | 244 | CT/MR/PT/SM | 以集合页为准 | 10.7937/k9/tcia.2018.pat12tbs | 见集合页 |
| CPTAC-UCEC | 250 | CT/MR/PT/病理 | 以集合页为准 | 见集合页 | Ongoing |
| CPTAC-GBM | 200 | MR/CT/病理/WSI | 192.6 GB | 10.7937/K9/TCIA.2018.3RJE41Q1 | 2024-07-08 |
| CPTAC-PDA(放射) | 110(134 检查/1,133 序列/132,852 幅) | CT 等 DICOM | 67.24 GB | 10.7937/k9/tcia.2018.sc20fo18 | 2025-02-26(V15) |
| CPTAC-PDA(病理) | 168 | SVS | 88 GB | 同上 | 2025-02-26(V15) |
| CPTAC-HNSCC | 112 | CT/MR 等 | 以集合页为准 | 见集合页 | Limited Access |
| CPTAC-CM | 94 | CT/MR/PT/病理 | 以集合页为准 | 见集合页 | 外部队列 |
| CPTAC-BRCA(病理-only) | 134 | 病理 WSI | 以集合页为准 | 见集合页 | — |
| CPTAC-COAD(病理-only) | 106(373 幅) | 病理 WSI | 66.69 GB | 见集合页 | — |
| CPTAC-OV(病理-only) | 102 | 病理 WSI | 以集合页为准 | 见集合页 | — |
规模数字来源:CCRCC 页、GBM 页、LSCC 页、PDA 页、IDC LUAD 页、2021 快照。口径说明:PDA 放射与病理取同一队列的不同影像子集(受试者有重叠),合计受试者时按 110 计;BRCA/COAD/OV 为病理-only;合计约 1,726 名受试者。2021 年快照时点 7 个队列的放射影像受试者合计约 437 例(33–98 例/队列),其后部分队列经修订扩充。
§3.3 数据格式
| 层 | 格式 | 说明 |
|---|---|---|
| 放射影像 | DICOM(.dcm) | 单序列单目录,含完整设备与试验标签 |
| 病理影像 | SVS(Aperio 金字塔) | 多分辨率层级;LUAD 另有 DICOM 化 SM 切片显微数据 |
| 临床数据 | CSV/TSV 或 TSV/JSON | 经 PDC/GDC Clinical 标签页导出 |
| 组学数据 | TSV 矩阵、mzML、BAM/VCF/MAF | 经 PDC(蛋白组)/GDC(基因组)获取,不在 TCIA |
| 分割标注 | NCI 提供的标注文件与种子点 | 仅 4 个集合,随集合页分发 |
§3.4 存储大小
已核实集合合计约 1.1 TB+(CCRCC 280.22 GB + LSCC 444.58 GB + GBM 192.6 GB + PDA 放射 67.24 GB + PDA 病理 88 GB + COAD 66.69 GB);LUAD、UCEC、HNSCC、CM、BRCA、OV 未计入,全量下载建议预留 1.5–2 TB 磁盘并按集合分批。全数字为 TCIA 集合页公开值(截至 2026-09 查询)。
§3.5 标注方式
人工标注:NCI 为 CPTAC-UCEC、CPTAC-PDA、CPTAC-CCRCC、CPTAC-HNSCC 生成 3D 分割标注与种子点(seed points);其中 HNSCC 影像因 NIH 受控数据新政暂不可用(TCIA 总览页)。种子点是稀疏提示点,不是完整轮廓。
自动/实验产出:组织学诊断与分子标签不是"标注"而是实验与质控产出——病理经 CPTAC qualification workflow 复核,蛋白组/基因组经质谱与测序实验生成,随论文发布。
无标注:多数放射影像无肿瘤级轮廓标注;把本数据集当分割金标准库使用是常见误解(见坑点 8)。
§3.6 标注者资质与一致性
分割与种子点由 NCI 组织的影像标注团队按统一协议生成;病理诊断由 CPTAC 各中心病理团队在 qualification workflow 下复核,分子标签由联盟中心实验室按统一实验流程产出。TCIA 未公布逐例标注者数量与 Kappa 一致性指标,需要严格标注质量评估的研究应以 CPTAC 各队列论文的质控描述为准,并将分割标注视为"研究参考"而非"临床金标准"。
§3.7 采集周期
影像采集与 CPTAC 招募同步:放射影像为病理诊断前即刻的标准诊疗扫描加术后随访扫描;病理玻片来自手术切除标本的 qualification 流程;影像在 TCIA 的发布与蛋白组/基因组数据在 PDC/GDC 的发布日程协调(TCIA 总览页)。所有日期字段经随机偏移 3–10 年(站点/集合内一致),绝对日期不可用于时间趋势分析。
§3.8 地域覆盖
数据来自 NCI CPTAC 联盟的美国多中心学术医疗网络(含少量国际合作位点),不覆盖低收入地区人群;转诊模式为三级学术中心,人群谱与社区医院存在差异(详见 §7.1 偏倚表)。
§3.9 设备规格
设备与扫描协议为标准诊疗现状的横断面:多厂商(GE、Siemens、Philips 等主流厂商的 CT/MR 设备均在联盟中心常规使用)、多场强(MR 含 1.5T/3T)、多协议(层厚、期相、造影剂方案随临床指征变化)。DICOM 头中 Manufacturer、ManufacturerModelName、ProtocolName 等标签完整保留,是设备归一化研究的一手素材。官方未发布设备分布汇总表,需自行统计(代码见 §6.3)。
§3.10 深度溯源链
TCIA(影像托管,本条目对象)← CPTAC 联盟各中心(影像采集与质控)← NCI(资助与协调);组学平行链:PDC(蛋白组/处理数据)与 GDC(基因组/原始数据)← CPTAC 实验 ← NCI;受控访问层:CDS 泛癌数据 dbGaP phs001287(Cancer Cell 2023)。TCIA 本身的机构溯源见 Clark et al., J Digit Imaging 2013;其公开癌症放射影像集合的整体面貌见 Sci Data 2017(当时 TCIA 已托管约 30.9M 幅影像、约 37,568 名受试者的 HIPAA 脱敏集合)。
§3.11 质量分层与选用顺序
不同使用者对数据质量的需求不同,按下表选择最低门槛成立的工作流:
| 使用层级 | 最低要求 | 推荐队列 | 常见失误 |
|---|---|---|---|
| 教学/原型验证 | 单队列可跑通、文档完整 | CPTAC-PDA(结构最完整) | 误用绝对日期或不做模态过滤 |
| 方法比较研究 | 明确的划分协议 + 可复现预处理 | CPTAC-CCRCC / GBM | 不落盘划分清单,导致数值不可复现 |
| 分割算法研究 | 有 3D 标注子集 | CPTAC-CCRCC / PDA / UCEC | 把种子点当完整轮廓评测 |
| radiogenomics 关联研究 | 影像+组学配对 + 生存标签 | LSCC / LUAD / CCRCC / PDA | 未报告配对率,功效被高估 |
| 临床转化前验证 | 外部验证集 + 分层报告 | 需外接 BraTS/LIDC-IDRI/TCGA | 只有内部指标即宣称可用 |
§3.12 已知数据缺陷清单
以下缺陷在使用前应当知情(均为设计或历史原因造成,非数据错误):(1)影像-组学配对率低且非随机;(2)放射模态混入 2D 检查(CR/DX)与非常规模态(US/NM/SR),需显式白名单;(3)部分集合的临床随访字段存在空值,语义为"未采集"而非"阴性";(4)3D 标注仅 4 队列且非全例覆盖;(5)脑、头、头颈部队列受限访问,跨队列联合分析会遇到许可不一致;(6)各队列的更新节奏不同,无全局版本号;(7)官方未公布标注者间一致性指标。这些缺陷均已在 §6.5 与 §7 中有对应处置方案,不宜以"清洗掉"作为唯一手段——多数情况下应把缺陷编码为显式字段参与分析。
§4 数据结构
§4.0 目录树
以下为 CPTAC-CCRCC 解压后的典型目录结构(示意;日期为脱敏后随机偏移值,具体命名以实际下载为准):
cptac-ccrcc/
├── Radiology Discovery Cohort/ # 放射发现队列(CT/MR,DICOM)
│ ├── C3N-00499/ # 受试者目录(PatientID)
│ │ ├── 10-28-2000-NA-CT ABDOMEN-<随机序列号>/ # 检查目录(脱敏日期开头)
│ │ │ ├── 4-<序列号>/ # 序列目录
│ │ │ │ ├── 1-<实例号>.dcm # DICOM 实例
│ │ │ │ └── ...
│ │ │ └── ...
│ │ └── C3L-00012/ # 另一受试者
│ └── ...
├── Radiology Confirmatory Cohort/ # 放射确证队列(结构同上)
├── Pathology Discovery Cohort/ # 病理发现队列(H&E WSI)
│ ├── C3N-00499/
│ │ ├── C3N-00499-1.svs # 全切片(金字塔 SVS)
│ │ └── ...
│ └── ...
├── Pathology Confirmatory Cohort/ # 病理确证队列(结构同上)
├── pathologyAnnotation/ # NCI 3D 分割与种子点(部分集合)
└── metadata.csv # 受试者/序列清单(集合页可导出)
§4.1 DAIMS 字段字典
核心字段(8 列:字段名/类型/说明/示例值/AI 用途/观测误差/信息性缺失编码/取值范围):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| PatientID | string | 去标识受试者 ID,跨 TCIA/PDC/GDC 一致 | C3N-00499 | 影像-组学-临床关联主键 | 无(设计保证) | 无缺失 | C3N-xxxxx/C3L-xxxxx |
| StudyInstanceUID | DICOM UID | 一次检查的唯一标识 | 1.3.6.1.4.1.… | 检查级分组与去重 | 无 | 无缺失 | DICOM UID |
| SeriesInstanceUID | DICOM UID | 序列唯一标识 | 1.3.6.1.4.1.… | 3D 体数据组织单元 | 无 | 无缺失 | DICOM UID |
| Modality | string | 影像模态 | CT | 过滤 2D/3D 与预处理分支 | 历史检查含 CR/DX | 按 DICOM 标准空标签 | CT/MR/PT/CR/DX/US/NM/SR |
| (0012,0050) Clinical Trial Time Point ID | string | 距初始病理诊断的天数 | -3 / 90 | 影像-病理-组学时点对齐 | 依赖站点录入 | 缺失=该检查未标注 | 整数天数(术前为负) |
| StudyDate | date | 脱敏检查日期(随机偏移 3–10 年) | 2013-05-14 | 仅限纵向间隔计算 | 绝对日期失真 | 无缺失 | 偏移后日期 |
| Collection | string | TCIA 集合名 | cptac-ccrcc | 队列归组 | 无 | 无缺失 | 11 个集合名 |
| Cohort | string | Discovery/Confirmatory 子集 | Discovery | 复现论文分析设计 | 以集合页为准 | 无缺失 | Discovery/Confirmatory |
| SlideID(病理) | string | WSI 玻片标识 | C3N-00499-1 | 病理任务主键 | 无 | 无缺失 | 集合内唯一 |
| 组织学诊断(PDC Clinical) | string | 部位与亚型术语 | Adenocarcinoma | 分类标签源 | 以 PDC 导出为准 | 空串=未知 | ICD-O 术语 |
§4.2 标签分布
本数据集没有集中的"标签文件":分类标签需经 PDC/GDC 的 Clinical 导出获取(组织学亚型、分期、生存),分割标签仅 4 个集合部分受试者有。因此在任何建模前,第一步应是用 §6.1 代码从 DICOM 头统计受试者×检查×序列×模态的实际分布,并与 PDC Clinical 导出做交集,把"标签可用性矩阵"显式落盘。2021 快照的参考分布:放射影像受试者 33(LUAD)–98(PDA)例/队列、合计约 437 例(2021 快照)。
§4.3 关键统计
- 放射侧:CPTAC-PDA V15 为 110 名受试者、134 次检查、1,133 个序列、132,852 幅 DICOM(67.24 GB)(PDA 页)——可据此估算其他队列的"受试者:检查:序列:实例"约为 1:1.2:10:1,200 量级(粗略外推,实际以各集合 manifest 为准)。
- 病理侧:CPTAC-COAD 106 例、373 幅 WSI(66.69 GB),平均每例约 3.5 张玻片(COAD wiki)。
- 数据 DOI 被引:CCRCC 17 次、GBM 28 次、LSCC 28 次(TCIA 页面实时计数,截至 2026-09,GBM 页)。
§4.4 数据层级
放射影像四级:受试者(PatientID)→ 检查(StudyInstanceUID,对应一次扫描)→ 序列(SeriesInstanceUID,对应一个模态/方位/期相)→ 实例(单幅 .dcm)。病理两级:受试者 → 玻片(SlideID,SVS 金字塔内含 level 0–N)。临床层经 PatientID 挂接。跨库层级:受试者(TCIA PatientID = PDC case 标识 = GDC case 标识)→ 检查/样本 → 文件(PDC/GDC 用 UUID 命名,与 TCIA 目录树无直接对应,见坑点 7)。
§4.5 缺失值与信息性缺失
| 情形 | 表现 | 解读 | 处理建议 |
|---|---|---|---|
| 组学缺号 | 受试者在 TCIA 有影像但 PDC 查无蛋白组 | 该例影像发布早于组学或属外部队列(如 CM) | 记入"配对率清单",勿当随机缺失 |
| 影像缺号 | PDC 有组学但 TCIA 无放射 | 影像未发布或该队列病理-only | 检查 §3.2 口径表 |
| (0012,0050) 缺失 | DICOM 头无时点标签 | 少数历史检查未录入 | 归入"时点未知"组,勿默认为术前 |
| 临床字段空串 | PDC 导出 CSV 空值 | 真实未采集(如未做某分期检查) | 区分"未采集"与"阴性" |
§4.6 常用探查查询
拿到 manifest 后的前 30 分钟应当产出下列四张表,它们决定后续所有实验的可行性:
import pandas as pd
manifest = pd.read_csv("cptac_ccrcc_manifest.csv")
# 表 1:每受试者的序列数与模态构成(识别多模态受试者与单序列受试者)
per_patient = (manifest.groupby("PatientID")
.agg(n_series=("SeriesInstanceUID", "nunique"),
modalities=("Modality", lambda s: ",".join(sorted(set(s))))))
print(per_patient["modalities"].value_counts().head(10))
# 表 2:模态 × 受试者交叉表(决定白名单过滤策略,呼应坑点 5)
modality_matrix = (manifest.groupby(["PatientID", "Modality"])
.size().unstack(fill_value=0))
print((modality_matrix > 0).sum().sort_values(ascending=False))
# 表 3:序列规模分布(识别异常小/大序列,通常是定位像或拼接错误的序列)
print(manifest["ImageCount"].describe(percentiles=[.05, .5, .95]))
# 表 4:与组学的配对可用性(呼应坑点 1 的三计数)
omics_ids = set(pd.read_csv("pdc_case_ids.csv")["case_id"])
manifest["has_omics"] = manifest["PatientID"].isin(omics_ids)
print(manifest.groupby("has_omics")["PatientID"].nunique())
读表要点:表 1 中若某受试者的模态字符串包含两种以上影像类型,说明该例有多次不同检查,须按时点标签决定用哪一次;表 2 若某模态只覆盖极少数受试者,该模态不足以支撑独立实验,应并入"其他"或直接剔除;表 3 的 5% 分位数附近若出现极小值,基本可判定为定位像序列;表 4 的 True 组即为可做 radiogenomics 的样本池,其规模通常远小于 False 组。
§5 划分与使用建议
§5.1 官方划分
官方没有提供机器学习意义的训练/验证/测试划分。集合页的 Discovery/Confirmatory 是 CPTAC 论文的分析阶段划分(发现队列用于假设生成、确证队列用于假设验证),与 ML 划分不可混用。TCIA 侧的拆分体现为独立下载目录(Radiology Discovery Cohort 等)。复现任何 CPTAC 论文结果时,应严格按论文的数据可得性声明取数——例如 LSCC 图谱论文的影像经 TCIA 获取、蛋白组为 PDC000232/233/234/237、基因组 dbGaP phs001287(Satpathy et al., Cell 2021)。
§5.2 社区惯例划分
社区实践通常按受试者级 70/15/15 或 80/20 随机划分,或按站点留一(leave-one-site-out)评估泛化。因为没有官方划分,跨论文数值不可比是常态(§8.1)。建议在自己论文中公开划分清单(PatientID 列表 + 随机种子),这在此类无官方划分的数据集上是基本学术规范。
§5.3 划分策略与泄漏风险
患者级泄漏是最大风险:同一受试者有术前基线 + 术后随访两次检查,若按"检查"而非"受试者"划分,模型可能记住个体纹理特征而虚高。站点泄漏次之:同一中心的患者共享设备与协议指纹,随机划分会泄漏站点信息。跨库泄漏:影像特征若与组学标签在同一受试者上反复出现于训练/测试两侧,radiogenomics 关联会系统性虚高。对策:一切划分以 PatientID 为最小单元;涉及站点泛化时用站点留一或至少站点分层抽样。
§5.4 交叉验证建议
推荐嵌套交叉验证:外层按受试者 5 折估计泛化性能,内层调参;每折确保同一受试者的所有检查与所有玻片同折。配对子集(影像+组学齐备)与非配对子集可分开评估并报告两个指标,避免"配对样本量小导致方差大"掩盖整体性能。
§5.5 外部验证建议
推荐外部集:同瘤种的独立影像库(如脑肿瘤用 BraTS、肺结节用 LIDC-IDRI)验证分割/分类迁移;分子层验证可在 TCGA 同瘤种数据上检验影像-分子关联的可复现性。CPTAC-GBM 的 DICOM 已被 BraTS 2021 用作分割与 MGMT 分类器训练数据(TCIA wiki),说明"内部训练→外部基准检验"路径可行。
§5.6 划分决策检查表
在开始任何训练前,逐条确认下列问题(每条都有对应的失败案例):
| 检查项 | 若回答"否"的后果 | 落地动作 |
|---|---|---|
| 划分单元是否为 PatientID? | 同一患者的多检查跨折 → 性能虚高 | 按 §6.4 的 patient_level_split 生成并落盘 ID 清单 |
| 是否记录了每个受试者被用于训练还是测试? | 无法回答审稿人质询,也无法自查泄漏 | 导出 split_train/val/test.csv 并入库版本控制 |
| 影像-组学配对样本是否与非配对样本分开评估? | 配对子集的小样本方差被掩盖 | 报告两套指标并在表注中说明分母 |
| 是否报告了每个队列/站点的分层结果? | 单一均值掩盖站点间巨大差异 | 加一张"按队列"的分组指标表 |
| 预处理参数是否只用训练集统计? | 归一化参数泄漏测试集信息 | 把均值/方差只在训练折上计算并缓存 |
| 时点是否统一口径(术前 or 随访)? | 同一测试集混入不同时点 → 结论不可解释 | 用 (0012,0050) 显式过滤并记录剔除数量 |
§5.7 任务-数据匹配建议
把研究问题与队列特性对齐可显著降低返工概率:想做分子分层预测,优先选蛋白组深度最高的队列(LSCC、LUAD、CCRCC、PDA 四个论文级队列),并接受配对样本量较小的现实;想做分割,优先选已标注队列(UCEC、PDA、CCRCC),且必须按 §7.7 的覆盖率说明报告有标注子集容量;想做病理分类,优先选 WSI 数量多的队列(LSCC 444.58 GB、PDA 病理 88 GB、COAD 373 幅),并把颜色归一化作为必要步骤;想做跨模态对齐,优先选同时有放射与病理的队列(PDA、CCRCC、GBM),因为同受试者的两种影像本身就是天然的正样本对。不建议在单队列上做"泛癌"结论,本数据集虽有 10 个癌种,但每个癌种的样本量都不足以独立支撑强结论。
§6 AI 就绪指南
§6.0 云端快速启动
两条云端路径:(1)PayneLab cptac Python/R 包统一访问 CPTAC 蛋白基因组数据并提供 Google Colab 教程(NCI 工具页;GitHub),适合先拉组学矩阵再对影像;(2)TCIA 官方提供 Jupyter notebook,演示读取 CPTAC 放射 DICOM 与 3D 标注、生成 radiomics 特征并关联临床数据(TCIA 总览页)。云端环境磁盘有限,建议只下载单队列子集(约 30–70 GB)。
§6.1 快速上手
# ============================================================
# 目录结构预期(以 CPTAC-CCRCC 为例,data_root 可自定):
# data_root/
# cptac-ccrcc/
# Radiology Discovery Cohort/
# C3N-00499/<脱敏日期>-<描述>/<序列号>/*.dcm
# manifest 拼接关系:
# series_dir = data_root / collection / cohort / patient / study / series
# 最小可用子集:单受试者的单个 CT 序列(数十至数百幅 .dcm)
# ============================================================
import pathlib
import pydicom
DATA_ROOT = pathlib.Path("data/cptac-ccrcc/Radiology Discovery Cohort")
# 先扫描一名受试者,核对 ID/模态/时点标签是否与集合页一致
patient_dir = DATA_ROOT / "C3N-00499"
dcm_files = sorted(patient_dir.rglob("*.dcm"))
print(f"该受试者 DICOM 实例数: {len(dcm_files)}")
for f in dcm_files[:3]:
ds = pydicom.dcmread(f, stop_before_pixels=True)
tp_elem = ds.get(0x00120050) # (0012,0050) 时点标签
timepoint = tp_elem.value if tp_elem is not None else "NA"
print(ds.PatientID, ds.Modality, ds.StudyDate, # 日期已随机偏移
f"days_from_pathology={timepoint}")
§6.2 数据获取
| 方式 | 适用集合 | 大小/流量 | 流程 |
|---|---|---|---|
| TCIA 集合页手动下载 | 全部(单文件级) | 按需 | 打开集合页 → 选择 Radiology/Pathology 子集 → 逐文件或整包下载 |
| NBIA Data Retriever | 全部(批量) | TB 级推荐 | 安装客户端 → 下载 manifest(.tcia)→ 客户端批量拉取 |
| NBIA REST API | 公开集合匿名;Limited 需 token | 自动化首选 | 见下方代码;Limited 队列先注册签署协议(坑点 2) |
| PDC/GDC 门户 | 组学与临床 | GB 级 | Clinical 标签页导出 CSV/TSV;蛋白组研究页下载矩阵 |
获取前必做的三件事:(1)确认目标集合的访问级别——公开 CC BY 集合可匿名脚本化下载,Limited 集合必须先注册并签署协议;(2)估算磁盘——按 §3.4 的集合大小预留,DICOM 解压后体积与下载包差异不大,但 SVS 与派生特征缓存会显著膨胀;(3)记录版本快照——把下载当日的集合页更新日期与 DOI 写入实验日志,因为集合会修订(PDA 页)。
import requests
BASE = "https://services.cancerimagingarchive.net/nbia-api/services/v1"
# 公开集合(如 CPTAC-CCRCC)匿名可查全部序列元数据
resp = requests.get(f"{BASE}/getSeries", params={"Collection": "cptac-ccrcc"},
timeout=60)
series_meta = resp.json() # 含 PatientID、Modality、ImageCount 等字段
print(len(series_meta), "个序列")
# 受限集合(CPTAC-GBM 等 Limited 队列)须先登录获取 token:
# token = requests.post(f"{BASE}/login",
# data={"username": "...", "password": "..."}).text
# 再在后续请求中携带 token 参数(详见 TCIA API guides)
从序列元数据构建 manifest(后续一切分析的起点):
import pandas as pd, pathlib
# getSeries 返回的每个元素含 PatientID / Modality / SeriesInstanceUID /
# ImageCount / StudyInstanceUID 等字段;先落成一张表再谈建模
manifest = pd.DataFrame(series_meta)[
["PatientID", "StudyInstanceUID", "SeriesInstanceUID",
"Modality", "ImageCount"]]
# 三个计数必须显式落盘:入组数 / 有影像数 / 影像+组学配对数为后续一切分母
n_image_subjects = manifest["PatientID"].nunique()
print(f"有影像受试者: {n_image_subjects}")
print(manifest.groupby("Modality")["SeriesInstanceUID"].count()
.sort_values(ascending=False))
manifest.to_csv("cptac_ccrcc_manifest.csv", index=False)
# 与 PDC 临床导出求交集,得到配对子集(把 m 写进实验配置)
pdc_clinical = pd.read_csv("pdc_clinical_export.csv", sep="\t")
paired = manifest[manifest["PatientID"].isin(pdc_clinical["case_id"])]
print(f"影像+临床配对受试者: {paired['PatientID'].nunique()}")
若需按受试者批量拉取 DICOM,可在 manifest 的 SeriesInstanceUID 上循环调用 /getImage 接口,或用 NBIA Data Retriever 消费官方生成的 .tcia manifest 文件;后者的断点续传与校验和机制比自制脚本更可靠,TB 级下载优先选它。
§6.3 预处理全流程
放射:DICOM 序列 → NIfTI 体数据 + 设备元数据表:
import SimpleITK as sitk
import pydicom, pathlib, pandas as pd
def dicom_series_to_nifti(series_dir: pathlib.Path, out_path: pathlib.Path):
"""把单个序列目录转为 NIfTI;DICOM 会按 InstanceNumber 排序拼接"""
reader = sitk.ImageSeriesReader()
names = reader.GetGDCMSeriesFileNames(str(series_dir))
reader.SetFileNames(names)
image = reader.Execute() # 各向异性体数据
sitk.WriteImage(image, str(out_path))
return image.GetSize(), image.GetSpacing()
# 设备分布统计(多厂商异质性的一手素材)
rows = []
for f in pathlib.Path("data/cptac-ccrcc").rglob("*.dcm"):
ds = pydicom.dcmread(f, stop_before_pixels=True)
rows.append({"PatientID": ds.PatientID,
"Modality": ds.Modality,
"Manufacturer": getattr(ds, "Manufacturer", "NA"),
"Model": getattr(ds, "ManufacturerModelName", "NA"),
"SliceThickness": getattr(ds, "SliceThickness", "NA")})
device_table = pd.DataFrame(rows).drop_duplicates()
print(device_table["Manufacturer"].value_counts())
病理:SVS 金字塔窗口读取 + 组织区过滤:
import openslide
from PIL import Image
import numpy as np
slide = openslide.OpenSlide("data/cptac-pda/C3N-00499/C3N-00499-1.svs")
print(slide.level_dimensions) # 金字塔各级尺寸(level 0 可达 10 万像素级)
def tissue_patch(slide, x, y, level=2, size=512):
"""读取一个 patch 并按饱和度过滤白背景"""
im = slide.read_region((x, y), level, (size, size)).convert("RGB")
arr = np.asarray(im)
hsv_max = arr.max(axis=2); hsv_min = arr.min(axis=2)
saturation = (hsv_max - hsv_min) / (hsv_max + 1e-6)
return im, saturation.mean() > 0.05 # False=白背景
清洗与标准化要点(按顺序执行,顺序错会引入隐蔽缺陷):
- 序列级去重与筛选:同一检查常有定位像(scout)、重建序列与薄层序列并存。先用
ImageCount与层厚过滤掉定位像与单帧序列,否则 3D 加载器会在这些序列上崩溃(呼应坑点 5)。 - 重采样与间距统一:DICOM 的像素间距因协议而异(层厚从 0.625 mm 到 5 mm 不等)。分割任务建议插值到统一间距(如 1×1×1 mm),分类任务可先统一到粗网格(如 2×2×3 mm)以控内存。
- 强度语义按模态分支:CT 用 HU 窗口(如腹部 -100~300、肺窗 -1350~150),MR 无绝对强度语义须逐序列 z-score,PET 用 SUV 或体重归一化。混用是典型错误(呼应坑点 5)。
- 方向归一化:用
sitk.DICOMOrient或等效方法把体数据统一到标准方向(如 LPS),避免不同站点重建方向不同导致模型学到方位伪影。 - 裁剪与前景提取:全身扫描需先裁到目标器官区,否则背景占比过高会稀释训练信号。可用简单阈值+连通域做粗裁剪,不必上深度学习分割。
- 病理侧的颜色归一化:不同站点的 H&E 染色差异显著,Macenko/Reinhard 颜色归一化对跨站点泛化有实测收益;但幅度过大的归一化会抹掉核异型信息(呼应 §6.6 的危险增强)。
import SimpleITK as sitk
import numpy as np
def normalize_ct(series_dir: str, out_path: str,
target_spacing=(1.0, 1.0, 1.0), hu_window=(-100, 300)):
"""CT 序列 → 方向统一 + 重采样 + HU 截断 的 NIfTI"""
reader = sitk.ImageSeriesReader()
reader.SetFileNames(reader.GetGDCMSeriesFileNames(series_dir))
img = reader.Execute()
# 1) 统一到标准方向,消除站点重建方向差异
img = sitk.DICOMOrient(img, "LPS")
# 2) 重采样到统一间距
original_spacing = img.GetSpacing()
original_size = img.GetSize()
new_size = [int(round(osz * ospc / tspc)) for osz, ospc, tspc in
zip(original_size, original_spacing, target_spacing)]
img = sitk.Resample(img, new_size, sitk.Transform(),
sitk.sitkLinear, img.GetOrigin(),
target_spacing, img.GetDirection(), 0,
img.GetPixelID())
# 3) HU 截断并归一化到 [0, 1](仅对 CT 有效)
arr = sitk.GetArrayFromImage(img).astype("float32")
arr = arr.clip(*hu_window)
arr = (arr - hu_window[0]) / (hu_window[1] - hu_window[0])
out = sitk.GetImageFromArray(arr)
out.CopyInformation(img)
sitk.WriteImage(out, out_path)
§6.4 PyTorch DataLoader
# ============================================================
# 两个 Dataset:放射 3D 体数据 + 病理 WSI patch
# 目录预期:data_root/collection/cohort/patient/study/series/*.dcm
# data_root/collection/pathology/patient/slide.svs
# 仅作骨架示例:实际使用需补 manifest 对齐与异常处理
# ============================================================
import pathlib, numpy as np, torch
from torch.utils.data import Dataset, DataLoader
import SimpleITK as sitk
import openslide
class CptacRadiologyDataset(Dataset):
"""CT 序列级数据集:HU 窗口化 + 重采样到统一尺寸"""
def __init__(self, series_dirs, target_shape=(64, 224, 224),
hu_range=(-100, 300)):
self.series_dirs = series_dirs # 每项为一个序列目录
self.target_shape = target_shape
self.hu_range = hu_range
def __len__(self):
return len(self.series_dirs)
def __getitem__(self, idx):
reader = sitk.ImageSeriesReader()
reader.SetFileNames(
reader.GetGDCMSeriesFileNames(str(self.series_dirs[idx])))
vol = sitk.GetArrayFromImage(reader.Execute()) # (Z, H, W)
vol = np.clip(vol, *self.hu_range)
vol = (vol - self.hu_range[0]) / (self.hu_range[1] - self.hu_range[0])
vol = torch.from_numpy(vol).float()[None] # (1, Z, H, W)
vol = torch.nn.functional.interpolate(
vol, size=self.target_shape, mode="trilinear",
align_corners=False)[0]
return vol
class CptacPathologyPatchDataset(Dataset):
"""WSI patch 数据集:level 2 采样 + 白背景过滤"""
def __init__(self, slide_paths, patch_size=512, level=2, stride=256):
self.slides = [openslide.OpenSlide(p) for p in slide_paths]
self.patch_size, self.level, self.stride = patch_size, level, stride
self.coords = []
for si, sl in enumerate(self.slides):
w, h = sl.level_dimensions[level]
for x in range(0, w - patch_size, stride):
for y in range(0, h - patch_size, stride):
self.coords.append((si, x, y))
def __len__(self):
return len(self.coords)
def __getitem__(self, idx):
si, x, y = self.coords[idx]
im = self.slides[si].read_region(
(x * 2 ** self.level, y * 2 ** self.level),
self.level, (self.patch_size, self.patch_size)).convert("RGB")
arr = np.asarray(im) / 255.0
return torch.from_numpy(arr.transpose(2, 0, 1)).float()
loader = DataLoader(CptacRadiologyDataset(series_dirs=[
pathlib.Path("data/cptac-ccrcc/Radiology Discovery Cohort/C3N-00499")]),
batch_size=2, num_workers=4)
带 transform 与受试者级划分的完整版本(生产用骨架):
import torch, numpy as np, pandas as pd
from torch.utils.data import Dataset, DataLoader
class CptacPairedDataset(Dataset):
"""影像 + 组学配对数据集;split 由 PatientID 清单驱动,杜绝患者级泄漏"""
def __init__(self, manifest: pd.DataFrame, omics: pd.DataFrame,
split_ids: set, hu_range=(-100, 300), target_shape=(64, 224, 224)):
merged = manifest.merge(omics, on="PatientID", how="inner")
self.rows = merged[merged["PatientID"].isin(split_ids)].reset_index(drop=True)
self.hu_range = hu_range
self.target_shape = target_shape
self.omics_cols = [c for c in omics.columns if c != "PatientID"]
def __len__(self):
return len(self.rows)
def __getitem__(self, idx):
row = self.rows.iloc[idx]
vol = load_volume(row["SeriesDir"]) # 复用 §6.3 预处理
vol = torch.from_numpy(vol).float()[None] # (1, Z, H, W)
vol = torch.nn.functional.interpolate(
vol, size=self.target_shape, mode="trilinear",
align_corners=False)[0]
label = torch.tensor(row["label"], dtype=torch.long)
omics_vec = torch.tensor(
row[self.omics_cols].to_numpy(dtype="float32"))
return vol, omics_vec, label
def patient_level_split(manifest: pd.DataFrame, seed: int = 42,
ratios=(0.7, 0.15, 0.15)):
"""受试者级三分;返回三份 PatientID 集合(先落盘再训练)"""
ids = sorted(manifest["PatientID"].unique())
rng = np.random.default_rng(seed)
rng.shuffle(ids)
n = len(ids)
n_tr, n_va = int(n * ratios[0]), int(n * ratios[1])
return (set(ids[:n_tr]), set(ids[n_tr:n_tr + n_va]), set(ids[n_tr + n_va:]))
train_ids, val_ids, test_ids = patient_level_split(manifest)
# 关键:把三份 ID 清单落盘,作为可复现性与审稿人核查的依据
for name, ids in [("train", train_ids), ("val", val_ids), ("test", test_ids)]:
pd.Series(sorted(ids)).to_csv(f"split_{name}.csv", index=False, header=False)
ds_train = CptacPairedDataset(manifest, omics_df, train_ids)
train_loader = DataLoader(ds_train, batch_size=4, shuffle=True,
num_workers=8, pin_memory=True)
多模态配对注意:上例以 SeriesDir 为影像入口,实际生产中应先按坑点 5 过滤模态(只留 CT 或只留 MR),再为每个受试者选定一个代表序列(如层厚最薄、覆盖最完整的序列),否则同一受试者会有多个样本被分到不同折——这正是患者级泄漏的隐蔽入口。
§6.5 坑点清单
⚠️ 坑点 1:影像-组学配对率远低于总入组人数(分类:偏倚陷阱)
问题:TCIA 只托管影像侧,11 队列约 1,726 名受试者中,2021 年时点有放射影像的仅约 437 例;把"入组人数"当"配对样本量"会让功效分析与结论全错。
症状:从 PDC 拉全队列组学后与影像 join,大量受试者无影像键;radiogenomics 关联在幸存子集上虚高。
解决:
- 简单方法:先从各集合页导出受试者清单,与 PDC Clinical 导出按 PatientID 求交集,再定样本量。
- 进阶方法:把每队列的"入组 N / 有影像 n / 影像+组学 m"三个数写进实验配置,模型只训练在 m 上、报告时三个数并列。
- SOTA 方法:对配对子集做逆概率加权或多重插补敏感性分析,检验关联是否随配对率漂移。
验证已修好:打印三个计数并断言m <= n <= N成立;若 m 与 n 差值超过预期(例如 n 的 50%),说明 join 键或导出范围有问题。
参考:TCIA CPTAC 总览;2021 快照统计。
⚠️ 坑点 2:2022-01-06 许可变更导致脑/头/颈集合下载失效(分类:工程陷阱)
问题:所有脑、头、头颈部集合(含 CPTAC-GBM、CPTAC-HNSCC)自 2022-01-06 起从 CC 许可转为 TCIA Limited Access License(面部可重建性考量),匿名下载失效。
症状:旧脚本批量下载 GBM 时突然全部 401/403;HNSCC 影像因 NIH 受控数据新政一度整体不可用。
解决:
- 简单方法:注册 TCIA 账户、在线签署 Limited Access 协议,用 NBIA Data Retriever 登录后下载。
- 进阶方法:REST 走 token 流程——先调登录接口取 token,再在 getSeries/getImage 请求中携带。
- SOTA 方法:在数据管线里维护"集合→访问级别"配置表,下载前校验,避免对受限集合硬编码匿名访问。
验证已修好:用同一脚本对公开集合与受限集合各发一次元数据请求,前者应返回 200 且含序列列表,后者未登录时应返回鉴权失败而非空列表——区分"无权限"与"无数据"。
参考:TCIA API guides。
⚠️ 坑点 3:把偏移后的 StudyDate 当真实日期(分类:标签理解)
问题:所有日期标签被随机偏移 3–10 年(站点/集合内一致)以满足 HIPAA,绝对日历时间失真。
症状:拿 StudyDate 与 PDC 临床诊断日期对齐时时点错乱;做"扫描日期-生存期"相关性研究得出无意义结论。
解决:
- 简单方法:时点对齐一律使用 DICOM (0012,0050) Clinical Trial Time Point ID(距初始病理诊断天数,术前为负、随访为正)。
- 进阶方法:纵向间隔用偏移后日期差计算(偏移在同站点一致,间隔保留);跨库绝对日期一律丢弃。
- SOTA 方法:在特征命名规范中显式使用 days_from_pathology 命名,并在数据卡中声明绝对日期不可用。
验证已修好:抽查数例,确认 (0012,0050) 存在且值域合理(术前应为负、随访为正);若该标签缺失比例高,应把"时点未知"作为独立分组的显式取值而非丢弃样本。
参考:CPTAC-GBM 集合页脱敏说明。
⚠️ 坑点 4:Discovery/Confirmatory 与放射/病理子集混淆(分类:工程陷阱)
问题:集合页把下载链接拆成 Radiology Discovery Cohort、Pathology Discovery Cohort(及 Confirmatory);Discovery/Confirmatory 是论文分析阶段划分,不是 ML 训练/测试划分。
症状:把 Pathology Discovery 当放射数据解包,目录里全是 SVS;把 Confirmatory 样本并入训练集导致与论文结果不可比。
解决:
- 简单方法:下载前读集合页下载区块,按影像类型与队列阶段分别取链接。
- 进阶方法:manifest 增加 cohort 与 image_type 两列,任何加载器按两列路由。
- SOTA 方法:复现论文时严格按论文数据可得性声明(如 LSCC:影像经 TCIA + 蛋白组 PDC000232/233/234/237)。
验证已修好:对解压目录做一次文件扩展名分布统计——放射目录应 100% 为 .dcm,病理目录应 100% 为 .svs(或对应格式);出现混杂即说明子集选取有误。
参考:CPTAC-CCRCC 集合页;Satpathy et al., Cell 2021。
⚠️ 坑点 5:放射模态异质,2D 与 3D 混读崩溃(分类:预处理陷阱)
问题:影像取自标准诊疗,模态含 CR/DX/CT/MR/PT/US/NM/SR;胸片等 2D 模态与 CT 等 3D 模态混在同一集合目录树里。
症状:假定 3D 体数据的 DataLoader 读到单帧 CR 时维度报错;把 HU 窗宽窗位用到 MR/PET 上产生全黑或全白图像。
解决:
- 简单方法:按 DICOM Modality 标签过滤,首轮实验仅保留 CT(或 MR)。
- 进阶方法:按模态分支预处理——CT 走 HU 窗口、MR 走 z-score、PT 走 SUV 标准化。
- SOTA 方法:逐序列校验行列数、层厚、期相后再入库,构建"模态×方向×层厚"元数据索引供采样器调用。
验证已修好:统计过滤前后 DataLoader 成功产出的 batch 数与模态计数——过滤后应无加载异常,且批次中的模态与预期白名单完全一致。
参考:2021 快照模态清单。
⚠️ 坑点 6:WSI 单文件千兆像素,整图读取爆内存(分类:工程陷阱)
问题:H&E 全切片 level 0 可达十万像素级、单文件数 GB;PIL/OpenCV 整图解码不可行。
症状:Image.open 读 SVS 卡死或 OOM;把 WSI 等比缩小后腺管与核异型细节全失,分类精度崩塌。
解决:
- 简单方法:用 openslide.read_region((x, y), level, size) 做窗口读取,金字塔高层做预览、level 0–2 做 patch。
- 进阶方法:按组织掩膜(饱和度/HSV 阈值)过滤白背景 patch,采样量可降一个数量级。
- SOTA 方法:用 pyvips 预转换为 zarr/tiled TIFF 金字塔,配合分布式 patch 采样器与多节点缓存。
验证已修好:在一个受限内存环境(如 8 GB 容器)里跑通单张 WSI 的 patch 采样,峰值内存应稳定在数百 MB 量级而非随图幅线性增长。
参考:CPTAC-COAD wiki。
⚠️ 坑点 7:TCIA 与 PDC/GDC 的 ID/文件体系错配(分类:标签理解)
问题:PatientID 设计上跨库一致,但 PDC/GDC 侧文件以 UUID 命名、TCIA 侧以患者/日期目录组织,两库均无用户侧官方 join 表。
症状:按文件名匹配两库数据全部失败;把 PDC 的 case 标识与 TCIA PatientID 的显示差异误判为不同受试者。
解决:
- 简单方法:以 PatientID 为唯一 join 键——TCIA PatientID 与 PDC/GDC 的 case 标识一致(CCRCC 页)。
- 进阶方法:用 PDC API 导出 case→study→file 的 UUID 层级表,落成 parquet 索引供两个库共用。
- SOTA 方法:把映射表纳入版本控制并记录行数校验和,任何重跑先校验映射完整性。
验证已修好:断言映射表覆盖了目标集合的全部 PatientID(左连接后无新增空值行),并抽查 3 例手工核对 ID 字符串是否逐字一致。
参考:PDC 门户;GDC CPTAC 页。
⚠️ 坑点 8:3D 分割标注仅 4 队列且非全例覆盖(分类:评估误用)
问题:NCI 仅为 CPTAC-UCEC、CPTAC-PDA、CPTAC-CCRCC、CPTAC-HNSCC 生成 3D 分割与种子点,且 HNSCC 受限、覆盖不含每一名受试者;种子点是稀疏点提示而非轮廓。
症状:把全部受试者当有标注训练集,mask 加载批量报错;把种子点当分割金标评测,Dice 系统性偏低。
解决:
- 简单方法:先枚举标注目录得到"有标注受试者清单",分割任务只在该子集上评测。
- 进阶方法:在数据卡中记录每个集合的 mask 覆盖率,主指标与"全例外推指标"分开报告。
- SOTA 方法:把种子点当弱监督提示(如 SAM 式点提示),无标注受试者进半监督分支。
验证已修好:打印"有标注受试者清单"与全集合受试者清单的比值,并与评分表的覆盖率数字对齐;评测脚本应显式断言样本全部在有标注子集内。
参考:TCIA CPTAC 总览(3D 标注公告)。
§6.6 数据增强
安全 ✅:放射侧——随机翻转(注意左右器官对称性假设)、小角度旋转、随机裁剪、灰度抖动、高斯噪声(模拟低剂量);病理侧——HED 颜色扰动(模拟染色差异,幅度要小)、随机 patch 采样位置、90° 旋转与翻转。
危险 ❌:放射侧——改变窗宽窗位的"增强"(破坏 HU 物理语义)、大形变(破坏解剖结构)、左右翻转用于有明显左右不对称的器官(如胰腺);病理侧——强 HED 扰动抹掉核异型信息、跨模态混合增强(CR 与 CT 特征空间不同)。任何增强都不得以"填充绝对日期"等形式泄漏被脱敏字段。
增强强度的判断依据:任何增强都应当能用"临床上会真实出现这种变化吗"来回答。低剂量扫描的噪声更大(可用高斯噪声模拟,安全);不同患者的体位略有差异(小角度旋转安全);不同医院染色深浅不一(小幅度 HED 扰动安全);但肿瘤不可能左右镜像生长在原本没有肿瘤的位置(大形变危险),窗宽窗位是阅片设置而非组织属性(改窗危险)。用这条判据可以把增强列表精简到真正有益的少数几项,也能防止把增强当成提升指标的捷径。
import torch
import torchvision.transforms.functional as TF
class CptacCTAugment:
"""CT 增强:只做临床合理的变化,禁止改动 HU 语义"""
def __init__(self, p_flip=0.5, max_angle=10, noise_std=0.01):
self.p_flip, self.max_angle, self.noise_std = p_flip, max_angle, noise_std
def __call__(self, vol: torch.Tensor) -> torch.Tensor:
# vol: (1, Z, H, W),已 HU 归一化到 [0, 1]
if torch.rand(1).item() < self.p_flip:
vol = TF.hflip(vol) # 仅当解剖结构近对称时使用
if torch.rand(1).item() < 0.5:
vol = TF.rotate(vol, float(torch.empty(1).uniform_(
-self.max_angle, self.max_angle))) # 小角度旋转
vol = vol + torch.randn_like(vol) * self.noise_std # 模拟低剂量噪声
return vol.clamp(0, 1) # 保持在归一化 HU 范围内
§6.7 模型推荐
| 任务 | 推荐架构 | 输入 | 起步理由 |
|---|---|---|---|
| CT 肿瘤分割 | nnU-Net v2 | 3D CT(HU) | 无官方划分时自监督预训练+交叉验证最稳健 |
| MR 分割 | nnU-Net v2 / Swin UNETR | 3D MR | GBM 队列可与 BraTS 生态衔接 |
| WSI 亚型分类 | Multiple Instance Learning(ABMIL/TransMIL) | patch 特征(UNI/CTransPath 骨干) | 玻片级标签天然适配 MIL |
| Radiogenomics 关联 | 预训练影像骨干 + 组学特征拼接/协同注意力 | 影像 embedding + 蛋白组矩阵 | 样本量小,宜冻结大部分参数 |
| 生存建模 | Cox-PASNet 类/深度 Cox | 影像+组学特征 | 生存标签经 PDC Clinical 导出 |
§6.8 硬件需求
| 场景 | GPU | 内存 | 磁盘 |
|---|---|---|---|
| 单队列 CT 预处理+2D 实验 | 1×24 GB(如 RTX 4090) | 64 GB | 500 GB |
| 3D 分割(nnU-Net) | 1×40 GB(A100 40G) | 128 GB | 1 TB |
| WSI MIL 训练 | 1×40 GB | 128 GB | 1.5 TB(含 patch 缓存) |
| 泛癌四队列联合 | 2×40 GB(数据并行) | 256 GB | 2 TB |
§6.9 评估指标代码
import numpy as np, torch
def dice_score(pred: torch.Tensor, gt: torch.Tensor, eps=1e-6):
"""3D 分割 Dice;pred/gt 为同形状二值张量"""
inter = (pred & gt).sum().float()
return (2 * inter + eps) / (pred.sum().float() + gt.sum().float() + eps)
def concordance_index(risk: np.ndarray, times: np.ndarray, events: np.ndarray):
"""生存模型 C-index(无 lifelines 依赖的简化实现)"""
n = 0; total = 0.0
for i in range(len(times)):
for j in range(len(times)):
if times[i] < times[j] and events[i] == 1:
n += 1
total += 1.0 if risk[i] > risk[j] else 0.5 if risk[i] == risk[j] else 0.0
return total / n if n else float("nan")
§6.10 MLOps 笔记
- 版本化:以"集合+版本日期"为数据版本键(如 cptac-pda@2025-02-26),任何实验记录必须绑定该键;TCIA 集合会修订(CCRCC 2025-07、PDA V15),静默升级会破坏可复现性。
- 许可合规入 CI:把"集合→许可→是否允许导出衍生特征"做成配置并在流水线启动时校验,防止 Limited 队列数据意外流入公开仓库。
- 配对率监控:每次重跑先重算"入组 N / 有影像 n / 配对 m"三个计数并与历史比对,配对率突变通常意味着集合修订或 PDC 版本更新。
- DUA 与致谢:论文与仓库按 §9.3 格式携带 Data Citation 与 CPTAC 致谢声明,这是许可的明文要求。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 转诊偏倚 | 三级学术中心、拟行根治手术人群,不代表全体患者谱 | 中 | 外部验证时混入社区医院数据 |
| 配对幸存者偏倚 | 影像-组学配对子集非随机(发布时序、队列阶段影响) | 高 | 坑点 1 的三计数报告 + 加权敏感性分析 |
| 设备/协议异质 | 多厂商多协议是设计使然,模型可能学设备指纹 | 高 | 站点留一验证;对抗性设备归一化 |
| 阶段划分偏倚 | Discovery/Confirmatory 阶段人群与年代不同 | 中 | 按队列阶段分层评估 |
| 标注覆盖不均 | 分割标注仅 4 队列部分受试者 | 中 | 坑点 8 的子集隔离策略 |
§7.2 标注质量
病理诊断与分子标签经 CPTAC qualification workflow 质控,是同行评审论文的支撑数据,可靠性高;3D 分割由 NCI 组织的标注项目生成,官方未公布逐例标注者间一致性指标,建议使用者自行抽样复标(例如随机抽 20 例双人复标 Dice)后再将分割结果用于主结论。种子点与分割的语义差异(稀疏提示 vs 完整轮廓)务必在数据管线中显式区分。
标注质量的三层验证流程(推荐用于任何以分割为主结论的研究):第一层,完整性检查——统计每个受试者的 mask 是否存在、体素数是否为零、是否超出影像边界,这三类异常在跨中心标注中并不罕见;第二层,一致性抽样——随机抽 15–20 例由第二名标注者复标,计算 Dice 与 Hausdorff 距离,若 Dice 低于 0.85 则该标注的误差量级已可与模型间差异相比,主结论必须谨慎;第三层,下游敏感性——用同一模型在"原始标注"与"清洗后标注"上各训练一次,若性能差异显著,说明结论对标注噪声敏感,应报告两个数值而非只报较优者。
§7.2b 标签噪声的已知来源
结合官方文档与数据设计特征,标签噪声主要来自四处:(1)多站点病理复核差异——组织学亚型的边界情形(如低分化腺癌与鳞癌的鉴别)在不同病理团队间可能存在判断差异;(2)分割边界的主观性——肿瘤边界在影像上常不清晰(尤其胰腺与脑肿瘤的浸润区),不同标注者对"包含水肿区与否"的判定不一致;(3)临床随访字段的录入差异——生存时间与事件状态依赖各站点研究协调员的随访工作,随访丢失会表现为删失而非失败;(4)分组标签的时序性——Discovery/Confirmatory 是发布时的分组,与患者本身的分子特征无必然联系,误当分类标签会导致完全无意义的模型。
§7.3 泛化性
| 外推场景 | 失效风险 | 证据/机理 |
|---|---|---|
| 学术中心 → 社区医院 | 高 | 设备、协议、人群谱差异;本数据集全部来自学术中心 |
| 美国人群 → 其他地区人群 | 中-高 | 人群遗传背景与就诊模式差异;种族分布以 PDC 导出为准 |
| 术前 CT → 随访 CT | 中 | 时点与治疗状态改变影像表观;(0012,0050) 可对齐但分布漂移真实存在 |
| 单队列训练 → 跨癌种推理 | 高 | 解剖部位与窗位差异;需多队列混合训练或域自适应 |
| 本数据集 → BraTS 类专精基准 | 中 | CPTAC-GBM 影像已用作 BraTS 2021 训练源,衔接可行但需模态对齐 |
§7.4 伦理
全部影像经 HIPAA 合规脱敏:移除直接标识、日期随机偏移 3–10 年(站点/集合内一致、纵向间隔保留)。2022-01-06 起,因面部可重建性风险,脑、头、头颈部集合升级为 Limited Access License,要求注册并签署协议后方可获取(TCIA API guides)。组学层:蛋白组与临床数据经 PDC 开放;原始基因组数据 dbGaP 受控(phs001287),需按 GRU 条款申请(Cancer Cell 2023)。使用时须遵守 CPTAC Data Use Agreement 并携带 §9.3 规定的致谢声明。
§7.5 公平性
CPTAC 队列以美国学术中心人群为主,种族、性别、社会经济分布记录于 PDC Clinical 导出中,官方未发布公平性专项分析。建模前建议按人口学分层审计各子队列的影像质量与标签分布;对低代表性群体,避免报告总指标掩盖子组性能差异。数据集不含图像中的人脸之外的自我声明敏感属性,公平性审计依赖临床表的完整性。
§7.6 数据漂移
三个天然漂移源:(1)集合修订漂移——CCRCC 2025-07、PDA V15 等修订会增删检查与序列,特征统计随之变化,需以版本键锁定;(2)扫描年代漂移——CPTAC-2/-3 招募跨约十年,扫描设备代际更替隐含在数据中,可用偏移后的纵向间隔间接还原年代结构(绝对年代不可用);(3)发布节奏漂移——影像与组学分批发布,任何时点的"配对全集"都是动态快照,生产系统应把配对率当受监控指标。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 影像为 DICOM 层级结构而非宽表;临床数据需经 PDC 导出自行拼宽表 |
| 2 | 唯一标识 | ✅ | PatientID 跨 TCIA/PDC/GDC 一致,为设计级保证 |
| 3 | 特殊字符 | ✅ | DICOM 与 SVS 元数据遵循标准字符集,未见编码异常记录 |
| 4 | 重复行 | ✅ | 受试者级无重复;同患者多检查为纵向设计而非数据错误 |
| 5 | 缺失编码 | ✅ | DICOM 空标签与 PDC 表格缺失语义清晰可辨 |
| 6 | 标签标识 | ⚠️ | 无集中标签文件;队列/子集归属需从目录与集合页推断 |
| 7 | 罕见类分组 | ⚠️ | 组织学亚型长尾分布,无官方分组指引 |
| 8 | 偏倚评估 | ⚠️ | 官方无偏倚报告;§7.1 为本条目基于设计特征的分析 |
| 9 | 数据字典 | ✅ | DICOM 标准字典完备 + 各集合页有字段说明 |
| 10 | 信息性缺失解释 | ⚠️ | 影像缺号与组学缺号的因果需按 §4.5 自行判读 |
| 11 | 设备记录 | ✅ | Manufacturer/Model/协议标签完整保留,异质性本身即研究素材 |
| 12 | 共线性 | ✅ | 原始层无合成特征;高维组学特征共线性属下游建模职责 |
| 13 | 编码映射 | ✅ | 临床诊断编码随 PDC/GDC 提供,与 ICD/SNOMED 可映射(见 §2.1) |
| 14 | 时间戳处理 | ⚠️ | 日期偏移 3–10 年 + (0012,0050) 相对天数并存,误用风险高(坑点 3) |
| 15 | 划分建议 | ⚠️ | 无官方 ML 划分;Discovery/Confirmatory 非划分,易混淆(坑点 4) |
| 16 | 泄漏讨论 | ⚠️ | 无官方讨论;患者级/站点级/跨库三类泄漏需按 §5.3 自防 |
| 17 | 标签分布 | ⚠️ | 无集中标签,分布须自行统计并与 PDC 交集 |
| 18 | 测量偏倚 | ⚠️ | 多中心多厂商协议差异真实存在(§3.9),官方无校正参考值 |
| 19 | 外部验证建议 | ✅ | 官方 wiki 明确记录 CPTAC-GBM 与 BraTS 2021 的衔接路径 |
| 20 | 版本记录 | ✅ | 每集合带 DOI 与版本化修订记录(PDA V15、CCRCC 2025-07) |
| 21 | 预处理脚本 | ✅ | TCIA 官方提供读取 DICOM+标注、生成 radiomics 特征的 notebook |
| 22 | 合规要求 | ✅ | CC BY/Limited Access License/CPTAC DUA/dbGaP 四层许可文档清晰 |
| 23 | 多模态对齐 | ⚠️ | 影像-组学经 PatientID 对齐,但时点需用 (0012,0050) 自行处理 |
| 24 | 去标识化 | ✅ | HIPAA Safe Harbor + 日期偏移 + 面部可重建性管控(Limited Access) |
DAIMS 评分:18.5 / 24(✅ 13 项、⚠️ 11 项、❌ 0 项)
评分解读:得分结构呈"基础设施强、分析就绪弱"——标识体系、版本管理、合规文档、脱敏机制、官方预处理脚本等基础设施项全部达标(无一项 ❌),这在公开影像数据集中属第一梯队;失分集中在"分析就绪"侧:无 ML 划分、无集中标签、配对率有限、时点与许可的易误用点密集。换言之,把它当"高质量原始影像-组学资源"名副其实,当"开箱即用的 ML 基准"则会处处碰壁。
对你意味着什么:(1)项目排期上,把至少 30% 工时预算给"数据工程"——manifest 构建、配对率审计、ID 映射与许可合规,这部分没有官方成品;(2)第一周先跑通 §6.1 快速上手并产出"受试者×模态×时点"统计矩阵,再决定切入哪个队列;(3)凡是涉及绝对日期的特征或结论一律改为相对天数口径,否则后期返工成本极高;(4)如需 GBM 或 HNSCC,把"申请许可"作为项目里程碑而非杂务,其前置周期会直接影响整体进度。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| BraTS 2021 | 多中心 MICCAI 挑战赛 | 脑肿瘤分割与 MGMT 分类 | Dice 等分割指标 | 需模态对齐后评估 | CPTAC-GBM 的 DICOM 为 BraTS 2021 训练数据源之一(TCIA wiki) |
| 泛癌蛋白基因组资源(跨 10 癌种) | NCI CPTAC / GDC / PDC / TCIA | 影像与分子层的联合可复现性 | 资源规模与可及性 | — | 官方明确 TCIA 为 NCI CRDC 组成、CDS 泛癌数据经 dbGaP 受控(Cancer Cell 2023) |
本矩阵只录入有同行评审或官方 wiki 支撑的衔接证据;本数据集自身的模型排行榜见 §8.1。
§8 基准性能与生态
§8.1 排行榜
重要前提:本数据集没有官方评测协议,也没有统一的划分、指标或输入预处理;不同论文的数值不可直接比较——差异可能来自队列选择(哪几个癌种)、配对子集(用多少例)、模态过滤(是否只用 CT)、分割标注覆盖率等。下表汇总有同行评审支撑、并在论文数据可得性声明中明确引用 CPTAC 影像/组学的代表性结果:
| 排名 | 模型/研究 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| — | LSCC 蛋白基因组图谱(含影像-分子关联分析) | 发现 FGFR1 扩增肿瘤中 NSD3 为替代驱动 | 2021 | 蛋白组+基因组+影像联合分析 | Satpathy S, et al. Cell. 2021;184(16):4348-4371.e40. DOI: 10.1016/j.cell.2021.06.031 | 见论文 Data Availability |
| — | PDA 蛋白基因组刻画 | 多组学亚型与免疫特征刻画 | 2021 | 蛋白质组+磷酸化+糖基化 | Cao L, et al. Cell. 2021;184(20):5031-5052.e26. DOI: 10.1016/j.cell.2021.08.023 | 见论文 |
| — | GBM 蛋白基因组与代谢组刻画 | 亚型与代谢特征关联 | 2021 | 蛋白组+代谢组+影像 | Wang LB, et al. Cancer Cell. 2021;39(4):509-528.e20. DOI: 10.1016/j.ccell.2021.02.010 | 见论文 |
| — | 泛癌蛋白基因组资源 | 10 癌种、逾 1,000 例原发肿瘤的系统刻画 | 2023 | 统一处理与跨癌种资源整合 | Cancer Cell. 2023. DOI: 10.1016/j.ccell.2023.06.009 | 见论文 |
| — | 泛癌翻译后修饰分析 | 1,110 例、11 种癌症类型的调控模式 | 2018 | 翻译后修饰泛癌整合 | Geffen Y, et al. Cell Reports. 2018. | 见论文 |
数值不可直接比较的原因已在表前说明;引用上述结果时必须同时报告所用队列、受试者数与模态过滤条件。
§8.2 SOTA 总结与选型建议
本数据集上的"最佳方法"高度依赖任务定义。经验法则:(1)分割任务优先用 nnU-Net 类自配置框架,因为异质层厚与多厂商场强对人工调参极不友好;(2)WSI 分类优先用 MIL 而非全图 CNN,因为玻片级标签是天然弱监督设定;(3)radiogenomics 关联优先用冻结的影像基础模型 embedding + 简单回归/秩相关,小配对样本量下训练深层融合网络的过拟合风险远高于收益;(4)生存建模优先用 Cox 类而非纯深度模型,样本量对参数量的比值太低。以上均以 §5.3 的受试者级划分为前提。
§8.3 评测协议
在无官方协议的情况下,建议采用如下最小可复现协议:受试者级划分(训练/验证/测试 = 70/15/15,固定种子并公开 PatientID 清单)→ 所有影像预处理参数只在训练集统计 → 报告主指标时同时给出按队列、按模态、按站点的分层结果 → 分割任务须显式声明"有标注子集"容量并给无标注子集的外推估计。协议全文应写入论文附录并在仓库中提供配置。
§8.4 相关数据集
| 数据集 | 关系 | 官方英文名 |
|---|---|---|
| CPTAC 蛋白基因组主资源 | 组学侧对应物,经 PDC/GDC 获取 | CPTAC / PDC / GDC |
| 癌症影像档案馆其他集合 | 同托管平台 | The Cancer Imaging Archive (TCIA) |
| 泛基因组学癌症图谱 | 同癌种可比队列(无系统影像) | TCGA |
| 脑肿瘤分割挑战数据 | 与本数据集 GBM 队列衔接 | BraTS |
| 肺结节 CT 参考集 | 影像标注深度可比 | LIDC-IDRI |
如何选用这些相关资源:若研究问题是"影像-分子关联的泛化性",主集用 CPTAC 影像、对照集用 TCGA 影像(若有)或 TCGA 组学,检验关联方向是否一致;若研究问题是"分割算法鲁棒性",主集用 CPTAC 的 4 个已标注队列、对照集用 BraTS(脑)或 LIDC-IDRI(肺),因为后两者标注深度远高于前者,可作为上限参照;若研究问题是"多模态融合方法",CPTAC 的放射+病理+组学三模态结构比多数公开集更完整,但配对样本量小,建议与配对更充分的模态组合(如影像+临床)做消融比较。
§8.5 关键论文 Top 6
- Satpathy S, et al. A proteogenomic portrait of lung squamous cell carcinoma. Cell. 2021;184(16):4348-4371.e40. DOI: 10.1016/j.cell.2021.06.031. — LSCC 蛋白基因组图谱,含影像-分子关联;数据经 TCIA/PDC000232-237/dbGaP phs001287(PubMed)。
- Cao L, et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 2021;184(20):5031-5052.e26. — PDA 多组学刻画,对应 CPTAC-PDA 影像集合(Cell)。
- Wang LB, et al. Proteogenomic and metabolomic characterization of human glioblastoma. Cancer Cell. 2021;39(4):509-528.e20. — GBM 多组学与代谢组刻画(Cell)。
- Cancer Cell (CPTAC 泛癌资源工作组). Proteogenomic data and resources for pan-cancer analysis. Cancer Cell. 2023. — 泛癌资源与 CDS/dbGaP phs001287 受控数据说明(Cell)。
- Geffen Y, et al. Pan-cancer analysis of post-translational modifications reveals shared patterns of protein regulation. Cell Reports. 2018. — 1,110 例、11 种癌症类型的泛癌 PTM 分析(NLIWOD)。
- Clark K, et al. TCIA: Maintaining and Operating a Public Information Repository. J Digit Imaging. 2013;26(6):1045-1057. DOI: 10.1007/s10278-013-9622-7. — TCIA 平台本体与运维的奠基引用(TCIA)。
§8.6 社区活跃度
TCIA 设有 CPTAC Imaging Special Interest Group(SIG)并举办系列 webinar(2020-02-04 CCRCC 蛋白基因组专场、2020-05-13 GBM 专场),说明存在持续的官方社区运营(CCRCC 页)。组学侧的社区工具以 PayneLab 的 cptac 包为代表,提供 Python/R 统一访问与 Colab 教程(NCI 工具页)。与单一大型挑战赛型数据集(如 BraTS)相比,CPTAC 影像的社区形态是"多队列、多论文带动的分散使用",因此没有集中的 issue 追踪区——这也是其缺少统一基准的原因之一。
社区参与方式:一是通过 TCIA 集合页的问题反馈渠道报告数据异常(如序列缺失、标签错误),这类反馈会随集合修订进入下一版本;二是通过 PDC/GDC 的数据门户提交组学侧问题;三是把可复现的处理流程开源,因为官方 notebook 覆盖的是读取与特征生成的基础环节,从原始 DICOM 到可训练张量的"最后一公里"仍依赖社区各自实现。对希望贡献的团队,最有价值的产出是公开的划分清单 + 预处理配置,它们直接解决了本数据集最突出的可复现性缺口。
§8.6b 生态成熟度评估
按平台文档、工具链、基准、社区四维评估本数据集的生态成熟度:平台文档成熟度高——各集合页给出规模、DOI、许可、更新时间与下载链接,TCIA API 有完整指南;工具链中等——DICOM 与 WSI 的通用工具(pydicom、SimpleITK、openslide)可直接用,但缺乏官方的一站式预处理与加载库;基准薄弱——无官方划分、无统一评测协议、无维护中的排行榜,跨论文数值不可比;社区分散——有 SIG 与 webinar,但没有集中的 issue 区与贡献指南。综合判断:这是一个"数据质量高、工程配套中、基准空白"的资源,其使用成本主要落在工程侧而非数据侧。
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态 | 推荐理由 |
|---|---|---|---|---|
| TCIA CPTAC 影像总览 | 官方入口 | https://www.cancerimagingarchive.net/?p=53438/ | 持续维护 | 3D 标注公告与 notebook 均在此 |
| TCIA API guides | 官方文档 | https://www.cancerimagingarchive.net/tcia-api-guides/ | 持续维护 | 许可变更与 API 使用的最新依据(坑点 2) |
| PDC 门户 | 组学数据 | https://pdc.cancer.gov | 持续维护 | 蛋白组矩阵与临床导出的主入口 |
| GDC CPTAC 页 | 基因组数据 | https://gdc.cancer.gov/node/1179 | 持续维护 | 基因组与受控访问的入口 |
| PayneLab cptac | 社区工具 | https://github.com/PayneLab/cptac | 活跃 | 统一访问 CPTAC 蛋白基因组数据 |
§9 相关资源与引用
§9.1 官方资源
- TCIA CPTAC 影像总览:https://www.cancerimagingarchive.net/?p=53438/ —— 集合导航、3D 标注公告、官方 notebook 入口。
- 各队列集合页:CPTAC-CCRCC、CPTAC-GBM、CPTAC-LSCC、CPTAC-PDA。
- TCIA API guides:https://www.cancerimagingarchive.net/tcia-api-guides/ —— 许可体系与 API 用法。
- PDC 门户:https://pdc.cancer.gov —— 蛋白组与临床数据。
- GDC CPTAC 页:https://gdc.cancer.gov/node/1179 —— 基因组数据入口。
- NCI 计算工具页:https://dctd.cancer.gov/data-tools-biospecimens/calculators-computational-tools/proteomics-computational-tools —— 蛋白组学工具清单。
- IDC 集合镜像:https://portal.imaging.datacommons.cancer.gov/collections/cptac_luad/ —— 部分队列在 NCI Imaging Data Commons 的镜像入口,可用于云上分析。
- 社区工具仓库:https://github.com/PayneLab/cptac —— CPTAC 蛋白基因组数据的统一访问包。
§9.1b 推荐的学习路径
按下列顺序推进可在最短时间内建立对本数据集的正确认知:第一步,读 TCIA CPTAC 总览页,弄清有哪些集合、各自访问级别与 3D 标注覆盖情况;第二步,选单个队列(建议 CPTAC-CCRCC)完整走通 §6.1 → §6.3 → §6.4 的流程,产出一张"受试者×模态×时点"统计表;第三步,把 §6.5 的 8 个坑点逐条在自己的管线上复现一次(有意识地制造错误再修正),这比读十遍文档更有效;第四步,接 PDC 导出做一次最小 radiogenomics 关联(如影像体积 vs 蛋白组某一通路评分),重点不是性能而是走通配对与统计流程;第五步,按 §8.3 的协议设计正式实验并落盘划分清单。跳过前三步直接做第四步,是新手最常见的失败模式。
§9.2 BibTeX 引用
% 数据集本体(按集合分别引用,DOI 随版本更新;示例为 CPTAC-CCRCC)
@misc{cptac_ccrcc_tcia,
author = {National Cancer Institute Clinical Proteomic Tumor Analysis Consortium},
title = {CPTAC-CCRCC Imaging Collection},
year = {2018},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/k9/tcia.2018.oblamn27},
url = {https://www.cancerimagingarchive.net/collection/cptac-ccrcc/}
}
% 平台本体
@article{clark2013tcia,
author = {Clark, Kenneth and Vendt, Bruce and Smith, Kirk and others},
title = {The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public Information Repository},
journal = {Journal of Digital Imaging},
volume = {26},
number = {6},
pages = {1045--1057},
year = {2013},
doi = {10.1007/s10278-013-9622-7}
}
% 代表论文(LSCC 蛋白基因组图谱,影像经 TCIA)
@article{satpathy2021lscc,
author = {Satpathy, Shankha and others},
title = {A proteogenomic portrait of lung squamous cell carcinoma},
journal = {Cell},
volume = {184},
number = {16},
pages = {4348--4371.e40},
year = {2021},
doi = {10.1016/j.cell.2021.06.031}
}
§9.3 引用与致谢指南
- 引用数据集:按集合分别引用对应 DOI(含版本号),而非只引本条百科或单一论文(PDA 页)。
- 必附致谢声明(逐字使用):“Data used in this publication were generated by the National Cancer Institute Clinical Proteomic Tumor Analysis Consortium (CPTAC).”(PDA 页)
- 受限集合:从 Limited Access 集合取得的影像,其致谢与再分发限制以所签协议为准;不得把受限集合影像并入公开再分发包(TCIA API guides)。
- 组学侧:蛋白组矩阵与临床注释遵守 CPTAC Data Use Agreement;dbGaP 受控数据的使用须遵守所获批件的条款。
- 方法学引用:若使用官方 notebook 或 radiomics 流程,建议同时引用方法学原文与 TCIA 平台论文(Clark 2013)。
§10 AI 使用声明卡
§10.1 AI 模型列表
本条目由千方病案医学编辑部的人机协作流程产出:语义组织、章节撰写与代码示例由大语言模型辅助生成;事实核验、数字校订、编码映射审定与医学表述终审由编辑部人工完成。撰文过程中使用的检索与核验工具为公开网络检索与官方数据集页面直接查阅。
§10.2 AI 参与范围
AI 参与:§1 概览叙事、§2 医学背景初稿、§3–§5 规格与结构整理、§6 代码骨架与坑点归纳、§7 DAIMS 表格的初评、§8–§9 引用整理。人工负责:所有事实性数字的逐条回溯验证、ICD-11 与 SNOMED CT 编码审定、许可条款表述、§10.4 校验表填写与最终发布决定。
§10.3 输入来源列表
- TCIA CPTAC 影像总览页 — https://www.cancerimagingarchive.net/?p=53438/
- TCIA CPTAC-CCRCC 集合页 — https://www.cancerimagingarchive.net/collection/cptac-ccrcc/
- TCIA CPTAC-GBM 集合页 — https://www.cancerimagingarchive.net/collection/cptac-gbm/
- TCIA CPTAC-LSCC 集合页 — https://www.cancerimagingarchive.net/?p=45043
- TCIA CPTAC-PDA 集合页 — https://www.cancerimagingarchive.net/?p=45161/
- TCIA API guides(许可体系) — https://www.cancerimagingarchive.net/tcia-api-guides/
- IDC CPTAC-LUAD 集合页 — https://portal.imaging.datacommons.cancer.gov/collections/cptac_luad/
- CPTAC 影像 2021 社区快照统计 — http://yuanpinz.github.io/blog/machine learning/2021/09/29/cptac.html
- CPTAC-COAD 病理集合 wiki — http://wiki.cancerimagingarchive.net/pages/viewpage.action?pageId=70227852
- CPTAC-GBM 与 BraTS 衔接说明 — http://wiki.cancerimagingarchive.net/plugins/viewsource/viewpagesrc.action?pageId=133073473
- Satpathy S, et al. Cell 2021(LSCC) — https://pubmed.gov/34358469/
- Cancer Cell 2023 泛癌资源论文 — https://www.cell.com/cancer-cell/fulltext/S1535-6108(23)00219-2
- Cao L, et al. Cell 2021 / Wang LB, et al. Cancer Cell 2021 — https://www.cell.com/cell-systems/fulltext/S2405-4712(23)00214-4
- Geffen Y, et al. Cell Reports 2018(泛癌 PTM) — https://nfdi-search.nliwod.org/researcher-details/orcid:0000-0002-9526-8194/source-id:0000-0002-9526-8194
- Clark K, et al. J Digit Imaging 2013(TCIA 平台) — https://stage.cancerimagingarchive.net/?p=2361/
- Scientific Data 2017(TCIA 公开放射影像集合) — https://www.nature.com/articles/sdata2017124
- NCI 蛋白组学计算工具页(PayneLab cptac) — https://dctd.cancer.gov/data-tools-biospecimens/calculators-computational-tools/proteomics-computational-tools
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 逐条回溯 TCIA 集合页与快照统计 | ✅ 已验证 |
| §2 ICD-11 与 SNOMED CT 映射 | 千方病案医学编辑部 | 对照 WHO ICD-11 MMS 与 FHIR 术语服务核实 | ✅ 已通过 |
| §3 规格与版本台账 | 千方病案医学编辑部 | 对照各集合页 DOI 与更新日期 | ✅ 已验证 |
| §4 数据结构与 DAIMS 字典 | 千方病案医学编辑部 | 对照 DICOM 标准与集合页字段说明 | ✅ 已通过 |
| §5 划分与泄漏分析 | 千方病案医学编辑部 | 对照论文数据可得性声明复核 | ✅ 已通过 |
| §6 代码与坑点(8 项) | 千方病案医学编辑部 | 代码语法检查 + 坑点逐条对照官方文档 | ✅ 已验证 |
| §7 DAIMS 24 项与偏倚分析 | 千方病案医学编辑部 | 双人复核打分与理由 | ✅ 已通过 |
| §8 论文引用与生态 | 千方病案医学编辑部 | 对照 PubMed/期刊页面核对题录 | ✅ 已验证 |
| §9 引用与致谢指南 | 千方病案医学编辑部 | 对照 TCIA/CPTAC 官方要求逐字比对 | ✅ 已通过 |
| §10 声明卡完整性 | 千方病案医学编辑部 | 对照编辑规范检查字段齐全 | ✅ 已通过 |
§10.5 AI 生成章节标注
本条目为 AI 辅助撰写并经人工审校的成果,其中代码骨架(§6.1–§6.4、§6.9)与表格初稿由 AI 生成后经数据工程师核改;医学描述(§2)与合规表述(§0、§9.3)以官方文档与文献原文为准,AI 初稿仅作结构组织之用。全篇无未标注的 AI 独有结论。
§10.6 最后人工审核日期
最后人工审核日期:2026-09-18(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- tcia — 共享标签:医学影像 / CT / MRI / 肿瘤学
- idc — 共享标签:医学影像 / CT / MRI / 肿瘤学
- synthrad — 共享标签:医学影像 / CT / MRI / 肿瘤学
- chimera — 共享标签:医学影像 / MRI / 病理图像 / 肿瘤学
- autopet — 共享标签:医学影像 / CT / 肿瘤学
- ucsf-pdgm — 共享标签:医学影像 / MRI / 肿瘤学
- lung-pet-ct-dx — 共享标签:医学影像 / CT / 肿瘤学
- fets — 共享标签:医学影像 / MRI / 肿瘤学
- medpix — 共享标签:医学影像 / CT / MRI
- ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

