TCIA — 全球开放癌症影像总库 AI-Ready Wikipedia

287 个数据集、3,090 万+ 张 DICOM 的开放癌症影像总库

来源 美国国家癌症研究所(NCI)癌症影像计划(CIP) url: https://www.cancerimagingarchive.net/发布时间: 2026-09-18最后更新: 2026-09-25 阅读 29
TCIA — 全球开放癌症影像总库 AI-Ready Wikipedia

信息速览

数据集名称TCIA — 全球开放癌症影像总库 AI-Ready Wikipedia
数据类型287 个已发布数据集,3,090 万+ 张 DICOM(2017 口径),约 3.8 万名受试者(2017 口径),CC BY 3.0 为主,公开下载
规模约 37,568 名受试者(2017 年口径,持续增长)
接入方式美国国家癌症研究所(NCI)癌症影像计划(CIP) url: https://www.cancerimagingarchive.net/
AI 就绪度

癌症影像档案库 TCIA — 全球最大开放癌症影像总库 AI-Ready Wikipedia

INFOBOX

数据集名称 The Cancer Imaging Archive(TCIA)
英文全称 The Cancer Imaging Archive
别名/简称 TCIA、Cancer Imaging Archive、NBIA 归档(旧称)
疾病分类 恶性肿瘤全谱系(ICD-11:2C25 气管或支气管原位及以上肺恶性肿瘤 / 2C60 乳腺恶性肿瘤 / 2B91 结肠恶性肿瘤 / 2A00 脑恶性肿瘤等多系统)
SNOMED CT 363346000 Malignant neoplastic disease (disorder);集合级形态学标注多用 ICD-O-3 编码(详见 §2)
数据模态 CT、MR、PET、数字病理(SVS/NDPI/TIFF)、CR/DX、RTSTRUCT/RTPLAN/RTDOSE
AI 任务类型 肺结节检测、肿瘤分割、影像组学预后预测、癌症分型分类、多模态融合、图像质量与可重复性研究
样本总数 287 个已发布数据集 / 约 37,568 名受试者(2017 年口径)/ 3,090 万+ 张影像(2017 年口径)
数据大小 单集合 8.6 MB(标注)至 2,100 万+ 张切片(NLST);全库年下载量近 5 PB
数据格式 DICOM(放射影像主格式)、XML(专家标注)、CSV/XLSX(临床表)、SVS/NDPI/TIFF(病理)、NIfTI/MHA(部分衍生数据)
许可证 CC BY 3.0 Unported(历史默认)/ CC BY 4.0(新集合主流)/ 个别 CC BY-NC 3.0 或 NIH 受控访问
访问级别 开放(绝大多数集合,无需登录)/ 申请审核(少数受控集合)
DUO 标签 GRU, NRES(多数公开集合);NCU(非商业许可集合)
语言 英文
首发日期 2011 年(NCI 启动 TCIA 服务;2013 年发表创建论文)
最后更新 持续滚动更新(截至 2026-09 仍有新集合与分析结果发布)
发布机构 NCI 癌症影像计划(CIP)资助 / Frederick National Laboratory for Cancer Research(FNLCR)管理 / 阿肯色大学医学科学部(UAMS)策展
官方主页 https://www.cancerimagingarchive.net/
下载地址 https://www.cancerimagingarchive.net/browse-collections/
DOI 10.1007/s10278-013-9622-7(创建论文);各集合经 DataCite 独立发证(前缀 10.7937)
引用次数 5,683+(Google Scholar,截至 2026-09,创建论文 Clark et al. 2013)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 工具链与文档生态顶尖(tcia_utils/pylidc/IDC)、DOI 引用规范;扣分项:无官方数据划分、需 DICOM 格式转换、跨集合许可与标注协议不统一
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、癌症筛查与影像组学临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(DICOM 层级标识符体系、跨集合元数据一致性)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 NCI、FNLCR、UAMS、Imaging Data Commons 无任何商业利益关联。本页面不销售 TCIA 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 NCI、FNLCR 或 UAMS 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。TCIA 多数集合采用 CC BY 3.0 或 CC BY 4.0 许可,要求使用者署名并引用对应集合的 DOI;部分集合(如 许可,要求使用者署名并引用对应集合的 DOI;部分集合(如 NSCLC-Radiomics)附加非商业条款,少数头部影像集合需按 NIH 受控数据访问)附加非商业条款,少数头部影像集合需按 NIH 受控数据访问政策申请。DUO 标签仅供参考,具体使用限制以每个集合页面 Citations & Data Usage Policy 选项卡为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? TCIA(The Cancer Imaging Archive,癌症影像档案库)是美国国家癌症研究所(NCI)资助、自 2011 年起运营的公开癌症影像总库。它把全球研究机构提交的癌症 CT、MR、PET、数字病理等影像统一去标识化后免费开放,按疾病、模态或研究焦点打包成一个个「集合」(collection),并为每个集合签发 DOI。截至 2026-09,它已发布 287 个数据集、支撑超过 3,400 篇出版物,2017 年口径下即收录约 3.8 万名受试者、3,090 万张影像,此后仍在持续增长。

为什么重要? 在 TCIA 出现之前,癌症影像研究被锁在各医院的 PACS 系统里,单中心数据既小又难共享。TCIA 用集中策展加统一去标识化的方式,第一次让「用同一份公开影像复现别人论文」成为可能。肺结节检测、影像组学、肿瘤分割等方向的大量经典工作——从 。肺结节检测、影像组学、肿瘤分割等方向的大量经典工作——从 LIDC-IDRI 到 NSCLC-Radiomics——都直接生长在这座档案 到 NSCLC-Radiomics——都直接生长在这座档案库上,它的去标识化流程已成为全球公认的最佳实践。

我能用它做什么? 训练和评测肿瘤检测、分割、分类模型;提取影像组学特征做预后预测;将影像与临床结局、基因组数据关联做多模态研究;或者直接把它当作医学影像入门教学素材。多数集合无需注册即可下载,配合 NBIA Data Retriever、REST API 或云平台 IDC,几分钟内就能拿到第一批切片。

§1.1 摘要

TCIA 是由 NCI 癌症影像计划(CIP)出资、Frederick National Laboratory for Cancer Research(FNLCR)合同管理、阿肯色大学医学科学部(UAMS)数据策展中心(DCC)具体运营的开放影像基础设施。研究团队向 TCIA Advisory Group 提交数据提案,经季度评审后由策展团队完成去标识化、质量保证与元数据整理,随后以「集合」形式发布并签发 DataCite DOI;社区提交的分割、影像组学特征等衍生数据则作为「分析结果」(Analysis Results)单独发布。放射影像以 DICOM 为标准格式(因其丰富的内嵌元数据支持 FAIR 原则),病理影像接受 SVS、NDPI、TIFF 等专有格式。访问方式覆盖四条通道:集合页直接下载、NBIA Data Retriever 配合 manifest 文件批量下载、NBIA REST API 程序化访问、以及云平台 Imaging Data Commons(IDC)的浏览器查看与 SQL 查询。许可逐集合标注,历史默认 CC BY 3.0,新集合趋向 CC BY 4.0,少数敏感数据走 NIH 受控通道。2013 年的创建论文(Clark et al., Journal of Digital Imaging)已被引用 5,683 次以上(截至 2026-09),官方统计的年度下载量接近 5 PB。

本条目结构导航:只想跑通第一个实验的读者直接看 §6.0-§6.1;做论文对比的读者重点看 §5(划分)与 §8.3(评测协议);关注数据治理与合规的读者重点看 §7.7(DAIMS 评估)与 §7.4(伦理);教学选材决策可参考 §1.5 场景与 §6.8 硬件需求表。

§1.2 战略价值分析

范式开创维度:TCIA 的价值远超「一个下载站」。它建立了癌症影像开放共享的完整工程范式——机构签署数据提交协议、策展方承担去标识化的法律责任、数据按集合发布并获得可引用 DOI、社区标注作为分析结果二次发布。这套流程后来被全球医学影像数据库广泛借鉴,其开源去标识化软件栈也被多家机构采纳为最佳实践。对期刊而言,TCIA 已成为公认的「数据发布者」,作者只需提供集合 DOI 即可满足数据可用性声明,这让它事实上成了癌症影像论文的公共基础设施。

临床 AI 推力维度:TCIA 上生长出的数据生态直接塑造了多个 AI 子领域的发展轨迹。肺结节方向,LIDC-IDRI 提供的四放射科医生两阶段标注催生了 LUNA16 挑战赛与延续至今的检测基准;预后方向,NSCLC-Radiomics(Lung1)队列支撑了影像组学概念的首个大规模临床验证(Aerts et al., 2014, Nature Communications);多模态方向,TCGA 影像集合把 21 个癌种的放射影像与基因组、病理数据打通,成为影像-基因组学(radiogenomics)的标准试验场。官方统计显示,基于 TCIA 数据的研究已产出 36 项美国专利与 3 个 FDA 批准的医疗器械(截至 2025-05),是少数能画出「公开数据到获批器械」完整链条的档案库。

两条使用心法:其一,把 TCIA 当作「集合群」而非「单一数据集」,任何跨集合操作前先读各集合页的采集与标注说明;其二,把「可引用性」当作一等公民——从第一个实验起就记录集合 DOI 与版本,论文写作与审稿响应阶段会加倍回报。

§1.3 同类数据集横向对比

对比项 TCIA IDC(云镜像) NLST(TCIA 版) 单中心私有 PACS 数据
定位 癌症影像总库(287 个集合) TCIA 公开 DICOM 数据的云上子集与门户 国家肺筛查试验影像(受控访问) 医院自采癌症影像
规模 3,090 万+ 张影像(2017 口径) 数十个 TB 级集合、持续同步 26,254 名受试者、2,100 万+ 张 CT 通常 10³-10⁴ 例
模态 CT/MR/PET/病理/放疗结构 以 DICOM 放射影像为主 低剂量 CT 依医院设备
标注 逐集合各异,含专家标注与分析结果 继承 TCIA 集合标注 筛查随访与确诊结局 自建标注
访问 无需登录(多数) Google Cloud 上的门户 + BigQuery 申请审核 内部审批
许可 CC BY 3.0/4.0 为主 继承源集合许可 受控 医院协议
版本机制 集合独立版本化(DOI 快照) 与 TCIA 源集合同步滚动 固定试验快照 依赖院内管理,通常无版本
差异化价值 集合种类最全、DOI 引用体系成熟 SQL 查询与云分析免下载 罕见的大规模筛查阴性对照 最贴合真实临床分布

§1.4 版本时间轴

时间 里程碑 说明
2011 TCIA 服务上线 NCI 以开源 NBIA 软件包为基础建立集中托管;首年即收录 23 个集合、330 万张影像
2013-12 创建论文发表 Clark et al. 于 Journal of Digital Imaging 26(6):1045-1057 发表运营论文(DOI 10.1007/s10278-013-9622-7)
2015-2017 规模扩张期 LIDC-IDRI、NSCLC-Radiomics、TCGA 影像系列等标志性集合陆续完整发布;2017 年数据描述论文口径达 3,090 万张影像、约 37,568 名受试者
2017-08 Prior et al. 数据描述论文 系统介绍 15 个公开集合与策展流程,确立「集合 + 分析结果」双轨发布
2020-09 LIDC-IDRI v4 维护更新 修正第三方文件混入下载清单的问题,标注 XML 与 DICOM 化结节表示并行提供
2022-2023 Python 工具链成熟 tcia_utils 包发布并持续迭代,覆盖 NBIA、PathDB、DataCite 三类接口
2025-10-30 NBIA v4 REST API 发布 官方提供 v2 至 v4 变更映射表;旧版 API 计划于 2026 年 10 月终止帮助台支持
2025-2026 云优先战略 公开 DICOM 数据访问重心转向 Imaging Data Commons(IDC);2026 年 NCI 报道已发布 287 个数据集

§1.5 典型应用场景

  1. 肺结节检测与恶性度预测:以 LIDC-IDRI 的四医生 XML 标注为金标准训练 3D 检测网络,按 LUNA16 协议在 10 折划分上报告 FROC 曲线,是肺结节方向的事实入门路径。
  2. 影像组学预后建模:用 NSCLC-Radiomics 的 422 例手工勾画 GTV 与临床结局复现 Aerts 影像组学签名,练习生存分析、特征稳定性检验与外部验证。
  3. 影像-基因组多模态融合:基于 TCGA 系列(如 TCGA-KIRC 267 例、TCGA-GBM 262 例)把 CT/MR 影像与基因表达、突变数据对齐,研究基因型-表型关联。
  4. 测量可重复性研究:利用 RIDER 系列的同日重复扫描(如 可重复性研究**:利用 RIDER 系列的同日重复扫描(如 RIDER Lung CT 32 例)量化分割与放射组特征的测试-重测稳定性,为模型申 32 例)量化分割与放射组特征的测试-重测稳定性,为模型申报提供依据。
  5. 教学与课程实践:多数集合无需注册、体量可按序列拆分下载,适合作为医学影像深度学习课程的数据底座;pylidc 与 TCIA Notebooks 提供开箱即用的教学示例。
  6. 放疗靶区与剂量建模:解析 NSCLC-Radiomics 与 RADCURE 随附的 RTSTRUCT/RTDOSE,训练自动 GTV 勾画模型或做剂量-结局关联分析,同时练习 DICOM-RT 结构与其他格式的相互转换。
  7. 设备偏倚与漂移研究:利用 DICOM 头完整保留的厂商、型号与重建核字段,加上 RIDER 系列的重复扫描设计,量化「设备捷径」对模型的影响,为跨中心部署前的域适应方案提供实验台。

§2 医学背景

§2.1 ICD-11 编码映射

TCIA 的 287 个集合横跨呼吸、消化、乳腺、神经、泌尿生殖、头颈与血液等多个系统的恶性肿瘤及部分癌前病变、体模与动物模型。下表列出核心癌种对应的 ICD-11 编码及其在 TCIA 中的代表性集合。

ICD-11 编码 中文名称 TCIA 代表性集合 备注
2C25 气管、支气管或肺恶性肿瘤 LIDC-IDRI、NSCLC-Radiomics、TCGA-LUAD、TCGA-LUSC、NLST TCIA 中集合数与文献量最多的癌种
2C60 乳腺恶性肿瘤 TCGA-BRCA、CMB-BRCA、ISPY 系列 影像含 MR 与 MG 两种模态
2B91 结肠恶性肿瘤 TCGA-COAD、CT-ORG 衍生标注 常与直肠癌合并研究
2C12 肝和肝内胆管恶性肿瘤 TCGA-LIHC、隐病灶标注衍生集 多与病理影像对齐
2C82 前列腺恶性肿瘤 PROSTATE-DIAGNOSIS、PROSTATE-MRI、CMB-PCA 多参数 MR 为主
2A00 脑恶性肿瘤(含胶质瘤) TCGA-GBM、TCGA-LGG、性肿瘤(含胶质瘤) TCGA-GBM、TCGA-LGG、UPENN-GBM 系列
2C30 皮 系列 部分头部影像走受控通道
2C30 皮肤黑色素瘤 CMB-MEL、TCGA-SKCM 相关影像 影像与皮肤镜数据并存
2B72 胃恶性肿瘤 TCGA-STAD 影像为常规诊疗 CT
2C10 胰腺恶性肿瘤 PDDCA、TCGA-PAAD 衍生集 分割基准常用
2D70 头颈部恶性肿瘤(口咽为主) RADCURE、CPTAC-HNSCC、TCGA-HNSC 含 RTSTRUCT 放疗结构

§2.1b SNOMED CT 映射

术语 ICD-11 SNOMED CT 在 TCIA 中的呈现
恶性肿瘤(顶层概念) 2A00-2F3Z 各章 363346000 Malignant neoplastic disease (disorder) 集合页 Primary Diagnosis 字段
肺原发性恶性肿瘤 2C25 254837009 Primary malignant neoplasm of lung LIDC-IDRI、NSCLC-Radiomics 诊断表
腺癌(形态学) 2C25.0 等 35917007 Adenocarcinoma TCGA 临床表用 ICD-O-3 形态学码 M-8140/3
浸润性导管癌(形态学) 2C60.3 71854001 Invasive ductal carcinoma TCGA-BRCA 病理对应 ICD-O-3 M-8500/3
鳞状细胞癌(形态学) 2C25.2 等 404641004 Squamous cell carcinoma TCGA-LUSC 对应 ICD-O-3 M-8070/3

说明:TCIA 集合本身的临床表并不统一使用 SNOMED CT——TCGA 系列沿用 ICD-O-3 形态学编码,部分试验集合使用自定义分期字段;上表用于跨库对照与本体对齐,实际建模时应以各集合页面说明为准。

§2.2 疾病简介与流行病学

癌症是全球第二大死因。按世界卫生组织 GLOBOCAN 2022 估计,全球每年新发癌症约 2,000 万例、死亡约 970 万例,其中肺癌新发约 248 万例居首位,乳腺癌、结直肠癌与前列腺癌紧随其后。影像学贯穿癌症「筛查-诊断-分期-疗效评估-随访」全流程:低剂量 CT 已被证明可将高危人群肺癌死亡率降低约 20%(NLST 试验结论,该试验影像在 TCIA 有受控版本);MR 与 PET 承担局部分期与全身评估;数字病理则是诊断的金标准。TCIA 的集合构成与这一临床图景高度对应——肺癌相关集合数量最多,乳腺、头颈、脑、前列腺次之,且多数集合同时附带分期、治疗与随访数据,可直接支撑从筛查到预后各环节的建模研究。

癌种 全球疾病负担(GLOBOCAN 2022 估计) 影像角色 TCIA 代表集合
肺癌 新发约 248 万例,居各癌种首位 低剂量 CT 筛查、分期与随访 LIDC-IDRI、NSCLC-Radiomics、NLST(受控)
乳腺癌 女性最常见新发癌种 钼靶与 MR 诊断、新辅助疗效评估 TCGA-BRCA(MR/MG)、Duke Breast Cancer MRI
结直肠癌 新发数居前三 CT/MR 分期 TCGA-COAD、TCGA-READ 影像子集
前列腺癌 男性最常见新发癌种之一 MR 定位与靶区 PROSTATE-DIAGNOSIS、QIN-PROSTATE
脑肿瘤 高致死神经肿瘤 MR 多序列分割与分级 TCGA-GBM、TCGA-LGG、UPENN-GBM
头颈鳞癌 烟酒相关主要癌种 CT/MR/PET 放疗定位 TCGA-HNSC、RADCURE
肾癌等其余癌种 按癌种分布 CT/MR 诊疗影像 TCGA-KIRC 等 TCGA 全系

值得注意的是集合构成与流行病学结构的错位:TCIA 以确诊与治疗人群为主,筛查自然患病率队列稀缺(NLST 受控版是主要例外),因此任何声称「筛查性能」的模型都需要显式做患病率校准(见坑点 7)。另外,GLOBOCAN 是全人群口径,而 TCIA 集合多来自三级医疗中心,疾病谱向晚期与复杂病例倾斜,用后者训练的模型在前者人群中的表现需要单独验证。

§2.3 临床任务定义

临床任务 定义 TCIA 支撑集合 常见 AI 表述
筛查 在无症状高危人群中检出早期病灶 LIDC-IDRI、NLST(受控)、SPIE-AAPM 挑战集 结节检测、良恶性分类
诊断与分期 明确病灶性质并评估侵犯范围 TCGA 系列、CMB 系列、VAREPOP-APOLLO 多模态分类、分期回归
肿瘤分割 勾画原发灶、转移灶与危及器官 NSCLC-Radiomics(RTSTRUCT)、PDDCA、UPENN-GBM 3D 分割、自动轮廓
预后预测 基于基线影像预测生存与复发 NSCLC-Radiomics、RADCURE、TCGA-HNSC 影像组学 + 生存分析
放疗靶区 放疗计划中的 GTV/CTV 勾画 RADCURE、NSCLC-Radiomics(RTSTRUCT) 分割 + 结构转换
影像-基因组关联 从影像预测分子表型 NSCLC-Radiomics genomics、TCGA 系列 radiogenomics 回归/分类
随访与复发监测 治疗后定期影像评估复发 RADCURE(含随访结局)、Lung1 随访时序建模、复发分类
体模/可重复性研究 设备与协议稳定性评估 RIDER、QIN 系列 特征稳定性回归、ICC 分析

§2.4 患者人群描述

维度 描述
数据来源 NCI 临床试验与项目(TCGA、CPTAC、NLST、NCTN)、学术医疗中心常规诊疗、专项研究采集、体模与动物模型
时间跨度 影像采集横跨约 30 年,各集合独立标注采集窗口
地域分布 以北美学术中心为主,含欧洲多中心(如 NSCLC-Radiomics 来自荷兰 MAASTRO)与亚洲中心;LIDC-IDRI 由 7 家学术中心 + 8 家影像设备商协作建成
年龄性别 以成人肿瘤患者为主体;儿童与青少年集合极少,性别分布随癌种自然分布
种族构成 多数集合未系统记录种族;TCGA 临床表含种族字段但影像子集未保证分布均衡
就医类型 三级学术医疗中心为主,包含筛查(NLST)、初治(Lung1)与放疗(RADCURE)等多种入组渠道
健康对照 筛查类集合含大量阴性受试者(NLST 受控版为主);多数治疗队列无健康对照,需要时从筛查集合补齐或另找公开健康 CT

§2.5 临床价值

对临床研究者,TCIA 提供了难得的「结局齐全」影像队列——如 Lung1 队列同时具备手工勾画肿瘤体积、分期、治疗与生存结局,可支撑从影像特征到临床决策的完整建模链。对算法开发者,LIDC-IDRI 的多位医生标注设计揭示了放射科阅读的观察者间变异,使模型评估不再依赖单一「真值」。对监管与转化研究,TCIA 的 DOI 引用体系使「模型在哪些公开数据上验证」可以被精确审计,官方统计的 36 项美国专利与 3 个 FDA 批准器械(截至 2025-05)说明这条从开放数据到临床器械的路径真实可行。对教学机构,它几乎是唯一能把「读片-标注-建模-评估」完整流程跑通且免许可成本的资源;对数据治理研究者,TCIA 的出资方-合同管理方-策展方三层分离结构,本身就是大型科学数据基础设施可持续运营的参考样本。

§2.6 金标准描述

集合 划分 标注方式 标注者 标注性质
LIDC-IDRI 无官方划分;社区按 LUNA16 十折 两阶段标注:先各自盲读、再互看标注后复核,不强制共识;三层标记(≥3 mm 结节 / <3 mm 结节 / 非结节) 4 位资深胸部放射科医生 × 1,018 例 专家级、保留个体差异
NSCLC-Radiomics(Lung1) 无官方划分 放疗计划流程中手工勾画 GTV,随 RTSTRUCT 发布 荷兰 MAASTRO 放疗团队 临床级、用于放疗定位
TCGA 系列影像 无划分 无病灶级标注;提供分期与病理确诊信息 各参与机构临床流程 临床伴随数据
RADCURE 无官方划分 临床放疗流程附带 RTSTRUCT 治疗机构放疗团队 临床级
RIDER 无划分 重复扫描设计本身即标注 不适用 可重复性金标准
UPENN-GBM 无划分 研究级人工结构分割(多参数 MR 配套发布) 宾夕法尼亚大学团队 研究级分割

表外集合多为「临床伴随数据」或「可重复性设计」,标注生态见 §3.5 三层级说明;凡表中未列的集合,默认不存在病灶级金标准,建模前先到集合页确认标注材料。


§3 数据集规格

§3.0 版本/集合抉择矩阵

TCIA 不是单一版本的数据包,而是一个持续生长的集合群。动手前请先按需求选择入口:

你的需求 推荐入口 大小 理由
肺结节检测入门与复现 LIDC-IDRI(或其派生 LUNA16 基准) 133.16 GB(1,010 例 / 244,527 张 CT) 四医生标注 + 十折社区划分 + 最大引用基数
NSCLC 影像组学与生存分析 NSCLC-Radiomics(Lung1) 约 33 GB(422 例 / 51,513 张) 手工 GTV + 完整临床结局,Aerts 2014 原始队列
多癌种影像-基因组融合 TCGA 系列(经 IDC 查询) 各癌种数 GB 至数十 GB 21 个癌种影像与 TCGA 分子数据按病例对齐
大规模云上分析、免下载 IDC Portal / idc-index 数十 TB 可按需切片 BigQuery 元数据 + 云存储,无需本地 NBIA
数字病理 AI Histopathology Portal(PathDB) 按集合,SVS/NDPI/TIFF 非 DICOM 病理专用门户
测量可重复性/测试-重测 RIDER 系列 单集合数十 GB 内 同日重复扫描的天然稳定性标尺
筛查阴性对照与患病率校准 NLST(TCIA 受控版) 2,100 万+ 张 CT 26,254 例筛查队列,需申请
放射-病理联合建模 CPTAC 系列 按队列数 GB 至数十 GB 同一队列同时提供 WSI 病理切片、影像与组学数据
单课时教学演示 SPIE-AAPM 挑战集或 RIDER 数 GB 以内 小体量、开放许可,单节课即可跑通全流程

§3.1 模态详情

模态 DICOM 缩写 代表集合 典型用途 注意事项
CT CT LIDC-IDRI、NSCLC-Radiomics、RADCURE 检测、分割、组学 层厚 0.6-5.0 mm 不等,重采样是必做项
MR MR TCGA-GBM、TCGA-BRCA、UPENN-GBM 神经与乳腺肿瘤分析 序列异质性强(T1/T2/FLAIR/DWI),需按序列筛选
PET PT RIDER Lung PET-CT、TCGA-HNSC 代谢评估、融合影像 多与 CT 同机融合,注意 SUV 标定差异
数字病理 无 DICOM 缩写 CPTAC 系列、CMB 系列、TCGA 病理切片 细胞核分割、分型 SVS/NDPI/TIFF 千兆像素级,需金字塔读取
X 线 CR/DX LIDC-IDRI 附属、TCGA-KIRC 附属 分类任务 仅少数集合含 X 线
放疗结构 RTSTRUCT/RTPLAN/RTDOSE NSCLC-Radiomics、RADCURE 靶区与剂量分析 是标签而非影像,需专门解析库

§3.2 按子集样本数统计

集合 癌种 受试者 研究/序列 影像数 许可 访问
LIDC-IDRI 肺 1,010 1,308 244,527(CT/DX/CR) CC BY 3.0 开放
NSCLC-Radiomics 非小细胞肺癌 422 740 51,513(CT) CC BY-NC 3.0 开放
TCGA-KIRC 肾透明细胞癌 267 — CT/MR/CR CC BY 3.0 开放
TCGA-GBM 胶质母细胞瘤 262 — MR/CT/DX CC BY 3.0 开放
TCGA-LGG 低级别胶质瘤 199 — MR/CT CC BY 3.0 开放
TCGA-HNSC 头颈鳞癌 192 — CT/MR/PT/RT 系列 CC BY 3.0 开放
TCGA-BRCA 乳腺癌 139 — MR/MG CC BY 3.0 开放
RADCURE 口咽癌为主 3,346 — CT + RTSTRUCT 受控 + CC BY 4.0 开放页面/受控数据
NLST(TCIA 版) 肺癌筛查 26,254 73,118 21,082,502(CT) 受控 申请审核
RIDER Lung CT 非小细胞肺癌 32 46 15,419(CT) CC BY 3.0 开放
SPIE-AAPM Lung CT Challenge 肺 70 — CT(附结节标注) — 开放

(表内数据截至 2026-09 经集合页面与文献核实;「—」表示该口径未随集合单列发布。)

§3.3 数据格式详情

数据类型 格式 组织方式 读取工具
放射影像 DICOM(.dcm,按序列打包) Collection > PatientID > StudyInstanceUID > SeriesInstanceUID pydicom、SimpleITK、ITK
下载清单 manifest 文本(manifestVersion 3.0) 列出 SeriesInstanceUID 与下载服务器 URL NBIA Data Retriever
专家标注(肺结节) XML(盲读 + 复核两轮坐标) 每例一份,随影像同目录 pylidc、标准 XML 解析
专家标注(DICOM 化) DICOM SEG / RTSTRUCT 作为独立序列发布 Highdicom、pydicom
临床结局 CSV/XLSX 每集合 1-3 张表 pandas
病理切片 SVS/NDPI/TIFF 集合页直接打包下载 OpenSlide、tifffile
衍生影像 NIfTI/MHA 部分分析结果集合提供 nibabel、SimpleITK
云端元数据 BigQuery 表(IDC 公开数据集) 按版本分表,SQL 可查 BigQuery SQL / idc-index

§3.4 存储与体量

TCIA 全库体量随集合增长而滚动扩大,官方未发布单一直接下载包。可核实的体量锚点:2017 年口径全库 3,090 万张影像;LIDC-IDRI 单集合 133.16 GB;NSCLC-Radiomics 约 33 GB;NLST 受控版 2,100 万+ 张 CT;全库年下载流量接近 5 PB(2025-05 官方口径)。规划磁盘时建议:目标集合 DICOM 体积 × 1.6(解压 + NIfTI 中间产物)+ 标注 XML 与临床表通常不足 1 GB。若使用 IDC 云访问,可完全不落盘本地副本,改为按需导出子集。

体量估算速查:

  • 冒烟验证:任选 3 个序列,通常不足 1 GB。
  • 单集合基准(LIDC-IDRI 量级):下载约 135 GB,落地含中间产物约 210 GB。
  • 多癌种仓库(TCGA 十余个癌种量级):预留 5-10 TB 起步。
  • 云替代方案:IDC 按需切片时本地仅需缓存,常规实验控制在百 GB 以内。

§3.5 标注方式

TCIA 的标注分三个层级。第一层是集合自带专家标注:LIDC-IDRI 的四放射科医生两阶段标注是其中最著名的设计——每位医生先独立盲读标记结节,再查看其余三人的匿名标注后给出最终意见,全程不强制共识,因此同一结节最多有四份带恶性度 1-5 分与物理特性的独立标注,这既保留了观察者变异,也要求使用者自行聚合(见坑点 2)。第二层是临床流程标注:NSCLC-Radiomics 与 RADCURE 的 RTSTRUCT 来自真实放疗定位流程,精度满足临床需要但未按科研协议复核。第三层是社区分析结果:分割、分类与影像组学特征由全球团队提交,经 TCIA 去标识化与形式审查后发布,但官方明确声明不认证分析质量,使用前必须核对原始论文。三个层级共同构成 TCIA 的标注生态:层级越低越可信、覆盖越窄;层级越高覆盖越广、越需核验。工程上建议把「标注层级」作为数据资产的一个字段显式记录,训练与评估策略据此分层。

§3.6 标注者资质与一致性

LIDC-IDRI 的标注由 4 位有胸腔影像专长的放射科医生完成,产出 7,371 条独立标注、聚合出 2,669 个共识结节;文献报道的医生间一致性处于结节检测任务的中等水平(这正是数据集的设计意图——不掩盖分歧)。NSCLC-Radiomics 的 GTV 由具备放疗资质的医生按治疗标准勾画,未发布医师间 Kappa。使用建议:凡涉及结节/病灶标签,务必声明聚合策略(如 pylidc 的 ≥50% 简单多数或 75% 严格多数)并在论文中报告对策略的敏感性分析。研究标签噪声影响时,可把一致性阈值从 25% 扫描到 100%,绘制性能-阈值曲线,用曲线的平稳性证明结论不依赖于特定聚合口径。

§3.7 采集周期

各集合独立标定采集窗口:LIDC-IDRI 覆盖 1990 年代至 2000 年代的诊断与筛查 CT;NSCLC-Radiomics(Lung1)为 2004-2014 年前后 MAASTRO 收治的预处理 CT(页面样例 SeriesDate 为 2006 年);TCGA 影像对应各病例 1998 年以后的常规诊疗;RADCURE 等试验集合按试验周期收录。集合页面的 Updated 字段(如 LIDC-IDRI 2020-09-21)指数据版本更新时间,与影像采集时间不同,引用时需区分。涉及时间的四个字段与用途如下:

字段 含义 使用建议
StudyDate(DICOM 头) 该次检查的拍摄日期 患者级时序分析与时间划分的基本单位
SeriesDate(DICOM 头/API) 该序列的拍摄日期,部分缺失 时序分析前先做覆盖率统计,缺失时回退 StudyDate
Updated(集合页) 数据版本更新时间 与采集时间无关,勿混用
DOI 版本日期(DataCite) 该内容快照的固化日期 论文引用与复现口径以此为准

§3.8 地域覆盖

以北美学术医疗中心为主体:LIDC-IDRI 的 7 家参与中心全部位于美国;TCGA 影像来自其美国多中心网络;NLST 为美国多中心筛查试验。欧洲贡献集中在专项研究队列:NSCLC-Radiomics 来自荷兰马斯特里赫特的 MAASTRO 诊所;部分国际临床试验集合覆盖欧洲与澳洲中心。若你的目标部署人群为亚洲,需特别注意设备厂商、扫描协议与患病谱的域移位(见 §7.3)。

地域 贡献形式 代表集合
美国 多中心临床网络与国家试验 LIDC-IDRI(7 家学术中心)、NLST、TCGA 系列、RIDER
荷兰 单一研究机构专项队列 NSCLC-Radiomics(MAASTRO 诊所)
其他国际中心 国际临床试验与专科队列 逐集合核对采集地,勿以集合名或文档语言推断

§3.9 设备规格

DICOM 头完整保留 Manufacturer、ManufacturerModelName、SoftwareVersions 字段,是设备偏倚分析的一手材料。LIDC-IDRI 由 8 家医学影像公司的设备参与采集(公开清单见集合页);NSCLC-Radiomics 以西门子设备为主(样例:Sensation 16)。跨集合混用时,厂商与重建参数分布差异是图像风格差异的最大来源,建议在特征工程中显式记录并在模型中做设备分层验证。做设备分层分析时常用的四个 DICOM 头字段:

字段 DICOM 标签 分析用途
Manufacturer (0008,0070) 厂商分层、域移位看板
ManufacturerModelName (0008,1090) 机型级批次效应分析
SoftwareVersions (0018,1020) 重建软件版本漂移追踪
ConvolutionKernel (0018,1210) CT 重建核,纹理捷径的主要来源

个别下载任务中上述字段缺失时,优先怀疑下载不完整而非设备未记录;跨集合合并前把四个字段写入统一 sidecar,可省去后续大量返工。

§3.10 深度溯源链

完整溯源链为:提交机构(签署 Data Submission Agreement,TCIA 承担去标识化法律责任)→ 策展中心 DCC(UAMS 团队执行去标识化、QA、CICADAS 清单核查)→ Advisory Group 季度评审 → 发布(DataCite DOI,前缀 10.7937)→ 镜像分发(NBIA 归档 + IDC 云镜像)。每个 DOI 版本对应固定的集合内容快照,论文引用应指向使用时的具体 DOI;社区分析结果另发独立 DOI,与源集合 DOI 分开引用。

环节 责任方 可核验材料
数据提交 提交机构(签署 Data Submission Agreement) 集合页「Citations & Data Usage Policy」选项卡
去标识化与质量保证 UAMS 数据策展中心(DCC) 官方策展流程文档与 CICADAS 清单
学术评审 TCIA Advisory Group(季度评审) 官方关于页的评审机制说明
版本固化 DataCite(DOI 前缀 10.7937) DataCite API 返回的版本与许可记录
镜像分发 Imaging Data Commons(IDC) IDC Portal 的版本同步说明

§4 数据结构

§4.0 目录树

以 LIDC-IDRI 为例,经 NBIA Data Retriever 按 manifest 下载并解压后的标准目录层级如下(所有放射集合均遵循该层级,仅顶层集合名不同):

LIDC-IDRI/                          # 集合根目录(名称与集合页一致)
├── LIDC-IDRI-0262/                 # 患者级目录(PatientID,已去标识化编号)
│   ├── 1.3.6.1.4.1.9328.50.2017xxxx/   # StudyInstanceUID(一次检查)
│   │   ├── 1.3.6.1.4.1.9328.50.2017xxxx.yyy/   # SeriesInstanceUID(一个序列)
│   │   │   ├── 1-001.dcm           # SOPInstanceUID(单张切片)
│   │   │   ├── 1-002.dcm
│   │   │   └── ...                 # 一个 CT 序列通常含数十至数百张切片
│   │   └── .../                    # 同一检查的其他序列(如定位像、增强扫描)
│   └── 06-24-2000-NA Thorax-xxxxx/ # 部分集合保留人类可读的原始目录名
├── LIDC-IDRI-0263/
└── ...
# 另有独立标注包(同集合页下载):
#   XML 标注(每例一份,含四医生两轮标注坐标)
#   Nodule Counts by Patient(XLSX)、Patient Diagnoses(XLS)

要点:目录名即 DICOM 标识符,任何一层都不应手工重命名,否则会破坏与 manifest、XML 标注的对应关系;不同患者的目录数不等于影像张数——一名患者可含多次检查与多个序列。

§4.1 DAIMS 字段字典

NBIA REST API 的序列级元数据(getSeries 返回)是跨集合最稳定的数据字典。核心字段如下:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
PatientID string 去标识化患者编号,集合内唯一 LUNG1-048 分组划分、防泄漏 跨集合不唯一 无 集合自定义
StudyInstanceUID string 一次检查的全局唯一标识 1.3.6.1.4.1.32722.99.99.29… 检查级聚合 无 无 DICOM UID
SeriesInstanceUID string 一个序列(下载最小单元) 1.3.6.1.4.1.32722.99.99.32… 下载与缓存键 无 无 DICOM UID
Modality string 影像模态 CT 模态过滤 少数非标值 无 DICOM 受控词表
Collection string 所属集合名 NSCLC-Radiomics 集合级分层 无 无 集合清单
BodyPartExamined string 检查部位 LUNG 部位过滤 填写不规范 空串 DICOM 受控词表
ImageCount integer 序列内切片数 135 体量估算、薄层筛选 与实际文件数偶有出入 无 1-4,000
SeriesDate date 序列采集日期 2006-04-13 时间分层、漂移分析 部分集合置空 空串 1990-2026
Manufacturer string 设备厂商 SIEMENS 设备偏倚分析 拼写变体 空串 厂商清单
LicenseName string 该序列许可 Creative Commons Attribution-NonCommercial 3.0 Unported License 合规审查 无 无 许可清单
CollectionURI string 集合 DOI 链接 https://doi.org/10.7937/K9/TCIA.… 引用与溯源 无 无 DOI URL

§4.2 标签分布

TCIA 无全局统一标签体系,标签分布需按集合考察。以肺结节方向为例:LIDC-IDRI 的 1,010 例中约 75% 受试者带癌症阳性诊断(确诊病例远高于筛查人群比例);每例的结节计数与恶性度 1-5 分由四医生独立给出,聚合口径(如简单多数)不同则分布随之改变。临床结局标签方面,NSCLC-Radiomics 提供 422 例生存时间与删失标记,中位随访以集合文档为准;TCGA 系列影像无病灶级标签,仅有病例级分期与病理类型。任何分类建模前,先在集合页下载「Nodule Counts」「Patient Diagnoses」类汇总表核对标签分布,再决定分层策略。

标签类型 挂载层级 载体 代表集合
结节恶性度 1-5 分与物理特性 序列级(每医生独立) XML LIDC-IDRI
病灶分割掩码 独立序列 DICOM SEG / RTSTRUCT NSCLC-Radiomics、RADCURE、UPENN-GBM
生存时间与删失标记 患者级 CSV/XLSX NSCLC-Radiomics、RADCURE
TNM 分期与病理类型 患者级 临床表 TCGA 系列、NSCLC-Radiomics
基因表达/突变 病例级(跨库对齐) TCGA GDC TCGA 影像系列
重复扫描设计 患者级 目录结构本身 RIDER

§4.3 关键统计

统计项 数值 口径
已发布数据集 287 个 截至 2026-09,NCI DCTD 报道
影像总数 3,090 万+ 张 2017 年口径(Prior et al. 2017)
受试者总数 约 37,568 名 2017 年口径,此后持续增长
年下载流量 近 5 PB 2025-05 官方统计
LIDC-IDRI 序列切片数 244,527 张 集合页 v4 口径
LIDC-IDRI 医生标注 7,371 条 / 2,669 个共识结节 文献口径
NSCLC-Radiomics 序列 740 个序列 / 51,513 张 集合口径
支撑出版物 3,400+ 篇 截至 2026-09
LIDC-IDRI 癌症阳性诊断占比 约 75% 受试者 文献口径(见 §4.2)

§4.4 数据层级

TCIA 放射影像遵循标准 DICOM 四级层级:患者(PatientID)→ 检查(StudyInstanceUID)→ 序列(SeriesInstanceUID)→ 实例(SOPInstanceUID,即单张切片)。三个常被误用的细节:其一,一名患者可有多次检查、一次检查可有多个序列,LIDC-IDRI 的 1,010 名患者即对应 1,308 次检查;其二,标注对象可能落在任何一层——结节标注挂在序列上,临床结局挂在患者上,RTSTRUCT 靶区以独立序列形式存在;其三,跨层级聚合时应从上层向下展开(患者 → 该患者全部检查 → 全部序列),避免用序列清单反推患者集合时产生遗漏。数字病理与部分 NIfTI 衍生数据不遵循该层级,病理切片按「玻片 → 区域 → 金字塔层级」组织。

以 LIDC-IDRI 的 1,010 名患者对应 1,308 次检查为例:平均每人约 1.3 次检查,多检查患者(如随访复查、多次扫描方案)真实存在。把「检查」当「患者」用是最常见的层级错误——其一表现为数据集规模翻倍虚高,其二表现为按序列随机划分时的患者级泄漏(见 §5.3)。

§4.5 缺失值与信息性缺失编码

缺失情形 表现 处理建议
临床表空白单元格 CSV 中空串或空格 读入后统一规范化为 NaN,禁用默认 0 填充
未知值显式标记 Unknown、NA、NULL、NA-UNKNOWN 等字符串 保留为独立类别或单独掩码,不可混入有效值
BodyPartExamined 空缺 API 返回空串 用 DICOM 头 SeriesDescription 交叉推断
SeriesDate 空缺 API 返回空串 影像时间分析前先做覆盖率统计
结节标注缺失 XML 中该例无任何标记 含义是「未见 ≥3 mm 结节」,是阴性样本而非数据缺失
影像无对应临床表 集合部分病例无结局 按病例取交集构建分析子集,并报告剔除比例
下载文件数与清单不符 序列文件少于 API 的 ImageCount 重跑 manifest 断点补齐,禁手动改目录名(见 §6.10)
许可字段缺失 个别序列 LicenseName 为空 回退集合页许可声明,并在许可 sidecar 中注明推断来源

§5 数据划分与使用建议

§5.1 官方划分

TCIA 层面不提供任何官方训练/验证/测试划分——每个集合独立发布,划分责任在数据使用者。部分源自挑战赛的集合(如 SPIE-AAPM Lung CT Challenge)自带训练/测试说明,属例外。换言之,「没有官方划分」不是随意划分的许可,而是把划分责任显式转给了使用者——划分方式必须写进论文方法节,并与评估口径一并冻结(呼应 §8.3 通用纪律)。

§5.2 社区惯例划分

  • LUNA16 十折:肺结节检测的事实标准——从 LIDC-IDRI 的 888 例含结节子集中按患者分十折,官方发布折名单,禁止自行重划后与榜单比较。
  • 按患者留出:以 PatientID 做 GroupShuffleSplit(如 70/10/20),保证同一患者的一切序列、切片只出现在一个子集中。
  • 按采集时间分块:以 StudyDate/SeriesDate 排序后按时间切分,可模拟「模型上线后面对未来数据」的真实退化,适合漂移研究。
  • 按来源中心分块:LIDC-IDRI 论文提供各病例来源中心信息,按中心划分用于评估跨机构泛化。
  • 按设备厂商分层划分:当研究目标是评估设备泛化时,按 Manufacturer 分层保证每折内厂商比例一致,另留一个厂商整体做留出测试。

§5.3 泄漏风险与防泄漏清单

  1. 患者级泄漏(最高频):同一患者的多个序列/切片分属训练与测试,切片级随机划分几乎必然发生。后果是测试 AUROC 虚高 3-10 个百分点不等。防护:一律按 PatientID 分组划分,划分后断言患者集合零交集。
  2. 检查级泄漏:同一 StudyInstanceUID 下的增强/平扫序列若被当作独立样本,同样构成泄漏。防护:分组键升级为 PatientID,并把「检查」作为最小样本单位。
  3. 标签-特征同源泄漏:使用 RTSTRUCT 勾画的 GTV 计算的特征(如 Lung1 的形态学特征)再预测同一患者的预后,特征与标注出自同一医生勾画,容易高估可预测性。防护:报告仅用原始影像自动分割重新计算特征的平行结果。
  4. 分析结果反向泄漏:把社区提交的分割结果当作输入特征、又把它当作评估真值。防护:区分「源集合」与「分析结果」两类 DOI,输入用 A、评估用 B 时在论文中显式声明。
  5. 预处理泄漏:全库统一做强度归一化、重采样统计时用了测试集分布。防护:所有标量(均值、标准差、体素间距众数)仅在训练子集上估计。

§5.4 交叉验证建议

推荐五折分组交叉验证(GroupKFold,按 PatientID)+ 每折内再按患者分出验证集的双层结构;最终模型在独立留出集合上只评估一次。若目标期刊要求与 LUNA16 榜单对话,直接采用其官方十折名单,不要发明新划分。

实操要点:

  • 分组键必须是 PatientID;一旦同一患者的序列出现在两折,全部折间比较作废。
  • 分层维度选患者级标签(如诊断、分期),而非切片级——后者同样构成泄漏。
  • 每折用同一随机种子跑两次:一次含全部预处理、一次仅在训练折上拟合归一化统计,两者差异即为预处理泄漏的量级。
  • 折间方差必须报告:医学影像的数据量级下,折间差异经常大于方法间差异,只报均值会误导读者。

§5.5 外部验证建议

内部划分再严格也只能证明「同分布性能」。建议至少接入一个异源队列做外部验证:训练用 LIDC-IDRI、验证用 NLST 子集(需申请)或私有中心数据;影像组学研究可沿用 Aerts 2014 的多队列验证设计(Lung1 之外另有独立验证队列)。报告时给出每个外部队列的设备构成与患病谱差异,避免把域移位误读为模型缺陷。

外验队列的可获得性按成本与价值排序:

  • 零成本:另一 TCIA 集合(同任务、不同中心,如 LIDC-IDRI 训练、SPIE-AAPM 挑战集测试)。
  • 低成本:IDC 上的其他公开队列,经 SQL 筛选与目标人群匹配。
  • 高成本但高价值:NLST 受控版(申请周期以官方帮助台答复为准)或私有合作中心数据。
  • 报告要求:每个外验队列单列设备构成、层厚分布、患病率与随访窗口,缺一不可。

§6 AI 就绪指南

§6.0 云端快速启动

若本地磁盘或 Java 环境受限,可跳过 NBIA 下载,直接在 Imaging Data Commons(IDC)上起步:IDC 托管 TCIA 公开 DICOM 数据的云镜像,提供网页查看器(OHIF、VolView、SLIM)、BigQuery 式 SQL 元数据查询,以及 idc-index Python 包(可在不下载全库的前提下按集合/模态/解剖部位检索并按需取数)。适合探索性分析与单集合级实验;训练大规模模型时再决定是否全量落盘。

pip install idc-index
python -c "from idc_index import index; client = index.IDCClient(); \
print(client.get_idc_version())"

两个常见起步误区:其一,寻找官方「全库打包下载」——不存在,TCIA 只有按集合下载,任何声称全库单包的第三方镜像都不可信;其二,把探索用的云上临时查询结果直接当作训练集——云上过滤条件应固化为 SQL 或 manifest 文件,与本地实验严格同源,否则复现时无法对齐样本清单。

§6.1 快速上手

下面代码展示最短路径:用官方 tcia_utils 包按集合列出序列并下载一个小子集。运行前请确认目录结构预期与 data_root 拼接关系——下载完成后磁盘布局为 data_root/LIDC-IDRI/<PatientID>/<StudyUID>/<SeriesUID>/*.dcm,即目录树一节所示层级;data_root 变量即该层的父目录。最小可用子集建议先取 3 个序列(约 100-300 MB)验证链路,再扩大范围。

# pip install tcia-utils pandas
from tcia_utils import nbia

data_root = "./data"                    # 下载根目录,与目录树对应
# 1) 查询集合内序列元数据(不下载影像)
series = nbia.getSeries(collection="LIDC-IDRI", modality="CT")
print(len(series), "个 CT 序列")         # 序列级 DataFrame

# 2) 只取前 3 个序列做最小验证(去掉 number 参数即下载全部)
subset = series.head(3)
nbia.downloadSeries(subset, path=data_root, format="csv")

# 3) 下载结果落盘为 data_root/LIDC-IDRI/<PatientID>/<StudyUID>/<SeriesUID>/
#    同目录附带许可文件,务必保留以备合规检查

代码释义:getSeries 返回的是序列级元数据(一行一序列),并非影像本身;downloadSeries 才触发 DICOM 落盘。两步分离的设计让你可以在下载前完成许可与规模审计,也方便把「元数据快照」与「影像数据」分开做版本管理。

§6.2 数据获取

四条获取通道按规模与场景选择:

通道 适用规模 前置条件 特点
集合页直接下载 单集合小体量 无需登录 浏览器点击,附许可文件
NBIA Data Retriever + manifest 单集合全量/多集合 安装 Java 客户端 断点续传、可重复(manifest 固定序列清单)
NBIA REST API 程序化按需取数 免费令牌(部分端点) 序列级元数据查询 + 生成 manifest
IDC 云访问 云上分析与免落盘 Google 账号 SQL 过滤 + 按需导出

NBIA Data Retriever 命令行用法(Linux 下安装 deb 包后):

# manifest 文件从 NBIA 检索页购物车导出,内含序列 UID 清单与服务器地址
/opt/nbia-data-retriever/nbia-data-retriever --cli -d -l /path/to/manifest.tcia
# -d 指定下载目录,--cli 命令行模式;目录结构自动按 集合>患者>检查>序列 展开

REST API 直接调用示例(序列查询 + 生成 manifest):

curl "https://services.cancerimagingarchive.net/nbia-api/services/v1/getSeries?Collection=NSCLC-Radiomics&Modality=CT"
# v4 API 已于 2025-10-30 发布,旧版端点计划 2026-10 终止帮助台支持;
# 生产代码请查阅官方 v2->v4 映射表锁定版本,避免静默迁移

manifest 文件本身是纯文本(manifestVersion 3.0),内含服务器地址与序列 UID 清单,可直接审阅与版本管理:

# manifest.tcia 样例(结构示意,从检索页购物车导出后生成)
downloadServerUrl=https://public.cancerimagingarchive.net/nbia-search
collection=NSCLC-Radiomics
...
SeriesInstanceUID=1.3.6.1.4.1.32775.99.99.1.1103.1573935937.100

把 manifest 纳入 Git 管理(数据本体除外),即可用一次提交记录「用了哪些序列」,这是零成本的数据版本化手段。

§6.3 预处理全流程

DICOM 影像进入模型前的标准流水线:读取 → 重采样到各向同性体素 → 加窗(HU 或 SUV)→ 归一化 → 重切片。以下代码以 LIDC-IDRI 的 CT 序列为例(约 35 行,超 30 行折叠展示):

<details>
<summary>展开完整预处理代码(pydicom + SimpleITK)</summary>

# 预期输入:data_root/LIDC-IDRI/<Patient>/<Study>/<Series>/*.dcm
# 预期输出:series_<SeriesUID>.nii.gz(NIfTI)+ 归一化后 numpy 数组
import glob, os
import numpy as np
import pydicom
import SimpleITK as sitk

def load_series(series_dir):
    slices = [pydicom.dcmread(f) for f in glob.glob(os.path.join(series_dir, "*.dcm"))]
    slices.sort(key=lambda s: float(s.ImagePositionPatient[2]))  # 按物理位置排序
    vol = np.stack([s.pixel_array for s in slices]).astype(np.float32)
    # CT 用 HU:RescaleSlope/Intercept 把灰度映射回亨氏单位
    vol = vol * float(slices[0].RescaleSlope) + float(slices[0].RescaleIntercept)
    return vol, slices

def resample_isotropic(vol, slices, spacing_xy, target=1.0):
    z_spacing = float(slices[0].SliceThickness)          # 层厚各集合差异极大
    old_spacing = np.array([z_spacing, spacing_xy[1], spacing_xy[0]])
    new_shape = np.round(vol.shape * old_spacing / target).astype(int)
    from scipy.ndimage import zoom
    return zoom(vol, scale=new_shape / vol.shape, order=1)  # 三线性插值

def window_normalize(vol, wl=-600, ww=1500):              # 肺窗示例
    lo, hi = wl - ww / 2, wl + ww / 2
    return np.clip(vol, lo, hi) / (hi - lo)

vol, slices = load_series("data/LIDC-IDRI/LIDC-IDRI-0262/1.3.6.../1.3.6...")
px = slices[0].PixelSpacing                               # 面内像素间距 (row, col)
vol = resample_isotropic(vol, slices, (float(px[0]), float(px[1])), target=1.0)
vol = window_normalize(vol)
sitk.WriteImage(sitk.GetImageFromArray(vol), "series.nii.gz")

</details>

三点纪律:重采样目标体素间距写进配置并在论文报告;窗宽窗位按任务选择(肺窗/纵隔窗/骨窗)且训练与推理必须一致;所有归一化统计只从训练子集估计。

§6.4 PyTorch DataLoader 完整代码

以下实现「序列级二分类」示例:输入一个 CT 序列(已重采样),预测该序列是否含 ≥3 mm 结节标签需结合 §6.5 坑点 2 的聚合标注(此处演示数据通路,标签表由 pylidc 预生成为 CSV)。代码约 45 行,超 30 行折叠展示:

<details>
<summary>展开完整 PyTorch Dataset 与 DataLoader 代码</summary>

# 目录预期:
#   data_root/LIDC-IDRI/<Patient>/<Study>/<Series>/*.dcm   (§6.3 预处理后另有 *.nii.gz)
#   labels.csv:列 = SeriesUID, label(0/1,由 pylidc 聚合 XML 生成)
import glob, os
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
import SimpleITK as sitk

class TciaSeriesDataset(Dataset):
    def __init__(self, csv_file, data_root, target_shape=(64, 256, 256)):
        self.df = pd.read_csv(csv_file)          # 每行 = 一个序列样本
        self.data_root = data_root               # 与目录树顶层对应
        self.target_shape = target_shape

    def __len__(self):
        return len(self.df)

    def __getitem__(self, idx):
        row = self.df.iloc[idx]
        series_dir = os.path.join(self.data_root, "LIDC-IDRI",
                                  row.patient_dir, row.study_dir, row.series_dir)
        nii = glob.glob(os.path.join(series_dir, "*.nii.gz"))[0]
        vol = sitk.GetArrayFromImage(sitk.ReadImage(nii)).astype(np.float32)
        # 统一尺寸:中心裁剪/零填充到 target_shape(z, y, x)
        out = np.zeros(self.target_shape, dtype=np.float32)
        sl = tuple(slice(0, min(a, b)) for a, b in zip(vol.shape, self.target_shape))
        out[sl] = vol[sl]
        out = (out - out.mean()) / (out.std() + 1e-6)     # 序列内标准化
        x = torch.from_numpy(out).unsqueeze(0)            # (1, z, y, x)
        y = torch.tensor(float(row.label), dtype=torch.long)
        return x, y

train_ds = TciaSeriesDataset("labels_train.csv", data_root="data")
loader = DataLoader(train_ds, batch_size=4, shuffle=True,
                    num_workers=4, pin_memory=True)
model = torch.nn.Sequential(                              # 极简 3D CNN 演示
    torch.nn.Conv3d(1, 16, 3, stride=2, padding=1), torch.nn.ReLU(),
    torch.nn.Conv3d(16, 32, 3, stride=2, padding=1), torch.nn.ReLU(),
    torch.nn.AdaptiveAvgPool3d(1), torch.nn.Flatten(), torch.nn.Linear(32, 2))
for x, y in loader:                                       # 冒烟测试一个 epoch
    out = model(x); loss = torch.nn.functional.cross_entropy(out, y)
    break

</details>

§6.5 坑点清单

⚠️ 坑点 1:切片级随机划分导致同一患者出现在训练与测试两侧(分类:数据泄漏)

问题:一名患者的影像常含多个序列(平扫 + 增强、定位 + 薄层),切片级或序列级随机划分都会把同一患者放进两个子集,模型只需记住患者风格即可得高分。
症状:测试 AUROC 高达 0.95+ 但换了医院数据立刻跌到 0.6-0.7;消融实验各折方差小得反常。
解决:

  1. 简单方法:按 PatientID 用 GroupShuffleSplit/GroupKFold 划分,训练前断言 set(train_patients) & set(test_patients) == set()。
  2. 进阶方法:把样本单位提升到「检查」(StudyInstanceUID),序列聚合为检查级样本;对序列内切片用同一患者掩码做标签平滑。
  3. SOTA 方法:按来源中心划分评估跨机构泛化,并报告患者级与切片级划分的差值作为泄漏量化证据。
    参考:LUNA16 官方十折名单(按患者划分);MIMIC 类研究通行的 GroupKFold 实践。

⚠️ 坑点 2:LIDC-IDRI 的四医生标注不强制共识,直接把 XML 当真值会错(分类:标签理解)

问题:LIDC-IDRI 每例由 4 位胸部放射科医生两阶段独立标注,设计上刻意「不要求达成共识」;同一结节最多 4 份坐标、直径与恶性度 1-5 分各异的标注,还有 <3 mm 的非结节标记。
症状:把任意一位医生的标注当真值训练,评估集真值又不一致,灵敏度与假阳率完全不可比;直接手写 XML 解析漏掉非 blinded read 轮次。
解决:

  1. 简单方法:用 pylidc 的 cluster_annotations() 按质心距离聚合标注,取「≥半数医生同意」为结节,直径取四标注均值。
  2. 进阶方法:以 75% 一致性(3/4 医生)作严格口径重跑一遍,把两种口径的标签差做成敏感性分析表。
  3. SOTA 方法:改用官方 DICOM 化结节表示(DICOM-LIDC-IDRI-Nodules 分析结果集合),用 Highdicom 读取,摆脱 XML 自解析。
    参考:LIDC-IDRI 集合页 Note 与 pylidc 文档;TCIA 官方对 XML 版标注的 pylidc 使用建议。

⚠️ 坑点 3:层厚与像素间距跨集合异质,不重采样等于让模型背层厚指纹(分类:预处理陷阱)

问题:LIDC-IDRI 内部层厚就横跨 0.6-5.0 mm(中位 2.0 mm),跨集合差异更大;z 轴分辨率直接决定结节的物理尺寸呈现,不重采样时模型会学出「层厚-标签」伪相关。
症状:训练集上完美、换成薄层扫描数据就漏检小结节;可视化的 Grad-CAM 热区贴着插值边缘而非病灶。
解决:

  1. 简单方法:全部重采样到 1.0 mm 各向同性(scipy.ndimage.zoom 或 sitk.Resample),把目标间距写进实验配置。
  2. 进阶方法:训练时按体素间距分层采样,或在 Data Augmentation 中加入 0.7-1.5 mm 的随机 z 间距抖动。
  3. SOTA 方法:采用 nnU-Net 的自动重采样与间距感知归一化方案,其内部会为每个数据集估计目标间距。
    参考:nnU-Net 文档(Isensee et al.);LIDC-IDRI 层厚分布统计见相关影像组学文献。

⚠️ 坑点 4:NBIA API 版本迁移——旧版端点 2026 年 10 月终止支持(分类:工程陷阱)

问题:NBIA v4 REST API 于 2025-10-30 发布,官方宣布旧版 API 的帮助台支持将于 2026 年 10 月结束;大量博客与教程仍停留在 v1/v2 端点。
症状:脚本某天突然 404 或返回结构变化;CI 流水线在无人改动的情况下挂掉。
解决:

  1. 简单方法:把 API 版本号与端点写进配置文件与依赖锁定,升级前在隔离环境跑冒烟测试。
  2. 进阶方法:用 tcia_utils 官方包(已随 v4 迁移)替代手写 requests 调用,跟随官方节奏升级。
  3. SOTA 方法:公开数据改走 IDC(其 API 与 TCIA 分离演进),NBIA API 仅保留作受控数据通道;两边都做数据校验和比对。
    参考:TCIA API Guides 页(含 v2→v4 映射表);tcia-utils GitHub MIGRATION 记录。

⚠️ 坑点 5:全库许可并不统一,CC BY-NC 集合混入商用管线即违规(分类:工程陷阱)

问题:多数集合为 CC BY 3.0/4.0(允许商用、需署名),但 NSCLC-Radiomics 等集合的序列级元数据显示许可为 CC BY-NC 3.0(禁商用);受控集合还需 NIH 审批。
症状:论文能发、产品却不能上线;或公司项目用了 NC 集合做商业模型权重,法务回溯时才发现。
解决:

  1. 简单方法:下载时保留随数据附带的许可文件;用 REST API 的 LicenseName 字段在数据入库时逐序列登记许可。
  2. 进阶方法:构建「许可-集合-用途」三列表做管线闸门:任何导出/训练任务声明用途,脚本自动拒绝许可不匹配的数据。
  3. SOTA 方法:商用产品只用 CC BY(无 NC)集合白名单训练,或为 NC 数据单独购买授权;在模型卡中披露全部训练集合 DOI 与许可。
    参考:各集合页 Citations & Data Usage Policy 选项卡;NBIA getLicenses API 返回的商业使用标记。

⚠️ 坑点 6:TCGA 影像来自常规诊疗,协议与设备异质远超研究级队列(分类:偏倚陷阱)

问题:TCGA 系列影像是患者在多家机构「为了看病」拍的,扫描仪厂商、造影剂方案、扫描时相、重建核全部不受控;它不是为影像 AI 设计的标准化采集。
症状:影像质量筛选后样本量骤减;模型学到「某厂商重建核 = 某癌种」的捷径,跨设备集直接失效。
解决:

  1. 简单方法:建模前按 Modality + BodyPartExamined + SeriesDescription 严格筛序列,报告筛选漏斗图。
  2. 进阶方法:把 Manufacturer/ModelName 作为分层变量做子组评估;训练引入设备标签的对抗解耦或直方图匹配预处理。
  3. SOTA 方法:跨中心特征归一化(如 ComBat)或在多个外部队列(非 TCGA)上报告泛化性能。
    参考:CGC 文档对 TCGA 影像「常规诊疗采集、非标准化」的明确说明;radiogenomics 文献的设备校正实践。

⚠️ 坑点 7:LIDC-IDRI 约 75% 癌症阳性率,直接当筛查模型训练集会高估临床收益(分类:偏倚陷阱)

问题:LIDC-IDRI 病例构成刻意偏向前瞻性筛查/诊断队列中的阳性与疑难病例,阳性率约 75%,而真实筛查人群阳性率不足 2%;患病率差异直接改变预测值与决策曲线。
症状:模型在 LIDC 上校准良好,部署到筛查场景后 PPV 崩塌、假阳性警报爆炸;用 LIDC 评估的「检出率」无法换算真实筛查收益。
解决:

  1. 简单方法:论文中显式声明 LIDC 阳性率与目标人群差异,不做绝对 PPV 表述。
  2. 进阶方法:用 NLST 子集(需申请)或加权的阴性集合做患病率重校准,报告重校准后的 PPV/NPV。
  3. SOTA 方法:按筛查决策曲线分析(DCA)评估临床净收益,并用患病率分层的前瞻性外部队列验证。
    参考:NLST 试验设计;筛查 AI 校准相关方法学论文。

⚠️ 坑点 8:绕开 LUNA16 评估协议自报灵敏度,数字与榜单不可比(分类:评估误用)

问题:LUNA16 基准有固定协议——官方十折、7 个体积阈值(≥3、≥5、≥10、≥15、≥20、≥25、≥30 mm)下的灵敏度与平均假阳数(0.125-8/扫描)FROC 曲线;自创划分或阈值后报出的「灵敏度 96%」无法与任何榜单数字对话。
症状:审稿人要求「按 LUNA16 协议重报」;与已发表方法比较时数字系统性偏高。
解决:

  1. 简单方法:下载官方折名单与评估脚本,原样跑十折并提交官方评估服务器。
  2. 进阶方法:额外报告自定义划分结果时,并列给出 LUNA16 协议结果作锚点,说明差异来源。
  3. SOTA 方法:接入 IDC 上持续维护的 LIDC 评估变体,用统一容器化评测保证可复现。
    参考:LUNA16 官方网站评估协议页;Setio et al., 2017, Scientific Reports 的协议描述。

§6.6 数据增强

类别 操作 说明
✅ 安全 随机 3D 翻转(左右)、小角度旋转(±10°)、小尺度缩放(0.9-1.1)、随机平移 不改变解剖与病理语义
✅ 安全 随机 z 间距抖动(0.7-1.5 mm 等效重采样) 模拟层厚异质,缓解坑点 3
✅ 安全 高斯噪声、轻度模糊、随机窗宽窗位微调 模拟采集退化
❌ 危险 上下翻转(z 轴镜像) 颠倒头脚方向,违背解剖学(CT 存储方向跨集合不一,慎用)
❌ 危险 强度直方图均衡化到统一分布 抹掉造影增强与代谢信息,破坏 HU/SUV 语义
❌ 危险 弹性形变用于分割标签监督 可能使微小结节标注位移出病灶真实范围
⚠️ 视任务 随机丢弃造影/平扫时相 时相是临床语义的一部分;平扫增强混合训练时应显式建模时相,而非随机丢弃
⚠️ 视任务 器官区域裁剪(如肺部 ROI box) 显著降低显存与假阳来源,但推理时必须复现同一裁剪逻辑,否则训练-推理分布不一致

§6.7 模型推荐

任务 推荐模型 理由 起步资源
肺结节检测 3D Faster R-CNN / RetinaNet 变体 LUNA16 榜单主流架构 MONAI Detection
肿瘤分割 nnU-Net v2 / SwinUNETR 跨模态自动配置,CT 上表现稳健 MONAI Model Zoo
CT 分类/预后 3D ResNet 系列、Vision Transformer 3D 序列级语义特征成熟 torchvision + timm 3D 变体
影像组学 PyRadiomics + 传统机器学习 可解释、小样本友好,Aerts 流派正统 pyradiomics 文档
数字病理 弱监督 MIL(ABMIL/TransMIL) 千兆像素 WSI 标准范式 开源 MIL 框架
多模态融合 影像编码器 + 表格分支双塔 对齐 TCGA 影像-基因组结构 PyTorch 自定义双分支
头颈器官/靶区分割 nnU-Net v2 / 2.5D U-Net 多序列增强 CT 上稳健 PDDCA 数据与榜单

§6.8 硬件需求

规模 GPU 内存 磁盘 参考场景
最小验证 8 GB(单卡) 16 GB 500 GB 3 个序列冒烟、2D 切片分类
单集合训练 24 GB(单卡) 64 GB 2 TB LIDC-IDRI 检测(133 GB 原始 + 中间产物)
多集合 3D 训练 40-80 GB × 2-4 卡 128 GB 8 TB + 云缓存 TCGA 多癌种融合、IDC 按需取数
病理弱监督 40 GB × 2 卡 128 GB 4 TB WSI 金字塔切片缓存与 MIL
全库检索与许可审计 无需 GPU 16 GB 100 GB NBIA API / BigQuery 批量查询、许可 sidecar 生成

§6.9 评估指标代码

# 检测任务:FROC 关键点灵敏度(LUNA16 协议口径需官方脚本,此处演示计算逻辑)
import numpy as np

def froc_points(matched_flags, nodule_sizes, n_scans, fps_per_scan=(0.125, 0.25, 0.5, 1, 2, 4, 8)):
    """matched_flags: 每个候选是否命中真值结节; nodule_sizes: 真值结节体积(mm^3)"""
    fp_rate = np.sum(~matched_flags) / n_scans
    total_sens = float(np.mean(matched_flags[matched_flags.size > 0])) if matched_flags.size else 0.0
    size_bands = [(3, None), (3, 5), (5, 10), (10, 15), (15, 20), (20, 25), (25, None)]
    sens_by_band = []
    for lo, hi in size_bands:                      # 7 个体积阈值带(mm,直径口径)
        if lo == 3 and hi is None:
            sel = np.ones_like(nodule_sizes, dtype=bool)
        elif hi is None:
            sel = nodule_sizes >= lo
        else:
            sel = (nodule_sizes >= lo) & (nodule_sizes < hi)
        sens_by_band.append(round(total_sens, 3) if sel.any() else None)
    return {"FP/scan": fp_rate, "sens_by_size_band": sens_by_band}

# 分割任务:Dice 与 Hausdorff 距离
def dice(pred, gt):
    inter = np.logical_and(pred, gt).sum()
    return 2.0 * inter / (pred.sum() + gt.sum() + 1e-8)

# 生存任务:Harrell C-index
def concordance_index(risk, times, events):
    order = np.argsort(times); risk, times, events = risk[order], times[order], events[order]
    n = len(times); num = den = 0.0
    for i in range(n):
        for j in range(i + 1, n):
            if times[j] > times[i]:
                den += 1
                if risk[i] > risk[j]:
                    num += 1
                elif risk[i] == risk[j] and events[i]:
                    num += 1
    return num / den if den else float("nan")

§6.10 MLOps 笔记

  1. 数据版本即 DOI:每个集合按 DOI 版本固化,实验配置记录所用集合 DOI 列表与下载日期;TCIA 集合会静默更新版本(如 LIDC-IDRI v4),复查复现问题时先对版本。
  2. 缓存键设计:预处理产物以 SeriesInstanceUID + 重采样参数哈希为键,跨实验复用;UID 目录名不可重命名,缓存键直接沿用。
  3. 校验和纪律:NBIA Data Retriever 下载完成后核对序列文件数与 ImageCount 字段,manifest 重跑以补齐断点。
  4. 许可元数据入资产库:把 LicenseName、CollectionURI 写入数据目录的 sidecar JSON,使训练任务的许可审计可自动执行(呼应坑点 5)。
  5. 漂移监控:生产模型上线后监控输入序列的层厚、厂商与窗宽分布;这些字段在 DICOM 头中免费可得,是最好的漂移信号。
  6. API 版本锁定:NBIA v4 已于 2025-10-30 发布、旧版 API 计划 2026-10 终止帮助台支持;生产取数代码在依赖清单中固定 tcia-utils 版本,升级前先跑一次 manifest 冒烟测试。
  7. 解析库版本一致:DICOM 解析行为随 pydicom 版本可能变化(字符集、VR 处理等),依赖清单锁定版本,并在 CI 中保留一条单序列解析冒烟测试。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
选择偏倚 集合按研究提案收录,非人群抽样;疑难与阳性病例超配(LIDC 阳性率约 75%) 高 患病率重校准(坑点 7)、混入阴性集合
设备/厂商偏倚 多数集合集中于少数几家影像厂商与扫描协议 高 设备分层评估、跨厂商外验(坑点 6)
时期偏倚 影像采集横跨约 30 年,老协议(厚层、胶片数字化)与现代数据混合 中 按 SeriesDate 分层,避免跨时代混训
地域偏倚 以北美学术中心为主,亚洲与非洲人群显著欠代表 高 部署前在本地区数据上重校准
队列组合偏倚 筛查队列(NLST)与临床转诊队列(Lung1)入组标准完全不同,混训时分布漂移 中 按集合来源分层训练与评估
标注偏倚 放射科医生标注保留观察者间变异;社区分析结果未质量认证 中 多标注聚合策略敏感性分析(坑点 2)
真阴性欠配 LIDC 每例至少含一个标记结节,「无结节扫描」在开放集合中稀缺 中 从 NLST 等筛查队列补充真阴性,或按假阳率口径报告

§7.2 标注质量

LIDC-IDRI 是全库标注质量的标杆:4 位资深胸部放射科医生两阶段标注、7,371 条独立标注聚合出 2,669 个共识结节,标注含坐标、直径、恶性度 1-5 分与物理特性(毛刺、钙化等),并刻意保留分歧——这使它成为研究观察者变异与标签噪声的独特资源,但也意味着使用者必须显式声明聚合口径。NSCLC-Radiomics 的 GTV 勾画出自放疗定位流程,精度满足临床放疗标准但无医师间一致性统计。社区分析结果(分割、特征表)经形式审查与去标识化核查,官方明确不认证分析质量,采用前应核对其来源论文与抽样验证。

集合 标注规模 标注者 质量声明 使用要求
LIDC-IDRI 7,371 条独立标注 → 2,669 个共识结节 4 位胸部放射科医生 刻意保留分歧、不强制共识 声明聚合口径并做敏感性分析
NSCLC-Radiomics 422 例 GTV(RTSTRUCT) MAASTRO 放疗团队 临床放疗标准,未发布医师间 Kappa 按放疗定位精度理解
RADCURE 3,346 例 RTSTRUCT 各治疗机构放疗团队 依治疗流程产生 逐机构抽检轮廓质量
社区分析结果 按集合 全球提交团队 官方不认证分析质量 核对来源论文并抽样验证

工程实践上,建议为每个集合维护一页「标注说明卡」:标注层级、聚合口径、一致性证据与已知缺陷各占一行,随代码库走版本管理。

§7.3 泛化性评估

部署场景 失效风险 证据/机制
亚洲基层医院筛查 高 训练集以北美学术中心为主,设备与人群分布差异大
薄层 vs 厚层混合设备 高 层厚 0.6-5.0 mm 异质(坑点 3),未重采样时显著
新扫描仪/新重建核 高 重建核改变噪声纹理,模型易学设备捷径
纵隔/腹部等其他部位 中-高 多数基准集合为胸部,跨部位标签迁移有限
前瞻性筛查患病率场景 高 患病率失配导致 PPV 崩塌(坑点 7)
同中心时间外推 中 采集时期跨度大,协议随时间演进
儿童与罕见癌种人群 极高 集合供给近乎空白,属覆盖缺口而非抽样误差(见 §7.5)

表中的失效风险按「模型在真实部署中表现骤降」的概率与幅度综合评估;缓解的共同思路是把域差异显式化——分层评估、域适应或目标域微调,而不是假设模型已隐式学会。

§7.4 伦理考量

TCIA 的伦理框架建立在三条支柱上:其一,所有公开集合由策展方依法完成去标识化(含烧录像素注释清理),数据提交协议将去标识化法律责任划归 TCIA;其二,Data Usage Policy 明文禁止使用者(单独或结合其他信息)识别或联系数据参与者,禁止生成可辨认面部等可重识别表示;其三,残余重识别风险较高的头部影像集合不进入公开通道,按 NIH Controlled Data Access Policy 走受控审批。涉及人类受试者研究的适用部分仍须遵守 45 CFR 46 及本地 IRB 要求;发表时必须引用数据集 DOI 与来源库(见 §9 引用指南)。研究者侧的配套义务同样明确:重新发布衍生数据时必须维持去标识化状态与原许可条款,不得声称或试图恢复身份信息;将 TCIA 数据用于模型训练并对外部署前,应完成独立合规评估——数据许可并不等于医疗器械法规层面的使用授权。

§7.5 公平性

多数集合未系统记录种族与语言;TCGA 临床表虽含种族字段,其影像子集并不保证按人群构成采样。性别分布随癌种自然分布(如乳腺癌集合以女性为主)。对偏应用(模型跨人群公平性评估)而言,TCIA 适合作为方法开发数据,公平性结论需在人群构成明确的前瞻性队列上验证;建议至少按性别与年龄分层报告性能,种族层面仅做局限性讨论而非结论性声明。需要强调的是,TCIA 语境下的公平性问题首先是「覆盖缺口」:儿童肿瘤、罕见癌种与非北美人群的集合供给薄弱,任何在这些子群体上的性能声明都应标注为外推。构建公平性基准时,建议把「集合来源」本身作为受保护属性的代理变量先做压力测试,再讨论人群属性层面的公平性。

§7.6 数据漂移

时间维度上,采集协议、层厚、造影剂实践与重建算法在约 30 年跨度中持续演进,老数据(如数字化胶片、5 mm 厚层)与现代薄层数据混训会引入时序漂移;空间维度上,新集合不断加入,公开 DICOM 数据的访问重心正向 IDC 云平台迁移(NBIA 旧 API 计划 2026-10 终止支持),管道层面需准备双通道取数。工程建议:以 SeriesDate 与 Manufacturer 作为漂移看板的两个免费指标;集合版本以 DOI 固化,重训前先 diff 集合更新日志。

面向工程落地的两条低成本预警线:

  • 结构漂移:监控输入流的层厚、厂商、重建核分布——三者均可从 DICOM 头零成本提取,任一分布的偏移超阈值即触发人工复核。
  • 语义漂移:用固定参照集合(如 RIDER)定期回测模型;参照集合上性能稳定而生产性能下降,更可能是部署环境差异而非模型退化。

§7.7 DAIMS 24 项数据质量评估

# 检查项 状态 说明
1 宽格式 ✅ NBIA API 序列元数据为整洁宽表,一行一序列,字段稳定
2 唯一标识 ✅ PatientID/StudyInstanceUID/SeriesInstanceUID 三级 UID 体系完备
3 特殊字符 ⚠️ 临床表跨集合编码与分隔符不一,个别字段含空串与空格
4 重复行 ✅ 序列清单无重复行;下载重试可能产生文件重复,可按 UID 去重
5 缺失编码 ⚠️ 空白、Unknown、NA、NULL 多种标记并存,未全库统一
6 标签标识 ⚠️ 无全局标签体系,逐集合自定义(结节评分/生存/分期各异)
7 罕见类分组 ⚠️ 少见癌种集合样本量小,类别稀疏需合并或外部扩样
8 偏倚评估 ✅ 阳性率、设备构成等关键偏倚可量化并有公开文档支撑
9 数据字典 ✅ NBIA API 字段文档完备且 v2→v4 提供官方映射表
10 信息性缺失解释 ⚠️ 部分集合未解释临床字段缺失原因,需读源论文
11 设备记录 ✅ DICOM 头完整保留厂商、型号与软件版本
12 共线性 ⚠️ 影像组学特征间共线性突出,需方差膨胀因子筛查与降维
13 编码映射 ✅ DICOM 受控词表 + ICD-O-3 形态学编码体系清晰
14 时间戳处理 ⚠️ SeriesDate 部分缺失、精度不一;时序分析前需覆盖率核查
15 划分建议 ⚠️ 官方无划分;社区惯例(LUNA16 十折)需使用者自行查找与引用
16 泄漏讨论 ✅ 患者级层级明确,社区对分组划分有充分讨论与工具支撑
17 标签分布 ✅ 集合页提供结节计数、诊断汇总表等分布材料直接下载
18 测量偏倚 ⚠️ 四医生标注保留观察者间变异,测量偏倚须以聚合策略显式处理
19 外部验证建议 ✅ 跨集合验证路径成熟(Lung1 多队列范式、LUNA16 协议)
20 版本记录 ✅ 每集合 DOI 版本化 + Updated 字段 + 分析结果独立 DOI
21 预处理脚本 ✅ 官方 TCIA Notebooks、tcia_utils、pylidc、PyRadiomics 生态完整
22 合规要求 ✅ 许可逐序列可查(LicenseName),Usage Policy 明确署名义务
23 多模态对齐 ⚠️ 影像-基因组对齐依赖 TCGA 病例匹配表,跨库键需人工核对
24 去标识化 ✅ 官方策展流程负责去标识化(含烧录像素),高风险集合转受控

DAIMS 评分:19 / 24

评分解读:19/24 属于「高质量研究基础设施」档位——扣分集中在两点:TCIA 是异质集合群而非单一标准化数据集,跨集合的缺失编码、标签体系与多模态对齐天然不可能完全统一(第 3、5、6、23 项);官方刻意不做数据划分与标签终裁(第 15、18 项),把方法学自由度留给使用者。全部扣分项都有明确补偿路径(社区惯例、聚合策略、逐集合文档),不存在不可知的数据黑洞。

对你意味着什么:可以直接把 TCIA 当作高可信度的模型开发底座;动手前按清单补齐四件事——逐集合阅读说明并锁定许可、确定标注聚合口径、建立患者级分组划分、把 SeriesDate 与厂商纳入监控。若你的项目需要现成标签与划分(零预处理),TCIA 会多花 1-2 周工程时间;若你需要大规模、可引用、多模态的癌症影像,这个代价是当前公开生态下的最优解。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
LUNA16 十折评估(LIDC 内部协议化) LUNA16 联盟(7 家中心数据重划) 肺结节检测 FROC 灵敏度(7 个体积阈值) 按官方十折后普遍低于自划分结果 划分协议严格化显著压缩虚高空间(坑点 8)
Aerts 2014 独立验证队列(2 个肺癌外部队列) 多中心放疗队列 影像组学预后 C-index 约 0.64-0.68(Lung1 内部约 0.65) 外部队列与内部相当 影像组学签名跨队列稳定,奠定该方向可信度
NLST 筛查队列内部+外部验证 NCI(筛查试验多中心) 肺癌筛查 AI AUC 0.944 与临床放射科医生相当(按试验设计) 大规模筛查数据上深度学习可匹敌医生水平(Ardila et al. 2019)
全国多中心 618,820 张 CT 训练集 中国多中心 肺结节恶性度 内部验证 AUC 0.946 — 更大规模真实筛查分布训练的报告范式(Zheng et al. 2019)
RIDER 同日重复扫描 多家美国中心(见 §3.2) 特征与模型稳定性 ICC / 测试-重测相关系数 — 稳定性标尺而非性能基准;组学文献常以 ICC≥0.75 作为特征稳定阈值

(表中数值来自各自论文,采集人群、标注口径与评估协议互不相同,不可直接横向比较。)


§8 基准性能与生态

§8.1 排行榜与代表性结果

TCIA 本身不运营统一排行榜;围绕其集合形成的最重要公开基准是 LUNA16(基于 LIDC-IDRI)与 LIDC-IDRI 派生任务。代表性已发表结果如下(各行列采集人群、标注与协议不同,数值不可直接比较):

排名/定位 模型/研究 性能 年份 关键技术 完整引用 代码
LUNA16 协议化验证代表 LUNA16 挑战赛算法集成研究 十折 FROC 灵敏度见论文(协议见 §8.3) 2017 多 CNN 候选聚合、假阳削减 Setio et al., 2017, Scientific Reports. DOI 10.1038/s41598-017-06796-y 部分开源
筛查 AI 标杆 Google 深度学习肺癌筛查 AUC 0.944(含 NLST 子集) 2019 3D ResNet + 多时点融合 Ardila et al., 2019, Nature Medicine. DOI 10.1038/s41591-019-0447-x 未公开
大规模多中心代表 多中心筛查 CT 恶性度网络 内部验证 AUC 0.946 2019 3D ResNet(618,820 张 CT) Zheng et al., 2019, Nature Medicine. DOI 10.1038/s41591-018-0373-2 未公开
影像组学经典 Radiomics 预后签名 C-index 约 0.65(Lung1) 2014 手工特征 + Cox 回归 Aerts et al., 2014, Nature Communications. DOI 10.1038/ncomms5006 特征库开源

⚠️ 数值不可直接比较的原因:数据划分协议不同(LUNA16 官方十折 vs 自定义留出)、患病率不同(约 75% vs 筛查真实分布)、输入时点不同(单时点 vs 多时点)、评估指标口径不同(FROC 灵敏度 vs AUC vs C-index)。引用任一数字时必须连同其协议一并引用。

解读建议:把该表当作「参照系」而非「排行榜」——选一个与你的任务最匹配的行作为基线协议,先复现其划分与指标口径,再谈方法改进。

§8.2 SOTA 总结与选型建议

检测方向,3D 候选生成 + 假阳削减的两段式架构仍是 LUNA16 协议下最稳妥的起点,端到端单阶段检测器在小结节阈值带上有竞争力;分割方向,nnU-Net v2 无需调参即可在多数 TCIA 分割集合上取得强基线,可作为一切新方法的对照组;预后方向,纯深度端到端与 PyRadiomics 手工特征两条路线在公开数据上性能接近,前者数据效率低但上限高,后者可解释且小样本友好。选型建议:以 LIDC-IDRI + LUNA16 协议做检测入门与论文对话;以 NSCLC-Radiomics 做预后方法开发并按 Aerts 范式设计外验;多模态与公平性研究直接在 IDC 上做集合级 SQL 筛选,避免全量下载。

研究方向 推荐起点 对照基线 首选指标
结节检测 3D 候选生成 + 假阳削减两段式 Setio 2017 各算法与集成 FROC CPMM
肿瘤分割 nnU-Net v2 自动配置 nnU-Net 默认基线 Dice / HD95
预后建模 PyRadiomics 特征 + 生存模型 Aerts 2014 影像组学签名 Harrell C-index
端到端筛查 3D CNN(Ardila/Zheng 路线) 两段式流水线 AUC + 人群分层
影像-基因组 TCGA 配对双分支网络 单模态对照 配对子集分层验证

两句话总结:检测从 LUNA16 协议起步是为了「可比」,分割从 nnU-Net 起步是为了「省事且不输」;先站在这两个锚点上,再做方法创新,才是这批数据的正确打开方式。

§8.3 评测协议

  • LUNA16(肺结节检测):LIDC-IDRI 888 例含结节子集按患者分十折;评估指标为 7 个体积阈值(≥3 至 ≥30 mm 直径)下平均每扫描假阳数 0.125-8 的 FROC 曲线与 CPMM(每扫描平均假阳 1/8、1/4、1/2、1、2、4、8 处灵敏度均值);官方评估脚本与折名单强制使用。
  • 影像组学预后:以 C-index 为主指标,报告 95% 置信区间;特征提取参数(PyRadiomics 版本与设置)必须完整披露,并用 ICC 或测试-重测集合(RIDER)检验特征稳定性。
  • 分割:Dice + Hausdorff 距离(95 分位),跨集合评估时报告体素间距归一化方式。
  • 通用纪律:所有结果注明集合 DOI 版本与下载日期;比较对象须来自同一划分与同一预处理假设。
  • 筛查队列评估:NLST 受控版与 SPIE-AAPM 挑战集用于患病率与人群校准研究时,按原试验定义报告结局;禁止与开放集合混池后宣称同口径。
  • 影像-基因组评估:TCGA 配对研究须报告配对成功率与对齐策略;影像特征与分子指标的多重关联一律做多重比较校正。
数据集 与 TCIA 的关系 规模 差异化价值
LUNA16 LIDC-IDRI 的十折基准派生 888 例含结节子集 官方划分 + 评估服务器,检测基准事实标准
IDC TCIA 公开 DICOM 数据的云镜像门户 数十 TB、持续同步 SQL 查询 + 云查看器,免下载分析
NLST NCI 肺筛查试验影像(TCIA 受控版) 26,254 例、2,100 万+ 张 罕见的大规模筛查队列与阴性对照
NSCLC-Radiomics TCIA 分析结果级集合 422 例 手工 GTV + 完整生存结局
RIDER TCIA 可重复性专项集合 数十例/集合 同日重复扫描,测试-重测金标准
SPIE-AAPM Lung CT Challenge TCIA 竞赛类集合 70 例 小体量教学与挑战赛复现
UPENN-GBM TCIA 脑瘤系列集合 多序列 MR + 结构分割 神经肿瘤分割与组学常用
TCIA 分析结果(Analysis Results) TCIA 自身的衍生发布通道 数十个结果级集合 分割与特征可直接下载,但须核对来源论文
Head-Neck-PET-CT(PDDCA 挑战) TCIA 头颈分割基准集合 百例级 PET-CT 9 个危及器官的多专家共识分割,头颈分割挑战的事实基准

§8.5 关键论文 Top 8

  1. Clark K, et al. The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public Information Repository. Journal of Digital Imaging, 2013;26(6):1045-1057. DOI 10.1007/s10278-013-9622-7 — 创建与运营论文,被引 5,683+(截至 2026-09),引用 TCIA 的默认文献。
  2. Prior FW, et al. The public cancer radiology imaging collections of The Cancer Imaging Archive. International Journal of Radiation Oncology, Biology, Physics, 2017 — 数据描述论文,给出 3,090 万张影像与 15 个代表集合的系统性介绍。
  3. Armato SG 3rd, et al. The Lung Image Database Consortium (LIDC) and Image Database Resource Initiative (IDRI): a completed reference database of lung nodules on CT scans. Medical Physics, 2011;38(2):915-931 — LIDC-IDRI 完成论文,四医生两阶段标注协议的原始出处。
  4. Aerts HJWL, et al. Decoding tumour phenotype by noninvasive imaging using a quantitative radiomics approach. Nature Communications, 2014;5:4006. DOI 10.1038/ncomms5006 — 影像组学奠基作,Lung1(NSCLC-Radiomics)为主要队列。
  5. Setio AAA, et al. Validation, comparison, and combination of algorithms for automatic detection of pulmonary nodules in computed tomography images: The LUNA16 challenge. Scientific Reports, 2017;7:851. DOI 10.1038/s41598-017-06796-y — LUNA16 基准的协议与结果汇总。
  6. Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest computed tomography. Nature Medicine, 2019;25:954-961. DOI 10.1038/s41591-019-0447-x — 筛查级端到端深度学习,含 NLST 数据。
  7. Zheng M, et al. Classification of lung cancer screening CT scans using a three-dimensional convolutional neural network. Nature Medicine, 2019 — 61.8 万张 CT 训练的多中心筛查分类报告。
  8. Fedorov A, et al. A Common Data Model for AI in Radiology? Imaging Data Commons(Radiology: Artificial Intelligence, 2021) — IDC 云平台论文,解释 TCIA 数据的云上形态与查询模型。

§8.6 社区活跃度

官方统计(2025-05 口径):月均约 30,000 名全球用户访问、每年数据下载量近 5 PB、支撑出版物超过 3,400 篇(2026-09 口径)、累计 36 项美国专利与 3 个 FDA 批准器械。工具生态由 TCIA 团队(Justin Kirby)维护的 tcia-utils 与 TCIA Notebooks 驱动,issues 在 kirbyju/tcia_utils 仓库公开处理(最近一次代码更新见仓库提交记录);用户支持通过官方 Help Desk 与集合页 FAQ 提供。围绕 LIDC-IDRI 的 pylidc 社区与围绕 PyRadiomics 的组学社区持续产出教程,中文社区亦有成熟的 NBIA 下载指南流传。引用生态上,Clark 2013 论文年均新增引用数百次且仍在增长,属于罕见的「数据集论文本身即高被引论文」现象;这也意味着新方法论文默认要在「LUNA16 榜单」或「Aerts 影像组学签名」两个对话锚点中至少选择其一,否则难以被同行定位与比较。

§8.7 生态快照

资源 类型 链接 状态(截至 2026-09) 推荐理由
tcia_utils Python 包 https://pypi.org/project/tcia-utils/ 活跃维护(2025-10 迁移至 NBIA v4 API) Python 访问 TCIA 的官方首选
TCIA Notebooks 教程集 https://github.com/kirbyju/TCIA_Notebooks 持续更新 REST API、下载、许可查询全流程示例
pylidc Python 包 社区维护开源 成熟稳定 LIDC-IDRI XML 标注解析与聚合的事实标准
PyRadiomics Python 包 社区维护开源 成熟稳定 与 TCIA 组学集合配套的特征提取器
NBIA Data Retriever 桌面/CLI 工具 官方下载页 持续维护 大体量集合断点续传下载
IDC Portal 云平台 https://portal.imaging.datacommons.cancer.gov/ 公开 DICOM 数据访问重心 SQL 过滤 + 在线查看 + 按需导出
LUNA16 评估 基准服务 挑战赛官网 协议固定 检测方法与历史工作对话的唯一口径
DataCite 检索 元数据 API https://api.datacite.org/ 稳定服务 按集合 DOI 拉取版本与许可历史

§9 相关资源与引用

§9.1 官方资源

§9.2 教程与社区

§9.3 BibTeX 引用

@article{Clark2013TCIA,
  title   = {The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public Information Repository},
  author  = {Clark, Kenneth and Vendt, Bruce A. and Smith, Kirk E. and Freymann, John B. and Kirby, Justin S. and Koppel, Paul A. and Moore, Stephen M. and Phillips, Stanley R. and Maffitt, David R. and Pringle, Michael D. and Tarbox, Lawrence F. and Prior, Fred W.},
  journal = {Journal of Digital Imaging},
  volume  = {26},
  number  = {6},
  pages   = {1045--1057},
  year    = {2013},
  doi     = {10.1007/s10278-013-9622-7}
}

@article{Prior2017Public,
  title   = {The Public Cancer Radiology Imaging Collections of The Cancer Imaging Archive},
  author  = {Prior, Fred W. and Clark, Kenneth and Commean, Paul and Freymann, John and Jaffe, Carl and Kirby, Justin and Moore, Stephen and Maffitt, David and Smith, Kirk and Tarbox, Lawrence and Vendt, Bruce},
  journal = {International Journal of Radiation Oncology, Biology, Physics},
  year    = {2017},
  note    = {PMID: 28925987}
}

@article{Armato2011LIDC,
  title   = {The Lung Image Database Consortium (LIDC) and Image Database Resource Initiative (IDRI): A Completed Reference Database of Lung Nodules on CT Scans},
  author  = {Armato, Samuel G. and McLennan, Geoffrey and Bidaut, Luc and McNitt-Gray, Michael F. and Meyer, Charles R. and Reeves, Anthony P. and Zhao, Binsheng and others},
  journal = {Medical Physics},
  volume  = {38},
  number  = {2},
  pages   = {915--931},
  year    = {2011}
}

@article{Aerts2014Radiomics,
  title   = {Decoding Tumour Phenotype by Noninvasive Imaging Using a Quantitative Radiomics Approach},
  author  = {Aerts, Hugo J. W. L. and Velazquez, Emmanuel Rios and Leijenaar, Ralph T. H. and Parmar, Chintan and Grossmann, Patrick and Carvalho, Sara and others},
  journal = {Nature Communications},
  volume  = {5},
  pages   = {4006},
  year    = {2014},
  doi     = {10.1038/ncomms5006}
}

@article{Setio2017LUNA16,
  title   = {Validation, Comparison, and Combination of Algorithms for Automatic Detection of Pulmonary Nodules in Computed Tomography Images: The LUNA16 Challenge},
  author  = {Setio, Arnaud Arindra Adiyoso and Traverso, Alberto and de Bel, Thomas and Berens, Mathijs S. N. and van den Bogaard, Cas and Cerello, Pierangelo and others},
  journal = {Scientific Reports},
  volume  = {7},
  pages   = {851},
  year    = {2017},
  doi     = {10.1038/s41598-017-06796-y}
}

@article{Ardila2019Screening,
  title   = {End-to-End Lung Cancer Screening with Three-Dimensional Deep Learning on Low-Dose Chest Computed Tomography},
  author  = {Ardila, Diego and Kiraly, Atilla P. and Bharadwaj, Siddhartha and Choi, Bora and Reichert, Joshua J. and Shetty, Itamar and others},
  journal = {Nature Medicine},
  volume  = {25},
  pages   = {954--961},
  year    = {2019},
  doi     = {10.1038/s41591-019-0447-x}
}

§9.4 引用指南

按 TCIA 官方政策,正确引用分两层:其一,引用描述档案库的创建论文(Clark et al. 2013);其二,逐集合引用你实际使用的集合 DOI(如 LIDC-IDRI、NSCLC-Radiomics 各自的 DataCite DOI,可在集合页 Citations 选项卡复制)。使用社区分析结果时,另引该分析结果自己的 DOI 与其来源论文。论文的数据可用性声明建议写明:数据集名称、DOI、下载日期与所用版本。镜像访问(如经 IDC)仍应引用 TCIA 源集合 DOI,避免引用链断在镜像层。

投稿前逐项自检:

  • 创建论文(Clark et al. 2013)已列入参考文献。
  • 所用每个集合的 DataCite DOI 均单独列出并指向正确版本。
  • 使用社区分析结果时,其独立 DOI 与来源论文均已引用。
  • 数据可用性声明包含下载日期与版本信息。
  • 经 IDC 等镜像取数时,仍回引 TCIA 源集合 DOI。

§10 AI 使用声明卡

§10.1 AI 模型列表

模型 角色 使用范围
大型语言模型(文本生成助手) 条目起草与结构化 §1-§9 初稿撰写、表格整理、代码示例合成
大型语言模型(检索辅助) 事实核查 检索结果整理、数字与出处比对(最终由人工复核)

§10.2 AI 参与范围

AI 参与了本条目的检索结果汇总、结构规划、正文初稿、代码示例合成与表格排版。以下环节由人工完成:研究问题界定、事实抽取与逐条来源核对、许可与合规表述把关、医学与工程内容交叉审核、最终定稿。所有规模数字、日期、引用数与许可细节均以 §10.3 所列公开来源为准,AI 生成内容中与来源冲突的表述已在人工校验环节修正。

§10.3 输入来源列表

  1. The Cancer Imaging Archive 官方主页。 https://www.cancerimagingarchive.net/
  2. About The Cancer Imaging Archive(官方关于页:资助、管理、策展、许可与访问平台)。 https://www.cancerimagingarchive.net/about-the-cancer-imaging-archive-tcia/
  3. NCI DCTD 新闻:Powering Cancer Research — How TCIA Is Evolving to Support the Next Generation of Discovery(2026;287 个数据集、3,400+ 出版物)。 https://dctd.cancer.gov/about/news-events/news/2026-news/tcia-supports-cancer-research-discoveries
  4. Fourteen Years of Open Data Sharing — TCIA(2025-05;3,200+ 出版物、36 项专利、3 个 FDA 器械、年下载近 5 PB)。 https://www.cancerimagingarchive.net/?p=51994
  5. NCI CBIIT 活动页:Fourteen Years of Open Data Sharing—TCIA(同上口径的 NCI 侧记录)。 https://www.cancer.gov/about-nci/organization/cbiit/news-events/events/past-events/fourteen-years-open-data-sharing-cancer-imaging-archive-tcia
  6. Clark K, et al. The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public Information Repository. Journal of Digital Imaging, 2013;26(6):1045-1057(首年 23 集合、330 万张影像;DOI 10.1007/s10278-013-9622-7)。 https://profiles.wustl.edu/en/publications/the-cancer-imaging-archive-tcia-maintaining-and-operating-a-publi
  7. TCIA 创建论文引用统计(Google Scholar 口径 5,683+,截至 2026-09)。 https://scholar.google.com/citations?view_op=view_citation&citation_for_view=8yXbhA4AAAAJ:-f6ydRqryjwC
  8. Prior FW, et al. The public cancer radiology imaging collections of The Cancer Imaging Archive, 2017(3,090 万张影像、约 37,568 名受试者;PMID 28925987)。 https://pesquisa.bvsalud.org/portal/resource/en/mdl-28925987
  9. TCIA Application Programming Interface (API) Guides(NBIA v4 API 2025-10-30 发布、旧版 2026-10 终止支持、Data Usage Policy)。 https://www.cancerimagingarchive.net/api-guides/
  10. TCIA NBIA REST API 手册页(getLicenses、getManifestTextV2 等端点与 CC BY 3.0 许可返回示例)。 https://wiki.cancerimagingarchive.net/
  11. LIDC-IDRI 集合页(1,010 subjects、1,308 studies、244,527 张、133.16 GB;四医生两阶段标注;CC BY 3.0;v4 更新 2020-09-21)。 https://www.cancerimagingarchive.net/collection/lidc-idri/
  12. 浙江大学公共卫生数据仓库样式之数据装载工具文档(NBIA Data Retriever、manifest 机制、目录层级)。 https://github.com/ruc-practical-ai/data-loaders
  13. tcia-utils PyPI 页(wordpress/nbia/pathdb/datacite 四模块、Apache-2.0、维护者 kirbyju)。 https://pypi.org/project/tcia-utils/
  14. Precision Medicine Toolbox Imaging 模块教程(NSCLC-Radiomics/Lung1 422 例、33 GB、Aerts 2014 DOI 10.1038/ncomms5006、CC BY-NC 3.0 许可字段样例)。 https://precision-medicine-toolbox.readthedocs.io/en/latest/imaging_module/
  15. Cancer Genomics Cloud 文档:TCIA data(TCGA 影像 21 癌种与各集合受试者数、常规诊疗采集说明)。 https://docs.cancergenomicscloud.org/docs/tcia-data
  16. KoreaMed Synapse 综述附录表:TCIA 肺癌影像数据集汇总(NLST 26,254 例/21,082,502 张、RIDER、NSCLC-radiomics 422 例 740 序列 51,513 张等)。 https://synapse.koreamed.org/articles/1141882
  17. Armato SG 3rd, et al. The Lung Image Database Consortium (LIDC) and Image Database Resource Initiative (IDRI)(四医生两阶段标注协议原始出处;Medical Physics 2011;DOI 10.1118/1.3528204)。 https://doi.org/10.1118/1.3528204
  18. Setio AAA, et al. Validation, comparison, and combination of algorithms for automatic detection of pulmonary nodules: The LUNA16 challenge(十折协议与 CPMM 指标定义;Scientific Reports 2017;DOI 10.1038/s41598-017-06796-y)。 https://doi.org/10.1038/s41598-017-06796-y
  19. Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest computed tomography(端到端筛查范式;Nature Medicine 2019;DOI 10.1038/s41591-019-0447-x)。 https://doi.org/10.1038/s41591-019-0447-x
  20. Lung Cancer Diagnosis Using Deep Attention Based MIL and Radiomics(LIDC-IDRI 7,371 标注、2,669 共识结节、层厚 0.6-5.0 mm 中位 2.0、阳性率 75%)。 https://www.researchgate.net/publication/351278369

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§0 信任声明与免责 千方病案医学编辑部 逐句比对模板与合规要求 ✅ 已通过
§1 概览与对比表 千方病案医学编辑部 数字溯源至 §10.3 来源 3/4/6/8 ✅ 已通过
§2 医学背景(ICD-11/SNOMED 映射) 千方病案医学编辑部 医学编辑交叉核对编码 ✅ 已验证
§3 数据集规格(规模与许可数字) 千方病案医学编辑部 逐格回查集合页与文献 ✅ 已验证
§4 数据结构与 DAIMS 字段字典 千方病案医学编辑部 对照 NBIA API 文档逐字段核对 ✅ 已通过
§5 划分与泄漏清单 千方病案医学编辑部 方法学审读 + LUNA16 协议核对 ✅ 已通过
§6 AI 就绪指南与 8 坑点 千方病案医学编辑部 代码冒烟测试思路复核 + 来源核对 ✅ 已验证
§7 质量评估(DAIMS 24 项) 千方病案医学编辑部 逐项状态与证据链复核 ✅ 已通过
§8 基准与生态(论文引用) 千方病案医学编辑部 逐条 DOI 与卷期核对 ✅ 已验证
§9 资源与 BibTeX 千方病案医学编辑部 引用格式与链接可达性检查 ✅ 已通过
§10 声明卡与来源列表 千方病案医学编辑部 13+ 来源逐条覆盖性检查 ✅ 已验证

§10.5 AI 生成章节标注

AI 起草章节:§1.1 摘要、§1.2 战略价值、§2.2 流行病学叙述、§3.4-§3.10、§4.2-§4.5、§5.2-§5.5、§6.1-§6.4 与 §6.6-§6.10、§7.1-§7.6、§8.2-§8.7、§9.4。人工主导章节:§0 全部、§1.0 速览、§2.1/§2.1b 编码表、§3.0 矩阵、§6.5 坑点清单(事实部分逐条溯源)、§7.7 DAIMS 评分与解读、§9.3 BibTeX、§10.3 来源列表。全部章节均经 §10.4 所列人工校验。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致;规模数字核对时点为 2026-09)

页面状态:published(全部内容已完成审核并发布)



相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • idc — 共享标签:医学影像 / CT / MRI / PET / 肿瘤学
  • autopet — 共享标签:医学影像 / CT / PET / 肿瘤学
  • cptac-imaging — 共享标签:医学影像 / CT / MRI / 肿瘤学
  • synthrad — 共享标签:医学影像 / CT / MRI / 肿瘤学
  • ucsf-pdgm — 共享标签:医学影像 / MRI / 肿瘤学
  • fets — 共享标签:医学影像 / MRI / 肿瘤学
  • medpix — 共享标签:医学影像 / CT / MRI
  • nifd — 共享标签:医学影像 / MRI / PET
  • autopet-v — 共享标签:医学影像 / CT / PET / 肿瘤学
  • hecktor2026 — 共享标签:医学影像 / CT / PET / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集