信息速览
影像数据公地 IDC — NCI 云端肿瘤影像公地 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | 影像数据公地 IDC |
| 英文全称 | IDC (Imaging Data Commons) |
| 别名/简称 | NCI IDC;Imaging Data Commons;NCI 影像数据公地 |
| 疾病分类(ICD-11 编码+中文名) | 2A00-2F9Z 恶性肿瘤(跨多癌种:肺、乳腺、脑、结直肠、前列腺、肝、肾、皮肤黑色素瘤等) |
| SNOMED CT | 363346000(malignant neoplastic disease,恶性肿瘤性疾病,跨多癌种) |
| 数据模态 | CT / MRI / PET / 数字病理切片(DICOM SM,明场与荧光)/注释·分割·参数图·影像组学特征 |
| AI 任务类型 | 医学图像分割、图像分类、目标检测、影像组学、预后建模、多模态融合 |
| 样本总数 | 176 个集合、85,682 例病例、1,032,911 个图像序列(截至 2026-04) |
| 数据大小 | 99.27 TB(Data Release 24.0,截至 2026-04) |
| 数据格式 | DICOM(全量统一,含 Segmentation、Whole Slide Microscopy、Parametric Map 等 IOD) |
| 许可证 | CC BY 4.0(>95%,允许商用)+ 少量 CC BY-NC 4.0(按文件标注) |
| 访问级别 | 开放(免注册、免访问申请,公共云桶直连下载) |
| DUO 标签 | NRES(无限制研究使用);CC BY-NC 子集相当于 NCU(非商业使用) |
| 语言 | 英文 |
| 首发日期 | 2020-10(pilot,28 个集合);2021-09(生产版) |
| 最后更新 | 2026-04-27(Data Release 24.0) |
| 发布机构 | 美国国家癌症研究所(NCI) |
| 官方主页 | https://portal.imaging.datacommons.cancer.gov/ |
| 下载地址 | https://portal.imaging.datacommons.cancer.gov/(及 AWS S3 / Google GCS 公共桶) |
| DOI | 10.1158/0008-5472.CAN-21-0950(数据集官方论文) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— DICOM 全量统一 + idc-index 一键下载 + BigQuery 全量元数据 + 双云免出口流量,工程体验顶尖;扣分项:无任务级官方划分、专家标注非全量、TB 级全量获取需自行规划 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、多癌种临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(CRDC 标识符体系、BigQuery 与桶目录结构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NCI、Brigham and Women’s Hospital、Frederick National Laboratory for Cancer Research 及 TCIA 无任何商业利益关联。本页面不销售 IDC 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。IDC 数据免注册、免访问申请即可从公共云桶下载,但每个文件均带许可标签——超过 95% 为允许商用的 CC BY,少量集合为 CC BY-NC,商业用途必须排除后者。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
IDC 是什么? 它是美国国家癌症研究所(NCI)在云端搭建的公开癌症影像库:把散落在 TCIA、TCGA、CPTAC、NLST、HTAN 等十几个项目里的肿瘤影像——CT、MRI、PET 直到数字病理切片——统一转换成 DICOM 格式,放到 Google Cloud 和 AWS 的公共桶里,截至 Data Release 24.0(2026-04-27)已有 176 个集合、85,682 例病例、约 99.27 TB。你不需要注册、不需要申请,一个 URL 就能下载任何文件。
为什么重要? 在 IDC 之前,想做肿瘤影像 AI 的研究者要先闯三关:向各机构逐家申请数据、处理十几种互不兼容的私有格式、再自己搭建算力环境。IDC 把这三关一次拆掉——格式全部统一为 DICOM,元数据全部进 BigQuery 可用 SQL 查询,算力与数据同在云端免出口流量费。它是 NCI 癌症研究数据公地(CRDC)的影像节点,与基因组数据公地(GDC)等通过共同标识符互联,天然支持影像-基因-蛋白的多组学联合分析。
你能用它做什么? 一行 pip install idc-index 即可在本地或 Colab 检索并下载任意子集;用 1,018 例 本地或 Colab 检索并下载任意子集;用 1,018 例 LIDC-IDRI 的四位放射科医师共识标注训练肺结节分割;用 NLST 全量 的四位放射科医师共识标注训练肺结节分割;用 NLST 全量低剂量 CT(附官方 标注训练肺结节分割;用 NLST 全量低剂量 CT(附官方 TotalSegmentator 分割与影像组学特征)做筛查队列研究;用 DICOM 化的 分割与影像组学特征)做筛查队列研究;用 DICOM 化的 GTEx/CPTAC/HTAN 病理切片做计算病理;或者只是在大模型训练中把它当作最大的公开肿瘤影像语料之一。它不提供现成的任务划分和标签——这是你唯一需要自己动手的地方。
§1.1 摘要
IDC 由 NCI 资助、Brigham and Women’s Hospital(哈佛医学院放射科 Andrey Fedorov 团队)与 Frederick National Laboratory 联合建设,2020 年 10 月发布 pilot(含 28 个 TCIA 集合),2021 年 9 月进入生产阶段,此后每 3-4 个月发布一次新版本(截至 2026-04 已到 Data Release 24.0)。工程上,IDC 做四件事:其一,把来源各异的数据(包括 TCGA、CPTAC、NLST、HTAN 的专有格式病理切片)全部转换为标准 DICOM 表示;其二,为每个文件建立随 DICOM 数据模型的元数据记录并载入 Google BigQuery 公共表,使全部 DICOM 属性(含私有标签)可用 SQL 检索;其三,把数据与计算同址——数据存于 Google Cloud 与 AWS 公共桶,配合 OHIF、Slim、VolView 查看器、idc-index Python 包与 MHub.ai 模型库,形成免出口流量费的云上分析闭环;其四,全部数据版本化,历史版本持久可访问,保证已发表分析可精确复现。许可方面,超过 95% 的数据为允许商用的 CC BY,少量为 CC BY-NC,每个文件单独标注。
§1.2 战略价值分析
AI 工程基础设施维度:医疗影像 AI 的最大隐性成本从来不是模型,而是数据工程——下载、去标识核对、格式转换、元数据对齐动辄耗费数月。IDC 用「统一 DICOM + BigQuery 元数据 + 公共桶」把这条流水线压缩到小时级:idc-index 用 DuckDB 在本地完成 SQL 检索、用 s5cmd 并行下载,全程免凭证;同样的 cohort 也可以直接在 BigQuery 里用一句 SQL 定义,再在 Colab 免费层或 NIH Cloud Lab 的 GPU 上原地训练。对需要快速验证想法的算法团队而言,IDC 是目前工程摩擦最小的公开肿瘤影像入口。
开放科学与可复现性维度:IDC 把「版本化」做成了一等公民——每个数据发布是一个完整快照,series 级的 crdc_series_uuid 不可变,论文发表数年后仍能取回当时分析过的完全相同的文件;当 PHI 问题或撤稿发生时,数据会从所有版本中移除,而非静默修改。配合强制引用官方论文(Fedorov et al., 2021, Cancer Research, DOI:10.1158/0008-5472.CAN-21-0950)与文件级许可标签,IDC 实际上示范了政府资助影像数据资源的治理范式,这套范式正在通过 NIH Data Management and Sharing Policy 影响整个领域。
多组学融合维度:IDC 不是孤立影像库,而是 CRDC 的影像节点——影像数据通过共同标识符与基因组数据公地(GDC)、蛋白组数据公地(PDC)等关联,TCGA、CPTAC、NLST、CCDI 等项目的影像与分子数据因此可以按患者直接联合。这使 IDC 成为影像基因组学(radiogenomics)与影像-病理-基因三模态研究的首选底座,也是它区别于普通「影像下载站」的本质所在。
教学与生态维度:IDC 也是医学影像 AI 教学的事实标准底座——官方教程仓库覆盖从「第一次 pip install」到「BigQuery 规模化查询」的完整学习路径,Colab 免费层意味着学生无需任何机构资源即可上手 TB 级真实数据。围绕它生长出的 idc-index、Highdicom、Slim、SlicerIDCBrowser、MHub.ai 等开源组件互相咬合,形成了医疗影像领域少见的、由公共资金支撑却按开源社区方式运转的完整生态,这套「数据-工具-算力三位一体」的模式正在被全球多个国家级影像平台效仿。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 差异化定位 |
|---|---|---|---|---|
| IDC | 176 集合 / 99.27 TB / 85,682 例(截至 2026-04) | CT、MRI、PET、数字病理(明场+荧光) | 专家注释(如 LIDC-IDRI)+ AI 分割与影像组学(NLST) | 云原生、全量 DICOM 统一、版本化、免 egress 双云、与 CRDC 多组学互联 |
| TCIA | 与 IDC 公开内容高度重叠(全部公开 DICOM 集合均镜像至 IDC),另托管私有集合 | 以放射为主 | 各集合原始提交标注 | 去标识化策展方与上传入口;下载制、无云计算生态 |
| LIDC-IDRI(作为集合) | 1,018 例胸部 CT | CT | 4 位胸部放射科医师两轮盲读+共识的肺结节轮廓 | IDC 内诊断级标注最充分的经典集合,LUNA16 基准数据源 |
| NLST(作为集合) | 数万例筛查参与者,IDC 中最大单一放射集合 | 低剂量 CT | 筛查终点(病理确诊)+ 官方 TotalSegmentator 分割与影像组学特征 | 全球最大肺癌筛查随机试验(53,454 人)的原始影像,仅 IDC 提供云化增值层 |
| GTEx(病理部分,经 IDC) | 25,503 张正常组织切片 / 8.5 TB(v19 入库) | 明场 H&E(DICOM SM) | 正常组织来源注释 | 大规模正常组织病理对照,与 TCGA 肿瘤切片构成配对研究底料 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 关键内容 |
|---|---|---|
| 2020-10 | IDC pilot 发布 | 28 个 TCIA 放射集合(含 TCGA 影像、LIDC-IDRI、TCIA 放射集合(含 TCGA 影像、LIDC-IDRI、NSCLC-Radiomics),GCP requester-pays 桶 |
| 202),GCP requester-pays 桶 | ||
| 2021-09 | 生产版(production)上线 | 进入 CRDC 正式服务;官方论文 Cancer Research 2021 发表 |
| 2023-06 | Data Release v15 | 已含大部分 TCIA 公开放射集合 + TCGA/CPTAC/NLST/HTAN DICOM 化病理 + Visible Human |
| 2024-09 | Data Release v19 | 数字病理大扩容:GTEx 25,503 张切片(8.5 TB)、Cancer Moonshot Biobank 590 张、CCDI-MCI 464 张,全部 CC BY |
| 2024-12 ~ 2026-03 | Data Release v20-v23 | 集合数与病例数稳步增长,病理与影像衍生数据持续入库;全部历史版本保留可查 |
| 2026-04-27 | Data Release 24.0 | 176 个集合、85,682 例病例、1,032,911 个图像序列、99.27 TB(撰写本条目时的当前版本) |
§1.5 典型应用场景
- 肺结节检测与分割:LIDC-IDRI 提供 1,018 例胸部 CT 与四位放射科医师共识轮廓,是 LUNA16 基准的数据源;配合 NSCLC-Radiomics 与 NLST 集合可扩展到数千例。
- 多器官自动分割规模化验证:NLST 全量 CT 已预置 TotalSegmentator 分割与影像组学特征,可直接用于模型对照、特征提取方法学与分布偏移研究。
- 影像基因组学:TCGA 影像(经 IDC)与 GDC 基因组数据按患者关联,复现 TCGA-GBM/LUAD 等经典 radiogenomics 队列。
- 计算病理与基础模型预训练:GTEx、CPTAC、HTAN、CMB 的 DICOM SM 病理切片提供数十 TB 的明场/荧光数据,配合 Slim 查看器与 Highdicom 标注编码。
- 云上教学与原型:Colab 免费层 + idc-index + OHIF/Slim 查看器构成零成本教学环境,适合课程作业与产品原型验证。
场景选择建议:以「标注质量优先」立项(如分割算法)选 LIDC-IDRI/NSCLC-Radiomics 起步,以「规模优先」立项(如基础模型预训练、弱监督)直接上 NLST 与 TCGA 全量,以「多组学」立项则锁定 TCGA/CPTAC 并同步申请 GDC 侧数据。无论哪条路,先跑 rider_pilot 冒烟再放大 cohort 都是最稳的路径。
§2 医学背景
§2.1 ICD-11 编码映射
IDC 覆盖全身主要实体瘤与部分儿科肿瘤,其影像内容横跨 ICD-11 肿瘤章节(2A00-2F9Z)。下表列出数据量最大、研究最活跃的癌种及其编码锚点:
| ICD-11 编码 | 中文名称 | IDC 内代表内容 |
|---|---|---|
| 2A25 | 支气管或肺恶性肿瘤 | NLST、LIDC-IDRI、NSCLC-Radiomics、TCGA-LUAD/LUSC |
| 2A00-2A0Z | 中枢神经系统恶性肿瘤 | TCGA-GBM/LGG、QIN 脑肿瘤系列 |
| 2B70 | 结肠恶性肿瘤 | TCGA-COAD、CPTAC 结直肠癌队列 |
| 2C12 | 肝与肝内胆管恶性肿瘤 | TCGA-LIHC、CPTAC 肝癌队列 |
| 2C10 | 胰腺恶性肿瘤 | TCGA-PAAD、CPTAC 胰腺队列 |
| 2C60-2C6Z | 乳腺恶性肿瘤 | TCGA-BRCA、QIN-BREAST、乳腺放射影像集合 |
| 2C82 | 前列腺恶性肿瘤 | QIN-PROSTATE、PROSTATE-DIAGNOSIS、TCGA-PRAD |
| 2C30 | 皮肤恶性黑色素瘤 | TCGA-SKCM 病理与相关影像 |
| 2C90 | 肾恶性肿瘤 | TCGA-KIRC、RIDER 集合 |
| 2B33 | 卵巢恶性肿瘤 | TCGA-OV 病理影像 |
注:IDC 的集合粒度以原始项目为准,同一集合可覆盖多个 ICD-11 部位码;儿科与青年肿瘤内容来自 CCDI-MCI 与 Cancer Moonshot Biobank。
§2.1b SNOMED CT 映射
| 标签概念 | SNOMED CT 编码 | 术语 | IDC 对应场景 |
|---|---|---|---|
| 恶性肿瘤性疾病(总类) | 363346000 | Malignant neoplastic disease | 全库疾病域锚点 |
| 支气管肺恶性肿瘤 | 363358000 | Malignant neoplastic disease of bronchus and lung | NLST / LIDC-IDRI / NSCLC-Radiomics |
| 乳腺恶性肿瘤 | 254837009 | Malignant tumour of breast | TCGA-BRCA / 乳腺影像集合 |
| 结肠恶性肿瘤 | 363406005 | Malignant neoplastic disease of colon | TCGA-COAD / CPTAC |
| 前列腺恶性肿瘤 | 399068003 | Malignant tumour of prostate | QIN-PROSTATE 系列集合 |
§2.2 疾病简介与流行病学
恶性肿瘤是全球最大的死因组之一:据 IARC 的 GLOBOCAN 2022 估计,2022 年全球新发癌症约 2,000 万例、死亡约 970 万例,其中肺癌以约 250 万新发居首。影像在癌症防治全链条中承担四种角色:筛查(低剂量 CT 使高危人群肺癌死亡率下降约 20%——NLST 试验的核心结论,见 National Lung Screening Trial Research Team et al., 2011, NEJM, DOI:10.1056/NEJMoa1102873)、诊断与分期(CT/MRI/PET 多模态评估)、治疗反应评估(RECIST 等测量标准依赖影像),以及新型生物标志物(影像组学特征从常规影像中挖掘肿瘤异质性信息)。IDC 的价值在于把这条链条上各环节所需的原始证据——筛查 CT、诊断多模态影像、病理切片、专家与 AI 标注——汇集为可计算、可复现的公共资源,使 AI 方法可以跨越单一机构数据的规模与多样性天花板。
GLOBOCAN 2022 估计的主要癌种全球负担与其在 IDC 中的影像覆盖:
| 癌种 | 2022 全球新发(约) | 2022 全球死亡(约) | IDC 影像覆盖 |
|---|---|---|---|
| 肺癌 | 250 万 | 182 万 | NLST、LIDC-IDRI、TCGA-LUAD(最充分) |
| 乳腺癌 | 230 万 | 67 万 | TCGA-BRCA、QIN-BREAST |
| 结直肠癌 | 193 万 | 90 万 | TCGA-COAD/READ、CPTAC |
| 前列腺癌 | 147 万 | 40 万 | QIN-PROSTATE 系列 |
| 胃癌 | 97 万 | 66 万 | TCGA-STAD 病理 |
| 肝癌 | 87 万 | 76 万 | TCGA-LIHC、CPTAC |
(数字为 GLOBOCAN 2022 公开估计的约数;IDC 覆盖情况按集合构成归纳,具体以 Portal 实时数据为准。)
§2.3 临床任务定义
| 临床任务 | 定义 | IDC 支撑内容 |
|---|---|---|
| 筛查 | 对高危无症状人群的定期影像检查 | NLST 低剂量 CT(含随访与确诊终点) |
| 检测与分割 | 病灶检出、器官与肿瘤体积分割 | LIDC-IDRI 共识轮廓、TotalSegmentator 全器官分割 |
| 诊断与分类 | 良恶性判别、组织学类型与分级预测 | TCGA/CPTAC 影像-病理-基因组配对数据 |
| 分期与预后 | 侵犯范围评估、生存结局建模 | 多模态影像 + 生存随访元数据 |
| 影像组学 | 从影像提取高通量定量特征 | NSCLC-Radiomics、NLST 预置影像组学特征 |
| 病理定量分析 | 切片区域注释、核分割、多光谱解析 | HTAN 多通道荧光、CPTAC/TCGA DICOM SM 病理 |
| 放疗计划支持 | 靶区勾画与危及器官分割 | RT Structure Set 对象(LIDC-IDRI 等) |
| 影像-文本多模态 | 影像表征与报告语义对齐 | 影像 + 提交方报告附件(经临床数据集) |
§2.4 患者人群构成
| 集合 | 人群 | 检查类型 | 特点 |
|---|---|---|---|
| NLST | 53,454 名高危重度吸烟者(筛查臂与对照臂的影像子集入库) | 低剂量 CT(年检多轮) | 筛查队列,附确诊终点与 AI 分割 |
| LIDC-IDRI | 1,018 例疑似或确诊肺部病变患者 | 胸部 CT | 四位放射科医师两轮盲读结节标注 |
| TCGA 系列 | 多癌种肿瘤患者(肺、脑、乳腺、结直肠等) | 诊断期 CT/MRI + 病理切片 | 与 GDC 基因组数据按患者关联 |
| CPTAC / HTAN | 多癌种手术患者 | 病理切片(明场/多通道荧光)+ 影像 | 蛋白组与空间组学配对 |
| GTEx | 数百名正常组织供体 | 明场 H&E 切片 | 正常组织对照(v19 入库 25,503 张) |
| CCDI-MCI / CMB | 儿童与青年肿瘤(CNS 肿瘤、肉瘤等)及 longitudinally 随访成人患者 | 病理切片 | 儿科/AYA 与耐药研究方向 |
| QIN 系列 | 多机构定量影像研究网络受试者 | MRI/CT/PET | 多参数定量成像协议研究 |
| RIDER 系列 | 各部位肿瘤与正常对照受试者 | CT/MR/PET(含重复扫描) | 测试-重测可靠性研究素材 |
§2.5 临床价值
对临床研究者,IDC 首次提供了「一个 SQL 就能跨越 176 个集合」的肿瘤影像检索能力:按癌种、模态、体重指数、设备厂商等任意 DICOM 属性组合 cohort,再一键下载或在云端分析,把传统上按月计的队列构建压缩到小时级。对方法学研究者,多中心、多厂商的数据天然构成分布偏移测试床,可以在论文中回答「模型在未见过的机构/设备上表现如何」。对转化团队,TCGA/CPTAC/NLST 的影像-分子-终点三层结构允许直接开展影像标志物验证,而不必再从零谈判数据使用协议——这在降低随访终点获取成本的同时,也要求使用者理解各集合原始设计(如 NLST 的筛查适应证偏倚),避免把工具数据当作流行病学抽样。
§2.6 金标准与参考标注
| 标注体系 | 划分/来源 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| LIDC-IDRI 结节轮廓 | 集合内 1,018 例胸部 CT | 两轮独立盲读 + 各自标注,第二轮可见第一轮结果以形成近似共识 | 4 位胸部放射科医师 | 诊断参考(近似金标准) |
| NLST 筛查终点 | NLST 随访数据库 | 影像发现经病理确诊确认 | 临床试验中心 | 终点金标准(随临床数据库分发) |
| TotalSegmentator 分割 | NLST 全量 CT(IDC 官方增值) | AI 模型自动推理,DICOM Segmentation 对象封装 | 无人工复核声明(自动生成) | 参考底料(非金标准,需抽样验证) |
| GTEx 组织来源注释 | GTEx 项目 | 供体组织解剖部位与质控状态 | GTEx 病理质控团队 | 正常组织参考标注 |
使用金标准的三条纪律:LIDC-IDRI 共识轮廓实为「多观察者轮廓集合」,训练时可取交集或并集,评估时须声明处理方式;NLST 终点必须通过其临床数据库联表获取,直接从影像元数据推断诊断是常见错误;TotalSegmentator 输出在任何论文中都应标注为「模型生成参考」,不得表述为人工金标准。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐路径 | 大小/成本 | 理由 |
|---|---|---|---|
| 探索最新数据、发表论文 | 当前版本(idc-index 默认跟随最新 Release,截至 2026-04 为 v24.0) | 按需下载,公共桶免 egress | 数据最全;注意引用时锁定版本号 |
| 复现他人已发表分析 | 论文对应的版本化数据集(如 BigQuery idc_v23)或 manifest 中的 crdc_series_uuid 清单 |
同上 | 旧版本持久保留,UUID 保证文件级一致 |
| 大规模元数据检索/流行病学统计 | BigQuery 公共表 bigquery-public-data.idc_current(需 GCP 项目) |
查询按扫描量计费,公共表每月有免费额度 | 全部 DICOM 属性可 SQL 化;idc-index 本地 DuckDB 是零成本轻量替代 |
| 商用产品开发 | 仅 CC BY 文件(过滤许可标签;NC 文件独立存放于 idc-open-data-cr 桶) |
同上 | CC BY-NC 子集法律上禁止商用 |
| 数字病理分析 | DICOM SM 集合(GTEx/CPTAC/HTAN/TCGA/CMB/MCI)+ Slim/wsidicom 工具链 | 病理切片单张可达 GB 级 | 需金字塔瓦片式读取,勿整张载入内存 |
| 教学冒烟测试 | rider_pilot(约 10.5 GB) | 10 GB 磁盘 + 笔记本即可 | 全链路最小闭环,五分钟跑通 |
| AI 批量推理生产 | 当前版本 + manifest + 云端 VM/GPU | 按序列体量估算 | 数据与计算同云免 egress,参考 NLST 生产管线 |
§3.1 模态详情
| 模态/数据类型 | DICOM IOD | 代表集合 | 说明 |
|---|---|---|---|
| CT | CT Image Storage | NLST、LIDC-IDRI、NSCLC-Radiomics、TCGA、RIDER | 数量与体积主体,多数含厚薄两套重建 |
| MR | MR Image Storage | QIN 系列(头颈、脑、前列腺、乳腺)、TCGA、RIDER | 多参数序列(T1/T2/DWI 等) |
| PET(含 PET/CT) | PET Image Storage | NLST、TCGA、RIDER-*.PET | 多与同机 CT 配对,支持衰减校正研究 |
| 数字病理(明场) | VL Whole Slide Microscopy Image | GTEx、TCGA、CPTAC、CMB、MCI | 金字塔瓦片式,单张数 GB;v19 起大规模扩容 |
| 数字病理(荧光/多光谱) | VL Whole Slide Microscopy(多通道) | HTAN | 空间组学用途 |
| 分割对象 | Segmentation Image | NLST(TotalSegmentator)、LIDC-IDRI | DICOM Segmentation 封装,与像素帧对齐 |
| 结构/注释 | RT Structure Set、Microscopy Bulk Simple Annotations | LIDC-IDRI、HTAN | 轮廓与病理区域注释 |
| 参数图 | Parametric Map | 放射与病理衍生集合 | 灌注、扩散等定量图 |
| 普通/可见光影像 | VL Photographic Image | 部分临床集合 | 体表摄影等辅助影像(数量少) |
§3.2 按子集样本数
| 子集(collection_id) | 样本规模 | 模态 | 角色 |
|---|---|---|---|
| nlst | 数万例筛查参与者、约百万级 CT 序列主体 | 低剂量 CT | 最大单一集合 |
| lidc_idri | 1,018 例 | CT | 专家标注金标准 |
| gtex | 25,503 张切片(8.5 TB,v19 入库) | 病理(明场) | 正常组织对照 |
| nsclc_radiomics | 422 例 | CT | 影像组学经典集合 |
| cmb(Cancer Moonshot Biobank) | 590 张切片(1.4 TB,v19 入库) | 病理 | 耐药纵向研究 |
| mci(CCDI-MCI) | 464 张切片(0.5 TB,v19 入库) | 病理 | 儿科/AYA 肿瘤 |
| tcga_gbm / tcga_luad 等 | TCGA 各癌种影像与病理子集 | MRI/CT/病理 | 影像-基因组配对 |
| qin_headneck | 多机构头颈部肿瘤受试者 | MRI/CT | 定量成像协议研究 |
| rider_* 系列 | 各部位肿瘤重复扫描受试者 | CT/MR/PET | 测试-重测与纵向分析 |
完整集合清单与实时计数以 IDC Portal 与
idc-index的get_collections()为准。
§3.3 数据格式
| 层级 | 格式 | 说明 |
|---|---|---|
| 像素数据 | DICOM(application/dicom) | 全量统一;原始专有格式(如 SVS、NRRD)已在入库时转换 |
| 元数据 | BigQuery 表 / idc-index 本地 DuckDB 索引 | 覆盖全部 DICOM 属性(含私有标签)与云上路径 |
| 注释/分割 | DICOM Segmentation、RT Structure Set、Highdicom 可编码对象 | 与像素帧通过引用对齐 |
| 下载清单 | manifest(s5cmd/BQ 查询结果) | cohort 级批量下载入口 |
| 查看器通道 | DICOMweb(WADO-RS) | 支持逐帧/逐瓦片访问,病理场景关键 |
§3.4 存储大小
全库约 99.27 TB(Data Release 24.0,2026-04-27),其中 NLST 等放射集合占据绝对主体,GTEx 单集合病理即达 8.5 TB。集合间体量差异极大:最小的示例集合 rider_pilot 约 10.5 GB,适合冒烟测试;TB 级集合则应按 series 或 manifest 粒度选择性获取。idc-index 的 series_size_MB 字段可在下载前精确估算体量。
体量规划的经验法则:NLST 单独占据全库放射部分的绝对主体,做「全量级」实验前先确认磁盘与带宽;GTEx 病理 8.5 TB 意味着「下载全部切片再处理」在多数实验室不现实,应以 DICOMweb 逐瓦片流式读取或云端处理为主;典型的论文级 cohort(数百到数千序列)通常落在 50 GB-2 TB 区间,单卡工作站配 2-4 TB SSD 即可容纳。
§3.5 标注方式
三类并存:其一,人工专家标注——以 LIDC-IDRI 的四医师两轮盲读为代表,随原始项目提交;其二,AI 自动生成——IDC 官方对 NLST 全量 CT 执行 TotalSegmentator 推理,产出全器官分割与影像组学特征(Thiriveedhi et al., 2024, Research Square, DOI:10.21203/rs.3.rs-4351526/v1),并用 AI 注释富集 NLST 与 NSCLC-Radiomics(Krishnaswamy et al., 2023, arXiv);其三,格式转换伴生标注——将原始项目的 NRRD/SVS 等格式连同注释转换为 DICOM Segmentation 与 Microscopy Annotations 对象,转换过程公开可审计。
三类标注的可靠性排序与用途建议:专家标注 > 终点确认标注 > AI 生成标注。训练时混用须在数据卡(data card)中逐集合声明来源;评估集应尽量限定在专家标注或终点确认的子集上。
§3.6 标注者资质与一致性
LIDC-IDRI 的标注者均为胸部放射科医师,采用两轮独立盲读、第二轮可见第一轮结果的渐进式共识协议;该协议使其成为领域内被引用最多的结节标注来源(见 Armato et al., 2011, Medical Physics, DOI:10.1118/1.3528204)。病理标注继承 GTEx/CPTAC/HTAN 原始项目的病理质控流程。AI 生成标注(TotalSegmentator 等)无逐例人工复核声明,官方定位为增值底料而非金标准,使用者应自行抽样验证。
§3.7 采集周期
各集合的原始采集跨越数十年(NLST 于 2002-2007 年执行年度低剂量 CT 筛查;TCGA 集中于 2005 年后),而 IDC 自身的发布周期为每 3-4 个月一个版本,每次发布是当时的完整快照。引用时应同时说明原始采集年代与所用 IDC 版本号。
§3.8 地域覆盖
以美国机构为主:NLST 覆盖全美多中心筛查站点,TCGA/CPTAC/HTAN 为美国主导的多中心项目,QIN 为北美多机构网络;亦包含少量国际合作数据。地域集中性是评估模型跨人群泛化时必须声明的前提。
§3.9 设备规格
IDC 聚合多家厂商(GE、Siemens、Philips、Toshiba/Canon 等)的 CT/MR/PET 设备与多家病理扫描仪,具体参数保存在每实例的 DICOM 属性中,可在 BigQuery 中直接统计——这也是做设备域泛化实验前的基础核查步骤:
| DICOM 属性 | 记录内容 | 泛化研究用途 |
|---|---|---|
| Manufacturer | 设备厂商 | 厂商域外验证分组 |
| ManufacturerModelName | 具体型号 | 型号级指纹分析 |
| KVP / XRayTubeCurrent | CT 球管电压/电流 | 剂量协议分层 |
| SliceThickness | 层厚 | 重建协议归一 |
| MagneticFieldStrength | MR 场强(1.5T/3T) | MR 序列域分层 |
| ConvolutionKernel | 重建核 | CT 纹理类特征的关键协变量 |
§3.10 深度溯源链
每一份文件的溯源链为:原始项目(如 NLST)→ 去标识化(TCIA 或 NCI 安全部门批准的数据协调中心)→ IDC 入库 DICOM 化与元数据对齐 → 版本化发布(v1…v24)→ 云上路径(s3://idc-open-data/{crdc_series_uuid}/)→ 文件级许可标签。crdc_series_uuid 在 series 内容不变时保持稳定,内容变更则分配新 UUID 并保留旧路径,形成可审计的完整谱系。
原始项目(NLST / TCGA / CPTAC ...)
│ 采集 + 初步整理
▼
去标识化(TCIA 或 NCI 安全部门批准的 DCC)
│ PHI 清除 + 风险评估文档
▼
IDC 入库(DICOM 化 + 元数据对齐 + 许可标注)
│ 分配 crdc_series_uuid
▼
版本化发布(v1 ... v24,每版为完整快照)
│
▼
公共桶文件(s3://idc-open-data/{crdc_series_uuid}/)
+ BigQuery 元数据(含文件级许可与云路径)
§4 数据结构
§4.0 目录树
数据按「BigQuery 元数据 + 公共桶文件」双层组织,本地下载后按 series 分目录存放:
# ---- 云端元数据层(BigQuery 公共数据集) ----
bigquery-public-data.idc_current # 指向最新版本的别名
bigquery-public-data.idc_v24 # 版本化元数据(v1..v24 均保留)
├── dicom_all # 全部 DICOM 属性 + 云上路径 + 许可标签
├── (其他辅助表:集合汇总、临床数据等独立数据集)
# ---- 伴随临床数据(独立 BigQuery 数据集,非 dicom_all 列) ----
bigquery-public-data.idc_current_clinical
├── 各集合临床表(字段口径由原始提交方决定)
└── 通过 PatientID / 病例 ID 与影像元数据联表
# ---- 云端文件层(AWS S3 与 Google GCS 双镜像,路径结构一致) ----
s3://idc-open-data/ # CC BY 文件(另有 idc-open-data-two 第二 CC BY 桶)
s3://idc-open-data-cr/ # CC BY-NC 文件独立存放
├── {crdc_series_uuid}/ # 每个 DICOM series 一个文件夹
│ ├── 000001.dcm # 逐实例存放 .dcm 文件
│ └── ...
# ---- 本地下载后(idc-index download_from_selection) ----
./idc_data/
├── {crdc_series_uuid}/ # 与桶内一致,按 series 分目录
│ └── *.dcm
└── ...
§4.1 DAIMS 数据字典(idc-index / BigQuery 核心字段)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| collection_id | Text | 集合短名(小写+下划线) | lidc_idri | 分域训练/域外验证 | 个别集合更名或拆分 | 无 | 176 个合法值 |
| PatientID | Text | 去标识后患者 ID | LIDC-IDRI-0001 | 患者级分组防泄漏 | 跨集合非全局唯一 | 无 | 集合内唯一 |
| StudyInstanceUID | Text | 检查(Study)级 DICOM UID | 1.3.6.1.4.1.14519… | 按检查聚合多序列 | 去标识后可能重新生成 | 无 | DICOM UID 格式 |
| SeriesInstanceUID | Text | 序列级 DICOM UID | 1.3.6.1.4.1.14519… | 下载与引用基本单元 | 版本更新可变更 | 无 | DICOM UID 格式 |
| crdc_series_uuid | Text | IDC 系列级稳定标识 | 64 位 UUID 字符串 | 复现锚点(manifest 主键) | 内容变更时更换 | 无 | UUID 格式 |
| Modality | Text | 模态代码 | CT / MR / PT / SM | 模态过滤 | PET 记为 PT 易踩坑 | 无 | DICOM 术语表 |
| BodyPartExamined | Text | 检查部位 | CHEST / HEAD | 部位筛选 | 非必填,部分集合缺失 | 空值=未提供 | DICOM 术语表 |
| SeriesDescription | Text | 序列描述 | AXIAL 1.25mm | 重建/序列筛选 | 提交方自由文本,风格不一 | 空值=未提供 | 自由文本 |
| series_size_MB | Float | 序列体积(MB) | 245.3 | 下载前体量预算 | 随版本微变 | 无 | > 0 |
| license_short_name | Text | 文件级许可简称 | CC BY / CC BY-NC | 商用合规过滤 | 无 | 无 | 枚举 |
§4.2 标签与模态分布
IDC 是资源库而非标注数据集,不存在全库统一标签;各集合自带标签密度差异显著:LIDC-IDRI 的结节轮廓逐例可用,NLST 的 AI 分割与影像组学特征覆盖全部 CT 序列,而 TCGA 影像多数仅携带诊断上下文。模态分布上,CT(尤其 NLST)构成序列数量与体积的主体,MR 与 PET 次之,病理切片虽张数过万但单张体量大。做监督学习前,务必先用 SQL 统计「有标注的子集」的真实规模,而非全库 85,682 例。
# 模态与集合分布速查(idc-index 本地 SQL,零成本)
from idc_index import IDCClient
client = IDCClient.client()
dist = client.sql_query("""
SELECT collection_id, Modality,
COUNT(*) AS n_series,
ROUND(SUM(series_size_MB)/1024.0, 1) AS size_GB
FROM index
GROUP BY collection_id, Modality
ORDER BY size_GB DESC
LIMIT 20
""")
print(dist) # 下钻前的必备动作:先看清楚体量与构成
§4.3 关键统计
| 指标 | 数值 | 来源 |
|---|---|---|
| 集合数 | 176 | IDC Portal(截至 2026-04) |
| 病例数(cases) | 85,682 | 同上 |
| 图像序列数 | 1,032,911 | 同上 |
| 数据总量 | 99.27 TB | 同上 |
| CC BY 覆盖率 | >95% | NCI 官方介绍 |
| 发布节奏 | 每 3-4 个月一版 | IDC FAQ |
| 单文件许可标签 | 100% 文件覆盖 | 同上 |
| 病理切片(GTEx,v19 起) | 25,503 张 / 8.5 TB | v19 发布公告 |
| 版本快照保留 | 全部历史版本(v1-v24) | AWS Registry |
§4.4 数据层级
Collection(collection_id)
└── Patient(PatientID,去标识后)
└── Study(StudyInstanceUID,一次检查)
└── Series(SeriesInstanceUID + crdc_series_uuid,一组像素 + 元数据)
└── Instance(SOPInstanceUID,单帧/单切片 .dcm 文件)
在 DICOM 五级层级之上,IDC 附加了两个治理层:版本层(每次 Release 是一个完整快照)与许可层(每个文件带许可标签)。理解「SeriesInstanceUID 可能随版本变更,而 crdc_series_uuid 才是复现锚点」是本数据结构的第一课。
这一层级结构带来三个直接推论:第一,任何按「文件」计数的统计都可能夸大规模(一例患者的多序列会重复计数病灶),论文中应以 Patient 或 Study 为单位;第二,跨模态对齐(CT 与同机 PET、影像与病理)必须经由 Study/Patient 层完成,序列层之间没有直接引用;第三,下载与去重的最小合理粒度是 series——以 instance 为粒度会产生海量小文件,以 collection 为粒度则无法精确控制体量。
§4.5 缺失值与信息性缺失
| 字段/场景 | 缺失形态 | 处理建议 |
|---|---|---|
| BodyPartExamined | 空值(非 DICOM 必填) | 以 SeriesDescription 文本匹配兜底,勿硬过滤 |
| SeriesDescription | 空值或提交方自由文本 | 规则匹配时容忍大小写/缩写差异 |
| 伴随临床数据 | 存放于独立 BigQuery 数据集,需按患者 ID 联表 | 缺失=原始提交即无,非 IDC 遗漏 |
| PET 模态代码 | 记为 PT 而非 PET | 过滤条件用 IN (‘PT’) 而非 ‘PET’ |
| 早期版本的 series | 桶中旧文件夹仍存在但已退出当前索引 | 检索一律走当前版本表,勿直接遍历桶 |
| PET 模态的配对 CT | PET/CT 中 CT 序列独立存在 | 按 StudyInstanceUID 聚合后再取模态组合 |
| 集合级临床字段口径 | 各集合字段名/编码不统一 | 联表后逐集合映射,勿假设全局一致 |
§5 划分与使用建议
§5.1 官方划分
IDC 不提供任何任务级官方划分——它是数据资源而非基准数据集。任何论文中的 train/val/test 数字都是作者自建的,引用时必须注明「划分由原作者构建」。
这一设计是特性而非缺陷:同一份底料在筛查终点预测、结节分割、影像组学复现等不同任务下需要完全不同的切分逻辑,强加统一划分反而会误导。代价是入门者缺少「开箱即跑」的锚点——官方教程选择了用端到端笔记本(而非固定划分)来填补这一空缺。
§5.2 社区惯例划分
LIDC-IDRI 系研究多按患者随机 8:1:1 划分或沿用 LUNA16 的 10 折列表;NLST 研究常按站点或受试者划分并保留外部集合(如 NSCLC-Radiomics)作测试。复现既有论文时,优先索取其 manifest(crdc_series_uuid 清单)而非重新构建划分。
§5.3 泄漏风险(重点)
- 患者级泄漏:同一患者常有多序列(薄/厚层重建、多期增强、多时相随访),按 SeriesInstanceUID 随机划分会让同一患者同时出现在训练与测试集,指标虚高。
- 集合内机构聚集:单机构集合(如部分 QIN 子集)整体划入训练集会放大设备域过拟合。
- 跨模态同源:TCGA 患者的 CT、MRI 与病理切片同源,多模态项目中若按文件而非患者切分会造成跨模态泄漏。
- AI 增值标注的自证:在 TotalSegmentator 的输出上训练再在同一批图像上评估,只能证明模型学会了模仿该模型。
§5.4 交叉验证建议
用 sklearn.model_selection.GroupKFold 并以 PatientID 为 group;涉及机构泛化时改用「留一集合/留一机构」方案。所有 fold 的 manifest 都应保存 crdc_series_uuid 列表,保证跨版本可复跑。
from sklearn.model_selection import GroupKFold
import pandas as pd
# df: 来自 idc-index 检索结果,含 PatientID 与 SeriesInstanceUID
# 键原则:group 必须是 PatientID(患者级隔离),而非序列/检查级
gkf = GroupKFold(n_splits=5)
splits = []
for fold, (tr, te) in enumerate(gkf.split(df, groups=df["PatientID"])):
splits.append({
"fold": fold,
"train_series": df.iloc[tr]["SeriesInstanceUID"].tolist(),
"test_series": df.iloc[te]["SeriesInstanceUID"].tolist(),
})
# 将 splits 序列化为 manifest 存档,附 IDC 版本号
§5.5 外部验证建议
推荐的验证链:内部 LIDC-IDRI → 同任务异集合 NSCLC-Radiomics → 异设计 NLST → 异国家/异设备数据。至少跨越一层才算外部验证,跨越两层(集合+机构)才能支撑泛化性声明。
注意 IDC 与 TCIA 同源这一事实的隐藏含义:从 IDC 集合切出的测试集与从 TCIA 下载的同一集合并非独立验证——两者是同一批原始影像的不同发行渠道。真正的外部验证需要 IDC 之外的独立资源。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
在 Google Colab(免费层即可)或任何 Jupyter 环境:
# 云端零配置起步:无需 GCP/AWS 账号、无需凭证
!pip install --quiet idc-index
from idc_index import IDCClient
client = IDCClient.client()
print(f"IDC has {len(client.get_collections())} collections") # 截至 2026-04 为 176
# 挑一个最小集合(rider_pilot,约 10.5 GB)试手
client.download_from_selection(collection_id="rider_pilot", downloadDir="./idc_data")
§6.1 快速上手
# =====================================================================
# 环境准备:Python 3.10+,pip install idc-index(自带 s5cmd 下载引擎)
# 目录结构预期:downloadDir 下按 crdc_series_uuid 建子目录存放 .dcm 文件
# data_root 拼接关系:data_root = downloadDir;series 子目录名即 UID,
# 无需自行拼接云路径——idc-index 已封装好桶寻址
# 最小可用子集:先 SQL 检索 5 个 CT 序列(约 1-2 GB)验证全链路
# =====================================================================
from idc_index import IDCClient
client = IDCClient.client()
# 1) 检索:本地 DuckDB 直接跑 SQL,零凭证、零成本
df = client.sql_query("""
SELECT collection_id, PatientID, SeriesInstanceUID,
Modality, series_size_MB
FROM index
WHERE Modality = 'CT'
AND collection_id = 'rider_pilot'
ORDER BY series_size_MB
LIMIT 5
""")
print(df)
# 2) 下载:按序列 UID 下载到本地,自动并行 + 断点续传
client.download_dicom_series(
seriesInstanceUID=df["SeriesInstanceUID"].tolist(),
downloadDir="./idc_data",
)
# 3) 浏览层级:集合 -> 患者 -> 检查 -> 序列
patients = client.get_patients("tcga_luad", outputFormat="list")
studies = client.get_dicom_studies(patients[0])
series = client.get_dicom_series(studies[0]["StudyInstanceUID"])
# 4) 浏览器查看:生成 OHIF(放射)或 Slim(病理)在线查看链接
print(client.get_viewer_URL(seriesInstanceUID=series[0]["SeriesInstanceUID"]))
§6.2 数据获取
| 方式 | 适用场景 | 门槛 | 备注 |
|---|---|---|---|
| IDC Portal 网页 cohort | 交互式探索、小规模勾选 | 无 | 浏览器内 OHIF/Slim 预览 + manifest 导出 |
| idc-index(推荐) | Python 工作流、中小 cohort | pip 即装 | 本地 SQL + s5cmd 并行下载 |
| BigQuery | TB 级元数据统计、复杂 SQL | 需 GCP 项目 | 表 bigquery-public-data.idc_current.dicom_all |
| AWS CLI / s5cmd 直连 | 脚本化批量、已知 UID 清单 | 无(匿名可读) | --no-sign-request;NC 文件在 -cr 桶 |
| DICOMweb | 逐帧/逐瓦片(病理) | 需端点 | 大 WSI 免整张下载 |
Portal 网页路径(适合非编程用户)五步流程:其一,打开 IDC Portal 并按集合/癌种/模态筛选;其二,在集合详情页用过滤面板逐步缩小 case 范围;其三,用内嵌 OHIF(放射)或 Slim(病理)查看器逐例质检;其四,将 cohort 保存为 manifest 并下载;其五,把 manifest 喂给 idc download manifest.s5cmd 或 idc-index 批量下载。全程无需注册账号,manifest 即是可存档、可分享、可复现的 cohort 凭证。
# AWS 匿名直连(免账号)——按 series 目录下载
aws s3 cp --no-sign-request --recursive \
s3://idc-open-data/{crdc_series_uuid}/ ./my_series/
# Google GCS 镜像(同一路径结构)
gsutil -m cp -r gs://idc-open-data/{crdc_series_uuid}/ ./my_series/
# BigQuery:全量 DICOM 元数据的复杂查询(需 GCP 项目)
from google.cloud import bigquery
bq = bigquery.Client(project="your-gcp-project")
rows = bq.query("""
SELECT collection_id, Modality, COUNT(DISTINCT PatientID) AS patients
FROM `bigquery-public-data.idc_current.dicom_all`
WHERE Modality IN ('CT', 'MR', 'PT') AND BodyPartExamined = 'HEAD'
GROUP BY collection_id, Modality
ORDER BY patients DESC
""").to_dataframe()
§6.3 预处理全流程
# ============ CT 序列:DICOM -> 1mm 各向同性 3D 体数据 ============
# 依赖:pip install pydicom numpy scipy SimpleITK
import os, glob, pydicom, numpy as np, SimpleITK as sitk
def load_ct_series(series_dir: str) -> sitk.Image:
"""读取一个 series 目录(idc-index 下载产物)为 3D CT。
依赖 DICOM 层间排序属性,勿按文件名字典序排序。"""
files = glob.glob(os.path.join(series_dir, "*.dcm"))
reader = sitk.ImageSeriesReader()
reader.SetFileNames(sorted(files)) # SimpleITK 自动按 ImagePositionPatient 排序
return reader.Execute() # HU 值体数据
def preprocess_ct(series_dir: str, target_spacing=(1.0, 1.0, 1.0)) -> np.ndarray:
img = load_ct_series(series_dir)
# 重采样到统一 spacing(不同设备层厚 0.5-5 mm 不等)
resampler = sitk.ResampleImageFilter()
resampler.SetOutputSpacing(target_spacing)
resampler.SetSize([int(img.GetWidth()), int(img.GetHeight()),
int(img.GetDepth())])
resampler.SetInterpolator(sitk.sitkLinear)
img = resampler.Execute(img)
arr = sitk.GetArrayFromImage(img).astype(np.float32) # (Z, Y, X) HU
np.clip(arr, -1000, 400, out=arr) # 肺/软组织常用窗
return arr / 400.0 # 归一化到 [-2.5, 1]
# ============ 病理切片:DICOM SM -> 瓦片流(勿整张载入) ============
# 依赖:pip install wsidicom
from wsidicom import WsiDicom
def iter_tiles(series_dir: str, level: int = 0, tile_size: int = 512):
"""DICOM SM 金字塔按层读取瓦片,病理场景必用流式接口。"""
with WsiDicom.open_dir(series_dir) as wsi:
for tile in wsi.read_tiles(level=level):
yield tile # (x, y, numpy RGB)
清洗与标准化要点:剔除 SliceThickness 异常的离群序列;增强序列用 SeriesInstanceUID 前缀(-1/-2)识别期相;PET 影像保留原始 SUV 标签字段再归一化;病理瓦片按 20x 等效倍率选层,前景掩码过滤空白区域。
常用 CT 窗宽窗位参考(HU 域,按任务选择而非全用):
| 窗位 | 窗宽(WW) | 窗位(WL) | 适用任务 |
|---|---|---|---|
| 肺窗 | 1,500 | -600 | 肺结节检测/分割 |
| 纵隔窗 | 350 | 50 | 纵隔淋巴结、软组织 |
| 骨窗 | 2,000 | 300 | 骨转移评估 |
| 腹部窗 | 400 | 40 | 肝胰病灶 |
若做胸腹盆全扫描联合训练,建议保留原始 HU 并在模型内做可学习窗位(或输入三通道窗位堆叠),避免预处理阶段就锁死信息。
§6.4 PyTorch DataLoader
# ==========================================================
# 依赖:pip install torch SimpleITK numpy
# 输入:§6.2 下载产物的根目录(每个 series 一个 crdc_series_uuid 子目录)
# 输出:(1, D, H, W) 的归一化 3D 张量 + collection 来源标签
# ==========================================================
import glob, os, numpy as np, torch
from torch.utils.data import Dataset, DataLoader
import SimpleITK as sitk
class IDCSeriesDataset(Dataset):
"""按 series 目录遍历 IDC 下载产物,输出统一尺寸 3D CT 张量。"""
def __init__(self, data_root: str, series_list, out_shape=(64, 224, 224)):
self.root = data_root
self.series = series_list # List[str]: crdc_series_uuid 或 SeriesInstanceUID
self.out_shape = out_shape
def __len__(self):
return len(self.series)
def __getitem__(self, idx):
series_dir = os.path.join(self.root, self.series[idx])
img = load_ct_series(series_dir) # §6.3 的加载函数
arr = sitk.GetArrayFromImage(img).astype(np.float32) # (Z, Y, X)
arr = np.clip(arr, -1000, 400)
# 简单插值到统一尺寸(生产环境请用各向异性感知的重采样)
import torch.nn.functional as F
t = torch.from_numpy(arr)[None, None] # (1,1,Z,Y,X)
t = F.interpolate(t, size=self.out_shape, mode="trilinear",
align_corners=False)
return t[0, 0] # (D, H, W)
train_ds = IDCSeriesDataset("./idc_data", series_list=your_series_uids)
train_dl = DataLoader(train_ds, batch_size=2, num_workers=4,
pin_memory=True, persistent_workers=True)
for batch in train_dl: # batch: (B, 64, 224, 224)
print(batch.shape, batch.min().item(), batch.max().item())
break
§6.5 坑点 8 个
⚠️ 坑点 1:版本漂移让三个月前的分析无法复现(分类:工程陷阱)
问题:IDC 每 3-4 个月发布新版本;series 内容一旦变更(补充实例、修正元数据)即分配新的
crdc_series_uuid,旧文件夹虽仍留在公共桶里,但已退出当前版本索引。
症状:三个月后重跑旧 notebook,原 SeriesInstanceUID 检索不到或下载到的文件与当初不同;论文审稿被要求提供数据快照时拿不出来。
解决:
- 简单方法:每次分析固定使用版本化资源——BigQuery 查
idc_v24而非idc_current,并在实验记录中写明版本号。- 进阶方法:从检索结果中导出
crdc_series_uuid列存为 manifest(CSV/JSON),下载与复跑都以 UUID 清单为输入;idc-index 按 UUID 定位的是不可变文件。- SOTA 方法:把「版本号 + UUID manifest + 环境 lockfile」三件套纳入 MLOps 资产(DVC/LakeFS 管理),任何论文 revision 都能一条命令重建数据集。
参考:IDC 数据版本化与 AWS 桶说明;idc-index 文档
⚠️ 坑点 2:CC BY-NC 文件混入商用 cohort(分类:标签理解)
问题:全库 >95% 是允许商用的 CC BY,但仍有少量集合为 CC BY-NC;NC 文件单独存放在
s3://idc-open-data-cr/桶,而元数据查询默认跨全部集合。
症状:产品原型阶段一切顺利,商业化法律审查时发现训练集含 NC 许可文件,被迫重新训练。
解决:
- 简单方法:检索时在 SQL 中加
WHERE license_short_name = 'CC BY'(idc-index 与 BigQuery 表均提供该字段)。- 进阶方法:cohort manifest 落盘前做许可断言(如 pytest 检查
set(df.license_short_name) == {'CC BY'}),把合规检查塞进 CI。- SOTA 方法:构建数据血缘表——每个训练样本追溯到 source URL + 许可 + 版本,产出机器可审计的 provenance 报告。
参考:AWS Registry 许可与桶划分说明;NCI 官方介绍
⚠️ 坑点 3:按序列随机划分导致患者级泄漏(分类:数据泄漏)
问题:同一患者常见 2-10 个序列(薄/厚层重建、多期增强、随访),而 IDC 的下载与索引天然以 series 为单位。
症状:测试集指标异常漂亮(如 Dice 高出同行 10 个点),换外部数据立刻崩塌;审稿人查 PatientID 重叠一抓一个准。
解决:
- 简单方法:划分前先
SELECT DISTINCT PatientID,按患者随机切分,序列跟随其患者。- 进阶方法:
GroupKFold(n_splits=5)并以 PatientID 为 group;患者数不足时用患者分层(按癌种/期别)保证 fold 均衡。- SOTA 方法:两级隔离——患者级划分 + 机构级留出(以集合甚至站点为外部测试层),并在论文中同时报告两组指标。
参考:本条目 §5.3;LIDC-IDRI 原始协议(Armato et al., 2011, Medical Physics, DOI:10.1118/1.3528204)
⚠️ 坑点 4:BigQuery 查询需要计费项目,小白卡在第一行(分类:工程陷阱)
问题:官方教程中的高级元数据查询基于 BigQuery,需要 Google Cloud 项目与 API 凭证配置;pilot 时期的旧教程甚至还要求 requester-pays 桶。
症状:照抄博客代码报Access Denied: BigQuery BigQuery: No OAuth2 with scope或 403;以为数据集要收费,其实文件下载完全免费。
解决:
- 简单方法:日常检索直接用 idc-index 的本地 DuckDB SQL(
client.sql_query),零凭证零成本,覆盖 90% 需求。- 进阶方法:确需 BigQuery 时,注册免费 GCP 项目并仅查询公共表——
bigquery-public-data.idc_current,每月免费查询额度即可满足大多数研究。- SOTA 方法:把重查询导出为物化表/manifest,团队共享一份查询结果而非人人直连,既省钱又保证口径一致。
参考:IDC-Tutorials(BigQuery 前置设置笔记本)
⚠️ 坑点 5:DICOM 私有标签(b 值等)在 SQL 里找不到(分类:预处理陷阱)
问题:DWI 的 b 值、部分厂商协议参数存于 DICOM 私有标签;元数据表中私有标签以规范化名称存储,新手用通用列名查询必然落空。
症状:想筛 b=1000 的 DWI 序列,SELECT ... WHERE BValue = 1000报列不存在;不同厂商同一物理参数字段名还不一致。
解决:
- 简单方法:先
SELECT * ... LIMIT 1打印全部列名,按厂商搜索目标属性(私有标签通常带厂商前缀)。- 进阶方法:按官方教程用 BigQuery 的 JSON/ARRAY 展开语法检索私有标签字典。
- SOTA 方法:下载少量样本在本地用 pydicom 读全量标签建立映射表,再反推 SQL 过滤条件——一次投入,全组复用。
参考:IDC-Tutorials「Searching DICOM private tags」笔记本
⚠️ 坑点 6:用 SVS/OpenSlide 老代码读 DICOM 病理切片直接报错(分类:预处理陷阱)
问题:v19 起 GTEx/CPTAC/HTAN 等病理切片以 DICOM SM(Whole Slide Microscopy)标准存储;传统处理 SVS 的 OpenSlide 老版本、Image.open 等代码均不适用。
症状:openslide.OpenSlide(path)抛出 unknown format;或误把整张 GB 级切片载入内存导致 OOM。
解决:
- 简单方法:改用支持 DICOM SM 的库——wsidicom(Python)、QuPath(图形界面)、新版 OpenSlide;或用 Slim 查看器在线看。
- 进阶方法:按金字塔层级流式读瓦片(§6.3 的
iter_tiles),配合前景掩码只处理有效组织区域。- SOTA 方法:用 Highdicom 把标注/模型输出编码回 DICOM 对象,与 Slim/查看器生态无缝互认,实现「读-训-写」全 DICOM 闭环。
参考:IDC v19 数字病理公告;Gorman et al., 2023, Nature Communications, DOI:10.1038/s41467-023-37224-2
⚠️ 坑点 7:整集合下载低估体量,磁盘与时长双双爆表(分类:工程陷阱)
问题:集合体量从 10 GB 到数十 TB 不等;按 collection 整包下载是新手默认动作。
症状:download_from_selection(collection_id='nlst')跑了一夜仍未完成;磁盘写满后 s5cmd 报 IO 错误,断点续传表损坏。
解决:
- 简单方法:下载前用
series_size_MB聚合估算体量,加LIMIT探路;rider_pilot(约 10.5 GB)是最小冒烟集合。- 进阶方法:按 manifest/series 粒度分批下载,s5cmd 并行参数调优,落盘目录与对象存储对齐以便断点续传。
- SOTA 方法:数据不落本地——在 Colab/云 VM 上直接流式读取,或用 DICOMweb 逐帧访问(病理),把「移动数据」变成「移动计算」。
参考:idc-index 文档;IDC-Tutorials「Direct access」笔记本
⚠️ 坑点 8:临床数据不在影像表里,ID 对接想当然(分类:标签理解)
问题:伴随影像的临床表格(分期、病理终点、生存数据)存放在独立的 BigQuery 数据集,而非 dicom_all 表的列;各集合的临床字段口径由原始提交方决定。
症状:SELECT stage FROM dicom_all报错或拿到空列;误把影像元数据里的描述字段当临床标签训练,得到看似可信的「模型」。
解决:
- 简单方法:先读官方「Searching clinical data」笔记本,理解临床数据集结构与联表键(患者/病例 ID)。
- 进阶方法:联表后做字段级 EDA(缺失率、取值分布),确认目标变量在目标集合内真实存在再立项。
- SOTA 方法:建立集合级别的「临床变量可用性清单」并在团队内维护,凡跨集合训练一律以清单为准绳。
参考:IDC FAQ(临床数据位置);IDC-Tutorials
§6.6 数据增强(安全与危险清单)
| 操作 | 安全性 | 说明 |
|---|---|---|
| 窗宽窗位调整(HU 域内) | ✅ | 模拟不同阅读窗,保留 HU 语义 |
| 各向同性重采样后的几何翻转/90° 旋转 | ✅ | 对 CT/MR 普遍安全 |
| 病理瓦片随机裁剪、HED 抖动 | ✅ | 计算病理标准操作 |
| 全局强度翻转 / 非线性灰度变换 | ❌ | 破坏 HU 物理语义,CT 模型会崩 |
| z 轴任意角度旋转 | ❌ | 层厚各向异性,z 轴插值伪影严重 |
| 直接对 PET SUV 做直方图均衡 | ❌ | 破坏定量语义,应标准化到 SUV 域再增强 |
§6.7 模型推荐
| 模型/框架 | 任务适配 | 上手难度 | 备注 |
|---|---|---|---|
| TotalSegmentator | 全器官 3D 分割 | 低 | IDC 的 NLST 分割即由其生成,可作基线 |
| nnU-Net v2 | 任意 3D 分割 | 中 | 医疗分割默认冠军,自建 LIDC 任务首选 |
| MONAI | 通用框架 | 中 | 提供 DICOM/CloudStack 数据集与预训练权重 |
| MedSAM / SAM-Med3D | 交互式分割 | 中 | 少标注场景微调 |
| 3D ResNet/DenseNet(MONAI 模型库) | 分类/预后 | 低 | 结节良恶性、筛查终点预测 |
| MHub.ai 模型库 | 云端推理 | 低 | 直接对 IDC DICOM 跑官方封装模型 |
§6.8 硬件需求
| 场景 | 推荐配置 | 说明 |
|---|---|---|
| 检索与冒烟测试 | 笔记本 + rider_pilot(10.5 GB) | 纯 CPU 即可 |
| 中小 cohort 训练(数百序列) | 单卡 24 GB(A10/4090) | 3D U-Net 级别可行 |
| NLST 级全量训练 | Colab Pro / NIH Cloud Lab / 云 VM 多卡 | 数据与算力同云,免 egress |
| 数字病理 | 64 GB+ 内存 + GPU | WSI 流式读取,内存为主要瓶颈 |
§6.9 评估指标代码
import torch, numpy as np
def dice_score(pred: torch.Tensor, target: torch.Tensor, eps=1e-7) -> float:
"""3D 分割 Dice;pred/target 为 (D, H, W) 0/1 张量。"""
pred, target = pred.bool(), target.bool()
inter = (pred & target).sum().float()
return ((2 * inter) / (pred.sum() + target.sum() + eps)).item()
def detection_froc_at(iou_matrix: np.ndarray, threshold: float) -> float:
"""结节检测 FROC@IoU:以 IoU 矩阵(预测数 x 标注数)统计召回。"""
hits = (iou_matrix > threshold).any(axis=1)
return hits.mean()
def auc_with_ci(y_true: np.ndarray, y_score: np.ndarray, n_boot: int = 2000, seed: int = 42):
"""分类任务 AUROC + 患者级 bootstrap 95% CI(医疗影像论文标配)。"""
from sklearn.metrics import roc_auc_score
rng = np.random.default_rng(seed)
point = roc_auc_score(y_true, y_score)
boots = []
n = len(y_true)
for _ in range(n_boot):
idx = rng.integers(0, n, n)
if len(np.unique(y_true[idx])) < 2:
continue
boots.append(roc_auc_score(y_true[idx], y_score[idx]))
lo, hi = np.percentile(boots, [2.5, 97.5])
return point, (lo, hi)
§6.10 MLOps 笔记
把 IDC 纳入生产化训练管道的三条铁律:其一,数据资产版本化——manifest(crdc_series_uuid 清单)+ IDC 版本号 + 许可过滤条件一并入库,与代码同评审;其二,下载幂等——所有获取脚本以 manifest 为唯一输入源,禁止交互式手选,保证环境重建后数据位对位;其三,监控分布——每次重训前重跑模态/设备/集合占比统计(一段 BigQuery SQL 的事),IDC 每 3-4 个月扩容一次,分布漂移是常态而非异常。
# 推荐的仓库级数据资产布局(与代码同库同评审)
project/
├── data_manifests/
│ ├── idc_v24_train_manifest.csv # crdc_series_uuid + PatientID + license
│ └── idc_v24_test_manifest.csv
├── configs/
│ └── data.yaml # 声明 idc_version: 24.0、获取日期、过滤条件
├── src/download_idc.py # 以 manifest 为唯一输入的幂等下载器
└── reports/
└── distribution_check_2026-09.md # 每次重训前的占比漂移快照
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 筛查适应证偏倚 | NLST 人群为高危老年重度吸烟者,与临床就诊人群分布迥异 | 高 | 声明适用域;避免外推到普通人群 |
| 地域与机构集中 | 以美国学术中心为主,扫描协议与人群构成单一 | 高 | 留一机构/集合验证;报告设备分布 |
| 癌种与模态不均 | 肺部 CT 体量远超其他部位;部分癌种影像稀少 | 中 | 按任务选集合,勿以全库计数误导读者 |
| 标注稀缺与异质 | 专家标注集中于少数集合,AI 分割无逐例复核 | 中 | 自建标注抽样验证;区分金标准与参考底料 |
| 正常-肿瘤不匹配 | GTEx 正常切片与肿瘤队列非同源配对 | 中 | 对照研究声明采样差异 |
| 版本更替漂移 | 集合随版本增补,跨版本合并可能引入组成变化 | 低 | 锁定版本;统计各版本 diff |
§7.2 标注质量
LIDC-IDRI 的四医师两轮盲读协议是影像标注领域被复用最多的协议之一,其轮廓本身即带观察者间变异(同一结节可得多个轮廓),这既是局限也是天然的标注不确定性研究素材。NLST 终点以病理确诊为准,可靠性高,但影像-终点联表需通过临床数据库完成。TotalSegmentator 等 AI 标注的官方定位是增值底料,官方未声明逐例人工复核,使用前应抽样评估(建议每集合至少 50 例双人复核)。
对标注变异的处理建议:LIDC-IDRI 每个结节的多位医师轮廓可以构建「标注不确定性带」,用于训练不确定性感知的分割模型,或以 STAPLE 类算法合成概率共识;把多观察者轮廓硬融合成单一 mask 会丢失这部分信息,是新手最常见的浪费。
§7.3 泛化性
| 目标场景 | 失效风险 | 证据与理由 |
|---|---|---|
| 美国学术中心 → 基层/其他国家 | 高 | 地域与协议集中(§7.1) |
| NLST → 临床就诊人群 | 高 | 筛查人群特异性 |
| 单机构集合 → 多机构模型 | 高 | 机构协议指纹 |
| 病理切片 → 不同扫描仪 | 中 | GTEx/CPTAC 扫描仪有限;建议染色归一 |
| TotalSegmentator 标注 → 新分割模型 | 中 | 蒸馏可行,但继承模型偏差 |
| PET 定量特征跨设备 | 高 | SUV 受采集协议与校准影响,跨设备直比不可靠 |
| 成人模型 → 儿科数据(CCDI-MCI/CMB) | 高 | 体格、病理类型与剂量协议差异显著 |
§7.4 伦理
IDC 仅托管公开数据:入库名单以 NCI 安全部门批准的去标识化流程为前提(TCIA 或其他数据协调中心执行),系统本身按 FISMA Low 持证运营,且不托管任何含 PHI 的数据;一旦发现 PHI,相关数据集会从所有已发布版本中撤除。对使用者而言,义务集中在两端——遵守文件级许可(尤其 NC 子集),以及不得尝试对去标识影像做身份重识别。
§7.5 公平性
人群构成以美国多中心筛查与肿瘤治疗人群为主,种族、族裔与社会经济分层信息依各集合原始提交而异、粒度不一。训练模型前应统计目标集合的人群画像;任何跨人群部署声明都需要本数据集之外的验证证据。
| 公平性维度 | 现状 | 对建模的影响 |
|---|---|---|
| 年龄/性别 | 筛查集合偏向老年男性(NLST 入组标准) | 跨性别/年龄外推需重加权 |
| 种族/族裔 | 各集合披露粒度不一 | 分组公平性评估常因样本不足受限 |
| 设备/机构可及性 | 学术中心设备为主 | 对基层设备图像的性能未知 |
| 儿科覆盖 | 仅 CCDI-MCI/CMB 病理 | 儿科影像模型需外部数据源 |
§7.6 数据漂移
两个方向都存在:横向漂移(每 3-4 个月新增集合与修正数据,集合构成持续变化)与纵向漂移(筛查集合如 NLST 本身携带多轮随访的时相变化)。建议在管道中固化「版本号 + 集合占比 + 设备占比」三项漂移监控指标。
实践上,漂移监控可以压缩为一段 SQL——每次重训前对比当前版本与训练时版本的「集合 × 模态 × 厂商」三维占比,任何一维占比漂移超过 5 个百分点即触发人工评估;同时记录版本号差异,确保新加入集合不会悄悄改变任务分布。
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | BigQuery/idc-index 单表索引覆盖全库 series |
| 2 | 唯一标识 | ✅ | 五级 DICOM 层级 + crdc_series_uuid 双锚点 |
| 3 | 特殊字符 | ✅ | UID 全数字点分;描述字段 UTF-8 安全 |
| 4 | 重复行 | ✅ | 索引表以 SeriesInstanceUID 主键去重 |
| 5 | 缺失编码 | ✅ | 空值语义清晰(未提供≠错误) |
| 6 | 标签标识 | ⚠️ | 无全库统一任务标签;标签随集合分散 |
| 7 | 罕见类分组 | ⚠️ | 少见癌种/模态样本稀薄,需自行聚合 |
| 8 | 偏倚评估 | ⚠️ | 官方未发布系统性偏倚审计(本条目 §7.1 补充) |
| 9 | 数据字典 | ✅ | DICOM 标准字典 + BigQuery schema 公开 |
| 10 | 信息性缺失解释 | ⚠️ | 缺失无逐字段官方说明,需依 DICOM 语义推断 |
| 11 | 设备记录 | ✅ | Manufacturer/Model/KVP/场强等属性完整可查 |
| 12 | 共线性 | ✅ | 影像特征非预打包;预置 radiomics 需自行查共线性 |
| 13 | 编码映射 | ✅ | DICOM 术语表(模态/部位/解剖)标准化 |
| 14 | 时间戳处理 | ⚠️ | 去标识后日期处理跨集合不完全一致,需逐集合核对 |
| 15 | 划分建议 | ✅ | 官方声明不设任务划分;患者级划分社区共识明确 |
| 16 | 泄漏讨论 | ✅ | 患者多序列/多时相结构显式可见,便于防泄漏 |
| 17 | 标签分布 | ✅ | 元数据可直接统计分布(模态/集合/部位) |
| 18 | 测量偏倚 | ⚠️ | 多设备多协议并存,定量特征需设备层校正 |
| 19 | 外部验证建议 | ✅ | 官方与社区提供跨集合用例(NLST/LIDC/TCGA 链) |
| 20 | 版本记录 | ✅ | 全库版本化 + UUID 谱系,业界最佳实践 |
| 21 | 预处理脚本 | ✅ | 官方教程笔记本覆盖检索/下载/预处理/训练 |
| 22 | 合规要求 | ✅ | 文件级许可标签 + 引用规范明确 |
| 23 | 多模态对齐 | ✅ | 影像-注释-临床经共同标识符对齐;CRDC 跨公地互联 |
| 24 | 去标识化 | ✅ | TCIA/NCI 批准流程去标识 + PHI 撤除机制 |
DAIMS 评分:22.5 / 24
评分解读:作为「数据资源型」数据集,IDC 在标识体系、版本治理、合规透明、工具链与文档上达到公开数据集的第一梯队水平(20 项 ✅);扣分集中在任务化缺口——无统一标签体系(#6)、偏倚评估未产品化(#8)、信息性缺失缺乏官方逐字段解释(#10),以及多协议定量研究固有的测量偏倚问题(#18、#14 部分相关)。这些扣分几乎全部源于「公地」而非「基准」的定位,属于结构特征而非缺陷。
对你意味着什么:如果你的任务是分割/分类的算法研发,IDC 可以直接开工,但请把 30% 的预算留给标注体系搭建与患者级防泄漏工程;如果你要做定量影像组学或多设备泛化,先做设备协议分层与测量校正再谈模型;如果你要发论文,从第一天起记录版本号与 crdc_series_uuid manifest,这是 IDC 生态里最便宜的信誉保险;如果你要商业化,CC BY 过滤检查必须进 CI。
§7.8 外部验证矩阵
| 基于数据集 | 来源机构 | 评估任务 | 性能/产出 | 相对内部表现 | 关键发现 |
|---|---|---|---|---|---|
| TotalSegmentator → NLST 全量 CT | IDC 官方(BWH/哈佛) | 全器官分割全量化生产 | TB 级推理结果以 DICOM Segmentation 入库并开放 | 云端管道在数十万序列上稳定运行 | 证明了 IDC 作为 AI 生产线输入源的规模可行性(Thiriveedhi et al., 2024, Research Square, DOI:10.21203/rs.3.rs-4351526/v1) |
| AI 注释富集 NLST / NSCLC-Radiomics | IDC 官方 | 影像衍生注释扩展 | AI 分割与定量注释覆盖既有 CT 集合 | 注释密度由稀疏专家标注提升至全集合覆盖 | 展示「专家标注 → AI 富集」的规模化路径(Krishnaswamy et al., 2023, arXiv) |
| IDC 病理 → Slim/Highdicom 计算病理栈 | MGH、BWH、IDC 团队 | DICOM SM 读取与标注互操作 | 跨厂商 WSI 读取与标注回写打通 | 与专有格式栈功能等价且开放 | DICOM SM 已可承载生产级计算病理(Gorman et al., 2023, Nature Communications, DOI:10.1038/s41467-023-37224-2) |
§8 基准性能与生态
§8.1 排行榜与公开基准
IDC 是数据资源库,本身不设统一排行榜;其数据支撑的代表性公开基准如下(跨基准数值不可直接比较——任务定义、划分与评价指标均不同):
| 排名 | 模型/研究 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| — | LUNA16(基于 LIDC-IDRI 的肺结节检测基准) | 多团队持续提交,见官方排行榜 | 2016 起 | 候选生成 + 假阳性抑制两段式 | Setio et al., 2016/2017 系列;见 luna16.grand-challenge.org | 多团队开源 |
| — | TotalSegmentator(多器官分割,IDC NLST 生产管线所用) | 104 个解剖结构分割,论文报告 Dice 均值 >0.9(器官依赖) | 2022/2023 | nnU-Net 框架 + 大规模多数据训练 | Wasserthal et al., 2023, Nature Communications, DOI:10.1038/s41467-023-41238-5 | github.com/wasserth/TotalSegmentator |
| — | NLST 筛查终点深度学习复现 | 多团队研究级结果,无统一榜 | 2019 起 | 3D CNN + 筛查队列迁移 | 代表:Ardila et al., 2019, Nature Medicine(Google 团队,基于 NLST 影像) | 部分开源 |
跨基准数值不可直接比较的原因:LUNA16 是固定划分+固定指标的竞赛式基准,TotalSegmentator 是多数据集训练的通用分割模型(其数字反映训练分布内表现),NLST 复现研究则各自定义任务与终点。三者唯一的公共变量是数据来源,而预处理、划分与评价指标全然不同——引用任何一方的数字都必须连同其协议语境。
§8.2 SOTA 总结与选型建议
LIDC-IDRI 上的结节检测已高度饱和,适合作为教学与新框架的 sanity check 而非刷榜主场;多器官分割以 nnU-Net 系(含 TotalSegmentator)为事实标准,在 IDC 数据上复跑的成本极低;筛查终点预测(NLST)与病理基础模型是当前仍有明确提升空间的两个方向。选型建议:分割任务首选 nnU-Net/TotalSegmentator 基线,再考虑 MONAI 生态的自定义架构;标注稀缺时用 IDC 官方 AI 分割做预训练或蒸馏底料,但务必在金标准子集上重新校准。
针对不同产出目标的组合拳:发分割论文——LIDC-IDRI 训练 + NSCLC-Radiomics 内验 + NLST 外验,全链患者级划分;发方法学论文(特征提取、不确定性)——直接复用官方 TotalSegmentator 输出做对照组;做产品原型——先 CC BY 过滤 + 小 cohort 验证价值,再规划规模化算力。三条路线共享同一套 manifest 工程底座,切换成本极低。
§8.3 评测协议
社区惯用协议:LIDC-IDRI 检测类任务沿用 LUNA16 的 FROC 指标与 10 折划分;分割类任务报告 Dice/Hausdorff(95%)并按患者级划分;NLST 预测类任务以受试者为单位划分并报告 AUC + 敏感度@固定特异度。所有协议的共同前提:注明所用 IDC 版本与 manifest。
评测报告的最小披露清单(审稿人常查):IDC 版本号与获取日期;train/val/test 的患者数与序列数(而非仅图像数);划分键(PatientID 或更高);所用标注来源(专家/AI/终点)与许可过滤条件;随机种子与硬件环境。这六项齐备,结果才具备被独立复现的资格。
§8.4 相关数据集
| 数据集 | 关系 | 差异 |
|---|---|---|
| TCIA | IDC 的上游策展方与去标识执行者 | TCIA 强在提交与私有集合,IDC 强在云化与版本化 |
| LUNA16 | 从 LIDC-IDRI 派生的检测基准 | 固定划分与榜单,适合公平比较 |
| NSCLC-Radiomics | IDC 内影像组学经典集合 | 规模小但特征标注完整 |
| DC 内影像组学经典集合 | 规模小但特征标注完整 | |
| DeepLesion | NIH 的多病灶 CT 标注库 | 体系独立,病灶标注 |
| 病灶 CT 标注库 | 体系独立,病灶标注密度更高 | |
| UK Biobank | 大规模人群影像 | 疾病谱与设计完全不同,可互补做泛化 |
| QIDC | 定量影像数据公地(QIN 衍生) | 聚焦定量特征与 phantom 数据,与 IDC 互补 |
§8.5 关键论文 Top 8
- Fedorov et al., 2021, Cancer Research, DOI:10.1158/0008-5472.CAN-21-0950 — IDC 建设宣言与架构总览(数据集官方论文)。
- Fedorov et al., 2023, RadioGraphics, DOI:10.1148/rg.230180 — 面向影像 AI 的透明度、可复现性与规模化实践综述,含用例详解。
- Thiriveedhi et al., 2024, Research Square, DOI:10.21203/rs.3.rs-4351526/v1 — 云上大规模 AI 分割策展(NLST TotalSegmentator 管线)。
- Gorman et al., 2023, Nature Communications, DOI:10.1038/s41467-023-37224-2 — Slim 互操作病理查看器与注释工具。
- Bridge et al., 2022, Journal of Digital Imaging, DOI:10.1007/s10278-022-00683-y — Highdicom 标注编码库,DICOM 生态的粘合剂。
- Schacherer et al., 2023, Computer Methods and Programs in Biomedicine, DOI:10.1016/j.cmpb.2023.107839 — IDC 作为计算病理可复现研究平台。
- Armato et al., 2011, Medical Physics, DOI:10.1118/1.3528204 — LIDC-IDRI 集合原始论文(标注协议权威描述)。
- National Lung Screening Trial Research Team et al., 2011, NEJM, DOI:10.1056/NEJMoa1102873 — NLST 主论文(低剂量 CT 筛查降低肺癌死亡率 20%)。
- Wasserthal et al., 2023, Nature Communications, DOI:10.1038/s41467-023-41238-5 — TotalSegmentator(IDC NLST 增值标注所用模型)。
- Krishnaswamy et al., 2023, arXiv(cs.CV)— 用 AI 注释富集 NLST 与 NSCLC-Radiomics CT 集合的方法学。
§8.6 社区活跃度
IDC 采用「文档 + 论坛 + GitHub」三件套运营:learn.canceridc.dev 用户手册持续更新;discourse.canceridc.dev 论坛由核心团队值守,每个 Release 都有官方公告帖;GitHub 组织 ImagingDataCommons 下托管 idc-index、IDC-Tutorials、SlicerIDCBrowser 等仓库,教程笔记本随版本更新。数据发布节奏(每 3-4 个月)与团队响应速度在 NIH 资助项目中属于第一梯队。提交 bug 或用法问题通常在工作日 1-2 天内获得核心开发者回复;每版发布的公告帖会列出新增集合、修复与工具更新,是跟踪数据漂移的官方渠道。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| idc-index | Python 包 | https://idc-index.readthedocs.io/ | 检索+下载+查看器 URL 一站式,官方推荐入口 |
| IDC-Tutorials | 教程仓库 | https://github.com/ImagingDataCommons/IDC-Tutorials | 从入门到 BigQuery/病理/AWS 的全路径笔记本 |
| IDC Portal | Web 门户 | https://portal.imaging.datacommons.cancer.gov/ | 交互式 cohort 构建 + OHIF/Slim 在线看图 |
| IDC 论坛 | 社区 | https://discourse.canceridc.dev/ | 坑点求助第一站,团队响应快 |
| SlicerIDCBrowser | 桌面插件 | https://github.com/ImagingDataCommons/SlicerIDCBrowser | 3D Slicer 内直接浏览 IDC |
| MHub.ai | 模型库 | https://mhub.ai/ | 官方封装模型直接跑 IDC DICOM |
| Highdicom | Python 库 | https://highdicom.readthedocs.io/ | 标注/分割 DICOM 编码标准库 |
| idc-claude-skill | AI 接口 | https://github.com/ImagingDataCommons/idc-claude-skill | 官方自然语言查询 IDC 入口 |
| IDC-Docs | 文档源码 | https://github.com/ImagingDataCommons/IDC-Docs | FAQ、发布说明与出版物清单的原始仓库 |
§9 相关资源与引用
§9.1 官方资源清单
| 资源 | 链接 | 用途 |
|---|---|---|
| 数据门户 | https://portal.imaging.datacommons.cancer.gov/ | 交互式探索、cohort 构建与在线查看 |
| 项目介绍 | https://imaging.datacommons.cancer.gov | 项目定位、数据类型与工具总览 |
| 用户手册 | https://learn.canceridc.dev | 检索/下载/版本化的权威说明 |
| 教程仓库 | https://github.com/ImagingDataCommons/IDC-Tutorials | 入门到进阶的笔记本全集 |
| 社区论坛 | https://discourse.canceridc.dev | 提问与版本公告 |
| AWS 公共数据集页 | https://registry.opendata.aws/nci-imaging-data-commons/ | 桶结构、许可与版本说明 |
| CRDC 总入口 | https://datacommons.cancer.gov | 跨公地(基因组/蛋白组)联动入口 |
| Python 包 | https://idc-index.readthedocs.io/ | 检索与下载的官方封装 |
§9.2 BibTeX 完整引用
@article{Fedorov2021,
author = {Fedorov, Andrey and Longabaugh, William J. R. and Pot, David and
Clunie, David A. and Pieper, Steven D. and Aerts, Hugo J. W. L. and
Homeyer, Andre and Lewis, Rob and others},
title = {NCI Imaging Data Commons},
journal = {Cancer Research},
volume = {81},
pages = {4188--4193},
year = {2021},
doi = {10.1158/0008-5472.CAN-21-0950}
}
@article{Fedorov2023,
author = {Fedorov, Andrey and Longabaugh, William J. R. and Pot, David and
Clunie, David A. and Pieper, Steven D. and Kikinis, Ron and others},
title = {National Cancer Institute Imaging Data Commons: Toward Transparency,
Reproducibility, and Scalability in Imaging Artificial Intelligence},
journal = {RadioGraphics},
volume = {43},
number = {12},
pages = {e230180},
year = {2023},
doi = {10.1148/rg.230180}
}
@article{Thiriveedhi2024,
author = {Thiriveedhi, Vamsi Krishna and Krishnaswamy, Deepa and
Clunie, David and Pieper, Steve and Kikinis, Ron and Fedorov, Andrey},
title = {Cloud-based large-scale curation of medical imaging data
using AI segmentation},
journal = {Research Square},
year = {2024},
doi = {10.21203/rs.3.rs-4351526/v1}
}
§9.3 引用指南
使用 IDC 数据时:引用官方论文(Fedorov 2021 为数据集论文,RadioGraphics 2023 为方法与用例综述);在正文中注明所用的 Data Release 版本号;如使用了官方 AI 增值标注(NLST 分割与影像组学),同时引用 Thiriveedhi 2024;遵守文件级许可标签,CC BY 文件需完成署名(attribution),NC 文件不得商用。
§10 AI 使用声明卡
10.1 AI 模型列表
本条目撰写过程中使用了大型语言模型辅助资料整理、结构化写作与代码示例生成;未使用任何 AI 模型生成虚构数据、指标或引用。
10.2 AI 参与范围
AI 参与:检索结果汇总、章节起草、表格与代码示例编写。人工参与:事实核查(全部规模数字、版本号、DOI 均与官方来源比对)、医学与数据工程交叉审核、最终定稿。规模数字(176 集合、85,682 例、1,032,911 序列、99.27 TB)直接取自 IDC 门户当前版本页,非 AI 推断。
10.3 输入来源列表
- IDC Portal 首页(Data Release 24.0 数字),http://portal.imaging.datacommons.cancer.gov/
- NCI CRDC 官方介绍页,https://datacommons.cancer.gov/repository/imaging-data-commons/
- IDC About 页,https://portal.imaging.datacommons.cancer.gov/about/
- CRDC Data Commons 总览,https://datacommons.cancer.gov/explore/data-commons
- NCI CBIIT 博客(七个 Data Commons),https://www.cancer.gov/about-nci/organization/cbiit/news-events/blog/2026/questions-answered-data-commons
- IDC FAQ(learn.canceridc.dev),https://learn.canceridc.dev/frequently-asked-questions
- IDC-Docs publications.md,https://github.com/ImagingDataCommons/IDC-Docs
- IDC-Tutorials 仓库,https://github.com/ImagingDataCommons/IDC-Tutorials
- idc-index 文档,https://idc-index.readthedocs.io/
- idc-index(PyPI),https://pypi.org/project/idc-index/
- AWS Registry of Open Data(IDC Collections),https://registry.opendata.aws/nci-imaging-data-commons/
- IDC 论坛 v19 发布公告,https://discourse.canceridc.dev/t/idc-sept-2024-release-v19-focus-on-digital-pathology/626
- Fedorov et al., 2021, Cancer Research, DOI:10.1158/0008-5472.CAN-21-0950
- Fedorov et al., 2023, RadioGraphics, DOI:10.1148/rg.230180
- Thiriveedhi et al., 2024, Research Square, DOI:10.21203/rs.3.rs-4351526/v1
- Gorman et al., 2023, Nature Communications, DOI:10.1038/s41467-023-37224-2
- Bridge et al., 2022, Journal of Digital Imaging, DOI:10.1007/s10278-022-00683-y
- Schacherer et al., 2023, Computer Methods and Programs in Biomedicine, DOI:10.1016/j.cmpb.2023.107839
- Armato et al., 2011, Medical Physics, DOI:10.1118/1.3528204
- National Lung Screening Trial Research Team et al., 2011, NEJM, DOI:10.1056/NEJMoa1102873
10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| 规模数字与版本信息 | 千方病案医学编辑部 | 与 IDC 门户及 NCI 官方页逐项比对 | ✅ 已通过/已验证 |
| 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 医学编辑交叉审核 | ✅ 已通过/已验证 |
| 数据字典与访问路径 | 千方病案医学编辑部 | 数据工程师比对官方文档复现要点 | ✅ 已通过/已验证 |
| 坑点与代码示例 | 千方病案医学编辑部 | 数据工程师对照官方教程审查 | ✅ 已通过/已验证 |
| 引用与许可合规 | 千方病案医学编辑部 | 编辑部合规审查 | ✅ 已通过/已验证 |
10.5 AI 生成章节标注
AI 辅助起草:§1.1、§1.2、§2.2、§3.5-3.7、§5、§6.3-6.10、§7.1-7.6、§8.2-8.3。人工主导:INFOBOX、§0、§2.1/2.1b、§4.1、§6.5 坑点、§7.7 DAIMS、§9、§10。
10.6 最后人工审核日期
2026-09-05(与 §0.3 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
§C 结构化数据(JSON-LD)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- tcia — 共享标签:医学影像 / CT / MRI / PET / 肿瘤学
- autopet — 共享标签:医学影像 / CT / PET / 肿瘤学
- cptac-imaging — 共享标签:医学影像 / CT / MRI / 肿瘤学
- synthrad — 共享标签:医学影像 / CT / MRI / 肿瘤学
- medpix — 共享标签:医学影像 / CT / MRI
- nifd — 共享标签:医学影像 / MRI / PET
- autopet-v — 共享标签:医学影像 / CT / PET / 肿瘤学
- hecktor2026 — 共享标签:医学影像 / CT / PET / 肿瘤学
- autopet-iii — 共享标签:医学影像 / CT / PET / 肿瘤学
- medical-decathlon — 共享标签:医学影像 / CT / MRI
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

