信息速览

Duke 乳腺 MRI — 大规模乳腺 DCE-MRI 多维标注数据集 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | Duke 乳腺 MRI(TCIA 收录名:Duke-Breast-Cancer-MRI) |
| 英文全称 | Duke Breast Cancer MRI Dataset(Dynamic Contrast-Enhanced Magnetic Resonance Images of Breast Cancer Patients with Tumor Locations) |
| 别名/简称 | DBC-MRI、Duke DCE-MRI、Duke Breast MRI |
| 疾病分类(ICD-11) | 2C60 恶性乳腺肿瘤(乳腺癌,浸润性癌为主) |
| SNOMED CT | 254837009(乳腺恶性肿瘤)、29851001(乳腺浸润性导管癌) |
| 数据模态 | 乳腺 DCE-MRI(T1 加权多时相)+ 临床/病理/治疗/结局/基因组表格 + 影像组学特征表 |
| AI 任务类型 | 分割、检测、分类、放射组学、放射基因组学、新辅助化疗 pCR 预测 |
| 样本总数 | 922 例患者(活检确诊浸润性乳腺癌) |
| 数据大小 | 368.89 GB(TCIA 托管影像部分) |
| 数据格式 | DICOM(影像)+ XLSX(标注框、临床特征、组学特征、路径映射) |
| 许可证 | CC BY-NC 4.0(署名-非商业性使用 4.0 国际) |
| 访问级别 | 开放下载(需署名并遵守 TCIA 数据使用政策) |
| DUO 标签 | NPUNCU(非商业、非营利研究使用) |
| 语言 | 英语(元数据、临床表格与文档) |
| 首发日期 | 2019 年(TCIA 公开发布;描述论文 2018 年刊出) |
| 最后更新 | 2022-08-01(Version 3,新增 3D 乳腺/纤维腺体分割补充数据) |
| 发布机构 | Duke University(Mazurowski Lab)/ The Cancer Imaging Archive(TCIA) |
| 官方主页 | Duke Mazurowski Lab 数据集页 |
| 下载地址 | TCIA 数据页(DOI 直达) |
| DOI | 10.7937/TCIA.e3sv-re93 |
| 引用次数 | 39+(TCIA DOI 数据页计数,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 标注体系丰富(3D 包围盒 + 529 组学特征 + 近 100 列临床表 + 100 例 3D 分割补充),但需自行完成 DICOM 转换与序列甄别,且无官方训练/测试划分 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
本页面由千方病案医学编辑部编写,遵循千方病案医数集 AI-Ready 写作宪法 v1.0。
- 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 双映射、乳腺癌流行病学与 DCE-MRI 临床任务)、§7 偏倚分析。
- 数据工程审核:千方病案医学编辑部交叉审核。医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
- 事实核查:所有规模数字、标注协议与基准数字均经 2026-09 联网检索核实,来源见 §10.3 输入来源列表。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Duke-Breast-Cancer-MRI 采用 CC BY-NC 4.0 许可,允许非商业用途的复制、修改与分发,但必须署名;使用时应引用 Saha et al. 2018 论文与 TCIA DOI(10.7937/TCIA.e3sv-re93)。具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? 这是杜克大学 Mazurowski 实验室发布、由 The Cancer Imaging Archive(TCIA)托管的乳腺癌 MRI 公开数据集。它收录了 2000 年至 2014 年间在杜克医院接受术前乳腺 MRI 的 922 例活检确诊浸润性乳腺癌患者的动态对比增强(DCE-MRI)影像,连同放射科医生标注的肿瘤位置、529 个自动提取的影像组学特征,以及涵盖人口学、病理、治疗、复发结局与基因组的近 100 列表格数据(TCIA 数据页)。
为什么重要? 乳腺 MRI 是评估乳腺癌病变范围、预测新辅助化疗疗效与远期预后的关键影像手段,但该领域长期缺乏大规模、多维标注的公开数据。Duke 数据集是少数把影像、肿瘤空间标注、定量组学特征与"临床-病理-基因组"四层信息对齐到同一批患者的公开资源,自发布以来支撑了大量放射基因组学、疗效预测与 AI 检测研究,并被 Imaging Data Commons 收录为标准分析集合(IDC)。
我能用它做什么? 训练肿瘤检测/定位模型(3D 包围盒监督)、乳腺与纤维腺体组织分割(100 例逐体素 3D 分割补充数据)、放射组学与放射基因组学建模(529 特征 + 基因组标签)、新辅助化疗 pCR 预测(约三成患者具备疗效标签),或把它当作 breast MRI 领域 AI 模型的外部验证队列。注意:队列全部为浸润性癌,不适合做良恶性二分类的训练集。
§1.1 摘要
Duke-Breast-Cancer-MRI 是单机构回顾性队列:研究团队从杜克医院 PACS 系统导出 2000-01-01 至 2014-03-23 期间 922 例活检确诊浸润性乳腺癌患者的术前 DCE-MRI,经 TCIA 脱标识流程后以 DICOM 格式公开(368.89 GB)。每例检查通常包含一个非脂肪饱和 T1 加权序列、一个脂肪饱和梯度回波 T1 增强前序列,以及多为 3 至 4 个增强后序列(TCIA 数据页)。8 名 fellowship-trained 乳腺放射科医生用 MATLAB 自研界面为每例患者绘制肿瘤 3D 包围盒;发布方另提供 529 个计算机提取的影像组学特征(尺寸、形状、纹理、增强特性)与近 100 列临床病理基因组表格。2022-08-01 的 Version 3 新增 100 例随机子集的乳腺、纤维腺体组织与血管逐体素 3D 分割(Scientific Reports 2024)。数据集无官方训练/测试划分,使用者需自行设计患者级划分以避免泄漏。
设计动机方面,发布方明确指出:乳腺 MRI 在预后预测(短期与长期结局)与病理/基因组特征预测上潜力巨大,但领域的进一步发展受制于"缺乏大规模、完善标注的数据集"——因此这份数据从立项起就以"影像 + 标注 + 临床 + 基因组"四位一体为目标设计,而不是单纯的影像堆料。这也解释了它至今仍是放射基因组学教学与研究中被反复引用的范本。
§1.2 战略价值
维度一:标注纵深。 公开乳腺癌 MRI 数据集大多只提供单一层级标注(要么只有分期标签,要么只有分割掩码)。Duke 数据集的独特之处在于三层标注同时可用:空间层(3D 包围盒定位 + 100 例逐体素 3D 分割)、定量层(529 个组学特征可直接用于表格建模,不需要面对 368.89 GB 原始影像)、临床层(人口学、病理、治疗、复发与基因组近 100 列)。对资源有限的团队,可先在表格层复现放射基因组学流水线,再逐步升级到影像层。
维度二:任务覆盖面。 同一份数据可以支撑检测(包围盒)、分割(补充掩码)、分类/预测(pCR、受体状态、组织学分级、复发)与自监督预训练四类任务,且被外部研究者用作 AI 诊断模型的标准外部验证集——Witowski et al. 在 Science Translational Medicine 上将 Duke 的 910 例研究用作纽约大学训练模型的外部测试集(PMC10323699)。对于需要"内部训练 + 外部验证"完整证据链的中国研究者,这是少数同时适合两个角色的公开数据集。
维度三:生态位。 它与 I-SPY1(221 例)、I-SPY2(985 例)共同构成 breast DCE-MRI 的"三支柱"——BreastDCEDL 项目正是把三者合并为 2,070 例的统一 NIfTI 数据集来训练 Transformer(arXiv:2506.12190)。掌握 Duke 数据集的 DICOM 组织与标注惯例,是使用这一整个生态的门票。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 空间标注 | 临床/组学标注 | 差异化 |
|---|---|---|---|---|---|
| Duke-Breast-Cancer-MRI | 922 例 | DCE-MRI(1.5T/3T,多时相) | 3D 包围盒(922 例)+ 100 例 3D 分割 | 近 100 列临床病理基因组 + 529 组学特征 | 标注层次最全,全恶性队列 |
| I-SPY1 | 221 例 | DCE-MRI + PET/CT | 全肿瘤 3D 分割 | pCR、受体状态、结局 | 纵向治疗试验设计,规模较小 |
| I-SPY2 | 985 例 | DCE-MRI(3-12 时相) | 全肿瘤 3D 分割 | pCR、受体状态 | 规模最大,适应性试验人群 |
| TCGA-BRCA(TCIA) | 139 例患者/164 检查 | MRI + 病理 + 组学 | DSR 报告为主 | 基因组最全 | 影像标注弱,需自行生成 AI 标签 |
| QIN-Breast | 68 例 | PET/CT + 定量 MR | 纵向三时点 | pCR/非 pCR 标签 | 纵向治疗监测,规模小 |
规模数字来源:arXiv:2506.12190、PMC10323699、BMC Cancer 2024 综述。
§1.4 版本时间轴
| 版本 | 日期 | 关键变化 |
|---|---|---|
| 描述论文 | 2018-08 | Saha et al. 于 British Journal of Cancer 发表数据集描述与放射基因组学基线(DOI 10.1038/s41416-018-0185-8) |
| v1(TCIA 首发) | 2019 | 影像 DICOM + 标注框 + 临床表 + 组学特征表公开 |
| v3(现行版本) | 2022-08-01 | 新增 3D Breast and FGT MRI Segmentation Supplemental Data(100 例逐体素分割) |
来源:TCIA 收录页、Nature Scientific Reports 2024。
§1.5 典型应用场景
- 肿瘤检测与定位:以 3D 包围盒为监督训练 3D 检测网络,输出肿瘤位置(Witowski et al. 2023 外部验证先例)。
- 乳腺与纤维腺体组织分割:用 Version 3 的 100 例逐体素 3D 分割训练密度量化模型,官方配套发布分割模型权重(Scientific Reports 2024)。
- 放射组学/放射基因组学:直接使用 529 个影像特征表与临床基因组表格建模,无需处理原始 DICOM(Saha et al. 2018)。
- 新辅助化疗 pCR 预测:对约三成接受新辅助化疗的患者用增强前后序列预测病理完全缓解(Li et al. 2024)。
- AI 模型外部验证:作为单机构全恶性队列,检验在其他数据(如 I-SPY、NYU)上训练的 breast MRI 模型的跨机构泛化性。
| 场景 | 所需数据组件 | 起步成本 |
|---|---|---|
| 检测/定位 | DICOM + Annotation_Boxes.xlsx | 高(需处理全部影像) |
| 分割 | v3 补充掩码 + 对应 DICOM 子集 | 中 |
| 组学表格建模 | 两张 XLSX | 低(约 50 MB) |
| pCR 预测 | NAC 子集影像/特征 + pCR 字段 | 中-高 |
| 外部验证 | 依源模型输入而定 | 低-中 |
§2 医学背景
§2.1 ICD-11 编码映射
| 标签/概念 | ICD-11 编码 | ICD-11 术语(中文) |
|---|---|---|
| 乳腺癌(总类) | 2C60 | 恶性乳腺肿瘤 |
| 浸润性导管癌(IDC) | 2C60.0 | 浸润性导管癌(含侧别扩展码) |
| 浸润性小叶癌(ILC) | 2C61 | 浸润性小叶癌 |
| 就诊时转移 | 表格字段 | Metastatic disease at presentation(以临床字段记录,非影像分期) |
编码依据 WHO ICD-11 MMS(Mortality and Morbidity Statistics)乳腺癌章节(2C60-2C6Z)。本数据集队列全部为活检确诊的浸润性乳腺癌,主要落在 2C60.0 与 2C61。
§2.1b SNOMED CT 映射
| 标签/概念 | SNOMED CT 码 | 术语 |
|---|---|---|
| 乳腺癌 | 254837009 | Malignant tumor of breast(乳腺恶性肿瘤) |
| 浸润性导管癌 | 29851001 | Infiltrating duct carcinoma of breast(乳腺浸润性导管癌) |
| 乳腺密度评估 | 概念族 | BI-RADS density 相关概念(临床表格以 1-4 枚举) |
临床表格中的 BI-RADS 密度、受体状态等字段建议在使用前与 SNOMED CT / ICD-O-3 形态学码做一次显式映射并沉淀为映射表。
§2.2 疾病简介与流行病学
乳腺癌是全球女性发病首位的恶性肿瘤。据 American Cancer Society 统计报告(Siegel et al., 2024, CA: A Cancer Journal for Clinicians 74:12),乳腺癌长期位居美国女性新发癌症第一位;在中国,乳腺癌同样是女性发病率最高的恶性肿瘤之一。浸润性导管癌(IDC)是最常见的组织学亚型,浸润性小叶癌(ILC)次之。本数据集的 IDC/ILC 子研究中,IDC 患者平均年龄 48 ± 11.15 岁,ILC 患者平均年龄 59 ± 11 岁(放射组学子研究)。
乳腺 MRI 的临床价值在三个场景中被确立:高危人群加密筛查(对致密型乳腺的检出率高于钼靶,Duke Health 患教)、局部分期与病变范围评估、以及新辅助化疗(NAC)疗效的动态监测。DCE-MRI 通过注射钆对比剂后多时相采集,捕捉肿瘤血管的高通透性与快速强化模式,是功能成像参数(强化率、washout 型时间-信号曲线)的直接来源。
组织学亚型与影像表型的关联是本数据集的重要研究面向:IDC 倾向于表现为边界毛刺的强化肿块,ILC 则常呈弥漫性、非肿块样强化,导致其在 MRI 上的检出与定量都更困难——这也是多篇基于 Duke 数据的放射组学研究选择 IDC/ILC 鉴别作为任务的原因(放射组学子研究、Frontiers in Oncology 2025)。此外,乳腺密度(BI-RADS 1-4)既是独立的患病风险因子,也直接影响病灶的可视性与强化背景噪声,本数据集同时提供放射科医生的密度评估表与 v3 分割掩码两条密度量化路径。
§2.3 临床任务定义
| 临床任务 | 本数据集的对应标签/数据 | AI 任务形式 |
|---|---|---|
| 病变检出与定位 | 8 名放射科医生绘制的肿瘤 3D 包围盒 | 3D 目标检测/定位 |
| 病变范围与分割 | 100 例乳腺/纤维腺体/血管 3D 分割(v3 补充) | 3D 语义分割 |
| 组织学亚型鉴别 | 病理报告字段(IDC、ILC 等) | 影像分类 + 组学 |
| 受体状态推断 | ER/PR/HER2 字段 | 影像分类(放射基因组学) |
| 新辅助化疗疗效预测 | pCR 结局字段(约三成患者) | 二分类/生存建模 |
| 复发风险预测 | 无复发生存(RFS)与复发结局字段 | 生存分析 |
| 密度评估 | BI-RADS 密度评估表 + v3 分割掩码 | 回归/分割量化 |
§2.4 患者人群
| 维度 | 内容 |
|---|---|
| 来源机构 | 杜克大学医院(Duke Hospital, Durham, North Carolina, USA),单机构回顾性队列 |
| 采集时间 | 2000-01-01 至 2014-03-23(约 14 年) |
| 入组标准 | 活检确诊浸润性乳腺癌;具备术前 DCE-MRI |
| 排除标准 | 既往乳腺手术史、乳腺癌病史、MRI 采集前已开始新辅助治疗(BMC Cancer 2024 综述) |
| 年龄 | IDC 子样本平均 48 ± 11.15 岁;ILC 子样本平均 59 ± 11 岁(n=58 子研究) |
| 性别 | 女性(乳腺浸润性癌队列) |
| 种族/民族 | 临床表格记录 White、Black、Asian、Native American、Hispanic、Multiethnic、Hawaiian、American Indian 八类(TCIA 数据页) |
| 就医类型 | 术前(pre-operative)肿瘤评估 |
§2.5 临床价值
对 AI 研究者而言,这个数据集的临床锚点非常扎实:全部 922 例都有活检病理确认,肿瘤空间标注由亚专科(fellowship-trained)乳腺放射科医生完成,临床表格覆盖从诊断到复发随访的完整链条。这意味着:以它训练的检测/分割模型有明确的病理金标准;放射基因组学模型可以验证影像表型与分子表型的关联;pCR 预测模型有手术病理作为终点。相比只有影像没有临床锚点的公开集,它能回答"模型预测的东西在临床上是否真的重要"。
| 临床问题 | 数据集能提供什么 | 对应产出 |
|---|---|---|
| 病灶在哪里? | 放射科医生 3D 包围盒 + 减影序列 | 检测/定位模型 |
| 病灶长什么样? | 529 个定量组学特征 | 表型图谱、可解释特征 |
| 它与分子表型相关吗? | ER/PR/HER2 与基因组字段 | 放射基因组学 |
| 化疗会不会有效? | NAC 亚群 pCR 终点 | 疗效预测模型 |
| 会不会复发? | RFS 与复发字段 | 生存模型 |
| 乳腺本身什么状态? | BI-RADS 密度评估 + v3 分割 | 密度量化模型 |
§2.6 金标准对照表
| 属性 | 内容 |
|---|---|
| 划分方式 | 无官方划分;本页 §5 给出社区惯例 |
| 标注方式 | 8 名放射科医生以 MATLAB GUI 绘制肿瘤 3D 包围盒(行/列/切片起止坐标);529 个组学特征由实验室自研软件自动提取 |
| 标注者资质 | Fellowship-trained 乳腺放射科医生,fellowship 后经验 1-22 年 |
| 金标准性质 | 影像标注(包围盒)+ 病理金标准(活检确诊)双重锚定;pCR 以术后病理为终点 |
| 一致性 | 官方未公布标注者间一致性系数;v3 分割补充数据经 3 名 board-certified 乳腺放射科医生逐一复核 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本/形态 | 大小 | 理由 |
|---|---|---|---|
| 完整影像研究(检测/分割/预训练) | TCIA 原始 DICOM(v3) | 368.89 GB | 唯一包含全部 922 例多时相影像的官方形态 |
| 快速表格建模(组学/放射基因组学) | Imaging_Features + Clinical_and_Other_Features 两张 XLSX | 约 50 MB | 529 特征 + 近 100 列临床,绕过影像处理 |
| 分割模型训练 | v3 补充 3D 分割(100 例)+ 对应 DICOM | 子集下载 | 逐体素掩码,含乳腺/FGT/血管三类 |
| Transformer 大规模预训练 | 社区派生 BreastDCEDL(I-SPY1+2+Duke 统一 NIfTI) | 约 28 GB(MinCrop 版) | 已统一格式与标签,含基准划分 |
| 2D 切片级快速实验 | 社区派生 chehablab/DBCM | 视下载 | 已切片化并广播临床标签,注意体积膨胀 |
§3.1 模态详情
每例检查通常包含以下序列(TCIA 数据页):
| 序列类型 | 描述 | 典型用途 |
|---|---|---|
| 非脂肪饱和 T1 加权 | 解剖参考序列 | 解剖定位、T1 平扫 |
| 脂肪饱和梯度回波 T1(增强前) | pre-contrast,作为减影基线 | 增强定量、减影像生成 |
| 增强后 T1(多为 3-4 个) | first post-contrast 及后续时相 | 强化动力学分析、检测/分割输入 |
| 减影像(派生) | first post − pre,官方标注即在此序列上下文中完成 | 与社区派生数据对齐时注意 |
轴位采集,患者俯卧位。DCE 序列典型参数(IDC/ILC 子研究报道):3D 梯度回波,TR 4-6 ms,TE 1-2.5 ms,矩阵 320 × 320,层厚 1.2 mm,层间距 5.5 mm,翻转角 10°,钆对比剂 15-20 ml,单次动态序列含 6-7 个时相(放射组学子研究)。注意"序列(series)"与"时相(phase)"的组织方式因设备与年代而异,是本数据集预处理的主要复杂度来源(见坑点 8)。
跨年代协议异质性速查(预处理前先对号入座):
| 异质性维度 | 观测到的变化 | 预处理对策 |
|---|---|---|
| 矩阵尺寸 | 320 / 448 / 512 三档共存 | 重采样到统一 spacing,而非粗暴 resize |
| Z 层数 | 每例数十到二百层不等(社区均值约 170) | crop_or_pad 到固定深度 |
| 增强后时相数 | 大多 3-4 个,个别更少 | 以 first post-contrast 为锚 |
| 序列描述 | 命名不统一,设备相关 | 半自动分桶 + 人工抽查 |
| 场强 | 1.5T 与 3T 混合 | 强度归一化 + 场强协变量 |
§3.2 按子集样本数
| 子集 | 例数 | 说明 |
|---|---|---|
| 全队列 | 922 | 活检确诊浸润性乳腺癌,均有术前 MRI |
| 第一阶段标注 | 271 | 6 名放射科医生,标注最多 5 个病灶 |
| 第二阶段标注 | 651 | 4 名放射科医生,只标注最大活检灶 |
| 3D 分割补充(v3) | 100 | 随机子集,乳腺/FGT/血管逐体素标注 |
| pCR 标签子集 | 约 298 | 接受新辅助化疗的患者(社区派生口径) |
来源:TCIA 数据页、BreastDCEDL。
§3.3 格式表
| 组件 | 文件/格式 | 说明 |
|---|---|---|
| 影像 | DICOM(.dcm,逐切片) | NBIA Data Retriever 下载,Classic Directory Name 目录约定 |
| 标注框 | Annotation_Boxes.xlsx | 每行一例患者,6 列(含 ID) |
| 临床特征 | Clinical_and_Other_Features.xlsx | 近 100 列,人口学/病理/治疗/结局/基因组 |
| 组学特征 | Imaging_Features.xlsx | 529 个计算机提取特征 |
| 路径映射 | Breast-Cancer-MRI-filepath_filename-mapping.xlsx(49.6 MB) | 切片文件路径索引 |
| 密度评估 | Breast_Radiologist_Density_Assessments.xlsx | 放射科医生 BI-RADS 密度分级 |
| 3D 分割补充 | 逐体素分割文件(v3) | 100 例,3D Slicer 标注流程 |
元数据表格列结构速查(以官方说明为准):
| 表格 | 关键列 | 主键粒度 |
|---|---|---|
| Annotation_Boxes.xlsx | Patient ID、Start/End Row、Start/End Col、Start/End Slice | 每行 1 例患者 |
| Clinical_and_Other_Features.xlsx | 人口学(年龄/绝经/种族)、肿瘤特征(病理)、治疗、RFS、基因组 | 每行 1 例患者,近 100 列 |
| Imaging_Features.xlsx | 529 个特征列(尺寸/形状/纹理/增强) | 每行 1 例患者 |
| filepath_filename-mapping.xlsx | 切片文件相对路径 ↔ 患者/序列层级 | 每行 1 张切片 |
| Breast_Radiologist_Density_Assessments.xlsx | 患者 ID、BI-RADS 密度 | 每行 1 例患者 |
§3.4 存储大小
TCIA 托管的影像部分共 368.89 GB(TCIA 收录页);元数据表格合计约 50 MB(路径映射表 49.6 MB + 标注框表 49 kB 等)。社区派生 NIfTI 版本(BreastDCEDL,918 例)约 10 GB(原始分辨率 Duke 部分)或约 28 GB(三队列合并 MinCrop 版),转换后体积显著小于 DICOM 原始形态的原因包括去重、压缩与单序列裁剪(BreastDCEDL)。
§3.5 标注方式
- 空间标注(人工):8 名 fellowship-trained 乳腺放射科医生,通过实验室自研 MATLAB 图形界面绘制肿瘤 3D 包围盒;标注在 pre-contrast、first post-contrast 与减影三种序列上下文中完成;多发病例最多标注 5 个病灶,并以活检报告锚定"被标注的即活检靶灶"。
- 定量特征(自动):529 个影像组学特征由实验室自研软件从影像自动提取,覆盖肿瘤与瘤周组织的尺寸、形状、纹理与增强特性,特征设计一部分来自文献常用定义、一部分为实验室自研。
- 像素级分割(人工,v3):100 例随机子集的乳腺、纤维腺体组织与血管逐体素 3D 标注,平均每例标注耗时约 8 小时,由研究生与医学生标注、3 名 board-certified 乳腺放射科医生复核修改(Scientific Reports 2024)。
v3 分割标注的指令要点(节选自其方法学论文):
| 目标结构 | 标注规则 |
|---|---|
| 乳腺 | 沿轮廓描绘,排除胸壁肌肉与胸骨等内部结构;上界约至锁骨水平,下界至乳房下皱襞 |
| 纤维腺体组织(FGT) | 标记所有 FGT,但排除血管、活检夹与淋巴结;必须位于乳腺轮廓内 |
| 血管 | 标记所有清晰可见的血管;均须位于乳腺轮廓内 |
§3.6 标注者资质与一致性
两阶段标注共 8 名 radiologists,均为 fellowship-trained 乳腺放射专科医生,fellowship 后经验 1-22 年(Saha et al.,经 Witowski et al. 引述)。第一阶段 6 人组每人独立负责随机分配的子集;第二阶段 4 人组遵循"最大活检灶"规则并可调阅 PACS 全套影像。官方未公布标注者间一致性系数(如 Dice 或 ICC),使用者在做围框回归类任务时应把标注者因素视为不可观测的方差来源。v3 分割补充数据的标注流程有明确的指令文档与多级复核,可视为像素级标注质量的较强保障。
§3.7 采集周期
影像采集横跨 2000-01-01 至 2014-03-23(TCIA 数据页)。这是理解本数据集异质性的关键时间轴:14 年间扫描仪更替、协议演进,直接导致矩阵尺寸(320/448/512)、层厚与增强时相数的分布差异。
§3.8 地域覆盖
单机构:美国北卡罗来纳州达勒姆市杜克大学医院。无地理多样性;用于跨机构泛化研究时应明确定位为"外部验证目标域"而非"多样域"。
§3.9 设备规格
| 设备 | 场强 | 厂商 |
|---|---|---|
| Signa Excite | 1.5T | GE Healthcare |
| Signa HDxt | 1.5T | GE Healthcare |
| Avanto | 1.5T | Siemens |
| 其他 3T 机型 | 3T | GE Healthcare 与 Siemens |
来源:放射组学子研究、Scientific Reports 2024。体素矩阵范围(100 例子集实测):320 × 320 × 144 至 512 × 512 × 200,体素分辨率 0.6 × 0.6 × 1.0 至 1.1 × 1.1 × 1.2 mm³。
§3.10 深度溯源链
| 层级 | 内容 | 可追溯性 |
|---|---|---|
| 原始采集 | Duke Hospital PACS,临床常规采集 | DICOM 头保留设备/协议参数 |
| 脱标识 | TCIA 标准脱标识管线 | (0020,0052) 等 UID 被替换(见坑点 1) |
| 发布 | TCIA DOI 10.7937/TCIA.e3sv-re93(v3,2022-08-01) | DOI 永久解析 + 版本说明 |
| 描述论文 | Saha et al. 2018, British Journal of Cancer | DOI 10.1038/s41416-018-0185-8 |
| 二次托管 | Imaging Data Commons(含 BAMF-AIMI 派生标注,DOI 10.5281/zenodo.8345959) | IDC 集合页可溯 |
§4 数据结构
§4.0 目录树
NBIA Data Retriever 以 Classic Directory Name 约定解压后的典型结构(示意,实际日期与序列描述因患者而异):
manifest-<hash>/
└── Duke-Breast-Cancer-MRI/
├── Breast_MRI_001/ # 患者 ID(患者层)
│ ├── 01-01-2000-NA-MRI BREAST BILATERAL W WO CONTRAST-<series#>/
│ │ │ # 检查日期-描述-序列号(检查层/序列层)
│ │ ├── 1-01.dcm # 切片:时相-切片号(切片层)
│ │ ├── 1-02.dcm
│ │ ├── ...
│ │ ├── 2-01.dcm # 下一时相
│ │ └── ...
│ └── <另一检查日期>/<另一序列>/
├── Breast_MRI_002/
│ └── ...
└── ...(共 922 个患者目录)
配套的 Breast-Cancer-MRI-filepath_filename-mapping.xlsx 把每张切片映射到患者/序列层级;Annotation_Boxes.xlsx 与 Clinical_and_Other_Features.xlsx 以患者 ID 为主键与影像关联。
标注框坐标与切片文件的对接逻辑(官方规则,坑点 2 的根源):
# 官方规则:标注框的切片坐标 = 文件名连字符后的序号
# 例:1-050.dcm -> slice 50;框坐标 (s0, s1) 直接引用该序号
# 但序列可能"从最高 Z 开始编号"(降序物理高度):
# 此时按物理高度排序的 volume 中,需做镜像换算:
import numpy as np
def remap_slice_coords(s0, s1, M, descending=True):
"""M = 该序列总切片数;descending = 文件名升序对应物理高度降序。"""
if not descending:
return s0, s1
return M - s1 + 1, M - s0 + 1 # 官方换算:(M-B+1, M-A+1)
# 使用前务必用 ImagePositionPatient 的 Z 值确认方向(见 §6.3 代码)。
对接后再做行/列方向的解释:包围盒的行/列坐标对应像素数组的 (row, col),与 pydicom pixel_array 的轴序一致,无需转置。
§4.1 DAIMS 字段字典
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Patient ID | string | 患者唯一标识(影像目录名同源) | Breast_MRI_001 | 主键、分组划分 | 无 | 无 | 922 个唯一值 |
| Start Row / End Row | int | 包围盒行起止 | 117 / 156 | 检测框回归 | 非整数坐标已四舍五入 | 无 | 随矩阵尺寸 |
| Start Col / End Col | int | 包围盒列起止 | 203 / 251 | 检测框回归 | 同上 | 无 | 随矩阵尺寸 |
| Start Slice / End Slice | int | 包围盒切片起止(文件名序号) | 40 / 58 | 检测框回归 | 依序列方向可能需翻转(坑点 2) | 无 | 随层数 |
| Age at Diagnosis (Days) | int | 诊断时年龄(天) | 16,425 | 人口学协变量 | 天级粒度 | 空白=缺失 | — |
| Menopause at Diagnosis | int | 绝经状态 | 0=绝经前 / 1=绝经后 | 协变量/标签 | 依临床笔记判断 | 空白=缺失 | |
| ER / PR / HER2 | int | 受体状态 | 1=阳性 | 放射基因组学标签 | 病理报告回填 | 空白=缺失 | {0,1}(HER2 含 2=不确定) |
| Nottingham Grade | int | 组织学分级 | 2 | 分类标签 | 病理判读 | 空白=缺失 | |
| BI-RADS Density | int | 乳腺密度(放射科医生评估) | 3 | 密度分层 | 主观分级 | 空白=缺失 | |
| RFS (months) | float | 无复发生存月数 | 57.3 | 生存分析终点 | 随访截断 | 空白=缺失 | ≥ 0 |
| Recurrence | int | 复发结局 | 0=未复发 | 分类/生存标签 | 随访窗口内 | 空白=缺失 | |
| Imaging Feature #1-529 | float | 自动提取组学特征 | 0.8731 | 表格建模、特征选择 | 软件版本固定 | 按特征而定 | 连续值 |
§4.2 标签分布
- 恶性状态:922/922 全部为浸润性乳腺癌(无良性对照)。
- 标注覆盖:全部 922 例均有 3D 包围盒;第一阶段覆盖 271 例、第二阶段覆盖 651 例。
- 像素级分割:仅 100 例(v3 补充)。
- pCR 标签:约 298 例(仅限接受新辅助化疗者,占全队列约三成,BreastDCEDL)。
- 受体状态/分级/密度/复发:字段存在,但官方未发布逐字段完整率统计;社区派生版本提示"少数病例临床或病理信息不完整"(chehablab/DBCM)。
§4.3 关键统计
- 影像总量 368.89 GB;单检查通常 1 个增强前 + 3-4 个增强后序列;单动态序列 6-7 个时相。
- 体素矩阵跨 320/448/512 三档主流尺寸(社区全量统计:512 × 512 占 68%、448 × 448 占 28%、320 × 320 占 4%,平均每例约 170 个 Z 切片,BreastDCEDL)。
- 临床表近 100 列;组学表 529 列;两表与影像以 Patient ID 对齐。
| 统计项 | 数值 | 来源 |
|---|---|---|
| 患者数 | 922 | TCIA 收录页 |
| 影像大小 | 368.89 GB | TCIA 收录页 |
| 组学特征数 | 529 | Saha et al. 2018 |
| 临床表列数 | 近 100 | Mazurowski 访谈 |
| 3D 分割补充 | 100 例 | Sci Rep 2024 |
| 标注医生数 | 8 | Saha et al. 2018 |
§4.4 数据层级
患者(922)
└── 检查(study,每例术前 MRI 为主)
└── 序列(series:T1 非 FS、T1 FS pre、post1..postN)
└── 时相/文件(切片文件名前缀区分时相)
└── 切片(slice,文件名连字符后即切片号)
包围盒坐标挂在患者层(每行一例患者),映射到具体序列与切片需结合路径映射表与文件名规则。
Clinical_and_Other_Features.xlsx 字段分组速查(依据官方 TCIA 页说明):
| 字段组 | 代表字段 | 来源 |
|---|---|---|
| 人口学 | Age in days at diagnosis、Menopausal status、Race/ethnicity、Metastatic disease at presentation | 肿瘤科门诊病历 |
| 肿瘤特征 | 病理活检报告字段(组织学、分级等) | 病理活检报告 |
| 治疗 | 化疗/手术等治疗记录 | 临床记录 |
| 结局 | Recurrence-free survival、复发结局 | 随访 |
| 基因组 | 基因组检测相关字段 | 基因组数据源 |
具体列名以随数据发布的表格文件为准;官方页面强调这些数据"收集自临床笔记、影像报告与病理报告等多种来源"。
§4.5 缺失值与信息性缺失编码
| 情形 | 表现 | 处理建议 |
|---|---|---|
| 临床字段缺失 | XLSX 单元格空白 | 读入后显式转 NaN,勿以 0 填充(0 是 ER 等字段的有效取值) |
| 受体状态"不确定" | HER2 = 2(equivocal) | 建模时单列或剔除,勿并入阳性/阴性 |
| 增强后序列数不足 | 该检查只有 2 个 post-contrast | 时相对齐时按"first post-contrast"锚定而非绝对序号 |
| pre/post 尺寸不匹配 | 个别检查序列矩阵不一致 | 参考坑点 4 的 12 例已知问题清单 |
§5 划分与使用建议
§5.1 官方划分
不存在。发布方未提供 train/val/test 划分,全部 922 例向使用者开放。
§5.2 社区惯例划分
| 社区方案 | 做法 | 适用 |
|---|---|---|
| BreastDCEDL 基准 | I-SPY1+2+Duke 合并 2,070 例,按 pCR/HER2/HR 多标签分层随机划分 train 1,099 / val 176 / test 177(pCR 标签子集口径) | pCR 预测、跨队列 Transformer |
| Nature Sci Rep 2024 | 100 例分割子集按 70%/15%/15% 随机划分 | 分割模型 |
| Witowski et al. 2023 | Duke 910 例整体作为外部测试集(模型在 NYU 397 例训练) | 外部验证 |
| MST 管线 | StratifiedGroupKFold 5 折,患者级分组 | 稳健性能估计 |
划分策略决策建议:
| 你的处境 | 建议方案 |
|---|---|
| 只用 Duke,发方法论文 | 5 折 StratifiedGroupKFold(患者级)+ 报告折间方差 |
| 追求与 BreastDCEDL 可比 | 直接采用其冻结划分与统一 NIfTI |
| 在 I-SPY 训练、声称跨机构 | Duke 全量(或 910 例口径)作外部测试,不参与任何调参 |
| 分割任务 | 100 例掩码子集 70/15/15,并按患者分组 |
§5.3 泄漏风险(重点)
- 切片级划分:从同一 volume 抽取的相邻切片高度相关,切片级随机划分会系统性高估性能——必须以患者(volume)为最小划分单元(chehablab/DBCM)。
- 双侧乳腺:同一患者的左/右乳在减影与增强序列中共享采集条件与噪声,拆分左右乳作两条样本同样构成泄漏。
- 表格-影像混用:529 个组学特征由同一检查提取,若表格模型与影像模型在同一患者上分别训练再融合,融合层评估仍需患者级隔离。
- 同患者多时相:把 post2、post3 当作独立"新样本"输入测试集是常见错误。
- 表格与影像的"伪独立":用 529 个组学特征预训练的 embedding 再喂给影像模型、且两者共享患者时,评估集信息已经过特征工程层泄漏——embedding 必须在训练集患者上重算。
§5.4 交叉验证建议
- 分割任务:100 例子集做 5 折交叉验证(患者级分组),同时报告折间标准差。
- pCR/分类任务:以 StratifiedGroupKFold(分层键 = pCR 或受体状态;分组键 = Patient ID)5 折为主,参考 MST 管线(DeepWiki/MST)。
- 外部验证:以 I-SPY1/2(经 BreastDCEDL 统一格式)或 TCGA-BRCA 作为时间/机构异质的目标域。
§5.5 使用红线
- 不可用于"良恶性分类"训练或评估主张——队列无良性样本(Witowski et al. 2023)。
- 不可声称覆盖现代扫描仪或筛查人群——设备为 2000-2014 年代的 1.5T/3T。
- 商业用途被 CC BY-NC 4.0 禁止。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
不在本地下载数据的替代路径:Imaging Data Commons(IDC)已托管本数据集(IDC 集合页),可通过 IDC Portal 购物车后用 s5cmd/gsutil 批量拉取,或在 BigQuery 中先对 DICOM 元数据做 SQL 检索再定向下载子集——对只想先跑通 10-20 例的团队,这是成本最低的入口。IDC 上的派生标注(BAMF-AIMI-Annotations)可经 Zenodo(DOI 10.5281/zenodo.8345959)获取。
# IDC 购物车导出 manifest 后,云端批量拉取示例(s5cmd):
# 1) 在 IDC Portal 检索 collection = duke_breast_cancer_mri,加入购物车并导出 manifest
# 2) 解析 manifest 中的 S3 地址后批量下载:
s5cmd --endpoint-url https://s3.amazonaws.com cp "s3://idc-open-data/*/" ./duke_subset/
# 3) 校验下载量(应与购物车页显示一致)
find ./duke_subset -name "*.dcm" | wc -l
本地路线(NBIA Data Retriever)与云端路线可混合使用:表格元数据用本地 XLSX,影像子集走 IDC。
§6.1 快速上手
目录结构预期:数据根目录下是 NBIA 解压的
manifest-*/Duke-Breast-Cancer-MRI/Breast_MRI_xxx/<study>/<series>/*.dcm;data_root与患者目录直接拼接。最小可用子集:任意 1 个患者目录 + Annotation_Boxes.xlsx + Clinical_and_Other_Features.xlsx 两个表格文件即可跑通本节代码。
# 最小可用子集:1 个患者目录 + 2 个 XLSX
# data_root 结构:
# data_root/
# manifest-xxx/Duke-Breast-Cancer-MRI/Breast_MRI_001/<study>/<series>/*.dcm
# Annotation_Boxes.xlsx
# Clinical_and_Other_Features.xlsx
import pydicom, glob, numpy as np, pandas as pd
DATA_ROOT = "data_root/manifest-xxx/Duke-Breast-Cancer-MRI"
def load_series(series_dir: str) -> np.ndarray:
"""按文件名数字序读入一个序列目录为 3D volume(H, W, Z)。"""
files = sorted(glob.glob(f"{series_dir}/*.dcm"),
key=lambda p: int(p.split("/")[-1].split("-")[1].split(".")[0]))
slices = [pydicom.dcmread(p).pixel_array for p in files]
return np.stack(slices, axis=-1)
# 读取标注框与临床表(每行 = 1 名患者)
boxes = pd.read_excel("Annotation_Boxes.xlsx")
clin = pd.read_excel("Clinical_and_Other_Features.xlsx")
row = boxes[boxes["Patient ID"] == "Breast_MRI_001"].iloc[0]
print(row) # Start Row/End Row, Start Col/End Col, Start Slice/End Slice
§6.2 数据获取
| 步骤 | 操作 | 备注 |
|---|---|---|
| 1 | 访问 TCIA 数据页 | 免登录即可下载多数组件 |
| 2 | Images (DICOM):安装 NBIA Data Retriever,用 .tcia manifest 下载 | 目录类型必须选 Classic Directory Name,否则后续代码路径不匹配 |
| 3 | 下载 Annotation Boxes (XLSX, 49 kB) 与 File Path mapping tables (XLSX, 49.6 MB) | 标注与切片索引 |
| 4 | 下载 Clinical and Other Features 与 Imaging Features | 表格建模所需 |
| 5 | v3 补充分割:Data Access → Supplemental Segmentation | 100 例逐体素掩码 |
| 6 | 商业用途评估 | CC BY-NC 4.0,非商业免费 |
下载中断可直接重新发起,NBIA 会断点续传(Duke 官方教程)。社区问答可在 r/DukeDCEMRIData 检索或提问。
§6.3 预处理全流程
# 预处理目标:DICOM -> NIfTI;修正切片物理顺序;锚定 first post-contrast
import glob, os, pydicom, numpy as np, SimpleITK as sitk
def read_series_sorted(series_dir):
"""坑点 2 修复版:按 ImagePositionPatient 的 Z 值物理排序,而非文件名。"""
files = sorted(glob.glob(os.path.join(series_dir, "*.dcm")))
headers = [(f, pydicom.dcmread(f, stop_before_pixels=True)) for f in files]
items = [(f, float(d.ImagePositionPatient[2]), d.pixel_array) for f, d in headers]
items.sort(key=lambda t: t[1]) # 物理高度升序
vol = np.stack([t[2] for t in items], axis=-1) # (H, W, Z)
spacing_z = abs(items[1][1] - items[0][1])
img = sitk.GetImageFromArray(vol.transpose(2, 0, 1).astype(np.float32))
img.SetSpacing((float(headers[0][1].PixelSpacing[1]),
float(headers[0][1].PixelSpacing[0]), spacing_z))
return img
def dicom2nifti(patient_dir, out_dir):
for k, series in enumerate(sorted(os.listdir(patient_dir))):
img = read_series_sorted(os.path.join(patient_dir, series))
sitk.WriteImage(img, os.path.join(out_dir, f"series_{k:02d}.nii.gz"))
def subtract(post_img, pre_img):
"""减影像:post - pre(不截断负值,与 Witowski et al. 2023 实验一致)。"""
a, b = sitk.GetArrayFromImage(post_img), sitk.GetArrayFromImage(pre_img)
out = sitk.GetImageFromArray((a - b).astype(np.float32))
out.CopyInformation(post_img)
return out
序列角色判定建议半自动:先按 DICOM 标签 SeriesDescription 分桶(pre/post 关键词、时相序号),再人工抽查——Witowski et al. 2023 亦采用"半自动识别 + 人工复核",并最终排除了 12 例无法可靠判定的研究(PMC10323699)。
# 序列角色判定(半自动):产出 per-patient 的序列角色清单 CSV
import pydicom, os, re, pandas as pd
def classify_series(series_dir):
d = pydicom.dcmread(os.path.join(series_dir, sorted(os.listdir(series_dir))[0]),
stop_before_pixels=True)
desc = str(getattr(d, "SeriesDescription", "")).upper()
n_slices = len(os.listdir(series_dir))
role = "unknown"
if "PRE" in desc or ("SSET" not in desc and re.search(r"POST\s*[-_]?[2-9]", desc)):
role = "post_other" if re.search(r"POST", desc) else "pre"
if re.search(r"POST\s*[-_]?1?\b", desc) and "POST" in desc:
role = "post_first" if re.search(r"POST\s*[-_]?1\b", desc) else role
return {"series_dir": series_dir, "description": desc,
"n_slices": n_slices, "rows": d.Rows, "cols": d.Columns, "role": role}
def audit_patient(patient_dir):
records = []
for study in sorted(os.listdir(patient_dir)):
sp = os.path.join(patient_dir, study)
if not os.path.isdir(sp):
continue
for series in sorted(os.listdir(sp)):
records.append(classify_series(os.path.join(sp, series)))
return pd.DataFrame(records)
# audit_patient(f"{DATA_ROOT}/Breast_MRI_001").to_csv(...) # 逐例落盘审计日志
要点:矩阵尺寸(rows/cols)逐例比对即可提前暴露坑点 4 的尺寸不匹配问题;role == "unknown" 的序列进入人工复核队列,而不是静默丢弃。
§6.4 PyTorch DataLoader
# 依赖:nibabel、pandas、torch;预期目录:
# nifti_root/<PatientID>/pre.nii.gz 与 post_1.nii.gz(由 §6.3 生成)
# boxes.csv:PatientID, r0, r1, c0, c1, s0, s1(从 Annotation_Boxes.xlsx 整理)
import pandas as pd, numpy as np, nibabel as nib, torch
from torch.utils.data import Dataset, DataLoader
class DukeBreastMRIDataset(Dataset):
"""包围盒裁剪 + 双通道(pre、post1)volume 分类样本。按患者级 split 使用。"""
def __init__(self, split_ids, nifti_root, boxes_csv, crop=(96, 96, 32)):
self.ids = split_ids
self.root, self.crop = nifti_root, crop
self.boxes = pd.read_csv(boxes_csv).set_index("PatientID")
def __len__(self):
return len(self.ids)
def __getitem__(self, i):
pid = self.ids[i]
pre = nib.load(f"{self.root}/{pid}/pre.nii.gz").get_fdata()
post = nib.load(f"{self.root}/{pid}/post_1.nii.gz").get_fdata()
b = self.boxes.loc[pid]
r0, r1 = max(int(b.r0) - 8, 0), int(b.r1) + 8
c0, c1 = max(int(b.c0) - 8, 0), int(b.c1) + 8
s0, s1 = max(int(b.s0) - 4, 0), int(b.s1) + 4
pc, pp = pre[r0:r1, c0:c1, s0:s1], post[r0:r1, c0:c1, s0:s1]
vol = np.stack([pc, pp], axis=0).astype(np.float32) # (2, H, W, Z)
vol = self._pad_crop(vol, self.crop)
lo, hi = np.percentile(vol, 1), np.percentile(vol, 99)
vol = (vol - lo) / (hi - lo + 1e-8)
return torch.from_numpy(np.ascontiguousarray(vol))
@staticmethod
def _pad_crop(vol, shape):
pads = [(max(0, s - v) for s, v in zip(shape, vol.shape[1:]))]
vol = np.pad(vol, [(0, 0)] + [(0, p) for p in pads[0]])
return vol[:, :shape[0], :shape[1], :shape[2]]
# 示例:患者级划分(GroupKFold 思路,groups = Patient ID)
train_ds = DukeBreastMRIDataset(train_ids, "nifti_root", "boxes.csv")
loader = DataLoader(train_ds, batch_size=4, shuffle=True, num_workers=4, pin_memory=True)
不想碰 368.89 GB 影像?表格放射组学基线(30 分钟跑通):
# 数据:Imaging_Features.xlsx(529 特征)+ Clinical_and_Other_Features.xlsx(标签)
# 任务示例:以 ER 状态为二分类标签;缺失值显式 NaN,勿填 0
import pandas as pd, numpy as np
from sklearn.model_selection import StratifiedGroupKFold
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import roc_auc_score
from sklearn.impute import SimpleImputer
from sklearn.pipeline import make_pipeline
feats = pd.read_excel("Imaging_Features.xlsx").set_index("Patient ID")
clin = pd.read_excel("Clinical_and_Other_Features.xlsx").set_index("Patient ID")
common = feats.index.intersection(clin.index)
X, y = feats.loc[common], (clin.loc[common, "ER"] == 1).astype(int).values
groups = common.values # 患者级分组(坑点 7)
cv = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
scores = []
for tr, te in cv.split(X, y, groups):
model = make_pipeline(SimpleImputer(strategy="median"),
RandomForestClassifier(n_estimators=500, random_state=42))
model.fit(X.iloc[tr], y[tr])
scores.append(roc_auc_score(y[te], model.predict_proba(X.iloc[te])[:, 1]))
print(f"5-fold AUC = {np.mean(scores):.3f} ± {np.std(scores):.3f}")
该基线复现的是 Saha et al. 2018 式的表格建模路径。ER 为示例标签,实际使用时请按研究问题替换为 HER2、Nottingham 分级或 pCR 等字段,并报告各类别样本量。
§6.5 坑点 8 个
⚠️ 坑点 1:FrameOfReference UID 被假值替换,跨序列空间对齐失效(分类:工程陷阱)
问题:TCIA 脱标识流程丢失了 DICOM 标签 (0020,0052) Frame Of Reference UID,官方以每检查一个假(Dummy)值回填,并明确警告其不可靠、不可用于图像对齐。
症状:用该 UID 判断"哪些序列共享同一物理坐标系"时,所有序列都会被判为同一坐标系;基于 UID 的自动配准/融合管线静默地产出错位体,且不报错。
解决:
- 简单方法:绝不使用 (0020,0052);改用 ImagePositionPatient/ImageOrientationPatient 的实际数值做逐序列校验。
- 进阶方法:对 pre 与 first post 计算原点差与方向余弦夹角,超阈值(如原点差 > 2 mm 或夹角 > 1°)即人工复核;同一检查内通常未移动患者,可视为准刚性对齐后做减影。
- SOTA 方法:放弃跨序列硬对齐,各自重采样到统一网格(如 1.0 × 1.0 × 1.2 mm³)后以体素中心对齐;需要精确动力学建模时引入轻量级可变形配准头与训练联合优化。
参考:TCIA 数据页官方警示
⚠️ 坑点 2:切片文件名顺序 ≠ 物理高度顺序,包围盒叠加错位(分类:预处理陷阱)
问题:官方标注框的 Slice 坐标以"文件名连字符后的序号"定义,但部分序列从最高 Z 的切片开始编号,文件名升序恰好是物理高度降序。
症状:直接按文件名排序叠框,框出现在肿瘤的镜像位置或错误层段;可视化时"标注漂移",检测模型的框监督系统性偏移。
解决:
- 简单方法:读每张切片 ImagePositionPatient 的 Z 值,确认首切片是否为最高层;若是,按官方公式把框的 (Start Slice A, End Slice B) 翻转为 (M − B + 1, M − A + 1),M 为该序列总切片数。
- 进阶方法:统一按物理 Z 升序重建 volume 并重排框坐标,使"切片索引 = 物理高度序",一劳永逸(§6.3 代码即此法)。
- SOTA 方法:把标注坐标转存为世界坐标系(mm)下的框角点并持久化,任何重采样/翻转都通过世界坐标变换链自动继承,杜绝派生数据版本间坐标漂移。
参考:TCIA 数据页标注说明
⚠️ 坑点 3:标注是 3D 包围盒,不是逐像素掩码(分类:标签理解)
问题:922 例的空间标注为放射科医生绘制的 3D 包围盒(行/列/切片起止),框内包含大量非肿瘤组织;逐体素掩码仅存在于 v3 的 100 例补充子集。
症状:把包围盒当掩码训练分割网络,Dice 看似正常(框内预测全阳性即可得分)但临床无意义;弱监督分割把框内脂肪/腺体也当肿瘤学习。
解决:
- 简单方法:检测/定位任务直接用框;分割任务只用 100 例补充掩码子集。
- 进阶方法:框内 + 增强约束的弱监督:在减影像上以增强阈值把框内体素二值化为伪掩码,再以框为外约束做形态学清理。
- SOTA 方法:框监督分割(box-supervised segmentation):以框内最大增强连通域初始化,配合多实例学习损失或医学图像基础模型交互式精化;先在 100 例掩码上验证伪掩码质量,再放大到 922 例。
参考:官方标注协议、chehablab/DBCM 注意事项
⚠️ 坑点 4:12 例已知的 pre/post 尺寸不匹配或时相不可判定(分类:预处理陷阱)
问题:部分检查的增强前/后序列矩阵尺寸不一致,或无法自动判定哪个序列是 pre/post。Witowski et al. 2023 排除了 12 例:Breast_MRI_065、120、127、134、232、279、465、514、574、596、700、767。
症状:减影像运算报错(shape mismatch);时相判定脚本把 post1 当成 pre,模型输入含噪声基线,指标无解释地下滑。
解决:
- 简单方法:把上述 12 例 ID 加入排除清单(配置文件管理),与 Witowski 协议对齐后样本量为 910。
- 进阶方法:自动校验每例 pre/post 矩阵一致性并生成质检 CSV;不一致者尝试重采样对齐,仍失败则人工复核 SeriesDescription。
- SOTA 方法:把"序列角色判定"建模为规则 + 置信度打分的半自动流程,输出每例的判定依据日志并进入版本控制,任何模型结果都能回溯到序列判定版本。
参考:Witowski et al. 2023, Sci Transl Med
⚠️ 坑点 5:全恶性队列,无良性对照(分类:偏倚陷阱)
问题:922 例全部为活检确诊浸润性乳腺癌,不含正常或良性病例。把本数据集当"乳腺癌检测"训练集,会把"一切非标注区域"当负样本,模型学到的可能只是"有没有显眼病灶"而非"癌 vs 非癌"。
症状:在含良性病灶或正常人的外部集上假阳性率失控;从单侧标注推双侧"阴性"标签引入系统性错误。
解决:
- 简单方法:本数据集只用于恶性队列内的任务(定位、分割、亚型、pCR),良恶性判别训练交给 I-SPY/NYU 类混合队列。
- 进阶方法:若必须构造 breast 级任务,参考 Witowski et al. 的做法——以包围盒中心点换算左/右乳级别标签,并明确 Duke 仅作为外部验证而非训练源。
- SOTA 方法:用 v3 分割掩码引导的阴性对照采样(对侧乳腺 + 非强化区域),并在论文中报告"负样本构成"以供复现与批判。
参考:Witowski et al. 2023(“Duke data set is all-malignant”)
⚠️ 坑点 6:两阶段标注协议不一致,标注风格存在系统差(分类:标签理解)
问题:271 例(第一阶段,6 名医生)与 651 例(第二阶段,4 名医生)遵循不同规则:前者可标注最多 5 个病灶,后者被明确要求只标注最大活检灶且可调阅 PACS。
症状:以"每例框数"或"框大小分布"为特征的统计在两个子集间出现跳变;跨两阶段训练的检测模型对第二阶段的大框风格过拟合。
解决:
- 简单方法:分析时把标注阶段作为协变量;按阶段分层报告指标。
- 进阶方法:仅用"最大活检灶"语义统一的口径训练检测(第一阶段也只取其活检锚定框),保证监督信号语义一致。
- SOTA 方法:把阶段与标注者 ID 作为随机效应做层级敏感性分析,并在消融中报告"仅第二阶段 651 例"的性能下界。
参考:TCIA 数据页两阶段标注说明
⚠️ 坑点 7:切片级/时相级划分造成患者级泄漏(分类:数据泄漏)
问题:每个 volume 可产出成百上千切片与多个时相,若以切片或时相为样本做随机划分,同一患者的数据同时出现在训练与测试集。
症状:验证指标虚高(常见 2D 模型 AUC 轻松超过 0.95),换到外部集瞬间崩塌;审稿人以"slice-level split"直接质疑。
解决:
- 简单方法:一切划分以 Patient ID 为最小单元(sklearn GroupKFold,groups = Patient ID)。
- 进阶方法:StratifiedGroupKFold 同时固定标签分布与患者分组;报告每折的标签率与患者数。
- SOTA 方法:划分清单版本化(冻结 CSV + 哈希校验),外部验证集(I-SPY/TCGA-BRCA)物理隔离于训练目录之外,数据增强随机数绑定患者 ID 播种,确保同患者所有切片/时相共享同一增强轨迹。
参考:chehablab/DBCM 使用注意事项、MST 划分管线
⚠️ 坑点 8:增强后时相数量不一 + pCR 标签仅覆盖约三成(分类:评估误用)
问题:增强后序列"大多 3-4 个"意味着每例时相数不同;同时全队列仅约 298 例(约三成)接受新辅助化疗并具备 pCR 标签。
症状:把post_2固定为第二个时相的代码在部分患者上读到错误序列或越界;pCR 模型在"被选择接受 NAC 的亚群"上的性能被误读为全人群性能,甚至与 I-SPY(全人群 NAC)结果直接比较。
解决:
- 简单方法:一切时相引用以"first post-contrast"为锚;建模时相序列用掩码/padding 处理缺失时相。
- 进阶方法:pCR 研究明确报告纳排(多少例有标签、选择偏倚方向),与 I-SPY 结果比较时声明人群差异;或仅用 Duke pCR 子集做外部验证而非主训练。
- SOTA 方法:时相数作为模型输入的一部分(time-embedding/缺失指示通道),pCR 模型叠加逆倾向得分加权(IPTW)缓解"NAC 选择偏倚"。
参考:TCIA 序列构成、BreastDCEDL pCR 子集口径
§6.6 数据增强
安全增强 ✅
| 增强 | 说明 |
|---|---|
| 左右镜像翻转 | 乳腺近似左右对称;若同时使用"左/右乳标签",翻转后必须同步交换标签与框列坐标(col → W − col) |
| 小角度旋转(≤ 10°)与平移 | 俯卧位采集姿态相对固定,小扰动安全;框坐标需同步变换 |
| 强度缩放/伽马 | 以分位数归一化为前提做温和强度扰动,模拟跨设备灰度差 |
| 高斯噪声/模糊 | 模拟 1.5T 与 3T 的噪声差异,有利于跨场强泛化 |
危险增强 ❌
| 增强 | 风险 |
|---|---|
| 头脚方向翻转 | 颠倒解剖学上下,破坏"层序"语义与框切片坐标 |
| 大角度旋转(> 15°) | 俯卧位乳腺形变模型不成立,产生非物理形态 |
| 过强非线性弹性形变 | 肿瘤形态学特征(组学标签相关)被扭曲,标签失真 |
| 减影像上的对比度反转 | 直接破坏增强动力学的单调性语义 |
§6.7 模型推荐
| 任务 | 推荐起点 | 说明 |
|---|---|---|
| 肿瘤定位 | 3D ResNet18 检测头 / nnDetection | Witowski et al. 用 3D ResNet18 + Kinetics-400 预训练取得跨机构迁移 |
| 分割 | nnU-Net v2 | 100 例掩码子集即可冷启动,五折交叉验证 |
| pCR 预测 | ViT(三时相 RGB 融合)或 3D CNN + 临床特征拼接 | BreastDCEDL ViT 在合并队列 HR+/HER2- 达 AUC 0.94 |
| 放射基因组学 | LightGBM/XGBoost on 529 特征 | Saha et al. 2018 与 Li et al. 2024 均为表格建模路线 |
| 自监督预训练 | MAE/SimMIM on 922 例 volume | 单机构大体量影像是预训练的优质燃料 |
§6.8 硬件需求
| 阶段 | 建议 |
|---|---|
| 存储 | 原始 DICOM 368.89 GB;加 NIfTI 与缓存建议预留 1 TB |
| 2D 模型 | 单卡 8-12 GB 显存可训练(切片级) |
| 3D 模型 | 单卡 24 GB(A5000/3090 级)起,crop 后 volume(如 96 × 96 × 32)batch 4-8 |
| 全量多时相 Transformer | 建议 A100 40 GB 起或梯度检查点 + 混合精度 |
| CPU/内存 | 解压与转换期建议 ≥ 64 GB 内存、NVMe 盘(千万级小文件 IO) |
§6.9 评估指标代码
# 分类(pCR/受体状态)与检测(框 IoU)最小实现
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score
def cls_metrics(y_true, y_prob):
return {"AUC": roc_auc_score(y_true, y_prob),
"AP": average_precision_score(y_true, y_prob)} # 类别不平衡下 AP 更敏感
def box_iou_3d(a, b):
# a, b: (r0, r1, c0, c1, s0, s1)
inter = max(0, min(a[1], b[1]) - max(a[0], b[0])) * \
max(0, min(a[3], b[3]) - max(a[2], b[2])) * \
max(0, min(a[5], b[5]) - max(a[4], b[4]))
vol_a = (a[1] - a[0]) * (a[3] - a[2]) * (a[5] - a[4])
vol_b = (b[1] - b[0]) * (b[3] - b[2]) * (b[5] - b[4])
return inter / (vol_a + vol_b - inter + 1e-8)
def dice_3d(pred, gt):
"""分割任务(100 例 v3 掩码子集)逐例 Dice。"""
intersect = np.logical_and(pred, gt).sum()
return 2.0 * intersect / (pred.sum() + gt.sum() + 1e-8)
def survival_cindex(risk, events, times):
"""RFS 生存任务的 Harrell C-index(简单实现)。"""
n, conc, disc = len(risk), 0, 0
for i in range(n):
for j in range(i + 1, n):
if times[i] != times[j]:
earlier = i if times[i] < times[j] else j
later = j if earlier == i else i
if events[earlier]:
conc += risk[earlier] > risk[later]
disc += risk[earlier] < risk[later]
return conc / (conc + disc + 1e-8)
§6.10 MLOps 笔记
- 数据版本化:TCIA v3(2022-08-01)与社区派生版(BreastDCEDL、chehablab/DBCM)并行流通,实验记录必须写明"来源形态 + 版本 + 转换脚本哈希"。
- 序列判定日志:pre/post 角色判定与 12 例排除清单(坑点 4)是事实上的"数据预处理版本号",任何模型重跑都要绑定它。
- 划分冻结:划分 CSV 进 git/DVC,训练脚本只读哈希校验后的副本。
- 评估可复现:随机种子同时绑定
torch、numpy与患者 ID(增强轨迹按患者播种,见坑点 7 SOTA 方案)。 - 发布边界:任何衍生权重仍受 CC BY-NC 4.0 约束,模型卡须声明非商业限制与"全恶性队列"适用范围。
推荐的实验元数据结构(每行一条实验记录):
| 字段 | 示例 | 作用 |
|---|---|---|
| data_source | TCIA-v3-DICOM / BreastDCEDL-v1 | 溯源数据形态 |
| conversion_hash | sha256:9f2c…(dicom2nifti 脚本) | 绑定预处理版本 |
| series_assignment | sha256:1a4b…(pre/post 判定日志) | 绑定序列角色版本 |
| split_hash | sha256:77c0…(冻结划分 CSV) | 绑定评估协议 |
| metric_primary | AUC(patient-level) | 主指标口径 |
| excluded_ids | Breast_MRI_065,…,767 | 显式记录排除清单 |
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单机构偏倚 | 全部来自杜克医院一家学术中心 | 高 | 作为外部验证目标域使用;与 I-SPY 等多中心数据交叉 |
| 全恶性选择偏倚 | 无良性/正常对照,仅浸润性癌 | 高 | 禁用于良恶性分类训练;负样本策略透明化 |
| 时间偏倚 | 2000-2014 年设备与协议,与当代扫描差距大 | 中 | 按年代分层评估;域适应/强度归一化 |
| 标注协议偏倚 | 两阶段规则不同(271 vs 651) | 中 | 阶段协变量分层;统一"最大活检灶"口径 |
| 标签覆盖偏倚 | pCR 标签仅覆盖约三成(接受 NAC 者) | 中 | 报告纳排与选择机制;IPTW 加权 |
| 特征共线性 | 529 个组学特征高维且高度相关 | 低-中 | mRMR/Lasso 特征选择;正则化 |
§7.2 标注质量
空间标注由 8 名 fellowship-trained 乳腺放射专科医生完成(经验 1-22 年),以活检报告锚定标注对象,临床有效性高;但官方未公布标注者间一致性定量结果,框的边界精度应视为"定位级"而非"分割级"。v3 补充分割采用指令化流程(乳腺轮廓、FGT 排除血管/淋巴/活检夹、血管单独标记),标注者经统一培训(≥ 5 小时)后作业,且全部经 3 名 board-certified 乳腺放射科医生复核修改,平均每例约 8 小时,属公开 breast MRI 中投入极高的像素级标注(Scientific Reports 2024)。
§7.3 泛化性
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 训练于 Duke → 部署于现代 3T 筛查队列 | 高:协议、场强、人群均漂移 | 单机构 2000-2014 队列构成;跨机构研究亦需重采样对齐(Witowski et al. 2023) |
| 训练于 I-SPY → Duke 外部验证 | 中-高:机构/设备差异 | Witowski et al. 以 910 例 Duke 做外部测试并排除 12 例问题研究 |
| Duke 内部训练 → Duke 内部测试 | 低-中:仅机构内时间漂移 | 必须患者级划分(坑点 7) |
| Duke 检测框 → 弱监督分割 | 中:框 ≠ 掩码 | 坑点 3;v3 100 例掩码可作桥接验证 |
§7.4 伦理与合规
影像经 TCIA 标准脱标识流程处理(身份相关 DICOM 标签移除或替换);数据公开发布,基于公开数据库的二次研究获 Duke Health IRB 审查豁免认定与知情同意豁免(Scientific Reports 2024)。License 为 CC BY-NC 4.0:署名 + 非商业;使用者须引用 Saha et al. 2018 与 TCIA DOI。中国研究者使用时还需遵守本单位伦理审查与数据出境合规要求。
§7.5 公平性
临床表格记录了 8 类种族/民族字段,为公平性研究提供了变量基础;但发布方未给出全队列人口构成统计,公开文献也少有按种族分层的性能报告。使用者在报告模型性能时建议:按种族/年龄分层评估,并在论文局限中声明未验证的群体。
§7.6 数据漂移
- 设备/协议漂移:1.5T GE Signa 系 → Siemens Avanto → 3T 机型的更替横跨队列,矩阵尺寸与层厚分布随年代变化(社区全量统计:512 矩阵占 68%,BreastDCEDL)。
- 人群漂移:14 年间的诊疗模式(NAC 使用率、保乳率)变化会反映在表格字段分布上。
- 实践建议:以采集年份分层做内部时间验证(train 早年 → test 晚年)模拟前向部署漂移。
| 漂移类型 | 触发条件 | 监控指标 | 缓解 |
|---|---|---|---|
| 设备漂移 | 部署医院扫描仪与本队列不同 | 输入强度分布偏移(KS 检验) | 强度归一化、域适应 |
| 协议漂移 | 时相数/层厚与训练分布不符 | 时相数与层厚直方图监控 | 时相掩码输入(坑点 8) |
| 人群漂移 | 良性/筛查人群混入 | 预测置信度分布漂移 | 明确适用域声明(全恶性) |
| 标注漂移 | 不同标注团队的框风格差异 | 框尺寸分布监控 | 阶段/标注者分层评估(坑点 6) |
§7.7 DAIMS 数据就绪度 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式表格 | ✅ | 临床近 100 列 + 组学 529 列,XLSX 单表结构 |
| 2 | 唯一标识 | ✅ | Patient ID 全局唯一且与影像目录名一致 |
| 3 | 特殊字符处理 | ✅ | 标识符为 ASCII;序列描述含空格但不进主键 |
| 4 | 重复行 | ✅ | 标注框/临床表均每患者一行 |
| 5 | 缺失编码 | ⚠️ | 空白单元格即缺失,无显式编码文档;读入需显式 NaN 化 |
| 6 | 标签标识 | ✅ | ER/PR/HER2/分级/复发等枚举语义在 TCIA 页有明文 |
| 7 | 罕见类分组 | ⚠️ | 罕见亚型未预分组;pCR 正例占比需按子集自查 |
| 8 | 偏倚评估 | ⚠️ | 官方未附偏倚文档;偏倚信息散于论文 limitations |
| 9 | 数据字典 | ✅ | TCIA 页逐文件逐列说明(标注框坐标语义、临床字段枚举) |
| 10 | 信息性缺失解释 | ⚠️ | 未区分"未做"与"未记录";HER2=2(equivocal)需自行处理 |
| 11 | 设备记录 | ✅ | DICOM 头保留厂商/场强/序列参数 |
| 12 | 特征共线性 | ⚠️ | 529 特征高维相关,官方未提供去冗余指导 |
| 13 | 编码映射 | ✅ | BI-RADS 密度、绝经、受体状态枚举在官方说明与派生文档有完整对照 |
| 14 | 时间戳处理 | ✅ | 以"诊断时年龄(天)"等相对量发布,规避日期隐私 |
| 15 | 划分建议 | ❌ | 官方无 train/test 划分,需社区方案(§5.2) |
| 16 | 泄漏讨论 | ⚠️ | 官方未讨论;社区明确要求 volume 级划分 |
| 17 | 标签分布 | ⚠️ | 全恶性为已知;逐字段完整率官方未发布 |
| 18 | 测量偏倚 | ⚠️ | 标注者经验跨度大(1-22 年)且无一致性系数 |
| 19 | 外部验证建议 | ⚠️ | 官方未给协议;社区已有 IDC/TCGA-BRCA 实践 |
| 20 | 版本记录 | ✅ | TCIA 版本页明确 v3(2022-08-01)变更内容 |
| 21 | 预处理脚本 | ✅ | Mazurowski Lab 官方教程代码 + 多个社区管线 |
| 22 | 合规要求 | ✅ | CC BY-NC 4.0 + TCIA 数据使用政策清晰 |
| 23 | 多模态对齐 | ✅ | 路径映射表(49.6 MB)精确到切片文件级 |
| 24 | 去标识化 | ✅ | TCIA 标准脱标识;UID 替换副作用已官方声明(坑点 1) |
DAIMS 评分:18.5 / 24
评分解读:14 项 ✅、9 项 ⚠️、1 项 ❌。该数据集的"静态质量"(标识、字典、合规、对齐、版本)接近满分,反映出 TCIA 托管流程的成熟;失分集中在"动态使用支持"——无官方划分、无一致性系数、无缺失与偏倚的官方文档。它是"数据本体优秀、使用脚手架自助"的典型。
对你意味着什么:
- 可以直接把它接入以 Patient ID 为主键的任何表格/影像融合管线,无须清洗主键;
- 必须自建三件套:患者级划分清单、序列角色判定日志、缺失值映射表——这三件事官方不做,做不好就翻车(坑点 4/7/8);
- 529 个组学特征先做相关性筛选再用,共线性会让浅层模型过拟合、解释失真;
- 一切商业设想(包括为药企提供付费模型服务)在 CC BY-NC 4.0 下都需要另行授权评估。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Duke 910 例(NYU 模型的外部测试域) | Duke / NYU Langone | 乳腺级恶性检测 | 3D ResNet18 概率输出(具体数值见原文报告) | 由内部训练域转为外部验证域 | 12 例因尺寸不匹配/时相不可判定被排除;Duke 全恶性,解释限浸润性癌(Sci Transl Med 2023) |
| I-SPY1+2+Duke 合并 2,070 例 | 多中心 | pCR 预测(HR+/HER2- 亚组) | AUC 0.94,accuracy 0.93(ViT) | Duke 单域 → 跨队列统一格式 | 首个 breast DCE-MRI Transformer 基准(arXiv:2506.12190) |
| Duke 281 例 NAC 亚群 | Duke | pCR 预测 | LightGBM AUC 0.823(95%CI 0.743-0.902) | 影像组学内部验证 | Luminal 亚组 RF AUC 0.914;TNBC 亚组 LightGBM AUC 0.836(PeerJ 2024) |
§8 基准性能与生态
§8.1 排行榜
| 排名 | 模型 | 任务与性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | ViT(三时相 RGB 融合) | pCR 预测 AUC 0.94 / accuracy 0.93(HR+/HER2-,2,070 例合并队列) | 2025 | 三相位融合 + Transformer | Fridman, N., Solway, B., Fridman, T., Barnea, I., Goldstein, A., 2025, arXiv:2506.12190(预印本) | BreastDCEDL |
| 2 | RF(放射组学,Luminal 亚组) | pCR 预测 AUC 0.914(95%CI 0.847-0.981) | 2024 | SMOTE + mRMR 特征选择 | Li, X., Li, C., Wang, H., Jiang, L., Chen, M., 2024, PeerJ 12:e17683. DOI 10.7717/peerj.17683 | 未公开 |
| 3 | LightGBM(放射组学,NAC 全亚群) | pCR 预测 AUC 0.823(95%CI 0.743-0.902) | 2024 | 281 例,增强前 + 首个增强后 T1WI 特征 | Li, X., et al., 2024, PeerJ 12:e17683. DOI 10.7717/peerj.17683 | 未公开 |
| 4 | 3D ResNet18 | 乳腺级恶性检测(Duke 910 例外部验证) | 2023 | Kinetics-400 预训练 + LPS 重采样 | Witowski, J., et al., 2023, Science Translational Medicine(PMC10323699) | 未公开 |
| 5 | SVM/RF 放射组学 | 基因组特征预测(922 例 + 529 特征基线) | 2018 | 大规模放射组学筛选 | Saha, A., Harowicz, M.R., Grimm, L.J., Kim, C.E., Ghate, S.V., Walsh, R., Mazurowski, M.A., 2018, British Journal of Cancer 119(4):508-516. DOI 10.1038/s41416-018-0185-8 | 未公开 |
⚠️ 排名不可直接比较:各行任务定义、队列(全 Duke vs 合并队列)、终点(pCR 亚组 vs 检测)与数据形态(表格 vs 影像)不同;AUC 数值仅在相同评测协议内有效。
§8.2 SOTA 总结与选型建议
- 做表格放射组学:从 529 特征 + LightGBM 起步,可快速复现 Li et al. 2024 量级的结果;
- 做影像 pCR:直接采用 BreastDCEDL 统一 NIfTI + 官方划分,避免重复造轮子;
- 做检测/外部验证:以 Witowski 协议(LPS 重采样 + 12 例排除 + breast 级标签)为基准复现,保证可比性;
- 做分割:nnU-Net + 100 例掩码,其余 822 例可用于自监督预训练或框监督弱标注扩展。
§8.3 评测协议
- 固定患者级划分并公开划分文件;
- 报告 95%CI(以患者为单位的 bootstrap);
- pCR 任务注明 NAC 子集纳排与类别占比;
- 检测任务以框 IoU ≥ 0.2 或 breast 级命中为判准(框监督语义宽松,严格 IoU 会低估);
- 跨数据集比较时声明重采样与归一化管线差异。
| 协议要素 | 本数据集的推荐口径 |
|---|---|
| 划分单元 | 患者(volume)级,禁止切片级 |
| 分层键 | pCR / ER / HER2(按任务) |
| 分组键 | Patient ID |
| 折数 | 5 折交叉验证 + 折间标准差 |
| 主指标 | AUC(分类/pCR)、Dice(分割)、box IoU(定位) |
| 显式报告 | 排除清单(12 例)、标注阶段(271/651)、NAC 覆盖率 |
| 外部验证 | I-SPY1/2(BreastDCEDL 格式)或 TCGA-BRCA |
§8.4 相关数据集
| 数据集 | 规模 | 与 Duke 的关系 |
|---|---|---|
| I-SPY1 | 221 例 | 同为 TCIA 托管 DCE-MRI,含全肿瘤分割,纵向治疗设计 |
| I-SPY2 | 985 例 | 规模最大,pCR 标签完整,BreastDCEDL 主力 |
| TCGA-BRCA | 139 患者/164 检查 | 基因组最全,影像标注弱,适合放射基因组学互补 |
| QIN-Breast | 68 例 | 纵向三时点治疗监测 |
| NYU(Witowski 内部队列) | 397 检查(248 良性/149 恶性) | 与 Duke 互为内外的检测验证对 |
来源:arXiv:2506.12190、PMC10323699、BMC Cancer 2024。
§8.5 关键论文 Top 5
- Saha, A., Harowicz, M.R., Grimm, L.J., Kim, C.E., Ghate, S.V., Walsh, R., Mazurowski, M.A., 2018, British Journal of Cancer 119(4):508-516. DOI 10.1038/s41416-018-0185-8 — 数据集奠基论文:922 例 + 529 个 DCE-MRI 特征的机器学习放射基因组学框架与全部纳排标准。
- Witowski, J., et al., 2023, Science Translational Medicine(PMC10323699) — 首个在 Duke 上完成大规模外部验证的临床级 breast MRI AI(3D ResNet18),公开了完整的跨机构预处理协议与 12 例排除清单。
- Li, X., Li, C., Wang, H., Jiang, L., Chen, M., 2024, PeerJ 12:e17683. DOI 10.7717/peerj.17683 — 在 Duke 281 例上系统比较六种分类器的 pCR 放射组学基准,给出亚组性能。
- Fridman, N., Solway, B., Fridman, T., Barnea, I., Goldstein, A., 2025, arXiv:2506.12190(预印本) — 将 Duke 与 I-SPY 合并为 2,070 例统一 DCE-MRI 基准 BreastDCEDL,训练首个 breast DCE-MRI Transformer 并刷新 pCR SOTA。
- Duke-Breast-Cancer-MRI 数据集本身,2022(v3),TCIA. DOI 10.7937/TCIA.e3sv-re93 — Version 3 新增 100 例乳腺/FGT/血管逐体素 3D 分割,配套方法学与分割模型发表于 Scientific Reports(DOI 10.1038/s41598-024-54048-2)。
§8.6 社区活跃度
- 官方维护的 r/DukeDCEMRIData Reddit 版面用于数据答疑;
- Mazurowski Lab 教程博客与配套 GitHub 仓库(MRI-deeplearning-tutorial)提供从 DICOM 到 PyTorch 的官方入门路径;
- Imaging Data Commons 的收录使其可进入云分析生态(BigQuery 元数据检索 + 对象存储批量下载);
- 社区派生数据集(BreastDCEDL、chehablab/DBCM、MST 管线)在 2024-2025 年密集出现,二次生态活跃。
| 活跃度信号 | 证据 | 说明 |
|---|---|---|
| 官方答疑渠道 | Reddit 版面由发布方维护 | 数据使用问题可直接获得发布方回复 |
| 官方教学材料 | 博客系列 + GitHub 教程仓库 | 覆盖下载、DICOM 解析到 PyTorch 训练全流程 |
| 云平台收录 | IDC 集合页 + Zenodo 派生标注 | 进入 GCP/BigQuery 分析生态 |
| 派生生态 | BreastDCEDL、DBCM、MST 等 2024-2025 涌现 | 格式转换、切片化、基准划分均有现成方案 |
§8.7 生态快照
| 资源 | 类型 | 获取方式 | 推荐理由 |
|---|---|---|---|
| TCIA 数据页 | 官方托管 | DOI 直达 | 影像 + 全部元数据表 + 版本记录 |
| Mazurowski Lab 数据集页 | 官方文档 | sites.duke.edu | 数据设计动机与联系入口 |
| MRI-deeplearning-tutorial | 官方代码 | GitHub | DICOM→PyTorch 官方路径,配教程博客 |
| BreastDCEDL | 社区派生数据 | GitHub | 统一 NIfTI + 基准划分 + pCR 标签 |
| chehablab/DBCM | 社区派生数据 | Hugging Face 镜像页 | 2D 切片级多序列 + 掩码广播,快速实验 |
| Imaging Data Commons | 云端镜像 | IDC 集合页 | 云上子集化下载与元数据 SQL |
| r/DukeDCEMRIData | 社区问答 | 官方答疑渠道 | |
| NBIA Data Retriever | 下载工具 | TCIA 数据页内链 | 断点续传的标准下载器 |
§9 相关资源与引用
§9.1 官方文档与教程
- TCIA 数据页(组件下载 + 详细说明):DOI 10.7937/TCIA.e3sv-re93
- Duke 官方资源页:Mazurowski Lab
- 官方深度学习教程(Part 1 数据装配 / Part 2 训练):博客 + GitHub 代码
- 社区问答:r/DukeDCEMRIData
- 云端镜像:IDC 集合页
- 实验室主页(方法学研究列表):Mazurowski Lab
- 派生数据与基准:BreastDCEDL、chehablab/DBCM
按使用路径选入口:
| 你想先做什么 | 直达入口 |
|---|---|
| 只看数据能不能满足研究问题 | TCIA 收录页的 Detailed Description |
| 快速跑通一个表格模型 | Imaging_Features.xlsx + §6.4 代码 |
| 下载 10-20 例试试水 | IDC Portal 购物车(§6.0) |
| 完整下载 368.89 GB | NBIA Data Retriever(§6.2) |
| 做分割但怕标注理解错 | 先读 §6.5 坑点 2/3,再用 v3 补充掩码 |
§9.2 BibTeX 引用块
@article{Saha2018Radiogenomics,
author = {Saha, Ashirbani and Harowicz, Michael R. and Grimm, Lars J. and Kim, Chul-E. and Ghate, Sujata V. and Walsh, Ruth and Mazurowski, Maciej A.},
title = {A machine learning approach to radiogenomics of breast cancer: a study of 922 subjects and 529 DCE-MRI features},
journal = {British Journal of Cancer},
volume = {119},
number = {4},
pages = {508--516},
year = {2018},
doi = {10.1038/s41416-018-0185-8}
}
@misc{DukeBreastCancerMRI2022,
author = {{Mazurowski Lab, Duke University}},
title = {Duke-Breast-Cancer-MRI: Dynamic contrast-enhanced magnetic resonance images of breast cancer patients with tumor locations},
year = {2022},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/TCIA.e3sv-re93},
note = {Version 3, updated 2022-08-01}
}
@article{Witowski2023BreastMRI,
author = {Witowski, J. and others},
title = {Improving breast cancer diagnostics with deep learning for MRI},
journal = {Science Translational Medicine},
year = {2023},
note = {PMC10323699}
}
@article{Li2024pCRRadiomics,
author = {Li, Xue and Li, Chunmei and Wang, Hong and Jiang, Lei and Chen, Min},
title = {Comparison of radiomics-based machine-learning classifiers for the pretreatment prediction of pathologic complete response to neoadjuvant therapy in breast cancer},
journal = {PeerJ},
volume = {12},
pages = {e17683},
year = {2024},
doi = {10.7717/peerj.17683}
}
@article{Fridman2025BreastDCEDL,
author = {Fridman, Naomi and Solway, Bubby and Fridman, Tomer and Barnea, Itamar and Goldstein, Anat},
title = {BreastDCEDL: A Comprehensive Breast Cancer DCE-MRI Dataset and Transformer Implementation for Treatment Response Prediction},
journal = {arXiv preprint arXiv:2506.12190},
year = {2025}
}
§9.3 引用指南
使用本数据集时:正文引用 Saha et al. 2018(方法学);数据来源引用 TCIA DOI 10.7937/TCIA.e3sv-re93;若使用 v3 分割补充数据,建议同时引用其方法学论文(Scientific Reports 2024,DOI 10.1038/s41598-024-54048-2);若使用社区派生版本(BreastDCEDL/DBCM),按其页面要求附加引用。
§10 AI 使用声明卡
§10.1 本页面生产中使用的 AI 模型
| 模型 | 用途 |
|---|---|
| fast-model(千方病案写作助手) | 结构化写作、代码示例生成、事实清单整理 |
§10.2 AI 参与范围
AI 参与了本页面的初稿撰写、代码示例生成与格式整理。所有医学判断、数字取舍与坑点定性由编辑流程把关;检索事实经 2026-09 联网核实后由编辑核定采纳,检索证伪的种子信息(数据集收录名与团队归属)已在 §10.4 审核范围内纠正。
§10.3 输入来源列表
- Saha, A., Harowicz, M.R., Grimm, L.J., Kim, C.E., Ghate, S.V., Walsh, R., Mazurowski, M.A., 2018, British Journal of Cancer 119(4):508-516. DOI 10.1038/s41416-018-0185-8
- Duke-Breast-Cancer-MRI, TCIA 收录页(数据摘要与许可). https://www.cancerimagingarchive.net/?p=42255
- Duke-Breast-Cancer-MRI, TCIA DOI 页(详细描述与坑点警示). DOI 10.7937/TCIA.e3sv-re93
- Witowski, J., et al., 2023, Science Translational Medicine. https://pmc.ncbi.nlm.nih.gov/articles/PMC10323699/
- A publicly available deep learning model and dataset for segmentation of breast, fibroglandular tissue, and vessels in breast MRI, 2024, Scientific Reports. DOI 10.1038/s41598-024-54048-2. https://www.nature.com/articles/s41598-024-54048-2
- Li, X., Li, C., Wang, H., Jiang, L., Chen, M., 2024, PeerJ 12:e17683. DOI 10.7717/peerj.17683
- Fridman, N., et al., 2025, BreastDCEDL, arXiv:2506.12190. https://arxiv.org/html/2506.12190v2
- BreastDCEDL GitHub 仓库(数据统计与基准). https://github.com/standardgalactic/BreastDCEDL
- chehablab/DBCM 派生数据集页(字段说明与注意事项). https://huggingface.lolicp.com/datasets/chehablab/DBCM
- Differentiation of invasive ductal and lobular carcinoma of the breast using MRI radiomic features(IDC/ILC 子研究,采集参数). https://www.ncbi.nlm.nih.gov/pmc/articles/PMC10988200
- Advancing personalized oncology: a systematic review on the integration of artificial intelligence in monitoring neoadjuvant treatment for breast cancer patients, 2024, BMC Cancer. https://link.springer.com/10.1186/s12885-024-13049-0
- Mazurowski Lab 教程博客 Part 1(下载与目录约定). https://sites.duke.edu/mazurowski/2022/07/13/breast-mri-cancer-detect-tutorial-part1/
- Mazurowski Lab 数据集页. https://sites.duke.edu/mazurowski/resources/breast-cancer-mri-dataset/
- Imaging Data Commons: Duke-Breast-Cancer-MRI 集合页. https://portal.imaging.datacommons.cancer.gov/collections/duke_breast_cancer_mri
- Health Data Management 报道(临床表近 100 列之 Mazurowski 访谈). https://www.healthdatamanagement.com/articles/breast-mri-dataset-machine-learning?id=128977
- MST(Medical Slice Transformer)Duke 数据集文档. https://deepwiki.com/mueller-franzes/MST/4.1-duke-breast-cancer-mri-dataset
- Frontiers in Oncology, 2025(IDC/ILC 对侧乳放射组学,患者选择流程). DOI 10.3389/fonc.2025.1588787
- Duke Health 患教:Fast Breast MRI. http://dukehealth.org/blog/fast-breast-mri-available-women-average-breast-cancer-risk
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 对照 TCIA DOI 页与收录页逐数核对 | ✅ 已通过/已验证 |
| §2 医学背景(ICD-11/SNOMED/流行病学) | 千方病案医学编辑部 | 编码与术语复核;种子纠错(团队归属 Sagar→Saha/Mazurowski)确认 | ✅ 已通过/已验证 |
| §3-§4 规格与数据字典 | 千方病案医学编辑部数据工程组 | 对照 TCIA 说明与社区派生文档核对字段语义 | ✅ 已通过/已验证 |
| §6 代码与 8 坑点 | 千方病案医学编辑部数据工程组 | 代码逻辑走查;坑点全部溯源至官方/论文证据 | ✅ 已通过/已验证 |
| §7 DAIMS 与偏倚分析 | 千方病案医学编辑部 | 24 项逐项核对状态与说明 | ✅ 已通过/已验证 |
| §8-§9 基准与引用 | 千方病案医学编辑部 | 引用逐条检索验证,不可比性已标注 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页面全部章节均由 AI 辅助生成初稿,经上表所列人工审核流程修订后发布;代码示例经过人工走查,但未在真实数据副本上端到端执行,使用前请自行验证。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核声明一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ucsf-pdgm — 共享标签:医学影像 / MRI / 肿瘤学
- fets — 共享标签:医学影像 / MRI / 肿瘤学
- tcia — 共享标签:医学影像 / MRI / 肿瘤学
- idc — 共享标签:医学影像 / MRI / 肿瘤学
- prostatex — 共享标签:医学影像 / MRI / 肿瘤学
- pi-cai — 共享标签:医学影像 / MRI / 肿瘤学
- synthrad — 共享标签:医学影像 / MRI / 肿瘤学
- camelyon16-17 — 共享标签:医学影像 / 乳腺癌 / 肿瘤学
- nucls — 共享标签:医学影像 / 乳腺癌 / 肿瘤学
- tupac16 — 共享标签:医学影像 / 乳腺癌 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
