I-SPY — 乳腺癌新辅助治疗影像队列 AI-Ready Wikipedia

985 例乳腺 DCE-MRI + 分子分型 + pCR 结局的自适应平台试验队列

来源 The Cancer Imaging Archive (TCIA) / ACRIN / FNIH Biomarkers Consortium url: https://www.cancerimagingarchive.net/collection/ispy2/发布时间: 2026-09-15最后更新: 2026-09-25 阅读 39
I-SPY — 乳腺癌新辅助治疗影像队列 AI-Ready Wikipedia

信息速览

数据集名称I-SPY — 乳腺癌新辅助治疗影像队列 AI-Ready Wikipedia
数据类型985 例 DCE-MRI 队列,约 2.4 TB DICOM,纵向 4 时间点,CC BY 4.0 开放,公开下载
规模985 例(ISPY2 Imaging Cohort 1)
接入方式The Cancer Imaging Archive (TCIA) / ACRIN / FNIH Biomarkers Consortium url: https://www.cancerimagingarchive.net/collection/ispy2/
AI 就绪度

数据集封面

I-SPY — 乳腺癌新辅助治疗影像队列 AI-Ready Wikipedia

INFOBOX

数据集名称 乳腺癌 I-SPY
英文全称 I-SPY 1 / I-SPY 2 (Investigation of Serial Studies to Predict Your Therapeutic Response with Imaging And moLecular Analysis)
别名/简称 ISPY1、ISPY2、ACRIN 6657、CALGB 150007、ACRIN 6698、I-SPY2 Imaging Cohort 1
疾病分类 2C60 乳房恶性肿瘤(ICD-11)
SNOMED CT 254837009 Malignant tumor of breast
数据模态 动态对比增强 MRI(DCE-MRI)+ 弥散加权成像(DWI,子研究)+ 分子标志物 + 临床结局
AI 任务类型 pCR 疗效预测、肿瘤分割、放射组学、分子亚型分类、纵向响应建模
样本总数 985 例(ISPY2 Imaging Cohort 1);ISPY1 集合 222 例
数据大小 ISPY2 集合 1.75 TB / ISPY2 Imaging Cohort 1 2.41 TB / ISPY1 78.36 GB / ACRIN-6698 841.95 GB
数据格式 DICOM(MR、SEG)、XLSX、TSV(BreastDCEDL 结果集为 NIfTI)
许可证 Creative Commons Attribution 4.0 International (CC BY 4.0)
访问级别 开放(需 TCIA Data Retriever 客户端下载)
DUO 标签 GRU(通用研究)、NPUNCU(非商业非营利)、PUB(须公开发表)
语言 英文
首发日期 2016-09-28(ISPY1 集合上线)
最后更新 2022-05-02(ISPY2 集合 Version 1)
发布机构 ACRIN / CALGB (Alliance) / FNIH Biomarkers Consortium / UCSF / TCIA
官方主页 https://www.cancerimagingarchive.net/collection/ispy2/
下载地址 https://www.cancerimagingarchive.net/collection/ispy2/
DOI 10.7937/TCIA.D8Z0-9T85(ISPY2)、10.7937/K9/TCIA.2016.HdHpgJLK(ISPY1)
引用次数 15+(ISPY2,TCIA 页面计数);35+(ISPY1,TCIA 页面计数),截至 2026-09
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 提供官方临床表格与派生分割掩膜,但治疗臂异质、派生 FTV 值与原始试验值不一致,需手动实现时间点对齐
页面状态 published

§0 E-E-A-T 与审核声明

§0.1 医学审核

[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、新辅助治疗与 pCR 终点定义)、§7 偏倚分析(试验入组选择偏倚、自适应随机化的时间-治疗混杂)、§6.5 坑点 4 与坑点 6 的标签理解部分。

审核者背景:乳腺影像诊断与肿瘤临床试验方法学方向,核对本文对 ACRIN 6657/CALGB 150007 与 I-SPY 2 方案结构的描述是否与 TCIA 官方集合页、试验注册记录及已发表的 NEJM 结果一致。

§0.2 数据工程审核

[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核要点:DICOM 序列识别规则的厂商差异(§3.9)、单侧裁剪与全双侧图像的混杂(坑点 8)、SER 值 rescale 处理(坑点 3)、派生客体非标准 DICOM 兼容性(坑点 5)。

§0.3 审核日期与免责

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。I-SPY 公开影像集合采用 CC BY 4.0 许可,允许共享与改编但强制要求署名并引用原始 DOI;TCIA 要求所有用户遵守其数据使用政策,在出版物中完整引用数据集 DOI。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? I-SPY 是美国进行的一项长期乳腺癌研究系列,全名直译过来是"用影像与分子分析预测治疗应答的系列研究"。它招募肿瘤较大(直径至少 2.5 厘米)、复发风险高的乳腺癌患者,在手术前先做化疗或靶向治疗,也就是"新辅助治疗"。医生在治疗前、治疗早期、治疗中期和治疗结束前各做一次乳腺磁共振(MRI),同时采集肿瘤组织的分子检测结果,最后在手术后用显微镜确认肿瘤是否被彻底清除。I-SPY 1 是这个系列的第一阶段,I-SPY 2 把它升级成可以同时测试多种新药的"平台试验"。

为什么重要? 乳腺癌并非一种病,不同分子特征的肿瘤对同一种药的反应差别极大。传统临床试验要把几百名患者随机分成两组、等上很多年才能知道某个药有没有用。I-SPY 2 换了一种思路:用贝叶斯统计在试验过程中不断更新对每个药效的判断,把新入组患者更多地分配到看起来更有效的方案和更适合他们的分子亚型上,并用 MRI 测量的肿瘤体积变化作为疗效信号。这个设计被视为肿瘤学"平台试验"的先驱之一。对 AI 研究者而言,它留下了一批罕见资产:同一患者治疗过程中多个时间点的 MRI、统一的扫描协议、以及手术后的金标准疗效标签。

我能用它做什么? 最主流的用法是"用治疗前的影像预测治疗后会不会实现病理完全缓解",这是影像组学与深度学习在乳腺 MRI 上最经典的建模任务。此外还可做肿瘤自动分割、从影像推断分子亚型(激素受体 HR 与 HER2 状态)、提取放射组学特征、研究纵向响应曲线,或用它做跨机构泛化能力的测试场。需注意这批数据来自临床试验入组人群而非社区日常诊疗人群,临床部署前必须独立验证。

§1.1 摘要

I-SPY 的完整名称是 Investigation of Serial Studies to Predict Your Therapeutic Response with Imaging And moLecular Analysis,由两个平行的研究组分合并构成:CALGB 150007 负责组织生物标志物的相关科学研究,ACRIN 6657 负责影像学组分,二者共同形成 I-SPY 1 试验的基础(https://www.cancerimagingarchive.net/collection/ispy1)。I-SPY 1 于 2002 年 5 月至 2006 年 3 月在 9 家机构入组 237 例患者,其中 230 例满足 T3 期、肿瘤至少 3 厘米的资格标准,最终 216 例具备完整影像进入分析(https://ascopubs.org/doi/10.1200/jco.2009.27.15_suppl.529)。该阶段确立了核心发现:由 MRI 测量的肿瘤体积变化,比临床触诊或肿瘤直径更能预测新辅助化疗后的病理反应。

I-SPY 2 于 2010 年春启动,注册号 NCT01042379,是一项持续进行的多中心 II 期平台试验(https://www.cancerimagingarchive.net/?p=42613)。它的资格标准是 18 岁以上女性、局部晚期乳腺癌、肿瘤不小于 2.5 厘米且无远处转移。试验把患者按 HER2 状态、激素受体状态和 MammaPrint 70 基因表达谱划分为 8 个生物标志物亚型,并在 10 个前瞻性定义的 signature(亚型组合)内进行贝叶斯自适应随机化(https://escholarship.org/content/qt1039w857/qt1039w857_noSplash_5b015e978f4d81d9521e12fa86fa4c50.pdf)。主要终点是手术时乳腺与腋窝淋巴结的病理完全缓解,即 pCR。

在数据层面,I-SPY 2 的影像经 The Cancer Imaging Archive 分三个集合发布。ISPY2 集合包含 719 例患者的 DCE-MRI,采集于 2010 至 2016 年间、超过 22 家临床中心,采用标准化采集协议,每例患者在治疗过程中接受 4 次 MRI 检查(https://www.cancerimagingarchive.net/?p=42613)。该集合与 ACRIN 6698 弥散加权成像子研究的 266 例合并,构成 985 例的 I-SPY2 Imaging Cohort 1,这是 I-SPY 2 公开发布影像数据的第一个子群。I-SPY 1 的影像则以 ISPY1 集合发布,含 222 例、847 个 MR 研究,体积 78.36 GB。

§1.2 战略价值

维度一:纵向多时间点影像与金标准结局的配对。 绝大多数公开乳腺影像数据集只提供单次扫描与单一诊断标签,而 I-SPY 提供的是同一患者在治疗前、治疗后早期、两段化疗之间和治疗结束前的完整轨迹。ISPY2 集合中超过 95% 的 DCE 数据满足功能肿瘤体积分析的验收标准(https://www.cancerimagingarchive.net/?p=42613),意味着这批纵向影像的质量一致性达到了可用于定量分析的级别。这种"同一患者多次扫描 + 手术病理金标准"的结构,使研究者可以建模治疗响应的动态过程,而不是只做一次静态的横截面预测。对于需要学习时间维度的架构(时序 Transformer、状态空间模型、纵向影像配准网络),这是一个天然适配的测试床。

维度二:自适应平台试验带来的独特偏倚结构。 常规数据集的核心挑战是标注质量和样本量,I-SPY 的核心挑战则是因果结构的复杂性。由于试验采用自适应随机化,患者被分配到哪个治疗臂不仅取决于其分子亚型,还取决于入组时点上累积的疗效数据(https://www.ascopost.com/News/43794)。这意味着治疗臂与入组日期、分子亚型之间存在系统性关联。任何试图从这批数据中估计"某种治疗对某类患者无效或有效"的模型,都必须显式处理这个混杂结构,否则会把"当时恰好分配到某个臂的人群特征"误读成治疗效应。对研究因果推断、去混杂建模和试验数据二次分析的团队,这是一份难得的、结构复杂的真实数据。

维度三:跨机构域偏移的标准压力测试集。 ISPY2 数据来自 22 家以上临床中心、多种扫描仪厂商(1.5T 与 3.0T),尽管采集协议经过标准化,机构间仍存在可观测的差异。MAMA-MIA 挑战正是利用这一点:用美国多中心数据训练、用欧洲三个独立中心的私有数据测试,结果显示跨大洲的域偏移会显著影响性能(https://arxiv.org/html/2603.01250v2)。I-SPY 因此不仅是训练集,也是评估模型泛化与公平性的基准素材。

§1.3 同类数据集横向对比

数据集 规模 模态 标注/标签 差异化特点
I-SPY2(本条目) 719 例(合并后 985 例) DCE-MRI + SEG + 临床 pCR、HR/HER2、MammaPrint、FTV 掩膜 自适应平台试验队列,纵向 4 时间点,含治疗臂信息
ISPY1(本条目) 222 例 DCE-MRI + SEG + 临床 pCR、RFS、FTV、STV 分割 单一化疗方案(AC 序贯紫杉),时间跨度更早,扩展集含专家标注
ACRIN-6698(本条目) 385 例 DWI + DCE-MRI + SEG ADC 图、肿瘤分割、pCR 唯一含 4 个 b 值与 test-retest 重复性亚组的乳腺 DWI 集合
Duke-Breast-Cancer-MRI 922 例 DCE-MRI + 分割 肿瘤分割、分子亚型、RFS 单机构、扫描协议高度一致,适合作为外部验证集
Breast-MRI-NACT-Pilot 64 例 DCE-MRI + 分割 pCR 规模极小,常作小样本方法验证
MAMA-MIA(衍生基准) 1,506 例训练 + 574 例外部测试 DCE-MRI + 专家分割 统一 49 变量 + pCR 由上列多集合统一勾画整合,配套公平性评测框架
BreastDCEDL_ISPY2(衍生结果集) 982 例 NIfTI 化的 DCE-MRI 已切分 train/val/test 将 I-SPY2 转为深度学习就绪格式并提供固定划分

需要说明的是,MAMA-MIA 与 BreastDCEDL 并非独立采集的队列,而是对 TCIA 上多个原始集合的再加工产物。MAMA-MIA 的 1,506 例训练集由 ISPY1 的 171 例、ISPY2 的 980 例、Duke 的 291 例与 NACT 的 64 例构成(https://arxiv.org/html/2603.01250v2);BreastDCEDL 全集的 2,070 例则来自 I-SPY1、I-SPY2 与 Duke 三者。因此在使用这些衍生集时,必须注意它们与原始集合存在样本重叠,不能同时用作训练与独立测试。

§1.4 版本时间轴

时间 事件
2002-05 I-SPY 1(CALGB 150007 + ACRIN 6657)开始入组,在 9 家机构招募
2006-03 I-SPY 1 结束入组,共 237 例
2009 ASCO 年会报告 ACRIN 6657 初步结果:早期 MRVol 变化是唯一可预测 pCR 的变量
2010 春 I-SPY 2 平台试验启动(NCT01042379),采用贝叶斯自适应随机化
2012-08 ACRIN 6698 DWI 子研究开始入组(NCT01564368),共 10 家机构
2015-01 ACRIN 6698 结束入组,406 例
2016-07 NEJM 同期发表 veliparib/carboplatin 与 neratinib 两个毕业方案结果
2016-09-28 ISPY1 集合在 TCIA 上线并更新
2021-12-17 ACRIN-6698 集合在 TCIA 更新(Version 1)
2022-05-02 ISPY2 集合在 TCIA 更新(Version 1),含 985 例 Imaging Cohort 1 临床表
2025 BreastDCEDL_ISPY2 分析结果集发布(982 例 NIfTI,DOI 10.7937/42WQ-TH78)
2025-2026 MAMA-MIA 挑战基于四个 TCIA 集合构建 1,506 例统一基准并完成外部评测

§1.5 典型应用场景

场景一:治疗前 pCR 预测。 使用 T0 基线 DCE-MRI,配合临床变量(年龄、HR/HER2 状态、MammaPrint 风险等级),训练二分类模型预测患者能否在手术后达到 pCR。这是该数据集被引用最多的任务,也是 MAMA-MIA 挑战的任务 2。需要注意 MAMA-MIA 的结论:仅靠基线 DCE-MRI,所有参赛团队的预测性能都偏低,pCR 预测本质上是一个困难问题。

场景二:原发肿瘤自动分割。 在 DCE-MRI 上勾画肿瘤区域。ISPY1 的扩展集提供了 163 例由乳腺放射科专家勾画的 STV 与 FTV 双套标签,可用于监督训练;ISPY2 与 ACRIN-6698 集合提供了 UCSF 分析实验室生成的功能肿瘤体积掩膜。MAMA-MIA 任务 1 中排名第二的方案在外部测试集上取得 Dice 0.713,可作为参考基线。

场景三:从影像推断分子亚型。 用影像预测 HR 与 HER2 状态,即所谓"影像组学活检"。BreastDCEDL 提供的基准显示,Vision Transformer 在 HR 阳性/HER2 阴性亚组上的 pCR 预测 AUC 达到 0.94(https://huggingface.co/papers?q=treatment response prediction)。

场景四:纵向治疗响应建模。 利用 T0 至 T3 四个时间点的影像序列,建模肿瘤体积的动态变化轨迹,并研究早期变化(T1)与最终 pCR 的关系。I-SPY 1 的核心发现正是这一方向的起点。

场景五:域偏移与公平性基准测试。 在 I-SPY 上训练、在 Duke 或其他机构的数据上测试以评估跨机构性能衰减;或按年龄、绝经状态、乳腺密度等亚组做公平性分析,复现 MAMA-MIA 的评测框架。


§2 医学背景

§2.1 ICD-11 编码映射

标签 ICD-11 编码 中文名
主要疾病 2C60 乳房恶性肿瘤
亚型(解剖) 2C60.0 乳房中央部恶性肿瘤
亚型(解剖) 2C60.1 乳房上内侧象限恶性肿瘤
亚型(解剖) 2C60.2 乳房上外侧象限恶性肿瘤
治疗情境 无专用编码 新辅助治疗(术前全身治疗)
疗效终点 无专用编码 病理完全缓解(pCR)
分期 2E60-2E6Z 区段 临床 II-III 期(试验入组要求)

需要说明的是,ICD-11 没有为"新辅助治疗情境"或"病理完全缓解"设置独立编码,这两个概念在临床记录中通常通过治疗史与病理报告字段表达。数据集中的分期信息以试验资格标准形式存在(临床 II 至 III 期),而非以标准分期字段结构化存储。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 术语
主要疾病 2C60 254837009 Malignant tumor of breast
浸润性导管癌 2C60 408643008 Infiltrating duct carcinoma of breast
三阴性乳腺癌 2C60 417181009 Triple negative breast cancer
激素受体阳性 2C60 416851007 Estrogen receptor positive tumor
HER2 阳性 2C60 431396003 Human epidermal growth factor receptor 2 positive
新辅助治疗 无 373846009 Neoadjuvant therapy
病理完全缓解 无 252126009 No evidence of residual tumor
乳腺 MRI 无 425560002 Magnetic resonance imaging of breast
动态对比增强 MRI 无 433065005 Dynamic contrast enhanced magnetic resonance imaging
弥散加权成像 无 438743003 Diffusion weighted magnetic resonance imaging
功能肿瘤体积 无 无对应 Functional tumor volume(I-SPY 专用影像学指标)
MammaPrint 无 无对应 70-gene expression profiling assay

功能肿瘤体积与 MammaPrint 属于研究性指标与专有检测,尚无 SNOMED CT 对应术语,这是影像组学指标在标准医学术语体系中覆盖不足的一个典型例子。

§2.2 疾病简介与流行病学

乳腺癌是全球女性最常见的恶性肿瘤之一。I-SPY 系列研究关注的不是全部乳腺癌,而是一个特定亚群:局部晚期、复发风险高的乳腺癌。I-SPY 2 的入组标准要求肿瘤直径至少 2.5 厘米且无远处转移(https://www.cancerimagingarchive.net/?p=42613),这意味着该队列系统性地富集了侵袭性较强的肿瘤。ISPY2 集合的人口学概览显示:719 例受试者全部为女性,平均年龄 48.9 岁(标准差 11),中位年龄 49 岁,年龄跨度 24 至 73 岁(https://www.cancerimagingarchive.net/?p=42613)。种族构成上,白人占 79.3%、黑人占 12.5%、亚裔占 6.4%,西班牙裔占 13%。

I-SPY 系列的医学意义在于它把"是否实现病理完全缓解"确立为核心疗效终点。pCR 指的是手术切除标本中乳腺与腋窝淋巴结均未发现浸润性癌残留。在侵袭性较强的亚型中,pCR 与长期生存的相关性尤其强,因此 pCR 被接受为加速药物开发的有效替代终点。这也解释了为什么 I-SPY 2 敢于用 pCR 而非总生存期作为主要终点:它大幅缩短了试验周期。在公开的 982 例口径中,pCR 率为 32.2%(317 例),激素受体阳性占 54.5%(537 例),HER2 阳性占 24.8%(244 例)(https://github.com/naomifridman/BreastDCEDL/blob/main/ISPY2/README.md)。

§2.3 临床任务定义

I-SPY 数据可支撑的临床任务可归为四类,其难度与数据需求差异显著。

任务类型 具体定义 数据需求 难度与主要障碍
疗效预测(预测建模) 由治疗前影像预测手术后 pCR T0 影像 + 临床变量 + pCR 标签 高。MAMA-MIA 显示仅凭基线影像时所有团队性能偏低(https://arxiv.org/html/2608.29162v1)
图像分割 勾画原发肿瘤区域 影像 + 专家掩膜 中。外部测试集 Dice 参考值 0.713(https://arxiv.org/html/2608.29162v1)
分子分型 由影像推断 HR 与 HER2 状态 影像 + 免疫组化标签 中至高。亚型间影像表型重叠明显
纵向轨迹建模 建模 FTV 随时间变化并预测最终反应 多时间点影像 + 随访 中。需解决时间点对齐与缺失问题

对这四类任务,数据集中可用的监督信号强度并不相同。pCR 与分子分型是明确的二分类标签且覆盖全部入组患者;肿瘤分割标签只在 ISPY1 扩展集(163 例专家标注)与 ISPY2/ACRIN-6698 的 FTV 掩膜中提供,覆盖面有限且两者定义不同(见坑点 4);纵向轨迹建模则需要处理部分患者时间点缺失的问题。

§2.4 患者人群特征

维度 ISPY2 集合 ISPY1 集合 ACRIN-6698 集合
来源机构 22 家以上美国临床中心 9 家美国机构 10 家美国机构
入组时间 2010–2016 2002-05 至 2006-03 2012-08 至 2015-01
样本量 719 例(合并后 985 例) 222 例(原始入组 237 例) 385 例(原始入组 406 例)
年龄(均值 ± 标准差) 48.9 ± 11 岁 47.8 ± 9 岁 48.8 ± 11 岁
年龄范围 24–73 岁 24–68 岁 23–77 岁
性别 100% 女性 100% 女性 100% 女性
种族构成 白人 79.3%、黑人 12.5%、亚裔 6.4% 白人 74.3%、黑人 18.9%、亚裔 4.1% 白人 73%、黑人 10%、亚裔 8%、未知 6%
西班牙裔 13% 未提供 6%(另有 32% 缺失)
疾病分期 临床 II–III 期,肿瘤 ≥2.5 cm T3 期,肿瘤 ≥3 cm 浸润性乳腺癌,I-SPY 2 入组者
就医类型 临床试验入组(多中心前瞻性) 临床试验入组 临床试验子研究入组

三个集合的年龄分布相当一致(均值都在 48 至 49 岁),但种族构成存在差异:ISPY1 中黑人占比(18.9%)明显高于 ISPY2(12.5%)与 ACRIN-6698(10%)。ACRIN-6698 有 6% 的种族信息缺失,且西班牙裔信息有 32% 缺失(https://www.cancerimagingarchive.net/?p=41253),这在做公平性分析时需要作为信息性缺失处理,而不是当作随机缺失。

§2.5 临床价值

I-SPY 系列对临床实践最直接的贡献,是证明了影像学指标可以作为疗效的早期替代信号。I-SPY 1 的分析显示,在治疗早期(第一周期 AC 之后)测量的 MR 肿瘤体积变化是唯一具有统计学意义的 pCR 预测变量,而临床触诊尺寸变化与 MR 最长径变化均未达到显著水平(https://ascopubs.org/doi/10.1200/jco.2009.27.15_suppl.529)。在治疗结束(t4)时点,MR 体积与病理尺寸的相关系数为 0.61,明显高于临床尺寸的 0.44 与 MR 最长径的 0.28。这一发现奠定了后续功能肿瘤体积分析的基础。

I-SPY 2 的贡献则在于试验设计层面。它验证了自适应平台试验可以在乳腺癌新辅助治疗情境下高效筛选药物:veliparib/carboplatin 在三阴性乳腺癌中达到 51% 对 26% 的 pCR 率优势并成为首个毕业方案,neratinib 在 HER2 阳性/激素受体阴性亚型中达到 56% 对 33% 的优势(https://www.ascopost.com/News/43794)。这两个结果同时发表于 2016 年 7 月的《新英格兰医学杂志》,本身即说明自适应设计在肿瘤学药物开发中的方法论价值得到了主流认可。

对 AI 研究者而言,临床价值体现在数据本身的结构:pCR 是一个有明确临床意义的、与长期生存相关的端点,而不是一个纯粹的图像标注任务。用这批数据训练的模型,如果能可靠预测 pCR,理论上可以支持治疗方案的早期调整。

§2.6 金标准定义

标签/端点 划分方式 标注方式 标注者/来源 性质
pCR(病理完全缓解) 二分类(是/否) 手术标本病理判读,乳腺与腋窝淋巴结均无浸润性癌残留 各参与中心的病理科 金标准临床终点
HR(激素受体状态) 二分类 免疫组化 各中心病理科 标准生物标志物
HER2 状态 二分类 免疫组化 + 原位杂交 各中心病理科 标准生物标志物
MammaPrint 风险等级 二分类(High / Ultra High) 70 基因表达谱检测 集中检测 试验分层因子
FTV(功能肿瘤体积) 连续值 强度阈值分割(含背景阈值与约 70% 最小 PE 阈值) UCSF 分析实验室算法 派生定量影像指标
STV(结构肿瘤体积) 连续值 手工勾画肿瘤完整范围 乳腺放射科专家(ISPY1 扩展集,163 例) 专家标注
肿瘤最长径 连续值(毫米) 放射科医师在基线 MRI 上测量 各中心放射科 常规测量
无复发生存(RFS) 时间-事件 随访记录 试验随访体系 临床终点

需要特别区分 FTV 与 STV 两个分割概念。FTV 是按体素强度阈值定义的"功能性活跃区域",反映肿瘤血管灌注特征,但只覆盖超过阈值的体素,不能完整描述肿瘤负荷;STV 则勾画原发灶的完整结构范围(https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf)。两者不是同一掩膜的两个版本,混用会导致模型学到不同的解剖定义(见坑点 4)。


§3 数据集规格

§3.0 版本抉择矩阵

I-SPY 相关数据在 TCIA 上存在多个集合与结果集,选择哪一个取决于研究目标。

你的需求 推荐版本 大小 理由
做 pCR 预测,需要最大样本量 ISPY2 + ACRIN-6698 合并(I-SPY2 Imaging Cohort 1) 2.41 TB 985 例完整队列;仅下载 ISPY2 得到 719 例的不完整子集,结果不可与已发表结果比较
做快速原型验证,不希望处理 DICOM BreastDCEDL_ISPY2 结果集 54 GB 已转为 NIfTI、已配准、含固定 train/val/test 划分,开箱可用
研究乳腺 DWI 与 ADC 重复性 ACRIN-6698 集合 841.95 GB 唯一含 4 个 b 值与 test-retest 亚组(71 对可分析)的集合
做肿瘤分割,需要专家勾画标签 ISPY1-Tumor-SEG-Radiomics 扩展集 见 ISPY1(78.36 GB) 163 例基线影像均由乳腺放射科专家勾画 STV 与 FTV 双套标签
做跨机构泛化与公平性评测 MAMA-MIA 基准 1,506 例训练 + 574 例外部测试 统一 49 变量、统一勾画、配套公平性评分框架
早期方法验证、比较纵向体积动力学 ISPY1 集合 78.36 GB 222 例、方案相对统一(AC 序贯紫杉),扫描协议一致性高

一个常见的误判是"直接下载 ISPY2 集合即可"。TCIA 官方明确说明:仅下载该集合会得到 719 例的不完整队列,结果无法与已发表结果比较,必须使用数据访问表中提供的 manifest 文件才能获得覆盖两个集合的完整 985 例(https://www.cancerimagingarchive.net/?p=42613)。这是使用该数据集时最容易踩的第一个工程问题。

§3.1 模态详情

动态对比增强 MRI(DCE-MRI):核心模态。ISPY2 采用 1.5T 或 3.0T 扫描仪配合专用乳腺射频线圈,患者俯卧位成像,轴向双侧全覆盖采集(https://www.cancerimagingarchive.net/?p=42613)。T1 加权 DCE 序列的相位时长要求控制在 80 至 100 秒之间,注射对比剂后连续采集至少 8 分钟。每例患者的所有检查必须在同一台扫描仪配置上完成(同一型号、同一场强、同一乳腺线圈型号),这是保证纵向可比性的关键约束。ISPY1 的采集参数不同:1.5T、单体位、矢状面成像,T1 加权序列扫描时长 4.5 至 5 分钟,层面厚度不超过 2.5 毫米(https://www.cancerimagingarchive.net/collection/ispy1)。

弥散加权成像(DWI):ACRIN 6698 子研究的核心模态,采集 4 个 b 值(b=0、100、600、800 s/mm²),关键分析使用 b=600 与 b=800(https://www.cancerimagingarchive.net/?p=41253)。需要特别注意:ISPY2 主集合中并不包含 DWI 数据,主集合页明确说明 DWI 采集当时正处于质量审查阶段故未收录(https://www.cancerimagingarchive.net/?p=42613)。很多人会误以为 ISPY2 包含全部序列。

派生影像对象:ISPY2 与 ACRIN-6698 集合包含 UCSF 分析实验室计算的派生对象,包括 SER 图(信号增强比)、PE 图(百分比增强)、单侧裁剪的 DCE 原始图,以及 FTV 分析掩膜。掩膜以 DICOM SEG 对象存储于独立序列(https://www.cancerimagingarchive.net/?p=42613)。派生对象不包含原始导出的 reformats、CAD 软件输出与 MIP 图像。

临床与分子数据:以 XLSX 表格形式提供,覆盖人口学、分子检测(HR、HER2、MammaPrint)、随访与治疗信息。ISPY2 Imaging Cohort 1 的临床表覆盖全部 985 例,另有覆盖 384 例的放射组学特征表。

§3.2 按子集样本数

子集/数据对象 样本数 说明
ISPY2 集合受试者 719 2010–2016 年间随机化的 I-SPY 2 患者
ISPY2 集合 studies / series / 图像数 2,688 / 32,411 / 5,586,493 含纵向多时间点、原始 DCE、T2 加权与派生对象
ACRIN-6698 集合受试者 385 DWI 子研究,含 266 例并入 Cohort 1
ACRIN-6698 集合 studies / series / 图像数 1,123 / 18,747 / 2,911,334
I-SPY2 Imaging Cohort 1 985 719 例 ISPY2 + 266 例 ACRIN-6698
Cohort 1 studies / series / 图像数 3,677 / 43,356 / 7,575,549
ISPY1 集合受试者 222 原始入组 237 例,230 例符合资格
ISPY1 集合 studies 847
ISPY1-Tumor-SEG-Radiomics 扩展集 163 具备基线双相位后对比影像者
ISPY2 放射组学特征子集 384 四项定量特征,中位年龄 49 岁
BreastDCEDL_ISPY2 结果集 982 985 例中排除 3 例影像或元数据不完整者
入组 9 个已完成实验臂或对照臂 985 Cohort 1 全部受试者

§3.3 数据格式

数据类型 格式 说明
原始影像 DICOM(MR) 未处理,仅做去标识化处理
派生掩膜 DICOM(SEG) 位编码分割对象,非严格 DICOM 合规
派生参数图 DICOM(MR) SER 图、PE 图,存于独立序列
临床数据 XLSX 985 例临床表 56.84 KB;384 例放射组学表 129.83 KB
深度学习结果集 NIfTI BreastDCEDL_ISPY2,54 GB,含 8,021 个序列
结果集临床数据 TSV 229 KB(临床)、510 KB(文件大小)、2.55 KB(数据字典)
私有标签字典 XLSX ACRIN 6698 ISPY2 共享私有标签数据字典
数据描述文档 PDF / DOCX DWI 与 DCE MRI 数据描述、分析掩膜文件说明

§3.4 存储大小

原始数据总体积按集合分别为:ISPY2 集合 1.75 TB、ISPY2 Imaging Cohort 1 完整包 2.41 TB、ISPY1 集合 78.36 GB、ACRIN-6698 集合 841.95 GB。TCIA 的 ISPY2 集合页标注的总规模为 4.16 TB(https://www.cancerimagingarchive.net/?p=42613),涵盖集合的全部关联资源。深度学习结果集 BreastDCEDL_ISPY2 为 54 GB。工程上下载 2.41 TB 的完整 Cohort 1 需要相当长的网络时间与充足的本地存储;若研究只需要基线影像,TCIA Data Retriever 支持按 series UID 清单选择性下载,预先筛选比事后删除更经济。

§3.5 标注方式

I-SPY 的标签体系混合了三种不同性质的标注来源,这一点在使用时必须分清。

临床金标准标注(人工,覆盖全队列):pCR 由各参与中心的病理科在手术标本上判读,属于最高等级的监督信号。HR 与 HER2 状态来自免疫组化与原位杂交,属于标准临床检测。这两类标签对全部 985 例患者基本可用。

分子分层标注(集中检测):MammaPrint 70 基因表达谱由集中实验室检测,用于试验分层。I-SPY 2 将患者按 MammaPrint 分数分为 High 与 Ultra High 两档,分界点取 I-SPY 1 中符合 I-SPY 2 资格标准患者的中位 MammaPrint 分数作为预设分层因子(https://www.pumabiotechnology.com/news/2016/20160707.html)。

影像标注(自动化派生 + 专家手工,覆盖部分子集):FTV 掩膜由 UCSF 分析实验室的算法依据强度阈值生成,属于自动化派生标注;STV 掩膜由乳腺放射科专家手工勾画,仅存在于 ISPY1 扩展集的 163 例中。MAMA-MIA 则组织了 16 位放射科医师对全部 1,506 例进行统一勾画(https://arxiv.org/html/2608.29162v1),这是目前该系列中标注一致性最高的影像标签资源。

§3.6 标注者资质与一致性

影像标注的质量差异是 I-SPY 使用中最需要警惕的方面。UCSF 派生的 FTV 掩膜由算法生成、经分析实验室质量控制,掩膜编码了多个处理步骤(背景阈值、最小 PE 阈值、手动定义的矩形感兴趣体积、手动定义的排除区域),因此它不是纯自动的,其中包含人工干预环节(https://www.cancerimagingarchive.net/?p=42613)。

ISPY1 扩展集的 STV 标注由具备资质的乳腺放射科专家完成,该扩展集同时提供 STV 与 FTV 两套标签,使研究者可以直接比较两种定义下的模型表现。研究显示,从 STV 区域提取的放射组学特征在预后性能上优于 FTV 值(https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf)。MAMA-MIA 的组织方式提供了当前最高的一致性基准:1,506 例训练数据由 16 位放射科医师统一勾画全部原发肿瘤,形成具有一致专家标注的联合数据集(https://arxiv.org/html/2608.29162v1)。若研究对分割标签一致性要求高,应优先使用 MAMA-MIA 衍生的标注而不是直接拼接各原始集合的掩膜。

§3.7 采集周期

I-SPY 系列的采集跨越两个阶段。I-SPY 1 的入组窗口为 2002 年 5 月至 2006 年 3 月(https://www.cancerimagingarchive.net/collection/ispy1);I-SPY 2 于 2010 年春启动并持续进行(https://www.cancerimagingarchive.net/?p=42613),而公开影像数据覆盖的是 2010 至 2016 年间随机化的患者。ACRIN 6698 子研究的入组窗口为 2012 年 8 月至 2015 年 1 月(https://www.cancerimagingarchive.net/?p=41253)。

这一时间结构带来两个重要影响。其一,ISPY1 与 ISPY2 之间的治疗方案差异显著:I-SPY 1 患者接受蒽环类-环磷酰胺(AC)方案,单独使用或后续接紫杉类药物;I-SPY 2 患者统一接受每周紫杉醇(HER2 阳性者加曲妥珠单抗),随后统一接受 4 个周期 AC(https://escholarship.org/content/qt1039w857/qt1039w857_noSplash_5b015e978f4d81d9521e12fa86fa4c50.pdf)。因此不能把两个集合简单合并当作同一干预下的队列。其二,扫描技术在 14 年间持续演进,早期的 ISPY1 与较晚的 ISPY2 在序列参数上存在系统性差异。

§3.8 地域覆盖

全部公开影像数据采集自美国境内的临床中心:ISPY2 来自 22 家以上美国中心,ISPY1 来自 9 家美国机构,ACRIN-6698 来自 10 家美国机构。这一单国属性是模型泛化能力的主要限制来源之一:MAMA-MIA 挑战刻意用美国数据训练、用波兰(30 例)、立陶宛(232 例)与西班牙(312 例)三个欧洲中心的私有数据测试,以检验跨大洲泛化(https://arxiv.org/html/2608.29162v1)。在人口学构成上还需注意,ISPY2 的种族分布为白人 79.3%、黑人 12.5%、亚裔 6.4%(https://www.cancerimagingarchive.net/?p=42613),美国境外人群、以及美国境内其他族裔群体的代表性都不足。

§3.9 设备规格

集合 场强 线圈 体位与方位 关键参数
ISPY2 1.5T 或 3.0T 专用乳腺射频线圈 俯卧位,轴向双侧全覆盖 T1 DCE 相位 80–100 秒,注射后连续采集 ≥8 分钟
ACRIN-6698 1.5T 或 3.0T 专用乳腺线圈 俯卧位,轴向 4 个 b 值(0/100/600/800 s/mm²),DWI 需站点资格认证
ISPY1 1.5T 专用乳腺射频线圈 单体位,矢状面 层面厚度 ≤2.5 mm,TR ≤20 ms,TE = 4.5 ms,翻转角 ≤45°,FOV 16–18 cm,矩阵最小 256×192,64 层,T1 序列 4.5–5 分钟

ISPY1 的采集参数记录得更为完整,因为它年代较早、协议为单一固定方案。ISPY2 虽然也规定了协议上限,但 22 家以上中心、多种厂商设备的现实导致实际参数存在机构间差异。文档还特别说明:部分研究可能在提交至分析与归档中心之前已经过匿名化,因此某些分析所必需的扫描仪厂商私有属性不保证存在(https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf)。这一点在需要做强度标准化或厂商特定校正时会造成实质困难。

§3.10 深度溯源链

I-SPY 数据的溯源链跨越了十五年、多个机构与多层加工。

环节 责任主体 产物
试验设计与资助 FNIH 生物标志物联盟(含 FDA、NIH 与制药企业)、CALGB/ACRIN 试验方案、注册记录
患者入组与治疗 22 家以上美国临床中心 临床数据、原始影像
影像分析与质控 UCSF 乳腺影像研究项目核心实验室 SER/PE 参数图、FTV 掩膜
分子检测 集中实验室 MammaPrint 70 基因表达谱
病理判读 各中心病理科 pCR、HR、HER2 标签
数据归档与发布 The Cancer Imaging Archive (TCIA) ISPY1、ISPY2、ACRIN-6698 集合
二次加工(非官方) 独立研究团队 BreastDCEDL_ISPY2、MAMA-MIA 统一基准
试验运营管理 Quantum Leap Healthcare Collaborative (QLHC) 持续试验运营

理解这条链条的关键在于区分"原始发布"与"二次加工"。ISPY1/ISPY2/ACRIN-6698 是 TCIA 官方集合,有稳定的 DOI;BreastDCEDL 与 MAMA-MIA 是第三方对官方集合的再加工,各有自己的 DOI 与引用要求。二者不可混用为训练/测试的独立划分。


§4 数据结构

§4.0 目录树

以下为使用 TCIA Data Retriever 下载 ISPY2 Imaging Cohort 1 后的典型目录结构。患者目录以 I-SPY 2 试验分配的 6 位数字标识符命名,检查目录以临床试验访视代码标识。

I-SPY2_Imaging_Cohort1/
├── manifest-<collection>.tcia            # 下载清单,含全部 985 例的 series UID
├── ISPY2-Imaging-Cohort-1-Clinical-Data.xlsx    # 985 例临床与人口学数据(56.84 KB)
├── Multi-feature-MRI-NACT-Data.xlsx             # 384 例放射组学特征(129.83 KB)
├── Analysis-mask-files-description.docx         # FTV 掩膜编码说明
├── ACRIN-6698-ISPY2-Shared-Private-Tag-Data-Dictionary.xlsx
├── ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions.pdf
└── <PatientID>/                          # 6 位试验患者号,如 109623
    ├── <StudyUID>/                       # 每次 MRI 检查一个 study
    │   ├── T0/                           # 术前基线
    │   │   ├── 1.3.6.1.4.1..../          # series UID 目录
    │   │   │   ├── 1-001.dcm             # 单张 DICOM 切片
    │   │   │   ├── 1-002.dcm
    │   │   │   └── ...
    │   │   ├── 1.3.6.1.4.1..../          # T2 加权序列
    │   │   └── 1.3.6.1.4.1..../          # DCE 原始序列
    │   ├── T1/                           # 方案 1 治疗 3 周后
    │   ├── T2/                           # 紫杉醇与蒽环类之间
    │   └── T3/                           # 4 周期 AC 后、手术前
    └── <StudyUID>/                       # 派生对象 study
        ├── 1800/                         # 单侧裁剪 DCE 原始(SeriesNumber 1800)
        ├── 1000/                         # SER 图(SeriesNumber 1000)
        ├── 100/                          # PE 相位图(SeriesNumber 100)
        └── 1900/                         # FTV 分析掩膜(DICOM SEG)

必须强调目录树中的两个非直观之处。第一,T0/T1/T2/T3 的目录命名是访视代码的直观化表达,实际 DICOM 中的访视标识存储在标签 (0012,0050) 与 (0012,0051),字段值分别为 T0/T1/T2/T3 与 baseline/early-treatment/inter-regimen/pre-surgery(https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf)。第二,派生对象的识别依赖 SeriesNumber 或 SeriesDescription,而基准值因扫描仪厂商而异——例如 DCE 根目录在西门子与 GE 系统上等于第一个原始 DCE 序列号,在飞利浦系统上等于原始 DCE 序列号除以 100(https://www.cancerimagingarchive.net/?p=42613)。按固定数字硬编码会漏掉整个厂商的病例。

§4.1 DAIMS 字段字典

下表为临床主表(ISPY2-Imaging-Cohort-1-Clinical-Data.xlsx)与影像序列表的核心字段字典。

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
Patient ID 文本 I-SPY 2 试验分配的唯一患者号 109623 主键,跨表连接 无 无 6 位数字
Age 整数 入组时年龄(岁) 49 协变量、公平性亚组 记录口径为筛选时年龄 无 24–73
Race 分类 自报种族 White 公平性分析 自报偏差,6% 缺失 Unknown 8 类
Ethnicity 分类 西班牙裔标识 Non-Hispanic 公平性分析 ACRIN-6698 中 32% 缺失 Unknown Hispanic/Non-Hispanic
HR 二分类标签 激素受体状态 Positive 分层与标签 各中心 IHC 判读差异 无 Positive/Negative
HER2 二分类标签 人表皮生长因子受体 2 状态 Negative 分层与标签 IHC + ISH 组合判读 无 Positive/Negative
MP 分类标签 MammaPrint 风险等级 High 试验分层因子 集中检测,一致性高 无 High/Ultra High
pCR 二分类标签 手术时病理完全缓解 1 主要预测目标 各中心病理判读 无 0/1
FTV 浮点 功能肿瘤体积(cm³) 4.82 定量影像终点 与原始试验值不完全一致(见坑点 5) 不可分析研究缺席 ≥0
LD 浮点 肿瘤最长径(mm) 42.0 常规测量基线 测量者间变异 无 >0
Sphericity 浮点 球形度 0.71 形态学特征 依赖分割质量 无 0–1
BPE 浮点 对侧背景实质强化 0.34 背景特征、混杂控制 与绝经状态强相关 无 ≥0
ClinicalTrialTimePointID 文本 访视代码 T0 纵向对齐 无 无 T0/T1/T2/T3
SeriesInstanceUID 文本 序列唯一标识 1.3.6.1.4.1… 影像索引、清单下载 无 无 UID 格式
SeriesNumber 整数 序列编号 1000 派生对象识别 厂商基准不同(见坑点 2) 无 依厂商
SeriesDescription 文本 序列描述 ISPY2: VOLSER: uni-lateral cropped: SER 派生对象识别 命名格式厂商差异 无 自由文本
Modality 文本 模态代码 MR 序列筛选 无 无 MR/SEG
RescaleSlope 浮点 重缩放斜率 0.001 SER 值还原 无 无 依对象
RescaleIntercept 浮点 重缩放截距 0 SER 值还原 无 无 依对象

字段字典中有三个需要特别留意的设计。其一,Patient ID 是试验分配的 6 位数字,不是 TCIA 常见的 PatientID 格式,跨集合连接时需用试验号而非影像归档号。其二,SER 图以整数存储,原始 SER 值需通过 RescaleSlope 与 RescaleIntercept(DICOM 标签 0028,1052-1054)还原至 0.0 至 3.0 区间(https://www.cancerimagingarchive.net/?p=42613),忽略这一步会得到量级完全错误的数值。其三,`Race` 与 Ethnicity 在部分集合中存在信息性缺失,处理方式会影响公平性分析结论。

§4.2 标签分布

在 982 例标准口径(985 例排除 3 例影像或元数据不完整者)中,标签分布如下(https://github.com/naomifridman/BreastDCEDL/blob/main/ISPY2/README.md):

标签 类别 样本数 占比
pCR 是 317 32.2%
pCR 否 665 67.8%
HR 阳性 537 54.5%
HR 阴性 445 45.5%
HER2 阳性 244 24.8%
HER2 阴性 738 75.2%

pCR 阳性率约为三分之一,这在此类高危新辅助治疗队列中属于典型水平。需要注意公开文档内部存在口径差异:BreastDCEDL 的说明在同一段落中同时给出 313 例(32%)与 317 例(32.2%)两组数字。本文以表格口径的 317 例(32.2%)为准,但使用者在引用时应当核对自己所用版本的具体口径。

在 MAMA-MIA 的统一基准中,1,506 例训练数据的 pCR 分布为 440 例(29.2%)达到、1,051 例(69.8%)未达到、15 例(1.0%)标签缺失(https://arxiv.org/html/2608.29162v1);外部测试集 574 例中 160 例(27.9%)达到 pCR。三个口径的阳性率在 28% 至 32% 之间,说明该终点在不同子集间相对稳定,这对建模是有利的。

§4.3 关键统计

统计量 数值 来源
Cohort 1 总样本 985 例 TCIA ISPY2 集合页
平均每例 studies 约 3.7 个 3,677 / 985
平均每例 series 约 44 个 43,356 / 985
平均每例图像数 约 7,690 张 7,575,549 / 985
每例治疗期 MRI 次数 4 次(T0–T3) TCIA ISPY2 集合页
DCE 数据满足 FTV 分析验收比例 >95% TCIA ISPY2 集合页
已完成实验臂数 9 个 + 对照臂 TCIA ISPY2 集合页
采集中心数 22 家以上 TCIA ISPY2 集合页
ISPY1 MR studies 847 个 / 222 例 IDC ISPY1 集合页
ISPY1 DCE 相位数 通常 3–6 期 MAMA-MIA 分析
ISPY2 DCE 相位数 常 7 期以上 MAMA-MIA 分析

平均每例约 7,690 张 DICOM 图像这一数字解释了为什么总量达到 TB 级:DCE 序列本身包含多个时间相位,每个相位是一整套三维体数据,再叠加 T2 加权序列与派生对象,单例数据量自然庞大。这也是为什么在研究只用到基线影像时,按 series UID 选择下载比整集合下载更实际。

§4.4 数据层级

I-SPY 数据结构遵循标准 DICOM 四级层次,但每个层级都对应特定的临床试验语义。

患者(Patient,6 位试验号,如 109623)
  └── 检查(Study,一次 MRI 访视)
        └── 序列(Series,一种采集或派生对象)
              └── 图像(Instance,单张切片或单个体积)
层级 标识符 语义 典型数量
患者 Clinical Trial Patient ID (0012,0040) I-SPY 2 试验受试者 985
检查 Clinical Trial Time Point ID (0012,0050) 治疗过程中的一个访视时间点 每例 4 次
序列 Series Instance UID (0020,000E) 一次采集或一个派生对象 每例约 44 个
图像 SOP Instance UID 单张切片 每例约 7,690 张

关键语义在于检查层级承载了临床试验时间点信息。T0 是术前基线,T1 是方案 1 治疗 3 周后(紫杉醇 ± 实验药),T2 是紫杉醇与蒽环类治疗之间,T3 是 4 个周期 AC 之后、手术之前(https://www.cancerimagingarchive.net/?p=42613)。任何纵向建模都必须以这个时间点体系为对齐基准,而不能依赖检查日期,因为各中心的化疗周期起止时间不同。

此外,影像中心信息被去标识为 SITE AAA、SITE AAB 形式的三字母代码(https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf)。这保留了做中心分层分析的可能,但无法回溯到具体机构。

§4.5 缺失值与信息性缺失

I-SPY 数据中的缺失并非随机,识别其性质是正确建模的前提。

缺失字段/情形 出现场景 性质 建议处理
pCR 标签缺失 MAMA-MIA 训练集 15 例(1.0%) 信息性缺失(病理数据不完整) 从监督训练中排除,不要填补
种族信息缺失 ACRIN-6698 中 25 例(6%),标记为 Unknown 部分信息性 单独作为 Unknown 类别,或从公平性分析中排除
西班牙裔信息缺失 ACRIN-6698 中 32% 缺失 信息性缺失 不可假设为 Non-Hispanic
DWI 检查缺失 ACRIN-6698 主分析队列排除 30 例 信息性缺失(DWI 不可评估) 该 30 例仍可能在 ISPY2 集合中有 DCE 数据
派生对象缺失 不可分析研究不提供全部派生客体 信息性缺失(与影像质量相关) 记录缺失标志,作为质量协变量
厂商私有属性缺失 部分研究提交前已匿名化 结构性缺失 不做依赖私有标签的分析
时间点检查缺失 部分患者未完成全部 4 次 MRI 信息性缺失(可能与病情或退出相关) 纵向建模需显式建模缺失机制

ACRIN-6698 的案例最能说明信息性缺失的处理原则:该子研究共入组 406 例,272 例随机进入 I-SPY 2 治疗或对照臂,其中 30 例因 DWI 检查缺失或不可评估而被排除,最终 242 例构成主要分析队列(https://www.cancerimagingarchive.net/?p=41253)。这 30 例被排除的原因与影像质量相关,而影像质量可能又与分析技术或设备状态相关,因此简单地将其从训练中剔除会引入选择偏倚。更稳妥的做法是把"是否可评估"作为一个显式的协变量记录下来。


§5 数据划分与使用建议

§5.1 官方划分

TCIA 原始集合本身不提供机器学习的训练/验证/测试划分,它提供的是完整的影像归档与临床表格。官方层面唯一接近"划分"的概念是子集定义:I-SPY2 Imaging Cohort 1 是 719 例 ISPY2 与 266 例 ACRIN-6698 的合并,而这个合并本身构成一个明确定义的队列,TCIA 提供了覆盖全部 985 例的清单文件用于一次性下载(https://doi.org/10.7937/TCIA.D8Z0-9T85)。

ACRIN-6698 集合内部则提供了有实际意义的子集划分,包括主要分析子集(242 例,865 个 studies)与 test-retest 集合(71 例)。test-retest 集合是评估指标可重复性的专门资源,它采集了同一患者在基线和早期治疗时点的重复扫描,可用于估计测量误差下界(https://www.cancerimagingarchive.net/?p=41253)。

若有明确的划分需求,最实用的是使用 BreastDCEDL_ISPY2 分析结果集,它提供了固定的 train/validation/test 划分,且按生物标志物亚型与响应结局进行了分层(https://doi.org/10.7937/42WQ-TH78)。这是目前唯一带官方固定划分的版本。

§5.2 社区惯例划分

社区实践中形成了三种主要划分思路。第一种是"原始集合隔离":用 ISPY1 训练、ISPY2 测试或反之,利用两次试验在时间、机构与治疗方案上的自然差异模拟域偏移,但代价是样本量受限(ISPY1 仅 222 例)且方案差异会混入性能差异。第二种是"外部机构隔离":在 I-SPY 上训练、在 Duke-Breast-Cancer-MRI 或其他机构数据上测试;MAMA-MIA 挑战采用这一思路的极端形式,用美国 25 家中心数据训练、欧洲三个中心数据测试(https://arxiv.org/html/2603.01250v2),这是评估真实泛化能力最可信的设计,但外部测试数据通常是私有的。第三种是 MAMA-MIA 与 BreastDCEDL 提供的固定划分,优势是可复现、可横向比较。

§5.3 泄漏风险

I-SPY 的泄漏风险有其特殊性,值得单独强调。

风险一:同一患者的纵向影像跨划分。 每个患者有 4 次 MRI 检查(T0–T3)。若按检查而非按患者做随机划分,同一患者的基线影像可能落在训练集、而治疗后影像落在测试集。由于同一患者的肿瘤在影像上具有高度相似性,模型会学到患者身份而非疗效信号。这是该数据集上最严重也最常见的泄漏形式。

风险二:MammaPrint 分层信息与标签的间接关联。 MammaPrint 是试验的分层因子,而分层因子与 pCR 率强相关。若在特征中使用了分层相关信息(例如"该患者属于 Ultra High 风险"),同时又在测试集上评估,需要意识到这个变量本身是试验设计的一部分,其分布在不同子集中可能不同。

风险三:衍生数据集的样本重叠。 BreastDCEDL 全集由 I-SPY1、I-SPY2 与 Duke 三者构成,共 2,070 例;MAMA-MIA 的 1,506 例训练集包含 ISPY1 的 171 例与 ISPY2 的 980 例。如果用 MAMA-MIA 训练、用 ISPY2 测试,测试样本实际已在训练集中出现过。使用任何衍生集之前,必须核对它与测试集的样本重叠情况。

风险四:中心泄漏。 同一中心的数据在采集参数、患者人群、甚至病理判读习惯上都更相似。若随机划分而非按中心划分,模型可能利用中心特征获得虚高的内部性能。建议在报告内部性能的同时,至少做一次按中心分组的交叉验证(GroupKFold,分组变量用 SITE 代码)。

§5.4 交叉验证建议

划分目标 推荐方案 分组变量 理由
估计内部泛化 5 折分层交叉验证 Patient ID 防止同一患者跨折泄漏
估计中心泛化 留一中心交叉验证 SITE 三字母代码 模拟新中心部署
估计亚型泛化 按 HR/HER2 分层 HR × HER2 组合 保证每个亚型在各折中均有代表
估计时间泛化 按入组年份切分 入组日期 检验自适应随机化带来的时间漂移
估计方案泛化 按试验臂切分 治疗臂 检验跨方案迁移能力

分层变量应同时考虑标签(pCR)与关键协变量(HR、HER2、MammaPrint)。由于 pCR 率在亚型间差异很大(三阴性与 HER2 阳性亚型的 pCR 率显著高于 HR 阳性/HER2 阴性亚型),若不做分层,小折内的类别比例会严重失衡。

§5.5 外部验证建议

考虑到 I-SPY 全部采集自美国多中心临床试验,外部验证至少应从三个方向进行。

跨机构验证:在 Duke-Breast-Cancer-MRI 上验证。这是一份 922 例的单机构数据,扫描协议高度一致,可用于检验模型在设备与流程统一条件下的表现。

跨大洲验证:参照 MAMA-MIA 的设计,在欧洲或其他地区的数据上验证。MAMA-MIA 的外部测试集来自波兰、立陶宛与西班牙三个中心共 574 例(https://arxiv.org/html/2608.29162v1),其挑战结果已明确显示跨大洲迁移会带来实质性能变化。

跨人群验证:按年龄、绝经状态、乳腺密度做亚组分析。MAMA-MIA 的评分框架把公平性作为与准确率同等权重的组成部分,其公平性指标基于年龄、绝经状态与乳腺密度三个维度衡量性能差异(https://arxiv.org/html/2603.01250v2)。团队 FME 在 pCR 任务上的均衡几率差为 0.212(https://arxiv.org/html/2608.29162v1),这个数字可以作为公平性方面的参考量级。


§6 AI 就绪指南

§6.1 快速上手

以下代码假定数据已按 §4.0 的目录结构解压到本地。目录结构预期为:data_root 下含 images/<PatientID>/<StudyUID>/<SeriesUID>/*.dcm 的影像树,与 clinical/ISPY2-Imaging-Cohort-1-Clinical-Data.xlsx 临床表。最小可用子集建议先取 20 至 50 例,验证整条流程跑通后再扩展到全队列。

# 目录结构预期(相对 data_root):
#   data_root/images/<6位患者号>/<StudyUID>/<SeriesUID>/<切片>.dcm
#   data_root/clinical/ISPY2-Imaging-Cohort-1-Clinical-Data.xlsx
# 最小可用子集:先取 20-50 例,确认读取、配准、缓存全链路通畅

import pydicom
import pandas as pd
from pathlib import Path

data_root = Path("./I-SPY2_Imaging_Cohort1")


def list_patients(root: Path):
    """列出全部患者目录(6 位试验号)。"""
    images = root / "images"
    if not images.exists():
        raise FileNotFoundError(f"未找到影像目录:{images}")
    return sorted(p.name for p in images.iterdir() if p.is_dir())


def series_meta(series_dir: Path):
    """读取一个序列的首张切片,抽取 DICOM 元数据。"""
    slices = sorted(f for f in series_dir.iterdir() if f.suffix.lower() == ".dcm")
    if not slices:
        return None
    ds = pydicom.dcmread(str(slices[0]), stop_before_pixels=True)
    return {
        "series_uid": str(getattr(ds, "SeriesInstanceUID", "")),
        # SeriesNumber 是派生对象识别的关键字段,但厂商基准不同(见坑点 2)
        "series_number": int(getattr(ds, "SeriesNumber", -1)),
        "series_desc": str(getattr(ds, "SeriesDescription", "")),
        # 访视代码决定该序列属于哪个治疗时间点
        "time_point": str(getattr(ds, "ClinicalTrialTimePointID", "")),
        "modality": str(getattr(ds, "Modality", "")),
        "n_slices": len(slices),
    }


pids = list_patients(data_root)
print(f"患者数:{len(pids)},示例:{pids[:5]}")

# 展开前 3 例的全部序列元数据,观察时间点与派生对象分布
preview = []
for pid in pids[:3]:
    for study in (data_root / "images" / pid).iterdir():
        if not study.is_dir():
            continue
        for series in study.iterdir():
            meta = series_meta(series) if series.is_dir() else None
            if meta:
                preview.append({**meta, "patient_id": pid})

pd.set_option("display.width", 200)
print(pd.DataFrame(preview)[["patient_id", "time_point", "modality",
                             "series_number", "series_desc", "n_slices"]].to_string())

运行后应能看到每个患者的序列按时间点分布:T0 到 T3 各有若干序列,序列号在 100、1000、1800、1900 附近出现派生对象。若某患者只有 T0 而无后续时间点,属正常缺失,需在纵向建模时处理。

§6.2 数据获取

若不希望本地处理 2 TB 级数据,有两条更轻量的路径:使用 BreastDCEDL_ISPY2 分析结果集(54 GB NIfTI 配合固定划分,可在单张消费级显卡上开始建模,需 IBM Aspera Connect 插件),或通过 NCI Imaging Data Commons 以云对象存储方式访问(适合大规模并行预处理)。两条路径的共同前提是遵守 CC BY 4.0 的署名要求并引用原始 DOI。

集合 规模 下载方式 许可
ISPY2 1.75 TB(集合本身) TCIA Data Retriever 客户端,按集合或按清单 CC BY 4.0
ISPY2 Imaging Cohort 1 2.41 TB TCIA Data Retriever,需使用官方 manifest 文件 CC BY 4.0
ISPY1 78.36 GB TCIA Data Retriever CC BY 4.0
ACRIN-6698 841.95 GB TCIA Data Retriever CC BY 4.0
BreastDCEDL_ISPY2 54 GB IBM Aspera Connect 插件 CC BY 4.0
临床表格(985 例) 56.84 KB 直接下载 CC BY 4.0
放射组学特征表(384 例) 129.83 KB 直接下载 CC BY 4.0

获取流程分三步。第一步,从 TCIA 集合页下载对应集合的清单文件(.tcia 后缀)。第二步,安装并配置 TCIA Data Retriever 客户端,载入清单文件。第三步,指定本地目标目录并启动下载。

关键约束是必须使用官方提供的 manifest 文件而非手动选择集合。TCIA 官方明确说明,若只下载 ISPY2 集合本身,得到的是不完整的 719 例队列,基于该子集的结果无法与已发表结果比较(https://www.cancerimagingarchive.net/?p=42613)。manifest 文件会同时包含 ISPY2 与 ACRIN-6698 的系列,从而构成完整的 985 例。

§6.3 预处理全流程

I-SPY 预处理的核心挑战不是常规的格式转换,而是把多厂商、多中心的 DICOM 序列统一到可比较的强度与几何空间。

# 预处理四阶段:序列筛选 -> 几何统一 -> 强度标准化 -> 体积构建
# 输入:data_root/images/<pid>/<study>/<series>/*.dcm
# 输出:data_root/processed/<pid>_<timepoint>.npz

import numpy as np
import SimpleITK as sitk
from pathlib import Path


def read_series(series_dir: Path):
    """按切片位置排序读取一个 DICOM 序列,返回 SimpleITK 图像。"""
    reader = sitk.ImageSeriesReader()
    files = reader.GetGDCMSeriesFileNames(str(series_dir))
    if not files:
        raise ValueError(f"序列不可读:{series_dir}")
    reader.SetFileNames(files)
    return reader.Execute()


def restore_ser(img):
    """还原 SER 图的整数缩放。SER 值以 x1000 存为整数,
    必须用 RescaleSlope/RescaleIntercept 还原至 0.0-3.0(见坑点 3)。"""
    arr = sitk.GetArrayFromImage(img).astype(np.float32)
    keys = img.GetMetaDataKeys()
    slope = float(img.GetMetaData("0028|1053")) if "0028|1053" in keys else 1.0
    intercept = float(img.GetMetaData("0028|1054")) if "0028|1054" in keys else 0.0
    return arr * slope + intercept


def normalize_intensity(vol, mask=None):
    """稳健强度归一化:用肿瘤区或前景的百分位裁剪,避免极端值主导。
    DCE 的相对增强信息通过相位差值保留,故不做 z-score 而线性映射到 [0,1]。"""
    ref = vol[mask > 0] if mask is not None and mask.sum() > 0 else vol[vol > 0]
    if ref.size == 0:
        return np.zeros_like(vol)
    lo, hi = np.percentile(ref, [1, 99])
    if hi - lo < 1e-6:
        return np.zeros_like(vol)
    return np.clip((vol - lo) / (hi - lo), 0, 1)


def build_phase_stack(dce_dir, mask_dir, out_dir: Path, pid: str, tp: str):
    """构建单个患者单个时间点的多相位体数据栈。
    关键:必须保留相位维度,因为 DCE 的动态信息是模型最重要的输入。"""
    vol = sitk.GetArrayFromImage(read_series(dce_dir)).astype(np.float32)
    if vol.ndim == 3:
        vol = vol[..., None]
    mask = None
    if mask_dir and Path(mask_dir).exists():
        try:
            mask = sitk.GetArrayFromImage(read_series(Path(mask_dir))).astype(np.uint8)
        except Exception:
            mask = None
    vol = normalize_intensity(vol)
    out_dir.mkdir(parents=True, exist_ok=True)
    np.savez_compressed(out_dir / f"{pid}_{tp}.npz", volume=vol.astype(np.float16),
                        mask=mask if mask is not None else np.zeros_like(vol[..., 0]))
    return vol.shape


def process_patient(pid_root: Path, out_dir: Path):
    """遍历一例患者的全部时间点,按 SeriesDescription 关键词识别派生对象。"""
    results = {}
    for study in sorted(p for p in pid_root.iterdir() if p.is_dir()):
        for series in sorted(p for p in study.iterdir() if p.is_dir()):
            meta = series_meta(series)
            if meta is None:
                continue
            # 用 SeriesDescription 匹配而非硬编码 SeriesNumber,兼容厂商基准差异(见坑点 2)
            desc, key = meta["series_desc"].lower(), meta["time_point"] or "UNKNOWN"
            if "ser" in desc and "map" in desc:
                results.setdefault(key, {})["ser"] = series
            elif "analysis mask" in desc:
                results.setdefault(key, {})["mask"] = series
            elif "cropped" in desc and "original" in desc:
                results.setdefault(key, {})["dce"] = series
            elif meta["modality"] == "MR" and "dce" in desc:
                results.setdefault(key, {})["dce_fallback"] = series

    out = {}
    for tp, parts in results.items():
        dce = parts.get("dce") or parts.get("dce_fallback")
        if tp == "UNKNOWN" or dce is None:
            continue
        out[tp] = build_phase_stack(dce, parts.get("mask"), out_dir, pid_root.name, tp)
    return out

预处理中有三个决策点需要明确。序列筛选应基于 SeriesDescription 的关键词匹配而非 SeriesNumber 硬编码,原因见坑点 2。几何统一方面,I-SPY 各中心的体素间距与层厚不同,若要做跨中心建模,需要重采样到统一网格,建议用 SimpleITK 的三次样条插值重采样到如 1 mm × 1 mm × 1 mm 的等比网格,但要注意这会显著增加显存占用,实践中常重采样到 2 mm 各向同性。强度标准化方面,DCE 的临床信息主要在增强动力学(早期增强、晚期增强、信号增强比)而非绝对强度,因此除了线性归一化,更贴合物理意义的做法是基于相位构建差值图与比值图。

§6.4 PyTorch DataLoader

以下为完整的 Dataset 与 DataLoader 实现。设计要点包括:以患者为划分单位防止纵向泄漏、按时间点索引、支持只加载基线。

# 预期目录:processed/<pid>_<t0..t3>.npz,每个文件含 volume (z,y,x,t) 与 mask (z,y,x)
# 训练集/验证集划分按 Patient ID 分组,绝不按时间点切分(见坑点 1)
# 最小可用子集:单时间点(T0)即可跑通基线模型

import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path


class ISPY2Dataset(Dataset):
    def __init__(self, processed_dir, clinical_xlsx, patient_ids,
                 time_points=("T0",), transform=None):
        self.processed_dir, self.time_points, self.transform = (
            Path(processed_dir), time_points, transform)

        # 读取临床表;列名按公开表格口径,实际使用时需先核对列名
        df = pd.read_excel(clinical_xlsx)
        col = {str(c).lower().strip(): c for c in df.columns}
        id_col = col.get("patient id") or col.get("pid") or df.columns[0]
        label_col = col.get("pcr")
        if label_col is None:
            raise KeyError("临床表中未找到 pCR 列,请核对公开表格的列名口径")
        df[id_col] = df[id_col].astype(str)
        self.clinical, self.label_col = df.set_index(id_col), label_col

        # 仅保留有影像与有标签的样本
        self.samples = []
        for pid in patient_ids:
            if pid not in self.clinical.index:
                continue
            label = self.clinical.loc[pid, self.label_col]
            if pd.isna(label):
                continue
            for tp in self.time_points:
                f = self.processed_dir / f"{pid}_{tp}.npz"
                if f.exists():
                    self.samples.append({"pid": pid, "tp": tp,
                                         "file": f, "label": int(label)})

    def __len__(self):
        return len(self.samples)

    def __getitem__(self, idx):
        s = self.samples[idx]
        with np.load(s["file"]) as npz:
            vol = npz["volume"].astype(np.float32)   # (z, y, x, t)
            mask = npz["mask"].astype(np.float32)    # (z, y, x)

        # 通道拼接:多相位强度 + 早期减基线 + 晚期减基线
        if vol.shape[-1] >= 3:
            pre, early, late = vol[..., 0], vol[..., 1], vol[..., 2]
            sub_early, sub_late = early - pre, late - pre
        else:
            pre = vol[..., 0]
            sub_early = sub_late = np.zeros_like(pre)
        img = np.stack([pre, sub_early, sub_late], axis=0)  # (3, z, y, x)

        # 以肿瘤为中心裁剪固定尺寸体块,减少无效背景并统一尺寸
        cz, cy, cx = self._lesion_center(mask, img.shape[1:])
        img = self._crop(img, (cz, cy, cx), size=(32, 128, 128))

        sample = {"image": torch.from_numpy(img.copy()),
                  "label": torch.tensor(s["label"], dtype=torch.long),
                  "pid": s["pid"], "time_point": s["tp"]}
        if self.transform:
            sample = self.transform(sample)
        return sample

    @staticmethod
    def _lesion_center(mask, shape):
        if mask.sum() > 0:
            z, y, x = np.where(mask > 0)
            return int(z.mean()), int(y.mean()), int(x.mean())
        return shape[0] // 2, shape[1] // 2, shape[2] // 2

    @staticmethod
    def _crop(img, center, size):
        offs = [max(0, min(center[i] - size[i] // 2, max(0, img.shape[i + 1] - size[i])))
                for i in range(3)]
        z0, y0, x0 = offs
        out = img[:, z0:z0 + size[0], y0:y0 + size[1], x0:x0 + size[2]]
        pad = [(0, 0)] + [(0, max(0, sz - o)) for sz, o in zip(size, out.shape[1:])]
        return np.pad(out, pad, mode="constant") if any(p[1] > 0 for p in pad) else out


def make_loaders(processed_dir, clinical_xlsx, train_ids, val_ids,
                 batch_size=8, num_workers=4):
    train_ds = ISPY2Dataset(processed_dir, clinical_xlsx, train_ids, time_points=("T0",))
    val_ds = ISPY2Dataset(processed_dir, clinical_xlsx, val_ids, time_points=("T0",))
    train_loader = DataLoader(train_ds, batch_size=batch_size, shuffle=True,
                              num_workers=num_workers, pin_memory=True, drop_last=True)
    val_loader = DataLoader(val_ds, batch_size=batch_size, shuffle=False,
                            num_workers=num_workers, pin_memory=True)
    return train_loader, val_loader


# 按患者而非按影像划分,这是防止纵向泄漏的唯一可靠做法(见坑点 1)
if __name__ == "__main__":
    import random
    root = Path("./I-SPY2_Imaging_Cohort1")
    all_pids = [p.name for p in (root / "images").iterdir() if p.is_dir()]
    random.seed(42)
    random.shuffle(all_pids)
    cut = int(len(all_pids) * 0.8)
    tr, va = make_loaders(root / "processed",
                          root / "clinical" / "ISPY2-Imaging-Cohort-1-Clinical-Data.xlsx",
                          all_pids[:cut], all_pids[cut:])
    print(f"图像张量:{next(iter(tr))['image'].shape}")

§6.5 坑点

⚠️ 坑点 1:按影像而非按患者划分数据集导致纵向泄漏(分类:数据泄漏)

问题:I-SPY 每例患者有 4 次 MRI(T0–T3),若研究者把全部影像文件展开成一个列表再做随机划分,同一患者的基线影像可能进入训练集、治疗后影像进入测试集。由于同一患者的肿瘤在形态与强化模式上高度相似,模型会退化为患者身份识别器,在测试集上得到虚高的 AUC,而跨患者泛化能力实际很弱。
症状:内部验证 AUC 达到 0.90 以上,但换成按患者分组划分后骤降到 0.6 至 0.7;或模型对同一患者的不同时间点给出几乎相同的预测,即使肿瘤已明显缩小。
解决:

  1. 简单方法:在划分前先按 Patient ID 聚合,用 GroupShuffleSplit 或按患者列表切分,确保同一患者的全部时间点只出现在一个折中。
  2. 进阶方法:使用 GroupKFold 并以 Patient ID 为分组变量做交叉验证,分组变量同时加入中心代码以同时防止中心泄漏:GroupKFold(n_splits=5).split(X, y, groups=df["patient_id"] + "|" + df["site_code"])。用 ACRIN-6698 的 test-retest 重复扫描对估计测量误差下界,若模型在同患者重复扫描间的预测方差已接近其在不同患者间的方差,说明学到的是身份而非疗效。
  3. SOTA 方法:在纵向建模中显式引入患者级随机效应,或使用患者对比学习目标,把"同一患者不同时间点"作为正样本对、"不同患者的同期影像"作为负样本对,强制模型学习随时间变化的成分。若做外部验证,采用跨机构划分(在 ISPY2 训练、Duke 或 MAMA-MIA 外部集测试)而非随机划分。
    参考:MAMA-MIA 挑战采用严格的跨机构外部测试设计以避免此类泄漏 — https://arxiv.org/html/2603.01250v2

⚠️ 坑点 2:用固定 SeriesNumber 识别派生对象,漏掉整个厂商的病例(分类:工程陷阱)

问题:I-SPY 的派生对象(SER 图、PE 图、单侧裁剪 DCE、FTV 掩膜)通过 SeriesNumber 与 SeriesDescription 识别。但 SeriesNumber 的基准值因扫描仪厂商而异:在西门子与 GE 系统上,DCE 根目录等于第一个原始 DCE 序列号,而在飞利浦系统上等于原始 DCE 序列号除以 100(https://www.cancerimagingarchive.net/?p=42613)。研究者若按文档示例硬编码序列号去找 SER 图,会系统性遗漏一个厂商设备的全部病例,且这种遗漏不会报错,只会表现为"某些患者没有派生数据"。
症状:数据集中约四分之一的病例缺少 SER 图或掩膜,而 TCIA 页面上这些病例明明存在派生对象;按中心分析时发现某个 SITE 代码的派生对象覆盖率接近零。
解决:

  1. 简单方法:改用 SeriesDescription 关键词匹配。派生对象的描述包含稳定的语义片段,如 VOLSER: uni-lateral cropped: SER、Analysis Mask、uni-lateral cropped: original DCE。
  2. 进阶方法:对每个患者先读取原始 DCE 序列的 SeriesNumber 作为基准,再按文档规则计算派生对象的预期编号(西门子与 GE 直接使用、飞利浦除以 100 后反向还原),并与 SeriesDescription 匹配结果交叉验证。两条路径都命中才认为该序列可信。
  3. SOTA 方法:不依赖序列编号,而是依赖 DICOM 语义内容:SER 图可通过其像素值范围(还原后 0.0–3.0)与私有属性识别,FTV 掩膜可通过 Modality 为 SEG 且有位编码分割特征识别。建立一套内容指纹匹配规则,并记录每个患者的匹配报告作为数据质量审计日志。
    参考:TCIA ISPY2 集合页的派生对象序列识别表 — https://www.cancerimagingarchive.net/?p=42613

⚠️ 坑点 3:忽略 SER 图的整数缩放,得到量级错误的信号增强比(分类:预处理陷阱)

问题:信号增强比(SER)图以整数形式存储,原始 SER 值被乘以 1000 以适配整数存储。若不使用 DICOM 的 RescaleSlope 与 RescaleIntercept(标签 0028,1052-1054)还原,读取到的像素值是真实值的 1000 倍。更隐蔽的问题在于,部分图像的默认斜率可能为 1,使错误值落在看似合理的范围内,从而不被察觉。
症状:SER 图的最大值达到数百甚至数千,而正常范围应为 0.0 至 3.0;基于 SER 阈值做的分割全部失效;模型的 SER 相关特征与 pCR 呈反常的强相关,因为数值被单调放大后阈值效应被破坏。
解决:

  1. 简单方法:读取时显式应用重缩放:arr = pixel_array * float(ds.RescaleSlope) + float(ds.RescaleIntercept),并断言还原后的值域落在 0.0 至 3.0 附近。
  2. 进阶方法:建立自动校验:对每例 SER 图计算最小值、最大值与 99 百分位,若 99 百分位大于 5 则判定为未还原并记录警告;在预处理报告中输出全队列的值域分布直方图,人工确认无异常批次。
  3. SOTA 方法:不依赖 SER 派生对象,而是从原始 DCE 相位自行计算 SER 与百分比增强,这样可以在统一的信号归一化框架下处理全部病例,避免派生对象与原始试验值不一致的问题(见坑点 5)。同时把自行计算的 SER 与派生 SER 图做相关性校验,相关性低于阈值的病例标记为质量可疑。
    参考:TCIA ISPY2 集合页对 SER 缩放与 rescale 字段的说明 — https://www.cancerimagingarchive.net/?p=42613

⚠️ 坑点 4:混淆 FTV 与 STV 两种分割定义(分类:标签理解)

问题:I-SPY 生态中存在两种肿瘤体积定义。功能肿瘤体积(FTV)是按体素强度阈值定义的活跃区域,只覆盖超过特定增强阈值的体素,反映肿瘤血管灌注特征;结构肿瘤体积(STV)则勾画原发灶的完整结构范围(https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf)。二者在解剖覆盖范围上系统性地不同:FTV 会遗漏低增强的肿瘤成分,STV 则包含全部肿瘤组织。研究者常把 ISPY2 集合提供的 FTV 掩膜当作"肿瘤分割真值"直接用于训练分割模型,而实际上它只是一个功能性感兴趣区域。
症状:训练出的分割模型在炎症性、弥漫性或低增强肿瘤上系统性低估病灶范围;用 FTV 掩膜评估时 Dice 很高,换用 STV 标注评估时 Dice 大幅下降;模型预测的肿瘤体积与病理尺寸的相关性低于文献报告值。
解决:

  1. 简单方法:明确区分两种掩膜的用途。做分割任务时优先使用 ISPY1 扩展集的 STV 标注(163 例专家勾画),做疗效定量时使用 FTV 值本身(它本身就是为响应评估设计的指标)。
  2. 进阶方法:在特征工程中同时提取 STV 与 FTV 区域的放射组学特征并对比其预后性能。已有研究表明,从 STV 区域提取的放射组学特征在预后性能上优于 FTV 值(https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf),这提示结构性信息比功能性阈值信息更稳健。
  3. SOTA 方法:使用 MAMA-MIA 统一勾画的标注,该数据集由 16 位放射科医师对全部 1,506 例进行统一的原发肿瘤分割,具有一致的定义与更低的标注者间变异(https://arxiv.org/html/2608.29162v1)。做多任务学习时把"功能性活跃区域"与"结构性肿瘤范围"作为两个独立的分割目标,让模型学习二者的关系而不是混为一谈。
    参考:I-SPY1-Tumor-SEG-Radiomics 数据描述论文 — https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf

⚠️ 坑点 5:假设派生的 SER 客体中 FTV 值与原始试验分析值一致(分类:评估误用)

问题:TCIA 提供的派生对象中包含功能肿瘤体积分析结果,但官方明确说明:SER 派生客体中存储的 FTV 结果与 I-SPY 2 研究实际使用的值并不相同,原因是两个平台的实现方式不同——UCSF 内部软件与 Hologic 公司的 AEGIS 系统。虽然差异通常较小,且 AEGIS 系统曾在先前的 I-SPY 1 试验中针对 UCSF 结果做过验证,但官方不保证结果完全相同(https://www.cancerimagingarchive.net/?p=42613)。研究者若用公开的 FTV 值去复现已发表论文中的具体数字,会发现对不上,进而误判实现有误。
症状:用公开派生对象的 FTV 值复现文献报告的多特征模型,AUC 总有可察觉的偏差;按同一阈值筛选响应者时,与文献中的病例分组不一致;不同批次下载的派生对象之间 FTV 值存在小幅系统性偏移。
解决:

  1. 简单方法:在方法学部分明确声明使用的是 TCIA 公开派生对象中的 FTV 值而非原始试验分析值,并把 FTV 当作一个普通的连续影像特征使用,而不是当作可精确复现的试验端点。做模型比较时,专注于自己数据划分下的相对性能而非与文献绝对数值对齐。
  2. 进阶方法:从原始 DCE 相位自行计算 FTV,实现文档中描述的完整掩膜生成流程:预对比背景阈值处理、最小百分比增强阈值(文档给出约 70% 的名义值)、手动定义的矩形感兴趣体积、以及用于排除侵入矩形区域的非肿瘤增强区的手动排除区域(https://www.cancerimagingarchive.net/?p=42613)。把自算 FTV 与公开值做 Bland-Altman 分析,量化偏差幅度并在论文中报告。
  3. SOTA 方法:不依赖 FTV 这一单一派生指标,改用多特征联合建模。公开的 384 例子集正是沿这个方向:四项定量特征(功能肿瘤体积、最长径、球形度、对侧背景实质强化)联合后的 AUC 高于任何单一特征(https://www.cancerimagingarchive.net/?p=42613)。把派生 FTV 与其他形态学、背景特征一并输入模型,可以降低对单一指标实现细节的敏感性。
    参考:TCIA ISPY2 集合页关于 FTV 实现差异的说明 — https://www.cancerimagingarchive.net/?p=42613

⚠️ 坑点 6:把自适应平台试验当作固定方案的随机对照队列(分类:偏倚陷阱)

问题:I-SPY 2 采用贝叶斯自适应随机化:患者被分配到哪个治疗臂,不仅取决于其分子亚型,还取决于入组时点上累积的疗效数据。方案在某个 signature 内达到 85% 的预测成功概率就毕业退出,单臂最多 120 例,60 例后即可提前毕业(https://www.ascopost.com/News/43794)。这意味着治疗臂与入组日期、分子亚型之间存在系统性的、随时间变化的关联。研究者若把全部 985 例当作一个统一的新辅助化疗队列做分析,等于把不同药物、不同分配机制、不同时期的人群混在一起。
症状:模型中入组年份或治疗臂成为强预测因子,其重要性甚至超过影像特征;某类患者的样本随时间先增多后减少(因为对应试验臂毕业或被淘汰);试图估计某药对某亚型的疗效时,得到与 NEJM 发表结果差异很大的数字。
解决:

  1. 简单方法:除非研究目标就是治疗效应估计,否则在特征中完全排除治疗臂信息,并把研究范围限定为"由治疗前影像预测 pCR"这一预测建模问题,明确声明结果是预测性的而非因果性的。报告中必须说明队列来自自适应平台试验。
  2. 进阶方法:在模型中加入入组日期或试验期次作为协变量以吸收时间漂移,并做敏感性分析:分别在早入组与晚入组子集上训练,比较性能差异。若差异显著,说明存在时间漂移,需要在论文中量化报告。
  3. SOTA 方法:若研究目标是治疗效应,必须使用适用于自适应设计的方法:以 signature 为分析单元、使用贝叶斯分层模型并纳入试验设计信息(如各臂的分配概率)作为权重,或使用 g-computation、逆概率加权等因果推断方法处理时变混杂。任何情况下都不要用朴素的分层比较替代设计感知的分析。I-SPY 2 的原始设计目标是快速筛选而非确证,确证性结论需要 III 期试验。
    参考:NEJM 2016 关于 veliparib/carboplatin 与 neratinib 毕业的试验设计描述 — https://escholarship.org/content/qt1039w857/qt1039w857_noSplash_5b015e978f4d81d9521e12fa86fa4c50.pdf

⚠️ 坑点 7:只用 ISPY2 集合而漏掉 ACRIN-6698 的 266 例,且结果不可比(分类:工程陷阱)

问题:TCIA 上 ISPY2 集合显示 719 例,看起来是一个完整的公开队列。但官方明确说明:仅下载该集合会得到不完整的队列,基于这 719 例的结果无法与已发表结果比较;要获得完整的 I-SPY2 Imaging Cohort 1,必须使用数据访问表中提供的 manifest 文件,因为它会同时包含 ACRIN-6698 集合中的病例(https://www.cancerimagingarchive.net/?p=42613)。很多研究者在集合页直接点击下载,得到的正是那个不可比的 719 例子集,却没有意识到。
症状:样本量为 719 而非 985,且论文中报告的 pCR 率、亚型分布与文献中基于完整队列的数字存在偏差;试图复现文献结果时总差一截;评审质疑样本量来源。
解决:

  1. 简单方法:始终从 ISPY2 集合页的数据访问表下载官方 manifest 文件,而不是直接选择集合下载。核对下载后患者数是否为 985。
  2. 进阶方法:下载后做自动核对:统计患者数、studies 数、series 数、图像数,与官方公布的 985、3,677、43,356、7,575,549 四个数字逐一比对(https://doi.org/10.7937/TCIA.D8Z0-9T85),任一不符即说明下载不完整。把核对结果写入数据质量报告。
  3. SOTA 方法:把数据集版本与清单哈希纳入实验记录,确保任何人复现时获得完全相同的样本集。对衍生数据集(BreastDCEDL、MAMA-MIA)同样核对样本与原始集合的重叠关系,避免把已见样本当作外部测试。
    参考:TCIA ISPY2 集合页的数据访问说明 — https://www.cancerimagingarchive.net/?p=42613

⚠️ 坑点 8:假设所有病例都有完整派生对象与统一影像格式(分类:工程陷阱)

问题:两个相关假设都会失败。第一,并非所有病例都具备全部派生客体:官方文档说明并非所有客体在所有病例中都存在,因为存在不可分析的研究(https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf)。第二,派生的 SER 客体中部分并非严格符合 DICOM 标准,可能无法被某些 DICOM 软件包读取(https://www.cancerimagingarchive.net/?p=42613)。此外,单侧裁剪只对每行体素数不少于 384 的研究执行,低于该阈值的影像保持全双侧,因此派生图像的视野范围在病例间并不统一。
症状:批量读取脚本在部分病例上抛出解析异常或返回空序列;模型输入的空间尺寸在病例间不一致,导致批次拼接失败;以肿瘤为中心裁剪时,某些病例的裁剪框包含了整个双侧乳腺,稀释了病灶信号。
解决:

  1. 简单方法:把读取封装为返回空值的容错函数,记录失败病例清单并在后续分析中显式排除或单独处理;不要假设每个病例都有 T2 加权、DWI 或掩膜。
  2. 进阶方法:建立病例级可用性矩阵(行=患者,列=T0 的 DCE/T2/SER/掩膜、T1 的、T2 的、T3 的),把缺失模式可视化,据此决定研究范围。对裁剪范围不一致的病例,统一用自己的裁剪逻辑(依据掩膜质心)而不是依赖派生图像的既有裁剪。
  3. SOTA 方法:预处理管线适配异构输入:先探测每个序列的可读性与空间范围,再做统一重采样到固定网格与固定尺寸,用掩膜质心而非图像中心定义感兴趣区域。对不可读的派生对象,回退到从原始 DCE 自行计算,从而绕开 DICOM 兼容性问题。所有回退事件记入审计日志并在论文方法部分报告比例。
    参考:ACRIN 6698/I-SPY2 DWI 与 DCE MRI 数据描述文档 — https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf

§6.6 数据增强策略

乳腺 DCE-MRI 的增强策略受解剖约束限制,并非所有通用增强都安全。

增强方法 安全性 说明
左右翻转 ⚠️ 危险 乳腺癌病灶位置与左右侧解剖相关,翻转会制造现实中不存在的对侧病灶映射;若模型需要区分左右,翻转即引入错误标签
随机旋转(小幅) ✅ 安全 旋转 10 至 15 度以内,模拟体位与摆位差异
随机缩放 ✅ 安全 0.9 至 1.1 倍,模拟体素间距与扫描范围差异
弹性形变 ⚠️ 谨慎 幅度需严格限制,过强形变会破坏肿瘤边缘的形态学特征(如球形度、边缘规则性),这些是有临床意义的特征
强度抖动 ✅ 安全 小幅加性噪声或伽马校正,模拟厂商与场强差异
对比度与亮度扰动 ✅ 安全 注意不要破坏 SER 的比值关系,建议在相位域而非派生图域做
随机裁剪 ✅ 安全 以病灶为中心裁剪,但必须保证掩膜完整保留
相位顺序打乱 ❌ 危险 DCE 的相位顺序承载增强动力学信息,打乱会破坏核心信号
混样(MixUp / CutMix) ❌ 危险 不同患者的肿瘤混合在临床上无意义,且会破坏 pCR 标签的语义
跨中心风格迁移 ✅ 安全(进阶) 用 CycleGAN 类方法做中心间风格迁移,可提升跨机构泛化,但需验证未引入伪影

§6.7 模型推荐

任务 推荐架构 理由 关键实现要点
pCR 预测(仅基线) 3D ResNet / 3D DenseNet 参数量与队列规模匹配,不易过拟合 多相位输入拼接为通道;以病灶为中心裁剪
pCR 预测(多时间点) 时序 Transformer / 3D CNN + LSTM 显式建模纵向变化 时间点编码;缺失时间点需掩码处理
pCR 预测(小样本) 影像组学 + 逻辑回归 / XGBoost 985 例规模下经典方法仍具竞争力 特征遵循 IBSI 标准;多特征联合优于单特征
肿瘤分割 nnU-Net 自配置、在异构数据集上稳健 用减影图作为输入通道可提升效果
肿瘤分割(进阶) nnU-Net 集成 + 连通域后处理 外部测试集第二名的方案配置 5 折集成 + 镜像测试时增强
分子亚型分类 ViT / 3D CNN 多任务 HR 与 HER2 联合预测可共享表征 亚型类别不平衡需处理
跨中心泛化 域对抗 / 风格迁移 + 主任务 显式消除中心特定特征 中心标签用 SITE 代码,注意隐私边界

MAMA-MIA 挑战的实际结果提供了重要参考:分割任务上,改用第一后对比减预处理图作为输入、5 折 nnU-Net 残差编码器集成、配合镜像测试时增强与最大连通域后处理,在外部测试集上取得 Dice 0.713、归一化豪斯多夫距离 0.099(https://arxiv.org/html/2608.29162v1)。pCR 预测上,25 个预训练 3D 视频分类器集成、以病灶为中心裁剪、使用预对比与两个后对比体数据,取得平衡准确率 0.541 与公平性综合得分 0.664。这一结果说明:分割任务通过合理的减影输入与集成策略可以在域偏移下保持稳健,而 pCR 预测从基线影像出发本质上仍然困难。

§6.8 硬件需求

场景 GPU 显存 内存 存储 说明
仅用临床变量建模 无需 GPU 16 GB 1 GB 影像组学特征表 129.83 KB,普通笔记本可完成
BreastDCEDL 结果集训练 16 GB 起 32 GB 100 GB 54 GB NIfTI 数据,单卡可训练 3D CNN
全 DICOM 预处理 无需 GPU 64 GB 起 3 TB 起 2.41 TB 原始数据 + 处理中间产物
全队列 3D 分割训练 24 GB 起 128 GB 3 TB 起 nnU-Net 全分辨率训练显存需求高
多时间点时序建模 24 GB 起 128 GB 3 TB 起 4 个时间点同时载入显存压力大,需梯度检查点

存储规划需要有额外考虑:DICOM 原始数据的体积在预处理过程中会膨胀,因为解压后的体数据通常以 float16 或 float32 存储。建议为中间产物预留等于原始数据 1.5 倍的额外空间,或采用流式处理并即时删除中间文件。

§6.9 评估指标

# I-SPY 评估指标:pCR 预测与分割的指标选择差异。
import numpy as np
from sklearn.metrics import (roc_auc_score, balanced_accuracy_score,
                             confusion_matrix, brier_score_loss, recall_score)


def pcr_metrics(y_true, y_prob, threshold=0.5, subgroups=None):
    """pCR 核心指标。类别不平衡时必须报告平衡准确率;AUC 需注意样本量。"""
    y_pred = (np.asarray(y_prob) >= threshold).astype(int)
    y_true = np.asarray(y_true).astype(int)
    out = {"auc": roc_auc_score(y_true, y_prob),
           "balanced_accuracy": balanced_accuracy_score(y_true, y_pred),
           "brier": brier_score_loss(y_true, y_prob),
           "n": int(y_true.size), "prevalence": float(y_true.mean())}
    tn, fp, fn, tp = confusion_matrix(y_true, y_pred, labels=[0, 1]).ravel()
    out.update({"sensitivity": tp / (tp + fn) if (tp + fn) else float("nan"),
                "specificity": tn / (tn + fp) if (tn + fp) else float("nan"),
                "ppv": tp / (tp + fp) if (tp + fp) else float("nan"),
                "npv": tn / (tn + fn) if (tn + fn) else float("nan")})
    # 公平性:按亚组计算均衡几率差(equalized odds difference)
    if subgroups is not None:
        tprs, fprs = [], []
        for g in np.unique(subgroups):
            m = np.asarray(subgroups) == g
            if m.sum() < 10 or len(np.unique(y_true[m])) < 2:
                continue
            tprs.append(recall_score(y_true[m], y_pred[m], pos_label=1))
            fprs.append(recall_score(y_true[m], y_pred[m], pos_label=0))
        if tprs:
            out["equalized_odds_diff"] = max(max(tprs) - min(tprs),
                                             max(fprs) - min(fprs))
    return out


def dice(pred, true, eps=1e-6):
    pred = (np.asarray(pred) > 0).astype(np.float32)
    true = (np.asarray(true) > 0).astype(np.float32)
    return float((2 * (pred * true).sum() + eps) /
                 (pred.sum() + true.sum() + eps))


def hd95(pred, true):
    """95% 豪斯多夫距离。对离群点稳健,分割任务的标准报告指标。"""
    p, t = np.argwhere(np.asarray(pred) > 0), np.argwhere(np.asarray(true) > 0)
    if len(p) == 0 or len(t) == 0:
        return float("nan")
    step = lambda n: slice(None, None, max(1, n // 5000))
    d1 = np.array([np.min(np.linalg.norm(t - x, axis=1)) for x in p[step(len(p))]])
    d2 = np.array([np.min(np.linalg.norm(p - x, axis=1)) for x in t[step(len(t))]])
    return float(np.percentile(np.concatenate([d1, d2]), 95))


# 使用示例:报告主指标时同时给出亚组指标
if __name__ == "__main__":
    rng = np.random.default_rng(0)
    y = rng.integers(0, 2, 985)
    p = np.clip(0.3 * y + rng.normal(0.35, 0.2, 985), 0, 1)
    print(pcr_metrics(y, p, subgroups=rng.choice(
        ["HR+/HER2-", "HER2+", "TNBC"], 985, p=[0.545, 0.248, 0.207])))

指标选择上有三点需要明确。其一,pCR 阳性率约 32%,存在中等程度的类别不平衡,因此必须报告平衡准确率与预测值,仅报告准确率会误导。其二,AUC 在 985 例规模下的置信区间较宽,建议用自助法(bootstrap)报告 95% 置信区间。其三,评估必须包含亚组分析:MAMA-MIA 的评测框架把公平性与准确率同等加权,其公平性基于年龄、绝经状态与乳腺密度衡量性能差异(https://arxiv.org/html/2603.01250v2),团队 FME 报告的均衡几率差为 0.212(https://arxiv.org/html/2608.29162v1),可作为参考量级。

§6.10 MLOps 笔记

数据版本控制。 I-SPY 集合会更新(ISPY2 更新于 2022-05-02,ACRIN-6698 更新于 2021-12-17),而衍生数据集(BreastDCEDL、MAMA-MIA)是独立发布物。实验记录中必须同时记录原始集合版本与衍生集版本,并保存下载清单文件的哈希,建议在项目内维护样本清单(患者号、时间点、序列 UID、可用性)的快照。

预处理可复现性。 DICOM 读取、重采样、强度归一化的每一步都可能引入细微差异。建议把预处理输出与临床表联表校验:核对处理后的样本数是否等于有标签的样本数,核对各时间点的样本分布,核对 pCR 比例是否落在 28% 至 32% 区间。

监控要点。 上线前的模型监控应关注三类漂移:输入分布漂移(体素间距、图像尺寸、相位数的分布)、中心构成漂移(新数据来自不同机构)、标签分布漂移(pCR 率的时序变化)。由于 I-SPY 来自自适应试验,历史数据中治疗效果的真实分布随入组时间变化,用历史数据训练的模型在部署到新时段时性能可能下降。

合规与记录。 CC BY 4.0 许可要求署名,任何衍生产品(包括模型发布页)都应声明使用了 I-SPY 数据集并给出 DOI。TCIA 要求数据引用,使用前应阅读其数据使用政策(https://www.cancerimagingarchive.net/collection/ispy2/)。若模型输出用于患者相关决策场景,必须保留完整的模型卡与数据卡,并声明训练数据来自临床试验人群而非社区诊疗人群。


§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解方式
选择偏倚 入组标准要求肿瘤 ≥2.5 cm 且高复发风险,队列富集侵袭性亚型,与社区乳腺癌人群不同 高 报告中明确声明目标人群;部署前做外部验证;不要外推到早期小肿瘤
时间-治疗混杂 自适应随机化使治疗臂与入组日期、分子亚型相关联,对照组非固定 高 预测任务中排除治疗臂变量;治疗效应分析使用设计感知方法(见坑点 6)
种族构成偏倚 ISPY2 白人占 79.3%,ISPY1 白人占 74.3%;美国境外人群完全缺失 高 亚组公平性评估;跨大洲外部验证;报告中量化性能差异
机构异质性 22 家以上中心、多厂商设备,尽管协议标准化仍有参数差异 中 中心分层交叉验证;图像重采样与强度标准化;域适应方法
标注定义不统一 FTV(功能性阈值)与 STV(结构性范围)两种分割定义并存 中 明确所用定义;优先使用 MAMA-MIA 统一勾画(见坑点 4)
派生值实现差异 公开 FTV 值与原始试验分析值不完全一致 中 声明所用口径;自算并与公开值交叉校验(见坑点 5)
西班牙裔信息缺失 ACRIN-6698 中 32% 缺失 低至中 作为独立类别处理,不做插补
时间跨度技术漂移 2002–2016 年间扫描技术演进,早期与晚期数据存在系统性差异 低至中 按入组时期分层分析;报告中说明

§7.2 标注质量

I-SPY 的标签质量在临床终点层面很高,在影像标注层面则参差不齐,这种不对称需要在方法学部分交代清楚。pCR 作为金标准由各中心病理科在手术标本上判读,具有明确的临床定义(乳腺与腋窝淋巴结均无浸润性癌残留),且有长期生存相关性作为临床效度支撑;HR 与 HER2 状态来自标准免疫组化与原位杂交流程,一致性有行业标准约束;MammaPrint 是集中实验室的标准化检测,一致性最高。

影像标注则不统一。ISPY2 与 ACRIN-6698 的 FTV 掩膜由算法生成并含人工干预环节(手动定义矩形感兴趣体积与排除区域),属于半自动派生而非独立专家标注。ISPY1 集合本身不含专家肿瘤分割,其扩展集补充的 163 例专家勾画是目前该系列中唯一的高质量人工影像标注,且研究者指出 STV 特征在预后性能上优于 FTV 值(https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf)。MAMA-MIA 则代表了当前最佳实践:16 位放射科医师对 1,506 例统一勾画(https://arxiv.org/html/2608.29162v1)。

§7.3 泛化性分析

场景 失效风险 证据
跨大洲部署(美国训练、欧洲测试) 高 MAMA-MIA 用美国 25 家中心数据训练、欧洲三中心 574 例测试,结果显示共同评测框架下存在显著性能波动(https://arxiv.org/html/2603.01250v2)
跨机构部署(不同扫描仪厂商) 中至高 ISPY2 集合包含多厂商设备,厂商私有属性在部分研究中缺失,无法做厂商特定校正
从临床试验人群到社区诊疗人群 高 试验入组标准富集侵袭性肿瘤(≥2.5 cm、高复发风险),试验情境与社区实践存在差异
从大肿瘤到小肿瘤 高 训练数据全部为 ≥2.5 cm 肿瘤,对小病灶的检测与分割能力未经验证
仅基线影像预测 pCR 高(任务本身困难) MAMA-MIA 结论:仅用基线 DCE-MRI 预测 pCR 仍然受限,所有团队预测性能偏低,最佳平衡准确率 0.541(https://arxiv.org/html/2608.29162v1)
不同亚型间迁移 中 亚型分布严重不均,HR 阳性/HER2 阴性占比最高但 pCR 率最低,模型可能偏向多数类
不同绝经状态与乳腺密度 中 背景实质强化与绝经状态强相关;MAMA-MIA 把乳腺密度纳入公平性维度正是基于这一差异

§7.4 伦理与合规

I-SPY 数据的伦理基础是原始临床试验的知情同意与机构审查委员会批准。所有公开的 DICOM 客体在提交归档前均已完成去标识化:患者标识符被替换为 I-SPY 2 试验分配的 6 位数字,影像中心被编码为 SITE AAA 形式的三字母代码,符合 HIPAA 要求的私有属性在允许范围内保留(https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf)。部分研究在提交至分析与归档中心之前已经过匿名化,因此某些厂商私有属性不保证存在。官方文档还提供了 PHI 上报渠道,若发现任何不符合 HIPAA 要求的信息应通知 UCSF 乳腺影像研究项目核心实验室。

使用该数据有三条合规底线。第一,CC BY 4.0 许可允许商业使用,但强制要求署名并引用原始数据集 DOI。第二,TCIA 要求数据引用,使用者必须遵守其数据使用政策。第三,尽管数据已去标识化,任何试图重新识别个体的行为都是禁止的——三字母站点代码与患者号构成的组合在小样本机构中仍可能具有指向性。在临床伦理层面还需注意:该数据集训练出的模型若用于临床,其目标人群是临床试验入组的高危患者,直接应用于社区筛查或常规诊疗场景缺乏依据;不同国家对 AI 医疗软件审批路径的差异,也必须在部署前评估。

§7.5 公平性

公平性分析在 I-SPY 上有明确的实践基础,因为 MAMA-MIA 挑战已经把公平性纳入评分框架,其指标基于年龄、绝经状态与乳腺密度三个维度衡量性能差异,并把公平性与任务准确率等权重地合成综合得分(https://arxiv.org/html/2603.01250v2)。

已知的不均衡点包括三方面。其一,种族构成偏斜:ISPY2 中白人占 79.3%,黑人占 12.5%,亚裔占 6.4%,美洲原住民与太平洋岛民各占 0.4%,超过一个种族标识的占 0.6%(https://www.cancerimagingarchive.net/?p=42613)。ISPY1 的黑人占比更高(18.9%),这为跨集合的种族亚组分析提供了可能,但两个集合的方案与年代不同,不能直接合并比较。其二,欧洲与非美国人群完全缺失。其三,西班牙裔信息在 ISPY1 中未提供、在 ACRIN-6698 中有 32% 缺失,使族裔维度的公平性评估在这些集合上难以开展。

实践建议:报告中至少给出按 HR/HER2 亚型、年龄组与中心代码分层的性能表,并明确说明哪些亚组样本量不足以支撑统计推断。团队 FME 报告的均衡几率差 0.212 可作为横向比较参考,但该值来自其特定模型与外部测试集,不是数据集本身的固有属性。

§7.6 数据漂移

I-SPY 存在三种可观测的漂移。第一是采集技术漂移:2002 年至 2016 年间 MRI 硬件与序列参数持续演进,ISPY1 采用 1.5T 单体位矢状面采集且 T1 序列仅 4.5 至 5 分钟,ISPY2 则要求 1.5T 或 3.0T、注射后连续采集至少 8 分钟(https://www.cancerimagingarchive.net/?p=42613)。第二是治疗方案漂移:I-SPY 1 使用 AC 方案序贯紫杉,I-SPY 2 使用每周紫杉醇 ± 实验药后统一 4 周期 AC。第三是人群构成漂移:自适应随机化使不同时期入组患者的亚型分布与治疗分配发生变化。对使用该数据训练模型的团队,漂移意味着:若模型在早期数据上训练、用于晚期数据,性能可能下降;若在 ISPY2 上训练、用于 ISPY1 数据,方案差异会被误读为疗效信号差异。缓解方式是做时间分层敏感性分析与跨集合验证,并在模型卡中记录训练数据的入组时间范围。

§7.7 DAIMS 24 项数据质量评估

DAIMS(Data Analysis and Information Management Standard)24 项检查覆盖数据结构、标签、偏倚、治理与工程实践五个维度。以下逐项评估。

# 检查项 状态 说明
1 宽格式(Wide format) ✅ 临床表一行一患者,字段横向展开,符合宽格式规范;影像为独立文件不适用
2 唯一标识(Unique identifier) ✅ 患者以 6 位试验号唯一标识,序列以 SeriesInstanceUID 唯一标识;跨集合连接需用试验号
3 特殊字符(Special characters) ⚠️ SeriesDescription 含冒号与斜杠(如 ISPY2: VOLSER: uni-lateral cropped: SER),直接用作文件名会失败
4 重复行(Duplicate rows) ⚠️ 同一患者存在多时间点、多序列记录,按患者聚合时若不显式去重会重复计数
5 缺失编码(Missing codes) ⚠️ 缺失以空白呈现,未见统一哨兵值;Unknown 在种族字段中作为独立类别而非缺失标记
6 标签标识(Label identification) ✅ pCR 为明确的 0/1 二分类;HR 与 HER2 为明确的二分类;MammaPrint 为 High/Ultra High 二档
7 罕见类分组(Rare class grouping) ⚠️ 美洲原住民与太平洋岛民各占 0.4%,超过一个种族标识占 0.6%,直接分层会导致极小样本
8 偏倚评估(Bias assessment) ⚠️ 数据本身不附偏倚文档;选择偏倚与时间-治疗混杂需使用者自行识别(§7.1)
9 数据字典(Data dictionary) ✅ 提供私有标签数据字典(XLSX)与 DWI/DCE 数据描述(PDF),字段定义完整
10 信息性缺失解释(Informative missingness) ⚠️ 官方未逐字段说明缺失机制;DWI 排除 30 例、派生客体缺席等需从文档推断(§4.5)
11 设备记录(Device record) ⚠️ 场强与线圈要求有文档,但厂商私有属性在部分研究中因预先匿名化而缺失
12 共线性(Collinearity) ⚠️ HR、HER2 与 MammaPrint 高度相关(MammaPrint 本身就是多基因综合指标),同时入模需检查 VIF
13 编码映射(Code mapping) ✅ 访视代码 T0/T1/T2/T3 与访视描述有明确定义映射;DICOM 标签 (0012,0050) 与 (0012,0051) 对应
14 时间戳处理(Timestamp handling) ⚠️ 纵向对齐应基于访视代码而非检查日期,因各中心化疗周期起止时间不同
15 划分建议(Split recommendation) ❌ TCIA 原始集合不提供 train/val/test 划分;仅衍生结果集 BreastDCEDL_ISPY2 提供固定划分
16 泄漏讨论(Leakage discussion) ⚠️ 官方未讨论泄漏;同一患者 4 次检查构成主要泄漏源,需使用者自行处理(§5.3)
17 标签分布(Label distribution) ✅ pCR 32.2%、HR 阳性 54.5%、HER2 阳性 24.8% 有公开数字,且与 MAMA-MIA 口径可交叉验证
18 测量偏倚(Measurement bias) ⚠️ 血管内对比剂增强受心输出量、注射速率影响;不同中心 DCE 相位时长在 80–100 秒区间浮动
19 外部验证建议(External validation) ⚠️ 官方未提供外部验证指引;MAMA-MIA 的跨大洲设计可作参照(§5.5)
20 版本记录(Version record) ✅ 各集合有明确更新日期(ISPY1 2016-09-28、ACRIN-6698 2021-12-17、ISPY2 2022-05-02)与 Version 1 标注
21 预处理脚本(Preprocessing scripts) ⚠️ 不提供官方预处理脚本;提供了分析掩膜说明文档与派生对象序列识别表作为替代参照
22 合规要求(Compliance requirements) ✅ CC BY 4.0 许可明确,TCIA 强制数据引用政策公开,去标识化流程有文档说明
23 多模态对齐(Multimodal alignment) ⚠️ 影像与临床表通过试验号对齐;但同一患者多时间点的影像与临床变量(如 pCR 为单次手术结果)的时序对应需自行建模
24 去标识化(De-identification) ✅ 患者号替换为试验分配号、站点编码为三字母代码、符合 HIPAA 的私有属性按规则保留、提供 PHI 上报渠道

DAIMS 评分:17.5 / 24

评分解读:17.5 分对应"结构完好、工程需自理"的档位。满分项集中在数据治理层面(唯一标识、标签标识、数据字典、编码映射、版本记录、合规、去标识化),说明 I-SPY 作为正式临床试验的数据资产在治理与合规上达到了高水平。扣分项集中在机器学习就绪度:无官方划分(第 15 项 ❌)、无预处理脚本(第 21 项 ⚠️)、泄漏未讨论(第 16 项 ⚠️)、缺失机制未逐字段说明(第 10 项 ⚠️)、偏倚评估文档缺位(第 8 项 ⚠️)。另有因试验属性本身扣分的项:厂商私有属性缺失(第 11 项)、亚型变量共线性(第 12 项)、时间戳需用访视代码(第 14 项)、测量偏倚(第 18 项)、多模态时序对齐需自行建模(第 23 项)。

对你意味着什么:拿到数据后第一件事是建立患者级清单并按 Patient ID 做划分,而非直接展开影像文件列表,这能避免 §5.3 与坑点 1 描述的最严重泄漏形式。不要期待开箱即用的划分与脚本——需要固定划分时改用 BreastDCEDL_ISPY2 结果集,坚持用原始集合则必须自行实现划分、序列识别与预处理并写入模型卡。标签可信但影像标注需甄别:pCR、HR、HER2 可直接使用;FTV 与 STV 掩膜必须先明确定义与来源,不要把 FTV 当作完整肿瘤分割真值。亚型变量存在共线性,若同时把 HR、HER2、MammaPrint 与派生的三阴性标识入模需检查方差膨胀因子。厂商私有属性不可依赖,任何需要扫描仪特定参数的分析都要先做可用性普查并准备回退方案。外部验证不是可选项——数据集全部来自美国多中心临床试验,跨机构与跨人群验证应在研究设计阶段就纳入计划。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
欧洲三中心私有测试集(波兰 30、立陶宛 232、西班牙 312 例) MAMA-MIA 挑战,2025-2026 肿瘤分割 Dice 0.713、归一化豪斯多夫距离 0.099、综合公平得分 0.882 分割任务在域偏移下相对稳健 减影图输入配合集成策略可提升跨站稳健性
同上 MAMA-MIA 挑战,2025-2026 pCR 预测 平衡准确率 0.541、均衡几率差 0.212、综合得分 0.664 明显下降,所有团队表现偏低 仅用基线 DCE-MRI 预测 pCR 本质上困难
Duke-Breast-Cancer-MRI 杜克大学(TCIA) 常作 I-SPY 的外部验证集 视具体研究而定 单机构协议一致,域偏移较小 适用于检验设备与流程统一条件下的性能
同机构跨时间验证(早期入组 vs 晚期入组) I-SPY 2 内部 pCR 预测 需自行计算 存在时间漂移风险 自适应随机化使治疗分配与亚型分布随入组时间变化

§8 基准性能与生态

§8.1 排行榜

I-SPY 相关的公开基准中,最具代表性的是 MAMA-MIA 挑战,它把 I-SPY 与其他 TCIA 乳腺集合整合成统一评测框架。下表列出目前有公开记录的评测结果。

排名 模型/方案 性能 年份 关键技术 完整引用 代码
2(分割任务) FME nnU-Net 集成 Dice 0.713、归一化豪斯多夫距离 0.099、综合公平得分 0.882 2026 5 折残差编码器 nnU-Net 集成 + 减影图输入 + 镜像测试时增强 + 最大连通域后处理 Geissler, K., Schäfer, R. (2026). Subtraction-Based Tumor Segmentation and Lesion-Centered pCR Prediction for the MAMA-MIA Challenge. arXiv:2608.29162. https://arxiv.org/html/2608.29162v1 github.com/FraunhoferMEVIS/MAMA-MIA-Challenge-FME
2(pCR 预测任务) FME 3D 视频分类器集成 平衡准确率 0.541、均衡几率差 0.212、综合得分 0.664 2026 25 个预训练 3D 视频分类器集成 + 病灶中心裁剪 + 预对比与两个后对比体数据 Geissler, K., Schäfer, R. (2026). 同上. https://arxiv.org/html/2608.29162v1 github.com/FraunhoferMEVIS/MAMA-MIA-Challenge-FME
参考(I-SPY 2 多特征 MRI) 逻辑回归多特征模型 联合特征 AUC 高于任何单一特征 2020 功能肿瘤体积 + 最长径 + 球形度 + 对侧背景实质强化,按 HR/HER2 分层 Li, W., Newitt, D. C., Gibbs, J., et al. (2020). Predicting breast cancer response to neoadjuvant treatment using multi-feature MRI: results from the I-SPY 2 TRIAL. npj Breast Cancer, 6(1), 63. https://doi.org/10.1038/s41523-020-00203-7 见 TCIA 集合页 384 例子集特征表
参考(BreastDCEDL ViT) ViT(RGB 融合三相位) HR+/HER2− 患者 pCR 预测 AUC 0.94、准确率 0.93 2025 Vision Transformer 编码预对比、早期后对比与晚期后对比三相位融合图 Fridman, N., Solway, B., Fridman, T., Barnea, I., Goldstein, A. (2025). BreastDCEDL: A comprehensive breast cancer DCE-MRI dataset and transformer implementation for treatment response prediction. arXiv:2506.12190. https://arxiv.org/abs/2506.12190 github.com/naomifridman/BreastDCEDL
参考(ISPY1 FTV 预测 RFS) 功能肿瘤体积单变量分析 FTV 变化预测无复发生存,达到统计学显著 2016 在治疗早期按信号增强比阈值计算功能肿瘤体积变化 Hylton, N. M., Gatsonis, C. A., Rosen, M. A., et al. (2016). Neoadjuvant Chemotherapy for Breast Cancer: Functional Tumor Volume by MR Imaging Predicts Recurrence-free Survival—Results from the ACRIN 6657/CALGB 150007 I-SPY 1 TRIAL. Radiology, 279(1), 44-55. https://doi.org/10.1148/radiol.2015150013 无

数值不可直接比较的原因:上表结果的评测条件差异很大,不能横向排名。其一,MAMA-MIA 的两项结果在私有外部测试集上评测,而 BreastDCEDL 的 AUC 0.94 在其自身固定划分上评测,两者不构成同台比较。其二,BreastDCEDL 的数字限定在 HR 阳性/HER2 阴性亚组,而 MAMA-MIA 的 pCR 指标是跨亚组汇总的,亚组限定会显著抬高数值。其三,ISPY1 的 FTV 结果是单变量生存分析而非分类预测,评估范式不同。其四,评测人群的 pCR 阳性率不同(约 28% 至 32%),各指标对类别比例的敏感度不同。其五,各研究使用的影像输入(仅基线 vs 多时间点、是否含减影图)与预训练策略不同。因此上表只应作为方法学参考,不构成排行榜意义上的名次。

§8.2 SOTA 总结与选型建议

从现有公开结果可提炼四条对选型有直接指导意义的结论。

分割任务已有相对可靠的技术路线。 减影图(第一后对比减预对比)作为输入、nnU-Net 类自配置架构、多折集成、测试时增强、连通域后处理,这套组合在外部测试集上取得 Dice 0.713 并排名第二。这说明该任务在跨站域偏移下可以做到稳健,工程重点在于输入构造与集成策略而非架构创新。对大多数团队,nnU-Net 基线已足够,改进空间主要在预处理与后处理。

pCR 预测是一个尚未被攻克的难题。 MAMA-MIA 挑战中所有团队表现都偏低,最佳方案的平衡准确率仅 0.541,处于随机水平与临床可用的模糊地带。参赛团队明确指出:仅从基线 DCE-MRI 预测 pCR 仍然受限。任何声称在该数据上取得极高 pCR 预测性能的报告,都需审视其评估设计(是否存在 §5.3 的泄漏、是否在亚组上评估、是否与训练集重叠)。

多特征联合优于单特征,是一条稳定成立的结论。 384 例子集的研究显示,功能肿瘤体积、最长径、球形度与对侧背景实质强化四项特征联合后的 AUC 高于任何单一特征(https://www.cancerimagingarchive.net/?p=42613)。这条经验在影像组学与深度学习融合的混合模型上同样适用。

亚组限定会系统性抬高数值。 BreastDCEDL 的 ViT 在 HR 阳性/HER2 阴性亚组达到 AUC 0.94,不应解读为在全体 I-SPY 2 患者上的性能。报告中必须明确标注评估的亚组范围。

选型建议:目标是分割则直接用 nnU-Net 配减影输入;目标是 pCR 预测且追求可解释性则用影像组学特征加梯度提升树;追求性能上限且算力充足则用 3D 视频分类器的多模型集成;需跨中心部署则优先考虑域适应方法与风格迁移增强。

§8.3 评测协议

复现或对比 I-SPY 上的结果时,以下协议要素必须明确记录,否则结果之间无法比较。

协议要素 必须记录的内容 常见错误
队列版本 使用 ISPY2 的 719 例子集还是完整 985 例 Cohort 1 未声明,导致与文献样本量不符(坑点 7)
时间点 仅 T0 基线,还是包含 T1/T2/T3 未声明,纵向信息的使用与否影响巨大
输入构造 是否使用减影图、使用哪些相位、是否归一化 未声明,减影输入对分割效果影响显著
划分方式 按患者划分还是按影像划分;是否按中心分组 按影像划分导致泄漏(坑点 1)
评估指标 AUC、平衡准确率、敏感性、特异性等完整报告 仅报告准确率,掩盖类别不平衡问题
亚组范围 全体患者还是特定 HR/HER2 亚组 未声明亚组,数字被误读为全体性能
置信区间 自助法置信区间或交叉验证标准差 仅报告点估计,无法判断差异是否显著
标签口径 pCR 的判定标准与来源 未声明,不同口径的 pCR 率存在差异

建议在报告中给出一个标准化的结果表,按 HR 阳性/HER2 阴性、HER2 阳性、三阴性三个亚组分别列出指标,并附上各亚组的样本量与 pCR 阳性率。这样做不仅提高可比性,也直接满足公平性报告的要求。

数据集 关系 规模 差异
Duke-Breast-Cancer-MRI 同域外部验证集 922 例 单机构、协议一致、含 RFS 结局
Breast-MRI-NACT-Pilot 同域小规模集合 64 例 常作方法验证,规模小
MAMA-MIA DCE-MRI I-SPY1 与 I-SPY2 的再加工统一基准 1,506 例训练 + 574 例外部测试 统一 49 变量与专家勾画,配套公平性框架
BreastDCEDL_ISPY2 I-SPY2 的深度学习就绪版本 982 例 NIfTI 化、固定划分、含 ViT 基准实现
I-SPY1-Tumor-SEG-Radiomics ISPY1 的专家标注扩展 163 例 STV 与 FTV 双套专家分割 + IBSI 标准放射组学特征
原始 I-SPY 2 试验数据(非公开) 影像集合的来源队列 超过影像集合的入组规模 仅部分患者与部分时间点的影像公开发布

§8.5 关键论文

# 完整引用 一句话贡献
1 Hylton, N. M., Blume, J., Gatsonis, C., et al. (2009). MRI tumor volume for predicting response to neoadjuvant chemotherapy in locally advanced breast cancer: Findings from ACRIN 6657/CALGB 150007. Journal of Clinical Oncology, 27(15_suppl), 529. https://doi.org/10.1200/jco.2009.27.15_suppl.529 首次报告 MRI 肿瘤体积可预测新辅助化疗后的病理反应,早期体积变化是最强预测变量
2 Hylton, N. M., Gatsonis, C. A., Rosen, M. A., et al. (2016). Neoadjuvant Chemotherapy for Breast Cancer: Functional Tumor Volume by MR Imaging Predicts Recurrence-free Survival—Results from the ACRIN 6657/CALGB 150007 I-SPY 1 TRIAL. Radiology, 279(1), 44-55. https://doi.org/10.1148/radiol.2015150013 确立功能肿瘤体积与无复发生存的关联
3 Rugo, H. S., Olopade, O. I., DeMichele, A., et al. (2016). Adaptive Randomization of Veliparib-Carboplatin Treatment in Breast Cancer. New England Journal of Medicine, 375(1), 23-34. https://doi.org/10.1056/NEJMoa1513749 报告首个毕业方案,三阴性 pCR 率 51% 对 26%,III 期预测成功概率 88%
4 Park, J. W., Liu, M. C., Yee, D., et al. (2016). Adaptive Randomization of Neratinib in Early Breast Cancer. New England Journal of Medicine, 375(1), 11-22. https://doi.org/10.1056/NEJMoa1513750 报告 neratinib 在 HER2 阳性/激素受体阴性亚型毕业,pCR 率 56% 对 33%
5 Li, W., Newitt, D. C., Gibbs, J., et al. (2020). Predicting breast cancer response to neoadjuvant treatment using multi-feature MRI: results from the I-SPY 2 TRIAL. npj Breast Cancer, 6(1), 63. https://doi.org/10.1038/s41523-020-00203-7 证明四项 MRI 特征联合优于任何单一特征
6 Newitt, D. C., Partridge, S. C., Zhang, Z., et al. (2021). ACRIN 6698/I-SPY2 Breast DWI [Data set]. The Cancer Imaging Archive. https://doi.org/10.7937/TCIA.KK02-6D95 ACRIN 6698 DWI 子研究数据集的正式引用条目
7 Li, W., Newitt, D. C., Gibbs, J., et al. (2022). I-SPY 2 Breast Dynamic Contrast Enhanced MRI Trial (ISPY2) (Version 1) [Data set]. The Cancer Imaging Archive. https://doi.org/10.7937/TCIA.D8Z0-9T85 ISPY2 影像集合的正式引用条目,本条目主要 DOI
8 Partridge, S. C., Zhang, Z., Newitt, D. C., et al. (2018). Diffusion-weighted MRI Findings Predict Pathologic Response in Neoadjuvant Treatment of Breast Cancer: The ACRIN 6698 Multicenter Trial. Radiology, 289(3), 618-627. https://doi.org/10.1148/radiol.2018180273 多中心验证 DWI 指标预测病理反应的有效性
9 Newitt, D. C., Zhang, Z., Gibbs, J. E., et al. (2018). Test–retest repeatability and reproducibility of ADC measures by breast DWI: Results from the ACRIN 6698 trial. Journal of Magnetic Resonance Imaging, 49(6), 1617-1628. https://doi.org/10.1002/jmri.26539 报告 ADC 测量的重复性,为评估指标可靠性提供依据
10 Garrucho, L., et al. (2024). MAMA-MIA: A Large-Scale Multi-Center Breast Cancer DCE-MRI Benchmark Dataset with Expert Segmentations. arXiv preprint. https://arxiv.org/html/2603.01250v2 整合四个 TCIA 集合,形成统一乳腺 DCE-MRI 基准

§8.6 社区活跃度

I-SPY 的社区活跃度体现在三个层面。第一是持续的试验运营:I-SPY 2 于 2010 年春启动并持续进行,由 Quantum Leap Healthcare Collaborative 提供管理支持,并在不断增加的临床研究点招募患者(https://www.cancerimagingarchive.net/?p=42613)。第二是影像工作组的成立:I-SPY 2 影像生物标志物工作组为影像科学家与放射科医师提供交流平台,围绕 TCIA 上公开的 I-SPY 2 MRI 数据开展协作,通过报名渠道加入双月视频会议。第三是基准竞赛的推动:MAMA-MIA 挑战吸引 26 支国际团队参与最终评测(https://huggingface.co/papers?q=treatment response prediction),并在 MICCAI 2025 框架下运行,带动了围绕该系列数据的可复现研究。在文献层面,TCIA 为每个集合维护使用该数据集的出版物列表并持续更新,ISPY1 集合页显示 35 次引用、ISPY2 集合页显示 15 次引用、ACRIN-6698 集合页显示 18 次引用(TCIA 页面计数,截至 2026-09);这些数字仅统计数据集引用而非论文引用。

§8.7 生态快照

资源 类型 链接 Star/热度(截至 2026-09) 推荐理由
TCIA ISPY2 集合页 官方数据门户 https://www.cancerimagingarchive.net/collection/ispy2/ 11.6k 次浏览(TCIA 计数) 主入口,含数据访问表与完整文档
TCIA ISPY1 集合页 官方数据门户 https://www.cancerimagingarchive.net/collection/ispy1/ 7.8k 次浏览 I-SPY 1 影像与扩展标注的入口
TCIA ACRIN-6698 集合页 官方数据门户 https://www.cancerimagingarchive.net/collection/acrin-6698/ 6.1k 次浏览 唯一的乳腺 DWI 集合,含 test-retest 亚组
BreastDCEDL GitHub 开源实现 https://github.com/naomifridman/BreastDCEDL 活跃维护 提供 NIfTI 化流程、DICOM 元数据解析与 ViT 基准实现
MAMA-MIA 挑战平台 基准竞赛 https://www.codabench.org/competitions/7425/ 26 支团队参与最终评测 带公平性评分的标准化评测框架
FME 挑战方案代码 参考实现 https://github.com/FraunhoferMEVIS/MAMA-MIA-Challenge-FME 公开仓库 分割与 pCR 预测两项任务排名第二的完整方案
NCI Imaging Data Commons 云访问入口 见 TCIA 集合页外链 — 提供云端对象存储访问,适合大规模并行处理
ClinicalTrials.gov I-SPY 2 记录 试验注册 https://clinicaltrials.gov/study/NCT01042379 — 方案细节、资格标准与试验臂结构的权威来源

§9 相关资源与引用

§9.1 官方文档与资源

资源名称 类型 用途
TCIA ISPY2 集合页 数据门户 下载 ISPY2 集合、985 例临床表与放射组学特征表;获取派生对象序列识别表
TCIA ISPY1 集合页 数据门户 下载 I-SPY 1 影像与 847 个 MR 研究;获取扩展集标注说明
TCIA ACRIN-6698 集合页 数据门户 下载 DWI 子研究数据;获取主要分析子集与 test-retest 集合
ACRIN-6698-ISPY2 DWI 与 DCE MRI 数据描述 PDF 文档 DICOM 标签定义、私有属性、访视代码映射的权威说明
ACRIN 6698 ISPY2 共享私有标签数据字典 XLSX 文档 派生对象中私有属性的字段定义
Analysis mask files description DOCX 文档 FTV 掩膜位编码分割的处理步骤说明
ISPY2-Imaging-Cohort-1-Clinical-Data XLSX 数据表 985 例人口学、分子检测、随访与治疗信息
Multi-feature MRI NACT Data XLSX 数据表 384 例子集的功能肿瘤体积、最长径、球形度与对侧背景实质强化
ClinicalTrials.gov NCT01042379 试验注册记录 I-SPY 2 方案、资格标准与试验臂结构
ClinicalTrials.gov NCT01564368 试验注册记录 ACRIN 6698 DWI 子研究方案

访问上述资源前需注意两点。第一,影像下载需要 TCIA Data Retriever 客户端,且完整 Cohort 1 必须通过官方 manifest 文件获取(见坑点 7)。第二,TCIA 要求数据引用,使用前应阅读并遵守其数据使用政策。

§9.2 社区与代码资源

资源 类型 说明
BreastDCEDL GitHub 仓库 代码与元数据 I-SPY1、I-SPY2 与 Duke 的 NIfTI 化流程,含 DICOM 元数据解析脚本与 ViT 实现
MAMA-MIA 挑战 CodaBench 平台 基准评测 标准化评测协议与公平性评分框架
FME MAMA-MIA 方案仓库 参考实现 分割任务 nnU-Net 集成与 pCR 预测 3D 分类器集成的完整代码
NCI Imaging Data Commons 云数据访问 基于云对象存储的 I-SPY 影像访问方式
I-SPY 2 影像生物标志物工作组 社区组织 双月视频会议,围绕 TCIA 公开数据开展影像分析方法讨论
SimpleITK / pydicom Python 库 DICOM 读取、重采样与图像处理的工程基础

§9.3 BibTeX 引用

以下是本条目涉及的三个主要数据集的正式引用条目,以及核心方法论文献。

@dataset{li2022ispy2,
  author    = {Li, Wen and Newitt, David C. and Gibbs, Jessica and Wilmes, Lisa J. and Jones, Ella F. and Arasu, Vignesh A. and Strand, Fredrik and others},
  title     = {I-SPY 2 Breast Dynamic Contrast Enhanced MRI Trial (ISPY2) (Version 1)},
  year      = {2022},
  publisher = {The Cancer Imaging Archive},
  doi       = {10.7937/TCIA.D8Z0-9T85},
  url       = {https://doi.org/10.7937/TCIA.D8Z0-9T85}
}

@dataset{newitt2021ispy2_dwi,
  author    = {Newitt, David C. and Partridge, Savannah C. and Zhang, Zheng and Gibbs, Jessica and Chenevert, Thomas and others},
  title     = {ACRIN 6698/I-SPY2 Breast DWI},
  year      = {2021},
  publisher = {The Cancer Imaging Archive},
  doi       = {10.7937/TCIA.KK02-6D95},
  url       = {https://doi.org/10.7937/TCIA.KK02-6D95}
}

@dataset{hylton2016ispy1,
  author    = {Hylton, Nola M. and Gatsonis, Constantine A. and Rosen, Mark A. and Lehman, Constance D. and Newitt, David C. and others},
  title     = {ISPY1: Multi-center breast DCE-MRI data and segmentations from
               patients in the I-SPY 1/ACRIN 6657 trials (Version 1)},
  year      = {2016},
  publisher = {The Cancer Imaging Archive},
  doi       = {10.7937/K9/TCIA.2016.HdHpgJLK},
  url       = {https://doi.org/10.7937/K9/TCIA.2016.HdHpgJLK}
}

@article{hylton2016ftv,
  author  = {Hylton, Nola M. and Gatsonis, Constantine A. and Rosen, Mark A. and Lehman, Constance D. and others},
  title   = {Neoadjuvant Chemotherapy for Breast Cancer: Functional Tumor Volume
             by MR Imaging Predicts Recurrence-free Survival---Results from the
             ACRIN 6657/CALGB 150007 I-SPY 1 TRIAL},
  journal = {Radiology},
  volume  = {279}, number = {1}, pages = {44--55}, year = {2016},
  doi     = {10.1148/radiol.2015150013}
}

@article{rugo2016veliparib,
  author  = {Rugo, Hope S. and Olopade, Olufunmilayo I. and DeMichele, Angela and Yau, Christina and van 't Veer, Laura J. and others},
  title   = {Adaptive Randomization of Veliparib-Carboplatin Treatment in Breast Cancer},
  journal = {New England Journal of Medicine},
  volume  = {375}, number = {1}, pages = {23--34}, year = {2016},
  doi     = {10.1056/NEJMoa1513749}
}

@article{park2016neratinib,
  author  = {Park, John W. and Liu, Minetta C. and Yee, Douglas and Ellis, Matthew J. and van 't Veer, Laura J. and others},
  title   = {Adaptive Randomization of Neratinib in Early Breast Cancer},
  journal = {New England Journal of Medicine},
  volume  = {375}, number = {1}, pages = {11--22}, year = {2016},
  doi     = {10.1056/NEJMoa1513750}
}

@article{li2020multifeature,
  author  = {Li, Wen and Newitt, David C. and Gibbs, Jessica and Wilmes, Lisa J. and Jones, Ella F. and others},
  title   = {Predicting breast cancer response to neoadjuvant treatment using
             multi-feature MRI: results from the I-SPY 2 TRIAL},
  journal = {npj Breast Cancer},
  volume  = {6}, number = {1}, pages = {63}, year = {2020},
  doi     = {10.1038/s41523-020-00203-7}
}

@article{partridge2018dwi,
  author  = {Partridge, Savannah C. and Zhang, Zheng and Newitt, David C. and Gibbs, Jessica E. and Chenevert, Thomas L. and others},
  title   = {Diffusion-weighted MRI Findings Predict Pathologic Response in
             Neoadjuvant Treatment of Breast Cancer: The ACRIN 6698 Multicenter Trial},
  journal = {Radiology},
  volume  = {289}, number = {3}, pages = {618--627}, year = {2018},
  doi     = {10.1148/radiol.2018180273}
}

@article{fridman2025breastdcedl,
  author  = {Fridman, Naomi and Solway, Ben and Fridman, Tomer and Barnea, Ilan and Goldstein, Ariel},
  title   = {BreastDCEDL: A comprehensive breast cancer DCE-MRI dataset and
             transformer implementation for treatment response prediction},
  journal = {arXiv preprint}, year = {2025}, eprint = {2506.12190},
  url     = {https://arxiv.org/abs/2506.12190}
}

@article{garrucho2024mamamia,
  author  = {Garrucho, Lidia and others},
  title   = {MAMA-MIA: A Large-Scale Multi-Center Breast Cancer DCE-MRI Benchmark
             Dataset with Expert Segmentations},
  journal = {arXiv preprint}, year = {2024},
  url     = {https://arxiv.org/html/2603.01250v2}
}

§9.4 引用指南

引用本条目描述的数据集时,请遵守三条规则。第一,必须引用对应集合的原始 DOI:使用 ISPY2 集合引用 10.7937/TCIA.D8Z0-9T85,使用 ACRIN-6698 集合引用 10.7937/TCIA.KK02-6D95,使用 ISPY1 集合引用 10.7937/K9/TCIA.2016.HdHpgJLK;若使用完整 Cohort 1,应同时引用前两个 DOI。第二,若使用衍生数据集,同时引用衍生集与原始集合:使用 BreastDCEDL_ISPY2 时,除引用 10.7937/42WQ-TH78 外,还应引用其来源的原始集合 DOI。第三,在方法部分说明具体使用的版本与子集,至少记录使用 719 例还是 985 例、使用了哪些时间点、是否使用 DWI、下载日期与清单哈希。推荐的数据可用性声明写法:本研究使用了 The Cancer Imaging Archive 发布的 I-SPY 2 乳腺动态对比增强 MRI 数据集(DOI: 10.7937/TCIA.D8Z0-9T85)与 ACRIN 6698/I-SPY2 乳腺 DWI 数据集(DOI: 10.7937/TCIA.KK02-6D95),数据采用 CC BY 4.0 许可。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型/工具 用途 版本说明
大语言模型(文本生成与结构化) 依据公开文献与官方数据集文档起草条目内容,按写作规范组织章节结构 生成内容经人工逐节核对
WebSearch 检索工具 核实规模数字、许可条款、试验设计与基准性能等硬事实 检索时间为 2026-09
Markdown 质量校验脚本 检查行数、必需章节、纯净度、frontmatter 字段与代码围栏配对 本地运行

AI 未参与任何医学判断的独立形成。条目中所有临床概念的定义、试验设计描述与统计数字均来自本页引用的公开来源。

§10.2 AI 参与范围

内容模块 AI 参与程度 人工干预方式
frontmatter 与 JSON-LD 结构化数据 依据数据集档案生成 逐字段核对 DOI、许可名称与日期
§1 概览与战略价值 基于官方文档与论文摘要组织 核对所有规模数字与来源链接
§2 医学背景与编码映射 依据 ICD-11 与 SNOMED CT 公开术语生成 核对编码与术语对应关系
§3 数据集规格 依据 TCIA 集合页参数生成 核对体积、样本数、扫描参数
§4 数据结构与字段字典 依据官方文档中的字段定义生成 核对字段名与 DICOM 标签
§5 划分与泄漏分析 基于数据集结构推导 核对划分建议的可行性
§6 代码与坑点 依据官方文档的已知问题编写 核对坑点在官方文档中的依据
§7 DAIMS 评估 按 24 项框架逐项评估 核对每项状态与说明的对应关系
§8 基准与生态 基于已发表结果整理 核对性能数字与完整引用格式
§9 资源与 BibTeX 依据官方引用条目生成 核对作者列表与 DOI

§10.3 输入来源列表

本条目撰写过程中依据的主要公开来源如下。

  1. TCIA ISPY2 集合页(含派生对象序列识别表、SER 缩放说明、FTV 实现差异说明、数据访问表) — https://www.cancerimagingarchive.net/?p=42613
  2. TCIA ISPY1 集合页(含 ACRIN 6657 协议参数与人口学概览) — https://www.cancerimagingarchive.net/collection/ispy1
  3. TCIA ACRIN-6698 集合页(含 DWI 协议、主要分析队列与 test-retest 亚组说明) — https://www.cancerimagingarchive.net/?p=41253
  4. ISPY2 数据集 DOI 记录(含数据访问版本表与引用条目) — https://doi.org/10.7937/TCIA.D8Z0-9T85
  5. BreastDCEDL_ISPY2 分析结果集 DOI 记录 — https://doi.org/10.7937/42WQ-TH78
  6. ACRIN 6698/I-SPY2 DWI 与 DCE MRI 数据描述文档(含访视代码映射与私有属性说明) — https://www.cancerimagingarchive.net/wp-content/uploads/ACRIN-6698-ISPY2-DWI-and-DCE-MRI-Data-Descriptions_20210520.pdf
  7. NCI Imaging Data Commons ISPY1 集合页(含 847 个 MR studies 与集合 DOI) — https://portal.imaging.datacommons.cancer.gov/collections/ispy1/
  8. BreastDCEDL ISPY2 README(含 982 例亚型分布与 pCR 率) — https://github.com/naomifridman/BreastDCEDL/blob/main/ISPY2/README.md
  9. Rugo 等 2016 年 NEJM 论文(veliparib/carboplatin 自适应随机化) — https://escholarship.org/content/qt1039w857/qt1039w857_noSplash_5b015e978f4d81d9521e12fa86fa4c50.pdf
  10. Park 等 2016 年 NEJM 论文(neratinib 自适应随机化) — https://www.researchgate.net/publication/304993742_Adaptive_Randomization_of_Neratinib_in_Early_Breast_Cancer
  11. ASCO Post 对两个毕业方案的报道(含 85% 毕业门槛与 signature 说明) — https://www.ascopost.com/News/43794
  12. Puma Biotechnology 新闻稿(含 MammaPrint 分层因子与单臂 120 例上限) — https://www.pumabiotechnology.com/news/2016/20160707.html
  13. Hylton 等 2009 年 ASCO 摘要(ACRIN 6657 初步结果) — https://ascopubs.org/doi/10.1200/jco.2009.27.15_suppl.529
  14. I-SPY1-Tumor-SEG-Radiomics 数据描述论文(STV 与 FTV 定义、163 例样本量、IBSI 标准) — https://link.springer.com/content/pdf/10.1038/s41597-022-01555-4.pdf
  15. 同一论文 PMC 版本(含 237 例入组与 222 例公开的样本推导) — https://pmc.ncbi.nlm.nih.gov/articles/PMC9308769/pdf/41597_2022_Article_1555.pdf
  16. MAMA-MIA 挑战论文(含 1,506 例训练、574 例外部测试、16 位放射科医师与公平性框架) — https://arxiv.org/html/2603.01250v2
  17. FME 团队 MAMA-MIA 方案论文(含 Dice 0.713、平衡准确率 0.541、均衡几率差 0.212) — https://arxiv.org/html/2608.29162v1
  18. MAMA-MIA DCE-MRI 数据集综述(含四个来源集合的例数拆分与相位采样差异) — https://www.emergentmind.com/topics/mama-mia-dce-mri-dataset
  19. Hugging Face 论文页对 BreastDCEDL 与 MAMA-MIA 的摘要(含 2,070 例与 26 支团队信息) — https://huggingface.co/papers?q=treatment response prediction
  20. 公开乳腺数据集汇总仓库(含 ISPY1、ISPY2 的 BibTeX 条目与 4.16 TB 标注) — https://github.com/DH82/Public-Breast-Dataset

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§0 审核声明与免责 千方病案医学编辑部 逐条核对免责文本与审核日期一致性 ✅ 已通过
§1 概览与规模数字 千方病案医学编辑部 对照 TCIA 集合页逐数字核验 ✅ 已验证
§2 医学背景与编码映射 千方病案医学编辑部 核对 ICD-11 与 SNOMED CT 术语对应 ✅ 已验证
§3 数据集规格与设备参数 千方病案医学编辑部 对照官方集合页与数据描述文档核验 ✅ 已验证
§4 字段字典与缺失分析 千方病案医学编辑部 对照官方数据描述文档核验字段与标签 ✅ 已验证
§5 划分策略与泄漏分析 千方病案医学编辑部 核对划分建议与数据集结构的一致性 ✅ 已验证
§6 代码与 8 个坑点 千方病案医学编辑部 核对每个坑点在官方文档或论文中的依据 ✅ 已验证
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部 逐项核对状态判定与说明的对应关系 ✅ 已验证
§8 基准数字与完整引用 千方病案医学编辑部 对照原始论文核验性能数字与 DOI ✅ 已验证
§9 BibTeX 与引用指南 千方病案医学编辑部 核对作者列表、卷期页码与 DOI ✅ 已验证
§10 声明卡与来源列表 千方病案医学编辑部 核对来源数量与链接有效性 ✅ 已通过

§10.5 AI 生成章节标注

本条目全部章节均由 AI 依据公开来源起草,经上述人工校验流程逐模块审核。其中 §2 医学背景、§7 偏倚与伦理部分涉及医学判断,由医学审核者重点复核;§4 字段字典、§6 代码与坑点、§7 DAIMS 评估涉及数据工程判断,由数据工程审核者重点复核。所有引用的规模数字、日期、许可条款与性能指标均经过来源核验,未使用未经检索支持的估计值。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • BACH — 共享标签:医学影像 / 乳腺影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • CAMELYON16-17 — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • nucls — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • tupac16 — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • mitos-atypia-14 — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • herohe — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • metabric — 共享标签:电子健康记录 / 肿瘤学 / 乳腺癌
  • BreakHis — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • BRACS — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌
  • bcss — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 乳腺癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集