信息速览
INFOBOX — crossMoDA 2023 一屏速览
维度 内容 本质 crossMoDA 挑战赛系列第三届(MICCAI 2023 卫星赛):无监督跨模态域适应(UDA)分割基准 任务 唯一任务:hrT2 上 3 类分割——瘤内 VS、瘤外 VS、双侧耳蜗(Koos 分类任务已取消) 数据方向 增强 T1(ceT1,有标注源域)→ 高分辨率 T2(hrT2,无标注目标域),unpaired 不成对 规模 959 扫描 = UK MC-RC 274(145 患者/10 英国站点)+ London SC-GK 309 + Tilburg SC-GK 376 公开口径 训练源 227 + 训练目标 295 + 验证 96 = 618 公开;测试 341 不公开 版本演进 2022 版 755 → 剔伦敦术后 70 例 + 新增 MC-RC 274 → 959;Tilburg 376 例原样保留 标注 MC-RC:Neuromorphometrics 公司初标 → 3 名放射科医生复核 → 专家终审;瘤内外分界:专家神经外科医生(MRtrix3)+ 放射科医生质控(ITK-SNAP) 平台 grand-challenge.org → Synapse(syn51236108),数据托管+打榜一体 许可 CC BY-NC-SA 4.0(训练+验证) 参与漏斗 26 注册 → 13 队(7 国)验证榜 → 6 队(5 国)测试榜 评估 DSC + ASSD × 3 区域,rank score(案例级名次聚合)越低越好;分界面 ASSD 仅参考 冠军 vandy365(Han Liu 等,Vanderbilt + Siemens Healthineers):扩展 3D QS-Attn 条件风格生成 + nnU-Net v2 + 自训练 + 11 模型 ensemble;rank score 2.2 冠军理念 “与其 harmonization 抹掉站点风格,不如把站点风格生成出来” 关键结果 冠军跨届回溯:伦敦测试集 VS DSC 88.61(超 2022 冠军 88.45);耳蜗 DSC 跨届走低(87.11→86.30) 库内互链 crossmoda2022(647) 直系前作、brats(24) 同卷 proceedings、fastmri(23) MRI 数据域对照
crossMoDA 2023 是一个"把真实世界的混乱端上考卷"的挑战赛。
前两届的考题是受控采集的放射外科计划数据——扫描机器固定、协议统一、分辨率整齐;第三届把英国 10 家医院日常随访拍出来的杂牌 MRI(四家厂商、三种场强、层厚差五倍)混进训练集和测试集,再把肿瘤一刀切成"内听道里"和"内听道外"两个亚区,逼参赛算法在真实临床的噪声里做无监督跨模态域适应(unsupervised cross-modality domain adaptation, UDA)。
临床动机始终如一:随访前庭神经鞘瘤(vestibular schwannoma, VS)本来要打钆造影剂做增强 T1,而高分辨率 T2 更安全、更便宜——如果模型能只看 T2 就完成肿瘤与耳蜗分割,VS 随访就不再需要造影剂。
导语读法三则:
- 只想下数据:直奔 §6——2023 版不在 Zenodo,在 Synapse(syn51236108);别用网上流传的"zenodo.10685265",那是一条无关记录。
- 做域适应研究:直奔 §5——6 队完整排名、rank score 双口径、冠军方案"生成站点风格"的完整拆解、以及耳蜗 DSC 为何跨届走低。
- 关心版本演进:直奔 §2.6——2023 数据不是"2022 加新站",伦敦数据剔除了 70 例术后扫描,同一座城市两届考卷不同。
§0 导读:这个数据集解决什么问题
0.1 一个临床场景:随访为什么不打药
前庭神经鞘瘤是长在内听道(internal auditory canal)里的良性肿瘤,源于前庭神经的施万细胞,终生发病率约千分之一。
它长得慢,多数患者的管理不是开刀而是"看着"——定期 MRI 随访,肿瘤不长大就继续观察,长大了再考虑放射外科(伽马刀)或手术。
问题出在"看着"用的成像序列上:临床惯例是增强 T1(contrast-enhanced T1, ceT1)——钆造影剂把肿瘤染亮,边界一目了然。但钆造影剂有安全隐患(肾功能受损者的肾源性系统纤维化风险、脑内钆沉积的长期争议),且增强扫描比平扫贵约十倍(Connor 2021,回顾论文引用口径)。
对一种需要十年量级随访的良性病,每次随访都打药的累积代价可观。替代方案是高分辨率 T2(high-resolution T2, hrT2):不打药,肿瘤在内听道里表现为占位信号,耳蜗液体呈高信号——序列本身便宜安全,代价是肿瘤与周围组织的对比度远不如增强 T1,分割困难。
crossMoDA 的核心命题由此而来:能不能让模型从"有标注的 ceT1"里学会"在 hrT2 上分割"?
- 训练时:标注长在增强模态上(肿瘤打药后才看得清,标注便宜且准);
- 部署时:模型只看不增强的模态(患者不打药)。
这就是跨模态域适应(cross-modality domain adaptation):训练域与部署域隔着一整个模态的强度分布鸿沟,且两域数据完全不成对(unpaired)——每个 ceT1 患者与每个 hrT2 患者是不同的人。
0.2 为什么耳蜗也在考卷上
分割任务里除了肿瘤还有双侧耳蜗(cochlea),这不是凑数:
- 耳蜗紧贴内听道,是放射外科剂量规划的关键危及器官(organ at risk)——伽马刀打瘤时剂量曲线必须护住耳蜗,否则患者失聪;
- 随访时耳蜗轮廓也是听力保留评估的解剖基准;
- 耳蜗又是典型的"小结构":体积在立方厘米量级,T2 上呈高信号的液体螺旋,边界靠骨性结构反衬。
大结构分割的深度学习方法在小结构上经常失效——耳蜗入卷,把"精细结构分割"的难度也钉进了任务里。
VS 报告指南(Kanzaki 等)进一步要求把肿瘤分成内听道内的瘤内部分(intra-meatal)与内听道外的瘤外部分(extra-meatal)分别报告,因为瘤外最大径与体积是评估肿瘤生长最敏感的影像组学指标——2023 届把这个报告规范升级成了考题本身。
0.3 三届演化:一条刻意加难的曲线
crossMoDA 系列由 King’s College London(KCL)牵头创办于 2021 年,与 MICCAI 会议的 BrainLes workshop 绑定。三届的演化路径清晰可读:
- 2021 届:单中心(伦敦 Queen Square 放射外科中心),379 例受控采集,2 类分割(肿瘤+耳蜗),grand-challenge.org 平台。确立了"翻译+分割"两段式与 rank score 排名两大方法论模板。
- 2022 届:加入荷兰蒂尔堡 Elisabeth-TweeSteden 医院(ETZ)数据,总量 755 例,追加 Koos 分级分类任务(仅 3 队参赛)。
- 2023 届(本条目):加入英国多中心常规临床(multi-centre routine clinical, MC-RC)10 站点的常规随访数据——没有预设扫描协议,四家厂商、1.0T/1.5T/3.0T 混装,层厚从 1 mm 到 5 mm 不等;肿瘤升级为瘤内/瘤外 3 类分割;Koos 分类取消;平台迁至 Synapse。总量 959 扫描。
回顾论文(Wijethilake 等,Medical Image Analysis 2026)把这条曲线概括为"从一对一域偏移到一对多域偏移":
- 2021/2022 的域偏移是模态间的(ceT1 vs hrT2),但数据本身是受控采集的"干净"偏移;
- 2023 又叠加了站点间的协议偏移——同一模态内部也有十个站点的风格差异。
这是对"算法能否在真实临床工作"的正面回答:真实医院的 MRI 就是四厂商三场强的拼盘,考卷长得像战场,才算考到了真本事。
0.4 一份意外的结论:混乱是疫苗
三届数据的 retrospective 分析给出一个违反直觉的结果:数据越异质,灾难性失败(离群预测)越少。
数字对照:2023 届冠军(在异质数据上训练)放到 2021、2022 的"旧考卷"上,成绩不但不降反而超过当年冠军——
- 伦敦 2021 测试集:VS DSC 88.61 vs 2022 冠军的 88.45;
- 伦敦+蒂尔堡 2022 测试集:88.00 vs 2022 冠军的 86.07。
异质性不是要清洗掉的噪声,而是提升泛化的疫苗——2023 冠军方案的核心理念正是主动"生成"站点风格而非"抹平"站点风格。
代价同样真实:耳蜗 DSC 跨届走低(87.11→86.30),任务从 2 类升 3 类后,最小的结构最先失分。
0.5 对数据集使用者的三层价值
- 任务本身:618 例公开扫描(227 带标注 ceT1 + 295 无标注 hrT2 + 96 验证 hrT2)是当前最大的多中心跨模态 UDA 分割基准之一,测试集 341 例永久私有保证了基准的防污染性。
- 数据形态:MC-RC 子集带来真实临床的协议混乱——文件名内嵌站点前缀(etz/ldn/ukm)、多场强多厂商、纵向随访时间轴——是测试模型鲁棒性、风格不变性、纵向一致性的天然考场。
- 方法论:冠军方案"生成式风格覆盖"(不是 harmonization 而是生成)与组织方的 rank score 聚合、防作弊设计、平台迁移决策,都是可以整体搬走的工程模板。
0.6 本条目的写作立场
两点声明。
其一,本条目一切数字以回顾论文(arXiv:2506.12006v4 / MedIA 114:104282)为最高口径,官网与第三方资料为辅证;正文与表格打架处(如 rank score 2.3 vs 2.2)一律以表格为准并存照(§10 坑 3)。
其二,网络检索 crossMoDA 2023 时最常见的三个讹传——“数据在 Zenodo(DOI 10685265)”、“Task 1/Task 2 两个任务”、“方向是 T1→增强 T1”——分别错在渠道、任务结构与方向,本条目在 §10 避坑清单中逐一拆解,读者带着这三个警惕去用任何二手资料都不容易被带偏。
0.7 术语表(首现对照)
| 术语 | 英文 | 含义 |
|---|---|---|
| 前庭神经鞘瘤 | Vestibular Schwannoma (VS) | 内听道良性肿瘤,源于前庭神经施万细胞;本数据集的分割对象之一 |
| 耳蜗 | Cochlea | 听觉器官的耳蜗部分,放射外科危及器官;双侧均需分割 |
| 瘤内区 | Intra-meatal component | 肿瘤位于内听道内的部分 |
| 瘤外区 | Extra-meatal component | 肿瘤位于内听道外(桥小脑角)的部分;最大瘤外径是生长报告指标 |
| 增强 T1 | contrast-enhanced T1 (ceT1) | 打钆造影剂的 T1 加权像;本数据集的源域(有标注) |
| 高分辨率 T2 | high-resolution T2 (hrT2) | 不打药的薄层 T2 加权像;本数据集的目标域(无标注) |
| 跨模态域适应 | cross-modality domain adaptation | 从 A 模态(有标注)迁移到 B 模态(无标注)的域适应 |
| 无监督域适应 | unsupervised domain adaptation (UDA) | 目标域无任何标注的域适应设定 |
| 域偏移 | domain shift | 训练数据与部署数据分布不一致的现象 |
| 风格 | style | 图像中非解剖的外观属性(强度分布、对比度、噪声纹理),由设备与协议决定 |
| 图像翻译 | image-to-image translation | 非配对图像间的模态/风格转换(CycleGAN/CUT/QS-Attn 等) |
| 自训练 | self-training | 用模型在无标注数据上的伪标签再训练自身的半自动策略 |
| 伪标签 | pseudo-label | 模型对无标注样本的预测,当作训练标签使用 |
| Koos 分级 | Koos grade | 按肿瘤压迫范围的 1-4 级分级(2022 届任务,2023 取消) |
| rank score | rank score | 案例级名次聚合后的综合排名分(越低越好) |
| MC-RC | multi-centre routine clinical | 多中心常规临床(随访)数据;2023 新增的异质子集 |
| 放射外科 | radiosurgery | 伽马刀等大剂量单次放疗;VS 主要治疗手段之一 |
| 危及器官 | organ at risk | 放疗剂量规划中必须保护的结构(此处指耳蜗) |
§1 数据集速览:十问十答
一问:crossMoDA 2023 是什么?
MICCAI 2023 卫星挑战赛(系列第三届)及其配套数据集。
- 任务:给定带标注的 ceT1(源域,227 例)与无标注的 hrT2(目标域,295 例训练+96 例验证),在 hrT2 上完成瘤内 VS、瘤外 VS、双侧耳蜗的三类分割;
- 约束:不得使用目标域人工标注、不得引入任何外部数据(含 TCIA 数据与预训练模型);
- 节点:2023-10-08(MICCAI 2023 温哥华会议期间)宣布获奖,方法短文收入 Springer LNCS 14669。
二问:数据规模多大?
共 959 扫描,四象限:
- 训练源(ceT1 带标注):227;
- 训练目标(hrT2 无标注):295;
- 验证目标(hrT2 无标注):96;
- 测试目标(hrT2,不公开):341。
三个来源:UK MC-RC 274 扫描(145 位患者、英国 10 站常规随访数据)、London SC-GK 309(放射外科计划数据,已剔术后 70 例)、Tilburg SC-GK 376(原样保留自 2022 届)。公开可下载上限 618 例。
三问:和 2022 版什么关系?
直系前作(库内条目 crossmoda2022,record_id 647)。
- 数据:2023 = 2022 的 755 例 − 伦敦 70 例术后扫描 + MC-RC 274 例新增;
- 任务:2 类升 3 类(瘤内/瘤外细分),Koos 分类取消;
- 平台:grand-challenge.org 迁到 Synapse。
- 注意"同一批伦敦患者"在两届数据中的内容不同(术后例被剔)。
四问:标注谁做的?怎么做的?
统一标注协议下三路人力:
- MC-RC:专业标注公司 Neuromorphometrics 初标 → 三名受训放射科医生复核 → 临床专家组(顾问级神经放射科+神经外科)验证;
- 瘤内/瘤外亚分割:专家神经外科医生用 MRtrix3 完成 → 受训放射科医生用 ITK-SNAP 质控;
- 伦敦/蒂尔堡:延续 TCIA 底座协议(主诊神经外科医生与物理师共识标注)。
- 特别约定:MC-RC 的 ceT1 与 T2 标注独立进行、不跨模态参照。
五问:license 是什么?怎么获取?
- 训练+验证数据:CC BY-NC-SA 4.0(署名-非商业-相同方式共享);
- 测试集:不公开;
- 获取:Synapse(https://www.synapse.org/Synapse:syn51236108),需注册账号;
- 不在 Zenodo——Zenodo 6504722 是 2021/2022 版,网传的"zenodo.10685265"是一条无关记录(§10 坑 1)。
六问:评估指标是什么?
- 指标:DSC(Dice 相似系数)+ ASSD(平均对称表面距离);
- 聚合:对"每测试病例 × 每区域(瘤内/瘤外/耳蜗)× 每指标"分别排名 → 病例内聚合为 cumulative rank → 全病例聚合为 rank score(越低越好);
- 参考指标:瘤内/瘤外分界面 ASSD(不入排名);
- 纪律:验证榜每日限一次提交(防有监督超参选择)。
七问:谁赢了?用了什么方法?
vandy365 队(Han Liu、Yubo Fan、Zhoubing Xu、Benoit M Dawant、Ipek Oguz;Vanderbilt 大学 MedICL-VU 实验室与 Siemens Healthineers 合作)。
- 成绩:rank score 2.2;VS 总 DSC 中位 87.1%、瘤内 74.9%、瘤外 87.3%、耳蜗 84.1%;
- 方法:把 QS-Attn 翻译网络扩展到 3D 并改为站点码条件化的动态生成器——“与其 harmonization 抹掉站点风格,不如把站点风格生成出来”——配合 nnU-Net v2、自训练与 11 模型 ensemble;
- 开放:论文 arXiv:2311.12437,代码全开源(GitHub MedICL-VU/crossmoda2023)。
八问:参与规模如何?
26 队注册、13 队(7 国)上验证榜、6 队(5 国)完赛——较 2022 届(233 注册/12 队完赛)骤降,与平台迁至 Synapse 同期发生;回顾论文未归因(因果存疑,见坑 8)。
完赛六队:vandy365、ccc1018、superpoly、hustcbib、auda、mbzuai。
九问:结果如何引用才不踩坑?
以回顾论文(arXiv:2506.12006 / MedIA 114:104282)Table 5 为准。三个高频讹传:
- rank score 正文写 2.3 而表格写 2.2(以表为准);
- MC-RC 患者数 160(数据论文)vs 165(回顾论文)双口径;
- "Zenodo DOI 10685265"为无关记录。
跨届数字对比时记住 2023 版伦敦数据剔了术后 70 例。
十问:适合谁用?
- 适合:跨模态/多中心域适应、图像翻译、自训练/伪标签、风格不变性研究者;VS 临床自动化(T2-only 随访、耳蜗剂量保护)工程团队;异质数据挑战赛设计者。
- 不适合:需要术后数据或 Koos 标注的(去用 2022 版);需要商业授权的(NC 条款);想拿测试集离线刷榜的(永久私有)。
§2 数据构成与规格
2.1 三队列 959 扫描全景
crossMoDA 2023 的数据总账是理解它的第一步。回顾论文 Table 1 给出了三届数据在三套来源上的完整分布,2023 版的四象限如下:
| 划分 | UK MC-RC(患者数/扫描数) | London SC-GK | Tilburg SC-GK | 合计 |
|---|---|---|---|---|
| 训练源(ceT1,带标注) | 38 / 43 | 79 | 105 | 227 |
| 训练目标(hrT2,无标注) | 47 / 105 | 85 | 105 | 295 |
| 验证目标(hrT2,无标注) | 15 / 32 | 32 | 32 | 96 |
| 测试目标(hrT2,不公开) | 45 / 94 | 113 | 134 | 341 |
| 合计 | 145 / 274 | 309 | 376 | 959 |
单位是扫描(scan)数。MC-RC 一位患者可有最多三次纵向随访扫描,所以它的患者数(145)与扫描数(274)不同——这也是"MC-RC 患者数 160 还是 165"讹传的温床(见坑 4)。
加和自洽校验:列方向 274 + 309 + 376 = 959;行方向 227 + 295 + 96 + 341 = 959。两张账都对得上,Table 1 内部无矛盾。
公开可下载部分为训练源 227 + 训练目标 295 + 验证 96 = 618 扫描;测试 341 例只接受 Docker 容器在组织方集群上的服务器端评估,外部研究者永远拿不到原始数据。
这个"618/959"的双口径是使用任何 crossMoDA 2023 数字前必须建立的第一反应:论文里报的总规模是 959,你实际能做实验的是 618。
另注意 London 的训练源(79)比训练目标(85)少 6 例、Tilburg 两域各 105 例持平。
源域规模小于目标域不是数据缺失,而是协议设计:
- 源域 ceT1 要带标注(标注成本高、且 MC-RC 的 ceT1 只收"耳蜗清晰可见"的扫描);
- 目标域 hrT2 无标注(获取便宜、多多益善)。
源域小而精、目标域大而杂是跨模态 UDA 数据集的典型形态,也是它区别于普通分割数据集的结构特征。
2.2 UK MC-RC:从受控采集到真实临床的一步
2023 届最大的变量是 UK MC-RC(multi-centre routine clinical)子集。
它的底座是 Kujawa 等 2024 年发表并公开的多中心常规临床 VS 数据集(Front. Comput. Neurosci. 18:1365727,CC BY):
- 160 位单侧散发性 VS 患者(回顾论文引用口径为 165——两口径并存,见坑 4);
- 124 个 ceT1w 与 363 个 T2w 扫描(合计 487);
- 每位患者最多三次纵向检查。
crossMoDA 2023 从这个库中取了 145 位患者、274 个扫描进入挑战赛——不是全量,组织方按任务需求(耳蜗可见性、瘤内外可分性、去标识合规)做了筛选。
MC-RC 的"异质性"具体到什么程度?三个维度:
- 设备维度:10 个英国站点,Siemens、Philips、General Electric、Hitachi 四家厂商,磁场强度 1.0T/1.5T/3.0T 三档并存;
- 协议维度:这些扫描是常规随访拍的——没有为科研预设的统一协议,层厚、体素体积、强度分布在站点间自由漂移(第三方转述口径:层厚约 1-5 mm);
- 人群维度:纵向随访意味着同一患者的多次扫描自带疾病进展的时间轴,同一患者前后两次扫描的肿瘤大小可能已经不同。
回顾论文 Fig. 1 用四幅分布图对比三个数据集的强度、体素体积、层数与层厚:London 与 Tilburg 的分布是尖锐的峰(受控采集,所有扫描参数挤在一个小窗口里),MC-RC 是摊开的坡。
这正是 2023 届的命题:域适应方法不能只在"干净的偏移"上有效。2021/2022 的域偏移是模态间的(ceT1 vs hrT2)且数据受控;2023 又叠加了站点间的协议偏移——从"一对一"域偏移升级为"一对多"。
对使用者的实操含义:拿到 MC-RC 子集后第一件事不是跑模型,而是逐例读 NIfTI 头文件——spacing、方向、场强相关的对比度特征都要按扫描核对,任何"批量假设统一 spacing"的预处理都会在 MC-RC 上翻车。文件名前缀(ukm)只告诉你站点族群,不告诉你具体协议。
2.3 五套序列参数全表
| 站点 | 设备 | 序列 | 层内分辨率 | 矩阵 | 层厚 | TR/TE/TI |
|---|---|---|---|---|---|---|
| London SC-GK | Siemens Avanto 1.5T(32 通道,单通道头线圈) | ceT1:MP-RAGE | 0.4×0.4 mm(官网口径) | 512×512 | 1.0-1.5 mm | 1900/2.97/1100 ms |
| London SC-GK | Siemens Avanto 1.5T | hrT2:3D CISS/FIESTA | 0.5×0.5 mm | 384×384 或 448×448 | 1.0-1.5 mm | 9.4/4.23 ms |
| Tilburg SC-GK | Philips Ingenia 1.5T(quadrature 头线圈) | ceT1:3D-FFE | 0.8×0.8 mm | 256×256 | 1.5 mm | 25/1.82 ms |
| Tilburg SC-GK | Philips Ingenia 1.5T | hrT2:3D-TSE | 0.4×0.4 mm | 512×512 | 1.0 mm | 2700/160 ms(ETL 50) |
| UK MC-RC | 四厂商三场强 | 各站常规协议 | 各异 | 各异 | 约 1-5 mm(第三方转述) | 各异 |
三行解读。
第一、二行的伦敦数据是"教科书式"的受控采集:同一台机器、同一套序列、参数窗口极窄——CISS/FIESTA 是内耳成像的经典序列,脑脊液高信号与骨结构低信号的对比是耳蜗可见性的来源。
第三、四行的蒂尔堡数据同为受控采集但厂商不同(Philips vs Siemens),ceT1 层内分辨率(0.8 mm)明显低于伦敦(0.4 mm)——2022 届考题的"多中心"实际上已经是两种风格。
第五行 MC-RC 则把参数空间彻底打开:同一份训练集里可能同时有 1.0T 厚层(5 mm)与 3.0T 薄层(1 mm)的 T2,体素体积可以差一个数量级以上。
伦敦 ceT1 层内分辨率存在 0.4×0.4 mm(官网)与 0.47×0.47 mm(回顾论文 v4)两个口径——前作条目已存照,本条目沿用"官网 0.4 / 论文 0.47"双口径记录法(见坑 7)。
合成与分割实验的重采样目标分辨率若写"0.4×0.4×1 mm³"或"0.41×0.41×1 mm³"(冠军代码库用中位分辨率 0.41×0.41×1 mm³),都属于合理选择,但要在论文里写明口径来源。
2.4 文件结构与命名约定
数据为 NIfTI 格式(nii.gz),文件名内嵌站点前缀,第三方代码库(MedICL-VU/crossmoda2023 与 openmedlab 收录)记录的结构如下:
crossMoDA 2023
├── crossmoda23_training
│ ├── TrainingSource # 带标注 ceT1(源域)
│ │ ├── crossmoda2023_etz_1_ceT1.nii.gz
│ │ ├── crossmoda2023_etz_1_Label.nii.gz
│ │ ├── crossmoda2023_ldn_#_ceT1.nii.gz
│ │ └── crossmoda2023_ukm_#_ceT1.nii.gz
│ └── TrainingTarget # 无标注 hrT2(目标域)
│ ├── crossmoda2023_etz_106_T2.nii.gz
│ ├── crossmoda2023_ldn_80_T2.nii.gz
│ └── crossmoda2023_ukm_44_T2.nii.gz
└── crossmoda23_validation # 无标注 hrT2(验证)
└── crossmoda2023_etz_211_T2.nii.gz
站点前缀三枚:etz(荷兰蒂尔堡 Elisabeth-TweeSteden)、ldn(伦敦)、ukm(UK MC-RC)。
冠军代码库的合成网络正是拿这个前缀当 one-hot site code 的条件输入(001=UKM、010=ETZ、100=LDN)。
挑战赛把"域标签"直接编码进了文件名,参赛者不需要额外的 manifest 表就能按域切分数据——当域信息是公开且重要时,把它放进文件名比放进单独的 CSV 更不易出错。这是挑战赛数据工程的一个实用细节。
需要注意的边界:
- 源域标注文件(
_Label.nii.gz)只存在于 TrainingSource; - 目标域(TrainingTarget、validation)没有任何标签文件——这是任务设计的直接体现,不是文件缺失;
- Synapse 页面因需登录/JS 渲染,文件级大小与 MD5 未直接核验(存照),下载后应以平台清单为准;Synapse 提供 API,脚本化下载与校验可行。
2.5 规模口径速查:959 / 618 / 341 / 145×274 / 160 vs 165
| 口径 | 数字 | 含义与用法 |
|---|---|---|
| 959 | 2023 版全部扫描 | 含不公开测试集;论文与条目主口径;写"数据集规模"用它 |
| 618 | 公开可下载 | 源 227 + 目标 295 + 验证 96;本地实验的真实上限;写"实验用数据"用它 |
| 341 | 私有测试集 | 仅为服务器端排名存在,永远拿不到;写"benchmark 排名"时它是分母 |
| 145 / 274 | MC-RC 患者/扫描 | 一人最多三次纵向随访,两数不要混用;写"MC-RC 患者数"用 145 |
| 160 / 165 | MC-RC 原始库患者数 | Kujawa 2024 摘要 160 vs 回顾论文引用 165,双口径;引用注明出处 |
| 227 / 295 / 96 / 341 | 四象限分项 | 加和 959 自洽;复现参赛配置时按此切分 |
| 618 + 341 | 公开 + 私有 | 任何"959 全用于训练"的表述都是错的 |
2.6 版本演进:2023 不是"2022 加新站"
这是本条目最重要的版本事实,也是跨届对比最容易翻车的地方。逐象限对照 2022 与 2023:
| 划分 | 2022(London/Tilburg/总) | 2023(London/Tilburg/MC-RC/总) | 变化 |
|---|---|---|---|
| 训练源 | 105/105/210 | 79/105/43=227 | 伦敦 −26(剔术后);新增 MC-RC 43 |
| 训练目标 | 105/105/210 | 85/105/105=295 | 伦敦 −20;新增 MC-RC 105 |
| 验证目标 | 32/32/64 | 32/32/32=96 | 伦敦不变;新增 MC-RC 32 |
| 测试目标 | 137/134/271 | 113/134/94=341 | 伦敦 −24;新增 MC-RC 94 |
| 合计 | 379/376/755 | 309/376/274=959 | 伦敦 −70;蒂尔堡原样;新增 274 |
三个事实值得写在墙上。
第一,伦敦数据被动了手术:共剔除 70 例术后扫描(26 源 + 20 目标 + 24 测试)。
原因:手术会破坏瘤内/瘤外的解剖区分——术后术腔的瘢痕组织会模糊内听道壁,Kanzaki 分界失去解剖依据。回顾论文 §2.2.1 原文:“for the 2023 challenge, we excluded the postoperative scans, as surgical procedures could affect the anatomical distinction between intra- and extra-meatal regions.”
所以同一座城市、同一批患者的两届数据内容不同,跨届指标对比(如 §5.6 的冠军回溯)已经是"新考卷对旧考卷"。
第二,蒂尔堡原样保留(105/105/32/134 完全不动),反证其数据不含术后扫描或未做剔除——前作条目的"待核:蒂尔堡是否含术后"由此部分收束:若蒂尔堡含术后而 2023 未剔,瘤内外分界在那里就会出问题;组织者动了伦敦没动蒂尔堡,最经济的解释是蒂尔堡本就全术前。这是从数据演化的"对照组"读出的推论,标注为推断而非实锤。
第三,MC-RC 同时进入源域与目标域:43 例 ceT1 进训练源(带标注),105 例 T2 进训练目标、32 例进验证、94 例进测试(均无标注)。MC-RC 的标注质量与协议混乱同时出现在两个域里——它不是"只当考题"的点缀,而是实打实的训练素材。
顺带校正一个官网遗留矛盾:crossmoda-challenge.ml 的 Task 段至今写着训练集"含术前与术后两个时点"(from both pre-operative and post-operative time points)——这是 2022 版的遗留文字;回顾论文 §2.2.1 明确 2023 版剔除了术后扫描。以论文为准(见坑 6)。
第三方资料同样有版本混写:openmedlab 收录页把 2021/2022 的"N=105/N=105/testing 137"口径与 2023 版混写在同一页——引用第三方资料先看时间戳。
2.7 已知质量问题汇总(使用前检查单)
- MC-RC 的 ceT1 耳蜗标注精度有限:论文自曝"由于 ceT1 上耳蜗可见性有限,可能存在轻微标注误差"——源域标签在耳蜗类别上的噪声是内置的;用源域标签评估耳蜗分割精度时记住分母本身有噪声。
- MC-RC 协议异质性:层厚跨约 1-5 mm(第三方转述口径)、四厂商三场强,做体素级操作(重采样/裁剪)前必须按扫描逐例读头文件。
- 训练源与目标完全不成对:源域 227 例 ceT1 与目标域 295 例 hrT2 是不同患者,任何"配对假设"的预处理(如逐例强度直方图匹配、逐例仿射对齐)都错误。
- 验证集无标注:96 例验证 hrT2 只有图像,标签在组织方手里,只能通过每日一次的 Synapse 打榜获得分数反馈——把验证集当本地测试集用是不可能的。
- 术后扫描已剔除(2023):如需术后数据做研究,只能回用 2022 版(Zenodo 6504722)的伦敦术后 70 例——注意两版文件编号体系不同(2023 版重编)。
- Koos 标注是 2022 遗产:2023 版无 Koos 任务与相应考卷;Koos 分级(London 221 例 + Tilburg 273 例术前)只能从 2022 版获取。
- 未见 GIF 掩码延续:2022 届为训练源提供 GIF 脑区自动分割掩码(191.7 MB zip),2023 届官网与论文均未提及——做脑区先验相关实验要自备。
2.8 纵向随访:MC-RC 的时间轴红利与陷阱
MC-RC 子集有一个前两届完全没有的结构特性:同一患者的多次扫描(最多三次)。
机会有二:
- 纵向一致性评测:考察模型对同一患者不同时点扫描的分割一致性——这是横断面数据集测不了的"随访稳定性",而随访稳定性恰恰是 VS 管理的临床刚需(体积变化是随访的核心读数);
- 生长建模:配对的时点数据支持肿瘤生长速率的影像组学研究(当然受 274 扫描的规模限制)。
陷阱一个:数据泄漏形态升级。做交叉验证时,同一患者的多次扫描必须分在同一折——按扫描随机切分会把"同一患者的相似扫描"分进训练与测试,指标虚高。跨患者切分(patient-wise split)在 MC-RC 子集上不是可选项而是义务。
§3 标注协议:三队列如何统一到一套考卷
3.1 统一协议与三种标注来源
回顾论文 §2.3 开宗明义:“所有影像数据集按同一标注协议人工分割”(All imaging datasets were manually segmented following the same annotation protocol)。
但"同一协议"之下,三套来源的标注人力构成各不相同:
- 伦敦:TCIA 2021 开放数据集的底座协议——主诊神经外科医生(treating neurosurgeon)与物理师(physicist)共识标注,同时参考 ceT1 与 hrT2 两模态;
- 蒂尔堡:延续伦敦式协议的 ETZ 院内标注;
- MC-RC:公司初标 + 双级复核的企业流水线(见 3.2),且 ceT1/T2 独立标注不跨模态参照。
三路人力最终统一到同一套解剖约定(哪些结构算、边界划在哪、囊变算不算),才有跨队列可比性。
对使用者,这意味着标签的系统偏差可能因队列而异——做域泛化研究时,"标注者效应"与"设备效应"是两个都要控制(或至少要意识到)的变量源。
3.2 MC-RC 的企业级标注流水线
MC-RC 整瘤(whole tumour)标注由专业 MRI 标注公司 Neuromorphometrics(美国马萨诸塞州 Somerville)迭代完成。
复核链:临床专家组验证——包括顾问级神经放射科医生与顾问级神经外科医生——并做了观察者间/观察者内一致性分析(inter-/intra-observer reliability)。三级流程完整记录于 Kujawa 2024。
它与另两种范式并列,构成医学标注生产的三种典型模式:
- crossMoDA 伦敦底座的"医生+物理师亲标"(精度最高、成本最高、最难扩量);
- PANDA-PLUS 式"学生标注+专家终审"(可扩量、训练成本内置);
- MC-RC 的"外包公司+复核"(专业产能、质量控制制度化)。
三种模式的共同终点都是临床专家终审——分歧只在劳动密集环节由谁承担。
MC-RC 模式的独特资产是制度化的可靠性实验:观察者间/内一致性数字让下游使用者可以量化"标签噪声的地板",这在挑战赛数据集里是少见的奢侈。
3.3 解剖约定:耳蜗、VS 与瘤内/瘤外分界
- 耳蜗(T2 上标注):统一包含 basal turn(底周,含骨性螺旋板 osseous spiral lamina)与中心低信号的蜗轴(modiolus);双侧耳蜗都要标。耳蜗约定抠得这么细,是因为它是立方厘米级的小结构,DSC 对边界约定极其敏感——蜗轴算不算、底周到哪里,两点差异足以让两支队伍的"耳蜗 DSC"相差两三个点。
- VS(T2 上标注):包含 tumor capping(帽部)与瘤内囊肿(intratumoural cysts);紧邻或陷入瘤体的血管与脑神经不标——囊肿是肿瘤的一部分,血管不是,这条界线写进了协议。
- 瘤内/瘤外分界(split segmentation):按 VS 报告指南(Kanzaki et al.)沿后岩骨壁(posterior petrous wall)划分——内听道内为 intra-meatal,桥小脑角侧为 extra-meatal。临床依据:报告指南要求分开报告瘤内/瘤外部分、以最大瘤外径报告肿瘤大小,且瘤外区的大小/体积特征是评估 VS 生长最敏感的影像组学指标(官网 Task 页原文)。
- MC-RC 的特别约定:训练源的耳蜗与 VS 在 ceT1 和 T2 上独立从头标注、不跨模态参照(unlike in the other dataset annotations)——这是为研究跨模态标注一致性付出的额外成本,代价是论文自曝的 ceT1 耳蜗精度受限;瘤内/瘤外亚分割由一位专家神经外科医生用 MRtrix3 完成、受训放射科医生用 ITK-SNAP 质控。
3.4 Koos 分级:2022 遗产与 2023 的舍
Koos 分级(1-4 级,按肿瘤对脑干、小脑等邻近结构的压迫程度划分)是 2022 届追加的分类任务。
- 标注:两名 5-10 年经验神经外科医生独立评定伦敦 221 例、蒂尔堡 273 例术前数据,分歧由顾问级神经放射科+神经外科仲裁组定案;
- 结果:只有 3 队参赛(SJTU_EIEE_2-426Lab 0.26 / Super Polymerization 0.37 / skjp 0.84,MA-MAE 指标);
- 差距:冠军离人类重测一致性(intra-rater 0.11)仍有明显距离;
- 结构性困难:Koos 1 级样本天然稀少(此类患者少做放射外科),类别不平衡内置。
2023 届组织者做出取舍:与其维持一个三人参赛的任务,不如把全部复杂度预算投给分割——取消 Koos,把肿瘤切成瘤内/瘤外两半。
这个决定的深层逻辑是信息量等价:Koos 分级本质是肿瘤大小与压迫范围的手工概括,瘤内/瘤外亚分割给出的是连续、像素级的同一信息源——分割标签永远可以再聚合成分级,反之不行。
对数据集使用者的操作含义:Koos 标注只能从 2022 版获取;不要在 2023 版考卷上训练分级模型——2023 已剔除术后病例、且 Koos 分级主要对术前病例有意义,数据范围恰好错开。
3.5 去标识、伦理与发布形态
三个数据集全部去标识:图像头文件清除患者信息 + 去脸(defacing)处理。
- 伦敦协议:沿用 Shapey 2021 / Milchenko & Marcus 2013;
- MC-RC 协议:直接开源(github.com/aaronkujawa/defacing_pipeline);
- 发布前:全部数据人工目检。
去脸(把 MRI 中面部特征磨掉)对 VS 分割几乎无损——兴趣区在后颅窝——但对其他脑区分割任务是必须知道的预处理事实:这批数据不能再用于涉及面部结构的任何研究。
伦理批件:NHS Health Research Authority 与研究伦理委员会(18/LO/0532);回顾性研究 + 去标识,豁免知情同意。
发布形态:NIfTI(nii.gz),训练+验证数据 CC BY-NC-SA 4.0,经 Synapse 发放;测试集不发放。
3.6 标注协议对使用者的操作含义
四条落地建议:
- 耳蜗标注约定决定 DSC 的"合法上限"——拿你的模型与文献对比时,先确认对方用的是同一套约定(底周+蜗轴、不含血管神经),否则 84% 与 87% 的差距可能只是蜗轴算不算;
- MC-RC 的"不跨模态参照"标注意味着同一患者的 ceT1 与 T2 标签存在真实的模态间标注差——做标签噪声研究这本身就是素材,做精标对照时要意识到源标签不是"终极真值";
- 瘤内/瘤外分界依赖 Kanzaki 约定(后岩骨壁)——算法如果自己发明分界(如固定坐标切分、按体积二分),会在分界面 ASSD 上暴露;
- 源域标签长在 ceT1 上,任何直接"把 ceT1 标签贴到 T2 上"的配对式做法都违反数据的不成对本质——这正是整个挑战赛存在的理由:标签不能跨模态直搬,只能靠算法搬运。
3.7 三种标注生产模式的库内对照
MC-RC 的"公司初标+复核"流水线放进库内标注范式的光谱里看更清楚:
- 专家亲标型:crossMoDA 伦敦底座(神经外科医生+物理师共识)、acdc 等临床小数据集——精度天花板最高,规模天花板最低;
- 学生/受训研究员型:PANDA-PLUS 的"医学生注释+专家终审"、crossMoDA MC-RC 耳蜗标注(>3 年经验受训研究员)——以培训体系换产能;
- 外包公司型:MC-RC 整瘤(Neuromorphometrics)——工业产能+制度化 QC,成本最高但可审计。
三种模式的选择本质是"标注预算 vs 精度要求 vs 规模目标"的三元权衡。
crossMoDA 系列的有趣之处在于同一数据集内混用了至少两种模式(伦敦亲标+MC-RC 外包)——这对"标注模式差异是否构成额外的域差"是一个天然的实验场:如果模型在 MC-RC 目标域上的误差分布与伦敦目标域系统性不同,标注模式差异就是候选解释之一。
§4 评估方法学:rank score 的三届打磨
4.1 为什么还是 DSC + ASSD
2023 届沿用系列的评估双指标:DSC(Dice Similarity Coefficient,Dice 相似系数)与 ASSD(Average Symmetric Surface Distance,平均对称表面距离)。
官网给出四条选择理由:简单(simplicity)、流行(popularity)、排名稳定(rank stability)、能评估兴趣区的不同侧面(different aspects)。
两个指标互为制衡的机理值得展开:
- 对 VS 这种边界模糊的病变,DSC 高不代表边界准——一个系统性过分割 1 mm 的预测也能刷出高 Dice,而放射外科剂量规划恰恰对边界敏感(剂量跌落区就在毫米尺度)。ASSD 直接度量两个表面之间的平均对称距离,把"边界在哪"这件事单独计分。
- 反过来,对耳蜗这种小结构,1 mm 的边界差在 DSC 上是灾难(小体积对表面误差极敏感),但在 ASSD 上只是一毫米——单独用 ASSD 会让小结构的整体覆盖错误被低估。
一句话:DSC 管"割了多少",ASSD 管"割得多准",缺一不可。
2023 的新意在于评估区域从 2 个变 3 个:瘤内 VS、瘤外 VS、耳蜗各自独立计分,另合成"VS 整体"(瘤内+瘤外合并)指标。
分界面的 ASSD(split boundary ASSD)作为参考指标随成绩单发给参赛队,但不参与排名——回顾论文 Table 6 单列,正文明言 “provided to participants for reference but were not used in the final ranking”。
4.2 rank score:三步聚合,越低越好
排名方案与 2021 届一致、赛前公布(公布于 Grand Challenge 页与 crossMoDA 官网),具体三步:
- 逐项排名:对每个测试病例(341 例)、每个评估区域(2023:瘤内/瘤外/耳蜗)、每个指标(DSC/ASSD),把 6 支队伍的成绩分别排名;并列时取并列值中的最低名次(lowest rank among the tied values)。
- 病例内聚合:对每个病例,把该病例所有"区域×指标"的名次取均值,得到该病例的 cumulative rank(累积名次)。
- 全病例聚合:对每支队伍,把所有病例的 cumulative rank 取均值,得到最终 rank score;越低越好。
这个方案(明言借鉴 BraTS 与 ISLES)的精妙之处在防"平均主义"。
传统做法是对全测试集的 DSC 求均值再排名——一支在 95% 病例上优秀、在 5% 病例上崩盘(比如把肿瘤整个漏掉)的队伍,均值可能依然漂亮。
而 rank score 对"每例每项"都在排名:崩盘病例上你的名次是第 6,这个第 6 无法被其他病例的第 1 抵消,只会被平均进最终 score。灾难性失败由此无法隐藏。
这正是 2023 届考题想要的:MC-RC 的协议混乱最容易在个别刁钻病例(低场强、厚层、术后变异)上触发崩溃,rank score 让"稳"比"尖"更值钱。
回顾论文的离群分析印证了设计意图:数据集越扩、离群(outlier)数量越少;且 2023 冠军在 2021/2022 测试集上 reduced the number of outliers——异质训练削平了灾难尾巴。
4.3 空预测、分界面指标与稳定性检验
三个配套机制。
其一,空预测处理(系列惯例,沿用 2021/2022):全背景预测的 ASSD 记为测试集体素最大距离(350 mm 口径)——空预测不会因"无穷大"炸掉排名,但会被重罚到榜尾。
其二,分界面 ASSD:直接度量"算法理解的瘤内/瘤外分界"与"Kanzaki 约定的分界"的距离,是检查算法是否真正学到解剖约定(而非只学会一团肿瘤)的显微镜。2023 冠军的分界面 ASSD 中位 0.55 mm,第 2-6 名在 0.62-0.82 mm。
其三,排名稳定性:2022 届做了 1,000 次 bootstrap(每次 N=271)的 Kendall τ 检验,2023 届沿用同一分析框架(回顾论文 §5.6 专节)——挑战赛的排名不是"一次快照"而是"分布稳健的序"。
4.4 防作弊与每日一提交
验证榜每日限一次提交(only one submission per day was allowed on the validation leaderboard)。
官方明确动机:防参赛者以验证集为"超级测试集"做有监督超参选择(to mitigate the risk that participants select their model hyper-parameters in a supervised manner)。
评估期(2023-07-05 至 07-20,Docker 截止 07-10)每人仅一次提交,容器在集群统一执行;参赛队被要求 zip 内含全部病例的预测,缺漏即无效;全部容器通过质量控制测试。
测试集对参赛者完全私有,这是遵循挑战赛组织最佳实践(回顾论文引 [43])的标准操作。
代码透明义务:参赛队须公开训练与测试代码(可仅向组织方开放并签 NDA),且须说明超参微调方式;top 3 赛后另交 Docker 复验合规。
组织成员可参赛但不得获奖、不上榜——利益回避规则同样成文。
4.5 与库内挑战赛评估体系的对照
这套"多指标 × 多区域 × rank score"的模板在库内多个 MICCAI 系挑战赛条目中可见变体:
- brats(24) 的 BraTS 系列用 lesion-wise Dice 与排名方案(crossMoDA 明言借鉴);
- wmh-challenge(501) 用加权多指标合成;
- instance2022(645) 的实例分割任务用 AP 族;
- autoimplant(472) 用表面距离族。
crossMoDA 的差异化在于案例级名次聚合——不是对指标值求均值,而是对"名次"求均值。
这使不同量纲的指标(% 与 mm)可以无缝混合,也使"每例都重要"的伦理判断(临床上一个漏诊病例就是一个患者)直接编码进了排名数学。
4.6 两点方法学批评与组织者的回应
批评一:rank score 对小规模完赛队伍敏感。
6 支队伍的排名方差大,一名次之差就能翻转总榜(2023 的第二三名在表格里只差 0.1);统计功效依赖完赛规模,而 2023 恰恰只有 6 队。组织者的回应是 bootstrap 稳定性检验——但检验能告诉你"排名稳不稳",不能凭空创造区分度。
批评二:验证集(96 例)与测试集(341 例)分布不同构。
验证集里 MC-RC 只占 32 例(33%),测试集里占 94 例(28%),且测试集剔了术后而验证集的伦敦例本就无术后——参赛者在验证集上选的模型,要面对一份比例略有不同的考卷。
这是所有"私有测试集"挑战赛的通病。crossMoDA 的缓解手段:每日一提交(降低验证集过拟合带宽)+ 赛前公布的固定排名方案(不做赛后规则调整)。
§5 结果与基准:6 队排名、双口径与冠军拆解
5.1 2023 完赛队伍完整排名(回顾论文 Table 5 口径)
| 排名 | 队伍 | Rank score↓ | 瘤内 VS DSC% | 瘤内 ASSD mm | 瘤外 VS DSC% | 瘤外 ASSD mm | 耳蜗 DSC% | 耳蜗 ASSD mm |
|---|---|---|---|---|---|---|---|---|
| 1 | vandy365 | 2.2 | 74.9 [68.8-80.0] | 0.43 | 87.3 [82.7-90.4] | 0.40 | 84.1 [81.7-86.0] | 0.21 |
| 2 | ccc1018 | 2.9 | 71.7 [64.5-76.9] | 0.54 | 84.9 [75.9-89.4] | 0.48 | 84.5 [82.7-86.3] | 0.21 |
| 3 | superpoly | 3.0 | 67.2 [53.0-76.8] | 0.66 | 85.6 [77.2-89.4] | 0.49 | 85.1 [83.1-86.6] | 0.19 |
| 4 | hustcbib | 3.5 | 69.7 [59.8-76.3] | 0.57 | 83.5 [75.8-88.7] | 0.51 | 81.8 [79.9-83.8] | 0.25 |
| 5 | auda | 4.2 | 67.1 [46.4-76.8] | 0.64 | 78.2 [60.0-85.3] | 0.66 | 82.7 [78.9-84.7] | 0.23 |
| 6 | mbzuai | 4.9 | 63.9 [46.7-72.8] | 0.72 | 76.3 [51.2-85.8] | 0.67 | 79.1 [75.8-81.4] | 0.27 |
DSC 为中位 [四分位距];ASSD 同格式。
VS 整体(瘤内+瘤外合并)口径:
- vandy365:87.1 [83.3-90.2] / ASSD 0.40 [0.32-0.51];
- ccc1018:85.8 [78.8-89.9] / 0.48;
- superpoly:85.0 [79.0-88.8] / 0.53;
- hustcbib:83.6 [77.5-88.5] / 0.53;
- auda:79.8 [63.4-85.6] / 0.66;
- mbzuai:78.0 [58.6-86.4] / 0.67。
读表四要点。
第一,瘤外 DSC 全面高于瘤内(顶配 87.3 vs 74.9,差 12.4 个点):瘤外区体积大、边界相对清楚;瘤内区被听道骨壁包裹、体积小,是小结构分割难题的又一例证——与 2021/2022 届"VS 难于耳蜗"的观察一脉相承(耳蜗虽小但位置形态极其规整,肿瘤则形态多变)。
第二,耳蜗是 superpoly 的单项王(85.1%,ASSD 0.19 全场最小),但它的瘤内 DSC 只有 67.2%——rank score 机制下"偏科"拿不了总冠军,这正是案例级名次聚合的设计意图。
第三,六队全部过线:最末位的 mbzuai 耳蜗也有 79.1%,没有 2022 届那种 15.6% DSC 的雪崩式垫底——考卷变难了,但完赛队伍的平均水位也涨了(6/26 的漏斗自我选择贡献于此)。
第四,四分位距的宽度本身就是信息:auda 瘤内 [46.4-76.8]、mbzuai 瘤外 [51.2-85.8] 的超宽 IQR 说明这些方法在部分病例上崩到接近随机,"稳定输出"在异质考卷上是硬通货。
5.2 rank score 双口径:正文与表格打架
回顾论文正文 §5.4 写 vandy365 rank score 2.3、superpoly 与 ccc1018 同为 2.8;而 Table 5 写 2.2、2.9、3.0。
正文与表格三处不一致,且直接影响第二/三名谁先谁后的叙述:按表 2.9 vs 3.0,ccc1018 第二;正文"same rank score of 2.8"则语焉不详。
本条目正文一律采用 Table 5 口径(2.2/2.9/3.0),正文口径在此存照(见坑 3)。
这不是吹毛求疵:第二名与第三名的次序在传播中已被写乱过一次,引用排名前先声明口径。
5.3 结构级名次分解(Table 7)
| 队伍 | 总排名 | 瘤内 VS 名次 | 瘤外 VS 名次 | 耳蜗名次 |
|---|---|---|---|---|
| vandy365 | 1 | 1.5 | 1.0 | 2.5 |
| ccc1018 | 2 | 2.5 | 3.0 | 2.5 |
| superpoly | 3 | 4.0 | 3.0 | 2.0 |
| hustcbib | 4 | 3.0 | 3.0 | 4.0 |
| auda | 5 | 4.5 | 5.0 | 4.0 |
| mbzuai | 6 | 5.0 | 5.0 | 5.5 |
冠军 vandy365 的取胜结构一目了然:瘤外 VS 名次 1.0(几乎每例都第一)+ 瘤内 1.5,耳蜗 2.5 略逊——它赢在"没有短板上的大坑",而非某一项的极限拔高。
hustcbib 的瘤内名次(3.0)好于 superpoly(4.0)但耳蜗拖后腿(4.0 vs 2.0),总排名反超不掉。
这张表也是给"想冲击下一届"的团队的策略图:瘤外每提升一名次的边际收益最高(名次均值里权重相同,但瘤外的队伍间差距最小、最容易挤进前二)。
5.4 耳蜗 DSC 跨届走低之谜
把三届冠军的耳蜗成绩放一起(回顾论文 Winners across editions 表):
| 测试集 | 2021 冠军 | 2022 冠军 | 2023 冠军 |
|---|---|---|---|
| 伦敦 2021 测试集 | 85.71 | 87.11 | 86.30 |
| 伦敦+蒂尔堡 2022 测试集 | — | 87.63 | 84.90 |
| 全三源 2023 测试集 | — | — | 84.06 |
耳蜗 DSC 不升反降,且在所有可对照的测试集上一致走低。
回顾论文的归因带着明确的推测语气(“probably due to”):
- 瘤亚分割使 3 类任务的优化复杂度上升,模型在"维持所有类别高性能"上分心了;
- 叠加数据异质化与分辨率可变性的冲击。
论文同时承认 precise cause remains uncertain。
这个现象对小结构分割研究者是重要提醒:类别数与任务复杂度的增加,最先牺牲的往往是最小的结构。
如果耳蜗才是你关心的临床终点(保听力),直接拿 2023 冠军模型不如拿 2022 冠军、或在 2022 数据(2 类任务)上复训——这不是 2023 数据集的缺陷,而是任务设计权衡的已知代价,使用者的任务设计应该跟着自己的临床终点走。
5.5 冠军方案 vandy365 拆解:“生成风格"而非"抹平风格”
冠军论文:Learning site-specific styles for multi-institutional unsupervised cross-modality domain adaptation。
- arXiv:2311.12437(2023-11);
- Springer LNCS 14669, pp. 372-385;
- 作者:Han Liu、Yubo Fan、Zhoubing Xu、Benoit M Dawant、Ipek Oguz(Vanderbilt 大学 MedICL-VU 实验室与 Siemens Healthineers 合作;Liu 现址 Siemens Healthineers);
- 代码全开源:GitHub MedICL-VU/crossmoda2023(含可玩风格的预训练模型与样例数据);
- 资助:NSF 2220401 + NIH T32EB021937。
核心思想(README 原文):“Instead of removing site-specific styles by data harmonization, we generate them!”
面对多站点风格差异,主流做法是 harmonization(把不同站点拉齐到同一风格,如强度标准化、直方图匹配),冠军反其道而行:把站点风格当作可控的生成条件,主动把每一种风格都生成出来喂给分割器,让模型见多识广。
三步流水线:
- 非配对图像翻译(主要创新):把 QS-Attn(Query-selected Attention,基于查询选择注意力的对比学习翻译网络)从 2D 扩展到 3D,并将生成器改为动态网络(dynamic network)——以 one-hot 站点码(001=UKM / 010=ETZ / 100=LDN)为条件,经动态实例归一化(dynamic instance normalization)输出可控风格的合成 T2。站点码还能外推:喂 (1,5,10) 这类"没见过"的码,就生成未见过的风格(解剖不变、风格变化),相当于在风格空间做插值增广。生成器额外挂了一个分割解码器(label-assisted intensity transformation),以分割一致性约束逼生成过程保住解剖结构。
- 只用合成图像训练分割器:nnU-Net v2 全分辨率配置,定制 trainer + 两种针对感兴趣结构局部强度的增广(强/弱两档,结构区强度缩放约 ±50%);按耳蜗位置裁剪 256×144×32 子体积、重采样到数据集中位分辨率 0.41×0.41×1 mm³。
- 自训练(self-training):用真实无标注 T2 生成伪标签,连通域分析过滤低质伪标签,与合成图像(真实标签)联合重训,缩小合成-真实的残余域差。
推理:11 模型 ensemble——3 个标准 nnUNet(不同种子)+ 8 个定制模型 = 2 种 backbone(U-Net/ResU-Net)× 2 种局部强度增广策略 × 2 组未见站点码风格插值;后处理每类取最大连通域(LCC)。
它的本质可以概括为一句话:把"域适应"改写成"风格条件生成 + 风格覆盖"——不是让模型对风格盲(invariant),而是让模型对风格全知(covering)。
2022 冠军 PAST(北大 ne2e)的"像素对齐+自训练"是单风格假设下的方案,2023 冠军把同一框架升级到了多风格条件化——两届冠军方案的演进本身就是域适应技术从"单一域差"走向"域的流形"的缩影。
5.6 跨届回溯:异质性训练的增益与代价
回顾论文最漂亮的一张表(Winners’ performance across editions):把三届冠军模型放到三套测试集上交叉评估。
| 测试集 | 2021 冠军 VS | 2022 冠军 VS | 2023 冠军 VS | 2022 冠军耳蜗 | 2023 冠军耳蜗 |
|---|---|---|---|---|---|
| 伦敦 2021 测试集 | 87.01 [81.81-89.99] | 88.45 [84.71-91.95] | 88.61 [85.78-91.71] | 87.11 | 86.30 |
| 伦敦+蒂尔堡 2022 测试集 | — | 86.07 [82.70-89.66] | 88.00 [84.27-90.90] | 87.63 | 84.90 |
| 全三源 2023 测试集 | — | — | 87.08 [83.25-90.22] | — | 84.06 |
(DSC 中位 [IQR],%;ASSD 对照:伦敦 2021 集 2023 冠军 0.3065 mm vs 2022 冠军 0.3041 mm 基本持平。)
两条结论。
增益:2023 冠军(异质数据训练)在 2021、2022 的"旧考卷"上都超过了当年冠军(VS 88.61 vs 88.45;88.00 vs 86.07)——见过混乱的模型在干净数据上不降反升,异质性不是噪声而是疫苗。注意旧考卷已因术后剔除而内容微变(§2.6),但伦敦 2021 测试集不含术后、对比基本干净。
代价:耳蜗 DSC 在所有对照中一致走低(87.63→84.90),亚分割任务对多类别均衡的挤压是真实存在的。
回顾论文的总结句值得直引:“increased data heterogeneity can enhance segmentation performance even on homogeneous data”——但 VS 分割的性能已接近天花板(leading competitors start to plateau),未来需要更难的跨模态学习任务来维持基准的区分度。
5.7 方法谱系:全员"翻译+分割"的收敛与冠军的差异化
六队方法(回顾论文 Table 3 + §4.3 叙述)全景:
- vandy365(冠军):扩展 3D QS-Attn 动态网络(站点码条件化)+ nnU-Net v2 + 自训练 + 11 模型 ensemble + LCC 后处理——唯一把多站点条件化做成一等公民的方案。
- ccc1018(亚军):CUT(2D,patch-wise 对比学习)翻译 + 2.5D ResUNet(三下三上、z 向不降采样)+ 自训练 + 伪标签强度缩放对齐后处理;Adam 0.0002、200 epochs。
- superpoly(季军):Seq2Seq 生成器 + hyper 判别器——一张 ceT1 在不同条件码下生成九个版本(不同中心/平面视角),条件化增广的另一种实现;nnU-Net 分割,无自训练。
- hustcbib(第四):三网并发翻译(2.5D CycleGAN 周期一致 / CUT 对比损失 / 2D WCUT 加权对比),各挂辅助分割损失 + 3 折 ensemble;华中科技大学(arXiv:2311.11578)。
- auda(第五):SE-CUT(CUT+分割解码器)翻译 + 三路 CycleGAN 做像素级强度微调 + 5 折 MS-MT(多尺度均值教师)自训练;VS 用 LCC、耳蜗用 2 连通域后处理。
- mbzuai(第六):试过 QS-Attn/DECENT 后回退传统 2D CycleGAN + 3D nnU-Net + 自训练 + 补洞去孤立点后处理 + 3 折 ensemble。
三个谱系观察。
其一,"翻译→分割→自训练"三段式是全员共识——六队全部采用图像翻译桥接模态差,五队用自训练缩小合成-真实差;这个两段式范式自 2021 届确立后三届未变。
其二,翻译器谱系从 CycleGAN 独大走向分化:2022 届全员 CycleGAN 系,2023 届 CUT 系(3 队)、生成器路线(1 队)、QS-Attn 扩展(冠军)各占一席——对比学习系翻译器在多站点场景的适应性开始显山露水。
其三,ensemble 是涨分硬通货:前三名全部 ensemble(11 模型/条件化增广替代/3 折),后三名两家用 3-5 折——在 rank score 机制下,ensemble 的"削峰填谷"直接转化为名次。
5.8 只用公开 618 例,实验怎么设计
测试集 341 例永远拿不到,公开使用者的天花板是 618 例(源 227 + 目标 295 + 验证 96)。三条务实路径:
- 复现参赛队口径:训练 227+295、验证 96 打榜式评估;自建内部验证时从训练集切(注意 MC-RC 按患者切分,见 §2.8),并保留"每日一提交"的纪律——防验证集过拟合的逻辑对自建验证同样成立。
- 源内切分的受控实验:把 227 例带标注 ceT1 自行切分训练/测试,只考"跨模态"不考"跨站点",可与 HUST_CBIB 等技术报告的验证集数字(如 VS DSC 72.78%、耳蜗 80.64%)直接对标——技术报告多用验证集口径,与测试集排名不可混比。
- 域泛化消融:用文件名站点前缀(etz/ldn/ukm)天然构成三个域,"leave-one-site-out"式的域泛化实验不需要任何额外标注——文件名即域标签的设计在这里第二次兑现价值。
若需要更大规模的私有对照,MC-RC 原始库(Kujawa 2024:160 患者、487 扫描含 124 ceT1w + 363 T2w)是同源且公开的补充弹药——它的 T2w 数量(363)甚至超过 crossMoDA 2023 的全部 hrT2 目标域(295+96)。
两者的差异:原始库有整瘤标注(无瘤内外细分、无耳蜗),license 独立(CC BY),做"多中心 VS 分割"而非"跨模态 UDA"时原始库可能更合适。
5.9 给基准使用者的分数对齐清单
引用或对比 crossMoDA 2023 的任何分数前,逐项核对:
- 口径声明:测试集排名(Table 5)还是验证集(技术报告)?两者不可混排——技术报告的验证集 DSC 普遍低于测试集中位;
- 区域口径:VS"整体"(瘤内+瘤外合并)还是瘤内/瘤外分列?2023 与 2022 的 VS 数字不可直接比(任务从 2 类变 3 类);
- 届次口径:2022 数字对应 755 例考卷、2023 对应 959 例(伦敦已剔术后)——同队同法两届分数本就不可直接比;
- 聚合口径:中位数 [IQR](Table 5 口径)而非均值;rank score 越低越好、与 DSC 方向相反;
- rank score 出处:Table 5(2.2/2.9/3.0)优先于正文叙述(2.3/2.8/2.8)——坑 3;
- 后处理披露:六队全部有后处理(LCC/补洞/伪标签对齐),复现对比时后处理是配置项不是可选项;
- ensemble 披露:冠军 11 模型、HUST 3 折、A-UDA 5 折——单模型复现达不到榜单数字属预期;
- 切分纪律:自建实验用 patient-wise split(MC-RC 同患者多扫描),否则指标虚高(§2.8)。
§6 获取与许可:Synapse 时代的门怎么进
6.1 渠道核验:不在 Zenodo,在 Synapse
这是本条目最重要的获取事实,也是检索陷阱最密集的地方。
三轮核验结论:
- Zenodo 10685265 与 crossMoDA 无关——直接抓取该记录(2026-09-27),内容是 “OPeNDAP (The Open-source Project for a Network Data Access Protocol) BOM Tutorial Introduction”(Fox, Peter,2007-10-15,NSF NCAR 高空观测台)的一份海洋数据系统教学幻灯片。
- 网络上流传的"crossMoDA 2023 zenodo DOI"是讹传。
- 讹误的成因无从考证(数字段撞车或转引失真)。
- 但可以确定的是:没有证据表明 2023 版数据有任何 Zenodo 记录。
- 2023 版数据的官方渠道是 Synapse:
- 回顾论文 §2.4.1 原文 “The datasets used in the 2023 edition were available on the Synapse crossMoDA challenge space”,脚注给出 https://www.synapse.org/Synapse:syn51236108;
- openmedlab 数据集百科的 Download Link 指向同一 Synapse 空间;
- 冠军代码库 README 的下载指引(“CrossMoDA 2023 dataset can be officially downloaded here”)也指向该 Synapse 空间;
- 三源互证成立,渠道结论可以定案。
- Zenodo 6504722 是 2021/2022 版的渠道,别拿它当 2023 版:
- crossmoda2022_training.zip 7.8 GB;
- crossmoda2022_validation.zip 1.0 GB;
- training_source_GIF.zip 191.7 MB(GIF 脑区掩码,2023 版未见延续);
- AMID Python 库的 CrossMoDA 类截至查证仍指向该 Zenodo 记录。
代价是平台体验的变化:
- Zenodo 是"点开就下";
- Synapse 需要注册账号、接受使用条款;
- Synapse 页面为 JS 渲染,脚本化抓取不如 Zenodo 友好。
对 AI-Ready 光谱而言,这是可获取性的一小步退步。组织方的理由见 §6.6:Synapse 能把数据托管与打榜评估装进同一个门。
6.2 License 逐字母拆解:CC BY-NC-SA 4.0
训练+验证数据的许可是 CC BY-NC-SA 4.0(回顾论文 §2.4.1 与官网 Data 页双源确认)。
官网原文:
“All data will be made available online with a permissive non-commercial copyright-license (CC BY-NC-SA 4.0), allowing for data to be shared, distributed and improved upon.”
逐字母拆解:
- BY(署名):使用须引用数据底座。
- 官网明文 “To cite this data, please refer to https://arxiv.org/abs/2201.02831”(Dorent 2022 首届 benchmark 论文);
- MC-RC 部分应引 Kujawa 2024(Front. Comput. Neurosci. 18:1365727);
- 伦敦数据的学术源头是 Shapey 2021(TCIA,DOI 10.7937/TCIA.9YTJ-5Q73);
- 三路引用按使用子集取舍,但"用了哪路就引哪路"不可省略。
- NC(非商业):不得商业使用。
- 厂商做产品化 VS 分割工具需要另行商业授权,这不是 CC BY 数据;
- 联系渠道:官网联系表单(收件邮箱 rdorent@bwh.harvard.edu)。
- SA(相同方式共享):衍生数据集须以同款 CC BY-NC-SA 4.0 发布。
- 在你的预处理版本上不能再叠加更严或更松的许可;
- "改进后重新发布"被 license 明文欢迎(allowing for…improved upon);
- 但改进版必须保持同款许可,这是一个"传染性"条款。
测试集不是"许可严格"而是根本不发放:341 例私有扫描只接受 Docker 容器提交、服务器端评估——许可条款管不到它,因为它根本不离开组织方服务器。
另外两份相关文本的许可,三层别混:
- 回顾论文 arXiv 页面标 CC BY-NC-ND 4.0(论文文本,ND=禁止演绎);
- MC-RC 数据论文本身是 CC BY(Frontiers 开放获取);
- 数据本体(训练+验证)是 CC BY-NC-SA 4.0。
6.3 引用规范模板
论文(回顾/基准描述):
Wijethilake N, Dorent R, Ivory M, Kujawa A, et al., Shapey J, Vercauteren T.
crossMoDA challenge: Evolution of cross-modality domain adaptation techniques
for vestibular schwannoma and cochlea segmentation from 2021 to 2023.
Medical Image Analysis 114:104282, 2026. doi:10.1016/j.media.2026.104282
(arXiv:2506.12006)
数据(按使用子集取舍):
Shapey J, et al. Segmentation of Vestibular Schwannoma from MRI: An Open
Annotated Dataset and Baseline Algorithm. TCIA 2021. doi:10.7937/TCIA.9YTJ-5Q73
(伦敦数据底座;官网对整个数据的指定引用之一)
Kujawa A, Dorent R, Connor S, et al., Shapey J. Deep learning for automatic
segmentation of vestibular schwannoma: a retrospective study from multi-center
routine MRI. Front Comput Neurosci 18:1365727, 2024. doi:10.3389/fncom.2024.1365727
(UK MC-RC 子集)
Dorent R, et al. CrossMoDA 2021 challenge: Benchmark of cross-modality domain
adaptation techniques for vestibular schwannoma and cochlea segmentation.
Medical Image Analysis 83:102628, 2023. doi:10.1016/j.media.2022.102628
(系列首届基准论文;官网 "To cite this data" 的指向对象)
冠军方法(若复现/对比):
Liu H, Fan Y, Xu Z, Dawant BM, Oguz I. Learning site-specific styles for
multi-institutional unsupervised cross-modality domain adaptation.
crossMoDA 2023 proceedings, LNCS 14669, pp.372-385. Springer, 2024.
arXiv:2311.12437
引用时的三个注意:
- 用哪个子集就引哪路数据论文——只用了 MC-RC 子集而引用 Shapey 2021 是不完整的引用;
- 回顾论文覆盖 2022+2023 两届,引用 2021 届数字时另有首届基准论文;
- 冠军论文有 arXiv 与 LNCS 两个版本,正式引用以 Springer LNCS 14669 pp.372-385 为准。
6.4 时间线速查(2023 届全程)
| 日期 | 事件 |
|---|---|
| 2023-04-02(原计划)→ 04-15(实际) | 训练+验证数据发布(Synapse) |
| 2023-04-12(原计划)→ 04-27(实际) | 验证期开始(每日一次提交) |
| 2023-07-05 | 评估期开始 |
| 2023-07-10 | Docker 容器提交截止 |
| 2023-07-09 / 07-20 | 验证期结束 / 评估期结束 |
| 2023-10-08(MICCAI 2023 温哥华,10-08~12) | crossMoDA event 宣布获奖 |
| 2023-11-30 | 受邀队伍向 BrainLes Workshop 提交方法短文截止 |
| 2023-11-22 / 2024-01-12 | 冠军代码库 GitHub 首提交 / 结果图上传(开源时间线旁证) |
| 2024-05-09 | MC-RC 数据论文(Kujawa 2024)发表 |
| 2024-12-27/28 | Springer LNCS 14669(BraTS+crossMoDA 2023 proceedings)出版 |
| 2025-06-13 / 2026-08-25 | 回顾论文 arXiv v1 / v4 |
| 2026-11 | 回顾论文期刊版刊出(MedIA 114:104282) |
时间线的三个读法:
- 官网 Timeline 上 4-02 与 4-15、4-12 与 4-27 两组日期并列——改期痕迹原样保留在页面上("2nd April 15th April 2023: Release…"的原始 HTML 格式),引用时以实际日期(后一档)为准。
- 数据发布到验证期开始约两周缓冲,验证期约 10 周、评估期两周——这个节奏(数据先发、充分打榜、一次性终评)与前两届一致,是可复用的赛程模板。
- 数据发布(4-15)到论文发表(2026-11)超过三年半——挑战赛数据资产的完整学术闭环(数据→榜单→proceedings→数据论文→回顾论文)是以年为单位的慢工程,规划复用周期时应按这个时间尺度预期。
6.5 DAIMS 评估
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 官网+回顾论文+Synapse 三入口可索引;扣分:Zenodo DOI 讹传(坑 1)与 GC 子站 404(坑 8)会误导检索 |
| A 可获取性 | 6 | Synapse 注册制(对比 2022 版 Zenodo 免注册直降);测试集 341 例永久私有;扣分:无 Zenodo 式一键直链与公开 MD5 清单页(平台内可能有,未核验) |
| I 可互操作 | 8 | NIfTI(nii.gz)医学影像事实标准,进 nnU-Net/MONAI 管线零摩擦;文件名内嵌站点元数据(域标签即文件名) |
| M 元数据质量 | 8 | 回顾论文 Table 1 全量数字+官网协议页+开源 defacing 管线;扣分:伦敦分辨率双口径(坑 7)、官网 2022 遗留文字未清(坑 6) |
| S 可持续性 | 8 | 系列持续三届+回顾论文期刊沉淀+冠军代码开源;扣分:渠道随平台迁移易断链(AMID 等第三方未跟上)、Koos 任务取消 |
| 综合评级 | 7.6/10(良) | 任务-数据-评估一体化设计是库内挑战赛工程样本的天花板;短板集中在可获取性——全是平台迁移的代价 |
DAIMS 之下的八维细评(定性口径,供工程决策参考):
| 维度 | 评分 | 说明 |
|---|---|---|
| 可发现性 | 良好 | 官网+回顾论文+Synapse 三入口;但"Zenodo DOI"讹传与 GC 子站 404 会误导检索 |
| 可获取性 | 中 | Synapse 注册制;测试集永久私有;无 Zenodo 式一键直链与 MD5 清单页(平台内可能有,未核验) |
| 格式规范 | 优秀 | NIfTI(nii.gz)医学影像事实标准;文件名内嵌站点元数据(域标签即文件名) |
| 标注质量 | 良好 | 三级标注流水线+可靠性分析;ceT1 耳蜗可见性限制已自曝 |
| 文档完备 | 良好 | 回顾论文 Table 1 全量数字、官网协议页、开源 defacing 管线;Synapse 页文档未核验 |
| 许可明确 | 优秀 | CC BY-NC-SA 4.0 白纸黑字(论文+官网双源) |
| 机器可读元数据 | 中 | Synapse API 可编程访问,但无 Zenodo 式 OAI-PMH/JSON-LD 记录;文件名前缀是唯一"结构化"域标签 |
| 可复现基准 | 优秀 | 私有测试集 + Docker 服务器端评估 + 每日一提交,防污染设计完整 |
综合判读:
- DAIMS 五维里可互操作/元数据/可持续三维稳健,可获取性 6 分是全表最低——全部源于 Synapse 迁移;
- 与 2021/2022 版(Zenodo 时代,同系列条目 crossmoda2022 评 8.2/10)相比,2023 版在"点开就下"维度让了步,在"数据-榜单一体"维度进了步;
- 对全自动流水线用户,注册步骤是唯一的人工环节——Synapse 提供编程 API,注册一次后可用 token 拉取,工程上可接受。
6.6 平台迁移的得与失:为什么是 Synapse
2023 届 quietly 完成的基建变更是从 grand-challenge.org 迁到 Synapse。
回顾论文 §2.5 的官方理由:
两家平台都能跑自动验证榜,“但 Synapse 还允许我们把数据托管在他们的平台上”(Synapse additionally allowed us to host our data on their platform)。
此前两届的组织栈是三件套拼接:
- Zenodo(数据分发);
- grand-challenge.org(打榜);
- 自有集群(Docker 终评)。
Synapse 把三件事装进同一个门:
- 数据托管(平台内更新可追溯);
- 每日打榜(评估工作流原生集成);
- 工作流编排(Synapse Workflow Orchestrator,data-to-model 工作流,开源在 github.com/Sage-Bionetworks/SynapseWorkflowOrchestrator)。
得与失的完整清单:
- 得:
- 数据版本可控(平台内更新可追溯);
- 打榜-数据同源(不存在"下错版本");
- 工作流可复用(Sage Bionetworks 的开源编排器生态);
- 运维成本骤降(一套账号体系管全流程)。
- 失:
- 注册门槛(参与漏斗骤降的候选原因之一,未证实);
- 检索生态弱化(无 DOI、无 OAI-PMH、GC 子站 404);
- 匿名性丧失(注册制对部分研究场景是合规负担);
- 第三方资料断链(openmedlab 混写口径、AMID 未收录 2023 版,都是检索生态弱化的症状)。
给挑战赛设计者的推论:平台选择不是纯技术决策,它同时决定了数据资产的可发现性生命周期——Zenodo 的 DOI 永久可引用,Synapse 的 syn ID 依赖平台存活。
6.7 获取与使用的边界情形清单
- 需要术后扫描:
- 2023 版没有(全剔了);
- 回用 2022 版 Zenodo 6504722 的伦敦数据(2022 版含术后)。
- 需要 Koos 标注:
- 同上,2022 版遗产(London 221 + Tilburg 273 术前例,双人评定+仲裁)。
- 需要 MC-RC 全量(不止 crossMoDA 用的 274 例):
- Kujawa 2024 的原始公开库(160 患者 487 扫描含 124 ceT1w + 363 T2w)另有发布渠道;
- 与挑战赛子集互补发放;
- license 独立为 CC BY(无 NC/SA 限制,比挑战赛子集宽松)。
- 商业用途:
- CC BY-NC-SA 的 NC 条款拦截;
- 联系组织方(官网表单,rdorent@bwh.harvard.edu)另行授权。
- 想做排行榜复刷:
- 挑战赛已闭幕,榜单快照见回顾论文;
- 自行复刷只能自建切分(按 §5.8 三路径);
- 注意切分须按患者聚合(同一患者的多次随访扫描不得跨切分泄漏)。
- 想跑冠军模型:
- 代码与预训练合成模型全开源(MedICL-VU/crossmoda2023);
- 含样例数据与风格 playground;
- 注意其分割器按挑战赛预处理(0.41 mm 重采样+耳蜗定位裁剪 256×144×32)训练,直推自己的数据要先对齐预处理;
- 合成网络可用任意站点码(含未见码)玩风格插值。
- 要引用官网数据描述:
- 注意官网 Task 段的"术前+术后"文字是 2022 遗留(坑 6);
- 伦敦 0.4 mm 是官网口径(坑 7);
- 官网引用须带届次限定,与回顾论文冲突时以论文为准。
§7 生态与影响:一个系列的三届进化论
7.1 主办方谱系与资助
组织核心是 KCL 生物医学工程与影像科学学院(BMEIS)-耳科临床的轴心:
- Navodini Wijethilake(论文共同一作,MRC DTP 博士培养,概念设计/数据预处理/指标委员会);
- Reuben Dorent(共同一作,KCL 博士后→哈佛医学院,Leadership+指标委员会);
- Tom Vercauteren(KCL 教授,Medtronic/皇家工程院研究讲席 RCSRF1819/7/34);
- Jonathan Shapey(KCL/KCH 双聘,临床总顾问);
- Aaron Kujawa(概念设计+MC-RC 数据论文一作);
- Marina Ivory(分割标注+数据整理);
- Samuel Joutard(日常运维);
- 指标委员会:Nicola Rieke(NVIDIA)、Spyridon Bakas(宾夕法尼亚大学);
- ETZ 侧预处理与数据整理:Stefan Cornelissen、Patrick Langenhuizen;
- 标注一线:Steve Connor(KCL/KCH)、Mohamed Okasha(Ninewells Hospital NHS Tayside, Dundee)、Anna Oviedova(Charing Cross Hospital, Imperial College Healthcare)。
资助矩阵:
- Wellcome(203148/Z/16/Z);
- EPSRC(NS/A000049/1);
- MRC 项目基金(MC/PC/180520);
- MRC DTP(MR/N013700/1);
- 欧洲 MSCA SafeREG(101154248);
- Medtronic/皇家工程院讲席(RCSRF1819/7/34);
以上是英国临床 AI 的标准资助拼盘。
冠军队侧:
- NSF(2220401);
- NIH(T32EB021937);
——美国学术-产业轴心(Vanderbilt+Siemens)的投入。
奖项赞助:英国听神经瘤患者组织 BANA(British Acoustic Neuroma Association)——患者组织赞助 AI 挑战赛奖项,在挑战赛生态里是不多见的临床共建信号,也提示这个系列的患者社群根基。
7.2 系列脉络:三届任务设置演化全景
| 维度 | 2021 | 2022 | 2023(本条目) |
|---|---|---|---|
| 任务 | 2 类分割(VS+耳蜗) | 2 类分割 + Koos 分类 | 3 类分割(瘤内/瘤外/耳蜗) |
| 数据 | 伦敦 379 | 伦敦+蒂尔堡 755 | +MC-RC = 959 |
| 域偏移形态 | 一对一(模态) | 一对一(模态+2 站点) | 一对多(模态×10 站点协议) |
| 术后数据 | 含 | 含(分类任务除外) | 全剔除 |
| 附属资产 | — | GIF 脑区掩码 | 未见延续 |
| 平台 | grand-challenge.org | grand-challenge.org | Synapse |
| 数据渠道 | Zenodo 6504722 | Zenodo 6504722 | Synapse syn51236108 |
| 注册/完赛 | 55/16 队 | 233/12 队(分割) | 26/6 队 |
| 冠军 | — | ne2e(北大,PAST:像素对齐+自训练) | vandy365(Vanderbilt,风格生成) |
| Koos | 无 | 有(3 队,SJTU 0.26) | 取消 |
| 数据底座论文 | Shapey 2021(TCIA) | 同左 | +Kujawa 2024(MC-RC) |
演化逻辑一以贯之:
- 每届都在"更临床"的方向上加码;
- 2022 加多中心(蒂尔堡入列);
- 2023 加真实世界协议混乱(MC-RC 十站点协议)与解剖学细分(瘤内/瘤外);
- 同时果断砍掉已被证明参与不足的任务形态(Koos 两届谢幕)。
参与规模的骤降(233→26 注册)与平台迁移同期发生,但回顾论文未做归因——平台门槛、赛题变难、系列疲劳、疫情后线上参赛潮退温都可能是变量,存照不下结论(见坑 8)。
值得注意的是完赛队伍的质量水位并未下降:
- 2023 六队的尾部成绩(耳蜗 79.1%)远好于 2022 十二队的尾部(耳蜗 52.0%);
- 参与数量下降、参与质量上升——注册门槛若真实存在,它过滤掉的可能是"凑热闹"而非"真选手";
- 这一模式与同期其他 MICCAI 挑战赛的"注册虚高、完赛坍缩"现象一致,可互为参照。
7.3 数据血缘:一条 TCIA→挑战赛→原始库的三叉谱
- 伦敦数据:
- Shapey 2021 TCIA 开放数据集(DOI 10.7937/TCIA.9YTJ-5Q73)是整个系列的地基;
- 先有开放数据集,再被挑战赛化(2021);
- 2023 版继承其中 309 例(术后 70 例被剔除)。
- MC-RC:
- 时序倒挂——先在挑战赛内使用(2023-04 数据发布),数据论文 2024-05 才正式发表;
- 论文承担方法学与一致性分析的"引用锚";
- 挑战赛承担分发与定标;
- 原始库(160 患者 487 扫描)另渠道发放,比挑战赛子集(145 患者 274 扫描)更全。
- 蒂尔堡:
- ETZ 医院放射外科流程数据;
- 无独立开放版本,只能经挑战赛获取;
- 2023 版原样继承 2022 版的 376 例(源 105/目标 105/验证 32/测试 134)。
对数据集考古者,这个三叉谱意味着:
- 引用伦敦数据时 TCIA 论文是学术源头;
- 引用 MC-RC 时 Frontiers 论文是;
- 两者都被 CC BY-NC-SA 的"BY"条款实际要求引用。
三叉谱也是复用路线图:
- 想要术后+Koos 走 TCIA/2022 版;
- 想要常规临床异质性走 Kujawa 原始库;
- 想要"跨模态考题"走 2023 版本体。
7.4 出版网络与开放科学形态
2023 届的出版网络三层。
挑战赛本体:
- MICCAI 2023(温哥华,10-08~12)crossMoDA event 宣布获奖;
- 方法短文收入 Springer LNCS 14669(BraTS 2023 + crossMoDA 2023 联合卷);
- 出版日 2024-12-27/28,DOI 10.1007/978-3-031-76163-8;
- eBook ISBN 978-3-031-76163-8,软皮 ISBN 978-3-031-76162-1;
- 编辑含 Baid/Dorent/Wijethilake/Bakas/Crimi。
注意 Springer 页面副标题把会议日期误写为 “October 12 and 8, 2024”(坑 9),且别与 BrainLes 主卷 LNCS 14668 混淆。
回顾论文:
- arXiv:2506.12006(2025-06-13 v1 / 2026-08-25 v4);
- 期刊版 Medical Image Analysis 114:104282(2026-11);
- 覆盖 2022+2023 两届、三届回溯。
外围:
- MC-RC 数据论文(Front Comput Neurosci 2024,CC BY);
- 冠军论文(arXiv 2023-11 + LNCS 14669);
- 参赛技术报告若干(如 HUST_CBIB 的 arXiv:2311.11578)。
开放科学形态的独特之处:数据、代码、评估器三层全开放——
- 评估指标实现在 GitHub 公开(官网 “These metrics are implemented here”);
- 冠军代码全开源;
- defacing 管线开源。
挑战赛结束不等于工具链蒸发——这是系列可长期复用的关键。
7.5 第三方收录与衍生工具
- openmedlab/Awesome-Medical-Dataset:
- 收录 CrossMoDA 2023(含文件结构文档);
- 但部分描述混入 2021/2022 口径(其"N=105/N=105/testing 137"是 2021 版数字、引用的是 2021 届论文);
- 第三方资料的时间戳要看清。
- AMID(Awesome Medical Imaging Datasets):
- Python 库内置 CrossMoDA 类;
- 截至查证仍指向 Zenodo 6504722 的 2021/2022 合并包(len(ds.ids)=484);
- 2023 版收录情况待核。
- MedICL-VU/crossmoda2023:
- 冠军代码库;
- 含 synthesis(可条件生成站点风格的 3D 翻译网络 + 预训练模型 + playground)与 segmentation(nnU-Net v2 定制 trainer + 结构强度增广)两个子模块;
- README 承诺"用任意站点码玩未见风格"。
- aaronkujawa/defacing_pipeline:
- MC-RC 去脸管线开源;
- 可复用于其他头颅数据集的去标识。
- 下游研究:
- VS 的 T2-only 自动分割已有多篇后续工作以 crossMoDA 系列为基准;
- 系列宣言 “more cost-effective VS management” 的转化路径正在被下游论文兑现;
- MC-RC 训练数据提升鲁棒性的结论(Kujawa 2024:SC-GK 模型在常规数据上显著欠性能,反向亦然)为"训练分布决定部署上限"提供了又一条实证。
§8 方法学启示:四条可迁移的经验
8.1 异质性应该做进考题,而不是被清洗掉
三届数据演化的核心教训:把协议差异当噪声清洗(harmonization)会越洗越弱,当多样性喂给模型反而更强。
证据链有三节:
- 回顾论文的离群分析(数据越杂、离群越少);
- 冠军跨届回溯(2023 冠军在旧考卷上 88.61/88.00 双双超越当年冠军);
- 冠军方案本身(生成站点风格而非抹平——“generate styles, don’t harmonize”)。
§7.5 提到的 Kujawa 2024 是同一结论的受控版:
- SC-GK 受控数据训练的模型在常规临床数据上显著欠性能;
- 反向亦然——常规数据训练的模型到受控环境同样掉链子。
这对一切"多中心数据集如何建"的问题是范式级提示:建库时保留甚至强化协议异质性(不同厂商、不同场强、不同层厚),比强行统一采集更有长期价值。
KCL 团队用三届时间把这句话做成了公开基准。
对具体建库操作的翻译:
- 采购/汇采数据时按站点保留原始参数,不要重采样统一;
- 文件名或元数据里显式记录站点/厂商/场强(crossMoDA 的文件名前缀即范例);
- 评测时按站点分层报告,让异质性可见而非隐藏。
8.2 标注经济性的不对称是跨模态 UDA 的第一性约束
整个系列的立项基础是一个经济学事实:
- ceT1+造影剂与 hrT2 的成本/风险差约十倍;
- 标注长在贵的一侧(ceT1 已有临床刚需、肿瘤边界清晰易标);
- 推理部署在安全的一侧(hrT2 无造影剂风险、随访便宜)。
跨模态 UDA 的本质是"把标注资产从贵模态搬运到便宜模态"。
这个框架可以直接移植:
- 做其他跨模态移植(CT→MRI、PET→CT、增强→平片)之前,先算清两侧的临床成本/风险不对称;
- 不对称越大,UDA 的转化价值越高;
- 两侧成本相同(如 T1 vs T2 都便宜)时,直接双模态采集可能比域适应便宜。
一句话判定式:先问"标注为什么在那一侧、部署为什么在这一侧"——答案能讲清临床经济学,这个 UDA 任务就值得做;讲不清,就只是技术练习。
8.3 任务取舍要跟着参与度走,解剖细分是分类任务的高质量替代
Koos 分类任务两届就退场(3 队参与):
- 一个只有个位数参赛者的排行榜没有统计意义;
- 排名的 bootstrap 检验也无从做起。
组织者的替代方案不是硬撑,而是把分类任务的"临床信息量"折叠回分割任务:
- Koos 分级本质是肿瘤大小与压迫范围的手工概括;
- 瘤内/瘤外亚分割给出的是连续、像素级的同一信息源。
当分类任务参与度不足时,把标签体系降维成更细的分割是更可持续的路线——分割标签永远可以再聚合成分级,反之不行。
这个"细分-聚合"的单向性适用于一切医学分级任务(Gleason、Koos、Bi-RADS):
- 像素/腺体级标注是分级标签的超集;
- 投资前者是买看涨期权;
- 投资后者是把信息瓶颈焊死在当年的分级标准上。
8.4 挑战赛运维的平台选择是数据资产的放大器
grand-challenge.org → Synapse 的迁移展示了挑战赛基础设施的两个代际:
- GC 时代:“数据自托管(Zenodo)+榜单外包”;
- Synapse 时代:“数据+榜单+工作流一体”。
一体化的代价与收益:
- 代价:注册门槛与检索弱化(无 DOI、子站 404、第三方资料断链——openmedlab 混写口径、AMID 未收录即症状);
- 收益:运维成本骤降与数据版本可控。
库内其他挑战赛条目(brats、instance2022、wmh-challenge、autoimplant)分别停在不同代际——比较它们的可获取性时,平台代际是比年份更本质的变量。
给数据集建设者的推论:数据资产的"AI-Ready 度"不只取决于数据本身,还取决于分发基础设施的代际——选平台时要同时算检索生态的账。
8.5 小结构是任务复杂化的第一受害者(与缓解)
2023 届最清醒的一笔是保留了一个"负结果"并诚实归因:
- 任务从 2 类升 3 类后,耳蜗 DSC 跨届走低;
- 且所有测试集上一致(伦敦/蒂尔堡/MC-RC 无一幸免)。
对小结构研究者,这提供了两条缓解路线的实证:
- 把小结构从"多类联训"里拆出来单独训练(代价是失去类别间的互相约束);
- 像 superpoly 那样在小结构上做条件化增广(它拿了耳蜗单项王)。
给任务设计者的启示:增加类别不是免费的,类别间的优化预算互相挤占。
若临床终点里有不可牺牲的小结构:
- 要么单列任务;
- 要么为它设计专门的增广与损失。
耳蜗在这份考卷里的角色,类似于自然图像基准里的小目标类别——它是模型容量与优化预算分配的敏感探针。
7.6 VS 临床管理语境:这个系列为什么值得持续做
把 crossMoDA 放回临床流水线,才能看懂它的任务设计为什么这样取舍。
VS 的管理决策分三档:小肿瘤随访观察、中型肿瘤放射外科(伽马刀)、大肿瘤或压迫脑干者开颅手术。三档决策的影像需求各不相同:
- 随访:需要体积变化的准确测量——对应"分割准",且希望不打药(MC-RC 子集与 hrT2 目标域服务的正是这一档);
- 放射外科规划:需要肿瘤+耳蜗+脑干的精密轮廓——对应"边界准"(ASSD 与耳蜗 DSC 的临床意义所在);
- 手术规划:需要瘤内/瘤外区分与面神经位置——瘤内外亚分割的报告学依据正在于此。
2023 届把三档需求全部折叠进一个分割任务(瘤内/瘤外细分=手术侧、耳蜗=放疗侧、hrT2=随访侧),再用 10 站常规数据模拟"真实施工环境"——任务设计的每个细节都能回溯到一条临床需求。
这也解释了系列的临床共建信号:BANA(听神经瘤患者组织)赞助奖项、KCH 耳神经外科团队直接供数与标注——这不是一个纯算法游戏,而是一条"患者组织-临床科室-计算实验室"三方共创的管线。
对库内其他"临床导向数据集"条目的写作者,这个三方结构(谁出数、谁标注、谁赞助)是值得复用的检查维度。
§9 与库内条目的关系
9.1 家族图谱
- crossmoda2022(647)——直系前作,第一互链:
- 同一系列的 2022 届条目,与本条目构成"连续剧"关系。
- 两届共享 ceT1→hrT2 的任务骨架、CC BY-NC-SA 4.0 的许可与 KCL-ETZ 的组织班底。
- 2023 在其上叠加 MC-RC 异质数据、瘤内/瘤外亚分割与 Synapse 平台迁移,并剔除伦敦 70 例术后扫描。
- 读法建议:先读 647 了解"翻译+分割"两段式与 rank score 机制的原始语境,再读本条目看异质性如何改写结果格局。
- 两届冠军方案(北大 PAST 的"像素对齐+自训练" vs Vanderbilt 的"条件风格生成")的对照是域适应方法演进的两年切片。
- 数据层面两届是"同一地基的两套考卷":Zenodo 6504722(2021/2022)与 Synapse syn51236108(2023)互为补充渠道。
- 做跨届对比实验时,务必回到各自届次的原始数据(见坑 5)——2023 版里已经没有术后扫描。
- brats(24)——同卷 proceedings 的邻居:
- BraTS 2023 与 crossMoDA 2023 合刊于 Springer LNCS 14669。
- 编辑班底(Dorent、Wijethilake、Bakas)高度重合。
- BraTS 是脑肿瘤分割挑战赛的旗舰,两者在 rank score 排名设计上互相借鉴(crossMoDA 明言参照 BraTS/ISLES)。
- 差异同样有教益:BraTS 考多参数 MRI 的病灶群体,crossMoDA 考单模态对的跨模态迁移。
- 一个横向铺"模态数",一个纵向钻"域差"——合读可拼出"医学影像挑战赛的任务光谱"。
- fastmri(23)——MRI 数据域的另一极:
- fastMRI 是 MRI 重建(k 空间→图像),crossMoDA 是 MRI 分割(图像→掩码)。
- fastMRI 的挑战是采样欠定,crossMoDA 的挑战是域偏移。
- 两者合读可覆盖"MRI 深度学习"的两条主线。
- fastMRI 的多中心协采模式(NYU+外部厂商)也与 crossMoDA 的多站点汇采构成数据工程对照。
- duke-breast-mri(440):
- 同为 MRI 分割条目。
- 乳腺 DCE-MRI 的单中心大样本与 crossMoDA 的多中心小结构形成"规模 vs 精度"光谱的两端。
- Duke 数据的增强扫描属性也与 crossMoDA"逃离增强扫描"的动机互为注脚。
- wmh-challenge(501):
- MICCAI 系脑白质高信号分割挑战赛,同用多中心 MRI 考验泛化。
- 其 FLAIR 域内多站点偏移与 crossMoDA 的跨模态偏移互为镜像。
- WMH 证明"域内多站点也够难",crossMoDA 证明"跨模态+多站点是难度的平方"。
- instance2022(645):
- MICCAI 挑战赛条目范式参考(条目结构、漏斗统计、获奖拆解的写法模板)。
- 其实例分割任务形态与 crossMoDA 的语义分割任务形态互补。
- autoimplant(472):
- 同为"临床手术规划导向"的 MICCAI 挑战赛。
- 颅底重建(补骨)与 VS 分割(保听力)分属临床流水线的不同环节。
- 两者都把"手术规划的真实需求"直接翻译成了任务定义——临床需求驱动任务设计的同款方法论。
- totalsegmentator(422):
- 大规模 CT 全身分割的反衬面。
- 百例级粗粒度批量分割 vs 千例级以内精细小结构分割。
- 规模与精度不可兼得时的两种取舍。
- 小结构(耳蜗)在小数据集上的精标策略与全身大结构的大数据策略是两套完整的成本模型。
- ixi-brain(482):
- 公开健康脑 MRI,无肿瘤无标注负担。
- 适合做"健康域→病变域"的预训练-微调实验的起点,与 crossMoDA 的病变域考卷互补。
- 其多站点(三家伦敦医院)采集也是"健康数据同样有域差"的提醒。
9.2 检索路径建议
按研究问题推荐三条路径。
路径一:跨模态域适应
- crossmoda2022(647)——两段式 baseline 与 rank score 的原始语境;
- 本条目——异质协议如何改写结果格局;
- brats(24)——看 rank score 排名方案的另一个实现;
- wmh-challenge(501)——域内多站点偏移的对照组。
路径二:VS 临床自动化
- 本条目 §5——三队列测试集上的性能天花板;
- autoimplant(472)——手术规划侧的邻接环节;
- ixi-brain(482)——健康解剖先验的起点数据。
路径三:挑战赛设计
- 本条目 §4/§8——评估设计与运维教训;
- instance2022(645)——漏斗统计与获奖拆解的模板;
- brats(24)——旗舰级挑战赛的运营形态;
- fastmri(23)——非 MICCAI 系的规模对手。
9.3 在库内"域适应/多中心"光谱上的位置
库内以"域偏移/多中心"为核心卖点的条目不多:
- crossmoda2022 与本条目是唯二的"跨模态"条目;
- wmh-challenge 是"域内多中心"代表;
- ixi-brain 提供"健康多中心"背景板。
本条目的独特生态位是跨模态 × 多站点 × 无标注目标域的三重叠加。
在"AI-Ready 光谱"上:
- 它的可获取性(Synapse 注册制、测试集私有)不是最亮的一档;
- 但它的"任务-数据-评估"一体化设计(文件名即域标签、rank score 防平均主义、私有测试集防污染)是库内最完整的挑战赛工程样本。
一句话定位:拿数据不如 2022 版方便,拿"考题设计"则是库内天花板。
9.4 常见误用场景与库内纠正
| 误用场景 | 错误做法 | 库内纠正 |
|---|---|---|
| 想做"肿瘤分级"研究 | 在 2023 版上找 Koos 标签 | 2023 无 Koos——回 crossmoda2022(647) 或 2022 版数据 |
| 想刷 crossMoDA 榜单 | 下载"crossMoDA zenodo 10685265" | 记录无关(坑 1)——正确渠道 Synapse syn51236108 |
| 想做多中心鲁棒性实验 | 按 CT 全身分割套路(totalsegmentator 422)统一 spacing 批处理 | crossMoDA 需逐例读头——MC-RC 层厚跨约 1-5 mm |
| 想做配对模态实验 | 假设 ceT1-hrT2 成对 | 两域不同患者(unpaired)——这是任务前提不是数据缺陷 |
| 想做纵向随访一致性 | 按扫描随机切分交叉验证 | MC-RC 同患者多扫描——必须按患者切分(§2.8) |
§10 避坑清单:十个已踩过的坑
坑 1:Zenodo DOI 讹传——10685265 是一条无关记录。
- 网传 crossMoDA 2023 的 Zenodo DOI 10.5281/zenodo.10685265,直接抓取实为 2007 年的 OPeNDAP 教程幻灯片(Fox, Peter, NSF NCAR,“OPeNDAP BOM Tutorial Introduction”)。
- 2023 版数据的唯一官方渠道是 Synapse(syn51236108)。
- Zenodo 6504722 是 2021/2022 版。
- 没有证据表明 2023 版有任何 Zenodo 记录。
- 检索时若见"crossMoDA 2023 zenodo"字样,一律回溯到回顾论文 §2.4.1 的原文表述核验。
- 写论文引用数据时,引用 URL 应为 Synapse 空间地址而非任何 Zenodo DOI。
坑 2:方向别写反——是 ceT1→hrT2,不是 T1→增强 T1。
- 任务方向是"从有标注的增强 T1(源域)到无标注的高分辨率 T2(目标域)"。
- 部分二手资料(含本条目的任务简报初稿)写成 “Kontrastless T1→CE T1”(方向颠倒)。
- 后果严重:源域/目标域颠倒会让"标注在哪个模态"与"推理在哪个模态"全部搞反。
- 域适应的数学设定(源有标签、目标无标签)随之崩坏。
- 照着错误方向做实验,你会发现"目标域标注"根本不存在。
- 记忆锚点:标注长在打了药的模态上,模型服务的是不打药的模态。
- 检验口诀:ceT1 有 Label 文件(
_Label.nii.gz),hrT2 没有——文件系统就是方向说明书。
坑 3:rank score 正文与表格打架——2.3 vs 2.2。
- 回顾论文正文写冠军 rank score 2.3、第二三名"同为 2.8"。
- Table 5 写 2.2、2.9、3.0。
- 名次叙述(尤其第二/第三名谁先)请以 Table 5 为准:ccc1018 2.9 第二、superpoly 3.0 第三。
- 同类陷阱:MC-RC 患者数 160(数据论文摘要)vs 165(回顾论文引用)双口径并存。
- 引用时注明口径,或干脆写"约 160 例(两源口径 160/165)"。
- 二手文献若写"冠军 rank score 2.3",那是正文口径,不是榜单口径。
坑 4:959/618/341 与 145/274 的口径迷宫。
- 959 = 全部扫描(含 341 私有测试)。
- 618 = 公开可下载上限。
- 145 = MC-RC 患者数、274 = MC-RC 扫描数(一人最多三次随访扫描,两数不同)。
- 做实验时写"用了 959 例"是错的——你最多用 618 例。
- 写"MC-RC 160 例患者"对 crossMoDA 而言也是错的——挑战赛只用了其中 145 例 274 扫描。
- 同理四象限:227(源)+295(目标)+96(验证)+341(测试)=959。
- 任何一个分项数字脱离象限名都没有意义。
坑 5:2023 数据不是"2022 加新站"——伦敦被剔了 70 例。
- London 379→309(源 -26、目标 -20、测试 -24,全为术后扫描)。
- Tilburg 376 原样。
- 跨届指标对比(如 2022 冠军 DSC 86.07 vs 2023 冠军 88.00 在"伦敦+蒂尔堡测试集"上)考的已不完全是同一张伦敦考卷。
- 例外:2021 单伦敦测试集不含术后,与 2023 的对比基本干净。
- 要复现 2022 届数字,请用 2022 版数据(Zenodo 6504722),不要用 2023 版。
- 两版文件编号体系也不同(2023 版按 etz/ldn/ukm 重编)。
坑 6:官网"术前+术后"文字是 2022 遗留。
- crossmoda-challenge.ml 的 Task 段至今写着训练集含术前与术后两个时点(“from both pre-operative and post-operative time points”)。
- 与回顾论文"2023 剔除术后扫描"直接矛盾。
- 以论文为准:2023 版全数据集无术后扫描。
- 官网页面未随版本更新是长期存在的文档债。
- 读取官网任何描述前先问"这是哪一届的文字"。
- 同一页面上还住着 2022 届的获奖榜(Task 1/Task 2 结构)与伦敦 0.4 mm 口径(坑 7)。
坑 7:伦敦 ceT1 分辨率两个口径——0.4 vs 0.47。
- 官网 Data 页写 0.4×0.4 mm。
- 回顾论文 v4 写 0.47×0.47 mm(2022 届已存照同款问题,官网是"当年数字"、论文是"复测口径")。
- 做重采样实验时以实际 NIfTI 头文件为准。
- 文献引用时注明口径出处。
- 冠军代码库的"中位分辨率 0.41×0.41×1 mm³"是第三个相关数字(全数据集中位,非伦敦专属)。
- 同理:官网 Timeline 上的 4-02/4-15 与 4-12/4-27 是改期痕迹,写时间线用实际日期。
坑 8:平台迁移与参与规模骤降——别强加因果。
- 2022 届 233 队注册(grand-challenge.org)→ 2023 届 26 队(Synapse)。
- 回顾论文只陈述不归因。
- "Synapse 注册门槛吓跑参赛者"是流行猜测但无论文依据。
- 赛题变难、系列疲劳、完赛定义收紧都可能贡献。
- 检索旧资料时注意:crossmoda2023.grand-challenge.org 已 404。
- 一切 2023 届的一手信息以 crossmoda-challenge.ml、Synapse 与回顾论文为准。
- 写综述引用参与数字时带平台名——"233 队(GC)/26 队(Synapse)"与裸数字"233→26"的信息量完全不同。
坑 9:Koos 分类与 2023 无关——别套用两任务框架。
- 官网 Winners 页的 “Task 1: Segmentation / Task 2: Koos Classification” 是 2022 届获奖榜结构。
- 2023 届只有一个分割任务。
- Koos 取消已成定局(回顾论文 §5.1 明文 “Due to the limited number of participants, this task was discontinued in the 2023 edition”)。
- 同理,2022 届提供的 GIF 脑区掩码在 2023 版资料中未见延续(其配套用途 Koos 分类已取消)。
- 2023 版的使用计划里别给 GIF 留位置。
- 做脑区先验实验要自备工具(如 FastSurfer/SynthSeg 等第三方方案,注意坑外的 license)。
坑 10:Springer 卷信息里的年份笔误与卷号混淆。
- LNCS 14669 页面副标题把会议日期误写为 “October 12 and 8, 2024”(实为 2023-10-08/12)。
- Springer 元数据也会有笔误,引用前用 dblp 交叉核对。
- 别把 14669 与同系列 BrainLes 主卷 14668 混淆。
- crossMoDA 2023 的方法短文(含冠军论文 pp.372-385)在 14669(BraTS+crossMoDA 联合卷)。
- 14668 是 BrainLes+SWITCH 主卷。
- 另有容易混淆的组:回顾论文 arXiv 2506.12006 与 2021 届论文 arXiv 2201.02831(官网指定的数据引用对象)是两篇不同论文。
- 引用"crossMoDA 论文"时务必分届。
§11 总结
11.1 三句话总结
- 第一句:crossMoDA 2023 把跨模态域适应基准从"受控考场"推进到"真实临床"——959 扫描、三队列、四厂商、三场强、瘤内/瘤外亚分割,是当前最贴近临床部署条件的无监督跨模态分割公开基准。
- 第二句:它的结果证明异质性是疫苗不是毒药——2023 冠军在 2021/2022 旧考卷上不降反升——也暴露了任务复杂化的代价:最小的结构(耳蜗)最先失分。
- 第三句:它的获取入口已从 Zenodo 迁往 Synapse,测试集永久私有,公开使用者的真实天花板是 618 例扫描与 CC BY-NC-SA 4.0 的非商业边界。
11.2 适合谁
- 做无监督/半监督跨模态域适应、图像翻译、自训练/伪标签、风格不变性研究的算法团队——618 例公开数据+私有测试集的防污染设计让复现与对比都有纪律。
- 开发 T2-only VS 随访、耳蜗剂量保护的临床工程团队——任务定义直接来自放射外科与随访的临床需求。
- 需要"异质协议"考题检验模型鲁棒性的评测研究者——MC-RC 子集的协议混乱是买不到的考卷。
- 把挑战赛当运维产品来设计的赛事组织者——rank score 聚合、每日一提交、Docker 复验、平台迁移决策都是可抄的作业。
11.3 不适合谁
- 需要术后扫描或 Koos 标注的研究——去用 2022 版 Zenodo 6504722。
- 需要商业部署许可的产品团队——NC 条款拦截,需联系组织方另行授权。
- 期望拿到测试集做离线刷榜的团队——341 例永远私有。
- 想要"开箱即统一协议"数据的使用者——协议混乱正是这份考卷的考点,拿到手的第一件事是逐例读头文件而不是跑模型。
- 预算里没有标注合规成本的商用项目——BY 条款要求的三路引用(Shapey 2021 / Dorent 2022 / Kujawa 2024)+ SA 条款的同款许可再发布,都是不可豁免的合规项。
11.4 延伸阅读与关键链接
- 回顾论文:arXiv:2506.12006(免费全文)|期刊版 Medical Image Analysis 114:104282(2026,doi:10.1016/j.media.2026.104282)
- 官网(2023 届内容):https://crossmoda-challenge.ml/
- 数据(Synapse):https://www.synapse.org/Synapse:syn51236108
- 冠军论文:arXiv:2311.12437|代码:https://github.com/MedICL-VU/crossmoda2023
- MC-RC 数据论文:doi:10.3389/fncom.2024.1365727(Front Comput Neurosci 18:1365727,CC BY)
- proceedings:Springer LNCS 14669,doi:10.1007/978-3-031-76163-8(BraTS 2023 + crossMoDA 2023 联合卷)
- 系列首届基准:arXiv:2201.02831(2021 届,官网指定数据引用)|TCIA 数据底座:doi:10.7937/TCIA.9YTJ-5Q73
- 参赛技术报告样例:HUST_CBIB arXiv:2311.11578(验证集口径数字对标)
- 库内相关条目:crossmoda2022(直系前作)、brats(同卷 proceedings)、fastmri、duke-breast-mri、wmh-challenge、instance2022、autoimplant、totalsegmentator、ixi-brain(见 §9)
附录 A:数据集卡(一页纸摘要)
| 字段 | 内容 |
|---|---|
| 正式名称 | crossMoDA 2023(Cross-Modality Domain Adaptation for Medical Image Segmentation challenge, 2023 edition) |
| url_name | crossmoda-2023 |
| 类型 | 挑战赛+基准数据集(三合一:赛事/数据/UDA 协议) |
| 届次 | 系列第三届(MICCAI 2023 卫星赛,温哥华 2023-10-08~12) |
| 论文 | 回顾论文 arXiv:2506.12006 / MedIA 114:104282(2026-11);数据底座 Shapey 2021(TCIA)+ Kujawa 2024(MC-RC);冠军 arXiv:2311.12437 |
| 团队 | King’s College London(牵头)+ ETZ Tilburg + King’s College Hospital + 哈佛(Dorent)+ 10 个英国 MC-RC 站点 |
| 任务 | 唯一任务:hrT2 上瘤内 VS/瘤外 VS/双侧耳蜗 3 类分割(ceT1→hrT2,unpaired,无监督) |
| 规模 | 959 扫描全口径(公开 618 = 源 227 + 目标 295 + 验证 96;测试 341 私有);MC-RC 274 扫描/145 患者 |
| 许可 | CC BY-NC-SA 4.0(训练+验证);测试集不发放;渠道 Synapse syn51236108(注册制) |
| 抓取时点 | 2026-09-27 |
| 覆盖届次 | 仅 2023 版(2021/2022 走 Zenodo 6504722,见库内 crossmoda2022 条目) |
| 参与规模 | 26 队注册(Synapse);13 队验证榜(7 国);6 队(5 国)完赛 |
| 评估协议 | DSC+ASSD × 3 区域,rank score(案例级名次聚合);分界面 ASSD 仅参考 |
| 冠军 | vandy365(rank score 2.2):3D QS-Attn 条件风格生成 + nnU-Net v2 + 自训练 + 11 模型 ensemble |
| 库内互链 | crossmoda2022(647)/brats(24)/fastmri(23)/duke-breast-mri(440)/wmh-challenge(501)/instance2022(645)/autoimplant(472)/totalsegmentator(422)/ixi-brain(482) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 官网+回顾论文+Synapse 三入口可索引;小风险:Zenodo DOI 讹传(坑 1)、GC 子站 404(坑 8)、官网混届文字(坑 6) |
| A 可获取性 | 6 | Synapse 注册制(对比 2022 的 Zenodo 免注册是退步);测试集 341 例永久私有;NC 条款限制商用 |
| I 可互操作 | 8 | NIfTI(nii.gz)标准格式,进 nnU-Net/MONAI 管线零摩擦;文件名内嵌站点前缀即域标签;扣分:无机器可读元数据卡、无 OAI-PMH |
| M 元数据质量 | 8 | 回顾论文 Table 1/3/5/7/8 全量数字+标注协议+序列参数;扣分:rank score 正文/表格双口径(坑 3)、MC-RC 患者数双口径(坑 4)、伦敦分辨率双口径(坑 7) |
| S 可持续性 | 8 | 系列三届持续举办+期刊回顾论文沉淀+冠军代码开源;扣分:挑战赛已闭幕(榜单冻结)、2023 渠道无 DOI 永久句柄 |
| 综合评级 | 7.6/10(良) | 任务-数据-评估一体化设计库内最完整的挑战赛工程样本;短板在分发基础设施代际(Synapse 注册制 vs Zenodo 直链)与测试集封闭 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/互证 |
|---|---|---|
| 959 = 274+309+376;四象限 227/295/96/341 | 回顾论文 Table 1 | arXiv:2506.12006v4(HTML 全文解析,2026-09-27) |
| 伦敦剔除术后 70 例 | 回顾论文 §2.2.1 明文 | arXiv:2506.12006v4 |
| MC-RC 160/145/274 | Kujawa 2024 摘要 × Table 1 × 回顾论文 §2.2.1(165 口径) | doi:10.3389/fncom.2024.1365727 + arXiv:2506.12006v4(三源,坑 4) |
| MC-RC 四厂商三场强 | 官网 Data 页 × Kujawa 2024 | crossmoda-challenge.ml + Frontiers |
| 时间线(04-15 发布/07-20 终评/10-08 颁奖) | 官网 Timeline × 回顾论文 §2.5 | 双源互证(改期痕迹坑 7) |
| Synapse syn51236108 | 回顾论文脚注 × openmedlab × MedICL-VU README | 三源互证(坑 1) |
| Zenodo 10685265 无关 | Zenodo 记录直接抓取 | zenodo.org/records/10685265(OPeNDAP 教程) |
| 6 队排名全表 | 回顾论文 Table 5 | arXiv:2506.12006v4(正文口径 2.3/2.8/2.8 存照,坑 3) |
| rank score 聚合规则 | 回顾论文 §4.1 × 官网 Evaluation 页 | 双源 |
| 冠军方法与作者 | 回顾论文 §4.3 × arXiv:2311.12437 × MedICL-VU README(BibTeX) | 三源 |
| LNCS 14669 pp.372-385 | Springer 书页 × dblp × 冠军 BibTeX | 三源(日期笔误坑 10) |
| Koos 取消 | 回顾论文 §5.1 明文 | arXiv:2506.12006v4 |
| 跨届冠军回溯数字 | 回顾论文 Winners across editions 表 | arXiv:2506.12006v4 |
附录 D:数据获取决策树
你要什么?
├─ 训练+验证数据(618 例)
│ ├─ 学术使用 → Synapse syn51236108 注册下载(CC BY-NC-SA 4.0)
│ │ ├─ 引用三件套:Dorent 2022(arXiv:2201.02831)+ Shapey 2021(TCIA)+ Kujawa 2024(若用 MC-RC 子集)
│ │ └─ 逐例读头文件(MC-RC 层厚/场强各异,勿批量假设)
│ └─ 商业使用 → 不可行(NC 条款),联系组织方另行授权(rdorent@bwh.harvard.edu)
├─ 测试集(341 例)→ 不公开,仅 Docker 提交服务器评估(挑战赛已闭幕,榜单冻结)
├─ 术后扫描 / Koos 标签 / GIF 掩码 → 2023 版均无 → 回 2022 版(Zenodo 6504722)
├─ 更大 MC-RC 样本(整瘤标注)→ Kujawa 2024 原始库(160 患者 487 扫描,CC BY)
└─ 冠军模型/合成器 → GitHub MedICL-VU/crossmoda2023(含预训练与 playground)
附录 E:序列参数速查(重采样与预处理用)
| 场景 | 建议 |
|---|---|
| 混合三源训练 | 按 spacing 分组重采样;勿假设统一分辨率(0.4/0.47/0.5/0.8 mm 层内并存 + MC-RC 各异) |
| 复现冠军预处理 | 重采样到全数据集中位 0.41×0.41×1 mm³;按耳蜗位置裁 256×144×32 子体积 |
| 只用伦敦数据 | 层内 0.4 或 0.47(口径存照)、层厚 1.0-1.5 mm;ceT1 MP-RAGE / hrT2 CISS-FIESTA |
| 只用蒂尔堡数据 | ceT1 0.8 mm 层内 1.5 mm 层厚;hrT2 0.4 mm 层内 1.0 mm 层厚——分辨率跨度大 |
| 含 MC-RC 子集 | 逐例读头;场强 1.0/1.5/3.0T 并存,强度分布不可直接混合 |
| 报告分辨率 | 注明口径出处(官网 0.4 / 回顾论文 0.47,坑 7) |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- brats — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 脑肿瘤
- brats-pediatric — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 脑肿瘤
- brats-africa — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- rembrandt — 共享标签:医学影像 / MRI / 脑肿瘤
- promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- crossmoda2022 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- aims-tbi — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- lisa2025 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

