crossMoDA 2022 (crossmoda2022) — AI-Ready Wikipedia

无监督跨模态域适应分割挑战赛:755 例前庭神经鞘瘤 MRI(ceT1 有标注源域→hrT2 无标注目标域),双任务 VS+耳蜗分割与 Koos 分级,12 队 rank score 排名,CC BY-NC-SA 4.0

来源 King's College London/King's College Hospital(伦敦 379 例)+ Elisabeth-TweeSteden Hospital 蒂尔堡(376 例)前庭神经鞘瘤 MRI:训练源 210 ceT1(VS+耳蜗标注+GIF 掩码)、训练目标 210 hrT2(无标注)、验证 64 hrT2、测试 271 hrT2(不公开)发布时间: 2026-09-26最后更新: 2026-09-26 阅读 20
crossMoDA 2022 (crossmoda2022) — AI-Ready Wikipedia

信息速览

数据集名称crossMoDA 2022 (crossmoda2022) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模2022 版全口径 755 例 MRI(训练源 210 ceT1 + 训练目标 210 hrT2 + 验证 64 hrT2 + 封闭测试 271 hrT2);Zenodo 公开可下载 484 例(21
接入方式King's College London/King's College Hospital(伦敦 379 例)+ Elisabeth-TweeSteden Hospital 蒂尔堡(376 例)前庭神经鞘瘤 MRI:训练源 210 ceT1(VS+耳蜗标注+GIF 掩码)、训练目标 210 hrT2(无标注)、验证 64 hrT2、测试 271 hrT2(不公开)
AI 就绪度

INFOBOX — crossMoDA 2022 一屏速览

维度 内容
本质 无监督跨模态域适应(ceT1→hrT2)分割挑战赛 + 基准数据集(MICCAI 2022 卫星赛事,系列第二届)
名字 crossMoDA = Cross-Modality Domain Adaptation(跨模态域适应)
团队 King’s College London(KCL)牵头 + 荷兰 Elisabeth-TweeSteden Hospital(ETZ)蒂尔堡;核心组织者 Wijethilake / Dorent / Vercauteren / Shapey
论文 官方回顾论文 arXiv:2506.12006(42 位作者),期刊版 Medical Image Analysis Vol.114:104282(2026-11);首届 benchmark 论文 arXiv:2201.02831
数据 2022 版全口径 755 例 = 训练源 210 ceT1 + 训练目标 210 hrT2 + 验证 64 + 封闭测试 271(伦敦 379 + 蒂尔堡 376)
公开部分 Zenodo 6504722 免注册下载 484 例(210+210+64,约 9.0 GB,training.zip 7.8GB);测试集仅服务器端评估
双任务 Task 1 = VS+耳蜗分割(12 队完赛);Task 2 = Koos 1-4 分级分类(3 队完赛;2022 新增、2023 取消)
评估 Task 1 = DSC+ASSD 按「病例×结构×指标」排名取均值(rank score,越低越好);Task 2 = MA-MAE(宏平均绝对误差)
冠军 Task 1 = ne2e(北京大学,rank score 3.0,NiceGAN 翻译+自训练);Task 2 = SJTU_EIEE_2-426Lab(上海交大,MA-MAE 0.26)
人类基准 Koos 分级 intra-rater variability 0.11——分类冠军 0.26 尚未达到人类自身重测一致性
方法共性 12 支分割队伍全部采用 image-to-image translation(CycleGAN 及变体)+ nnUNet/U-Net 系分割器
参与 233 队(35 国)注册 → 27 队提交验证榜 → 12 队(8 国)完赛分割;分类 3 队完赛
License CC BY-NC-SA 4.0(署名-非商业性使用-相同方式共享),Zenodo 无需注册/申请
身份指纹 脑/内耳、MRI、不成对双模态、域适应——出现 CT、配对数据、以分类为主任何一个词,说的都是别家数据集
库内互链 brats(24)、instance2022(645)、wmh-challenge(501)、autoimplant(472)、fdtooth(609)、totalsegmentator(422)、fastmri(23)、ixi-brain(482)
序列事件 2022-05-01 Zenodo 发布 → 2022-08-15 Docker 截止 → 2022-09 MICCAI 2022 期间发榜 → 2023 第三届取消分类任务

crossMoDA 2022 是一场"把标注留在模态 A、把考试安排在模态 B"的挑战赛:训练集里增强 T1(ceT1)带有人工分割的肿瘤与耳蜗掩码,而考卷却是高分辨率 T2(hrT2)——两者之间没有一例配对数据。算法必须先跨越 ceT1 与 hrT2 之间的模态鸿沟(外观、对比度、伪影形态完全不同),再在目标模态上完成前庭神经鞘瘤(VS)与耳蜗的体素级分割;这是医学影像领域第一个把无监督跨模态域适应作为正式赛道并持续多届的系列挑战赛的第二届。它同时开辟了第二个赛道——Koos 分级(1-4 级)分类,把"分割出来之后临床上怎么用"(选随访、放射外科还是开颅)也变成了考题。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——Zenodo 6504722 免注册下载,CC BY-NC-SA 4.0 意味着商业使用被禁止;注意 755 与 484 两个规模数字的口径差(坑 4)。
  2. 关心排名怎么算:直奔 §4——rank score「按病例×结构×指标排名取均值」的方案与 DSC/ASSD 双指标的设计动机;分类赛道用 MA-MAE。
  3. 要训练模型:直奔 §5 方法谱系——12 支队伍全部走"图像翻译+分割"两段式,没有一队例外;这对判断该范式的饱和度非常有信息量。

§0 导读:这个数据集解决什么问题

前庭神经鞘瘤(vestibular schwannoma, VS)是桥小脑角区最常见的良性肿瘤,临床决策链的第一环是 MRI:增强 T1(ceT1)看肿瘤边界最清楚,是分割与测量的金标准模态;高分辨率 T2(hrT2,稳态进动序列)则对内耳精细结构(耳蜗、半规管、面听神经束)最敏感,是保留听力的放射外科与手术规划的眼睛。问题在于临床上模态的"标注经济性"极不均衡:ceT1 需要注射钆对比剂,影像科医生习惯在其上勾画肿瘤;而 hrT2 无创、随访友好,但几乎没有现成的标注。更现实的约束是:对比剂累积暴露促使越来越多随访方案转向以 hrT2 为主的无创序列——标注留在旧模态、临床迁往新模态,这就是 crossMoDA 立题的真实临床张力。

直接把 ceT1 上训练好的分割器搬到 hrT2 上会失效:两个模态的强度分布、组织对比、噪声与伪影形态差异巨大,属于典型的跨模态域偏移(cross-modality domain shift)。传统的监督学习救不了——hrT2 上没有标注(重新标注一批 hrT2 又贵又慢,且耳蜗这种毫米级结构的专业标注成本极高)。于是唯一现实的路径是无监督域适应(unsupervised domain adaptation):让模型在不成对的「有标注 ceT1 + 无标注 hrT2」上学出可在 hrT2 上工作的分割器。到 2022 年,UDA 文献已经历两代演化:第一代以对抗对齐为代表(在像素或特征层面拉近两域分布),第二代把图像级、特征级适应与自训练(self-training,用目标域伪标签迭代精化)结合起来,一致性正则与 mean-teacher 框架则用于稳定伪标签学习。学术社区不缺方法,缺的是一个统一的、临床动机清晰、排名规则透明的 benchmark——论文里"提点"式的自我比较无法沉淀为可比结论,而 UDA 论文的可复现性问题在医学影像方向尤其突出。crossMoDA 把这个缺口做成了正式比赛:它是该方向第一个连续举办、任务定义与评估方案赛前公布的系列赛事。

crossMoDA 2022 的回答分四层。第一层是数据:把伦敦 King’s College London/King’s College Hospital(Gamma Knife 立体定向放射外科流程)与荷兰 ETZ 蒂尔堡两个中心的 755 例 VS MRI 按四象限切分——训练源 210 例 ceT1(带 VS+耳蜗标注与 GIF 脑区掩码)、训练目标 210 例 hrT2(无标注)、验证 64 例 hrT2、封闭测试 271 例 hrT2;两中心设备(Siemens Avanto 1.5T vs Philips Ingenia 1.5T)与序列参数不同,天然引入机构异质性。第二层是任务设计:Task 1 考跨模态分割,Task 2(2022 新增)考 Koos 1-4 分级分类——后者直接把"肿瘤压迫脑干的程度"这一临床分级变成机器学习目标。第三层是评估方法学:不用单一平均 Dice,而是按「每个测试病例 × 每个结构 × 每个指标」分别排名再取均值(rank score,越低越好),配合 1000 次 bootstrap 的稳定性检验——这套方案后来成为该系列的固定遗产。第四层是发现:12 支完赛队伍无一例外全部采用「图像翻译(CycleGAN 系)+ 分割器(nnUNet/U-Net 系)」的两段式方案,方法收敛度罕见地高;而 Koos 分类冠军(MA-MAE 0.26)仍未达到人类标注员自身的重测一致性(0.11)——任务边界在哪里,benchmark 给出了定量回答。

在库内数据集谱系里,crossMoDA 2022 填补的是"神经影像 + MRI + 跨模态域适应"的交叉空位:brats(24) 占住多参数脑肿瘤分割但模态内变化为主,wmh-challenge(501) 占住白质高信号但为单模态多中心,fastmri(23) 占住 MRI 重建域,而"标注模态与目标模态系统性分离"的 UDA 基准此前是空白。它也是库内少数"方法论收敛可被完整观察"的条目——12 支队伍的方法清单构成了图像翻译范式在 2022 年成熟度的横断面样本(§5.2)。

这个数据集有三重身份,引用前先想清楚自己拿的是哪一个:作为临床数据集,它是 VS/内耳 MRI 方向最大的公开多中心标注资源之一(484 例公开,双机构、双任务标注);作为方法学 benchmark,它是无监督跨模态 UDA 的旗舰评测场(rank score 协议 + 三届可比的冠军回溯链);作为挑战赛工程范本,它的四象限划分、防泄漏规则、封闭测试与 bootstrap 验证是一套可整体复用的赛事设计模板。三重身份对应三类引用语境——论文里引"数据规模"用第一身份,引"方法排名"用第二身份,设计新赛事引用"协议"用第三身份;混用身份(如拿方法排名数字描述数据集规模价值)是最常见的引用错位。

§0 读法三则:

  1. 这个条目是"数据集+域适应 benchmark+临床任务定义"三合一:引用时先想清楚要的是哪一层——拿它当普通分割数据用(只用源域)会浪费其设计核心。
  2. 全文统计数字均出自官方回顾论文(arXiv:2506.12006,MedIA 期刊版 2026-11 刊出)、官网与 Zenodo 记录页;口径冲突处已在坑 2、坑 3、坑 4 存照。
  3. 检索时最大的坑是届次混淆:crossMoDA 系列每年一届,2021(单机构 105 对、仅分割)、2022(双机构 210 对+Koos 分类)、2023(新增 UK MC-RC 异质数据、瘤内/瘤外亚分割、取消分类)任务设置差异很大;本条目只覆盖 2022 版(数据经 Zenodo 6504722 与 2021 版共用下载通道,见坑 6)。

三行小结:脑/内耳、MRI、不成对双模态、域适应——四个关键词就是本数据集的身份指纹;配对翻译、CT、单模态分割,出现任何一个都是在说别的数据集。

§1 数据集速览:十问十答

Q1:crossMoDA 2022 这个名字怎么展开?
crossMoDA = Cross-Modality Domain Adaptation,跨模态域适应。全称 Cross-Modality Domain Adaptation for Medical Image Segmentation challenge, 2022 edition(跨模态域适应医学图像分割挑战赛 2022 版)。官方站点写作 crossMoDA challenge series,2022 版独立子站为 crossmoda2022.grand-challenge.org(注意与系列入口 crossmoda.grand-challenge.org 和总站 crossmoda-challenge.ml 是三个地址,坑 1)。它不是"跨模态配对翻译"数据集——恰恰相反,不成对(unpaired)是其设计核心。

Q2:数据从哪来?
两个临床中心。伦敦:King’s College London 与 King’s College Hospital NHS Foundation Trust 的 Gamma Knife 立体定向放射外科(SC-GK)流程,Siemens Avanto 1.5T 采集,共 379 例——其数据基线可追溯至 Shapey et al. 2021 在 TCIA 发布的开放 VS 数据集(DOI 10.7937/TCIA.9YTJ-5Q73);蒂尔堡:荷兰 Elisabeth-TweeSteden Hospital(ETZ),Philips Ingenia 1.5T 采集,共 376 例。主办方为 KCL(牵头)+ ETZ,核心组织团队包括 Navodini Wijethilake、Reuben Dorent、Tom Vercauteren、Jonathan Shapey 等;受 Wellcome Trust(203145Z/16/Z、203148/Z/16/Z)、EPSRC(NS/A000050/1、NS/A000049/1)与荷兰 ZonMw(10070012010006)资助。

Q3:图像规格是什么?
全部为 NIfTI 3D 体积,四套序列参数(§2.3 详表):伦敦 ceT1 = MP-RAGE(层内 0.47×0.47mm,层厚 1.0-1.5mm);伦敦 hrT2 = 3D CISS/FIESTA(0.5×0.5mm);蒂尔堡 ceT1 = 3D-FFE(0.8×0.8mm);蒂尔堡 hrT2 = 3D-TSE(0.4×0.4mm,层厚 1.0mm)。两中心 1.5T 设备、不同厂商、不同序列——机构异质性是刻意保留的。源域训练集另附 GIF(Geodesic Information Flows)自动脑区分割掩码(GIF.zip,191.7MB)与人口学信息表 infos_source_training.csv。

Q4:跨模态域适应为什么难,难在哪一层?
不是"风格迁移好看不好看"的问题,而是三层耦合的失败模式:其一,ceT1 与 hrT2 的强度分布无一一对应(ceT1 里亮的钆强化肿瘤在 hrT2 里是等/稍高信号的占位),逐像素监督信号不存在;其二,结构外观反转——耳蜗在 hrT2 里是高信号的淋巴液亮结构、在 ceT1 里相对不显眼,翻译模型学错方向会直接毁灭耳蜗分割;其三,病灶可变性——VS 肿瘤大小、位置、术后腔体变化远超健康解剖的变异范围。最终 12 支队伍全部用图像翻译做模态桥接再分割(§5.2),说明 2022 年社区共识是"两段式"而非端到端 UDA。值得注意的是三层困难的权重并不相等:分层评估(§5.1 读榜其五)显示肿瘤(可变结构)上的方差远大于耳蜗(恒定结构)——病灶可变性是主要矛盾,模态鸿沟是背景难度;这也是为什么冠军方案都把增强与自训练的火力集中在肿瘤外观的多样性上(§5.8 技术演化)。

Q5:标注是谁做的,可靠吗?
两套协议。分割(仅源域 ceT1):具有 3 年以上临床经验的 radiology fellows 用 ITK-SNAP 手动分割 VS 与耳蜗,耳蜗以 T2 为参考并统一包含 basal turn(含骨性螺旋板)与中心低信号 modiolus(回顾论文标注协议节);VS 标注协议延续 2021 版(TCIA 论文 Shapey et al. 2021 记录基线)。Koos 分级:两名 5-10 年经验的神经外科医生独立评定全部术前病例(伦敦 221 + 蒂尔堡 273),标注前接受统一 briefing(含 Erickson 描述的 Koos 系统与图像示例),ceT1 与 hrT2 同时提供,分歧由顾问级神经放射科医生+顾问级神经外科医生仲裁;分级者自身重测一致性(intra-rater variability)为 0.11(MA-MAE 口径,引 Kujawa et al. 2022)——这个数字后来成了机器的及格线参照(§5.3)。可靠性上要区分两句话:分割标注有协议与资质背书但未公布 inter-rater 系数(§6.5 给中评的原因);分级标注有重测锚点但 0.11 是个体内指标,不要误当一致性系数引用。

Q6:两个任务分别考什么?
Task 1(分割):在 hrT2 上自动分割 VS 肿瘤与耳蜗两个结构——注意考卷在 hrT2、标注在 ceT1,这就是域适应考题本身;数据含术前与术后病例。Task 2(Koos 分级分类,2022 新增):对含 VS 的术前 hrT2 自动评定 Koos 1-4 级——Koos 分级刻画肿瘤对脑干、小脑等邻近结构的压迫程度,是选择随访/放射外科/开颅方案的核心依据;仅限术前数据。每支队伍可任选一个或两个任务参赛;两个任务最终分别有 12 队与 3 队完赛。两个任务的难度结构完全不同:分割赛道的对手是"模态鸿沟×机构异质性",分类赛道的对手是"有序分级×类别不平衡×标注天花板低"——同一场比赛里藏着两类不同的科学问题,这也是它对方法学研究的价值密度所在。

Q7:规模到底是 755 还是 484?
都对,口径不同(坑 4)。755 = 2022 版全口径(训练源 210 + 训练目标 210 + 验证 64 + 封闭测试 271),含不公开的测试集,出处为回顾论文 Table 1(伦敦 379 + 蒂尔堡 376);484 = Zenodo 公开可下载部分(210+210+64),也是 AMID 等第三方 Python 库的计数口径(AMID 还把 2021/2022 两届合并到同一个 Zenodo 记录 6504722 下载)。写论文引用规模时必须先声明口径。

Q8:排名怎么算?
Task 1:DSC(Dice)+ ASSD(平均对称表面距离)双指标,按「每个测试病例 × 每个结构(VS/耳蜗)× 每个指标」分别排名,对每个病例取各指标排名的累积值,再对全部 271 个测试病例取均值得到 rank score——越低越好;排名方案赛前公布,并用 1000 次 bootstrap(每次 N=271,Kendall τ)验证排名稳定性;空预测(全背景)的 ASSD 记为测试集体素最大距离 350mm。Task 2:MA-MAE(宏平均绝对误差)——对 1-4 有序分级且类别不平衡的问题,宏平均让少数类(Koos 1 级)的权重与多数类相等(§4)。举个直观例子:一个队伍若在 100 例上全场第 1、在 171 例上全场第 12,其 rank score ≈ (100×1+171×12)/271 ≈ 7.9——比"稳定第 5 名"(5.0)差得多;这正是 rank score 惩罚"偏科+灾难失效"的直观展示。

Q9:冠军是谁,赢在哪里?
Task 1 分割赛道冠军 ne2e(北京大学,董彬/张立课题组):rank score 3.0,方法 PAST = Pixel Alignment + Self-Training,用 NiceGAN 做翻译;VS DSC 中位 86.1%、耳蜗 DSC 中位 87.6%(回顾论文 Table 5 口径;官方获奖榜口径 DSC 86.9,坑 3)。分层看更清楚:ne2e 的耳蜗 cumulative rank 中位 1.5(全场几乎恒定第 1-2 名),VS 为 3.5——它赢在"耳蜗近乎完美 + VS 无灾难",而非任何单项碾压(§5.1 读榜)。亚军 MAI(Korea University,3.4)、季军 LaTIM(Inserm,3.8)。Task 2 分类赛道冠军 SJTU_EIEE_2-426Lab(上海交通大学):MA-MAE 0.26,251 例测试中仅 7 例错两级、多数错误在 3↔4 级之间;但仍显著差于人类重测一致性 0.11。

Q10:怎么获取,能商用吗?
Zenodo 记录 6504722(DOI 10.5281/zenodo.6504722,2022-05-01 发布)直接下载,无需注册或申请:training.zip 7.8GB(md5 8d68fcd44eaee6b0a4371ce344e775cd)+ validation.zip 1.0GB(md5 1f0b2ac47d3d8b19e31d3b5bfa2f1e11)+ GIF.zip 191.7MB + infos_source_training.csv。License 为 CC BY-NC-SA 4.0——署名、非商业性使用、相同方式共享,商用被明确禁止。测试集 271 例不公开,只能通过 grand-challenge.org 提交 Docker 容器在服务器端评估。官方要求引用两篇论文:Shapey et al. 2021(TCIA)与 Dorent et al. 2022(首届 benchmark,arXiv:2201.02831)。

§2 数据构成与规格

2.1 四象限划分:755 例全景

crossMoDA 2022 的数据组织是一个清晰的四象限结构,全部数字出自官方回顾论文(arXiv:2506.12006)Table 1:

子集 模态 例数 伦敦 蒂尔堡 标注 分发
Training Source ceT1 210 105 105 VS+耳蜗人工掩码 + GIF 掩码 + Koos 标签(术前) Zenodo 公开
Training Target hrT2 210 105 105 无(无监督目标域) Zenodo 公开
Validation Target hrT2 64 32 32 无(验证榜用) Zenodo 公开
Testing Target hrT2 271 137 134 官方私有 不公开,仅服务器评估
合计 — 755 379 376 — 公开部分 484

三点结构性观察。第一,标注与数据"错层":全部人工分割标注只存在于源域 ceT1,目标域 hrT2 从训练到测试都无公开 GT——这是 UDA 考题的题面,不是数据缺陷。第二,两机构严格对半分:每个子集都是伦敦/蒂尔堡约 1:1(210=105+105,64=32+32),机构异质性被刻意控制为可比较的均衡设计。第三,测试集占比高达全口径的 35.9%(271/755)——组织者用一个大而封闭的测试集换取榜单的统计稳健性(bootstrap 检验即在其中进行,§4.4)。

Koos 分级标注覆盖全部术前病例:伦敦 221 例 + 蒂尔堡 273 例 = 494 例(回顾论文单源口径)。注意 494 是"病例数"而非"子集数"——分级对象是术前扫描,与四象限的分割子集划分是两个正交的维度;训练源 ceT1 中的术前病例携带 Koos 标签供 Task 2 使用。

2.2 两机构两设备:异质性是特性不是缺陷

伦敦数据出自 King’s College Hospital 的 Gamma Knife 立体定向放射外科(SC-GK)临床流程——每位接受放射外科的 VS 患者都会做定位 MRI,这保证了数据是"真实临床工作流"而非研究专采;设备为 Siemens Avanto 1.5T。蒂尔堡数据出自 ETZ 医院的同类受控采集,设备为 Philips Ingenia 1.5T。两中心的差异是全方位的:厂商(Siemens vs Philips)、序列族(MP-RAGE vs 3D-FFE;CISS/FIESTA vs 3D-TSE)、分辨率分布(见 2.3)、患者人群。回顾论文与官网均把这一点作为 2022 版相对 2021 版(仅伦敦单中心)的核心升级——单中心 benchmark 上的 UDA 方法排名,未必在多中心现实下成立,2022 版直接把这个问题做进了考题。"放射外科流程快照"的数据性质还要注意一点:数据以治疗决策时点为锚(术前为主、含术后随访时点),扫描时机由临床流程而非研究方案决定——这与 ixi-brain(482) 那类研究专采数据的"协议均匀性"形成对照,使用时按临床时点分层比按时间顺序分层更合理。

对使用者的直接含义:做域适应方法研究时,"机构"是一个比"模态"更细的分层变量——任何跨子集的实验设计都应报告按机构分层的结果;把 210 例源域当作同质集合用,会丢失这批数据最有价值的设计。

2.3 四套序列参数全表

以下参数出自回顾论文 v4 §2.2(数字以该文为准;2022 年参赛报告 mai.pdf 中伦敦 ceT1 写 0.4×0.4mm,与回顾论文 0.47×0.47mm 并存,坑 2):

机构 模态 序列 层内分辨率 (mm) 矩阵 层厚 (mm) TR/TE/TI (ms)
伦敦 (Siemens Avanto 1.5T) ceT1 MP-RAGE 0.47×0.47 512×512 1.0-1.5 TR 1900 / TE 2.97 / TI 1100
伦敦 (Siemens Avanto 1.5T) hrT2 3D CISS 或 FIESTA 0.5×0.5 384×384 或 448×448 1.0-1.5 TR 9.4 / TE 4.23
蒂尔堡 (Philips Ingenia 1.5T) ceT1 3D-FFE 0.8×0.8 256×256 1.5 TR 25 / TE 1.82
蒂尔堡 (Philips Ingenia 1.5T) hrT2 3D-TSE 0.4×0.4 512×512 1.0 TR 2700 / TE 160 / ETL 50

读表三则。其一,"hrT2 高分辨率"在两机构的实现完全不同:伦敦用稳态进动序列(CISS/FIESTA,脑脊液高信号、对内耳结构敏感),蒂尔堡用 3D-TSE——同为 hrT2,跨机构的外观差异不亚于跨模态差异,这是给 UDA 方法额外加的隐藏考题。其二,蒂尔堡 ceT1(0.8mm)分辨率显著低于伦敦 ceT1(0.47mm),源域内部本身就有分辨率鸿沟。其三,全部为 1.5T 设备——这不是 3T 数据集,对追求极限分辨率的方法要有合理预期。

这组序列差异的后果在结果里有官方背书:回顾论文对"排名靠后队伍 DSC 更低、ASSD 更高"的判语正是"凸显了多机构数据下跨模态域适应的挑战"(§5.3)——机构异质性不是背景噪音,而是 2022 版榜单分化(rank score 从 3.0 拉到 11.3)的主要解释变量之一。

2.4 Zenodo 文件清单与校验

Zenodo 记录 6504722(DOI 10.5281/zenodo.6504722,2022-05-01 发布)的文件构成:

文件 大小 MD5 内容
crossmoda2022_training.zip 7.8 GB 8d68fcd44eaee6b0a4371ce344e775cd 训练源 ceT1(含掩码)+ 训练目标 hrT2
crossmoda2022_validation.zip 1.0 GB 1f0b2ac47d3d8b19e31d3b5bfa2f1e11 验证目标 hrT2 64 例
training_source_GIF.zip 191.7 MB — 训练源 GIF 脑区分割掩码
infos_source_training.csv 11.7 kB — 训练源人口学/元数据表

合计约 9.0 GB。记录页累计下载 2.2K+ 次,累计数据流出约 17.5 TB——对一个单一任务方向的学术数据集,这是一个可观的下游使用量。下载前建议先核对 MD5(7.8GB 级文件传输损坏并不罕见),解压后按机构/子集目录组织。

下载校验操作(Linux 示例):

# 1. 下载后校验 MD5(官方记录页提供全部文件的 md5)
md5sum crossmoda2022_training.zip
# 期望输出: 8d68fcd44eaee6b0a4371ce344e775cd  crossmoda2022_training.zip
md5sum crossmoda2022_validation.zip
# 期望输出: 1f0b2ac47d3d8b19e31d3b5bfa2f1e11  crossmoda2022_validation.zip
# 2. 解压后抽查 NIfTI 头(spacing 与 §2.3 表核对,注意坑 2 的 0.47/0.4 双口径)
python3 -c "import nibabel as nib; img=nib.load('example_ceT1.nii.gz'); print(img.header.get_zooms())"

2.5 GIF 掩码与 csv:2022 版的"附赠基础设施"

2022 版为训练源域附带了两个容易被忽视的附属资产。GIF 脑区分割掩码(training_source_GIF.zip):用 Geodesic Information Flows 方法自动生成的全脑解剖分区掩码,官方明确说明两个任务均可使用——它给了参赛者(以及后来的使用者)一个免费的解剖先验:比如用脑区掩码把桥小脑角兴趣区裁出来,减少翻译与分割的搜索空间。infos_source_training.csv:训练源病例的元数据表(人口学信息),是做偏倚分析(年龄/性别与肿瘤大小、分级的关系)的入口。

这两份附属资产让 crossMoDA 的源域不只是一个"图像+肿瘤掩码"的分割数据集,而是一个可以做解剖上下文建模的多层标注资源——只用肿瘤掩码会浪费 GIF 层。顺着这个思路还有一层用法:GIF 掩码的脑区边界在 ceT1 与伪 T2 上是同一解剖实体,可以作为翻译前后的结构一致性检查器——若翻译后图像的脑区边界相对 GIF 参照发生系统性位移,即是翻译器形变解剖结构的直接证据(尾部队伍耳蜗 ASSD 16.44mm 的失效,理论上可以被这类检查提前拦截,§5.6)。

2.6 与 2021 版数据的共用通道:下载前必须知道的事

2021 首届(105 对 ceT1/hrT2,仅伦敦)与 2022 版数据共用同一个 Zenodo 记录 6504722 分发——AMID 等第三方库的 CrossMoDA 类即按此记录下载(其 len(ds.ids)=484 的口径也是把两届可用数据合并计数的结果)。这意味着两件事:其一,下载者拿到的包里可能同时包含两届数据(以目录/编号区分),做实验前先理清哪部分属于哪一届;其二,第三方库的"CrossMoDA 数据集"默认不是 2022 版全口径 755 例(测试集本来就不在任何公开渠道),也不是纯 2022 口径 484 例——引用规模时以官方 Table 1 为准并声明口径(坑 4)。

2023 版(第三届)另走独立发布渠道,含 UK MC-RC 165 例异质常规随访数据与瘤内/瘤外亚分割标注,任务设置变化大(取消 Koos 分类),不在本条目展开。

2.7 规模口径速查:755 / 484 / 494 / 251

四个高频数字的精确含义:

  • 755:2022 版全口径扫描总数(210+210+64+271),含不公开测试集(回顾论文 Table 1)。
  • 484:Zenodo 公开可下载部分(210+210+64),亦为 AMID 第三方口径(且混入 2021 版通道)。
  • 494:带 Koos 分级标签的术前病例数(伦敦 221 + 蒂尔堡 273),是 Task 2 的标注总量,与分割四象限正交。
  • 251:Koos 分类封闭测试例数(回顾论文 §5.1 单源,官网未列,坑 5)。

2.8 参与漏斗:从 233 队注册到 12 队完赛

回顾论文 §4.2 给出的 2022 版参与漏斗是评估"榜单代表性"的基础数据:

阶段 分割赛道(Task 1) 分类赛道(Task 2)
Grand Challenge 平台注册 233 队(35 个国家) 同左(注册不分赛道)
提交验证榜 27 队 —
进入评估阶段(Docker 提交测试) 12 队(8 个国家) 3 队(同时进入评估与测试)
获奖名次 3 名(ne2e/MAI/LaTIM) 3 名(SJTU/Super Polymerization/skjp)

两点解读。其一,漏斗收窄比约 19:1(注册→完赛):233 队注册中只有 27 队跑通验证榜、12 队完成 Docker 测试提交——UD 任务的工程门槛(训练图像翻译器+分割器+容器化)筛掉了大多数注册者,这与 INSTANCE2022 等"数据可得即可刷基线"的赛事漏斗形态不同。其二,国别覆盖广:12 支完赛队伍来自 8 个国家(中、韩、法、荷、英、阿联酋、日等),比 2021 版(16 队进入评估阶段,来自 9 国;55 队提交验证榜)在绝对数量上更少但机构异质性设计下的参与质量更高。作为对照,2021 版的漏斗是 55→16(验证榜→评估),2022 版 27→12——两届收窄比例相近(约 2:1 到 2.5:1 的验证→评估损耗),说明瓶颈不在注册热度而在完整参赛能力。

2.9 已知质量问题汇总(使用前检查单)

汇总本条目各处散见的质量边界,使用前逐条过一遍:

# 问题 影响 缓解
1 伦敦 ceT1 分辨率双官方口径(0.47/0.4) 重采样参数不确定 以 0.47 为准并声明(坑 2)
2 分割 inter-rater 系数未公布 源域标注质量的定量上限未知 按协议约定核对解剖边界(§3.6)
3 GIF 掩码为自动生成 不可作金标准 仅作先验/裁剪(§3.2)
4 目标域无公开分割 GT 跨模态效果本地不可直接验证 自划小规模人工标注集或服务器评估
5 人口学元数据仅覆盖训练源 公平性/亚组分析受限(§8.7) 限定结论范围
6 2021/2022 混合分发 子集构成混淆 与 Table 1 对账(坑 6)
7 Koos 1 级天然稀少 分级模型少数类性能不稳定 宏平均评估+分层报告(§3.4)
8 测试集封闭 终榜不可复现 自划测试集+复刻协议(§5.7)

这份清单的性质是"已知且官方或本条目存照的质量边界"——不是数据缺陷清单;其中 1、6、7 是设计选择的结果,4、8 是 UDA benchmark 的固有形态。

§3 标注协议:两套人工标注如何分工

3.1 分割标注:radiology fellows + ITK-SNAP + 统一解剖约定

源域 ceT1 的 VS 与耳蜗分割由具有 3 年以上普通放射学临床经验的 radiology fellows 手动完成,工具为 ITK-SNAP。协议里最有信息量的是耳蜗部分的解剖约定(回顾论文标注协议节):以 T2 序列为参考(耳蜗淋巴液在 T2 上高信号、边界最清楚——即"标注在 ceT1、参考 T2"的混合操作),统一包含 basal turn(底周,含骨性螺旋板)与中心低信号的 modiolus(蜗轴)。这类毫米级结构的标注一致性高度依赖统一约定——骨性螺旋板算不算耳蜗、蜗轴算不算耳蜗,一字之差就能造成 DSC 几个点的系统性偏移;官方协议把这两个争议点显式写死,是对后续评估可比性的关键保障。

VS 肿瘤标注在 ceT1 上进行,协议延续 2021 版;完整基线协议记录于数据底座论文 Shapey et al. 2021(TCIA,DOI 10.7937/TCIA.9YTJ-5Q73)——该文同时发布伦敦数据的开放版本,是追溯标注质量细节的第一入口。

3.2 GIF 自动掩码:不是金标准,但是免费先验

训练源附带的 GIF(Geodesic Information Flows)掩码是自动生成的全脑分区,不是人工金标准。官方定位是"两个任务均可使用的辅助信息"。正确用法:兴趣区裁剪、解剖先验、跨模态配准锚点;错误用法:把它当分割 GT 训练后直接报全脑分割分数——该掩码没有经过逐例人工质控承诺,用于软先验是安全的,用于硬标签是有风险的。

3.3 Koos 分级:双人独立 + 统一 briefing + 顾问仲裁

Task 2 的标注协议比分割标注更"临床"。分级者为两名 5-10 年经验的神经外科医生;标注前接受统一 briefing,内容包括 Erickson 描述的 Koos 系统原文与图像示例;每例的 ceT1 与 hrT2 同时提供(分级是模态联合判断而非单模态盲测);分歧不协商解决,而是提交顾问级神经放射科医生 + 顾问级神经外科医生仲裁。这套"双人独立+仲裁"流程的目标是把分级者的主观性收敛到协议层面,而不是让两人互相靠近——它与 3.1 的分割标注( fellows 单人勾画、无仲裁层描述)是两种不同的质量哲学,前者服务分级这种有序类别任务,后者服务体素级勾画。仲裁层还有一个隐性作用:分歧案例本身构成"Koos 边界病例"的金样本集——3↔4 级的机器错误集中在边界(§5.3)与人类仲裁集中在边界,是同一枚硬币的两面。

分级的质量锚点是重测一致性:同一分级者自身重复评定的 variability 为 0.11(MA-MAE 口径,回顾论文引 Kujawa et al. 2022,编号 [33])。这个数字是整个分类赛道的天花板参照:机器 MA-MAE 0.26(冠军)离"人对自己不一致的程度"还有一倍多距离(§5.3)。

3.4 Koos 系统本身:分级意味着什么临床决策

Koos 分级按肿瘤在内听道(internal auditory canal, IAC)外的扩展及其对脑干/小脑的压迫程度分四级:Koos 1 级肿瘤限于 IAC 内;2 级侵入桥小脑角但未触及脑干;3 级压迫脑干;4 级严重压迫脑干及小脑并使之下移。分级直接映射治疗选择:小肿瘤(1-2 级)常选随访观察或放射外科(Gamma Knife),大肿瘤(3-4 级)倾向开颅减瘤。这就是为什么 Task 2 用 hrT2(随访友好、无对比剂)——如果分级可以在无创序列上自动完成,随访曲线上的每一步都能自动监测分级变化。也正因为 1 级患者较少接受放射外科(更多进入随访或观察),放射外科流程采集的数据里 Koos 1 级天然稀少——类别不平衡不是采样失误,是临床流程选择偏差的忠实映像(回顾论文明确指出此点)。

3.5 规则与数据隔离:禁止什么,允许什么

2022 版参赛规则(官网):禁止使用任何额外数据——包括 TCIA 公开发布的 Shapey 数据与任何预训练模型(防"曲线救国"地把测试分布的数据混进训练);通用脑图谱可以使用,但必须声明并说明理由;每支队伍可任选一个或两个任务参赛;最终以 Docker 容器提交(2022-08-15 截止),测试评估在服务器端完成。这套规则与 INSTANCE2022 等同期 MICCAI 卫星赛事的防泄漏思路一致(库内 instance2022/645 条目有逐条对照):数据隔离的强度决定榜单的可信度——crossMoDA 测试集完全不公开 + Docker 服务器评估,属于最严格的一档。

3.6 标注协议对使用者的操作含义

把协议读成操作清单,避免三类常见复现事故:

  1. 耳蜗掩码的解剖边界是"协议定义的"而非"自然实体":basal turn 含骨性螺旋板、modiolus 含入/不含入,直接决定掩码体积与 DSC 量级。复现者在自建标注或对比第三方标注时,第一件事是核对解剖约定是否一致——不一致的对比全是噪音。
  2. Koos 分级是"双人+仲裁"的共识标签:它测的是"协议化共识"而非"任意一位医生的判断"。用单标注者数据训练、用共识标签评估(或反之)会引入系统性偏移;引用 0.11 重测一致性时注意它是个体内 variability,不是 inter-rater 系数。
  3. 训练源含术后病例:Task 1 数据覆盖术前与术后时间点,术后瘤腔与瘢痕的外观是训练分布的一部分——把公开数据全部当"术前 VS"处理是常见误读(FACTS 待核 3:分机构术后占比无公开数字,做术前/术后分层分析时需自行甄别)。

§4 评估方法学:rank score 与 MA-MAE

4.1 Task 1 为什么是 DSC + ASSD 双指标

单一 Dice 对毫米级结构的失效是常识:耳蜗直径约 10mm,DSC 从 85% 到 90% 的差异可能只对应零点几毫米的表面偏移,而临床(如保留听力的放射外科剂量规划)关心的是"离耳蜗有多远"这种表面距离量。ASSD(平均对称表面距离,mm)补上了这个维度:DSC 管"体积重叠",ASSD 管"边界误差"。双指标各管一个失效模式——这是精细结构分割评估的标准配置,官方在首届即采用并延续(回顾论文明言其遵循生物医学图像分析指标选择的共识建议,取其简单、秩稳定、高效)。

两个指标的数学直觉(复刻时的实现检查点):DSC = 2|A∩B| / (|A|+|B|),体积型、对大结构变化钝感(耳蜗小,少分几层体素 DSC 掉得快——这也是它"对小结构敏感"的另一面);ASSD = (Σ_{a∈∂A} d(a,∂B) + Σ_{b∈∂B} d(b,∂A)) / (|∂A|+|∂B|),表面型、对孤立错误点敏感(一个远离的假阳性点会显著抬高 ASSD——这正是它"暴露灾难失效"的机理)。两者并用后,"体积对了但边界错位"与"边界大体对但体积小"两种失效各自可见。

另一个设计细节:空预测处理。全背景预测(某方法在某例上什么都没分割出来)在 ASSD 下的数学处理不平凡——官方规则记为测试集体素的最大距离 350mm,即给空预测以最差惩罚而非未定义值。这让"偶尔完全失败"的方法无法靠其余病例的平均值掩盖灾难性失效,与 instance2022 的"HD=inf 劣后"规则(库内 instance2022/645,其总结论文赛后建议弃用 HD)形成有趣的对照:同样处理"完全失败"问题,crossMoDA 选择给最差值,INSTANCE 选择劣后名次——两种方案都在拒绝平均主义。

4.2 rank score:三步聚合,越低越好

排名方案(回顾论文 + 官网,赛前公布):

  1. 细粒度排名:对每个测试病例 × 每个结构(VS、耳蜗)× 每个指标(DSC、ASSD),12 支队伍分别排名次;
  2. 病例内累积:每个队伍在每个病例上取四项名次(VS-DSC、VS-ASSD、耳蜗-DSC、耳蜗-ASSD)的均值(cumulative rank);
  3. 全测试集聚合:对全部 271 个测试病例取均值 → rank score,数值越低排名越高。

与"先平均分数再排名"的传统方案相比,rank-by-case 的关键差异是对离群病例稳健:一个方法在某 10 例上灾难性失败(如翻译器在术后腔体病例上崩溃),在传统方案里可能只体现为 DSC 均值掉一点,在 rank 方案里则体现为这 10 例上每项都垫底、累积名次被显著拉高。它会系统性地奖励"没有明显短板"的方法——2022 年冠军 ne2e(3.0)与亚军 MAI(3.4)的差距不大,而尾部队伍(如 Of_Men_and_Rabbits 11.3)的 rank score 差距远大于其 DSC 均值差距,正是这个机制在放大短板。

4.3 稳定性检验:1000 次 bootstrap 与 Kendall τ

排名方案的稳健性用 bootstrap 验证:从 271 个测试病例中有放回抽样 N=271 例,重复 1000 次,每次重新计算全部队伍的 rank score 与名次,然后用 Kendall τ 度量各次排名与全量排名的一致性。这套流程回答的问题是:“冠军换一批测试病例还成立吗?”——对小样本、按病例排名的方案,这是必要而非奢侈的检验;回顾论文对 2022 与 2023 两届均执行了该验证。(技术细节:有放回抽样下每个 bootstrap 样本平均只保留约 63% 的不同病例,其余为重复抽取——这意味着检验实际考察的是"在病例组合扰动下的名次抖动",比单纯缩小样本量更严苛。)

实测结果有三个层次(回顾论文 §5.6):

  1. 总体稳定:中位 Kendall τ = 1,IQR [1, 1]——完美稳定;冠军队伍在全部 1000 个 bootstrap 样本中保持第 1(2022 与 2023 两届均如此,Fig. 9)。
  2. 双指标优于单指标:分别用 DSC-only、ASSD-only 与 DSC+ASSD 组合重跑 bootstrap,三者中位 τ 均为 1,但单指标方案的 τ 离散度明显更大(Fig. 10)——即双指标不仅信息更全,还让排名对样本扰动更不敏感;这是"为什么不用单一 Dice"的定量回答。
  3. rank-then-aggregate 优于 aggregate-then-rank:官方方案属于 rank-then-aggregate(先按病例排名再聚合,均值聚合);对照实验显示 aggregate-then-rank(先平均指标值再排名)在 ASSD 存在离群值时稳健性显著下降(Fig. 11)——ASSD 的长尾(如 27.61mm 的失败病例)会污染均值排名,而先排名把它截断在名次层面。这为 §4.5 的"2021-2022 挑战赛集体转向按病例排名"提供了本赛事自己的实验证据。

4.4 Task 2 为什么是 MA-MAE

Koos 1-4 是有序类别(不是四分类的平权问题——错 1 级和错 2 级的临床含义完全不同),且类别分布天然不平衡(§3.4)。MA-MAE(Macro-averaged Mean Absolute Error,宏平均绝对误差)同时处理这两个属性:对每个样本取「预测级 − 真实级」的绝对值(误差按级差计权——错两级罚得比错一级重),再对每个 Koos 级别分别求平均,最后对四个级别的误差取宏平均(每级等权——1 级样本稀少不会被 3/4 级淹没)。该指标源自 SemEval-2017 有序情感强度预测任务,后被 Kujawa et al. 2022 引入 VS 分级场景,为 crossMoDA 2022 官方采用。

读数基准:MA-MAE = 0 为完美;0.11 为人类分级者自身重测一致性(天花板参照);冠军 SJTU_EIEE_2-426Lab 为 0.26——平均而言每例错约四分之一级,且 251 例中 7 例错两级、多数错误发生在 3↔4 级边界(回顾论文 §5.1)。一个直观对比:MA-MAE 0.26 的直觉解读是"每 4 例累计错 1 级"——对分级这种决策粒度(随访 vs 放射外科 vs 开颅)而言,这相当于每 4 例就有 1 例的处置建议被推向相邻档位;这就是"0.26 vs 0.11"差距的临床翻译。

4.5 与库内挑战赛评估体系的对照

条目 指标 聚合方式 失败处理
crossMoDA 2022 DSC+ASSD(分割)/ MA-MAE(分级) 按病例×结构×指标排名取均值(rank score) 空预测 ASSD 记 350mm
instance2022(645) DSC/NSD/RVD/HD 四指标 aggregate-then-rank 三步 HD=inf 队伍劣后
brats(24) Dice/N Jessica 系 按亚区平均后综合 —
wmh-challenge(501) Dice/LD(logistic detection distance) 双指标加权综合 —

共性清晰可见:2021-2022 年的 MICCAI 卫星赛事集体从"平均分排序"转向"按病例排名"类方案——大家都在防同一件事:用平均值掩盖灾难性失败。crossMoDA 的特殊贡献是把"结构×指标×病例"三重排名做到最细粒度。

4.6 评估体系的三点批评与官方回应

一个成熟的 benchmark 要经得起评估体系本身的审视。三点常见批评与对照的官方证据:

  1. “排名测的是翻译质量还是分割质量?”——两段式范式下,翻译崩坏会直接拖垮分割分数(§5.6 尾部队伍),rank score 无法区分"翻译得好但分割器弱"与"翻译器把结构都搬丢了"。官方回应体现在设计上:官方从未单独评估翻译质量(无翻译保真度指标),而把"分割分数"作为唯一出口——这是实用主义选择(临床要的是分割结果),但也意味着方法消融要靠参赛者自己在论文里补。使用者复现时若想归因,需要在自划集上分别报告"伪 T2 视觉抽检"与"分割分数"两层。
  2. “ASSD 长尾会不会绑架均值?”——§4.3 已给官方实验答案:rank-then-aggregate 对长尾免疫(这是选它的理由);真正的脆弱点在 aggregate-then-rank 对照方案上。批评在此是官方自己完成回应的。
  3. “12 队全员同质方法,rank 区分度是方法差异还是调参差异?”——§5.4 已指出全员"翻译+分割"的收敛使 benchmark 实际测的是"该范式内部的工程调优差异";官方在讨论中承认需要鼓励范式多样性。引用 2022 排名时注意:它回答"两段式内部谁做得好",不回答"两段式 vs 特征级对齐谁优"。

这三点的共同教训:benchmark 的评估体系定义了它能回答的问题边界——边界外的结论(如范式优劣、临床效用)需要额外的实验设计,不能拿榜单硬答。

§5 结果与基准:12 队分割排名、方法谱系与 Koos 分类

5.1 分割赛道完整排名(回顾论文 Table 5 口径)

12 支完赛队伍的完整排名如下。rank score 越低越好;中位数后括号为 bootstrap 区间口径(回顾论文 Table 5):

排名 队伍 机构 Rank score VS DSC 中位 (%) VS ASSD 中位 (mm) 耳蜗 DSC 中位 (%) 耳蜗 ASSD 中位 (mm)
1 ne2e 北京大学 3.0 86.1 [82.7–89.7] 0.38 [0.28–0.61] 87.6 [86.3–88.7] 0.15 [0.12–0.17]
2 MAI Korea University 3.4 87.3 [82.5–90.5] 0.41 [0.32–0.53] 86.2 [84.8–87.3] 0.17 [0.12–0.20]
3 LaTIM Inserm(法国) 3.8 86.8 [83.1–90.5] 0.42 [0.29–0.53] 84.9 [83.2–86.8] 0.17 [0.14–0.21]
4 Super_Polymerization Radboud University(荷兰) 4.3 86.6 [82.3–90.0] 0.43 [0.33–0.57] 84.9 [83.6–86.2] 0.18 [0.14–0.22]
5 A*DA — 4.9 86.7 [81.3–90.9] 0.43 [0.31–0.59] 84.6 [82.6–85.5] 0.20 [0.18–0.23]
6 fgh_365 — 5.6 82.5 [78.0–87.2] 0.61 [0.49–0.75] 85.3 [83.3–86.6] 0.18 [0.16–0.20]
7 SJTU_EIEE_2-426Lab 上海交通大学 5.9 86.4 [81.1–90.6] 0.66 [0.35–1.91] 80.9 [79.5–82.7] 0.21 [0.16–0.26]
8 MBZUAI_VS MBZUAI 7.5 84.7 [80.3–88.0] 0.49 [0.37–0.69] 75.0 [70.0–78.0] 0.28 [0.24–0.37]
9 HUST_CBIB 华中科技大学 8.6 76.3 [64.3–83.9] 1.78 [0.62–5.42] 78.9 [76.2–80.9] 0.27 [0.22–0.33]
10 skjp Muroran Institute of Technology(室兰工大) 9.5 46.1 [19.0–70.1] 2.83 [1.43–6.62] 77.6 [73.0–81.1] 0.26 [0.22–0.31]
11 gabybaldeon — 10.3 78.2 [66.9–83.9] 0.81 [0.60–1.20] 52.0 [49.4–54.8] 16.44 [15.63–17.27]
12 Of_Men_and_Rabbits — 11.3 15.6 [4.8–35.6] 27.61 [17.72–32.39] 54.4 [40.0–71.1] 0.82 [0.40–1.14]

注:A*DA、fgh_365、gabybaldeon、Of_Men_and_Rabbits 四队的机构归属在回顾论文可获取文本中未明示,本表留空以存照(坑 8);其余八队机构归属均有来源(回顾论文 Table 3/技术报告/北大新闻)。

读榜五则。其一,前三名与其余的断层很小:ne2e(3.0)到 LaTIM(3.8)每一步只差 0.4-0.5 个名次均值,前三在 VS DSC 上互有胜负(MAI 的 87.3 甚至高于冠军的 86.1)——rank score 冠军靠的是耳蜗更稳(87.6 vs 86.2)与整体无短板,不是单项碾压。其二,中段(4-7 名)的 DSC 中位几乎挤在一起(82.5-86.7%),但 rank score 从 4.9 拉开到 5.9——拉开它们的是最差病例上的表现(如 SJTU 的 VS ASSD bootstrap 上界达 1.91mm,中段最差)。其三,尾部暴露的是灾难性失效模式:skjp 的 VS DSC 中位仅 46.1%(区间 19.0-70.1,接近"一半病例分割基本失败");gabybaldeon 耳蜗 ASSD 中位 16.44mm(相当于耳蜗整体错位约一个耳蜗直径);Of_Men_and_Rabbits 的 VS DSC 中位 15.6%——接近空预测水平。其四,DSC 中位高不等于 rank score 好:fgh_365 的耳蜗 DSC(85.3)高于第 5 名 A*DA(84.6),但 VS 短板(82.5)把它整体拖到第 6。其五,结构难度不对称:全员 VS DSC 波动远大于耳蜗(肿瘤形态可变 vs 耳蜗解剖恒定),但耳蜗 ASSD 全员在亚毫米-毫米级——耳蜗是"难但稳",VS 是"可难到崩"。

官方正文对头部的判语可直接引用:“The top-ranked team, ne2e, achieved a rank score of 3.0, followed by MAI with a rank score of 3.4. Both teams achieved a median DSC above 86% for both cochlea and VS segmentation.”(回顾论文 §5.3)——注意"both … above 86%"与 Table 5 中位数逐项对照一致,两个口径在头部队伍上是自洽的;分歧只出现在官方获奖榜(坑 3)那一侧。

读榜其五有官方分层证据(回顾论文 §5.5/Table 8 前置分层表):把每队的 cumulative rank 按 VS 与耳蜗拆开看中位 [IQR]——ne2e 的耳蜗 cumulative rank 中位 1.5 [1.0–2.5](全场接近恒定第 1-2 名),VS 为 3.5 [1.5–6.0];fgh_365 耳蜗 4.0 [3.0–5.5] 但 VS 7.0 [5.5–9.0],VS 短板直接定义了它的第 6 名;MBZUAI_VS 则相反(VS 6.5、耳蜗 9.5)。回顾论文对"VS 方差更大"的官方解释:耳蜗在位置、体积与强度分布上高度均匀,肿瘤则相反——这一不均匀性自 2021 版起就是该 benchmark 的固定观察。前三名正文判语(§5.3):ne2e 与 MAI 双结构中位 DSC 均 >86%;LaTIM/Super_Polymerization/A*DA 的 VS 中位 >86% 且耳蜗 >84%;排名靠后队伍呈现更低 DSC 与更高 ASSD——“凸显了多机构数据下跨模态 DA 的挑战”。

5.2 官方获奖榜口径与读榜守则

官方站点(crossmoda-challenge.ml)获奖表列出的数字与回顾论文 Table 5 不可直接对表:前者列 ne2e DSC 86.9、MAI 86.8、LaTIM 85.9(官方排行榜口径),后者列 VS DSC 中位 86.1、87.3、86.8(论文复现口径,且 VS/耳蜗分列)。两套口径的差异来源包括:均值 vs 中位、VS 单结构 vs 双结构聚合、排行榜原始提交 vs 论文复现(坑 3)。引用守则:写"获奖名次+rank score"用回顾论文 Table 5;写"某队 DSC"必须声明是官方榜口径还是论文 Table 5 的哪个结构哪个统计量——只写一个裸数字(如"DSC 86.9")而不声明口径,是本数据集最常被引用错的形态。

5.3 Koos 分类赛道:3 队完赛与人类基准

分类赛道规模很小但信息密度高(回顾论文 §5.1):

排名 队伍 机构 MA-MAE
1 SJTU_EIEE_2-426Lab 上海交通大学 0.26
2 Super Polymerization Radboud University 0.37
3 skjp Muroran Institute of Technology 0.84

三个定量结论。第一,机器尚未达到人类自身一致性:冠军 0.26 vs 分级者重测 variability 0.11(§3.3)——差距超过一倍,说明 Koos 分级的"机器可用"结论在 2022 年尚不成立, benchmark 的价值正在于把这个边界变成可引用的数字。第二,错误结构有临床含义:冠军 251 例中仅 7 例错两级,多数错误发生在 3↔4 级之间——即机器在"是否压迫脑干"的大方向上基本可靠,偏差集中在压迫严重程度的细节上;而 1↔2 级(随访 vs 放射外科的决策分界)错误率相对更低。第三,参与者少本身是发现,也是任务取消的直接原因:分类赛道仅 3 队完赛(分割 12 队),说明 2022 年社区对"有序分级+宏平均指标"的技术储备远小于分割——这不是任务不重要,而是工具箱缺位;回顾论文明确写道"由于参与者数量有限,该任务在 2023 版中被取消"(Due to the limited number of participants, this task was discontinued in the 2023 edition)——Koos 分类因此成为 crossMoDA 系列唯一举办过一届的任务,任何引用 Koos 自动分级结果的研究都只能回到 2022 版数据。

5.4 方法谱系:全员"图像翻译+分割"两段式的收敛

回顾论文方法分析的最显著结论:12 支分割队伍无一例外采用 image-to-image translation 做跨模态桥接,再在翻译后的图像(或其组合)上用监督分割器。具体谱系:

  • 翻译器:以 CycleGAN 及其变体为主——NiceGAN(冠军 ne2e)、CUT、UVCGAN、DCLGAN 均有队伍采用;无一队使用扩散模型或回归式翻译。
  • 分割器:nnUNet 与 U-Net 系一统天下——与同期所有 MICCAI 分割赛事的收敛一致(instance2022 的 13 队里 7 支 nnUNet、brats 系全员 U-Net 系)。
  • 自训练/伪标签:冠军 PAST(Pixel Alignment + Self-Training)在翻译之上叠加自训练环节——用翻译后图像上的初始分割伪标签迭代精化,这是两段式范式里离"端到端 UDA"最近的一步。

前三名的技术路线细描(均有可靠归属:回顾论文方法节 + 队伍技术报告):

  • ne2e(北京大学,第 1):PAST,NiceGAN 翻译 + 自训练(§5.5 详述)。相对其 2021 版前身的关键升级:在翻译框架内引入额外的分割网络以更好保持精细结构(耳蜗)——沿袭 2021 版冠军"分割解码器进生成器"的思路并扩展到 3D。
  • MAI(Korea University,第 2):Kang et al. 的多视角图像翻译(multi-view image translation)——并行使用两个翻译模型(CycleGAN + QS-Attn):前者以像素级循环一致性忠实保留 ceT1 纹理(含 VS 与耳蜗),后者以 patch 级对比损失保持结构完整性(按熵选择域相关特征);两者生成的伪 T2 一起训练 nnUNet,再对真实 T2 生成伪标签做迭代自训练。技术报告见 https://crossmoda-challenge.ml/media/papers_2022/mai.pdf 。
  • LaTIM(Inserm,法国,第 3):Sallé et al. 的 SinGAN 数据增强路线——先仅在伦敦 SC-GK 数据上训 CycleGAN,对两中心 ceT1 生成对齐伪 T2;针对真实/伪 T2 间的域差(耳蜗信号衰减 + 蒂尔堡特有的大异质高纹理 VS),把伪 T2 中肿瘤强度按大于/小于 1 的因子缩放(模拟高/低信号)并用 2D one-shot 生成模型 SinGAN 逐切片真实地融合回去;分割骨干为全分辨率 3D nnUNet,叠加 3 轮迭代自训练。这条路线首次把"生成式增强"用于应对 2022 版新引入的多机构异质性。

其余队伍的共性:均以 CycleGAN 系变体为翻译主干(CUT 及其分割增强版、UVCGAN、DCLGAN、StyleGAN 换 backbone 的 CUT 等),配合自训练/mean-teacher 一致性正则(如多尺度 mean-teacher 框架)与不同组合的强度/翻转/过采样增强;分割端全员 3D nnUNet(多为 full-resolution 配置,部分用 5 折集成或非光滑 Dice 损失变体)。个别队伍在翻译中引入代理任务(如 VS 分割与脑区划分一致性)以维持图像结构。

这个横断面样本的方法学含义:2022 年时间点上,“翻译+分割"两段式是跨模态 UDA 的收敛共识而非某队标新立异;但全员同质也意味着该 benchmark 尚未检验过翻译之外的 UDA 路线(如纯特征级对齐、共享编码器)——回顾论文将此列为社区反思点:未来的届次需要鼓励范式多样性,否则 benchmark 开始"只测一个族谱的内部差异”。

5.5 冠军方案 PAST 拆解(ne2e,北京大学)

ne2e(北京大学董彬/张立课题组,成员董和鑫、于飞、袁铭泽、赵杰;北大新闻 2022-09-18 佐证:https://bda.pku.edu.cn/info/1003/1351.htm)的方案 PAST = Pixel Alignment + Self-Training:

  1. Pixel Alignment:用 NiceGAN 学习 ceT1→hrT2 的非配对翻译,在像素空间完成模态桥接——相比 CycleGAN 基线,NiceGAN 的重聚类机制缓解了长训练下的模式退化;
  2. Self-Training:在翻译后的 hrT2 风格图像上训练初始分割器,生成伪标签,再迭代用伪标签监督真实 hrT2 上的分割器——把"源域标注"经由翻译器间接投射到目标域。

获胜逻辑与 rank score 机制互为印证:PAST 不是 DSC 单项最高的方案(VS DSC 中位 86.1 低于 MAI 的 87.3),而是四项名次均值最稳的方案(VS ASSD 0.38mm 与耳蜗 DSC 87.6% 均为全场最佳)——在"按病例×结构×指标排名"的规则下,均衡压倒尖峰。分层数字(§5.1 读榜其五)进一步显示它的耳蜗 cumulative rank 中位 1.5——耳蜗的近乎恒定最优是它压过 MAI 的直接原因;这也解释了为什么 PAST 在翻译框架里专门加分割网络保精细结构(§5.4)——设计针对的正是 rank score 权重最高的失效面。另外值得注意:PAST 是 2021 版同队方案的迭代(回顾论文明确对比),而非从零新设计——冠军的连续性说明在该 benchmark 上"渐进工程"优于"另起炉灶",这与两段式范式的收敛互为因果。

5.6 尾部队伍与失败模式:benchmark 的另一半价值

尾部名次不是噪音,是失败模式分类学:skjp(VS DSC 46.1%)提示翻译器在部分病例上彻底失败后分割器输出噪声;gabybaldeon(耳蜗 ASSD 16.44mm)提示小结构在翻译中位移/形变——结构在,位置错;Of_Men_and_Rabbits(VS DSC 15.6%)接近系统性输出空/错误区域,按 350mm 口径被重罚。对 benchmark 使用者的含义:在自建数据上复现两段式范式时,需要为"翻译崩溃"准备检测机制(如翻译质量门控 + 空预测拒绝),否则会复刻尾部队伍的失效形态——这正是 rank score 设计要暴露的东西。

按失效形态可以把 12 队分成三类学:① 均衡型(前 5 名):双结构四指标无灾难,rank score 3.0-4.9;② 偏科型(6-8 名):单结构进前列、另一结构拖尾(fgh_365 的 VS、MBZUAI_VS 的耳蜗),rank score 5.6-7.5;③ 失效型(9-12 名):至少一项指标进入"临床不可用"区间(DSC <50% 或 ASSD >2mm),rank score 8.6-11.3。这个分类学对方法诊断有用:你的方案落进哪一类,决定下一步是补短板(偏科型)还是排查管线级故障(失效型)。

5.7 给基准使用者的分数对齐清单

把本文数字用于自己论文的对照表时,逐条核对:

  1. 引名次与 rank score → 回顾论文 Table 5(arXiv:2506.12006);
  2. 引 DSC/ASSD → 必须同时声明:官方榜口径 vs 论文中位口径、VS 还是耳蜗、中位还是均值(坑 3);
  3. 引 Koos 分类 → MA-MAE + 声明测试集 251 例为回顾论文单源数字(坑 5);
  4. 引规模 → 先选口径:755 全口径或 484 公开口径(坑 4);
  5. 引伦敦 ceT1 分辨率 → 0.47×0.47mm(回顾论文 v4),如引 0.4 需注明 2022 年参赛报告口径(坑 2);
  6. 自己在公开 484 例上做实验 → 不存在可比的官方测试分数(测试集不公开),只能内部划分自报,勿与终榜对表。

5.8 跨届回溯:冠军模型的泛化能力与"异质性代价"

回顾论文 §6.2 做了一个少见的跨届回溯分析:把 2021/2022/2023 三届冠军模型放到同一批测试集上重新评估,直接量化"训练数据异质性"对泛化的影响。与 2022 版直接相关的三组数字(回顾论文 Table 8,DSC 中位 [IQR]):

模型 \ 测试集 伦敦单中心测试集 伦敦+蒂尔堡双机构测试集
2021 冠军(仅伦敦训练) VS 87.01 [81.81–89.99] —(其设计域)
2022 冠军(伦敦+蒂尔堡训练) VS 88.45 [84.71–91.95] VS 86.07 [82.70–89.66]
2022 冠军(同上,耳蜗) 耳蜗 87.11 [85.04–88.16] 耳蜗 87.63 [86.31–88.68]
2021 冠军(同上,耳蜗) 耳蜗 85.71 [83.85–86.98] —

三个定量结论。第一,"异质性代价"可量化:同一个 2022 冠军模型,在训练分布内的伦敦单中心测试集上 VS DSC 88.45%,在纳入蒂尔堡的双机构测试集上降到 86.07%——约 2.4 个点的差距就是跨机构泛化的价格;注意耳蜗方向相反(87.11→87.63),小结构对机构偏移的敏感性模式与肿瘤不同。第二,单中心训练的模型会过期:2021 冠军(仅伦敦数据训练)在 2022/2023 数据上性能显著下降,离群值密集——回顾论文的判语是"同质单源数据训练的模型难以泛化到异质多机构测试集"(显著性 p<0.01);2022 冠军模型在 2023 版(加入 UK MC-RC 常规随访数据)上同样出现下降。第三,异质训练换来稳健:2023 冠军(最异质数据训练)在全部测试集上保持高性能且离群值最少,其 VS 在伦敦单中心测试集上超过 88%——用短期分数换取长期泛化的证据链完整。这条回溯链对任何做多中心医学 AI 的团队都是直接可引用的证据:benchmark 设计者用三届比赛证明了 8.3 节的方法论主张。

技术演化同脉络:2021 冠军把分割解码器嵌入 2D CycleGAN 生成器以保住细小耳蜗结构 → 2022 冠军(PAST)沿用并扩展到 3D;2022 季军(LaTIM)引入 SinGAN 生成式强度增强 → 2023 冠军沿用该技术并加困难样本过采样。三届冠军技术是一条清晰的增量链,而非每年从零开始——系列赛事的"记忆"由此体现。

5.9 只用公开 484 例,实验怎么设计

测试集封闭意味着第三方的方法对比要在公开 484 例上自建协议。四条经过参赛方案与评估体系反推的实验设计建议:

  1. 划分必须分层:按「机构 × 子集」分层抽样(如源域 210 = 伦敦 105 + 蒂尔堡 105,各留 20-30 例做内部测试),并固定随机种子公开划分清单——否则"机构偏移"会与"随机波动"混淆,且他人无法复现你的数字;
  2. 对照组要包含"不适应基线":直接在 ceT1 上训练、直接推理 hrT2(no adaptation)的裸基线是必须的——它量化模态鸿沟本身的代价;再对照"翻译+分割"两段式与(可选)特征级 UDA,才能回答 §4.6 批评 3 里的范式问题;
  3. 报告口径对齐官方:DSC+ASSD 双指标、VS 与耳蜗分列、中位 [IQR]、按病例排名聚合(rank score 逻辑)+ 空预测 350mm——用官方口径报告虽不能与终榜对表,但能与官方论文的统计形态直接对话(附录 H/S);
  4. 用验证集 64 例做模型选择、内部测试绝不参与选型——这是官方"验证榜/测试榜"两层结构的单机版;把 484 例全部混进训练再自测的论文,在本 benchmark 的语境下应视为无效实验。

附加提醒:公开数据里源域 ceT1 是唯一带分割标注的部分,若你的方法只需要"VS/耳蜗分割"而无关域适应,公开 484 例里实际可用的监督信号只有 210 例源域——样本量论证时要按 210 而不是 484 写。

§6 获取与许可:三层资产、一张许可证

6.1 资产三层、获取三种

层 内容 获取方式
公开层 训练源+目标(210+210)、验证(64)、GIF 掩码、元数据 csv Zenodo 6504722 直接下载,无注册/无申请
验证层 验证榜提交 grand-challenge.org 提交 Docker;验证期经 Synapse Workflow Orchestrator
测试层 封闭测试 271 例 不公开;仅官方服务器端评估(Docker 容器)

与 instance2022"注册墙→2026 公开化"的轨迹不同,crossMoDA 训练+验证数据从发布第一天起就是免注册直接下载(2022-05-01 至今),在库内可获取性光谱上属于最开放的一档;封闭的只有测试层。Zenodo 记录页明示 “All the organizers will have access to the test set if needed”——测试集仅存于组织方侧。

6.2 License 逐字母拆解:CC BY-NC-SA 4.0

Zenodo 记录页官方声明为 CC BY-NC-SA 4.0(官网描述为 “permissive non-commercial copyright-license”):

  • BY(署名):使用须引用官方指定文献——① Shapey et al. 2021(TCIA,DOI 10.7937/TCIA.9YTJ-5Q73);② Dorent et al. 2022(首届 benchmark,arXiv:2201.02831);
  • NC(非商业):商业使用被明确禁止——将其用于商业产品训练、收费服务、商业流水线均越界;这是它与 brats(CC BY 4.0,允许商用)等库内数据集的关键差异;
  • SA(相同方式共享):基于该数据的衍生数据集/再分发须以相同许可(CC BY-NC-SA 4.0)发布——把衍生标注闭源发布或换更严/更松许可都不合规。

SA 条款的两个实务边界举例:在数据上重标注一批 hrT2 掩码后发布,衍生掩码必须同样以 CC BY-NC-SA 4.0 开放;在数据上训练的模型权重是否算"衍生作品"在许可语境下通常不被 SA 覆盖(权重不是数据副本),但下游产品若捆绑数据本体或其切片即触发 NC+SA——灰色地带以"是否再分发数据本体"为判据,商业场景建议直接咨询权利方(KCL/ETZ)。

对 AI-Ready 使用者的直接结论:可用于学术研究与开源模型训练;发布衍生资源时三件事必做——署名引用、非商业声明、同许可开放。

6.3 引用规范模板

数据引用(Zenodo 官方要求,两条都要):
Shapey, J. et al. (2021). Segmentation of Vestibular Schwannoma from MRI:
  An Open Annotated Dataset and Baseline Algorithm. TCIA.
  DOI: 10.7937/TCIA.9YTJ-5Q73
Dorent, R. et al. (2022). CrossMoDA 2021 challenge: Benchmark of
  Cross-Modality Domain Adaptation techniques for Vestibular Schwannoma
  and Cochlea Segmentation. arXiv:2201.02831
方法结果引用(2022 版排名/分析):
Wijethilake, N.*, Dorent, R.*, et al. The CrossMoDA challenge... (2026).
  Medical Image Analysis 114:104282. DOI: 10.1016/j.media.2026.104282
  (arXiv:2506.12006)

6.4 时间线速查

  • 2021:首届 crossMoDA(单机构 105 对,仅分割);
  • 2022-05-01:2022 版训练+验证集 Zenodo 发布(记录 6504722);
  • 2022-08-15:Docker 容器提交截止;
  • 2022-09:MICCAI 2022 会议期间 crossMoDA event 宣布获奖(北大新闻 2022-09-18 佐证;未精确到日,坑 7);
  • 2023:第三届(+UK MC-RC 异质数据、亚分割;取消 Koos 分类);
  • 2025-06-13 / 2026-08-25:回顾论文 arXiv v1 / v4;
  • 2026-11:Medical Image Analysis Vol.114 刊出(文章号 104282)。

6.5 AI-Ready 评估

维度 评价 依据
机器可读性 优 NIfTI 标准格式;csv 元数据;MD5 校验值官方提供
无注册获取 优 Zenodo 免注册直接下载(库内最开放档)
标注可追溯性 良 标注协议有论文级文档;但标注者间一致性(分割)无公开数字
许可清晰度 优 CC BY-NC-SA 4.0 明示 + 引用要求官方声明
探针可复现性 中 测试集封闭,终榜不可第三方复算;公开 484 例上无官方 baseline 分数可对齐
文档完整性 优 官网 + Zenodo + 回顾论文三层文档,评估方案赛前公布

短板集中在"探针可复现性":公开部分没有官方 baseline 模型或分数,第三方做本地实验后无外部锚点可校准——建议使用者至少复刻评估协议(DSC+ASSD、rank score 逻辑)保证内部一致(附录 K)。

6.6 获取与使用的边界情形清单

情形 能否做 要点
学术研究,直接下载训练+验证 能 Zenodo 免注册;引用两篇官方文献(§6.3)
把数据放进开源 benchmark 仓库再分发 能(带条件) 须保持 CC BY-NC-SA 4.0 同许可(SA 条款)
商业产品训练/收费服务 不能 NC 条款明确禁止
在公开 484 例上自划测试集发论文 能 声明划分与协议,不与官方终榜对表
提交官方测试评估 视届次通道 赛后个人无开放通道;系列届次走 Docker 提交
用 TCIA Shapey 数据与 6504722 合并训练 赛事内不能 / 赛后研究可 赛事规则禁 TCIA(防泄漏);赛后注意两源重叠病例
把 2021/2022 混合包当纯 2022 用 不建议 按官方 Table 1 理清子集构成(坑 6)
从 AMID 一键下载 能 知道它是 484 合并口径(§2.6)
申请测试集原始数据 无公开路径 仅组织方持有(§6.1)

§7 生态与影响

7.1 主办方谱系与资助

学术主导 King’s College London(Tom Vercauteren 组为核心,Reuben Dorent 后至 Harvard Medical School),临床双中心 King’s College Hospital(伦敦)与 ETZ(蒂尔堡);顾问委员会含工业界(NVIDIA,Nicola Rieke)与学术界(UPenn,Spyridon Bakas)。资助方:Wellcome Trust(203145Z/16/Z、203148/Z/16/Z)、EPSRC(NS/A000050/1、NS/A000049/1,英国工程与自然科学研究理事会)、ZonMw(10070012010006,荷兰)——英荷双国资助结构对应双机构数据。标注参与单位还包括 Ninewells Hospital NHS Tayside(Dundee)与 Charing Cross Hospital(Imperial College Healthcare)。

7.2 系列脉络:三届任务设置的演化

届 数据 任务 相对上一届的变化
2021 伦敦单中心 105 对(ceT1+hrT2) 仅分割 首发,确立 UDA 赛道
2022 双机构 755(公开 484) 分割 + Koos 分类 多机构异质性;新增分类赛道;附 GIF 掩码
2023 +UK MC-RC 165 例异质常规随访数据 分割(含瘤内/瘤外亚分割) 取消 Koos 分类;数据异质性再升级

2022 版在系列中的位置因此很清晰:它是"多机构 + 双任务"的唯一一届——Koos 分类只在 2022 存在,任何引用 Koos 分类结果的论文都绕不开本届数据。

2023 版概况(作为 2022 结论的外推边界,引用前先核对届次):6 队完赛分割(Docker 截止 2023-07-10,MICCAI 2023 会议期间发榜),冠军 vandy365(rank score 2.3,VS DSC 中位超 87%);任务升级为 VS 瘤内/瘤外亚分割(intra-/extra-meatal),2023 冠军瘤内区 DSC 超 74%、瘤外区超 87%(回顾论文 §5.4/Table 6);Koos 分类因参与人数少被取消(§5.3)。数据侧加入 UK MC-RC 165 例异质常规随访数据——临床常规扫描的异质性(体素体积、层厚、强度分布、厂商、采集协议)显著高于放射外科流程的受控采集,这直接改变了 benchmark 的难度结构(§5.8 的耳蜗下降讨论)。

7.3 数据血缘:TCIA 开放数据集的挑战赛化

伦敦数据基座是 Shapey et al. 2021 在 TCIA(The Cancer Imaging Archive)发布的开放 VS 标注数据集(DOI 10.7937/TCIA.9YTJ-5Q73,含基线分割算法)。血缘关系带来的两个实务点:其一,官方规则禁止参赛者使用 TCIA 数据或其预训练模型(防止与挑战赛训练源重叠导致泄漏,§3.5);其二,研究者若需要更完整的伦敦元数据或基线分割算法,TCIA 是第一入口——挑战赛版本与 TCIA 版本的原始层是同一批临床工作。

7.4 第三方收录与软件生态

  • AMID(Awesome Medical Imaging Datasets,Python 库)内置 CrossMoDA 类,按 Zenodo 6504722 自动下载(484 口径,§2.6)——一键可复现的获取路径让它进入很多 UDA 论文的默认实验配置;
  • grand-challenge.org:提交与评估基础设施(Docker 容器、服务器端 GPU 评估);
  • Synapse Workflow Orchestrator:验证阶段的编排器;
  • ITK-SNAP(标注)、GIF(脑区掩码生成)、nnUNet/U-Net/CycleGAN 系(参赛主流栈,§5.4)。

生态读法:crossMoDA 的"可复现性资产"分布在四个独立组织(Zenodo 托管数据、GC 托管评估、KCL 维护官网与论文、第三方库维护下载器)——单点故障风险低,但也意味着信息分散:查数据去 Zenodo、查赛制去 GC 子站、查结果与获奖去总站、查方法细节去回顾论文,四个入口的职责边界在坑 1 里已列。

7.5 会议与出版网络

挑战赛挂在 MICCAI 2022 卫星赛事(BrainLes workshop 系)之下,获奖于 MICCAI 2022 会议期间的 crossMoDA event 宣布;获奖者技术报告收录于 post-conference 的 MICCAI BrainLes 2022 proceedings(如亚军 MAI 队报告 “Multi-view Cross-Modality MR Image Translation for Vestibular Schwannoma and Cochlea Segmentation”,https://crossmoda-challenge.ml/media/papers_2022/mai.pdf )。官方回顾论文历经三年沉淀:arXiv 2025-06(v1)→ v4 2026-08 → Medical Image Analysis 期刊版 2026-11(Vol.114,文章号 104282,42 位作者, Wijethilake 与 Dorent 共同一作)——对挑战赛条目而言,这个"赛事→技术报告→期刊回顾"的完整出版链是结果数字可信度的重要保障。

出版链上还有两个引用注意事项:其一,回顾论文的 arXiv 页面所列许可为 CC BY-NC-ND 4.0(论文文本),引用原句时遵循 ND(禁止演绎)要求——翻译/改写表述须标注为间接引述;其二,BrainLes proceedings 的正式卷号与各技术报告的 DOI 在 FACTS 存档时未落定(FACTS 待核 2),引用技术报告暂以官网 PDF 链接为准,正式 DOI 公布后应替换。

§8 方法学启示:五条可迁移的经验

8.1 标注经济性不对称是跨模态 UDA 的第一性约束

crossMoDA 的立题不是"我们想考域适应",而是临床现实的结构性错位:标注沉淀在旧模态(ceT1,临床习惯+金标准),临床迁往新模态(hrT2,无创随访)。这个"标注-模态错位"模式在医学影像里到处成立(标注贵的模态 ≠ 未来使用的模态),crossMoDA 只是把它第一次做成了持续的正式 benchmark。迁移判断:任何"有 A 模态标注、想在 B 模态上用"的项目都可以直接复用其四象限数据组织(源带标/目标无标/验证无标/测试封闭)与评估设计;反过来,如果你的场景里目标模态也可以标注一小批,那问题定义就变成半监督 UDA,对标结论要相应调整。

8.2 rank score:评估设计里"防平均主义"的成熟模板

"按病例×结构×指标细粒度排名再聚合"的三步方案(§4.2)提供了一种可移植的评估模板,其核心洞察是:平均分掩盖灾难性失败,名次聚合放大短板。移植条件:多指标+多结构+按病例评估的任务都适用;代价是需要足够大的测试集(271 例支撑了 rank score 的方差控制,1000 次 bootstrap 是配套的稳健性检查)。2021-2022 年 MICCAI 卫星赛事集体转向此类方案(instance2022 的 aggregate-then-rank、§4.5 对照表),说明这已是社区共识方法学,新 benchmark 直接沿用即可。移植时的三个参数决策:① 测试集规模下限——官方经验是"测试例数 ≥ 队伍数的 5 倍且 ≥ 100"量级才能让名次均值有区分度(经验法则,非官方数字,自行验证);② 聚合用均值还是中位——官方对照实验支持均值(§4.3),但若你的指标长尾极重可两种都报;③ 是否空预测惩罚——精细结构任务建议保留(官方 350mm 方案),分类任务不适用。

8.3 多中心异质性应该做进考题,而不是被清洗掉

2022 版把两机构 1:1 均衡混合、保留不同厂商设备与序列族(§2.2),而不是把数据" harmonize "成同质集合——这保留了 benchmark 对真实世界的预测效度。其回报在结果里可见:全员 VS DSC 波动远大于耳蜗(§5.1 读榜其五),机构异质性带来的困难被如实暴露;而 2023 版把异质性再推一档(加入 UK MC-RC 常规随访数据)后,耳蜗性能出现官方自认"机制未明"的下降(§8.7)——异质性的收益与代价在同一系列里先后显形。对自建数据集的启示:预处理管线里"清洗掉站点差异"的操作(如重采样到统一分辨率后丢弃原始 spacing 信息)会同时清洗掉 benchmark 的外部效度;正确姿势是保留原始属性并把它作为分析维度。§5.8 的跨届回溯是这条主张的定量版:单中心训练的 2021 冠军在异质测试上崩溃,最异质数据训练的 2023 冠军全测试集稳健——benchmark 设计者的方法论选择,被他们自己后续的实验证明了。

8.4 人类重测一致性:分类任务定标的便宜而有效的锚点

Koos 分级先测了分级者自身重测 variability(0.11),再让机器去比(冠军 0.26)——这一步让"机器到没到人类水平"从口号变成了两小数点后的差距陈述。这套定标成本很低(同一批标注者重复标注一次子集)却给整个赛道提供了天花板参照。对分类/分级型 benchmark 的普适启示:没有人类一致性数字的指标(MAE、F1)无法解读绝对值;做分级任务先测人,再测机器。定标设计还有两个细节值得抄:其一,重测要隔开足够时间间隔并打乱病例顺序,否则测的是记忆不是判断;其二,锚点指标要与机器指标同构(这里都是 MA-MAE 口径),不同构的比较(人的一致性 vs 机器的准确率)是无效比较——0.11 之所以能当"及格线",正因为它和 0.26 是同一个量纲上的同一个统计量。

8.5 附属资产的数据集增值思路

GIF 掩码(自动脑区分割)与元数据 csv(§2.5)是"低成本高杠杆"的附属资产:生成是自动的(GIF 是既有算法),却把数据集从"图像+肿瘤掩码"升级为可做解剖先验与偏倚分析的多层资源。数据集作者的启示:发布前盘点手头可自动生成的附属标注(解剖分区、质量分、人口学表),一并发布——它们对使用者的边际价值常常超过又一批肿瘤掩码。

8.6 给数据集条目写作者的三条规则

从本条目写作中沉淀的规则:其一,届次型数据集必须把"本条目覆盖哪一届"写进 §0(crossMoDA 三届任务设置差异大到引用错届次等于引用错数据集);其二,凡官方存在两个口径(榜单 vs 论文、全口径 vs 公开口径)的数字,两个都写且互指,绝不"择善而从"地只留一个;其三,测试集封闭的 benchmark,"AI-Ready 评估"里必须有"探针可复现性"一行并如实给中评(§6.5)——开放下载不等于开放复现。

8.7 回顾论文自认的三个局限(组织者自己的复盘)

官方回顾论文在讨论节明确承认的局限,比任何外部批评都更有分量:

  1. 发布数据缺人口学元数据:挑战赛数据只附带训练源的人口学表,验证/目标域无年龄、性别、族裔信息,无法做人口学亚组性能与公平性分析;回顾论文建议未来届次发布"协调化且妥当去标识"的人口学变量。
  2. 临床落地前仍有硬障碍:异质数据上的一致性、离群值削减、分割精度之外的临床效用验证、鲁棒的质量控制机制;再加前瞻性多机构验证、临床工作流集成与监管路径——这些都在 benchmark 分数之外。
  3. 耳蜗性能跨届下降的机制未明:2023 冠军耳蜗 DSC 较 2022 有所回落(84.90 vs 87.63,双机构测试口径),回顾论文列举了三个可能原因(UK MC-RC 数据的体素体积/层厚/强度/厂商异质性;两类→三类的亚分割任务改变优化平衡——瘤内成分与耳蜗空间邻近且都小;方法为肿瘤鲁棒性牺牲了耳蜗精度),并明确写道"当前分析未能完全解决该下降的机制,是未来工作的开放问题"。

一个 reference-grade 数据集的自我批评样本:把"我们不知道什么"写进论文,正是 crossMoDA 系列能持续三届的原因。

§9 与库内条目的关系

9.1 家族图谱:八个互链点

brats(24):MICCAI 系脑肿瘤分割挑战赛旗舰。对照维度:模态策略相反——brats 把多参数(T1/Gd-T1/T2/FLAIR)全部给你、考的是模态内融合;crossMoDA 只给一个模态的标注、考跨模态迁移。两方合读构成"脑肿瘤分割 benchmark 的模态策略两极"。解剖部位也不同:brats 的胶质瘤在幕上脑实质,crossMoDA 的 VS 在桥小脑角——即使任务形式相同(MRI 分割),临床问题、标注结构(浸润性胶质瘤 vs 局限性神经鞘瘤+毫米级耳蜗)与难度结构都不可互换。

instance2022(645):同届(MICCAI 2022)卫星赛事,颅内出血 NCCT 分割。两者共享防平均主义的评估哲学(rank score vs aggregate-then-rank,§4.5 对照表)与 Docker 封闭测试机制;差异在影像域(MRI vs CT)与任务类型(域适应 vs 常规分割)。是"2022 年挑战赛方法学收敛"的最佳互证对——两场赛事独立地收敛到同类排名方案,说明该设计是对真实需求的响应而非个别组织者的偏好。

wmh-challenge(501):脑白质高信号分割挑战赛。同为 MICCAI 系脑 MRI 多中心 benchmark,但无模态迁移(单模态 FLAIR 为主、多站点)——与 crossMoDA 的"跨模态+双站点"形成"两种偏移源"的对照:站点偏移 vs 模态偏移。

autoimplant(472):MICCAI 颅底重建挑战赛。同为"临床手术规划导向"的挑战赛(耳科-颅底邻域与 VS 管理的临床工作流相邻),两者合读可见从分割到重建的任务谱。

fdtooth(609):牙科 CBCT 分割挑战赛。跨解剖域的挑战赛数据集互链;共同点是"毫米级精细结构"的分割难度(耳蜗 vs 牙齿/根管),差异在影像域(MRI vs CBCT)。

totalsegmentator(422):大规模 CT 全身分割。反衬价值: totalsegmentator 走"大规模+多结构+粗标注"路线(耳蜗这类小结构在其中并非重点),crossMoDA 走"小样本+双结构+精标注"路线——合读呈现"分割数据集的规模-精度权衡"。

fastmri(23):MRI 数据域的另一极(重建 vs 分割)。fastmri 的 k 空间原始数据与 crossMoDA 的诊断级体积分属 MRI 数据形态两端;对做"重建后分割"全链路的研究者,两者是上下游关系。

ixi-brain(482):公开脑 MRI(健康人)。用途对照:ixi 提供健康解剖域的参考分布,crossMoDA 全部为 VS 患者域——做域差异分析或预训练-微调设计时可两者组合。

9.2 检索路径建议

三条常见检索动线的落点:检索"vestibular schwannoma segmentation / 听神经瘤分割"→ 本条目为主锚点,向 autoimplant(472)(颅底手术规划)与 totalsegmentator(422)(通用分割背景)发散;检索"domain adaptation medical imaging / 跨模态域适应"→ 本条目为主锚点,向 brats(24)(模态内融合对照)与 wmh-challenge(501)(站点偏移对照)发散;检索"MICCAI challenge dataset / 挑战赛数据集"→ 本条目与 instance2022(645)、brats(24)、fdtooth(609) 同层,按影像域与任务类型分流。

按使用者身份的第四条动线:耳鼻喉科/神经外科的临床研究者(关心 Koos 分级与放疗规划)→ 先读 §1 Q6/Q7 与 §3.4,再看 §5.3 机器-vs-人类差距的结论——2022 版的答案尚不支持临床落地(§8.7),但数据本身可用于回顾性算法验证;NLP/多模态研究者 → 本条目无文本模态,可转向库内影像-文本对齐类条目,crossMoDA 仅作为"纯影像域适应"的参照系。

§10 避坑清单:八个已踩过或易踩的坑

坑 1:官网域名三地址混淆。 crossmoda.grand-challenge.org(系列/2021 入口)、crossmoda2022.grand-challenge.org(2022 版子站)、crossmoda-challenge.ml(系列总站,含获奖名单与数据说明)并存;委托方 brief 亦曾写错为 crossmoda.grand-challenge.org。引数据说明用总站,引 2022 版赛制用子站。实操:引用前把三个域名都打开核对页面标题与届次标注,勿凭记忆写 URL。

坑 2:伦敦 ceT1 层内分辨率两口径。 回顾论文 v4 写 0.47×0.47mm;2022 年参赛队技术报告(mai.pdf)写 0.4×0.4mm。本条目正文采用回顾论文 v4(更晚、更权威);引用 0.4 者需注明 2022 年口径。两数字相差 17.5%,做重采样时足以改变体素各向异性比。

坑 3:获奖榜 DSC 与回顾论文中位 DSC 不可直接对表。 官方站获奖表:ne2e 86.9 / MAI 86.8 / LaTIM 85.9;回顾论文 Table 5(VS DSC 中位):86.1 / 87.3 / 86.8。差异来自均值/中位、VS 单结构/双结构聚合、原始提交/论文复现。只写裸 DSC 数字不声明口径是本数据集最高频的引用错误。

坑 4:755 vs 484。 755 = 全口径(210+210+64+271,含不公开测试);484 = Zenodo 公开部分(210+210+64),也是 AMID 口径。两者相差 271 例——恰好都是"没有的部分"。引用规模必先声明口径;"755 例公开数据集"是错句。实操:句式模板——“crossMoDA 2022 共 755 例(公开 484 例,测试 271 例封闭)”,一句话双口径,杜绝歧义。

坑 5:Koos 分类测试集 251 例是单源数字。 仅回顾论文 §5.1(“7 out of 251 cases”)一处明示,官网未列。可用,但引用时应注明出处层级为回顾论文单源。

坑 6:2021/2022 两届共用 Zenodo 通道。 Zenodo 6504722 同时服务 2021 与 2022 数据(AMID 亦按此下载并把两届合并计数为 484)。下载到的包可能混含两届数据;做纯 2022 实验前先按官方 Table 1 理清子集构成,勿把第三方库计数当 2022 规模。实操:解压后统计各目录病例数并与 Table 1 的 210/210/64 对账,多出来的部分按 2021 版数据隔离处理。

坑 7:发榜时间未精确到日。 回顾论文仅写 “announced during the crossMoDA event at the MICCAI 2022 conference”(2022-09);北大新闻发布日期 2022-09-18 佐证月份。写"2022-09 发榜"安全,写具体某日是编造。

坑 8:四支队伍的机构归属不可脑补。 A*DA、fgh_365、gabybaldeon、Of_Men_and_Rabbits 在回顾论文可获取文本中无机构信息;其余八队(北大、高丽大、Inserm、Radboud、上海交大、MBZUAI、华中科大、室兰工大)有来源。排行榜表格中机构列留空是准确,填猜测是错误。

§11 总结

11.1 三句话总结

  1. crossMoDA 2022 是医学影像领域无监督跨模态域适应的旗舰 benchmark:755 例前庭神经鞘瘤 MRI(公开 484 例),标注留在 ceT1、考卷在 hrT2、全程不成对,双任务覆盖分割(VS+耳蜗,12 队)与 Koos 分级(3 队)。
  2. 它的评估设计(DSC+ASSD 按病例×结构×指标 rank score、MA-MAE、1000 次 bootstrap、空预测 350mm)是"防平均主义"方法学的完整范本,与同届 instance2022 的 aggregate-then-rank 共同构成 2022 年挑战赛评估的收敛范式。
  3. 它的横断面结论(12 队全员"图像翻译+分割"两段式;机器 Koos 分级 0.26 尚未达到人类重测 0.11)既宣告了一个范式的成熟,也划清了它的边界。

11.2 适合谁

  • 做跨模态/域适应方法研究、需要临床动机清晰的 UDA benchmark 的研究者;
  • 做 VS 或内耳分割、Koos 分级自动化的医学 AI 团队(数据本身即该方向最大的公开多中心资源之一);
  • 挑战赛组织者(四象限数据组织、rank score、封闭测试+bootstrap 的完整工程范本);
  • 教学/综述用:方法论收敛度极高(全员两段式),是讲"图像翻译+分割"范式的最佳案例集;
  • 做多中心泛化研究的团队:三届冠军回溯链(§5.8)是"数据异质性→泛化能力"的现成证据源。

11.3 不适合谁

  • 需要配对 ceT1/hrT2 数据做监督翻译或超分辨率的团队——这是无监督 UDA 数据集,不成对是题面(FAQ Q12);
  • 需要目标模态(hrT2)分割 GT 做常规监督分割的团队——GT 只在源域 ceT1;
  • 需要 Koos 标签做术后病例分析的团队——分级仅覆盖术前;
  • 需要人口学亚组/公平性分析的团队——数据缺年龄/性别/族裔(§8.7,FAQ Q52);
  • 商业使用场景——CC BY-NC-SA 4.0 明确禁止商用(坑在 §6.2);
  • 想在本地复现官方终榜分数的团队——测试集不公开(但可自划内部测试集自报)。

11.4 30 秒决策卡

问题 答案
我要 VS/耳蜗 MRI 分割数据? 是 → Zenodo 6504722 直接下(484 例公开),CC BY-NC-SA 4.0
我有 ceT1 标注、想在 hrT2 上用? 正中题面 → 四象限设计 + rank score 协议直接复用
我要配对双模态数据? 不适合 → 不成对;找配对 VS 数据需另寻
我要 Koos 分级数据? 训练源术前例有标签(494 例口径);分类任务仅 2022 版存在
我要商用? 不行 → CC BY-NC-SA 的 NC 条款
我要复现官方排名? 不可能 → 测试集封闭;自划测试集自报
引用规模? 先选口径:755(全)或 484(公开)(坑 4)

11.5 三类读者的最小阅读集

  • 数据使用者:§1 十问 → §2.1/2.3/2.4 → §6.1/6.2 → 附录 A;
  • 方法研究者:§0 → §4 → §5.1/5.3/5.4 → §8.1/8.2;
  • 挑战赛组织者:§3.5 → §4 全部 → §7.2 → §8.3/8.4/8.5。

11.6 常见误用清单(反面模式)

误用 后果 正确姿势
把训练源 ceT1 与目标 hrT2 当配对数据做监督翻译 无逐例对应,翻译目标错位 非配对翻译(CycleGAN 系)或特征级 UDA
在公开 484 例上自测后与官方终榜 DSC 对表 测试分布与协议不同,数字不可比 自划测试集自报,声明协议差异
把 GIF 掩码当分割金标准训练全脑分割器 GIF 无逐例人工质控承诺 GIF 仅作软先验/裁剪/配准锚
只用源域 210 ceT1 做普通分割 benchmark 浪费 UDA 设计核心,且与既有 ceT1 数据集无差异优势 至少报告目标域 hrT2 上的跨模态实验
引用"DSC 86.9"不声明口径 官方榜/论文中位混淆(坑 3) 双列口径并注出处
用 AMID 下载计数声称"2022 版 755 例公开" 混届+含不公开测试(坑 4/坑 6) 声明 484 公开口径
假设 Koos 分类可迁移到术后病例 分级标注仅覆盖术前 术后使用需自行标注验证
商业产品训练数据混入 违反 CC BY-NC-SA 的 NC 条款 学术用途或另行联系权利方

FAQ(高频问答 40 问)

A. 基础认知

Q1:crossMoDA 2022 是什么?
MICCAI 2022 卫星挑战赛(系列第二届)及其配套基准数据集:要求参与者用「有标注的 ceT1 + 无标注的 hrT2(不成对)」训练出能在 hrT2 上分割 VS 与耳蜗(Task 1)、评定 Koos 分级(Task 2)的算法;双机构(伦敦 KCL/KCH + 荷兰 ETZ 蒂尔堡)共 755 例 MRI(公开 484 例)。

Q2:crossMoDA 缩写怎么展开?
Cross-Modality Domain Adaptation。官方全称 Cross-Modality Domain Adaptation for Medical Image Segmentation challenge。

Q3:它和 2021 版、2023 版是什么关系?
同一系列的连续三届,任务设置差异大到"引用错届次=引用错数据集":

维度 2021 2022(本条目) 2023
数据 伦敦 105 对 755(公开 484),伦敦+蒂尔堡 +UK MC-RC 165 例异质随访
任务 仅分割 分割 + Koos 分类(唯一一届) 分割(瘤内/瘤外亚分割,三类)
完赛 16 队 分割 12 队 / 分类 3 队 6 队
冠军 —(见首届论文) ne2e(rank score 3.0) vandy365(rank score 2.3)

2022 版数据与 2021 版共用 Zenodo 6504722 下载通道(坑 6)。本条目只覆盖 2022 版;2023 概况见 §7.2。

Q4:谁是主办方?
King’s College London(学术主导,Vercauteren 组)+ ETZ 蒂尔堡(第二数据机构);核心组织者 Wijethilake、Dorent、Vercauteren、Shapey、Kujawa、Ivory 等;顾问含 NVIDIA Rieke 与 UPenn Bakas。

Q5:官方论文是哪篇?
回顾论文:Wijethilake*, Dorent* et al., The CrossMoDA challenge(42 作者,共同一作),arXiv:2506.12006;期刊版 Medical Image Analysis 114:104282(2026-11),DOI 10.1016/j.media.2026.104282。首届 benchmark 论文:Dorent et al. 2022, arXiv:2201.02831。数据底座论文:Shapey et al. 2021(TCIA,DOI 10.7937/TCIA.9YTJ-5Q73)。

Q6:数据集的 license 是什么?能商用吗?
CC BY-NC-SA 4.0:署名(引用指定两篇文献)+ 非商业(商用禁止)+ 相同方式共享(衍生数据集须同许可开放)。不能商用。

Q7:Koos 分级是什么?
前庭神经鞘瘤的四级分级系统(Koos 1-4),按肿瘤在内听道外的扩展及对脑干/小脑的压迫程度划分,直接映射治疗选择(随访/放射外科/开颅)。

Q8:这个数据集独一无二的地方是什么?
三个"唯一":库内唯一以无监督跨模态域适应为正式赛道的 benchmark;Koos 分类任务仅在 2022 版存在;12 支分割队伍全员采用图像翻译+分割两段式的方法收敛横断面。

B. 数据与获取

Q9:数据在哪里下载?
Zenodo 记录 6504722(DOI 10.5281/zenodo.6504722),免注册直接下载:training.zip 7.8GB(md5 8d68fcd44eaee6b0a4371ce344e775cd)、validation.zip 1.0GB(md5 1f0b2ac47d3d8b19e31d3b5bfa2f1e11)、GIF.zip 191.7MB、infos_source_training.csv。

Q10:下载到的是 755 例吗?
不是。公开可下载 484 例(训练源 210 + 训练目标 210 + 验证 64);测试集 271 例不公开。引用规模先声明口径(坑 4)。

Q11:测试集怎么"用"?
不发放数据,只能把算法打包成 Docker 容器提交到 grand-challenge.org 服务器端评估;验证阶段经 Synapse Workflow Orchestrator。这意味着官方测试评估只在挑战赛窗口内对参赛者开放——赛后研究者没有持续开放的测试通道,这也是"终榜不可第三方复现"(§6.5)的制度根源。日常研究一律用公开 484 例自划协议(§5.9)。

Q12:ceT1 和 hrT2 是配对的吗?
不配对。同一患者可能在不同子集出现,但训练源与训练目标之间无逐例配对关系——这是无监督 UDA 考题的题面。想要配对 VS 数据需另寻来源。

Q13:图像是什么格式?
NIfTI 3D 体积。序列参数见 §2.3 四表(伦敦 MP-RAGE/CISS、蒂尔堡 3D-FFE/3D-TSE,全部 1.5T)。

Q14:GIF 掩码是什么,能当 GT 用吗?
GIF(Geodesic Information Flows)自动生成的全脑分区掩码,官方定位为两任务均可用的辅助信息;不是人工金标准,作软先验安全、作硬标签有风险(§3.2)。

Q15:infos_source_training.csv 里有什么?
训练源病例的元数据(人口学信息),做偏倚分析的入口(§2.5)。

Q16:AMID 库下载的 CrossMoDA 和官方 2022 版一致吗?
不完全一致:AMID 按 Zenodo 6504722 下载、484 计数且把 2021/2022 合并;做纯 2022 实验前按官方 Table 1 理清子集(§2.6、坑 6)。

C. 标注与质量

Q17:分割掩码谁标的?
radiology fellows(3 年以上临床经验)用 ITK-SNAP 在 ceT1 上手动分割;耳蜗以 T2 为参考、统一包含 basal turn(含骨性螺旋板)与中心低信号 modiolus(§3.1)。

Q18:分割标注的标注者间一致性有公开数字吗?
无。回顾论文记录了协议与标注者资质,但未公开分割的 inter-rater 系数(AI-Ready 评估"标注可追溯性"给良的原因之一,§6.5)。

Q19:Koos 标签怎么标的?
两名 5-10 年经验神经外科医生独立评定全部术前病例(伦敦 221 + 蒂尔堡 273 = 494),统一 briefing、ceT1+hrT2 同看、分歧由顾问级双医生仲裁(§3.3)。

Q20:Koos 1 级样本为什么少?
临床流程选择偏差:1 级患者多进入随访观察而非放射外科,而数据主体出自放射外科工作流——不平衡是真实临床分布的映像(§3.4)。

Q21:源域里术前和术后都有吗?
Task 1 数据含术前与术后时间点(官网/Zenodo 描述确认训练目标集含术后);分机构术后占比无公开数字(FACTS 待核 3)。

Q22:能用 TCIA 版 Shapey 数据补充训练吗?
参赛时不行(规则明确禁止,防泄漏,§3.5);赛后研究使用是另一回事,但引用与许可条款照旧遵守。

D. 评测与结果

Q23:分割排名怎么算?
DSC+ASSD 按「271 测试病例 × 2 结构 × 2 指标」分别排名 → 病例内取四项名次均值 → 全测试集取均值 = rank score,越低越好(§4.2)。

Q24:空预测怎么处理?
全背景预测的 ASSD 记为测试集体素最大距离 350mm——给最差惩罚而非未定义(§4.1)。

Q25:排名稳定吗?
1000 次 bootstrap(每次有放回抽 N=271)+ Kendall τ 检验,回顾论文报告排名基本稳定(§4.3)。

Q26:2022 冠军是谁?
Task 1:ne2e(北京大学,PAST = Pixel Alignment + Self-Training,NiceGAN 翻译,rank score 3.0);Task 2:SJTU_EIEE_2-426Lab(上海交大,MA-MAE 0.26)。

Q27:为什么 MAI 的 VS DSC(87.3)比冠军 ne2e(86.1)高却只得亚军?
rank score 是四项名次均值:ne2e 在 VS ASSD(0.38mm)与耳蜗 DSC(87.6%)两项全场最佳、整体无短板;MAI 的耳蜗(86.2)与 ASSD(0.41)略逊。均衡压倒尖峰(§5.5)。

Q28:冠军 DSC 到底是 86.9 还是 86.1?
两个口径都"对":86.9 是官方获奖榜口径,86.1 是回顾论文 Table 5 的 VS DSC 中位。引用必须声明口径(§5.2、坑 3)。

Q29:Koos 分级机器达到人类水平了吗?
没有。冠军 MA-MAE 0.26 vs 人类重测一致性 0.11,差距一倍多;251 例中 7 例错两级、多数错误在 3↔4 级(§5.3)。

Q30:为什么分类赛道只有 3 队?
有序分级+宏平均指标的技术储备在 2022 年尚缺位(§5.3 结论三);且回顾论文明确:因参与者数量有限,该任务在 2023 版中被取消——Koos 分类成为系列唯一举办过一届的任务。参与者少是真实社区状态而非数据问题。

E. 与其他数据集/条目的关系

Q31:和 brats(24) 的区别?
模态策略相反:brats 给全多参数考模态内融合;crossMoDA 只给单模态标注考跨模态迁移。域同为脑 MRI(brats 胶质瘤 vs crossMoDA 听神经瘤)。

Q32:和 instance2022(645) 的区别?
同届(MICCAI 2022)不同域:INSTANCE 是 CT 颅内出血常规分割;crossMoDA 是 MRI 跨模态 UDA。两者共享防平均主义评估哲学(§4.5 对照表)。

Q33:和 wmh-challenge(501) 的区别?
偏移源不同:wmh 是多站点单模态(站点偏移),crossMoDA 是双站点双模态(模态+站点双偏移)。

Q34:和 fastmri(23) 的关系?
MRI 数据形态两端:fastmri 是 k 空间原始数据(重建任务),crossMoDA 是诊断级体积(分割任务);"重建后分割"全链路研究可上下游组合。

Q35:和 ixi-brain(482) 的关系?
ixi 是健康人脑 MRI,crossMoDA 全部为 VS 患者域;域差异分析或预训练-微调设计可组合使用。

F. 工程与复现

Q36:本地实验怎么做评估才能与官方协议一致?
复刻 DSC+ASSD 双指标 + 按病例排名逻辑 + 空预测 350mm 规则(附录 K 骨架);自划测试集自报,不与官方终榜对表(§5.7 条 6)。

Q37:重采样到统一 spacing 要注意什么?
保留原始 spacing 元数据;伦敦 ceT1 存在 0.47 vs 0.4 两个官方口径(坑 2),重采样参数必须声明以哪个为准。

Q38:翻译模型训练有什么现成参考?
12 支队伍的方法配置见回顾论文方法分析节与 BrainLes 2022 proceedings 技术报告(如 mai.pdf);冠军 PAST 的两段式结构见 §5.5。

Q39:数据泄漏风险点在哪?
主要在测试分布:禁止用 TCIA Shapey 数据与预训练模型(参赛规则);赛后研究里若把验证集并入训练,验证榜即失去意义——自报实验要固定划分并声明。

Q40:写论文引用哪几条?
数据用 Shapey 2021(TCIA)+ Dorent 2022(arXiv:2201.02831)双引(Zenodo 官方要求);2022 版结果与分析引回顾论文(MedIA 114:104282 / arXiv:2506.12006)。模板见 §6.3。

G. 方法与跨届(扩展问答)

Q41:233 队注册,为什么只有 12 队完赛?
漏斗收窄在验证榜与 Docker 两道门槛:233 队注册 → 27 队提交验证榜 → 12 队完成 Docker 测试提交(§2.8)。UDA 任务的工程门槛(训练翻译器+分割器+容器化提交)筛掉了大多数注册者;验证→评估的损耗比例(27→12)与 2021 版(55→16)相近,说明瓶颈是完整参赛能力而非热度。

Q42:排名在 bootstrap 下真的稳定吗?
是,且是"完美"级别:中位 Kendall τ = 1、IQR [1,1],冠军在全部 1000 个 bootstrap 样本中保持第 1(§4.3)。引用排名时可以放心写"排名经 1000 次 bootstrap 验证"。

Q43:为什么说双指标排名比单指标好?
回顾论文 §5.6 的对照实验:DSC-only 与 ASSD-only 的中位 τ 同为 1,但 bootstrap 下 τ 离散度更大;双指标组合(DSC+ASSD)离散度最小——信息更全且更稳。

Q44:rank-then-aggregate 与 aggregate-then-rank 之争有实验答案吗?
有:aggregate-then-rank(先平均指标值再排名)在 ASSD 出现离群值(如 27.61mm 的灾难性失效)时稳健性下降;官方 rank-then-aggregate(先按病例排名再聚合均值)不受此污染(§4.3)。这是"2022 年挑战赛集体转向按病例排名"的实验论据。

Q45:2021 冠军模型今天还能用吗?
在伦敦单中心、训练分布内的数据上:能(VS DSC 87.01);但在 2022/2023 版异质数据上性能显著下降(p<0.01)、离群值密集(§5.8)。回顾论文的结论是单源数据训练的模型难以泛化到多机构测试集——"还能用"的前提是把使用域圈死在训练分布内。

Q46:冠军模型在单中心和多中心测试上差多少?
2022 冠军:伦敦单中心测试集 VS DSC 88.45 [84.71–91.95] vs 双机构测试集 86.07 [82.70–89.66]——约 2.4 个点的"异质性代价";耳蜗方向相反(87.11→87.63)(§5.8,Table 8)。

Q47:分类冠军是怎么实现的?
回顾论文方法节描述的领先方案:用 nnUNet 分割 VS 及七个 Koos 相关脑区结构(脑桥、脑干、小脑蚓部 I-V/VI-VII/VIII-X、左右小脑半球)——分割基于伪 T2 与 ceT1 上的 VS 手工标注及 GIF 自动脑区掩码;再从这些掩码提取手工特征(体积、与 VS 最短距离、与 VS 接触面积),训练随机森林分类器输出 Koos 级。本质是"分割+解剖学特征+浅层分类器",而非端到端深度分类。

Q48:三届冠军的技术演化链条是什么?
2021:分割解码器嵌入 2D CycleGAN 生成器(保耳蜗小结构)→ 2022:PAST 沿用该思路并扩展到 3D(NiceGAN+自训练)→ 2023:在 2022 技术上叠加 SinGAN 生成式增强与困难样本过采样(2023 冠军;SinGAN 增强首创于 2022 季军 LaTIM)(§5.8)。三届是一条增量链。

Q49:分割端必须用 nnUNet 吗?
不是必须,但 12 支完赛队伍全部采用 nnUNet 系(多为 3D full-resolution 配置,部分 5 折集成);回顾论文称 nnUNet 为"VS 与耳蜗 MRI 勾画金标准"。偏离 nnUNet 的方法需要自行证明其增益——否则审稿人会合理怀疑差距来自分割器而非 UDA 策略。

Q50:bootstrap"平均保留约 63% 不同病例"是什么意思?
有放回抽样 N=271 时,期望约有 37% 的位置抽到重复病例,即每个 bootstrap 样本平均含约 63% 的不同病例(§4.3)——它模拟的是"测试集病例组合扰动"对名次的影响,比简单减样本量更接近真实部署的抽样波动。

Q51:系列未来会扩展到什么新任务?
回顾论文展望的方向包括:临床相关终点(而非纯分割精度)、不确定性估计、更完整的元数据、以及更广的跨模态设置——如 MRI 到术中超声的域适应(§8.7)。本数据集的 hrT2 UDA 协议是这些扩展的原型。

Q52:数据缺人口学信息影响什么?
无法做年龄/性别/族裔亚组的性能与公平性分析——回顾论文自认为该局限(§8.7)。做算法公平性研究的使用者需要另寻带人口学标注的数据源,或仅用训练源 csv(§2.5)做有限分析。

H. 评测解读细节

Q53:Table 5 里中位数后的方括号区间是什么?
bootstrap 区间口径(回顾论文 Table 5 报告 median [IQR])。例如 ne2e VS DSC 86.1 [82.7–89.7]——半数病例在 82.7-89.7 之间。宽区间(如 skjp 46.1 [19.0–70.1])本身就是失效信号,不要只引中位数。

Q54:VS 和耳蜗哪个结构更难?
方向不同:VS 难在方差(12 队 DSC 从 15.6% 到 87.3%,离群值密集——肿瘤可变),耳蜗难在绝对精度(直径 10mm 结构,0.15mm 的 ASSD 已是全场最佳——毫米级容差)。回顾论文的官方解释:耳蜗在位置、体积、强度分布上均匀,肿瘤相反(§5.1、事实清单 51)。

Q55:跨模态 VS 分割现在的 SOTA 大概什么水平?
跨届回溯口径:2022 冠军在训练分布内的伦敦单中心测试集 VS DSC 88.45%,2023 冠军 88.61%;双机构测试约 86-88%;耳蜗 84-88%(§5.8/附录 N)。注意这些是官方测试协议下的数字,本地实验不可直接对表(Q36)。

Q56:能用 2022 版数据预训练,再参加 2023 版任务吗?
赛事规则层面各自独立(2023 版有自己的训练集与规则);赛后研究里用 2022 数据预训练再在 2023 异质数据上微调是合理范式——但注意 2023 任务定义变了(瘤内/瘤外亚分割、三类掩码),标签空间不兼容需自行映射。

Q57:训练源 csv 能支撑哪些分析?
人口学元数据表(11.7kB,约 210 行),可支撑源域的年龄/性别分层描述与偏倚检查;目标域与验证域无对应表(§8.7 局限一)。具体列名以下载的实际文件为准,本条目不做未核验的字段级描述。

Q58:rank score 与平均 DSC 差异有多大?
尾部放大最明显:Of_Men_and_Rabbits 的 VS DSC 中位 15.6% 与第 10 名 skjp 的 46.1% 相差 30 个点,而两者 rank score 只差 1.8(11.3 vs 9.5)——排名法把"崩溃程度"压缩为名次差;头部相反:前三名 DSC 中位几乎并列(86.1/87.3/86.8)而 rank score 分开 0.8——排名法放大了"稳定性的小差异"。用哪套数字讲什么故事,引用前想清楚(§5.2)。

I. 与库内条目的关系

Q59:库内哪个条目和它最像?
没有"同款"——这正是它的空位价值。最接近的对照是 instance2022(645)(同届卫星赛事、同为防平均主义评估哲学,但域是 CT、任务是常规分割)与 wmh-challenge(501)(同为脑 MRI 多中心挑战赛,但无跨模态)。想要"另一个 UDA 数据集"——库内暂无;想要"另一个 VS 数据集"——库内暂无。

Q60:做脑肿瘤分割,该用 brats 还是这个?
看肿瘤类型与任务:胶质瘤(多参数、级别分类)用 brats(24)——其多参数协议是胶质瘤临床现实;听神经瘤(跨模态、分级/放疗规划)用本条目——其 ceT1→hrT2 设定对应 VS 随访的无创化趋势。两者肿瘤部位不同(幕上胶质瘤 vs 桥小脑角)、临床问题不同,不构成替代关系。

Q61:想组合使用,有推荐搭配吗?
两条已验证的搭配:① 本条目 + ixi-brain(482):健康脑 MRI 做预训练或域参照,再做 VS 患者域的 UDA 微调;② 本条目 + fastmri(23):重建(k 空间)→ 分割(诊断体积)的全链路实验——注意两者序列与解剖域不同,只能做方法学迁移不能做数据拼接。

事实清单(硬事实 53 条)

# 事实 来源
1 2022 版全口径 755 例(伦敦 379 + 蒂尔堡 376) 回顾论文 Table 1(arXiv:2506.12006)
2 训练源 210 ceT1(105+105),带 VS+耳蜗标注+GIF 掩码 Table 1 × mai.pdf 互证
3 训练目标 210 hrT2(105+105),无标注 Table 1 × mai.pdf 互证
4 验证 64 hrT2(32+32) Table 1 × mai.pdf 互证
5 测试 271 hrT2(137+134),不公开 Table 1 × bootstrap 段 N=271 互证
6 Zenodo 6504722,2022-05-01 发布,DOI 10.5281/zenodo.6504722 Zenodo 记录页
7 training.zip 7.8GB,md5 8d68fcd44eaee6b0a4371ce344e775cd Zenodo 记录页
8 validation.zip 1.0GB,md5 1f0b2ac47d3d8b19e31d3b5bfa2f1e11 Zenodo 记录页
9 GIF.zip 191.7MB;infos_source_training.csv 11.7kB Zenodo 记录页
10 累计下载 2.2K+,数据流出 17.5TB Zenodo 记录页
11 License CC BY-NC-SA 4.0 Zenodo 记录页 + 官网描述互证
12 2022 版子站 crossmoda2022.grand-challenge.org 官网实际核验
13 系列总站 crossmoda-challenge.ml(获奖名单+数据说明) 官网
14 伦敦 ceT1 = MP-RAGE,0.47×0.47mm,512×512,层厚 1.0-1.5mm,TR 1900/TE 2.97/TI 1100 回顾论文 v4 §2.2.2
15 伦敦 hrT2 = 3D CISS/FIESTA,0.5×0.5mm,TR 9.4/TE 4.23 回顾论文 v4
16 蒂尔堡 ceT1 = 3D-FFE,0.8×0.8mm,层厚 1.5mm,TR 25/TE 1.82 回顾论文 v4
17 蒂尔堡 hrT2 = 3D-TSE,0.4×0.4mm,层厚 1.0mm,TR 2700/TE 160/ETL 50 回顾论文 v4
18 两机构设备:Siemens Avanto 1.5T / Philips Ingenia 1.5T 回顾论文 v4
19 Koos 标注:伦敦 221 + 蒂尔堡 273 = 494 术前例 回顾论文
20 Koos 标注者:两名 5-10 年神经外科医生 + 顾问仲裁 回顾论文标注协议节
21 Koos 分级者重测 variability 0.11(引 Kujawa et al. 2022 [33]) 回顾论文(二手引用存照)
22 Koos 分类测试 251 例 回顾论文 §5.1 单源(坑 5)
23 Task 1 指标 DSC+ASSD;空预测 ASSD 记 350mm 官网+回顾论文
24 rank score = 病例×结构×指标排名两级聚合,越低越好 官网+回顾论文
25 1000 次 bootstrap(N=271)+ Kendall τ 回顾论文
26 Task 2 指标 MA-MAE(SemEval-2017 谱系) 回顾论文
27 分割 12 队完赛;分类 3 队完赛 回顾论文 Table 5/§5.1
28 冠军 ne2e(北京大学)rank score 3.0,PAST,NiceGAN 回顾论文 Table 5 + 北大新闻
29 ne2e VS DSC 中位 86.1 [82.7-89.7],耳蜗 DSC 中位 87.6 [86.3-88.7] 回顾论文 Table 5
30 亚军 MAI(高丽大)3.4;季军 LaTIM(Inserm)3.8 回顾论文 Table 5
31 官方获奖榜 DSC:ne2e 86.9 / MAI 86.8 / LaTIM 85.9 crossmoda-challenge.ml
32 分类:SJTU 0.26 < Super Polymerization 0.37 < skjp 0.84 回顾论文 §5.1
33 冠军 251 例中 7 例错两级,多数错误在 3↔4 级 回顾论文 §5.1
34 12 队全员 image-to-image translation(CycleGAN/NiceGAN/CUT/UVCGAN/DCLGAN)+ nnUNet/U-Net 回顾论文方法分析
35 规则禁止额外数据(含 TCIA Shapey 数据与预训练模型) 官网规则
36 Docker 提交截止 2022-08-15 官网时间线
37 获奖于 MICCAI 2022 会议期间宣布(2022-09,北大新闻 09-18 佐证) 回顾论文+北大新闻(坑 7)
38 资助:Wellcome Trust 203145Z/16/Z、203148/Z/16/Z;EPSRC NS/A000050/1、NS/A000049/1;ZonMw 10070012010006 Zenodo 记录页/回顾论文
39 回顾论文期刊版 MedIA Vol.114:104282,DOI 10.1016/j.media.2026.104282,2026-11 刊出 期刊页/arXiv 页
40 AMID 内置 CrossMoDA 类,len(ds.ids)=484(2021/2022 合并口径) amid 文档站
41 2022 版注册 233 队(35 国);分割赛道 27 队提交验证榜、12 队(8 国)进入评估;分类 3 队 回顾论文 §4.2
42 2021 版:55 队(16 国)提交验证榜、16 队(9 国)进入评估 回顾论文 §4.1
43 bootstrap 中位 Kendall τ = 1,IQR [1,1];冠军在全部样本保持第 1 回顾论文 §5.6(Fig.9)
44 每个 bootstrap 样本平均保留约 63% 不同病例(有放回抽样 N=271) 回顾论文 §3.3.1
45 aggregate-then-rank(均值)在 ASSD 离群值下稳健性下降;官方为 rank-then-aggregate 回顾论文 §5.6(Fig.11)
46 2022 冠军跨测试集:伦敦单中心 VS DSC 88.45 [84.71-91.95] vs 双机构 86.07 [82.70-89.66];耳蜗 87.11 / 87.63 回顾论文 Table 8
47 2021 冠军模型在 2022/2023 数据上性能显著下降(p<0.01);2023 冠军(最异质训练)全测试集稳健 回顾论文 §6.2
48 发布数据缺年龄/性别/族裔人口学元数据(回顾论文自认局限) 回顾论文 §6.2 末
49 ne2e 分层 cumulative rank:VS 3.5 [1.5-6.0]、耳蜗 1.5 [1.0-2.5](全场最佳) 回顾论文 §5.5 分层表
50 fgh_365 分层:VS 7.0 [5.5-9.0] vs 耳蜗 4.0 [3.0-5.5]——VS 短板决定第 6 名 回顾论文 §5.5 分层表
51 VS 方差大于耳蜗的官方解释:耳蜗位置/体积/强度分布均匀,肿瘤相反 回顾论文 §5.5
52 2023 版:6 队完赛,Docker 截止 2023-07-10,冠军 vandy365(rank score 2.3);瘤内 DSC >74% 回顾论文 §5.4
53 分类任务取消官方原因:“limited number of participants”(参与者数量有限) 回顾论文 §5.1

术语表(36 条)

术语 释义
ceT1 contrast-enhanced T1,钆对比剂增强 T1 加权像,源域模态
hrT2 high-resolution T2,高分辨率 T2 加权像,目标域模态
VS vestibular schwannoma,前庭神经鞘瘤(听神经瘤),桥小脑角良性肿瘤
耳蜗(cochlea) 内耳听觉器官,直径约 10mm 的毫米级精细分割目标
Koos 分级 VS 的 1-4 级分级系统,按 IAC 外扩展与脑干/小脑压迫划分
UDA unsupervised domain adaptation,无监督域适应
跨模态域偏移 不同成像模态间强度分布/对比/伪影的系统性差异
不成对(unpaired) 两模态无逐例配对关系,是 UDA 设置的题面
image-to-image translation 图像翻译,非配对模态间的风格转换(CycleGAN 系)
CycleGAN 循环一致性生成对抗网络,非配对翻译的事实标准
NiceGAN 引入重聚类的 CycleGAN 变体,冠军翻译器
CUT Contrastive Unpaired Translation,对比学习式翻译
UVCGAN / DCLGAN 2022 年出现的 UDA 翻译变体,均有队伍采用
PAST Pixel Alignment + Self-Training,冠军 ne2e 的两段式方案
自训练(self-training) 用初始模型伪标签迭代监督目标域训练的半监督技术
nnUNet 自适应配置的 U-Net 分割框架,分割器主流
DSC Dice Similarity Coefficient,体积重叠指标
ASSD Average Symmetric Surface Distance,平均对称表面距离(mm)
rank score crossMoDA 的两级聚合排名分(病例×结构×指标),越低越好
cumulative rank 单病例上四项名次的累积均值
空预测 全背景输出;ASSD 记 350mm(测试集体素最大距离)
MA-MAE 宏平均绝对误差,有序分级+类别不平衡的官方指标
Kendall τ 秩相关系数,bootstrap 稳定性检验的度量
GIF Geodesic Information Flows,自动脑区分割方法(掩码附属资产)
IAC internal auditory canal,内听道,Koos 分级的解剖参照
modiolus 蜗轴,耳蜗中心低信号结构,标注协议的解剖约定点
basal turn 耳蜗底周,标注协议统一包含(含骨性螺旋板)
SC-GK 立体定向放射外科(Gamma Knife)临床流程,伦敦数据来源工作流
TCIA The Cancer Imaging Archive,Shapey 2021 数据底座的托管库
BrainLes MICCAI 卫星 workshop 系,crossMoDA 挂靠与 proceedings 出版地
QS-Attn 基于熵选择域相关特征的对比式非配对翻译,MAI 队双翻译器之一
SinGAN 单图像多尺度生成模型,LaTIM 用作肿瘤强度增强与融合
mean teacher 师生双网络一致性正则框架,稳定目标域伪标签学习
MS-MT Multi-Scale Mean Teacher,多尺度深监督的 mean-teacher 变体
SE-CUT segmentation-enhanced CUT,带分割解码器的 CUT 翻译
rank-then-aggregate 先按病例排名再聚合名次的排名族(crossMoDA 所用)
aggregate-then-rank 先聚合指标值再排名的排名族(对照方案)

附录

附录 A:条目信息速查卡

项 值
条目名 crossMoDA 2022
url_name crossmoda2022
类型 挑战赛+基准数据集(三合一:赛事/数据/UDA 协议)
论文 arXiv:2506.12006;MedIA 114:104282(2026-11);arXiv:2201.02831(首届);TCIA DOI 10.7937/TCIA.9YTJ-5Q73(数据底座)
团队 King’s College London(牵头)+ ETZ Tilburg
规模 755 例全口径(公开 484:210+210+64);Koos 标注 494 术前例
许可 CC BY-NC-SA 4.0(Zenodo 免注册下载)
抓取时点 2026-09-26
覆盖届次 仅 2022 版(2021 数据同通道分发;2023 另行发布)
参与规模 233 队(35 国)注册;分割 12 队完赛、分类 3 队完赛
评估协议 DSC+ASSD rank score(分割);MA-MAE(分级);1000 次 bootstrap
库内互链 brats(24)/instance2022(645)/wmh-challenge(501)/autoimplant(472)/fdtooth(609)/totalsegmentator(422)/fastmri(23)/ixi-brain(482)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 三入口可索引(专有名称+MICCAI/BrainLes 官方网络+Zenodo);小风险:crossMoDA/crossmoda/CrossModA 多拼写与三官网并存(坑 1)
A 可获取性 9 Zenodo 免注册直接下载(2022-05-01 起至今);扣 1 分:测试集封闭(设计属性)+NC 条款限制商用
I 可互操作 8 NIfTI 标准格式+csv 元数据+MD5 官方校验,进 nnUNet/MONAI 管线零摩擦;扣分:无标准机器可读元数据卡
M 元数据质量 8 回顾论文表格完备(Table 1 数据分布/Table 5 排名/标注协议/序列参数);扣分:伦敦 ceT1 分辨率双口径(坑 2)、分割 inter-rater 系数缺失
S 可持续性 8 Zenodo DOI 永久托管+系列持续举办+期刊回顾论文沉淀;扣分:Koos 分类任务已取消、AMID 第三方口径混届
综合评级 8.2/10(良+) 库内可获取性光谱最开放档+文档三层完备;短板在测试封闭与口径分裂

附录 C:逐项证据链自证

关键数字 来源 位置
755(379+376)/四子集划分 回顾论文 Table 1 arXiv:2506.12006v4
210/210/64 Table 1 × 参赛报告 mai.pdf 双源互证
271(137+134) Table 1 × bootstrap 段 N=271 arXiv:2506.12006v4
Zenodo 文件/MD5/日期/license Zenodo 记录页 zenodo.org/records/6504722
序列参数四表 回顾论文 v4 §2.2 arXiv:2506.12006v4(伦敦 ceT1 与 mai.pdf 口径差,坑 2)
Koos 494/协议/0.11 回顾论文标注协议节+引用 [33] arXiv:2506.12006v4
12 队排名全表 回顾论文 Table 5 arXiv:2506.12006v4
官方榜 DSC 86.9/86.8/85.9 crossmoda-challenge.ml 获奖表 官网(坑 3)
ne2e=北京大学+成员 北大新闻 2022-09-18 bda.pku.edu.cn/info/1003/1351.htm
MA-MAE 0.26/0.37/0.84;7/251 回顾论文 §5.1 arXiv:2506.12006v4
资助编号 Zenodo 记录页+回顾论文致谢 双源
方法谱系全员翻译+分割 回顾论文方法分析节 arXiv:2506.12006v4

附录 D:数据获取决策树

你要什么?
├─ 训练/验证数据(484 例)
│   ├─ 学术使用 → Zenodo 6504722 直接下载(免注册)
│   │   ├─ 下载后先验 MD5(training 8d68fcd4... / validation 1f0b2ac4...)
│   │   └─ 理清 2021/2022 混届目录(坑 6)
│   └─ 商业使用 → 不可行(CC BY-NC-SA 的 NC 条款)
├─ 测试集(271 例)→ 不公开,只能 Docker 提交服务器评估
├─ Koos 标签 → 训练源术前例自带(csv+标签),无需单独申请
├─ GIF 脑区掩码 → GIF.zip 独立下载
└─ 更完整伦敦元数据/基线算法 → TCIA(DOI 10.7937/TCIA.9YTJ-5Q73)

附录 E:序列参数速查(重采样与预处理用)

场景 建议
混合两机构训练 按 spacing 分组重采样;勿假设统一分辨率(0.4/0.47/0.5/0.8mm 四种层内并存)
引用伦敦 ceT1 分辨率 0.47×0.47mm(回顾论文 v4);用 0.4 需注明 2022 参赛报告口径(坑 2)
裁剪兴趣区 用 GIF 掩码取桥小脑角邻域(幕下+颞骨岩部)可减 60% 以上体素量(经验值,自行验证)
强度标准化 ceT1 与 hrT2 分模态各自 z-score;翻译管线内再做直方图匹配
层厚敏感性 hrT2 层厚 1.0-1.5mm,3D 各向同性重采样到 0.5mm 会放大 2-3 倍显存开销

附录 F:双口径登记表(八项)

# 项 口径 A 口径 B 采纳 依据
1 官网域名 crossmoda.grand-challenge.org(系列/2021) crossmoda2022.grand-challenge.org(2022 子站) 双址并列 §7.5/坑 1
2 伦敦 ceT1 分辨率 0.47×0.47mm(回顾论文 v4) 0.4×0.4mm(mai.pdf 2022) 0.47 坑 2
3 冠军 DSC 86.9(官方获奖榜) 86.1(Table 5 VS DSC 中位) 双列 坑 3
4 数据规模 755(全口径) 484(公开/AMID) 双列 坑 4
5 Koos 分类测试 251(回顾论文 §5.1) 官网未列 251(单源存照) 坑 5
6 数据通道 Zenodo 6504722(2022) 同记录含 2021(AMID 合并计数) 正文声明 坑 6
7 发榜时间 2022-09(回顾论文+新闻) 具体日期无官方记录 月份粒度 坑 7
8 队伍机构 8 队有来源 4 队无来源 有则填、无则空 坑 8

附录 G:数据加载骨架(Python / nibabel)

# crossmoda2022 训练源加载骨架(NIfTI,目录结构以解压结果为准)
# 依赖: pip install nibabel numpy
import nibabel as nib
from pathlib import Path

ROOT = Path("crossmoda2022_training")  # training.zip 解压根
# 官方目录按 模态/机构 组织;csv 提供 source 病例元数据
# ceT1 = 训练源(带 VS+耳蜗掩码与 GIF 掩码);hrT2 = 训练目标(无标注)

def load_case(img_path: Path, mask_path: Path | None = None):
    img = nib.load(str(img_path))            # 保留原始 affine 与 spacing
    data = img.get_fdata(dtype="float32")    # 勿在此处重采样(坑 2:口径需先声明)
    out = {"image": data, "affine": img.affine, "zooms": img.header.get_zooms()}
    if mask_path is not None:
        m = nib.load(str(mask_path))
        out["mask_vs"], out["mask_cochlea"] = None, None  # 掩码通道以官方 label 值为准
        out["mask_gif"] = None               # GIF 全脑分区掩码(独立 zip)
    return out

# 提示:训练源 csv(infos_source_training.csv)含人口学元数据,
# 做分层划分(按机构/分级)时先读它;验证集 64 例仅图像。

附录 H:rank score 复现骨架

# 复刻 crossMoDA 2022 Task 1 排名协议(自划测试集上使用;勿与官方终榜对表,Q36)
# 依赖: pip install pandas numpy scipy
import numpy as np
import pandas as pd

def rank_score(per_case_scores: pd.DataFrame) -> pd.Series:
    """per_case_scores: index=case_id, columns=[('VS','DSC'),('VS','ASSD'),
       ('cochlea','DSC'),('cochlea','ASSD')](MultiIndex 列)。
       DSC 越大越好,ASSD 越小越好;空预测 ASSD 记 350mm(§4.1)。"""
    ranks = pd.DataFrame(index=per_case_scores.index)
    for col in per_case_scores.columns:
        ascending = (col[1] == "ASSD")          # ASSD 小者名次高
        ranks[col] = per_case_scores[col].rank(ascending=ascending, method="average")
    per_case_mean = ranks.mean(axis=1)          # 病例内四项名次均值(cumulative rank)
    return per_case_mean                        # 全测试集均值即最终 rank score

final = per_case_mean.mean()
# Task 2 的 MA-MAE(宏平均绝对误差):
# mae_per_level = {k: np.mean(np.abs(pred[k] - true[k])) for k in (1,2,3,4)}
# ma_mae = float(np.mean(list(mae_per_level.values())))   # 每级等权(宏平均)

附录 I:坑点档案对照(§10 索引)

坑 一句话 深入位置
坑 1 三官网地址勿混淆 §7.5、附录 F#1
坑 2 伦敦 ceT1 0.47 vs 0.4 §2.3、附录 E、附录 F#2
坑 3 获奖榜 DSC vs 论文中位 §5.2、附录 F#3
坑 4 755 vs 484 §2.7、附录 F#4
坑 5 Koos 251 单源 §2.7、附录 F#5
坑 6 2021/2022 共用 Zenodo 通道 §2.6、附录 D、附录 F#6
坑 7 发榜时间只到月 §6.4、附录 F#7
坑 8 四队机构不可脑补 §5.1 注、附录 F#8

附录 J:条目自洽性抽查记录(写手自检)

  • 755 = 210+210+64+271 ✓;379+376 = 755 ✓;105+105=210(×2)✓;32+32=64 ✓;137+134=271 ✓
  • 484 = 210+210+64 ✓;221+273 = 494 ✓
  • §5.1 表 rank score 单调递增(3.0→11.3)✓;官方榜与 Table 5 口径差已双列 ✓
  • INFOBOX、§0、§1、附录 A 的规模/冠军/许可数字互相一致 ✓
  • 233 注册 → 27 验证 → 12 完赛漏斗单调 ✓;55→16(2021)与 27→12(2022)损耗比例同量级 ✓
  • 伦敦单中心 88.45 > 双机构 86.07(异质性代价方向正确)✓;耳蜗方向相反已注明 ✓
  • 三届冠军单中心 VS DSC 单调升(87.01→88.45→88.61)与回顾论文 Fig.12 结论一致 ✓
  • FAQ Q8 直觉算例:(100×1+171×12)/271 ≈ 7.9,介于中段与尾部队之间,与构造一致 ✓
  • frontmatter description ≤170 字符、title/subtitle/data_source.name ≤255 字符(入库硬限制)✓

附录 K:核验过程与抓取环境存照

  • WebSearch 三轮(官网语义 / Zenodo 规模 / 结果与获奖)全部命中一手来源;库内 SQL 查重 0 行、writing/ 目录查重无同名(FACTS.md §1)。
  • WebFetch arXiv HTML v4 返回空 → 改用 curl -sL -A "Mozilla/5.0" https://arxiv.org/html/2506.12006v4 抓取 533KB HTML 转纯文本 1395 行(/tmp/crossmoda_review.txt),Table 1/Table 5/标注协议/序列参数均出自该文本。
  • Zenodo 记录页 WebFetch 成功;文件大小/MD5/日期/license/资助/引用要求均取自页面原文。
  • 三源互证判定:官网(任务/规则/评估)× Zenodo(license/文件/日期)× 回顾论文(数据/序列/标注/排名)× 参赛报告 mai.pdf(210/64 互证)× 北大新闻(冠军互证)。

附录 L:缩写速查

缩写 全称
crossMoDA Cross-Modality Domain Adaptation challenge
VS Vestibular Schwannoma
ceT1 / hrT2 contrast-enhanced T1 / high-resolution T2
UDA Unsupervised Domain Adaptation
MP-RAGE / CISS / FIESTA / FFE / TSE 各厂商 3D 序列名(§2.3 表)
DSC / ASSD Dice / Average Symmetric Surface Distance
MA-MAE Macro-averaged Mean Absolute Error
GIF Geodesic Information Flows
IAC Internal Auditory Canal
KCL / KCH / ETZ King’s College London / King’s College Hospital / Elisabeth-TweeSteden Ziekenhuis
SC-GK Stereotactic radiosurgery with Gamma Knife
TCIA The Cancer Imaging Archive
MedIA Medical Image Analysis(期刊)

附录 M:2022 版方法要素采用表(不绑定未证实归属的队伍)

以下要素来自回顾论文 §4.2 方法综述与 Table 2;前三名归属可靠,其余要素仅登记"有队伍采用",不做队名映射(坑 8 同源谨慎):

方法要素 2022 版采用情况
NiceGAN 翻译 冠军 ne2e(PAST)
CycleGAN + QS-Attn 双翻译器并行 亚军 MAI(multi-view translation)
SinGAN 生成式肿瘤强度增强+融合 季军 LaTIM(首创,2023 冠军沿用)
分割增强翻译(SE-CUT 等,带分割解码器) 有队伍采用(多尺度 mean-teacher 框架)
UVCGAN(ViT-UNet 生成器的 CycleGAN 变体) 有队伍采用
StyleGAN 替换 backbone 的 2D CUT 有队伍采用
代理任务(VS 分割+脑区划分一致性) 有队伍采用
3D nnUNet(多为 full-resolution) 全部 12 队
5 折 nnUNet 集成 多支队伍
3D + 2D nnUNet 混合集成 有队伍采用
小 VS 过采样(至 nnUNet 1000 样本上限) 有队伍采用
非光滑 Dice 损失变体 有队伍采用
LCC 后处理(VS 留第 1 连通域、耳蜗留前 2) 有队伍采用
肿瘤强度缩放增强(±50% 模拟高/低信号) 多支队伍采用

附录 N:三届冠军跨测试集完整对照(回顾论文 Table 8 口径)

DSC 中位 [IQR](%);ASSD 中位 [IQR](mm)。这是 §5.8 的完整数据版:

冠军模型 测试集 VS DSC VS ASSD 耳蜗 DSC 耳蜗 ASSD
2021 冠军 伦敦 SC-GK 87.01 [81.81–89.99] 0.3914 [0.2869–0.5207] 85.71 [83.85–86.98] 0.1329 [0.1174–0.1661]
2022 冠军 伦敦 SC-GK 88.45 [84.71–91.95] 0.3041 [0.2285–0.3798] 87.11 [85.04–88.16] 0.1249 [0.1093–0.1537]
2023 冠军 伦敦 SC-GK 88.61 [85.78–91.71] 0.3065 [0.2549–0.3854] 86.30 [84.91–87.35] 0.1177 [0.1037–0.1330]
2022 冠军 伦敦+蒂尔堡 86.07 [82.70–89.66] 0.3847 [0.2794–0.6115] 87.63 [86.31–88.68] 0.1469 [0.1230–0.1701]
2023 冠军 伦敦+蒂尔堡 88.00 [84.27–90.90] 0.3765 [0.2921–0.4756] 84.90 [82.97–86.53] 0.1775 [0.1207–0.2350]
2023 冠军 +UK MC-RC 87.08 [83.25–90.22] 0.4004 [0.3162–0.5130] 84.06 [81.65–85.95] 0.2074 [0.1330–0.2467]

读法提示:VS 的"2022 冠军 88.45 vs 86.07"是异质性代价的直接测量(§5.8 结论一);耳蜗"2023 冠军 87.63 → 84.90 → 84.06"的递减是回顾论文自认的开放问题(§8.7 结论三);同一模型在单中心列的逐年提升(87.01→88.45→88.61)则是"训练数据多样性→单中心性能也更好"的证据。

附录 O:关键判语原文存照(回溯核验锚点)

维护本条目时如需复核关键表述的原文依据,以下英文原句均出自官方回顾论文(arXiv:2506.12006v4 抓取文本):

  1. 分类任务取消原因(§5.1):“Due to the limited number of participants, this task was discontinued in the 2023 edition.”
  2. 机器未达人类一致性(§5.1):“The top-performing team … achieved a MA-MAE score of 0.26, which is significantly higher than the intra-rater variability, estimated at 0.11.”
  3. 方法收敛(§5.3):“All participating teams employed image-to-image translation approaches, predominantly using CycleGAN and its extensions, to bridge the gap between T1 and T2 scans.”
  4. 多机构挑战判语(§5.3):“…highlighting the challenges of cross-modality DA with multi-institutional data.”
  5. 排名稳定(§5.6):“The median Kendall’s τ was 1 and the corresponding IQR was [1; 1], indicating perfect ranking stability.”
  6. 单中心泛化失败(§6.2):“…models trained on homogeneous, single-source data struggle to generalise effectively to heterogeneous, multi-institutional test sets.”
  7. 人口学局限(§6.2):“…the lack of age, sex, and ethnicity information prevents analysis of demographic subgroup performance.”
  8. 临床落地障碍(§6.2):“Several barriers remain before cross-modality DA methods can be adopted in clinical practice, including … robust quality-control mechanisms.”

附录 P:库内互链点对照全表

库内条目 record_id 影像域 与 crossMoDA 2022 的对照维度
brats 24 脑 MRI(多参数) 模态策略相反:全参数给足考融合 vs 单模态标注考迁移
instance2022 645 脑 CT 同届(MICCAI 2022)卫星赛事;评估哲学互证(§4.5)
wmh-challenge 501 脑 MRI(FLAIR) 偏移源对照:多站点单模态 vs 双站点双模态
autoimplant 472 颅骨 CT 同为手术规划导向的临床挑战赛;颅底-耳科邻域
fdtooth 609 牙科 CBCT 跨解剖域的毫米级精细结构分割对照
totalsegmentator 422 全身 CT 规模-精度权衡的另一极:大规模多结构 vs 小样本精标注
fastmri 23 膝关节 MRI(k 空间) MRI 数据形态两端:重建 vs 诊断级分割
ixi-brain 482 健康人脑 MRI 域对照:健康解剖分布 vs VS 患者域;预训练-微调组合

互链使用约定:正文已自然提及(§0/§4.5/§9.1),无手写导航章节;instance2022 条目由其写手维护,本条目仅单向引用其公开结论,不互改。

附录 Q:维护计划与更新触发点

触发点 需更新的内容
回顾论文 arXiv 再更新(v5+)或 MedIA 版勘误 §2.3 序列参数(坑 2 口径可能收敛)、§5 排名数字、附录 O 判语
crossMoDA 新届次发布(2024+) §7.2 系列脉络表、§5.8 跨届回溯(若新回溯分析发布)、坑 1 地址清单
Zenodo 6504722 版本更新/新文件 §2.4 文件清单与 MD5、§6.1 获取方式
AMID 等第三方库计数口径变化 §2.6、坑 6
Koos 分级原始论文(Kujawa et al. 2022)被直接核验 存照 6 升级为直接引用;0.11 的出处层级更新
官方发布 baseline 模型或公开部分官方分数 §6.5 AI-Ready 评估"探针可复现性"评级上调
BrainLes 2022 proceedings 正式卷号/DOI 落定 FACTS 待核 2 消解;§7.5 引用更新

维护原则:所有数字变更必须同步更新事实清单(53 条)与对应坑点存照;两个口径并存的数字(坑 2/3/4)在任何一侧变化时另一侧要复核。

附录 R:快速上手路线(30 分钟版)

给"拿到数据先跑起来"的使用者的最小路径:

  1. 下载与校验(约 5 分钟,不含传输):Zenodo 6504722 → training.zip + validation.zip → md5sum 校验(§2.4 命令);
  2. 理清目录(约 5 分钟):对照 §2.1 四象限表辨认训练源(ceT1,带掩码)/训练目标(hrT2,无标注),注意 2021/2022 混届(坑 6);
  3. 读一例数据(约 5 分钟):nibabel 读 affine 与 zooms,与 §2.3 序列表核对机构归属;
  4. 跑通一个 UDA 基线(约 15 分钟配置):CycleGAN 翻译(ceT1→hrT2)+ nnUNet(源域伪 T2 训练)——这是 12 队共同骨架的最小复刻(§5.4/附录 M);自训时用 GIF 掩码裁桥小脑角兴趣区省算力(附录 E);
  5. 评估:在自划 hrT2 测试集上算 DSC+ASSD,空预测记 350mm,按病例排名聚合(附录 H 骨架)——全程不与官方终榜对表(§5.7 条 6)。

附录 S:官方评估协议逐条复刻清单

把回顾论文与官网描述的评估协议拆成可执行的检查项(自划集复现用):

# 协议项 官方口径 复刻检查
1 分割指标 DSC + ASSD 双指标 两指标都必须报;只报 DSC 不完整
2 评估粒度 每测试病例 × 每结构(VS/耳蜗) 逐例逐结构计算,勿先全局平均
3 聚合方向 rank score = 名次两级均值,越低越好 别把方向搞反(附录 H)
4 空预测 ASSD 记测试集体素最大距离 350mm 全背景输出计 350mm,非 NaN/剔除
5 排名稳健性 1000 次 bootstrap(N=271)+ Kendall τ 至少复刻 bootstrap 名次抖动报告
6 排名族 rank-then-aggregate(均值聚合) 勿用 aggregate-then-rank(§4.3)
7 统计量 中位 [IQR] Table 5 口径;均值口径需声明
8 分类指标 MA-MAE(宏平均,级差绝对误差) 每级等权;错两级罚两倍
9 预处理声明 官方未统一规定 自己的 resample/窗位必须显式声明(坑 2)
10 对照基线 官方未发布 baseline 自建 no-adaptation 裸基线(§5.9 条 2)

尾注

本条目由写手代理 A(影像域)于 2026-09-26 完成,事实底稿见 writing/crossmoda2022/FACTS.md(九节结构,9 条双口径存照 + 3 条待核项)。全部硬数字可循文中 URL 回溯至官方回顾论文(arXiv:2506.12006 / MedIA 114:104282)、Zenodo 记录 6504722、crossmoda2022.grand-challenge.org 与 crossmoda-challenge.ml;单源与二手引用数字(Koos 251 例、重测一致性 0.11)已按坑 5/存照 6 声明口径层级。测试集封闭导致的"探针不可复现"为数据集设计属性而非条目缺陷,已在 §6.5 与附录 B 如实评级。

维护提示:本条目与 FACTS.md 是"正文—底稿"关系,正文数字变更必须回写 FACTS(含存照与待核清单的状态流转);坑点编号(坑 1-坑 8)与附录 F 双口径登记表、附录 O 判语存照构成三层核验体系,更新任一层需同步其余两层。后续更新触发点见附录 Q。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • aims-tbi — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • lisa2025 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • brats — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • atlas-v2 — 共享标签:医学影像 / MRI / 医学图像分割 / 神经科学
  • bonbid-hie — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • crossmoda-2023 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • brats-pediatric — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
  • mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集