信息速览
INFOBOX — M&Ms-2 一屏速览
维度 内容 本质 M&Ms 挑战第二版:STACOM 2021 官方挑战数据集,任务聚焦右心室 RV 单结构分割并新增长轴 4CH 双视图(前代 M&Ms 为 LV/MYO/RV 三结构) 团队 BCN-AIM 实验室(Universitat de Barcelona,Karim Lekadir 组)+ Vall d’Hebron 研究所;通讯 Carlos Martín-Isla,Andrea Guala、José F. Rodríguez Palomares 共同组织 论文 IEEE JBHI 27(7):3302-3313, 2023(doi:10.1109/JBHI.2023.3267857);挑战是 2021 年,总结论文是 2023 年——两个时间坐标不可混写 数据 360 例 cine CMR = Normal 75 + 7 组病理 285(DLV/HCM 各 60,ARR/FALL/CIA 各 35,DRV/TRI 各 30) 中心与设备 3 家巴塞罗那医院;9 台扫描仪、3 厂商(Siemens 5 型/Philips 1 型/GE 3 型);多数 1.5T、少量 3T 视图 短轴 SA + 长轴 4CH 双视图,inter-view 对应关系保留;标注 LV/RV/MYO 三结构,评估仅 RV 划分 训练 160(有标注)/ 验证 40(每病理组 5 例)/ 测试 160;DRV+TRI 完全排除出训练集(未见病理测泛化) 标注 来源中心专家临床医生(3-10+ 年)标注 + 另 2 人复核共识 + cvi42 软件链 + SOP 四规则(新增长轴定界规则 d) 参与 >120 队注册 / 17 队提交测试 / 15 队发表(STACOM 2021,Springer LNCS,ISBN 978-3-030-93722-5) 冠军 nnU-Net 集团最优(P1-P5 表现相当、统计差异有限);跨设备稳定 DSC 0.922±0.011(SA)/ 0.912±0.016(LA) 纵向坐标 较 M&Ms-1 平均 DSC +0.042;与 ACDC 相当(+0.004)且队列更异质 多视图 8/15 队利用双视图;P9 的 RVEF 误差≥10% 病例最少——几何 DSC 与临床指标并非强相关 泛化 未见病理组(除 CIA)DSC 一致更差,Mann-Whitney U 检验 ED 相位统计显著 获取 注册制(官网 www.ub.edu/mnms-2,核验时临时不可用)|Zenodo 仅 2.7MB 设计 PDF|Kaggle/HF 有第三方镜像(非官方分发) 谱系 2012 RVSC(单中心 48 例,无 DL)→ 2020 M&Ms(三结构)→ 2021 M&Ms-2(RV+双视图+未见病理)——首个多中心多疾病多视图 RV 公开 DL 基准
M&Ms-2 是一场"把右心室逼进真实世界"的挑战赛:在它之前,右心室分割的公开基准停留在 2012 年——48 例单中心数据、没有任何深度学习方法参加;在它之后,多中心、多疾病、多视图的 RV 分割第一次有了可对标的开箱基准。360 例 cine 心脏磁共振来自 3 家巴塞罗那医院、9 台不同扫描仪,覆盖健康人与 7 组心血管病理;最关键的设计狠招是:把右心室扩张(DRV)和三尖瓣反流(TRI)两组病理完全藏出训练集,专门用来测模型对"从未见过的病理形态"的泛化能力。15 支队伍的答卷给出了一个既平淡又深刻的结论——nnU-Net 依然是王者,但 DSC 0.92 的漂亮数字之下,未见病理上的系统性下滑和"几何指标不等于临床正确"的裂缝,才是这个数据集留给后人的真正考题。
导语读法三则:
- 只想下数据:直奔 §4 获取与许可——注意数据是注册制、Zenodo 上只有设计 PDF(坑 1),别空手而归。
- 关心泛化与域漂移:直奔 §2.6 未见病理设计 + §6.6 泛化结论——这是 M&Ms-2 相对 ACDC/M&Ms 的独特实验杠杆。
- 要办挑战赛或设计指标:直奔 §5 评估协议 + §7 方法学启示——0.75/0.25 双视图加权、HD 50mm 封顶、未见病理组设计都是现成的协议样本。
- 要引结论数字写论文:直奔 §6.9 可引用结论清单——14 条结论一张表,全部带出处与引用注意。
§0 导读:这个数据集解决什么问题
右心室(RV)是心脏影像分割的"困难户":腔壁薄、形态不规则、基底-心尖边界靠解剖推断而非清晰灰度过渡,同一位病人在不同扫描仪上呈现的 RV 形状差异可以大到掩盖病理本身。2012 年的 RVSC 挑战给出了第一个公开 RV 分割基准,但那是 48 例单中心数据、7 支队伍、全为非深度学习方法(最佳 DSC≈0.80、HD≈1cm)——此后十二年,RV 分割一直没有第二个多中心公开基准,直到 M&Ms-2 出现。此间深度学习早已统治了左心室分割(ACDC、M&Ms 等),但 RV 的公开监督数据缺口依然巨大。
M&Ms-2 的回答分三层。第一层是数据:360 例 cine CMR,3 家医院、9 台扫描仪、3 个厂商,8 个病理组(健康、左室扩张、肥厚型心肌病、心律失常性心肌病、法洛四联症、房间隔交通、右室扩张、三尖瓣反流),短轴与长轴 4CH 双视图,ED/ES 两时相三结构标注——RV 训练样本的异质性一次拉满。第二层是协议:挑战不只在"见过分布"上比拼,而是刻意把 DRV、TRI 两组病理排除出训练集,把泛化能力变成计分桌上的显式变量;排名指标对短轴与长轴加权(0.75/0.25),迫使方法正视长轴视图在基底/心尖定界中的解剖学作用。第三层是结论:15 支队伍的方法论文完整发表(STACOM 2021,LNCS),nnU-Net 集团夺冠但未拉开统计差距,几何 DSC 与 RVEF 等临床指标的脱节被定量摆上台面——这些负结果与正结果同样可引用。
第四层面向本库读者:M&Ms-2 的 AI-Ready 短板(注册制、官网状态、Zenodo 无数据)与其学术高价值形成明显反差,这使它成为"申请制高价值基准"的教科书样本——当直链拿不到时,工程如何规划:先用方法论文与公开材料把管线搭起来,注册通道走通后替换正式数据,第三方镜像只作体量与格式佐证(路径见 §4.6 与附录 D)。
§0 读法三则:
- 这个条目有双时间坐标:挑战/数据/方法论文是 2021 年(STACOM 2021),总结论文是 2023 年(IEEE JBHI)。引数字前先问"出自哪个时点",别把 2023 写进数据集发布年份(坑 2)。
- 它的前作 M&Ms(2020,STACOM;三结构、3 国 6 中心)与它极易混淆——两者数据、任务、论文全部不同(坑 4),本条目开头即锚定区分。
- 全文硬数字均出自 JBHI 论文全文与 Zenodo 官方记录;论文表 II-VI 为图像表格不可机读,个别拆分数字标注为"推算"并说明推算路径(坑 7)。
§1 数据集速览:十问十答
Q1:M&Ms-2 是什么、和 M&Ms 什么关系?
M&Ms-2(Multi-Disease, Multi-View & Multi-Center Right Ventricular Segmentation Challenge)是 M&Ms 挑战的第二版,由同一个核心团队(BCN-AIM + Vall d’Hebron)在 STACOM 2021(MICCAI 2021 同场 workshop)举办。三点变化:任务从 LV/MYO/RV 三结构收敛为只评 RV;新增长轴 4CH 视图(前代只有短轴);队列从 345 例(训练+验证口径)/375 例(总量口径)换成 360 例全新多病理队列。名字里的"Multi-Disease/Multi-View/Multi-Center"三个 M 正是相对前代的升级清单。
Q2:为什么只评 RV?
RV 是心脏分割里最薄弱的环节:薄壁、新月形、边界依赖解剖推断,且临床需求持续增长(肺动脉高压、先心病术后随访、心律失常性心肌病诊断都靠 RV 定量)。前作 M&Ms 已证明三结构任务下 RV 是拖分项;M&Ms-2 干脆把 RV 单独拿出来,配一个异质性拉满的队列,专攻这个短板。LV 与 MYO 的标注仍然存在于数据中(不浪费),但挑战计分只看 RV。
Q3:360 例怎么构成?
75 例健康(Normal)+ 7 组病理 285 例:左心室扩张 DLV 60、肥厚型心肌病 HCM 60、心律失常源性心肌病 ARR 35、法洛四联症 FALL 35、房间隔交通 CIA 35、右心室扩张 DRV 30、三尖瓣反流 TRI 30。病理诊断按论文原文的量化标准执行(如 DLV = LVEDV>214mL 男/179mL 女;HCM = LV 壁厚>15mm),见 §2.3。
Q4:设备和中心情况?
3 家西班牙巴塞罗那医院(Vall d’Hebron、Clínica Sagrada Familia、Dexeus)回顾性收集;9 台扫描仪横跨 3 厂商——Siemens 5 型(Avanto、Avanto Fit、Symphony、SymphonyTim、TrioTim)、Philips 1 型(Achieva)、GE 3 型(Signa Excite、Signa Explorer、Signa HDxt)。绝大多数 1.5T,少量 3.0T(论文口径仅 12 个 3T 样本,其中 5 个进入测试集)。设备异质性超过前作 M&Ms。
Q5:双视图是怎么设计的?
每例同时提供短轴(SA)全堆栈和长轴 4 心腔(LA 4CH)视图,两者在预处理中保留 inter-view 对应关系。长轴的解剖学使命是基底/心尖精确定界:短轴堆栈里"哪一层算 RV 的第一层"是个著名的歧义问题,4CH 视图上三尖瓣环的位置正是答案的锚点(SOP 规则 d,见 §3.3)。这也解释了排名指标为何给 LA 留 0.25 权重。
Q6:"未见病理"设计是什么?
DRV(右心室扩张)与 TRI(三尖瓣反流)两组各 30 例,完全排除出训练集——训练 160 例里一组都没有,它们只出现在验证/测试集。这是把"域泛化"变成协议级实验:模型必须在训练时从未见过这两种形态的情况下给出分割。未见病理设计的执行口径:DRV 30 例、TRI 30 例在训练 160 例中为零;按验证集"每病理组 5 例"反推,测试集约含 50 例未见病理(DRV 25 + TRI 25)——论文表 II 为图像表格,此拆分标注为推算(坑 7)。选择这两组的原因是形态梯度逻辑(§2.2):它们是 RV 本体病变、形态最"不像"任何训练组——是模型最需要在现实里遇到、却故意没教过的考题。
Q7:谁标注的,可靠吗?
每例由来源中心的专家临床医生手工标注(临床经验 3 至 10+ 年)——标注者本身就是日常看这类病人的影像/心内科医生;另设 2 名研究者做详细复审,重点查基底与心尖区,分歧按观察者间共识解决。软件链为 cvi42(Circle Cardiovascular Imaging)勾画 → DICOM + cvi42ws 工作区 → 自研软件统一转 NIfTI。全程统一 SOP(四规则,继承 ACDC/M&Ms 并新增长轴定界规则)。
Q8:排名怎么算?
综合指标 M = 0.75×(DSC_SA + HD_SA)/2 + 0.25×(DSC_LA + HD_LA)/2,DSC 与 HD 均取 ED、ES 两时相平均;HD 做 min-max 归一化并 50mm 封顶(全体最大 HD + 10mm,超出按最差计)。提交走 CodaLab,方法打包 Docker 在主办方服务器(5×NVIDIA RTX 3090)远程评估,测试标签全程不可见;验证期每队最多提交 20 次;禁用外部数据与预训练模型。
Q9:结果如何?
120+ 队注册、17 队提交、15 队发表。冠军集团 P1-P5 全是 nnU-Net 系(6 队用 nnU-Net),彼此统计差异有限;P1-P5 跨扫描仪稳定 DSC = 0.922±0.011(SA)、0.912±0.016(LA)。较 M&Ms-1 平均 DSC 提升 0.042,与 ACDC 相当(+0.004)——而 M&Ms-2 队列明显更异质。未见病理组(除 CIA)DSC 一致更差,ED 相位差异经 Mann-Whitney U 检验统计显著。
Q10:我现在能拿到什么?
三样东西、三个通道:①数据本体——官网 www.ub.edu/mnms-2 注册并同意数据使用政策后获取(研究用途;核验时点官网临时不可用,见坑 5);②挑战设计文档——Zenodo record 4573984(DOI 10.5281/zenodo.4573984),仅 1 个 2.7MB PDF,不含影像;③15 篇方法论文——Springer LNCS(STACOM 2021 论文集,ISBN 978-3-030-93722-5)。另有 Kaggle(约 30.15GB)与 HuggingFace(约 543MB)第三方镜像佐证存在性,但非官方分发、许可状态不明(§4.3)。
§2 数据构成与规格
2.1 规模、来源与中心构成
M&Ms-2 包含 360 例 cine 心脏磁共振(cine CMR)研究,全部为回顾性临床采集,来自 3 家西班牙巴塞罗那医院:
| 中心 | 城市 | 角色备注 |
|---|---|---|
| Vall d’Hebron Hospital(瓦尔·德希布伦大学医院) | 巴塞罗那 | 主导中心;Vall d’Hebron 研究所是挑战共同主办方 |
| Clínica Sagrada Familia(神圣家族诊所) | 巴塞罗那 | 数据来源中心之一 |
| Dexeus Hospital(德克苏斯大学医院) | 巴塞罗那 | 数据来源中心之一 |
三家医院伦理委员会均批准本研究,所有参与者取得书面知情同意(§8.4)。论文没有按中心拆分每家医院的例数(表 II 为图像表格不可机读),"3 中心"是文字可证的硬口径;设备维度的异质性(下节)是比中心维度更细粒度的偏移来源。
多中心临床采集的常规语境也值得交代:回顾性设计意味着队列来自"已经做过临床检查的患者",伦理框架是"既有数据二次利用+知情同意"而非前瞻性入组——这决定了两点:①病理组比例由临床现实决定后经设计调整,而非流行病学代表性抽样;②影像质量继承临床采集标准(bSSFP cine 是 CMR 临床标配,质量总体可靠但无科研级重扫)。使用 M&Ms-2 做"临床现实感"研究是加分项,做流行病学推断则要小心选择偏差。
设计 vs 实际的双口径:Zenodo record 4573984 官方描述写 “450 cardiac MRI datasets”(设计目标口径),实际收集并发布 360 例(论文口径)。这不是错误而是里程碑式措辞——设计文档 2021-03-02 发布时的计划目标,与 2021-05-10 实际发布的训练+验证集规模、最终完整规模 360 例并存于两份官方文档。引用规模时按论文口径 360 例,需要提设计目标时注明"Zenodo 设计口径"(坑 3)。前作 M&Ms 同样存在 375 vs 345 的规模双口径,是同一家族的"传统艺能"。
2.2 病理分布:8 组队列的设计逻辑
360 例按病理分 8 组(论文口径,缩写原文):
| 组别 | 缩写 | 例数 | 定义要点 | 是否进训练集 |
|---|---|---|---|---|
| 健康 | Normal | 75 | 无心血管病理 | 是 |
| 左心室扩张 | DLV(dilated LV) | 60 | LVEDV 超性别阈值(§2.3) | 是 |
| 肥厚型心肌病 | HCM | 60 | LV 壁厚>15mm | 是 |
| 心律失常源性心肌病 | ARR | 35 | 按临床定义 | 是 |
| 法洛四联症 | FALL(ToF) | 35 | 术后/随访先心病 | 是 |
| 房间隔交通 | CIA(文献亦作 IAC/ASD) | 35 | 房水平分流病变 | 是 |
| 右心室扩张 | DRV(dilated RV) | 30 | RVEDV 超性别阈值(§2.3) | 否(未见) |
| 三尖瓣反流 | TRI | 30 | 按临床定义 | 否(未见) |
| 合计 | — | 360 | — | 训练 160 / 验证+测试 200 |
数量阶梯背后是设计意图而非随意:
- Normal 75 最大——健康形态是所有方法的"底色",多给。
- DLV/HCM 各 60 次之——这两组是最常见的心肌病表型,且形态改变主要在 LV 侧,对 RV 任务构成"结构性干扰"(RV 腔被推挤变形)但不至于不可辨认。
- ARR/FALL/CIA 各 35 中档——RV 形态开始显著异常(FALL 术后 RV 常见重构、ARR 累及右心)。
- DRV/TRI 各 30 最小且全部排除出训练——这两组是 RV 本体病变(RV 扩大、瓣膜反流致 RV 容量负荷),正是"模型最需要泛化到"的形态,刻意留作未见考题。
每组病理的影像学含义(算法研究者的临床速修课)
对使用 RV 数据但不做临床的算法研究者,八组形态一句话画像:
- Normal(75):新月形薄壁 RV,短轴上"月牙"包绕圆形 LV 腔——所有方法的舒适区。
- DLV(60):LV 扩张推挤 RV,月牙被压扁变形——RV 自身边界正常但几何关系异常,考验"空间关系先验"而非边界检测。
- HCM(60):心肌增厚挤占腔体,双室腔同时变形——壁厚变化直接改变 RV 外缘的灰度过渡与心包-心肌界面。
- ARR(35):心律失常源性心肌病累及右心时可见右室壁结构与形态异常——RV 本体病变的轻度版。
- FALL(35):法洛四联症术后 RV 常显著扩大、壁厚不均、形态个体差异极大——先心病形态的"教科书无标准答案"区,也是"来源中心专家标注"模式(§3.1)价值最大的组:只有日常看先心病的医生才敢标。
- CIA(35):房水平分流使 RV 容量负荷增加、腔体扩大——形态上与 DRV 同向但程度较轻;它也是未见组下滑规律中的唯一例外(§6.6),与其 RV 形态改变最温和相容。
- DRV(30,未见):右室扩大直接命中任务目标结构本身——两种病因学路径(原发扩张与反流负荷)之一。
- TRI(30,未见):三尖瓣反流的容量负荷同样扩大 RV——与 DRV 组成"未见双保险":病因不同、同向形态偏移。
这组画像揭示病理组设计的第二层逻辑:除数量阶梯外,形态偏移方向也成梯度——从"LV 侧病变干扰 RV"(DLV/HCM)到"RV 侧轻度受累"(CIA/ARR)到"RV 本体重构"(FALL/DRV/TRI),模型面对的形态难度随组递增,而最难的两组恰好被隔离成考题。
三个研究场景的最小可行数据面
拿到数据(或规划申请)时,不同研究目标需要的数据切片不同:
| 场景 | 需要的最小数据面 | 关键注意 |
|---|---|---|
| 训练 RV 分割模型 | 官方训练 160 例(有标注) | 遵守数据政策用途边界;禁预训练口径仅约束挑战复现,非挑战用途自行声明 |
| 泛化/域漂移研究 | 训练 160 + 验证 40 + 未见组 | 测试集标签的公开状态以官网注册页为准——挑战外研究通常按官方划分或自划分执行,别默认能拿到 160 例测试标签 |
| RV 定量/临床指标研究 | 任意子集 + ED/ES 标注 | EDV/ESV/RVEF 由标注直接计算;逐例层数、体素规格不统一,体积计算须逐例读元数据 |
第三行的实操提醒值得重复:M&Ms-2 没有统一体素规格(§2.7),任何"用统一数组尺寸加载全集"的偷懒脚本都会悄悄引入重采样误差——体积类指标对层厚尤其敏感。
病理×划分的完整矩阵在论文表 II 中,但该表为图像格式无法机读提取;文字可证的硬数字为:总量 360、训练 160、验证 40(每病理组 5 例)、测试 160、DRV/TRI 训练集为 0。其余拆分(如测试集内各病理组例数)为推算并按坑 7 处理。
缩写对照(读文献必带):论文自身混用多套缩写——CIA 与 IAC 互见(inter-atrial communication,文献中同义于 ASD 房间隔缺损口径)、FALL 与 ToF 互见(tetralogy of Fallot);论文原文还把 Tetralogy 拼成了 “Tetrology of Fallot”(笔误存照)。检索时这些变体都要试(坑 6)。
2.3 病理诊断标准(论文原文量化口径)
论文给出了三组的量化入组标准,其余按各自临床定义:
| 病理 | 量化标准(论文原文) | 备注 |
|---|---|---|
| DLV(左心室扩张) | LVEDV > 214 mL(男) / 179 mL(女) | 性别分层阈值 |
| DRV(右心室扩张) | RVEDV > 250 mL(男) / 201 mL(女) | 性别分层阈值;与 TRI 同为未见病理 |
| HCM(肥厚型心肌病) | LV 壁厚 > 15 mm | 经典临床口径 |
| ARR / FALL / CIA / TRI | 按临床定义 | 论文未给单一线性阈值 |
三点解读:
- DLV 与 DRV 阈值来源对称——左右心室扩张各按性别定界,意味着"扩张"在本数据集是体积累积口径而非目测定性;DRV 的入组直接决定了未见病理组的形态幅度。
- HCM 的 15mm 是室间隔/游离壁最大舒张末厚度的国际通用切点,HCM 组因此主要考验"心肌增厚挤压双室腔"的形态鲁棒性。
- 这些标准是"入组标准"而非"金标签"——组标签由临床诊断链给出(含影像与临床信息),分割标注是独立的另一条流水线(§3);用 M&Ms-2 做病理分类研究时,标签的置信来源是临床诊断而非分割结果。
2.4 扫描设备矩阵:9 台扫描仪、3 厂商
设备异质性是 M&Ms-2 相对 ACDC(单厂商)与 M&Ms(6 中心但设备谱较窄)的核心增量。论文口径的 9 台扫描仪:
| 厂商 | 型号 | 数量小计 |
|---|---|---|
| Siemens | Avanto、Avanto Fit、Symphony、SymphonyTim、TrioTim | 5 型 |
| Philips | Achieva | 1 型 |
| GE | Signa Excite、Signa Explorer、Signa HDxt | 3 型 |
场强构成:大多数为 1.5T,少量 3.0T。论文文字口径明确"12 个 3T 样本中 5 个进入测试集"——这是机读可证的少数设备维度硬数字之一,也意味着 3T 样本在训练集中最多 7 个,其稀疏性本身就是一个隐性的"域稀缺"实验。逐台扫描仪×例数的完整矩阵在论文表 III(图像表格,不可机读,坑 7)。
分辨率维度的异质性同样显著:面内分辨率与层厚跨中心差异大(表 III 图像表格存照)。对使用者的直接含义:任何"在 M&Ms-2 上训练、在别处测试"或反向的域泛化实验,都要把设备/分辨率作为显式分层变量——它就是这份数据集被设计出来的主要扰动源之一。
厂商维度的补充说明:三家厂商的 cine 序列参数生态(翻转角、并行采集方案、带宽等)直接影响 bSSFP 的对比度与伪影形态——例如暗带伪影(banding)的位置与血液-心肌对比在同病异机间可呈现系统性差异,这类差异正是多厂商基准要暴露的"域指纹"。Siemens 家族在本数据中占 5 型(§2.4 表),型号内部仍有参数差异,"型号"不是域的最细粒度。对域自适应研究者:扫描仪型号标签随数据发放,是最直接的域标签,比自行聚类可靠。
对选型者的映射:要单厂商纯净对照 → ACDC;要三结构多国家多厂商 → M&Ms;要 RV 单结构+双视图+病理谱+未见组 → 本条目。三者构成 CMR 分割公共基准的互补三件套(§8.2)。
2.5 双视图设计:SA 与 LA 4CH 的分工
每例同时提供两种视图的 cine 序列:
| 属性 | 短轴(SA) | 长轴 4 心腔(LA 4CH) |
|---|---|---|
| 覆盖 | 心底至心尖的全层堆栈 | 单层面四腔全景 |
| 标注 | LV/RV/MYO 三结构逐层 | 同三结构 |
| 传统角色 | 容积定量的主力视图 | 形态筛查/教学视图 |
| 在 M&Ms-2 中的使命 | 计分主力(指标权重 0.75) | 基底/心尖定界的解剖参考(权重 0.25) |
两个关键设计细节:
- inter-view 对应关系在预处理中保留——同一例的 SA 堆栈与 LA 视图不是两份孤立数据,而是带对应关系的配对。这是为"多视图方法"准备的结构:模型可以显式利用 LA 定位 SA 堆栈的有效范围。15 支参赛队中 8 支真的用了双视图互补信息(§6.5)。
- LA 的解剖学使命被写进了 SOP——规则 d(§3.3)把"RV 基底 slice 由三尖瓣环在 4CH 上的位置推断"固化为标注规则,也间接固化为评估预期:基底区是 RV 分割误差的重灾区,而 LA 视图是唯一能一眼看清三尖瓣环与心尖的视图。
对模型设计的启示:把 LA 当"辅助模态"丢弃会损失定界信息;把 LA 当"独立第三通道"堆进去则浪费对应关系。M&Ms-2 是少数把这个问题做成显式实验的公开数据集。
还有一层容易被忽略:双视图采集本是 CMR 临床协议的标配——M&Ms-2 没有发明新采集,只是把临床常规里"人人都拍但基准里没人计分"的那一半(LA)变成评估对象。这一步补上了"临床数据丰富度"与"基准任务丰富度"之间的落差,也提示数据集工程者:审视手头临床数据时,先问"哪些常规采集维度被基准实践浪费了",往往比发明新协议收益更快。
2.6 划分与未见病理设计:把泛化摆上计分桌
三段划分(论文文字硬口径):
| 集合 | 例数 | 标注 | 用途 |
|---|---|---|---|
| 训练 | 160 | 有(NIfTI 公开发给参赛者) | 模型拟合;不含 DRV/TRI |
| 验证 | 40 | 无(标签在主办方侧) | 提交计分(CodaLab 实时反馈);每病理组 5 例 |
| 测试 | 160 | 无(标签在主办方侧) | 最终排名;Docker 远程评估 |
未见病理设计的执行细节:
- DRV 30 例、TRI 30 例在训练集中为零——文字可证(论文明确这两组用于测试泛化)。按验证集"每病理组 5 例"的均匀口径推算,每组验证占 5 例、测试占 25 例,即测试集约含 50 例训练时从未见过的病理(DRV 25 + TRI 25)——此拆分为推算口径,论文未以文字明说测试集内未见例数,引用时注明(坑 7、附录 I)。
- 设计逻辑:DRV/TRI 是 RV 本体病变(右室扩张、容量负荷),形态上最"不像"训练集里任何一组;把它们藏出训练集,模型分数的下滑就纯粹归因于"没见过这种形态",而不是类别不平衡或采样噪声。
- 结果验证了杠杆的有效性:未见病理组(除 CIA 外的各病理组)DSC 一致更差,且 Mann-Whitney U 检验在 ED 相位(SA 与 LA 两视图)呈统计显著(§6.6)——"需要更多样的形态学样本"由此从直觉变成测量结论。
这套设计对后续挑战赛的影响是范式级的:把 OOD(out-of-distribution)子集显式嵌入官方划分,让泛化能力从"附加分析"变成"排名内变量"。库内记录的多个后续挑战赛条目都能看到这一设计的回声。
对挑战成绩解读的反向提醒:由于 DRV/TRI 不在训练分布内,任何把 160 例测试集当作单一整体报告分数的做法都会稀释未见组信号——论文按病理组拆分分析正是为了暴露这一点;复现者自建评测时也应分组报告,否则会在"平均 DSC 很高"的表象下漏掉泛化失败的组。
协议内 OOD vs 事后 OOD:方法学差异对照
文献里大量域泛化结论来自研究者"自行划分 OOD 子集"的回顾性设计,M&Ms-2 是协议内建——两者的证据等级不同:
| 维度 | 协议内 OOD(M&Ms-2) | 事后 OOD(常见回顾设计) |
|---|---|---|
| 隔离时机 | 数据发布前由组织方固化 | 实验时由研究者划分 |
| 泄漏风险 | 极低(分组先于一切训练) | 中-高(预训练/调参阶段可能见过 OOD 样本) |
| 可比性 | 全部参赛方法同一口径 | 各研究划分口径不同,难以横向比较 |
| 结论性质 | 排名内变量、有显著性检验背书 | 附加分析、常无检验 |
| 复用建议 | 直接引用 | 引用时注明"作者自划分" |
这张表也是本条目对"为什么 M&Ms-2 的泛化结论值得优先引用"的操作化回答。
2.7 标注结构、时相与分辨率
| 属性 | 规格 |
|---|---|
| 影像类型 | cine CMR(bSSFP 型亮血序列)——无 LGE、无任何延迟强化序列(证伪存照:任务头"含 Scars LGE 子集"印象错误,见坑 8) |
| 视图 | SA 堆栈 + LA 4CH,双视图成对交付 |
| 标注结构 | LV 腔、RV 腔、LV 心肌(MYO)三结构 |
| 标注时相 | ED(舒张末期)与 ES(收缩末期)两帧 |
| 交付格式 | NIfTI(影像与掩码);原始 DICOM 与 cvi42 工作区由主办方保留 |
| 评估对象 | 仅 RV(LV/MYO 标注存在但不计分) |
| 中间帧 | ED/ES 之外的动态帧无标注(与前作一致) |
时相口径的工程含义:数据名义上是"cine"(动态序列),但可用的监督只有 ED/ES 两帧——做全周期时序分割(motion-aware segmentation)没有现成标签,只能用 M&Ms-2 做两时相任务或自行扩展标注。分辨率与层厚跨中心异质(§2.4),没有任何全数据集统一的体素规格——预处理脚本必须按例读取元数据。
2.8 与前作队列的字段级对照
| 字段 | M&Ms(2020) | M&Ms-2(2021) |
|---|---|---|
| 总量 | 345(训练+验证口径)/375(总量口径,双口径) | 360(实际发布)/450(设计口径,双口径) |
| 中心 | 6 中心 3 国 | 3 中心(巴塞罗那) |
| 厂商 | 4 | 3(但型号更多:9 台) |
| 视图 | 仅短轴 | 短轴 + LA 4CH |
| 未见病理组 | 无 | DRV/TRI(协议内 OOD) |
| 计分任务 | LV/MYO/RV 三结构 | 仅 RV |
| 总结论文 | TMI 2021 | JBHI 2023 |
| 冠军模型存档 | Zenodo record 4288464 | 无 |
对照读法:M&Ms-2 用"地理收缩"换"设备与病理扩张"——国家数从 3 收到 1,但设备异质性与病理谱双双超过前代;同时把任务从"三结构"收窄为"单结构深做",并引入前代没有的协议内 OOD。两代不构成替代关系而是互补关系:要跨国多厂商三结构基准用 M&Ms,要 RV 深做、双视图与泛化实验用 M&Ms-2。字段级对照也是检索防混淆的操作化清单(坑 4)——按这张表逐字段核对,就不会把两代的数字串门。
§3 标注流水线:中心专家 + 双复核 + cvi42 链
3.1 人员结构
| 层级 | 人员 | 职责 |
|---|---|---|
| L1 标注 | 来源中心的专家临床医生(临床经验 3 至 10+ 年) | 逐例手工勾画 LV/RV/MYO 三结构、ED/ES 两时相 |
| L2 复核 | 另设 2 名研究者 | 详细复审,重点基底与心尖区 |
| L3 仲裁 | 观察者间共识 | L2 发现的分歧由共识机制解决 |
"由来源中心专家标注"是这个流水线最值得注意的选择:标注者不是外包团队或受训学生,而是日常报告这类病人的临床医生——HCM 组由看 HCM 的中心标、FALL 组由做先心病的中心标。代价是跨中心标注风格可能不同(这本身就是一种真实的域变异,论文以统一 SOP 对冲);收益是形态判断的临床可信度高,尤其先心病术后这类教科书上找不到标准答案的形态。
复核资源向两端倾斜:基底区(slice 归属歧义)与心尖区(腔体最小、误差相对值最大)是复审重点——这与后续挑战结果里"基底欠分割最严重、心尖区因体积小误差大"的误差分布正好互为因果(§6.7)。
3.2 软件链:cvi42 到 NIfTI
标注生产链四段(论文原文口径):
- cvi42 勾画与修正——Circle Cardiovascular Imaging(Calgary)的心血管影像商业分析软件,CMR 临床定量的事实标准工具之一;临床医生在临床工作流内直接标注,不引入陌生工具。
- DICOM 影像 + cvi42ws 工作区——影像以 DICOM 保留原始元数据,勾画轮廓存为 cvi42 专有工作区格式。
- 自研软件转换——主办方用内部软件把 cvi42ws 轮廓栅格化、对齐、打包。
- NIfTI 交付——参赛者拿到的影像与标注均为 NIfTI(医学影像研究的通用格式),与 ACDC/M&Ms 的交付格式一致,保证了三个基准之间的管线兼容性。
临床工具链直接产出科研基准、再无缝转成开放格式——这条路径对其他中心是可复制的模板:不要求医生改变工作流,转换成本全部由主办方吸收。
3.3 SOP 四规则:基底歧义的制度化解法
标注遵循统一 SOP,四条规则(继承 ACDC/M&Ms 惯例并新增规则 d):
- (a) 腔体全覆盖:LV/RV 腔体含乳头肌与小梁完全覆盖——容积口径的"血液池"定义,不剔除腔内结构。
- (b) 基底不插值:基底区心肌边界必须逐层手工勾画、不得层间插值——基底是形态变化最剧烈的区域,插值会系统性抹掉真实边界。
- © 时相校验:RV 容积必须满足 ED 帧 > ES 帧——防止时相标反的粗错误混入。
- (d) 长轴定界(M&Ms-2 新增):长轴 4CH 视图作为基底/心尖界定的参考——RV 基底 slice 由三尖瓣环在 4CH 视图上的位置推断;心尖 slice 为最后一个可见心室腔的层面。
规则 (d) 是对前作遗留问题的正面回应:M&Ms 与 ACDC 时代,"短轴堆栈从哪一层开始算 RV 基底"是观察者间变异的最大来源之一——三尖瓣环在短轴上没有清晰的灰度边界,不同标注者的起点可以差出一两层,而每差一层,EDV/RVEF 的计算就漂移一截。M&Ms-2 把 LA 视图引入数据并写进 SOP,等于给基底歧义提供了第二视角的解剖锚——这是"多视图"从数据集卖点变成标注质量工具的关键一步,也是排名指标给 LA 留 0.25 权重的正当性来源。
四条规则的执行顺序也有讲究:© 是粗校验(时相没标反才谈得上其他),放在复核流水线的最前端;(a) 是口径统一(决定所有容积数字的分母),在任何边界讨论之前;(b) 与 (d) 是精细校验(都针对基底),在复核中合并执行——复核资源按"先 ©(a) 全查、后 (b)(d) 重点查基底/心尖"分配。复刻此 SOP 的团队可以直接继承这个校验顺序:粗错拦截在前、精细仲裁在后,仲裁火力对准规则试图解决而未完全解决的地方。
3.4 时相与帧覆盖的边界(复用者必读)
ED/ES 双时相标注支撑 EF、心肌质量等临床指标的标准计算口径;其余心动周期帧无标注。两条边界要写进任何复用计划:
- 时序模型没有免费监督——想训练动态分割,只有 2/N 的帧有标签;中间帧只能做自监督/配准式利用,或拿 ED/ES 插值做伪监督(均有偏)。
- ED/ES 本身由影像判定——挑战未交付心电门控元数据口径的时相标签文件,时相选择在 cvi42 临床流程内完成,属于"已判定的专家输出";复用者应把它当作给定条件而非需要复现的变量。
3.5 与前作流水线的传承对照
| 维度 | ACDC(2017) | M&Ms(2020) | M&Ms-2(2021) |
|---|---|---|---|
| 标注者 | 专家(单中心) | 各来源中心专家 | 各来源中心专家(3-10+ 年) |
| 复核 | 内部 | 双人复核+共识 | 双人复核+共识(重点基底/心尖) |
| 工具链 | — | cvi42 链 | cvi42 链 |
| SOP | 基础规则 (a)(b)© 前身 | (a)(b)© | (a)(b)©+(d) 长轴定界 |
| 视图 | 短轴 | 短轴 | 短轴+LA 4CH |
| 交付 | NIfTI | NIfTI | NIfTI |
演进方向清晰:标注人不动(临床专家),变的只有两处——复核火力对准误差高发区,视图维度为解法定界。这份"加法最小化"的迭代策略值得数据集工程参考:每代只解决一个上一代被证实的最大痛点。
3.6 观察者间变异的治理链条与残余盲区
把标注治理拆成四道工序,每道对准一种变异源:
| 变异源 | 治理工序 | 残余量级 |
|---|---|---|
| 标注者间水平差异 | 来源中心专家准入(3-10+ 年经验门槛) | 低 |
| 同一人前后不一致 | 统一 SOP 四规则 | 低-中 |
| 观察者间边界分歧 | 2 人复核+共识仲裁(火力集中基底/心尖) | 中——集中在固有难区 |
| 中心间风格差异 | SOP 统一约束 | 中——论文未报告跨中心交叉重标一致性 |
最后一行是诚实的盲区:公开材料没有跨中心观察者间一致性系数(如交叉重标的 DSC/κ 矩阵),"中心间风格差异"在标注层的量级无法量化——它混在数据自身的域变异里。对纯方法研究无碍(方法本来就要在域变异下工作);对"标注一致性"本体研究是缺失项,需自测补齐。这也再次抬高规则 (d) 的价值:基底归属是最大的潜在中心间分歧源,SOP 直接给了它一个客观锚点(三尖瓣环位置),等于在最危险的地方先装了护栏。
3.7 标注质量与指标封顶的反身关系
一个容易被忽略的闭环:HD 封顶 50mm(§5.4)的设定隐含标注质量假设——若标注本身在基底存在跨例不一致(同一解剖位置被不同标注者划到不同层),方法在这类例上的 HD 会被系统性抬高,封顶把这类"标注-方法混合误差"压进同一个最差档。这不是缺陷而是要知情:极端差的 HD 可能包含标注分歧的贡献,解读垫底提交时"50mm+"未必全是方法的锅。反过来说,规则 (d) 在标注层消解了最大不一致源,使测试期 HD 更接近纯方法误差——标注协议与评估指标在这里形成了相互支撑:协议 (d) 让指标封顶更干净,指标封顶让协议残余不至爆炸。
§4 获取与许可:注册制数据 + 一个"只有说明书"的 Zenodo
4.1 官方渠道矩阵
| 资产 | 入口 | 许可/条件 | 状态(核验时点) |
|---|---|---|---|
| 数据本体(影像+标注) | 官网 www.ub.edu/mnms-2(论文脚注 2 口径) | 注册并同意数据使用政策后获取;研究用途 | 2026-09-26/27 核验返回 “Pàgina temporalment no disponible”(临时不可用) |
| 挑战设计文档 | Zenodo record 4573984,DOI 10.5281/zenodo.4573984 | 公开下载 | 可访问;仅 1 个 2.7MB PDF(挑战设计说明),md5 f1c1e1845b87cd8bd00ebe48ba11c31e;published 2021-03-02 v1 |
| 15 篇方法论文 | Springer LNCS(STACOM 2021 论文集,ISBN 978-3-030-93722-5) | 订阅/机构获取 | 可检索 |
| 总结论文 | IEEE JBHI 27(7):3302-3313, 2023,doi:10.1109/JBHI.2023.3267857 | IEEE 版权 | 机构订阅 |
Zenodo 记录署名五人:Carlos Martín-Isla、José F. Rodríguez Palomares、Andrea Guala、Sergio Escalera、Karim Lekadir——正是主办方科学侧与机器学习侧的核心名单。标题 “Multi-Disease, Multi-View & Multi-Center Right Ventricular Segmentation in Cardiac MRI (M&Ms-2)” 与挑战同名。
三个官方渠道的细读:
- 官网(数据本体):www.ub.edu/mnms-2 是论文脚注 2 给出的正式入口。注册制意味着数据与身份绑定——对数据提供方是反滥用措施,对使用者是排期变量:注册审批与发放等待都要计入项目计划。核验时点的"临时不可用"(§4.2、坑 5)恰好演示了单官网依赖的风险。
- Zenodo(设计文档):元数据完备(作者五人、DOI、2021-03-02 v1、单文件 2.7MB)。它把挑战的任务定义、指标协议、时间线固化为可引用版本——设计 PDF 是了解"主办方原意"的第一手材料;当论文(2023)与设计文档(2021)表述有出入(如 450 vs 360)时,按各自时点分别引用而不是互相覆盖。
- 论文集(方法细节):15 篇方法论文是复现的真正入口——总结论文只给排名与 aggregate 分析,网络架构、预处理、训练细节都在各队自己的论文里。
4.2 最大的检索陷阱:Zenodo 上没有数据
这是本条目最重的一条获取警示:在 Zenodo/Google 检索"M&Ms-2"首先命中的是 record 4573984,而它里面只有设计 PDF,没有任何影像或标注。数据本体的唯一官方通道是官网注册制。三层后果:
- 自动化采集脚本会空手而归——按"DOI → 下载"的惯性走 Zenodo,拿到的是 2.7MB 的说明书而非 30GB 级的数据集。
- "发布"语义要辨析——Zenodo v1(2021-03-02)发布的是挑战设计与任务定义(含 450 例设计目标口径),数据本体 2021-05-10 才经官网面向注册者发布训练+验证部分。两条发布线时间不同、载体不同、内容不同。
- 任务头印象的 DOI 10.5281/zenodo.8498334 为错误记忆——curl 返回 404、Zenodo API 与站内搜索均无此记录;真实 DOI 为 10.5281/zenodo.4573984(由前作档案线索 + 官方页核验确认,证伪存照见坑 1)。
一个 Zenodo 检索者的真实动线复盘(防坑演练):检索 “M&Ms-2” → 命中 record 4573984 → 看到 “Multi-Disease, Multi-View & Multi-Center…” 标题与官方署名,确认是对的东西 → 点开 files:只有 1 个 PDF → 常见误判 A:“数据还没传”(错,本体从来不在 Zenodo)→ 常见误判 B:“找到了 DOI,数据=DOI 可引”(对一半:DOI 引的是设计文档,引数据本体要引官网注册通道或论文)→ 正确动作:下载 PDF 读协议,官网注册要数据。这条动线值得写进任何以本数据集为对象的采集脚本的注释里。
4.3 第三方镜像:佐证存在性,不构成官方分发
| 镜像 | 平台 | 体量 | 状态 | 定性 |
|---|---|---|---|---|
| 社区镜像 | Kaggle | 约 30.15GB | 公开;license 标 Unknown | 非官方分发;规模口径与完整数据集相容 |
| 个人镜像 | HuggingFace(用户 viennh2012) | 约 543MB | 公开 | 非官方分发;体量远小于完整数据集,疑为子集/重打包 |
两条镜像的用途边界要划清:它们能佐证数据集真实存在、体量级正确(30.15GB 与 360 例双视图 cine CMR 相容),可在官网不可用时提供"长什么样"的参考;但不应作为生产管线的正式数据源——许可链断裂(Kaggle 镜像 license Unknown)、版本无背书、完整性无声明。正式使用一律回官网注册通道。此外,前作 M&Ms-1 冠军模型有官方 Zenodo 存档(record 4288464),M&Ms-2 没有同等奖金模型存档记录——想要"现成 RV 分割模型"的话,这个数据集不提供官方权重出口。
镜像使用的三条纪律:①只读不引——了解数据长相与格式可以,论文里报告"数据取自 Kaggle 镜像"会成为许可瑕疵;②不进生产——管线数据源必须可追溯至官方发放;③不重分发——二次上传镜像同时触碰官方政策与平台条款。
4.4 许可条款细读
数据本体无标准开源许可证文本:获取条件是"注册并同意数据使用政策"(与 M&Ms 一致的口径)——这是学术影像数据集的常见做法(政策即合同),但对自动化管线意味着:没有机器可读的 license 字段、再分发与商用条款以注册时同意的政策文本为准、跨平台搬运(如镜像站)在许可上站不住。论文(JBHI)为 IEEE 版权;设计 PDF 与 Zenodo 元数据的许可以 Zenodo 记录页为准。
引用与致谢惯例建议:使用数据发表论文时,引用双件套(Zenodo dataset 条目 + JBHI 论文,见附录 K);致谢中照录三家医院与资助编号(§8.4)——多数欧洲资助体系(H2020 系)把致谢作为合规审计项;若政策文本有额外署名要求,以注册时同意的版本为准。
4.5 AI-Ready 评估:注册制的失分与文档的补偿
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:Zenodo 记录(DOI、作者、时间线)+ JBHI 论文 + 15 篇方法论文——文献侧完备;数据侧元数据(逐例标签、扫描仪映射)随注册发放。
- 公开直链:缺失——本体必须注册,Zenodo 只有设计 PDF。这是 AI-Ready 最大失分项。
- 许可明确性:中——"注册+同意政策"是明确流程,但无 SPDX 可读许可证,脚本化合规困难。
- 格式互操作:良——NIfTI 通用格式,与 ACDC/M&Ms 管线直接兼容。
- 文档自洽:论文正文与 Zenodo 描述存在 450/360 双口径;表 II-VI 图像格式不可机读——使用时以文字口径为准(坑 3、坑 7)。
- 可复现性:15 篇方法论文公开 + 至少一支参赛队开源代码(§8.1),但官方未发布统一评测代码或模型权重。
综合:AI-Ready 等级"中下"——学术价值与协议设计一流,可获取性被注册制+官网状态拖累。检索者应把它当作"申请制高价值基准"而非"即插即用数据集"来规划工程。
4.6 获取沟通路径建议
官网不可用时的替代路径,按正式程度排序:
- 隔期重试——“Pàgina temporalment no disponible”(加泰罗尼亚语"临时不可用")字面即平台临时状态;学术机构网站在假期/迁移期短暂下线并不罕见,宜数日或数周后重试。
- 联系通讯作者——Carlos Martín-Isla(Vall d’Hebron 研究所)是 Zenodo 署名第一作者与论文通讯;邮件附研究用途简述+机构隶属(与学术数据请求的通用信息要求同构)。
- 经 BCN-AIM 实验室渠道——巴塞罗那大学 Lekadir 组的机构主页通常维护 M&Ms 系列入口与组内联系方式,是官网之外的机构级入口。
- 学术会议渠道——STACOM workshop 系列年年随 MICCAI 举办,经当届组织者转接是学术圈的常规操作。
不推荐:在论坛/issue 区索要镜像链接、接受私人转发——许可链与版本链都会断,与 §4.3 三条纪律冲突。
§5 挑战设计与评估协议:把泛化和可复现写进规则
5.1 时间线:五个月走完全程
| 时点 | 事件 |
|---|---|
| 2021-03-02 | Zenodo 发布挑战设计文档(v1;设计目标口径 450 例) |
| 2021-05-10 | 训练集 160 例(含标注)+ 验证集 40 例(无标注)发布 |
| 2021-07-01 至 2021-07-20 | 测试期:提交开放约三周 |
| 2021-09/10 | STACOM 2021 workshop(MICCAI 2021 同场)结果公布与颁奖 |
| 2022-09-21 至 2023-07-03 | 总结论文周期:投稿→大修→录用→在线(2023-04-17)→终版(2023-07-03) |
从设计发布到颁奖约半年,节奏紧凑;训练/验证与测试期之间留出约七周方法开发窗——这个窗口长度被后续多个挑战赛沿用为合理默认。
时间线的两个设计细节:①训练发布(05-10)到测试期开启(07-01)约 7 周——这是参赛者实际的方法开发窗;②**测试期约 3 周(07-01 至 07-20)**后快速出结果、9/10 月 workshop 颁奖——从数据发布到学术闭环约半年。对办赛者,这个节奏是"参赛者能完成、组织方不失焦"的经过验证的默认值。
5.2 参与漏斗:120 → 17 → 15
| 漏斗层 | 规模 | 口径 |
|---|---|---|
| 注册下载数据 | >120 队 | 官网注册制下的累计参与意向 |
| 提交最终测试 | 17 队 | 通过验证期筛选后进入测试评估 |
| 发表方法论文 | 15 队 | 收录于 STACOM 2021 论文集(LNCS) |
一个约 14% 的注册→提交转化率在医学影像挑战中属于健康区间:注册门槛低(签数据政策即可),真正训练并调优到可提交的队伍自然收敛。15/17 的发表转化率极高——挑战赛把方法论文发表作为参与闭环的一部分,参赛者因此有强动机完成全部流程。对挑战赛组织者,这是"发表激励设计"的可引用样本;对研究者,15 篇方法论文构成一个罕见完整的"同一任务方法光谱"语料(§6.1)。
5.3 平台与规则:Docker 远程评估的三重保证
| 规则 | 内容 | 针对的问题 |
|---|---|---|
| 提交平台 | CodaLab | 结果提交与排行榜的标准化载体 |
| 评估方式 | 方法打包 Docker 镜像,在主办方服务器远程推理 | 结果不可复现/本地作弊 |
| 硬件 | 主办方 5×NVIDIA RTX 3090 | 评估算力统一;3090(24GB)限定了显存上限,超显存方法需自行降级 |
| 提交限制 | 验证期每队最多 20 次提交 | 对验证集过拟合(提交次数即超参搜索预算) |
| 数据规则 | 禁用外部数据与预训练模型 | 数据泄漏——所有方法在完全相同的监督预算下比拼 |
四条规则合起来是一个完整的反作弊/可复现闭环:Docker 保证"你交的代码就是你跑的代码";3090 集群保证算力公平并顺手设定了工程约束;20 次提交上限把验证集的信息泄漏限制在可估计范围;禁预训练在 2021 年是个有争议的决定(ImageNet 预训练是否算"外部数据"的边界问题被一刀切禁掉)——它保证了公平,但也意味着本挑战的成绩不能与允许预训练的其他挑战直接对标。复用此协议的后来者需要明确预训练政策的取舍(2021 年后的大多数挑战已转向"允许自监督预训练、禁止标注数据"的折中口径)。
复现性自查清单(评估这套协议或照抄它时逐项问):
| 检查项 | M&Ms-2 的答案 | 你的版本? |
|---|---|---|
| 提交的是什么 | Docker 镜像(可执行方法本体) | 结果文件 or 代码? |
| 在谁的硬件上跑 | 主办方 5×RTX 3090(固定+公开) | ? |
| 测试标签见过没有 | 从未(主办方侧保管) | ? |
| 验证集反馈次数 | 每队上限 20 次 | ? |
| 外部数据/预训练 | 全禁 | ? |
| 结果可追溯性 | 镜像留存+固定硬件复跑 | ? |
第三、四行是两个最容易被日后复现研究追问的点——标签接触历史与验证信息预算;M&Ms-2 在这两处的答案都是当时的最严档。
5.4 排名指标:双视图加权与 HD 封顶的设计取舍
综合排名指标(论文原文口径):
M = 0.75 × (DSC_SA + HD_SA)/2 + 0.25 × (DSC_LA + HD_LA)/2
- DSC(Dice 系数)与 HD(Hausdorff 距离)各占一半,SA 与 LA 按 0.75/0.25 加权;
- 两个视图的 DSC/HD 均取 ED、ES 两时相平均——单帧好不算好;
- HD 经 min-max 归一化后计入,并设 50mm 封顶:50mm = 全体参赛提交中的最大 HD + 10mm,超出者按最差档处理。
三处设计取舍值得办赛者细读:
- SA 0.75 / LA 0.25——SA 是容积定量的传统主力,LA 是定界辅助;权重差三倍反映了临床用途的权重,同时保住了 LA 不可为零分的底线。若 LA 权重过高,方法会在单层面视图上过度优化;若为零,规则 (d) 的定界质量将无人看守。
- DSC 与 HD 对半——DSC 衡量区域重叠(对大面积分割敏感),HD 衡量最坏边界误差(对基底/心尖的孤立失误极敏感)。RV 的典型失败模式恰恰是"整体不错、基底错一层",HD 把这类错误拉回计分桌。
- 50mm 封顶——HD 的无界性会在个别灾难性预测上产生数值爆炸(一次全图漏检可以把 HD 推到几百毫米),min-max 归一化+封顶既保留了"最差者出局"的排序信号,又防止单例灾难主导全部名次差。这是对 RVSC 时代以来 HD 类指标工程化的成熟收口。
一个极端案例演算(按公式数值演练,非论文数据):设提交 A 的 SA 项 DSC=0.90、HD=8mm(归一化 0.16),LA 项 DSC=0.85、HD=30mm(归一化 0.60),则 M = 0.75×(0.90+0.16)/2 + 0.25×(0.85+0.60)/2 ≈ 0.398+0.181 = 0.579。设提交 B 的 SA 与 A 完全相同,但 LA 崩溃——DSC=0.70、HD≥50mm 触发封顶按 0 计,则 M = 0.398 + 0.25×0.35 = 0.486。SA 相同的两份提交,仅 LA 崩溃即损失约 0.093,超过多数相邻名次差——这就是 0.25 权重"定界底线"的数值化呈现:LA 不是可以随便放弃的零头。
5.5 评估流程与标签安全
测试集标签全程在主办方侧,参赛者只见过影像;最终名次基于 Docker 镜像在主办方 5×3090 服务器上的一次性远程推理。验证集(40 例,每病理组 5 例)的实时反馈构成唯一的调参信号——配合 20 次提交上限,构成对"验证集记忆"的预算控制。这套流程与标签治理在 2021 年属于严格执行档:同期不少挑战仍接受"上传结果 CSV"的松散模式,M&Ms-2 的 Docker 制(继承自 M&Ms-1 的实践)使其结果的可信度与可引用性更高一层。
协议一览(引用格式建议):引挑战协议时写"360 例/160-40-160 划分/未见病理 DRV+TRI/M 指标 0.75-0.25 加权/HD 50mm 封顶/CodaLab+Docker/5×RTX 3090/20 次提交上限/禁外部数据与预训练"——一整句话即可复述全部协议要点,出处均为 JBHI 论文正文。
M&Ms-2 与前代 M&Ms 同由核心团队组织、同处 CodaLab 评估生态,纵向可比性由共同的指标族(DSC/HD)与团队连续性保证;两代协议细节的逐项沿革以两代论文各自口径为准,本条目不作无出处推断。M&Ms-2 协议在其时点属严格执行档(Docker+固定硬件+提交上限+数据禁令四件齐备),这使它的成绩单在同期挑战中可信度居前。
5.6 与相邻基准的画像对照
| 要素 | ACDC(2017) | M&Ms(2020) | M&Ms-2(2021) |
|---|---|---|---|
| 队列规模 | 100 例 | 345/375(双口径) | 360(设计口径 450) |
| 中心/设备 | 单中心单厂商 | 6 中心 3 国 4 厂商 | 3 中心 9 扫描仪 |
| 视图 | SA | SA | SA + LA 4CH |
| 计分任务 | LV/MYO/RV | LV/MYO/RV | 仅 RV |
| 未见病理组 | 无 | 无 | DRV/TRI(协议内 OOD) |
读法:四年三代,队列异质性与任务聚焦同步演进;M&Ms-2 站在这条线的当时终点,它引入的未见组与双视图加权是后续影像挑战可直接继承的两个设计件。三者的互补定位(而非替代关系)已在 §2.8 与 §8.2 展开。
§6 核心发现:15 支队伍画出的方法地图与四条硬结论
6.1 方法谱系:一届挑战赛的方法普查
15 支发表队伍按骨干架构四分(论文口径,队伍编号 P1-P15):
| 家族 | 队伍 | 占比 | 备注 |
|---|---|---|---|
| nnU-Net(自配置框架) | P1、P2、P3、P4、P5、P6 | 6/15 | 冠军集团 P1-P5 均出于此 |
| U-Net 手工变体 | P8-P14 | 7/15 | 注意编号不连续——P7 缺席此家族 |
| 深度层级聚合 | P7(DLA) | 1/15 | — |
| Transformer 特征金字塔 | P15(GST:金字塔 squeeze-and-excite Transformer 特征聚合) | 1/15 | 唯一 Transformer 路线 |
三个结构性观察:
- nnU-Net 的压倒性默认地位:40% 的队伍直接采用自配置框架——在 2021 年,“自己设计架构"已经让位于"正确运行 nnU-Net”。这个比例本身就是对方法学界的测量结论。
- U-Net 变体家族最庞大但无人登顶:7 支队伍的手工改进(注意力、多尺度、密集连接等)没有一支突破 nnU-Net 集团——手工变体的创新点在充分调参的自配置框架面前普遍失效。
- Transformer 路线仅一支且未领先:2021 年正是 ViT 热潮起点,GST(P15)把 Transformer 引入特征金字塔但未进第一集团——医学影像小数据集上 ViT 类结构的劣势此后在多个基准反复复现,M&Ms-2 是较早的量化样本之一。
家族粗分之外:编号掩盖了家族内的实现差异——nnU-Net 六队的分歧点在预处理方案、集成策略与推理技巧(滑动窗口重叠、测试时增强等);U-Net 变体七队各带一个当时的流行模块(注意力门、密集连接、多尺度融合一类);P7 的 DLA 与 P15 的 GST 代表"跳出 U-Net 框架"的两种尝试。家族内的逐队细节以各队方法论文为准(STACOM 2021 论文集),本条目不越界转述未核验的队伍实现。
6.2 排名结论:nnU-Net 集团胜利,但差距不具统计戏剧性
论文口径的排名图景:P1-P5(全为 nnU-Net 系)表现相当,彼此统计差异有限——第一名与其后数名的 DSC 差异小于队伍间方法差异的噪声水平。这不是"冠军乏味",而是基准异质性下的正常图景:当数据跨 9 台扫描仪、8 组病理时,方法间的架构差异被数据变异稀释,能稳定吃满 nnU-Net 默认配置红利的队伍就落在同一梯队。
排名数字的使用须知:逐队排名明细在论文中为图像格式表格(与表 II-VI 同类,坑 7),可机读引用的是本节与 §6.3-6.6 的文字口径数字;引用"第 N 名是谁"级别的细节请回 STACOM 2021 论文集或论文原图,勿据二手转写。
P1-P5 跨扫描仪的稳定 DSC:
- 短轴(SA):0.922 ± 0.011
- 长轴(LA 4CH):0.912 ± 0.016
SA 略高于 LA(约 1 个点)符合直觉——SA 是主流训练范式的主场;但 0.016 的标准差(SA)意味着顶尖方法在不同扫描仪间的波动极小:在充分异质的训练数据上,跨设备稳定性是可以买到的(用数据多样性而非域适应技巧)。
6.3 纵向对比:+0.042 与 +0.004 的两个坐标
| 对比基准 | 差值 | 口径 | 解读 |
|---|---|---|---|
| M&Ms-1(2020,三结构) | +0.042 | 平均 DSC | 两年间方法与数据协议的净进步 |
| ACDC(2017,单中心) | +0.004(相当) | 平均 DSC | 且 M&Ms-2 队列显著更异质 |
这两个数字要连读:相对 ACDC 的"持平"是在更难的数据上取得的——ACDC 是单中心、5 组较少病理、无未见组的温和队列;M&Ms-2 是 3 中心 9 扫描仪 8 组病理加未见组。在难一个量级的基准上做到与简单基准同档的绝对分数,实际含义是方法鲁棒性两年间的真实跃升。而相对 M&Ms-1 的 +0.042 则度量了"协议升级(双视图+新队列)+方法微进化"的合成增量——注意这个跨挑战对比并非同队列对照,+0.042 是趋势性指标而非严格归因。
两个对比基准的画像(读 +0.042/+0.004 前的背景板):
- M&Ms-1(2020):三结构、6 中心 3 国 4 厂商、345/375 例(双口径);冠军模型有官方 Zenodo 存档(record 4288464)。
- ACDC(2017):100 例、单中心单厂商,DL 心脏分割的入门事实标准。
在背景板下再读一遍:+0.042 的含义是"更异质队列上仍实现跃升";+0.004 的含义是"温和队列上的饱和分数在异质队列上被顶住"——两个数字共同指向方法侧在 2019-2021 年间的鲁棒性进步,而非单纯的数据红利。
6.4 跨设备与跨场强:1.5T 与 3T 无实质差异
论文对 1.5T vs 3.0T 子集做了性能对照,结论:无实质性能差异。结合 12 个 3T 样本(其中 5 个在测试集)的稀缺性,这个"无差异"更可能的解释是顶尖方法对场强偏移的鲁棒,而非 3T 样本太多以至于不成挑战——对实践者的含义:bSSFP cine 的 RV 分割里,场强不是主要的域漂移轴,厂商/序列参数/病理形态才是。做域泛化实验时,把 3T 当"稀缺域"来采样意义有限,按扫描仪型号分层更有效。
6.5 多视图的价值:用了不等于赢,但用在点子上就赢
8/15 队伍显式利用了 SA+LA 双视图互补信息。多视图方法的战绩拆开看非常说明问题:
- 整体排名上多视图不是充分条件——用双视图的队伍里既有第一集团也有中游;骨干架构(是否 nnU-Net)仍是第一解释变量。
- 基底定界上多视图兑现了设计初衷:P9、P14、P4 是未分割基底 slice 数最少的队伍——基底"从哪层开始算"的歧义正是规则 (d) 与 LA 视图要解决的问题,多视图方法在这里系统性占优。
- 临床指标的明星是 P9:统一 2D/3D U-Net 加 cross-view 模块的 P9,RVEF 误差≥10% 的病例数全场的最少——即按临床射血分数误差衡量,P9 是最可靠的提交之一,尽管其几何排名未必第一。
由此得出本挑战最具引用价值的结论之一:几何 DSC 与临床指标(EDV/ESV/RVEF)并非强相关。一个 DSC 更高的方法可以在容积趋势上更不可靠,因为 DSC 对逐层边界误差的惩罚是面积加权的,而 RVEF 误差来自跨层求和后的容积差——基底多算或少算一层,DSC 掉零点几个点,RVEF 却可能漂过临床决策阈值。做 RV 定量工具选型时,单看 DSC 排行会选错模型。
多视图融合的三条通用路线(8/15 队的整体事实为底,路线划分为通用方法学分类):①早期融合——LA 作为额外输入通道与 SA 一起进入网络,对应关系靠空间编码隐式学习;②特征级融合——两视图各自编码后在特征层拼接或互注(P9 的 cross-view 模块属此类);③决策级融合——分别分割后按解剖一致性合并。论文的定量证据(P9 的 RVEF 稳定性、P9/P14/P4 的基底最优)支持"特征级利用 LA 的解剖信息比把 LA 当普通额外通道更有效"这一方向性判断;但 8/15 的混合战绩同时提醒:融合方式不是开关,骨干与数据管线仍是基座。
6.6 泛化结论:未见病理上的一致下滑
未见病理设计(§2.6)的答卷:
- 除 CIA(房间隔交通)外的未见病理组,DSC 一致更差——DRV/TRI 这类 RV 本体病变形态,是模型在训练分布外的真实盲区;CIA 的例外与其形态温和(主要异常在房水平分流,RV 形态改变较轻)相容。
- Mann-Whitney U 检验在 ED 相位(SA 与 LA 两视图)呈统计显著——舒张末期是腔体最大、形态变异最大的时相,域外形态在这里暴露得最充分。
- 论文的方法学结论直白:需要更多样的病理形态学样本才能提升泛化——"加数据"不是套话,而是本实验测出来的具体处方:缺的是形态谱覆盖,不是像素量。
对域泛化研究者的额外提示:M&Ms-2 的未见组是协议内建的(划分即隔离),因此它支持的泛化结论比文献里大量"自行划分 OOD 子集"的回顾性实验更干净——你不需要担心 OOD 样本在训练时以任何形式泄漏。
6.7 误差解剖:三处系统性弱点
| 误差区 | 表现 | 机制 |
|---|---|---|
| 时相 | ED 分割优于 ES | ES 腔体收缩、血池小,边界-噪声比恶化 |
| 层位 | 基底区欠分割最严重 | 三尖瓣环层面的归属歧义(规则 d 的对象);RV 流出道形态多变 |
| 层位 | 心尖区因体积小误差大 | 绝对误差小但相对误差与 HD 敏感;心尖腔体常仅数层 |
三处弱点与标注流水线的复核火力分布(§3.1 重点基底/心尖)互为镜像——组织方在数据侧知道哪里难,参赛者在方法侧仍然栽在同一批地方。这说明这些误差是任务固有难度而非标注噪声主导:薄壁、歧义层、小结构,是 RV 分割的三个结构性陷阱,后续研究若要超越 nnU-Net,杠杆也在这三处。
弱点×对策矩阵(从 §6.5-6.7 证据推导的改进方向):
| 弱点 | 对应证据 | 可能的对策方向 |
|---|---|---|
| 基底欠分割 | P9/P14/P4 基底最优=多视图方法 | 特征级 cross-view 融合;把规则 (d) 的三尖瓣环锚点编码进损失或后处理 |
| ES 劣于 ED | 全场规律 | 容积一致性约束(ED/ES 联合预测);时相感知的归一化 |
| 心尖小体积高相对误差 | 全场规律 | 拓扑/连通性约束;HD 类指标加权心尖切片 |
| 未见病理下滑 | 协议内 OOD 组一致更差 | 形态谱增广;跨队列预训练(注意与挑战口径的区别) |
矩阵中"多视图→基底"与"未见→形态谱"两行有本挑战的直接证据背书;其余两行是从机制推导的合理方向,引用时应区分证据等级。
6.8 RVSC 断代对照:十二年的基准进步
把 M&Ms-2 放回 RV 分割基准的历史坐标:
| 维度 | RVSC(2012) | M&Ms-2(2021) |
|---|---|---|
| 规模 | 48 例 | 360 例 |
| 中心 | 单中心 | 3 中心 9 扫描仪 |
| 病理 | (单一临床队列) | 8 组病理+未见组 |
| 视图 | 短轴 | 短轴+长轴 4CH |
| 参赛方法 | 7 队,全为非深度学习(图割、水平集等) | 15 队发表,全为深度学习 |
| 最佳 DSC | ≈0.80 | ≈0.92(0.922±0.011 SA) |
| 最佳 HD | ≈1 cm | 归一化计分(毫米级量级) |
九年跨度、三倍规模、DSC +12 个点——更值得注意的是方法范式的整体换代:2012 年的最优方法全是手工能量模型,2021 年的最优方法全是 DL 且大半是同一框架(nnU-Net)。RVSC 之后再无多中心 RV 基准的十二年空窗,正是 M&Ms-2 立项的直接动机(前作 M&Ms 虽含 RV 标注但任务以 LV/MYO 为主,且队列病理谱较窄)。
断代叙事的引用建议:写综述/开题时,"RVSC→M&Ms-2"是一条干净的断代线(48→360、单中心→多中心、非 DL→全 DL),但有两个口径要守:①RVSC 的 0.80 是 2012 年方法在其测试协议上的数字,与 M&Ms-2 的 0.922 不同队列不同协议——只能作时代对照,不能作同尺比较;②"十二年空窗"指公开多中心基准的空窗,不是研究空窗——其间仍有零散 RV 研究与私有数据集,只是没有公开可比的基准。表述精确度决定这条断代线的引用寿命。
6.9 可引用结论清单(一页版)
把 §6 全部可引结论按"数字/结论—出处—引用注意"压缩成一张表:
| # | 可引结论 | 出处 | 引用注意 |
|---|---|---|---|
| 1 | 360 例、3 中心 9 扫描仪、8 组病理 | JBHI 正文 | 450 为 Zenodo 设计口径(坑 3) |
| 2 | 160/40/160 划分、验证每病理组 5 例 | JBHI 正文 | — |
| 3 | DRV/TRI 排除出训练(协议内 OOD) | JBHI 正文 | 测试集 25+25 为推算(坑 7) |
| 4 | >120 注册/17 提交/15 发表 | JBHI 正文 | — |
| 5 | M = 0.75/0.25 双视图加权、HD 50mm 封顶 | JBHI 正文 | — |
| 6 | P1-P5 相当、nnU-Net 最优 | JBHI 正文 | 逐队名次在图像表格(坑 7) |
| 7 | DSC 0.922±0.011(SA)/0.912±0.016(LA) | JBHI 正文 | P1-P5 跨扫描仪口径 |
| 8 | +0.042 vs M&Ms-1、+0.004 vs ACDC | JBHI 正文 | 趋势性对比非同队列归因 |
| 9 | 8/15 队用双视图;基底最优 P9/P14/P4 | JBHI 正文 | — |
| 10 | P9 的 RVEF 误差≥10% 病例最少 | JBHI 正文 | 几何≠临床的核心证据 |
| 11 | 未见组(除 CIA)一致更差、ED 相位显著 | JBHI 正文(Mann-Whitney U) | — |
| 12 | ED>ES;基底欠分割;心尖误差大 | JBHI 正文 | — |
| 13 | 1.5T vs 3T 无实质差异 | JBHI 正文 | 3T 样本仅 12 |
| 14 | RVSC 最佳 DSC≈0.80/HD≈1cm(非 DL) | RVSC 2012 口径(经 JBHI 转述) | 时代对照非同尺比较 |
写 related work 时按行取用即可,全部条目可与正文小节对读。
§7 方法学启示:三条可迁移的经验
7.1 未见病理组是挑战赛能做的最便宜的科学实验
M&Ms-2 把 DRV/TRI 藏出训练集的边际成本几乎为零(只是划分策略),产出却是一个协议级泛化测量:结论(未见组一致下滑、ED 相位显著)以 Mann-Whitney U 检验背书,而非肉眼观察。任何手里握有多病理队列的团队都可以复制这一设计——不需要新采集,只需要在划分时回答一个问题:"哪两组病理最像,但模型最需要在现实里遇到?"把它们隔离开。这比事后在论文附录里做 OOD 分析干净一个数量级。
7.2 指标设计是在给参赛者的优化方向投票
M 指标的三个组件各投了一票:0.75/0.25 投给"短轴为主、长轴定界"的临床口径;HD 对半投给"最坏边界误差必须上桌";50mm 封顶投给"灾难可以垫底但不能爆炸"。结果 8/15 队伍采用多视图、P9/P14/P4 在基底定界上最优——指标结构与方法行为之间能看到清晰的引导链。办赛者应当把指标当作最主动的设计变量,而不是事后算分公式。
办赛者最常问的三个实现问题(按本挑战的答案作答):
- 封顶阈值定在哪?——M&Ms-2 用"全体提交最大 HD + 10mm",即阈值随当届数据分布自适应,而非拍脑袋常数。好处是任何一届都能复用同一规则;注意它意味着阈值在提交齐备前不完全可知,排行榜早期数字要注明"阈值未冻结"。
- 双指标(DSC+HD)谁先谁后?——两者各占一半直接平均(先视图内平均、再加权),不做"先 DSC 决胜、HD 破平局"的字典序——字典序会让 HD 沦为摆设;对半平均保证两者都真实计分。
- 时相怎么聚?——ED/ES 先平均、后进视图加权,即任何单时相的漂亮数字都要经受另一时相检验——RV 的 ES 是失分高发段,这个聚合顺序直接惩罚"只会舒张期"的方法。
7.3 几何分数与临床正确要分开报告
P9 的案例是本挑战留给医学影像评测的公共提醒:DSC 第一集团的方法,RVEF 误差≥10% 的病例数未必最少;反之亦然。RV 定量的下游是临床决策(肺高压风险评估、先心病手术时机),RVEF 漂 10% 就是另一个诊疗结论。报告 RV 分割结果时,几何指标(DSC/HD)与容积衍生指标(EDV/ESV/EF 误差)双轨报告应当成为默认规范——M&Ms-2 用 15 支队伍的完整数据把这一点演示了出来。
7.4 标注视角:临床专家自标注的得与失
与前作及 ACDC 一脉的"来源中心专家标注"模式,在本挑战中再次验证其两面性:得——病理形态判断的临床可信度(FALL 术后形态这类无标准答案的样本只有先心病专家敢标);失——跨中心标注风格差异成为额外变异源,必须以统一 SOP(§3.3)压制。规则 (d)(长轴定界)是这份 SOP 最有价值的增量:它证明多视图数据的价值不只在测试时被模型利用,也可以在标注时被人类利用——把 LA 视图交给标注者当解剖参考,是提升标注一致性的低成本手段。
7.5 负结果清单:这届挑战没证明什么
完整吸收一届挑战的结论,负结果与正结果同价。M&Ms-2 的五条"没证明":
- Transformer 没有赢——P15(GST)未进第一集团;2021 年时点,小数据医学影像上 ViT 类结构不占优。
- 手工架构创新没有赢——U-Net 变体 7 队无一登顶;自配置框架(nnU-Net)的默认红利压过单点模块创新。
- 多视图不是充分条件——8/15 采用,整体排名仍由骨干决定;多视图的收益是局部的(基底定界、RVEF 稳定性)而非全局的。
- 场强不是域漂移主轴——1.5T vs 3T 无实质差异;把场强当主要困难变量的研究假设在此数据上得不到支持。
- 几何分数不保证临床正确——DSC 排名与 RVEF 误差表现脱钩;"榜一=临床最优"的推断失效。
这五条合起来构成对 2021 年医学分割方法学的一次快照式证伪集合——它们比冠军数字更有引用价值,因为负结果在文献里更稀缺、更少被转述。办新挑战赛或写 related work 时,这份清单可直接作为设计输入或论述弹药。
§8 生态与影响:一个挑战赛的第二生命
8.1 参赛方开源:TemPERA 与 mnms2_challenge
官方挑战结束后,参赛方法持续沉淀。已知的代表性开源:参赛者 Christoforos Galazis(Imperial College London)的 TemPERA 方法代码,托管于 GitHub cgalaz01/mnms2_challenge——这是 M&Ms-2 方法生态里可检索到的完整开源实现之一。与 M&Ms-1(官方发布过冠军模型 Zenodo 存档 record 4288464)不同,M&Ms-2 没有官方模型权重出口,复现路径以方法论文+社区开源为主。
8.2 学术复用:CMR 分割三件套的第三块拼图
M&Ms-2 与 ACDC、M&Ms 共同构成 CMR 分割公共基准的互补三件套,各自占位:
| 基准 | 年 | 规模 | 中心/设备 | 任务 | 独特杠杆 |
|---|---|---|---|---|---|
| ACDC | 2017 | 100 例 | 单中心单厂商 | LV/MYO/RV 三结构 | 病理清晰、门槛最低、事实标准 |
| M&Ms | 2020 | 345/375(双口径) | 6 中心 3 国 4 厂商 | 三结构 | 多国家多厂商域漂移 |
| M&Ms-2 | 2021 | 360 例 | 3 中心 9 扫描仪 | 仅 RV | 双视图+8 组病理+协议内未见组 |
学术复用的常见形态:多视图 CMR 分割论文把它当"多视图有效性"的测试床;域泛化论文用其未见组做协议内 OOD 验证;RV 定量研究把它当"形态谱最宽"的 RV 专用监督源;CineMA 等多中心 CMR 分析项目将其纳入评估队列。三件套间的迁移实验(ACDC→M&Ms→M&Ms-2 或反向)也是域自适应文献的标准设置。
8.3 未来工作:论文自述的多视图补全计划
总结论文自述的后续方向:加入2 心腔与 3 心腔长轴视图,把"双视图"补全为完整多视图体系——届时 LA 4CH 的定界角色将扩展为多平面协同;预期用途清单六类:病理自动评估、多扫描仪配准、多结构分割、定量分析、应变与运动分析、图像合成。至本条目核验时点,2CH/3CH 扩展版未见独立发布记录,作为计划口径存照(附录 I)。
8.4 资助与伦理:一份完整的 European 资助谱
伦理:三家医院(Vall d’Hebron、Sagrada Familia、Dexeus)伦理委员会批准,所有参与者书面知情同意——回顾性队列的合规双件齐全。
资助清单(论文披露口径):
| 资助 | 编号 | 受益侧 |
|---|---|---|
| H2020 euCanSHare | Grant 825903 | CMR 数据共享基础设施(项目主体) |
| H2020 HealthyCloud | Grant 965345 | 健康数据云 |
| Spanish PID2019-105093GBI00 | 国家项目 | 西班牙侧研究 |
| ICREA Academia | 机构奖 | Karim Lekadir |
| FCT Portugal | — | Queirós |
| Juan de la Cierva | IJC2018-037349-I | Andrea Guala |
| la Caixa | LCF/BQ/PR22/11920008 | — |
| Ramon y Cajal | RYC-2015-17183 | Karim Lekadir |
euCanSHare(H2020 资助的 CMR 数据共享平台)正是这个团队的 dataset 工程母体——M&Ms 系列挑战是它的公共出口之一。引用数据集时,资助与伦理声明一并照录是学术规范,也是数据使用政策里常见的要求项。
8.5 对数据集工程使用者的价值拆解
跳过学术结论,M&Ms-2 作为"数据集工程样本"还有四项可复用资产:
- 划分即实验设计——160/40/160 + 未见组的划分文件本身就是一份实验设计文档;组织新数据集时,划分方案先于数据上线定稿并由第三方复核,是最便宜的防泄漏措施。
- SOP 的增量演进——规则 (d) 演示了"每代只修一个被证实的最大痛点"的标注协议迭代法;协议变更要有明确的动机证据(前代的基底歧义误差)。
- 临床工具链直通开放格式——cvi42→NIfTI 的转换链让临床医生零工具迁移成本;数据集工程的第一性问题是"标注者愿意用什么",而不是"研究者想要什么格式"。
- 协议文本的可引用性——指标公式、封顶规则、提交限制全部以可转述的一句话形式写在论文里;后来者引用或复刻协议的成本被压到最低——这正是本条目 §5 能"一整句话复述全部协议"的原因。
四项合起来的元教训:挑战赛最持久的产出往往不是排名,而是协议与流水线的公共资产化——数据会过时,设计模式不会。
§9 检索路径建议
- 检索词组合:
"M&Ms-2" AND ("right ventricular" OR "RV segmentation");变体MNMS2/MnMs-2/Multi-Disease Multi-View Multi-Center;查病理组时补tetralogy of Fallot(注意论文笔误拼法 “Tetrology” 也会被检索引擎收录)、inter-atrial communication/IAC/ASD。 - 要拿数据:官网 www.ub.edu/mnms-2 注册通道(论文脚注 2 口径;核验时临时不可用,隔期重试)→ 同意数据使用政策 → 按协议获取。Zenodo 4573984 只给设计 PDF(坑 1)。
- 要复现方法:STACOM 2021 论文集(ISBN 978-3-030-93722-5)15 篇方法论文 → GitHub
cgalaz01/mnms2_challenge(TemPERA)等社区开源 → 官方无统一评测代码与权重出口。 - 要引结论:数字按 JBHI 论文(doi:10.1109/JBHI.2023.3267857)正文口径,注明"挑战 2021、论文 2023"双时点;推算口径(测试集未见病理 25+25)引用时注明推算性质(坑 7)。
- 防混淆:检索命中"M&Ms"时先核对数据规模(345/375 vs 360)与任务(三结构 vs RV 单结构)再决定用哪篇——两代挑战的论文标题都含 “M&Ms Challenge” 字样(坑 4)。
§10 避坑清单:八个已踩过的坑
坑 1:DOI 8498334 不存在;Zenodo 4573984 里没有数据。任务头印象 DOI 10.5281/zenodo.8498334 经 curl(404)、Zenodo API 与站内搜索三轮证伪,系错误记忆;真实 DOI 为 10.5281/zenodo.4573984。且该 record 仅含 1 个 2.7MB 挑战设计 PDF(md5 f1c1e1845b87cd8bd00ebe48ba11c31e),影像本体在官网注册制通道——按"DOI=数据"的惯性走 Zenodo 必空手而归。
坑 2:2021 与 2023 双时间坐标。挑战(数据、参赛、方法论文集)= 2021(STACOM 2021 / MICCAI 2021 同场);总结论文 = 2023(IEEE JBHI 27(7):3302-3313,received 2022-09-21 / published 2023-04-17 / current version 2023-07-03)。"M&Ms-2 是 2023 年的数据集"与"M&Ms-2 是 MICCAI 2023 的挑战"都是错句;引用任何数字先注明出自哪个时点。
坑 3:450 vs 360 规模双口径。Zenodo 官方描述写 “450 cardiac MRI datasets”(2021-03-02 设计目标口径);论文与实际发布为 360 例。前作 M&Ms 亦存在 375 vs 345 双口径——同一家族的"传统艺能"。正文一律按 360 例,提设计目标时注明"Zenodo 设计口径"。
坑 4:M&Ms 与 M&Ms-2 极易混淆。两代挑战同名族、同主办团队、论文标题都含 “M&Ms Challenge”:M&Ms = 2020 STACOM,三结构(LV/MYO/RV),345/375 例(双口径),TMI 2021 论文,6 中心 3 国 4 厂商;M&Ms-2 = 2021 STACOM,仅评 RV,360 例,JBHI 2023 论文,3 中心 9 扫描仪+双视图+未见病理组。检索、引用、建库时以规模与任务字段强制区分。
坑 5:官网临时不可用 ≠ 数据消失。官网 www.ub.edu/mnms-2 于 2026-09-26/27 核验返回加泰罗尼亚语 “Pàgina temporalment no disponible”(临时不可用)。数据本体仍在注册制体系内(论文、Zenodo、三方镜像均佐证其存在),属平台临时状态;条目按"论文脚注引用口径+核验时点状态"存照,使用者隔期重试或经学术渠道联系主办方(BCN-AIM / Vall d’Hebron)。
坑 6:论文笔误与缩写混用。论文原文把 Tetralogy of Fallot 拼作 “Tetrology of Fallot”;病理缩写 CIA 与 IAC 互见(inter-atrial communication)、FALL 与 ToF 互见。转引时按正确拼写(Tetralogy)与统一缩写书写,检索时把变体都试一遍。
坑 7:表 II-VI 是图像表格;测试集未见病理数是推算。论文表 II/III/IV/V/VI(病理×划分矩阵、扫描仪×例数、分辨率等)为图像格式,pdfplumber 提取 0 表、数字无法机读。文字可证硬数字:360、160/40/160、验证每病理组 5 例、DRV/TRI 训练为 0、12 个 3T 样本中 5 个进测试集;"测试集含 50 例未见病理(DRV 25 + TRI 25)"为按验证口径反推,引用必须注明推算性质。
坑 8:"含 Scars LGE 子集"是错误印象。任务头原印象"含 Scars LGE 子集"经论文全文与 Zenodo 记录双源证伪:M&Ms-2 全部为 cine CMR(SA+LA 4CH),无 LGE/延迟强化序列。"Scars/LGE"疑与其他含 LGE 的心脏数据集混淆。任何基于 M&Ms-2 做瘢痕/LGE 研究的计划从一开始就无数据支撑。
§11 总结
11.1 三句话总结
- M&Ms-2 用 360 例、3 中心、9 扫描仪、8 组病理、双视图的数据,把右心室分割从十二年空窗后的第一个多中心公开基准做成了协议级泛化实验——DRV/TRI 未见组设计让"模型没见过的形态"成为排名内变量。
- 结果平淡而深刻:nnU-Net 集团以 0.922±0.011(SA)夺冠且彼此无统计差距,多视图方法在基底定界与 RVEF 稳定性上兑现价值,几何 DSC 与临床指标脱节被定量摆上台面。
- 数据注册制获取、Zenodo 只有设计 PDF、官网核验时临时不可用——"高学术价值+中下 AI-Ready"的组合,是申请制高价值基准的典型样本。
11.2 适合谁
- RV 分割/定量团队:形态谱最宽的 RV 专用监督源(8 组病理、双视图、专家标注)。
- 域泛化研究者:协议内建的未见病理组,无需自行划分 OOD 即可做干净的泛化实验。
- 挑战赛组织者:完整的协议样本——M 指标加权、HD 封顶、Docker 远评、20 次提交上限、禁预训练,全部现成可抄。
- 多视图方法研究者:SA+LA 保留 inter-view 对应关系,8/15 参赛队用双视图,有效性有定量证据。
11.3 不适合谁
- 需要即插即用公开直链的管线(注册制+官网状态不稳定,工程排期不可控)。
- LGE/瘢痕相关研究(无 LGE 序列,坑 8)。
- 全心动周期时序分割(仅 ED/ES 两帧有标注)。
- LV/MYO 为主的研究(标注存在但挑战不计分,且队列按 RV 任务设计)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要训练 RV 分割模型 | 官网注册申请;等待期用方法论文+社区开源(§8.1)搭管线 |
| 要做域泛化论文 | 直奔 §2.6 未见组设计与 §6.6 结论;引用注明推算口径 |
| 要办挑战赛 | 抄 §5 协议清单:M 指标、50mm 封顶、Docker、20 次、禁预训练(注意预训练政策的时代局限) |
| 要引 RV 分割 SOTA 坐标 | JBHI 论文:0.922±0.011(SA)/+0.042 vs M&Ms-1/1.5T vs 3T 无差异 |
| 检索时看到 “M&Ms” | 先核规模(360 vs 345/375)与任务(RV vs 三结构)再定引用对象(坑 4) |
| 想找 LGE 数据 | 走错门了——本数据集无 LGE(坑 8) |
| 要写论文的"协议设计"段落 | 抄 §5.4 三处取舍 + §7.2 指标投票论 + §7.5 负结果清单 |
| 想预估自己的模型在 M&Ms-2 上的表现 | 先查自己的训练集是否含 RV 扩张病例——含则 DRV/TRI 对它已不"未见"(§6.6) |
FAQ(高频问答 40 问)
A. 基础认知
Q1:M&Ms-2 的官方全称是什么?
Multi-Disease, Multi-View & Multi-Center Right Ventricular Segmentation Challenge(多疾病、多视图、多中心右心室分割挑战)。三个 “Multi” 是相对前代的升级清单:多疾病(8 组病理)、多视图(SA+LA 4CH)、多中心(3 医院 9 扫描仪)。
Q2:它是哪年办的?
挑战 2021 年(STACOM 2021,与 MICCAI 2021 同场举办);总结论文 2023 年(IEEE JBHI)。两个年份都出现在文献里,别混(坑 2)。
Q3:和 M&Ms 什么关系?
同一核心团队(BCN-AIM + Vall d’Hebron)的第二代挑战。任务从三结构收敛为仅 RV,新增长轴视图,队列换新(360 例、病理谱加宽、引入未见组设计)。
Q4:为什么专门做右心室?
RV 是心脏分割的薄弱环节(薄壁、不规则、边界靠推断),且临床需求增长(肺高压、先心病随访、致心律失常性右室心肌病);2012 RVSC 后十二年没有第二个多中心 RV 公开基准。
Q5:谁组织的?
BCN-AIM 实验室(Universitat de Barcelona,Karim Lekadir 组)+ Vall d’Hebron 研究所;通讯作者 Carlos Martín-Isla,核心成员含 Andrea Guala、José F. Rodríguez Palomares;Zenodo 记录署名另含 Sergio Escalera。
Q6:数据是真实病人吗?
是。3 家巴塞罗那医院回顾性临床采集,三院伦理批准+书面知情同意;不是合成数据或公开库重标注。
Q7:360 例都是成人吗?
队列以成人临床患者为主体(三家成人医院的临床队列,含先心病术后随访人群如法洛四联症);论文未披露年龄分布明细。
Q8:参加挑战要交钱吗?
论文与公开材料未见注册费记载;参与门槛是注册+同意数据使用政策。120+ 队注册的低门槛是漏斗设计的一部分。
Q9:15 支队伍都发表了论文吗?
17 队提交最终测试,15 队方法论文收录于 STACOM 2021 论文集(Springer LNCS,ISBN 978-3-030-93722-5)。
Q10:它算挑战赛数据集还是普通数据集?
两者都是:挑战结束后,标注数据以注册制继续开放给研究者使用(这正是"挑战数据集"的常规第二生命)。
B. 数据与获取
Q11:去哪下数据?
官网 www.ub.edu/mnms-2 注册并同意数据使用政策(论文脚注 2 口径)。2026-09-26/27 核验时官网临时不可用——隔期重试或联系主办方(坑 5)。
Q12:Zenodo 能下到数据吗?
不能。Zenodo record 4573984(DOI 10.5281/zenodo.4573984)只有 1 个 2.7MB 挑战设计 PDF(坑 1)。
Q13:为什么网上的 DOI 有的是 4573984 有的是 8498334?
8498334 是错误记忆/二手误传——curl 返回 404、Zenodo API 与搜索三轮证伪。真实且唯一:10.5281/zenodo.4573984。
Q14:Kaggle/HuggingFace 上的镜像能用吗?
佐证存在性可以(Kaggle 约 30.15GB 与 360 例双视图 cine 相容),正式使用不行——非官方分发、许可状态不明(Kaggle 镜像 license Unknown)、版本完整性无背书(§4.3)。
Q15:数据什么格式?
NIfTI(影像+标注掩码)。原始 DICOM 与 cvi42 工作区由主办方保留;NIfTI 与 ACDC/M&Ms 管线直接兼容。
Q16:450 例还是 360 例?
实际发布 360 例;450 是 Zenodo 设计文档的目标口径。引用按 360(坑 3)。
Q17:验证集为什么只有 40 例、每病理组 5 例?
均匀分层的小验证集——每组 5 例保证提交反馈覆盖全部病理形态,同时控制验证信息泄漏(配合每队 20 次提交上限)。
Q18:测试集里有多少未见病理?
推算口径约 50 例(DRV 25 + TRI 25,按验证每病理组 5 例反推);论文未以文字明说测试集内拆分(表 II 为图像表格),引用注明推算(坑 7)。
Q19:有没有官方训练好的模型可以下?
没有。M&Ms-1 有冠军模型 Zenodo 存档(record 4288464),M&Ms-2 无对应官方权重出口;复现走方法论文+社区开源。
Q20:能商用吗?
数据按"注册+同意数据使用政策"的研究用途口径发放,无标准开源许可证文本;商用需与主办方书面确认。第三方镜像的许可链更不成立。
C. 标注与协议
Q21:谁标的?
每例由来源中心的专家临床医生标注(临床经验 3-10+ 年),另 2 名研究者复核(重点基底/心尖),分歧按观察者间共识解决。
Q22:用什么软件标注?
cvi42(Circle Cardiovascular Imaging,Calgary)勾画与修正 → DICOM 影像+cvi42ws 工作区 → 自研软件转换 → NIfTI 交付。临床工作流内标注,转换成本主办方吸收。
Q23:SOP 有哪些规则?
四条:(a) 腔体含乳头肌完全覆盖;(b) 基底心肌边界不得插值;© ED 帧 RV 容积>ES 帧;(d) 长轴 4CH 作为基底/心尖界定参考(RV 基底 slice 由三尖瓣环在 4CH 上的位置推断)。规则 d 是 M&Ms-2 新增。
Q24:标注了哪些结构?
LV 腔、RV 腔、LV 心肌三结构,ED/ES 两时相,SA 与 LA 双视图都标。但挑战评估只看 RV。
Q25:为什么长轴视图权重只有 0.25?
SA 是容积定量主力、LA 是定界辅助——0.75/0.25 反映临床用途权重,同时保住 LA 不可为零分的底线(基底定界质量需要 LA 来看守)。
Q26:HD 为什么要封顶 50mm?
HD 无界,一次灾难性预测可推到几百毫米并主导全部名次。50mm = 全体提交最大 HD + 10mm;min-max 归一化+封顶保留排序信号又防数值爆炸。
Q27:允许用预训练模型吗?
不允许——禁外部数据与预训练模型(2021 年口径)。这保证了监督预算公平,但意味着成绩不能与允许预训练的挑战直接对标。
Q28:验证期最多提交几次?
每队 20 次。提交次数即对验证集的超参搜索预算,上限控制过拟合。
Q29:怎么保证提交结果可信?
方法打包 Docker 镜像,在主办方 5×NVIDIA RTX 3090 服务器远程推理;测试标签全程不可见。
Q30:排名指标完整公式?
M = 0.75×(DSC_SA + HD_SA)/2 + 0.25×(DSC_LA + HD_LA)/2;DSC/HD 取 ED、ES 平均;HD min-max 归一化、50mm 封顶。
D. 结果与复现
Q31:冠军是谁?用的什么方法?
P1-P5 集团(全为 nnU-Net 系)表现相当、统计差异有限;6/15 队用 nnU-Net。冠军归属的具体队伍排序见 JBHI 论文排名图(图像表格口径)。
Q32:最好的 DSC 是多少?
P1-P5 跨扫描仪稳定 DSC = 0.922±0.011(短轴)、0.912±0.016(长轴 4CH)。
Q33:比 M&Ms-1 好多少?
平均 DSC 提升 0.042;与 ACDC 相当(+0.004)——且是在更异质的队列上。
Q34:多视图到底有没有用?
整体排名上不是充分条件(骨干架构仍是第一变量);但在基底定界(P9/P14/P4 未分割基底 slice 最少)与 RVEF 稳定性(P9 的 RVEF 误差≥10% 病例最少)上兑现了设计价值。
Q35:DSC 高就等于临床可用吗?
不等于。几何 DSC 与 EDV/ESV/RVEF 误差并非强相关——基底差一层,DSC 掉零点几,RVEF 可能漂过临床阈值。双轨报告是规范(§7.3)。
Q36:1.5T 和 3T 差别大吗?
无实质性能差异。且 3T 样本仅 12 个(5 个进测试)——场强不是主要域漂移轴,按扫描仪型号分层更有效。
Q37:模型在没见过的病理上表现如何?
除 CIA 外一致更差;Mann-Whitney U 检验在 ED 相位(SA 与 LA)统计显著。结论:需要更多样的病理形态样本(§6.6)。
Q38:哪里误差最大?
三处系统性弱点:ES 时相劣于 ED;基底区欠分割最严重;心尖区因体积小相对误差大——与标注复核火力分布互为镜像,属任务固有难度。
Q39:有开源代码吗?
有社区开源:GitHub cgalaz01/mnms2_challenge(Imperial College 的 TemPERA 方法);官方无统一评测代码。15 篇方法论文在 STACOM 2021 论文集。
Q40:2012 年的 RVSC 和它什么关系?
断代坐标。RVSC:48 例、单中心、7 队、全非 DL、最佳 DSC≈0.80/HD≈1cm;M&Ms-2:360 例、多中心多病理多视图、15 队全 DL、DSC 0.92 档——九年基准代差的两个端点。
E. 生产与库内
Q41:为什么 slug 是 mms-2?
沿数据集官方简称 M&Ms-2 的 URL 安全变体;与前作 slug(mms)按代际区分。库内检索时两个 slug 都会命中各自的条目。
Q42:本条目的核验时点与证据边界?
核验 2026-09-26/27;三源互证(Zenodo 官方记录页、JBHI 论文全文、STACOM/GitHub/Kaggle 侧信息)。表 II-VI 图像表格不可机读,推算口径已全部标注(坑 7);官网临时不可用状态存照(坑 5)。
Q43:如果我只记住一件事?
把两组病理(DRV/TRI)藏出训练集、专门测"没见过形态"的泛化——这是 M&Ms-2 对一切医学分割挑战的示范:泛化可以是协议内变量,而不是论文附录里的花絮。
F. 工程与复现
Q44:训练集拿到手是什么样的?
NIfTI 格式,影像与标注掩码配对,按病例组织、区分 SA/LA 视图与 ED/ES 时相;逐例的病理标签与扫描仪元数据随注册发放。原始 DICOM 与 cvi42 工作区不出官方门。
Q45:复现冠军结果的最短路径?
①读 JBHI 论文方法节拿协议口径;②STACOM 2021 论文集读 nnU-Net 系各队论文;③nnU-Net 默认配置在 160 例训练集上跑通(严格对标需遵守禁预训练口径);④在验证 40 例上自评 M 指标(公式与骨架见 §5.4 与附录 G)。官方无统一评测代码,指标需自实现。
Q46:数据到手后第一件该做的事?
按 §2.4 的维度自己统计训练子集构成(病理×扫描仪×视图),核对是否 160/40/160 完整口径。镜像来源的数据尤其要查 DRV/TRI 是否混进了训练集——它们本不该出现,出现即说明划分被重排过。
Q47:能做跨数据集联合训练吗(如 ACDC+M&Ms-2)?
研究上常见且规则上可行(数据到手后如何组合是研究者自由),但报告必须声明——M&Ms-2 的"未见组"设计只在"仅用其 160 例训练集"时成立;混入其他含 RV 扩张病例的数据会破坏 OOD 实验的纯净性,此时不应再引用其泛化结论口径。
Q48:后续最值得盯的更新是什么?
官网恢复与 2CH/3CH 扩展版(附录 J 触发点 1/2);若 Zenodo record 4573984 增补数据本体,本条目 §4 与 AI-Ready 评级需整体重写。
事实清单(硬事实 42 条)
- M&Ms-2 = Multi-Disease, Multi-View & Multi-Center Right Ventricular Segmentation Challenge,STACOM 2021 官方挑战(MICCAI 2021 同场)。
- 总结论文:Martín-Isla et al., IEEE JBHI 27(7):3302-3313, 2023, DOI 10.1109/JBHI.2023.3267857;received 2022-09-21 / revised 2023-02-13 / accepted 2023-03-31 / published 2023-04-17 / current version 2023-07-03。
- 方法论文集:STACOM 2021,Springer LNCS,ISBN 978-3-030-93722-5,15 篇。
- 挑战时间线:2021-03-02 Zenodo 设计文档(v1)→ 2021-05-10 训练+验证发布 → 2021-07-01 至 2021-07-20 测试期 → 2021-09/10 STACOM 颁奖。
- 数据:360 例 cine CMR(论文口径);Zenodo 设计口径 450 例(双口径存照)。
- 3 家西班牙巴塞罗那医院:Vall d’Hebron、Clínica Sagrada Familia、Dexeus;三院伦理批准+书面知情同意。
- 病理分布:Normal 75 / DLV 60 / HCM 60 / ARR 35 / FALL 35 / CIA 35 / DRV 30 / TRI 30 = 360。
- 诊断标准:DLV = LVEDV>214mL(男)/179mL(女);DRV = RVEDV>250mL(男)/201mL(女);HCM = LV 壁厚>15mm;余按临床定义。
- 扫描仪 9 台 3 厂商:Siemens(Avanto/Avanto Fit/Symphony/SymphonyTim/TrioTim)、Philips(Achieva)、GE(Signa Excite/Signa Explorer/Signa HDxt);多数 1.5T,3T 样本仅 12 个、其中 5 个进测试集。
- 双视图:短轴 SA + 长轴 4CH;inter-view 对应关系在预处理中保留;LA 用于基底/心尖定界。
- 划分:训练 160(有标注)/ 验证 40(无标注,每病理组 5 例)/ 测试 160(无标注)。
- 未见病理设计:DRV 与 TRI 完全排除出训练集;测试集含约 50 例未见病理(25+25 为推算口径)。
- 标注结构:LV 腔/RV 腔/LV 心肌三结构、ED/ES 两时相、双视图均标;评估仅 RV;中间帧无标注。
- 全部为 cine CMR;无 LGE/延迟强化序列("含 Scars LGE"印象证伪)。
- 标注者:来源中心专家临床医生,经验 3 至 10+ 年;另 2 名研究者复核(重点基底/心尖),分歧共识解决。
- 软件链:cvi42(Circle Cardiovascular Imaging, Calgary)勾画 → DICOM+cvi42ws → 自研软件转换 → NIfTI 交付。
- SOP 四规则:(a) 腔含乳头肌全覆盖;(b) 基底不插值;© ED 容积>ES;(d) 长轴 4CH 定界(M&Ms-2 新增;RV 基底 slice 由三尖瓣环位置推断)。
- 参与漏斗:>120 队注册 / 17 队提交测试 / 15 队发表。
- 平台:CodaLab 提交 + Docker 镜像远程评估(主办方 5×NVIDIA RTX 3090);验证期每队最多 20 次提交;禁外部数据与预训练模型。
- 排名指标:M = 0.75×(DSC_SA + HD_SA)/2 + 0.25×(DSC_LA + HD_LA)/2;DSC/HD 取 ED/ES 平均;HD min-max 归一化、50mm 封顶(全体最大 HD+10mm)。
- 方法谱系:6 队 nnU-Net(P1-P6)、7 队 U-Net 变体(P8-P14)、P7 DLA、P15 GST(Transformer 特征金字塔);8/15 队用双视图。
- 冠军集团 P1-P5(均 nnU-Net 系)表现相当、统计差异有限;nnU-Net 整体最优。
- 稳定性能:P1-P5 跨扫描仪 DSC = 0.922±0.011(SA)、0.912±0.016(LA)。
- 纵向:较 M&Ms-1 平均 DSC +0.042;与 ACDC 相当(+0.004)且队列更异质。
- 多视图发现:P9、P14、P4 未分割基底 slice 最少;P9(统一 2D/3D U-Net + cross-view 模块)RVEF 误差≥10% 病例最少。
- 几何 DSC 与临床指标(EDV/ESV/RVEF)并非强相关。
- 泛化:未见病理组(除 CIA)DSC 一致更差;Mann-Whitney U 检验 ED 相位(SA 与 LA)统计显著。
- 误差解剖:ED 优于 ES;基底欠分割最严重;心尖因体积小误差大。
- 1.5T vs 3T 无实质性能差异。
- RVSC(2012)对照:48 例单中心、7 队全非 DL、最佳 DSC≈0.80/HD≈1cm——M&Ms-2 为首个多中心多疾病多视图 RV 公开 DL 基准。
- 获取:官网 www.ub.edu/mnms-2 注册制(2026-09-26/27 核验临时不可用,“Pàgina temporalment no disponible”);Zenodo record 4573984 仅 2.7MB 设计 PDF(md5 f1c1e1845b87cd8bd00ebe48ba11c31e,published 2021-03-02)。
- 真实 DOI:10.5281/zenodo.4573984;印象 DOI 8498334 经 404/API/搜索三轮证伪。
- Zenodo 署名:Carlos Martín-Isla、José F. Rodríguez Palomares、Andrea Guala、Sergio Escalera、Karim Lekadir。
- 第三方镜像:Kaggle 约 30.15GB(license Unknown)、HuggingFace viennh2012 约 543MB——非官方分发。
- 主办方:BCN-AIM(Universitat de Barcelona)+ Vall d’Hebron 研究所;Guala 为先心病/主动脉瓣专家。
- 开源:GitHub cgalaz01/mnms2_challenge(TemPERA,Christoforos Galazis, Imperial College);M&Ms-2 无官方模型权重存档(对照 M&Ms-1 record 4288464)。
- 未来计划:加入 2CH/3CH 长轴视图;预期用途六类(病理评估/配准/多结构分割/定量/应变运动/合成)。
- 资助:H2020 euCanSHare 825903、H2020 HealthyCloud 965345、Spanish PID2019-105093GBI00、ICREA Academia;个人:FCT(Queirós)、Juan de la Cierva IJC2018-037349-I(Guala)、la Caixa LCF/BQ/PR22/11920008、Ramon y Cajal RYC-2015-17183(Lekadir)。
- 论文原文拼 “Tetrology of Fallot”(笔误);缩写 CIA/IAC、FALL/ToF 混用。
- 论文表 II-VI 为图像表格,pdfplumber 提取 0 表;文字可证数字仅 360/160/40/160、验证每病理 5 例、DRV/TRI 训练 0、3T 样本 12 中 5 进测试。
- M&Ms(2020,STACOM,三结构,345/375 双口径,TMI 2021)与 M&Ms-2(2021,RV 单结构,360,JBHI 2023)双代际并存,需以规模与任务字段区分。
- curl 直连 zenodo.org/web.archive.org TLS 阻断(exit 35)环境存照:核验经 WebFetch 通路完成。
- 测试集标签在主办方侧;挑战外研究能否获得 160 例测试标注以官网注册页口径为准——泛化研究默认按官方训练/验证划分或自划分执行。
- 协议内 OOD 与事后 OOD 的证据等级差异是本条目优先引用 M&Ms-2 泛化结论的方法学理由(§2.6 对照表)。
- 弱点×对策矩阵中"多视图→基底"与"未见→形态谱"两行有直接证据背书;容积一致性与拓扑约束两行为机制推导方向,证据等级不同。
- 厂商序列参数差异(翻转角/并行采集/带宽)影响 bSSFP 对比与暗带伪影位置——扫描仪型号标签是最直接的域标签。
- 极端 HD(50mm+)可能含标注分歧贡献——规则 (d) 在标注层消解最大不一致源后,测试期 HD 更接近纯方法误差。
- LA 崩溃的数值后果(按公式演练):SA 相同的两份提交仅 LA 项失败即损失约 0.093 总分,超过多数相邻名次差。
术语表(30 条)
| 术语 | 释义 |
|---|---|
| cine CMR | 心脏磁共振电影序列(bSSFP 亮血),心动周期连续成像;M&Ms-2 的影像类型 |
| 短轴(SA, short-axis) | 垂直于心脏长轴的成像平面,容积定量的主力视图 |
| 长轴 4CH(LA 4CH) | 四心腔长轴视图,单层面同显四腔;M&Ms-2 中承担基底/心尖定界 |
| ED / ES | 舒张末期/收缩末期,cine 序列的两个标准标注时相 |
| DSC(Dice) | Dice 系数,分割重叠度指标(0-1) |
| HD(Hausdorff 距离) | 最坏边界距离指标,对孤立边界误差极敏感;本挑战 50mm 封顶 |
| nnU-Net | 自配置 U-Net 框架(Isensee 等),本挑战冠军集团骨干 |
| 未见病理(unseen pathology) | 训练集中完全不出现、仅用于验证/测试的病理组(DRV/TRI) |
| 域泛化(domain generalization) | 模型对训练分布外数据的泛化能力 |
| 基底 slice 歧义 | 短轴堆栈中"RV 从哪一层开始算"的归属问题,由 SOP 规则 d 以长轴定界解决 |
| 三尖瓣环 | 右心房-右心室间的纤维环;4CH 视图上推断 RV 基底起点的解剖锚 |
| DLV | 左心室扩张(dilated LV);LVEDV>214mL 男/179mL 女 |
| DRV | 右心室扩张(dilated RV);RVEDV>250mL 男/201mL 女;未见病理组 |
| HCM | 肥厚型心肌病;LV 壁厚>15mm |
| ARR | 心律失常源性心肌病(arrhythmic) |
| FALL / ToF | 法洛四联症(tetralogy of Fallot);论文误拼 “Tetrology” |
| CIA / IAC | 房间隔交通(inter-atrial communication),文献亦近 ASD 口径 |
| TRI | 三尖瓣反流(tricuspid regurgitation);未见病理组 |
| RVEF | 右心室射血分数 = (RVEDV−RVESV)/RVEDV;本挑战的代表性临床指标 |
| Mann-Whitney U 检验 | 非参数组间差异检验;论文用于未见组 DSC 差异的显著性 |
| CodaLab | 挑战赛提交与排行榜平台,本挑战采用 |
| Docker 远程评估 | 参赛方法打包镜像、主办方服务器统一推理的评估模式 |
| bSSFP | 稳态自由进动序列,cine CMR 的标准序列 |
| STACOM | Statistical Atlases and Computational Models of the Heart workshop,MICCAI 同场系列 |
| LNCS | Springer Lecture Notes in Computer Science;STACOM 论文集载体 |
| RVSC | Right Ventricle Segmentation Challenge(2012),上一个 RV 公开基准 |
| inter-view 对应 | 同一例 SA 与 LA 序列间的解剖对应关系,预处理中保留 |
| 数据使用政策 | 注册制数据发放中"注册+同意政策"的合同文本,本数据集的许可载体 |
| euCanSHare | H2020 资助(825903)的 CMR 数据共享平台,M&Ms 系列的资助母体 |
| TemPERA | Imperial College 参赛方法(Galazis 等),代码开源 cgalaz01/mnms2_challenge |
| 暗带伪影(banding) | bSSFP 序列的特有伪影条带,位置随序列参数与场强变化;多厂商域指纹的一部分 |
| 特征级融合 | 两视图各自编码后在特征层拼接/互注的融合方式;P9 cross-view 模块所属类型 |
| 协议内 OOD | 在数据发布前即由官方划分固化的分布外子集;区别于研究者事后自划分 |
| 先心病(ACHD) | 成人先天性心脏病随访人群;FALL 组的典型来源 |
| 层间插值 | 用相邻层边界自动生成中间层标注的做法;SOP 规则 b 在基底区禁止 |
| min-max 归一化 | 把指标线性压缩到 0-1 区间的预处理;HD 计分前执行 |
| 远程推理 | 提交物在主办方硬件上执行而非参赛者本地的评估模式;Docker 是其载体 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | M&Ms-2 |
| url_name | mms-2 |
| 类型 | 挑战赛数据集(数据+协议+方法论文集三件套) |
| 论文 | IEEE JBHI 27(7):3302-3313, 2023(挑战=STACOM 2021) |
| 团队 | BCN-AIM(UB)+ Vall d’Hebron 研究所 |
| 规模 | 360 例 cine CMR(8 组病理);160/40/160 |
| 许可 | 注册制研究用途(无标准开源许可证文本) |
| 抓取时点 | 2026-09-26/27 |
| 生产批次 | 50 篇冲刺批量生产 · 批次 4 |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | Zenodo DOI+JBHI 论文+STACOM 论文集三路可索引;但与 M&Ms 名称近似度高,检索需强制区分 |
| A 可获取性 | 4 | 注册制无直链;Zenodo 仅设计 PDF;官网核验时临时不可用;镜像不可作为正式源 |
| I 可互操作 | 8 | NIfTI 通用格式,与 ACDC/M&Ms 管线直接兼容;DICOM 元数据保留于主办方侧 |
| M 元数据质量 | 6 | 病理/扫描仪/划分口径文字完备;但表 II-VI 图像格式不可机读、450/360 双口径、逐例元数据随注册发放 |
| S 可持续性 | 5 | 学术团队维护(euCanSHare 资助背景),单官网依赖;无官方模型权重与统一评测代码出口 |
| 综合评级 | 6.0/10(中) | 学术价值与协议设计一流;可获取性被注册制+平台状态拖累 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 360 例/8 组病理分布 | JBHI 论文正文 | 全文(/tmp/mnms2_jbhi.txt) |
| 160/40/160 划分、验证每病理 5 例 | JBHI 论文正文 | 全文 |
| DLV/DRV/HCM 诊断阈值 | JBHI 论文正文 | 全文 |
| 9 扫描仪 3 厂商清单 | JBHI 论文正文 | 全文 |
| >120/17/15 参与漏斗 | JBHI 论文正文 | 全文 |
| M 指标公式、HD 50mm 封顶 | JBHI 论文正文 | 全文 |
| 0.922±0.011 / 0.912±0.016 | JBHI 论文正文 | 全文 |
| +0.042 vs M&Ms-1、+0.004 vs ACDC | JBHI 论文正文 | 全文 |
| SOP 四规则、cvi42 链 | JBHI 论文正文 | 全文 |
| 论文时间线五时点 | JBHI 论文 footnote | 全文页脚 |
| DOI 4573984、2.7MB 设计 PDF、md5 | Zenodo record 4573984 官方页 | WebFetch 核验 |
| 450 设计口径 | Zenodo 记录描述字段 | 同上 |
| 30.15GB / 543MB 镜像体量 | Kaggle/HF 镜像页 | WebFetch 核验 |
| TemPERA 开源 | GitHub cgalaz01/mnms2_challenge | WebFetch 核验 |
| 测试集未见病理 25+25 | 按"验证每病理 5 例"反推 | 推算口径,非原文直证 |
附录 D:数据获取决策树
需求是什么?
├── 只想看挑战设计了什么
│ └── Zenodo record 4573984 下载设计 PDF(2.7MB,公开直链)
├── 要数据本体(训练/复现)
│ ├── 1) 官网 www.ub.edu/mnms-2 注册(论文脚注 2 口径)
│ ├── 2) 同意数据使用政策(研究用途)
│ └── 3) 官网不可用 → 隔期重试 / 联系 BCN-AIM / Vall d'Hebron
├── 要复现参赛方法
│ ├── STACOM 2021 论文集(LNCS, ISBN 978-3-030-93722-5)15 篇
│ └── GitHub cgalaz01/mnms2_challenge(TemPERA)
├── 要引结论数字
│ └── JBHI 论文(doi:10.1109/JBHI.2023.3267857)正文口径+双时点注明
├── 要标注质量研究
│ └── §3.6 治理链条与残余盲区(跨中心一致性未公开,需自测)
├── 要办新挑战赛
│ └── §5 协议清单 + §7.2 指标设计论 + §7.5 负结果清单作设计输入
└── 想找 LGE/瘢痕数据
└── 走错门:本数据集全为 cine,无 LGE(坑 8)
附录 E:病理组缩写对照全表
| 论文缩写 | 英文全称 | 中文 | 检索变体 | 未见组 |
|---|---|---|---|---|
| Normal | healthy | 健康 | normal/NOR/HC | 否 |
| DLV | dilated left ventricle | 左心室扩张 | LV dilation | 否 |
| HCM | hypertrophic cardiomyopathy | 肥厚型心肌病 | HCM | 否 |
| ARR | arrhythmic (cardiomyopathy) | 心律失常源性心肌病 | ARVC 语境注意区分 | 否 |
| FALL | (tetralogy of) Fallot | 法洛四联症 | ToF/Tetralogy/Tetrology(论文笔误) | 否 |
| CIA | inter-atrial communication | 房间隔交通 | IAC/ASD | 否 |
| DRV | dilated right ventricle | 右心室扩张 | RV dilation | 是 |
| TRI | tricuspid regurgitation | 三尖瓣反流 | TR | 是 |
附录 F:SOP 四规则复现骨架
规则 a(腔体全覆盖)
- LV/RV 血池含乳头肌与小梁完全计入
- 目的:容积口径统一,EF 可比
规则 b(基底不插值)
- 基底区心肌边界逐层手画,禁止层间插值
- 目的:形态变化最剧烈区不因插值失真
规则 c(时相校验)
- RV 容积:ED 帧 > ES 帧,违例退回
- 目的:拦截时相标反的粗错
规则 d(长轴定界,M&Ms-2 新增)
- RV 基底 slice:三尖瓣环在 LA 4CH 上的位置推断
- 心尖 slice:最后一个可见心室腔的层面
- 目的:以第二视角消解短轴基底歧义
工程要点:复核火力集中基底/心尖;分歧走观察者间共识;
标注在临床工具链(cvi42)内完成,统一转 NIfTI 交付
附录 G:排名指标公式与实现骨架
def challenge_score(dsc_sa, hd_sa, dsc_la, hd_la, hd_max_all=50.0):
"""M&Ms-2 综合排名指标(ED/ES 先平均后计入)。
hd_*: 已 min-max 归一化的 HD;hd_max_all 为封顶值(全体最大 HD + 10mm)。
"""
def clip_norm(hd, cap=hd_max_all):
return min(hd, cap) / cap # 超出按最差档计
m_sa = (dsc_sa + clip_norm(hd_sa)) / 2
m_la = (dsc_la + clip_norm(hd_la)) / 2
return 0.75 * m_sa + 0.25 * m_la
设计要点:SA/LA 按 0.75/0.25 加权(临床用途权重+定界底线);DSC 与 HD 各半(区域重叠+最坏边界双保险);HD 归一化+封顶(防单例灾难主导名次)。
附录 H:15 队方法谱系总表(家族口径)
| 编号 | 家族 | 多视图 | 备注 |
|---|---|---|---|
| P1-P5 | nnU-Net | 部分采用 | 冠军集团,统计差异有限 |
| P6 | nnU-Net | — | 未进第一集团 |
| P7 | DLA(深度层级聚合) | — | — |
| P8-P14 | U-Net 手工变体 | 含 P9/P14 | P9 统一 2D/3D U-Net+cross-view;RVEF 最稳 |
| P15 | GST(Transformer 特征金字塔) | — | 唯一 Transformer 路线 |
多视图采用共 8/15 队;未分割基底 slice 最少:P9、P14、P4。逐队完整方法细节见 STACOM 2021 论文集各篇。
附录 I:双口径与推算口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 数据规模 | 450 例(Zenodo 设计描述) | 360 例(论文/实际发布) | 按 360 引用,设计口径注明 |
| 2 | 时间坐标 | 2021(挑战/STACOM) | 2023(JBHI 论文) | 双时点并存,引数字注明出处时点 |
| 3 | 测试集未见病理 | — | 25+25=50 例(按验证每病理 5 例反推) | 推算口径,引用注明 |
| 4 | 前作 M&Ms 规模 | 375 例(总量口径) | 345 例(训练+验证口径) | 沿用前作条目双口径存照 |
| 5 | 2CH/3CH 扩展 | 论文自述计划 | 无发布记录(核验时点) | 计划口径存照 |
| 6 | 官网状态 | 论文脚注 2 有效口径 | 2026-09-26/27 核验临时不可用 | 按核验时点存照 |
附录 J:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 官网恢复 | www.ub.edu/mnms-2 可访问 | 更新 §4 状态、确认注册通道现行为、补抓数据页元数据 | 1 |
| 2CH/3CH 版发布 | 团队发布多视图扩展数据集 | 新立或扩写条目、更新 §8.3 | 2 |
| Zenodo 更新 | record 4573984 增补文件(如数据本体上 Zenodo) | 重写 §4 可获取性、升 AI-Ready 评级 | 3 |
| 后续综述引用 | M&Ms-2 被方法学综述系统引用 | §8.2 生态表扩行 | 4 |
触发点联动关系:触发点 1(官网恢复)是 2/3 的前置观测点——官网页面常随扩展版发布同步改版;触发点 3 若发生(数据本体上 Zenodo),本条目的 AI-Ready 评级(附录 B 的 A 维度)与 §4 全节需整体重写,优先级最高级处理。
附录 K:引文规范
@article{martinisla2023mnms2,
title = {Deep Learning Segmentation of the Right Ventricle in Cardiac MRI:
The M\&Ms Challenge},
author = {Mart{\'i}n-Isla, Carlos and others},
journal = {IEEE Journal of Biomedical and Health Informatics},
volume = {27},
number = {7},
pages = {3302--3313},
year = {2023},
doi = {10.1109/JBHI.2023.3267857}
}
@dataset{mnms2_zenodo,
title = {Multi-Disease, Multi-View \& Multi-Center Right Ventricular
Segmentation in Cardiac MRI (M\&Ms-2)},
author = {Mart{\'i}n-Isla, Carlos and Rodr{\'i}guez Palomares, Jos{\'e} F. and
Guala, Andrea and Escalera, Sergio and Lekadir, Karim},
year = {2021},
publisher = {Zenodo},
doi = {10.5281/zenodo.4573984}
}
引用规则:数据本体引 Zenodo dataset 条目(2021);结论数字引 JBHI 论文(2023);方法复现引 STACOM 2021 各队论文——三条引文线各管一段,不可互相替代。
附录 L:本条目生产档案
- 生产通道:50 篇冲刺批量生产 · 批次 4,代理 agentB-mms2
- 任务头三处证伪:DOI 8498334(→4573984)、“2023/MICCAI 2023”(→STACOM 2021)、“含 Scars LGE”(→全为 cine)
- 事实研究:前 session Zenodo/JBHI PDF/LNCS/GitHub/Kaggle 三源互证 + 本 session JBHI 全文三段回读二次核验
- FACTS.md:writing/mms-2/FACTS.md 九节
- 成稿方式:五 part 直写拼接(/tmp/mms-2_agentB-mms2_part1~5.md → cat)
- 坑点:§10 八则("坑 N:"编号制)
- 互链:按纪律由 link_builder.py 自动挂载,本文未手写互链章节
附录 M:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI 10.5281/zenodo.4573984(设计文档);数据本体无独立 DOI |
| F2 富元数据 | ⚠️ | Zenodo 记录+论文完备;逐例元数据随注册发放、表 II-VI 不可机读 |
| A1 可访问协议 | ⚠️ | 注册制 HTTP 通道;核验时官网临时不可用;无公开直链 |
| A2 元数据可访问 | ✅ | 设计 PDF/论文/方法论文集公开 |
| I1 互操作格式 | ✅ | NIfTI,与 ACDC/M&Ms 管线兼容 |
| I2 词汇表引用 | ✅ | 标准心脏解剖与病理术语(含组内缩写对照) |
| R1 来源溯源 | ✅ | 3 中心、9 扫描仪、伦理与资助全披露 |
| R3 可复现流程 | ⚠️ | 15 篇方法论文公开;无官方评测代码/权重出口 |
| AI-Ready 综合 | 中下 | 申请制高价值基准的典型样本 |
附录 N:缩写速查
| 缩写 | 全称 |
|---|---|
| M&Ms | Multi-Centre, Multi-Vendor & Multi-Disease(前代挑战,2020) |
| M&Ms-2 | Multi-Disease, Multi-View & Multi-Center RV Segmentation Challenge(2021) |
| RV / LV / MYO | 右心室 / 左心室 / 心肌 |
| SA / LA | 短轴 / 长轴 |
| 4CH | 四心腔(four-chamber)视图 |
| ED / ES | 舒张末期 / 收缩末期 |
| DSC | Dice 系数 |
| HD | Hausdorff 距离 |
| EF / RVEF | 射血分数 / 右室射血分数 |
| CMR | 心脏磁共振 |
| bSSFP | 稳态自由进动序列 |
| ToF | 法洛四联症 |
| STACOM | 统计心脏图谱与计算模型 workshop |
| LNCS | Springer 计算机科学讲义 |
| JBHI | IEEE Journal of Biomedical and Health Informatics |
| RVSC | 右心室分割挑战(2012) |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 O:基于本数据集的研究检查清单(12 项)
- 获取合规:走官网注册+数据使用政策,不使用第三方镜像做正式研究;商用需书面确认。
- 时点标注:引挑战事实写 2021/STACOM,引结论数字写 2023/JBHI。
- 规模口径:数据集规模一律 360 例;提到 450 必须挂"设计目标口径"。
- 推算声明:测试集未见病理 25+25 为推算,论文未直证——引用时保留"推算"字样。
- 任务边界:这是 RV 评估基准;用 LV/MYO 标注时注明其非计分身份。
- 时相边界:只有 ED/ES 有标签;时序方法需自行解决中间帧监督。
- 无 LGE:任何瘢痕/延迟强化研究命题在本数据集上无数据支撑。
- 泛化实验:未见的 DRV/TRI 组是协议级 OOD——别把它们混进训练集再做"数据增强"。
- 指标双轨:报 DSC/HD 的同时报 EDV/ESV/EF 误差;引用他人结果时核对是否双轨。
- 预训练政策:对标本挑战成绩时记住"禁外部数据与预训练"的口径差异。
- 名称防混淆:与 M&Ms(2020)区分以规模(360 vs 345/375)与任务(RV vs 三结构)双字段校验。
- 拼写卫生:写 Tetralogy(不沿用论文 Tetrology 笔误);缩写统一用一套(FALL 或 ToF 二选一全篇一致)。
附录 P:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 挑战/数据集 | “M&Ms-2” AND (“right ventricular” OR “RV”) | Zenodo 4573984 + JBHI 论文 |
| 设计文档 | zenodo 4573984 / “Multi-Disease, Multi-View & Multi-Center” | 挑战设计 PDF |
| 方法论文 | “M&Ms” AND “STACOM 2021” / LNCS 978-3-030-93722-5 | 15 篇方法论文 |
| 开源实现 | mnms2_challenge / TemPERA Galazis | GitHub cgalaz01 |
| 未见病理泛化 | “M&Ms-2” AND (“unseen” OR “out-of-distribution” OR “generalization”) | 泛化研究引用者 |
| 病理组核对 | “Tetrology of Fallot”(论文笔误原文) | 论文原文定位 |
| 反例(勿用) | zenodo 8498334 | 无此记录(坑 1) |
检索卫生三条:一、命中"M&Ms"先核规模与任务字段再定引用对象;二、官网不可用时以论文脚注+Zenodo 存照为准,勿据 404 宣告数据集消失;三、镜像站只作体量佐证,不作许可与版本依据。
条目结构一览(全篇导航):
| 章节 | 内容 | 服务对象 |
|---|---|---|
| INFOBOX + 导语 | 一屏速览 + 读法四则 | 所有读者 |
| §0 导读 | 问题背景与四层回答 | 初次接触者 |
| §1 十问十答 | 最高频问题的快答 | 快速筛选者 |
| §2 数据构成 | 病理/设备/视图/划分/未见组/诊断标准 | 建管线的人 |
| §3 标注流水线 | 人员/软件链/SOP 四规则/治理链条 | 标注工程与数据质量研究 |
| §4 获取与许可 | 官方渠道矩阵/检索陷阱/镜像纪律/AI-Ready | 想拿数据的人 |
| §5 挑战协议 | 时间线/漏斗/规则/指标公式 | 办赛者与复现者 |
| §6 核心发现 | 方法谱系/排名/多视图/泛化/误差/断代 + 结论清单 | 引用者与研究者 |
| §7 方法学启示 | 可迁移经验 + 负结果清单 | 综述与设计者 |
| §8 生态 | 开源/三件套/未来计划/资助伦理 | 生态与合规 |
| §9 检索路径 | 关键词组合与通道 | 检索者 |
| §10 避坑清单 | 八则"坑 N:" | 所有人(尤其自动化采集) |
| §11 总结 + FAQ 48 问 + 事实清单 48 条 + 术语表 40 条 | 收口与查证 | 深度读者与审校 |
| 附录 A-Q | 速查/DAIMS/证据链/决策树/对照表/引文规范 | 审校与维护 |
附录 Q:常见误读与澄清对照表
| 常见误读 | 澄清 | 出处 |
|---|---|---|
| “M&Ms-2 是 2023 年的数据集” | 挑战 2021;2023 只是 JBHI 总结论文 | 坑 2 |
| “Zenodo DOI 就能下数据” | Zenodo 仅设计 PDF;本体注册制 | 坑 1、§4.2 |
| “450 例” | 实际发布 360 例;450 为设计口径 | 坑 3 |
| “M&Ms 和 M&Ms-2 差不多” | 任务/队列/视图/论文全线不同 | 坑 4、§2.8 |
| “含 LGE 可做瘢痕研究” | 全为 cine,无 LGE | 坑 8 |
| “测试集 100 例未见病理” | 推算口径约 50 例(25+25) | 坑 7 |
| “DSC 0.92 = RV 定量已可临床用” | 几何与 RVEF 误差脱钩,需双轨报告 | §6.5、§7.3 |
| “多视图方法排名更高” | 多视图非充分条件;收益在基底与 RVEF 局部 | §6.5、§7.5 |
| “3T 数据是主要难点” | 1.5T vs 3T 无实质差异 | §6.4 |
| “官网 404 = 数据集死了” | 平台临时状态;以论文脚注+核验时点存照 | 坑 5 |
这张表与坑点清单(§10)、双口径登记表(附录 I)配套使用:坑点讲"怎么踩的",本表讲"怎么快速纠正"。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,核验时点 2026-09-26/27。事实陈述以 JBHI 总结论文(doi:10.1109/JBHI.2023.3267857)全文、Zenodo record 4573984 官方记录与 STACOM 2021 论文集为源;任务头三处印象错误(DOI、年份、LGE)已在生产中证伪并全程按修正后事实书写;450/360 双口径、图像表格不可机读、测试集未见病理推算口径等原始文档限制已在坑点与附录 I 存照。条目与库内 M&Ms、ACDC 等 CMR 分割基准条目共同构成心脏磁共振分割数据集家族的检索面;互链由系统按调度自动挂载。后续维护触发点见附录 J。
版本记录:v1.0(2026-09-27)——批次 4 首版成稿,五 part 拼接(1400 行档),八坑、48 问、48 条硬事实、17 附录;触发点 1-4 未触发。后续修订按附录 J 执行并在本节追加版本行。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cmrxmotion — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lvquant — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- emidec — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- myops — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- mm-whs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lascarqs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- cmrxrecon — 共享标签:医学影像 / MRI / 挑战赛数据集 / 心血管疾病
- mms — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
- camus — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

