信息速览
INFOBOX — CMRxMotion 一屏速览
维度 内容 本质 MICCAI 2022 官方注册挑战(STACOM 2022 第 13 届):首个把"呼吸运动伪影"做成受控变量的心脏 MRI 公开基准——不是比谁泛化得广,而是比谁在"质量崩塌梯度"上崩得慢 设计 **单中心、单扫描仪(Siemens MAGNETOM Vida 3T,复旦张江国际脑影像中心)、单序列(TrueFISP bSSFP cine 短轴)**前瞻采集 40 名健康志愿者——刻意反着 M&Ms 的多厂商路线走,把设备混杂全部锁死 数据 320 个 cine volume = 40 人 × 4 种呼吸协议(完全屏气/屏气减半/自由呼吸/剧烈呼吸)× 2 时相(ED/ES);2.0×2.0 mm² / 层厚 8 mm / 层间隔 4 mm 划分 训练 20 人 160(139 例带分割标注)/ 验证 5 人 40 / 测试 15 人 120(挑战期全保密;志愿者不跨集) 双任务 Task 1 图像质量评估(三级轻/中/重,Cohen’s Kappa);Task 2 鲁棒分割(LV/MYO/RV,DSC+HD95,重度伪影图像剔除出评估) 标注 IQA:两位放射科医生 5 点 Likert 共识压缩为三级;分割:技术员勾画+双放射科医生复核,3D Slicer 链,沿用 ACDC/M&Ms 惯例 参与 14 国家/地区 87 队报名(官方新闻口径;论文口径 112 名注册者);验证榜 275+340 次提交;测试期 10+13 队交 Docker;14 篇方法论文进 STACOM 2022 论文集(LNCS 978-3-031-23442-2) 冠军 Task 1:UON_IMA(诺丁汉大学)Kappa 0.631;Task 2:UA-SVCC(阿尔伯塔大学)与 Med-Air(KCL)并列第一,CMR.Love.LHND(港中文)与 Tewodrosw 并列第二(MedIA 最终口径) 数字 13 队 DSC 范围:LV 81.81-93.90%、MYO 67.73-87.37%、RV 63.95-92.22%;nnU-Net 主导(12 队中 7 队采用);22 套算法(源码+权重+Docker)全开源 获取 Synapse 注册制(注册+data usage agreement);官方条款为解禁期(2022-12)后研究使用需引用两篇官方论文;Zenodo 上没有数据(坑 2) 谱系 ACDC(2017,单中心病理)→ M&Ms(2020,多厂商)→ CMRxMotion(2022,运动伪影单变量)→ CMRxRecon(2023-2025,重建,库内 rid 506)——CMRx 系列开山作 红线 全健康人、单机单序列、两帧制、Label 3 无分割标注——四条边界任何一条越界使用都会得出无效结论(§7.4、附录 M)
CMRxMotion 是一场"主动把影像拍坏"的挑战赛:组织者招募 40 名健康志愿者,训练他们用四种方式呼吸——老老实实屏气、屏气时间砍半、随便喘、剧烈喘——然后在一台 3T 磁共振上把每个人的心脏各拍四遍。设备是同一台、序列是同一种、人群是同一批,唯一变化的是呼吸行为本身。于是这批数据天然构成了一条从"教科书级清晰"到"重度伪影糊成一片"的质量梯度,320 个 cine volume 像一根标尺,专门量两件事:算法能不能识别出影像已经被呼吸毁了?分割模型在影像半毁时还能撑住多少精度? 这是 ACDC、M&Ms 这些"把数据集做广"的挑战之外,一条"把实验做纯"的路线。
答卷同样值得细读。质量评估任务上,冠军(诺丁汉大学 UON_IMA)的 Cohen’s Kappa 只有 0.631——机器与医生在"轻度"上很一致,在中重度的灰色地带全面拉胯,这个不及格分数本身就是有价值的公开结论:细粒度伪影分级远未解决,但可用/不可用的二分判断已经够用。分割任务上,13 支队伍的 DSC 从 63.95% 一路铺到 93.90%,阿尔伯塔大学与伦敦国王学院的两套方法在最终排名上并列第一——而 nnU-Net 系的压倒性在场再次证明:域漂移换了一种形式(从"换厂商"变成"换呼吸"),应对配方却高度趋同。最难得的是,22 套参赛算法连同源码、权重、Docker 镜像全部开源存档——这可能是 CMR 分割挑战史上可复现资产最完整的一届。
数字名片(全部硬数字的三源口径汇总,逐项出处见 §11.3):
| # | 数字 | 含义 |
|---|---|---|
| 1 | 40 | 健康志愿者(24 男/16 女,19-48 岁)——受试者级样本量 |
| 2 | 320 | cine volume 总数(4 呼吸协议 × ED/ES 两时相)——"例"的正确口径 |
| 3 | 1 | 扫描仪台数(Siemens MAGNETOM Vida 3T)——单变量设计的物理基础 |
| 4 | 4 | 呼吸协议档数(完全屏气/屏气减半/自由呼吸/剧烈呼吸) |
| 5 | 139/160 | 训练集带分割标注的 volume 数(21 例 Label 3 设计性无标注) |
| 6 | 0.631 | Task 1 冠军 UON_IMA 的 Cohen’s Kappa(CI 0.518-0.734) |
| 7 | 93.90% | Task 2 最佳单结构 DSC(LV,UA-SVCC) |
| 8 | 7/12 | 采用 nnU-Net 的 Task 2 可分析队伍占比 |
| 9 | 22 | 全开源参赛算法套数(源码+权重+Docker,Apache 2.0) |
| 10 | 87 / 112 | 报名队伍数(新闻口径)/ 注册参与者数(论文口径) |
导语读法五则:
- 只想下数据:直奔 §4 获取与许可——Synapse 注册制、两个 Synapse ID 并存(坑 3)、Zenodo 上没有数据(坑 2),三件事先记住。
- 关心模型鲁棒性与质量控制:直奔 §2.3 质量三级设计 + §6 结果分析——IQA Label 3 无分割标注(坑 8)这个预处理细节能省掉一个晚上的 debug。
- 要办挑战赛或设计评估协议:直奔 §5 评估协议——rank-then-aggregate 排名、断网 Docker 离线评估、每 case 排名平均制都是现成可抄的协议样本。
- 对比 M&Ms/ACDC 做基准选型:直奔 §2.7 对照表 + §8 生态——想清楚你要测的是厂商泛化、病理泛化还是行为鲁棒性,再决定用哪个数据集。
- 合规与引用:直奔 §4.4 条款细读 + 附录 F 引文规范——"代码 Apache 2.0 ≠ 数据开源"是最常被忽略的一层(坑 9)。
§0 导读:这个数据集解决什么问题
心脏磁共振(CMR)分割的公开基准在 2022 年之前已经把"数据异质性"这条路线卷得很充分:ACDC(2017)提供了单中心多病理的起点,M&Ms(2020)把厂商与中心差异搬上计分桌,M&Ms-2(2021)把任务收敛到右心室并加入多视图。但这一整条谱系有一个共同的盲区——它们默认影像本身是"合格的"。而临床现实是:心衰患者和儿童根本憋不住气,屏气失败导致的呼吸运动伪影(respiratory motion artifacts)是日常扫描中最常见的质量崩塌方式;模型在 paper 上 0.92 的 DSC,遇到一张糊掉的图会跌到哪里,没有人系统量过。
CMRxMotion 的回答是把这个问题变成受控实验。与其去回顾性数据库里翻找"偶然拍坏了的图"(既费人力又被数据治理卡住,还混着厂商、协议、病理等无法剥离的混杂因素),不如前瞻性地让健康志愿者在知情同意下表演四种呼吸方式——同一台机器、同一个协议、同一批人,四个质量层级全部拿到。这样建出来的数据集,运动伪影是唯一自变量,任何性能滑坡都能干净地归因于伪影本身。这是整个挑战在方法学上最聪明的一步棋,也使它成为"单变量压力测试"这一实验设计范式的教科书样本。
值得把"为什么不用回顾性数据"展开说透,因为这是所有质控数据集建设的公共岔路口。回顾性路线的第一难在筛:从 PACS 里翻找伪影片依赖人工阅片,而伪影像在库里的占比不高、分布零散;第二难在治理:医院数据库的二次利用受伦理与合同约束,跨国共享几乎不可行;第三难在归因:一张临床废片上可能同时叠加着异常体位、金属植入物、非常规序列与非标准屏气——你无法回答"模型崩是因为呼吸还是因为别的"。前瞻性表演路线把三难一次清空:筛选成本变为采集成本(一次访视四遍扫描)、治理边界从"医院历史数据"变为"前瞻研究知情同意"、归因纯度由设计保证。当然它也付出代价:健康志愿者无法呈现病理形态(心脏代偿性扩大、胸腔积液等真实伪影高发人群缺席),且表演出来的呼吸模式与病理性呼吸的统计分布不完全一致——这些边界在 §7 与 §8 的使用建议里会持续出现。
第二层设计是双任务。Task 1 让模型学会"自己看图说话"——把每张影像按运动伪影严重度分为轻、中、重三级,对应临床决策是"直接用/谨慎用/重拍";Task 2 让分割模型在质量梯度上保持输出,且评估时把无可靠真值的重度图像剔除,避免拿噪声当靶子。两个任务合起来,恰好对应临床工作流的两道关卡:先判质量、再做定量。论文的后续分析也证实了这个流程的价值——质量感知工作流(先过滤后分割)能显著降低下游心功能指标的误差。
第三层是可复现性工程。验证期 Synapse 实时榜单(每队每天每任务最多 3 次提交),测试期一律收 Docker 镜像进断网的标准 GPU 环境离线跑(Tesla V100、4 小时限额)——排名不可刷、环境不可变。更重要的是收尾:22 套算法的源码、权重、Docker 镜像全部在 GitHub 组织与 Docker Hub 归档。对于做基线复现的研究者,这批资产的密度超过了绝大多数挑战赛。
第四层面向本库读者:CMRxMotion 是一个"设计极简但实验设计极讲究"的数据集——320 个 volume 的体量在 CMR 家族里垫底,但单变量的纯度让它成为算法鲁棒性研究和质量控制模型训练的首选标尺;同时它的注册制获取、双 Synapse ID、零 Zenodo 存在感构成了三道检索暗坑(§4 与 §10 逐条拆解)。
还有一层常被忽略的定位:它是影像质控(IQA)方向上少数带医师共识标签的公开训练源。医学影像质量评估这个方向,公开数据一直比分割少一个量级——多数质控数据集要么是二分类(可用/不可用),要么标签来自代理指标(如扫描参数)而非医生判读。CMRxMotion 给出了 320 例医师共识的三级标签,且与分割标签共享同一批影像、同一套伦理与许可——对"质量评估+下游分析"联合研究来说,这是它超出"又一个分割挑战"的身份价值。
把 CMRxMotion 放进实验科学的谱系里看,它的设计范式并不新鲜——物理学里叫控制变量实验,临床医学里叫单因素对照试验——但它在医学影像基准这个"习惯于拿现成数据"的领域里是一次不常见的回归:用实验设计而不是数据挖掘来回答问题。大多数公开数据集的本质是"观察性研究"——把临床流水线里自然发生的数据收集起来,异质性是既成事实,研究者只能用统计手段事后剥离混杂;CMRxMotion 的本质是"干预性研究"——呼吸行为是被组织者主动设定的自变量,每个受试者内的四档对照是设计出来的,不是碰运气凑出来的。这个差异决定了两个数据集能回答的问题集合完全不同:观察性数据集回答"真实分布下模型表现如何",干预性数据集回答"特定因素的单变量剂量-反应曲线长什么样"。后者恰恰是建立因果性认知(“伪影导致性能下降 X 个点"而非"伪影与性能下降相关”)的唯一路径。
还有一个时效性的问题值得正面回答:这是一个 2022 年的挑战赛,到本条目核验时点(2026-09)已经过去四年,为什么还值得一条 AI-Ready 条目?三个理由。其一,它的核心问题(呼吸运动伪影下的鲁棒性)在临床上没有被解决——总结论文 2025 年才出版,冠军 Kappa 0.631 的天花板纪录仍待打破;其二,它的 22 套开源算法与 320 例医师共识标签是持续被下游工作(含 CMR 基础模型研究)取用的活资产,不是博物馆展品;其三,它的实验设计模板(单变量压力测试 + 受试者内配对 + 质量门控写入评估协议)对当前层出不穷的新基准设计仍是最干净的参考样本——数据集会老,设计不会。
证据等级说明。本条目所有事实陈述分三级标注:一手双源(设计论文 arXiv:2210.06385 + 总结论文 MedIA 109:103883,硬数字主口径)→ 一手单源(官网条款原文、复旦官方新闻,用于时间线与颁奖细节)→ 第三方佐证(openmedlab、HuggingFace 镜像、EmergentMind,仅用于结构参考与交叉验证,不作事实主源)。凡未能从可获取文本逐字核验的数字(如五个生物标志物名单、测试集标注的解禁形态),一律在正文存照并标注"待核",不编造补位。八处双口径冲突全部登记于附录 D,引用本条目时请连同存照一起引用。
§0 读法三则:
- 这个数据集有两种完全相反的错误打开方式:一种是把"单中心单厂商"当成缺陷否掉(恰恰相反,这是它方法学价值所在,见坑 7);另一种是把它当多厂商泛化基准用(那是 M&Ms 的活,见 §2.7 对照表)。
- 全文硬数字出自三份一手文档:设计论文 arXiv:2210.06385(2022)、总结论文 Medical Image Analysis 109:103883(在线 2025/卷期 2026)与官网 cmr.miccai.cloud;颁奖时点的复旦新闻表述与论文最终排名存在一处出入(坑 5),引用时以论文口径为准。
- "320 例"是 volume 数不是人数——40 名志愿者 × 4 协议 × 2 时相(坑 6);第三方镜像把测试集写成 160 例也是错的(坑 4)。
§1 数据集速览:十五问十五答
Q1:CMRxMotion 是什么、解决什么问题?
CMRxMotion(Extreme Cardiac MRI Analysis Challenge under Respiratory Motion,呼吸运动下的极端心脏 MRI 分析挑战)是 MICCAI 2022 官方注册挑战、第 13 届 STACOM workshop 同场活动。它建立了第一个公开评估"呼吸运动伪影下自动 CMR 分析鲁棒性"的基准:40 名健康志愿者按 4 种呼吸行为各扫一次,得到同一人的四档质量梯度影像,配套双任务(质量评估 + 鲁棒分割)。一句话:别的挑战测"换个医院还行不行",它测"病人没憋住气还行不行"。
Q2:数据长什么样、有多大?
320 个短轴 cine volume(TrueFISP bSSFP,ED/ES 两时相各一个 3D 体数据),来自 40 人 × 4 协议。面内分辨率 2.0×2.0 mm²,层厚 8 mm,层间隔 4 mm。NIfTI 格式,文件名 Pxxx-x-ED/ES.nii.gz。配套两类标注:每个 volume 一个三级质量标签(1 轻/2 中/3 重),诊断质量图像另有 LV/RV/MYO 三结构分割掩码。以体量论,它是 CMR 挑战家族里最小的成员之一(M&Ms 345 例、ACDC 100 患者但每人全周期多帧);它的筹码不在量,在"同一人四档质量"的配对结构——这种结构在自然采集的数据里几乎不可能凑齐。
Q3:四种呼吸协议具体是什么?
a) 完全遵从屏气指令(full breath-hold)——标准临床 SOP;b) 屏气时间减半(half breath-hold)——模拟憋不住但努力了;c) 自由呼吸(free breath)——完全不管;d) 剧烈呼吸(intensive breath)——主动制造最大伪影。志愿者在正式扫描前经过培训,四种行为在同一次访视内完成。设计逻辑是把临床上的"连续质量滑坡"离散成四个可对齐档位。
Q4:质量标签怎么打的?
两位放射科医生(Zhang Shi、Chengliang Dai)在 3D Slicer 中逐例查看,按标准 5 点 Likert 量表打分(5 优/4 良/3 可诊断/2 存疑/1 非诊断),讨论达成共识。为可复现性压缩为三级:4-5 分→Label 1 轻度、3 分→Label 2 中度、1-2 分→Label 3 重度。压缩的逻辑很工程化:五档里 4 与 5 的临床处置相同(直接用)、1 与 2 的处置也相同(重扫),真正影响决策的分界只有"能不能用"与"要不要小心"两道;三级恰好把临床动作空间映射完整,又避免五分类把训练样本摊薄。测试集质量与分割真值由 3 名资深放射科医生完成,挑战期间保密。
Q5:划分怎么切?
按志愿者切(不跨集):训练 20 人 160 volumes(图像+质量标签+分割标注全给)、验证 5 人 40 volumes(只给图像,真值扣住上 Synapse 榜)、测试 15 人 120 volumes(全部保密,收 Docker 离线评)。训练集 160 例中 139 例带分割标注——21 例重度伪影图像没有可靠真值,不标注也不参与分割计分。
Q6:谁参加、谁赢了?
14 个国家/地区 87 支队伍报名(官方新闻口径;总结论文计 112 名注册参与者),验证榜累计 Task 1 275 次、Task 2 340 次提交,最终 Task 1 有 10 队、Task 2 有 13 队提交 Docker 完成测试,14 篇方法论文进入 STACOM 2022 论文集。冠军:Task 1 为诺丁汉大学 UON_IMA(Kappa 0.631);Task 2 为阿尔伯塔大学 UA-SVCC 与伦敦国王学院 Med-Air 并列第一(MedIA 论文最终口径;颁奖新闻的表述与之有出入,见坑 5)。
Q7:方法和结论上有什么可带的干货?
四条。一,nnU-Net 统治依旧:Task 2 的 12 支可分析队伍中 7 支以 nnU-Net 为主干或核心组件——伪影场景也没能撼动它,自配置框架的鲁棒性跨过了第三种域漂移。二,质量评估"及格线清晰、天花板很低":所有队都对 Label 1 很准、对 Label 3 召回很低,说明"能不能用"的二分已可行、"坏到什么程度"的细分未解决;冠军 Kappa 0.631 的区间下沿(0.518)离"不可用"只有一步。三,MYO(心肌)永远是最难的结构(薄壁),基底与心尖层面普遍崩——与 ACDC/M&Ms 时代的误差解剖完全同构,说明这类误差源于结构本身而非数据集。四,稳定性赢了精度:rank-then-aggregate 下并列冠军的方法中位数并非最高,但分布最紧、离群最少——"不崩"比"偶尔惊艳"更值钱。
Q8:怎么获取?
官网注册(cmr.miccai.cloud)并签署 data access agreement,然后在 Synapse 平台下载数据(注册制,非直链)。注意两个 Synapse ID 并存:syn28503327(项目页,设计论文口径)与 syn32407769(验证榜页,总结论文口径)。Zenodo 上没有这个数据集的记录——别去 Zenodo 空手而归。官方条款:解禁期(2022 年 12 月)后可在研究中自由使用并引用两篇官方论文。代码侧另有惊喜:22 套参赛算法的源码、权重、Docker 镜像在 GitHub 与 Docker Hub 全开源(Apache 2.0),基线可以零训练成本复现。
Q9:和 ACDC、M&Ms、CMRxRecon 是什么关系?
四者同属 CMR 挑战赛家族但分工不同:ACDC 是多病理单中心的分割起点;M&Ms/M&Ms-2 把厂商、中心、病理、视图异质性做满;CMRxMotion 把设备锁死、单独放大"呼吸行为"变量;CMRxRecon(库内 cmrxrecon,rid 506)是同一复旦团队主导的后续系列,转向重建任务。选数据集先问自己测什么维度:病理泛化选 ACDC,厂商泛化选 M&Ms,运动鲁棒性与质量控管选 CMRxMotion。三者标注结构同构(0/1/2/3 标签 + ED/ES 两时相短轴),联合训练的工程成本主要是域对齐而非标签转换;差异点在人群(CMRxMotion 全健康)与序列供应商参数(TrueFISP 单机 vs 各中心常规 cine),混训时这两处是主要的域信号。
Q10:一 ideal 的使用姿势是什么?
两段式:先用 Task 1 的思路训一个质量门控模型(或直接用三级标签做规则过滤),再在 Label 1&2 子集上训/评分割模型;把"质量过滤前的全量指标"与"过滤后的指标"同时报告,复现论文"质量感知工作流降低下游误差"的核心结论。切忌不做质量分层直接全量上分割模型(坑 8)。进阶玩法是利用受试者内配对结构做"性能-质量曲线":同一模型在同一志愿者的四个 volume 上的表现差,就是对伪影敏感度的最干净测量——这个分析在自然异质数据集上做不了,是 CMRxMotion 的独家实验。
Q11:一例数据在磁盘上长什么样?
图像与掩码同名成对:P001-1-ED.nii.gz(协议 1 的舒张末期体数据)与 P001-1-ED-label.nii.gz(LV/MYO/RV 三结构掩码),全部 NIfTI 压缩格式;质量标签集中在一个 IQA.csv 表里,键为受试者-协议-时相。注意预处理时方向信息被刻意丢弃以兼容 ITK-SNAP 等查看器——加载后轴向语义需要自己约定(§2.1)。按 volume 级展开后,139 例带分割标注的训练子集对应约 1501 张 2D 短轴切片(openmedlab 统计口径)——如果你按切片级采样做 2D 网络,用这个数估算 epoch 规模。
Q12:只想跑一个基线,最低成本路径是什么?
不训模型、不下数据的路径存在:GitHub 组织 github.com/CMRxMotion 收录了各参赛队的 fork(如 A1.UON_IMA、A5_S4.Tewodrosw、A9_S6.Abdual 等命名规整的仓库)与 Docker Hub 上的 22 套官方存档镜像(cmrxmotion/* 命名空间,Apache 2.0),冠军方法(UON_IMA 的 IQA、UA-SVCC/Med-Air 的分割)的源码+权重+运行环境三件套齐全,拉镜像即可复现论文数字。想训练自己的模型才需要走 §4 的注册流程。
Q13:样本量到底按哪个数说?
三级口径别混:受试者级 40 人(统计与划分的单位)、volume 级 320 个(“例"的正确口径,40×4 协议×2 时相)、切片级约 1501 张(139 例标注子集的 2D 切片总数,做切片级采样时用)。新闻与镜像最常见的错误是把 320 写成"320 人”(坑 6)或把测试集写成 160 例(坑 4)。
Q14:拿它能做什么方向的论文或项目?
至少五类:①影像质控/IQA 模型(三级标签直接监督,二分门控可部署);②鲁棒分割与域泛化(性能-质量曲线、伪影下的不确定性估计);③伪影仿真方法验证(四协议配对数据是天然的"干净-脏"参照对);④多任务与工作流研究(质量分级+分割联合,或先过滤后分割的级联);⑤挑战赛协议设计研究(rank-then-aggregate、断网 Docker、质量门控入协议都是可引用的协议样本)。不适合的方向:病理形态分析(全健康人)、多厂商泛化(单厂商,坑 7)、全心动周期时序建模(只有 ED/ES 两帧有标注)。
Q15:出了问题找谁?
官方联系渠道:CMRxMotion@163.com(挑战专用邮箱)与 shuowang@fudan.edu.cn(通讯作者王烁,复旦大学数字医学研究中心)。注册审批慢、数据链接失效、许可条款疑问都走邮件。检索类问题先查 §10 十一坑——大部分"找不到数据"的求助在坑 2(Zenodo 空门)与坑 3(双 Synapse ID)里已有答案。
全篇速览表(一图流):
| 你想知道 | 直接看 |
|---|---|
| 有多少数据、怎么切的 | §2.1 表 + §2.5 表 |
| 四种呼吸怎么设计的 | §2.2 |
| 质量标签怎么来的 | §2.3 |
| 和 M&Ms/ACDC 什么关系 | §2.7 对照表 |
| 标注谁做的、可不可靠 | §3 全节 |
| 怎么下载、什么许可 | §4.1 渠道矩阵 + §4.4 条款细读 |
| 排名怎么算的 | §5.4 两套公式 |
| 冠军是谁、多少分 | §6.1 + §6.2 |
| 有哪些开源基线 | §6.9 队伍总表 + §8.2 |
| 会踩什么坑 | §10 十一坑清单 |
| 引用格式 | 附录 F |
与相邻条目的分工(本库视角):本条目与库内 mms(rid 516)、mms-2(rid 682)、acdc、cmrxrecon(rid 506)同属 CMR 分割/分析基准族,但叙事重心各不相同——mms 讲"厂商域漂移下 nnU-Net 与增强策略的胜利",mms-2 讲"任务收敛与未见病理设计",acdc 讲"起点基准与病理泛化",cmrxrecon 讲"重建端的加速与泛化",本条目讲"行为伪影下的单变量压力测试与质量门控"。五条目互链后覆盖"CMR 自动分析为什么会在真实世界掉分"的完整归因空间;本条目同时是族内唯一带医师质量标签的双任务条目,检索"cardiac QC/IQA"词族时是唯一入口。
§2 数据构成与规格
2.1 规模、来源与中心构成
CMRxMotion 的全部影像出自一次前瞻性研究:40 名健康志愿者(24 男、16 女,年龄 19-48 岁,体重 45-85 kg,从复旦大学师生中招募),在复旦大学张江国际脑影像中心的同一台 Siemens MAGNETOM Vida 3T 扫描仪上完成单次访视采集。伦理批准来自复旦大学机构审查委员会(批件号 FE20017),全体参与者签署书面知情同意。
数据体量按三层展开:
| 层级 | 数字 | 说明 |
|---|---|---|
| 志愿者 | 40 人 | 训练 20 / 验证 5 / 测试 15,按人切分不跨集 |
| 呼吸协议 | 4 种/人 | 完全屏气 / 屏气减半 / 自由呼吸 / 剧烈呼吸 |
| 时相 | 2 个/次 | 舒张末期 ED、收缩末期 ES 各提取一个 3D volume |
| 总量 | 320 个 cine volume | 40 × 4 × 2;这是"例"的正确口径 |
序列为临床 TrueFISP(balanced steady-state free precession,bSSFP 家族)cine 短轴(short-axis,SA)采集;扫描参数遵循既往 CMR 文献的推荐,面内分辨率 2.0×2.0 mm²、层厚 8.0 mm、层间隔 4.0 mm(设计论文原文口径)。影像从 DICOM 匿名化导出为 NIfTI,提取 ED/ES 两个 3D 体数据,并刻意丢弃方向信息以兼容 ITK-SNAP 等常用查看器——一个贴心的工程细节,也意味着想拿方向做后处理的复现者需要自行重建朝向。
样本量还有第三个口径(切片级)值得单列:139 例带分割标注的训练子集按层内切片展开约 1501 张 2D 短轴切片(openmedlab 统计口径)。三个口径的适用场景——受试者级(40)用于划分与统计推断、volume 级(320)用于"例"的表述与评估计数、切片级(1501)用于 2D 网络的采样与 epoch 估算。引用时写明层级,是避免被审稿人抓样本量矛盾的第一道防线。
采集团队的机构拼图也值得记录一笔,因为它解释了数据为什么"长这样":影像出自复旦张江国际脑影像中心(脑影像平台承接心脏研究——单机单点正是可复现性的来源之一);IQA 标注的两位放射科医生(Zhang Shi、Chenchen Dai)来自附属中山医院放射科,临床判读经验在标注侧而不是工程侧;分割勾画的技术员(Xutong Kuang)来自人类表型组研究院——一个典型的"临床判读 + 研究院执行"的互补结构(§3 详述)。
文件组织规整可脚本化:受试者编号 P001-P040,协议编号 1-4,时相后缀 ED/ES,如 P001-1-ED.nii.gz(图像)与 P001-1-ED-label.nii.gz(分割掩码);质量标签集中在 IQA.csv。HuggingFace 上的第三方镜像(MedOtter/cmrxmotion 等)把该结构 JSONL 化并保留 official_split 字段,可作结构参考(非官方分发)。
2.2 四协议设计:把"质量滑坡"做成可对齐的梯度
四档呼吸行为的临床对应关系值得逐条翻译给算法研究者:
- 完全屏气(full breath-hold)——严格遵循标准作业程序(SOP)的教科书采集,即 Label 1 的主力来源;
- 屏气减半(half breath-hold)——模拟"努力了但没憋住"的真实最常见失败模式,膈肌位移缩短,伪影轻度;
- 自由呼吸(free breath)——完全放弃屏气,呼吸运动全周期污染 k-space,伪影中度到重度;
- 剧烈呼吸(intensive breath)——主动加大呼吸幅度,制造最大位移与最重伪影,是 Label 3 的主要来源。
这个设计的妙处在于受试者内配对:同一颗心脏、同一台机器、同一批参数,四个质量档位互为对照。做伪影敏感性分析时,任何分割误差的增量都可以干净地归因于伪影本身,而不必像 M&Ms 那类数据集一样用统计手段去剥离厂商/协议/人群的混杂效应。这也是为什么 40 人、320 个 volume 的"小"数据集能撑起高质量的鲁棒性研究——数据不在多,在纯。
协议与质量标签的关系需要澄清一处容易误读的地方:四档呼吸行为是"诱导手段",三级质量标签是"观察结果",两者相关但非一一映射。同一个协议 b(屏气减半),对胸腔容积大的人可能只掉到轻度、对呼吸频率快的人可能直接中度;协议 d(剧烈呼吸)也未必人人都是重度——放射科医生的 Likert 评分才是唯一权威标签。设计论文以 Likert 为准建立 Task 1 的真值,协议编号只是元数据字段。因此:训 IQA 模型用质量标签,别用协议编号当标签;做"协议-标签"交叉统计时把个体差异当作发现而非噪声。各协议下的标签分布数字见设计论文 Table I(本条目未机读提取该表,不做转抄——引用具体分布请查原文)。
从物理机制看,四档协议的伪影成因也值得算法研究者理解:CMR cine 用多个心动周期的信号填充 k-space(跨心跳平均),假设呼吸位置在采集期间不变;屏气失败时膈肌位移让心脏在不同心跳间处于不同位置,k-space 相位一致性被破坏,重建图像出现重影(ghosting)、边缘模糊与几何形变——位移越大、模式越乱,退化越重。这意味着伪影强度同时受位移幅度与位移时间模式影响,协议 c(自由呼吸)与 d(剧烈呼吸)的差异不只是"动得多"还有"动得是否有节律",这也是纯仿真增强难以完全复刻真实伪影谱的原因之一。
对比维度上还要指出一点:全部为健康志愿者。队列里没有心衰、肥厚、先心病等病理形态。这意味着它天然适合"质量-性能"关系研究,天然不适合病理泛化研究(想测病理泛化请回 ACDC/M&Ms,见 §2.7)。
四协议的官方英文名与习惯缩写(写代码时直接对齐):full breath-hold(协议 a,FBH)、half breath-hold(协议 b,HBH)、free breath(协议 c,FB)/free breathing、intensive breath(协议 d,IB)。注意 free breath 与 full breath-hold 缩写都可能出现 FB——自建代码用协议编号 1-4 最安全,与文件名 Pxxx-x 的第二段一致。
2.3 IQA 三级标签:5 点 Likert 的临床压缩
图像质量标注由两位放射科医生(Zhang Shi、Chengliang Dai)完成:先在 3D Slicer 中逐例查看,按标准 5 点 Likert 量表独立评分,再讨论达成共识协议。原始量表为:
| Likert 分 | 临床含义 |
|---|---|
| 5 | 诊断质量优秀(excellent diagnostic quality) |
| 4 | 足够诊断(more than adequate for diagnosis) |
| 3 | 尚可诊断(adequate for diagnosis) |
| 2 | 诊断存疑(questionable for diagnosis) |
| 1 | 非诊断质量(non-diagnostic) |
为提升可复现性(也为了让三分类任务的类别不至于过碎),官方把 5 点压缩为三级运动伪影标签:
- Label 1 轻度(mild):Likert 4-5——直接可用;
- Label 2 中度(intermediate):Likert 3——可用但需谨慎;
- Label 3 重度(severe):Likert 1-2——应重扫。
这个三级体系就是 Task 1 的预测目标({1,2,3} 三分类),同时也是 Task 2 的数据门控依据(Label 3 无分割标注、被剔除出分割评估)。复现者的实用推论:三级标签一份数据两用,既是监督信号又是过滤开关。
挑战结果反过来验证了这套压缩的边界:所有队伍对 Label 1 的识别都很准,对 Label 3 的召回普遍偏低——Likert 2 与 1 之间、3 与 2 之间的灰色地带是机器与医生共识度最低的地方(§6.2 详述)。
类别不平衡的工程预案(复现者绕不开的一课)。虽然挑战数据未逐类公布分布数字,但可以从结构推出方向:全量 320 例中 Label 1 来自协议 a 与部分协议 b(临床 SOP 采集天然多数),Label 3 集中在协议 d——比例失衡是设计内生的,不是意外。冠军 Kappa 仅 0.631 而 accuracy 达 72.5%,两数字的落差本身就是不平衡的指纹(多数类全猜也能刷高 accuracy,Kappa 把这部分虚胖挤掉了)。实践上三条预案:一,选 Kappa 或加权 F1 当训练与汇报指标,裸 accuracy 一律不采信;二,采样层面对 Label 2/3 过采样或对 Label 1 欠采样,损失层面换 focal/类平衡交叉熵;三,评估时按协议分桶报告——四协议天然是四档难度标尺,分桶后的混淆矩阵比单一全局数字更能暴露"哪一档在崩"。
2.4 设备矩阵:单一化的设计宣言
与 M&Ms 的"9 台扫描仪 3 厂商"相反,CMRxMotion 的设备矩阵只有一行:
| 维度 | CMRxMotion | M&Ms(对照) |
|---|---|---|
| 中心 | 1(复旦张江国际脑影像中心) | 6(西班牙/德国/加拿大) |
| 扫描仪 | 1 台 MAGNETOM Vida | 4 厂商多机型 |
| 场强 | 3T 单一 | 1.5T 为主少量 3T |
| 序列 | TrueFISP bSSFP 单一 | 各中心常规 cine |
| 人群 | 40 名健康志愿者 | 375 例患者+志愿者 |
| 自变量 | 呼吸行为(受控 4 档) | 厂商/中心/病理(自然异质) |
这张表是理解本数据集定位的关键:它不是"更全面"的基准,而是"更纯净"的标尺。任何拿它去训练通用临床分割模型、然后抱怨"全是健康人"的用法,都是对设计意图的误读(坑 7)。
单机采集还有三条容易被忽略的工程红利:
- 参数漂移归零:多中心数据里,即便同厂商同机型,医院间的 coil 配置、 shim 方案、扫参微调仍会制造"设备内域漂移";同一台机器一次访视把这一切压到零,伪影是唯一的影像差异源;
- 受试者内可比性:四档影像的解剖完全一致(同一颗心脏几分钟内扫完),做伪影可视化的 figure 不需要任何解剖对齐解释——对比图里看到的一切差异都是伪影;
- 标注共识的纯净度:放射科医生对同一人四档影像的评分构成天然的"评分校准链"(同一解剖参照下判轻中重),比跨病人评分更可控。
代价同样要写明白:任何模型在这个数据集上的绝对分数不能与多中心基准的分数直接比较——难度坐标系完全不同(一个比"崩溃斜率",一个比"跨域均值")。论文与官网都把 CMRxMotion 定位为"补充基准"而非"下一代替代",引用时保持这个措辞纪律。
2.5 划分与保密设计
| 划分 | 志愿者 | volumes | 发布内容 | 用途 |
|---|---|---|---|---|
| 训练 | 20 | 160 | 图像 + 质量标签 + 分割标注(139/160 有分割标注) | 模型开发 |
| 验证 | 5 | 40 | 仅图像(真值扣留) | Synapse 实时榜在线评估 |
| 测试 | 15 | 120 | 挑战期全部保密(图像与真值均扣留) | Docker 离线最终排名 |
三个设计点:其一,按志愿者切分,同一人的 8 个 volume 永远在同一划分内,杜绝受试者内信息泄漏;其二,训练集中 21 例无分割标注的重度伪影图像是故意保留的——它们正是 Task 1 的困难正样本,把它们扔掉等于抽掉最难的部分;其三,测试集真值由 3 名资深放射科医生标注,配合断网 Docker 评估,排名的可信度在同代挑战中属于第一梯队。
第三方口径纠错(坑 4 预告):openmedlab 等镜像把测试集写成"160 cases(20 volunteers)",这是把训练集参数错套到测试集上的错误——设计论文与总结论文的双源口径均为 15 人 120 volumes(20+5+15=40 人、160+40+120=320 volumes,两个闭合等式交叉锁定)。
划分设计的统计含义:20/5/15 的受试者级切分意味着验证榜只有 40 个 volume 的评估基数——单日 3 次 × 多队的提交在 40 个点上反复"刷",验证榜分数的过拟合风险天然偏高;这也是最终排名坚持用独立的 120 volume 测试集离线复评的方法学理由。使用者若自建评测,建议至少保留 15 人量级的受试者级留出集,否则 Kappa/DSC 的估计方差会淹没方法间差异——CMRxMotion 的划分比例(50%/12.5%/37.5%)是"小队列三切"的可抄模板。
2.6 标注结构一览
每个诊断质量 volume 的分割掩码为 3D NIfTI,标签体系沿用 ACDC/M&Ms 惯例:
| 标签 | 结构 | 英文 |
|---|---|---|
| 0 | 背景 | background |
| 1 | 左心室血腔 | LV(left ventricle blood pool) |
| 2 | 左心室心肌 | MYO(myocardium) |
| 3 | 右心室血腔 | RV(right ventricle blood pool) |
质量标签(IQA)与分割标签的组合矩阵决定了每例的实际可用性:
| 组合 | 数量级 | 可用性 |
|---|---|---|
| Label 1/2 + 分割标注 | 训练集 139 例 | 全功能:质量分级 + 分割训练 |
| Label 3 + 无分割 | 训练集约 21 例 | 仅质量任务(Task 1 困难样本) |
| 验证/测试集 | 40 + 120 例 | 标注扣留,用于评估 |
每例记录的字段级 schema(按官方命名规则与 IQA 表口径整理,字段名以实际 CSV 表头为准):
| 字段 | 类型 | 取值域 | 说明 |
|---|---|---|---|
| subject_id | string | P001-P040 | 受试者主键,划分单位 |
| protocol_id | int | 1-4 | 呼吸协议(诱导手段,≠质量标签) |
| phase | enum | ED / ES | 时相 |
| image | file | Pxxx-x-ED/ES.nii.gz | NIfTI 体数据;方向信息已丢弃 |
| segmentation | file | Pxxx-x-ED/ES-label.nii.gz | 仅诊断质量图像存在;取值 |
| iqa_label | int | 1 / 2 / 3 | 轻/中/重度;Task 1 目标 + Task 2 评估门控 |
| split | enum | train / val / test | 官方划分;志愿者不跨集 |
2.7 与相邻基准的字段级对照
拿 CMRxMotion 与两位"邻居"逐字段对齐,便于基准选型:
| 维度 | ACDC(2017) | M&Ms(2020) | CMRxMotion(2022) |
|---|---|---|---|
| 例数 | 100 患者 | 375 例(345 实发布口径) | 320 volumes / 40 人 |
| 人群 | 患者+健康 | 患者+健康 | 全健康志愿者 |
| 中心/厂商 | 单中心 | 6 中心 4 厂商 | 1 中心 1 厂商 |
| 序列 | cine bSSFP | cine bSSFP | cine TrueFISP bSSFP |
| 视图 | 短轴 | 短轴 | 短轴 |
| 时相 | ED/ES | ED/ES | ED/ES |
| 标注 | LV/MYO/RV | LV/MYO/RV | LV/MYO/RV + 质量三级 |
| 测试维度 | 病理泛化 | 厂商/中心泛化 | 行为/伪影鲁棒性 |
| 双任务 | 无 | 无 | IQA + 分割 |
| 获取 | 公开直链 | 注册制 | Synapse 注册制 |
选型口诀:测病理选 ACDC,测厂商选 M&Ms,测"图烂了模型还行不行"选 CMRxMotion。三者标注结构与标签体系同构(0/1/2/3),在同一个 nnU-Net 管线里互换成本极低——这是 CMR 挑战赛家族多年标准化积累的红利。
2.8 与 cine 全周期数据的关系(复用者必读)
CMRxMotion 只发布了每个 cine 序列的 ED/ES 两帧体数据——这与 ACDC、M&Ms 完全一致,是 CMR 分割挑战的标准做法:分割与容积定量只需要这两个时相。但对以下人群,这个决定影响使用方式:
- 做全周期运动分析(应变、血流动力学):不可用——中间帧不在包里,也无法从两帧恢复;
- 做伪影仿真对齐:只对 ED/ES 对齐——你的仿真器需要输出"恰好两帧"的对比才有真值可依;
- 做视频模型预训练:只能当 3D 体数据集用(160+40 例),视频维度的价值为零,别来。
另一个结构性事实:每个受试者的 8 个 volume 高度相关(同一颗心脏、同一分钟内扫完)。做受试者级交叉验证时必须按人切分(官方划分已保证);若按 volume 随机切分,验证分数会被受试者内信息泄漏严重污染——这是所有"多人多次采集"数据集的通病,CMRxMotion 的配对结构让它尤其致命。
2.9 三个研究场景的最小可行数据面
| 场景 | 最小数据面 | 备注 |
|---|---|---|
| 质控模型(分类器) | 320 例三级标签(或二分 Label 1&2 vs 3) | 不需要分割掩码;类别分布先看 IQA.csv |
| 鲁棒分割基准 | 训练 139 例(Label 1&2)+ 官方测试协议 | 想可比就得复刻 §5.4 全套指标 |
| 质量-性能曲线研究 | 全部 320 例 + 逐协议/逐标签分桶 | 配对结构是核心资产,别打散 |
§3 标注流水线:放射科共识 + 技术员勾画 + 双复核
2.10 与 ACDC/M&Ms 联合使用的工程注意事项
三数据集联训/联评是高价值玩法(补齐病理×设备×行为三维),工程上有四个坑要提前避:
- 分辨率重采样策略要统一:CMRxMotion 2.0×2.0 mm² 面内/8 mm 层厚/4 mm 层间隔,与 ACDC(约 1.5-2 mm²/5-10 mm)和 M&Ms(约 1-2 mm²)不同——用 nnU-Net 的自动重采样即可,但自写管线容易在 spacing 上翻车;
- 标签语义核对:三者的 0/1/2/3 语义一致(背景/LV/MYO/RV),但 RV 在 M&Ms-2 里是评估主角、在 CMRxMotion 里是普通结构——权重与指标按各自任务约定;
- 人群偏差显式建模:CMRxMotion 全健康、ACDC 患者为主、M&Ms 混合——混训时把"数据集来源"作为协变量记录,防止模型学到"哪个库"的捷径特征;
- 质量维度只有 CMRxMotion 有:另外两家默认影像合格——跨库做质量分析时,M&Ms/ACDC 只能当"高质量域"样本,不能当质量梯度的对照。
2.11 一个容易忽略的事实:为什么层间隔 4 mm 值得注意
层厚 8 mm、层间隔 4 mm 意味着 z 向采样不连续(相邻层面间有 50% 的间隙未采集)。这对分割的影响是结构性的:3D 卷积在 z 向的感受野跨过的是"空隙+组织"而非连续组织,z 向上下文推断天然打折——这也是为什么短轴 cine 分割至今仍以 2D 切片级方法为主流(ACDC/M&Ms/CMRxMotion 三代挑战的共同结论)。做 3D 方法联评时,别把 z 向误差全部归因于伪影——有一半是采样间隙的先天税。
3.1 人员结构:两类标注、两条线
CMRxMotion 的标注分两条独立流水线,对应两类标注对象:
- 质量标注线(IQA):两位放射科医生(Zhang Shi、Chengliang Dai,即设计论文中的 Z.S. 与 C.D.)——先独立按 5 点 Likert 评分,再讨论达成共识协议后统一打标。所有 320 个 volume 均有质量标签。
- 分割标注线(RCS):一名有经验的标注技术员(Xutong Kuang,X.K.)在 3D Slicer 中对**全部诊断质量图像(Label 1&2)**勾画 LV/MYO/RV 轮廓,随后由两名放射科医生(Z.S.、C.D.)复核确认。
这个结构的分工逻辑很清晰:质量判断是临床放射科医生的核心技能(判读经验密集),结构勾画是可训练的技术工作(量大、规则明确),医生只做复核把关。资源效率与质量保障兼顾,与 M&Ms"来源中心专家自标注"的模式形成对照——后者省了外部标注者对解剖的熟悉成本,前者换来了跨例一致性。
3.2 软件链:3D Slicer 到 NIfTI
标注全程在 3D Slicer(开源平台)中完成,与 M&Ms 系的 cvi42 商业软件链不同——全程开源工具链意味着任何实验室都能零成本复刻同一套流程,这对标注协议的社区再利用是个实际的加分项。交付格式为 NIfTI(.nii.gz),图像与掩码同名成对(如 P001-1-ED.nii.gz / P001-1-ED-label.nii.gz),质量标签汇总于 IQA.csv。
3.3 测试集标注的三医生规格
挑战期保密的测试集(15 人 120 volumes)由三名资深放射科医生完成标注(总结论文口径)。三医生配置高于训练集的双医生共识,是挑战赛"最终裁判"环节的常见加固做法——与 M&Ms 系一样,测试真值在赛后成为数据集最值钱的部分。测试标注在解禁期后的发布形态见 §4.4 的存照讨论。
3.4 标注规则与 ACDC/M&Ms 的继承关系
分割标注"遵循既往 CMR 分割挑战的标注实践"(设计论文原文,引 ACDC 与 M&Ms):LV 与 RV 血池轮廓包含血腔,MYO 为心肌环,ED/ES 两时相分别勾画。对本库读者而言,这意味着 CMRxMotion 的掩码可以与 ACDC/M&Ms 的掩码用同一套后处理代码读取——三数据集联合训练时不需要为标签体系做任何转换。
3.5 复用者必读的三条标注边界
- 重度伪影图像没有分割真值:Label 3 的图像连医生也认为不可靠勾画,所以没有掩码——这不是数据缺失,是质量门控的一部分(坑 8)。
- 只有 ED/ES 两帧有标注:与 ACDC/M&Ms 相同,中间心动周期帧无标注,不要拿来做全周期时序分割。
- 质量标签是共识而非独立双标:IQA 标签由两位医生讨论达成共识后给出,数据集中没有保留独立评分——做观察者间变异研究需要另想办法。
3.6 标注治理链条与残余盲区
把 CMRxMotion 的标注治理链完整画出来:放射科医生定协议(Likert 量表 + 压缩规则)→ 双医生共识打标(IQA 全量)→ 技术员勾画(Label 1&2 分割)→ 双放射科医生复核(分割)→ 三医生标注测试真值(保密期)。这条链的冗余度随数据敏感度递增——训练集双角色、测试集三医生——是"越关键处越冗余"的标准配置。
残余盲区有三处。其一,IQA 共识制抹掉了医生间分歧的信号:两张 Likert 各打 3 与 4 的图,共识后只有一个标签,"边界样本"的信息量被压缩——挑战结果里中重度分类全面拉胯,部分原因可能正是边界样本本身定义模糊。其二,分割复核采用"技术员初稿+医生审核"而非双独立勾画+差异仲裁,勾画者间一致性没有量化发布。其三,四协议与三标签的映射虽以 Likert 为桥,但协议 a 并非必然 Label 1、协议 d 并非必然 Label 3——个体对呼吸失败的耐受度不同,按协议分桶分析时不要假设协议=标签(设计论文以 Likert 为准,协议只是诱导手段)。
3.7 与前两代 CMR 挑战标注规格的传承对照
| 标注要素 | ACDC(2017) | M&Ms(2020) | CMRxMotion(2022) |
|---|---|---|---|
| 结构集 | LV/MYO/RV | LV/MYO/RV | LV/MYO/RV(同构) |
| 时相 | ED/ES | ED/ES | ED/ES |
| 标注者 | 专家(单中心) | 来源中心临床医生(3-10+ 年) | 技术员+双放射科复核 |
| 软件链 | — | cvi42(商业) | 3D Slicer(开源) |
| 质量标签 | 无 | 无 | 三级医师共识(独有) |
| SOP 公开度 | 协议级 | 四规则原文 | Likert→三级映射规则原文 |
三代表格横向读下来,CMR 挑战赛的标注规格在不断加码:结构集十年未变(0/1/2/3 标签体系的既得利益),变化发生在"谁来标、怎么标、标几层"——CMRxMotion 加上的质量标签层,是它在标注维度上对家族的真实增量。
3.8 标注成本与产能的粗核算(标注工程视角)
从公开口径反推这条流水线的产能账:分割标注 139 例 × 每例两层(ED/ES)短轴勾画,工作量与 ACDC 同量级;IQA 标注 320 例为阅片级任务,单例分钟级。两个放射科医生 + 一名技术员 + 复核环节的配置,在同类医学影像挑战中属于"轻量但含金量高"的组合——它证明了一件事:带医师质量标签的双任务数据集,边际成本只比纯分割数据集高一层阅片,而这个增量换来了任务维度与临床语义的成倍扩展。对规划内部标注的团队,这是本数据集流水线最有迁移价值的一笔账。
3.9 与"检查表式标注"的兼容性说明
CMRxMotion 的标注协议有一个对自动化友好的特征:判定规则全部可枚举。IQA 侧是"5 点 Likert → 三段映射"的确定性函数(一旦 Likert 打分确定,标签无歧义);分割侧是"Label 1&2 全勾画、Label 3 全跳过"的二值规则。这意味着任何想复刻或扩展这套协议的团队(比如给自家数据补质量标签),可以直接把这两条规则写成检查表交给标注平台执行,不需要与原团队协商"潜规则"——公开挑战数据集里,标注协议的这种完全可枚举性并不常见,值得在自建标注 SOP 时优先模仿。
3.10 标注 SOP 与前代的逐条对照(工程移植视图)
把三代的标注规则并列,便于团队直接移植:
| 规则项 | ACDC | M&Ms | CMRxMotion |
|---|---|---|---|
| LV 血池含乳头肌 | 是 | 是(SOP 规则 a) | 沿用惯例 |
| 基底层面不插值 | 是 | 是(规则 b) | 沿用惯例 |
| ED/ES 两时相 | 是 | 是 | 是 |
| 特殊结构定界参考 | — | 长轴 4CH 定基底/心尖(规则 d) | 短轴单视图,无长轴参考 |
| 质量不合格层处理 | 无此概念 | 无此概念 | Label 3 整层跳过(独有规则) |
| 标注软件 | — | cvi42(商业) | 3D Slicer(开源) |
| 复核配置 | 单专家 | 双复核 | 技术员初稿+双放射科复核 |
移植提示:CMRxMotion 的 SOP 是三者中最"可脚本化"的——判定规则全部可枚举、无主观定界步骤(因为没有长轴视图参与基底判定,短轴层的基底/心尖归属完全由层位置决定),适合直接写进标注平台的自动路由逻辑。
§4 获取与许可:Synapse 注册制 + 一份"引用制"条款
4.1 官方渠道矩阵
| 渠道 | URL | 内容 | 状态 |
|---|---|---|---|
| 挑战官网 | cmr.miccai.cloud | 规则、时间线、任务、榜单说明、结果 | 在线(2026-09-27 核验可达) |
| 数据页 | cmr.miccai.cloud/datasets/ | 发布公告 + 使用条款 + 引用要求 | 在线 |
| Synapse 项目页 | synapse.org/#!Synapse:syn28503327 | 数据分发与注册(设计论文口径) | 需 Synapse 账号+注册审批 |
| Synapse 验证榜页 | synapse.org/#!Synapse:syn32407769 | 验证期实时榜单(总结论文口径) | 需 Synapse 账号 |
| Docker 测试平台 | docker.miccai.cloud | 测试期容器化提交入口 | 挑战已结束 |
| GitHub 组织 | github.com/CMRxMotion | 评测脚本、验证工作流、各队代码 fork | 在线,Apache 2.0(代码) |
| Docker Hub | hub.docker.com/repositories/cmrxmotion | 22 套参赛算法镜像存档 | 在线,Apache 2.0(镜像) |
| 设计论文 | arxiv.org/abs/2210.06385 | 数据规格、协议、指标定义 | 在线 |
| 总结论文 | arxiv.org/abs/2507.19165 / doi:10.1016/j.media.2025.103883 | 完整结果与开源资源表 | 在线 |
注册制获取流程(设计论文原文):在官网注册并填写 data access agreement → 经审核后凭 Synapse 账号下载数据。与前作 M&Ms 的"官网表单注册"相比,Synapse 平台化托管意味着下载行为、版本、使用者都有平台侧留痕,对数据提供方是更强的治理抓手。
4.2 最大的检索陷阱:Zenodo 上没有数据
在 Zenodo 搜"CMRxMotion"返回 0 条记录(2026-09-27 核验)——这与 M&Ms-2"Zenodo 上只有设计 PDF"的坑不同,CMRxMotion 是整个 Zenodo 门牌都不存在:数据只在 Synapse。Automated 检索管线若按"Zenodo DOI → 数据"的惯性走,会直接空手而归(坑 2)。
同理,把 huggingface.co 上的 MedOtter/cmrxmotion、Angelou0516/cmrxmotion 镜像当成官方分发也是错的——它们是第三方处理的分割子集(JSONL 化),可作为结构参考与体量佐证,但完整性、时点、质量标签是否齐全均无官方承诺。官方唯一分发通道始终是 Synapse。
4.3 两个 Synapse ID 并存(坑 3 预告)
官方文档里出现了两个 Synapse ID:syn28503327(设计论文脚注、openmedlab 口径,“挑战项目页”)与 syn32407769(MedIA 总结论文口径,“验证榜所在工作区”)。两者并存的合理解释是项目主页与挑战工作区分离,或后期重建。复现者应两个都试,以实际可注册、可下载者为准;引用时标注出处口径。Synapse 为 JS 门户,无登录状态下页面内容抓取受限,本条目无法代验当前哪个 ID 的数据包更全。
4.4 许可条款细读
官网 /datasets/ 页的官方条款原文(2026-09-27 抓取):
“You are free to use and/or refer to the CMRxMotion challenge and datasets in your own research after the embargo period (Dec 2022), provided that you cite” arXiv:2507.19165 与 arXiv:2210.06385。
拆解要点:
- 解禁期(embargo)为 2022 年 12 月——挑战结束后保留 3 个月的论文缓冲期,现已过;
- 研究使用免费,条件是引用两篇官方论文——这是"引用制"(citation-based)条款,而非标准开源许可证;
- 没有出现任何 CC许可证文本——第三方对 license 的标注不一(HF 镜像自标 CC-BY-4.0;EmergentMind 转述"CC-BY non-commercial"),均非官方口径,不应作为合规依据;
- 代码与 Docker 镜像在 GitHub/Docker Hub 存档部分明确 Apache 2.0(总结论文原文),这部分是清晰的开源资产——但注意这是算法的许可,不自动延伸到数据。
对本库 AI-Ready 评级的影响:获取需注册+协议(失分),但条款文字直白、解禁已过、引用义务清晰(补分);对比"完全无许可文本"的条目,CMRxMotion 的许可透明度处于注册制数据集的中上水平。
4.5 测试集解禁后形态(存照)
MedIA 总结论文摘要称 “curated and publicly released a dataset of 320 CMR cine series”——以总量 320 口径宣告公开释放(含测试集);官网条款亦称 “challenge and datasets” 解禁后可研究使用。但测试集分割真值(3 名资深放射科医生标注版)是否作为独立文件随包发布,未能从可获取文本中逐字确认——复现者在拿到 Synapse 包后应第一时间核验 120 个测试 volume 的标注完整性。此为遗留待核项,不影响主口径书写。
4.6 AI-Ready 评估:注册制的失分与工程资产的超额补分
按本库 AI-Ready 五维粗评:
| 维度 | 评价 |
|---|---|
| 可获取性 | 注册制(Synapse),非直链——失分但流程清晰 |
| 格式开放性 | NIfTI + CSV,医学影像事实标准——满分 |
| 标注完备性 | 质量标签全覆盖 + 分割标注覆盖诊断质量图像(139/160)——高 |
| 文档质量 | 设计论文+总结论文+官网三件套,参数、协议、指标全部可查——CMR 挑战家族最完整梯队 |
| 可复现资产 | 22 套算法源码+权重+Docker 全开源——超额补分,同代挑战罕见 |
综合判断:注册制是唯一的实质门槛,越过之后从格式到文档到基线代码的全链路对复现者极其友好。适合作为"注册制但高 AI-Ready"的正例条目。评分明细见附录 B。
4.7 获取常见问题(实操向)
Q:注册审批要多久?
官网 datasets 页留有提示:若在 Synapse 注册后长时间未获批准,可发邮件(CMRxMotion@163.com 或 shuowang@fudan.edu.cn)催办——这句话本身写进了官网公告,说明审批不是自动化的,有等待期,项目排期应预留。
Q:Synapse 下载要什么前置条件?
有效 Synapse 账号(注册需邮箱验证)+ 被挑战方批准加入项目工作区。Synapse 的数据访问有平台侧记录,下载行为可审计——对数据提供方是治理抓手,对使用者是合规留痕。
Q:能不能只要测试集标注、不要全量?
没有分开发布渠道——解禁后数据以整包形态分发(以实际 Synapse 包内容为准)。按 §4.5 的存照,测试标注是否随包需到手核验。
Q:想先看数据再决定要不要申请?
合法路径有限:设计论文(arXiv:2210.06385)的图 1 展示了四协议配对影像样例;总结论文(arXiv:2507.19165)有更多定性结果图;HuggingFace 镜像可看文件组织结构(非官方、非完整)。看样例足够做技术选型,拿到正式授权前不要把镜像内容当数据用。
Q:论文里说数据"publicly released",和注册制矛盾吗?
不矛盾,但确实容易误读:“publicly released” 指的是向社区开放(相对此前无任何公开渠道),不等于"无门槛直链下载"。实际形态是注册制分发+引用制条款。类似的表述在挑战赛文献里很常见,以官网获取页的操作口径为准。
渠道优先级建议:需要数据本体 → Synapse(4.3 双 ID);需要基线代码 → GitHub 组织;需要算法镜像 → Docker Hub;需要条款与公告 → 官网 /datasets/ 子页;需要协议与指标定义 → 设计论文;需要结果与开源资源矩阵 → 总结论文。六路材料各管一段,没有单一入口覆盖全部——这是检索本数据集的基本盘。
4.8 官网信息架构速查(抓取时点 2026-09-27)
cmr.miccai.cloud 单页站点,各锚点内容如下,供快速定位:
| 锚点 | 内容 | 本条目对应 |
|---|---|---|
| #papers | 14 篇方法论文列表 + 挑战总结论文链接 | §5.2、附录 C |
| #motivation / #background | 挑战动机与 CMR 质控背景 | §0 |
| #cmr-acquisition-design | 40 志愿者、Vida 3T、四协议 | §2.1、§2.2 |
| #challenge-tasks | 双任务定义 + 奖金 | §5.4、§5.5 |
| #timeline | 官方时间线表 | §5.1 |
| #workshop-schedule | STACOM 2022 现场日程(各队讲席) | §6.1、§6.2 |
| #contact | 官方邮箱 | 附录 J |
| /datasets/ 子页 | 发布公告 + 使用条款原文 | §4.4 |
值得注意的一个细节:官网 workshop 日程按"口头报告队伍"排列(056 OpenGTN 双任务讲、043 Tewodros、045 UON_IMA、049 Philips_CTS、041 UA-SVCC、044 CMR.Love.LHND、064 Med-Air),与总结论文的 TID 编号体系(A1-A10/S1-S12)可以互相印证排名——这是双口径之外用第三路材料交叉验证排名的通道。
4.9 合规自检清单(下载与使用前过一遍)
- 我是否完成了官网注册并签署 data access agreement?(前置条件)
- 我下载的渠道是 Synapse 官方工作区还是第三方镜像?(镜像不可用于生产)
- 我的论文/产品引用了官网要求的两篇官方论文吗?(arXiv:2507.19165 + arXiv:2210.06385 或其正式版)
- 我的数据使用场景是否为研究用途?(商用边界未明示,需书面确认)
- 我是否保留了许可条款原文快照(条款页可能随官网改版消失)?
- 二次分发给团队/合作者时,是否让对方也走官方注册?(多数注册制数据集禁止转分发)
- 我是否把"代码 Apache 2.0"误当"数据开源"了?(两者许可独立)
§5 挑战设计与评估协议:把"压力测试"写进规则
5.1 时间线:十八个月从立项到出版
| 日期 | 事件 |
|---|---|
| 2021-05 ~ 2022-04 | 数据收集、处理、标注、质控(总结论文口径) |
| 2022-02-28 | MICCAI 2022 卫星事件委员会正式接收 |
| 2022-04-01 | 官网 cmr.miccai.cloud 上线(总结论文口径;官网表另写 4 月 15 日开放,见坑 9 相关存照) |
| 2022-04-15 | 开放注册 |
| 2022-05-31 | 训练集(图像+质量标签+分割标注)发布 |
| 2022-07-01 | 验证集(图像)发布 |
| 2022-07-06 | 验证榜单与提交系统开放 |
| 2022-08-15 | 注册截止;测试提交系统开放 |
| 2022-09-01 ~ 09-05 | Docker 提交窗口 |
| 2022-09-18 | STACOM 2022 workshop(MICCAI 2022 新加坡)现场颁奖 |
| 2022-12 | 数据解禁期(embargo)截止 |
| 2023-01-28 | Springer LNCS 论文集出版(ISBN 978-3-031-23442-2) |
一次性活动(one-time event),不设第二季;同团队的后续系列转向重建任务(CMRxRecon 2023/2024/2025)。
5.2 参与漏斗:87/112 → 275+340 → 10+13 → 14
漏斗各级口径(注意两种计数单位并存,见坑 5 相关存照):
- 注册:14 个国家/地区 87 支队伍(复旦官方新闻口径);总结论文口径为 112 名注册参与者(人数而非队数——两者不矛盾,一队可多人注册);
- 验证榜提交:Task 1 累计 275 次、Task 2 累计 340 次(每队每任务每天上限 3 次);
- 完成测试:Task 1 10 队、Task 2 13 队提交自包含 Docker;
- 论文:每任务前三名受邀撰写全文,14 篇方法论文经同行评审进入 STACOM 2022 论文集。
5.3 平台与规则:三平台分工 + 断网 Docker
| 平台 | 职能 | 规则要点 |
|---|---|---|
| cmr.miccai.cloud | 信息中枢 | 注册、规则、data access agreement |
| Synapse | 数据分发 + 验证期实时榜 | 每队每任务每天 ≤3 次提交;自动后端算分 |
| docker.miccai.cloud | 测试期容器收集与离线执行 | 标准环境:10 CPU 核(2.50 GHz)/ 32 GB RAM / NVIDIA Tesla V100(32 GB);断网;每任务最长推理 4 小时 |
测试期规则与 M&Ms 系的远程评估同构,但标准化程度更高:统一 GPU 型号、统一时限、统一断网——把"硬件差异导致的分数噪声"也控制掉了。测评算力由并行科技(Paratera)赞助,设计论文致谢中明确。
外部数据政策:允许使用公开数据,但必须声明来源(设计论文原文)——比 M&Ms-2 的全面禁用预训练宽松,比完全放开可控,是 2022 年前后挑战赛的典型折中。
5.4 排名指标:两个任务两套公式
Task 1(IQA):预测 {1,2,3} 三分类,排名指标为(线性加权)Cohen’s Kappa(sklearn 实现):
- κ = (p₀ - pₑ) / (1 - pₑ),p₀ 为总体准确率,pₑ 为随机一致率;
- Kappa 对类别不平衡稳健——320 个 volume 中轻度占比高,用裸 accuracy 会系统性高估;
- 排名按测试集 Kappa 降序;bootstrap 置信区间 + paired Wilcoxon 检验差异显著性。
Task 2(RCS):LV/MYO/RV 三结构分割,逐例计算 DSC 与 95% Hausdorff 距离(HD95),最终排名用 robust rank-then-aggregate:
- 对每个测试 case、每个指标(DSC、HD95)、每个结构(LV/MYO/RV),给所有队伍排名;
- 每队最终分数 = 全部排名的平均;
- Wilcoxon signed-rank 检验相邻名次差异是否统计显著。
这个设计专门奖励"在所有 case、所有结构、两类指标上稳定靠前"的方法,惩罚偏科冠军——某队 LV 特别强但 MYO 崩,平均排名会被拉垮。挑战结果的直接产物就是 Task 2 前两名并列(统计不可分),说明指标设计达到了目的:分辨率的极限就设在那里,诚实报告。
评估范围规则:IQA Label 3(重度伪影)图像被排除出分割评估——无可靠真值的样本不进计分桌。这是"质量门控写入评估协议"的显式化,也是本数据集"双任务一体"设计的收口。
两套指标设计各自的权衡,值得展开一层:
Task 1 选 Kappa 而非 accuracy,本质是承认类别不平衡的现实——320 个 volume 中轻度样本占多数(协议 a 与部分 b 的产物),用 accuracy 训练/评选会诱导模型把一切都猜成"轻度"还能拿高分;Kappa 把随机猜中的期望扣除,逼着方法在少数类上证明自己。代价是 Kappa 对小样本波动敏感(120 个测试 case,冠军 CI 宽达 ±0.1)。
Task 2 选 rank-then-aggregate 而非指标加权平均,本质是承认"跨指标不可公度"——DSC 是比率、HD95 是毫米,两者怎么加权都是拍脑袋;先把每个 case、每个指标换算成名次(无量纲),再平均名次,就绕开了单位问题,还顺带把"个别 case 上爆表"的投机策略压平。代价是丢失了绝对量纲信息(排名表里看不到"差 2 个点还是差 20 个点"),所以论文同时报告了全部 DSC/HD95 原始值——排名定奖牌、原始值供下游引用,两手都要。
Wilcoxon 显著性检验则是给并列提供了程序正义:没有它,"并列第一"会被读成主办方和稀泥;有了它,并列是"差距小于测量噪声"的数学结论。这一整套(稳健排名+显著性+并列机制)是近年挑战赛评估协议的成熟形态,值得完整搬运。
5.5 奖项
每任务前三名(含并列)获现金奖:第一名 $500、第二名 $200、第三名 $100。颁奖于 2022-09-18 STACOM workshop 现场举行,由帝国理工学院的 Chen Chen 与 Cheng Ouyang 代为主办方颁发(复旦官方新闻)。
5.6 与相邻挑战协议的画像对照
| 协议要素 | M&Ms(2020) | M&Ms-2(2021) | CMRxMotion(2022) |
|---|---|---|---|
| 评估任务 | LV/MYO/RV 三结构 | 仅 RV(双视图加权) | IQA 三分类 + 三结构分割 |
| 排名指标 | DSC/HD 加权归一 | 0.75 SA + 0.25 LA 加权 | Kappa / rank-then-aggregate |
| 测试环境 | CodaLab 远程 | CodaLab + Docker | Synapse 榜 + 断网 Docker(统一 V100) |
| 未见域设计 | 未见厂商 50 例 | 未见病理组 | 质量梯度全程覆盖(无独立 OOD 组) |
| 论文出口 | TMI 2021 | JBHI 2023 | MedIA 2025 |
CMRxMotion 的协议没有"未见组"——因为质量梯度本身就是连续 OOD:模型在 Label 1 上是 in-distribution,在 Label 3 上天然 out-of-distribution,性能-质量曲线的斜率就是泛化能力本身。
5.7 提交与计分的工程细节(复现协议者用)
把两阶段评估的工程参数一次列全,供自建基准者对照:
验证阶段(Synapse)
- 输入:官方训练包(160 volumes + 标签);待预测验证包(40 volumes 仅图像);
- 提交物:Task 1 为 CSV(每行一个验证 case 的预测标签 {1,2,3});Task 2 为打包的 NIfTI 预测掩码;
- 频控:每队每任务每天 ≤3 次;
- 后端:自动算 Cohen’s Kappa(T1)/ DSC+HD95(T2)并刷新实时榜。
测试阶段(docker.miccai.cloud)
- 提交物:自包含 Docker 镜像(含源码+预训练权重),不联网也能推理;
- 执行环境:10 CPU 核(2.50 GHz)+ 32 GB RAM + NVIDIA Tesla V100(32 GB VRAM);
- 硬规则:执行期禁网(防数据外泄与在线模型调用)、每任务总推理时长 ≤4 小时、官方容器内跑完即排名;
- 计分:§5.4 的两套公式;Wilcoxon 检验相邻名次差异,不显著即并列。
给自建基准者的三条忠告:其一,断网+限时是可迁移性最强的两条规则——它同时封死了"测试时在线调用大模型"与"用海量离线集成硬凑时间"两种作弊面;其二,rank-then-aggregate 需要 per-case 的全指标日志,你的评测后端要把每个 case 每个结构的分数落盘,否则并列无法判定;其三,Kappa 记得用线性加权(多级有序标签),裸 Kappa 会丢掉"轻与中的差距小于中与重"的序信息。
评测后端实现注记:总结论文明确后端用 sklearn 计算 Kappa、用 medpy 一类库算 Hausdorff(设计论文脚注 4 提及 medpy);HD95 的实现细节(采样距离变换 vs 表面点对)在不同库间有细微差异——复现者与官方榜对分时,先对齐实现库再对齐超参,否则会出现"同一模型两套分数"的假性差异。DSC 的实现差异极小(体素级比值),HD95 才是跨库复现的第一坑。
5.8 给办赛者的检查清单(从本挑战提炼的 12 条)
- 官方注册早于官网六周以上(2-28 接收 → 4-1 上线),给平台开发留时间;
- 训练包带全三类资产:图像+任务标签+评测脚本;
- 验证榜限频(每日 3 次),防榜单过拟合;
- 测试期只收 Docker,镜像内必须含权重(防测试期偷训);
- 统一 GPU 型号与时限,把硬件噪声从排名里剔除;
- 断网执行,封死在线模型调用;
- 排名用稳健聚合(rank-then-aggregate),配显著性检验与并列机制;
- 无真值样本显式排除出计分(写进协议而非口头约定);
- 奖金小额但明确($500/$200/$100 档),前三名(含并列)全覆盖;
- 收官三件套归档:源码、权重、Docker——这决定挑战的第二生命;
- 论文集与总结论文分开投(方法论文进 workshop 论文集,总结论文投期刊);
- 官网解禁条款在挑战期就写清楚(embargo 日期+引用义务),别等赛后补。
5.9 时间线里程碑的三条注释
- "18 个月"的两段拆分:2021-05 至 2022-04 是纯数据工程期(采集、脱敏、标注、质控,11 个月),2022-02 接收后到 4 月开赛只有 2 个月窗口——官网、Synapse 工作区、Docker 评测栈三套基础设施在两个月内上线,主办方的工程储备前置到了数据期;
- 验证期与测试期之间留了一个月空档(8-15 注册截止 → 9-01 Docker 窗口),这是给队伍"锁模型"的缓冲:注册截止后不能再换队,Docker 窗口前必须冻结方法——把"最后一个月疯狂改模型"的赛末乱象从制度上排掉;
- 论文集出版滞后 4 个月(9-18 workshop → 2023-01-28 Springer 出版),这是挑战赛知识沉淀的常规时滞;CMRxMotion 的特殊之处在于总结论文又等了三年才在 MedIA 发表(含下游生物标志物分析),挑战事实与文献定论的时点差在本系列条目里是最大的——引用时务必区分"2022 挑战事实"与"2025/2026 文献口径"。
§6 核心发现:22 套算法画出的鲁棒性地图与硬结论
6.1 Task 1 结果:0.631 的 Kappa 是个诚实的"不及格"
测试集(120 volumes)上 Task 1 最终排名:
| 名次 | 队伍 | 机构背景 | Cohen’s Kappa | 备注 |
|---|---|---|---|---|
| 1 | UON_IMA | 英国诺丁汉大学(University of Nottingham) | 0.631 | bootstrap 95% CI 0.518-0.734;accuracy 72.5% |
| 2 | Philips_CTS | 飞利浦临床科学团队 | 0.549 | |
| 3 | OpenGTN | — | 0.474 | 双任务参赛(Task 2 亦入前三讲席) |
(另 7 支完成测试的队伍成绩递减;任务 1 共 10 队交 Docker。)
**为什么这个任务比看起来难?**三个机制层面的原因。其一,伪影谱的连续性与标签的离散性之间的错配:呼吸位移是连续变量,三级标签是人为离散化,Likert 3 分附近的样本天然处于决策边界——模型哪怕完美学习了连续映射,在边界处也会与离散真值"意见不合";其二,退化的形态学证据弱:与病理影像"病灶清晰可见"不同,中度呼吸伪影的表现(局部模糊、轻微重影)与低对比度、扫描参数差异等其他因素纠缠,模型需要学会"什么不是运动伪影";其三,训练信号总量小:320 个 volume 里中重度样本占比有限(分布见设计论文 Table I),深度模型在这类小样本细粒度任务上先天吃亏。冠军 95% CI 下沿 0.518 的另一层含义是:在 120 个测试 volume 上,Kappa 的估计精度本身就有 ±0.1 量级的波动——未来方法想证明"显著超越 0.631",要么涨到 0.75 以上,要么扩数据。
三层的解读:
- 绝对数字不高但可信:冠军 Kappa 0.631 的 bootstrap 区间(0.518-0.734)与亚军的 0.549 存在重叠,前三名之间统计差异有限——这个任务没有出现"碾压式"方法;
- 误差结构高度一致:各队混淆矩阵呈现同一模式——Label 1(轻度)识别准、Label 3(重度)召回低。机器和医生一样,在"轻度"上有共识、在"中度够不够诊断"的灰色地带拉胯;
- 实用主义结论:把三级分类退化为"可用(Label 1&2)/不可用(Label 3)"二分后,可行性显著上升——细粒度伪影分级仍未解决,但二值质量门控已经是可部署的技术。这也是本数据集对影像质控工程最直接的输出。
6.2 Task 2 结果:并列第一与"稳定性美学"
13 支队伍完成测试,DSC 与 HD95 的全距:
| 结构 | DSC 范围(13 队) | 最佳值 | 最佳队 |
|---|---|---|---|
| LV | 81.81% → 93.90% | 93.90% | UA-SVCC |
| MYO | 67.73% → 87.37% | 87.38% | Med-Air |
| RV | 63.95% → 92.22% | 92.39% | Med-Air |
| 结构 | HD95 范围(13 队) | 最低值 | 最低队 |
|---|---|---|---|
| LV | 3.05 → 15.21 mm | 2.95 mm | Tewodrosw |
| MYO | 2.20 → 17.53 mm | 2.11 mm | Tewodrosw |
| RV | 3.53 → 21.16 mm | 3.53 mm | UA-SVCC |
最终排名(rank-then-aggregate + Wilcoxon 检验):
- 并列第一:S1.UA-SVCC(阿尔伯塔大学)与 S2.Med-Air(伦敦国王学院)——排名分数无统计显著差异(p>0.05);
- 并列第二:S3.CMR.Love.LHND(香港中文大学)与 S4.Tewodrosw 并列第二。
从单结构最佳分布看并列的必然性:LV 最高分属于 UA-SVCC(93.90%)、MYO 与 RV 最高分属于 Med-Air(87.38%/92.39%)、LV 与 MYO 的 HD95 最低属于 Tewodrosw(2.95/2.11 mm)、RV 的 HD95 最低属于 UA-SVCC(3.53 mm)——四支前排队伍各占山头,没有任何一家通吃。rank-then-aggregate 把这些山头平均掉之后,UA-SVCC 与 Med-Air 的综合坡顶恰好等高。这个结果结构对"该复现谁"给出了实用答案:追 LV 精度看 UA-SVCC,追心肌与右室看 Med-Air,追边界质量看 Tewodrosw,追多任务效率看 CMR.Love.LHND。
三点观察:
- 单结构冠军 ≠ 总冠军:UA-SVCC 拿了 LV DSC 最高(93.90%)与 RV HD95 最低(3.53 mm),Med-Air 拿了 MYO/RV DSC 最高,Tewodrosw 拿了 LV/MYO 两项 HD95 最低——rank-then-aggregate 把这些偏科强队拉到同一张桌子上比稳定性,最终胜出的是"没有短板"的两套方法;
- 箱线图的"稳定性美学":论文的分布图显示,并列冠军的方法中位数成绩与追赶者相近,但分布更紧、离群点更少——在伪影场景下,不崩比更准更重要;
- MYO 依旧最难:薄壁心肌在自由呼吸与剧烈呼吸协议下边界模糊化最严重,13 队 DSC 跨度高达 19.6 个百分点(67.73-87.37%),是三个结构中分化最大的。
双口径存照(坑 5):复旦官方新闻(2022-09-20 颁奖报道)写"香港中文大学队与阿尔伯塔大学队共同获得心脏鲁棒分割任务冠军",而 MedIA 总结论文的最终复算排名为"UA-SVCC 与 Med-Air 并列第一、CMR.Love.LHND 与 Tewodrosw 并列第二"。颁奖时点表述与论文最终口径存在出入,本条目正文一律采用 MedIA 论文口径并在此存照。
6.3 方法谱系:nnU-Net 的第三次统治
总结论文的方法学普查:Task 2 的 12 支可分析队伍中 7 支采用 nnU-Net(作为主模型、集成组件或多步管线的关键级),其余为 U-Net 变体与 Transformer 系(含 Swin UNETR 类结构)。结合任务特色的技术趋势:
- 运动伪影仿真增强:在 k-space 或图像域注入模拟运动伪影做数据增强,让模型"见过烂图";
- 多任务学习:质量分级与分割联合训练——Task 1 的标签反过来给 Task 2 当辅助监督,多家队伍验证了这组协同;
- 质量感知工作流:先跑 IQA 模型过滤/分流,再对合格影像做分割——把两个任务串成临床工作流,下游心功能指标的误差显著降低(论文的生物标志物分析结论,见 §6.4)。
对照 CMR 挑战谱系,这是一个熟悉的配方第三次生效:M&Ms(厂商漂移)nnU-Net 系登顶、M&Ms-2(视图与病理漂移)nnU-Net 系登顶、CMRxMotion(行为伪影漂移)nnU-Net 系依旧在 7/12 的队伍中出现——域漂移换了三种形式,应对配方的趋同度却一次比一次高。对研究者而言,这既是"基线已经很强"的提醒,也是"创新空间在 nnU-Net 之外"的路标。
nnU-Net 为什么总是赢?三个被反复验证的解释:其一,自配置把"预处理的域知识"编码进了框架——重采样、切块、增强策略随数据自动调整,跨域场景下这些默认值恰好接近最优;其二,它默认用"集成+折外验证"的保守推理,方差小,在 rank-then-aggregate 这类惩罚波动的排名下占便宜;其三,挑战训练集都很小(几十到几百例),大规模预训练与端到端大模型的优势施展不开。第三点在 CMRxMotion 上尤其明显:160 例训练 volume 里还有 21 例没有分割标注——这个量级上,数据策略的每一分优化都被放大,而架构创新的收益被稀释。想在这个数据集上刷出有意义的增量,动架构不如动数据:伪影仿真、质量感知采样、半监督利用 Label 3 的未标注影像,都是论文里被验证过的方向。
6.4 运动伪影对临床生物标志物的影响
总结论文在挑战结果之外做了一层下游分析:考察运动伪影对 5 个临床相关生物标志物(心功能定量类指标,如心室容积与射血分数类测量)的影响。核心结论:质量感知工作流(先过滤后分割)能降低下游标志物误差与临床误读风险——即"分割 DSC 掉 2 个点"的临床代价不是均匀的,重度伪影图像上算出的容积/功能指标可能整体失真,先按质量标签分流再定量,是更安全的临床管线。
这层分析为什么重要?因为它把"分割指标下降"翻译成了"临床决策风险"。DSC 从 0.93 掉到 0.80 对算法研究者是个抽象数字,但换算到下游:心室容积测错会影响心衰分级、射血分数测错会误导治疗评估——不同质量档位上的指标误差幅度,直接决定"自动定量报告"敢不敢无人审核发布。CMRxMotion 用双任务+下游分析的三层结构,把这条链从算法指标一路打通到临床语义,这在挑战赛论文里是少见的完整度。
(存照:五个标志物的逐项名单与量化数字未从可获取文本中逐字核验,本节按论文摘要与讨论段的定性口径书写;引用具体数字前请核对 MedIA 原文 §7。)
6.5 参赛方法论的共性与分野
总结论文对提交方法做了系统普查,可以拆出一张"2022 年 CMR 鲁棒分割技术画像":
架构层:编码-解码器(U-Net 家族)绝对主导,nnU-Net 出现在 12 支可分析队伍中的 7 支(主模型、集成组件或多步管线关键级);Transformer 系以 Swin UNETR 等形态出现但未成主流——与 2022 年医学分割领域"Transformer 尚未在 3D 医学小数据上兑现承诺"的大背景一致。
训练策略层:三条主流增强路线——①k-space 域运动仿真(把呼吸位移建模进原始信号再成像,物理保真度高);②图像域形变/模糊仿真(便宜、可控、可堆叠);③对抗生成(用 GAN 把清晰影像往伪影域翻译)。多支队伍把 Task 1 的质量标签当辅助监督做多任务学习(分级头+分割头共享编码器),把"知道图有多烂"内化为分割的特征先验。
推理策略层:测试时增强(TTA)、多模型集成与滑动窗推理常见;冠军集团的共同点是推理侧克制、训练侧扎实——与"稳定性美学"的排名结果互为印证。
质量感知管线:把 IQA 模型作为分割前置过滤器的两段式工作流在多支队伍中出现,论文的生物标志物分析(§6.4)从官方层面确认了这条管线的下游收益。
6.6 从挑战结果反推的四个"数字之外"结论
- 伪影鲁棒性是可测的、有梯度的、可优化的——13 支队伍的成绩分布证明了性能-质量关系稳定可复现,不是玄学;
- "识别坏图"比"在坏图上硬分"更接近应用成熟点——IQA 的 Kappa 0.631 虽不高,但二分门控已可用;而 Label 3 上的分割本身因无真值而无法评价,临床正确姿势就是不评价、去重扫;
- 受试者内配对设计放大了方法差异的可解释性——同一颗心脏跨质量档次的分割变化,可以直接可视化"模型到底对什么敏感";
- 开源存档的完整度决定了挑战赛的第二生命——CMRxMotion 的 22 套三件套存档让它在闭幕后三年仍能被复现与教学使用,总结论文(2025)本身就是这批资产的存在证明。
6.9 参赛队伍总表(TID 与开源资源,按总结论文 Table 4 口径)
14 支进入 STACOM 2022 论文集的队伍与其标识符(Task 1 以 A 前缀、Task 2 以 S 前缀;一队可双任务参赛故持双 ID):
| TID | 队名 | 任务参与 | 开源资源备注 |
|---|---|---|---|
| A1 | UON_IMA | Task 1(冠军) | 源码+Docker(GitHub 组织有 fork) |
| A2/S7 | Philips_CTS | 双任务 | 源码+Docker |
| A3/S5 | OpenGTN | 双任务(Task 1 季军) | 源码+Docker |
| A4 | issun | Task 1 | — |
| A5/S4 | Tewodrosw | 双任务(Task 2 并列第二) | 源码+Docker(GitHub 组织有 fork) |
| A6/S3 | CMR.Love.LHND | 双任务(Task 2 并列第二) | 源码+Docker |
| A7/S8 | MI-IST_DA | 双任务 | 源码+Docker |
| A8/S1 | UA-SVCC | 双任务(Task 2 并列第一) | 源码+Docker |
| A9/S6 | Abdual | 双任务 | 源码+Docker(GitHub 组织有 fork) |
| A10/S10 | Sano | 双任务 | 源码+Docker |
| S2 | Med-Air | Task 2(并列第一) | 源码+Docker |
| S9 | ML-Labs | Task 2 | — |
| S11 | HAHA2 | Task 2 | — |
| S12 | sots | Task 2 | — |
读表要点:双任务参赛是常态(10/14 队);GitHub 组织(github.com/CMRxMotion)下可见 UON_IMA、Tewodrosw、Abdual 等队的官方 fork 仓库;22 套公开算法(源码+权重+Docker 三件套)散布于上表勾选队——完整资源矩阵以总结论文 Table 4 与 Docker Hub cmrxmotion 命名空间为准。
6.10 可引用结论清单(一页版)
- CMRxMotion 是首个公开评估呼吸运动伪影下 CMR 分析鲁棒性的基准(MedIA 摘要原文口径);
- 数据集:40 名健康志愿者、单机(Siemens MAGNETOM Vida 3T,复旦张江国际脑影像中心)、320 个短轴 cine volume(4 呼吸协议 × ED/ES);
- 参数:TrueFISP bSSFP,2.0×2.0 mm² 面内分辨率,层厚 8 mm,层间隔 4 mm;
- 划分:训练 20 人 160 / 验证 5 人 40 / 测试 15 人 120(按人切分);训练集 139/160 例带分割标注;
- 质量标签:5 点 Likert 共识 → 三级(轻/中/重);Label 3 图像无分割标注且不参与分割评估;
- Task 1 冠军 UON_IMA(诺丁汉)Kappa 0.631(CI 0.518-0.734);细粒度三级难、二分门控可行;
- Task 2 并列第一 UA-SVCC(阿尔伯塔)与 Med-Air(KCL);并列第二 CMR.Love.LHND(港中文)与 Tewodrosw;
- DSC 全距:LV 81.81-93.90%、MYO 67.73-87.37%、RV 63.95-92.22%;HD95 全距 LV 3.05-15.21 / MYO 2.20-17.53 / RV 3.53-21.16 mm;
- nnU-Net 出现在 12 队中的 7 队(主模型/集成/管线级);
- MYO 是最难结构;基底与心尖层面普遍误差最大;
- 22 套算法(源码+权重+Docker)开源存档于 GitHub/Docker Hub(Apache 2.0);
- 参与规模:14 国家/地区 87 队(新闻口径)/112 注册者(论文口径);验证榜 275+340 次提交;
- 伦理:复旦大学 IRB FE20017;全体书面知情同意;
- 质量感知工作流降低下游生物标志物误差(论文定性结论)。
每条引用时注意时点:挑战事实(1-5、8-13)以设计论文+总结论文双源;排名数字(6-7)以 MedIA 总结论文为最终口径(颁奖新闻口径不同,见坑 5)。
§7 方法学启示:四条可迁移的经验
7.1 单变量压力测试是多中心基准的互补品而非替代品
M&Ms 路线把真实世界的异质性原样搬进数据集(多中心、多厂商、多病理),代价是性能差异永远无法干净归因;CMRxMotion 路线把异质性锁死,只放一个变量进来,代价是生态效度(ecological validity)受限。两者是互补关系:先在单变量标尺上回答"这个失败模式存在吗、有多严重",再去多中心基准上回答"真实世界里叠加了多少"。设计数据集/实验时,这对范式选择比"哪个数据集更大"重要得多。
落到操作层面,单变量设计对三类研究是刚需:其一,机制分析——你想证明"运动位移每增加 1 mm,MYO 的 DSC 掉多少",混杂未除的数据永远给不出这条曲线;其二,方法消融——鲁棒化模块(伪影仿真增强、质量感知门控)的增益只有在受控条件下才能与其他因素解耦;其三,失效边界标定——安全关键应用需要知道模型的"崩溃点"在哪档质量,自然分布数据采样不到崩溃点,配对压力测试可以。反过来,单变量数据的结论外推时要全程带着"其他变量恒定"的限定语——CMRxMotion 上跑分 0.93 的模型,换到真实多厂商临床流上没有参照意义,除非补做跨域实验。
7.2 让受试者"表演失败",是采集极端数据最便宜的办法
回顾性挖掘"拍坏的图"费人力、卡治理、混变量;CMRxMotion 用"训练志愿者表演四种呼吸"拿到了完整配对的质量梯度,成本几乎只有采集时间。这个思路可以平移到其他行为性退化场景(运动伪影之外,还有金属伪影、体动、不顺从的屏气等),前提是退化机制可以在健康人身上安全地诱导——这划定了它的适用边界(结构性病变无法这样"表演")。
把这条经验写成判据,判断一个退化场景适不适合"表演式采集":一看可诱导性——退化机制能否在志愿者身上按指令重现(呼吸可以,病理不能);二看安全性——诱导过程对健康人无风险(屏气失败零风险);三看可配对性——同一受试者能否在不疲劳/不引入额外变量的约束下完成多档位采集(CMR 单次访视四遍扫描在 30-40 分钟内完成,可行);四看标签独立性——退化程度能否由独立于采集的评审判定(Likert 由放射科医生打,不依赖诱导指令本身)。四条全过的场景,表演式采集都是首选;过不了的,再回到回顾性筛选或仿真合成路线。
7.3 把质量门控写进评估协议,而不是留给参赛者自由发挥
"Label 3 不参与分割评估"是一条看似平淡实则关键的规则:它把"哪些样本有资格被评价"从自由裁量变成了协议条款,既避免拿噪声当靶子的不公平,也把"先判质量、再做定量"的临床工作流直接编码进了挑战赛。做评估协议设计时,定义合格样本集与定义指标同样重要。
这条规则的深一层含义是:评估集的构成本身就是一种立场声明。如果把 Label 3 保留在分割评估里,等于宣告"任何输出都该被打分",模型会在最烂的图上产生看似有意义的掩码——这在临床上是危险的(垃圾进、看似合理的垃圾出);把 Label 3 剔除并单设 IQA 任务去识别它们,等于宣告"系统应当知道自己不行"——这才是医学 AI 的正确失败模式。CMRxMotion 用协议结构把这种价值观写进了计分桌,值得所有评估设计者抄写。
7.4 负结果清单:这届挑战没证明什么
- 细粒度伪影三级分类没有解决:冠军 Kappa 0.631,中重度灰色地带的共识度低——负结果本身是可引用的领域现状;
- 没有出现统计显著的单冠军:Task 2 前两名并列,说明在该数据体量与指标设计下,顶级方法之间不可分——"谁第一"是个伪问题,"谁不崩"才是真问题;
- 健康志愿者数据不能证明病理人群性能:全部受试者为健康人,对心衰/先心病人群的外推有效性未经检验(论文亦将病理域适应列为未来工作);
- 运动校正与分割的端到端联合未在挑战内覆盖:伪影校正(motion correction)+ 分割的一体化优化是论文指出的后续方向,挑战本身只覆盖了"识别与鲁棒分割",未覆盖"先修复再分割"路线的横向对比;
- IQA 标签的观察者间变异未量化:共识制标签让"医生之间对中重度的分歧有多大"成为盲区——这不影响基准使用,但提醒别把三级标签当成无噪声真值。
7.5 分读者行动清单
如果你是分割算法研究者:
- 拉开源基线(UA-SVCC 或 Med-Air 的 Docker)先复现排名,校准自己的评测管线;
- 训练时只用 Label 1&2(139 例),把 21 例 Label 3 留给 IQA 或伪影仿真模块;
- 报告时给出"性能-质量曲线"(分桶 DSC),别只报全测试集均值——均值会掩盖崩溃斜率;
- 与 M&Ms/ACDC 联评时声明各自测试协议不可互比。
如果你是影像质控/QC 工程师:
- 直接用三级标签训分类器,二分口径(可用/不可用)优先上线;
- 用 Cohen’s Kappa 报告性能(类别不平衡敏感);
- 部署时把阈值卡在"高召回 Label 3"一侧——漏放废片的临床代价远高于误杀可用片。
如果你要办新挑战赛:
- 照抄 §5.3 三平台分工与 §5.7 工程参数(断网 Docker、统一 GPU、时限);
- 评估协议学 §5.4:稳健排名+显著性检验+并列机制+合格样本条款;
- 收官学 §8.2:源码+权重+Docker 三件套强制归档,论文集同步。
如果你是综述/基准作者:
- 引"首个呼吸伪影公开基准"时用 MedIA 摘要原文口径;
- 排名数字一律引 MedIA 2025 最终口径(颁奖新闻口径不同,见坑 5);
- 五个生物标志物影响的具体数字先核对原文再引(本条目存照未逐字核验)。
把三届挑战的"应对配方"排成时间线,能看到社区学习曲线:ACDC 时代(2017-2019),社区在解决"小数据上把 U-Net 调稳";M&Ms 时代(2020-2021),强度域增强与域自适应成为标配(TMI 论文结论"强度驱动增强最重要");CMRxMotion 时代(2022),配方收敛为"nnU-Net 骨架 + 伪影仿真增强 + 多任务质量监督 + 集成推理"。三届下来,“更强的骨干"带来的边际收益始终小于"更聪明的数据策略”——这个模式在 M&Ms-2(多视图信息利用)与 CMRxMotion(质量感知管线)上反复出现,几乎可以当作 CMR 分割领域的经验定律引用。
引用示例(正文写作可直接套的句式):"在呼吸运动伪影的受控压力测试 CMRxMotion 上,最优方法的 LV/MYO/RV 分割 DSC 分别为 93.90%/87.38%/92.39%(并列冠军 UA-SVCC 与 Med-Air),而细粒度质量分级的最佳 Cohen’s Kappa 仅 0.631(UON_IMA)——前者说明伪影鲁棒分割已接近清晰影像水平,后者说明自动质量分级仍是开放问题(Wang et al., MedIA 2025)。"一句带出双任务、双冠军、双结论,且全部数字可溯源。
§8 生态与影响:CMRx 系列的开山作与开源资产库
8.1 一个实验室的挑战赛产品线:CMRxMotion → CMRxRecon
CMRxMotion 的主办方复旦大学数字医学研究中心(王烁组)在此之后把"CMRx"做成了系列品牌:CMRxRecon(心脏 MRI 重建挑战,2023 年挂 STACOM 2023、2024 年续办 STACOM 2024、2025 年第三季挂 STACOM 2025,设计文档 DOI 10.5281/zenodo.14051205)。两者构成"采集端(运动伪影下分析)× 重建端(加速采集)“的上下游呼应:重建挑战处理"欠采样怎么重建好”,运动挑战处理"重建好了但病人动了怎么分析好"。本库 cmrxrecon(rid 506)条目可与本条目形成双向互链。
与 M&Ms 系(BCN-AIM 主导,两季+衍生)类似,CMRx 系再次印证了 CMR 挑战赛生态的组织规律:单一核心实验室 + 稳定国际协作网 + 每季一个聚焦变量。
8.2 22 套开源算法:本数据集最被低估的资产
总结论文 Table 4 系统登记了全部参赛队的可复现资源(TID 编号:Task 1 以 A 前缀、Task 2 以 S 前缀),其中 22 套算法以"源码+模型权重+Docker 镜像"三件套形式公开,统一归档在 GitHub 组织(CMRxMotion/A1.UON_IMA 等 fork 仓库)与 Docker Hub(cmrxmotion/* 镜像,Apache 2.0)。对使用者这意味着:
- 开箱基线:复现冠军(UON_IMA 的 IQA、UA-SVCC/Med-Air 的分割)无需重写训练管线,拉镜像即可;
- 方法普查样本:22 套方法横跨 CNN/Transformer/多任务/增强策略,可直接做元分析或消融对照;
- 协议再利用:验证工作流(CMRxMotion-Task1/Task2-ValidatationFlow,Common Workflow Language 写成)与 Docker 构建模板可被其他挑战赛直接借用。
在"挑战赛结束即资产蒸发"的行业常态下,这批归档的完整度值得单独立项引用。
8.3 学术复用与基准位次
CMRxMotion 在 CMR 分割基准体系中的位次:与 ACDC、M&Ms 构成"病理-设备-行为"三维泛化的三支柱(§2.7 对照表);CMR 自监督/基础模型工作(如 arXiv:2503.19005 的 3D-Heart_Seg)将其纳入挑战数据池;影像质控(IQA)方向上,它是少数带三级医师标签的公开训练源。设计论文发表(2022-10)至总结论文发表(2025)三年间,数据集保持持续被引与算法更新,属于"挑战赛后仍有生命周期"的健康样本。
8.4 资助与伦理
- 伦理:复旦大学机构审查委员会(IRB)批准,批件号 FE20017;全体参与者书面知情同意(MedIA 论文口径);
- 通讯作者资助(MedIA 致谢节,Shuo Wang 部分):国家重点研发计划(2024YFF1207500)、国家自然科学基金(62501166)、上海市教委 AI 专项(24RGZNC01)、上海市科技创新行动计划国际合作项目(23410710400);共同作者 Chengyan Wang 亦有资助条目(文本截断未全录);
- 测评算力:并行科技(Paratera Technology Ltd)赞助;数据分发平台:Synapse(设计论文致谢)。
8.5 对数据集工程使用者的价值拆解
| 使用场景 | 怎么用 | 注意 |
|---|---|---|
| 训练影像质控模型 | 320 例三级标签直接监督;或二分(Label 1&2 vs 3) | 类别不平衡,用 Kappa 别用裸 accuracy |
| 鲁棒分割基准 | Label 1&2 训练、按协议梯度分桶评测性能-质量曲线 | 别把 Label 3 混进训练假装有标注 |
| 伪影仿真研究的真值参照 | 四协议配对影像是天然的"干净-脏"对 | 单中心单序列,仿真参数外推需谨慎 |
| 多任务(质量+分割)方法验证 | 139 例同时有两类标注 | 测试协议按 §5.4 复刻才可比 |
| 域泛化论文的附加实验 | 与 ACDC/M&Ms 联用,补"行为维度" | 报告时区分数据维度,别混写结论 |
8.6 本条目在库内 CMR 条目族中的补位说明
本库的心脏 MR 条目至此覆盖了基准谱系的四个象限:acdc(病理维度起点)、mms 与 mms-2(设备与视图维度)、cmrxrecon(重建维度)、本条目(行为/质量维度)。CMRxMotion 补位后,"CMR 分割为什么在真实临床流上掉分"的三大原因(病人形态不同、机器不同、图拍坏了)在库内都有对应数据集可查——这是检索层面把三个独立条目串成一条故事线的价值。互链由系统按调度自动挂载,本节供编辑者人工核对锚文本语义。
§9 检索路径建议
按目标选择检索组合(均经 2026-09-27 实测有效):
- 要数据:
CMRxMotion Synapse→ 官网 cmr.miccai.cloud/datasets/ → Synapse 注册(两个 ID 都试:syn28503327 / syn32407769); - 要协议细节与硬数字:arXiv:2210.06385(设计论文,含数据规格/IQA 定义/指标公式)+ arXiv:2507.19165(总结论文,含全部结果表与开源资源表);
- 要正式引用:DOI 10.1016/j.media.2025.103883(MedIA Vol.109:103883);
- 要代码与基线:GitHub
CMRxMotion组织(组织页列全部参赛队 fork)+ Docker Hubcmrxmotion命名空间; - 要方法论文集:Springer LNCS《Statistical Atlases and Computational Models of the Heart. Regular and CMRxMotion Challenge Papers》(STACOM 2022,ISBN 978-3-031-23442-2);
- 要中文官方叙述:复旦大学数字医学研究中心官网新闻"实验室主办 CMRxMotion 挑战赛结果在 MICCAI 2022 公布"(2022-09-20);
- 易混淆词提醒:检索时避开裸词 “MMS”(磁层卫星任务 Magnetospheric Multiscale 占满结果)与 “M&Ms”(另一个心脏挑战系列);用 “CMRxMotion” 全词或全称。
9.1 检索关键词组合表
| 目标 | 推荐组合 | 避开 |
|---|---|---|
| 官网与数据入口 | CMRxMotion + Synapse / cmr.miccai.cloud |
裸词 MMS、M&Ms |
| 数据规格细节 | CMRxMotion + 2210.06385 或 + extreme cardiac MRI |
只搜中文(一手文献全英文) |
| 结果与排名 | CMRxMotion + 2507.19165 / 10.1016/j.media.2025.103883 |
颁奖新闻数字(口径旧) |
| 代码与基线 | github.com/CMRxMotion / Docker Hub cmrxmotion |
只搜模型名(队伍名冷僻) |
| 论文集 | STACOM 2022 + 978-3-031-23442-2 |
只搜 LNCS 卷号(易混 2021/2023 卷) |
| 中文叙述 | CMRxMotion 挑战赛 + 复旦大学 数字医学研究中心 |
机器翻译名"CMRx运动" |
§10 避坑清单:十一个已踩过的坑
坑 1:裸词检索会被卫星与糖果淹没。
“MMS” 是磁层卫星任务(Magnetospheric Multiscale)的缩写,Zenodo 搜 “M&Ms-3” 返回的是磁层等离子体数据集与昆虫翅脉论文;心脏挑战的 “M&Ms” 与磁层 “MMS” 又只差一个 & 号。检索一律用 “CMRxMotion” 全词或 “Extreme Cardiac MRI Analysis Challenge” 全称。
坑 2:Zenodo 上没有这个数据集。
与 M&Ms 系"Zenodo 至少有设计 PDF"不同,CMRxMotion 在 Zenodo 零记录——数据唯一官方通道是 Synapse。自动化管线里"DOI 10.5281/zenodo.xxx"的惯性假设在这里必然空转。
坑 3:两个 Synapse ID 并存。
设计论文与 openmedlab 写 syn28503327(项目页),MedIA 总结论文写 syn32407769(验证榜工作区)。两个 ID 都是官方口径,指向不同工作区。引用时标注出处;下载时两个都试。
坑 4:测试集是 15 人 120 volumes,不是 160。
第三方镜像(openmedlab)把测试集写成 “160 cases (20 volunteers)”——错把训练集参数套到了测试集上。双源闭合等式锁定:40 人 = 20+5+15,320 volumes = 160+40+120。引错测试集规模会连带算错所有 per-case 指标。
坑 5:Task 2 冠军有两种说法。
复旦官方新闻(颁奖时点):“香港中文大学队与阿尔伯塔大学队共同获得冠军”;MedIA 总结论文(最终复算):“UA-SVCC(阿尔伯塔)与 Med-Air(KCL)并列第一,CMR.Love.LHND(港中文)与 Tewodrosw 并列第二”。以论文为准;引新闻表述务必标注时点。
坑 6:"320 例"是 volume 数,志愿者是 40 人。
新闻与镜像常把 “320 CMR cine series” 简写成 “320 例”——受试者级样本量是 40,volume 级才是 320。做受试者级划分统计或 per-subject 分析时用错口径会全面翻车。
坑 7:单中心单厂商不是缺陷,是设计。
把 CMRxMotion 当"低配版 M&Ms"是方向性误读:它的价值恰在锁死设备变量后对"呼吸行为"做单变量压力测试。反过来,拿它练"厂商泛化"更是缘木求鱼——全库只有一台 Vida。
坑 8:重度伪影图像没有分割标注。
训练集 160 例中 139 例有分割掩码;21 例 Label 3(重度)图像只有质量标签。直接拿训练集全量训分割模型会遇 NIfTI 缺文件;正确姿势是先按 IQA 标签过滤,或把质量门控作为管线第一级。
坑 9:代码的 Apache 2.0 ≠ 数据的开源许可。
GitHub/Docker Hub 存档明确 Apache 2.0,但那是算法资产;数据本体的官方条款是"解禁期后研究使用+引用"(引用制),无标准 CC 文本。HF 镜像自标的 CC-BY-4.0 与二手转述的 CC-BY-NC 都不能当官方依据。合规表述见 §4.4。
坑 10:MedIA 卷期年份有两套写法。 DOI 是 10.1016/j.media.2025.103883(在线 2025),ScienceDirect 页面标 Volume 109 / March 2026(正式卷期)。引用时选一套并保持一致——建议正文引"2025(在线)/卷期 2026"双注,参考文献表用卷期口径。
坑 11:HD95 的跨库实现差异。 官方后端用 medpy 系实现(设计论文脚注),不同库(MedPy/scipy/SimpleITK)的 Hausdorff 表面采样方式有细微差别——复现排名时若分数对不上,先对齐 HD95 实现再怀疑模型。
§11 总结与速查
11.1 一段话总结
CMRxMotion 是 MICCAI 2022 STACOM 官方挑战数据集,用"40 名健康志愿者 × 4 种呼吸协议 × ED/ES 两时相 = 320 个单机 3T 短轴 cine volume"的极简设计,把呼吸运动伪影从临床抱怨变成了可测量的公开基准;双任务(三级质量评估 + LV/MYO/RV 鲁棒分割)+ 严苛评估协议(断网 Docker、rank-then-aggregate、Label 3 剔除)+ 22 套全开源算法,使它成为运动鲁棒性与影像质控研究的第一引用对象;注册制获取(Synapse)与三处检索暗坑(Zenodo 空门、双 Synapse ID、双冠军口径)是使用前必须扫清的障碍。
条目名采用官方简称 CMRxMotion(社区检索的主流键),全称在 §1 Q1 与附录 L 全文给出;slug 定为 cmrxmotion 与库内 cmrxrecon(rid 506)形成系列命名对,检索与互链均以此为准。
11.2 三种读者的 30 秒版本
工程落地方:“Synapse 注册拿数据(双 ID 都试),NIfTI 直接进 nnU-Net,先训 IQA 二分门控再训分割,Label 3 别碰,测试别跟挑战榜比——榜单冻结了。”
论文写作者:“首个呼吸伪影 CMR 公开基准(MedIA 2025),40 人 320 volumes 单机 3T 四协议配对设计,Task 2 并列第一 UA-SVCC/Med-Air(DSC 93.90/87.38/92.39),Task 1 Kappa 0.631(UON_IMA);引排名认准 MedIA 口径,引条款认准官网原文。”
教学/综述者:“这是’观察性基准’之外的’干预性基准’范本:控制一切、只动呼吸、把质量门控写进协议、把 22 套算法全部开源——教实验设计时比教数据集时更有用。”
11.3 FAQ(51 问快答)
身份与定位
- CMRxMotion 全称?——Extreme Cardiac MRI Analysis Challenge under Respiratory Motion。
- 哪一年、挂什么会?——2022 年,MICCAI 2022 官方注册挑战,STACOM 2022(第 13 届)workshop,2022-09-18 颁奖。
- 有第二季吗?——没有(one-time event);同团队后续系列是 CMRxRecon(重建,2023-2025 三季)。
- 和库内 cmrxrecon 什么关系?——同一复旦团队主导的 CMRx 系列,一个管运动伪影下分析、一个管加速重建,rid 506 可互链。
数据
- 多少数据?——40 名志愿者、320 个短轴 cine volume(4 协议 × ED/ES);训练 160/验证 40/测试 120。
- 扫描仪与序列?——Siemens MAGNETOM Vida 3T 单台,TrueFISP(bSSFP)cine 短轴;2.0×2.0 mm²、层厚 8 mm、层间隔 4 mm。
- 有病理样本吗?——没有,全部为健康志愿者(19-48 岁)。
- 四种呼吸协议?——完全屏气/屏气减半/自由呼吸/剧烈呼吸;受试者内配对。
- 文件格式与命名?——NIfTI(.nii.gz),Pxxx-x-ED/ES.nii.gz;方向信息被刻意丢弃。
- 标签体系?——分割 0 背景/1 LV/2 MYO/3 RV(沿用 ACDC/M&Ms);质量三级(1 轻/2 中/3 重)由 5 点 Likert 压缩。
任务与结果
- 两个任务是什么?——Task 1 图像质量评估(三分类,Cohen’s Kappa);Task 2 鲁棒分割(DSC+HD95,rank-then-aggregate)。
- Task 1 冠军与成绩?——UON_IMA(诺丁汉大学),Kappa 0.631(CI 0.518-0.734)。
- Task 2 冠军?——UA-SVCC(阿尔伯塔)与 Med-Air(KCL)并列第一;CMR.Love.LHND(港中文)与 Tewodrosw 并列第二(MedIA 最终口径)。
- 最佳 DSC?——LV 93.90%(UA-SVCC)、MYO 87.38%(Med-Air)、RV 92.39%(Med-Air)。
- 用了什么架构最多?——nnU-Net(12 队中 7 队)。
- 最难的结构?——MYO(薄壁),且基底/心尖层面普遍误差大。
- 参与规模?——14 国家/地区 87 队(新闻口径)/112 注册者(论文口径);验证榜 275+340 次提交;测试 10+13 队;14 篇方法论文。
获取与许可
- 怎么下载?——官网注册 + data access agreement → Synapse(syn28503327 / syn32407769 双 ID 并存)。
- license 是什么?——数据为"解禁期(2022-12)后研究使用+引用"的引用制条款,无标准 CC 文本;代码/镜像 Apache 2.0。
- Zenodo 有吗?——没有,零记录。
- 第三方镜像可信吗?——HuggingFace 镜像可作结构参考,非官方分发,完整性无承诺。
工程与合规
- 伦理批件?——复旦大学 IRB FE20017,全体书面知情同意。
- 能和 ACDC/M&Ms 混着训吗?——标签体系同构可直接混训;但论文引用需分别标注,且注意 CMRxMotion 全为健康人。
- 总结论文正式出处?——Medical Image Analysis Vol.109:103883,DOI 10.1016/j.media.2025.103883(在线 2025,卷期 2026-03)。
方法与结果细读
- rank-then-aggregate 具体怎么算?——每个测试 case、每个指标(DSC/HD95)、每个结构(LV/MYO/RV)单独给所有队伍排名,最后把一名队伍的全部排名取平均作为最终分。
- 为什么 Task 2 会并列第一?——Wilcoxon 符号秩检验显示 UA-SVCC 与 Med-Air 的排名分差异不显著(p>0.05),按协议并列。
- 各队最常用的增强策略?——k-space 运动仿真、图像域形变/模糊仿真、对抗生成三类;多队叠加质量标签做辅助监督。
- IQA 任务的类别分布偏差怎么处理?——用线性加权 Kappa 而非裸 accuracy,前者对类别不平衡稳健。
- 轻度图像为何普遍识别得好?——Likert 4-5 的影像视觉特征清晰、与协议 a 对应度高,机器与医生共识最容易;中重度的"够不够诊断"边界本身主观性强。
- 挑战后的榜单还开吗?——挑战是一次性活动(one-time event),Docker 评测窗口 2022-09 关闭;后续 benchmark 靠自行复现协议+开源基线。
数据工程
- 影像的方向信息去哪了?——预处理时被刻意丢弃(设计论文明说,为兼容 ITK-SNAP 等查看器);需要朝向的后处理要自行重建。
- 每个 case 的层级键是什么?——subject(P001-P040)→ protocol(1-4)→ phase(ED/ES);按人切分是官方划分原则。
- 验证集有标注吗?——没有,40 个 volume 只有图像,真值扣留在 Synapse 后端做在线评测。
- 训练集里没有分割标注的 21 例是坏文件吗?——不是,是 Label 3 重度伪影图像的设计性无标注(医生认为不可靠勾画)。
- 可以拿它做视频/时序模型吗?——不合适,只有 ED/ES 两帧,心动周期中间帧不在包内。
生态与引用
- 主办方资助来自哪里?——王烁组:国家重点研发计划 2024YFF1207500、国自然 62501166、上海市教委 24RGZNC01、上海科创国际合作 23410710400 等;测评算力由并行科技赞助。
- 论文集在哪?——Springer LNCS《Statistical Atlases and Computational Models of the Heart. Regular and CMRxMotion Challenge Papers》(STACOM 2022,ISBN 978-3-031-23442-2),34 篇 regular + 14 篇挑战论文。
- 官方联系方式?——CMRxMotion@163.com 与 shuowang@fudan.edu.cn(官网 Contact 节)。
- 想引"首个"的宣称有依据吗?——MedIA 总结论文摘要原文 “established the first public benchmark for evaluating the robustness of automated CMR analysis algorithms against respiratory motion artifacts”。
- 检索时最容易撞车的词?——裸词 MMS(磁层卫星)、M&Ms(另一心脏挑战系列)、M&Ms-3(无实证);一律用 CMRxMotion 全词。
质量评估方法学(补)
- 三级标签可以当回归目标吗?——不建议直接回归 Likert 值(共识制单标签,序信息半可靠);先用三分类复现基线,序回归(ordinal regression)是进阶方向。
- 冠军 UON_IMA 用的什么方法?——论文 Table 5 有方法学普查;其 GitHub fork(ruizhe-l/CMRxMotion)可读源码;本条目不做二手转抄。
- 为什么不用 ImageNet 预训练就好?——多数队伍用了预训练(ImageNet 或医学自监督);总结论文 Table 5 有逐队登记,预训练是普遍但非充分的组件。
- 伪影仿真增强有效吗?——多支前排队伍采用(k-space 仿真或图像域形变),属于本届共识性技巧;单变量有效性请做消融。
- IQA 模型能迁移到其他模态吗?——未验证;本数据集只含 CMR 短轴 cine,跨模态迁移是开放问题。
数据边界(补)
- 有多少个 2D 切片?——训练集 139 例带标注切片共 1501 张(openmedlab 统计口径);全量切片数以实际数据包为准。
- 志愿者年龄跨度会引入什么?——19-48 岁健康人心脏尺寸与心率跨度可观,做配对分析时年龄是潜在混杂变量。
- 能用这个数据集做生成模型吗?——没有限制条款禁止,但只有两帧/人的时序约束使其更适合条件生成(如伪影-清晰配对翻译)而非视频生成。
检索与获取(补)
- 一句话检索策略?——
CMRxMotion Synapse(找数据)+arXiv 2210.06385(设计论文)+arXiv 2507.19165(总结论文),三步覆盖 90% 需求。 - 想确认官网条款有没有变怎么办?——官网 /datasets/ 页是唯一权威源;抓取留痕(含日期)是合规自检的一部分(附录 M 第 5 条)。
- 挑战同期还有哪些心脏挑战可对照?——M&Ms 系(厂商/视图)、EMIDEC(心梗 LGE)、MyoPS(心肌病理多序列);本库 acdc/mms/mms-2 条目有各自档案。
11.4 硬事实清单(32 条,含出处)
- 官方全称 Extreme Cardiac MRI Analysis Challenge under Respiratory Motion(官网/设计论文)
- MICCAI 2022 Satellite Events Committee 2022-02-28 正式接收(总结论文 §4.3.2)
- STACOM 2022 workshop 2022-09-18 颁奖(官网/总结论文)
- 40 名健康志愿者,24 男 16 女,19-48 岁,45-85 kg(MedIA 数据段)
- 复旦张江国际脑影像中心,Siemens MAGNETOM Vida 3T(官网/设计论文/MedIA 三源)
- TrueFISP bSSFP cine 短轴;2.0×2.0 mm²/8 mm/4 mm(设计论文)
- 320 volumes = 40 人 × 4 协议 × 2 时相(设计论文/MedIA/openmedlab)
- 划分 160/40/120,按志愿者切分(设计论文/MedIA)
- 训练集 139/160 例带分割标注(openmedlab 统计口径)
- IQA 三级 = Likert 5-4→L1、3→L2、1-2→L3(设计论文 Table I 规则)
- 分割标注:技术员 X.K. 勾画 + 双放射科医生复核,3D Slicer(设计论文)
- 测试真值由 3 名资深放射科医生标注(总结论文)
- 伦理 FE20017,书面知情同意(MedIA)
- 注册:87 队/14 国家地区(复旦新闻);112 名注册参与者(MedIA)
- 验证榜提交 275(Task 1)/340(Task 2)(MedIA)
- 测试期 10 队 IQA / 13 队 RCS 交 Docker(MedIA)
- 测试环境:V100 32GB、断网、4 小时限额(总结论文)
- Task 1 前三:UON_IMA 0.631 / Philips_CTS 0.549 / OpenGTN 0.474(MedIA/chatpaper 互证)
- Task 2 并列第一 UA-SVCC + Med-Air;并列第二 CMR.Love.LHND + Tewodrosw(MedIA)
- DSC 全距 LV 81.81-93.90/MYO 67.73-87.37/RV 63.95-92.22%;HD95 全距 3.05-15.21/2.20-17.53/3.53-21.16 mm(MedIA)
- nnU-Net:12 队中 7 队(MedIA §6.5)
- 14 篇方法论文入 STACOM 2022 论文集,ISBN 978-3-031-23442-2(Springer)
- 22 套算法三件套开源,GitHub/Docker Hub,Apache 2.0(总结论文 §4.3.3)
- 官方使用条款:解禁期 2022-12 后研究使用需引用 arXiv:2507.19165 与 2210.06385(官网 /datasets/ 页原文)
- 挑战为一次性活动(one-time event),无第二季(总结论文 §4.3.2)
- 颁奖由帝国理工 Chen Chen、Cheng Ouyang 现场执行(复旦新闻)
- 外部数据允许使用但须声明来源(设计论文 Participation and Awards 节)
- 每任务奖金 1st $500 / 2nd $200 / 3rd $100,前三名含并列(设计论文+官网)
- 验证期每队每任务每天最多 3 次提交(总结论文 §5.1)
- 测试集标注团队为 3 名资深放射科医生(总结论文 §4.3.2)
- 数据预处理丢弃方向信息以兼容 ITK-SNAP(设计论文 Pre-processing 节)
- STACOM 2022 workshop 共收到 48 篇投稿,收录 34 regular + 14 挑战论文(Springer 出版说明)
11.5 术语表(29 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| 呼吸运动伪影 | respiratory motion artifact | 屏气失败/呼吸导致的心脏影像模糊与形变 |
| 极端影像 | extreme imaging | 按协议刻意诱导质量退化的采集 |
| 受试者内配对 | intra-subject pairing | 同一人在多条件下成像,可做严格对照 |
| 屏气 | breath-hold | CMR 标准采集中的憋气指令 |
| 自由呼吸 | free breathing | 不屏气状态下采集 |
| TrueFISP | True Fast Imaging with Steady-state Precession | Siemens 的 bSSFP 序列商品名 |
| bSSFP | balanced steady-state free precession | 平衡稳态自由进动,cine 主力序列 |
| 短轴 | short-axis (SA) | 垂直于心脏长轴的切面 |
| 舒张末期/收缩末期 | end-diastole (ED)/end-systole (ES) | 心室充盈最大/最小的时相 |
| 图像质量评估 | image quality assessment (IQA) | 对影像诊断可用性的自动分级 |
| 鲁棒分割 | robust cardiac segmentation (RCS) | 在质量退化下保持精度的分割 |
| Cohen’s Kappa | Cohen’s κ | 校正随机一致后的分类一致性度量 |
| Dice 系数 | Dice Similarity Coefficient (DSC) | 分割重叠度指标 |
| 95% Hausdorff 距离 | 95th percentile Hausdorff distance (HD95) | 表面距离的 95 分位,边界质量指标 |
| rank-then-aggregate | 先排名后聚合 | 逐 case 逐指标排名取平均的稳健排名法 |
| Wilcoxon 符号秩检验 | Wilcoxon signed-rank test | 配对非参数显著性检验 |
| 质量门控 | quality gating | 以质量分级过滤/分流后续流程 |
| nnU-Net | — | 自配置医学分割框架,本挑战主流方法 |
| Synapse | — | Sage Bionetworks 的数据/竞赛托管平台 |
| data access agreement | 数据使用协议 | 获取数据前签署的合规文书 |
| 解禁期 | embargo period | 挑战结束到数据自由使用的缓冲期(2022-12 止) |
| STACOM | Statistical Atlases and Computational Modelling of the Heart | MICCAI 心脏 workshop 系列 |
| BIAS 指南 | Biomedical Image Analysis Challenges guideline | 挑战赛报告规范(Maier-Hein 2020) |
| 张江国际脑影像中心 | Zhangjiang International Brain Imaging Center | 复旦大学的影像采集设施 |
| k-space 仿真 | k-space motion simulation | 在原始信号域注入运动效应的增强手段 |
| 测试时增强 | test-time augmentation (TTA) | 推理时对输入做多扰动并聚合预测 |
| 多任务学习 | multi-task learning | 质量分级头与分割头共享编码器的联合训练 |
| 并行科技 | Paratera | 挑战测评算力赞助方 |
| 逐例排名聚合 | per-case ranking average | rank-then-aggregate 的逐案平均实现 |
| 检查表式标注 | checklist-based annotation | 判定规则完全可枚举的标注协议形态 |
附录
附录 A:硬数字速查表
| 项目 | 值 |
|---|---|
| 志愿者 | 40(24 男/16 女,19-48 岁) |
| 总量 | 320 volumes(4 协议 × ED/ES) |
| 划分 | 160(20 人)/40(5 人)/120(15 人) |
| 训练集分割标注 | 139/160 |
| 扫描仪 | MAGNETOM Vida 3T 单台 |
| 序列 | TrueFISP bSSFP,SA |
| 参数 | 2.0×2.0 mm² / 8 mm 层厚 / 4 mm 层间隔 |
| 伦理 | 复旦 IRB FE20017 |
| 注册 | 87 队(新闻)/112 人(论文) |
| 验证榜提交 | 275(T1)/340(T2) |
| 测试队 | 10(T1)/13(T2) |
| Task 1 冠军 | UON_IMA,Kappa 0.631 |
| Task 2 冠军 | UA-SVCC 与 Med-Air 并列 |
| DSC 最佳 | LV 93.90 / MYO 87.38 / RV 92.39 % |
| 方法论文 | 14 篇(LNCS 978-3-031-23442-2) |
| 开源算法 | 22 套(源码+权重+Docker) |
| 总结论文 | MedIA 109:103883,DOI 10.1016/j.media.2025.103883 |
| 设计论文 | arXiv:2210.06385(2022-10-12) |
| 官网 | cmr.miccai.cloud(/datasets/ 子页含条款) |
| 代码存档 | github.com/CMRxMotion + Docker Hub cmrxmotion(Apache 2.0) |
附录 B:DAIMS 评分表(数据集 AI-Ready 五维)
| 维度 | 评分(1-5) | 依据 |
|---|---|---|
| 可获取性 | 3 | Synapse 注册制+协议审批;流程清晰但非直链;无 Zenodo 备份 |
| 格式开放性 | 5 | NIfTI+CSV,医学影像事实标准,无专有格式 |
| 标注完备性 | 4 | 质量标签全覆盖;分割覆盖诊断质量图像(139/160);Label 3 设计性缺标注 |
| 文档质量 | 5 | 设计论文+总结论文+官网三件套;参数/协议/指标/资源表全部可查 |
| 可复现资产 | 5 | 22 套算法源码+权重+Docker 开源;评测脚本与工作流公开 |
| 综合 | 4.4/5 | 注册制是唯一实质门槛;越过即全链路高可用 |
附录 C:证据链(主要来源 URL)
| # | 来源 | 用途 |
|---|---|---|
| 1 | http://cmr.miccai.cloud/ | 官网:定位、协议、时间线、队伍讲席、奖金 |
| 2 | http://cmr.miccai.cloud/datasets/ | 发布公告与官方使用条款原文 |
| 3 | https://arxiv.org/abs/2210.06385 | 设计论文:数据规格、IQA 定义、指标、流程 |
| 4 | https://arxiv.org/abs/2507.19165 | 总结论文预印本(结果表、开源资源表、时间线) |
| 5 | https://doi.org/10.1016/j.media.2025.103883 | MedIA 正式版(卷期、作者、伦理、资助) |
| 6 | https://miccai.fudan.edu.cn/ff/79/c34229a458617/page.htm | 复旦官方新闻:主办方、87 队、颁奖口径 |
| 7 | https://github.com/CMRxMotion | 组织页:参赛队 fork、评测工作流 |
| 8 | https://www.synapse.org/#!Synapse:syn28503327 | 数据分发(设计论文口径) |
| 9 | https://www.synapse.org/#!Synapse:syn32407769 | 验证榜(总结论文口径) |
| 10 | openmedlab/Awesome-Medical-Dataset CMRxMotion.md | 数据组织、139 标注数、主办方名单(第三方) |
| 11 | https://huggingface.co/datasets/MedOtter/cmrxmotion | 第三方镜像结构参考(非官方) |
| 12 | https://www.emergentmind.com/topics/miccai-cmrxmotion-challenge | 结果汇总交叉验证(第三方) |
来源分级说明(引用本条目时的强度标尺):
| 等级 | 来源 | 使用规则 |
|---|---|---|
| S1 一手双源 | 设计论文 + MedIA 总结论文 | 硬数字主口径;两者冲突时入附录 D 存照 |
| S2 一手单源 | 官网原文、复旦官方新闻、Springer 出版页 | 时间线/颁奖/条款细节;标注抓取时点 |
| S3 平台存档 | GitHub 组织、Docker Hub、Synapse | 资产存在性;状态需定期复核(附录 I 触发点) |
| S4 第三方佐证 | openmedlab、HuggingFace 镜像、EmergentMind | 仅结构与体量佐证;禁止作事实主源 |
| S5 推断口径 | 队伍机构归属(队名/作者列表推断) | 正文标注"推断";存照于 FACTS §9 与附录 N |
附录 D:双口径登记表
| # | 口径 A | 口径 B | 处置 |
|---|---|---|---|
| 1 | 测试集 15 人 120 volumes(设计论文+MedIA) | 160 volumes/20 人(openmedlab) | 按 A 书写,B 标注为镜像错误 |
| 2 | Task 2 冠军 UA-SVCC+Med-Air(MedIA 最终) | CUHK+Alberta(复旦颁奖新闻) | 按 A 书写,B 存照标注时点 |
| 3 | 112 名注册参与者(MedIA) | 87 支队伍(复旦新闻) | 并存:人数 vs 队数,各标口径 |
| 4 | Synapse syn28503327(设计论文) | syn32407769(MedIA) | 并存:两 ID 都给 |
| 5 | 官网 4-01 上线/4-15 开注册(总结论文) | 官网表"15-Apr website opens" | 并存:以总结论文叙述为主 |
| 6 | MYO DSC 最佳 87.38%(正文) | 87.37%(范围句) | 四舍五入差异,取正文 87.38 |
| 7 | MedIA 在线 2025(DOI 前缀/arXiv) | 卷期 Volume 109, March 2026(ScienceDirect) | 并存:引用时注明时点 |
| 8 | 数据许可=引用制(官网原文) | CC-BY-4.0(HF 镜像)/CC-BY-NC(转述) | 按 A 书写,B 标注非官方 |
附录 E:数据获取决策树
要拿 CMRxMotion 数据
├── 只想确认结构/规模?
│ └── 读 arXiv:2210.06385(设计论文)+ 本条目 §2 → 无需下载
├── 要真数据
│ ├── 有 Synapse 账号?
│ │ ├── 是 → 官网 cmr.miccai.cloud 注册 + 填 data access agreement
│ │ │ → 获批后到 Synapse(syn28503327 主试;syn32407769 备用)下载
│ │ └── 否 → 先注册 synapse.org(机构邮箱过审更快)
│ └── 审批慢?→ 邮件 CMRxMotion@163.com 或 shuowang@fudan.edu.cn 催办
├── 只要基线代码/权重?
│ └── GitHub github.com/CMRxMotion + Docker Hub cmrxmotion/*(无需数据协议)
└── 想要测试集真值?
└── 挑战期保密;解禁后形态见附录 D 第 1 行存照——到手后先核验
附录 F:引文规范与易错点
引本文数据集时建议双引文(官网条款要求):
@article{wang2025cmrxmotion,
title={Extreme cardiac MRI analysis under respiratory motion:
Results of the CMRxMotion challenge},
author={Wang, Kang and Qin, Chen and Shi, Zhang and others},
journal={Medical Image Analysis},
volume={109},
pages={103883},
year={2025},
doi={10.1016/j.media.2025.103883}
}
@article{wang2022cmrxmotion,
title={The Extreme Cardiac MRI Analysis Challenge under Respiratory Motion (CMRxMotion)},
author={Wang, Shuo and Qin, Chen and Wang, Chengyan and others},
journal={arXiv preprint arXiv:2210.06385},
year={2022}
}
易错点:把 2022(挑战年)写成数据集"发表年";把 MedIA 卷期 2026 写成 2025(或反之)——双口径见附录 D 第 7 行;把 volume 数 320 当受试者数。
附录 G:常见误读与澄清对照表
| 常见误读 | 澄清 | 出处 |
|---|---|---|
| “CMRxMotion 数据在 Zenodo” | Zenodo 零记录;数据在 Synapse | 坑 2、§4.2 |
| “测试集 160 例” | 15 人 120 volumes | 坑 4、§2.5 |
| “港中文拿了分割冠军” | MedIA 最终口径为 UA-SVCC+Med-Air 并列第一 | 坑 5、§6.2 |
| “320 人的数据集” | 40 名志愿者、320 个 volume | 坑 6、§2.1 |
| “单中心数据没价值” | 单变量压力测试恰是其设计价值 | 坑 7、§7.1 |
| “全量 320 例可训分割” | Label 3 的 21 例训练样本无分割标注 | 坑 8、§3.5 |
| “Apache 2.0 所以数据随便用” | Apache 2.0 仅覆盖代码/镜像;数据为引用制 | 坑 9、§4.4 |
| “IQA 三分类已解决” | 冠军 Kappa 仅 0.631,中重度未解决 | §6.1、§7.4 |
| “它是 M&Ms 第三季” | 与 M&Ms 系无隶属关系;M&Ms-3 无实证 | FACTS §9、§8.1 |
| “质量标签可有可无” | 它同时是 Task 1 监督信号与 Task 2 评估门控 | §2.3、§5.4 |
附录 H:CMR 挑战赛家族对照总表(选型视图)
| 数据集 | 年份/会议 | 规模 | 人群 | 设备 | 独特变量 | 任务 | 库内 rid |
|---|---|---|---|---|---|---|---|
| ACDC | 2017 / STACOM | 100 患者 | 患者+健康 | 单中心 | 多病理 | LV/MYO/RV 分割 | acdc |
| M&Ms | 2020 / STACOM | 345-375 例 | 患者+健康 | 6 中心 4 厂商 | 厂商/中心异质 | LV/MYO/RV 分割 | 516 |
| M&Ms-2 | 2021 / STACOM | 360 例 | 患者(8 组) | 3 中心 9 机 | RV+多视图+未见病理 | RV 分割(双视图) | 682 |
| CMRxMotion | 2022 / STACOM | 320 vol/40 人 | 全健康 | 1 中心 1 机 | 呼吸行为 4 档 | IQA+鲁棒分割 | 本条目 |
| CMRxRecon | 2023-2025 / STACOM | 300-330 例 | 患者+健康 | 多中心多厂商 | 加速重建 | CMR 重建 | 506 |
读表口诀:四代基准按"异质性来源"排列——病理(ACDC)→ 设备(M&Ms)→ 视图与未见病理(M&Ms-2)→ 行为(CMRxMotion)→ 信号欠采样(CMRxRecon);标注与格式高度同构,跨集联合实验的边际成本主要在域对齐。
附录 I:维护触发点(本条目)
| # | 触发条件 | 动作 |
|---|---|---|
| 1 | Synapse 任一 ID 失效或数据包结构变化 | 更新 §4.1 渠道矩阵与坑 3 |
| 2 | 官网 cmr.miccai.cloud 下线 | 在 §4.1 标注核验时点,术语与条款以论文为准 |
| 3 | 官方发布数据 license 正式文本(如 CC) | 重写 §4.4 与 frontmatter license 字段 |
| 4 | 总结论文被正式勘误或排名修正 | 修 §6.2 并更新附录 D 双口径表 |
| 5 | 测试集标注公开形态确认 | 删除 §4.5 存照,补实测描述 |
| 6 | cmrxrecon 条目(rid 506)更新系列信息 | 同步 §8.1 与附录 H |
附录 J:数据卡(DATACARD 速印版)
- 名称:CMRxMotion(Extreme Cardiac MRI Analysis Challenge under Respiratory Motion)
- 版本/时点:2022 挑战版;解禁 2022-12;总结论文 2025(MedIA 109:103883)
- 模态/序列:CMR,TrueFISP(bSSFP)cine,短轴,ED/ES
- 受试者:40 名健康成人(24M/16F,19-48 岁)
- 体量:320 volumes(160 训练/40 验证/120 测试)
- 分辨率:2.0×2.0 mm² 面内;8 mm 层厚;4 mm 层间隔
- 标签:分割(0/1/2/3 = 背景/LV/MYO/RV,139/160 训练例)+ 质量三级(320 例全覆盖)
- 设备:Siemens MAGNETOM Vida 3T(复旦张江国际脑影像中心)
- 获取:官网注册 + data access agreement → Synapse(syn28503327 / syn32407769)
- 许可:引用制研究使用(官方条款);代码 Apache 2.0
- 伦理:复旦 IRB FE20017
- 基准:Task 1 Kappa 0.631(UON_IMA);Task 2 并列第一 UA-SVCC/Med-Air
- 已知限制:全健康人群;单机单序列;两帧制;IQA 共识制无观察者间变异量化
附录 K:与 M&Ms 系条目的互链注记
本条目在生产时原任务为"M&Ms-3 挑战赛第三季"条目(slug mms-3),经三轮以上核验证伪后改道 CMRxMotion。因此本条目与 M&Ms 家族的互链面反而更深:
- mms(rid 516):官网 motivation 原文引用(“previous CMR challenges (e.g., ACDC, M&Ms)”);CMRxMotion 设计论文参考文献 [4];两者构成"设备异质性 vs 行为异质性"的方法学对偶;
- mms-2(rid 682):MedIA 总结论文引用(Martín-Isla et al. 2023)作为"解剖结构变异类挑战"的代表;标注惯例同源(三结构 ED/ES 短轴);
- cmrxrecon(rid 506):同主办(复旦数字医学研究中心)、同系列命名(CMRx)、同 STACOM 场域;差异在任务(分析 vs 重建)与数据变量(运动伪影 vs 加速欠采样);
- acdc:标注规则继承来源;设计论文参考文献 [5]。
互链锚文本建议:M&Ms 侧挂"CMRxMotion(呼吸运动极端心脏 MRI 挑战)“;cmrxrecon 侧挂"CMRx 系列前作”;acdc 侧挂"标注惯例下游继承者"。
附录 L:缩写与命名对照总表
| 缩写/命名 | 全称 | 中文 |
|---|---|---|
| CMRxMotion | Extreme Cardiac MRI Analysis Challenge under Respiratory Motion | 呼吸运动下的极端心脏 MRI 分析挑战 |
| STACOM | Statistical Atlases and Computational Modelling of the Heart | 心脏统计图谱与计算建模 workshop |
| MICCAI | Medical Image Computing and Computer Assisted Intervention | 医学图像计算与计算机辅助干预会议 |
| IQA | Image Quality Assessment | 图像质量评估 |
| RCS | Robust Cardiac Segmentation | 鲁棒心脏分割 |
| CMR | Cardiac Magnetic Resonance | 心脏磁共振 |
| bSSFP | balanced Steady-State Free Precession | 平衡稳态自由进动 |
| TrueFISP | True Fast Imaging with Steady-State Precession | Siemens bSSFP 序列名 |
| SA | Short-Axis | 短轴 |
| ED/ES | End-Diastole / End-Systole | 舒张末期/收缩末期 |
| LV/MYO/RV | Left Ventricle / MYOcardium / Right Ventricle | 左心室/心肌/右心室 |
| DSC | Dice Similarity Coefficient | Dice 相似系数 |
| HD95 | 95th percentile Hausdorff Distance | 95 分位豪斯多夫距离 |
| TID | Team Identifier | 队伍标识符(A=Task1、S=Task2 前缀) |
| UON_IMA | University of Nottingham IMA | Task 1 冠军队(诺丁汉大学) |
| UA-SVCC | University of Alberta SVCC | Task 2 并列第一(阿尔伯塔大学) |
| Med-Air | — | Task 2 并列第一(伦敦国王学院背景队) |
| CMR.Love.LHND | — | Task 2 并列第二(香港中文大学背景队) |
| DTA | Data Transfer/Usage Agreement | 数据使用协议 |
| IRB | Institutional Review Board | 机构审查委员会(伦理) |
| MedIA | Medical Image Analysis | 总结论文期刊 |
| BIAS | Biomedical Image Analysis Challenges | 挑战赛报告规范 |
| M&Ms | Multi-Centre, Multi-Vendor & Multi-Disease Challenge | 相邻心脏分割挑战系列(非本条目) |
| MMS | Magnetospheric Multiscale | 磁层卫星任务(检索干扰项,与本题无关) |
(注:M&Ms-3 为本条目生产时被证伪的候选名——公开渠道无"第三季挑战"实证,检索遇此名请勿采信,详见 FACTS 档案第 9 节。)
附录 M:局限性与使用风险声明(数据卡配套)
- 外推风险:全部受试者为健康成人志愿者,任何在病理人群(心衰、肥厚、先心病、儿童)上的应用主张都需要额外验证数据支撑;
- 单机外推风险:仅 Siemens MAGNETOM Vida 3T 一台设备,对 GE/Philips/Canon 或低场机的迁移有效性未检验;
- 标签粒度风险:三级标签由 5 点 Likert 压缩而来,"中度"边界样本的标签噪声天然偏高——挑战结果(Kappa 0.631)已经量化了这种噪声的下游代价;
- 两帧制风险:ED/ES 之外的时相缺失,任何涉及心动周期连续性的结论(运动、血流)不可用本数据集支撑;
- 许可风险:官方条款为引用制研究使用,商业用途是否覆盖未明示——商用前联系官方(CMRxMotion@163.com)书面确认;
- 镜像风险:HuggingFace 等第三方镜像无官方维护承诺,生产系统禁止以镜像替代官方 Synapse 分发;
- 时效风险:测试基准的单次性意味着榜单已冻结——新方法需按论文协议自行复刻测试流程(含断网 Docker 约定)以保证可比性。
附录 N:生产过程存照(改道记录摘要)
本条目的生产起点是任务头分派的"M&Ms-3——Multi-Centre, Multi-Vendor & Multi-Disease 心脏 MR 分割挑战赛第三季"候选。按写手纪律包 §1,开工先做存在性核验,三轮以上精确搜索的全部通路与结果如下(详细版见 writing/cmrxmotion/ 同目录 FACTS.md 第 9 节):
| 核验通路 | 结果 |
|---|---|
| 官网 www.ub.edu/mnms-3 与 /mnms3 | 均 404;主站 /mnms/ 亦临时不可用(与库内 mms-2 FACTS 记录一致) |
| Wayback Machine CDX API | ub.edu/mnms-3* 无任何存档快照 |
| Zenodo(API + 站内搜索) | 无心脏领域 M&Ms-3 记录(仅磁层卫星 MMS 与昆虫翅脉 M-Ms3) |
| arXiv(API + 站内) | 无 M&Ms-3 / MnMs-3 心脏挑战记录 |
| MICCAI 2024 官方挑战(grand-challenge 博客,16 项) | 无 M&Ms-3 |
| MICCAI 2025 官方挑战全清单(conferences.miccai.org) | 无 M&Ms-3(心脏相关仅 CMRxRecon2025 等) |
| STACOM 2024 官方日程 | 无 M&Ms-3 |
| EMBC / ISBI / CinC 渠道 | 无 M&Ms-3 |
| 文献中 “M&Ms³” 字样 | 为第一季上标引用格式(MedIA 合成数据论文),描述与第一季完全一致 |
结论:M&Ms-3 无存在实证,任务头候选证伪。 按纪律包就地改道影像域备选:库内查重(url_name ILIKE '%cmrx%' 等)0 命中后定 CMRxMotion——与原任务同属心脏 MR 挑战赛生态(MICCAI/STACOM),且与 M&Ms 家族存在天然互链(官方文档互引),改道后开工三查重新执行(新锁 writing/cmrxmotion/.lock,时间戳 2026-09-27T00:25:48Z;自建的 mms-3/.lock 已清除;ps aux | grep -c “[c]odebuddy” = 4)。本条目全文按 CMRxMotion 实核事实书写,与被证伪候选无内容混入。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,核验时点 2026-09-27。事实陈述以挑战设计论文(arXiv:2210.06385)、总结论文(Medical Image Analysis 109:103883,DOI 10.1016/j.media.2025.103883)与官网 cmr.miccai.cloud 为源,复旦官方新闻、openmedlab、GitHub 组织、HuggingFace 镜像等六路佐证交叉。任务头原候选"M&Ms-3"经三轮以上核验证伪(官网 404、Wayback 无存档、Zenodo/arXiv 无记录、MICCAI 2024/2025 官方挑战清单均无此项),按纪律包就地改道影像域备选 CMRxMotion,查重 0 命中后成稿——证伪全过程存照于 FACTS.md 第 9 节。测试集规模、Task 2 冠军归属、Synapse ID、参与规模、MedIA 卷期等五处双口径已在附录 D 登记并按主口径书写。条目与库内 cmrxrecon(rid 506)、mms(rid 516)、mms-2(rid 682)、acdc 等 CMR 基准条目构成"病理-设备-行为-重建"四维互链面;互链由系统按调度自动挂载。
版本记录:v1.0(2026-09-27)——改道后首版成稿,五 part 拼接;十一坑、§1 十五问速览、51 问 FAQ、32 条硬事实、29 条术语、14 附录(A-N);触发点未触发。后续修订按主会话维护流程执行并在本节追加版本行。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- lvquant — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- emidec — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- myops — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- mm-whs — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- lascarqs — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- cmrxrecon — 共享标签:医学影像 / MRI / 心血管疾病 / 挑战赛数据集
- mms — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
- camus — 共享标签:医学影像 / 医学图像分割 / 心血管疾病 / 挑战赛数据集
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

