信息速览
INFOBOX — MyoPS 一屏速览
维度 内容 本质 MICCAI 挑战赛数据集家族:多序列 CMR 心肌病理分割(scar 瘢痕 + edema 水肿),“Myo”=心肌(myocardium)不是肌肉 组织方 复旦大学庄吓海(Xiahai Zhuang)组;两届主干:MyoPS 2020(MICCAI 2020 首届)+ CARE MyoPS++ 2024(MICCAI 2024 CARE track4) 三序列 bSSFP(C0,解剖边界)/ LGE(DE,钆延迟强化看瘢痕)/ T2-weighted(看水肿);MvMM 预对齐到公共空间 2020 数据 45 例急性心肌梗死(AMI)患者三序列配齐 = 25 训练(公开金标准)+ 20 测试(加密金标准);训练 306 个 2D 切片(102×3) 标签值 NIfTI 整数编码:scar=2221 / edema=1220 / normal=200 / LV pool=500 / RV pool=600(共 5 类勾画,比赛只评 scar+edema) 2024 数据 250 患者 / 7 中心(中法英)= 145 三序列 + 24 bSSFP+LGE + 81 仅 LGE;训练 200(中心 A,B,C,E,F,G)+ 验证/测试各 25(中心 D) 2024 升级 真实世界三大挑战:缺失序列、未对齐、多中心;发布对齐/未对齐两版;规则仅自动方法、禁预训练模型与外部数据 运营数字 2020:76 注册申请 / 65 队参赛 / 23 份测试提交 / 15 支算法入选公开基准;每队测试提交≤2 次;CMT 平台 基准结果 15 法平均 Dice scar 0.614 / edema 0.644;像素精度 scar 83.6% / edema 74.3%;冠军 UESTC scar 0.708 / edema 0.731 病理洞察 edema 大而连续易分(Dice 高);scar 斑块状、不规则难分;基底部/心尖部层面显著差于中层 金标准 三名独立受训观察者逐层勾画取平均;45 例全男性(45M/0F,56.2±7.92 岁)——偏倚存照 基准论文 arXiv:2201.03186(2022);4 篇必引:Zhuang 2019 TPAMI(MvMM)/ Li 2023 MedIA / Qiu 2023 MedIA(MyoPS-Net)/ Ding 2023 IEEE TMI 获取 2020 训练集官方页公开下载;测试金标准加密+评估工具箱随包发布(注册可下);CARE 2024 需注册+签 data agreement 库内互链 ACDC(rid 511)、M&Ms(516)、M&Ms-2(682)、EMIDEC(696)、CMRxRecon(506)、CMRxMotion(687)、CHAOS(337)等 14 条
MyoPS 是心脏影像分割里"换一个考题"的转折点数据集:此前的 ACDC、M&Ms 系列考的是"把心肌画出来"(结构分割),MyoPS 考的是"心肌里哪里坏了"(病理分割)——在 bSSFP、T2-weighted、LGE 三个磁共振序列上,同时定位急性心肌梗死后的水肿(edema)与瘢痕(scar)。单看任何一个序列这题都近乎无解:bSSFP 看不清病理、T2 与 LGE 又各有伪影,只有把三个序列的信息融合起来才可能做出可靠分割。这使它成为多模态医学图像融合分割的标准考题,也把"序列缺失、空间未对齐、多中心异质"这些真实世界的麻烦(CARE MyoPS++ 2024 的三大升级)第一次系统性地搬上了 MICCAI 舞台。
它的第二个身份同样重要:方法学的孵化器。围绕它诞生的 MvMM 理论(TPAMI 2019)、15 法公开基准(MedIA 2023)、官方 scribble 弱监督标注(2022-2023)、加密金标准自评模式,各自都被后续挑战赛反复借用。换句话说,MyoPS 对社区的价值一半在数据本身,一半在它示范的"挑战赛工程学"。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意 2020 测试金标准是加密的、自评靠官方工具箱;CARE 2024 要注册签协议。
- 关心标签怎么读:直奔 §4 任务与标注——标签值编码 2221/1220/200/500/600 是 NIfTI 整数标签值不是切片数,读错是最高频事故(坑 2)。
- 对标性能:直奔 §7 基准与评估——15 支算法的 Dice 分布与"edema 比 scar 好分"的结构性结论可直接引用。
一个定位提醒放在最前面:MyoPS 不是"更大的 ACDC"。ACDC(511) 型数据集的价值密度在"样本量×结构标签",MyoPS 的价值密度在"任务难度×标注协议×评测纪律"。如果你找的是结构分割练手数据,请直接用 ACDC;如果你要做的是多序列融合、病理分割、真实世界鲁棒性中的任何一个,MyoPS 是库内最对口的选择——这也是本条目把两届挑战当作一个演进故事来写的原因。
§0 导读:这个数据集解决什么问题
先看临床背景。急性心肌梗死(AMI)是全球头号死因,患者存活后的核心预后变量是"梗死范围"与"残余可挽救心肌"——前者决定射血分数的下限,后者决定再血管化与抗心衰治疗还能挽回多少。影像学界为这两个变量准备了两个序列:LGE-CMR 上延迟强化的区域对应瘢痕(不可逆坏死),T2-CMR 上高信号的区域对应水肿(可逆损伤,即 area at risk)。指南推荐二者联合使用,但临床实践仍以医生目测半定量(17 节段评分)为主——自动分割若要落地,必须同时处理三个序列各自的短板:bSSFP(steady-state free precession,稳态自由进动)对比度稳定、能画准心肌边界,但对病理不敏感;T2 加权对水肿敏感但信噪比低、易受血流伪影影响;LGE 对瘢痕敏感但需要造影剂、且会同时点亮血池,心肌边界反而模糊。
多序列融合的学术困难在于:三个序列的采集时间、空间对应、强度分布都不同,"融合"发生在什么层级(像素级早期融合、特征级中期融合、决策级后期融合)至今没有共识答案。MyoPS 把这个问题变成了一个可量化的公开竞赛:固定数据、固定切分、固定评测器,让全世界的融合方案在同一坐标系下比武——这正是 MICCAI 挑战赛制度对医学 AI 的核心贡献。
MyoPS 的方法论主张是:病理分割不可能在单一序列上做好,必须在多序列融合框架下完成。它的理论根基是庄吓海组 2019 年发表于 IEEE TPAMI 的 MvMM(Multimodal Varying Manifold Model,多模态变化流形模型)——一个把不同模态图像联合配准与分割统一起来的概率框架。MyoPS 2020 的所有训练与测试数据都预先用 MvMM 对齐到公共空间,把"配准"这个变量先固定下来,让参赛者专注"融合分割";到 2024 年的 CARE MyoPS++ 届,主办方反过来把对齐也撤掉——发布对齐与未对齐两版数据——让"多序列未对齐"成为考题本身的一部分。
对 AI-Ready 而言,MyoPS 的价值在三点:其一,它是心肌病理分割方向规模最大的公开标注资源(两届合计 295 例患者、标注覆盖 5 类结构);其二,它自带加密金标准+官方评估工具箱的自评闭环,训练-测试分离的纪律性在医学数据集中属第一梯队;其三,它的两届演进(2020 理想化条件 → 2024 真实世界条件)构成一条罕见的"从实验室到临床"的难度升级链,为评估算法的临床就绪度提供了天然的阶梯。
§0 读法三则:
- 本条目把 MyoPS 2020 与 CARE MyoPS++ 2024 当作一个数据集家族的两代主干来写;检索时若遇到"MyoPS 2022"字样,四轮核查未发现独立届次的直接证据(§9.4 与待核存照),请勿将其当作独立数据集引用。
- 全文数字以 2026-09-27 抓取的官方页与基准论文为准;"25 训练+20 测试"是修正后口径(早期网络流传的"45 训练"是错误的,坑 1)。
- 若你的任务是"心脏结构分割"而非"病理分割",本数据集的 LV/RV/normal 心肌标签可以拿来用,但要清楚官方评测从不含这三类(§4.3)。
§1 数据集速览:十问十答
Q1:MyoPS 到底是肌肉还是心肌?
心肌。MyoPS = Myocardial Pathology Segmentation(心肌病理分割),与骨骼肌(muscle)无关。任务简报里"肌肉 MRI 微结构挑战"是误称,已在 FACTS 档案双口径存照。如果你带着"肌肉"预期来用这批数据,会在第一眼看到心脏短轴环时就对不上号。词源上"Myo-"在医学语境里既可指肌(myo-metry 子宫肌层)也可指心肌(myo-cardium),但 MyoPS 的官方全称写明 myocardial——一切以全称为准,缩略词不背锅。
Q4:金标准怎么产生的?
三名独立受训观察者对每层逐层勾画 5 类结构(LV/RV 血池、normal 心肌、edema、scar),取平均作为金标准。标签以 NIfTI 整数值编码:scar=2221、edema=1220、normal myocardium=200、LV blood pool=500、RV blood pool=600。"取平均"而非"多数投票"意味着金标准边界是平滑的概率共识——它比单观察者边界更稳定,但也让"硬边界评估"的解读要留余量(§4.5)。
Q2:数据规模到底多大?
两届主干:MyoPS 2020 = 45 例 AMI 患者三序列配齐(25 例训练带公开金标准 + 20 例测试金标准加密);CARE MyoPS++ 2024 = 250 例患者、7 个中心(中法英),其中 145 例三序列配齐、24 例 bSSFP+LGE 双序列、81 例仅 LGE。两届合计 295 例患者。若把官方衍生的 scribble 标注口径(20/5/20)也算入生态,还有一整套弱监督切分可查(§4.4)——但注意它不是挑战赛口径,两套数字不可混用。
Q3:每个病例长什么样?
2020 届:每个病例 3 个 .nii.gz 短轴体数据(C0=bSSFP、DE=LGE、T2),每个序列 2-6 层、屏气采集、三序列同一心动周期完成;训练 25 例共 306 个 2D 切片(102 例×3 序列)。层厚 12-23 mm、层间距大——这是"稀疏堆叠切片"而非连续 3D 体。实用含义:一个"病例"在内存里其实是 3 个很薄的层堆,做 3D 卷积前先想清楚层间间隔(约 15 倍于面内分辨率)意味着什么。
Q4:金标准怎么产生的?
三名独立受训观察者对每层逐层勾画 5 类结构(LV/RV 血池、normal 心肌、edema、scar),取平均作为金标准。标签以 NIfTI 整数值编码:scar=2221、edema=1220、normal myocardium=200、LV blood pool=500、RV blood pool=600。
Q5:比赛评什么?
虽然勾画了 5 类,官方评测只聚焦心肌病理两类:scar 与 edema 的 Dice(部分场合报告 Jaccard/精确率/召回率)。LV、RV、normal 三类是"白送"的辅助标注,可用于结构分割预训练,但不计入比赛排名。这个"5 类勾画、2 类计分"的设计后来被多个病理分割挑战沿用:既保证掩码的解剖完备性,又把排名焦点锁定在科学问题上。
Q6:2024 届升级了什么?
三大真实世界化:序列缺失(250 例中 105 例不全配齐)、空间未对齐(发布对齐/未对齐两版,测试提交用对齐版)、多中心异质(7 中心,训练与验证/测试来自不同中心——中心 D 独占验证与测试各 25 例)。规则同时收紧:仅自动方法、禁外部数据、禁预训练模型。三条规则合起来的效果是:把 2020 届那些依赖"大数据预训练+人工后处理"的取巧路径全部封死,逼算法在 200 例真实世界数据上裸奔。
Q7:最好的方法做到多少分?
2020 届 15 支入选算法平均:scar Dice 0.614、edema Dice 0.644;像素精度 scar 83.6%、edema 74.3%。冠军 UESTC 队 scar 0.708 / edema 0.731。对照结构分割(ACDC 心肌 Dice 普遍 0.9+)可以感到病理分割的难度量级——同一颗心脏,"画出来"与"看出病"之间隔着 0.2 个 Dice 点。
Q8:为什么 edema 反而比 scar 好分?
基准论文的病理学解释:水肿区域大而连续、与正常心肌边界相对清楚;瘢痕呈斑块状、散在分布、边界不规则,且部分瘢痕在非 LGE 序列上几乎不可见。基底部与心尖部层面的表现系统性差于中层——这些层面心肌薄、部分容积效应强。临床含义正好相反:越难分的 scar 恰恰是预后最关键的变量——模型最需要精确的地方正是它最弱的地方,这是把 MyoPS 用于真实报告前必须正视的落差。
Q9:我现在能拿到什么?
2020 届:训练 25 例+金标准官方页公开下载;测试 20 例图像公开、金标准加密发布(*_gdencrypt.nii.gz)配官方评估工具箱(MyoPS2020_EvaluateByYourself),注册后可下载自评。CARE 2024 届:注册+评估平台获取,需签 data agreement。三句话总结获取策略:训练开箱即用、测试自评闭环、2024 走协议流程——三条路径的门槛依次升高,但可复现性纪律也依次增强。
Q10:它对 AI-Ready 的启示是什么?
MyoPS 展示了"挑战赛式 AI-Ready"的标准动作:固定切分+公开训练标签+加密测试标签+官方评估器,让任何人在不接触测试金标准的情况下复现榜单。同时它也示范了标签值编码、稀疏切片、多版本(对齐/未对齐)发布等工程细节——每一条都在本条目的避坑清单里有对应说明。对照库内 DAIMS 评估(附录 B),它的短板在可获取性(6/10)与许可透明度,长板在工程纪律与评估闭环——这个组合本身就是"AI-Ready 不等于 open license"的最佳教案。
§2 数据构成与规格
2.1 MyoPS 2020:45 例的理想化 cohort
MyoPS 2020 的数据来自复旦大学附属中山医院连续采集的 45 例急性心肌梗死患者,论文口径为"directly collected from the clinic without any selection"——没有按梗死范围、年龄或影像质量做选择,是常规临床工作流里自然流出的连续样本。全部 45 例在同一心动周期内完成 bSSFP、T2-weighted、LGE 三个序列的短轴屏气采集,覆盖左心室从基底到心尖。
切分口径(修正后):
| 子集 | 例数 | 序列 | 金标准 | 发布形态 |
|---|---|---|---|---|
| 训练集 | 25 | C0 + T2 + DE 三序列配齐 | 公开(train25_myops_gd) | 官方页直接下载 |
| 测试集 | 20 | C0 + T2 + DE 三序列配齐 | 加密(*_gdencrypt.nii.gz) | 图像公开,金标准随评估工具箱发布 |
| 合计 | 45 | — | — | — |
早期网络资料曾流传"45 例训练+20 例测试"的说法——这是把总数 45 当成了训练数。45=25+20 才是正确口径,openmedlab 文档、基准论文(arXiv 2302.03537)与 MDPI 引文三方互证(坑 1 详述)。
采集协议层面还有两个对使用者重要的细节:其一,屏气采集——每层都是在患者屏气时获取的,层间无呼吸位移,但屏气时长限制了每次能覆盖的层数(这是 2-6 层的临床原因,不是故意偷工);其二,三序列同一心动周期——C0、T2、DE 在同一心动周期内先后完成,把心跳相位差也控制住了。这两个协议细节合起来意味着:官方预对齐版里三序列的对应关系是"采集时物理对齐+MvMM 数学对齐"的双重保障,配准误差被压到了本数据集设计的最低点——这也是 2020 届分数可作为"融合算法纯净对照"的原因。
训练 25 例共 306 个 2D 切片:每例每序列 2-6 层短轴,102 例 × 3 序列 = 306。这个"2D 切片堆叠"的体量意味着它远小于连续 3D 心脏 MRI(如 ACDC 每例 28-40 层),做 3D 卷积前必须先想清楚层间间隔(12-23 mm)意味着什么——相邻层之间隔着一大段没采样的心肌。
2.2 体数据规格:稀疏短轴的几何事实
官方公布的体数据统计(基于训练 25 例三序列):
| 统计量 | spacing(mm,x/y/z) |
|---|---|
| 最小 | 0.73 × 0.73 × 12 |
| 中位 | 0.73 × 0.73 × 14 |
| 最大 | 0.76 × 0.76 × 23 |
面内分辨率均匀且高(约 0.75×0.75 mm,MDPI 引文口径),层厚 12-23 mm 且层间距大——典型的临床短轴扫描协议。体数据尺寸从 408×392×2 到 512×511×6 不等:z 轴只有 2-6 层。三条使用含义:
- 2D 方法是主战场:306 个 2D 切片的训练量对 2D U-Net 变体刚好够用;2020 届 15 支入选算法全部以 2D 或 2.5D 为主干。
- 3D 方法先天吃亏:z 向感受野没有意义(2-6 层、层间距 15 倍于面内分辨率),伪 3D 只会引入插值伪影。
- 切片数≠样本数:统计"训练样本量"时要么说 25 例(患者级),要么说 306 切片(切片级),不要混用——跨数据集对比时尤其如此。
补充一个容易被忽略的几何事实:层间距大意味着相邻切片之间可能隔着整段未采样的心肌——基底或心尖区域的相邻两层,中间的病理变化完全没被观测。这对两类工作有直接影响:做逐例体积定量时,体积是"由稀疏层面估计"的(26.1/18.89 cm³ 的中位数是这种估计的产物),不是连续积分;做层间插值可视化时,展示的是几何插值而非真实解剖——两种场合都应在产出物里注明"稀疏采样估计"。
2.3 CARE MyoPS++ 2024:250 例的真实世界 cohort
2024 届(CARE MyoPS++ track4)把规模扩到 250 例患者、横跨中国、法国、英国的 7 个中心,并刻意保留了临床数据的"不完美":
| 中心 | 例数 | 序列配置 | 角色 |
|---|---|---|---|
| A | 81 | 仅 LGE | 训练 |
| B | 50 | 三序列 | 训练 |
| C | 45 | 三序列 | 训练 |
| E | 7 | 三序列 | 训练 |
| F | 9 | 三序列 | 训练 |
| G | 8 | 三序列 | 训练 |
| D | 50 | 三序列 | 验证 25 + 测试 25,不参与训练 |
| 合计 | 250 | 145 三序列 + 24 bSSFP+LGE + 81 仅 LGE | — |
序列构成:145 例三序列配齐 + 24 例 bSSFP+LGE 双序列 + 81 例仅 LGE = 250 例,即 105 例(42%)存在序列缺失。这个设计直接模拟了真实临床里"T2 序列质量差/没扫"的普遍情形——单序列 LGE 分割从"配角"变成"必答题"。
中心分布设计有一个值得注意的不对称:训练用的中心 A 恰好是"仅 LGE"的 81 例独占者,而验证/测试的中心 D 是三序列配齐——主办方用这种划分强制考察"从缺序列训练域到全序列测试域"的泛化。预处理规则:LGE 与 T2 统一取舒张末期帧(避免收缩期心肌厚度变化干扰跨序列对应);发布 MvMM 预对齐版与未对齐原始版两套,官方测试提交以对齐版为准。
从实验设计角度再读一遍 7 中心分配(A=81/B=50/C=45/D=50/E=7/F=9/G=8):训练中心规模高度不均衡(E/F/G 三中心合计仅 24 例),这是"多中心数据天然不均衡"的忠实呈现而非设计失误——真实临床网络里就是有大中心与小医院。对使用者的含义:做跨中心实验时按中心分层评估(每个中心单独报分),别只报训练/测试总分——中心级分数的方差本身就是一个值得报告的发现点。
文件命名:[PatientID]_LGE.nii.gz / [PatientID]_T2.nii.gz / [PatientID]_C0.nii.gz + 金标准 [PatientID]_gd.nii.gz——与 2020 届的 myops_train_XXX_C0/DE/T2、myops_test_201-220 编号体系不同,跨届写脚本时不要复用解析逻辑。
2.6 文件命名全景与解析要点
两届命名体系放在一起看:
| 届次 | 图像 | 金标准 | 编号规则 |
|---|---|---|---|
| MyoPS 2020 训练 | myops_train_XXX_C0 / _DE / _T2.nii.gz | myops_train_XXX_gd.nii.gz | XXX 为训练编号 |
| MyoPS 2020 测试 | myops_test_201-220_C0 / _DE / _T2.nii.gz | myops_test_201_gdencrypt.nii.gz(加密) | 201-220 连续编号 |
| CARE 2024 | [PatientID]_C0 / _LGE / _T2.nii.gz | [PatientID]_gd.nii.gz | 中心相关 PatientID |
三条解析要点:其一,2020 届用 DE 代指 LGE(delayed enhancement 的缩写),CARE 届直接用 LGE——读代码/论文时注意这是同一序列的两种叫法;其二,金标准只对训练集明文发布(train25_myops_gd),测试集是 _gdencrypt 后缀,命名后缀本身就是"这个掩码能不能直接读"的判别器;其三,PatientID 在 2024 届可能携带中心信息线索,但不要依赖文件名推断中心归属——官方元数据才是权威来源。
2.4 人口学与偏倚
基准论文(arXiv 2302.03537)Table I 披露 2020 届队列:45 例,年龄 56.2±7.92 岁,45 男 / 0 女——全部为男性。全男性队列在 2020 年的心脏 AI 数据集里并非孤例(ACDC 等也有明显性别不均),但"零女性"意味着:任何以 MyoPS 2020 训练的模型,其对女性患者心脏(平均心腔更小、心率与体型分布不同)的表现完全没有数据支撑。CARE 2024 未在官网披露完整人口学表——使用时把性别泛化问题列入限制声明是稳妥做法。
年龄与临床背景同样值得注意:56.2±7.92 岁是典型的 AMI 高发年龄段(标准差小,队列年龄集中),几乎全部为经典冠心病患者。这意味着用 MyoPS 训练的病理分割模型,面对非典型病因(心肌炎、结节病、肥厚型心肌病继发纤维化)时的表现没有数据支撑——LGE 上这些疾病也会有强化,但分布模式与缺血性瘢痕(冠状动脉供血区分布)不同。引用时把"缺血性病理分割"写准确,不要泛化为"心肌病分割"。
给数据集卡片作者的一个模板化建议:偏倚披露至少写四行——性别(45M/0F)、年龄带(56.2±7.92 岁)、病因(缺血性 AMI 单病因)、地域/设备(单中心 2020 届/七中心 2024 届)。四行写全,下游使用者就能自行判断"我的场景离训练分布有多远"——偏倚披露的目的不是免责,是让下游能做出知情的部署决策。
2.5 与相邻心脏数据集的规格对照
把 MyoPS 2020 放进库内心脏 MRI 数据集的规格坐标系,能看清它的生态位:
| 条目 | 例数 | 序列/模态 | 标签 | z 向层数 | 任务 |
|---|---|---|---|---|---|
| MyoPS 2020 | 45(25+20) | bSSFP+T2+LGE 三序列 | 5 类(病理计分) | 2-6(稀疏) | 病理分割 |
| ACDC(rid 511) | 100 | cine bSSFP | RV/Myo/LV 3 类 | 28-40(连续) | 结构分割+分组 |
| M&Ms(rid 516) | 345 | 多厂商 cine | 3 类结构 | 连续 | 多中心结构分割 |
| MSCMRseg | 45 | LGE 为主 | 3 类结构 | 稀疏 | 结构分割 |
| EMIDEC(rid 696) | 100 | LGE | 梗死相关类 | 连续 | 梗死表征分割 |
三条对照结论:其一,MyoPS 是唯一把"病理"写进金标准的 2020 年前心脏挑战数据集(EMIDEC 与它最近但单序列);其二,它的 z 向层数最稀薄,2D 方法主导有几何必然性;其三,它的例数最小,靠"任务难度+官方自评闭环"而非规模取胜——这三个特征合起来解释了它在方法学论文里"小而关键"的引用地位。
§3 多序列原理与 MvMM:为什么必须三个序列一起看
3.1 三序列的分工与互补
三个序列看的是同一颗心脏的三个侧面:
| 序列 | 官方代号 | 看什么 | 强项 | 弱点 |
|---|---|---|---|---|
| bSSFP(balanced SSFP) | C0 | 解剖结构 | 血池-心肌对比度高、边界清晰、无造影剂 | 对病理(水肿/瘢痕)几乎不敏感 |
| T2-weighted | T2 | 心肌水肿 | 水肿组织 T2 信号升高,可圈定"风险区"(area at risk) | 信噪比低、血流伪影、运动敏感 |
| LGE(late gadolinium enhancement) | DE | 心肌瘢痕/坏死 | 瘢痕组织钆剂滞留呈高信号,瘢痕定量金标准 | 需造影剂;血池同样高信号,心内膜边界模糊 |
单序列解题的困境在基准论文里被定量呈现:仅用 bSSFP 时模型根本"看不见"病理区域,仅用 T2 或 LGE 时伪影与血池干扰导致边界系统性漂移。这也是为什么 MyoPS 官方把"多序列融合"写进数据集名称——这不是加分项,是解题的必要条件。
给不熟悉心脏 MRI 的读者一个直观的联合阅读方式:拿到一例数据,先看 C0 环——它是"地图",告诉你心室腔在哪、心肌壁多厚;再把 T2 环叠上来——心肌壁里发亮的部分是水肿,是"正在受伤"的心肌;最后叠 LGE 环——心肌壁里持续发亮的部分是瘢痕,是"已经死掉"的心肌。理想的算法输出就是把这层视觉推理自动化:以 C0 的边界为骨架、T2 与 LGE 的信号异常为内容,共同决定每个心肌像素的病理状态。值得一提的细节是 LGE 的"血池也亮":LGE 期血池信号同样高,若算法不先解决"哪是血池哪是心内膜下心肌",瘢痕(好发于心内膜下)就会被血池淹没——这是两阶段流水线(先 C0 定位再分割病理)在 15 法中成为主流的另一个原因。
3.2 MvMM 预对齐:把配准变量先固定
庄吓海组的 MvMM(Multimodal Varying Manifold Model,IEEE TPAMI 2019, 41(12):2933-2946)是一个联合建模多模态图像配准与分割的概率框架:它把不同模态视为同一底层解剖流形在不同"视角"下的投影,从而在不需要逐对配准的情况下建立跨模态体素对应。MyoPS 2020 与 CARE 2024 的对齐版数据都由 MvMM(或其后续实现)预对齐到公共空间。
这一设计决定了数据集的性质:在预对齐版上,跨序列的体素级对应是可靠的,逐体素融合方法(早期融合、跨注意力、跨序列跳跃连接)可以直接用。2024 届同时发布未对齐版,把"如何在不完美对齐下融合"留给了算法——这是两届之间最本质的考题升级。
MvMM 的建模直觉值得多给两句:传统做法是"先配准后融合"两步走,配准误差会单向传导进融合结果;MvMM 把配准与分割放进同一个概率图模型,让两者互相约束——分割的不确定性反过来修正配准估计。对使用者的实际含义:官方对齐版的体素对应质量高于一般"注册后配准"流水线的产物,所以跨序列方法可以放心假设"同一坐标的心肌就是同一块心肌"——这个假设在自配准的多序列数据上通常要先验证再用。
3.3 相邻任务辨析:MSCMRseg 与 MyoPS-Net
检索"MyoPS"时最容易撞上的两个近亲:
- MSCMRseg(MICCAI 2018/2019,同属庄吓海组):45 例 LGE+bSSFP+T2,但任务是心脏结构分割(LV/RV/ myocardium 三类),不含病理标签。它与 MyoPS 2020 的 45 例在数量上恰好相同(都是 45),网络资料经常把两者混为一谈——这是两个不同的挑战赛、不同的金标准、不同的标签体系。
- MyoPS-Net(Qiu 等,Medical Image Analysis 2023, 84:102694):这是方法论文而非挑战赛,作者组额外构建了 50 对五序列(含 T1 mapping 等)私有数据集。引用"50 例"时注意它不是公开挑战赛数据。
补充一个时间线辨析技巧:MSCMRseg 的论文与数据页常以"bSSFP/T2/LGE 多序列心脏分割"自我描述,与 MyoPS 的描述字面高度相似——辨析不能靠关键词,只能靠任务与标签两个硬指标(考什么、金标准里有几类、有没有病理标签)。本条目 §9.4 把这条判据压缩成了一句话版。
3.4 序列缺失:CARE 2024 把"完美假设"撤掉之后
2020 届有个隐含假设:所有病例三序列配齐。临床现实是 T2 序列因信噪比低、采集耗时经常被砍掉,LGE 则因造影剂流程标准化程度高而几乎必有。CARE 2024 的 105 例(42%)缺序列病例正是对这一现实的忠实记录。
缺序列设定下算法界有三种应对范式,各自的数据集含义不同:
- 序列丢弃/模态 dropout:训练时随机置零某序列通道,强迫网络学到"任何子集都可用"的表征。对应本数据集的使用姿势:在 145 例三序列训练样本上模拟缺失,用 81 例仅 LGE 与 24 例双序列做自然分布校验。
- 模态蒸馏/知识迁移:以全序列教师模型指导缺序列学生模型。对应姿势:教师用三序列子集训练,学生在仅 LGE 中心 A 的 81 例上蒸馏。
- 单序列专精:干脆只训 LGE 单序列模型,承认 T2 缺失的普遍性。2020 届 15 法里已有个别队伍报告了"仅 LGE 输入"的消融,分数显著低于三序列版本——这本身就是"多序列必要性"的定量注脚。
CARE 2024 用中心划分把第 1、2 种范式变成必答题:训练域里 81 例仅 LGE(中心 A)与全序列样本混在一起,而测试域(中心 D)三序列配齐——模型必须学会"用什么训什么、缺了也能上",这正是真实世界部署的核心难题。
3.5 CMR 序列物理原理速成(面向算法工程师)
不需要成为放射科医生,但需要理解信号从哪来。三个序列的对比度机制一张表说清:
| 序列 | 对比度机制 | 组织信号逻辑 | 对分割的直接含义 |
|---|---|---|---|
| bSSFP(C0) | 平衡梯度回波,信号∝T2/T1 比 | 血池最亮(血液 T2/T1 高)、心肌中等、脂肪较亮 | 心内膜/心外膜边界最可靠;病理与正常心肌同灰度 |
| T2-weighted | T2 加权自旋回波类 | 水含量越高信号越强(水肿 T2 值延长) | 水肿亮但 SNR 低;慢血流在心腔内也"亮"——假阳性重灾区 |
| LGE(DE) | 钆造影剂延迟采集,细胞外间隙越大信号越强 | 瘢痕(细胞外间隙扩大)亮;正常心肌暗;血池也亮 | 瘢痕亮但心内膜边界被血池"淹没" |
由此可推出三个工程上重要的推论:其一,C0 是唯一"自洽"的序列(边界与结构可独立从 C0 读出),T2/LGE 必须借助 C0 的几何参照——这是所有两阶段方法把 C0 用在第一阶段的信息论原因;其二,T2 与 LGE 的"亮"不可直接比强度(不同物理来源),跨序列强度归一化要独立做;其三,水肿(T2 亮)与瘢痕(LGE 亮)在各自序列上的假阳性来源不同(慢血流 vs 血池),数据增强与伪影模拟应针对序列分别设计——统一扔高斯噪声是对这两个序列物理的误解。
§4 任务定义与标注体系
4.1 五类结构的勾画范围
金标准覆盖左心室截面的 5 类结构(NIfTI 整数标签值编码):
| 标签值 | 结构 | 评测角色 |
|---|---|---|
| 200 | normal myocardium(正常心肌) | 不计入比赛评测 |
| 500 | LV blood pool(左心室血池) | 不计入比赛评测 |
| 600 | RV blood pool(右心室血池) | 不计入比赛评测 |
| 1220 | edema(心肌水肿) | 官方评测对象 |
| 2221 | scar(心肌瘢痕) | 官方评测对象 |
勾画口径:观察者对每个短轴层面的 LV 心肌区域判定三种状态(正常/水肿/瘢痕),水肿与瘢痕按信号强度逐像素勾画;血池与正常心肌补全整个截面。训练 25 例的金标准由三名独立受训观察者逐层勾画取平均——注意"取平均"的实现方式:多观察者概率图取阈值化的平均结果,而非多数投票,这意味着金标准边界天然带有平滑,硬边界与单观察者金标准的数据集(如 ACDC)不完全可比。
勾画的解剖学范围还有一个隐含约定值得点明:病理标签只勾在左心室心肌上——右心室心肌的水肿/瘢痕不在勾画范围内(RV 区域仅标血池)。因此"MyoPS 是左心室病理分割数据集",若你的研究问题涉及右心室病理(致心律失常性右室心肌病等),这批数据不适用。
4.2 标签值编码的使用规范
直接读 .nii.gz 掩码时最常见的翻车是用"类别索引"的方式处理"标签值":掩码里的整数是 200/500/600/1220/2221 的字面值,不是 0/1/2/3/4 的索引。正确的读取姿势:
import nibabel as nib
import numpy as np
gd = nib.load("train25_myops_gd/myops_train_001_gd.nii.gz").get_fdata()
# 标签值编码(不是 0-4 索引!)
LABEL_MAP = {200: 0, 500: 1, 600: 2, 1220: 3, 2221: 4}
label = np.zeros_like(gd, dtype=np.uint8)
for val, idx in LABEL_MAP.items():
label[np.isclose(gd, val)] = idx
# 比赛只评 idx 3(edema)与 idx 4(scar)
背景(未标注区域)取 0。若直接 label = (gd == i) 遍历 i=0…4,只会得到全空掩码——这是本数据集最高频的使用事故(坑 2)。
入库前建议对每个掩码做一次值域断言(assert),把三类异常挡在训练循环外:值域外的"脏值"(浮点尾差用 isclose 吸收后仍存在的)、5 类全无的空掩码(说明文件配错)、体数据与掩码 shape 不一致(几何配错)。三个断言写进数据加载器只要五行代码,却能消灭事后排查一晚上的事故。
4.3 评测口径:只看 scar 与 edema
官方评测对每个测试切片计算 scar 与 edema 的 Dice 系数(部分年份报告 Jaccard、precision、recall),对 20 例测试的全部层面取平均。三个口径细节:
- 逐层计算再平均:由于体数据是稀疏堆叠切片,Dice 按切片算再对切片平均——空切片(无病理区域)的处理规则以官方评估工具箱实现为准,自行实现时务必对齐工具箱口径。
- LV/RV/normal 不参与排名:但金标准里有,可以拿来预训练结构分割头。
- CARE 2024 指标扩展:DSC/PRE/SEN/SPE 四指标,且要求提交"仅自动方法"的全流程输出。
为什么"逐层平均"值得单独强调:病理在层间的分布不均匀(中层病理多、基底/心尖少),逐层平均会让病理少的层面与病理多的层面权重相同——这与按体素平均的 3D 评测口径结果不同。跨论文比较分数时,"逐层平均 vs 逐体素平均"是继"标签解码"之后的第二大口径陷阱,两套口径的分数可以差好几个点位。
4.4 衍生标注:scribble 稀释标注线
庄吓海组后续发布了 MyoPS 训练集的 scribble 稀释标注版本(Zhang & Zhuang 2022a/2023):把逐像素金标准稀释成少量线条笔触,用于弱监督分割研究。MedCL(arXiv 2503.22890)披露社区常用的 scribble 切分为 20/5/20(20 训练/5 验证/20 测试)。若你在文献里看到"MyoPS 20 例训练"的弱监督口径,那是 scribble 子集切分,不是挑战赛 25 例口径——两套口径不可互换(坑 5)。
scribble 线存在的深层意义值得点破:它是对"病理分割金标准太贵"这一根本约束的工程回应(§8.2)。逐像素勾画水肿/瘢痕需要序列专业知识与大量时间,而线条笔触把标注成本压低一个量级——代价是监督信号从"每个像素有标签"降级为"每条线附近有标签",弱监督算法要在两者之间"脑补"。这个方向的方法论文密度高,正好说明"降标注成本"是社区公认的痛点;使用 scribble 数据时同样先确认许可与获取渠道(衍生标注的发布方式以原论文/代码库说明为准)。
4.5 金标准的可信度边界
基准论文坦承了两点不确定性:其一,观察者间变异高——尤其瘢痕呈斑块状散在分布时,不同观察者对"这一小块算不算瘢痕"的分歧显著;其二,模型的不确定性与人的不一致性高度相关——模型最犹豫的像素恰好也是专家分歧最大的像素。使用含义:MyoPS 的金标准是"平均专家意见"而非"客观真值",评估分数的解读应保留至少 1-2 个 Dice 点位的方法学余量,不要把 0.708 vs 0.695 的差异当作决定性证据。
4.6 与单观察者金标准数据集的可比性
把 MyoPS 的"三观察者取平均"金标准与库内常见金标准范式并排,能看到标注协议如何塑造分数的可比性:
| 数据集 | 标注协议 | 对分数的影响 |
|---|---|---|
| MyoPS | 三名受训观察者逐层勾画取平均 | 边界平滑,跨方法方差小;与单观察者数据集分数不直接可比 |
| ACDC(rid 511) | 单一专家标注 | 边界锐利但携带单人风格 |
| M&Ms(rid 516) | 单一专家+多厂商复核 | 同上+厂商差异 |
| M&Ms-2(rid 682) | 专家标注+复核 | 类似 |
两条实用规则:其一,把 MyoPS 的分数与 ACDC 系结构分割分数并排时,永远加脚注"任务与标注协议不同,分数不可直接比较";其二,若你的方法在 MyoPS 上做观察者鲁棒性分析(如对三个观察者版本分别评估),注意公开的金标准只有"平均版",个体观察者版本未随挑战赛发布——需要时应联系组织方。
4.7 金标准质量抽查 SOP(数据到手第一小时)
25 个训练掩码到手后、写任何训练代码之前,跑一遍这五步抽查(全部可在 notebook 里完成):
- 值域断言:逐例
np.unique,断言值域 ⊆ {0,200,500,600,1220,2221}。任何表外值立即停——先解决文件配对问题再往下走。 - 几何一致性:逐例对比掩码与三序列图像的 shape/affine,断言完全一致。不一致说明下载包损坏或版本混用。
- 病理存在性统计:统计每例 scar/edema 体素占比,画出 25 例分布。两件事要看出:有没有完全没有 scar 的病例(AMI 患者出现无瘢痕是可疑信号,需核对);有没有病理占比异常高的离群例(可能是勾画范围特大的教学病例)。
- 逐层连续性目检:抽 3 例,把掩码叠在 C0 上逐层动画/并排显示,肉眼确认心肌环内色块贴壁、无漂浮斑块。这一步抓"掩码与图像错位"比任何脚本都快。
- 标签值频谱:统计全数据集各标签值的体素频数直方图。normal(200) 应占心肌内大头,scar(2221) 通常最少——若频谱倒挂,你的解码或文件配对有问题。
五步通过再进入建模。这 25 例是你唯一的明文监督,它们的任何问题都会原样传给模型——第一小时的抽查是对整个项目性价比最高的投资。
§5 两届挑战赛运营:数字与流程
5.1 MyoPS 2020:报名到榜单
2020 届在 MICCAI 2020 年会框架下举办,官网挂靠 zmic.org.cn(庄吓海组的 MICCAI 挑战门户),配套页面在复旦 sdspeople 服务器。运营硬数字:
| 环节 | 数字 |
|---|---|
| 注册申请 | 76 份 |
| 正式参赛队伍 | 65 队 |
| 测试阶段提交 | 23 份 |
| 入选公开基准 | 15 支算法 |
| 每队测试提交上限 | 2 次 |
| 提交平台 | CMT |
流程:注册需签署 data agreement(数据使用协议),通过后获得训练集下载权限;测试阶段开放后,队伍对 20 例加密图像推理,把分割结果按规范打包上传 CMT,官方用加密金标准在线评分。23 份提交中 15 份提交了符合 LNCS 格式要求的方法说明论文并入选基准——也就是说,公开基准不是"全部提交的排名",而是"愿意写方法论文并通过完整性检查的子集",引用榜单时应说"15 支入选算法"而非"全部参赛方法"。
76→65→23→15 的漏斗还有一层解读价值:从 65 支正式参赛到 23 份测试提交,流失了 65%——这在 MICCAI 挑战里是常态(多数队伍倒在"训练分数不错、测试泛化崩塌"或纯粹时间不够),它提醒我们榜单覆盖的是"坚持到最后的强队伍"生态,而非全体参与者的水平分布。做挑战赛生态研究时,这组漏斗数字本身就是素材。
5.2 CARE MyoPS++ 2024:时间线与规则收紧
CARE(Comprehensive Application-oriented Challenge on Real-world data)是 MICCAI 2024 下的挑战品牌,MyoPS++ 为其 track4,官网 zmic.org.cn/care_2024/track4/(http 协议)。关键时间线:
- 2024-05-10:训练数据发布
- 2024-10-10:workshop(MICCAI 2024 框架内)
规则三大收紧(对照 2020 届):
- 仅自动方法:禁止任何人工交互/半自动修正,全流程端到端。
- 禁外部数据:不许用任何额外的心脏影像数据做训练。
- 禁预训练模型:连 ImageNet/模型库权重也不许加载——这条在 2024 年的 MICCAI 挑战里相当激进,等于逼参赛者从零训练,直接考验"小数据+多中心"下的算法设计功力。
“禁预训练"的立规逻辑值得琢磨:2020-2024 间心脏 AI 社区的真实水平已被大规模预训练大幅抬高,若放开预训练,榜单将变成"谁的底座模型强"而非"谁的算法设计好”——这与 CARE 品牌"考察真实世界算法能力"的立意相悖。禁令把比较拉回同一起跑线。代价是参与门槛对没有从零训练经验的团队变高了——规则从来不是中立的,它选择它想要的参赛者画像。
指标扩展为 DSC/PRE/SEN/SPE 四件套;联系渠道为 dingwangbin@fjmu.edu.cn(福建医科大学)与两个复旦邮箱(21110980009@m.fudan.edu.cn、zhangyang23@m.fudan.edu.cn)。
5.3 资金与伦理
基准论文致谢披露的资助:国家自然科学基金 61971142 / 62111530195 / 62011540404 与上海市人才发展基金 2020015。伦理方面,CARE 2024 官网声明各参与中心均获伦理批准并完成匿名化;2020 届数据"directly collected from the clinic"的表述意味着其伦理框架依托中山医院常规临床采集授权。使用数据发表论文时,引用基准论文并在伦理声明中说明"数据经原作者挑战赛协议获取"是标准姿势。
伦理与合规还有一个容易漏掉的角落:二次分析中的受试者保护。虽然数据已匿名化,但 45 例这样小的队列配合年龄(56.2±7.92 岁)、性别(全男性)、病因(AMI)的组合信息,理论上存在再识别风险的累积。因此:不要在论文/演示里展示可拼接身份的元数据组合;可视化时优先用合成示例或已公开的展示用例;涉及图像的公开材料走组织方的发布许可流程(若 data agreement 有此条款)。
5.4 两届规则全景对照
把两届的运营与规则要素并排,"真实世界化"的具体含义一目了然:
| 要素 | MyoPS 2020 | CARE MyoPS++ 2024 |
|---|---|---|
| 所属框架 | MICCAI 2020 挑战 | MICCAI 2024 CARE track4 |
| 病例规模 | 45 例(25 训练+20 测试) | 250 例(200 训练+25 验证+25 测试) |
| 中心数 | 1(复旦中山) | 7(中法英) |
| 序列完整性 | 三序列全配齐 | 145 三序列+24 双序列+81 仅 LGE |
| 空间对齐 | MvMM 全部预对齐 | 对齐/未对齐双版发布 |
| 提交规则 | 每队测试≤2 次 | 仅自动方法全流程 |
| 外部数据 | 未明确禁止 | 禁止 |
| 预训练模型 | 未明确禁止 | 禁止 |
| 评测指标 | Dice(scar/edema) | DSC/PRE/SEN/SPE |
| 测试真值 | 加密发布+自评工具箱 | 官方平台在线评测 |
| 提交平台 | CMT | 官方评估平台 |
| 金标准口径 | 三观察者取平均 | 官方标注(取平均协议延续) |
对照表的使用方式:写论文的"数据集对比"表、做方法选型(2020 届结论还能不能迁移到 2024 届)、评估自己的方法"在旧规则下的成绩有多少水分"(2020 届没禁预训练——若你的 2020 届方法加载了 ImageNet 权重,直接搬到 CARE 2024 规则下就不合规了)。
5.5 时代坐标:MyoPS 在 MICCAI 挑战生态里的位置
把 MyoPS 放回 MICCAI 挑战赛的时间轴,能看到医学影像挑战主题的演进逻辑:2018 年前后以结构分割为主(ACDC 2017、MSCMRseg 2018),2020 年开始"任务升级"——从画结构到看病理(MyoPS 2020)、从单中心到多中心(M&Ms 2020);2024 年的 CARE 品牌则把"真实世界"制度化(real-world data 直接写进品牌名)。MyoPS 恰好站在两次演进的交汇点:它既是最早的病理分割挑战之一,又是真实世界化的先行者。
这个位置的解释力:为什么方法学界对 MyoPS 的持续关注超过其样本量应有的热度——因为它两次踩在社区的转折点上,围绕它的方法论文(MvMM、MyoPS-Net、弱监督系列、MedCL)构成了一条完整的"多模态分割方法论"引用链。对研究者而言,顺着这条链做 related work 比泛搜"cardiac segmentation"高效得多。
§6 获取与许可:三道门怎么进
6.1 门 1:MyoPS 2020 训练集(公开直链)
训练 25 例三序列 + 金标准(train25_myops_gd)在官方页(zmic.org.cn 的 MyoPS 2020 页面 / sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/)提供直接下载,无需注册。下载包结构:
MyoPS2020/
├── test20/ # 20 例测试图像(C0/DE/T2)
├── train25/ # 25 例训练图像(C0/DE/T2)
├── train25_myops_gd/ # 训练金标准(公开)
└── MyoPS2020_EvaluateByYourself/ # 自评工具包
├── 评估脚本 + 加密测试金标准
└── myops_test_201_gdencrypt.nii.gz 等
测试图像与训练图像一样公开可下——能拿到的是测试图像,不是测试金标准本体。金标准以加密 .nii.gz 发布,解密密钥掌握在组织方手中;参赛者自评时运行评估工具箱,工具箱在本地完成评分但不暴露逐像素真值。
首次打开数据的验证顺序建议:先 ls 四个目录核对文件数(train25 应有 25 组×3 序列、test20 应有 20 组×3 序列、gd 目录 25 个掩码),再抽查一例的 np.unique 值域(应为 {0,200,500,600,1220,2221}),最后跑一次官方评估脚本的 dry-run(用训练掩码替代测试输出验证脚本可执行)——三步通过再开始写训练代码,能把大多数环境问题前置消解。
6.2 门 2:MyoPS 2020 测试自评(评估工具箱)
MyoPS2020_EvaluateByYourself 是这个数据集工程上最值得学习的设计:官方同时发布评估脚本与加密金标准,参赛者可以在自己的机器上重复榜单计算——既保住了测试标签的保密性,又保住了可复现性。学术用途获取测试金标准密钥需联系组织方。评估工具箱另有独立直链:sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/test_image_evaluation_kit.zip。
把工具箱纳入实验流程的正确位置:它只该出现在"最终测试评估"环节,训练期的模型选择与调参请用训练集交叉验证(或 CARE 2024 的验证集)。用测试自评反复调参是"变相在测试集上训练"——20 例测试经不起这种消耗,榜单分数的参考价值也会随之蒸发。给自己立个规矩:整个项目生命周期里测试评估不超过 5 次,每次都留档。
6.3 门 3:CARE MyoPS++ 2024(注册+协议)
2024 届数据通过官网注册获取,需签署 data agreement;提交经官方评估平台在线评分。注册流程与 CMT 类似:填队伍信息→等待审核→获得下载权限。联系邮箱见 §5.2。
注册实操提示(按 2026-09-27 抓取的官网状态):训练数据 2024-05-10 已发布,挑战赛程结束后数据获取窗口是否延续以官网现行说明为准;注册时准备的材料通常包括队伍信息、机构隶属、研究用途简述;审核周期以邮箱往来为准(联系人 dingwangbin@fjmu.edu.cn 为福建医科大学方,21110980009@m.fudan.edu.cn 与 zhangyang23@m.fudan.edu.cn 为复旦方)——邮件用英文写清楚"数据用途+预期产出+引用承诺"三项,一次说全能省两轮往返。
6.4 许可状态:无显式许可证声明(存照)
数据集本体没有发布显式开源许可证——官方页与下载包内均未见 OSI 类许可文本。获取方式(注册+data agreement)与论文引用惯例构成了事实上的许可框架。两个必须分清的口径:
- 基准论文 arXiv:2201.03186 页面标注 CC BY-NC-SA 4.0——这是论文文本的许可,不是数据集许可。把论文许可套到数据上是常见误读(坑 4)。
- data agreement 的典型条款为学术用途限制+禁止再分发+成果引用要求。商用前必须直接联系组织方取得书面授权。
6.5 获取合规自检清单
动代码前先过这五条:
- 切分对齐:确认你引用的切分口径(挑战赛 25/20 vs scribble 20/5/20)与你声称的比较对象一致。
- 预训练合规:只在 CARE 2024 上工作时,检查模型权重来源——ImageNet/心脏数据集预训练都在禁止之列。
- 再分发红线:data agreement 框架下不要把数据(哪怕只是训练集)打包上传到网盘/HuggingFace/论文附件;分享下载链接的官方页即可。
- 衍生标注的许可链:基于 MyoPS 训练集自己再标注/筛选的衍生版本,其许可随原始数据(学术用途框架),不是你新写了一个 license 就能改变性质的。
- 成果回报:data agreement 通常要求在成果中引用基准论文——把它写进你的引用管理器,避免发表前手忙脚乱。
§7 基准与评估:15 支算法能告诉我们什么
7.1 总体分数与天花板
15 支入选算法的官方基准汇总:
| 指标 | scar | edema |
|---|---|---|
| 15 法平均 Dice | 0.614 | 0.644 |
| 15 法平均像素精度 | 83.6% | 74.3% |
| 冠军(UESTC)Dice | 0.708 | 0.731 |
三个解读要点:其一,像素精度与 Dice 的"倒挂"(scar 的 PP 高于 edema 但 Dice 更低)源于类别不平衡——瘢痕区域通常小于水肿区域,预测保守(只报高置信区)即可拉高像素精度但压低 Dice;其二,最好与最差方法之间的分差远大于常规结构分割挑战(scar 方向跨度超过 0.3 Dice),说明这个任务的算法设计空间很大;其三,即便冠军分数(0.708/0.731)也显著低于同期结构分割任务(ACDC 心肌 0.9+),这个 0.2 的差距就是"病理分割"与"结构分割"的难度差。
读这组分数还有第四个要点:分数的方差与均值同样重要。病理分割的逐例方差大(水肿范围小的病例 Dice 波动剧烈),论文报告中位数与四分位距比单报均值更诚实;自评时若只看总分不看逐例分布,容易把"某 3 例崩了拖低均值"误诊为"模型整体不行"——先看逐例热力图定位崩塌病例,再决定是模型问题还是数据问题(常见真凶:基底/心尖层面的部分容积效应,§7.3)。
7.2 冠军方法与常见策略谱系
2020 届冠军为电子科技大学(UESTC)队(scar 0.708 / edema 0.731),领先 15 法平均约 0.09-0.12 Dice——领先幅度可观,说明即使在小样本挑战里,工程细节(预处理、增强、集成、后处理)的差距依然能拉开显著名次。15 支入选算法的策略画像(据基准论文方法章节归纳):
- 全部为深度学习,绝大多数为 U-Net 变体(2D 为主,个别 2.5D 集成)。
- 两阶段流水线是主流:先用 bSSFP(或 C0)定位 ROI/心肌区域,再在多序列裁剪区上做病理分割——把"结构分割(容易)"与"病理分割(难)"解耦。
- 重度数据增强:含弹性形变、灰度扰动;个别队伍用了 SPADE 类合成增强来扩充 306 切片的小样本。
- 序列融合位置各异:早期融合(通道拼接)、跨序列注意力、跨序列跳跃连接均有代表,没有哪一种融合范式呈现压倒性优势——多序列融合至今仍是开放问题。
7.3 病理学的结构性结论
基准论文的误差分析给出三条可复用的领域结论:
- edema 比 scar 好分(平均 Dice 高 0.03、冠军高 0.023):水肿区域大而连续,边界相对清楚;瘢痕斑块状、散在、不规则,部分瘢痕在非 LGE 序列上近乎不可见。
- 层面位置决定难度:基底与心尖层面系统性差于中层——心肌薄、部分容积效应强、病理分布稀疏。
- 模型不确定性与专家分歧相关:模型输出熵高的像素与观察者间分歧大的像素高度重合,这为"用不确定性图提示人工复核"提供了直接证据。
三条结论的迁移价值各不相同:第 1 条几乎可以原样迁移到任何心肌病理分割场景(edema 易 scar 难是病理形态决定的,不是数据集特例);第 2 条对任何短轴心脏数据都成立但强度取决于层厚;第 3 条的"不确定性-分歧相关"是最有临床转化潜力的一条——它意味着模型的不确定度输出不是工程噱头,而是对"专家也不知道答案"区域的诚实映射,附录 J 的复核工单设计就建立在这条结论上。
7.4 复现榜单的最短路径
想对齐榜单数字:下载官方包→按 §4.2 解码标签→实现/加载候选模型→对 20 例测试推理→用官方评估工具箱出分(不要自写评测脚本,空切片处理等细节会引入偏差)→对照 §7.1 的 15 法平均与冠军区间判断实现是否正常。若分数系统性偏低,先检查三件事:标签解码(§4.2)、逐层 Dice 口径、是否误把结构类(200/500/600)算进了病理指标。
这条路径的设计逻辑是把"变量"一个个锁死:官方包锁定数据、官方工具箱锁定评测、§4.2 锁定标签语义——剩下唯一变量是你的模型。复现失败的排查也因此有了确定顺序:先跑通"官方工具箱+把训练金标准当输入"(验证评测链路),再验证推理输出的几何还原(附录 L3),最后才怀疑模型本身。跳过前两步直接怀疑模型,是新手最常见的排错方向错误。
7.5 策略谱系总表:15 法的分类学
把基准论文披露的方法要素按"融合位置 × 流程结构"两个轴整理,15 支入选算法的分布如下(个别队伍未完整披露处按论文叙述归类):
| 策略要素 | 代表做法 | 采用面 |
|---|---|---|
| 早期融合 | 三序列通道拼接入 U-Net 编码器 | 常见 |
| 中期融合 | 跨序列注意力/跨序列跳跃连接 | 少数 |
| 两阶段解耦 | 先 C0 定位心肌 ROI,再在 ROI 内分病理 | 主流 |
| 模态专精分支 | LGE 分支专管 scar、T2 分支专管 edema | 少数 |
| 2.5D 堆叠 | 相邻层作为通道 | 少数 |
| 重度数据增强 | 弹性/灰度/SPADE 合成 | 普遍 |
| 后处理 | 连通域清理、小目标过滤 | 部分 |
两个值得注意的"负面结果":其一,没有一种融合范式呈现压倒性优势——多序列融合至今是开放问题,这本身就是 MyoPS 对方法学的重要贡献;其二,2020 届没有队伍用真 3D 网络——几何现实(§2.2)决定了 2D/2.5D 是理性选择。
7.6 病理分割与相邻任务的难度坐标系
把 MyoPS 的分数放回更大的坐标系,"病理分割难在哪"有了定量答案:
| 任务 | 数据集 | 代表 Dice | 难度来源 |
|---|---|---|---|
| 心脏结构分割 | ACDC(rid 511) | 0.91-0.93(Myo) | 边界清晰、对比度高 |
| 多中心结构分割 | M&Ms(rid 516) | 0.87-0.91(Myo) | 厂商域移 |
| 心肌病理分割(edema) | MyoPS | 0.644(15 法均值) | 病理边界模糊、序列互补 |
| 心肌病理分割(scar) | MyoPS | 0.614(15 法均值) | 斑块状、散在、单序列不可见 |
| 梗死区分割 | EMIDEC(rid 696) | 单序列 LGE 设定 | 序列信息单一 |
同一颗心脏,结构分割 0.9+、病理分割 0.6 档——0.3 的落差就是"看清楚"与"看懂"的差距。给使用者的定位建议:如果你的模型在 MyoPS 上 scar Dice 过了 0.75 且不在榜首队列,先怀疑实现漏洞而不是创新突破(冠军才 0.708)。
7.7 把基准分数写进论文的规范
引用或报告 MyoPS 相关数字时的四条规范:
- 注明口径:“15 支入选算法平均"或"冠军(UESTC)”,不要写成"SOTA"或"平均性能"——15 法是参赛子集,其均值不是社区的 SOTA 上限。
- 自评分数标注工具:用官方工具箱得出的分数注明"MyoPS2020_EvaluateByYourself";自建评测实现的分数必须先与官方口径校准并声明差异。
- 跨届比较只定性:2020 与 2024 的规则、数据、指标都不同,两届分数不做算术比较,只能讨论趋势。
- 逐例透明:论文附录放逐例分数表(或至少分布图)——病理分割的逐例方差大,只有总分的结果读者无法复现诊断。
§8 方法生态与学术影响
8.1 四篇必引文献
围绕 MyoPS 的学术坐标系由四篇方法/基准论文构成:
| 文献 | 期刊/出处 | 角色 |
|---|---|---|
| Zhuang & Shen, “Multimodal Varying Manifold Model” | IEEE TPAMI 2019, 41(12):2933-2946 | MvMM 理论根基;数据预对齐方法 |
| Li et al., MyoPS 基准论文 | Medical Image Analysis 2023, 87:102808(另见 arXiv:2201.03186) | 挑战赛正式基准:15 法汇总+误差分析 |
| Qiu et al., MyoPS-Net | Medical Image Analysis 2023, 84:102694 | 组织方方法延伸:全序列融合网络+私有 50 对五序列集 |
| Ding et al. | IEEE Transactions on Medical Imaging 2023 | 病理分割方法学延续(Ding 亦为 CARE 2024 联系人) |
使用数据发表成果时的引用规范:数据引基准论文(Li 2023 MedIA / arXiv:2201.03186),方法上若受益于预对齐应引 MvMM(Zhuang 2019 TPAMI)。四篇的分工用一个类比概括:TPAMI 是"理论教材"、MedIA 基准论文是"考试大纲与成绩单"、MyoPS-Net 是"出题人的解法"、TMI 论文是"后续答卷"。写 related work 时按这个叙事顺序展开最顺:先多模态建模理论(MvMM),再任务定义与基准(MyoPS),然后方法演进(MyoPS-Net、Ding)——直接跳过前两步只谈方法的写法,审稿人常会问"你的多序列设定与 MvMM 的关系是什么"。
8.2 谱系:从结构分割到病理分割再到真实世界
庄吓海组的心脏挑战赛三部曲,串起一条清晰的难度升级链:
MSCMRseg (2018/19) MyoPS 2020 CARE MyoPS++ 2024
───────────────── → ───────────────── → ─────────────────
结构分割:LV/RV/心肌 病理分割:scar+edema 真实世界病理分割
45 例(数量巧合) 45 例 = 25+20 250 例 / 7 中心
LGE 为主 三序列配齐+预对齐 缺序列+未对齐+多中心
三步分别回答了"能不能画准心脏"、“能不能看出心脏哪里坏了”、“临床数据不完美时还灵不灵”。对算法研究者,这三届构成了天然的消融阶梯:同一套方法在 MSCMRseg 上跑通后上 MyoPS 2020 检验多序列融合能力,再用 CARE 2024 检验真实世界鲁棒性。
这张演进图还有一个常被忽略的读法:标签成本的暴涨。MSCMRseg 标 3 类结构(勾轮廓即可);MyoPS 标 5 类且病理边界靠信号强度判断(需要序列专业知识);CARE 2024 再叠加多中心协调与双版本发布——任务每升一级,标注与运营成本上升一个量级。这解释了为什么病理分割数据集普遍小于结构分割数据集:不是没人想做,是金标准太贵。这也是 MyoPS 团队后续开放 scribble 标注(§4.4)的动机——用弱监督把"贵金标准"的使用成本降下来。
8.3 弱监督与多模态学习的试验田
MyoPS 的小样本(306 切片)与多序列结构使其成为两个方法学方向的标准试验田:
- 弱监督/半监督分割:官方衍生的 scribble 标注(§4.4)被大量弱监督分割论文用作基准,20/5/20 切分成为社区默认口径。
- 多模态融合与缺失模态学习:CARE 2024 的缺序列设定(42% 病例不全配齐)使"模态缺失鲁棒性"从附加实验变成主考题;MedCL(arXiv 2503.22890)等跨模态对比学习工作直接以 MyoPS 为验证场。
这条试验田属性对使用者的含义是双面的:好处是任何新方法都能在这里找到大量可比对的先行结果(弱监督、半监督、缺序列、域泛化各方向的论文都以 MyoPS 为常见落点);代价是检索先行工作时必须按"任务设定+标注口径"双重过滤——同为"MyoPS 上的分割论文",全监督挑战赛口径与 scribble 弱监督口径的结果完全不可比(坑 5 的另一个侧面)。
8.4 对 AI-Ready 生态的方法学贡献
MyoPS 的"加密金标准+官方评估器"模式后来被大量 MICCAI 挑战复制。它的另一个隐性贡献是标签值编码规范:用非连续大整数(200/500/600/1220/2221)避免"背景=0、类别=1,2,3"的隐式约定带来的误读——代价是使用者必须显式解码(坑 2),但换来的是标签文件自描述:看到 2221 就知道是 scar,不需要查表猜顺序。
从库内条目生产的角度,MyoPS 还贡献了第三样东西:双届演进的可参照模板。本条目把两届挑战写成一个演进故事(理想化→真实世界),这种"同一家族跨年代合并立目"的写法处理了库内一个普遍难题——同一团队的系列挑战赛(M&Ms→M&Ms-2、ToothFairy→ToothFairy2/3 等)是分立条目还是合并条目。MyoPS 的实践表明:当届次间共享任务定义与标注体系时,合并立目+演进叙事比分立条目更能防止检索者的口径混淆。
8.5 尚未解决的问题清单
两届数据集沉淀下来、但至今没有公认答案的问题,也是选题雷达上的高价值目标:
- 最优融合层级未定:早期/中期/后期融合在 15 法中无压倒性差异——多序列融合的理论框架(何时该融合、融合什么)仍是空白。
- scar 与 edema 的联合建模:两者在病理生理上相关(水肿消退→瘢痕形成),但主流方法把它们当独立类别各自输出——利用其结构关系的建模几乎空白。
- 层间上下文的合法利用:稀疏短轴的 z 向信息如何在不插值造假的前提下利用(如解剖连续性先验),尚无定论。
- 跨病理类型的迁移:缺血性瘢痕(本数据集)与非缺血性强化(心肌炎、HCM)的分布差异能否用少量目标域数据弥合——CARE 2024 的多中心设定提供了部分素材但未覆盖病理类型迁移。
- 不确定性到临床决策的桥:基准论文已证明模型不确定性与专家分歧相关(§7.3),但"不确定性图如何变成复核工单/质控阈值"的工程化路径未打通。
§9 与库内条目的关系
9.1 家族图谱:心脏 MRI 考题全景
库内心脏 MRI 条目按"考什么"可排成一条完整光谱,MyoPS 占据"病理分割"生态位:
| 条目 | rid | 考题 | 与 MyoPS 的关系 |
|---|---|---|---|
| ACDC | 511 | 结构分割(RV/Myo/LV)+ 分组 | 结构分割对照组;常被用作 MyoPS 方法的预训练源(注意 CARE 2024 禁预训练规则) |
| M&Ms | 516 | 多中心+多厂商结构分割 | 同为庄吓海系挑战;MvMM 供应商谱系一致 |
| M&Ms-2 | 682 | 多中心结构分割+域泛化 | 域泛化方法论可平移到 CARE 2024 |
| EMIDEC | 696 | 梗死表征分割(含病理区) | 任务最接近的库内近亲:LGE 单序列梗死分割 vs MyoPS 多序列病理分割 |
| CMRxRecon | 506 | CMR 重建 | 上游环节:重建质量影响下游分割 |
| CMRxMotion | 687 | 运动伪影鲁棒性 | 上游环节:伪影是 MyoPS 未直接考察的干扰源 |
| CHAOS | 337 | 多模态腹部分割 | 多模态方法论近亲(CT/MRI 而非 CMR 内三序列) |
读这张表的正确姿势不是逐行记忆,而是抓住一个结构事实:库内的心脏条目绝大多数站在"结构分割"一侧(ACDC/M&Ms 系/CMRx 系),“病理分割"一侧只有 MyoPS 与 EMIDEC 两个——这与文献界"结构分割数据多、病理分割数据少"的格局一致(§8.2 标签成本论证)。因此 MyoPS 在库内的战略地位是"稀缺生态位的占位者”:任何涉及心肌病理的库内检索都会汇到这里,条目质量的重要性被生态位放大。
9.2 跨模态与临床转化邻居
- cardiac-atlas-project(rid 521):统计形状建模的对照视角——Atlas 走"平均解剖"路线,MyoPS 走"个体病理"路线。
- myocardial-perfusion-spect(rid 620):心肌缺血的另一条影像通路(SPECT 灌注 vs CMR 病理),临床问题同源、数据形态迥异。
- echonet-dynamic(rid 526)与 camus(rid 533):超声心动图的功能学评估(EF 等),与 MyoPS 的病理学评估构成"功能+病理"双报告的组合。
- cinc-2023(rid 499):心电图方向的梗死检测——多模态融合(ECG+CMR)是潜在延伸。
- shhs(rid 282)与 cardiac-implantable-device-cxr(rid 599):心血管疾病大生态中的睡眠与器械视角,适合做库内"心血管疾病"主题导航的二级链接。
这组邻居关系的共同主题是"同一临床问题、不同数据形态":SPECT 看灌注、超声看功能、心电图看电活动、CMR 看病理形态——心血管 AI 的完整拼图需要它们互补而非互替。写综述或系统论文时,"MyoPS 补的是形态病理这一格"是比"MyoPS 是心脏分割数据集"更有信息量的定位句。
9.3 检索路径建议
以"MyoPS"为节点检索库内相关条目的三条路径:
- 任务路径(病理/病变分割):EMIDEC(696) → ACDC(511) → M&Ms(516)。
- 模态路径(多序列/多模态融合):CHAOS(337) → M&Ms-2(682) → CMRxRecon(506)。
- 临床路径(心血管疾病全景):myocardial-perfusion-spect(620) → echonet-dynamic(526) → cinc-2023(499) → shhs(282)。
三条路径的用法差异:任务路径回答"还有谁在做和我类似的事"(找对照组);模态路径回答"我的融合方法还能用在哪"(找迁移场景);临床路径回答"这个数据集在心血管全景里补了哪块拼图"(写引言/综述)。若你在写的是系统类论文(采集→重建→质控→分割→报告),三条路径各取一段就能拼出完整的库内坐标系。
9.4 与 MSCMRseg 的边界声明
MSCMRseg(45 例,LGE 结构分割)与 MyoPS 2020(45 例,三序列病理分割)例数相同、组织方相同、时间相邻,是文献里混淆率最高的一对。边界判据一条就够:看金标准标签值——MSCMRseg 只有 LV/RV/Myo 三类结构标签;出现 1220/2221 标签值的一定是 MyoPS。本库以 MyoPS 为独立条目,MSCMRseg 不单独立库,其事实要点已并入本条目 §3.3。
9.5 互链点使用指南
本条目在库内的 14 个互链对象按链接方向分两类,供反向导航:
从 MyoPS 出发(本条目 §9.1-9.3 已铺好路径):ACDC(511)、M&Ms(516)、M&Ms-2(682)、EMIDEC(696)、CHAOS(337) 是"任务/模态近邻",适合做方法对比实验的对照组清单;CMRxRecon(506)、CMRxMotion(687) 是"管线上下游",适合写多任务系统时引用。
指向 MyoPS 的库内条目(预计的回链场景):做心脏影像综述的条目(如 cardiac-atlas-project(521))可在"病理分割"段落回链本条目;做多模态学习条目(如跨模态对比学习相关)可以 MyoPS 为验证场案例;cinc-2023(499) 在讨论 ECG+影像多模态时可回链。
互链写作的两条纪律:其一,回链时带任务限定语(“心肌病理分割"而非笼统"心脏分割”),避免把 MyoPS 误当结构分割数据集;其二,引用分数时注明届次与口径(2020 届 15 法均值 vs 冠军),榜单数字不跨届混用。
§10 避坑清单:八个已踩过的坑
以下八条全部来自真实使用事故与文献误引,每条附一行自查动作。写代码前通读一遍的成本约五分钟,跳过的代价通常是一个通宵。
坑 1:规模口径陷阱——"45 训练"是错的。 网络流传的"45 例训练+20 例测试"把总数当成了训练数。正确口径:45 例总数 = 25 训练(公开金标准)+ 20 测试(加密金标准)。openmedlab 文档、基准论文(arXiv 2302.03537)与 MDPI 引文三方互证。写论文、算参数量、报样本量都按 25/20/45 三分法,否则会被审稿人直接抓住。
自查:任何写"45 例训练"的草稿直接改。
坑 2:标签值不是索引——全空掩码事故。 金标准掩码的整数是字面标签值(200/500/600/1220/2221),不是 0-4 类别索引。用 mask == i for i in range(5) 的写法只会得到全空掩码且不报错。必须按 §4.2 的映射表显式解码。同理,可视化时若用自动对比度拉伸,2221 与 1220 的巨大数值差会把正常心肌(200)压成背景色——注意可视化也要求显式映射。
自查:加载后第一行 np.unique 断言值域。
坑 3:把 MSCMRseg 当 MyoPS——45 对 45 的迷魂阵。 两个挑战赛例数都是 45、都出自庄吓海组、时间相邻。分辨判据:标签体系(结构三类 vs 病理五类)与序列要求(MSCMRseg 侧重 LGE vs MyoPS 三序列必须)。引错的结果是把"结构分割 Dice 0.9"说成 MyoPS 的病理分割成绩,差出一个量级。
自查:看到标签里只有 3 类结构值,就是 MSCMRseg。
坑 4:论文许可≠数据许可。 基准论文 arXiv 页面的 CC BY-NC-SA 4.0 只覆盖论文文本。数据集本体无显式许可证,获取走"注册+data agreement"。把 CC BY-NC-SA 写进数据的 license 字段、或据此认为可以再分发数据,都是错误引用。商用必须联系组织方书面授权。
自查:license 字段写"无显式声明+data agreement",不写 CC。
坑 5:弱监督口径的 20/5/20 ≠ 挑战赛 25/20。 scribble 弱监督文献常用的 20 训练/5 验证/20 测试切分是衍生子集口径(MedCL arXiv 2503.22890 披露),与挑战赛的 25 训练/20 测试不可互换。读弱监督论文的分数时先确认它用的哪套切分——两套口径的分数不在同一坐标系。
自查:读任何 MyoPS 论文先翻它的数据切分表。
坑 6:稀疏短轴当连续 3D 用——插值伪影与虚假感受野。 z 轴只有 2-6 层、层间距 12-23 mm(面内分辨率的 15 倍以上)。对体数据做 3D 插值上采样会产生大片虚假平滑;3D 卷积的 z 向感受野没有解剖学意义。15 支入选基准算法全走 2D/2.5D 路线不是巧合。若确需 3D 上下文,用逐层堆叠的 2.5D(相邻层作为通道)比真 3D 更诚实。
自查:pipeline 里出现 z 向 zoom/resample 即违规。
坑 7:CARE 2024 对齐版与未对齐版混用。 2024 届发布 MvMM 预对齐与未对齐两版数据,官方测试提交以对齐版为准。在未对齐版上训练、对齐版上测试(或反之)会引入一个数据集本身没打算考察的配准误差变量。另外两届文件命名体系不同(myops_train_XXX vs PatientID_LGE),跨届脚本不能复用解析逻辑。
自查:训练与测试数据目录名里标注 aligned/unaligned。
坑 8:性别泛化盲区。 2020 届 45 例全部为男性(45M/0F,56.2±7.92 岁)。用 2020 届训练的模型对女性患者的表现没有任何数据支撑——女性心脏几何更小、病理分布可能有差异。在模型卡与论文限制节明确声明这一点;需要性别均衡时考虑补 CARE 2024(其人口学官网未完整披露,使用前向组织方确认)。
自查:模型卡 limitations 首条写全男性队列。
§11 总结
11.1 三句话总结
- MyoPS 把心脏影像的考题从"画出心肌"升级为"找出心肌里的病"——用 bSSFP/T2/LGE 三序列融合分割急性心肌梗死的水肿与瘢痕,2020 届 45 例(25+20)起步,CARE 2024 届 250 例 7 中心真实世界化。
- 它是心肌病理分割方向规模最大的公开标注资源,15 支算法公开基准(平均 scar Dice 0.614 / edema 0.644,冠军 UESTC 0.708/0.731)划定了这一任务的难度基线——比结构分割低约 0.2 Dice。
- "加密金标准+官方评估工具箱+标签值编码"构成其工程三件套:可复现性纪律第一梯队,但标签解码、稀疏切片、全男性队列三个坑必须先读避坑清单再动手。
11.2 适合谁
- 医学影像分割研究者:想把方法从结构分割推进到病理分割、从单序列推进到多序列融合的人——这里有多序列融合的公开坐标系与 15 法基准。
- MICCAI 挑战赛参赛者:需要小样本+多模态+缺失模态的标准练兵场与可复现榜单;两届规则差异本身就是一份"难度梯度训练计划"。
- 弱监督/半监督方法作者:官方 scribble 衍生标注提供了社区默认口径的弱监督基准,先行论文充足。
- 心脏影像临床研究团队:需要瘢痕/水肿自动定量以支撑 AMI 预后研究的工程团队——但请先读 §11.5 与附录 J 的落地红线。
- 多模态学习理论研究者:MvMM 谱系与融合层级消融素材都在,开放问题清单见 §8.5。
11.3 不适合谁
- 需要连续 3D 体数据或全心脏覆盖的方法(z 轴只有 2-6 层稀疏短轴,§2.2)。
- 需要 3D 逐体素高分辨率标注的预训练场景(层间距 12-23 mm 的插值是虚假信息,坑 6)。
- 需要性别均衡队列的公平性研究(2020 届 0 女性,坑 8)。
- 期望现成开源许可证、可以随意再分发的场景(无显式 license,data agreement 管着,坑 4)。
- 右心室病理研究(病理标签只勾左心室心肌,§4.1)。
- 非缺血性心肌病(心肌炎、HCM、结节病等)的病理分割——队列是纯 AMI,强化分布模式不适用于非缺血病因(§2.4)。
11.4 30 秒决策卡
| 你的处境 | 建议 |
|---|---|
| 只想快速验证多序列融合思路 | 用 2020 训练 25 例 + 官方自评工具箱,2D U-Net 起步 |
| 要对标 2024 真实世界设定 | 注册 CARE 2024,用未对齐版+缺序列设定,注意禁预训练规则 |
| 做弱监督分割 | 找官方 scribble 标注,按 20/5/20 口径,别混挑战赛口径 |
| 做结构分割 | 直接用 ACDC(511)/M&Ms(516),MyoPS 的 200/500/600 标签仅作辅助 |
| 做配准研究 | CARE 2024 未对齐版+对齐版参考(FAQ C7) |
| 做教学练习 | 训练集+官方自评,学生自行注册(FAQ A7) |
| 要女性数据 | 本数据集无解(45M/0F),换 M&Ms 系或补其他队列 |
| 商用 | 必须联系组织方书面授权(dingwangbin@fjmu.edu.cn 等) |
11.5 常见误用 Top 5(事前自查)
从两届社区实践与本条目坑点清单中提炼的高频误用,动手前逐条自查:
- 当结构分割数据集用:拿 MyoPS 训练 LV/RV 结构分割模型并与 ACDC 比分数——任务错位,306 切片也撑不起这个赛道。结构分割请去 ACDC(511)/M&Ms(516)。
- 标签索引化读入:
mask==i for i in 0..4全空掩码(坑 2),或把 2221/1220 当切片数/面积去统计。 - 切分口径串线:把 scribble 20/5/20 论文的分数与挑战赛 25/20 口径的分数同表比较(坑 5)。
- z 向插值造 3D:把 2-6 层稀疏短轴插值成连续体再做 3D 卷积(坑 6)——插出来的层是编造的。
- 跨届数据混训去参加 CARE 2024:违规使用外部数据/预训练模型(§5.4 规则红线),成绩会被取消。
FAQ(高频问答 55 问)
A. 基础认知
A1:MyoPS 的 Myo 是肌肉吗?
不是。是 myocardium(心肌)的词头。MyoPS = Myocardial Pathology Segmentation,心肌病理分割。任务简报中"肌肉 MRI 微结构挑战"为误称,已存照。
A2:它分割的是什么病?
急性心肌梗死(AMI)后的两类心肌病理:edema(水肿,T2 序列高信号,代表可挽救的"风险区")与 scar(瘢痕,LGE 序列高信号,代表已坏死组织)。
A3:为什么需要三个序列?
bSSFP 提供可靠解剖边界但不显示病理;T2 显示水肿但信噪比低;LGE 显示瘢痕但血池同样高亮、边界模糊。单序列信息量不足以可靠定位病理,多序列融合是必要条件而非可选项。
A4:MyoPS 2020 和 CARE MyoPS++ 2024 是什么关系?
同一组织方(复旦庄吓海组)的两代挑战赛:2020 是首届(MICCAI 2020),2024 是 CARE 品牌 track4(MICCAI 2024)。后者把规模从 45 例扩到 250 例、从预对齐扩到未对齐、从全配齐扩到缺序列。
A5:有 MyoPS 2021/2022 届吗?
四轮检索(zmic 门户、zenodo、数字限定检索、变体拼写)未发现独立届次的直接证据。成稿以 2020 与 2024 两届为主干;若见"MyoPS 2022"字样,请先向来源索要一手链接再引用。
A6:它和 Kaggle 上的心脏数据集是一回事吗?
不是。MyoPS 走 MICCAI 挑战赛体系(zmic.org.cn / CMT / grand-challenge 风格),不托管在 Kaggle;下载入口见 §6。
A7:能拿来做课程教学/学生练习吗?
训练集在学术框架下可用于教学(挑战赛数据常用于医学影像课程),但仍受 data agreement 的学术用途约束;建议课程场景下只发官方页链接让学生自行注册下载,教师不要打包再分发(§6.5 红线)。教学选它的理由:小体积(笔记本可跑)、任务真实、官方评估器现成——比让学生在 ACDC 上内卷结构分割更有区分度。
A8:数据覆盖心脏的哪些范围?
左心室短轴从基底到心尖的 2-6 个层面(每序列),不覆盖心房、不覆盖长轴位、不覆盖全心脏 3D 解剖。与 ACDC 覆盖全左室(28-40 层连续短轴)不同,MyoPS 的层面是"够用就好"的临床协议——够覆盖梗死好发区域,但不是全解剖扫描。选数据集时先对齐这个覆盖差异。
A9:为什么条目里 2020 届的内容比 2024 届多?
信息可得性不对称:2020 届有完整基准论文(15 法分数、误差分析、队列人口学)+三年社区使用积累,可核事实密度高;2024 届(CARE)以官网一手信息为主(数据划分、规则、时间线),基准结果与深度分析随 workshop 论文逐步释放。本条目对 2024 届坚持"官网核实到哪写到哪",不脑补未公布数字——这也是检索者引用时的应有纪律。
A10:MyoPS 与"AI-Ready Wikipedia"的关系是什么?
本条目是千方病案医数集为 MyoPS 数据集家族撰写的百科条目:把两届挑战的硬事实、获取路径、评测口径与避坑经验结构化为可检索的知识单元。条目本身不托管数据;所有下载与协议行为都发生在官方渠道(§6)。条目内的互链(rid)指向库内相邻数据集条目,方便构建"心脏影像"主题的知识图谱。
B. 数据与获取
B1:训练集怎么下载?
官方页(zmic.org.cn MyoPS 2020 页面 / sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/)直接下载,无需注册。包内含 train25/、test20/、train25_myops_gd/、MyoPS2020_EvaluateByYourself/ 四个目录。
B2:测试集的金标准能拿到明文吗?
正常渠道拿不到。金标准以加密 .nii.gz(*_gdencrypt.nii.gz)发布,参赛者用官方工具箱本地评分但不暴露逐像素真值。学术用途需要明文时联系组织方说明理由。
B3:CARE 2024 数据怎么获取?
官网注册 + 签署 data agreement,经审核后获取;提交走官方评估平台。联系人:dingwangbin@fjmu.edu.cn(福建医科大学)、21110980009@m.fudan.edu.cn、zhangyang23@m.fudan.edu.cn。
B4:能商用吗?
默认不可以。数据集无显式开源许可证,data agreement 为学术用途框架;商用必须直接联系组织方取得书面授权。论文页 CC BY-NC-SA 4.0 只管论文文本。
B5:数据是什么格式?
全部 NIfTI 压缩格式(.nii.gz):图像体数据与整数标签值掩码(200/500/600/1220/2221)。无 DICOM 原始层——若需要 DICOM 元数据(拍照参数、厂商字段),本数据集不提供。
B6:一个训练样本有多大?
体数据尺寸约 408×392×2 至 512×511×6,面内 0.73-0.76 mm、层厚 12-23 mm。单例三序列 + 掩码通常在几十 MB 量级,整个训练集远小于通用大影像数据集,笔记本硬盘即可容纳。
B7:CARE 2024 的"未对齐版"是什么?
未经 MvMM 预对齐的原始多序列数据,序列间存在真实的空间错位。官方测试提交以对齐版为准;未对齐版用于研究"配准+分割一体化"方法。
B8:CARE 2024 的验证集与测试集有何区别?
都来自中心 D(各 25 例),但验证集标签对参赛者可见(供调参/早停),测试集标签只有官方评估平台可见(供最终排名)。这与 2020 届"只有训练集带公开标签"的两分法不同——2024 届给了中间的调参缓冲。用验证集刷测试策略(在验证集上选超参后不再动测试提交)是合规且被期望的做法。
B9:官方页打不开怎么办?
CARE 2024 官网为 http 协议(非 https),部分浏览器/网络环境会拦截——本条目 2026-09-27 抓取时 http 直连成功。排查顺序:换浏览器/网络、直接访问 sdspeople 复旦页、检索 web archive 快照、邮件联系人索取最新链接。不要使用第三方转载的数据包——无法核验完整性与合规性。
B10:下载的包怎么校验完整性?
三步:目录核对(§6.1 的四目录与文件数)、抽样值域断言(§4.7 第 1 步)、体数据几何抽查(shape/affine 与 §2.2 的尺寸范围吻合)。官方包未发布哈希清单,故校验以内容抽验为主——任何目录缺失或值域异常都应先重下再排查代码。
B11:CARE 2024 的验证集标签真的可见吗?
按官网赛制设计,验证集(中心 D 的 25 例)提供公开标签供参赛者本地自检,测试集 25 例只经官方平台评分。这一"训练-验证-测试"三级结构与 2020 届的"训练-测试"两级结构不同;引用时注意别把 2024 的"验证 25"当成 2020 不存在的中间集。赛制细节若有更新以官网为准。
C. 标签与任务
C1:掩码里为什么有 5 类但比赛只评 2 类?
勾画时把整个左心室截面分给 5 类(LV/RV 血池、正常心肌、水肿、瘢痕),保证掩码完备;但比赛考题是"病理分割",所以官方只评 edema 与 scar。LV/RV/normal 是免费送的辅助标注。
C2:2221 是什么意思?
是 scar(瘢痕)的 NIfTI 标签值——一个约定的大整数,不是切片数、不是面积、不是索引。edema=1220、normal=200、LV pool=500、RV pool=600。直接遍历 0-4 找类别会得到全空掩码(坑 2)。
C3:金标准是单人标注吗?
不是。三名独立受训观察者逐层勾画后取平均。这是"平均专家意见"式金标准,边界比单观察者金标准更平滑,但也意味着金标准本身携带观察者间不确定性。
C4:逐层 Dice 的空切片怎么处理?
以官方评估工具箱(MyoPS2020_EvaluateByYourself)实现为准。自写评测脚本时若对空真值/空预测的处理与官方不一致,分数会有系统性偏移——复现榜单请务必用官方工具箱。
C5:scribble 标注是官方的吗?
是庄吓海组发布的官方衍生标注(Zhang & Zhuang 2022a/2023),把逐像素金标准稀释为线条笔触供弱监督研究。社区常用切分 20/5/20(MedCL arXiv 2503.22890 披露),与挑战赛 25/20 口径不同。
C6:能把它当结构分割数据集用吗?
可以但不划算。金标准含 LV/RV/normal 三类结构标签可做结构分割,但 25 例/306 切片的规模远小于 ACDC 等专用结构分割数据集;MyoPS 的价值密度在病理标签上。
C7:金标准能用于配准研究吗?
可以但注意前提:官方发布的是预对齐后的版本,做"配准算法评测"需要的是未对齐输入——CARE 2024 的未对齐版正好提供这个(配准研究可用其对齐版当参考真值)。2020 届只有对齐版,做配准研究只能自己人为制造形变(合成形变场),结论的外推力有限——这类研究建议直接上 CARE 2024。
C8:normal 心肌标签(200)有什么用?
三用途:结构分割预训练(与 LV/RV 血池一起构成完整心脏解剖监督);病理分割的负样本定义(病理=心肌内非 normal 区域);心肌厚度/质量的几何测量(正常心肌环宽是 AMI 后重塑的观测指标)。别因为"不计分"就把它扔了——它是不平衡问题里最大的稳定类别,训练时对特征学习有稳定作用。
C9:能把自己的标注加进训练集吗?
技术上可行(NIfTI 格式+同一标签值体系即可并入),合规上要注意:你的新增标注基于官方图像,衍生数据同样受 data agreement 约束,发布时不能附带原始图像;标注协议应尽量复刻官方口径(三序列同层勾画、左心室心肌内三态判定),否则金标准体系混血,评测口径就说不清了。发论文时把"官方金标准"与"自扩展标注"分开报告。
C10:标签值之间为什么跳得这么开(200→500→600→1220→2221)?
官方没有公开解释编码设计,但可观察到它是"语义分组+位级扩展"式的:结构类(200/500/600)与病理类(1220/2221)数值上分离,病理类再按类型分段。工程含义:可以按数值区间(如 >1000 为病理)写粗筛逻辑,但正式解码仍应以精确标签值匹配为准——区间技巧仅用于调试与可视化。
D. 基准与方法
D1:榜单分数在哪看?
基准论文(Li et al., MedIA 2023, 87:102808;arXiv:2201.03186)给出 15 支入选算法的完整分数表与本条目 §7.1 的汇总数字。CARE 2024 的结果以官网与 workshop 论文集为准。
D2:15 支算法是怎么选出来的?
65 支正式参赛队伍提交了 23 份测试结果,其中 15 份提交了符合 LNCS 格式的方法说明并入选公开基准。榜单是"完整提交方法"的子集排名。
D3:冠军是什么方法?
冠军为电子科技大学(UESTC)队:scar Dice 0.708、edema Dice 0.731。基准论文未将其方法细节与名次一一公开对应的部分,需查 LNCS 挑战论文集中的对应方法论文(如 Altunok & Oksuz 残差 U-Net pp.128-137 等)。
D4:为什么我的复现分数比论文低很多?
按概率排序检查三件事:① 标签解码用了索引而非标签值(全空或部分空掩码);② 评测口径与官方工具箱不一致(空切片处理、逐层 vs 逐例平均);③ 把结构类(200/500/600)算进了病理指标。
D5:edema 分数普遍比 scar 高,是标签问题还是任务问题?
主要是任务问题:水肿区域大而连续、边界相对清楚;瘢痕斑块状、散在、不规则,部分瘢痕在非 LGE 序列上几乎不可见。基底部/心尖部层面系统性更差。
D6:CARE 2024 禁预训练模型,那 ImageNet 权重也不能用?
按官网规则,仅自动方法、禁外部数据与预训练模型——等于要求从零训练。参赛前请以官网规则原文为准,这条在本条目写作时点是明确的。
D7:自己的方法比 15 法均值高但比冠军低,说明什么?
说明你的实现大概率没有 bug(超过了 15 法中位数水平),且还有正常的提升空间。此时提升的杠杆点按性价比排序:两阶段 ROI 解耦(若还没用)→ 序列级增强定制(§3.5 推论三)→ 基底/心尖层面的针对性处理(§7.3)→ 融合结构创新(开放问题,回报不确定)。
D8:能把 15 法的排名当作方法学结论引用吗?
要小心。挑战排名受实现细节、调参算力、后处理技巧影响,不控制变量——“注意力融合排名第 3、早期融合排名第 8"不能推出"注意力优于早期融合”。基准论文自己也只做策略画像归纳(§7.5),不做排名归因。方法学结论请引用论文内受控的消融实验(若有),而非榜单名次。
D9:哪里能找到各队伍的方法论文?
入选基准的 15 队方法说明以 LNCS 挑战论文集形式出版(Springer,MICCAI 挑战工作坊论文集),CARE 2024 的方法论文随其 workshop 论文集发布。检索入口:按队名+LNCS/MICCAI 2020 组合检索;部分队伍另有 arXiv 预印本扩展版——预印本与论文集版本内容可能有出入,引用时注明所用版本。
E. 与库内其他条目
E1:和 ACDC(511) 怎么选?
考结构分割选 ACDC(100 例、连续短轴、社区基准丰富);考病理分割只有 MyoPS(含 EMIDEC(696) 的 LGE 单序列梗死分割作为近亲)。两者也可串联:ACDC 预训练结构头 → MyoPS 微调病理头(注意 CARE 2024 禁预训练)。
E2:和 EMIDEC(696) 的区别?
EMIDEC 是 LGE 单序列的心梗死区域分割(含梗死区/微血管阻塞等类);MyoPS 是三序列融合的水肿+瘢痕分割。任务最接近但模态设定与标签体系不同,分数不可直接互比。
E3:和 M&Ms(516)/M&Ms-2(682) 的关系?
同出庄吓海系的多中心结构分割挑战,考题是"多中心/多厂商下画准心脏";MyoPS 考的是"多序列下看出病理"。域泛化方法论互通。
E4:想做多模态融合综述,库内还有哪些可引?
多模态医学分割方向:CHAOS(337)(CT/MRI 腹部)、MyoPS(CMR 内三序列);多模态上下游:CMRxRecon(506)(重建)、CMRxMotion(687)(运动伪影)、cinc-2023(499)(ECG 梗死检测)。
E5:心血管疾病主题还有哪些库内条目?
myocardial-perfusion-spect(620)(SPECT 灌注)、echonet-dynamic(526) 与 camus(533)(超声心功能)、shhs(282)(睡眠与心血管)、cardiac-implantable-device-cxr(599)(器械)、cardiac-atlas-project(521)(统计形状建模)。
E6:CMRxMotion(687) 与 MyoPS 有什么衔接点?
CMRxMotion 考的是运动伪影下的鲁棒性,MyoPS 的数据是屏气采集、伪影被协议压制——两者是"干扰源归零"与"干扰源入题"的镜像设计。写多任务系统(采集→质控→分割)时,CMRxMotion 的伪影分级可以作为 MyoPS 模型部署前的输入质控参照;反过来 MyoPS 的多序列融合也可借鉴 CMRxMotion 的质量分层思路。
E7:为什么库内没有 MSCMRseg 条目?
本库对"同团队同体系、任务高度相邻且例数巧合重叠"的挑战家族采用合并立目策略:MSCMRseg 的关键事实并入本条目(§3.3、§9.4),不单独占一个 slug——避免两个 45 例条目在检索与互链中互相制造混淆。若未来 MSCMRseg 需要独立扩展(如其数据集被独立社区广泛使用),再拆分立目并双向互链。
F. 工程细节
F1:用什么库读数据?
nibabel 读 .nii.gz;掩码解码按 §4.2 映射。注意 get_fdata() 返回浮点,比较标签值用 np.isclose 或先转整型,避免浮点误差漏配。
F2:训练前要做哪些预处理?
官方预对齐版无需再配准。常见做法:面内裁剪到心脏 ROI、HU 不适用(MRI 用强度归一化如 z-score 或 0-1 截断)、逐层处理保持 2D 结构。T2 与 LGE 的强度分布与 bSSFP 差异大,跨序列强度归一化要分别做。
F2b:预处理的输出要不要落盘?
建议落盘(裁剪+归一化后的 2D 切片存 npz/png),理由有三:25 例数据量极小(落盘成本忽略不计)、调试时肉眼检查预处理结果最直观、实验之间共享预处理产物保证可比。但落盘的只是"训练中间产物",测试推理必须从原始 .nii.gz 走同一条预处理链,并把几何还原(附录 L3)保留在链路末端。
F3:数据增强怎么做才安全?
空间增强必须三序列+掩码同步做(同参数同几何);z 向插值避免(稀疏层);强度增强按序列独立但参数共享。SPADE 类合成增强在 2020 届有队伍用且有效,但注意合成样本不要进入测试评估链路。
F4:2.5D 怎么实现?
把相邻 z 层作为输入通道(如 C0/T2/LGE 各取同层与邻层堆叠)。z 向感受野仍然有限(2-6 层),这是诚实上限;用插值"增厚"z 轴不会带来真实信息。
F5:如何声明数据来源?
引用基准论文:Li et al., MedIA 2023, 87:102808(或 arXiv:2201.03186);用到预对齐方法引 Zhuang & Shen, IEEE TPAMI 2019, 41(12):2933-2946;用 CARE 2024 数据按其官网要求声明 data agreement 并联系确认引用格式。
F6:nibabel 读出来的掩码值对不上标签表怎么办?
先用 np.unique(gd) 看实际值域:正常应恰含 {0, 200, 500, 600, 1220, 2221}(或子集)。若出现小数尾差(如 199.99998),是浮点存储误差,用 np.isclose 吸收;若出现表外整数值,先确认拿的是不是 MSCMRseg 的数据(坑 3),再看是否混用了不同版本的掩码文件。
F7:训练循环里患者级与切片级怎么组织?
按患者分 folds(25 例建议 5-fold×5 例),fold 内再展开成切片。严禁同一患者的切片同时出现在训练与验证——306 个切片来自 25 例患者,患者级泄漏会让验证分数虚高 0.1 Dice 以上。
F8:类别不平衡怎么处理?
scar 与 edema 占心肌面积比例小(尤其 scar 斑块状散在),常见对策:Dice 类损失(天然抗不平衡)或 Dice+BCE 组合;空间裁剪聚焦心肌 ROI(两阶段流水线的第二阶段天然完成这件事);采样时对含病理切片上采样。像素精度指标在这种不平衡下意义有限(§7.1 的"倒挂"现象),评估以 Dice 为主。
F9:能和 ACDC 数据混着训练吗?
学术上可以(结构预训练→病理微调),但要处理三件事:标签体系不同(ACDC 是 3 类结构、MyoPS 是 5 类含病理)、z 向分辨率不同(ACDC 连续、MyoPS 稀疏)、强度分布不同( cine vs 黑血/延迟强化)。若目标是 CARE 2024 提交,混训直接违反"禁外部数据"规则。
F10:结果论文里应该报告哪些基线数字?
最低配置三件套:15 法均值(scar 0.614/edema 0.644)、冠军(0.708/0.731)、你自己方法在官方工具箱下的分数。若涉及 CARE 2024,用其官网公布的 winning 方法数字,并注明规则差异(禁预训练)使得跨届比较只能定性。
F11:推理结果怎么组织才能通过官方评估?
按工具箱说明的命名与目录约定输出(对齐 myops_test_201-220 的编号体系),输出格式与输入一致(.nii.gz、同尺寸同 spacing)。三个高频被拒原因:文件命名不匹配(大小写/分隔符)、体数据尺寸与输入不一致(预处理裁剪后忘了还原)、把标签值输出成了索引值。提交前用"训练掩码改名替换"做一次 dry-run 是最便宜的保险。
F12:如何把官方工具箱接进 CI/自动实验?
把工具箱脚本包进固定版本的容器(Python 依赖以工具箱 README 为准),评估入口做成"结果目录→分数 CSV"的纯函数式调用;每次实验落盘逐例分数(不只总分),便于事后做分布分析(§7.1 第四要点)。注意工具箱仅用于测试自评——训练/验证阶段的评估自己实现即可,但实现时先对齐工具箱的空切片口径。
F13:多 GPU/集群环境有什么注意点?
数据量小(训练集几十 MB 量级)意味着瓶颈不在 IO 而在通信与同步开销——单卡训练一个基线通常比多卡更快到收敛。多卡价值在超参搜索(并行跑不同种子/超参)而非数据并行。患者级切分(F7)在分布式采样时同样要保持——DataLoader 的 sampler 也要按患者分组。
F14:随机种子怎么设才能复现?
三层都要固定:框架层(torch/numpy/random)、CUDA 层(cudnn.deterministic + benchmark=False,接受小幅速度损失)、数据层(切分、增强、初始化的独立种子并落盘)。即使全固定,cuDNN 非确定性算子仍可能带来 ±0.005 级 Dice 波动——论文报告建议多种子均值±标准差(3-5 个种子),单次运行分数不做结论。
F15:切片少、类别多,loss 怎么选?
主流组合是 Dice Loss(或其多类软形式)+ 交叉熵的加权混合:Dice 抗类别不平衡、CE 提供逐像素梯度密度。三个额外建议:病理类(1220/2221)可加权重;背景不做过度抑制(血池/正常心肌占大面积);训练早期若 Dice 不收敛,先检查是不是解码问题而不是调 loss——全空预测会让 Dice 类 loss 的梯度行为很怪。
事实清单(硬事实 36 条)
- MyoPS 全称 Myocardial Pathology Segmentation Combining Multi-Sequence Cardiac Magnetic Resonance,多序列 CMR 心肌病理分割挑战。
- 组织方为复旦大学庄吓海(Xiahai Zhuang)组;门户 zmic.org.cn,复旦页 sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/。
- 两届主干:MyoPS 2020(MICCAI 2020 首届)+ CARE MyoPS++ 2024(MICCAI 2024 CARE track4)。
- MyoPS 2020 数据 = 45 例 AMI 患者三序列配齐 = 25 训练(公开金标准)+ 20 测试(金标准加密)。
- 训练 25 例共 306 个 2D 切片 = 102 例 × 3 序列;每序列 2-6 层短轴。
- spacing:min (0.73,0.73,12)、median (0.73,0.73,14)、max (0.76,0.76,23) mm。
- 体数据尺寸 408×392×2 至 512×511×6;MDPI 引文口径面内约 0.75×0.75 mm。
- 标签值编码:scar=2221、edema=1220、normal myocardium=200、LV blood pool=500、RV blood pool=600。
- 金标准由三名独立受训观察者逐层勾画取平均。
- 数据"directly collected from the clinic without any selection"(无选择连续入组)。
- 包结构:test20 / train25 / train25_myops_gd / MyoPS2020_EvaluateByYourself。
- 测试金标准加密命名形如 myops_test_201_gdencrypt.nii.gz;评估工具箱独立直链 sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/test_image_evaluation_kit.zip。
- 全部数据预对齐到公共空间(MvMM,Zhuang & Shen, IEEE TPAMI 2019, 41(12):2933-2946)。
- 2020 运营:76 注册申请、65 队参赛、23 份测试提交、15 支算法入选公开基准;每队测试提交≤2 次;平台 CMT。
- 15 法平均 Dice:scar 0.614、edema 0.644;平均像素精度 scar 83.6%、edema 74.3%。
- 2020 冠军 UESTC(电子科技大学):scar 0.708、edema 0.731。
- 15 支入选算法全部为深度学习,多数 U-Net 变体;两阶段 ROI+分割与重度增强(含 SPADE 合成)是常见策略。
- 队列人口学:56.2±7.92 岁,45 男/0 女(全男性);见基准论文 Table I(arXiv 2302.03537)。
- 基准论文:arXiv:2201.03186(2022)“MyoPS: A benchmark of myocardial pathology segmentation…”;MedIA 正式版 Li et al. 2023, 87:102808。
- arXiv 论文页许可 CC BY-NC-SA 4.0(论文许可,非数据许可)。
- 数据集本体无显式开源许可证声明;获取需签 data agreement。
- Funding:NSFC 61971142 / 62111530195 / 62011540404 + 上海市人才发展基金 2020015。
- CARE MyoPS++ 2024:250 患者 / 7 中心(中法英)= 145 三序列 + 24 bSSFP+LGE + 81 仅 LGE。
- 中心分布:A=81(仅 LGE)/B=50/C=45/D=50/E=7/F=9/G=8;训练=中心 A,B,C,E,F,G(200 例);验证/测试各 25 例来自中心 D。
- CARE 预处理:LGE/T2 取舒张末期;发布 MvMM 预对齐与未对齐两版;测试提交用对齐版。
- CARE 命名:[PatientID]_LGE/_T2/_C0/_gd.nii.gz;时间线 2024-05-10 训练发布 → 2024-10-10 workshop。
- CARE 规则:仅自动方法、禁外部数据、禁预训练模型;指标 DSC/PRE/SEN/SPE。
- CARE 联系人:dingwangbin@fjmu.edu.cn(福建医科大学)、21110980009@m.fudan.edu.cn、zhangyang23@m.fudan.edu.cn。
- 病理结论:edema 大而连续易分;scar 斑块状不规则难分;基底部/心尖部层面显著差;模型不确定性与观察者分歧相关。
- 衍生 scribble 标注(Zhang & Zhuang 2022a/2023);社区常用 20/5/20 切分(MedCL arXiv 2503.22890 披露)。
- MSCMRseg(2018/19)为 45 例 LGE 结构分割挑战,与 MyoPS 相邻但任务不同(例数 45 为巧合)。
- MyoPS-Net(Qiu et al., MedIA 2023, 84:102694)另含 50 对五序列私有集;Ding et al. 方法论文载 IEEE TMI 2023。
- 参赛方法论文收入 Springer LNCS 挑战论文集(例:Altunok & Oksuz, pp.128-137)。
- CARE 2024 官网为 http 协议(zmic.org.cn/care_2024/track4/),声明各中心伦理批准+匿名化;2026-09-27 抓取核验。
- 病理只勾画在左心室心肌上,右心室心肌的病理不在标注范围(RV 区域仅标血池)。
- scar 体积中位数约 26.1 cm³、edema 体积中位数约 18.89 cm³(训练队列体积统计量级参照)。
术语表(40 条)
- MyoPS:Myocardial Pathology Segmentation,多序列 CMR 心肌病理分割挑战;“Myo”=心肌。
- bSSFP:balanced Steady-State Free Precession,稳态自由进动序列;本数据集代号 C0,提供解剖边界。
- LGE:Late Gadolinium Enhancement,钆延迟强化;本数据集代号 DE,瘢痕评估金标准序列。
- T2-weighted:T2 加权序列;水肿敏感,信噪比低。
- edema(水肿):AMI 后心肌含水量增加区域,T2 高信号,标签值 1220;代表"可挽救心肌"(area at risk)。
- scar(瘢痕):心肌梗死后纤维化坏死区,LGE 高信号,标签值 2221;代表不可逆损伤。
- AMI:Acute Myocardial Infarction,急性心肌梗死;本数据集全部病例的病因。
- 短轴位(short-axis):垂直于左心室长轴的标准心脏 MRI 切面;本数据集全部为短轴层。
- 层间距(slice spacing):相邻层面中心距;本数据集 12-23 mm,远大于面内分辨率,决定其稀疏堆叠性质。
- 2.5D:以相邻层面为通道的伪三维方法;本数据集上比真 3D 更合理。
- MvMM:Multimodal Varying Manifold Model,多模态变化流形模型;跨模态联合配准-分割概率框架,数据预对齐所用方法。
- 标签值编码:掩码整数存的是类别字面值(200/500/600/1220/2221)而非 0-4 索引。
- Dice / DSC:Dice Similarity Coefficient,分割重叠度指标,2|A∩B|/(|A|+|B|)。
- CARE:Comprehensive Application-oriented Challenge on Real-world data,MICCAI 2024 挑战品牌;MyoPS++ 为 track4。
- CMT:2020 届测试提交所用的官方在线评测平台。
- data agreement:数据使用协议;获取 2020 测试自评权限与 CARE 2024 数据的前置签署文件。
- 加密金标准:以加密 .nii.gz 发布的测试真值(*_gdencrypt.nii.gz),配官方评估器实现本地自评而不泄露真值。
- EvaluateByYourself:官方自评工具包目录名,含评估脚本与加密金标准。
- scribble 标注:官方衍生的线条笔触稀释标注,用于弱监督分割研究;常用切分 20/5/20。
- MSCMRseg:同一组织方 2018/19 的 LGE 结构分割挑战(45 例 LV/RV/Myo),与 MyoPS 是两个数据集。
- MyoPS-Net:组织方方法延伸(Qiu et al., MedIA 2023),含 50 对五序列私有集。
- U-Net 变体:编码-解码分割网络家族;2020 届 15 支入选算法的主流主干。
- 两阶段流水线:先 ROI/心肌定位、后病理分割的解耦策略;2020 届主流。
- SPADE 增强:空间自适应合成式数据增强;2020 届个别队伍用于扩充小样本。
- 部分容积效应:层厚大导致体素内混合多种组织信号;基底部/心尖部分割难度高的主因。
- 舒张末期(end-diastole):心室充盈最大的时相;CARE 2024 统一取 LGE/T2 舒张末期帧。
- 域泛化(domain generalization):跨中心/跨厂商 unseen 域性能;M&Ms-2 与 CARE 2024 的共同母题。
- 观察者间变异(interobserver variability):不同标注者的一致性差异;MyoPS 金标准"取平均"的由来。
- NIfTI(.nii.gz):神经影像通用格式;本数据集图像与掩码的存储格式。
- MICCAI:医学图像计算与计算机辅助介入国际会议;两届挑战的举办框架。
- DE(delayed enhancement):延迟强化,2020 届对 LGE 序列的文件命名代号;与 LGE 同指一序列。
- C0:2020 届对 bSSFP 序列的文件命名代号;两届通用。
- ROI 解耦:先定位心肌/心室感兴趣区、再在裁剪区内做精细分割的两阶段策略。
- 患者级切分(patient-level split):以患者为单位划分训练/验证/测试,防止切片级泄漏的最小合规单位。
- 舒张期/收缩期:心动周期的心室充盈相与射血相;跨序列对比必须在同一时相(CARE 2024 取舒张末期)。
- 数据集漂移(dataset shift):训练与部署数据分布不一致的现象;CARE 2024 的中心隔离切分即其制度化模拟。
- 弱监督(weak supervision):用稀疏/不精确标注(如 scribble)训练分割模型的方向;MyoPS 官方衍生标注服务的对象。
- 不确定性图(uncertainty map):模型输出置信度的空间可视化;基准论文证明其与专家分歧区域高度重合,可指导人工复核。
- 黑血/亮血成像:CMR 的两类对比策略;bSSFP 属亮血技术,血池高信号是其边界可靠性的来源。
- 标签图(label map)模式:医学影像查看器中按类别着色(而非灰度拉伸)显示掩码的模式;查看 1220/2221 大标签值时的正确姿势。
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| 条目 slug | myops |
| 数据集名 | MyoPS(Myocardial Pathology Segmentation Combining Multi-Sequence CMR) |
| 组织方 | 复旦大学庄吓海组(zmic.org.cn) |
| 两届主干 | MyoPS 2020(45 例=25+20);CARE MyoPS++ 2024(250 例/7 中心) |
| 模态 | CMR 短轴三序列:bSSFP(C0)/T2/LGE(DE) |
| 任务 | 心肌病理分割(edema=1220、scar=2221 为主评;LV/RV/normal 辅助) |
| 基准论文 | arXiv:2201.03186;Li et al., MedIA 2023, 87:102808 |
| 冠军 | UESTC:scar 0.708 / edema 0.731(15 法平均 0.614/0.644) |
| 许可 | 数据无显式 license(data agreement 框架);论文页 CC BY-NC-SA 4.0 仅论文 |
| 获取 | 2020 训练集公开直链;测试金标准加密+官方工具箱;CARE 2024 注册+协议 |
| 官方页 | zmic.org.cn;sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/ |
| CARE 2024 官网 | zmic.org.cn/care_2024/track4/(http 协议) |
| 联系人 | dingwangbin@fjmu.edu.cn;21110980009@m.fudan.edu.cn;zhangyang23@m.fudan.edu.cn |
| Funding | NSFC 61971142 / 62111530195 / 62011540404;上海人才发展基金 2020015 |
| 抓取核验 | 2026-09-27 |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 官方页+MICCAI 门户+zmic 门户三入口可检索;基准论文 arXiv 与 MedIA 高被引;无统一 DOI 指向数据本体,扣 2 |
| A 可获取性 | 6 | 2020 训练集公开直链零门槛;测试金标准加密(依赖官方工具箱自评);CARE 2024 注册+data agreement 门槛;无显式开源许可证 |
| I 可交互性 | 7 | NIfTI 标准格式+nibabel 即读;标签值编码需显式解码(有事故率);两届命名体系不统一 |
| M 元数据完备性 | 7 | 官方公布 spacing 统计、尺寸范围、切分口径、标签值表;但无机器可读元数据文件(JSON/YAML),人口学仅论文 Table I |
| S 可持续性 | 7 | 学术机构长期维护(2020-2024 两届延续),评估工具箱与加密金标准模式可持续;依托课题组个人服务器(sdspeople)有单点风险 |
DAIMS 总分 35/50(加权均值 7.0/10):定位为"获取有门槛、工程质量高"的挑战赛型数据集。可获取性是主要短板(加密金标准+无显式 license),工程纪律(可复现自评闭环)是主要长板。
对照库内光谱解读这组评分:公开直链型数据集(如 ACDC 类)D/A 双高但评测配套弱;请求制数据集(如掩码请求制类)A 偏低;MyoPS 的差异化在于用"加密+官方评估器"部分补偿了"拿不到测试真值"——你拿不到数据本体,但拿得到与官方一致的评分能力。这种"评分能力开放、真值封闭"的组合在 AI-Ready 评估里应视为中间形态,而非简单扣分项。
附录 C:逐项证据链自证
| 关键事实 | 证据源 | 性质 |
|---|---|---|
| 45 例=25 训练+20 测试 | openmedlab 文档 + arXiv 2302.03537 + MDPI 引文 | 三方互证 |
| 标签值 200/500/600/1220/2221 | openmedlab + 基准论文标签定义 | 双源互证 |
| 306 切片(102×3) | openmedlab + 官方页数据说明 | 双源互证 |
| spacing min/median/max | 官方页/基准论文数据节 | 一手来源 |
| 76/65/23/15 运营数字 | 基准论文(Li 2023 MedIA) | 一手来源 |
| 15 法平均与冠军分数 | 基准论文结果表 | 一手来源 |
| 冠军 UESTC | 基准论文 | 一手来源 |
| 45M/0F、56.2±7.92 岁 | arXiv 2302.03537 Table I | 一手来源 |
| MvMM 与 TPAMI 出处 | IEEE TPAMI 2019, 41(12):2933-2946 | 一手来源 |
| CARE 250/7 中心/145+24+81/中心分布 | CARE 官网 track4 页(2026-09-27 抓取) | 一手来源 |
| CARE 时间线与规则 | CARE 官网(http) | 一手来源 |
| 联系邮箱 | CARE 官网联系节 | 一手来源 |
| NSFC 与上海人才基金 | 基准论文致谢节 | 一手来源 |
| scribble 与 20/5/20 | Zhang & Zhuang 2022a/2023 + MedCL arXiv 2503.22890 | 双源互证 |
| MyoPS 2022 无独立届次 | 四轮检索未命中(zmic/zenodo/数字限定/变体) | 否定性存照 |
| MICES 不存在 | 三轮检索证伪(改道依据) | 否定性存照 |
| scar/edema 体积中位数(26.1/18.89 cm³) | 基准论文体积统计 | 一手来源 |
| 弱监督 20/5/20 切分口径 | MedCL arXiv 2503.22890 | 一手来源 |
| 病理仅勾画左心室心肌 | 基准论文勾画协议 | 一手来源 |
| brief 误述"肌肉 MRI" | 任务简报 vs 官方全称 | 双口径存照 |
| CARE 中心划分 A-G | CARE 官网 track4 页 | 一手来源 |
| "仅自动方法/禁外部/禁预训练"规则 | CARE 官网规则节 | 一手来源 |
附录 D:数据获取决策树
你要做什么?
├── 只训练(不需要测试金标准)
│ └── 下载 MyoPS 2020 train25 + train25_myops_gd(公开直链)
│ ├── 想要弱监督 → 另找官方 scribble 标注(20/5/20 口径)
│ └── 想要 3D → 先读坑 6(稀疏短轴,改 2D/2.5D)
├── 要复现 2020 榜单
│ └── test20 + MyoPS2020_EvaluateByYourself(官方工具箱自评)
│ ├── 需要明文测试金标准 → 邮件组织方说明学术理由
│ └── 评测 → 必须用官方脚本,勿自写(坑:空切片口径)
├── 要做真实世界/缺序列/未对齐
│ └── 注册 CARE MyoPS++ 2024(签 data agreement)
│ ├── 训练域:中心 A(仅LGE)+B+C+E+F+G
│ ├── 提交:对齐版测试 → 官方评估平台
│ └── 规则红线:仅自动方法/禁外部数据/禁预训练
├── 只想做配准研究
│ └── CARE 2024 未对齐版输入 + 对齐版参考(§FAQ C7)
├── 要做教学
│ └── 训练集 + 课程练习;学生自行注册下载,教师不打包分发(§FAQ A7)
└── 要商用
└── 无公开路径 → 邮件 dingwangbin@fjmu.edu.cn 等书面授权
附录 E:类别映射与使用规范
| 标签值 | 英文 | 中文 | 评测 | 使用建议 |
|---|---|---|---|---|
| 0 | background | 背景 | — | 解码后索引 0 |
| 200 | normal myocardium | 正常心肌 | 否 | 结构分割辅助监督 |
| 500 | LV blood pool | 左心室血池 | 否 | ROI 定位/解剖预训练 |
| 600 | RV blood pool | 右心室血池 | 否 | 同上 |
| 1220 | edema | 心肌水肿 | 是 | 主评对象;Dice 单列 |
| 2221 | scar | 心肌瘢痕 | 是 | 主评对象;Dice 单列 |
解码骨架(与 §4.2 代码一致):
LABEL_MAP = {200: 1, 500: 2, 600: 3, 1220: 4, 2221: 5} # 0 留给背景
# 评测只用索引 4(edema)与 5(scar)
跨届注意:CARE 2024 金标准([PatientID]_gd.nii.gz)沿用同一标签值体系,但部分病例(仅 LGE 组)的掩码可能只含病理相关类——加载后先做值域检查再入训练循环。
对可视化工具(如 3D Slicer/ITK-SNAP)的两条提示:其一,加载后手动设窗宽窗位或标签色表时,色表条目按标签值命名(200-normal/500-LV/600-RV/1220-edema/2221-scar),避免默认色表把大数值标签截断;其二,若工具默认把掩码当灰度图拉伸显示,病理类会"隐形"——先切换为标签图(label map)模式再叠加。
附录 F:从零复现 2020 榜单的工程骨架
以下骨架假设单机单卡环境,目标是把"官方包→榜单口径分数"的完整链路一次搭通;方法创新在链路跑通之后再做。
# 1. 下载官方包(官方页直链)
# MyoPS2020/{test20, train25, train25_myops_gd, MyoPS2020_EvaluateByYourself}
unzip MyoPS2020.zip -d MyoPS2020
# 2. 评估工具箱独立直链(如包内缺失)
# sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/test_image_evaluation_kit.zip
# 3. 数据加载与解码骨架(2D 逐层)
import nibabel as nib, numpy as np, glob
LABEL_MAP = {200: 1, 500: 2, 600: 3, 1220: 4, 2221: 5}
def load_case(case_dir, pid):
seqs = {}
for tag, name in [("C0", "C0"), ("DE", "DE"), ("T2", "T2")]:
seqs[tag] = nib.load(f"{case_dir}/myops_train_{pid}_{name}.nii.gz").get_fdata()
gd = nib.load(f"{case_dir}/myops_train_{pid}_gd.nii.gz").get_fdata()
label = np.zeros_like(gd, dtype=np.uint8)
for val, idx in LABEL_MAP.items():
label[np.isclose(gd, val)] = idx
return seqs, label # z 轴 2-6 层:按层切 2D 样本,勿做 z 向插值
# 4. 训练要点(对齐 2020 届主流做法)
# - 2D U-Net 变体;两阶段:C0 上定位心肌 ROI → 三序列裁剪区上分病理
# - 空间增强三序列+掩码同步;强度增强按序列独立
# - 比赛只评 idx 4(edema)/idx 5(scar)的 Dice
# 5. 测试自评(不接触明文金标准)
cd MyoPS2020/MyoPS2020_EvaluateByYourself
# 按工具箱说明放置推理结果(命名对齐 myops_test_201-220)
# 运行官方评估脚本 → 得到 scar/edema Dice(对齐榜单口径)
# 6. 对照基准:15 法平均 scar 0.614 / edema 0.644;冠军 0.708 / 0.731
# 系统性偏低 → 先查标签解码与空切片口径,再查模型
使用声明模板:本工作使用了 MyoPS 挑战赛数据集(Li et al., MedIA 2023, 87:102808;arXiv:2201.03186),数据经官方渠道获取并遵守 data agreement;预对齐基于 MvMM(Zhuang & Shen, IEEE TPAMI 2019, 41(12):2933-2946)。
附录 G:两届挑战全景对照总表(检索者速查)
| 维度 | MyoPS 2020 | CARE MyoPS++ 2024 |
|---|---|---|
| 会议框架 | MICCAI 2020 | MICCAI 2024(CARE track4) |
| 病例总数 | 45 | 250 |
| 训练/验证/测试 | 25 / — / 20 | 200 / 25 / 25 |
| 中心 | 1(中国) | 7(中法英) |
| 序列配置 | 全三序列 | 145 三序列+24 双序列+81 仅 LGE |
| 训练中心 | — | A,B,C,E,F,G |
| 验证/测试中心 | — | D |
| 序列代号 | C0 / DE / T2 | C0 / LGE / T2(命名 PatientID_XXX) |
| 对齐状态 | MvMM 全预对齐 | 双版发布(对齐+未对齐) |
| 预处理要点 | 屏气、同心动周期 | LGE/T2 取舒张末期 |
| 标签体系 | 200/500/600/1220/2221 | 沿用同体系 |
| 评测类 | scar+edema | scar+edema(扩展 DSC/PRE/SEN/SPE) |
| 方法限制 | 每队提交≤2 次 | 仅自动/禁外部/禁预训练 |
| 测试真值形态 | 加密+自评工具箱 | 官方平台在线评测 |
| 运营数字 | 76 注册/65 队/23 提交/15 入选 | 官网未公布完整运营数 |
| 时间线 | MICCAI 2020 年会 | 2024-05-10 发布→2024-10-10 workshop |
| 官网 | zmic.org.cn(MyoPS 2020 页) | zmic.org.cn/care_2024/track4/(http) |
此表与本条目 §5.4 的对照表互为补充:§5.4 偏"规则与流程",本表偏"数据与事实"。写数据集对比论文时建议直接合并两表使用;单独引用时注明届次与抓取时点(2026-09-27),CARE 2024 的运营数字(报名/提交量)官网未公布,表中留白即事实状态,不要用第三方转述填补。
附录 H:多序列融合方法分类与 MyoPS 上的表现
面向"读完就能选型"的整理,融合位置的分类与本数据集上的已知证据:
| 融合层级 | 机制 | 在 MyoPS 上的证据 |
|---|---|---|
| 像素级(早期) | 三序列拼接为多通道输入 | 15 法常见;实现简单,性能与中期融合无显著差 |
| 特征级(中期) | 各序列独立编码器+跨序列注意力/跳跃连接 | 15 法少数;无压倒性优势——融合层级是开放问题(§8.5) |
| 决策级(后期) | 各序列独立分割再融合输出 | 个别队伍;灵活应对缺序列但丢跨模态细节 |
| 两阶段解耦 | C0 结构定位→ROI 内病理分割 | 主流;把易任务(结构)与难任务(病理)分开 |
| 模态 dropout | 训练随机丢序列通道 | CARE 2024 缺序列设定的主流应对(§3.4) |
| 模态蒸馏 | 全序列教师→缺序列学生 | CARE 2024 中心 A(仅 LGE)场景的应对 |
选型建议:入门用两阶段+早期融合起步(与 15 法主流对齐,复现性最好);研究创新点放在中期融合或缺序列鲁棒(开放问题所在);面向 CARE 2024 交付时先读规则(§5.4)再定架构。
一个反直觉的提醒收尾:融合越"重"不一定越好。中期融合的跨序列注意力参数量可观,而训练集只有 306 个切片——参数增长与数据规模严重失配时,重型融合模块容易过拟合到训练中心的采集风格。文献里"轻量融合+强增强+两阶段"跑赢"重型融合"的例子不少见;做架构决策时,先用参数量与训练样本量的比值做个 sanity check(本数据集上每参数摊到的监督像素非常有限)。
附录 I:常见错误代码对照(错误写法 vs 正确写法)
# 错误 1:把标签值当索引遍历 → 全空掩码
for i in range(5):
mask_i = (gd == i) # 全空:掩码里根本没有 0-4
# 正确 1:显式标签值映射
LABEL_MAP = {200: 1, 500: 2, 600: 3, 1220: 4, 2221: 5}
mask = np.zeros_like(gd, dtype=np.uint8)
for val, idx in LABEL_MAP.items():
mask[np.isclose(gd, val)] = idx
# 错误 2:浮点直接相等比较 → 漏配部分体素
mask = (gd == 2221).astype(np.uint8) # 浮点存储尾差导致漏配
# 正确 2:np.isclose 吸收浮点误差
mask = np.isclose(gd, 2221).astype(np.uint8)
# 错误 3:患者级数据泄漏的切分
slices = glob.glob("train25/*/C0*.nii.gz") # 按切片切 folds
train, val = random_split(slices, [0.8, 0.2]) # 同患者切片跨集泄漏
# 正确 3:患者级分组切分
pids = list(range(1, 26)) # 25 例患者
folds = np.array_split(np.random.permutation(pids), 5)
# fold 内再展开成切片;验证分数才可信
# 错误 4:对稀疏短轴做 z 向 3D 重采样 → 虚假平滑
img_3d = zoom(data, (1, 1, 8), order=3) # 12mm→1.5mm 纯属编造
# 正确 4:保持 2D 逐层,或相邻层作通道(2.5D)
x = np.concatenate([c0[:,:,k-1:k+2], t2[:,:,k:k+1], de[:,:,k:k+1]], axis=-1)
附录 J:临床落地场景与部署提示
MyoPS 训练的模型在真实临床管线里的四个候选落点,各自的对接要求:
- AMI 出院前报告自动定量:输入三序列 CMR → 输出 scar/edema 体积与占比(scar 体积中位数约 26.1 cm³、edema 约 18.89 cm³ 的量级参照)→ 对接结构化报告。要求:置信度阈值+低置信区人工复核(§7.3 的不确定性证据支持这一设计)。
- 血运重建术后随访对比:同一患者前后两次扫描的 scar 变化定量。要求:跨时相配准(本数据集未覆盖,需自行解决)。
- T2 缺失场景的水肿估计:仅 LGE/bSSFP 输入时输出水肿概率图。要求:明确标注"模型在缺序列输入下未经充分验证的边界"——CARE 2024 的缺序列设定是训练素材但测试域三序列配齐,缺序列测试性能需自行补验证。
- 科研队列的表型量化:大规模 CMR 队列(如 UK Biobank 风格)的病理筛查。要求:注意队列人口学与 MyoPS(45 例全男性 AMI)的差异,先做小样本域适应验证。
- 弱监督标注预填:新采集临床数据先由 scar/edema 模型预填勾画草稿、医生修正。要求:预填模型在小样本域的失败模式(漏掉小瘢痕灶)恰好是医生最容易漏看的方向——预填系统应同时输出不确定性图,把"模型没把握"和"医生没注意"双保险叠加。
共同红线:MyoPS 金标准是"平均专家意见"(§4.5),模型输出应作为"第二意见"而非"真值替代";报告模板中保留医生复核字段。
附录 K:检索关键词包(文献与数据检索用)
中文:心肌病理分割;多序列心脏磁共振;心肌水肿分割;心肌瘢痕分割;急性心肌梗死 CMR;多模态医学图像融合;心脏挑战赛。
英文:MyoPS challenge;myocardial pathology segmentation;multi-sequence CMR segmentation;bSSFP T2 LGE fusion;edema and scar segmentation;multimodal varying manifold model(MvMM);CARE MyoPS++;MICCAI challenge cardiac pathology。
组合提示:检索 2020 届事实时优先组合 “MyoPS 2020” + “benchmark”/“segmentation”;检索 2024 届时用 “CARE MyoPS++” 或 “MyoPS 2024”;避免用 “MyoPS 2022”(无独立届次证据,§9.4);避免 “MyoPS muscle MRI”(误称来源,见 FACTS 存照)。
布尔检索式示例(可直接粘贴到学术检索引擎):
- 基准事实:
"MyoPS" AND ("benchmark" OR "challenge") AND "cardiac" - 方法线:
"multi-sequence" AND "CMR" AND ("edema" OR "scar") AND "segmentation" - 2024 届:
"CARE" AND "MyoPS"(或限定 2024 年份 + MICCAI) - 弱监督线:
"MyoPS" AND ("scribble" OR "weakly supervised") - 理论线:
"multimodal varying manifold" OR ("MvMM" AND Zhuang)
附录 L:官方评估工具箱使用 FAQ(MyoPS2020_EvaluateByYourself)
L1:工具箱里有什么?
评估脚本(计算 scar/edema 的 Dice 等指标)与加密测试金标准(myops_test_201_gdencrypt.nii.gz 等 20 个文件)。脚本在本地解密评分,不暴露明文真值——这是"可复现"与"保密"的平衡设计。
L2:独立下载地址?
sdspeople.fudan.edu.cn/zhuangxiahai/0/myops20/test_image_evaluation_kit.zip(官方页亦随包发布)。
L3:评估脚本报"尺寸不匹配"怎么办?
你的推理输出被预处理改过(裁剪/重采样)而未还原。正确姿势:推理 pipeline 的最后一步必须把预测掩码还原到原始测试图像的几何(尺寸+spacing+origin 对齐)——用 SimpleITK 的 CopyInformation 或 nibabel 的 affine 回写。
L4:分数与论文对不上但差异不大,正常吗?
0.01-0.02 的浮动通常来自实现细节(插值边界、空切片口径);系统性偏差(>0.05)几乎都是标签解码或几何还原错误。先跑"训练集交叉验证"校准自己的评测实现与官方口径的差异,再评估测试分数。
L5:能反解加密金标准吗?
不要尝试。技术上是对工具箱的逆向工程,违反 data agreement 的精神与条款;学术信誉成本远高于收益。需要测试真值做离线分析时,邮件组织方说明用途——挑战方对合理学术请求通常有正规通道。
L6:工具箱支持 Windows/macOS 吗?
工具箱以 Python 脚本为主体,跨平台可用;依赖以包内 README 为准。若脚本依赖特定 nibabel/SimpleITK 版本,按 README 锁定版本——工具箱的分数口径与依赖版本绑定,升级依赖前先验证一份已知结果。
附录 M:写作与引用模板包
论文数据节模板:
We used the MyoPS challenge dataset (Myocardial Pathology Segmentation combining multi-sequence CMR), comprising 45 patients with acute myocardial infarction scanned with bSSFP, T2-weighted, and LGE sequences (25 training cases with public gold standard, 20 testing cases with encrypted labels evaluated via the official toolkit). Data were pre-aligned to a common space using MvMM. The benchmark results of 15 selected algorithms are reported in Li et al. (Med Image Anal 2023;87:102808).
限制节(limitations)模板要点:
- 训练队列规模小(25 例/306 切片),结论外推需谨慎;
- 队列全男性(45M/0F),性别泛化未验证;
- 金标准为三观察者平均,携带标注协议固有的不确定性;
- 稀疏短轴(层间距 12-23 mm)限制 3D 上下文利用;
- (若用 CARE 2024)训练域与测试域来自不同中心,跨中心性能已由赛制约束但真实部署仍需本地验证。
模型卡(model card)建议字段:训练数据(届次+切分口径)、评测工具(官方工具箱版本)、指标(Dice per class)、已知盲区(基底/心尖层面、非缺血性病理、女性患者)、许可(数据经 data agreement 获取,模型权重许可见你的项目条款)。
对照实验声明模板(与结构分割数据集混用时):
Scores on MyoPS are not directly comparable to structural segmentation benchmarks (e.g., ACDC) due to differences in task definition (pathology vs. structure), annotation protocol (3-observer averaged vs. single expert), and image geometry (sparse vs. contiguous short-axis stacks).
BibTeX 快速引用块(四件套):
@article{myops_benchmark,
title={MyoPS: A benchmark of myocardial pathology segmentation combining
three-sequence cardiac magnetic resonance images},
journal={Medical Image Analysis},
volume={87}, pages={102808}, year={2023},
note={arXiv:2201.03186}
}
@article{mvmm,
author={Zhuang, Xiahai and Shen, Jiahang},
title={Multimodal Varying Manifold Model for Multimodal Registration
and Segmentation of Cardiac MRI},
journal={IEEE Transactions on Medical Imaging (under the name IEEE TPAMI)},
volume={41}, number={12}, pages={2933--2946}, year={2019}
}
附录 N:从数据到论文的完整工作流(6 周参考计划)
给"第一次做 MyoPS 课题"的团队一份时间线参考(单人+单 GPU 的量级估算):
| 周 | 里程碑 | 关键动作 |
|---|---|---|
| 第 1 周 | 数据就绪 | 官方包下载→§4.7 五步抽查→数据加载器+值域断言→复现一版简单基线(2D U-Net 单序列) |
| 第 2 周 | 基线对齐 | 三序列早期融合基线→官方自评工具箱打通→分数落进 15 法区间(scar 0.5-0.7)即健康 |
| 第 3 周 | 方法迭代 | 两阶段 ROI 解耦→序列定制增强→患者级 5-fold 交叉验证锁定模型选择协议 |
| 第 4 周 | 消融实验 | 融合层级消融(早/中/晚)→缺序列消融(模拟 dropout)→逐例分数分析定位薄弱病例 |
| 第 5 周 | 测试自评 | 测试 20 例推理→几何还原→官方工具箱评分→与训练 CV 分数差>0.05 时回头查泄漏/域移 |
| 第 6 周 | 成文 | 按 §7.7 规范报告→附录 M 模板写数据节与限制节→引用四件套核对(§8.1) |
两条经验规则:其一,第 2 周末的"分数落区间"是整个计划的咽喉——落不进 15 法区间就不要往下走,先修实现;其二,患者级切分协议必须在第 3 周锁定并冻结,之后任何"调参顺手改切分"的冲动都是向泄漏让步。
按社区反馈频率排的返工 Top3(提前知道可以全部避开):
- 评测口径返工:自写评测与官方口径不一致,全部实验重跑——对策:第 1 周就用官方工具箱校准(附录 L4)。
- 几何还原返工:测试输出的 spacing/origin 未对齐,官方评估拒收或分数异常——对策:预处理链路的还原步骤从一开始就写进代码(附录 L3)。
- 切分口径返工:先按切片切分做了全部实验,投稿前被指出泄漏——对策:第 3 周冻结患者级协议(正文附录 N 第 3 周)。
本条目由千方病案医数集生产管线生成;事实抓取与核验时点 2026-09-27;FACTS 档案见 writing/myops/FACTS.md。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- cmrxmotion — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lvquant — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- emidec — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- mm-whs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lascarqs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- cmrxrecon — 共享标签:医学影像 / MRI / 挑战赛数据集 / 心血管疾病
- mms — 共享标签:医学影像 / MRI / 医学图像分割 / 心血管疾病
- camus — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

