信息速览
INFOBOX — MM-WHS 一屏速览
维度 内容 本质 MICCAI-STACOM 2017 首届多模态全心分割挑战赛数据集(非静态发布包,评测服务长期运行) 团队 复旦大学 ZMIC Lab(庄吓海 Xiahai Zhuang)主办;联合 Imperial College London(Guang Yang)、上海交通大学(Lei Li) 论文 Med Image Anal. 2019 Dec;58:101537(doi:10.1016/j.media.2019.101537;PMID 31446280;arXiv:1902.07880) 数据 120 例 3D 心脏影像 = 60 CT/CTA + 60 MRI;训练 20 CT + 20 MRI,测试 40 CT + 40 MRI 标注 训练集逐体素手工分割 七类:LV=500 / RV=600 / LA=420 / RA=550 / Myo=205 / AO=820 / PA=850 规格 CT 面内约 0.78×0.78 mm、层厚约 1.60 mm;MRI 3D b-SSFP,采集约 2 mm 重采样约 1 mm;NIfTI 指标 generalized Dice + Jaccard + surface-to-surface distance(盲评) 评测规模 论文:CT 10 算法 + MRI 11 算法,来自 12 个团队 核心发现 CT 全心分割整体优于 MRI;DL 潜力大但盲评方差大、若干方法表现差;传统多图谱方法稳健 引用量 Google Scholar 420 / Semantic Scholar 366 / PlumX 289(三源口径,抓取时点) 续作 CARE-Whole Heart(MICCAI 2025 CARE,246 例 8 中心,沿用同套 205-850 标签与 MM-WHS 训练编号) 获取 请求制:签署注册表 → 组织者批准 → 发链接(FDU server / MEGA) 许可 数据:接受方承诺不向第三方传播,组织方称永久开放|论文:Elsevier open access 库内互链 CARE-Whole Heart(官方续作)、ACDC(同届 STACOM 2017 挑战)、LAScarQS 2022(MM-WHS 附属 WHS 复用)
MM-WHS 是"在真实临床噪声里逼出可信全心分割"的一场竞赛式数据集工程:它不追求图像干净整齐,反而刻意保留多中心、多设备、质量参差甚至偏劣的 CT 与 MRI——因为全心分割(WHS)算法若只在精修数据上表现好,就永远进不了诊室。它用 120 例 3D 心脏影像、一套跨模态统一的七结构标签(205-850)、以及一个至今仍在运行的盲评服务,把"多模态全心分割"从一个研究话题推成了领域标准基准。十余年来,任何声称"能分割全心"的算法,几乎都要先在这 120 例上接受一次公开体检。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——MM-WHS 是请求制(签署注册表经批准),没有公开直链,别按"公开下载"去找。
- 关心评测与方法:直奔 §4 挑战赛结果——CT vs MRI 的分层、DL 与多图谱的攻防、盲评方差,是全条目的技术核心。
- 要做域自适应/半监督:直奔 §5 与 §7——MM-WHS 的 CT↔MRI 跨模态差异与"20 标注 + 40 未标注"结构,正是域自适应与半监督分割的经典试验床。
§0 导读:这个数据集解决什么问题
全心分割(Whole Heart Segmentation, WHS)是心脏影像计算的"底盘任务":把心脏影像里左心室、右心室、左右心房、心肌、升主动脉、肺动脉这些亚结构逐个圈出来。它是心脏建模、功能分析、手术规划与术中导航的前置步骤——结构没分对,后面所有量化都无从谈起。但 WHS 手工分割极其耗时易错,自动分割又异常困难:心脏形态随心动周期剧烈变化,临床影像常有运动伪影、对比度噪声比差、视野不一致等问题。
在 MM-WHS 出现之前,这个领域有一个结构性痛点:各家算法在各自的数据集上各自报告,指标口径不一,根本无法横向比较。有人用 CT、有人用 MRI,有人只分左心室、有人分全心,Dice 的计算方式也各写各的。于是 MM-WHS 的定位就非常清晰——不是发布一份"最干净的数据",而是建立一个"公开、公平、可复现的比较框架"。它做三件事:提供统一的 120 例多模态数据(CT 60 + MRI 60)、统一的七结构标注口径、以及统一的盲评服务。
MM-WHS 的三重身份(读全条目前先分清):
- 作为数据集:120 例 3D 心脏影像,训练 20 CT + 20 MRI 带手工标注、测试 40 CT + 40 MRI 无公开标注——这是 §2、§3 的主体。
- 作为挑战赛与评测服务:2017 年 MICCAI-STACOM 首届,持续受理测试集提交并盲评——这是 §4、§6 的主体。
- 作为领域基准与生态源头:衍生出官方续作 CARE-Whole Heart、被大量域自适应/半监督工作当作标准测试床——这是 §5、§7、§8 的主体。
§0 读法三则:
- 这个条目是"数据集 + 挑战赛评测 + 基准生态"三合一:本体是 120 例影像与标注,评测是长期运行的盲评服务,生态是跨模态分割研究的公共参照系——三者获取方式一致(请求制)但使用边界不同(§6)。
- 全文所有硬数字都给出三源(官网 / 期刊论文 / 独立聚合站或引用论文)出处;凡一手来源之间有出入者,均在正文与坑点处并列存照(尤其标签编码,见坑 1)。
- 检索时若按"MM-WHS 是一个可以随便下载的公开数据集"去找会碰壁——它是签署注册表经批准的请求制数据集(坑 2);同时它的首页域名已从复旦旧域迁至 GitHub Pages,且首页已声明本体维护结束(坑 5)。
§1 数据集速览:十问十答
Q1:MM-WHS 是什么?名字怎么读?
全称 Multi-Modality Whole Heart Segmentation Challenge(多模态全心分割挑战赛),常写作 MM-WHS 或 MMWHS,也常带年份称 MM-WHS 2017。"多模态"指它同时提供 CT/CTA 与 MRI 两种成像模态;"全心"指分割对象覆盖整个心脏而非单一腔室。它是 MICCAI-STACOM 2017 举办的首届此类挑战赛。
Q2:数据规模到底是多少?
120 例 3D 心脏影像,CT/CTA 与 MRI 各 60 例。划分为训练集 20 CT + 20 MRI(含逐体素手工标注)与测试集 40 CT + 40 MRI(仅影像、无公开标注,供盲评)。也就是说,真正带标注、可自由下载使用的只有 40 例(20+20),另 80 例测试影像用于提交评测。
Q3:标注了哪些结构?标签值是多少?
七类,跨 CT 与 MRI 统一编码:左心室血腔 LV=500、右心室血腔 RV=600、左心房血腔 LA=420、右心房血腔 RA=550、左心室心肌 Myo=205、升主动脉 AO=820、肺动脉 PA=850,背景=0。注意这套编码不是连续的 1-7,复现老代码时必须做标签映射(坑 1)。
Q4:图像规格如何?
CT/CTA:常规 cardiac CT angiography 采集,覆盖腹上部至主动脉弓,轴位,面内分辨率约 0.78×0.78 mm、平均层厚约 1.60 mm。MRI:3D balanced steady state free precession (b-SSFP) 序列,各方向采集分辨率约 2 mm、重建(重采样)至约 1 mm。格式统一 NIfTI(.nii.gz)。
Q5:怎么获取?能直接下载吗?
不能直接下载。须签署 registration form(注册表)并发送给组织者(Lingchao XU、Lei LI),获批后由组织方发送链接——可选 FDU server 或 MEGA 镜像。接受方须承诺"不向第三方传播数据"。见 §6。
Q6:测试集怎么评测?
测试集不公开标注。参赛者须邮件提交算法简述与测试集分割结果(NIfTI,命名 ct_test_20??_label.nii.gz / mr_test_20??_label.nii.gz,图像信息须与原图完全一致),标题格式 “MM-WHS Test Result + Fully Name of the corresponding author”,由组织方盲评。一个方法仅允许评测一次。后期组织方也提供了用户自助评测工具。
Q7:论文是什么?
Zhuang X, Li L, Payer C, … Yang G. Evaluation of algorithms for Multi-Modality Whole Heart Segmentation: An open-access grand challenge. Medical Image Analysis, 2019;58:101537。doi:10.1016/j.media.2019.101537;PMID 31446280;PMCID PMC6839613;预印本 arXiv:1902.07880(2019-02-21)。同时收录于 STACOM 2017 Revised Selected Papers(Springer LNCS vol 10663)。
Q8:挑战赛结果如何?
CT 10 个算法 + MRI 11 个算法(来自 12 个团队)参评。主结论:CT 全心分割整体优于 MRI;深度学习方法潜力大但方差大,若干在盲评中表现差(疑过拟合);传统多图谱方法稳健但精度与效率有限。见 §4。
Q9:MM-WHS 现在还在维护吗?它有哪些续作?
官方首页已声明 MM-WHS 本体维护结束,新数据见 CARE-Whole Heart(MICCAI 2025 CARE 挑战赛 WHS 赛道,ZMIC Lab 组织,246 例 8 中心),后者沿用 MM-WHS 的七结构标签(205-850)与训练数据编号——是血统明确的官方续作。见 §5、§7。
Q10:谁该用它,谁不该用?
该用:做 3D 医学图像分割、跨模态(CT↔MRI)域自适应、半监督分割、多图谱分割,或需要一个公认 WHS 基准做横向比较的团队。不该直接拿它做:需要大量标注样本的纯监督大模型训练(训练集仅 40 例带标注)、需要覆盖全心动周期/4D 动态的任务(它是静态 3D)、需要非心脏结构或儿科专门数据的研究(其标注面向成人心脏七结构)。
§2 数据构成与规格
2.1 规模、来源与划分
MM-WHS 的数据来自多中心真实临床环境。组织方从多个采集站点汇总了 120 例 3D 心脏影像:60 例 cardiac CT/CTA 与 60 例 cardiac MRI,全部覆盖全心及其亚结构。所有数据均经机构伦理批准并匿名化(institutional ethic approval and anonymized),采集于在体(in vivo)临床环境且实际用于诊断。
划分口径(官方 data.html 与论文摘要一致):
| 模态 | 训练集(含标注) | 测试集(无公开标注) | 合计 |
|---|---|---|---|
| CT/CTA | 20 例 | 40 例 | 60 例 |
| MRI | 20 例 | 40 例 | 60 例 |
| 合计 | 40 例 | 80 例 | 120 例 |
口径提示:带标注、研究者可实际下载并用于训练的只有 40 例(20 CT + 20 MRI);另外 80 例为测试影像,其标注由组织方持有、仅用于盲评。这一点决定了 MM-WHS 的实际"可用监督样本量"很小——也是它成为半监督/域自适应研究热门测试床的结构性原因(§8)。
组织方对"为什么包含低质量数据"有明确表态:
“The data had various image quality, some were with relative poor quality. However, it is necessary to include these datasets to validate the robustness of the developed algorithms when it comes to real clinical usage.”
——官方 data.html
即:质量参差不是缺陷,而是设计意图——只有把真实临床的脏数据纳入,才能验证算法在真实使用场景下的鲁棒性。
2.2 影像规格
CT/CTA 采集规格(官方 data.html 口径):
| 项目 | 内容 |
|---|---|
| 采集方式 | routine cardiac CT angiography(常规心脏 CT 血管造影) |
| 覆盖范围 | 自腹上部至主动脉弓(upper abdominal to aortic arch),覆盖全心 |
| 采集方向 | 轴位(axial view) |
| 面内分辨率 | 约 0.78 × 0.78 mm |
| 平均层厚 | 约 1.60 mm |
MRI 采集规格(官方 data.html 口径):
| 项目 | 内容 |
|---|---|
| 序列 | 3D balanced steady state free precession(b-SSFP,平衡稳态自由进动) |
| 采集分辨率 | 各方向约 2 mm |
| 重建分辨率 | 重采样至约 1 mm |
| 覆盖范围 | 全心及亚结构 |
训练 20 例实测统计(OpenMedLab 聚合口径,非官方标称口径):
CT(20 例):
| 统计量 | spacing (mm) | size |
|---|---|---|
| min | (0.28, 0.28, 0.45) | (512, 512, 177) |
| median | (0.44, 0.44, 0.625) | (512, 512, 261) |
| max | (0.59, 0.59, 0.625) | (512, 512, 363) |
CT 训练 20 例 2D 切片总数约 5,305。
MR(20 例):
| 统计量 | spacing (mm) | size |
|---|---|---|
| min | (0.78, 0.78, 0.90) | (256, 256, 112) |
| median | (0.97, 0.97, 1.05) | (288, 288, 137) |
| max | (1.21, 1.21, 1.60) | (512, 512, 200) |
MR 训练 20 例 2D 切片总数约 2,898。
口径存照(重要):官方 data.html 写 CT 面内约 0.78×0.78 mm、层厚约 1.60 mm,而 OpenMedLab 的 CT spacing 表中位为 (0.44, 0.44, 0.625) mm。二者不是矛盾:前者是全局标称口径(organizer 对全部数据的概括描述),后者是训练 20 例实测统计口径(逐例 spacing 的实际分布)。MR 同理:官方写采集约 2 mm、重建约 1 mm,实测中位约 (0.97, 0.97, 1.05) mm。引用时务必注明所据口径,否则读者会以为两方打架。这一冲突登记于坑 7。
2.3 标注结构体系与标签编码
训练集每例提供七类全心亚结构的逐体素手工分割。官方 data.html 给出的结构定义与标签值如下:
| 序号 | 结构(中文) | 结构(英文) | 官方标签值 |
|---|---|---|---|
| 1 | 左心室心肌 | Myocardium of the left ventricle (Myo) | 205 |
| 2 | 左心房血腔 | Left atrium blood cavity (LA) | 420 |
| 3 | 左心室血腔 | Left ventricle blood cavity (LV) | 500 |
| 4 | 右心房血腔 | Right atrium blood cavity (RA) | 550 |
| 5 | 右心室血腔 | Right ventricle blood cavity (RV) | 600 |
| 6 | 升主动脉 | Ascending aorta (AO) | 820 |
| 7 | 肺动脉 | Pulmonary artery (PA) | 850 |
| — | 背景 | Background | 0 |
大血管的严格解剖定义(官方原文口径):
- 升主动脉(AO):定义为 “the aortic trunk from the aortic valve to the superior level of the atria”(自主动脉瓣至心房上缘水平的主动脉干)。
- 肺动脉(PA):定义为 “the beginning trunk between the pulmonary valve and the bifurcation point”(肺动脉瓣至分叉点之间的起始主干)。
组织方解释了为何要对大血管做严格定义:由于不同扫描的视野(fields of view)不同,大血管的覆盖范围会不一致;为了在不同受试者之间有一致的定义,才做如上限定,并说明评测时会用特定方法把大血管分割结果截断到限定长度,但鼓励参赛者尽量提交更长的大血管分割、且提供的训练手工标注通常覆盖超过定义长度。
可疑点存照:官方 data.html 在描述升主动脉与肺动脉定义时,两者"平均长度"均写作 “about 41.9 mm as we measured in 25 healthy subjects”——两个不同血管给出同一数值 41.9 mm,疑为原文复制粘贴笔误。本条目原文照录并标注疑点(坑 8),不擅自"修正"为不同数字。
2.4 标签编码冲突:205-850 vs 200/500/600/1220/2221(重点双口径存照)
这是使用 MM-WHS 时最容易静默出错的地方,必须单独讲清。
- 官方一手口径(data.html):CT 与 MRI 统一采用七结构编码 205 / 420 / 500 / 550 / 600 / 820 / 850。
- OpenMedLab 聚合口径:其 MM-WHS 条目中单列了一张 CT Label Information 表,列出五个标签 200 / 500 / 600 / 1220 / 2221,对应描述为 LV normal myocardium / LV blood pool / RV blood pool / LV myocardial edema / LV myocardial scars(左心室正常心肌 / 左心室血池 / 右心室血池 / 左心室心肌水肿 / 左心室心肌瘢痕)。
两组编码显然不同源:后者包含"心肌水肿""心肌瘢痕"这类病理性心肌标注类别,而 MM-WHS 官方的七结构里根本没有这些类别。合理判断是:OpenMedLab 的 CT 表混入了另一套心肌/瘢痕标注的编码(很可能来自相关的病理心肌分割工作或另一份数据),并非 MM-WHS 官方的三分结构编码。
使用建议:
- 以官网 data.html 的 205-850 为权威口径。
- 若你在某处(如某个 GitHub 复现仓库)看到 1-7 连续编码或 200/500/600/1220/2221,先做映射转换再训练,否则标签语义错位、结果"错得悄无声息"。
- 后续官方续作 CARE-Whole Heart 明确沿用 205-850(见 §5),进一步佐证 205-850 才是"官方血统"编码。
这一冲突登记于坑 1,是本条目给读者的第一号警示。
2.5 文件组织与命名规范
数据集按模态与用途分四个文件夹(OpenMedLab 记录的目录结构):
MM-WHS 2017 Dataset
│
├── ct_train
│ ├── ct_train_1001_image.nii.gz
│ ├── ct_train_1001_label.nii.gz
│ ├── ct_train_1002_image.nii.gz
│ ├── ct_train_1002_label.nii.gz
│ └── ...
│
├── ct_test
│ ├── ct_test_2001_image.nii.gz
│ ├── ct_test_2002_image.nii.gz
│ └── ...
│
├── mr_train
│ ├── mr_train_1001_image.nii.gz
│ ├── mr_train_1001_label.nii.gz
│ ├── mr_train_1002_image.nii.gz
│ ├── mr_train_1002_label.nii.gz
│ └── ...
│
└── mr_test
├── mr_test_2001_image.nii.gz
├── mr_test_2002_image.nii.gz
└── ...
命名约定(对复现与提交都关键):
| 目录 | 内容 | 命名规则 |
|---|---|---|
ct_train |
CT 训练影像 + 标注 | ct_train_10??_image.nii.gz / _label.nii.gz |
ct_test |
CT 测试影像(无标注) | ct_test_20??_image.nii.gz |
mr_train |
MR 训练影像 + 标注 | mr_train_10??_image.nii.gz / _label.nii.gz |
mr_test |
MR 测试影像(无标注) | mr_test_20??_image.nii.gz |
编号坑:训练集用
10??(1001 起),测试集用20??(2001 起)。提交测试结果时文件名必须形如ct_test_20??_label.nii.gz(??为两位数字索引),且图像信息(spacing/size/orientation/数据类型 short int 等)须与原图完全一致——命名或格式不符会被评测拒收。登记于坑 6。
2.6 与相邻数据集的边界
理解 MM-WHS 时要分清它与几个"看起来像"的数据集:
- ACDC(Automated Cardiac Diagnosis Challenge):同为 STACOM 2017 挑战赛(与 MM-WHS 同届),但目标不同——ACDC 关注心脏 MRI 的功能诊断(左/右心室与心肌分割 + 射血分数等临床参数估计),样本量与解剖范围都窄于 MM-WHS。二者常被并列提及,不要混为一谈。
- CARE-Whole Heart:MM-WHS 的官方续作(MICCAI 2025 CARE 挑战赛 WHS 赛道),扩大了中心数与样本量(246 例 8 中心),但沿用同一套七结构标签与部分 MM-WHS 训练编号。血统关系见 §5。
- LAScarQS 2022 等:MM-WHS 官网在"★ WHS of other datasets"列表里把若干挑战赛的 WHS 子任务与之关联(含 LAScarQS 2022 的左心房与瘢痕量化、Left Atrium Segmentation Challenge 13 的 30 MR + 30 CT 全心等)——这些是关联复用,不是 MM-WHS 本体。
§3 标注与评测流水线
3.1 手工分割的生产方式
与 PANDA-PLUS 那类"学生初注 + 专家终审"的三层流水线不同,MM-WHS 的标注是由专家直接完成的手工逐体素分割(manual segmentation / manual delineation)。组织方没有公开描述多层级流水线或众包细节,其数据说明中仅强调:训练集数据配有手工分割标注、标注覆盖七类结构、且大血管的标注范围通常超过官方定义的限定长度(以便评测时截断)。
组织方也提供了一批辅助工具,暗示其标注与后续分析依托图谱(atlas)方法生态:
- Atlas-based WHS:
zxhwhs.m(MATLAB 脚本) - Multi-atlas WHS:
zxhLabelFuse(标签融合工具) - ZXHPROJ(配套工程脚本)
这些工具的公开,等于把组织方自己的传统方法基线也交了出去——研究者可以直接复现其 atlas 方法,再与自己的深度学习方案对比。
3.2 评测协议(盲评服务)
MM-WHS 的核心不是"发数据",而是"提供持续运行的公平评测"。评测协议要点(官方主页 + GitHub README):
- 测试集标注不公开:组织方持有 80 例测试影像的标注,参评者拿不到。
- 提交方式:参赛者准备算法简述(a brief description of their algorithm)+ 测试集分割结果,邮件发送组织方。
- 邮件标题格式:
MM-WHS Test Result + Fully Name of the corresponding author(固定格式,便于组织方归档)。 - 结果格式:NIfTI 格式打包为 zip;所有结果须与原始 CT/MR 影像具有完全一致的图像信息(spacing、size、orientation、short int 数据类型等);文件名须为
ct_test_20??_label.nii.gz或mr_test_20??_label.nii.gz。 - 单方法单次评测:“A method can only be evaluated once.”——一个方法只能评一次,遏制"反复调参刷榜"。
- 自助评测(后期):官网后期提供 “Users can evaluate their results by themselves now” 的自助入口。
3.3 评测指标
官方首页与 CFP 明确列出的评测指标为:
| 指标 | 说明 |
|---|---|
| generalized Dice | 广义 Dice 系数(对多类分割、含小结构更稳健) |
| Jaccard | 雅卡尔指数(IoU,交并比) |
| surface-to-surface distance | 表面到表面距离(对称表面距离,刻画边界一致性) |
这三项的组合设计意图是"体积重叠 + 边界一致"双维度考察:Dice/Jaccard 反映整体体积重叠,surface distance 反映边界精度——只有两者都不差的算法,才算真正分得好。
3.4 论文评测规模与参与者
挑战赛论文报告了参评方法的规模(见 §4 详述):
- CT 数据:10 个算法
- MRI 数据:11 个算法
- 来自 12 个团队(12 groups)
论文收录于 STACOM 2017 Revised Selected Papers(Springer LNCS vol 10663)——STACOM 2017 全书共录用 27 篇文章(自 35 篇投稿),其中包含 ACDC 与 MM-WHS 两个挑战赛的专门篇幅。
3.5 AI-Ready 视角:这套流水线对复现者意味着什么
从"数据能否直接喂给模型"的角度看,MM-WHS 的生产方式有两个鲜明特征:
- 标注语义明确、但访问受限:七结构标签定义清晰(含大血管的长度定义),但因为要走注册表审批,复现者拿到的数据并没有"一条命令下载完事"的便利——这与 PANDA-PLUS 那种"实体请求制 + 衍生品 HF 直链"的双轨结构不同,MM-WHS 是单轨请求制(§6)。
- 测试集不可得、评测走服务:对复现者是"评测难"——你无法本地计算官方指标,必须走提交评审(或使用后期自助工具)。这提升了公平性,却削弱了自助迭代的便利。
这两点合起来,使 MM-WHS 的"AI-Ready 光谱"位置偏"半开放基准"一侧:训练数据可申请获得、评测结果可比,但入口与出口都带组织方关卡。详见 §6 的 AI-Ready 评估。
§4 挑战赛结果:方法、发现与盲评的教训
4.1 评测结构回顾
2017 年首届 MM-WHS 收了来自 12 个团队的方法,按模态分两条评测线:
- CT 线:10 个算法参评
- MRI 线:11 个算法参评
论文的核心目标不是"选出冠军",而是回答一个问题:在真实临床的多模态全心分割问题上,不同技术路线到底能到什么水平、各自短板在哪里。为此论文把参评方法粗分为两大类:
- 传统方法——以多图谱(multi-atlas)分割为主:通过配准多个带标注的图谱到目标影像,再做标签融合。
- 深度学习方法——各种 3D 卷积网络及其变体。
4.2 论文三大主结论
论文摘要与正文给出的核心结论可归纳为三条:
结论一:CT 全心分割整体优于 MRI。
“The results showed that the performance of CT WHS was generally better than that of MRI WHS.”
这与两模态的成像特性一致:CT/CTA 对心脏腔室与大血管的对比度通常更清晰、空间分辨率更高(面内约 0.78 mm),而 MRI(重采样至约 1 mm、原始采集约 2 mm)在边界刻画上更难,加上心脏 MRI 的运动伪影与灰度不均。
结论二:深度学习方法潜力大,但方差极大——盲评是"照妖镜"。
“The deep learning (DL)-based methods demonstrated great potential, though several of them reported poor results in the blinded evaluation. Their performance could vary greatly across different network structures and training strategies.”
这是论文最值得细读的一条:若干 DL 方法在自报成绩上表现优异,却在盲评(blinded evaluation)中出现显著退化。论文推测原因是过拟合(overfitting)——训练集只有 20 例,模型很容易记住训练样本而无法泛化到测试集。作者还强调 DL 方法的表现"可随网络结构与训练策略剧烈波动",说明当时(2017-2019)的 DL 全心分割尚不成熟、稳定性和可复现性都成问题。
结论三:传统多图谱方法稳健。
“The conventional algorithms, mainly based on multi-atlas segmentation, demonstrated good performance, though the accuracy and computational efficiency could be limited.”
多图谱方法虽无 DL 的"上限潜力",但表现稳定、可复现性好;其短板在精度(CT 上不及最佳 DL 法)与计算效率(配准 + 融合耗时长)。
4.3 亚结构难度的分层
论文指出:不同患者类别的亚结构分割难度不同,原因在于成像差异与心脏形态变异。
“The segmentation of the substructures for different categories of patients could present different levels of challenge due to the difference in imaging and variations of heart shapes.”
具体到七类结构,可以合理推断的难度梯度(论文与领域共识):
- 较易:左心室血腔(LV)、左心房血腔(LA)——体积大、对比度高、形态相对稳定。
- 中等:右心室血腔(RV)、升主动脉(AO)——形态复杂或受视野影响。
- 较难:心肌(Myo)、肺动脉(PA)、右心房(RA)——心肌壁薄且与血腔边界接近、肺动脉细小且形态多变、右心房形态不规则。
论文的 Fig.4(CT 十方法 Dice 箱线图)与 Fig.5(MRI 十一方法 Dice 箱线图)分别展示了各方法在不同结构上的分布差异,是理解"哪类结构是瓶颈"的关键图。
4.4 盲评事件的启示
MM-WHS 论文在方法学上留下的最重要教训,不是"哪个方法最好",而是盲评暴露了自评估的可信度问题:
- 训练集小 → 过拟合风险高:20 例训练样本下,DL 模型极易过拟合;论文明确指出若干方法"reported poor results in the blinded evaluation, probably due to over fitting in their training"。
- 单次评测的纪律性:挑战赛规定"一个方法只能评一次",正是为了防止反复提交、以测试集信息反向调参(即"对测试集过拟合")。
- 公平比较的价值:论文的核心贡献之一是提供了一个"fair and intuitive comparison framework"——统一数据、统一指标、统一盲评,三者缺一不可。
这一点对今天任何声称"在心脏分割上 SOTA"的工作依然适用:在自建数据上刷出的高分,不等于在 MM-WHS 盲评上站得住。
4.5 引用与索引概况(三源口径存照)
MM-WHS 挑战赛论文的引用量随年份快速增长,已成为全心分割领域的高引文献。三源计数如下(抓取时点 2026-09-30):
| 来源 | 引用数 | 备注 |
|---|---|---|
| Google Scholar | 420 | 逐年:2019:8 / 2020:44 / 2021:57 / 2022:71 / 2023:60 / 2024:64 / 2025:89 / 2026:25 |
| Semantic Scholar | 366 | HypePaper 转引 |
| PlumX | 289 | Scopus 288 / CrossRef 288 / PMC 62 |
双口径存照:三源计数差异显著(420 / 366 / 289),属正常现象——各数据库收录的文献源与去重规则不同。本条目并列三口径而不取单一数字,避免"以某一家为准"的误导。登记于坑 4。
§5 衍生基准与血统:从 MM-WHS 到 CARE-Whole Heart
5.1 官方续作 CARE-Whole Heart
MM-WHS 官网首页现状声明:
“Maintainance of MMWHS has been ended. Please refer to latest event in CARE for more data.”
即 MM-WHS 本体维护已结束,新数据请参考 CARE 系列。其官方续作是 CARE-Whole Heart(CARE 2025/2026 挑战赛的 Whole Heart Segmentation 赛道,由 Fudan ZMIC Lab 组织)。
CARE-Whole Heart 关键事实(来源 zmic.org.cn/care_2026/track_wholeheart/):
| 维度 | 内容 |
|---|---|
| 组织 | Fudan ZMIC Lab(与 MM-WHS 同源) |
| 规模 | 246 例,8 个中心(8 centers) |
| 训练集 | 106 例:A 中心 20 CT / B 中心 20 CT / C&D 中心 20 MRI / E 中心 26 MRI / G 中心 20 CT |
| 验证集 | 50 例:A 20 CT / B 10 CT / C&D 20 MRI |
| 测试集 | 90 例 |
| 标签 | 沿用 MM-WHS 七结构 205-850 编码 |
| 编号 | A 中心 CT ct_train_1001–1020、C&D 中心 MRI mr_train_1001–1020 直接沿用 MM-WHS 训练数据及编号 |
血统明证的三个层面:
- 标签体系相同:CARE-Whole Heart 明确采用 LV=500 / RV=600 / LA=420 / RA=550 / Myo=205 / AO=820 / PA=850,与 MM-WHS 官方 data.html 完全一致。
- 数据与编号沿用:A 中心 CT 与 C&D 中心 MRI 的训练编号与 MM-WHS 时代一致(
1001–1020),说明部分原始病例被继承进续作。 - 设计目标延续:“检验全心分割在多中心、多模态域偏移下的稳健性”——这正是 MM-WHS 的核心命题,只是把中心数与样本量都扩大了。
CARE-Whole Heart 的扫描设备涵盖 Philips 64-slice CT、SIEMENS SOMATOM Force CT、GE Revolution CT、Philips Achieva 1.5T、Siemens Avanto 1.5T、Toshiba Aquilion ONE CT 等多种机型——进一步放大了跨设备、跨中心的域偏移挑战。
5.2 MM-WHS 官网列出的"关联 WHS 复用数据"
MM-WHS 官网在 “★ WHS of other datasets or Challenge data” 一栏列出多处可直接关联/复用的 WHS 数据与挑战,构成一个围绕"全心分割"的小生态:
| 数据/挑战 | 内容 | 说明 |
|---|---|---|
| MM-WHS 测试子集(MR) | 20 例带手工分割的 MR(MM-WHS 测试集子集) | 官网标注为 “NEW!!!”,可直接取用 |
| LAScarQS 2022 | 左心房与瘢痕量化分割挑战赛 | WHS 相关(官网标 TODO) |
| Left Atrium Segmentation Challenge 13 | 30 MR + 30 CT 的全心分割 | 前代左心房挑战 |
| Coronary Centerline Extraction Challenge 08 | 32 例 CTA 的 WHS(原挑战已失效) | 有挑战赛论文 |
| Coronary Artery Stenosis Detection Challenge 13 | 48 例 CTA 的 WHS(原挑战已失效) | 有挑战赛论文 |
注意:这些是 MM-WHS 官网关联推荐的复用数据,不是 MM-WHS 本体的一部分。检索时勿混为一谈。
5.3 工具链与课程数据
官网还公开了一套工具与课程数据,服务于"复现传统方法 + 教学"两条线:
- Atlas-based WHS:
zxhwhs.m(MATLAB) - Multi-atlas WHS:
zxhLabelFuse(标签融合) - ZXHPROJ:配套工程脚本
- 课程数据(Medical image analysis, DATA630015):预处理训练数据,配准到公共空间 2×2×2 mm,包括
affregcommon2mm_roi_mr_train(MR)与affregcommon2mm_roi_ct_train(CT)——适用于多图谱分割、多模态配准+分割联合、统计形状模型等研究。
5.4 引导论文(组织方要求引用)
使用 MM-WHS 数据与结果时,组织方要求引用其一系列方法学论文(官网口径):
| 论文 | 出处 | 主题 |
|---|---|---|
| Zhuang X, Shen J. | Med Image Anal 31:77-87, 2016 | Multi-scale patch + 多模态图谱的 MRI 全心分割 |
| Zhuang X, et al. | Medical Physics 42(7):3822-3833, 2015 | 条件熵图谱排序/选择的 CT 多图谱全心分割 |
| Zhuang X. | J Healthcare Eng 4(3):371-407, 2013 | 全自动全心分割挑战与方法综述 |
| Zhuang X, et al. | IEEE TMI 29(9):1612-1625, 2010 | 基于配准传播的 MRI 全心分割框架 |
| Zhuang X. | IEEE TPAMI 41(12):2933-2946, 2019 | 多源图像心肌分割的多元混合模型 |
| Wu F, Zhuang X. | IEEE TPAMI 45(5):6021-6036, 2023 | 无标注数据上的半监督分割风险最小化 |
| Gao S, Zhou H, Gao Y, Zhuang X. | Med Image Anal 89:102889, 2023 | BayeSeg:可解释泛化性的贝叶斯分割 |
BayeSeg(2023)获 Elsevier-MedIA 1st Prize & Best Paper Award of MICCAI Society 2023——是 MM-WHS 生态中获国际奖项的代表性方法工作。
§6 获取与许可:请求制的门怎么进
6.1 获取流程(单轨请求制)
MM-WHS 是请求制数据集,没有"点一下就下载"的公开直链。标准流程:
- 下载并签署注册表(registration form):官网提供注册表,须填写并签署。
- 发送给组织者:将签署后的注册表发送给组织方联系人(GitHub README 记为 Lingchao XU 与 Lei LI)。
- 等待批准并获得链接:组织者批准后发送下载链接,可选 FDU server 或 MEGA 镜像(OpenMedLab 记录的 MEGA 入口为
https://mega.nz/folder/UNMF2YYI#1cqJVzo4p_wESv9P_pc8uA)。 - 遵守使用条款:同意不向第三方传播数据(见 6.2)。
6.2 使用条款与数据保护
官方数据页明确的数据使用承诺:
“The Recipient(s) commit to not disseminate the Data to any third party.”
即接受方承诺不向任何第三方再分发数据。同时组织方在 CFP 更新中声明:
“We have agreed to open the data permanently.”
即数据永久开放(但仍走上述申请流程)。
此外,官网说明数据的传播目的是"在 MM-WHS 2017 挑战赛框架下,对匿名化临床 MRI 与 CT 扫描数据库进行多机构分析"。
6.3 评测入口(出口那一半)
拿到数据只是第一步,若要在 MM-WHS 上做可比评测,还须走评测流程:
- 提交制(盲评):邮件提交算法简述 + 测试集分割结果(格式严格,见 §3.2);单方法单次评测。
- 自助评测:官网后期开放 “Users can evaluate their results by themselves now” 的自助入口,便于研究者快速自测。
6.4 AI-Ready 评估:半开放基准的得失
把 MM-WHS 放到"A 数据集是否 AI-Ready"的坐标上评估,它呈现出一种典型的"半开放基准"形态:
优势(AI-Ready 加分项):
- 口径统一、定义清晰:七结构标签 + 大血管严格解剖定义 + 统一评测指标,横向可比性极强。
- 隐私合规到位:伦理批准 + 匿名化 + 明确的数据使用承诺。
- 评测服务长期运行:不是"发完就走",而是持续受理并有论文背书。
- 生态完整:工具链、课程数据、续作 CARE-Whole Heart 一应俱全。
短板(AI-Ready 减分项):
- 访问门槛:请求制(签表 + 审批),无公开直链,自动化流水线难以直接接入。
- 测试集不可得:本地无法计算官方指标,迭代依赖提交评审,效率受限。
- 训练集小:40 例带标注样本,纯监督大模型训练数据量不足。
- 维护状态:官方已声明本体维护结束,链接可能随时间失效。
结论:MM-WHS 是一个"评测取向极强、可获得性中等"的基准数据集——它最适合作为"已具备训练数据、需要一个公认基准验证泛化能力"的研究团队的标准靶场;对"只想快速下一份数据跑 baseline"的用户,则需先跨过申请门槛。
6.5 与库内可获取性光谱的对照
若把本库(千方病案医数集)条目的"可获取性"看成一个连续光谱——从"完全公开直链"(如 HuggingFace 托管的基准)到"完全请求制/受限"——MM-WHS 落在偏受限一侧:
| 光谱位置 | 典型形态 | 本库对应 |
|---|---|---|
| 完全公开直链 | HF/Zenodo 一键下载 | PANDA-PLUS-Bench(CC BY-4.0) |
| 有条件公开 | Kaggle 注册即可下载 | PANDA 原数据集 |
| 请求制(签表审批) | 签注册表经批准发链接 | MM-WHS(本条目) |
| 委托/合作制 | 需机构协议 | 多数院内临床数据 |
在检索与引用时,请按"请求制"来规划 MM-WHS 的获取路径与时间成本(登记于坑 2)。
§7 生态与影响
7.1 学科定位:全心分割的标准基准
MM-WHS 自 2017 年发布以来,已成为全心脏分割(WHS)领域的标准测试平台。它的地位可以这样概括:
- 横向比较的公共参照系:任何声称"能做全心分割"的新方法,几乎都要在 MM-WHS 上报告结果才算"入场"。
- 方法演进的见证者:从多图谱传统方法 → 深度学习 → Transformer → 域自适应/半监督,每一波方法浪潮都在 MM-WHS 上留下了成绩。
- 跨模态研究的天然试验床:CT 与 MRI 两种模态共存,且域偏移显著,是研究"域自适应(Domain Adaptation)"与"多模态融合"的理想数据。
7.2 高频下游应用
MM-WHS 被广泛用于以下研究与应用方向:
- 分割算法基准测试:验证 CNN、Transformer 等架构在 3D 医学图像分割上的性能与鲁棒性。
- 跨模态域自适应:以 CT 训练、MRI 测试(或反之)模拟真实世界的数据分布差异,例如知识蒸馏式的无配对多模态分割。
- 半监督与少标注分割:利用"20 标注 + 40 未标注"的结构模拟标注稀缺场景。
- 多图谱/配准方法研究:利用 atlas 工具链做配准、标签融合、统计形状模型。
- 临床应用前置:支撑心脏建模、治疗规划与术中导航(官网明确列出这些下游用途)。
7.3 独立第三方引用示例
MM-WHS 被大量独立工作引用,其中不乏高影响力期刊。例如 Nature Scientific Reports 2025 的 “Adaptive composite loss for volumetric whole heart segmentation”(s41598-025-25785-9)即采用了 MM-WHS 的 CT 子集做实验,并在方法部分对数据集做了如下描述(第三方口径,可作为交叉验证):
“The dataset consists of the total 120 subjects acquired from multiple imaging sites. There are 60 cases for each of the imaging modality, with 20 cases for training and 40 cases for evaluation.”
该文同时指出一个关键事实:
“the cases for evaluation are not publicly accessible and submission to the challenge server is required for evaluation.”
——测试例不可公开访问,须提交挑战服务器评测。这从第三方视角印证了 §6.3 的评测入口描述。
7.4 生态中的关键枢纽角色
MM-WHS 在千方病案医数集库内可视为一个心脏影像分割家族的关键枢纽,向下连接若干相关条目:
| 关联条目 | 关系 | 说明 |
|---|---|---|
| CARE-Whole Heart | 官方续作 | 扩大中心与样本,沿用七结构标签与 MM-WHS 编号(§5.1) |
| ACDC | 同届挑战 | 同为 STACOM 2017,但目标为心脏 MRI 功能诊断 |
| LAScarQS 2022 | 关联复用 | MM-WHS 官网列为 WHS 复用数据(左心房与瘢痕量化) |
| Left Atrium Segmentation Challenge 13 | 前代挑战 | 30 MR + 30 CT 全心,MM-WHS 的"血缘前辈"之一 |
7.5 对方法学的一般性影响
MM-WHS 留给后世的,除了数据本身,还有三条被反复验证的方法学命题:
- 盲评不可省:自评估的高分必须经独立盲评复核,否则过拟合会被当成 SOTA(§4.4)。
- 小样本的诚实:40 例带标注的规模决定了它天然是"少标注/半监督方法的试金石",任何在它上面"轻松刷到 0.95+"的声明都值得追问是否公平设置。
- 多模态才是真实世界:单一模态的精修成绩不等于临床可用,MM-WHS 塞入的"脏数据"恰恰是它最有价值的部分。
§8 方法学启示:三条可迁移的经验
8.1 基准的"公平性"由三件套共同保证
MM-WHS 最大的方法学贡献不是数据,而是"统一数据 + 统一指标 + 统一盲评"的三件套比较框架。任何想自建基准的团队都该记住:只发数据不做盲评,等于没有比较——因为各家会在自建测试集上刷出各自的高分,横向不可比。MM-WHS 论文明确把"提供 fair and intuitive comparison framework"写进贡献,值得借鉴。
8.2 "脏数据"是鲁棒性的必要成分
MM-WHS 刻意纳入多中心、多设备、质量参差甚至偏劣的影像,并明说这是为了"验证算法在真实临床使用中的鲁棒性"。这个设计取舍对今天的数据集建设极具启发:
- 只在精修数据上评估的算法,进不了诊室。
- 域偏移不是噪声,是信号——它恰好暴露算法在真实部署时会遇到的困难。
- 后续的 CARE-Whole Heart 把中心数从"多站"扩到"8 中心",正是把这一理念推到极致。
8.3 标签编码是"接口契约",必须显式登记
MM-WHS 的标签编码(205-850)不连续、且有异源编码(200/500/600/1220/2221)在第三方流传——这提示我们:数据集标签编码是一种"接口契约",一旦被第三方误记误传,就会造成静默的语义错位。建设 AI-Ready 数据集时,应当把编码表作为一等公民显式登记、版本化,并在文档最显眼处给出"映射转换指南"。
8.4 从"发布"到"运营":基准是一种长期服务
MM-WHS 的价值很大一部分来自它持续运行的评测服务——它不是一次性发布的静态包,而是一个十余年仍在受理提交的"服务"。对 AI-Ready 数据集建设者的启示是:数据集的"可获取性"与"可评测性"是两条独立的运维线,后者往往更被低估,却决定了数据集能否成为"基准"。
§9 与库内条目的关系
9.1 家族图谱
在千方病案医数集库内,MM-WHS 属于心脏影像 + 医学图像分割 + 挑战赛数据集三类标签的交汇处,其库内邻居包括:
- CARE-Whole Heart(官方续作,最强关联)——若库内已有,应双向互链。
- ACDC(同届 STACOM 2017 挑战)——同源会议,常并列检索。
- 其他心脏分割 / 心血管影像条目——同属"心血管疾病 + 医学图像分割"标签圈。
- 其他挑战赛数据集(如 KiTS19、BraTS 类)——同属"挑战赛数据集"标签圈,方法论可比。
9.2 检索路径建议
给不同背景读者的检索建议:
| 你的需求 | 建议路径 |
|---|---|
| 找多模态心脏分割训练数据 | 走 §6 申请流程;同时看 CARE-Whole Heart(规模更大) |
| 找 CT↔MRI 域自适应测试床 | MM-WHS 是本类研究最常用的标准数据(§7.2) |
| 找半监督分割基准 | 注意"20 标注 + 40 未标注"结构(§2.1) |
| 找心脏 MRI 功能诊断数据 | 应转向 ACDC,而非 MM-WHS |
| 需要最新全心分割数据 | 转向 CARE-Whole Heart(MM-WHS 本体已停更,§5.1) |
9.3 引用与致谢规范
若在研究中使用了 MM-WHS,组织方要求至少引用 §5.4 所列的引导论文(尤其 Zhuang & Shen 2016、Zhuang 2019 TPAMI)。若使用了挑战赛评测结果,还须引用挑战赛总结论文(Zhuang et al., Med Image Anal 2019;58:101537)。未按规定引用而使用数据,等同违反数据使用条款——这一点在申请时应提前明确。
§10 避坑清单:八个已踩过的坑
以下是使用 MM-WHS 时最常踩、后果最严重的八个坑。每个坑都给出"症状 / 根因 / 对策",供检索者与复现者对照。
坑 1:标签编码误用——最危险的静默错误
症状:训练顺利、loss 下降、指标也"看着不错",但与文献结果无法对齐;或可视化标签时颜色全乱、大血管和心肌位置互换。
根因:MM-WHS 的标签编码是不连续的 205 / 420 / 500 / 550 / 600 / 820 / 850,不是 1-7。而且第三方流传着异源编码 200 / 500 / 600 / 1220 / 2221(OpenMedLab CT 表,含心肌水肿/瘢痕类别,非官方七结构)。此外,一些老复现代码沿用 1-7 连续编码,与新编码不兼容。
对策:
- 以官网 data.html 的 205-850 为唯一权威口径。
- 拿到任何标签数据先打印唯一值(
np.unique),确认编码集是否落在 {0, 205, 420, 500, 550, 600, 820, 850}。 - 若同时使用旧编码数据或旧代码,必须先写映射表转换,并做转换前后的重叠可视化验证。
- 参见 §2.4 与附录 E 的映射规范。
坑 2:把它当"公开可下载数据集"——白跑一趟
症状:写脚本、开爬虫、找直链,处处碰壁;或轻信某些二手页面提供的"下载地址"后发现失效或非法。
根因:MM-WHS 是请求制数据集,须签署注册表并经组织者批准后才发链接,没有稳定的公开直链。数据使用条款还要求接受方不向第三方传播。
对策:
- 按 §6.1 走正式申请流程(签 registration form → 发组织者 → 获链接)。
- 不要把从第三方"顺手拿到"的 MM-WHS 数据再分发——这违反数据使用条款。
- 若只是需要一个"公开可下"的全心分割替代,考虑 CARE-Whole Heart(同样需注册)或其他公开心脏分割集,但注意目标与规格不同(§2.6)。
坑 3:训练/测试编号搞混——提交被拒或数据错位
症状:提交评测被组织方退回;或训练时误把测试影像当训练数据(无标注,导致读到空标签)。
根因:训练集文件用 10?? 命名(ct_train_1001…),测试集用 20??(ct_test_2001…);测试集只有 image 没有 label。提交文件名有严格格式要求(ct_test_20??_label.nii.gz)。
对策:
- 严格按目录名加载:
ct_train/mr_train才有_label。 - 写数据加载器时断言"label 文件存在"。
- 提交前逐项核对:文件名格式、图像信息(spacing/size/orientation/数据类型)与原图一致(§3.2)。
坑 4:引用量取单一数字——误导读者
症状:在文章中写"MM-WHS 被引用 X 次",X 取自某单一数据库,与读者在其他库看到的数字不符,被质疑。
根因:不同数据库引用计数差异显著——Google Scholar 420 / Semantic Scholar 366 / PlumX 289(抓取时点)。
对策:
- 并列三口径而非取单一数字(本条目即如此处理)。
- 若必须取一个,注明来源与抓取日期(如"Google Scholar,2026-09-30")。
- 参见 §4.5。
坑 5:官网域名迁移与"维护结束"——历史链接大面积失效
症状:论文/旧博客里给出的官网链接打不开;按旧域名(sdspeople.fudan.edu.cn)访问跳转或 404。
根因:官网已从复旦旧域(www.sdspeople.fudan.edu.cn/zhuangxiahai/0/mmwhs/)迁至 GitHub Pages(zmiclab.github.io/zxh/0/mmwhs/)。且首页现声明 “Maintainance of MMWHS has been ended”(本体维护结束)。
对策:
- 一律使用新域名
zmiclab.github.io/zxh/0/mmwhs/;旧链接仅作历史存照。 - 需要"活数据"时转向 CARE-Whole Heart(§5.1)。
- 抓取时注意:该 GitHub Pages 站点的某些页面(如
data.html)在受限网络/沙箱环境中可能无法直接抓取,需换网络或用搜索引擎缓存的文本(本条目即通过搜索引擎索引文本 + 论文 + 聚合站三源互证完成的)。
坑 6:提交格式细节——单次评测不能重来
症状:辛苦训练的方法,提交后因格式问题被拒,而规则规定"一个方法只能评一次",机会白白浪费。
根因:MM-WHS 提交有严格的邮件标题格式、文件命名格式、图像信息一致性要求,且单方法单次评测。很多人忽略了"只能评一次"这条硬约束。
对策:
- 提交前逐条核对 §3.2 的六项要求(标题格式、zip、命名、图像信息一致、数据类型 short int 等)。
- 先用官方后期的自助评测工具本地自测一遍,确认格式无误再正式提交。
- 把"单次评测"当硬约束——提交前做足交叉验证。
坑 7:把两种分辨率口径当成矛盾
症状:看到官方说"CT 层厚约 1.60 mm"、OpenMedLab 表说"CT spacing 中位 0.625 mm",以为数据被篡改或来源错误,反复纠结。
根因:两套数字是不同口径——官方是全局标称口径(对所有数据的概括),OpenMedLab 是训练 20 例实测统计口径(逐例实际分布,含 min/median/max)。
对策:
- 引用时注明所据口径(“标称"vs"实测”)。
- 不要拿两套数字去"证伪"对方——它们描述的是不同层次的同一事物。
- 参见 §2.2 的口径存照表。
坑 8:轻信一手页面里的可疑同值数字
症状:在文章里写"升主动脉和肺动脉平均长度均为 41.9 mm",被同行指出"两个不同血管怎会完全同值"。
根因:官网 data.html 在定义升主动脉与肺动脉时,两个"平均长度"均写作 “about 41.9 mm as we measured in 25 healthy subjects”,疑为原文复制粘贴笔误。
对策:
- 引用该数字时标注疑点(“原文如此,疑复制笔误”),不擅自"修正"。
- 需要准确的大血管长度时,应查健康受试者心脏解剖的独立文献,而非依赖此可疑同值。
- 参见 §2.3 的可疑点存照。
坑点速查:坑 1 标签编码|坑 2 请求制获取|坑 3 编号与提交格式|坑 4 引用多口径|坑 5 域名迁移与停更|坑 6 单次评测格式|坑 7 分辨率双口径|坑 8 官网可疑同值。
§11 总结
11.1 三句话总结
- MM-WHS 是全心分割领域的标准基准数据集:120 例 3D 心脏影像(60 CT + 60 MRI),训练 40 例带七结构手工标注(LV/RV/LA/RA/Myo/AO/PA,官标 205-850),测试 80 例用于盲评;出自 MICCAI-STACOM 2017,论文发表于 Medical Image Analysis 2019。
- 它的核心价值在"评测框架"而非"数据量":统一数据 + 统一指标 + 统一盲评,使不同方法首次可横向比较;盲评暴露了深度学习方法在小训练集下的过拟合问题,也确认了传统多图谱方法的稳健性。
- 它已进入"基准运营"阶段:官方声明本体维护结束,续作 CARE-Whole Heart(246 例 8 中心)承继其标签体系与编号;获取走请求制,使用须遵守不传播条款与引用规范。
11.2 适合谁
- 做 3D 医学图像分割、需要公认基准做横向比较的研究者。
- 做 跨模态(CT↔MRI)域自适应的团队——MM-WHS 是本类研究最常用的标准测试床。
- 做 半监督 / 少标注分割的开发者——"20 标注 + 40 未标注"结构天然适配。
- 做 多图谱 / 配准 / 统计形状模型的研究者——官方提供了配套工具链与课程数据。
- 需要全心脏七结构标准定义(含大血管解剖长度定义)作为参照的临床/工程团队。
11.3 不适合谁
- 需要海量带标注样本训练纯监督大模型的团队(训练集仅 40 例带标注)。
- 需要动态(4D)/ 心动周期数据的任务(MM-WHS 是静态 3D)。
- 需要儿科或特定病变专门数据的研究(其标注面向成人心脏七结构)。
- 期望一键公开下载、自动化流水线直接接入的用户(它是请求制)。
- 做单腔室功能诊断(如射血分数)的团队——那更适合 ACDC。
11.4 30 秒决策卡
| 问题 | 答案 |
|---|---|
| 它是什么? | MICCAI-STACOM 2017 多模态全心分割挑战赛数据集 |
| 有多少数据? | 120 例 = 60 CT + 60 MRI;训练 40 例带标注,测试 80 例盲评 |
| 标注哪几类? | LV=500 / RV=600 / LA=420 / RA=550 / Myo=205 / AO=820 / PA=850 |
| 有多难拿? | 请求制——签注册表 → 组织者批准 → 发链接 |
| 怎么评测? | 提交结果走盲评(单方法单次)或后期自助工具 |
| 还活着吗? | 本体维护已结束,续作为 CARE-Whole Heart |
| 一句话价值 | 全心分割领域的公开公平比较框架与标准基准 |
§12 常见问题 FAQ
A. 基础认知
A1:MM-WHS 和 MMWHS 是同一个东西吗?
是。MM-WHS、MMWHS、MM-WHS 2017、Multi-Modality Whole Heart Segmentation Challenge 均指同一数据集/挑战赛。
A2:它是"数据集"还是"挑战赛"?
两者都是。它最初是 2017 年的挑战赛,赛后可申请获得数据、并有持续运行的评测服务。因此它既是数据集也是基准。
A3:为什么常有论文把 MM-WHS 和 ACDC 一起提?
因为二者同为 STACOM 2017 的挑战赛,常被并列报告。但目标不同:MM-WHS 是多模态全心分割,ACDC 是心脏 MRI 功能诊断。
A4:MM-WHS 是 2D 还是 3D?
3D。所有数据是 3D 体数据(volumes),NIfTI 格式。
A5:它是静态还是动态(4D)?
静态 3D。不覆盖心动周期的时间维度。
B. 数据与获取
B1:我能直接下载吗?
不能。须签署注册表并经组织者批准(§6.1)。
B2:申请要多久?
官方未公布固定时长。有社区经验称用机构邮箱(.edu/.org)提交通常较快(约 24 小时内收到回复),但这是社区非官方经验口径,仅供参考、不构成承诺。
B3:数据多大?
官方未给出统一体积。社区经验指出原始 DICOM 单例可超过 1 GB,建议预留充足存储(非官方口径)。NIfTI 格式的体量取决于分辨率与例数。
B4:我能把数据分享给同事吗?
不能。接受方承诺不向第三方传播(§6.2)。
B5:训练集和测试集分别有多少?
训练 20 CT + 20 MRI(带标注);测试 40 CT + 40 MRI(无公开标注)。
C. 标注与标签
C1:标签值是 1-7 吗?
不是。官方为 205/420/500/550/600/820/850,背景 0(坑 1)。
C2:CT 和 MRI 的标签一样吗?
官方口径下一样(统一 205-850)。若你在某处看到 CT 用 200/500/600/1220/2221,那是异源编码,不属官方七结构(§2.4)。
C3:大血管有特殊定义吗?
有。升主动脉=主动脉瓣至心房上缘水平;肺动脉=肺动脉瓣至分叉点。评测时大血管会被截断到标准长度(§2.3)。
C4:训练标注覆盖范围会超出定义长度吗?
会。官方说明训练手工标注通常覆盖超过定义长度,评测时才截断。
D. 评测
D1:我能本地算官方指标吗?
测试集标注不公开,无法本地算官方指标;须提交盲评或使用官方自助工具(§6.3)。
D2:能评几次?
单方法单次(“A method can only be evaluated once”)。
D3:指标有哪些?
generalized Dice、Jaccard、surface-to-surface distance(§3.3)。
D4:提交格式要求有哪些?
邮件标题固定格式、NIfTI zip、文件名 ct_test_20??_label.nii.gz、图像信息与原图完全一致(§3.2,坑 6)。
E. 影响与续作
E1:引用量多少?
三源:Google Scholar 420 / Semantic Scholar 366 / PlumX 289(抓取时点,§4.5)。
E2:有续作吗?
有。CARE-Whole Heart(MICCAI 2025 CARE,246 例 8 中心,沿用同套标签)(§5.1)。
E3:MM-WHS 还维护吗?
官方声明本体维护已结束,新数据看 CARE(坑 5)。
E4:应该引用哪些论文?
使用数据引用 Zhuang & Shen 2016、Zhuang 2019 TPAMI 等(§5.4);使用评测结果引用挑战赛总结论文(Zhuang et al., Med Image Anal 2019;58:101537)。
F. 复现与工程
F1:有没有开源复现?
有。社区有多个基于 MM-WHS 的心脏分割复现仓库(含 UNet 类基础结构与半监督/域自适应方法),GitHub 上可检索到(如 Xavier-cvpr/MMWHS 等)。注意核对标签编码(坑 1)。
F2:常见预处理有哪些?
社区常用:重采样到统一 spacing、窗宽窗位调整(CT)、强度归一化、尺寸统一(如缩放到 512×512 等)、裁去非心脏区域。具体参数以官方文档与你的任务为准(社区口径,非官方规定)。
F3:为什么我的 Dice 比论文低很多?
可能是标签编码不匹配(坑 1)、预处理差异、训练/测试划分误解(坑 3),或使用了不同评测实现。先在官方评测口径下核对。
附录 A:条目信息速查卡
| 项目 | 内容 |
|---|---|
| 条目名 | MM-WHS(mm-whs) |
| 全称 | Multi-Modality Whole Heart Segmentation Challenge |
| 别名 | MMWHS / MM-WHS 2017 / Multi-Modality Whole Heart Segmentation |
| 类型 | 挑战赛数据集(请求制) |
| 组织 | Fudan University ZMIC Lab(Xiahai Zhuang);联合 Imperial College London(Guang Yang)、上海交通大学(Lei Li) |
| 会议 | MICCAI-STACOM 2017(Quebec City, Canada, 2017-09) |
| 论文 | Med Image Anal 2019;58:101537(doi:10.1016/j.media.2019.101537;PMID 31446280;PMC6839613;arXiv:1902.07880) |
| 论文集 | Springer LNCS vol 10663(doi:10.1007/978-3-319-75541-0) |
| 规模 | 120 例(60 CT + 60 MRI) |
| 划分 | 训练 20 CT + 20 MRI;测试 40 CT + 40 MRI |
| 标注 | 七类:LV=500 / RV=600 / LA=420 / RA=550 / Myo=205 / AO=820 / PA=850 |
| 格式 | NIfTI(.nii.gz) |
| 指标 | generalized Dice / Jaccard / surface-to-surface distance |
| 获取 | 请求制(注册表 → 批准 → 链接) |
| 续作 | CARE-Whole Heart |
| 官网 | https://zmiclab.github.io/zxh/0/mmwhs/ |
附录 B:DAIMS 评估全表
DAIMS 从数据可用性、可发现性、可互操作性、可复现性等维度评估数据集。本条目对 MM-WHS 的逐维评估如下:
| DAIMS 维度 | 评估 | 说明 |
|---|---|---|
| 数据可用性(Availability) | ★★★☆☆ | 数据存在且可申请,但请求制,无公开直链;接受方不得再分发 |
| 数据可发现性(Discoverability) | ★★★★☆ | 官网 + 论文 + arXiv + 多聚合站均可检索到完整元信息;条目名唯一 |
| 可访问性(Accessibility) | ★★★☆☆ | 需人工审批流程,自动化工具难以直接接入;旧域名大面积失效 |
| 可互操作性(Interoperability) | ★★★★☆ | 统一 NIfTI 格式 + 统一标签体系(205-850)+ 严格解剖定义,跨方法可比性强 |
| 可复现性(Reproducibility) | ★★★★☆ | 盲评 + 单方法单次评测 + 公开指标口径 + 工具链公开,复现条件良好;但测试集标注不可得,本地无法完全复现官方评测 |
| 元数据完整性(Metadata) | ★★★★☆ | 论文/官网提供采集、规格、标签、定义等详尽元数据;部分数字有双口径(分辨率、训练例数) |
| 许可清晰度(Licensing) | ★★★☆☆ | 数据使用条款明确(签表 + 不传播),但无标准 SPDX 许可证;论文为 Elsevier open access |
| 时效性(Currency) | ★★★☆☆ | 本体维护已结束(2025 前),续作 CARE-Whole Heart 承接;经典但非最新 |
| 伦理与隐私(Ethics/Privacy) | ★★★★★ | 全部经机构伦理批准并匿名化,采集于临床且合规使用 |
| AI-Ready 综合 | ★★★★☆ | 作为基准极为合格(口径统一、可比性强、盲评背书);作为可直接训练的数据源则受限于请求制与小样本 |
附录 C:逐项证据链自证
| 事实 | 主源 | 交叉源 1 | 交叉源 2 |
|---|---|---|---|
| 120 例(60 CT + 60 MRI) | 官网 data.html | 论文摘要(Med Image Anal 2019) | OpenMedLab 聚合站 / Nature Sci Rep 2025 |
| 训练 20+20 / 测试 40+40 | 官网 data.html | 论文摘要 | OpenMedLab / Nature Sci Rep 2025 |
| 七结构标签 205-850 | 官网 data.html | CARE-Whole Heart 页面 | 专利 CN114708212A 引述 |
| 论文 doi/PMID | PubMed 31446280 | ScienceDirect S1361841519300751 | HAL / PlumX |
| arXiv 1902.07880(2019-02-21) | arXiv 元数据 | — | — |
| STACOM 2017 LNCS 10663 | dblp | 图书馆书目记录(Owens/IU) | — |
| CT 面内约 0.78 mm / 层厚约 1.60 mm | 官网 data.html | — | — |
| 请求制获取 | 官网主页 | GitHub README | 社区博客经验 |
| 不接受再传播 | 官网主页 | — | — |
| 盲评 + 单方法单次 | GitHub README | — | — |
| 引用量三口径 | Google Scholar 420 | Semantic Scholar 366 | PlumX 289 |
| 续作 CARE-Whole Heart(246 例 8 中心) | zmic.org.cn CARE 页面 | CSDN 复述 | — |
| 首页"维护结束"声明 | 官网首页 | — | — |
附录 D:数据获取决策树
需要多模态全心分割数据?
├─ 需要 CT + MRI 双模态、七结构、公认基准
│ ├─ 能接受"签注册表 + 等审批" → MM-WHS(本条目,§6)
│ └─ 需要更大样本 / 更多中心 → CARE-Whole Heart(§5.1)
├─ 只需要心脏 MRI 功能诊断(射血分数等)
│ └─ ACDC(§2.6)
├─ 需要左心房 / 瘢痕专项
│ └─ LAScarQS 2022 等(§5.2)
└─ 只需快速跑 baseline、要公开直链
└─ 考虑其他完全公开的心脏分割集(注意目标/规格差异)
附录 E:标签编码映射规范
官方七结构编码(权威):
| 结构 | 官方标签 | 常见异源编码(勿混用) |
|---|---|---|
| 背景 | 0 | 0 |
| 左心室心肌 Myo | 205 | 200(OpenMedLab CT 表"LV normal myocardium") |
| 左心房血腔 LA | 420 | — |
| 左心室血腔 LV | 500 | 500(“LV blood pool”) |
| 右心房血腔 RA | 550 | — |
| 右心室血腔 RV | 600 | 600(“RV blood pool”) |
| 升主动脉 AO | 820 | — |
| 肺动脉 PA | 850 | — |
| (异源专有)左心室心肌水肿 | — | 1220 |
| (异源专有)左心室心肌瘢痕 | — | 2221 |
转换守则:
- 加载后先
np.unique打印标签集,与官方集合比对。 - 若混入 1220/2221,说明数据来自异源心肌标注,不可直接当作 MM-WHS 七结构使用。
- 若遇到 1-7 连续编码,按官方顺序(Myo/LA/LV/RA/RV/AO/PA)或按源文档映射,并做可视化验证。
附录 F:复现骨架(SOP 模板)
1. 获取:签注册表 → 组织者批准 → 下载 ct_train/mr_train/ct_test/mr_test
2. 校验:np.unique 检查标签集 == {0,205,420,500,550,600,820,850}
3. 预处理:重采样统一 spacing → (CT)窗宽窗位 → 强度归一化 → 裁 ROI / 统一尺寸
4. 划分:用官方 train 20+20 训练;如需验证集,从 train 内部切分(勿用 test)
5. 训练:3D 分割网络(UNet/VNet/Transformer 类)
6. 自测:用官方自助评测工具或自实现 Dice/Jaccard/ASSD
7. 提交:核对格式(§3.2)→ 邮件盲评(单方法单次)
8. 引用:按 §5.4 规范引用
附录 G:评测指标公式速查
| 指标 | 公式(简述) |
|---|---|
| Dice | 2·\ |
| Jaccard (IoU) | \ |
| Surface-to-surface distance | A 表面点到 B 表面点距离的双向统计(均值/中位/HD95 等) |
官方使用 generalized Dice(对多类、含小结构更稳健而非简单逐类平均)。具体实现以官方评测说明为准。
附录 H:双口径登记表
| 事实 | 口径 A | 口径 B | 处置 |
|---|---|---|---|
| CT 分辨率 | 官方标称 0.78×0.78 mm / 层厚 1.60 mm | OpenMedLab 实测中位 (0.44,0.44,0.625) mm | 并列,注明口径来源(坑 7) |
| MR 分辨率 | 官方 采集约 2 mm / 重建约 1 mm | OpenMedLab 实测中位 (0.97,0.97,1.05) mm | 并列 |
| 训练标注集大小 | 官方 20 CT + 20 MRI | OpenMedLab CT 表表体列 “25” | 以官方 20 为准,异源"25"存照 |
| 标签编码 | 官方 205-850 | OpenMedLab CT 表 200/500/600/1220/2221 | 以官方为准(坑 1) |
| 引用量 | Google Scholar 420 | Semantic Scholar 366 / PlumX 289 | 三口径并列(坑 4) |
| 大血管平均长度 | 官网 升主动脉 ≈41.9 mm | 官网 肺动脉 ≈41.9 mm(同值可疑) | 原文照录 + 标注疑点(坑 8) |
附录 I:与库内 PANDA-PLUS 条目的对照(方法论)
本条目与库内 PANDA-PLUS 条目同属千方病案医数集,但在多个维度形成鲜明对照,便于读者建立"数据集类型光谱"的直觉:
| 维度 | MM-WHS(本条目) | PANDA-PLUS |
|---|---|---|
| 类型 | 挑战赛数据集(原生) | 重标注升级版(衍生) |
| 模态 | 3D 心脏 CT/MRI | 2D 病理 WSI |
| 任务 | 全心七结构分割 | 像素级 Gleason 分级分割 |
| 获取 | 单轨请求制(签表审批) | 三层异构(WSI 公开 / 掩码请求制 / Bench 直链) |
| 论文 | Med Image Anal 2019;58:101537 | J Pathol Inform 2025;20:100540 |
| 核心贡献 | 公平比较框架 + 盲评 + 标准基准 | 标签质量解剖 + 可复制注释流水线 |
| 共同点 | 均为高价值基准;都存在双口径/编码坑;均需注意引用与许可规范 | 同左 |
附录 J:参考来源清单(全)
| # | 来源 | URL / 标识 | 用途 |
|---|---|---|---|
| 1 | 官方主页 | https://zmiclab.github.io/zxh/0/mmwhs/ | 数据/获取/维护声明 |
| 2 | 官方数据页 | https://zmiclab.github.io/zxh/0/mmwhs/data.html | 规格/标签/大血管定义 |
| 3 | 挑战赛论文 | doi:10.1016/j.media.2019.101537 | 结果/规模/结论 |
| 4 | PubMed | PMID 31446280 | 书目核验 |
| 5 | arXiv | arXiv:1902.07880 | 预印本元数据 |
| 6 | STACOM 2017 论文集 | doi:10.1007/978-3-319-75541-0(LNCS 10663) | 会议出处 |
| 7 | GitHub 镜像 | https://github.com/zxhzxhgithub/mmwhs | 提交规范/引用要求 |
| 8 | OpenMedLab 聚合 | github.com/openmedlab/.../MM-WHS.md | 规格统计/目录结构/下载镜像 |
| 9 | CARE-Whole Heart | https://zmic.org.cn/care_2026/track_wholeheart/ | 续作/血统 |
| 10 | Nature Sci Rep 2025 | s41598-025-25785-9 | 第三方引用口径 |
| 11 | PlumX | plu.mx/plum/a?doi=10.1016/j.media.2019.101537 | 引用计数 |
| 12 | Google Scholar | 检索记录 | 引用计数 |
| 13 | CFP 邮件列表 | visionlist / connectionists (2017) | 时间线/组织/赞助 |
| 14 | 专利 CN114708212A | Google Patents | 标签编码交叉验证 |
§13 深度应用场景:MM-WHS 在真实研究中的五条主线
13.1 主线一:跨模态域自适应(Domain Adaptation)
这是 MM-WHS 被引用最多的应用方向之一。核心设定是:在一种模态(源域)上训练,在另一种模态(目标域)上测试,模拟真实世界中"训练数据与部署数据分布不一致"的问题。
为什么 MM-WHS 天然适合:
- 它有 CT 与 MRI 两套配对的解剖结构(同一套七结构标签),可以构造"CT→MRI"或"MRI→CT"的迁移任务。
- 它包含多中心、多设备采集的数据,域偏移真实存在而非人为制造。
- 训练集与测试集的结构标签一致,便于度量迁移前后的性能跌落。
典型方法路线(文献常见):
- 特征对齐:在共享特征空间中对齐源域与目标域的分布(如对抗训练、MMD 最小化)。
- 知识蒸馏:用源域模型指导目标域模型,例如无配对多模态分割中的相互蒸馏。
- 图像翻译:先把源域影像翻译为目标域风格(如 CycleGAN 类),再在翻译后数据上训练。
- 测试时适应:推理阶段用目标域的无标注测试样本微调模型。
评估要点:在 MM-WHS 上,域自适应的"及格线"通常看目标域 Dice 相对源域直接迁移的提升幅度;因为 CT 本身比 MRI 易分(§4.2),"MRI→CT"往往报出更高绝对值,比较时须注意方向。
13.2 主线二:半监督 / 少标注分割
MM-WHS 的"20 标注 + 40 未标注"结构(每个模态)是半监督分割研究的经典配置:
- 用 20 例带标注样本作为监督信号。
- 用 40 例无标注样本(测试影像)作为无监督正则。
- 度量在半监督下能否逼近全监督(即用满 40 例标注)的性能上限。
典型方法:一致性正则(对无标注样本加扰动要求预测一致)、伪标签自训练、Mean Teacher、熵最小化、对比学习预训练(如 VoCo 类框架)。
方法学意义:MM-WHS 上的半监督结果常被用来论证"在医学影像标注稀缺的现实下,无标注数据能否被有效利用"——这直接关系到临床数据采集成本。
13.3 主线三:多图谱与配准方法
在深度学习兴起前,MM-WHS 的主要基线就是多图谱分割(官网至今提供 zxhwhs.m / zxhLabelFuse 工具)。这条主线至今仍有价值:
- 配准质量研究:把图谱配准到目标影像的精度,直接决定分割质量。
- 标签融合研究:如何加权融合多个图谱的标签(多数投票、条件熵、概率融合)。
- 统计形状模型:利用训练集的形状分布约束分割,提升鲁棒性。
- 课程数据:官网提供的
affregcommon2mm_roi_{mr,ct}_train(配准到 2×2×2 mm 公共空间)正是为此类研究准备。
论文结论的呼应:§4.2 指出传统多图谱方法"稳健但精度/效率有限"——这条主线在 MM-WHS 上的当代价值,更多是作为鲁棒基线与混合方法的前段,而非单独追求最高 Dice。
13.4 主线四:网络架构与训练策略消融
由于 MM-WHS 是公认基准,大量论文把它当作架构与策略的消融试验场:
- 3D 网络设计:3D UNet / VNet / Attention UNet / nnU-Net / Transformer(SwinUNETR 类)的对比。
- 损失函数:Dice loss、交叉熵、边界损失(Boundary loss)、复合损失(如 Adaptive Composite Loss,Nature Sci Rep 2025 即在其 CT 子集上验证)。
- 数据增强:弹性形变、强度扰动、随机裁剪对全心分割的影响。
- 预训练与迁移:引入大规模 3D 医学影像自监督预训练(如 VoCo)后再微调。
消融的纪律:在 MM-WHS 上做消融,必须报告盲评口径或至少严格对齐官方指标实现(§3.3),否则不同论文的"提升"不可比。
13.5 主线五:临床下游任务验证
MM-WHS 的分割结果常被用作临床任务的前置模块:
- 心脏建模:由分割结果重建心脏三维模型,用于血流动力学仿真与术前规划。
- 治疗规划:为射频消融、瓣膜介入等手术提供结构导航。
- 功能分析:由心肌与腔室分割计算容积、室壁厚度等指标(注意 MM-WHS 是静态 3D,动态指标需另配数据)。
- 疾病诊断辅助:结构形态异常作为心脏疾病(如心肌病、瓣膜病)的影像特征。
官网明确把"cardiac modeling, treatment planning, and disease diagnosis across imaging modalities"列为数据效用的下游目标(这也是 Nature Sci Rep 2025 转述的口径)。
13.6 五条主线的交叉与选择建议
| 主线 | 对手法 | 数据用法 | 典型读者 |
|---|---|---|---|
| 域自适应 | CT↔MRI 迁移 | 源域标注 + 目标域无标注 | 迁移学习/域泛化研究者 |
| 半监督 | 一致性/伪标签 | 20 标注 + 40 无标注 | 少标注学习研究者 |
| 多图谱/配准 | 配准 + 标签融合 | 全训练集图谱库 | 传统方法/形状模型研究者 |
| 架构消融 | 网络 + 损失 + 增强 | 训练集 + 盲评 | 分割算法工程师 |
| 临床下游 | 分割前置 | 分割结果作为输入 | 临床应用/工程团队 |
选择建议:先明确你要回答的问题是"泛化(域自适应)"、“标注效率(半监督)”、"鲁棒性(架构消融)“还是"应用(临床下游)”,再据此决定用 MM-WHS 的哪部分结构与哪套评测口径。
§14 工程质量须知:从拿到数据到跑通 pipeline
14.1 数据加载与完整性校验
拿到 MM-WHS 数据后,第一件事是做完整性校验,避免"训练半天才发现标签没读进来":
- 清点文件数:
ct_train/mr_train应各含 20 组{image,label}对;ct_test/mr_test应各含 40 个image。 - 标签唯一值检查:对每个
_label.nii.gz执行numpy.unique,确认标签集 ⊆ {0,205,420,500,550,600,820,850}(§附录 E)。 - 几何一致性检查:image 与对应 label 的 shape、spacing、origin、direction 应完全一致(否则配准错位)。
- 数据类型检查:官方要求提交 short int 类型;本地读取时注意 label 的数据类型。
14.2 预处理流水线(社区常用,非官方规定)
| 步骤 | 常见做法 | 注意事项 |
|---|---|---|
| 重采样 | 统一到目标 spacing(如各向同性 1 mm) | 须同步重采样标签(最近邻插值),否则标签模糊错位 |
| CT 窗宽窗位 | 调整到心脏软组织窗(如 WW≈400-600 / WL≈50 附近) | 提高心肌/血腔对比度 |
| 强度归一化 | z-score 或 min-max | 各模态分别归一化 |
| ROI 裁剪 | 裁去非心脏区域 | 减少背景干扰与显存占用 |
| 尺寸统一 | 缩放或 pad 到固定尺寸 | 保持各向异性比例或统一为 3D patch |
红线:标签在任何几何变换下都必须用最近邻插值。用线性/三次插值重采样标签会造出不存在的类别值,是坑 1 的"二次伤害"。
14.3 训练与验证的划分纪律
- 官方测试集不可用于训练或调参(其标注本来就不公开)。
- 若需要验证集,应从 20 例训练样本内部切分(如 16 训练 / 4 验证),并做交叉验证以降低小样本划分的偶然性。
- 因训练集只有 20 例,单次划分的方差很大;严谨做法是 5-fold 交叉验证或多随机种子重复。
14.4 评测实现的一致性
若自实现 Dice/Jaccard/ASSD,须注意与官方定义的差异:
- generalized Dice(非简单逐类平均)的加权方式。
- surface-to-surface distance 的双向性与统计量(均值 / 中位数 / HD95)。
- 大血管截断:官方评测会对大血管结果做长度截断(§2.3),自测时若忽略,大血管 Dice 可能虚高。
建议:优先使用官方提供或官方认证的自助评测工具,避免"自己的指标比别人高一截"的假象。
14.5 常见工程故障排查表
| 现象 | 可能原因 | 排查 |
|---|---|---|
| 训练 loss 不降 | 标签编码错位 / 归一化异常 | np.unique 查标签;查输入强度范围 |
| 测试 Dice 极低 | 训练/测试划分错 / spacing 不一致 | 核对文件归属、重采样后 spacing |
| 大血管类 Dice 虚高 | 未做官方截断 | 按官方定义截断后重算 |
| 显存爆 | 3D 体数据过大 | 降 batch、patch 训练、混合精度 |
| 复现不出论文数 | 标签编码/预处理/评测口径不同 | 逐项对齐(§附录 E、§14.4) |
§15 数据集选择建议:什么情况下用 MM-WHS、什么情况下不用
15.1 决策矩阵
| 你的需求 | 推荐 | 理由 |
|---|---|---|
| 需要一个公认的全心分割基准做横向比较 | 用 MM-WHS | 领域标准测试床,可比性最强 |
| 研究 CT↔MRI 域自适应 | 用 MM-WHS | 天然双模态 + 真实域偏移 |
| 研究半监督 / 少标注 | 用 MM-WHS | "20 标注 + 40 无标注"结构经典 |
| 需要大量带标注训练纯监督大模型 | 不用 MM-WHS | 训练集仅 40 例带标注 |
| 需要动态 4D / 心动周期数据 | 不用 MM-WHS | 它是静态 3D |
| 需要心脏 MRI 功能诊断(射血分数等) | 用 ACDC | 目标匹配 |
| 需要多个心中心、更大规模的 WHS | 用 CARE-Whole Heart | MM-WHS 官方续作,246 例 8 中心 |
| 需要最新且可自动化获取的公开数据 | 谨慎 | MM-WHS 请求制 + 本体停更 |
15.2 与相近基准的横评
| 基准 | 模态 | 规模 | 任务 | 获取 | 与 MM-WHS 关系 |
|---|---|---|---|---|---|
| MM-WHS | CT + MRI | 120 例 | 全心七结构分割 | 请求制 | 本条目 |
| CARE-Whole Heart | CT + MRI | 246 例 8 中心 | 全心七结构分割 | 注册 | 官方续作 |
| ACDC | MRI | 150 例(100 训练+50 测试) | 心脏功能诊断 + 分割 | 注册 | 同届 STACOM 2017 |
| Left Atrium Seg. 2013 | MRI + CT | 30 + 30 | 左心房/全心 | 请求制 | MM-WHS 关联前辈 |
| LAScarQS 2022 | MRI | — | 左心房 + 瘢痕量化 | 注册 | MM-WHS 官网关联 |
横评提示:选择基准时先对齐任务与模态,再看规模与获取方式。MM-WHS 的独特价值在于"双模态 + 七结构 + 盲评服务"三者的组合,而非单纯的数据量。
15.3 迁移使用建议
若你已有一个在 MM-WHS 上训练好的模型,想迁移到其他数据(如 CARE-Whole Heart、院内数据),须注意:
- 标签编码:确认目标数据的编码是否同为 205-850;不同则先映射(§附录 E)。
- spacing/方向:不同数据的 spacing 与朝向不同,须重采样与配准对齐。
- 结构定义:大血管的解剖长度定义可能不同(MM-WHS 有严格截断定义),迁移时须核对目标口径。
- 域偏移:不同中心/设备的影像风格不同,直接迁移可能性能跌落,必要时做域自适应(§13.1)。
§16 维护计划与触发点
16.1 本条目需要更新的触发条件
以下任一情况发生时,本条目应复核更新:
| 触发条件 | 更新动作 |
|---|---|
| MM-WHS 官网恢复维护 / 重新开放 | 更新 §5.1、§6 的停更描述 |
| CARE-Whole Heart 正式完结并发布数据 | 扩写 §5.1 的血统与规模 |
| 出现新的官方续作或合并动作 | 新增续作小节 |
| 官网域名再次迁移 | 更新 §6.5、坑 5 的域名信息 |
| 论文被重大勘误或标准编码变更 | 更新 §2.3、§2.4、附录 E |
| 出现权威的标签编码澄清 | 收敛坑 1 的双口径 |
16.2 本条目已知的时效性弱点
- 官网抓取受限:本条目撰写时,
zmiclab.github.io在沙箱环境无法直接抓取正文,官网事实系通过搜索引擎索引文本 + 期刊论文 + 独立聚合站三源互证获得(§附录 C、坑 5)。 - MEGA 链接不可验证:
mega.nz为 JS 渲染,无法在沙箱内确认文件夹内容与体积。 - 应用经验为社区口径:§14 的部分预处理建议与 §FAQ 的部分答复(如申请时长)来自社区经验,非官方规定,已在正文标注。
- 引用量为动态值:§4.5 的三口径引用数会随时间变化,标注了抓取时点。
本条目遵循千方病案医数集 AI-Ready Wikipedia 编写规范:硬数字三源互证、双口径逐条存照、坑点编号制、DAIMS 评估、中文为主术语首现标英文。所有外部链接与数字的抓取时点均为 2026-09-30。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mms-2 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- cmrxmotion — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lvquant — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- emidec — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- myops — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- lascarqs — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 心血管疾病
- medical-decathlon — 共享标签:医学影像 / CT / MRI / 医学图像分割
- cmrxrecon — 共享标签:医学影像 / MRI / 挑战赛数据集 / 心血管疾病
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

