信息速览

MIDOG 有丝分裂泛癌域泛化检测数据集 — 跨扫描仪、跨物种的计算病理学域泛化基准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | MIDOG(MItosis DOmain Generalization Challenge) |
| 英文全称 | MItosis DOmain Generalization Challenge(MIDOG 2021/2022,扩展版 MIDOG++) |
| 别名/简称 | MIDOG 2021、MIDOG 2022、MIDOG++ |
| 疾病分类(ICD-11) | 2C60 乳腺癌;2C30 皮肤黑色素瘤(人域;犬类肿瘤不适用 ICD-11) |
| SNOMED CT | 254837009(恶性乳腺肿瘤);372244000(恶性黑色素瘤) |
| 数据模态 | H&E 染色组织病理 ROI 图像(40× 全切片扫描裁剪,TIFF/PNG) |
| AI 任务类型 | 目标检测(有丝分裂象检测)、跨域泛化;延伸任务:非典型有丝分裂分类 |
| 样本总数 | MIDOG 2021 训练 200 例;MIDOG 2022 训练 405 例;MIDOG++ 503 例 |
| 数据大小 | MIDOG 2022 PNG 版约 30 GB(Zenodo 分卷);MIDOG++ 图像约 65 GB |
| 数据格式 | TIFF(2021);PNG + MS COCO JSON + SlideRunner SQLite(2022/MIDOG++) |
| 许可证 | CC BY-NC-ND 4.0(MIDOG 2021 训练数据,据挑战论文数据使用声明);MIDOG++ 图像 CC0 |
| 访问级别 | 注册后开放(挑战注册 + 公开下载) |
| DUO 标签 | NPUNCU(非商业、非营利使用;以官方许可协议为准) |
| 语言 | 英文(标注与文档);图像为组织病理切片,无文本内容 |
| 首发日期 | 2021-04(MIDOG 2021 训练数据上 Zenodo) |
| 最后更新 | 2023-06(MIDOG++ 数据集发布于 figshare) |
| 发布机构 | MIDOG 联合团队:英戈尔施塔特工业大学、维也纳兽医大学、UMC 乌得勒支、柏林自由大学、埃尔朗根-纽伦堡大学等 |
| 官方主页 | midog.deepmicroscopy.org |
| 下载地址 | MIDOG 2021(Zenodo)、MIDOG 2022 PNG 版(Zenodo) |
| DOI | 10.5281/zenodo.4643381(2021 训练数据);10.5281/zenodo.6547151(2022 PNG 版) |
| 引用次数 | 2022 版挑战报告论文 58+ 次(VetMedUni VetDoc 出版记录,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方 COCO/SQLite 双格式标注、参考算法代码与 Colab 入门 notebook 齐全;扣分项:无官方训练/验证划分(测试集隐藏)、跨版本需手动对齐、PNG 版与原始 TIFF 分辨率需自行核对 |
| 页面状态 | published |
§0 E-E-A-T 审核与可信度声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(有丝分裂计数与肿瘤分级、ICD-11 与 SNOMED CT 映射)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MIDOG 2021 训练数据采用 CC BY-NC-ND 4.0 许可(禁止商业使用与演绎分发),MIDOG++ 图像采用 CC0 许可。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? MIDOG 是 MICCAI 2021 与 2022 年连续举办的两届"有丝分裂域泛化挑战"(MItosis DOmain Generalization Challenge)所发布的数据集系列。它由病理医师在 H&E 染色组织切片上圈出的高倍视野区域(ROI)构成,每个正在分裂的细胞(有丝分裂象)都被精确标注。MIDOG 2021 含 200 例人乳腺癌、4 台不同扫描仪;MIDOG 2022 扩展到 405 例、6 个肿瘤域,涵盖人类与犬的多种肿瘤(官方挑战页、Zenodo)。
为什么重要? 有丝分裂计数是多种肿瘤分级的核心预后指标,但病理医师之间的判读差异很大。更麻烦的是:深度学习模型换一台扫描仪、换一种肿瘤、甚至换一个物种,性能就会大幅下降——这正是 MIDOG 专门设计的"考题"。它是计算病理学领域第一个系统考察域泛化的检测基准(Aubreville et al., 2022, MedIA)。
我能用它做什么? 训练与评测跨扫描仪稳健的有丝分裂检测器;研究染色归一化、域对抗训练、测试时增强等域泛化技术;把人类肿瘤模型迁移到犬类肿瘤(兽医病理 AI);或用 11,051 个"硬负例"研究假阳性抑制。9,501 个有丝分裂标注 + 11,051 个硬负例,全部免费下载(获取方式)。
§1.1 摘要
MIDOG 系列数据集由 MICCAI 有丝分裂域泛化挑战赛产生,组织方包括英戈尔施塔特工业大学(Technische Hochschule Ingolstadt)、维也纳兽医大学(University of Veterinary Medicine Vienna)、UMC 乌得勒支(UMC Utrecht)、柏林自由大学、埃尔朗根-纽伦堡大学等。数据制作流程为:病理医师按分级指南(如乳腺癌 Elston-Ellis 方案)从全切片图像(WSI)上选取约 2 mm² 的肿瘤热区(约等于 10 个 400× 高倍视野),裁剪为固定 ROI;再由资深病理医师用 SlideRunner 软件标注全部有丝分裂象及形态相似的"硬负例",经过算法辅助的漏检召回、128×128 像素 patch 盲评、双专家共识与第三人仲裁的多轮质控(Aubreville et al., 2023, Sci Data)。
MIDOG 2021 把"同一实验室、同一癌种、4 台扫描仪"作为唯一变量(200 例人乳腺癌,每台扫描仪 50 例),证明扫描仪差异本身就能让检测器性能骤降;MIDOG 2022 进一步把变量扩展到肿瘤类型、实验室与物种(405 例、6 域,含 3 个人类域与 3 个犬域),并在测试中引入训练时完全未见的域(如猫肿瘤)。两届挑战的冠军模型 F1 分别为 0.748 与 0.764,最佳方法普遍采用分割辅助任务、集成/测试时增强与激进的染色域增强。数据以 MS COCO JSON 与 SlideRunner SQLite 双格式发布,附带参考算法代码、Docker 提交模板与 Colab 入门 notebook,工程可用性在病理检测数据集中属于第一梯队。
§1.2 战略价值
维度一:域泛化研究的"标准考卷"。 在医疗影像 AI 从单中心走向多中心部署的过程中,域偏移是最主要的失败来源之一。MIDOG 2021 用同实验室同癌种、只变扫描仪的设计,干净地剥离出了"数字化设备"这一单一偏移源;MIDOG 2022 又叠加了癌种、实验室、物种、染色流程等多重偏移。两层数据叠加,使研究者可以在"单变量偏移"与"复合偏移"两个难度梯度上系统评测泛化方法——这在病理影像数据集中几乎独一无二。MIDOG 2021 挑战报告显示,最佳方法已达专家水平(F1 0.748,95% CI 0.704-0.781),但未见扫描仪上性能仍显著偏低(Aubreville et al., 2022, MedIA)。
维度二:人医与兽医病理的跨物种桥梁。 MIDOG 2022 是首批同时覆盖人类与犬类肿瘤、且标注协议完全一致的多物种检测数据集之一:犬肺癌、犬淋巴瘤、犬皮肤肥大细胞瘤共 149 例,全部由兽医病理专家按相同流程标注。挑战结果证明,训练集中未出现的物种(猫)会带来小幅但显著的性能下降,这为"跨物种病理基础模型"研究提供了可量化起点(Aubreville et al., 2024, MedIA)。对兽医 AI 团队而言,3 个犬域 + 2 台扫描仪的组合本身就是高价值资源。
维度三:标注质量方法学的示范样本。 MIDOG 的标注协议——算法辅助漏检召回、盲评 patch、双专家共识、第三人仲裁——已成为病理检测数据集标注的事实标准之一,并被 MIDOG++(503 例、11,937 个有丝分裂标注)完整继承。对计划自建病理标注团队的公司与医院,这套协议本身就是可复用的方法论(Aubreville et al., 2023, Sci Data)。
维度四:可复现性基础设施。 从 Zenodo/figshare 持久 DOI、双格式标注、参考算法权重,到 Docker 提交模板与官方 Colab notebook,MIDOG 提供了从"下载"到"复现官方基线"的完整闭环——这在 2021 年的检测类挑战中相当超前。对工程团队,这意味着把基线跑通的时间成本从数周降到数小时;对教学场景,它提供了难得的"论文-数据-代码-评测平台"四位一体样本(参考算法)。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态与标注 | 扫描仪/域 | 差异化定位 |
|---|---|---|---|---|
| MIDOG 2021 | 200 例乳腺癌 ROI | 有丝分裂框/圆标注(COCO JSON) | 4 台扫描仪(1 台无标注) | 单变量:纯扫描仪域偏移 |
| MIDOG 2022 | 405 例、6 肿瘤域,9,501 MF + 11,051 硬负例 | 圆形标注(COCO + SQLite) | 5 台扫描仪、3 实验室、2 物种 | 复合域偏移 + 跨物种 |
| MIDOG++ | 503 例、7 肿瘤域,11,937 MF + 14,351 imposters | 同上,含 5 折交叉验证划分 | 5 台扫描仪、多实验室 | 最大规模多域训练集 |
| MITOS-ATYPIA-14(ICPR 2014) | 约 1,300 张高倍视野帧 | 有丝分裂 + 非典型标注 | 2 台扫描仪 | 多伦多/那不勒斯队列,含 ATYPIA 子任务 |
| TUPAC16(MICCAI 2016) | 500 例乳腺癌 WSI(TCGA) | 全片有丝分裂计数 + 增殖评分 | 单一扫描仪为主 | 全片增殖预测,非域泛化 |
| MoNuSAC / PanNuke | 大规模细胞核分割/分类 | 核实例分割 | 多癌种 | 核分割通用基准,无有丝分裂专精 |
| NuCLS | 约 220,000 个核标注 | 多类别核检测(含有丝分裂类) | TCGA 多癌种 | 核型分类 + 标注者间一致性研究 |
MIDOG 系列是唯一以"域泛化"为一等公民、由多届 MICCAI 挑战持续运营的有丝分裂检测基准;MITOS-ATYPIA-14 与 TUPAC16 提供历史延续性,但扫描仪域覆盖远小于 MIDOG(域泛化综述)。
§1.4 版本时间轴
| 版本 | 发布时间 | 关键内容 | 来源 |
|---|---|---|---|
| MIDOG 2021 训练数据 | 2021-04 | 200 例人乳腺癌、4 台扫描仪、COCO 标注 | Zenodo 4643381 |
| MIDOG 2021 挑战 | 2021-08 至 2021-10 | 17 支队伍终评;2021-10-01 MICCAI 2021 公布结果 | 挑战页 |
| MIDOG 2021 挑战报告 | 2022 | Medical Image Analysis 总结论文 | DOI |
| MIDOG 2022 训练数据 | 2022-04-20 | 405 例、6 域、9,501 MF + 11,051 硬负例、双格式 | Zenodo 6547151 |
| MIDOG 2022 挑战 | 2022-08 至 2022-09 | 双赛道(禁用/允许外部数据);10 域隐藏测试 | 挑战页 |
| MIDOG++ | 2023-06-30 | 503 例、11,937 MF + 14,351 imposters、figshare 发布 | figshare |
| MIDOG 2022 挑战报告 | 2024-03-22 | Medical Image Analysis 94:103155 | DOI |
| MIDOG 2025 | 2025 | 新增 Track 2 非典型有丝分裂(AMF)分类 | 综述 |
§1.5 典型应用场景
- 跨扫描仪稳健检测器研发:用 2021 版 4 扫描仪设计做域对抗训练、染色增强、测试时增强的消融实验,F1 可与公开冠军(0.748)对标。
- 多癌种有丝分裂检测通用模型:以 2022 版 6 域训练构建跨肿瘤类型检测器,再在 MIDOG++ 的 7 域上扩展。
- 兽医数字病理冷启动:犬肺癌/淋巴瘤/肥大细胞瘤 3 个域可直接支撑犬肿瘤分级 AI 原型。
- 标注协议与质量控制研究:利用双专家共识 + 仲裁痕迹与硬负例设计,研究标签噪声建模与"难度感知"学习(MIDOG 2025 Track 2 已把标注难度建模为监督信号)。
- 教学与基准复现:官方 Colab notebook + Docker 提交模板使该数据集成为计算病理课程的理想实验平台。
§2 医学背景
§2.1 疾病与术语编码映射(ICD-11)
MIDOG 覆盖人类与犬类肿瘤。人类肿瘤域可映射至 ICD-11;犬类肿瘤不适用 ICD-11(该分类系统仅覆盖人类疾病),兽医侧依赖 WHO 家畜肿瘤分级方案。
| 标签/概念 | ICD-11 编码 | ICD-11 中文名 | 备注 |
|---|---|---|---|
| 乳腺癌(人,MIDOG 主要域) | 2C60 | 乳腺原位癌或浸润性乳腺癌(Breast carcinoma) | 训练集 150 例(2022 版)全部来自 UMC 乌得勒支乳腺档案 |
| 皮肤黑色素瘤(人) | 2C30 | 皮肤恶性黑色素瘤(Cutaneous melanoma) | 2022 版 51 例,训练域未提供标签 |
| 神经内分泌肿瘤(人) | 按原发部位编码(如胰腺 2C10、胃肠类) | 神经内分泌肿瘤 | 数据集未披露全部原发部位,编码需按具体病例归属 |
| 犬肺癌 / 犬淋巴瘤 / 犬皮肤肥大细胞瘤 | 不适用 ICD-11 | —(动物疾病) | 兽医病理使用 WHO 犬肿瘤分级(如犬肥大细胞瘤 Patnaik/Kiupel 分级) |
§2.1b SNOMED CT 映射
| 标签/概念 | SNOMED CT 码 | 术语 | 说明 |
|---|---|---|---|
| 乳腺恶性肿瘤 | 254837009 | Malignant tumor of breast (disorder) | 对应 ICD-11 2C60 |
| 恶性黑色素瘤 | 372244000 | Malignant melanoma (disorder) | 对应 ICD-11 2C30 |
| 有丝分裂活动(概念) | 见"核分裂计数"相关概念轴 | Mitotic activity / Mitotic count | 病理报告结构化字段,跨肿瘤通用 |
| 犬类肿瘤 | SNOMED CT 兽医扩展(Veterinary Extension) | — | 人用 SNOMED CT 核心模块不覆盖 |
§2.2 疾病简介与流行病学
有丝分裂与肿瘤分级。 有丝分裂象(mitotic figure)是处于细胞分裂过程中的细胞,在 H&E 染色下呈现深染的核分裂形态。肿瘤组织中单位面积的有丝分裂计数(mitotic count, MC)与肿瘤增殖活性高度相关,是多种肿瘤分级方案的核心组分:乳腺癌 Nottingham(Elston-Ellis)分级中,10 个高倍视野的有丝分裂计数与腺管形成、核多形性并列为三大评分项;犬皮肤肥大细胞瘤的 Kiupel 与 Patnaik 分级同样将有丝分裂活性作为关键判据(Aubreville et al., 2022, MedIA)。
判读的主观性难题。 有丝分裂象识别的观察者间差异极大:前景细胞(核分裂前期/后期/末期)与凋亡小体、淋巴细胞、裸核瘤细胞极易混淆。MIDOG 挑战报告明确指出"病理医师识别有丝分裂象存在强烈的观察者间偏倚,限制了其预后价值"——这正是自动化检测的核心动机(Aubreville et al., 2022, MedIA)。
流行病学背景。 乳腺癌是全球女性最常见的恶性肿瘤,GLOBOCAN 2022 估计每年新发约 230 万例;皮肤黑色素瘤 GLOBOCAN 2020 估计每年新发约 33 万例。MIDOG 数据来自欧洲(德国、奥地利、荷兰)与美国(纽约动物医疗中心)的人类与兽医病理档案,时间为 2021-2023 年间回顾性收集(挑战页)。
为什么用犬肿瘤? 兽医肿瘤学是 MIDOG 2022 的独特视角:犬自发肿瘤与人类肿瘤在组织学形态、分级逻辑(有丝分裂计数为核心组分)上有高度相似性,且犬肿瘤的分级方案(如犬皮肤肥大细胞瘤的 Patnaik/Kiupel 分级、犬淋巴瘤评估)同样依赖高倍视野下的有丝分裂活性。跨物种数据不仅扩大了训练分布,也使"形态学先验是否跨物种迁移"成为可量化问题——2022 挑战结果显示,训练中未见的猫科样本带来小幅但显著的性能下降,说明物种间迁移可行但非零成本(Aubreville et al., 2024, MedIA)。
§2.3 临床任务定义
MIDOG 对应的临床任务是有丝分裂计数自动化,属于"诊断与分级支持"类任务:病理医师在 10 个高倍视野内人工计数有丝分裂象(乳腺癌分级要求),或评估每 mm² 有丝分裂密度(犬肥大细胞瘤等)。该任务的特点是:目标极小(约 10-20 像素直径)、类别极度不平衡(每张 2 mm² ROI 内有丝分裂仅数十个,而细胞总数以万计)、且" imposters"(貌似分裂的细胞)密集。MIDOG 将其形式化为目标检测(中心点圆形标注 + 类别),并附加了域泛化约束:模型必须在训练时未见过的扫描仪/肿瘤类型/物种上保持性能(MIDOG 2022 官网)。
按临床工作流定位,该任务处于三个层次的交汇点:
- 分级支持(核心):有丝分裂计数直接进入 Nottingham 分级等方案,自动化可降低观察者间变异,提升分级可重复性。
- 热区定位(衍生):检测器输出的有丝分裂密度图可用于定位"增殖最活跃区域",辅助后续免疫组化取材与 FISH 检测的选区。
- 非典型分裂识别(延伸):MIDOG 2025 将"非典型有丝分裂(AMF)vs 正常有丝分裂(NMF)“设为独立赛道,因为 AMF 的比例与肿瘤侵袭性相关——这把任务从"计数"推进到"形态学细分类”(MIDOG 2025 报告)。
注意任务边界:MIDOG 不包含分级标签本身(每例的 Nottingham 级别)、不包含增殖指数(Ki-67)对照,也不含生存结局——它是"计数这一步"的基准,而非端到端分级的基准。
§2.4 患者与病例人群
| 维度 | MIDOG 2021 | MIDOG 2022 |
|---|---|---|
| 物种 | 人类 | 人类 + 犬 |
| 肿瘤类型 | 人乳腺癌(浸润性,按 Elston-Ellis 选择) | 人乳腺癌、人黑色素瘤、人神经内分泌肿瘤、犬肺癌、犬淋巴瘤、犬皮肤肥大细胞瘤 |
| 来源机构 | UMC 乌得勒支(荷兰) | UMC 乌得勒支、维也纳兽医大学、柏林自由大学、埃尔朗根大学医院(德国/荷兰) |
| 病例构成 | 连续病例按纳入标准筛选,各扫描仪组肿瘤分级分布相近 | 按域收集;具体年龄/性别分布未随数据发布 |
| 染色与扫描 | 同一实验室 H&E 染色,4 台扫描仪 | 多实验室 H&E 染色,5 台扫描仪 |
说明:数据集为去标识化的组织 ROI 图像,未附带患者年龄、性别、生存结局等临床表格,人群画像以论文描述为准(Zenodo、Aubreville et al., 2024, MedIA)。
§2.5 临床价值
自动有丝分裂检测的直接价值是把高主观性的人工计数变为可重复的量化指标:在乳腺癌分级中降低观察者间变异、在犬肿瘤分级中支持标准化报告;进阶价值包括增殖热区自动定位(辅助 FISH/免疫组化取材决策)与预后建模。MIDOG 2021 报告指出,挑战中最佳方法在已见扫描仪上的表现与高水平的病理专家相当,说明 ROI 级有丝分裂检测技术已接近可用,但全片场景(含离焦、坏死区域)仍需额外验证(Aubreville et al., 2022, MedIA)。
§2.6 金标准与标注协议
| 维度 | 内容 |
|---|---|
| 标注对象 | 每张 ROI 内全部有丝分裂象(MF)+ 形态相似的硬负例(imposters) |
| 划分方式 | SlideRunner 软件筛查模式,病理医师对每域图像两轮筛查;圆形标注半径 50 像素 |
| 标注者 | 3 名资深病理医师(C.A.B. 初标 + R.K. 盲评复标 + T.A.D. 分歧仲裁),均为有丝分裂标注经验丰富者 |
| 质控流程 | ① 初标 → ② RetinaNet 低阈值挖掘漏检候选(防确认偏倚)→ ③ 128×128 patch 盲评(隐藏原标签)→ ④ 双专家共识、分歧交第三人仲裁 |
| 参考标准性质 | 多专家共识金标准;MIDOG 2022 另建独立的免疫组化(IHC)辅助参考标准用于敏感性检验 |
| 一致性 | 双专家不一致样本由第三人终裁;挑战报告确认标签一致性较高(计算机辅助标注 + 高资历专家) |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现扫描仪域泛化研究(对齐 2021 论文基线) | MIDOG 2021 | TIFF 原始版(Zenodo 4643381) | 200 例乳腺癌、4 扫描仪、与冠军报告同分布;GT450 子集无标注,适合无监督域自适应实验 |
| 训练跨癌种/跨物种检测器 | MIDOG 2022 训练集 | PNG 版约 30 GB | 405 例 6 域、9,501 MF + 11,051 硬负例,标注最全的双格式版本 |
| 最大规模多域预训练 | MIDOG++ | 图像约 65 GB(figshare) | 503 例、11,937 MF + 14,351 imposters,含软组织肉瘤新域与官方交叉验证划分 |
| 快速上手/教学 | MIDOG 2022 PNG 版 + Colab notebook | 约 30 GB | PNG 无需 WSI 库,官方 notebook 提供统计与格式解析 |
| 兽医 AI 应用 | MIDOG 2022 / MIDOG++ 犬域 | 子集较小 | 犬肺癌 44 + 犬淋巴瘤 55 + 犬肥大细胞瘤 50 例,仅此系列提供一致标注的犬肿瘤检测数据 |
§3.1 模态详情
MIDOG 全部图像为H&E 染色组织病理 ROI:病理医师先在 WSI 上按分级指南圈定约 2 mm² 的肿瘤热区(约 10 个 400× 高倍视野),再从原始扫描(40× 倍率层)裁剪导出。MIDOG 2021 以 TIFF 无损压缩发布;MIDOG 2022 官方 Google Drive 提供原始 TIFF、Zenodo 提供 PNG 版(文件内嵌原始扫描的 DPI 元数据以保留分辨率信息)。由于不同扫描仪的像素分辨率不同,ROI 图像尺寸在域间略有差异(Aubreville et al., 2023, Sci Data)。
同一组织被不同扫描仪数字化后,不仅颜色分布不同,焦深(景深)等光学特性也不同——这是 MIDOG 2021 的核心设计:全部 200 例来自同一实验室 UMC 乌得勒支,染色流程一致,因此图像间的全部可见差异均可归因于数字化设备(Zenodo 4643381)。
从成像技术角度,MIDOG 的域隙有三个具体来源(Aubreville et al., 2022, MedIA):
- 颜色响应:各厂商扫描仪的光源、传感器与色彩管线不同,同一 H&E 切片的 RGB 分布差异肉眼可辨,是最直观的偏移源;
- 光学特性:不同物镜的景深不同——2021 论文明确指出,同一有丝分裂象在 Hamamatsu XR 与 S360 下"除颜色偏移外,焦深也受影响",这使部分细胞在不同扫描仪下清晰度不同;
- 压缩与分辨率:各扫描仪默认的有损压缩设置不同、像素分辨率也不同(MIDOG++ 论文明确记录"原始图像格式使用各厂商软件默认的可变有损压缩设置"),MIDOG 侧以 TIFF 无损压缩统一导出来缓解,但源头的扫描差异仍然保留。
MIDOG 2021 的单变量设计(同实验室、同癌种)意味着:任何在这些维度上的性能下降,都可以干净地归因于"数字化域"而非生物或染色差异——这正是它成为域泛化标准测试床的原因。MIDOG 2022 放开这一约束(多实验室、多物种),代价是偏移源混杂,换来的是更贴近真实部署的复合难度。
§3.2 按子集样本数
MIDOG 2021 训练集(200 例人乳腺癌,UMC 乌得勒支):
| 文件编号 | 扫描仪 | 例数 | 是否提供标注 |
|---|---|---|---|
| 001.tiff-050.tiff | Hamamatsu NanoZoomer XR(Scanner A) | 50 | 是 |
| 051.tiff-100.tiff | Hamamatsu NanoZoomer S360, 0.5 NA(Scanner B) | 50 | 是 |
| 101.tiff-150.tiff | Aperio ScanScope CS2(Scanner C) | 50 | 是 |
| 151.tiff-200.tiff | Leica GT450(Scanner D) | 50 | 否(供无监督域自适应) |
MIDOG 2022 训练集(405 例,6 域):
| 文件编号 | 肿瘤类型 | 物种 | 扫描仪 | 例数 | 标注 |
|---|---|---|---|---|---|
| 001-150 | 乳腺癌(来自 MIDOG 2021) | 人 | Hamamatsu XR / S360 / Aperio CS2 各 50 | 150 | 是 |
| 151-194 | 肺癌 | 犬 | 3DHistech Pannoramic Scan II | 44 | 是 |
| 195-249 | 淋巴瘤 | 犬 | 3DHistech Pannoramic Scan II | 55 | 是 |
| 250-299 | 皮肤肥大细胞瘤 | 犬 | Aperio ScanScope CS2 | 50 | 是 |
| 300-354 | 神经内分泌肿瘤 | 人 | Hamamatsu NanoZoomer XR | 55 | 是 |
| 355-405 | 黑色素瘤 | 人 | Hamamatsu NanoZoomer XR | 51 | 否 |
MIDOG 2021/2022 测试集(不公开): 2021 版 100 例、4 台扫描仪(2 台属训练扫描仪、2 台未公开,每台 20 例);2022 版 100 例、10 个独立肿瘤域,含训练中未见的猫肿瘤、梭形细胞形态与新扫描仪(Aubreville et al., 2024, MedIA)。
MIDOG++(503 例): 在 2021/2022 基础上新增(皮下)软组织肉瘤域,共 7 种肿瘤类型、11,937 个 MF + 14,351 个 imposters(figshare)。
MIDOG++ 域构成:
| 肿瘤类型 | 物种 | 说明 |
|---|---|---|
| 乳腺癌 | 人 | 含 2021 版 3 个扫描仪子集(域 1a-c) |
| 肺癌 | 犬 | 3DHistech Pannoramic Scan II |
| 淋巴肉瘤 | 犬 | 3DHistech Pannoramic Scan II |
| 神经内分泌肿瘤 | 人 | Hamamatsu NanoZoomer XR |
| 皮肤肥大细胞瘤 | 犬 | Aperio ScanScope CS2 |
| 皮肤黑色素瘤 | 人 | Hamamatsu NanoZoomer XR(含新增标签) |
| (皮下)软组织肉瘤 | 犬 | MIDOG++ 新增域 |
MIDOG++ 将黑色素瘤域补齐了标注(2022 挑战版该域无标签),并通过统一的标注流水线为全部 7 域提供可交叉验证的标签——技术验证共使用 10 个域子集(同一肿瘤类型按扫描仪拆分),每域分层 20% 留出,合计 111 例留出测试集(Aubreville et al., 2023, Sci Data)。
§3.3 数据格式
| 组件 | 格式 | 说明 |
|---|---|---|
| ROI 图像(2021) | TIFF(无损压缩) | 001.tiff-200.tiff |
| ROI 图像(2022 PNG 版) | PNG | 405 个文件,内嵌原始 DPI 元数据 |
| 标注(2021) | MS COCO JSON(MIDOG.json) | 边界框式目标标注,含专家分歧与难例 |
| 标注(2022/MIDOG++) | MS COCO JSON + SlideRunner SQLite | 双格式等价提供;SQLite 为圆形标注(中心点 + 半径 50 px) |
| 官方工具 | Docker 模板、Python 代码、Colab notebook | MIDOG_reference_docker、MIDOGpp 仓库 |
§3.4 存储大小
- MIDOG 2021 训练数据(TIFF,200 例):Zenodo 发布(具体大小以 Zenodo 记录为准)。
- MIDOG 2022 PNG 版:Zenodo 分卷压缩合计约 30 GB(z01-z06 + zip,每卷约 4.3 GB)。
- MIDOG++ 图像:figshare 发布,约 65 GB(MIDOGpp 仓库)。
§3.5 标注方式
人工标注 + 算法辅助的混合流水线(详见 §2.6):初筛为纯人工(SlideRunner 两轮筛查),随后用初标训练的 RetinaNet(3 折交叉验证、低检测阈值)在每域上挖掘漏检候选——低阈值故意制造大量假阳性以降低确认偏倚——最后把全部候选裁成 128×128 像素 patch、打乱命名后交第二位病理医师盲评,一致样本直接入库,分歧样本由第三人终裁。硬负例类为非穷尽标注:只需达到与 MF 类相当的数量级,用作判别信号,不能视为"全部非分裂细胞"清单(Aubreville et al., 2023, Sci Data)。
完整流程拆解为六步:
- 双轮筛查:病理医师 C.A.B. 用 SlideRunner 筛查模式对每域全部图像筛查两遍,标注每个有丝分裂象与形态相似的硬负例(圆形,半径 50 像素,中心点标记)。
- 算法召回:以初标训练定制 RetinaNet(域 1a-c 用 MIDOG 2021 预训练),3 折交叉验证下把模型应用到各自验证折,低阈值收集漏检候选。
- 盲评裁剪:全部候选(人工标注 + 算法检出)裁成 128×128 PNG patch,按标签编号命名(隐藏类别)。
- 双专家盲评:第二位病理医师 R.K. 逐 patch 判别"MF 或硬负例",一致样本直接入库。
- 第三方仲裁:分歧 patch 交第三位病理医师 T.A.D. 终裁。
- 入库发布:最终标签写入 SlideRunner 数据库并同步导出 MS COCO JSON。
MIDOG 2022 挑战在该流程之上叠加了第二套参考标准:利用免疫组化(IHC)辅助建立的独立标签集,用于检验共识标签的敏感性——两套标准的对比成为 2022 报告最有信息量的分析之一(Aubreville et al., 2024, MedIA)。
§3.6 标注者资质与一致性
三名标注病理医师(C.A.B.、R.K.、T.A.D.)均为有丝分裂标注领域公认的高资历专家,深度参与此前 MITOS-ATYPIA-14、TUPAC16 及兽医有丝分裂数据集的标注与分级指南制定;MIDOG 2022 报告另设独立 IHC 辅助参考标准交叉检验,发现所有算法对 IHC 参考的召回率均有下降,但排名基本不变——说明共识标签与"金标准"之间存在系统性但均匀的偏差(Aubreville et al., 2024, MedIA)。
§3.7 采集周期
- MIDOG 2021:2021-04 发布训练数据;挑战期 2021-08 至 2021-10。
- MIDOG 2022:2022-04-20 发布训练数据;挑战期 2022-08 至 2022-09。
- MIDOG++:2023-06-30 于 figshare 首发;描述论文 2023 年发表于 Scientific Data。
- 病例本身为各参与机构病理档案的回顾性收集,具体取片年份未随数据集披露。
§3.8 地域覆盖
人类病例来自荷兰(UMC 乌得勒支)与德国(埃尔朗根大学医院等);犬类病例来自奥地利(维也纳兽医大学)与德国(柏林自由大学);合作团队分布于德国、奥地利、荷兰、美国、瑞士等。数据集不含患者地理信息,地域信息仅到机构层级(挑战页)。
§3.9 设备规格
| 扫描仪 | 出现在 | 备注 |
|---|---|---|
| Hamamatsu NanoZoomer XR | 2021(A);2022 乳腺/NET/黑色素瘤域 | 最常见域设备 |
| Hamamatsu NanoZoomer S360(0.5 NA) | 2021(B);2022 乳腺域 | 与 XR 存在颜色与焦深差异 |
| Aperio ScanScope CS2 | 2021(C);2022 乳腺/犬肥大细胞瘤域 | — |
| Leica GT450 | 2021(D,无标注) | 训练集未提供该域标签;报告指出其低对比度是主要障碍 |
| 3DHistech Pannoramic Scan II | 2022 犬肺癌/淋巴瘤域 | — |
| 未知扫描仪 | 2021/2022 测试集 | 训练时完全未见,挑战后才部分披露 |
§3.10 深度溯源链
病例入选(各机构病理档案,连续病例/纳入标准)→ WSI 数字化(各机构扫描仪,厂商默认压缩设置)→ 病理医师 ROI 选取(2 mm²,约 10 HPF,Elston-Ellis 等分级指南)→ TIFF 无损导出 → SlideRunner 人工筛查标注 → RetinaNet 辅助漏检召回 → patch 盲评 + 双专家共识 + 第三人仲裁 → MS COCO / SQLite 双格式发布(Zenodo/figshare 持久 DOI)。每个环节均有对应论文或 Zenodo 描述文档支撑,溯源完整(Aubreville et al., 2023, Sci Data)。
§4 数据结构
§4.0 目录树
MIDOG 2022 PNG 版(Zenodo)解压后结构:
MIDOG2022/
├── 001.png # ROI 图像(乳腺癌,Hamamatsu XR)
├── 002.png
├── ...
├── 150.png # 乳腺癌域结束(3 台扫描仪各 50 例)
├── 151.png # 犬肺癌域开始(3DHistech Pannoramic Scan II)
├── ...
├── 194.png
├── 195.png # 犬淋巴瘤域
├── ...
├── 249.png
├── 250.png # 犬皮肤肥大细胞瘤域(Aperio CS2)
├── ...
├── 299.png
├── 300.png # 人神经内分泌肿瘤域(Hamamatsu XR)
├── ...
├── 354.png
├── 355.png # 人黑色素瘤域(Hamamatsu XR,无标注)
├── ...
├── 405.png
├── MIDOG2022.json # MS COCO 格式标注(MF + 硬负例)
└── MIDOG2022.sqlite # SlideRunner 格式标注(圆形:中心点 + 半径)
MIDOG 2021 训练包结构:001.tiff-200.tiff + MIDOG.json(COCO)。MIDOG++ 通过 DeepMicroscopy/MIDOGpp 仓库发布:databases/(SQLite + COCO)、slide/(数据加载器)、images/(由 Setup.ipynb 从 figshare 下载填充,约 65 GB)。
§4.1 DAIMS 字段字典
以 MIDOG 2022 标注为核心(COCO JSON 视角):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| image_id | Integer | COCO 图像 ID,与文件名对应 | 355 | 关联图像与标注 | 无 | 无缺失 | 1-405 |
| file_name | Text | ROI 文件名 | 355.png | 定位图像文件 | 无 | 无缺失 | 001-405 |
| width/height | Integer | 图像像素宽高 | 约 4,000-6,000(随扫描仪而异) | 分辨率归一化 | 扫描仪间像素尺寸略不同 | 无缺失 | 域间不一致 |
| annotation_id | Integer | 标注唯一 ID | 109,233 | 结果匹配、统计 | 无 | 无缺失 | 全局唯一 |
| category_id | Integer | 类别:有丝分裂象 / 硬负例 | 1(有丝分裂象) | 训练监督信号 | 边界样本存在专家分歧 | 无缺失 | |
| bbox | Float[4] | COCO 边界框 [x, y, width, height],由圆形标注派生 | [2289.5, 1062.0, 50, 50] | 检测器框回归 | 圆形→方框转换含近似 | 无缺失 | 图像范围内 |
| x_center, y_center | Float | 标注中心坐标(SlideRunner 圆心;COCO 由框派生) | (2314.5, 1087.0) | 检测框回归、评估匹配 | 中心定位主观性约数像素 | 无缺失 | 图像范围内 |
| radius | Float | 圆形标注半径(SlideRunner) | 50(像素) | 评估匹配窗口 | 固定值 | 无缺失 | 50 |
| tumor_domain | Text(由文件号段派生) | 肿瘤域 | melanoma | 域泛化实验分组 | 需自行按文件号映射 | 无缺失 | 6 域 |
| scanner | Text(由域派生) | 扫描仪型号 | Hamamatsu NanoZoomer XR | 域偏移分析 | 需按官方文档映射 | 无缺失 | 5 型号 |
| dpi_meta | Integer(PNG 元数据) | 原始扫描 DPI | 如 40× 层对应值 | 物理分辨率换算 | 若忽略会导致跨域尺寸错位 | 部分阅读库默认不读取 | 随扫描仪 |
§4.2 标签分布
| 数据集 | 有丝分裂象(MF) | 硬负例 | 每例 MF 密度特征 |
|---|---|---|---|
| MIDOG 2021 训练集 | 官方未在描述页给出单独总数(COCO 内含分歧样本与难例) | 同左 | 乳腺癌按分级选择,热区密度高 |
| MIDOG 2022 训练集 | 9,501 | 11,051 | 犬淋巴瘤域 MF 密度显著高于其他域;乳腺癌 150 例贡献约半数 MF |
| MIDOG++ | 11,937 | 14,351 | 各域 MF 数量级相当(标注协议要求硬负例与 MF 同数量级) |
注意:MIDOG 2022 中乳腺癌 150 例沿用 MIDOG 2021 的图像与标注(统一到双格式),因此跨版本使用时该子集完全重叠(Zenodo 6547151)。
官方未发布分域的 MF 数量汇总表,但数据完全可由标注文件统计还原:
# 分域 MF / 硬负例统计(接 §6.1 的读取代码)
import json
from pathlib import Path
from collections import defaultdict
with open("data_root/MIDOG2022/MIDOG2022.json", encoding="utf-8") as f:
coco = json.load(f)
id2name = {img["id"]: img["file_name"] for img in coco["images"]}
per_domain = defaultdict(lambda: defaultdict(int))
for ann in coco["annotations"]:
fid = int(Path(id2name[ann["image_id"]]).stem)
dom = ("breast" if fid <= 150 else "canine_lung" if fid <= 194 else
"canine_lymph" if fid <= 249 else "canine_mct" if fid <= 299 else
"neuroendo" if fid <= 354 else "melanoma")
per_domain[dom][ann["category_id"]] += 1
for dom, cnt in per_domain.items():
print(dom, dict(cnt)) # 类别 ID 与 MF/硬负例的对应关系见 coco["categories"]
§4.3 关键统计
- 图像物理范围:每张约 2 mm² 组织,对应约 10 个 400× 高倍视野。
- MF 直径量级:数十像素(40× 层),与 50 像素标注半径同量级。
- 类别不平衡:单张 ROI 内 MF 占全部细胞比例极低;MIDOG 2025 Track 2(AMF vs NMF)中正类占比 14.65%,可见有丝分裂细分类任务的不平衡程度(MIDOG 2025 参赛报告)。
- 域不平衡:乳腺癌 150/405(37%)占主导,犬三域合计 149/405。
- 挑战规模:2021 年 237 人注册、161 人加入、46 人提交 Docker、17 队终评(Aubreville et al., 2022, MedIA)。
- 标注比例:MIDOG 2022 训练集 MF : 硬负例 ≈ 9,501 : 11,051(约 1 : 1.16),官方刻意维持两类同数量级以便判别学习;MIDOG++ 为 11,937 : 14,351(约 1 : 1.20),比例高度一致,说明标注协议的稳定性。
- 图像压缩来源多样性:原始扫描采用各厂商默认压缩设置(有损),MIDOG 导出时统一转 TIFF 无损/PNG,避免发布环节引入额外伪影(Aubreville et al., 2023, Sci Data)。
§4.4 数据层级
物种(人 / 犬)
└── 病例(case = 1 张 ROI;数据集未发布病例级临床表格)
└── ROI 图像(约 2 mm²,001-405.png)
└── 标注对象(MF / 硬负例,中心点 + 半径 50 px)
与常规"患者 → 切片 → 区域"层级不同,MIDOG 发布的是"病例 → 单张 ROI → 目标"两层结构;同一病例的多张 ROI、原始 WSI 与临床信息均不在公开范围内,这限制了病例级纵向分析(Zenodo 6547151)。
COCO JSON 的顶层结构示例(字段名以实际文件为准):
{
"images": [
{"id": 355, "file_name": "355.png", "width": 4964, "height": 4284}
],
"annotations": [
{"id": 109233, "image_id": 355, "category_id": 1,
"bbox": [2289.5, 1062.0, 50, 50]}
],
"categories": [
{"id": 1, "name": "mitotic figure"},
{"id": 2, "name": "hard negative"}
]
}
说明:上方 width/height/bbox 为示意值(实际尺寸随扫描仪而异);categories 的 id 与名称对应关系请以随包 JSON 内的字段为准,勿按本示例硬编码。
§4.5 缺失值与信息性缺失
| 现象 | 编码方式 | 使用建议 |
|---|---|---|
| 黑色素瘤域(355-405)无标注 | 该域文件在 COCO/SQLite 中无标注记录 | 这是信息性缺失:官方将其设计为无标签目标域(域自适应/伪标签实验用),不是数据损坏 |
| 硬负例非穷尽 | 无"全部阴性细胞"清单 | 不能把未标注细胞当作确定负样本;负样本应从硬负例 + 采样策略构造 |
| Scanner D(2021)无标注 | 151-200.tiff 无 COCO 记录 | 同为信息性缺失:无监督域自适应设计 |
| 专家分歧样本 | 2021 版 COCO 中保留分歧标注 | 训练时可作标签噪声建模素材,评估时注意其对金标准的影响 |
§5 划分与使用建议
§5.1 官方划分
MIDOG 挑战的官方划分是"公开训练集 + 隐藏测试集":2021 版测试集 100 例(4 台扫描仪,含 2 台未知扫描仪);2022 版测试集 100 例(10 个肿瘤域,含训练时未见的猫肿瘤、梭形细胞形态与新扫描仪)。训练集内部未提供官方 train/validation 划分——参赛者自行划验证集。MIDOG++ 数据描述论文提供了自己的技术验证划分:每域分层抽取 20%(合计 111 例)作留出测试集,其余按 MC 分层做 5 折交叉验证(Aubreville et al., 2023, Sci Data)。
2022 版还有赛道级划分规则:Track 1 禁止使用挑战数据之外的任何数据与任何形式的人工/半自动标签生成;Track 2 允许公开数据集与额外标签(私有标签需遵循官方博客的披露规则)。两条赛道分别排名,比较论文结果时必须区分赛道(挑战页)。
§5.2 社区惯例划分
社区常用两种方案:① 按域分层随机划分(每域内按病例切 80/10/10),用于与挑战报告可比的整体 F1;② leave-one-domain-out(LODO)交叉验证,直接度量"对未见域的泛化",与 MIDOG++ 论文评估一致。跨论文比较时务必确认对方采用的是哪种。
§5.3 泄漏风险
- patch 级随机划分泄漏:若先把 ROI 切成 patch 再随机划分 train/val,同一 ROI 的相邻 patch 会同时出现在两侧,验证指标会严重虚高。必须按 ROI(更严格按域)划分。
- 跨版本重叠:MIDOG 2022 的乳腺癌 150 例与 MIDOG 2021 训练集完全相同。若用 2021 训练、2022 验证,乳腺癌域不算真正的外部验证。
- 增强泄漏:对全数据集先做染色归一化统计(如 Macenko 参考值)再划分,会把验证集信息泄入训练。统计量只能在训练折内估计。
§5.4 划分策略建议
- 对标挑战报告:每域内按 ROI 划分,训练集内再按扫描仪/域分层,确保每折各域都有代表。
- 研究泛化:LODO 或"留一扫描仪"(2021 版)划分,报告每域 F1 而非仅均值。
- 使用 melanoma(2022)与 GT450(2021)两个无标签域做目标域,可与半监督/域自适应文献直接对话。
§5.5 交叉验证建议
参照 MIDOG++ 技术验证协议:分层 5 折(保持各域 MF 计数分布),每个 patch 批次按域均匀采样(官方评估中每 epoch 采样 1,000 个训练 patch 与 250 个验证 patch,512×512 像素),以折间均值 ± 标准差报告(Aubreville et al., 2023, Sci Data)。
§5.6 外部验证建议
外部验证可选用 MITOS-ATYPIA-14(2 扫描仪、含非典型标注)、TUPAC16(TCGA 乳腺癌 WSI)、NuCLS(TCGA 多癌种核标注)或自采本院数据。注意跨数据集的标注协议差异(如 TUPAC16 的全片计数任务)会导致指标不可直接比较;建议先在 ROI 级对齐任务定义再比较(见 §7.8)。
实操路径:
- 先内后外:先在 MIDOG 内部用 LODO 建立跨域基线,再把训练好的模型零样本迁移到 MITOS-ATYPIA-14 高倍视野帧,报告"相对内部的最差域变化"。
- 协议对齐:外部数据集若只有框/点标注差异(MITOS-ATYPIA 用框、MIDOG 用圆),统一用中心点匹配半径评估,避免几何口径引入的假差异。
- 正向方向:把 MIDOG 作为训练源、本院数据作为目标域,可自然地研究"多源域泛化 → 单目标域自适应"这一部署中最常见的两段式流程。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
官方提供 Google Colab 入门 notebook(含数据统计概览与标注格式解析),零配置即可浏览数据集:官方 Colab notebook(来源)。Colab 免费实例(约 12 GB 显存)足够运行本节全部示例代码;完整训练建议使用 16 GB+ 显存的 GPU 实例。
§6.1 快速上手
以下代码假设目录结构为 data_root/MIDOG2022/(内含 001.png-405.png、MIDOG2022.json、MIDOG2022.sqlite,即 §4.0 目录树)。data_root 是你解压数据的任意路径,代码内部不做路径拼接假设,所有路径由 DATA_ROOT 变量统一控制。最小可用子集:乳腺癌域 001-150.png + COCO JSON(其他域代码同样适用)。
# 最小可用示例:读取 MIDOG 2022 COCO 标注并统计各域 MF 数
# 预期目录:DATA_ROOT/MIDOG2022/{001..405}.png + MIDOG2022.json
import json
from pathlib import Path
from collections import Counter, defaultdict
DATA_ROOT = Path("data_root/MIDOG2022")
def domain_of(file_id: int) -> str:
# 文件号段映射来自官方 Getting the data 页
if file_id <= 150: return "breast_cancer"
if file_id <= 194: return "canine_lung"
if file_id <= 249: return "canine_lymphoma"
if file_id <= 299: return "canine_mast_cell"
if file_id <= 354: return "neuroendocrine"
return "melanoma_unlabeled"
with open(DATA_ROOT / "MIDOG2022.json", encoding="utf-8") as f:
coco = json.load(f)
id2name = {img["id"]: img["file_name"] for img in coco["images"]}
per_domain = defaultdict(Counter)
for ann in coco["annotations"]:
fname = id2name[ann["image_id"]]
per_domain[domain_of(int(Path(fname).stem))][ann["category_id"]] += 1
for dom, counter in sorted(per_domain.items()):
print(f"{dom}: {dict(counter)}")
# 注意:melanoma_unlabeled 通常无输出——该域设计上不提供标注
# category_id 的具体取值请以 JSON 内 'categories' 字段为准(MF / 硬负例两类)
也可以用官方 SQLite(SlideRunner)格式读取圆形标注,更适合精确评估:
# 读取 SlideRunner SQLite:每条标注为 (file, x_center, y_center, radius, class)
import sqlite3
conn = sqlite3.connect("data_root/MIDOG2022/MIDOG2022.sqlite")
rows = conn.execute(
"SELECT name FROM sqlite_master WHERE type='table'"
).fetchall()
print("tables:", rows) # 先查看表结构再写查询,不同版本表名可能不同
§6.2 数据获取
| 版本 | 渠道 | 形式 | 大小 | 条件 |
|---|---|---|---|---|
| MIDOG 2021 训练数据 | Zenodo 4643381 | TIFF + COCO | 见记录页 | 免费,CC BY-NC-ND 4.0 |
| MIDOG 2022(原始 TIFF) | 官网 Google Drive | TIFF + 双格式标注 | 约 30 GB+ | 挑战网站注册后获取链接 |
| MIDOG 2022(PNG 版) | Zenodo 6547151 | PNG 分卷压缩 | 约 30 GB | 免费 |
| MIDOG++ | figshare 22691092 | TIFF 分片 | 约 65 GB | 免费,CC0 |
# 方式一:Zenodo PNG 版(分卷 zip,需全部下载后同目录解压)
# 下载 z01-z06 与主 zip 共 7 个文件到同一目录,然后:
zip -s 0 MIDOG2022Dataset.zip --out MIDOG2022_full.zip && unzip MIDOG2022_full.zip
# 方式二:MIDOG++ 官方脚本(自动从 figshare 拉取约 65 GB)
git clone https://github.com/DeepPathology/MIDOGpp.git
cd MIDOGpp && pip install -r requirements.txt
# 运行 Setup.ipynb,将图像下载填充到 images/ 目录
§6.3 预处理全流程
MIDOG 图像是单层 ROI(非金字塔 WSI),预处理重心在分辨率归一、patch 采样与染色域增强三步:
# 预处理:读取 PNG(保留 DPI 元数据)→ 物理分辨率归一 → 训练 patch 采样
import numpy as np
from PIL import Image
def load_roi(path):
img = Image.open(path)
dpi = img.info.get("dpi", (None, None)) # PNG 内嵌原始扫描 DPI,勿丢弃
return np.array(img.convert("RGB")), dpi
def resize_to_common(img, dpi, target_dpi=None, ref_size_px=None):
# 简单方法:统一到目标物理分辨率(若已知各域 DPI)
# 进阶方法:统一 resize 到参考像素尺寸(跨域实验的常用折中)
if ref_size_px is None:
return img
h, w = img.shape[:2]
scale = ref_size_px / max(h, w)
img = Image.fromarray(img).resize(
(int(w * scale), int(h * scale)), Image.LANCZOS
)
return np.array(img)
def sample_patches(img, center_pts, patch=512, n=100, rng=None):
# 按 MF 中心点引导采样(正例过采样),或全图均匀采样
rng = rng or np.random.default_rng(0)
h, w = img.shape[:2]
patches = []
for _ in range(n):
if len(center_pts) and rng.random() < 0.5:
cx, cy = center_pts[rng.integers(len(center_pts))]
cx = int(np.clip(cx + rng.normal(0, 64), patch / 2, w - patch / 2))
cy = int(np.clip(cy + rng.normal(0, 64), patch / 2, h - patch / 2))
else:
cx, cy = rng.integers(patch / 2, w - patch / 2), rng.integers(patch / 2, h - patch / 2)
patches.append(img[cy - patch // 2:cy + patch // 2,
cx - patch // 2:cx + patch // 2])
return patches
染色域增强是 MIDOG 冠军方案的关键组件:不要把图像归一化到单一目标色域(对未见扫描仪可能适得其反,见坑点 2),而是随机化增强目标的颜色统计:
# 染色域增强:随机化 Reinhard 目标统计量(源自参赛方法 Domain Adaptive Cascade R-CNN 思路)
def stain_augment_rgb(img, rng, strength=0.08):
lab = img.astype(np.float32) / 255.0
for c in range(3):
shift = rng.normal(0, strength)
scale = 1.0 + rng.normal(0, strength)
lab[..., c] = np.clip((lab[..., c] - 0.5) * scale + 0.5 + shift, 0, 1)
return (lab * 255).astype(np.uint8)
§6.4 PyTorch DataLoader 完整示例
# MIDOG 2022 目标检测 Dataset(COCO 标注版)
# 目录预期:DATA_ROOT/MIDOG2022/{001..405}.png + MIDOG2022.json
import json
from pathlib import Path
import numpy as np
import torch
from PIL import Image
from torch.utils.data import Dataset, DataLoader
class MidogDetectionDataset(Dataset):
"""输出 512x512 patch + 归一化检测框(类别 0=MF,1=硬负例)。"""
def __init__(self, data_root, split_ids, patch=512, patches_per_img=8, seed=0):
self.root = Path(data_root)
self.patch = patch
self.ppi = patches_per_img
self.rng = np.random.default_rng(seed)
with open(self.root / "MIDOG2022.json", encoding="utf-8") as f:
coco = json.load(f)
self.id2file = {im["id"]: im["file_name"] for im in coco["images"]}
self.anns = {}
for a in coco["annotations"]:
self.anns.setdefault(a["image_id"], []).append(a)
self.image_ids = [i for i in self.id2file if i in split_ids]
def __len__(self):
return len(self.image_ids) * self.ppi
def __getitem__(self, idx):
img_id = self.image_ids[idx // self.ppi]
img = np.array(Image.open(self.root / self.id2file[img_id]).convert("RGB"))
h, w = img.shape[:2]
p = self.patch
cx, cy = self.rng.integers(p, w - p), self.rng.integers(p, h - p)
tile = img[cy - p // 2:cy + p // 2, cx - p // 2:cx + p // 2]
boxes, labels = [], []
for a in self.anns.get(img_id, []):
x, y, bw, bh = a["bbox"] # COCO: 左上角 + 宽高
bx, by = x + bw / 2, y + bh / 2
if cx - p / 2 <= bx < cx + p / 2 and cy - p / 2 <= by < cy + p / 2:
boxes.append([bx - cx + p / 2 - bw / 2, by - cy + p / 2 - bh / 2, bw, bh])
labels.append(0 if a["category_id"] == self.mf_category else 1)
if not boxes:
boxes, labels = [[0, 0, 1, 1]], [0] # 空框占位,按所用检测框架调整
return (torch.from_numpy(tile).permute(2, 0, 1).float() / 255.0,
{"boxes": torch.tensor(boxes, dtype=torch.float32),
"labels": torch.tensor(labels, dtype=torch.int64)})
# 说明:mf_category 需在构造后按 coco["categories"] 中的 MF 类别 ID 设置;
# collate_fn 需按检测框架要求聚合变长框列表(torchvision detection 提供现成实现)。
§6.5 坑点 8 个
⚠️ 坑点 1:扫描仪域偏移让"准确率 95%"的模型一夜归零(分类:偏倚陷阱)
问题:MIDOG 的核心发现——在不同扫描仪间,深度检测器性能大幅下降。2021 版训练集第 4 台扫描仪(Leica GT450)低对比度成像使大量方法在其上表现显著更差,未知扫描仪(E/F)同样如此;未见扫描仪的颜色分布还会导致模型分数校准失真(置信度系统性偏高或偏低)。
症状:验证集(与训练同扫描仪)F1 很高,换一台扫描仪的图像上假阳性/假阴性同时暴增,且模型置信度分布明显漂移。
解决:
- 简单方法:训练时把每个 batch 内的域(扫描仪)混匀采样,并对染色做随机化增强(HED 抖动、随机 Reinhard 目标),避免模型记住某一台扫描仪的色域。
- 进阶方法:域对抗训练(梯度反转层 + 域判别器)。官方参考算法 Domain Adversarial RetinaNet 即用此策略,在测试集拿到 F1 0.7183,且跨未见域的提升最明显。
- SOTA 方法:分割辅助任务 + 染色域增强 + 集成/测试时增强。2021 冠军(F1 0.748)同时使用了分割辅助与傅里叶域混合增强;Top7 中 5 支队伍用了集成或 TTA。
参考:Aubreville et al., 2022, MedIA、Wilm et al., 2022, LNCS 参考算法、Domain Adaptive Cascade R-CNN 参赛报告
⚠️ 坑点 2:染色归一化可能让泛化更差(分类:预处理陷阱)
问题:把所有图像归一化到单一目标色域(经典 Macenko/Reinhard 流程)在"训练域内"有效,但测试扫描仪的颜色分布未知时,固定目标反而引入新的失配;参赛报告明确指出固定的染色归一化对未见扫描仪可能不提升甚至有害。
症状:加了归一化后域内指标不变,跨域/未知扫描仪指标下降;或归一化把形似有丝分裂的深染细胞"洗"成了与 MF 相同的外观,假阳性上升。
解决:
- 简单方法:训练/推理都不做固定归一化,只用随机染色抖动(见 §6.3 代码)。
- 进阶方法:随机化归一化目标——从训练集统计量范围内随机抽取 Reinhard/Vahadane 的目标均值/方差/染色矩阵做增强,等效于"色域混洗"。
- SOTA 方法:傅里叶域风格混合(在频域交换低频外观信息)或基于 CycleGAN 的域转换,仅在训练阶段使用、推理保持原图。
参考:Domain Adaptive Cascade R-CNN、Aubreville et al., 2022, MedIA
⚠️ 坑点 3:11,051 个硬负例被当成了"全部负样本"(分类:标签理解)
问题:MIDOG 2022 提供 11,051 个硬负例(imposters:貌似有丝分裂的淋巴细胞、凋亡小体、裸核等),但官方论文明确说明该类是非穷尽标注——数量级与 MF 相当即可,不是全片阴性清单。两个极端用法都是错的:完全不用(假阳性暴增)或把"未标注细胞"全部当负样本(把真 MF 错标为负)。
症状:只用 MF 训练时,验证集上大量条状结构/淋巴细胞误检;把未标注区域当负样本后,召回率莫名下降且训练不稳定。
解决:
- 简单方法:损失函数只对 MF 与硬负例标注计算,未标注区域不计损失(检测框架中通过 ignore region 或采样策略实现)。
- 进阶方法:把硬负例作为独立类别或难例挖掘队列,训练时按 (MF:硬负例 ≈ 1:1) 比例采样 patch。
- SOTA 方法:将标注分歧/难度信息建模(MIDOG 2025 Track 2 把"标注者是否一致"作为难度监督信号训练双头分类器)。
参考:Aubreville et al., 2023, Sci Data、MIDOG 2025 Track 2 报告
⚠️ 坑点 4:边界有丝分裂与标签噪声(分类:标签理解)
问题:有丝分裂判定本质主观。MIDOG 2021 的 COCO 标注特意保留了"专家间有分歧"的样本;2022 报告显示,对照 IHC(免疫组化)辅助参考标准时,所有参赛方法的召回率都下降——共识标签与"生物学真值"之间存在系统性缺口。
症状:训练损失在高分位样本上震荡不收敛;用多数投票评估时与官方报告对不上;换个标注协议复评,模型排名不变但绝对分数掉一截。
解决:
- 简单方法:接受标签噪声,训练用对噪声更稳的损失(focal loss、soft label),评估用官方协议。
- 进阶方法:把分歧样本单独分层,验证/测试时报告"全一致子集"与"含分歧子集"两个口径的 F1。
- SOTA 方法:噪声感知训练(co-teaching / 标签修正网络),或用 IHC 类辅助染色数据做弱监督校准(MIDOG 2022 官方双参考标准思路)。
参考:Aubreville et al., 2024, MedIA、Zenodo 4643381 说明
⚠️ 坑点 5:PNG 版的 DPI 元数据与跨域尺寸漂移(分类:工程陷阱)
问题:不同扫描仪的像素物理分辨率不同,官方明确说明"图像尺寸在域间略有差异";Zenodo PNG 版把原始 DPI 写进了文件元数据,若用默认图像库读取而不处理,跨域训练/推理时同一物理大小的细胞会对应不同像素尺寸。
症状:模型对某几个域的召回系统性偏低;把 patch 像素尺寸设成固定值后,不同域的有效视野(HPF 数)不一致,有丝分裂密度统计失真。
解决:
- 简单方法:统一 resize 到参考像素尺寸(折中,牺牲物理对齐换稳定输入)。
- 进阶方法:读取 PNG DPI 元数据(PIL 的
img.info["dpi"]),按物理尺寸(µm/px)归一化后再裁 patch;评估窗口也按物理尺寸换算。- SOTA 方法:训练时做多尺度增强(随机缩放 0.8-1.25×),让网络对残余的分辨率差异不敏感。
参考:Zenodo 6547151 说明、Aubreville et al., 2023, Sci Data
⚠️ 坑点 6:双格式坐标与评估匹配准则不一致(分类:评估误用)
问题:MIDOG 同时发布 MS COCO(边界框)与 SlideRunner SQLite(圆心 + 半径 50 px)两种标注,二者坐标语义不同;官方评估使用特定的中心点匹配准则,自建评估若用 IoU 阈值或不同的匹配半径,F1 数字不可与排行榜比较。官方还曾公告附加指标 Average Precision 的计算存在错误并发布勘误——第三方复现的 AP 值需对照最新勘误口径。
症状:同一模型用自写评估得到 F1 比官方高/低数个百分点;COCO 框与 SQLite 圆的标注数量对不上;复现论文 AP 与原文不符。
解决:
- 简单方法:评估统一用"预测中心点落入标注圆内"的匹配(与官方一致),报告 F1 而非 mAP。
- 进阶方法:实现双口径(中心点匹配 + IoU 0.5)并在论文/报告中同时给出,注明匹配准则。
- SOTA 方法:直接使用官方评估容器(MIDOG_reference_docker)与 grand-challenge.org 平台评测,杜绝口径漂移。
参考:MIDOG 2022 挑战页勘误公告、官方 Docker 模板
⚠️ 坑点 7:patch 级随机划分 + 域不平衡造成双重虚高(分类:数据泄漏)
问题:MIDOG 训练集没有官方 train/val 划分;乳腺癌占 150/405 且与 2021 版完全重叠。常见错误是把 patch 打乱后随机划分——同一 ROI 的相邻 patch 同时进训练与验证,指标虚高;再把 2021 数据混入 2022 做外部验证——乳腺癌域泄漏。
症状:验证 F1 接近 0.9 但提交挑战平台/换域测试掉到 0.7 左右;跨版本实验中乳腺癌域"泛化好得反常"。
解决:
- 简单方法:按 ROI(文件级)划分,禁止 patch 级随机划分。
- 进阶方法:按域分层的 ROI 划分 + LODO 交叉验证;跨版本使用时把重叠的 150 例乳腺癌明确标记为"域内数据"而非外部验证。
- SOTA 方法:训练域平衡采样(每域等概率采 batch),并在报告中同时给整体 F1 与最差域 F1(worst-domain F1)。
参考:Aubreville et al., 2023, Sci Data、Zenodo 6547151
⚠️ 坑点 8:ROI 级结果不能直接外推到全片有丝分裂计数(分类:偏倚陷阱)
问题:MIDOG 全部图像都是病理医师预先选好的 2 mm² 肿瘤热区——"找热区"这一步被人工完成了。挑战报告明确指出:真实 WSI 含离焦、坏死、大量未评估的硬负例,全片场景的变异性远高于 ROI;且 ROI 级检测到"有丝分裂计数/分级"之间还隔着热区定位、计数聚合等环节。
症状:ROI 上 F1 0.75 的模型部署到全片流水线后,整片有丝分裂计数与病理医师的分级计数对不上;在坏死/离焦区域产生密集假阳性。
解决:
- 简单方法:明确把产品定位为"热区辅助定位 + ROI 内计数",让病理医师保留热区选择权。
- 进阶方法:自建全片流水线时增加质量门控(离焦/坏死检测),并在 TUPAC16 等全片数据集上补充验证计数聚合逻辑。
- SOTA 方法:热区定位与计数联合建模(检测器直接输出 per-HPF 密度),并在多中心 WSI 上做前瞻验证——这也是官方指出的未来工作方向。
参考:Aubreville et al., 2022, MedIA、Aubreville et al., 2024, MedIA
§6.6 数据增强建议
安全增强 ✅:水平/垂直翻转、小角度旋转(有丝分裂无方向语义);随机染色抖动/随机目标归一化;小尺度缩放(0.8-1.25×)补偿域间分辨率差;随机 patch 位置采样(隐式增强)。
危险增强 ❌:大角度色调矩阵变换(会破坏 H&E 双染色语义);过强的模糊/噪声(模拟"新扫描仪"没有物理依据,反而教坏模型);固定目标的 Macenko 归一化作为预处理(对未见域有害,见坑点 2);弹性形变(细胞形态是核心判别特征,形变会伪造/抹除分裂形态特征)。
§6.7 模型推荐
| 模型 | 适用场景 | 关键技术 | 参考 |
|---|---|---|---|
| Domain Adversarial RetinaNet | 跨扫描仪泛化基线 | 梯度反转域对抗 + RetinaNet | Wilm et al., 2022, LNCS |
| Cascade R-CNN + 染色域增强 | 单模型跨域 | 随机化 Reinhard/Vahadane 目标 | 参赛报告 |
| 分割辅助多任务检测器(2021 冠军路线) | 冲击最高 F1 | 辅助分割头 + 傅里叶域混合 + TTA | Aubreville et al., 2022, MedIA |
| Teacher-Student UNet + DANN | 2025 赛道(检测 + AMF 分类) | 伪掩码密集监督 + 对比/域对抗损失 | MIDOG 2025 参赛报告 |
| 双头 ResNet50 + 难度建模 | AMF/NMF 细分类 | 类别 + 标注难度双焦点损失头 | MIDOG 2025 Track 2 报告 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 数据浏览/notebook | CPU 8 GB 内存 | CPU 16 GB | PNG 解码即可,无需 WSI 库 |
| 复现单模型训练 | 1×GPU 11 GB(RTX 2080Ti 级) | 1×GPU 24 GB(3090/4090 级) | 512×512 patch、batch 16 起步 |
| 集成 + TTA + LODO 网格 | — | 2×GPU 24 GB 或云端 A100 | 域折 × 种子数线性放大 |
§6.9 评估指标代码
# 与官方口径一致的 F1:预测中心点落入标注圆(半径 50 px)内计为命中,每个标注至多匹配一次
import numpy as np
def mitosis_f1(pred_centers, gt_centers, radius=50.0):
"""pred_centers, gt_centers: (N, 2) / (M, 2) 数组,图像内像素坐标。"""
pred = list(pred_centers)
matched_gt = set()
tp = 0
for px, py in pred:
for j, (gx, gy) in enumerate(gt_centers):
if j not in matched_gt and (px - gx) ** 2 + (py - gy) ** 2 <= radius ** 2:
matched_gt.add(j)
tp += 1
break
fp = len(pred) - tp
fn = len(gt_centers) - tp
precision = tp / max(tp + fp, 1)
recall = tp / max(tp + fn, 1)
return 2 * precision * recall / max(precision + recall, 1e-9)
报告惯例:给出整体 F1 + 每域 F1 + bootstrap 置信区间(官方用 20 次有放回抽病例、10,000 次重复的自助法),切勿只报均值(Aubreville et al., 2022, MedIA)。
§6.10 MLOps 笔记
- 域监控:上线后持续记录每张片子的染色统计量与扫描仪来源,按域分桶监控 F1/校准曲线——MIDOG 的教训是"整体均值掩盖最差域"。
- 版本对齐:数据版本(2021/2022/MIDOG++)、标注格式(COCO/SQLite)、评估口径(AP 勘误前后)三者都进实验跟踪,否则复现无从谈起。
- 容错:PNG DPI 读取失败时降级为 resize 归一并打日志(坑点 5);无标注域自动跳过监督损失。
- 提交复现:挑战平台以 Docker 提交,把镜像与数据版本绑定(镜像内固化 data hash),保证评测可重放。
- 标签谱系:把"共识标签"与"IHC 辅助标签"两套参考标准分开存储与评估,任何对外报告注明所用口径——这是 MIDOG 2022 报告最核心的方法学经验之一。
- 数据许可审计:CC BY-NC-ND(2021)与 CC0(MIDOG++)并存,模型/产品发布前按训练数据版本逐项审计许可与署名要求,尤其是 ND(禁止演绎分发)条款对标注再分发的影响。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 域不平衡 | 乳腺癌 150/405 例占主导,犬域合计 149 例,melanoma 无标签 | 高 | 域平衡采样、LODO 评估、报告最差域指标 |
| 实验室集中 | 人类乳腺癌全部来自 UMC 乌得勒支单一实验室,染色流程一致 | 中 | 结合 MIDOG++ 多实验室域;外采本中心数据验证 |
| 标注主观性 | 边界有丝分裂存在专家分歧;对照 IHC 参考所有方法召回下降 | 中 | 双专家共识 + 仲裁已缓解大半;评估同时报告全一致子集口径 |
| 任务范围 | 仅 2 mm² ROI,热区选择由人工完成,无全片负样本 | 高 | 不直接外推全片;在 TUPAC16 等全片集上补验(坑点 8) |
| 物种/形态先验偏移 | 测试含未见物种(猫)与形态(梭形细胞) | 中 | 多物种训练(MIDOG++ 7 域)+ 难例增强 |
对这五项偏倚的总体判断:MIDOG 的偏倚不是"意外污染",而是设计内变量与真实限制的混合——域不平衡与物种混合是刻意构造的挑战,ROI-only 与标签主观性则是数据模态的固有限制。使用者的正确姿势是把前者当训练信号(域平衡采样)、把后者当边界声明(不外推全片),而不是试图"清洗掉"它们。
§7.2 标注质量
标注流程为病理检测数据集的一流水平:两轮人工筛查 + 算法辅助漏检召回(低阈值故意制造大量假阳性以抗确认偏倚)+ patch 盲评 + 双专家共识 + 第三人仲裁。官方在 2021 报告中的自检认为标签一致性较高(计算机辅助 + 高资历专家),并提供了五专家事后共识作为补充分析;但报告同样承认"标注偏倚不能完全排除",且硬负例非穷尽是有意的设计取舍(Aubreville et al., 2022, MedIA、Aubreville et al., 2023, Sci Data)。
两项值得注意的细节:
- 挑战后五专家共识:2021 报告在赛后用五位专家对部分样本做了补充共识标注,用于检验"挑战 ground truth"与"更大规模专家共识"之间的差异——冠军方法在两种口径下均超过专家平均水平,这为标签质量提供了双重证据。
- 算法召回的双刃剑:RetinaNet 低阈值召回既降低了漏检率,也意味着最终标签集里包含"模型发现、专家确认"的样本;这提高了召回完整性,但要求使用者在研究"纯人工标注差异"时留意这一混合来源。
§7.3 泛化性
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 换扫描仪(未见型号) | 高:颜色/焦深差异导致分数校准失真、F1 下降 | 2021 测试集两台未知扫描仪上最佳成绩显著低于已见扫描仪 |
| 换肿瘤类型 | 中高:MF 密度与形态先验不同(prior shift) | 2022 版跨 10 域评估,冠军 F1 0.764 低于单域水平 |
| 换物种/形态 | 中:新物种(猫)、梭形细胞形态带来小幅但显著下降 | Aubreville et al., 2024, MedIA |
| 全片部署 | 高:离焦、坏死、非热区未在训练分布内 | 挑战报告明确列为限制 |
| 对照 IHC 真值 | 中:共识标签系统性漏掉部分真 MF | 所有方法对 IHC 参考召回率下降 |
2021 报告的逐扫描仪分析进一步显示:在已见扫描仪 A(完全监督)与未知扫描仪 E 上,最佳方法达到与域内 SOTA 相当的水平;而在训练时无标注的扫描仪 D 与未知扫描仪 F 上,最佳成绩明显更弱——作者分析这既可能源于算法未覆盖的域隙,也可能与这两台扫描仪的图像质量(对人对算法都更难)及专家对其色彩/结构模式不熟悉有关。这提示:"未见域上的失败"需要区分算法可修复部分与设备固有难度,部署评估时应同时引入目标域小规模专家标注做锚定(Aubreville et al., 2022, MedIA)。
§7.4 伦理与合规
人类组织材料来自参与机构病理档案的回顾性去标识化使用;数据以 ROI 裁剪图发布,不含患者标识、面部或临床身份信息。MIDOG 2021 训练数据采用 CC BY-NC-ND 4.0(禁止商业与演绎分发),MIDOG++ 图像为 CC0,MIDOGpp 代码为 MIT——商用前必须逐版本核对许可。兽医部分(犬肿瘤)使用兽医临床档案,无人类受试者问题(挑战论文数据使用声明、figshare)。
§7.5 公平性
数据集未发布患者人口统计学(年龄/性别/族裔)表格,无法做人群分层公平性审计;已知结构性偏倚为机构与地域集中(欧洲为主)。对临床落地而言,跨染色实验室与跨扫描仪的稳健性是比人口学公平性更突出的公平性问题——这恰是 MIDOG 的设计主题(Aubreville et al., 2024, MedIA)。
§7.6 数据漂移
MIDOG 的域结构天然就是漂移测试床:扫描仪代际更替、染色试剂批次、实验室流程变更都会表现为新增域。MIDOG 2022 把 2021 之后出现的新域(3DHistech 扫描仪、犬肿瘤)作为训练域、把更新的域(猫、梭形细胞)留作测试域,实证了"漂移域上性能小幅但显著下降"的结论。持续部署场景建议以"新域即测试"的 LODO 思维做滚动验证(Aubreville et al., 2024, MedIA)。
可落地的漂移监测清单:
- 输入侧:监控每批片子与训练分布的染色统计距离(如 Reinhard 均值/方差偏移量),超阈值自动告警。
- 输出侧:监控分数分布与置信度校准(未见扫描仪会先表现为校准漂移,再表现为 F1 下降——2021 报告明确记录了这一先行指标)。
- 反馈侧:病理医师对自动计数的修改记录是最有价值的漂移信号,应结构化回收用于增量训练评估。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | COCO JSON 单文件扁平存储全部标注,pandas/标准库即可展开 |
| 2 | 唯一标识 | ✅ | annotation_id 全局唯一;image_id 与文件名一一对应 |
| 3 | 特殊字符处理 | ✅ | 字段全部为 ASCII 标识符与数值,无转义风险 |
| 4 | 重复行 | ✅ | 双格式(COCO/SQLite)内容等价,无重复标注记录的官方报告 |
| 5 | 缺失编码 | ✅ | 无标注域(melanoma、GT450)为信息性缺失,官方文档明示 |
| 6 | 标签标识 | ✅ | 类别经 COCO categories 字段显式定义(MF / 硬负例) |
| 7 | 罕见类分组 | ⚠️ | MF 密度在犬淋巴瘤等域偏高、其他域稀疏,需分层采样 |
| 8 | 偏倚评估 | ✅ | 官方论文含跨域性能矩阵、IHC 参考对照与域不平衡讨论 |
| 9 | 数据字典 | ⚠️ | 官方提供格式说明与 notebook,但无机器可读的字段级 schema 文件 |
| 10 | 信息性缺失解释 | ✅ | 无标签域的设计意图在 Zenodo 描述与论文中明确说明 |
| 11 | 设备记录 | ✅ | 扫描仪型号按文件号段完全可追溯(官方 Getting the data 页) |
| 12 | 共线性 | ✅ | 特征仅坐标/类别/元数据,无共线性问题 |
| 13 | 编码映射 | ⚠️ | 域/扫描仪映射需按文件号段自行构造(官方页有对照表但非结构化文件) |
| 14 | 时间戳处理 | ❌ | 未发布病例采集时间戳,纵向/时序分析不可行 |
| 15 | 划分建议 | ⚠️ | 挑战版无官方 train/val 划分;MIDOG++ 论文提供了分层 5 折方案可参照 |
| 16 | 泄漏讨论 | ✅ | 官方隐藏测试集设计 + 本文 §5.3 系统讨论 patch/跨版本泄漏 |
| 17 | 标签分布 | ✅ | 9,501 MF + 11,051 硬负例总量明确;分域分布可通过标注统计还原 |
| 18 | 测量偏倚 | ✅ | 扫描仪差异即为研究主题;IHC 参考对照量化了标签测量偏倚 |
| 19 | 外部验证建议 | ✅ | MITOS-ATYPIA-14、TUPAC16、NuCLS 等可比数据集明确 |
| 20 | 版本记录 | ✅ | Zenodo/figshare 持久 DOI + 版本时间轴清晰 |
| 21 | 预处理脚本 | ✅ | 官方 Docker 模板、参考算法代码、MIDOGpp 训练脚本、Colab notebook |
| 22 | 合规要求 | ✅ | CC BY-NC-ND 4.0(2021)/ CC0(MIDOG++ 图像)/ MIT(代码)边界清晰 |
| 23 | 多模态对齐 | ❌ | 仅图像模态,无临床表格/分子/IHC 图像随包发布(IHC 仅用于标签质控) |
| 24 | 去标识化 | ✅ | ROI 组织裁剪图,无患者标识与元数据泄露面 |
DAIMS 评分:19.5 / 24
评分解读:扣分集中在四项——无病例时间戳(❌)、无多模态配套数据(❌)、无机器可读数据字典与结构化域映射(⚠️)、无官方训练/验证划分(⚠️)。这些都不影响其作为检测基准的核心可用性:图像、标注、工具链、溯源与合规文档均为病理数据集第一梯队水平。
对你意味着什么:① 可以直接把它当作目标检测 + 域泛化的生产级基准,落地成本主要在"按文件号段重建域映射表"这一小时级工作;② 如果你的研究需要时间戳、生存结局或多模态配对,MIDOG 无法满足,需转向 TCGA 系或自建队列;③ 任何训练/评估脚本都必须自己实现"按 ROI/域划分"——这是没有官方划分的数据集里最容易翻车的一步;④ 商用前逐版本核对许可(CC BY-NC-ND vs CC0 vs MIT 边界)。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| MIDOG 2022 隐藏测试(IHC 辅助参考) | MIDOG 联合团队 | 10 域有丝分裂检测 | F1 下降(召回率系统性降低) | 相对 3 专家共识:召回下降、排名基本不变 | 共识标签与 IHC 真值存在均匀系统性缺口 |
| 未见域(猫肿瘤、梭形细胞、新扫描仪) | MIDOG 2022 测试域 | 跨域检测 | 小幅但显著下降 | 相对训练域:统计显著 | 新物种/新形态/新设备构成残余泛化瓶颈 |
| MIDOG++ 单域训练 → 跨域测试 | 官方技术验证 | 7 域互测 | 跨域 F1 显著低于域内 | leave-one-domain-out 后明显改善 | 多域联合训练是泛化的有效手段 |
| MITOS-ATYPIA-14(跨数据集) | MITOS-ATYPIA 组织方 | 有丝分裂检测/非典型分类 | 协议不同,不可直接比较 | 标注协议与扫描仪组合不同 | 跨数据集比较须先对齐任务定义 |
§8 基准性能与生态
§8.1 排行榜
MIDOG 2021(隐藏测试集,主指标 F1):
| 排名 | 模型/团队 | 性能(F1) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Yang et al. | 0.748(95% CI 0.704-0.781) | 2022 | 分割辅助任务 + 傅里叶域混合 + TTA | Yang, S. et al., 2022, MICCAI MIDOG Workshop (LNCS) | 未公开 |
| — | Top5 集成 | 0.773 | 2022 | 前五名模型集成(非单一提交) | Aubreville, M. et al., 2022, MedIA. DOI | 未公开 |
| 参考 | Domain Adversarial RetinaNet(官方基线,不计名次) | 0.7183 | 2022 | 梯度反转域对抗 + RetinaNet | Wilm, F. et al., 2022, MICCAI MIDOG Workshop, LNCS 13166, pp. 5-13. DOI | GitHub |
MIDOG 2022(10 个隐藏域,主指标 F1):
| 排名 | 模型/团队 | 性能(F1) | 年份 | 关键技术 | 完整引用 |
|---|---|---|---|---|---|
| 1 | 冠军队伍(9 队终评之一) | 0.764 | 2024 | 多域训练 + 集成策略(详见挑战报告) | Aubreville, M. et al., 2024, Medical Image Analysis 94: 103155. DOI |
⚠️ 数值不可直接比较:两届测试集完全不同(域构成、隐藏扫描仪、ground truth 协议均不同);2022 年官方还勘误过附加指标 AP 的计算。与外部论文比较时,务必核对评估协议版本与匹配准则(见坑点 6)。
MIDOG 2021 按扫描仪分解(官方报告的分析口径):
| 扫描仪 | 训练时状态 | 最佳方法表现 | 官方解读 |
|---|---|---|---|
| Scanner A(Hamamatsu XR) | 已见(有标注) | 达到域内全监督 SOTA 水平 | 标签一致性高 |
| Scanner E(未知) | 未见 | 同样达到 SOTA 量级 | 域隙可被增强/架构补偿 |
| Scanner D(Leica GT450) | 已见图像但无标注 | 明显更弱 | 低对比度是主要障碍 |
| Scanner F(未知) | 未见 | 明显更弱 | 域隙覆盖不全或设备固有难度 |
(来源:Aubreville et al., 2022, MedIA)
这一分解对部署的启示是:均值 F1 掩盖了"未见且成像困难的域"上的巨大差异——选择模型时应看最差域表现而非整体均值。
§8.2 SOTA 总结与选型建议
跨域有丝分裂检测的成熟配方:域平衡采样 + 随机化染色增强 + 分割/密度辅助任务 + 集成与 TTA。若目标是在自有数据上部署,优先复现官方基线(Domain Adversarial RetinaNet)再叠加染色域增强;若目标是发论文,LODO 协议 + 最差域指标是当前审稿人期待的标准姿势。ROI 级任务已接近专家水平(F1 ≈ 0.75-0.77),改进空间主要在最差域与校准,而非整体均值(Aubreville et al., 2022, MedIA、Aubreville et al., 2024, MedIA)。
按目标的选型建议:
| 你的目标 | 建议起点 | 理由 |
|---|---|---|
| 快速复现基线 | Domain Adversarial RetinaNet(官方开源权重) | 代码 + 权重公开,F1 0.7183 可直接对标 |
| 单模型冲高性能 | 分割辅助多任务 + 随机化染色增强 | 2021 前三名共同的组件 |
| 追求极限指标 | 多模型集成 + TTA | Top5 集成 0.773,验证过收益 |
| 研究域泛化机理 | LODO + 域对抗/傅里叶域混合消融 | 与综述与挑战报告的分析框架对齐 |
| AMF 细分类(2025 方向) | 双头分类器 + 难度建模 | 官方新赛道的参赛建议路线 |
§8.3 评测协议
官方协议要点:① 以 Docker 容器提交(MIDOG_reference_docker 模板),在 grand-challenge.org 平台盲测;② 主指标为 F1,中心点匹配(标注圆半径 50 px),自举法(20 次有放回抽病例、10,000 次重复)估计置信区间;③ 2021 年要求方法短论文通过单盲同行评审(F1 ≥ 0.6 方可进入 workshop,12/17 队入选);④ 2022 年分双赛道:Track 1 禁用任何外部数据与标签,Track 2 允许公开数据(挑战页、Aubreville et al., 2022, MedIA)。
§8.4 相关数据集
| 数据集 | 与 MIDOG 的关系 | 适用场景 |
|---|---|---|
| MITOS-ATYPIA-14 | 历史前作(ICPR 2014),2 扫描仪、含非典型分裂标注 | 跨数据集外部验证 |
| TUPAC16 | MICCAI 2016,TCGA 乳腺癌全片计数/增殖评分 | 全片级任务补充验证 |
| MIDOG++ | MIDOG 的官方扩展(503 例、11,937 MF) | 更大规模多域训练 |
| NuCLS / PanNuke / MoNuSAC | 核分割/分类通用基准 | 预训练核特征提取器 |
| BCData / BACH | 乳腺癌分类数据集 | 相邻任务迁移 |
§8.5 关键论文 Top 6
- Aubreville, M., Stathonikos, N., Bertram, C.A., et al. “Mitosis domain generalization in histopathology images — The MIDOG challenge.” Medical Image Analysis 79: 102699 (2022). DOI: 10.1016/j.media.2022.102699 — MIDOG 2021 官方总结:扫描仪域偏移可被强增强与好架构高度补偿。
- Aubreville, M., Stathonikos, N., Donovan, T.A., et al. “Domain generalization across tumor types, laboratories, and species — Insights from the 2022 edition of the Mitosis Domain Generalization Challenge.” Medical Image Analysis 94: 103155 (2024). DOI: 10.1016/j.media.2024.103155 — MIDOG 2022 官方总结:跨肿瘤/物种泛化可行但新域仍有显著损耗。
- Aubreville, M., Wilm, F., Stathonikos, N., et al. “A comprehensive multi-domain dataset for mitotic figure detection.” Scientific Data 10: 484 (2023). DOI: 10.1038/s41597-023-02327-4 — MIDOG++ 数据描述:503 例、标注协议与 LODO 验证的完整方法学。
- Wilm, F., Marzahl, C., Breininger, K., Aubreville, M. “Domain Adversarial RetinaNet as a Reference Algorithm for the MItosis DOmain Generalization Challenge.” MICCAI MIDOG Workshop 2021, LNCS 13166: 5-13 (2022). DOI: 10.1007/978-3-030-97281-3_1 — 官方域对抗基线。
- Aubreville, M., Bertram, C.A., Veta, M., et al. “Quantifying the scanner-induced domain gap in mitosis detection.” Medical Imaging with Deep Learning (MIDL) (2021). — 扫描仪域隙的定量刻画,MIDOG 立项的直接前导。
- Aubreville, M., et al. “MItosis DOmain Generalization Challenge (MICCAI-MIDOG 2021) Training Data.” Zenodo (2021). DOI: 10.5281/zenodo.4643381 — 数据集官方描述文档。
§8.6 社区活跃度
MIDOG 系列通过 MICCAI 挑战保持持续运营:2021 年 237 人注册、17 队终评;2022 年 9 队终评;2025 年新增 AMF 分类赛道。官方维护 DeepPathology/MIDOG(参考算法)、DeepPathology/MIDOGpp(13 stars,截至 2026-09)、MIDOG_reference_docker 三个仓库与 deepmicroscopy.org 官网;2022 版挑战报告论文 58+ 次引用(VetMedUni VetDoc,截至 2026-09)。讨论主要通过 Grand Challenge 平台与 GitHub issues(MIDOGpp)。
社区生态的三个特点值得注意:其一,挑战论文作者网络覆盖全球 30+ 机构(欧洲、北美、亚洲的学术界与腾讯 AI Lab、TCS Research 等工业界团队),后续衍生研究持续出现在 MICCAI、MIDL 等会议;其二,MIDOG 2025 把"非典型分裂"独立成赛道并叠加"难度建模"维度,显示系列仍在主动演进而非存量维护;其三,官方勘误文化良好——AP 指标计算错误通过公开博客说明并修正,第三方复现时可以拿到明确的口径依据。
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| MIDOGpp 仓库 | 代码 + 标注数据库 | GitHub | 13 stars / 9 forks | MIDOG++ 全套训练脚本与双格式标注 |
| MIDOG 参考算法 | 代码 + 权重 | GitHub | 官方维护 | 域对抗基线,可直接复现 0.7183 |
| Docker 提交模板 | 工程模板 | GitHub | 官方维护 | 平台评测的标准容器骨架 |
| 官方 Colab notebook | 教程 | Colab | 官方维护 | 30 分钟理解数据与标注格式 |
| Grand Challenge 平台 | 评测 | midog2022 | 官方运营 | 盲测提交与排行榜 |
| 域泛化综述 | 综述 | arXiv 2310.19656 | 学术引用 | 把 MIDOG 置于计算病理域泛化全景 |
§9 相关资源与引用
§9.1 官方资源列表
- 官方主页(数据获取 + notebook + FAQ):midog.deepmicroscopy.org
- Getting the data(文件号段 ↔ 域对照表):官方页面
- MIDOG 2021 挑战页:grand-challenge.org
- MIDOG 2022 挑战页(含 AP 勘误公告):grand-challenge.org
- MIDOG 2021 训练数据:Zenodo 4643381
- MIDOG 2022 PNG 版训练数据:Zenodo 6547151
- MIDOG++ 数据集:figshare 22691092
- MIDOG++ 代码仓库:GitHub DeepMicroscopy/MIDOGpp
- 参考算法仓库:GitHub DeepPathology/MIDOG
- Docker 提交模板:GitHub MIDOG_reference_docker
- 入门 notebook:Google Colab
§9.2 BibTeX 引用
@article{aubreville2022mitosis,
author = {Aubreville, Marc and Stathonikos, Nikolas and Bertram, Christof A. and Klopfleisch, Robert and ter Hoeve, Natalie D. and Ciompi, Francesco and Wilm, Frauke and Marzahl, Christian and Donovan, Taryn A. and Maier, Andreas and Veta, Mitko and Breininger, Katharina},
title = {Mitosis domain generalization in histopathology images -- {The MIDOG} challenge},
journal = {Medical Image Analysis},
volume = {79},
pages = {102699},
year = {2022},
doi = {10.1016/j.media.2022.102699}
}
@article{aubreville2024domain,
author = {Aubreville, Marc and Stathonikos, Nikolas and Donovan, Taryn A. and Klopfleisch, Robert and Ammeling, Jonas and Ganz, Jonathan and Wilm, Frauke and Veta, Mitko and Jabari, Samir and Eckstein, Markus and Breininger, Katharina and Bertram, Christof A.},
title = {Domain generalization across tumor types, laboratories, and species -- {Insights} from the 2022 edition of the {Mitosis Domain Generalization Challenge}},
journal = {Medical Image Analysis},
volume = {94},
pages = {103155},
year = {2024},
doi = {10.1016/j.media.2024.103155}
}
@article{aubreville2023midogpp,
author = {Aubreville, Marc and Wilm, Frauke and Stathonikos, Nikolas and Breininger, Katharina and Donovan, Taryn A. and Jabari, Samir and Veta, Mitko and Ganz, Jonathan and Ammeling, Jonas and van Diest, Paul J. and Klopfleisch, Robert and Bertram, Christof A.},
title = {A comprehensive multi-domain dataset for mitotic figure detection},
journal = {Scientific Data},
volume = {10},
pages = {484},
year = {2023},
doi = {10.1038/s41597-023-02327-4}
}
@inproceedings{wilm2022domain,
author = {Wilm, Frauke and Marzahl, Christian and Breininger, Katharina and Aubreville, Marc},
title = {Domain Adversarial {RetinaNet} as a Reference Algorithm for the {MItosis DOmain Generalization Challenge}},
booktitle = {MItosis DOmain Generalization Challenge (MIDOG), MICCAI 2021 Workshops, LNCS 13166},
pages = {5--13},
year = {2022},
doi = {10.1007/978-3-030-97281-3_1}
}
@misc{aubreville2021midogdata,
author = {Aubreville, Marc and Bertram, Christof A. and Stathonikos, Nikolas and Veta, Mitko and Donovan, Taryn and ter Hoeve, Natalie and Ciompi, Francesco and Marzahl, Christian and Wilm, Frauke and Breininger, Katharina and Maier, Andreas and Klopfleisch, Robert},
title = {{MItosis DOmain Generalization Challenge} ({MICCAI-MIDOG} 2021) {Training} {Data}},
year = {2021},
doi = {10.5281/zenodo.4643381},
publisher = {Zenodo}
}
@misc{aubreville2022midog2022data,
author = {Aubreville, Marc and Stathonikos, Nikolas and Donovan, Taryn A. and Klopfleisch, Robert and Jabari, Samir and Veta, Mitko and Breininger, Katharina and Bertram, Christof A.},
title = {{MItosis DOmain Generalization Challenge} 2022 ({MICCAI MIDOG} 2022), {Training} data set ({PNG} version)},
year = {2022},
doi = {10.5281/zenodo.6547151},
publisher = {Zenodo}
}
§9.3 引用指南
- 使用 MIDOG 2021 数据:引用 Aubreville et al. 2022(MedIA 总结论文)+ Zenodo 数据 DOI。
- 使用 MIDOG 2022 数据:引用 Aubreville et al. 2024(MedIA 挑战报告)+ Zenodo 6547151。
- 使用 MIDOG++:引用 Aubreville et al. 2023(Scientific Data)+ figshare DOI。
- 使用参考算法代码:另引 Wilm et al. 2022(LNCS)。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型
| 用途 | 模型/工具 |
|---|---|
| 资料检索与事实核验 | CodeBuddy Code(检索增强写作 Agent,fast-model) |
| 初稿撰写与结构化 | CodeBuddy Code(fast-model) |
| 交叉核验与格式校验 | CodeBuddy Code + check_md.py 校验脚本 |
§10.2 AI 参与范围
AI 负责公开资料的检索汇总、初稿撰写、代码示例编写与格式规范执行;所有关键数字(病例数、标注数、F1、许可条款)均要求附带可点击来源;最终内容经千方病案医学编辑部人工审核后发布。医学结论、临床建议与数据使用合规判断的责任由人工审核承担。
§10.3 输入来源列表
- Aubreville, M. et al., 2022, Medical Image Analysis 79: 102699. DOI: 10.1016/j.media.2022.102699
- Aubreville, M. et al., 2024, Medical Image Analysis 94: 103155. DOI: 10.1016/j.media.2024.103155
- Aubreville, M. et al., 2023, Scientific Data 10: 484. DOI: 10.1038/s41597-023-02327-4
- Aubreville, M. et al., 2021, Zenodo. DOI: 10.5281/zenodo.4643381
- Aubreville, M. et al., 2022, Zenodo. DOI: 10.5281/zenodo.6547151
- Aubreville, M. et al., 2021, Zenodo(挑战描述). DOI: 10.5281/zenodo.4573978
- Wilm, F. et al., 2022, LNCS 13166: 5-13. DOI: 10.1007/978-3-030-97281-3_1
- Aubreville, M. et al., 2021, Medical Imaging with Deep Learning(MIDL). arXiv: 2108.11269
- MIDOG 2021 Grand Challenge 官方页. https://midog2021.grand-challenge.org
- MIDOG 2022 Grand Challenge 官方页. https://midog2022.grand-challenge.org/
- MIDOG 官方 Getting the data 页. https://midog.deepmicroscopy.org/?p=130/
- MIDOG++ figshare 数据集. DOI: 10.6084/m9.figshare.22691092
- GitHub: DeepPathology/MIDOGpp. https://github.com/DeepPathology/MIDOGpp
- GitHub: DeepPathology/MIDOG_reference_docker. https://github.com/DeepPathology/MIDOG_reference_docker
- Domain Adaptive Cascade R-CNN 参赛报告. arXiv: 2109.00965
- 计算病理域泛化综述. arXiv: 2310.19656
- VetMedUni VetDoc 出版记录(MIDOG 2022 报告引用数). https://vetdoc.vetmeduni.ac.at/vivo/display/publ_86022
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与 §1.4 版本时间轴 | 千方病案医学编辑部 | 对照 Zenodo/挑战页逐项核对 | ✅ 已通过/已验证 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED CT 术语核对 | ✅ 已通过/已验证 |
| §3-§4 数据规格与字段字典 | 千方病案医学编辑部 | 对照官方 Getting the data 与论文核对 | ✅ 已通过/已验证 |
| §6 代码示例与 8 个坑点 | 千方病案医学编辑部 | 代码逻辑复核 + 坑点溯源 | ✅ 已通过/已验证 |
| §7-§8 指标与引用完整性 | 千方病案医学编辑部 | 与原始论文数字逐一比对 | ✅ 已通过/已验证 |
| 许可与合规声明 | 千方病案医学编辑部 | CC BY-NC-ND/CC0/MIT 条款核对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页面全部章节由 AI 辅助生成初稿,经人工审核修订后发布;其中 §6.5 坑点、§7.7 DAIMS 评估与"对你意味着什么"为 AI 基于官方论文与文档的归纳,已在 §10.4 完成人工复核。
§10.6 最后人工审核日期
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- digestpath — 共享标签:医学影像 / 病理图像 / 目标检测 / 肿瘤学
- ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
- sicapv2 — 共享标签:医学影像 / 病理图像 / 肿瘤学
- msk-impact — 共享标签:医学影像 / 病理图像 / 肿瘤学
- munich-bmc — 共享标签:医学影像 / 病理图像 / 肿瘤学
- pi-cai — 共享标签:医学影像 / 目标检测 / 肿瘤学
- cima — 共享标签:医学影像 / 病理图像 / 肿瘤学
- camelyon16-17 — 共享标签:医学影像 / 病理图像 / 肿瘤学
- icgc — 共享标签:医学影像 / 病理图像 / 肿瘤学
- osteosarcoma — 共享标签:医学影像 / 病理图像 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
