信息速览
INFOBOX — MedMNIST 一屏速览
维度 内容 本质 MNIST 化的医学图像分类数据集集合:12 个 2D(MedMNIST2D)+ 6 个 3D(MedMNIST3D),18 个子数据集一包解决"医学 AI 第一步" 团队 上海交通大学(一作 Jiancheng Yang,通讯 Bingbing Ni);v2 扩展至 8 作者(哈佛/波士顿学院/亚琛/中山医院) 论文 v1:ISBI 2021(pp.191–195);v2:Scientific Data 2023;10:41(doi:10.1038/s41597-022-01721-8,被引 1600+) 规模 708,069 张 2D + 9,998 张 3D(论文口径);Zenodo v2 描述曾写 10,214;现行表格加总 707,962 + 9,996(v2.2.4 清洗后) 尺寸 MNIST-like 28(2D/3D)起步;MedMNIST+ 增 64/128/224(2D)与 64³(3D),全量 46.1 GB 任务 binary / multi-class(2–11 类)/ ordinal regression(RetinaMNIST)/ multi-label(ChestMNIST 14 标签) 模态 病理、胸片、OCT、皮肤镜、眼底、超声、血细胞、肾组织显微镜、腹部 CT、肺结节 CT、肋骨 CT、脑 MRA、电镜——九大类 源数据 13 个公开源(NCT-CRC-HE-100K、NIH-ChestXray14、HAM10000、LIDC-IDRI、RibFrac 等)+ 2 个自采(AdrenalMNIST3D、SynapseMNIST3D) 格式 每子集一个 npz,6 键(train/val/test × images/labels),uint8; pip install medmnist一行加载许可 数据 CC BY 4.0(唯一例外 DermaMNIST CC BY-NC 4.0);代码 Apache-2.0;官方声明 NOT for clinical use 获取 Zenodo 唯一官方分发(现挂 doi:10.5281/zenodo.10519652)|PyPI medmnist|GitHub MedMNIST/MedMNIST版本链 v1.0(2020-11)→ v2.0/v2.1/v2.2(2022)→ v3.0 MedMNIST+(2024-01-16);PyPI 现行 v3.0.2 库内互链 nct-crc-he-100k(148)、busi(539)、3dircadb(357)、ribfrac(451)、luna16(237)、isic-2018(710) 等 10 条
MedMNIST 是医学图像分析领域的"儿童自行车":它不追求临床级分辨率,而是把 18 个真实医学影像数据集全部压进 MNIST 的模子里——28×28 像素、标准 train/val/test 三分、一行 Python 代码加载——让任何人在一台没有 GPU 的笔记本上,十分钟内跑通第一个医学影像分类器。这个"降维"设计使它成为全球医学 AI 课程、AutoML 基准与轻量模型评测的事实标准工具,v2 论文被引超过 1600 次;而 2024 年的 MedMNIST+ 扩展(64/128/224 尺寸、46.1 GB)又把它推向医学基础模型时代的新战场。
与它的原型对照一眼:
| 维度 | MNIST(手写数字) | MedMNIST |
|---|---|---|
| 图像尺寸 | 28×28 | 28×28(2D)/28×28×28(3D)起步,可选 64/128/224 |
| 样本量 | 70,000 | 708,069 张 2D + 10,214 张 3D(论文口径) |
| 子集数 | 1 | 18(9 大模态) |
| 任务类型 | 10 类单任务 | 4 种任务类型 |
| 模型入门成本 | 笔记本 CPU 分钟级 | 同左(28 版) |
| 领域 | 计算机视觉入门 | 医学影像 AI 入门 + AutoML/方法学基准 |
MNIST 用 7 万张手写数字教会了一代人"什么是神经网络";MedMNIST 用 18 万到 70 万张医学小图在做同一件事——只是这次,教完之后你离真实临床数据集(和它的坑)只有一步之遥。
导语读法三则:
- 只想下数据跑通模型:直奔 §4 获取与许可——一行
pip install medmnist即可;注意商用必须排除 DermaMNIST。 - 要引用具体样本数:直奔 §9 坑点 1 与坑点 2——3D 总数有三个历史口径(10,214/9,998/9,996),不注明版本会被审稿人抓住。
- 做基础模型/大尺寸评测:直奔 §5 与 §7.2——MedMNIST+ 的 46.1 GB 多尺寸版本才是为你准备的,28 版太小。
全篇阅读地图(按角色):
| 你是谁 | 建议路径 | 预计耗时 |
|---|---|---|
| 第一次接触的学习者 | 导语 → §0 → §1 → §10.1 上手 | 15 分钟 |
| 要写论文引用数据的科研者 | §2 全表 → §3 版本链 → §9 全部坑点 → 附录 A2 | 40 分钟 |
| AutoML/方法学研究者 | §5 基准 → §5.5 难度分级 → §6.6 场景适配 | 30 分钟 |
| 基础模型开发者 | §2.4 尺寸阶梯 → §7.2 → §4.3 下载策略 | 20 分钟 |
| 库内编辑/互链维护 | §8 → 附录 A/G | 10 分钟 |
| 合规/数据管理者 | §4.2 许可矩阵 → §6.5 传导表 → 坑点 3 | 15 分钟 |
§0 导读:这个数据集解决什么问题
医学影像 AI 有一条经典的入门墙:你想试试"用深度学习分辨皮肤癌",第一个发现是原始数据集要么没公开、要么要签协议、要么动辄几十 GB 的 DICOM 序列;第二个发现是每个数据集的预处理、划分、标签格式都自成一派,光是"把数据读进内存"就能耗掉一周。ImageNet 时代的问题在医学领域同样存在——没有统一的"MNIST",就永远在重复造数据加载的轮子。
MedMNIST 的回答是把"标准化"做到极致。第一层标准化是尺寸:所有 2D 图像压成 28×28(3D 压成 28×28×28),与手写数字 MNIST 完全同构,任何能跑 MNIST 的代码改一行类名就能跑医学数据。第二层是划分:每个子集都给好 train/validation/test 三段,论文报告的所有数字可在同一划分上复现比较。第三层是任务多样性:二分类、多分类(2–11 类)、有序回归(糖尿病视网膜病变 5 级)、多标签(胸片 14 种疾病)四种任务类型齐全,一个集合覆盖教科书里的全部分类范式。第四层是模态多样性:从病理切片到电镜体数据,九大类模态让"跨模态泛化"不再是纸上谈兵。
这套设计的代价同样明确:28 像素装不下诊断级细节。官方在每一处入口都声明"NOT intended for clinical use"——它是算法研究的旋转门,不是临床工具的检验场。2024 年的 MedMNIST+ 用 64/128/224 三个更大尺寸部分回应了这个短板,官方定位也随之升级为"医学基础模型的标准化基准"。
§0 读法三则:
- 这个条目覆盖的是一个集合而非单一数据集:18 个子集的源数据、许可与任务各不相同,§2.2 与 §2.3 的逐子集档案是全文的索引枢纽。
- 全文统计数字均出自论文(PMC9852451)、官网(medmnist.com)与 Zenodo 记录(4269852/6496656/10519652)三方互证;所有版本间数字漂移已在 §9 坑点清单逐条存照。
- 检索时若把 “MedMNIST Classification Decathlon”、“MedMNIST v2”、“MedMNIST+” 当作三个不同数据集去找会一无所获——它们是同一项目的三个阶段名(§3 版本链)。
0.1 入门墙的三种痛与对应解法
MedMNIST 的每层设计都精确对应一种真实痛点,展开来说:
痛一:获取墙。 医学影像的"公开"常常名不副实——要么注册制(填机构、导师、用途,等审批),要么 license 限制商用/限制再分发,要么物理上藏在数十 GB 的 DICOM 序列里。MedMNIST 的解法是把分发做到"零摩擦":Zenodo 直链 + PyPI 自动下载 + 28 版全集合仅 705.8 MB(一节课的课堂带宽就能全员下载)。
痛二:格式碎片。 十个医学数据集有十种目录结构、五种标签格式、三种图像位深,"把数据读进 DataLoader"就能耗掉一周——这是 v1 论文立项时的核心观察。MedMNIST 的解法是 npz 六键 + uint8 + 固定形状,让"更换数据集"的成本等于改一个类名。
痛三:对比失效。 同一数据集,A 论文自切 8:1:1、B 论文用官方划分、C 论文做了类别合并——数字彼此不可比。MedMNIST 的解法是官方唯一划分 + 统一 Evaluator + 开源实验代码,把"可比性"从约定变成基础设施。
这三层解法叠加的效果,是医学影像算法研究的"起点下移":本科生、跨界工程师、资源有限的研究组都能在同一基础设施上开始工作——这正是它被引 1600+ 次的结构性原因,也是本库把它纳入 AI-Ready 光谱"最高就绪度"位置的理由。
0.2 一个具体场景走读:十分钟从零到第一个医学分类器
以 BloodMNIST(血细胞 8 分类)为例,走一遍完整的"零到一"流程——这就是 MedMNIST 体验的全部:
第 0 分钟 pip install medmnist
第 2 分钟 from medmnist import BloodMNIST
train = BloodMNIST(split="train", download=True)
# 自动从 Zenodo 下载 bloodmnist.npz(35.5 MB)
第 4 分钟 train.montage(10) # 生成 10×10 拼图,肉眼确认数据加载正确
第 6 分钟 把 DataLoader 接到你熟悉的任意 CNN(ResNet-18 也好,
自己写的小 CNN 也好)——输入 3×28×28,输出 8 类
第 9 分钟 用包内 Evaluator 在 val 上出 AUC/ACC
第 10 分钟 与官方基准对照:AUC ≈ 0.998 → 管线正确;
明显低于 0.99 → 回头查代码
同样的十分钟,换成 PathMNIST 就得到一个病理分类器,换成 OrganMNIST3D 就得到一个 3D 器官分类器——变的只是类名。这种"改一个词换一个模态"的体验,就是"标准化"三个字在数据工程里的全部含义。
§1 数据集速览:十五问十五答
Q1:MedMNIST 到底是一个数据集还是十八个?
是一个"集合"(collection):18 个相互独立的子数据集,12 个 2D + 6 个 3D,各自有独立的源数据、任务与划分,但共用同一套尺寸标准化(28)、npz 格式与 Python API。论文与官网统称 2D 部分为 MedMNIST2D、3D 部分为 MedMNIST3D。
Q2:为什么是 28×28?这么小的图能代表医学影像吗?
28×28 与经典 MNIST 完全同构,是刻意的设计选择:轻量到笔记本 CPU 可训、课堂演示可即时完成、AutoML 工具可在全集合上快速搜索。代价是细节的不可逆丢失——它测的是"算法骨架"的优劣,不是"临床性能"的天花板。需要细节时用 MedMNIST+ 的 64/128/224 版本。
Q3:18 个子集分别是什么?
2D 十二子集:PathMNIST(结肠病理 9 类)、ChestMNIST(胸片 14 标签多标签)、DermaMNIST(皮肤镜 7 类)、OCTMNIST(视网膜 OCT 4 类)、PneumoniaMNIST(儿科胸片二分类)、RetinaMNIST(眼底 DR 5 级有序回归)、BreastMNIST(乳腺超声二分类)、BloodMNIST(血细胞 8 类)、TissueMNIST(肾皮质细胞 8 类)、OrganAMNIST/OrganCMNIST/OrganSMNIST(腹部 CT 三切面 11 类器官)。3D 六子集:OrganMNIST3D(腹部 CT 体数据 11 类)、NoduleMNIST3D(肺结节二分类)、AdrenalMNIST3D(肾上腺形状二分类)、FractureMNIST3D(肋骨骨折 3 类)、VesselMNIST3D(脑血管形状二分类)、SynapseMNIST3D(电镜突触二分类)。
Q4:数据从哪来,是团队新标注的吗?
绝大部分继承自公开源数据集:PathMNIST 来自 NCT-CRC-HE-100K、ChestMNIST 来自 NIH-ChestXray14、DermaMNIST 来自 HAM10000、FractureMNIST3D 来自 RibFrac、NoduleMNIST3D 来自 LIDC-IDRI 等。只有两个子集是团队自主标注:AdrenalMNIST3D(中山医院 792 名患者的肾上腺形状,内分泌专家标注)与 SynapseMNIST3D(大鼠电镜体数据中的突触,三名神经科学专家分割)。MedMNIST 团队的核心工作是预处理、标准化与统一划分,不是重标注。
Q5:规模有多大?最大的子集是哪个?
论文口径合计 708,069 张 2D + 9,998 张 3D(Zenodo v2.0 描述的 10,214 是 NoduleMNIST3D 修复前口径,见坑 1)。单子集最大是 TissueMNIST 的 236,386 张(肾皮质细胞),最小是 RetinaMNIST 的 1,600 张——规模横跨两个数量级(100 到 100,000)正是设计目标:让你在同一接口下研究"数据量对模型的影响"。文件大小:28 版全集合 705.8 MB,MedMNIST+ 全量 46.1 GB。
Q6:我现在能拿到什么?
全部 18 个子集,没有注册墙。三条路:① Zenodo 直下(官方唯一分发链接,28 版 705.8 MB / 全量 46.1 GB);② pip install medmnist 后用 download=True 自动下载;③ GitHub 源码。许可:CC BY 4.0 为主,唯一例外是 DermaMNIST 的 CC BY-NC 4.0。
Q7:许可证有什么要小心的?
两件事。第一,DermaMNIST 是 CC BY-NC 4.0——商用项目若把 18 个子集一起打包分发就会侵权(坑 3)。第二,这个许可有过版本变更:早期仓库曾按"继承源数据许可"口径书写,GitHub v2.2.3 才明确统一为 CC BY-NC,引用旧文献会看到不一致写法。
Q8:基准结果怎么样,模型能做多好?
官方基准覆盖 ResNet-18/50 与三家 AutoML 工具(auto-sklearn、AutoKeras、Google AutoML Vision)。容易的子集近乎饱和(BloodMNIST AUC 0.998),难的仍有大量空间(FractureMNIST3D 全方法 AUC ≤ 0.750;ChestMNIST 多标签 AUC 0.778)。这种"难度梯度"本身就是设计:既可教学入门,也可支撑严肃的算法对比。
Q9:v1、v2、MedMNIST+ 什么关系?引用哪篇?
v1 = ISBI 2021 的 “MedMNIST Classification Decathlon”(10 个 2D 子集,AutoML 基准);v2 = Sci Data 2023 论文(+2 个 2D、+6 个 3D,即现在的 18 子集);MedMNIST+ = 2024 年 1 月的大尺寸扩展(64/128/224 与 64³,数据 v3.0)。官方要求同时引用 v1 与 v2 两篇论文,用子集还须引用对应源数据论文。
Q10:为什么它对 AI-Ready 重要?
MedMNIST 是"零门槛获取 + 一行代码加载 + 标准划分 + 统一格式"四项全满的教科书样本:CC BY 4.0 为主、Zenodo 固定 DOI、PyPI 包自动下载、npz 格式十年不变。它的 AI-Ready 短板不在数据层而在语义层——28 像素的图像"就绪"程度极高,但临床语义密度极低;这正是 §6.4 分析的"轻量派生数据集"光谱位置。
Q11:HuggingFace 上的 MedMNIST 是官方的吗?
不是。官网 Disclaimer 原文只认 Zenodo 为唯一官方分发链接,HF 上的都是第三方转载。国内网络环境下走镜像下载很常见,但做严肃对比实验前务必用 MD5(Zenodo 文件清单逐文件提供)对回官方版本,引用时说明版本号(坑 11)。
Q12:有序回归和多标签该怎么正确跑?
RetinaMNIST(有序回归):标签 0–4 是等级,官方用有序回归口径评估——把 5 级硬拆成互斥 5 类会浪费偏序信息、数字也不可与文献比。ChestMNIST(多标签):标签向量 N×14,一张图可多病并存;评估用逐标签 AUC(整体 ACC 被标签不平衡扭曲)。两者都有专用评估代码(包内 Evaluator)。
Q13:28 版和 224 版的实验结果能直接比吗?
能——这正是 MedMNIST+ 的设计点:五个分辨率共用同一套样本与划分,官方基准也同时报 ResNet 的 28/224 两档。但要记住两条:一,224 版训练成本高两个数量级,先在 28 版筛想法、再去 224 版验证是推荐工作流;二,DermaMNIST/RetinaMNIST 上 224 反而可能降分(小样本过拟合),分辨率不是万能药(§5.2 规律三)。
Q14:用 MedMNIST 发论文要注意什么?
三重引用义务(v1 论文 + v2 论文 + 所用子集的源数据论文);报告所用数据版本(尤其 NoduleMNIST3D 的 v2.1 前后与 Organ 系列的 v2.2.4 前后,坑 1/2);别把基准成绩写成临床性能(坑 12)。这三条做到,审稿人在数据层面挑不出毛病。
Q15:研究联邦学习/持续学习/模型校准,该用哪些子集?
联邦学习:18 子集的"同构格式、异构分布"天然模拟跨机构孤岛,常见做法是按模态或按子集分客户端。持续学习:把 18 子集排成任务序列即可,无需自建流。校准/不确定性:小样本子集(BreastMNIST 780、RetinaMNIST 1,600、AdrenalMNIST3D 1,584)天然带高不确定性,适合做校准误差的跨域稳定性分析。三条路的共同前提:先读 §2 的逐子集档案,别把任务类型搞混。
§2 数据集合总览:18 个子集逐个点名
MedMNIST 的正确打开方式是"先索引、再下钻":每个子集是一个独立的小数据集,有自己的源、任务与脾气。本节按 2D/3D 两组给出逐子集档案:汇总表用现行下载版口径(v2.2.4 清洗后),论文口径(Scientific Data 2023 Table 1 与 Details 段)的差异逐处标注,并在 §9 坑点 1/2 存照。
2.1 四种任务类型与统一格式
在进入子集之前,先记住两个"全集合公约数":
任务四型:binary(二分类)、multi-class(多分类,2–11 类)、ordinal regression(有序回归,仅 RetinaMNIST 的 DR 5 级——级别 3 比 2 更接近 4,不能当普通多分类处理)、multi-label(多标签,仅 ChestMNIST 的 14 项文本挖掘疾病标签,一张胸片可同时患多种病)。
四型任务对应的评估口径差异(官方 Evaluator 的处理方式):
| 任务类型 | 子集 | 标签形状 | 指标口径 | 常见错误 |
|---|---|---|---|---|
| binary | Pneumonia/Breast + 3D 四个二分类 | N×1(0/1) | 标准二分类 AUC/ACC | 忽略类别不平衡只看 ACC |
| multi-class | Path/Derma/OCT/Blood/Tissue/Organ 系 | N×1(0–C-1) | micro/macro 平均 AUC + ACC | 把 one-hot 后的维度当标签 |
| ordinal regression | RetinaMNIST | N×1(0–4) | 有序性感知口径 | 当普通 5 分类丢偏序信息 |
| multi-label | ChestMNIST | N×14(0/1 向量) | per-label AUC + 样本级 ACC | 用整体 ACC 掩盖标签不平衡 |
格式一律:每个子集一个 .npz 文件,内部 6 个键——train_images/train_labels/val_images/val_labels/test_images/test_labels,数据类型全部 uint8。2D 灰度图形状 N×28×28,2D 彩色图 N×28×28×3,3D 体数据 N×28×28×28。ChestMNIST 的标签是 N×14(多标签),其余子集为 N×1(其中有序回归的标签值 0–4 表示 5 级)。这个格式自 v1(2020)沿用至今,是最早一批"十年不 breaking change"的医学数据格式承诺。
不依赖 PyTorch 封装、直接用 NumPy 读取的最小示例:
import numpy as np
d = np.load("pathmnist.npz")
print(d.files)
# ['train_images', 'train_labels', 'val_images', 'val_labels', 'test_images', 'test_labels']
print(d["train_images"].shape, d["train_images"].dtype)
# (89996, 28, 28, 3) uint8 —— PathMNIST 源为 RGB 染色图,故 3 通道
print(d["train_labels"].shape)
# (89996, 1)
MedMNIST2D 全表(现行口径,v2.2.4 后;Organ 三系列的论文口径差异见 §9 坑 2 与各自档案卡):
| 子集 | 模态 | 任务(类数) | 样本数(train/val/test) | 源数据 |
|---|---|---|---|---|
| PathMNIST | 结肠病理 H&E | 多分类 (9) | 107,180(89,996/10,004/7,180) | NCT-CRC-HE-100K |
| ChestMNIST | 胸片 | 多标签 (14)/二分类 (2) | 112,120(78,468/11,219/22,433) | NIH-ChestXray14 |
| DermaMNIST | 皮肤镜 | 多分类 (7) | 10,015(7,007/1,003/2,005) | HAM10000 + ISIC 2018 |
| OCTMNIST | 视网膜 OCT | 多分类 (4) | 109,309(97,477/10,832/1,000) | Kermany et al. Cell 2018 |
| PneumoniaMNIST | 儿科胸片 | 二分类 (2) | 5,856(4,708/524/624) | Kermany et al. Cell 2018 |
| RetinaMNIST | 眼底彩照 | 有序回归 (5) | 1,600(1,080/120/400) | DeepDRiD 挑战 |
| BreastMNIST | 乳腺超声 | 二分类 (2) | 780(546/78/156) | BUSI |
| BloodMNIST | 血细胞显微镜 | 多分类 (8) | 17,092(11,959/1,712/3,421) | Acevedo et al. Data in Brief 2020 |
| TissueMNIST | 肾皮质显微镜 | 多分类 (8) | 236,386(165,466/23,640/47,280) | BBBC051(Broad) |
| OrganAMNIST | 腹部 CT 轴位 | 多分类 (11) | 58,830(34,561/6,491/17,778) | LiTS + 多器官定位集 |
| OrganCMNIST | 腹部 CT 冠状 | 多分类 (11) | 23,583(12,975/2,392/8,216) | 同上 |
| OrganSMNIST | 腹部 CT 矢状 | 多分类 (11) | 25,211(13,932/2,452/8,827) | 同上 |
2.2 MedMNIST2D:12 个 2D 子集逐个档案
2D 组官方基准最佳成绩速查(官网 Benchmarking 表加粗值,28/224 混合口径):
| 子集 | 最佳 AUC | 最佳 ACC | 难度定位 |
|---|---|---|---|
| PathMNIST | 0.990 | 0.911 | 中等偏易 |
| ChestMNIST | 0.778 | 0.948 | 困难(多标签噪声) |
| DermaMNIST | 0.920 | 0.768 | 中等 |
| OCTMNIST | 0.963 | 0.776 | 中等 |
| PneumoniaMNIST | 0.991 | 0.946 | 易 |
| RetinaMNIST | 0.750 | 0.531 | 困难(有序回归+小样本) |
| BreastMNIST | 0.919 | 0.863 | 中等(小样本) |
| BloodMNIST | 0.998 | 0.966 | 饱和 |
| TissueMNIST | 0.998 | 0.951 | 易(大样本) |
| OrganAMNIST | 0.998 | 0.951 | 饱和 |
| OrganCMNIST | 0.994 | 0.920 | 易 |
| OrganSMNIST | 0.975 | 0.813 | 易 |
逐个档案如下(每张档案表给出模态/源/任务/划分/规格与使用要点;基准数字的完整表在 §5.2):
2.2.1 PathMNIST 档案:集合里的病理代表
| 属性 | 内容 |
|---|---|
| 模态 | 结肠病理 H&E 染色组织 patch |
| 源数据 | NCT-CRC-HE-100K(10 万张非重叠 patch)+ CRC-VAL-HE-7K(官方测试集),Kather et al. PLOS Medicine 2019 |
| 任务 | 9 类组织多分类:脂肪组织(adipose)、背景(background)、碎屑(debris)、淋巴细胞(lymphocytes)、黏液(mucus)、平滑肌(smooth muscle)、正常结直肠黏膜(normal colon mucosa)、癌相关基质(cancer-associated stroma)、结直肠腺癌上皮(colorectal adenocarcinoma epithelium) |
| 划分 | 源训练集按 9:1 切 train/val;源验证集(CRC-VAL-HE-7K)整体作 test |
| 源图规格 | 128×128 H&E patch;直接缩到 28×28 |
| 许可 | CC BY 4.0(源为 CC BY 4.0) |
PathMNIST 是集合中规模第二大的 2D 子集,也是与库内条目 nct-crc-he-100k(148) 直接对应的轻量派生——后者保留了 128×128 的原分辨率 patch,本子集则把每张 patch 压成 28×28。9 类组织的判别在 28 像素下依然可行(官方 ResNet-50 AUC 0.990),因为组织级的纹理与染色模式在该分辨率下仍具辨识度;但腺体形态级细节(如筛状结构)已不可辨。教学场景中它通常扮演"第一个病理分类器"的角色。
2.2.2 ChestMNIST 档案:多标签任务的唯一载体
| 属性 | 内容 |
|---|---|
| 模态 | 后前位胸片 X-Ray(灰度) |
| 源数据 | NIH-ChestXray14:112,120 张图、30,805 名患者,Wang et al. CVPR 2017 |
| 任务 | 14 项疾病标签的多标签分类(肺不张 atelectasis、心脏肥大 cardiomegaly、胸腔积液 effusion、浸润 infiltration、肿块 mass、结节 nodule、肺炎 pneumonia、气胸 pneumothorax、实变 consolidation、水肿 edema、肺气肿 emphysema、纤维化 fibrosis、胸膜增厚 pleural thickening、疝气 hernia);可退化视为"有无病灶"二分类 |
| 划分 | 沿用源数据官方 train/val/test 划分(78,468/11,219/22,433) |
| 源图规格 | 1,024×1,024 灰度;直接缩到 28×28 |
| 标签来源 | NLP 从放射报告中文本挖掘(非人工逐图确认) |
三个使用要点:其一,14 标签是文本挖掘产物,源噪声全部透传——官方基准 AUC 天花板 ~0.78(远低于其他子集的 0.9+),部分原因即在此(坑 6);其二,test 集(22,433)比 val(11,219)大,这是源数据官方划分的原样继承,不要以为切错了;其三,多标签评估必须用 per-label AUC,整体 ACC 会被 14 个标签的极端不平衡扭曲。它是集合中唯一的多标签子集,天然是"多标签学习"课程的实验教具。
2.2.3 DermaMNIST 档案:许可见外的皮肤镜
| 属性 | 内容 |
|---|---|
| 模态 | 皮肤镜图像(三通道 RGB) |
| 源数据 | HAM10000(10,015 张多源皮肤镜图)+ ISIC 2018 挑战训练集补充,Tschandl et al. Sci Data 2018 |
| 任务 | 7 类色素性皮肤病变:光化性角化病、基底细胞癌、良性角化病样病变、皮肤纤维瘤、黑色素细胞痣、黑色素瘤、血管病变 |
| 划分 | 7:1:2(train/val/test) |
| 源图规格 | 600×450 三通道;直接缩到 28×28(非中心裁剪) |
| 许可 | CC BY-NC 4.0(唯一例外,坑 3) |
HAM10000 的"多源"指图像来自三套采集设备与多个机构,这带来采集分布的多样性,也带来设备伪影差异。600×450 压到 28×28 是 18 个子集中纵横比损失最大的一档——病灶的色素网络(pigment network)与蓝白幕(blue-white veil)等皮肤镜经典征象在 28 像素下大部分消失,官方基准 AUC 0.917(ResNet-18 28)与 0.920(224)的差距也印证了分辨率仍有增益。库内 isic-2018(710) 是同一挑战赛体系的原始分辨率条目。
2.2.4 OCTMNIST 档案:视网膜 OCT 四分类
| 属性 | 内容 |
|---|---|
| 模态 | 视网膜 OCT B-scan(灰度) |
| 源数据 | Kermany et al. Cell 2018(Mendeley Data rscbjbr9sj.3)的 OCT 部分:109,309 张有效图像 |
| 任务 | 4 类:CNV(脉络膜新生血管)、DME(糖尿病黄斑水肿)、DRUSEN(玻璃膜疣)、NORMAL |
| 划分 | 源训练集 9:1 切 train/val;源验证集作 test(97,477/10,832/1,000) |
| 源图规格 | 跨度大(384–1,536 × 277–512)灰度;短边中心裁剪后缩放 |
OCT 图像的"层结构"(视网膜各层的高反光带)在 28×28 下保留了主要轮廓——这也是官方基准 AUC 达 0.958(ResNet-50 224)的原因。它与 PneumoniaMNIST 同源(同一篇 Cell 论文同一份 Mendeley 数据),是集合里仅有的"一次下载、两个子集"的组合。注意源数据在原始论文中的采集与标注协议(Kermany 团队与美国四家医院协作)适用于本子集。
2.2.5 PneumoniaMNIST 档案:儿科胸片(与 ChestMNIST 零重叠)
| 属性 | 内容 |
|---|---|
| 模态 | 儿科胸片 X-Ray(灰度) |
| 源数据 | Kermany et al. Cell 2018 的儿科胸片部分:5,856 张 |
| 任务 | 肺炎 vs 正常二分类 |
| 划分 | 源训练集 9:1 切 train/val;源验证集作 test(4,708/524/624) |
| 源图规格 | 跨度大(384–2,916 × 127–2,713)灰度;短边中心裁剪后缩放 |
它最容易与 ChestMNIST 混淆——两者都是胸片、都在这个集合里,但来源完全不同(坑 5):本子集是 1-5 岁儿科患者、医生标注的二元标签;ChestMNIST 是全龄患者、NLP 文本挖掘的 14 标签。官方基准下它的 AUC 高达 0.991(Google AutoML Vision)——儿科肺炎的影像特征(实变、胸腔积液)在 28 像素下仍高度可辨。val 只有 524 张,做模型选择时注意方差。
2.2.6 RetinaMNIST 档案:唯一的有序回归
| 属性 | 内容 |
|---|---|
| 模态 | 眼底彩照(三通道) |
| 源数据 | DeepDRiD 挑战(ISBI 2020 第二届 DR 分级与图像质量估计挑战,isbi.deepdr.org):1,600 张 |
| 任务 | 糖尿病视网膜病变(DR)严重度 0–4 级有序回归 |
| 划分 | 源训练集 9:1 切 train/val;源验证集作 test(1,080/120/400) |
| 源图规格 | 1,736×1,824 三通道;短边中心裁剪后缩放 |
它是集合中样本最少的 2D 子集(1,600 张),也是唯一要求"标签有序性"的子集:把 5 级 DR 当普通 5 分类处理会浪费级别间的偏序信息,官方以有序回归口径评估。val 仅 120 张、test 400 张——单次评估波动可达 ±2 个百分点,论文对比或榜单发布时应报告多次运行均值。库内 idrid(191) 是同任务领域(IDRiD 挑战,眼底 DR 分割+分级)的原始分辨率条目,两者构成"姊妹挑战赛"关系。
2.2.7 BreastMNIST 档案:最小子集与反直觉标签
| 属性 | 内容 |
|---|---|
| 模态 | 乳腺超声(灰度) |
| 源数据 | BUSI(Al-Dhabyani et al. Data in Brief 2020):780 张 |
| 任务 | 二分类——论文原文口径:“combining normal and benign as positive and classifying them against malignant as negative”,即 normal+benign 为 positive、malignant 为 negative(坑 7:与临床惯例相反) |
| 划分 | 7:1:2(546/78/156) |
| 源图规格 | 500×500 灰度;直接缩到 28×28 |
它是 2D 组最小的子集——780 张里 test 只有 156 张,任何评估结论都要考虑小样本方差。源数据 BUSI 的三分类(normal/benign/malignant)在 MedMNIST 中合并了前两类,丢失"正常 vs 良性病灶"的区分;库内 busi(539) 保留完整三分类与原始分辨率,做良恶性细粒度研究应回源条目。官方基准 AUC 0.919(Google AutoML)/0.901(ResNet-18 28)。
2.2.8 BloodMNIST 档案:最饱和的"金丝雀"
| 属性 | 内容 |
|---|---|
| 模态 | 外周血细胞显微图像(三通道) |
| 源数据 | Acevedo et al. Data in Brief 2020(Mendeley Data):17,092 张单个细胞图像 |
| 任务 | 8 类:中性粒细胞、嗜酸性粒细胞、嗜碱性粒细胞、淋巴细胞、单核细胞、未成熟粒细胞(immature granulocytes)、血小板、有核红细胞(erythroblast)——注意第 8 类是有核红细胞而非成熟红细胞 |
| 供血者条件 | 无感染、无血液/肿瘤疾病、采血时无药物治疗(论文原文) |
| 划分 | 7:1:2(11,959/1,712/3,421) |
| 源图规格 | 360×363 三通道;中心裁剪 200×200 后缩放 |
单细胞在纯色背景下的分类对深度学习几乎是"玩具级"任务——官方基准多家方法 AUC 同时打到 0.998(饱和)。它的价值不在"刷分"而在工程:作为管线正确性检验器(跑不出 0.99 说明代码有 bug)与课堂演示素材(十分钟出结果)。库内无 Acevedo 原始数据条目,本子集是血细胞分类的唯一入口。
2.2.9 TissueMNIST 档案:规模之王与投影陷阱
| 属性 | 内容 |
|---|---|
| 模态 | 人肾皮质细胞显微图像(灰度) |
| 源数据 | BBBC051(Broad Bioimage Benchmark Collection),Woloshuk et al. Cytometry Part A 2020 |
| 任务 | 8 类肾皮质细胞核型分类 |
| 划分 | 7:1:2(165,466/23,640/47,280) |
| 源图规格 | 32×32×7 的 z-stack(7 层三维堆栈)——取 axial 轴最大投影压成 28×28 单图 |
三个"最"集于一身:样本最多(236,386 张,占 2D 组三分之一)、唯一直接来自 Broad 基准集合、唯一的 z-stack 投影产物。两个易错点:源编号是 BBBC051 而非相近的其他 BBBC 条目(坑 8);最大投影丢失了 z 轴结构——做"细胞三维形态"研究不可用本子集,应回源数据用完整 stack。规模大的另一面是类别不平衡与标本级聚类(236K 张图只来自 3 个参考标本)——按标本划分的泛化实验(如留一标本外推)要自己重组划分,7:1:2 的官方划分是按图随机切的,标本信息会泄漏。库内 human-protein-atlas(404) 是同属"显微镜细胞分类"领域的邻近条目。
2.2.10 OrganAMNIST 档案:轴位切片三胞胎之长
| 属性 | 内容 |
|---|---|
| 模态 | 腹部 CT 轴位(axial)切片(灰度) |
| 源数据 | LiTS(Bilic et al.,正式版 Med Image Anal 2023)+ 多器官定位数据(Xu et al. IEEE TMI 2019) |
| 任务 | 11 类腹部器官多分类(肝、脾、肾左右、胃、食管、胰腺、胆囊、十二指肠、主动脉、下腔静脉等) |
| 划分 | 源 CT 扫描 115 例切 train、16 例 val、70 例 test(扫描级划分);切片级样本 58,830(34,561/6,491/17,778) |
| 源图规格 | 边界框裁剪后缩放 |
v2.2.4 口径 58,830;v2.2.4 前(论文 Table 1)58,850——差 20 张空白样本(坑 2)。划分是扫描级而非切片级:同一 CT 的切片不会跨集合出现,这比按图随机划分更严格,也让"跨病人泛化"的结论更可信。库内 3dircadb(357) 是多器官定位源数据之一的原始条目。
2.2.11 OrganCMNIST 档案:冠状视角
| 属性 | 内容 |
|---|---|
| 模态 | 腹部 CT 冠状(coronal)重建切片(灰度) |
| 源数据 | 与 OrganAMNIST 完全相同 |
| 任务 | 11 类(标签空间与轴位版一致) |
| 划分 | 同一批 115/16/70 例 CT;切片级 23,583(12,975/2,392/8,216) |
| 备注 | v2.2.4 前 23,660(差 77 张,三胞胎中减幅最大) |
冠状重建的切片数天然少于轴位(CT 逐层采集沿轴位进行),但单张切片承载的解剖信息更"浓缩"。它与 OrganAMNIST/OrganSMNIST 构成"同一批病人、同一标签、三个正交视角"的天然对照——做"视角鲁棒性"或"跨平面知识迁移"实验无需任何额外标注。
2.2.12 OrganSMNIST 档案:矢状视角
| 属性 | 内容 |
|---|---|
| 模态 | 腹部 CT 矢状(sagittal)重建切片(灰度) |
| 源数据 | 与 OrganAMNIST 完全相同 |
| 任务 | 11 类 |
| 划分 | 同一批 115/16/70 例 CT;切片级 25,211(13,932/2,452/8,827) |
| 备注 | v2.2.4 前 25,221(差 10 张) |
三胞胎中最小的冠状/矢状变体在官方基准下 ACC 达 0.90–0.92(ResNet-18 224 的 OrganCMNIST 0.920)—— organs 在正交视角下均具辨识度。三个子集 AUC 全部 0.99+,同样是"金丝雀"级饱和区。
2.3 MedMNIST3D:6 个 3D 子集逐个档案
3D 组官方基准最佳成绩速查(官网表格加粗值):
| 子集 | 最佳 AUC | 最佳 ACC | 难度定位 |
|---|---|---|---|
| OrganMNIST3D | 0.996 | 0.907 | 易 |
| NoduleMNIST3D | 0.914 | 0.874 | 中等(AutoML 意外领跑) |
| AdrenalMNIST3D | 0.839 | 0.802 | 中等偏难 |
| FractureMNIST3D | 0.750 | 0.517 | 全集合最难 |
| VesselMNIST3D | 0.930 | 0.928 | 中等 |
| SynapseMNIST3D | 0.851 | 0.795 | 中等偏难(方法方差大) |
逐个档案如下:
MedMNIST3D 全表(现行口径,v2.2.4 后;OrganMNIST3D 与 VesselMNIST3D 的论文口径 1,743/1,909 见各自档案卡与 §9 坑 1):
| 子集 | 模态 | 任务(类数) | 样本数(train/val/test) | 源数据 |
|---|---|---|---|---|
| OrganMNIST3D | 腹部 CT 体数据 | 多分类 (11) | 1,742(971/161/610) | LiTS + 多器官定位集 |
| NoduleMNIST3D | 胸部 CT | 二分类 (2) | 1,633(1,158/165/310) | LIDC-IDRI |
| AdrenalMNIST3D | 肾上腺形状(CT 分割) | 二分类 (2) | 1,584(1,188/98/298) | 团队自采(中山医院) |
| FractureMNIST3D | 胸部 CT | 多分类 (3) | 1,370(1,027/103/240) | RibFrac Dataset |
| VesselMNIST3D | 脑 MRA 血管形状 | 二分类 (2) | 1,908(1,335/191/382) | IntrA |
| SynapseMNIST3D | 扫描电镜体数据 | 二分类 (2) | 1,759(1,230/177/352) | 团队自采(MitoEM 同源体积) |
2.3.1 OrganMNIST3D 档案:2D/3D 严格对照的锚点
| 属性 | 内容 |
|---|---|
| 模态 | 腹部 CT 3D 体数据(28×28×28 灰度体素) |
| 源数据 | 与 Organ{A,C,S}MNIST 完全同源(LiTS + 多器官定位集) |
| 任务 | 11 类腹部器官(标签空间与 2D 版一致) |
| 划分 | 同一批 115/16/70 例 CT(与 2D 版扫描级一致);体数据级 1,742(971/161/610) |
| 预处理 | 直接用 3D 边界框裁剪、缩到 28³(论文原文:“directly use the 3D bounding boxes”) |
它是 3D 组的"锚点子集":同一批 CT、同一套标签,只把输入从 2D 切片换成 3D 体数据——"OrganAMNIST(2D)vs OrganMNIST3D(3D)"构成一组严格对照实验的现成材料。官方基准下 3D 版 AUC 0.996(ResNet-18+3D)与 2D 轴位版 0.997 几乎持平——对器官分类而言 28³ 体数据与 28² 切片的信息差异已被压到很小,这个"持平"本身就是可引用的结论。v2.2.4 移除 1 张空白样本(论文口径 1,743)。
2.3.2 NoduleMNIST3D 档案:修过 bug 的肺结节
| 属性 | 内容 |
|---|---|
| 模态 | 胸部 CT 肺结节体数据 |
| 源数据 | LIDC-IDRI(Armato et al. Medical Physics 2011):肺结节权威参考库,4 位放射医生独立标注恶性度 1–5 |
| 任务 | 二分类:恶性度 1/2 → 阴性、4/5 → 阳性、3 级(不确定)整例丢弃 |
| 划分 | 7:1:2(1,158/165/310) |
| 预处理 | 空间归一化到 1mm×1mm×1mm 后中心裁剪 28³ |
它是集合中"标签质量"讨论最丰富的子集:LIDC-IDRI 的恶性度本身是 4 名医生的共识产物,丢弃 3 级的设计把"不确定样本"排除在基准之外——既提升了标签确定性,也制造了"容易样本"偏差。版本史:v2.0 首发的 nodulemnist3d.npz 有数据错误,v2.1(Zenodo 6496656,2022-04-27)修复,修复导致 3D 总数 10,214→9,998(坑 1);复现 2022 年上半年论文的数字必须用修复前/后对应版本。库内 luna16(237) 是 LIDC-IDRI 的著名预处理版(LUNA16 挑战),与本子集同源不同预处理。
2.3.3 AdrenalMNIST3D 档案:唯一自采临床数据
| 属性 | 内容 |
|---|---|
| 模态 | 肾上腺 3D 形状掩码(非 CT 强度图) |
| 源数据 | 团队自采:复旦中山医院 792 名患者的 1,584 个左/右肾上腺形状 |
| 标注 | 内分泌(endocrinologist)专家在腹部 CT 上逐例标注 |
| 任务 | 正常肾上腺 vs 肾上腺占位二分类 |
| 划分 | 7:1:2(1,188/98/298) |
| 隐私限制 | 论文原文:“Considering patient privacy, we do not provide the source CT scans” |
18 个子集中唯一的"纯自采临床数据":其余子集的标签要么继承源数据集、要么来自公开挑战赛,只有它的标签是 MedMNIST 团队组织的专家标注。拿到的是形状掩码(体素占用)而非 CT 强度——任何依赖组织密度(如脂肪含量、囊性/实性区分)的实验无法开展。val 仅 98 例,是小样本实验的另一个警示案例。官方基准 AUC 0.839(ResNet-18+ACS)。
2.3.4 FractureMNIST3D 档案:全集合难度天花板
| 属性 | 内容 |
|---|---|
| 模态 | 胸部 CT 骨折区域体数据 |
| 源数据 | RibFrac Dataset(Jin et al. EBioMedicine 2020,FracNet):660 例 CT、约 5,000 处肋骨骨折、4 个临床类型 |
| 任务 | 3 类多分类:buckle(不全骨折)、nondisplaced(无移位)、displaced(移位);segmental(节段性)类型因低分辨率不可辨被弃 |
| 划分 | 7:1:2(1,027/103/240) |
| 预处理 | 以每个标注骨折区域的中心裁剪、缩到 28³ |
官方基准下全方法 AUC 0.587–0.750、ACC 0.397–0.517——18 个子集中最难。原因直白:细微骨折线在 28³ 体素下几乎消失。它的价值恰在于此:任何"新方法在医学影像上更优"的主张,若能在这个子集上显著超越 ResNet 基线(+5 pp 级别),说服力远大于在 BloodMNIST 上从 0.998 刷到 0.999。库内 ribfrac(451) 保留原始分辨率与 4 类完整标签,做临床级骨折检测/分类应回源条目。
2.3.5 VesselMNIST3D 档案:唯一的形状/几何模态
| 属性 | 内容 |
|---|---|
| 模态 | 脑血管 3D 形状(体素化的 mesh) |
| 源数据 | IntrA(Yang et al. CVPR 2020):103 个由 MRA 重建的完整脑血管 3D mesh |
| 任务 | 二分类:健康血管段 vs 动脉瘤段(1,694 健康段 + 215 动脉瘤段自动切分) |
| 划分 | 7:1:2(1,335/191/382) |
| 预处理 | PyMeshFix 修补非水密网格 → trimesh 体素化 → 28³(论文原文引用 PyMeshFix/trimesh 工具链) |
集合中唯一的"形状/几何"输入:体素占用图而非图像强度——Hounsfield 单位、染色强度等强度信息完全不存在,分类只能依赖几何形态(血管壁的膨隆)。预处理工具链(PyMeshFix 论文引文为 Attene 2010 The Visual Computer)对 mesh 数据处理者有参考价值。v2.2.4 移除 1 张空白样本(论文口径 1,909)。官方基准 AUC 0.930(ResNet-18+ACS)——动脉瘤的形态学特征在低分辨率下仍相当可辨。
2.3.6 SynapseMNIST3D 档案:跨界的神经科学接口
| 属性 | 内容 |
|---|---|
| 模态 | 成年大鼠脑组织扫描电镜(multi-beam SEM)3D 体积 |
| 源数据 | 团队自采;体积与 MitoEM 数据集(Wei et al. MICCAI 2020)同源——(30 μm)³ 子体积,原始分辨率 8×8×30 nm |
| 标注 | 三名神经科学专家分割锥体神经元内的突触 |
| 任务 | 二分类:兴奋性突触 vs 抑制性突触 |
| 划分 | 随机 7:1:2(1,230/177/352) |
| 预处理 | 裁剪 1024×1024×1024 nm³ 体积、缩到 28³ |
集合中最"跨界"的子集——从临床影像跳到分子细胞神经科学。兴奋性/抑制性突触的判别依赖突触囊泡形态与突触后致密带形态,这些特征在 28³ 下保留度有限(官方基准 AUC 0.538–0.851,方法间方差极大)。它与 AdrenalMNIST3D 是仅有的两个"标签由团队自产"的子集,也是数据集论文中唯一涉及动物实验伦理声明位置的子集(抓取文本未含批准号,见 FACTS 待核项)。
2.3.7 3D 组横向速读:与 2D 组对照的三个观察
把 6 个 3D 子集与 12 个 2D 子集放在一起读,有三个值得写进实验设计的观察:
- 维度翻倍 ≠ 信息翻倍。OrganMNIST3D(28³,AUC 0.996)与 OrganAMNIST(28²,0.998)几乎打平——28³ 体数据的体素数是 28² 的 28 倍,但有效信息(器官判别特征)没有等比例增加。真正拉开差距的是任务类型:需要空间上下文的任务(血管形态、突触微结构)3D 收益显著(ResNet-18 的 3D 卷积在 OrganMNIST3D 上比 2.5D 高 1.9 pp AUC、在 SynapseMNIST3D 上高 18.6 pp)。
- 3D 组没有饱和区。2D 组有 5 个 AUC ≥0.99 的子集,3D 组最高的 OrganMNIST3D 也只到 0.996 且 FractureMNIST3D 卡在 0.750——3D 数据的低分辨率信息损失更严重,"3D 比 2D 难"在这个集合上是普遍规律而非个例。
- 3D 组的"强度"更稀薄。VesselMNIST3D 与 AdrenalMNIST3D 是体素占用图(形状信息),SynapseMNIST3D 是电镜强度——18 个子集中真正保有"临床影像强度"(Hounsfield 单位意义上的 CT)的 3D 子集只有 OrganMNIST3D、NoduleMNIST3D、FractureMNIST3D 三个,且都压到 28³。引用 3D 子集做"CT 研究"表述前,先核对模态类型。
2.4 尺寸阶梯:从 28 到 224
MedMNIST+(v3.0,2024-01-16)在不改动标签与划分的前提下,为 2D 增加 64×64、128×128、224×224 三档、为 3D 增加 64³ 一档。同一张图五个尺寸意味着:
- 对照实验免费化:研究"分辨率对模型性能的影响"不再需要自己重采样——同一病人、同一划分、五个分辨率直接对齐。
- 文件名约定:28 版无后缀(
pathmnist.npz),大尺寸带后缀(pathmnist_64.npz、chestmnist_224.npz、organmnist3d_64.npz)。 - 体量陡增:octmnist_224.npz 约 4.0 GB、chestmnist_224.npz 约 3.9 GB,全集合 46.1 GB——下载前先想清楚要哪几档(§4.3)。
- API 层零成本切换:
ChestMNIST(split="test", download=True, size=224)一个参数搞定。 - 标签划分不随尺寸变:五个分辨率共用同一套 train/val/test 样本编号——这是 MedMNIST+ 相对各团队自行重采样版的核心优势。
§3 版本演进:一条从 AutoML 到基础模型的主线
3.1 三个阶段、三份文献
| 阶段 | 名称 | 文献 | 数据构成 |
|---|---|---|---|
| v1 | MedMNIST Classification Decathlon | ISBI 2021(DOI 10.1109/ISBI48211.2021.9434062,pp.191–195;preprint arXiv:2010.14925) | 10 个 2D 子集(文件:pathmnist / chestmnist / dermamnist / octmnist / pneumoniamnist / retinamnist / breastmnist / organmnist_axial / organmnist_coronal / organmnist_sagittal) |
| v2 | MedMNIST v2 | Scientific Data 2023;10:41(DOI 10.1038/s41597-022-01721-8;preprint arXiv:2110.14795) | 12 个 2D + 6 个 3D = 18 子集 |
| v3.0 | MedMNIST+ | 无独立论文;GitHub on_medmnist_plus.md + Zenodo v3.0 record |
同 18 子集 × 多尺寸(28/64/128/224 + 64³) |
v2 论文对阶段差异的原文表述:MedMNIST v1 更偏 medical-oriented(10 个 2D 医学影像数据集),v2 在此基础上新增 2 个 2D bioimage 数据集(BloodMNIST、TissueMNIST——两个显微镜下的细胞图像,把覆盖面从临床影像扩展到生物影像),并顺应 3D 影像的普及新增 6 个 3D 数据集。Zenodo changelog 的表述则是"add 6 datasets for 3D and 2 for 2D",两边口径完全一致。v1 的 10 个文件里 Organ 三切面以 _axial/_coronal/_sagittal 后缀存在,v2 才改名 OrganA/C/S(坑 4)。
v1 的团队阵容也提示了阶段差异:ISBI 2021 论文只有 Yang、Shi、Ni 三位上交作者;v2 引入 Wei(波士顿学院)、Pfister(哈佛)、Liu(亚琛)、Zhao(中山医院)、Ke(上海 general hospital)五位合作者——3D 子集与两个自采子集(中山医院数据、神经科学专家标注)正是这次扩容的直接产物。
v1 → v2 的数据文件名迁移对照(老代码/老教程对号用):
| v1 文件名(Zenodo 4269852 实抓) | v2 对应文件名 | 说明 |
|---|---|---|
| organmnist_axial.npz | organamnist.npz | 去后缀改 A 中缀 |
| organmnist_coronal.npz | organcmnist.npz | 同上 |
| organmnist_sagittal.npz | organsmnist.npz | 同上 |
| pathmnist.npz 等其余 7 个 | 同名沿用 | 无变化 |
| — | bloodmnist.npz / tissuemnist.npz | v2 新增 2 个 2D |
| — | 6 个 *mnist3d.npz | v2 新增 3D |
若你在维护 2020-2021 年的教程代码,数据层的迁移成本就是改三个文件名/类名(Python API 层的 v1 类名对应关系以当年的包源码为准,本条目不做未核验的具体类名断言);这也是官方坚持"单包演进、不做两套包"的红利。
3.2 Zenodo 数据版本链(record 号即证据)
| 版本 | Zenodo record | 发布日期 | 变更内容与影响 |
|---|---|---|---|
| v1.0 | zenodo.4269852 | 2020-11-12 | 首发仓库:10 个 2D npz;页面注明"每子集继承源数据许可"口径 |
| v2.0 | zenodo.5208230 | 2022 年初 | 新增 6 个 3D 与 2 个 2D(Blood/Tissue);描述中 3D 总数 10,214(NoduleMNIST3D 修复前口径——坑 1 的起点) |
| v2.1 | zenodo.6496656 | 2022-04-27 | 修复 nodulemnist3d.npz 文件错误(GitHub issue #22);3D 总数修正为 9,998 |
| v2.2 | (并入后续 record) | 2022 下半年 | 移除 OrganAMNIST/OrganCMNIST/OrganSMNIST/OrganMNIST3D/VesselMNIST3D 中误留的空白样本(2D −107、3D −2) |
| v3.0 | zenodo.10519652 | 2024-01-16 | MedMNIST+ 发布:46.1 GB,28 原版 + 全部大尺寸变体;官网"Data"按钮现挂此 record |
官网 Disclaimer 原文明确:“The only official distribution link for the MedMNIST dataset is Zenodo”——任何第三方镜像(包括 HuggingFace 上的转载)都不属于官方分发,出了版本不一致以 Zenodo 为准。v3.0 record 里 28 原版文件的组织是"清洗后版本":organcmnist.npz 的 MD5(b9ceb9546e10131b32923c5bbeaea2b1)与 v2.1 record 的同名文件(0afa5834fb105f7705a7d93372119a21)不同——这是 v2.2 清洗在文件层的直接证据,也是核对"你手上到底是哪一版"的快速指纹。
3.3 PyPI 包版本链(API 层)
medmnist Python 包(Apache-2.0)的 release notes 完整记录了数据与代码的双重演进:
核对本地环境版本的两条命令:
import medmnist
print(medmnist.__version__) # 官方 README 推荐的版本检查方式
pip show medmnist # 或在 shell 层查看安装版本与依赖
若版本低于 3.0.0 则没有 MedMNIST+ 多尺寸能力;低于 2.1.0 则 NoduleMNIST3D 数据可能带修复前错误——版本核对应成为复现实验的第一步。
| PyPI 版本 | 内容 |
|---|---|
| v1.0.0 | MedMNIST v1 发布 |
| v2.0.0 | MedMNIST v2 上 PyPI(18 子集 API 齐备) |
| v2.1.0 | NoduleMNIST3D 数据修复 |
| v2.2.0 | montage 方法兼容 scikit-image ≥0.20 |
| v2.2.1 | PyPI 信息更新 |
| v2.2.2 | Python 3.11 的 Sequence(from collections.abc)支持 |
| v2.2.3 | DermaMNIST 许可标注改为 CC BY-NC 4.0(坑 3) |
| v2.2.4 | 移除空白样本(对应 2D 总数 −107、3D 总数 −2) |
| v3.0.0 | MedMNIST+:size 参数支持 64/128/224 与 64³ |
| v3.0.1 | 下载报错信息优化 |
| v3.0.2 | Evaluator 的 size_flag bug 修复(2024-09-16,现行最新) |
引用这一链条的两个实用价值:其一,复现旧论文结果时要检查作者当年用的版本——v2.1 前后的 NoduleMNIST3D、v2.2.4 前后的 Organ 系列数字不可混用(§9 坑点 1/2);其二,许可变更发生在包版本层,pip install medmnist==2.2.2 时代的文档写的 DermaMNIST 许可与现行不同。
3.4 时间线总览
2020-10 arXiv:2010.14925(v1 preprint)
2020-11 Zenodo v1.0(10 个 2D)
2021-01 ISBI 2021 论文(v1,pp.191-195)
2021-10 arXiv:2110.14795(v2 preprint)
2021-11 v2 论文投稿(Received 2021-11-29)
2022-03 Zenodo v2.0(18 子集齐备)
2022-04 Zenodo v2.1(NoduleMNIST3D 修复)
2022-09 v2 论文接收(Accepted 2022-09-26);随后 v2.2 清洗空白样本
2023-01 Sci Data 正式发表(2023-01-19;10:41);PMC 2023-01-21 上线
2024-01 MedMNIST+ / v3.0(Zenodo 10519652,46.1 GB)
2024-09 PyPI v3.0.2(现行)
三个日期细节值得放进引用脚注:论文 Received(2021-11-29)到 Accepted(2022-09-26)之间隔了 10 个月——期间 Zenodo v2.0/v2.1 已经先行发布,即数据早于论文近一年可获取,这是 Sci Data 系"数据先行"发表模式的典型样本;"Collection date 2023"意味着正式卷期归属 2023 年,而 PMC 上线(2023-01-21)比 pub-date(2023-01-19)晚两天,引用时以 pub-date 为准。
3.5 如何确定"你手上是哪一版":三条指纹
复现或对比实验前,先给手上的数据验明正身:
- 文件名指纹:出现
organmnist_axial.npz→ v1.0;出现pathmnist_224.npz→ v3.0(MedMNIST+);18 个 npz 全部无尺寸后缀 → v2.x 或 v3.0 的 28 子集。 - MD5 指纹:organcmnist.npz 的 MD5 若为
0afa5834fb105f7705a7d93372119a21→ v2.1 及之前(含 77 张空白样本);若为b9ceb9546e10131b32923c5bbeaea2b1→ v2.2.4 之后(清洗版)。organmnist3d.npz 同理(21f0a239… vs a0c5a1ff…)。 - 样本数指纹:
train_images.shape[0]——OrganAMNIST 为 34,581 → v2.2.4 前;34,561 → 清洗后。NoduleMNIST3D 总数 1,849 → v2.0 修复前;1,633 → v2.1 起。
三条指纹全部落定后再解读任何历史数字——这是 §9 坑点 1/2 唯一可靠的规避手段。
§4 获取与许可:三条路、一张许可矩阵、一个体积警告
4.1 三条获取路径
路径一:Zenodo 直接下载(最透明)。官网唯一官方分发链接为 doi.org/10.5281/zenodo.10519652(v3.0 record,46.1 GB),历史版本可从同一 concept 的版本列表进入(v1.0 = 4269852、v2.1 = 6496656)。每个 npz 均附 MD5 校验值(如 pathmnist.npz md5 a8b06965200029087d5bd730944a56c1),跨版本核对文件完整性时应先对 MD5——v2.2.4 清洗后 organcmnist.npz 与 organmnist3d.npz 的 MD5 均已改变,这是版本漂移在文件层的直接证据。
路径二:pip install medmnist(最省事)。官方推荐方式:
pip install medmnist
from medmnist import PathMNIST, NoduleMNIST3D, ChestMNIST
# 28 标准版:指定 split 自动下载
train_dataset = PathMNIST(split="train", download=True)
val_3d = NoduleMNIST3D(split="val", download=True)
# MedMNIST+ 大尺寸:size 参数一换即可
test_224 = ChestMNIST(split="test", download=True, size=224)
包内置 medmnist.INFO 字典存放 18 个子集的元信息(样本数、任务、标签语义),medmnist.Evaluator 提供统一的 AUC/ACC 评估函数——官方基准的全部指标口径都出自它。
路径三:GitHub 源码。github.com/MedMNIST/MedMNIST,适合要改 dataloader 或研究 info.py 标签语义的实现者。代码 Apache-2.0,数据本体仍从 Zenodo 拉。
三条路径对照:
| 维度 | Zenodo 直下 | pip install | GitHub 源码 |
|---|---|---|---|
| 版本可控性 | 最高(record/MD5 精确锁定) | 随包版本走 | 随 commit 走 |
| 新手成本 | 低(点下载) | 最低(一行命令) | 中(clone + 装依赖) |
| 适用场景 | 论文复现、版本审计 | 日常实验、教学 | 改 dataloader、读元数据 |
| 自动更新 | 无(手动) | download=True 按需 | 无 |
| 计量影响 | Zenodo 下载计数 | PyPI 下载计数 | GitHub star |
4.2 许可矩阵:一个例外与两处口径
| 资产 | 许可 | 说明 |
|---|---|---|
| 17/18 子集数据 | CC BY 4.0 | 署名即可用、可商用、可再分发 |
| DermaMNIST | CC BY-NC 4.0 | 唯一例外;源 HAM10000 为 CC BY-NC-SA 4.0,NC 限制由此传导,禁止商用 |
| 代码(PyPI/GitHub) | Apache-2.0 | 含专利授权条款 |
| 论文(Sci Data 2023) | CC BY 4.0 | 开放获取,© The Author(s) 2023 |
| v1 时代口径 | “每子集继承源数据许可” | Zenodo 4269852 原文;ChestMNIST 源 NIH-ChestXray14 为 CC0 1.0 |
三处必须写进项目笔记的细节:
- DermaMNIST 例外是硬约束。把 18 个子集打包成一个"MedMNIST 全家桶"再分发或商用时,DermaMNIST 必须单独移除或取得商业授权——这是集合型数据集最常踩的合规坑。论文原文披露:“Some datasets are under CC-BY-NC license; we have contacted the authors and obtained the permission to re-distribute the datasets”——即团队的再分发许可不自动传导给下游用户。
- 许可有版本史。GitHub release notes 明确 v2.2.3 才把 DermaMNIST 标注改为 CC BY-NC 4.0;更早的 v1 仓库页面写的是"继承源许可"口径。引用许可条款时以当前官网/记录为准,不要引旧博客。
- 源数据引用义务。官网与论文均要求:使用任一子集,除引用 MedMNIST v1/v2 两篇论文外,必须引用该子集的源数据论文(逐子集引用列表见官网 Facts 页与 medmnist.bib 文件)。
4.3 体积与下载策略:46.1 GB 不是必选项
MedMNIST+ record(10519652)把 28 原版与全部大尺寸变体放在同一 record 下(全量 46.1 GB),但实际下载完全可以按需取用:
| 需求 | 建议取法 | 体积 |
|---|---|---|
| 教学演示 / 笔记本实验 | 只下 28 版 18 个 npz | 705.8 MB |
| 单一子集深度实验 | pip install medmnist + 按需自动下载 |
单子集 0.3 MB – 4 GB |
| 分辨率消融研究 | 某子集的 28/64/128/224 四档 | 视子集 0.6 – 5.7 GB |
| 全量镜像 | Zenodo 全 record | 46.1 GB |
代表性单文件体积(28 版):pathmnist.npz 205.6 MB(最大)、tissuemnist.npz 125.0 MB、chestmnist.npz 82.8 MB、octmnist.npz 54.9 MB、breastmnist.npz 559.6 kB、adrenalmnist3d.npz 276.8 kB(最小)。大尺寸端:octmnist_224.npz 约 4.0 GB、chestmnist_224.npz 约 3.9 GB、nodulemnist3d_64.npz 约 289.8 MB。
4.4 版本选择决策(下载前三十秒)
你要做什么?
├── 教学 / 课程 / 快速原型
│ └── pip install medmnist,28 版按需自动下载(0.3–205 MB/子集)
├── 复现 2022-2023 年论文数字
│ ├── 引用的是 NoduleMNIST3D → 查论文投稿时间,对齐 v2.0/v2.1
│ ├── 涉及 Organ 系列 → v2.2.4 前(58,850)还是后(58,830)?
│ └── 用 §3.5 三条指纹核对手上版本
├── 跨模态 / 基础模型评测
│ └── MedMNIST+:size=64/128/224,注意 46.1 GB 按需取档
├── 商业项目
│ └── 17 个子集可用;DermaMNIST 剔除(坑 3)
└── 需要原始分辨率
└── 别下 MedMNIST——回库内源条目(附录 G)
4.5 AI-Ready 评估:轻量派生数据集的天花板样本
按 DAIMS 五维粗评(完整表见附录 B):MedMNIST 在可发现性(官网+Zenodo DOI+PyPI 三重入口)与可获取性(无注册、无申请、自动下载)两端接近满分,可互操作(npz+uint8+PyTorch Dataset 标准封装)同样优秀;元数据层面文档完备但版本漂移需要使用者自行甄别(§9);可持续性则受益于 Zenodo 固定 DOI 与十年不 breaking change 的格式承诺。它的 AI-Ready 短板不在"就绪度"而在"语义密度":28 像素图像对算法层是高就绪的,对临床语义层是低密度的——这个光谱位置与库内原始源数据条目(如 NCT-CRC-HE-100K 的全分辨率 patch)形成互补而非竞争。
§5 基准与评估:数字怎么读
5.1 官方基准的设定
v2 论文为 18 个子集提供了统一基准,方法分两族:
- 监督 CNN 族:ResNet-18 与 ResNet-50,各跑 28 与 224 两种输入尺寸(2D);3D 侧 ResNet-18/50 各配三种通道策略——2.5D(取三平面中央切片当 2D 图)、3D(真三维卷积)、ACS(axial/coronal/sagittal 三平面卷积,源自团队 IEEE JBHI 2021 论文 “Reinventing 2D convolutions for 3D images”)。
- AutoML 族:auto-sklearn、AutoKeras(开源)与 Google AutoML Vision(商业)。v1 的 Decathlon 定位即"AutoML 基准"——让不开发 CNN 的人也能在全集合上自动搜索模型。
指标统一为 AUC(AUROC)与 ACC,由包内 Evaluator 输出;多标签(ChestMNIST)与有序回归(RetinaMNIST)用适配口径。所有训练用 Adam 优化器、标准数据增广,代码与权重公开于 MedMNIST/experiments。
5.2 2D 结果速读(官网 Benchmarking 表逐字摘录)
| 方法 | PathMNIST AUC/ACC | ChestMNIST AUC/ACC | DermaMNIST AUC/ACC | OCTMNIST AUC/ACC | PneumoniaMNIST AUC/ACC | RetinaMNIST AUC/ACC |
|---|---|---|---|---|---|---|
| ResNet-18 (28) | 0.983/0.907 | 0.768/0.947 | 0.917/0.735 | 0.943/0.743 | 0.944/0.854 | 0.717/0.524 |
| ResNet-18 (224) | 0.989/0.909 | 0.773/0.947 | 0.920/0.754 | 0.958/0.763 | 0.956/0.864 | 0.710/0.493 |
| ResNet-50 (28) | 0.990/0.911 | 0.769/0.947 | 0.913/0.735 | 0.952/0.762 | 0.948/0.854 | 0.726/0.528 |
| ResNet-50 (224) | 0.989/0.892 | 0.773/0.948 | 0.912/0.731 | 0.958/0.776 | 0.962/0.884 | 0.716/0.511 |
| auto-sklearn | 0.934/0.716 | 0.649/0.779 | 0.902/0.719 | 0.887/0.601 | 0.942/0.855 | 0.690/0.515 |
| AutoKeras | 0.959/0.834 | 0.742/0.937 | 0.915/0.749 | 0.955/0.763 | 0.947/0.878 | 0.719/0.503 |
| Google AutoML Vision | 0.944/0.728 | 0.778/0.948 | 0.914/0.768 | 0.963/0.771 | 0.991/0.946 | 0.750/0.531 |
| 方法 | BreastMNIST AUC/ACC | BloodMNIST AUC/ACC | TissueMNIST AUC/ACC | OrganAMNIST AUC/ACC | OrganCMNIST AUC/ACC | OrganSMNIST AUC/ACC |
|---|---|---|---|---|---|---|
| ResNet-18 (28) | 0.901/0.863 | 0.998/0.958 | 0.930/0.676 | 0.997/0.935 | 0.992/0.900 | 0.972/0.782 |
| ResNet-18 (224) | 0.891/0.833 | 0.998/0.963 | 0.933/0.681 | 0.998/0.951 | 0.994/0.920 | 0.974/0.778 |
| ResNet-50 (28) | 0.857/0.812 | 0.997/0.956 | 0.931/0.680 | 0.997/0.935 | 0.992/0.905 | 0.972/0.770 |
| ResNet-50 (224) | 0.866/0.842 | 0.997/0.950 | 0.932/0.680 | 0.998/0.947 | 0.993/0.911 | 0.975/0.785 |
| auto-sklearn | 0.836/0.803 | 0.984/0.878 | 0.828/0.532 | 0.963/0.762 | 0.976/0.829 | 0.945/0.672 |
| AutoKeras | 0.871/0.831 | 0.998/0.961 | 0.941/0.703 | 0.994/0.905 | 0.990/0.879 | 0.974/0.813 |
| Google AutoML Vision | 0.919/0.861 | 0.998/0.966 | 0.924/0.673 | 0.990/0.886 | 0.988/0.877 | 0.964/0.749 |
三条横向规律值得写进实验设计:
- 饱和区:BloodMNIST(AUC 0.998)与 Organ 三系列(AUC 0.99+)已被打穿,再刷榜意义有限——它们更适合当管线正确性的"金丝雀"。
- 难度梯度区:ChestMNIST(多标签 AUC ~0.77,文本挖掘标签噪声透传)、RetinaMNIST(ACC ~0.53,有序回归 5 级 + 小样本)与 FractureMNIST3D(见下)保留了充足的改进空间。
- 224 未必更好:DermaMNIST 与 RetinaMNIST 上大尺寸模型 ACC 反而下降——小样本子集过拟合风险高于分辨率收益,"分辨率越大越好"的直觉在这个集合上不成立。
读这张表的四个技术注意:
- 加粗规则:官方表加粗的是每列(每子集)的最优值,跨方法比较而非单方法行读。
- ACC 与 AUC 背离时信 AUC:极端不平衡子集(如 PneumoniaMNIST 负样本占比高)的 ACC 波动远大于 AUC。
- Google AutoML Vision 的两个"异常值"(PneumoniaMNIST 0.991 与 FractureMNIST3D 无 3D 支持)提醒:商业 AutoML 的黑盒管道在医学域不是万能的。
- 所有数字为 28/224 双输入、无外部数据:任何引入预训练权重或外部数据的实验都不与这张表直接可比——应在自己的表格里单列"预训练"档。
5.3 3D 结果速读(官网表格逐字摘录)
| 方法 | OrganMNIST3D AUC/ACC | NoduleMNIST3D AUC/ACC | FractureMNIST3D AUC/ACC | AdrenalMNIST3D AUC/ACC | VesselMNIST3D AUC/ACC | SynapseMNIST3D AUC/ACC |
|---|---|---|---|---|---|---|
| ResNet-18 + 2.5D | 0.977/0.788 | 0.838/0.835 | 0.587/0.451 | 0.718/0.772 | 0.748/0.846 | 0.634/0.696 |
| ResNet-18 + 3D | 0.996/0.907 | 0.863/0.844 | 0.712/0.508 | 0.827/0.721 | 0.874/0.877 | 0.820/0.745 |
| ResNet-18 + ACS | 0.994/0.900 | 0.873/0.847 | 0.714/0.497 | 0.839/0.754 | 0.930/0.928 | 0.705/0.722 |
| ResNet-50 + 2.5D | 0.974/0.769 | 0.835/0.848 | 0.552/0.397 | 0.732/0.763 | 0.751/0.877 | 0.669/0.735 |
| ResNet-50 + 3D | 0.994/0.883 | 0.875/0.847 | 0.725/0.494 | 0.828/0.745 | 0.907/0.918 | 0.851/0.795 |
| ResNet-50 + ACS | 0.994/0.889 | 0.886/0.841 | 0.750/0.517 | 0.828/0.758 | 0.912/0.858 | 0.719/0.709 |
| auto-sklearn | 0.977/0.814 | 0.914/0.874 | 0.628/0.453 | 0.828/0.802 | 0.910/0.915 | 0.631/0.730 |
| AutoKeras | 0.979/0.804 | 0.844/0.834 | 0.642/0.458 | 0.804/0.705 | 0.773/0.894 | 0.538/0.724 |
3D 侧两个标志性发现:
- 2.5D 明显吃亏:仅取中央切片的 2.5D 策略在多数 3D 子集上落后于真 3D 卷积与 ACS——28³ 的体数据足够小,3D 卷积的算力开销已非瓶颈,"省算力取切片"的做法在轻量场景没有借口。
- auto-sklearn 的逆袭:在 NoduleMNIST3D 上传统 AutoML(0.914 AUC)击败所有 ResNet 变体——当影像特征被压到极低分辨率后,特征工程类方法的竞争力被意外放大。这也是 MedMNIST 作为 AutoML 基准的原始卖点之一。
5.4 使用基准的四条守则
- 引用数字时注明版本:上表对应 v2.1 后的 NoduleMNIST3D 与 v2.2.4 前的 Organ 系列口径;v2.2.4 清洗后官网表格的 Organ 数字已微调(§9 坑点 2)。
- 别用 test 集调参:每个子集的 test 只许碰一次;RetinaMNIST 的 test 仅 400 张,单次波动即可达 ±2 pp。
- 有序回归别当多分类:RetinaMNIST 若忽略级别有序性,ACC 会虚低且与文献不可比。
- 多标签别硬套 ACC:ChestMNIST 的 14 标签极端不平衡,报告 ACC 同时必须给 per-label AUC。
5.5 十八子集难度分级与成因
把官方基准的"最好成绩"拉成一张难度地图,成因分四类:
| 难度档 | 子集(最佳 AUC) | 成因 |
|---|---|---|
| 饱和(≥0.99) | BloodMNIST (0.998)、TissueMNIST (0.998)、OrganAMNIST (0.998)、OrganCMNIST (0.994)、OrganSMNIST (0.975)、OrganMNIST3D (0.996)、OCTMNIST (0.963)、PathMNIST (0.990) | 目标结构在低分辨率下仍具强判别性;类别视觉差异大(细胞形态、器官轮廓) |
| 中等(0.86–0.96) | PneumoniaMNIST (0.991 实为饱和)、DermaMNIST (0.920)、VesselMNIST3D (0.930)、NoduleMNIST3D (0.914)、BreastMNIST (0.919)、AdrenalMNIST3D (0.839)、SynapseMNIST3D (0.851) | 小样本(Breast/Adrenal)、形态学信息受限(Vessel 形状、Adrenal 无强度)、专家分歧大(Synapse) |
| 困难(0.75–0.86) | NoduleMNIST3D 与 SynapseMNIST3D 的多数方法 | 恶性度丢弃 3 级后的残余分歧;电镜特征的低分辨率保留度有限 |
| 极难(<0.75) | ChestMNIST (0.778)、RetinaMNIST (0.750)、FractureMNIST3D (0.750) | 多标签文本挖掘噪声;小样本有序回归;骨折线低分辨率不可见 |
这张表的实用价值是"选靶子":想验证新方法的有效性,去困难/极难档找提升空间;想验证新管线的正确性,去饱和档确认能复现 0.99。
5.6 与库内评测基准类条目的位置关系
库内受控标签"评测基准"下的条目各占一个生态位,MedMNIST 的位置是"轻量多模态分类基准":
- vs 挑战赛类条目(如 camelyon16、idrid、luna16 等):挑战赛数据是"单任务、原始分辨率、一次性的排名竞技场";MedMNIST 是"18 任务、标准化、可反复跑的日常训练场"——前者的排名含金量高,后者的迭代成本低,两者互为上下游。
- vs 教学类资源:MedMNIST 是库内极少数"官网明确欢迎教学用途"的条目(Key Features 之 Educational 项),CC 许可 + 28 像素 + 无背景要求的三连设计是教科书级的 AI-Ready 教学样本。
- vs 基础模型评测集:MedMNIST+ 的多尺寸矩阵切入了"基础模型跨模态泛化"评测的空白位——在 224 档上,它与库内其他 224 原生数据集条目形成"泛化探针 vs 专项深度"的互补。
5.7 复现官方基准的实操清单
想逐格复现官网 Benchmarking 表,按此清单走:
- 包版本钉死:
pip install medmnist==3.0.2(v3.0.0/3.0.1 的 Evaluator 有 size_flag bug,坑 9)。 - 数据版本声明:28 版从 v3.0 record 自动下载即为 v2.2.4 清洗后版本;复现论文 Table 内 Organ 系列数字需自行到 v2.1 record(6496656)取清洗前文件。
- 训练配置:官方实验代码与权重在
MedMNIST/experiments(PyTorch、auto-sklearn、AutoKeras、Google AutoML Vision 四套);Adam 优化器、标准增广、包内默认超参。 - 评估口径:用包内
Evaluator输出 AUC/ACC,别自写指标——多标签与有序回归的口径差异都在里面处理好了。 - 报告规范:多次运行报均值±标准差;小样本子集(Breast/Retina/Adrenal)至少 3 seeds;224 版注明硬件与时长(与 28 版不可同日而语)。
- 对照锚点:BloodMNIST(0.998)跑不出说明管线有 bug;FractureMNIST3D 轻松破 0.8 说明数据泄漏(多半是切片级泄漏进了扫描级划分)。
§6 与源数据集的关系:"MNIST 化"的方法论与代价
6.1 派生操作的三步法
MedMNIST 对每个源数据集执行统一的三步流水线:
- 裁剪与缩放:源图短边中心裁剪(源纵横比悬殊者,如 OCTMNIST 的 384–1536×277–512)或直接缩放(源图接近方形者,如 DermaMNIST 的 600×450),统一压到 28×28(2D)或 28×28×28(3D 体数据经边界框裁剪后缩放)。
- 再划分:源数据自带官方 train/test 者沿用官方划分(ChestMNIST),或把源训练集按 9:1 切出 train/val、源验证集当 test(OCTMNIST、PneumoniaMNIST、RetinaMNIST);源数据无官方划分者按 7:1:2 随机分(DermaMNIST、BreastMNIST、BloodMNIST、TissueMNIST 与全部 3D 子集)。
- 标签整理:多标签源保留全部标签(ChestMNIST 14 项);有序源保留级别(RetinaMNIST 5 级);三分类中语义重叠者合并(BreastMNIST 的 normal+benign);五级置信度中不确定段丢弃(NoduleMNIST3D 的恶性度 3);四类中低分辨率不可辨者删类(FractureMNIST3D 弃 segmental)。
这套流水线的产物是"同一批标签、同一个接口、五种分辨率"的可比空间——代价是每一步都不可逆地丢弃源信息,且官方不提供从 MedMNIST 回源数据的逐样本映射表(源数据独立下载、独立划分,与 MedMNIST 的 train/val/test 不保证样本级对应)。
6.2 源数据映射全表与库内对应
| MedMNIST 子集 | 源数据 | 源出处 | 库内条目(rid) |
|---|---|---|---|
| PathMNIST | NCT-CRC-HE-100K(10 万 patch) | Kather et al. PLOS Medicine 2019(doi:10.1371/journal.pmed.1002730) | nct-crc-he-100k(148) |
| ChestMNIST | NIH-ChestXray14(112,120 图/30,805 患者) | Wang et al. CVPR 2017 | —(库内暂无 ChestXray14 条目) |
| DermaMNIST | HAM10000 + ISIC 2018 训练集 | Tschandl et al. Sci Data 2018;Codella et al. 2019 | isic-2018(710)(同挑战赛) |
| OCTMNIST | Kermany OCT 集 | Kermany et al. Cell 2018 | — |
| PneumoniaMNIST | Kermany 儿科胸片集 | 同上(Mendeley Data rscbjbr9sj.3) | — |
| RetinaMNIST | DeepDRiD 挑战数据 | isbi.deepdr.org(2020) | idrid(191)(同任务领域) |
| BreastMNIST | BUSI(780 图) | Al-Dhabyani et al. Data in Brief 2020 | busi(539) |
| BloodMNIST | Acevedo 血细胞集 | Acevedo et al. Data in Brief 2020 | — |
| TissueMNIST | BBBC051(3 标本 8 类) | Woloshuk et al. Cytometry A 2020;Ljosa et al. Nat Methods 2012 | human-protein-atlas(404)(同显微镜细胞分类领域) |
| Organ{A,C,S}MNIST / OrganMNIST3D | LiTS + 多器官定位 CT | Bilic et al.(LiTS,Med Image Anal 2023);Xu et al. IEEE TMI 2019 | 3dircadb(357)(多器官定位源之一) |
| NoduleMNIST3D | LIDC-IDRI | Armato et al. Medical Physics 2011 | luna16(237)(LIDC 预处理版) |
| AdrenalMNIST3D | 团队自采(中山医院 792 患者) | 论文 Details 段 | — |
| FractureMNIST3D | RibFrac Dataset | Jin et al. EBioMedicine 2020(FracNet) | ribfrac(451) |
| VesselMNIST3D | IntrA(103 脑血管 mesh) | Yang et al. CVPR 2020 | — |
| SynapseMNIST3D | 团队自采(MitoEM 同源大鼠电镜体积) | Wei et al. MICCAI 2020(MitoEM) | — |
互链读法:MedMNIST 子集与库内源条目是"轻量教学镜像 vs 全分辨率原始数据"的关系。做严肃研究应回到源条目拿原始分辨率(如 PathMNIST 的 100,000 张 128×128 H&E patch 远比 28×28 版信息量大);做教学、原型与 AutoML 搜索则用 MedMNIST 版以小时级成本换迭代速度。
6.3 两个自采子集的独特地位
AdrenalMNIST3D 与 SynapseMNIST3D 是集合中仅有的两个"标签由团队自己生产"的子集,也因此携带独有的限制:
- AdrenalMNIST3D:中山医院的 792 名患者、1,584 个肾上腺形状,内分泌专家逐例标注。论文明确"Considering patient privacy, we do not provide the source CT scans"——使用者拿到的是形状掩码(体素占用图)而非 CT 强度图,任何依赖组织强度信息(如脂肪含量)的实验都无法开展。它也是集合里唯一的内分泌器官临床数据。
- SynapseMNIST3D:三名神经科学专家在大鼠电镜体积中分割锥体神经元内的突触并标注兴奋/抑制。原始体积与 MitoEM 数据集同源((30 μm)³ 子体积),想看原始上下文可对照 MitoEM(MICCAI 2020)。这是医学影像基准中罕见的"分子细胞神经科学 × 机器学习"接口。
自采子集的使用伦理提醒(两者共性):CC BY 4.0 许可意味着标签与形状/体数据可自由再分发,但这不改变其背后的临床/动物实验伦理语境——基于人类患者数据(中山医院)的子集再做患者级重识别尝试是被明确排除的用途(形状掩码设计上已剥离强度信息);基于动物实验数据的子集在论文方法学中应说明其体积与 MitoEM 的同源关系。两个子集的原始采集协议细节论文未完整披露,引用时保留"per the MedMNIST publication"的溯源表述即可。
6.4 "MNIST 化"的三笔账
收益账:① 入门门槛从"周级"降到"分钟级"——下载 0.3–205 MB、一行代码、CPU 可训;② 跨子集可比性——统一尺寸/划分/指标后,18 个原本互不相通的域可放进同一张排行榜;③ 可复现性——npz + 固定划分 + 开源 Evaluator,论文数字十年可复跑。
损失账:① 诊断细节不可逆丢失——28×28 下肋骨骨折线几乎消失(FractureMNIST3D AUC 0.59–0.75 就是证据)、皮肤镜病灶纹理被抹平;② 源数据集的标签噪声全部透传(ChestMNIST 的文本挖掘标签、LIDC-IDRI 的观察者间恶性度分歧);③ 样本级回溯不可行——没有官方映射表,无法把 MedMNIST 样本对回源数据的患者做分层分析。
适用边界:算法研究(架构、AutoML、持续学习、联邦学习、小样本)首选;临床性能研究、监管申报、真实世界部署研究必须回到源数据集。官方"NOT intended for clinical use"的免责声明不是套话,而是这套设计的逻辑必然。
6.5 源数据许可传导全表
集合型数据集的许可风险集中在"传导链":MedMNIST 子集 ← 源数据集 ← 原始采集方。逐条核验(官网 Facts 页 + v1 Zenodo 许可口径 + 论文原文)后的传导表:
| 子集 | 源数据许可 | MedMNIST 口径 | 传导备注 |
|---|---|---|---|
| PathMNIST | CC BY 4.0 | CC BY 4.0 | 署名即可商用 |
| ChestMNIST | CC0 1.0(NIH) | CC BY 4.0 | v1 页面明示源为 CC0;公共领域,最宽松 |
| DermaMNIST | CC BY-NC 4.0(HAM10000) | CC BY-NC 4.0 | 唯一禁商用子集;团队另获再分发许可(不传导) |
| OCTMNIST / PneumoniaMNIST | CC BY 4.0(Kermany) | CC BY 4.0 | 署名即可 |
| RetinaMNIST | CC BY 4.0(DeepDRiD) | CC BY 4.0 | 挑战赛数据 |
| BreastMNIST | CC BY 4.0(BUSI) | CC BY 4.0 | — |
| BloodMNIST | 源 Mendeley(CC BY 4.0) | CC BY 4.0 | — |
| TissueMNIST | BBBC 系(Broad 开放) | CC BY 4.0 | Broad BBBC 惯例为宽松许可 |
| Organ 系列(2D/3D) | CC BY 4.0(LiTS/TMI) | CC BY 4.0 | — |
| NoduleMNIST3D | LIDC-IDRI(开放) | CC BY 4.0 | TCIA 托管源 |
| AdrenalMNIST3D / SynapseMNIST3D | 自采 | CC BY 4.0 | 团队拥有原始权利 |
| FractureMNIST3D | RibFrac(开放) | CC BY 4.0 | FracNet 团队发布 |
| VesselMNIST3D | IntrA(开放) | CC BY 4.0 | — |
合规三句话:商用项目——17 个子集署名可用,DermaMNIST 必须剔除或单独授权;学术项目——全部可用,但引用义务(v1+v2+源论文三重引用)是学术诚信问题而非法律问题;再分发项目——打包 18 子集再分发时保持逐子集许可标注,不能把整体笼统标成 CC BY 4.0。
6.6 四类研究场景的适配度
- 联邦学习:18 个"同构格式、异构分布"的子集天然模拟了跨机构数据孤岛——各医院拿到的模态/任务/规模都不同,MedMNIST 让联邦学习论文不用再去签 N 家医院的数据协议。这是它被引构成中联邦学习论文占比高的结构性原因。
- 持续学习 / 多任务:18 子集可排成任意任务序列,研究灾难性遗忘、任务边界检测无需自建流。
- 模型校准 / 不确定性:四类任务 × 多模态提供了"校准误差是否跨域稳定"的现成测床;小样本子集(Breast/Retina/Adrenal)天然带不确定性。
- 神经架构搜索(NAS):28 像素输入让 NAS 的搜索成本降到 ImageNet 场景的百分之一——这正是 v1 “Classification Decathlon” 的立意。
适用边界自查清单(用 MedMNIST 前过一遍):
- [ ] 我的研究结论是否需要"临床级分辨率"支撑?需要 → 回源数据集。
- [ ] 我的商用场景是否包含 DermaMNIST?包含 → 剔除或授权(坑 3)。
- [ ] 我引用的样本数是否注明了版本?没有 → 回坑点 1/2 补注。
- [ ] 我的评估是否用了包内 Evaluator 口径?没有 → 结果与文献不可比。
- [ ] 我的划分是否保持扫描级/官方划分?自己重切 → 与官方数字失去可比性且可能引入泄漏。
§7 生态与影响:从课堂教具到基础模型基准
7.1 学术影响
v2 论文(Sci Data 2023)Google Scholar 被引 1662 次(2026-09-28 抓取时点),且引用曲线仍在陡峭段。按时间轴看引用构成的四次接力:
- 2021(v1 刚发):AutoML 社区接棒——“Classification Decathlon” 本是为 auto-sklearn/AutoKeras/Google AutoML 设计的竞技场,早期引用集中在 AutoML 与 NAS 论文。
- 2022-2023(v2 齐备):轻量医学 ML 教学与原型研究接棒——"在 MedMNIST 上验证"成为医学影像课程作业与快速原型的事实协议。
- 2023-2024:方法学论文接棒——联邦学习(18 子集 = 18 个异构客户端)、持续学习(任务序列)、不确定性量化与校准(小样本子集)把 MedMNIST 当"标准方法学实验床"。
- 2024 之后:基础模型评测接棒——MedMNIST+ 的 224 档与多模态矩阵切中"医学视觉基础模型跨域泛化"的评测需求(官方定位语:“a standardized benchmark for medical foundation models”)。
引用构成上,除医学影像分析主线外,大量来自"方法学"论文——MedMNIST 提供的"多域、多任务、轻量"组合使其成为方法学论文的标准实验床。v1 ISBI 2021 论文则奠定了 “Classification Decathlon”(分类十项全能)的叙事——与分割领域的 Medical Segmentation Decathlon 呼应。
7.2 MedMNIST+ 与医学基础模型时代
2024-01-17 官宣(GitHub README Update 原文)的 MedMNIST+ 把定位从"轻量 AutoML 基准"升级为"a standardized benchmark for medical foundation models"。逻辑很直接:基础模型(vision transformer、医学预训练大模型)评估需要标准化、多模态、多任务的中等分辨率数据——224×224 恰好是 ImageNet 预训练模型的输入原生尺寸,18 个域 × 4 种任务 × 5 种分辨率的组合矩阵让"模型在哪个模态、哪个任务上泛化好"变成可系统测量的问题。API 层 size=64/128/224 一个参数的切换设计,让旧代码零改动升级。
7.3 教育用途:被低估的主战场
四项官方 Key Features 中有一项就是 “Educational”:CC 许可 + 无背景要求(“no background knowledge is required for users”——不需要懂 DICOM、不需要懂窗宽窗位)+ 28 像素的即时可视化。官网明确欢迎教学场景。在中文教学语境中,MedMNIST 是少数"一个周末就能跑通、还能讲清四类分类任务差异"的医学数据集——这也是它对本库"AI-Ready 光谱"的独特贡献:就绪度最高的那一级台阶。
五个课堂即用的教学实验设计(按学期进度排列):
- 第 1 课·管线验证:BloodMNIST + 小 CNN → 复现 AUC 0.998——学会"饱和集当金丝雀"的工程习惯。
- 第 2 课·任务差异:同一模型分别跑 PneumoniaMNIST(binary)与 RetinaMNIST(ordinal)→ 直观理解任务类型决定评估口径。
- 第 3 课·数据量 vs 性能:从 PathMNIST(107K)到 BreastMNIST(780)画学习曲线 → 触摸"规模两个数量级"的设计意图。
- 第 4 课·跨模态泛化:在 Organ 三切面(A/C/S)上训练-互测 → 体会"同病人不同视角"的分布漂移。
- 第 5 课·分辨率消融:MedMNIST+ 的某子集 28/64/128/224 四档 → 亲手验证"224 未必更好"(§5.2 规律三)。
每个实验都在 CPU 笔记本上 30 分钟内出结果——这是"MNIST 化"在教育场景的全部意义。
7.4 与其他轻量基准的对照
| 维度 | MedMNIST | 经典 MNIST | ImageNet 医学子集 | 全分辨率医学数据集 |
|---|---|---|---|---|
| 尺寸 | 28–224 可选 | 28 | 224 | 原始(512²–gigapixel) |
| 模态数 | 9 类/18 子集 | 1(手写数字) | 1–2 | 逐集单模态 |
| 任务类型 | 4 种 | 1(10 类) | 多为单分类 | 分割/检测/分类混杂 |
| 下载体积 | 0.3 MB–46 GB | ~11 MB | 数十 GB | 数十 GB–数 TB |
| 许可 | CC BY 4.0(1 例外 CC BY-NC) | MIT 类 | 混杂 | 逐集各异 |
| 临床语义密度 | 低–中 | 无 | 中 | 高 |
MedMNIST 的生态位是这张表的第一列:它不以临床语义密度取胜,而以"模态×任务×分辨率"的组合覆盖与获取摩擦的最小化取胜。
7.5 引用生态的四种典型用法
检索 Google Scholar 上千次引用的构成,MedMNIST 在文献中的角色可归为四类,各有正确的引用姿势:
- 作为实验场(“we evaluate on MedMNIST”):必须报版本(v2/v2.1/v2.2.4/+)、所用子集全集或子名单、以及源数据引用——漏源引用是审稿意见常客。
- 作为教学案例(课程/教程/博客):引用 v1+v2 论文即可,但注意 2022 年前的教程可能还在讲 10 子集的 v1(Organ 三切面旧文件名)。
- 作为"数据集设计"的对标物:讨论"如何构建医学基准"的论文常以 MedMNIST 的四层标准化(尺寸/划分/任务/模态)为参照系,同时引用其"NOT for clinical use"边界声明作为轻量化的诚实示范。
- 作为基础模型评测协议(2024 后):配合 MedMNIST+ 使用时注明"多尺寸"引用 Zenodo v3.0 record(10519652)而非 v2.1 record。
7.6 与库内"医学问答与基准"标签条目的横向对照
| 条目 | 类型 | 基准定位 | 与 MedMNIST 的差异 |
|---|---|---|---|
| medmnist(本条目) | 影像分类集合 | 轻量、多模态、四任务 | — |
| 挑战赛影像条目(camelyon16 等) | 单任务竞技 | 原始分辨率、排名制 | 深度 vs 广度 |
| 医学问答/考试类条目 | 文本基准 | 知识评测 | 模态完全不同,可组合使用 |
对使用者而言,"MedMNIST + 库内源条目"的组合才能覆盖完整工作流:MedMNIST 上完成原型与消融,回源条目上验证临床语义——这也是本条目把 10 个互链 rid 放进附录 A 速查卡的原因。
7.7 国内使用者的获取注意项
在大陆网络环境下(HuggingFace 直连受阻、Zenodo 大文件不稳),三条实操建议:
- 首选 PyPI 路径:
pip install medmnist走 PyPI 国内镜像没有障碍;数据自动下载目标源为 Zenodo,必要时配置代理或用镜像站。28 版单文件最大 205.6 MB,直连通常可行。 - 镜像站对照:若走 HF 镜像(如 hf-mirror.com)上的第三方转载,下载后必须用 Zenodo 官方 MD5 清单逐文件校验(坑 11)——不同转载的版本可能停在 v2.1 或 v2.2.4 前,数字对不上多半是这里。
- 大尺寸按需取档:MedMNIST+ 的 46.1 GB 全量在国内下载成本高,强烈建议按子集/按尺寸取用;octmnist_224.npz(约 4.0 GB)这类单文件建议断点续传工具。
§8 与库内条目的关系
8.1 分工声明
本库没有 MedMNIST 的单子集条目(数据库查重 url_name ILIKE ‘%medmnist%’ 返回 0 行,writing/ 目录亦无 breastmnist/bloodmnist 等子集条目),因此本条目以总集身份一次覆盖 18 个子集。与库内源数据条目的分工原则:源条目管原始分辨率与临床语义,本条目管轻量派生与跨模态基准。使用者研究 BUSI 的全分辨率超声图像走 busi(539),研究"BUSI 在 28×28 下的可分类性"走本条目的 BreastMNIST。
与库内标签体系的三组具体边界:
- 乳腺影像组(busi(539)、inbreast、cbis-ddsm、vindr-mammo 等):库内乳腺条目主打全分辨率诊断级图像(BI-RADS、钙化、分割掩码);MedMNIST 的 BreastMNIST 只是其 780 张 28×28 的"教学镜像",三分类信息还少了一类(normal/benign 合并)。乳腺临床研究一概走源条目。
- 皮肤影像组(isic-2018(710)、isic-2019、isic-2020、BCN20000、MED-NODE、PH2 等):DermaMNIST 的 7 类标签体系源自 HAM10000/ISIC 2018,但分辨率与元数据(解剖位置、年龄、性别的 demo 信息在源数据中可用)远逊源条目。
- 病理图像组(nct-crc-he-100k(148)、camelyon16(694)、panda、unitopatho 等):PathMNIST 是 NCT-CRC-HE-100K 的 28×28 化身;库内病理条目群保留 gigapixel WSI 或 128² patch,是计算病理学的正经战场。
一句话:MedMNIST 是这三大标签组的"公共入口与基准层",不与任何源条目竞争临床用途。
8.2 建议互链点(条目 + rid,均经数据库查实)
| 库内条目 | rid | 互链逻辑 | 方向 |
|---|---|---|---|
| nct-crc-he-100k | 148 | PathMNIST 的直接源数据(同一 Kather 团队 NCT-CRC-HE-100K) | 源 → 派生 |
| busi | 539 | BreastMNIST 的直接源数据 | 源 → 派生 |
| 3dircadb | 357 | Organ{A,C,S}MNIST/OrganMNIST3D 的多器官定位源之一 | 源 → 派生 |
| ribfrac | 451 | FractureMNIST3D 的直接源数据(RibFrac/FracNet) | 源 → 派生 |
| luna16 | 237 | NoduleMNIST3D 源 LIDC-IDRI 的著名预处理版(同源不同预处理) | 旁支互证 |
| isic-2018 | 710 | DermaMNIST 的源挑战赛(ISIC 2018 训练集并入) | 源 → 派生 |
| idrid | 191 | RetinaMNIST 同任务领域(眼底 DR 分级,DeepDRiD 为姊妹挑战) | 领域互链 |
| human-protein-atlas | 404 | TissueMNIST 同为显微镜细胞图像分类 | 领域互链 |
| drive | 241 | 视网膜眼底图像(RetinaMNIST 同模态) | 模态互链 |
| camelyon16 | 694 | 淋巴结病理图像分类(PathMNIST 同病理模态) | 模态互链 |
| camelyon16-17 | 33 | CAMELYON16/17 合并视图(淋巴结转移病理) | 同域病理互链 |
| panda-plus | —(本条目不引 rid) | 库内病理切片重点条目(金标准条目) | 同域病理互链 |
8.3 反向引用建议
库内上述源条目可在"派生生态"小节反向链接本条目,话术模板:“该数据集已被 MedMNIST 集合压缩为 28×28 轻量版作为教学/基准用途(见 medmnist 条目)”——注意反向引用时必须带上"轻量派生"定性,避免读者把两者当成同一数据集的两个入口。
8.4 尚无库内条目的子集源(补库线索)
18 个子集的源数据中有 8 个在库内暂无对应条目,列出以备后续派发选题(均经本条目写作时 DB 查重确认不存在):
| 缺失源 | 支撑的子集 | 候选 slug 建议 |
|---|---|---|
| NIH-ChestXray14(Wang CVPR 2017) | ChestMNIST | chestxray14 |
| Kermany OCT+胸片(Cell 2018,Mendeley rscbjbr9sj.3) | OCTMNIST、PneumoniaMNIST | kermany-oct(OCT 部分含 IEEE TAMBE’18 挑战背景) |
| DeepDRiD 挑战(ISBI 2020) | RetinaMNIST | deepdrid |
| Acevedo 血细胞集(Data in Brief 2020) | BloodMNIST | acevedo-blood(或 blood-cell-microscope) |
| BBBC051(Broad) | TissueMNIST | bbbc051 |
| LIDC-IDRI 原始版 | NoduleMNIST3D | lidc-idri(库内已有 luna16 为其预处理版) |
| IntrA(CVPR 2020) | VesselMNIST3D | intra |
| MitoEM(MICCAI 2020) | SynapseMNIST3D 同源体积 | mitoem |
补库优先级建议:NIH-ChestXray14(ChestMNIST 直接源 + 14 标签文本挖掘标签体系的学术史价值)与 Kermany Cell 2018 数据(同时支撑 OCTMNIST/PneumoniaMNIST 两子集 + "AI 诊断视网膜疾病"里程碑论文)优先级最高;BBBC051 与 MitoEM 属"小众但精确"的补全。
§9 检索者坑点清单
本清单是全文的"防御性摘要":12 个坑点全部来自三源核验中实际撞到的口径冲突或官方文档的易误读处,每条按"坑在哪 → 证据在哪 → 怎么规避"书写。写作时遵循一条纪律——只收有据可查的坑,不收推测;任何在核验中无法闭环的疑点都放进了 FACTS.md 第 9 节"待核"而非本清单。引用本条目数据前,建议至少通读坑 1、坑 2、坑 3(数字口径与许可是最高频引用事故点)。
以下 12 个坑点全部经三源核验(官网 medmnist.com / PMC9852451 论文全文 / Zenodo 记录与 GitHub release notes),每条给出证据位置。
坑 1:3D 总数有三个历史口径——10,214 / 9,998 / 9,996
Zenodo v2.0 描述写"10,214 3D images";论文摘要(2023-01-19)写"9,998";官网现行表格加总 9,996。差额完全闭环:v2.1 修复 NoduleMNIST3D 文件错误(−216),v2.2.4 移除 OrganMNIST3D 与 VesselMNIST3D 各 1 张空白样本(−2)。引用样本数必须注明版本;10,214 是修复前口径,任何与论文表格的对比都应以 9,998/9,996 为准。
坑 2:2D 总数论文与官网差 107 张
论文摘要 708,069 vs 官网现行 12 个 2D 子集表格加总 707,962。差额全在 Organ 三系列:OrganAMNIST 58,850→58,830(−20)、OrganCMNIST 23,660→23,583(−77)、OrganSMNIST 25,221→25,211(−10)——v2.2.4 “Removed a small number of mistakenly included blank samples”。写论文引 708,069 时注明"v2.2.4 前口径";做逐子集实验时以当前下载版本的 train/val/test 形状为准。
坑 3:DermaMNIST 的许可变过版本
GitHub release notes 明确 v2.2.3 “DermaMNIST license to CC BY-NC 4.0”(源 HAM10000 为 CC BY-NC-SA 4.0)。更早的 v1 时代 Zenodo 页面写"每子集继承源数据许可"口径。旧资料里"MedMNIST 全系列 CC BY 4.0"的说法在 v2.2.3(2023-04)之后不再成立。商用项目打包分发前必须把 DermaMNIST 剔除或单独授权。
坑 4:v1 与 v2 的 Organ 子集名不通用
v1 文件名 organmnist_axial.npz / organmnist_coronal.npz / organmnist_sagittal.npz(Zenodo 4269852 实抓);v2 改名 OrganAMNIST / OrganCMNIST / OrganSMNIST(npz 名 organamnist.npz 等)。老教程、旧博客与 v1 era 代码用旧名,直接在 v2 API 下会 import 失败。检索"organmnist_axial"命中的是 2020-2021 年资料,属正常现象。
坑 5:两个胸片子集来源完全不同
PneumoniaMNIST 的源是 Kermany 团队(Cell 2018)的儿科胸片子集(5,856 张);ChestMNIST 的源是 NIH-ChestXray14(Wang et al. CVPR 2017,成人,文本挖掘 14 标签)。两者在患者人群、标注方式、标签体系上零重叠——"MedMNIST 里两个胸片数据集"不是同源数据的两种切法,而是两个独立数据集。把 PneumoniaMNIST 当成 ChestXray14 的肺炎子集是最常见的科普级错误。
坑 6:ChestMNIST 的 14 标签是文本挖掘产物
源 NIH-ChestXray14 的疾病标签由 NLP 从放射报告中自动挖掘,非人工逐图确认——源噪声全部透传。官方基准 ChestMNIST AUC 天花板 ~0.78(远低于其他子集的 0.9+)部分即源于此。在其上训练的分类器不应被解读为"影像诊断性能"。
坑 7:BreastMNIST 的正负类定义与临床直觉相反
论文 Details 段原文:“combining normal and benign as positive and classifying them against malignant as negative”——normal+benign 为 positive、malignant 为 negative。这与临床惯例(恶性为 positive)相反,套用敏感性/特异性术语时会完全搞反方向。引用该子集的混淆矩阵类指标前必须核对论文原文口径。
坑 8:TissueMNIST 的源编号与图像物理形态易错
源数据是 BBBC051(Broad Bioimage Benchmark Collection 编号 051),不是相近编号的其他 BBBC 子集;且源图是 32×32×7 的 z-stack(7 层三维堆栈),MedMNIST 取 axial 最大投影压成 2D——它本质是"3D 信息的 2D 投影",做"3D 细胞结构"研究不可用此子集。另外引用论文时注意 Scientific Data 的 “41” 是 article number(Sci Data 2023;10:41),不是页码也不是期号。
坑 9:PyPI v3.0.0–v3.0.1 的 Evaluator 有 size_flag bug
GitHub release notes 原文:“v3.0.2: Bug fixed in Evaluator (size_flag)”——即 MedMNIST+ 刚发布(v3.0.0/v3.0.1)期间,多尺寸评估路径存在缺陷。用大尺寸版本跑评测并引用 2024 年上半年数字时,先确认所用包版本 ≥3.0.2;用旧版本得出的多尺寸基准数字与官方表不可比。
坑 10:v3.0 record 里的 28 版文件是"清洗后"版本,MD5 已变
想在 v3.0 record(10519652)下只下 28 版的用户注意:这里的 organcmnist.npz(MD5 b9ceb954…)与 v2.1 record(6496656)的同名文件(MD5 0afa5834…)不是同一文件——v2.2.4 的空白样本清理同样作用于 28 版。跨版本核对完整性一律先对 MD5,不要假设同名文件同内容。
坑 11:HuggingFace 等第三方镜像非官方
官网 Disclaimer 原文只认 Zenodo 为唯一官方分发。HF 上的 MedMNIST 转载(常见于国内访问场景)无法保证与官方版本同步——引用"从 HF 下载的 MedMNIST"做实验时,务必用 MD5 对回 Zenodo 官方清单,并说明版本。
坑 12:把"基准成绩"当"临床性能"引用
官方基准 ChestMNIST AUC 0.778、FractureMNIST3D AUC 0.750 这类数字只能在"28×28 MNIST 化输入"的前提下解读;任何"AI 读胸片达到 XX 水平"的临床表述若引用的是 MedMNIST 数字,都属于错位引用——28 像素版本与源数据的临床性能没有可传递性(官方每一处入口都挂着 NOT for clinical use 声明)。
坑点溯源速查(12 个坑点 × 一句话证据):
| 坑 | 一句话证据 | 证据位置 |
|---|---|---|
| 1 | “10,214”(v2.0)→“9,998”(论文)→“9,996”(现行表) | Zenodo 6496656 / PMC9852451 / medmnist.com |
| 2 | Organ 三系列 58,850/23,660/25,221 → 58,830/23,583/25,211 | PMC Table 1 vs 官网现行表 |
| 3 | release notes “v2.2.3: DermaMNIST license to CC BY-NC 4.0” | GitHub MedMNIST/MedMNIST |
| 4 | v1 文件名 organmnist_axial/coronal/sagittal | Zenodo 4269852 文件清单 |
| 5 | PneumoniaMNIST 引文 22/23 与 ChestMNIST 引文 18 | PMC9852451 Details 段 |
| 6 | “text-mined 14 disease labels”(论文原文) | PMC9852451 ChestMNIST 段 |
| 7 | “combining normal and benign as positive…”(论文原文) | PMC9852451 BreastMNIST 段 |
| 8 | “We use the BBBC051 … 32×32×7”(论文原文) | PMC9852451 TissueMNIST 段 |
| 9 | “v3.0.2: Bug fixed in Evaluator (size_flag)” | GitHub release notes |
| 10 | organcmnist.npz 两个 MD5 值 | Zenodo 6496656 vs 10519652 |
| 11 | “The only official distribution link … is Zenodo” | medmnist.com Disclaimer |
| 12 | “NOT intended for clinical use”(官网/论文/Zenodo 三处) | 全部来源 |
§10 速查卡与使用决策
10.1 一分钟上手
pip install medmnist
from medmnist import INFO, Evaluator, PathMNIST
# 查元信息
print(INFO["pathmnist"]["task"]) # "multi-class"
print(INFO["chestmnist"]["label"]) # 14 标签语义
# 28 标准版
train = PathMNIST(split="train", download=True)
# MedMNIST+ 大尺寸
train_224 = PathMNIST(split="train", download=True, size=224)
# 查元信息与标准评估
from medmnist import INFO
print(INFO["pathmnist"]["task"]) # 'multi-class'
print(len(INFO)) # 18
# Evaluator:官方基准的 AUC/ACC 口径
from medmnist import Evaluator
# evaluator = Evaluator('pathmnist', 'pathmnist_28') # 详见包内文档
10.2 子集选择决策树
你的目的是什么?
├── 教学演示 / 第一个医学 AI 模型
│ └── BloodMNIST(饱和、快)或 PathMNIST(大、经典)
├── AutoML / 轻量模型对比
│ └── 全 18 子集 Decathlon 协议(v1 论文口径)
├── 多标签学习研究
│ └── ChestMNIST(唯一多标签;记得 per-label AUC)
├── 有序回归研究
│ └── RetinaMNIST(唯一有序任务;样本仅 1,600)
├── 3D 卷积 / ACS 策略研究
│ └── OrganMNIST3D(饱和)+ FractureMNIST3D(最难)组合
├── 形状/几何深度学习
│ └── VesselMNIST3D(体素化 mesh)
├── 跨模态泛化 / 基础模型评测
│ └── MedMNIST+ 全尺寸(64/128/224/64³)
└── 临床语义研究
└── 不要用 MedMNIST——回库内源条目拿原始数据
10.3 引用清单(官方要求逐项引用)
@article{medmnistv2,
title={MedMNIST v2-A large-scale lightweight benchmark for 2D and 3D biomedical image classification},
author={Yang, Jiancheng and Shi, Rui and Wei, Donglai and Liu, Zequan and Zhao, Lin and Ke, Bilian and Pfister, Hanspeter and Ni, Bingbing},
journal={Scientific Data}, volume={10}, number={1}, pages={41}, year={2023}
}
@inproceedings{medmnistv1,
title={MedMNIST Classification Decathlon: A Lightweight AutoML Benchmark for Medical Image Analysis},
author={Yang, Jiancheng and Shi, Rui and Ni, Bingbing},
booktitle={IEEE 18th International Symposium on Biomedical Imaging (ISBI)},
pages={191--195}, year={2021}
}
外加所用子集的源数据论文(官网 Facts 页或 medmnist.com/assets/v2/medmnist.bib 逐子集列出)。
引用三注意:
- 两个 DOI 都要出现在参考文献里(Sci Data 与 ISBI 缺一不可),只引其一会被官方视为不完整引用。
- 报告实验所用数据版本——"MedMNIST v2 (Zenodo 6496656, 2022)"或"MedMNIST+ (Zenodo 10519652, 2024)"级别的精度,配合 §3.5 的三条指纹。
- 源数据论文按子集逐个引,不要用"and references therein"一笔带过——官网 bib 文件就是为此准备的。
10.4 五个高频 FAQ
FAQ 1:下载时 URL 写什么?
官方唯一入口 doi.org/10.5281/zenodo.10519652(46.1 GB,v3.0);只要 28 版就点进"Files"按需下 18 个 npz(共 705.8 MB),或者干脆 pip install medmnist 让它自己下。
FAQ 2:npz 怎么读?
numpy.load("pathmnist.npz") 后取 ["train_images"] 等六个键;不想碰 NumPy 的直接用 PyTorch Dataset 封装(from medmnist import PathMNIST)。
FAQ 3:标签值怎么对应疾病名?
包内 medmnist.INFO 字典或 info.py 源码有每个子集的标签语义映射(如 PathMNIST 的 9 类组织名、ChestMNIST 的 14 病名)。
FAQ 4:能用它做分割/检测吗?
不能——MedMNIST 只有分类标签,没有像素级/框级标注。分割需求回源数据集(如库内 camelyon16、ribfrac、busi 等条目均有分割标注)。
FAQ 5:引用时写"MedMNIST"还是"MedMNIST v2"?
数据与论文都指 v2(2023);若工作流基于 ISBI’21 的 10 子集 Decathlon 协议则引 v1。官方要求两篇都引,正文可统称 MedMNIST、脚注给全两个 DOI(10.1038/s41597-022-01721-8 与 10.1109/ISBI48211.2021.9434062)。
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | medmnist |
| url_name | medmnist |
| 类型 | 数据集集合(12 个 2D + 6 个 3D)+ 基准 |
| 论文 | Sci Data 2023;10:41(v2)+ ISBI 2021 pp.191–195(v1) |
| 团队 | 上海交大(通讯 Bingbing Ni)+ 哈佛/波士顿学院/亚琛/中山医院 |
| 规模 | 708,069 张 2D + 9,998 张 3D(论文口径);现行 707,962 + 9,996(三源对照见附录 A2) |
| 尺寸 | 28 起步;MedMNIST+ 增 64/128/224(2D)与 64³(3D) |
| 许可 | CC BY 4.0(DermaMNIST CC BY-NC 4.0);代码 Apache-2.0 |
| 获取 | Zenodo 10519652(唯一官方分发);pip install medmnist |
| 抓取时点 | 2026-09-28 |
| 双零自检 | check_md.py PASS / preflight_check.py ERROR 0 WARN 0 |
| 坑点数 | 12(§9,全部有证据落点) |
| 库内互链 | nct-crc-he-100k(148)/busi(539)/3dircadb(357)/ribfrac(451)/luna16(237)/isic-2018(710)/idrid(191)/human-protein-atlas(404)/drive(241)/camelyon16(694) |
附录 A2:三源数字对照总表(论文 / Zenodo / 官网现行)
把散落在 §9 的数字漂移收拢成一张"引用前必查"表:
| 数字项 | 论文(PMC9852451,2023) | Zenodo v2.1(6496656) | 官网现行(2026-09-28 抓取) | 引用建议 |
|---|---|---|---|---|
| 2D 总数 | 708,069 | (描述同论文 708,069) | 707,962(表格加总) | 注"论文口径"或"现行口径" |
| 3D 总数 | 9,998 | 10,214(v2.0 描述残留) | 9,996(表格加总) | 以论文 9,998 或现行 9,996 |
| OrganAMNIST | 58,850 | 同论文 | 58,830 | 实验用现行 |
| OrganCMNIST | 23,660 | 同论文 | 23,583 | 实验用现行 |
| OrganSMNIST | 25,221 | 同论文 | 25,211 | 实验用现行 |
| OrganMNIST3D | 1,743 | 同论文 | 1,742 | 实验用现行 |
| VesselMNIST3D | 1,909 | 同论文 | 1,908 | 实验用现行 |
| NoduleMNIST3D | 1,633(v2.1 修复后) | 1,849(v2.0 修复前) | 1,633 | 一律用 1,633 |
| 文件总大小(28 版) | — | 705.8 MB | 官网挂 46.1 GB(v3.0 全量) | 区分"28 版"与"全量" |
| 漂移归因 | — | v2.1 修复 NoduleMNIST3D(−216) | v2.2.4 清洗空白样本(−107 2D、−2 3D) | — |
漂移时间线示意(一张图记住谁在哪一步变了):
2022-03 v2.0 发布 3D = 10,214 ── 2D = 708,069
2022-04 v2.1 修 Nodule 3D = 9,998 ──(−216,nodulemnist3d.npz 文件错误)
2022 下 v2.2 清空白样本 3D = 9,996 ── 2D = 707,962(−2 / −107)
2023-01 论文发表 论文沿用修复后口径 9,998 / 708,069
2024-01 v3.0 MedMNIST+ 全部沿用清洗后版本(28 版文件 MD5 已更新)
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 9 | 独立官网+Zenodo DOI 链+PyPI+GitHub 四重入口;论文开放获取;名称唯一性高 |
| A 可获取性 | 10 | 无注册、无申请、无墙:pip 一行自动下载,Zenodo 直链;28 版仅 705.8 MB |
| I 可互操作 | 9 | npz+uint8 十年不变、PyTorch Dataset 标准封装、多尺寸同名 API;格式极简到无 DICOM 依赖 |
| M 元数据质量 | 8 | 论文表格+官网 Facts 页+bib 文件三层完备;扣分项:版本间数字漂移(坑 1/2)需使用者自查版本 |
| S 可持续性 | 8 | Zenodo 固定 DOI+官方"唯一分发"声明+格式十年兼容;扣分项:大尺寸版本仅存在 Zenodo 单点 |
| 综合评级 | 8.8/10(AI-Ready 标杆) | "轻量派生数据集"光谱上就绪度的天花板;短板仅在临床语义密度,而这正是设计使然 |
附录 C:逐项证据链自证
| 关键数字/事实 | 来源 | 位置 |
|---|---|---|
| 18 数据集(12 2D + 6 3D) | 官网首页/论文摘要/Zenodo 描述三源一致 | medmnist.com;PMC9852451 摘要 |
| 708,069 2D / 9,998 3D(论文口径) | 论文摘要 | PMC9852451(PubMed PMID 36658144) |
| 10,214 3D(v2.0 口径) | Zenodo v2.1 record 描述原文 | zenodo.org/records/6496656 |
| 2D 表格加总 707,962(现行) | 官网 MedMNIST2D 表 + python 加总验证 | medmnist.com(2026-09-28 抓取) |
| Organ 系列差值 −20/−77/−10 | 论文 Table 1(58,850/23,660/25,221)vs 官网现行表 | PMC9852451 Table 1;medmnist.com |
| 18 个 npz 文件名/大小/MD5 | Zenodo Files 清单 | zenodo.org/records/6496656(705.8 MB);/records/10519652(46.1 GB) |
| v1 = 10 个 2D npz(含 organmnist_axial 等) | Zenodo v1.0 record 文件列表实抓 | zenodo.org/records/4269852 |
| npz 6 键/uint8/形状规范 | 论文 Data Records 段原文 | PMC9852451 |
| license(CC BY 4.0;DermaMNIST 例外) | Zenodo 描述 + GitHub README + release notes v2.2.3 | zenodo.org/records/6496656;github.com/MedMNIST/MedMNIST |
| PyPI 版本链至 v3.0.2(2024-09-16) | GitHub Release Notes | github.com/MedMNIST/MedMNIST |
| MedMNIST+ 发布 2024-01-16/17 | Zenodo v3.0 record 日期 + GitHub README Update | zenodo.org/records/10519652 |
| AdrenalMNIST3D 中山医院自采/不给源 CT | 论文 Details 段原文 | PMC9852451 |
| SynapseMNIST3D MitoEM 同源体积 | 论文 Details 段(引 MitoEM,MICCAI 2020) | PMC9852451 |
| 各子集基准 AUC/ACC | 官网 Benchmarking 表逐字 | medmnist.com |
| 被引 1662 次 | Google Scholar 引用计数 | scholar.google.com(2026-09-28) |
| 论文时间线 Received/Accepted/发表 | PMC XML history 字段 | PMC9852451(2021-11-29/2022-09-26/2023-01-19) |
附录 D:18 子集中文速查表
| 子集 | 中文一句话 | 任务 | 类数 | 样本数 |
|---|---|---|---|---|
| PathMNIST | 结肠病理 H&E 组织 9 分类 | 多分类 | 9 | 107,180 |
| ChestMNIST | 胸片 14 种疾病多标签 | 多标签 | 14 | 112,120 |
| DermaMNIST | 皮肤镜色素病变 7 分类 | 多分类 | 7 | 10,015 |
| OCTMNIST | 视网膜 OCT 4 类病变 | 多分类 | 4 | 109,309 |
| PneumoniaMNIST | 儿科胸片肺炎二分类 | 二分类 | 2 | 5,856 |
| RetinaMNIST | 眼底 DR 严重度 5 级 | 有序回归 | 5 | 1,600 |
| BreastMNIST | 乳腺超声良恶性二分类 | 二分类 | 2 | 780 |
| BloodMNIST | 外周血细胞 8 类识别 | 多分类 | 8 | 17,092 |
| TissueMNIST | 肾皮质细胞 8 类识别 | 多分类 | 8 | 236,386 |
| OrganAMNIST | 腹部 CT 轴位器官 11 分类 | 多分类 | 11 | 58,830 |
| OrganCMNIST | 腹部 CT 冠状器官 11 分类 | 多分类 | 11 | 23,583 |
| OrganSMNIST | 腹部 CT 矢状器官 11 分类 | 多分类 | 11 | 25,211 |
| OrganMNIST3D | 腹部 CT 体数据器官 11 分类 | 多分类 | 11 | 1,742 |
| NoduleMNIST3D | 肺结节恶性二分类 | 二分类 | 2 | 1,633 |
| AdrenalMNIST3D | 肾上腺形状正常/占位 | 二分类 | 2 | 1,584 |
| FractureMNIST3D | 肋骨骨折 3 类型 | 多分类 | 3 | 1,370 |
| VesselMNIST3D | 脑血管段动脉瘤判别 | 二分类 | 2 | 1,908 |
| SynapseMNIST3D | 电镜突触兴奋/抑制 | 二分类 | 2 | 1,759 |
附录 E:术语对照
| 术语 | 英文/原文 | 说明 |
|---|---|---|
| MNIST 化 | MNIST-like standardization | 压缩到 28×28/28³ 并配标准划分的统一化处理 |
| 分类十项全能 | Classification Decathlon | v1 提出的"10 子集全套评测"叙事,呼应分割领域 MSD |
| 有序回归 | ordinal regression | 标签有天然等级(DR 0-4 级),不能当普通多分类 |
| 多标签 | multi-label | 一图多病(ChestMNIST 14 标签),标签向量 N×14 |
| ACS 卷积 | axial-coronal-sagittal conv | 用三个 2D 卷积处理三个正交平面的 3D 高效策略 |
| 2.5D | 2.5D strategy | 取 3D 体数据的中央切片当 2D 图的降维用法 |
| 体素化 | voxelization | mesh→体素栅格(VesselMNIST3D 的 28³ 化路径) |
| 空白样本 | blank samples | v2.2.4 移除的全黑/无信息图(2D 107 张、3D 2 张) |
| 再分发许可 | re-distribution permission | 团队就 CC BY-NC 源向原作者取得的总许可声明 |
| 最大投影 | maximum projection | z-stack 沿轴取最大值压平(TissueMNIST 的 3D→2D 路径) |
附录 F:来源 URL 总表(2026-09-28 抓取)
| 来源 | URL | 用于 |
|---|---|---|
| 官网首页(含 18 子集表、Benchmarking 表、许可、Facts) | https://medmnist.com/ | 硬数字主源 |
| 子集源数据 bibtex | https://medmnist.com/assets/v2/medmnist.bib | §6.2 源映射 |
| v2 论文(Sci Data 2023) | https://doi.org/10.1038/s41597-022-01721-8 | https://pubmed.ncbi.nlm.nih.gov/36658144/ | PMC9852451 | 摘要数字、时间线、Details 段 |
| v1 论文(ISBI 2021) | https://doi.org/10.1109/ISBI48211.2021.9434062 | 版本链 |
| v2 preprint / v1 preprint | https://arxiv.org/abs/2110.14795 | https://arxiv.org/abs/2010.14925 | 时间线 |
| Zenodo v1.0(10 个 2D npz 清单) | https://zenodo.org/records/4269852 | v1 档案 |
| Zenodo v2.1(18 npz 清单、705.8 MB、changelog) | https://zenodo.org/records/6496656 | 文件/MD5/版本链 |
| Zenodo v3.0 MedMNIST+(46.1 GB、大尺寸清单) | https://zenodo.org/records/10519652 | MedMNIST+ 档案 |
| Zenodo v2.0(历史版本) | https://doi.org/10.5281/zenodo.5208230 | 10,214 口径存照 |
| GitHub 仓库(release notes、README、API) | https://github.com/MedMNIST/MedMNIST | PyPI 版本链、MedMNIST+ 宣告 |
| NCT-CRC-HE-100K(PathMNIST 源) | Kather, Halama, Marx. “100,000 histological images of human colorectal cancer and healthy tissue.” Zenodo, 2018(论文引文 17) | §6.2 |
| HAM10000(DermaMNIST 源) | Tschandl et al. Sci Data 2018(doi:10.1038/sdata.2018.161) | §6.2 |
| LIDC-IDRI(NoduleMNIST3D 源) | Armato et al. Medical Physics 2011(doi:10.1118/1.3528204) | §6.2 |
| RibFrac/FracNet(FractureMNIST3D 源) | Jin et al. EBioMedicine 2020(doi:10.1016/j.ebiom.2020.103106) | §6.2 |
| DeepDRiD 挑战(RetinaMNIST 源) | https://isbi.deepdr.org/data.html | §6.2 |
| Kermany OCT+胸片(OCT/Pneumonia 源) | doi:10.1016/j.cell.2018.02.010 | Mendeley rscbjbr9sj.3 | §6.2 |
| Acevedo 血细胞(BloodMNIST 源) | doi:10.1016/j.dib.2020.105474 | §6.2 |
| BBBC051(TissueMNIST 源) | Woloshuk et al. Cytometry A 2020 | broadinstitute.org/bbbc/BBBC051 | §6.2 |
| IntrA(VesselMNIST3D 源) | Yang et al. CVPR 2020 | §6.2 |
| MitoEM(SynapseMNIST3D 同源) | Wei et al. MICCAI 2020 | §6.2 |
| 被引计数 | scholar.google.com(v2 条目) | §7.1 |
附录 G:18 子集关键属性总矩阵(一表备查)
| 子集 | 通道 | 划分法 | 预处理路径 | 许可 | 自采? | 官方最佳 AUC(方法) |
|---|---|---|---|---|---|---|
| PathMNIST | RGB | 源 9:1 + 源 test | 直接缩放 | CC BY 4.0 | 否 | 0.990(ResNet-50 28) |
| ChestMNIST | 灰度 | 官方划分 | 直接缩放 | CC BY 4.0(源 CC0) | 否 | 0.778(Google AutoML) |
| DermaMNIST | RGB | 7:1:2 | 直接缩放 | CC BY-NC 4.0 | 否 | 0.920(ResNet-18 224) |
| OCTMNIST | 灰度 | 源 9:1 + 源 test | 短边中心裁剪 | CC BY 4.0 | 否 | 0.963(Google AutoML) |
| PneumoniaMNIST | 灰度 | 源 9:1 + 源 test | 短边中心裁剪 | CC BY 4.0 | 否 | 0.991(Google AutoML) |
| RetinaMNIST | RGB | 源 9:1 + 源 test | 短边中心裁剪 | CC BY 4.0 | 否 | 0.750(Google AutoML) |
| BreastMNIST | 灰度 | 7:1:2 | 直接缩放 | CC BY 4.0 | 否 | 0.919(Google AutoML) |
| BloodMNIST | RGB | 7:1:2 | 裁 200² 后缩放 | CC BY 4.0 | 否 | 0.998(并列) |
| TissueMNIST | 灰度 | 7:1:2 | z-stack 最大投影 | CC BY 4.0 | 否 | 0.998(ResNet-18 224) |
| OrganAMNIST | 灰度 | 扫描级 115/16/70 | 边界框+缩放 | CC BY 4.0 | 否 | 0.998(ResNet-18 224) |
| OrganCMNIST | 灰度 | 同上 | 同上 | CC BY 4.0 | 否 | 0.994(ResNet-18 224) |
| OrganSMNIST | 灰度 | 同上 | 同上 | CC BY 4.0 | 否 | 0.975(ResNet-50 224) |
| OrganMNIST3D | 灰度体 | 扫描级同上 | 3D 边界框+缩放 | CC BY 4.0 | 否 | 0.996(ResNet-18+3D) |
| NoduleMNIST3D | 灰度体 | 7:1:2 | 归一化+中心裁剪 | CC BY 4.0 | 否 | 0.914(auto-sklearn) |
| AdrenalMNIST3D | 形状体 | 7:1:2 | 形状掩码 | CC BY 4.0 | 是(中山医院) | 0.839(ResNet-18+ACS) |
| FractureMNIST3D | 灰度体 | 7:1:2 | 中心裁剪 | CC BY 4.0 | 否 | 0.750(ResNet-50+ACS) |
| VesselMNIST3D | 形状体 | 7:1:2 | mesh 修补+体素化 | CC BY 4.0 | 否 | 0.930(ResNet-18+ACS) |
| SynapseMNIST3D | 电镜体 | 7:1:2 | 体积裁剪缩放 | CC BY 4.0 | 是(团队自采) | 0.851(ResNet-50+3D) |
("官方最佳 AUC"取自官网 Benchmarking 表加粗值;28 版口径。)
附录 H:常见错误用法 Top 8(每条对应一个真实坑点)
| 错误用法 | 后果 | 规避 |
|---|---|---|
| 18 子集打包商用 | DermaMNIST CC BY-NC 侵权(坑 3) | 剔除或单独授权 |
| 引用"708,069/10,214"不注版本 | 与现行下载版本对不上(坑 1/2) | 注明论文口径或用现行 707,962/9,996 |
| 用 v1 旧名 organmnist_axial 调 v2 API | import 失败(坑 4) | 改用 OrganAMNIST |
| 把 PneumoniaMNIST 当 ChestXray14 子集 | 儿科/成人、标注方式全搞错(坑 5) | 记住两个胸片两来源 |
| 用整体 ACC 评价 ChestMNIST | 极端不平衡下虚高(坑 6) | per-label AUC |
| 混淆 BreastMNIST 正负类方向 | 敏感性/特异性完全说反(坑 7) | 以论文原文口径为准 |
| 用 TissueMNIST 做 3D 细胞研究 | z 轴信息已被投影抹掉(坑 8) | 回 BBBC051 用完整 stack |
| 引用 HF 镜像版本做对比实验 | 版本不同步、数字不可比(坑 11) | MD5 对回 Zenodo 清单 |
附录 I:库内互链双跳转表(本条目 ↔ 源条目)
| 工作流场景 | 先用 | 再用 | 理由 |
|---|---|---|---|
| 病理分类原型→深度实验 | medmnist(PathMNIST) | nct-crc-he-100k(148) | 28 像素跑通后回 128×128 patch |
| 乳腺超声教学→临床研究 | medmnist(BreastMNIST) | busi(539) | BUSI 三分类与原始分辨率在源条目 |
| 多器官切片实验 | medmnist(Organ 三兄弟) | 3dircadb(357) | 源 3D 体数据与更细标注 |
| 肋骨骨折消融→检测系统 | medmnist(FractureMNIST3D) | ribfrac(451) | 4 类完整标签与原分辨率 |
| 肺结节快速基线 | medmnist(NoduleMNIST3D) | luna16(237) | LUNA16 是同一权威源的标准预处理版 |
| 皮肤病变入门 | medmnist(DermaMNIST) | isic-2018(710) | ISIC 2018 挑战全量与元数据 |
| 眼底 DR 对比实验 | medmnist(RetinaMNIST) | idrid(191) | IDRiD 含分割+分级双任务 |
尾注
条目制作说明:本条目由写手代理 agent-b-medmnist 于 2026-09-28 按"三轮三源核验"流程成稿——官网 medmnist.com(首页/表格/Benchmarking/bib 文件实抓)、Nature Scientific Data 论文(PMID 36658144 / PMC9852451 全文 XML 实抓)、Zenodo 记录(4269852 / 6496656 / 10519652 实抓)与 GitHub 仓库(MedMNIST/MedMNIST,release notes 与 README)。全部硬数字在附录 C 逐项落点,版本漂移数字经 Python 加总验证闭环(坑 1/坑 2 的 −216/−107/−2 归因)。库内查重(url_name ILIKE ‘%medmnist%’)0 行,确认总集条目身份;10 个互链 record_id 均经数据库只读查询核验。
本条目为总集条目,覆盖 18 个子集;库内无单子集条目,与 10 个源数据/同领域条目(附录 A 互链清单)构成"源-派生"互链网络,8 个缺失源已列入 §8.4 补库线索。MedMNIST 是算法基准而非临床工具,官方"NOT intended for clinical use"声明适用于其全部子集与全部尺寸版本。
(本条目成稿于 agent-b-medmnist 租约期内,成稿时点 2026-09-28 23:20 前后;后续版本更新请以 Zenodo 官方记录为准。)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- brax — 共享标签:医学影像 / 图像分类 / CT / X光影像
- acevedo-blood — 共享标签:医学影像 / 图像分类 / 评测基准 / 病理图像
- bbbc051 — 共享标签:医学影像 / 图像分类 / 评测基准 / 病理图像
- covidx-cxr — 共享标签:医学影像 / 图像分类 / X光影像 / 评测基准
- hlca — 共享标签:医学影像 / X光影像 / 病理图像
- camelyon17 — 共享标签:医学影像 / 图像分类 / 评测基准 / 病理图像
- unitopatho — 共享标签:医学影像 / 图像分类 / 评测基准 / 病理图像
- dental-opg-xray — 共享标签:医学影像 / 图像分类 / X光影像 / 评测基准
- chexpert — 共享标签:医学影像 / 图像分类 / X光影像
- nih-chestx-ray14 — 共享标签:医学影像 / 图像分类 / X光影像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

