信息速览
INFOBOX — Acevedo 外周血细胞数据集一屏速览
维度 内容 本质 17,092 张正常外周血单细胞显微图像(非全涂片、非 WSI),360×363 px JPG RGB,每图单细胞居中 团队 Hospital Clinic de Barcelona(临床侧)+ 加泰罗尼亚理工 UPC(工程侧),六作者,通讯 José Rodellar 论文 Data in Brief 2020;30:105474(数据集论文,PMID 32346559)+ Comput Methods Programs Biomed 2019;180:105020(方法论文,PMID 31425939) 采集链 Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字采图(Core Laboratory) 类别 8 组 10 类型:中性粒/嗜酸/嗜碱/淋巴/单核/未成熟粒 IG(早幼粒·中幼粒·晚幼粒三子类)/幼红/血小板 规模 17,092 张:中性粒 3,329 / 嗜酸 3,117 / IG 2,895 / 血小板 2,348 / 幼红 1,551 / 单核 1,420 / 嗜碱 1,218 / 淋巴 1,214 标注 expert clinical pathologists(临床病理专家)复核确认;DM96 机器预分类打底 质控 供血者无感染、无血液病、无肿瘤、无相关药物治疗——纯正常血象 基准 官方 2019 CNN 最佳 96.2%;第三方 27 种微调 CNN 最高 99.32%(arXiv 2110.09508) 派生 BloodMNIST(MedMNIST v2 子集)即其 28×28 降采样派生版,官方 split 11,959/1,712/3,421 获取 Mendeley Data 免费公开直链(无需注册),单一版本 V1(2020-06-08) 许可 CC BY 4.0(DOI 10.17632/snkd93bnjr.1) 库内互链 medmnist(716)(实质派生关系)、herlev-pap(483)、sipakmed(490)、human-cell-atlas(319)、cellxgene(38)
Acevedo 外周血细胞数据集(文献中惯称 Acevedo dataset 或 PBC Dataset)是一个"把血常规科日常变成公开基准"的数据集:西班牙 Hospital Clinic de Barcelona 核心实验室(Core Laboratory)在 2015–2019 年间,从健康供血者的外周血涂片里,用 CellaVision DM96 数字形态学工作站采集了 17,092 张单个细胞的显微图像,经临床病理专家标注为 8 组正常血细胞类型,以 CC BY 4.0 在 Mendeley Data 公开。它是官方口径下"首个大样本正常外周血细胞公开集",也是轻量医学影像基准 BloodMNIST 的直接上游——你可能早就在 28×28 的 BloodMNIST 上跑过它,只是没见过它的原生 360×363 px 全貌。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——Mendeley Data 免费直链、CC BY 4.0,全程无注册 gate,这是库内可获取性最高的一档。
- 要写论文引用:直奔 §4 论文与时间线——数据集论文(Data in Brief 2020)与方法论文(CMPB 2019)各管一摊,Data DOI 引 Mendeley,别把 arXiv 编号张冠李戴(坑 1)。
- 想对标指标:直奔 §5 基准与评估——先问自己用哪个 split、哪个分辨率,再谈 96.2% 和 99.32% 能不能放同一张表里(坑 5)。
§0 导读:这个数据集解决什么问题
血细胞显微镜检查(外周血涂片镜检)是血液学最古老的人工智能战场:一个训练有素的检验医师看一张涂片要数百个细胞,而形态学识别恰恰是"规则写不清、人眼一眼准"的典型任务——中性粒细胞分叶几叶算正常、单核细胞和淋巴细胞核染色质怎么区分,这些知识长在专家脑子里,很难翻译成 if-else。2010 年代深度学习成熟后,缺的不再是方法而是数据:血细胞图像要么锁在商业系统(如 CellaVision 付费数据库)里,要么公开集规模太小(几百张),要么混入大量异常细胞导致任务不纯。
Acevedo 数据集的回答是把"正常血象"这一个场景做深:17,092 张、8 组 10 类型、每图单细胞居中、规格统一 360×363 px、专家标注、CC BY 4.0 全开放。官方在 Data in Brief 摘要里的自我定位是:“据我们所知,这是首个拥有大数量正常外周血细胞的公开集,期望成为模型基准的 canonical dataset(正典数据集)”。十年回看,这个期待基本兑现——它成了外周血细胞分类的默认起点,还通过 BloodMNIST 派生链进入了几乎所有轻量基准评测的必选清单。
§0 读法三则:
- 这个条目是"数据集+方法论文+派生基准"三合一叙事:本体是 17,092 张原生图像(Mendeley),方法论是 2019 CMPB 论文的 CNN 基准,派生品是 MedMNIST 生态的 BloodMNIST——三者分辨率、划分、许可语境各不相同(§5.6 统计卫生守则)。
- 全文硬数字均出自 Data in Brief 官方 Table 1(八类分布,合计恰 17,092)、两篇论文 PubMed 记录与 Mendeley 托管页;唯一撞见的"12,869 张"口径已在坑 3 存照并证伪。
- 检索时别盯着某个"官方数据集名"找——它没有注册商标式的专名,“Acevedo dataset”“PBC Dataset”“PBC_Acevedo”"peripheral blood cell dataset"都指向同一批数据(坑 4)。
§1 数据集速览:十问十答
Q1:17,092 张图从哪来?
西班牙 Hospital Clinic de Barcelona 核心实验室 2015–2019 年采集的健康供血者外周血涂片。供血者准入即质控:无感染性疾病、无血液病、无肿瘤病史、采血时无相关药物治疗——保证每张图都是"正常血象"。供血者精确人数论文未披露(遗留疑点,见 §10 坑 8 与事实清单)。
Q2:图像怎么采出来的?
三级设备链:Advia 2120 血液分析仪做全血计数与质控 → Sysmex SP1000i 自动推片染色机做 May-Grünwald-Giemsa(MGG)染色 → CellaVision DM96 数字形态学工作站逐细胞成像并裁剪。最终交付物是 360×363 像素 JPG(RGB),无滤波、无预处理、原样保存。
Q3:到底 8 类还是 10 类?
两种口径都对,看你怎么数。目录级是 8 组(groups):中性粒、嗜酸、嗜碱、淋巴、单核、未成熟粒(IG)、幼红、血小板;其中未成熟粒一组内部含早幼粒、中幼粒、晚幼粒三个子类——按"类型"数就是 10 种分 8 组。文献里"13 类白细胞"的说法是印象错误(坑 2),两篇官方论文均明写 eight classes/groups。
Q4:谁标注的,可靠吗?
CellaVision DM96 采集时输出机器预分类,临床病理专家(expert clinical pathologists,论文复数口径)复核确认。注意可靠性边界的诚实披露:论文未发布观察者间一致性系数,标注可信度背书来自专家临床资格而非量化一致性数据——这在同类数据集里是常态而非例外。
Q5:里面有白血病细胞吗?
没有。这是它与 Matek 骨髓数据集(21 类、含血液病形态)最本质的分野:Acevedo 数据集是纯正常血象集,连"感染与再生性贫血常见的反应性细胞"都只出现在论文配图示例里而非独立类目。想研究异常细胞识别,它帮不上忙(§7.3)。
Q6:有官方 train/test 划分吗?
原始发布(Mendeley V1)没有固定划分文件。2019 方法论文自用一套划分做基准,arXiv 2110.09508 的 27-CNN 评测用 64/24/12,BloodMNIST 派生链定义了 11,959/1,712/3,421——三套 split 各行其是,跨论文指标不可直接对标(坑 5,§5.6)。
Q7:性能上限多少?
官方 2019 基准最佳总体准确率 96.2%(微调 InceptionV3 一族);第三方把 27 种 CNN 全部微调后,最高 99.32%(Wide ResNet-50-2)、最低 98.39%(AlexNet)。到 99%+ 区间意味着固定口径下基准接近饱和,剩余错误集中在形态学最相近的类对上(§5.5)。
Q8:怎么拿到?什么许可?
Mendeley Data 托管页 https://data.mendeley.com/datasets/snkd93bnjr/1 免费公开下载,无需注册,CC BY 4.0——可商用、可衍生,唯一义务是署名(引用 Data in Brief 论文 + Data DOI 10.17632/snkd93bnjr.1)。单一版本 V1(2020-06-08 发布),至今无 .2 版本。
Q9:它和 BloodMNIST 什么关系?
直接派生:BloodMNIST 就是 MedMNIST v2 团队从本数据集降采样到 28×28 的轻量版,沿用全部 17,092 张、8 组标签,并定义了 11,959/1,712/3,421 的官方 split;MedMNIST+ 又补了 64/128/224 px 升级版。换句话说,你在 BloodMNIST 上的每张图都能溯源到 Mendeley 包里的原生 360×363 JPG。
Q10:为什么它对 AI-Ready 重要?
它是库内"可获取性光谱"最开放一档的样本:公开直链 + CC BY 4.0 + 无 gate + 类别目录即标签 + 规模适中(单卡可训)。它的短板同样典型——无 manifest 元数据、无固定 split、无患者级信息——这让它在"数据工程完备性"上留了改进空间,也让"从 BloodMNIST 回到原生 Acevedo"成为一堂现成的 AI-Ready 教学案例。
§2 数据构成与规格
2.1 规模总览:官方 Table 1 全分布
数据集的全部家底就是一张官方分布表(Data in Brief 2020,Table 1,合计恰 17,092):
| 组别(英文目录名) | 中文 | 张数 | 占比 |
|---|---|---|---|
| neutrophils | 中性粒细胞 | 3,329 | 19.48% |
| eosinophils | 嗜酸性粒细胞 | 3,117 | 18.24% |
| immature granulocytes (IG) | 未成熟粒细胞 | 2,895 | 16.94% |
| platelets (thrombocytes) | 血小板 | 2,348 | 13.74% |
| erythroblasts | 幼红细胞 | 1,551 | 9.07% |
| monocytes | 单核细胞 | 1,420 | 8.31% |
| basophils | 嗜碱性粒细胞 | 1,218 | 7.13% |
| lymphocytes | 淋巴细胞 | 1,214 | 7.10% |
| 合计 | — | 17,092 | 100% |
三个观察:
- 粒系压舱:中性粒 + 嗜酸 + 嗜碱 + 未成熟粒四组合计 10,559 张(61.8%),反映正常骨髓造血的粒系主导结构;分类任务的主要难度也集中在粒系内部(成熟中性粒 vs 三个未成熟阶段的边界)。
- 最少与最多差 2.7 倍:淋巴细胞 1,214 张 vs 中性粒细胞 3,329 张——这是一个"轻度不平衡"数据集,不是均匀构造的产物,MedMNIST+ 用 Shannon’s Equitability 0.96(三个 split 均 0.96)量化了这一点:接近平衡但保留真实血象的比例感。
- 没有"其他/垃圾"类:8 组全部是明确的形态学实体,无 Background、无 Ignore、无 Unknown——标注体系干净,代价是它对"图里不是这 8 种东西"的世界一无所知(闭集假设,§5.5)。
2.2 图像规格与粒度边界
| 属性 | 规格 |
|---|---|
| 图像尺寸 | 360 × 363 像素 |
| 格式 | JPG |
| 色彩 | RGB(MGG 染色原色) |
| 内容粒度 | 单细胞居中(每图一个细胞) |
| 后处理 | 无滤波、无预处理,原样保存 |
| 组织方式 | 按 8 个类别目录打包(目录名即标签) |
| 对应对象 | 外周血涂片(peripheral blood smear) |
粒度边界需要一屏讲清楚:这是单细胞图像集,不是全涂片图像集(更不是 WSI)。CellaVision DM96 的工作方式是把涂片视野数字化后定位白细胞、裁出单个细胞的方形视野——所以每张图天然自带"检测已完成"的假设。对使用者的三重含义:
- 细胞检测/定位任务不可训:数据集里没有"空视野"负样本,没有检测框标注,无法从这里学出"找到细胞"这一步。
- 场景级任务不可行:红细胞形态异常、涂片整体染色质量、血浆背景异常等 smear-level 信息在裁剪时被丢弃了大半。
- 类间像素域极窄:所有图都是"居中单细胞 + 淡色背景",模型要学的判别信号几乎全部来自细胞形态本身——这是它作为分类基准干净的原因,也是它做域泛化研究时脆弱的原因(§5.5)。
2.3 八组类别体系与"10 类型分 8 组"口径
8 组的形态学身份一句话版:
| 组 | 形态学要点(标注专家所依据的识别核心) |
|---|---|
| 中性粒细胞 neutrophils | 成熟粒细胞,分叶核(2–5 叶),细颗粒胞质;正常血象中占比最高的白细胞 |
| 嗜酸性粒细胞 eosinophils | 双叶核,粗大橙红色嗜酸颗粒,MGG 下辨识度最高的组之一 |
| 嗜碱性粒细胞 basophils | 双叶核被深紫蓝色嗜碱颗粒遮盖,数量最稀少的正常白细胞之一 |
| 淋巴细胞 lymphocytes | 圆核、染色质致密、少量清亮胞质(含大淋巴细胞形态谱) |
| 单核细胞 monocytes | 大细胞,核形不规则(肾形/马蹄形),灰蓝色丰富胞质 |
| 未成熟粒细胞 IG | 骨髓粒系前体细胞,正常外周血罕见;含早幼粒 promyelocytes、中幼粒 myelocytes、晚幼粒 metamyelocytes 三个子类 |
| 幼红细胞 erythroblasts | 有核红细胞前体,圆形深染核,正常外周血中不应大量出现 |
| 血小板 platelets | 体积最小的组分(thrombocytes 为同义词),无核碎片状 |
"8 组还是 10 类"的口径学:
- 目录级(8 组):数据包的 8 个文件夹、官方 Table 1 的 8 行、全部基准论文的 8 分类输出头——工程上一切以 8 为准。
- 类型级(10 类型):官方原文将 IG 组说明为"promyelocytes, myelocytes, and metamyelocytes"三个子型的合并,所以"10 种类型分 8 组(10 types organized in 8 groups)"是官方自己的表述。子类边界在目录级没有保留——你拿不到"这 2,895 张里哪张是中幼粒"的官方答案。
- 13 类从何而来:文献引用链里的讹误(可能是把"10 类型"再拆分加上误记的异常类目),两篇官方论文均无 13 类表述。任何以 13 类为口径的转引都应回溯到官方 8 组(坑 2)。
IG 组的存在是这个数据集最有临床味道的设计:正常健康人外周血里不该有可观数量的未成熟粒细胞,但这 2,895 张确实来自健康供血者——它们对应的是"感染与再生性贫血常见"的反应性改变谱系(论文配图标题原话:包括 those more frequently observed in infections and regenerative anaemias)。这让数据集在"纯正常"底色上多了一个向血液病初筛延伸的钩子。
2.4 采集设备链:从血管到像素
论文 Fig. 2 描绘的 Core Laboratory 日工作流,翻译成数据链路是三站:
供血者 EDTA 采血
│
▼
① Advia 2120(Siemens/Bayer 系全自动血液分析仪)
全血计数(CBC)+ 分类初筛 + 样本质控
│
▼
② Sysmex SP1000i(自动推片染色机)
机械推片 → May-Grünwald-Giemsa(MGG)标准染色
│
▼
③ CellaVision DM96(数字形态学工作站)
载台自动巡游 → 白细胞定位 → 360×363 px 视野裁剪
→ 机器预分类 → 专家复核 → 类别目录归档
三站各有数据学含义:
- Advia 2120 的角色是"守门员":它不产生数据集图像,但它的 CBC 数值是供血者"正常血象"资格的客观依据之一。这也是为什么把本数据集当作"CBC 仪器数据"是张冠李戴——它全程是显微镜形态学数据(坑 8)。
- SP1000i 的角色是"标准化器":自动推片+自动染色把 MGG 染色质量从"技师手艺"变成"机器规程",显著压低了染色批次差异这一显微图像最大的域漂移源。
- DM96 的角色是"采集+预标注"双肩挑:它是临床数字形态学的成熟商用系统(对血细胞做定位、裁剪与预分类),数据集直接复用这条临床在用流水线,而不是为研究另建一套——见 §9.1 的方法学讨论。
2.5 供血者质控:"正常血象"的操作性定义
论文摘要给出的准入排除标准是四条:无感染性疾病、无血液系统疾病、无肿瘤疾病、采血时无相关药物治疗。这四条构成"正常血象"的可操作定义——它不是"细胞看起来正常"的循环论证,而是供者层面的独立质控。
由此推出的使用边界:
- "正常"是供者维度而非细胞维度:IG 组 2,895 张正是健康人血里能见到的反应性未成熟粒——"健康供者的涂片"与"每张图都是教科书正常形态"是两回事。
- 年龄、性别、民族分布未披露:论文未给供者人口学统计表(遗留疑点之一),做人群分层研究时无法从这里出发。
- 供血者精确人数未知:只知道 2015–2019 四年间采集、随机 ID 匿名化。每人贡献多少张、有多少供者,全部不可考——这直接封死了患者级交叉验证(§5.6)。
2.6 与全涂片数据集的粒度光谱
把"血细胞图像数据集"按粒度排一条光谱,本数据集的位置一目了然:
| 粒度 | 代表 | 本数据集是否覆盖 |
|---|---|---|
| 全涂片 WSI(gigapixel) | Matek 骨髓集部分形态(扫描全片) | 否 |
| 多细胞视野 | Raabin-WBC 部分图像 | 否 |
| 单细胞裁剪(居中) | Acevedo 17,092 张(本条目) | 是(全部) |
| 更粗(patch 内多细胞) | — | 否 |
| 血常规数值表(CBC 表格) | MIMIC 等电子病历生态 | 否 |
单细胞粒度是血液数字形态学商用系统(DM96 一族)的天然输出,也因此是"细胞分类"任务最主流的粒度选择——但这意味着拿它做"细胞检测→分类"端到端研究时,必须另配检测数据或自标负样本。
2.7 八组逐类深度档案
§2.1 的分布表给出了"多少",本节给出"是什么、怎么认、难在哪"。每组按统一框架展开:形态学识别要点(标注专家所依据的特征)、MGG 染色下的视觉表现、临床关联、在本数据集内的角色与易混淆点。细胞直径等数值取自标准血液形态学教科书通识,供读图时参考;各组张数与占比均为官方 Table 1 口径(附录 E 速算表同源)。
2.7.1 中性粒细胞 neutrophils——3,329 张(19.48%)
- 识别要点:成熟粒系终末细胞,直径约 12–15 μm;标志性特征是分叶核(2–5 叶,以 3 叶居多),叶间以染色质细丝相连;染色质粗块状凝聚;胞质淡粉色,充满细小的中性(紫红色)颗粒。
- MGG 表现:胞质底色接近无色偏粉,颗粒细而不醒目——"认核不认质"是这一组的读图重心。
- 临床关联:细菌感染与炎症的首要应答细胞;核左移(杆状核增多)是感染/炎症的形态学信号,分叶过多则提示巨幼细胞性贫血或 B12/叶酸缺乏。
- 数据集内角色:占比最高的单一组,也是粒系"成熟锚点"——模型从这里学到的"成熟粒细胞长什么样",是判别 IG 组三个未成熟阶段的参照系。
- 易混淆:与 IG 组晚幼粒(metamyelocyte)——核形从肾形向分叶过渡是一个连续谱,固定阈值切割必然产生边界样本(§2.8 类对 1)。
2.7.2 嗜酸性粒细胞 eosinophils——3,117 张(18.24%)
- 识别要点:直径约 13–17 μm;核多为双叶("眼镜"状);胞质充满粗大、分布均匀的橙红色嗜酸颗粒。
- MGG 表现:MGG 染色的酸性染料(伊红)对嗜酸颗粒着色极强,橙红色颗粒在淡蓝背景上对比强烈——全组辨识度最高的视觉签名。
- 临床关联:过敏性疾病、寄生虫感染、药物反应、嗜酸性粒细胞增多症的核心效应细胞。
- 数据集内角色:占比第二,且是典型的"送分组"——第三方评测的分组召回中该组通常位居最高一档(方向性观察,具体数值随划分与架构而变,见 §5.6 第 4 条对分组指标的提醒)。
- 易混淆:几乎不与其他组混淆;真正的研究价值在于它是"视觉特征主导分类"的对照组——深度模型对它的判断可解释性最强。
2.7.3 未成熟粒细胞 immature granulocytes (IG)——2,895 张(16.94%)
IG 组是本数据集临床味道最重、内部异质性最大的一组。官方将其描述为三个子类的合并(子类归属未随包发布,§2.3):
-
早幼粒细胞 promyelocyte:三者中最大(直径约 15–25 μm),圆形或椭圆核、常偏位,染色质开始凝聚但可见核仁残迹;胞质含大量粗大的嗜天青(primary)颗粒,MGG 下呈紫红色密集颗粒感。
-
中幼粒细胞 myelocyte:直径约 12–20 μm;核变圆偏位、染色质更凝聚;胞质同时出现中性(secondary)颗粒与残余嗜天青颗粒——“颗粒双轨期”。
-
晚幼粒细胞 metamyelocyte:直径约 10–18 μm;肾形/豆形核(凹陷超过核直径一半但尚未分叶)是定义性特征;胞质颗粒谱接近成熟中性粒。
-
临床关联:正常健康人外周血中罕见可观数量的 IG;感染与再生性贫血(论文配图标题原话:those more frequently observed in infections and regenerative anaemias)是最常见的反应性来源;持续显著增多则需排查骨髓增殖性或白血病性过程——但本数据集不含白血病病例(事实清单第 32 条)。
-
数据集内角色:三子类谱系横跨"颗粒最密"到"接近成熟",使该组的类内方差大于多数其他整组;它是细粒度研究与"子类归属"需求的主要诉求对象(附录 L 维护触发点之一)。
-
易混淆:早幼粒 vs 单核(颗粒 vs 灰蓝胞质)、晚幼粒 vs 成熟中性粒(核形连续谱)——两条类对都进 §2.8 地图。
2.7.4 血小板 platelets (thrombocytes)——2,348 张(13.74%)
- 识别要点:直径约 2–4 μm 的无核细胞质碎片(巨核细胞脱落产物);本数据集内是 DM96 裁剪出的单个血小板放大视野,淡蓝色胞质包裹紫红色细颗粒;形态从圆形/卵圆形到不规则突起(伪足)谱系宽,巨型血小板也在其中。
- MGG 表现:中央颗粒区(granulomere)紫红、周边透明区(hyalomere)淡蓝,色差分明。
- 临床关联:一期凝血的核心要素;计数与形态(巨血小板、颗粒减少)是出血性疾病评估的一线信息。
- 数据集内角色:八组中唯一的非白细胞组分,天然构成"白细胞 vs 血小板"这个几乎零难度的粗分类轴;同时是"裁剪粒度≠生理尺度"的最佳提醒——真实血涂片上血小板直径只有细胞视野的零头,这里却被居中放大。
- 易混淆:无实质混淆对象;它存在的意义更多是完整性(让"外周血有形成分"覆盖不缺角)而非分类难度贡献。
2.7.5 幼红细胞 erythroblasts——1,551 张(9.07%)
- 识别要点:有核红细胞前体(normoblast 谱系);圆形核、染色质深染致密(成熟阶段可呈"墨点"状),胞质随血红蛋白化程度从深蓝(嗜碱性)过渡到灰蓝再到灰红;核周常可见淡染晕。
- MGG 表现:"深蓝胞质 + 墨色圆核"的晚期阶段与"灰红胞质"的近成熟阶段并存,组内色域跨度大。
- 临床关联:正常成人外周血中极罕见;溶血、急性失血、骨髓代偿性增生或骨髓浸润时外周血可见——即"幼红细胞出现在外周血"本身就是临床信号。
- 数据集内角色:健康供者血象中出现 1,551 张幼红细胞,是理解"正常是供者维度而非细胞维度"(§2.5 第 1 条)的最佳实例:供者通过四条准入质控,而其涂片仍含正常造血谱系的成分。它与 IG 组共同构成数据集的"发育谱系采样"。
- 易混淆:与淋巴细胞——都是"圆核致密"外形,判别点在胞质颜色(蓝/灰红 vs 清亮)与核质比;这条类对也进 §2.8 地图。
2.7.6 单核细胞 monocytes——1,420 张(8.31%)
- 识别要点:正常白细胞中最大的一组(直径约 15–25 μm);核形不规则——肾形、马蹄形、折叠或浅分叶;染色质网状疏松(对比粒系的块状凝聚);胞质丰富、灰蓝色磨砂感,含细小嗜天青颗粒。
- MGG 表现:灰蓝胞质 + 疏松核染色质是两大签名;"大而不圆、灰而不清"的直觉概括。
- 临床关联:结核、心内膜炎等慢性感染,单核细胞白血病/骨髓增生异常谱系,以及感染恢复期的单核增多。
- 数据集内角色:形态谱最"散"的正常白细胞组(核形连续变化),是闭集分类里"类内方差大"的典型样本。
- 易混淆:大淋巴细胞 vs 单核(数据集公认的细粒度难题之一,§5.5 类对);早幼粒 vs 单核(颗粒密度是判别核心)。
2.7.7 嗜碱性粒细胞 basophils——1,218 张(7.13%)
- 识别要点:直径约 10–14 μm;深紫蓝色粗大嗜碱颗粒(含组胺与肝素)常遮盖或推移分叶核——"见颗粒不见核"是常态;核常呈 S 形或双叶。
- MGG 表现:碱性染料(亚甲蓝系)对嗜碱颗粒着色极强,深紫蓝色调在整张图里几乎不可能误认。
- 临床关联:正常血中最稀少的白细胞(外周血分类计数常 <1%);增多与过敏反应及骨髓增殖性疾病(尤其 CML)相关。
- 数据集内角色:占比倒数第二;它的存在本身就是"真实血象采样"的证据——均匀构造的数据集不会把最稀少的细胞采到一千余张。
- 易混淆:识别本身不难(特征过目不忘),难度在于低频组的样本效率(§5.6 第 4 条)。
2.7.8 淋巴细胞 lymphocytes——1,214 张(7.10%)
- 识别要点:小淋巴细胞(直径约 7–12 μm)圆核、染色质致密成块、胞质为窄环状清亮淡蓝——“核占九成”;大淋巴细胞(约 12–16 μm)核略大、染色质稍松、胞质更宽。数据集内含这一形态谱。
- MGG 表现:核深蓝紫色、胞质清亮少颗粒;大淋巴的胞质偶见少量嗜天青颗粒。
- 临床关联:病毒感染(淋巴细胞增多/异型淋巴)、免疫状态评估;T/B/NK 系总称——纯形态学无法下系别结论。
- 数据集内角色:占比最少的一组;含形态谱使其与单核组共同贡献了最著名的细粒度混淆类对。
- 易混淆:大淋巴 vs 单核(第一类对);小淋巴 vs 晚期幼红(圆核致密的形似,靠胞质色判别)。
2.7.9 逐类档案小结:三句话记住八组
- 三个"过目不忘"组:嗜酸(橙红粗颗粒)、嗜碱(深紫蓝遮核颗粒)、血小板(小而无核)——低难度、高召回。
- 两个"发育谱系"组:IG(粒系三级未成熟)与幼红(红系前体)——类内方差大、承载临床叙事、子类/阶段归属是公开缺口。
- 三个"互为镜像"组:中性粒、单核、淋巴——彼此间的边界类对(晚幼粒 vs 中性粒、大淋巴 vs 单核)构成了本数据集残余错误的集中地。
2.8 细粒度混淆地图:五条类对难度轴
§5.5 指出 99%+ 时代的残余错误高度集中在形态学最近邻类对;本节把"哪些类对"一次性铺开,供设计评测与错误分析时直接引用。难度分档为基于形态学连续谱结构的定性判断(跨划分不保证数值稳定,仅作分析起点):
| # | 类对 | 难度 | 混淆机理 | 判别要点 |
|---|---|---|---|---|
| 1 | 晚幼粒(IG) vs 成熟中性粒 | 最高 | 核形从肾形→分叶是连续成熟谱,无客观切割点 | 核凹陷深度与叶间细丝;边界样本本质上不可判定 |
| 2 | 大淋巴细胞 vs 单核细胞 | 高 | 两者都是"大细胞+一定量胞质",大淋巴染色质稍松后与单核疏松染色质接近 | 核形(圆 vs 不规则)、胞质色(清亮 vs 灰蓝磨砂) |
| 3 | 早幼粒(IG) vs 单核细胞 | 中高 | 两者都大、核都可偏位 | 嗜天青颗粒密度(密集粗大 vs 细小稀疏) |
| 4 | 小淋巴细胞 vs 晚期幼红细胞 | 中 | 圆核致密的形似 | 胞质色(清亮淡蓝 vs 灰蓝/灰红血红蛋白化) |
| 5 | 中幼粒(IG) vs 早幼粒(IG) | 中(组内) | 同组子类边界,颗粒双轨期跨阶段 | secondary 颗粒出现与否——子类归属本就未随包发布 |
三条使用提示:
- 类对 1/2 是错误分析的第一站:任何新架构的残余 1% 错误,建议先按这两条类对拆解混淆矩阵,再下"泛化改进"的结论——很可能改进空间不在泛化而在边界样本定义。
- 类对 5 与"10 类型"口径直接相关:IG 组内子类边界没有官方逐张答案(§2.3),凡声称"IG 子类准确率"的工作都是自标口径,引用时按坑 3 同类逻辑存疑。
- 本地图与 §7 的跨域叙事互补:类对 1/2 的难度在人工读图口径同样存在——CellaVision 类商用系统在人机对比研究中的分歧细胞,正是同一批边界样本;这是"机器基线已超人工熟练技师一致性"叙事的细粒度注脚。
§3 采集与标注流水线
3.1 临床侧:Core Laboratory 的日常即数据来源
Hospital Clinic de Barcelona 是西班牙最大的临床中心之一,其核心实验室(Core Laboratory,隶属生化与分子遗传学系·生物医学诊断中心)每天处理大量血常规标本。数据集图像不是"为研究专门采血"的产物,而是日常标本流的副产物:健康供血者(血库/体检口径)的血样走完 Advia 2120 → SP1000i 常规流程后,符合条件的涂片进入 DM96 数字化。
这个"临床日常复用"模式的优点与代价同样清晰:
- 优点:流程全部标准化(设备、染色、规程都有临床质控背书),图像的采集质量与真实检验环境完全一致;研究不需要伦理上新增采血负担。
- 代价:研究侧无法控制每类细胞的采集配比——8 组的分布(§2.1)是真实血象的自然呈现,不是实验设计出来的均衡表。
3.2 标注流程:机器预分类 + 专家复核
论文口径的标注链路是两层:
- 机器预分类:CellaVision DM96 内置的形态学分类算法对每张裁剪图输出预分类结果——这是商用系统十余年形态学规则的沉淀。
- 专家复核:临床病理专家(expert clinical pathologists,复数)逐张确认或改判,最终目录归属以专家口径为准。
这种"工作站预标+人工终审"是血液数字形态学行业的实际作业方式(DM96 在全球临床实验室就是这么用的),它的效率远高于从零手标;但要注意它的三个透明度缺口(论文未提供,遗留疑点):
- 复核专家的人数、资历、各自主管类目未披露;
- 机器预分类被专家改判的比例未披露(这恰恰是"预分类质量"的直接指标);
- 观察者间一致性(如 κ 系数)未发布。
换句话说,标注质量的证据是间接的:设备是临床认证设备、标注者是临床专家、流程是临床在用流程——资格背书而非量化背书。在同类公开数据集里这是常态(Matek 集发布了一致性数据是少数派),但引用时应如实写"expert-annotated"而不是"consensus-annotated"。
3.3 匿名化与伦理口径
- 随机 ID:图像以随机标识符组织,患者可追溯信息(姓名、病历号、采集日期关联)不随数据集发布。
- 供者维度匿名:由于供者人数与图像归属关系未披露,即使掌握原始数据的团队也无法从公开包重建"哪些图来自同一人"。
- 伦理路径:作为 Data in Brief(数据论文期刊)发布,走的是"常规临床流程数据 + 完全匿名化 + 公开描述"的常规声明路径;四条排除标准本身就是伦理意图的一部分(不用患者数据、只用健康供者)。
对复用者的含义:CC BY 4.0 给了你再分发的自由,但数据集内不含任何可识别信息,你也不应该尝试从图像 EXIF 等元数据反推采集来源(JPG 已是裁剪产物,原始元数据未随包发布)。
3.4 数据包内容与"未随包发布"清单
下载 Mendeley V1 包(约 8 个类别目录的 JPG 集合)后,你能得到:
- 17,092 张 360×363 px JPG,按 8 个类别目录组织,目录名即标签;
- Mendeley 托管页的描述元数据(版本、DOI、许可、Related Article 链接);
- 主题标签(Platelet / Leukocyte / Hematopathology / Blood Cell)。
你不能得到(论文与托管页均未提供):
- 供者级元数据(人数、人口学、每人图像数);
- 官方 train/val/test 划分文件;
- IG 组内三子类(早幼粒/中幼粒/晚幼粒)的逐张归属;
- 采集年份与图像的对应关系(2015–2019 只是一个总区间);
- 机器预分类结果与专家改判记录;
- 机器可读的 manifest(CSV/JSON 清单)——标签需要从目录结构自行解析。
这份"未发布清单"不是吹毛求疵:§9 与附录 B 的 AI-Ready 评分里,它就是元数据维度失分的全部原因。同时也给出一个典型的数据工程提示——目录即标签(directory-as-label)是 CV 数据集最古老也最通用的约定,PyTorch 的 ImageFolder 一行代码即可加载,但对需要 track 个体来源的现代 ML 工作流(患者级划分、数据卡片、溯源审计)来说,这个包的元数据停在 2020 年的发布标准上。
3.5 染色协议深读:MGG 是这批图像的"物理色彩空间"
§2.4 把 SP1000i 定位为"标准化器";本节展开标准化背后的染色学,因为对 CV 使用者而言,MGG(May-Grünwald-Giemsa)就是这批图像的物理色彩空间——模型学到的每一个颜色特征都由它决定。
3.5.1 两步染色的机理速览
MGG 是 May-Grünwald 液与 Giemsa 液先后施染的复合染色法,核心化学是酸性染料伊红与碱性染料亚甲蓝/天青系对细胞组分按电化学亲和力的选择性着色:
- May-Grünwald 液(伊红-亚甲蓝复合物)先行:酸性成分着色嗜碱性结构(核、嗜碱颗粒、RNA 丰富的胞质),碱性成分着色嗜酸性结构(嗜酸颗粒、血红蛋白)。
- Giemsa 液(天青-伊红系)接力:加深核染色质的蓝紫色层次,并给嗜天青颗粒与中性颗粒建立紫红色谱。
- 水洗分化与干燥:终止反应并固定色阶。
由此得到血液形态学的"标准色谱":核 = 蓝紫、嗜酸颗粒 = 橙红、嗜碱颗粒 = 深紫蓝、中性颗粒 = 淡紫红、成熟红细胞/血红蛋白化胞质 = 灰粉红、幼稚胞质 = 深蓝。§2.7 逐类档案里的每个视觉签名,都是这套色谱在特定细胞结构上的映射。
3.5.2 自动化染色的"三固定"及其数据学含义
SP1000i 把手工染色的"技师经验"替换为机器规程,实质是三个固定:
- 固定试剂浓度与批次管理——染液老化(亚甲蓝氧化、伊红降解)造成的批次色偏被压缩;
- 固定施染时间与节奏——着色深度的时间依赖性被消除;
- 固定冲洗与干燥条件——残留染液沉淀与干燥伪影被抑制。
对数据集的三重含义:
- 颜色特征可信:跨图像的色域漂移远小于人工染色涂片,“橙红颗粒”"灰蓝胞质"这类描述在像素层面真的成立——用 RGB/HSV 手工特征做基线的论文能站住脚,前提正是这种标准化。
- 域内一致性换来域间脆弱性:整包数据共享同一染色域,模型在 MGG 域内学到的色彩先验,遇到 Wright 染色(北美常用)、Wright-Giemsa 或不同厂商自动染色机时会整体偏移——染色归一化(stain normalization)与颜色增强因此成为本数据集上域泛化研究的标准轴(§5.5 出路 2 的具体化)。
- "无滤波、无预处理"承诺的边界:官方保存图像时不做颜色校正,但采集前的染色就是一级"预处理"——它已经被机器规程统一过了。宣称"零预处理数据集"时应知悉这一层。
3.5.3 对下游研究的四条可操作提示
- 颜色增强要模拟染色域而非摄影域: hue/saturation 抖动、 stain augmentation(按染色向量分解再扰动)比几何增强更贴合"换染色法"的真实域差;旋转/翻转(60° 旋转 + 翻转是第三方 27-CNN 论文的增强口径,事实清单第 21 条同源)解决的是姿态问题,解决不了染色问题。
- 跨染色迁移研究应选对参照集:与 Raabin-WBC(Wright-Giemsa)或 Matek 集对照做跨域实验时,染色差异是首要混杂变量——把"设备差异"与"染色差异"拆开报告才有结论价值。
- 批间泄漏不存在、域内漂移有限:与病理 WSI 数据集常见的"每张 WSI 一个站点"式批间结构不同,本数据集的染色域近乎单一,随机划分的乐观偏差主要来自供者/个体层面(无法量化,§5.6 第 3 条),而非染色批次。
- 引用染色协议时认设备口径:写"May-Grünwald-Giemsa 染色"时,规范做法是同时给出施染设备(Sysmex SP1000i)——它把"哪一种 MGG"的歧义(手工/机染、哪家机染)一次性钉死。
§4 论文与时间线
4.1 双论文结构:数据论文与方法论文各管一摊
这个数据集挂着两篇官方论文,分工明确,引用时别混:
| 数据集论文 | 方法论文 | |
|---|---|---|
| 标题 | A dataset of microscopic peripheral blood cell images for development of automatic recognition systems | Recognition of peripheral blood cell images using convolutional neural networks |
| 期刊 | Data in Brief 30:105474(2020) | Comput Methods Programs Biomed 180:105020(2019-10) |
| DOI | 10.1016/j.dib.2020.105474 | 10.1016/j.cmpb.2019.105020 |
| PMID / PMCID | 32346559 / PMC7182702 | 31425939 / — |
| 作者 | Acevedo A, Merino A, Alférez S, Molina Á, Boldú L, Rodellar J | Acevedo A, Alférez S, Merino A, Puigví L, Rodellar J |
| 开放获取 | 是(Recercat 有 postprint,CC BY 4.0 口径;ScienceDirect PII S2352340920303681) | 订阅制(PubMed 记录) |
| 管什么 | 数据本身:8 组分布、采集流程、图像规格、供者质控 | 方法与基准:CNN 架构对比、训练细节、96.2% 基准 |
作者名单的两个易错点(PubMed 32346559 与 Recercat 双源核对):
- 首名全名:一作是 Andrea Acevedo(双隶属:Hospital Clinic 生化与分子遗传学系·生物医学诊断中心 + UPC 数学系),通讯是 José Rodellar(UPC 数学系)。文献里流传的"Adrián Acevedo""Jordi Rodellar"是误传(坑 6);Recercat 机构库的全名记录为 Andrea Acevedo / Merino González, Anna / Alférez Baquero, Edwin Santiago / Molina Borrás, Ángel / Boldú Nebot, Laura / Rodellar Benedé, José。
- 三作隶属变迁:Santiago Alférez 在方法论文(2019)时属 UPC,Data in Brief(2020)时点已署 Universidad del Rosario(波哥大,哥伦比亚)——引用 affiliation 时注意论文时点。
4.2 时间线:四年采集、两年成稿、一条派生链
| 时点 | 事件 |
|---|---|
| 2015–2019 | Hospital Clinic Core Laboratory 采集健康供血者涂片,DM96 数字化 |
| 2019-10 | 方法论文发表(CMPB 180:105020)——数据集首次进入文献(作为该研究的训练测试底座) |
| 2020-06-08 | Mendeley Data Version 1 发布(DOI 10.17632/snkd93bnjr.1,CC BY 4.0) |
| 2020-06 | 数据集论文发表(Data in Brief 30:105474)——官方描述与 Table 1 定本 |
| 2020-10 | 第三方大规模评测出现(arXiv 2110.09508,27 种 CNN 微调) |
| 2021-08 | MedMNIST v2 发布,BloodMNIST 作为其子集派生自本数据集,进入轻量基准生态 |
| 2024+ | MedMNIST+ 提供BloodMNIST 的 64/128/224 px 升级版;同域对照研究持续引用 |
时间线的两个注意点:
- 方法论文先于数据论文:2019 年那篇 CMPB 是"先用了数据集发方法",2020 年 Data in Brief 才是"把数据本身作为贡献正式描述"。所以 2019 论文是数据集的最早文献记录,但描述数据规格的权威文本是 2020 数据论文。
- 数据集只有单一版本:Mendeley V1(2020-06-08)发布后无 .2 及以上版本——五年无修订,一方面说明数据稳定无勘误级问题,另一方面意味着 §3.4 那份"未发布清单"至今没有被补齐。
4.3 引用规范:三件套各引各的
写论文时的引用组合建议:
- 用了图像数据:引 Data in Brief 论文(10.1016/j.dib.2020.105474)+ Data DOI(10.17632/snkd93bnjr.1)。CC BY 4.0 的署名义务由此满足。
- 用了或对比了官方基准数字(96.2% 等):加引方法论文(10.1016/j.cmpb.2019.105020)。
- 用了 BloodMNIST/28×28 版本:加引 MedMNIST v2 论文(Yang 等,MedMNIST v2),并注明与原生 Acevedo 数据集的分辨率差异。
- 不要引 arXiv:1701.01905:那是数学论文(Korff, “Korff F-signatures of Hirzebruch surfaces”),与血细胞无关(坑 1)。
4.4 检索名坑:一个数据集的多个"曾用名"
本数据集没有注册专名,文献与代码库里同时流通的名字包括:
| 名字 | 常见语境 |
|---|---|
| Acevedo dataset | 学术论文转引最常用(以一作姓指代) |
| PBC Dataset / PBC_Acevedo | 代码仓库与 GitHub 常用(PBC = Peripheral Blood Cell) |
| Peripheral Blood Cell (PBC) dataset | Data in Brief 语境的描述性称呼 |
| Blood Cell Microscope | MedMNIST 系的 source 字段口径 |
| BloodMNIST | 28×28 派生版的专名(MedMNIST 生态内) |
检索建议:PubMed 用 “peripheral blood cell images”+ “Data in Brief”;Google Scholar 用数据论文标题精确短语;GitHub 搜 “PBC dataset Acevedo” 或直接认 Mendeley ID snkd93bnjr——这个随机串是全链路最稳定的唯一标识。
§5 基准与评估
5.1 官方基准(2019 CMPB):96.2% 是怎么来的
方法论文在 Keras/TensorFlow + Nvidia Titan XP 单卡环境下做的架构对比,四条路线:
| 路线 | 架构 | 总体准确率 |
|---|---|---|
| 特征提取 + SVM | VGG-16(ImageNet 预训练,特征向量接 SVM) | 86% |
| 特征提取 + SVM | InceptionV3(同上范式) | 90% |
| 微调 CNN | InceptionV3(全网络微调) | 95% |
| 微调 CNN | VGG-16(全网络微调) | 96% |
| 最佳总体 | 官方报告的最佳配置 | 96.2% |
方法论上值得记的三点:
- 微调 > 特征提取:在显微图像上,全网络微调比"冻结骨干+SVM"高出 6–10 个百分点——预训练特征不直接适配显微域,这条经验后来在 MedMNIST 全家桶上被反复验证。
- 单卡可训是设计目标之一:Titan XP(2017 年级消费级卡)跑得动的规模与架构——数据集规模与 360×363 分辨率对当时实验室是友好的。
- 划分是论文自用的:该论文未把 split 定义为社区标准;你复现 96.2% 需要按论文正文口径(正文未在摘要给出精确样本数,这是遗留疑点之一)。
5.2 第三方 27-CNN 评测(arXiv 2110.09508):99.32% 与 98.39%
2020 年 10 月,第三方团队把 27 种 CNN 在本数据集上全部微调,64/24/12 划分,两端结果:
- 最高 99.32%:Wide ResNet-50-2(WRN-50-2);
- 最低 98.39%:AlexNet——最古老的架构也只差不到 1 个百分点。
该文引用的类分布与官方 Table 1 一致(独立第三方佐证之一)。"最差 98.39%"比官方最佳 96.2% 还高,说明五年间训练技巧、预训练权重与数据增强的进步吃掉了早期架构差距;也预示固定口径下这个基准已接近饱和(§5.5)。
5.3 派生基准生态:BloodMNIST 与 MedMNIST+
本数据集的第二条评测生命线在 MedMNIST 生态里:
| 层级 | 内容 |
|---|---|
| MedMNIST v2(2021) | BloodMNIST:28×28 降采样,17,092 张全量,8 类,官方 split 11,959 / 1,712 / 3,421,与几十个其他 MedMNIST 子集同台 |
| MedMNIST+(2024,arXiv 2404.15786) | Blood 源字段明写 “A. Acevedo et al.”;提供 64/128/224 px 分辨率升级;类别不平衡度 Shannon’s Equitability 三个 split 均 0.96 |
MedMNIST 生态对本数据集的放大作用是实质性的:几十个轻量基准论文、AutoML 工具、不确定性研究(如把 BloodMNIST 用作分布偏移/校准测试床的开源项目)都自动继承了这份数据——其中相当一部分使用者并不知道(或不需要知道)上游还有一个 360×363 的原生版本。
5.4 其他第三方口径
- Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN 混合架构):确认 8 类口径并在其上评测——第三方持续把本数据集当"新架构试金石"。
- 同域对照(S0169260724005534 论文 Table 1 口径):Matek BM 171,374 图/21 类、Matek blood 18,365/15、Acevedo 17,092/8、Raabin 17,965/5——Acevedo 是其中最大的纯正常血象公开集(Matek BM 更大但含骨髓异常形态且不公开)。
- 引用场景谱系:外周血细胞分类、血液病初筛的前置模块、轻量 CNN 对比、联邦学习仿真、不确定性量化与校准研究、教学演示——跨度从工程到方法学都覆盖。
5.4.1 27-CNN 论文的训练配置全披露(复现锚点)
arXiv 2110.09508 除两端准确率外,还公开了完整训练配置,使"99.32%"成为可复现锚点而非孤证数字:
| 配置项 | 口径 |
|---|---|
| 划分 | 64% / 24% / 12%(图像级,无供者级约束——§5.6 第 3 条同样适用) |
| 优化器 | SGD,momentum 0.9 |
| 学习率 | 0.001 起步,每 7 个 epoch 衰减 0.1 |
| minibatch | 32 |
| 数据增强 | 60° 旋转 + 水平/垂直翻转 |
| 预训练 | 全部 27 架构均 ImageNet 预训练微调 |
5.4.2 投票集成 99.51%:该基准的已发表上限
同一论文在单模型之外给出投票集成(voting ensemble)结果:99.51%——由单模型榜前列的四模型组成:
| 集成成员 | 架构族 |
|---|---|
| Wide ResNet-50-2 | WRN(单模型最高 99.32%) |
| VGG-19 | 经典深 VGG |
| Wide ResNet-101-2 | WRN 加深版 |
| ResNet-34 | 经典 ResNet |
三点解读:
- 99.51% 是固定口径(64/24/12、原生分辨率)下可公开引用的最高数字——比最佳单模型再 +0.19 个百分点,集成收益已进入边际区间,进一步佐证 §5.5 的饱和判断。
- 集成成员全是 ImageNet 时代经典骨干:没有 Transformer、没有专用医学预训练——在这个数据集上"骨干先进性"对终点的边际贡献趋零,技巧与集成才是增量来源。
- 引用规范:99.51% 应同时标注"投票集成 + 64/24/12 划分"两个限定词;裸引"99.5%+ 的准确率"而不给口径,会重演跨 split 不可比的老问题(§5.6 第 1 条)。
5.4.3 BloodMNIST 降采样工艺链:28×28 从哪一步来
MedMNIST 官方文档披露了从本数据集到 BloodMNIST 的完整降采样工艺,这串变换是理解"派生皮信息损失"的唯一权威口径:
原生 3×360×363(JPG 解码后)
→ 中心裁剪 center-crop → 3×200×200
→ 缩放 resize → 3×28×28(保存为 .npz)
配套的工程指纹(复现/对账用):
- 官方 MD5:
7053d0359d879ad8a5505303e11de1dc(MedMNIST v2 分发的 blood.npz 口径); - Zenodo 托管:MedMNIST 系数据在 Zenodo 固化(zenodo.org/records/10519652 及其同族记录),DOI 版本化与 Mendeley 原包(§6.1)平行存在。
工艺链的两点含义:
- 中心裁剪丢弃了视野边缘 44% 的线性信息(360×363 → 200×200)——DM96 的居中裁剪假设使此操作大体安全(细胞在图中心),但细胞出格/贴边的个体像素在派生皮上已经丢失;
- 28×28 相对 200×200 又损失约 50 倍像素——对红细胞大小的结构(颗粒、核叶间隙)是毁灭性降采样,这就是"分辨率敏感研究请回到原生版"(§8.2 检索路径 1)的量化注脚。
5.5 99%+ 意味着什么:饱和基准的三条出路
固定口径(同一 split、同一分辨率、闭集 8 类)下准确率逼近 99.5%,这个基准还能做什么?三条被验证的出路:
- 错误细粒度化:残余 1% 错误高度集中在形态学最近邻类对——成熟中性粒 vs 晚幼粒、大淋巴 vs 单核。研究价值从"刷总准确率"转向"细粒度混淆矩阵"与"可解释的错误分析"。
- 评测轴转向 OOD 与不确定性:闭集准确率饱和后,域偏移(不同染色、不同设备、不同分辨率)、分布外检测(见异常细胞时模型会不会"硬编"成 8 类之一)、校准与选择性预测成为增量方向——BloodMNIST 在不确定性研究中的高频出镜正是这条路的体现(闭集饱和数据集天然适合当"干净对照组")。
- 回到原生分辨率的性价比问题:28×28 的 BloodMNIST 上 99%+ 与 360×363 原生版上 99%+ 是否同样容易,分辨率消融本身就是可做的研究问题——MedMNIST+ 提供 64/128/224 px 版本正是为这类问题准备的。
5.6 统计卫生守则:四条,引用前先自查
- split 不对标:官方论文自用 split、arXiv 2110.09508 的 64/24/12、BloodMNIST 的 11,959/1,712/3,421 三套划分互不兼容;96.2% 与 99.32% 之间不是"方法进步 3 个点"的干净比较(划分不同)。
- 分辨率不对标:BloodMNIST(28×28)指标 ≠ 原生 360×363 指标;MedMNIST+ 各分辨率档次的指标同理。转引时注明分辨率。
- 患者级划分无人做过也无法做:供者归属未披露,所有 published split 都是图像级随机——同一供者的细胞可能同时出现在 train 和 test,乐观偏差理论上存在但无法量化(数据集结构性缺口,见 §3.4)。
- "总体准确率"掩盖类间差异:引用时最好附各类召回率或混淆矩阵;嗜碱/淋巴这类低频组在总体 96% 时可能类内召回明显更低。
§6 获取与许可:一扇门,一张纸
6.1 获取:库内最简的一扇门
与库内"三层异构"(如 panda-plus 的 WSI/掩码/基准三套许可)或请求制数据集不同,本数据集只有一扇门、一张纸:
| 项 | 内容 |
|---|---|
| 托管页 | https://data.mendeley.com/datasets/snkd93bnjr/1 |
| Data DOI | 10.17632/snkd93bnjr.1 |
| 版本 | Version 1(2020-06-08 发布,单一版本链,无 .2+) |
| 许可 | CC BY 4.0(托管页直核) |
| 获取门槛 | 无注册、无申请、无 gate——免费公开下载 |
| 包内容 | 8 个类别目录的 JPG(合计 17,092 张,360×363 px RGB) |
| Related Article | 10.1016/j.cmpb.2019.105020(方法论文,托管页关联) |
| 主题标签 | Platelet / Leukocyte / Hematopathology / Blood Cell |
实操三步:打开托管页 → Download(选 V1 全包)→ 解压后用 ImageFolder 类工具按目录加载。想要 28×28 或更高分辨率派生版,走 MedMNIST 官方下载脚本(medmnist Python 包,BloodMNIST 子集)。
6.2 CC BY 4.0 的义务与自由
CC BY 4.0 给你的自由:商用、衍生、再分发、闭源使用,全部允许。唯一义务是署名(attribution),实操口径:
- 引数据集论文:Acevedo A, Merino A, Alférez S, Molina Á, Boldú L, Rodellar J. A dataset of microscopic peripheral blood cell images… Data in Brief 30:105474 (2020)。
- 标注 Data DOI:10.17632/snkd93bnjr.1。
- 衍生品(如再发布的增强版、裁剪版)同样以 CC BY 4.0 或兼容条款开放,并保留原始署名。
两个边界提醒:JPG 图像本身的分辨率规格(360×363)意味着任何"超分辨率重建版"是衍生作品,署名链不能断;若把图像嵌入商业产品(如教学软件),CC BY 4.0 允许但署名义务仍然存在——这一点比 CC BY-SA 温和(无相同方式共享要求),比 CC0 严格(不能不署名)。
6.3 版本链与稳定性
单一版本 V1 自 2020-06-08 至今无修订。含义有三:
- 稳定性红利:五年零勘误,文献里也未见官方更正公告——数据本体可信度高,引用无需版本辨析(对比某些数据集 1.0/2.0 口径打架的坑)。
- 改进停滞:§3.4 那份"未发布清单"(manifest、供者元数据、子类归属、官方 split)五年未补——数据集的元数据停留在 2020 年发布标准。
- 快照式存档:Mendeley Data 对每个版本做 DOI 固化(.1 即快照),即使原机构变动,DOI 解析仍指向存档——这是它比 GitHub 托管数据集(链接易腐)在可持续性维度加分的理由。
6.4 AI-Ready 快评:高分项与失分项并置
| 维度 | 表现 |
|---|---|
| 可获取 | 满分语境:公开直链、无 gate、CC BY 4.0、平台(Mendeley/Elsevier)稳定 |
| 可加载 | 目录即标签,ImageFolder 即用;JPG 通用格式无私有依赖 |
| 规模友好 | 17,092 张 / 360×363 px,单卡全量训练无压力 |
| 元数据 | 缺 manifest、缺供者信息、缺子类标签、缺官方 split——工程完备性停在 2010 年代中 |
| 可追溯 | Data DOI + 论文 PII 齐全;但图像级溯源(哪个供者、哪年采集)为零 |
| 许可清晰度 | 单一许可全文包,无嵌套许可(对比库内三层异构条目是显著优点) |
一句话:数据本体的 AI-Ready 接近满分,元数据层的 AI-Ready 有明显天花板——它是"开放但朴素"的典型样本。
6.5 与库内可获取性光谱的对照
把库内条目的获取模式排一条光谱,本数据集处在最开放端:
| 获取模式 | 库内例子 | 本数据集 |
|---|---|---|
| 公开直链 + 宽松许可(CC BY 类) | acevedo-blood(本条目)、medmnist(716) | ✓ 完全一致 |
| 公开下载但条款逐条细读 | 多数图像集 | — |
| 注册/申请 gate | 部分队列与基因组集 | ✗ 无此环节 |
| 请求制(邮件通讯作者) | panda-plus 的掩码层 | ✗ 无此环节 |
| 非公开 | Matek BM 171,374 张 | ✗(对照项,永不公开) |
对数据集选型者的启示:如果你要给团队挑一个"今天下午就能开工"的血液显微图像数据集,这个是确定性最高的选择——没有任何一个环节可能卡住你。
6.6 下载留痕与完整性校验实操
Mendeley 直链省掉了申请环节,但也意味着校验责任完全转移到下载者一侧——没有 gate 的数据集,同样没有 gate 后面帮你做一致性检查的人。这一节给出一份最小可操作的验收清单,做完即可放心开工。
6.6.1 下载留痕三件套(写给未来的自己与审稿人)
| 留痕项 | 内容 | 写在哪里 |
|---|---|---|
| 版本 URL | https://data.mendeley.com/datasets/snkd93bnjr/1 |
实验记录 / 仓库 README |
| 下载日期 | 精确到日(如 2026-09-29) | 同上 |
| Data DOI | 10.17632/snkd93bnjr.1(Version 1,2020-06-08 发布) | 论文数据可用性声明 |
三条一起留,任何人在任何时点都能精确复现"你当时拿到的是哪一版字节"。本数据集目前是单一版本链(未发现 .2 及以上),版本漂移风险低(§6.3),但留痕习惯不因版本少而豁免。
6.6.2 完整性校验:计数 + 抽查,替代不存在的官方哈希
一个必须诚实面对的事实:官方没有发布压缩包级的 MD5/SHA 校验值,托管页描述之外也未随包附逐文件清单(§9 待核 3)。因此正确的校验姿势不是"对一个哈希",而是两层交叉验证:
| 校验层 | 动作 | 通过标准 |
|---|---|---|
| 计数层 | 解压后逐目录统计 JPG 数量 | 八组数字与官方 Table 1 逐一相等(3,329 / 3,117 / 2,895 / 2,348 / 1,551 / 1,420 / 1,218 / 1,214),总数恰 17,092(附录 E 有速算表) |
| 抽查层 | 每组随机抽 5-10 张,读图像尺寸与色彩通道 | 360×363 px、RGB;若出现异常尺寸先怀疑下载不完整而非数据本身 |
计数层脚本十行以内可写完(目录即标签的好处在这里兑现一次),抽查层用任何图像库读 shape 即可。两层都过,数据完整性就有了可写进方法学段落的依据。
计数层的参考实现(shell 十行以内,输出与 Table 1 逐行对照):
# 逐目录统计 JPG 数量(目录即标签在这里兑现一次)
find PBC_dataset -type f -iname '*.jpg' | sed 's|/[^/]*$||' | sort | uniq -c
# 期望八行:3329 / 3117 / 2895 / 2348 / 1551 / 1420 / 1218 / 1214,合计 17092
# 注:目录名以解压包实际为准,本命令只数数量不做名称假设
6.6.3 三个常见故障与处置
- 解压后目录层级多一层:部分操作系统解压工具会把内层目录再包一层,
ImageFolder指向上一层目录就会把"目录名"错当类别。处置:加载前先打印目录树确认八组目录直接可见(§3.4 有包内容清单)。 - 下载中断导致尾部文件损坏:JPG 损坏通常在读图时才暴露。处置:计数层先拦(数量不足直接重下),抽查层兜底(读图报错的文件重下后复检)。
- 把 BloodMNIST 的 MD5 误用到原包上:
7053d0359d879ad8a5505303e11de1dc是 BloodMNIST npz 文件的校验值(§5.4.3),不是本数据集原始压缩包的哈希——两者是母集与派生集的关系(§8.4)。写进校验脚本前先看清对象。
验收完成后的最后一步:把 Table 1 对照结果存成一行日志(“2026-09-29 下载,八组计数全部相符,总 17,092”)。这一行将来就是你回应审稿人"数据从哪来、是否完整"的全部证据。
§7 同域数据集对照
7.1 外周血/骨髓显微图像公开集景观
以 S0169260724005534 论文 Table 1 的对照口径为骨架(数字为该文口径,我们逐项注明来源语境):
| 数据集 | 图像数 | 类数 | 公开性 | 与本数据集的关系 |
|---|---|---|---|---|
| Matek BM(骨髓) | 171,374 | 21 | 非公开 | 规模与类目(含异常形态)远超,但学术访问受限——常被引作"更大的存在",不可实测 |
| Matek blood(外周血) | 18,365 | 15 | 非公开 | 含异常类目;同样不公开 |
| Acevedo(本条目) | 17,092 | 8 | CC BY 4.0 公开 | 最大纯正常血象公开集,事实上的公开基准锚点 |
| Raabin-WBC | 17,965 | 5 | CC BY 4.0 | 规模相近的公开同类;类目更粗(白细胞 5 类,无血小板/幼红) |
| BloodMNIST | 17,092 | 8 | CC BY 4.0 | 本数据集的 28×28 派生版(同数据不同皮) |
三个定位判断:
- "最大"要加限定词:外周血/骨髓显微图像公开集里,纯正常血象+全开放+单细胞粒度的组合下,17,092 张就是最大——不加限定词的"最大血细胞数据集"说法会被 Matek BM(171,374,不公开)打脸。
- 与 Raabin-WBC 是互补不是替代:Raabin 5 类白细胞口径更贴近"血常规人工分类"任务;Acevedo 8 组多了血小板、幼红细胞与 IG,且图像来自全自动 Core Lab 流水线(设备标准化更强)。
- BloodMNIST 行不是第五个数据集:它是本数据集的降采样皮——把两行加起来统计"血细胞数据集数量"是常见滑稽错误(坑 7)。
7.2 官方自我定位与十年回看
官方原话(Data in Brief 摘要):“据我们所知,这是首个拥有大数量正常外周血细胞的公开集,期望成为模型基准的 canonical dataset。”
十年回看,这个定位基本站住了:公开生态里"大样本正常血象单细胞集"至今仍以它为默认起点;后来的公开集要么更粗粒度(Raabin 5 类)、要么转向派生皮(BloodMNIST)、要么不公开(Matek 系)。它没有做成的是"异常细胞"半壁江山——那部分生态由不公开的骨髓集与零散小集分担。
7.3 正常与异常的边界:它不做的事
本数据集不含白血病原始细胞、不含异型淋巴细胞、不含疟原虫感染红细胞——所有"异常"都不在类目里。同团队的其他工作(如 Boldú 等急性白血病图像识别、Alférez 等异型淋巴细胞识别,见 Data in Brief 引文列表)说明研究组有异常细胞研究线,但从未公开同等规模的异常集。
使用含义:拿本数据集训练的 8 类分类器,遇到白血病原始细胞时会被迫输出 8 类之一(闭集假设)——把它直接当"血液病筛查器"是危险的误用;正确姿势是把它当"正常血象的形态学字典",异常检测需另建开集/OOD 机制(§5.5 出路 2)。
§8 生态与互链(库内条目)
8.1 库内家族图谱(条目名 + rid)
| 库内条目 | rid | 互链性质 | 建议强度 |
|---|---|---|---|
| medmnist | 716 | 实质派生关系:BloodMNIST 即本数据集 28×28 降采样版(MedMNIST+ 源字段明写 Acevedo) | ★★★ 首选 |
| herlev-pap | 483 | 同"显微镜细胞学图像分类"范式(宫颈细胞学) | ★★ |
| sipakmed | 490 | 同"显微镜细胞学图像分类"范式(宫颈液基细胞学) | ★★ |
| human-cell-atlas | 319 | 细胞生物学数据生态(单细胞转录组图谱,形态学↔分子对照叙事) | ★ |
| cellxgene | 38 | 细胞生物学可视化/数据生态 | ★ |
| jump-cell-painting | 563 | 高内涵细胞成像表型生态(图像表型 vs 形态学分类对话) | ★ |
互链叙事建议:与 medmnist 的互链要写"派生"而非"同域"(这是全库少有的直接父子关系,比类比式互链信息量大得多);与 herlev-pap/sipakmed 写"同范式跨器官"(同为显微镜单细胞分类,任务结构一致,可互引预处理经验);与 HCA/cellxgene/jump 写"图像形态学与分子图谱的生态位互补"。
8.2 检索路径建议
- 从 medmnist 条目进来的读者:告知"你手里的 BloodMNIST 上游就在本条目",原生 360×363 版本可解锁分辨率相关研究。
- 从 herlev-pap/sipakmed 进来的读者:关注 §3 标注流水线(工作站预标+专家复核范式在两个器官间的异同)与 §5.6 统计卫生(三套 split 的教训通用)。
- 从 hca/cellxgene 进来的读者:形态学分类与分子分型是细胞的两种"身份证",本条目提供图像侧的锚点。
8.3 外部生态位
- 教学:CC BY 4.0 + 规模适中 + 8 类直白,是"医学影像入门第一课"级的数据集(Kaggle/课程作业高频出现其派生皮)。
- 方法学试金石:新架构(KAN 变体、联邦学习、不确定性方法)论文里常见它当"标准测试床"——饱和基准的新用途。
- 行业对照:CellaVision 等商用数字形态学系统的学术公开参照物——它是外界能在同设备口径下对标的唯一大样本公开集。
8.4 与 medmnist(rid 716)条目的分工声明
本条目与 medmnist 条目存在全库唯一的父子派生关系(BloodMNIST 即本数据集的 28×28 降采样皮),为避免两文重复建设与叙事冲突,正式划定分工:
| 维度 | 本条目(acevedo-blood) | medmnist 条目(rid 716) |
|---|---|---|
| 数据本体 | 原生 360×363 JPG,17,092 张,8 类目录 | MedMNIST v2 全家桶视角,BloodMNIST 为其中一个 28×28 子集 |
| 采集链 | Advia 2120 → SP1000i → DM96 全链路(§3) | 不展开(引用本条目) |
| 染色协议 | MGG 机理与自动化标准化(§3.5) | 不展开 |
| 形态学 | 八组逐类档案与混淆地图(§2.7/§2.8) | 不展开 |
| 许可 | CC BY 4.0 原包口径(Mendeley,§6) | MedMNIST 分发口径(其 CC BY 4.0 继承声明) |
| 基准 | 原生分辨率口径:96.2% / 99.32% / 99.51% | 28×28 及 64/128/224 派生口径,MedMNIST 生态横向对比 |
| split | 官方自用 + 64/24/12 | 11,959/1,712/3,421 官方派生 split |
| 降采样工艺 | 记录工艺链与 MD5(§5.4.3) | 详述 MedMNIST 统一降采样框架 |
读者动线:
- 从 medmnist 条目来的读者:你在 28×28 上做的一切,其数据源头、采集链与原生分辨率基准在本条目;需要分辨率(>28 px)时直接取原包(§6.1),下载门槛与派生皮同样为零。
- 从本条目去 medmnist 条目的读者:轻量基准、几十个子集同台对比、教学工具链在彼处;用 BloodMNIST 做消融时先读彼处的统一降采样框架。
- 双条目共同承诺:凡涉派生关系,两文均写"派生"而非"同域",且统一采用 MedMNIST+ 的源声明口径(“A. Acevedo et al.”,事实清单第 24 条);任何一侧修订派生链表述,按附录 L 触发点同步另一侧。
为什么这条分工值得写进正文:派生关系是本条目区别于全库其他"同域对照"互链的结构性特征——它意味着两个条目不是互相补充的两个视角,而是同一批像素的两个分辨率化身。把分工钉死,读者在任一侧都能获得完整叙事,且不会把 BloodMNIST 误当独立数据集(坑 7 的条目级防线)。
§9 方法学启示:三条可迁移的经验
9.1 “工作站即流水线”:复用临床日常而不是另建标注管线
最值得抄的设计决策:数据集没有为研究新造一套标注流程,而是把 DM96 的临床在用流程(预分类+专家复核)整体复用。收益是零额外标注成本 + 设备级标准化 + 与真实检验场景零域差;代价是流程透明度受制于商用系统(§3.2 的三个缺口)。可迁移判断:凡是目标域已有成熟数字工作站的场景(骨髓、宫颈、尿液有形成分……),优先考虑"工作站复用"而非"从零手标"——但要预留透明度补偿措施(发布一致性数据、预分类改判率)。
9.2 "纯正常"的对照设计价值
只收健康供者、只设正常 8 组,这个"窄"成就了它的"纯":类别轴干净、无异常干扰、分布即真实血象。它与含异常类目的数据集(Matek BM 21 类)构成光谱两端——前者是"正常形态学字典",后者是"疾病形态学图谱"。设计启示:一个数据集不必贪大求全,把一个场景做纯,其对照价值会随生态成熟而上升(本条目在 OOD/开集研究里的"干净对照组"角色正是这种价值)。
9.3 派生链即传播链:被 BloodMNIST 载着走
本数据集的传播历史有个值得记录的结构:真正让它进入千千万万笔记本的,不是 Mendeley 原包,而是 MedMNIST 的 28×28 派生皮。派生品降低了使用门槛(一行 medmnist 代码),也带来了分辨率信息损失与"知其皮不知其源"的引用习惯(很多人引 BloodMNIST 论文而不引 Acevedo)。可迁移启示:大数据集的传播要主动经营"派生链"——官方若当年自己发布多分辨率派生版,就能把署名链握在自己手里;对使用者,从派生皮回溯原生数据(§6.1)常常能免费解锁一批分辨率敏感的研究方向。
§10 避坑清单:八个已踩过的坑
坑 1:arXiv:1701.01905 不是本数据集的论文。该编号实为数学论文(Korff, “Korff F-signatures of Hirzebruch surfaces”),与血细胞毫无关系;检索语境里的误引源可追溯到早期转引链。数据集论文的真源是 Data in Brief 30:105474(DOI 10.1016/j.dib.2020.105474,PMID 32346559)。引用前用 DOI 反查一次 PubMed 是 cheapest 的防错动作。
坑 2:"13 类白细胞"是印象错误。两篇官方论文均明写 eight classes/groups(8 组);官方另一个口径是"10 种类型分 8 组"——IG 组内含早幼粒/中幼粒/晚幼粒三子类(3+7=10)。"13 类"在任何官方文本中都不存在;以 13 类为口径的训练脚本大概率混入了别的数据集或自己拆的子类。
坑 3:"12,869 张"不是官方规模。S0169260724005534 论文 Table 2 的 Acevedo 列(IG 145、erythroblast 78 等,合计 12,869)是该论文自己标注的子集,不是官方分布;官方 Data in Brief Table 1 合计恰 17,092,且 arXiv 2110.09508 与 Wiley 202500387 两份独立第三方引用与官方一致。凡见到 12,869 口径,按"自标子集"处理,不可当官方数字转引。
坑 4:没有官方专名。“Acevedo dataset”“PBC Dataset”“PBC_Acevedo”“Peripheral Blood Cell dataset”“Blood Cell Microscope”(MedMNIST 口径)都指向同一批数据。按专名检索会漏;最稳的唯一标识是 Mendeley ID snkd93bnjr 与 Data DOI 10.17632/snkd93bnjr.1。
坑 5:没有官方固定 split。原始发布(Mendeley V1)无划分文件;文献里三套划分并行——2019 官方论文自用划分(96.2%)、arXiv 2110.09508 的 64/24/12(99.32%)、BloodMNIST 的 11,959/1,712/3,421。跨论文准确率不可直接对标;复现任何指标先问"哪个 split"。
坑 6:作者名与双论文,两个引用高频错误。一作全名是 Andrea Acevedo(不是 Adrián)、通讯是 José Rodellar(不是 Jordi)——PubMed 32346559 与 Recercat 机构库双源可证。另外 Data in Brief(2020,数据论文)与 Comput Methods Programs Biomed(2019,方法论文)分工不同:数据规格引前者、96.2% 基准引后者,混引会让审稿人困惑。
坑 7:BloodMNIST 不是"第五个血细胞数据集"。它是本数据集的 28×28 降采样派生版(MedMNIST+ 论文源字段明写 Acevedo),同 17,092 张、同 8 组。做文献统计或数据集对比表时把两行相加是滑稽错误;反之,若你只认识 BloodMNIST,本条目就是你的"回源指南"(§6.1)。
坑 8:Advia 2120 不是数据内容,CBC 数值不在包里。Advia 2120 全血分析仪只在采集链里当"守门员"(供者质控),它的血常规数值没有随数据集发布——把它当"影像+检验多模态数据集"是误读;这是纯图像数据集,唯一的"标注"就是 8 组目录名。
§11 总结
11.1 三句话总结
- 这是公开生态里最大最纯的正常外周血单细胞显微图像集:17,092 张、8 组 10 类型、360×363 px、专家标注、CC BY 4.0 全开放。
- 它的采集链(Advia 2120 → SP1000i → DM96)复用了临床 Core Laboratory 的日常流水线,设备级标准化是它作为基准的隐形竞争力。
- 它的下游派生(BloodMNIST/MedMNIST+)让 28×28 皮通行全球,而原生 360×363 版本与三套并行 split 的口径管理(§5.6)是引用前必做的功课。
11.2 适合谁
- 给实验室选"第一个血液显微图像数据集"的教学负责人——无 gate、CC BY 4.0、单卡可训,今天下午开工。
- 做细胞分类/细粒度识别方法研究的团队——8 组里粒系内部的相似类对是现成的细粒度难题。
- 做不确定性量化、开集识别、分布偏移研究的团队——饱和的闭集准确率让增量价值集中在这些轴上。
- 做 BloodMNIST 相关工作想"回源"的人——原生分辨率可能免费解锁一批新实验。
11.3 不适合谁
- 找异常细胞(白血病/疟疾/异型淋巴)数据的人——一概没有,闭集 8 类会"硬编"任何异常输入。
- 需要患者级划分、供者人口学、纵向数据的人——供者信息未披露,结构性缺口无法补。
- 需要全涂片/WSI 或细胞检测标注的人——单细胞裁剪粒度,检测任务无负样本无框。
- 需要影像+检验多模态的人——CBC 数值不在包里(坑 8)。
11.4 30 秒决策卡
| 你的需求 | 判断 |
|---|---|
| 正常血象单细胞分类基准,要公开许可 | ✓ 就是它 |
| 教学演示 / 单卡训练 / 轻量对比实验 | ✓ 规模与格式都友好 |
| 血液病检测、异常细胞识别 | ✗ 纯正常集,会误用 |
| 患者级建模 / 多模态(影像+CBC) | ✗ 元数据缺口 |
| 28×28 轻量基准 | 走 BloodMNIST 派生皮,但记得回本条目引用 |
FAQ(高频问答 38 问)
A. 基础认知
Q1:数据集的官方名字是什么?
没有注册专名。文献惯称 Acevedo dataset 或 PBC Dataset;Data in Brief 论文标题是 “A dataset of microscopic peripheral blood cell images for development of automatic recognition systems”;MedMNIST 生态里叫 Blood Cell Microscope(原生)与 BloodMNIST(派生)。
Q2:多少张图?
17,092 张,官方 Table 1 八组之和恰好此数:中性粒 3,329 / 嗜酸 3,117 / IG 2,895 / 血小板 2,348 / 幼红 1,551 / 单核 1,420 / 嗜碱 1,218 / 淋巴 1,214。
Q3:多少类?
目录级 8 组;类型级 10 种分 8 组(IG 组含早幼粒/中幼粒/晚幼粒三子类)。"13 类"是讹传(坑 2)。
Q4:图像什么规格?
360×363 像素 JPG,RGB,单细胞居中,无预处理原样保存。
Q5:谁做的?
西班牙双机构:Hospital Clinic de Barcelona(临床侧,Core Laboratory 采集与专家标注)+ 加泰罗尼亚理工 UPC(工程侧,方法研发);六作者,通讯 José Rodellar(UPC 数学系)。
Q6:发表在哪里?
双论文:数据集论文 Data in Brief 30:105474(2020,开放获取,PMID 32346559);方法论文 Comput Methods Programs Biomed 180:105020(2019-10,PMID 31425939)。
Q7:数据从哪来?
2015–2019 年 Hospital Clinic de Barcelona 健康供血者的外周血涂片,经 Advia 2120(质控)→ SP1000i(MGG 染色)→ CellaVision DM96(采图预分类)流水线数字化。
Q8:最大卖点一句话?
“首个大样本正常外周血细胞公开集”(官方原话),CC BY 4.0 无门槛开放,且你大概率已经用过它的 28×28 皮(BloodMNIST)。
B. 数据与获取
Q9:怎么下载?
Mendeley 托管页 https://data.mendeley.com/datasets/snkd93bnjr/1 → Download V1 全包。无需注册,无任何 gate。
Q10:许可什么条款?
CC BY 4.0:商用/衍生/再分发皆可,唯一义务是署名(引 Data in Brief 论文 + Data DOI 10.17632/snkd93bnjr.1)。
Q11:包里有什么文件?
8 个类别目录的 JPG(目录名即标签)。没有 CSV manifest、没有 split 文件、没有供者元数据(§3.4)。
Q12:有版本管理吗?
单一版本 V1(2020-06-08),DOI 固化快照,至今无 .2——引用无需版本辨析。
Q13:能下载更高/更低分辨率版本吗?
官方原生只有 360×363。降采样 28×28 与升级 64/128/224 px 版本走 MedMNIST 生态(BloodMNIST / MedMNIST+),均为派生品。
Q14:下载后怎么加载?
PyTorch torchvision.datasets.ImageFolder(root) 一行即用;或先 glob 按目录扫一遍自建 manifest。想要官方 split 结构可手动对齐 BloodMNIST 的 11,959/1,712/3,421(但那是派生皮划分)。
C. 标注与质量
Q15:谁标注的?
CellaVision DM96 机器预分类打底,临床病理专家(expert clinical pathologists,论文复数口径)逐张复核确认。
Q16:标注一致性有数据吗?
没有。论文未发布观察者间 κ 或改判率——标注可靠性是"临床资格背书"而非"量化背书",引用时写 expert-annotated 而非 consensus-annotated。
Q17:IG 组的三个子类能分开拿到吗?
不能。早幼粒/中幼粒/晚幼粒的逐张归属未随包发布,8 个目录就是标签的全部粒度。
Q18:图像质量有已知问题吗?
官方未发布质量分级或已知错误清单;五年无勘误公告。MGG 自动染色 + 商用工作站让采集端质量有临床质控背书,但个别样本的染色批次差异客观存在——做域泛化研究时这正是"真实世界变异"的一部分。
D. 基准与指标
Q19:官方基准多少?
2019 CMPB 论文:特征提取+SVM(VGG-16 86%、InceptionV3 90%),微调(VGG-16 96%、InceptionV3 95%),最佳总体 96.2%(Keras/TensorFlow + Titan XP 单卡)。
Q20:最高纪录多少?
第三方 27-CNN 全微调(arXiv 2110.09508,64/24/12 划分):最高 99.32%(Wide ResNet-50-2),最低 98.39%(AlexNet)。
Q21:96.2% 和 99.32% 能直接比吗?
不能干净地比——两套 split 不同(论文自用 vs 64/24/12)。见 §5.6 统计卫生守则。
Q22:BloodMNIST 上的指标能搬到原生版吗?
不能。28×28 与 360×363 是不同的任务难度;MedMNIST+ 的 64/128/224 档位就是为分辨率消融准备的。
Q23:固定口径下饱和了还能做什么?
三条出路:细粒度混淆分析(残错集中在粒系近邻类对)、OOD/开集/不确定性评测(饱和集当"干净对照组")、分辨率与数据效率消融(§5.5)。
Q24:有患者级划分吗?
没有,也无法有——供者归属未披露,所有 published split 都是图像级随机,跨集乐观偏差理论上存在但不可量化。
E. 库内与生态
Q25:和库内 medmnist 条目什么关系?
父子关系:BloodMNIST 是 medmnist 条目(rid 716)内含的子集,派生自本数据集。这是库内少见的直接派生互链,强于一般类比互链。
Q26:和 herlev-pap / sipakmed 什么关系?
同范式跨器官:同为显微镜单细胞分类(宫颈细胞学方向),任务结构与预处理经验可互移;类目体系与临床场景不同。
Q27:和 human-cell-atlas / cellxgene / jump-cell-painting 什么关系?
生态位互补:那边是单细胞分子图谱与高内涵成像表型,本条目是图像形态学分类锚点——"细胞的两种身份证"叙事的素材。
Q28:Matek 数据集更大,为什么本条目是公开基准锚点?
Matek BM 171,374 张/21 类确实更大,但非公开(学术访问受限);公开生态里"大样本+纯正常+全开放"的组合至今以本数据集为最大(§7.1)。
F. 工程与引用细节
Q29:写论文引用清单是什么?
数据:Acevedo et al., Data in Brief 30:105474 (2020),DOI 10.1016/j.dib.2020.105474 + Data DOI 10.17632/snkd93bnjr.1;方法/基准:加引 CMPB 180:105020 (2019);用 BloodMNIST:加引 MedMNIST v2 论文。
Q30:别引什么?
别引 arXiv:1701.01905(数学论文,坑 1);别引 12,869 口径(自标子集,坑 3);别把 BloodMNIST 行当独立数据集统计(坑 7)。
Q31:想复现 96.2% 怎么办?
按 2019 论文正文口径搭建(Keras/TensorFlow、Titan XP 级算力即可);注意论文摘要未给出划分精确样本数(遗留疑点),需要从正文方法节取口径。
Q32:数据包会用坏吗?
Mendeley/Elsevier 平台稳定 + DOI 固化,链接腐坏风险低;JPG 是最通用格式。若做长期项目,建议下载本地存档并记录 Data DOI 版本(V1)。
G. 进阶与边界问题
Q33:八组里哪组最好认、哪组最难认?
最好认:嗜酸(橙红粗颗粒)、嗜碱(深紫蓝遮核)、血小板(小而无核)——视觉签名过目不忘;最难的是 IG 组与成熟中性粒的边界(核形成熟连续谱)和大淋巴 vs 单核(§2.8 类对 1/2)。"总体准确率"掩盖的就是这两条类对的差异。
Q34:健康供者的血里为什么会有未成熟粒细胞和幼红细胞?
“正常"是供者维度质控(四条排除标准,§2.5)而非"每张图教科书正常”。健康人外周血可以零星见到反应性未成熟粒与少量有核红(尤其在感染与再生性贫血常见谱系内,论文配图原话);这 2,895 + 1,551 张正是这一真实谱系的采样,也是数据集"真实血象分布"的证明。
Q35:集成已经 99.51% 了,这个数据集还有研究价值吗?
有,但不在刷总准确率(§5.5):细粒度错误分析(类对 1/2)、OOD 与不确定性评测(闭集饱和集是天然干净对照组)、分辨率消融(28 px vs 64/128/224 vs 360×363)、染色归一化(§3.5.3)、以及新架构的"标准测试床"角色(Wiley 202500387 是最近例证)。
Q36:论文里引 BloodMNIST 的降采样工艺和 MD5 怎么写?
工艺链按 MedMNIST 官方口径:原生 3×360×363 → center-crop 3×200×200 → resize 3×28×28(§5.4.3);分发文件 MD5 7053d0359d879ad8a5505303e11de1dc;同时保留对上游的署名(Acevedo Data in Brief DOI),避免"知其皮不知其源"(§9.3)。
H. 数据工程细节
Q37:官方提供 train/val/test 划分吗?
不提供。官方包只有"目录即标签"的图像目录结构(§3.4);2019 CMPB 方法论文有自己的实验划分(FACTS 口径),但它不是随包发布的固定 split;64/24/12 是 27-CNN 第三方评测的划分(§5.4.1)。你的划分自定即可,但要连随机种子一起公开(附录 O 第 3 条),否则结果不可复现。
Q38:有逐张元数据(采集日期、供者 ID、子类归属)吗?
没有。这三样都列在"未随包发布"清单里(§3.4):供者精确人数论文未披露、无逐张采集日期、IG 子类归属未发布。这正是 DAIMS 评估中 M 维(元数据质量)成为最大短板的直接原因(附录 M),也是使用本数据集时"目录即标签"之外不能假设任何附加信息的原因(§2.6)。
事实清单(硬事实 36 条)
- 数据集含 17,092 张单细胞显微图像,官方 Table 1 八组之和恰为此数。
- 8 组分布:中性粒 3,329(19.48%)/嗜酸 3,117(18.24%)/嗜碱 1,218(7.13%)/淋巴 1,214(7.10%)/单核 1,420(8.31%)/IG 2,895(16.94%)/幼红 1,551(9.07%)/血小板 2,348(13.74%)。
- 图像规格:360×363 像素 JPG RGB,单细胞居中,无滤波无预处理。
- 采集设备链:Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字采图与预分类。
- 采集地点:Hospital Clinic de Barcelona 核心实验室(Core Laboratory)。
- 采集期:2015–2019。
- 供血者准入四条:无感染、无血液病、无肿瘤、采血时无相关药物治疗。
- 供血者精确人数未披露;随机 ID 匿名化。
- 标注:expert clinical pathologists(复数)复核 DM96 预分类。
- 官方口径:“first publicly available set with large numbers of normal peripheral blood cells”,期望成为 canonical dataset。
- IG 组官方说明含 promyelocytes/myelocytes/metamyelocytes 三子类——10 类型分 8 组。
- 六作者(PubMed/Recercat 全名):Andrea Acevedo(双隶属 Hospital Clinic+UPC)、Anna Merino、Edwin Santiago Alférez、Ángel Molina、Laura Boldú、José Rodellar(通讯,UPC)。
- Alférez 在 Data in Brief 时点隶属 Universidad del Rosario(波哥大)。
- 数据集论文:Data in Brief 30:105474 (2020),DOI 10.1016/j.dib.2020.105474,PMID 32346559,PMCID PMC7182702,ScienceDirect PII S2352340920303681,开放获取。
- 方法论文:Comput Methods Programs Biomed 180:105020 (2019-10),DOI 10.1016/j.cmpb.2019.105020,PMID 31425939。
- Mendeley Data 托管:snkd93bnjr/1,Version 1 发布于 2020-06-08,Data DOI 10.17632/snkd93bnjr.1,单一版本链无 .2+。
- 许可:CC BY 4.0(Mendeley 托管页直核);论文同为 Open Access(Recercat dc.rights 口径 CC BY 4.0)。
- Mendeley 主题标签:Platelet / Leukocyte / Hematopathology / Blood Cell;Related Article 链方法论文 DOI。
- 获取:免费公开下载,无注册、无申请 gate。
- 官方基准(2019 CMPB):特征提取+SVM VGG-16 86%、InceptionV3 90%;微调 VGG-16 96%、InceptionV3 95%;最佳总体 96.2%;环境 Keras/TensorFlow + Nvidia Titan XP。
- 第三方 27-CNN(arXiv 2110.09508):64/24/12 划分,最高 99.32%(Wide ResNet-50-2),最低 98.39%(AlexNet);引用类分布与官方一致。
- 第三方 Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN):确认 8 类口径。
- BloodMNIST(MedMNIST v2)派生自本数据集:同 17,092 张、8 类、28×28;官方 split 11,959/1,712/3,421。
- MedMNIST+(arXiv 2404.15786)Table 1:Blood 源字段 “A. Acevedo et al.”,Blood Cell Microscope,MC (8),Shannon’s Equitability 三个 split 均 0.96;提供 64/128/224 px 版本。
- 同域对照(S0169260724005534 Table 1 口径):Matek BM 171,374/21(非公开)、Matek blood 18,365/15(非公开)、Acevedo 17,092/8(公开)、Raabin-WBC 17,965/5(CC BY 4.0)。
- arXiv:1701.01905 为数学论文(Korff F-signatures of Hirzebruch surfaces),与本数据集无关——转引链误引已证伪。
- "13 类白细胞"无官方出处:两篇官方论文均写 eight classes/groups。
- 12,869 口径(S0169260724005534 Table 2)系该论文自标子集,非官方分布。
- 原始发布无固定 train/val/test 划分文件;文献三套 split 并行(2019 论文自用 / 64-24-12 / 11,959-1,712-3,421)。
- 数据包无 manifest、无供者元数据、无子类归属、无采集日期映射——目录即标签是全部标注粒度。
- 观察者间一致性系数未发布;机器预分类改判率未披露。
- 数据集不含异常细胞类目(白血病原始细胞、异型淋巴等均不在 8 组内)。
- 同团队有异常细胞研究线(Boldú 急性白血病识别、Alférez 异型淋巴细胞识别,见 Data in Brief 引文列表),未公开同等规模数据。
- Advia 2120 的 CBC 数值不随数据集发布——纯图像数据集。
- Mendeley 分类标签与论文关键词(Blood cell automatic recognition; Blood cell morphology; Deep learning; Hematological diagnosis 等)与托管页一致。
- 抓取核验时点:2026-09-29(Mendeley 托管页、PubMed 32346559、Recercat hdl 2117/386919、arXiv 2404.15786 等多源)。
术语表(34 条)
| 术语 | 释义 |
|---|---|
| 外周血(peripheral blood) | 循环血液,区别于骨髓穿刺样本;血涂片镜检的对象 |
| 血涂片(blood smear) | 血液薄涂于玻片经染色后的显微镜样本 |
| May-Grünwald-Giemsa(MGG) | 血细胞形态学标准染色法之一,嗜酸/嗜碱颗粒在此染色下色差分明 |
| CBC | Complete Blood Count,全血计数;Advia 2120 的输出,本数据集未含其数值 |
| 中性粒细胞(neutrophil) | 成熟粒系白细胞,分叶核;正常白细胞中占比最高 |
| 嗜酸性粒细胞(eosinophil) | 粗大橙红颗粒为特征的白细胞,过敏与寄生虫应答相关 |
| 嗜碱性粒细胞(basophil) | 深紫蓝颗粒的白细胞,正常血中最稀少者之一 |
| 淋巴细胞(lymphocyte) | 圆核致密染色质的免疫细胞,T/B/NK 总称 |
| 单核细胞(monocyte) | 大型不规则核白细胞,巨噬细胞前体 |
| 未成熟粒细胞(IG) | 粒系前体(早幼粒/中幼粒/晚幼粒),正常外周血罕见,感染与再生性贫血时可见 |
| 早幼粒/中幼粒/晚幼粒(promyelocyte/myelocyte/metamyelocyte) | 粒系成熟三阶段,本数据集合并为 IG 组,子类归属未随包发布 |
| 幼红细胞(erythroblast) | 有核红细胞前体,正常外周血少量可见 |
| 血小板(platelet/thrombocyte) | 无核细胞碎片,凝血要素;本数据集类目之一 |
| 正常血象(normal hematologic profile) | 供者无相关疾病与用药背景下的血细胞形态谱,本数据集的准入定义 |
| CellaVision DM96 | 数字形态学工作站:自动定位白细胞、裁剪视野、机器预分类;本数据集的采集设备 |
| Advia 2120 | 全自动血液分析仪(CBC 输出),采集链中的质控守门员 |
| Sysmex SP1000i | 自动推片染色机,MGG 染色标准化者 |
| 单细胞图像(single-cell image) | 每图恰一个居中细胞的裁剪图像;区别于多细胞视野与全涂片 WSI |
| WSI | Whole Slide Image,全切片扫描图像;本数据集不含 |
| 目录即标签(directory-as-label) | 用文件夹结构承载类别标签的数据组织约定,ImageFolder 类工具的输入格式 |
| 闭集假设(closed-set) | 模型假设所有输入属于训练类目之一;本数据集 8 类分类器的固有局限 |
| Shannon’s Equitability | 类别均衡度指标(0 全偏斜–1 全均衡);MedMNIST+ 口径本数据集三个 split 均 0.96 |
| BloodMNIST | MedMNIST v2 中派生自本数据集的 28×28 子集,官方 split 11,959/1,712/3,421 |
| Data DOI | 数据集自身的 DOI(10.17632/snkd93bnjr.1),与论文 DOI 分开引用 |
| 核左移(left shift) | 杆状核等较幼稚中性粒比例增高的血象改变,感染/炎症的形态学信号;本数据集不含杆状核独立类目,此类样本归入中性粒或 IG 组 |
| 嗜天青颗粒(azurophilic granule) | 粒系细胞胞质内的初级颗粒(MGG 紫红色),早幼粒阶段最密集;IG 组与单核组判别的核心特征 |
| 分叶核(segmented nucleus) | 成熟中性粒的核形态(2–5 叶、细丝相连);与 IG 晚幼粒"肾形核"的边界是类对 1 难度的来源 |
| 血红蛋白化(hemoglobinization) | 红系前体胞质随血红蛋白积累从深蓝转灰红的着色过程;幼红细胞组内色域跨度的成因 |
| 核质比(N/C ratio) | 细胞核与胞质面积之比;小淋巴"核占九成"即高核质比的教科书示例 |
| 细粒度分类(fine-grained classification) | 类间差异集中于细微局部特征的分类任务设定;本数据集残余错误的主要学术语境 |
| 类对混淆(class-pair confusion) | 错误集中于特定近邻类对的现象;本数据集的五条类对见 §2.8 地图 |
| 投票集成(voting ensemble) | 多模型输出按多数票合并的集成方式;arXiv 2110.09508 的 top-4 集成达 99.51%(§5.4.2) |
| 中心裁剪(center-crop) | 取图像中心区域的降采样操作;BloodMNIST 工艺链第一步(360×363 → 200×200,§5.4.3) |
| 染色归一化(stain normalization) | 把图像映射到参考染色域的预处理方法族;应对跨染色域漂移(§3.5.3)的标准工具 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | acevedo-blood |
| 通用名 | Acevedo dataset / PBC Dataset |
| 类型 | 纯图像数据集(单细胞分类) |
| 论文 | Data in Brief 2020;30:105474 + CMPB 2019;180:105020 |
| 团队 | Hospital Clinic de Barcelona + UPC(通讯 José Rodellar) |
| 规模 | 17,092 张(8 组,360×363 px JPG) |
| 许可 | CC BY 4.0(单一许可) |
| 获取 | Mendeley Data 免费直链,无 gate |
| 抓取时点 | 2026-09-29 |
| 库内互链 | medmnist(716)/herlev-pap(483)/sipakmed(490)/human-cell-atlas(319)/cellxgene(38)/jump-cell-painting(563) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | Data in Brief 开放获取 + PubMed/PMCID 可索引 + Mendeley 主题标签;失分项:无官方专名导致检索分散(坑 4)、"13 类/12,869"等讹误口径污染检索结果 |
| A 可获取性 | 10 | Mendeley 免费公开直链、无注册无申请、CC BY 4.0、DOI 固化快照——库内最开放档 |
| I 可互操作 | 7 | JPG+目录即标签,ImageFolder/glob 即用;MedMNIST 生态提供 npz/Python 包接口;失分项:无 manifest、无标准元数据 schema、子类与供者信息缺失 |
| M 元数据质量 | 6 | 官方 Table 1 分布完备且被两份独立第三方复证;失分项:无供者元数据、无一致性数据、无官方 split、无逐张采集日期 |
| S 可持续性 | 8 | Mendeley/Elsevier 平台稳定 + Data DOI 版本固化(.1 快照永续解析)+ 单一版本五年零勘误;失分项:无官方维护社区、派生链(BloodMNIST)由第三方经营 |
| 综合评级 | 7.6/10(良好偏上) | 可获取性与可持续性接近满分,元数据工程完备性是唯一系统性短板——"开放但朴素"的典型样本 |
附录 C:逐项证据链自证
| 关键数字/事实 | 来源 | 位置/方式 |
|---|---|---|
| 17,092 总量与八组分布 | Data in Brief 论文 Table 1 | PubMed 摘要 + Europe PMC 镜像全文核 |
| 360×363 px JPG、"eight groups"表述 | Data in Brief 摘要 | PubMed 32346559 页面原文 |
| 供者四条排除标准 | Data in Brief 摘要 | PubMed 32346559 页面原文 |
| "first publicly available set…"定位 | Data in Brief 摘要 | PubMed 32346559 页面原文 |
| DM96 / Core Laboratory 采集 | Data in Brief 摘要 | PubMed 32346559 页面原文 |
| 96.2%/96%/95%/90%/86% 基准 | CMPB 方法论文 | PubMed 31425939 + OpenAIRE 双源 |
| 27 CNN / 99.32% / 98.39% / 64-24-12 | arXiv 2110.09508 | 摘要与正文核 |
| CC BY 4.0 / V1 2020-06-08 / DOI | Mendeley 托管页 | data.mendeley.com/datasets/snkd93bnjr/1 直核 |
| BloodMNIST 派生与官方 split | MedMNIST+ 论文 Table 1 + clustpy 文档 + 第三方仓库 | arXiv 2404.15786 / 三源互证 |
| 作者全名与隶属 | PubMed 32346559 + Recercat | 双源比对 |
| 同域对照数字 | S0169260724005534 Table 1 | 论文表格转引(第三方口径,注明) |
| arXiv:1701.01905 证伪 | arXiv 官方页 | 编号直查 |
| 12,869 子集证伪 | S0169260724005534 Table 2 上下文 | 该论文自标口径说明 |
附录 D:数据获取决策树
你的需求?
├── 原生 360×363 px 图像(方法研究/细粒度/分辨率消融)
│ └── Mendeley snkd93bnjr/1 → CC BY 4.0 → ImageFolder 加载 → 自建 manifest
├── 28×28 轻量基准(AutoML/教学/快速基线)
│ └── BloodMNIST(medmnist Python 包)→ 记得加引 MedMNIST v2 + Acevedo
├── 中高分辨率(64/128/224)消融
│ └── MedMNIST+(arXiv 2404.15786 配套发布)
├── 需要官方 train/test 划分
│ └── 没有(坑 5)→ 自划并声明,或对齐 BloodMNIST split 以便可比
├── 需要异常细胞(白血病/疟疾/异型淋巴)
│ └── 本数据集没有 → 转向含异常类目的同域集(多数不公开,§7.1)
└── 需要影像+CBC 多模态
└── 本数据集没有(坑 8)→ CBC 数值需另寻电子病历生态
附录 E:八组速算表(占比核对用)
| 组 | 张数 | 占比 | 与全集比(1/X) |
|---|---|---|---|
| neutrophils | 3,329 | 19.48% | 1/5.1 |
| eosinophils | 3,117 | 18.24% | 1/5.5 |
| IG | 2,895 | 16.94% | 1/5.9 |
| platelets | 2,348 | 13.74% | 1/7.3 |
| erythroblasts | 1,551 | 9.07% | 1/11.0 |
| monocytes | 1,420 | 8.31% | 1/12.0 |
| basophils | 1,218 | 7.13% | 1/14.0 |
| lymphocytes | 1,214 | 7.10% | 1/14.1 |
| 合计 | 17,092 | 100.00% | — |
采样提示:加权采样把各组拉平(每类约 12.5%)会人为抹掉真实血象结构;若做"临床仿真"评测,保留原始占比更有生态效度。
附录 F:坑点档案(与 §10 对照)
| 坑 | 错误口径 | 正确口径 | 危害等级 |
|---|---|---|---|
| 1 | arXiv:1701.01905 是数据集论文 | Data in Brief 10.1016/j.dib.2020.105474 | 中(引用错链) |
| 2 | 13 类白细胞 | 8 组(10 类型分 8 组) | 高(任务定义错) |
| 3 | 12,869 张官方规模 | 17,092 张;12,869 是第三方自标子集 | 高(规模错) |
| 4 | 按专名检索 | 无专名;认 Mendeley ID snkd93bnjr | 低(漏检) |
| 5 | 有官方 split | 无;三套 split 并行 | 高(指标不可比) |
| 6 | Adrián/Jordi 作者名 | Andrea Acevedo / José Rodellar | 中(署名错误) |
| 7 | BloodMNIST 是独立第五集 | 它是本数据集 28×28 派生皮 | 低(统计滑稽) |
| 8 | 影像+CBC 多模态 | 纯图像,CBC 不在包内 | 中(任务误设) |
附录 G:双口径登记表
| 议题 | 口径 A | 口径 B | 采信与理由 |
|---|---|---|---|
| 类目数 | 8 组(目录级) | 10 类型(IG 拆三子类) | 并行采信:工程以 8 为准、形态学表述可注 10,均为官方原话 |
| 规模 | 17,092(官方) | 12,869(第三方自标子集) | 采信 17,092:官方 Table 1 + 两份独立第三方复证 |
| 划分 | 官方论文自用(96.2%) | 64/24/12(99.32%);11,959/1,712/3,421(BloodMNIST) | 并行记录、禁止跨口径对标 |
| 分辨率 | 360×363(原生) | 28×28 / 64 / 128 / 224(MedMNIST 系派生) | 并行记录,引用注明分辨率 |
| 作者首名 | Andrea/José(PubMed+Recercat 双源) | Adrián/Jordi(转引链误传) | 采信双源全名 |
附录 H:FAIR / AI-Ready 检查单
| 检查项 | 状态 |
|---|---|
| F1 元数据有全局唯一标识 | ✓ Data DOI 10.17632/snkd93bnjr.1 |
| F2 数据有持久标识 | ✓(同上,Mendeley 版本固化) |
| F3 元数据含数据描述符 | 部分(有描述与标签体系;无逐张元数据) |
| F4 元数据可索引 | ✓(Mendeley/PubMed/Google Dataset Search 可见) |
| A1 可检索 | ✓(但专名缺失拉低命中率,坑 4) |
| A2 可访问(协议标准) | ✓ HTTPS 直链,无认证 |
| A3 元数据即认证失效仍可及 | ✓(DOI 记录独立于数据文件) |
| I1 数据用开放格式 | ✓ JPG |
| I2 词汇表符合社区标准 | 部分(目录名即标签,无受控词表映射) |
| I3 元数据含合格引用 | ✓(论文 DOI + Data DOI 双链) |
| R1 许可明确 | ✓ CC BY 4.0 |
| R2 出处(provenance)可查 | 部分(论文级出处清晰;图像级溯源为零) |
| R3 社区标准meet | ✓(Data in Brief 发布流程) |
| AI-Ready 综合 | 开放性满分、元数据工程为短板:适合"即取即用",不适合"溯源审计" |
附录 I:基于本数据集的研究检查清单(10 项)
- 明确声明用哪个 split(自划/64-24-12/BloodMNIST 划分),不得含糊。
- 明确声明分辨率(原生 360×363 或 MedMNIST 系派生档)。
- 引用三件套按 §4.3 组合,勿引 arXiv:1701.01905。
- 报告总体准确率时附分组召回或混淆矩阵(低频组差异被均值掩盖)。
- 不要把模型表述为"血液病筛查工具"(闭集 8 类,§7.3)。
- 涉及"患者级"表述前重读 §5.6 第 3 条——供者归属不可得。
- 衍生数据产品保留 CC BY 4.0 署名链。
- 做域泛化/染色归一化研究时,把 MGG 自动染色的标准化背景写进方法学(§2.4)。
- 使用 BloodMNIST 指标对比时,注明与原生版的粒度差异(坑 7/§5.6 第 2 条)。
- 新造 manifest/split 时随数据一起发布(填补社区缺口的第一步)。
附录 J:图像加载与 manifest 生成骨架(代码)
# 环境:Python 3.10+,Pillow,pandas
import os, hashlib
import pandas as pd
from PIL import Image
ROOT = "snkd93bnjr-1" # 解压后的 Mendeley V1 包根目录
# 1) 生成 manifest:目录即标签
rows = []
for cls in sorted(os.listdir(ROOT)):
d = os.path.join(ROOT, cls)
if not os.path.isdir(d):
continue
for fn in os.listdir(d):
p = os.path.join(d, fn)
h = hashlib.md5(open(p, "rb").read()).hexdigest() # 查重/对账用
rows.append({"path": p, "label": cls, "md5": h})
df = pd.DataFrame(rows)
assert len(df) == 17092, f"期望 17092,实际 {len(df)}" # 官方总量自检
print(df["label"].value_counts()) # 对齐附录 E 速算表
# 2) 图像规格抽检(官方口径 360x363 JPG RGB)
with Image.open(df["path"].iloc[0]) as im:
print(im.size, im.mode) # -> (360, 363) RGB
# 3) 分层划分示例(图像级;注意 §5.6 第 3 条患者级不可得)
from sklearn.model_selection import train_test_split
tr, tmp = train_test_split(df, test_size=0.3, stratify=df["label"], random_state=42)
va, te = train_test_split(tmp, test_size=0.4, stratify=tmp["label"], random_state=42)
tr.to_csv("train.csv", index=False); va.to_csv("val.csv", index=False); te.to_csv("test.csv", index=False)
附录 K:缩写速查
| 缩写 | 全称 |
|---|---|
| PBC | Peripheral Blood Cell |
| CBC | Complete Blood Count |
| MGG | May-Grünwald-Giemsa(染色法) |
| IG | Immature Granulocytes(未成熟粒细胞) |
| WBC | White Blood Cell |
| CMPB | Computer Methods and Programs in Biomedicine(期刊) |
| PMC | PubMed Central |
| WSI | Whole Slide Image |
附录 L:维护计划与触发点
| 触发点 | 动作 |
|---|---|
| Mendeley 出现 .2 版本 | 核对新版 changelog,更新 §6.3 与事实清单第 16 条 |
| 官方发布一致性数据或子类归属 | 更新 §3.2、§2.3 与 DAIMS 的 M 维评分 |
| MedMNIST 生态换 BloodMNIST 源声明 | 复核派生链表述(事实清单第 23/24 条) |
| 出现新的公开同域集(规模/许可超越) | 更新 §7.1 景观表与"最大纯正常"定位限定词 |
| 文献出现新的 SOTA 或新任务轴 | 更新 §5 基准节 |
附录 M:DAIMS 24 项细评
评分 1–10(10 为完全满足);与附录 H FAIR 检查单口径互相锚定,逐项给出判分依据。
| # | 维度项 | 分 | 依据 |
|---|---|---|---|
| D1 | 可发现性·全局唯一标识 | 10 | Data DOI 10.17632/snkd93bnjr.1 版本固化(§6.1) |
| D2 | 可发现性·富元数据 | 6 | 论文级描述、主题标签齐全;无逐张元数据 |
| D3 | 可发现性·标准索引收录 | 9 | PubMed(PMID 32346559)、Google Dataset Search、Mendeley 检索均可达 |
| D4 | 可发现性·检索友好度 | 5 | 无官方专名(坑 4),转引名混乱拉低命中率 |
| A1 | 可获取性·标准协议 | 10 | HTTPS 直链下载,无认证 |
| A2 | 可获取性·元数据持久 | 9 | DOI 记录独立于文件存活 |
| A3 | 可获取性·数据持久 | 9 | Mendeley/Elsevier 平台稳定,V1 单版本链 |
| A4 | 可获取性·获取门槛 | 10 | 无注册、无申请、无 gate(§6.1) |
| I1 | 互操作·开放格式 | 10 | JPG + 目录结构,任何栈可读 |
| I2 | 互操作·受控词表 | 4 | 目录名即标签,无 SNOMED/ICD-O 类标准映射 |
| I3 | 互操作·工具兼容 | 10 | ImageFolder 一行加载(§3.4/附录 J) |
| I4 | 互操作·标准引用 | 9 | 论文 DOI + Data DOI 双链(事实清单第 14/16 条) |
| M1 | 元数据·数据字典 | 3 | 无 manifest/CSV/JSON(§3.4 未发布清单第 6 条) |
| M2 | 元数据·采集协议记录 | 7 | 设备三站链与排除标准有论文级记录;逐日规程未附 |
| M3 | 元数据·标注协议记录 | 5 | "DM96 预分类 + 专家复核"两级口径有,人数/一致性缺口(§3.2) |
| M4 | 元数据·质控记录 | 6 | 供者四条排除标准 = 供者级质控声明;图像级质控无记录 |
| M5 | 元数据·划分定义 | 2 | 无官方 split;三套并行划分全靠社区自持(§5.6 第 1 条) |
| M6 | 元数据·溯源信息 | 2 | 供者人数、图像-供者映射、采集日期映射全缺(§2.5) |
| M7 | 元数据·版本管理 | 9 | Mendeley 版本链清晰(V1,2020-06-08) |
| M8 | 元数据·已知问题披露 | 7 | 论文自述局限 + 本条目存照体系(附录 G)补足社区披露 |
| S1 | 可持续·持久托管 | 10 | DOI 固化 + 学术出版社托管 |
| S2 | 可持续·许可明确 | 10 | CC BY 4.0(§6.1) |
| S3 | 可持续·维护主体 | 7 | 作者/机构链可考;无公开维护计划或 issue 渠道 |
| S4 | 可持续·社区生态 | 10 | MedMNIST 派生 + 236 次引用 + 持续第三方评测(§5.4) |
汇总:D 30/40、A 38/40、I 33/40、M 41/80、S 37/40,总分 179/240(74.6%)。形状是典型的"开放性满分、元数据工程短板"——A/I/S 三维接近满贯,M 维的 M1/M5/M6 三项(manifest、split、溯源)合计仅 7/30,是全部失分深坑所在,也与 §10 的坑位清单一一对应。
附录 N:第三方与派生基准汇总表
全部已核基准的单一入口表;口径限定词一律随行给出(§5.6 统计卫生的表格化执行)。
| 来源 | 划分 | 分辨率 | 模型/口径 | 准确率 | 引用限定词 |
|---|---|---|---|---|---|
| 官方方法论文(CMPB 180:105020,2019) | 论文自用(未公开精确样本数) | 360×363 | 特征提取+SVM:VGG-16 / InceptionV3 | 86% / 90% | “官方特征提取路线” |
| 同上 | 同上 | 360×363 | 微调:VGG-16 / InceptionV3 | 96% / 95% | “官方微调路线” |
| 同上 | 同上 | 360×363 | 微调最佳总体 | 96.2% | “官方基准” |
| arXiv 2110.09508(27-CNN) | 64/24/12 | 360×363 | AlexNet(27 架构最低) | 98.39% | “第三方单模型下限” |
| 同上 | 64/24/12 | 360×363 | Wide ResNet-50-2(27 架构最高) | 99.32% | “第三方单模型上限” |
| 同上 | 64/24/12 | 360×363 | 投票集成 top-4(WRN-50-2 + VGG-19 + WRN-101-2 + ResNet-34) | 99.51% | “固定口径已发表上限” |
| MedMNIST v2(BloodMNIST) | 11,959/1,712/3,421 | 28×28 | 生态基线(详见 medmnist 条目) | 见派生条目 | “28×28 派生口径” |
| MedMNIST+(arXiv 2404.15786) | 同上 | 64/128/224 | 升级分辨率基线 | 见派生条目 | “MedMNIST+ 升级档” |
| Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN) | 自定 | 360×363 | BiT-HyMLPKAN 混合架构 | 见原文 | “新架构试金石” |
使用守则:
- 表内任何两行不可跨口径比较(划分、分辨率、任务设定至少一项不同);
- 转引 99.51% 必须带"投票集成 + 64/24/12"限定词(§5.4.2 第 3 条);
- 12,869 口径(自标子集)不入本表(坑 3);13 类口径无官方出处不入本表(坑 2)。
附录 O:细粒度子类研究路线(IG 三拆与形态学进阶)
本附录回答一个进阶问题:想在这批图上做比"8 组分类"更细的研究,路怎么走?前提事实:官方包只发布到 8 组粒度,IG 组内部的早幼粒/中幼粒/晚幼粒三子类归属未随包发布(§3.4),官方口径是"10 种类型、分 8 组"(§2.3)。
O.1 为什么值得拆
- 临床含义不同:早幼粒异常增殖对应急性早幼粒细胞白血病谱系,晚幼粒/中幼粒增多见于感染、骨髓增殖性疾患等(§2.7.3);"IG 总量"无法区分这些场景。
- 方法学价值:组内拆分是典型的细粒度分类问题(术语表:细粒度分类),难度轴从"组间"降到"组内",恰好是 2.8 混淆地图里最难那几条类对的延伸。
- 空白即机会:官方未发布,任何严谨的拆分成果都是增量贡献——但正因如此,更不能把自己的拆分结果误传成"官方标签"(O.4 红线)。
O.2 三条可行路线
| 路线 | 做法 | 优势 | 硬约束 |
|---|---|---|---|
| ① 自标注 | 对 IG 组 2,895 张做双人独立标注 + 分歧仲裁,报告一致性系数(如 Cohen’s kappa) | 标签质量可控,可发表 | 需要具备血液形态学资质的标注者;标注协议先于标注冻结 |
| ② 外部参照迁移 | 用含粒系成熟阶段细分的参照集做迁移学习或对照设计 | 省标注成本 | 最大参照(Matek 骨髓集,21 类含成熟阶段轴)非公开,只能作设计参照;公开的 Raabin-WBC(17,965 张、5 类、CC BY 4.0)无 IG 拆分,仅可作粒系旁证(§7.1) |
| ③ 弱监督起点 | 以采集工作站(DM96)的预分类机制为启发,做弱监督/主动学习 | 贴合采集链故事(§9.1) | 官方只发布了专家确认后的组级标签,逐张机器预分类分数未随包发布,不能直接拿来当软标签 |
三条路线不互斥:常见的组合是"② 定模型、① 定标签、③ 降标注量"。
O.3 评估协议建议
- 主指标用宏平均 F1 而非准确率:八组虽相对均衡(Shannon’s Equitability 0.96,MedMNIST+ 口径),但组内拆分后子类样本量差异会被放大(IG 2,895 拆三份后,最小子类可能只有数百张),准确率会被大类掩盖问题。
- 必报类对混淆矩阵:拆分研究的贡献就体现在组内类对上,只报总体指标等于没做(呼应 2.8 的五条难度轴)。
- split 与种子公开:本数据集无官方 split(§3.4),你的 64/24/12 式划分(§5.4.1 同款)必须连随机种子一起公开,否则结果不可复现。
- 与 96.2%/99.32% 这类组级基准不比较:任务不同(组级 8 类 vs 子类级 10 类),数字放同一张表就是制造新的讹误口径(附录 N 使用守则第 1 条同理)。
O.4 红线
- 拆分成果表述为"本研究的标注/划分",不得表述为"数据集自带的子类标签"——坑 2(“13 类”)与坑 3(“12,869 子集”)都是第三方的自选口径被读者误当官方事实的先例(§10)。
- 引用时保持双 DOI 口径(§4.3),并注明所用版本与拆分协议版本。
附录 P:教学与演示场景使用指南
§11.2 把"教学演示"列进适合谁,本附录把这句话展开成可执行的课表设计。教学场景对数据的要求与科研不同:构图干净、类别均衡、错误代价低——本数据集恰好三项全占。
P.1 为什么适合教学
| 教学需求 | 本数据集的对应供给 |
|---|---|
| 学生看图识类,需要"一图一细胞"的干净构图 | 单细胞居中裁剪,每图恰一个目标(术语表:单细胞图像) |
| 出题需要类别覆盖均衡,避免某类永远缺席 | 8 组占比 7.10%-19.48%,Shannon’s Equitability 0.96(§2.1) |
| 课程时间有限,需要"当天下载当天跑通" | Mendeley 免费直链 + 目录即标签,ImageFolder 十行加载(§6.5、附录 J) |
| 需要真实临床质感而非玩具数据 | Advia 2120 → SP1000i → DM96 真实临床采集链(§2.4),染色与设备伪影都保留原样 |
P.2 出题设计:按混淆地图设难度梯度
直接拿 2.8 的五条类对难度轴当命题大纲:
- 初级(组间、形态差异大):中性粒 vs 淋巴 vs 血小板——核形、胞浆、尺寸三个维度全线拉开,适合第一课建立"先看什么"的观察顺序。
- 中级(同尺寸、不同谱系):大淋巴细胞 vs 单核细胞——都是大细胞,考"核染色质质地 + 胞浆颗粒"两个细节。
- 高级(组内近邻):晚幼粒 vs 成熟中性粒、中幼粒 vs 早幼粒——考核质比与颗粒演化(术语表:核质比、核左移),适合形态学进阶课或检验技术专业的实习前热身。
出题引擎不需要写新代码:按目录分层抽样,再按上述类对过滤即可;速查背卡用附录 Q 的八组识别卡,每题配 2.7 对应小节做标准答案的讲解底稿。
P.3 演示工作流
课程演示的最短路径:附录 J 的加载骨架 + 任意预训练 CNN 微调三五个 epoch,课堂当场看到从随机猜测到 90%+ 的收敛过程——这个数据集规模(1.7 万张)恰好小到笔记本可跑、又大到曲线像样。若课堂机器算力紧张,改用 BloodMNIST 28×28 派生皮演示训练、再用原图做"高清回看"环节,两个数据集的分工见 §8.4。
P.4 教学红线
- 不得用于任何自我诊断或健康评估——本数据集是正常血象的科研图像,不是诊断工具,也不含个体临床信息(§3.3 匿名化口径)。
- 教学判读 ≠ 临床判读:学生练习给出的分类意见没有任何临床效力,课程说明里应显式写明。
- 署名义务照常:教学材料公开发布(课件、题库、开源课程仓库)同样触发 CC BY 4.0 的署名条款(§6.2),双 DOI 三件套(§4.3)一次写全。
附录 Q:八组识别速查卡(考场/出题两用)
把 §2.7 八份逐类档案浓缩成一张速查卡。三列形态描述均为 MGG 染色下的典型表现(§3.5);"最易混"列直接对应 2.8 的五条类对难度轴;"一秒口诀"只求课堂好记,不构成任何判读依据(附录 P 红线第 2 条)。
| 组(张数,占比) | 核 | 胞浆与颗粒 | MGG 主色调 | 最易混 | 一秒口诀 |
|---|---|---|---|---|---|
| 中性粒(3,329,19.48%) | 分叶 2-5 叶,叶间有丝相连 | 量多,细中性颗粒,几乎不见粗颗粒 | 粉紫胞浆 + 紫红核 | 晚幼粒(分叶度) | “分叶索丝” |
| 嗜酸(3,117,18.24%) | 多为双叶,眼镜状 | 粗大、均匀、满布 | 橙红/砖红颗粒夺目 | 几乎无强对手(颗粒独一无二) | “眼镜 + 砖红” |
| IG(2,895,16.94%) | 圆/肾形/凹陷,核质比高 | 嗜天青颗粒(紫红,粗于中性细颗粒) | 深紫核 + 灰蓝/淡紫胞浆 | 单核、早幼粒 vs 单核(§2.8 中高难) | “幼稚核 + 嗜天青” |
| 血小板(2,348,13.74%) | 无核 | 极小,紫红颗粒碎屑,常见聚集 | 紫红小点 | 染色杂质(低难,簇状时易误判) | “无核小碎屑” |
| 幼红(1,551,9.07%) | 圆,深染致密,核质比极高 | 随成熟由深蓝转向灰蓝/粉(血红蛋白化) | 深蓝核 + 蓝转粉胞浆 | 小淋巴(核质比与胞浆色) | “墨点核 + 渐变浆” |
| 单核(1,420,8.31%) | 肾形/折叠,染色质疏松 | 量大,细尘样颗粒 | 灰蓝胞浆 + 灰紫核 | 大淋巴(染色质质地) | “肾形折叠 + 尘浆” |
| 嗜碱(1,218,7.13%) | 常被颗粒遮盖难辨 | 粗大深紫黑颗粒,可遮核 | 深紫黑颗粒主导 | 被遮盖时难辨(低样本 + 难辨认双重,§2.7.7) | “黑颗粒遮核” |
| 淋巴(1,214,7.10%) | 圆,深染,占满 | 少,薄环状 | 天蓝薄环 + 深紫核 | 幼红、单核(大淋巴时) | “深核薄蓝环” |
使用说明:
- 本卡是 §2.7 档案的检索替身——速查用本卡,讲透用 §2.7;两处的形态表述同源,出现分歧时以 §2.7 为准。
- “典型表现"不等于"每张都长这样”:染色批次、细胞状态都会造成偏移(§3.5.2 的"三固定"只能收窄不能消除),出题时优先抽典型样本,进阶讨论再上边界样本。
- 表内数字为官方 Table 1 硬数字(§2.1),与附录 E 速算表一致;引用时按 §4.3 双 DOI 口径。
尾注
本条目由千方病案医数集 AI-Ready Wikipedia 写手流水线生产。事实核验时点 2026-09-29:数据本体以 Data in Brief 官方 Table 1 与 PubMed 32346559 记录为最高权威源;许可与获取以 Mendeley 托管页(snkd93bnjr/1)直核为准;派生链以 MedMNIST+ 论文(arXiv 2404.15786)、clustpy 文档与第三方仓库三源互证;作者名与隶属以 PubMed 与 Recercat(UPC 机构库)双源为准。双口径冲突已按"以官方为准、第三方口径注明"原则处理并存照(附录 G);供血者人数、观察者间一致性、子类归属等官方未披露信息列为结构性缺口而非缺陷推测。若官方在未来发布修订(版本、一致性数据、子类标签),以官方新口径为准并触发附录 L 维护动作。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- nct-crc-he-100k — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- panda-plus — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- medmnist — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- bbbc — 共享标签:医学影像 / 病理图像 / 评测基准
- pcam — 共享标签:病理图像 / 图像分类 / 评测基准
- neptune — 共享标签:医学影像 / 病理图像 / 图像分类
- biomedica — 共享标签:医学影像 / 图像分类 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

