Acevedo 外周血细胞数据集(acevedo-blood)— AI-Ready Wikipedia

Acevedo dataset:Hospital Clinic de Barcelona 与加泰罗尼亚理工 UPC 2015–2019 采集的 17,092 张正常外周血单细胞显微图像——Advia 2120 → Sysmex SP1000i 染色 → CellaVision DM96 采图流水线,专家标注 8 组 10 类型,官方 CNN 基准最佳 96.2%、第三方微调最高 99.32%,CC BY 4.0 于 Mendeley Data 公开

来源 Hospital Clinic de Barcelona 健康供血者外周血涂片(Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字细胞成像),裁剪单细胞 360×363 px JPG RGB,专家标注 8 组(中性粒/嗜酸/嗜碱/淋巴/单核/未成熟粒/幼红/血小板),Mendeley Data snkd93bnjr V1发布时间: 2026-09-29最后更新: 2026-09-29 阅读 10
Acevedo 外周血细胞数据集(acevedo-blood)— AI-Ready Wikipedia

信息速览

数据集名称Acevedo 外周血细胞数据集(acevedo-blood)— AI-Ready Wikipedia
数据类型影像数据,人工标注,原始数据
规模17,092 张单细胞图像(8 组正常血象;供血者精确人数未披露,2015–2019 采集)
接入方式Hospital Clinic de Barcelona 健康供血者外周血涂片(Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字细胞成像),裁剪单细胞 360×363 px JPG RGB,专家标注 8 组(中性粒/嗜酸/嗜碱/淋巴/单核/未成熟粒/幼红/血小板),Mendeley Data snkd93bnjr V1
AI 就绪度

INFOBOX — Acevedo 外周血细胞数据集一屏速览

维度 内容
本质 17,092 张正常外周血单细胞显微图像(非全涂片、非 WSI),360×363 px JPG RGB,每图单细胞居中
团队 Hospital Clinic de Barcelona(临床侧)+ 加泰罗尼亚理工 UPC(工程侧),六作者,通讯 José Rodellar
论文 Data in Brief 2020;30:105474(数据集论文,PMID 32346559)+ Comput Methods Programs Biomed 2019;180:105020(方法论文,PMID 31425939)
采集链 Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字采图(Core Laboratory)
类别 8 组 10 类型:中性粒/嗜酸/嗜碱/淋巴/单核/未成熟粒 IG(早幼粒·中幼粒·晚幼粒三子类)/幼红/血小板
规模 17,092 张:中性粒 3,329 / 嗜酸 3,117 / IG 2,895 / 血小板 2,348 / 幼红 1,551 / 单核 1,420 / 嗜碱 1,218 / 淋巴 1,214
标注 expert clinical pathologists(临床病理专家)复核确认;DM96 机器预分类打底
质控 供血者无感染、无血液病、无肿瘤、无相关药物治疗——纯正常血象
基准 官方 2019 CNN 最佳 96.2%;第三方 27 种微调 CNN 最高 99.32%(arXiv 2110.09508)
派生 BloodMNIST(MedMNIST v2 子集)即其 28×28 降采样派生版,官方 split 11,959/1,712/3,421
获取 Mendeley Data 免费公开直链(无需注册),单一版本 V1(2020-06-08)
许可 CC BY 4.0(DOI 10.17632/snkd93bnjr.1)
库内互链 medmnist(716)(实质派生关系)、herlev-pap(483)、sipakmed(490)、human-cell-atlas(319)、cellxgene(38)

Acevedo 外周血细胞数据集(文献中惯称 Acevedo dataset 或 PBC Dataset)是一个"把血常规科日常变成公开基准"的数据集:西班牙 Hospital Clinic de Barcelona 核心实验室(Core Laboratory)在 2015–2019 年间,从健康供血者的外周血涂片里,用 CellaVision DM96 数字形态学工作站采集了 17,092 张单个细胞的显微图像,经临床病理专家标注为 8 组正常血细胞类型,以 CC BY 4.0 在 Mendeley Data 公开。它是官方口径下"首个大样本正常外周血细胞公开集",也是轻量医学影像基准 BloodMNIST 的直接上游——你可能早就在 28×28 的 BloodMNIST 上跑过它,只是没见过它的原生 360×363 px 全貌。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——Mendeley Data 免费直链、CC BY 4.0,全程无注册 gate,这是库内可获取性最高的一档。
  2. 要写论文引用:直奔 §4 论文与时间线——数据集论文(Data in Brief 2020)与方法论文(CMPB 2019)各管一摊,Data DOI 引 Mendeley,别把 arXiv 编号张冠李戴(坑 1)。
  3. 想对标指标:直奔 §5 基准与评估——先问自己用哪个 split、哪个分辨率,再谈 96.2% 和 99.32% 能不能放同一张表里(坑 5)。

§0 导读:这个数据集解决什么问题

血细胞显微镜检查(外周血涂片镜检)是血液学最古老的人工智能战场:一个训练有素的检验医师看一张涂片要数百个细胞,而形态学识别恰恰是"规则写不清、人眼一眼准"的典型任务——中性粒细胞分叶几叶算正常、单核细胞和淋巴细胞核染色质怎么区分,这些知识长在专家脑子里,很难翻译成 if-else。2010 年代深度学习成熟后,缺的不再是方法而是数据:血细胞图像要么锁在商业系统(如 CellaVision 付费数据库)里,要么公开集规模太小(几百张),要么混入大量异常细胞导致任务不纯。

Acevedo 数据集的回答是把"正常血象"这一个场景做深:17,092 张、8 组 10 类型、每图单细胞居中、规格统一 360×363 px、专家标注、CC BY 4.0 全开放。官方在 Data in Brief 摘要里的自我定位是:“据我们所知,这是首个拥有大数量正常外周血细胞的公开集,期望成为模型基准的 canonical dataset(正典数据集)”。十年回看,这个期待基本兑现——它成了外周血细胞分类的默认起点,还通过 BloodMNIST 派生链进入了几乎所有轻量基准评测的必选清单。

§0 读法三则:

  1. 这个条目是"数据集+方法论文+派生基准"三合一叙事:本体是 17,092 张原生图像(Mendeley),方法论是 2019 CMPB 论文的 CNN 基准,派生品是 MedMNIST 生态的 BloodMNIST——三者分辨率、划分、许可语境各不相同(§5.6 统计卫生守则)。
  2. 全文硬数字均出自 Data in Brief 官方 Table 1(八类分布,合计恰 17,092)、两篇论文 PubMed 记录与 Mendeley 托管页;唯一撞见的"12,869 张"口径已在坑 3 存照并证伪。
  3. 检索时别盯着某个"官方数据集名"找——它没有注册商标式的专名,“Acevedo dataset”“PBC Dataset”“PBC_Acevedo”"peripheral blood cell dataset"都指向同一批数据(坑 4)。

§1 数据集速览:十问十答

Q1:17,092 张图从哪来?
西班牙 Hospital Clinic de Barcelona 核心实验室 2015–2019 年采集的健康供血者外周血涂片。供血者准入即质控:无感染性疾病、无血液病、无肿瘤病史、采血时无相关药物治疗——保证每张图都是"正常血象"。供血者精确人数论文未披露(遗留疑点,见 §10 坑 8 与事实清单)。

Q2:图像怎么采出来的?
三级设备链:Advia 2120 血液分析仪做全血计数与质控 → Sysmex SP1000i 自动推片染色机做 May-Grünwald-Giemsa(MGG)染色 → CellaVision DM96 数字形态学工作站逐细胞成像并裁剪。最终交付物是 360×363 像素 JPG(RGB),无滤波、无预处理、原样保存。

Q3:到底 8 类还是 10 类?
两种口径都对,看你怎么数。目录级是 8 组(groups):中性粒、嗜酸、嗜碱、淋巴、单核、未成熟粒(IG)、幼红、血小板;其中未成熟粒一组内部含早幼粒、中幼粒、晚幼粒三个子类——按"类型"数就是 10 种分 8 组。文献里"13 类白细胞"的说法是印象错误(坑 2),两篇官方论文均明写 eight classes/groups。

Q4:谁标注的,可靠吗?
CellaVision DM96 采集时输出机器预分类,临床病理专家(expert clinical pathologists,论文复数口径)复核确认。注意可靠性边界的诚实披露:论文未发布观察者间一致性系数,标注可信度背书来自专家临床资格而非量化一致性数据——这在同类数据集里是常态而非例外。

Q5:里面有白血病细胞吗?
没有。这是它与 Matek 骨髓数据集(21 类、含血液病形态)最本质的分野:Acevedo 数据集是纯正常血象集,连"感染与再生性贫血常见的反应性细胞"都只出现在论文配图示例里而非独立类目。想研究异常细胞识别,它帮不上忙(§7.3)。

Q6:有官方 train/test 划分吗?
原始发布(Mendeley V1)没有固定划分文件。2019 方法论文自用一套划分做基准,arXiv 2110.09508 的 27-CNN 评测用 64/24/12,BloodMNIST 派生链定义了 11,959/1,712/3,421——三套 split 各行其是,跨论文指标不可直接对标(坑 5,§5.6)。

Q7:性能上限多少?
官方 2019 基准最佳总体准确率 96.2%(微调 InceptionV3 一族);第三方把 27 种 CNN 全部微调后,最高 99.32%(Wide ResNet-50-2)、最低 98.39%(AlexNet)。到 99%+ 区间意味着固定口径下基准接近饱和,剩余错误集中在形态学最相近的类对上(§5.5)。

Q8:怎么拿到?什么许可?
Mendeley Data 托管页 https://data.mendeley.com/datasets/snkd93bnjr/1 免费公开下载,无需注册,CC BY 4.0——可商用、可衍生,唯一义务是署名(引用 Data in Brief 论文 + Data DOI 10.17632/snkd93bnjr.1)。单一版本 V1(2020-06-08 发布),至今无 .2 版本。

Q9:它和 BloodMNIST 什么关系?
直接派生:BloodMNIST 就是 MedMNIST v2 团队从本数据集降采样到 28×28 的轻量版,沿用全部 17,092 张、8 组标签,并定义了 11,959/1,712/3,421 的官方 split;MedMNIST+ 又补了 64/128/224 px 升级版。换句话说,你在 BloodMNIST 上的每张图都能溯源到 Mendeley 包里的原生 360×363 JPG。

Q10:为什么它对 AI-Ready 重要?
它是库内"可获取性光谱"最开放一档的样本:公开直链 + CC BY 4.0 + 无 gate + 类别目录即标签 + 规模适中(单卡可训)。它的短板同样典型——无 manifest 元数据、无固定 split、无患者级信息——这让它在"数据工程完备性"上留了改进空间,也让"从 BloodMNIST 回到原生 Acevedo"成为一堂现成的 AI-Ready 教学案例。

§2 数据构成与规格

2.1 规模总览:官方 Table 1 全分布

数据集的全部家底就是一张官方分布表(Data in Brief 2020,Table 1,合计恰 17,092):

组别(英文目录名) 中文 张数 占比
neutrophils 中性粒细胞 3,329 19.48%
eosinophils 嗜酸性粒细胞 3,117 18.24%
immature granulocytes (IG) 未成熟粒细胞 2,895 16.94%
platelets (thrombocytes) 血小板 2,348 13.74%
erythroblasts 幼红细胞 1,551 9.07%
monocytes 单核细胞 1,420 8.31%
basophils 嗜碱性粒细胞 1,218 7.13%
lymphocytes 淋巴细胞 1,214 7.10%
合计 — 17,092 100%

三个观察:

  1. 粒系压舱:中性粒 + 嗜酸 + 嗜碱 + 未成熟粒四组合计 10,559 张(61.8%),反映正常骨髓造血的粒系主导结构;分类任务的主要难度也集中在粒系内部(成熟中性粒 vs 三个未成熟阶段的边界)。
  2. 最少与最多差 2.7 倍:淋巴细胞 1,214 张 vs 中性粒细胞 3,329 张——这是一个"轻度不平衡"数据集,不是均匀构造的产物,MedMNIST+ 用 Shannon’s Equitability 0.96(三个 split 均 0.96)量化了这一点:接近平衡但保留真实血象的比例感。
  3. 没有"其他/垃圾"类:8 组全部是明确的形态学实体,无 Background、无 Ignore、无 Unknown——标注体系干净,代价是它对"图里不是这 8 种东西"的世界一无所知(闭集假设,§5.5)。

2.2 图像规格与粒度边界

属性 规格
图像尺寸 360 × 363 像素
格式 JPG
色彩 RGB(MGG 染色原色)
内容粒度 单细胞居中(每图一个细胞)
后处理 无滤波、无预处理,原样保存
组织方式 按 8 个类别目录打包(目录名即标签)
对应对象 外周血涂片(peripheral blood smear)

粒度边界需要一屏讲清楚:这是单细胞图像集,不是全涂片图像集(更不是 WSI)。CellaVision DM96 的工作方式是把涂片视野数字化后定位白细胞、裁出单个细胞的方形视野——所以每张图天然自带"检测已完成"的假设。对使用者的三重含义:

  1. 细胞检测/定位任务不可训:数据集里没有"空视野"负样本,没有检测框标注,无法从这里学出"找到细胞"这一步。
  2. 场景级任务不可行:红细胞形态异常、涂片整体染色质量、血浆背景异常等 smear-level 信息在裁剪时被丢弃了大半。
  3. 类间像素域极窄:所有图都是"居中单细胞 + 淡色背景",模型要学的判别信号几乎全部来自细胞形态本身——这是它作为分类基准干净的原因,也是它做域泛化研究时脆弱的原因(§5.5)。

2.3 八组类别体系与"10 类型分 8 组"口径

8 组的形态学身份一句话版:

组 形态学要点(标注专家所依据的识别核心)
中性粒细胞 neutrophils 成熟粒细胞,分叶核(2–5 叶),细颗粒胞质;正常血象中占比最高的白细胞
嗜酸性粒细胞 eosinophils 双叶核,粗大橙红色嗜酸颗粒,MGG 下辨识度最高的组之一
嗜碱性粒细胞 basophils 双叶核被深紫蓝色嗜碱颗粒遮盖,数量最稀少的正常白细胞之一
淋巴细胞 lymphocytes 圆核、染色质致密、少量清亮胞质(含大淋巴细胞形态谱)
单核细胞 monocytes 大细胞,核形不规则(肾形/马蹄形),灰蓝色丰富胞质
未成熟粒细胞 IG 骨髓粒系前体细胞,正常外周血罕见;含早幼粒 promyelocytes、中幼粒 myelocytes、晚幼粒 metamyelocytes 三个子类
幼红细胞 erythroblasts 有核红细胞前体,圆形深染核,正常外周血中不应大量出现
血小板 platelets 体积最小的组分(thrombocytes 为同义词),无核碎片状

"8 组还是 10 类"的口径学:

  • 目录级(8 组):数据包的 8 个文件夹、官方 Table 1 的 8 行、全部基准论文的 8 分类输出头——工程上一切以 8 为准。
  • 类型级(10 类型):官方原文将 IG 组说明为"promyelocytes, myelocytes, and metamyelocytes"三个子型的合并,所以"10 种类型分 8 组(10 types organized in 8 groups)"是官方自己的表述。子类边界在目录级没有保留——你拿不到"这 2,895 张里哪张是中幼粒"的官方答案。
  • 13 类从何而来:文献引用链里的讹误(可能是把"10 类型"再拆分加上误记的异常类目),两篇官方论文均无 13 类表述。任何以 13 类为口径的转引都应回溯到官方 8 组(坑 2)。

IG 组的存在是这个数据集最有临床味道的设计:正常健康人外周血里不该有可观数量的未成熟粒细胞,但这 2,895 张确实来自健康供血者——它们对应的是"感染与再生性贫血常见"的反应性改变谱系(论文配图标题原话:包括 those more frequently observed in infections and regenerative anaemias)。这让数据集在"纯正常"底色上多了一个向血液病初筛延伸的钩子。

2.4 采集设备链:从血管到像素

论文 Fig. 2 描绘的 Core Laboratory 日工作流,翻译成数据链路是三站:

供血者 EDTA 采血
   │
   ▼
① Advia 2120(Siemens/Bayer 系全自动血液分析仪)
   全血计数(CBC)+ 分类初筛 + 样本质控
   │
   ▼
② Sysmex SP1000i(自动推片染色机)
   机械推片 → May-Grünwald-Giemsa(MGG)标准染色
   │
   ▼
③ CellaVision DM96(数字形态学工作站)
   载台自动巡游 → 白细胞定位 → 360×363 px 视野裁剪
   → 机器预分类 → 专家复核 → 类别目录归档

三站各有数据学含义:

  1. Advia 2120 的角色是"守门员":它不产生数据集图像,但它的 CBC 数值是供血者"正常血象"资格的客观依据之一。这也是为什么把本数据集当作"CBC 仪器数据"是张冠李戴——它全程是显微镜形态学数据(坑 8)。
  2. SP1000i 的角色是"标准化器":自动推片+自动染色把 MGG 染色质量从"技师手艺"变成"机器规程",显著压低了染色批次差异这一显微图像最大的域漂移源。
  3. DM96 的角色是"采集+预标注"双肩挑:它是临床数字形态学的成熟商用系统(对血细胞做定位、裁剪与预分类),数据集直接复用这条临床在用流水线,而不是为研究另建一套——见 §9.1 的方法学讨论。

2.5 供血者质控:"正常血象"的操作性定义

论文摘要给出的准入排除标准是四条:无感染性疾病、无血液系统疾病、无肿瘤疾病、采血时无相关药物治疗。这四条构成"正常血象"的可操作定义——它不是"细胞看起来正常"的循环论证,而是供者层面的独立质控。

由此推出的使用边界:

  1. "正常"是供者维度而非细胞维度:IG 组 2,895 张正是健康人血里能见到的反应性未成熟粒——"健康供者的涂片"与"每张图都是教科书正常形态"是两回事。
  2. 年龄、性别、民族分布未披露:论文未给供者人口学统计表(遗留疑点之一),做人群分层研究时无法从这里出发。
  3. 供血者精确人数未知:只知道 2015–2019 四年间采集、随机 ID 匿名化。每人贡献多少张、有多少供者,全部不可考——这直接封死了患者级交叉验证(§5.6)。

2.6 与全涂片数据集的粒度光谱

把"血细胞图像数据集"按粒度排一条光谱,本数据集的位置一目了然:

粒度 代表 本数据集是否覆盖
全涂片 WSI(gigapixel) Matek 骨髓集部分形态(扫描全片) 否
多细胞视野 Raabin-WBC 部分图像 否
单细胞裁剪(居中) Acevedo 17,092 张(本条目) 是(全部)
更粗(patch 内多细胞) — 否
血常规数值表(CBC 表格) MIMIC 等电子病历生态 否

单细胞粒度是血液数字形态学商用系统(DM96 一族)的天然输出,也因此是"细胞分类"任务最主流的粒度选择——但这意味着拿它做"细胞检测→分类"端到端研究时,必须另配检测数据或自标负样本。

2.7 八组逐类深度档案

§2.1 的分布表给出了"多少",本节给出"是什么、怎么认、难在哪"。每组按统一框架展开:形态学识别要点(标注专家所依据的特征)、MGG 染色下的视觉表现、临床关联、在本数据集内的角色与易混淆点。细胞直径等数值取自标准血液形态学教科书通识,供读图时参考;各组张数与占比均为官方 Table 1 口径(附录 E 速算表同源)。

2.7.1 中性粒细胞 neutrophils——3,329 张(19.48%)
  • 识别要点:成熟粒系终末细胞,直径约 12–15 μm;标志性特征是分叶核(2–5 叶,以 3 叶居多),叶间以染色质细丝相连;染色质粗块状凝聚;胞质淡粉色,充满细小的中性(紫红色)颗粒。
  • MGG 表现:胞质底色接近无色偏粉,颗粒细而不醒目——"认核不认质"是这一组的读图重心。
  • 临床关联:细菌感染与炎症的首要应答细胞;核左移(杆状核增多)是感染/炎症的形态学信号,分叶过多则提示巨幼细胞性贫血或 B12/叶酸缺乏。
  • 数据集内角色:占比最高的单一组,也是粒系"成熟锚点"——模型从这里学到的"成熟粒细胞长什么样",是判别 IG 组三个未成熟阶段的参照系。
  • 易混淆:与 IG 组晚幼粒(metamyelocyte)——核形从肾形向分叶过渡是一个连续谱,固定阈值切割必然产生边界样本(§2.8 类对 1)。
2.7.2 嗜酸性粒细胞 eosinophils——3,117 张(18.24%)
  • 识别要点:直径约 13–17 μm;核多为双叶("眼镜"状);胞质充满粗大、分布均匀的橙红色嗜酸颗粒。
  • MGG 表现:MGG 染色的酸性染料(伊红)对嗜酸颗粒着色极强,橙红色颗粒在淡蓝背景上对比强烈——全组辨识度最高的视觉签名。
  • 临床关联:过敏性疾病、寄生虫感染、药物反应、嗜酸性粒细胞增多症的核心效应细胞。
  • 数据集内角色:占比第二,且是典型的"送分组"——第三方评测的分组召回中该组通常位居最高一档(方向性观察,具体数值随划分与架构而变,见 §5.6 第 4 条对分组指标的提醒)。
  • 易混淆:几乎不与其他组混淆;真正的研究价值在于它是"视觉特征主导分类"的对照组——深度模型对它的判断可解释性最强。
2.7.3 未成熟粒细胞 immature granulocytes (IG)——2,895 张(16.94%)

IG 组是本数据集临床味道最重、内部异质性最大的一组。官方将其描述为三个子类的合并(子类归属未随包发布,§2.3):

  • 早幼粒细胞 promyelocyte:三者中最大(直径约 15–25 μm),圆形或椭圆核、常偏位,染色质开始凝聚但可见核仁残迹;胞质含大量粗大的嗜天青(primary)颗粒,MGG 下呈紫红色密集颗粒感。

  • 中幼粒细胞 myelocyte:直径约 12–20 μm;核变圆偏位、染色质更凝聚;胞质同时出现中性(secondary)颗粒与残余嗜天青颗粒——“颗粒双轨期”。

  • 晚幼粒细胞 metamyelocyte:直径约 10–18 μm;肾形/豆形核(凹陷超过核直径一半但尚未分叶)是定义性特征;胞质颗粒谱接近成熟中性粒。

  • 临床关联:正常健康人外周血中罕见可观数量的 IG;感染与再生性贫血(论文配图标题原话:those more frequently observed in infections and regenerative anaemias)是最常见的反应性来源;持续显著增多则需排查骨髓增殖性或白血病性过程——但本数据集不含白血病病例(事实清单第 32 条)。

  • 数据集内角色:三子类谱系横跨"颗粒最密"到"接近成熟",使该组的类内方差大于多数其他整组;它是细粒度研究与"子类归属"需求的主要诉求对象(附录 L 维护触发点之一)。

  • 易混淆:早幼粒 vs 单核(颗粒 vs 灰蓝胞质)、晚幼粒 vs 成熟中性粒(核形连续谱)——两条类对都进 §2.8 地图。

2.7.4 血小板 platelets (thrombocytes)——2,348 张(13.74%)
  • 识别要点:直径约 2–4 μm 的无核细胞质碎片(巨核细胞脱落产物);本数据集内是 DM96 裁剪出的单个血小板放大视野,淡蓝色胞质包裹紫红色细颗粒;形态从圆形/卵圆形到不规则突起(伪足)谱系宽,巨型血小板也在其中。
  • MGG 表现:中央颗粒区(granulomere)紫红、周边透明区(hyalomere)淡蓝,色差分明。
  • 临床关联:一期凝血的核心要素;计数与形态(巨血小板、颗粒减少)是出血性疾病评估的一线信息。
  • 数据集内角色:八组中唯一的非白细胞组分,天然构成"白细胞 vs 血小板"这个几乎零难度的粗分类轴;同时是"裁剪粒度≠生理尺度"的最佳提醒——真实血涂片上血小板直径只有细胞视野的零头,这里却被居中放大。
  • 易混淆:无实质混淆对象;它存在的意义更多是完整性(让"外周血有形成分"覆盖不缺角)而非分类难度贡献。
2.7.5 幼红细胞 erythroblasts——1,551 张(9.07%)
  • 识别要点:有核红细胞前体(normoblast 谱系);圆形核、染色质深染致密(成熟阶段可呈"墨点"状),胞质随血红蛋白化程度从深蓝(嗜碱性)过渡到灰蓝再到灰红;核周常可见淡染晕。
  • MGG 表现:"深蓝胞质 + 墨色圆核"的晚期阶段与"灰红胞质"的近成熟阶段并存,组内色域跨度大。
  • 临床关联:正常成人外周血中极罕见;溶血、急性失血、骨髓代偿性增生或骨髓浸润时外周血可见——即"幼红细胞出现在外周血"本身就是临床信号。
  • 数据集内角色:健康供者血象中出现 1,551 张幼红细胞,是理解"正常是供者维度而非细胞维度"(§2.5 第 1 条)的最佳实例:供者通过四条准入质控,而其涂片仍含正常造血谱系的成分。它与 IG 组共同构成数据集的"发育谱系采样"。
  • 易混淆:与淋巴细胞——都是"圆核致密"外形,判别点在胞质颜色(蓝/灰红 vs 清亮)与核质比;这条类对也进 §2.8 地图。
2.7.6 单核细胞 monocytes——1,420 张(8.31%)
  • 识别要点:正常白细胞中最大的一组(直径约 15–25 μm);核形不规则——肾形、马蹄形、折叠或浅分叶;染色质网状疏松(对比粒系的块状凝聚);胞质丰富、灰蓝色磨砂感,含细小嗜天青颗粒。
  • MGG 表现:灰蓝胞质 + 疏松核染色质是两大签名;"大而不圆、灰而不清"的直觉概括。
  • 临床关联:结核、心内膜炎等慢性感染,单核细胞白血病/骨髓增生异常谱系,以及感染恢复期的单核增多。
  • 数据集内角色:形态谱最"散"的正常白细胞组(核形连续变化),是闭集分类里"类内方差大"的典型样本。
  • 易混淆:大淋巴细胞 vs 单核(数据集公认的细粒度难题之一,§5.5 类对);早幼粒 vs 单核(颗粒密度是判别核心)。
2.7.7 嗜碱性粒细胞 basophils——1,218 张(7.13%)
  • 识别要点:直径约 10–14 μm;深紫蓝色粗大嗜碱颗粒(含组胺与肝素)常遮盖或推移分叶核——"见颗粒不见核"是常态;核常呈 S 形或双叶。
  • MGG 表现:碱性染料(亚甲蓝系)对嗜碱颗粒着色极强,深紫蓝色调在整张图里几乎不可能误认。
  • 临床关联:正常血中最稀少的白细胞(外周血分类计数常 <1%);增多与过敏反应及骨髓增殖性疾病(尤其 CML)相关。
  • 数据集内角色:占比倒数第二;它的存在本身就是"真实血象采样"的证据——均匀构造的数据集不会把最稀少的细胞采到一千余张。
  • 易混淆:识别本身不难(特征过目不忘),难度在于低频组的样本效率(§5.6 第 4 条)。
2.7.8 淋巴细胞 lymphocytes——1,214 张(7.10%)
  • 识别要点:小淋巴细胞(直径约 7–12 μm)圆核、染色质致密成块、胞质为窄环状清亮淡蓝——“核占九成”;大淋巴细胞(约 12–16 μm)核略大、染色质稍松、胞质更宽。数据集内含这一形态谱。
  • MGG 表现:核深蓝紫色、胞质清亮少颗粒;大淋巴的胞质偶见少量嗜天青颗粒。
  • 临床关联:病毒感染(淋巴细胞增多/异型淋巴)、免疫状态评估;T/B/NK 系总称——纯形态学无法下系别结论。
  • 数据集内角色:占比最少的一组;含形态谱使其与单核组共同贡献了最著名的细粒度混淆类对。
  • 易混淆:大淋巴 vs 单核(第一类对);小淋巴 vs 晚期幼红(圆核致密的形似,靠胞质色判别)。
2.7.9 逐类档案小结:三句话记住八组
  1. 三个"过目不忘"组:嗜酸(橙红粗颗粒)、嗜碱(深紫蓝遮核颗粒)、血小板(小而无核)——低难度、高召回。
  2. 两个"发育谱系"组:IG(粒系三级未成熟)与幼红(红系前体)——类内方差大、承载临床叙事、子类/阶段归属是公开缺口。
  3. 三个"互为镜像"组:中性粒、单核、淋巴——彼此间的边界类对(晚幼粒 vs 中性粒、大淋巴 vs 单核)构成了本数据集残余错误的集中地。

2.8 细粒度混淆地图:五条类对难度轴

§5.5 指出 99%+ 时代的残余错误高度集中在形态学最近邻类对;本节把"哪些类对"一次性铺开,供设计评测与错误分析时直接引用。难度分档为基于形态学连续谱结构的定性判断(跨划分不保证数值稳定,仅作分析起点):

# 类对 难度 混淆机理 判别要点
1 晚幼粒(IG) vs 成熟中性粒 最高 核形从肾形→分叶是连续成熟谱,无客观切割点 核凹陷深度与叶间细丝;边界样本本质上不可判定
2 大淋巴细胞 vs 单核细胞 高 两者都是"大细胞+一定量胞质",大淋巴染色质稍松后与单核疏松染色质接近 核形(圆 vs 不规则)、胞质色(清亮 vs 灰蓝磨砂)
3 早幼粒(IG) vs 单核细胞 中高 两者都大、核都可偏位 嗜天青颗粒密度(密集粗大 vs 细小稀疏)
4 小淋巴细胞 vs 晚期幼红细胞 中 圆核致密的形似 胞质色(清亮淡蓝 vs 灰蓝/灰红血红蛋白化)
5 中幼粒(IG) vs 早幼粒(IG) 中(组内) 同组子类边界,颗粒双轨期跨阶段 secondary 颗粒出现与否——子类归属本就未随包发布

三条使用提示:

  1. 类对 1/2 是错误分析的第一站:任何新架构的残余 1% 错误,建议先按这两条类对拆解混淆矩阵,再下"泛化改进"的结论——很可能改进空间不在泛化而在边界样本定义。
  2. 类对 5 与"10 类型"口径直接相关:IG 组内子类边界没有官方逐张答案(§2.3),凡声称"IG 子类准确率"的工作都是自标口径,引用时按坑 3 同类逻辑存疑。
  3. 本地图与 §7 的跨域叙事互补:类对 1/2 的难度在人工读图口径同样存在——CellaVision 类商用系统在人机对比研究中的分歧细胞,正是同一批边界样本;这是"机器基线已超人工熟练技师一致性"叙事的细粒度注脚。

§3 采集与标注流水线

3.1 临床侧:Core Laboratory 的日常即数据来源

Hospital Clinic de Barcelona 是西班牙最大的临床中心之一,其核心实验室(Core Laboratory,隶属生化与分子遗传学系·生物医学诊断中心)每天处理大量血常规标本。数据集图像不是"为研究专门采血"的产物,而是日常标本流的副产物:健康供血者(血库/体检口径)的血样走完 Advia 2120 → SP1000i 常规流程后,符合条件的涂片进入 DM96 数字化。

这个"临床日常复用"模式的优点与代价同样清晰:

  • 优点:流程全部标准化(设备、染色、规程都有临床质控背书),图像的采集质量与真实检验环境完全一致;研究不需要伦理上新增采血负担。
  • 代价:研究侧无法控制每类细胞的采集配比——8 组的分布(§2.1)是真实血象的自然呈现,不是实验设计出来的均衡表。

3.2 标注流程:机器预分类 + 专家复核

论文口径的标注链路是两层:

  1. 机器预分类:CellaVision DM96 内置的形态学分类算法对每张裁剪图输出预分类结果——这是商用系统十余年形态学规则的沉淀。
  2. 专家复核:临床病理专家(expert clinical pathologists,复数)逐张确认或改判,最终目录归属以专家口径为准。

这种"工作站预标+人工终审"是血液数字形态学行业的实际作业方式(DM96 在全球临床实验室就是这么用的),它的效率远高于从零手标;但要注意它的三个透明度缺口(论文未提供,遗留疑点):

  • 复核专家的人数、资历、各自主管类目未披露;
  • 机器预分类被专家改判的比例未披露(这恰恰是"预分类质量"的直接指标);
  • 观察者间一致性(如 κ 系数)未发布。

换句话说,标注质量的证据是间接的:设备是临床认证设备、标注者是临床专家、流程是临床在用流程——资格背书而非量化背书。在同类公开数据集里这是常态(Matek 集发布了一致性数据是少数派),但引用时应如实写"expert-annotated"而不是"consensus-annotated"。

3.3 匿名化与伦理口径

  • 随机 ID:图像以随机标识符组织,患者可追溯信息(姓名、病历号、采集日期关联)不随数据集发布。
  • 供者维度匿名:由于供者人数与图像归属关系未披露,即使掌握原始数据的团队也无法从公开包重建"哪些图来自同一人"。
  • 伦理路径:作为 Data in Brief(数据论文期刊)发布,走的是"常规临床流程数据 + 完全匿名化 + 公开描述"的常规声明路径;四条排除标准本身就是伦理意图的一部分(不用患者数据、只用健康供者)。

对复用者的含义:CC BY 4.0 给了你再分发的自由,但数据集内不含任何可识别信息,你也不应该尝试从图像 EXIF 等元数据反推采集来源(JPG 已是裁剪产物,原始元数据未随包发布)。

3.4 数据包内容与"未随包发布"清单

下载 Mendeley V1 包(约 8 个类别目录的 JPG 集合)后,你能得到:

  1. 17,092 张 360×363 px JPG,按 8 个类别目录组织,目录名即标签;
  2. Mendeley 托管页的描述元数据(版本、DOI、许可、Related Article 链接);
  3. 主题标签(Platelet / Leukocyte / Hematopathology / Blood Cell)。

你不能得到(论文与托管页均未提供):

  1. 供者级元数据(人数、人口学、每人图像数);
  2. 官方 train/val/test 划分文件;
  3. IG 组内三子类(早幼粒/中幼粒/晚幼粒)的逐张归属;
  4. 采集年份与图像的对应关系(2015–2019 只是一个总区间);
  5. 机器预分类结果与专家改判记录;
  6. 机器可读的 manifest(CSV/JSON 清单)——标签需要从目录结构自行解析。

这份"未发布清单"不是吹毛求疵:§9 与附录 B 的 AI-Ready 评分里,它就是元数据维度失分的全部原因。同时也给出一个典型的数据工程提示——目录即标签(directory-as-label)是 CV 数据集最古老也最通用的约定,PyTorch 的 ImageFolder 一行代码即可加载,但对需要 track 个体来源的现代 ML 工作流(患者级划分、数据卡片、溯源审计)来说,这个包的元数据停在 2020 年的发布标准上。

3.5 染色协议深读:MGG 是这批图像的"物理色彩空间"

§2.4 把 SP1000i 定位为"标准化器";本节展开标准化背后的染色学,因为对 CV 使用者而言,MGG(May-Grünwald-Giemsa)就是这批图像的物理色彩空间——模型学到的每一个颜色特征都由它决定。

3.5.1 两步染色的机理速览

MGG 是 May-Grünwald 液与 Giemsa 液先后施染的复合染色法,核心化学是酸性染料伊红与碱性染料亚甲蓝/天青系对细胞组分按电化学亲和力的选择性着色:

  1. May-Grünwald 液(伊红-亚甲蓝复合物)先行:酸性成分着色嗜碱性结构(核、嗜碱颗粒、RNA 丰富的胞质),碱性成分着色嗜酸性结构(嗜酸颗粒、血红蛋白)。
  2. Giemsa 液(天青-伊红系)接力:加深核染色质的蓝紫色层次,并给嗜天青颗粒与中性颗粒建立紫红色谱。
  3. 水洗分化与干燥:终止反应并固定色阶。

由此得到血液形态学的"标准色谱":核 = 蓝紫、嗜酸颗粒 = 橙红、嗜碱颗粒 = 深紫蓝、中性颗粒 = 淡紫红、成熟红细胞/血红蛋白化胞质 = 灰粉红、幼稚胞质 = 深蓝。§2.7 逐类档案里的每个视觉签名,都是这套色谱在特定细胞结构上的映射。

3.5.2 自动化染色的"三固定"及其数据学含义

SP1000i 把手工染色的"技师经验"替换为机器规程,实质是三个固定:

  1. 固定试剂浓度与批次管理——染液老化(亚甲蓝氧化、伊红降解)造成的批次色偏被压缩;
  2. 固定施染时间与节奏——着色深度的时间依赖性被消除;
  3. 固定冲洗与干燥条件——残留染液沉淀与干燥伪影被抑制。

对数据集的三重含义:

  • 颜色特征可信:跨图像的色域漂移远小于人工染色涂片,“橙红颗粒”"灰蓝胞质"这类描述在像素层面真的成立——用 RGB/HSV 手工特征做基线的论文能站住脚,前提正是这种标准化。
  • 域内一致性换来域间脆弱性:整包数据共享同一染色域,模型在 MGG 域内学到的色彩先验,遇到 Wright 染色(北美常用)、Wright-Giemsa 或不同厂商自动染色机时会整体偏移——染色归一化(stain normalization)与颜色增强因此成为本数据集上域泛化研究的标准轴(§5.5 出路 2 的具体化)。
  • "无滤波、无预处理"承诺的边界:官方保存图像时不做颜色校正,但采集前的染色就是一级"预处理"——它已经被机器规程统一过了。宣称"零预处理数据集"时应知悉这一层。
3.5.3 对下游研究的四条可操作提示
  1. 颜色增强要模拟染色域而非摄影域: hue/saturation 抖动、 stain augmentation(按染色向量分解再扰动)比几何增强更贴合"换染色法"的真实域差;旋转/翻转(60° 旋转 + 翻转是第三方 27-CNN 论文的增强口径,事实清单第 21 条同源)解决的是姿态问题,解决不了染色问题。
  2. 跨染色迁移研究应选对参照集:与 Raabin-WBC(Wright-Giemsa)或 Matek 集对照做跨域实验时,染色差异是首要混杂变量——把"设备差异"与"染色差异"拆开报告才有结论价值。
  3. 批间泄漏不存在、域内漂移有限:与病理 WSI 数据集常见的"每张 WSI 一个站点"式批间结构不同,本数据集的染色域近乎单一,随机划分的乐观偏差主要来自供者/个体层面(无法量化,§5.6 第 3 条),而非染色批次。
  4. 引用染色协议时认设备口径:写"May-Grünwald-Giemsa 染色"时,规范做法是同时给出施染设备(Sysmex SP1000i)——它把"哪一种 MGG"的歧义(手工/机染、哪家机染)一次性钉死。

§4 论文与时间线

4.1 双论文结构:数据论文与方法论文各管一摊

这个数据集挂着两篇官方论文,分工明确,引用时别混:

数据集论文 方法论文
标题 A dataset of microscopic peripheral blood cell images for development of automatic recognition systems Recognition of peripheral blood cell images using convolutional neural networks
期刊 Data in Brief 30:105474(2020) Comput Methods Programs Biomed 180:105020(2019-10)
DOI 10.1016/j.dib.2020.105474 10.1016/j.cmpb.2019.105020
PMID / PMCID 32346559 / PMC7182702 31425939 / —
作者 Acevedo A, Merino A, Alférez S, Molina Á, Boldú L, Rodellar J Acevedo A, Alférez S, Merino A, Puigví L, Rodellar J
开放获取 是(Recercat 有 postprint,CC BY 4.0 口径;ScienceDirect PII S2352340920303681) 订阅制(PubMed 记录)
管什么 数据本身:8 组分布、采集流程、图像规格、供者质控 方法与基准:CNN 架构对比、训练细节、96.2% 基准

作者名单的两个易错点(PubMed 32346559 与 Recercat 双源核对):

  1. 首名全名:一作是 Andrea Acevedo(双隶属:Hospital Clinic 生化与分子遗传学系·生物医学诊断中心 + UPC 数学系),通讯是 José Rodellar(UPC 数学系)。文献里流传的"Adrián Acevedo""Jordi Rodellar"是误传(坑 6);Recercat 机构库的全名记录为 Andrea Acevedo / Merino González, Anna / Alférez Baquero, Edwin Santiago / Molina Borrás, Ángel / Boldú Nebot, Laura / Rodellar Benedé, José。
  2. 三作隶属变迁:Santiago Alférez 在方法论文(2019)时属 UPC,Data in Brief(2020)时点已署 Universidad del Rosario(波哥大,哥伦比亚)——引用 affiliation 时注意论文时点。

4.2 时间线:四年采集、两年成稿、一条派生链

时点 事件
2015–2019 Hospital Clinic Core Laboratory 采集健康供血者涂片,DM96 数字化
2019-10 方法论文发表(CMPB 180:105020)——数据集首次进入文献(作为该研究的训练测试底座)
2020-06-08 Mendeley Data Version 1 发布(DOI 10.17632/snkd93bnjr.1,CC BY 4.0)
2020-06 数据集论文发表(Data in Brief 30:105474)——官方描述与 Table 1 定本
2020-10 第三方大规模评测出现(arXiv 2110.09508,27 种 CNN 微调)
2021-08 MedMNIST v2 发布,BloodMNIST 作为其子集派生自本数据集,进入轻量基准生态
2024+ MedMNIST+ 提供BloodMNIST 的 64/128/224 px 升级版;同域对照研究持续引用

时间线的两个注意点:

  1. 方法论文先于数据论文:2019 年那篇 CMPB 是"先用了数据集发方法",2020 年 Data in Brief 才是"把数据本身作为贡献正式描述"。所以 2019 论文是数据集的最早文献记录,但描述数据规格的权威文本是 2020 数据论文。
  2. 数据集只有单一版本:Mendeley V1(2020-06-08)发布后无 .2 及以上版本——五年无修订,一方面说明数据稳定无勘误级问题,另一方面意味着 §3.4 那份"未发布清单"至今没有被补齐。

4.3 引用规范:三件套各引各的

写论文时的引用组合建议:

  1. 用了图像数据:引 Data in Brief 论文(10.1016/j.dib.2020.105474)+ Data DOI(10.17632/snkd93bnjr.1)。CC BY 4.0 的署名义务由此满足。
  2. 用了或对比了官方基准数字(96.2% 等):加引方法论文(10.1016/j.cmpb.2019.105020)。
  3. 用了 BloodMNIST/28×28 版本:加引 MedMNIST v2 论文(Yang 等,MedMNIST v2),并注明与原生 Acevedo 数据集的分辨率差异。
  4. 不要引 arXiv:1701.01905:那是数学论文(Korff, “Korff F-signatures of Hirzebruch surfaces”),与血细胞无关(坑 1)。

4.4 检索名坑:一个数据集的多个"曾用名"

本数据集没有注册专名,文献与代码库里同时流通的名字包括:

名字 常见语境
Acevedo dataset 学术论文转引最常用(以一作姓指代)
PBC Dataset / PBC_Acevedo 代码仓库与 GitHub 常用(PBC = Peripheral Blood Cell)
Peripheral Blood Cell (PBC) dataset Data in Brief 语境的描述性称呼
Blood Cell Microscope MedMNIST 系的 source 字段口径
BloodMNIST 28×28 派生版的专名(MedMNIST 生态内)

检索建议:PubMed 用 “peripheral blood cell images”+ “Data in Brief”;Google Scholar 用数据论文标题精确短语;GitHub 搜 “PBC dataset Acevedo” 或直接认 Mendeley ID snkd93bnjr——这个随机串是全链路最稳定的唯一标识。

§5 基准与评估

5.1 官方基准(2019 CMPB):96.2% 是怎么来的

方法论文在 Keras/TensorFlow + Nvidia Titan XP 单卡环境下做的架构对比,四条路线:

路线 架构 总体准确率
特征提取 + SVM VGG-16(ImageNet 预训练,特征向量接 SVM) 86%
特征提取 + SVM InceptionV3(同上范式) 90%
微调 CNN InceptionV3(全网络微调) 95%
微调 CNN VGG-16(全网络微调) 96%
最佳总体 官方报告的最佳配置 96.2%

方法论上值得记的三点:

  1. 微调 > 特征提取:在显微图像上,全网络微调比"冻结骨干+SVM"高出 6–10 个百分点——预训练特征不直接适配显微域,这条经验后来在 MedMNIST 全家桶上被反复验证。
  2. 单卡可训是设计目标之一:Titan XP(2017 年级消费级卡)跑得动的规模与架构——数据集规模与 360×363 分辨率对当时实验室是友好的。
  3. 划分是论文自用的:该论文未把 split 定义为社区标准;你复现 96.2% 需要按论文正文口径(正文未在摘要给出精确样本数,这是遗留疑点之一)。

5.2 第三方 27-CNN 评测(arXiv 2110.09508):99.32% 与 98.39%

2020 年 10 月,第三方团队把 27 种 CNN 在本数据集上全部微调,64/24/12 划分,两端结果:

  • 最高 99.32%:Wide ResNet-50-2(WRN-50-2);
  • 最低 98.39%:AlexNet——最古老的架构也只差不到 1 个百分点。

该文引用的类分布与官方 Table 1 一致(独立第三方佐证之一)。"最差 98.39%"比官方最佳 96.2% 还高,说明五年间训练技巧、预训练权重与数据增强的进步吃掉了早期架构差距;也预示固定口径下这个基准已接近饱和(§5.5)。

5.3 派生基准生态:BloodMNIST 与 MedMNIST+

本数据集的第二条评测生命线在 MedMNIST 生态里:

层级 内容
MedMNIST v2(2021) BloodMNIST:28×28 降采样,17,092 张全量,8 类,官方 split 11,959 / 1,712 / 3,421,与几十个其他 MedMNIST 子集同台
MedMNIST+(2024,arXiv 2404.15786) Blood 源字段明写 “A. Acevedo et al.”;提供 64/128/224 px 分辨率升级;类别不平衡度 Shannon’s Equitability 三个 split 均 0.96

MedMNIST 生态对本数据集的放大作用是实质性的:几十个轻量基准论文、AutoML 工具、不确定性研究(如把 BloodMNIST 用作分布偏移/校准测试床的开源项目)都自动继承了这份数据——其中相当一部分使用者并不知道(或不需要知道)上游还有一个 360×363 的原生版本。

5.4 其他第三方口径

  • Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN 混合架构):确认 8 类口径并在其上评测——第三方持续把本数据集当"新架构试金石"。
  • 同域对照(S0169260724005534 论文 Table 1 口径):Matek BM 171,374 图/21 类、Matek blood 18,365/15、Acevedo 17,092/8、Raabin 17,965/5——Acevedo 是其中最大的纯正常血象公开集(Matek BM 更大但含骨髓异常形态且不公开)。
  • 引用场景谱系:外周血细胞分类、血液病初筛的前置模块、轻量 CNN 对比、联邦学习仿真、不确定性量化与校准研究、教学演示——跨度从工程到方法学都覆盖。
5.4.1 27-CNN 论文的训练配置全披露(复现锚点)

arXiv 2110.09508 除两端准确率外,还公开了完整训练配置,使"99.32%"成为可复现锚点而非孤证数字:

配置项 口径
划分 64% / 24% / 12%(图像级,无供者级约束——§5.6 第 3 条同样适用)
优化器 SGD,momentum 0.9
学习率 0.001 起步,每 7 个 epoch 衰减 0.1
minibatch 32
数据增强 60° 旋转 + 水平/垂直翻转
预训练 全部 27 架构均 ImageNet 预训练微调
5.4.2 投票集成 99.51%:该基准的已发表上限

同一论文在单模型之外给出投票集成(voting ensemble)结果:99.51%——由单模型榜前列的四模型组成:

集成成员 架构族
Wide ResNet-50-2 WRN(单模型最高 99.32%)
VGG-19 经典深 VGG
Wide ResNet-101-2 WRN 加深版
ResNet-34 经典 ResNet

三点解读:

  1. 99.51% 是固定口径(64/24/12、原生分辨率)下可公开引用的最高数字——比最佳单模型再 +0.19 个百分点,集成收益已进入边际区间,进一步佐证 §5.5 的饱和判断。
  2. 集成成员全是 ImageNet 时代经典骨干:没有 Transformer、没有专用医学预训练——在这个数据集上"骨干先进性"对终点的边际贡献趋零,技巧与集成才是增量来源。
  3. 引用规范:99.51% 应同时标注"投票集成 + 64/24/12 划分"两个限定词;裸引"99.5%+ 的准确率"而不给口径,会重演跨 split 不可比的老问题(§5.6 第 1 条)。
5.4.3 BloodMNIST 降采样工艺链:28×28 从哪一步来

MedMNIST 官方文档披露了从本数据集到 BloodMNIST 的完整降采样工艺,这串变换是理解"派生皮信息损失"的唯一权威口径:

原生 3×360×363(JPG 解码后)
   → 中心裁剪 center-crop → 3×200×200
   → 缩放 resize → 3×28×28(保存为 .npz)

配套的工程指纹(复现/对账用):

  • 官方 MD5:7053d0359d879ad8a5505303e11de1dc(MedMNIST v2 分发的 blood.npz 口径);
  • Zenodo 托管:MedMNIST 系数据在 Zenodo 固化(zenodo.org/records/10519652 及其同族记录),DOI 版本化与 Mendeley 原包(§6.1)平行存在。

工艺链的两点含义:

  1. 中心裁剪丢弃了视野边缘 44% 的线性信息(360×363 → 200×200)——DM96 的居中裁剪假设使此操作大体安全(细胞在图中心),但细胞出格/贴边的个体像素在派生皮上已经丢失;
  2. 28×28 相对 200×200 又损失约 50 倍像素——对红细胞大小的结构(颗粒、核叶间隙)是毁灭性降采样,这就是"分辨率敏感研究请回到原生版"(§8.2 检索路径 1)的量化注脚。

5.5 99%+ 意味着什么:饱和基准的三条出路

固定口径(同一 split、同一分辨率、闭集 8 类)下准确率逼近 99.5%,这个基准还能做什么?三条被验证的出路:

  1. 错误细粒度化:残余 1% 错误高度集中在形态学最近邻类对——成熟中性粒 vs 晚幼粒、大淋巴 vs 单核。研究价值从"刷总准确率"转向"细粒度混淆矩阵"与"可解释的错误分析"。
  2. 评测轴转向 OOD 与不确定性:闭集准确率饱和后,域偏移(不同染色、不同设备、不同分辨率)、分布外检测(见异常细胞时模型会不会"硬编"成 8 类之一)、校准与选择性预测成为增量方向——BloodMNIST 在不确定性研究中的高频出镜正是这条路的体现(闭集饱和数据集天然适合当"干净对照组")。
  3. 回到原生分辨率的性价比问题:28×28 的 BloodMNIST 上 99%+ 与 360×363 原生版上 99%+ 是否同样容易,分辨率消融本身就是可做的研究问题——MedMNIST+ 提供 64/128/224 px 版本正是为这类问题准备的。

5.6 统计卫生守则:四条,引用前先自查

  1. split 不对标:官方论文自用 split、arXiv 2110.09508 的 64/24/12、BloodMNIST 的 11,959/1,712/3,421 三套划分互不兼容;96.2% 与 99.32% 之间不是"方法进步 3 个点"的干净比较(划分不同)。
  2. 分辨率不对标:BloodMNIST(28×28)指标 ≠ 原生 360×363 指标;MedMNIST+ 各分辨率档次的指标同理。转引时注明分辨率。
  3. 患者级划分无人做过也无法做:供者归属未披露,所有 published split 都是图像级随机——同一供者的细胞可能同时出现在 train 和 test,乐观偏差理论上存在但无法量化(数据集结构性缺口,见 §3.4)。
  4. "总体准确率"掩盖类间差异:引用时最好附各类召回率或混淆矩阵;嗜碱/淋巴这类低频组在总体 96% 时可能类内召回明显更低。

§6 获取与许可:一扇门,一张纸

6.1 获取:库内最简的一扇门

与库内"三层异构"(如 panda-plus 的 WSI/掩码/基准三套许可)或请求制数据集不同,本数据集只有一扇门、一张纸:

项 内容
托管页 https://data.mendeley.com/datasets/snkd93bnjr/1
Data DOI 10.17632/snkd93bnjr.1
版本 Version 1(2020-06-08 发布,单一版本链,无 .2+)
许可 CC BY 4.0(托管页直核)
获取门槛 无注册、无申请、无 gate——免费公开下载
包内容 8 个类别目录的 JPG(合计 17,092 张,360×363 px RGB)
Related Article 10.1016/j.cmpb.2019.105020(方法论文,托管页关联)
主题标签 Platelet / Leukocyte / Hematopathology / Blood Cell

实操三步:打开托管页 → Download(选 V1 全包)→ 解压后用 ImageFolder 类工具按目录加载。想要 28×28 或更高分辨率派生版,走 MedMNIST 官方下载脚本(medmnist Python 包,BloodMNIST 子集)。

6.2 CC BY 4.0 的义务与自由

CC BY 4.0 给你的自由:商用、衍生、再分发、闭源使用,全部允许。唯一义务是署名(attribution),实操口径:

  1. 引数据集论文:Acevedo A, Merino A, Alférez S, Molina Á, Boldú L, Rodellar J. A dataset of microscopic peripheral blood cell images… Data in Brief 30:105474 (2020)。
  2. 标注 Data DOI:10.17632/snkd93bnjr.1。
  3. 衍生品(如再发布的增强版、裁剪版)同样以 CC BY 4.0 或兼容条款开放,并保留原始署名。

两个边界提醒:JPG 图像本身的分辨率规格(360×363)意味着任何"超分辨率重建版"是衍生作品,署名链不能断;若把图像嵌入商业产品(如教学软件),CC BY 4.0 允许但署名义务仍然存在——这一点比 CC BY-SA 温和(无相同方式共享要求),比 CC0 严格(不能不署名)。

6.3 版本链与稳定性

单一版本 V1 自 2020-06-08 至今无修订。含义有三:

  • 稳定性红利:五年零勘误,文献里也未见官方更正公告——数据本体可信度高,引用无需版本辨析(对比某些数据集 1.0/2.0 口径打架的坑)。
  • 改进停滞:§3.4 那份"未发布清单"(manifest、供者元数据、子类归属、官方 split)五年未补——数据集的元数据停留在 2020 年发布标准。
  • 快照式存档:Mendeley Data 对每个版本做 DOI 固化(.1 即快照),即使原机构变动,DOI 解析仍指向存档——这是它比 GitHub 托管数据集(链接易腐)在可持续性维度加分的理由。

6.4 AI-Ready 快评:高分项与失分项并置

维度 表现
可获取 满分语境:公开直链、无 gate、CC BY 4.0、平台(Mendeley/Elsevier)稳定
可加载 目录即标签,ImageFolder 即用;JPG 通用格式无私有依赖
规模友好 17,092 张 / 360×363 px,单卡全量训练无压力
元数据 缺 manifest、缺供者信息、缺子类标签、缺官方 split——工程完备性停在 2010 年代中
可追溯 Data DOI + 论文 PII 齐全;但图像级溯源(哪个供者、哪年采集)为零
许可清晰度 单一许可全文包,无嵌套许可(对比库内三层异构条目是显著优点)

一句话:数据本体的 AI-Ready 接近满分,元数据层的 AI-Ready 有明显天花板——它是"开放但朴素"的典型样本。

6.5 与库内可获取性光谱的对照

把库内条目的获取模式排一条光谱,本数据集处在最开放端:

获取模式 库内例子 本数据集
公开直链 + 宽松许可(CC BY 类) acevedo-blood(本条目)、medmnist(716) ✓ 完全一致
公开下载但条款逐条细读 多数图像集 —
注册/申请 gate 部分队列与基因组集 ✗ 无此环节
请求制(邮件通讯作者) panda-plus 的掩码层 ✗ 无此环节
非公开 Matek BM 171,374 张 ✗(对照项,永不公开)

对数据集选型者的启示:如果你要给团队挑一个"今天下午就能开工"的血液显微图像数据集,这个是确定性最高的选择——没有任何一个环节可能卡住你。

6.6 下载留痕与完整性校验实操

Mendeley 直链省掉了申请环节,但也意味着校验责任完全转移到下载者一侧——没有 gate 的数据集,同样没有 gate 后面帮你做一致性检查的人。这一节给出一份最小可操作的验收清单,做完即可放心开工。

6.6.1 下载留痕三件套(写给未来的自己与审稿人)

留痕项 内容 写在哪里
版本 URL https://data.mendeley.com/datasets/snkd93bnjr/1 实验记录 / 仓库 README
下载日期 精确到日(如 2026-09-29) 同上
Data DOI 10.17632/snkd93bnjr.1(Version 1,2020-06-08 发布) 论文数据可用性声明

三条一起留,任何人在任何时点都能精确复现"你当时拿到的是哪一版字节"。本数据集目前是单一版本链(未发现 .2 及以上),版本漂移风险低(§6.3),但留痕习惯不因版本少而豁免。

6.6.2 完整性校验:计数 + 抽查,替代不存在的官方哈希

一个必须诚实面对的事实:官方没有发布压缩包级的 MD5/SHA 校验值,托管页描述之外也未随包附逐文件清单(§9 待核 3)。因此正确的校验姿势不是"对一个哈希",而是两层交叉验证:

校验层 动作 通过标准
计数层 解压后逐目录统计 JPG 数量 八组数字与官方 Table 1 逐一相等(3,329 / 3,117 / 2,895 / 2,348 / 1,551 / 1,420 / 1,218 / 1,214),总数恰 17,092(附录 E 有速算表)
抽查层 每组随机抽 5-10 张,读图像尺寸与色彩通道 360×363 px、RGB;若出现异常尺寸先怀疑下载不完整而非数据本身

计数层脚本十行以内可写完(目录即标签的好处在这里兑现一次),抽查层用任何图像库读 shape 即可。两层都过,数据完整性就有了可写进方法学段落的依据。

计数层的参考实现(shell 十行以内,输出与 Table 1 逐行对照):

# 逐目录统计 JPG 数量(目录即标签在这里兑现一次)
find PBC_dataset -type f -iname '*.jpg' | sed 's|/[^/]*$||' | sort | uniq -c
# 期望八行:3329 / 3117 / 2895 / 2348 / 1551 / 1420 / 1218 / 1214,合计 17092
# 注:目录名以解压包实际为准,本命令只数数量不做名称假设

6.6.3 三个常见故障与处置

  1. 解压后目录层级多一层:部分操作系统解压工具会把内层目录再包一层,ImageFolder 指向上一层目录就会把"目录名"错当类别。处置:加载前先打印目录树确认八组目录直接可见(§3.4 有包内容清单)。
  2. 下载中断导致尾部文件损坏:JPG 损坏通常在读图时才暴露。处置:计数层先拦(数量不足直接重下),抽查层兜底(读图报错的文件重下后复检)。
  3. 把 BloodMNIST 的 MD5 误用到原包上:7053d0359d879ad8a5505303e11de1dc 是 BloodMNIST npz 文件的校验值(§5.4.3),不是本数据集原始压缩包的哈希——两者是母集与派生集的关系(§8.4)。写进校验脚本前先看清对象。

验收完成后的最后一步:把 Table 1 对照结果存成一行日志(“2026-09-29 下载,八组计数全部相符,总 17,092”)。这一行将来就是你回应审稿人"数据从哪来、是否完整"的全部证据。

§7 同域数据集对照

7.1 外周血/骨髓显微图像公开集景观

以 S0169260724005534 论文 Table 1 的对照口径为骨架(数字为该文口径,我们逐项注明来源语境):

数据集 图像数 类数 公开性 与本数据集的关系
Matek BM(骨髓) 171,374 21 非公开 规模与类目(含异常形态)远超,但学术访问受限——常被引作"更大的存在",不可实测
Matek blood(外周血) 18,365 15 非公开 含异常类目;同样不公开
Acevedo(本条目) 17,092 8 CC BY 4.0 公开 最大纯正常血象公开集,事实上的公开基准锚点
Raabin-WBC 17,965 5 CC BY 4.0 规模相近的公开同类;类目更粗(白细胞 5 类,无血小板/幼红)
BloodMNIST 17,092 8 CC BY 4.0 本数据集的 28×28 派生版(同数据不同皮)

三个定位判断:

  1. "最大"要加限定词:外周血/骨髓显微图像公开集里,纯正常血象+全开放+单细胞粒度的组合下,17,092 张就是最大——不加限定词的"最大血细胞数据集"说法会被 Matek BM(171,374,不公开)打脸。
  2. 与 Raabin-WBC 是互补不是替代:Raabin 5 类白细胞口径更贴近"血常规人工分类"任务;Acevedo 8 组多了血小板、幼红细胞与 IG,且图像来自全自动 Core Lab 流水线(设备标准化更强)。
  3. BloodMNIST 行不是第五个数据集:它是本数据集的降采样皮——把两行加起来统计"血细胞数据集数量"是常见滑稽错误(坑 7)。

7.2 官方自我定位与十年回看

官方原话(Data in Brief 摘要):“据我们所知,这是首个拥有大数量正常外周血细胞的公开集,期望成为模型基准的 canonical dataset。”

十年回看,这个定位基本站住了:公开生态里"大样本正常血象单细胞集"至今仍以它为默认起点;后来的公开集要么更粗粒度(Raabin 5 类)、要么转向派生皮(BloodMNIST)、要么不公开(Matek 系)。它没有做成的是"异常细胞"半壁江山——那部分生态由不公开的骨髓集与零散小集分担。

7.3 正常与异常的边界:它不做的事

本数据集不含白血病原始细胞、不含异型淋巴细胞、不含疟原虫感染红细胞——所有"异常"都不在类目里。同团队的其他工作(如 Boldú 等急性白血病图像识别、Alférez 等异型淋巴细胞识别,见 Data in Brief 引文列表)说明研究组有异常细胞研究线,但从未公开同等规模的异常集。

使用含义:拿本数据集训练的 8 类分类器,遇到白血病原始细胞时会被迫输出 8 类之一(闭集假设)——把它直接当"血液病筛查器"是危险的误用;正确姿势是把它当"正常血象的形态学字典",异常检测需另建开集/OOD 机制(§5.5 出路 2)。

§8 生态与互链(库内条目)

8.1 库内家族图谱(条目名 + rid)

库内条目 rid 互链性质 建议强度
medmnist 716 实质派生关系:BloodMNIST 即本数据集 28×28 降采样版(MedMNIST+ 源字段明写 Acevedo) ★★★ 首选
herlev-pap 483 同"显微镜细胞学图像分类"范式(宫颈细胞学) ★★
sipakmed 490 同"显微镜细胞学图像分类"范式(宫颈液基细胞学) ★★
human-cell-atlas 319 细胞生物学数据生态(单细胞转录组图谱,形态学↔分子对照叙事) ★
cellxgene 38 细胞生物学可视化/数据生态 ★
jump-cell-painting 563 高内涵细胞成像表型生态(图像表型 vs 形态学分类对话) ★

互链叙事建议:与 medmnist 的互链要写"派生"而非"同域"(这是全库少有的直接父子关系,比类比式互链信息量大得多);与 herlev-pap/sipakmed 写"同范式跨器官"(同为显微镜单细胞分类,任务结构一致,可互引预处理经验);与 HCA/cellxgene/jump 写"图像形态学与分子图谱的生态位互补"。

8.2 检索路径建议

  1. 从 medmnist 条目进来的读者:告知"你手里的 BloodMNIST 上游就在本条目",原生 360×363 版本可解锁分辨率相关研究。
  2. 从 herlev-pap/sipakmed 进来的读者:关注 §3 标注流水线(工作站预标+专家复核范式在两个器官间的异同)与 §5.6 统计卫生(三套 split 的教训通用)。
  3. 从 hca/cellxgene 进来的读者:形态学分类与分子分型是细胞的两种"身份证",本条目提供图像侧的锚点。

8.3 外部生态位

  • 教学:CC BY 4.0 + 规模适中 + 8 类直白,是"医学影像入门第一课"级的数据集(Kaggle/课程作业高频出现其派生皮)。
  • 方法学试金石:新架构(KAN 变体、联邦学习、不确定性方法)论文里常见它当"标准测试床"——饱和基准的新用途。
  • 行业对照:CellaVision 等商用数字形态学系统的学术公开参照物——它是外界能在同设备口径下对标的唯一大样本公开集。

8.4 与 medmnist(rid 716)条目的分工声明

本条目与 medmnist 条目存在全库唯一的父子派生关系(BloodMNIST 即本数据集的 28×28 降采样皮),为避免两文重复建设与叙事冲突,正式划定分工:

维度 本条目(acevedo-blood) medmnist 条目(rid 716)
数据本体 原生 360×363 JPG,17,092 张,8 类目录 MedMNIST v2 全家桶视角,BloodMNIST 为其中一个 28×28 子集
采集链 Advia 2120 → SP1000i → DM96 全链路(§3) 不展开(引用本条目)
染色协议 MGG 机理与自动化标准化(§3.5) 不展开
形态学 八组逐类档案与混淆地图(§2.7/§2.8) 不展开
许可 CC BY 4.0 原包口径(Mendeley,§6) MedMNIST 分发口径(其 CC BY 4.0 继承声明)
基准 原生分辨率口径:96.2% / 99.32% / 99.51% 28×28 及 64/128/224 派生口径,MedMNIST 生态横向对比
split 官方自用 + 64/24/12 11,959/1,712/3,421 官方派生 split
降采样工艺 记录工艺链与 MD5(§5.4.3) 详述 MedMNIST 统一降采样框架

读者动线:

  1. 从 medmnist 条目来的读者:你在 28×28 上做的一切,其数据源头、采集链与原生分辨率基准在本条目;需要分辨率(>28 px)时直接取原包(§6.1),下载门槛与派生皮同样为零。
  2. 从本条目去 medmnist 条目的读者:轻量基准、几十个子集同台对比、教学工具链在彼处;用 BloodMNIST 做消融时先读彼处的统一降采样框架。
  3. 双条目共同承诺:凡涉派生关系,两文均写"派生"而非"同域",且统一采用 MedMNIST+ 的源声明口径(“A. Acevedo et al.”,事实清单第 24 条);任何一侧修订派生链表述,按附录 L 触发点同步另一侧。

为什么这条分工值得写进正文:派生关系是本条目区别于全库其他"同域对照"互链的结构性特征——它意味着两个条目不是互相补充的两个视角,而是同一批像素的两个分辨率化身。把分工钉死,读者在任一侧都能获得完整叙事,且不会把 BloodMNIST 误当独立数据集(坑 7 的条目级防线)。

§9 方法学启示:三条可迁移的经验

9.1 “工作站即流水线”:复用临床日常而不是另建标注管线

最值得抄的设计决策:数据集没有为研究新造一套标注流程,而是把 DM96 的临床在用流程(预分类+专家复核)整体复用。收益是零额外标注成本 + 设备级标准化 + 与真实检验场景零域差;代价是流程透明度受制于商用系统(§3.2 的三个缺口)。可迁移判断:凡是目标域已有成熟数字工作站的场景(骨髓、宫颈、尿液有形成分……),优先考虑"工作站复用"而非"从零手标"——但要预留透明度补偿措施(发布一致性数据、预分类改判率)。

9.2 "纯正常"的对照设计价值

只收健康供者、只设正常 8 组,这个"窄"成就了它的"纯":类别轴干净、无异常干扰、分布即真实血象。它与含异常类目的数据集(Matek BM 21 类)构成光谱两端——前者是"正常形态学字典",后者是"疾病形态学图谱"。设计启示:一个数据集不必贪大求全,把一个场景做纯,其对照价值会随生态成熟而上升(本条目在 OOD/开集研究里的"干净对照组"角色正是这种价值)。

9.3 派生链即传播链:被 BloodMNIST 载着走

本数据集的传播历史有个值得记录的结构:真正让它进入千千万万笔记本的,不是 Mendeley 原包,而是 MedMNIST 的 28×28 派生皮。派生品降低了使用门槛(一行 medmnist 代码),也带来了分辨率信息损失与"知其皮不知其源"的引用习惯(很多人引 BloodMNIST 论文而不引 Acevedo)。可迁移启示:大数据集的传播要主动经营"派生链"——官方若当年自己发布多分辨率派生版,就能把署名链握在自己手里;对使用者,从派生皮回溯原生数据(§6.1)常常能免费解锁一批分辨率敏感的研究方向。

§10 避坑清单:八个已踩过的坑

坑 1:arXiv:1701.01905 不是本数据集的论文。该编号实为数学论文(Korff, “Korff F-signatures of Hirzebruch surfaces”),与血细胞毫无关系;检索语境里的误引源可追溯到早期转引链。数据集论文的真源是 Data in Brief 30:105474(DOI 10.1016/j.dib.2020.105474,PMID 32346559)。引用前用 DOI 反查一次 PubMed 是 cheapest 的防错动作。

坑 2:"13 类白细胞"是印象错误。两篇官方论文均明写 eight classes/groups(8 组);官方另一个口径是"10 种类型分 8 组"——IG 组内含早幼粒/中幼粒/晚幼粒三子类(3+7=10)。"13 类"在任何官方文本中都不存在;以 13 类为口径的训练脚本大概率混入了别的数据集或自己拆的子类。

坑 3:"12,869 张"不是官方规模。S0169260724005534 论文 Table 2 的 Acevedo 列(IG 145、erythroblast 78 等,合计 12,869)是该论文自己标注的子集,不是官方分布;官方 Data in Brief Table 1 合计恰 17,092,且 arXiv 2110.09508 与 Wiley 202500387 两份独立第三方引用与官方一致。凡见到 12,869 口径,按"自标子集"处理,不可当官方数字转引。

坑 4:没有官方专名。“Acevedo dataset”“PBC Dataset”“PBC_Acevedo”“Peripheral Blood Cell dataset”“Blood Cell Microscope”(MedMNIST 口径)都指向同一批数据。按专名检索会漏;最稳的唯一标识是 Mendeley ID snkd93bnjr 与 Data DOI 10.17632/snkd93bnjr.1。

坑 5:没有官方固定 split。原始发布(Mendeley V1)无划分文件;文献里三套划分并行——2019 官方论文自用划分(96.2%)、arXiv 2110.09508 的 64/24/12(99.32%)、BloodMNIST 的 11,959/1,712/3,421。跨论文准确率不可直接对标;复现任何指标先问"哪个 split"。

坑 6:作者名与双论文,两个引用高频错误。一作全名是 Andrea Acevedo(不是 Adrián)、通讯是 José Rodellar(不是 Jordi)——PubMed 32346559 与 Recercat 机构库双源可证。另外 Data in Brief(2020,数据论文)与 Comput Methods Programs Biomed(2019,方法论文)分工不同:数据规格引前者、96.2% 基准引后者,混引会让审稿人困惑。

坑 7:BloodMNIST 不是"第五个血细胞数据集"。它是本数据集的 28×28 降采样派生版(MedMNIST+ 论文源字段明写 Acevedo),同 17,092 张、同 8 组。做文献统计或数据集对比表时把两行相加是滑稽错误;反之,若你只认识 BloodMNIST,本条目就是你的"回源指南"(§6.1)。

坑 8:Advia 2120 不是数据内容,CBC 数值不在包里。Advia 2120 全血分析仪只在采集链里当"守门员"(供者质控),它的血常规数值没有随数据集发布——把它当"影像+检验多模态数据集"是误读;这是纯图像数据集,唯一的"标注"就是 8 组目录名。

§11 总结

11.1 三句话总结

  1. 这是公开生态里最大最纯的正常外周血单细胞显微图像集:17,092 张、8 组 10 类型、360×363 px、专家标注、CC BY 4.0 全开放。
  2. 它的采集链(Advia 2120 → SP1000i → DM96)复用了临床 Core Laboratory 的日常流水线,设备级标准化是它作为基准的隐形竞争力。
  3. 它的下游派生(BloodMNIST/MedMNIST+)让 28×28 皮通行全球,而原生 360×363 版本与三套并行 split 的口径管理(§5.6)是引用前必做的功课。

11.2 适合谁

  • 给实验室选"第一个血液显微图像数据集"的教学负责人——无 gate、CC BY 4.0、单卡可训,今天下午开工。
  • 做细胞分类/细粒度识别方法研究的团队——8 组里粒系内部的相似类对是现成的细粒度难题。
  • 做不确定性量化、开集识别、分布偏移研究的团队——饱和的闭集准确率让增量价值集中在这些轴上。
  • 做 BloodMNIST 相关工作想"回源"的人——原生分辨率可能免费解锁一批新实验。

11.3 不适合谁

  • 找异常细胞(白血病/疟疾/异型淋巴)数据的人——一概没有,闭集 8 类会"硬编"任何异常输入。
  • 需要患者级划分、供者人口学、纵向数据的人——供者信息未披露,结构性缺口无法补。
  • 需要全涂片/WSI 或细胞检测标注的人——单细胞裁剪粒度,检测任务无负样本无框。
  • 需要影像+检验多模态的人——CBC 数值不在包里(坑 8)。

11.4 30 秒决策卡

你的需求 判断
正常血象单细胞分类基准,要公开许可 ✓ 就是它
教学演示 / 单卡训练 / 轻量对比实验 ✓ 规模与格式都友好
血液病检测、异常细胞识别 ✗ 纯正常集,会误用
患者级建模 / 多模态(影像+CBC) ✗ 元数据缺口
28×28 轻量基准 走 BloodMNIST 派生皮,但记得回本条目引用

FAQ(高频问答 38 问)

A. 基础认知

Q1:数据集的官方名字是什么?
没有注册专名。文献惯称 Acevedo dataset 或 PBC Dataset;Data in Brief 论文标题是 “A dataset of microscopic peripheral blood cell images for development of automatic recognition systems”;MedMNIST 生态里叫 Blood Cell Microscope(原生)与 BloodMNIST(派生)。

Q2:多少张图?
17,092 张,官方 Table 1 八组之和恰好此数:中性粒 3,329 / 嗜酸 3,117 / IG 2,895 / 血小板 2,348 / 幼红 1,551 / 单核 1,420 / 嗜碱 1,218 / 淋巴 1,214。

Q3:多少类?
目录级 8 组;类型级 10 种分 8 组(IG 组含早幼粒/中幼粒/晚幼粒三子类)。"13 类"是讹传(坑 2)。

Q4:图像什么规格?
360×363 像素 JPG,RGB,单细胞居中,无预处理原样保存。

Q5:谁做的?
西班牙双机构:Hospital Clinic de Barcelona(临床侧,Core Laboratory 采集与专家标注)+ 加泰罗尼亚理工 UPC(工程侧,方法研发);六作者,通讯 José Rodellar(UPC 数学系)。

Q6:发表在哪里?
双论文:数据集论文 Data in Brief 30:105474(2020,开放获取,PMID 32346559);方法论文 Comput Methods Programs Biomed 180:105020(2019-10,PMID 31425939)。

Q7:数据从哪来?
2015–2019 年 Hospital Clinic de Barcelona 健康供血者的外周血涂片,经 Advia 2120(质控)→ SP1000i(MGG 染色)→ CellaVision DM96(采图预分类)流水线数字化。

Q8:最大卖点一句话?
“首个大样本正常外周血细胞公开集”(官方原话),CC BY 4.0 无门槛开放,且你大概率已经用过它的 28×28 皮(BloodMNIST)。

B. 数据与获取

Q9:怎么下载?
Mendeley 托管页 https://data.mendeley.com/datasets/snkd93bnjr/1 → Download V1 全包。无需注册,无任何 gate。

Q10:许可什么条款?
CC BY 4.0:商用/衍生/再分发皆可,唯一义务是署名(引 Data in Brief 论文 + Data DOI 10.17632/snkd93bnjr.1)。

Q11:包里有什么文件?
8 个类别目录的 JPG(目录名即标签)。没有 CSV manifest、没有 split 文件、没有供者元数据(§3.4)。

Q12:有版本管理吗?
单一版本 V1(2020-06-08),DOI 固化快照,至今无 .2——引用无需版本辨析。

Q13:能下载更高/更低分辨率版本吗?
官方原生只有 360×363。降采样 28×28 与升级 64/128/224 px 版本走 MedMNIST 生态(BloodMNIST / MedMNIST+),均为派生品。

Q14:下载后怎么加载?
PyTorch torchvision.datasets.ImageFolder(root) 一行即用;或先 glob 按目录扫一遍自建 manifest。想要官方 split 结构可手动对齐 BloodMNIST 的 11,959/1,712/3,421(但那是派生皮划分)。

C. 标注与质量

Q15:谁标注的?
CellaVision DM96 机器预分类打底,临床病理专家(expert clinical pathologists,论文复数口径)逐张复核确认。

Q16:标注一致性有数据吗?
没有。论文未发布观察者间 κ 或改判率——标注可靠性是"临床资格背书"而非"量化背书",引用时写 expert-annotated 而非 consensus-annotated。

Q17:IG 组的三个子类能分开拿到吗?
不能。早幼粒/中幼粒/晚幼粒的逐张归属未随包发布,8 个目录就是标签的全部粒度。

Q18:图像质量有已知问题吗?
官方未发布质量分级或已知错误清单;五年无勘误公告。MGG 自动染色 + 商用工作站让采集端质量有临床质控背书,但个别样本的染色批次差异客观存在——做域泛化研究时这正是"真实世界变异"的一部分。

D. 基准与指标

Q19:官方基准多少?
2019 CMPB 论文:特征提取+SVM(VGG-16 86%、InceptionV3 90%),微调(VGG-16 96%、InceptionV3 95%),最佳总体 96.2%(Keras/TensorFlow + Titan XP 单卡)。

Q20:最高纪录多少?
第三方 27-CNN 全微调(arXiv 2110.09508,64/24/12 划分):最高 99.32%(Wide ResNet-50-2),最低 98.39%(AlexNet)。

Q21:96.2% 和 99.32% 能直接比吗?
不能干净地比——两套 split 不同(论文自用 vs 64/24/12)。见 §5.6 统计卫生守则。

Q22:BloodMNIST 上的指标能搬到原生版吗?
不能。28×28 与 360×363 是不同的任务难度;MedMNIST+ 的 64/128/224 档位就是为分辨率消融准备的。

Q23:固定口径下饱和了还能做什么?
三条出路:细粒度混淆分析(残错集中在粒系近邻类对)、OOD/开集/不确定性评测(饱和集当"干净对照组")、分辨率与数据效率消融(§5.5)。

Q24:有患者级划分吗?
没有,也无法有——供者归属未披露,所有 published split 都是图像级随机,跨集乐观偏差理论上存在但不可量化。

E. 库内与生态

Q25:和库内 medmnist 条目什么关系?
父子关系:BloodMNIST 是 medmnist 条目(rid 716)内含的子集,派生自本数据集。这是库内少见的直接派生互链,强于一般类比互链。

Q26:和 herlev-pap / sipakmed 什么关系?
同范式跨器官:同为显微镜单细胞分类(宫颈细胞学方向),任务结构与预处理经验可互移;类目体系与临床场景不同。

Q27:和 human-cell-atlas / cellxgene / jump-cell-painting 什么关系?
生态位互补:那边是单细胞分子图谱与高内涵成像表型,本条目是图像形态学分类锚点——"细胞的两种身份证"叙事的素材。

Q28:Matek 数据集更大,为什么本条目是公开基准锚点?
Matek BM 171,374 张/21 类确实更大,但非公开(学术访问受限);公开生态里"大样本+纯正常+全开放"的组合至今以本数据集为最大(§7.1)。

F. 工程与引用细节

Q29:写论文引用清单是什么?
数据:Acevedo et al., Data in Brief 30:105474 (2020),DOI 10.1016/j.dib.2020.105474 + Data DOI 10.17632/snkd93bnjr.1;方法/基准:加引 CMPB 180:105020 (2019);用 BloodMNIST:加引 MedMNIST v2 论文。

Q30:别引什么?
别引 arXiv:1701.01905(数学论文,坑 1);别引 12,869 口径(自标子集,坑 3);别把 BloodMNIST 行当独立数据集统计(坑 7)。

Q31:想复现 96.2% 怎么办?
按 2019 论文正文口径搭建(Keras/TensorFlow、Titan XP 级算力即可);注意论文摘要未给出划分精确样本数(遗留疑点),需要从正文方法节取口径。

Q32:数据包会用坏吗?
Mendeley/Elsevier 平台稳定 + DOI 固化,链接腐坏风险低;JPG 是最通用格式。若做长期项目,建议下载本地存档并记录 Data DOI 版本(V1)。

G. 进阶与边界问题

Q33:八组里哪组最好认、哪组最难认?
最好认:嗜酸(橙红粗颗粒)、嗜碱(深紫蓝遮核)、血小板(小而无核)——视觉签名过目不忘;最难的是 IG 组与成熟中性粒的边界(核形成熟连续谱)和大淋巴 vs 单核(§2.8 类对 1/2)。"总体准确率"掩盖的就是这两条类对的差异。

Q34:健康供者的血里为什么会有未成熟粒细胞和幼红细胞?
“正常"是供者维度质控(四条排除标准,§2.5)而非"每张图教科书正常”。健康人外周血可以零星见到反应性未成熟粒与少量有核红(尤其在感染与再生性贫血常见谱系内,论文配图原话);这 2,895 + 1,551 张正是这一真实谱系的采样,也是数据集"真实血象分布"的证明。

Q35:集成已经 99.51% 了,这个数据集还有研究价值吗?
有,但不在刷总准确率(§5.5):细粒度错误分析(类对 1/2)、OOD 与不确定性评测(闭集饱和集是天然干净对照组)、分辨率消融(28 px vs 64/128/224 vs 360×363)、染色归一化(§3.5.3)、以及新架构的"标准测试床"角色(Wiley 202500387 是最近例证)。

Q36:论文里引 BloodMNIST 的降采样工艺和 MD5 怎么写?
工艺链按 MedMNIST 官方口径:原生 3×360×363 → center-crop 3×200×200 → resize 3×28×28(§5.4.3);分发文件 MD5 7053d0359d879ad8a5505303e11de1dc;同时保留对上游的署名(Acevedo Data in Brief DOI),避免"知其皮不知其源"(§9.3)。

H. 数据工程细节

Q37:官方提供 train/val/test 划分吗?

不提供。官方包只有"目录即标签"的图像目录结构(§3.4);2019 CMPB 方法论文有自己的实验划分(FACTS 口径),但它不是随包发布的固定 split;64/24/12 是 27-CNN 第三方评测的划分(§5.4.1)。你的划分自定即可,但要连随机种子一起公开(附录 O 第 3 条),否则结果不可复现。

Q38:有逐张元数据(采集日期、供者 ID、子类归属)吗?

没有。这三样都列在"未随包发布"清单里(§3.4):供者精确人数论文未披露、无逐张采集日期、IG 子类归属未发布。这正是 DAIMS 评估中 M 维(元数据质量)成为最大短板的直接原因(附录 M),也是使用本数据集时"目录即标签"之外不能假设任何附加信息的原因(§2.6)。

事实清单(硬事实 36 条)

  1. 数据集含 17,092 张单细胞显微图像,官方 Table 1 八组之和恰为此数。
  2. 8 组分布:中性粒 3,329(19.48%)/嗜酸 3,117(18.24%)/嗜碱 1,218(7.13%)/淋巴 1,214(7.10%)/单核 1,420(8.31%)/IG 2,895(16.94%)/幼红 1,551(9.07%)/血小板 2,348(13.74%)。
  3. 图像规格:360×363 像素 JPG RGB,单细胞居中,无滤波无预处理。
  4. 采集设备链:Advia 2120 全血计数 → Sysmex SP1000i 自动 May-Grünwald-Giemsa 染色 → CellaVision DM96 数字采图与预分类。
  5. 采集地点:Hospital Clinic de Barcelona 核心实验室(Core Laboratory)。
  6. 采集期:2015–2019。
  7. 供血者准入四条:无感染、无血液病、无肿瘤、采血时无相关药物治疗。
  8. 供血者精确人数未披露;随机 ID 匿名化。
  9. 标注:expert clinical pathologists(复数)复核 DM96 预分类。
  10. 官方口径:“first publicly available set with large numbers of normal peripheral blood cells”,期望成为 canonical dataset。
  11. IG 组官方说明含 promyelocytes/myelocytes/metamyelocytes 三子类——10 类型分 8 组。
  12. 六作者(PubMed/Recercat 全名):Andrea Acevedo(双隶属 Hospital Clinic+UPC)、Anna Merino、Edwin Santiago Alférez、Ángel Molina、Laura Boldú、José Rodellar(通讯,UPC)。
  13. Alférez 在 Data in Brief 时点隶属 Universidad del Rosario(波哥大)。
  14. 数据集论文:Data in Brief 30:105474 (2020),DOI 10.1016/j.dib.2020.105474,PMID 32346559,PMCID PMC7182702,ScienceDirect PII S2352340920303681,开放获取。
  15. 方法论文:Comput Methods Programs Biomed 180:105020 (2019-10),DOI 10.1016/j.cmpb.2019.105020,PMID 31425939。
  16. Mendeley Data 托管:snkd93bnjr/1,Version 1 发布于 2020-06-08,Data DOI 10.17632/snkd93bnjr.1,单一版本链无 .2+。
  17. 许可:CC BY 4.0(Mendeley 托管页直核);论文同为 Open Access(Recercat dc.rights 口径 CC BY 4.0)。
  18. Mendeley 主题标签:Platelet / Leukocyte / Hematopathology / Blood Cell;Related Article 链方法论文 DOI。
  19. 获取:免费公开下载,无注册、无申请 gate。
  20. 官方基准(2019 CMPB):特征提取+SVM VGG-16 86%、InceptionV3 90%;微调 VGG-16 96%、InceptionV3 95%;最佳总体 96.2%;环境 Keras/TensorFlow + Nvidia Titan XP。
  21. 第三方 27-CNN(arXiv 2110.09508):64/24/12 划分,最高 99.32%(Wide ResNet-50-2),最低 98.39%(AlexNet);引用类分布与官方一致。
  22. 第三方 Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN):确认 8 类口径。
  23. BloodMNIST(MedMNIST v2)派生自本数据集:同 17,092 张、8 类、28×28;官方 split 11,959/1,712/3,421。
  24. MedMNIST+(arXiv 2404.15786)Table 1:Blood 源字段 “A. Acevedo et al.”,Blood Cell Microscope,MC (8),Shannon’s Equitability 三个 split 均 0.96;提供 64/128/224 px 版本。
  25. 同域对照(S0169260724005534 Table 1 口径):Matek BM 171,374/21(非公开)、Matek blood 18,365/15(非公开)、Acevedo 17,092/8(公开)、Raabin-WBC 17,965/5(CC BY 4.0)。
  26. arXiv:1701.01905 为数学论文(Korff F-signatures of Hirzebruch surfaces),与本数据集无关——转引链误引已证伪。
  27. "13 类白细胞"无官方出处:两篇官方论文均写 eight classes/groups。
  28. 12,869 口径(S0169260724005534 Table 2)系该论文自标子集,非官方分布。
  29. 原始发布无固定 train/val/test 划分文件;文献三套 split 并行(2019 论文自用 / 64-24-12 / 11,959-1,712-3,421)。
  30. 数据包无 manifest、无供者元数据、无子类归属、无采集日期映射——目录即标签是全部标注粒度。
  31. 观察者间一致性系数未发布;机器预分类改判率未披露。
  32. 数据集不含异常细胞类目(白血病原始细胞、异型淋巴等均不在 8 组内)。
  33. 同团队有异常细胞研究线(Boldú 急性白血病识别、Alférez 异型淋巴细胞识别,见 Data in Brief 引文列表),未公开同等规模数据。
  34. Advia 2120 的 CBC 数值不随数据集发布——纯图像数据集。
  35. Mendeley 分类标签与论文关键词(Blood cell automatic recognition; Blood cell morphology; Deep learning; Hematological diagnosis 等)与托管页一致。
  36. 抓取核验时点:2026-09-29(Mendeley 托管页、PubMed 32346559、Recercat hdl 2117/386919、arXiv 2404.15786 等多源)。

术语表(34 条)

术语 释义
外周血(peripheral blood) 循环血液,区别于骨髓穿刺样本;血涂片镜检的对象
血涂片(blood smear) 血液薄涂于玻片经染色后的显微镜样本
May-Grünwald-Giemsa(MGG) 血细胞形态学标准染色法之一,嗜酸/嗜碱颗粒在此染色下色差分明
CBC Complete Blood Count,全血计数;Advia 2120 的输出,本数据集未含其数值
中性粒细胞(neutrophil) 成熟粒系白细胞,分叶核;正常白细胞中占比最高
嗜酸性粒细胞(eosinophil) 粗大橙红颗粒为特征的白细胞,过敏与寄生虫应答相关
嗜碱性粒细胞(basophil) 深紫蓝颗粒的白细胞,正常血中最稀少者之一
淋巴细胞(lymphocyte) 圆核致密染色质的免疫细胞,T/B/NK 总称
单核细胞(monocyte) 大型不规则核白细胞,巨噬细胞前体
未成熟粒细胞(IG) 粒系前体(早幼粒/中幼粒/晚幼粒),正常外周血罕见,感染与再生性贫血时可见
早幼粒/中幼粒/晚幼粒(promyelocyte/myelocyte/metamyelocyte) 粒系成熟三阶段,本数据集合并为 IG 组,子类归属未随包发布
幼红细胞(erythroblast) 有核红细胞前体,正常外周血少量可见
血小板(platelet/thrombocyte) 无核细胞碎片,凝血要素;本数据集类目之一
正常血象(normal hematologic profile) 供者无相关疾病与用药背景下的血细胞形态谱,本数据集的准入定义
CellaVision DM96 数字形态学工作站:自动定位白细胞、裁剪视野、机器预分类;本数据集的采集设备
Advia 2120 全自动血液分析仪(CBC 输出),采集链中的质控守门员
Sysmex SP1000i 自动推片染色机,MGG 染色标准化者
单细胞图像(single-cell image) 每图恰一个居中细胞的裁剪图像;区别于多细胞视野与全涂片 WSI
WSI Whole Slide Image,全切片扫描图像;本数据集不含
目录即标签(directory-as-label) 用文件夹结构承载类别标签的数据组织约定,ImageFolder 类工具的输入格式
闭集假设(closed-set) 模型假设所有输入属于训练类目之一;本数据集 8 类分类器的固有局限
Shannon’s Equitability 类别均衡度指标(0 全偏斜–1 全均衡);MedMNIST+ 口径本数据集三个 split 均 0.96
BloodMNIST MedMNIST v2 中派生自本数据集的 28×28 子集,官方 split 11,959/1,712/3,421
Data DOI 数据集自身的 DOI(10.17632/snkd93bnjr.1),与论文 DOI 分开引用
核左移(left shift) 杆状核等较幼稚中性粒比例增高的血象改变,感染/炎症的形态学信号;本数据集不含杆状核独立类目,此类样本归入中性粒或 IG 组
嗜天青颗粒(azurophilic granule) 粒系细胞胞质内的初级颗粒(MGG 紫红色),早幼粒阶段最密集;IG 组与单核组判别的核心特征
分叶核(segmented nucleus) 成熟中性粒的核形态(2–5 叶、细丝相连);与 IG 晚幼粒"肾形核"的边界是类对 1 难度的来源
血红蛋白化(hemoglobinization) 红系前体胞质随血红蛋白积累从深蓝转灰红的着色过程;幼红细胞组内色域跨度的成因
核质比(N/C ratio) 细胞核与胞质面积之比;小淋巴"核占九成"即高核质比的教科书示例
细粒度分类(fine-grained classification) 类间差异集中于细微局部特征的分类任务设定;本数据集残余错误的主要学术语境
类对混淆(class-pair confusion) 错误集中于特定近邻类对的现象;本数据集的五条类对见 §2.8 地图
投票集成(voting ensemble) 多模型输出按多数票合并的集成方式;arXiv 2110.09508 的 top-4 集成达 99.51%(§5.4.2)
中心裁剪(center-crop) 取图像中心区域的降采样操作;BloodMNIST 工艺链第一步(360×363 → 200×200,§5.4.3)
染色归一化(stain normalization) 把图像映射到参考染色域的预处理方法族;应对跨染色域漂移(§3.5.3)的标准工具

附录

附录 A:条目信息速查卡

项 值
条目名 acevedo-blood
通用名 Acevedo dataset / PBC Dataset
类型 纯图像数据集(单细胞分类)
论文 Data in Brief 2020;30:105474 + CMPB 2019;180:105020
团队 Hospital Clinic de Barcelona + UPC(通讯 José Rodellar)
规模 17,092 张(8 组,360×363 px JPG)
许可 CC BY 4.0(单一许可)
获取 Mendeley Data 免费直链,无 gate
抓取时点 2026-09-29
库内互链 medmnist(716)/herlev-pap(483)/sipakmed(490)/human-cell-atlas(319)/cellxgene(38)/jump-cell-painting(563)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 Data in Brief 开放获取 + PubMed/PMCID 可索引 + Mendeley 主题标签;失分项:无官方专名导致检索分散(坑 4)、"13 类/12,869"等讹误口径污染检索结果
A 可获取性 10 Mendeley 免费公开直链、无注册无申请、CC BY 4.0、DOI 固化快照——库内最开放档
I 可互操作 7 JPG+目录即标签,ImageFolder/glob 即用;MedMNIST 生态提供 npz/Python 包接口;失分项:无 manifest、无标准元数据 schema、子类与供者信息缺失
M 元数据质量 6 官方 Table 1 分布完备且被两份独立第三方复证;失分项:无供者元数据、无一致性数据、无官方 split、无逐张采集日期
S 可持续性 8 Mendeley/Elsevier 平台稳定 + Data DOI 版本固化(.1 快照永续解析)+ 单一版本五年零勘误;失分项:无官方维护社区、派生链(BloodMNIST)由第三方经营
综合评级 7.6/10(良好偏上) 可获取性与可持续性接近满分,元数据工程完备性是唯一系统性短板——"开放但朴素"的典型样本

附录 C:逐项证据链自证

关键数字/事实 来源 位置/方式
17,092 总量与八组分布 Data in Brief 论文 Table 1 PubMed 摘要 + Europe PMC 镜像全文核
360×363 px JPG、"eight groups"表述 Data in Brief 摘要 PubMed 32346559 页面原文
供者四条排除标准 Data in Brief 摘要 PubMed 32346559 页面原文
"first publicly available set…"定位 Data in Brief 摘要 PubMed 32346559 页面原文
DM96 / Core Laboratory 采集 Data in Brief 摘要 PubMed 32346559 页面原文
96.2%/96%/95%/90%/86% 基准 CMPB 方法论文 PubMed 31425939 + OpenAIRE 双源
27 CNN / 99.32% / 98.39% / 64-24-12 arXiv 2110.09508 摘要与正文核
CC BY 4.0 / V1 2020-06-08 / DOI Mendeley 托管页 data.mendeley.com/datasets/snkd93bnjr/1 直核
BloodMNIST 派生与官方 split MedMNIST+ 论文 Table 1 + clustpy 文档 + 第三方仓库 arXiv 2404.15786 / 三源互证
作者全名与隶属 PubMed 32346559 + Recercat 双源比对
同域对照数字 S0169260724005534 Table 1 论文表格转引(第三方口径,注明)
arXiv:1701.01905 证伪 arXiv 官方页 编号直查
12,869 子集证伪 S0169260724005534 Table 2 上下文 该论文自标口径说明

附录 D:数据获取决策树

你的需求?
├── 原生 360×363 px 图像(方法研究/细粒度/分辨率消融)
│   └── Mendeley snkd93bnjr/1 → CC BY 4.0 → ImageFolder 加载 → 自建 manifest
├── 28×28 轻量基准(AutoML/教学/快速基线)
│   └── BloodMNIST(medmnist Python 包)→ 记得加引 MedMNIST v2 + Acevedo
├── 中高分辨率(64/128/224)消融
│   └── MedMNIST+(arXiv 2404.15786 配套发布)
├── 需要官方 train/test 划分
│   └── 没有(坑 5)→ 自划并声明,或对齐 BloodMNIST split 以便可比
├── 需要异常细胞(白血病/疟疾/异型淋巴)
│   └── 本数据集没有 → 转向含异常类目的同域集(多数不公开,§7.1)
└── 需要影像+CBC 多模态
    └── 本数据集没有(坑 8)→ CBC 数值需另寻电子病历生态

附录 E:八组速算表(占比核对用)

组 张数 占比 与全集比(1/X)
neutrophils 3,329 19.48% 1/5.1
eosinophils 3,117 18.24% 1/5.5
IG 2,895 16.94% 1/5.9
platelets 2,348 13.74% 1/7.3
erythroblasts 1,551 9.07% 1/11.0
monocytes 1,420 8.31% 1/12.0
basophils 1,218 7.13% 1/14.0
lymphocytes 1,214 7.10% 1/14.1
合计 17,092 100.00% —

采样提示:加权采样把各组拉平(每类约 12.5%)会人为抹掉真实血象结构;若做"临床仿真"评测,保留原始占比更有生态效度。

附录 F:坑点档案(与 §10 对照)

坑 错误口径 正确口径 危害等级
1 arXiv:1701.01905 是数据集论文 Data in Brief 10.1016/j.dib.2020.105474 中(引用错链)
2 13 类白细胞 8 组(10 类型分 8 组) 高(任务定义错)
3 12,869 张官方规模 17,092 张;12,869 是第三方自标子集 高(规模错)
4 按专名检索 无专名;认 Mendeley ID snkd93bnjr 低(漏检)
5 有官方 split 无;三套 split 并行 高(指标不可比)
6 Adrián/Jordi 作者名 Andrea Acevedo / José Rodellar 中(署名错误)
7 BloodMNIST 是独立第五集 它是本数据集 28×28 派生皮 低(统计滑稽)
8 影像+CBC 多模态 纯图像,CBC 不在包内 中(任务误设)

附录 G:双口径登记表

议题 口径 A 口径 B 采信与理由
类目数 8 组(目录级) 10 类型(IG 拆三子类) 并行采信:工程以 8 为准、形态学表述可注 10,均为官方原话
规模 17,092(官方) 12,869(第三方自标子集) 采信 17,092:官方 Table 1 + 两份独立第三方复证
划分 官方论文自用(96.2%) 64/24/12(99.32%);11,959/1,712/3,421(BloodMNIST) 并行记录、禁止跨口径对标
分辨率 360×363(原生) 28×28 / 64 / 128 / 224(MedMNIST 系派生) 并行记录,引用注明分辨率
作者首名 Andrea/José(PubMed+Recercat 双源) Adrián/Jordi(转引链误传) 采信双源全名

附录 H:FAIR / AI-Ready 检查单

检查项 状态
F1 元数据有全局唯一标识 ✓ Data DOI 10.17632/snkd93bnjr.1
F2 数据有持久标识 ✓(同上,Mendeley 版本固化)
F3 元数据含数据描述符 部分(有描述与标签体系;无逐张元数据)
F4 元数据可索引 ✓(Mendeley/PubMed/Google Dataset Search 可见)
A1 可检索 ✓(但专名缺失拉低命中率,坑 4)
A2 可访问(协议标准) ✓ HTTPS 直链,无认证
A3 元数据即认证失效仍可及 ✓(DOI 记录独立于数据文件)
I1 数据用开放格式 ✓ JPG
I2 词汇表符合社区标准 部分(目录名即标签,无受控词表映射)
I3 元数据含合格引用 ✓(论文 DOI + Data DOI 双链)
R1 许可明确 ✓ CC BY 4.0
R2 出处(provenance)可查 部分(论文级出处清晰;图像级溯源为零)
R3 社区标准meet ✓(Data in Brief 发布流程)
AI-Ready 综合 开放性满分、元数据工程为短板:适合"即取即用",不适合"溯源审计"

附录 I:基于本数据集的研究检查清单(10 项)

  1. 明确声明用哪个 split(自划/64-24-12/BloodMNIST 划分),不得含糊。
  2. 明确声明分辨率(原生 360×363 或 MedMNIST 系派生档)。
  3. 引用三件套按 §4.3 组合,勿引 arXiv:1701.01905。
  4. 报告总体准确率时附分组召回或混淆矩阵(低频组差异被均值掩盖)。
  5. 不要把模型表述为"血液病筛查工具"(闭集 8 类,§7.3)。
  6. 涉及"患者级"表述前重读 §5.6 第 3 条——供者归属不可得。
  7. 衍生数据产品保留 CC BY 4.0 署名链。
  8. 做域泛化/染色归一化研究时,把 MGG 自动染色的标准化背景写进方法学(§2.4)。
  9. 使用 BloodMNIST 指标对比时,注明与原生版的粒度差异(坑 7/§5.6 第 2 条)。
  10. 新造 manifest/split 时随数据一起发布(填补社区缺口的第一步)。

附录 J:图像加载与 manifest 生成骨架(代码)

# 环境:Python 3.10+,Pillow,pandas
import os, hashlib
import pandas as pd
from PIL import Image

ROOT = "snkd93bnjr-1"  # 解压后的 Mendeley V1 包根目录

# 1) 生成 manifest:目录即标签
rows = []
for cls in sorted(os.listdir(ROOT)):
    d = os.path.join(ROOT, cls)
    if not os.path.isdir(d):
        continue
    for fn in os.listdir(d):
        p = os.path.join(d, fn)
        h = hashlib.md5(open(p, "rb").read()).hexdigest()  # 查重/对账用
        rows.append({"path": p, "label": cls, "md5": h})
df = pd.DataFrame(rows)
assert len(df) == 17092, f"期望 17092,实际 {len(df)}"   # 官方总量自检
print(df["label"].value_counts())                        # 对齐附录 E 速算表

# 2) 图像规格抽检(官方口径 360x363 JPG RGB)
with Image.open(df["path"].iloc[0]) as im:
    print(im.size, im.mode)   # -> (360, 363) RGB

# 3) 分层划分示例(图像级;注意 §5.6 第 3 条患者级不可得)
from sklearn.model_selection import train_test_split
tr, tmp = train_test_split(df, test_size=0.3, stratify=df["label"], random_state=42)
va, te = train_test_split(tmp, test_size=0.4, stratify=tmp["label"], random_state=42)
tr.to_csv("train.csv", index=False); va.to_csv("val.csv", index=False); te.to_csv("test.csv", index=False)

附录 K:缩写速查

缩写 全称
PBC Peripheral Blood Cell
CBC Complete Blood Count
MGG May-Grünwald-Giemsa(染色法)
IG Immature Granulocytes(未成熟粒细胞)
WBC White Blood Cell
CMPB Computer Methods and Programs in Biomedicine(期刊)
PMC PubMed Central
WSI Whole Slide Image

附录 L:维护计划与触发点

触发点 动作
Mendeley 出现 .2 版本 核对新版 changelog,更新 §6.3 与事实清单第 16 条
官方发布一致性数据或子类归属 更新 §3.2、§2.3 与 DAIMS 的 M 维评分
MedMNIST 生态换 BloodMNIST 源声明 复核派生链表述(事实清单第 23/24 条)
出现新的公开同域集(规模/许可超越) 更新 §7.1 景观表与"最大纯正常"定位限定词
文献出现新的 SOTA 或新任务轴 更新 §5 基准节

附录 M:DAIMS 24 项细评

评分 1–10(10 为完全满足);与附录 H FAIR 检查单口径互相锚定,逐项给出判分依据。

# 维度项 分 依据
D1 可发现性·全局唯一标识 10 Data DOI 10.17632/snkd93bnjr.1 版本固化(§6.1)
D2 可发现性·富元数据 6 论文级描述、主题标签齐全;无逐张元数据
D3 可发现性·标准索引收录 9 PubMed(PMID 32346559)、Google Dataset Search、Mendeley 检索均可达
D4 可发现性·检索友好度 5 无官方专名(坑 4),转引名混乱拉低命中率
A1 可获取性·标准协议 10 HTTPS 直链下载,无认证
A2 可获取性·元数据持久 9 DOI 记录独立于文件存活
A3 可获取性·数据持久 9 Mendeley/Elsevier 平台稳定,V1 单版本链
A4 可获取性·获取门槛 10 无注册、无申请、无 gate(§6.1)
I1 互操作·开放格式 10 JPG + 目录结构,任何栈可读
I2 互操作·受控词表 4 目录名即标签,无 SNOMED/ICD-O 类标准映射
I3 互操作·工具兼容 10 ImageFolder 一行加载(§3.4/附录 J)
I4 互操作·标准引用 9 论文 DOI + Data DOI 双链(事实清单第 14/16 条)
M1 元数据·数据字典 3 无 manifest/CSV/JSON(§3.4 未发布清单第 6 条)
M2 元数据·采集协议记录 7 设备三站链与排除标准有论文级记录;逐日规程未附
M3 元数据·标注协议记录 5 "DM96 预分类 + 专家复核"两级口径有,人数/一致性缺口(§3.2)
M4 元数据·质控记录 6 供者四条排除标准 = 供者级质控声明;图像级质控无记录
M5 元数据·划分定义 2 无官方 split;三套并行划分全靠社区自持(§5.6 第 1 条)
M6 元数据·溯源信息 2 供者人数、图像-供者映射、采集日期映射全缺(§2.5)
M7 元数据·版本管理 9 Mendeley 版本链清晰(V1,2020-06-08)
M8 元数据·已知问题披露 7 论文自述局限 + 本条目存照体系(附录 G)补足社区披露
S1 可持续·持久托管 10 DOI 固化 + 学术出版社托管
S2 可持续·许可明确 10 CC BY 4.0(§6.1)
S3 可持续·维护主体 7 作者/机构链可考;无公开维护计划或 issue 渠道
S4 可持续·社区生态 10 MedMNIST 派生 + 236 次引用 + 持续第三方评测(§5.4)

汇总:D 30/40、A 38/40、I 33/40、M 41/80、S 37/40,总分 179/240(74.6%)。形状是典型的"开放性满分、元数据工程短板"——A/I/S 三维接近满贯,M 维的 M1/M5/M6 三项(manifest、split、溯源)合计仅 7/30,是全部失分深坑所在,也与 §10 的坑位清单一一对应。

附录 N:第三方与派生基准汇总表

全部已核基准的单一入口表;口径限定词一律随行给出(§5.6 统计卫生的表格化执行)。

来源 划分 分辨率 模型/口径 准确率 引用限定词
官方方法论文(CMPB 180:105020,2019) 论文自用(未公开精确样本数) 360×363 特征提取+SVM:VGG-16 / InceptionV3 86% / 90% “官方特征提取路线”
同上 同上 360×363 微调:VGG-16 / InceptionV3 96% / 95% “官方微调路线”
同上 同上 360×363 微调最佳总体 96.2% “官方基准”
arXiv 2110.09508(27-CNN) 64/24/12 360×363 AlexNet(27 架构最低) 98.39% “第三方单模型下限”
同上 64/24/12 360×363 Wide ResNet-50-2(27 架构最高) 99.32% “第三方单模型上限”
同上 64/24/12 360×363 投票集成 top-4(WRN-50-2 + VGG-19 + WRN-101-2 + ResNet-34) 99.51% “固定口径已发表上限”
MedMNIST v2(BloodMNIST) 11,959/1,712/3,421 28×28 生态基线(详见 medmnist 条目) 见派生条目 “28×28 派生口径”
MedMNIST+(arXiv 2404.15786) 同上 64/128/224 升级分辨率基线 见派生条目 “MedMNIST+ 升级档”
Wiley 10.1002/aisy.202500387(BiT-HyMLPKAN) 自定 360×363 BiT-HyMLPKAN 混合架构 见原文 “新架构试金石”

使用守则:

  1. 表内任何两行不可跨口径比较(划分、分辨率、任务设定至少一项不同);
  2. 转引 99.51% 必须带"投票集成 + 64/24/12"限定词(§5.4.2 第 3 条);
  3. 12,869 口径(自标子集)不入本表(坑 3);13 类口径无官方出处不入本表(坑 2)。

附录 O:细粒度子类研究路线(IG 三拆与形态学进阶)

本附录回答一个进阶问题:想在这批图上做比"8 组分类"更细的研究,路怎么走?前提事实:官方包只发布到 8 组粒度,IG 组内部的早幼粒/中幼粒/晚幼粒三子类归属未随包发布(§3.4),官方口径是"10 种类型、分 8 组"(§2.3)。

O.1 为什么值得拆

  • 临床含义不同:早幼粒异常增殖对应急性早幼粒细胞白血病谱系,晚幼粒/中幼粒增多见于感染、骨髓增殖性疾患等(§2.7.3);"IG 总量"无法区分这些场景。
  • 方法学价值:组内拆分是典型的细粒度分类问题(术语表:细粒度分类),难度轴从"组间"降到"组内",恰好是 2.8 混淆地图里最难那几条类对的延伸。
  • 空白即机会:官方未发布,任何严谨的拆分成果都是增量贡献——但正因如此,更不能把自己的拆分结果误传成"官方标签"(O.4 红线)。

O.2 三条可行路线

路线 做法 优势 硬约束
① 自标注 对 IG 组 2,895 张做双人独立标注 + 分歧仲裁,报告一致性系数(如 Cohen’s kappa) 标签质量可控,可发表 需要具备血液形态学资质的标注者;标注协议先于标注冻结
② 外部参照迁移 用含粒系成熟阶段细分的参照集做迁移学习或对照设计 省标注成本 最大参照(Matek 骨髓集,21 类含成熟阶段轴)非公开,只能作设计参照;公开的 Raabin-WBC(17,965 张、5 类、CC BY 4.0)无 IG 拆分,仅可作粒系旁证(§7.1)
③ 弱监督起点 以采集工作站(DM96)的预分类机制为启发,做弱监督/主动学习 贴合采集链故事(§9.1) 官方只发布了专家确认后的组级标签,逐张机器预分类分数未随包发布,不能直接拿来当软标签

三条路线不互斥:常见的组合是"② 定模型、① 定标签、③ 降标注量"。

O.3 评估协议建议

  1. 主指标用宏平均 F1 而非准确率:八组虽相对均衡(Shannon’s Equitability 0.96,MedMNIST+ 口径),但组内拆分后子类样本量差异会被放大(IG 2,895 拆三份后,最小子类可能只有数百张),准确率会被大类掩盖问题。
  2. 必报类对混淆矩阵:拆分研究的贡献就体现在组内类对上,只报总体指标等于没做(呼应 2.8 的五条难度轴)。
  3. split 与种子公开:本数据集无官方 split(§3.4),你的 64/24/12 式划分(§5.4.1 同款)必须连随机种子一起公开,否则结果不可复现。
  4. 与 96.2%/99.32% 这类组级基准不比较:任务不同(组级 8 类 vs 子类级 10 类),数字放同一张表就是制造新的讹误口径(附录 N 使用守则第 1 条同理)。

O.4 红线

  • 拆分成果表述为"本研究的标注/划分",不得表述为"数据集自带的子类标签"——坑 2(“13 类”)与坑 3(“12,869 子集”)都是第三方的自选口径被读者误当官方事实的先例(§10)。
  • 引用时保持双 DOI 口径(§4.3),并注明所用版本与拆分协议版本。

附录 P:教学与演示场景使用指南

§11.2 把"教学演示"列进适合谁,本附录把这句话展开成可执行的课表设计。教学场景对数据的要求与科研不同:构图干净、类别均衡、错误代价低——本数据集恰好三项全占。

P.1 为什么适合教学

教学需求 本数据集的对应供给
学生看图识类,需要"一图一细胞"的干净构图 单细胞居中裁剪,每图恰一个目标(术语表:单细胞图像)
出题需要类别覆盖均衡,避免某类永远缺席 8 组占比 7.10%-19.48%,Shannon’s Equitability 0.96(§2.1)
课程时间有限,需要"当天下载当天跑通" Mendeley 免费直链 + 目录即标签,ImageFolder 十行加载(§6.5、附录 J)
需要真实临床质感而非玩具数据 Advia 2120 → SP1000i → DM96 真实临床采集链(§2.4),染色与设备伪影都保留原样

P.2 出题设计:按混淆地图设难度梯度

直接拿 2.8 的五条类对难度轴当命题大纲:

  • 初级(组间、形态差异大):中性粒 vs 淋巴 vs 血小板——核形、胞浆、尺寸三个维度全线拉开,适合第一课建立"先看什么"的观察顺序。
  • 中级(同尺寸、不同谱系):大淋巴细胞 vs 单核细胞——都是大细胞,考"核染色质质地 + 胞浆颗粒"两个细节。
  • 高级(组内近邻):晚幼粒 vs 成熟中性粒、中幼粒 vs 早幼粒——考核质比与颗粒演化(术语表:核质比、核左移),适合形态学进阶课或检验技术专业的实习前热身。

出题引擎不需要写新代码:按目录分层抽样,再按上述类对过滤即可;速查背卡用附录 Q 的八组识别卡,每题配 2.7 对应小节做标准答案的讲解底稿。

P.3 演示工作流

课程演示的最短路径:附录 J 的加载骨架 + 任意预训练 CNN 微调三五个 epoch,课堂当场看到从随机猜测到 90%+ 的收敛过程——这个数据集规模(1.7 万张)恰好小到笔记本可跑、又大到曲线像样。若课堂机器算力紧张,改用 BloodMNIST 28×28 派生皮演示训练、再用原图做"高清回看"环节,两个数据集的分工见 §8.4。

P.4 教学红线

  1. 不得用于任何自我诊断或健康评估——本数据集是正常血象的科研图像,不是诊断工具,也不含个体临床信息(§3.3 匿名化口径)。
  2. 教学判读 ≠ 临床判读:学生练习给出的分类意见没有任何临床效力,课程说明里应显式写明。
  3. 署名义务照常:教学材料公开发布(课件、题库、开源课程仓库)同样触发 CC BY 4.0 的署名条款(§6.2),双 DOI 三件套(§4.3)一次写全。

附录 Q:八组识别速查卡(考场/出题两用)

把 §2.7 八份逐类档案浓缩成一张速查卡。三列形态描述均为 MGG 染色下的典型表现(§3.5);"最易混"列直接对应 2.8 的五条类对难度轴;"一秒口诀"只求课堂好记,不构成任何判读依据(附录 P 红线第 2 条)。

组(张数,占比) 核 胞浆与颗粒 MGG 主色调 最易混 一秒口诀
中性粒(3,329,19.48%) 分叶 2-5 叶,叶间有丝相连 量多,细中性颗粒,几乎不见粗颗粒 粉紫胞浆 + 紫红核 晚幼粒(分叶度) “分叶索丝”
嗜酸(3,117,18.24%) 多为双叶,眼镜状 粗大、均匀、满布 橙红/砖红颗粒夺目 几乎无强对手(颗粒独一无二) “眼镜 + 砖红”
IG(2,895,16.94%) 圆/肾形/凹陷,核质比高 嗜天青颗粒(紫红,粗于中性细颗粒) 深紫核 + 灰蓝/淡紫胞浆 单核、早幼粒 vs 单核(§2.8 中高难) “幼稚核 + 嗜天青”
血小板(2,348,13.74%) 无核 极小,紫红颗粒碎屑,常见聚集 紫红小点 染色杂质(低难,簇状时易误判) “无核小碎屑”
幼红(1,551,9.07%) 圆,深染致密,核质比极高 随成熟由深蓝转向灰蓝/粉(血红蛋白化) 深蓝核 + 蓝转粉胞浆 小淋巴(核质比与胞浆色) “墨点核 + 渐变浆”
单核(1,420,8.31%) 肾形/折叠,染色质疏松 量大,细尘样颗粒 灰蓝胞浆 + 灰紫核 大淋巴(染色质质地) “肾形折叠 + 尘浆”
嗜碱(1,218,7.13%) 常被颗粒遮盖难辨 粗大深紫黑颗粒,可遮核 深紫黑颗粒主导 被遮盖时难辨(低样本 + 难辨认双重,§2.7.7) “黑颗粒遮核”
淋巴(1,214,7.10%) 圆,深染,占满 少,薄环状 天蓝薄环 + 深紫核 幼红、单核(大淋巴时) “深核薄蓝环”

使用说明:

  1. 本卡是 §2.7 档案的检索替身——速查用本卡,讲透用 §2.7;两处的形态表述同源,出现分歧时以 §2.7 为准。
  2. “典型表现"不等于"每张都长这样”:染色批次、细胞状态都会造成偏移(§3.5.2 的"三固定"只能收窄不能消除),出题时优先抽典型样本,进阶讨论再上边界样本。
  3. 表内数字为官方 Table 1 硬数字(§2.1),与附录 E 速算表一致;引用时按 §4.3 双 DOI 口径。

尾注

本条目由千方病案医数集 AI-Ready Wikipedia 写手流水线生产。事实核验时点 2026-09-29:数据本体以 Data in Brief 官方 Table 1 与 PubMed 32346559 记录为最高权威源;许可与获取以 Mendeley 托管页(snkd93bnjr/1)直核为准;派生链以 MedMNIST+ 论文(arXiv 2404.15786)、clustpy 文档与第三方仓库三源互证;作者名与隶属以 PubMed 与 Recercat(UPC 机构库)双源为准。双口径冲突已按"以官方为准、第三方口径注明"原则处理并存照(附录 G);供血者人数、观察者间一致性、子类归属等官方未披露信息列为结构性缺口而非缺陷推测。若官方在未来发布修订(版本、一致性数据、子类标签),以官方新口径为准并触发附录 L 维护动作。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • nct-crc-he-100k — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • panda-plus — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • medmnist — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • bbbc — 共享标签:医学影像 / 病理图像 / 评测基准
  • pcam — 共享标签:病理图像 / 图像分类 / 评测基准
  • neptune — 共享标签:医学影像 / 病理图像 / 图像分类
  • biomedica — 共享标签:医学影像 / 图像分类 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集