NIH Malaria — 疟疾血涂片细胞图像 AI-Ready Wikipedia

2.7 万张薄血涂片单细胞图像 · 200 例患者 · 疟疾自动诊断奠基基准

来源 name: "U.S. National Library of Medicine, Lister Hill National Center for Biomedical Communications (LHNCBC)" url: "https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-datasheet.html"发布时间: 2026-09-16最后更新: 2026-09-25 阅读 42
NIH Malaria — 疟疾血涂片细胞图像 AI-Ready Wikipedia

信息速览

数据集名称NIH Malaria — 疟疾血涂片细胞图像 AI-Ready Wikipedia
数据类型["27,558 张细胞图像", "200 例患者", "337 MB", "PNG 单细胞裁剪", "免费开放获取"]
规模200 例患者(150 例恶性疟感染 + 50 例未感染)
接入方式name: "U.S. National Library of Medicine, Lister Hill National Center for Biomedical Communications (LHNCBC)" url: "https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-datasheet.html"
AI 就绪度

数据集封面

NIH Malaria — 疟疾血涂片细胞图像 AI-Ready Wikipedia


INFOBOX

数据集名称 NIH Malaria Cell Images Dataset(NLM Malaria Datasets)
英文全称 Segmented Cells from Thin Blood Smear Slide Images for Malaria (Malaria Screener)
别名/简称 NIH Malaria、NLM Malaria、Cell Images for Detecting Malaria、Malaria Cell Images Dataset、Lister Hill Malaria
疾病分类 疟疾(ICD-11:1F40 恶性疟 / 1F41 间日疟 / 1F42 三日疟 / 1F43 卵形疟 / 1F44 诺氏疟 / 1F45 未特指疟疾)
SNOMED CT 61462000 Malaria (disorder);病原体与检验概念详见 §2.1b
数据模态 光学显微镜二维彩色图像(薄血涂片单细胞裁剪,RGB 三通道)
AI 任务类型 二分类(parasitized vs uninfected)、迁移学习/特征提取、轻量 CNN 基准、染色标准化、域泛化、可解释性研究
样本总数 27,558 张单细胞图像(parasitized 13,779 + uninfected 13,779)
数据大小 337.08 MiB(下载包)/ 317.62 MiB(解压后图像)
数据格式 PNG(部分镜像仓库为 JPEG 转换版);附带 2 个患者 ID—细胞映射 CSV
许可证 NLM 开放获取公开数据;镜像站(和鲸等)标注为 CC0 公共领域共享;官方页未单列 license 字段
访问级别 开放(无需注册、无需申请,直接 HTTP/FTP 下载)
DUO 标签 GRU, NRES, PUB
语言 英文(文件名与标注);无文本语料
首发日期 2018-04-16(PeerJ 6:e4568 论文同期发布数据集)
最后更新 2018-04-16(细胞分类子集;NLM 后续增补厚涂片与 Vivax 薄涂片整视野数据集)
发布机构 美国国家医学图书馆(NLM)Lister Hill National Center for Biomedical Communications(LHNCBC)
官方主页 https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-datasheet.html
下载地址 https://data.lhncbc.nlm.nih.gov/public/Malaria/cell_images.zip
DOI 10.7717/peerj.4568(原始论文)
引用次数 657+(Google Scholar,截至 2026-09);Scopus 记录 342 次
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 图像即取即用、官方附代码与映射 CSV;扣分项:无官方划分、无患者分组列、尺寸极不统一、许可未单列
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、疟疾流行病学与临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(文件名字段解析、患者 ID 抽取规则、类别目录结构)、§5 数据划分策略(患者级 GroupKFold)、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与美国国家医学图书馆(NLM)、NIH、Lister Hill 国家生物医学通信中心均无任何商业利益关联。本页面不销售该数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 NLM 或 NIH 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始获取渠道的使用条款。该资源由美国国家医学图书馆以开放获取形式发布,属于其公开研究资源体系;镜像平台(Kaggle、和鲸、TensorFlow Datasets)可能附加各自的平台条款,转载时请同时核对。DUO 标签仅供参考,具体使用限制以官方发布页为准。

§1 数据集概览

§1.0 30 秒速览

这是什么? 想象一位检验技师坐在显微镜前,一张薄血涂片上密密麻麻铺着几百个红细胞,他需要逐一判断:这个细胞里有没有疟原虫?在疟疾流行区,一名熟练技师一天可能要这样看上几十张片子。NIH Malaria 数据集做的事情,就是把这项工作"数字化切块"——研究者把显微镜视野拍下来,用算法把每一个红细胞单独裁剪成一张小图,然后由专家逐张标注它到底感没感染。最终得到 27,558 张单细胞小图,其中 13,779 张感染、13,779 张未感染,来自孟加拉国 200 位患者的真实血涂片。

为什么重要? 它是疟疾 AI 诊断领域被引用最多的开放数据集,几乎所有疟疾细胞分类论文都会跑一遍它做对比。更重要的是,它是"患者级数据泄漏"这个问题最经典的教科书案例——官方 150 位感染患者的血片上同时存在感染细胞和看起来正常的细胞,所以这些患者同时向两个类别贡献了样本。如果你按图像随机划分训练集和测试集,同一个患者的细胞会同时出现在两侧,模型会"背答案"而不是"学规律"。数据集官方发布的患者 ID—细胞映射 CSV,恰恰就是为解决这个问题准备的。

我能用它做什么? 训练一个 parasitized vs uninfected 的二分类器,复现 Rajaraman 2018 的 ResNet-50 / VGG-16 基准;用它做迁移学习和轻量 CNN(MobileNet、EfficientNet)的对比实验;拿它当患者级 GroupKFold 的教学范例;或者研究染色标准化与跨站点域泛化。但要注意:这只是一个单细胞分类基准,不能用它做全片检测、寄生虫计数或真实患病率估计——那需要 NLM 另外发布的厚涂片与整视野数据集。

§1.1 摘要

NIH Malaria 数据集(NLM Malaria Datasets,社区通称 Malaria Cell Images Dataset)由美国国家医学图书馆(NLM)下属的 Lister Hill 国家生物医学通信中心(LHNCBC)通过 Malaria Screener 研究项目发布。该项目针对资源受限地区显微镜检查者不足、手工计数耗时的现实问题,开发了一套运行在普通 Android 智能手机上的移动应用,手机通过适配器附加在传统光学显微镜上,逐视野拍摄血涂片图像。

数据采集于孟加拉国吉大港医学院医院(Chittagong Medical College Hospital)。研究者制备了 150 例恶性疟原虫(Plasmodium falciparum)感染患者和 50 例未感染患者的 Giemsa 染色薄血涂片,用智能手机内置摄像头逐显微镜视野拍摄。所有图像由泰国曼谷 Mahidol-Oxford Tropical Medicine Research Unit(MORU)的专家镜检医师人工标注,去标识后在 NLM IRB#12972 批准下归档。随后研究者采用基于迭代投票与 level-set 的算法检测并分割单个红细胞,得到 27,558 张单细胞裁剪图,parasitized 与 uninfected 各 13,779 张,构成严格 1:1 平衡的二分类任务。

原始论文 Rajaraman 等(2018,PeerJ 6:e4568)将这批数据用于评估预训练卷积神经网络作为特征提取器的效果,在患者层级五折交叉验证下,ResNet-50 与 VGG-16 取得约 0.96 的准确率与 0.99 的 AUC,成为该数据集上被最广泛引用的基准。NLM 官方同时发布了患者 ID—细胞映射 CSV(parasitized 类 151 条、uninfected 类 201 条)和细胞分类代码包,使该数据集在提供简单基准的同时,也成为研究患者级数据泄漏与分组交叉验证的经典素材。

§1.2 战略价值

价值维度一:疟疾诊断 AI 的标准入门基准与人才训练场。 世界卫生组织 2023 年报告口径显示,2022 年全球约有 2.49 亿例疟疾病例。传统诊断依赖显微镜下人工阅片,准确性高度依赖技师经验且存在观察者间差异;在资源受限地区,专业镜检人员严重不足。该数据集以极低的获取门槛(直接下载、无需注册)提供规模适中、类别平衡、标注质量可控的细胞级基准,使从课程作业到顶级会议论文都能在同一把"尺子"上比较方法。其战略价值不在于规模最大,而在于首次把"智能手机 + 显微镜 + 深度学习"这条技术路线变成一个可复现的公开问题。

价值维度二:数据泄漏方法论的活体教材。 150 位感染患者的血涂片上既有含寄生虫的红细胞,也有不含寄生虫的红细胞。因此官方 uninfected 类 CSV 有 201 条患者 ID(151 位感染患者 + 50 位未感染患者),而 parasitized 类 CSV 有 151 条。这意味着任何按图像随机划分的训练/测试集,都必然把同一患者的细胞分散到两侧。原始论文作者对此非常清醒,明确采用患者层级五折交叉验证来规避偏倚;但当数据集以镜像形式传播后,这一关键设定在大量下游工作中被忽略,导致报告的准确率虚高。后续文献(如 2026 年 Frontiers in Medicine 的阈值优化研究)明确指出:公开分发版本缺少可靠的分组标识,“patient/slide independence not claimed”。

价值维度三:连接细胞级与全片级的桥梁。 NLM 围绕同一批玻片资源发布了完整谱系:分割后的单细胞图像(本数据集)、薄涂片整视野图像(193 例,含配子体、白细胞、碎片、染色沉淀、气泡等 12 类细粒度标注)、厚涂片数据集(Falciparum 150 例、Vivax 150 例、未感染 50 例)以及 Vivax 薄涂片数据集(171 例)。研究者可以在单细胞数据集上预训练分类器,再迁移到整视野检测任务(如 RBCNet、Cascading YOLO),形成从"细胞分类"到"全片筛查"的完整技术链路。

§1.3 同类数据集横向对比

数据集 发布机构 规模 模态 标注粒度 类别构成 差异化定位
NIH Malaria(本数据集) NLM / LHNCBC 27,558 张单细胞图 薄涂片单细胞 RGB 图像级二分类 parasitized / uninfected 严格 1:1 单细胞二分类入门基准;附患者 ID 映射;被引最多
NLM 薄涂片整视野数据集 NLM / LHNCBC 193 例患者整视野图 薄涂片全视野 12 类目标框标注 含配子体、白细胞、碎片、染色沉淀等细粒度类 可做检测与定位;粒度为视野而非细胞
NLM 厚涂片数据集(Falciparum) NLM / LHNCBC 150 例感染患者 厚涂片整视野(3024 × 4032) 寄生虫 / 白细胞标注 感染仅 厚涂片用于检出寄生虫存在与否;分辨率远高于单细胞集
NLM 厚涂片未感染集 NLM / LHNCBC 50 例未感染患者 厚涂片整视野 白细胞标注 未感染仅 与上述配对构成厚涂片二分类资源
NLM Vivax 薄涂片数据集 NLM / LHNCBC 171 例间日疟患者 薄涂片整视野(2988 × 5312) 寄生虫标注 感染仅,物种为 P. vivax 覆盖非恶性疟物种,用于跨物种泛化测试
BBBC041(Broad Institute) Broad Institute 约 1,364 张血涂片、约 8 万感染细胞 薄涂片视野 多物种多类别 P. falciparum / P. vivax 等 多物种、多类别;常与 NIH 集做跨数据集验证
Kaggle 镜像 “Cell Images for Detecting Malaria” 社区转载 27,558 张(同源) 同上 同上 同上 传播最广的获取入口;目录结构存在冗余副本
TensorFlow Datasets malaria Google / TFDS 27,558 张(同源) 同上 同上 同上 一行代码加载;仅提供单一 train split

表格说明:上表中多个条目(厚涂片、整视野、Vivax 等)与 NIH CXR、NIH TB 等同属 NIH 公开影像资源体系,均可在 NLM 官方数据页获取;不同数据集之间规模与标注粒度差异很大,性能数字不可直接横向比较。

§1.4 版本时间轴

时间 事件 说明
2015 年 玻片采集 孟加拉国吉大港医学院医院采集 Giemsa 染色薄血涂片;文件名中可见 20150619、20150918 等采集日期戳
2016 年 分割与标注归档 MORU 专家完成人工标注;level-set 算法完成细胞分割;去标识图像与标注在 NLM IRB#12972 下归档
2018-04-16 论文与数据集正式发布 Rajaraman et al. 发表 PeerJ 6:e4568,同期发布 27,558 张单细胞数据集与患者 ID 映射 CSV
2018-07 姊妹论文 Rajaraman et al. 发表 J Med Imaging 5(3):034501,可视化自定义 CNN 的学习行为,揭示模型依据染色伪影判断的风险
2019 集成方法论文 Rajaraman, Jaeger, Antani 发表 PeerJ 7:e6977,评估深度神经网络集成在该数据集上的表现
2020 Malaria Screener 应用论文 Yu et al. 发表 BMC Infect Dis 20(1):825,公开移动端筛查应用
2020-2021 谱系扩展 NLM 陆续发布厚涂片(Falciparum / Vivax / 未感染)与 Vivax 薄涂片整视野数据集
2021 RBCNet 论文与代码 Kassim et al. 发表 IEEE JBHI 25(5):1735-1746,官方开源红细胞检测代码
2020s 社区镜像扩散 Kaggle、TensorFlow Datasets、和鲸等平台广泛转载,成为被引用最多的疟疾细胞基准

§1.5 典型应用场景

场景 说明 常用模型
细胞级二分类教学与基准 数据量友好(337 MB、2.7 万张),单卡几十分钟一轮,适合课程大作业与迁移学习入门 VGG16/19、ResNet50、DenseNet121/201、InceptionV3、Xception、EfficientNet 系列、MobileNet 系列
移动端与边缘轻量化模型 采集硬件本身就是智能手机,在轻量架构上实验具天然落地意义;已有基于 Coral TPU 的现场筛查研究 MobileNet、EfficientNet-B0、ShuffleNet
患者级泄漏与分组交叉验证方法学 从文件名抽取 P 编号构造分组标签,对比图像级与患者级划分的性能落差,量化泄漏造成的乐观偏差 任意分类器 + StratifiedGroupKFold
染色标准化与域泛化 Giemsa 染色跨批次存在颜色漂移;验证归一化方法对泛化的提升,再在 BBBC041 等外部数据上测试迁移 Macenko / Reinhard / Vahadane + DANN / IRM
模型可解释性与伪影学习诊断 Rajaraman 等姊妹论文可视化 CNN 的权重、显著性与类激活图,发现模型可能依据染色伪影而非寄生虫形态判断 Grad-CAM、显著性图、类激活图
智能手机显微镜算法原型 在单细胞数据集上快速迭代分类模块,再迁移到整视野检测流程,配合官方 RBCNet 代码完成红细胞定位 任意骨干 + RBCNet

§2 医学背景

§2.1 ICD-11 编码映射

标签 ICD-11 编码 中文名称 临床说明
Malaria(总类) 1F40-1F45 疟疾 由疟原虫属(Plasmodium)引起的寄生虫病,经雌性按蚊叮咬传播
P. falciparum malaria 1F40 恶性疟 本数据集唯一涉及的物种;病死率最高,常见于撒哈拉以南非洲与东南亚
P. vivax malaria 1F41 间日疟 分布最广的疟原虫;可形成肝内休眠体导致复发;见于 NLM 的 Vivax 子集
P. malariae malaria 1F42 三日疟 病程较缓,可长期低水平寄生
P. ovale malaria 1F43 卵形疟 相对少见,主要见于西非
P. knowlesi malaria 1F44 诺氏疟 人兽共患,见于东南亚
Malaria, unspecified 1F45 未特指疟疾 未明确虫种时使用
Parasitaemia(实验室所见) MA15.0 相关 疟原虫血症 血涂片镜检发现疟原虫;本数据集阳性样本的定义依据

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语(SNOMED CT FSN)
Malaria(总类) 1F40-1F45 61462000 Malaria (disorder)
恶性疟 1F40 62676009 Plasmodium falciparum malaria (disorder)
间日疟 1F41 27052006 Plasmodium vivax malaria (disorder)
三日疟 1F42 27618009 Quartan malaria (disorder)
卵形疟 1F43 19341001 Plasmodium ovale malaria (disorder)
恶性疟原虫(病原体) — 30020004 Plasmodium falciparum (organism)
间日疟原虫(病原体) — 74746009 Plasmodium vivax (organism)
疟原虫属(病原体) — 34706006 Plasmodium (organism)
疟原虫镜检 相关检验 12845003 Malaria smear (procedure)
薄血涂片镜检 相关检验 121241001 Malaria thin smear (procedure)
厚血涂片镜检 相关检验 121240000 Malaria thick smear (procedure)
虫种鉴定 相关检验 122074006 Plasmodium species identification (procedure)
疟疾抗原检测 相关检验 407727009 Malaria antigen test (procedure)

映射说明:上表用于把数据集标签接入临床术语体系,便于与电子病历系统对接或做跨数据集标签对齐。SNOMED CT 码取自澳大利亚 CDC 实验室病例定义文件中的疟疾术语对照表与加拿大疫苗可预防疾病术语库,均为国际版概念的常用编码,具体国家版本可能有本地扩展,使用时请以最新版 SNOMED CT 国际版为准。数据集本身不携带任何术语映射,此表为编辑补充,且只标注 parasitized / uninfected 二分类,不包含虫种、发育阶段或原虫密度的细粒度信息。

§2.2 疾病简介与流行病学

疟疾是由疟原虫属(Plasmodium)寄生虫引起的、经雌性按蚊(Anopheles)叮咬传播的急性发热性寄生虫病。感染人体的主要虫种包括恶性疟原虫(P. falciparum)、间日疟原虫(P. vivax)、三日疟原虫(P. malariae)、卵形疟原虫(P. ovale)和诺氏疟原虫(P. knowlesi)。其中恶性疟原虫致病性最强,是重症疟疾与疟疾死亡的主要来源,也是本数据集唯一涉及的虫种。

寄生虫在人体内的生命周期分为肝内期(无症状潜伏)与红细胞内期。进入红细胞后,虫体经历环状体、滋养体、裂殖体等阶段,红细胞破裂时释放裂殖子并引发典型的发热、寒战、出汗、头痛、肌肉酸痛等症状。重症病例可出现意识障碍、惊厥、严重贫血、肾功能衰竭与急性呼吸窘迫,若不及时治疗可致命。P. vivax 与 P. ovale 还可在肝内形成休眠子(hypnozoite),导致数周至数月后复发。

从流行病学看,疟疾仍是全球主要公共卫生负担之一。世界卫生组织 2023 年报告口径显示,2022 年全球估计约有 2.49 亿例疟疾病例,绝大多数集中在撒哈拉以南非洲。标准确诊手段是显微镜下检查 Giemsa 染色血涂片:厚涂片用于检测寄生虫是否存在(敏感度高),薄涂片用于鉴定虫种(形态清晰)。世界卫生组织推荐流程要求在 100 倍放大下仔细检查,由经过培训的人员手工计数约 5,000 个红细胞中含寄生虫的比例以计算原虫密度。

核心痛点在于:准确性高度依赖技师经验,存在明显的观察者间差异;在资源受限地区合格镜检人员严重不足,大规模筛查难以保证质量。替代技术如聚合酶链反应(PCR)与快速诊断试纸(RDT)各有局限——前者对实验条件要求高,后者在流行区大规模使用成本效益不佳。这正是机器学习辅助诊断的价值切入点,也是本数据集诞生的临床动因。

§2.3 临床任务定义

任务层级 定义 本数据集是否支持 说明
筛查(Screening) 判断受检者是否感染疟疾 ❌ 不直接支持 数据集粒度为细胞而非患者;需自行聚合到患者层面
细胞级分类(Cell classification) 判断单个红细胞是否含疟原虫 ✅ 核心支持 数据集直接提供的任务:parasitized vs uninfected
全片检测(Detection) 在整视野中定位所有受感染红细胞 ❌ 不支持 单细胞裁剪已丢失空间上下文;需用 NLM 整视野数据集
虫种鉴定(Species ID) 区分 P. falciparum / vivax 等 ❌ 不支持 全部样本仅涉及 P. falciparum
分期(Staging) 区分环状体 / 滋养体 / 裂殖体 / 配子体 ❌ 不支持 本数据集无分期标注;整视野数据集含配子体类别
原虫密度量化(Parasitaemia) 计算含寄生虫红细胞比例 ❌ 不支持 需整视野与细胞计数的配套资源
治疗反应监测 追踪治疗后原虫密度变化 ❌ 不支持 数据集为单时点横断面图像

任务定义的实际含义:当论文声称"用 NIH Malaria 数据集实现疟疾诊断准确率 99%"时,严格来说它验证的是"细胞级二分类"性能,而非"患者级诊断"性能。把细胞级指标直接表述为临床诊断准确率是一个常见的过度解读。原始论文同时报告了两个层级的数字(细胞级 0.986 / 患者级 0.959),正是为了区分这两者。

§2.4 患者人群特征

维度 内容 备注
采集来源 孟加拉国吉大港医学院医院(Chittagong Medical College Hospital) 单一中心
采集时间 2015 年(从文件名日期戳推断,可见 20150619、20150918 等) 官方未公布统一起止日期
感染患者数 150 例 P. falciparum 感染患者 提供 parasitized 细胞,同时其正常细胞也进入 uninfected 类
未感染患者数 50 例未感染(健康)患者 仅提供 uninfected 细胞
合计采血对象 200 例 官方与论文口径一致
患者 ID 映射条目 parasitized CSV 151 条 / uninfected CSV 201 条 151 = 150 + 1 条特殊条目;201 = 151 + 50
特殊说明 患者 ID “C47P8thinOriginal” 的玻片由 Olympus 与 Motif 两台显微镜读取 引入设备异质性
年龄 官方未披露 —
性别 官方未披露 —
种族/族裔 官方未披露;地理上为孟加拉国人群 —
就医类型 官方未披露;推测为门诊/住院混合 无明示
共病 官方未披露 —
伦理批准 NLM IRB#12972 去标识后归档

重要提醒:该数据集未释放患者级人口学与临床变量(年龄、性别、合并感染、原虫密度、治疗方案等)。因此任何按人群分层的公平性分析在此数据集上都无法直接开展,只能做细胞形态学维度的分层(如细胞大小、染色强度)。

§2.5 临床价值

价值维度 说明
缩短阅片时间 细胞级分类器可对视野内红细胞做预筛,把"疑似含虫细胞"排序呈现给镜检人员,减少逐一目视扫描负担
缓解专业人员短缺 在合格镜检人员不足的地区作为初筛工具,把有限的专业人力集中到疑难或阳性复核上;Malaria Screener 应用即围绕此场景设计
标准化判读尺度 算法判读尺度固定,可减少不同技师、不同实验室之间的判读波动——前提是模型在本地数据上经过验证
技术进步的可复现基线 使不同研究组的方法可在同一批图像上直接比较,推动算法迭代

必须清醒认识的边界:该数据集是细胞级、单中心、单虫种、单染色流程的形态学基准,其 1:1 平衡类别比例与真实流行区患病率相去甚远。任何将其性能直接外推为"临床诊断准确率"的说法都不成立。真正的临床落地需要患者级数据集验证、多中心多染色方案的外部验证、按本地患病率重新校准的预测值与临床阈值,以及监管审批。

§2.6 金标准与标注协议

项目 内容 说明
划分方式 官方未提供训练/验证/测试划分 原始论文采用患者层级五折交叉验证
标注类型 图像级二分类标签(parasitized / uninfected) 通过目录名分类:Parasitized/ 与 Uninfected/
标签定义(阳性) 细胞图像中含疟原虫(P. falciparum) 阳性样本含寄生虫
标签定义(阴性) 细胞图像中不含疟原虫 但可能包含染色伪影、杂质等其他物体
标注者 Mahidol-Oxford Tropical Medicine Research Unit(曼谷)专家镜检医师 单人专家标注,官方未披露标注者数量
标注一致性 官方未披露(未报告 Cohen’s kappa 或一致性统计) 数据集未提供多标注者重复标注
分割方式 基于迭代投票与 level-set 的自动算法 分割质量直接影响标签与细胞边界的对应关系
去标识化 图像与标注在 NLM IRB#12972 下去标识归档 仅保留编码患者 ID
患者层面标识 官方提供 2 个 CSV 映射文件 需自行从文件名解析 P 编号
标签噪声 阳性样本定义为"含寄生虫",未区分虫期与虫载量 弱标注;单个红细胞中寄生虫数量与形态未量化
数据校验 官方提供 MD5 校验文件 见 NLM 官方发布页

金标准的局限:这是一个单专家标注、无重复标注、无一致性统计、无患者级标签的弱金标准。尤其值得注意的是标签的语义边界——"uninfected"仅表示该细胞中未发现寄生虫,并不意味着细胞形态正常,它可能是白细胞、碎片、染色沉淀或不完整的红细胞。这种"阴性类内混杂"是该数据集被反复指出的固有噪声。

§3 数据集规格

§3.0 版本抉择矩阵

该数据集经由多个渠道分发,内容同源但结构、附加文件与体积不同。选择哪一版取决于你的使用目标:

你的需求 推荐版本 大小 理由
复现论文基准、做患者级分组交叉验证 NLM 官方 cell_images.zip + 2 个 ID 映射 CSV 337.08 MiB 唯一同时提供图像与患者—细胞映射的官方来源,分组信息完整,可做 GroupKFold
快速原型、一行加载、不想管理文件 TensorFlow Datasets malaria 337.08 MiB(下载) tfds.load("malaria") 直接得到 (image, label) 字典;但只有单一 train split,无患者 ID,无法做患者级划分
需要 URL 可引用、社区示例多、教程丰富 Kaggle 镜像 “Cell Images for Detecting Malaria” 约 337 MB 下载链接稳定,Notebook 生态最丰富;注意目录中可能存在重复副本,需去重后再计数
需要原始整视野上下文、检测任务 NLM 薄涂片整视野数据集(193 例患者) 见官方发布页 只有整视野数据才保留空间信息与 12 类细粒度标注
需要非恶性疟虫种、跨物种泛化 NLM Vivax 薄涂片数据集(171 例) 见官方发布页 提供 P. vivax 样本,可用于测试模型对物种变化的鲁棒性
需要厚涂片场景(检出灵敏度更高) NLM 厚涂片数据集(Falciparum / Vivax / Uninfected) 3024 × 4032 单图,体积大 厚涂片是 WHO 推荐的高敏感度筛查手段,与薄涂片用途不同

核心结论:如果只做细胞分类且不在意患者分组,任何镜像都可以;如果要做严谨的患者级评估,必须使用 NLM 官方版本并配合两个 CSV 映射文件,因为镜像站通常不附带映射文件。

§3.1 模态详情

属性 内容
成像模态 明场光学显微镜二维彩色图像(brightfield light microscopy)
标本类型 外周血薄涂片(thin blood film)
染色方式 Giemsa 染色(使寄生虫染色质与细胞质呈现可辨识的色调差异)
成像设备 标准 Android 智能手机内置摄像头 + 传统光学显微镜适配器
色彩空间 RGB 三通道,8-bit/通道(uint8)
图像内容 单个红细胞(或红细胞居中的小视野)裁剪图
图像尺寸 高度不一致,最小 46 × 46 px,最大 385 × 395 px
背景 含血浆背景、邻近细胞边缘、染色沉淀等
空间上下文 已丢失(裁剪为单细胞);无法用于全片定位

模态的关键力学特征:由于是裁剪后的单细胞图,图像没有解剖学方位(红细胞呈游离圆盘,无固定朝向),因此旋转、翻转类增强在语义上是安全的,这也是后续研究普遍采用 ±14° 至 ±22° 随机旋转的原因。相反,任何改变染色色调的增强(如强饱和度抖动、色调偏移)在语义上是危险的,因为色调本身携带寄生虫判读线索,同时染色批次差异又是主要的域偏移来源——这个张力是本数据集增强策略设计的核心难点。

§3.2 按子集样本数

子集 图像数 占比 来源患者 文件路径
Parasitized(感染) 13,779 50.00% 151 条患者 ID 条目 cell_images/Parasitized/
Uninfected(未感染) 13,779 50.00% 201 条患者 ID 条目 cell_images/Uninfected/
合计 27,558 100.00% 200 位采血对象 —

患者 ID 条目数的解读:parasitized 类 CSV 含 151 条 patient-ID,uninfected 类 CSV 含 201 条。二者不是简单的 150 与 50,原因有二:(1)150 位感染患者的血片上,未感染红细胞同样存在,这些正常细胞被归入 uninfected 类,故 uninfected 条目 = 151 + 50 = 201;(2)官方说明中提到 parasitized patient-ID “C47P8thinOriginal” 的玻片图由两台显微镜(Olympus 与 Motif)读取,这是 151 与 150 之间存在差异的可能来源。使用者务必注意:parasitized 与 uninfected 两类共享同一批感染患者,这是本数据集最关键的泄漏风险来源。

§3.3 数据格式

文件/对象 格式 说明
cell_images.zip ZIP 归档 内含 cell_images/Parasitized/*.png 与 cell_images/Uninfected/*.png
细胞图像 PNG(无损) RGB 三通道;部分第三方镜像转为 JPEG 以减小体积
patientid_cellmapping_parasitized.csv CSV 患者 ID 与寄生细胞的映射
patientid_cellmapping_uninfected.csv CSV 患者 ID 与未感染细胞的映射
malaria_cell_classification_code.zip ZIP 官方细胞分类参考代码
校验文件 TXT 官方发布页提供 MD5 校验值
文档 readme 官方说明每份数据集附带 readme 与标注说明文件

命名规则(关键):单细胞文件名形如 C33P1thinF_IMG_20150619_114756a_cell_179.png。解析规则如下:

片段 含义 示例
C33 玻片/视野编码前缀 C33
P1 患者 ID(patient identifier) P1
thinF 薄涂片、Falciparum thinF
IMG_20150619_114756 采集时间戳 2015-06-19 11:47:56
a 同一时间戳下的序列后缀 a
cell_179 该视野内细胞序号 179

§3.4 存储大小与标注方式

度量 数值 来源
下载包大小 337.08 MiB TensorFlow Datasets 目录页
解压后数据集大小 317.62 MiB TensorFlow Datasets 目录页
和鲸社区镜像标注大小 337.1 MB 和鲸社区数据集页
第三方转载归档(含补充材料) 795.0 MB Zenodo 记录
单张图像平均体积 约 12 KB(317.62 MiB ÷ 27,558) 由上述数值推算

对工程的直接影响:整个数据集在内存中以 uint8 全量载入约为 317 MB 量级,但由于图像尺寸不统一,无法直接构成一个稠密张量。若统一缩放至 224 × 224 × 3,全量缓存约需 27,558 × 224 × 224 × 3 ≈ 4.1 GB(uint8),用 DataLoader 按需读取更实际。

标注环节 方式 责任方 说明
细胞分割 自动算法(迭代投票 + level-set) NLM 研究者 在整视野图上检测并分割单个红细胞
细胞级标签 人工标注 MORU 专家镜检医师 判断细胞内是否含疟原虫
标签载体 目录结构(文件夹名即标签) NLM Parasitized/ 与 Uninfected/
标签类型 图像级二分类(弱标注) — 无边界框、无像素级掩膜、无虫期与虫载量
患者映射 官方便携 CSV NLM 供研究者还原分组信息
去标识化 归档前完成 NLM IRB#12972 批准

标注方式的本质:这是一个人工图像级弱标注 + 自动分割的组合。分割的自动化意味着细胞边界的质量不由人工控制,可能出现包含邻近细胞、切割不完整、或细胞不居中的情况;而标签的人工性意味着阳性/阴性的判定依赖单个专家的判读标准。两者叠加,构成了数据集标签噪声的主要来源。

§3.6 标注者资质、设备与溯源链

维度 内容
标注机构 Mahidol-Oxford Tropical Medicine Research Unit(MORU),泰国曼谷
标注者身份与数量 专家镜检医师(expert slide reader);官方描述为单一位专家,未披露人数
标注者资质 MORU 为牛津大学与玛希隆大学共建的知名热带医学研究机构,具备专业疟疾镜检能力
标注一致性 官方未披露——未报告重复标注、Cohen’s kappa 或 Fleiss kappa,也无仲裁机制
复核流程 图像与标注在 NLM IRB#12972 下归档,隐含机构审查;但无技术层面的一致性统计
采集地点 孟加拉国吉大港(Chittagong, Bangladesh)吉大港医学院医院
采集时间 2015 年(文件名日期戳可见 20150619、20150918 等);季节设计官方未披露
标注与归档地点 标注于泰国曼谷;归档于美国 NLM(Bethesda, MD)
显微镜 传统光学显微镜;已知至少两台:Olympus 与 Motif(用于患者 ID “C47P8thinOriginal”)
成像设备 标准 Android 智能手机内置摄像头 + 显微镜适配器;型号与像素规格官方未披露
放大倍数与染色配方 官方未在数据页明示(薄涂片镜检常规为 100 倍油镜)
拍摄方式 逐显微镜视野拍摄,非全片扫描,因此不存在 WSI 金字塔结构

标注一致性的意义:医学影像数据集中标注一致性是判断标签质量的核心指标。本数据集缺乏该指标,意味着下游无法量化标签噪声上限。可行做法是把模型在验证集上的表现上限(约 0.99 细胞级)理解为"与单专家判断的一致度",而非"与真实病理的一致度";若要提升可信度,应引入本地多专家复核子集做校准。

设备信息的完整度:本数据集属部分披露——知道"智能手机 + 光学显微镜"这一组合,但缺具体型号、放大倍数、染色配方。这削弱了跨机构可复现性,也是不同论文预处理流程差异巨大(64 × 64、100 × 100、224 × 224 均有)的原因之一。由于全部图像来自同一家医院、同一套制片与染色流程、同一类装置,模型学到的特征里混入大量"站点指纹";文献中已有报告:在本数据集训练、于 Broad Institute BBBC041 上测试时 AUC 从约 99% 降至约 94.5%。

溯源环节 时间 执行方 产物
1. 临床采血与制片 2015 年 吉大港医学院医院 Giemsa 染色薄血涂片
2. 显微拍摄 2015 年 研究者(Malaria Screener 项目) 逐视野整视野图像(RGB)
3. 人工标注 2015-2016 年 MORU 专家镜检医师(曼谷) 图像级 parasitized / uninfected 判定
4. 细胞分割 2016 年前后 NLM 研究者 level-set / 迭代投票算法输出单细胞裁剪
5. 去标识与归档 归档前 NLM(IRB#12972) 去标识图像 + 标注文件
6. 数据集发布 2018-04-16 NLM LHNCBC cell_images.zip + 2 个映射 CSV + 代码包
7. 社区镜像扩散 2018 年至今 Kaggle / TFDS / 和鲸等 同源转载版本(结构略有差异)
8. 谱系扩展 2020-2021 NLM LHNCBC 厚涂片、Vivax 薄涂片、整视野数据集

溯源链可信度评估:属于中上水平——每个环节都有对应公开文献或官方页面,且提供官方代码与校验文件。欠缺之处在于细胞分割算法的参数与质量评估报告未作为数据集文档发布,且原始整视野图像与单细胞裁剪之间的对应关系未公开(文件名保留视野编码与细胞序号,理论上可回溯,但官方未提供映射表)。

§4 数据结构

§4.0 目录树

从官方 cell_images.zip 解压后的典型结构:

cell_images/
├── Parasitized/                      # 感染类:13,779 张 PNG
│   ├── C1P1thinF_IMG_20150619_113328a_cell_73.png
│   ├── C1P1thinF_IMG_20150619_113328a_cell_74.png
│   ├── C33P1thinF_IMG_20150619_114756a_cell_179.png
│   ├── C101P62ThinF_IMG_20150918_151006_cell_62.png
│   └── ...                           # 命名规则见 §3.3
└── Uninfected/                       # 未感染类:13,779 张 PNG
    ├── C1P1thinF_IMG_20150619_113328a_cell_12.png
    ├── C33P1thinF_IMG_20150619_114756a_cell_35.png
    ├── C101P62ThinF_IMG_20150918_151006_cell_63.png
    └── ...

# 官方额外发布的配套文件(通常需单独下载):
patientid_cellmapping_parasitized.csv     # 患者 ID ↔ 寄生细胞映射
patientid_cellmapping_uninfected.csv      # 患者 ID ↔ 未感染细胞映射
malaria_cell_classification_code.zip      # 官方细胞分类参考代码

Kaggle 与部分第三方镜像的目录常出现重复副本(例如同时存在 cell_images/cell_images/Parasitized 与 cell_images/Parasitized),遍历时若用递归 glob 会造成计数翻倍。务必用 os.walk 显式跳过嵌套的同名目录,或在计数前断言总数为 27,558。

§4.1 DAIMS 字段字典

本数据集没有关系表,其"字段"来自文件系统元数据 + 文件名解析 + 官方 CSV 联合派生。下表为面向建模的派生字段字典:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
filename String 单细胞图像文件名(主键) C33P1thinF_IMG_20150619_114756a_cell_179.png 数据装载与去重 无 无(必填) 唯一字符串
filepath String 相对/绝对路径 cell_images/Parasitized/...png 批量加载 镜像结构差异导致路径不同 无 —
label Categorical 图像级标签,由父目录名派生 Parasitized / Uninfected 监督信号(目标变量) 单专家标注,无一致性统计 无(二分类全覆盖)
patient_id String 从文件名 P<number> 正则抽取的患者编码 P1、P62 构造分组标签做 GroupKFold 仅编码,无人口学信息;151/201 条目口径不一 无(全部可解析) P1–P151 等
slide_code String 文件名首段视野/玻片编码 C33、C101 可作更细粒度的分组键 与 patient_id 的层级关系官方未明示 无 C<number>
smear_type Categorical thinF 表示薄涂片 + Falciparum thinF 过滤(本数据集应全为此值) 出现其他值说明混入其他子集 无 thinF(预期唯一)
acquisition_ts Datetime 文件名中的采集时间戳 2015-06-19 11:47:56 批次效应分析、染色漂移诊断 时间戳精度到秒 无 2015 年内
cell_index Integer 该视野内细胞序号 179 同视野细胞聚类、去重辅助 序号是否全局唯一官方未披露 无 非负整数
width / height Integer 图像宽高(像素) 46–385 / 46–395 尺寸分布分析、分桶采样 无 无 46–385 / 46–395
channels Integer 颜色通道数 3(RGB) 输入管道配置 无 无 3
dtype String 像素数据类型 uint8 归一化前检查 无 无 uint8
aspect_ratio Float width / height 0.97 长宽比异常检测 由宽高派生 无 约 0.9–1.1(多数接近 1)
file_size_bytes Integer 单图字节数 约 12,000 存储估算、损坏检测 无 无 约 3,000–30,000

字段字典的关键提示:label 是唯一的监督信号;patient_id 与 slide_code 是防泄漏的关键字段但需要自行派生——官方 CSV 提供了映射,但没有现成的"分组列"。这是本数据集在工程上最需要注意的一点。

§4.2 标签分布与关键统计

标签 数值 图像数 占比 阳性定义
Uninfected 0 13,779 50.00% 细胞中未发现疟原虫
Parasitized 1 13,779 50.00% 细胞中含疟原虫(P. falciparum)
合计 — 27,558 100.00% —
统计量 数值 说明
图像总数 / 类别数 27,558 / 2 官方与各文献一致;二分类
患者数(含未感染) 200 150 感染 + 50 未感染
患者 ID 条目(parasitized / uninfected CSV) 151 / 201 见 §3.2 解释;201 = 151 + 50
平均每患者细胞数(粗算) 约 138 张 27,558 ÷ 200;实际分布高度不均
平均每感染患者寄生细胞数 约 91 张 13,779 ÷ 151;分布未知且可能极不均
图像尺寸范围 46 × 46 至 385 × 395 px 相差约 8 倍线性尺度;上采样会引入插值伪影
采集年份 2015 由文件名日期戳推断

分布特征的临床含义与陷阱:(1)严格 1:1 平衡是人为的——真实流行区含虫红细胞比例通常远低于 1%,在 1:1 数据上训练的模型其先验与真实场景严重不符;(2)准确率在此数据集上不具临床可解释性——"全猜阳性"也能得 50% 准确率;(3)准确率与 F1 的解读须配合敏感性/特异性,一旦按真实患病率重新加权,PPV/NPV 会剧烈变化,部署前必须按本地患病率重算。

§4.4 数据层级

本数据集的组织层级为四层,从临床对象到单个样本:

层级 实体 本数据集中的载体 是否可直接获取
L1 患者(Patient) 200 位采血对象 文件名 P<number> + 官方 CSV ⚠️ 可派生,无独立患者表
L2 玻片/视野(Slide / Field of view) 每位患者的多个显微镜视野 文件名 C<number> 前缀 + 时间戳 ⚠️ 可派生
L3 细胞(Cell) 每个视野内分割出的单个红细胞 单个 PNG 文件 ✅ 直接获取
L4 像素(Pixel) 图像像素矩阵 PNG 内容 ✅ 直接获取
患者 P1 (200 位之一)
├── 视野 C1 (IMG_20150619_113328)
│   ├── cell_12  → Uninfected/  (未感染红细胞)
│   ├── cell_73  → Parasitized/ (含虫红细胞)
│   └── cell_74  → Parasitized/
├── 视野 C33 (IMG_20150619_114756)
│   ├── cell_35  → Uninfected/
│   └── cell_179 → Parasitized/
└── ...(更多视野)

⚠️ 关键结构事实:同一患者的细胞同时进入 Parasitized/ 与 Uninfected/ 两个目录。
   因此患者标签不是细胞标签的简单聚合——无法从细胞标签反推患者是否感染。

这一层级结构带来的三个直接后果:

  1. 无法从细胞标签推导患者标签。150 位感染患者同时贡献 parasitized 与 uninfected 细胞。若要构造患者级任务,必须依赖官方 parasitized CSV 中的 151 条患者 ID 作为"感染者集合"。
  2. 图像级划分必然泄漏。同一患者的细胞分散在目录中,随机划分会把同一患者分到两侧。
  3. 同视野细胞高度相关。同一视野下分割出的细胞共享光照、染色、对焦状态,属于强相关样本;即使做了患者级分组,同视野细胞仍可能在两侧造成"视野级泄漏"——更严格的划分应以 slide_code 或 acquisition_ts 为分组单位。

§4.5 缺失值与信息性缺失

本数据集没有结构化表格,因此传统意义上的"缺失值"体现为"官方未发布的字段"。

字段/信息 状态 缺失类型 对分析的影响 缓解方式
年龄 官方未披露 完全缺失(结构性) 无法做年龄分层分析 无(可考虑借用同地区公开流行病学数据做敏感性分析)
性别 官方未披露 完全缺失(结构性) 无法做性别公平性评估 无
患者级标签 需从 CSV 派生 可派生缺失 患者级任务需自行构造 用 patientid_cellmapping_parasitized.csv 的 151 条构建阳性患者集合
虫种 隐式存在(全为 P. falciparum) 未作为字段显式标注 无法筛选虫种 由文件名 thinF 后缀与官方说明确认为 falciparum
虫期(环状体/滋养体/配子体) 官方未标注 结构性缺失 无法做分期任务 改用 NLM 整视野数据集(含 Gametocyte 类)
虫载量(每细胞寄生虫数) 官方未标注 结构性缺失 无法做密度回归 无
原虫密度(患者级) 官方未披露 结构性缺失 无法评估严重程度分层 无
图像采集设备型号 部分披露 部分缺失 无法做设备效应校正 已知两台显微镜(Olympus / Motif),其余未披露
染色批次 可从时间戳近似推断 间接可得 染色漂移诊断需近似 用 acquisition_ts 作为批次代理变量
分割质量评分 官方未提供 结构性缺失 无法过滤分割失败样本 自行做尺寸/长宽比/边缘检测筛除异常样本

"信息性缺失"在本数据集中的特殊表现:本数据集的缺失基本是结构性缺失(missing by design),而不是随机缺失。官方出于去标识化与发布范围考虑,只发布了分割后的细胞图与最小必要的患者编码,主动舍弃了人口学与临床变量。这意味着缺失本身不携带患者层面的信息(不是 MNAR),但也无法通过插补来弥补——因为源数据未公开。

§5 划分与使用建议

§5.1 官方划分

官方未提供任何训练/验证/测试划分。 这一点必须在项目开始时明确:cell_images.zip 里只有两个类别目录,没有任何 split 文件、没有 fold 索引。TensorFlow Datasets 版本的 malaria 也只暴露一个 train split(27,558 例),其语义是"全部数据",而不是"官方训练集"。

原始论文的做法是患者层级五折交叉验证(patient-level five-fold cross-validation)。论文中给出的一版折分布如下:

折(Fold) Parasitized Uninfected 合计
1 2,756 2,757 5,513
2 2,758 2,758 5,516
3 2,776 2,762 5,538
4 2,832 2,760 5,592
5 2,657 2,742 5,399
合计 13,779 13,779 27,558

注意:该折分布出自姊妹论文(J Med Imaging 5(3):034501)的患者层级分组实验,用于说明"每个患者的所有细胞整体进入同一折"这一原则。由于患者分组的具体分配依赖于患者 ID 与细胞数的原始分布,直接照搬该表无法精确复现——你需要用官方 CSV 自行构造分组。

§5.2 社区惯例划分

由于官方无划分,社区做法高度分散,这本身就是该数据集使用中最需要注意的问题之一。

方案 比例 划分单位 是否防泄漏 出处类型
图像级随机/分层划分 80:20、60:10:30、70:15:15、90:10 等 单张图像 ❌ 泄漏 大量入门教程、课程作业与多篇论文(含 MDPI Applied Sciences 11(5):2284、2026 年 Frontiers in Medicine 阈值研究)
患者层级五折(GroupKFold) 5 折 患者 ID ✅ 防泄漏 原始论文与后续方法学论文
患者层级分层分组 + 内层调参 20 外折 / 3 内折 患者 ID ✅ 防泄漏 2026 年 EMFE 轻量框架(StratifiedGroupKFold,运行时断言守卫)
患者级持出(patient-level holdout) 160:40 例患者 患者 ID ✅ 防泄漏 同上,作为 20 折估计的补充

结论:图像级随机划分报告的性能普遍高于患者层级划分,差距通常为 1-3 个百分点,但这种提升是泄漏的产物而非真实泛化能力。

§5.3 划分策略建议与泄漏风险(重点)

泄漏的机制。 本数据集的泄漏不是偶然的工程疏忽,而是数据集结构本身内嵌的:150 位感染患者的血涂片同时贡献含寄生虫的红细胞(→ Parasitized/)与不含寄生虫的红细胞(→ Uninfected/),后者与前者来自同一张玻片、同一次染色、同一台设备、同一时刻,共享全部采集条件;另有 50 位未感染患者的细胞全部进入 Uninfected/。

因此,当你做图像级随机划分时:

  1. 同一患者的细胞会同时出现在训练集与测试集。模型可以记住这位患者的染色色调、光照模式、背景纹理,从而在测试集上"认出"这位患者,而不是学会识别寄生虫形态。
  2. 同一视野的细胞可能被拆散到两侧,泄漏程度更严重——同视野样本的相关性远高于同患者不同视野的样本。
  3. uninfected 类的 201 条患者 ID 中,有 151 条同时出现在 parasitized 类的患者集合里。这意味着你无法通过"按类别独立划分"来规避泄漏。

缓解方案(按严格程度递增):

方案 分组键 严格程度 实施要点
图像级随机划分 无 ❌ 不推荐 仅在教学演示"什么是泄漏"时使用
分层图像级划分 无 ❌ 不推荐 保持类别比例,但仍泄漏
患者级分组划分 patient_id ✅ 推荐 用 GroupShuffleSplit 或 StratifiedGroupKFold
视野级分组划分 slide_code ✅✅ 更严格 用文件名首段 C<number> 分组,避免同视野泄漏
采集批次分组划分 acquisition_ts 截断到天 ✅✅✅ 最严格 近似按采集批次分组,同时检验染色漂移鲁棒性

必须校验不变量。 无论采用哪种方案,训练完成后都应断言:

assert set(train_patients).isdisjoint(set(test_patients)), "患者级泄漏!"
assert total_images == 27558, f"图像计数异常: {total_images}"
assert parasitized_count == uninfected_count == 13779

后续文献的共识很明确:图像级划分下报告的 99%+ 准确率不能与患者级划分下的 0.96 准确率直接比较;做临床性声明时,必须使用患者级(理想情况是视野级或批次级)划分。

§5.4 交叉验证与外部验证建议

交叉验证项目 建议 理由
折数 5 折(对齐论文)或 20 折(估计更稳定) 5 折便于与基准比较;20 折减少折间方差
分组变量 patient_id(最低要求)或 slide_code(更严格) 数据集结构决定必须分组
分层 按类别分层(StratifiedGroupKFold) 保持每折类别比例接近 1:1
分组与分层冲突 优先保证分组完整,允许折间类别比例小幅波动 分组不可妥协,分层是优化项
随机种子 固定并在报告中披露 该数据集划分敏感,种子影响可达数个百分点
内层调参 在每折训练集内再做分组 CV 避免调参阶段引入泄漏
报告内容 每折指标 + 均值 ± 标准差 + 置信区间;导出折索引 CSV 单值报告掩盖方差;官方无折索引须自行构造并公开

折间方差的量级参考:原始论文中 Xception 在默认层特征下的折间准确率标准差达 ±0.107,远超其他模型(±0.007 至 ±0.026)。这说明某些架构对该数据集的划分方式极度敏感,单次划分的结论可能完全不可靠。

外部验证的最低要求:任何声称"可用于疟疾筛查"的模型,至少应在一份未参与训练的外部数据集上报告患者级敏感性、特异性与 AUC,并按目标人群患病率重算 PPV/NPV。仅在本数据集上报告图像级准确率不构成临床可用性证据。具体的外部验证矩阵见 §7.8。

§6 AI 就绪指南

§6.1 快速上手

以下代码假设你已从 NLM 官方下载并解压数据。目录结构预期:

<data_root>/
├── cell_images/
│   ├── Parasitized/            # 13,779 张 .png
│   └── Uninfected/             # 13,779 张 .png
├── patientid_cellmapping_parasitized.csv
└── patientid_cellmapping_uninfected.csv
  • data_root = cell_images/ 的父目录(即包含 cell_images 文件夹的那一层)
  • 路径拼接关系:data_root / "cell_images" / <class_folder> / <filename>
  • 若解压结果多了一层(如 cell_images/cell_images/Parasitized),需下移 data_root 或改用下方代码的自动探测逻辑

最小可用子集:先用每类 500 张(共 1,000 张)跑通全流程,确认解析、分组、训练、评估无误后再放全量,单次调试只需几秒。

# 目录结构预期:<data_root>/cell_images/{Parasitized,Uninfected}/*.png
#               <data_root>/patientid_cellmapping_{parasitized,uninfected}.csv
# 本脚本自动探测真实的 cell_images 根目录,避免镜像版多一层嵌套导致计数翻倍。

import re
from pathlib import Path
import pandas as pd

def find_data_dir(root: Path) -> Path:
    """定位真正包含 Parasitized/ 与 Uninfected/ 的那一层目录。"""
    candidates = [p for p in root.rglob("*") if p.is_dir()
                  and (p / "Parasitized").is_dir() and (p / "Uninfected").is_dir()]
    if not candidates:
        raise FileNotFoundError("未找到同时含 Parasitized/ 与 Uninfected/ 的目录")
    return sorted(candidates, key=lambda p: len(p.parts))[0]   # 选最浅的一层,避免嵌套副本

def parse_meta(filename: str) -> dict:
    """从文件名解析患者 ID、视野编码与采集时间戳。
    例: C33P1thinF_IMG_20150619_114756a_cell_179.png -> P1 / C33 / 2015-06-19 11:47:56"""
    m = re.match(r"^(?P<slide>C\d+)(?P<pid>P\d+)(?P<smear>\w+?)_IMG_"
                 r"(?P<ts>\d{8}_\d{6})(?P<suffix>[a-z]*)_cell_(?P<idx>\d+)", filename)
    if not m:
        return {"patient_id": None, "slide_code": None, "acquisition_ts": None, "cell_index": None}
    g = m.groupdict()
    return {"patient_id": g["pid"], "slide_code": g["slide"],
            "acquisition_ts": pd.to_datetime(g["ts"], format="%Y%m%d_%H%M%S", errors="coerce"),
            "cell_index": int(g["idx"])}

data_root = Path("/path/to/your/download")   # 改成你的实际路径
data_dir = find_data_dir(data_root)
rows = []
for label_name, label_id in [("Parasitized", 1), ("Uninfected", 0)]:
    for fp in sorted((data_dir / label_name).glob("*.png")):
        rows.append({"filepath": str(fp), "filename": fp.name,
                     "label": label_id, **parse_meta(fp.name)})

df = pd.DataFrame(rows)
print("图像总数:", len(df))                          # 期望 27558
print("类别分布:\n", df["label"].value_counts())     # 期望各 13779
assert len(df) == 27558, "计数异常:可能遍历到了嵌套副本目录"
assert df["label"].value_counts().nunique() == 1, "类别不平衡,文件缺失"

§6.2 数据获取

渠道 地址 体积 是否含患者映射 适用场景
NLM 官方(细胞图像) https://data.lhncbc.nlm.nih.gov/public/Malaria/cell_images.zip 337.08 MiB ❌ 首选;官方原始
NLM 官方(寄生类映射) https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_parasitized.csv 小 ✅ 151 条 患者级划分必备
NLM 官方(未感染类映射) https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_uninfected.csv 小 ✅ 201 条 患者级划分必备
NLM 官方(分类代码) https://data.lhncbc.nlm.nih.gov/public/Malaria/malaria_cell_classification_code.zip 小 — 参考实现
NLM 官方 RBC 检测代码 https://github.com/nlm-malaria/RBCNet — — 整视野红细胞检测
Kaggle 镜像 https://www.kaggle.com/iarunava/cell-images-for-detecting-malaria 约 337 MB ❌ 教程生态好;注意重复目录
TensorFlow Datasets https://www.tensorflow.org/datasets/catalog/malaria 337.08 MiB ❌ 一行加载;单 split

下载与校验(推荐流程):

# 全部为公开开放获取,无需注册、无需申请、无需签署协议
mkdir -p ./nih-malaria && cd ./nih-malaria
curl -O https://data.lhncbc.nlm.nih.gov/public/Malaria/cell_images.zip
curl -O https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_parasitized.csv
curl -O https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_uninfected.csv
ls -lh cell_images.zip                 # 预期约 337 MB
unzip -q cell_images.zip -d .
for d in cell_images/Parasitized cell_images/Uninfected; do
  echo "$d: $(find "$d" -name '*.png' | wc -l)"   # 各应 13779
done

获取注意事项:

  1. 官方下载走 data.lhncbc.nlm.nih.gov,属 NLM 公开数据域名,无频率限制说明,但建议批量下载时加延时并复用连接。
  2. 官方发布页同时提供 MD5 校验文件,强烈建议校验——大文件下载中断会得到损坏的 ZIP,而 unzip 可能只报部分错误。
  3. Kaggle 镜像需要登录 Kaggle 账号并使用 API token;TFDS 版本首次运行会自动下载,缓存位置由 TFDS_DATA_DIR 控制。
  4. 不要只下载 cell_images.zip——那样你将失去患者分组信息,只能在图像级划分下做实验,性能会被高估。

§6.3 预处理全流程与 PyTorch DataLoader

推荐顺序:探测真实目录 → 解析文件名 → 去重与异常筛查 → 构造患者分组 → 尺寸统一与归一化 → 按组划分 → 增强(仅训练集)。

预处理决策 推荐做法 原因
目标分辨率 224 × 224(与论文及主流骨干一致) 与 ImageNet 预训练权重匹配;保留细胞边界与寄生虫纹理
是否保留原生分辨率 至少做一次原生分辨率评估 最小样本仅 46 × 46,强上采样会插值出虚假纹理
归一化方式 除以 255 + ImageNet 均值方差标准化 使用预训练权重时必须匹配其标准化
染色归一化 作为消融实验项,不作为默认步骤 归一化会改变寄生虫色彩线索,效果需实证
灰度转换 不推荐 染色色调是重要判别线索,转灰度会损失信息
异常样本处理 先标记(尺寸 < 50 px 或长宽比异常),再做"含/不含"敏感性分析 直接删除会改变类别分布
数据泄漏检查 每次划分后断言组不相交 见 §5.3
import re
from pathlib import Path
import pandas as pd
from PIL import Image
from sklearn.model_selection import StratifiedGroupKFold
import torch
from torch.utils.data import Dataset, DataLoader
import torchvision.transforms as T

# ============ 1) 索引构建:解析患者 ID 与视野编码(分组的基础)============
NAME_RE = re.compile(r"^(?P<slide>C\d+)(?P<pid>P\d+)(?P<smear>\w+?)_IMG_"
                     r"(?P<ts>\d{8}_\d{6})(?P<suffix>[a-z]*)_cell_(?P<idx>\d+)")

def build_index(data_dir: Path) -> pd.DataFrame:
    rows = []
    for label_name, label_id in [("Parasitized", 1), ("Uninfected", 0)]:
        for fp in (data_dir / label_name).glob("*.png"):
            m = NAME_RE.match(fp.name)
            rows.append({"filepath": str(fp), "label": label_id,
                         "patient_id": m.group("pid") if m else None,
                         "slide_code": m.group("slide") if m else None})
    df = pd.DataFrame(rows).drop_duplicates(subset=["filepath"])
    df["group"] = df["patient_id"].fillna(df["slide_code"])   # 兜底:用视野分组
    assert len(df) == 27558, f"计数异常: {len(df)}(检查是否有嵌套副本目录)"
    return df

# ============ 2) 异常筛查(尺寸极小的样本多为分割失败)============
# df["width"], df["height"] = zip(*[Image.open(p).size for p in df["filepath"]])
# df["suspect_segmentation"] = (df["width"] < 50) | (df["height"] < 50)

# ============ 3) Dataset:训练/验证增强分离 ============
class MalariaCellDataset(Dataset):
    """单细胞图无解剖学朝向,故旋转/翻转语义安全;染色相关变换慎用(见 §6.6)。"""
    MEAN, STD = (0.485, 0.456, 0.406), (0.229, 0.224, 0.225)

    def __init__(self, df: pd.DataFrame, image_size: int = 224, train: bool = True):
        self.df, self.train = df.reset_index(drop=True), train
        if train:
            self.tf = T.Compose([
                T.Resize((image_size, image_size)),
                T.RandomRotation(degrees=15), T.RandomHorizontalFlip(),
                T.RandomVerticalFlip(),
                T.RandomAffine(degrees=0, translate=(0.06, 0.06), scale=(0.92, 1.08)),
                T.ColorJitter(brightness=0.05, contrast=0.05),  # 温和,过强会破坏染色线索
                T.ToTensor(), T.Normalize(self.MEAN, self.STD)])
        else:
            self.tf = T.Compose([T.Resize((image_size, image_size)), T.ToTensor(),
                                 T.Normalize(self.MEAN, self.STD)])

    def __len__(self):
        return len(self.df)

    def __getitem__(self, idx):
        row = self.df.iloc[idx]
        img = Image.open(row["filepath"]).convert("RGB")   # 强制三通道
        return self.tf(img), torch.tensor(row["label"], dtype=torch.float32)

# ============ 4) 患者级分层划分 + 泄漏断言 ============
index_df = build_index(Path("<data_root>/cell_images"))
sgkf = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
tr_idx, va_idx = next(iter(sgkf.split(index_df, index_df["label"],
                                     groups=index_df["group"])))
train_df, val_df = index_df.iloc[tr_idx], index_df.iloc[va_idx]
assert set(train_df["group"]).isdisjoint(set(val_df["group"])), "患者级泄漏!"
print(f"train {len(train_df)} / val {len(val_df)};阳性率 "
      f"{train_df['label'].mean():.4f} / {val_df['label'].mean():.4f}")

# ============ 5) DataLoader ============
train_loader = DataLoader(MalariaCellDataset(train_df, 224, True), batch_size=64,
                          shuffle=True, num_workers=8, pin_memory=True, drop_last=True)
val_loader = DataLoader(MalariaCellDataset(val_df, 224, False), batch_size=64,
                        shuffle=False, num_workers=8, pin_memory=True)
images, labels = next(iter(train_loader))   # 形状 [64, 3, 224, 224] / [64]

§6.5 坑点

⚠️ 坑点 1:患者级数据泄漏——同一患者的细胞被拆散到训练与测试两侧(分类:数据泄漏)

问题:150 位感染患者的血涂片同时贡献 parasitized 与 uninfected 细胞(官方 uninfected 映射含 201 条患者 ID = 151 + 50),因此任何图像级随机划分都会把同一患者分到两侧。模型可以靠识别患者的染色色调、光照与背景纹理"背答案",而非学习寄生虫形态。
症状:图像级划分下轻易得到 99%+ 准确率,换外部数据后骤降到 90% 上下;不同随机种子间结果波动大;注意力热图落在细胞外的背景与染色沉淀上。
解决:

  1. 简单方法:按文件名正则抽取 P<数字> 作为分组键,用 GroupShuffleSplit 或 StratifiedGroupKFold 划分,并断言 set(train_groups).isdisjoint(set(test_groups))。
  2. 进阶方法:把分组粒度提升到视野级(文件名首段 C<数字>)甚至采集批次级(时间戳截断到天),因为同视野细胞共享光照与对焦状态,相关性比同患者不同视野更高。
  3. SOTA 方法:采用嵌套分组交叉验证(外层 20 折做性能估计、内层 3 折做超参选择),并在每次划分时以运行时断言守卫泄漏;同时报告"图像级 vs 患者级"两套数字的差值作为泄漏量化指标——文献中该差值通常为 1-3 个百分点,论文自报细胞级 0.986 与患者级 0.959 的差距即属此类。
    参考:Rajaraman et al. 2018, PeerJ 6:e4568(明确采用 patient-level 五折);Frontiers in Medicine 2026 阈值研究(明确声明 “patient/slide independence not claimed”);arXiv EMFE(运行时泄漏断言守卫)。

⚠️ 坑点 2:Uninfected 类里混着非红细胞物体,模型学到的是"染色"不是"寄生虫"(分类:标签理解)

问题:官方明确定义阴性样本"不含疟原虫,但可能包含其他类型物体,包括染色伪影与杂质"。因此 uninfected 类实际上混杂了白细胞、细胞碎片、染色沉淀、气泡、不完整红细胞等。模型只需学会"这张图像颜色更均匀/更亮"就能分类。
症状:训练损失下降极快、验证准确率异常高(>99%),但模型对"含虫但染色较浅"的困难样本几乎全部漏检;Grad-CAM 热图集中在染色沉淀区域而非细胞内寄生虫结构;在按染色强度分层的子集上性能崩溃。
解决:

  1. 简单方法:肉眼抽查每类各 200 张样本,建立"困难样本清单";对阴性类做形态学筛查(圆度、面积、颜色方差),把明显非红细胞样本单独成组,做"含/不含"敏感性分析。
  2. 进阶方法:构造染色强度分层评估——按图像的平均饱和度/色调把测试集分成若干桶,分别报告每桶的敏感性;若性能随桶间变化剧烈,说明模型依赖染色特征。
  3. SOTA 方法:引入染色归一化(Macenko / Reinhard / Vahadane)作为消融项,或使用对抗式域泛化训练(DANN、IRM)迫使模型忽略染色风格;姊妹论文通过可视化权重、显著性与类激活图直接诊断该问题,值得作为方法论参考。
    参考:Rajaraman et al. 2018, J Med Imaging 5(3):034501(learned behavior 可视化研究);NLM 官方数据页对阴性类构成的说明。

⚠️ 坑点 3:图像尺寸从 46×46 到 385×395,直接 stack 会崩(分类:预处理陷阱)

问题:图像尺寸高度不一致(最小 46 × 46,最大 385 × 395 像素),无法直接构成稠密张量。若用 np.stack 或默认 collate 会抛维度错误;若统一 resize 到 224 × 224,46 × 46 的样本会被放大约 4.9 倍,插值产生大量虚假纹理。
症状:RuntimeError: stack expects each tensor to be equal size;或模型在极小样本上表现异常差(上采样后像模糊色块);数据集中"看似完全相同"的重复图像实际是同一视野的不同上采样结果。
解决:

  1. 简单方法:在 Dataset 的 __getitem__ 中逐张 Image.open(...).convert("RGB") 后 Resize((224, 224)),靠 DataLoader 默认 collate 自动堆叠;绝不要预先把所有图读进一个 numpy 数组。
  2. 进阶方法:按原图短边长度分桶(如 <80、80-160、>160 三桶),每桶内用相近的 resize 策略,并分桶报告指标,检验极小样本是否拖低整体性能。
  3. SOTA 方法:使用保持长宽比的 padding-then-resize(letterbox),配合尺寸感知的采样权重;或直接在原生分辨率上做多尺度训练(随机选择 96/128/224),使模型对大范围尺度变化鲁棒——本数据集近 8 倍的线性尺度差异远超常规增强范围。
    参考:Wireless Communications and Mobile Computing 2020 对分辨率范围的明确记载;Frontiers in Medicine 2026 对原生分辨率验证必要性的强调。

⚠️ 坑点 4:把细胞级 0.986 当成临床诊断准确率报告(分类:评估误用)

问题:原始论文报告了两个层级的数字——细胞层级准确率 0.986、患者层级准确率 0.959。下游大量工作只引用前者并表述为"疟疾诊断准确率"。细胞级正确率不等于患者级诊断正确率:筛查找出一个含虫细胞即可判定阳性,而细胞级指标把"大量正常细胞判对"也算作贡献。
症状:论文中写"我们的模型达到 98.6% 的疟疾诊断准确率";审稿人要求提供患者级指标时无法给出;模型在真实筛查场景中敏感性远低于宣称值。
解决:

  1. 简单方法:明确区分并同时报告细胞级与患者级指标;患者级用官方 parasitized CSV 的 151 条患者 ID 构造阳性患者集合,聚合规则可设为"任一细胞判阳则该患者判阳"(高敏感)或"阳性细胞比例超阈值判阳"。
  2. 进阶方法:报告完整的患者级敏感性、特异性、PPV、NPV、AUC、F1 与 MCC,并给出患者级置信区间(患者聚类 bootstrap);同时披露聚合阈值的选择依据。
  3. SOTA 方法:按目标人群本地患病率重新校准预测值(PPV/NPV 随患病率变化剧烈),并做决策曲线分析(DCA)或净收益分析论证临床阈值;论文自报的 NND(95% 置信下需检查 11 个红细胞才能得到 10 个阳性)可作为敏感性设计的参考锚点。
    参考:Rajaraman et al. 2018, PeerJ 6:e4568 Table 6(细胞级与患者级并列);Frontiers in Medicine 2026(明确警告平衡先验下的 PPV/NPV 不可直接外推)。

⚠️ 坑点 5:1:1 平衡类别导致的先验错配与患病率幻觉(分类:偏倚陷阱)

问题:数据集严格 1:1(13,779 : 13,779),而真实疟疾流行区中感染红细胞的比例通常远低于此。在平衡数据上训练的模型,其输出概率隐含"先验 50%"假设,直接用于低患病率场景会造成大量假阳性。
症状:模型在测试集上准确率 99%,但在真实筛查中阳性预测值极低(绝大多数报警为假阳);阈值 0.5 在临床上完全不适用;报告里出现"准确率与患病率无关"的错误论断。
解决:

  1. 简单方法:报告指标时显式说明类别比例是人为平衡的,并把准确率与灵敏度/特异性分开陈述;不要用准确率作为唯一主指标。
  2. 进阶方法:用先验校正公式把模型输出概率重映射到目标患病率 π:p_adj = (p·π) / (p·π + (1-p)·(1-π));再据此重算 PPV/NPV,并按临床可接受的敏感性下限选择新阈值。
  3. SOTA 方法:使用类先验校准方法(如 prior shift correction、温度缩放 + 先验偏移),并用 Brier 分数、可靠性图与 ECE 评估校准质量;文献中已出现针对本数据集的"敏感性感知阈值优化"研究,直接优化阈值使敏感性达到临床要求而非最大化准确率。
    参考:Frontiers in Medicine 2026(敏感性感知阈值优化与患病率重加权讨论);Rajaraman, Ganesan, Antani 2022, PLoS ONE 17(1):e0262838(类别不平衡下的模型校准)。

⚠️ 坑点 6:染色批次漂移被当成病理信号(分类:偏倚陷阱)

问题:全部图像来自同一家医院、同一套 Giemsa 染色流程,但不同采集批次的染色强度与色调仍有明显漂移(时间戳跨度覆盖 2015 年数月)。若模型把"染色偏深/偏紫"直接关联为"寄生态",则在新批次或新站点上会系统性偏差。
症状:按采集时间戳分组评估时性能波动明显;跨数据集测试(如换到 Broad Institute BBBC041)AUC 出现数个百分点下降;模型对同一细胞的不同染色版本给出矛盾预测。
解决:

  1. 简单方法:用文件名时间戳截断到天作为批次代理,做批次留出评估(leave-one-batch-out),观察性能下降幅度。
  2. 进阶方法:在训练集中施加温和的颜色抖动(brightness/contrast ±0.05)提高鲁棒性,但避免强饱和度/色调变换——后者会直接破坏寄生虫判读线索。
  3. SOTA 方法:采用染色归一化(Macenko / Reinhard / Vahadane)或染色解耦表示学习,把图像分解为"染色风格"与"生物结构"两部分,仅让分类头使用结构分量;配合域泛化目标(DANN、IRM、MixStyle)显式压制风格分量。注意归一化的参考模板必须仅从训练集估计,否则会引入新的泄漏。
    参考:Frontiers in Medicine 2026 对染色强度与色调变异的描述;Zhao et al. 跨数据集 AUC 由 99.40% 降至 94.5% 的记录(Sukumarran et al. 综述表 1)。

⚠️ 坑点 7:Kaggle 镜像的嵌套重复目录导致样本计数翻倍(分类:工程陷阱)

问题:部分 Kaggle 与第三方镜像解压后存在嵌套的 cell_images/cell_images/ 结构,若用递归 glob 遍历所有 *.png,同一批图像会被计数两次,得到约 55,116 条记录;若还用图像内容哈希去重,又会误删真实重复的合法样本。
症状:len(df) 约等于 27,558 的整数倍;类别分布仍保持 1:1(两类都被同样翻倍),因此不易通过类别比例发现;训练时验证集准确率高得反常(同一图像同时出现在训练与验证中)。
解决:

  1. 简单方法:遍历前定位唯一目标目录——找到同时含 Parasitized/ 与 Uninfected/ 且路径最浅的那一层;遍历后立即断言 len(df) == 27558 且每类各 13,779 张。
  2. 进阶方法:以 (filename, label) 而非绝对路径为唯一键去重;同时对每类分别断言数量,防止"一类翻倍、另一类不翻倍"的隐蔽情形。
  3. SOTA 方法:为数据集生成不可变的清单文件(manifest CSV,含路径、SHA-256、标签、患者 ID、折号),在 CI 中校验;后续实验都从清单加载而非现场遍历目录,从机制上杜绝计数漂移。
    参考:Kaggle “Cell Images for Detecting Malaria” 镜像页;NLM 官方数据页对数据集总量的声明。

⚠️ 坑点 8:无官方划分与折索引导致结果不可复现(分类:工程陷阱)

问题:官方未提供任何 train/val/test 划分或交叉验证折索引,也没有官方随机种子约定。不同论文使用的划分比例从 80:20 到 60:10:30 到 70:15:15 各不相同,划分单位从图像级到患者级各不相同,导致同一模型在不同论文中的报告值相差数个百分点,无法判断进步来自模型还是划分。
症状:复现某篇论文的数字时怎么调都对不上;同一架构换一个随机种子准确率跳动 1-3 个百分点;文献排行榜上不同方法的数字无法直接比较。
解决:

  1. 简单方法:固定并公开自己的划分方案与随机种子,把折索引保存成 CSV 一并发布,让后续工作可以精确复现你的划分。
  2. 进阶方法:同时报告"图像级划分"与"患者级划分"两套结果,并给出差值作为划分敏感性指标;报告每折指标与均值 ± 标准差而非单一数值,因为该数据集上不同折之间的标准差可达 ±0.007 至 ±0.107。
  3. SOTA 方法:采用重复分层分组交叉验证(如 5 折 × 5 次重复)并报告跨重复方差;使用基于患者聚类的 bootstrap 置信区间替代朴素图像级区间;方法间比较采用配对检验(如配对 Wilcoxon 符号秩检验)而非点估计对比,这是比较同一批折上两个模型的正确统计做法。
    参考:Rajaraman et al. 2018, PeerJ 6:e4568(患者层级五折与逐折分布表);arXiv EMFE(配对 Wilcoxon 与患者聚类 bootstrap 的实践);Frontiers in Medicine 2026(划分方案与随机种子披露规范)。

§6.6 数据增强与模型选型

增强操作 安全性 说明
随机旋转(±14° 至 ±22°) ✅ 安全 红细胞无解剖学朝向,旋转语义合理;文献常用范围
水平/垂直翻转、小幅平移(±8 至 ±12 px)、小幅缩放(0.88-1.12) ✅ 安全 模拟细胞在视野中的位置与大小差异
温和亮度/对比度抖动(±0.05) ✅ 相对安全 有助于染色鲁棒性;建议控制在温和范围
MixUp / CutMix、测试时增强(TTA) ⚠️ 需验证 可作为消融项,但需与验证集严格隔离并实证
强饱和度/色调偏移、灰度化 ❌ 危险 直接改变寄生虫判读的染色线索,丢失 Giemsa 颜色对比信息
弹性形变 / 强透视 ❌ 危险 红细胞形态是判读依据,形变会改变细胞边界与内部结构
人工插入寄生虫纹理、类别条件生成(GAN 合成) ❌ 禁止 相当于伪造标签,可能引入无法量化的偏倚

增强强度的经验范围:文献中两种配置可作安全起点——方法 A 旋转 ±14°、平移 ±8 px、缩放 0.92-1.08;方法 B 旋转 ±22°、平移 ±12 px、缩放 0.88-1.12,两者均用水平与垂直翻转。

绝对不要做的事:把增强应用到验证/测试集(TTA 除外且需单独论证),或用增强样本填充患者级划分的缺口——增强不能解决泄漏。

场景 推荐架构 输入尺寸 理由
复现论文基准 ResNet-50 或 VGG-16(特征提取器模式) 224 × 224 论文中患者层级表现最佳(VGG-16 最优层 0.959 / AUC 0.991;ResNet-50 0.957 / 0.990)
追求最高敏感性 DenseNet-121 224 × 224 最优层下敏感性 0.960 ± 0.009,为论文中最高
边缘/移动端部署 MobileNetV3 / EfficientNet-B0 96-224 × 224 参数少、推理快,适合智能手机与低功耗设备
注意:EfficientNet 系列 EfficientNet-B1 至 B7 224-600 × 224 第三方报告性能波动大(B1 在部分实验中仅 0.5975 准确率),需谨慎调参
快速基线 小型自定义 CNN(3-5 层卷积) 96-128 × 128 训练快、易调试;自建 CNN 在 96 × 96 输入下可达 97-98% 验证准确率
最强集成 多骨干集成 + 集成投票 224 × 224 文献中集成模型可提升特异性,但成本与部署复杂度显著上升

选型建议:要发表可比较的结果,用 ResNet-50 配合论文的特征提取方案;要落地到手机,优先 MobileNetV3 或 EfficientNet-B0 并验证 INT8 量化后的性能保持;只做快速验证流程,小型自定义 CNN 即可(97.7% 对 SOTA 的 98.6% 并不远)。

一个反直觉现象:在本数据集上 ImageNet 预训练并非总是带来提升。论文中预训练特征提取(0.959)仅略优于精心设计的自定义 CNN(0.927),某些第三方实验中 EfficientNet 系列甚至明显低于 MobileNet。原因是数据规模适中、任务相对简单,且图像域与 ImageNet 差异极大,大规模预训练的迁移收益被削弱。

§6.8 硬件需求

配置档位 硬件 训练时间估算 适用场景
最低 CPU(16 核)+ 16 GB RAM 数小时/轮(224 × 224,全量) 调试流程、小样本(每类 500 张)实验
入门 GPU 单卡 8 GB 显存(如 T4、GTX 1080 Ti) 约 1-3 分钟/轮(224 × 224,batch 64) 论文原始实验即在此量级硬件上完成(GTX 1080 Ti 11 GB)
主流 GPU 单卡 16-24 GB 显存(如 V100、RTX 4090) 约 30-60 秒/轮 全量训练、多骨干对比实验
多卡 2-4 卡 线性加速但收益递减 大规模超参搜索、集成模型训练
边缘推理 手机 CPU / Coral TPU / Jetson 单张推理数十至数百毫秒 现场部署(文献已有 Coral TPU 方案)

显存估算参考:batch size 64、224 × 224 × 3、ResNet-50 骨干冻结时显存占用约 2-3 GB;全网络微调时约 6-8 GB。推理阶段 batch 256 也仅需约 2 GB。数据本体仅 317.62 MiB,存储需求可忽略。

§6.9 评估指标

import numpy as np, torch, pandas as pd
from sklearn.metrics import (roc_auc_score, average_precision_score, confusion_matrix,
                             brier_score_loss, balanced_accuracy_score, matthews_corrcoef, f1_score)

@torch.no_grad()
def predict(model, loader, device="cuda"):
    model.eval(); probs, labels = [], []
    for x, y in loader:
        x = x.to(device, non_blocking=True)
        probs.append(torch.sigmoid(model(x).squeeze(-1)).float().cpu().numpy())
        labels.append(y.numpy())
    return np.concatenate(probs), np.concatenate(labels)

def full_metrics(y_true, y_prob, thr=0.5):
    """二分类完整指标。注意:Parasitized(感染)定义为阳性类。"""
    y_pred = (y_prob >= thr).astype(int)
    tn, fp, fn, tp = confusion_matrix(y_true, y_pred, labels=[0, 1]).ravel()
    return {
        "accuracy": (tp + tn) / (tp + tn + fp + fn),
        "balanced_accuracy": balanced_accuracy_score(y_true, y_pred),
        "sensitivity": tp / (tp + fn),          # 敏感性/召回率
        "specificity": tn / (tn + fp),          # 特异性
        "precision_ppv": tp / (tp + fp),        # 精确率 = PPV
        "npv": tn / (tn + fn),
        "f1": f1_score(y_true, y_pred),
        "mcc": matthews_corrcoef(y_true, y_pred),
        "roc_auc": roc_auc_score(y_true, y_prob),
        "pr_auc": average_precision_score(y_true, y_prob),
        "brier": brier_score_loss(y_true, y_prob),
        "n": len(y_true),
    }

def patient_level_aggregate(df_val, y_prob, thr=0.5):
    """细胞级聚合到患者级:任一细胞判阳则该患者判阳(高敏感规则)。
    注意:仅对'已知感染者集合'有意义,因为未感染患者也贡献了未感染细胞。"""
    d = pd.DataFrame({"group": df_val["group"].values, "prob": y_prob})
    agg = d.groupby("group")["prob"].agg(n_cells="size", n_pos=lambda s: int((s >= thr).sum()))
    agg["pred_any"] = (agg["n_pos"] > 0).astype(int)
    agg["pred_rate"] = (agg["n_pos"] / agg["n_cells"] >= 0.05).astype(int)
    return agg

指标使用规范:

指标 是否必报 说明
敏感性(Sensitivity) ✅ 必报 阳性类为 Parasitized;临床筛查中这是首要指标
特异性(Specificity) ✅ 必报 与敏感性配对,二者需同时报告并给出阈值
ROC-AUC ✅ 必报 与阈值无关的排序能力;便于与文献对比
PR-AUC / MCC ✅ 建议 类别平衡时 PR-AUC 基线为 0.5;MCC 对不平衡稳健
准确率(Accuracy) ⚠️ 谨慎 在 1:1 数据上可用,但不可外推为临床准确率(见坑点 4、5)
Brier 分数 ✅ 建议 评估概率校准质量;临床阈值决策依赖校准
患者级指标 ✅ 必报(若做临床声明) 细胞级指标不能替代患者级指标

§6.10 MLOps 与工程笔记

主题 建议 理由
数据版本化 生成 manifest(路径 + SHA-256 + 标签 + 患者 ID + 折号)并对清单做版本控制 目录结构不稳定,清单是唯一可信来源(见坑点 7)
划分持久化 把折索引导出为 CSV 并随模型一起发布 无官方划分,不公开折索引就无法复现(见坑点 8)
泄漏守卫 把患者/视野不相交断言放进训练脚本入口,而非人工检查 泄漏是本数据集最致命问题(见坑点 1)
预处理固化 图像解码、resize、归一化参数版本化并写入配置 不同 resize 策略对结果影响显著
校准监控 每次上线前产出可靠性图与 Brier 分数 概率校准直接决定阈值决策质量
染色漂移监控 线上统计输入图像的平均饱和度/色调分布,与训练集分布做漂移检验 染色是主要域偏移来源(见坑点 6)
设备分组记录 若部署到多台设备,记录每张图的采集设备型号并分组评估 数据集内已知存在两台显微镜(Olympus / Motif)
推理性能 若面向手机部署,测量 INT8 量化后的准确率下降幅度 轻量化必然带来精度损失,需量化权衡
数据完整性 训练前校验总数(27,558)与类别计数(各 13,779) 一次断言可避免整轮实验作废
结果记录 同时记录细胞级与患者级指标、随机种子、折索引哈希 便于审稿与复现

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解方式
单中心采集偏倚 全部图像来自孟加拉国吉大港医学院医院一家机构 高 在外部多中心数据上验证;跨数据集测试(如 BBBC041、NLM Vivax 集)
单虫种偏倚 仅含 P. falciparum,不含 P. vivax / malariae / ovale / knowlesi 高 补充多虫种数据;明确声明适用范围限于恶性疟
采集批次/染色漂移偏倚 不同采集批次的 Giemsa 染色强度与色调存在差异 中高 批次留出评估;染色归一化;域泛化训练
类别先验偏倚 人为 1:1 平衡,与真实流行区患病率严重不符 高 先验校正;按本地患病率重算 PPV/NPV
阴性类内容异质偏倚 uninfected 类混杂白细胞、碎片、染色沉淀、气泡等非红细胞物体 中高 形态学筛查分层;报告分层指标
设备异质偏倚 至少两台显微镜(Olympus / Motif)参与采集,型号与放大倍数未完整披露 中 若可识别设备来源则分组评估
标注者单源偏倚 单专家标注,无一致性统计、无仲裁机制 中 引入本地多专家复核子集做校准
分割质量偏倚 自动 level-set 分割,边缘质量不均,最小样本仅 46 × 46 中 尺寸/长宽比筛查;原生分辨率评估
人口学信息缺失偏倚 无年龄、性别、共病等变量,无法做公平性分层 中 声明局限;结合同地区流行病学数据做敏感性分析
患者细胞数不均衡偏倚 各患者贡献细胞数分布未披露,可能高度不均 中 划分前统计分布;患者级 bootstrap 置信区间
检出灵敏度偏倚 薄涂片对低原虫密度的敏感性低于厚涂片 中 明确适用范围;厚涂片场景需另用对应数据集
维度 评估 说明
标注者专业性 ✅ 高 MORU 专家镜检医师,机构具备国际公认的热带医学检验能力
标注流程规范性 ⚠️ 部分披露 有人工标注与 NLM IRB 审查,但未公开标注 SOP
标注一致性 ❌ 未披露 无重复标注、无 Cohen’s kappa / Fleiss kappa
标签粒度 ⚠️ 粗 仅图像级二分类;无虫种、虫期、虫载量、边界框
标签语义清晰度 ⚠️ 有边界模糊 “uninfected” 仅指未发现寄生虫,不代表细胞形态正常
分割质量 ⚠️ 无评估报告 自动算法输出,无分割精度指标发布
阴性类纯度 ❌ 已知不纯 官方明示阴性类可能含染色伪影与杂质
患者级标签 ⚠️ 需派生 依赖官方 CSV 与文件名解析
可审计性 ✅ 中上 有官方 CSV、代码、MD5 校验文件,链路可追溯

总体判断:标注质量的专业性有保障,但可量化性不足。对于单细胞二分类这个相对简单的任务,标注质量足以支撑基准测试;但对于任何需要精确判读的应用(如原虫密度估计、虫期判别),该数据集不构成可用金标准。

§7.2 标注质量

维度 评估 说明
标注者专业性 ✅ 高 MORU 专家镜检医师,机构具备国际公认的热带医学检验能力
标注流程规范性 ⚠️ 部分披露 有人工标注与 NLM IRB 审查,但未公开标注 SOP
标注一致性 ❌ 未披露 无重复标注、无 Cohen’s kappa / Fleiss kappa
标签粒度 ⚠️ 粗 仅图像级二分类;无虫种、虫期、虫载量、边界框
标签语义清晰度 ⚠️ 有边界模糊 “uninfected” 仅指未发现寄生虫,不代表细胞形态正常
分割质量 ⚠️ 无评估报告 自动算法输出,无分割精度指标发布
阴性类纯度 ❌ 已知不纯 官方明示阴性类可能含染色伪影与杂质
患者级标签 ⚠️ 需派生 依赖官方 CSV 与文件名解析
可审计性 ✅ 中上 有官方 CSV、代码、MD5 校验文件,链路可追溯

总体判断:标注质量的专业性有保障,但可量化性不足。对于单细胞二分类这个相对简单的任务,标注质量足以支撑基准测试;但对于任何需要精确判读的应用(如原虫密度估计、虫期判别),该数据集不构成可用金标准。

§7.3 泛化性评估

场景 失效风险 证据
更换地理区域(如非洲高流行区) 高 数据集来自孟加拉国单中心;不同区域的寄生虫株、人群免疫状态、染色习惯均不同;文献建议患者与站点分组的外部验证
更换虫种(如 P. vivax) 高 数据集仅含 P. falciparum;P. vivax 形态学(如变形红细胞、阿米巴样滋养体)差异明显
更换染色批次或配方 中高 文献明确指出 stain intensity 与 colour tone 的变异是主要挑战
更换成像设备(不同手机/显微镜) 中高 设备型号未完整披露;手机摄像头响应差异会改变色彩分布
更换涂片类型(薄→厚) 高 厚涂片红细胞重叠、形态不完整,与单细胞裁剪的视觉特征完全不同
从细胞级迁移到全片检测 高 单细胞裁剪丢失空间上下文;端到端检测需重新训练
真实临床场景(低患病率人群) 高 1:1 先验与真实患病率不匹配,PPV 会大幅下降;文献明确要求按本地患病率重算预测值
原生分辨率的极低质量样本 中 最小样本 46 × 46,上采样会引入插值伪影,文献强调原生分辨率验证的必要性
跨数据集(BBBC041) 中高 文献报告 AUC 由约 99.40% 降至约 94.5%,已在 §7.8 列出
同一分布内的随机划分 低 但这也是最容易被泄漏高估的场景(见 §5.3)

泛化性总结:这是一个高度内分布友好、外分布脆弱的基准。它在自身分布内的表现已接近饱和(细胞级 0.98+),但在任何分布变化下都会明显退化。研究者若只报告内分布指标,会系统性高估模型的真实价值。

§7.4 伦理与合规

维度 内容
伦理批准 NLM Institutional Review Board 批准,编号 IRB#12972
去标识化 归档前完成;仅发布分割后的细胞裁剪图,不含人脸、姓名、出生日期
患者标识 文件名中保留编码患者 ID(如 P1、P62),未发布指向个体的密钥
地理披露粒度 披露到国家与城市(孟加拉国吉大港),符合常见公开数据集惯例
患者知情同意 官方页面未单独说明同意形式;依赖机构 IRB 审查框架
数据主权 样本来自孟加拉国,由美国 NLM 归档并公开;跨机构合作研究应关注该议题
双用途风险 低——细胞形态学数据不具备生物安全或武器化风险
商业使用 官方未单列许可条款;镜像站标注为 CC0,商业使用前建议核实原始条款
公平性考量 数据集不含人口学变量,无法评估模型在不同亚群间的公平性;这是明确局限

面向使用者的合规提示:将该数据集训练的模型部署到临床场景时,除技术验证外还需满足目标司法管辖区的医疗器械监管要求(如美国 FDA、欧盟 MDR、中国 NMPA)。公开数据集上的高性能不构成监管合规证据。

§7.5 公平性、亚群分析与漂移监测

数据集不含年龄、性别、共病、虫种、原虫密度等分层变量,常规亚群公平性分析无法直接开展。可行的代理维度如下:

可分析的代理维度 方法 能揭示的问题
细胞尺寸分层 按面积分桶(小/中/大),分别报告敏感性 模型是否对小型细胞(早期感染或分割不完整)表现更差
染色强度分层 按平均饱和度/亮度分桶 模型是否依赖染色深浅而非形态
采集批次分层 按时间戳截断到天分组 染色漂移是否造成批次间性能差异
采集设备分层 若可识别 Olympus / Motif 来源则分组 设备差异是否影响判读一致性
患者分层 按患者统计敏感性 是否存在少数患者的细胞被系统性误判
视野分层 按 slide_code 统计 是否存在个别视野整体判读失败

建议做法:即使缺少人口学变量,也应至少报告上述代理维度的分层结果,以暴露"模型在特定子群上系统性失败"的风险。

漂移来源 监测指标 建议动作
染色批次漂移 输入图像平均饱和度、Lab 空间 a/b 通道均值分布 与训练集分布做 KS 检验;显著漂移时触发重新归一化或重训
成像设备漂移 图像分辨率分布、锐度(拉普拉斯方差)分布 新设备上线时做分组评估
细胞尺寸漂移 细胞面积分布 中位数偏移超过 20% 时告警
分割质量漂移 分割掩膜圆度、边缘梯度统计 圆度分布下移说明分割质量退化
患病率漂移 线上预测阳性率 与预期患病率偏离过大时检查模型与阈值
预测分布漂移 输出概率直方图、平均预测熵 熵显著上升说明遇到更多不确定样本
性能漂移 有人工复核金标准时的滚动敏感性/特异性 敏感性下降超过 5 个百分点时触发复审

落地建议:本数据集所有图像共享一次采集的"站点指纹",部署后的实际输入几乎必然是分布外的。因此漂移监测不是可选项而是部署前提——上线前就应建立基线分布与告警机制。

§7.7 DAIMS 数据质量评估(24 项)

# 检查项 状态 说明
1 宽格式(Wide format) ✅ 图像 + 标签天然为宽格式;派生表格为一图一行,无需宽长转换
2 唯一标识(Unique identifier) ⚠️ 文件名在官方版本内唯一;但第三方镜像存在嵌套副本,需按 (filename, label) 去重
3 特殊字符处理 ✅ 文件名为 ASCII 字母数字与下划线,无中文、无空格、无编码问题
4 重复行检测 ⚠️ 官方版本无重复;镜像版本可能出现目录级重复,需显式去重与计数断言
5 缺失值编码 ✅ 二分类标签全覆盖,无缺失标签;缺失仅存在于未发布字段中
6 标签标识(Label semantics) ⚠️ 标签由目录名承载,语义清晰但阴性类内含异质物体,标签边界模糊
7 罕见类分组 ✅ 二分类且严格平衡,不存在罕见类问题
8 偏倚评估 ⚠️ 单中心、单虫种、单设备族、1:1 人造先验;官方未提供偏倚说明文档
9 数据字典 ❌ 官方未提供机器可读的数据字典;字段语义需从文件名与官方文字说明推导
10 信息性缺失解释 ⚠️ 缺失为结构性(按发布范围设计),官方未单独解释缺失机制
11 设备记录 ⚠️ 仅披露"智能手机 + 光学显微镜",型号、放大倍数、染色配方未完整记录
12 共线性检查 ⚠️ 同患者/同视野/同批次的样本高度相关(这正是泄漏根源),需分组处理
13 编码映射 ❌ 官方未提供 ICD-11 / SNOMED CT 等术语映射;本词条 §2.1/§2.1b 为编辑补充
14 时间戳处理 ⚠️ 采集时间戳嵌在文件名中,需正则解析;官方未提供结构化时间字段
15 划分建议 ❌ 官方未提供任何划分建议或折索引;社区方案高度分散
16 泄漏讨论 ⚠️ 原始论文明确采用患者层级五折;但官方数据页未单独警示医学图像层面的泄漏风险
17 标签分布 ✅ 严格 1:1(13,779 : 13,779),分布明确且官方文档有载
18 测量偏倚 ⚠️ 自研智能手机显微镜装置,无与传统显微镜的对照测量一致性研究
19 外部验证建议 ⚠️ 官方未提供外部验证指南;本词条 §5.4/§7.8 给出建议
20 版本记录 ⚠️ 数据集本身无版本号;NLM 后续扩展了厚涂片与 Vivax 子集,但细胞集未见版本迭代
21 预处理脚本 ✅ 官方提供 malaria_cell_classification_code.zip 与 RBCNet 代码仓库
22 合规要求 ✅ 公开开放获取,IRB#12972 批准,去标识化完成;官方未单列 license 文件
23 多模态对齐 ❌ 纯图像数据集,无配对的文本、组学或其他模态数据
24 去标识化 ✅ 仅发布单细胞裁剪图与编码患者 ID,移除全部直接标识符

DAIMS 评分:13.5 / 24

评分解读:得分处于中等偏上水平(满分 24,得分率约 56%)。强项是标签分布(严格平衡)、去标识化(彻底且有 IRB 记录)、预处理脚本(官方代码完整)、特殊字符与合规(干净且开放获取);中项是唯一标识、重复检测、缺失编码、偏倚评估、设备记录、时间戳、泄漏讨论——这些项目"能做但未做全",属官方文档深度不足而非数据本身有缺陷;明确失分项是数据字典(无机器可读说明)、编码映射(无术语映射)、划分建议(完全缺失)、多模态对齐(不适用但计入分母)、版本记录(无版本号体系)。图像本身即取即用,失分几乎全部集中在元数据与文档治理层面——这正是 2018 年前后公开数据集的时代特征。

对你意味着什么:

  1. 官方元数据不能开箱即用:自行编写索引脚本(见 §6.1/§6.3),从文件名解析患者 ID、视野编码与时间戳并固化为 manifest CSV;一次投入,后续实验长期受益。
  2. 划分策略必须自己定并承担风险:官方既无划分也无建议,你的方案直接决定报告数字的量级。优先采用患者级或视野级分组划分并导出折索引(见 §5.3、坑点 8)。
  3. 把设备与染色信息当"部分已知"处理:用时间戳作批次代理做批次留出评估,量化染色漂移影响(见坑点 6)。
  4. 标签语义写进数据卡:明确声明"uninfected = 未发现寄生虫,不代表细胞形态正常",并说明阴性类内的异质成分——这是审稿中越来越常被追问的点。
  5. 外部验证是必要条件而非加分项:若目标涉及临床声明,至少在外部数据集上报告患者级指标,并按本地患病率重算 PPV/NPV。既然官方缺数据字典与术语映射,你整理出的 manifest 与标签映射(如 §2.1/§2.1b)本身即可作为对社区的补充贡献。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
Broad Institute BBBC041 Broad Institute malaria 细胞二分类(跨虫种跨站点) VGG-16:准确率 96.53%、敏感性 95.0%、特异性 98.07%、AUC 99.40%、F1 96.48%、MCC 93.30%;跨数据集 AUC 94.5% AUC 由 99.40% → 94.5%,下降约 4.9 个百分点 跨数据集迁移出现显著性能退化,主要归因于虫种(P. vivax)与染色流程差异
NLM Vivax 薄涂片数据集(171 例) NLM / LHNCBC 跨站点、跨虫种泛化 官方未披露对照实验数值 未披露 该数据集与细胞集同源但采集于曼谷、虫种为 P. vivax,是理想的同源跨域测试资源
NLM 薄涂片整视野数据集(193 例) NLM / LHNCBC 由细胞分类器嵌入全片检测流程 官方未披露端到端对照数值 未披露 从图像级分类迁移到目标检测属不同任务,需重新训练检测头与分割流程
Coral TPU 现场筛查场景 第三方研究(Electronics 期刊 2025) 现场薄涂片 P. falciparum 筛查 该研究未报告与 NIH 细胞集内部指标的严格对照 未披露 展示边缘设备部署可行性,但现场部署的性能不能用细胞集内部指标替代
真实临床低患病率人群 无公开对照 筛查阳性预测值 无公开患者级外部验证数值 理论预期:PPV 大幅下降 1:1 先验与真实患病率不匹配,必须在目标人群重算 PPV/NPV 后方可部署

矩阵说明:上表仅收录有同行评审支撑的结果。本数据集缺乏严格意义上的患者级外部验证文献——现有跨数据集结果主要是细胞分类层面的 AUC 下降,且多为单一外部数据集(BBBC041)。这是其作为临床可用性证据的最大短板。

§8 基准性能与生态

§8.1 性能排行榜

下表汇总文献中报告的该数据集性能。重要提示:这些数值来自不同论文,划分方案、预处理流程、输入分辨率、评估层级(细胞级/患者级)各不相同,因此不可直接横向比较。

排名 模型 性能 年份 完整引用
1 Customized CNN(Umer et al.) 准确率 99.96% / 精确率 100% / 召回率 99.93%(划分方案未披露) 2020s Sukumarran et al., 2024 综述收录, Zenodo. DOI 10.5281/zenodo.16415619
2 Xception(Sriporn et al.) 准确率 99.28% / F1 99.28%(7,000 张子集) 2020s 同上
3 本模型(Rajaraman et al.,细胞层级) 准确率 0.986 / 敏感性 0.981 / 特异性 0.992 / AUC 0.999 2018 Rajaraman et al. 2018, PeerJ 6:e4568
4 集成模型(Ragb et al.) 敏感性 97.94% / 特异性 97.78%(13 种骨干集成) 2020s 同上
5 DenseNet201(Cinar et al.) 准确率 97.83%(多骨干对比) 2020s 同上
6 定制 CNN(自建复现) 验证准确率 98.08%(96 × 96 输入) 2019 sachaMorin. malaria-detection. GitHub
7 Proposed(Mujahid et al.) 准确率 97.24% / F1 97.24% / AUC 98.72%(10 折) 2024 Mujahid M, et al. 2024. Scientific Reports 14:13249. DOI 10.1038/s41598-024-63831-0
8 EfficientNetB3(IEEE CENIM 2024) 准确率 97.09%(七种 CNN 对比) 2024 Oktovianus L, et al. 2024. CENIM. DOI 10.1109/CENIM64038.2024.10882645
9 本模型(Rajaraman et al.,患者层级) 准确率 0.959 / 敏感性 0.947 / 特异性 0.972 / AUC 0.991 2018 Rajaraman et al. 2018, PeerJ 6:e4568
10 VGG-16(最优层 block5_conv2) 准确率 0.959 ± 0.009 / AUC 0.991 ± 0.004 2018 同上
11 ResNet-50(最优层 res5c_branch2c) 准确率 0.959 ± 0.008 / AUC 0.991 ± 0.005 / 特异性 0.972 ± 0.010 2018 同上
12 DenseNet-121(最优层 Conv5_16_x2) 敏感性 0.960 ± 0.009(论文最高敏感性) 2018 同上
13 ResNet-50(默认层特征) 准确率 0.957 ± 0.007 / AUC 0.990 ± 0.004 2018 同上
14 EfficientNet 方案(Mujahid et al.,80:20) 准确率 97.57% 2024 Mujahid M, et al. 2024. Scientific Reports 14:13249. DOI 10.1038/s41598-024-63831-0
15 VGG16(细调,80:20) 准确率 0.9492 / F1 0.9500 2024 同上
16 CNN(ResNet 定制) 准确率 0.9521 / F1 0.9512 2023 Dewi et al., 2023. MDPI Applied Sciences 11(5):2284 相关
17 MobileNet(细调,80:20) 准确率 0.9521 / F1 0.9517 2024 Mujahid M, et al. 2024. Scientific Reports 14:13249
18 Xception(默认层,Rajaraman) 准确率 0.890 ± 0.107(折间方差最大) 2018 Rajaraman et al. 2018, PeerJ 6:e4568
19 EfficientNet-B1(细调,80:20) 准确率 0.5975 / F1 0.5591(迁移学习失败案例) 2024 Mujahid M, et al. 2024. Scientific Reports 14:13249
20 传统方法基线(Das et al.) 准确率 0.840 / 敏感性 0.981 / 特异性 0.689 2013 Das DK, et al. 2013. Micron 45:97-106. DOI 10.1016/j.micron.2012.11.002

为什么这些数字不可直接比较:1)评估层级不同——第 3 行是细胞层级(0.986),第 9 行是患者层级(0.959),同一篇论文、同一批模型的两个数字差距达 2.7 个百分点;2)划分方案不同——第 1-8 行多数未披露是否做了患者分组,第 9-13 行采用患者层级五折;3)输入分辨率不同——100 × 100、224 × 224、96 × 96、64 × 64 均有出现;4)子集不同——第 2 行使用 7,000 张子集,其余多用全量 27,558 张;5)训练配置不同——轮数从 5 到 536 不等,优化器与学习率策略各异;6)多数第三方结果未公开代码与折索引,无法复现验证。

§8.2 SOTA 总结与选型建议

性能天花板的位置。 在该数据集上,患者层级交叉验证的准确率天花板约为 0.96,对应原始论文的 ResNet-50 / VGG-16(0.959)。细胞层级可以逼近 0.99,但那是另一种评估口径。大量第三方论文报告的 99%+ 准确率,绝大多数是在图像级划分(含泄漏)或子集上取得的,不应与患者层级基准混谈。

架构选择的三条实用结论:

  1. 中等规模的经典骨干最稳。ResNet-50 与 VGG-16 在论文中并列最优,且折间方差小(±0.007 至 ±0.009)。它们是最可靠的基线与论文比较锚点。
  2. 追求敏感性时优先 DenseNet-121。论文中 DenseNet-121 的最优层特征取得最高敏感性(0.960 ± 0.009),在筛查场景中比准确率更有价值。
  3. 大规模预训练不是万能解。EfficientNet-B1 在部分实验中准确率骤降至 0.5975,而 Xception 在默认层特征下折间标准差高达 ±0.107。这说明本数据集的任务特性(小尺寸、染色主导、域与 ImageNet 差异大)对某些架构不友好,必须实测而非假定预训练模型一定更好。

工程上的取舍:数据量小(27,558 张、317 MB),训练成本极低,因此做多次重复的完整交叉验证比追求更大模型更有价值。建议至少跑 5 折 × 3 次重复并报告跨重复方差。

§8.3 评测协议

要在该数据集上做可信的评测,建议遵循以下协议:

步骤 要求
1. 数据完整性 断言总数 27,558、每类 13,779;去重后再次断言
2. 分组构造 从文件名解析 P<number> 作为患者分组键;无法解析时退化为 C<number> 视野键
3. 划分 患者级 StratifiedGroupKFold,5 折(便于对齐论文)或 20 折(更稳定)
4. 泄漏校验 每折训练/验证组不相交的运行时断言
5. 折索引公开 导出折索引 CSV 并随论文/代码发布
6. 预处理声明 明确披露目标分辨率、归一化方式、是否做染色归一化
7. 增强声明 明确披露增强类型、强度范围、仅应用于训练集
8. 指标报告 每折 + 均值 ± 标准差;必报敏感性、特异性、ROC-AUC;建议报 MCC、Brier
9. 层级报告 同时报告细胞级与患者级指标,并说明聚合规则
10. 阈值与校准 明确阈值选择依据;报告可靠性图与 Brier 分数(若做临床阈值声明)
11. 外部验证 至少在 BBBC041 或 NLM Vivax 集上报告一次跨数据集结果
12. 复现材料 发布随机种子、折索引、数据清单哈希、训练配置

最低提交标准(用于论文发表):患者级分组划分 + 每折指标 + 折索引公开 + 细胞级与患者级指标并列。缺少任何一项,报告的数字都无法被可靠复现或与其他工作比较。

数据集 机构 规模 与本文数据集的关系
NLM 薄涂片整视野数据集 NLM / LHNCBC 193 例患者(148 感染 + 45 未感染) 同源上游数据;含 12 类细粒度标注,可做检测与定位
NLM 厚涂片 Falciparum 集 NLM / LHNCBC 150 例感染患者,3024 × 4032 同源扩展;厚涂片用于高敏感度检出
NLM 厚涂片 Vivax 集 NLM / LHNCBC 150 例感染患者,3024 × 4032 同源扩展;补充间日疟虫种
NLM 厚涂片未感染集 NLM / LHNCBC 50 例未感染患者 与厚涂片感染集配对
NLM Vivax 薄涂片数据集 NLM / LHNCBC 171 例感染患者,2988 × 5312 同源扩展;跨虫种跨站点验证资源
BBBC041 Broad Institute 约 1,364 张血涂片、约 8 万感染细胞 独立来源;多虫种多类别,常用于跨数据集验证
NIH CXR(ChestX-ray14) NIH 约 11.2 万张胸片 同属 NIH 公开影像资源体系,模态与任务不同
NIH TB(Montgomery / Shenzhen) NIH / NLM 数百至上千张胸片 同属 NIH 公开影像资源体系;同为传染病影像 AI 基准
Kaggle 镜像 社区 同源 27,558 张 传播渠道,非独立数据集

生态定位:本数据集与 NIH CXR、NIH TB 等同属 NIH 公开影像资源体系,共同构成了公共卫生领域最具影响力的开放影像基准群。相比胸片类数据集,它的优势是规模适中、类别平衡、获取门槛低;劣势是缺乏患者级临床变量与多中心多样性。

§8.5 关键论文

  1. Rajaraman S, et al. (2018). Pre-trained convolutional neural networks as feature extractors toward improved malaria parasite detection in thin blood smear images. PeerJ 6:e4568. DOI 10.7717/peerj.4568 — 本数据集的原始论文与唯一权威基准。提出用预训练 CNN 作为特征提取器,系统评估 AlexNet、VGG-16、ResNet-50、Xception、DenseNet-121 与自定义 CNN 在患者层级五折交叉验证下的表现,确定各模型最优特征层,并同时报告细胞级与患者级指标。

  2. Rajaraman S, et al. (2018). Understanding the learned behavior of customized convolutional neural networks toward malaria parasite detection in thin blood smear images. J Med Imaging 5(3):034501. DOI 10.1117/1.JMI.5.3.034501 — 姊妹论文。通过可视化权重、显著性与类激活图,揭示 CNN 判读疟疾时实际关注哪些区域,警示模型可能依赖染色伪影而非寄生虫形态,是本数据集可解释性研究的奠基工作。

  3. Rajaraman S, Jaeger S, Antani SK. (2019). Performance evaluation of deep neural ensembles toward malaria parasite detection in thin-blood smear images. PeerJ 7:e6977. DOI 10.7717/peerj.6977 — 评估深度神经网络集成在该数据集上的表现,论证集成方法在提升泛化性与稳定性方面的作用。

  4. Yu H, et al. (2020). Malaria Screener: a smartphone application for automated malaria screening. BMC Infect Dis 20(1):825. DOI 10.1186/s12879-020-05453-1 — 公开 Malaria Screener 移动应用的设计与实现,是本数据集采集动机与落地场景的直接来源。

  5. Kassim YM, et al. (2021). Clustering-Based Dual Deep Learning Architecture for Detecting Red Blood Cells in Malaria Diagnostic Smears. IEEE JBHI 25(5):1735-1746. DOI 10.1109/JBHI.2020.3034594 — 提出 RBCNet 红细胞检测架构,官方开源代码,是从细胞级分类走向全片检测的关键技术。

  6. Yang F, et al. (2020). Deep Learning for Smartphone-Based Malaria Parasite Detection in Thick Blood Smears. IEEE JBHI 24(5):1427-1438. DOI 10.1109/JBHI.2019.2939121 — 面向厚涂片的手机端疟疾检测,展示同一技术路线在厚涂片场景的应用。

  7. Yang F, et al. (2020). Cascading YOLO: Automated Malaria Parasite Detection for Plasmodium Vivax in Thin Blood Smears. Proc. SPIE 11314, 113141Q. DOI 10.1117/12.2549701 — 面向 P. vivax 的级联 YOLO 检测,扩展虫种覆盖范围。

  8. Mujahid M, et al. (2024). Efficient deep learning-based approach for malaria detection using red blood cell smears. Scientific Reports 14:13249. DOI 10.1038/s41598-024-63831-0 — 系统对比多种细调骨干(含 DenseNet、VGG、ResNet、EfficientNet、MobileNet),并给出十折交叉验证结果,是较新的大规模对比研究。

  9. Rajaraman S, Ganesan P, Antani S. (2022). Deep learning model calibration for improving performance in class-imbalanced medical image classification tasks. PLoS ONE 17(1):e0262838. DOI 10.1371/journal.pone.0262838 — 针对类别不平衡场景的模型校准研究,直接对应本数据集 1:1 先验与真实患病率错配的问题。

  10. Sukumarran D, et al. (2024). Table 1 in An optimised YOLOv4 deep learning model for efficient malarial cell detection in thin blood smear images. Zenodo. DOI 10.5281/zenodo.16415619 — 系统汇总近年自动疟疾诊断的深度学习方案与性能数字,是构建本词条排行榜的重要二手来源。

§8.6 社区活跃度

维度 状况 说明
论文引用量 高 原始论文 Google Scholar 引用 657+(截至 2026-09);Scopus 记录 342 次
官方代码维护 低 NLM 官方仓库与作者仓库均为 2018-2021 年间上传,此后基本无更新
社区复现仓库 中高 GitHub 上存在大量学生与研究者复现项目,质量参差
Kaggle Notebook 生态 高 镜像数据集页面附带大量公开 Notebook,是入门首选入口
论文产出持续性 高 每年仍有新论文使用该数据集作为基准或对比项
方法学讨论深度 上升中 近年出现专门讨论患者级泄漏、患者分组交叉验证、阈值优化的方法学论文
框架集成 有 TensorFlow Datasets 官方收录;PyTorch 生态需自行实现 Dataset
数据更新频率 无 细胞分类子集自 2018 年发布后未再更新
社区争议点 集中于划分与泄漏 大量高分论文因图像级划分受到方法学质疑

活跃度评价:这是一个"数据冻结但使用活跃"的基准。数据体量小、内容固定,官方不再维护;但其入门基准的地位使论文产出持续不断。社区的主要增量贡献集中在方法学批评与划分规范上,而非数据本身的扩展。

§8.7 生态快照

资源 类型 链接 规模(截至 2026-09)
NLM Malaria 数据页 官方门户 https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-datasheet.html 唯一权威入口,含数据、映射 CSV 与官方代码链接
NLM 数据集下载页 官方文档 https://www.lhncbc.nlm.nih.gov/LHC-downloads/dataset.html 含患者 ID 编码规则与各子集描述
NLM Malaria 项目页 官方文档 https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-project.html 项目背景与 Malaria Screener 应用介绍
cell_images.zip 官方数据 https://data.lhncbc.nlm.nih.gov/public/Malaria/cell_images.zip 337.08 MiB,首选下载源,无注册门槛
患者 ID 映射(parasitized) 官方元数据 https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_parasitized.csv 151 条,患者级划分必需
患者 ID 映射(uninfected) 官方元数据 https://data.lhncbc.nlm.nih.gov/public/Malaria/patientid_cellmapping_uninfected.csv 201 条,揭示"感染患者贡献阴性细胞"结构
官方细胞分类代码包 官方代码 https://data.lhncbc.nlm.nih.gov/public/Malaria/malaria_cell_classification_code.zip 论文配套实现,含特征提取流程
RBCNet 官方代码 https://github.com/nlm-malaria/RBCNet 红细胞检测参考实现,通向全片检测
作者 Jupyter 复现仓库 官方作者代码 https://github.com/sivaramakrishnan-rajaraman/CNN-for-malaria-parasite-detection 含自定义 CNN 与预训练 CNN 两本 Notebook
整视野薄涂片数据集(193 例) 官方扩展 https://data.lhncbc.nlm.nih.gov/public/Malaria/NIH-NLM-ThinBloodSmearsPf/index.html 12 类细粒度标注,可做检测与定位
TensorFlow Datasets malaria 框架集成 https://www.tensorflow.org/datasets/catalog/malaria 一行加载,适合快速原型;无患者 ID
Kaggle 镜像 社区镜像 https://www.kaggle.com/iarunava/cell-images-for-detecting-malaria 高热度 Notebook 生态;注意目录重复问题
Kaggle 患者映射镜像 社区镜像 https://www.kaggle.com/datasets/itsdaniyal/malerial-cell-classification-dataset 附带映射 CSV
和鲸社区镜像 社区镜像 https://www.heywhale.com/mw/dataset/5d007c76e727f8002c43d2bd 337.1 MB,标注 CC0
sachaMorin 复现仓库 社区代码 https://github.com/sachaMorin/malaria-detection 明确讨论患者级划分与泄漏问题
官方联系邮箱(Stefan Jaeger) 官方联系 mailto:stefan.jaeger@nih.gov 数据集与文档问题可直接联系项目作者

§9 相关资源与引用

§9.1 官方许可与使用条款

维度 内容
官方许可表述 数据页未单列 SPDX 许可文件;资源以 NLM 开放获取形式发布,属美国联邦政府资助的公开研究资源
镜像站标注 和鲸社区标注 CC0;Kaggle 各镜像标注不一(部分为 CC0,部分无标注)
获取门槛 无需注册、无需申请、无需签署数据使用协议(DUA);直接 HTTP 下载
商业使用 官方未单列条款;镜像站 CC0 标注可作为参考,但商业部署前建议直接核实 NLM 原始条款
署名要求 学术界惯例为引用原始论文 Rajaraman et al. 2018, PeerJ 6:e4568(见 §9.3)
再分发 允许转载;镜像站的存在本身即体现社区的再分发实践
患者隐私 IRB#12972 批准,归档前完成去标识化(详见 §7.4)
监管提示 公开数据集的开放许可不等于医疗器械监管合规;临床部署需另行满足 FDA / MDR / NMPA 要求

§9.3 权威引用(BibTeX)

原始论文(引用本数据集时请使用此条):

@article{rajaraman2018pre,
  title = {Pre-trained convolutional neural networks as feature extractors toward improved malaria parasite detection in thin blood smear images},
  author = {Rajaraman, Sivaramakrishnan and Antani, Sameer K. and Poostchi, Mahdieh and Silamut, Kamolrat and Hossain, Md A. and Maude, Richard J. and Jaeger, Stefan and Thoma, George R.},
  journal = {PeerJ}, volume = {6}, pages = {e4568}, year = {2018}, doi = {10.7717/peerj.4568}, publisher = {PeerJ Inc.}
}

模型学习行为可视化(姊妹论文):

@article{rajaraman2018understanding,
  title = {Understanding the learned behavior of customized convolutional neural networks toward malaria parasite detection in thin blood smear images},
  author = {Rajaraman, Sivaramakrishnan and Silamut, Kamolrat and Hossain, Md A. and Ersoy, Ilker and Maude, Richard J. and Jaeger, Stefan and Thoma, George R. and Antani, Sameer K.},
  journal = {Journal of Medical Imaging}, volume = {5}, number = {3}, pages = {034501}, year = {2018}, doi = {10.1117/1.JMI.5.3.034501}
}

其余常用引用(按需取用):

@article{rajaraman2019ensembles,
  title = {Performance evaluation of deep neural ensembles toward malaria parasite detection in thin-blood smear images},
  author = {Rajaraman, Sivaramakrishnan and Jaeger, Stefan and Antani, Sameer K.},
  journal = {PeerJ}, volume = {7}, pages = {e6977}, year = {2019}, doi = {10.7717/peerj.6977}
}

@article{yu2020malaria,
  title = {Malaria Screener: a smartphone application for automated malaria screening},
  author = {Yu, Hang and Yang, Feng and Rajaraman, Sivaramakrishnan and Ersoy, Ilker and Moallem, Golnaz and Poostchi, Mahdieh and Palaniappan, Kannappan and Antani, Sameer and Maude, Richard J. and Jaeger, Stefan},
  journal = {BMC Infectious Diseases}, volume = {20}, number = {1}, pages = {825}, year = {2020}, doi = {10.1186/s12879-020-05453-1}
}

@article{kassim2021rbcnet,
  title = {Clustering-Based Dual Deep Learning Architecture for Detecting Red Blood Cells in Malaria Diagnostic Smears},
  author = {Kassim, Yasmin M. and Palaniappan, Kannappan and Yang, Feng and Poostchi, Mahdieh and Palaniappan, Nila and Maude, Richard J. and Antani, Sameer and Jaeger, Stefan},
  journal = {IEEE Journal of Biomedical and Health Informatics}, volume = {25}, number = {5}, pages = {1735--1746}, year = {2021}, doi = {10.1109/JBHI.2020.3034594}
}

@article{rajaraman2022calibration,
  title = {Deep learning model calibration for improving performance in class-imbalanced medical image classification tasks},
  author = {Rajaraman, Sivaramakrishnan and Ganesan, Prasanth and Antani, Sameer},
  journal = {PLoS ONE}, volume = {17}, number = {1}, pages = {e0262838}, year = {2022}, doi = {10.1371/journal.pone.0262838}
}

§9.4 引用指南

场景 应引用
使用该数据集做实验 Rajaraman et al. 2018, PeerJ 6:e4568(必引,数据集来源与基准)
讨论模型可解释性或染色伪影依赖 Rajaraman et al. 2018, J Med Imaging 5(3):034501
使用集成方法 Rajaraman et al. 2019, PeerJ 7:e6977
引用移动端应用 Yu et al. 2020, BMC Infect Dis 20(1):825
使用 RBCNet 或做全片检测 Kassim et al. 2021, IEEE JBHI 25(5):1735-1746
讨论类别不平衡与校准 Rajaraman et al. 2022, PLoS ONE 17(1):e0282838
报告患者级指标 必须同时引用数据集论文并说明你的划分方案与折索引
引用本百科页面 千方病案医数集. NIH Malaria — 疟疾血涂片细胞图像 AI-Ready Wikipedia. https://www.qianfanghub.com/ai-ready-dataset/nih-malaria/502

引用规范提醒:引用该数据集时,除论文外建议同时给出官方数据页链接与下载日期,并明确说明使用的是官方版本还是社区镜像版本——两者的目录结构与是否附带患者映射存在差异,会影响可复现性。

§10 AI 使用声明卡

§10.1 AI 模型列表

模型/工具 用途 版本说明
大语言模型(通用对话式 AI 助手) 文献检索整合、章节草拟、代码示例撰写、格式规范化 生成时检索截至 2026-09 的公开资料
Web 检索工具 获取 NLM 官方数据页、PeerJ 论文页、TensorFlow Datasets 目录页、第三方综述 检索记录见 §10.3
Python/SQL 静态代码审查(人工执行) 校验代码示例的 API 用法与逻辑一致性 人工核对

§10.2 AI 参与范围

内容模块 AI 参与程度 说明
frontmatter 与 schema_org AI 生成 基于规范模板生成,字段值取自核实事实
INFOBOX AI 生成 数值全部来自官方页面与论文
§1 概览 AI 生成 基于官方说明与论文摘要整合
§2 医学背景 AI 生成(编辑补充标注) ICD-11 与 SNOMED CT 映射为编辑补充,非数据集原生字段
§3 数据集规格 AI 生成 基于官方数据页与 TFDS 目录页
§4 数据结构 AI 生成 目录树与字段字典由官方结构推导
§5 划分建议 AI 生成 + 人工核对 泄漏机制分析基于官方 CSV 条目数与文献结论
§6 代码与坑点 AI 生成 + 人工审查 代码示例经人工检查 API 用法;坑点源自官方文档与文献限制说明
§7 质量评估 AI 生成 DAIMS 24 项逐项评估
§8 基准与生态 AI 生成 数值逐条标注来源,不可比较性明确声明
§9 引用 AI 生成 BibTeX 字段经交叉核对
§10 声明卡 AI 生成 —

编辑补充声明:§2 的 ICD-11 与 SNOMED CT 映射、§4 的派生字段字典、§5 的泄漏机制分析、§7 的 DAIMS 评分,均为编辑基于公开资料的补充定义,不是数据集原生字段或官方 schema。§8 的所有性能数值均标注原始出处,不同来源之间不可直接比较。

§10.3 输入来源列表

  1. NLM LHNCBC. Malaria Datasheet(官方数据页). https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-datasheet.html
  2. NLM LHNCBC. Dataset Download(官方数据集下载与说明页). https://www.lhncbc.nlm.nih.gov/LHC-downloads/dataset.html
  3. NLM LHNCBC. Malaria Project page. https://lhncbc.nlm.nih.gov/LHC-research/LHC-projects/image-processing/malaria-project.html
  4. Rajaraman S, Antani SK, Poostchi M, Silamut K, Hossain MA, Maude RJ, Jaeger S, Thoma GR. (2018). Pre-trained convolutional neural networks as feature extractors toward improved malaria parasite detection in thin blood smear images. PeerJ 6:e4568. https://peerj.com/articles/4568/ ; DOI 10.7717/peerj.4568
  5. Rajaraman S, Silamut K, Hossain MA, Ersoy I, Maude RJ, Jaeger S, Thoma GR, Antani SK. (2018). Understanding the learned behavior of customized convolutional neural networks toward malaria parasite detection in thin blood smear images. J Med Imaging 5(3):034501. https://lhncbc.nlm.nih.gov/LHC-publications/PDF/pub9809.pdf
  6. TensorFlow Datasets. malaria 目录页(体积、split、引用信息). https://www.tensorflow.org/datasets/catalog/malaria
  7. Kaggle. Cell Images for Detecting Malaria(社区镜像). https://www.kaggle.com/iarunava/cell-images-for-detecting-malaria
  8. Kaggle. Malerial Cell Classification Dataset(含患者映射 CSV 的镜像). https://www.kaggle.com/datasets/itsdaniyal/malerial-cell-classification-dataset/data
  9. 和鲸社区. 疟疾细胞图像数据集(中文镜像,标注 CC0). https://www.heywhale.com/mw/dataset/5d007c76e727f8002c43d2bd
  10. Rajaraman S, et al. 官方复现代码仓库(CNN-for-malaria-parasite-detection). https://github.com/sivaramakrishnan-rajaraman/CNN-for-malaria-parasite-detection
  11. Frontiers in Medicine. (2026). Deep learning-assisted malaria microscopy with sensitivity-aware threshold optimization. https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2026.1911275/full
  12. arXiv. EMFE: A lightweight, explainable machine learning framework for malaria cell classification. https://arxiv.org/html/2608.24793
  13. Mujahid M, Rustam F, Shafique R, Caro Montero E, Silva Alvarado E, de la Torre Diez I, Ashraf I. (2024). Efficient deep learning-based approach for malaria detection using red blood cell smears. Scientific Reports 14:13249. https://www.nature.com/articles/s41598-024-63831-0
  14. Sukumarran D, Hasikin K, Khairuddin ASM, Ngui R, Sulaiman WYW, Vythilingam I, Divis PCS. (2024). Table 1 in An optimised YOLOv4 deep learning model for efficient malarial cell detection in thin blood smear images. Zenodo. https://doi.org/10.5281/zenodo.16415619
  15. Oktovianus L, Tikkhaviro JK, Prasetyo SY. (2024). Benchmarking CNN Models for Malaria Cell Detection. CENIM. DOI 10.1109/CENIM64038.2024.10882645
  16. MDPI Applied Sciences. (2021). Deep Malaria Parasite Detection in Thin Blood Smear Microscopic Images. 11(5):2284. https://www.mdpi.com/2076-3417/11/5/2284
  17. Wireless Communications and Mobile Computing. (2020). Leveraging Deep Learning Techniques for Malaria Parasite Detection Using Mobile Application. https://www.semanticscholar.org/reader/026e8ae152f1a1a7075ed4f49b58ed498d8ebb35
  18. Rajaraman S, Ganesan P, Antani S. (2022). Deep learning model calibration for improving performance in class-imbalanced medical image classification tasks. PLoS ONE 17(1):e0262838. DOI 10.1371/journal.pone.0262838
  19. sachaMorin. malaria-detection(社区复现,含患者级划分讨论). https://github.com/sachaMorin/malaria-detection
  20. Rajaraman S. Google Scholar 个人主页(引用次数核对). https://scholar.google.cat/citations?hl=en&oi=sra&user=bHPu9eIAAAAJ

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11 / SNOMED CT 映射、疾病与流行病学描述) 千方病案医学编辑部 交叉审核:对照 ICD-11 与 SNOMED CT 官方术语核查编码与名称 ✅ 已通过
§3 数据集规格(规模、患者数、分辨率、格式、来源) 千方病案医学编辑部 交叉审核:逐项对照 NLM 官方数据页与 PeerJ 论文原文 ✅ 已通过
§4 数据结构(目录树、字段字典、标签分布) 千方病案医学编辑部 交叉审核:对照官方下载结构说明与患者映射 CSV 条目数 ✅ 已通过
§5 划分策略与泄漏分析 千方病案医学编辑部 交叉审核:核对患者 ID 条目数(151 / 201)与论文的患者层级五折设定 ✅ 已通过
§6 代码示例与 8 个坑点 千方病案医学编辑部 交叉审核:代码 API 用法核对;坑点逐条比对官方文档与文献限制说明 ✅ 已通过
§7 质量评估(DAIMS 24 项、偏倚、泛化性) 千方病案医学编辑部 交叉审核:逐项评定状态并复核外部验证矩阵来源 ✅ 已通过
§8 基准排行榜与关键论文 千方病案医学编辑部 交叉审核:逐条核对引用完整性与数值来源,标注不可比较性 ✅ 已通过
§9 引用与 BibTeX 千方病案医学编辑部 交叉审核:核验作者、期刊、卷期、页码与 DOI ✅ 已通过
§10 AI 使用声明 千方病案医学编辑部 交叉审核:逐项核对参与范围与输入来源列表 ✅ 已通过
全篇合规检查(专有表述、无 HTML 标签、无占位符、代码围栏配对) 千方病案医学编辑部 自动化校验脚本 + 人工复核 ✅ 已验证

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • cytoimagenet — 共享标签:医学影像 / 病理图像
  • enigma — 共享标签:医学影像 / 公共卫生与流行病学
  • uk-biobank — 共享标签:医学影像 / 公共卫生与流行病学
  • lightmycells2 — 共享标签:医学影像 / 病理图像
  • bcnb — 共享标签:医学影像 / 病理图像
  • ocelot — 共享标签:医学影像 / 病理图像
  • sicapv2 — 共享标签:医学影像 / 病理图像
  • acrobat — 共享标签:医学影像 / 病理图像
  • msk-impact — 共享标签:医学影像 / 病理图像
  • munich-bmc — 共享标签:医学影像 / 病理图像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集