信息速览

Herlev 宫颈涂片(Herlev Pap Smear) — 经典宫颈细胞学基准 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Herlev Pap Smear Benchmark Data |
| 英文全称 | Pap-smear Benchmark Data For Pattern Classification |
| 别名/简称 | Herlev Pap Smear Database、Pap Smear Database、smear2005 |
| 疾病分类 | 宫颈上皮内瘤变与宫颈癌(ICD-11:GA15.6 低级别鳞状上皮内病变 / 2E66.2 高级别鳞状上皮内病变 / 2E66 宫颈原位癌 / 2C77.0 宫颈鳞状细胞癌) |
| SNOMED CT | 285636001 宫颈上皮内瘤变 / 450595003 CIN1 / 400049009 CIN2 / 20365006 CIN3(详见 §2.2) |
| 数据模态 | 宫颈细胞显微图像(单细胞,Pap 染色) |
| AI 任务类型 | 7 类细胞分类、2 类正常/异常筛查、4 类分级、细胞核/细胞质分割 |
| 样本总数 | 917 张单细胞图像(正常 242 / 异常 675)+ 917 张分割掩码 + 每细胞 20 维数值特征 |
| 数据大小 | smear2005.zip 85.17 MB(图像与掩码);另有特征数据包 norup2005.zip 3.17 MB |
| 数据格式 | BMP(24 位位图;原图与掩码混放于类别文件夹,掩码以 *-d.bmp 命名) |
| 许可证 | 无正式许可证文本;免费公开下载,官方要求引用当前链接与相关研究 |
| 访问级别 | 开放(直接下载,无需注册或申请) |
| DUO 标签 | GRU(官方要求引用出处) |
| 语言 | 英文(文档与论文) |
| 首发日期 | 2005(Jantzen et al. 于 Proc. NiSIS 2005 发表并随文发布) |
| 最后更新 | 2005(最终版;原 DTU 站点停止维护后由爱琴海大学 MDE-Lab 接管托管) |
| 发布机构 | 丹麦技术大学(DTU)+ Herlev 大学医院;现由爱琴海大学 MDE-Lab 托管 |
| 官方主页 | http://mde-lab.aegean.gr/index.php/downloads/ |
| 下载地址 | http://mde-lab.aegean.gr/index.php/downloads/(smear2005.zip) |
| DOI | 无正式 DOI(引用 Jantzen et al., 2005, Proc. NiSIS 2005, pp. 1-9) |
| 引用次数 | 285+(Semantic Scholar,Jantzen et al. 2005,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 带分类标签与像素级掩码、免注册下载、规模小易上手;扣分项:无官方数据划分、BMP 与掩码需自行解析、类别不平衡且标注一致性统计未披露 |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
本词条由千方病案医学编辑部按 AI-Ready 医疗数据集百科规范生产,面向医疗 AI 工程师、临床研究者和数据科学学生。
- 医学审核:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 / SNOMED CT 双映射、疾病与流行病学描述)、§7 偏倚分析。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Herlev Pap Smear 数据集可免费下载,官方未发布正式许可证文本,但明确要求使用者引用其官方链接与相关研究(Jantzen et al., 2005, Proc. NiSIS 2005)。DUO 标签仅供参考,具体使用限制以数据集官方页面说明为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? Herlev Pap Smear 是 2005 年由丹麦技术大学(DTU)与哥本哈根 Herlev 大学医院联合发布的宫颈细胞学基准数据集:917 张在显微镜下逐个圈选、Pap 染色的单细胞图像,每张都由两名细胞技师背靠背判读并给出 7 类标签之一——3 类正常(浅层鳞状、中层鳞状、柱状)和 4 类异常(轻度、中度、重度不典型增生,原位癌)——同时还附带软件生成的细胞核/细胞质分割掩码和 20 维数值特征。
为什么重要? 在深度学习进入病理图像分析之前,它几乎是唯一同时提供"分类标签 + 像素级真值掩码"的开放宫颈细胞数据集,因此成为 2005-2020 年间宫颈细胞自动识别论文绕不开的试金石:从传统机器学习的 61.1% 官方基线,到人工神经网络时代的 93.78%,再到卷积网络的 98.3%(2 类筛查任务),20 年的方法演进都能在同一批细胞上直接对话。
我能用它做什么? 你可以用它做三件事:训练一个"正常/异常"二分类筛查模型或 7 类分级模型;利用自带掩码做细胞核与细胞质分割算法的对照实验;或者把它当作小样本医学图像分析的入门练手集——917 张图一张消费级显卡就能跑通全流程。但请记住:它没有官方训练/测试划分,且不提供任何患者级信息。
§1.1 摘要
Herlev Pap Smear 数据集的图像采集于哥本哈根 Herlev 大学医院:将传统巴氏染色涂片置于显微镜下,经数字相机以 0.201 µm/pixel 的空间分辨率逐细胞成像,得到 917 张尺寸不一的 BMP 单细胞图(约 71×59 至 490×474 像素)。标注采用双人协议——两名细胞技师各自判读,疑难样本由医生复核,意见不一致的细胞直接丢弃,从而保证剩余 917 个样本的标签清晰;分割掩码由商业软件 CHAMP(Dimac)生成,标记背景、细胞质、细胞核与未知区四类。每张图按类别归入 7 个文件夹之一,类别分布刻意不均衡(占比 8%-22%),以模拟真实筛查场景。丹麦技术大学团队在 2005 年 NiSIS 研讨会上发布该基准,并给出最小距离分类器约 61.1%(7 类)的官方基线;此后 Chankong et al.(2014,人工神经网络,2 类 99.27%)、Zhang et al.(2017,DeepPap,2 类 98.3%)、Lin et al.(2019,GoogLeNet,2 类 94.5%/7 类 64.5%)等工作持续将其作为标准评测台。
§1.2 战略价值
维度一:方法学的"公共标尺"。 医学图像领域长期苦于"每篇论文自造划分、数字互不可比",而 Herlev 是少数让 20 年间的方法在同 917 个细胞上重复交手的公开基准。Jantzen et al.(2005)的 61.1% 7 类基线、Chankong et al.(2014)的 93.78%、Lin et al.(2019)的 64.5%(GoogLeNet)与 2025 年 Xception 变体的 90.42%,构成了从经典特征工程到深度学习的完整演化谱系。对研究者而言,这意味着新方法上线前可以先回答一个历史问题:“你比 2005 年的最小距离分类器、比 2014 年的 ANN 究竟好了多少?”
维度二:带真值掩码的分割试验台。 相比同期多数只给分类标签的细胞数据集,Herlev 每张图都带 CHAMP 生成的像素级掩码(细胞质/细胞核/背景三区标注),可以直接用于分割算法的定量评估,也可作为弱监督、半监督方法的种子标注。917 张、85 MB 的体量使其成为课堂演示、算法单元测试与快速原型验证的理想载体——不需要集群,一台笔记本即可复现全部经典结果。
维度三:小数据方法学的公共教具。 917 张、7 类、20 维特征、掩码齐备——四个要素的任何组合都能构造出一个可复现的微型实验(特征选择、类别不平衡、域适应、半监督种子集),且全部实验在一台笔记本上分钟级完成。在"算力即门槛"的时代,这种"人人可复现"的属性本身就是稀缺资源,也是它比许多更大更新数据集更适合教学与消融研究的原因。
§1.3 同类数据集横向对比
| 数据集 | 发布 | 规模 | 模态/粒度 | 标注 | 差异化 |
|---|---|---|---|---|---|
| Herlev Pap Smear(本词条) | 2005 | 917 张 | 单细胞显微图像(Pap 染色) | 7 类 + 像素级掩码(CHAMP) | 双人标注协议;20 维特征随库发布;免注册下载 |
| Pap Smear Database(旧库) | 20 世纪 90 年代末 | 500 张 | 单细胞显微图像(Pap 染色) | 7 类 + 掩码 | Herlev 基准的前身,规模更小,smear.zip 仅 5.16 MB |
| SIPaKMeD | 2014(ISBI 挑战赛切片) | 4,049 张 | 单细胞显微图像(Pap 染色) | 5 类 | 规模更大、源自现代制片,但无随库数值特征 |
三者同属宫颈细胞学赛道,但各有覆盖盲区:Herlev 补历史纵深与掩码真值,SIPaKMeD 补规模与现代制片,旧库补演化考证;若研究需要全涂片(含背景杂质与重叠细胞)场景,三者均不覆盖,需另寻 WSI 级资源。
§1.4 版本时间轴
| 时间 | 版本/事件 | 规模与内容 | 备注 |
|---|---|---|---|
| 20 世纪 90 年代末 | Pap Smear Database(旧库) | 500 张单细胞图像,smear.zip 5.16 MB | Herlev 大学医院采集、DTU 整理 |
| 2005 | Herlev 基准(新库)发布 | 917 张图像 + 掩码 + 特征,smear2005.zip 85.17 MB | 随 Jantzen et al. 论文发布于 Proc. NiSIS 2005(pp. 1-9) |
| 2006 | 姊妹篇与汇编 | Jantzen & Dounias《Analysis of Pap-smear Image Data》;《The Pap-Smear Benchmark》论文集 | 系统分析特征选择与分类器错误率(最低 1-2%) |
| 2014 | ANN 时代基准刷新 | Chankong et al.:2 类 99.27% / 7 类 93.78% | FCM 分割 + 9 特征 ANN |
| 2017 | 深度学习介入 | Zhang et al. DeepPap:2 类 98.3%(5 折 CV) | IEEE JBHI |
| 2019-2025 | 卷积网络与排行榜扩展 | Lin et al. GoogLeNet、Rahaman et al. 混合特征融合(90.32%)、Xception 变体(90.42%) | 无官方划分导致数字间不可直接比较 |
| 原站停维后 | MDE-Lab 接管托管 | smear2005.zip 及配套论文包可从爱琴海大学下载 | 原 fuzzy.iau.dtu.dk 地址已由 MDE-Lab 页面取代 |
§1.5 典型应用场景
- 基准回归测试:新分类器(从 SVM 到 Vision Transformer)在 7 类/2 类任务上的快速对标,直接接入 2005 年以来的文献谱系。
- 分割算法试验台:利用随库 CHAMP 掩码评估细胞核/细胞质分割算法的边界精度,是少数可做定量分割评估的开放细胞数据集。
- 小样本医学图像分析教学:917 张、85 MB,适合课堂与 Kaggle 风格练习,覆盖类别不平衡、数据划分泄漏、评估指标选择等全部经典议题。
- 特征工程与可解释性研究:20 维形态/光密度特征与深度特征可对照分析,为"深度模型学到了什么"提供锚点。
- 半监督/自监督预训练评估:以 Herlev 为小规模下游评测集,检验无标签预训练表征在细胞学上的迁移效果。
§1.6 读者价值地图
| 读者 | 最该看的章节 | 能带走什么 |
|---|---|---|
| 医疗 AI 工程师 | §4.0、§6 全部 | 目录结构、掩码解析、8 个坑点、可运行 DataLoader 与训练脚本 |
| 方法学研究者 | §5.3、§7.8、§8.1 | 划分协议、泄漏论证、二十年排行榜与不可比性说明 |
| 临床/检验医学生 | §1.0、§2.1-§2.3 | 7 类标签的形态学与疾病谱系对应、筛查任务定义 |
| 数据合规/法务 | §3.5、§7.4、§9.4 | 许可现状(免费但无正式许可文本)、引用义务清单 |
| 评审/编辑 | §7.7、§8.3 | DAIMS 24 项评估、协议卡片式评审清单 |
§2 医学背景
§2.1 ICD-11 编码映射
Herlev 的 7 类标签对应宫颈细胞形态学谱系,与 ICD-11 MMS 的对应关系如下(正常细胞学条目在 ICD-11 中无独立编码):
| 数据集类别 | 形态学描述 | ICD-11 编码 | ICD-11 中文名称 |
|---|---|---|---|
| normal_superficiel(浅层鳞状) | 成熟表层鳞状上皮细胞,固缩小核 | — | 正常细胞学,无对应编码 |
| normal_intermediate(中层鳞状) | 中层鳞状上皮细胞,泡状核,胞质青染 | — | 正常细胞学,无对应编码 |
| normal_columnar(柱状) | 宫颈/子宫内膜柱状上皮细胞,柱状核 | — | 正常细胞学,无对应编码 |
| mild(轻度不典型增生) | 轻度核异质,核轻度增大(≈ CIN1) | GA15.6 | 低级别鳞状上皮内病变(LSIL) |
| moderate(中度不典型增生) | 中度核异质,核质比升高(≈ CIN2) | 2E66.2 | 高级别鳞状上皮内病变(HSIL) |
| severe(重度不典型增生) | 重度核异质,核大深染(≈ CIN3) | 2E66.2 | 高级别鳞状上皮内病变(HSIL) |
| carcinoma_in_situ(原位癌) | 恶性细胞但未突破基底膜 | 2E66 | 宫颈原位癌 |
说明:中度不典型增生(CIN2)在 ICD-11 中归入 2E66.2(HSIL);若病变进展为浸润性鳞状细胞癌,则对应 2C77.0(宫颈鳞状细胞癌),该阶段已超出本数据集的细胞类别范围。
§2.2 SNOMED CT 映射与疾病简介
SNOMED CT 映射(宫颈上皮内瘤变谱系):
| 概念 | SNOMED CT 编码 | 与数据集类别的对应 |
|---|---|---|
| Cervical intraepithelial neoplasia(宫颈上皮内瘤变,总称) | 285636001 | mild / moderate / severe 三类总域 |
| CIN1 - mild dysplasia | 450595003 | mild |
| CIN2 - moderate dysplasia | 400049009 | moderate |
| CIN3 - severe dysplasia | 20365006 | severe |
| 原位癌与正常三类 | — | 官方映射未在本数据集文档中收录 |
疾病简介:宫颈癌的发生遵循"正常上皮 → 低级别鳞状上皮内病变(LSIL/CIN1)→ 高级别鳞状上皮内病变(HSIL/CIN2/CIN3)→ 原位癌 → 浸润癌"的连续谱系,高危型人乳头瘤病毒(HPV,尤其是 16/18 型)持续感染是必要病因。Herlev 数据集的 7 类标签恰好横跨这一谱系的癌前阶段:三个正常类代表无病变细胞,四个异常类覆盖从轻度核异质到原位癌的渐进形态改变。这正是它作为"分级教学样本"的独特价值——同一次采集内可以看到疾病演化的完整形态梯度。
流行病学:据世界卫生组织 2018 年统计,宫颈癌是全球女性第 4 常见癌症,每年约 57 万新发病例、31.1 万死亡;同年中国新发约 10.6 万例、死亡约 4.8 万例。巴氏涂片细胞学筛查是过去半个世纪最成功的癌症二级预防手段之一——一张传统 Pap 涂片可含约 300 万个细胞,人工镜检既要从中找出极少数异常细胞,又要在 LSIL/HSIL 边界上做出分级判断,这正是 Herlev 标签体系复刻的两个核心困难。
§2.2b 与 TBS(Bethesda)体系的对应
现代宫颈细胞学报告通用 TBS(The Bethesda System)术语。Herlev 的 7 类标签先于 TBS 细分体系确立,官方文档未提供与 TBS 的正式映射;下表为基于形态学谱系的常规对应关系,仅供理解参考,复现文献时请以原论文定义为准:
| Herlev 类别 | TBS 对应术语 | 处理建议(临床惯例) |
|---|---|---|
| normal_superficiel / normal_intermediate | NILM(未见上皮内病变或恶性细胞) | 常规随访 |
| normal_columnar | NILM(腺上皮成分) | 常规随访 |
| mild(≈ CIN1) | LSIL | 12 个月随访或 HPV 分流 |
| moderate(≈ CIN2) | HSIL | 阴道镜活检 |
| severe(≈ CIN3) | HSIL | 阴道镜活检 + 治疗 |
| carcinoma_in_situ | HSIL / 原位癌 | 治疗(锥切等) |
对该数据集的使用启示:若研究目标对标现代筛查工作流,应把 7 类聚合为"NILM vs 异常"(2 类)或"LSIL vs HSIL"(异常内部)两种协议,这与 TBS 的实际决策分支一致。
§2.3 临床任务定义
| 任务 | 输入 | 输出 | 对应数据集用法 | 临床意义 |
|---|---|---|---|---|
| 筛查(triage) | 单细胞图像 | 2 类:正常 / 异常 | 3 个正常类聚合 vs 4 个异常类聚合 | 从大量细胞中检出可疑者,对应筛查初筛 |
| 分级(grading) | 单细胞图像 | 7 类(或 4 类聚合) | 直接使用原始 7 类标签 | 在异常之上区分 LSIL/HSIL,决定随访与治疗强度 |
| 分割 | 单细胞图像 | 细胞核 / 细胞质 / 背景 | 使用 *-d.bmp 掩码 | 定量形态学测量的前置步骤 |
§2.4 患者与样本人群
| 维度 | 内容 |
|---|---|
| 来源机构 | 丹麦哥本哈根 Herlev 大学医院 |
| 采集时间 | 官方未披露具体年份(旧库建于 20 世纪 90 年代末,基准版 2005 年发布) |
| 样本类型 | 传统巴氏染色(Pap)涂片,显微镜下逐细胞提取 |
| 性别/年龄 | 均为宫颈癌筛查女性受检者的涂片;年龄分布官方未披露 |
| 种族/地域 | 单中心(丹麦);人口学信息官方未披露 |
| 就医类型 | 宫颈癌筛查门诊;细胞经由双人细胞技师判读后入库 |
§2.5 临床价值定位
对临床 AI 而言,Herlev 的价值不在"直接产出可部署模型"——917 张单细胞图、单中心、20 世纪 90 年代制片,远不足以支撑监管级声明——而在于三点:其一,它是理解"细胞级判读有多难"的最小完备样本(LSIL/HSIL 边界模糊、柱状细胞与重度不典型增生核形态重叠等难点在数据中真实存在);其二,它提供了筛查任务的不平衡分布(异常:正常 ≈ 2.8:1)与 7 类细分级两种协议,可训练团队建立正确的评估直觉;其三,其双人标注 + 医生复核 + 不一致丢弃的协议,本身就是临床标注质量管理的经典案例。
对标注团队管理者,该协议给出两条可迁移经验:双人独立判读的成本远低于"仲裁一切分歧",且丢弃分歧样本对基准用途是合理交换——前提是像本数据集一样把丢弃规则写进协议文档而非事后解释;对临床教师,7 个文件夹恰好构成一份"形态学梯度教具",从浅层鳞状到原位癌的核质比演变可直接用于阅片教学。
§2.6 标注金标准
| 项目 | 内容 |
|---|---|
| 参考划分 | 无官方训练/测试划分;官方仅提供 7 类最小距离分类器约 61.1% 的参考基线 |
| 标注方式 | 人工双判读 + 医生复核 + CHAMP(Dimac)软件分割生成掩码 |
| 标注者 | 两名细胞技师(cyto-technicians),困难样本由医生复核;具体人数与资质细节官方未披露 |
| 一致性处理 | 意见不一致的细胞被直接丢弃(未披露丢弃数量与 Kappa 统计) |
| 标注性质 | 全监督人工标注;每图 1 个类别标签 + 1 张像素级分割掩码 |
§3 数据集规格
§3.0 版本抉择矩阵
MDE-Lab 下载页同时提供旧库、新库与多个配套数据包,按下表选择:
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 训练分类/分割模型(默认) | smear2005.zip(917 张新基准) | 85.17 MB | 样本最多、带掩码与类别文件夹,2005 年后全部文献基于此版本 |
| 复现经典特征工程论文 | norup2005.zip(特征数据包) | 3.17 MB | 随 Norup 2005 硕士论文发布的 20 维特征,与文献数字直接可比 |
| 版本演化/历史考证 | smear.zip(旧库 500 张) | 5.16 MB | 20 世纪 90 年代末建成的 Pap Smear Database 原始版本 |
| 系统阅读原始文献 | Papers.zip | 6.20 MB | 官方汇编的相关论文全文 |
| 完整学术考证(可选) | byriel.zip / martin2003.zip | 295.98 MB / 86.78 MB | 官方提供的两份历史硕士论文数据包,非必需 |
§3.1 模态详情
数据集为光学显微镜下的单细胞显微图像:将传统巴氏染色宫颈涂片置于显微镜下,由实验员在视野中逐个圈选孤立细胞,经显微镜搭载的数字相机数字化为 24 位 BMP 位图。像素空间分辨率为 0.201 µm/pixel,足以分辨染色质分布与核膜细节。原始 BMP 尺寸不统一(约 71×59 至 490×474 像素,部分文献报道的范围更宽),取决于细胞本身大小与采集时的取景框——这是使用时必须逐图处理的工程事实,不存在统一的"200×300"规格。图像颜色为标准 Pap 染色谱系:细胞质呈青/蓝绿色调,细胞核呈紫/品红色调。
§3.1b 采集与数字化流程
巴氏染色涂片(Herlev 大学医院制备)
│ 显微镜下逐视野检视
▼
实验员圈选孤立、边界清晰的单细胞
│ 显微镜搭载数字相机成像
▼
24 位 BMP 单细胞图像(0.201 µm/pixel,尺寸随细胞而定)
│ 双人细胞技师各自判读类别;困难样本由医生复核
▼
意见一致 → 保留(917 张);意见不一致 → 丢弃
│ CHAMP(Dimac)软件生成核/质分割掩码
▼
按 7 类文件夹归档发布(2005,DTU → 现由 MDE-Lab 托管)
该流程解释了两个使用要点:其一,每张图都是"被拣选的孤立细胞",不包含重叠细胞团与背景杂质——真实涂片中最难的拥挤场景不在库内;其二,类别标签先于掩码产生,两者语义独立,分类任务与分割任务可分别使用。
§3.2 按类别样本数
| 类别文件夹 | 中文名称 | 样本数 | 占比 | 聚合标签 |
|---|---|---|---|---|
| normal_superficiel(法语拼写,少一个 u) | 浅层鳞状(正常) | 74 | 8% | 正常 |
| normal_intermediate | 中层鳞状(正常) | 70 | 7% | 正常 |
| normal_columnar | 柱状(正常) | 98 | 11% | 正常 |
| mild_dysplasia | 轻度不典型增生 | 182 | 19% | 异常 |
| moderate_dysplasia | 中度不典型增生 | 146 | 16% | 异常 |
| severe_dysplasia | 重度不典型增生 | 197 | 22% | 异常 |
| carcinoma_in_situ | 原位癌 | 150 | 17% | 异常 |
| 合计 | — | 917 | 100% | 正常 242 / 异常 675 |
类别分布刻意不均衡(均匀期望为 14%),最少的浅层鳞状类(74 张)仅是最多的重度不典型增生类(197 张)的 37.6%。三个正常类合计 242 张、四个异常类合计 675 张——设计者的意图可从构成读出:正常内部按上皮层次细分(浅层/中层/柱状),异常内部按异型程度细分(轻/中/重/原位癌),两个细分维度叠加,才得到这个"看起来奇怪"的 7 类体系;这也解释了为何 7 类任务远难于 2 类任务——模型必须同时学会"层次"与"异型程度"两个正交轴。
§3.3 数据格式
| 内容 | 格式 | 命名/组织 | 说明 |
|---|---|---|---|
| 细胞原图 | BMP(24 位) | *.bmp |
与掩码混放于同一类别文件夹 |
| 分割掩码 | BMP(24 位) | *-d.bmp(原图文件名 + -d 后缀) |
标记区位于蓝色通道;含背景/细胞质/细胞核/未知 4 类标签 |
| 数值特征 | 随 norup2005.zip 发布 | 表格文件 | 每细胞 20 维形态/光密度特征 |
| 类别标签 | 文件夹名即标签 | 7 个类别文件夹 | 二分类需自行按正常/异常聚合 |
§3.4 存储大小
| 数据包 | 大小 | 内容 |
|---|---|---|
| smear2005.zip | 85.17 MB | 917 张新基准图像与掩码(本词条主对象) |
| smear.zip | 5.16 MB | 500 张旧库图像 |
| norup2005.zip | 3.17 MB | 特征数据包 |
| Papers.zip | 6.20 MB | 相关论文汇编 |
| byriel.zip / martin2005.zip | 295.98 MB / 86.78 MB | 历史硕士论文数据包(可选) |
§3.5 标注方式
混合标注:类别标签为纯人工标注(双人细胞技师判读 + 医生复核);分割掩码为软件辅助标注——由商业分割软件 CHAMP(Dimac)自动生成细胞核/细胞质边界,配合人工确认。掩码含 4 个标签区:背景、细胞质、细胞核与"未知"区(unknown 区域多数使用场景并入背景处理)。因此对分类任务它是全监督人工标注,对分割任务它是"软件生成 + 人工背书"的准金标准。
§3.6 标注者资质与一致性
每个细胞由两名细胞技师分别检查,困难样本提交医生复核;意见不一致的样本被直接丢弃而非仲裁。该协议保证了入库样本标签的清晰度,但也引入选择偏倚(见坑点 7)。官方文档未披露丢弃样本数量、标注者间 Kappa 值等一致性统计——使用者在论文中应避免声称"标注一致性已量化"。
§3.7 采集周期
官方未披露具体采集年份。可核实的锚点是:旧 Pap Smear Database 建于 20 世纪 90 年代末,917 张新基准于 2005 年随 NiSIS 论文发布;因此图像采集应不晚于 2005 年,且部分样本与旧库同期。对使用者的含义:染色与制片工艺代表 20 世纪 90 年代的北欧实验室水准,任何依赖染色准确性的结论都应限定在该语境。
§3.8 地域覆盖
单中心:丹麦哥本哈根 Herlev 大学医院。数据集不含地理多样性,跨人群泛化能力未经评估。
§3.9 设备规格
光学显微镜 + 显微镜搭载数字相机(具体品牌与型号官方未披露),像素空间分辨率 0.201 µm/pixel,输出 24 位 BMP。制片采用传统巴氏染色法(非液基制片)。
§3.10 深度溯源链
Herlev 大学医院(采集与判读)→ 丹麦技术大学(DTU,建库与基准设计;Jantzen/Norup/Dounias/Bjerregaard)→ Proc. NiSIS 2005 论文与 DTU Orbit 收录(https://orbit.dtu.dk/en/publications/pap-smear-benchmark-data-for-pattern-classification)→ 原 DTU 站点(fuzzy.iau.dtu.dk)停止维护 → 爱琴海大学 MDE-Lab 接管托管(http://mde-lab.aegean.gr/index.php/downloads/,合作者 Dounias 教授任职机构)→ 社区镜像(如 GitHub 的 ImageMask-Dataset-Pap-Smear 仓库对掩码做了重新打包)。当前唯一应引用的官方入口是 MDE-Lab 下载页。
§4 数据结构
§4.0 目录树
smear2005.zip 解压后的组织结构(按 7 个类别文件夹组织,原图与掩码混放;不同镜像对文件夹命名的拼写可能略有出入,以实际解压结果为准):
data_root/
├── normal_superficiel/ # 浅层鳞状(正常),74 个细胞
│ ├── 0123.bmp # 细胞原图(文件名仅示意,以实际解压为准)
│ └── 0123-d.bmp # 对应掩码(蓝色通道为标记区)
├── normal_intermediate/ # 中层鳞状(正常),70 个细胞
├── normal_columnar/ # 柱状(正常),98 个细胞
├── mild_dysplasia/ # 轻度不典型增生,182 个细胞
├── moderate_dysplasia/ # 中度不典型增生,146 个细胞
├── severe_dysplasia/ # 重度不典型增生,197 个细胞
└── carcinoma_in_situ/ # 原位癌,150 个细胞
# 每个文件夹内:细胞原图 *.bmp 与掩码 *-d.bmp 成对混放
# 二分类标签:前 3 个文件夹 → 正常(0);后 4 个文件夹 → 异常(1)
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 细胞原图 | BMP 图像 | 单细胞 Pap 染色显微图 | 0123.bmp |
分类/分割输入 | 取景框含少量背景 | 无缺失 | 71×59 至 490×474 px |
| 分割掩码 | BMP 图像 | *-d.bmp,标记区在蓝色通道 |
0123-d.bmp |
分割真值/ROI 裁剪 | CHAMP 自动边界 | unknown 区(并入背景) | 背景/胞质/核/未知 |
| 类别标签(7 类) | 整数 0-6 | 文件夹名映射 | 3(轻度不典型增生) | 多分类目标 | 双人一致性未量化 | 无缺失 | 0-6 |
| 聚合标签(2 类) | 整数 0-1 | 正常/异常聚合 | 1(异常) | 筛查任务目标 | 由 7 类确定 | 无缺失 | 0,1 |
| 像素分辨率 | 浮点 | µm/pixel | 0.201 | 物理尺度换算 | 恒定 | 无缺失 | 0.201 |
| 图像宽高 | 整数对 | 逐图不同 | 143×109 | 预处理输入 | 恒定 | 无缺失 | 见 §4.3 |
| 20 维特征 | 浮点向量 | 形态 + 光密度特征(norup2005.zip) | 20 维向量 | 经典 ML/可解释性 | 特征由分割结果派生 | 无缺失 | 见特征包文档 |
| 患者标识 | — | 不存在 | — | — | — | — | 官方未提供 |
| 涂片/视野编号 | — | 官方未提供 | — | 分层划分不可行 | — | — | 官方未提供 |
§4.2 标签分布
7 类分布见 §3.2。聚合视图:
| 聚合协议 | 类别构成 | 数量 | 占比 |
|---|---|---|---|
| 2 类(筛查) | 正常 | 242 | 26.4% |
| 2 类(筛查) | 异常 | 675 | 73.6% |
| 4 类(文献常见) | 正常 / LSIL / HSIL / 癌前-癌聚合 | 具体聚合方式因研究而异 | — |
| 7 类(分级) | 逐类见 §3.2 | 917 | 100% |
注意:Lin et al.(2019)等文献使用 4 类协议,但其聚合边界各文献不完全一致,复现时应逐篇核对原文定义。
§4.2b 不平衡度量
由类别计数直接计算的失衡指标(均为可复现的算术推导):
| 度量 | 数值 | 含义 |
|---|---|---|
| 异常:正常比(2 类) | 675:242 ≈ 2.79:1 | 按频率倒数赋类权重即可对冲 |
| 最大/最小类比(7 类) | 197:74 ≈ 2.66:1 | 重度不典型增生 vs 浅层鳞状 |
| 最大类占比 / 最小类占比 | 22% / 8% | 均匀期望 14% |
| 不平衡度(7 类,占优比) | 每 10 个样本约 1.9 个来自最大类 | 远轻于真实筛查场景(异常率 < 5%) |
值得强调的方向性:库内异常占 73.6%,远高于真实筛查人群的阳性率——Herlev 是"类间不平衡、整体准平衡"的教学级不平衡,与真实筛查的极端稀有事件不平衡性质不同,度量结论不可互相外推。
§4.3 关键统计
| 统计项 | 数值 | 说明 |
|---|---|---|
| 图像总数 | 917 | 另有 917 张成对掩码 |
| 类别数 | 7(3 正常 + 4 异常) | 二分类聚合 242:675 |
| 像素分辨率 | 0.201 µm/pixel | 全库统一 |
| 单图尺寸范围 | 约 71×59 至 490×474 px | 无统一规格,逐图处理 |
| 单图最大宽高比 | 显著偏离 1:1 | 细胞形态所致,resize 时注意形变 |
| 类别占比范围 | 8%-22% | 均匀期望 14% |
| 特征维度 | 20 | 随 norup2005.zip 发布 |
§4.4 数据层级
受检者(患者) # 官方未提供任何患者级信息
└── 涂片(slide) # 官方未提供涂片编号
└── 显微视野 # 官方未提供视野编号
└── 单细胞图像(917 个,7 类标签 + 掩码)
层级断裂是本数据集最重要的结构事实:917 个细胞无法追溯回多少张涂片、多少名受检者,因此患者级/涂片级划分不可重建,任何划分策略都只能做到"细胞级"(详见 §5.3 与坑点 3)。
| 层级 | 是否可用 | 对分析的影响 |
|---|---|---|
| 患者 | ❌ 不存在 | 无法做人群级推断,结果只能表述为"细胞级" |
| 涂片 | ❌ 不存在 | 无法按涂片划分,泄漏只能近似控制 |
| 显微视野 | ❌ 不存在 | 同视野光照相关性与涂片同级处理 |
| 单细胞 | ✅ 917 个(文件名级) | 全部分类/分割分析的基本单元 |
§4.5 缺失值与信息性缺失编码
图像与掩码本身无缺失值;掩码中的第 4 标签"未知(unknown)“区是唯一的信息性编码,语义为"不属于明确背景/胞质/核的过渡或伪影区”,社区惯例是并入背景或直接丢弃该区像素。特征表中未见缺失值报告。患者级元数据整体缺省,属"官方未提供"而非信息性缺失。
§5 数据划分与使用建议
§5.1 官方划分
不存在。官方仅提供 7 类任务的最小距离分类器基线(准确率约 61.1%),未规定训练/测试划分协议。
§5.2 社区惯例
| 协议 | 代表文献 | 说明 |
|---|---|---|
| 5 折交叉验证(细胞级随机) | Zhang et al. 2017(DeepPap,2 类) | 最常见;同一涂片的细胞可能跨越折 |
| 随机 hold-out | Chankong et al. 2014 | 划分比例各文献不一 |
| 自造 50/50 或 70/30 | 大量早期论文 | 数字互不可比 |
由于协议不一,跨论文数字不可直接比较——Lin et al.(2019)明确声明了这一点(详见 §8.1)。读者在 §8.1 看到任何数字时,应把"划分协议"列当作与"性能"列同等重要的信息:一个 94.5%(随机划分)与一个 84.45%(不同预处理与划分)之间不存在可比的优劣关系,只有协议一致时排座次才有意义。
§5.3 泄漏风险(重点)
Herlev 的泄漏风险是结构性的:917 个细胞来自未知数量的涂片与受检者,同一涂片的细胞在染色、制片、光照上高度同质。细胞级随机划分会让"同涂片兄弟细胞"同时出现在训练集与测试集,使模型有机会记忆涂片级特征(背景色调、染色深浅)而非细胞形态学。Lin et al.(2019)按患者级组织划分后,性能明显低于随机划分——这一差距就是随机划分的乐观偏差上界。对策:报告结果时必须写明划分协议与随机种子;凡声称"接近 100%"的 2 类结果,应先检查其划分是否为细胞级随机。
§5.4 划分策略建议
- 基线复现:分层(按 7 类)+ 固定种子 + 5 折交叉验证,与主流文献可比。
- 稳健评估:按掩码重心做空间聚类(如 KMeans)构造"伪涂片组"再划分,近似同涂片不跨折。
- 报告规范:同时报告宏平均与逐类召回率,并附划分脚本;禁止只报总体准确率。
§5.5 交叉验证建议
917 样本规模下 5 折 CV 方差已可接受;建议重复 3 次(不同种子)取均值 ± 标准差。异常类与正常类在每个折内保持 7 类分层。若做 2 类筛查,注意 675:242 的失衡需配合类权重或分层采样。
§5.6 外部验证建议
训练后应在外部数据集(如 SIPaKMeD,4,049 张单细胞、5 类)上测试跨库泛化——两库制片年代与染色协议不同,跨库性能下降幅度是衡量模型"学形态学"还是"学涂片风格"的直接指标。官方未提供跨库基准,社区亦无标准化协议,需自行搭建。
§5.7 最小复现检查清单
交付任何基于 Herlev 的实验结果前,逐项确认:
- [ ] 样本计数与官方一致(917 张原图 + 917 张掩码,7 类计数逐一对上 §3.2)。
- [ ] 掩码未被当作训练样本(*-d.bmp 已过滤)。
- [ ] 划分协议书面化:折数、种子、分层键、是否聚类级。
- [ ] 预处理策略书面化:resize 或 zero-pad,目标尺寸。
- [ ] 指标含 balanced accuracy、宏平均 F1、逐类召回率与混淆矩阵。
- [ ] 引用的历史数字注明其原始协议(见 §8.1 各行)。
- [ ] Limitations 含选择偏倚(丢弃不一致样本)与单中心声明。
- [ ] 数据获取路径与日期记录在案(官方无版本号)。
§6 AI 就绪指南
§6.0 环境准备
本数据集体量小(85 MB),本地 CPU 环境即可完成全部预处理与小模型训练;无需云端启动器。推荐环境:Python 3.10+、PyTorch 2.x、OpenCV、scikit-learn。由于官方仅提供下载页直链,首次使用请手动下载 smear2005.zip 并解压(见 §6.2)。
# 最小环境安装(CPU 版 PyTorch 即可完成本文全部示例)
pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu
pip install opencv-python-headless scikit-learn numpy
硬件基线:8 GB 内存、双核 CPU、约 2 GB 磁盘(数据 + 解压 + 缓存)。若需微调较大骨干网络(EfficientNet-B2 以上),建议一张 4 GB 显存以上的 GPU。
§6.1 快速上手
# 目录结构预期(data_root 指向 smear2005.zip 解压目录,含 7 个类别文件夹,
# 每个文件夹内原图 *.bmp 与掩码 *-d.bmp 混放):
# data_root/
# ├── normal_superficiel/ (74 图) ├── mild_dysplasia/ (182 图)
# ├── normal_intermediate/ (70 图) ├── moderate_dysplasia/ (146 图)
# ├── normal_columnar/ (98 图) ├── severe_dysplasia/ (197 图)
# └── carcinoma_in_situ/ (150 图)
# 最小可用子集:任选 2 个文件夹(如 normal_intermediate 与 carcinoma_in_situ)
# 即可跑通"加载-可视化-训练"全流程;data_root 直接拼接文件夹名,无需额外索引文件。
from pathlib import Path
import cv2
import numpy as np
data_root = Path("data_root") # smear2005.zip 解压目录
CLASSES = ["normal_superficiel", "normal_intermediate", "normal_columnar",
"mild_dysplasia", "moderate_dysplasia", "severe_dysplasia",
"carcinoma_in_situ"]
def load_pair(path: Path):
"""读取一个细胞:返回 RGB 原图与三值掩码(0 背景 / 1 胞质 / 2 核)。"""
img = cv2.cvtColor(cv2.imread(str(path)), cv2.COLOR_BGR2RGB)
mask = cv2.imread(str(path.with_name(path.stem + "-d.bmp"))) # BGR 读取
blue = mask[:, :, 0] # 标记区位于蓝色通道
out = np.zeros_like(blue, dtype=np.uint8)
out[(blue > 0) & (blue < 255)] = 1 # 细胞质(示例阈值,需按实际标定调整)
out[blue == 255] = 2 # 细胞核
return img, out
for cls in CLASSES: # 清点数据量并验证掩码成对存在
files = sorted((data_root / cls).glob("*.bmp"))
images = [f for f in files if not f.stem.endswith("-d")]
masks = [f for f in files if f.stem.endswith("-d")]
print(cls, len(images), "images /", len(masks), "masks")
§6.2 数据获取
| 步骤 | 操作 |
|---|---|
| 1 | 打开官方下载页 http://mde-lab.aegean.gr/index.php/downloads/ |
| 2 | 下载 smear2005.zip(85.17 MB,本词条主数据)与 norup2005.zip(3.17 MB,特征包,可选) |
| 3 | 解压至本地 data_root;无需注册、无需申请、无需签署协议 |
| 4 | 若页面迁移,可经 DTU Orbit 论文页溯源至当前托管地址 |
# 手动下载后校验解压完整性(官方未提供哈希值,建议自行留存记录)
unzip -q smear2005.zip -d data_root
find data_root -name "*.bmp" | wc -l # 应为 1834(917 原图 + 917 掩码)
使用提醒:官方要求引用当前链接与相关研究(Jantzen et al., 2005);再次分发时请保留官方出处。
获取渠道提示:网络上存在大量第三方镜像与再打包版本(Kaggle、HuggingFace 等),其掩码格式、文件夹命名甚至类别定义可能已被改动,不建议用于正式实验;正式研究一律以 MDE-Lab 页面的原始包为准,并在论文中注明下载日期。
§6.3 预处理全流程
# 流程:成对读取 → 掩码解析(蓝色通道)→ ROI 裁剪 → 尺寸归一(两种策略)→ 归一化
import cv2
import numpy as np
def preprocess(img_path, mask_path, strategy="resize", target=224):
img = cv2.cvtColor(cv2.imread(str(img_path)), cv2.COLOR_BGR2RGB)
mask = cv2.imread(str(mask_path))[:, :, 0] # 蓝色通道
ys, xs = np.where(mask > 0) # ROI:掩码非零区外接框
y0, y1, x0, x1 = ys.min(), ys.max(), xs.min(), xs.max()
img_roi = img[max(0, y0-4):y1+4, max(0, x0-4):x1+4] # 4 px 余量
if strategy == "resize": # 策略 A:直接 resize(快,会形变)
out = cv2.resize(img_roi, (target, target))
else: # 策略 B:零填充成方阵(保长宽比)
h, w = img_roi.shape[:2]
s = max(h, w)
canvas = np.zeros((s, s, 3), dtype=np.uint8)
canvas[:h, :w] = img_roi
out = cv2.resize(canvas, (target, target))
return out.astype(np.float32) / 255.0
# 经验:文献中 224×224、300×200、512×512 与 zero-pad 方阵并存;
# 细胞长宽比信息本身有判别价值,resize 形变会抹掉它——两种策略都应报告结果。
§6.4 PyTorch DataLoader
# 完整可运行:7 类分类的 Dataset + transform + DataLoader
from pathlib import Path
import torch
from torch.utils.data import Dataset, DataLoader
from torchvision import transforms as T
class HerlevDataset(Dataset):
CLASSES = ["normal_superficiel", "normal_intermediate", "normal_columnar",
"mild_dysplasia", "moderate_dysplasia", "severe_dysplasia",
"carcinoma_in_situ"]
def __init__(self, root, tf=None):
self.items, self.tf = [], tf
for label, cls in enumerate(self.CLASSES):
for p in (Path(root) / cls).glob("*.bmp"):
if not p.stem.endswith("-d"):
self.items.append((p, label))
def __len__(self):
return len(self.items)
def __getitem__(self, i):
p, y = self.items[i]
img = cv2.cvtColor(cv2.imread(str(p)), cv2.COLOR_BGR2RGB)
if self.tf:
img = self.tf(img)
return img, y
tf = T.Compose([T.ToPILImage(), T.Resize((224, 224)), T.ToTensor()])
ds = HerlevDataset("data_root", tf=tf)
loader = DataLoader(ds, batch_size=32, shuffle=True, num_workers=4)
for x, y in loader: # x: (32,3,224,224), y: (32,)
break
§6.5 坑点
⚠️ 坑点 1:图像与掩码混放 + 文件名陷阱 + 法语拼写文件夹(分类:工程陷阱)
问题:原图
*.bmp与掩码*-d.bmp混在同一类别文件夹,简单glob("*.bmp")会把掩码当训练样本读入;类别文件夹名normal_superficiel是法语拼写(少一个 u),硬编码英式拼写会直接报"文件夹不存在"。
症状:样本数翻倍(约 1,834 而非 917);训练损失莫名异常;或 DataLoader 初始化即 FileNotFoundError。
解决:
- 简单方法:过滤
p.stem.endswith("-d")区分原图与掩码,掩码路径用p.with_name(p.stem + "-d.bmp")推导。- 进阶方法:启动时断言每个原图都有成对掩码且数量等于类别元数据(74/70/98/182/146/197/150),不一致即抛异常终止。
- SOTA 方法:建立一次性的 manifest.csv(相对路径、7 类标签、2 类标签、图像宽高),此后所有实验只读 manifest,杜绝路径拼写问题复发。
参考:https://github.com/sarah-antillia/ImageMask-Dataset-Pap-Smear(社区对混放结构与-d命名的处理)
⚠️ 坑点 2:掩码是 24 位 BMP、标记区在蓝色通道且含 4 类标签(分类:预处理陷阱)
问题:掩码不是单通道索引图,而是与原图同尺寸的 24 位 BMP;标记信息存放在蓝色通道,且包含背景/细胞质/细胞核/未知 4 个标签。按灰度图直读或按 RGB 均值阈值都会得到错误分割。
症状:掩码可视化全黑或全白;算出的核质面积比恒为常数;分割 IoU 异常低。
解决:
- 简单方法:只取蓝色通道
mask[:, :, 0](OpenCV 的 BGR 顺序下为第 0 通道),再按像素值区间拆分 4 类。- 进阶方法:先统计全库蓝色通道的像素值直方图确定实际编码区间(不同镜像可能有差异),写入配置文件后再解析;"未知"区按社区惯例并入背景。
- SOTA 方法:解析结果抽样 5% 人工目检(叠加原图半透明着色),并保存解析后的单通道 PNG 作为缓存,杜绝重复踩坑。
参考:https://github.com/sarah-antillia/ImageMask-Dataset-Pap-Smear;FACTS 记录的 4 标签语义
⚠️ 坑点 3:无官方划分 + 细胞级随机划分导致泄漏(分类:数据泄漏)
问题:数据集无官方 train/test 划分,也不提供患者/涂片编号;细胞级随机划分会让同一涂片的"兄弟细胞"跨越训练/测试集,模型记住的是涂片风格而非细胞形态。
症状:2 类任务轻易达到 98%+,但换一批新涂片即大幅掉点;不同论文间数字差异悬殊且互相无法复现。
解决:
- 简单方法:固定随机种子 + 按 7 类分层 5 折 CV,并明确声明"细胞级划分"。
- 进阶方法:用图像统计特征(色调直方图)做 KMeans 聚类生成"伪涂片组",保证同组细胞不跨折,近似涂片级划分。
- SOTA 方法:同时报告细胞级随机与聚类级划分两套结果并标注差距——这正是 Lin et al.(2019)指出患者级划分性能明显更低的可复现替代方案。
参考:Lin et al., 2019, IEEE Access(https://ieeexplore.ieee.org/document/8723334)
⚠️ 坑点 4:类别不平衡 242:675 且 7 类占比 8%-22%(分类:偏倚陷阱)
问题:二分类下异常:正常 ≈ 2.8:1,7 类下最少类 74 张、最多类 197 张;不加处理时模型偏向多数类。
症状:总体准确率好看但正常类召回率低——这恰是筛查场景最危险的失败方向(漏诊)。
解决:
- 简单方法:CrossEntropyLoss 传
weight,权重取各类频率倒数。- 进阶方法:DataLoader 用
WeightedRandomSampler重采样 + 评估改用逐类召回率与宏平均 F1;对最少类做安全增强(见 §6.6)。- SOTA 方法:报告 balanced accuracy 与 confusion matrix,并以"正常类召回率不低于 x%"为模型验收线,而非总体准确率。
参考:类别构成见 https://peerj.com/articles/cs-457/
⚠️ 坑点 5:图像尺寸不一,resize 会摧毁形态学信号(分类:预处理陷阱)
问题:原始 BMP 约 71×59 至 490×474 像素不等,且细胞长宽比差异显著;直接 resize 到方阵会形变核质比例——而核质比正是分类的关键形态学特征。
症状:不同预处理策略下同一模型准确率差好几个点;消融实验结论不稳定。
解决:
- 简单方法:ROI 裁剪后统一 resize 到 224×224,作为基线。
- 进阶方法:zero-pad 成方阵再 resize(保持长宽比),或按 0.201 µm/pixel 换算物理尺寸后等比缩放,使像素尺度跨图一致。
- SOTA 方法:双策略各跑一套完整实验并报告差异——文献中 224×224、300×200、512×512、zero-pad 并存且结果互有高低,差异本身就是应报告的实验结论。
参考:https://arxiv.org/html/2105.07402v2(resize 策略与长宽比影响)
⚠️ 坑点 6:柱状细胞与重度不典型增生/原位癌核形态相近(分类:标签理解)
问题:柱状(正常)细胞与重度不典型增生、原位癌细胞的细胞核尺寸接近(文献报告 SCCIS 与柱状细胞核尺寸相似),7 类任务中最深的混淆对就出现在这里;且数据集本身的类边界定义即不清晰。
症状:confusion matrix 中 normal_columnar ↔ severe_dysplasia / carcinoma_in_situ 呈双向高混淆;7 类准确率远低于 2 类且难以提升。
解决:
- 简单方法:接受 7 类 61%-71% 的历史区间,把报告重点放在 2 类筛查与"异常细分"两个二级指标上。
- 进阶方法:输出 per-pair 混淆分析,专门报告"正常 vs 异常"聚合后的柱状/重度混淆率,证明模型瓶颈在类边界而非特征提取。
- SOTA 方法:在特征空间对混淆对做可解释性分析(如核面积、染色质纹理的分布重叠度),并在论文中明确讨论该数据集的类边界模糊属性。
参考:https://dx.doi.org/10.1177%2F15330338221134833(SCCIS 与柱状细胞核尺寸相似)
⚠️ 坑点 7:不一致样本被丢弃引入选择偏倚(分类:偏倚陷阱)
问题:标注协议规定两名细胞技师意见不一致的细胞直接丢弃——被丢弃的恰是真实筛查中最难、最有临床价值的边界样本。留下的 917 张因此系统性偏向"清晰可判"的细胞。
症状:模型在 Herlev 上表现优异,面对真实涂片中大量"灰色地带"细胞时置信度失真;临床医生反馈"模型过度自信"。
解决:
- 简单方法:在论文 Limitations 中明确声明该选择偏倚及其方向。
- 进阶方法:训练时引入标签平滑或深度集成,压低对边界样本的过度自信;报告置信度校准曲线(ECE)。
- SOTA 方法:把"不确定度输出"作为一等公民——用 MC Dropout 或集成方差识别疑似被丢弃的边界样本,转人工复核,模拟真实筛查分流。
参考:Jantzen & Dounias 2006(class membership is not clearly defined;不一致即丢弃协议)
⚠️ 坑点 8:在不平衡数据上误用总体准确率 + 误读 61.1% 基线(分类:评估误用)
问题:官方基线 61.1% 是 7 类最小距离分类器的总体准确率;在 8%-22% 的类别占比下,总体准确率会被多数类主导。后来者常把"我的模型 90%"与"基线 61.1%“直接对比并宣称巨大进步——两者协议未必一致。
症状:论文审稿被质疑"与基线协议不同、不可比”;或模型总体准确率 90% 但浅层鳞状类召回率不足 50% 却未被发现。
解决:
- 简单方法:任何结果同时报告宏平均指标与逐类召回率,绝不只报总体准确率。
- 进阶方法:复现官方最小距离分类器作为同协议锚点,再与自己的模型对比;引用他人数字时逐篇核对划分协议(Chankong 2014 的 93.78% 与 Lin 2019 的 64.5% 协议不同,不可直接排序)。
- SOTA 方法:建立协议卡片(划分方式、预处理、指标定义、种子数)随结果一并发布,让排行榜可比性成为方法论的一部分。
参考:Lin et al., 2019(协议差异声明);官方基线见 Jantzen et al., 2005
§6.6 数据增强
| 类别 | 手段 | 理由 |
|---|---|---|
| 安全 ✅ | 水平/垂直翻转、90° 旋转、±10% 缩放 | 细胞无方向语义,旋转不改变标签 |
| 安全 ✅ | 小幅亮度/对比度抖动(±10%) | 模拟显微镜光照波动 |
| 安全 ✅ | 灰度域随机 gamma(γ ∈ [0.8, 1.2]) | 模拟相机曝光差异,不破坏色相结构 |
| 危险 ❌ | 大幅色相偏移 | Pap 染色色调本身携带判别信息(核品红/质青绿),过度偏移制造假样本 |
| 危险 ❌ | 强弹性形变/大幅仿射 | 直接改变核质比与核形态——这是分类的核心特征,形变等于篡改标签 |
| 危险 ❌ | 强噪声/模糊 | 破坏染色质纹理与核膜细节,而纹理正是重度异型增生的判别依据 |
| 危险 ❌ | 对掩码使用与原图不同步的几何变换 | 图像-掩码必须同参数同步变换,否则分割真值错位 |
§6.7 模型推荐
| 模型 | 适用任务 | 理由 | 参考性能 |
|---|---|---|---|
| 最小距离/SVM + 20 维特征 | 7 类基线复现 | 与官方基线同协议,建立锚点 | 官方 61.1%(7 类) |
| ResNet-18 | 2 类/7 类入门 | 917 张小数据不易过拟合 | 文献 2 类 84%-94% 区间 |
| GoogLeNet(5C 变体) | 2/4/7 类 | Lin et al. 2019 的对照结构 | 94.5% / 71.3% / 64.5% |
| ANN(9 特征) | 7 类经典复现 | Chankong et al. 2014 协议 | 93.78%(7 类) |
| DeepPap 式双通道 CNN | 2 类筛查 | 细胞学专用设计 | 98.3%(5 折 CV) |
| 混合深度特征融合 | 7 类冲榜 | Rahaman et al. 2021 路线 | 90.32%(7 类) |
§6.8 硬件需求
| 配置 | 能力 | 说明 |
|---|---|---|
| 笔记本 CPU(8 GB 内存) | 预处理 + 特征分类器 + ResNet-18 训练 | 917 张 224×224 图像全库 < 100 MB 内存占用 |
| 单卡消费级 GPU(4-8 GB) | 全部模型 + 快速消融 | 单 epoch 秒级,完整实验分钟级 |
| 多卡/集群 | 无必要 | 数据规模不匹配,纯属浪费 |
§6.9 评估指标代码
# 不平衡数据的标准评估组合:宏平均 + 逐类召回率 + balanced accuracy
from sklearn.metrics import (balanced_accuracy_score, f1_score,
recall_score, confusion_matrix)
def evaluate(y_true, y_pred, n_classes=7):
return {
"overall_acc": float((np.asarray(y_true) == np.asarray(y_pred)).mean()),
"balanced_acc": balanced_accuracy_score(y_true, y_pred), # 主指标
"macro_f1": f1_score(y_true, y_pred, average="macro"),
"per_class_rec": recall_score(y_true, y_pred,
average=None,
labels=range(n_classes)).tolist(),
"confusion": confusion_matrix(y_true, y_pred,
labels=range(n_classes)).tolist(),
} # 筛查任务验收线:正常类召回率 + 特异度,而非 overall_acc
§6.10 MLOps 笔记
- 固定协议再实验:先把划分(含种子)、预处理策略(resize/pad)、指标定义写进配置文件,任何实验只改配置不改代码。
- 数据版本化:对 smear2005.zip 记录获取日期与自算哈希;官方无版本号,自建 manifest 即事实版本。
- 结果可追溯:每次运行落盘 config + 环境清单 + 混淆矩阵;7 类任务的混淆矩阵是判断模型行为的最低成本诊断物。
- 勿频繁全量重训:数据不更新(2005 年后停更),训练集恒定,重点放在评估协议的一致性而非增量数据管道。
§6.11 二十维特征基线(sklearn)
复现官方基线谱系的最快路径:使用特征数据包(norup2005.zip)中的 20 维数值特征,在固定种子下与 §8.1 的历史数字同协议对标。
# 特征基线:最小距离 / 逻辑回归 / SVM / 随机森林 四件套
# X: (917, 20) 特征矩阵,y: 7 类标签(读取方式取决于特征包内文件布局,
# 官方未提供机器可读字典,列名请对照 Norup 2005 论文手工核对)
import numpy as np
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
from sklearn.linear_model import LogisticRegression
from sklearn.ensemble import RandomForestClassifier
from sklearn.svm import SVC
from sklearn.model_selection import StratifiedKFold, cross_val_score
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
X = np.load("features.npy") # 替换为特征包解析结果
y = np.load("labels.npy") # 7 类整数标签(顺序同 §6.1 CLASSES)
models = {
"min_distance(≈LDA)": LinearDiscriminantAnalysis(), # 近似官方最小距离基线
"logreg": make_pipeline(StandardScaler(), LogisticRegression(max_iter=2000)),
"svm": make_pipeline(StandardScaler(), SVC(kernel="rbf", C=10)),
"rf": RandomForestClassifier(n_estimators=500, random_state=42),
}
cv = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
for name, m in models.items():
acc = cross_val_score(m, X, y, cv=cv, scoring="balanced_accuracy")
print(f"{name:20s} {acc.mean():.4f} ± {acc.std():.4f}")
# 预期:7 类 balanced accuracy 落在 50%-70% 区间;显著高于官方 61.1% 时
# 先检查是否存在信息泄漏(特征是否在划分前参与了任何统计量计算)。
§6.12 端到端训练与评估脚本
# 从 §6.4 的 HerlevDataset 出发:类权重训练 + 每折评估 + 混淆矩阵落盘
import numpy as np
import torch
import torch.nn as nn
from collections import Counter
from torch.utils.data import DataLoader
from torchvision import models
from sklearn.metrics import balanced_accuracy_score, confusion_matrix
from sklearn.model_selection import StratifiedKFold
ds = HerlevDataset("data_root", tf=tf) # 复用 §6.4 定义
counts = Counter(y for _, y in ds.items) # 7 类计数
w = torch.tensor([len(ds) / (7 * counts[c]) for c in range(7)],
dtype=torch.float32) # 频率倒数类权重
crit = nn.CrossEntropyLoss(weight=w)
y_true_all, y_pred_all = [], []
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
labels = [y for _, y in ds.items]
for fold, (tr, va) in enumerate(skf.split(np.zeros(len(ds)), labels)):
tr_loader = DataLoader(torch.utils.data.Subset(ds, tr),
batch_size=32, shuffle=True, num_workers=4)
va_loader = DataLoader(torch.utils.data.Subset(ds, va),
batch_size=64, shuffle=False, num_workers=4)
net = models.resnet18(weights=None) # 小数据,从零或轻量预训练均可
net.fc = nn.Linear(net.fc.in_features, 7)
opt = torch.optim.AdamW(net.parameters(), lr=1e-4, weight_decay=1e-4)
for epoch in range(10):
net.train()
for x, y in tr_loader:
opt.zero_grad()
crit(net(x), y).backward()
opt.step()
net.eval()
with torch.no_grad():
for x, y in va_loader:
y_true_all += y.tolist()
y_pred_all += net(x).argmax(1).tolist()
print("balanced acc:", balanced_accuracy_score(y_true_all, y_pred_all))
print(confusion_matrix(y_true_all, y_pred_all)) # 重点检查柱状 ↔ 重度/原位癌混淆
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 双人标注不一致的细胞被直接丢弃,边界样本系统性缺失,入库样本偏向"清晰可判" | 高 | 论文明确声明;输出置信度/不确定度并设人工复核通道(见坑点 7) |
| 类别不平衡 | 正常 242 vs 异常 675;7 类占比 8%-22% | 中 | 类权重/重采样 + balanced accuracy 验收(见坑点 4) |
| 单中心偏倚 | 全部样本来自 Herlev 大学医院一家机构 | 高 | 跨库评估(SIPaKMeD 等),报告协议差异 |
| 年代偏倚 | 20 世纪 90 年代传统制片与染色,与当代液基制片(LBC)存在系统差异 | 高 | 不直接外推到现代制片流程;用新数据微调 |
| 泄漏偏差 | 无患者/涂片编号,细胞级随机划分高估性能 | 高 | 聚类级划分 + 双协议报告(见坑点 3) |
| 评估偏差 | 无官方划分导致各文献协议不一,排行榜数字不可直接比较 | 中 | 复现同协议基线锚点(见坑点 8) |
§7.2 标注质量
优势:双人判读 + 医生复核 + 不一致丢弃的三重协议在同期数据集中相当严格,入库标签的可信度高;掩码由商业软件 CHAMP 生成,边界质量稳定。局限:丢弃协议的代价是"标注质量"与"样本代表性"被隐性交换;官方未披露丢弃数量、Kappa 统计与医生复核比例,标注一致性无法量化复核。使用建议:把 7 类标签视为"强但偏乐观"的真值,把掩码视为"软件级"真值而非病理医师逐像素描画的金标准。
具体到两类任务:分类标签经双人交叉验证,用于训练与评估的噪声风险低;掩码由软件自动生成,直接当 IoU 金标准时要留有余量——做分割研究时建议先对 5%-10% 样本做人工边界复核,报告"人工复核后的掩码质量"作为附加结论。
§7.3 泛化性评估
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 同库新涂片 | 中 | Lin et al. 2019:患者级划分性能明显低于随机划分 |
| 跨染色实验室 | 高 | 单中心数据,染色风格(色调深浅)成为潜在捷径特征 |
| 液基制片(LBC) | 高 | 数据集为传统涂片;背景杂质与细胞分散度分布不同 |
| 数字化扫描仪差异 | 高 | 显微相机采集(0.201 µm/pixel)与 WSI 扫描的分辨率、色彩管线不同 |
| 真实筛查流(低患病率) | 极高 | 库内异常占比 73.6% 远高于真实筛查阳性率,PPV 不可外推 |
| 跨病种/跨器官细胞 | 极高 | 数据仅含宫颈上皮细胞,形态学先验不可迁移到其他标本类型 |
§7.4 伦理
数据为回溯性采集的脱敏单细胞图像,不含患者身份、人口学或临床随访信息,公开 20 余年无已知伦理争议。原始协议应当已获得医院层面的知情同意与伦理许可(细节官方未披露)。使用者仍应遵守官方引用要求,并避免任何将数据用于个体诊断声明的做法。
§7.5 公平性
数据集不含人口学标签,无法做亚组公平性分析——这本身是需要声明的局限:模型的跨人群(年龄、种族、地域)表现完全未知。单中心丹麦来源意味着任何跨人群部署前必须重新收集代表性数据并做亚组审计。
另外两点值得注意:其一,标注者群体(两名细胞技师 + 医生)代表单一实验室的判读传统,标签本身可能携带机构级判读风格;其二,若模型学到的是染色风格捷径而非形态学,那么在其他人群染色差异下失效的概率更高——公平性审计应包含"染色风格 → 预测"的敏感性检验。
§7.6 数据漂移
数据集 2005 年后停更,本身无版本漂移;但"世界已漂移"——HPV 疫苗接种改变病变谱系、液基制片与计算机辅助筛查改变图像风格、HPV 检测分流改变了细胞学判读的角色。把 Herlev 训练的模型视为"传统涂片时代的形态学基线",而非当前筛查工作流的镜像。
工程上的对策是"分层冻结":把 Herlev 上训练的模型定位为方法学验证层,进入真实工作流前用当代 LBC 图像重训或域自适应微调;监控指标方面,染色色调分布(HSV 直方图)与核质面积比分布是两个低成本漂移哨兵,分布偏移超阈值即触发复核。
§7.7 DAIMS 数据质量评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 特征包为标准表格,每细胞一行 |
| 2 | 唯一标识 | ⚠️ | 仅有文件名级标识,无患者/涂片/视野 ID |
| 3 | 特殊字符 | ⚠️ | 文件夹名 normal_superficiel 为法语拼写;掩码 -d 后缀易误读 |
| 4 | 重复行 | ✅ | 未见重复样本报告 |
| 5 | 缺失编码 | ✅ | 图像、掩码、特征均无缺失值 |
| 6 | 标签标识 | ✅ | 类别由文件夹名确定,7 类映射无歧义 |
| 7 | 罕见类分组 | ⚠️ | 最少类 74 张(8%),需重采样或类权重 |
| 8 | 偏倚评估 | ✅ | 不平衡与选择偏倚均有同行评审讨论 |
| 9 | 数据字典 | ⚠️ | 20 维特征语义散见于论文,无机器可读字典 |
| 10 | 信息性缺失解释 | ✅ | 掩码"未知"区语义明确,社区有统一处理惯例 |
| 11 | 设备记录 | ⚠️ | 仅记录 0.201 µm/pixel,显微镜与相机型号未披露 |
| 12 | 共线性 | ⚠️ | 20 维形态/光密度特征高度相关,特征选择文献即为此而生 |
| 13 | 编码映射 | ✅ | 7 类 → 2 类/4 类聚合规则明确 |
| 14 | 时间戳处理 | ❌ | 无任何采集时间元数据 |
| 15 | 划分建议 | ⚠️ | 无官方划分;社区协议多样,须自建并声明 |
| 16 | 泄漏讨论 | ✅ | 细胞级 vs 患者级泄漏有同行评审论证(Lin et al. 2019) |
| 17 | 标签分布 | ✅ | 7 类计数与占比完全公开 |
| 18 | 测量偏倚 | ⚠️ | 单中心、单相机、90 年代制片,测量条件单一 |
| 19 | 外部验证建议 | ⚠️ | 官方无跨库基准,跨库协议需自行搭建 |
| 20 | 版本记录 | ✅ | 旧库 500 张 / 新库 917 张的演化链清晰可考 |
| 21 | 预处理脚本 | ❌ | 官方未提供,依赖社区工程与本文档 §6 |
| 22 | 合规要求 | ⚠️ | 免费开放但无正式许可文本,仅引用要求 |
| 23 | 多模态对齐 | ✅ | 图像-掩码经 -d 后缀一一对应,结构完整 |
| 24 | 去标识化 | ✅ | 单细胞裁剪,不含任何患者身份信息 |
DAIMS 评分:17.0 / 24(✅ 12 项 · ⚠️ 10 项 · ❌ 2 项)
评分解读:Herlev 在"内容完整性"维度表现优秀——标签、掩码、特征、类别分布一应俱全且可考证,泄漏与偏倚问题因 20 年的文献积累反而成为"被讨论得最充分"的公开基准之一。失分集中在"元数据与工程配套"维度:无时间戳、无设备型号、无官方划分、无预处理脚本、无正式许可文本,这些都要使用者自行补齐。
对你意味着什么:第一天就要做四件事——按 §6.1 校验 917 对图像/掩码的完整性;建立 manifest.csv 顶替缺失的患者级标识;把划分协议与种子写进配置以顶替官方划分缺失;用类权重 + balanced accuracy 对冲 242:675 的不平衡。若项目要求合规审计,注意"无正式许可文本"需法务确认引用要求即可满足,而非寻找不存在的许可证文件。
§7.8 外部验证与跨协议稳健性矩阵
诚实声明:该数据集不存在严格意义的"外部验证"——官方未提供第二个数据集上的基准,社区也没有标准化的跨库协议;下表收录的是有同行评审支撑的同库跨协议稳健性证据,并把"划分组织方式"视为最重要的泛化变量。真实外部验证(如迁移到 SIPaKMeD 或现代 LBC 数据)需由使用者自行搭建并报告。
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 同库患者级/分组织划分 | Lin et al. 2019, IEEE Access | 2/4/7 类 | 94.5% / 71.3% / 64.5%(随机划分) | 患者级组织后明显更低 | 细胞级随机划分存在乐观偏差 |
| 同库 5 折交叉验证 | Zhang et al. 2017(DeepPap), IEEE JBHI | 2 类 | 98.3%,AUC 0.99 | — | 仍为细胞级,未消除涂片同质性 |
| 同库 hold-out | Chankong et al. 2014, CMIG | 7 类 | 93.78% | — | 与随机划分协议不同,数字不可直接排序 |
| 跨库(SIPaKMeD 等) | 官方未提供 | — | — | — | 无同行评审跨库基准;迁移协议需自行搭建 |
§8 基准性能与生态
§8.1 排行榜
二分类(正常 vs 异常)——各条目划分协议不同,数字不可直接比较(Lin et al. 2019 明确声明):
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | ANN(9 特征) | 99.27%(Rec 99.85% / Sp 96.53%) | 2014 | FCM 分割 + 特征选择 + ANN | Chankong, T. et al., 2014, Computerized Medical Imaging and Graphics. https://www.sciencedirect.com/science/article/pii/S0169260713004021 | 未公开 |
| 2 | DeepPap | 98.3%(AUC 0.99,5 折 CV) | 2017 | 双通道 CNN(FCN + GLCM) | Zhang, L. et al., 2017, IEEE JBHI. DOI 10.1109/JBHI.2017.2705583 | arXiv 1801.08616 |
| 3 | GoogLeNet-5C | 94.5% | 2019 | GoogLeNet 变体微调 | Lin, H. et al., 2019, IEEE Access. https://ieeexplore.ieee.org/document/8723334 | 未公开 |
| 4 | DenseNet161 | 94.38% | 2019 | ImageNet 预训练微调 | Promworn, A. et al., 2019(转引自 Kurnianingsih et al. 2020, J. Imaging 6(11):121) | 未公开 |
| 5 | CNN(Bora et al.) | 94%(F1 0.90) | 2016 | CNN + CLAHE 预处理 | Bora, K. et al., 2016(转引自 Pirovano et al. 2021, Medical Image Analysis 综述) | 未公开 |
| 6 | Mask R-CNN + compact VGG | 灵敏度 >96%(±2.8%) | 2020 | 分割 + 分类两段式 | Kurnianingsih et al., 2020, J. Imaging 6(11):121. https://www.mdpi.com/2313-433X/6/11/121 | 未公开 |
| 7 | ResNet | 84.45% | 2017 | ResNet 迁移学习 | Forslid, G. et al., 2017(转引自 Pirovano et al. 2021 综述) | 未公开 |
七分类(3 正常 + 4 异常):
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | ANN(9 特征) | 93.78%(Rec 98.96% / Sp 96.69%) | 2014 | 同上协议 | Chankong, T. et al., 2014, CMIG. 同上链接 | 未公开 |
| 2 | Xception 变体 | 90.42% | 2025 | Xception 迁移学习 | Scientific Reports, 2025. DOI 10.1038/s41598-025-10009-x(排行榜表) | 未公开 |
| 3 | 混合深度特征融合 | 90.32% | 2021 | 多 CNN 特征拼接 + SVM | Rahaman, M. M. et al., 2021(数字转引自 Sci Rep 2025 排行榜表) | 未公开 |
| 4 | DenseNet161 | 68.54% | 2019 | 端到端多分类 | Promworn, A. et al., 2019(转引自 Kurnianingsih et al. 2020) | 未公开 |
| 5 | GoogLeNet-5C | 64.5%(4 类 71.3%) | 2019 | 同上协议 | Lin, H. et al., 2019, IEEE Access. 同上链接 | 未公开 |
| 6 | 最小距离分类器(官方基线) | 61.1% | 2005 | 20 维特征 + 最小距离 | Jantzen, J. et al., 2005, Proc. NiSIS 2005, pp. 1-9 | 未公开 |
§8.1b 官方基线 61.1% 的正确解读
官方基线常被误读为"20 年前的最低水平"。三个事实还原其语境:其一,61.1% 是 7 类任务——难度远高于被广泛引用的 2 类任务;其二,它来自最小距离分类器,是刻意保守的参照点,Jantzen & Dounias(2006)随后的特征选择与蚁群优化等高级方法已可把错误率压到 1%-2%(即 7 类准确率 98% 量级,但为留一法等乐观协议下的结果);其三,它没有与任何深度学习共享划分协议。因此正确用法是:把它当作"同协议复现的锚点"(§6.11 的 LDA 近似),而非用来衬托深度模型进步的稻草人。
§8.2 SOTA 总结与选型建议
两条曲线讲清全部历史:2 类筛查已饱和——2014 年 ANN 即达 99.27%,深度学习时代普遍 94%-98%,继续刷分已无信息量,价值转向协议透明化与患者级划分下的诚实评估;7 类分级仍是真问题——最好数字停在 93%-94%,传统端到端 CNN 只有 61%-71%,柱状/重度/原位癌的形态重叠(坑点 6)加上类边界模糊(坑点 7)构成根本瓶颈。选型建议:做筛查概念验证选 ResNet-18 或 DenseNet 变体;做分级研究先复现 Chankong 的特征方案(93.78%)再做特征融合(Rahaman 路线);任何情况下先声明划分协议再引用他人数字。
小数据训练要点(917 样本规模):优先轻量骨干(ResNet-18/EfficientNet-B0)而非大模型微调;学习率取 1e-4 量级并配早停;把 5 折 × 3 种子的均值 ± 标准差作为最低报告标准——单次随机划分在 900 量级样本上的指标波动足以淹没方法差异;预训练权重可用但需在论文中声明,因为 ImageNet 自然图像到显微细胞域差距大,预训练收益不稳定。
§8.3 评测协议建议
- 任务定义:7 类与 2 类分开报告;4 类协议须注明聚合边界。
- 划分:分层 5 折 CV × 3 种子;有条件者追加"聚类级(伪涂片)"划分。
- 预处理:写明 resize 或 zero-pad 策略(坑点 5)。
- 指标:balanced accuracy、宏平均 F1、逐类召回率、混淆矩阵四件套;2 类补特异度与 AUC。
- 引用纪律:凡引用历史数字,逐篇核对协议后再排座次。
- 消融报告:预处理策略(resize vs zero-pad)作为独立消融维度而非固定选择。
- 不确定度:报告置信度校准(ECE)或集成方差,对冲丢弃不一致样本造成的过度自信。
§8.4 相关数据集
| 数据集 | 规模 | 模态 | 标注 | 与本数据集的关系 |
|---|---|---|---|---|
| Pap Smear Database(旧库) | 500 张 | 单细胞 Pap 图像 | 7 类 + 掩码 | Herlev 基准的直接前身(同机构、同标签体系) |
| SIPaKMeD | 4,049 张 | 单细胞 Pap 图像 | 5 类 | 更大规模的现代制片数据集,常用作跨库外部验证 |
| Cervix93 | 93 张 | 宫颈涂片图像 | 细胞核分割标注 | 小规模分割对照集 |
| TBS 体系现代液基数据集 | 各异 | LBC 图像 | TBS 分类 | 表征"当前时代"的制片与标签体系,适合做漂移对照 |
§8.5 关键论文 Top 10
- Jantzen, J., Norup, J., Dounias, G., Bjerregaard, B. (2005). “Pap-smear Benchmark Data For Pattern Classification.” Proc. NiSIS 2005, Albufeira, Portugal, pp. 1-9. — 数据集出生证明:规模、类别构成、标注协议与官方基线。
- Jantzen, J., Dounias, G. (2006). “Analysis of Pap-smear Image Data.” NiSIS 2006 / Ørsted•DTU Report 2886. — 姊妹篇:系统分析 20 维特征、最小距离分类器错误率约 6% 与高级方法 1-2% 的差距,并直言类边界不清。
- Norup, J. (2005). 丹麦技术大学硕士论文(特征数据包 norup2005.zip 随库发布). — 20 维数值特征的权威出处。
- Marinakis, Y. et al. (2008). — 独立确认两代库的 917/500 张构成。https://dias.library.tuc.gr/view/53660
- Chankong, T. et al. (2014). Computerized Medical Imaging and Graphics. — FCM 分割 + ANN 的经典方案,2 类 99.27% / 7 类 93.78%,至今仍是 7 类最高档数字。
- Zhang, L. et al. (2017). “DeepPap: Deep Convolutional Networks for Cervical Cell Classification.” IEEE JBHI. DOI 10.1109/JBHI.2017.2705583. — 深度学习路线的标志性结果:2 类 98.3%(5 折 CV)。
- Forslid, G. et al. (2017). — ResNet 迁移学习对照(2 类 84.45%),显示端到端深度学习早期并不占优。
- Lin, H. et al. (2019). IEEE Access. https://ieeexplore.ieee.org/document/8723334 — 方法论转折点:GoogLeNet-5C 三档结果(94.5/71.3/64.5%)与"划分协议决定数字可比性"的明确声明。
- Kurnianingsih et al. (2020). J. Imaging 6(11):121. — Mask R-CNN 分割 + 紧凑 VGG 分类的两段式方案与多篇历史结果的汇编参照。
- Scientific Reports (2025). DOI 10.1038/s41598-025-10009-x. — 最新一代 Xception 变体(7 类 90.42%)并整理完整历史排行榜。
§8.6 社区活跃度
原始论文 Semantic Scholar 引用 285+ 次(截至 2026-09);2005-2025 年间持续有新论文在其上报告结果(2014、2017、2019、2021、2025 均有代表性工作),属于"低引用量、长生命周期"的经典基准。社区工程方面,GitHub 存在掩码重新打包与预处理参考实现(如 ImageMask-Dataset-Pap-Smear 仓库),Kaggle 等平台亦偶有练习用途的转载(非官方,使用时以 MDE-Lab 页面为准)。
值得注意的是其"二手引用"生态:大量论文从不直接使用 917 张图像,仅引用其历史数字作为动机或对照——这使 Herlev 的影响力大于其直接使用量,也意味着引用它时应区分"用数据做实验"与"引用基准数字"两种性质。
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度 | 推荐理由 |
|---|---|---|---|---|
| MDE-Lab 下载页 | 官方托管 | http://mde-lab.aegean.gr/index.php/downloads/ | 持续可访问(截至 2026-09) | 唯一官方下载入口 |
| DTU Orbit 论文页 | 官方收录 | https://orbit.dtu.dk/en/publications/pap-smear-benchmark-data-for-pattern-classification | 稳定 | 论文元数据与引用规范 |
| Jantzen & Dounias 2006 PDF | 姊妹篇全文 | https://backend.orbit.dtu.dk/ws/portalfiles/portal/2528109/oersted-dtu2886.pdf | 稳定 | 特征体系与错误率分析的一手来源 |
| DeepPap PubMed 条目 | 论文 | https://pubmed.ncbi.nlm.nih.gov/28541229/ | 稳定 | 深度学习基线(arXiv 1801.08616) |
| ImageMask-Dataset-Pap-Smear | 社区工程 | https://github.com/sarah-antillia/ImageMask-Dataset-Pap-Smear | 社区维护 | 掩码结构与 -d 命名的现成处理参考 |
| Sci Rep 2025 排行榜表 | 论文 | https://link.springer.com/article/10.1038/s41598-025-10009-x/tables/16 | 稳定 | 一表纵览 2005-2025 全部关键数字 |
§9 相关资源与引用
§9.1 官方资源
- 下载页(图像、掩码、特征包、论文汇编):http://mde-lab.aegean.gr/index.php/downloads/
- DTU Orbit 论文收录页:https://orbit.dtu.dk/en/publications/pap-smear-benchmark-data-for-pattern-classification
- 姊妹篇全文 PDF:https://backend.orbit.dtu.dk/ws/portalfiles/portal/2528109/oersted-dtu2886.pdf
- 联系人:g.dounias[at]aegean[dot]gr(MDE-Lab 页面公布)
§9.2 教程与社区资源
- 社区掩码预处理参考:https://github.com/sarah-antillia/ImageMask-Dataset-Pap-Smear
- 深度学习基线(DeepPap)预印本:arXiv 1801.08616
- 历史排行榜汇总:Sci Rep 2025 论文表 16(https://link.springer.com/article/10.1038/s41598-025-10009-x/tables/16)
- 特征体系与错误率分析(姊妹篇):https://backend.orbit.dtu.dk/ws/portalfiles/portal/2528109/oersted-dtu2886.pdf
- 经典 ANN 方案(Chankong et al. 2014):https://www.sciencedirect.com/science/article/pii/S0169260713004021
- 划分协议可比性讨论(Lin et al. 2019):https://ieeexplore.ieee.org/document/8723334
- 分割 + 分类两段式方案(Kurnianingsih et al. 2020):https://www.mdpi.com/2313-433X/6/11/121
§9.3 BibTeX 完整引用
@inproceedings{jantzen2005papsmear,
title = {Pap-smear Benchmark Data For Pattern Classification},
author = {Jantzen, J. and Norup, J. and Dounias, G. and Bjerregaard, B.},
booktitle = {Proceedings of NiSIS 2005},
address = {Albufeira, Portugal},
pages = {1--9},
year = {2005}
}
@techreport{jantzen2006analysis,
title = {Analysis of Pap-smear Image Data},
author = {Jantzen, J. and Dounias, G.},
institution = {Ørsted·DTU, Technical University of Denmark},
number = {2886},
year = {2006}
}
@article{zhang2017deeppap,
title = {DeepPap: Deep Convolutional Networks for Cervical Cell Classification},
author = {Zhang, L. and others},
journal = {IEEE Journal of Biomedical and Health Informatics},
year = {2017},
doi = {10.1109/JBHI.2017.2705583}
}
§9.4 引用指南
使用本数据集的最小引用义务是 Jantzen et al. (2005);若涉及特征体系或错误率分析,追加 Jantzen & Dounias (2006);若引用基准数字,请同时引用对应论文并注明划分协议。引用本词条时请使用页面 URL(https://www.qianfanghub.com/ai-ready-dataset/herlev-pap/483)。
最小引用集示例:正文只需一句话加两条文献,“We evaluated our method on the Herlev pap-smear benchmark (917 single-cell images, 7 classes) [Jantzen et al., 2005; Jantzen and Dounias, 2006], using stratified 5-fold cross-validation with fixed random seeds.”——数据集名、规模、协议、引用四要素齐全,即可满足复现要求。
§10 AI 使用声明卡
§10.1 AI 模型列表
本词条由 fast-model(CodeBuddy Code 平台)起草,并使用同一模型完成多轮 WebSearch/WebFetch 检索与事实核对。
§10.2 AI 参与范围
AI 负责:资料检索与交叉核验、全文起草、代码示例编写、DAIMS 评估初稿。人工负责:医学编码与流行病学数字复核、来源链接有效性抽查、最终发布决定。全部关键数字均有内联来源链接,可逐项溯源。
边界约定:凡检索结果相互矛盾或无法二次核实的信息(如部分文献报道的图像尺寸范围差异、历史论文的引用数波动),一律采用"官方未披露"或区间化表述,不做单点裁断;代码示例保证语法正确与逻辑自洽,但不承诺在任意环境零修改运行,首次使用请按 §5.7 检查清单走查。
§10.3 输入来源列表
- Jantzen, J., Norup, J., Dounias, G., Bjerregaard, B. (2005). Pap-smear Benchmark Data For Pattern Classification. Proc. NiSIS 2005, Albufeira, Portugal, pp. 1-9.
- Jantzen, J., Dounias, G. (2006). Analysis of Pap-smear Image Data. Ørsted•DTU Report 2886. https://backend.orbit.dtu.dk/ws/portalfiles/portal/2528109/oersted-dtu2886.pdf
- DTU Orbit 论文收录页. https://orbit.dtu.dk/en/publications/pap-smear-benchmark-data-for-pattern-classification
- MDE-Lab(爱琴海大学)官方下载页. http://mde-lab.aegean.gr/index.php/downloads/
- Chankong, T. et al. (2014). Automatic cervical cell segmentation and classification in Pap smears. Computerized Medical Imaging and Graphics. https://www.sciencedirect.com/science/article/pii/S0169260713004021
- Zhang, L. et al. (2017). DeepPap: Deep Convolutional Networks for Cervical Cell Classification. IEEE JBHI. DOI 10.1109/JBHI.2017.2705583. https://pubmed.ncbi.nlm.nih.gov/28541229/
- Lin, H. et al. (2019). IEEE Access. https://ieeexplore.ieee.org/document/8723334
- Kurnianingsih et al. (2020). J. Imaging 6(11):121. https://www.mdpi.com/2313-433X/6/11/121
- Pirovano, A. et al. (2021). Medical Image Analysis(综述,转引 Forslid et al. 2017、Bora et al. 2016). https://perso.telecom-paristech.fr/bloch/papers/MEDIA-2021-AntoinePirovano.pdf
- PeerJ Computer Science, Article 457. https://peerj.com/articles/cs-457/
- Mathematics 10(6):980(MDPI, 2022). https://www.mdpi.com/2227-7390/10/6/980/xml
- Research Square 预印本 rs-3977123. https://www.researchsquare.com/article/rs-3977123/latest.pdf
- Scientific Reports (2025). DOI 10.1038/s41598-025-10009-x. https://link.springer.com/article/10.1038/s41598-025-10009-x
- Semantic Scholar 论文引用统计. https://www.semanticscholar.org/paper/c970014a387d2cbced93f5644eb6150b1adb684c
- Marinakis, Y. et al. (2008). https://dias.library.tuc.gr/view/53660
- sarah-antillia. ImageMask-Dataset-Pap-Smear(GitHub). https://github.com/sarah-antillia/ImageMask-Dataset-Pap-Smear
- WHO 宫颈癌统计(2018 数字,新华社报道). https://www.xinhuanet.com/english/2019-07/18/c_138237191.htm
- PMC8321208(Pap 涂片细胞量等细胞学背景). https://pmc.ncbi.nlm.nih.gov/articles/PMC8321208/
- arXiv 2105.07402(预处理策略与长宽比影响). https://arxiv.org/html/2105.07402v2
- ResearchGate 265873515(双人标注协议细节). https://www.researchgate.net/publication/265873515
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学编码(ICD-11 / SNOMED CT)与流行病学 | 千方病案医学编辑部 | 逐项对照 FACTS.md 与 WHO/ICD-11 来源 | ✅ 已通过/已验证 |
| §3-§4 规格数字与目录结构 | 千方病案医学编辑部 | 逐项对照 FACTS.md 与官方下载页 | ✅ 已通过/已验证 |
| §6 代码与 8 个坑点 | 千方病案医学编辑部 | 工程逻辑走查 + 对照社区工程参考 | ✅ 已通过/已验证 |
| §8 基准数字与引用 | 千方病案医学编辑部 | 逐条对照原始论文/排行榜来源 | ✅ 已通过/已验证 |
| §C JSON-LD 结构 | 千方病案医学编辑部 | 与 frontmatter schema_org 逐字段比对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
全文各章节均由 AI 起草并经人工校验后发布;其中 §2(医学背景)、§7.7(DAIMS)与 §8(基准数字)为高风险模块,已执行上表的逐项校验流程。
风险声明:AI 在起草中遵循"无来源不落笔"原则,凡检索未能核实的字段一律写"官方未披露"并省略对应行;仍建议使用者在二次引用前抽查 §8.1 排行榜数字与其原始论文的一致性——这是全文唯一依赖二手转引(Pirovano 2021 综述与 Sci Rep 2025 排行榜表)的模块。
§10.6 最后人工审核日期
2026-09-05(与 §0.3 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- sipakmed — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学 / 评测基准
- panda — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学
- monuseg — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 评测基准
- paip — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学
- camelyon17 — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 评测基准
- unitopatho — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 评测基准
- nct-crc-he-100k — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 评测基准
- bbbc — 共享标签:医学影像 / 病理图像 / 评测基准
- pcam — 共享标签:医学问答与基准 / 病理图像 / 评测基准
- ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
