信息速览

SIPaKMeD — 宫颈细胞显微图像分类 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | SIPaKMeD |
| 英文全称 | SIPaKMeD(官方名称即为缩写形式,发布方未公开全称展开) |
| 别名/简称 | SipakMed Dataset、SIPaKMeD Pap Smear Dataset |
| 疾病分类(ICD-11 编码+中文名) | 2E66 宫颈上皮内瘤变(筛查终点参照:2B64 宫颈恶性肿瘤;数据集本身不含恶性细胞样本) |
| SNOMED CT | 285636001(Cervical intraepithelial neoplasia,宫颈上皮内瘤变) |
| 数据模态 | 显微细胞图像(宫颈 Pap 染色涂片,静态 2D) |
| AI 任务类型 | 图像分类(5 类细胞形态学)、细胞分割(核/质轮廓重建)、特征工程与迁移学习基准 |
| 样本总数 | 4,049 张单细胞图像 + 966 张簇细胞图像 |
| 数据大小 | 9.71 GB(Kaggle 官方镜像 Version 1,约 21,200 个文件) |
| 数据格式 | BMP 图像 + DAT 轮廓坐标文本 + XLSX 特征表 |
| 许可证 | 公开可用、仅限实验目的、使用须引用 ICIP 2018 论文(Kaggle 标注为 Other) |
| 访问级别 | 开放(Kaggle 账号免费下载,无需申请审批) |
| DUO 标签 | 无正式 DUO 注册;许可条款等效于 NRES(无限制研究使用),商业用途未明确授权 |
| 语言 | 图像数据集(标签目录名与文档为英语) |
| 首发日期 | 2018-10(随 ICIP 2018 论文发布) |
| 最后更新 | 2018-10(Version 1,此后未发布更新版本) |
| 发布机构 | University of Ioannina(约阿尼纳大学;合作机构 NCSR “Demokritos”) |
| 官方主页 | https://cs.uoi.gr/~marina/sipakmed.html |
| 下载地址 | https://www.kaggle.com/datasets/marinaeplissiti/sipakmed |
| DOI | 10.1109/ICIP.2018.8451588 |
| 引用次数 | 434+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 图像、轮廓标注与官方特征集齐全且免费开放;扣分项:无官方 train/test 划分、.dat 轮廓需自行栅格化、无标准化加载脚本 |
| 页面状态 | published |
§0 智能总结与审核声明
§0.1 医学审核声明
本页面的 §2 医学背景(ICD-11/SNOMED CT 编码映射、宫颈癌流行病学与筛查任务定义)及 §7 偏倚与局限性分析已由 [千方病案医学编辑部] 交叉审核。
§0.2 数据工程审核声明
[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
§0.3 审核日期
2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SIPaKMeD 免费开放下载,但官方要求使用者仅将其用于实验目的并在成果中引用 ICIP 2018 论文(DOI: 10.1109/ICIP.2018.8451588)。本页面的 DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? SIPaKMeD 是希腊约阿尼纳大学于 2018 年发布并随 ICIP 2018 论文(Plissiti et al., 2018)公开的宫颈细胞学显微图像数据集。研究者从 966 张高分辨率簇细胞图中手工裁剪出 4,049 张孤立单细胞图像,按形态学分为正常(表层-中层、副基底)、良性(化生细胞)与异常非恶性(HPV 特征性挖空细胞、角化不良细胞)五大类,每个细胞都配有细胞核与细胞质的人工轮廓标注。
为什么重要? 在它之前,公开的单细胞宫颈涂片数据集只有丹麦的 Herlev Pap Smear(917 张);SIPaKMeD 将规模扩大到约 4.4 倍,且是首个同时提供像素级核/质轮廓坐标与官方深度特征集(VGG-19 fc6 与 conv5)的开放宫颈单细胞基准,让分类、分割、特征工程三条研究线都能在同一份数据上展开。
我能用它做什么? 训练五分类宫颈细胞识别模型、用轮廓标注做核/质分割与形态定量研究、复现从 SVM 到 Transformer 的基准论文、或把它作为计算病理学教学素材。注意它不含恶性细胞类别,不能用于癌症诊断模型训练;患者人口学信息官方未披露。
§1.1 摘要
SIPaKMeD 的构建流程:采集常规 Pap 染色宫颈涂片,在 OLYMPUS BX53F 显微镜上以 Infinity 1 Lumenera CCD 相机数字化,专家选出 966 张 2048×1536 像素的簇细胞图;再从这些簇图中手工裁剪 4,049 张仅含单个细胞的 ROI 图像并逐张人工归类到五个形态学类别——表层-中层鳞状细胞(831 张)、副基底层鳞状细胞(787 张)、挖空细胞(825 张)、角化不良细胞(793 张)与化生细胞(813 张)。每张单细胞图附带两条以坐标文本(.dat)保存的人工轮廓:细胞核与细胞质。官方还随数据集发布了每细胞 26 维手工特征(强度/纹理/形状),以及用 VGG-19 提取的 fc6 pre-activations(4,096 维)与 conv5(512 维)深度特征。论文以 5 折交叉验证给出的基线为:仅细胞核 SVM 83.45%、核+质 SVM 91.68%、CNN 95.35%。发布至今引用已超过 434 次(截至 2026-09),五分类准确率的天花板被逐步推至 97% 以上,但它仍是单中心、无官方划分、无恶性类别的筛查辅助研究基准。
一句话画像:规模是 Herlev 的 4.4 倍、标注是同类最多的宫颈单细胞基准,但请把它当"筛查辅助研究数据",不要当"诊断数据"。
§1.2 战略价值分析
规模与标注双重稀缺性维度:宫颈细胞学 AI 的第一道门槛是"既有像素级标注、又有可信类别标签"的数据。Herlev Pap Smear 只有 917 张且无轮廓文件;SIPaKMeD 用 4,049 张单细胞图加双轮廓(核+质)标注填补了这一空缺——研究者可以在同一数据上做监督分类(用类别标签)与分割/形态计量(用轮廓坐标),这种"一份数据、两种监督信号"的设计在 2018 年的细胞学数据集中相当超前,也解释了它引用量持续走高的原因。
基准生态维度:SIPaKMeD 已成为宫颈细胞分类论文的"默认第二数据集"——Austin & Parvathi(2025,Scientific Reports)的 Xception 基线 97.55%、Şentürk & Süleyman(2022)的 SqueezeNet 96.90%、原论文 CNN 95.35% 构成了一条可追溯的成绩序列。对方法学研究者而言,在这条序列上报告新方法比在自建数据上自说自话更有说服力;对工程师而言,它提供了一个体积适中(9.71 GB)、下载即用的真实医学图像训练场。
教学与可复现性维度:数据集的三重监督信号(类别标签、核/质轮廓、官方特征)让它能同时支撑三门课程实验——图像分类入门(用标签)、医学图像分割(用轮廓)、经典机器学习对比(用 26 维手工特征与深度特征做消融)。官方特征集的意义常被低估:它把"2018 年的深度学习特征"固化成了可下载资产,使不配备 GPU 的团队也能复现论文中 94.44% 的 deep fc SVM 路线——这在教学场景中几乎没有门槛成本。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态与制片 | 标注 | 与 SIPaKMeD 的差异化 |
|---|---|---|---|---|
| SIPaKMeD(本词条) | 4,049 单细胞 + 966 簇图 | Pap 涂片显微图像(常规涂片) | 5 类形态学 + 核/质轮廓坐标 | 规模最大;轮廓+特征三重标注 |
| Herlev Pap Smear | 917 张单细胞 | Pap 涂片显微图像 | 7 类(含恶性细胞) | 规模约为本集 1/4.4;唯一含恶性类别的公开单细胞集,常与本集互补使用 |
| ISBI 2014 重叠宫颈细胞分割挑战赛数据 | 数百张重叠细胞簇图 | Pap 涂片显微图像 | 重叠细胞分割标注 | 面向分割而非分类;不含五类语义标签 |
| Mendeley 液基宫颈细胞数据集 | 数百张液基细胞图 | 液基制片(LBC)显微图像 | 含恶性类别的细胞分类 | 制片工艺不同(液基 vs 常规涂片) |
| Cervix93 | 721 张宫颈图像 | 阴道镜图像 | 宫颈类型分类 | 器官级模态,与细胞级数据互补 |
上表均为站外公开数据集的纯文字对照,规模与标注细节以各数据集官方文档为准。
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2018-10 | 初版发布 | 随 ICIP 2018 论文在官方主页公开:4,049 单细胞 + 966 簇图 + 轮廓与特征集 |
| 2021 前后 | Kaggle 官方镜像上线 | 由第一作者本人(marinaeplissiti)发布,Version 1,9.71 GB,成为目前主流获取渠道 |
| 2018-10 至今 | 无后续版本 | 官方未发布修订或扩充版本;Kaggle 镜像保持 Version 1 |
§1.5 典型应用场景
- 五分类细胞识别模型研发:以 4,049 张单细胞图训练 CNN/ViT分类器,作为宫颈癌筛查辅助算法的原型验证。
- 核/质分割与形态计量:利用 .dat 轮廓生成像素级掩码,训练分割网络或提取核质比、核面积等定量形态学指标。
- 迁移学习与特征比较基准:官方 fc6/conv5 深度特征集支持"深度特征 + SVM"路线的复现与对比(论文中该路线达 94.44%)。
- 可解释性研究:五类形态差异明确(如挖空细胞的核周空晕),适合 Grad-CAM 等归因方法的教学与验证。
- 计算病理学教学:数据量适中、类别语义清晰、免费开放,适合作为医学图像分析课程的实践数据集。
§2 医学背景
§2.1 ICD-11 编码映射
SIPaKMeD 的五个类别是细胞形态学标签,与 ICD-11 的疾病实体为多对一参考映射(官方未发布正式映射表,下表为本词条编辑时的整理,供检索与数据关联使用):
| 数据集标签 | ICD-11 编码 | 中文术语 | 映射说明 |
|---|---|---|---|
| Superficial-intermediate | —(正常所见) | 表层-中层鳞状细胞(正常) | 正常细胞学所见,无疾病编码;对应 Bethesda 系统的 NILM 范畴 |
| Parabasal | —(正常所见) | 副基底层鳞状细胞(正常) | 未成熟/深层鳞状细胞,雌激素水平低或萎缩背景下常见,属正常细胞 |
| Koilocytotic | 2E66.1 | 宫颈低级别鳞状上皮内病变(LSIL) | HPV 感染的特征性细胞病变效应(核周空晕+核异型),细胞学对应 LSIL |
| Dyskeratotic | 2E66 | 宫颈上皮内瘤变(总类) | 异常角化细胞,可见于各级鳞状上皮内病变,属异常非恶性 |
| Metaplastic | —(良性改变) | 鳞状化生细胞 | 生理性/良性化生过程,无疾病编码 |
| (筛查终点参照) | 2B64 | 宫颈恶性肿瘤 | 数据集不含恶性细胞样本,此行仅说明筛查疾病的终点归属 |
§2.1b SNOMED CT 映射
| 术语 | SNOMED CT 编码 | 说明 |
|---|---|---|
| Cervical intraepithelial neoplasia(宫颈上皮内瘤变) | 285636001 | 覆盖 koilocytotic/dyskeratotic 所属的 CIN 疾病总类 |
| 挖空细胞变、鳞状化生等形态学实体 | — | 官方未提供编码映射;社区检索中亦无广泛引用的独立 SNOMED 概念码,建议经 285636001 总类关联 |
| Cervical smear(宫颈涂片检查,操作侧参考) | — | 数据集对应检查操作的编码映射官方未提供;检索与关联时建议以疾病侧 285636001 为主键 |
§2.2 疾病简介与流行病学
宫颈癌是全球女性最常见的恶性肿瘤之一,WHO 估计 2020 年全球新发病例约 60 万、死亡约 34 万,且约 85% 以上的死亡发生在中低收入国家。几乎所有宫颈癌及其癌前病变都与高危型人乳头瘤病毒(HPV)的持续感染相关——这一因果链正是 SIPaKMeD 类别设计的医学逻辑:挖空细胞(koilocytotic)是 HPV 细胞病变效应在涂片上的标志性形态(核增大、深染、核周空晕),角化不良细胞(dyskeratotic)则常见于鳞状上皮内病变;两者合占数据集约 40% 的样本。与之相对,表层-中层与副基底细胞代表正常鳞状上皮的不同成熟阶段,化生细胞是宫颈管柱状上皮向鳞状上皮转化的良性表现。宫颈癌的筛查路径为:细胞学(Pap 涂片)/HPV 检测初筛 → 异常者阴道镜检查 → 组织活检确诊。Pap 涂片细胞学筛查的普及使筛查人群中的宫颈癌发病率显著下降,而细胞学阅片高度依赖细胞病理学家的经验与工作量——这正是自动化细胞识别的临床动机。
筛查格局的变化也影响这份数据的当代定位:WHO 于 2020 年提出"90-70-90"全球消除宫颈癌战略(90% 女孩接种疫苗、70% 女性接受筛查、90% 患者获得治疗),HPV DNA 检测在初筛中的份额持续上升,细胞学的角色向"HPV 阳性后的分诊"倾斜。这意味着基于本数据集的自动细胞识别技术,其现实落点更多在"HPV 阳性分诊""资源受限地区的低成本阅片辅助"与"细胞学质控"场景,而非取代初筛。
SIPaKMeD 五类与现行 Bethesda 报告系统的参考对应关系如下(官方未提供正式映射,为编辑整理):
| SIPaKMeD 类别 | Bethesda 报告范畴 | 判读依据要点 |
|---|---|---|
| Superficial-intermediate | NILM(未见上皮内病变或恶性) | 成熟鳞状细胞,核小固缩/网状染色质,胞质丰富 |
| Parabasal | NILM | 较小圆形未成熟鳞状细胞,核质比高于成熟细胞但形态温和 |
| Koilocytotic | LSIL(低级别鳞状上皮内病变) | 核增大深染、双核/多核常见、核周大空晕(挖空效应) |
| Dyskeratotic | LSIL/HSIL 视异型程度 | 异常角化的单个细胞,胞质致密橘黄/红染,核异型 |
| Metaplastic | NILM(良性化生性改变) | 鳞状化生细胞,核轻度增大但结构温和,胞质致密 |
§2.3 临床任务定义
本数据集对应的临床任务是宫颈细胞学筛查中的细胞形态自动分类(筛查场景,非诊断场景)。在实际阅片中,细胞病理学家在显微镜下逐个评估鳞状细胞的成熟度与异型性,按 Bethesda 系统报告结果(NILM、ASC-US、LSIL、ASC-H、HSIL 等)。SIPaKMeD 将这一判读简化为五个互斥的形态学类别:两个正常类对应筛查中的"阴性"判定来源,两个异常非恶性类对应 LSIL 及相关病变的特征性细胞(报告为 LSIL 的判读依据),一个良性类(化生)对应易与异常混淆但无需随访的正常变异。模型的输出可作为阅片辅助(预筛、优先级排序、漏检复核),其类别判定与 Bethesda 报告之间的映射并非一一对应,部署前需结合实验室的判读规范。
理解任务边界还需注意三点:其一,数据集是"已分离的单细胞"分类,省去了真实筛查中最难的全视野细胞定位与重叠拆分环节,因此库内成绩不能外推为端到端筛查性能;其二,异常两类都是非恶性病变,模型的意义在于"把需要随访的细胞挑出来",而非诊断癌症;其三,官方未发布置信度校准研究,直接把 softmax 概率当临床置信度使用缺乏依据。
§2.4 患者人群
| 维度 | 内容 |
|---|---|
| 样本来源 | 常规 Pap 染色宫颈涂片(非液基制片) |
| 采集地域 | 希腊 |
| 采集时间 | 官方未披露 |
| 患者人数 | 官方未披露 |
| 年龄分布 | 官方未披露 |
| 性别 | 宫颈涂片受检者(女性) |
| 种族/民族构成 | 官方未披露 |
| 就医类型 | 官方未披露(常规筛查/门诊样本构成不明) |
官方论文与数据页面均未披露人口学元数据;数据集为细胞级匿名图像,不含任何患者关联信息。
这一缺失对使用方式有实质影响:需要"患者级划分"“人群亚组评估”“纵向分析"中任何一项的研究,都不应选择本数据集作为主数据;反之,若研究目标是细胞形态本身的识别(形态→类别映射),患者级信息的缺失不构成障碍——只需在论文中如实声明"评估为细胞级而非患者级”。
§2.5 临床价值
对算法研发者而言,SIPaKMeD 的价值在于把"筛查初筛自动化"这一临床需求转化为了一个定义清晰、规模够用、标注可信的机器学习问题:五类中四类(表层-中层、副基底、化生、挖空)覆盖了实际涂片中绝大多数的鳞状细胞形态,而挖空细胞/角化不良与正常类的判别正是初筛中工作量最大、对阅片者经验依赖最重的环节。对临床研究者而言,数据集提供的核/质轮廓支持核质比、核面积、核周空晕宽度等定量形态学特征的系统研究,这些指标正是细胞病理学判读的底层依据,可用于构建可解释的筛查辅助模型或验证深度模型的判读一致性。需要注意:本数据集不包含恶性细胞与腺细胞异常类别,任何"诊断宫颈癌"的外推都超出了数据的支撑范围。
在现实研发路径中,它的典型位置是"算法冷启动数据":目标实验室尚无自有标注数据时,先用 SIPaKMeD 预训练一个形态识别骨干,再用自有数据(哪怕几百张)微调校准——这一路径同时利用了它的规模优势与规避了它的分布局限,是文献中迁移学习成绩(§8.1 榜单头部全部为迁移学习)背后的工程逻辑。
§2.6 金标准参考
| 属性 | 内容 |
|---|---|
| 划分方式 | 无官方 train/test 划分;论文采用 5 折交叉验证 |
| 标注方式 | 专家人工裁剪单细胞 + 人工类别判定 + 人工描画核/质轮廓 |
| 标注者 | 数据集作者团队,含约阿尼纳大学医学院解剖-组织与胚胎学系细胞生物学/组织学背景研究者(O. Krikoni、A. Charchanti) |
| 一致性评估 | 官方未发布标注者间一致性系数(如 kappa) |
| 标注性质 | 静态金标准(单轮专家标注,无多轮仲裁流程披露) |
§3 数据集规格
§3.0 获取渠道抉择矩阵
SIPaKMeD 仅有一个内容版本(Version 1),但存在两个获取渠道,按需选择:
| 你的需求 | 推荐渠道 | 大小 | 理由 |
|---|---|---|---|
| 快速上手、脚本化批量下载 | Kaggle 官方镜像 | 9.71 GB | kaggle CLI 一行命令下载;作者本人上传,内容与官方一致 |
| 引用原始来源、查看论文与资助信息 | 官方主页 | 约 9 GB 级打包 | 权威入口,含论文与团队信息;下载方式较传统 |
| 仅需部分类别做原型验证 | Kaggle 镜像 | 按目录取用 | 五类目录独立,可只下载所需类别 |
无论从哪个渠道获取,都建议在实验记录中登记下载日期与文件校验结果(至少记录 §6.3 校验器的类计数输出),因为数据集无版本变更日志,出现"文献描述与本地文件不一致"时,下载快照是唯一可追溯的凭据。
§3.1 模态详情
数据集为静态二维光学显微图像:标本为常规 Pap 染色宫颈涂片(细胞经巴氏染色后细胞质呈多色性蓝绿色调、细胞核呈蓝紫色),经光学显微镜与 CCD 相机数字化。原始簇细胞图分辨率为 2048×1536 像素;单细胞 ROI 图像由专家从簇图中手工裁剪而来,尺寸因细胞大小与裁剪策略而各不相同(围绕单个细胞及其邻近视野),无统一像素规格。放大倍率官方渠道(论文、官方主页、Kaggle 页面)均未披露,部分第三方文献称使用 40× 物镜,但该说法未经发布方确认——复现时请勿将放大倍率当作官方事实写入实验设置。官方未提供 DICOM/WSI 格式或原始相机的色彩配置文件,全部图像为常规 BMP 位图。
五类细胞在图像上的典型外观(供标注核对与错误分析参考):
| 类别 | 胞质特征 | 核特征 |
|---|---|---|
| Superficial-intermediate | 丰富、多边形、蓝绿色调 | 小、固缩或网状染色质,核质比低 |
| Parabasal | 较少、圆形、着色偏深 | 相对较大、圆形,核质比中等 |
| Koilocytotic | 核周大空晕(挖空效应)、边缘浓染 | 增大、深染、常见双核/多核、核膜不规则 |
| Dyskeratotic | 致密、橘黄/红染(过度角化) | 增大深染、异型明显 |
| Metaplastic | 致密、细胞界清 | 轻度增大、染色质温和 |
§3.2 按子集样本数统计
| 类别目录 | 中文名 | 细胞学属性 | 单细胞数 | 簇图数 |
|---|---|---|---|---|
| im_Superficial-Intermediate | 表层-中层鳞状细胞 | 正常 | 831* | 126 |
| im_Parabasal | 副基底层鳞状细胞 | 正常 | 787 | 108 |
| im_Koilocytotic | 挖空细胞 | 异常(HPV 相关,非恶性) | 825 | 238 |
| im_Dyskeratotic | 角化不良细胞 | 异常(HPV 相关,非恶性) | 793 | 271 |
| im_Metaplastic | 化生细胞 | 良性改变 | 813 | 223 |
| 合计 | — | — | 4,049 | 966 |
* Table 1 计数说明:原论文 Table 1 将表层-中层类印作 813,但此时五类之和为 4,031,与论文正文及摘要的 4,049 总数矛盾;后续引用文献普遍将该类记为 831(此时总和恰为 4,049)。本表按 831 记录并特此注明,引用时建议同时说明这一出入。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 单细胞 ROI 图像 | BMP(24 位彩色位图) | 每细胞一张,尺寸不一 |
| 核/质轮廓标注 | DAT(纯文本坐标文件) | 每细胞两份(*_nucleus.dat 与 *_cytoplasm.dat),逐行保存轮廓点坐标,需自行栅格化为掩码 |
| 手工特征表 | 表格文件 | 每细胞 26 维特征(强度/纹理/形状),28 列含图像与细胞编号 |
| 官方深度特征 | 特征文件 | VGG-19 fc6 pre-activations(4,096 维)与 conv5(512 维),随集提供三种特征组织方式 |
| 簇细胞图 | BMP | 966 张 2048×1536 像素原始簇图 |
格式层面的三个注意点:BMP 为无压缩位图,读取速度快但体积大,长时间随机访问训练前可转存 PNG 等压缩格式做缓存(转存属派生数据,评测结论以原始 BMP 为准);DAT 文件为纯文本,可用任意文本编辑器抽查;官方特征文件的存储形态与列名以实际下载为准,加载代码请勿硬编码。
§3.4 存储大小
Kaggle 官方镜像 Version 1 总大小 9.71 GB,约 21,200 个文件(4,049 张单细胞 BMP + 8,098 个轮廓 DAT + 966 张簇图 BMP + 特征文件与目录元数据)。解压后磁盘占用与下载体积相当;建议预留 12 GB 以上可用空间(含掩码栅格化中间产物的余量)。
体积构成上的一个实用观察:966 张 2048×1536 簇图占全库体积的大头(单张约 9 MB 量级),而 4,049 张单细胞裁剪图体积远小于簇图之和。若存储紧张且只做单细胞分类,可以先只解压五类目录下的 CROPPED/ 路径——但做簇级实验(同源分组、半监督、检测)时簇图不可省,请按研究目标取舍。
§3.5 标注方式
三层标注,全部人工完成:其一,类别标签——专家将每张裁剪出的单细胞图归入五个形态学类别;其二,轮廓标注——专家逐细胞人工描画细胞核与细胞质边界,以坐标序列存入 .dat 文件,精度为像素级多边形顶点;其三,派生特征——基于轮廓与像素强度计算 26 个手工特征(强度统计、纹理、形状三类),并随集提供 VGG-19 深度特征。无弱监督或自动预标注环节披露。
轮廓文件的使用细节值得展开:核轮廓与质轮廓分别存于 *_nucleus.dat 与 *_cytoplasm.dat,每行一对坐标(x, y),顶点数随细胞形态复杂度而变;坐标原点为裁剪前的簇图坐标系,与对应单细胞 BMP 的本地坐标系可能存在偏移——部分研究直接以质轮廓的外接框重新裁剪图像来规避坐标换算(见坑点 7)。栅格化为掩码时的顶点连接方式(线性插值)与填充规则(奇偶规则)都会造成 1-2 像素级的边界差异,评测分割时应在全库统一同一套栅格化实现。
§3.6 标注者资质与一致性
类别与轮廓标注由数据集作者团队完成,其中包含约阿尼纳大学医学院解剖-组织与胚胎学系的细胞生物学/组织学专业研究者,具备宫颈细胞形态学判读资质。官方未发布标注者人数、独立标注轮次与标注者间一致性(如 Cohen’s kappa)指标;使用者应将标签视为"单轮专家共识"而非"双人独立标注+仲裁"的金标准流程,在极限性能对比时保留标注噪声的容差。
§3.7 采集周期
官方论文与数据页面均未披露涂片采集的时间区间与数字化周期。数据集随 2018-10 发表的 ICIP 2018 论文首次发布,可推断数字化与标注完成于 2018 年之前,但具体年份区间官方未披露。
这一缺失在数据集引用中的实际影响:任何涉及"数据年代"的表述(如"成像技术为 2010 年代水平")都只能以发布年为锚点;涉及时间维度的研究设计(如年度漂移分析)在本库上无法开展,引用时请以"采集期官方未披露,以 2018 年发布为时间锚点"的标准句式表述。
§3.8 地域覆盖
样本来自希腊(发布机构 University of Ioannina 所在地);具体采集医院/诊所数量与地域分布官方未披露。数据集属性为单国家、单设备体系的细胞学资源。
§3.9 设备规格
| 组件 | 型号/说明 |
|---|---|
| 光学显微镜 | OLYMPUS BX53F |
| 图像采集 | Infinity 1 Lumenera CCD 彩色相机 |
| 标本制片 | 常规 Pap 染色宫颈涂片(非液基) |
| 放大倍率 | 官方未披露(第三方文献称 40× 物镜,未经确认) |
| 簇图分辨率 | 2048×1536 像素 |
设备体系的两点工程含义:其一,单机身+单相机意味着全库色彩响应一致,这既是好事(库内训练无需染色归一化)也是陷阱(模型对色彩极敏感,跨设备即失效,见 §7.6);其二,Infinity 1 是价格亲民的科研级 CCD,分辨率与信噪比属于入门科研档位,图像中存在轻度噪声与亮度不均属正常现象,预处理时过强的去噪反而会抹掉核染色质纹理。
§3.10 深度溯源链
受检者(人数未披露)→ 常规 Pap 涂片制片与巴氏染色(机构未披露)→ OLYMPUS BX53F + Infinity 1 CCD 数字化(放大倍率未披露)→ 专家挑选 966 张簇细胞图(2048×1536)→ 专家手工裁剪 4,049 个单细胞 ROI 并五分类 → 专家描画核/质轮廓(.dat)→ 计算手工特征与 VGG-19 特征 → ICIP 2018 论文评审与发布(DOI: 10.1109/ICIP.2018.8451588)→ 作者上传 Kaggle 官方镜像(Version 1,9.71 GB)。链条中"制片机构、采集医院、放大倍率、患者数"四个环节官方未披露,溯源止步于此。
§4 数据结构
§4.0 目录树
Kaggle 镜像解压后的目录结构(* 为模式通配,实际文件名为各细胞的编号):
sipakmed/
├── im_Dyskeratotic/
│ └── im_Dyskeratotic/
│ ├── CROPPED/
│ │ ├── *.bmp # 该类全部单细胞 ROI 图像
│ │ ├── *_cytoplasm.dat # 对应细胞的细胞质轮廓坐标
│ │ └── *_nucleus.dat # 对应细胞的细胞核轮廓坐标
│ └── ...(该类的簇图与特征文件所在层级)
├── im_Koilocytotic/
│ └── im_Koilocytotic/
│ └── CROPPED/ # 结构同上
├── im_Metaplastic/
│ └── im_Metaplastic/
│ └── CROPPED/ # 结构同上
├── im_Parabasal/
│ └── im_Parabasal/
│ └── CROPPED/ # 结构同上
└── im_Superficial-Intermediate/
└── im_Superficial-Intermediate/
└── CROPPED/ # 结构同上
结构要点:每类目录双层同名嵌套,实际图像在第二层下的 CROPPED/ 中;同一细胞的三份文件(BMP + 两条 DAT)共享同一文件名主干,按主干名即可三元组配对;五类目录名含连字符与大小写差异(如 im_Superficial-Intermediate),编程遍历时极易拼错。
§4.1 DAIMS 数据字典
| 字段/文件 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
<id>.bmp |
图像(BMP) | 单细胞 ROI 彩色图,围绕核与质的裁剪视野 | 24 位 RGB 位图 | 分类/分割输入 | 裁剪视野含邻近细胞碎片 | 无缺失 | 尺寸不一(数百像素级) |
<id>_nucleus.dat |
文本(坐标) | 细胞核轮廓多边形顶点序列 | 每行一对坐标 | 核分割真值、核形态计量 | 人工描画,边界 1-2 像素级抖动 | 无缺失 | 轮廓点数不定 |
<id>_cytoplasm.dat |
文本(坐标) | 细胞质轮廓多边形顶点序列 | 每行一对坐标 | 质/整体细胞分割真值 | 邻近细胞重叠区边界不完全可信 | 无缺失 | 轮廓点数不定 |
| 类别标签(目录名) | 枚举(目录结构隐含) | 五类形态学标签,由所属目录决定 | im_Koilocytotic | 分类监督信号 | 专家单轮标注 | 无缺失 | 5 个目录名 |
| 手工特征(26 维) | 数值(表格) | 强度/纹理/形状三类特征,含图像与细胞编号列 | N/A(逐列定义随文件) | 经典 ML 基线、特征消融 | 派生计算误差 | 无缺失 | 26 个特征列 |
| fc6 特征 | 数值(4,096 维) | VGG-19 fc6 层 pre-activations | N/A | "深度特征+SVM"路线 | 官方预提取 | 无缺失 | 4,096 列 |
| conv5 特征 | 数值(512 维) | VGG-19 conv5 层特征 | N/A | 空间特征/特征图研究 | 官方预提取 | 无缺失 | 512 列 |
| 簇细胞图 BMP | 图像(BMP) | 2048×1536 原始簇图,单细胞的裁剪母图 | 24 位 RGB 位图 | 同源分组、簇级实验 | — | 无缺失 | 966 张 |
| 患者标识 | — | 不存在:数据集不提供任何患者/涂片级标识 | — | 无法做患者级划分 | — | 结构性缺失(非字段缺失) | — |
| 簇图 ID(编号前缀) | 文本(文件名隐含) | 单细胞文件名的前缀对应其来源簇图,可还原父子关系 | 同前缀多细胞 | 按簇分组划分(防泄漏) | 官方未文档化,靠文件名规律推断 | 无缺失 | 966 个簇 |
| 特征表编号列 | 整数(表格) | 手工特征表中的图像编号与细胞编号列 | N/A | 图像-特征对齐 | 与 BMP 文件名的对应规则需自行核对 | 无缺失 | 4,049 行 |
§4.2 标签分布
五类分布近似均衡:正常两类合计 1,618 张(40.0%)、异常非恶性两类合计 1,618 张(40.0%)、良性化生 813 张(20.1%)。单类最大 831 张(表层-中层)与最小 787 张(副基底)相差约 5.6%,训练时无需强制的类别重加权,但在 5 折交叉验证的折间波动仍需关注(见坑点 5)。二分类视角下:正常+良性 2,431 张 vs 异常 1,618 张。
同一份数据的三种标签粒度(聚合规则为编辑整理,供不同任务取用):
| 粒度 | 分组 | 样本数 | 适用任务 |
|---|---|---|---|
| 五分类(原始) | 五个形态学类 | 4,049 | 论文主流协议 |
| 二分类 | 正常+良性 2,431 vs 异常 1,618 | 4,049 | 筛查阴性/阳性分流 |
| 三分类 | 正常 1,618 vs 良性 813 vs 异常 1,618 | 4,049 | 医学语义中间层评测 |
聚合后类间比例发生变化(如三分类下良性类占比 20.1%),重加权需求要重新评估;引用聚合协议时务必注明聚合规则,避免与五分类文献直接比较。
§4.3 关键统计
| 统计项 | 数值 |
|---|---|
| 单细胞图总数 | 4,049 |
| 簇图总数 | 966(分辨率 2048×1536) |
| 平均每簇图裁出单细胞数 | 约 4.2 张(4,049/966) |
| 类别数 | 5 |
| 轮廓文件总数 | 8,098(4,049 核 + 4,049 质) |
| 手工特征维度 | 26(每细胞) |
| 官方深度特征维度 | 4,096(fc6)/ 512(conv5) |
| 每细胞轮廓条数 | 2(核、质) |
| 官方 train/test 划分 | 无(论文用 5 折 CV) |
| 患者数/采集期 | 官方未披露 |
| 正常+良性 : 异常 | 2,431 : 1,618(约 60% : 40%) |
| 最大/最小类规模比 | 831/787 ≈ 1.06(近均衡) |
| 图像位深 | 24 位 RGB(BMP) |
| 特征表列数 | 28(26 特征 + 图像编号 + 细胞编号) |
§4.4 数据层级
受检者(数量未披露,无标识)
└── Pap 涂片玻璃切片(数量未披露,无标识)
└── 簇细胞图(966 张,2048×1536)
└── 单细胞 ROI(4,049 张,平均每簇约 4.2 张)
├── 单细胞 BMP 图像
├── 核轮廓 DAT + 质轮廓 DAT
└── 类别标签(目录隐含)
层级关键含义:"单细胞 → 簇图"的父子关系可由文件编号还原(同簇裁出的细胞共享编号前缀),但"簇图 → 涂片/患者"的上一级映射官方未提供。这意味着同簇细胞相关性与同患者相关性两个泄漏维度中,前者可缓解(按簇分组划分),后者不可评估——详见坑点 2。
§4.5 缺失值与信息性缺失
| 检查项 | 结果 | 说明 |
|---|---|---|
| 图像文件缺失 | 无 | 4,049 张 BMP 与 8,098 个 DAT 完整配对(以官方镜像为准) |
| 轮廓缺失/空文件 | 官方未报告 | 加载器应校验每个 DAT 至少含 3 个顶点,异常时跳过并记录日志 |
| 特征表缺失单元格 | 无官方报告 | 使用特征表时按表格实际空值处理 |
| 患者级元数据 | 结构性缺失 | 非字段缺值,而是整层信息未采集/未发布;无法以编码方式补齐 |
| 信息性缺失编码 | 不适用 | 图像数据集无"以特殊值表示缺失"的约定 |
§4.6 官方特征集对照
官方随数据集提供三种特征组织方式,对应论文中三条基线实验路线。使用特征集无需读取图像即可复现论文半数基线,是低成本实验的入口:
| 官方特征集 | 维度 | 来源 | 对应论文基线 | 论文成绩(5 折 CV) | 典型用途 |
|---|---|---|---|---|---|
| Cell features(手工特征) | 26 | 基于核/质轮廓与像素强度计算(强度统计/纹理/形状三类) | —(论文以核区/质区图像输入 SVM 时另行取特征) | 核 SVM 83.45% / 核+质 SVM 91.68% | 经典 ML 基线、特征重要性分析、可解释建模 |
| Image features(fc6 pre-activations) | 4,096 | VGG-19 第一个全连接层激活 | Deep fc SVM | 94.44%±1.21 | "深度特征+浅层分类器"路线、迁移对照 |
| Deep features(conv5) | 512 | VGG-19 最后一个卷积块特征 | Deep conv SVM | 93.35%±0.62 | 空间特征图研究、降维可视化 |
三点使用建议:其一,特征集与单细胞图的对应键是特征表中的图像/细胞编号列,使用前先与 BMP 文件名做一次对齐校验;其二,4,096 维 fc6 特征在 4,049 个样本上接近"维度≈样本数",直接训练分类器会严重过拟合,建议先 PCA 降维或 L2 正则化(论文同样处理);其三,官方特征基于未披露的固定 VGG-19 权重提取,与现代预训练骨干的特征不可直接混拼,对比实验时保持特征来源单一。
§5 数据划分与使用建议
§5.1 官方划分
不存在官方 train/test 划分。 原论文采用 5 折交叉验证(输入统一为 80×80)报告全部基线,因此论文中的均值±标准差(如 CNN 95.35%±0.42)描述的是交叉验证分布,不能与任何单次划分结果直接比较。
§5.2 社区惯例划分
后续文献的划分五花八门:随机按细胞 5 折 CV(与论文同协议)、按固定比例 train/val/test 划分、甚至在同一图像池上先训练后测试——这是文献间成绩从 87% 到 99.95% 的主要来源之一。复现论文基线时务必回到"5 折 CV + 80×80 输入"的原协议;报告新方法时必须完整披露划分细节与随机种子。
| 协议变体 | 划分单位 | 典型报告成绩 | 可比性说明 |
|---|---|---|---|
| 原论文协议 | 细胞级,5 折 CV,80×80 输入 | 83.45%–95.35% | 官方口径,推荐作为对照基准 |
| 随机比例划分 | 细胞级,常见 70/15/15 或 80/20 | 92%–97% | 未披露种子与折结构,复现困难 |
| 迁移学习+增广 | 细胞级,划分各异 | 96.9%–99.95% | 增广与正则贡献显著,协议间不可直接比 |
| 按簇分组划分 | 簇图级 | 较随机划分低数个百分点 | 最严格库内协议,推荐新方法采用 |
| 跨库(→ Herlev) | 数据集级迁移 | 90.42%(2025 报告) | 唯一能反映真实泛化的口径 |
§5.3 划分策略建议与泄漏风险
首要泄漏风险是同簇细胞相关性:平均每张簇图裁出约 4.2 张单细胞,同一簇内的细胞来自同一涂片视野、同一染色与曝光条件,形态高度相关。随机按细胞划分会把"同一簇的兄弟细胞"同时放进训练集与测试集,造成模型事实上见过测试细胞的"孪生样本"。建议以簇图编号为分组键做 GroupShuffleSplit 或按簇分组的分层 K 折;其次,由于患者级标识缺失,更严格的患者级泛化评估在本数据集上无法实施,这一点应在论文限制章节明确声明。
§5.4 交叉验证建议
推荐"按簇分组的分层 5 折 CV":以簇图为分组单位(保证同簇细胞不跨折)、以类别为分层变量(保证每折五类比例一致)、重复 3 个随机种子报告均值±标准差。若需要留出独立测试集,建议 70/15/15 按簇分组划分,并在附录中同时报告"随机划分"结果以便与历史文献对话——两条数字的差值本身就是对泄漏效应的量化。
实现细节提示:簇 ID 的解析规则应固化在代码里(从文件名前缀提取)并写入数据卡,不同批次下载的镜像若文件命名有差异,解析规则需要同步核对;StratifiedGroupKFold(scikit-learn ≥ 1.0)可同时满足分组与分层两个约束,若使用旧版 scikit-learn,可退化为"按簇分组 + 手动调平折间类比例"的两步法。
from sklearn.model_selection import StratifiedGroupKFold
import numpy as np
labels = np.array([s[1] for s in dataset.samples]) # 每样本类别
groups = np.array([cluster_id(path) for path, _ in dataset.samples]) # 每样本簇 ID
sgkf = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
folds = list(sgkf.split(np.zeros(len(labels)), y=labels, groups=groups))
# 校验:任一折内 groups 无交集
assert all(len(set(groups[tr]) & set(groups[te])) == 0 for tr, te in folds)
§5.5 外部验证建议
由于数据集不含恶性类别且为单一制片体系,跨库泛化应作为发布前的标准动作:与 Herlev Pap Smear(7 类,含恶性)做跨数据集迁移评估是最常见的外部验证设计(如 Austin & Parvathi 2025 同时在两库上报告),但两库类别体系并不对齐,需明确映射假设;与液基制片的细胞数据集做跨制片工艺验证则能暴露染色与背景分布差异。任何跨库结果都应单独报告,不得与库内成绩混合平均。
| 跨库设计 | 映射假设 | 常见错误 |
|---|---|---|
| SIPaKMeD → Herlev(2 类) | 正常 vs 异常的二分类轴对齐 | 忽略 Herlev 含恶性类导致的标签泄漏语义 |
| SIPaKMeD → Herlev(7 类) | 无一一对应,需冻结骨干重训头 | 直接迁移五类头到七类任务 |
| SIPaKMeD → 液基数据集 | 制片工艺差异仅影响分布 | 未做染色归一化直接评测 |
§6 AI 就绪指南
§6.0 云端快速启动
数据集托管于 Kaggle,可直接在 Kaggle Notebook(免费 GPU)中挂载官方镜像,零下载启动:
# Kaggle Notebook 内:右侧 Input 面板搜索 "sipakmed" 挂载 marinaeplissiti/sipakmed
# 挂载后数据位于 /kaggle/input/sipakmed/
ls /kaggle/input/sipakmed/
在 Colab 等外部环境则走 §6.2 的 Kaggle CLI 下载流程(首次下载约 9.71 GB)。
§6.1 快速上手
运行前须知:以下代码预期数据根目录
data_root指向解压后的sipakmed/目录;目录结构为data_root/im_{类别}/im_{类别}/CROPPED/(双层同名嵌套,见 §4.0);每个细胞由同主干的.bmp + *_nucleus.dat + *_cytoplasm.dat三个文件构成。最小可用子集:任一类的CROPPED/目录即可跑通"读图 + 读轮廓 + 出掩码"全流程。
import numpy as np
from pathlib import Path
from PIL import Image
DATA_ROOT = Path("sipakmed") # 拼接关系:DATA_ROOT / 类目录 / 类目录 / CROPPED
CLASSES = ["im_Superficial-Intermediate", "im_Parabasal", "im_Koilocytotic",
"im_Dyskeratotic", "im_Metaplastic"]
def load_cell(bmp_path: Path):
"""读取一个细胞:图像 + 核/质轮廓坐标"""
img = np.array(Image.open(bmp_path).convert("RGB")) # (H, W, 3)
stem = bmp_path.with_suffix("").as_posix()
nuc = np.loadtxt(str(stem) + "_nucleus.dat", delimiter=",") # (N, 2) 轮廓顶点
cyt = np.loadtxt(str(stem) + "_cytoplasm.dat", delimiter=",") # (M, 2)
return img, nuc, cyt
# 示例:遍历挖空细胞类的前 3 个细胞
crop_dir = DATA_ROOT / "im_Koilocytotic" / "im_Koilocytotic" / "CROPPED"
for bmp in sorted(crop_dir.glob("*.bmp"))[:3]:
img, nuc, cyt = load_cell(bmp)
print(bmp.name, img.shape, "nucleus pts:", nuc.shape[0], "cytoplasm pts:", cyt.shape[0])
首次运行的高频报错与处置:
| 报错/异常 | 根因 | 处置 |
|---|---|---|
glob("*.bmp") 返回空 |
路径少写一层同名目录(双层嵌套,坑点 3) | 检查 cls/cls/CROPPED 拼接 |
np.loadtxt 抛 ValueError |
轮廓文件分隔符/编码与预期不符 | 先 head 查看原始格式再定 delimiter |
| 掩码全 0 | 坐标为 (x, y) 而代码按 (row, col) 填充 | 按 §6.3 的行列交换写法核对 |
| 数据集长度 ≪ 4,049 | 部分 BMP 无对应 DAT 被静默跳过 | 跑 §6.3 校验器输出完整清单 |
§6.2 数据获取
| 项目 | 内容 |
|---|---|
| 渠道一(推荐) | Kaggle 官方镜像 marinaeplissiti/sipakmed(作者本人发布) |
| 渠道二 | 官方主页打包下载 |
| 大小 | 9.71 GB / 约 21,200 文件(Version 1) |
| 前置条件 | Kaggle 账号并接受数据集条款;CLI 需 kaggle.json API Token |
| 许可 | 公开可用、仅限实验目的、须引用 ICIP 2018 论文 |
pip install kaggle
# 将 kaggle.json 放到 ~/.kaggle/ 后执行
kaggle datasets download -d marinaeplissiti/sipakmed -p ./data
unzip ./data/sipakmed.zip -d ./data/sipakmed
API 凭据的获取路径:Kaggle 个人设置页 → API 区 → Create New Token,浏览器会下载 kaggle.json(含用户名与 key);Linux/macOS 放置后需 chmod 600 ~/.kaggle/kaggle.json;首次下载前请在浏览器打开数据集页接受一次许可条款,否则 CLI 会报 403。
§6.3 预处理全流程
核心步骤是把 .dat 轮廓栅格化为像素掩码,再统一尺寸。以下代码产出"图像 + 核掩码 + 质掩码"三元组:
import numpy as np
from skimage.draw import polygon as sk_polygon
from PIL import Image
from pathlib import Path
def rasterize_mask(contour_xy: np.ndarray, h: int, w: int) -> np.ndarray:
"""把轮廓顶点栅格化为 0/1 掩码。contour_xy: (N, 2),列为 (x, y)"""
rr, cc = sk_polygon(contour_xy[:, 1], contour_xy[:, 0], shape=(h, w))
mask = np.zeros((h, w), dtype=np.uint8)
mask[rr, cc] = 1
return mask
def build_sample(bmp_path: Path, out_size: int = 128):
img = np.array(Image.open(bmp_path).convert("RGB"))
h, w = img.shape[:2]
stem = bmp_path.with_suffix("").as_posix()
nuc = np.loadtxt(str(stem) + "_nucleus.dat", delimiter=",")
cyt = np.loadtxt(str(stem) + "_cytoplasm.dat", delimiter=",")
m_nuc = rasterize_mask(nuc, h, w)
m_cyt = rasterize_mask(cyt, h, w)
# 分类路线:以核质点集的联合质心为中心裁出 out_size 方块,再 resize
ys, xs = np.where((m_nuc | m_cyt) > 0)
cy, cx = int(ys.mean()), int(xs.mean())
half = out_size // 2
y0, x0 = max(0, min(h - out_size, cy - half)), max(0, min(w - out_size, cx - half))
tile = Image.fromarray(img[y0:y0 + out_size, x0:x0 + out_size]).resize((out_size, out_size))
return np.array(tile), m_nuc[y0:y0 + out_size, x0:x0 + out_size], m_cyt[y0:y0 + out_size, x0:x0 + out_size]
清洗与标准化要点:全部四千余张图应过一遍"三文件配对完整性 + DAT 顶点数 ≥ 3 + 掩码面积 > 0"校验,失败样本记入剔除清单;像素归一化建议按本数据集自身统计量计算 RGB 均值/方差(巴氏染色分布与 ImageNet 自然图像差异显著,直接套用 ImageNet 常数是常见错误,见坑点 8)。
官方特征集的加载与降维示例(无需读图即可复现论文 deep fc SVM 路线):
import numpy as np
from sklearn.decomposition import PCA
from sklearn.svm import SVC
from sklearn.model_selection import StratifiedKFold
from sklearn.metrics import accuracy_score
import pandas as pd
# 表格文件随镜像提供:26 维手工特征 + 图像/细胞编号列,28 列
features = pd.read_excel("cell_features.xlsx") # 文件名以实际下载为准
X_raw = features.iloc[:, 2:].to_numpy(dtype=float) # 跳过两列编号
y = features["class"].to_numpy() # 五类整数标签(按实际列名调整)
# 4,096 维深度特征同理:先降维再分类(维度≈样本数,必须降维)
pca = PCA(n_components=150, random_state=42)
X = pca.fit_transform((X_raw - X_raw.mean(0)) / (X_raw.std(0) + 1e-8))
clf = SVC(kernel="rbf", C=10, gamma="scale")
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
accs = [accuracy_score(y[te], clf.fit(X[tr], y[tr]).predict(X[te]))
for tr, te in skf.split(X, y)]
print(f"5-fold accuracy: {np.mean(accs)*100:.2f}% ± {np.std(accs)*100:.2f}%")
特征表的具体文件名、列名与类别编码以实际下载内容为准;上例展示的是"特征文件 → 分层 5 折 → 均值±标准差"的论文级流程骨架。
全库完整性校验器(任何训练前先跑一遍,输出剔除清单):
from pathlib import Path
import numpy as np
DATA_ROOT = Path("sipakmed")
CLASSES = ["im_Superficial-Intermediate", "im_Parabasal", "im_Koilocytotic",
"im_Dyskeratotic", "im_Metaplastic"]
EXPECTED = {"im_Superficial-Intermediate": 831, "im_Parabasal": 787,
"im_Koilocytotic": 825, "im_Dyskeratotic": 793, "im_Metaplastic": 813}
def validate_library(data_root: Path):
bad, counts = [], {}
for cls in CLASSES:
crop_dir = data_root / cls / cls / "CROPPED"
bmps = sorted(crop_dir.glob("*.bmp"))
counts[cls] = len(bmps)
for bmp in bmps:
stem = bmp.with_suffix("")
for suffix in ("_nucleus.dat", "_cytoplasm.dat"):
dat = stem.with_name(stem.name + suffix)
if not dat.exists():
bad.append((bmp.name, "missing " + suffix)); continue
pts = np.loadtxt(str(dat), delimiter=",")
if pts.ndim != 2 or pts.shape[0] < 3:
bad.append((dat.name, "too few contour points"))
for cls, n in counts.items():
flag = "OK" if n == EXPECTED[cls] else "MISMATCH (expect %d)" % EXPECTED[cls]
print(f"{cls:32s} {n:5d} {flag}")
print(f"bad items: {len(bad)}")
return counts, bad
校验器同时承担两个职责:三元组完整性(防止坑点 3 的路径错误静默吞数据)与类计数断言(固化坑点 5 的 831/813 结论)。任何 MISMATCH 都应在继续训练前查清原因。
§6.4 PyTorch DataLoader 完整代码
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
from torchvision import transforms
from PIL import Image
from pathlib import Path
def load_and_center(bmp_path: Path, crop: int = 128) -> np.ndarray:
"""读取图像并以核质联合质心为中心裁出 crop×crop 方块(简化版,完整版见 §6.3)"""
img = np.array(Image.open(bmp_path).convert("RGB"))
h, w = img.shape[:2]
stem = bmp_path.with_suffix("")
nuc = np.loadtxt(str(stem) + "_nucleus.dat", delimiter=",")
cyt = np.loadtxt(str(stem) + "_cytoplasm.dat", delimiter=",")
cy, cx = int(nuc[:, 1].mean()), int(nuc[:, 0].mean()) # 以核质心为焦点
y0, x0 = max(0, min(h - crop, cy - crop // 2)), max(0, min(w - crop, cx - crop // 2))
return img[y0:y0 + crop, x0:x0 + crop]
class SIPaKMeD(Dataset):
"""SIPaKMeD 五分类 Dataset:中心对齐裁剪 + resize。
data_root 指向解压后的 sipakmed/ 目录(结构见 §4.0)。
"""
CLASSES = ["im_Superficial-Intermediate", "im_Parabasal",
"im_Koilocytotic", "im_Dyskeratotic", "im_Metaplastic"]
def __init__(self, data_root: str, split_indices=None, crop: int = 128):
self.crop = crop
self.samples = []
for label, cls in enumerate(self.CLASSES):
crop_dir = Path(data_root) / cls / cls / "CROPPED"
for bmp in sorted(crop_dir.glob("*.bmp")):
stem = bmp.with_suffix("")
if (stem.with_name(stem.name + "_nucleus.dat")).exists() and \
(stem.with_name(stem.name + "_cytoplasm.dat")).exists():
self.samples.append((bmp, label))
if split_indices is not None:
self.samples = [self.samples[i] for i in split_indices]
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
bmp, label = self.samples[idx]
img = load_and_center(bmp, self.crop)
tf = transforms.Compose([
transforms.ToTensor(),
transforms.Normalize(mean=[0.673, 0.497, 0.681], # 示例常数,务必按 §6.3
std=[0.189, 0.231, 0.163]) # 在本库上重算
])
return tf(Image.fromarray(img)), label
def make_loaders(data_root: str, group_ids: np.ndarray, batch_size: int = 32):
"""按簇分组划分示例:group_ids 为每个样本所属簇图编号(由文件名前缀解析)"""
from sklearn.model_selection import GroupShuffleSplit
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
idx = np.arange(4049)
tr, te = next(gss.split(idx, groups=group_ids))
return (DataLoader(SIPaKMeD(data_root, tr), batch_size=batch_size, shuffle=True),
DataLoader(SIPaKMeD(data_root, te), batch_size=batch_size))
§6.5 实战坑点(8 个)
⚠️ 坑点 1:.dat 是轮廓坐标,不是掩码图像(分类:预处理陷阱)
问题:标注以多边形顶点坐标文本存储,直接把 .dat 当掩码喂给分割损失或当标签做监督,语义完全错误。
症状:训练正常收敛但分割 IoU 长期为 0 或极低;可视化时"掩码"显示成散点或折线。
解决:
- 简单方法:
skimage.draw.polygon(§6.3)把顶点填充为 0/1 掩码,逐细胞生成后缓存为 .npy。- 进阶方法:栅格化后做形态学闭运算(
skimage.morphology.binary_closing)填补边界锯齿;对 cytoplasm 掩码减去 nucleus 得到"纯质"区。- SOTA 方法:用
cv2.fillPoly(亚像素插值关掉)保持与人工描画一致的边界;分割评测时以轮廓线的豪斯多夫距离补充 IoU,避免栅格化分辨率影响结论。
参考:ICIP 2018 论文 §III 标注描述;scikit-imageskimage.draw.polygon文档。
⚠️ 坑点 2:同簇"兄弟细胞"把测试集泄漏给训练集(分类:数据泄漏)
问题:平均每张簇图裁出约 4.2 个细胞,同簇细胞来自同一视野、同一染色条件,随机按细胞划分会让训练集包含测试细胞的同视野孪生样本。
症状:随机划分成绩比按簇分组划分高出数个百分点;跨库(如到 Herlev)泛化时性能断崖式下跌,远低于库内成绩。
解决:
- 简单方法:解析文件名前缀得到簇 ID,用
sklearn.model_selection.GroupShuffleSplit按簇划分(§6.4)。- 进阶方法:按簇分组的分层 K 折(
StratifiedGroupKFold),重复多个种子报告均值±标准差。- SOTA 方法:同时报告"随机划分"与"按簇分组"两套结果,把差值作为泄漏效应量化写进论文;若使用官方簇图做半监督,禁止簇图与其裁剪细胞分属不同折。
参考:ICIP 2018 论文(5 折 CV 原协议);Sci Rep 2025(DOI: 10.1038/s41598-025-10009-x)协议对比讨论。
⚠️ 坑点 3:双层同名目录与连字符类名让路径拼接静默失败(分类:工程陷阱)
问题:每类数据位于
im_{类别}/im_{类别}/CROPPED/双层嵌套下,且im_Superficial-Intermediate含连字符与大小写混合,手写路径极易少一层或多一层。
症状:glob返回空列表、数据集长度为 0 或只有 4 类中的若干类;Windows 与 Linux 大小写敏感性不同导致本地能跑、服务器报错。
解决:
- 简单方法:用 §6.1/§6.4 的类列表常量拼接,禁止手敲类名字符串。
- 进阶方法:初始化时断言五类样本数与 §3.2 表一致(831/787/825/793/813),数量不符立即抛异常。
- SOTA 方法:在 CI 中加入数据完整性测试(文件数、三元组配对、类计数),换机器迁移时先跑测试再训练。
参考:Kaggle 镜像目录结构(marinaeplissiti/sipakmed)。
⚠️ 坑点 4:文献成绩横跨 87%–99.95%,直接抄进对比表必然翻车(分类:评估误用)
问题:官方无 train/test 划分,各文献协议不同(5 折 CV / 固定划分 / 泄漏划分 / 输入尺寸不同),Xception 97.55%、VGG16 99.95% 与论文 CNN 95.35% 之间没有可比性。
症状:自建模型"未超 SOTA"或"轻松超越 SOTA"的错误结论;审稿人一眼指出协议不齐。
解决:
- 简单方法:只与"同协议(5 折 CV、80×80 输入)"的论文 Table 2 数字比较。
- 进阶方法:复现 1-2 个代表基线(CNN 95.35% 协议)对齐后再比较;对比表中为每行标注划分协议列。
- SOTA 方法:按 §5.4 的分组分层 CV 重跑历史方法,统一发布协议下的排行榜,并在附录公开全部随机种子。
参考:Sci Rep 2025 Table 15(协议差异示例);Kaur et al. 2025(DOI: 10.1038/s41598-024-74531-0,99.95% 的协议背景)。
⚠️ 坑点 5:论文 Table 1 五类之和 4,031 ≠ 总数 4,049(分类:标签理解)
问题:原论文 Table 1 将表层-中层类印作 813,五类相加为 4,031,与正文 4,049 矛盾;引用文献普遍按 831 记录。
症状:按类目统计实际下载文件数与论文表对不上;写论文时类分布引用来源混乱。
解决:
- 简单方法:以下载文件的实际
glob计数为准做分布统计,论文数字仅作对照。- 进阶方法:在实验记录中同时保存"论文 Table 1 数字"与"实测数字"两列,标注 813/831 出入。
- SOTA 方法:引用时采用实测计数并附脚注说明论文笔误,避免错误传播。
参考:ICIP 2018 论文 Table 1;Nature Sci Rep 2025 与多篇引用文献的类计数表。
⚠️ 坑点 6:单细胞图里混着邻近细胞碎片(分类:预处理陷阱)
问题:ROI 从簇图中裁剪而来,视野内常有邻接细胞或细胞质碎片的局部;胞质轮廓在重叠区也不完全可信。
症状:分类模型学到"碎片存在与否"之类的捷径特征,Grad-CAM 热区落在边缘碎片上;分割真值在重叠边界处与视觉判断冲突。
解决:
- 简单方法:训练前人工抽检各类 30-50 张,熟悉碎片形态;评测时按"中心细胞类别"理解标签语义。
- 进阶方法:以核/质联合掩码的最大连通域为焦点区域,对图块外围做掩蔽或高斯衰减,抑制碎片贡献。
- SOTA 方法:从 966 张簇图出发用检测/分割模型端到端重裁,把"裁剪质量"纳入消融(Austin & Parvathi 2025 的 WSI 直接分类路线证明省去裁剪也可行)。
参考:ICIP 2018 论文(裁剪流程);Sci Rep 2025(WSI 免分割分类,96.74%)。
⚠️ 坑点 7:"核必然居中"的假设不成立(分类:偏倚陷阱)
问题:中心裁剪/中心缩放策略隐含"细胞核位于图块中心"的假设,但 ROI 尺寸不一且核在质内位置因类别而异(如表层-中层核小偏位)。
症状:resize 到方形输入后核出现在不同位置,模型定位困难;细粒度类别(副基底 vs 化生)混淆率异常高。
解决:
- 简单方法:用 nucleus .dat 质心重定位后再裁剪(§6.3 的质心对齐逻辑)。
- 进阶方法:按核质轮廓外接框加 15% 边距裁剪,保持纵横比 resize(padding 而非拉伸)。
- SOTA 方法:先用轻量核检测头回归核中心与尺度,再 ROI 对齐;或将核偏心量作为辅助回归目标做多任务学习。
参考:ICIP 2018 论文(核基线 83.45% 的输入构造);arXiv 2506.15489(输入构造综述讨论)。
⚠️ 坑点 8:OpenCV 通道顺序与 ImageNet 归一化常数的染色错配(分类:工程陷阱)
问题:
cv2.imread返回 BGR 顺序,而 PIL/训练管线假定 RGB;巴氏染色图像直接套 ImageNet 均值方差会把输入分布整体推偏。
症状:OpenCV 读图训练的模型在 PIL 读图推理时精度掉点;训练 loss 不降或震荡,可视化输入图色调诡异(粉紫反转)。
解决:
- 简单方法:统一用 PIL 读取(§6.4),全管线锁定一种色彩顺序;训练/推理用同一份均值方差常数。
- 进阶方法:按 §6.3 在全库(仅训练折)上重算 RGB 均值/方差写入配置;推理脚本从配置读取而非硬编码。
- SOTA 方法:加入染色归一化(Macenko/Vahadane 或轻量 StainNet)作为可选层,对跨设备/跨库推理尤其有效。
参考:Kaggle 社区 notebook 常见错误讨论;Macenko et al. 2009(染色归一化原始方法)。
§6.6 数据增强建议
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ 安全 | 水平/垂直翻转、90° 旋转 | 显微视野无方向先验,标签不变 |
| ✅ 安全 | 小角度随机旋转(±15°)与平移 | 模拟摆放差异 |
| ✅ 安全 | 轻度亮度/对比度抖动(±10%) | 模拟曝光微差 |
| ✅ 安全 | 小幅随机缩放(0.9–1.1) | 模拟对焦差异 |
| ❌ 危险 | 大幅剪切/弹性形变 | 破坏核质比与核形判读依据,可能把正常细胞扭成异常形态 |
| ❌ 危险 | 强度色调大范围 HSV 扰动 | 巴氏染色的多色性是判读线索,过度扰动破坏颜色-类别关联 |
| ❌ 危险 | 过大高斯噪声/重度模糊 | 掩盖核染色质纹理这一关键判读特征 |
Austin & Parvathi(2025)报告增广+正则化显著提升其基线成绩,说明该库上增广收益真实存在;但增广策略应避开上表危险区。
一个实用的增广强度标定方法:把增广后的样本与原始样本并排可视化,请一位不了解代码的同事判断"增广样本是否还像合格的涂片视野"——任何让人类判读者产生怀疑的形变或色调,大概率也在破坏细胞形态学的判读依据。四千级小样本上,增广从"可选优化"变成"必备项",但它的收益以不破坏医学语义为前提。
§6.7 模型推荐
| 模型 | 适用场景 | 论文报告成绩(协议各异) | 备注 |
|---|---|---|---|
| ResNet-18/50 | 首选基线,训练快 | —(社区复现常用) | 从 128×128 输入起步即可 |
| VGG-19(论文原版) | 复现官方基线 | 95.35%±0.42(5 折 CV,80×80) | 官方特征即出自该网络 |
| Xception | 冲击榜单 | 97.55%(Austin & Parvathi 2025) | 深度可分离卷积,参数效率好 |
| SqueezeNet | 轻量/边缘部署 | 96.90%(Şentürk & Süleyman 2022) | 参数量极小 |
| ViT/DeiT-Tiny | 大规模预训练迁移 | —(社区新趋势) | 4k 样本需强增广或大预训练 |
| 簇级检测+分类两段式 | 接近真实筛查流 | WSI 直接分类 96.74%(2025) | 用 966 张簇图 |
选型时的两条经验法则:第一,先看输入尺寸再选网络——论文原协议是 80×80,现代骨干多用 224×224,改输入尺寸会连带改变成绩口径,换网络与换尺寸不要同时做;第二,五类近均衡但形态混淆集中在"挖空 vs 角化不良"与"副基底 vs 化生"两对上,模型迭代时盯住这两对类的混淆率变化,比盯总准确率更能反映改进是否真实。
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 数据准备(掩码栅格化) | 4 核 CPU / 16 GB RAM | 8 核 CPU / 32 GB RAM | 一次性 CPU 任务,约 4,049×2 次多边形填充 |
| 五分类训练(128×128) | 1× 8 GB GPU(如 RTX 3060) | 1× 16 GB GPU(如 RTX 4090/V100) | batch 32-64,单折数十分钟量级 |
| 5 折×多种子完整评测 | 同上,时间×5 | 1× 24 GB GPU 或 2× 16 GB | 建议用后台脚本串行跑折 |
一个低成本起步方案:先用 CPU 完成掩码栅格化与特征复现(免 GPU),再租用按小时计费的云 GPU 跑 5 折分类——按单折数十分钟的量级,完整论文级评测的 GPU 开销在个位数 GPU 时,属于教学预算可覆盖的范围。
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import (classification_report, confusion_matrix,
balanced_accuracy_score, cohen_kappa_score)
def evaluate(y_true, y_pred, class_names):
"""五分类完整评估:宏平均优先(类别近均衡但仍需防单类塌陷)"""
print(classification_report(y_true, y_pred, target_names=class_names, digits=4))
print("Confusion matrix:\n", confusion_matrix(y_true, y_pred))
return {
"acc": float(np.mean(np.asarray(y_true) == np.asarray(y_pred))),
"balanced_acc": float(balanced_accuracy_score(y_true, y_pred)),
"kappa": float(cohen_kappa_score(y_true, y_pred)),
}
class_names = ["Superficial-Intermediate", "Parabasal", "Koilocytotic",
"Dyskeratotic", "Metaplastic"]
重点指标:宏平均 F1 与 balanced accuracy(防单类偏塌)、每类召回(筛查场景对异常类召回最敏感,漏检挖空/角化不良的代价高于误报)、按折聚合的均值±标准差(与论文协议对齐)。kappa 可用于与标注一致性未知的现实对齐。
| 指标 | 什么时候必须报告 | 理由 |
|---|---|---|
| Accuracy | 复现论文协议时 | 与官方基线同口径 |
| Macro F1 | 所有场景 | 类别轻微不平衡下的稳健总评 |
| Per-class Recall | 筛查相关结论 | 异常两类漏检代价不对称 |
| Confusion Matrix | 模型对比与错误分析 | 定位"挖空 vs 角化不良"等相近类混淆 |
| 均值±标准差(多折多种子) | 一切对外报告的成绩 | 单次数字在本库上无统计意义 |
| Balanced Accuracy / Kappa | 与临床读者沟通时 | 对先验差异更直观 |
补充两项进阶指标的处理建议:其一,二分类视角(正常+良性 vs 异常)下的 ROC-AUC 与五分类 macro-AUC(roc_auc_score(..., multi_class="ovr"))适合与筛查灵敏度指标一起报告,临床读者更熟悉;其二,若做按簇分组划分,建议额外输出"按簇聚合的多数投票成绩"——同一簇多个细胞的预测投票后判簇,更接近真实阅片中"同视野多细胞佐证"的工作方式,且与单细胞成绩的差值有明确的工程解释。
§6.10 MLOps 笔记
- 数据版本化:把 Kaggle 镜像的 Version 1 + 解压后文件计数(4,049/8,098/966)写入数据卡;任何再裁剪/清洗都生成新的派生版本而非原地修改。
- 划分即产物:按簇分组的折划分保存为 JSON(簇 ID → 折号),训练/评测/论文三方共用同一份划分文件。
- 指标追踪:每折记录宏 F1、每类召回与混淆矩阵快照;把"随机划分 vs 分组划分"双轨成绩作为常设对比项。
- 监控重点:上线筛查辅助时监控异常两类的召回漂移与染色分布漂移(见 §7.6),新染色批次先做小样本一致性评估。
- 合规留痕:成果中引用 ICIP 2018 论文(DOI: 10.1109/ICIP.2018.8451588)是许可条款的强制项,建议在代码仓库 README 与论文引用管理器中同时登记。
- 掩码缓存策略:栅格化产物(.npy 掩码)单独建目录存放,键为"细胞 ID + 栅格化实现版本号"——换栅格化实现时旧缓存自动失效,避免分割评测中静默混用两种边界的掩码。
- 实验可复现三件套:固定种子 + 固定划分文件 + 固定预处理缓存版本,三者齐备才能在论文返修时一键重跑。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 单中心设备偏倚 | 全部图像来自同一显微/相机体系(BX53F + Infinity 1),染色与曝光分布窄 | 高 | 跨库验证(Herlev、液基数据集);部署前用目标实验室图像做校准 |
| 制片工艺偏倚 | 仅常规涂片,无液基制片(LBC)样本 | 高 | 结论限定"常规涂片筛查",LBC 场景需另行采集或验证 |
| 同簇相关性 | 同簇裁出的多个细胞高度相关,随机划分虚增性能 | 中 | 按簇分组划分(§5.3、坑点 2) |
| 类别构成偏倚 | 异常两类的样本配额(各约 20%)高于真实筛查中的异常检出率,库内先验与临床先验不同 | 中 | 训练时按真实场景重设先验/阈值,不直接沿用库内比例 |
| 人口学盲区 | 患者数、年龄、种族全部未披露,公平性不可评估 | 中 | 不做人群级结论;公平性敏感场景改用含元数据的数据集 |
| 标注单轮性 | 无标注者间一致性数据,标签噪声水平未知 | 低-中 | 对边界样本保留容差;关键实验抽样复标 |
六类偏倚的共同根源是"学术型单中心数据集"的先天形态:数据质量高、工程元数据薄。缓解的优先级排序建议——同簇相关性与单中心设备偏倚是影响结论效度的两大项,应优先处理(分组划分 + 跨库验证);类别先验与人口学盲区影响的是部署适配,在向真实场景迁移时处理;标注单轮性属于残余风险,按容差设计即可。
§7.2 标注质量
类别标签与核/质轮廓均由含医学背景的作者团队单轮人工完成,轮廓为像素级多边形顶点,总体可信。公开渠道未见标注者间一致性(kappa)与轮廓复测报告;论文 Table 1 的 813/831 计数笔误也提示出版层面存在人工疏漏。使用建议:以文件实测计数为准;对分割研究,先按 §6.3 校验器清洗再评测。
从下游反馈看标注质量的两条间接证据:其一,原论文 CNN 基线达 95.35% 且混淆集中在形态相近类(挖空 vs 角化不良),说明类别边界与形态学判读常识一致,标签系统性错位风险低;其二,数据集被大量后续研究原样复用而鲜见"标签修正"类论文发表,侧面说明标注经受了社区检验。当然,95%+ 的库内成绩同时意味着标签噪声的上界——如果存在成片的错标,模型与标签会共同把噪声"学平",这正是必须保留按簇分组划分与人工抽检环节的原因。
§7.3 泛化性评估
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 库内随机划分 | 低风险但成绩虚高 | 同簇孪生样本泄漏(§5.3),分组划分后通常下降 |
| 跨制片工艺(常规涂片→液基) | 高 | 数据集仅含常规涂片;染色背景与细胞分散度分布不同 |
| 跨染色批次/跨设备 | 高 | 单设备采集;Austin & Parvathi 2025 跨到 Herlev 后成绩从 97.55% 降至 90.42%,佐证跨库衰减 |
| 恶性病变检测 | 不可用 | 数据集不含恶性细胞类别,任务定义外 |
| 腺细胞异常识别 | 不可用 | 五类均为鳞系细胞,无腺细胞样本 |
§7.4 伦理与合规
数据集为细胞级匿名图像,不含患者身份、人口学或可关联信息;官方页面声明可公开获取并用于实验目的,要求引用 ICIP 2018 论文。原始涂片采集的知情同意与伦理审批流程官方未详述,使用者若需在受监管研究(如临床试验)中复用,应自行补充合规评估。无 DUO 机制,商业用途授权范围未明确,建议商用前联系发布方确认。
与需要凭证化申请的医疗数据集(如 PhysioNet 系资源)相比,SIPaKMeD 的"零门槛获取"是把双刃剑:研究者能够即刻启动,但也意味着没有任何机构层面的使用审查——数据被用于原始许可范围之外(如再分发出售、训练商业产品)的风险完全依赖使用者的自律。学术使用者应做的最低限度合规动作:成果中引用论文、不再分发生成派生数据集时明确标注来源与许可、不在应用层声称数据集本身经过临床验证。
§7.5 公平性
数据集不含年龄、种族、地域等人口学字段,无法进行亚组性能评估;样本全部来自希腊单一国家。任何"跨人群公平"声明都不具备数据支撑。在公平性敏感的部署中,应把"本库预训练 + 目标人群数据微调"作为默认路径,并在部署评估中补充目标人群亚组指标。
§7.6 数据漂移
主要漂移源:染色试剂批次与染色时间差异、显微镜/相机更换、制片工艺从常规涂片向液基过渡(临床趋势)。这些漂移在库内不可观测(单设备单批次体系未披露),属于"库内不可见、部署必遭遇"的类型。缓解:上线后监控输入图像的 RGB 分布统计与异常两类召回率;引入染色归一化(Macenko/Vahadane)降低染色域差距。
可操作的漂移监控方案:为每个上线批次抽取 50-100 张图,计算 RGB 通道均值向量,与训练分布做马氏距离检验,超阈值即触发人工抽检与可能的微调;同时维护一个 100-200 张的本地金标准集(由目标实验室阅片者标注),每次模型或数据管线变更后回归测试——这比库内验证集更能反映"漂移中的真实性能"。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 特征表每行对应一个细胞,符合分析惯例 |
| 2 | 唯一标识 | ✅ | 细胞以"文件名主干+所属类目录"唯一标识 |
| 3 | 特殊字符 | ✅ | 文件与目录名仅含字母、数字、连字符与下划线 |
| 4 | 重复行 | ✅ | 官方镜像未见重复文件;特征表无重复记录报告 |
| 5 | 缺失编码 | ✅ | 无需缺失编码约定,图像与轮廓文件完整配对 |
| 6 | 标签标识 | ✅ | 类别由目录结构隐含,映射明确无歧义 |
| 7 | 罕见类分组 | ⚠️ | 五类近均衡(787–831),无罕见类;但官方未提供任何合并/重加权指引 |
| 8 | 偏倚评估 | ⚠️ | 官方未发布偏倚声明;单中心、单设备偏倚需使用者自查(§7.1) |
| 9 | 数据字典 | ⚠️ | 26 个手工特征在论文中有定义但粒度有限,无逐列官方字典文件 |
| 10 | 信息性缺失解释 | ✅ | 数据无缺失单元格,不存在信息性缺失约定 |
| 11 | 设备记录 | ✅ | 显微镜(OLYMPUS BX53F)与相机(Infinity 1 Lumenera)型号官方披露 |
| 12 | 共线性 | ⚠️ | 形状类手工特征(面积/周长/等效直径等)存在理论共线性风险,官方未提供相关性分析 |
| 13 | 编码映射 | ⚠️ | 与 ICD-11/SNOMED CT/Bethesda 的映射官方未提供(本词条 §2.1 为参考性整理) |
| 14 | 时间戳处理 | ✅ | 无时间字段,不适用 |
| 15 | 划分建议 | ⚠️ | 无官方 train/test 划分,论文协议为 5 折 CV,复现需自行设计(§5) |
| 16 | 泄漏讨论 | ⚠️ | 官方未讨论同簇细胞泄漏;本词条 §5.3 与坑点 2 已补全分析与方案 |
| 17 | 标签分布 | ✅ | 类计数公开可实测(含 Table 1 笔误注记,见 §3.2) |
| 18 | 测量偏倚 | ⚠️ | 单设备单中心;放大倍率官方未披露,物理尺度不可标定 |
| 19 | 外部验证建议 | ⚠️ | 官方未给出外部验证协议;社区已有跨库实践但无标准方案 |
| 20 | 版本记录 | ⚠️ | 仅 Version 1,无变更日志;2018 年发布后未更新 |
| 21 | 预处理脚本 | ⚠️ | 官方未发布加载/预处理代码;轮廓栅格化需自行实现(§6.3 已给参考实现) |
| 22 | 合规要求 | ✅ | 许可条款清晰:实验目的使用 + 引用论文;获取流程简单透明 |
| 23 | 多模态对齐 | ✅ | 图像-核轮廓-质轮廓-特征表按文件名主干严格对齐 |
| 24 | 去标识化 | ✅ | 细胞级匿名图像,不含患者可识别信息 |
DAIMS 评分:18.5 / 24(✅×13 + ⚠️×11,❌×0)
评分解读:数据本身的完整性与对齐质量(标识、配对、去标识化、合规)达到优秀水准,构成它 434+ 引用量的硬基础;失分几乎全部集中在"研究基础设施"一侧——无官方划分、无预处理脚本、无偏倚与一致性声明、无外部验证协议。这是典型的"数据优秀、工程配套缺位"的学术数据集形态。
对你意味着什么:可以直接把它当作分类/分割研究的可信数据源,但必须自带三件套——按簇分组的划分方案(§5.4)、轮廓栅格化与清洗管线(§6.3)、以及把"随机划分 vs 分组划分"双轨成绩写进实验报告的纪律。如果你的团队没有时间实现这三件套,建议先用 §6.4 的现成代码起步,切勿直接拿文献数字当基线。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Herlev Pap Smear(7 类) | 丹麦 Herlev 大学医院 | 跨库迁移分类 | 准确率 90.42%(Xception) | 相对库内 97.55% 下降约 7.1 个百分点 | Austin & Parvathi 2025(Sci Rep 15:23936):跨库衰减显著但方法仍有效,作者归因于 7 类任务更难与分布差异 |
| Herlev Pap Smear(2/7 类) | 同上 | 跨库迁移分类 | ResNet50 95%(Herlev 库内) | 与本库(VGG16 99.95%)不同协议不可直接比 | Kaur et al. 2025(Sci Rep 15:3945):同批模型跨库表现受任务定义影响大 |
截至 2026-09,SIPaKMeD 尚无统一协议下的多中心外部验证研究;上表仅录同行评审文献报告值,协议差异见 §8.3。
§8 基准性能与生态
§8.1 五分类准确率排行榜
⚠️ 下列数字来自不同划分协议与输入尺寸,不可直接横向比较;协议列仅供参考,严格对比请回到 §8.3 的原论文协议复现。
| 排名 | 模型 | 准确率 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | VGG16(迁移学习) | 99.95%* | 2025 | 16 种预训练模型系统对比 | Kaur, H., Sharma, R., Kaur, J. (2025). Scientific Reports 15:3945. DOI: 10.1038/s41598-024-74531-0 | — |
| 2 | Xception | 97.55% | 2025 | 迁移学习+增广+正则化 | Austin, R., Parvathi, R. (2025). Scientific Reports 15:23936. DOI: 10.1038/s41598-025-10009-x | — |
| 3 | LSTM+CNN+ViT 集成 | 97.65% | 2023 | 混合架构集成 | Maurya et al. (2023). Neural Computing and Applications(转引自其引文网络) | — |
| 4 | SqueezeNet | 96.90% | 2022 | 轻量网络迁移学习 | Şentürk, U., Süleyman (2022)(转引自 Sci Rep 2025 Table 15) | — |
| 5 | CNN(VGG-19 风格) | 95.35%±0.42 | 2018 | 原论文基线,5 折 CV,80×80 | Plissiti, M.E. et al. (2018). ICIP 2018, pp. 3144-3148. DOI: 10.1109/ICIP.2018.8451588 | — |
| 6 | Deep fc SVM | 94.44%±1.21 | 2018 | VGG-19 fc6 特征+SVM | 同上(Plissiti et al. 2018) | — |
| 7 | Bagging 集成 | 94.09% | 2020 | 经典集成学习 | Win et al. (2020)(转引自 Sci Rep 2025 Table 15) | — |
| 8 | CerviFormer | 93.70% | 2024 | Transformer 架构 | Deo et al. (2024)(转引自 Sci Rep 2025 Table 15) | — |
| 9 | Deep conv SVM | 93.35%±0.62 | 2018 | VGG-19 conv5 特征+SVM | 同上(Plissiti et al. 2018) | — |
| 10 | AlexNet | 87.32% | 2020 | 早期迁移学习 | Haryanto et al. (2020)(转引自 Sci Rep 2025 Table 15) | — |
* Kaur et al. 的 99.95% 在宽松协议下取得且接近理论上限,解读时应视为协议差异的产物而非可比成绩(见坑点 4)。
§8.2 SOTA 总结与选型建议
成绩序列的三条规律:其一,2018 年原论文的 95.35% 与 2025 年的 97.55% 之间只有约 2.2 个百分点的"诚实进步空间",库内刷分已近饱和,新方法应转向更难的协议(按簇分组划分、跨库验证);其二,"深度特征+SVM"路线(94.44%)与端到端 CNN(95.35%)差距很小,小样本场景下前者仍是高性价比选择;其三,榜单头部被迁移学习占据,从 ImageNet 预训练出发是默认最优起点。工程选型建议:原型期用 ResNet-18,冲榜/发文用 Xception 或其变体,部署到边缘设备参考 SqueezeNet 路线。
从方法演进的时间线还能读出两点社区共识:Transformer 路线(CerviFormer 93.70%)在四千级小样本上并未兑现其在自然图像上的优势,数据规模仍是硬约束;而"WSI 簇图免分割直接分类"(96.74%,Austin & Parvathi 2025)提示预处理管线本身可以是被简化对象——当你需要处理整张簇图而非预裁剪细胞时,这是一个已被验证的工程方向。
§8.3 评测协议基准
原论文协议(复现官方基线的唯一口径):五分类任务;输入统一为 80×80(RGB);五折交叉验证;报告均值±标准差;三个特征路线分别评测——仅核 SVM(输入核区 80×80)、核+质 SVM(输入质区 80×80)、深度模型(全图)。基线成绩:核 SVM 83.45%±1.53、核+质 SVM 91.68%±0.98、CNN 95.35%±0.42、deep conv SVM 93.35%±0.62、deep fc SVM 94.44%±1.21。混淆分析:koilocytotic 是最难类(与 dyskeratotic 及表层-中层混淆最多)。
若要在论文中报告新成绩,建议的协议披露清单:划分方式(细胞级/簇级)与折数、输入尺寸与插值方式、归一化常数来源、增广明细与是否作用于验证折、每类样本数在折间的波动范围、随机种子数量与汇总统计量(均值±标准差而非单次最好成绩)、以及所有基线是否在完全相同管线重跑。这九项补齐后,成绩才能进入"可比较"的讨论范围。
§8.4 相关数据集
| 数据集 | 关系 | 差异化说明 |
|---|---|---|
| Herlev Pap Smear(丹麦,917 张,7 类) | 互补 | 唯一含恶性类别的公开单细胞集;规模约为本集 1/4.4;跨库验证首选搭档 |
| ISBI 2014 重叠宫颈细胞分割挑战赛数据(纯文字提及) | 互补 | 面向重叠细胞分割,无五类语义标签 |
| Mendeley 液基宫颈细胞数据集(纯文字提及) | 互补 | 液基制片,可检验跨制片工艺泛化 |
| Cervix93(纯文字提及) | 互补 | 阴道镜模态,器官级视角 |
组合使用的两条典型路线:其一"SIPaKMeD 预训练 → Herlev 微调/评测",利用两库类别体系的最大公约数(正常/异常轴),用于报告跨库泛化;其二"SIPaKMeD 单细胞模型 + 簇图检测器"两段式,把本库的 966 张簇图用于检测端微调,形成从全视野到单细胞的完整筛查原型。两条路线都要求在论文中明确说明类别映射假设,不得默认五类与对方数据集的类别一一对应。
§8.5 关键论文 Top 5
- Plissiti, M.E., Dimitrakopoulos, P., Sfikas, G., Nikou, C., Krikoni, O., Charchanti, A. (2018). “SIPaKMeD: A dataset for the classification of the Pap smear cells into normal, benign and premalignant categories”. 25th IEEE ICIP, Athens, pp. 3144-3148. DOI: 10.1109/ICIP.2018.8451588 —— 数据集原始论文,定义五类体系与全部官方基线。
- Austin, R., Parvathi, R. (2025). “CNN based method for classifying cervical cancer cells in pap smear images”. Scientific Reports 15:23936. DOI: 10.1038/s41598-025-10009-x —— Xception 97.55% 与 WSI 免分割分类 96.74%,现役 SOTA 之一。
- Kaur, H., Sharma, R., Kaur, J. (2025). “Comparison of deep transfer learning models for classification of cervical cancer from pap smear images”. Scientific Reports 15:3945. DOI: 10.1038/s41598-024-74531-0 —— 16 种预训练模型系统对比,展示协议对成绩的影响。
- Şentürk, U., Süleyman (2022)(SqueezeNet 96.90%,转引自 Sci Rep 2025 Table 15)—— 轻量模型路线的代表成绩。
- Maurya et al. (2023). “Deep learning-based approaches for robust classification of cervical cancer”. Neural Computing and Applications —— LSTM/CNN/ViT 混合集成 97.65%。
§8.6 社区活跃度
截至 2026-09:Google Scholar 引用 434+,且以每年数十篇的速度持续累积;Kaggle 官方镜像(作者本人维护)为最大流量入口,社区 notebook 覆盖从读图到迁移学习的完整链路;数据集无官方 GitHub issue 渠道,问题讨论集中在 Kaggle 讨论区。活跃度定性结论:学术引用稳定增长、工程社区活跃、官方维护低频(版本冻结于 2018)。
选择它做研究基座的一个隐性好处是"引用兼容性":434+ 的引用池意味着审稿人普遍认识这份数据,方法对比表中出现它的成绩不需要额外解释数据来源;同时,大批量已发表结果提供了现成的"文献成绩带"(87%–99.95%),任何新协议下的结果都能快速定位自己在带中的位置。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| 官方主页 | 数据+论文入口 | https://cs.uoi.gr/~marina/sipakmed.html | 权威来源,含论文与团队信息 |
| Kaggle 官方镜像 | 托管分发 | https://www.kaggle.com/datasets/marinaeplissiti/sipakmed | 一行命令下载,作者本人发布 |
| ICIP 2018 论文 | 原始文献 | https://doi.org/10.1109/ICIP.2018.8451588 | 全部官方基线与协议出处 |
| Sci Rep 2025(Xception) | SOTA 文献 | https://doi.org/10.1038/s41598-025-10009-x | 现役成绩天花板与跨库参照 |
| Sci Rep 2025(DTL 对比) | 方法对比文献 | https://doi.org/10.1038/s41598-024-74531-0 | 16 模型横向对比 |
生态判断:该数据集的维护重心已从"发布方"转移到"引用社区"——官方渠道 2018 年后无实质更新,而引用与复现活动持续扩张。使用者应把本词条 §4-§6 的结构解析与代码视为对官方文档缺位的社区级补充,并以官方渠道为最终事实依据。
§9 相关资源与引用
§9.1 官方资源
- 官方主页(数据下载、论文、团队信息):https://cs.uoi.gr/~marina/sipakmed.html
- Kaggle 官方镜像(推荐下载渠道):https://www.kaggle.com/datasets/marinaeplissiti/sipakmed
- 原始论文(IEEE Xplore):https://doi.org/10.1109/ICIP.2018.8451588
- 论文第一作者学术主页(University of Ioannina 计算机科学与工程系):https://cs.uoi.gr/~marina/
§9.2 BibTeX 引用
使用本数据集的最小引用集合:原始论文(必选)+ 你实际参照的方法论文。
引用位置建议:方法部分引用数据集时用 plissiti2018sipakmed;引用具体基准数字时逐条对应原始文献(如 97.55% 引 austin2025cnn),避免"数据集论文替方法论文背数字"的常见引用错位。若研究同时使用了本数据集与 Herlev,两者分别引用各自的原始文献,不要合并成一句"宫颈细胞数据集"。
@inproceedings{plissiti2018sipakmed,
author = {Plissiti, Marina E. and Dimitrakopoulos, P. and Sfikas, G.
and Nikou, Christophoros and Krikoni, O. and Charchanti, A.},
title = {{SIPaKMeD}: A dataset for the classification of the {Pap} smear
cells into normal, benign and premalignant categories},
booktitle = {2018 25th IEEE International Conference on Image Processing (ICIP)},
year = {2018},
address = {Athens, Greece},
pages = {3144--3148},
doi = {10.1109/ICIP.2018.8451588}
}
@article{austin2025cnn,
author = {Austin, Remita and Parvathi, R.},
title = {{CNN} based method for classifying cervical cancer cells in
pap smear images},
journal = {Scientific Reports},
volume = {15},
pages = {23936},
year = {2025},
doi = {10.1038/s41598-025-10009-x}
}
@article{kaur2025comparison,
author = {Kaur, Harmanpreet and Sharma, Reecha and Kaur, Jagroop},
title = {Comparison of deep transfer learning models for classification
of cervical cancer from pap smear images},
journal = {Scientific Reports},
volume = {15},
pages = {3945},
year = {2025},
doi = {10.1038/s41598-024-74531-0}
}
§9.3 引用指南
许可条款要求任何使用都必须引用 plissiti2018sipakmed;引用类计数时建议注明"表层-中层类按实测 831 计(论文 Table 1 印作 813,与总数 4,049 存在出版笔误)“;引用成绩时必须同时给出划分协议,禁止把不同协议的准确率并列成"进步曲线”。
§10 AI 使用声明卡
§10.1 本词条生产使用的 AI 模型
- 大语言模型(文本撰写与结构化整理):CodeBuddy Code 会话模型(腾讯混元体系,fast-model)
- 联网检索:WebSearch / WebFetch 工具(事实核实)
§10.2 AI 参与范围
AI 负责检索信息源、整理事实清单、起草正文与代码示例;全部医学编码映射、关键数字(规模、基准、引用数)与纠错结论均经人工比对来源复核;代码示例经逻辑审校但未在本环境中实际执行,使用者应先在本地验证。
AI 生成内容的三项已知风险与对应处置:其一,代码示例中涉及本地文件名/列名的部分(如特征表文件名)可能与实际下载不符——文中已逐处标注"以实际下载为准",使用前请核对;其二,文献转引的成绩(Şentürk、Win、Deo 等条目)未经原始论文全文核对,均标注"转引"字样;其三,官方未披露的信息(患者数、采集期、放大倍率)一律写明"官方未披露"而非推测值。
§10.3 输入来源列表
- Plissiti, M.E., Dimitrakopoulos, P., Sfikas, G., Nikou, C., Krikoni, O., Charchanti, A. (2018). SIPaKMeD: A dataset for the classification of the Pap smear cells into normal, benign and premalignant categories. 25th IEEE ICIP, pp. 3144-3148. DOI: 10.1109/ICIP.2018.8451588(论文 PDF 全文已提取核对)
- SIPaKMeD 官方主页(University of Ioannina). https://cs.uoi.gr/~marina/sipakmed.html
- Kaggle 官方镜像(marinaeplissiti/sipakmed,Version 1,9.71 GB,License: Other). https://www.kaggle.com/datasets/marinaeplissiti/sipakmed
- IEEE Xplore 论文条目(DOI: 10.1109/ICIP.2018.8451588). https://doi.org/10.1109/ICIP.2018.8451588
- Austin, R., Parvathi, R. (2025). CNN based method for classifying cervical cancer cells in pap smear images. Scientific Reports 15:23936. DOI: 10.1038/s41598-025-10009-x
- Kaur, H., Sharma, R., Kaur, J. (2025). Comparison of deep transfer learning models for classification of cervical cancer from pap smear images. Scientific Reports 15:3945. DOI: 10.1038/s41598-024-74531-0
- PubMed 收录记录(PMID: 40615498,作者与单位信息). https://pubmed.ncbi.nlm.nih.gov/40615498/
- NASA ADS 收录记录(2025NatSR…1523936A,卷期页码核对). https://adsabs.harvard.edu/abs/2025NatSR..1523936A
- Maurya et al. (2023). Deep learning-based approaches for robust classification of cervical cancer. Neural Computing and Applications. https://www.researchgate.net/publication/372072436
- KEGG ICD-11 对照库(2E66 宫颈上皮内瘤变编码核实). https://www.kegg.jp/kegg-bin/get_htext?htext=br08411.keg
- OHDSI Athena 术语服务(SNOMED CT 285636001 Cervical intraepithelial neoplasia 核实). https://athena.ohdsi.org/search-terms/terms/198572
- WHO 宫颈癌专题(流行病学与 HPV 因果关系表述). https://www.who.int/westernpacific/health-topics/cervical-cancer
- arXiv 2506.15489(第三方 40× 物镜说法来源,未经官方确认). https://arxiv.org/abs/2506.15489
- 国家卫生健康委《国际疾病分类第十一次修订本(ICD-11)中文版》通知. http://www.phic.org.cn/zcbz/bzypj/bzgf/gjbz/202408/t20240819_438099.html
- Google Scholar 引用记录(434+,截至 2026-09,经检索结果摘要核实)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(编码映射/流行病学) | 千方病案医学编辑部 | 对照 ICD-11/SNOMED 权威源逐条核码 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 论文 PDF 全文与 Kaggle 镜像描述交叉核对 | ✅ 已通过 |
| §6 代码与坑点 | 千方病案医学编辑部(数据工程) | API 与目录结构逻辑审校 | ✅ 已通过 |
| §7 DAIMS 24 项 | 千方病案医学编辑部 | 逐项对照数据集实际状态 | ✅ 已通过 |
| §8 基准数字 | 千方病案医学编辑部 | 逐条溯源至论文表格或引用文献 | ✅ 已通过 |
| FACTS.md 纠错记录 | 千方病案医学编辑部 | 三处队列纠错全部复核 | ✅ 已通过 |
| §9 BibTeX 与引用指南 | 千方病案医学编辑部 | 逐字段与 IEEE Xplore/PubMed 收录记录比对 | ✅ 已通过 |
§10.5 AI 生成章节标注
全部章节由 AI 起草;§2.1/§2.1b 编码映射、§3.2 计数注脚、§7.7 DAIMS 评分与 §8.1 排行榜为 AI 整理后经人工逐条复核的内容;§0 免责声明为编辑部固定文本。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- herlev-pap — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学 / 评测基准
- panda — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学
- monuseg — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 评测基准
- paip — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 肿瘤学
- camelyon17 — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 评测基准
- unitopatho — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 评测基准
- nct-crc-he-100k — 共享标签:医学影像 / 医学问答与基准 / 病理图像 / 评测基准
- bbbc — 共享标签:医学影像 / 病理图像 / 评测基准
- pcam — 共享标签:医学问答与基准 / 病理图像 / 评测基准
- ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

