信息速览

PH2 — 经典皮肤镜图像数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PH2(PH²) |
| 英文全称 | PH² — A Dermoscopic Image Database for Research and Benchmarking |
| 别名/简称 | PH2、PH²、ADDI PH2 Database、Hospital Pedro Hispano Database |
| 疾病分类 | 2C30 皮肤恶性黑色素瘤 / 2F20 良性黑素细胞痣(含 2F20.1 非典型黑素细胞痣) |
| SNOMED CT | 2092003 Malignant melanoma / 254796009 Dysplastic nevus / 400096004 Melanocytic nevus(详见 §2.2) |
| 数据模态 | 影像(皮肤镜图像)+ 分割掩膜 + 结构化标注表(诊断与皮肤镜标准) |
| AI 任务类型 | 语义分割、图像分类(二分类/三分类)、皮肤镜标准识别(多标签)、跨数据集泛化测试 |
| 样本总数 | 200 张皮肤镜图像(80 普通痣 / 80 非典型痣 / 40 黑色素瘤) |
| 数据大小 | ~280 MB(BMP 原图 + 掩膜 + 标注表;单张原图约 1.3 MB) |
| 数据格式 | BMP(768×560 px,8-bit RGB 原图与 0/255 掩膜)/ TXT 标注表(部分镜像为 XLSX)/ 社区 PNG 转换版 |
| 许可证 | 学术免费使用:仅限研究与教学目的,禁止再分发与商业使用,发表必须引用 EMBC 2013 论文 |
| 访问级别 | 注册后开放(ADDI 官网填写快速注册表后下载) |
| DUO 标签 | HMB, NPUNCU, PUB |
| 语言 | 英文(标注表与文档) |
| 首发日期 | 2013-07-03(EMBC 2013 会议,日本大阪) |
| 最后更新 | 2013-09-26(IEEE Xplore 收录;此后数据冻结,无版本更新) |
| 发布机构 | 波尔图大学理学院(FCUP)ADDI 项目组 & Hospital Pedro Hispano 皮肤科(葡萄牙马托西纽什) |
| 官方主页 | https://www.fc.up.pt/addi/ph2 database.html |
| 下载地址 | https://www.fc.up.pt/addi/ph2 database.html(注册后下载 PH2Dataset.rar) |
| DOI | 10.1109/EMBC.2013.6610779 |
| 引用次数 | 1,018+(Semantic Scholar,截至 2026-09;另 Scopus 759 / Web of Science 398) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 全量专家标注(分割掩膜 + 诊断 + 7 项镜下标准)、单设备采集一致性高、社区加载工具成熟;扣分项:仅 200 张样本、无官方划分、许可禁止再分发、彩色掩膜非全量 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、黑色素瘤临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(标注表字段与取值体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与波尔图大学、Hospital Pedro Hispano、ADDI 项目组无任何商业利益关联。本页面不分发 PH2 数据集本身(其许可禁止再分发),仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守 PH2 官方使用条款(Terms of Use):仅限研究与教学目的、禁止再分发、禁止商业使用,且所有使用该数据的发表物必须引用 Mendonça et al. 2013(EMBC)论文。请从 ADDI 官方网站注册下载,不要使用第三方镜像。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
PH2 是波尔图大学理学院 ADDI 项目组与葡萄牙 Hospital Pedro Hispano 皮肤科于 2013 年联合发布的皮肤镜图像数据集,包含 200 张统一采集的皮肤镜图像(768×560 px)——80 颗普通痣、80 颗非典型痣、40 例黑色素瘤——每张图像都配有皮肤科专家手工勾勒的病灶分割掩膜、临床诊断标签和 7 项皮肤镜标准评分。
它的历史地位在于"三个第一":全球第一个公开的带完整医学标注的皮肤镜基准库(比 ISIC 挑战赛早 3 年、比 HAM10000 早 5 年);最早把"分割掩膜 + 诊断标签 + 镜下标准评分"三位一体的标注范式引入皮肤影像;以及引用最广的小样本皮肤数据集——原始论文 Semantic Scholar 引用已超过 1,000 次(截至 2026-09)。发布 13 年后,2026 年的新分割模型仍把它列为必刷基准。
你可以用它来:快速跑通一个病灶分割模型(Dice 0.88-0.97 的文献区间)、训练黑色素瘤 vs 痣的分类器原型、作为 ISIC/HAM10000 训练模型的独立外部泛化测试集、或者作为医学影像教学中最小可跑通的完整数据集。
§1.1 摘要
PH2 诞生于 ADDI 项目(Automatic computer-based Diagnosis system for Dermoscopy Images,波尔图大学理学院 FCUP 与 ISR/IST Lisbon 合作),目标是解决 2013 年前后皮肤镜 CAD 研究的致命问题:各家用私有图像自评、结果无法横向比较。数据全部来自葡萄牙马托西纽什 Hospital Pedro Hispano 皮肤科,使用 Tuebinger Mole Analyzer 系统 20 倍放大、相同条件采集,8-bit RGB、768×560 px。200 张图像按 80 普通痣 / 80 非典型痣 / 40 黑色素瘤三类构成,每张均由一名皮肤科专家完成手工病灶分割、临床诊断(0/1/2)与 7 项皮肤镜标准(不对称、色素网、点/球、条纹、退行区、蓝白幕、六色)评分;组织学诊断在可得时提供。黑色素瘤仅 40 张是官方有意为之:真实病例稀少,且黑色素瘤常未完整入镜、伪影较多,不宜全部用作金标准。全部受试者为 Fitzpatrick II/III 型肤色。数据经官网注册免费获取,禁止再分发与商用,发表须引用。
§1.2 战略价值分析
范式开创维度:PH2 的原始论文开宗明义——“各家系统在私有图像集上自评,没有公开数据库可以进行公平比较”。PH2 正是为终结这一局面而生:它第一次把"图像 + 专家分割掩膜 + 诊断 + 结构化皮肤镜标准"打包公开,让任何团队的算法都能在同一套金标准上对比。这一范式后来被 ISIC 系列(2016 起)和 HAM10000(2018)继承并放大。更前瞻的是,PH2 在 2013 年就实现了每张图像的 dense concept annotation(7 项皮肤镜标准逐项评分)——这与 2024 年发表于 Nature Medicine 的 MONET 概念检索模型所倡导的"用语义概念标注医学图像"思路一脉相承,早了整整 11 年。
生态推动维度:以 200 张的规模,PH2 撬动了远超其体量的大生态:Semantic Scholar 引用 1,018 次(截至 2026-09),覆盖肿瘤学、人工智能、计算机视觉等领域。2013-2026 年间,几乎每一篇皮肤镜分割论文都会在 PH2 上报告数字——从 U-Net 的 Dice 0.88 到 SkinFormNet 的 0.97,它见证了整个深度学习分割时代的性能爬升。由于规模小、单设备采集高度一致、标注全量,PH2 还成为"跨数据集泛化"研究的标准外部测试集:在 HAM10000 或 ISIC 上训练、在 PH2 上零样本测试,是泛化性研究的经典设计。
临床影响维度:PH2 的标注体系直接映射皮肤科临床评分规则(ABCD 法、7 分列表法、Menzies 法共用的核心标准),使算法研究天然贴近临床可解释性——模型不仅要答"良性/恶性",还要回答"色素网是否典型、有无蓝白幕"。官方文档明确指出该库可用于皮肤科医师培训:住院医师可将自己的诊断与库内金标准对比。这一"结构化镜下标准"设计直接启发了后来的 Derm7pt(7 分法数据集)等可解释 CAD 数据资源。
§1.3 横向对比
| 数据集 | 图像数 | 类别 | 分割掩膜 | 标注特色 | 核心差异化 |
|---|---|---|---|---|---|
| PH2 | 200 | 3(普通痣/非典型痣/黑色素瘤) | ✅ 全量专家手工 | 7 项皮肤镜标准 + 临床/组织学诊断 | 引用最广的小样本经典;单设备采集一致;外部测试首选 |
| MED-NODE | 170 | 2(痣/黑色素瘤) | ❌ | 临床 + 皮肤镜双视图 | 双模态视图,无掩膜 |
| Derm7pt | 1,011 | 8(含非黑素细胞病变) | 部分 | 7 分法结构化概念 | 概念标注粒度更细,病种更宽 |
| ISIC 2017 | 2,750 | 3 | ✅(官方划分) | 官方 train/val/test | 竞赛标准划分,结果可比 |
| HAM10000 | 10,015 | 7 | ❌ | 7 类诊断 + 部分元数据 | 大规模分类训练主力 |
| ISIC Archive | >50,000 | 9+ | 部分 | 持续更新、多来源 | 当前最大的皮肤镜资源池 |
PH2 的不可替代性不在规模,而在三点:标注密度最高(每图均有掩膜 + 诊断 + 7 项标准)、采集一致性最好(单中心单设备同条件)、历史可比性最强(13 年文献积累使其成为跨时代对照的锚点)。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2013-07-03 | PH2 在 EMBC 2013(第 35 届 IEEE 医学与生物工程学会年会,日本大阪)发表(Mendonça et al., pp. 5437-5440) |
| 2013-09-26 | 论文被 IEEE Xplore 收录(DOI: 10.1109/EMBC.2013.6610779);数据经 ADDI 官网开放注册下载,此后冻结无版本更新 |
| 2014 | Barata et al. 发表基于 PH2 的黑色素瘤检测系统(IEEE Systems Journal),ADDI 团队自产基线 |
| 2015 | CRC Press 书章 “PH2: A Public Database for the Analysis of Dermoscopic Images”(收录于 Dermoscopy Image Analysis)系统阐述库的设计 |
| 2016-2018 | ISIC 挑战赛与 HAM10000 相继发布,PH2 从"唯一基准"转为"经典小样本基准 + 外部测试集"双重角色 |
| 2019 | Tang et al. 提出 Separable-Unet + 随机权重平均,PH2 分割 Dice 达 94.13% |
| 2020 | Winkler et al.(JMIR Med Inform)系统揭示 PH2 黑色圆角边框对跨数据集分类器的混杂效应 |
| 2022 | FAT-Net(Medical Image Analysis)PH2 分割 DSC 0.944,Transformer 时代开启 |
| 2024 | CA-SLNet(PeerJ Computer Science)报告 PH2 分类准确率 99.50%(5 折 AUC 0.9814) |
| 2026 | IMA++ 多标注者数据集论文将 PH2 列为"现存最小的皮肤病变分割基准";LANET、SkinFormNet 等新模型继续以 PH2 为评测集 |
§1.5 典型 AI 应用场景
- 病灶语义分割基准:在 200 张专家掩膜上训练/评测 U-Net 系模型,报告 Dice / Jaccard——这是 PH2 最主流、文献最密集的用途。
- 黑色素瘤筛查分类器原型:三分类(普通痣/非典型痣/黑色素瘤)或二分类(良性 vs 恶性)快速原型验证,适合迁移学习与教学场景。
- 跨数据集泛化外部测试:在 ISIC / HAM10000 上训练、在 PH2 上零样本测试,评估模型的设备与机构迁移能力(Winkler 2020 的经典设计)。
- 可解释 CAD 与概念学习:利用 7 项皮肤镜标准评分做概念瓶颈模型、多任务学习或临床规则对齐研究。
- 医学影像教学:200 张的规模可在笔记本电脑上完整跑通"加载 → 预处理 → 训练 → 评估"全流程,是课程实验的理想数据集。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
PH2 覆盖黑素细胞肿瘤谱系的三个关键节点——良性(普通痣)、交界性(非典型痣)与恶性(黑色素瘤):
| 数据集类别 | 临床含义 | ICD-11 编码 | ICD-11 名称 | ICD-10 对应 |
|---|---|---|---|---|
| 0 — Common Nevus | 普通(通常获得性)黑素细胞痣 | 2F20.0 | 通常获得性黑素细胞痣 | D22.-(按部位细分) |
| 1 — Atypical Nevus | 非典型(发育不良)黑素细胞痣 | 2F20.1 | 非典型黑素细胞痣 | D22.-(临床口径,编码不区分非典型性) |
| 2 — Melanoma | 皮肤恶性黑色素瘤 | 2C30(含 2C30.0 浅表播散型 / 2C30.1 结节型 / 2C30.2 恶性雀斑型 / 2C30.3 肢端型) | 皮肤恶性黑色素瘤 | C43.-(按部位细分) |
为什么三分类是临床决策的核心:普通痣几乎不恶变(单颗痣终生恶变风险的经典估计约 0.03%),通常只需观察;黑色素瘤是致死率最高的皮肤肿瘤,必须尽早完整切除;非典型(发育不良)痣位于两者之间——它既是黑色素瘤的模拟者(镜下特征重叠,是假阳性/假阴性的主要来源),本身也是黑色素瘤风险标志物。三分类而非简单二分类的设计,使 PH2 天然包含"最难的灰色地带"样本。
§2.2 SNOMED CT 映射
| 数据集标签 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| Melanoma(类别 2) | 2C30 | 2092003 | Malignant melanoma (disorder) |
| Atypical Nevus(类别 1) | 2F20.1 | 254796009 | Dysplastic nevus (disorder) |
| Common Nevus(类别 0) | 2F20.0 | 400096004 | Melanocytic nevus (disorder) |
皮肤镜标准与临床评分体系的对应关系:PH2 的 7 项标准直接对应 ABCD 法(Asymmetry 不对称 / Border 边界 / Color 颜色 / Dermoscopic structures 结构)与 7 分列表法(atypical pigment network、blue-whitish veil、atypical vascular pattern、irregular streaks、irregular dots/globules、irregular blotches、regression structures)的核心条目,是按 ABCD 总皮肤镜评分(TDS = A×1.3 + B×0.1 + C×0.5 + D×0.5)等临床规则做"规则对齐模型"的天然标签。
§2.3 疾病简介
黑色素瘤是致死率最高的皮肤肿瘤。据 GLOBOCAN 2022,全球当年新发皮肤黑色素瘤约 331,722 例、死亡约 58,667 例,为第 17 位常见癌症;年龄标化发病率以大洋洲(29.78/10 万)、北美(16.3/10 万)与欧洲(10.43/10 万)最高,与白种人群和紫外线暴露强相关。预后高度依赖分期:早期(局限性)黑色素瘤 5 年生存率可超过 95%,而远处转移后骤降至约 15%-35%——"早诊早切"是改善结局的唯一决定性杠杆。
皮肤镜(dermoscopy)是无创的表皮显微成像技术,可显示肉眼不可见的色素网、条纹、蓝白幕等皮下结构,将诊断准确性较肉眼提升约 20%-30%。但 Kittler et al. 2002(Lancet Oncology)的荟萃分析指出:皮肤镜的诊断收益显著依赖医师经验——这正是计算机辅助诊断(CAD)的切入点,也是 PH2 论文引言给出的建库动因。
§2.4 临床任务定义
| AI 任务 | 临床对应 | 标签来源 | 操作化定义 |
|---|---|---|---|
| 病灶分割 | 病灶边界界定(测量 ABCD 之 B、指导切除范围) | 专家手工掩膜 | 像素级二分类:病灶 vs 正常皮肤 |
| 三分类诊断 | 筛查分诊:观察(普通痣)/ 随访(非典型)/ 活检切除(黑色素瘤) | Clinical Diagnosis 0/1/2 | 图像级三分类;常合并为"良性(0+1)vs 恶性(2)"二分类 |
| 皮肤镜标准识别 | ABCD 法 / 7 分法的逐项评分 | 7 项标准标注 | 多标签分类:色素网(AT/T)、点/球(A/AT/T)、条纹(A/P)、退行区(A/P)、蓝白幕(A/P)、不对称(0/1/2)、六色多选 |
| 跨数据集泛化评估 | 器械/机构间诊断系统稳健性 | 同分类标签 | 在 ISIC/HAM10000 训练 → PH2 零样本测试 |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 单中心:Hospital Pedro Hispano 皮肤科,葡萄牙波尔图都会区马托西纽什(Matosinhos) |
| 采集时间 | 未公开(发表于 2013 年,采集应在此之前) |
| 样本规模 | 200 张图像(按图像计,非按患者;未公开患者人数与一患多图对应关系) |
| 类别构成 | 普通痣 80(40%)/ 非典型痣 80(40%)/ 黑色素瘤 40(20%) |
| 肤色分布 | 全部为 Fitzpatrick II 或 III 型(官方明示:皮肤颜色 white 至 cream white) |
| 年龄/性别 | 未公开(无任何患者级人口学元数据) |
| 入选标准 | 黑素细胞病变;图像质量、分辨率与皮肤镜特征经精选;黑色素瘤若未完整入镜或伪影过重则被排除 |
| 就医类型 | 皮肤科门诊皮肤镜检查 |
关键提示:PH2 是"图像级"而非"患者级"数据集。没有年龄、性别、病灶部位、Breslow 厚度等临床协变量——所有需要患者元数据的研究(如风险因素建模、亚组公平性分析)都无法在 PH2 内完成。
§2.6 金标准/参考标准
| 标注内容 | 产生方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| 病灶分割掩膜 | 手工勾勒,与原图同尺寸二值图 | 一名皮肤科专家(HPH 皮肤科) | 像素级专家金标准;单标注者、无一致性检验;边界主观性集中在非典型痣 |
| 临床诊断(0/1/2) | 专家读片诊断 | 同上 | 图像级主标签 |
| 组织学诊断 | 活检病理(“when available”,非全量) | 病理科 | 最强证据级别,但覆盖不全且未标明哪些图像有 |
| 7 项皮肤镜标准 | 专家逐项评分(ABCD/7 分法体系) | 同上 | 结构化概念标注,主观性随标准而异(蓝白幕、退行区主观性最高) |
理解 PH2 金标准的三条军规:(1) 所有标注出自同一名专家——无标注者间一致性数据,把掩膜当"绝对真理"会高估模型(详见 §6.5 坑点 6);(2) 病理确诊并非全量——部分诊断仅是临床诊断,这是它与 ISIC 2018(全病理)的本质差距;(3) 掩膜包含病灶主体但会带入取景暗角边缘——直接拿掩膜裁图做分类可能反而引入混杂(Winkler 2020 的实证,见 §6.5 坑点 1)。
§3 数据集规格
§3.0 版本抉择矩阵
PH2 只有一个版本(2013 年发布后冻结),真正的"版本抉择"是 PH2 vs 其他皮肤数据集。30 秒选型:
| 你的需求 | 推荐数据集 | 规模 | 理由 |
|---|---|---|---|
| 30 分钟跑通分割 baseline;笔记本可训;复现经典文献 | PH2 | 200 张(~280 MB) | 全量掩膜、单设备一致、文献基线最密集;U-Net 一晚可训 |
| 训练可部署的分类模型 | HAM10000 / ISIC Archive | 10,015 / >50,000 张 | 量级决定上限;PH2 只有 200 张,独立训练深度分类器必过拟合 |
| 与文献严格可比地报分割指标 | PH2 + ISIC 2017/2018 联合报告 | 200 + 2,750/2,594 | 社区惯例:PH2 报 Dice/JI,ISIC 报官方划分指标 |
| 7 分法概念学习 / 可解释 CAD | Derm7pt(可用 PH2 补充) | 1,011 张 | Derm7pt 概念粒度更细且含非黑素细胞病变;PH2 标准标注可作辅助 |
| 跨数据集泛化外部测试 | PH2 | 200 张 | 单设备黑角边框、独立机构来源,是检验模型鲁棒性的天然"压力测试" |
| 双视图(临床照 + 皮肤镜)研究 | MED-NODE | 170 张 | PH2 仅有皮肤镜视图 |
一句话结论:分割基准、教学演示、外部测试 → 选 PH2;大规模训练 → 选 ISIC/HAM10000;概念学习 → 选 Derm7pt。
PH2 vs HAM10000 关键差异速查:
| 维度 | PH2 | HAM10000 |
|---|---|---|
| 发布年份 | 2013 | 2018 |
| 图像数 | 200 | 10,015 |
| 类别 | 3(仅黑素细胞病变) | 7(含 BCC、AKIEC 等非黑素细胞病变) |
| 分割掩膜 | ✅ 全量专家手工 | ❌ 无 |
| 皮肤镜标准标注 | ✅ 7 项逐图评分 | ❌ |
| 患者元数据 | ❌(仅图像级) | ✅(年龄、性别、部位、诊断确认方式) |
| 采集设备 | 单一(Tuebinger Mole Analyzer 20x) | 多来源多设备 |
| 官方划分 | ❌ | ❌(社区惯例划分) |
| 许可 | 研究教学免费 + 禁止再分发 | CC BY-NC 4.0 |
| 典型角色 | 分割基准 / 外部测试集 | 分类训练主力 |
§3.1 模态详细说明
PH2 包含三层数据:
- 皮肤镜 RGB 图像(主模态):8-bit RGB、768×560 px、BMP 无损格式。全部经 Tuebinger Mole Analyzer 系统 20 倍放大、相同条件采集——光照、放大倍率、分辨率的高度一致是 PH2 区别于多来源数据集(HAM10000、ISIC Archive)的核心特征。图像普遍带有该设备取景产生的黑色圆角边框(暗角),是后续一切预处理讨论的焦点(见 §6.5 坑点 1)。
- 分割掩膜:每张图像配一张同尺寸二值 BMP 掩膜(病灶为白、背景为黑,0/255 取值),由专家手工勾勒。部分图像还附 ROI / 颜色分割掩膜(“if available”,非全量)。
- 结构化标注表:一行一图,含图像名、临床诊断(0/1/2)与 7 项皮肤镜标准取值,是"图像之外"最被低估的资产——可直接驱动多任务学习与概念瓶颈模型。
§3.2 样本量拆分
| 子集 | 图像数 | 占比 | 说明 |
|---|---|---|---|
| 普通痣(Common Nevus,类别 0) | 80 | 40% | 良性 |
| 非典型痣(Atypical Nevus,类别 1) | 80 | 40% | 良性(交界性) |
| 黑色素瘤(Melanoma,类别 2) | 40 | 20% | 恶性 |
| 合计 | 200 | 100% | 良性 : 恶性 = 160 : 40 = 4 : 1 |
官方不提供 train/validation/test 划分(详见 §5.1)。掩膜全量 200 张;彩色分割掩膜仅部分图像提供。
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 原始发布 | PH2Dataset.rar | ADDI 官网注册后下载(约 280 MB) |
| 图像 | BMP,768×560 px,8-bit RGB,单张约 1.3 MB | 命名 IMDxxx.bmp,ID 不连续(IMD002-IMD435 区间) |
| 掩膜 | BMP,768×560 px,0/255 二值 | 命名 IMDxxx_lesion.bmp;部分图像另有 _roi 目录(ROI/颜色掩膜) |
| 标注表 | TXT(部分镜像为 XLSX) | 一行一图:Image Name / Clinical Diagnosis / Asymmetry / Pigment Network / Dots/Globules / Streaks / Regression Areas / Blue-Whitish Veil / Colors |
| PH2 Browser | Windows 可执行文件(x86/x64,MATLAB 编写) | 官方可视化工具:浏览标注、按标准检索、导出;需 MATLAB 或免费 MCR 运行时 |
| 社区转换版 | PNG 扁平目录 | datasetninja、openmedlab、Kaggle 等镜像(注意许可合规问题,见 §6.2) |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| 原图(200 张 BMP) | 约 258 MB | 768×560×3 bytes ≈ 1.29 MB/张 |
| 掩膜(200 张 BMP) | 约 20 MB | 二值掩膜压缩比高 |
| 标注表 + 工具 | <10 MB | PH2_dataset.txt + PH2 Browser |
| 整包(PH2Dataset.rar) | 约 280 MB | 磁盘预留 1 GB 足够 |
| 社区 PNG 转换版 | 约 100-300 MB | 视压缩方式而异(Kaggle 镜像显示 275.76 MB) |
§3.5 标注方式
纯人工专家标注,无任何自动或弱监督成分,流程为:
HPH 皮肤科临床皮肤镜检查(Tuebinger Mole Analyzer 20x,同条件)
→ 图像精选(质量/分辨率/镜下特征;剔除不完整入镜与重伪影图)
→ 专家逐图标注:
① 手工勾勒病灶边界 → 二值分割掩膜
② 临床诊断(0 普通痣 / 1 非典型痣 / 2 黑色素瘤)
③ 7 项皮肤镜标准评分(ABCD/7 分法体系)
④ 颜色分割掩膜(对含典型颜色区的图像,"if available")
→ 组织学诊断(对活检病例,"when available")
→ FCUP/ADDI 整理发布(图像 + 掩膜 + 标注表)
§3.6 标注者资质
| 维度 | 情况 |
|---|---|
| 标注者人数 | 1 名 |
| 资质 | 皮肤科专家(Hospital Pedro Hispano 皮肤科;末位作者 Jorge Rozeira 为该科主任) |
| 一致性检验 | 无——无多标注者、无重测一致性、无 kappa 系数公开 |
| 质控流程 | 未公开 |
单标注者是 PH2 标注质量评估的第一约束(详见 §7.2)。2026 年 IMA++ 论文将"多标注者分割"作为核心卖点时,正是以 PH2 这类单标注数据集为对照背景。
§3.7 数据采集时间范围
未公开。论文发表于 2013 年 7 月,采集应在 2013 年之前完成。无逐图时间戳字段,无法进行任何时间维度分析(横断面图像集)。
§3.8 地理覆盖
单中心——Hospital Pedro Hispano 皮肤科,葡萄牙波尔图都会区马托西纽什。葡萄牙属南欧,人群以 Fitzpatrick II/III 型肤色为主,与数据集的肤色构成一致。单中心 + 单一人种肤色构成是 PH2 最核心的泛化性限制(详见 §7.3)。
§3.9 采集设备规格
| 项目 | 规格 |
|---|---|
| 设备 | Tuebinger Mole Analyzer(接触式皮肤镜成像系统) |
| 放大倍率 | 20×(全库统一) |
| 图像参数 | 8-bit RGB,768×560 px,BMP 无损 |
| 采集条件 | 全部图像于同一皮肤科、相同条件下采集(官方明示 “under the same conditions”) |
| 设备特征伪影 | 黑色圆角边框(取景暗角)、偶有毛发/标尺/墨迹伪影 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 临床采集 | HPH 皮肤科门诊皮肤镜检查 | 黑素细胞病变患者在临床流程中接受皮肤镜成像 |
| 2. 图像精选 | ADDI 项目组 + 皮肤科专家 | 按质量、分辨率、镜下特征筛选 200 张;黑色素瘤因不完整入镜/伪影被大量剔除(40 张留存) |
| 3. 专家标注 | 一名皮肤科专家 | 逐图手工分割 + 诊断 + 7 项标准评分 + 颜色掩膜(部分);组织学诊断挂接(when available) |
| 4. 脱敏整理 | ADDI 项目组(FCUP) | 仅保留图像与标注,不含任何患者标识与临床元数据;IMD 编号不连续 |
| 5. 公开发布 | ADDI 官网(fc.up.pt) | 2013 年随 EMBC 论文开放,注册表 + 使用条款(禁止再分发/商用,须引用);PH2 Browser 同步发布 |
| 6. 冻结 | 无维护计划 | 2013 年后无版本更新、无扩充;社区镜像(Dropbox/Kaggle/GitHub)为第三方行为 |
§4 数据结构详解
§4.0 目录结构预览
PH2Dataset/
├── PH2 Dataset images/
│ ├── IMD002/
│ │ ├── IMD002_Dermoscopic_Image/
│ │ │ └── IMD002.bmp # 皮肤镜原图(768×560,8-bit RGB,约 1.3 MB)
│ │ ├── IMD002_lesion/
│ │ │ └── IMD002_lesion.bmp # 病灶分割掩膜(0/255 二值,同尺寸)
│ │ └── IMD002_roi/ # ROI / 颜色分割掩膜(仅部分图像有)
│ ├── IMD003/
│ │ ├── IMD003_Dermoscopic_Image/
│ │ │ └── IMD003.bmp
│ │ └── IMD003_lesion/
│ │ └── IMD003_lesion.bmp
│ ├── IMD004/ ...
│ └── IMD435/ # IMD 编号不连续(IMD002–IMD435 区间共 200 张)
├── PH2_dataset.txt # 标注表(一行一图;部分镜像为 PH2_dataset.xlsx)
└── PH2 Browser/ # 官方 MATLAB 可视化工具(Windows x86/x64)
加载口诀:按目录后缀路由——*_Dermoscopic_Image/ 取原图、*_lesion/ 取掩膜;IMD 编号是连接图像、掩膜与标注表的唯一键。
§4.1 DAIMS 标准化字段描述表
图像与掩膜层
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| image_id | TEXT | 图像唯一标识(目录名/文件名主干) | “IMD002” | 连接图像/掩膜/标注表的主键 | 编号不连续,勿假设连续 | 不允许缺失 | IMD002-IMD435 区间 200 个值 |
| image | BMP 图像 | 皮肤镜原图 | 768×560×3 uint8 | 模型输入 | 黑角边框、毛发/标尺伪影 | 不允许缺失 | uint8 [0,255] |
| lesion_mask | BMP 图像 | 专家病灶分割掩膜 | 768×560 uint8(0/255) | 分割监督信号 | 单标注者边界主观性;含暗角边缘 | 全量 200 张均有 | {0, 255},读取后 >127 二值化 |
| color_mask | BMP 图像 | 颜色/ROI 分割掩膜 | 768×560 uint8 | 颜色概念监督 | “if available” 非全量 | 部分图像无此目录(MNAR_标注未做) |
标注表层(PH2_dataset.txt,一行一图)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Image Name | TEXT | 图像标识(主键) | “IMD002” | 连接键 | 与目录名一致 | 不允许缺失 | 200 个唯一值 |
| Clinical Diagnosis | INT | 临床诊断主标签 | 2 | 分类监督 | 病理确诊非全量(when available) | 不允许缺失 | 0=普通痣 / 1=非典型痣 / 2=黑色素瘤 |
| Asymmetry | INT | 不对称性评分 | 1 | 概念标签(ABCD 之 A) | 专家主观评分 | 不允许缺失 | 0=全对称 / 1=单轴不对称 / 2=双轴不对称 |
| Pigment Network | TEXT | 色素网 | “AT” | 概念标签 | 主观 | 不允许缺失 | AT=非典型 / T=典型 |
| Dots/Globules | TEXT | 点/球状结构 | “A” | 概念标签 | 主观 | 不允许缺失 | A=无 / AT=非典型 / T=典型 |
| Streaks | TEXT | 条纹 | “P” | 概念标签 | 主观 | 不允许缺失 | A=无 / P=有 |
| Regression Areas | TEXT | 退行区 | “A” | 概念标签 | 主观性较高 | 不允许缺失 | A=无 / P=有 |
| Blue-Whitish Veil | TEXT | 蓝白幕 | “A” | 概念标签(7 分法高分项) | 主观性较高 | 不允许缺失 | A=无 / P=有 |
| Colors(6 列) | TEXT/标记 | 病灶含色(多标签) | Light-Brown=X | 概念标签(ABCD 之 C) | 主观 | 未标记即无该色 | 1=白 / 2=红 / 3=浅棕 / 4=深棕 / 5=蓝灰 / 6=黑 |
§4.2 标签分布统计
| 任务口径 | 分布 | 说明 |
|---|---|---|
| 三分类(官方主口径) | 普通痣 80(40%)/ 非典型痣 80(40%)/ 黑色素瘤 40(20%) | 类别 0/1/2 |
| 二分类(良性 vs 恶性) | 良性 160(80%)/ 恶性 40(20%) | 4:1 不平衡;accuracy 单独使用会误导(必报 Sens/Spec/AUC,见 §6.5 坑点 4) |
| 二分类(痣 vs 黑色素瘤,合并 0+1) | 同上 | 文献中最常用口径 |
| 分割 | 前景像素占比因图而异(病灶面积占比通常 10%-60%) | 黑色素瘤病灶常更大且贴近边缘 |
| 皮肤镜标准 | 逐图 7 项评分(官方未发布全库频次统计) | 可按标注表自行统计,用于概念学习 |
§4.3 关键字段描述性统计
- 全部 200 张图像尺寸一致(768×560 px、约 43 万像素/通道),无任何尺寸分布问题——这在多来源数据集中罕见。
- 单张原图约 1.29 MB(BMP 无损);整库约 280 MB,可完全载入现代笔记本内存。
- 掩膜全量 200 张;
_roi颜色掩膜仅部分图像提供。 - IMD 编号不连续(IMD002-IMD435 区间),共 200 个有效 ID——写加载器时不要用
range(1, 201)生成文件名。 - 全部图像带设备特征性黑色圆角边框;毛发、标尺、墨迹等伪影散见,黑色素瘤类伪影相对更多。
§4.4 数据层级关系
IMD ID(如 IMD002,唯一键,200 个)
├─ 原图:IMDxxx_Dermoscopic_Image/IMDxxx.bmp(1:1)
├─ 病灶掩膜:IMDxxx_lesion/IMDxxx_lesion.bmp(1:1)
├─ 颜色/ROI 掩膜:IMDxxx_roi/(0:1,部分图像)
└─ 标注表行:PH2_dataset.txt 中 Image Name = IMDxxx 的一行
├─ Clinical Diagnosis(分类主标签)
└─ 7 项皮肤镜标准(概念标签组)
- 无患者级层级:官方未公开"一患多图"对应关系。理论上同一患者的多颗痣可能同时入库(防御措施见 §5.3)。
- 无序列/时序层级:横断面单时点图像,无随访。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 字段 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| MNAR_流程 | 组织学诊断 | 仅活检病例有病理(“when available”);良性痣常不送检 | 缺失 ≈ 临床判断无需活检(偏良性) | 以"病理确诊"筛子集会引入良性欠代表的验证偏倚 |
| MNAR_标注 | 颜色/ROI 掩膜 | “if available”——仅对含典型颜色区的图像制作 | 缺失 ≈ 该图无典型可分色区 | 用颜色掩膜做监督时样本非随机子集 |
| 结构性缺失 | 患者元数据(年龄/性别/部位/肤色细分) | 官方未采集或未公开 | 全字段缺失 | 无法做亚组与公平性分析(见 §7.5) |
| 结构性缺失 | 采集时间戳 | 未公开 | 全字段缺失 | 无时间维度分析可能 |
| 标签口径 | 二分类标签 | 官方仅给三分类 | 良性 = 0 与 1 合并系社区惯例 | 不同论文"良性"口径不一(0 vs 0+1),注意对齐 |
§5 数据划分与使用建议
§5.1 官方数据划分
PH2 官方不提供任何 train/validation/test 划分。 这是 200 张小样本数据集的常见做法,但直接后果是:各论文自建划分(7:3、8:2、100-50-50、5 折交叉验证皆有),不同论文的绝对数字严格来说不可直接比较(详见 §6.5 坑点 3)。社区常用惯例:DTU 深度学习课程的 100-50-50 随机划分、UCM-Net 等分割仓库的 7:3 划分、分类研究的 5 折交叉验证。
§5.2 推荐划分策略
- 分层随机划分(首选):按三分类标签分层,7:1.5:1.5 或 8:1:1 切分,保证 40/40/20 的类别比例在三子集中一致。200 张下测试集仅 30-40 张,指标方差大,务必同时报告置信区间或改用交叉验证。
- 分层 5 折交叉验证(小样本最佳实践):5 折分层 CV 报告 mean ± std,是比单次划分更稳健的文献口径(CA-SLNet 即采用 5 折报告 AUC 0.9814±0.0121)。
- 先划分、后增强(铁律):任何旋转/翻转/颜色增强必须只在训练集内进行(详见 §6.5 坑点 2)。
- 固定并公开随机种子:200 张下换一个种子,测试集指标可波动数个百分点;论文中必须报告种子与划分文件。
import numpy as np
from sklearn.model_selection import StratifiedShuffleSplit
# labels: 长度 200 的类别数组(0/1/2),与 IMD ID 列表一一对应
sss = StratifiedShuffleSplit(n_splits=1, test_size=0.15, random_state=42)
train_idx, test_idx = next(sss.split(np.zeros(len(labels)), labels))
train_ids = [imd_list[i] for i in train_idx]
test_ids = [imd_list[i] for i in test_idx]
assert set(train_ids).isdisjoint(test_ids) # 图像级零泄漏验证
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 先增强后划分:同一原图的旋转/翻转副本同时落入 train 与 test | 极高(200 张小库 + 16 倍增强时指标可虚高至 99%+) | 先按 IMD ID 划分,再仅对训练集增强(§6.5 坑点 2) |
| 2 | 一患多图未知:同一患者多颗痣可能分跨 train/test | 中(官方未公开对应关系,无法根除) | 论文中声明该局限;有条件时用外部集(ISIC)验证 |
| 3 | 用掩膜裁剪/加权后的图像训练分类器,再用同一掩膜评估 | 中 | 掩膜只作分割监督或预处理,分类评估保持原始口径 |
| 4 | 镜像版本不一致:不同第三方镜像的 PNG 转换/重采样不同 | 低中 | 记录所用镜像与文件哈希;首选官方 RAR |
§5.4 交叉验证建议
- 标准:分层 5 折交叉验证,报告 mean ± std;若与单次划分文献对比,注明口径差异。
- 分割任务:折内再切 10% 训练数据作早停验证集;评估在折测试集的原始分辨率掩膜上进行(避免 resize 引入的指标偏差)。
- 多任务(分类 + 概念识别):以三分类标签分层即可保证各概念标签近似均衡。
§5.5 外部验证
PH2 的外部验证有两条方向相反的经典路径:
- PH2 当外部集(推荐,文献主流):在 ISIC 2016/2017 或 HAM10000 上训练 → PH2 全库零样本测试。Winkler et al. 2020(JMIR Med Inform)用此设计量化了黑角混杂;多篇多任务论文用 PH2 作 unseen test set。
- PH2 训练 → 外部集测试:仅适用于分割(掩膜是 PH2 独有资产),如在 PH2 上训练分割模型后到 ISIC 2018 测试跨设备 Dice 下降。分类任务因 PH2 仅 200 张,此方向证据力弱。
§6 AI 就绪指南
§6.0 云端快速启动
社区教学入口(非官方):丹麦技术大学(DTU)"Deep Learning in Computer Vision"课程的公开 Notebook 提供了 PH2 的 Colab 式完整练习——Google Drive 镜像下载、100-50-50 划分、PyTorch 分割训练全流程,是零配置体验 PH2 的最快路径(见 §9 教程链接)。
合规提示:PH2 许可禁止再分发,第三方镜像(含上述 Drive 镜像、Kaggle、Dropbox)严格来说均不符合官方使用条款。正式研究请走 §6.2 的官方注册渠道;教学演示可用镜像但应注明来源与许可限制。
§6.1 快速上手(PyTorch 分割版)
# ========================================
# PH2 快速上手 — PyTorch 分割版
# 环境要求: torch>=2.0, numpy, Pillow
#
# ⚠️ 目录结构预期:
# 将 ADDI 官网下载的 PH2Dataset.rar 解压至 ./data/ ,确保以下结构:
# ./data/PH2Dataset/
# ├── PH2 Dataset images/
# │ ├── IMD002/
# │ │ ├── IMD002_Dermoscopic_Image/IMD002.bmp # 原图 768×560 RGB
# │ │ ├── IMD002_lesion/IMD002_lesion.bmp # 病灶掩膜(0/255)
# │ │ └── IMD002_roi/ # ROI/颜色掩膜(部分图像)
# │ ├── IMD003/ ...(共 200 个 IMD 目录,编号不连续)
# └── PH2_dataset.txt # 标注表
#
# 要点:① 遍历目录取 ID,不要用 range 生成文件名;
# ② 掩膜读取后 >127 阈值化为 0/1;
# ③ resize 时图像用双线性、掩膜用最近邻。
# ========================================
import os, glob
import numpy as np
from PIL import Image
import torch
from torch.utils.data import Dataset, DataLoader
class PH2Segmentation(Dataset):
IMG_DIR = "PH2 Dataset images"
def __init__(self, data_root, ids=None, size=(256, 256)):
self.root = os.path.join(data_root, self.IMG_DIR)
self.size = size
all_ids = sorted(d for d in os.listdir(self.root) if d.startswith("IMD"))
self.ids = ids if ids is not None else all_ids
def __len__(self):
return len(self.ids)
def __getitem__(self, i):
imd = self.ids[i]
img_path = glob.glob(os.path.join(
self.root, imd, f"{imd}_Dermoscopic_Image", "*.bmp"))[0]
msk_path = glob.glob(os.path.join(
self.root, imd, f"{imd}_lesion", "*_lesion.bmp"))[0]
img = Image.open(img_path).convert("RGB").resize(self.size, Image.BILINEAR)
msk = Image.open(msk_path).convert("L").resize(self.size, Image.NEAREST)
x = torch.from_numpy(np.asarray(img)).permute(2, 0, 1).float() / 255.0
y = torch.from_numpy((np.asarray(msk) > 127).astype(np.float32)).unsqueeze(0)
return x, y
# 分层划分(先划分、后增强!)
from sklearn.model_selection import train_test_split
all_ids = sorted(d for d in os.listdir(os.path.join(
"./data/PH2Dataset", PH2Segmentation.IMG_DIR)) if d.startswith("IMD"))
labels = load_labels("./data/PH2Dataset/PH2_dataset.txt", all_ids) # 读标注表得 0/1/2
train_ids, test_ids = train_test_split(
all_ids, test_size=0.15, random_state=42, stratify=labels)
train_loader = DataLoader(PH2Segmentation("./data/PH2Dataset", train_ids),
batch_size=8, shuffle=True)
test_loader = DataLoader(PH2Segmentation("./data/PH2Dataset", test_ids),
batch_size=8)
print(f"train: {len(train_ids)} test: {len(test_ids)}")
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| 官方渠道(推荐) | https://www.fc.up.pt/addi/ph2 database.html | ~280 MB | ① 打开 ADDI 官网 PH2 页面;② 填写页面上的快速注册表(quick registration form);③ 获得 PH2Database pack(图像 + 标注)与 PH2 Browser 的下载链接;④ 解压 PH2Dataset.rar |
| PH2 Browser | 同上 | 随包 | MATLAB 编写的 Windows 工具;无 MATLAB 时安装免费 MCR(MATLAB Compiler Runtime)即可运行 |
| 社区镜像(合规风险) | Dropbox PH2Dataset.rar(openmedlab 索引)、Kaggle hashbanger/ph2-dataset、Google Drive(DTU 课程) |
100-300 MB | 第三方再分发严格来说违反官方使用条款;仅建议教学演示,正式研究勿用 |
使用条款核心义务:仅限研究与教学目的;禁止再分发;禁止商业使用;所有使用该数据的发表物必须引用 Mendonça et al. 2013(EMBC)论文。这不是标准开源许可证(非 CC、非 MIT),没有任何"默认可再分发"空间——把它放进商业产品或打包进自己的数据集再发布均属违约。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 4 步预处理代码(Python 版:黑角裁剪 → 毛发去除 → 统一尺寸 → 划分后增强)</b></summary>
import cv2
import numpy as np
# ---------- 步骤 1:黑色圆角边框裁剪(PH2 最重要的预处理,见坑点 1) ----------
def crop_black_corners(img, dark_thr=30):
"""检测并裁掉 Tuebinger Mole Analyzer 取景产生的黑色暗角。
策略:以阈值找非暗像素的最大内接区域,裁剪后居中。
简化替代:直接四周固定裁边 5%-8%(文献常用且稳定)。"""
gray = cv2.cvtColor(img, cv2.COLOR_RGB2GRAY)
mask = (gray > dark_thr).astype(np.uint8)
rows = np.where(mask.any(axis=1))[0]
cols = np.where(mask.any(axis=0))[0]
r0, r1, c0, c1 = rows[0], rows[-1], cols[0], cols[-1]
return img[r0:r1 + 1, c0:c1 + 1]
# ---------- 步骤 2:毛发去除(blackhat 形态学 + inpaint,DullRazor 思想) ----------
def remove_hair(img):
gray = cv2.cvtColor(img, cv2.COLOR_RGB2GRAY)
kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (9, 9))
blackhat = cv2.morphologyEx(gray, cv2.MORPH_BLACKHAT, kernel)
_, hair_mask = cv2.threshold(blackhat, 10, 255, cv2.THRESH_BINARY)
return cv2.inpaint(img, hair_mask, 3, cv2.INPAINT_TELEA)
# ---------- 步骤 3:统一尺寸(图像双线性;掩膜必须最近邻) ----------
def resize_pair(img, mask, size=(256, 256)):
img_r = cv2.resize(img, size, interpolation=cv2.INTER_LINEAR)
msk_r = cv2.resize(mask, size, interpolation=cv2.INTER_NEAREST)
return img_r, (msk_r > 127).astype(np.uint8)
# ---------- 步骤 4:划分后增强(只对训练集!) ----------
import albumentations as A
train_tf = A.Compose([
A.HorizontalFlip(p=0.5),
A.VerticalFlip(p=0.5),
A.RandomRotate90(p=0.5),
A.ColorJitter(brightness=0.1, contrast=0.1, saturation=0.1, hue=0.02, p=0.3),
A.Normalize(mean=(0.485, 0.456, 0.406), std=(0.229, 0.224, 0.225)),
])
</details>
流程要点与顺序:先按 IMD ID 分层划分 → 训练集走「黑角裁剪 → 毛发去除 → resize → 增强」;验证/测试集走「黑角裁剪 → resize」不做增强。黑角裁剪对分类任务的影响是决定性的(Winkler 2020:特异度 30.9% → 65.8%,见 §6.5 坑点 1);对分割任务影响较小(掩膜本身不含黑角)但建议统一执行以保持口径一致。
§6.4 框架加载
PyTorch DataLoader(基于 §6.1 的 Dataset):
from torch.utils.data import DataLoader
train_loader = DataLoader(PH2Segmentation("./data/PH2Dataset", train_ids),
batch_size=8, shuffle=True, num_workers=2, pin_memory=True)
for x, y in train_loader:
# x: [B, 3, 256, 256] float32 0-1;y: [B, 1, 256, 256] float32 0/1
...
TensorFlow:
import tensorflow as tf
def load_pair(img_path, msk_path):
img = tf.image.decode_bmp(tf.io.read_file(img_path), channels=3)
msk = tf.image.decode_bmp(tf.io.read_file(msk_path), channels=1)
img = tf.image.resize(img, [256, 256]) / 255.0
msk = tf.cast(tf.image.resize(msk, [256, 256], method="nearest") > 127, tf.float32)
return img, msk
ds = (tf.data.Dataset.from_tensor_slices((img_paths, msk_paths))
.map(load_pair, num_parallel_calls=tf.data.AUTOTUNE)
.batch(8).prefetch(tf.data.AUTOTUNE))
§6.5 常见坑点
⚠️ 坑点 1:黑色圆角边框是最强混杂因子(分类:预处理陷阱)
问题:PH2 图像普遍带 Tuebinger Mole Analyzer 取景产生的黑色圆角边框。跨数据集实验(Winkler et al. 2020,JMIR Med Inform)证明:在 HAM10000 上训练的分类器直接测 PH2,特异度仅 30.9%——模型把"有黑角"学成了数据集/类别特征;裁掉黑角后特异度升至 65.8%(灵敏度约 93.5% 基本不变)。
症状:外部训练的模型在 PH2 上"灵敏度极高、特异度极低";或在 PH2 上训练的模型到 ISIC 上性能崩塌;把黑角裁掉后指标剧烈变化。
解决:分类任务务必先裁黑角(固定裁边 5%-8% 或阈值检测暗像素,§6.3 步骤 1);注意一个反直觉发现——用 PH2 官方掩膜裁剪反而更差(特异度 76.5% vs 模型掩膜 80.2%),因为掩膜把暗角边缘一并圈进了"病灶区"。报告结果时注明是否做了黑角处理。
参考:Winkler JK et al. (2020), JMIR Medical Informatics 8(11):e21695, DOI: 10.2196/21695。
⚠️ 坑点 2:先增强后划分 = 数据泄漏制造机(分类:数据泄漏)
问题:200 张图 + 旋转/翻转 16 倍增强是 PH2 文献的常见配方。若增强先于划分,同一原图的多个变换副本会同时落入训练集与测试集——模型"记住"原图即可在测试集拿满分。这是 PH2 上大量 99%+ 准确率结果的主要成因。
症状:测试准确率 99%+ 且训练曲线几乎不过拟合;换一个随机种子指标大幅波动;同一方法在外部集(ISIC)上断崖下跌。
解决:铁律——先按 IMD ID 划分,再只对训练集增强(§6.3 步骤 4);审稿/复现时优先相信"PH2 作外部测试集"的论文(如多任务 MTL 论文仅用 PH2 训练集部分增强、或干脆把 PH2 整体作 unseen test)。
参考:MDPI Bioengineering 11(11):1173(2024)的标准做法(增强仅用于训练集,PH2 作外部集);CA-SLNet(PeerJ Comput Sci 2024)5 折协议。
⚠️ 坑点 3:无官方划分——论文间数字不可直接比较(分类:评估误用)
问题:PH2 官方无 train/val/test 划分。文献中 7:3、8:2、100-50-50、5 折 CV 并存,测试集从 30 张到 100 张不等;200 张小样本下单次划分的指标方差可达数个百分点。
症状:你的 U-Net 复现 Dice 0.89,论文 A 报 0.92、论文 B 报 0.88——三者可能都没错,只是划分不同。
解决:① 自己的实验用分层 5 折 CV 报 mean ± std;② 与文献对比时核对对方划分协议(比例、种子、是否增强),只在同口径下比数字;③ 论文中公开划分文件与种子。
参考:DTU 课程 100-50-50 划分(§9 教程);UCM-Net 仓库 7:3 划分(§8.7)。
⚠️ 坑点 4:类别不平衡 + 口径混乱,accuracy 是陷阱(分类:标签理解)
问题:良性 : 恶性 = 160 : 40(4:1),一个永远猜"良性"的模型 accuracy 就有 80%。且文献口径混乱:三分类(0/1/2)、二分类"良性(0+1)vs 恶性(2)“、二分类"普通痣(0)vs 黑色素瘤(2)”(丢弃非典型痣)三种并存,accuracy 完全不可横比。
症状:论文 accuracy 95% 但黑色素瘤漏诊过半;对比表里的数字口径对不上。
解决:必报 Sensitivity(恶性召回)、Specificity、AUC(±F1/平衡准确率);写清类别口径;损失函数用类别权重或 Dice/Focal 处理不平衡;报告三分类宏平均与恶性类单独指标。
参考:Processes 11(3):910(2023)同时报告 AUC/Acc/Sens/Prec/Spec 的范例。
⚠️ 坑点 5:200 张过小——PH2 的正确角色是"评测集"而非"训练集"(分类:评估误用)
问题:40 张黑色素瘤、测试集常见仅 30-40 张,单次划分下 1 张图翻盘就是 2-3 个百分点。2026 年综述明确指出:PH2 太小、样本多样性不足,无法独立训练可靠的深度模型,也不反映真实世界分布。
症状:小改动换来"SOTA";99%+ 结果层出不穷;模型在 PH2 内天下无敌、出了 PH2 寸步难行。
解决:正确定位 PH2——① 分割基准(与 ISIC 联合报告);② 外部泛化测试集(在大库训练、PH2 零样本测);③ 教学最小闭环。任何"仅在 PH2 上训练并报告高分"的分类结论都应谨慎对待。
参考:IJCSE 13(5):101(2026)数据集综述;IMA++(2026)将 PH2 列为最小分割基准。
⚠️ 坑点 6:单一标注者 + 病理非全量——金标准并非纯金(分类:标签理解)
问题:全库标注出自同一名皮肤科专家,无标注者间一致性;组织学诊断仅"when available",部分标签只是临床诊断;掩膜边界对非典型痣这类弥散病灶主观性最强。
症状:分割 Dice 在 0.95 附近遇到"玻璃天花板"——剩余误差很大程度是标注主观性而非模型误差;不同论文对"难例"(边界模糊的非典型痣)的评价分歧大。
解决:① 把 Dice 0.95+ 视为 PH2 分割的实际饱和区,不要为 0.5 个百分点的"提升"过度设计;② 分类评估时注明"标签含临床诊断成分";③ 需要纯病理标签的研究改用 ISIC 2018(全病理确诊)。
参考:PH2 官方数据说明(“histological (when available) diagnosis”);IMA++(2026)对单标注局限的讨论。
⚠️ 坑点 7:掩膜与文件结构的工程细节(分类:工程陷阱)
问题:① 掩膜是 0/255 的 8-bit BMP,忘记阈值化会得到 255 倍的标签;② resize 掩膜用双线性会产生 0-255 中间值,污染 Dice;③ IMD 编号不连续(IMD002-IMD435),
range(1,201)生成的路径大批不存在;④ 部分镜像把 BMP 转成了 PNG 且重采样,与原库口径不同。症状:损失 NaN 或恒为负;Dice 异常低;FileNotFoundError 成堆;与文献指标系统性差 1-2 点。
解决:读取后
(mask > 127)二值化;掩膜 resize 一律NEAREST;遍历目录取真实 ID 列表;记录所用镜像及文件哈希。参考:DTU 课程 Notebook 的标准加载范式(§9);Medical-SAM3 dataset_loaders 对 PH2"嵌套层级最深"的处理。
⚠️ 坑点 8:许可禁止再分发——镜像便利与合规的冲突(分类:工程陷阱/合规)
问题:官方使用条款明确禁止 redistribution 与商业使用。Kaggle、Dropbox、GitHub 上的镜像均为第三方行为;把 PH2 打包进自己的产品数据集、放进商业模型训练管线、或在论文补充材料里直接挂图床,都是违约。
症状:法务质疑数据来源;论文被要求补充数据获取说明;商业项目审计不过。
解决:正式研究一律走 ADDI 官网注册下载;论文方法学写明"downloaded from the official ADDI website after registration";引用 Mendonça et al. 2013(这是条款的硬性义务);商用需求直接联系波尔图大学 ADDI 项目组洽谈授权。
参考:ADDI 官网 PH2 页面 “3 - Terms of Use” 原文。
版本提示:PH2 自 2013 年发布后冻结,无版本号与更新日志。不同第三方镜像可能存在格式转换(BMP→PNG)、重采样、命名差异,复现实验时请固定同一镜像并记录哈希。
§6.6 数据增强
| ✅ 安全增强(仅训练集、先划分后增强) | ❌ 危险增强(禁止) |
|---|---|
| 水平/垂直翻转、90° 旋转(皮肤镜无方向先验) | 任何增强应用于验证/测试集 |
| 小角度旋转(±15°)与轻微缩放 | 先增强后划分(同一原图副本跨集,见坑点 2) |
| 轻度颜色抖动(亮度/对比度 ±10%,hue ±0.02) | 强颜色变换破坏"六色标注"与蓝白幕等颜色相关标准的语义 |
| 弹性形变(小幅度,模拟皮肤形变) | 裁剪到只剩病灶局部(破坏边界信息与全局上下文) |
| GAN/扩散模型合成黑色素瘤少数类(声明合成样本) | 把合成样本混入测试集或当作真实样本报告 |
§6.7 模型推荐
| 任务 | 推荐方案 | 预期性能(PH2 文献区间) |
|---|---|---|
| 分割快速基线 | U-Net(Ronneberger 2015),256×256 输入 | Dice 0.88-0.92 |
| 分割进阶 | FAT-Net / Separable-Unet + SWA | Dice 0.94 左右 |
| 分割文献前沿 | SkinFormNet / LANET(2026) | Dice 0.94-0.97(注意协议差异) |
| 分类快速基线 | ImageNet 预训练 ResNet50/MobileNet 微调 | Acc 90-92.5,AUC 0.92-0.93 |
| 分类进阶 | 双路特征融合 + 注意力(CA-SLNet 类) | Acc 95+(需严格协议方可信) |
| 多任务(分割+分类+概念) | 共享编码器多任务网络 | 见 MDPI Bioengineering 11:1173 范式 |
| 教学演示 | §6.1 Dataset + 轻量 U-Net,CPU 可跑通流程 | Dice 0.80+(演示级) |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 1 GB | 5 GB(含增强缓存与检查点) |
| 内存 | 8 GB(全库可入内存) | 16 GB |
| GPU | CPU 可跑通(U-Net 小图,约 1-3 小时) | 1 × 8 GB 显存(U-Net 数十分钟收敛) |
| 训练时间 | 分割基线 <1 小时(单 GPU) | 多折/多任务实验半天内 |
| 云端替代 | Colab 免费档完全足够 | — |
§6.9 评估指标
import numpy as np
from sklearn.metrics import roc_auc_score, confusion_matrix
def dice_iou(pred, target, thr=0.5, eps=1e-7):
"""分割评估:Dice 与 Jaccard(IoU)。pred/target 为 [N,1,H,W] numpy 数组。"""
p = (pred > thr).astype(np.float32); t = target.astype(np.float32)
tp = (p * t).sum(); fp = (p * (1 - t)).sum(); fn = ((1 - p) * t).sum()
dice = (2 * tp + eps) / (2 * tp + fp + fn + eps)
iou = (tp + eps) / (tp + fp + fn + eps)
return dice, iou
def clf_report(y_true, y_prob_melanoma):
"""分类评估(恶性 vs 良性口径):AUC + 灵敏度 + 特异度,禁止只报 accuracy。"""
auc = roc_auc_score(y_true, y_prob_melanoma)
tn, fp, fn, tp = confusion_matrix(y_true, y_prob_melanoma > 0.5).ravel()
return {"AUC": auc,
"Sensitivity": tp / (tp + fn), # 恶性召回,筛查场景第一指标
"Specificity": tn / (tn + fp),
"BalancedAcc": (tp / (tp + fn) + tn / (tn + fp)) / 2}
社区共识口径:分割报 Dice + Jaccard(PH2 文献两大主指标,常附 Sensitivity/Specificity/Accuracy);分类报 AUC + Sensitivity + Specificity;声明划分协议与是否黑角处理;小样本务必报 mean ± std(多折/多种子)。
§6.10 MLOps 笔记
- 引用义务是硬条款:任何使用 PH2 的发表物必须引用 Mendonça et al. 2013(DOI: 10.1109/EMBC.2013.6610779)——这是使用条款(Terms of Use)的明文义务,不是学术礼貌。
- 镜像一致性:实验记录中写明数据获取渠道(官方 RAR / 某镜像)与文件数(应为 200 张原图 + 200 张掩膜);社区 PNG 版与官方 BMP 版的指标可能有 1 个百分点级系统差。
- 划分即资产:200 张小库上,划分文件本身就是最重要的实验元数据——随代码一起发布
train_ids.txt / val_ids.txt / test_ids.txt与种子。 - 饱和信号:PH2 分割 Dice 0.95+、分类 Acc 99%+ 已进入"标注主观性主导误差"的饱和区,继续刷点的边际科学价值趋零;把精力转向跨数据集泛化(§7.8)更有产出。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 肤色偏倚 | 全部为 Fitzpatrick II/III 型(white ~ cream white),无深色皮肤、无肢端病变代表 | 高 | 仅用 PH2 做浅肤色口径结论;跨肤色评估用 Fitzpatrick17k / DDI |
| 单中心/单设备偏倚 | HPH 单中心、Tuebinger Mole Analyzer 单设备、20x 统一放大;黑角边框成为数据集"指纹" | 高 | 跨数据集训练 + PH2 外部测试;黑角裁剪 |
| 选择偏倚 | 图像经质量精选;黑色素瘤若未完整入镜或伪影重则被剔除——恶性样本偏向"干净、完整"的易例 | 中高 | 声明该偏倚;真实世界验证不可省略 |
| 类别不平衡 | 恶性仅占 20%(4:1) | 中 | 类别权重/重采样;报 Sens/Spec/AUC |
| 标注者偏倚 | 单一专家标注,无一致性检验;边界与主观标准(蓝白幕、退行区)带个人风格 | 中 | 把 Dice 0.95+ 视为饱和;多标注数据集(IMA++)交叉参考 |
| 时代偏倚 | 2013 年前的设备与人群;皮肤镜设备与临床实践已迭代多年 | 中 | 定位为基准/教学/外部测试,不作当代部署依据 |
| 规模偏倚 | 200 张,恶性 40 张——统计功效天花板 | 高 | 5 折 CV + 置信区间;结论限于方法学相对比较 |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 病灶分割掩膜 | 专家手工,整体高 | 无重测数据;非典型痣边界主观性最强 | 单标注者;带入暗角边缘 |
| 临床诊断(0/1/2) | 专家读片,中高 | 无第二读片者 | 病理确诊非全量;非典型痣 vs 早期黑色素瘤存在固有灰区 |
| 组织学诊断 | 病理金标准(覆盖不全) | — | “when available”,未标明覆盖哪些图 |
| 皮肤镜标准评分 | 结构化、映射临床规则 | 蓝白幕/退行区等主观标准一致性未知 | 单标注者;无 kappa |
| 颜色掩膜 | 专家勾勒 | 非全量 | “if available” 机制不透明 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨设备(Tuebinger → 其他皮肤镜/手机) | 高 | 黑角边框即设备指纹;Winkler 2020 显示未裁剪时跨库特异度崩塌至 30.9% |
| 跨机构(HPH → 其他皮肤科) | 中高 | 单中心人群与取材偏好;ISIC/HAM 训练模型在 PH2 上平衡准确率约 80-86%(Winkler 2020) |
| 跨肤色(II/III 型 → IV-VI 型) | 高 | 库内零深色皮肤样本;2026 综述将肤色单一列为三大库(ISIC/HAM/PH2)共性问题 |
| 跨病种(黑素细胞 → BCC/AK 等) | 极高 | PH2 仅含黑素细胞病变,不能用于非黑素细胞皮肤病结论 |
| 跨时间(2013 → 当代设备) | 中 | 现代皮肤镜分辨率/偏振光已换代;PH2 仅 768×560 |
| 分割 → 分类任务迁移 | 中 | 掩膜监督学得的边界特征对分类有帮助,但分类标签含临床诊断噪声(坑点 6) |
§7.4 伦理考量
- 图像为病灶局部特写,不含面部或可识别体表特征,官方未发布任何患者标识与临床元数据,重识别风险极低;但仍应遵守使用条款、不得尝试关联外部信息识别患者。
- 数据来自真实皮肤科患者,包含 40 例恶性肿瘤影像;研究与展示时应保持对患者的基本尊重。
- 肤色构成本身是一种代表性伦理问题:仅在 II/III 型浅肤色上验证的模型若直接部署于深肤色人群,可能造成系统性漏诊——任何基于 PH2 的模型对外宣称性能时都应附带肤色适用范围声明。
- 禁止商业使用是许可硬约束:学术衍生模型若进入商业产品,需重新确认授权链条。
§7.5 公平性评估
PH2 不含任何可用于公平性分组的元数据(无年龄、性别、肤色细分字段——仅知全库为 Fitzpatrick II/III 型)。因此库内公平性分析在原理上不可行,社区共识做法是把 PH2 当作"浅肤色外部测试集",与深肤色数据集并列评估:
# 跨肤色泛化评估范式:同一模型在两个外部集上分别测试并对比
results = {}
for name, loader in [("PH2 (Fitzpatrick II/III)", ph2_loader),
("DDI (Fitzpatrick IV-VI)", ddi_loader)]:
y_true, y_prob = evaluate(model, loader)
results[name] = roc_auc_score(y_true, y_prob)
gap = results["PH2 (Fitzpatrick II/III)"] - results["DDI (Fitzpatrick IV-VI)"]
print(f"跨肤色 AUC 差: {gap:.3f}") # >0.05 即提示显著公平性问题
已知差异(文献共识):ISIC/HAM10000/PH2 三大库均以 I-III 型肤色为主,深色皮肤(V-VI 型)占比不足 5%;在深肤色外部集上,多数公开模型的灵敏度显著下降,肢端型黑色素瘤(深肤色人群主要亚型)几乎无代表。
§7.6 数据漂移提示
- PH2 的成像分布冻结在 2013 年前的 Tuebinger Mole Analyzer:分辨率 768×560、接触式 20x 放大、带黑角。当代皮肤镜(偏振光、非接触、>1000 px)与手机皮肤镜的输入分布已明显漂移。
- 部署监控信号:输入图像的暗像素占比(黑角检测)、分辨率分布、颜色直方图 PSI;任何现代设备输入都应先重做 §6.3 的裁剪与归一化。
- 临床实践漂移:皮肤镜标准本身稳定(ABCD/7 分法沿用至今),概念标签的时效性优于图像像素分布。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | 标注表一行一图;图像/掩膜一一对应 |
| 2 | 有唯一标识符列 | ✅ | IMD 图像 ID 连接图像/掩膜/标注表 |
| 3 | 无 Unicode 或特殊字符 | ✅ | 标注取值全为 ASCII 代码(0/1/2、A/AT/T/P) |
| 4 | 无重复行 | ✅ | 200 个唯一 IMD ID;无公开的重复图像报告 |
| 5 | 缺失值已识别并编码 | ⚠️ | 颜色掩膜"if available"、组织学"when available"非全量,缺失机制未正式编码(§4.5) |
| 6 | 标签列被明确标识 | ✅ | Clinical Diagnosis 为主标签;掩膜为分割标签 |
| 7 | 已对罕见类别(<3%)进行分组 | ✅ | 三类构成 40%/40%/20%,无 <3% 罕见类 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 列出 7 类偏倚与缓解措施 |
| 9 | 有完整的数据字典 | ✅ | 官方页面给出全部标准取值定义(§4.1) |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | 病理/颜色掩膜缺失机制官方未文档化,本页 §4.5 补全 |
| 11 | 数据采集设备和设置已记录 | ✅ | Tuebinger Mole Analyzer、20x、768×560、同条件采集,记录完整(§3.9) |
| 12 | 已移除完全共线性变量 | ⚠️ | 未执行(影像任务不直接适用;概念标签间未做共线性检查) |
| 13 | 对编码的映射标准已说明 | ✅ | 0/1/2 与 A/AT/T/P 代码官方定义;ICD-11/SNOMED CT 映射本页补全(§2.1/§2.2) |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 无时间戳字段;采集时间范围未公开 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无划分;社区惯例(7:3、5 折 CV)补位(§5.2) |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 四种泄漏模式 + §6.5 坑点 2 |
| 17 | 标签分布已被分析 | ✅ | §4.2 三分类与二分类口径分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 官方明示黑色素瘤因不完整入镜/伪影被剔除(§7.1 选择偏倚) |
| 19 | 外部验证建议已给出 | ✅ | §5.5 双向外部验证路径 + §7.8 矩阵 |
| 20 | 数据更新和版本信息已记录 | ⚠️ | 2013 年发布后冻结,无版本号/更新日志(§1.4) |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 无官方脚本;PH2 Browser 仅可视化;社区 loader 补位(§8.7) |
| 22 | 合规使用要求已明确 | ✅ | 注册表 + 使用条款(禁再分发/商用 + 引用义务)明示(§6.2) |
| 23 | 多模态对齐方法已说明 | ⚠️ | 图像-掩膜-标注经 IMD ID 对齐清晰;但颜色掩膜非全量且覆盖机制未说明 |
| 24 | 去标识化方法已被记录 | ⚠️ | 无面部特征与患者元数据(事实脱敏),但官方未正式记录脱敏流程 |
DAIMS 评分:19.0 / 24
评分解读:良好偏优——以 200 张的小体量做到了大库级别的标注完整度,失分集中在"无官方划分、无版本维护、病理与颜色标注非全量、无时间戳与脱敏文档"。
对你意味着什么:PH2 的 15 个 ✅ 项几乎全部来自其教科书级的标注设计——全量专家掩膜、逐图 7 项标准评分、完整的设备与取值字典、明确的合规条款,在 2013 年的时代背景下无出其右。扣分项中真正影响日常使用的只有三个:无官方划分(用 §5.2 的分层 5 折方案并公开种子)、病理金标准非全量(需要纯病理标签请转 ISIC 2018)、无患者元数据(公平性研究转 Fitzpatrick17k/DDI)。其余 ⚠️ 项(时间戳、共线性、脱敏文档)对图像分割/分类任务几乎无实际影响。建议在使用前执行:(1) 官方渠道下载并校验 200 张图 + 200 张掩膜齐全;(2) 按 §6.3 完成黑角裁剪;(3) 按 §5.2 分层划分并公开种子;(4) 报告时注明数据获取渠道与预处理口径。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| PH2(HAM10000 训练 → PH2 零样本,未裁剪) | HPH(葡萄牙)vs 维也纳/纪念斯隆-凯特琳 | 恶性 vs 良性分类 | 灵敏度 95.5% / 特异度 30.9% | 特异度崩塌 | 黑角边框被模型学成了数据集特征(Winkler 2020) |
| PH2(HAM10000 训练 → PH2 裁剪黑角后) | 同上 | 同上 | 灵敏度 93.5% / 特异度 65.8% | 特异度 +34.9 pp | 黑角裁剪可挽回大部分性能;混杂主要来自边框而非病灶 |
| PH2(ISIC 训练 → PH2 零样本,分割掩膜预处理) | 同上 | 同上 | 平衡准确率 86.4% | 相对未分割 83.7% 略升 | 分割预处理对跨数据集鲁棒性有小幅正收益 |
| PH2(ISIC 2016 训练 → PH2 unseen test) | HPH vs ISIC 2016 挑战赛 | 多任务分割 + 分类 | 论文报告外部集可行 | N/A(定性结论) | 多任务学习框架在 PH2 外部集上保持泛化(Bioengineering 11:1173, 2024) |
| PH2(颜色归一化外部测试) | HPH vs 意大利 Novara | 生成式颜色归一化 | 跨分辨率/光照泛化 | N/A | PH2 被选为两个外部测试集之一(GCC-GAN, Salvi et al. 2024) |
PH2 在 2026 年还值得用吗? 值得——但要用对角色。作为独立训练集它早已过时(200 张不够当代模型塞牙缝);作为分割基准、外部泛化测试集与教学最小闭环,它仍是无可替代的第一选择:标注密度最高、设备一致性最好、13 年文献积累提供了任何新数据集都没有的历史可比性。这就是"经典小样本基准"的准确含义。
§8 基准性能与生态
§8.1 排行榜
必读警告:PH2 无官方划分,各论文在划分比例、随机种子、是否增强、是否黑角处理、输入尺寸上各不相同——下列绝对数值不可直接横向比较,仅作量级参考。审稿级别的对比必须回到原文核对协议(§6.5 坑点 3)。
分割任务(Dice 为主指标,按报告 Dice 排序):
| 排名 | 模型 | Dice / 其他指标 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | SkinFormNet | Dice 0.97 / JI 92.04 / Acc 97.41 / AUC 99.48 | 2026 | Transformer-CNN 混合 + 病灶感知空间注意力 | “Advanced hybrid transformer CNN framework for improved skin lesion classification and segmentation.” Scientific Reports (2026). DOI: 10.1038/s41598-026-43376-0 | — |
| 2 | LiteMamba-Bound | Dice 95.62 / IoU 91.70 / Acc 94.79 | 2025 | 轻量 Mamba + 边界增强 | 转引自 LANET 论文对比表(Biomedical Signal Processing and Control, 2026) | — |
| 3 | LANET | Acc 97.89 / Dice 93.70 / IoU 91.60 | 2026 | 轻量注意力网络 | “LANET: A Deep Lightweight Attention Network for Skin Cancer Segmentation.” (2026) | — |
| 4 | FAT-Net | DSC 0.9440 / Sens 94.41 / Spec 97.41 / Acc 97.03 | 2022 | 特征自适应 Transformer | Wu H, Chen S, Chen G, Wang W, Lei B, Wen Z. “FAT-Net: Feature adaptive transformers for automated skin lesion segmentation.” Medical Image Analysis 76:102327 (2022). DOI: 10.1016/j.media.2021.102327 | — |
| 5 | Separable-Unet + SWA | Dice 94.13 / JI 89.40 | 2019 | 可分离卷积 + 随机权重平均 | Tang P, Liang Q, Yan X, Xiang S, Sun W, Zhang D, Coppola G. “Efficient skin lesion segmentation using separable-Unet with stochastic weight averaging.” Computer Methods and Programs in Biomedicine 178:69-77 (2019). DOI: 10.1016/j.cmpb.2019.06.002 | — |
| 6 | EM-Net | Dice 94.03 / Acc 96.34 | 2025 | 边缘感知多尺度网络 | 转引自 LANET 论文对比表(2026) | — |
| 7 | iFCN | Dice 93.02 / JI 87.1 / Acc 96.92 / Sens 96.88 | 2020 | 改进 FCN + 伪影处理 | Öztürk Ş, Ünver HM. “Skin Lesion Segmentation with Improved Convolutional Neural Network.” Journal of Healthcare Engineering 2020:4046949. DOI: 10.1155/2020/4046949 | — |
| 8 | FrCN | Dice 91.77 / JI 84.79 / Acc 95.08 | 2018 | 全分辨率卷积网络(无池化信息损失) | Al-Masni MA, Al-Antari MA, Choi MT, Han SM, Kim TS. “Skin lesion segmentation in dermoscopy images via deep full resolution convolutional networks.” Computer Methods and Programs in Biomedicine 162:221-231 (2018). DOI: 10.1016/j.cmpb.2018.05.027 | — |
| 9 | U-Net(基线) | Dice 87.61-92.0 / Acc 92.0-92.55 | 2015 起多论文复测 | 编码-解码跳跃连接 | Ronneberger O, Fischer P, Brox T. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” MICCAI 2015. DOI: 10.1007/978-3-319-24574-4_28 | 多个公开复现 |
分类任务(口径不一,谨慎对比;按报告准确率排序):
| 排名 | 模型 | 性能指标 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | CA-SLNet | Acc 99.50 / Recall 99.40 / Precision 98.80 / AUC 0.9814±0.0121(5 折) | 2024 | ResNet-VGG 双路特征融合 + 注意力 | “Deep feature fusion for melanoma detection using ResNet-VGG networks with attention mechanism.” PeerJ Computer Science 10:e3248 (2024). DOI: 10.7717/peerj-cs.3248 | — |
| 2 | Benyahia et al. | Acc 99.05 | 2022 | 多特征深度提取融合 | Benyahia S, Meftah B, Lézoray O.(2022,转引自 CA-SLNet 对比表) | — |
| 3 | VGG16 迁移学习 | Acc 95.7(原图)/ 99.1(增强后) | 2021 | ImageNet 迁移 + 数据增强 | “A Deep Learning-Based Transfer Learning Framework for the Early Detection and Classification of Dermoscopic Images of Melanoma.” Biomedical and Pharmacology Journal 14(4):2225 (2021). DOI: 10.13005/bpj/2225 | — |
| 4 | 5 层轻量 CNN | Acc ~95 / Sens 94 / Spec 97 / AUC ~100 | 2020 | 从头训练轻量 CNN | “Skin Lesions Identification Using Deep Convolutional Neural Network.” AECT 2020. DOI: 10.1109/AECT47998.2020.9194205 | — |
| 5 | ResNet101 / MobileNet 预训练微调 | Acc 92.5 / 90.0;AUC 93.13 / 92.87 | 2023 | 预训练骨干直接微调 | “Multi-Models of Analyzing Dermoscopy Images for Early Detection of Multi-Class Skin Lesions Based on Fused Features.” Processes 11(3):910 (2023). DOI: 10.3390/pr11030910 | — |
饱和判读:PH2 分类 99%+ 的结果应默认接受严格审视——测试集往往仅 30-60 张,1-2 张图即决定小数点后排名;且相当比例的高分存在先增强后划分嫌疑(§6.5 坑点 2)。分割 Dice 0.95 附近同样进入标注主观性主导的饱和区。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现经典分割文献 | U-Net 基线(Dice ~0.88-0.92)→ FrCN/Separable-Unet | 文献基线密集、实现简单 |
| 验证新分割架构 | 与 FAT-Net(0.944)/ SkinFormNet(0.97)同口径对比 | 2022-2026 年的可比锚点 |
| 做分类方法学研究 | 5 折分层 CV + 报告 AUC/Sens/Spec,基准对齐 CA-SLNet 协议 | 当前最完整的公开协议 |
| 评估模型泛化性 | ISIC/HAM 训练 → PH2 零样本测试(裁黑角) | Winkler 2020 建立的标准范式 |
| 快速出教学/演示结果 | §6.1 代码 + 轻量 U-Net,1 小时内出 Dice | 200 张全内存,笔记本可完成 |
§8.3 官方评测协议
无官方协议。社区事实标准:分割报 Dice + Jaccard(常附 Accuracy/Sensitivity/Specificity);分类报 Accuracy + Sensitivity + Specificity + AUC;无固定划分(5 折分层 CV 为较新论文的主流);建议声明黑角处理与增强口径。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| HAM10000 | 互补/后继 | 10,015 张 7 类,无掩膜;PH2 常作其训练模型的外部测试集 |
| ISIC 2016/2017/2018 系列 | 互补/后继 | 官方划分 + 大规模;与 PH2 联合报告是分割论文标配 |
| ISIC Archive | 后继生态 | >50,000 张持续更新,当前最大资源池 |
| Derm7pt | 同类(概念标注) | 1,011 张 8 类,7 分法结构化标注,与 PH2 的镜下标准思路同源 |
| MED-NODE | 同类 | 170 张双视图(临床 + 皮肤镜),无掩膜 |
| Fitzpatrick17k / DDI | 公平性补充 | 提供 PH2 缺失的深肤色与肤色标注 |
| IMA++ | 多标注者后继 | 17,000+ 张多标注者分割(2026),解决 PH2 单标注局限 |
§8.5 关键论文 Top 10
- Mendonça T, Ferreira PM, Marques JS, Marçal ARS, Rozeira J (2013), EMBC 2013:5437-5440. “PH2 - A dermoscopic image database for research and benchmarking.” — 数据集本体,权威引用入口与使用条款指定的必引文献。DOI: 10.1109/EMBC.2013.6610779
- Mendonça T, Celebi ME, Mendonça T, Marques JS (2015). “PH2: A Public Database for the Analysis of Dermoscopic Images.” 收录于 Dermoscopy Image Analysis(CRC Press)— 系统阐述建库设计的官方书章。
- Barata C, Celebi ME, Marques JS (2014), IEEE Systems Journal 8(3):965-979. “Two systems for the detection of melanomas in dermoscopy images using texture and color features.” — ADDI 团队基于 PH2 的黑色素瘤检测代表作,深度学习时代前的手工特征范式。
- Ronneberger O, Fischer P, Brox T (2015), MICCAI. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” — PH2 分割文献的通用骨干。DOI: 10.1007/978-3-319-24574-4_28
- Al-Masni MA et al. (2018), CMPB 162:221-231. FrCN — 全分辨率卷积分割,PH2 Dice 0.9177。DOI: 10.1016/j.cmpb.2018.05.027
- Tang P et al. (2019), CMPB 178:69-77. Separable-Unet + 随机权重平均,PH2 Dice 94.13。DOI: 10.1016/j.cmpb.2019.06.002
- Öztürk Ş, Ünver HM (2020), Journal of Healthcare Engineering 2020:4046949. iFCN — 伪影处理 + 改进 FCN,PH2 Dice 93.02。DOI: 10.1155/2020/4046949
- Winkler JK et al. (2020), JMIR Medical Informatics 8(11):e21695. “Reducing the Impact of Confounding Factors on Skin Cancer Classification via Image Segmentation.” — 揭示 PH2 黑角混杂的里程碑研究,泛化实验设计范本。DOI: 10.2196/21695
- Wu H et al. (2022), Medical Image Analysis 76:102327. FAT-Net — Transformer 时代 PH2 分割代表,DSC 0.944。DOI: 10.1016/j.media.2021.102327
- CA-SLNet (2024), PeerJ Computer Science 10:e3248. 双路特征融合 + 注意力,PH2 分类 Acc 99.50(5 折 AUC 0.9814)— 分类任务当前最完整协议的高分参照。DOI: 10.7717/peerj-cs.3248
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| Semantic Scholar 引用(EMBC 2013 论文) | 1,018 次(Highly Influential Citations 103;截至 2026-09) |
| Scopus / Web of Science 引用 | 759 / 398 次(FCUP 机构库快照) |
| IEEE Xplore 引用 | 717 次(cites in papers) |
| OpenAlex 引用 | 711 次(截至 2026-09 快照;肿瘤学 574、AI 445、CV 167 为主力引用领域) |
| Kaggle 镜像热度 | 2,525 次浏览 / 220 次下载(hashbanger/ph2-dataset,截至 2026-09 快照) |
| 教学采用 | DTU “Deep Learning in Computer Vision” 课程公开 Notebook(分割练习标准素材) |
| 持续刷榜 | 2025-2026 年仍有 DPMF-Net、LANET、SkinFormNet、ViConEx-Med 等新模型以 PH2 为评测集 |
| 工具收录 | datasetninja、openmedlab Awesome-Medical-Dataset、Medical-SAM3 均内置 PH2 支持 |
§8.7 生态快照
| 资源 | 类型 | 链接 | 说明(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| ADDI 官方 PH2 页面 | 官方主页 | https://www.fc.up.pt/addi/ph2 database.html | 注册下载唯一合规渠道 | 许可条款、PH2 Browser、官方定义的唯一权威来源 |
| PH2 Browser | 官方工具 | 随 PH2Dataset.rar | MATLAB 编写,Windows x86/x64 | 免代码浏览全部标注、按标准检索、导出子集 |
| datasetninja PH2 | 数据索引/转换 | https://datasetninja.com/ph2 | 在线预览 + PNG 转换版 | 不写代码先看数据分布与样例 |
| openmedlab Awesome-Medical-Dataset | 索引 | GitHub openmedlab/Awesome-Medical-Dataset/resources/PH2.md | 含 Dropbox 镜像与元信息卡 | 中文社区最常用的 PH2 索引页 |
| Medical-SAM3 | 工具库 | GitHub AIM-Research-Lab/Medical-SAM3 | 内置 PH2 loader(标注其"嵌套层级最深") | SAM3 系分割模型直接评测 PH2 的入口 |
| DTU dlicv 课程 Notebook | 教程 | GitLab gbar.dtu.dk/s192613/dlicv | 完整分割练习(加载/划分/训练) | 教学场景最成熟的公开代码 |
| UCM-Net | 分割代码 | GitHub chunyuyuan/UCM-Net | 含 PH2 的 7:3 预划分与评测脚本 | 复现"PH2 + ISIC 联合评测"论文口径的捷径 |
| Kaggle hashbanger/ph2-dataset | 社区镜像 | kaggle.com/datasets/hashbanger/ph2-dataset | 275.76 MB,trainx/trainy 扁平目录 | 便利但有合规风险(官方禁止再分发),仅建议演示 |
§9 相关资源与引用
官方资源
- 数据集主页(注册下载 + 使用条款):https://www.fc.up.pt/addi/ph2 database.html
- 论文(IEEE Xplore):https://doi.org/10.1109/EMBC.2013.6610779
- PubMed 记录:PMID 24110966
- PH2 Browser:随官方数据包提供(Windows,MATLAB/MCR 运行)
- 许可:研究教学免费使用,禁止再分发与商业使用,发表须引用
BibTeX 引用
% 1) 数据集论文(使用条款指定的必引文献)
@inproceedings{mendonca2013ph2,
title={PH2 - A dermoscopic image database for research and benchmarking},
author={Mendon{\c{c}}a, Teresa and Ferreira, Pedro M. and Marques, Jorge S. and Mar{\c{c}}al, Andr{\'e} R. S. and Rozeira, Jorge},
booktitle={2013 35th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC)},
pages={5437--5440},
year={2013},
organization={IEEE},
doi={10.1109/EMBC.2013.6610779}
}
% 2) 官方书章(设计细节权威来源)
@incollection{mendonca2015ph2,
title={PH2: A Public Database for the Analysis of Dermoscopic Images},
author={Mendon{\c{c}}a, Teresa and Celebi, M. Emre and Mendon{\c{c}}a, Teresa and Marques, Jorge S.},
booktitle={Dermoscopy Image Analysis},
editor={Celebi, M. Emre and Mendon{\c{c}}a, Teresa and Marques, Jorge S.},
publisher={CRC Press},
year={2015}
}
% 3) 如使用黑角混杂结论(泛化研究建议同引)
@article{winkler2020confounding,
title={Reducing the Impact of Confounding Factors on Skin Cancer Classification via Image Segmentation: Technical Model Study},
author={Winkler, Julia K and others},
journal={JMIR Medical Informatics},
volume={8}, number={11}, pages={e21695}, year={2020},
doi={10.2196/21695}
}
教程与学习资源
- DTU dlicv 分割练习(最完整的公开教学代码):https://gitlab.gbar.dtu.dk/s192613/dlicv
- datasetninja PH2 在线预览:https://datasetninja.com/ph2
- openmedlab PH2 索引页(含镜像与元信息):https://github.com/openmedlab/Awesome-Medical-Dataset
- UCM-Net 数据准备文档(PH2 7:3 划分范式):https://github.com/chunyuyuan/UCM-Net
原始论文
- Mendonça T, Ferreira PM, Marques JS, Marçal ARS, Rozeira J (2013). “PH2 - A dermoscopic image database for research and benchmarking.” 2013 35th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC), Osaka, pp. 5437-5440. DOI: 10.1109/EMBC.2013.6610779. PMID: 24110966.
- Mendonça T, Celebi ME, Mendonça T, Marques JS (2015). “PH2: A Public Database for the Analysis of Dermoscopic Images.” In: Dermoscopy Image Analysis. CRC Press.
- Kittler H, Pehamberger H, Wolff K, Binder M (2002). “Diagnostic accuracy of dermoscopy.” The Lancet Oncology 3(3):159-165.(PH2 论文引用的方法学基石:皮肤镜诊断准确性依赖经验的荟萃分析)
- Barata C, Celebi ME, Marques JS (2014). “Two systems for the detection of melanomas in dermoscopy images using texture and color features.” IEEE Systems Journal 8(3):965-979.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:ADDI 官方页与使用条款、标注体系、引用量多源快照、分割/分类基准、黑角混杂等坑点文献、ICD-11/GLOBOCAN 医学背景交叉验证 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 ADDI 官方页面、Mendonça 2013 原始论文记录、Semantic Scholar/Scopus/OpenAlex 引用快照与同行评审文献中整理结构化信息;(2) 生成 §6 的 Python/PyTorch/TensorFlow 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Mendonça T et al. (2013), EMBC 2013:5437-5440 — PH2 原始论文(DOI: 10.1109/EMBC.2013.6610779)
- ADDI 官方 PH2 页面(https://www.fc.up.pt/addi/ph2 database.html)— 数据描述、标注体系、使用条款、PH2 Browser
- Semantic Scholar 论文页(Corpus ID 8042197)— 1,018 次引用快照(截至 2026-09-05)
- FCUP 机构库(sigarra.up.pt)— Scopus 759 / WoS 398 引用快照
- Rankless/OpenAlex — 711 次索引引用与领域分布
- datasetninja PH2(cdn.datasetninja.com/ph2)— 数据卡与官方论文文本(肤色 II/III 型、黑色素瘤选材说明)
- openmedlab Awesome-Medical-Dataset PH2.md — 镜像链接、2015 CRC Press 书章信息
- Winkler JK et al. (2020), JMIR Medical Informatics 8(11):e21695 — 黑角混杂与跨数据集泛化实验(DOI: 10.2196/21695)
- Tang P et al. (2019), CMPB 178:69-77 — Separable-Unet 分割基准
- Öztürk Ş, Ünver HM (2020), J Healthc Eng 2020:4046949(PMC7649844)— iFCN 及 U-Net/SegNet/FCN 对比表
- Wu H et al. (2022) FAT-Net 对比数据(PMC9319384)— DSC 0.9440 及 MCGU-Net 等基线
- LANET 论文(2026)— PH2 SOTA 对比表(LiteMamba-Bound / EM-Net / BDFormer)
- “Advanced hybrid transformer CNN framework”(Scientific Reports 2026, s41598-026-43376-0)— SkinFormNet 指标与文献回顾
- CA-SLNet(PeerJ Computer Science 2024, 10.7717/peerj-cs.3248)— 分类对比表(Ozkan & Koklu 2017 / Xie 2020 / Benyahia 2022 等转引)
- Processes 11(3):910(2023)— MobileNet/ResNet101 PH2 分类基线
- MDPI Bioengineering 11(11):1173(2024)— PH2 作 unseen test 的多任务范式与增强规范
- PMC6364923 — PH2 标注取值体系复述验证
- PMC9648757 — PH2 边框/毛发伪影处理文献
- IJCSE 13(5):101(2026)— 数据集局限综述(小样本、肤色单一)
- IMA++(2026,腾讯新闻转述)— PH2 为最小皮肤分割基准、多标注者趋势
- GLOBOCAN 2022 melanoma fact sheet(IARC)— 331,722 新发 / 58,667 死亡
- ICD-11 MMS(v2025-01/v2026-01,findacode 与综述转述)— 2C30 / 2F20 编码体系
- DTU dlicv 课程 Notebook — 目录结构、100-50-50 划分、掩膜加载范式
- Medical-SAM3 文档 — PH2 loader 与嵌套结构描述
- Kaggle hashbanger/ph2-dataset — 镜像文件规模与 ID 区间(IMD002-IMD435)佐证
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、流行病学、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(规模、设备、标注体系) | 千方病案医学编辑部 | 与 ADDI 官方页面及原始论文交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与官方数据说明及社区 loader 交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 Winkler 2020 等原文比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar/Scopus/OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
