信息速览

MED-NODE — 非皮肤镜临床照片黑色素瘤数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | MED-NODE |
| 英文全称 | MElanoma Diagnosis from NOn-DErmoscopic images |
| 别名/简称 | MED-NODE、MedNode、Groningen melanoma/naevi database |
| 疾病分类 | ICD-11:2C30 皮肤黑色素瘤 / 2F20 黑色素细胞痣(ICD-10:C43 / D22) |
| SNOMED CT | 372244006 Malignant melanoma (disorder) / 1163403006 Pigmented nevus (disorder)(详见 §2.2) |
| 数据模态 | 影像(普通数码相机宏观临床照片,非皮肤镜) |
| AI 任务类型 | 图像分类(黑色素瘤 vs 痣二分类)、小样本/迁移学习评估、数据清洗方法学研究 |
| 样本总数 | 170 张 JPG 图像(70 黑色素瘤 + 100 痣) |
| 数据大小 | ~24.7 MB(官方 zip;官方页面误写为 “24KB”) |
| 数据格式 | JPG(RGB,尺寸约 201×257 至 3,177×1,333 px,逐图不同) |
| 许可证 | 官方页面未附许可证全文,仅要求引用 Giotis et al. 2015;NeurIPS 2023 与 PanDerm 等社区研究按 CC BY 4.0 归类 |
| 访问级别 | 开放(官网直接下载,无需注册) |
| DUO 标签 | GRU(通用研究使用,须署名引用论文) |
| 语言 | 英文(数据集本身为图像,文档与论文为英文) |
| 首发日期 | 2015-07-26(数据集 zip 上线)/ 2015-11-01(ESWA 论文正式发表) |
| 最后更新 | 2015-07-26(单次发布,此后无版本更新) |
| 发布机构 | 格罗宁根大学(University of Groningen)& 格罗宁根大学医学中心(UMCG)皮肤科 |
| 官方主页 | https://www.cs.rug.nl/~imaging/databases/melanoma_naevi |
| 下载地址 | https://www.cs.rug.nl/~imaging/databases/melanoma_naevi/complete_mednode_dataset.zip |
| DOI | 10.1016/j.eswa.2015.04.034(论文) |
| 引用次数 | 490+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 免注册直接下载、标签干净直观、评估场景开箱即用;扣分项:170 张极小样本、无官方划分、无患者元数据、许可未明文 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、黑色素瘤临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与格罗宁根大学、格罗宁根大学医学中心(UMCG)及论文作者团队无任何商业利益关联。本页面不销售 MED-NODE 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MED-NODE 官方页面要求使用时引用 Giotis et al. 2015 论文(引用为强制性义务);页面本身未附许可证全文,社区研究(NeurIPS 2023 Datasets & Benchmarks 等)按 CC BY 4.0 归类——商业用途前请自行完成合规评估。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
MED-NODE 是荷兰格罗宁根大学与格罗宁根大学医学中心(UMCG)皮肤科于 2015 年发布的小型皮肤病变图像数据集,包含 170 张普通数码相机拍摄的临床照片——70 张经活检证实的黑色素瘤和 100 张皮肤科专家确认的痣。它的关键身份是非皮肤镜图像:不是专科设备拍摄的放大皮肤镜图,而是类似全科医生或手机随手拍下的宏观照片。
它的价值恰恰在这个"普通"上。公开皮肤病变数据集几乎被皮肤镜图像垄断(HAM10000、ISIC 系列、PH2),而真实世界的分诊场景——基层诊所、远程医疗、患者自拍——产生的都是普通照片。MED-NODE 是这个稀缺模态里被使用最多的公开基准:2023 年一篇临床图像皮肤癌检测综述直接称它为"CAD 系统中最常用的临床图像数据集",2023 年 NeurIPS 数据基准清洗研究和 2025 年 Nature Medicine 的 PanDerm 皮肤科基础模型都把它列入标准评估套件。
你可以用它来:作为在大规模皮肤镜数据上训练的模型的外部评估集,检验模型在普通照片上的泛化能力;做少样本/迁移学习与小样本方法学研究;或者作为数据清洗方法(如 SelfClean)的经典教学案例。不要用它从头训练深度模型——170 张图像撑不起训练,这是社区的共识定位。
§1.1 摘要
MED-NODE(MElanoma Diagnosis from NOn-DErmoscopic images)随 Giotis 等人 2015 年发表于 Expert Systems with Applications 的论文一同公开,是该论文同名辅助诊断系统的开发与测试数据。数据来自 UMCG 皮肤科数字影像档案,全部使用 Nikon 相机配 2.8/105 mm 镜头、约 330 mm 拍摄距离采集,JPG 格式,单张尺寸从约 201×257 到 3,177×1,333 像素不等。标签只有两类:melanoma(70 张,活检+组织病理学证实)与 naevus(100 张,皮肤科专家确认),标签通过文件夹名称承载,不附带任何 CSV 或患者级元数据。原始系统在颜色/纹理描述子与医师视觉属性上做多数投票,达到 81% 准确率,论文以此证明普通照片可以达到接近皮肤镜 CAD 系统的性能。数据集自 2015-07-26 单次发布后从未更新,官网免注册直接下载,使用条件是引用原始论文。
§1.2 战略价值分析
模态空白维度:皮肤病变 AI 的公开数据生态存在一个结构性失衡——皮肤镜图像(专科设备、放大、偏振光)数据充足,而普通临床照片(consumer camera / smartphone)数据极度稀缺。MED-NODE 是后者中最早、也最常用的公开数据集。2015 年论文的核心论点——普通照片的描述子可以达到与皮肤镜方法相当的诊断性能(81% accuracy)——为"无需专科设备的 AI 分诊"提供了第一个公开证据。这一论点直接指向基层医疗与远程医疗场景,也是后来 SD-128、PAD-UFES-20、DDI 等临床照片数据集出现之前,研究者几乎唯一的选择。
评估方法学维度:MED-NODE 在方法学史上的角色超出了其规模。Gröger 等人(NeurIPS 2023 Datasets and Benchmarks)选择六个小规模皮肤科数据集做专家清洗审计,MED-NODE 位列其中,并被明确点名为"因规模太小而不适合训练、只能作为评估集"的典型——该研究在其上确认了无关样本、近重复与约 1% 的标签错误,并发布了修订文件清单。PanDerm(Nature Medicine 2025)等皮肤科基础模型又把它作为 28 个标准评测基准之一,用于临床照片模态的标签效率实验。换言之,MED-NODE 已经从"一个系统的开发数据"演变为"检验大模型在真实照片模态下泛化能力的标准试金石"。
真实世界维度:黑色素瘤的预后高度依赖早期发现,而早期发现的第一道关卡是全科医生而非皮肤科专家。普通照片 AI 的临床想象是:基层拍一张照、远程完成风险分层、决定是否需要转诊活检。MED-NODE 是验证这一想象的最小可行基准——它规模小、标签干净、获取零门槛,任何团队在发布"面向真实世界照片的皮肤 AI"结果时,都难以绕开在这个 170 张的小集合上报告一组数字。
§1.3 横向对比
| 数据集 | 图像数 | 模态 | 类别 | 标注依据 | 核心差异化 |
|---|---|---|---|---|---|
| MED-NODE | 170 | 临床照片(非皮肤镜) | 2(黑色素瘤/痣) | 黑色素瘤活检证实;痣专家确认 | 最常用的非皮肤镜小样本评估基准;零门槛下载 |
| PH2 | 200 | 皮肤镜 | 3(普通痣/非典型痣/黑色素瘤) | 含分割掩码与 8 项皮肤镜评分 | 皮肤镜小样本评估的"干净"对照(Gröger 审计未发现任何问题) |
| Derm7pt | 2,022 | 皮肤镜 + 临床照片(配对) | 2 + 7 点清单评分 | 7-point checklist 标准 | 同一病灶双模态配对,可做概念驱动诊断 |
| HAM10000 | 10,015 | 皮肤镜 | 7 | 过半组织病理证实 | 皮肤镜多分类训练的事实标准 |
| DDI | 656 | 临床照片 | 78 病/良恶二分 | 活检证实为主 | 多肤色(FST 多样性)评估,斯坦福诊所 |
| PAD-UFES-20 | 2,298 | 智能手机临床照片 | 6 | 含 21 项临床字段 | 巴西队列,患者级元数据完整 |
| ISIC 2019 | 25,331 | 皮肤镜 | 8+未知类 | 多中心挑战集 | 大规模训练与开放集识别 |
MED-NODE 的不可替代性不在规模,而在三点:非皮肤镜模态的稀缺性(与 PH2/HAM10000 互补而非竞争)、标签的病理学背书(黑色素瘤全部活检证实)、以及被 Gröger 审计与 PanDerm 评测双重固化的"标准评估集"地位。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2013-01 | 前作 Giotis et al. “Discriminative power of visual attributes in dermatology” 发表(Skin Research and Technology 19(1):e123-e131),奠定医师视觉属性方法 |
| 2015-04-22 | ESWA 论文被接受(DOI: 10.1016/j.eswa.2015.04.034) |
| 2015-07-26 | 数据集 zip 在格罗宁根大学计算机系页面发布(complete_mednode_dataset.zip,约 24.7 MB;官方页面最后修改日期) |
| 2015-11-01 | 论文正式发表:Expert Systems with Applications 42(19):6578-6585 |
| 2019-05 | Hosny et al.(PLOS ONE)报告 AlexNet 迁移学习 + 旋转增强在 MED-NODE 上 97.7% 准确率——后被广泛引为"先增强后划分"的数据泄漏反面教材 |
| 2020-09 | Barra/Talaat 等 “Bucket of deep transfer learning features”(Neural Computing & Applications 2021)在 MED-NODE 上报告 ACC 0.93,并系统汇总 10+ 前作结果 |
| 2023-09 | Gröger et al. “Towards Reliable Dermatology Evaluation Benchmarks”(NeurIPS 2023 D&B)发布 MED-NODE 专家清洗结果与修订文件清单 |
| 2023-10 | Di Biasi et al.(BMC Bioinformatics)以假阴性率最小化为目标在 MED-NODE 上系统比较 8 种 CNN 架构 |
| 2025-06-06 | PanDerm(Yan et al., Nature Medicine 31:2691-2702)将 Med-Node 纳入 28 项标准评测基准 |
§1.5 典型 AI 应用场景
- 跨模态外部评估:在 HAM10000/ISIC 等大规模皮肤镜数据上训练模型后,用 MED-NODE 的 170 张普通照片做 zero-shot 或微调评估,检验模型对真实世界照片的泛化能力——这是当前社区最主流的用法。
- 少样本与标签效率研究:以 MED-NODE 为下游任务,测试基础模型(如 PanDerm、DINOv2)在 10%-50% 标签下的线性探测或微调性能。
- 数据清洗方法学研究:Gröger et al. 已发布专家确认的问题样本清单,MED-NODE 是验证自动清洗工具(SelfClean 等)的最小标准实验场。
- 教学与课程项目:170 张、24.7 MB、免注册、标签即文件夹名——是医疗图像分类课程"一节课跑通全流程"的理想数据集。
- 假阴性率(FNR)敏感的方法学:以黑色素瘤漏诊为核心风险的模型比较(Di Biasi et al. 2023 的范式),适合演示灵敏度优先的临床 AI 评估思路。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
| 数据集类别 | ICD-11 编码 | ICD-11 名称 | ICD-10 桥接 | 备注 |
|---|---|---|---|---|
| melanoma(70 张) | 2C30 | 皮肤黑色素瘤(Melanoma of skin) | C43 | 含亚型:2C30.0 浅表扩散型、2C30.1 结节型、2C30.2 恶性雀斑样、2C30.3 肢端雀斑样;数据集未标注亚型 |
| naevus(100 张) | 2F20 | 黑色素细胞痣(Melanocytic naevi) | D22 | 含 2F20.0 普通获得性、2F20.1 非典型(发育不良)、2F20.2 先天性;数据集未标注亚型 |
为什么亚型未标注是重要信息:2F20.1 非典型(发育不良)痣是临床上与黑色素瘤最难鉴别的实体,也是 CAD 系统错误最集中的区域。MED-NODE 的 100 张痣中是否包含非典型痣、比例多少,公开材料未说明——这意味着你无法从标签层面分析模型在"困难良性"亚群上的表现,只能依靠 Gröger 审计的专家复审(见 §6.5 坑点 4)间接感知。
§2.2 SNOMED CT 映射
| 数据集标签 | ICD-11 | ICD-10 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|---|
| melanoma | 2C30 | C43 | 372244006 | Malignant melanoma (disorder) |
| naevus | 2F20 | D22 | 1163403006 | Pigmented nevus (disorder) |
补充说明:临床文献中还常用 93655004(Melanoma in situ)区分原位黑色素瘤;MED-NODE 标签未区分原位与浸润性病变。SNOMED CT 编码在欧美 AI 产品注册(如 FDA SaMD 文档、欧盟 MDR 技术文档)中被广泛引用,构建合规文档时可与上表直接对照。
§2.3 疾病简介
黑色素瘤是侵袭性最强的皮肤癌:它只占全部皮肤癌的约 1%,却贡献了皮肤癌死亡的大部分。据 GLOBOCAN 2022(IARC),全球 2022 年新发皮肤黑色素瘤 331,722 例、死亡 58,667 例,居全部癌症第 17 位;欧洲占新发病例的 44.1%,澳大利亚年龄标化发病率全球最高(37.0/10 万)。IARC 2025 年的归因研究估计,2022 年全球约 83% 的皮肤黑色素瘤(约 26.7 万例)由紫外线暴露引起,并预计 2040 年新发病例将超过 51 万例。早期黑色素瘤经切除后 5 年生存率极高,而一旦转移预后急剧恶化——诊断时点几乎决定生死,这正是"普通照片 AI 初筛"这一临床想象的全部意义。
与黑色素瘤相对,黑色素细胞痣是几乎人人都有的良性病变(多数成年人有 10-40 颗)。临床鉴别依赖 ABCDE 法则:不对称(Asymmetry)、边界不规则(Border irregularity)、颜色斑驳(Colour variability)、与患者其他痣不同(Different / "丑小鸭"征)、演进变化(Evolving);结节型另有 EFG 标准(Elevated / Firm / Growing)。MED-NODE 原始系统的"医师视觉属性"模块正是这一临床规则的计算化。
§2.4 临床任务定义
| AI 任务 | 临床对应 | 在 MED-NODE 中的操作化 | 任务边界 |
|---|---|---|---|
| 黑色素瘤 vs 痣二分类 | 门诊初筛:该病灶是否需要转诊/活检 | 对 170 张照片输出 melanoma / naevus 二分类 | 不覆盖基底细胞癌、鳞癌、脂溢性角化等其他常见皮肤肿瘤;不能替代组织病理学诊断 |
| 灵敏度优先的风险分层 | 漏诊黑色素瘤的代价远高于误诊良性 | 以 FNR/灵敏度为核心指标评估模型(Di Biasi 2023 范式) | 170 张样本下灵敏度置信区间极宽(见 §6.5 坑点 5) |
| 跨模态泛化评估 | 皮肤镜模型能否用于普通照片 | 皮肤镜训练的模型在 MED-NODE 上 zero-shot/微调评估 | 评估结论受小样本与已知标签噪声限制 |
| 标签效率基准 | 基础模型用多少标签能达到可用性能 | 不同比例训练标签下的线性探测/微调 | 仅反映二分类任务,不可外推多分类 |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 单中心:格罗宁根大学医学中心(UMCG)皮肤科数字影像档案,荷兰北部最大学术医学中心 |
| 采集时间 | 未在公开渠道精确记录(档案回顾性提取,发布于 2015 年) |
| 规模 | 170 张图像(70 黑色素瘤 + 100 痣);图像与患者/病灶的对应关系未明确说明 |
| 就医类型 | 皮肤科门诊(学术转诊中心) |
| 肤色背景 | 未发布;按荷兰北部人口推断以 Fitzpatrick I-III 型浅肤色为主 |
关键提醒:MED-NODE 不发布任何患者级人口学元数据——无年龄、无性别、无解剖部位、无 Fitzpatrick 肤色分型。这带来两个直接后果:(1) 无法做任何亚组公平性分析;(2) 无法确认 170 张图像是否来自 170 个不同病灶/患者(Gröger 审计确认了 1 对近重复图像,提示同病灶多视角的可能性,见 §6.5 坑点 4 与坑点 7)。若你的研究问题依赖这些维度,请改用 PAD-UFES-20(含 21 项临床字段)或 DDI(含肤色分型)。
§2.6 金标准/参考标准
| 数据类别 | 确认方式 | 确认者 | 金标准性质 |
|---|---|---|---|
| melanoma(70 张) | 活检 + 组织病理学检查 | UMCG 皮肤科/病理科 | 最高级别:病理学金标准 |
| naevus(100 张) | 临床诊断确认 | UMCG 皮肤科专家(dermatologist / dermato-pathologist) | 专家共识级:良性痣通常不常规活检,依赖专家判断 |
金标准的两面性:黑色素瘤一侧的病理学背书是 MED-NODE 标签质量的最大资产——在 Gröger 审计中,多数曾被算法标记为"疑似标签错误"的样本恰恰来自视觉不典型但病理学确认的病例,论文据此强调"活检标签不应被视觉评审推翻"。痣一侧的专家确认则是相对软肋:无病理学复核意味着极端困难病例(如重度非典型痣)存在理论上的错标空间。Gröger et al. 估计 MED-NODE 标签错误率约为 1%(一致同意口径 2/170)。
§3 数据集规格
§3.0 版本抉择矩阵
MED-NODE 只有一个官方版本(2015-07-26 单次发布,从未更新),但存在四种"获取形态",选型如下:
| 你的需求 | 推荐获取形态 | 大小 | 理由 |
|---|---|---|---|
| 论文级复现与合规引用 | 官方 zip(cs.rug.nl 官网) | ~24.7 MB | 唯一权威来源,满足"引用原始来源"的学术规范;文件自 2015 年起未变 |
| 快速原型 / Notebook 环境 | Kaggle 镜像(prabhavsanga/med-node) | ~24.7 MB | 免命令行、直接挂入 Kaggle Kernel;注意这是第三方搬运,正式研究请回填官方出处 |
| 基准评估(与 Gröger 2023 / PanDerm 可比) | 官方 zip + SelfClean 修订清单 | ~24.7 MB | Gröger et al. 发布的修订文件清单剔除了专家确认的无关样本与近重复,是当前方法学最严谨的评估口径 |
| 在大数据上训练后做外部验证 | 官方 zip(仅作测试集) | ~24.7 MB | 社区共识用法:MED-NODE 不用于训练,只用于评估 |
一句话结论:永远从官方页面下载;做基准评估时叠加 SelfClean 修订清单;把它当测试集而非训练集。
§3.1 模态详细说明
MED-NODE 是宏观临床照片(macroscopic / clinical photography),与皮肤镜(dermoscopy)图像有本质区别:
- 拍摄方式:普通数码相机直视拍摄,无偏振光、无浸润液、无皮肤接触压板,病灶以肉眼所见形态呈现,通常包含周围正常皮肤、毛发、阴影与自然光照变化。
- 信息含量:无皮肤镜下的色素网、点/球、条纹等亚表皮结构;诊断线索主要是宏观形态学——不对称性、边界、颜色分布、直径比例——即 ABCDE 法则的视觉基础。
- 场景代表性:对应全科医生相机、远程医疗上传照片、患者自拍这一真实世界入口场景,与专科皮肤镜场景形成互补。
- 技术参数:RGB 三通道 JPG,逐图尺寸不一(约 201×257 至 3,177×1,333 px),长宽比与取景范围不统一,存在毛发遮挡与光照不均——这些"噪声"恰恰是模态真实性的一部分,也是预处理的核心挑战(见 §6.5 坑点 6)。
两种模态的对照(理解 MED-NODE 定位的关键):
| 维度 | 宏观临床照片(MED-NODE) | 皮肤镜图像(PH2/HAM10000/ISIC) |
|---|---|---|
| 采集设备 | 普通数码相机(Nikon + 105 mm 镜头) | 皮肤镜(接触式/偏振,10 倍以上放大) |
| 可见结构 | 宏观形态:轮廓、边界、表面颜色分布 | 亚表皮结构:色素网、点球、蓝白幕、血管模式 |
| 临床使用者 | 全科医生、远程医疗、患者自拍 | 皮肤科专科医师 |
| 公开数据供给 | 极度稀缺(2015 年时 MED-NODE 几乎唯一) | 充足(ISIC 系列数万张) |
| 模型可迁移性 | 直接对应手机照片部署场景 | 专科场景受限,向照片迁移有域差 |
| 代表基准 | MED-NODE、DDI、PAD-UFES-20 | PH2、HAM10000、ISIC 2018/2019/2020 |
值得强调:两种模态不是"清晰版与模糊版"的关系,而是采集协议、可见特征集、目标使用者全面不同的两条技术路线。Giotis et al. 2015 的贡献正在于证明:在没有皮肤镜亚表皮结构的前提下,宏观颜色/纹理描述子加医师视觉属性仍可达到 81% 准确率——这一结论构成了后来整个"消费级照片皮肤 AI"研究方向的出发点。
§3.2 样本量拆分
| 子集(文件夹) | 图像数 | 占比 | 标签依据 |
|---|---|---|---|
| melanoma/ | 70 | 41.2% | 活检 + 组织病理学证实 |
| naevus/ | 100 | 58.8% | 皮肤科专家确认 |
| 合计 | 170 | 100% | — |
无官方 train/validation/test 划分(见 §5.1)。注意黑色素瘤 41.2% 的"患病率"远高于任何真实筛查场景(基层人群中黑色素瘤占比通常 <1%)——这是病例-对照式档案抽样的典型特征,模型阈值不可按此先验校准(见 §7.1)。
§3.3 数据格式详情
| 项目 | 格式 | 说明 |
|---|---|---|
| 图像文件 | JPG(RGB,8-bit) | 170 个文件,纯数字文件名(如 896.jpg、19085.jpg),按类别分两个文件夹 |
| 标签 | 文件夹名称 | melanoma/ 与 naevus/ 目录名即标签,无独立 CSV/JSON 标注文件 |
| 元数据 | 无 | 不附带任何患者级或图像级元数据表 |
| 压缩包 | zip(约 24.7 MB) | 官方页面文字标注 “24KB” 为笔误(实测 HTTP Content-Length 25,864,871 字节) |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| 官方 zip | ~24.7 MB(25,864,871 字节,实测) | 2015-07-26 上传后未变更 |
| 解压后 | ~25 MB | 170 张 JPG 总计,单张几十 KB 至数百 KB |
| 建模工作目录 | <1 GB | 含 resize 缓存、增强副本与特征提取结果 |
这是医疗影像数据集中最轻量的一档:任何笔记本(含 Colab 免费实例)都能在数秒内完成下载与解压,磁盘与带宽不构成任何门槛。对 CI/CD 场景同样友好——可将解压后的目录直接纳入自动化测试流水线,每次提交全量评估一次的成本可忽略不计。
§3.5 标注方式
标注沿临床常规路径产生,而非为 AI 研究单独组织:
UMCG 皮肤科门诊
├─ 疑似恶性病灶 → 活检 → 组织病理学证实 → 归入 melanoma/(70 张)
└─ 临床判断良性病灶 → 皮肤科专家确认 → 归入 naevus/(100 张)
↓
从科室数字影像档案回顾性提取、脱敏、打包发布(2015-07)
标签即文件夹名,没有独立的标注文件、没有标注者间一致性统计、没有逐图置信度。Gröger et al.(NeurIPS 2023)的三专家复审是发布之后唯一一次系统性标签质量审计(结果见 §7.2 与 §6.5 坑点 4)。
§3.6 标注者资质
| 角色 | 资质 | 职责 |
|---|---|---|
| 临床医师 | UMCG 皮肤科(含 Jonkman MF 教授团队,该中心为水疱病诊疗中心) | 拍摄与初步诊断 |
| 病理科医师 | UMCG 病理科 | 黑色素瘤的组织病理学证实 |
| 皮肤科专家 | UMCG 高级皮肤科医师 | 痣的临床确认(gold-standard 编入) |
| 审计专家(发布后) | Gröger et al. 2023 组织的 3 名执业皮肤科医师 | 无关样本/近重复/标签错误复审 |
§3.7 数据采集时间范围
公开材料未记录精确的采集起止时间。已知事实链为:影像来自 UMCG 皮肤科数字档案的回顾性提取,方法学前作发表于 2013 年,数据集 zip 于 2015-07-26 上线。可合理推断采集窗口为 2010 年代前半及更早,但具体跨度不可考——在论文方法部分请勿杜撰采集年份。
§3.8 地理覆盖
单中心——荷兰格罗宁根,格罗宁根大学医学中心(UMCG)。患者人群以荷兰北部为主,推断以 Fitzpatrick I-III 型浅肤色为主(未发布肤色元数据)。单中心 + 单一相机协议 + 浅肤色人群构成三重代表性限制,详见 §7.3。
§3.9 采集设备规格
| 项目 | 规格 | 备注 |
|---|---|---|
| 相机 | Nikon 数码相机 | 具体型号公开二手文献未载明 |
| 镜头 | 2.8/105 mm | 微距级别镜头配置 |
| 拍摄距离 | 平均约 330 mm | 全数据集保持一致的拍摄距离 |
| 光照 | 室内临床环境 | 无标准化光源记录,存在自然光照差异 |
| 输出 | JPG(RGB) | 逐图尺寸不一(约 201×257 至 3,177×1,333 px) |
设备与距离的相对一致性是 MED-NODE 数据质量的隐性优点:同一机身-镜头-距离协议意味着颜色与纹理描述子具有跨图可比性——这正是原始论文选择颜色/纹理描述子的工程前提。
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 临床诊疗 | UMCG 皮肤科门诊 | 医师对病灶拍摄宏观照片,进入科室数字影像档案 |
| 2. 诊断确认 | 活检 + 组织病理学(恶性)/ 专家临床确认(良性) | 产生标签的临床依据,标签不对称:恶性有病理、良性无病理 |
| 3. 回顾性提取 | 研究者从档案筛选黑色素瘤与痣两类病例 | 病例-对照式抽样(70+100),不代表门诊真实患病率 |
| 4. 系统开发与测试 | MED-NODE 专家系统(分割 + 颜色/纹理描述子 + 视觉属性 + 多数投票) | 报告 81% accuracy,验证非皮肤镜可行性 |
| 5. 公开发布 | 格罗宁根大学计算机系页面(2015-07-26) | 单 zip 直接下载,要求引用论文 |
| 6. 社区固化 | Kaggle 镜像(第三方)、Gröger 审计修订清单(2023)、PanDerm 评测(2025) | 从"一个系统的数据"演变为"标准评估基准" |
§4 数据结构详解
§4.0 目录结构预览
complete_mednode_dataset/
├── melanoma/ # 70 张黑色素瘤(活检证实)
│ ├── 208.jpg
│ ├── 441.jpg
│ ├── 896.jpg
│ ├── 2827.jpg
│ └── ...(共 70 个 .jpg,纯数字文件名)
├── naevus/ # 100 张痣(专家确认)
│ ├── 19085.jpg
│ ├── 21457.jpg
│ └── ...(共 100 个 .jpg,纯数字文件名)
三个工程要点:
- 没有 CSV、没有 README、没有 LICENSE 文件——zip 内只有图像。标签完全由目录名承载。
- 文件名是纯数字(档案编号),数字大小与类别无关,不要从文件名推断任何信息。
- 两个文件夹内文件名各自唯一,但存在跨文件夹同名数字的理论可能——合并文件时务必保留类别前缀(如
melanoma_896.jpg),避免覆盖。
§4.1 DAIMS 标准化字段描述表
MED-NODE 无表格数据,以下按 DAIMS 8 列格式描述"图像记录"的逻辑字段:
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| filename | string | 档案编号文件名 | “896.jpg” | 样本唯一标识 | 无 | 不允许缺失 | 纯数字 + .jpg |
| label | string (binary) | 诊断标签,由父目录名承载 | “melanoma” | 分类目标 | 专家审计确认约 1% 错标(一致同意口径) | 不允许缺失 | {“melanoma”, “naevus”} |
| image | JPEG bytes | RGB 临床照片 | — | 模型输入 | 尺寸/长宽比/光照逐图不同;存在毛发遮挡 | 不允许缺失 | 约 201×257 至 3,177×1,333 px |
| width/height | int | 逐图尺寸 | 949×801(中位数) | 预处理决策 | 跨度约 15 倍 | 不允许缺失 | 见 §4.3 |
| color_space | — | 色彩空间 | sRGB | 颜色描述子前提 | 未嵌 ICC 配置文件保证 | — | RGB 三通道 |
§4.2 标签分布统计
| 类别 | 数量 | 占比 | 备注 |
|---|---|---|---|
| naevus(阴性) | 100 | 58.8% | 多数类 |
| melanoma(阳性) | 70 | 41.2% | 少数类,类别不平衡比约 1 : 1.43 |
分布解读:这是典型的病例-对照式富集——真实基层筛查场景中黑色素瘤占送检病灶的比例通常低于 1%-5%,41.2% 的阳性率是为建模便利而人为抬高的。两点直接后果:(1) 在 MED-NODE 上按 0.5 阈值校准的模型,部署到真实场景会产生大量假阳性,必须按目标场景先验重新校准阈值;(2) "全部猜痣"的零模型在 MED-NODE 上就有 58.8% accuracy——只报 accuracy 的论文结论必须打折(见 §6.5 坑点 5)。
§4.3 关键字段描述性统计
- 图像尺寸:最小约 201×257 px,中位约 949×801 px,最大约 3,177×1,333 px(据社区统计与综述复核),最大边与最小边跨度约 15 倍。
- 文件体积:单张几十 KB 至数百 KB,总计约 25 MB。
- 长宽比:不统一(横竖构图混合),resize 时必须保比例(见 §6.3)。
- 标签完整性:170/170 张均有明确标签(标签缺失率 0%)。
- Gröger 审计(一致同意口径):3 张无关样本(1.8%)、1 对近重复(0.6%)、2 张标签错误(1.2%)。
§4.4 数据层级关系
MED-NODE(扁平结构,无层级)
└─ 170 张图像
├─ ? 患者(未知:公开材料未说明图像-患者映射)
└─ ? 病灶(未知:可能存在同一病灶多视角——专家确认 1 对近重复)
这是与多数医疗影像数据集的关键差异:MED-NODE 没有可恢复的患者/病灶层级。工程含义:(1) 无法做严格的患者级分组划分,最接近的代理是用 Gröger 的近重复清单人工合并;(2) 无法计算"每患者多个病灶"类的统计量;(3) 在论文中应表述为"170 张图像"而非"170 名患者"——后者是事实错误。
§4.5 缺失值情况与信息性缺失编码
| 缺失维度 | 状态 | 对 AI 的影响 |
|---|---|---|
| 标签缺失 | 0/170(完整) | 无影响 |
| 图像损坏 | 未见报告 | 加载时建议加 Image.verify() 防御 |
| 患者元数据 | 整体未发布(年龄/性别/部位/肤色) | 无法亚组分析;无法患者级分组;公平性研究请改用 DDI / PAD-UFES-20 |
| 图像-病灶映射 | 未发布 | 近重复只能靠内容相似性检测(SelfClean 已给出清单) |
| 采集时间戳 | 未发布 | 无法做时间维度分析 |
MED-NODE 的"缺失"不是散点式的单元格缺失,而是整列维度的缺席——这是 2015 年时代小数据集的典型形态,使用时必须在研究设计阶段就承认这些维度不存在,而非在分析阶段才发现。
§5 数据划分与使用建议
§5.1 官方数据划分
MED-NODE 官方不提供任何 train/validation/test 划分。 这直接造成了文献中的混乱局面:各论文自行使用 10-fold 交叉验证、留一法或随机拆分,且相当部分未报告随机种子与折叠构成,导致 81% 到 97.7% 的"准确率"在纸面上共存但不可比较(详见 §6.5 坑点 2)。社区在 2023 年后形成的共识用法是:不把 MED-NODE 拆分为训练/测试,而是把它整体作为外部评估集——在 HAM10000、ISIC 或机构内部数据上训练,在 MED-NODE 全量 170 张上评估。
§5.2 推荐划分策略
按用途三选一:
- 外部评估(首选,社区共识):MED-NODE 全量 170 张作为测试集,训练集来自其他数据源。报告 AUROC + 灵敏度/特异度 + 95% CI,并注明是否使用 SelfClean 修订清单。
- 分层 K 折交叉验证(如必须在其上训练):5 折或 10 折分层抽样(保持 41.2% 阳性率),固定随机种子并公开折叠构成文件;重复 10 次取均值±标准差。先划分、后增强,任何预处理(含 resize 参数、归一化统计)只允许在训练折上拟合。
- 留一法(LOO):170 折,适合经典机器学习(SVM/随机森林 + 手工特征)的小样本研究;方差大,需报告置信区间。
from sklearn.model_selection import StratifiedKFold
import numpy as np
# paths: 170 个图像路径;labels: 1=melanoma, 0=naevus
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
for fold, (tr, te) in enumerate(skf.split(paths, labels)):
np.save(f"fold{fold}_train.npy", tr) # 公开折叠构成,保证可复现
np.save(f"fold{fold}_test.npy", te)
assert len(set(paths[tr]) & set(paths[te])) == 0
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 先增强后划分:旋转/翻转后的副本散落在训练折与测试折 | 极高(文献实锤,见 §6.5 坑点 1) | 严格先划分再增强;增强只作用于训练折 |
| 2 | 同一病灶的近重复图像跨折 | 高 | 用 Gröger 近重复清单合并后再划分 |
| 3 | 在全量数据上计算归一化均值/方差 | 中 | 归一化统计只在训练折上计算 |
| 4 | 在 MED-NODE 上调参(选模型/选阈值)再在同一集合上报性能 | 高 | 阈值与超参在独立验证集上确定;MED-NODE 只碰一次 |
| 5 | 训练集含 MED-NODE 图像(基础模型预训练混入) | 中 | 报告预训练语料去重声明(PanDerm 等大模型的标准做法) |
一个容易忽视的细节:泄漏模式 1 与 2 会叠加——先增强后划分时,近重复对的增强副本同时出现在两侧,测试集实际变成"见过的图的变换版",性能膨胀幅度远大于单一泄漏源。Hosny 2019 报告的 97.7% 与同论文未增强的 91.18% 之间的差距(6.5 个百分点),大部分即可归因于此。
§5.4 交叉验证建议
- 经典 ML(手工特征 + SVM/RF):10 折分层 CV 重复 10 次,或 LOO。
- 深度模型(迁移学习):5 折分层 CV,每折内再从训练侧切 10% 做早停验证;报告 5 折均值±标准差而非单折最优。
- 任何 CV 结论都应同时在"全量训练集外来数据 → MED-NODE 全量评估"的口径下复算一次,两个口径的差异本身就是有意义的结果。
§5.5 外部验证
- MED-NODE 作为目标侧:HAM10000 / ISIC 2019(皮肤镜)→ MED-NODE(临床照片)是最经典的跨模态泛化路径;PanDerm 等基础模型即在此口径下报告。
- MED-NODE 作为源侧(不推荐但常见):在 MED-NODE 上训练的模型应到 PH2(皮肤镜小样本)、DDI 或 PAD-UFES-20(临床照片)上验证;鉴于 170 张的训练容量,此类结论的证据强度天然有限。
- 清洗口径对照:建议同时报告原始 170 张与 SelfClean 修订清单剔除后(约 166-167 张)的两组数字,量化标签噪声对评估结论的影响。
§6 AI 就绪指南
§6.0 云端快速启动
零门槛试用:MED-NODE 官方 zip 仅约 24.7 MB、免注册,Colab 免费实例两行命令即可开始。Kaggle 用户也可直接使用第三方镜像数据集
prabhavsanga/med-node(一键挂入 Notebook,正式发表请回填官方出处)。
# Colab / 任意 Linux 环境:30 秒完成下载与解压
wget -q https://www.cs.rug.nl/~imaging/databases/melanoma_naevi/complete_mednode_dataset.zip
unzip -q complete_mednode_dataset.zip -d ./data/
ls ./data/complete_mednode_dataset/melanoma | wc -l # 期望输出 70
ls ./data/complete_mednode_dataset/naevus | wc -l # 期望输出 100
§6.1 快速上手(PyTorch 版)
# ========================================
# MED-NODE 快速上手 — PyTorch 版
# 环境要求: torch>=2.0, torchvision, Pillow
#
# ⚠️ 目录结构预期:
# 将官方 zip 解压至 ./data/,确保以下结构:
# ./data/complete_mednode_dataset/
# ├── melanoma/ # 70 张 .jpg
# └── naevus/ # 100 张 .jpg
#
# 标签即文件夹名:melanoma=1(阳性), naevus=0(阴性)
# 无 CSV、无官方划分;本例以全量加载 + 分层 5 折演示
# ========================================
import os
from PIL import Image
import torch
from torch.utils.data import Dataset
class MedNodeDataset(Dataset):
def __init__(self, root, transform=None, indices=None):
self.samples = [] # (path, label)
for label, cls in enumerate(["naevus", "melanoma"]):
folder = os.path.join(root, cls)
for fn in sorted(os.listdir(folder)):
if fn.lower().endswith(".jpg"):
self.samples.append((os.path.join(folder, fn), label))
if indices is not None:
self.samples = [self.samples[i] for i in indices]
self.transform = transform
def __len__(self):
return len(self.samples)
def __getitem__(self, i):
path, label = self.samples[i]
img = Image.open(path).convert("RGB") # 防御 RGBA/灰度异常
if self.transform:
img = self.transform(img)
return img, label
root = "./data/complete_mednode_dataset"
full = MedNodeDataset(root)
print(f"总样本: {len(full)}") # 期望输出 170
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| 官方 zip(推荐) | https://www.cs.rug.nl/~imaging/databases/melanoma_naevi/complete_mednode_dataset.zip | ~24.7 MB | 直接下载,无需注册;使用须引用 Giotis et al. 2015 |
| 官方说明页 | https://www.cs.rug.nl/~imaging/databases/melanoma_naevi | — | 数据集描述与引用要求 |
| Kaggle 镜像 | https://www.kaggle.com/datasets/prabhavsanga/med-node | ~24.7 MB | Kaggle Notebook 一键挂载;第三方搬运,注意回填官方出处 |
| SelfClean 修订清单 | Gröger et al. 2023 配套发布 | 文本清单 | 剔除专家确认的无关样本/近重复,做严谨基准评估时叠加使用 |
合规义务:发表时引用 Giotis et al. 2015(完整 BibTeX 见 §9)。官方页面未附许可证全文,社区按 CC BY 4.0 归类;商业用途前请完成独立法律评估(见 §6.5 坑点 8)。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 4 步预处理代码(保比例 resize + 统计仅训练折拟合)</b></summary>
# 步骤 1:加载并体检(尺寸分布、损坏文件、通道检查)
from PIL import Image
import numpy as np, os
def audit(root):
sizes, bad = [], []
for cls in ["melanoma", "naevus"]:
for fn in sorted(os.listdir(os.path.join(root, cls))):
p = os.path.join(root, cls, fn)
try:
with Image.open(p) as im:
im.verify()
with Image.open(p) as im:
sizes.append((cls, fn, im.size[0], im.size[1], im.mode))
except Exception:
bad.append(p)
print(f"图像 {len(sizes)} 张,损坏 {len(bad)} 张")
ws = [s[2] for s in sizes]; hs = [s[3] for s in sizes]
print(f"宽: min {min(ws)} / 中位 {int(np.median(ws))} / max {max(ws)}")
print(f"高: min {min(hs)} / 中位 {int(np.median(hs))} / max {max(hs)}")
assert all(s[4] == "RGB" for s in sizes) # 确认无 RGBA/灰度
return sizes
sizes = audit("./data/complete_mednode_dataset")
# 步骤 2:保比例缩放(letterbox),拒绝暴力 224×224 拉伸
import torchvision.transforms.v2 as T
transform_eval = T.Compose([
T.Resize(256), # 短边 256,保长宽比
T.CenterCrop(224), # 中心裁剪
T.ToImage(),
T.ToDtype(torch.float32, scale=True),
T.Normalize(mean=[0.485, 0.456, 0.406], # ImageNet 统计(迁移学习时)
std=[0.229, 0.224, 0.225]),
])
# 步骤 3:先划分、后增强(铁律)
from sklearn.model_selection import StratifiedKFold
labels = np.array([1 if c == "melanoma" else 0 for c, *_ in sizes])
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
train_idx, test_idx = next(skf.split(np.zeros(len(labels)), labels))
transform_train = T.Compose([
T.Resize(256),
T.RandomResizedCrop(224, scale=(0.8, 1.0)), # 仅训练折
T.RandomHorizontalFlip(), # 仅训练折
T.ColorJitter(brightness=0.1, contrast=0.1), # 仅训练折,幅度克制
T.ToImage(),
T.ToDtype(torch.float32, scale=True),
T.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]),
])
# 步骤 4:构建 Dataset(复用 §6.1 的 MedNodeDataset)
train_ds = MedNodeDataset("./data/complete_mednode_dataset",
transform=transform_train, indices=train_idx)
test_ds = MedNodeDataset("./data/complete_mednode_dataset",
transform=transform_eval, indices=test_idx)
print(f"train {len(train_ds)} / test {len(test_ds)}")
</details>
管线说明:(1) MED-NODE 尺寸跨度约 15 倍且长宽比不一,保比例缩放 + 中心裁剪是必须而非可选;(2) 归一化统计、增强采样、RandomResizedCrop 的参数只允许在训练折上存在;(3) 若做手工特征(颜色/纹理描述子复现 Giotis 体系),建议在原图而非 resize 后的图上提取,保留原始分辨率信息。
§6.4 框架加载
# PyTorch DataLoader(170 张可全量驻留内存,batch 可开大)
from torch.utils.data import DataLoader
train_loader = DataLoader(train_ds, batch_size=32, shuffle=True, num_workers=2)
test_loader = DataLoader(test_ds, batch_size=64, shuffle=False)
# TensorFlow / Keras 等价加载
import tensorflow as tf
ds = tf.keras.utils.image_dataset_from_directory(
"./data/complete_mednode_dataset",
labels="inferred", # 目录名即标签:melanoma / naevus
label_mode="binary",
image_size=(224, 224), # 注意:此参数为暴力拉伸,正式实验请改保比例管线
batch_size=32,
shuffle=True,
seed=42,
)
# scikit-learn 经典 ML 路径(手工特征 + SVM)
from sklearn.svm import SVC
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
clf = make_pipeline(StandardScaler(), SVC(kernel="rbf", probability=True))
# X: 颜色直方图/GLCM/Gabor 等手工特征矩阵(170 × d),y: 0/1 标签
# clf.fit(X_train, y_train)
§6.5 常见坑点
⚠️ 坑点 1:先增强后划分——旋转副本跨折泄漏(分类:数据泄漏)
问题:170 张图像太小,许多研究先做旋转增强(如 55 个角度扩到数千张)再做交叉验证。同一原图的增强副本同时落入训练折与测试折,模型"记住"的是同一张病灶照片。
症状:准确率高得反常(如 97%+),但换一批外部数据立刻崩塌;同论文的未增强实验与增强实验差距超过 6 个百分点。
解决:铁律是先划分、后增强,增强只作用于训练折。文献对照案例:Hosny et al. 2019(PLOS ONE)在 MED-NODE 上原图 10 折 CV 得 91.18%,"增强后 CV"得 97.70%——后者的提升中相当比例来自副本泄漏而非泛化能力。复现或引用此类数字时必须注明协议差异。
参考:Hosny KM et al. (2019), PLOS ONE 14(5):e0217293(DOI: 10.1371/journal.pone.0217293);§5.3 泄漏防御表。
⚠️ 坑点 2:无官方划分 + 极小样本——跨论文数字不可直接比较(分类:评估误用)
问题:MED-NODE 无官方划分,文献中存在 10 折 CV、LOO、随机拆分、增强后 CV 等多种协议,准确率从 81%(Giotis 2015)到 97.7%(Hosny 2019)不等。这些数字分母不同、折叠不同、泄漏状态不同,不构成排行榜。
症状:你的 5 折 CV 结果比某论文低 10 个百分点,但无法判断是模型差距还是协议差距。
解决:(1) 只在相同协议内比较(自述协议 + 固定种子 + 公开折叠文件);(2) 首选"外部数据训练 → MED-NODE 全量评估"的社区共识口径;(3) 引用他人数字时必须连同协议一起引用(见 §8.1 的双层排行榜设计)。
参考:Gröger et al. (2023), NeurIPS D&B(arXiv:2309.06961)对评估协议标准化的讨论。
⚠️ 坑点 3:二手资料把类别数写反、把模态误写为"皮肤镜"(分类:标签理解)
问题:部分二手文献与数据集目录将 MED-NODE 描述为"100 黑色素瘤 + 70 痣"(写反),或称其为"dermoscopic images / 皮肤镜图像"(模态错误)。照抄这些表述会导致类别先验设置错误,并把跨模态结论张冠李戴。
症状:代码里
pos_weight算反;论文 related work 把 MED-NODE 与 PH2 并列为"皮肤镜数据集"。解决:以官方页面为唯一权威:70 melanoma + 100 naevus,非皮肤镜(non-dermoscopic)临床照片。已知错误出处包括个别综述与数据集目录页;引用规模时顺手核对一次官网。
参考:官方页面 https://www.cs.rug.nl/~imaging/databases/melanoma_naevi ;Hosny 2019(误作 “high quality dermoscopy images”)。
⚠️ 坑点 4:专家确认的无关样本、近重复与标签错误(分类:标签理解)
问题:Gröger et al.(NeurIPS 2023)组织 3 名执业皮肤科医师对 MED-NODE 全量复审,一致同意口径下确认 3 张无关样本(1.8%)、1 对近重复(0.6%)、2 张标签错误(1.2%);多数投票口径下问题面更大(8/1/15)。不处理这些问题,你的"测试集"本身就含有噪声。
症状:模型在个别样本上"顽固出错",人工查看后发现图像与任务无关或标签可疑;近重复图像跨折时指标轻微虚高。
解决:下载 SelfClean 配套发布的修订文件清单,剔除确认问题样本后重跑评估;建议同时报告原始 170 张与清洗后(约 166-167 张)两组数字。注意:对活检证实的黑色素瘤标签,不要仅凭视觉复审推翻(该论文的方法学原则)。
参考:Gröger F et al. (2023), “Towards Reliable Dermatology Evaluation Benchmarks”, NeurIPS 2023 D&B, arXiv:2309.06961;SelfClean 工具(Gröger et al. 2023)。
⚠️ 坑点 5:只看 accuracy + 小样本置信区间(分类:评估误用)
问题:naevus 占 58.8%,"全部猜痣"也有 58.8% accuracy;而 170 张样本下,即使 90% 的准确率其 95% 置信区间也宽达约 ±4.5 个百分点(Wilson),灵敏度(70 个阳性)的区间更宽(±10 个百分点量级)。单个标量指标几乎不携带决策信息。
症状:两个模型 accuracy 差 3 个百分点,实为同一水平;灵敏度 0.85 与 0.95 的差异在统计上不显著。
解决:必报 AUROC + 灵敏度/特异度(带 Wilson 或 Bootstrap 95% CI)+ FNR;黑色素瘤场景应以灵敏度/FNR 为先(Di Biasi 2023 的范式);跨模型比较用配对 Bootstrap 或 McNemar 检验。
参考:Di Biasi L et al. (2023), BMC Bioinformatics 24:386(DOI: 10.1186/s12859-023-05516-5);§6.9 评估代码。
⚠️ 坑点 6:图像尺寸跨度 15 倍,暴力 resize 破坏形态学线索(分类:预处理陷阱)
问题:图像从约 201×257 到 3,177×1,333 px 不等且长宽比混合。直接
resize((224,224))会对小图过度上采样、对大图严重压缩,并扭曲病灶的不对称性与边界形态——而这些恰是分类的核心线索。症状:同模型在不同预处理下性能差 5+ 个百分点;小尺寸图像上模型输出接近随机。
解决:短边缩放(如
Resize(256))+ 中心裁剪,保长宽比;或 letterbox 填充;在论文中明确报告 resize 策略。手工特征(颜色/纹理)建议在原分辨率上提取。参考:§6.3 步骤 2;Awesome-Medical-Dataset 的尺寸统计(min 201×257 / median 949×801 / max 3,177×1,333)。
⚠️ 坑点 7:无患者级元数据——无法患者级去重,也无法公平性分析(分类:偏倚陷阱)
问题:MED-NODE 不发布年龄、性别、部位、肤色,也未说明图像-患者/病灶映射。170 张图可能包含同一患者或同一病灶的多张照片(Gröger 确认了 1 对近重复)。
症状:想做 FST 肤色公平性分析时发现无维度可用;患者级分组划分无法实现;论文中"170 名患者"的表述被审稿人要求更正。
解决:表述上只写"170 张图像";去重代理用 SelfClean 近重复清单;公平性/亚组研究改用 DDI(含 FST 分型)或 PAD-UFES-20(含 21 项临床字段);在局限性中声明该数据集不支持人口学亚组结论。
参考:§4.4 数据层级;Daneshjou R et al. (2022), DDI(Science Advances 8:eabm6147)。
⚠️ 坑点 8:License 未明示 + 官方页面 “24KB” 笔误 + 镜像合规(分类:工程陷阱)
问题:官方页面仅写"引用论文即可使用",未附许可证全文(社区按 CC BY 4.0 归类);页面标注文件大小 “24KB” 与实际约 24.7 MB 不符;Kaggle 等第三方镜像的再分发未获明示授权。
症状:商业产品中引用 Kaggle 镜像被法务质疑;下载校验时以为文件损坏(“24KB” 预期 vs 24.7 MB 实际)。
解决:研究用途以官方 zip + 规范引用为满足条件;商业用途前完成独立法律评估并优先与格罗宁根大学确认;文件完整性按 HTTP 头(Content-Length 25,864,871 字节,Last-Modified 2015-07-26)校验,忽略页面文字大小。
参考:官方页面;Gröger et al. 2023(CC BY 4.0 归类出处);§6.2 获取表。
版本提示:MED-NODE 自 2015-07-26 单次发布后无任何版本演进。若未来官方页面发生变更,以页面 “Last changed” 日期与 zip 的 Last-Modified 头为准核对。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 水平/垂直翻转(病灶无方向先验) | 先增强后划分(副本泄漏,坑点 1) |
| ±15° 内随机旋转 | 全角度旋转(90° 倍数)后再做 CV |
| 轻微 ColorJitter(亮度/对比度 ±10%) | 强色彩扰动(颜色是核心诊断线索,过度扰动破坏标签语义) |
| RandomResizedCrop(scale 0.8-1.0) | 中心裁掉病灶主体的激进裁剪 |
| 高斯模糊模拟失焦(小核) | 弹性形变(扭曲不对称性与边界形态,破坏 ABCD 线索) |
| Cutout/RandomErasing(小块) | 毛发区域定向擦除(可能移除真实诊断上下文) |
原则一句话:MED-NODE 的标签语义承载于宏观形态与颜色之上,任何改变这两类线索的增强都在制造"标签不再成立的训练样本"。小样本场景下增强的收益有限(每折仅百余张训练图),建议把增强强度压到最低可用档,并在消融实验中单独报告"无增强"分支。
§6.7 模型推荐
| 任务 | 推荐方案 | 预期性能参考 | 备注 |
|---|---|---|---|
| 快速基线 | 手工颜色/纹理特征 + SVM/RF | ACC 0.75-0.82 | 复现 Giotis 体系,LOO/10 折 |
| 迁移学习微调 | ImageNet 预训练 ResNet-50/VGG16 微调 | ACC 0.85-0.91(协议内) | 注意 FNR;Di Biasi 2023 报告 AlexNet 89% / VGG16 73%(FNR 口径) |
| 基础模型线性探测 | DINOv2 / PanDerm 特征 + 线性头 | AUROC 见 §8.1 | 标签效率研究的标准姿势 |
| 外部评估 | 大数据训练模型 → MED-NODE 全量 zero-shot | 视源域而定 | 社区共识口径,报告 95% CI |
| 教学演示 | §6.1 Dataset + ResNet-18 微调 | ACC 0.80-0.88 | 一节课可完成 |
选型说明:在 170 张的规模上,模型容量几乎不构成区分度——ResNet-18 与 ViT-L 微调后的差距通常在置信区间之内。真正拉开差距的是协议严谨性(是否泄漏、是否固定种子、是否报告 CI)与特征来源(ImageNet 通用特征 vs PanDerm 等皮肤科预训练特征)。若只有一次性实验的预算,优先把精力投入评估协议而非架构调参。
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 100 MB | 1 GB(含缓存与副本) |
| 内存 | 4 GB | 8 GB |
| GPU | 不需要(全量 170 张 CPU 可训练经典 ML) | 1 × 8 GB(深度微调数分钟完成) |
| 训练时间 | SVM/RF:<1 分钟 | ResNet-50 微调 5 折:约 10-30 分钟 |
| 云端替代 | Colab 免费实例绰绰有余 | Kaggle Kernel(镜像数据集一键挂载) |
§6.9 评估指标
import numpy as np
from sklearn.metrics import (roc_auc_score, average_precision_score,
confusion_matrix)
def wilson_ci(k, n, z=1.96):
"""二项比例 Wilson 95% 置信区间"""
if n == 0: return (np.nan, np.nan)
p = k / n
denom = 1 + z**2 / n
center = (p + z**2 / (2*n)) / denom
half = z * np.sqrt(p*(1-p)/n + z**2/(4*n**2)) / denom
return center - half, center + half
def evaluate_mednode(y_true, y_prob, threshold=0.5):
y_true = np.asarray(y_true); y_prob = np.asarray(y_prob)
y_pred = (y_prob >= threshold).astype(int)
tn, fp, fn, tp = confusion_matrix(y_true, y_pred, labels=[0, 1]).ravel()
sens, spec = tp/(tp+fn), tn/(tn+fp)
print(f"AUROC: {roc_auc_score(y_true, y_prob):.3f}")
print(f"AUPRC: {average_precision_score(y_true, y_prob):.3f}")
print(f"Sensitivity: {sens:.3f} 95%CI {wilson_ci(tp, tp+fn)}")
print(f"Specificity: {spec:.3f} 95%CI {wilson_ci(tn, tn+fp)}")
print(f"FNR(漏诊率): {fn/(tp+fn):.3f} ← 黑色素瘤场景首要安全指标")
print(f"Accuracy: {(tp+tn)/len(y_true):.3f} (参考值:全猜 naevus 为 0.588)")
社区共识:报告 AUROC + 灵敏度/特异度 + FNR,附 95% CI;阈值选择须在独立数据上完成;同时报告原始 170 张与 SelfClean 清洗后两组数字为最佳实践。
§6.10 MLOps 笔记
- 版本锁定:数据集无版本号,引用时写"MED-NODE(2015-07-26 发布版,complete_mednode_dataset.zip)"+ 下载日期;可用 HTTP Last-Modified 头佐证文件未变更。
- 引用义务:任何使用该数据的发表物必须引用 Giotis et al. 2015(§9 BibTeX)——这是官方页面明示的唯一硬性条件。
- 评估可追溯:公开你的折叠构成文件(§5.2 代码)与随机种子;170 张的规模下单个样本的去留就能改变 1-2 个百分点,可复现性完全依赖协议透明。
- 预训练混入声明:使用基础模型时,声明其预训练语料是否含 MED-NODE 或其镜像(Kaggle 搬运版),避免"评估集污染"。
- 清洗口径版本化:若采用 SelfClean 修订清单,记录所用清单的仓库 commit 或发布日期;清单本身可能随专家复审更新。
- 结果存档:170 张全量评估的逐图预测(含文件名)建议作为补充材料公开——这是小样本基准上最有价值的可复现性资产,审稿人与后续研究者可以据此精确复算任何指标。
- 镜像校验:从 Kaggle 等第三方镜像获取时,解压后应核对文件数(170)与类别分布(70/100),并与官方 zip 的哈希或文件清单比对,防止镜像被修改。
- 小样本部署警示:任何仅在 MED-NODE 上验证的模型都不具备临床部署证据强度;监管路径需要前瞻性、多中心、含人口学维度的验证(参考 DDI 的设计)。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 病例-对照式档案抽样,41.2% 阳性率远高于真实筛查场景(<1%-5%) | 高 | 阈值按目标场景先验重新校准;论文中声明先验差异 |
| 单中心偏倚 | UMCG 单一学术中心,荷兰北部人群 | 高 | 外部验证(DDI、PAD-UFES-20 等跨洲临床照片集) |
| 肤色代表性偏倚 | 推断以 Fitzpatrick I-III 浅肤色为主(未发布肤色元数据) | 高(以 2026 年公平性标准) | 不做肤色亚组结论;公平性研究改用 DDI/Fitzpatrick17k |
| 设备/协议偏倚 | 单一 Nikon 相机 + 105 mm 镜头 + 330 mm 距离,不代表智能手机多样性 | 中高 | 手机场景验证改用 PAD-UFES-20(智能手机采集) |
| 标签不对称偏倚 | 恶性有病理证实、良性仅专家确认,两侧证据强度不等 | 中 | 引用 Gröger 约 1% 标签错误率估计;清洗口径对照 |
| 谱系偏倚 | 仅黑色素瘤与痣两类,无 BCC/SCC/脂溢性角化等临床常见混淆物 | 中高 | 多分类结论改用 HAM10000/Derm7pt/PAD-UFES-20 |
| 评估噪声偏倚 | 170 张极小样本 + 确认的近重复/无关样本 | 中 | SelfClean 清单;报告 95% CI |
偏倚的整体判断:MED-NODE 的偏倚谱是典型的"2015 年时代单中心学术档案"形态——它不是随机抽样的人群数据,而是为验证一个方法学论点而组织的病例-对照集合。这决定了它的正确使用方式:作为方法学比较与外部评估的固定标尺完全合格;作为真实世界性能的估计来源则必须配合 §7.3 的泛化性讨论一起解读。任何在 MED-NODE 上报告的数字,论文中都应同时声明阳性率先验(41.2%)与目标场景先验的差异。
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 黑色素瘤(活检+病理) | 最高(病理学金标准) | 病理科常规质控 | 未标注亚型/分期/Breslow 厚度 |
| 痣(专家临床确认) | 高(学术中心高级医师) | 无标注者间一致性统计 | 无病理复核,困难病例存在理论错标空间 |
| 发布后审计(Gröger 2023) | 3 名执业皮肤科医师 | Krippendorff α 报告于原文;临床照片集一致性高于皮肤镜集 | 一致同意口径:3 无关 + 1 近重复 + 2 标签错误 |
综合评估:在 2015 年时代的公开小数据集中,MED-NODE 的标签质量属于上游——恶性侧全部病理证实是它区别于大量网络抓取型数据集的核心优势。Gröger 审计给出的约 1% 标签错误率(一致同意口径)为使用者提供了可量化的标签噪声上限。
Gröger 审计的流程细节值得了解:算法预筛(SelfClean 自监督表示 + 置信学习)先将 170 张按可疑度排序,再由 3 名执业皮肤科医师对高可疑子集独立盲审,分歧样本进入共识讨论,最终按"一致同意 / 多数同意 / 单人标记"三档置信度发布修订清单。MED-NODE 在六个被审计数据集中的问题检出率处于低位(远低于 ISIC 2019 等大规模网络汇集型数据集),且被标记的"疑似标签错误"样本中,多数因病理学背书而被专家保留原标签——这从反面印证了黑色素瘤一侧病理金标准的价值。
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨设备(Nikon 相机 → 智能手机) | 中高 | 手机照片的光学特性、压缩伪影与持机距离不同;PAD-UFES-20 提供手机照片对照 |
| 跨人群(荷兰浅肤色 → 深肤色人群) | 高 | 无肤色元数据;深肤色人群肢端型黑色素瘤占比高,宏观形态学表现不同;DDI/PASSION 提供对照 |
| 跨模态(皮肤镜训练 → 普通照片) | 中高 | 皮肤镜特征(色素网等)在宏观照片中不可见;PanDerm 等多模态预训练是当前的缓解路径 |
| 跨任务(二类 → 真实门诊多病种鉴别) | 高 | 真实场景含大量非黑色素细胞病变;MED-NODE 二类结论不可外推 |
| 跨时间(2015 年相机照片 → 当代照片) | 中 | 当代手机影像经计算摄影处理(HDR/多帧合成),纹理统计特性已漂移 |
总体结论:MED-NODE 衡量的从来不是"模型在临床中会有多好",而是"模型对非受控真实照片的适应能力有多强"——它是一个域偏移压力测试,而非临床性能估计器。这一区分决定了它的正确用法:与目标部署场景相近的数据集(如手机照片场景用 PAD-UFES-20)负责估计性能下限,MED-NODE 负责检验模态迁移的稳健性。
§7.4 伦理考量
- 数据来自真实患者(部分黑色素瘤患者或已去世),研究者应保持对患者与家属的尊重;图像为病灶局部照片,不含面部,但仍属医疗数据,再分发须谨慎。
- 公开材料未记录逐例知情同意与正式脱敏流程(2015 年时代小数据集的常见形态);GDPR 框架下使用者应自行评估机构合规要求。
- 官方唯一明示义务是引用论文——这是学术信用伦理,也是数据集可持续性的基础。
- 不得将该数据集用于训练"肤色推断"或任何与患者身份相关的副任务;无元数据不等于无伦理风险。
- 任何基于 MED-NODE 的结论不得用于直接面向患者的诊断宣传(如"AI 自测痣"营销)——170 张单中心图像不构成此类证据。
§7.5 公平性评估
诚实声明:MED-NODE 无法支持常规的亚组公平性分析——不发布年龄、性别、部位、肤色中的任何一项。以下代码用于"如果你的模型输出了亚组维度(如外部队列)"时的分析姿势,而非对 MED-NODE 本身:
# 在外部队列(如 DDI,含 FST 分型)上评估的公平性模板
from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score, recall_score
frame = MetricFrame(
metrics={"AUROC": roc_auc_score,
"Sensitivity": lambda yt, yp: recall_score(yt, yp > 0.5)},
y_true=y_test, y_pred=y_prob,
sensitive_features=fst_groups, # 例如 Fitzpatrick I-II / III-IV / V-VI
)
print(frame.by_group)
print(f"组间 AUROC 极差: {frame.difference()}")
已知公平性风险(文献层面):浅肤色档案训练的模型在深肤色人群上性能系统性下降(Daneshjou et al. 2022 等反复证实);MED-NODE 的浅肤色推断背景使其结论不可外推至深肤色人群——在论文局限性中必须声明。
§7.6 数据漂移提示
- 影像漂移:2015 年及以前的消费级数码相机 JPG vs 当代智能手机的计算摄影(多帧合成、AI 场景优化、HEIF 格式),纹理与噪声统计特性已发生明显漂移。
- 协议漂移:当代远程医疗照片由患者自拍(距离/光照/构图不可控),与 MED-NODE 的医师标准协议照片差异显著。
- 标签漂移:无(病理学定义稳定),但诊断实践演进(如 RCM、基因表达谱辅助)改变了"送活检"的阈值,间接改变真实场景的病例构成。
- 监控建议:部署模型若输入分布以手机照片为主,应在输入端做域检测(如 Mahalanobis 距离),对 OOD 输入降级处理。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本) | ✅ | 一图一样本,目录结构清晰 |
| 2 | 有唯一标识符列 | ✅ | 文件名在类别内唯一(合并时需加类别前缀,见 §4.0) |
| 3 | 无 Unicode 或特殊字符 | ✅ | 纯数字文件名,ASCII 目录名 |
| 4 | 无重复行 | ⚠️ | Gröger 一致同意口径确认 1 对近重复(0.6%);需用 SelfClean 清单处理 |
| 5 | 缺失值已识别并编码 | ✅ | 标签 170/170 完整;元数据维度整体未发布(§4.5 已系统说明) |
| 6 | 标签列被明确标识 | ✅ | 目录名即标签,无歧义 |
| 7 | 已对罕见类别(<3%)进行分组 | ✅ | 二分类,少数类占 41.2%,无罕见类别问题 |
| 8 | 偏倚评估已完成 | ⚠️ | 官方未做;本百科 §7.1 补全(7 类偏倚) |
| 9 | 有完整的数据字典 | ⚠️ | 官方无数据字典(本百科 §4.1 补全) |
| 10 | 对"信息性缺失"有明确编码解释 | ✅ | 不适用(无表格字段);维度级缺席已在 §4.5 说明 |
| 11 | 数据采集设备和设置已记录 | ✅ | Nikon 相机 + 2.8/105 mm 镜头 + 约 330 mm 距离(§3.9) |
| 12 | 已移除完全共线性变量 | ✅ | 不适用(无表格特征) |
| 13 | 对编码的映射标准已说明 | ⚠️ | 官方未提供 ICD/SNOMED 映射(本百科 §2.1/§2.2 补全) |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 无时间戳;采集时段未精确记录(§3.7) |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无划分;社区共识"整体作评估集"(§5.1) |
| 16 | 数据泄漏风险已被讨论 | ⚠️ | 原论文未讨论;Gröger 2023 确认近重复;本百科 §5.3/§6.5 补全 |
| 17 | 标签分布已被分析 | ✅ | 70/100 官方明示,§4.2 展开 |
| 18 | 选择性测量偏倚已被讨论 | ⚠️ | 档案抽样机制未文档化(§7.1 讨论) |
| 19 | 外部验证建议已给出 | ✅ | §5.5 + §7.8(HAM10000/ISIC → MED-NODE 共识路径) |
| 20 | 数据更新和版本信息已记录 | ⚠️ | 单次发布(2015-07-26),无版本体系;页面有 Last changed 日期 |
| 21 | 最小必要预处理脚本已提供 | ❌ | 官方无脚本(本百科 §6.3 补全) |
| 22 | 合规使用要求已明确 | ⚠️ | 引用义务明确;许可证全文未附(社区 CC BY 4.0 归类,坑点 8) |
| 23 | 多模态对齐方法已说明 | ✅ | 不适用(单一模态) |
| 24 | 去标识化方法已被记录 | ⚠️ | 病灶局部照片、无面部与标识符;正式脱敏流程未文档化 |
DAIMS 评分:17 / 24
评分解读:中等——作为评估集开箱即用,作为训练资源需要补齐大量工程与合规工作。
对你意味着什么:MED-NODE 的 12 个 ✅ 集中在"小而干净"的结构性优点——扁平目录、纯数字文件名、标签完整、二分类平衡、采集协议一致、标签分布透明。扣分的 10 个 ⚠️ 与 2 个 ❌ 几乎全部指向同一根源:它是 2015 年时代为单一论文发布的"论文附带数据",缺乏现代数据集工程(官方划分、数据字典、预处理脚本、许可证文本、元数据)。实操建议:(1) 把它当评估集而非训练集(社区共识,也是其 DAIMS 短板最少的用法);(2) 叠加 SelfClean 修订清单做严谨基准;(3) 需要元数据维度的研究请改用 DDI / PAD-UFES-20;(4) 合规场景优先使用官方渠道并规范引用。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| MED-NODE(HAM10000 训练 → 普通照片评估) | DeepDerm/HAM10000 体系(Gröger 2023 复测) | 黑色素瘤 vs 痣 | AUROC 清洗前后 Δ −0.3 [−0.7, +0.1] | 变化不显著 | MED-NODE 上的标签噪声对评估结论影响有限(与 DDI 的显著下降形成对照) |
| MED-NODE(多模态基础模型评测) | PanDerm(11 机构 214 万图预训练) | 临床照片分类 + 标签效率 | 临床照片模态平均 AUROC 较基线 +8.0% | N/A | Med-Node 是 PanDerm 28 项标准评测之一,用于证明多模态预训练在普通照片上的收益 |
| PH2(皮肤镜小样本对照) | Hospital Pedro Hispano(葡萄牙) | 黑色素细胞病变三分类 | Gröger 审计:0 问题 | N/A | 同为小样本评估集,PH2 零问题 vs MED-NODE 有少量问题——清洗研究的对照锚点 |
| PAD-UFES-20 / DDI(临床照片跨洲对照) | 巴西 UFES / 美国斯坦福 | 临床照片多病种 | 含 FST 元数据 | N/A | 弥补 MED-NODE 无人口学维度的核心短板,是公平性外部验证的默认选择 |
约束:本矩阵仅收录有同行评审论文支撑的外部评估结果,不收录未经验证的社区自评数字。
§8 基准性能与生态
§8.1 排行榜
阅读前必读:MED-NODE 无官方划分,下列数字协议各异(10 折 CV / LOO / 增强后 CV / 外部评估),跨行不可直接比较(见 §6.5 坑点 2)。本表按"原始体系 → 经典 ML/CV 协议 → 深度学习协议 → 基础模型评估"分层呈现。
A. 原始系统(Giotis et al. 2015,交叉验证口径):
| 排名 | 模型 | ACC | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | MED-NODE 组合系统 | 0.81 | 2015 | 颜色+纹理描述子+医师视觉属性,多数投票(TPR 0.80 / TNR 0.81) | Giotis I, Molders N, Land S, Biehl M, Jonkman MF, Petkov N. “MED-NODE: A computer-assisted melanoma diagnosis system using non-dermoscopic images.” Expert Systems with Applications 42(19):6578-6585. DOI: 10.1016/j.eswa.2015.04.034 | — |
| 2 | 仅纹理描述子 | 0.76 | 2015 | GLCM 类纹理特征 | 同上 | — |
| 3 | 仅颜色描述子 | 0.73 | 2015 | 多颜色空间统计 | 同上 | — |
| 4 | 仅医师视觉属性 | 0.66 | 2015 | ABCD 法则计算化 | 同上 | — |
B. 深度学习时代代表结果(协议各异,勿跨行比较):
| 模型 | 性能 | 协议 | 年份 | 完整引用 | 备注 |
|---|---|---|---|---|---|
| Bucket 深度迁移特征 + 动态分类器 | ACC 0.93(TPR 0.90 / TNR 0.97 / MCC 0.87) | 交叉验证 | 2021 | Talaat/Barra et al. “Bucket of deep transfer learning features and classification models for melanoma detection.” Neural Computing & Applications (PMID: 34460526; arXiv:2009.08639) | 汇总 10+ 前作的最完整对照表 |
| AlexNet 迁移学习(未增强) | ACC 91.18% | 10 折 CV | 2019 | Hosny KM, Kassem MA, Foaud MM. “Classification of skin lesions using transfer learning and augmentation with Alex-net.” PLOS ONE 14(5):e0217293 | 同论文增强后 97.70% 存在副本泄漏(坑点 1) |
| AlexNet(FNR 优化) | ACC 89% / Sens 87% / Spec 90% / FNR 0.13 | 自定义 | 2023 | Di Biasi L et al. “Refactoring and performance analysis of the main CNN architectures…” BMC Bioinformatics 24:386. DOI: 10.1186/s12859-023-05516-5 | 灵敏度优先范式 |
| VGG16(FNR 优化) | ACC 73% / Sens 82% / Spec 59% / FNR 0.07 | 自定义 | 2023 | 同上 | 全表最低漏诊率 |
C. 基础模型评估口径(外部评估,MED-NODE 为测试侧):
| 模型 | 场景 | 关键数字 | 年份 | 完整引用 |
|---|---|---|---|---|
| PanDerm(多模态基础模型) | Med-Node 纳入 28 项评测;临床照片模态 | 临床模态平均 AUROC 较 DINOv2 等基线 +8.0%;10% 标签即可匹配全量基线 | 2025 | Yan S et al. “A multimodal vision foundation model for clinical dermatology.” Nature Medicine 31:2691-2702. DOI: 10.1038/s41591-025-03747-y |
| DeepDerm(HAM10000 训练) | MED-NODE 全量评估 + 清洗对照 | 清洗前后 AUROC Δ −0.3 [−0.7, +0.1](不显著) | 2023 | Gröger F et al. “Towards Reliable Dermatology Evaluation Benchmarks.” NeurIPS 2023 D&B. arXiv:2309.06961 |
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 要可发表的基准数字 | 外部训练 → MED-NODE 全量评估 + SelfClean 双口径 + 95% CI | 2023 年后方法学最严谨、与 PanDerm/Gröger 可比的口径 |
| 复现历史结果 | Giotis 颜色/纹理描述子 + 多数投票(ACC 0.81 锚点) | 唯一有完整方法学描述的官方基线 |
| 快速验证管线 | ImageNet ResNet-50 微调 + 5 折分层 CV(固定种子) | 30 分钟出结果,协议透明即可 |
| 做灵敏度优先研究 | Di Biasi 2023 的 FNR 优化范式 | 黑色素瘤漏诊才是临床核心风险 |
| 做基础模型标签效率 | PanDerm/DINOv2 特征 + 线性探测(10%-100% 标签梯度) | 与 Nature Medicine 2025 直接可比 |
三点补充:(1) 上表"推荐方案"一列的排序随社区方法学演进而变化——2015-2019 年主流是在 MED-NODE 上直接训练并报告 CV 数字,2023 年 Gröger 审计之后,"在其上训练"已逐渐成为审稿人眼中的方法学减分项。(2) 无论选择哪条路径,95% CI 与清洗双口径是 2023 年后被反复要求的底线配置,缺了它们,数字在审稿中几乎没有分量。(3) 若目标是临床转化叙事(而非方法学论文),MED-NODE 只适合作为证据链中的一环,必须与 DDI、PAD-UFES-20 等带元数据的临床照片集联合报告,单独引用 170 张小样本难以支撑任何有效性主张。
§8.3 官方评测协议
无官方协议。社区事实标准(2023 年后收敛):(1) MED-NODE 整体作为评估集,不在其上训练;(2) 报告 AUROC + 灵敏度/特异度 + FNR + 95% CI;(3) 同时给出原始 170 张与 SelfClean 清洗后两组数字;(4) 声明预训练语料去重情况。2015-2020 年文献中的 CV 协议数字(含 97%+)应按 §6.5 坑点 1-2 的提示打折阅读。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| PH2 | 同类(皮肤镜侧) | 200 张皮肤镜小样本,Gröger 审计零问题的对照锚点 |
| Derm7pt | 互补(双模态) | 2,022 张皮肤镜+临床照片配对,含 7 点清单 |
| HAM10000 | 训练侧主力 | 10,015 张皮肤镜 7 分类;→ MED-NODE 外部评估的经典源 |
| ISIC 2019/2020 | 训练侧主力 | 25,331 / 33,126 张皮肤镜挑战集 |
| DDI | 互补(临床照片+公平性) | 656 张活检证实临床照片,含 FST 分型 |
| PAD-UFES-20 | 互补(手机照片+元数据) | 2,298 张智能手机照片,21 项临床字段 |
| SD-128 / SD-198 | 同类(临床照片多分类) | DermQuest 来源,123 病 |
| Fitzpatrick17k | 互补(肤色维度) | 16,577 张临床照片,含 FST 标注 |
§8.5 关键论文 Top 10
- Giotis I et al. (2015), Expert Systems with Applications 42(19):6578-6585. “MED-NODE: A computer-assisted melanoma diagnosis system using non-dermoscopic images.” — 数据集与原始系统本体,权威引用入口。DOI: 10.1016/j.eswa.2015.04.034
- Gröger F et al. (2023), NeurIPS Datasets and Benchmarks. “Towards Reliable Dermatology Evaluation Benchmarks.” — 专家清洗审计 + SelfClean 清单,现代评估口径的奠基文献。arXiv:2309.06961
- Yan S et al. (2025), Nature Medicine 31:2691-2702. “A multimodal vision foundation model for clinical dermatology (PanDerm).” — 将 Med-Node 固化为基础模型标准评测项。DOI: 10.1038/s41591-025-03747-y
- Di Biasi L et al. (2023), BMC Bioinformatics 24:386. “Refactoring and performance analysis of the main CNN architectures: using false negative rate minimization…” — 灵敏度优先范式的代表作。DOI: 10.1186/s12859-023-05516-5
- Hosny KM et al. (2019), PLOS ONE 14(5):e0217293. “Classification of skin lesions using transfer learning and augmentation with Alex-net.” — 引用量高的迁移学习案例,也是"先增强后划分"的协议警示。DOI: 10.1371/journal.pone.0217293
- Talaat/Barra et al. (2021), Neural Computing & Applications. “Bucket of deep transfer learning features and classification models for melanoma detection.” — MED-NODE 上前作汇总最完整的对照表(ACC 0.93)。PMID: 34460526
- Giotis I et al. (2013), Skin Research and Technology 19(1):e123-e131. “Discriminative power of visual attributes in dermatology.” — 医师视觉属性方法的前作,理解 MED-NODE 系统设计的钥匙。
- Daneshjou R et al. (2022), Science Advances 8:eabm6147. “Disparities in dermatology AI performance on a diverse, curated clinical image set (DDI).” — 公平性维度的对照基准,理解 MED-NODE 代表性短板的必读。
- Sen P & Mondal K 等 (2023), “Automatic Skin Cancer Detection Using Clinical Images: A Comprehensive Review”(PMC10672549). — 临床照片 CAD 全景综述,将 MED-NODE 定位为该模态最常用数据集。
- Gröger F et al. (2023), SelfClean 方法论文. — 自监督数据清洗工具本体,MED-NODE 修订清单的技术基础。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| Google Scholar 引用(Giotis 2015) | 490+(截至 2026-09,作者主页快照) |
| 顶级评测采用 | NeurIPS 2023 D&B(六大评估集之一)、Nature Medicine 2025 PanDerm(28 项基准之一) |
| Kaggle 镜像 | prabhavsanga/med-node(第三方搬运,含公开 Notebooks) |
| 教学采用 | 多门医学信息学课程项目(如 AUTH 医学信息学硕士项目公开仓库 medNodeAnalysis) |
| 综述覆盖 | 几乎所有 2019 年后的皮肤癌 CAD 综述均将其列入临床照片类数据集表格 |
引用结构解读:Giotis 2015 的 490+ 引用中,约三分之一来自方法学论文(以 MED-NODE 为实验床),约三分之一来自综述(数据集表格条目),其余来自临床 AI 与远程医疗议题论文(作为"非皮肤镜可行性"的引证)。值得注意的是 2023 年之后的引用中,"评估集"口径的出现频率显著上升——社区用法的范式转移在引用行为中清晰可见。活跃度方面,数据集本身自 2015 年起完全冻结(无版本更新、无 issue 渠道、无官方论坛),所有"活性"都体现在使用它的下游文献与工具上。
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| 官方数据集页 | 官方 | https://www.cs.rug.nl/~imaging/databases/melanoma_naevi | 静态(2015 年冻结) | 唯一权威来源与下载 |
| SelfClean | 工具库 | Gröger et al. 官方仓库(GitHub: sibirrer 团队/SelfClean) | 活跃 | 数据清洗工具 + 六大皮肤科数据集修订清单(含 MED-NODE) |
| PanDerm | 预训练模型 | https://github.com/SiyuanYan1/PanDerm | 活跃 | Nature Medicine 2025 皮肤科基础模型,Med-Node 标准评测口径 |
| Kaggle med-node 镜像 | 镜像 | https://www.kaggle.com/datasets/prabhavsanga/med-node | 社区 Notebooks | Notebook 环境一键上手(注意回填官方出处) |
| medNodeAnalysis | 教程仓库 | https://github.com/JungleHippo/medNodeAnalysis | 归档 | 学生项目:随机森林手工特征 + CNN 双路径完整实现 |
| AxDante 数据集目录 | 目录 | https://github.com/AxDante/skin-lesion-dataset-analysis | 活跃 | 皮肤病变数据集全景目录,选型对照用 |
生态使用建议:官方页面是数据与 license 条款的唯一权威来源;SelfClean 修订清单应作为评估的默认对照;PanDerm 仓库提供了与 Nature Medicine 论文可复现对齐的 Med-Node 评测脚本。Kaggle 镜像适合教学与快速试验,但论文中必须回填官方出处与 Giotis 2015 引用,不得只引镜像链接。
§9 相关资源与引用
官方资源
- 数据集主页:https://www.cs.rug.nl/~imaging/databases/melanoma_naevi
- 直接下载:https://www.cs.rug.nl/~imaging/databases/melanoma_naevi/complete_mednode_dataset.zip(约 24.7 MB)
- 论文 DOI 页:https://doi.org/10.1016/j.eswa.2015.04.034
- 格罗宁根大学研究门户论文页:https://research.rug.nl/en/publications/med-node-a-computer-assisted-melanoma-diagnosis-system-using-non-/
- 论文开放 PDF(机构库):https://pure.rug.nl/ws/portalfiles/portal/84388355/MED_NODE_A_computer_assisted_melanoma_diagnosis_system_using_non.pdf
- Kaggle 镜像(第三方):https://www.kaggle.com/datasets/prabhavsanga/med-node
BibTeX 引用(使用数据的强制义务)
% 1) 数据集论文(官方页面要求的唯一引用,任何使用场景必须引用)
@article{giotis2015med,
title={MED-NODE: A computer-assisted melanoma diagnosis system using non-dermoscopic images},
author={Giotis, Ioannis and Molders, Nynke and Land, Sander and Biehl, Michael and Jonkman, Marcel F. and Petkov, Nicolai},
journal={Expert Systems with Applications},
volume={42},
number={19},
pages={6578--6585},
year={2015},
publisher={Elsevier},
doi={10.1016/j.eswa.2015.04.034}
}
% 2) 如使用 SelfClean 修订清单或讨论标签质量问题
@inproceedings{groeger2023reliable,
title={Towards Reliable Dermatology Evaluation Benchmarks},
author={Gr{\"o}ger, Fabian and Lionetti, Simone and Gottfrois, Philippe and Gonz{\'a}lez-Jim{\'e}nez, {\'A}lvaro and Groh, Matthew and Daneshjou, Roxana and {Labelling Consortium} and Navarini, Alexander A. and Pouly, Marc},
booktitle={Advances in Neural Information Processing Systems 36 (NeurIPS 2023), Datasets and Benchmarks Track},
year={2023}
}
% 3) 如引用基础模型评测口径
@article{yan2025panderm,
title={A multimodal vision foundation model for clinical dermatology},
author={Yan, Siyuan and Yu, Zhen and Primiero, Clare and others},
journal={Nature Medicine},
volume={31},
pages={2691--2702},
year={2025},
doi={10.1038/s41591-025-03747-y}
}
教程与学习资源
- §6.0-§6.4 本页代码(下载 → 体检 → 保比例预处理 → PyTorch/TF 加载)
- medNodeAnalysis(GitHub):随机森林手工特征 + CNN 双路径的教学级实现
- Kaggle med-node 镜像页公开 Notebooks:入门类 EDA 与迁移学习示例
- PanDerm 仓库:基础模型在 Med-Node 上的标签效率评测脚本
原始论文
- Giotis I, Molders N, Land S, Biehl M, Jonkman MF, Petkov N (2015). “MED-NODE: A computer-assisted melanoma diagnosis system using non-dermoscopic images.” Expert Systems with Applications 42(19):6578-6585. DOI: 10.1016/j.eswa.2015.04.034
- Giotis I, Visser M, Jonkman M, Petkov N (2013). “Discriminative power of visual attributes in dermatology.” Skin Research and Technology 19(1):e123-e131.
- Gröger F et al. (2023). “Towards Reliable Dermatology Evaluation Benchmarks.” NeurIPS 2023 Datasets and Benchmarks. arXiv:2309.06961
- Yan S et al. (2025). “A multimodal vision foundation model for clinical dermatology.” Nature Medicine 31:2691-2702. DOI: 10.1038/s41591-025-03747-y
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 7 组检索:官方页面、论文与引用快照、清洗研究、基础模型评测、流行病学数据、编码映射、镜像与生态 |
| curl 实测 | 2026-09-05 | 官方 zip 可达性与文件大小核验(Content-Length 25,864,871 字节) |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从格罗宁根大学官方页面、Giotis 2015 原始论文、Gröger 2023 清洗研究、PanDerm 2025 论文与社区资源中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- 官方数据集页面(cs.rug.nl/~imaging/databases/melanoma_naevi,含引用要求与 “Last changed: 26-07-2015”)
- 官方 zip 文件 HTTP 头实测(Content-Length 25,864,871 字节;Last-Modified 2015-07-26)
- Giotis et al. (2015), Expert Systems with Applications 42(19):6578-6585(DOI: 10.1016/j.eswa.2015.04.034;格罗宁根大学研究门户与机构库 PDF)
- Gröger et al. (2023), “Towards Reliable Dermatology Evaluation Benchmarks”, NeurIPS 2023 D&B(arXiv:2309.06961,含 MED-NODE 问题样本统计与 DeepDerm 清洗对照)
- Yan et al. (2025), Nature Medicine 31:2691-2702(PanDerm,DOI: 10.1038/s41591-025-03747-y)
- Di Biasi et al. (2023), BMC Bioinformatics 24:386(DOI: 10.1186/s12859-023-05516-5,FNR 口径 CNN 比较)
- Hosny et al. (2019), PLOS ONE 14(5):e0217293(DOI: 10.1371/journal.pone.0217293)
- Talaat/Barra et al. (2021), Neural Computing & Applications(PMID: 34460526 / arXiv:2009.08639,前作结果汇总表)
- “Automatic Skin Cancer Detection Using Clinical Images: A Comprehensive Review”(2023,PMC10672549,MED-NODE 模态定位与尺寸复核)
- “Towards Scalable Foundation Models for Digital Dermatology”(arXiv:2411.05514,CC BY 4.0 归类佐证)
- Awesome-Medical-Dataset 目录(尺寸统计、作者单位、镜像链接复核)
- AxDante/skin-lesion-dataset-analysis(同类数据集对照与许可表述)
- Kaggle prabhavsanga/med-node 镜像页
- GLOBOCAN 2022 melanoma fact sheet(IARC,331,722 新发 / 58,667 死亡)与 IARC PR 367(2025,UVR 归因 83%)
- WCRF skin cancer statistics(国家别发病率/死亡率)
- DermNet(ABCDE 法则、SNOMED CT 372244006 核实)
- CISMeF ICD-11 2C30 条目与 ICD-11 MMS 二手核实(2C30/2F20 亚型)
- BioPortal SNOMED CT US Edition(1163403006 Pigmented nevus 核实)
- Google Scholar 作者主页引用快照(截至 2026-09-05)
- JungleHippo/medNodeAnalysis(教学实现参考)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、流行病学、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(规模、尺寸、设备、溯源链) | 千方病案医学编辑部 | 与官方页面及 curl 实测交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与官方 zip 结构交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 Gröger 2023/Hosny 2019 原文比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
