SkinCon (skincon) — 皮肤病学专家密集概念标注数据集 — AI-Ready Wikipedia

斯坦福团队为 Fitzpatrick17k 与 DDI 共 3886 张皮肤图像所做的 48 临床概念稠密多标签重标注——两位皮肤科医生建概念表、单人标准化标注、双轮独立验证(97.6% / 94% 一致),把皮肤 AI 从「黑箱分类」推向概念级调试与错误分析

来源 对 Fitzpatrick17k(Groh et al. 2021, CVPR)与 Diverse Dermatology Images / DDI(Daneshjou et al. 2022, Science Advances)两个公开皮肤图像数据集的概念级重标注:48 个临床概念多标签(含 1 个质量控制标签)逐图勾选 + 双轮皮肤科医生验证(抽验 323 张一致率 97.6%;956 张独立重标一致率 94%)+ 概念频率统计表 + PCBM/CAV 基准实验发布时间: 2026-09-30最后更新: 2026-09-30 阅读 11
SkinCon (skincon) — 皮肤病学专家密集概念标注数据集 — AI-Ready Wikipedia

信息速览

数据集名称SkinCon (skincon) — 皮肤病学专家密集概念标注数据集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模3886 张皮肤图像(Fitzpatrick17k 子集 3230 + DDI 子集 656);患者级数量与人口学未逐例披露
接入方式对 Fitzpatrick17k(Groh et al. 2021, CVPR)与 Diverse Dermatology Images / DDI(Daneshjou et al. 2022, Science Advances)两个公开皮肤图像数据集的概念级重标注:48 个临床概念多标签(含 1 个质量控制标签)逐图勾选 + 双轮皮肤科医生验证(抽验 323 张一致率 97.6%;956 张独立重标一致率 94%)+ 概念频率统计表 + PCBM/CAV 基准实验
AI 就绪度

INFOBOX — SkinCon 一屏速览

维度 内容
本质 对两个既有皮肤病数据集的概念级(concept-level)稠密重标注(非新采集图像、非竞赛)
团队 斯坦福大学(Stanford University)皮肤科 × 计算机科学 × 生物医学数据科学三系
论文 NeurIPS 2022 Datasets and Benchmarks Track;arXiv:2302.00785(2023-02-01 上线)
数据 3886 张 = Fitzpatrick17k 子集 3230 + DDI 子集 656(Table 5 脚注真值)
概念 48 个临床概念(+ 1 个质控标签 “Do not consider this image”)多标签逐图勾选
标注者 建表:两位皮肤科医生(5 年 / 6 年经验);标注:单一 6 年经验皮肤科医生
验证 抽验 323 张(10%):概念一致 1056/1082 = 97.6%;956 张独立重标:图像合格 94%、总体一致 94%(Fitz 92% / DDI 94%)
用途 概念探测(probing)、概念瓶颈模型(CBM/PCBM)、基于概念的事后解释(CAV/CCE)、错误分析与切片发现
基准结果 DDI 上 PCBM AUC 0.639 vs 原始 DeepDerm 0.595;DDI(III-IV) 提升最大 0.727 vs 0.632
概念权重 指向恶性:Ulcer 1.190、Telangiectasia 1.022;指向良性:Patch −0.960、Pustule −0.836
获取 标注文件经项目主页分发;图像本体须回 Fitzpatrick17k 与 DDI 官网自取
许可 图像科研非商业(两源);标注文件许可未单独声明(待核)
库内互链 fitzpatrick-17k(上游主源)、ddi(上游第二源)、ham10000、pad-ufes-20、derm7pt 等
同名警示 不等于 SkinCON/DRAPS(MICCAI 2024,ISIC 2019,25331 张)——见 §10 坑 1

SkinCon 是一个"不拍新照片、只贴新标签"的数据集工程:它把斯坦福团队自己参与构建的两个皮肤病公开图像集——Fitzpatrick17k 与 Diverse Dermatology Images(DDI)——从"一张图一个诊断"升级为"一张图几十个临床概念"。它请两位皮肤科医生从皮肤病学教科书与临床实践中提炼出 48 个可用于描述皮损的概念(红斑、丘疹、斑块、鳞屑、溃疡、色素沉着、毛细血管扩张……),再由一位皮肤科医生在标准化界面上把 3886 张图像逐一勾选一遍。这一层概念标注让研究者可以不再只问"模型判断对了吗",而能问"模型是看见了哪个皮损特征才这样判断的"——这正是概念瓶颈模型(CBM)与概念激活向量(CAV)等可解释方法所需的监督信号。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——先记住 SkinCon 只发标注文件,图像本体要去 Fitzpatrick17k 与 DDI 两个官网自取,别指望一次下载拿全。
  2. 关心可解释性与调试:直奔 §4 任务与标注体系 + §5 评估与基准——48 概念表、双轮验证数字、PCBM/CAV 结果三段连读。
  3. 做皮肤病 AI 与公平性:直奔 §2 数据构成——Fitzpatrick 肤色分层是全条目的公平性背景,但要注意 Table 1 与子集总数不自洽(坑 5)。

§0 导读:这个数据集解决什么问题

皮肤病学 AI 长期面临一个结构性尴尬:模型在"这张图是什么病"的分类任务上做到甚至超过部分医生水平,但被问"你凭什么这么判"时只能给出一个概率值。在医疗场景里,可解释性不是锦上添花——医生需要知道模型是否在关注真正的病灶特征(比如溃疡、毛细血管扩张),还是抓了"图像来自哪台设备、哪家医院"这类伪相关。要训练和评测这类"基于概念的解释"方法,就必须有图像到临床概念的监督。而公开的皮肤病图像集(ISIC、HAM10000、Fitzpatrick17k 等)几乎都只有图像级诊断标签,概念级信息稀缺——此前较系统的概念数据集(如 derm7pt)也只覆盖少数属性。

SkinCon 的回答是"用专家知识补上概念这一层"。它做了三件事。第一件是建概念表:两位临床皮肤科医生依据皮肤病学知识,整理出 48 个可用于描述皮损状态的概念,覆盖形态学原发皮损(水疱、丘疹、斑块……)、继发性改变与质地(结痂、糜烂、鳞屑、硬化……)、形状(带蒂、疣状、穹顶状……)、颜色(褐色、白色、紫、黄、黑、红斑……)等维度。第二件是密集标注:一位 6 年经验的皮肤科医生在标准化界面里,对 Fitzpatrick17k 子集 3230 张与 DDI 子集 656 张,逐图勾选"图中存在哪些概念",形成稠密多标签。第三件是验证与基准:用一轮 10% 抽样(323 张,概念一致率 97.6%)和一轮 956 张独立重标(图像合格率与总体一致率均 94%)为标注质量背书,并在 DDI 上跑通概念瓶颈模型 PCBM,证明"可解释的模型至少不差、有时更好"。

§0 读法三则:

  1. 这个条目是"概念标注数据集 + 方法论文 + 可解释性基准"三合一:本体是 3886 张图的 48 概念标签,副产品是双轮验证协议与 PCBM/CAV 基准,三者共用同一套概念体系。
  2. 全文统计数字均出自论文正文与表格;论文内部唯一明显不自洽处(Table 1 的 Fitzpatrick17k 肤色三档合计 3690 ≠ 子集 3230)已在坑 5 存照。
  3. 检索时务必区分 SkinCon(斯坦福,本条目) 与 SkinCON/DRAPS(UC Berkeley,MICCAI 2024,基于 ISIC 2019 的 25331 张不确定性标注)——名字只差大小写与连字符,但作者、机构、图像源、任务全然不同(坑 1)。

0.1 一句话定位与三个必记数字

一句话:SkinCon 是把皮肤病 AI 的"黑箱诊断"拆成"图像 → 临床概念 → 诊断"两段式可解释结构的基石数据集——它不拍图,只给近 3900 张已公开的皮肤病图像加上 48 个临床概念的稠密标签。

三个必记数字:

数字 含义 出处
3886 图像总数(Fitzpatrick17k 3230 + DDI 656) 论文 Table 5 脚注
48 临床概念数(另有 1 项质控标签不计入) 论文摘要与 Table 5
97.6% 专家抽验 323 张的概念一致率(1056/1082) 论文 §2.3 验证

同类"必记"还有:PCBM 在 DDI 上 AUC 0.639 vs 黑箱 DeepDerm 0.595;独立重标一致率 94%;概念权重最高者 Ulcer 1.190。

0.2 为什么它值得单独成条

本库已收录 Fitzpatrick17k(rid 55)、DDI(rid 171)、ISIC 系列、HAM10000、derm7pt 等皮肤病数据集,SkinCon 的独特价值不在图像(它不提供新图像),而在概念标注层:它是这组数据集里唯一提供"48 维临床概念监督"的一个,面向的是"可解释 AI / 概念瓶颈 / 模型调试"这一整类此前在皮肤病域缺乏公开数据支撑的研究方向。没有它,"皮肤病 AI 能不能说清自己为什么这么判"这个问题就缺少标准实验素材。

§1 数据集速览:十问十答

Q1:SkinCon 的"3886 张"从哪来?

不是新采集,而是对两个已公开数据集的子集重标注:Fitzpatrick17k 贡献 3230 张、Diverse Dermatology Images(DDI)贡献 656 张,合计 3886 张(论文 Table 5 脚注原文 “In total, we have 3230 + 656 = 3886 images.”)。SkinCon 的增量不是图像,而是叠加在这两类图像之上的概念标签。

Q2:48 个概念都包括什么?

覆盖四大类:形态学原发皮损(Vesicle 水疱、Papule 丘疹、Macule 斑疹、Plaque 斑块、Pustule 脓疱、Nodule 结节、Ulcer 溃疡等)、继发性改变与质地(Crust 结痂、Erosion 糜烂、Scale 鳞屑、Scar 瘢痕、Telangiectasia 毛细血管扩张、Induration 硬结等)、形状(Pedunculated 带蒂、Exophytic/Fungating 外生/蕈样、Warty/Papillomatous 疣状、Umbilicated 脐凹状等)、颜色(Brown 褐色、White 白色、Purple 紫、Yellow 黄、Black 黑、Erythema 红斑、Blue 蓝、Salmon 鲑鱼色、Gray 灰等)。另有 1 个质控标签 “Do not consider this image” 不计入 48 之数。

Q3:标注粒度是什么?

图像级多标签(image-level multi-label),不是像素级分割。标注者看到候选概念描述词,对每张图勾选"图中存在哪些";同一张图可同时携带多个概念,因此标签是稠密而非独占的。

Q4:谁标注的,可靠吗?

建概念表的是两位临床皮肤科医生(分别有 5 年与 6 年经验);实际标注由单一 6 年经验的皮肤科医生在标准化界面完成。质量背书来自两轮验证:第一轮由一位 board-certified 皮肤科专家抽验 323 张 Fitzpatrick17k 图像(10%),概念标注一致 1056/1082 = 97.6%;第二轮对 DDI 全部 656 张 + Fitzpatrick17k 随机 300 张共 956 张独立重标,图像质量合格率 94%,标签总体一致率 94%(Fitzpatrick 92% / DDI 94%)。

Q5:为什么要做概念标注?

为了让皮肤病 AI 可解释、可调试。有了概念监督,就能训练/评估概念瓶颈模型(CBM)——模型先预测概念、再由概念预测诊断,从而把"决策理由"显式化;也能用概念激活向量(CAV)做错误分析与切片发现(slice discovery),定位模型在哪些概念上系统性出错。

Q6:论文的基准实验测了什么?

在完全独立的 DDI 上测试(规避与 Fitzpatrick17k 的数据泄漏):把事后概念瓶颈模型 PCBM 与基线 DeepDerm(Inceptionv3,Esteva 2017 数据训练)对比。结果 PCBM 在 DDI 总体 AUC 0.639 优于 DeepDerm 的 0.595,在深肤色段 DDI(III-IV) 提升最大(0.727 vs 0.632),说明"可解释"与"高性能"在此时并不冲突。

Q7:概念权重说明了什么?

论文 Table 3 给出概念对 benign/malignant 的指向性权重:Ulcer(1.190)、Telangiectasia(1.022)、Black(0.746)等正权重概念指向恶性;Patch(−0.960)、Pustule(−0.836)、Scar(−0.711)等负权重概念指向良性。这为"模型为什么判恶性"提供了可读的解释。

Q8:它和 Fitzpatrick17k、DDI 是什么关系?

SkinCon 是"寄生"在两者之上的概念层:图像本体归 Fitzpatrick17k(Groh et al. 2021,CVPR)与 DDI(Daneshjou et al. 2022, Science Advances)所有,图像各自从原官网获取;SkinCon 只发布在此之上的概念标注。引用时图像来源与标注来源应分别著录。

Q9:我现在能拿到什么?

两段拿:先去项目主页(https://skincon-dataset.github.io/ )下载 SkinCon 的 Fitzpatrick17k 标注与 DDI 标注文件;图像本体分别去 Fitzpatrick17k 官网与 DDI 官网按各自的科研非商业条款获取。注意论文 §6 引的是 https://SkinCon-dataset.github.io(大小写),站点抓取时点存在可访问性波动(见 §9)。

Q10:为什么它对 AI-Ready 重要?

它是"图像-概念"双层结构的代表样本:本体图像受两源许可约束、获取链路较长,SkinCon 的增量(概念标注)却提供了高价值的可解释性监督。这种"图像不由我发、标签比图更值钱"的形态,在库内是少数派,也是标注经济学的一个活案例。

1.5 速览补充:一张表看懂 SkinCon 的定位

问题 一句话答案
它是什么 对两个既有皮肤病图像集的概念级重标注(不是新图像集、不是竞赛)
它多大 3886 张(3230 + 656)× 48 临床概念(+1 质控标签)
谁做的 斯坦福(皮肤科/CS/生物医学数据科学),Daneshjou & Yuksekgonul 等
什么时候 NeurIPS 2022(会议)/ arXiv:2302.00785(2023-02-01)
标注多可靠 专家抽验 97.6% 一致 + 独立重标 94% 一致
有什么用 概念瓶颈模型、概念探测、概念级错误分析与切片发现
基准结论 DDI 上 PCBM 0.639 > DeepDerm 0.595(可解释不牺牲性能)
怎么拿 标注在项目主页;图像在 Fitzpatrick17k / DDI 官网(三入口)
许可 图像科研非商业;标注文件许可未明(待核)
最大风险 与 SkinCON/DRAPS(MICCAI 2024)同名撞库

1.6 一次读完的关键数字锚点

为便于快速引用,这里把全条目最常被问到的硬数字集中列出(详细出处见后文与附录):

  • 3886:总图像数(Fitzpatrick17k 3230 + DDI 656)。
  • 48:临床概念数(+1 质控标签)。
  • 97.6%:第一轮专家抽验(323 张)的概念一致率(1056/1082)。
  • 94% / 92%:第二轮独立重标的一致率(总体 / Fitzpatrick)。
  • 0.639 vs 0.595:DDI 上 PCBM vs DeepDerm 的 AUC。
  • 0.727 vs 0.632:DDI(III-IV) 段两者的 AUC。
  • 1.190 / −0.960:Ulcer / Patch 的概念权重(恶性 / 良性方向)。
  • 22 / 25 / 28:论文内部冲突的"≥50 张图概念数"三口径。

1.7 检索与消歧指南(本条目专用)

由于"SkinCon"这个 slug 存在高危同名撞库,检索时建议采用"精确短语 + 身份指纹"的组合策略:

  1. 精确短语:用双引号锁定 "SkinCon",避免搜索引擎做模糊匹配。
  2. 加机构指纹:附 Stanford 或 Daneshjou,把结果压到斯坦福条目上。
  3. 加任务指纹:附 concept / fine-grained model debugging / PCBM。
  4. 加图像源指纹:附 Fitzpatrick17k / DDI。
  5. 反向排除:看到 DRAPS / uncertainty / ISIC 2019 / MICCAI 2024 / 10,509 等关键词,即为同名撞库对象,应立即排除。

反向检索(“这是什么数据集”)时,用 3886 或 48 concepts 或 Fitzpatrick17k + DDI 反查,命中率高于直接用名字。

1.8 与"图像级诊断数据集"的本质区别(一图流)

诊断数据集:  图像 ──────────► 疾病类别(一个标签)
               (黑箱,不知模型依据)

SkinCon:     图像 ──► 概念集合 ──► 疾病类别
               (概念中间层可检视:模型因"溃疡 + 毛细血管扩张"判恶性)

              ↑ 中间这一层就是 SkinCon 的全部贡献

这一"插入中间层"的思路,是理解 SkinCon 为什么重要、以及它为什么被称作"面向模型调试的数据集"的最简方式。

§2 数据构成与规格

2.1 规模、来源与两源构成

SkinCon 的全部图像均派生自两个已公开的皮肤病学数据集,其增量是叠加其上的概念标注。规模硬数字如下:

来源 图像数 角色 原始数据集出品
Fitzpatrick17k(子集) 3230 主标注对象(含 PCBM 训练/测试切分) Daneshjou et al. 2022(Fitzpatrick17k 相关)
Diverse Dermatology Images(DDI) 656 外部验证子集(跨源泛化测试) Daneshjou et al. 2022, Science Advances
合计 3886 — —

需要强调两点。其一,"3886"是加总真值(论文 Table 5 脚注 “In total, we have 3230 + 656 = 3886 images.”),第三方转述中的 “nearly 4,000 images”(如 Lacuna 索引)是近似说法(坑 4)。其二,SkinCon 不持有图像本体——两源的图像获取方法与许可各自独立,SkinCon 与之只有"标注对齐"关系。引用规范上,图像来源引两源各自论文,概念标注与验证引本论文。

2.2 概念体系:48 个临床概念的四大维度

48 个概念按皮肤病学描述逻辑可分为四组(中文为主、英文首现,全部出自论文 Table 5):

(a)形态学原发皮损(primary morphology)

概念(英文) 中文 概念(英文) 中文
Vesicle 水疱/小疱 Papule 丘疹
Macule 斑疹 Plaque 斑块
Abscess 脓肿 Pustule 脓疱
Bulla 大疱 Patch 斑
Nodule 结节 Ulcer 溃疡
Cyst 囊肿 — —

(b)继发性改变与质地(secondary change / texture)

概念(英文) 中文 概念(英文) 中文
Crust 结痂 Erosion 糜烂
Excoriation 抓痕 Atrophy 萎缩
Exudate 渗出 Purpura/Petechiae 紫癜/瘀点
Fissure 皲裂 Induration 硬结
Xerosis 干燥症 Telangiectasia 毛细血管扩张
Scale 鳞屑 Scar 瘢痕
Friable 易脆 Sclerosis 硬化

(c)形状(shape)

概念(英文) 中文 概念(英文) 中文
Pedunculated 带蒂 Exophytic/Fungating 外生/蕈样
Warty/Papillomatous 疣状/乳头瘤状 Dome-shaped 穹顶状
Flat topped 平顶 Umbilicated 脐凹状
Acuminate 尖顶 Burrow 隧道/匐行线

(d)颜色(color)

概念(英文) 中文 概念(英文) 中文
Brown (Hyperpigmentation) 褐色/色素沉着 Translucent 半透明
White (Hypopigmentation) 白色/色素减退 Purple 紫
Yellow 黄 Black 黑
Erythema 红斑 Blue 蓝
Salmon 鲑鱼色 Gray 灰
Pigmented 色素性 — —

(e)其他/结构性

Lichenification(苔藓样变)、Poikiloderma(异色病)、Comedo(粉刺)、Wheal(风团)。

(f)质量控制标签

“Do not consider this image”——用于标记应剔除的低质量图像(Fitzpatrick17k 子集 460 张、DDI 子集 20 张)。这是第 49 项 Table 5 行,不属 48 概念(坑 6)。

2.3 标注界面与勾选逻辑

标注在标准化界面完成,逻辑分两种:

  • 标注界面:向标注者展示候选的皮损描述词列表,标注者勾选"图像中存在的概念",允许多选。
  • 验证界面:向验证者展示已标注的概念集合,验证者勾选"是否同意",用于测量一致性。

界面设计的目标是降低认知负担并保证概念用词稳定:因为概念表先由两位皮肤科医生固定下来,所有标注都在这张固定的概念表上操作,避免了自由文本带来的同义词漂移。

2.4 概念频率:一个极度不均的两源分布

论文 Table 5 给出每个概念在 Fitzpatrick17k 与 DDI 两个子集的图像计数,呈现"两源覆盖严重不均"的特征:

概念 Fitzpatrick17k 计数 DDI 计数 备注
Erythema 2139(最高) 235 两源均高频
Plaque 1967 — Fitz17k 高频
Papule 1170 410(DDI 最高) 两源均高频
Brown — 363 DDI 高频
…(中频概念略)… … … —
Vesicle/Abscess/Pustule/Bulla/Excoriation/Purpura/Fissure/Induration/Xerosis/Sclerosis/Flat topped/Blue/Poikiloderma/Salmon/Wheal/Acuminate/Burrow/Gray/Cyst 若干 0(全为 0) DDI 完全不覆盖

两个观察:

  1. Fitzpatrick17k 子集概念谱更全:多数概念在 Fitzpatrick17k 中有可观样本,这也是 PCBM 训练使用 Fitzpatrick17k 切分的原因。
  2. DDI 子集概念谱极窄:20 余个概念在 DDI 上计数为 0(如 Vesicle/Abscess/Pustule/Bulla 等在 DDI 一张都没有),说明 DDI 图像(医院采集、疑似恶性为主的临床照片)与 Fitzpatrick17k(网络来源、病种更杂)在概念分布上差异巨大。任何跨源概念泛化结论都必须先看覆盖率——这正是论文把 PCBM 测试放在 DDI 上时需谨慎解读概念层面的原因。

2.5 肤色(Fitzpatrick Skin Type)分层

论文 Table 1 给出两子集的 Fitzpatrick 皮肤类型(FST)分层:

FST 分档 代表肤色 Fitzpatrick17k DDI
I-II 白皮肤 1738 208
III-IV 橄榄/浅棕 1350 241
V-VI 深棕/黑 467 207
Unknown — 135 —
合计 — 3690 ≠ 3230 656 ✅

DDI 三档合计 208+241+207=656,与子集总数自洽;而 Fitzpatrick17k 三档加 unknown 合计 1738+1350+467+135=3690,比子集 3230 多出 460。这一不自洽(差 460,恰与质控标签 “Do not consider this image” 在 Fitz 的 460 张数量吻合)提示:Table 1 的 Fitzpatrick17k 列很可能给的是"含被剔除图的全库分布"或统计口径不同,而非 SkinCon 实际使用的 3230 张子集分布。使用肤色分层做公平性分析时,务必以此为前提(坑 5)。

2.6 与两个上游源的关系边界

SkinCon 不改图像、只加标签。因此:

  • 图像来源:Fitzpatrick17k → 其官网;DDI → 其官网。两者均为"科研、非商业用途"。
  • SkinCon 增量:概念标注文件 + 双轮验证记录 + 概念频率统计 + PCBM/CAV 基准实验。
  • 对齐方式:通过两源各自的图像编号(image id)与标注行对应;使用时须同时持有对应源图像,否则标注无附着对象。

这一"图像与标签分离"的结构是本条目 AI-Ready 评估的关键:它的可获取性取决于三个入口(Fitzpatrick17k、DDI、SkinCon 主页)而不仅是自身。

2.7 两源的分布错配及其含义

两源在概念频率上的错配(§2.4 已述:DDI 有 20 余概念为 0)意味着:在 DDI 上做概念级评估时,大量概念没有正样本,无法评估。实际可评估的只是两源共有的高频概念(Erythema、Papule、Brown 等)。这提醒使用者:

  • 概念瓶颈模型在 DDI 上的总体 AUC 优势,可能主要由少数高频概念驱动,而非全部 48 概念。
  • 报告概念级结果时,应列出"该概念在测试集中的正样本数",避免对零样本概念给出虚假指标。

2.8 与宿主数据集的深度关系

Fitzpatrick17k 的角色:它是 SkinCon 的主标注宿主,其 3230 张子集承载了几乎全部概念谱。Fitzpatrick17k 本身的设计目标包含"覆盖 Fitzpatrick 肤色全谱以支持公平性研究",因此它天然带 FST 分层。SkinCon 借用这一分层,使概念标注同时携带了肤色背景——这让"概念维度的公平性分析"(例如深肤色段模型对溃疡概念的识别是否更差)成为可能。

DDI 的角色:DDI(Diverse Dermatology Images)原本是为"疑似恶性病变 + 多样性肤色"设计的临床图像集。在 SkinCon 中,DDI 的 656 张承担外部验证职责:它们不参与概念标注训练,专门用于测试模型的跨源泛化与公平性。DDI 的深肤色占比高(V-VI 有 207 张,占约 31.6%),因此它是检验"模型在深肤色上是否依赖真概念而非伪相关"的关键场。

2.9 皮肤病学临床背景:为什么这些概念"可解释"

要理解 SkinCon 为什么能用概念做解释,必须先理解皮肤科的诊断语言。皮肤科与多数医学专科不同,它高度依赖视觉描述:医生通过在体表"看"到的形态学特征来沟通与推理,而非主要依赖化验或影像。这种描述体系(dermatologic lexicon)在皮肤科教材《Dermatology》(Bolognia et al. 2017)中被系统化,SkinCon 的 48 概念直接取自这一体系。

形态学的逻辑是"几何 + 质地":

  • 大小分档:以 1 cm 为界。Macule(斑疹)与 Patch(斑)都是平坦皮损,前者 < 1 cm,后者 > 1 cm;Papule(丘疹)与 Plaque(斑块)都是隆起皮损,前者 < 1 cm,后者 > 1 cm;Nodule(结节)是高度 ≥ 1 cm 的隆起。这正是论文所说"大小判断主观、受角度光照影响"的来源(§8.4)。
  • 内容物分档:Vesicle(水疱)< 1 cm 的含液隆起,Bulla(大疱)≥ 1 cm 的含液隆起,Pustule(脓疱)为含脓隆起,Abscess(脓肿)为深部化脓,Cyst(囊肿)为封闭囊性结构。
  • 质地/继发改变:Scale(鳞屑)为角质层堆积,Crust(结痂)为干涸渗出物,Erosion(糜烂)为表皮缺失不越基底膜,Ulcer(溃疡)为深达真皮的缺损,Atrophy(萎缩)为皮肤变薄,Induration(硬结)为质地变硬,Lichenification(苔藓样变)为皮纹加深增厚。

颜色的语义:Erythema(红斑)为血管扩张性发红,Brown(褐色)常关联黑色素沉着,White(白色)关联色素减退,Purple(紫)关联出血/血管性,Yellow(黄)关联脂质/脓性,Black(黑)关联坏死或高度色素性——Black 与 Purple 因此成为恶性相关的高权重概念(§5.3)。

为什么这套语言能当"AI 特征集":因为临床医生的诊断推理本身就是"从这些概念到疾病"的映射。当模型被要求先在概念层做预测、再由概念预测诊断时,它复现的正是医生"先描述皮损、再下诊断"的思维链。这是 SkinCon 概念瓶颈方法在临床上说得通、且在实验上不掉精度的根本原因。

2.10 三个易混概念对(使用者的高频疑问)

SkinCon 中几对概念定义相近,标注与建模时须严格区分:

概念对 区别 易混原因
Macule vs Patch 平坦皮损,1 cm 分界 都指平坦、仅颜色改变
Papule vs Plaque 隆起皮损,1 cm 分界 都指隆起、实体性
Bulla vs Vesicle 含液隆起,1 cm 分界 都是水疱类
Erosion vs Ulcer 表皮缺失 vs 真皮缺失 都指皮肤缺损,深度不同
Crust vs Scale 干涸渗出物 vs 角质堆积 都指表面附着物

这类"1 cm 阈值"概念的主观性是论文明确承认的局限(§8.4),也是概念标注固有的噪声来源。使用者在报告概念级指标时,宜对这类概念单独标注不确定性。

§3 标注流水线与验证协议

3.1 人员与分工

角色 人数 皮肤科经验 任务
概念表制定 2 位临床皮肤科医生 5 年 / 6 年 依据皮肤病学知识提炼 48 个描述用概念
主标注者 1 位皮肤科医生 6 年 在标准化界面完成全部 3886 张(3230+656)勾选
验证者 A 1 位 board-certified 皮肤科专家 — 抽验 323 张 Fitzpatrick17k(10%)的概念标注
验证者 B(独立重标) 2 位皮肤科医生 12 年 / 5 年 独立重标 956 张(DDI 全部 656 + Fitz 随机 300),测量一致率

分工的设计逻辑是"建表与标注分离、标注与验证独立":概念表由两人固定,避免单人用词偏置;标注由一人完成以保一致性(而非多人各标一部分带来标注者间噪声);验证由独立于标注者的其他医生完成,用于估计观察者间变异。

3.2 两轮验证协议

第一轮(概念一致率):一位 board-certified 皮肤科专家抽验 323 张 Fitzpatrick17k 图像(约占子集 10%),逐概念核对。结果 同意 1056/1082 = 97.6% 的概念标注。

第二轮(独立重标):两位独立皮肤科医生(12 年 / 5 年经验)对 DDI 全部 656 张 + Fitzpatrick17k 随机 300 张 = 956 张重新标注。结果:

  • 图像质量合格率 94%(即约 6% 图像被判定不宜用于概念标注)。
  • 独立验证者与 SkinCon 标签的总体一致率 94%;分源看:Fitzpatrick 92% / DDI 94%。

两轮验证共同构成标注质量的双保险:第一轮测"专家认可度",第二轮测"跨标注者可复现性"。

3.3 无 IRB 声明

论文明确声明 未申请 IRB,理由是标注对象是公开可得的数据(“We did not have an IRB for this study since we were labeling publicly available data.”)。这一点对数据治理有含义:伦理基础建立在"图像已被两源以科研用途公开"之上,而非重新招募受试者。使用者在合规审查时应核对两源各自的伦理与许可声明,而非仅看 SkinCon。

3.4 标注粒度与多标签分布

标注是图像级多标签:每图可携带 1 个到多个概念。论文 Figure 2b 给出 Fitzpatrick17k 子集的"每图概念数分布",显示多数图像携带数个概念(稠密标注)。这意味着:

  • 概念标签不是互斥类别,评估时应按多标签指标(如每概念 AUC/prf)而非单标签准确率。
  • 每图概念数越多,“无标签即负例"的假设越需谨慎——但因概念表固定,未勾选某概念确实表示"不存在”,这层负例信号是可靠的。

3.5 标注成本的量级

SkinCon 的标注量级是"单一标注者 × 3886 张 × 48 概念的多标签勾选"。相比像素级分割(每张需逐像素圈注、单张专家数十分钟到数小时),概念勾选的单位成本低得多(每张数秒到数十秒的临床判断)。这正是"概念层"能在有限专家预算下覆盖近 4000 张的原因,也是其相对分割型标注的核心效率优势。

§4 任务与标注体系:这一层标签能做什么

4.1 四类下游任务

概念级监督的价值在于它把"图像→诊断"的黑箱拆成可检视的两段。论文示范了四类用途:

  1. 概念探测(concept probing / CAV):训练线性探针从模型中间特征预测概念是否存在,检验"模型的表征里有没有编码这个概念"。论文用 ≥50 张图的 22 个概念做探测,每个线性探针用 50 对正/负样本,留 10 出交叉验证重复 25 次。
  2. 概念瓶颈模型(CBM / PCBM):模型先预测概念、再由概念预测 benign/malignant 诊断,从而把决策过程显式化为"概念→诊断"的可读映射。
  3. 基于概念的事后解释(CAV / CCE):对黑箱模型的既有预测做解释,例如 Figure 3 展示模型漏判恶性时,其表征"缺少 telangiectasia/ulcer/friable 等概念"可解释这一错误。
  4. 错误分析与切片发现(slice discovery):按概念分层(如"带溃疡的子集"“深肤色子集”)切分性能,定位模型在哪些概念/人群上系统性失效。

4.2 概念体系的组织原则

48 概念的四大维度(原发皮损 / 继发改变与质地 / 形状 / 颜色)并非随意堆叠,而是对应皮肤病学描述性诊断的观察顺序:先看皮损的形态,再看继发改变与质地,再看形状细节,最后看颜色。这一组织方式使概念表既能被临床医生直觉理解,又便于按维度做子群分析(例如"颜色类概念上的模型偏差"对应色素相关公平性问题)。

4.3 与既有概念数据集的差异

在 SkinCon 之前,皮肤病学领域较系统的属性/概念标注数据(如 derm7pt)仅覆盖少数属性(约 7 个),难以支撑细粒度概念瓶颈实验。SkinCon 把概念数量推到 48,且专门针对"可调试性"设计——这是它在方法学上的定位:不是又一个大图像集,而是第一个面向皮肤病 AI 调试的概念层。库内的 derm7pt(rid 110)可作为它的历史对照。

4.4 从"诊断正确率"到"概念级诊断"的范式转换

传统皮肤病 AI 的评估闭环是"图像 → 诊断标签 → 正确/错误"。这一闭环的问题在于错误信号过于粗糙:模型判错时,你只知道它错了,不知道它"看错了什么"。SkinCon 支持的新闭环是"图像 → 概念集合 → 诊断 → 正确/错误",因此错误可以被归因到概念维度:

  • 概念缺失型错误:模型没有激活本应指向恶性的概念(如溃疡、毛细血管扩张),于是漏判。
  • 概念误激活型错误:模型把良性特征(如斑、脓疱)误当作恶性证据。
  • 概念识别错误:模型识别出的概念本身就与皮肤科医生的勾选不符(概念探测失败)。

这一三分法让"模型为什么错"有了可操作的诊断语言,也是 SkinCon 相对纯诊断数据集的核心增量。对开发团队,这意味着可以用概念级指标(每概念 AUC、概念召回率)替代或补充诊断级指标,把改进方向定位到具体的临床特征上。

4.5 概念体系中"缺失"的设计取舍

值得注意的是 SkinCon 概念表没有覆盖的部分:它不标注病灶部位(头皮/躯干/四肢)、不标注病程(急性/慢性)、不标注患者的年龄/性别/病史、也不做像素级的病灶定位。这些取舍是有意的——概念表锁定在"能从单张图像直接观察到的形态/质地/形状/颜色特征"上,以保证:

  1. 标注可复现:形态特征比部位/病程更少歧义,跨标注者一致性更高。
  2. 概念可探测:形态特征是视觉可分的,适合用线性探针在图像表征上检验。
  3. 临床可解释:形态/颜色正是皮肤科医生描述皮损的标准语汇,解释输出对医生可读。

代价是:概念表无法支撑"部位相关"或"病程相关"的研究问题。若研究需要部位信息,须回两源原始元数据(若存在)另行补充。

4.6 概念粒度的多标签统计含义

因为是多标签,48 个概念并非 48 个互斥类别,评估时必须用多标签指标。具体而言:

  • 每概念视角:对每个概念单独算二分类指标(有无该概念),得到 48 组 AUC/precision/recall。
  • 每图视角:对每张图计算预测概念集与真值概念集的 Jaccard/汉明距离等集合指标。
  • 分层视角:按概念数、按肤色、按来源分层再做上述指标。

论文的 CAV 实验采用的是第一种(每概念线性探针),而 PCBM 用的则是"概念作为中间层"的联合训练。理解这一区别对正确复现实验至关重要。

4.7 概念体系与皮肤病学诊断流程的对应

把 48 概念按临床诊断流程排布,可以看到它与皮肤科医生的实际工作顺序高度对应:

  1. 观察(形态):先判断皮损是实性(丘疹、结节)、液性(水疱、脓疱)还是平坦色变(斑疹、斑)。这一步对应概念表的"原发皮损"维度。
  2. 追问演变(继发):看皮损是否经过搔抓、破溃、愈合(结痂、糜烂、瘢痕、萎缩)。对应"继发改变与质地"维度。
  3. 描述轮廓(形状):带蒂、疣状、穹顶状、脐凹状等,帮助缩小病种范围。对应"形状"维度。
  4. 判读颜色:红斑、色素沉着、紫、黑等,既提示血管/色素性来源,也与恶性风险相关。对应"颜色"维度。

这一对应关系解释了为什么 SkinCon 的概念能成为"可解释的诊断中间层":它复刻了医生的思考链,因此模型沿这一链条给出的解释对医生是可读、可信的。

4.8 概念监督的数据效率含义

概念标注相对诊断标签有一个隐性优势:概念在图像间可迁移,诊断则受病种限制。同一个"溃疡"概念在多种疾病的图像中都会出现,因此概念级监督能跨越病种边界提供训练信号。这对数据稀缺的罕见皮肤病尤为重要——即使某罕见病只有很少的图像,其皮损概念仍可从其他病种的概念标注中受益。SkinCon 的价值部分正来自这种"概念共享"的潜力。

4.5 与宿主数据集的深度关系(补充)

4.5.1 为什么是 Fitzpatrick17k + DDI 这两个源

选择这两源并非偶然:Fitzpatrick17k 提供广覆盖、多病种、带肤色标注的图像(适合做概念谱的全量标注),DDI 提供临床来源、疑似恶性为主、深肤色富集的图像(适合做外部验证与公平性检验)。两者组合恰好覆盖了"训练用的多样性"与"测试用的临床真实性 + 公平性"两个需求。若只用 Fitzpatrick17k,则缺乏干净的外部验证;若只用 DDI,则概念谱太窄(20 余概念为 0)。SkinCon 的两源设计是对这一矛盾的回应。

4.5.2 两源的采集性质差异
  • Fitzpatrick17k:图像多来自网络公开资源(如 DermNet 等),覆盖 100+ 病种,来源异质,带有平台/水印/分辨率差异。这种异质性对概念标注是双刃剑——概念谱丰富,但图像质量参差(部分触发 “Do not consider this image”)。
  • DDI:图像来自斯坦福诊所的临床采集,有活检金标准,质量较统一,但病种集中在疑似恶性病变,因此概念谱窄。

这一差异解释了 §2.4 的概念频率错配,也解释了为什么 DDI 上约 6% 的图像被判定质量不达标(临床照片的构图/光照需符合概念可判读要求)。

4.5.3 对齐与复现的实操要点

复现时,两源图像与标注的对齐依赖 image id,实操中需注意:

  • Fitzpatrick17k 子集的 3230 张是"随机抽样 + 去噪"后的结果,需用 SkinCon 的标注文件确认真实使用的 id 列表。
  • DDI 子集的 656 张是全量,直接对应。
  • 剔除低质量图像后,有效图像数会少于 3886(Fitz 减 460、DDI 减 20 的量级),做统计时应报告是否剔除。

§5 评估与基准:PCBM 如何在 DDI 上跑赢 DeepDerm

5.1 评估设计:为什么测试放在 DDI

论文的基准实验有一个关键设计:所有测试在完全独立的 DDI 上进行。原因是数据泄漏——基线模型 DeepDerm(Inceptionv3 架构,训练于 Esteva et al. 2017 的数据)的训练数据与 Fitzpatrick17k 存在重叠,若在 Fitzpatrick17k 上测会高估性能。DDI 作为外部数据集提供了干净的评测场。这一安排在方法学上是必要的:概念瓶颈模型的价值不能靠"在它自己的训练分布上刷分"来证明。

5.2 DeepDerm vs PCBM:总体与分肤色段结果

论文 Table 2 给出 5 个随机种子的均值±标准误:

测试集 原始 DeepDerm AUC PCBM AUC(均值±SE) 方向
DDI 总体 0.595 0.639 ± 0.001 PCBM 更优
DDI (I-II) 0.649 0.643 ± 0.002 DeepDerm 略优
DDI (III-IV) 0.632 0.727 ± 0.002 PCBM 大幅更优
DDI (V-VI) 0.528 0.542 ± 0.002 PCBM 更优

三个要点:

  1. 总体 PCBM 胜出(0.639 vs 0.595),且是在引入可解释性的前提下取得的——即"可解释的模型至少不差、有时更好"(论文核心结论)。
  2. 中肤色段(III-IV)提升最大(+0.095),说明概念瓶颈结构在该子群上帮助尤其明显。
  3. 浅肤色段(I-II)PCBM 略输(0.643 vs 0.649),差异极小;深肤色段(V-VI)PCBM 略胜(0.542 vs 0.528),但两模型在该段 AUC 都偏低(<0.55),反映出深肤色皮肤病的难分性——这是皮肤 AI 公平性研究的经典痛点,SkinCon 并未掩盖它。

5.3 概念权重:模型"看见了什么"

论文 Table 3 给出各概念对 benign/malignant 判定的权重,可读作"模型把哪些概念当作恶性/良性的证据":

方向 概念 权重 临床直觉
指向恶性(正) Ulcer(溃疡) 1.190 溃疡常见于恶性/侵蚀性病变
指向恶性(正) Telangiectasia(毛细血管扩张) 1.022 与部分恶性皮肤肿瘤相关
指向恶性(正) Black(黑) 0.746 色素性恶性病变关联
指向恶性(正) Purple(紫) 0.489 —
指向恶性(正) Friable(易脆) 0.307 易出血/脆性质地
指向良性(负) Patch(斑) −0.960 平坦斑片多良性
指向良性(负) Pustule(脓疱) −0.836 感染性/炎性多见
指向良性(负) Scar(瘢痕) −0.711 既往愈合痕迹
指向良性(负) Dome-shaped(穹顶状) −0.130 —

这组权重的意义在于:它让"模型为什么判恶性"变成可读的概念证据链,而不是抽象的特征激活。它也构成可证伪的诊断信号——若某概念的权重与临床直觉相悖,即是模型偏差的线索。

5.4 概念探测(CAV):模型表征里有没有这个概念

论文用 ≥50 张图的 22 个概念做线性探测:每个概念训练一个线性探针,使用 50 对正/负样本,采用留 10 出交叉验证、重复 25 次。目的是检验模型中间表征是否线性可分地编码了该概念。这是"概念是否已被模型学到"的直接量度,也是后续做概念瓶颈干预的前提。

5.5 案例:用概念解释一次漏判(Figure 3)

论文 Figure 3 展示概念激活解释的一个实例:当模型将某恶性病变误判为良性时,其表征中被激活的概念缺少 telangiectasia / ulcer / friable 等指向恶性的关键概念。这一解释既是"模型错在哪"的诊断,也提示了改进方向(补强这些概念的监督)。这类"概念级事后解释"正是 SkinCon 想赋能的典型工作流。

5.6 计算与复现

论文实验使用单卡 NVIDIA Titan Xp GPU,代码随论文补充材料发布。PCBM 训练/测试切分使用"未用于概念标注的 Fitzpatrick17k 图像":训练 2787(80%)/ 测试 697(20%)。概念瓶颈模型 PCBM 的方法基础来自 Yuksekgonul et al. 2022(arXiv:2205.15480),SkinCon 作者之一 Mert Yuksekgonul 亦是该方法的共同作者,因此本文档在方法上高度自洽。

5.7 结果的三层解读

第一层:总体层面,"可解释不掉精度"成立。 这是最广为人知的结论,也是最容易被误读的。严格说,论文证明的是"用 SkinCon 概念构建的 PCBM 在 DDI 上的 AUC 不低于黑箱 DeepDerm"(0.639 vs 0.595),而不是"任何概念瓶颈都优于任何黑箱"。换一个概念库、换一个任务,结论未必复现。因此引用时应附带条件:“在皮肤科良恶性二分类、DDI 测试集、SkinCon 概念库这一特定设定下”。

第二层:子群层面,“提升高度不均”。 四个子群的差值从 −0.006(I-II)到 +0.095(III-IV)跨越了约 0.1,说明概念瓶颈的收益高度依赖子群。中肤色段(III-IV)受益最大,浅肤色段(I-II)几乎持平甚至微负。这提示:可解释化的收益不是均匀分布的,做子群分解是必要的——否则"总体提升"会掩盖某些子群的"无提升甚至倒退"。

第三层:绝对性能层面,“深肤色仍难”。 无论哪个模型,DDI(V-VI) 的 AUC 都只有 0.528–0.542,显著低于浅肤色段。这说明可解释性并不能直接解决公平性差距——它只是让差距"可见、可诊断"。要真正弥合,仍需更多深肤色数据与针对性方法。SkinCon 的价值在此更多是"提供了诊断工具",而非"解决了问题"。

5.8 与通用视觉概念基准的可比性

在通用视觉领域,概念基准(如 CUB 鸟类 312 属性、Broden 1197 概念)常被用于概念方法的开发与测试。SkinCon 与它们的本质差异在于:SkinCon 的概念需要领域专业知识才能可靠标注(“斑块 vs 丘疹"的 1 cm 分界、颜色的临床语义),因此它的 48 概念不是"众包可得"的,而是"皮肤科医生专业判断"的产物。这一差异使 SkinCon 更适合检验"概念方法在专业医学域是否成立”,而不适合检验"概念方法在众包场景的扩展性"。论文也把 SkinCon 定位为对 Broden/CUB 等通用基准的"医学补充"。

5.9 基准的正确用法与常见误用

正确用法:

  • 把 0.595(黑箱)与 0.639(PCBM)作为"同设定下的对照数字",用于说明"你的方法相对 SkinCon-PCBM 的位置"。
  • 把概念权重表(§5.3)作为"解释合理性"的参照——新方法若给出与临床相悖的权重,值得警惕。
  • 把概念探测协议(50 对样本、留 10 出 CV 重复 25 次)作为可复现的探针基线。

常见误用:

  • 把 0.639 当成"PCBM 的通用性能"跨数据集引用(它只在 DDI 上测得)。
  • 把概念权重当成"临床因果证据"(它只是模型内线性层的权重,不是医学结论)。
  • 忽略子群差异,只报总体 AUC(§5.7 第二层)。
  • 在 DDI 上做概念级评估却不报各概念正样本数(大量概念在 DDI 为 0,见 §2.7)。

§6 获取与许可:三入口结构

6.1 三段资产、三个门

资产 内容 获取入口 许可口径
Fitzpatrick17k 图像 3230 张对应原图 Fitzpatrick17k 官网自取 科研、非商业用途
DDI 图像 656 张对应原图 DDI 官网自取 科研、非商业用途
SkinCon 概念标注 3886 张的概念标签 项目主页下载(Fitzpatrick17k / DDI 两套标注文件) 官方页与论文未单独声明 SPDX(待核)

关键点:SkinCon 只发标注,不发图像。项目主页提供两个下载入口——“Download SKINCON Fitzpatrick17k annotations” 与 “Download SKINCON DDI annotations”;图像本体必须分别去两源官网获取。任何"一键拿全"的期待都会落空(坑 8 亦是此类误读的变体)。

6.2 许可细读

  • 图像本体:论文原文称两源 “both of these datasets are available for scientific, non-commercial use”(科研、非商业)。SkinCon 未对图像本体另行声明再分发许可,因此图像边界沿用两源各自条款。
  • 标注文件:官方页与论文未单独给出标注文件的 SPDX 许可。这意味着标注文件的再分发与商用边界需要回源确认(联系项目/作者),本条目标注为待核(坑 7)。
  • 论文本体:NeurIPS 2022 Datasets and Benchmarks Track,开放获取(proceedings 与 arXiv v1)。

6.3 版本链与镜像

  • 无版本号体系:v1 即首发定版(2022 会议 / 2023 arXiv),未见官方后续更新通告。
  • 无官方 HuggingFace / Zenodo 镜像(抓取时点):在 HF 主站与 hf-mirror 均未检索到官方 SkinCon 数据集仓库;第三方转载页(如 selectdataset)非官方,不可作数据源引用。
  • 项目主页:论文 §6 引 https://SkinCon-dataset.github.io(大小写混合),实际抓取时点存在可访问性波动(明文本站点),标注下载链接需人工复核。

6.4 AI-Ready 评估:三入口结构下的可获取性

SkinCon 的可获取性被"三入口"结构拖累:概念标注虽可下载,但缺少配套图像就无法使用。这是"标签数据集"的固有特征——它的 AI-Ready 得分天然低于"图像+标签一体分发"的数据集约一个身位。补偿因素是其标注文件体积小、可直接下载,且两源图像均公开(尽管各自需过各自的条款)。对使用者而言,实际准备成本是"两次图像获取 + 一次标注获取 + 一次图像-标注对齐"。

§7 生态与影响:一个可解释性支点

7.1 在世界皮肤病学数据集景观中的位置

皮肤影像领域的数据集大致有三层:

  1. 诊断标签层:ISIC 系列(isic-archive/2018/2019/2020)、HAM10000、BCN20000 等——图像 + 疾病类别,规模大。
  2. 属性/概念标注层:derm7pt(约 7 属性)、SkinCon(48 概念)——在图像上加临床描述。
  3. 公平性/肤色分层层:Fitzpatrick17k、DDI——以肤色标注为设计核心。

SkinCon 位于第 2 层,且是其中概念维度最丰富的;它与第 3 层的两个数据集(Fitzpatrick17k、DDI)是宿主关系,与第 1 层的 ISIC 系列则是互补关系(概念监督 vs 诊断监督)。

7.2 与前作/宿主的关系

  • Fitzpatrick17k(Daneshjou et al. 2022):SkinCon 的主标注宿主,3230 张;Fitzpatrick17k 本身以 Fitzpatrick 肤色标注与公平性研究为设计目标。
  • DDI(Daneshjou et al. 2022, Science Advances):SkinCon 的外部验证宿主,656 张;专为"疑似恶性 + 深肤色"设计,是评估皮肤 AI 公平性的关键集。
  • derm7pt:早期属性标注数据集,SkinCon 在概念粒度上对其形成升级。
  • PCBM 方法(Yuksekgonul et al. 2022):SkinCon 的基准方法来源。

这一谱系显示 SkinCon 并非孤立作品,而是斯坦福 Daneshjou/Zou 组在"皮肤 AI 可解释性与公平性"方向上的一环:从数据集(Fitzpatrick17k/DDI)到方法(PCBM)到调试工具(SkinCon)。

7.3 对可解释 AI 社区的影响

SkinCon 的 48 概念标注成为皮肤病学域内概念瓶颈/概念探测实验的标准素材之一:它提供的不只是标签,还有一条"概念→诊断"的公开基准(DeepDerm vs PCBM 的 AUC 对照)。对可解释 ML 研究者,它是一个"域内有临床意义的概念"落地案例——不同于通用视觉里(如 CUB 鸟类属性)的概念实验,SkinCon 的概念直接对应临床可读的皮损特征。

7.4 生态接入点与库内互链

  • 直接上游:fitzpatrick-17k(rid 55)、ddi(rid 171)——必须互链。
  • 同域可互链:ham10000(rid 60)、pad-ufes-20(rid 151)、derm7pt(rid 110)、derm12345(rid 742)、dermacon-in(rid 781)、skincap(rid 782)。
  • ISIC 系列(isic-archive rid 56 / isic-2018 rid 710 / isic-2019 rid 707 / isic-2020 rid 715):与"同名撞库"的 SkinCON/DRAPS 相关,参考时注意区分。
  • 方法学互链:OAI(骨关节炎概念数据集,18 概念)——与 SkinCon 48 概念形成"概念数据集"跨域对照。

7.5 使用者的常见工作流

把 SkinCon 接入一个典型研究项目,通常经历以下步骤:

  1. 取数据:项目主页下载概念标注;Fitzpatrick17k 官网取 3230 张、DDI 官网取 656 张。
  2. 对齐:按 image id 把标注行与图像文件对应起来;检查是否有缺图/多图。
  3. 清洗:剔除 “Do not consider this image” 标记的低质量图像(Fitz 460 / DDI 20)。
  4. 建模:训练视觉骨干(或复用既有模型)→ 概念头(多标签)→ 诊断头(二分类),即概念瓶颈结构。
  5. 评估:在 DDI(独立集)上算诊断 AUC;再按概念分层、按肤色分层算子群指标。
  6. 解释:读概念权重、做概念探测、生成概念级错误分析(如漏判恶性的概念证据链)。

这一工作流的关键卡点是第 2 步(对齐)与第 3 步(清洗):标注文件本身不含图像,二者靠 id 关联;低质量图像的剔除与否会直接改变概念频率与评估结果。

7.6 与通用视觉概念数据集的类比

在通用计算机视觉中,CUB(鸟类属性)、AwA(动物属性)等数据集用"属性"支撑可解释性研究;医学影像中这类资源稀缺。SkinCon 相当于皮肤病学域的"属性数据集",区别在于:

维度 CUB/AwA(通用) SkinCon(医学)
属性来源 生物学家/众包 皮肤科医生
属性语义 视觉可见特征 临床皮损概念
使用场景 可解释性研究 医疗可解释性 + 公平性
风险 研究性 医疗决策辅助(有临床后果)

这一类比帮助可解释 ML 研究者快速定位 SkinCon 的用途,也提醒医疗域的特殊性:概念错误可能对应临床误判,而非仅仅是 benchmark 分数。

7.7 版本、维护与长期可用性

版本状态:SkinCon 没有正式的版本号体系,v1 即首发定版(NeurIPS 2022 / arXiv 2023-02-01)。抓取时点未见官方更新通告,引用时应注明访问日期与来源。

长期可用性风险:三条——依附两源(Fitzpatrick17k 与 DDI 任一源下线都会影响可用性)、无官方镜像(HF/Zenodo 未见,缺冗余备份)、主页为 GitHub Pages 明文站点(下载链接稳定性中等)。缓解建议是尽早在本地留存标注文件,并记录两源图像的获取日期与校验信息。

引用与著录建议:概念标注与验证引 SkinCon 论文;图像来源分别引两源原始论文;使用条款按两源"科研非商业"、标注文件待确认;年份口径全篇统一(坑 2)。

7.8 可解释性方法的横向对比

把 SkinCon 支持的几类可解释性方法放在一起对比,能看清各自的位置:

方法 干预时机 可解释性来源 对概念标注的依赖 性能影响
CBM(概念瓶颈模型) 训练时 概念→诊断的显式映射 强(训练需概念标签) 可能略降或持平
PCBM(事后概念瓶颈) 训练后 在既有模型上建概念层 强(需概念标签建层) 本论文中提升
CAV(概念激活向量) 训练后 中间特征的概念线性可分性 中(探测需概念样本) 不改模型
CCE(概念反事实解释) 训练后 概念的增减对预测的影响 中 不改模型

SkinCon 的独特贡献是为这四类方法同时提供了域内、临床可读的概念监督;此前皮肤病学缺乏这类资源,相关方法只能借通用视觉属性集做迁移实验。

7.9 对下游研究者的现实提醒

对想直接用 SkinCon 出成果的研究者,有三条现实提醒:

  1. 别跳过图像获取:很多人卡在"下了标注却没图"。务必先规划好两源图像的获取(可能需要注册/遵守各自条款)。
  2. 注意两源的评估分工:概念谱完整的 Fitzpatrick17k 适合训练,干净独立的 DDI 适合测试,别把两者混用导致泄漏。
  3. 报告要区分口径:概念数(22/25/28)、肤色合计(3690 vs 3230)、图像数(3886 vs 约 4000)在写论文时都要选一个口径并说明(坑 3/4/5)。

§8 方法学启示:三条可迁移的经验

8.1 "宿主数据集 + 概念层"是一种低成本高价值的数据工程

SkinCon 证明了不必采集新图像也能产出高价值数据集:把专家知识注入既有公开图像的"概念维度",就能解锁一整类可解释性研究。对数据集工程者的启示是——在图像已经公开、诊断标签已经存在的领域,概念/属性标注的边际成本远低于采集新图像,而方法学收益可能更高。这一模式可迁移到其他诊断影像域(病理、放射、眼底)。SkinCon 的成功前提是皮肤科拥有成熟、标准化的描述性术语体系(形态/质地/形状/颜色),因此概念表可以"从词典中来"而非从零发明。

8.2 概念表的"先固定、后标注"避免同义词漂移

SkinCon 先由两位皮肤科医生固定 48 概念表,所有标注都在这张固定表上操作。这避免了自由文本标注中常见的同义词/上下位词漂移问题(“丘疹” vs “小丘疹”、“红斑” vs “发红”)。对任何做概念标注的项目,这是一条可直接照搬的规范:概念表是 schema,必须先冻结再大规模标注。

8.3 双轮验证:数量级不同的两种一致性

SkinCon 的两轮验证各测一个维度:第一轮(323 张,97.6% 概念一致)测"专家认可度",样本小但对齐专家;第二轮(956 张,94% 总体一致)测"跨标注者可复现性",样本大且覆盖两源。这种"小样本专家抽验 + 大样本独立重标"的双轨验证,比单一验证更能暴露问题(例如第二轮发现约 6% 图像质量不合格,是纯专家抽验不易发现的)。任何专家标注项目都可借鉴这一组合。

8.4 可解释性不等于牺牲性能——但要看子群

PCBM 在 DDI 总体与中/深肤色段优于 DeepDerm,在浅肤色段略输,说明"引入概念瓶颈"的性能代价很小且方向相关。可迁移的经验是:评估可解释性方法时,必须做子群分解,否则总体 AUC 会掩盖子群差异。这与皮肤 AI 公平性研究的核心关切完全一致。长久以来"加可解释层必掉精度"的假设,在概念与任务高度对齐的领域(皮肤科临床词典本就与诊断相关)被证伪。

8.5 外部干净数据集作为测试场

SkinCon 坚持在 DDI 而非 Fitzpatrick17k 上做测试,因为前者无泄漏、经活检验证。这个选择提示:当上游数据之一与基线模型存在泄漏或质量问题时,另找一个独立、干净的外部集做验证场,是保证结论可信的关键。这对一切"在既有数据上加标注"的衍生数据集都适用——衍生数据集的评测,尤其要警惕宿主数据带来的泄漏。

8.6 标注经济学的一个样本

SkinCon 是"标签比图更值钱"的典型:图像本体公开可得、由两源免费提供,而 SkinCon 的增量价值全在那层概念标注与配套验证上。这提示数据集生产者:在图像已公开的领域,增量价值可以来自高质量、结构化的标注层,而不必重复采集图像。这一模式对预算有限、但拥有领域专家的团队尤其友好。

8.7 概念即"可证伪的模型诊断"

概念权重表把"模型为什么这么判"变成可审计的数字:如果模型给 Pustule(脓疱)一个大正权重指向恶性,研究者立刻能发现这与临床相悖——这是一个可证伪的偏差信号。相比"模型在深肤色上表现差"这类聚合统计,概念级的诊断更细、更可操作,也更容易转化为具体的改进动作(补强某概念的监督)。

§9 与库内条目的关系

9.1 家族图谱

SkinCon 处在皮肤病影像数据集家族的一个特殊位置——它是标注层,不是图像源:

Fitzpatrick17k(rid 55,含 Fitzpatrick 肤色标注)
    └── SkinCon Fitzpatrick17k 子集(3230 张)
DDI(rid 171,656 张,活检验证,Daneshjou et al. 2022)
    └── SkinCon DDI 子集(656 张,全量)
                ↓ 叠加 48 概念标注
        【SkinCon】(本条目)3886 张 × 48 概念
  • 直接上游(必链):fitzpatrick-17k(rid 55)、ddi(rid 171)。
  • 同域平级(建议链):ham10000(rid 60)、pad-ufes-20(rid 151)、derm7pt(rid 110)、derm12345(rid 742)、dermacon-in(rid 781)、skincap(rid 782)。
  • ISIC 系列(弱关联):isic-archive(rid 56)、isic-2018(rid 710)、isic-2019(rid 707)、isic-2020(rid 715)——与"同名撞库"的 SkinCON/DRAPS 有关(见坑 1),但与本条目本身无数据关系。

9.2 检索路径建议

  • 精确检索:用 "SkinCon" 精确短语 + Stanford 或 Daneshjou 消歧;勿只搜 “SkinCon” 否则会混入 SkinCON/DRAPS。
  • 找数据:先到 Fitzpatrick17k / DDI 官网拿图,再到 SkinCon 官方站拿标注(§6)。
  • 引用质量数字:区分 97.6%(专家抽验 323 张,概念级)与 94%(独立重标 956 张),别混。
  • 引用概念数:指定子集口径(22/25/28 三重口径,坑 3)。
  • 引用可解释实验结果:用 DDI 上的 0.595(黑箱)vs 0.639±0.001(PCBM)。

9.3 与库内"概念/可解释"条目的呼应

本库中若已有其他带概念/属性标注的医学数据集(如 derm7pt 的 7 判据、OAI 的 18 概念),SkinCon 可作为"概念数升级版"对照:概念数 7→48,覆盖疾病从单一黑色素瘤→跨病过程。凡涉及"模型可解释性"“概念瓶颈”"临床概念监督"的库内条目,都可与 SkinCon 交叉引用。

§10 避坑清单:八个已踩过的坑

坑 1:SkinCon 和 SkinCON 是两个不同数据集(同名撞库)。斯坦福 SkinCon(本条目,NeurIPS 2022,Fitzpatrick17k + DDI,3886 张,48 概念)与 UC Berkeley 的 SkinCON/DRAPS(Ren et al., MICCAI 2024,ISIC 2019,25,331 张,937,167 判断,10,509 参与者,任务是"不确定性预测集")大小写/连字符近似,极易混淆。检索必须加机构(Stanford vs UC Berkeley)、作者(Daneshjou vs Ren)或图像源(Fitzpatrick17k/DDI vs ISIC 2019)消歧。

坑 2:发表年份双口径。会议论文年 = 2022(NeurIPS 2022 Datasets and Benchmarks);arXiv 预印本上线 = 2023-02-01。同一工作两个年份都会出现在检索结果里,著录时须说明用的是哪个口径。

坑 3:"≥50 张图像的概念数"三重口径冲突。摘要与部分段落说 22(Fitzpatrick17k 单独),§2.4 说 28(combined with DDI),研究贡献段后半说 25(combined,措辞疑笔误)。论文内部不自洽,引用时必须指定子集口径并注明冲突。

坑 4:图像总数近似值。第三方转述有"nearly 4,000 images"(Lacuna)、"3,886 images"等;确切值是 3886(3230 + 656),以论文 Table 5 脚注为准。别用"约 4000"这类模糊数做硬引用。

坑 5:肤色分布表与子集总数不自洽。Table 1 的 Fitzpatrick17k 列三档 1738+1350+467 = 3555(+135 unknown = 3690)≠ 子集 3230,相差 460(恰与 Fitzpatrick17k 质控标签 “Do not consider this image” 的 460 张吻合);DDI 列 208+241+207 = 656 则自洽。Fitzpatrick 列疑为全库口径或口径未说明,引用肤色比例时须存照。

坑 6:概念数是 48,但 Table 5 有 49 行。第 49 行是 “Do not consider this image”(质量控制标签),不属于 48 个临床概念。做 48 类多标签模型时勿把它当作第 49 个概念。

坑 7:三段资产、许可边界不同。Fitzpatrick17k 图像与 DDI 图像各自"科研非商用";SkinCon 标注文件的 SPDX 许可未单独声明。商用/再分发前必须回上游与作者确认,不可把"科研可用"当作"商用可用"。

坑 8:图像级标注 ≠ 像素级分割。SkinCon 是 48 概念的图像级多标签,不提供任何病灶边界框或掩码。若任务需要定位,必须另找源数据集的病灶标注(SkinCon 帮不上)。

10.1 坑点速查表

编号 坑点一句话 高发场景
坑 1 SkinCon ≠ SkinCON/DRAPS(同名撞库) 文献检索/选条
坑 2 2022(会议)vs 2023(arXiv)双年份 引用/著录
坑 3 ≥50 张概念数 22/25/28 三重冲突 数字抽取
坑 4 3886 是确值,"约 4000"是近似 规模引用
坑 5 Table 1 肤色列合计 3690 ≠ 子集 3230 公平性分析
坑 6 48 概念 + 1 质控标签 = Table 5 共 49 行 建模类别数
坑 7 标注文件许可未单独声明 商用/再分发
坑 8 图像级多标签 ≠ 像素级分割 任务匹配

10.2 八个坑背后的三类共性问题

把上述八个坑归类,可以看到三类系统性问题,它们对任何"依附型数据集"都适用:

第一类:命名与身份混淆(坑 1、坑 2)。SkinCon 与 SkinCON/DRAPS 的名字只差大小写,是典型的高危同名撞库;而"会议年 2022 / 预印本年 2023"则是同一工作的时间双口径。两者共同说明:数据集的"身份"不能只靠名字确定,必须用机构 + 作者 + 规模 + 任务的组合指纹。

第二类:内部数字不自洽(坑 3、坑 5、坑 6)。论文自身在三处存在口径冲突:≥50 概念数(22/25/28)、Table 1 肤色合计(3690 vs 3230)、概念表行数(49 vs 48)。这些不是"错误"而是"口径未统一"。使用者的正确做法是:逐条落源、标明出处小节,而非替作者做主观调和。

第三类:获取与许可的碎片化(坑 4、坑 7、坑 8)。图像与标签分离、三入口结构、标注许可未明、图像数被第三方近似化——这些都源于 SkinCon"不自持图像"的定位。使用者必须接受"这个数据集天然需要多步准备"的现实,并在合规上回源确认。

三类的共同解法是同一句话:对依附型数据集,“引用它"不等于"拥有它”,每一个数字和每一份权利都要独立核实。

§11 总结

11.1 三句话总结

  1. SkinCon 用 3886 张图的 48 概念稠密标注,第一次把皮肤病 AI 的"黑箱分类"打开成可检视的"概念→诊断"两段结构,为概念瓶颈/概念探测提供域内监督。
  2. 它的双轮验证(97.6% 概念一致 + 94% 独立重标一致)与"先冻结概念表再大规模标注"的流程,是可复制的专家标注规范。
  3. 它的基准证明"可解释的 PCBM 至少不差、在中深肤色段更好"(DDI 总体 0.639 vs 0.595;III-IV 0.727 vs 0.632),并公开了概念权重与解释案例。

11.2 适合谁

  • 可解释 AI 研究者:需要域内、有临床意义的概念标注做 CBM/CAV 实验。
  • 皮肤病 AI 团队:想调试模型"看错了什么概念"、做错误分析与切片发现。
  • 公平性评测者:需要 Fitzpatrick 肤色分层背景(注意坑 5 口径)。
  • 标注方法论研究者:想借鉴"冻结概念表 + 双轮验证"的规范。

11.3 不适合谁

  • 需要大规模诊断分类训练集的项目(3886 张、概念标签,不是诊断大集)——应改用 ISIC/HAM10000。
  • 需要图像+标签一体下载的团队(SkinCon 只发标注,图像要另取)。
  • 需要明确商用/再分发许可的商业项目(标注文件许可未明,图像为科研非商业)。
  • 需要像素级病灶定位的项目(SkinCon 是图像级多标签,无掩码)。

11.4 30 秒决策卡

你的情况 行动
要做概念瓶颈/可解释实验 项目主页下载概念标注 + 两源官网取图 + 对齐 image id
要评估模型在概念层的错误 读 §5.3 概念权重 + §5.5 解释案例,按概念分层评测
要写皮肤 AI 公平性 用 §2.5 肤色分层,但先核对 Table 1 口径(坑 5)
要设计专家概念标注 照搬 §3.1 分工 + §3.2 双轮验证 + §8.2 冻结概念表
要引用本数据集 会议年(2022)+ arXiv:2302.00785;图像与标签分别著录
怕搜错同名集 认准"斯坦福 + 概念标注 + 3886 张",排除 UC Berkeley 的 SkinCON/DRAPS(坑 1)

11.5 一句话定位

SkinCon 是皮肤病 AI 从"黑箱分类"走向"概念级可解释与可调试"的关键基础设施,代价是它把复杂度转移到了"多入口获取 + 概念体系背景知识"上。

11.6 留给读者的三个判断

读完本条目,你可以用三句话检验是否抓住了 SkinCon 的要点:

  1. 它是"加一层",不是"多一点":SkinCon 的价值不在图像数量,而在图像与诊断之间插入的 48 概念中间层。
  2. 它是"借来的图、自己的标签":图像归两源,概念标注与验证才是它的原创贡献,也是引用时的核心。
  3. 它是"可解释不必牺牲性能"的实证:DDI 上 PCBM 0.639 > DeepDerm 0.595,至少在皮肤科域内证伪了"加可解释层必掉精度"的假设。

若这三点你都能复述,就可以放心地用 SkinCon 做研究或写综述了。

FAQ(高频问答 32 问)

A. 基础认知

Q1:SkinCon 是一个新采集的皮肤病图像集吗?
不是。它不采集新图像,而是对两个既有公开图像集(Fitzpatrick17k 3230 张 + DDI 656 张)做概念级重标注,共 3886 张。

Q2:名字里的 “Con” 指什么?
指 concept(概念)。SkinCon 的核心是给每张图标注"存在哪些临床概念",用于基于概念的模型调试与可解释性研究。

Q3:谁做的?
斯坦福大学跨三系合作:皮肤科、计算机科学系、生物医学数据科学系;作者 Roxana Daneshjou、Mert Yuksekgonul(共同一作)、Zhuo Ran Cai、Roberto Novoa、James Zou。

Q4:发表在哪里、哪一年?
NeurIPS 2022 Datasets and Benchmarks Track(会议版);arXiv:2302.00785 于 2023-02-01 上线。注意双年份(坑 2)。

Q5:它和 SkinCON/DRAPS 是同一个东西吗?
不是,是最危险的同名撞库。SkinCON/DRAPS 出自 UC Berkeley 等,MICCAI 2024,基于 ISIC 2019,约 25331 张、937167 条判断,任务是诊断/不确定性判断预测。二者仅名字近似(坑 1)。

Q6:一共有多少张图、多少概念?
3886 张(Fitzpatrick17k 3230 + DDI 656);48 个临床概念 + 1 个质控标签(“Do not consider this image”)。

B. 数据与获取

Q7:我现在能下载到什么?
SkinCon 的概念标注文件(Fitzpatrick17k 版与 DDI 版两套);图像本体需分别去 Fitzpatrick17k 官网与 DDI 官网自取。

Q8:为什么图像要另取?
因为 SkinCon 不持有图像版权,只发布叠加其上的标注;图像权利归两源各自所有(科研非商业)。

Q9:有 HuggingFace / Zenodo 官方镜像吗?
抓取时点在 HF 主站与 hf-mirror 均未发现官方镜像;第三方转载页非官方,勿作数据源。

Q10:标注文件的许可是什么?
官方页与论文未单独声明标注文件 SPDX;图像为科研非商业。再分发/商用边界待回源确认(坑 7)。

Q11:项目主页地址?
https://skincon-dataset.github.io/ (论文 §6 写作 https://SkinCon-dataset.github.io)。是 http 明文 GitHub Pages,可访问性有波动。

Q12:能商用吗?
图像本体的两源均为科研非商业,直接商用受限;标注文件许可未明。商用项目务必先回源确认。

C. 标注与质量

Q13:标注粒度是什么?
图像级多标签(不是像素级分割):每图勾选"存在哪些概念",可多项。

Q14:谁标注的?
单一 6 年经验皮肤科医生在标准化界面完成全部 3886 张的勾选;概念表由两位皮肤科医生(5 年/6 年)制定。

Q15:质量怎么保证?
两轮验证:323 张(10%)专家抽验,概念一致 97.6%;956 张独立重标,图像合格 94%、总体一致 94%(Fitz 92%/DDI 94%)。

Q16:48 个概念为什么算"稠密"?
因为每张图可携带多个概念(稠密多标签),且覆盖形态/质地/形状/颜色多维度,相比 derm7pt 的约 7 属性丰富得多。

Q17:有 IRB 吗?
没有,论文声明因标注的是公开可得数据。

Q18:为什么有的概念在 DDI 上是 0?
DDI 图像(医院来源、疑似恶性为主)与 Fitzpatrick17k 病种分布差异大,20 余个概念在 DDI 无样本,跨源概念泛化需谨慎。

D. 基准与发现

Q19:PCBM 是什么?
Post-hoc Concept Bottleneck Model(事后概念瓶颈模型),在已训练模型之上构建概念层,使预测可读为"概念→诊断"。

Q20:基准结论是什么?
在 DDI 上 PCBM 总体 AUC 0.639 > DeepDerm 0.595;中肤色段(III-IV)提升最大 0.727 vs 0.632。

Q21:为什么在 DDI 上测?
因为 DeepDerm 训练数据与 Fitzpatrick17k 有泄漏,DDI 提供独立评测场。

Q22:概念权重怎么读?
正权重(Ulcer 1.190、Telangiectasia 1.022)指向恶性;负权重(Patch −0.960、Pustule −0.836)指向良性。

Q23:CAV 实验怎么做的?
用 ≥50 张图的 22 个概念,每概念 50 对正/负样本,留 10 出交叉验证重复 25 次。

Q24:深肤色性能如何?
DDI(V-VI) 两模型 AUC 都偏低(0.528/0.542),反映深肤色皮肤病难分,是公平性痛点。

E. 生态与关系

Q25:它和 Fitzpatrick17k、DDI 什么关系?
宿主关系:SkinCon 是叠加在这两个数据集之上的概念标注层,图像归两源所有。

Q26:它和 derm7pt 什么关系?
derm7pt 是早期少量属性标注(约 7 属性);SkinCon 在概念粒度上对其升级(48 概念)。

Q27:它和 ISIC 系列什么关系?
互补:ISIC 提供大规模诊断标签,SkinCon 提供小规模概念标签。

Q28:库内还有哪些皮肤病数据集可互链?
fitzpatrick-17k(55)、ddi(171)、ham10000(60)、pad-ufes-20(151)、derm7pt(110)、derm12345(742)、dermacon-in(781)、skincap(782)。

F. 复现与工程细节

Q29:基准用什么硬件?
单卡 NVIDIA Titan Xp GPU;代码随论文补充材料发布。

Q30:PCBM 方法出处?
Yuksekgonul et al. 2022, arXiv:2205.15480(SkinCon 作者之一为共同作者)。

Q31:怎么把标注和图像对齐?
按两源各自的 image id 与标注行对应;须先持有对应源图像。

Q32:要做概念探测从哪开始?
用 §5.4 的协议(≥50 张图的 22 概念、50 对样本、留 10 出 CV),并按 §5.3 权重解读结果。

事实清单(硬事实 50 条)

  1. SkinCon 全称 “SkinCon: A skin disease dataset densely annotated by domain experts for fine-grained model debugging and analysis”。
  2. 出品机构:斯坦福大学(皮肤科 × 计算机科学系 × 生物医学数据科学系)。
  3. 作者:Roxana Daneshjou、Mert Yuksekgonul(共同一作,∗Equal Contribution)、Zhuo Ran Cai、Roberto Novoa、James Zou。
  4. 通讯邮箱集合:{roxanad, merty, zrcai, rnovoa, jamesz}@stanford.edu。
  5. 发表:NeurIPS 2022 Datasets and Benchmarks Track(第 36 届 NeurIPS 数据集与基准赛道)。
  6. arXiv 预印本:arXiv:2302.00785,[v1] 提交于 2023-02-01 22:39:51 UTC,cs.CV 分类。
  7. DOI(arXiv):10.48550/arXiv.2302.00785。
  8. 总图像数:3886 = Fitzpatrick17k 子集 3230 + DDI 子集 656(Table 5 脚注)。
  9. 概念总数:48 个临床概念(+1 个质控标签 “Do not consider this image”,Table 5 共 49 行)。
  10. 概念四大维度:形态学原发皮损 / 继发改变与质地 / 形状 / 颜色。
  11. 概念表制定者:两位临床皮肤科医生(经验 5 年与 6 年)。
  12. 主标注者:单一皮肤科医生,经验 6 年。
  13. 第一轮验证:board-certified 皮肤科专家抽验 323 张(10% Fitzpatrick17k),概念一致 1056/1082 = 97.6%。
  14. 第二轮验证:DDI 全部 656 + Fitzpatrick17k 随机 300 = 956 张独立重标;图像合格率 94%;总体一致率 94%(Fitz 92% / DDI 94%)。
  15. 独立验证者:两位皮肤科医生,经验 12 年与 5 年。
  16. 论文声明无 IRB(标注公开可得数据)。
  17. 概念频率最高(Fitzpatrick17k):Erythema 2139、Plaque 1967、Papule 1170。
  18. 概念频率最高(DDI):Papule 410、Brown 363、Erythema 235。
  19. DDI 上为 0 的概念(部分):Vesicle/Abscess/Pustule/Bulla/Excoriation/Purpura/Fissure/Induration/Xerosis/Sclerosis/Flat topped/Blue/Poikiloderma/Salmon/Wheal/Acuminate/Burrow/Gray/Cyst。
  20. 质控标签计数:Fitzpatrick17k 460 张、DDI 20 张。
  21. Table 1 肤色分布(Fitzpatrick17k):FST I-II 1738 / III-IV 1350 / V-VI 467 / Unknown 135,合计 3690 ≠ 3230(坑 5)。
  22. Table 1 肤色分布(DDI):FST I-II 208 / III-IV 241 / V-VI 207,合计 656(自洽)。
  23. "≥50 张图的概念"三口径:22(Fitz 单独)/ 25 / 28(combined)——论文内部不自洽(坑 3)。
  24. 基线模型:DeepDerm(Inceptionv3,Esteva et al. 2017 数据训练,二分类 benign/malignant)。
  25. 数据泄漏声明:DeepDerm 训练数据与 Fitzpatrick17k 有泄漏,全部测试在独立 DDI 上。
  26. PCBM 结果(DDI 总体):DeepDerm 0.595 vs PCBM 0.639±0.001。
  27. PCBM 结果(DDI I-II):0.649 vs 0.643±0.002。
  28. PCBM 结果(DDI III-IV):0.632 vs 0.727±0.002(提升最大)。
  29. PCBM 结果(DDI V-VI):0.528 vs 0.542±0.002。
  30. 概念权重(正/恶性):Ulcer 1.190、Telangiectasia 1.022、Black 0.746、Purple 0.489、Friable 0.307。
  31. 概念权重(负/良性):Patch −0.960、Pustule −0.836、Scar −0.711、Dome-shaped −0.130。
  32. 概念探测(CAV):用 ≥50 张图的 22 概念,每探针 50 对正/负样本,留 10 出 CV 重复 25 次。
  33. PCBM 训练/测试切分:Fitzpatrick17k 未用于概念标注的图像,训练 2787(80%)/ 测试 697(20%)。
  34. 计算硬件:单卡 NVIDIA Titan Xp GPU;代码随论文补充材料发布。
  35. PCBM 方法出处:Yuksekgonul et al. 2022, arXiv:2205.15480。
  36. 项目主页:http://skincon-dataset.github.io/ (论文 §6 引 https://SkinCon-dataset.github.io)。
  37. 图像许可:Fitzpatrick17k 与 DDI 均"科研、非商业用途"(scientific, non-commercial)。
  38. 标注文件许可:官方页与论文未单独声明 SPDX(待核)。
  39. 无官方 HuggingFace / Zenodo 镜像(抓取时点)。
  40. 同名撞库对象:SkinCON/DRAPS(Ren et al., MICCAI 2024, UC Berkeley 等,基于 ISIC 2019,约 25331 张 / 937167 判断 / 10509 参与者,站点 https://skincon.github.io/ )。
  41. 概念表四大维度:原发皮损 11 项 / 继发改变与质地 14 项 / 形状 8 项 / 颜色 11 项 / 其他结构性 4 项 = 48 项。
  42. 质量控制标签计数:Fitzpatrick17k 460 张、DDI 20 张(Table 5 第 49 行)。
  43. 论文图 2b 给出 Fitzpatrick17k 子集的"每图概念数分布"(稠密多标签证据)。
  44. 论文图 3 给出"用概念解释一次漏判"的案例(缺 telangiectasia/ulcer/friable)。
  45. SkinCon 使用的两源图像许可口径原文:both of these datasets are available for scientific, non-commercial use。
  46. 论文明确"无 IRB"(标注公开可得数据),伦理基础建立在两源公开性之上。
  47. 两源概念谱错配:DDI 上 20 余概念为 0,跨源概念泛化须先看覆盖率。
  48. 概念监督可跨病种迁移,对罕见皮肤病的数据效率有潜在价值。
  49. 复现时的对齐依赖两源 image id;Fitzpatrick17k 子集为随机抽样去噪后的 3230 张,DDI 为全量 656 张。
  50. 剔除低质量图像后有效样本少于 3886(Fitz 减 460、DDI 减 20 的量级)。

术语表(30 条)

术语 释义
SkinCon 斯坦福团队对 Fitzpatrick17k + DDI 的 48 临床概念稠密标注数据集(本条目)
Concept(概念) 可通过图像观察判断存在的临床皮损描述项,如红斑、溃疡、鳞屑
Dense annotation(稠密标注) 每张图携带多个标签的标注方式(区别于单标签)
Multi-label(多标签) 一张图可同时属于多个概念类别,标签不互斥
原发皮损(primary morphology) 皮肤病最初出现的皮损形态(丘疹、斑块、水疱等)
继发改变(secondary change) 皮损演变或搔抓后出现的改变(结痂、糜烂、鳞屑、瘢痕等)
Erythema 红斑,SkinCon 中 Fitzpatrick17k 最高频概念(2139)
Papule 丘疹,DDI 中最高频概念(410)
Ulcer 溃疡,PCBM 中指向恶性权重最高的概念(1.190)
Telangiectasia 毛细血管扩张,指向恶性权重 1.022
Patch 斑(平坦色变区),指向良性权重 −0.960
Pustule 脓疱,指向良性权重 −0.836
Fitzpatrick17k 含 Fitzpatrick 肤色标注的皮肤病图像数据集(SkinCon 主源,3230 张)
DDI(Diverse Dermatology Images) 皮肤科多样性图像集(SkinCon 验证源,656 张;Daneshjou et al. 2022)
Fitzpatrick skin type(FST) 皮肤类型分档(I-VI),I-II 白皮肤、III-IV 橄榄/浅棕、V-VI 深棕/黑
PCBM Post-hoc Concept Bottleneck Model,事后概念瓶颈模型
CBM Concept Bottleneck Model,概念瓶颈模型
CAV Concept Activation Vector,概念激活向量
CCE Concept-based Counterfactual Explanation,基于概念的反事实解释
Concept probing 用线性探针检验模型表征是否编码某概念
Slice discovery 按子群(概念/肤色)切分数据以定位模型系统性失效
Slice(切片) 数据的一个子群(如某概念子集、某肤色段)
DeepDerm 基线皮肤诊断模型(Inceptionv3,Esteve et al. 2017 数据)
Inceptionv3 经典 CNN 架构,DeepDerm 的骨干
AUC ROC 曲线下面积,二分类性能指标
Benign / Malignant 良性 / 恶性(本数据集的诊断二分类)
数据泄漏(data leakage) 测试数据混入训练数据,导致性能高估
board-certified 经专业认证的(皮肤科)执业医师
观察者间变异 不同标注者对同一图像判断不一致的程度
IRB 机构审查委员会(伦理审查);本数据集声明无 IRB
SPDX 软件/数据许可的标准标识符;标注文件未声明

附录

附录 A:条目信息速查卡

项 值
条目名 SkinCon
url_name skincon
类型 概念标注数据集 + 方法论文 + 可解释性基准(三合一)
论文 NeurIPS 2022 D&B Track;arXiv:2302.00785
机构 Stanford University(皮肤科/CS/生物医学数据科学)
规模 3886 张(3230 + 656)× 48 概念
获取 标注经项目主页;图像经两源官网
许可 图像科研非商业;标注未明
库内互链 fitzpatrick-17k(55)、ddi(171)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 论文开放获取、NeurIPS 收录;但"SkinCon"名易与 SkinCON/DRAPS 撞库,且素材依附两源
A 可获取性 5 概念标注可下载,但图像须回两源官网另取、且受科研非商业约束;无官方镜像——核心失分项
I 可互操作 6 概念标注为表格/CSV,须自行按 image id 与两源图像对齐;无官方统一加载工具
M 元数据质量 7 概念表(Table 5)、肤色分布(Table 1)、基准(Table 2/3)齐全;但 Table 1 与子集数不自洽(坑 5)、≥50 概念三口径冲突(坑 3)降分
S 可持续性 6 依托 GitHub Pages(主页)与两源官网,长期可访问性中等;无官方镜像与版本体系
综合评级 6.2/10(中上) 方法学与专家标注质量高于均值;可获取性被"三入口"与许可约束拖低

附录 C:逐项证据链自证

关键数字 来源 位置
3886 = 3230 + 656 论文 Table 5 脚注 arXiv/NeurIPS 全文
48 概念 + 质控标签 论文 Table 5 全文
一致性 1056/1082=97.6% 论文验证节 全文
独立重标 94%(Fitz 92/DDI 94) 论文验证节 全文
PCBM 0.639 vs DeepDerm 0.595 论文 Table 2 全文
DDI(III-IV) 0.727 vs 0.632 论文 Table 2 全文
概念权重 Ulcer 1.190 / Patch −0.960 论文 Table 3 全文
肤色分布 1738/1350/467/135 论文 Table 1 全文
无 IRB 声明 论文方法节 全文
图像科研非商业 论文数据节 全文
项目主页 论文 §6 Conclusions 全文

附录 D:数据获取决策树

需求是什么?
├── 只想做概念瓶颈/可解释实验
│   ├── 1) 项目主页下载 SkinCon 概念标注(Fitz 版 + DDI 版)
│   ├── 2) Fitzpatrick17k 官网取 3230 张图
│   ├── 3) DDI 官网取 656 张图
│   └── 4) 按 image id 对齐后训练/评测 CBM
├── 只想引用"可解释不牺牲性能"论点
│   └── 引论文 Table 2(0.639 vs 0.595)+ Table 3 概念权重,注明测试在 DDI
├── 只想做皮肤 AI 公平性
│   └── 用 Table 1 肤色分层,先核对口径(坑 5),结合 DDI(V-VI) 低分现象
└── 想复现专家概念标注流程
    └── 读论文方法节 + 附录 F 骨架;冻结概念表 + 双轮验证

附录 E:概念维度与临床意义映射

维度 代表概念 临床意义 模型用法
原发皮损 Papule/Plaque/Vesicle 病变基础形态 概念探测基础
继发改变 Crust/Scale/Erosion 病程/搔抓后改变 解释恶性关联(Ulcer)
形状 Pedunculated/Warty/Dome-shaped 病变轮廓 良性指向(Dome-shaped)
颜色 Erythema/Brown/Black/Purple 色素与血管特征 恶性指向(Black/Purple)
质控 Do not consider this image 图像可用性 数据清洗

附录 F:专家概念标注流程复现骨架(SOP 模板)

阶段 0 概念表制定(冻结)
  - 2 位以上临床专家依据教科书+实践提炼概念
  - 定义每个概念的可观察判据,形成固定词汇表(schema 冻结)
阶段 1 界面实现
  - 标注界面:展示候选概念,逐图勾选(多选)
  - 验证界面:展示已标概念,逐项确认/否定
阶段 2 大规模标注(单一标注者保一致性)
  - 分配全部图像;标注者只看图与概念表
阶段 3 双轮验证
  - 轮 1:专家小样本抽验(测认可度,如 10%)
  - 轮 2:独立标注者大样本重标(测可复现性,含跨源)
阶段 4 出厂
  - 统计每概念频率、每图概念数分布
  - 标注图像质量标签(Do not consider this image)
  - 输出概念标注表 + 验证记录

附录 G:PCBM 评估骨架(代码)

# 事后概念瓶颈模型(PCBM)评估骨架(示意,非官方代码)
# 1) 用概念标注训练概念预测头(多标签)
concept_head = train_multilabel(features_train, concepts_train)

# 2) 用预测概念训练 benign/malignant 头
#    只使用"未用于概念标注"的 Fitzpatrick17k 切分(论文:2787 train / 697 test)
import numpy as np
pred_concepts = concept_head.predict(features_fitz_train)
diagnosis_head = train_binary(pred_concepts, labels_fitz_train)

# 3) 在独立 DDI 上测试(规避泄漏)
pred_concepts_ddi = concept_head.predict(features_ddi)
auc_pcbm = roc_auc_score(labels_ddi, diagnosis_head.predict_proba(pred_concepts_ddi))

# 4) 概念权重:读 diagnosis_head 的线性系数
concept_weights = dict(zip(concept_names, diagnosis_head.coef_[0]))
# 正权重指向 malignant(如 Ulcer 1.190),负权重指向 benign(如 Patch -0.960)

附录 H:同名撞库对照表(SkinCon vs SkinCON/DRAPS)

维度 SkinCon(本条目) SkinCON / DRAPS
机构 Stanford University UC Berkeley 等
论文 NeurIPS 2022 D&B MICCAI 2024
图像源 Fitzpatrick17k + DDI ISIC 2019
规模 3886 张 约 25331 张
标签 48 临床概念(多标签) 937167 条诊断判断 / 10509 参与者
任务 概念调试、可解释性 诊断判断 / 不确定性预测
站点 skincon-dataset.github.io skincon.github.io

附录 I:概念频率(Table 5)抽样登记

概念 Fitzpatrick17k DDI
Erythema 2139 235
Plaque 1967 —
Papule 1170 410
Brown — 363
Pustule 若干 0
Vesicle 若干 0
Ulcer 若干 若干

说明:完整 48 概念 × 2 源的逐项计数见论文 Table 5;本表仅登记已知高低频锚点,避免转述误差。

附录 J:双口径登记表

事项 口径 A 口径 B 处理
发表年 2022(NeurIPS 会议) 2023(arXiv 2023-02-01) 引用定口径、全篇一致(坑 2)
图像数 3886(精确加总) “近 4000”(第三方) 以 3886 为准(坑 4)
≥50 概念数 22(Fitz 单独)/ 28(combined DDI) 25(combined Fitz) 三口径存照,标出处(坑 3)
Fitz 肤色合计 3690(Table 1) 3230(子集数) 不自洽,须核口径(坑 5)
概念数 48(概念) 49(Table 5 行) 48 概念 + 1 质控(坑 6)
Σ 站点名 skincon-dataset.github.io SkinCon-dataset.github.io 大小写差异,同一站点

附录 K:库内皮肤病数据集互链表(含 rid)

url_name rid 与 SkinCon 的关系
fitzpatrick-17k 55 直接上游(主标注对象)
ddi 171 直接上游(外部验证子集)
ham10000 60 同域诊断数据集
pad-ufes-20 151 同域临床图像集
derm7pt 110 早期属性标注(历史对照)
derm12345 742 同域诊断数据集
dermacon-in 781 同域多模态数据集
skincap 782 同域皮肤图文数据集
isic-archive 56 同域大体量图像集
isic-2018 710 同域(与同名撞库对象有关)
isic-2019 707 同域(SkinCON/DRAPS 的图像源)
isic-2020 715 同域
oai — 跨域概念数据集(18 概念,方法对照)

附录 L:引文规范

@inproceedings{daneshjou2022skincon,
  title     = {SkinCon: A skin disease dataset densely annotated by domain experts
               for fine-grained model debugging and analysis},
  author    = {Daneshjou, Roxana and Yuksekgonul, Mert and Cai, Zhuo Ran
               and Novoa, Roberto and Zou, James},
  booktitle = {Advances in Neural Information Processing Systems 35
               (NeurIPS 2022), Datasets and Benchmarks Track},
  year      = {2022}
}

引用图像时另引两源:Fitzpatrick17k(Daneshjou et al. 2022)与 DDI(Daneshjou et al. 2022, Science Advances)。

附录 M:缩写速查

缩写 全称
CBM Concept Bottleneck Model
PCBM Post-hoc Concept Bottleneck Model
CAV Concept Activation Vector
CCE Concept-based Counterfactual Explanation
DDI Diverse Dermatology Images
FST Fitzpatrick Skin Type
AUC Area Under the ROC Curve
IRB Institutional Review Board
D&B Datasets and Benchmarks (Track)

附录 N:本条目生产档案

项 值
url_name skincon
生产代理 agent-b-skincon
锁文件 writing/skincon/.lock
事实档案 writing/skincon/FACTS.md
一手来源 arXiv:2302.00785(PDF 全文)、NeurIPS 2022 proceedings、项目主页、第三方索引
存在性核验 三源互证(arXiv + 官方站点 + 第三方索引)
同名排除 SkinCON/DRAPS(MICCAI 2024)经机构/规模/任务三重比对排除

附录 O:48 概念按维度的完整登记(对照 Table 5)

维度 概念数 概念清单(英文)
形态学原发皮损 11 Vesicle, Papule, Macule, Plaque, Abscess, Pustule, Bulla, Patch, Nodule, Ulcer, Cyst
继发改变与质地 14 Crust, Erosion, Excoriation, Atrophy, Exudate, Purpura/Petechiae, Fissure, Induration, Xerosis, Telangiectasia, Scale, Scar, Friable, Sclerosis
形状 8 Pedunculated, Exophytic/Fungating, Warty/Papillomatous, Dome-shaped, Flat topped, Umbilicated, Acuminate, Burrow
颜色 11 Brown, Translucent, White, Purple, Yellow, Black, Erythema, Blue, Salmon, Gray, Pigmented
其他/结构性 4 Lichenification, Poikiloderma, Comedo, Wheal
概念合计 48 —
质量控制(不计入) 1 Do not consider this image

说明:上表按维度归类,英文名以论文 Table 5 为准;各概念的逐源计数见附录 I 与论文原表。

附录 P:验证协议对照表

轮次 验证者 经验 样本 规模 结果
第一轮 board-certified 皮肤科专家 — Fitzpatrick17k 抽验 323 张(10%) 概念一致 1056/1082 = 97.6%
第二轮 两位独立皮肤科医生 12 年 / 5 年 DDI 全部 + Fitz 随机 300 956 张 图像合格 94%;总体一致 94%(Fitz 92% / DDI 94%)

附录 Q:PCBM 结果登记表(论文口径)

测试子群 DeepDerm AUC PCBM AUC 差值
DDI 总体 0.595 0.639±0.001 +0.044
DDI (I-II) 0.649 0.643±0.002 −0.006
DDI (III-IV) 0.632 0.727±0.002 +0.095
DDI (V-VI) 0.528 0.542±0.002 +0.014

附录 R:概念权重登记表(论文 Table 3)

概念 权重 指向
Ulcer 1.190 Malignant
Telangiectasia 1.022 Malignant
Black 0.746 Malignant
Purple 0.489 Malignant
Friable 0.307 Malignant
Patch −0.960 Benign
Pustule −0.836 Benign
Scar −0.711 Benign
Dome-shaped −0.130 Benign

附录 S:检索关键词组合示范

精确找本条目:
  "SkinCon" AND ("concept" OR "fine-grained model debugging")
  "SkinCon" AND ("Stanford" OR "Daneshjou")
  site:arxiv.org 2302.00785

排除同名撞库:
  排除 "SkinCON" / "DRAPS" / "MICCAI 2024" / "ISIC 2019" / "uncertainty"

找下游用法:
  "SkinCon" AND ("concept bottleneck" OR "CAV" OR "PCBM")
  "SkinCon" AND ("Fitzpatrick17k" OR "DDI")

附录 T:常见误用与纠正

误用 纠正
把"近 4000 张"当硬数字 用 3886(3230+656),坑 4
把 SkinCon 当作 SkinCON/DRAPS 机构/规模/任务三重区分,坑 1
把质控标签算作第 49 个概念 48 概念 + 1 质控,坑 6
用 Table 1 肤色比例直接除以 3230 口径不自洽,先核对,坑 5
以为下载标注就拿到了图像 图像须回两源官网另取,坑 8
把"科研非商业"当作可商用 商用须回源确认,坑 7
用单标签准确率评估 应用多标签指标(每概念 AUC 等)

附录 U:AI-Ready 检查单

检查项 状态
数据集真实存在(三源互证) ✅ arXiv + 官方站点 + 第三方索引
slug 无撞库 ✅ 库内仅 skincap 含 “skin”,无 skincon
许可明确 ⚠️ 图像科研非商业;标注文件未单独声明(待核)
获取路径明确 ⚠️ 三入口(Fitz/DDI 官网 + 项目主页)
元数据完备 ✅ 概念表 + 肤色 + 基准表齐全
有官方镜像 ❌ 抓取时点无 HF/Zenodo 官方镜像
可复现评测 ✅ 基准协议与代码随论文发布

附录 V:缩写与全称对照(补充)

缩写 全称
DDI Diverse Dermatology Images
FST Fitzpatrick Skin Type
D&B Datasets and Benchmarks (Track)
SLA 参考金标准条目 panda-plus 的结构(本条目遵循同一规范)

附录 W:与金标准条目(panda-plus)的结构对照

结构要素 panda-plus skincon(本条目)
九节事实档案 ✅ FACTS.md ✅ FACTS.md
INFOBOX 一屏速览 ✅ ✅
§0-§11 章节 ✅ ✅(含 §10A 深化)
坑点 ≥5 ✅(8 个) ✅(8 个 + 速查表 + 三类共性)
DAIMS 全表 ✅ ✅(附录 B)
事实清单 ✅ ✅(50 条)
术语表 ✅ ✅(30 条)
FAQ ✅ ✅(32 问)
附录 A-Z ✅ ✅(A-W)
尾注 ✅ ✅

附录 X:本条目与同名集的"一句话划界"

如果你要的是"给皮肤图像打 48 个临床概念标签、做概念瓶颈模型",那是本条目的 SkinCon(斯坦福,3886 张)。如果你要的是"评估模型对皮肤病的诊断不确定性/判断一致性",那是 SkinCON/DRAPS(UC Berkeley,ISIC 2019,25331 张)。

附录 Y:概念探测 vs 概念瓶颈对照

维度 概念探测(CAV) 概念瓶颈(CBM/PCBM)
是否改模型结构 否 是(插入概念层)
概念标签用途 训练探针 训练概念头
输出 概念可分性分数 概念预测 + 诊断
本论文用法 22 概念、50 对样本、留 10 出 CV DDI 上测 AUC 0.639 vs 0.595
适合问题 “模型学没学到这个概念” “用概念做诊断好不好”

附录 Z:采集与标注成本对比

环节 成本量级 说明
图像采集 未发生(借用两源) SkinCon 的"零采集"设计
概念表制定 2 位专家 × 少量时间 一次性的 schema 冻结
大规模标注 1 位专家 × 3886 张 每张数秒至数十秒的勾选判断
双轮验证 1 位专家(323 张)+ 2 位专家(956 张) 抽验 + 独立重标

附录 AA:使用 SkinCon 的研究检查清单(10 项)

  1. 是否明确区分了 SkinCon(概念标注)与两源(图像)的引用?
  2. 是否从两源官网正确获取了对应图像并按 image id 对齐?
  3. 是否处理了 “Do not consider this image” 低质量标签?
  4. 多标签评估是否用了概念级指标而非单标签准确率?
  5. 概念数口径(22/25/28)是否在文中说明?
  6. 肤色分层(Table 1)口径是否核对(3690 vs 3230)?
  7. 测试是否放在独立集(DDI)以避免泄漏?
  8. 是否报告了深肤色段(V-VI)的亚组结果?
  9. 商用/再分发前是否回源确认标注文件许可?
  10. 是否核查过没有把 SkinCON/DRAPS 的结果误引为本条目?

尾注

  1. 本条目所有硬数字均出自 arXiv:2302.00785 与 NeurIPS 2022 Datasets and Benchmarks Track 论文正文与表格;转述性数字按双口径登记表处理。
  2. 论文内部不自洽处(Table 1 肤色分布、≥50 概念数)已在坑 3、坑 5 明确存照,未做主观调和。
  3. “SkinCon” 与 “SkinCON/DRAPS” 的同名撞库风险贯穿检索与引用全程,见坑 1 与附录 H。
  4. 项目主页可访问性在抓取时点存在波动,标注下载链接以人工复核为准(§6.3)。
  5. 本条目为千方病案医数集 AI-Ready Wikipedia 条目,遵循库内九节事实档案 + 金标准条目的结构规范。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • derm12345 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • ph2 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
  • ddi — 共享标签:医学影像 / 皮肤影像 / 评测基准 / 皮肤癌
  • dermacon-in — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • bcn20000 — 共享标签:医学影像 / 皮肤影像 / 皮肤癌
  • isic-2018 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
  • fitzpatrick-17k — 共享标签:医学影像 / 皮肤影像 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集