信息速览
INFOBOX — SkinCon 一屏速览
维度 内容 本质 对两个既有皮肤病数据集的概念级(concept-level)稠密重标注(非新采集图像、非竞赛) 团队 斯坦福大学(Stanford University)皮肤科 × 计算机科学 × 生物医学数据科学三系 论文 NeurIPS 2022 Datasets and Benchmarks Track;arXiv:2302.00785(2023-02-01 上线) 数据 3886 张 = Fitzpatrick17k 子集 3230 + DDI 子集 656(Table 5 脚注真值) 概念 48 个临床概念(+ 1 个质控标签 “Do not consider this image”)多标签逐图勾选 标注者 建表:两位皮肤科医生(5 年 / 6 年经验);标注:单一 6 年经验皮肤科医生 验证 抽验 323 张(10%):概念一致 1056/1082 = 97.6%;956 张独立重标:图像合格 94%、总体一致 94%(Fitz 92% / DDI 94%) 用途 概念探测(probing)、概念瓶颈模型(CBM/PCBM)、基于概念的事后解释(CAV/CCE)、错误分析与切片发现 基准结果 DDI 上 PCBM AUC 0.639 vs 原始 DeepDerm 0.595;DDI(III-IV) 提升最大 0.727 vs 0.632 概念权重 指向恶性:Ulcer 1.190、Telangiectasia 1.022;指向良性:Patch −0.960、Pustule −0.836 获取 标注文件经项目主页分发;图像本体须回 Fitzpatrick17k 与 DDI 官网自取 许可 图像科研非商业(两源);标注文件许可未单独声明(待核) 库内互链 fitzpatrick-17k(上游主源)、ddi(上游第二源)、ham10000、pad-ufes-20、derm7pt 等 同名警示 不等于 SkinCON/DRAPS(MICCAI 2024,ISIC 2019,25331 张)——见 §10 坑 1
SkinCon 是一个"不拍新照片、只贴新标签"的数据集工程:它把斯坦福团队自己参与构建的两个皮肤病公开图像集——Fitzpatrick17k 与 Diverse Dermatology Images(DDI)——从"一张图一个诊断"升级为"一张图几十个临床概念"。它请两位皮肤科医生从皮肤病学教科书与临床实践中提炼出 48 个可用于描述皮损的概念(红斑、丘疹、斑块、鳞屑、溃疡、色素沉着、毛细血管扩张……),再由一位皮肤科医生在标准化界面上把 3886 张图像逐一勾选一遍。这一层概念标注让研究者可以不再只问"模型判断对了吗",而能问"模型是看见了哪个皮损特征才这样判断的"——这正是概念瓶颈模型(CBM)与概念激活向量(CAV)等可解释方法所需的监督信号。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——先记住 SkinCon 只发标注文件,图像本体要去 Fitzpatrick17k 与 DDI 两个官网自取,别指望一次下载拿全。
- 关心可解释性与调试:直奔 §4 任务与标注体系 + §5 评估与基准——48 概念表、双轮验证数字、PCBM/CAV 结果三段连读。
- 做皮肤病 AI 与公平性:直奔 §2 数据构成——Fitzpatrick 肤色分层是全条目的公平性背景,但要注意 Table 1 与子集总数不自洽(坑 5)。
§0 导读:这个数据集解决什么问题
皮肤病学 AI 长期面临一个结构性尴尬:模型在"这张图是什么病"的分类任务上做到甚至超过部分医生水平,但被问"你凭什么这么判"时只能给出一个概率值。在医疗场景里,可解释性不是锦上添花——医生需要知道模型是否在关注真正的病灶特征(比如溃疡、毛细血管扩张),还是抓了"图像来自哪台设备、哪家医院"这类伪相关。要训练和评测这类"基于概念的解释"方法,就必须有图像到临床概念的监督。而公开的皮肤病图像集(ISIC、HAM10000、Fitzpatrick17k 等)几乎都只有图像级诊断标签,概念级信息稀缺——此前较系统的概念数据集(如 derm7pt)也只覆盖少数属性。
SkinCon 的回答是"用专家知识补上概念这一层"。它做了三件事。第一件是建概念表:两位临床皮肤科医生依据皮肤病学知识,整理出 48 个可用于描述皮损状态的概念,覆盖形态学原发皮损(水疱、丘疹、斑块……)、继发性改变与质地(结痂、糜烂、鳞屑、硬化……)、形状(带蒂、疣状、穹顶状……)、颜色(褐色、白色、紫、黄、黑、红斑……)等维度。第二件是密集标注:一位 6 年经验的皮肤科医生在标准化界面里,对 Fitzpatrick17k 子集 3230 张与 DDI 子集 656 张,逐图勾选"图中存在哪些概念",形成稠密多标签。第三件是验证与基准:用一轮 10% 抽样(323 张,概念一致率 97.6%)和一轮 956 张独立重标(图像合格率与总体一致率均 94%)为标注质量背书,并在 DDI 上跑通概念瓶颈模型 PCBM,证明"可解释的模型至少不差、有时更好"。
§0 读法三则:
- 这个条目是"概念标注数据集 + 方法论文 + 可解释性基准"三合一:本体是 3886 张图的 48 概念标签,副产品是双轮验证协议与 PCBM/CAV 基准,三者共用同一套概念体系。
- 全文统计数字均出自论文正文与表格;论文内部唯一明显不自洽处(Table 1 的 Fitzpatrick17k 肤色三档合计 3690 ≠ 子集 3230)已在坑 5 存照。
- 检索时务必区分 SkinCon(斯坦福,本条目) 与 SkinCON/DRAPS(UC Berkeley,MICCAI 2024,基于 ISIC 2019 的 25331 张不确定性标注)——名字只差大小写与连字符,但作者、机构、图像源、任务全然不同(坑 1)。
0.1 一句话定位与三个必记数字
一句话:SkinCon 是把皮肤病 AI 的"黑箱诊断"拆成"图像 → 临床概念 → 诊断"两段式可解释结构的基石数据集——它不拍图,只给近 3900 张已公开的皮肤病图像加上 48 个临床概念的稠密标签。
三个必记数字:
| 数字 | 含义 | 出处 |
|---|---|---|
| 3886 | 图像总数(Fitzpatrick17k 3230 + DDI 656) | 论文 Table 5 脚注 |
| 48 | 临床概念数(另有 1 项质控标签不计入) | 论文摘要与 Table 5 |
| 97.6% | 专家抽验 323 张的概念一致率(1056/1082) | 论文 §2.3 验证 |
同类"必记"还有:PCBM 在 DDI 上 AUC 0.639 vs 黑箱 DeepDerm 0.595;独立重标一致率 94%;概念权重最高者 Ulcer 1.190。
0.2 为什么它值得单独成条
本库已收录 Fitzpatrick17k(rid 55)、DDI(rid 171)、ISIC 系列、HAM10000、derm7pt 等皮肤病数据集,SkinCon 的独特价值不在图像(它不提供新图像),而在概念标注层:它是这组数据集里唯一提供"48 维临床概念监督"的一个,面向的是"可解释 AI / 概念瓶颈 / 模型调试"这一整类此前在皮肤病域缺乏公开数据支撑的研究方向。没有它,"皮肤病 AI 能不能说清自己为什么这么判"这个问题就缺少标准实验素材。
§1 数据集速览:十问十答
Q1:SkinCon 的"3886 张"从哪来?
不是新采集,而是对两个已公开数据集的子集重标注:Fitzpatrick17k 贡献 3230 张、Diverse Dermatology Images(DDI)贡献 656 张,合计 3886 张(论文 Table 5 脚注原文 “In total, we have 3230 + 656 = 3886 images.”)。SkinCon 的增量不是图像,而是叠加在这两类图像之上的概念标签。
Q2:48 个概念都包括什么?
覆盖四大类:形态学原发皮损(Vesicle 水疱、Papule 丘疹、Macule 斑疹、Plaque 斑块、Pustule 脓疱、Nodule 结节、Ulcer 溃疡等)、继发性改变与质地(Crust 结痂、Erosion 糜烂、Scale 鳞屑、Scar 瘢痕、Telangiectasia 毛细血管扩张、Induration 硬结等)、形状(Pedunculated 带蒂、Exophytic/Fungating 外生/蕈样、Warty/Papillomatous 疣状、Umbilicated 脐凹状等)、颜色(Brown 褐色、White 白色、Purple 紫、Yellow 黄、Black 黑、Erythema 红斑、Blue 蓝、Salmon 鲑鱼色、Gray 灰等)。另有 1 个质控标签 “Do not consider this image” 不计入 48 之数。
Q3:标注粒度是什么?
图像级多标签(image-level multi-label),不是像素级分割。标注者看到候选概念描述词,对每张图勾选"图中存在哪些";同一张图可同时携带多个概念,因此标签是稠密而非独占的。
Q4:谁标注的,可靠吗?
建概念表的是两位临床皮肤科医生(分别有 5 年与 6 年经验);实际标注由单一 6 年经验的皮肤科医生在标准化界面完成。质量背书来自两轮验证:第一轮由一位 board-certified 皮肤科专家抽验 323 张 Fitzpatrick17k 图像(10%),概念标注一致 1056/1082 = 97.6%;第二轮对 DDI 全部 656 张 + Fitzpatrick17k 随机 300 张共 956 张独立重标,图像质量合格率 94%,标签总体一致率 94%(Fitzpatrick 92% / DDI 94%)。
Q5:为什么要做概念标注?
为了让皮肤病 AI 可解释、可调试。有了概念监督,就能训练/评估概念瓶颈模型(CBM)——模型先预测概念、再由概念预测诊断,从而把"决策理由"显式化;也能用概念激活向量(CAV)做错误分析与切片发现(slice discovery),定位模型在哪些概念上系统性出错。
Q6:论文的基准实验测了什么?
在完全独立的 DDI 上测试(规避与 Fitzpatrick17k 的数据泄漏):把事后概念瓶颈模型 PCBM 与基线 DeepDerm(Inceptionv3,Esteva 2017 数据训练)对比。结果 PCBM 在 DDI 总体 AUC 0.639 优于 DeepDerm 的 0.595,在深肤色段 DDI(III-IV) 提升最大(0.727 vs 0.632),说明"可解释"与"高性能"在此时并不冲突。
Q7:概念权重说明了什么?
论文 Table 3 给出概念对 benign/malignant 的指向性权重:Ulcer(1.190)、Telangiectasia(1.022)、Black(0.746)等正权重概念指向恶性;Patch(−0.960)、Pustule(−0.836)、Scar(−0.711)等负权重概念指向良性。这为"模型为什么判恶性"提供了可读的解释。
Q8:它和 Fitzpatrick17k、DDI 是什么关系?
SkinCon 是"寄生"在两者之上的概念层:图像本体归 Fitzpatrick17k(Groh et al. 2021,CVPR)与 DDI(Daneshjou et al. 2022, Science Advances)所有,图像各自从原官网获取;SkinCon 只发布在此之上的概念标注。引用时图像来源与标注来源应分别著录。
Q9:我现在能拿到什么?
两段拿:先去项目主页(https://skincon-dataset.github.io/ )下载 SkinCon 的 Fitzpatrick17k 标注与 DDI 标注文件;图像本体分别去 Fitzpatrick17k 官网与 DDI 官网按各自的科研非商业条款获取。注意论文 §6 引的是 https://SkinCon-dataset.github.io(大小写),站点抓取时点存在可访问性波动(见 §9)。
Q10:为什么它对 AI-Ready 重要?
它是"图像-概念"双层结构的代表样本:本体图像受两源许可约束、获取链路较长,SkinCon 的增量(概念标注)却提供了高价值的可解释性监督。这种"图像不由我发、标签比图更值钱"的形态,在库内是少数派,也是标注经济学的一个活案例。
1.5 速览补充:一张表看懂 SkinCon 的定位
| 问题 | 一句话答案 |
|---|---|
| 它是什么 | 对两个既有皮肤病图像集的概念级重标注(不是新图像集、不是竞赛) |
| 它多大 | 3886 张(3230 + 656)× 48 临床概念(+1 质控标签) |
| 谁做的 | 斯坦福(皮肤科/CS/生物医学数据科学),Daneshjou & Yuksekgonul 等 |
| 什么时候 | NeurIPS 2022(会议)/ arXiv:2302.00785(2023-02-01) |
| 标注多可靠 | 专家抽验 97.6% 一致 + 独立重标 94% 一致 |
| 有什么用 | 概念瓶颈模型、概念探测、概念级错误分析与切片发现 |
| 基准结论 | DDI 上 PCBM 0.639 > DeepDerm 0.595(可解释不牺牲性能) |
| 怎么拿 | 标注在项目主页;图像在 Fitzpatrick17k / DDI 官网(三入口) |
| 许可 | 图像科研非商业;标注文件许可未明(待核) |
| 最大风险 | 与 SkinCON/DRAPS(MICCAI 2024)同名撞库 |
1.6 一次读完的关键数字锚点
为便于快速引用,这里把全条目最常被问到的硬数字集中列出(详细出处见后文与附录):
- 3886:总图像数(Fitzpatrick17k 3230 + DDI 656)。
- 48:临床概念数(+1 质控标签)。
- 97.6%:第一轮专家抽验(323 张)的概念一致率(1056/1082)。
- 94% / 92%:第二轮独立重标的一致率(总体 / Fitzpatrick)。
- 0.639 vs 0.595:DDI 上 PCBM vs DeepDerm 的 AUC。
- 0.727 vs 0.632:DDI(III-IV) 段两者的 AUC。
- 1.190 / −0.960:Ulcer / Patch 的概念权重(恶性 / 良性方向)。
- 22 / 25 / 28:论文内部冲突的"≥50 张图概念数"三口径。
1.7 检索与消歧指南(本条目专用)
由于"SkinCon"这个 slug 存在高危同名撞库,检索时建议采用"精确短语 + 身份指纹"的组合策略:
- 精确短语:用双引号锁定
"SkinCon",避免搜索引擎做模糊匹配。 - 加机构指纹:附
Stanford或Daneshjou,把结果压到斯坦福条目上。 - 加任务指纹:附
concept/fine-grained model debugging/PCBM。 - 加图像源指纹:附
Fitzpatrick17k/DDI。 - 反向排除:看到
DRAPS/uncertainty/ISIC 2019/MICCAI 2024/10,509等关键词,即为同名撞库对象,应立即排除。
反向检索(“这是什么数据集”)时,用 3886 或 48 concepts 或 Fitzpatrick17k + DDI 反查,命中率高于直接用名字。
1.8 与"图像级诊断数据集"的本质区别(一图流)
诊断数据集: 图像 ──────────► 疾病类别(一个标签)
(黑箱,不知模型依据)
SkinCon: 图像 ──► 概念集合 ──► 疾病类别
(概念中间层可检视:模型因"溃疡 + 毛细血管扩张"判恶性)
↑ 中间这一层就是 SkinCon 的全部贡献
这一"插入中间层"的思路,是理解 SkinCon 为什么重要、以及它为什么被称作"面向模型调试的数据集"的最简方式。
§2 数据构成与规格
2.1 规模、来源与两源构成
SkinCon 的全部图像均派生自两个已公开的皮肤病学数据集,其增量是叠加其上的概念标注。规模硬数字如下:
| 来源 | 图像数 | 角色 | 原始数据集出品 |
|---|---|---|---|
| Fitzpatrick17k(子集) | 3230 | 主标注对象(含 PCBM 训练/测试切分) | Daneshjou et al. 2022(Fitzpatrick17k 相关) |
| Diverse Dermatology Images(DDI) | 656 | 外部验证子集(跨源泛化测试) | Daneshjou et al. 2022, Science Advances |
| 合计 | 3886 | — | — |
需要强调两点。其一,"3886"是加总真值(论文 Table 5 脚注 “In total, we have 3230 + 656 = 3886 images.”),第三方转述中的 “nearly 4,000 images”(如 Lacuna 索引)是近似说法(坑 4)。其二,SkinCon 不持有图像本体——两源的图像获取方法与许可各自独立,SkinCon 与之只有"标注对齐"关系。引用规范上,图像来源引两源各自论文,概念标注与验证引本论文。
2.2 概念体系:48 个临床概念的四大维度
48 个概念按皮肤病学描述逻辑可分为四组(中文为主、英文首现,全部出自论文 Table 5):
(a)形态学原发皮损(primary morphology)
| 概念(英文) | 中文 | 概念(英文) | 中文 |
|---|---|---|---|
| Vesicle | 水疱/小疱 | Papule | 丘疹 |
| Macule | 斑疹 | Plaque | 斑块 |
| Abscess | 脓肿 | Pustule | 脓疱 |
| Bulla | 大疱 | Patch | 斑 |
| Nodule | 结节 | Ulcer | 溃疡 |
| Cyst | 囊肿 | — | — |
(b)继发性改变与质地(secondary change / texture)
| 概念(英文) | 中文 | 概念(英文) | 中文 |
|---|---|---|---|
| Crust | 结痂 | Erosion | 糜烂 |
| Excoriation | 抓痕 | Atrophy | 萎缩 |
| Exudate | 渗出 | Purpura/Petechiae | 紫癜/瘀点 |
| Fissure | 皲裂 | Induration | 硬结 |
| Xerosis | 干燥症 | Telangiectasia | 毛细血管扩张 |
| Scale | 鳞屑 | Scar | 瘢痕 |
| Friable | 易脆 | Sclerosis | 硬化 |
(c)形状(shape)
| 概念(英文) | 中文 | 概念(英文) | 中文 |
|---|---|---|---|
| Pedunculated | 带蒂 | Exophytic/Fungating | 外生/蕈样 |
| Warty/Papillomatous | 疣状/乳头瘤状 | Dome-shaped | 穹顶状 |
| Flat topped | 平顶 | Umbilicated | 脐凹状 |
| Acuminate | 尖顶 | Burrow | 隧道/匐行线 |
(d)颜色(color)
| 概念(英文) | 中文 | 概念(英文) | 中文 |
|---|---|---|---|
| Brown (Hyperpigmentation) | 褐色/色素沉着 | Translucent | 半透明 |
| White (Hypopigmentation) | 白色/色素减退 | Purple | 紫 |
| Yellow | 黄 | Black | 黑 |
| Erythema | 红斑 | Blue | 蓝 |
| Salmon | 鲑鱼色 | Gray | 灰 |
| Pigmented | 色素性 | — | — |
(e)其他/结构性
Lichenification(苔藓样变)、Poikiloderma(异色病)、Comedo(粉刺)、Wheal(风团)。
(f)质量控制标签
“Do not consider this image”——用于标记应剔除的低质量图像(Fitzpatrick17k 子集 460 张、DDI 子集 20 张)。这是第 49 项 Table 5 行,不属 48 概念(坑 6)。
2.3 标注界面与勾选逻辑
标注在标准化界面完成,逻辑分两种:
- 标注界面:向标注者展示候选的皮损描述词列表,标注者勾选"图像中存在的概念",允许多选。
- 验证界面:向验证者展示已标注的概念集合,验证者勾选"是否同意",用于测量一致性。
界面设计的目标是降低认知负担并保证概念用词稳定:因为概念表先由两位皮肤科医生固定下来,所有标注都在这张固定的概念表上操作,避免了自由文本带来的同义词漂移。
2.4 概念频率:一个极度不均的两源分布
论文 Table 5 给出每个概念在 Fitzpatrick17k 与 DDI 两个子集的图像计数,呈现"两源覆盖严重不均"的特征:
| 概念 | Fitzpatrick17k 计数 | DDI 计数 | 备注 |
|---|---|---|---|
| Erythema | 2139(最高) | 235 | 两源均高频 |
| Plaque | 1967 | — | Fitz17k 高频 |
| Papule | 1170 | 410(DDI 最高) | 两源均高频 |
| Brown | — | 363 | DDI 高频 |
| …(中频概念略)… | … | … | — |
| Vesicle/Abscess/Pustule/Bulla/Excoriation/Purpura/Fissure/Induration/Xerosis/Sclerosis/Flat topped/Blue/Poikiloderma/Salmon/Wheal/Acuminate/Burrow/Gray/Cyst | 若干 | 0(全为 0) | DDI 完全不覆盖 |
两个观察:
- Fitzpatrick17k 子集概念谱更全:多数概念在 Fitzpatrick17k 中有可观样本,这也是 PCBM 训练使用 Fitzpatrick17k 切分的原因。
- DDI 子集概念谱极窄:20 余个概念在 DDI 上计数为 0(如 Vesicle/Abscess/Pustule/Bulla 等在 DDI 一张都没有),说明 DDI 图像(医院采集、疑似恶性为主的临床照片)与 Fitzpatrick17k(网络来源、病种更杂)在概念分布上差异巨大。任何跨源概念泛化结论都必须先看覆盖率——这正是论文把 PCBM 测试放在 DDI 上时需谨慎解读概念层面的原因。
2.5 肤色(Fitzpatrick Skin Type)分层
论文 Table 1 给出两子集的 Fitzpatrick 皮肤类型(FST)分层:
| FST 分档 | 代表肤色 | Fitzpatrick17k | DDI |
|---|---|---|---|
| I-II | 白皮肤 | 1738 | 208 |
| III-IV | 橄榄/浅棕 | 1350 | 241 |
| V-VI | 深棕/黑 | 467 | 207 |
| Unknown | — | 135 | — |
| 合计 | — | 3690 ≠ 3230 | 656 ✅ |
DDI 三档合计 208+241+207=656,与子集总数自洽;而 Fitzpatrick17k 三档加 unknown 合计 1738+1350+467+135=3690,比子集 3230 多出 460。这一不自洽(差 460,恰与质控标签 “Do not consider this image” 在 Fitz 的 460 张数量吻合)提示:Table 1 的 Fitzpatrick17k 列很可能给的是"含被剔除图的全库分布"或统计口径不同,而非 SkinCon 实际使用的 3230 张子集分布。使用肤色分层做公平性分析时,务必以此为前提(坑 5)。
2.6 与两个上游源的关系边界
SkinCon 不改图像、只加标签。因此:
- 图像来源:Fitzpatrick17k → 其官网;DDI → 其官网。两者均为"科研、非商业用途"。
- SkinCon 增量:概念标注文件 + 双轮验证记录 + 概念频率统计 + PCBM/CAV 基准实验。
- 对齐方式:通过两源各自的图像编号(image id)与标注行对应;使用时须同时持有对应源图像,否则标注无附着对象。
这一"图像与标签分离"的结构是本条目 AI-Ready 评估的关键:它的可获取性取决于三个入口(Fitzpatrick17k、DDI、SkinCon 主页)而不仅是自身。
2.7 两源的分布错配及其含义
两源在概念频率上的错配(§2.4 已述:DDI 有 20 余概念为 0)意味着:在 DDI 上做概念级评估时,大量概念没有正样本,无法评估。实际可评估的只是两源共有的高频概念(Erythema、Papule、Brown 等)。这提醒使用者:
- 概念瓶颈模型在 DDI 上的总体 AUC 优势,可能主要由少数高频概念驱动,而非全部 48 概念。
- 报告概念级结果时,应列出"该概念在测试集中的正样本数",避免对零样本概念给出虚假指标。
2.8 与宿主数据集的深度关系
Fitzpatrick17k 的角色:它是 SkinCon 的主标注宿主,其 3230 张子集承载了几乎全部概念谱。Fitzpatrick17k 本身的设计目标包含"覆盖 Fitzpatrick 肤色全谱以支持公平性研究",因此它天然带 FST 分层。SkinCon 借用这一分层,使概念标注同时携带了肤色背景——这让"概念维度的公平性分析"(例如深肤色段模型对溃疡概念的识别是否更差)成为可能。
DDI 的角色:DDI(Diverse Dermatology Images)原本是为"疑似恶性病变 + 多样性肤色"设计的临床图像集。在 SkinCon 中,DDI 的 656 张承担外部验证职责:它们不参与概念标注训练,专门用于测试模型的跨源泛化与公平性。DDI 的深肤色占比高(V-VI 有 207 张,占约 31.6%),因此它是检验"模型在深肤色上是否依赖真概念而非伪相关"的关键场。
2.9 皮肤病学临床背景:为什么这些概念"可解释"
要理解 SkinCon 为什么能用概念做解释,必须先理解皮肤科的诊断语言。皮肤科与多数医学专科不同,它高度依赖视觉描述:医生通过在体表"看"到的形态学特征来沟通与推理,而非主要依赖化验或影像。这种描述体系(dermatologic lexicon)在皮肤科教材《Dermatology》(Bolognia et al. 2017)中被系统化,SkinCon 的 48 概念直接取自这一体系。
形态学的逻辑是"几何 + 质地":
- 大小分档:以 1 cm 为界。Macule(斑疹)与 Patch(斑)都是平坦皮损,前者 < 1 cm,后者 > 1 cm;Papule(丘疹)与 Plaque(斑块)都是隆起皮损,前者 < 1 cm,后者 > 1 cm;Nodule(结节)是高度 ≥ 1 cm 的隆起。这正是论文所说"大小判断主观、受角度光照影响"的来源(§8.4)。
- 内容物分档:Vesicle(水疱)< 1 cm 的含液隆起,Bulla(大疱)≥ 1 cm 的含液隆起,Pustule(脓疱)为含脓隆起,Abscess(脓肿)为深部化脓,Cyst(囊肿)为封闭囊性结构。
- 质地/继发改变:Scale(鳞屑)为角质层堆积,Crust(结痂)为干涸渗出物,Erosion(糜烂)为表皮缺失不越基底膜,Ulcer(溃疡)为深达真皮的缺损,Atrophy(萎缩)为皮肤变薄,Induration(硬结)为质地变硬,Lichenification(苔藓样变)为皮纹加深增厚。
颜色的语义:Erythema(红斑)为血管扩张性发红,Brown(褐色)常关联黑色素沉着,White(白色)关联色素减退,Purple(紫)关联出血/血管性,Yellow(黄)关联脂质/脓性,Black(黑)关联坏死或高度色素性——Black 与 Purple 因此成为恶性相关的高权重概念(§5.3)。
为什么这套语言能当"AI 特征集":因为临床医生的诊断推理本身就是"从这些概念到疾病"的映射。当模型被要求先在概念层做预测、再由概念预测诊断时,它复现的正是医生"先描述皮损、再下诊断"的思维链。这是 SkinCon 概念瓶颈方法在临床上说得通、且在实验上不掉精度的根本原因。
2.10 三个易混概念对(使用者的高频疑问)
SkinCon 中几对概念定义相近,标注与建模时须严格区分:
| 概念对 | 区别 | 易混原因 |
|---|---|---|
| Macule vs Patch | 平坦皮损,1 cm 分界 | 都指平坦、仅颜色改变 |
| Papule vs Plaque | 隆起皮损,1 cm 分界 | 都指隆起、实体性 |
| Bulla vs Vesicle | 含液隆起,1 cm 分界 | 都是水疱类 |
| Erosion vs Ulcer | 表皮缺失 vs 真皮缺失 | 都指皮肤缺损,深度不同 |
| Crust vs Scale | 干涸渗出物 vs 角质堆积 | 都指表面附着物 |
这类"1 cm 阈值"概念的主观性是论文明确承认的局限(§8.4),也是概念标注固有的噪声来源。使用者在报告概念级指标时,宜对这类概念单独标注不确定性。
§3 标注流水线与验证协议
3.1 人员与分工
| 角色 | 人数 | 皮肤科经验 | 任务 |
|---|---|---|---|
| 概念表制定 | 2 位临床皮肤科医生 | 5 年 / 6 年 | 依据皮肤病学知识提炼 48 个描述用概念 |
| 主标注者 | 1 位皮肤科医生 | 6 年 | 在标准化界面完成全部 3886 张(3230+656)勾选 |
| 验证者 A | 1 位 board-certified 皮肤科专家 | — | 抽验 323 张 Fitzpatrick17k(10%)的概念标注 |
| 验证者 B(独立重标) | 2 位皮肤科医生 | 12 年 / 5 年 | 独立重标 956 张(DDI 全部 656 + Fitz 随机 300),测量一致率 |
分工的设计逻辑是"建表与标注分离、标注与验证独立":概念表由两人固定,避免单人用词偏置;标注由一人完成以保一致性(而非多人各标一部分带来标注者间噪声);验证由独立于标注者的其他医生完成,用于估计观察者间变异。
3.2 两轮验证协议
第一轮(概念一致率):一位 board-certified 皮肤科专家抽验 323 张 Fitzpatrick17k 图像(约占子集 10%),逐概念核对。结果 同意 1056/1082 = 97.6% 的概念标注。
第二轮(独立重标):两位独立皮肤科医生(12 年 / 5 年经验)对 DDI 全部 656 张 + Fitzpatrick17k 随机 300 张 = 956 张重新标注。结果:
- 图像质量合格率 94%(即约 6% 图像被判定不宜用于概念标注)。
- 独立验证者与 SkinCon 标签的总体一致率 94%;分源看:Fitzpatrick 92% / DDI 94%。
两轮验证共同构成标注质量的双保险:第一轮测"专家认可度",第二轮测"跨标注者可复现性"。
3.3 无 IRB 声明
论文明确声明 未申请 IRB,理由是标注对象是公开可得的数据(“We did not have an IRB for this study since we were labeling publicly available data.”)。这一点对数据治理有含义:伦理基础建立在"图像已被两源以科研用途公开"之上,而非重新招募受试者。使用者在合规审查时应核对两源各自的伦理与许可声明,而非仅看 SkinCon。
3.4 标注粒度与多标签分布
标注是图像级多标签:每图可携带 1 个到多个概念。论文 Figure 2b 给出 Fitzpatrick17k 子集的"每图概念数分布",显示多数图像携带数个概念(稠密标注)。这意味着:
- 概念标签不是互斥类别,评估时应按多标签指标(如每概念 AUC/prf)而非单标签准确率。
- 每图概念数越多,“无标签即负例"的假设越需谨慎——但因概念表固定,未勾选某概念确实表示"不存在”,这层负例信号是可靠的。
3.5 标注成本的量级
SkinCon 的标注量级是"单一标注者 × 3886 张 × 48 概念的多标签勾选"。相比像素级分割(每张需逐像素圈注、单张专家数十分钟到数小时),概念勾选的单位成本低得多(每张数秒到数十秒的临床判断)。这正是"概念层"能在有限专家预算下覆盖近 4000 张的原因,也是其相对分割型标注的核心效率优势。
§4 任务与标注体系:这一层标签能做什么
4.1 四类下游任务
概念级监督的价值在于它把"图像→诊断"的黑箱拆成可检视的两段。论文示范了四类用途:
- 概念探测(concept probing / CAV):训练线性探针从模型中间特征预测概念是否存在,检验"模型的表征里有没有编码这个概念"。论文用 ≥50 张图的 22 个概念做探测,每个线性探针用 50 对正/负样本,留 10 出交叉验证重复 25 次。
- 概念瓶颈模型(CBM / PCBM):模型先预测概念、再由概念预测 benign/malignant 诊断,从而把决策过程显式化为"概念→诊断"的可读映射。
- 基于概念的事后解释(CAV / CCE):对黑箱模型的既有预测做解释,例如 Figure 3 展示模型漏判恶性时,其表征"缺少 telangiectasia/ulcer/friable 等概念"可解释这一错误。
- 错误分析与切片发现(slice discovery):按概念分层(如"带溃疡的子集"“深肤色子集”)切分性能,定位模型在哪些概念/人群上系统性失效。
4.2 概念体系的组织原则
48 概念的四大维度(原发皮损 / 继发改变与质地 / 形状 / 颜色)并非随意堆叠,而是对应皮肤病学描述性诊断的观察顺序:先看皮损的形态,再看继发改变与质地,再看形状细节,最后看颜色。这一组织方式使概念表既能被临床医生直觉理解,又便于按维度做子群分析(例如"颜色类概念上的模型偏差"对应色素相关公平性问题)。
4.3 与既有概念数据集的差异
在 SkinCon 之前,皮肤病学领域较系统的属性/概念标注数据(如 derm7pt)仅覆盖少数属性(约 7 个),难以支撑细粒度概念瓶颈实验。SkinCon 把概念数量推到 48,且专门针对"可调试性"设计——这是它在方法学上的定位:不是又一个大图像集,而是第一个面向皮肤病 AI 调试的概念层。库内的 derm7pt(rid 110)可作为它的历史对照。
4.4 从"诊断正确率"到"概念级诊断"的范式转换
传统皮肤病 AI 的评估闭环是"图像 → 诊断标签 → 正确/错误"。这一闭环的问题在于错误信号过于粗糙:模型判错时,你只知道它错了,不知道它"看错了什么"。SkinCon 支持的新闭环是"图像 → 概念集合 → 诊断 → 正确/错误",因此错误可以被归因到概念维度:
- 概念缺失型错误:模型没有激活本应指向恶性的概念(如溃疡、毛细血管扩张),于是漏判。
- 概念误激活型错误:模型把良性特征(如斑、脓疱)误当作恶性证据。
- 概念识别错误:模型识别出的概念本身就与皮肤科医生的勾选不符(概念探测失败)。
这一三分法让"模型为什么错"有了可操作的诊断语言,也是 SkinCon 相对纯诊断数据集的核心增量。对开发团队,这意味着可以用概念级指标(每概念 AUC、概念召回率)替代或补充诊断级指标,把改进方向定位到具体的临床特征上。
4.5 概念体系中"缺失"的设计取舍
值得注意的是 SkinCon 概念表没有覆盖的部分:它不标注病灶部位(头皮/躯干/四肢)、不标注病程(急性/慢性)、不标注患者的年龄/性别/病史、也不做像素级的病灶定位。这些取舍是有意的——概念表锁定在"能从单张图像直接观察到的形态/质地/形状/颜色特征"上,以保证:
- 标注可复现:形态特征比部位/病程更少歧义,跨标注者一致性更高。
- 概念可探测:形态特征是视觉可分的,适合用线性探针在图像表征上检验。
- 临床可解释:形态/颜色正是皮肤科医生描述皮损的标准语汇,解释输出对医生可读。
代价是:概念表无法支撑"部位相关"或"病程相关"的研究问题。若研究需要部位信息,须回两源原始元数据(若存在)另行补充。
4.6 概念粒度的多标签统计含义
因为是多标签,48 个概念并非 48 个互斥类别,评估时必须用多标签指标。具体而言:
- 每概念视角:对每个概念单独算二分类指标(有无该概念),得到 48 组 AUC/precision/recall。
- 每图视角:对每张图计算预测概念集与真值概念集的 Jaccard/汉明距离等集合指标。
- 分层视角:按概念数、按肤色、按来源分层再做上述指标。
论文的 CAV 实验采用的是第一种(每概念线性探针),而 PCBM 用的则是"概念作为中间层"的联合训练。理解这一区别对正确复现实验至关重要。
4.7 概念体系与皮肤病学诊断流程的对应
把 48 概念按临床诊断流程排布,可以看到它与皮肤科医生的实际工作顺序高度对应:
- 观察(形态):先判断皮损是实性(丘疹、结节)、液性(水疱、脓疱)还是平坦色变(斑疹、斑)。这一步对应概念表的"原发皮损"维度。
- 追问演变(继发):看皮损是否经过搔抓、破溃、愈合(结痂、糜烂、瘢痕、萎缩)。对应"继发改变与质地"维度。
- 描述轮廓(形状):带蒂、疣状、穹顶状、脐凹状等,帮助缩小病种范围。对应"形状"维度。
- 判读颜色:红斑、色素沉着、紫、黑等,既提示血管/色素性来源,也与恶性风险相关。对应"颜色"维度。
这一对应关系解释了为什么 SkinCon 的概念能成为"可解释的诊断中间层":它复刻了医生的思考链,因此模型沿这一链条给出的解释对医生是可读、可信的。
4.8 概念监督的数据效率含义
概念标注相对诊断标签有一个隐性优势:概念在图像间可迁移,诊断则受病种限制。同一个"溃疡"概念在多种疾病的图像中都会出现,因此概念级监督能跨越病种边界提供训练信号。这对数据稀缺的罕见皮肤病尤为重要——即使某罕见病只有很少的图像,其皮损概念仍可从其他病种的概念标注中受益。SkinCon 的价值部分正来自这种"概念共享"的潜力。
4.5 与宿主数据集的深度关系(补充)
4.5.1 为什么是 Fitzpatrick17k + DDI 这两个源
选择这两源并非偶然:Fitzpatrick17k 提供广覆盖、多病种、带肤色标注的图像(适合做概念谱的全量标注),DDI 提供临床来源、疑似恶性为主、深肤色富集的图像(适合做外部验证与公平性检验)。两者组合恰好覆盖了"训练用的多样性"与"测试用的临床真实性 + 公平性"两个需求。若只用 Fitzpatrick17k,则缺乏干净的外部验证;若只用 DDI,则概念谱太窄(20 余概念为 0)。SkinCon 的两源设计是对这一矛盾的回应。
4.5.2 两源的采集性质差异
- Fitzpatrick17k:图像多来自网络公开资源(如 DermNet 等),覆盖 100+ 病种,来源异质,带有平台/水印/分辨率差异。这种异质性对概念标注是双刃剑——概念谱丰富,但图像质量参差(部分触发 “Do not consider this image”)。
- DDI:图像来自斯坦福诊所的临床采集,有活检金标准,质量较统一,但病种集中在疑似恶性病变,因此概念谱窄。
这一差异解释了 §2.4 的概念频率错配,也解释了为什么 DDI 上约 6% 的图像被判定质量不达标(临床照片的构图/光照需符合概念可判读要求)。
4.5.3 对齐与复现的实操要点
复现时,两源图像与标注的对齐依赖 image id,实操中需注意:
- Fitzpatrick17k 子集的 3230 张是"随机抽样 + 去噪"后的结果,需用 SkinCon 的标注文件确认真实使用的 id 列表。
- DDI 子集的 656 张是全量,直接对应。
- 剔除低质量图像后,有效图像数会少于 3886(Fitz 减 460、DDI 减 20 的量级),做统计时应报告是否剔除。
§5 评估与基准:PCBM 如何在 DDI 上跑赢 DeepDerm
5.1 评估设计:为什么测试放在 DDI
论文的基准实验有一个关键设计:所有测试在完全独立的 DDI 上进行。原因是数据泄漏——基线模型 DeepDerm(Inceptionv3 架构,训练于 Esteva et al. 2017 的数据)的训练数据与 Fitzpatrick17k 存在重叠,若在 Fitzpatrick17k 上测会高估性能。DDI 作为外部数据集提供了干净的评测场。这一安排在方法学上是必要的:概念瓶颈模型的价值不能靠"在它自己的训练分布上刷分"来证明。
5.2 DeepDerm vs PCBM:总体与分肤色段结果
论文 Table 2 给出 5 个随机种子的均值±标准误:
| 测试集 | 原始 DeepDerm AUC | PCBM AUC(均值±SE) | 方向 |
|---|---|---|---|
| DDI 总体 | 0.595 | 0.639 ± 0.001 | PCBM 更优 |
| DDI (I-II) | 0.649 | 0.643 ± 0.002 | DeepDerm 略优 |
| DDI (III-IV) | 0.632 | 0.727 ± 0.002 | PCBM 大幅更优 |
| DDI (V-VI) | 0.528 | 0.542 ± 0.002 | PCBM 更优 |
三个要点:
- 总体 PCBM 胜出(0.639 vs 0.595),且是在引入可解释性的前提下取得的——即"可解释的模型至少不差、有时更好"(论文核心结论)。
- 中肤色段(III-IV)提升最大(+0.095),说明概念瓶颈结构在该子群上帮助尤其明显。
- 浅肤色段(I-II)PCBM 略输(0.643 vs 0.649),差异极小;深肤色段(V-VI)PCBM 略胜(0.542 vs 0.528),但两模型在该段 AUC 都偏低(<0.55),反映出深肤色皮肤病的难分性——这是皮肤 AI 公平性研究的经典痛点,SkinCon 并未掩盖它。
5.3 概念权重:模型"看见了什么"
论文 Table 3 给出各概念对 benign/malignant 判定的权重,可读作"模型把哪些概念当作恶性/良性的证据":
| 方向 | 概念 | 权重 | 临床直觉 |
|---|---|---|---|
| 指向恶性(正) | Ulcer(溃疡) | 1.190 | 溃疡常见于恶性/侵蚀性病变 |
| 指向恶性(正) | Telangiectasia(毛细血管扩张) | 1.022 | 与部分恶性皮肤肿瘤相关 |
| 指向恶性(正) | Black(黑) | 0.746 | 色素性恶性病变关联 |
| 指向恶性(正) | Purple(紫) | 0.489 | — |
| 指向恶性(正) | Friable(易脆) | 0.307 | 易出血/脆性质地 |
| 指向良性(负) | Patch(斑) | −0.960 | 平坦斑片多良性 |
| 指向良性(负) | Pustule(脓疱) | −0.836 | 感染性/炎性多见 |
| 指向良性(负) | Scar(瘢痕) | −0.711 | 既往愈合痕迹 |
| 指向良性(负) | Dome-shaped(穹顶状) | −0.130 | — |
这组权重的意义在于:它让"模型为什么判恶性"变成可读的概念证据链,而不是抽象的特征激活。它也构成可证伪的诊断信号——若某概念的权重与临床直觉相悖,即是模型偏差的线索。
5.4 概念探测(CAV):模型表征里有没有这个概念
论文用 ≥50 张图的 22 个概念做线性探测:每个概念训练一个线性探针,使用 50 对正/负样本,采用留 10 出交叉验证、重复 25 次。目的是检验模型中间表征是否线性可分地编码了该概念。这是"概念是否已被模型学到"的直接量度,也是后续做概念瓶颈干预的前提。
5.5 案例:用概念解释一次漏判(Figure 3)
论文 Figure 3 展示概念激活解释的一个实例:当模型将某恶性病变误判为良性时,其表征中被激活的概念缺少 telangiectasia / ulcer / friable 等指向恶性的关键概念。这一解释既是"模型错在哪"的诊断,也提示了改进方向(补强这些概念的监督)。这类"概念级事后解释"正是 SkinCon 想赋能的典型工作流。
5.6 计算与复现
论文实验使用单卡 NVIDIA Titan Xp GPU,代码随论文补充材料发布。PCBM 训练/测试切分使用"未用于概念标注的 Fitzpatrick17k 图像":训练 2787(80%)/ 测试 697(20%)。概念瓶颈模型 PCBM 的方法基础来自 Yuksekgonul et al. 2022(arXiv:2205.15480),SkinCon 作者之一 Mert Yuksekgonul 亦是该方法的共同作者,因此本文档在方法上高度自洽。
5.7 结果的三层解读
第一层:总体层面,"可解释不掉精度"成立。 这是最广为人知的结论,也是最容易被误读的。严格说,论文证明的是"用 SkinCon 概念构建的 PCBM 在 DDI 上的 AUC 不低于黑箱 DeepDerm"(0.639 vs 0.595),而不是"任何概念瓶颈都优于任何黑箱"。换一个概念库、换一个任务,结论未必复现。因此引用时应附带条件:“在皮肤科良恶性二分类、DDI 测试集、SkinCon 概念库这一特定设定下”。
第二层:子群层面,“提升高度不均”。 四个子群的差值从 −0.006(I-II)到 +0.095(III-IV)跨越了约 0.1,说明概念瓶颈的收益高度依赖子群。中肤色段(III-IV)受益最大,浅肤色段(I-II)几乎持平甚至微负。这提示:可解释化的收益不是均匀分布的,做子群分解是必要的——否则"总体提升"会掩盖某些子群的"无提升甚至倒退"。
第三层:绝对性能层面,“深肤色仍难”。 无论哪个模型,DDI(V-VI) 的 AUC 都只有 0.528–0.542,显著低于浅肤色段。这说明可解释性并不能直接解决公平性差距——它只是让差距"可见、可诊断"。要真正弥合,仍需更多深肤色数据与针对性方法。SkinCon 的价值在此更多是"提供了诊断工具",而非"解决了问题"。
5.8 与通用视觉概念基准的可比性
在通用视觉领域,概念基准(如 CUB 鸟类 312 属性、Broden 1197 概念)常被用于概念方法的开发与测试。SkinCon 与它们的本质差异在于:SkinCon 的概念需要领域专业知识才能可靠标注(“斑块 vs 丘疹"的 1 cm 分界、颜色的临床语义),因此它的 48 概念不是"众包可得"的,而是"皮肤科医生专业判断"的产物。这一差异使 SkinCon 更适合检验"概念方法在专业医学域是否成立”,而不适合检验"概念方法在众包场景的扩展性"。论文也把 SkinCon 定位为对 Broden/CUB 等通用基准的"医学补充"。
5.9 基准的正确用法与常见误用
正确用法:
- 把 0.595(黑箱)与 0.639(PCBM)作为"同设定下的对照数字",用于说明"你的方法相对 SkinCon-PCBM 的位置"。
- 把概念权重表(§5.3)作为"解释合理性"的参照——新方法若给出与临床相悖的权重,值得警惕。
- 把概念探测协议(50 对样本、留 10 出 CV 重复 25 次)作为可复现的探针基线。
常见误用:
- 把 0.639 当成"PCBM 的通用性能"跨数据集引用(它只在 DDI 上测得)。
- 把概念权重当成"临床因果证据"(它只是模型内线性层的权重,不是医学结论)。
- 忽略子群差异,只报总体 AUC(§5.7 第二层)。
- 在 DDI 上做概念级评估却不报各概念正样本数(大量概念在 DDI 为 0,见 §2.7)。
§6 获取与许可:三入口结构
6.1 三段资产、三个门
| 资产 | 内容 | 获取入口 | 许可口径 |
|---|---|---|---|
| Fitzpatrick17k 图像 | 3230 张对应原图 | Fitzpatrick17k 官网自取 | 科研、非商业用途 |
| DDI 图像 | 656 张对应原图 | DDI 官网自取 | 科研、非商业用途 |
| SkinCon 概念标注 | 3886 张的概念标签 | 项目主页下载(Fitzpatrick17k / DDI 两套标注文件) | 官方页与论文未单独声明 SPDX(待核) |
关键点:SkinCon 只发标注,不发图像。项目主页提供两个下载入口——“Download SKINCON Fitzpatrick17k annotations” 与 “Download SKINCON DDI annotations”;图像本体必须分别去两源官网获取。任何"一键拿全"的期待都会落空(坑 8 亦是此类误读的变体)。
6.2 许可细读
- 图像本体:论文原文称两源 “both of these datasets are available for scientific, non-commercial use”(科研、非商业)。SkinCon 未对图像本体另行声明再分发许可,因此图像边界沿用两源各自条款。
- 标注文件:官方页与论文未单独给出标注文件的 SPDX 许可。这意味着标注文件的再分发与商用边界需要回源确认(联系项目/作者),本条目标注为待核(坑 7)。
- 论文本体:NeurIPS 2022 Datasets and Benchmarks Track,开放获取(proceedings 与 arXiv v1)。
6.3 版本链与镜像
- 无版本号体系:v1 即首发定版(2022 会议 / 2023 arXiv),未见官方后续更新通告。
- 无官方 HuggingFace / Zenodo 镜像(抓取时点):在 HF 主站与 hf-mirror 均未检索到官方 SkinCon 数据集仓库;第三方转载页(如 selectdataset)非官方,不可作数据源引用。
- 项目主页:论文 §6 引 https://SkinCon-dataset.github.io(大小写混合),实际抓取时点存在可访问性波动(明文本站点),标注下载链接需人工复核。
6.4 AI-Ready 评估:三入口结构下的可获取性
SkinCon 的可获取性被"三入口"结构拖累:概念标注虽可下载,但缺少配套图像就无法使用。这是"标签数据集"的固有特征——它的 AI-Ready 得分天然低于"图像+标签一体分发"的数据集约一个身位。补偿因素是其标注文件体积小、可直接下载,且两源图像均公开(尽管各自需过各自的条款)。对使用者而言,实际准备成本是"两次图像获取 + 一次标注获取 + 一次图像-标注对齐"。
§7 生态与影响:一个可解释性支点
7.1 在世界皮肤病学数据集景观中的位置
皮肤影像领域的数据集大致有三层:
- 诊断标签层:ISIC 系列(isic-archive/2018/2019/2020)、HAM10000、BCN20000 等——图像 + 疾病类别,规模大。
- 属性/概念标注层:derm7pt(约 7 属性)、SkinCon(48 概念)——在图像上加临床描述。
- 公平性/肤色分层层:Fitzpatrick17k、DDI——以肤色标注为设计核心。
SkinCon 位于第 2 层,且是其中概念维度最丰富的;它与第 3 层的两个数据集(Fitzpatrick17k、DDI)是宿主关系,与第 1 层的 ISIC 系列则是互补关系(概念监督 vs 诊断监督)。
7.2 与前作/宿主的关系
- Fitzpatrick17k(Daneshjou et al. 2022):SkinCon 的主标注宿主,3230 张;Fitzpatrick17k 本身以 Fitzpatrick 肤色标注与公平性研究为设计目标。
- DDI(Daneshjou et al. 2022, Science Advances):SkinCon 的外部验证宿主,656 张;专为"疑似恶性 + 深肤色"设计,是评估皮肤 AI 公平性的关键集。
- derm7pt:早期属性标注数据集,SkinCon 在概念粒度上对其形成升级。
- PCBM 方法(Yuksekgonul et al. 2022):SkinCon 的基准方法来源。
这一谱系显示 SkinCon 并非孤立作品,而是斯坦福 Daneshjou/Zou 组在"皮肤 AI 可解释性与公平性"方向上的一环:从数据集(Fitzpatrick17k/DDI)到方法(PCBM)到调试工具(SkinCon)。
7.3 对可解释 AI 社区的影响
SkinCon 的 48 概念标注成为皮肤病学域内概念瓶颈/概念探测实验的标准素材之一:它提供的不只是标签,还有一条"概念→诊断"的公开基准(DeepDerm vs PCBM 的 AUC 对照)。对可解释 ML 研究者,它是一个"域内有临床意义的概念"落地案例——不同于通用视觉里(如 CUB 鸟类属性)的概念实验,SkinCon 的概念直接对应临床可读的皮损特征。
7.4 生态接入点与库内互链
- 直接上游:fitzpatrick-17k(rid 55)、ddi(rid 171)——必须互链。
- 同域可互链:ham10000(rid 60)、pad-ufes-20(rid 151)、derm7pt(rid 110)、derm12345(rid 742)、dermacon-in(rid 781)、skincap(rid 782)。
- ISIC 系列(isic-archive rid 56 / isic-2018 rid 710 / isic-2019 rid 707 / isic-2020 rid 715):与"同名撞库"的 SkinCON/DRAPS 相关,参考时注意区分。
- 方法学互链:OAI(骨关节炎概念数据集,18 概念)——与 SkinCon 48 概念形成"概念数据集"跨域对照。
7.5 使用者的常见工作流
把 SkinCon 接入一个典型研究项目,通常经历以下步骤:
- 取数据:项目主页下载概念标注;Fitzpatrick17k 官网取 3230 张、DDI 官网取 656 张。
- 对齐:按 image id 把标注行与图像文件对应起来;检查是否有缺图/多图。
- 清洗:剔除 “Do not consider this image” 标记的低质量图像(Fitz 460 / DDI 20)。
- 建模:训练视觉骨干(或复用既有模型)→ 概念头(多标签)→ 诊断头(二分类),即概念瓶颈结构。
- 评估:在 DDI(独立集)上算诊断 AUC;再按概念分层、按肤色分层算子群指标。
- 解释:读概念权重、做概念探测、生成概念级错误分析(如漏判恶性的概念证据链)。
这一工作流的关键卡点是第 2 步(对齐)与第 3 步(清洗):标注文件本身不含图像,二者靠 id 关联;低质量图像的剔除与否会直接改变概念频率与评估结果。
7.6 与通用视觉概念数据集的类比
在通用计算机视觉中,CUB(鸟类属性)、AwA(动物属性)等数据集用"属性"支撑可解释性研究;医学影像中这类资源稀缺。SkinCon 相当于皮肤病学域的"属性数据集",区别在于:
| 维度 | CUB/AwA(通用) | SkinCon(医学) |
|---|---|---|
| 属性来源 | 生物学家/众包 | 皮肤科医生 |
| 属性语义 | 视觉可见特征 | 临床皮损概念 |
| 使用场景 | 可解释性研究 | 医疗可解释性 + 公平性 |
| 风险 | 研究性 | 医疗决策辅助(有临床后果) |
这一类比帮助可解释 ML 研究者快速定位 SkinCon 的用途,也提醒医疗域的特殊性:概念错误可能对应临床误判,而非仅仅是 benchmark 分数。
7.7 版本、维护与长期可用性
版本状态:SkinCon 没有正式的版本号体系,v1 即首发定版(NeurIPS 2022 / arXiv 2023-02-01)。抓取时点未见官方更新通告,引用时应注明访问日期与来源。
长期可用性风险:三条——依附两源(Fitzpatrick17k 与 DDI 任一源下线都会影响可用性)、无官方镜像(HF/Zenodo 未见,缺冗余备份)、主页为 GitHub Pages 明文站点(下载链接稳定性中等)。缓解建议是尽早在本地留存标注文件,并记录两源图像的获取日期与校验信息。
引用与著录建议:概念标注与验证引 SkinCon 论文;图像来源分别引两源原始论文;使用条款按两源"科研非商业"、标注文件待确认;年份口径全篇统一(坑 2)。
7.8 可解释性方法的横向对比
把 SkinCon 支持的几类可解释性方法放在一起对比,能看清各自的位置:
| 方法 | 干预时机 | 可解释性来源 | 对概念标注的依赖 | 性能影响 |
|---|---|---|---|---|
| CBM(概念瓶颈模型) | 训练时 | 概念→诊断的显式映射 | 强(训练需概念标签) | 可能略降或持平 |
| PCBM(事后概念瓶颈) | 训练后 | 在既有模型上建概念层 | 强(需概念标签建层) | 本论文中提升 |
| CAV(概念激活向量) | 训练后 | 中间特征的概念线性可分性 | 中(探测需概念样本) | 不改模型 |
| CCE(概念反事实解释) | 训练后 | 概念的增减对预测的影响 | 中 | 不改模型 |
SkinCon 的独特贡献是为这四类方法同时提供了域内、临床可读的概念监督;此前皮肤病学缺乏这类资源,相关方法只能借通用视觉属性集做迁移实验。
7.9 对下游研究者的现实提醒
对想直接用 SkinCon 出成果的研究者,有三条现实提醒:
- 别跳过图像获取:很多人卡在"下了标注却没图"。务必先规划好两源图像的获取(可能需要注册/遵守各自条款)。
- 注意两源的评估分工:概念谱完整的 Fitzpatrick17k 适合训练,干净独立的 DDI 适合测试,别把两者混用导致泄漏。
- 报告要区分口径:概念数(22/25/28)、肤色合计(3690 vs 3230)、图像数(3886 vs 约 4000)在写论文时都要选一个口径并说明(坑 3/4/5)。
§8 方法学启示:三条可迁移的经验
8.1 "宿主数据集 + 概念层"是一种低成本高价值的数据工程
SkinCon 证明了不必采集新图像也能产出高价值数据集:把专家知识注入既有公开图像的"概念维度",就能解锁一整类可解释性研究。对数据集工程者的启示是——在图像已经公开、诊断标签已经存在的领域,概念/属性标注的边际成本远低于采集新图像,而方法学收益可能更高。这一模式可迁移到其他诊断影像域(病理、放射、眼底)。SkinCon 的成功前提是皮肤科拥有成熟、标准化的描述性术语体系(形态/质地/形状/颜色),因此概念表可以"从词典中来"而非从零发明。
8.2 概念表的"先固定、后标注"避免同义词漂移
SkinCon 先由两位皮肤科医生固定 48 概念表,所有标注都在这张固定表上操作。这避免了自由文本标注中常见的同义词/上下位词漂移问题(“丘疹” vs “小丘疹”、“红斑” vs “发红”)。对任何做概念标注的项目,这是一条可直接照搬的规范:概念表是 schema,必须先冻结再大规模标注。
8.3 双轮验证:数量级不同的两种一致性
SkinCon 的两轮验证各测一个维度:第一轮(323 张,97.6% 概念一致)测"专家认可度",样本小但对齐专家;第二轮(956 张,94% 总体一致)测"跨标注者可复现性",样本大且覆盖两源。这种"小样本专家抽验 + 大样本独立重标"的双轨验证,比单一验证更能暴露问题(例如第二轮发现约 6% 图像质量不合格,是纯专家抽验不易发现的)。任何专家标注项目都可借鉴这一组合。
8.4 可解释性不等于牺牲性能——但要看子群
PCBM 在 DDI 总体与中/深肤色段优于 DeepDerm,在浅肤色段略输,说明"引入概念瓶颈"的性能代价很小且方向相关。可迁移的经验是:评估可解释性方法时,必须做子群分解,否则总体 AUC 会掩盖子群差异。这与皮肤 AI 公平性研究的核心关切完全一致。长久以来"加可解释层必掉精度"的假设,在概念与任务高度对齐的领域(皮肤科临床词典本就与诊断相关)被证伪。
8.5 外部干净数据集作为测试场
SkinCon 坚持在 DDI 而非 Fitzpatrick17k 上做测试,因为前者无泄漏、经活检验证。这个选择提示:当上游数据之一与基线模型存在泄漏或质量问题时,另找一个独立、干净的外部集做验证场,是保证结论可信的关键。这对一切"在既有数据上加标注"的衍生数据集都适用——衍生数据集的评测,尤其要警惕宿主数据带来的泄漏。
8.6 标注经济学的一个样本
SkinCon 是"标签比图更值钱"的典型:图像本体公开可得、由两源免费提供,而 SkinCon 的增量价值全在那层概念标注与配套验证上。这提示数据集生产者:在图像已公开的领域,增量价值可以来自高质量、结构化的标注层,而不必重复采集图像。这一模式对预算有限、但拥有领域专家的团队尤其友好。
8.7 概念即"可证伪的模型诊断"
概念权重表把"模型为什么这么判"变成可审计的数字:如果模型给 Pustule(脓疱)一个大正权重指向恶性,研究者立刻能发现这与临床相悖——这是一个可证伪的偏差信号。相比"模型在深肤色上表现差"这类聚合统计,概念级的诊断更细、更可操作,也更容易转化为具体的改进动作(补强某概念的监督)。
§9 与库内条目的关系
9.1 家族图谱
SkinCon 处在皮肤病影像数据集家族的一个特殊位置——它是标注层,不是图像源:
Fitzpatrick17k(rid 55,含 Fitzpatrick 肤色标注)
└── SkinCon Fitzpatrick17k 子集(3230 张)
DDI(rid 171,656 张,活检验证,Daneshjou et al. 2022)
└── SkinCon DDI 子集(656 张,全量)
↓ 叠加 48 概念标注
【SkinCon】(本条目)3886 张 × 48 概念
- 直接上游(必链):
fitzpatrick-17k(rid 55)、ddi(rid 171)。 - 同域平级(建议链):
ham10000(rid 60)、pad-ufes-20(rid 151)、derm7pt(rid 110)、derm12345(rid 742)、dermacon-in(rid 781)、skincap(rid 782)。 - ISIC 系列(弱关联):
isic-archive(rid 56)、isic-2018(rid 710)、isic-2019(rid 707)、isic-2020(rid 715)——与"同名撞库"的 SkinCON/DRAPS 有关(见坑 1),但与本条目本身无数据关系。
9.2 检索路径建议
- 精确检索:用
"SkinCon"精确短语 +Stanford或Daneshjou消歧;勿只搜 “SkinCon” 否则会混入 SkinCON/DRAPS。 - 找数据:先到 Fitzpatrick17k / DDI 官网拿图,再到 SkinCon 官方站拿标注(§6)。
- 引用质量数字:区分 97.6%(专家抽验 323 张,概念级)与 94%(独立重标 956 张),别混。
- 引用概念数:指定子集口径(22/25/28 三重口径,坑 3)。
- 引用可解释实验结果:用 DDI 上的 0.595(黑箱)vs 0.639±0.001(PCBM)。
9.3 与库内"概念/可解释"条目的呼应
本库中若已有其他带概念/属性标注的医学数据集(如 derm7pt 的 7 判据、OAI 的 18 概念),SkinCon 可作为"概念数升级版"对照:概念数 7→48,覆盖疾病从单一黑色素瘤→跨病过程。凡涉及"模型可解释性"“概念瓶颈”"临床概念监督"的库内条目,都可与 SkinCon 交叉引用。
§10 避坑清单:八个已踩过的坑
坑 1:SkinCon 和 SkinCON 是两个不同数据集(同名撞库)。斯坦福 SkinCon(本条目,NeurIPS 2022,Fitzpatrick17k + DDI,3886 张,48 概念)与 UC Berkeley 的 SkinCON/DRAPS(Ren et al., MICCAI 2024,ISIC 2019,25,331 张,937,167 判断,10,509 参与者,任务是"不确定性预测集")大小写/连字符近似,极易混淆。检索必须加机构(Stanford vs UC Berkeley)、作者(Daneshjou vs Ren)或图像源(Fitzpatrick17k/DDI vs ISIC 2019)消歧。
坑 2:发表年份双口径。会议论文年 = 2022(NeurIPS 2022 Datasets and Benchmarks);arXiv 预印本上线 = 2023-02-01。同一工作两个年份都会出现在检索结果里,著录时须说明用的是哪个口径。
坑 3:"≥50 张图像的概念数"三重口径冲突。摘要与部分段落说 22(Fitzpatrick17k 单独),§2.4 说 28(combined with DDI),研究贡献段后半说 25(combined,措辞疑笔误)。论文内部不自洽,引用时必须指定子集口径并注明冲突。
坑 4:图像总数近似值。第三方转述有"nearly 4,000 images"(Lacuna)、"3,886 images"等;确切值是 3886(3230 + 656),以论文 Table 5 脚注为准。别用"约 4000"这类模糊数做硬引用。
坑 5:肤色分布表与子集总数不自洽。Table 1 的 Fitzpatrick17k 列三档 1738+1350+467 = 3555(+135 unknown = 3690)≠ 子集 3230,相差 460(恰与 Fitzpatrick17k 质控标签 “Do not consider this image” 的 460 张吻合);DDI 列 208+241+207 = 656 则自洽。Fitzpatrick 列疑为全库口径或口径未说明,引用肤色比例时须存照。
坑 6:概念数是 48,但 Table 5 有 49 行。第 49 行是 “Do not consider this image”(质量控制标签),不属于 48 个临床概念。做 48 类多标签模型时勿把它当作第 49 个概念。
坑 7:三段资产、许可边界不同。Fitzpatrick17k 图像与 DDI 图像各自"科研非商用";SkinCon 标注文件的 SPDX 许可未单独声明。商用/再分发前必须回上游与作者确认,不可把"科研可用"当作"商用可用"。
坑 8:图像级标注 ≠ 像素级分割。SkinCon 是 48 概念的图像级多标签,不提供任何病灶边界框或掩码。若任务需要定位,必须另找源数据集的病灶标注(SkinCon 帮不上)。
10.1 坑点速查表
| 编号 | 坑点一句话 | 高发场景 |
|---|---|---|
| 坑 1 | SkinCon ≠ SkinCON/DRAPS(同名撞库) | 文献检索/选条 |
| 坑 2 | 2022(会议)vs 2023(arXiv)双年份 | 引用/著录 |
| 坑 3 | ≥50 张概念数 22/25/28 三重冲突 | 数字抽取 |
| 坑 4 | 3886 是确值,"约 4000"是近似 | 规模引用 |
| 坑 5 | Table 1 肤色列合计 3690 ≠ 子集 3230 | 公平性分析 |
| 坑 6 | 48 概念 + 1 质控标签 = Table 5 共 49 行 | 建模类别数 |
| 坑 7 | 标注文件许可未单独声明 | 商用/再分发 |
| 坑 8 | 图像级多标签 ≠ 像素级分割 | 任务匹配 |
10.2 八个坑背后的三类共性问题
把上述八个坑归类,可以看到三类系统性问题,它们对任何"依附型数据集"都适用:
第一类:命名与身份混淆(坑 1、坑 2)。SkinCon 与 SkinCON/DRAPS 的名字只差大小写,是典型的高危同名撞库;而"会议年 2022 / 预印本年 2023"则是同一工作的时间双口径。两者共同说明:数据集的"身份"不能只靠名字确定,必须用机构 + 作者 + 规模 + 任务的组合指纹。
第二类:内部数字不自洽(坑 3、坑 5、坑 6)。论文自身在三处存在口径冲突:≥50 概念数(22/25/28)、Table 1 肤色合计(3690 vs 3230)、概念表行数(49 vs 48)。这些不是"错误"而是"口径未统一"。使用者的正确做法是:逐条落源、标明出处小节,而非替作者做主观调和。
第三类:获取与许可的碎片化(坑 4、坑 7、坑 8)。图像与标签分离、三入口结构、标注许可未明、图像数被第三方近似化——这些都源于 SkinCon"不自持图像"的定位。使用者必须接受"这个数据集天然需要多步准备"的现实,并在合规上回源确认。
三类的共同解法是同一句话:对依附型数据集,“引用它"不等于"拥有它”,每一个数字和每一份权利都要独立核实。
§11 总结
11.1 三句话总结
- SkinCon 用 3886 张图的 48 概念稠密标注,第一次把皮肤病 AI 的"黑箱分类"打开成可检视的"概念→诊断"两段结构,为概念瓶颈/概念探测提供域内监督。
- 它的双轮验证(97.6% 概念一致 + 94% 独立重标一致)与"先冻结概念表再大规模标注"的流程,是可复制的专家标注规范。
- 它的基准证明"可解释的 PCBM 至少不差、在中深肤色段更好"(DDI 总体 0.639 vs 0.595;III-IV 0.727 vs 0.632),并公开了概念权重与解释案例。
11.2 适合谁
- 可解释 AI 研究者:需要域内、有临床意义的概念标注做 CBM/CAV 实验。
- 皮肤病 AI 团队:想调试模型"看错了什么概念"、做错误分析与切片发现。
- 公平性评测者:需要 Fitzpatrick 肤色分层背景(注意坑 5 口径)。
- 标注方法论研究者:想借鉴"冻结概念表 + 双轮验证"的规范。
11.3 不适合谁
- 需要大规模诊断分类训练集的项目(3886 张、概念标签,不是诊断大集)——应改用 ISIC/HAM10000。
- 需要图像+标签一体下载的团队(SkinCon 只发标注,图像要另取)。
- 需要明确商用/再分发许可的商业项目(标注文件许可未明,图像为科研非商业)。
- 需要像素级病灶定位的项目(SkinCon 是图像级多标签,无掩码)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要做概念瓶颈/可解释实验 | 项目主页下载概念标注 + 两源官网取图 + 对齐 image id |
| 要评估模型在概念层的错误 | 读 §5.3 概念权重 + §5.5 解释案例,按概念分层评测 |
| 要写皮肤 AI 公平性 | 用 §2.5 肤色分层,但先核对 Table 1 口径(坑 5) |
| 要设计专家概念标注 | 照搬 §3.1 分工 + §3.2 双轮验证 + §8.2 冻结概念表 |
| 要引用本数据集 | 会议年(2022)+ arXiv:2302.00785;图像与标签分别著录 |
| 怕搜错同名集 | 认准"斯坦福 + 概念标注 + 3886 张",排除 UC Berkeley 的 SkinCON/DRAPS(坑 1) |
11.5 一句话定位
SkinCon 是皮肤病 AI 从"黑箱分类"走向"概念级可解释与可调试"的关键基础设施,代价是它把复杂度转移到了"多入口获取 + 概念体系背景知识"上。
11.6 留给读者的三个判断
读完本条目,你可以用三句话检验是否抓住了 SkinCon 的要点:
- 它是"加一层",不是"多一点":SkinCon 的价值不在图像数量,而在图像与诊断之间插入的 48 概念中间层。
- 它是"借来的图、自己的标签":图像归两源,概念标注与验证才是它的原创贡献,也是引用时的核心。
- 它是"可解释不必牺牲性能"的实证:DDI 上 PCBM 0.639 > DeepDerm 0.595,至少在皮肤科域内证伪了"加可解释层必掉精度"的假设。
若这三点你都能复述,就可以放心地用 SkinCon 做研究或写综述了。
FAQ(高频问答 32 问)
A. 基础认知
Q1:SkinCon 是一个新采集的皮肤病图像集吗?
不是。它不采集新图像,而是对两个既有公开图像集(Fitzpatrick17k 3230 张 + DDI 656 张)做概念级重标注,共 3886 张。
Q2:名字里的 “Con” 指什么?
指 concept(概念)。SkinCon 的核心是给每张图标注"存在哪些临床概念",用于基于概念的模型调试与可解释性研究。
Q3:谁做的?
斯坦福大学跨三系合作:皮肤科、计算机科学系、生物医学数据科学系;作者 Roxana Daneshjou、Mert Yuksekgonul(共同一作)、Zhuo Ran Cai、Roberto Novoa、James Zou。
Q4:发表在哪里、哪一年?
NeurIPS 2022 Datasets and Benchmarks Track(会议版);arXiv:2302.00785 于 2023-02-01 上线。注意双年份(坑 2)。
Q5:它和 SkinCON/DRAPS 是同一个东西吗?
不是,是最危险的同名撞库。SkinCON/DRAPS 出自 UC Berkeley 等,MICCAI 2024,基于 ISIC 2019,约 25331 张、937167 条判断,任务是诊断/不确定性判断预测。二者仅名字近似(坑 1)。
Q6:一共有多少张图、多少概念?
3886 张(Fitzpatrick17k 3230 + DDI 656);48 个临床概念 + 1 个质控标签(“Do not consider this image”)。
B. 数据与获取
Q7:我现在能下载到什么?
SkinCon 的概念标注文件(Fitzpatrick17k 版与 DDI 版两套);图像本体需分别去 Fitzpatrick17k 官网与 DDI 官网自取。
Q8:为什么图像要另取?
因为 SkinCon 不持有图像版权,只发布叠加其上的标注;图像权利归两源各自所有(科研非商业)。
Q9:有 HuggingFace / Zenodo 官方镜像吗?
抓取时点在 HF 主站与 hf-mirror 均未发现官方镜像;第三方转载页非官方,勿作数据源。
Q10:标注文件的许可是什么?
官方页与论文未单独声明标注文件 SPDX;图像为科研非商业。再分发/商用边界待回源确认(坑 7)。
Q11:项目主页地址?
https://skincon-dataset.github.io/ (论文 §6 写作 https://SkinCon-dataset.github.io)。是 http 明文 GitHub Pages,可访问性有波动。
Q12:能商用吗?
图像本体的两源均为科研非商业,直接商用受限;标注文件许可未明。商用项目务必先回源确认。
C. 标注与质量
Q13:标注粒度是什么?
图像级多标签(不是像素级分割):每图勾选"存在哪些概念",可多项。
Q14:谁标注的?
单一 6 年经验皮肤科医生在标准化界面完成全部 3886 张的勾选;概念表由两位皮肤科医生(5 年/6 年)制定。
Q15:质量怎么保证?
两轮验证:323 张(10%)专家抽验,概念一致 97.6%;956 张独立重标,图像合格 94%、总体一致 94%(Fitz 92%/DDI 94%)。
Q16:48 个概念为什么算"稠密"?
因为每张图可携带多个概念(稠密多标签),且覆盖形态/质地/形状/颜色多维度,相比 derm7pt 的约 7 属性丰富得多。
Q17:有 IRB 吗?
没有,论文声明因标注的是公开可得数据。
Q18:为什么有的概念在 DDI 上是 0?
DDI 图像(医院来源、疑似恶性为主)与 Fitzpatrick17k 病种分布差异大,20 余个概念在 DDI 无样本,跨源概念泛化需谨慎。
D. 基准与发现
Q19:PCBM 是什么?
Post-hoc Concept Bottleneck Model(事后概念瓶颈模型),在已训练模型之上构建概念层,使预测可读为"概念→诊断"。
Q20:基准结论是什么?
在 DDI 上 PCBM 总体 AUC 0.639 > DeepDerm 0.595;中肤色段(III-IV)提升最大 0.727 vs 0.632。
Q21:为什么在 DDI 上测?
因为 DeepDerm 训练数据与 Fitzpatrick17k 有泄漏,DDI 提供独立评测场。
Q22:概念权重怎么读?
正权重(Ulcer 1.190、Telangiectasia 1.022)指向恶性;负权重(Patch −0.960、Pustule −0.836)指向良性。
Q23:CAV 实验怎么做的?
用 ≥50 张图的 22 个概念,每概念 50 对正/负样本,留 10 出交叉验证重复 25 次。
Q24:深肤色性能如何?
DDI(V-VI) 两模型 AUC 都偏低(0.528/0.542),反映深肤色皮肤病难分,是公平性痛点。
E. 生态与关系
Q25:它和 Fitzpatrick17k、DDI 什么关系?
宿主关系:SkinCon 是叠加在这两个数据集之上的概念标注层,图像归两源所有。
Q26:它和 derm7pt 什么关系?
derm7pt 是早期少量属性标注(约 7 属性);SkinCon 在概念粒度上对其升级(48 概念)。
Q27:它和 ISIC 系列什么关系?
互补:ISIC 提供大规模诊断标签,SkinCon 提供小规模概念标签。
Q28:库内还有哪些皮肤病数据集可互链?
fitzpatrick-17k(55)、ddi(171)、ham10000(60)、pad-ufes-20(151)、derm7pt(110)、derm12345(742)、dermacon-in(781)、skincap(782)。
F. 复现与工程细节
Q29:基准用什么硬件?
单卡 NVIDIA Titan Xp GPU;代码随论文补充材料发布。
Q30:PCBM 方法出处?
Yuksekgonul et al. 2022, arXiv:2205.15480(SkinCon 作者之一为共同作者)。
Q31:怎么把标注和图像对齐?
按两源各自的 image id 与标注行对应;须先持有对应源图像。
Q32:要做概念探测从哪开始?
用 §5.4 的协议(≥50 张图的 22 概念、50 对样本、留 10 出 CV),并按 §5.3 权重解读结果。
事实清单(硬事实 50 条)
- SkinCon 全称 “SkinCon: A skin disease dataset densely annotated by domain experts for fine-grained model debugging and analysis”。
- 出品机构:斯坦福大学(皮肤科 × 计算机科学系 × 生物医学数据科学系)。
- 作者:Roxana Daneshjou、Mert Yuksekgonul(共同一作,∗Equal Contribution)、Zhuo Ran Cai、Roberto Novoa、James Zou。
- 通讯邮箱集合:{roxanad, merty, zrcai, rnovoa, jamesz}@stanford.edu。
- 发表:NeurIPS 2022 Datasets and Benchmarks Track(第 36 届 NeurIPS 数据集与基准赛道)。
- arXiv 预印本:arXiv:2302.00785,[v1] 提交于 2023-02-01 22:39:51 UTC,cs.CV 分类。
- DOI(arXiv):10.48550/arXiv.2302.00785。
- 总图像数:3886 = Fitzpatrick17k 子集 3230 + DDI 子集 656(Table 5 脚注)。
- 概念总数:48 个临床概念(+1 个质控标签 “Do not consider this image”,Table 5 共 49 行)。
- 概念四大维度:形态学原发皮损 / 继发改变与质地 / 形状 / 颜色。
- 概念表制定者:两位临床皮肤科医生(经验 5 年与 6 年)。
- 主标注者:单一皮肤科医生,经验 6 年。
- 第一轮验证:board-certified 皮肤科专家抽验 323 张(10% Fitzpatrick17k),概念一致 1056/1082 = 97.6%。
- 第二轮验证:DDI 全部 656 + Fitzpatrick17k 随机 300 = 956 张独立重标;图像合格率 94%;总体一致率 94%(Fitz 92% / DDI 94%)。
- 独立验证者:两位皮肤科医生,经验 12 年与 5 年。
- 论文声明无 IRB(标注公开可得数据)。
- 概念频率最高(Fitzpatrick17k):Erythema 2139、Plaque 1967、Papule 1170。
- 概念频率最高(DDI):Papule 410、Brown 363、Erythema 235。
- DDI 上为 0 的概念(部分):Vesicle/Abscess/Pustule/Bulla/Excoriation/Purpura/Fissure/Induration/Xerosis/Sclerosis/Flat topped/Blue/Poikiloderma/Salmon/Wheal/Acuminate/Burrow/Gray/Cyst。
- 质控标签计数:Fitzpatrick17k 460 张、DDI 20 张。
- Table 1 肤色分布(Fitzpatrick17k):FST I-II 1738 / III-IV 1350 / V-VI 467 / Unknown 135,合计 3690 ≠ 3230(坑 5)。
- Table 1 肤色分布(DDI):FST I-II 208 / III-IV 241 / V-VI 207,合计 656(自洽)。
- "≥50 张图的概念"三口径:22(Fitz 单独)/ 25 / 28(combined)——论文内部不自洽(坑 3)。
- 基线模型:DeepDerm(Inceptionv3,Esteva et al. 2017 数据训练,二分类 benign/malignant)。
- 数据泄漏声明:DeepDerm 训练数据与 Fitzpatrick17k 有泄漏,全部测试在独立 DDI 上。
- PCBM 结果(DDI 总体):DeepDerm 0.595 vs PCBM 0.639±0.001。
- PCBM 结果(DDI I-II):0.649 vs 0.643±0.002。
- PCBM 结果(DDI III-IV):0.632 vs 0.727±0.002(提升最大)。
- PCBM 结果(DDI V-VI):0.528 vs 0.542±0.002。
- 概念权重(正/恶性):Ulcer 1.190、Telangiectasia 1.022、Black 0.746、Purple 0.489、Friable 0.307。
- 概念权重(负/良性):Patch −0.960、Pustule −0.836、Scar −0.711、Dome-shaped −0.130。
- 概念探测(CAV):用 ≥50 张图的 22 概念,每探针 50 对正/负样本,留 10 出 CV 重复 25 次。
- PCBM 训练/测试切分:Fitzpatrick17k 未用于概念标注的图像,训练 2787(80%)/ 测试 697(20%)。
- 计算硬件:单卡 NVIDIA Titan Xp GPU;代码随论文补充材料发布。
- PCBM 方法出处:Yuksekgonul et al. 2022, arXiv:2205.15480。
- 项目主页:http://skincon-dataset.github.io/ (论文 §6 引 https://SkinCon-dataset.github.io)。
- 图像许可:Fitzpatrick17k 与 DDI 均"科研、非商业用途"(scientific, non-commercial)。
- 标注文件许可:官方页与论文未单独声明 SPDX(待核)。
- 无官方 HuggingFace / Zenodo 镜像(抓取时点)。
- 同名撞库对象:SkinCON/DRAPS(Ren et al., MICCAI 2024, UC Berkeley 等,基于 ISIC 2019,约 25331 张 / 937167 判断 / 10509 参与者,站点 https://skincon.github.io/ )。
- 概念表四大维度:原发皮损 11 项 / 继发改变与质地 14 项 / 形状 8 项 / 颜色 11 项 / 其他结构性 4 项 = 48 项。
- 质量控制标签计数:Fitzpatrick17k 460 张、DDI 20 张(Table 5 第 49 行)。
- 论文图 2b 给出 Fitzpatrick17k 子集的"每图概念数分布"(稠密多标签证据)。
- 论文图 3 给出"用概念解释一次漏判"的案例(缺 telangiectasia/ulcer/friable)。
- SkinCon 使用的两源图像许可口径原文:both of these datasets are available for scientific, non-commercial use。
- 论文明确"无 IRB"(标注公开可得数据),伦理基础建立在两源公开性之上。
- 两源概念谱错配:DDI 上 20 余概念为 0,跨源概念泛化须先看覆盖率。
- 概念监督可跨病种迁移,对罕见皮肤病的数据效率有潜在价值。
- 复现时的对齐依赖两源 image id;Fitzpatrick17k 子集为随机抽样去噪后的 3230 张,DDI 为全量 656 张。
- 剔除低质量图像后有效样本少于 3886(Fitz 减 460、DDI 减 20 的量级)。
术语表(30 条)
| 术语 | 释义 |
|---|---|
| SkinCon | 斯坦福团队对 Fitzpatrick17k + DDI 的 48 临床概念稠密标注数据集(本条目) |
| Concept(概念) | 可通过图像观察判断存在的临床皮损描述项,如红斑、溃疡、鳞屑 |
| Dense annotation(稠密标注) | 每张图携带多个标签的标注方式(区别于单标签) |
| Multi-label(多标签) | 一张图可同时属于多个概念类别,标签不互斥 |
| 原发皮损(primary morphology) | 皮肤病最初出现的皮损形态(丘疹、斑块、水疱等) |
| 继发改变(secondary change) | 皮损演变或搔抓后出现的改变(结痂、糜烂、鳞屑、瘢痕等) |
| Erythema | 红斑,SkinCon 中 Fitzpatrick17k 最高频概念(2139) |
| Papule | 丘疹,DDI 中最高频概念(410) |
| Ulcer | 溃疡,PCBM 中指向恶性权重最高的概念(1.190) |
| Telangiectasia | 毛细血管扩张,指向恶性权重 1.022 |
| Patch | 斑(平坦色变区),指向良性权重 −0.960 |
| Pustule | 脓疱,指向良性权重 −0.836 |
| Fitzpatrick17k | 含 Fitzpatrick 肤色标注的皮肤病图像数据集(SkinCon 主源,3230 张) |
| DDI(Diverse Dermatology Images) | 皮肤科多样性图像集(SkinCon 验证源,656 张;Daneshjou et al. 2022) |
| Fitzpatrick skin type(FST) | 皮肤类型分档(I-VI),I-II 白皮肤、III-IV 橄榄/浅棕、V-VI 深棕/黑 |
| PCBM | Post-hoc Concept Bottleneck Model,事后概念瓶颈模型 |
| CBM | Concept Bottleneck Model,概念瓶颈模型 |
| CAV | Concept Activation Vector,概念激活向量 |
| CCE | Concept-based Counterfactual Explanation,基于概念的反事实解释 |
| Concept probing | 用线性探针检验模型表征是否编码某概念 |
| Slice discovery | 按子群(概念/肤色)切分数据以定位模型系统性失效 |
| Slice(切片) | 数据的一个子群(如某概念子集、某肤色段) |
| DeepDerm | 基线皮肤诊断模型(Inceptionv3,Esteve et al. 2017 数据) |
| Inceptionv3 | 经典 CNN 架构,DeepDerm 的骨干 |
| AUC | ROC 曲线下面积,二分类性能指标 |
| Benign / Malignant | 良性 / 恶性(本数据集的诊断二分类) |
| 数据泄漏(data leakage) | 测试数据混入训练数据,导致性能高估 |
| board-certified | 经专业认证的(皮肤科)执业医师 |
| 观察者间变异 | 不同标注者对同一图像判断不一致的程度 |
| IRB | 机构审查委员会(伦理审查);本数据集声明无 IRB |
| SPDX | 软件/数据许可的标准标识符;标注文件未声明 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | SkinCon |
| url_name | skincon |
| 类型 | 概念标注数据集 + 方法论文 + 可解释性基准(三合一) |
| 论文 | NeurIPS 2022 D&B Track;arXiv:2302.00785 |
| 机构 | Stanford University(皮肤科/CS/生物医学数据科学) |
| 规模 | 3886 张(3230 + 656)× 48 概念 |
| 获取 | 标注经项目主页;图像经两源官网 |
| 许可 | 图像科研非商业;标注未明 |
| 库内互链 | fitzpatrick-17k(55)、ddi(171) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文开放获取、NeurIPS 收录;但"SkinCon"名易与 SkinCON/DRAPS 撞库,且素材依附两源 |
| A 可获取性 | 5 | 概念标注可下载,但图像须回两源官网另取、且受科研非商业约束;无官方镜像——核心失分项 |
| I 可互操作 | 6 | 概念标注为表格/CSV,须自行按 image id 与两源图像对齐;无官方统一加载工具 |
| M 元数据质量 | 7 | 概念表(Table 5)、肤色分布(Table 1)、基准(Table 2/3)齐全;但 Table 1 与子集数不自洽(坑 5)、≥50 概念三口径冲突(坑 3)降分 |
| S 可持续性 | 6 | 依托 GitHub Pages(主页)与两源官网,长期可访问性中等;无官方镜像与版本体系 |
| 综合评级 | 6.2/10(中上) | 方法学与专家标注质量高于均值;可获取性被"三入口"与许可约束拖低 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 3886 = 3230 + 656 | 论文 Table 5 脚注 | arXiv/NeurIPS 全文 |
| 48 概念 + 质控标签 | 论文 Table 5 | 全文 |
| 一致性 1056/1082=97.6% | 论文验证节 | 全文 |
| 独立重标 94%(Fitz 92/DDI 94) | 论文验证节 | 全文 |
| PCBM 0.639 vs DeepDerm 0.595 | 论文 Table 2 | 全文 |
| DDI(III-IV) 0.727 vs 0.632 | 论文 Table 2 | 全文 |
| 概念权重 Ulcer 1.190 / Patch −0.960 | 论文 Table 3 | 全文 |
| 肤色分布 1738/1350/467/135 | 论文 Table 1 | 全文 |
| 无 IRB 声明 | 论文方法节 | 全文 |
| 图像科研非商业 | 论文数据节 | 全文 |
| 项目主页 | 论文 §6 Conclusions | 全文 |
附录 D:数据获取决策树
需求是什么?
├── 只想做概念瓶颈/可解释实验
│ ├── 1) 项目主页下载 SkinCon 概念标注(Fitz 版 + DDI 版)
│ ├── 2) Fitzpatrick17k 官网取 3230 张图
│ ├── 3) DDI 官网取 656 张图
│ └── 4) 按 image id 对齐后训练/评测 CBM
├── 只想引用"可解释不牺牲性能"论点
│ └── 引论文 Table 2(0.639 vs 0.595)+ Table 3 概念权重,注明测试在 DDI
├── 只想做皮肤 AI 公平性
│ └── 用 Table 1 肤色分层,先核对口径(坑 5),结合 DDI(V-VI) 低分现象
└── 想复现专家概念标注流程
└── 读论文方法节 + 附录 F 骨架;冻结概念表 + 双轮验证
附录 E:概念维度与临床意义映射
| 维度 | 代表概念 | 临床意义 | 模型用法 |
|---|---|---|---|
| 原发皮损 | Papule/Plaque/Vesicle | 病变基础形态 | 概念探测基础 |
| 继发改变 | Crust/Scale/Erosion | 病程/搔抓后改变 | 解释恶性关联(Ulcer) |
| 形状 | Pedunculated/Warty/Dome-shaped | 病变轮廓 | 良性指向(Dome-shaped) |
| 颜色 | Erythema/Brown/Black/Purple | 色素与血管特征 | 恶性指向(Black/Purple) |
| 质控 | Do not consider this image | 图像可用性 | 数据清洗 |
附录 F:专家概念标注流程复现骨架(SOP 模板)
阶段 0 概念表制定(冻结)
- 2 位以上临床专家依据教科书+实践提炼概念
- 定义每个概念的可观察判据,形成固定词汇表(schema 冻结)
阶段 1 界面实现
- 标注界面:展示候选概念,逐图勾选(多选)
- 验证界面:展示已标概念,逐项确认/否定
阶段 2 大规模标注(单一标注者保一致性)
- 分配全部图像;标注者只看图与概念表
阶段 3 双轮验证
- 轮 1:专家小样本抽验(测认可度,如 10%)
- 轮 2:独立标注者大样本重标(测可复现性,含跨源)
阶段 4 出厂
- 统计每概念频率、每图概念数分布
- 标注图像质量标签(Do not consider this image)
- 输出概念标注表 + 验证记录
附录 G:PCBM 评估骨架(代码)
# 事后概念瓶颈模型(PCBM)评估骨架(示意,非官方代码)
# 1) 用概念标注训练概念预测头(多标签)
concept_head = train_multilabel(features_train, concepts_train)
# 2) 用预测概念训练 benign/malignant 头
# 只使用"未用于概念标注"的 Fitzpatrick17k 切分(论文:2787 train / 697 test)
import numpy as np
pred_concepts = concept_head.predict(features_fitz_train)
diagnosis_head = train_binary(pred_concepts, labels_fitz_train)
# 3) 在独立 DDI 上测试(规避泄漏)
pred_concepts_ddi = concept_head.predict(features_ddi)
auc_pcbm = roc_auc_score(labels_ddi, diagnosis_head.predict_proba(pred_concepts_ddi))
# 4) 概念权重:读 diagnosis_head 的线性系数
concept_weights = dict(zip(concept_names, diagnosis_head.coef_[0]))
# 正权重指向 malignant(如 Ulcer 1.190),负权重指向 benign(如 Patch -0.960)
附录 H:同名撞库对照表(SkinCon vs SkinCON/DRAPS)
| 维度 | SkinCon(本条目) | SkinCON / DRAPS |
|---|---|---|
| 机构 | Stanford University | UC Berkeley 等 |
| 论文 | NeurIPS 2022 D&B | MICCAI 2024 |
| 图像源 | Fitzpatrick17k + DDI | ISIC 2019 |
| 规模 | 3886 张 | 约 25331 张 |
| 标签 | 48 临床概念(多标签) | 937167 条诊断判断 / 10509 参与者 |
| 任务 | 概念调试、可解释性 | 诊断判断 / 不确定性预测 |
| 站点 | skincon-dataset.github.io | skincon.github.io |
附录 I:概念频率(Table 5)抽样登记
| 概念 | Fitzpatrick17k | DDI |
|---|---|---|
| Erythema | 2139 | 235 |
| Plaque | 1967 | — |
| Papule | 1170 | 410 |
| Brown | — | 363 |
| Pustule | 若干 | 0 |
| Vesicle | 若干 | 0 |
| Ulcer | 若干 | 若干 |
说明:完整 48 概念 × 2 源的逐项计数见论文 Table 5;本表仅登记已知高低频锚点,避免转述误差。
附录 J:双口径登记表
| 事项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|
| 发表年 | 2022(NeurIPS 会议) | 2023(arXiv 2023-02-01) | 引用定口径、全篇一致(坑 2) |
| 图像数 | 3886(精确加总) | “近 4000”(第三方) | 以 3886 为准(坑 4) |
| ≥50 概念数 | 22(Fitz 单独)/ 28(combined DDI) | 25(combined Fitz) | 三口径存照,标出处(坑 3) |
| Fitz 肤色合计 | 3690(Table 1) | 3230(子集数) | 不自洽,须核口径(坑 5) |
| 概念数 | 48(概念) | 49(Table 5 行) | 48 概念 + 1 质控(坑 6) |
| Σ 站点名 | skincon-dataset.github.io | SkinCon-dataset.github.io | 大小写差异,同一站点 |
附录 K:库内皮肤病数据集互链表(含 rid)
| url_name | rid | 与 SkinCon 的关系 |
|---|---|---|
| fitzpatrick-17k | 55 | 直接上游(主标注对象) |
| ddi | 171 | 直接上游(外部验证子集) |
| ham10000 | 60 | 同域诊断数据集 |
| pad-ufes-20 | 151 | 同域临床图像集 |
| derm7pt | 110 | 早期属性标注(历史对照) |
| derm12345 | 742 | 同域诊断数据集 |
| dermacon-in | 781 | 同域多模态数据集 |
| skincap | 782 | 同域皮肤图文数据集 |
| isic-archive | 56 | 同域大体量图像集 |
| isic-2018 | 710 | 同域(与同名撞库对象有关) |
| isic-2019 | 707 | 同域(SkinCON/DRAPS 的图像源) |
| isic-2020 | 715 | 同域 |
| oai | — | 跨域概念数据集(18 概念,方法对照) |
附录 L:引文规范
@inproceedings{daneshjou2022skincon,
title = {SkinCon: A skin disease dataset densely annotated by domain experts
for fine-grained model debugging and analysis},
author = {Daneshjou, Roxana and Yuksekgonul, Mert and Cai, Zhuo Ran
and Novoa, Roberto and Zou, James},
booktitle = {Advances in Neural Information Processing Systems 35
(NeurIPS 2022), Datasets and Benchmarks Track},
year = {2022}
}
引用图像时另引两源:Fitzpatrick17k(Daneshjou et al. 2022)与 DDI(Daneshjou et al. 2022, Science Advances)。
附录 M:缩写速查
| 缩写 | 全称 |
|---|---|
| CBM | Concept Bottleneck Model |
| PCBM | Post-hoc Concept Bottleneck Model |
| CAV | Concept Activation Vector |
| CCE | Concept-based Counterfactual Explanation |
| DDI | Diverse Dermatology Images |
| FST | Fitzpatrick Skin Type |
| AUC | Area Under the ROC Curve |
| IRB | Institutional Review Board |
| D&B | Datasets and Benchmarks (Track) |
附录 N:本条目生产档案
| 项 | 值 |
|---|---|
| url_name | skincon |
| 生产代理 | agent-b-skincon |
| 锁文件 | writing/skincon/.lock |
| 事实档案 | writing/skincon/FACTS.md |
| 一手来源 | arXiv:2302.00785(PDF 全文)、NeurIPS 2022 proceedings、项目主页、第三方索引 |
| 存在性核验 | 三源互证(arXiv + 官方站点 + 第三方索引) |
| 同名排除 | SkinCON/DRAPS(MICCAI 2024)经机构/规模/任务三重比对排除 |
附录 O:48 概念按维度的完整登记(对照 Table 5)
| 维度 | 概念数 | 概念清单(英文) |
|---|---|---|
| 形态学原发皮损 | 11 | Vesicle, Papule, Macule, Plaque, Abscess, Pustule, Bulla, Patch, Nodule, Ulcer, Cyst |
| 继发改变与质地 | 14 | Crust, Erosion, Excoriation, Atrophy, Exudate, Purpura/Petechiae, Fissure, Induration, Xerosis, Telangiectasia, Scale, Scar, Friable, Sclerosis |
| 形状 | 8 | Pedunculated, Exophytic/Fungating, Warty/Papillomatous, Dome-shaped, Flat topped, Umbilicated, Acuminate, Burrow |
| 颜色 | 11 | Brown, Translucent, White, Purple, Yellow, Black, Erythema, Blue, Salmon, Gray, Pigmented |
| 其他/结构性 | 4 | Lichenification, Poikiloderma, Comedo, Wheal |
| 概念合计 | 48 | — |
| 质量控制(不计入) | 1 | Do not consider this image |
说明:上表按维度归类,英文名以论文 Table 5 为准;各概念的逐源计数见附录 I 与论文原表。
附录 P:验证协议对照表
| 轮次 | 验证者 | 经验 | 样本 | 规模 | 结果 |
|---|---|---|---|---|---|
| 第一轮 | board-certified 皮肤科专家 | — | Fitzpatrick17k 抽验 | 323 张(10%) | 概念一致 1056/1082 = 97.6% |
| 第二轮 | 两位独立皮肤科医生 | 12 年 / 5 年 | DDI 全部 + Fitz 随机 300 | 956 张 | 图像合格 94%;总体一致 94%(Fitz 92% / DDI 94%) |
附录 Q:PCBM 结果登记表(论文口径)
| 测试子群 | DeepDerm AUC | PCBM AUC | 差值 |
|---|---|---|---|
| DDI 总体 | 0.595 | 0.639±0.001 | +0.044 |
| DDI (I-II) | 0.649 | 0.643±0.002 | −0.006 |
| DDI (III-IV) | 0.632 | 0.727±0.002 | +0.095 |
| DDI (V-VI) | 0.528 | 0.542±0.002 | +0.014 |
附录 R:概念权重登记表(论文 Table 3)
| 概念 | 权重 | 指向 |
|---|---|---|
| Ulcer | 1.190 | Malignant |
| Telangiectasia | 1.022 | Malignant |
| Black | 0.746 | Malignant |
| Purple | 0.489 | Malignant |
| Friable | 0.307 | Malignant |
| Patch | −0.960 | Benign |
| Pustule | −0.836 | Benign |
| Scar | −0.711 | Benign |
| Dome-shaped | −0.130 | Benign |
附录 S:检索关键词组合示范
精确找本条目:
"SkinCon" AND ("concept" OR "fine-grained model debugging")
"SkinCon" AND ("Stanford" OR "Daneshjou")
site:arxiv.org 2302.00785
排除同名撞库:
排除 "SkinCON" / "DRAPS" / "MICCAI 2024" / "ISIC 2019" / "uncertainty"
找下游用法:
"SkinCon" AND ("concept bottleneck" OR "CAV" OR "PCBM")
"SkinCon" AND ("Fitzpatrick17k" OR "DDI")
附录 T:常见误用与纠正
| 误用 | 纠正 |
|---|---|
| 把"近 4000 张"当硬数字 | 用 3886(3230+656),坑 4 |
| 把 SkinCon 当作 SkinCON/DRAPS | 机构/规模/任务三重区分,坑 1 |
| 把质控标签算作第 49 个概念 | 48 概念 + 1 质控,坑 6 |
| 用 Table 1 肤色比例直接除以 3230 | 口径不自洽,先核对,坑 5 |
| 以为下载标注就拿到了图像 | 图像须回两源官网另取,坑 8 |
| 把"科研非商业"当作可商用 | 商用须回源确认,坑 7 |
| 用单标签准确率评估 | 应用多标签指标(每概念 AUC 等) |
附录 U:AI-Ready 检查单
| 检查项 | 状态 |
|---|---|
| 数据集真实存在(三源互证) | ✅ arXiv + 官方站点 + 第三方索引 |
| slug 无撞库 | ✅ 库内仅 skincap 含 “skin”,无 skincon |
| 许可明确 | ⚠️ 图像科研非商业;标注文件未单独声明(待核) |
| 获取路径明确 | ⚠️ 三入口(Fitz/DDI 官网 + 项目主页) |
| 元数据完备 | ✅ 概念表 + 肤色 + 基准表齐全 |
| 有官方镜像 | ❌ 抓取时点无 HF/Zenodo 官方镜像 |
| 可复现评测 | ✅ 基准协议与代码随论文发布 |
附录 V:缩写与全称对照(补充)
| 缩写 | 全称 |
|---|---|
| DDI | Diverse Dermatology Images |
| FST | Fitzpatrick Skin Type |
| D&B | Datasets and Benchmarks (Track) |
| SLA | 参考金标准条目 panda-plus 的结构(本条目遵循同一规范) |
附录 W:与金标准条目(panda-plus)的结构对照
| 结构要素 | panda-plus | skincon(本条目) |
|---|---|---|
| 九节事实档案 | ✅ FACTS.md | ✅ FACTS.md |
| INFOBOX 一屏速览 | ✅ | ✅ |
| §0-§11 章节 | ✅ | ✅(含 §10A 深化) |
| 坑点 ≥5 | ✅(8 个) | ✅(8 个 + 速查表 + 三类共性) |
| DAIMS 全表 | ✅ | ✅(附录 B) |
| 事实清单 | ✅ | ✅(50 条) |
| 术语表 | ✅ | ✅(30 条) |
| FAQ | ✅ | ✅(32 问) |
| 附录 A-Z | ✅ | ✅(A-W) |
| 尾注 | ✅ | ✅ |
附录 X:本条目与同名集的"一句话划界"
如果你要的是"给皮肤图像打 48 个临床概念标签、做概念瓶颈模型",那是本条目的 SkinCon(斯坦福,3886 张)。如果你要的是"评估模型对皮肤病的诊断不确定性/判断一致性",那是 SkinCON/DRAPS(UC Berkeley,ISIC 2019,25331 张)。
附录 Y:概念探测 vs 概念瓶颈对照
| 维度 | 概念探测(CAV) | 概念瓶颈(CBM/PCBM) |
|---|---|---|
| 是否改模型结构 | 否 | 是(插入概念层) |
| 概念标签用途 | 训练探针 | 训练概念头 |
| 输出 | 概念可分性分数 | 概念预测 + 诊断 |
| 本论文用法 | 22 概念、50 对样本、留 10 出 CV | DDI 上测 AUC 0.639 vs 0.595 |
| 适合问题 | “模型学没学到这个概念” | “用概念做诊断好不好” |
附录 Z:采集与标注成本对比
| 环节 | 成本量级 | 说明 |
|---|---|---|
| 图像采集 | 未发生(借用两源) | SkinCon 的"零采集"设计 |
| 概念表制定 | 2 位专家 × 少量时间 | 一次性的 schema 冻结 |
| 大规模标注 | 1 位专家 × 3886 张 | 每张数秒至数十秒的勾选判断 |
| 双轮验证 | 1 位专家(323 张)+ 2 位专家(956 张) | 抽验 + 独立重标 |
附录 AA:使用 SkinCon 的研究检查清单(10 项)
- 是否明确区分了 SkinCon(概念标注)与两源(图像)的引用?
- 是否从两源官网正确获取了对应图像并按 image id 对齐?
- 是否处理了 “Do not consider this image” 低质量标签?
- 多标签评估是否用了概念级指标而非单标签准确率?
- 概念数口径(22/25/28)是否在文中说明?
- 肤色分层(Table 1)口径是否核对(3690 vs 3230)?
- 测试是否放在独立集(DDI)以避免泄漏?
- 是否报告了深肤色段(V-VI)的亚组结果?
- 商用/再分发前是否回源确认标注文件许可?
- 是否核查过没有把 SkinCON/DRAPS 的结果误引为本条目?
尾注
- 本条目所有硬数字均出自 arXiv:2302.00785 与 NeurIPS 2022 Datasets and Benchmarks Track 论文正文与表格;转述性数字按双口径登记表处理。
- 论文内部不自洽处(Table 1 肤色分布、≥50 概念数)已在坑 3、坑 5 明确存照,未做主观调和。
- “SkinCon” 与 “SkinCON/DRAPS” 的同名撞库风险贯穿检索与引用全程,见坑 1 与附录 H。
- 项目主页可访问性在抓取时点存在波动,标注下载链接以人工复核为准(§6.3)。
- 本条目为千方病案医数集 AI-Ready Wikipedia 条目,遵循库内九节事实档案 + 金标准条目的结构规范。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- derm12345 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- ph2 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
- ddi — 共享标签:医学影像 / 皮肤影像 / 评测基准 / 皮肤癌
- dermacon-in — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
- bcn20000 — 共享标签:医学影像 / 皮肤影像 / 皮肤癌
- isic-2018 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
- fitzpatrick-17k — 共享标签:医学影像 / 皮肤影像 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

