DermaCon-IN (dermacon-in) — 首个南亚肤色多概念标注皮肤病数据集 — AI-Ready Wikipedia

IIT 海得拉巴牵头、南印度三家三级医院前瞻采集 5,450 张门诊临床照片(3,002 患者 / 245 诊断),每图带病灶描述符+解剖部位+双肤色量表三重稠密标注,按 Rook 分类学三层分层并开源 CC BY-NC-SA 4.0——首个以印度肤型为中心、同时覆盖解剖与形态概念的皮肤病数据集

来源 南印度北卡纳塔克三家三级医院及附属区域诊所门诊前瞻采集的高分辨率临床照片(108MP Android/48MP iPhone Pro/12–36MP 相机,非皮肤镜),附 47 病灶描述符+49 解剖部位+8 大类/19 亚类/245 疾病标签+Fitzpatrick 与 Monk 双肤色评分;Harvard Dataverse doi:10.7910/DVN/W7OUZM 发布发布时间: 2026-09-30最后更新: 2026-09-30 阅读 10
DermaCon-IN (dermacon-in) — 首个南亚肤色多概念标注皮肤病数据集 — AI-Ready Wikipedia

信息速览

数据集名称DermaCon-IN (dermacon-in) — 首个南亚肤色多概念标注皮肤病数据集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模5,450 张临床照片,来自 3,002 位南印度门诊患者(NeurIPS proceedings 版作 2,993 人,双口径存照)
接入方式南印度北卡纳塔克三家三级医院及附属区域诊所门诊前瞻采集的高分辨率临床照片(108MP Android/48MP iPhone Pro/12–36MP 相机,非皮肤镜),附 47 病灶描述符+49 解剖部位+8 大类/19 亚类/245 疾病标签+Fitzpatrick 与 Monk 双肤色评分;Harvard Dataverse doi:10.7910/DVN/W7OUZM 发布
AI 就绪度

INFOBOX — DermaCon-IN 一屏速览

维度 内容
本质 首个以印度(南亚)肤色为中心、多概念稠密标注的皮肤病临床图像数据集(非挑战赛、非皮肤镜)
主办 IIT Hyderabad 牵头,联合 Madarkar Hospital / S R Patil / S Nijalingappa / Sri Chamundeshwari 医学院与印度海军医疗系统
论文 arXiv:2506.06099(v1 2025-06-06 / v2 2026-01-08);NeurIPS 2025 D&B Track(DOI 10.52202/085713-3742)
数据 5,450 张临床照片 / 3,002 患者(proceedings 口径 2,993)/ 南印度门诊前瞻采集
标签 8 主类 → 19 亚类 → 245 疾病(Rook 分类学,对齐 ICD-11)
概念 47 病灶描述符 + 49 解剖部位 = 96 唯一概念
肤色 Fitzpatrick 与 Monk Skin Tone 双标;合标注契合印度表型(MST 4–9、FST 3–4)
基准 Swin-B 主类 70.41%;CBM 概念监督;跨库验证 PASSION 30/40、Fitzpatrick17k 33/40
采集 108MP Android / 48MP iPhone Pro / 12–36MP 相机,环境临床光,保留解剖上下文
获取 Harvard Dataverse doi:10.7910/DVN/W7OUZM 公开直链;代码 GitHub shan4035/DermaCon-IN-code
许可 CC BY-NC-SA 4.0(单一许可,无请求制/注册墙)
伦理 IIT Hyderabad 伦理委员会批准(protocol IITH/IEC/2025/01/05)
库内互链 Fitzpatrick 17k(55)、SCIN(181)、DDI(171)、HAM10000(60)、ISIC 系列(56/710/707/715)、DERM12345(742)、Derm7pt(110)、PAD-UFES-20(151)

DermaCon-IN 做的是一件在皮肤病 AI 圈里长期被忽略的事:把训练数据从"欧美皮肤镜下的黑色素瘤"换成"南亚门诊里的真菌感染、色素病与湿疹"。全球皮肤病 AI 模型的训练集高度集中于 ISIC、HAM10000、Fitzpatrick17k 等以肿瘤为中心或源于教学图谱的资源,深色皮肤与热带高发病种严重欠代表——文献报告在深肤色人群上准确率可下降 30–40%。DermaCon-IN 用一个前瞻采集、三重标注(疾病层级 + 病灶描述符 + 解剖部位)的数据集,正面填补了这块空白,并把"概念可解释性"(Concept Bottleneck Model)做成了官方基准的一部分。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——它是本库少见的"单一许可 + 公开直链",Harvard Dataverse 直接下载,无需申请。
  2. 关心公平性与代表性:直奔 §0 与 §4——看它如何对准肤色/病种双重偏倚,以及数据集自身的分布局限。
  3. 做可解释 AI:直奔 §5 概念瓶颈模型与 §7——96 个概念的监督设计与 21/47、16/49 的激活分析是核心。

§0 导读:这个数据集解决什么问题

皮肤病是全球第四大非致命疾病负担。AI 被寄望于在皮肤科医生稀缺的资源受限地区承担分诊与初筛,但这条路被一个瓶颈卡住:缺乏有代表性的训练数据。现有公开数据集呈现三重系统性偏倚——

  • 病种偏倚:ISIC、HAM10000、DERM12345 等以黑色素瘤/肿瘤为中心,主要含皮肤镜图像,忽略热带与低收入地区高发的感染性(真菌、病毒、寄生虫)、色素性、炎症性疾病(如疥疮、白癜风、湿疹)。
  • 肤色偏倚:Fitzpatrick17k 逾 75% 属 Type I–III(浅肤型),深色皮肤(Type IV–VI)严重欠缺;DDI 研究显示,在浅肤色为主数据上训练的模型于深肤色人群准确率下降 30–40%。
  • 来源偏倚:SD-198、Fitzpatrick17k 取自教学图谱(如 DermNet)而非真实临床库,标注维度单一(多数只有诊断标签,缺解剖与形态学描述);SCIN 虽为众包真实图像,但镜像美国病种模式。

DermaCon-IN 的回答是三重设计的叠加。第一,来源:从南印度三家三级医院及附属诊所前瞻采集真实门诊照片(非皮肤镜、非图谱),保留完整解剖上下文。第二,标注:每张图同时携带疾病层级标签(Rook 分类学,8 主类/19 亚类/245 疾病)、病灶描述符 + 解剖部位双概念集、以及 Fitzpatrick 与 Monk 双肤色量表评分——这是"临床试验如何被皮肤科医生看"的结构化复刻。第三,可解释性:官方基准不仅测分类精度,还训练 Concept Bottleneck Model(CBM),用概念层显式暴露模型"依据哪些病灶特征与解剖部位做出判断"。

§0 读法三则:

  1. 这个条目是"数据集 + 基准 + 公平性研究"三合一:本体是 5,450 张带三重标注的临床照片,基准含 Swin 与 CBM 两套结果,副产品是一套对皮肤病 AI 偏倚的正面回应。
  2. 全文数字以 arXiv v2(2026-01-08) 为准;与 NeurIPS proceedings 版及 Dataverse 描述不一致处(患者数、诊断数、作者数)已在坑点与 §9 存照。
  3. 检索时注意论文标题在两处版式不同(“Multi-concept” vs “Multiconcept-Annotated”),且幻灯片页眉有 “DermacomON-IN” 误拼——用 arXiv ID 或 Dataverse DOI 定位最稳(坑 1、坑 2)。

§1 数据集速览:十问十答

Q1:DermaCon-IN 的"5,450 张"是什么图像?
是临床照片,不是皮肤镜图像。用 108MP Android、48MP iPhone Pro 及 12–36MP 相机在南印度门诊环境光下拍摄,每张保留受影响部位及周围皮肤以维持解剖上下文——刻意区别于皮肤镜/紧密裁剪的单一病灶范式。

Q2:来自哪里、多少人?
南印度北卡纳塔克三家三级医院及附属区域诊所,患者人群覆盖 Karnataka、Maharashtra、Goa、Andhra Pradesh 四邦,共 3,002 位患者(proceedings 口径 2,993)。数据采集于 2024–2025 年,在机构伦理协议下完成。

Q3:标签体系是什么?
三级疾病分类学,改编自 Rook’s Textbook of Dermatology 并对齐 ICD-11:8 个病因学主类(从 Infectious 到 Neoplastic,含 No Definite Diagnosis)→ 19 个临床亚类(含"Inflammatory + Infectious (Bacterial)"这类混合态)→ 245 种细粒度疾病。

Q4:什么叫"多概念(multi-concept)"标注?
除疾病标签外,每张图独立标注两组临床概念:47 个病灶描述符(如 patch、plaque、scale、erythema、white/hypopigmentation)与 49 个解剖部位(用精确临床术语与区域标签如 trunk/extremities/scalp),合计 96 个唯一概念——为概念监督与可解释建模提供基础。

Q5:肤色怎么标?
同时采用 Fitzpatrick(FST)与 Monk Skin Tone(MST)双量表,直接基于非病变皮肤区域评分。这是对 Fitzpatrick 固有 UV 反应偏倚的正面回应;合标注契合印度表型分布(MST 4–9、FST 3–4)。

Q6:谁标注的、怎么保证质量?
4 位 board-certified 皮肤科医师(经验 11/3/3/1 年)分四子集标注,遵循三级疾病分类学;分歧经共识或由第三位专家仲裁。纳入要求两位医师诊断一致或随访验证。

Q7:基准结果如何?
主类(8 类)分类最佳为 Swin-B/4W12-384,准确率 70.41%(5 种子平均);亚类(19 类)基线 58.27%。CBM 概念监督下主类 68.12–68.57%,且概念激活分析显示 47 描述符中 21 个、49 部位中 16 个呈正激活。

Q8:能和别的数据集比吗?
可跨库验证:仅用 DermaCon-IN 训练的 CBM 在 PASSION 40 抽样中正确 30、Fitzpatrick17k 40 抽样中正确 33,Grad-CAM 经皮肤科医师复核——显示概念的跨数据集迁移性。

Q9:我现在能拿到什么?
全部在 Harvard Dataverse(doi:10.7910/DVN/W7OUZM):图像 zip(DATASET_0/1.zip,约 3.6 GB)、元数据表、划分文件、模型权重、训练/推理脚本,共 17 个文件。许可 CC BY-NC-SA 4.0。

Q10:为什么它对 AI-Ready 重要?
它是库内皮肤病公平性赛道的代表性区域数据集:以 Indian skin phototype 为中心、多概念稠密标注、单一宽松许可、公开直链、含可解释基准——与 Fitzpatrick17k(肤色公平性)、SCIN(真实世界众包)、ISIC/HAM10000(肿瘤/皮肤镜)构成完整对照面。

§1.1 与欧美主导数据集的四个结构性差异

把 DermaCon-IN 与它想"补足"的欧美数据集并置,能看到四处不是程度差异、而是结构性差异:

维度 欧美主导数据集(ISIC/HAM10000 类) DermaCon-IN
成像 皮肤镜(dermoscopy),标准化单病灶 临床照片,多共现病灶 + 解剖上下文
病种 肿瘤中心(黑色素瘤/痣/角化) 广病种(感染/炎症/色素/角化/附属器/肿瘤)
来源 教学图谱或专科转诊 门诊前瞻采集(基层真实分布)
标注 多为单一诊断标签 三层疾病 + 双概念 + 双肤色量表

这四处差异决定了模型行为也不同:在皮肤镜数据上训练的模型学到的是"标准化视野下的精细纹理判别",而在 DermaCon-IN 上训练的模型要学"变光照变视角下的解剖-形态联合推理"——后者更接近全科/基层医生的实际决策条件。

§1.2 为什么"解剖部位"这一维如此关键

论文反复强调的一个临床事实值得单独拎出:同一皮损形态在不同解剖部位指向不同诊断。头皮上的鳞屑性斑块多为银屑病,足部的鳞屑性斑块多为足癣(tinea pedis);面部红斑在不同区域可能是脂溢性皮炎、玫瑰痤疮或接触性皮炎。因此"部位"不是可有可无的元数据,而是诊断推理的约束条件。

这解释了为什么本数据集要把 49 个解剖部位与 47 个形态描述符并列为概念:模型若只学形态,会在"同形态不同诊断"处系统性犯错;把部位作为显式概念输入,才可能复刻"形态 + 解剖 = 诊断"的专家路径。论文用 Figure 5 的相关性统计证明这类关联在数据中的真实存在(如色素病类与 white 描述符 r=+0.71)。

§1.3 双肤色量表:一个常被低估的设计

多数皮肤病数据集只报 Fitzpatrick,而 Fitzpatrick(6 档)本质是UV 反应分型,并非色调分型——在深肤型上分辨率不足,且其在深色人群的适用性长期受质疑。Monk Skin Tone(10 档)以感知色调为轴,在深色端提供更细的分辨率。

DermaCon-IN 同时报告 FST 与 MST,好处有三:(1) 公平性分析可交叉验证——若模型在 FST 5-6 上掉分,可核对是否同样在 MST 8-9 上掉分;(2) 弥补 Fitzpatrick 在深色端的分辨率缺陷;(3) 为后续研究提供两种肤色分组口径,便于与国际文献对接(FST)同时保留更细的内部梯度(MST)。这是本条目建议后续公平性数据集采用的标准配置(见 §8.2)。

§2 数据构成与规格

2.1 规模、来源与机构构成

DermaCon-IN 的采集网络横跨南印度北卡纳塔克地区,由 IIT Hyderabad 牵头、多机构协作完成:

机构 角色
Indian Institute of Technology Hyderabad(IIT 海得拉巴) 牵头/算法与数据集整合,一作及多位作者所在
Madarkar Hospital(印度) 临床采集点之一(一作同姓,疑为家族关联医院)
SR Patil Medical College and Research Center, Badagandi 临床采集点(Mahajabeen Madarkar 所在)
S Nijalingappa Medical College 临床采集点
Sri Chamundeshwari Medical College, Hospital & Research 临床采集点(Vinaykumar MV 所在)
Indian Navy(印度海军医疗系统) 作者机构之一(Teli Prakash / Adarsh Kasturi 等)

Cohort 覆盖 Karnataka、Maharashtra、Goa、Andhra Pradesh 四邦,采集时间为 2024–2025 年。三家三级医院加附属区域诊所的组合,使样本兼具转诊复杂度与基层门诊广度——这正是论文强调的"真实门诊(outpatient)场景",区别于教学图谱的"精选典型病例"。

规模三数字(以 arXiv v2 为准):

指标 数值
临床照片 5,450 张(高分辨率 JPEG)
患者 3,002 人(proceedings 版 2,993)
疾病标签 245 种
主类 / 亚类 8 / 19
概念 47 描述符 + 49 部位 = 96
体量 ~4 GB

2.2 图像规格与采集协议

采集设计刻意镜像真实皮肤病诊疗流程,同时强调病灶细节与更广的解剖区域:

属性 规格
图像类型 临床照片(clinical photograph,非皮肤镜)
采集设备 108MP Android、48MP iPhone Pro、12–36MP 相机
光照 环境临床光(ambient clinical lighting)
取景 含受影响部位及周围皮肤,保留解剖上下文
协议 跨站点统一标准协议,但允许角度/距离/光照的自然变化以反映临床真实性
隐私处理 含可识别面部特征时做局部裁剪;肤色评分基于非病变皮肤区域
格式 高分辨率 JPEG

一处关键设计取舍:论文明确保留取景与光照的变异,而非追求皮肤镜式的标准化。理由是真实临床中同一皮肤病在不同角度、距离、光照下形态各异,模型必须学会这些不变性;这也使 DermaCon-IN 与 ISIC/HAM10000 等"皮肤镜单病灶"数据集在成像范式上正交互补。

纳入标准:所有年龄段、临床确诊的皮肤病患者(经知情同意);需两位 board-certified 医师诊断一致或随访验证;图像须满足可分级性且元数据完整(诊断、解剖区域、Fitzpatrick 与 Monk 评分、人口学、诊断确定性)。
排除标准:画质差、视觉遮挡(纹身、饰物)、元数据缺失、诊断不确定、拒绝参与者。

2.3 三级疾病分类学(Rook’s Classification)

数据集的核心结构是基于病因学的层级分类,改编自 Rook’s Textbook of Dermatology 并对齐 WHO 的 ICD-10/ICD-11:

  • 8 个主类(Main Class):从 Infectious 到 Neoplastic,含 No Definite Diagnosis,覆盖南亚门诊全谱系。论文指出高负担类如真菌感染与湿疹在体量上占主导,而罕见但临床重要的类(如角化病 keratinisation disorders)仍保有足够密度以支持少样本泛化。
  • 19 个亚类(Sub Class):用于捕捉混合与共病状态。例如 “Inflammatory + Infectious (Bacterial)” 反映真实世界中两种疾病叠加的多形性表现。
  • 245 个疾病叶节点:细粒度诊断,频率呈对数正态长尾分布,拟合指数 1.8——典型真实临床特征,提示必须采用不平衡感知的学习策略。

为什么用 Rook 而非扁平标签?论文论证四点:(1) 临床相关性——Rook 按病因与病理过程分层,模拟医生从广机制到具体实体的鉴别诊断推理;(2) 情境契合——印度门诊以真菌、色素、炎症病为主,Rook 结构比肿瘤中心的西方数据集更贴合 LMIC 就诊谱;(3) 学习优势——层级结构利于标签一致性、超类平衡与粗到细预测/多任务学习;(4) 互操作性——Rook 对齐 ICD-10/11,便于接入电子病历、计费与决策支持系统。

2.4 双概念标注:病灶描述符 + 解剖部位

"Multi-concept"是本数据集区别于同类资源的标志。每张图独立标注两组临床概念:

(1)47 个病灶描述符:涵盖原发皮损、继发改变、色素改变、血管异常、表面/甲异常五大门类。描述符集合借鉴 SkinCon 框架(papule、plaque、vesicle 等重叠),并根据区域高发病种做了裁剪:印度门诊常见白癜风与炎症后色素沉着,故精确的色素标注(white、gray、brown、pigmented)被纳入;高临床价值但低频的描述符(poikiloderma、gray、salmon)被保留以维持诊断粒度;translucent、friable、dome-shaped 因在 2D 临床照中缺乏可辨识视觉特征而被剔除。

(2)49 个解剖部位:用精确临床术语与区域标签(trunk、extremities、scalp 等)双轨组织。论文特别强调纳入被同类数据集忽略但诊断关键的腋下与腹股沟区域(对念珠菌病与皮肤癣诊断意义重大),并保留完整解剖区域视图以学习空间先验。

概念为何要联合标注? 论文用一个经典例子说明:头皮上的鳞屑性斑块可能提示银屑病,足部的鳞屑性斑块却可能是真菌感染(足癣)——同一皮损形态在不同部位指向不同诊断。通过联合标注病灶特征与解剖上下文,数据集让模型更接近皮肤科医生"形态特征 + 解剖位置 = 诊断"的真实推理路径。Figure 5 的相关系数分析(如 Pigmentary Disorders 下 white 描述符 r=+0.71,Keratinisation Disorders 下 hyperkeratotic plaques r=+0.47)从统计上验证了这套概念-疾病关联的生物学合理性与可解释性。

2.5 双肤色量表与人口学分布

数据集同时采用 Fitzpatrick Skin Type(FST)与 Monk Skin Tone(MST) 两套量表,论文称此为对 Fitzpatrick 固有 UV 反应偏倚的补救——MST 提供感知性替代,在深色端有更细的变化。

分布特征(附录 A.5 口径):

维度 分布
Fitzpatrick Type 4、5 最常见,其次 Type 3;Type 6 仅 136 张(深色端虽有覆盖但较少)
Monk Skin Tone 集中 MST 6–7;MST 4(较浅)与 MST 8–9(较深)较少
合标注定位 契合印度表型分布(MST 4–9、FST 3–4)
年龄 集中于 20–40 岁;次峰 10–20 与 40–60;儿童(0–10)与老年(60+)较少
性别 男 3,386 vs 女 2,064(约 1.64:1),疑与社会文化就医行为相关
病种-人口学 各群体中感染性、炎症性、色素性疾病均为最常见

"双标"本身是一个方法学卖点:Fitzpatrick 以 UV 反应为轴,在深肤型上分辨率不足;MST 以感知色调为轴,对深色端更细。同时报告两者,使研究者在公平性分析中可交叉验证肤色分组对模型表现的影响——这是 DDI 等纯粹依赖 Fitzpatrick 的公平性基准所欠缺的维度。

2.6 与同类数据集的位置对照

论文 Table 1 用七个维度对比了现有皮肤病 AI 数据集(A 肿瘤中心 / B 广病种 / C 皮肤镜单病灶 / D 实时多病灶多焦点 / E 有无部位标注 / F 有无病灶描述符 / G 是否 Rook 分类标签)。要点:

数据集 病种谱 采集类型 部位 描述符 Rook 标签
ISIC Archive 肿瘤中心 皮肤镜 ✓ ✗ ✗
HAM10000 肿瘤中心 皮肤镜 ✓ ✗ ✗
DERM12345 肿瘤中心 皮肤镜 ✗ ✗ ✗
Fitzpatrick17k 广病种 图谱 ✗ ✗ ✗
SD-198 广病种 图谱 ✗ ✗ ✗
SkinCon 广病种 图谱 ✗ ✓ ✓
SCIN 广病种 众包真实 ✓ ✓ ✗
PAD-UFES-20 仅癌症 手机 ✓ ✗ ✗
DermaCon-IN 广病种 临床多病灶 ✓ ✓ ✓

DermaCon-IN 的差异化定位清晰:唯一同时具备"广病种谱 + 真实临床多病灶采集 + 解剖部位 + 病灶描述符 + Rook 分层标签"五项的数据集。SCIN 同有部位与描述符但缺 Rook 分层且镜像美国病种;SkinCon 有描述符与 Rook 但源自教学图谱且非真实采集。这使 DermaCon-IN 在"公平性 + 临床真实性 + 可解释结构"的交叉点上目前是空缺填补者。

2.7 逐图元数据结构

依据 Dataverse 随附的 Metadata_schema.md 与论文描述,每张图像的记录至少包含以下字段族(具体字段名以 Dataverse 元数据表为准):

字段族 内容 用途
标识 image_id / subject_id 逐图与患者级关联(隐私去标识化)
疾病层级 main_class / sub_class / disease_label 8/19/245 三层标签
概念 lesion_descriptors[] / body_parts[] 47 描述符 + 49 部位的逐图概念集
肤色 fitzpatrick / monk_skin_tone 双量表肤色评分
质量 diagnostic_certainty / image_gradability 诊断确定性与可分级性
人口学 age_group / sex 年龄组与性别(非身份属性)

这份"稠密元数据"是数据集被称为"multi-concept annotated"的实体基础——它使研究者不仅能做分类,还能做概念监督、公平性分层、长尾分析、隐私敏感研究。逐图独立的概念集意味着同一疾病的不同实例可有不同概念组合,支撑了论文 Figure 5 的概念-疾病相关性统计。

2.8 数据划分与可复现性

论文采用按受试者(subject-wise)的 80:20 分层划分(按 Sub Class 分层),确保同一患者不会同时出现在训练与测试集——这是医学图像数据集的防泄漏底线,避免了"同患者不同部位图像"造成的虚高精度。Dataverse 随附 train_split.tab 与 test_split.tab 两个文件固定该划分,使结果可复现。

三处可复现性设计:

  1. 固定划分文件:train/test_split.tab 使任何团队能复现论文的 70.41% / 58.27% 基线。
  2. 权重公开:Swin_MC_best_model.pth 与三个 CBM 权重(各 ~348 MB)允许直接推理或初始化。
  3. 训练/推理脚本公开:train_swin_mc.py、train_cbm_mc.py、train_CBM_SC_MC_type1/2.py 与两个推理 Notebook,覆盖论文全部实验配置。

对复现者的提示:划分按 Sub Class 而非 Main Class 分层,意味着主类分布在两集间可能不完全均衡;报告主类指标时宜同时给出各类别的样本数。

2.9 主类-亚类的病因学图谱(扩读)

论文的层级结构不是分类学装饰,而是有临床推理含义的。8 个主类对应皮肤病学的病因学大类,其下亚类揭示"同类不同因"与"共病叠加":

  • Infectious(感染性):下分真菌(Fungal)、病毒(Viral)、寄生虫(Parasitic)、细菌(Bacterial)等亚类。南亚门诊中真菌感染(tinea 系列、念珠菌)与疥疮(scabies)高发,构成体量主力。
  • Inflammatory(炎症性):含 Eczema and Dermatitis(湿疹与皮炎)与其他炎症亚类。湿疹在体量与真菌并列主导。
  • Pigmentary(色素性):白癜风(Vitiligo)与炎症后色素沉着为主——印度门诊的高频诉求,也是"精确色素描述符"被纳入概念集的原因。
  • Keratinisation(角化性):如掌跖角化病,属"罕见但临床重要",论文称其保有足够密度以支持少样本泛化。
  • Appendageal(附属器):累及毛囊、皮脂腺、汗腺的疾病。
  • Neoplastic(肿瘤性):相对西方数据集占比更低,但保留以覆盖全谱系。
  • No Definite Diagnosis(无明确诊断):一个诚实的设计——真实的门诊存在无法确诊的病例,把它单列而非强行归类,避免了标签污染。

混合态亚类(如 “Inflammatory + Infectious (Bacterial)”)的存在尤其重要:真实患者常有叠加病变(如湿疹基础上的细菌感染),扁平标签体系无法表达这种共病,而层级 + 组合标签做到了。这是论文宣称 Rook 结构优于扁平结构的核心论据之一。

2.10 体量与存储规格

项 规格
图像格式 高分辨率 JPEG
数据集大小 约 ~4 GB
Dataverse 图像分卷 DATASET_0.zip(1.26 GB)+ DATASET_1.zip(2.34 GB)≈ 3.6 GB 压缩
元数据表 Skin_Metadata.tab(1.6 MB)
划分文件 train_split.tab(1.9 MB)+ test_split.tab(0.45 MB)
模型权重 Swin_MC(348 MB)+ CBM_MC(348 MB)+ CBM_SC_MC_type1(348 MB)+ type2(348 MB)
代码/Notebook 4 个 Python 脚本(8–22 KB)+ 2 个 Notebook(6–9 KB)
压缩比说明 图像 zip 合计约 3.6 GB,论文声称数据集约 4 GB——差异来自解压后与元数据/权重的计入口径

对存储规划的实际含义:仅用数据本体约 3.6–4 GB;若要复现全部基准,需额外约 1.4 GB 的模型权重空间;若在 512×512 分辨率下训练 Swin-B,显存需求是主要瓶颈而非磁盘。这与多数皮肤病数据集(多为数百 MB 到数 GB)同级,属"中等体量、可本地处理",不构成下载或存储障碍。

§3 标注流程与质量保障

3.1 采集-标注-质控 pipeline

数据集构建遵循"采集 → 标注 → 质控 → 基准评测"四段式流程:

  1. 采集:南印度三家三级医院及附属诊所门诊前瞻拍摄,统一标准协议,保留解剖上下文与临床光照变异。
  2. 标注:4 位 board-certified 皮肤科医师按可用性分四子集标注,遵循 Rook 三级分类学,同时做概念标注与肤色评分。
  3. 质控:纳入需两位医师诊断一致或随访验证;分歧经共识或第三位专家仲裁;跨标注者一致性通过校准会议维持。
  4. 基准评测:Swin 与多种 CNN/ViT 架构分类基线 + CBM 概念监督 + 跨数据集验证 + 可解释性分析。

3.2 标注人员与分工

项 内容
标注者 4 位 board-certified 皮肤科医师
经验分布 11 年、3 年、3 年、1 年
分工方式 全量数据分四个子集,按各医师可用性分配标注
标注内容 三层疾病标签 + 47 描述符 + 49 部位 + Fitzpatrick/MST 肤色 + 诊断确定性 + 图像可分级性
分歧处理 共识解决,或由第三位专家仲裁(adjudication)
一致性维护 calibration sessions(校准会议)定期进行
隐私 显式避免从图像推断身份相关属性;肤色直接基于非病变皮肤评分

一处设计细节:论文强调概念标注是逐图独立标注而非"按疾病类别固定概念"。同一个诊断为银屑病的图像,因患者、部位、肤型不同,其描述符组合可以不同——这种灵活性保留了真实变异性,也支撑了概念监督学习。Figure 5 的 Pearson 相关系数分析(疾病描述符-疾病类、解剖区域-疾病类两套弦图)从统计上验证了标注的生物学合理性。

3.3 伦理与隐私

  • 数据收集符合机构伦理指南,经 IIT Hyderabad 机构伦理委员会批准,protocol number IITH/IEC/2025/01/05。
  • 患者知情同意;仅图像满足可分级标准且元数据完整者保留。
  • 隐私保护融入数据集生命周期(采集、标注、隐私防护、预期用途),对齐人本计算机视觉(HCCV)负责任数据集策展最佳实践。
  • 含可识别面部特征时做局部裁剪,同时保留解剖上下文。
  • 明确避免从图像推断身份属性;肤色评分基于非病变区域。
  • 论文声明本研究无外部资助,所有贡献者出于对推进皮肤病 AI 研究的共同兴趣自发参与。

§4 基准评测结果

4.1 标准架构:Swin 领跑主类分类

论文在 8 主类(MC)与 19 亚类(SC)两个任务上基准了 CNN 与 ViT 两族架构,全部结果取 5 随机种子平均,采用按受试者(subject-wise)80:20 分层划分:

模型 预训练 MC 准确率 MC F1 MC Macro AUC
ResNet50 ImageNet 64.31 63.31 —
DenseNet121 ImageNet 65.20 64.37 —
EffNet-B4 ImageNet 64.28 63.38 —
ViT-B/16-224 ImageNet 64.09 62.98 —
ViT-B/16-384 ImageNet 66.95 65.78 —
MaxViT-B/512 ImageNet 66.92 65.90 —
Swin-B/4W12-384 ImageNet 70.41 69.69 78.51

Swin Transformer 在所有主类指标上一致最佳(准确率 70.41%、精确率 69.83%、灵敏度 70.41%、F1 69.69%、Macro AUC 78.51)。论文解释:Swin 的 shift-window 机制能高效建模非连续区域,其层级表征同时捕捉细粒度病灶细节与更广的空间模式——恰好契合"多共现病灶 + 多变解剖区域 + 层级多标签"的数据特征。

亚类(19 类)任务难度显著更高:Swin 基线准确率仅 58.27%(Macro AUC 83.11%)——粒度越细、类别越不平衡,性能下降越明显。

图像输入统一 resize+pad 到 512×512;Swin 骨干以 ImageNet-22k 预训练权重初始化并端到端微调;采用加权采样策略应对类别不平衡。

4.2 概念瓶颈模型(CBM):把"依据"摆到台面

CBM 的设计动机是让模型通过可解释的中间概念层做分类,而非黑箱。论文考察两种变体:

  • 1-level CBM:独立做 MC 或 SC 预测,用概念 logit 直接分类。
  • 2-level CBM(分层):联合预测 SC 与 MC,把概念层与层级分类结合。

CBM 概念集有三种配置:仅描述符(47)、仅部位(49)、两者合并(96)。基于 Swin 骨干的结果(Table 3):

分类头 概念集 准确率 F1 Macro AUC
CBM-D(+MC) 描述符 47 68.57 67.69 85.18
CBM-B(+MC) 部位 49 68.38 67.90 84.96
CBM(+MC) 描述符+部位 96 68.12 67.56 82.78
CBM-D(+SC) 描述符 47 56.42 55.63 80.16
CBM-B(+SC) 部位 49 55.88 54.87 78.94
CBM(+SC) 描述符+部位 96 57.37 56.90 78.39
分层 CBM(Type 1)SC 96 53.98 54.49 76.13
分层 CBM(Type 1)MC 96 67.78 66.92 79.53
分层 CBM(Type 2)SC 96 56.11 54.49 76.13
分层 CBM(Type 2)MC 96 69.90 69.08 77.01

三个读法要点:

  1. CBM 准确率略低于无概念基线(MC:~68% vs 70.41%),但 Macro AUC 反而更高(如 CBM-D 的 85.18 vs 基线 78.51)——概念瓶颈带来的是"更均衡的跨类判别",代价是少量绝对精度。
  2. 描述符与部位各有贡献:MC 任务上描述符(68.57)略优于部位(68.38),SC 任务上合并 96 概念(57.37)最好——说明细粒度下两类概念互补。
  3. 分层 CBM Type 2 在 MC 上达 69.90%,接近无概念基线,同时保留了概念可解释性——是比较成功的折中。

4.3 可解释性:模型盯住了哪些概念

论文对 Type 2 CBM 做后验分析:

  • 47 个描述符中 21 个呈正激活;49 个部位中 16 个呈正激活。
  • 即模型只选择性强调一小部分临床相关特征,忽略其余——可能因其余概念预测价值较低。
  • 论文用 Grad-CAM 对最佳概念做定位可视化,输出经 board-certified 皮肤科医师复核诊断准确性与定位相关性。

这一"概念稀疏激活"现象本身是重要发现:它表明模型确实学到了一套聚焦的概念表征,而非均匀地使用全部标注。

4.4 跨数据集验证:概念能否迁移

为检验概念的跨库泛化,论文用两个公开基准做跨数据集评估:

外部数据集 抽样数 Type 2 CBM 正确数 说明
PASSION 40 30 撒哈拉以南非洲色素性皮肤图像
Fitzpatrick17k 40 33 肤色公平性基准

做法:把外部数据集的标签空间对齐到 DermaCon-IN 的层级(因标签空间不同,各随机抽 40 例),用仅在本数据集训练的 CBM 预测。结果 30/40 与 33/40 的正确率,且产出的 Grad-CAM 在外部样本上仍具临床有效性与可解释性——验证了概念层(病灶形态 + 解剖部位)的跨人群迁移潜力。

4.5 结果解读的三条警戒线

  1. 主类 70.41% 不等于可直接临床部署。8 类粗分已经不易(长尾 + 类不平衡),19 亚类仅 58.27%、245 疾病更细分——真实临床诊断精度远未达标,本数据集的价值在于提供"公平且可解释"的起点而非终点。
  2. CBM 准确率略降不代表更差。Macro AUC 提升说明其跨类判别更均衡,配合概念可解释性与跨库迁移,CBM 在需要"讲清依据"的场景(临床辅助、审稿、监管)可能优于纯黑箱。
  3. 跨库 30/40、33/40 是小样本验证。各抽 40 例属提示性证据,非统计显著结论;且标签空间需人工对齐,存在映射歧义——引用时应注明样本量与对齐假设。

4.6 模型选择的工程权衡

从工程视角把主类结果重新排一遍,能看到"精度 vs 效率 vs 可解释"的三角:

目标 推荐配置 依据
最高主类精度 Swin-B/4W12-384(无概念层) 70.41%
精度 + 可解释平衡 分层 CBM Type 2(MC) 69.90% + 概念层
最均衡跨类判别 CBM-D(MC) Macro AUC 85.18
最高亚类精度 CBM-D+B(SC) 57.37%
轻量部署 ViT-B/16-224 64.09%(最低但最轻)

一个反直觉的观察:Swin 的 512 输入 + shift-window 机制在"多共现病灶 + 多变部位"场景下带来约 4–6 个百分点的增益,论文归因于其对非连续区域的建模能力。对于算力受限的部署场景,ViT-B/16-224 的 64.09% 与 Swin 的 70.41% 之间是"约 6 个百分点的精度"换"显著的显存与延迟节省"——是否值得取决于具体应用对错误成本的容忍度。

4.7 与皮肤病镜数据集的成绩不可直接横比

一个常见的误用是把 DermaCon-IN 的 70.41% 与 ISIC/HAM10000 上动辄 90%+ 的准确率直接比较。这不可比,原因有三:

  1. 任务不同:DermaCon-IN 是 8 类病因学粗分(且含 No Definite Diagnosis 类),ISIC 类多为 2–7 类肿瘤细分但类别更可分。
  2. 病种不同:本数据集以感染性、炎症性、色素性为主(形态高度重叠,如多种皮肤病都有鳞屑/红斑),而皮肤镜肿瘤类形态区分度更高。
  3. 成像不同:临床照片保留全景与光照变异,比标准化皮肤镜图像更难。

因此 70.41% 在"广病种临床照片 8 类"的语境下是合理基线,脱离语境横比会低估其难度、高估皮肤镜数据集的优势。

4.8 主干架构细节补充

论文的模型实验有几处工程细节值得复现者注意:

  • 输入分辨率:统一 resize + pad 到 512×512。这对保留病灶细节与解剖上下文都重要——过小的输入会丢失"部位"信息,而过大的输入增加显存压力。
  • 预训练:Swin 骨干以 ImageNet-22k 预训练权重初始化(非 ImageNet-1k),更大的预训练语料带来更强的通用特征。
  • 微调策略:端到端微调(非冻结)+ 加权采样应对类别不平衡。
  • 评估口径:全部指标取 5 随机种子平均并报告标准差(如 70.41 ± 0.41),提供了方差估计——这是高质量基准报告的做法,使用者引用时应带上标准差。
  • CBM 架构:Swin 编码器 → Dropout → 线性投影到概念 logit(c^ℓ ∈ ℝ^(B+D),B=49 部位、D=47 描述符)→ sigmoid 得概念向量 c ∈ [0,1]^(B+D);下游分类器 f 作用在概念 logit 上输出任务 logit y。1-level 版独立做 MC 或 SC;2-level 版联合预测两者。

4.9 结果的小样本稳健性观察

CBM 表格中有一处细节值得注意:部分 CBM 变体的标准差极小(如 CBM-D 的 SC 结果 56.42 ± 0.01),与基线模型的 58.27 ± 0.22 形成对比。极小的方差可能来自 CBM 训练配置下模型行为的稳定化,也可能与种子的实际影响被配置吸收有关——引用单个 CBM 数值时宜谨慎,优先看 Macro AUC 这类更综合的指标。

此外,分层 CBM 的 Type 1 与 Type 2 在 SC 任务上数值接近(53.98 vs 56.11),差异主要出现在 MC(67.78 vs 69.90)——说明两级联合训练的策略对主类判别更有帮助。这些细粒度差异对复现者选择配置有参考价值。

4.10 论文声称的三项核心贡献

回到论文本身,它明确列出三项贡献(key contributions),可作为引用时的"卖点清单":

  1. 首个以印度肤型为中心的稠密标注皮肤病数据集:5,450 张门诊临床照片,覆盖广泛皮肤病谱与肤色变异,正面回应非西方人群的欠代表问题。
  2. 首次同时提供"精确解剖位置 + 病灶级描述符"两类临床元数据:论文称"to the best of our knowledge, this is the first publicly available dataset to offer both annotation types at this scale and granularity"——为结构化监督与可解释建模提供基础。
  3. 基准结果 + 概念瓶颈模型:不仅给疾病分类基线,还给 CBM 结果,用于评估模型是否学到与专家推理对齐的医学概念。

第 2 项是最强的差异化声明:"解剖位置 + 形态描述符"在同一数据集内的规模级共存在公开资源中此前未见(SkinCon 有描述符但无真实采集、SCIN 有部位但缺描述符与 Rook 分层)。引用本数据集时,这项贡献是最有辨识度的定位。

§5 局限与使用边界

5.1 数据集自身的分布局限

论文与附录 A.5 自曝的边界(也是 AI-Ready 使用者必须纳入的约束):

局限 具体表现 对使用者的含义
区域单一性 全部来自南印度北卡纳塔克三家三级医院及附属诊所 是 region-specific 资源,非全球代表性样本;跨洲泛化需谨慎
性别不平衡 男 3,386 vs 女 2,064(约 1.64:1) 性别相关病种分析需分层校正
年龄偏斜 集中于 20–40 岁 儿童皮肤病(0–10)与老年(60+)欠代表,儿科/老年皮肤病模型需另找数据
肤色仍偏中档 FST 4/5 最常见、Type 6 仅 136;MST 集中 6–7 深色端占比提升但非均匀,极端深/浅肤型仍稀疏
长尾不平衡 245 疾病频率对数正态(指数 1.8) 罕见病样本稀疏,须用不平衡感知训练策略
采集非标准化 多设备 + 环境光,角度/距离/光照有变异 是刻意的临床真实性,但增加分布噪声

5.2 方法与标注局限

  • 概念集为裁剪版:47 描述符排除了 translucent、friable、dome-shaped 等 2D 图像不可辨识项——故概念量少于 SkinCon 全集,做概念对齐研究时须核对差异。
  • 肤色评分的主观性:FST/MST 评分即使基于非病变区域仍含观察者主观性,跨标注者校准缓解但不消除。
  • 分层标签的粒度风险:245 疾病叶节点高度长尾,多数类样本充足而尾部类可能仅数例——直接训练会欠拟合罕见病。
  • 诊断确定性与可分级性作为元数据存在,但论文未给出各档位的分布统计,使用者需从元数据表自行核算。

5.3 AI-Ready 评估(DAIMS 五维)

以库内 AI-Ready 检查单过一遍:

  • D 可发现性:arXiv + NeurIPS proceedings + Harvard Dataverse 三处独立标识,DOI 明确——良好。
  • A 可获取性:单一 CC BY-NC-SA 4.0 + 公开直链,无请求制、无注册墙、无需审批——本条目在本库可获取性光谱中属优良档。
  • I 可互操作:JPEG 图像 + TAB 元数据表 + PyTorch .pth 权重 + Notebook/脚本;无 DICOM/FHIR 官方映射,跨模态接入需自行转换。
  • M 元数据质量:论文 + Datasheet(补充材料)+ Metadata_schema.md + Skin_Metadata.tab 齐备;但多口径不一致(患者数/诊断数/作者数)需读者自行对齐。
  • S 可持续性:依托 Harvard Dataverse(长期归档,版本化 v1→v4)与 arXiv,平台稳定;代码依赖个人 GitHub 仓库,存在单点风险。

综合:AI-Ready 等级"良"——可获取性与可发现性优于多数皮肤病数据集,元数据丰富但存在口径漂移需存照。

§6 获取与许可

6.1 单一许可、公开直链

资产 入口 许可 门槛
数据集本体 Harvard Dataverse doi:10.7910/DVN/W7OUZM CC BY-NC-SA 4.0 无(公开可下)
代码 GitHub shan4035/DermaCon-IN-code 以仓库声明为准(待核) 无
论文 arXiv:2506.06099 / NeurIPS 2025 D&B 论文自身条款 无

CC BY-NC-SA 4.0 的含义(使用者必读):

  • BY(署名):任何使用须署名原作者与数据集。
  • NC(非商业):不得用于商业目的——商用管线需另获授权或改用允许商用的数据。
  • SA(相同方式共享):演绎作品(如在其上训练的再分发数据集、衍生标注)须以相同许可发布。注意模型权重是否属"演绎作品"在法学上仍有争议,稳妥做法是与作者确认。

这是本库皮肤病赛道中许可最简洁的条目之一:不像 PANDA-PLUS 三层异构、也无 ISIC 的注册墙——一张许可贯穿全部资产,减少了合规对齐成本,但 NC + SA 的双约束对商用与闭源最不友好。

6.2 Dataverse 文件清单(17 个文件)

文件 类型 体量 内容
DATASET_0.zip zip 1.26 GB 图像分卷 1
DATASET_1.zip zip 2.34 GB 图像分卷 2
Skin_Metadata.tab tab 1.6 MB 逐图元数据(标签/概念/肤色/人口学)
train_split.tab / test_split.tab tab 1.9 MB / 0.45 MB 按受试者分层划分
Metadata_schema.md markdown 5.9 KB 元数据字段说明
README.md markdown 2.4 KB 使用说明
Swin_MC_best_model.pth 权重 348 MB Swin 主类最佳权重
CBM_MC_best_model.pth 权重 348 MB CBM 主类权重
CBM_SC_MC_type1.pth / type2.pth 权重 各 348 MB 分层 CBM 权重
train_swin_mc.py / train_cbm_mc.py / train_CBM_SC_MC_type1/2.py Python 8–22 KB 训练脚本
Infer_Swin_MC.ipynb / Infer_CBM_MC.ipynb Notebook 6–9 KB 推理示例

6.3 版本链与引用规范

  • 版本链:Dataverse 首次发布 2025-05-16(v1)→ 现行 v4(2026-01-11 更新),标题仍记 “Release v1.0”;数据集发布早于 arXiv v1(2025-06-06)。
  • 引用优先级:数据引数据集(Dataverse DOI + CC BY-NC-SA),观点引论文(arXiv:2506.06099 / NeurIPS DOI 10.52202/085713-3742)。
  • 存档时点提醒:引用患者数/诊断数时先定口径(arXiv v2 的 3,002/245 vs proceedings 的 2,993/245+),全篇一致。

§7 生态与互链

7.1 在皮肤病 AI 数据集景观中的位置

DermaCon-IN 是"公平性 + 临床真实性"赛道的新成员,与库内条目构成完整对照:

数据集 rid 赛道角色 与本条目关系
Fitzpatrick 17k 55 肤色公平性基准 跨库验证对象(本 CBM 在其 40 抽样 33/40);同为公平性关切,但源自图谱
SCIN 181 众包真实世界皮肤影像 最相近的"真实采集"对手,但镜像美国病种、缺 Rook 分层
DDI 171 多样化皮肤图像公平性 本数据集引用其"深肤色准确率降 30–40%"作为动机
HAM10000 60 皮肤镜色素病变 论文 Table 1 对照(neoplasm-centric)
ISIC Archive / 2018 / 2019 / 2020 56/710/707/715 皮肤镜肿瘤影像 论文对照(皮肤镜单病灶范式)
DERM12345 742 皮肤镜多类 论文 Table 1 对照
Derm7pt 110 七点检查法皮肤镜 成像范式对照
PAD-UFES-20 151 手机皮肤癌筛查 论文列为 “Cancer-focused only” 对照

定位一句话:在"广病种 + 真实临床多病灶 + 解剖部位 + 病灶描述符 + Rook 分层"五项全占的交叉点上,DermaCon-IN 目前是填补者——库内其余条目要么偏肿瘤/皮肤镜(ISIC/HAM/DERM12345),要么缺分层或非真实采集(Fitzpatrick17k/SCIN)。

7.2 可发现性光谱上的位置

档位 库内参照 本条目
注册墙 ISIC 部分资产 —
请求制 老条目(upon request) —
平台托管 Zenodo 型 —
公开直链 + 单一许可 少数 Dataverse 公开直链 + CC BY-NC-SA

对检索者的含义:按"能否立刻下载"过滤时,本条目直接命中(无门禁);但按"能否商用"过滤时,NC 约束会将其排除——它的可获取性高而商用自由度低,是"开放学术、限制商业"的典型样本。

§8 方法学启示

8.1 "前瞻临床采集 + 多概念标注"是可迁移的范式

DermaCon-IN 的方法论核心可拆解为三件可复制的事:(1) 从真实门诊前瞻采集而非拼教学图谱,保证分布真实;(2) 联合标注病灶形态与解剖部位,因为"同形态不同部位 = 不同诊断"是皮肤科诊断的关键;(3) 用概念瓶颈模型把标注变成可解释监督。任何面向资源受限地区的临床 AI 数据集都可借鉴这套结构。

8.2 双肤色量表应成为公平性数据集的标准配置

Fitzpatrick 的 UV 反应轴在深肤型上分辨率不足,MST 的感知色调轴补充了深色端的粒度。同时报告两者,使公平性分析可交叉验证——比单一依赖 Fitzpatrick 的基准(如 DDI 部分分析)更稳健。本条目建议后续公平性数据集默认双标。

8.3 病理/皮肤数据的"概念稀疏激活"值得深挖

CBM 分析显示模型只用 21/47 描述符与 16/49 部位——这种选择性强调是模型行为的重要信号:它可能反映真正有判别力的临床特征,也可能反映标注噪声下的偷懒。后续研究可比对这些激活概念与皮肤科医生的诊断依据,做"人机概念对齐"分析。

8.4 与库内其他"概念/分层"条目的思想同族

本数据集与库内 PANDA-PLUS(标签粒度审计)、REG²(报告生成推理链)、SkinCon(概念标注)共享一个底层主张:结构化、可解释的中间表示(概念/层级/推理链)比扁平标签更接近临床真值结构。DermaCon-IN 的贡献在于把这一主张搬到了"南亚肤色 + 门诊广病种"的情境并配了可用基准。

§9 与库内条目的关系

9.1 家族图谱

  • Fitzpatrick 17k(rid 55):最直接的公平性姊妹集。两者都关心肤色代表性与诊断偏倚;本数据集用其做跨库验证(33/40)。差异:Fitzpatrick17k 源自教学图谱、无解剖/概念标注;本数据集为真实临床采集 + 三重标注。
  • SCIN(rid 181):真实世界众包影像的近亲。SCIN 同有部位与描述符标注,但镜像美国病种、无 Rook 分层;两者合读可对比"众包收集 vs 门诊前瞻采集"的差异。
  • DDI(rid 171):本数据集动机的直接来源——"深肤色准确率降 30–40%"即引自此。DDI 聚焦肤色公平但病种面窄(<80 标签),本数据集扩展到 245 诊断。
  • HAM10000(rid 60)/ ISIC Archive(56)/2018(710)/2019(707)/2020(715)/DERM12345(742)/Derm7pt(110):皮肤镜/肿瘤赛道的对照群,代表论文要"补足"的另一端(neoplasm-centric、皮肤镜、缺感染炎症病种)。
  • PAD-UFES-20(rid 151):智能手机筛查集,论文列为"仅癌症"对照,与本数据集的广病种谱形成对比。

9.2 检索路径建议

  • 检索词组合:“DermaCon-IN”(精确)+ “Indian skin” + “concept”;或用 arXiv ID 2506.06099 / Dataverse DOI 10.7910/DVN/W7OUZM 定位。
  • 勿混淆的三个变体:标题 “Multi-concept”(arXiv)vs “Multiconcept-Annotated”(proceedings);幻灯片页眉误拼 “DermacomON-IN”(坑 1、坑 2)。
  • 若目标是直接可用数据:Dataverse DOI 直下(CC BY-NC-SA,注意 NC/SA 约束)。
  • 若目标是引用公平性论点:引论文 §1 与 Table 1 数据集对比表,并注明患者数口径(坑 3)。

9.3 检索卫生三条

  1. 用 DOI 而非标题定位:论文标题在两处版式不同、幻灯片还有误拼(坑 1),精确检索请用 arXiv:2506.06099 或 Dataverse DOI 10.7910/DVN/W7OUZM。
  2. 勿把肤色档位当概念:96 概念是 47+49,与 6/10 肤色档位无关(坑 5);自动统计概念数时务必排除肤色量表。
  3. 存照口径:引用任何规模数字时附口径来源与时点,避免在 3,002/2,993 与 245/240+ 之间无意识漂移(附录 H)。

9.4 与"南亚/资源受限地区医疗 AI"家族的关系

DermaCon-IN 是库内"面向非西方人群、资源受限场景"的医疗 AI 数据集谱系中的一员。这一谱系的共同关切是代表性缺口如何转化为算法公平性缺口:

条目 地区/人群 代表性缺口关切
DermaCon-IN(本条目) 南亚(印度)门诊 肤色 + 病种双重偏倚
Fitzpatrick 17k(55) 全球图谱 肤色偏倚
SCIN(181) 美国众包 病种地域偏倚
DDI(171) 多样化人群 深肤色性能下降
PAD-UFES-20(151) 巴西 智能手机可及性

合读这些条目,可拼出"皮肤病 AI 公平性"的完整问题地图:不同地区各有代表性缺口,补足任何单一维度(肤色/病种/采集方式)都不足以实现真正公平的模型。DermaCon-IN 的贡献是在"南亚 + 门诊广病种 + 多概念可解释"这个此前空白的三维交叉点上落了一子。

9.5 一个使用场景串联:从下载到评测

把本条目各节串成一个端到端场景,帮助检索者落地:

  1. 获取(§6):从 Dataverse 下 DATASET_0/1.zip(约 3.6 GB 图像)、Skin_Metadata.tab(元数据)、train/test_split.tab(划分)。
  2. 探索(§2):按 main_class/sub_class/disease_label 统计分布,确认长尾;按 fitzpatrick/monk 交叉核对肤色覆盖。
  3. 基线复现(§4.1):用 train_swin_mc.py 复现 Swin-B 的 70.41%,验证环境与划分一致。
  4. 概念监督(§4.2):用 train_cbm_mc.py 或 train_CBM_SC_MC_type2.py 训练 CBM,观察概念层激活。
  5. 可解释分析(§4.3):对 Type 2 CBM 做激活统计与 Grad-CAM,核对 21/47 与 16/49 的稀疏激活模式。
  6. 公平性分层(§5.1):按 FST/MST 分层报告各类别表现,识别深色端掉分。
  7. 跨库验证(§4.4):把模型迁到 Fitzpatrick17k / PASSION 子样本,检验概念迁移(附录 P 模板)。
  8. 合规复核(§6.1):确认用途不触碰 NC,衍生再分发遵循 SA。

这条链路覆盖了"数据获取 → 复现 → 解释 → 公平性 → 迁移 → 合规"的完整研究闭环,是 DermaCon-IN 作为"AI-Ready 数据集"的实用价值体现。每一步均可仅依赖公开资产完成,无需邮件申请或审批——这正是它与请求制数据集的关键差异。

§10 避坑清单:十个已踩过的坑

坑 1:论文标题有两套版式。“Multi-concept”(arXiv 版)与 “Multiconcept-Annotated”(NeurIPS proceedings 版)指同一篇论文;NeurIPS 幻灯片页眉还有 “DermacomON-IN” 的误拼。引用时以 arXiv ID 或 DOI 定位,别被标题差异误导判断为两篇。

坑 2:患者数双口径——3,002 vs 2,993。arXiv v2 摘要、Dataverse 描述与 NeurIPS 幻灯片均写 3,002 人;NeurIPS proceedings 摘要写 2,993 人,差 9 人。条目正文按 arXiv v2(3,002)引用,引用前先定口径并全篇一致。

坑 3:诊断数双口径——245 vs “240+”。论文正文与 proceedings 均写 245 种细粒度疾病;Dataverse 描述与幻灯片用 “240+” 约数。条目按 245 精数引用,做自动化抽取时以论文正文为准。

坑 4:作者数与姓名拼写三个版本。arXiv v2 列 12 人;NeurIPS proceedings 列 11 人(KVL Sathwika 写作 Kota Sathwika、PVN Supranitha 写作 Padharthi Supranitha,且把 Deepanshu Bansal 移入致谢);Dataverse 仅列 7 人。简历/引用时以 arXiv v2 为准,并注意姓名拼写差异。

坑 5:概念数的两套口径易混。论文正文:“49 个解剖部位 + 47 个病灶描述符 = 96 个唯一概念”;而幻灯片写 “47 lesion-level concepts, 49 body locations, 6 FST and 10 MST skin tone scores”——末尾的 6/10 是肤色量表档位数(Fitzpatrick 6 档、Monk 10 档),不是本数据集的概念数。别把 6+10 也加进概念总数。

坑 6:数据集发布早于论文。Harvard Dataverse 首次发布 2025-05-16,而 arXiv v1 提交于 2025-06-06——“数据先行、论文后至”。检索最早出处时别默认论文在先。

坑 7:许可双约束 NC + SA。CC BY-NC-SA 4.0 含**非商业(NC)与相同方式共享(SA)**双重限制——商用需另授权;衍生数据集再分发须用相同许可。模型权重是否属演绎作品存法学争议,稳妥做法是与作者确认。

坑 8:真名是 DermaCon-IN(带连字符)。勿写成 “DermaConIN”、“Derma-Con-IN” 或与皮肤病诊断模型类命名混淆;检索与建库用精确名加连字符。

坑 9:GitHub 代码仓需自核。论文声明 “code available at GitHub”,指向 shan4035/DermaCon-IN-code;该仓的许可、stars、最后更新时间本代理受沙箱网络限制未能实抓——引用代码前请自行访问确认(不臆断其许可)。

坑 10:主类 70.41% 勿当临床级精度传播。这是 8 主类分类的最佳结果,19 亚类仅 58.27%、245 疾病更细分——数据集的价值在提供"公平且可解释"的基准起点,而非已达临床部署门槛。跨库验证的 30/40、33/40 亦为小样本提示性证据。

§11 总结

11.1 三句话总结

  1. DermaCon-IN 用 5,450 张南印度门诊前瞻临床照片(3,002 患者 / 245 诊断),首次把皮肤病 AI 数据的中心从"欧美皮肤镜黑色素瘤"移到"南亚门诊广病种",正面对冲肤色与病种双重偏倚。
  2. 它的三重稠密标注(Rook 三层疾病 + 47 病灶描述符 + 49 解剖部位 + 双肤色量表)让"概念可解释性"成为基准的一部分——CBM 主类达 69.90%、概念激活分析显示 21/47 与 16/49 的正激活。
  3. 它以单一 CC BY-NC-SA 4.0 + Harvard Dataverse 公开直链发布,是本库皮肤病赛道中可获取性最简洁的条目,但 NC/SA 约束对商用最不友好。

11.2 适合谁

  • 皮肤病 AI 公平性研究者:需要一个南亚肤色为主、带双肤色量表的真实临床集。
  • 可解释 AI / CBM 开发者:96 概念标注 + 官方 CBM 基准开箱可用。
  • 资源受限地区数字医疗团队:门诊广病种 + 解剖上下文,贴合基层分诊场景。
  • 数据集工程研究者:前瞻临床采集 + 多概念标注 + 单一许可,是完整案例。

11.3 不适合谁

  • 需要全球/多肤色均衡代表性的项目(本数据集区域单一)。
  • 需要皮肤镜标准化单病灶图像的项目(本数据集是临床多病灶照片)。
  • 有商用需求且无法接受 NC 约束的团队(须另授权)。
  • 需要儿科/老年皮肤病专精数据的项目(年龄集中在 20–40 岁)。

11.4 30 秒决策卡

你的情况 行动
要立刻下数据 Harvard Dataverse doi:10.7910/DVN/W7OUZM(CC BY-NC-SA,公开直链)
要做可解释皮肤病分类 用 96 概念 + 官方 CBM 权重/脚本(§4.2)
要引用公平性论点 引 §1 与 Table 1 对比表,注明患者数口径(坑 2)
要写数据集综述 §2.6 位置对照表 + §7.1 景观表可直接引用
打算商用 先解决 NC 约束(另获授权或改用可商用数据)

FAQ(高频问答 20 问)

Q1:DermaCon-IN 是挑战赛吗?
不是。它是一个前瞻采集的多概念标注数据集 + 基准论文,无 leaderboard、无比赛。

Q2:名字里的 IN 指什么?
India(印度)。DermaCon = dermatology concepts,IN = 印度肤型/门诊语境。

Q3:图像是皮肤镜吗?
不是,是临床照片(手机/相机在环境光下拍摄),刻意不同于 ISIC/HAM10000 的皮肤镜范式。

Q4:谁做的?
IIT Hyderabad 牵头,联合多家印度医学院与印度海军医疗系统;一作 Shanawaj S Madarkar。

Q5:发表在哪?
arXiv:2506.06099,被 NeurIPS 2025 Datasets & Benchmarks Track 接收(DOI 10.52202/085713-3742)。

Q6:多少张图、多少人?
5,450 张 / 3,002 患者(proceedings 口径 2,993,坑 2)。

Q7:标签体系?
Rook 分类学三层:8 主类 / 19 亚类 / 245 疾病,对齐 ICD-11。

Q8:什么叫多概念?
除疾病标签外,每图标注 47 个病灶描述符 + 49 个解剖部位,共 96 概念(坑 5 区分肤色量表档位)。

Q9:肤色怎么标?
Fitzpatrick 与 Monk Skin Tone 双标;MST 4–9、FST 3–4 契合印度表型。

Q10:基准成绩?
Swin-B 主类 70.41%;19 亚类 58.27%;CBM 主类最高 69.90%(分层 Type 2)。

Q11:可解释性怎么样?
CBM 概念层显式暴露依据;47 描述符中 21 个、49 部位中 16 个呈正激活;Grad-CAM 经医师复核。

Q12:能跨库用吗?
能。仅本数据集训练的 CBM 在 PASSION 40 抽样正确 30、Fitzpatrick17k 正确 33。

Q13:怎么下载?
Harvard Dataverse,DOI 10.7910/DVN/W7OUZM,17 个文件约 4 GB。

Q14:什么许可?
CC BY-NC-SA 4.0(署名—非商业—相同方式共享)。

Q15:能商用吗?
默认不能(NC);需另获作者授权或改用可商用数据。

Q16:代码在哪?
论文声明在 GitHub shan4035/DermaCon-IN-code(许可待自核,坑 9)。

Q17:伦理批号?
IIT Hyderabad 伦理委员会,protocol IITH/IEC/2025/01/05。

Q18:数据划分方式?
按受试者(subject-wise)80:20 分层划分(按 Sub Class 分层)。

Q19:最大的局限?
区域单一(仅南印度)+ 性别/年龄不平衡 + 深色端仍偏中档——是 region-specific 资源。

Q20:如果只记住一件事?
它把皮肤病 AI 数据的中心从"欧美皮肤镜肿瘤"移到了"南亚门诊广病种",并用多概念标注让"为什么这么诊断"变得可解释。

Q21:数据集里有没有"无明确诊断"的样本?
有。8 主类中含 “No Definite Diagnosis” 类——真实的门诊存在无法确诊的病例,单列而非强行归类,避免标签污染。

Q22:亚类里的混合态是什么意思?
如 “Inflammatory + Infectious (Bacterial)”,表示患者同时有炎症与细菌感染——真实临床的共病叠加,扁平标签无法表达。

Q23:为什么图像不标准化?
刻意保留角度/距离/光照变异,因为真实临床中同一皮肤病在不同条件下形态各异,模型必须学会这些不变性。

Q24:训练需要多少算力?
论文用 4× Nvidia A6000(各 42 GB),数据集约 4 GB;Swin-B 512 输入是显存主要开销。

Q25:划分是按图还是按人?
按受试者(subject-wise),确保同一患者不同图像不跨训练/测试集——防泄漏底线。

Q26:概念标注是谁标的?
4 位 board-certified 皮肤科医师,逐图独立标注,非按疾病类别固定套用。

Q27:为什么排除某些 SkinCon 描述符?
translucent/friable/dome-shaped 在 2D 临床照中缺乏可辨识视觉特征,无法可靠标注,故剔除。

Q28:MST 和 FST 结果冲突怎么办?
两套量表是互补视角;若结论在两套上一致,稳健性更强;若不一致,需分别报告并讨论原因(§8.2)。

Q29:能只用主类标签不做概念吗?
可以,主类/亚类分类不依赖概念层;但这样就放弃了 CBM 的可解释性优势,只是普通分类。

Q30:数据集会更新吗?
Dataverse 已从 v1 更新到 v4(2026-01-11);论文版式在 arXiv v1→v2 也有修订。维护触发点见附录 O。


事实清单(硬事实 30 条)

  1. 全称 DermaCon-IN — A Multi-concept Annotated Dermatological Image Dataset of Indian Skin Disorders for Clinical AI Research。
  2. 论文 arXiv:2506.06099,v1 提交 2025-06-06,v2 2026-01-08;被 NeurIPS 2025 D&B Track 接收(DOI 10.52202/085713-3742)。
  3. 数据集 Harvard Dataverse DOI 10.7910/DVN/W7OUZM,标题 “DermaCon-IN Dataset Release v1.0”,首发布 2025-05-16,现 v4(2026-01-11)。
  4. 规模:5,450 张临床照片 / 3,002 患者(proceedings 口径 2,993)/ 245 诊断。
  5. 层级:8 病因学主类 / 19 亚类 / 245 疾病叶节点(Rook 分类学,对齐 ICD-11)。
  6. 概念:47 病灶描述符 + 49 解剖部位 = 96 唯一概念。
  7. 肤色:Fitzpatrick 与 Monk Skin Tone 双标;MST 4–9、FST 3–4;FST 4/5 最常见、Type 6 仅 136 张。
  8. 人口学:集中于 20–40 岁;男 3,386 vs 女 2,064。
  9. 采集:南印度北卡纳塔克三家三级医院及附属诊所;覆盖 Karnataka/Maharashtra/Goa/Andhra Pradesh;2024–2025 年。
  10. 设备:108MP Android、48MP iPhone Pro、12–36MP 相机,环境临床光。
  11. 标注者:4 位 board-certified 皮肤科医师(经验 11/3/3/1 年),分四子集标注,第三专家仲裁分歧。
  12. 伦理:IIT Hyderabad 伦理委员会,protocol IITH/IEC/2025/01/05。
  13. 体量约 ~4 GB;算力 4× Nvidia A6000(各 42 GB)。
  14. 长尾:245 疾病频率对数正态,指数 1.8。
  15. 划分:按受试者 80:20 分层(按 Sub Class)。
  16. 骨干:Swin-B/4W12-384(ImageNet-22k 预训练,输入 512×512)。
  17. 主类最佳:Swin-B 准确率 70.41%(Prec 69.83 / Sens 70.41 / F1 69.69 / Macro AUC 78.51)。
  18. 亚类基线:58.27%(Macro AUC 83.11)。
  19. CBM 主类:描述符 68.57 / 部位 68.38 / 合并 68.12;分层 Type 2 达 69.90%。
  20. CBM 亚类:描述符 56.42 / 部位 55.88 / 合并 57.37。
  21. 概念激活:47 描述符中 21 个、49 部位中 16 个正激活。
  22. 跨库验证:Type 2 CBM 在 PASSION 40 抽样正确 30、Fitzpatrick17k 正确 33。
  23. 病种分布:感染性、炎症性、色素性疾病在南亚门诊主导。
  24. 对齐 ICD-10/ICD-11(Rook 分类学的互操作性论证)。
  25. 描述符裁剪:剔除 translucent/friable/dome-shaped;保留低频高价值项(poikiloderma/gray/salmon)。
  26. 概念-疾病相关:Pigmentary 下 white r=+0.71;Keratinisation 下 hyperkeratotic plaques r=+0.47。
  27. 许可:CC BY-NC-SA 4.0(论文与 Dataverse 一致)。
  28. Dataverse 17 文件:图像 DATASET_0/1.zip(1.26+2.34 GB)、Skin_Metadata.tab、train/test_split.tab、3 个 .pth 权重、训练/推理脚本。
  29. 无外部资助声明;贡献者自发参与。
  30. 背景动机数字:皮肤病为全球第四大非致命疾病负担(GBD 2019);深肤色准确率降 30–40%(DDI)。

术语表(24 条)

术语 释义
DermaCon-IN 南亚肤色为主的皮肤病多概念标注数据集名(IN=印度)
Multi-concept(多概念) 除疾病标签外同时标注病灶描述符与解剖部位等多类概念的标注范式
Rook’s Classification Rook 皮肤病学教科书的病因学层级分类,本数据集三级标签的框架
ICD-11 世卫组织国际疾病分类第 11 版,本数据集分类的对齐目标
Main Class(主类) 8 个病因学大类(感染/炎症/色素等)
Sub Class(亚类) 19 个临床亚类,含混合病态组合
Lesion Descriptor(病灶描述符) 描述皮损形态的临床词(patch/plaque/scale 等),本轮 47 个
Body Part(解剖部位) 病灶所在解剖区域标签,本轮 49 个
Fitzpatrick Skin Type(FST) 基于 UV 反应的 6 档肤色分型
Monk Skin Tone(MST) 感知色调的 10 档肤色量表,深色端更细
Concept Bottleneck Model(CBM) 经可解释概念层做分类的模型架构
概念监督 用概念标注作为中间监督信号训练模型
分层 CBM 联合预测亚类与主类的两级 CBM
Macro AUC 各类别 AUC 的宏平均,对类别不平衡更稳健
长尾分布 少数类样本极多、多数类样本稀疏的频率分布
对数正态拟合 用对数正态分布拟合叶节点频率,本数据集指数 1.8
前瞻采集(prospective) 在真实临床场景中按协议实时采集,而非事后拼凑
临床照片 vs 皮肤镜 前者为环境光全景拍摄,后者为标准化单病灶放大成像
Grad-CAM 用梯度定位模型关注区域的解释方法
跨数据集验证 在 A 上训练、在 B 上测试以检验泛化
PASSION 撒哈拉以南非洲色素性皮肤图像数据集,本轮跨库验证对象
Fitzpatrick17k 皮肤病诊断公平性基准数据集(库内 rid 55),本轮跨库验证对象
CC BY-NC-SA 4.0 署名—非商业—相同方式共享许可
Dataverse Harvard 的通用数据归档平台,本数据集托管地

附录

附录 A:条目信息速查卡

项 值
条目名 DermaCon-IN
url_name dermacon-in
类型 数据集 + 基准(二合一)
论文 arXiv:2506.06099(NeurIPS 2025 D&B)
机构 IIT Hyderabad 牵头
规模 5,450 图 / 3,002 患者 / 245 诊断
许可 CC BY-NC-SA 4.0
抓取时点 2026-09-30
库内互链 fitzpatrick-17k(55)/scin(181)/ddi(171)/ham10000(60)/isic-archive(56)/isic-2018(710)/derm12345(742)/derm7pt(110)/pad-ufes-20(151)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 arXiv + NeurIPS proceedings + Dataverse 三处独立标识,DOI 明确
A 可获取性 8 单一 CC BY-NC-SA + 公开直链,无请求制/注册墙——本库优良档
I 可互操作 6 JPEG+TAB+PyTorch 权重+Notebook;无 DICOM/FHIR 官方映射
M 元数据质量 7 论文+Datasheet+Metadata_schema+Skin_Metadata 齐备;多口径不一致需自行对齐
S 可持续性 7 Dataverse 长期归档 + 版本化;代码依赖个人 GitHub 单点
综合评级 7.4/10(良) 可获取性与可发现性突出;互操作与元数据口径漂移是主要扣分项

附录 C:逐项证据链自证

关键数字 来源 位置
5,450 图 / 3,002 患者 / 245 诊断 arXiv:2506.06099 摘要 arXiv 页面
8 主类 / 19 亚类 / 96 概念 论文 §4 Dataset Overview arXiv HTML v2
47 描述符 + 49 部位 论文方法节 + §4 arXiv HTML v2
MST 4–9 / FST 3–4 / Type6 136 张 附录 A.5 arXiv HTML v2
男 3,386 / 女 2,064 附录 A.5 Demographic Distribution arXiv HTML v2
Swin-B 70.41% / 亚类 58.27% 论文 Table 2 arXiv HTML v2
CBM 各配置数值 论文 Table 3 arXiv HTML v2
21/47 与 16/49 激活 论文可解释性节 arXiv HTML v2
PASSION 30/40、Fitz17k 33/40 论文跨数据集验证节 arXiv HTML v2
DOI 10.7910/DVN/W7OUZM / CC BY-NC-SA / 17 文件 Dataverse API /api/datasets/:persistentId 实测 2026-09-30
DOI 10.52202/085713-3742 NeurIPS 2025 proceedings 页 proceedings.neurips.cc

附录 D:数据获取决策树

需求是什么?
├── 只想做分类/可解释基准
│   └── Dataverse doi:10.7910/DVN/W7OUZM 直下(图像+元数据+权重+脚本)
├── 想做公平性分析
│   ├── 用 FST + MST 双肤色标注分层评估
│   └── 与 Fitzpatrick17k(55)/DDI(171)/SCIN(181) 对照
├── 只想引用公平性论点
│   └── 引论文 §1 与 Table 1 数据集对比表(注明患者数口径 坑 2)
└── 想商用
    └── NC 约束——需另获授权或改用可商用数据

附录 E:标签层级示意(Rook 分类学精简)

8 Main Classes(病因学)
 ├── Infectious(感染性:真菌/病毒/寄生虫/细菌)
 ├── Inflammatory(炎症性,含 Eczema and Dermatitis 亚类)
 ├── Pigmentary(色素性:Vitiligo / 炎症后色素沉着等)
 ├── Keratinisation(角化性)
 ├── Appendageal(附属器)
 ├── Neoplastic(肿瘤性)
 ├── ...(其余主类)
 └── No Definite Diagnosis(无明确诊断)
    └── 展开为 19 Sub Classes(含混合态)
        └── 展开为 245 Disease Labels(长尾,指数 1.8)

附录 F:概念标注使用规范

概念组 数量 使用建议
病灶描述符 47 逐图独立标注;做概念监督时注意低频描述符稀疏
解剖部位 49 含腋下/腹股沟等关键区域;联合形态做空间先验
合并概念 96 CBM 亚类任务最佳(57.37%)
肤色量表 FST 6 档 / MST 10 档 非概念数,是评分档位(坑 5)

附录 G:CBM 训练骨架(代码)

# 概念瓶颈模型(1-level)训练骨架——以论文 Type 2 分层版为主
import torch
import torch.nn as nn

class ConceptBottleneck(nn.Module):
    """Swin 编码器 -> 概念 logit -> 分类头(论文 §6.2 结构)。"""
    def __init__(self, backbone, n_concepts=96, n_classes=8):
        super().__init__()
        self.encoder = backbone                 # Swin-B/4W12-384
        self.dropout = nn.Dropout(0.3)
        self.to_concept = nn.Linear(backbone.out_dim, n_concepts)   # c^l
        self.classifier = nn.Linear(n_concepts, n_classes)          # f(c^l)

    def forward(self, x):
        z = self.encoder(x)
        c_logits = self.to_concept(self.dropout(z))   # 概念 logit
        c = torch.sigmoid(c_logits)                   # 概念向量 c in [0,1]
        # 下游分类器作用在概念 logit 上(可解释 + 概念监督)
        y = self.classifier(c_logits)
        return y, c

附录 H:盘点双口径登记表

# 项 口径 A 口径 B 处理
1 患者数 3,002(arXiv v2/Dataverse/幻灯片) 2,993(NeurIPS proceedings) 双记,正文按 3,002
2 诊断数 245(论文正文) “240+”(Dataverse/幻灯片) 按 245 精数
3 作者数 12(arXiv v2) 11(proceedings)/ 7(Dataverse) 按 arXiv v2
4 论文标题 “Multi-concept”(arXiv) “Multiconcept-Annotated”(proceedings) 双记,DOI 定位

附录 I:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 标题两版式 + 幻灯片误拼 DermacomON-IN 检索/引用
坑 2 患者数 3,002 vs 2,993 数字抽取
坑 3 诊断数 245 vs “240+” 数字抽取
坑 4 作者数/姓名三版本 引用/著录
坑 5 概念数混淆(96 vs 6+10 肤色档位) 概念统计
坑 6 数据集 2025-05-16 早于论文 2025-06-06 溯源
坑 7 CC BY-NC-SA 的 NC+SA 双约束 商用/再分发
坑 8 精确名带连字符 DermaCon-IN 检索/建库
坑 9 GitHub 代码仓许可待自核 复现
坑 10 70.41% 非临床级精度 结果引用

附录 J:与库内最相关条目对照

维度 Fitzpatrick 17k(55) SCIN(181) DDI(171) DermaCon-IN(本条目)
来源 教学图谱 众包真实 众包多样 门诊前瞻采集
病种 广 广(美国) 窄(<80) 广(南亚)
肤色标注 FST FST 多 FST + MST 双标
部位标注 无 有 无 有(49)
描述符 无 有 无 有(47)
Rook 分层 无 无 无 有
许可 研究用途 CC BY 研究用途 CC BY-NC-SA

附录 K:缩写速查

缩写 全称
DermaCon-IN Dermatology Concepts — India
Rook’s Rook’s Textbook of Dermatology 分类体系
ICD International Classification of Diseases
FST Fitzpatrick Skin Type
MST Monk Skin Tone
CBM Concept Bottleneck Model
MC / SC Main Class / Sub Class
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
GBD Global Burden of Disease
LMIC Low- and Middle-Income Countries
HCCV Human-Centric Computer Vision

附录 L:引文规范

@inproceedings{madarkar2025dermaconin,
  title     = {DermaCon-IN: A Multi-concept Annotated Dermatological Image
               Dataset of Indian Skin Disorders for Clinical AI Research},
  author    = {Madarkar, Shanawaj S and Madarkar, Mahajabeen and
               Venkatesh, Madhumitha and Bansal, Deepanshu and Prakash, Teli and
               Mopuri, Konda Reddy and MV, Vinaykumar and Sathwika, KVL and
               Kasturi, Adarsh and Raj, Gandla Dilip and Supranitha, PVN and
               Udai, Harsh},
  booktitle = {Advances in Neural Information Processing Systems 38
               (NeurIPS 2025), Datasets and Benchmarks Track},
  year      = {2025},
  eprint    = {2506.06099},
  archivePrefix = {arXiv},
  primaryClass  = {eess.IV},
  doi       = {10.52202/085713-3742}
}

@misc{dermaconin2025dataverse,
  title        = {DermaCon-IN Dataset Release v1.0},
  author       = {Madarkar, Shanawaj Sahebpatel and others},
  year         = {2025},
  publisher    = {Harvard Dataverse},
  doi          = {10.7910/DVN/W7OUZM},
  note         = {Licensed under CC BY-NC-SA 4.0}
}

附录 M:基于本数据集的研究检查清单(10 项)

  1. 口径声明:引用患者数注明 3,002(arXiv v2)还是 2,993(proceedings);诊断数用 245(坑 2、坑 3)。
  2. 许可核对:确认用途是否触及 NC(非商业);衍生再分发须用相同许可(SA)(坑 7)。
  3. 肤色分层:分析模型表现时用 FST 与 MST 双轴分层,报告深色端(Type 5-6 / MST 8-9)表现。
  4. 区域边界:跨地域泛化结论须声明受限于南印度单一来源。
  5. 类别不平衡:245 疾病长尾,报告宏平均指标并说明不平衡处理策略。
  6. 概念映射:概念数用 96;勿把 6/10 肤色档位计入概念(坑 5)。
  7. 精度定位:70.41% 是 8 主类结果,勿当临床精度传播(坑 10)。
  8. 跨库验证样本量:引用 30/40、33/40 时注明小样本与标签对齐假设。
  9. 引用完整:数据引 Dataverse DOI,观点引 arXiv/proceedings 论文。
  10. 代码自核:使用 GitHub 代码前确认其许可与可运行性(坑 9)。

附录 N:本条目生产档案

  • 存在性核验:三轮搜索(WebSearch×4 + 官网/arXiv/Dataverse 实抓)三源互证,确证数据集真实存在。
  • 事实研究:arXiv HTML v2 全文抓取(curl + User-Agent)+ Dataverse REST API 实测 + NeurIPS proceedings 页 + 幻灯片 PDF,共约 8 轮。
  • slug 查重:url_name ILIKE '%derma%' → 0 行;ls writing/ 无同名目录。
  • FACTS.md:writing/dermacon-in/FACTS.md 九节。
  • 成稿方式:五块直写拼接(part1-5),每 part 尾留空行,最后 cat 拼接。
  • 坑点:§10 十则(坑 1-10"坑 N:"编号制)。
  • description:成稿时即 ≤170 字符。
  • 双口径存照:附录 H 登记 4 项。

附录 O:维护计划与触发点

触发点 条件 动作 优先级
数据集新版本 Dataverse 发布 v1.1+ 更新 §6 版本链与规模 1
代码仓公开度 GitHub 仓获明确许可/更新 核实坑 9、补 §6.1 2
第三方评测 新论文用本数据集评测 §4 结果表扩行 3
后续版本计划 团队扩中心/加像素级掩码 §7 生态更新 4
口径统一 论文/proceedings 修订对齐 附录 H 简化 5

附录 P:跨数据集验证实验模板(代码)

# 跨数据集概念迁移验证骨架(论文 §D 做法:标签空间对齐 + 小样本预测)
# 前提:已有在 DermaCon-IN 上训练好的 Type 2 CBM(概念层 + 层级分类头)
import random
from collections import Counter

def align_and_eval(cbm, external_ds, n_sample=40, seed=0):
    """把外部数据集的标签对齐到 DermaCon-IN 分类学,随机抽 n 例预测。
    external_ds: 含 (image, raw_label) 的可迭代对象(如 PASSION / Fitzpatrick17k)
    返回:正确数 / 抽样数,以及每例的 Grad-CAM 供医师复核
    """
    random.seed(seed)
    pool = []
    for img, raw_label in external_ds:
        mapped = map_to_dermacon_taxonomy(raw_label)  # 人工/规则对齐,需记录映射假设
        if mapped is not None:
            pool.append((img, mapped))
    sample = random.sample(pool, min(n_sample, len(pool)))
    correct = 0
    for img, gold in sample:
        pred, concepts = cbm(img)                     # 概念层 + 层级预测
        if pred == gold:
            correct += 1
        # Grad-CAM(concepts) 输出交 board-certified 医师复核定位相关性
    return correct, len(sample)

# 论文口径结果(小样本提示性证据):
#   PASSION:        30/40
#   Fitzpatrick17k: 33/40

注意:map_to_dermacon_taxonomy 是关键假设点——两个外部数据集标签空间与本数据集不同,映射引入歧义,引用结果时须同时声明映射规则与抽样量(各 40 例)。

附录 Q:标签层级与疾病示例(精选)

下表给出论文 Figure 1/幻灯片所示的部分"主类 → 亚类 → 疾病 → 描述符 → 部位"映射示例,供理解标注结构:

主类 亚类 疾病示例 描述符示例 部位示例
Pigmentary Disorders Pigmentary(色素性) Vitiligo(白癜风) Patch、White(Hypopigmentation) Upper Extremities / Hands / Fingers
Keratinisation Disorders Keratanisation(角化性) Palmoplantar Keratoderma(掌跖角化病) Fissure、Hyperkeratotic plaques、Scale Lower Extremities / Soles
Infectious Disorders Infectious-Fungal(真菌) Tinea Faciei(面癣) Erythema、Plaque、Scale Head / Cheeks
Inflammatory Disorders Inflammatory (Other) Urticaria(荨麻疹) Erythema、Wheal Trunk / Upper Extremities / Shoulders
Inflammatory Disorders Eczema and Dermatitis Seborrheic Dermatitis(脂溢性皮炎) Patch、Plaque、White Head / Scalp

从表可见:同一主类(Inflammatory)下不同亚类共享部分描述符(Erythema/Plaque)但部位分布不同——这正是"形态 + 部位联合"才能区分的实例。

附录 R:与 PANDA-PLUS 类"概念/粒度"条目的思想对照

维度 PANDA-PLUS(病理) DermaCon-IN(皮肤)
数据对象 WSI 像素级掩码 临床照片 + 多概念标签
中间结构 像素级 Gleason pattern 病灶描述符 + 解剖部位概念
可解释出口 像素掩码 + 粒度审计 Concept Bottleneck Model
共同主张 结构化中间表示优于扁平标签 同左
差异 重标注既有数据(审计) 前瞻采集新数据(填补代表性缺口)

两者是同一方法学主张在两个医学影像子领域的平行实现:把"真值"从"一个标签"扩展为"可解释的结构"。合读可看到这一趋势在病理与皮肤科的同时兴起。

附录 S:常见误读五大纠偏

误读 纠偏
“70% 太低,不如皮肤镜模型” 任务/病种/成像均不可比(§4.7)
“就是又一个印度版 Fitzpatrick17k” 来源不同(前瞻 vs 图谱)、标注维度不同(三概念 vs 单标签)
“96 概念 = 47+49+6+10” 6/10 是肤色档位,非概念(坑 5)
“数据公开=随便用” CC BY-NC-SA 有 NC+SA 双约束(坑 7)
“5,450 张很多” 245 疾病长尾下,尾部类仍稀疏,不代表每类样本充足

附录 T:术语中英对照速查(补充)

中文 英文
病灶描述符 lesion descriptor
解剖部位 anatomical site / body part
概念瓶颈模型 Concept Bottleneck Model (CBM)
分层分类 hierarchical classification
长尾分布 long-tailed distribution
类别不平衡 class imbalance
按受试者划分 subject-wise split
诊断确定性 diagnostic certainty
图像可分级性 image gradability
前瞻采集 prospective collection
门诊场景 outpatient setting
肤色分型 skin phototype
相同方式共享 ShareAlike (SA)
非商业 NonCommercial (NC)

附录 U:五大数据集公平性维度横比

维度 DermaCon-IN Fitzpatrick 17k(55) SCIN(181) DDI(171) HAM10000(60)
图像数 5,450 16,577 10,408 656 10,015
患者/来源 3,002 门诊 图谱 众包 众包 专科
成像 临床照片 临床照片 临床照片 临床照片 皮肤镜
诊断数 245 114 按条件 <80 7
肤色量表 FST + MST FST FST FST/其他 —
部位标注 ✓(49) ✗ ✓ ✗ ✓
描述符 ✓(47) ✗ ✓ ✗ ✗
Rook 分层 ✓ ✗ ✗ ✗ ✗
许可 CC BY-NC-SA 研究用途 CC BY 研究用途 CC BY-NC

(注:Fitzpatrick 17k / SCIN / DDI / HAM10000 的图像数、诊断数取自各数据集条目与公开文献的常见口径,引用前请以各条目为准;本表仅作公平性维度的结构性对照。)

从表可见 DermaCon-IN 的独特性集中在**“诊断数最多(245)+ 双肤色量表 + 部位与描述符双概念 + Rook 分层”**的组合——没有任何单一维度是它的绝对优势(图像数不及 Fitzpatrick17k/HAM10000),但四维叠加使其在"宽病种 + 可解释结构 + 公平性"的联合定位上独一无二。

附录 V:一句话记住 DermaCon-IN

南印度门诊 5,450 张真实临床照片,用 Rook 三层 + 96 概念 + 双肤色量表回答"皮肤病 AI 如何公平且可解释"——一个填补非西方人群代表性缺口的前瞻采集数据集。

附录 W:抓取与核验时点存照

项 时点/口径
FACTS 与成稿抓取 2026-09-30
arXiv 版本 v2(2026-01-08)
Dataverse 版本 v4(2026-01-11 更新,首发 2025-05-16)
NeurIPS proceedings 2025 D&B Track
数据库查重 url_name ILIKE '%derma%' → 0 行(2026-09-30)
锁 agent-c-dermaconin 于 2026-09-30T22:14:08+08:00 创建
进程留痕 `ps aux

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 医学问答与基准 / 评测基准
  • fitzpatrick-17k — 共享标签:医学影像 / 皮肤影像 / 医学问答与基准 / 评测基准
  • ddi — 共享标签:医学影像 / 皮肤影像 / 医学问答与基准 / 评测基准
  • skincon — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • nct-crc-he-100k — 共享标签:医学影像 / 图像分类 / 医学问答与基准 / 评测基准
  • isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • derm12345 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • acrima — 共享标签:医学影像 / 图像分类 / 医学问答与基准 / 评测基准
  • skincap — 共享标签:皮肤影像 / 图像分类 / 医学问答与基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集