DERM12345 (derm12345) — AI-Ready Wikipedia

土耳其三机构跨 2008-2021 的 12,345 张皮肤镜图像集:5 super classes→15 main classes→40 subclasses 三级分类树,论文宣称 40 子类粒度属科学文献首次,CC BY 4.0 经 Harvard Dataverse 与 ISIC 双通道公开

来源 土耳其三机构回顾性皮肤镜图像(Celal Bayar University Manisa / Istinye University / University of Health Sciences Haydarpasa Numune, Istanbul),MoleMax 3 / MoleMax HD / FotoFinder / 3gen DermLite DL4+iPhone 等设备,2008-2021,40 子类 + 11 项元数据发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
DERM12345 (derm12345) — AI-Ready Wikipedia

信息速览

数据集名称DERM12345 (derm12345) — AI-Ready Wikipedia
数据类型公开数据集,影像数据,人工标注
规模1,627 名患者(12,345 张图像;train 9,860 / test 2,485,按患者划分)
接入方式土耳其三机构回顾性皮肤镜图像(Celal Bayar University Manisa / Istinye University / University of Health Sciences Haydarpasa Numune, Istanbul),MoleMax 3 / MoleMax HD / FotoFinder / 3gen DermLite DL4+iPhone 等设备,2008-2021,40 子类 + 11 项元数据
AI 就绪度

INFOBOX — DERM12345 一屏速览

维度 内容
本质 土耳其三机构多源皮肤镜图像数据集:12,345 张 / 1,627 患者 / 40 子类(非挑战赛、非任何集的子集)
团队 Imperial College London(通讯 Abdurrahim Yilmaz)+ Celal Bayar University / Istinye University / University of Health Sciences(共 4 作者)
论文 Sci Data 11, 1302 (2024),doi:10.1038/s41597-024-04104-3;Received 2024-06-17 / Accepted 2024-11-08 / Published 2024-11-28
数据 12,345 张皮肤镜图像,2008-2021,MoleMax 3 / MoleMax HD / FotoFinder / DermLite DL4+iPhone 等设备
分类 三级树:5 super classes → 15 main classes → 40 subclasses(论文宣称 40 子类粒度属科学文献首次)
标注 两位 20+ 年经验皮肤科专家共识(GG + SPY);所有恶性病变均活检证实;剔除 280 张重复图
划分 train 9,860(80%)/ test 2,485(20%),按患者划分(dfsp / mpd 例外)
基线 ResNet50 0.50 / Xception 0.59 / InceptionResNetV2 0.58(test 加权准确率,40 子类细粒度)
获取 CC BY 4.0 全公开:Harvard Dataverse doi:10.7910/DVN/DAXZ7P(三卷 ZIP + 两 .tab)+ ISIC 镜像 + GitHub 代码
核心卖点 **子类粒度(40)**而非总量——相较 Patient-Centric 33,126、BCN20000 18,946、ISIC 全档百万级,其体量属中等

§0 导读:这个数据集解决什么问题

皮肤镜(dermoscopy)是皮肤科医生对付黑色素瘤等恶性病变的第一道放大镜,但它也是"人因变异"的重灾区:诊断准确率与训练年限、经验积累高度相关,同一位病变在不同医生手里可能得出不同结论。论文引言援引的证据表明,恶性与良性病变的患病率、形态分布会随种族、地理与皮肤类型而异——这意味着一个在欧洲浅肤色人群上训练的模型,未必能可靠迁移到欧亚过渡带更多样的皮肤类型上。

已有的公开皮肤镜数据集大多停在"粗类"层面:HAM10000 是 10,015 张 / 7 类,BCN20000 是 18,946 张 / 8 类,ISIC 挑战赛各年份集多为 2-3 类。粗类标签的代价是双重的:临床上真正棘手的"与恶性高度相似的良性病变"(发育不良痣、先天性痣、蓝痣、复发性痣)被压缩进一个"nevus"大类,模型学不到分恶性所需的细粒度边界;训练时头部类一枝独大,评测时一个混淆就直接吃掉整类分数。

DERM12345 的回答是一次"沿子类维度扩张"。它把 12,345 张皮肤镜图像编排成一棵三级分类树:5 个 super classes(黑色素细胞良性 / 黑色素细胞恶性 / 非黑色素细胞良性 / 非黑色素细胞不确定 / 非黑色素细胞恶性)→ 15 个 main classes → 40 个 subclasses。论文明确宣称,40 子类粒度加分类树的组合是"科学文献中首次"。它保留了大量易恶变、类恶性的良性子类(dysplastic nevus 合计约 6,136 张、banal nevus 约 3,815 张),目的就是给"分恶性"与"失败分析"提供更细的监督面。

§0 读法三则:

  1. 这个条目的核心价值主张是"子类粒度",不是"总量":12,345 张在公开皮肤镜集合里属中等体量,它的差异化在于 40 个子类与三级树结构,而非图像数量(§7 有全景观对照)。
  2. 全文统计数字均出自论文正文、表格与 Harvard Dataverse 元数据实抓;正文与表格的唯一冲突处(dysplastic nevus 6,136 vs 6,137)已在 §9 与坑点存照。
  3. 它是库内皮肤影像家族中第一个以"40 子类三级树"为标签体系的条目,与 HAM10000/BCN20000 的粗类体系互补而非替代(§9 家族图谱)。

§1 数据集速览:十问十答

Q1:DERM12345 是挑战赛吗?
不是。它没有比赛、没有 leaderboard,是土耳其三机构合作的一次数据集构建研究,成果为论文(Sci Data 2024)+ 数据集(Harvard Dataverse)+ 基线代码(GitHub)三件套。

Q2:名字里的"12345"是什么意思?
就是图像总数 12,345。全名 DERM12345: A Large, Multisource Dermatoscopic Skin Lesion Dataset with 40 Subclasses,数字命名与总量自洽——这也是检索时可以直接用精确短语 DERM12345 定位的原因。

Q3:12,345 张图像从哪来、谁采的?
土耳其三家机构 2008-2021 年间的回顾性临床皮肤镜图像:Celal Bayar University(Manisa 马尼萨)、Istinye University(Istanbul 伊斯坦布尔)、University of Health Sciences Haydarpasa Numune Research and Training Hospital(Istanbul)。采集自 1,627 名患者。

Q4:图像是什么设备拍的、什么规格?
四类设备混采:MoleMax 3、MoleMax HD(Derma Medical Systems, Vienna)、FotoFinder® videodermatoscope(FotoFinder Systems, Bad Birnbach)、3gen DermLite DL4 手持皮肤镜 + iPhone 5/7 连接套件(DermLite LLC);另用高分辨率 DSLR 相机与手机皮肤镜附件。偏振光接触式成像,放大 10×–140×,手机端可达 3840×2160,JPEG 格式。

Q5:40 子类是怎么组织的?
三级树:5 个 super classes → 15 个 main classes → 40 个 subclasses。例如 super class “Melanocytic Benign” 下设 Banal Compound / Banal Dermal / Banal Junctional / Dysplastic Compound / Dysplastic Junctional / Dysplastic Recurrent / Lentigo 等 main classes,再细到 ajb、jb、jd 等子类缩写。

Q6:谁标注的,可靠吗?
两位资深皮肤科专家——Gulsum Gencoglan(GG,另获基础肿瘤学第二博士学位)与 Sirin Pekcan Yasar(SPY),均具 20 年以上皮肤镜经验,以共识决策(consensus decision)方式终审。诊断确认来源为两位专家的临床诊断共识、随访(follow-up)与组织病理证实(when available)三者。

Q7:恶性病变的标签可信吗?
论文明确写"All malignant skin lesions were biopsy proven"——所有恶性病变均经活检组织病理证实。良性病变则由两位专家共识标注;痣有 >2 年数字皮肤镜随访且无变化者(nevoid involution 除外)标记为无变化。

Q8:重复图像怎么处理的?
用 Python 脚本按文件大小比对,发现 280 张重复图像,人工复核后剔除。这一处理让"12,345"成为去重后的净数。

Q9:我现在能拿到什么?
全部可公开直链获取,CC BY 4.0:Harvard Dataverse(doi:10.7910/DVN/DAXZ7P)提供三卷图像 ZIP(train 拆两卷 + test 一卷)与两份元数据 .tab;同一数据接入 ISIC Archive 镜像;GitHub abdurrahimyilmaz/derm12345 提供基线代码;Google Derm Foundation 生态有嵌入教程与 notebooks。

Q10:为什么它对 AI-Ready 重要?
它是库内皮肤影像家族里"许可最干净、子类粒度最细"的样本之一:数据集与论文同为 CC BY 4.0、无请求制、无付费墙,30 秒即可 start download;同时以 40 子类 + 三级树提供了粗类数据集给不出的细粒度监督与层次学习素材。

§2 数据构成与规格

2.1 规模、来源与机构构成

DERM12345 的规模可以用四个数字锚定:12,345 张图像、1,627 名患者、40 个子类、跨越 2008-2021 共 14 年。图像来自土耳其三家机构的回顾性临床采集:

机构 城市 说明
Celal Bayar University Manisa(马尼萨) 伦理批件签发机构(Manisa Celal Bayar University 伦理审查委员会)
Istinye University Istanbul(伊斯坦布尔) 合作机构,Liv Hospital Vadistanbul 皮肤与性病科参与
University of Health Sciences, Haydarpasa Numune Research and Training Hospital Istanbul 合作机构,皮肤与性病科参与

三家机构均在土耳其(Europe–Asia 过渡区),皮肤类型分布较单一欧洲队列更广,这也正是论文强调"区域皮肤类型代表性"的立论基础。需要提示的是:论文仅在作者与致谢层面列出机构名,未逐机构披露各自贡献的图像数,因此机构间是否存在贡献集中度偏斜,无法从论文判断——这一点已列入存照待核(§9)。

采集时段 2008-2021 意味着这套数据横跨了皮肤镜设备从早期数字皮肤镜到手机附件成像的技术演进,图像在分辨率、色彩还原与视野规范上存在天然异质性。

2.2 图像规格与采集工艺

设备(四类):

  • MoleMax 3 / MoleMax HD(Derma Medical Systems, Vienna, Austria)——数字皮肤镜系统,固定式工作站。
  • FotoFinder® videodermatoscope(FotoFinder Systems, Bad Birnbach, Germany)——视频皮肤镜。
  • 3gen DermLite DL4 手持皮肤镜(DermLite LLC, California, USA)+ iPhone 5/7 连接套件(Apple Inc., California, USA)——手机耦合方案。
  • 高分辨率 DSLR 相机与手机加皮肤镜附件——用于补充。

成像规格:数字皮肤镜偏振光接触式(contact-polarized),放大倍率 10×–140×;手机耦合方案最高可达 3840×2160(4K);图像存为 JPEG,标签与元数据存于 CSV/.tab。

采集标准化(论文描述):

  • 采用偏振光接触式成像,必要时加界面介质(如超声凝胶)抑制反射光。
  • 病变居中,并保留少量健康皮肤作为上下文(避免纯病变裁剪丢失参照)。
  • 手机拍摄困难时多角度拍摄;黑边过大者裁剪、过小者保留。

这些工艺细节让数据集在"临床可用性"维度优于纯研究拍照集:视野规范、病变居中、有上下文皮肤。

2.3 三级分类体系(taxonomy tree)

DERM12345 的核心是标签体系,而非图像本身。它把 40 个子类编排进一棵三级树:

5 super classes
├── Melanocytic Benign(黑色素细胞良性)→ 若干 main classes → 若干 subclasses
├── Melanocytic Malignant(黑色素细胞恶性)→ 5 main classes → 5 subclasses
├── Nonmelanocytic Benign(非黑色素细胞良性)→ 3 main classes → 若干 subclasses
├── Nonmelanocytic Indeterminate(非黑色素细胞不确定)→ 1 main class → 1 subclass
└── Nonmelanocytic Malignant(非黑色素细胞恶性)→ 3 main classes → 若干 subclasses
        ↓ 二级:15 main classes
        ↓ 三级:40 subclasses

一级 5 个 super classes 同时编码了两个维度的属性:细胞来源(黑色素细胞 vs 非黑色素细胞)与恶性程度(良性 / 不确定 / 恶性)。这让标签天然支持按"分恶性任务"与"分细胞来源任务"两种方式切分——例如把 Melanocytic Malignant + Nonmelanocytic Malignant 合并为正类,其余为负类,即可构造一个二分类恶性筛查任务。

缩写规则(论文原文明确交代,检索者必读):dysplastic nevus 与 banal nevus 两类采用"主类首字母 + 子类首字母"的拼写方式,例如 (a)cral (j)unctional (b)anal nevus → ajb;其余子类取首字母缩写,例如 (b)asal ©ell ©arcinoma → bcc。理解这套规则后,jd、ajd、acb 这类不透明缩写才读得懂。

2.4 40 子类逐类分布:一个头部主导的不均衡样本

论文 Table 2 给出了 40 个子类的逐类图像数。以下按 5 个 super classes 归并(总数已校验):

Melanocytic Benign(合计 10,043)

子类缩写 语义组 图像数
acb Banal Compound nevus (acral) 37
ccb Banal Compound nevus (common) 418
mcb Banal Compound nevus (mucosal?) 123
cb Banal Compound nevus 722
bdb Banal Dermal nevus (blue?) 163
db Banal Dermal nevus 560
ajb Banal Junctional nevus (acral) 426
cjb Banal Junctional nevus (common) 143
jb Banal Junctional nevus 1,223
acd Dysplastic Compound nevus (acral) 9
ccd Dysplastic Compound nevus (common) 32
cd Dysplastic Compound nevus 498
ajd Dysplastic Junctional nevus (acral) 288
srjd Dysplastic Junctional nevus (slowly renewing?) 19
jd Dysplastic Junctional nevus 5,275
rd Dysplastic Recurrent nevus 16
isl Ink Spot Lentigo 6
ls Lentigo simplex 25
sl Solar Lentigo 60

Melanocytic Malignant(合计 400)

子类缩写 语义 图像数
alm Acral Lentiginous Melanoma 60
anm Amelanotic Melanoma 76
lm Lentigo Maligna 86
lmm Lentigo Maligna Melanoma 25
mel Melanoma 153

Nonmelanocytic Benign(合计 1,077)

子类缩写 语义组 图像数
sk Seborrheic Keratosis 607
lk Lichenoid Keratosis 8
df Dermatofibroma 180
angk Angiokeratoma 39
ha Hemangioma 166
la Lymphangioma 56
pg Pyogenic Granuloma 7
sa Sebaceous Adenoma 14

Nonmelanocytic Indeterminate(合计 58)

子类缩写 语义 图像数
ak Actinic Keratosis 58

Nonmelanocytic Malignant(合计 767)

子类缩写 语义组 图像数
bcc Basal Cell Carcinoma 423
bd Bowen’s Disease 37
ch Cutaneous Horn 12
mpd Metastatic Paget’s Disease? / Microcystic adnexal? 9
scc Squamous Cell Carcinoma 266
dfsp Dermatofibrosarcoma Protuberans 4
ks Kaposi Sarcoma 16

合计校验:10,043 + 400 + 1,077 + 58 + 767 = 12,345 ✓(与全集总数一致)。

不均衡自曝:最大的单一子类 jd(dysplastic junctional nevus)有 5,275 张,占全集 42.7%;而长尾极端稀疏——isl(ink spot lentigo)仅 6 张、dfsp(dermatofibrosarcoma protuberans)仅 4 张、pg(pyogenic granuloma)仅 7 张。这种"头部一个类吃掉四成、尾部若干类不足十张"的分布,是直接多类训练必然失衡的根本原因,也是该数据集最需要在文档里显式提示的使用约束。

2.5 元数据字段

每张图像配 11 项元数据(论文与 Dataverse 一致):

字段 含义
Unique Image ID 图像唯一标识(key)
Patient ID 患者标识(用于按患者划分)
Image Type 成像类型
Copyright License 版权许可(CC BY 4.0)
Split train / test 归属
Super Class 一级类(5 类之一)
Malignancy 恶性与否标志
Main Class 1 二级类(主)
Main Class 2 二级类(副,多诊断时)
Sub Class 三级类(40 类之一)
Label 最终标签

Main Class 1 / Main Class 2 的双字段设计值得一提:它为"多诊断合并病变"预留了表达空间——论文的排除标准里明确写到,无法拆分的多诊断合并病变会被排除,而能标识主次诊断的则通过这两个字段记录。

2.6 train/test 划分:按患者切分与两处例外

论文的划分策略是:train 9,860(80%)/ test 2,485(20%),按患者(based on patients)划分。按患者而非按图像划分,是避免"同一患者的不同图像分落两侧"造成数据泄漏的标准做法,也是让测试分数更接近真实泛化能力的必要条件。

划分时还包含了两个防泄漏细节:

  1. 类平衡考虑(class balancing):划分过程顾及了类别分布的均衡,避免某一子类在测试集中完全缺席。
  2. 低样本子类按唯一病灶人工标注:对图像数很少的子类,人工按唯一病灶(unique lesion)判别归属,防止同一病灶的图像跨 train/test。

两处例外(重要约束):dfsp(4 张)与 mpd(9 张)两个子类因孤例过少,未按唯一病灶划分。这意味着这两个类可能存在潜在的同患者跨集风险,使用者在做细粒度评测时应当知晓——这两类的分数带有一层"可能被泄漏抬高"的不确定性。

2.7 标签语义逐类详解(40 子类)

为便于检索者查阅,以下把 40 个子类的临床语义逐条展开。缩写规则见 §2.3。

Melanocytic Benign(黑色素细胞良性,10,043 张)

  • cb(Banal Compound nevus,722 张):普通复合痣,痣细胞同时位于表皮与真皮,是最常见的色素痣类型之一。
  • acb(acral 变体,37 张):位于掌跖等无毛皮肤的复合痣,因部位特殊(黑色素瘤高发于掌跖)而单列。
  • ccb(common 变体,418 张):经典型复合痣。
  • mcb(123 张):复合痣的另一变体。
  • db(Banal Dermal nevus,560 张):普通皮内痣,痣细胞完全位于真皮,临床多呈半球形隆起。
  • bdb(163 张):皮内痣变体。
  • jb(Banal Junctional nevus,1,223 张):普通交界痣,痣细胞位于表皮-真皮交界,色素常较深。
  • ajb(acral 变体,426 张):掌跖部位交界痣。
  • cjb(common 变体,143 张):经典型交界痣。
  • cd(Dysplastic Compound nevus,498 张):发育不良复合痣,异型性介于普通痣与黑色素瘤之间。
  • acd(9 张)/ccd(32 张):其 acral / common 变体。
  • jd(Dysplastic Junctional nevus,5,275 张):全集最大子类(42.7%),发育不良交界痣,是分恶性的核心难点。
  • ajd(288 张)/srjd(19 张):其 acral 变体与另一亚型。
  • rd(Dysplastic Recurrent nevus,16 张):发育不良复发性痣,痣在部分切除或外伤后再生的形态。
  • isl(Ink Spot Lentigo,6 张):全集最小子类之一,墨点样雀斑,深色不规则色素斑。
  • ls(Lentigo simplex,25 张):单纯性雀斑样痣。
  • sl(Solar Lentigo,60 张):日光性雀斑样痣,长期日晒相关的良性色素斑。

Melanocytic Malignant(黑色素细胞恶性,400 张)

  • mel(Melanoma,153 张):黑色素瘤,本 super class 最大子类。
  • lm(Lentigo Maligna,86 张):恶性雀斑样痣,原位阶段的黑色素瘤。
  • lmm(Lentigo Maligna Melanoma,25 张):恶性雀斑样痣进展为侵袭性黑色素瘤。
  • anm(Amelanotic Melanoma,76 张):无色素性黑色素瘤,因缺乏色素最易漏诊。
  • alm(Acral Lentiginous Melanoma,60 张):肢端雀斑样黑色素瘤,掌跖与甲下高发,在亚洲人群中占比相对高。

Nonmelanocytic Benign(非黑色素细胞良性,1,077 张)

  • sk(Seborrheic Keratosis,607 张):脂溢性角化病,最常见的良性表皮增生,临床易与黑色素瘤混淆。
  • lk(Lichenoid Keratosis,8 张):苔藓样角化病,炎症性良性病变。
  • df(Dermatofibroma,180 张):皮肤纤维瘤,常见良性真皮结节。
  • angk(Angiokeratoma,39 张):血管角皮瘤。
  • ha(Hemangioma,166 张):血管瘤。
  • la(Lymphangioma,56 张):淋巴管瘤。
  • pg(Pyogenic Granuloma,7 张):全集最小子类之一,化脓性肉芽肿,快速生长的血管性病变。
  • sa(Sebaceous Adenoma,14 张):皮脂腺瘤。

Nonmelanocytic Indeterminate(非黑色素细胞不确定,58 张)

  • ak(Actinic Keratosis,58 张):光化性角化病,日光损伤相关的癌前病变。它是唯一被归入"不确定"层的子类——反映了光化性角化病介于良性日光损伤与鳞状细胞癌原位之间、恶性归属存在分歧的临床现实。

Nonmelanocytic Malignant(非黑色素细胞恶性,767 张)

  • bcc(Basal Cell Carcinoma,423 张):基底细胞癌,全集第二大类非黑色素细胞恶性,也是最常见的皮肤恶性肿瘤。
  • scc(Squamous Cell Carcinoma,266 张):鳞状细胞癌。
  • bd(Bowen’s Disease,37 张):鲍温病,原位鳞状细胞癌。
  • ch(Cutaneous Horn,12 张):皮角,角质过度增生的临床形态,基底可含恶性成分。
  • mpd(9 张):未按病灶划分的两个子类之一(见坑 7)。
  • dfsp(Dermatofibrosarcoma Protuberans,4 张):全集最小子类,低度恶性真皮肿瘤,同样未按病灶划分。
  • ks(Kaposi Sarcoma,16 张):卡波西肉瘤,血管来源恶性肿瘤。

2.8 "不确定"层的设计意义

三级树中唯一特殊的是 Nonmelanocytic Indeterminate 层,仅含 ak(光化性角化病)58 张。把光化性角化病从良性与恶性中单独拎出来,是一个有临床依据的选择:

  • 光化性角化病在病理上表现为角质形成细胞的异型增生,部分病例可进展为鳞状细胞癌,但相当比例自发消退——"良性还是恶性"在临床上本就有争议。
  • 若强行归入良性,会稀释良性参照;若归入恶性,又会把大量并不进展的病变算作恶性。单设"不确定"层,等于用标签结构诚实地表达这种模糊性。

这层设计对建模有直接启示:层次分类模型在这一层应当保留"无法确定"的输出选项,而非被迫二选一。这也是 DERM12345 三级树优于平铺标签的一个具体体现——它允许标签体系承载临床上的"中间态"。

2.9 元数据文件结构与使用

两份元数据 .tab 为制表符分隔的文本文件,可直接用 pandas 读入:

  • derm12345_metadata_train.tab:1,224,410 字节,对应 9,860 张训练图像。
  • derm12345_metadata_test.tab:306,251 字节,对应 2,485 张测试图像。

按字节数粗算,训练元数据约每行 124 字节、测试约每行 123 字节,与 11 个字段的规模相符。使用要点:

  1. Split 字段是权威划分:不要自行随机划分,须直接用 Split 列,才能与论文口径一致。
  2. Patient ID 是划分依据:train/test 的划分按 Patient ID 而非图像,因此同一患者的图像只会出现在一侧。
  3. Sub Class 是 40 子类标签:需要粗类时可按 Super Class 或 Main Class 字段向上归并,无需重新标注。
  4. Malignancy 可直接构造二分类:该字段提供了恶性与否的现成标志,便于做恶性筛查任务。
  5. Copyright License 字段为 CC BY 4.0:每行附带许可信息,便于逐条溯源。

这套元数据设计让"同一份图像、多种任务切分"成为可能:想练 40 类细粒度分类用 Sub Class,想练 5 类超类用 Super Class,想练恶性筛查用 Malignancy,想练层次分类则三层依次下探——一份数据覆盖四种任务粒度,是细粒度标签体系带来的直接便利。

§3 注释流水线:专家共识 + 活检证实的循证分级

3.1 两级专家终审

DERM12345 的标注结构相当简洁,没有多层学生流水线,而是两位资深皮肤科专家直接终审:

  • Gulsum Gencoglan(GG)——Istinye University / Liv Hospital Vadistanbul 皮肤与性病科;另获基础肿瘤学第二博士学位(basic oncology),这为其在恶性病变判断上提供了病理侧的知识支撑。
  • Sirin Pekcan Yasar(SPY)——The University of Health Sciences, Haydarpasa Numune Research and Training Hospital 皮肤与性病科,20 年以上皮肤镜经验。

两人均具 20+ 年皮肤镜经验,所有标签以**共识决策(consensus decision)**方式确定,而非单人裁定或多数投票。这一设计降低了单一观察者的系统偏差,但也意味着标注吞吐受限于两位专家的可用时间——这恰好解释了为什么数据集只有 12,345 张,而非十万量级。

3.2 诊断确认的三来源

论文的入选标准(Inclusion Criteria)规定了诊断确认的三条来源,构成一个可信度阶梯:

  1. 两位专家的临床诊断共识——最基础的来源。
  2. 随访(follow-up)——对良性病变尤其重要:痣若有 >2 年数字皮肤镜随访且形态无变化(nevoid involution 除外),即标记为"无变化",为其良性属性提供时间维度证据。
  3. 组织病理证实(histopathological confirmation, where available)——最高强度的证据来源,且所有恶性病变均经活检证实。

这套"共识 + 随访 + 病理"的三来源设计,使标签的循证强度高于纯目视标注的数据集:恶性标签有组织学地气支撑,部分良性标签有时间稳定性支撑。

3.3 采集初筛与排除标准

在专家终审之前,有一套工程化初筛:由受训工程师按入选/排除标准预筛——明显不符合者剔除;一张图含多类病变者进行裁剪。

论文列出的排除标准覆盖了多个维度:

  • 成像质量:模糊、曝光过度或不足、存在大伪影。
  • 元数据:缺失关键元数据字段。
  • 伦理:含可识别患者信息或未获同意。
  • 非目标病变:甲病变、黏膜病变、cockade nevus、白斑;结节病/银屑病等系统性疾病皮损;疣、囊肿、瘢痕疙瘩、皮脂腺增生、生殖器疣、类脂蛋白沉积症、角膜下出血、色素性紫癜性皮肤病、黏膜黑变病;以及皮脂腺癌、汗腺来源的部分腺癌等。

这份排除清单实质上定义了数据集的适用边界:它聚焦于色素性与常见皮肤肿瘤性病变,刻意剔除了黏膜、甲、炎症性与部分皮肤附属器肿瘤——使用者若想研究这些被排除的类别,DERM12345 覆盖不到。

3.4 去重与提取工具链

  • 重复图像处理:用 Python 脚本按文件大小比对检测重复,发现 280 张重复图像,再经人工复核后剔除。文件大小比对是一种低成本近似(同一图像往往字节数相同),但也可能漏掉经重编码的重复,因此人工复核是必要补充。
  • 元数据提取:Python 3.11.5 + BeautifulSoup 4.12.2——从 HTML 内自动提取图像与元数据并分类;无法自动导出的数据手工标注;最终 metadata 手工整理为 CSV。
  • 子类定义逻辑:易恶变或类恶性的良性病变单独设子类(dysplastic nevus、congenital nevus、blue nevus、recurrent nevus);按解剖部位分(如掌跖 acral 类);多诊断合并病变若无法拆分则排除。

3.5 流水线画像小结

环节 执行者 工具/依据
采集初筛 受训工程师 入选/排除标准;多类病变裁剪
重复检测 Python 脚本 文件大小比对(发现 280 张)
元数据提取 Python 3.11.5 + BeautifulSoup 4.12.2 + 手工 HTML 自动提取 + 手工 CSV
专家终审 GG + SPY(共识) 临床共识 + 随访 + 活检病理

与"学生注释 + 专家终审"的大规模众包式流水线相比,DERM12345 走的是"小团队高强度专家共识"路线:规模换质量,12,345 张的每个标签都直接出自两位 20+ 年经验专家之手。这是一条与 HAM10000(单专家目视)和 PANDA-PLUS(三层学生流水线)都不同的第三条路线(§8.4 有横向对照)。

3.6 复现骨架(SOP 模板)

若要在自有皮肤镜数据上复刻 DERM12345 的标注路线,可参照以下骨架:

阶段 0:伦理与合规(先行)
  - 申请伦理审查批件(回顾性研究通常可豁免知情同意)
  - 确认数据匿名化流程(去可识别患者信息)
  - 明确最终许可(DERM12345 选 CC BY 4.0)

阶段 1:采集与初筛(工程师或研究助理)
  - 按入选标准预筛明显不符者
  - 一张图含多类病变者裁剪拆分
  - 按排除标准剔除:成像质量差 / 缺元数据 / 非目标病变
  - 记录每张图的采集设备、日期、部位

阶段 2:去重(脚本 + 人工)
  - 脚本按文件大小比对(或更稳健的图像哈希)
  - 人工复核候选重复对,确认后剔除
  - DERM12345 在此步发现并剔除 280 张

阶段 3:元数据提取(脚本 + 手工)
  - Python 自动提取可导出的元数据(DERM12345 用 3.11.5 + BeautifulSoup)
  - 不可自动导出的手工整理为 CSV
  - 字段对齐:Image ID / Patient ID / 设备 / 许可 / 划分 / 各级类 / 标签

阶段 4:标签体系设计(专家主导)
  - 确定分类树的层级数(DERM12345 用三级)
  - 决定哪些易恶变良性病变单列子类(dysplastic/congenital/blue/recurrent nevi)
  - 决定是否设"不确定"层(DERM12345 为 ak 设了一层)

阶段 5:专家终审(两位专家共识)
  - 两位专家独立判读 → 分歧处讨论达成共识
  - 恶性病变争取活检病理证实
  - 良性痣争取 >2 年数字皮肤镜随访无变化的记录
  - 记录每个标签的证据强度(共识/随访/病理)

阶段 6:划分(按患者)
  - 按 Patient ID 划分 train/test(DERM12345 为 80/20)
  - 低样本子类按唯一病灶划分防泄漏
  - 顾全类别平衡(class balancing)
  - 显式记录无法按病灶划分的例外子类(DERM12345 的 dfsp/mpd)

3.7 标注质量的可信度分级

DERM12345 的循证设计可抽象为一个标签可信度分级模型,供其它数据集借鉴:

证据强度 来源 适用情形
最强 组织病理证实(histopathology) 所有恶性病变、可活检的疑难病变
强 长期随访无变化(follow-up) 良性痣等需排除恶性的病变
中 两位专家临床共识 无病理也无长期随访、但形态典型的病变
基础 单一专家目视 仅作兜底,DERM12345 未采用此级

DERM12345 的实际构成是:恶性病变全部落在"最强"级,部分良性痣落在"强"级,其余落在"中"级,未使用"基础"级。这种"最弱也是两位专家共识"的底线,是该数据集标签质量的核心保证。使用者在引用时应知晓:并非每个良性标签都有病理背书,但每个标签至少经两位专家共识。

3.8 与库内其它标注模式的横向对照

数据集 标注主体 终审 证据来源 规模
DERM12345 两位皮肤科专家 共识决策 共识 + 随访 + 活检 12,345 图像级
PANDA-PLUS 式 学生 + 专家 专家全量终审 专家目视 + 像素级 546 WSI 像素级
HAM10000 式 单专家 无共识 目视 + 部分病理 10,015 图像级
众包式 众包工人 抽检 多数投票 十万级

DERM12345 处在"小团队高强度"与"大规模低成本"之间的位置:它用两位专家换来了高于众包集的标签质量,用图像级(而非像素级)标注换来了 12,345 的规模。这是一个在"质量-规模-粒度"三角中偏向质量与粒度的可行解。

§4 比较发现:40 子类在公开皮肤镜数据集景观中的位置

4.1 论文 Table 1 数据集景观对照

论文引言用一张对照表把 DERM12345 放进公开皮肤镜数据集的坐标系里。以下数字为论文正文实核:

数据集 图像数 类别数
ISIC-2016 1,279 2
ISIC-2017 2,000 3(mel / nv / sk)
HAM10000 10,015 7
BCN20000 18,946 8
Patient-Centric 33,126 2
PROVe-AI 603 15
阿根廷集合 — 10(已并入 ISIC)
ISIC 全档 >1,156,000(截至 2024-11-25) —
DERM12345(本文) 12,345 40

这张表把 DERM12345 的定位讲得很清楚,也需要读者自己把话说白:

  • 总量维度它不占优:12,345 张低于 BCN20000 的 18,946 与 Patient-Centric 的 33,126,更远低于 ISIC 全档的百万级。论文的措辞是"多类数据集中图像总量最大之一(one of the largest collections to date in terms of the total number of images in multiclass datasets)"——注意"之一"与"多类"两个限定词。
  • 类别维度它是极值:40 子类远超次高的 PROVe-AI(15 类)与阿根廷集合(10 类),是 HAM10000(7 类)的近 6 倍、BCN20000(8 类)的 5 倍。

所以 DERM12345 的差异化一句话概括:用中等体量换取最细的类别粒度。它的卖点是标签,不是数据量。

4.2 与 HAM10000 的关系边界

HAM10000 是本领域最常被引用的皮肤镜集合(10,015 张 / 7 类,来自奥地利与澳大利亚)。两者的区别是三重的:

  1. 体量与类别:12,345 张 / 40 类 vs 10,015 张 / 7 类——量级相近,但类别体系完全不同。
  2. 分类结构:HAM10000 是平铺的 7 类(akiec / bcc / bkl / df / mel / nv / vasc);DERM12345 是三级树,把"nevus"这一 HAM10000 的单一类拆到 banal / dysplastic / acral 等多层。
  3. 地理与皮肤类型:HAM10000 以欧洲人群为主;DERM12345 来自土耳其(Europe–Asia 过渡区)。

关键判定:DERM12345 不是 HAM10000 的扩展或子集,两者无包含关系,是可并列的两个独立集合。

4.3 与 BCN20000 的关系边界

BCN20000(18,946 张 / 8 类,西班牙巴塞罗那医院)常被当作"HAM10000 之后的更大集合"。与 DERM12345 的区别:

维度 BCN20000 DERM12345
图像数 18,946 12,345
类别数 8 40
分类结构 平铺 三级树
地域 西班牙 土耳其
定位 大样本粗类 中等样本细粒度

两者是"规模 vs 粒度"的两个极端选择,互为补充而非竞争。总结合集 BCN20000 的使用者若需要细粒度监督,DERM12345 是天然的下游或并行素材。

4.4 与 ISIC 挑战赛集的关系边界

库内已有 isic-2018 / isic-2019 / isic-2020(record_id 710 / 707 / 715)与 isic-archive(56)。DERM12345 与 ISIC 的关系是两条路径的交汇而非隶属:

  • 标签路径独立:ISIC 挑战赛各年份集有各自的类别定义(2-8 类不等),DERM12345 的 40 子类是自建体系,不由 ISIC 定义。
  • 分发路径交叠:DERM12345 作为独立数据集,又被接入 ISIC Archive 镜像(DOI 10.34970/705541 待核),因此在 ISIC 的 UI/CLI 里也能访问到它。

这一点容易被误判为"DERM12345 是 ISIC 的子集"——不是。它是先作为独立数据集发布(Harvard Dataverse),再被 ISIC 收录为镜像,关系是"收录"而非"归属"。

4.5 景观定位小结

                    类别数(粒度高 →)
                            ▲
                40 │        DERM12345 (12,345)
                   │
                15 │  PROVe-AI (603)
                10 │  阿根廷集
                 8 │        BCN20000 (18,946)
                 7 │  HAM10000 (10,015)
                 3 │  ISIC-2017 (2,000)
                 2 │  ISIC-2016 (1,279) / Patient-Centric (33,126)
                   └──────────────────────────────► 图像数(规模大 →)

DERM12345 落在"高类别数、中等规模"象限,是该象限在公开皮肤镜数据集里的代表;与它同规模但落在低类别数象限的是 HAM10000,与它同类别数但规模极小的是 PROVe-AI。

§5 核心发现与基线实验

5.1 dysplastic nevus 主导:一个刻意的分布选择

论文最重要的分布观察是:dysplastic nevus(发育不良痣)合计约 6,136 张,构成数据集的很大一部分(论文原文 “The number of dysplastic nevus (N: 6,136) constituted a large part of the dataset”)。

把发育不良痣拆到子类看:

子类 图像数
cd(Dysplastic Compound nevus) 498
acd(acral 变体) 9
ccd(common 变体) 32
jd(Dysplastic Junctional nevus) 5,275
ajd(acral 变体) 288
srjd 19
rd(Dysplastic Recurrent nevus) 16
按表相加 6,137
论文正文口径 6,136

口径差 1 存照:论文正文写 6,136,而按 Table 2 逐类相加为 6,137。本条目正文引用论文口径 6,136,并在此显式记录二者相差 1——这是原始文档的一处小瑕疵,使用者无论引用哪个数字,都应知晓该差异存在。

与之对照,banal nevus(普通痣)合计 3,815 张(cb 722 + acb 37 + ccb 418 + mcb 123 + db 560 + bdb 163 + jb 1,223 + ajb 426 + cjb 143 = 3,815 ✓,与论文口径一致)。

为什么保留这么多发育不良痣? 论文的逻辑是:发育不良痣与黑色素瘤在皮肤镜下高度相似,是临床"分恶性"最容易出错的边界。把它作为数据集中占比最大的类,等于把最难的问题摆在模型面前——这既提高了任务难度,也让模型必须学会区分"类恶性的良性"与"真恶性",从而降低假阳性。同样的设计逻辑也体现在 congenital nevus、blue nevus、recurrent nevus 被单独设为子类上。

5.2 基线深度学习实验设置

论文用三个经典 CNN 建立了基线(Baseline deep learning):

配置项 取值
模型 ResNet50 / Xception / InceptionResNetV2
框架 Python 3.9.19 + TensorFlow 2.10.1
输入尺寸 224×224(ResNet50)与 299×299(后两者)
预处理 缩放后存为 NumPy 数组
数据增强 旋转(range 45)、缩放(0.2)、宽度平移(0.2)、水平与垂直翻转
预训练 ImageNet 预训练权重
训练策略 50 epochs 不微调 + 200 epochs 微调

5.3 基线结果:三模型均未过半

test set 加权准确率(weighted accuracy):

模型 加权准确率
ResNet50 0.50
Xception 0.59
InceptionResNetV2 0.58

三个模型在 40 子类细粒度分类上的加权准确率都未超过 0.60,最好的 Xception 也只有 0.59。论文用这组数字传达的核心信息是:40 子类细粒度分类是一个当前方法远未解决的难题,标准 CNN + ImageNet 预训练的组合在该基准上表现有限,由此凸显细粒度层次学习(hierarchical learning)等更智能方法的必要性。

口径注记:论文写"trained 50 epochs without fine tuning and 200 epochs with fine tuning",但最终报告的是 test set 加权准确率的单值(0.50 / 0.59 / 0.58),未区分"无微调"与"微调"两阶段各自的成绩。因此严格来说,这三个数字对应的是最终模型(含微调阶段)的成绩;若原文献后续补充了两阶段的分别结果,引用时需以新口径为准。

5.4 使用价值主张

论文对数据集用途的宣称可归纳为三条:

  1. 支撑层次学习(hierarchical learning):三级树结构天然适配"先分 super class、再分 main class、最后定 subclass"的层次模型,也为层次分类算法提供了公开的评测底座。
  2. 填补区域皮肤类型代表性空白:土耳其(Europe–Asia 过渡区)队列在多以欧美浅肤色人群为主的公开集中提供了地域与肤色的补充。
  3. 兼具临床视觉参考与 ML 训练验证双重用途:细粒度标注既可供皮肤科医生作为形态学参考,也可供模型训练与验证。

论文还把"含大量与恶性高度相似的良性子类"作为一项设计优势,宣称其可支持失败分析(failure analysis)——因为有了细粒度真值,模型把哪一种良性误判成哪一种恶性是可追踪的,而粗类数据集只能给出一个笼统的"nevus↔melanoma"混淆。

5.5 核心宣称与边界

论文最具分量的一句宣称是:40 子类 + taxonomy tree 的组合属"科学文献中首次"(first time in the scientific literature)。这是对"类别粒度"这一维度的首发性主张,而非对规模或图像质量的主张。引用时应完整保留其限定:首发的是标签体系结构,不是数据量、不是图像质量、不是首个皮肤镜数据集。

与之配套的边界条件是:论文并未声称模型性能达到临床可用水平(基线准确率不足 0.6),也未声称已解决类别不均衡问题。DERM12345 提供的是"更细的监督信号"这一原材料,如何用好它仍取决于下游方法。

§6 获取与许可:三层均可公开直链

6.1 三层资产、三条入口

DERM12345 的可获取性结构比多数数据集干净——三层资产全部公开、无请求制、无付费墙:

层 内容 入口 许可
图像 + 元数据 12,345 张 JPEG + 两份 .tab Harvard Dataverse doi:10.7910/DVN/DAXZ7P CC BY 4.0
镜像 同一数据的 ISIC 界面 ISIC Archive(DOI 10.34970/705541,待核) 随 ISIC 条目口径
代码 基线训练源码 GitHub abdurrahimyilmaz/derm12345 见 repo
生态 Google Derm Foundation 嵌入教程 / notebooks / 模型卡 GitHub + Google 开发者站 见各 repo/页

6.2 Harvard Dataverse 文件清单(v2.1 实抓)

抓取时点为 Dataaverse latestVersion v2.1(versionState RELEASED,versionNumber 2,versionMinorNumber 1)。文件清单:

文件名 字节数 约合 类型
derm12345_metadata_train.tab 1,224,410 1.17 MB text/tab-separated-values
derm12345_metadata_test.tab 306,251 0.29 MB text/tab-separated-values
derm12345_test.zip 1,364,209,784 ≈ 1.27 GB application/zip
derm12345_train_part_1.zip 2,546,603,585 ≈ 2.37 GB application/zip
derm12345_train_part_2.zip 2,651,572,884 ≈ 2.47 GB application/zip

训练集拆两卷的由来:论文原文明确写到,因平台上传体积限制,训练集被拆成 derm12345_train_part_1.zip 与 derm12345_train_part_2.zip,并提示使用者 “please merge derm12345_train_part_1 and derm12345_train_part_2 in one folder”。三卷 ZIP 合计约 6.1 GB。首次下载者若只取到其中一卷,会得到不完整的训练集——这是一个必须先读文档才能避开的坑(见坑 6)。

6.3 元数据下载的轻量入口

如果只是想探查标签分布、做统计或搭评测管线,不必先下载 6 GB 图像:metadata_train.tab(1.17 MB)与 metadata_test.tab(0.29 MB)已包含全部 11 项字段与 Split 归属。先取元数据、再决定要不要下图像,是使用该数据集的推荐路径。

6.4 AI-Ready 评估:许可干净带来的高分

维度 观察
可发现性 高——DOI 双注册(论文 + Dataverse)、ISIC 镜像、GitHub 代码,检索DERM12345 精确短语直达
可获取性 高——CC BY 4.0 全公开直链,无请求制、无 gated、无审批,是该数据集相对同类最突出的优势
可互操作 中高——JPEG + TSV 通用格式,但无官方 DICOM / COCO / Parquet 转换脚本
元数据质量 中高——11 项字段齐全、Table 2 逐类计数完整;minor 瑕疵为 dysplastic 计数差 1、机构贡献数未披露
可持续性 中高——Dataverse 与 ISIC 均为机构级长期托管,优于个人网盘;GitHub 代码仓为个人托管的单点

与库内需要请求制、需 Kaggle 登录或需签署 DUA 的皮肤条目相比,DERM12345 的"CC BY 4.0 即点即下"属性显著降低了复现门槛,这也是它作为 AI-Ready 条目的一项加分。

§7 衍生基准与外部采纳

7.1 Google Derm Foundation 生态

DERM12345 已被纳入 Google Derm Foundation 的使用生态。Dataverse 的描述中明确列出三条链接:

  • 嵌入教程仓库:https://github.com/abdurrahimyilmaz/derm12345_google-derm-foundation
  • Google 官方 notebooks:https://github.com/Google-Health/derm-foundation/tree/master/notebooks
  • 模型卡:https://developers.google.com/health-ai-developer-foundations/derm-foundation/model-card

这条生态链的意义在于:DERM12345 被当作"基础模型嵌入 + 下游微调"的典型素材,而非仅作端到端训练的原始集。使用者可以先用 Derm Foundation 提取嵌入,再在 40 子类上做线性探针或微调,从而把"数据集的细粒度标签"与"基础模型的通用表征"结合。这是数据集价值被外部生态放大的一个实例。

7.2 ISIC Archive 镜像

数据集亦接入 ISIC Archive,提供进阶用户界面与 CLI,DOI 记为 10.34970/705541。通过 ISIC 通道,使用者可用统一的 ISIC 工具链访问该集合,降低了跨数据集批量分析的切换成本。

待核提示:该 ISIC DOI 在本次抓取时因 API 响应超时未能实抓落地页确认,DOI 数值按公开线索存照(§9 与坑 5)。

7.3 与库内皮肤影像家族的关系

DERM12345 补齐了库内皮肤影像家族中"细粒度子类"这一格。家族内其它条目多为粗类或特定维度集合:

  • 粗类并列:ham10000(60)(7 类)、bcn20000(161)(8 类)——与 DERM12345 是同规模不同粒度的对照。
  • 细类但规模小:derm7pt(110)(7 点/双模态系列)、ph2(121)(小规模分割)、pad-ufes-20(151)、bach(118)——DERM12345 在细类维度上规模最大。
  • ISIC 挑战赛序列:isic-2018(710) / isic-2019(707) / isic-2020(715) / isic-archive(56)——DERM12345 与其关系是"被收录为镜像"而非隶属。
  • scin(181):含肤色标注的皮肤数据集,与 DERM12345 的"区域皮肤类型"关切互补。

7.4 生态定位小结

DERM12345 目前处于"被两条公开生态链采纳"的状态:ISIC(分发镜像)与 Google Derm Foundation(基础模型嵌入素材)。它尚未衍生出独立的评测基准(benchmark)或挑战赛——这是它与 PANDA-PLUS 等"本体 + 基准"组合模式的一个差异。使用者想做标准化评测,需要自行在其 test 划分(2,485 张)上定义指标。

§8 方法学启示与生态

8.1 标签粒度是可选的超参数

DERM12345 最值得记住的方法学教训是:标签粒度不是数据集的固定属性,而是一个设计选择。同一批 12,345 张图像,若只标 7 类就是另一个 HAM10000 式的集合;标成 40 子类 + 三级树,就变成了一个支持层次学习与失败分析的细粒度基准。粒度选得越细,能表达的信息越多,但对标注者专业度的要求也越高、类不均衡也越严重。DERM12345 用 40 子类换来了细粒度监督,代价就是 jd 一个类占 42.7% 的极端不均衡——这个 trade-off 值得任何数据集设计者权衡。

8.2 "专家共识 + 活检证实"是小型高质量集的可行路径

与"学生注释 + 专家抽检/终审"的大规模流水线相比,DERM12345 展示了另一条路径:不追求十万量级,而是让两位 20+ 年经验的专家以共识方式直接终结每一张标签,并用"恶性病变均活检证实 + 良性痣随访验证"提供循证分级。这条路径的产出规模有限(12,345 张),但标签强度高——尤其恶性标签有组织学支撑。

8.3 循证分级的可复制性

论文的诊断确认三来源(专家共识 / 随访 / 组织病理)构成一个可复制的循证框架:

临床专家共识(基础)
  + 随访稳定性(对良性、尤其痣)
  + 组织病理证实(对恶性,where available)
  = 分级化的标签可信度

其它数据集构建者可借鉴:并非所有标签都需病理证实(那不现实),但对"哪些标签有病理支撑、哪些只有目视共识"做显式区分,能显著提升数据集的可信度透明度。

8.4 三条标注生产路线的横向对照

路线 代表 规模 标签强度 成本结构
单专家目视 HAM10000 式 万级 中 低,但无共识校验
学生流水线 + 专家终审 PANDA-PLUS 式 百级(但像素级) 高 专家时间被前置劳动稀释
小团队专家共识 DERM12345 万级 高(含活检) 专家时间即瓶颈,规模受限

DERM12345 是第三条路线的典型:它证明在"万级、每张都要专家共识"的约束下,仍能产出 12,345 张且恶性标签有活检背书。代价是机构与专家的产能上限直接决定了数据集规模上限。

8.5 生态与商业化

DERM12345 无直接商业化端口:没有付费墙、没有 gated 访问、论文声明无竞争利益(“The authors declare no competing interests.”)。它是一条纯粹的学术开放资产。

其生态位可概括为:"细粒度子类"代表,与 HAM10000 / BCN20000(粗类)形成互补;被 ISIC 与 Google Derm Foundation 两条公开生态链采纳;适合作为层次分类、细粒度皮肤病变识别、基础模型嵌入迁移研究的底座。

论文引言还提供了领域背景:皮肤镜诊断的准确性与训练及经验高度相关,存在人因变异;恶性/良性病变的患病率与结构随种族、地理、皮肤类型而异;AI 有潜力缩小临床检查中的人因经验差距——DERM12345 的"细粒度 + 区域代表性"正是对这一背景的直接回应。

§9 与库内条目的关系

9.1 家族图谱

DERM12345(derm12345)在库内皮肤影像家族中的位置:

皮肤影像家族
├── 粗类大集
│   ├── ham10000(60)      10,015 张 / 7 类(欧洲为主)
│   ├── bcn20000(161)     18,946 张 / 8 类(西班牙)
│   └── isic-archive(56)  ISIC 总库入口
├── 细类 / 特定维度
│   ├── derm12345(本条) 12,345 张 / 40 子类 / 三级树(土耳其)★
│   ├── derm7pt(110)      7 点临床-皮肤镜双模态
│   ├── ph2(121)          小规模专家分割
│   ├── pad-ufes-20(151)  解剖部位分布研究
│   ├── bach(118)         乳腺(非皮肤,仅作影像家族参考)
│   └── scin(181)         含肤色标注
└── ISIC 挑战赛序列
    ├── isic-2018(710) / isic-2019(707) / isic-2020(715)

9.2 检索路径建议

  • 想找细粒度皮肤病变标签 → derm12345(40 子类,库内最细)。
  • 想做粗类对照或大规模预训练 → ham10000(60) / bcn20000(161)。
  • 想研究临床-皮肤镜关联 → derm7pt(110)。
  • 想研究肤色 / 公平性 → scin(181)。
  • 想做分割 → ph2(121)(像素级但规模小)。
  • 想做跨地域泛化 → derm12345(土耳其)与 ham10000(欧洲)对比。

9.3 与库内各集的本质区分(查重结论)

核心判定:DERM12345 是独立的 12,345 张 / 40 子类新集——

  • 不是 HAM10000(10,015 张 / 7 类)的子集:图像数、类别数均不同,无包含关系。
  • 不是 BCN20000(18,946 张 / 8 类)的别名:来源医院、地域、类别体系全部不同。
  • 不是任何 ISIC 挑战赛年份集:ISIC 各年份集有独立类别定义;DERM12345 是自建 40 子类体系,仅被 ISIC 收录为镜像。
  • 不是 derm7pt / ph2 / pad-ufes-20 / scin 的任何变体:这些条目各自有独立的图像来源与标注维度。

slug 查重结果:url_name ILIKE '%derm12345%' 命中 0 行——derm12345 未被占用,不撞库。

9.4 建议互链点

条目 record_id 关系
ham10000 60 粗类对照(规模相近、粒度相反)
isic-archive 56 ISIC 镜像入口
bcn20000 161 粗类大集对照
derm7pt 110 细类但双模态
ph2 121 分割型皮肤集
pad-ufes-20 151 解剖部位研究集
scin 181 肤色公平性集
bach 118 影像家族参考(跨器官)
isic-2018 710 ISIC 挑战赛序列
isic-2019 707 ISIC 挑战赛序列
isic-2020 715 ISIC 挑战赛序列

9.5 与库内条目的互补用法

DERM12345 在库内不是孤立条目,而是可与多个皮肤条目组合使用:

组合 用途
derm12345 + ham10000(60) 细粒度与粗类的对照实验,检验粒度对分类难度的影响
derm12345 + bcn20000(161) 规模与粒度的两个极端,做数据规模 vs 类别数的消融
derm12345 + scin(181) 结合肤色标注做公平性分析(DERM12345 的土耳其队列肤色分布较广)
derm12345 + ph2(121) 分类(DERM12345)与分割(ph2)任务的联合研究
derm12345 + derm7pt(110) 图像级标签与临床-皮肤镜双模态关联的交叉验证
derm12345 全体 ISIC 序列 验证"独立集被 ISIC 收录"这一生态模式的实际影响

9.6 检索路径的边界提示

使用 DERM12345 时,有两条容易走错的检索路径:

  1. 不要用"土耳其数据集"当唯一检索词:文献中的土耳其皮肤数据集不止一个(如其它机构发布的色素性病变集),应用精确名 DERM12345 或 DOI 定位,避免张冠李戴。
  2. 不要把"40 类"当成"40 种疾病":40 子类是形态学分类,部分子类是同种病变的不同部位或亚型(如 cb / acb / ccb 都是复合痣),并非 40 种独立疾病实体。做流行病学统计时需先归并到 main class 或 super class。

9.7 库内皮肤影像家族的全景定位

把库内 11 个皮肤相关条目按"规模 × 粒度"两轴摆放,DERM12345 的位置一目了然:

粒度(类别数)
  ▲
40│  derm12345 ★
  │
  │
 8│         bcn20000
 7│  ham10000        derm7pt
  │
 2│  isic-2018/isic-2019/isic-2020
  └───────────────────────────────► 规模
    ~2k        10k        19k

DERM12345 独占"高粒度、中等规模"象限,与 HAM10000、BCN20000 构成粒度递进(7 → 8 → 40)的天然对照链。这条链本身就是一个可做实验的素材:用同一模型分别在 7 类、8 类、40 类上训练,可量化"类别数增加对分类难度的影响"。

§10 避坑清单:八个已踩过的坑

坑 1:把 DERM12345 当成 ISIC 的子集。DERM12345 是独立发布的集合,先经 Harvard Dataverse 发布,后被 ISIC 收录为镜像——关系是"收录"而非"归属"。ISIC 工具链里能看到它,不代表它由 ISIC 定义或由 ISIC 挑战赛产生。

坑 2:把 DERM12345 与 HAM10000 混为一谈。两者图像数相近(12,345 vs 10,015)、类别数悬殊(40 vs 7),来源地域不同(土耳其 vs 欧洲),是并行的两个独立集合,无包含关系。检索时勿以"另一个 nevus 集"处理。

坑 3:训练集只下载了一卷。因平台上传体积限制,训练集被拆成 derm12345_train_part_1.zip 与 derm12345_train_part_2.zip,必须两卷合并到同一文件夹才是完整训练集(论文原文提示 “please merge derm12345_train_part_1 and derm12345_train_part_2 in one folder”)。只取一卷会静默丢一半训练数据。

坑 4:dysplastic nevus 计数双口径。论文正文写 6,136,而按 Table 2 逐类相加(cd 498 + acd 9 + ccd 32 + jd 5,275 + ajd 288 + srjd 19 + rd 16)为 6,137。引用前先定口径,本条目正文按论文口径 6,136 并在 §5.1 记录差 1。

坑 5:ISIC 镜像 DOI 未实抓确认。ISIC Archive 镜像 DOI 记为 10.34970/705541,但本次抓取时 api.isic-archive.com/doi/derm12345 响应超时,未能实抓落地页核实。引用该 DOI 前建议自行访问确认(§9 已存照)。

坑 6:文件名缩写看不懂。40 子类用首字母缩写(jd、ajb、bcc、acd……),dysplastic/banal nevus 类采用"主类首字母 + 子类首字母"拼写(如 acral junctional banal nevus → ajb),其余取首字母(basal cell carcinoma → bcc)。不读论文的缩写规则注释,光看 CSV 里的标签会一头雾水(§2.3)。

坑 7:dfsp / mpd 存在潜在数据泄漏。低样本子类通常按唯一病灶人工划分防泄漏,但 dfsp(4 张)与 mpd(9 张)因孤例过少未按病灶划分,这两个类的 train/test 分数带有可能被同患者跨集抬高 的不确定性。用它们做细粒度评测时须显式声明该局限。

坑 8:基线结果的微调口径。论文写"50 epochs 不微调 + 200 epochs 微调",但只报告最终 test set 加权准确率单值(0.50 / 0.59 / 0.58),未给出两阶段分别的结果。引用时应说明这是最终模型成绩,不要武断归因于某个单一训练阶段。

(另有一项非坑点性质的观察:三家土耳其机构的图像贡献数论文未逐机构披露,机构偏斜无法评估;此点已列入 §9 待核,不计入坑点编号。)

§11 总结

11.1 三句话总结

  1. DERM12345 用 12,345 张 / 1,627 患者 / 40 子类的三级分类树,把公开皮肤镜数据集从"粗类"推进到"细粒度子类",论文宣称 40 子类粒度属科学文献首次。
  2. 它的标签由两位 20+ 年经验专家共识决策、恶性病变全部活检证实,并用"按患者划分 + 低样本子类按病灶划分"两道防线控制泄漏——代价是规模受专家产能限制。
  3. 它的可获取性是同类中的高分配置:数据集与论文同为 CC BY 4.0,Harvard Dataverse 直链即下,无请求制、无 gated、无付费墙,30 秒起步。

11.2 适合谁

  • 细粒度皮肤病变分类团队:需要 40 子类监督信号与三级树结构。
  • 层次学习 / 层次分类研究者:需要一个天然的 super→main→sub 三层评测底座。
  • 基础模型迁移评测者:可配合 Google Derm Foundation 嵌入做线性探针与微调。
  • 失败分析研究者:40 子类真值让"哪种良性被误判为哪种恶性"可追踪。
  • 跨地域泛化研究者:需要非欧洲、欧亚过渡带的皮肤类型样本。

11.3 不适合谁

  • 需要极端类均衡训练集的团队:jd 一类占 42.7%,长尾子类不足 10 张。
  • 需要像素级分割监督的项目:DERM12345 是图像级分类标签,无分割掩码(应看 ph2 等)。
  • 需要黏膜 / 甲 / 炎症性皮肤病覆盖的研究:这些已在排除标准中被剔除。
  • 需要十万级规模的预训练团队:12,345 张属中等体量,应看 ISIC 全档或 BCN20000 等。

11.4 30 秒决策卡

你的情况 行动
要立刻下数据跑通 Dataverse doi:10.7910/DVN/DAXZ7P 下三卷 ZIP + 两 .tab(记得合并两卷 train)
只要标签分布做统计 先下 metadata_train.tab + metadata_test.tab(合计约 1.5 MB)
要接 ISIC 工具链 走 ISIC Archive 镜像(DOI 10.34970/705541,先自行核 DOI)
要基础模型嵌入 Google Derm Foundation 教程 repo + 官方 notebooks
要复现基线 GitHub abdurrahimyilmaz/derm12345 源码
在别的皮肤集出了高分 用 DERM12345 的 40 子类做细粒度压力测试,注意坑 7(dfsp/mpd 泄漏)

FAQ(高频问答 40 问)

A. 基础认知

Q1:DERM12345 是挑战赛吗?
不是。它是土耳其三机构的数据集构建研究,无比赛、无 leaderboard,成果为论文 + 数据集 + 基线代码三件套。

Q2:名字里的"12345"指什么?
图像总数 12,345 张,数字与全名自洽。

Q3:它是 HAM10000 的子集吗?
不是。12,345 张 / 40 子类 vs 10,015 张 / 7 类,无包含关系,是并行独立集合。

Q4:它是 ISIC 的一部分吗?
不是隶属关系。它独立发布于 Harvard Dataverse,后被 ISIC 收录为镜像。

Q5:40 子类是怎么来的?
按细胞来源(黑色素细胞 vs 非黑色素细胞)与恶性程度(良性/不确定/恶性)两个维度,先分 5 个 super classes,再分 15 个 main classes,最后细到 40 个 subclasses。

Q6:为什么说它的粒度是"首次"?
论文宣称 40 子类粒度加分类树的组合在科学文献中属首次——这是对"标签体系结构"的首发主张,不是对数据量或图像质量的主张。

Q7:它的核心卖点是什么?
子类粒度(40),不是总量。12,345 张在公开皮肤镜集里属中等体量。

Q8:作者团队是谁?
4 位作者:Abdurrahim Yilmaz(Imperial College London,通讯)、Sirin Pekcan Yasar(University of Health Sciences)、Gulsum Gencoglan(Istinye University)、Burak Temelkuran(Imperial College London)。

B. 数据与获取

Q9:数据在哪下?
Harvard Dataverse,DOI 10.7910/DVN/DAXZ7P,CC BY 4.0,公开直链。

Q10:有哪些文件?
metadata_train.tab(1.17 MB)、metadata_test.tab(0.29 MB)、test.zip(≈1.27 GB)、train_part_1.zip(≈2.37 GB)、train_part_2.zip(≈2.47 GB)。

Q11:为什么要拆两卷?
平台上传体积限制。必须把两卷 train 合并到同一文件夹才完整。

Q12:只下元数据可以吗?
可以。两份 .tab 共约 1.5 MB,已含全部 11 项字段与 Split 归属。

Q13:有镜像吗?
有,ISIC Archive(DOI 10.34970/705541,待核),提供进阶 UI 与 CLI。

Q14:有代码吗?
有,GitHub abdurrahimyilmaz/derm12345(论文 Code availability 指定)。

Q15:有基础模型配套吗?
有,Google Derm Foundation 教程 repo、官方 notebooks、模型卡均已列出。

Q16:需要申请或签协议吗?
不需要。CC BY 4.0,无请求制、无 gated、无 DUA。

C:数据构成

Q17:图像多少人多少张?
12,345 张图像,来自 1,627 名患者。

Q18:什么时候采集的?
2008-2021,跨 14 年。

Q19:什么设备?
MoleMax 3 / MoleMax HD / FotoFinder 视频皮肤镜 / 3gen DermLite DL4 + iPhone 5/7 + DSLR。

Q20:图像什么格式、多大?
JPEG;放大 10×–140×,手机端最高 3840×2160。

Q21:最大的子类是什么?
jd(dysplastic junctional nevus)5,275 张,占 42.7%。

Q22:最小的子类呢?
dfsp 4 张、isl 6 张、pg 7 张。

Q23:有几个类?
5 super classes → 15 main classes → 40 subclasses。

Q24:元数据有哪些字段?
11 项:Unique Image ID / Patient ID / Image Type / Copyright License / Split / Super Class / Malignancy / Main Class 1 / Main Class 2 / Sub Class / Label。

D:标注与质量

Q25:谁标注的?
两位 20+ 年经验皮肤科专家 GG 与 SPY,共识决策。

Q26:恶性标签可信吗?
可信度高——论文明确"所有恶性病变均活检证实"。

Q27:良性标签怎么确认?
专家共识 + 随访(痣有 >2 年随访无变化者标记为无变化)+ 有病理时用病理。

Q28:重复图像怎么处理?
Python 按文件大小比对发现 280 张重复,人工复核后剔除。

Q29:train/test 怎么分?
9,860 / 2,485(80/20),按患者划分;低样本子类按唯一病灶划分,dfsp 与 mpd 例外。

E:使用与基线

Q30:基线表现如何?
ResNet50 0.50 / Xception 0.59 / InceptionResNetV2 0.58(test 加权准确率),三模型均未过半。

Q31:基线怎么训练的?
Python 3.9.19 + TensorFlow 2.10.1,ImageNet 预训练,50 epochs 无微调 + 200 epochs 微调。

Q32:拿它做什么研究最合适?
层次学习、细粒度分类、失败分析、基础模型嵌入迁移、跨地域泛化。

Q33:它的 5 个 super classes 具体是什么?
Melanocytic Benign(10,043)、Melanocytic Malignant(400)、Nonmelanocytic Benign(1,077)、Nonmelanocytic Indeterminate(58)、Nonmelanocytic Malignant(767)。

Q34:为什么要单设"不确定"层?
因为光化性角化病(ak)介于良性日光损伤与鳞状细胞癌原位之间,恶性归属有临床争议,单设一层以诚实表达这种模糊性(§2.8)。

Q35:一份数据能做几种任务?
四种——40 类细粒度(Sub Class)、5 类超类(Super Class)、恶性二分类(Malignancy)、层次分类(三层依次下探)。

Q36:它的标注路线能被复制吗?
能。§3.6 给出了六阶段 SOP 骨架,核心是"两位专家共识 + 恶性活检证实 + 按患者划分"。

Q37:它和 PANDA-PLUS 的标注模式有何不同?
DERM12345 是两位专家直接共识终结每一张(图像级);PANDA-PLUS 是学生注释 + 专家全量终审(像素级)。前者规模换质量,后者像素换成本。

Q38:如果我只想评估模型细粒度能力,怎么用?
用 test 划分(2,485 张)的 Sub Class 标签,报 macro-F1 与逐类召回,同时注意 dfsp/mpd 的泄漏风险。

Q39:它的许可有什么限制?
CC BY 4.0,几乎无限制——可商用、可再分发,只需署名。这也是它相对库内请求制皮肤条目的最大优势。

Q40:数据集会更新吗?
会。当前 Dataverse 为 v2.1(2025-04-02 更新),使用前建议复查是否已有更新版本。

事实清单(硬事实 40 条)

  1. 全称:DERM12345: A Large, Multisource Dermatoscopic Skin Lesion Dataset with 40 Subclasses。
  2. 图像总数 12,345 张,来自 1,627 名患者。
  3. 采集时段 2008-2021。
  4. 三级分类体系:5 super classes → 15 main classes → 40 subclasses。
  5. 标签体系含 11 项元数据字段。
  6. 来源机构:Celal Bayar University(Manisa)、Istinye University(Istanbul)、University of Health Sciences Haydarpasa Numune(Istanbul)。
  7. 设备:MoleMax 3、MoleMax HD、FotoFinder 视频皮肤镜、3gen DermLite DL4 + iPhone 5/7、DSLR。
  8. 成像:偏振光接触式,10×–140×,JPEG。
  9. 伦理批件:Manisa Celal Bayar University 20.478.486/1023(2021-11-24)。
  10. 5 个 super classes:Melanocytic Benign / Melanocytic Malignant / Nonmelanocytic Benign / Nonmelanocytic Indeterminate / Nonmelanocytic Malignant。
  11. super class 合计:10,043 / 400 / 1,077 / 58 / 767,总和 12,345。
  12. 最大子类 jd 5,275 张(42.7%)。
  13. dysplastic nevus 合计:论文口径 6,136,按表相加 6,137(差 1)。
  14. banal nevus 合计 3,815。
  15. 最小子类:dfsp 4 张、isl 6 张、pg 7 张。
  16. 标注者:Gulsum Gencoglan(GG)与 Sirin Pekcan Yasar(SPY),均 20+ 年经验。
  17. 所有恶性病变均经活检证实。
  18. 诊断确认三来源:专家共识 / 随访 / 组织病理。
  19. 重复图像检测发现 280 张,人工复核后剔除。
  20. 元数据提取工具:Python 3.11.5 + BeautifulSoup 4.12.2。
  21. 划分:train 9,860(80%)/ test 2,485(20%),按患者划分。
  22. dfsp 与 mpd 未按唯一病灶划分(孤例过少)。
  23. 论文:Sci Data 11, 1302 (2024),doi:10.1038/s41597-024-04104-3。
  24. 编辑时间线:Received 2024-06-17 / Accepted 2024-11-08 / Published 2024-11-28。
  25. 索引:PMID 39609462;PMC11604664。
  26. 数据集 DOI:10.7910/DVN/DAXZ7P(Harvard Dataverse)。
  27. Dataverse 版本:v2.1,publicationDate 2024-09-22,releaseTime 2025-04-02T10:46:10Z。
  28. 许可:数据集与论文同为 CC BY 4.0。
  29. 基线模型:ResNet50 / Xception / InceptionResNetV2。
  30. 基线框架:Python 3.9.19 + TensorFlow 2.10.1,ImageNet 预训练。
  31. 基线训练:50 epochs 无微调 + 200 epochs 微调。
  32. 基线 test 加权准确率:ResNet50 0.50 / Xception 0.59 / InceptionResNetV2 0.58。
  33. 代码:GitHub abdurrahimyilmaz/derm12345;Google Derm Foundation 生态三链接。
  34. 关键词:Dermatoscopy / Skin Lesion / Skin Cancer。
  35. 5 个 super classes 计数:Melanocytic Benign 10,043 / Melanocytic Malignant 400 / Nonmelanocytic Benign 1,077 / Nonmelanocytic Indeterminate 58 / Nonmelanocytic Malignant 767。
  36. 缩写规则:dysplastic/banal nevus 用"主类+子类首字母"(如 ajb),其余取首字母(如 bcc)。
  37. 唯一"不确定"子类:ak(光化性角化病)58 张,单设一层。
  38. Dataverse 五文件:metadata_train.tab(1,224,410 B)、metadata_test.tab(306,251 B)、test.zip(1,364,209,784 B)、train_part_1.zip(2,546,603,585 B)、train_part_2.zip(2,651,572,884 B)。
  39. 训练集拆两卷因平台上传体积限制,需合并使用。
  40. 论文 Table 1 对照:ISIC-2016 1,279/2;ISIC-2017 2,000/3;HAM10000 10,015/7;BCN20000 18,946/8;Patient-Centric 33,126/2;PROVe-AI 603/15;ISIC 全档 >1,156,000(截至 2024-11-25)。

术语表(30 条)

  1. 皮肤镜(dermoscopy / dermatoscopy):用放大镜配合偏振光观察皮肤病变表面与真皮浅层结构的无创成像技术。
  2. 皮肤病变(skin lesion):皮肤表面的异常区域,可为良性或恶性。
  3. 黑色素细胞(melanocyte):产生黑色素的皮肤细胞,其良性/恶性增生分别对应痣与黑色素瘤。
  4. 黑色素瘤(melanoma):起源于黑色素细胞的恶性肿瘤,皮肤癌中致死率最高。
  5. 基底细胞癌(BCC):最常见的皮肤恶性肿瘤,局部侵袭为主、转移少见。
  6. 鳞状细胞癌(SCC):第二常见的皮肤恶性肿瘤,有转移潜能。
  7. 良性(benign):非恶性的、不侵袭转移的病变。
  8. 恶性(malignant):具侵袭与转移能力的病变。
  9. dysplastic nevus(发育不良痣):形态学介于普通痣与黑色素瘤之间的痣,是分恶性的难点。
  10. banal nevus(普通痣):常见的良性色素痣。
  11. congenital nevus(先天性痣):出生时或出生后早期出现的痣。
  12. blue nevus(蓝痣):真皮深层黑色素细胞增生产生的蓝色调痣。
  13. recurrent nevus(复发性痣):痣部分切除或外伤后局部再生的色素性病变。
  14. actinic keratosis(光化性角化病):日光损伤相关的癌前病变,本集归入 Nonmelanocytic Indeterminate。
  15. seborrheic keratosis(脂溢性角化病):常见良性表皮增生。
  16. dermatofibroma(皮肤纤维瘤):常见的良性真皮结节。
  17. dermatofibrosarcoma protuberans(DFSP,隆突性皮肤纤维肉瘤):低度恶性真皮肿瘤,本集仅 4 张。
  18. Bowen’s disease(鲍温病):原位鳞状细胞癌。
  19. Kaposi sarcoma(卡波西肉瘤):血管来源恶性肿瘤。
  20. taxonomy tree(分类树):本集的三级层次标签结构。
  21. super class / main class / subclass:分类树的一、二、三级。
  22. 加权准确率(weighted accuracy):按类别样本量加权计算的准确率,受头部类主导。
  23. 细粒度分类(fine-grained classification):类间差异细微的多类分类任务。
  24. 层次学习(hierarchical learning):利用类别层次结构建模的方法。
  25. 数据泄漏(data leakage):训练集与测试集共享信息导致评估虚高。
  26. 按患者划分(patient-wise split):以患者为单位划分数据集,防同一患者跨集。
  27. 唯一病灶(unique lesion):同一病变的图像归为同一组,防跨集。
  28. 类不均衡(class imbalance):各类样本量差异悬殊的分布形态。
  29. 失败分析(failure analysis):细粒度追踪模型误判模式的诊断方法。
  30. 基础模型(foundation model):大规模预训练的通用表征模型,可迁移到下游任务。

附录

附录 A:条目信息速查卡

项 值
条目名 DERM12345
url_name derm12345
类型 皮肤镜图像数据集(+ 基线实验论文)
论文 Sci Data 11, 1302 (2024),doi:10.1038/s41597-024-04104-3
团队 Imperial College London + Celal Bayar University + Istinye University + University of Health Sciences
规模 12,345 张 / 1,627 患者 / 40 子类 / 三级树
许可 CC BY 4.0(数据集与论文一致)
抓取时点 2026-09-30
库内互链 ham10000(60)/isic-archive(56)/bcn20000(161)/derm7pt(110)/ph2(121)/pad-ufes-20(151)/scin(181)/bach(118)/isic-2018(710)/isic-2019(707)/isic-2020(715)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 论文开放获取 + Dataverse DOI + ISIC 镜像 + GitHub 代码,检索 DERM12345 精确短语直达;数字命名便于记忆
A 可获取性 9 数据集与论文同为 CC BY 4.0,无请求制、无 gated、无付费墙,Dataverse 直链即下——同类中的高分配置
I 可互操作 7 JPEG + TSV 通用格式,含完整元数据表;无官方 DICOM/COCO/Parquet 转换脚本,无统一加载器
M 元数据质量 7 11 项字段齐全、Table 2 逐类计数完整且可校验;dysplastic 计数差 1、机构贡献数未披露微降分
S 可持续性 8 Dataverse 与 ISIC 均为机构级长期托管;GitHub 代码为个人托管单点;论文无竞争利益声明
综合评级 8.0/10(优良) 可获取性与可发现性突出,许可干净是其最大优势;互操作与元数据细节为轻微短板

附录 C:逐项证据链自证

关键数字 来源 位置
12,345 张 / 1,627 患者 / 40 子类 论文标题与摘要 Nature Sci Data 论文页
2008-2021 采集时段 论文 Methods 采集节 Nature Sci Data 论文页
伦理批件 20.478.486/1023 论文 Ethics 声明 Nature Sci Data 论文页
40 子类逐类计数(Table 2) 论文 Table 2 Nature Sci Data 论文页
10,043+400+1,077+58+767=12,345 按 Table 2 相加校验 本条目核算
dysplastic nevus N: 6,136 论文结果正文 Nature Sci Data 论文页
所有恶性病变均活检证实 论文 Methods 入选标准 Nature Sci Data 论文页
280 张重复图 论文 Methods 去重 Nature Sci Data 论文页
train 9,860 / test 2,485 论文划分描述 Nature Sci Data 论文页
ResNet50 0.50 / Xception 0.59 / InceptionResNetV2 0.58 论文 Technical Validation Nature Sci Data 论文页
Received/Accepted/Published 三日期 论文页脚 Nature Sci Data 论文页
PMID 39609462 / PMC11604664 NLM/PMC 记录 PubMed 页
v2.1 / publicationDate 2024-09-22 / releaseTime 2025-04-02 Dataverse API 实测 dataverse.harvard.edu API
五文件体积清单 Dataverse API 实测 dataverse.harvard.edu API
CC BY 4.0 Dataverse license 字段 dataverse.harvard.edu API

附录 D:数据获取决策树

需求是什么?
├── 只要标签分布统计
│   └── 下 metadata_train.tab + metadata_test.tab(≈1.5 MB,Dataverse)
├── 要完整图像训练
│   ├── 1) 下 test.zip + train_part_1.zip + train_part_2.zip
│   ├── 2) 合并两卷 train 到同一文件夹(坑 3)
│   └── 3) 按 Split 字段切分
├── 要走 ISIC 工具链
│   └── ISIC Archive DOI 10.34970/705541(先自行核 DOI,坑 5)
├── 要基础模型嵌入
│   └── Google Derm Foundation 教程 repo + 官方 notebooks + 模型卡
├── 要复现基线
│   └── GitHub abdurrahimyilmaz/derm12345
└── 要对比粗类数据集
    └── 并行取 ham10000(60) / bcn20000(161)

附录 E:40 子类全表(按 super class 归并)

super class 子类(缩写:图像数) 合计
Melanocytic Benign acb 37, ccb 418, mcb 123, cb 722, bdb 163, db 560, ajb 426, cjb 143, jb 1223, acd 9, ccd 32, cd 498, ajd 288, srjd 19, jd 5275, rd 16, isl 6, ls 25, sl 60 10,043
Melanocytic Malignant alm 60, anm 76, lm 86, lmm 25, mel 153 400
Nonmelanocytic Benign sk 607, lk 8, df 180, angk 39, ha 166, la 56, pg 7, sa 14 1,077
Nonmelanocytic Indeterminate ak 58 58
Nonmelanocytic Malignant bcc 423, bd 37, ch 12, mpd 9, scc 266, dfsp 4, ks 16 767
总计 12,345

附录 F:常用子类缩写速查

缩写 全称
bcc Basal Cell Carcinoma
scc Squamous Cell Carcinoma
bd Bowen’s Disease
ak Actinic Keratosis
sk Seborrheic Keratosis
df Dermatofibroma
dfsp Dermatofibrosarcoma Protuberans
ks Kaposi Sarcoma
mel Melanoma
alm Acral Lentiginous Melanoma
lmm Lentigo Maligna Melanoma
jd Dysplastic Junctional Nevus
ajd Acral Dysplastic Junctional Nevus
cd Dysplastic Compound Nevus
jb Banal Junctional Nevus
cb Banal Compound Nevus
db Banal Dermal Nevus

附录 G:许可条款细读

资产 许可 要点
数据集(Harvard Dataverse) CC BY 4.0 可自由共享与改编,须署名;商业使用许可
论文(Sci Data) CC BY 4.0 开放获取,APC 由 Imperial College London Open Access Fund 支付
ISIC 镜像 随 ISIC 条目 通过 ISIC 访问时按其条目口径
GitHub 代码 见 repo 需查看 repo 内 LICENSE 文件

两件核心资产(数据集与论文)许可一致为 CC BY 4.0,无冲突——这是本条目在许可维度上最省心的一点。

附录 H:双口径登记表

事项 口径 A 口径 B 处置
论文日期 vs 数据上线 论文 Published 2024-11-28 Dataverse publicationDate 2024-09-22 两套并存,数据先论文约 2 个月
Dataverse 版本 首发 2024-09-22 v2.1 releaseTime 2025-04-02 以 v2.1 文件清单为准
dysplastic nevus 计数 论文正文 6,136 按 Table 2 相加 6,137 正文引论文口径,注差 1
基线微调口径 50 epochs 无微调 200 epochs 微调 报告值为最终模型,未分阶段

附录 I:类别不均衡的处理建议

针对 jd 占 42.7%、长尾不足 10 张的分布,可考虑:

  1. 层次分类:先分 super class(5 类,相对均衡),再逐层下探,缓解单层多类失衡。
  2. 重采样:对长尾子类过采样或头部子类欠采样(注意别把 dfsp/mpd 的 4/9 张复制到失真)。
  3. 类权重损失:用加权交叉熵补偿头部主导。
  4. 合并低样本子类:把 <10 张的子类合并到父类评估,或只在上层类报告指标。
  5. 报告分层指标:除整体加权准确率外,报 macro-F1 与逐类召回,暴露长尾表现。

附录 J:使用本数据集的检查清单(10 项)

  1. 是否下载并合并了两卷 train(坑 3)。
  2. 是否按 Split 字段而非自行随机划分。
  3. 是否知晓 dfsp/mpd 未按病灶划分的泄漏风险(坑 7)。
  4. 是否处理了 jd 主导的类不均衡。
  5. 是否区分了论文口径与表格口径的 dysplastic 计数(坑 4)。
  6. 是否按 CC BY 4.0 正确署名。
  7. 是否用加权准确率之外的分层指标(macro-F1 / 逐类召回)。
  8. 是否核对过 ISIC 镜像 DOI(坑 5)。
  9. 是否在报告中说明是图像级分类而非像素级分割。
  10. 是否核对了 Dataverse 是否已有更新版本(当前 v2.1)。

附录 K:与库内皮肤条目的关系声明

本条目(derm12345)与库内 ham10000(60)、isic-archive(56)、bcn20000(161)、derm7pt(110)、ph2(121)、pad-ufes-20(151)、scin(181)、bach(118)、isic-2018(710)、isic-2019(707)、isic-2020(715) 均为独立数据集,无包含、别名、版本后继或合并视图关系。DERM12345 的差异化在于 40 子类三级树标签体系与土耳其地域来源。slug 查重确认 derm12345 未被占用。

附录 L:引文规范

@article{yilmaz2024derm12345,
  title   = {DERM12345: A Large, Multisource Dermatoscopic Skin Lesion Dataset with 40 Subclasses},
  author  = {Yilmaz, Abdurrahim and Yasar, Sirin Pekcan and Gencoglan, Gulsum and Temelkuran, Burak},
  journal = {Scientific Data},
  volume  = {11},
  pages   = {1302},
  year    = {2024},
  doi     = {10.1038/s41597-024-04104-3}
}

数据集引用:

Yilmaz, A., Yasar, S. P., Gencoglan, G., & Temelkuran, B. (2024).
DERM12345: A Large, Multisource Dermatoscopic Skin Lesion Dataset with 40 Subclasses
[Data set]. Harvard Dataverse. https://doi.org/10.7910/DVN/DAXZ7P

附录 M:双口径与待核登记

事项 状态
dysplastic nevus 6,136 vs 6,137 正文引 6,136,注差 1
ISIC DOI 10.34970/705541 待核(API 超时未实抓)
机构贡献数 论文未披露,待核
Dataverse 后续版本 当前 v2.1,使用前复查

附录 N:本条目生产档案

项 值
代理 agent-b-derm12345
正选 slug derm12345
源文件 writing/derm12345/FACTS.md + 本成稿
三源互证 Nature Sci Data 论文 HTML 实抓 + Harvard Dataverse API 实抓 + ISIC/NLM/OpenAIRE 佐证
查重 url_name ILIKE '%derm12345%' = 0 行
抓取时点 2026-09-30
锁 writing/derm12345/.lock = agent-b-derm12345 2026-09-30T19:55

附录 O:FAIR / AI-Ready 检查单

原则 满足情况
Findable 满足——论文 + Dataverse + ISIC 三重 DOI,精确名可检索
Accessible 满足——CC BY 4.0 直链,无认证门槛
Interoperable 部分——通用格式但无标准转换脚本
Reusable 满足——CC BY 4.0 + 完整元数据 + 清晰标签体系
AI-Ready 满足——图像级多类标签可直接用于监督训练;需自行处理不均衡

附录 P:缩写速查

缩写 含义
Sci Data Scientific Data(Nature Portfolio 期刊)
CC BY 4.0 Creative Commons Attribution 4.0 International
DOI Digital Object Identifier
APC Article Processing Charge
CNN Convolutional Neural Network
PMID / PMC PubMed ID / PubMed Central
DFSP Dermatofibrosarcoma Protuberans
BCC / SCC Basal / Squamous Cell Carcinoma
ISIC International Skin Imaging Collaboration

附录 Q:三源互证记录

源 类型 抓取方式 提取内容
Nature Sci Data 论文页 一手论文 curl 带 User-Agent 实抓 HTML(374,721 B) 摘要、正文、日期、作者、基线结果、采集与标注方法、Table 1/2 数字
Harvard Dataverse API 一手数据仓 curl Accept: application/json 实抓(14,241 B) 版本、publicationDate、releaseTime、license、5 文件清单、taxonomy tree、关键词
ISIC Archive / NLM / OpenAIRE / ResearchGate 佐证 检索与页面访问 DOI 10.34970/705541(待核)、PMID 39609462、PMC11604664、领域背景

环境注记:Nature 与 PMC 均有反爬机制,WebFetch 直取返回验证页,改用 curl 带浏览器 User-Agent 头解决;Dataverse 页面 WebFetch 返回 202 空响应,改用 API endpoint 解决。此两点供后续写手复用。

附录 R:数据字段字典

字段 类型 说明 示例
Unique Image ID 字符串 图像唯一标识 —
Patient ID 字符串 患者标识,划分依据 —
Image Type 字符串 成像类型 dermoscopy
Copyright License 字符串 许可 CC BY 4.0
Split 枚举 划分 train / test
Super Class 枚举 一级类(5 类) Melanocytic Benign
Malignancy 布尔/枚举 恶性标志 benign / malignant
Main Class 1 枚举 二级类(主) Dysplastic Junctional Nevus
Main Class 2 枚举 二级类(副) —
Sub Class 枚举 三级类(40 类) jd
Label 字符串 最终标签 —

附录 S:与库内各集的差异对照表

条目 图像数 类别数 分类结构 地域 与 DERM12345 的关系
derm12345(本条) 12,345 40 三级树 土耳其 自身
ham10000(60) 10,015 7 平铺 欧洲 粗类对照
bcn20000(161) 18,946 8 平铺 西班牙 粗类大集对照
isic-archive(56) >1,156,000(全档) 多变 多变 全球 镜像收录方
derm7pt(110) — 7 点 双模态 — 独立
ph2(121) — — 分割 — 独立
pad-ufes-20(151) — — 部位研究 — 独立
scin(181) — — 含肤色 — 独立
isic-2018/19/20(710/707/715) 各自 各自 挑战赛 全球 独立(非同源)

附录 T:细粒度分类的建模建议

针对 40 子类三级树,可按以下思路建模:

方案一:扁平 40 类
  - 直接对 40 子类做多类分类
  - 优点:实现最简单
  - 缺点:长尾子类样本不足,头部主导

方案二:层次分类(hierarchical)
  - 第一级:预测 5 super classes
  - 第二级:在预测的 super class 内预测 main class
  - 第三级:在预测的 main class 内预测 subclass
  - 优点:缓解单层失衡,利用树结构
  - 缺点:误差逐层累积

方案三:多任务联合
  - 同时输出 super / main / sub 三层预测,联合损失
  - 优点:层级信息互为正则
  - 缺点:需调损失权重

方案四:迁移嵌入
  - 先用基础模型(如 Google Derm Foundation)提取嵌入
  - 再在 DERM12345 上做线性探针或微调
  - 优点:小样本子类也能受益于通用表征

论文的基线(ResNet50 0.50 / Xception 0.59 / InceptionResNetV2 0.58)走的是方案一(扁平 40 类),其准确率未过半正说明扁平法在长尾与细粒度上力不从心——这正是论文呼吁"层次学习"的动机。

附录 U:维护计划与触发点

触发条件 处置
Harvard Dataverse 发布新版本(>v2.1) 复核文件清单与 publicationDate,更新 §6.2 与附录 H
ISIC DOI 10.34970/705541 核实 回填 §7.2 与 §9,移除待核标记
论文补充基线分阶段结果 更新 §5.3 口径注记
机构贡献数公开 更新 §2.1 机构偏斜评估
出现 DERM12345 派生基准/挑战赛 新增 §7 小节并评估互链

附录 V:本条目与库内生产纪律的对应

纪律项 执行情况
开工三查 ①.lock = agent-b-derm12345 2026-09-30T19:55;②part 写入 .parts_agent-b-derm12345/ 私有区;③ps 计数 = 5
存在性核验 三源互证(论文实抓 + Dataverse API 实抓 + ISIC/NLM 佐证)
查重 url_name ILIKE '%derm12345%' = 0 行,不撞库
FACTS.md 九节 已产出,101 行
成稿 5 part 已产出,cat 拼接
双零自检 check_md.py PASS + preflight_check.py 0 ERROR/0 WARN

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(Sci Data 2024;11:1302,doi:10.1038/s41597-024-04104-3)、Harvard Dataverse API 实测(doi:10.7910/DVN/DAXZ7P)与 ISIC Archive / NLM 佐证为源;dysplastic nevus 计数双口径(6,136 vs 6,137)、Dataverse 版本迭代(v2.1)、机构贡献数未披露、ISIC 镜像 DOI 待核等原始文档局限已在坑点与附录 M 存照。条目与库内 ham10000(60)、isic-archive(56)、bcn20000(161)、derm7pt(110)、ph2(121)、pad-ufes-20(151)、scin(181)、bach(118)、isic-2018(710)、isic-2019(707)、isic-2020(715) 互链,构成皮肤影像家族从粗类到细粒度的完整检索面。后续维护触发点:Dataverse 新版本发布、ISIC DOI 核实、论文补充基线分阶段结果。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • skincon — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • ham10000 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 肿瘤学
  • ph2 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
  • ddi — 共享标签:医学影像 / 皮肤影像 / 评测基准 / 皮肤癌
  • dermacon-in — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • slice-3d — 共享标签:医学影像 / 皮肤影像 / 肿瘤学
  • oasbud — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集