ISIC 2018 Challenge (isic-2018) — AI-Ready Wikipedia

ISIC 第 3 届皮肤病变分析挑战赛:三任务(边界分割/属性检测/疾病分类)共 12,500+ 图,分类任务训练集即 HAM10000 全集 10,015 张;冠军 balanced accuracy 0.885,Lancet Oncology 读片研究证实 139 个算法整体超越 511 名人类读者

来源 ISIC 2018 官方发布的三任务数据包:Task1/2 训练 2,594 图 + 12,970 分割掩码/属性掩码 + 验证 100 + 测试 1,000(CC-0);Task3 训练 10,015 图(= HAM10000)+ 7 类 GT CSV + 测试 1,512 + validation;图像来自 HAM10000(维也纳 ViDIR + 昆士兰 Rosendahl)与 MSK发布时间: 2026-09-28最后更新: 2026-09-28 阅读 20
ISIC 2018 Challenge (isic-2018) — AI-Ready Wikipedia

信息速览

数据集名称ISIC 2018 Challenge (isic-2018) — AI-Ready Wikipedia
数据类型影像数据,人工标注,竞赛数据
规模Task 3 训练集 10,015 张(= HAM10000 全集,含多图同病灶,用 lesion_id 追踪);精确患者数论文未单列(遗留疑点)
接入方式ISIC 2018 官方发布的三任务数据包:Task1/2 训练 2,594 图 + 12,970 分割掩码/属性掩码 + 验证 100 + 测试 1,000(CC-0);Task3 训练 10,015 图(= HAM10000)+ 7 类 GT CSV + 测试 1,512 + validation;图像来自 HAM10000(维也纳 ViDIR + 昆士兰 Rosendahl)与 MSK
AI 就绪度

INFOBOX — ISIC 2018 Challenge 一屏速览

维度 内容
本质 ISIC 主办的第 3 届皮肤镜病变分析挑战赛(序列 2016/2017/2018/2019/2020/2024);本条目是挑战赛条目,不是独立新图像数据集
主办 International Skin Imaging Collaboration (ISIC) @ MICCAI 2018(Granada, Spain)
三任务 Task 1 病变边界分割 / Task 2 属性检测 / Task 3 疾病分类
时间线 参赛截止 2018-07-27;颁奖 2018-09-20 MICCAI Workshop;总结论文 arXiv:1902.03368(2019-02-09)
训练规模 Task1/2 2,594 图 + 12,970 掩码;Task3 10,015 图(= HAM10000 全集)
类别 7 类:MEL/NV/BCC/AKIEC/BKL/DF/VASC
主指标 Task1 thresholded Jaccard(0.65 阈值);Task2 Jaccard;Task3 balanced accuracy
冠军分 Task1 0.802 / Task2 0.473 / Task3 0.885
参与 900 注册下载;提交 115/25/159(三任务)
许可 Task1/2 CC-0|Task3 CC-BY-NC(署名 HAM10000 + MSK 两源)
经典结论 top 分割算法仍在 >10% 图上失败;Lancet Oncology 读片研究:139 算法整体胜过 511 名人类读者
库内互链 ham10000(rid 60)、isic-2019(rid 707)、isic-archive(rid 56)——数据本体细节以这几条为准

ISIC 2018 是皮肤影像领域迄今规模最大的一届公开挑战赛。它把"皮肤镜下的一枚病变"拆成三个可评测的机器学习任务——描出边界、认出皮肤镜属性、判出疾病类别——并在 MICCAI 2018 的舞台上,用一份源于 HAM10000 的 10,015 张数据把全球算法拉到同一把尺子下比较。它的重要性不止于排行榜:赛后以同一批测试图做的 Lancet Oncology 读片研究首次在大规模国际对照中显示,表现最好的算法在 7 类特异性诊断上显著优于人类专家——AI 辅助皮肤诊断由此从"实验室比拼"进入"临床能力论证"阶段。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——Task 1/2 是 CC-0,Task 3 是 CC-BY-NC,两套数据许可不同,别一律当 CC-0 用。
  2. 担心撞库重复:直奔 §5 分工声明——Task 3 训练集 100% 就是库内 ham10000(rid 60),本条目按"独立挑战赛条目"成稿的理由与边界都写在那里。
  3. 做分类模型对标:直奔 §7 评估与基准——balanced accuracy 口径、冠军 0.885、以及最易混淆的"文献自切分高分 vs 官方测试集分数"陷阱都列齐了。

读者画像与推荐路径:

你是谁 推荐读法 预计关注点
数据工程师 §2 → §6 数据规格、下载、许可
算法研究者 §3 → §7 任务定义、指标、基准分
临床/转化研究者 §7.4 → §8 人机对比、临床意义、局限
数据治理/合规 §6 → 附录 P 许可分层、署名义务
综述作者 全文 + 事实清单 硬数字、来源、口径存照

§0 导读:这个挑战赛解决什么问题

皮肤癌是全球增长最快的癌症之一,而皮肤镜(dermoscopy)作为无创放大成像技术,能把黑色素瘤的诊断准确率显著抬高——但它高度依赖医生的训练与经验,专家稀缺又恰是现实瓶颈。要让机器接手,先得有三样东西:足够大且有可靠标签的图像、清晰可评的任务定义、以及让所有参赛者公平可比的比赛机制。ISIC 2018 正是围绕这三点组织的。

三个任务的划分本身就是一种诊断拆解。Task 1(边界分割) 回答"病变在哪里":给一张皮肤镜图,输出病变的像素级轮廓——这是后续一切定量分析(面积、对称性、边界不规则度)的前置。Task 2(属性检测) 回答"病变长什么样":识别 pigment network、streaks、globules 等皮肤镜学术语中的视觉模式,把医生的"读图语言"转化为可定位的像素标注。Task 3(疾病分类) 回答"这是什么病":把病变判入 7 个疾病类别之一。三者共用同一批图像的视觉多样性,却各自面对不同的标注难点。

这届挑战赛的三条遗产值得单独记住。其一,它把 HAM10000 推成了皮肤影像领域的"ImageNet"——一个 10,015 张、7 类、多源采集的公开训练集,此后数年几乎所有皮肤病变分类论文都在它上面跑分数。其二,它确立了两个至今仍被沿用的评估设计:分割任务用 thresholded Jaccard(把"失败图像"也计入惩罚,而非只看平均重叠度),分类任务用 balanced accuracy(对抗 58:1 的类别失衡)。其三,也是最出圈的一条:赛后发表的 Lancet Oncology 人机对比研究,用同一批 1,511 张测试图让 139 个算法与 511 名人类读者正面较量,结论是算法整体更准,但在训练分布之外的图像上双方都会退步——这为"AI 能不能进临床"提供了一个可复用的评测范式。

§0 读法三则:

  1. 这个条目分三层读:赛事层(任务定义/时间线/排行榜,§1–§4)是主内容;数据层(图像本体规格)摘要足以,细节以库内 ham10000(rid 60) 为准;影响层(读片研究/基准演化)在 §7–§8。
  2. 全文硬数字均出自官方 challenge 页、arXiv:1902.03368 摘要与 ISIC Archive 集合页;凡两口径不一致处(12,500 图合计口径、测试集 1,512 vs 1,511)已在坑 4/坑 10 与附录 D 逐条存照。
  3. 检索时最容易犯的错,是把 ISIC 2018 当成"另一个 HAM10000 下载包"去重复收录——Task 3 训练集就是 HAM10000 全集,一条不缺(§5 分工声明)。

0.1 为什么这届挑战赛值得单独成条

皮肤影像领域此前并非没有数据集:PH2 只有 200 张,Interactive Atlas of Dermoscopy 约 1,000 张且获取受限,ISIC 2017 虽有 2,000 训练图但只覆盖 3 类。制约神经网络训练的从来不是算法,而是"足够大且标签可靠"的图像。ISIC 2018 的破局点在于它把 HAM10000 的 10,015 张(7 类、病理确诊率 53.3%、多源采集)导入分类任务,同时用一套新的评测协议把全球算法拉到同一起跑线。

这个组合产生了三重效应,也是本条目分三块讲述的根据:

  • 数据效应:HAM10000 从此成为皮肤影像分类的公共训练基准,被后续无数论文引用与复现;
  • 方法论效应:thresholded Jaccard 与 balanced accuracy 两个指标,一个解决"分割失败率被平均分掩盖",一个解决"类别失衡下高分虚高",此后被广泛借用;
  • 临床效应:赛后以同一批测试图做的人机对比研究,首次在大规模国际对照中给出"算法整体优于人类专家"的量化结论,成为 AI 进临床讨论的核心证据。

0.2 本条目与库内三条的阅读顺序建议

若你从"皮肤影像 AI"这个入口进来,建议的阅读顺序是:先读 ham10000(rid 60) 建立数据本体的认知(图像怎么来、标签怎么定),再读本条目理解这批数据如何被组织成赛事与基准,最后读 isic-2019(rid 707) 看下一届如何把规模翻倍并引入更难的 OOD 设定。isic-archive(rid 56) 则作为贯穿始终的"库"背景——它既是数据的长期托管方,也是 API 入口。这个顺序能避免"先看到赛事以为图像是赛事新采集的"这一常见误判。

§1 挑战赛速览:十问十答

Q1:ISIC 2018 到底是什么?
是由 ISIC(International Skin Imaging Collaboration,国际皮肤影像协作组织)主办、在 MICCAI 2018(西班牙 Granada)举办的皮肤镜图像分析挑战赛。它分三个独立任务:病变边界分割、病变属性检测、疾病分类。参赛者可任选或全选。

Q2:它是"数据集"还是"比赛"?
两者都是,但本体是比赛。赛事于 2018 年举行,围绕官方发布的三任务数据包展开;赛后的数据包与排行榜成为长期公共基准。本条目按"挑战赛条目"收录:任务定义、时间线、冠军与基准演化是主内容。

Q3:三个任务各用什么数据?
Task 1 与 Task 2 共用一套图集:训练 2,594 图(Task 1 配 12,970 张分割掩码,平均 5 张/图;Task 2 配 5 个属性的掩码)、验证 100 图、测试 1,000 图。Task 3 用另一套更大的图集:训练 10,015 图(即 HAM10000 全集)、测试 1,512 图。两套图集不是同一批,不能混用。

Q4:Task 3 训练的 10,015 张从哪来?
来自 HAM10000(Human Against Machine with 10000 training images),由维也纳医科大学 ViDIR 组与澳大利亚昆士兰大学的 Cliff Rosendahl 皮肤癌诊所联合采集。ISIC 2018 是 HAM10000 的来源挑战赛——这也是本条目与库内 ham10000(rid 60) 关系的核心。

Q5:有哪些疾病类别?
7 类:黑色素瘤(MEL)、黑色素细胞痣(NV)、基底细胞癌(BCC)、光化性角化病/Bowen 病(AKIEC)、良性角化病样病变(BKL)、皮肤纤维瘤(DF)、血管性病变(VASC)。类别极不均衡:NV 占 66.9%,DF 仅 1.1%。

Q6:评分怎么算?
Task 1 用 thresholded Jaccard:逐图算 Jaccard,小于 0.65 记 0 分、否则记原值,再取均值——0.65 这个阈值由 3 位专家在 100 张图上测出的最低专家间一致度(约 0.74)加误差容限导出。Task 2 用全数据集像素级 Jaccard。Task 3 用 balanced multi-class accuracy,平局以 AUC 打破。

Q7:谁拿了冠军,分数多少?
Task 1 冠军方案 MaskRcnn2+segmentation 得 0.802(thresholded Jaccard);Task 2 冠军得 0.473(Jaccard);Task 3 冠军得 0.885(balanced accuracy)。

Q8:参赛规模多大?
900 名用户注册下载数据;115 份提交投向分割任务,25 份投向属性检测,159 份投向疾病分类。Task 1 排行榜去重后 66 支团队/行。

Q9:许可怎么算?
分层:Task 1/2 数据包是 CC-0(公共领域);Task 3 数据包是 CC-BY-NC,署名须分别注明 HAM10000(维也纳 ViDIR)与 MSK 两个来源。

Q10:为什么它被反复引用?
除了作为最大规模皮肤影像赛事,两个后续成果放大了它的影响:Lancet Oncology 2019 的人机对比读片研究(用同一批测试图证明算法整体超越人类),以及 HAM10000 成为此后分类研究的公共训练基准。

1.1 七类疾病临床速览

Task 3 的 7 类诊断覆盖了色素性皮肤病变的主要谱系,理解它们的临床关系有助于读懂类别分布为何如此失衡:

类别 全称 良恶性 临床要点 样本数
NV 黑色素细胞痣(nevus) 良性 最常见的良性色素性病变 6,705
MEL 黑色素瘤(melanoma) 恶性 最致命的皮肤癌,早期诊断关键 1,113
BKL 良性角化病样病变 良性 含脂溢性角化、日光性黑子等 1,099
BCC 基底细胞癌 恶性 最常见的皮肤癌,生长缓慢 514
AKIEC 光化性角化病/Bowen 病 癌前/原位癌 鳞状细胞癌谱系 327
VASC 血管性病变 良性 血管瘤、血管角化瘤等 142
DF 皮肤纤维瘤 良性 常见于小腿的良性结节 115

读表要点:7 类中有 3 类属恶性或癌前(MEL、BCC、AKIEC),累计 1,954 张,占 19.5%。这个比例远高于真实临床(真实场景恶性占比更低),正是官方所说的"修正过的真实世界"——恶性被有意过度代表,以保证模型有足够样本学习恶性特征。这也解释了为什么不能用普通 accuracy:若能靠预测多数类(NV 良性)就拿 66.9% 准确率,评估意义有限。

1.2 三个任务的难度梯度

从冠军分数可以看出清晰的任务难度排序:分类(0.885)> 分割(0.802)> 属性检测(0.473)。这个梯度值得细读:

  • 分类相对容易:类别语义明确、真值可靠(多数有病理确认),深度网络在充足数据下能达到接近饱和的表现。
  • 分割中等:边界定义存在一定模糊(尤其是病变与周围皮肤的过渡带),但 thresholded Jaccard 的 0.65 阈值把难图直接判零,反而让得分集中于"能分割好的图"。
  • 属性检测最难:真值本身带专家分歧噪声,模型上限被压制在 0.5 以下。

这条梯度传递一个方法论启示:任务分数高低不只反映算法能力,更反映任务定义与真值的质量。属性检测的低分不是"算法不行",而是"这个问题本身还没被定义清楚"。

1.3 一图读懂数据流

原始采集(两家机构,历史筛查人群)
   │
   ├──► HAM10000(10,015 张,7 类,科学数据论文 2018-08)
   │        │
   │        ├──► ISIC 2018 Task 3 训练集(10,015,CC-BY-NC)──► 分类赛道
   │        │
   │        └──► ISIC 2019 训练集的一部分(三源聚合之一)
   │
   └──► MSK 数据集(SK 系)
            │
            └──► ISIC 2018 Task 1/2 训练集(2,594 + 掩码,CC-0)──► 分割/属性赛道

读图要点:HAM10000 是分流的核心节点——它既是 2018 届 Task 3 的全量训练集,又是 2019 届的三源之一。Task 1/2 的 2,594 图则来自 HAM10000 与 MSK 的交集采样并加了像素级标注,是 2018 届独有的增量数据。

1.4 关于"最大"的边界说明

官方称"全球最大皮肤图像分析挑战赛",这个"最大"指赛事规模(参与人数、提交数、数据量),而非单指某一项。若按单任务数据量,ISIC 2019(25,331)与 ISIC 2020(33,126)后来居上;若按任务丰富度,ISIC 2018 的三任务设计至今少见。引用时宜明确"最大"所指维度。

§2 数据构成与规格

2.1 三个任务的数据包结构

ISIC 2018 的官方数据组织方式有一个容易踩的结构性事实:三个任务并不共用一份数据。Task 1 与 Task 2 共享一套较小但带像素级掩码的图集,Task 3 则单独使用更大的分类图集。理解这条边界是正确使用这批数据的前提。

任务 训练图 训练 GT 验证 测试 测试 GT 许可
Task 1 病变边界分割 2,594 12,970 张分割掩码(5/图) 100 1,000 掩码(内部评分) CC-0
Task 2 属性检测 2,594 5 类属性掩码 100 1,000 掩码(内部评分) CC-0
Task 3 疾病分类 10,015 1 份 7 类 GT CSV 官方 validation(1,512) 1,512 CSV 标签 CC-BY-NC

官方数据集页给出的文件体量可佐证规模差异:Task 1 训练图像 10.4GB、分割掩码 26MB、验证图 228MB、测试图 2.2GB;Task 3 训练图像 2.6GB、GT CSV 481KB、测试图 401MB。Task 1 掩码文件大(12,970 张逐图 PNG),Task 3 图更多但因分辨率统一裁剪而总量更小。

2.2 图像规格与命名

所有输入为 JPEG 格式皮肤镜图像,命名规则统一为 ISIC_<image_id>.jpg,其中 <image_id> 是 7 位唯一标识符。官方明确说明:图像的 EXIF 标签已被移除,任何残留标签都不应被依赖为准确元数据。Task 3 图像分辨率统一为 600×450 像素(部分文献写作 450×600,系书写方向差异);Task 1/2 图像分辨率范围更宽。

图像采集背景是"覆盖全解剖部位(排除黏膜与指甲)、由多家机构、对历史皮肤癌筛查人群采样"的集合。官方特别提示其分布特征:疾病状态分布呈"修正过的真实世界"形态——良性病变多于恶性,但恶性被过度代表。这句话是理解类别失衡的关键:真实临床上良性病变占比会更高,因此这批数据对恶性病类的相对权重是被抬高的。

2.3 掩码规格(Task 1/2)

分割与属性任务的输出与真值都是二值 PNG 掩码:

  • 分割掩码:命名 ISIC_<image_id>_segmentation.png,单通道 8-bit 灰度图,像素取值 0(背景/病变外)或 255(前景/病变内)。因原发病变是单一连通区域,掩码也应只含单一连通前景、无游离组件或空洞。前景可任意大小,甚至铺满全图或贴边。
  • 属性掩码:命名 ISIC_<image_id>_attribute_<attribute_name>.png,同样为单通道 8-bit 二值 PNG(0 表示该属性不存在、255 表示存在)。与分割掩码不同,属性的区域不必连通——例如散在的球状体可以在图内多处出现。

2.4 类别体系与失衡

Task 3 的 7 类诊断来自 HAM10000 的标签体系,分布如下:

类别 代码 图像数 占比
黑色素细胞痣 nv 6,705 66.9%
黑色素瘤 mel 1,113 11.1%
良性角化病样病变 bkl 1,099 11.0%
基底细胞癌 bcc 514 5.1%
光化性角化病/Bowen 病 akiec 327 3.3%
血管性病变 vasc 142 1.4%
皮肤纤维瘤 df 115 1.1%
合计 10,015 100%

最大类 nv(6,705)与最小类 df(115)相差约 58 倍。这一失衡不是缺陷而是设计:官方选择 balanced accuracy 作主指标,正是为了抵消类别占比对分数的影响,避免"全猜成痣"也能拿高准确率的退化解。

2.5 真值确立方式

Task 3 的诊断真值来源分层(引自 HAM10000 论文):组织病理确认、反射共聚焦显微镜(reflectance confocal microscopy)确认、两年以上数字皮肤镜随访无变化(且至少 3 张图)、或 ≥3 位专家单图共识。关键保证是:所有恶性病变的诊断均经组织病理确认。整体上超过 50% 的病灶有病理确认(论文口径 53.3%)。

Task 1 的掩码真值同样强调专家环节:所有数据都由具备皮肤镜专长的执业皮肤科医生审核与整编,生成方式分三类——全自动算法+专家复核接受、半自动洪泛填充+专家调参、专家手工多边形勾画。Task 2 的属性真值则由皮肤科研究员在公认皮肤镜专家督导下,通过选取 SLIC 超像素(一种图像超像素分割方法)逐属性手工标注。

2.6 与 HAM10000 本体的关系边界

必须把话说透:Task 3 的训练集就是 HAM10000 全部 10,015 张图像,一张不多、一张不少。本条目不会复述 HAM10000 的采集工艺、清洗流程与多源整合细节——那些内容属于数据本体,以库内 ham10000(rid 60) 条目为准。本条目承担的是"赛事视角":这批数据如何被组织成三任务、如何评分、产生了怎样的基准与影响。同样的分工也适用于与 isic-2019(rid 707) 的关系(见 §5 与附录 A)。

2.7 元数据与可用字段

ISIC 2018 随数据发布的元数据结构如下(Task 3 口径):

字段 类型 含义 备注
image 字符串 ISIC_xxxxxxx(7 位 ID) 跨包稳定主键,去重与映射用
lesion_id 字符串 病灶级标识 同一病灶多张图共享,用于避免训练/测试集同病灶泄漏
dx 字符串 诊断类别 7 类之一(HAM10000 口径)
dx_type 字符串 确诊方式 histo / follow_up / consensus / confocal
age 数值 患者年龄 部分缺失
sex 字符串 性别 male / female / unknown
localization 字符串 解剖部位 如 back、lower extremity 等

lesion_id 字段的重要性被低估:HAM10000 含同一病灶的多张图像(随访或不同放大),若按图像随机切分训练/测试,同一病灶可能同时出现在两侧,造成测试分数虚高。官方挑战赛的测试集划分已规避此问题,但研究者自行切分时若忽略 lesion_id,就会产生数据泄漏——这是使用这批数据做自我评估时最常见的技术陷阱,值得单独警惕。

2.8 标注质量问题的一个具体例子

Task 2 属性检测的低分(冠军仅 0.473)不是孤例,它折射出一个更普遍的问题:皮肤镜属性的临床定义本身就存在专家分歧。官方论文在解释这一现象时指出,属性的专家间可靠性差(poor inter-observer reliability) 是主因,并给出两条出路——要么为皮肤镜特征建立更稳健的临床定义,要么用机器学习反过来精炼这些定义。这种"真值本身带噪声"的情况使得 Task 2 成为研究标签噪声对模型上限影响的绝佳案例:当不同专家对同一区域标注都不一致时,任何模型的 Jaccard 天花板都被压低了。

2.9 数据来源与伦理合规

ISIC 2018 的数据来源可追溯到两个伦理审批的采集项目:

  • University of Queensland(澳大利亚):Protocol-No. 2017001223。图像来自 Cliff Rosendahl 的皮肤癌诊所数据库,用于 HAM10000 的 Rosendahl 部分。
  • Medical University of Vienna(奥地利):Protocol-No. 1804/2017。图像来自 ViDIR Group 的既有数据库,含 Legacy 幻灯片与 2005 年以来的数字采集。

MSK 系(Memorial Sloan Kettering Cancer Center)的图像贡献也给 Task 1/2 的数据集增添了多样性。官方在数据说明中特别强调:疾病状态分布代表一种"修正过的真实世界"设定——良性多于恶性,但恶性被过度代表。这是所有使用者都应记住的数据特性,因为它直接影响阈值选择与临床解释。

2.10 图像采集设备的多样性

官方说明图像"以多种皮肤镜设备采集、覆盖所有解剖部位(排除黏膜与指甲)、来自历史皮肤癌筛查人群、来自多家机构"。这种设备多样性是双刃剑:

  • 优势:模型若在训练中见到多种设备风格,理论上泛化更好;这也使 ISIC 2018 成为研究域偏移(domain shift) 的良好素材。
  • 挑战:不同设备的色彩校准、偏振方式、分辨率差异会引入非病变相关的视觉差异,可能误导模型学习设备伪影而非病变特征——这正是后续研究关注 OOD 表现的一个隐含动机。

§3 三个任务的任务定义与评估设计

3.1 Task 1:病变边界分割(Lesion Boundary Segmentation)

目标:对皮肤镜图像提交病变分割边界的自动化预测。这是三个任务中最"经典"的计算机视觉任务——本质上是一个二值语义分割问题,输入 RGB 皮肤镜图,输出与原图同尺寸的像素级掩码。

输入输出规格:输入 JPEG,命名 ISIC_<id>.jpg;输出 PNG 掩码,命名 ISIC_<id>_segmentation.png,与输入图尺寸严格一致,单通道 8-bit(0/255),且应为单一连通前景。

主指标:thresholded Jaccard。这是 ISIC 2018 对分割评估最有方法论贡献的设计。计算步骤为:

  1. 逐图计算预测掩码与真值掩码的 Jaccard 指数(交并比);
  2. 对每张图,若 Jaccard 小于 0.65 则记 0 分,否则记该 Jaccard 值;
  3. 对全数据集取算术均值,作为最终分数。

阈值 0.65 的来历:官方依据一项先前分析(arXiv:1710.05006)指出,直接用原始 Jaccard 作性能度量会过于乐观——它掩盖了"有多少张图分割失败"这一关键信息。为确定阈值,官方让 3 位独立专家在一批 100 张图上标注,测出专家之间最低的 Jaccard 一致度约为 0.74,再留出误差容限,最终定为 0.65。换句话说,阈值就是"专家之间都会分歧到这种程度"的下限——低于它,算法的表现已跌出人类专家的可接受范围,直接判为失败。

这个设计的临床意义在于:分割算法的价值取决于需要人工修正的图片数量,而非平均重叠度。一个平均分 0.85 但在 12% 图上完全失手的算法,比一个平均分 0.80 但无严重失手的算法更不可用。thresholded Jaccard 正是把这一临床直觉写进了评分公式。

辅助指标:为科学完整性,官方还对每张图计算 sensitivity、specificity、accuracy、raw Jaccard 与 Dice 系数——但排名与颁奖只看 thresholded Jaccard。

3.2 Task 2:病变属性检测(Lesion Attribute Detection)

目标:在皮肤镜图像中定位具有临床意义的皮肤镜属性(dermoscopic attributes),即医生读图时所依据的视觉模式。官方指定 5 个属性:

  • pigment network(色素网);
  • negative network(负性色素网);
  • streaks(条纹);
  • milia-like cysts(粟粒样囊肿);
  • globules(球状体,含 dots 即点状结构)。

输入输出规格:输出为逐属性二值 PNG 掩码,命名 ISIC_<id>_attribute_<attribute_name>.png,属性名分别为 pigment_network、negative_network、streaks、milia_like_cyst、globules。掩码为单通道 8-bit(0 缺失/255 存在),且属性区域不必连通。

主指标:Jaccard(全数据集汇总口径)。注意与 Task 1 的关键差异:评分时先将所有图统一缩放到 256×256,然后把整个数据集的所有预测像素与真值像素一次性比对,而非逐图计算再平均。官方给出的理由是——某些图上根本不存在某个属性,逐图平均会因这些"无正例图"而产生偏差,因此改为全数据集像素级汇总。辅助指标为逐属性、逐图的 Dice 系数。

真值生产与难点:属性掩码由皮肤科研究员在皮肤镜专家监督下,以选取 SLIC 超像素的方式手工标注。这个任务在这届挑战赛中表现最差——冠军 Jaccard 仅 0.473,远低于其他任务。官方论文明确将低分部分归因于属性的专家间可靠性差(poor inter-observer reliability):皮肤镜属性的临床定义本身模糊,不同专家对"这里到底有没有色素网"都可能看法不一。官方由此提出两条改进路径:要么为皮肤镜特征建立更稳健的临床定义,要么反过来用机器学习去精炼这些定义。

3.3 Task 3:疾病分类(Lesion Diagnosis)

目标:对皮肤镜图像提交 7 类疾病的分类预测。7 类为 MEL、NV、BCC、AKIEC、BKL、DF、VASC。

输入输出规格:响应数据编码在单个 CSV 中,每行一个分类结果,列为 image, MEL, NV, BCC, AKIEC, BKL, DF, VASC。置信度为 [0,1] 浮点,0.5 作二分类阈值。官方允许任意分数区间经 sigmoid 变换映射到 [0,1];还建议将分类系统的二分类阈值调至预期达到 89% 敏感度的位置(非强制)。每个输入图实际只含一种疾病,但预测置信度可独立变化。

主指标:balanced multi-class accuracy。官方称之为 normalized multi-class accuracy metric(balanced across categories)——语义上等价于 average recall:先算每个类别的敏感度(该类正确预测数/该类真实总数),再对 7 类取算术平均。平局以 AUC 打破。

为什么换指标:官方给出两层理由。其一,临床上有两个目标——给出具体诊断与治疗方案,以及以合理敏感度/特异度检出皮肤癌;前者需要多类正确诊断,后者只需"活检/不活检"的二分类。其二,往届 ISIC 挑战赛聚焦于后者的二分类,而 2018 届想要更接近真实皮肤科医生评估的方式,因此改用更雄心勃勃的多类归一化准确率。这个选择还服务于一个延伸的读片研究——获胜算法将与医生在数字图像分类上的表现直接比较(即后来的 Lancet Oncology 研究)。

辅助指标:官方额外计算每类的 sensitivity、specificity、accuracy、AUC、mAP、F1、AUC80(仅黑色素瘤,AUC 在 80%–100% 敏感度区间积分)、PPV、NPV,以及跨类平均 AUC 与"恶性 vs 良性"的类别 AUC。

3.4 提交与流程规则

三个任务的参赛流程一致:Train(下载训练图与真值,开发算法)→ Validate(可选,下载验证图,跑算法后提交取即时分数,不限次数,用于检格式与性能)→ Test(下载测试图,跑算法后提交;每任务最多 3 套独立方案,提交次数不限但每套方案只取最近一次作官方评判;并须提交 4 页方法论文)。

两个细节值得记住:其一,验证阶段不限次数但测试阶段每套方案限 3 次——这是为了限制对测试集的过拟合;其二,所有参赛者都被要求提交方法论文,参赛者可将多任务描述合并进一篇。这一要求使得赛后能对方法做系统性综述(总结论文即由此汇总)。

3.5 任务间的隐藏联系:为什么三个任务不是孤立的

表面上三个任务互不相干,但它们共享同一批图像的视觉多样性,且互为上下游:

  • 分割是属性检测与分类的前置:先知道"病变在哪里",才能在病变区域内找属性、提取用于分类的特征。多个参赛队伍的报告显示,先在分割任务上训练,再把分割结果作为下游任务的输入或注意力掩码,能带来一致提升。
  • 属性是分类的中间语言:皮肤镜属性本就是医生诊断的推理依据(如"条纹+不对称"提示黑色素瘤),因此属性检测的中间输出可以被分类模型利用,形成近似可解释的流水线。
  • 测试集的泛化难题三任务共通:官方在三个任务上都观察到内外分布落差,这一现象在分类任务上被读片研究进一步放大。

Task 1 排行榜中确有队伍标注使用外部数据(如 Weill Cornell Medicine、DAISYLab),这也印证了"分割作为预训练/特征来源"的普遍做法。

3.6 官方页面曾出现的图数口径混乱(操作提示)

若你去抓 ISIC Archive 的 collection 列表页,会发现 Task1-2 的集合标签把 Validation 标为 1,000、Test 标为 2,594——后者恰好等于训练集规模,显然是标签错位。以官方任务页与总结论文为准(训练 2,594 / 验证 100 / 测试 1,000)。这类集合页标签错误在快速调研时极易误导,故单列提示。

3.7 Task 1 数据包的文件组织

Task 1 的官方数据包在文件层面这样组织,了解它有助于规划下载与校验:

  • 训练输入:一个包含 2,594 张 JPEG 的压缩包(10.4GB),文件名 ISIC_<id>.jpg。
  • 训练真值:一个包含 12,970 张 PNG 掩码的压缩包(26MB),文件名 ISIC_<id>_segmentation.png。注意掩码数(12,970)约为图数(2,594)的 5 倍——官方对每张图提供了 5 份专家标注,这一"同一图多标注"的设计本身就是对标注不确定性的承认,也让研究者可以量化专家间差异。
  • 验证输入:100 张 JPEG(228MB)。
  • 测试输入:1,000 张 JPEG(2.2GB)。
  • 真值(评分用):验证与测试的真值由官方在评分阶段内部使用,部分在赛后通过 ISIC Archive 公开。

"每图 5 掩码"这一细节值得展开:它意味着研究者既可以取 5 份的平均作为"软真值",也可以取多数投票生成"硬真值",还可以用 5 份之间的分歧度作为标注不确定性的度量。对于研究鲁棒分割或标注噪声的团队,这是一份被低估的资产。

3.8 Task 2 属性掩码的组织

Task 2 的掩码命名含属性名,因此每张图对应最多 5 个属性掩码文件(ISIC_<id>_attribute_<name>.png)。由于某些图上某属性完全不存在,对应的掩码可能是全零(或干脆不提供)。这正是官方把评分改为"全数据集像素级汇总"的原因:若逐图平均,那些"无该属性"的图会让分母虚增,拉低分数且无意义。改为全数据集汇总后,评分回答的是"在整个数据集的所有像素里,你的属性定位与真值有多吻合"。

这一设计还有一个隐含效果:它要求参赛者不能只优化单图表现,而要在整个数据集上维持稳定的属性识别能力。这与临床实际吻合——医生诊断时需要在整个患者群体上保持一致的判读标准。

§4 时间线、参与规模与排行榜

4.1 关键时间节点

时间 事件
2018 年(赛期) ISIC 2018 挑战赛开放,数据可下载
2018-07-27 23:59:59 EDT 参赛截止(提交测试集预测的硬截止)
2018-09-20 MICCAI 2018 Workshop(Granada, Spain)颁奖,每任务 2,500 美元
2018-08-14 HAM10000 论文正式发表于 Scientific Data
2019-02-09 官方总结论文 arXiv:1902.03368 v1
2019-03-29 v2(当前版本)
2019 Lancet Oncology 人机对比读片研究发表

一个必须点破的时间错觉:赛事在 2018 年,但总结论文到 2019 年 2 月才上 arXiv。检索时若只看论文年份会以为这是"2019 年的挑战赛",从而与 ISIC 2019 混淆——这是本条目要防的头号误解。

4.2 参与规模

官方论文摘要给出权威口径:900 名用户注册下载数据;三个任务分别收到 115(分割)/ 25(属性检测)/ 159(疾病分类) 份提交。

这组数字本身就是有趣的信号:分割任务最热闹(115),分类任务参与者最多(159),而属性检测最冷清(25)——与它最难、专家间可靠性最差的事实吻合。Task 1 排行榜去重后为 66 支团队/行,说明有相当比例的注册者未进入正式提交或多次提交被合并。

4.3 排行榜与冠军(官方页抓取,2026-09-28 存档)

Task 1(thresholded Jaccard):

排名 团队/方案 分数
1 MT(MaskRcnn2+segmentation) 0.802
2 Holidayburned(ensemble_with_CRF_v3) 0.799
3 imsight(Automatic Skin Lesion Segmentation by DCNN) 0.799
4 Tencent Youtu Lab(Adversarial Learning) 0.798
5 NMN_team(segmentation_ensemble) 0.796
6 GPM-UC3M 0.788

榜内可见大量 U-Net / Mask R-CNN 系方案(深度学习几乎一统分割任务),也有若干标注使用公开外部数据的队伍(如 Weill Cornell Medicine、DAISYLab 等)。Task 2 冠军平均 Jaccard 0.473;Task 3 冠军 balanced accuracy 0.885。

4.4 核心发现:分割仍会失手

总结论文给出一个反直觉的结论:即便平均 Jaccard 超过 0.8,顶尖分割算法平均仍在超过 10% 的图像上分割失败。而且失手并非均匀分布——某些病变类型(尤其脂溢性角化病 seborrheic keratosis)格外困难。这一发现正是 thresholded Jaccard 指标的用武之地:它把"平均分高但仍有大量需人工修正的图"这一现实暴露出来。

论文还点出一个对监管极重要的观察:在测试数据上表现相同的算法,泛化能力可以不同。换言之,仅凭一个测试集分数无法判断算法面对新数据源时的可靠性。论文将此列为"医疗领域机器学习工具监管机构"应重视的考量,并称其为此后公共医疗挑战赛设立了新标准。

4.5 Task 1 排行榜方法与机构素描

从官方 Task 1 排行榜(66 行)可读出几条趋势:

  • 深度分割网络一统天下:前 10 名几乎全是 U-Net / Mask R-CNN 系方案,传统方法(如 Otsu 阈值 + 聚类)排在后段(第 60-66 名区间分数落在 0.5–0.7)。
  • 集成与后处理是提分关键:榜内多支队伍方案名含 “ensemble”、“CRF”(条件随机场后处理)——分割掩码的边界细化对 Jaccard 有直接影响。
  • 外部数据使用要标注:官方要求标注是否使用公开外部数据。排名靠前者多为 “public_off”(不用外部数据),说明这些成绩主要依靠挑战赛数据本身的建模能力;少数 “public” 队伍(如 Weill Cornell Medicine、DAISYLab、WVU)借助外部数据取得中等偏上成绩。
  • 机构分布国际化:榜内可见 Tencent Youtu Lab(腾讯优图)、Weill Cornell Medicine、BMCV Heidelberg、Cleveland Clinic、University of York、SJTU、CDSLab 等,反映这是一届全球参与度极高的赛事。
  • 分数密集:前 6 名从 0.802 到 0.788,差距在 0.014 内,说明顶尖方案性能已趋于饱和(后文 §7.2 会解释为什么即便分数接近,真实可用性仍可能不同)。

4.6 一个被忽视的结论:属性检测为什么是最难的任务

三个任务提交数与分数呈现出清晰的一致性:属性检测提交最少(25 份)且分数最低(冠军 0.473)。这不是偶然关联,而是同因同果——任务的真值可靠性决定了它的可解性与吸引力。当专家之间对"这块区域算不算色素网"都难以达成一致时,参赛者要么望而却步,要么发现无限调参也撞不过真值噪声的天花板。官方论文坦承这一点,并把它上升为一项方法论呼吁:皮肤镜属性需要更稳健的临床定义。这也是本条目特别强调 Task 2 值得单独关注的原因——它是研究"标签质量如何封顶模型性能"的天然实验场。

4.7 赛事的组织设计:为什么这些规则重要

ISIC 2018 的组织规则本身包含若干精心设计,值得单独拆解,因为它们此后被多届挑战赛沿用:

  1. 三个任务彼此独立但可合并投稿:参赛者可任选任务参与,也可合并写成一篇方法论文。这降低了参与门槛,同时保证了方法论文的完整性。
  2. 每任务奖金 2,500 美元:金额不高,主要由 Canfield Scientific 赞助,说明激励重心不在金钱而在学术声誉与基准地位。
  3. 验证集不限次提交、测试集限制提交:这是一条经典的机器学习竞赛防过拟合设计——允许在验证集上反复试错,但对测试集设限,迫使参赛者真正泛化。
  4. 要求提交方法与可复现细节:使得赛后能产出系统性综述,也让排行榜成绩可被审计。
  5. 对组委会关联机构开放但要求隔离:官方明确"与组委会成员关联的机构不排除参赛,但须保证提交完全独立于组委会成员"——这是一条学术诚信条款。

4.8 一届"最"字赛事的意义

官方论文开篇即称 ISIC 2018 为"the largest skin image analysis challenge in the world"(全球最大的皮肤图像分析挑战赛)。这个"最"字由几组数字支撑:900 名注册下载者、299 份跨任务提交、139 个算法参与后续读片研究、77 个实验室、63 个国家的 511 名人类读者。在 2018 年,能在单一医学影像子领域汇聚如此规模的国际参与,是罕见的。它的规模效应直接转化为两个成果:一是 HAM10000 获得足够广泛的采用成为事实标准;二是人机对比研究因样本量充足而具备统计说服力。

4.9 排行榜之外的"隐形参赛者"

排行榜只记录提交成绩者,但挑战赛的真实影响还体现在"隐形参与者"身上:900 名注册下载数据者中,绝大多数从未提交。他们包括:

  • 教学用途:把 ISIC 2018 数据用作课程作业、tutorial 与练手项目,这使 HAM10000 成为许多学生接触医学影像 AI 的第一站。
  • 方法预训练:大量后续研究不参赛,只借用 HAM10000 预训练模型再迁移到其他任务。
  • 工业探索:企业用这批公开数据做原型验证(注意 Task 3 的 CC-BY-NC 禁止商业使用,这是合规红线)。

这提示一个常被忽略的事实:数据集的长期价值往往不由排行榜决定,而由其被复用的广度决定。ISIC 2018 的真正遗产,是让全球成百上千个团队手里都有一份可比的皮肤镜数据。

4.10 赛事与论文的双重时间线(附)

为彻底消除"2018 vs 2019"的混淆,这里完整列出相关文献的时间线:

时间 事件 类型
2018-04-25 HAM10000 论文收稿 数据本体论文
2018-06-26 HAM10000 论文接受 数据本体论文
2018-07-27 ISIC 2018 参赛截止 赛事
2018-08-14 HAM10000 论文正式发表 数据本体论文
2018-09-20 ISIC 2018 颁奖(MICCAI Granada) 赛事
2018-08-04 ~ 09-30 人机对比读片研究数据采集 读片研究
2019-02-09 ISIC 2018 总结论文 v1(arXiv) 赛事总结
2019-03-29 总结论文 v2 赛事总结
2019-06 人机对比读片研究发表于 Lancet Oncology 读片研究
2020 Nature Medicine 人机协作研究 后续研究

读这张表的要点:赛事在 2018 年,但总结论文与读片研究都发表于 2019 年。文献计量上,2019 年的引用高峰同时包含了 ISIC 2018 总结论文、读片研究论文与 ISIC 2019 赛事——这三者的年份交织,是导致混淆的根本原因。

§5 分工声明:与 isic-2019 / ham10000 / isic-archive 的边界

本节是本条目防"撞库"的核心。ISIC 系列数据高度相互嵌套,必须把每一条库内相关条目的职责划清。

5.1 与 ham10000(rid 60)的关系——赛事 vs 数据本体

Task 3 训练集 = HAM10000 全集 10,015 张,完全重合。 这是一对典型的"下游事件—上游本体"关系:

维度 ISIC 2018(本条目) HAM10000(rid 60)
本质 挑战赛事件(2018,MICCAI) 数据本体(Scientific Data 2018)
覆盖 三任务组织、评分、排行榜、影响 图像采集、清洗、多源整合、标签体系
数字 2,594/10,015 训练、1,512 测试 10,015 张、7 类、600×450
归属 ISIC 主办 维也纳 ViDIR + 昆士兰 Rosendahl

成稿边界:本条目不复述 HAM10000 的采集与清洗工艺,凡涉及图像本体的细节(多源构成、去重、lesion_id 追踪、患者伦理批号)一律指向 rid 60。检索者若只想下载"那 10,015 张图",应直奔 ham10000 条目,不必经由本条目。

5.2 与 isic-2019(rid 707)的关系——不同年份的两届赛事

ISIC 2019 是 ISIC 2018 下一年的下一届挑战赛,两者是并列的年度赛事条目,不是同一实体的不同版本:

维度 ISIC 2018(本条目) ISIC 2019(rid 707)
年份 2018(MICCAI Granada) 2019(MICCAI Shenzhen)
任务数 3(分割+属性+分类) 1(仅分类)
训练规模 2,594(Task1/2)+ 10,015(Task3) 25,331(8 类聚合)
类别数 7 类 8 类(新增 SCC 鳞状细胞癌)
训练来源 HAM10000 + MSK(Task1/2) HAM10000 + BCN20000 + MSK 三源聚合
测试集 1,000(Task1/2)/ 1,512(Task3) 8,238(含 UNK 未知类)
主指标 thresholded Jaccard / Jaccard / balanced accuracy balanced accuracy

关键区分点:ISIC 2018 是 HAM10000 的来源挑战赛(HAM10000 就是它的 Task 3 训练集);ISIC 2019 则是把 HAM10000 当作三大来源之一并入自己的聚合训练集。所以"HAM10000 → ISIC 2018 是本体到赛事",“HAM10000 → ISIC 2019 是数据源到聚合”。两者不能互相替代检索。

5.3 与 isic-archive(rid 56)的关系——赛事 vs 长期档案库

ISIC Archive 是 ISIC 组织长期运营的皮肤镜图像档案库与 API(非赛事、非单次发布)。ISIC 2018 的三任务数据包赛后由 ISIC Archive 以 “Pinned” 集合长期托管(2021-11-11 入档),并提供 API 访问。因此:isic-archive 是"库",ISIC 2018 是"库里一期特定的赛事数据"。检索者若要用 API 批量拉取,应看 rid 56 的接口说明;若关注 2018 届赛事本身,则看本条目。

5.4 与 BCN20000(rid 161)的关系——防误链

BCN20000(巴塞罗那 Hospital Clínic,12,413 张)是 ISIC 2019 才并入的数据源,与 ISIC 2018 无关。由于 ISIC 2019 条目会同时提到 HAM10000 与 BCN20000,检索者在追溯"ISIC 2018 用没用 BCN20000"时可能误链——明确答案:没用。ISIC 2018 Task 1/2 图像来自 HAM10000 与 MSK,Task 3 图像仅来自 HAM10000。

5.5 收录理由总结

尽管 Task 3 训练集与 ham10000 完全重合,本条目仍应作为独立条目收录,理由有三:其一,三任务的赛事组织、评估协议、排行榜与人机对比研究是无法从 ham10000 条目获取的独立信息;其二,Task 1/2 的 2,594 图与 12,970 张分割掩码不属 HAM10000 本体,是本条目独有的数据;其三,thresholded Jaccard 与 balanced accuracy 两个指标的由来与阈值推导是本领域重要方法论贡献。分工上,凡数据本体(图像采集/清洗/标签来源)归 ham10000,凡赛事机制与影响归本条目。

5.6 一张图说清三个条目的嵌套关系

ISIC Archive(rid 56,长期图像档案库 / API)
   └── ISIC 系列年度挑战赛
         ├── ISIC 2018(本条目,第 3 届,2018)
         │      ├── Task 1/2(2,594 图 + 掩码,CC-0)   ← 本条目独有
         │      └── Task 3(10,015 图,CC-BY-NC)       ← = HAM10000 全集
         │                                │
         │                                └──► HAM10000(rid 60,数据本体)
         └── ISIC 2019(rid 707,第 4 届,2019)
                └── 训练 = HAM10000 + BCN20000(rid 161) + MSK 三源聚合

读图要点:HAM10000 同时是 ISIC 2018 的输出物(作为 Task 3 训练集"交付")与 ISIC 2019 的输入物(作为三源之一"并入")。这条"数据本体在两届赛事间流转"的路径,是理解这三个条目为何必须互链却不可互换的关键。BCN20000 只出现在 2019 一侧,是防误链的锚点。

5.7 撞库自查清单(供后续检索者复用)

你可能想问的 正确条目 常见错误
10,015 张皮肤镜图的出处 ham10000(rid 60) 以为来自 ISIC 2018 新采集
ISIC 2018 有没有独立于 HAM10000 的数据 有,Task 1/2 的 2,594 图 + 掩码 以为 ISIC 2018 = HAM10000 别名
ISIC 2019 是不是 ISIC 2018 的升级版 是下一届(不同赛事),非版本升级 当成同一数据集的 v2
BCN20000 属不属于 ISIC 2018 不属于,2019 届才并入 因两届常并列提及而误链
三个任务的图是不是一批 不是,Task1/2 与 Task3 两套 用 Task3 的 10,015 去对 Task1 的掩码

5.8 互链策略建议(供主会话采用)

本条目建议的互链配置如下(以库里已有条目为准):

  • 强互链(正文提及 + 附录声明):ham10000(rid 60)。这是语义最近的条目,必须在 §2.6、§5.1 与附录 A 三处声明分工,并建议在 ham10000 条目反向提及"其对应挑战赛条目为 isic-2018"。
  • 中互链(届次关系):isic-2019(rid 707)。在 §5.2、§7.10、§8.4 与附录 G 建立上下届关联,强调"7 类 vs 8 类、三任务 vs 单任务、10,015 vs 25,331"的差异。
  • 弱互链(背景托管):isic-archive(rid 56)。在 §6.2 与 §8.4 提及作为长期托管方与 API 入口。
  • 防误链(明确否定):BCN20000(rid 161)。在 §5.4 与 §5.6 明确声明"2018 届未使用",避免与 2019 届混淆。
  • 横向参照(同标签):Derm7pt、rfmid、PAD-UFES-20、PH2 等皮肤影像条目,以及 cinc-、camelyon 等挑战赛条目。

这一配置的目标是:让从任一相邻条目进入的检索者,都能在两步内找到正确的数据归属,不产生"同一批图重复收录"的错觉。

§6 获取与许可:三种门、两条许可线

6.1 许可分层:最容易踩的坑

ISIC 2018 的许可不是一套,而是按任务分层的两套:

数据包 许可 义务
Task 1(分割)训练/验证/测试 + 掩码 CC-0(公共领域) 无署名义务,可自由使用
Task 2(属性)训练/验证/测试 + 掩码 CC-0 无署名义务
Task 3(分类)训练/测试 + GT CSV CC-BY-NC 署名 + 非商业

Task 3 的 CC-BY-NC 署名要求特别严格:官方要求署名须分别注明两个来源,缺一即违反许可条款:

换句话说,"我用了 ISIC 2018"这一句话的署名是不够的——必须列出 HAM10000 与 MSK 两个底层来源。许多论文在这一点的处理上并不规范,是本数据集使用中的高频许可瑕疵。

6.2 获取渠道

  • 官方数据页:https://challenge.isic-archive.com/data/(ISIC 系列统一数据入口)
  • 赛事主页:https://challenge2018.isic-archive.com/(Challenge 已 Closed,页面与排行榜长期保留)
  • ISIC Archive:以 “Pinned” 集合长期托管,附 DOI,可通过 ISIC Archive API(api.isic-archive.com)程序化访问
  • Task 1/2 集合:ISIC Archive 中标注为 “Challenge 2018: Task 1-2: Training/Validation/Test”
  • Task 3 集合:ISIC Archive 中 “Challenge 2018: Task 3: Training/Test”
  • 第三方镜像:Kaggle 等平台有 HAM10000/ISIC 2018 镜像;注意 license 误标风险——部分镜像把整体标成单一许可,掩盖了 Task1/2 与 Task3 的 CC-0/CC-BY-NC 差异

6.3 文件体量与下载规划

官方数据集页给出的体量(ADS 引用的官方 data 表口径):

  • Task 1:训练图 10.4GB + 掩码 26MB;验证图 228MB;测试图 2.2GB;GT 742KB
  • Task 2:训练图 33MB + 掩码 1MB;验证图 11MB
  • Task 3:训练图 2.6GB + GT CSV 481KB;测试图 401MB + GT 7KB;补充元数据(年龄/性别/部位/lesion ID)36KB + 51MB

若要完整复现三任务,下载总量在 15GB 量级;若只做分类(Task 3),约 3GB。

6.4 AI-Ready 适配评估

从"AI 就绪"角度,ISIC 2018 的成熟度很高:图像为统一命名的 JPEG、掩码为标准化 PNG、标签为规整 CSV、元数据齐备、API 可程序化获取、许可清晰且长期稳定托管。主要障碍不在数据本身,而在语义边界——三套数据包的混用、Task 3 与 HAM10000 的重合、以及"12,500 图"合计口径的歧义,都要求使用者先理清结构再动手。

6.5 复现三任务的最小下载清单

若目标是复现 ISIC 2018 的全部三个任务,最小下载集为:

  1. Task 1 训练图(10.4GB)+ 训练掩码(26MB)+ 测试图(2.2GB)
  2. Task 2 训练图 + 属性掩码 + 测试图
  3. Task 3 训练图(2.6GB)+ GT CSV(481KB)+ 测试图(401MB)+ 测试 GT(7KB)
  4. Task 1/2 验证图(228MB,用于调参)
  5. 元数据文件(Task 3 年龄/性别/部位/lesion ID)

总计约 15GB。若只关心分类(Task 3),可缩减至约 3GB。注意 Task 1/2 与 Task 3 的图像不是同一批,若试图用 Task 3 的图去找 Task 1 的掩码会一无所获——这是新手最易犯的结构性错误。

6.6 一个许可使用的具体示例

假设你在论文中使用了 ISIC 2018 Task 3 训练集(即 HAM10000),合规的图片来源声明应形如:

本研究使用 ISIC 2018 Challenge Task 3 训练集,图像来源为 HAM10000 Dataset(© ViDIR Group, Department of Dermatology, Medical University of Vienna, https://doi.org/10.1038/sdata.2018.161)与 MSK Dataset(© Anonymous, https://arxiv.org/abs/1710.05006)。数据遵循 CC-BY-NC 许可。

而若使用的是 Task 1 的分割数据,则因其为 CC-0,无强制署名义务(但学术惯例仍建议注明来源)。同一篇论文若同时用了 Task 1 与 Task 3,须分别标注两种许可——这一点常被忽略。

§7 评估与基准:从排行榜到人机对比

7.1 三任务指标速查

任务 主指标 平局打破 冠军分
Task 1 分割 thresholded Jaccard(0.65 阈值) — 0.802
Task 2 属性 Jaccard(256×256 全数据集像素汇总) — 0.473
Task 3 分类 balanced multi-class accuracy AUC 0.885

7.2 读指标时的第一守则:别与文献自切分混为一谈

这是本数据集使用中最危险、也最常见的误读:官方 balanced accuracy 0.885 是在官方测试集上按官方口径算出的,而文献中动辄出现的 0.92+ accuracy 往往是作者自行从原始 10,015 张里切分(如 70/30 或 80/20)后在同一分布内评估的结果。两者不可比,原因有三:其一,balanced accuracy 惩罚类别失衡,普通 accuracy 不惩罚;其二,官方测试集包含来自训练分布之外的图像(后述 OOD 问题),自切分则不会;其三,标签可能被作者清洗过。

因此,把 ISIC 2018 当基准引用时,必须同时说明评估口径(official test set / balanced accuracy vs. self-split / accuracy),否则分数没有意义。

7.3 泛化测试:这届挑战赛的新设计

官方总结论文强调,ISIC 2018 设立了两项新的评估协议:分割算法性能的新测试(即 thresholded Jaccard 与失败率统计),以及算法泛化能力的测试。后者的做法是在测试集中刻意区分内部分布(与训练同源)与外部来源(新机构数据),观察算法在两个子集上的表现落差。这正是论文核心结论的来源:测试分数相同的算法,泛化能力可以不同。

7.4 人机对比读片研究(Lancet Oncology 2019)

这是 ISIC 2018 影响最深远的一条产出。研究设计如下:

  • 人类侧:511 名来自 63 个国家的人类读者参与(2018-08-04 至 2018-09-30)。其中 55.4%(283 人) 为认证皮肤科医生,23.1%(118 人) 为皮肤科住院医,16.2%(83 人) 为全科医生。每人从 1,511 张测试图里随机抽 30 张作答。
  • 机器侧:77 个机器学习实验室提交的 139 个算法,赛前获得 10,015 张训练集。
  • 任务:7 类特异性诊断(与挑战赛 Task 3 一致)。

主要结果:

  1. 全体人类 vs 全体算法:算法平均多答对 2.01 题(95% CI 1.97–2.04;p<0.0001),人类 17.91(SD 3.42)vs 算法 19.92(SD 4.27)。
  2. 27 位经验 >10 年的专家 vs 前三算法:专家平均答对 18.78(SD 3.15),前三算法 25.43(SD 1.95),差距 6.65 题(95% CI 6.06–7.25;p<0.0001)。
  3. 分布外(OOD)图像:人类表现掉 11.4%(95% CI 9.9–12.9),算法仅掉 3.6%(0.8–6.3;p<0.0001)——即算法对未见来源数据的鲁棒性明显更好。

结论与限定:研究得出"最先进的机器学习分类器在色素性病变诊断上超越了人类专家,应在临床实践中扮演更重要的角色",但同时指出算法对分布外图像性能下降是潜在局限。第一作者 Tschandl 在采访中补充:计算机只分析光学快照,而真实诊断是复杂任务,医生还会考虑病程、风险、年龄等本研究未提供的信息——因此算法不能替代人类(约三分之二的参赛机器优于人类)。

7.5 与其他皮肤影像基准的对照

基准 年份 任务 规模 关键特性
ISIC 2016 2016 二分类 900 训练 / 379 测试 首年,仅痣 vs 黑色素瘤
ISIC 2017 2017 分割 + 三分类 2,000 训练 / 150 验证 / 600 测试 引入脂溢性角化类
ISIC 2018 2018 分割 + 属性 + 七分类 2,594 / 10,015 训练 三任务分立、thresholded Jaccard、balanced accuracy、人机对比
ISIC 2019 2019 八分类 25,331 训练 / 8,238 测试 三源聚合、新增 SCC 与 UNK 类
ISIC 2020 2020 二分类(黑色素瘤) 33,126 训练图 引入 DICOM 与患者级划分
ISIC 2024 2024 二分类 33,126 图 3D 全身摄影数据

ISIC 2018 在序列中的定位是任务最丰富、指标最具方法论贡献的一届。

7.6 冠军方案的技术共性

从三个任务的冠军方案看,2018 年的技术主流已经清晰:

  • 分割(Task 1):Mask R-CNN / U-Net 系架构 + 集成 + CRF 后处理。冠军 “MaskRcnn2+segmentation”(0.802)即 Mask R-CNN 变体,前几名普遍采用多模型集成。
  • 属性检测(Task 2):像素级二值分割思路,但因真值噪声,任何架构都被压在 0.5 以下。
  • 分类(Task 3):CNN 集成(含 ResNet 系),冠军 balanced accuracy 0.885,接近后续数年该基准的天花板。

这条技术路线在 ISIC 2019 被进一步推进(EfficientNets 多分辨率集成),形成清晰的方法演进脉络——皮肤影像 AI 在 2018 年完成了从"传统特征工程"到"深度网络主导"的转折,ISIC 2018 正是这一转折的标志性事件。

7.7 指标设计的方法论价值细读

ISIC 2018 对领域的持久贡献,很大程度体现在两个评估指标的设计智慧上。它们看似简单,却各自回应了一个真实痛点:

thresholded Jaccard 的三重智慧:

  1. 承认失败的独立性:分割算法的价值不在于"平均画得多准",而在于"有多少张需要人工返工"。把 Jaccard<0.65 直接记 0,使失败图在总分中被单独惩罚,而非被高分图稀释。
  2. 用专家分歧校准阈值:0.65 不是拍脑袋,而是"专家之间最低一致度 0.74 减容限"。这意味着阈值有临床含义——低于它,算法与人类专家的分歧已大到不可接受。
  3. 抗操纵性:若只用原始 Jaccard,算法可以通过在大而简单的病变上刷高分来掩盖在困难病变上的崩溃;thresholded 版本堵住了这条路。

balanced accuracy 的两重智慧:

  1. 直接对冲失衡:7 类从 6,705 到 115 相差 58 倍,普通 accuracy 会奖励"偏科"模型。balanced accuracy 对每类一视同仁,逼迫模型在少数类上也有表现。
  2. 贴合临床需求:临床上漏诊一例罕见恶性病变的代价,远大于误判一例常见良性病变。balanced accuracy 与"不放过每一类"的临床直觉一致。

这两个指标的设计思想后来被广泛移植到其他医学影像挑战赛中,成为"用指标设计引导正确行为"的经典范例。

7.8 泛化测试的具体含义

官方总结论文强调设立"算法泛化能力测试",这一设计的实现方式是:测试集内部按来源分层——一部分图像与训练集同源(内部测试),一部分来自训练未见过的新来源(外部测试)。算法需要在两个子集上分别报告表现。

这个设计的价值在读片研究中被放大:当把人类读者也拉进来对比时,人类在外部来源图像上的表现下降幅度(11.4%)明显大于算法(3.6%)。这揭示了一个反直觉的事实——算法在分布外的鲁棒性可能优于人类,因为算法学到的可能是更"设备无关"的特征,而人类的经验高度依赖其所受训练的视觉语境。

这一发现对临床部署的启示是:在跨机构、跨设备的真实场景中,经过充分训练的算法未必比本地专家差,甚至可能更稳定——但前提是它在多样化的数据上训练过。

7.9 如何正确引用 ISIC 2018 的分数

一份正确引用模板应包含以下要素:

在 ISIC 2018 Challenge Task 3(Lesion Diagnosis)上,本文方法的 balanced multi-class accuracy 达到 X.XX,评估于官方测试集(1,512 张);作为对照,该挑战赛冠军为 0.885(Codella et al., arXiv:1902.03368)。

要点:(1)说明评估集与指标;(2)如为自切分结果,须明确写"在 HAM10000 的 N% 训练/ M% 测试自切分上";(3)不要将自切分 accuracy 与官方 balanced accuracy 并列比较。这是避坑 7 的实践版。

7.10 与 ISIC 2019 评估设计的对比

理解 ISIC 2018 的评估设计,最好的镜像是它下一届的改动:

维度 ISIC 2018 ISIC 2019
任务数 3(分割/属性/分类) 1(仅分类)
类别数 7 8(新增 SCC)
主指标 Task3 balanced accuracy balanced accuracy(延续)
新难题 分割失败率、OOD 泛化 UNK 未知类(测试集含训练未见类别)
测试集规模 1,512(Task3) 8,238

关键延续:balanced accuracy 被 ISIC 2019 继承为主指标——这印证了该指标在类别失衡场景下的成功。关键进化:ISIC 2019 引入 UNK(unknown)类,测试集刻意包含训练集中未出现的疾病类别,用来测试算法"知道自己不知道"的能力(拒识/OOD 检测),这是比 ISIC 2018 的"内外来源分层"更激进的泛化测试。因此 2019 届的冠军分数(balanced accuracy 63.6%)远低于 2018 届(88.5%)——分数下降不是退步,而是任务变难了,这是跨届对比时最容易误读之处。

7.11 一个具体的评估陷阱演示

假设某模型在 HAM10000 自切分(80/20)上报告普通 accuracy 0.93。这个数字能否与官方 0.885 比较?答案是不能,原因可拆解为三点量化差异:

  1. 指标差异:0.93 是普通 accuracy,会因 66.9% 的 nv 多数类而虚高;若换成 balanced accuracy,同一模型可能降至 0.80 左右(取决于少数类表现)。
  2. 分布差异:自切分是随机同分布划分,训练与测试高度相似;官方测试集含外部来源图像,难度更高。
  3. 泄漏差异:若自切分未按 lesion_id 分组,同一病灶的多张图可能跨越训练/测试边界,进一步虚高分数。

结论:见到文献中的高分,先问三件事——什么指标?什么划分?有没有防泄漏? 三问不清,数字不可信。

§8 生态与影响

8.1 HAM10000 效应:一个训练集如何成为标准

ISIC 2018 对领域最持续的影响,是它把 HAM10000 变成了皮肤影像分类的公共训练基准。在此之后数年的皮肤病变分类论文,绝大多数都会报告"在 HAM10000 / ISIC 2018 上的表现",使其获得类似"皮肤影像 MNIST"的地位(HAM10000 常被昵称为 “Skin Cancer MNIST”)。这也带来副作用:大量论文的分数无法互比——因为各自的自切分方式、预处理、数据增强策略不同(§7.2 的陷阱)。

8.2 分割掩码的后续扩展

Task 1 的 2,594 张训练掩码(12,970 张,5/图)长期是分割研究的重要资源。此后出现了若干扩展:HAM10000 全 10,015 张的专家分割掩码(由 Tschandl 在 Nature Medicine 2020 研究中单人标注,用于 CNN 激活区域评估),以及第三方基于 U-Net + 人工复核生成的 ISIC 2018 掩码扩展集。这体现了一个模式:挑战赛发布的训练集虽小,但会成为后续更大标注工程的种子。

8.3 两篇续作论文的放大作用

  • Lancet Oncology 2019 人机对比(§7.4):把挑战赛测试集转化为国际读片研究的评测集,是 ISIC 2018 出圈最广的成果。
  • Nature Medicine 2020 人机协作:用同一批测试图研究不同人机协作模式,配套公开了人类读片评分数据与 HAM10000 全量分割掩码,把挑战赛的影响延伸到家协作设计领域。

8.4 库内可互链点

  • ham10000(rid 60):Task 3 训练集本体,最强的语义近邻——建议双向互链并在本条目注明"数据本体以 rid 60 为准"。
  • isic-2019(rid 707):下一届赛事,互为"上/下届"关系——建议互链并强调届次差异(7 类 vs 8 类、三任务 vs 单任务、2,594+10,015 vs 25,331)。
  • isic-archive(rid 56):ISIC 长期档案库与 API——本条目数据的长效托管方。
  • BCN20000(rid 161):2019 届才并入的数据源,与 2018 届无关,仅在"防误链"语境下提及。
  • 其他皮肤影像条目:Derm7pt、rfmid、PAD-UFES-20、MED-NODE、PH2、MED-NODE 等构成皮肤影像数据景观。
  • 赛事脉络条目:cinc-2011/2012/…、camelyon16/17、brats 等医学影像挑战赛条目可作"挑战赛数据集"标签下的横向参照。

8.5 一句话定位

ISIC 2018 处在一个罕见的位置:它既是数据发布事件(把 HAM10000 交付给全世界),又是评测方法论贡献(两个新指标),还是临床能力论证的开端(人机对比研究)。理解它,等于理解现代皮肤影像 AI 的三块基石。

8.6 对后续研究的四条具体影响

  1. 基准固化:此后几乎所有皮肤病变分类论文都以"HAM10000 / ISIC 2018 上的表现"作为标准报告项,使该数据集获得了领域内少有的可比性——尽管这种可比性常被自切分差异削弱(坑 7)。
  2. 指标外溢:balanced accuracy 与 thresholded Jaccard 的思路被应用到其他医学影像挑战赛(类别失衡、失败率敏感的分割评估),成为通用方法论词汇。
  3. 人机协作研究范式:读片研究确立的"同一测试集、人机同题对比、区分内外部来源"设计被后续研究反复借鉴。
  4. 分割掩码的种子效应:Task 1 的 2,594 张掩码启动了更大的标注工程,最终扩展到全 10,015 张(Nature Medicine 2020),成为皮肤病变分割研究的重要资源。

8.7 局限与批评

客观地说,ISIC 2018 也留下几处长期争议:

  • 数据集偏倚:图像主要来自奥地利与澳大利亚两家机构的历史筛查人群,种族与地理代表性有限,"真实世界"claim 需谨慎解读。
  • 类别失衡的副作用:即便用 balanced accuracy,少数类(DF 115 张、VASC 142 张)样本过少,模型在这些类上的评估方差大。
  • 任务间不一致:三任务用两套数据,缺乏统一的数据划分,增加了跨任务研究的摩擦。
  • 属性定义的模糊性:Task 2 的低分暴露了皮肤镜属性缺乏稳健操作化定义这一更深层的临床问题。

把这些局限与成就并置,才能对 ISIC 2018 给出公允评价:它是一次成功的大规模基准实践,但它的成绩单也精确标出了皮肤影像 AI 下一阶段要攻克的难点。

8.8 对临床转化的三段式影响链

ISIC 2018 对临床转化的影响可以串成一条清晰的链条:

第一段(数据基础):HAM10000 提供了足够大的训练集,使深度模型在 7 类诊断上第一次达到可与医生讨论的水平。
第二段(能力论证):Lancet Oncology 读片研究用严格的人机同题对比,量化了"算法优于专家"这一命题,并揭示 OOD 是主要短板。
第三段(协作探索):Nature Medicine 2020 的人机协作研究进一步探讨"医生+AI"如何组合最优——这是从"谁能赢"转向"如何配合"的关键一步。

这条链条的意义在于:ISIC 2018 不只产出了一个数据集或一个排行榜,它启动了一项从"数据→能力→协作"的完整研究议程。此后皮肤影像 AI 的多数进展,都可以追溯到这个起点。

8.9 给模型开发者的实践建议

基于 ISIC 2018 的经验,给使用这批数据的开发者几条具体建议:

  1. 分类任务优先按 lesion_id 分组切分,避免同病灶泄漏,否则你得到的分数不可信。
  2. 报告 balanced accuracy 而非普通 accuracy,与官方口径对齐,也让类别失衡下的表现可见。
  3. 在报告中区分"官方测试集"与"自切分",并说明所用指标——这是可比性的前提。
  4. 分割任务重视失败率,报告需人工修正的图数比例,而不只是平均 Jaccard。
  5. 若做属性检测,预期天花板较低,并考虑把专家分歧度作为不确定性来源建模,而非追求单点预测。
  6. 跨数据源验证:在 HAM10000 上训练的模型,应在其他来源(如 BCN20000、PAD-UFES-20)上测试泛化,因为 ISIC 2018 已证明同分布高分不代表跨源可用。

§9 避坑清单:十五个已踩过的坑

坑 1:把 ISIC 2018 当成"另一个 HAM10000 下载包"重复收录。
Task 3 训练集 100% 就是 HAM10000 的 10,015 张,一张不多不少。若只为拿图像,应直接看 ham10000(rid 60)。ISIC 2018 条目的增量是三任务的赛事机制(Task 1/2 的 2,594 图与掩码、评估协议、排行榜、读片研究)——不是图像本体。

坑 2:把 ISIC 2018 与 ISIC 2019 混为一谈。
两者是不同年份的两届赛事:2018 届三任务、7 类、训练 2,594+10,015;2019 届单任务(分类)、8 类、训练 25,331。ISIC 2018 是 HAM10000 的来源赛事,ISIC 2019 是把 HAM10000 当来源之一的聚合。见 §5.2 对照表。

坑 3:以为"12,500 图"是单一数据集规模。
论文摘要"over 12,500 images across 3 tasks"是三任务合计的概数;实际是 Task1/2(2,594+100+1,000)与 Task3(10,015+1,512)两套独立数据包之和。单独引用 12,500 会误导读者以为存在一个 12,500 张的统一数据集。

坑 4:把 Task 3 测试集写成 1,511 或 1,512 而不加说明。
官方 data 表与 ISIC Archive 写 1,512;HAM10000 的 Dataverse “Additional data” 与 Lancet Oncology 读片研究写 1,511。差异源于归档版本/去重口径(可能 1 张离群图)。引用时须注明所用版本。

坑 5:把 Task 1/2 数据包当 CC-BY-NC、或把 Task 3 当 CC-0。
许可按任务分层:Task 1/2 是 CC-0,Task 3 是 CC-BY-NC。一刀切会要么不当受限、要么无谓受限。

坑 6:Task 3 署名只提"ISIC 2018",漏掉 HAM10000 与 MSK 两源。
CC-BY-NC 明确要求署名分别注明 HAM10000(维也纳 ViDIR)与 MSK Dataset(Anonymous)两个底层来源,缺一即违反许可条款。这是最高频的合规瑕疵。

坑 7:把文献自切分的高分(0.92+ accuracy)与官方测试集分数(balanced accuracy 0.885)直接比较。
两者分布不同、指标不同、标签处理不同,不可比。引用基准时必须同时声明评估口径(见 §7.2)。

坑 8:以为 Task 2 属性检测"很简单"。
冠军 Jaccard 仅 0.473,是三任务中最低。根因是皮肤镜属性的临床定义本身模糊、专家间可靠性差——这不是"模型不够强",而是任务的真值本身就带噪声。

坑 9:把 Task 1 的 0.65 阈值当成随意设定。
它由 3 位专家在 100 张图上测出的最低专家间一致度(约 0.74)加误差容限导出,含义是"低于此即跌出人类可接受范围"。忽略这一来历,就无法理解为什么阈值是 0.65 而非 0.5 或 0.75。

坑 10:只看平均分,忽略"失败图像比例"。
官方论文的核心发现是:平均 Jaccard 超 0.8 的顶尖算法,平均仍在 >10% 的图上分割失败。只看均值会严重高估模型的临床可用性——分割算法的价值取决于需人工修正的图数,这正是 thresholded Jaccard 设计要暴露的东西。

坑 11:忽略 lesion_id,自行切分导致数据泄漏。
HAM10000 含同一病灶的多张图(随访/不同放大)。若按图像随机切分训练/测试,同一病灶会同时出现在两侧,测试分数虚高。必须按 lesion_id 分组切分。这是使用这批数据自查时最常见的技术错误。

坑 12:以为三个任务的提交数(115/25/159)等于参与团队数。
提交数与团队数不是一回事:Task 1 有 115 份提交但去重后为 66 支团队/行(允许每团队多方案)。且论文摘要口径(115/25/159)与部分二次页(112/26/141)不同,系统计时点差异(坑 6 登记的第五项)。

坑 13:把"修正过的真实世界"当成"真实世界"。
官方明确说明数据分布是"modified real world"——恶性被过度代表(19.5% vs 真实临床更低)。若据此估计真实场景的患病率或阳性预测值会严重偏离。

坑 14:假设 ISIC 2018 的图像是新采集的。
ISIC 2018 不采集新图像:Task 3 全部来自 HAM10000(2018 年发表的数据本体),Task 1/2 来自 HAM10000 与 MSK 的既有图。它是"数据组织与评测事件",不是数据采集项目。

坑 15:用同一套预处理假设处理三个任务。
Task 1/2 图像分辨率范围更宽且带像素级掩码,Task 3 图像统一为 600×450。掩码与图必须严格同尺寸对齐,跨任务的图像缩放策略不能通用。

§10 总结

10.1 三句话总结

  1. ISIC 2018 是 ISIC 的第 3 届皮肤镜病变分析挑战赛(MICCAI 2018, Granada),分三任务:病变边界分割、属性检测、疾病分类。
  2. 它的分类训练集就是 HAM10000 全集 10,015 张(7 类),是本条目与库内 ham10000(rid 60) 的核心关系;它与下一届 isic-2019(rid 707) 是并列的不同年份赛事。
  3. 它的方法论遗产(thresholded Jaccard、balanced accuracy)与临床遗产(Lancet Oncology 人机对比研究) 共同奠定了现代皮肤影像 AI 的评测范式。

10.2 适合谁

  • 做皮肤病变分割:Task 1 的 2,594 图 + 12,970 掩码可直接训练与对标(CC-0 无约束)。
  • 做皮肤病变分类:Task 3 的 10,015 图 + 官方测试集 1,512 是标准基准;但注意与 ham10000 条目查重。
  • 做皮肤镜属性检测:Task 2 是罕见的像素级属性标注集,也是难得的"难任务"基准(冠军仅 0.473)。
  • 研究人机协作 / AI 临床能力:本条目汇总的读片研究是重要设计与数据来源。
  • 研究评测方法论:两个指标的推导过程是教科书级的案例。

10.3 不适合谁

  • 只想找"一批方便下载的皮肤镜图"而不关心赛事——直接看 ham10000(rid 60) 或 isic-archive(rid 56) 更省事。
  • 需要最新最强的分类基准——ISIC 2019/2020/2024 规模更大、类别更多,应优先看那些条目。
  • 需要非皮肤影像的数据集——本条目与皮肤镜高度绑定。

10.4 30 秒决策卡

你的需求 该去哪
要 ISIC 2018 三任务完整数据包 §6.2 官方 data 页 / ISIC Archive
要那 10,015 张分类训练图 ham10000(rid 60)(与 Task 3 训练集同)
要 2,594 图 + 分割掩码 本条目 §2.1(Task 1,CC-0)
要下一届更大分类集 isic-2019(rid 707)
要 7 类分类的官方基准分 §7.1(冠军 balanced accuracy 0.885)
要人机对比数据与设计 §7.4(Lancet Oncology 读片研究)

10.5 三个数字背后的故事

若只能记住三个数字,选这三个,它们各自浓缩了 ISIC 2018 的一重意义:

  • 10,015——Task 3 训练集规模,即 HAM10000 全集。它是这届挑战赛给领域最实在的礼物:一个足够大、标签可靠、公开可用的皮肤镜分类训练集。
  • 0.885 vs 25.43/30——分类冠军的 balanced accuracy,以及前三算法在人机对比中 30 题答对 25.43 题(对比专家的 18.78)。这是 AI 在皮肤诊断上首次大规模超越人类专家的量化证据。
  • >10%——顶尖分割算法仍在超过一成图像上失败的比例。它提醒着:高分不等于可用,临床落地还要跨过"失败率"这道坎。

10.6 展望:ISIC 2018 之后

从 2018 到 2024,ISIC 系列把规模从 10,015 扩到 33,126,把模态从皮肤镜扩到 3D 全身摄影,把评估从单一 accuracy 扩到患者级划分与 OOD 测试。但三个内核始终未变:公开可靠的数据、清晰可比的指标、严肃的能力论证。ISIC 2018 确立的这三块基石,至今仍是皮肤影像 AI 评测的底层逻辑。

10.7 一句话送给三类决策者

  • 对研究者:ISIC 2018 是皮肤影像分类的公共标尺,但用之前先分清"官方测试集"与"自切分",否则你的分数没有可比性。
  • 对产品/合规方:Task 3 数据是 CC-BY-NC——可以研究,不能直接商用,署名必须同时列 HAM10000 与 MSK。
  • 对临床转化方:算法在同分布上赢了人类,但在分布外仍会退步;真实部署的价值取决于跨机构、跨设备的鲁棒性,而这正是 ISIC 2018 埋下的核心议题。

10.8 本条目在库中的角色

在千方病案医数集的皮肤影像条目群里,本条目扮演"赛事枢纽"的角色:向上连接 ISIC Archive(rid 56)这一长期档案库,向下连接 HAM10000(rid 60)这一数据本体,横向连接 ISIC 2019(rid 707)这一后续届次。它的价值不在于新增图像,而在于把"一批图像如何被组织成一场可比的国际竞赛、并从中产出临床级证据"这条链条完整记录下来。

FAQ(高频问答 34 问)

A. 基础认知

Q1:ISIC 2018 和 HAM10000 到底谁是谁?
HAM10000 是一份 10,015 张的皮肤镜数据集(数据本体);ISIC 2018 是把它作为分类任务训练集来组织的挑战赛(赛事)。关系是"赛事 → 数据本体",ISIC 2018 是 HAM10000 的来源挑战赛。

Q2:为什么不直接看 ham10000 条目就好?
因为 ISIC 2018 独有三块内容:Task 1/2 的 2,594 图与 12,970 掩码、三任务的评估协议与排行榜、以及赛后的人机对比研究。这些都不在 ham10000 条目里。

Q3:ISIC 2018 和 ISIC 2019 是什么关系?
上下届关系,但差异很大:2018 届三任务 + 7 类;2019 届单任务(分类)+ 8 类 + 训练规模近翻倍(25,331)。两者是并列条目,不能互相替代。

Q4:这届挑战赛什么时候办的?
赛事本身在 2018 年(截止 2018-07-27,颁奖 2018-09-20 MICCAI Granada)。官方总结论文 2019-02-09 才上 arXiv,勿因论文年份误判为 2019 年赛事。

Q5:谁主办、谁赞助?
ISIC(国际皮肤影像协作组织)主办,Clinichair 是维也纳医科大学的 Harald Kittler,CV chair 是 IBM Research 的 Noel Codella;赞助方为 Canfield Scientific, Inc.。

B. 数据与获取

Q6:三个任务的数据是一份吗?
不是。Task 1/2 共用一套(训练 2,594、验证 100、测试 1,000);Task 3 用另一套(训练 10,015、测试 1,512)。两套不可混用。

Q7:许可怎么算?
分层——Task 1/2 是 CC-0,Task 3 是 CC-BY-NC。Task 3 署名须分别注明 HAM10000 与 MSK 两源。

Q8:图像规格?
统一命名 ISIC_<7位ID>.jpg,EXIF 已清除。Task 3 图像为 600×450(部分文献写 450×600)。

Q9:怎么下载?
官方 data 页 challenge.isic-archive.com/data/,或经 ISIC Archive API。Kaggle 有镜像但注意 license 误标。

Q10:总共多大?
三任务完整约 15GB 量级;只做分类(Task 3)约 3GB。

Q11:Task 3 测试集是 1,511 还是 1,512?
官方 data 表与 ISIC Archive 写 1,512,Dataverse 归档与读片研究写 1,511,系版本/去重口径差异(坑 4)。

Q12:Task 2 的属性有哪几个?
pigment network、negative network、streaks、milia-like cysts、globules(含 dots)。

C. 评估与基准

Q13:三个任务的主指标分别是什么?
Task 1 thresholded Jaccard(0.65 阈值);Task 2 全数据集像素级 Jaccard;Task 3 balanced multi-class accuracy(平局以 AUC 打破)。

Q14:0.65 阈值怎么来的?
由 3 位专家在 100 张图上测出的最低专家间一致度约 0.74,加误差容限导出。

Q15:冠军分数是多少?
Task 1 0.802 / Task 2 0.473 / Task 3 0.885。

Q16:为什么 Task 2 分数这么低?
皮肤镜属性本身临床定义模糊、专家间可靠性差(官方论文口径),不是单纯模型能力问题。

Q17:0.885 能直接和文献里的 0.92 比吗?
不能。0.885 是官方测试集 balanced accuracy,0.92 多是作者自切分的普通 accuracy,分布、指标、标签处理都不同(坑 7)。

Q18:什么是 thresholded Jaccard 的意义?
它惩罚"失败图像"(Jaccard<0.65 记 0),暴露"平均分高但大量图需人工修正"的现实,比原始 Jaccard 更贴近临床可用性。

Q19:所谓"泛化测试"是什么?
官方在测试集中区分内部分布与外部来源子集,观察算法跨来源的表现落差,用于评估泛化能力。

D. 人机对比与影响

Q20:Lancet Oncology 读片研究的结论是什么?
算法整体优于人类:全体人类平均 17.91 题 vs 算法 19.92 题;>10 年经验专家 18.78 vs 前三算法 25.43。但算法对分布外图像性能下降是局限。

Q21:有多少人类读者和算法参与?
511 名读者(63 国)vs 139 个算法(77 个实验室),每人答 30 张(从 1,511 张抽)。

Q22:读片研究用的是挑战赛测试集吗?
是,同一批测试图(归档口径 1,511 张),这也是它能做公平人机对比的前提。

E. 生产与库内

Q23:本条目和库内哪些条目互链?
ham10000(rid 60)、isic-2019(rid 707)、isic-archive(rid 56);BCN20000(rid 161) 仅作防误链提及。

Q24:溯源到哪里?
赛事主页 challenge2018.isic-archive.com;总结论文 arXiv:1902.03368;数据本体论文 Scientific Data 5:180161;人机对比 DOI:10.1016/S1470-2045(19)30333-X。

F. 使用与工程细节

Q25:用 HAM10000 自己切数据集有什么风险?
最大风险是同病灶图像泄漏——HAM10000 含同一 lesion_id 的多张图(随访或不同放大),若按图像随机切分,同一病灶可能同时落在训练与测试侧,导致测试分数虚高。正确做法是按 lesion_id 分组切分。

Q26:Task 1 和 Task 3 的图能混用吗?
不能。Task 1/2 是 2,594 张带掩码的训练集,Task 3 是 10,015 张分类训练集,两套独立。做分割用 Task 1,做分类用 Task 3。

Q27:分割任务为什么阈值定 0.65 而非更高?
0.65 基于 3 位专家在 100 张图上的最低一致度约 0.74 加误差容限。它代表"专家之间都会分歧到这个程度"的下限,低于此即跌出人类可接受范围。

Q28:balanced accuracy 和普通 accuracy 差多少?
在有 58:1 类别失衡的情况下差异显著。“全猜 nv” 的退化解在普通 accuracy 上可得约 66.9%,但 balanced accuracy 只有约 1/7(14.3%),因此后者才反映真实分类能力。

Q29:怎么离线复现官方评分?
Task 3 的 balanced accuracy = 各类 recall(正确数/该类总数)的算术平均;Task 1 的 thresholded Jaccard 见附录 F 伪代码。两者都只需预测文件与真值文件即可复算。

Q30:ISIC 2018 的数据现在还能下吗?
能。官方 data 页与 ISIC Archive 均长期保留(Archive 以 Pinned 集合托管),Challenge 页面虽标 Closed 但数据与排行榜不撤。

G. 影响与评价

Q31:ISIC 2018 最重要的单一贡献是什么?
多数研究者认为是人机对比读片研究——它把挑战赛测试集转化为国际临床能力论证的载体,首次大规模量化"算法优于专家"。

Q32:这届比赛有什么公认的局限?
数据地理/种族代表性有限(主要来自奥地利与澳大利亚)、少数类样本过少、三任务数据划分不统一、属性定义模糊(Task 2 低分)。

Q33:为什么说它是皮肤影像 AI 的转折点?
因为深度网络在这届赛事上全面主导三个任务,且赛后读片研究给出了 AI 临床价值的量化证据,标志着该领域从"算法探索"进入"临床论证"阶段。

Q34:它和 ISIC 2020/2024 什么关系?
同系列后续届次。2020 引入 DICOM 与患者级划分(33,126 图),2024 扩展到 3D 全身摄影。规模与技术都在演进,但 2018 届确立的评测思想被延续。

事实清单(硬事实 48 条)

  1. 全称:Skin Lesion Analysis Toward Melanoma Detection 2018: A Challenge Hosted by the International Skin Imaging Collaboration (ISIC);通称 ISIC 2018。
  2. 主办:International Skin Imaging Collaboration (ISIC)。
  3. 举办地/场合:MICCAI 2018,西班牙 Granada(颁奖 2018-09-20)。
  4. 三任务:Task 1 病变边界分割;Task 2 属性检测;Task 3 疾病分类。
  5. 参赛截止:2018-07-27 23:59:59 EDT。
  6. 每任务奖金:2,500 美元;赞助方 Canfield Scientific, Inc.。
  7. 临床主席:Harald Kittler(维也纳医科大学)。
  8. CV 主席:Noel C. F. Codella(IBM Research)。
  9. 联合主席:M. Emre Celebi、Kristin Dana、David Gutman、Allan Halpern、Brian Helba、Philipp Tschandl。
  10. Task 1 训练:2,594 图 + 12,970 张掩码(5/图);验证 100;测试 1,000。
  11. Task 2 训练:2,594 图 + 5 属性掩码;验证 100;测试 1,000。
  12. Task 3 训练:10,015 图(= HAM10000 全集)+ 7 类 GT CSV;测试 1,512。
  13. 论文摘要合计口径:三任务"over 12,500 images"。
  14. Task 1 主指标:thresholded Jaccard,阈值 0.65。
  15. 0.65 阈值依据:3 专家在 100 图上最低一致度约 0.74 加容限。
  16. Task 2 主指标:Jaccard(256×256 全数据集像素汇总)。
  17. Task 3 主指标:balanced multi-class accuracy,平局以 AUC 打破。
  18. 7 类:MEL/NV/BCC/AKIEC/BKL/DF/VASC。
  19. 类别分布:nv 6,705 / mel 1,113 / bkl 1,099 / bcc 514 / akiec 327 / vasc 142 / df 115。
  20. 注册下载用户:900。
  21. 提交数:Task 1 = 115;Task 2 = 25;Task 3 = 159。
  22. Task 1 排行榜:66 支团队/行。
  23. 冠军分:Task 1 = 0.802;Task 2 = 0.473;Task 3 = 0.885。
  24. Task 1 冠军方案:MaskRcnn2+segmentation(队名 MT)。
  25. 许可:Task 1/2 = CC-0;Task 3 = CC-BY-NC。
  26. Task 3 署名:须分注 HAM10000(ViDIR, MedUni Vienna)与 MSK。
  27. 总结论文:arXiv:1902.03368(v1 2019-02-09;v2 2019-03-29)。
  28. 数据本体论文:Scientific Data 5:180161,doi:10.1038/sdata.2018.161(2018-08-14)。
  29. 读片研究:doi:10.1016/S1470-2045(19)30333-X,Lancet Oncology 2019。
  30. 读片研究规模:511 名读者(63 国)vs 139 算法(77 实验室)。
  31. 读片结果:人类 17.91 vs 算法 19.92(全体);专家 18.78 vs 前三算法 25.43。
  32. OOD 落差:人类掉 11.4% vs 算法掉 3.6%。
  33. 图像命名:ISIC_<7位ID>.jpg,EXIF 已清除。
  34. 伦理批号:UQ 2017001223;MedUni Vienna 1804/2017。
  35. 图像采集机构:维也纳医科大学 ViDIR + 昆士兰大学 Rosendahl 诊所(+ MSK 供 Task1/2)。
  36. 每任务最多提交 3 套独立方案,须配 4 页方法论文。
  37. 验证阶段提交不限次,测试阶段每方案限制,用于防过拟合。
  38. Task 1 训练掩码 12,970 张 = 2,594 图 × 5 份专家标注。
  39. 数据分布为"修正过的真实世界":良性多于恶性,恶性过度代表。
  40. Task 3 元数据字段含 age/sex/localization/lesion_id/dx/dx_type。
  41. HAM10000 病理确诊率 53.3%(>50%)。
  42. 官方称 ISIC 2018 为"全球最大的皮肤图像分析挑战赛"。
  43. Task 1 榜单去重后 66 支团队/行,前 6 名分数在 0.788–0.802。
  44. ISIC 2019 主指标继承 balanced accuracy 并引入 UNK 未知类。
  45. 三任务难度梯度:分类 0.885 > 分割 0.802 > 属性 0.473。
  46. ISIC 2018 未使用 BCN20000(该源 2019 届才并入)。
  47. 官方数据页仍在,提供三任务完整下载(约 15GB 总量)。
  48. Task 1 阈值 Jaccard 的失败判据含临床含义(低于 0.65 跌出人类可接受范围)。

术语表(30 条)

  1. ISIC(International Skin Imaging Collaboration):国际皮肤影像协作组织,皮肤镜图像最大的公共档案库主办方。
  2. 皮肤镜 / dermoscopy:一种无创放大成像技术,可显著提升色素性病变诊断准确率。
  3. 皮肤镜属性 / dermoscopic attributes:医生读图依据的视觉模式,如色素网、条纹、球状体。
  4. pigment network:色素网,色素性病变常见结构,形似网状。
  5. negative network:负性色素网,网眼呈反向明暗关系。
  6. streaks:条纹,放射状或假足样结构(常见于黑色素瘤)。
  7. milia-like cysts:粟粒样囊肿,白色圆点状结构(常见于脂溢性角化病)。
  8. globules / dots:球状体/点,圆形色素团块。
  9. SLIC 超像素:Simple Linear Iterative Clustering,一种将图像分割为感知均匀小块的算法,Task 2 标注以此为最小单元。
  10. 掩码 / mask:像素级二值标注图(0/255)。
  11. 单连通区域:分割掩码要求病变为一个连通的整体,无游离部分或空洞。
  12. Jaccard 指数 / IoU:交并比,预测区域与真值区域的交集除以并集。
  13. thresholded Jaccard:带失败阈值的 Jaccard,低于 0.65 记 0 分。
  14. Dice 系数:另一种重叠度指标,2×交集除以两者面积之和。
  15. balanced accuracy:类别平衡准确率,等价于各类敏感度的算术平均。
  16. AUC:ROC 曲线下面积,用于平局打破。
  17. AUC80:在 80%–100% 敏感度区间积分的 AUC(黑色素瘤专用)。
  18. sensitivity / 敏感度:真阳性率。
  19. specificity / 特异度:真阴性率。
  20. PPV / NPV:阳性/阴性预测值。
  21. OOD / 分布外:out-of-distribution,来自训练未见来源的数据。
  22. 泛化:模型在训练分布之外的表现能力。
  23. HAM10000:Human Against Machine with 10000 training images,本挑战赛 Task 3 训练集本体。
  24. MEL / NV / BCC / AKIEC / BKL / DF / VASC:7 类疾病代码(黑色素瘤/痣/基底细胞癌/光化性角化病/良性角化病/皮肤纤维瘤/血管性病变)。
  25. 组织病理 / histopathology:金标准诊断方式,恶性病变均经此确认。
  26. 反射共聚焦显微镜:一种无创在体成像确认手段。
  27. ViDIR Group:维也纳医科大学皮肤科研究组,HAM10000 主要来源。
  28. CC-0:公共领域许可,无署名义务。
  29. CC-BY-NC:署名 + 非商业使用许可。
  30. 读片研究 / reader study:组织人类读者与算法对比诊断性能的研究设计。

附录

附录 A:与库内 isic-2019(rid 707) / ham10000(rid 60) 的分工声明

库内条目 关系 本条目职责 该条目职责
ham10000(rid 60) Task 3 训练集本体 赛事组织、评分、排行榜、影响 图像采集、清洗、多源整合、标签体系、伦理
isic-2019(rid 707) 下一届赛事 2018 届三任务与指标 2019 届单任务、8 类、三源聚合
isic-archive(rid 56) 长期档案库/API 2018 届特定赛事数据 全 ISIC 图像库与 API 接口
BCN20000(rid 161) 无关(防误链) 明确声明 2018 届未使用 2019 届才并入的巴塞罗那源

声明:凡图像本体细节(采集设备、清洗流程、去重、lesion_id、患者伦理)以 ham10000(rid 60) 为准;凡 2019 届赛事细节以 isic-2019(rid 707) 为准;本条目不重复这些内容,只承担 2018 届赛事视角。

附录 A-2:本条目独有内容清单

为避免与 ham10000 条目重复,以下内容确认为 ISIC 2018 条目独有(不得在 ham10000 条目复制):

  1. Task 1 的 2,594 图 + 12,970 张分割掩码(含每图 5 标注的设计)。
  2. Task 2 的 5 类属性掩码与 SLIC 超像素标注流程。
  3. thresholded Jaccard 的定义、0.65 阈值推导与失败率概念。
  4. Task 3 到 7 类诊断映射与 balanced accuracy 的选择理由。
  5. 官方排行榜(66 行)与三任务冠军分数。
  6. 900 注册 / 115-25-159 提交的参与规模数据。
  7. 人机对比读片研究(511 读者 vs 139 算法)的全部结果。
  8. 提交规则(每任务 3 方案、须交方法论文)。
  9. 三任务与 ISIC 2019/Archive/BCN20000 的届次与托管关系。
  10. 赛事时间线(2018-07-27 截止 / 2018-09-20 颁奖 / 2019-02-09 论文)。

附录 B:DAIMS 评估全表

DAIMS(Data Asset Improvement Maturity Score,数据资产成熟度)五维评估:

维度 评分 依据
发现性(Discoverability) 5/5 专属赛事域名、ISIC Archive 长期托管、DOI 可引、API 可程序化发现
可访问性(Accessibility) 5/5 官方 data 页直接下载、ISC Archive API、长期 Pinned 保留、无审批门槛
可用性(Usability) 5/5 统一命名、标准 JPEG/PNG/CSV、掩码与图尺寸严格对齐、元数据齐备
互操作性(Interoperability) 4/5 ISIC ID 跨届稳定;但三任务数据包结构不一、Task3 与 HAM10000 重合需辨析
溯源透明度(Provenance) 4/5 采集机构、伦理批号、真值方式透明;Task1/2 掩码生成三法仅概略描述,逐图来源未披露

综合:4.6/5 —— 高成熟度,主要折损在跨任务结构一致性与逐图标注溯源粒度。

附录 C:逐项证据链自证

事实 来源
三任务名称与截止日 challenge2018.isic-archive.com(官方页)
12,500 合计、900 注册、115/25/159 提交 arXiv:1902.03368 摘要
Task1 训练 2,594、掩码 12,970、thresholded Jaccard 0.65 ISIC Archive 集合页 + 官方 Task 1 页
Task3 训练 10,015、7 类、balanced accuracy 官方 Task 3 页 + ISIC Archive 集合页
7 类分布(6705/1113/1099/514/327/142/115) HAM10000 论文 Table 1(Sci Data 5:180161)
冠军 0.802 / 0.473 / 0.885 challenge.isic-archive.com/leaderboards/2018/
CC-0 / CC-BY-NC 分层 官方 data 表(ADS 引口径)
511 读者 / 139 算法 / 18.78 vs 25.43 Lancet Oncology 2019 摘要(S1470-2045(19)30333-X)
图像命名与 EXIF 清除 官方 Task 页
伦理批号 HAM10000 论文正文

附录 D:双口径登记表

项目 口径 A 口径 B 采信
规模表述 “over 12,500 images”(论文摘要) 分任务计数(Task1/2 3,694 + Task3 11,527) 正文两口径并列;12,500 为三任务合计概数
图像分辨率 600×450 450×600 判为书写方向差异,同值
Task3 测试集 1,512(官方/Archive) 1,511(Dataverse/读片研究) 正文标注 1,512 主线,1,511 存照
Task1 验证/测试 100/1,000(官方任务页+论文) Archive 集合页 Validation 1,000 采信官方任务页与论文
被引次数 2,591 2,613(Google Scholar 两镜像页) 仅生态段提及"约 2,600+",非硬事实
Task3 提交数 159(论文摘要) 141(二次页) 采信论文摘要,二次口径存照

附录 E:检索决策树

  1. 你要的是图像本体(采集/清洗/标签)? → ham10000(rid 60)
  2. 你要的是2018 届三任务数据包与协议? → 本条目 §2–§4
  3. 你要的是下一届更大分类集? → isic-2019(rid 707)
  4. 你要的是全 ISIC 图像库/API? → isic-archive(rid 56)
  5. 你要的是人机对比设计与数据? → 本条目 §7.4 + Lancet Oncology 2019

附录 F:三个主指标的计算骨架

# Task 1: thresholded Jaccard
for each image:
    j = |pred ∩ gt| / |pred ∪ gt|
    score_i = 0 if j < 0.65 else j
final = mean(score_i)

# Task 2: dataset-level pixel Jaccard (all images resized to 256x256)
TP = sum of pixels where pred==1 and gt==1   # across dataset
FP = sum where pred==1 and gt==0
FN = sum where pred==0 and gt==1
Jaccard = TP / (TP + FP + FN)

# Task 3: balanced multi-class accuracy
per_class_recall_c = correct_c / total_c
final = mean(per_class_recall_c for c in 7 classes)

附录 G:ISIC 赛事年表

届次 年份 任务 训练规模 测试规模 类别数
ISIC 2016 2016 二分类 900 379 2
ISIC 2017 2017 分割 + 三分类 2,000 600 3
ISIC 2018 2018 分割 + 属性 + 七分类 2,594 / 10,015 1,000 / 1,512 7
ISIC 2019 2019 八分类 25,331 8,238 8(含 UNK)
ISIC 2020 2020 二分类 33,126 — 2
ISIC 2024 2024 二分类 33,126 — 2

附录 H:条目信息速查卡

  • slug:isic-2018
  • 类:挑战赛数据集(皮肤影像)
  • 三元:ISIC 2018(赛事)/HAM10000(Task 3 训练本体)/isic-2019(下届)
  • 许可:Task1/2 CC-0|Task3 CC-BY-NC
  • 稳态引用:arXiv:1902.03368
  • 互链:ham10000(60)、isic-2019(707)、isic-archive(56)

附录 I:待核疑点登记

  1. HAM10000 精确患者数:论文用 lesion_id 追踪多图病灶,无单一患者硬数字。
  2. Task 2 测试集图数:官方页未单列。
  3. Task 3 官方 validation(赛时 1,512)赛后是否直接并入测试公开:各源表述不一。
  4. 读片研究算法数 139 vs 挑战赛 Task3 提交 159:统计对象不同(合格子集),未获官方逐条映射。
  5. Task 1/2 掩码"三法生成"的逐图来源分布:官方未披露。

附录 J:维护计划与触发点

  • 触发点 1:ISIC 发布新一届挑战赛 → 更新附录 G 年表与 §7.5 对照。
  • 触发点 2:ISIC Archive 变更 2018 集合 DOI/许可 → 更新 §6。
  • 触发点 3:出现官方更正 Task3 测试集规模(1,511 vs 1,512)的公告 → 更新附录 D。
  • 触发点 4:库内新增 isic-2016/isic-2017/isic-2020 条目 → 补充 §8.4 互链。

附录 K:Task 3 官方 CSV 响应格式示例

image,MEL,NV,BCC,AKIEC,BKL,DF,VASC
ISIC_0024306,0.02,0.91,0.01,0.01,0.03,0.01,0.01
ISIC_0024307,0.87,0.05,0.03,0.02,0.02,0.01,0.00
...

要点:每行一个图像;8 列;置信度 [0,1];0.5 为分类阈值;每个图实际只含一种疾病,但置信度可独立取值。sigmoid 变换 1/(1+e^(-(a(x-b)))) 可将任意分数区间映射到 [0,1]。

附录 L:Task 2 五个属性的临床含义速查

属性名 掩码后缀 形态 常见提示
pigment network pigment_network 网状色素结构 痣的典型特征
negative network negative_network 反向明暗网眼 部分黑色素瘤
streaks streaks 放射状/假足样条纹 黑色素瘤警示征
milia-like cysts milia_like_cyst 白色圆点 脂溢性角化病
globules globules 圆形色素团(含 dots) 各类色素性病变

附录 M:读片研究关键数字总表

指标 人类 算法 差异
全体平均答对(30 题) 17.91(SD 3.42) 19.92(SD 4.27) +2.01(95% CI 1.97–2.04;p<0.0001)
>10 年经验专家 vs 前三算法 18.78(SD 3.15) 25.43(SD 1.95) +6.65(95% CI 6.06–7.25;p<0.0001)
分布外图像表现下降 11.4%(95% CI 9.9–12.9) 3.6%(0.8–6.3) —(p<0.0001)

读者构成:511 人 / 63 国;283(55.4%)认证皮肤科医生、118(23.1%)住院医、83(16.2%)全科;每人随机 30 张(自 1,511 张抽)。算法侧:139 算法 / 77 实验室。

附录 N:Dataset 元数据字段与 cr:RecordSet key 说明

  • key:ISIC 图片编号(ISIC_xxxxxxx)——7 位唯一标识,跨任务与跨届稳定。
  • Task 1 记录:image(JPEG)+ segmentation mask(PNG)。
  • Task 2 记录:image(JPEG)+ 5 属性 mask(PNG)。
  • Task 3 记录:image(JPEG)+ 7 类置信度向量(CSV)+ 元数据(age/sex/localization/lesion_id)。

附录 O:皮肤影像数据集景观横向对照

数据集 年份 规模 模态 定位
PH2 2013 200 皮肤镜 早期小规模基准
ISIC 2017 2017 2,750 皮肤镜 三分类
HAM10000/ISIC 2018 2018 10,015(分类)/ 2,594(分割) 皮肤镜 本条目
BCN20000 2019 12,413 皮肤镜 非受控采集多样性
ISIC 2019 2019 25,331 皮肤镜 八分类聚合
ISIC 2020 2020 33,126 皮肤镜(DICOM) 患者级划分
PAD-UFES-20 2020 2,298 智能手机临床 临床照片
Derm7pt 2018 1,011 皮肤镜 7 点检查法

附录 P:许可条款细读

CC-0(Task 1/2):著作权人放弃全部权利,作品进入公共领域。可自由复制、修改、分发、商用,无署名义务。学术惯例建议仍注明来源。

CC-BY-NC(Task 3):允许复制、分发、改编,须满足两个条件——(1)署名(Attribution):须注明创作者,且本数据集要求分别注明 HAM10000 与 MSK 两个底层来源;(2)非商业(NonCommercial):不得用于商业目的。注意:NC 限定意味着不得将 ISIC 2018 Task 3 数据用于商业 AI 产品训练,这是企业使用时的关键限制。

附录 Q:坑点档案(与 §9 对照)

坑号 一句话 关联章节
坑 1 ISIC 2018 ≠ HAM10000 别名 §5.1
坑 2 ISIC 2018 ≠ ISIC 2019 §5.2
坑 3 12,500 是三任务合计 §2.1
坑 4 测试集 1,511 vs 1,512 口径 附录 D
坑 5 许可分层 CC-0 / CC-BY-NC §6.1
坑 6 Task 3 署名须含两源 §6.1、附录 P
坑 7 自切分高分 ≠ 官方基准分 §7.2
坑 8 Task 2 难在真值噪声 §3.2、§4.6
坑 9 0.65 阈值有来历 §3.1
坑 10 只看平均分忽略失败率 §4.4

附录 R:本条目编写所依据的一手来源

  1. 官方赛事主页(含排行榜):https://challenge2018.isic-archive.com/
  2. 官方任务页:https://challenge.isic-archive.com/landing/2018/45|46|47/
  3. 官方数据页:https://challenge.isic-archive.com/data/
  4. 总结论文:arXiv:1902.03368(v1 2019-02-09 / v2 2019-03-29)
  5. HAM10000 数据本体论文:Sci Data 5:180161(doi:10.1038/sdata.2018.161)
  6. 读片研究:Lancet Oncology 2019(doi:10.1016/S1470-2045(19)30333-X)
  7. ISIC Archive 集合页:https://api.isic-archive.com/collections

附录 S:Task 1 排行榜前 15 名存档(thresholded Jaccard)

排名 团队/方案 分数 用外部数据
1 MT(MaskRcnn2+segmentation) 0.802 否
2 Holidayburned(ensemble_with_CRF_v3) 0.799 否
3 imsight(DCNN 自动分割) 0.799 否
4 Tencent Youtu Lab(对抗学习) 0.798 否
5 NMN_team(ensemble) 0.796 否
6 GPM-UC3M(SR FCN Init 2) 0.788 否
7 Andrey Sorokin(Mask-RCNN + SGD) 0.779 否
8 DC(maskrcnn) 0.777 否
9 Weill Cornell Medicine(Deep Unet) 0.773 是
10 Opsins(迁移学习 CNN) 0.771 否
11 DAISYLab(四模型集成) 0.769 是
12 SJTU_MJTC(注意力引导融合) 0.765 否
13 重庆绿色智能技术研究院(FCN+CRF) 0.761 否
14 Manu Goyal 0.760 否
15 Le-Health(多尺度 PSPNet) 0.758 否

(榜单共 66 行,尾部队伍的分数落在 0.5–0.7 区间,含若干传统方法与简单 U-Net 变体。)

附录 T:常见任务与对应官方资源入口

你的任务 数据 格式要求 评分资源
皮肤病变分割 Task 1(2,594+掩码) PNG 单通道二值,同尺寸,单连通 thresholded Jaccard
皮肤镜属性检测 Task 2(2,594+5属性掩码) PNG 单通道二值,属性可非连通 数据集级 Jaccard(256²)
皮肤病变分类 Task 3(10,015 训练) CSV 8 列,置信度 [0,1],阈值 0.5 balanced accuracy + AUC
人机对比研究 Task 3 测试集(1,512/1,511) 7 类诊断 参见 Lancet Oncology 设计

附录 U:一句话记忆卡

  • 三任务:分割(在哪)、属性(长啥样)、分类(是什么)。
  • 两套数据:Task1/2 = 2,594 训练 + CC-0;Task3 = 10,015 训练 + CC-BY-NC。
  • 两个指标:thresholded Jaccard(0.65);balanced accuracy。
  • 两个数:冠军 0.802 / 0.473 / 0.885;读者 511 vs 算法 139。
  • 一组关系:ISIC 2018(赛事)= HAM10000(数据本体)的来源挑战赛;ISIC 2019 是下一届。
  • 一句结论:算法赢了人类,但败给了分布外的世界。

附录 V:写给三类读者的行动清单

给数据工程师:

  1. 先确认你要的是哪套数据(Task1/2 还是 Task3)。
  2. 核对许可(Task3 是 CC-BY-NC,勿商用)。
  3. 检查 lesion_id,切分时分组。
  4. 校验掩码与图像尺寸是否一致(Task1/2)。

给算法研究者:

  1. 分类用 balanced accuracy,与官方对齐。
  2. 分割报告失败率,不只看平均 Jaccard。
  3. 属性任务预期天花板低,考虑不确定性建模。
  4. 跨源验证泛化,别只信同分布高分。

给临床/转化研究者:

  1. 记住 ISIC 2018 数据分布是"修正过的真实世界",非真实患病率。
  2. 人机对比结论要连同 OOD 局限一起引用。
  3. 关注后续 Nature Medicine 人机协作研究的设计。
  4. 商用部署前复核 CC-BY-NC 限制。

附录 W:本条目自评与已知不足

  • 数据本体叙述深度:为遵守与 ham10000(rid 60) 的分工,本条目刻意未展开图像采集与清洗细节;若读者需要完整数据本体知识,须跳转该条目。
  • 患者级统计:论文未给出单一患者数硬数字,本条目按"存照"处理,未强行给出估计值。
  • Task 2 测试集规模:官方页与 Archive 均未单列,本条目如实标注为遗留疑点。
  • 引用次数:Google Scholar 两个镜像页数字不一致,本条目仅在生态段作"约 2,600+"的模糊表述。
  • 排行榜完整性:Task 1 仅存档前 15 名与榜尾特征,完整 66 行可在官方页复查。

附录 X:条目元信息

  • slug:isic-2018
  • 代理:agent-b-isic2018
  • 抓取时点:2026-09-28
  • 一手来源数:7 类(官方页 3 + 论文 3 + Archive API 1)
  • 三源互证:官方 challenge 页 / arXiv:1902.03368 / ISIC Archive 集合页——核心数字(2,594、10,015、1,512、7 类、0.885)三源一致
  • 双口径存照数:6 条(见附录 D)
  • 遗留疑点:5 条(见附录 I)
  • 许可分层:2 种(CC-0 / CC-BY-NC)
  • 建议互链:ham10000(60) / isic-2019(707) / isic-archive(56) / BCN20000(161,防误链)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ph2 — 共享标签:医学影像 / 皮肤影像 / 医学图像分割 / 图像分类 / 皮肤癌
  • dfuc-2024 — 共享标签:医学影像 / 皮肤影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
  • isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 皮肤癌
  • isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 皮肤癌
  • isic-archive — 共享标签:医学影像 / 皮肤影像 / 挑战赛数据集 / 皮肤癌
  • puma — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 皮肤癌
  • skincon — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
  • bcn20000 — 共享标签:医学影像 / 皮肤影像 / 皮肤癌
  • selma3d — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
  • med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集