ISIC 2019 Challenge (isic-2019) — AI-Ready Wikipedia

ISIC 第 4 届皮肤镜病变分类挑战赛:25,331 张训练图 + 8,238 张含未知类测试图、balanced accuracy 主指标与 4,000 美元奖金,冠军 Gessert 团队多分辨率 EfficientNets 集成双任务登顶,训练集图像全部来自 HAM10000/BCN20000/MSK 三个既有数据源

来源 ISIC 2019 Challenge 官方数据包:训练 25,331 张皮肤镜 JPEG(9.1GB)+ 8 类 one-hot ground truth + 测试 8,238 张 JPEG(3.6GB)+ 测试 GT(454KB,含评分权重)+ 训练/测试 metadata(年龄/性别/部位/lesion ID);图像来源 BCN20000 + HAM10000 + MSK 三源聚合发布时间: 2026-09-28最后更新: 2026-09-28 阅读 15
ISIC 2019 Challenge (isic-2019) — AI-Ready Wikipedia

信息速览

数据集名称ISIC 2019 Challenge (isic-2019) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模训练 25,331 张图像(唯一 lesion ID 11,848 个)+ 测试 8,238 张;患者级人数官方未公布
接入方式ISIC 2019 Challenge 官方数据包:训练 25,331 张皮肤镜 JPEG(9.1GB)+ 8 类 one-hot ground truth + 测试 8,238 张 JPEG(3.6GB)+ 测试 GT(454KB,含评分权重)+ 训练/测试 metadata(年龄/性别/部位/lesion ID);图像来源 BCN20000 + HAM10000 + MSK 三源聚合
AI 就绪度

INFOBOX — ISIC 2019 Challenge 一屏速览

维度 内容
本质 ISIC 主办的第 4 届皮肤镜病变分类挑战赛(2016/2017/2018/2019 序列之 2019 届);本条目是挑战赛条目,不是独立新图像数据集
任务 皮肤镜图像九类分类:8 个训练类 + 测试集专属 UNK 未知类;双赛道 Task 1(仅图像)/ Task 2(图像+metadata)
数据 训练 25,331 张(8 类)+ 测试 8,238 张(9 类);分辨率 450×600 至 1024×1024
来源 HAM10000 10,015 + BCN20000 12,413 + MSK ≈2,903(倒推口径)——全部为既有图像,无新采集
类别分布 NV 12,875(50.8%)> MEL 4,522 > BCC 3,323 > BKL 2,624 > AK 867 > SCC 628 > VASC 253 > DF 239
主指标 balanced multi-class accuracy(=各类 sensitivity 的算术平均);平局以 AUC 打破
时间线 测试图计划 2019-08-02 发布 → Task 1 截止 2019-08-16 → Task 2 截止 2019-08-23 → 获奖在 MICCAI 2019 深圳工作坊节点公布
奖金 每赛道前三名 $4,000/$2,000/$1,000(Canfield Scientific 提供)
冠军 Gessert 等(汉堡工业大学+UKE):多分辨率 EfficientNets 集成,Task 1 BA 63.6% / Task 2 BA 63.4%,双任务第一
license CC-BY-NC;署名须分别注明 BCN/HAM/MSK 三源(MSK 源匿名但署名句不可省)
基准地位 皮肤镜分类引用最广的公开基准之一;官方排行榜持续开放(2024 live 榜 64 队)
库内互链 isic-archive(rid 56)、ham10000(rid 60)、bcn20000(rid 161)——数据本体细节以这三条为准

ISIC 2019 Challenge 是皮肤影像 AI 领域的"成人礼"节点:它把前一年 HAM10000 带来的 10,015 张图像一下子扩到 25,331 张,把分类体系从 7 类扩到 8 类,更关键的是在测试集里埋进了一个训练集中从未出现过的"未知类"(UNK,None of the others),强迫参赛系统从"闭集分类器"进化为"能说不知道的开放集系统"。冠军团队 Gessert 等人用多分辨率 EfficientNets 集成拿下双任务第一(官方测试集 balanced accuracy 63.6%/63.4%),而这个 63.6% 与后续文献自切分动辄 0.92-0.95 的 accuracy 之间的巨大落差,正是这条基准留给领域的最重要提醒:医学影像分类的真实难度,只有在官方协议下才看得清。

需要特别声明的是本条目的定位与分工:ISIC 2019 训练集的图像全部来自三个既有数据源——HAM10000(库内 rid 60)、BCN20000(库内 rid 161)与 MSK 系图像(其主库已由库内 isic-archive 条目 rid 56 覆盖),本条目不重复展开数据采集与标注细节,聚焦挑战赛事件本身:任务设计、评估协议、时间线、冠军方法与基准演化。想下载图像本体或了解 HAM10000/BCN20000 的采集故事,请走 §9 的库内互链。

导语读法三则:

  1. 只想下数据跑基线:直奔 §6 获取与许可——注意 CC-BY-NC 的三源分别署名要求,以及"官方测试集 vs 自切分"的坑 6。
  2. 关心挑战赛设计与冠军方法:直奔 §3(协议与指标)与 §4(冠军方法解剖)——UNK 未知类协议与 loss balancing 是本届两大方法学遗产。
  3. 担心撞库重复:直奔 §5 分工声明——训练集 88.5% 图像已在库内 ham10000/bcn20000 条目收录,本条目按"独立挑战赛条目"成稿的理由与边界都在那里。

§0 导读:这个挑战赛解决什么问题

皮肤癌是全球最常见的癌症,黑色素瘤(melanoma)是其中最致命的形态。皮肤镜(dermoscopy)作为改良的皮肤成像模态,已被证明比裸眼视诊更能提升皮肤癌诊断水平,但前提是临床医生接受过充分训练。为了让这种专长更广泛地可用,国际皮肤影像协作组(ISIC)建设了 ISIC Archive——一个国际性的皮肤镜图像库,既用于临床培训,也通过主办 ISIC 挑战赛支持自动化算法分析研究。这就是 2016-2024 年 ISIC 系列挑战赛的出发点,2019 届是其中的第 4 届。

2019 届要解决的问题有三层。第一层是规模与多样性:2018 届训练集(=HAM10000 全集)只有单一欧洲中心的 10,015 张图像,2019 届把巴塞罗那 BCN20000 的"野外"(in the wild)多设备图像并入,训练集扩到 25,331 张、三个来源中心,图像分辨率跨度从 450×600 到 1024×1024,更贴近真实临床的设备异质性。第二层是类别体系:在 2018 届 7 类基础上新增鳞状细胞癌(SCC,628 张),使恶性病变覆盖从"黑色素瘤 vs 痣"扩展到"黑色素瘤+鳞癌+基底细胞癌"三大皮肤恶性肿瘤。第三层是评估哲学:主指标从往届的二分类敏感度/特异度改为 balanced multi-class accuracy(各类敏感度的算术平均),官方理由是这"更接近皮肤科医生的真实评估";同时在测试集加入训练中不存在的 UNK 类,把"识别超出训练分布的病变"正式写进比赛协议。

§0 读法三则:

  1. 这个条目是"挑战赛事件+数据包+基准协议"三合一:事件层讲 2019 年夏天的比赛怎么打(§3/§4),数据层讲 25,331 张图怎么构成(§2),协议层讲 balanced accuracy 与 UNK 如何改变领域评测习惯(§3/§7)——三层各有独立检索价值。
  2. 全文硬数字均出自官方页面、冠军论文与三篇独立分析论文(MMU/IET/Frontiers),核心数字(25,331/8,238/类别分布)已达四源互证;双口径冲突逐条在坑点与存照节登记。
  3. 检索时最容易犯的错是把 ISIC 2019 当作一个"独立新数据集"去下载收录——训练集 88.5% 的图像已在库内 ham10000/bcn20000 两条目中(坑 1);其次是把文献自切分的 0.92+ accuracy 与官方测试集 63.6% 混为一谈(坑 6)。

为什么值得单独立条目:有人会问——图像都是既有的,比赛打完了,凭什么占一个条目?三个理由。其一,协议是一次性设计出来的公共品:balanced accuracy 的"医生视角"定义、UNK 开放集陷阱、防刷榜的验证分机制、开源评分代码,这四件套只存在于挑战赛事件里,任何一条数据集条目都承载不了。其二,排行榜是活的:官方 2019 榜重开为 live 榜后仍在接受提交,冠军五年未被公开超越——这个"基准的寿命"本身是事件属性。其三,口径混乱需要一个仲裁文本:63.6% vs 0.92+ 的落差每年都在制造错误对比表,本条目 §7.3/§8/附录 Q 就是为此而写的。

§1 数据集速览:十问十答

Q1:ISIC 2019 到底是"数据集"还是"比赛"?
两者都是,但本体是比赛。ISIC 2019 Challenge 于 2019 年举办,围绕一份 25,331 张训练图像 + 8,238 张测试图像的数据包展开;比赛结束后数据包成为公共基准长期被引用。本条目按"挑战赛条目"收录:比赛协议、时间线、冠军与基准演化是主内容,图像本体的采集细节以库内 ham10000/bcn20000/isic-archive 三条目为准(§5 分工声明)。

Q2:训练集 25,331 张图像从哪来?
三个既有来源聚合:HAM10000(维也纳 ViDIR 组,10,015 张,即 2018 届训练集全集)、BCN20000(巴塞罗那 Hospital Clínic,MMU 分析口径 12,413 张)、MSK 系(纪念斯隆-凯特琳,约 2,903 张,倒推口径)。没有任何为 2019 届新采集的图像——这也是"撞库"问题的根源(§5)。

Q3:分几类?
训练集 8 类(MEL 黑色素瘤 / NV 黑色素细胞痣 / BCC 基底细胞癌 / AK 光化性角化病 / BKL 良性角化病 / DF 皮肤纤维瘤 / VASC 血管病变 / SCC 鳞状细胞癌),ground truth CSV 为 8 列 one-hot。测试集 9 类——多出的第 9 类 UNK(None of the others)只出现在测试集,是官方埋的"训练分布外"陷阱。Kaggle 镜像页写"9 classes"指的是任务口径,不代表训练集有 9 列标签(坑 2)。

Q4:类别分布有多不均衡?
NV 12,875 张(50.8%)一家独大;MEL 4,522、BCC 3,323、BKL 2,624 居中;AK 867、SCC 628、VASC 253、DF 239 构成长尾。最大最小类样本比约 54:1——这正是官方把主指标从 accuracy 换成 balanced accuracy 的直接原因。

Q5:metadata 有什么?
训练 metadata 含年龄(age_approx)、性别、解剖部位、lesion ID(23,247 张有值、2,084 张缺失;唯一 ID 11,848 个);测试 metadata 只有年龄/性别/部位。lesion ID 意味着同一病变可能有多张不同放大倍率的图像(multiplets),这既是特色(多尺度信息)也是陷阱(随机切分泄漏,坑 10)。

Q6:怎么评分?
主指标 balanced multi-class accuracy:先算每类的 sensitivity(TP/positives),再对 8 个(或含 UNK 时相应)类别取算术平均——语义上等价 average recall。平局以 AUC 打破。官方还计算 sensitivity/specificity/accuracy/AUC/mAP/F1/AUC80/PPV/NPV 等全套指标用于科学分析,但排名与颁奖只看 balanced accuracy。评分代码 isic-challenge-scoring 开源可审计。

Q7:2019 年的比赛怎么打的?
测试图像计划 2019 年 8 月 2 日发布;Task 1(仅图像)截止 8 月 16 日,Task 2(图像+metadata)截止 8 月 23 日(测试 metadata 8 月 16 日放出后才有条件参赛);参赛者除预测结果外必须提交方法论文链接;奖金(每赛道 $4,000/$2,000/$1,000)在 2019 年 10 月深圳 MICCAI 工作坊节点后发放。

Q8:谁赢了?
Nils Gessert 等 5 人(汉堡工业大学+汉堡-埃彭多夫大学医学中心),方法是多分辨率 EfficientNets 集成:Task 1 balanced accuracy 63.6%、Task 2 63.4%,双任务第一(其论文 arXiv:1910.03910 官方备注 “First place”)。该团队即 2024 年 live leaderboard 第一名 DAISYLab 的同一机构。2024 年重开的 live 榜上第二名 DysionAI(北京鼎视智慧)是当年表现最好的中国团队之一。

Q9:官方成绩 63.6%,文献里动辄 0.92+,信谁的?
都信,但别混。63.6% 是官方测试集(含 UNK、balanced accuracy、无验证调参机会)的成绩;0.92-0.95 是后续论文在训练集内自切分、按 accuracy/macro-F1 报告的成绩。切分不同、指标不同、UNK 处理不同——三重不可比(坑 6)。要看真实泛化差距,只有官方协议口径。

Q10:现在还能拿到什么?
官方 data 页仍在:训练 JPEG(9.1GB)+ 训练 GT(1MB)+ 测试 JPEG(3.6GB)+ 测试 GT(454KB,含评分权重)+ 训练/测试 metadata;ISIC Archive API 同源可得。第三方 Kaggle 有镜像(注意 license 误标坑 9)。license 为 CC-BY-NC,署名须分别注明三个来源(坑 7)。

§2 数据构成与规格

2.1 三源聚合:25,331 张的来龙去脉

ISIC 2019 训练集不是一个"采集"出来的数据集,而是一个"聚合"出来的数据包。三个来源的角色与贡献如下:

来源 归属机构 进入 2019 训练集张数 口径说明
HAM10000 维也纳医科大学 ViDIR 组 10,015(全集) 即 2018 届训练集原封不动并入;Sci Data 2018 论文口径
BCN20000 巴塞罗那 Hospital Clínic 皮肤科 12,413 MMU 分析口径(Sci Dir 2021);BCN 官方论文写"19,424 张进入 2019+2020 合并集",两口径不可直接对表(存照)
MSK 系 纪念斯隆-凯特琳癌症中心(匿名署名) ≈2,903(倒推) =25,331−10,015−12,413;主要为 2017/2018 届已用 MSK 图像(MSK-1/2/3/4/5 系合计 2,918,差 15 张,子集归属口径未明)
合计 — 25,331 与官方数字精确一致

这张表是理解本条目的钥匙:2019 届的"增量"其实只有 BCN20000 的并入选取与 SCC 类标签,图像本体都是既有的。也因此,"下载 ISIC 2019 训练集"这个动作对已经拥有 HAM10000 与 BCN20000 的团队来说,新增内容仅约 2,903 张 MSK 图与统一的 8 类标签体系。

测试集 8,238 张的来源官方未逐源公布;按官方描述其中埋入了不属于 8 个训练类的异类图像(UNK),文献分析指出这类异类图像主要可由 SD-198 等非皮肤镜/非八类数据集代表(arXiv:2101.03814 作者自述其 UNK 训练数据"主要来自 SD-198")。

2.2 训练类别分布:一张表看懂长尾

四源互证(MMU Sci Dir 2021 表 3、MDPI Appl. Sci. 2022 表 1、IET CV 2023 百分比、Frontiers Med 2026)的 8 类分布如下:

类别缩写 英文全称 中文 张数 占比
NV Melanocytic nevus 黑色素细胞痣 12,875 50.8%
MEL Melanoma 黑色素瘤 4,522 17.8%
BCC Basal cell carcinoma 基底细胞癌 3,323 13.1%
BKL Benign keratosis 良性角化病(日光性黑子/脂溢性角化病/扁平苔藓样角化病) 2,624 10.4%
AK Actinic keratosis 光化性角化病 867 3.4%
SCC Squamous cell carcinoma 鳞状细胞癌 628 2.5%
VASC Vascular lesion 血管病变 253 1.0%
DF Dermatofibroma 皮肤纤维瘤 239 0.9%
合计 — — 25,331 100%

三个结构性观察:第一,良性主力 NV 占半壁江山,任何 accuracy 指标都会被它主导——这是官方弃用 accuracy 的统计学根据。第二,三大皮肤恶性肿瘤(MEL/BCC/SCC)合计 8,473 张(33.4%),恶性样本并不稀少,稀少的是 VASC/DF 这类"少见但良性"的类别——balanced accuracy 对它们的惩罚最重。第三,与 2018 届对比:7 类保留(MEL 1,113→4,522 等均大幅扩容),新增 SCC 628 张;2018 届的 514 张 BCC、327 张 AK 等在 2019 中按来源被扩容替代,逐年数字不可按"同名单纯加图"理解。

一个直观算例说明 balanced accuracy 为何"更严":设想一个只预测 NV 的退化模型,accuracy 可拿 50.8%(全猜最大类),而 balanced accuracy 只剩 1/8≈12.5%(其余 7 类敏感度全为 0)。反过来,一个把 NV 全对但 DF/VASC 全错的强模型,accuracy 可超 0.9,balanced accuracy 却封顶在 7/8=87.5% 再打折——官方用这个指标强行把"少见类"抬回评分视野,这正是"更接近医生真实评估"的数学表达:皮肤科医生不能因为"DF 反正少见"就不认识它。

2.2.0 三来源速览卡(细节见库内对应条目)
  • HAM10000(维也纳):“Skin Cancer MNIST”——多源皮肤镜 10,015 张、600×450 居中裁剪、7 类论文标签体系;2018 届训练集本体;库内 rid 60。
  • BCN20000(巴塞罗那):“dermoscopic lesions in the wild”——多设备非受控采集、含指甲/黏膜等困难部位;2019 届多样性担当;库内 rid 161。
  • MSK 系(纽约,匿名):纪念斯隆-凯特琳的系列皮肤镜采集(MSK-1 至 MSK-5 等子批次),2017/2018 届已部分使用,2019 届继续作为增量来源;仓库层归属库内 rid 56。
2.2.1 八类临床速查表(读数据前先看病)
类 临床要点 镜下典型线索 恶性潜能 处置含义
MEL 黑色素瘤 最致命皮肤癌,转移早 不对称、色斑驳、蓝白幕、不规则条纹 恶性 广泛切除,分期决定预后
NV 黑色素细胞痣 良性痣,人群极常见 色素网均匀、对称、边界清 良性(部分为发育不良痣,随访) 常规随访
BCC 基底细胞癌 最常见皮肤恶性肿瘤,转移罕见但局部破坏 树枝状血管、溃疡、珍珠样结构 局部恶性 局部切除/消融
AK 光化性角化病 日光相关癌前病变 角化鳞屑、红色角化背景 癌前(可进展为 SCC) 冷冻/外用药
BKL 良性角化病 合并类:日光性黑子/脂溢性角化病/扁平苔藓样角化病 粉刺样开口、脑回样结构 良性 无需处理或美容性去除
DF 皮肤纤维瘤 良性纤维组织细胞反应 中央白斑、色素晕 良性 无需处理
VASC 血管病变 血管瘤/血管角皮瘤等 紫红色腔隙、樱桃红点 良性 无需处理
SCC 鳞状细胞癌 第二常见皮肤恶性肿瘤 角化过度、溃疡、多形血管 恶性 切除+分级随访

两个数据-临床联动提醒:其一,BKL 是"三病合一"的合并类——这是 2019 届为平衡类别数做的取舍,意味着模型对 BKL 的预测不可直接当单一疾病诊断用;其二,AK(癌前)与 SCC(恶性)在临床上是一个进展谱系,二者合计仅 1,495 张——官方测试集里模型在这两类上的混淆正是 balanced accuracy 被压低的主要来源之一。

2.3 图像规格与 metadata

  • 格式与体量:JPEG;训练包 9.1GB(25,331 张),测试包 3.6GB(8,238 张)
  • 分辨率:450×600 至 1024×1024(IET 口径)——跨度近 4 倍的分辨率异质性是 2019 届的显著特征,冠军方法专门用"多分辨率输入+多种裁剪策略"回应(§4)
  • 训练 metadata(Task 2 用):age_approx(近似年龄)、sex、anatom_site_general(解剖部位)、lesion_id
    • lesion_id 有值 23,247 张、缺失 2,084 张;唯一 lesion ID 11,848 个(MMU 口径)
    • 同一 lesion ID 下的多张图像是同一病变在不同时间/放大倍率的拍摄(multiplets)——官方明言这是数据集特色:“包括在不同放大级别下呈现同一病变的多倍图,可能在不同放大级别提供重要的独特特征”
  • 测试 metadata:age_approx、sex、anatom_site_general;无 lesion_id
  • ground truth 格式:训练 8 列 one-hot(MEL,NV,BCC,AK,BKL,DF,VASC,SCC);测试 GT 454KB,官方注明"Includes the scoring and validation weights"(含评分与验证权重)
2.3.1 metadata 字段字典与缺失画像
字段 数据类型 取值/范围 缺失情况 建模提示
image 字符串 ISIC_xxxxxxx(跨包稳定键) 无缺失 主键;去重与跨包映射用
age_approx 分箱数值 0-85 岁近似分箱 存在缺失(测试镜像口径另有 unknown 档) 缺失类别化,勿均值插补
sex 类别 male/female(缺失归 unknown) 存在缺失 类别嵌入
anatom_site_general 类别 anterior/posterior torso、upper/lower extremity、head/neck、palms/soles、oral/genital 等 存在缺失 高基数低频部位可归并
lesion_id 字符串 11,848 唯一值;仅训练集提供 2,084 张缺失 组切分键;同一 ID = 同一病变多图
8 类 one-hot 二值向量 每行恰一列置 1 无 训练标签;测试侧含 UNK 行(8 列全 0)

两个使用要点:其一,metadata 各字段缺失率并不均匀(Kaggle 测试镜像口径:部位缺值约 4%、年龄存在 unknown 档、性别缺值约 4%),用 metadata 建模时缺失模式本身可能携带中心/设备信息,需防"缺失即标签"的伪相关;其二,lesion_id 仅训练侧提供——这意味着"按病变做测试"的严格协议在 2019 包内只能自建(自切分),官方测试协议按图计分,两种粒度的成绩不可互换。

2.4 测试集与 UNK 未知类协议

测试集 8,238 张、9 类口径。UNK(“None of the others”)是官方在挑战赛中埋下的开放集(open-set)陷阱:

  • 官方原文:“the test dataset will contain an additional outlier class not represented in the training data, which developed systems must be able to identify”——测试集将包含一个训练数据中未代表的额外异常类,开发的系统必须能够识别它
  • UNK 张数:官方未单独公布;Frontiers Med 2026 论文口径 2,047 张(单源,存照待核,见 §10 坑 8)
  • 挑战期间测试标签不公开,经自动在线评估系统评分;挑战结束后官方 data 页公开了测试 GT(454KB)——如今任何人可完整复算官方指标
  • 对参赛者而言,UNK 检测的主流做法是用外部数据(如 SD-198 皮肤病临床图集)充当"第 9 类"训练数据——这把"分布外检测(OOD detection)"这个 CV 话题第一次大规模带进医学影像挑战赛

2.5 与 2018/2020 两届的数据关系(版本链)

届 年份 训练 测试 类数 格式/要点
ISBI/ISIC 2016 900 379 2 类 首届,黑色素瘤 vs 痣二分类
ISIC 2017 2,000 600 3 类 加入角化病类
ISIC 2018 10,015(=HAM10000 全集) 1,512 7 类 训练=HAM10000;含分割/检测任务
ISIC 2019 25,331 8,238 8+UNK 三源聚合;+SCC;balanced accuracy 主指标;UNK 协议
ISIC 2020 33,126 10,982 多类+UNK 转 DICOM 嵌入 metadata;patient-centric(患者级切分);2,056 唯一患者
ISIC 2024+ — — — ISIC 2024 挑战(SLICE3D)与 MILK10k 基准(现行官方主推)

2019 届在链条中的独特位置:它是"图像规模三连跳"的中间跳(10,015→25,331→33,126),也是评估哲学的转折点(balanced accuracy+UNK 首次定标)。2020 届吸收了 2019 届 UNK 的教训并进一步把"同一患者多病变"作为防泄漏设计核心(patient-centric 切分)——反证 2019 届 lesion multiplets 的泄漏风险真实存在。

2.6 官方数据包文件字典

文件名 行/张数 字段/结构 用途
ISIC_2019_Training_Input/ 25,331 张 JPEG 命名 ISIC_xxxxxxx.jpg 图像本体
ISIC_2019_Training_GroundTruth.csv 25,331 行 image, MEL, NV, BCC, AK, BKL, DF, VASC, SCC(one-hot) 8 类训练标签
ISIC_2019_Training_Metadata.csv 25,331 行 image, age_approx, anatom_site_general, sex, lesion_id Task 2 训练侧输入
ISIC_2019_Test_Input/ 8,238 张 JPEG 命名 ISIC_xxxxxxx.jpg 测试图像
ISIC_2019_Test_GroundTruth.csv 8,238 行 8 known 列 + UNK 列(挑战后公开,含 scoring/validation weights) 官方复算/复现
ISIC_2019_Test_Metadata.csv 8,238 行 image, age_approx, anatom_site_general, sex Task 2 测试侧输入

字段级提示:age_approx 为近似分箱年龄;anatom_site_general 取值含 anterior torso/posterior torso/upper extremity/lower extremity/head-neck/palms-soles/oral-genital 等,Kaggle 测试镜像口径显示缺值以 “Other/unknown” 形式存在;lesion_id 为字符串 ID,同一病变多图共享。one-hot 行若 8 列全 0 不存在于训练集(训练集每行恰一类),测试集 UNK 行表现为 8 known 列全 0。

§3 挑战赛设计:任务、时间线、指标与奖励

3.1 双赛道任务定义

官方原文:“Two tasks will be available for participation: 1) classify dermoscopic images without meta-data, and 2) classify images with additional available meta-data.”

  • Task 1(仅图像):输入 25,331 张训练图 + 标签,对测试图输出 9 类(8 known+UNK)预测
  • Task 2(图像+metadata):额外使用训练/测试 metadata(年龄/性别/部位,测试集无 lesion_id);测试 metadata 于 2019-08-16 发布,Task 2 截止随之定在 8 月 23 日
  • 约束:Task 2 参与者必须同时提交 Task 1(只打 Task 1 是允许的,反之不行)——保证两赛道成绩可比
  • 强制要求:“each competitor is required to submit a link to a manuscript describing the methods used to generate predictions”——每位参赛者须提交方法论文链接,这是后来冠军论文等一批文献的直接来源
  • 官方页面对 2019 届任务列表有一句自注:“intentionally omit task-listing for 2019, since both tasks are so similar they can be described with just this landing page”——两赛道任务过于相似,共用同一页描述

3.2 时间线(官方口径)

节点 日期 说明
训练数据发布 官方页面未标注 遗留疑点(§9);不晚于 2019 年夏
测试图像发布 计划 2019-08-02 “planned release August 2nd”
测试 metadata 发布 2019-08-16 Task 2 才能启动
Task 1 截止 2019-08-16 与测试 metadata 同日
Task 2 截止 2019-08-23 “August 23th”(官方原文拼写)
成绩/榜单公布 提交期结束后不久 “Final scores and a public leaderboard are released shortly after the conclusion”
获奖/奖金节点 2019 年 10 月 MICCAI 工作坊(深圳)之后 官方:“awarded after the MICCAI Workshop in Shenzhen, China, in October 2019”

3.3 评估指标:balanced multi-class accuracy 的哲学

官方主指标定义(原文口径):

  • 名称:normalized (balanced) multi-class accuracy,“balanced across categories”
  • 定义:“the arithmetic mean of the (<category>_true_positives / <category>_positives) across each of the diagnostic categories”——各类 TP/positives 的算术平均
  • 语义:“This metric is semantically equivalent to the average recall score”(等价于 average recall / macro 平均 sensitivity)
  • 平局处理:“Tied positions will be broken using the area under the receiver operating characteristic curve (AUC) metric”

官方 rationale 值得整段读:临床应用有两个目标——给出具体诊断与治疗方案,以及以合理敏感度/特异度检出皮肤癌;往届挑战聚焦后者(二分类 biopsy vs don’t biopsy),本届要排名更 ambitious 的 normalized multiclass accuracy,“因为它也更接近对皮肤科医生的真实评估”(closer to real evaluation of a dermatologist)。官方还预告该成绩将用于 reader study(医生读片对比研究)。

配套指标体系:官方同时计算 sensitivity、specificity、accuracy、AUC、mAP、F1、AUC80(80%-100% 敏感度区间的 AUC 积分)、PPV、NPV,以及聚合口径(平均 AUC、恶性 vs 良性、分类别 AUC)——但"Participants will be ranked and awards granted based only on the balanced multi-class accuracy metric"(排名与颁奖只看 balanced accuracy)。

验证分机制:所有提交立即获得一个 validation score——基于约 100 张预置的非代表性子集计算,官方明言"not intended to be used for algorithm ranking or evaluation",仅用于格式/标签对齐的 sanity check;参考值:随机提交约 0.3。这个设计防止参赛者把验证子集当代榜刷分。

透明度:官方评分代码 isic-challenge-scoring 以宽松许可开源发布,“to facilitate external auditing”(便于外部审计)——2019 届的评分可复算性在医学挑战赛里属于早期的高标准实践。

3.3.1 balanced accuracy 复算骨架(官方测试 GT 公开后可用)
import pandas as pd
import numpy as np

CLASSES = ["MEL", "NV", "BCC", "AK", "BKL", "DF", "VASC", "SCC", "UNK"]

# y_true: 测试 GT one-hot(挑战后官方公开);y_pred: 提交的 one-hot 预测
y_true = pd.read_csv("ISIC_2019_Test_GroundTruth.csv", index_col=0)[CLASSES]
y_pred = pd.read_csv("submission.csv", index_col=0)[CLASSES]

# 官方定义:各类 TP/positives 的算术平均(语义等价 average recall)
def balanced_accuracy_official(y_true: pd.DataFrame, y_pred: pd.DataFrame) -> float:
    assert (y_pred.sum(axis=1) == 1).all(), "预测须逐行 one-hot"
    per_class = {}
    for c in CLASSES:
        pos = y_true[c] == 1
        tp = (y_pred[c][pos] == 1).sum()
        per_class[c] = tp / pos.sum()          # <category>_true_positives / <category>_positives
    return float(np.mean(list(per_class.values()))), per_class

# 平局判定用 AUC(官方口径),此处从略;完整逻辑以 isic-challenge-scoring 包为准
ba, per_class = balanced_accuracy_official(y_true, y_pred)
print(f"balanced accuracy = {ba:.4f}")
print(pd.Series(per_class).sort_values().round(4))   # 弱类一目了然(通常是 UNK/DF/AK/SCC)

复算要点:预测必须逐行 one-hot(官方提交格式);UNK 列参与平均——一个从不预测 UNK 的系统会在 UNK 类上拿到 0 敏感度,直接损失约 1/9 的指标上限;这正是"敢不敢说不知道"数值化的方式。

3.4 奖励与组织

  • 奖金:每赛道前三名 $4,000 / $2,000 / $1,000(USD),由 Canfield Scientific, Inc. 提供;获奖者须提交税务文件(美国人 W-9 / 非美国人 W-8 BEN)
  • 发放时点:2019 年 10 月深圳 MICCAI 工作坊之后
  • 赞助商:Canfield Scientific、IBM、MetaOptima
  • 组织委员会:
    • Clinical Chairs:Josep Malvehy(巴塞罗那 Hospital Clínic)、Allan Halpern(MSKCC)
    • Computer Vision Chair:Noel C. F. Codella(IBM Research)
    • Co-Chairs:M. Emre Celebi(中阿肯色大学)、Marc Combalia(巴塞罗那)、David Gutman(Emory)、Brian Helba(Kitware)、Harald Kittler(维也纳医科大学)、Veronica Rotemberg(MSKCC)、Philipp Tschandl(维也纳医科大学)
  • 利益规则:组委会成员所属机构不禁止参赛,但须保证提交与委员会成员完全独立
  • IEEE SPS 将该挑战列入其官方 data challenges 列表(Skin Lesion Analysis Towards Melanoma Detection (ISIC 2019))
  • 中国团队表现:北京鼎视智慧(DysionAI/skinreader.cn)2019-08-30 曾以官方 live 榜"基于公开数据"第一名见诸中文报道;其提交在当前官方 live leaderboard 居第 2 名(balanced accuracy 0.607)——两口径均存照(§9),正文按"前排团队"表述

3.5 参赛者旅程:从注册到奖金的完整动线

  1. 注册:官方提交系统 Sign up,获得参赛身份;组委会成员所属机构参赛须声明独立性(§3.4)
  2. 开发期:下载训练包(图像+GT+metadata),本地开发;此阶段测试集不可见
  3. 测试图发布(计划 2019-08-02):8,238 张测试 JPEG 释出,系统须对每张输出 9 类预测(8 known+UNK)
  4. Task 1 提交(截止 2019-08-16):上传 one-hot 预测 CSV;系统自动格式校验→即时 validation score(~100 张 sanity 子集)→进入正式评分队列
  5. 测试 metadata 发布(2019-08-16):Task 2 选手此时才能拿到测试侧 metadata
  6. Task 2 提交(截止 2019-08-23):同流程;Task 2 选手的 Task 1 提交为强制前置
  7. 方法论文:与预测同时提交 manuscript 链接——无论文链接的提交不完整
  8. 正式评分:提交期结束后官方发布最终成绩与公开 leaderboard;全套指标(sens/spec/AUC/F1/AUC80/PPV/NPV 等)逐项计算
  9. 公布与颁奖:获奖结果在 ISIC 工作坊节点公布(官方页文本见坑 3);奖金 $4,000/$2,000/$1,000 经税务流程(W-9/W-8 BEN)在 2019 年 10 月深圳 MICCAI 工作坊后发放
  10. 长尾:挑战站转 [Closed],数据与 GT 转入官方 data 页长期存档;2024 年 leaderboard 重开为 live 榜,提交通道延续

§4 冠军与方法:Gessert 团队的双任务登顶

4.1 官方成绩与团队

ISIC 2019 两个赛道的第一名是同一团队:Nils Gessert、Maximilian Nielsen、Mohsin Shaikh、René Werner、Alexander Schlaefer,来自汉堡工业大学(Hamburg University of Technology)与汉堡-埃彭多夫大学医学中心(University Medical Center Hamburg-Eppendorf)。其方法论文 “Skin Lesion Classification Using Ensembles of Multi-Resolution EfficientNets with Meta Data”(arXiv:1910.03910,v1 2019-10-09)在 arXiv 官方备注中直接写明:“First place at the ISIC 2019 Skin Lesion Classification Challenge”。

与 2024 live 榜第一名的身份衔接:live 榜队名 DAISYLab 挂靠的机构正是 TU Hamburg/UKE,且榜首数值 0.636 与当年官方成绩 63.6% 精确一致——合理的解释是该团队当年的提交在重开的 live 系统中延续展示(官方未另发说明,此处按机构+数值+方法三重吻合作一致性陈述,不虚构提交记录细节)。检索者只需记住:2019 冠军 = DAISYLab 同一团队谱系,榜单头名五年来在数值上纹丝未动。

官方测试集成绩(论文摘要自述):

赛道 balanced accuracy 名次
Task 1(仅图像) 63.6% 1st
Task 2(图像+metadata) 63.4% 1st

其内部 5 折交叉验证的集成成绩为 balanced accuracy 74.2%——CV 成绩与官方测试成绩之间约 10 个百分点的落差,本身就是"任务比想象中难"的最直接证据(UNK 陷阱+官方测试集的分布差异)。

4.2 方法解剖:五件套

冠军方法是典型的"工程完备主义",五件套缺一不可:

  1. 多分辨率 EfficientNets 集成:数据集分辨率从 450×600 到 1024×1024 跨度近 4 倍,团队用不同输入分辨率与不同裁剪策略(同尺寸裁剪/随机缩放裁剪)训练多个 EfficientNet 变体,让每个模型擅长一种尺度形态——后续综述(IET CV 2023)把这套"multi-resolution ensemble"列为 2019 届的标志性技术遗产。
  2. loss balancing(损失平衡):面对 54:1 的类别失衡,采用损失加权平衡而非简单重采样——摘要原话:“multi-class skin lesion classification comes with the problem of severe class imbalance. We try to overcome this problem by using loss balancing.”
  3. 外部数据补 UNK:摘要原话:“by including external data with skin lesions types that are not present in the training set”——用训练集之外的病类图像训练第 9 类。这一策略被后续方法论文系统化(如 arXiv:2101.03814 明确以 SD-198 为 UNK 训练源),OOD 检测由此成为 ISIC 系基准的标配课题。
  4. metadata 融合:Task 2 侧用一个额外的 dense 神经网络编码年龄/性别/部位,特征与 CNN 图像特征融合——metadata 的增益是真实的但有限(63.6%→63.4% 两赛道几乎打平,甚至图像-only 略高),这个"metadata 没那么神"的结果在后续文献中反复被复现。
  5. 集成子集搜索:不是把所有模型平均,而是"搜索最优模型子集"(we aggregate all our models with an ensembling strategy where we search for the optimal subset of models)——在数十个候选中用验证成绩挑组合,兼顾精度与推理成本。

4.3 其他前排团队与 live 榜

  • legacy 前三(PMC8055397,2021 口径):1st Gessert 63.6 / 2nd Cancerless 63.8 / 3rd ForCure 64.8——注意 2/3 名表内数值高于第 1 名的名次倒挂,属该文表内口径问题,官方名次以冠军论文自述+官方 leaderboard 为准(坑 5;该文还把 Gessert 拼成 “Gassert”,坑 4)
  • 官方 live leaderboard(challenge.isic-archive.com/leaderboards/2019,2024 年重开后持续开放,累计 64 队):1st DAISYLab 0.636(Ensemble of Multi-Res EfficientNets + SEN154)——正是 Gessert 所在机构(TU Hamburg/UKE)的队名与当年同值成绩;2nd DysionAI(北京鼎视智慧)0.607(EfficientNetB3-B4-Seresnext101 集成);3rd AImageLab & PRHLT(Unimore & UPV)0.593(ensemble+OOD threshold);4th DermaCode 0.578(13 models+hierarchical outlier selection);5th Nurithm Labs 0.569
  • 前排方法的共性:集成是标配;OOD/未知类处理策略(阈值法、层级外类判定、外部数据)决定名次分层——63% vs 59% 的差距主要不在分类骨干,而在"敢不敢说不知道"
  • 中国力量:DysionAI(鼎视智慧)、BITDeeper(北京理工大学,MelaNet 深度密集注意力网络)、SYSU-MIA-Group(中山大学)、Tencent Medical AI Lab、南方医科大学 MIP、中科院自动化所等中国团队密集出现在前 35 名——皮肤影像是 2019 年中国医学 AI 团队国际竞赛参与度最高的赛道之一
4.3.1 UNK/未知类检测策略对比(前排实践归纳)
策略 代表 原理 得失
外部数据作第 9 类 冠军 Gessert;arXiv:2101.03814(SD-198) 把"训练分布外"变成有监督的额外类 最稳;依赖外部数据与真实测试 UNK 分布的相似度
置信度阈值法 DermaCode(13 models+hierarchical outlier selection)等 softmax 最大概率低于阈值即判 UNK 免外部数据;阈值敏感,易误杀难样本
层级/规则判定 DermaCode 层级路线 先判"是否已知类"再细分类 结构清晰;层级错误传播
异常检测建模 SabanciUnivTeam(Anomaly Detection 提交) 将 UNK 视为异常检测问题 概念贴合;医疗分布下调参困难

对后来者的含义:2020/2024 届与 MILK10k 的"unknown"设计与 SLICE3D 等任务,把这条技术线从"比赛技巧"固化成了"协议要求"——复现 ISIC 系基准而不写 UNK 策略,等于没读懂协议。

4.4 冠军方法的可迁移启示

  • 分辨率即超参数:医学影像的设备异质性首先体现在分辨率;多分辨率输入+裁剪策略组合是低成本高回报的第一杠杆
  • 失衡的正确姿势是损失而非采样:54:1 失衡下 loss balancing 优于重采样/过拟合风险更大的过采样路线(该结论被大量后续工作引用)
  • OOD 是名次分水岭:closed-set 精度再高,UNK 识别做不好就上不了榜首——医学部署场景里"识别自己不认识的东西"比"多对一类"更重要
  • metadata 增益有限但值得做:结构化临床信息(年龄/部位/性别)对分类有正贡献但幅度小,且测试集 metadata 缺失字段(lesion_id)会限制上限

4.5 ISIC 2019 相关方法论文一览

团队/名次 论文 核心要素 备注
Gessert et al.(T1/T2 双第一) arXiv:1910.03910(2019-10-09) 多分辨率 EfficientNets+SENet 集成、loss balancing、外部数据、metadata 融合、子集搜索 官方备注 First place
BITDeeper(北京理工大学,live 榜第 7) MelaNet: A Deep Dense Attention Network for Melanoma Detection 密集注意力网络 中国团队方法论文代表
arXiv:2101.03814(2021,方法复现研究) Analysis of skin lesion images with deep learning SD-198 充当 UNK 训练数据、OOD 检测系统综述 对 UNK 协议的独立方法论分析
PMC8055397(Biomed Res Int 2021) Skin Lesion Classification Using Additional Patient Information TTA+Grad-CAM、metadata 利用、live 榜 88.7% 单模型 live 重开后的后续成绩(口径已变)
MDPI Appl. Sci. 2022(自切分) Multiclass Skin Cancer Classification Using Ensemble of Fine-Tuned Deep Learning Models ResNet/DenseNet/VGG-19 集成,accuracy 0.92 自切分口径代表
IET CV 2023(综述视角) A deep analysis on high-resolution dermoscopic image classification 高分辨率处理路线综述 引用冠军方法为"best performing approach"

读表提醒:此表混有官方协议成绩(第一行)与自切分/后续口径成绩(后几行),数字不可横向比较(坑 6);列入仅为方法学谱系梳理。

§5 分工声明:与 HAM10000/BCN20000/ISIC Archive 的关系边界(检索者必读)

5.1 为什么本条目没有撞库停止

本库写手规程要求:新条目若与库内既有条目构成实质性重复(别名/同数据换名),应停止并改道。ISIC 2019 通过了这一检验,依据是条目定位的分层而非数据的独立性:

  • 数据层:ISIC 2019 训练集 25,331 张 = HAM10000 10,015(100% 重叠,库内 rid 60 已收)+ BCN20000 12,413(MMU 口径,库内 rid 161 已收)+ MSK ≈2,903(其主库由 rid 56 isic-archive 覆盖)——数据本体重复度约 88.5%,MSK 增量约 2,903 张也包含在 isic-archive 主库范围内
  • 事件层:ISIC 2019 Challenge 是一个独立的历史事件——有独立的任务设计(8+UNK 九类、双赛道)、独立的评估协议(balanced accuracy 主指标+验证分机制+开源评分代码)、独立的竞赛结果(冠军/奖金/排行榜)、独立的基准生命周期(官方排行榜持续开放至 2024+)——这些内容不被库内任何既有条目覆盖(rid 60 条目的别名虽含"ISIC 2018 Training Set",但那是 2018 届口径;rid 161 的别名注明"ISIC 2019 挑战训练集主要构成"是来源关系声明,均未展开挑战赛事件本身)

结论:数据查重触发、事件查重通过——按"独立挑战赛条目"成稿,本节即为强制分工声明。

5.2 分工边界清单

内容域 归属条目 本条目处理方式
HAM10000 采集/标注/患者口径(10,015 张) ham10000(rid 60) 不重复展开;只写"2018 届训练集原样并入"的关系事实
BCN20000 采集/"野外"设备多样性(12,413 张) bcn20000(rid 161) 不重复展开;只写来源贡献数字与口径存照
ISIC Archive 主库/API/全库规模 isic-archive(rid 56) 不重复展开;MSK 系图像的仓库层归属指向该条
挑战赛任务设计/时间线/指标/奖金 本条目 完整展开(§3)
冠军方法/排行榜/方法学遗产 本条目 完整展开(§4/§7)
训练集聚合口径与重复性风险 本条目 完整展开(本节+坑 1)

5.3 给检索者的实操含义

  1. 不要为"拿 HAM10000 的图"而下 ISIC 2019 包——10,015 张 HAM 图只是 2019 包的子集,HAM10000 独立包(含其论文级文档)更干净
  2. 不要重复收录:若你的数据管理系统已收录 ham10000 与 bcn20000,再收 ISIC 2019 只为拿约 2,903 张 MSK 图与统一 8 类标签——值不值得,取决于你是否需要"官方挑战协议"本身(复现冠军成绩/打官方榜)
  3. 标签体系要区分:HAM10000 论文标签(7 类)与 ISIC 2019 聚合标签(8 类 one-hot)对同一张图可能有差异(类别映射/重审),引用时注明用的是哪套 GT
  4. 引用义务不同:用 2019 聚合包须按 CC-BY-NC 分别署名三源(坑 7);只用 HAM 子集则按 HAM10000 论文署名即可

5.4 如果只记住三件事

  1. 25,331 张里没有一张新图——它是三个既有数据集的聚合包+一套新标签+一份新协议,"新"在协议不在像素。
  2. 数据重复≠条目重复——本条目的存在理由是挑战赛事件(任务/协议/冠军/榜单),这件事在库内 ham10000/bcn20000/isic-archive 三条目里都没有写、也不该由它们写。
  3. 从 ISIC 2019 出发的每一条引用都有口径——哪套 GT、哪个切分、UNK 怎么处理,三问不问清,数字就是悬空的。

5.5 重复检测实操:入库/入训练集前的查重骨架

ISIC 系图像在多个数据包间流通(同一张图可能同时存在于 HAM10000 包、2019 包、2020 包),直接合并多包训练会造成重复样本——验证集信息泄漏与成绩虚高的常见根源。实操建议两道工序:

# 工序一:ID 级去重(官方图号 ISIC_xxxxxxx 是跨包稳定键)
import pandas as pd

def id_level_dedup(package_dirs: dict) -> set:
    """package_dirs: {"ham10000": ..., "isic2019": ..., "isic2020": ...}
    返回在各包间重复出现的图号集合"""
    id_sets = {name: {p.stem for p in d.glob("*.jpg")} for name, d in package_dirs.items()}
    seen, dup = set(), set()
    for s in id_sets.values():
        dup |= seen & s          # 与先前任何包的交集
        seen |= s
    return dup

# 工序二:内容级查重(同病变多倍图/重压缩变体,图号不同内容相近)
# 轻量做法:感知哈希(perceptual hash)+ 汉明距离阈值
from PIL import Image
import imagehash

def near_dup_report(img_paths, hash_size=16, max_dist=4):
    sigs = [(p, imagehash.phash(Image.open(p), hash_size=hash_size)) for p in img_paths]
    pairs = []
    for i in range(len(sigs)):
        for j in range(i + 1, len(sigs)):
            if sigs[i][1] - sigs[j][1] <= max_dist:
                pairs.append((sigs[i][0].name, sigs[j][0].name))
    return pairs   # 人工复核近重复对;同 lesion_id 的 multiplets 预期会被命中

学术先例:MMU 分析论文(Sci Dir 2021)对 ISIC 2016-2020 全系做了系统的重复样本分析,并据此发布去重后的 curated 数据集——多包联用前值得先读。本库同域教训(wsss4luad 等条目)同样表明:跨包合并前不做内容级查重,是医学影像基准虚高成绩的第一大来源。

§6 获取与许可:门怎么进、名怎么署

6.1 官方获取渠道(推荐首选)

官方 data 页(challenge.isic-archive.com/data/,ISIC 2019 Challenge [Closed] 表格)至今仍提供完整下载:

文件 规模 内容
ISIC 2019 Training Input 9.1GB 25,331 张皮肤镜 JPEG
ISIC 2019 Training Ground Truth 1MB 25,331 条 8 类 one-hot 诊断
ISIC 2019 Test Input 3.6GB 8,238 张 JPEG
ISIC 2019 Test Ground Truth 454KB 8,238 条诊断(挑战结束后公开;含评分与验证权重)
ISIC 2019 Training Metadata 1MB 25,331 条年龄/性别/部位/lesion ID
ISIC 2019 Test Metadata 287KB 8,238 条年龄/性别/部位
  • 备选官方通道:ISIC Archive API(与主库同源,可按图号增量拉取;API 文档见 isic-archive 条目 rid 56)
  • 挑战站旧域名 challenge2019.isic-archive.com 现显示 “[Closed]” 并指向主站
6.1.1 下载与完整性校验实操
# 官方直链(challenge.isic-archive.com/data/ 页内获取当前有效链接后)
# 训练包 9.1GB / 测试包 3.6GB——大文件建议断点续传
curl -L -C - -o ISIC_2019_Training_Input.zip   "<官方训练包链接>"
curl -L -C - -o ISIC_2019_Test_Input.zip       "<官方测试包链接>"
curl -L -C - -o ISIC_2019_Training_GroundTruth.zip "<官方训练GT链接>"
curl -L -C - -o ISIC_2019_Test_GroundTruth.zip "<官方测试GT链接>"   # 454KB,含评分权重
curl -L -C - -o ISIC_2019_Training_Metadata.zip "<官方训练metadata链接>"
curl -L -C - -o ISIC_2019_Test_Metadata.zip    "<官方测试metadata链接>"  # 287KB

# 数量校验(三条硬数字对上才算完整)
unzip -l ISIC_2019_Training_Input.zip | grep -c "jpg"    # 期望 25,331
unzip -l ISIC_2019_Test_Input.zip    | grep -c "jpg"    # 期望 8,238
python3 -c "import pandas as pd; gt=pd.read_csv('ISIC_2019_Training_GroundTruth.csv'); \
print(len(gt), gt.drop(columns=gt.columns[0]).sum().to_dict())"
# 期望: 25331 {'MEL': 4522, 'NV': 12875, 'BCC': 3323, 'AK': 867, 'BKL': 2624, 'DF': 239, 'VASC': 253, 'SCC': 628}

镜像通道对比:官方直链(首选,license 与文件一致性有保障)> Kaggle andrewmvd(CC BY-NC 4.0 标注正确,13.64GB 总包)> 其他社区镜像(仅作快照参考,agsam23 存在 CC0 误标,坑 9)。

6.2 第三方镜像与坑

  • Kaggle andrewmvd/isic-2019:最常用镜像,标 CC BY-NC 4.0(正确口径);其页面对训练集的"9 classes"表述是任务口径(坑 2)
  • Kaggle agsam23/isic-2019-challenge:license 误标为 CC0 Public Domain——与官方 CC-BY-NC 直接冲突,勿按 CC0 使用(坑 9)
  • openi.pcl.ac.cn 等学术社区镜像:内容为官方文本转载,可作快照参考
  • 一切以官方 data 页 license 口径为准:CC-BY-NC(Frontiers 2026 论文明确写 CC BY-NC 4.0)

6.3 署名规范(license 的强制动作)

官方原文要求:为符合 CC-BY-NC 的署名要求,聚合的 “ISIC 2019: Training” 数据必须按以下方式引用——三句缺一不可:

  1. BCN_20000 Dataset: © Department of Dermatology, Hospital Clínic de Barcelona
  2. HAM10000 Dataset: © by ViDIR Group, Department of Dermatology, Medical University of Vienna; https://doi.org/10.1038/sdata.2018.161
  3. MSK Dataset: © Anonymous; https://arxiv.org/abs/1710.05006 ; https://arxiv.org/abs/1902.03368

同时官方建议引用挑战赛本身:Codella et al. 2018 challenge 论文(arXiv:1902.03368)与 Tschandl et al. 2018(Sci Data 5:180161);BCN20000 部分按 Hernández-Pérez et al. 2024(Sci Data 11:641)引用。注意 MSK 源虽匿名,“© Anonymous” 这句署名不可省略——省略即违反许可条款(坑 7)。

6.4 license 的使用边界

使用场景 可行性 依据/条件
学术研究(训练/评测/发论文) ✓ 三源署名句齐全
竞赛/教学/内部分享 ✓ 同上,NC 框架内
开源模型权重发布 ◐ 官方未表态;建议权重页声明数据来源与许可
商业产品内嵌/商用 API ✗ NC 条款不覆盖;需向权利方另行授权
再分发数据包(镜像/转换格式) ◐ 须携带同署名与 NC 约束;建议链回官方页
衍生标注(如新分割掩码)发布 ◐ 新标注作者自持版权,但底层图像受 CC-BY-NC 传导
  • 非商业(NC):商业产品/付费服务中的直接使用不获许可;企业内研究是否算"非商业"需法务自行判断,官方未提供更细指引
  • 图像级再分发:CC-BY-NC 允许共享与改编,但须携带同样署名;训练模型权重是否受 NC 约束官方未表态(领域惯例视为可用,但论文/产品声明建议注明数据许可)
  • 与库内光谱对照:CC-BY-NC 属"可自由学术获取+强署名义务"档——比请求制(如 PANDA-PLUS 掩码)宽松,比 CC0/CC-BY(如 BCN2020 部分数据)严格

6.5 AI-Ready 评估

  • 可获取性:公开直链下载+API,无需注册审批——满分档
  • 格式:JPEG+CSV,标准工具链直接可读——满分档;非 DICOM 是 2020 届才引入的改进
  • 标注:训练集 8 类 one-hot 全量 gold standard;测试集 GT 挑战后公开——闭环完整
  • metadata:训练四字段(age/sex/site/lesion_id)足以支撑多模态实验,但缺患者级 ID(2020 届补上)
  • 文档:官方页面无数据卡(data card)概念,采集设备/人口学分布要查来源论文——扣分项
  • 结论:ISIC 2019 数据包本体是 AI-Ready 的早期标杆(“下载即训练”),其 AI-Ready 短板主要在文档层而非格式层

6.6 与库内可获取性光谱的对照

获取模式 代表条目 ISIC 2019 对照
公开直链(CC-BY/CC0 档) 多数影像条目 ISIC 2019 为"公开直链+NC 约束",介于两档之间
公开直链+强署名义务(NC 档) 本条目 三源分别署名是独有要求——比一般 NC 条目多两步
请求制(upon request) panda-plus 掩码层 ISIC 2019 无请求环节,门槛更低
API 分发 isic-archive(rid 56) 同属此档;2019 包是 API 的按届打包视图
注册制大盘 TCIA 系等 ISIC 无注册门槛

结论:在库内"AI-Ready 光谱"上,ISIC 2019 处于"最易获取的一档",其独有摩擦点不在获取而在合规(署名三句)与口径(官方协议 vs 自切分)。

6.7 渠道对比与选用建议

渠道 文件一致性 license 标注 适用场景 风险
官方 data 页 权威(评分权重齐全) CC-BY-NC(原文) 复现/打榜/正式研究 大文件下载需断点续传
ISIC Archive API 权威(同源) 同官方口径 增量拉取/按源筛选 需处理 API 限速
Kaggle andrewmvd 与官方一致(社区校验多) CC BY-NC 4.0(正确) 快速实验 页面"9 classes"表述易误读(坑 2)
Kaggle agsam23 与官方一致 CC0(误标) 不建议 license 误用风险(坑 9)
openi 等社区镜像 官方文本转载 转载口径 中文环境快照参考 时效性与完整性无保障

§7 生态与影响:一届挑战赛留下的基准遗产

7.1 在 ISIC 系列中的枢纽位置

2016-2020 五届挑战的规模曲线(900→2,000→10,015→25,331→33,126)中,2019 是第一个"三源聚合"届:它把 2018 届的单一中心数据(HAM10000)升级为多中心多设备数据,方法上直接回应了"实验室成绩能否迁移到野外图像"的质疑。BCN20000 的加入让"dermoscopic lesions in the wild"(皮肤镜野外病变)从 BCN 论文标题变成基准现实。2020 届的 DICOM 化与 patient-centric 切分,又是对 2019 届格式与泄漏教训的吸收——2019 届是整条曲线的方法学转折点。

7.2 官方排行榜的长尾生命力

  • 官方 2019 leaderboard 在 2024 年重开为持续开放的 live leaderboard(64 支队伍记录在案),2024+ 官方主推 MILK10k 基准与 ISIC 2024 挑战(SLICE3D)——但 2019 榜仍开放提交,这在医学影像挑战中罕见
  • live 榜第一名 DAISYLab 0.636 与 2019 冠军同机构同数值:五年间没有公开方法在官方协议下显著超越当年冠军——侧面证明该基准的难度设定与防过拟合设计(UNK+预置验证子集)经受住了时间检验
  • 基准引用惯性:ISIC 2019 的 25,331/8 类包是后续论文使用频率最高的皮肤镜分类数据(IET/Frontiers/MDPI/ACM 等大量 2021-2026 论文以其为实验载体)
7.2.1 五年无人破榜的三种解释
  1. 协议强度:官方测试集含约四分之一 UNK,balanced 口径把弱类敏感度全数计入——刷常见类无济于事,弱类(DF/VASC/AK/SCC/UNK)没有实质突破就动不了总分。
  2. 数据天花板:官方协议下外部数据要声明、验证子集不可刷、测试集不可调参——工程红利被协议锁死后,剩余差距只能靠真实泛化能力填。
  3. 激励结构:2020 届与 MILK10k 分流了后来者的投入——顶尖团队转向新协议新数据,2019 榜的挑战者增量有限,头部成绩自然冻结。

三种解释不互斥,共同指向同一结论:63.6% 是这个数据包在诚实评估下的水位线——任何声称"大幅超越"的自切分数字,先过口径三问(§8)再说话。

7.3 63.6% vs 0.95:一课基准素养

后续文献在 ISIC 2019 上的自切分成绩普遍 0.92-0.95(accuracy 口径):

口径 成绩 设置
官方测试集(冠军) balanced accuracy 63.6% 含 UNK、官方切分、balanced 口径
MDPI Appl. 2022(自切分) accuracy 0.92 训练集内 70:30 切分、8 类、无 UNK
Frontiers 2025(自切分) accuracy 94.5-95.0% 同上类自切分
ACM 2023(官方在线评估) 按官方协议 测试集经自动系统评分

落差来源三重:切分不同(官方测试集分布与训练集有异+含 24.9% UNK)、指标不同(accuracy vs balanced accuracy)、协议不同(无验证调参 vs 反复调参)。引用时必须写明口径——这是本条目反复强调的基准素养(坑 6)。

7.3.1 两口径对照总表(做实验设计时抄这张)
设计要素 官方挑战协议 文献自切分惯例
训练数据 官方训练集 25,331 张(外部数据须声明) 同左,或再并 PH2/SD-198 等
验证方式 无公开验证调参;测试集一次性提交 训练集内 train/val(常 70:30 或 80:20)
测试 官方 8,238 张(含 UNK 2,047) 自留出集(通常无 UNK)
指标 balanced multi-class accuracy(平均 recall),AUC 破平局 accuracy / macro-F1 / AUC
弱类 UNK、DF、VASC、AK、SCC 敏感度主导成绩 accuracy 被 NV 主导
可比性 唯一可与官方榜对比的口径 仅同协议论文间可比
复算工具 isic-challenge-scoring + 测试 GT 自实现(建议引用官方定义)

7.4 中国团队与国际参与

  • 2019 届官方 live 榜前 35 名中中国机构密集:DysionAI(鼎视智慧,当前第 2)、BITDeeper(北京理工大学)、SYSU-MIA-Group(中山大学)、Tencent Medical AI Lab、南方医科大学 MIP、中科院自动化所(两支)等
  • 中文报道口径存照:2019-08-30 中国产业经济信息网报道鼎视智慧"夺得该全球顶级医学影像算法竞赛的第 1 名(基于公开数据)"——该表述为当时 live 榜快照+限定语,与最终官方名次(live 榜当前第 2)并存不悖(坑 5 相关)
  • 国际参与:汉堡(冠军)、巴塞罗那/摩德纳/瓦伦西亚(AImageLab & PRHLT)、本古里安大学、萨班哲大学、IIT Ropar、ETRI 等——医学影像挑战赛的国际多元参与在 2019 届已成型

7.5 对方法学的三条持久影响

  1. OOD/开放集识别进入医学影像标配议题:UNK 协议之后,"模型必须能说不知道"从 CV 话题变成医学 AI 的评价维度;2020/2024 届与 MILK10k 均延续
  2. balanced accuracy 成为长尾医学分类的默认主指标:2019 官方 rationale(“更接近医生真实评估”)被后续大量挑战赛引用
  3. 多分辨率集成+损失平衡成为皮肤镜分类的强基线配方:冠军论文的配方在 2021-2026 年文献中仍是常用对照组

7.6 引用与影响面

  • 基准引用惯性:25,331/8 类包是 2021-2026 年皮肤镜分类论文的最高频实验载体之一(本条目引用链中的 MMU/IET/MDPI/Frontiers/ACM 五路文献全部以它为主实验台)
  • 方法学引文锚:冠军论文(arXiv:1910.03910)是多分辨率集成+loss balancing 配方的标准引用;SD-198 作 UNK 外部源的做法经由 arXiv:2101.03814 等复现研究扩散
  • 协议引用锚:官方 Evaluation 节的 balanced accuracy 定义与 rationale(“closer to real evaluation of a dermatologist”)被后续挑战赛(含非皮肤领域)在设计文档中转引
  • 数据治理引文锚:MMU 分析论文(Sci Dir 2021)以 ISIC 2016-2020 全系为对象做重叠/基准分析,其表 3/表 4/表 5 是本条目数据构成的主要分析口径——后续任何"ISIC 系数据族谱"工作都绕不开
  • 中文社区影响:openi.pcl.ac.cn 等中文平台收录官方数据文本;鼎视智慧夺冠报道使 ISIC 挑战赛在中文医学 AI 圈的知名度在 2019 年达到高点

§8 方法学启示:检索与使用这份基准的四条守则

8.1 守则一:先问"哪套 GT"

HAM10000 论文 GT(7 类)、ISIC 2018 届 GT、ISIC 2019 聚合 GT(8 类)对重叠图像可能有标签差异(类别体系映射与重审);论文引用某张图的标签时,注明 GT 版本与下载渠道,可避免"同一张图两个标签"的假性数据错误。

8.2 守则二:切分要按 lesion_id 聚类

训练集 11,848 个唯一 lesion ID 对应 23,247 张图(平均约 2 张/病变),随机按图切分会把同一病变的近重复图分进训练与验证两侧,制造虚高成绩;正确做法是按 lesion_id 分组切分(group split)。缺 lesion_id 的 2,084 张需单独处理策略。2020 届直接升级为 patient-centric 切分——方向的印证。

8.3 守则三:UNK 的处理写清楚

报告官方口径成绩必须说明 UNK 策略(阈值法/外部数据训练/拒识头);自切分研究若忽略 UNK,应明示"本实验不含未知类协议"——两种口径的成绩不可放进同一张对照表(见 7.3)。

8.4 守则四:署名三句走完再用图

CC-BY-NC 的三源分别署名是使用前提(6.3);论文致谢、数据声明、产品说明里都应完整出现。MSK “© Anonymous” 一句同样不可省。第三方镜像的 license 标注以官方为准(坑 9)。

8.5 复现级基线训练骨架(group split + loss balancing + UNK 外部类)

import torch, pandas as pd, numpy as np
from torch.utils.data import Dataset, DataLoader
from sklearn.metrics import balanced_accuracy_score

CLASSES = ["MEL", "NV", "BCC", "AK", "BKL", "DF", "VASC", "SCC"]  # 训练 8 类
df = pd.read_csv("ISIC_2019_Training_GroundTruth.csv")
df["label"] = df[CLASSES].values.argmax(axis=1)

# 1) group split:按 lesion_id 聚类切分,防 multiplets 泄漏(缺 ID 的图单列一层)
from sklearn.model_selection import GroupShuffleSplit
df["group"] = df["lesion_id"].fillna(df["image"])       # 无 lesion_id 的图自成一组
trv = GroupShuffleSplit(n_splits=1, test_size=0.1, random_state=42)
tr_idx, va_idx = next(trv.split(df, groups=df["group"]))
train_df, val_df = df.iloc[tr_idx], df.iloc[va_idx]

# 2) loss balancing:按类频倒数加权(冠军路线的核心;优于重采样)
counts = train_df["label"].value_counts().reindex(range(len(CLASSES)))
weights = torch.tensor((counts.sum() / (len(CLASSES) * counts)).values, dtype=torch.float32)
criterion = torch.nn.CrossEntropyLoss(weight=weights)

# 3) UNK 外部类(官方测试集口径):用 SD-198 等外部病类图作第 9 类
#    unk_ds 输出 label=8 的样本;与 8 类训练集拼接训练 9 类头(略)

# 4) 训练循环(示意;分辨率/裁剪策略按冠军路线做多尺度分支)
# model = timm.create_model("efficientnet_b0", num_classes=9, pretrained=True)
# for epoch in range(EPOCHS):
#     ... loss = criterion(logits, y); loss.backward(); opt.step()
#     # 验证:balanced_accuracy_score(与官方主指标同义,按样本级 macro recall)
#     print(balanced_accuracy_score(val_y, val_pred))

三处与"文献默认做法"的刻意差异,即本条目的方法学立场:切分按 lesion_id 而非按图(坑 10)、损失加权而非过采样(§4.2)、类别头 9 类而非 8 类(§2.4)。照抄默认做法得到的高分,在官方协议下都不作数。

8.6 评审者视角:用 ISIC 2019 的论文实验设计检查单

  1. 数据版本写了吗?(2019 聚合包 vs HAM/BCN 单包;GT 版本)
  2. 切分按 lesion_id 了吗?(有 multiplets 泄漏一律存疑)
  3. UNK 协议处理了吗?(无 UNK 实验须明示不含未知类)
  4. 指标是 balanced 口径吗?(accuracy 报告须加 macro 口径)
  5. 外部数据声明了吗?(官方协议要求;自切分也应声明)
  6. 署名三句齐全吗?(license 合规)
  7. 与官方 63.6% 对比了吗?(有则全表口径统一;无则说明理由)
  8. 多分辨率/多裁剪敏感性测了吗?(分辨率跨度近 4 倍是本基准的结构性变量)

§9 与库内条目的关系

9.1 家族图谱

                ISIC Archive 主库(rid 56)—— 仓库层:全库图像/API/挑战托管
                       │
        ┌──────────────┼──────────────────┐
        │              │                  │
   HAM10000        BCN20000           MSK 系图像
  (rid 60)        (rid 161)          (匿名源,主库覆盖)
  10,015 张        12,413 张          ≈2,903 张(倒推)
        └──────────────┼──────────────────┘
                       ▼
          ISIC 2019 Challenge 训练集 25,331 张(本条目)
                       │
                       ▼
          ISIC 2020(33,126 train,DICOM,patient-centric)
                       │
                       ▼
          ISIC 2024 挑战 / MILK10k 基准(现行官方主推)
  • 上游(数据来源层):ham10000(rid 60)——2018 届训练集、2019 届最大单一来源;bcn20000(rid 161)——2019 届第二来源、野外多样性担当;isic-archive(rid 56)——仓库层与 MSK 系图像归属
  • 本体(事件层):isic-2019(本条目)——任务设计、评估协议、冠军、排行榜
  • 下游(演进层):ISIC 2020/2024 与 MILK10k(官方页面口径;库内暂无独立条目)
  • 横向(任务同域):皮肤影像分类同域可互链:PH2、SD-198 等外部基准(库内暂无);生物医学挑战赛范式同域:库内其他挑战赛条目
9.1.1 三条目+本条目 = 完整 ISIC 知识面
你想知道 去哪 一句话理由
这个图库整体多大、怎么检索 API isic-archive(rid 56) 仓库层视图,全库图像统一入口
HAM10000 那 10,015 张的来龙去脉 ham10000(rid 60) 有 Sci Data 论文级的采集/标注叙事
巴塞罗那那 12,413 张的野外谱系 bcn20000(rid 161) 设备多样性与"wild"叙事的主场
2019 年比赛怎么打、谁赢了、指标怎么定 本条目 事件与协议只在这里

9.2 检索路径建议

  • 想下载图像本体:官方 data 页直链(§6.1)或 isic-archive 条目(rid 56)的 API 路径;只需 HAM/BCN 子集时直接走 rid 60/161 条目的原始获取渠道
  • 想复现冠军成绩/打官方榜:本条目 §3 协议 + §6 测试 GT + isic-challenge-scoring 开源代码
  • 想了解 HAM10000 的采集与 Sci Data 论文细节:rid 60 条目(本条目不重复)
  • 想了解 BCN20000 的野外设备多样性:rid 161 条目(本条目不重复)
  • 想把 ISIC 2019 与 2018 届对照:rid 60 条目的"ISIC 2018 Training Set"别名口径 + 本条目 §2.5 版本链表

§10 避坑清单:十个已踩过或必踩的坑

坑 1:把 ISIC 2019 当独立新数据集收录
训练集 88.5%(22,428/25,331)图像已在 ham10000/bcn20000 两条目覆盖,MSK 增量也在 isic-archive 主库范围内。数据管理系统的收录决策请先读 §5 分工声明——本条目按"独立挑战赛条目"成稿,事件层不重复、数据层明确指向,检索者别再踩"三处下载同一批图"的坑。

坑 2:9 类还是 8 类?
训练 GT CSV 是 8 列 one-hot;第 9 类 UNK(None of the others)只在测试集存在。Kaggle 镜像页"25,331 images belonging to 9 classes"是任务口径(9 类分类),不是训练标签有 9 类——拿训练 CSV 找第 9 列会扑空,拿 9 分类头接 8 列 GT 会错位。

坑 3:官方页面的 CVPR 2019 残留文本
官方页面同时写着"The results are presented at the ISIC Skin Image Analysis Workshop @ CVPR 2019"与奖金"awarded after the MICCAI Workshop in Shenzhen, China, in October 2019"——CVPR 2019 在 6 月、早于 8 月提交截止,时间倒挂,疑为沿用上届页面的模板残留。检索者以 MICCAI 2019 深圳(10 月)为获奖/收节点口径,CVPR 句存照不采。

坑 4:冠军姓氏拼写
PMC8055397(Biomed Res Int 2021)把冠军写作 “Gassert et al.”——正确为 Nils Gessert(arXiv:1910.03910 作者页为证)。文献检索两拼法都要试;引用以 arXiv 作者页为准。

坑 5:legacy 榜名次倒挂与"第一名"口径
PMC8055397 记录 legacy 前三为 Gessert 63.6 / Cancerless 63.8 / ForCure 64.8——2/3 名表内数值高于第 1 名,与 balanced accuracy 主指标排名逻辑冲突,官方名次以冠军论文自述+官方 leaderboard 为准。另有中文媒体 2019-08-30 报道"鼎视智慧获第 1 名(基于公开数据)"——那是当时 live 榜快照+限定语,与最终官方名次并存。三种"第一名"口径(官方最终/表内数值/媒体快照)不可混写。

坑 6:63.6% 与 0.92+ 不可同表
官方测试集(含 UNK、balanced accuracy、无调参机会)冠军 63.6%;文献自切分 accuracy 普遍 0.92-0.95。切分/指标/UNK 协议三重不同。对照实验要么全套官方协议+官方评分代码,要么明示"自切分口径",绝不混表(§7.3)。

坑 7:CC-BY-NC 三源分别署名,缺一即违规
官方强制署名三句:BCN_20000 © Hospital Clínic de Barcelona;HAM10000 © ViDIR Group, Med Uni Vienna;MSK Dataset © Anonymous。MSK 句虽是匿名署名也不可省。只用 HAM 子集可只按 HAM10000 论文署名,但一旦使用"ISIC 2019: Training"聚合包名义,三句必须齐全。

坑 8:UNK 数量是单源数字
测试集 UNK 2,047 张出自 Frontiers in Medicine 2026 论文(单源);官方未单独公布。引用时注明口径;精确数字以官方测试 GT CSV(现公开,454KB)按列求和核验为最终依据。

坑 9:第三方镜像 license 误标
Kaggle agsam23 镜像标 CC0 Public Domain——与官方 CC-BY-NC 冲突,勿据此使用数据;andrewmvd 镜像标 CC BY-NC 4.0 正确。一律以官方 data 页口径为准,并按坑 7 完成署名。

坑 10:lesion multiplets 的切分泄漏
11,848 个唯一 lesion ID 覆盖 23,247 张图,同一病变存在多张不同放大倍率图像(multiplets);随机按图切分会泄漏近重复样本。验证/测试切分必须按 lesion_id 分组(group split);2,084 张缺 lesion_id 的图像需显式处理策略(§8.2)。

坑点使用说明:坑 1/2/6/10 是"数字会错"类(直接影响实验结论);坑 3/4/5 是"史实会错"类(影响叙事与引用);坑 7/9 是"合规会错"类(影响法律边界);坑 8 是"待核"类(数字可能更新)。四类坑的核验优先级:合规 > 数字 > 史实 > 待核。

§11 总结

11.1 三句话总结

  1. ISIC 2019 Challenge 是第 4 届 ISIC 皮肤镜分类挑战赛:25,331 张训练图(HAM10000+BCN20000+MSK 三源聚合、8 类)+ 8,238 张含 UNK 未知类的测试图,balanced accuracy 主指标,冠军 Gessert 团队多分辨率 EfficientNets 集成双任务登顶(63.6%/63.4%)。
  2. 它的持久遗产不是图像(图像都是既有的),而是协议:UNK 开放集陷阱、balanced accuracy 的"医生视角"哲学、开源评分代码、以及一个五年无人公开突破的持续排行榜。
  3. 对数据管理者的核心提醒:数据层高度撞库(88.5% 已在库内两条目),本条目按独立挑战赛条目成稿并做分工声明;对使用者的核心提醒:口径三问(哪套 GT/哪个切分/UNK 怎么处理)之后再比较任何两个数字。

11.2 适合谁

  • 要复现/挑战官方成绩的团队:协议、测试 GT、评分代码、排行榜全链路公开,可直接开工
  • 研究长尾分布/开放集识别的方法学者:54:1 失衡 + UNK 协议是现成的方法学试验场
  • 做医学挑战赛设计的组织者:balanced accuracy rationale、验证分防刷榜、奖金与税务流程、开源评分审计——一套可直接借鉴的挑战赛运营范本
  • 写皮肤影像综述的作者:版本链(2016→2024)与 63.6% vs 0.92 的口径课,是讨论"基准真实难度"的必引素材

11.3 不适合谁

  • 只想"多拿一批新图"的团队:训练集 88.5% 图像已在 ham10000/bcn20000,纯数据增量仅 MSK 约 2,903 张——先读 §5
  • 需要患者级纵向数据的研究:训练集只有 lesion_id 无 patient ID,年龄是近似分箱——patient-centric 研究请走 ISIC 2020
  • 需要商业使用的团队:CC-BY-NC 不覆盖商业场景
  • 需要 DICOM/嵌入 metadata 的工作流:2019 包是 JPEG+CSV,2020 届才 DICOM 化

11.4 30 秒决策卡

  • 你要打官方榜/复现冠军?→ 是:§6 下载官方包+测试 GT,§3 协议,§4 冠军配方起点
  • 你要一个干净的皮肤镜分类基准?→ 已有 HAM/BCN?是:不必重收 2019 包,按 §5.3 决策;否:官方包一步到位且自带协议
  • 你要患者级/纵向研究?→ 走 ISIC 2020,本条目仅作谱系参考
  • 你要商业部署?→ NC 许可挡路;找替代数据或另行授权

11.5 给三类角色的一句话

  • 数据管理者:这是一个"事件条目"——收录它的理由是协议与榜单,不是图像;图像层请对照附录 O 的分工表防重复。
  • 算法研究员:这是"口径最严格"的皮肤镜基准——遵守它(group split、balanced 口径、UNK 声明)得到的数字才与官方榜同 currency。
  • 政策/运营者:这是医学挑战赛运营的参考范本——指标 rationale、防刷榜设计、评分审计、奖金流程四件事都写进了官方文本,可直接借鉴。

FAQ(高频问答 48 问)

A. 基础认知

Q1:ISIC 2019 是什么?
ISIC(国际皮肤影像协作组)主办的第 4 届皮肤病变分析挑战赛(2016/2017/2018/2019 序列),任务是皮肤镜图像九类分类(8 训练类+测试集 UNK 未知类),分图像-only 与图像+metadata 双赛道。

Q2:它和 ISIC Archive 什么关系?
Archive 是图像库(仓库层),挑战赛是每年一次的评测事件(事件层),数据包从 Archive 聚合导出。库内 isic-archive(rid 56)收仓库层,本条目收 2019 届事件层。

Q3:它和 HAM10000 什么关系?
HAM10000 的 10,015 张全部并入 2019 训练集(即 2018 届训练集原样成为 2019 届子集)。HAM 采集故事见库内 rid 60 条目。

Q4:它和 BCN20000 什么关系?
BCN20000 是 2019 届新增的巴塞罗那来源(MMU 口径 12,413 张进入 2019 训练集)。BCN 采集故事见库内 rid 161 条目。

Q5:为什么 2019 届重要?
三件事首次定标:三源多中心聚合、balanced accuracy 主指标、测试集 UNK 未知类协议。此后医学影像挑战赛的评估设计大量参照此届。

Q6:ISIC 2019 数据集 license 是什么?
CC-BY-NC(非商业),且署名须分别注明 BCN/HAM/MSK 三源(坑 7)。

B. 数据与获取

Q7:训练集多大?测试集多大?
训练 25,331 张 JPEG(9.1GB);测试 8,238 张 JPEG(3.6GB);合计 33,569 张。

Q8:图像分辨率是多少?
450×600 至 1024×1024(IET 口径),跨度近 4 倍——冠军方法用多分辨率输入回应。

Q9:metadata 有哪些字段?
训练:age_approx/sex/anatom_site_general/lesion_id;测试:age_approx/sex/anatom_site_general(无 lesion_id)。

Q10:lesion_id 缺失多少?
23,247 张有值、2,084 张缺失;唯一 ID 11,848 个(MMU 口径)。

Q11:测试集标签现在能拿到吗?
能。挑战期间不公开(自动在线评估);挑战结束后官方 data 页公开 8,238 条测试 GT(454KB,含评分与验证权重)。

Q12:哪里下载最靠谱?
官方 challenge.isic-archive.com/data/ 直链;API 走 isic-archive(rid 56)。第三方镜像注意 license 误标(坑 9)。

Q13:训练数据什么时候发布的?
官方页面未标注(遗留疑点);只知测试图计划 2019-08-02 发布,训练集不晚于 2019 年夏。

Q14:测试集 UNK 有多少张?
官方未单独公布;Frontiers Med 2026 单源口径 2,047 张(24.9%),待官方 GT CSV 核验(坑 8)。

C. 任务与评估

Q15:主指标怎么算?
balanced multi-class accuracy = 各类 TP/positives 的算术平均(等价 average recall);平局以 AUC 打破。

Q16:为什么不用 accuracy?
NV 占 50.8% 会主导 accuracy;官方 rationale 是 balanced 口径"更接近皮肤科医生的真实评估"。

Q17:validation score 是什么?
约 100 张预置非代表性子集上的 sanity check 分(随机提交约 0.3),官方明言不用于排名——防刷榜设计。

Q18:Task 1 和 Task 2 差在哪?
Task 2 可用 metadata;Task 2 选手必须同时提交 Task 1;两赛道各设前三名奖金。

Q19:评分代码可审计吗?
是。isic-challenge-scoring 包开源、宽松许可,官方为外部审计而发布。

Q20:还计算哪些指标?
sensitivity/specificity/accuracy/AUC/mAP/F1/AUC80/PPV/NPV 与聚合口径(平均 AUC、恶性 vs 良性、分类别 AUC),但排名只看 balanced accuracy。

D. 结果与基准

Q21:谁拿了冠军?成绩多少?
Gessert 等(TU Hamburg/UKE),多分辨率 EfficientNets 集成:Task 1 63.6%、Task 2 63.4%,双任务第一(arXiv:1910.03910 官方备注 First place)。

Q22:第二名第三名是谁?
PMC 口径 legacy 前三:2nd Cancerless(63.8)、3rd ForCure(64.8)——表内数值与名次倒挂存照(坑 5),官方名次以冠军自述+官方榜为准。

Q23:live leaderboard 是怎么回事?
官方 2019 榜于 2024 重开为持续开放的 live 榜(64 队):1st DAISYLab 0.636(当年冠军同机构同值)、2nd DysionAI 0.607、3rd AImageLab & PRHLT 0.593。

Q24:为什么文献里 0.92+ 的成绩比官方 63.6% 高这么多?
口径三重不同:自切分 vs 官方测试集、accuracy vs balanced accuracy、无 UNK vs 含 UNK——不可同表(坑 6)。

Q25:unknow 类怎么处理?
主流做法用外部数据(如 SD-198)训练第 9 类;也有阈值法/层级外类判定。冠军方法用外部数据补充训练集外病类。

Q26:奖金多少?谁发的?
每赛道前三 $4,000/$2,000/$1,000,Canfield Scientific 提供,2019 年 10 月深圳 MICCAI 工作坊后发放。

E. 使用与库内

Q27:我想只下载 HAM10000 那 10,015 张,用下 2019 包吗?
不必。直接用 ham10000(rid 60)条目的原始渠道;2019 包的价值在统一 8 类标签与官方协议。

Q28:用 2019 聚合包发表论文要怎么引用?
按官方要求三源分别署名(§6.3)+ 引用 Codella 2018 challenge 论文与 Tschandl 2018;BCN 部分加引 Hernández-Pérez 2024。

Q29:切分验证集要注意什么?
按 lesion_id 分组切分(group split),防 multiplets 泄漏;2,084 张缺 lesion_id 的图显式处理(坑 10)。

Q30:库内还有哪些相关条目?
isic-archive(rid 56,仓库层)、ham10000(rid 60,2018 届训练集)、bcn20000(rid 161,巴塞罗那源)——数据层细节都在那三条。

Q31:ISIC 2020/2024 在哪了解?
官方页面与 Rotemberg et al. 2020 论文(2020 届,33,126 train,DICOM,patient-centric);2024 挑战与 MILK10k 见 challenge.isic-archive.com 现行主页。库内暂无独立条目。

Q32:这届比赛对中国团队意义?
中国机构在前 35 名密集出现(鼎视智慧/北理工/中山大学/腾讯医疗 AI/南方医科大/中科院自动化所等),鼎视智慧曾以官方 live 榜前排成绩见诸中文报道——皮肤影像是当年中国医学 AI 国际竞赛参与度最高的赛道之一。

F. 工程与复现细节

Q33:官方提交格式是什么?
逐行 one-hot 的 CSV(8 或 9 列),提交系统自动做格式校验并即时返回 validation score;格式错误的常见翻车点是列序与图号对不上(validation score 会异常低,随机提交约 0.3 可作对照)。

Q34:怎么复算官方成绩?
挑战后测试 GT 已公开:下载 ISIC_2019_Test_GroundTruth.csv,按 §3.3.1 骨架或 isic-challenge-scoring 包复算 balanced accuracy;AUC 破平局逻辑以官方包为准。

Q35:多分辨率输入具体怎么做?
冠军路线是"多模型多尺度":为 EfficientNet 不同变体配置不同输入分辨率与裁剪(同尺寸裁剪/随机缩放裁剪),分别训练后子集搜索集成;单模型路线则是保持长宽比的缩放+随机裁剪增强。

Q36:metadata 缺值怎么处理?
age_approx/anatom_site_general/sex 均有缺值(测试集口径 “Other/unknown” 占比可观);常规做法是缺失类别化(unknown 列)——冠军的 dense 分支同样以类别嵌入处理,不建议均值插补。

Q37:想在 ISIC 2019 上练长尾方法,最该盯哪些类?
DF(239)、VASC(253)、SCC(628)、AK(867)四个长尾类的每类敏感度几乎决定 balanced accuracy 的上限;NK/平衡项调好后再看这四类的混淆矩阵收益最大。

Q38:官方测试集分布和训练集有什么已知差异?
测试集含 24.9% UNK(单源口径)且官方未承诺类别比例与训练集一致——这正是"闭集冠军在开放集上掉分"的结构性原因;复现时不要按训练集类别先验外推测试集。

Q39:现在提交还能上榜吗?
能。官方 2019 leaderboard 已重开为持续开放的 live 榜(64 队在案),提交走官方系统;注意排名按当前协议与评分权重,与 2019 年历史快照不完全同口径。

Q40:引用本条目数据时应报哪个抓取时点?
2026-09-28(官方页面/leaderboard/论文快照时点);官方 live 榜与文献计量类数字随时间变化,引用时注明时点是本库条目的通用要求。

G. 口径与合规

Q41:ISIC 2019、ISIC 2018、HAM10000 三者的 GT 有什么区别?
2018 届 GT=HAM10000 的 7 类口径;2019 届 GT=25,331 张的 8 类 one-hot(HAM 子集按 8 类体系重排,BKL 为合并类);三者类目映射与重审历史不同——同一张图在不同包里可能对应不同标签集合,引用必须注明 GT 版本。

Q42:可以在 Kaggle 上下完直接商用吗?
不可以。CC-BY-NC 不覆盖商业使用;且部分第三方镜像 license 标注有误(坑 9),商用授权需另行获得权利方(三源版权方)许可。

Q43:这篇条目和库内 ham10000 条目有重复吗?
无重复风险:本条目是挑战赛事件条目,数据层已按 §5/附录 O 分工声明指向 rid 60/161/56;ham10000 条目继续承载其数据本体细节。

Q44:用 ISIC 2019 训练的模型发论文,数据声明怎么写最稳?
四要素:训练集版本(ISIC 2019 Training,25,331 张)、外部数据清单(若有)、切分方式(按 lesion_id 分组)与指标口径(balanced accuracy 或注明 accuracy);许可声明附三源署名句。

Q45:冠军团队和 DAISYLab 到底什么关系?
同机构同方法谱系(TU Hamburg/UKE 的多分辨率 EfficientNets 集成),且 live 榜第一名的 0.636 与当年官方成绩 63.6% 精确一致;官方未发布正式说明,本条目按"机构+数值+方法三重吻合作一致性陈述"处理,不作超出证据的断言(§4.1)。

Q46:测试 GT 里的 scoring/validation weights 是什么?
官方测试 GT 文件(454KB)附带的评分与验证权重——官方评分器用它计算加权指标;自实现复算时若忽略权重,结果可能与官方口径有细微出入,建议直接用 isic-challenge-scoring。

Q47:BCN20000 为什么只进了一部分(12,413/20,000)?
BCN20000 全集 20,000 张中仅部分随 2019 届进入聚合包(MMU 口径 12,413),其余后续进入 2020 届——官方未逐张公布取舍标准;用 BCN 研究时引用其官方条目(rid 161)与期刊版论文(Hernández-Pérez 2024),勿把 20,000 全集与 2019 聚合包划等号。

Q48:ISIC 2019 会过期吗?
数据包长期有效(官方存档+live 榜持续开放);但"成绩快照"类数字(live 榜名次、文献计量)会随时间漂移——引用时注明时点,本条目维护计划见附录 N。

事实清单(硬事实 48 条)

  1. ISIC 2019 是 ISIC 主办的第 4 届皮肤病变分析挑战赛(2016/2017/2018/2019 序列)
  2. 训练集 25,331 张皮肤镜 JPEG,8 类 one-hot ground truth,9.1GB
  3. 测试集 8,238 张 JPEG,3.6GB,9 类口径(8 known+UNK)
  4. 合计 33,569 张
  5. 训练类别分布:MEL 4,522 / NV 12,875 / BCC 3,323 / AK 867 / BKL 2,624 / DF 239 / VASC 253 / SCC 628(四源互证)
  6. NV 占 50.8%,DF 0.9%,最大最小类比约 54:1
  7. 训练集来源:HAM10000 10,015(全集)+ BCN20000 12,413(MMU 口径)+ MSK ≈2,903(倒推)
  8. 相对 2018 届新增 SCC 类(628 张)与 BCN 源
  9. 图像分辨率 450×600 至 1024×1024
  10. 训练 metadata:age_approx/sex/anatom_site_general/lesion_id
  11. lesion_id 有值 23,247 张、缺失 2,084 张;唯一 ID 11,848 个
  12. 测试 metadata 无 lesion_id
  13. 测试图像计划发布日 2019-08-02(官方"planned release")
  14. 测试 metadata 2019-08-16 发布;Task 1 截止 2019-08-16;Task 2 截止 2019-08-23
  15. Task 2 参与者必须同时提交 Task 1
  16. 参赛者必须提交方法论文链接(官方要求)
  17. 主指标 balanced multi-class accuracy = 各类 TP/positives 算术平均 = average recall
  18. 平局以 AUC 打破;排名与颁奖只看 balanced accuracy
  19. 其他指标:sens/spec/acc/AUC/mAP/F1/AUC80/PPV/NPV
  20. validation score 基于约 100 张非代表性子集,仅 sanity check,随机提交约 0.3
  21. 评分代码 isic-challenge-scoring 开源可审计
  22. 奖金每赛道 $4,000/$2,000/$1,000,Canfield Scientific 提供
  23. 奖金在 2019 年 10 月深圳 MICCAI 工作坊后发放;官方页面另有 CVPR 2019 残留文本(存照矛盾)
  24. 赞助商:Canfield Scientific、IBM、MetaOptima
  25. Clinical Chairs:Malvehy(巴塞罗那)/ Halpern(MSKCC);CV Chair:Codella(IBM Research)
  26. 冠军:Nils Gessert 等 5 人(TU Hamburg/UKE),官方测试集 Task 1 63.6% / Task 2 63.4% 双第一
  27. 冠军方法:多分辨率 EfficientNets 集成+loss balancing+外部数据补 UNK+metadata dense 融合+集成子集搜索;CV 集成 BA 74.2%
  28. live leaderboard(2024 重开,64 队):DAISYLab 0.636 / DysionAI 0.607 / AImageLab & PRHLT 0.593
  29. legacy 前三(PMC 口径):Gessert 63.6 / Cancerless 63.8 / ForCure 64.8(名次-数值倒挂存照)
  30. license CC-BY-NC;三源分别署名为强制(MSK 匿名句不可省)
  31. 官方 data 页现提供测试 GT(454KB,含 scoring/validation weights)——挑战期间标签不公开的双口径
  32. 测试集 UNK 2,047 张(Frontiers Med 2026 单源,待核)
  33. 文献自切分成绩 0.92-0.95 accuracy 与官方 63.6% balanced accuracy 三重口径不可比
  34. UNK 外部数据主流源为 SD-198(arXiv:2101.03814 口径)
  35. 官方指定引用:Codella et al. 2018(arXiv:1902.03368)+ Tschandl 2018(Sci Data 5:180161)+ Codella 2017(arXiv:1710.05006)+ Hernández-Pérez 2024(Sci Data 11:641)
  36. 2024+ 官方转向 ISIC 2024 挑战与 MILK10k 基准;2019 live 榜仍开放
  37. 官方提交格式为逐行 one-hot CSV,提交系统自动格式校验并即时返回 validation score
  38. 官方页面注明 2019 届两赛道任务相似,共用同一页描述(模板自注)
  39. IEEE SPS 将 ISIC 2019 列入官方 data challenges 列表
  40. 组委会规则:委员会成员所属机构可参赛但须保证提交独立
  41. 图像命名 ISIC_xxxxxxx.jpg,图号是跨包稳定键(去重主键)
  42. 测试集 UNK 行在官方 GT 中表现为 8 known 列全 0、UNK 列置 1
  43. 官方测试 GT 文件"includes the scoring and validation weights"(含评分与验证权重)
  44. 训练集含同一病变不同放大倍率的多倍图(官方明言为数据集特色)
  45. 唯一图号键 ISIC_xxxxxxx 跨包稳定,可作多包联合去重主键
  46. live 榜前排 10 队中仅 3 队公开方法描述(官方透明度引导的自愿特征)
  47. metadata 各字段存在缺失(部位/性别缺值约 4% 量级,测试镜像口径),缺失模式可能携带中心/设备信息
  48. BCN20000 全集 20,000 张中仅部分进入 2019 聚合包,取舍标准官方未逐张公布

术语表(32 条)

术语 英文 释义
ISIC International Skin Imaging Collaboration 国际皮肤影像协作组,挑战赛主办方
皮肤镜 dermoscopy 带浸润液与放大的皮肤成像模态,皮肤癌诊断标准工具
黑色素瘤 melanoma 最致命的皮肤癌,MEL 类
黑色素细胞痣 melanocytic nevus 良性痣,NV 类,训练集第一大类
基底细胞癌 basal cell carcinoma 最常见皮肤恶性肿瘤,BCC 类
鳞状细胞癌 squamous cell carcinoma SCC 类,2019 届新增类别
光化性角化病 actinic keratosis 癌前病变,AK 类
良性角化病 benign keratosis BKL 类(日光性黑子/脂溢性角化病/扁平苔藓样角化病合并类)
皮肤纤维瘤 dermatofibroma 良性病变,DF 类,最小类(239 张)
血管病变 vascular lesion VASC 类
UNK unknown / None of the others 测试集专属未知类,训练分布外图像
balanced accuracy normalized multi-class accuracy 各类敏感度算术平均,主指标
平均召回率 average recall 与主指标语义等价
AUC80 AUC between 80-100% sensitivity 高敏感度区间的 AUC 积分,官方辅助指标
长尾分布 long-tailed distribution 少数类占绝大多数样本的分布形态
损失平衡 loss balancing 按类频加权损失函数应对失衡
多分辨率集成 multi-resolution ensemble 不同输入分辨率的模型组合
集成子集搜索 ensemble subset search 从候选池搜索最优模型组合
元数据融合 metadata fusion 结构化临床信息与图像特征拼接
开放集识别 open-set recognition 识别训练类之外的未知类
分布外检测 out-of-distribution (OOD) detection 判别输入是否偏离训练分布
病变多倍图 lesion multiplets 同一病变多张不同倍率图像
组切分 group split 按病变/患者 ID 聚类的数据切分
验证分 validation score 预置小子集上的提交自检分,不用于排名
读片研究 reader study 算法与医生表现的对照实验
野外图像 in the wild 多设备多条件非受控采集的图像
患者中心切分 patient-centric split 按患者而非图像划分数据集(2020 届引入)
金标准标签 gold standard 专家共识级诊断标签
感知哈希 perceptual hash (phash) 图像内容相似性指纹,近重复检测常用
阈值拒识 confidence thresholding 低于置信度阈值的输入判为未知类
版本链 version lineage 同一基准跨年份演化的代际关系
数据卡 data card 数据集的标准化自描述文档(ISIC 2019 缺失项)

附录

附录 A:条目信息速查卡

字段 值
slug isic-2019
正式名 ISIC 2019 Challenge(Skin Lesion Analysis Towards Melanoma Detection 2019)
条目类型 挑战赛条目(事件层);数据层指向 rid 56/60/161
主办 ISIC(MSISCC)
年份 2019(数据 2019 年发布,获奖收节点 2019-10 深圳 MICCAI)
规模 25,331 train + 8,238 test
license CC-BY-NC(三源分别署名强制)
主指标 balanced multi-class accuracy
冠军 Gessert et al., BA 63.6%(T1)/ 63.4%(T2)
官方渠道 challenge.isic-archive.com/data/
抓取时点 2026-09-28

附录 B:DAIMS 评估全表

维度 评分 依据
D1 可发现性 ★★★★★ 官方站+DOI 论文链+IEEE SSP 收录+大量文献引用,可发现性满分档
D2 可获取性 ★★★★★ 官方直链下载(训练 9.1GB/测试 3.6GB/GT/metadata 全套)+API,无需注册审批
D3 格式可用性 ★★★★☆ JPEG+CSV 标准工具链直读;非 DICOM(2020 届才改进)扣半星
I1 标注完整性 ★★★★☆ 训练集全量 8 类 gold standard+四字段 metadata;测试 GT 后补公开;无像素级标注
I2 标注质量 ★★★★☆ 三来源均为专家级皮肤镜诊断(HAM/BCN 各有 Sci Data 论文背书);类目合并(BKL 三病合一)降低粒度
M1 机器可读文档 ★★★☆☆ 官方页有任务/指标/署名说明,但无数据卡;采集设备/人口学分布要查来源论文
M2 伦理合规 ★★★☆☆ CC-BY-NC 明确+MSK 匿名;但无患者知情/IRB 细节披露(在来源论文层)
S1 可持续性 ★★★★★ 挑战站 [Closed] 后数据仍全量可取+测试 GT 公开+live 榜持续开放,五年维护良好
综合 4.1/5 AI-Ready 早期标杆;短板在文档层而非格式层

附录 C:逐项证据链自证

硬数字 一手来源 交叉验证
25,331 train / 8,238 test 官方 challenge2019.isic-archive.com(抓取 2026-09-28) MMU Sci Dir 2021 表 5;Frontiers 2026;ACM 2023
8 类分布(4522/12875/3323/867/2624/239/253/628) MMU Sci Dir 2021 表 3 MDPI Appl. 2022 表 1(绝对数);IET 2023(百分比);Frontiers 2026
三源构成(10015/12413/≈2903) MMU Sci Dir 2021 表 4 倒推校验 25,331−22,428=2,903;官方署名三句(来源归属)
Task 截止日 08-16/08-23 官方页面(抓取原文) openi.pcl.ac.cn 官方文本转载
balanced accuracy 定义 官方页面 Evaluation 节(抓取原文) IET 2023(“average sensitivity among classes”)
奖金 $4000/$2000/$1000 官方页面 Awards 节(抓取原文) —(单源官方)
冠军 63.6%/63.4% arXiv:1910.03910 摘要 PMC8055397 表 2(Gessert 行 63.6)
live 榜 DAISYLab 0.636 / DysionAI 0.607 challenge.isic-archive.com/leaderboards/2019(搜索快照 2026-09-28) PMC8055397(Gessert 63.6 与 DAISYLab 同值同机构互证)
lesion_id 统计(23,247/2,084/11,848) MMU Sci Dir 2021 —(单源分析口径,标注)
UNK 2,047 Frontiers Med 2026 —(单源,坑 8 存照)
测试 GT 现已公开(454KB) challenge.isic-archive.com/data/(抓取) ACM 2023(同期文献口径"not publicly available"——时间差存照)

附录 D:数据获取决策树

需要 ISIC 2019 数据?
├─ 只要 HAM10000 子集 → 走 ham10000(rid 60)原始渠道,不碰 2019 包
├─ 只要 BCN20000 子集 → 走 bcn20000(rid 161)原始渠道
├─ 要完整官方协议(复现/打榜)
│   ├─ 官方 data 页下载:train 9.1GB + GT + test 3.6GB + test GT + metadata
│   ├─ 评分:isic-challenge-scoring(开源)+ 官方测试 GT 复算
│   └─ 署名:三源分别署名(坑 7)
├─ 只要 MSK 增量(≈2,903 张)→ ISIC Archive API(rid 56)按源筛选
└─ 要患者级纵向数据 → 改用 ISIC 2020(patient-centric,DICOM)

附录 E:许可条款细读

条目 官方口径 实操含义
license CC-BY-NC 学术可用,商业受限
署名 三源分别注明(BCN/HAM/MSK) 论文数据声明三句齐全;MSK 匿名句不可省
再分发 CC-BY-NC 框架下可共享改编 携带同样署名与 NC 约束
模型权重 官方未表态 领域惯例可用;建议产品声明注明数据许可
第三方镜像 andrewmvd=CC BY-NC 4.0(正确);agsam23=CC0(误标) 一律以官方页为准(坑 9)
引用 Codella 2018 + Tschandl 2018 + 三源句 Hernández-Pérez 2024(BCN 部分期刊版)

附录 F:坑点档案(与 §10 对照)

坑号 一句话 后果
坑 1 ISIC 2019 非独立新数据集(88.5% 重叠) 重复收录/重复下载
坑 2 训练 GT 8 列,第 9 类只在测试 标签错位/找错列
坑 3 官方页 CVPR 2019 残留文本 vs MICCAI 深圳 获奖时间线写错
坑 4 Gessert 被拼成 Gassert 文献检索漏检
坑 5 legacy 2/3 名数值倒挂;媒体"第一名"快照口径 名次写错
坑 6 63.6% 与 0.92+ 三重口径差 虚假对比表
坑 7 三源署名缺一即违规 license 违约
坑 8 UNK 2,047 为单源数字 数字失据
坑 9 Kaggle 镜像 CC0 误标 license 误用
坑 10 multiplets 随机切分泄漏 虚高成绩

附录 G:双口径登记表

# 口径 A 口径 B 处理
1 官方页"results presented @ CVPR 2019" 同页"奖金 MICCAI 2019 深圳 10 月后发" 按 MICCAI 口径成稿,CVPR 句存照(模板残留)
2 挑战期间测试标签不公开(ACM 2023 等) 现官方 data 页提供测试 GT 454KB 按时间点分别陈述(挑战后公开)
3 legacy 前三数值 Gessert 63.6 < Cancerless 63.8 < ForCure 64.8 官方名次 Gessert 第一 名次以冠军自述+官方榜为准,表内数值存照
4 PMC 拼写 “Gassert” arXiv 作者页 “Nils Gessert” 以 arXiv 为准;检索两拼法都试
5 BCN 进入 2019 训练集 12,413(MMU) BCN 官方论文 19,424 进入 2019+2020 合并 两口径不同集合,不可对表;条目用 MMU 口径+注
6 MSK 增补 ≈2,903(倒推) MMU MSK 系合计 2,918 差 15 张口径未明,存照
7 UNK 2,047(Frontiers 2026) 官方未单独公布 单源存照,以官方 GT CSV 核验为最终依据
8 中文报道"鼎视智慧第 1 名(基于公开数据)"(2019-08-30) 当前 live 榜 DysionAI 第 2(0.607) 两口径均为真(时间点不同),并存陈述
9 训练数据发布日官方未标注 多源仅可上溯"2019 年内" 遗留疑点
10 2019 届原始参赛队数官方未公布 live 榜 64 队(2024 重开累计) 勿混用,条目按官方未公布处理

附录 H:引文规范(BibTeX 友好格式)

挑战赛数据引用(官方要求):
  Codella N, Rotemberg V, Tschandl P, et al. Skin Lesion Analysis Toward
  Melanoma Detection 2018: A Challenge Hosted by the International Skin
  Imaging Collaboration (ISIC). arXiv:1902.03368.
  Tschandl P, Rosendahl C, Kittler H. The HAM10000 dataset. Sci Data
  5, 180161 (2018). doi:10.1038/sdata.2018.161

三源署名(CC-BY-NC 强制):
  BCN_20000 Dataset: (c) Department of Dermatology, Hospital Clínic de Barcelona
  HAM10000 Dataset: (c) by ViDIR Group, Department of Dermatology, Medical
    University of Vienna; https://doi.org/10.1038/sdata.2018.161
  MSK Dataset: (c) Anonymous; https://arxiv.org/abs/1710.05006 ;
    https://arxiv.org/abs/1902.03368

冠军方法论文:
  Gessert N, Nielsen M, Shaikh M, Werner R, Schlaefer A. Skin Lesion
  Classification Using Ensembles of Multi-Resolution EfficientNets with
  Meta Data. arXiv:1910.03910 (2019).

BCN20000 期刊版:
  Hernández-Pérez C, Combalia M, Podlipnik S, et al. BCN20000: Dermoscopic
  lesions in the wild. Sci Data 11, 641 (2024).

附录 I:与库内 ham10000/bcn20000/isic-archive 条目的关系声明(强制分工)

本条目(isic-2019)为挑战赛事件条目:任务设计(§3)、冠军方法(§4)、基准演化(§7)为本体内容。数据层声明:训练集 25,331 张图像全部来自三个既有来源,其中 HAM10000(10,015 张,采集/标注/患者口径)归 ham10000(rid 60)条目;BCN20000(12,413 张,MMU 口径)归 bcn20000(rid 161)条目;MSK 系(≈2,903 张)的仓库层归属 isic-archive(rid 56)条目。本条目仅记录聚合关系、增量(SCC 类、UNK 协议)与重复性风险,不重复三条目的数据本体内容。若三条目与官方口径出现数据层冲突,以各来源论文与官方 data 页为准并在相应条目维护。

附录 J:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✓ 官方挑战站+arXiv 引用体系
F2 丰富元数据 ◐ 官方页有协议文档,无数据卡
F3 明确引用标识 ✓ 官方给出标准引用文本
A1 可元数据检索 ✓ IEEE SPS/官方站/论文生态
A2 元数据可访问 ✓ HTTP 页面公开
A3 数据可访问 ✓ 公开直链+API
I1 互操作格式 ✓ JPEG+CSV
I2 通用词表 ◐ 类别有官方缩写(MEL/NV/…),无 SNOMED 映射文件
R1 溯源 ✓ 三源署名+版本链清晰
R2 许可 ✓ CC-BY-NC 明示(署名义务详见坑 7)
R3 社区维护 ✓ live 榜持续开放+评分代码开源

附录 K:检索路径示范(关键词组合与查询式)

官方口径检索:
  "ISIC 2019" challenge site:challenge.isic-archive.com
  challenge2019.isic-archive.com  (历史域名,现 [Closed] 重定向)

冠军与排行榜:
  Gessert EfficientNets ISIC 2019        /  arXiv:1910.03910
  DAISYLab ISIC leaderboard              /  DysionAI ISIC

数据构成与重复性:
  ISIC 2019 HAM10000 BCN20000 MSK composition
  "ISIC 2019" "25,331" training images
  ISIC datasets overlap analysis  (MMU Sci Dir 2021 系核心文献)

协议与指标:
  "ISIC 2019" "balanced accuracy" unknown class
  isic-challenge-scoring github

避坑检索:
  Gessert OR Gassert ISIC 2019           (坑 4 双拼法)
  "ISIC 2019" UNK "2047" OR "2,047"      (坑 8 待核数字)

附录 L:官方页面关键原文摘录(口径锚点)

主题 官方原文(challenge2019.isic-archive.com,抓取 2026-09-28)
任务 “The goal for ISIC 2019 is classify dermoscopic images among nine different diagnostic categories”
UNK “the test dataset (planned release August 2nd) will contain an additional outlier class not represented in the training data, which developed systems must be able to identify”
赛道 “Two tasks will be available for participation: 1) classify dermoscopic images without meta-data, and 2) classify images with additional available meta-data.”
截止 “Task 1’s deadline will be August 16th. Task 2 will be August 23th, after release of test meta-data on August 16th.”
强制论文 “each competitor is required to submit a link to a manuscript describing the methods used to generate predictions”
指标定义 “the arithmetic mean of the (<category>_true_positives / <category>_positives) across each of the diagnostic categories… semantically equivalent to the average recall score”
平局 “Tied positions will be broken using the area under the receiver operating characteristic curve (AUC) metric.”
rationale “…we want to rank for the more ambitious metric of normalized multiclass accuracy, as it is also closer to real evaluation of a dermatologist.”
验证分 “This validation score is not intended to be used for algorithm ranking or evaluation… a random submission generates a validation score of about 0.3.”
评分审计 “The code of the isic-challenge-scoring package is used for actual score computation. This code is open source, permissively licensed, and published, to facilitate external auditing.”
奖金 “Cash prizes of $4,000, $2,000, and $1,000 will be awarded to the first, second, and third place participants of image-only and meta-data tasks.”
发放时点 “The monetary prizes for the winners of the challenge will be awarded after the MICCAI Workshop in Shenzhen, China, in October 2019.”
矛盾存照 “The results are presented at the ISIC Skin Image Analysis Workshop @ CVPR 2019.”(与 MICCAI 口径并存,见坑 3)
署名 “the aggregate ‘ISIC 2019: Training’ data must be cited as: BCN_20000 Dataset… HAM10000 Dataset… MSK Dataset…”

附录 M:缩写速查

缩写 全称 中文
ISIC International Skin Imaging Collaboration 国际皮肤影像协作组
MSKCC Memorial Sloan Kettering Cancer Center 纪念斯隆-凯特琳癌症中心
UKE University Medical Center Hamburg-Eppendorf 汉堡-埃彭多夫大学医学中心
MEL/NV/BCC/AK/BKL/DF/VASC/SCC/UNK 九个诊断类别缩写 见 §2.2 表
BA balanced multi-class accuracy 简写 平衡多类准确率
OOD out-of-distribution 分布外
TTA test-time augmentation 测试时增强
PPV/NPV positive/negative predictive value 阳性/阴性预测值
GT ground truth 金标准标签
CV cross-validation 交叉验证(本条目语境)
GT CSV 官方 ground truth 表格文件 训练 8 列 / 测试 9 列(含 UNK)

附录 N:维护计划与触发点

触发点 动作
官方 live leaderboard 名次变动(如 DysionAI/新队登顶) 更新 §4.3/§7.2 与 INFOBOX 排行数字,登记抓取时点
UNK 数量获得第二来源或官方公布 移出存照,升级为互证事实(§2.4/坑 8)
官方对训练数据发布日/2019 原始参赛队数补充口径 消除遗留疑点(§9)
MILK10k/ISIC 2024 基准被库内收录 更新 §7.1 版本链与 §9 下游互链
第三方镜像 license 标注变化 复核坑 9 表
读者反馈训练集构成与官方 GT CSV 不符 以 GT CSV 为准修订 §2.1/§2.2 并存照

附录 O:与库内条目的数字分工对照(防重复引用错位)

数字 本条目口径 归属条目口径 不得混用处
HAM10000 10,015 张 仅作为"2019 训练集来源占比"出现 ham10000(rid 60) 条目详述其采集/标注/病例结构 本条目不写 HAM 的 7 类标签细节与病例结构
BCN 12,413 张(MMU 口径) 仅作为来源贡献数字 bcn20000(rid 161) 条目详述"野外"设备谱系 本条目不展开 BCN 采集协议细节
MSK 匿名源 仅署名句+倒推数字 isic-archive(rid 56) 条目承载仓库层 本条目不写 MSK 系子数据集清单细节
25,331/8,238/协议/冠军 本条目本体 三条目均不承载 —

附录 P:ISIC 挑战赛 2016-2024 全系大事记

年份 事件 与 2019 届的关系
2016 首届挑战(ISBI 2016,二分类 900 train/379 test) 协议雏形:官方评测+workshop 公布
2017 ISBI 2017 挑战(3 类,2,000 train) 官方引用链中的 Codella 2017(arXiv:1710.05006)即此届
2018 挑战扩容(7 类,10,015 train=HAM10000 全集);官方论文 arXiv:1902.03368 2019 届的图像基底与官方指定引用来源
2019 第 4 届:三源聚合 25,331 train + UNK 协议 + balanced accuracy 定标 本条目
2020 第 5 届:33,126 train(DICOM/patient-centric,Rotemberg et al.) 吸收 UNK 教训,升级患者级切分
2021-2023 数据包长期开放;MMU 系统分析(2021)、自切分文献海量涌现 本条目引用链的文献主体
2024 官方重开 2019 live leaderboard;ISIC 2024 挑战(SLICE3D) live 榜 64 队在案,冠军团队仍居首
2025-2026 官方主推 MILK10k 基准 官方页现行动态;2019 数据包继续全量开放

附录 Q:泄漏自查清单(用 ISIC 2019 做训练必查)

# 检查项 工具/方法
1 训练与验证集有无同 lesion_id 样本 group split(§8.5)+ 断言校验
2 训练与验证有无内容近重复(重压缩/裁剪变体) phash 汉明距离 ≤4 人工复核(§5.4)
3 是否误把 2019 训练集图当作 2018/2020 包的独立样本 按 ISIC 图号取交集(§5.4 工序一)
4 无 lesion_id 的 2,084 张是否自成一组 fillna(image) 处理后复查组数
5 外部数据是否与测试集同源(SD-198 与 UNK 测试图的潜在重叠官方未排查) 声明外部数据清单;避免用官方测试图号
6 验证指标是否 balanced 口径 balanced_accuracy_score(macro recall)
7 是否用测试集调过参(官方协议禁止) 测试评估一次性;调参只在自留验证集

附录 R:官方 live leaderboard(2019 榜)前十名快照(2026-09-28)

名次 队伍 机构 方法 是否公开描述 balanced accuracy
1 DAISYLab TU Hamburg / UKE Ensemble of Multi-Res EfficientNets + SEN154 是 0.636
2 DysionAI DYSION AI, Inc(北京鼎视智慧) EfficientNetB3-B4-Seresnext101 集成 否 0.607
3 AImageLab & PRHLT Unimore & UPV ensemble, OOD threshold 否 0.593
4 DermaCode — 13 models + hierarchical outlier selection 否 0.578
5 Nurithm Labs Nurithm Labs DenseNet-161 + random crops 是 0.569
6 Torus Actions — 简单测试策略 否 0.563
7 BITDeeper 北京理工大学 MelaNet 深度密集注意力网络 否 0.558
8 SYSU-MIA-Group 中山大学 类中心开放集分类 否 0.557
9 MelanoNorm_IITRopar 印度理工学院鲁尔基 Stacking + 长尾分布 否 0.546
10 MH_team — Softmax/Sigmoid 集成 否 0.544

读表三注:①该榜为 2024 年重开的持续提交榜(64 队累计),非 2019 年原始快照;②第 1 名与 2019 冠军同机构同数值(0.636=63.6%),互为印证;③"是否公开描述"一列说明官方对方法透明的引导——前排 10 队中仅 3 队公开描述。

附录 S:数字索引(按主题分组的硬数字速查)

规模类:训练 25,331(9.1GB)|测试 8,238(3.6GB)|合计 33,569|分辨率 450×600 至 1024×1024|唯一 lesion ID 11,848|lesion_id 有值 23,247/缺失 2,084|UNK 2,047(单源)

类别类:MEL 4,522(17.8%)|NV 12,875(50.8%)|BCC 3,323(13.1%)|AK 867(3.4%)|BKL 2,624(10.4%)|DF 239(0.9%)|VASC 253(1.0%)|SCC 628(2.5%)|最大最小类比 ≈54:1|恶性三类合计 8,473(33.4%)

来源类:HAM10000 10,015|BCN20000 12,413(MMU 口径)|MSK ≈2,903(倒推)|重叠率 88.5%(22,428/25,331)

赛程类:测试图计划 2019-08-02|测试 metadata 2019-08-16|Task 1 截止 2019-08-16|Task 2 截止 2019-08-23|奖金节点 2019-10 深圳 MICCAI 后

成绩类:冠军 T1 63.6% / T2 63.4%|冠军 CV 集成 74.2%|live 榜 DAISYLab 0.636 / DysionAI 0.607 / AImageLab & PRHLT 0.593|验证分随机基线 ≈0.3|validation 子集 ≈100 张

协议类:奖金 $4,000/$2,000/$1,000 × 2 赛道|赞助 3 家(Canfield/IBM/MetaOptima)|组委会 9 人(2 Clinical Chairs + 1 CV Chair + 7 Co-Chairs,含身份重合口径见 §3.4)|评分代码 1 套(isic-challenge-scoring 开源)

附录 T:本条目生产档案

项 值
写手代理 agent-d-isic2019
开工时间 2026-09-28T13:04(锁文件 writing/isic-2019/.lock)
任务书 rsi_dispatch/task_isic-2019.md(2026-09-26 v3 纪律包)
开工三查 锁:不存在→自建;ps aux grep -c “[c]odebuddy” = 4;临时文件 /tmp/isic-2019_agent-d-isic2019_part1-5.md
核验结论 ISIC 2019 真实存在(官方站+arXiv+IEEE SPS+四路文献);与库内 rid 56/60/161 数据层高重叠、事件层独立——按用户指示走"独立挑战赛条目+分工声明"路线成稿
研究来源 官方 challenge2019.isic-archive.com(curl 全文);arXiv:1910.03910;Sci Dir S1361841521003509(MMU);IET cv2.12048;Frontiers fmed.2026.1841617;MDPI app112210593;PMC8055397;ACM 3616131.3616144;challenge2020 站口径;中文报道(cinic.org.cn);openi 镜像
成稿方式 5 part 直写拼接(每个 part 尾部空行)
双零自检 check_md.py PASS(0 ERROR / 0 WARN)+ preflight_check.py PASS(2026-09-28)

附录 U:数据层 vs 事件层速判(一图防撞库)

特征 数据集条目(如 ham10000/bcn20000) 挑战赛条目(本条目)
核心内容 采集协议、标注流水线、病例结构 任务设计、评估协议、竞赛结果
数字主体 张数/患者数/设备谱系/类目细节 规模、时间线、指标、奖金、名次
时间属性 静态(数据定稿后不随时间变) 动态(榜单/文献计量随时间漂移)
重复风险 与同数据别名条目撞 与数据条目"看似撞"实为分工
撞库判据 数据本体同源即重复 数据重叠不触发,事件层独有即可成稿
维护触发 来源论文勘误/版本更新 榜单名次变动/新届发布/口径澄清

检索者判别口诀:问"图从哪来"走数据条目,问"比赛怎么打"走本条目;两问都有的工作流,按 §9.1.1 的路线图串行取材。

尾注

本条目由千方病案医数集写手代理 agent-d-isic2019 于 2026-09-28 编写。数据抓取时点 2026-09-28(官方页面、arXiv、leaderboard 快照);三源互证完成度:核心数字(25,331/8,238/类别分布/冠军成绩/时间线)四源以上互证;单源数字(UNK 2,047、lesion_id 统计)已逐条存照。事实档案见同目录 FACTS.md。本条目为挑战赛事件条目,与库内 isic-archive(rid 56)、ham10000(rid 60)、bcn20000(rid 161)构成"仓库层-来源层-事件层"分工,互为检索入口。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 评测基准 / 皮肤癌
  • skincon — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-2018 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 皮肤癌
  • derm12345 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
  • isic-archive — 共享标签:医学影像 / 皮肤影像 / 挑战赛数据集 / 皮肤癌
  • ph2 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
  • ddi — 共享标签:医学影像 / 皮肤影像 / 评测基准 / 皮肤癌
  • dermacon-in — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
  • bcn20000 — 共享标签:医学影像 / 皮肤影像 / 皮肤癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集