信息速览
INFOBOX — ISIC 2019 Challenge 一屏速览
维度 内容 本质 ISIC 主办的第 4 届皮肤镜病变分类挑战赛(2016/2017/2018/2019 序列之 2019 届);本条目是挑战赛条目,不是独立新图像数据集 任务 皮肤镜图像九类分类:8 个训练类 + 测试集专属 UNK 未知类;双赛道 Task 1(仅图像)/ Task 2(图像+metadata) 数据 训练 25,331 张(8 类)+ 测试 8,238 张(9 类);分辨率 450×600 至 1024×1024 来源 HAM10000 10,015 + BCN20000 12,413 + MSK ≈2,903(倒推口径)——全部为既有图像,无新采集 类别分布 NV 12,875(50.8%)> MEL 4,522 > BCC 3,323 > BKL 2,624 > AK 867 > SCC 628 > VASC 253 > DF 239 主指标 balanced multi-class accuracy(=各类 sensitivity 的算术平均);平局以 AUC 打破 时间线 测试图计划 2019-08-02 发布 → Task 1 截止 2019-08-16 → Task 2 截止 2019-08-23 → 获奖在 MICCAI 2019 深圳工作坊节点公布 奖金 每赛道前三名 $4,000/$2,000/$1,000(Canfield Scientific 提供) 冠军 Gessert 等(汉堡工业大学+UKE):多分辨率 EfficientNets 集成,Task 1 BA 63.6% / Task 2 BA 63.4%,双任务第一 license CC-BY-NC;署名须分别注明 BCN/HAM/MSK 三源(MSK 源匿名但署名句不可省) 基准地位 皮肤镜分类引用最广的公开基准之一;官方排行榜持续开放(2024 live 榜 64 队) 库内互链 isic-archive(rid 56)、ham10000(rid 60)、bcn20000(rid 161)——数据本体细节以这三条为准
ISIC 2019 Challenge 是皮肤影像 AI 领域的"成人礼"节点:它把前一年 HAM10000 带来的 10,015 张图像一下子扩到 25,331 张,把分类体系从 7 类扩到 8 类,更关键的是在测试集里埋进了一个训练集中从未出现过的"未知类"(UNK,None of the others),强迫参赛系统从"闭集分类器"进化为"能说不知道的开放集系统"。冠军团队 Gessert 等人用多分辨率 EfficientNets 集成拿下双任务第一(官方测试集 balanced accuracy 63.6%/63.4%),而这个 63.6% 与后续文献自切分动辄 0.92-0.95 的 accuracy 之间的巨大落差,正是这条基准留给领域的最重要提醒:医学影像分类的真实难度,只有在官方协议下才看得清。
需要特别声明的是本条目的定位与分工:ISIC 2019 训练集的图像全部来自三个既有数据源——HAM10000(库内 rid 60)、BCN20000(库内 rid 161)与 MSK 系图像(其主库已由库内 isic-archive 条目 rid 56 覆盖),本条目不重复展开数据采集与标注细节,聚焦挑战赛事件本身:任务设计、评估协议、时间线、冠军方法与基准演化。想下载图像本体或了解 HAM10000/BCN20000 的采集故事,请走 §9 的库内互链。
导语读法三则:
- 只想下数据跑基线:直奔 §6 获取与许可——注意 CC-BY-NC 的三源分别署名要求,以及"官方测试集 vs 自切分"的坑 6。
- 关心挑战赛设计与冠军方法:直奔 §3(协议与指标)与 §4(冠军方法解剖)——UNK 未知类协议与 loss balancing 是本届两大方法学遗产。
- 担心撞库重复:直奔 §5 分工声明——训练集 88.5% 图像已在库内 ham10000/bcn20000 条目收录,本条目按"独立挑战赛条目"成稿的理由与边界都在那里。
§0 导读:这个挑战赛解决什么问题
皮肤癌是全球最常见的癌症,黑色素瘤(melanoma)是其中最致命的形态。皮肤镜(dermoscopy)作为改良的皮肤成像模态,已被证明比裸眼视诊更能提升皮肤癌诊断水平,但前提是临床医生接受过充分训练。为了让这种专长更广泛地可用,国际皮肤影像协作组(ISIC)建设了 ISIC Archive——一个国际性的皮肤镜图像库,既用于临床培训,也通过主办 ISIC 挑战赛支持自动化算法分析研究。这就是 2016-2024 年 ISIC 系列挑战赛的出发点,2019 届是其中的第 4 届。
2019 届要解决的问题有三层。第一层是规模与多样性:2018 届训练集(=HAM10000 全集)只有单一欧洲中心的 10,015 张图像,2019 届把巴塞罗那 BCN20000 的"野外"(in the wild)多设备图像并入,训练集扩到 25,331 张、三个来源中心,图像分辨率跨度从 450×600 到 1024×1024,更贴近真实临床的设备异质性。第二层是类别体系:在 2018 届 7 类基础上新增鳞状细胞癌(SCC,628 张),使恶性病变覆盖从"黑色素瘤 vs 痣"扩展到"黑色素瘤+鳞癌+基底细胞癌"三大皮肤恶性肿瘤。第三层是评估哲学:主指标从往届的二分类敏感度/特异度改为 balanced multi-class accuracy(各类敏感度的算术平均),官方理由是这"更接近皮肤科医生的真实评估";同时在测试集加入训练中不存在的 UNK 类,把"识别超出训练分布的病变"正式写进比赛协议。
§0 读法三则:
- 这个条目是"挑战赛事件+数据包+基准协议"三合一:事件层讲 2019 年夏天的比赛怎么打(§3/§4),数据层讲 25,331 张图怎么构成(§2),协议层讲 balanced accuracy 与 UNK 如何改变领域评测习惯(§3/§7)——三层各有独立检索价值。
- 全文硬数字均出自官方页面、冠军论文与三篇独立分析论文(MMU/IET/Frontiers),核心数字(25,331/8,238/类别分布)已达四源互证;双口径冲突逐条在坑点与存照节登记。
- 检索时最容易犯的错是把 ISIC 2019 当作一个"独立新数据集"去下载收录——训练集 88.5% 的图像已在库内 ham10000/bcn20000 两条目中(坑 1);其次是把文献自切分的 0.92+ accuracy 与官方测试集 63.6% 混为一谈(坑 6)。
为什么值得单独立条目:有人会问——图像都是既有的,比赛打完了,凭什么占一个条目?三个理由。其一,协议是一次性设计出来的公共品:balanced accuracy 的"医生视角"定义、UNK 开放集陷阱、防刷榜的验证分机制、开源评分代码,这四件套只存在于挑战赛事件里,任何一条数据集条目都承载不了。其二,排行榜是活的:官方 2019 榜重开为 live 榜后仍在接受提交,冠军五年未被公开超越——这个"基准的寿命"本身是事件属性。其三,口径混乱需要一个仲裁文本:63.6% vs 0.92+ 的落差每年都在制造错误对比表,本条目 §7.3/§8/附录 Q 就是为此而写的。
§1 数据集速览:十问十答
Q1:ISIC 2019 到底是"数据集"还是"比赛"?
两者都是,但本体是比赛。ISIC 2019 Challenge 于 2019 年举办,围绕一份 25,331 张训练图像 + 8,238 张测试图像的数据包展开;比赛结束后数据包成为公共基准长期被引用。本条目按"挑战赛条目"收录:比赛协议、时间线、冠军与基准演化是主内容,图像本体的采集细节以库内 ham10000/bcn20000/isic-archive 三条目为准(§5 分工声明)。
Q2:训练集 25,331 张图像从哪来?
三个既有来源聚合:HAM10000(维也纳 ViDIR 组,10,015 张,即 2018 届训练集全集)、BCN20000(巴塞罗那 Hospital Clínic,MMU 分析口径 12,413 张)、MSK 系(纪念斯隆-凯特琳,约 2,903 张,倒推口径)。没有任何为 2019 届新采集的图像——这也是"撞库"问题的根源(§5)。
Q3:分几类?
训练集 8 类(MEL 黑色素瘤 / NV 黑色素细胞痣 / BCC 基底细胞癌 / AK 光化性角化病 / BKL 良性角化病 / DF 皮肤纤维瘤 / VASC 血管病变 / SCC 鳞状细胞癌),ground truth CSV 为 8 列 one-hot。测试集 9 类——多出的第 9 类 UNK(None of the others)只出现在测试集,是官方埋的"训练分布外"陷阱。Kaggle 镜像页写"9 classes"指的是任务口径,不代表训练集有 9 列标签(坑 2)。
Q4:类别分布有多不均衡?
NV 12,875 张(50.8%)一家独大;MEL 4,522、BCC 3,323、BKL 2,624 居中;AK 867、SCC 628、VASC 253、DF 239 构成长尾。最大最小类样本比约 54:1——这正是官方把主指标从 accuracy 换成 balanced accuracy 的直接原因。
Q5:metadata 有什么?
训练 metadata 含年龄(age_approx)、性别、解剖部位、lesion ID(23,247 张有值、2,084 张缺失;唯一 ID 11,848 个);测试 metadata 只有年龄/性别/部位。lesion ID 意味着同一病变可能有多张不同放大倍率的图像(multiplets),这既是特色(多尺度信息)也是陷阱(随机切分泄漏,坑 10)。
Q6:怎么评分?
主指标 balanced multi-class accuracy:先算每类的 sensitivity(TP/positives),再对 8 个(或含 UNK 时相应)类别取算术平均——语义上等价 average recall。平局以 AUC 打破。官方还计算 sensitivity/specificity/accuracy/AUC/mAP/F1/AUC80/PPV/NPV 等全套指标用于科学分析,但排名与颁奖只看 balanced accuracy。评分代码 isic-challenge-scoring 开源可审计。
Q7:2019 年的比赛怎么打的?
测试图像计划 2019 年 8 月 2 日发布;Task 1(仅图像)截止 8 月 16 日,Task 2(图像+metadata)截止 8 月 23 日(测试 metadata 8 月 16 日放出后才有条件参赛);参赛者除预测结果外必须提交方法论文链接;奖金(每赛道 $4,000/$2,000/$1,000)在 2019 年 10 月深圳 MICCAI 工作坊节点后发放。
Q8:谁赢了?
Nils Gessert 等 5 人(汉堡工业大学+汉堡-埃彭多夫大学医学中心),方法是多分辨率 EfficientNets 集成:Task 1 balanced accuracy 63.6%、Task 2 63.4%,双任务第一(其论文 arXiv:1910.03910 官方备注 “First place”)。该团队即 2024 年 live leaderboard 第一名 DAISYLab 的同一机构。2024 年重开的 live 榜上第二名 DysionAI(北京鼎视智慧)是当年表现最好的中国团队之一。
Q9:官方成绩 63.6%,文献里动辄 0.92+,信谁的?
都信,但别混。63.6% 是官方测试集(含 UNK、balanced accuracy、无验证调参机会)的成绩;0.92-0.95 是后续论文在训练集内自切分、按 accuracy/macro-F1 报告的成绩。切分不同、指标不同、UNK 处理不同——三重不可比(坑 6)。要看真实泛化差距,只有官方协议口径。
Q10:现在还能拿到什么?
官方 data 页仍在:训练 JPEG(9.1GB)+ 训练 GT(1MB)+ 测试 JPEG(3.6GB)+ 测试 GT(454KB,含评分权重)+ 训练/测试 metadata;ISIC Archive API 同源可得。第三方 Kaggle 有镜像(注意 license 误标坑 9)。license 为 CC-BY-NC,署名须分别注明三个来源(坑 7)。
§2 数据构成与规格
2.1 三源聚合:25,331 张的来龙去脉
ISIC 2019 训练集不是一个"采集"出来的数据集,而是一个"聚合"出来的数据包。三个来源的角色与贡献如下:
| 来源 | 归属机构 | 进入 2019 训练集张数 | 口径说明 |
|---|---|---|---|
| HAM10000 | 维也纳医科大学 ViDIR 组 | 10,015(全集) | 即 2018 届训练集原封不动并入;Sci Data 2018 论文口径 |
| BCN20000 | 巴塞罗那 Hospital Clínic 皮肤科 | 12,413 | MMU 分析口径(Sci Dir 2021);BCN 官方论文写"19,424 张进入 2019+2020 合并集",两口径不可直接对表(存照) |
| MSK 系 | 纪念斯隆-凯特琳癌症中心(匿名署名) | ≈2,903(倒推) | =25,331−10,015−12,413;主要为 2017/2018 届已用 MSK 图像(MSK-1/2/3/4/5 系合计 2,918,差 15 张,子集归属口径未明) |
| 合计 | — | 25,331 | 与官方数字精确一致 |
这张表是理解本条目的钥匙:2019 届的"增量"其实只有 BCN20000 的并入选取与 SCC 类标签,图像本体都是既有的。也因此,"下载 ISIC 2019 训练集"这个动作对已经拥有 HAM10000 与 BCN20000 的团队来说,新增内容仅约 2,903 张 MSK 图与统一的 8 类标签体系。
测试集 8,238 张的来源官方未逐源公布;按官方描述其中埋入了不属于 8 个训练类的异类图像(UNK),文献分析指出这类异类图像主要可由 SD-198 等非皮肤镜/非八类数据集代表(arXiv:2101.03814 作者自述其 UNK 训练数据"主要来自 SD-198")。
2.2 训练类别分布:一张表看懂长尾
四源互证(MMU Sci Dir 2021 表 3、MDPI Appl. Sci. 2022 表 1、IET CV 2023 百分比、Frontiers Med 2026)的 8 类分布如下:
| 类别缩写 | 英文全称 | 中文 | 张数 | 占比 |
|---|---|---|---|---|
| NV | Melanocytic nevus | 黑色素细胞痣 | 12,875 | 50.8% |
| MEL | Melanoma | 黑色素瘤 | 4,522 | 17.8% |
| BCC | Basal cell carcinoma | 基底细胞癌 | 3,323 | 13.1% |
| BKL | Benign keratosis | 良性角化病(日光性黑子/脂溢性角化病/扁平苔藓样角化病) | 2,624 | 10.4% |
| AK | Actinic keratosis | 光化性角化病 | 867 | 3.4% |
| SCC | Squamous cell carcinoma | 鳞状细胞癌 | 628 | 2.5% |
| VASC | Vascular lesion | 血管病变 | 253 | 1.0% |
| DF | Dermatofibroma | 皮肤纤维瘤 | 239 | 0.9% |
| 合计 | — | — | 25,331 | 100% |
三个结构性观察:第一,良性主力 NV 占半壁江山,任何 accuracy 指标都会被它主导——这是官方弃用 accuracy 的统计学根据。第二,三大皮肤恶性肿瘤(MEL/BCC/SCC)合计 8,473 张(33.4%),恶性样本并不稀少,稀少的是 VASC/DF 这类"少见但良性"的类别——balanced accuracy 对它们的惩罚最重。第三,与 2018 届对比:7 类保留(MEL 1,113→4,522 等均大幅扩容),新增 SCC 628 张;2018 届的 514 张 BCC、327 张 AK 等在 2019 中按来源被扩容替代,逐年数字不可按"同名单纯加图"理解。
一个直观算例说明 balanced accuracy 为何"更严":设想一个只预测 NV 的退化模型,accuracy 可拿 50.8%(全猜最大类),而 balanced accuracy 只剩 1/8≈12.5%(其余 7 类敏感度全为 0)。反过来,一个把 NV 全对但 DF/VASC 全错的强模型,accuracy 可超 0.9,balanced accuracy 却封顶在 7/8=87.5% 再打折——官方用这个指标强行把"少见类"抬回评分视野,这正是"更接近医生真实评估"的数学表达:皮肤科医生不能因为"DF 反正少见"就不认识它。
2.2.0 三来源速览卡(细节见库内对应条目)
- HAM10000(维也纳):“Skin Cancer MNIST”——多源皮肤镜 10,015 张、600×450 居中裁剪、7 类论文标签体系;2018 届训练集本体;库内 rid 60。
- BCN20000(巴塞罗那):“dermoscopic lesions in the wild”——多设备非受控采集、含指甲/黏膜等困难部位;2019 届多样性担当;库内 rid 161。
- MSK 系(纽约,匿名):纪念斯隆-凯特琳的系列皮肤镜采集(MSK-1 至 MSK-5 等子批次),2017/2018 届已部分使用,2019 届继续作为增量来源;仓库层归属库内 rid 56。
2.2.1 八类临床速查表(读数据前先看病)
| 类 | 临床要点 | 镜下典型线索 | 恶性潜能 | 处置含义 |
|---|---|---|---|---|
| MEL 黑色素瘤 | 最致命皮肤癌,转移早 | 不对称、色斑驳、蓝白幕、不规则条纹 | 恶性 | 广泛切除,分期决定预后 |
| NV 黑色素细胞痣 | 良性痣,人群极常见 | 色素网均匀、对称、边界清 | 良性(部分为发育不良痣,随访) | 常规随访 |
| BCC 基底细胞癌 | 最常见皮肤恶性肿瘤,转移罕见但局部破坏 | 树枝状血管、溃疡、珍珠样结构 | 局部恶性 | 局部切除/消融 |
| AK 光化性角化病 | 日光相关癌前病变 | 角化鳞屑、红色角化背景 | 癌前(可进展为 SCC) | 冷冻/外用药 |
| BKL 良性角化病 | 合并类:日光性黑子/脂溢性角化病/扁平苔藓样角化病 | 粉刺样开口、脑回样结构 | 良性 | 无需处理或美容性去除 |
| DF 皮肤纤维瘤 | 良性纤维组织细胞反应 | 中央白斑、色素晕 | 良性 | 无需处理 |
| VASC 血管病变 | 血管瘤/血管角皮瘤等 | 紫红色腔隙、樱桃红点 | 良性 | 无需处理 |
| SCC 鳞状细胞癌 | 第二常见皮肤恶性肿瘤 | 角化过度、溃疡、多形血管 | 恶性 | 切除+分级随访 |
两个数据-临床联动提醒:其一,BKL 是"三病合一"的合并类——这是 2019 届为平衡类别数做的取舍,意味着模型对 BKL 的预测不可直接当单一疾病诊断用;其二,AK(癌前)与 SCC(恶性)在临床上是一个进展谱系,二者合计仅 1,495 张——官方测试集里模型在这两类上的混淆正是 balanced accuracy 被压低的主要来源之一。
2.3 图像规格与 metadata
- 格式与体量:JPEG;训练包 9.1GB(25,331 张),测试包 3.6GB(8,238 张)
- 分辨率:450×600 至 1024×1024(IET 口径)——跨度近 4 倍的分辨率异质性是 2019 届的显著特征,冠军方法专门用"多分辨率输入+多种裁剪策略"回应(§4)
- 训练 metadata(Task 2 用):age_approx(近似年龄)、sex、anatom_site_general(解剖部位)、lesion_id
- lesion_id 有值 23,247 张、缺失 2,084 张;唯一 lesion ID 11,848 个(MMU 口径)
- 同一 lesion ID 下的多张图像是同一病变在不同时间/放大倍率的拍摄(multiplets)——官方明言这是数据集特色:“包括在不同放大级别下呈现同一病变的多倍图,可能在不同放大级别提供重要的独特特征”
- 测试 metadata:age_approx、sex、anatom_site_general;无 lesion_id
- ground truth 格式:训练 8 列 one-hot(MEL,NV,BCC,AK,BKL,DF,VASC,SCC);测试 GT 454KB,官方注明"Includes the scoring and validation weights"(含评分与验证权重)
2.3.1 metadata 字段字典与缺失画像
| 字段 | 数据类型 | 取值/范围 | 缺失情况 | 建模提示 |
|---|---|---|---|---|
| image | 字符串 | ISIC_xxxxxxx(跨包稳定键) | 无缺失 | 主键;去重与跨包映射用 |
| age_approx | 分箱数值 | 0-85 岁近似分箱 | 存在缺失(测试镜像口径另有 unknown 档) | 缺失类别化,勿均值插补 |
| sex | 类别 | male/female(缺失归 unknown) | 存在缺失 | 类别嵌入 |
| anatom_site_general | 类别 | anterior/posterior torso、upper/lower extremity、head/neck、palms/soles、oral/genital 等 | 存在缺失 | 高基数低频部位可归并 |
| lesion_id | 字符串 | 11,848 唯一值;仅训练集提供 | 2,084 张缺失 | 组切分键;同一 ID = 同一病变多图 |
| 8 类 one-hot | 二值向量 | 每行恰一列置 1 | 无 | 训练标签;测试侧含 UNK 行(8 列全 0) |
两个使用要点:其一,metadata 各字段缺失率并不均匀(Kaggle 测试镜像口径:部位缺值约 4%、年龄存在 unknown 档、性别缺值约 4%),用 metadata 建模时缺失模式本身可能携带中心/设备信息,需防"缺失即标签"的伪相关;其二,lesion_id 仅训练侧提供——这意味着"按病变做测试"的严格协议在 2019 包内只能自建(自切分),官方测试协议按图计分,两种粒度的成绩不可互换。
2.4 测试集与 UNK 未知类协议
测试集 8,238 张、9 类口径。UNK(“None of the others”)是官方在挑战赛中埋下的开放集(open-set)陷阱:
- 官方原文:“the test dataset will contain an additional outlier class not represented in the training data, which developed systems must be able to identify”——测试集将包含一个训练数据中未代表的额外异常类,开发的系统必须能够识别它
- UNK 张数:官方未单独公布;Frontiers Med 2026 论文口径 2,047 张(单源,存照待核,见 §10 坑 8)
- 挑战期间测试标签不公开,经自动在线评估系统评分;挑战结束后官方 data 页公开了测试 GT(454KB)——如今任何人可完整复算官方指标
- 对参赛者而言,UNK 检测的主流做法是用外部数据(如 SD-198 皮肤病临床图集)充当"第 9 类"训练数据——这把"分布外检测(OOD detection)"这个 CV 话题第一次大规模带进医学影像挑战赛
2.5 与 2018/2020 两届的数据关系(版本链)
| 届 | 年份 | 训练 | 测试 | 类数 | 格式/要点 |
|---|---|---|---|---|---|
| ISBI/ISIC | 2016 | 900 | 379 | 2 类 | 首届,黑色素瘤 vs 痣二分类 |
| ISIC | 2017 | 2,000 | 600 | 3 类 | 加入角化病类 |
| ISIC | 2018 | 10,015(=HAM10000 全集) | 1,512 | 7 类 | 训练=HAM10000;含分割/检测任务 |
| ISIC | 2019 | 25,331 | 8,238 | 8+UNK | 三源聚合;+SCC;balanced accuracy 主指标;UNK 协议 |
| ISIC | 2020 | 33,126 | 10,982 | 多类+UNK | 转 DICOM 嵌入 metadata;patient-centric(患者级切分);2,056 唯一患者 |
| ISIC | 2024+ | — | — | — | ISIC 2024 挑战(SLICE3D)与 MILK10k 基准(现行官方主推) |
2019 届在链条中的独特位置:它是"图像规模三连跳"的中间跳(10,015→25,331→33,126),也是评估哲学的转折点(balanced accuracy+UNK 首次定标)。2020 届吸收了 2019 届 UNK 的教训并进一步把"同一患者多病变"作为防泄漏设计核心(patient-centric 切分)——反证 2019 届 lesion multiplets 的泄漏风险真实存在。
2.6 官方数据包文件字典
| 文件名 | 行/张数 | 字段/结构 | 用途 |
|---|---|---|---|
| ISIC_2019_Training_Input/ | 25,331 张 JPEG | 命名 ISIC_xxxxxxx.jpg | 图像本体 |
| ISIC_2019_Training_GroundTruth.csv | 25,331 行 | image, MEL, NV, BCC, AK, BKL, DF, VASC, SCC(one-hot) | 8 类训练标签 |
| ISIC_2019_Training_Metadata.csv | 25,331 行 | image, age_approx, anatom_site_general, sex, lesion_id | Task 2 训练侧输入 |
| ISIC_2019_Test_Input/ | 8,238 张 JPEG | 命名 ISIC_xxxxxxx.jpg | 测试图像 |
| ISIC_2019_Test_GroundTruth.csv | 8,238 行 | 8 known 列 + UNK 列(挑战后公开,含 scoring/validation weights) | 官方复算/复现 |
| ISIC_2019_Test_Metadata.csv | 8,238 行 | image, age_approx, anatom_site_general, sex | Task 2 测试侧输入 |
字段级提示:age_approx 为近似分箱年龄;anatom_site_general 取值含 anterior torso/posterior torso/upper extremity/lower extremity/head-neck/palms-soles/oral-genital 等,Kaggle 测试镜像口径显示缺值以 “Other/unknown” 形式存在;lesion_id 为字符串 ID,同一病变多图共享。one-hot 行若 8 列全 0 不存在于训练集(训练集每行恰一类),测试集 UNK 行表现为 8 known 列全 0。
§3 挑战赛设计:任务、时间线、指标与奖励
3.1 双赛道任务定义
官方原文:“Two tasks will be available for participation: 1) classify dermoscopic images without meta-data, and 2) classify images with additional available meta-data.”
- Task 1(仅图像):输入 25,331 张训练图 + 标签,对测试图输出 9 类(8 known+UNK)预测
- Task 2(图像+metadata):额外使用训练/测试 metadata(年龄/性别/部位,测试集无 lesion_id);测试 metadata 于 2019-08-16 发布,Task 2 截止随之定在 8 月 23 日
- 约束:Task 2 参与者必须同时提交 Task 1(只打 Task 1 是允许的,反之不行)——保证两赛道成绩可比
- 强制要求:“each competitor is required to submit a link to a manuscript describing the methods used to generate predictions”——每位参赛者须提交方法论文链接,这是后来冠军论文等一批文献的直接来源
- 官方页面对 2019 届任务列表有一句自注:“intentionally omit task-listing for 2019, since both tasks are so similar they can be described with just this landing page”——两赛道任务过于相似,共用同一页描述
3.2 时间线(官方口径)
| 节点 | 日期 | 说明 |
|---|---|---|
| 训练数据发布 | 官方页面未标注 | 遗留疑点(§9);不晚于 2019 年夏 |
| 测试图像发布 | 计划 2019-08-02 | “planned release August 2nd” |
| 测试 metadata 发布 | 2019-08-16 | Task 2 才能启动 |
| Task 1 截止 | 2019-08-16 | 与测试 metadata 同日 |
| Task 2 截止 | 2019-08-23 | “August 23th”(官方原文拼写) |
| 成绩/榜单公布 | 提交期结束后不久 | “Final scores and a public leaderboard are released shortly after the conclusion” |
| 获奖/奖金节点 | 2019 年 10 月 MICCAI 工作坊(深圳)之后 | 官方:“awarded after the MICCAI Workshop in Shenzhen, China, in October 2019” |
3.3 评估指标:balanced multi-class accuracy 的哲学
官方主指标定义(原文口径):
- 名称:normalized (balanced) multi-class accuracy,“balanced across categories”
- 定义:“the arithmetic mean of the (<category>_true_positives / <category>_positives) across each of the diagnostic categories”——各类 TP/positives 的算术平均
- 语义:“This metric is semantically equivalent to the average recall score”(等价于 average recall / macro 平均 sensitivity)
- 平局处理:“Tied positions will be broken using the area under the receiver operating characteristic curve (AUC) metric”
官方 rationale 值得整段读:临床应用有两个目标——给出具体诊断与治疗方案,以及以合理敏感度/特异度检出皮肤癌;往届挑战聚焦后者(二分类 biopsy vs don’t biopsy),本届要排名更 ambitious 的 normalized multiclass accuracy,“因为它也更接近对皮肤科医生的真实评估”(closer to real evaluation of a dermatologist)。官方还预告该成绩将用于 reader study(医生读片对比研究)。
配套指标体系:官方同时计算 sensitivity、specificity、accuracy、AUC、mAP、F1、AUC80(80%-100% 敏感度区间的 AUC 积分)、PPV、NPV,以及聚合口径(平均 AUC、恶性 vs 良性、分类别 AUC)——但"Participants will be ranked and awards granted based only on the balanced multi-class accuracy metric"(排名与颁奖只看 balanced accuracy)。
验证分机制:所有提交立即获得一个 validation score——基于约 100 张预置的非代表性子集计算,官方明言"not intended to be used for algorithm ranking or evaluation",仅用于格式/标签对齐的 sanity check;参考值:随机提交约 0.3。这个设计防止参赛者把验证子集当代榜刷分。
透明度:官方评分代码 isic-challenge-scoring 以宽松许可开源发布,“to facilitate external auditing”(便于外部审计)——2019 届的评分可复算性在医学挑战赛里属于早期的高标准实践。
3.3.1 balanced accuracy 复算骨架(官方测试 GT 公开后可用)
import pandas as pd
import numpy as np
CLASSES = ["MEL", "NV", "BCC", "AK", "BKL", "DF", "VASC", "SCC", "UNK"]
# y_true: 测试 GT one-hot(挑战后官方公开);y_pred: 提交的 one-hot 预测
y_true = pd.read_csv("ISIC_2019_Test_GroundTruth.csv", index_col=0)[CLASSES]
y_pred = pd.read_csv("submission.csv", index_col=0)[CLASSES]
# 官方定义:各类 TP/positives 的算术平均(语义等价 average recall)
def balanced_accuracy_official(y_true: pd.DataFrame, y_pred: pd.DataFrame) -> float:
assert (y_pred.sum(axis=1) == 1).all(), "预测须逐行 one-hot"
per_class = {}
for c in CLASSES:
pos = y_true[c] == 1
tp = (y_pred[c][pos] == 1).sum()
per_class[c] = tp / pos.sum() # <category>_true_positives / <category>_positives
return float(np.mean(list(per_class.values()))), per_class
# 平局判定用 AUC(官方口径),此处从略;完整逻辑以 isic-challenge-scoring 包为准
ba, per_class = balanced_accuracy_official(y_true, y_pred)
print(f"balanced accuracy = {ba:.4f}")
print(pd.Series(per_class).sort_values().round(4)) # 弱类一目了然(通常是 UNK/DF/AK/SCC)
复算要点:预测必须逐行 one-hot(官方提交格式);UNK 列参与平均——一个从不预测 UNK 的系统会在 UNK 类上拿到 0 敏感度,直接损失约 1/9 的指标上限;这正是"敢不敢说不知道"数值化的方式。
3.4 奖励与组织
- 奖金:每赛道前三名 $4,000 / $2,000 / $1,000(USD),由 Canfield Scientific, Inc. 提供;获奖者须提交税务文件(美国人 W-9 / 非美国人 W-8 BEN)
- 发放时点:2019 年 10 月深圳 MICCAI 工作坊之后
- 赞助商:Canfield Scientific、IBM、MetaOptima
- 组织委员会:
- Clinical Chairs:Josep Malvehy(巴塞罗那 Hospital Clínic)、Allan Halpern(MSKCC)
- Computer Vision Chair:Noel C. F. Codella(IBM Research)
- Co-Chairs:M. Emre Celebi(中阿肯色大学)、Marc Combalia(巴塞罗那)、David Gutman(Emory)、Brian Helba(Kitware)、Harald Kittler(维也纳医科大学)、Veronica Rotemberg(MSKCC)、Philipp Tschandl(维也纳医科大学)
- 利益规则:组委会成员所属机构不禁止参赛,但须保证提交与委员会成员完全独立
- IEEE SPS 将该挑战列入其官方 data challenges 列表(Skin Lesion Analysis Towards Melanoma Detection (ISIC 2019))
- 中国团队表现:北京鼎视智慧(DysionAI/skinreader.cn)2019-08-30 曾以官方 live 榜"基于公开数据"第一名见诸中文报道;其提交在当前官方 live leaderboard 居第 2 名(balanced accuracy 0.607)——两口径均存照(§9),正文按"前排团队"表述
3.5 参赛者旅程:从注册到奖金的完整动线
- 注册:官方提交系统 Sign up,获得参赛身份;组委会成员所属机构参赛须声明独立性(§3.4)
- 开发期:下载训练包(图像+GT+metadata),本地开发;此阶段测试集不可见
- 测试图发布(计划 2019-08-02):8,238 张测试 JPEG 释出,系统须对每张输出 9 类预测(8 known+UNK)
- Task 1 提交(截止 2019-08-16):上传 one-hot 预测 CSV;系统自动格式校验→即时 validation score(~100 张 sanity 子集)→进入正式评分队列
- 测试 metadata 发布(2019-08-16):Task 2 选手此时才能拿到测试侧 metadata
- Task 2 提交(截止 2019-08-23):同流程;Task 2 选手的 Task 1 提交为强制前置
- 方法论文:与预测同时提交 manuscript 链接——无论文链接的提交不完整
- 正式评分:提交期结束后官方发布最终成绩与公开 leaderboard;全套指标(sens/spec/AUC/F1/AUC80/PPV/NPV 等)逐项计算
- 公布与颁奖:获奖结果在 ISIC 工作坊节点公布(官方页文本见坑 3);奖金 $4,000/$2,000/$1,000 经税务流程(W-9/W-8 BEN)在 2019 年 10 月深圳 MICCAI 工作坊后发放
- 长尾:挑战站转 [Closed],数据与 GT 转入官方 data 页长期存档;2024 年 leaderboard 重开为 live 榜,提交通道延续
§4 冠军与方法:Gessert 团队的双任务登顶
4.1 官方成绩与团队
ISIC 2019 两个赛道的第一名是同一团队:Nils Gessert、Maximilian Nielsen、Mohsin Shaikh、René Werner、Alexander Schlaefer,来自汉堡工业大学(Hamburg University of Technology)与汉堡-埃彭多夫大学医学中心(University Medical Center Hamburg-Eppendorf)。其方法论文 “Skin Lesion Classification Using Ensembles of Multi-Resolution EfficientNets with Meta Data”(arXiv:1910.03910,v1 2019-10-09)在 arXiv 官方备注中直接写明:“First place at the ISIC 2019 Skin Lesion Classification Challenge”。
与 2024 live 榜第一名的身份衔接:live 榜队名 DAISYLab 挂靠的机构正是 TU Hamburg/UKE,且榜首数值 0.636 与当年官方成绩 63.6% 精确一致——合理的解释是该团队当年的提交在重开的 live 系统中延续展示(官方未另发说明,此处按机构+数值+方法三重吻合作一致性陈述,不虚构提交记录细节)。检索者只需记住:2019 冠军 = DAISYLab 同一团队谱系,榜单头名五年来在数值上纹丝未动。
官方测试集成绩(论文摘要自述):
| 赛道 | balanced accuracy | 名次 |
|---|---|---|
| Task 1(仅图像) | 63.6% | 1st |
| Task 2(图像+metadata) | 63.4% | 1st |
其内部 5 折交叉验证的集成成绩为 balanced accuracy 74.2%——CV 成绩与官方测试成绩之间约 10 个百分点的落差,本身就是"任务比想象中难"的最直接证据(UNK 陷阱+官方测试集的分布差异)。
4.2 方法解剖:五件套
冠军方法是典型的"工程完备主义",五件套缺一不可:
- 多分辨率 EfficientNets 集成:数据集分辨率从 450×600 到 1024×1024 跨度近 4 倍,团队用不同输入分辨率与不同裁剪策略(同尺寸裁剪/随机缩放裁剪)训练多个 EfficientNet 变体,让每个模型擅长一种尺度形态——后续综述(IET CV 2023)把这套"multi-resolution ensemble"列为 2019 届的标志性技术遗产。
- loss balancing(损失平衡):面对 54:1 的类别失衡,采用损失加权平衡而非简单重采样——摘要原话:“multi-class skin lesion classification comes with the problem of severe class imbalance. We try to overcome this problem by using loss balancing.”
- 外部数据补 UNK:摘要原话:“by including external data with skin lesions types that are not present in the training set”——用训练集之外的病类图像训练第 9 类。这一策略被后续方法论文系统化(如 arXiv:2101.03814 明确以 SD-198 为 UNK 训练源),OOD 检测由此成为 ISIC 系基准的标配课题。
- metadata 融合:Task 2 侧用一个额外的 dense 神经网络编码年龄/性别/部位,特征与 CNN 图像特征融合——metadata 的增益是真实的但有限(63.6%→63.4% 两赛道几乎打平,甚至图像-only 略高),这个"metadata 没那么神"的结果在后续文献中反复被复现。
- 集成子集搜索:不是把所有模型平均,而是"搜索最优模型子集"(we aggregate all our models with an ensembling strategy where we search for the optimal subset of models)——在数十个候选中用验证成绩挑组合,兼顾精度与推理成本。
4.3 其他前排团队与 live 榜
- legacy 前三(PMC8055397,2021 口径):1st Gessert 63.6 / 2nd Cancerless 63.8 / 3rd ForCure 64.8——注意 2/3 名表内数值高于第 1 名的名次倒挂,属该文表内口径问题,官方名次以冠军论文自述+官方 leaderboard 为准(坑 5;该文还把 Gessert 拼成 “Gassert”,坑 4)
- 官方 live leaderboard(challenge.isic-archive.com/leaderboards/2019,2024 年重开后持续开放,累计 64 队):1st DAISYLab 0.636(Ensemble of Multi-Res EfficientNets + SEN154)——正是 Gessert 所在机构(TU Hamburg/UKE)的队名与当年同值成绩;2nd DysionAI(北京鼎视智慧)0.607(EfficientNetB3-B4-Seresnext101 集成);3rd AImageLab & PRHLT(Unimore & UPV)0.593(ensemble+OOD threshold);4th DermaCode 0.578(13 models+hierarchical outlier selection);5th Nurithm Labs 0.569
- 前排方法的共性:集成是标配;OOD/未知类处理策略(阈值法、层级外类判定、外部数据)决定名次分层——63% vs 59% 的差距主要不在分类骨干,而在"敢不敢说不知道"
- 中国力量:DysionAI(鼎视智慧)、BITDeeper(北京理工大学,MelaNet 深度密集注意力网络)、SYSU-MIA-Group(中山大学)、Tencent Medical AI Lab、南方医科大学 MIP、中科院自动化所等中国团队密集出现在前 35 名——皮肤影像是 2019 年中国医学 AI 团队国际竞赛参与度最高的赛道之一
4.3.1 UNK/未知类检测策略对比(前排实践归纳)
| 策略 | 代表 | 原理 | 得失 |
|---|---|---|---|
| 外部数据作第 9 类 | 冠军 Gessert;arXiv:2101.03814(SD-198) | 把"训练分布外"变成有监督的额外类 | 最稳;依赖外部数据与真实测试 UNK 分布的相似度 |
| 置信度阈值法 | DermaCode(13 models+hierarchical outlier selection)等 | softmax 最大概率低于阈值即判 UNK | 免外部数据;阈值敏感,易误杀难样本 |
| 层级/规则判定 | DermaCode 层级路线 | 先判"是否已知类"再细分类 | 结构清晰;层级错误传播 |
| 异常检测建模 | SabanciUnivTeam(Anomaly Detection 提交) | 将 UNK 视为异常检测问题 | 概念贴合;医疗分布下调参困难 |
对后来者的含义:2020/2024 届与 MILK10k 的"unknown"设计与 SLICE3D 等任务,把这条技术线从"比赛技巧"固化成了"协议要求"——复现 ISIC 系基准而不写 UNK 策略,等于没读懂协议。
4.4 冠军方法的可迁移启示
- 分辨率即超参数:医学影像的设备异质性首先体现在分辨率;多分辨率输入+裁剪策略组合是低成本高回报的第一杠杆
- 失衡的正确姿势是损失而非采样:54:1 失衡下 loss balancing 优于重采样/过拟合风险更大的过采样路线(该结论被大量后续工作引用)
- OOD 是名次分水岭:closed-set 精度再高,UNK 识别做不好就上不了榜首——医学部署场景里"识别自己不认识的东西"比"多对一类"更重要
- metadata 增益有限但值得做:结构化临床信息(年龄/部位/性别)对分类有正贡献但幅度小,且测试集 metadata 缺失字段(lesion_id)会限制上限
4.5 ISIC 2019 相关方法论文一览
| 团队/名次 | 论文 | 核心要素 | 备注 |
|---|---|---|---|
| Gessert et al.(T1/T2 双第一) | arXiv:1910.03910(2019-10-09) | 多分辨率 EfficientNets+SENet 集成、loss balancing、外部数据、metadata 融合、子集搜索 | 官方备注 First place |
| BITDeeper(北京理工大学,live 榜第 7) | MelaNet: A Deep Dense Attention Network for Melanoma Detection | 密集注意力网络 | 中国团队方法论文代表 |
| arXiv:2101.03814(2021,方法复现研究) | Analysis of skin lesion images with deep learning | SD-198 充当 UNK 训练数据、OOD 检测系统综述 | 对 UNK 协议的独立方法论分析 |
| PMC8055397(Biomed Res Int 2021) | Skin Lesion Classification Using Additional Patient Information | TTA+Grad-CAM、metadata 利用、live 榜 88.7% 单模型 | live 重开后的后续成绩(口径已变) |
| MDPI Appl. Sci. 2022(自切分) | Multiclass Skin Cancer Classification Using Ensemble of Fine-Tuned Deep Learning Models | ResNet/DenseNet/VGG-19 集成,accuracy 0.92 | 自切分口径代表 |
| IET CV 2023(综述视角) | A deep analysis on high-resolution dermoscopic image classification | 高分辨率处理路线综述 | 引用冠军方法为"best performing approach" |
读表提醒:此表混有官方协议成绩(第一行)与自切分/后续口径成绩(后几行),数字不可横向比较(坑 6);列入仅为方法学谱系梳理。
§5 分工声明:与 HAM10000/BCN20000/ISIC Archive 的关系边界(检索者必读)
5.1 为什么本条目没有撞库停止
本库写手规程要求:新条目若与库内既有条目构成实质性重复(别名/同数据换名),应停止并改道。ISIC 2019 通过了这一检验,依据是条目定位的分层而非数据的独立性:
- 数据层:ISIC 2019 训练集 25,331 张 = HAM10000 10,015(100% 重叠,库内 rid 60 已收)+ BCN20000 12,413(MMU 口径,库内 rid 161 已收)+ MSK ≈2,903(其主库由 rid 56 isic-archive 覆盖)——数据本体重复度约 88.5%,MSK 增量约 2,903 张也包含在 isic-archive 主库范围内
- 事件层:ISIC 2019 Challenge 是一个独立的历史事件——有独立的任务设计(8+UNK 九类、双赛道)、独立的评估协议(balanced accuracy 主指标+验证分机制+开源评分代码)、独立的竞赛结果(冠军/奖金/排行榜)、独立的基准生命周期(官方排行榜持续开放至 2024+)——这些内容不被库内任何既有条目覆盖(rid 60 条目的别名虽含"ISIC 2018 Training Set",但那是 2018 届口径;rid 161 的别名注明"ISIC 2019 挑战训练集主要构成"是来源关系声明,均未展开挑战赛事件本身)
结论:数据查重触发、事件查重通过——按"独立挑战赛条目"成稿,本节即为强制分工声明。
5.2 分工边界清单
| 内容域 | 归属条目 | 本条目处理方式 |
|---|---|---|
| HAM10000 采集/标注/患者口径(10,015 张) | ham10000(rid 60) | 不重复展开;只写"2018 届训练集原样并入"的关系事实 |
| BCN20000 采集/"野外"设备多样性(12,413 张) | bcn20000(rid 161) | 不重复展开;只写来源贡献数字与口径存照 |
| ISIC Archive 主库/API/全库规模 | isic-archive(rid 56) | 不重复展开;MSK 系图像的仓库层归属指向该条 |
| 挑战赛任务设计/时间线/指标/奖金 | 本条目 | 完整展开(§3) |
| 冠军方法/排行榜/方法学遗产 | 本条目 | 完整展开(§4/§7) |
| 训练集聚合口径与重复性风险 | 本条目 | 完整展开(本节+坑 1) |
5.3 给检索者的实操含义
- 不要为"拿 HAM10000 的图"而下 ISIC 2019 包——10,015 张 HAM 图只是 2019 包的子集,HAM10000 独立包(含其论文级文档)更干净
- 不要重复收录:若你的数据管理系统已收录 ham10000 与 bcn20000,再收 ISIC 2019 只为拿约 2,903 张 MSK 图与统一 8 类标签——值不值得,取决于你是否需要"官方挑战协议"本身(复现冠军成绩/打官方榜)
- 标签体系要区分:HAM10000 论文标签(7 类)与 ISIC 2019 聚合标签(8 类 one-hot)对同一张图可能有差异(类别映射/重审),引用时注明用的是哪套 GT
- 引用义务不同:用 2019 聚合包须按 CC-BY-NC 分别署名三源(坑 7);只用 HAM 子集则按 HAM10000 论文署名即可
5.4 如果只记住三件事
- 25,331 张里没有一张新图——它是三个既有数据集的聚合包+一套新标签+一份新协议,"新"在协议不在像素。
- 数据重复≠条目重复——本条目的存在理由是挑战赛事件(任务/协议/冠军/榜单),这件事在库内 ham10000/bcn20000/isic-archive 三条目里都没有写、也不该由它们写。
- 从 ISIC 2019 出发的每一条引用都有口径——哪套 GT、哪个切分、UNK 怎么处理,三问不问清,数字就是悬空的。
5.5 重复检测实操:入库/入训练集前的查重骨架
ISIC 系图像在多个数据包间流通(同一张图可能同时存在于 HAM10000 包、2019 包、2020 包),直接合并多包训练会造成重复样本——验证集信息泄漏与成绩虚高的常见根源。实操建议两道工序:
# 工序一:ID 级去重(官方图号 ISIC_xxxxxxx 是跨包稳定键)
import pandas as pd
def id_level_dedup(package_dirs: dict) -> set:
"""package_dirs: {"ham10000": ..., "isic2019": ..., "isic2020": ...}
返回在各包间重复出现的图号集合"""
id_sets = {name: {p.stem for p in d.glob("*.jpg")} for name, d in package_dirs.items()}
seen, dup = set(), set()
for s in id_sets.values():
dup |= seen & s # 与先前任何包的交集
seen |= s
return dup
# 工序二:内容级查重(同病变多倍图/重压缩变体,图号不同内容相近)
# 轻量做法:感知哈希(perceptual hash)+ 汉明距离阈值
from PIL import Image
import imagehash
def near_dup_report(img_paths, hash_size=16, max_dist=4):
sigs = [(p, imagehash.phash(Image.open(p), hash_size=hash_size)) for p in img_paths]
pairs = []
for i in range(len(sigs)):
for j in range(i + 1, len(sigs)):
if sigs[i][1] - sigs[j][1] <= max_dist:
pairs.append((sigs[i][0].name, sigs[j][0].name))
return pairs # 人工复核近重复对;同 lesion_id 的 multiplets 预期会被命中
学术先例:MMU 分析论文(Sci Dir 2021)对 ISIC 2016-2020 全系做了系统的重复样本分析,并据此发布去重后的 curated 数据集——多包联用前值得先读。本库同域教训(wsss4luad 等条目)同样表明:跨包合并前不做内容级查重,是医学影像基准虚高成绩的第一大来源。
§6 获取与许可:门怎么进、名怎么署
6.1 官方获取渠道(推荐首选)
官方 data 页(challenge.isic-archive.com/data/,ISIC 2019 Challenge [Closed] 表格)至今仍提供完整下载:
| 文件 | 规模 | 内容 |
|---|---|---|
| ISIC 2019 Training Input | 9.1GB | 25,331 张皮肤镜 JPEG |
| ISIC 2019 Training Ground Truth | 1MB | 25,331 条 8 类 one-hot 诊断 |
| ISIC 2019 Test Input | 3.6GB | 8,238 张 JPEG |
| ISIC 2019 Test Ground Truth | 454KB | 8,238 条诊断(挑战结束后公开;含评分与验证权重) |
| ISIC 2019 Training Metadata | 1MB | 25,331 条年龄/性别/部位/lesion ID |
| ISIC 2019 Test Metadata | 287KB | 8,238 条年龄/性别/部位 |
- 备选官方通道:ISIC Archive API(与主库同源,可按图号增量拉取;API 文档见 isic-archive 条目 rid 56)
- 挑战站旧域名 challenge2019.isic-archive.com 现显示 “[Closed]” 并指向主站
6.1.1 下载与完整性校验实操
# 官方直链(challenge.isic-archive.com/data/ 页内获取当前有效链接后)
# 训练包 9.1GB / 测试包 3.6GB——大文件建议断点续传
curl -L -C - -o ISIC_2019_Training_Input.zip "<官方训练包链接>"
curl -L -C - -o ISIC_2019_Test_Input.zip "<官方测试包链接>"
curl -L -C - -o ISIC_2019_Training_GroundTruth.zip "<官方训练GT链接>"
curl -L -C - -o ISIC_2019_Test_GroundTruth.zip "<官方测试GT链接>" # 454KB,含评分权重
curl -L -C - -o ISIC_2019_Training_Metadata.zip "<官方训练metadata链接>"
curl -L -C - -o ISIC_2019_Test_Metadata.zip "<官方测试metadata链接>" # 287KB
# 数量校验(三条硬数字对上才算完整)
unzip -l ISIC_2019_Training_Input.zip | grep -c "jpg" # 期望 25,331
unzip -l ISIC_2019_Test_Input.zip | grep -c "jpg" # 期望 8,238
python3 -c "import pandas as pd; gt=pd.read_csv('ISIC_2019_Training_GroundTruth.csv'); \
print(len(gt), gt.drop(columns=gt.columns[0]).sum().to_dict())"
# 期望: 25331 {'MEL': 4522, 'NV': 12875, 'BCC': 3323, 'AK': 867, 'BKL': 2624, 'DF': 239, 'VASC': 253, 'SCC': 628}
镜像通道对比:官方直链(首选,license 与文件一致性有保障)> Kaggle andrewmvd(CC BY-NC 4.0 标注正确,13.64GB 总包)> 其他社区镜像(仅作快照参考,agsam23 存在 CC0 误标,坑 9)。
6.2 第三方镜像与坑
- Kaggle
andrewmvd/isic-2019:最常用镜像,标 CC BY-NC 4.0(正确口径);其页面对训练集的"9 classes"表述是任务口径(坑 2) - Kaggle
agsam23/isic-2019-challenge:license 误标为 CC0 Public Domain——与官方 CC-BY-NC 直接冲突,勿按 CC0 使用(坑 9) - openi.pcl.ac.cn 等学术社区镜像:内容为官方文本转载,可作快照参考
- 一切以官方 data 页 license 口径为准:CC-BY-NC(Frontiers 2026 论文明确写 CC BY-NC 4.0)
6.3 署名规范(license 的强制动作)
官方原文要求:为符合 CC-BY-NC 的署名要求,聚合的 “ISIC 2019: Training” 数据必须按以下方式引用——三句缺一不可:
- BCN_20000 Dataset: © Department of Dermatology, Hospital Clínic de Barcelona
- HAM10000 Dataset: © by ViDIR Group, Department of Dermatology, Medical University of Vienna; https://doi.org/10.1038/sdata.2018.161
- MSK Dataset: © Anonymous; https://arxiv.org/abs/1710.05006 ; https://arxiv.org/abs/1902.03368
同时官方建议引用挑战赛本身:Codella et al. 2018 challenge 论文(arXiv:1902.03368)与 Tschandl et al. 2018(Sci Data 5:180161);BCN20000 部分按 Hernández-Pérez et al. 2024(Sci Data 11:641)引用。注意 MSK 源虽匿名,“© Anonymous” 这句署名不可省略——省略即违反许可条款(坑 7)。
6.4 license 的使用边界
| 使用场景 | 可行性 | 依据/条件 |
|---|---|---|
| 学术研究(训练/评测/发论文) | ✓ | 三源署名句齐全 |
| 竞赛/教学/内部分享 | ✓ | 同上,NC 框架内 |
| 开源模型权重发布 | ◐ | 官方未表态;建议权重页声明数据来源与许可 |
| 商业产品内嵌/商用 API | ✗ | NC 条款不覆盖;需向权利方另行授权 |
| 再分发数据包(镜像/转换格式) | ◐ | 须携带同署名与 NC 约束;建议链回官方页 |
| 衍生标注(如新分割掩码)发布 | ◐ | 新标注作者自持版权,但底层图像受 CC-BY-NC 传导 |
- 非商业(NC):商业产品/付费服务中的直接使用不获许可;企业内研究是否算"非商业"需法务自行判断,官方未提供更细指引
- 图像级再分发:CC-BY-NC 允许共享与改编,但须携带同样署名;训练模型权重是否受 NC 约束官方未表态(领域惯例视为可用,但论文/产品声明建议注明数据许可)
- 与库内光谱对照:CC-BY-NC 属"可自由学术获取+强署名义务"档——比请求制(如 PANDA-PLUS 掩码)宽松,比 CC0/CC-BY(如 BCN2020 部分数据)严格
6.5 AI-Ready 评估
- 可获取性:公开直链下载+API,无需注册审批——满分档
- 格式:JPEG+CSV,标准工具链直接可读——满分档;非 DICOM 是 2020 届才引入的改进
- 标注:训练集 8 类 one-hot 全量 gold standard;测试集 GT 挑战后公开——闭环完整
- metadata:训练四字段(age/sex/site/lesion_id)足以支撑多模态实验,但缺患者级 ID(2020 届补上)
- 文档:官方页面无数据卡(data card)概念,采集设备/人口学分布要查来源论文——扣分项
- 结论:ISIC 2019 数据包本体是 AI-Ready 的早期标杆(“下载即训练”),其 AI-Ready 短板主要在文档层而非格式层
6.6 与库内可获取性光谱的对照
| 获取模式 | 代表条目 | ISIC 2019 对照 |
|---|---|---|
| 公开直链(CC-BY/CC0 档) | 多数影像条目 | ISIC 2019 为"公开直链+NC 约束",介于两档之间 |
| 公开直链+强署名义务(NC 档) | 本条目 | 三源分别署名是独有要求——比一般 NC 条目多两步 |
| 请求制(upon request) | panda-plus 掩码层 | ISIC 2019 无请求环节,门槛更低 |
| API 分发 | isic-archive(rid 56) | 同属此档;2019 包是 API 的按届打包视图 |
| 注册制大盘 | TCIA 系等 | ISIC 无注册门槛 |
结论:在库内"AI-Ready 光谱"上,ISIC 2019 处于"最易获取的一档",其独有摩擦点不在获取而在合规(署名三句)与口径(官方协议 vs 自切分)。
6.7 渠道对比与选用建议
| 渠道 | 文件一致性 | license 标注 | 适用场景 | 风险 |
|---|---|---|---|---|
| 官方 data 页 | 权威(评分权重齐全) | CC-BY-NC(原文) | 复现/打榜/正式研究 | 大文件下载需断点续传 |
| ISIC Archive API | 权威(同源) | 同官方口径 | 增量拉取/按源筛选 | 需处理 API 限速 |
| Kaggle andrewmvd | 与官方一致(社区校验多) | CC BY-NC 4.0(正确) | 快速实验 | 页面"9 classes"表述易误读(坑 2) |
| Kaggle agsam23 | 与官方一致 | CC0(误标) | 不建议 | license 误用风险(坑 9) |
| openi 等社区镜像 | 官方文本转载 | 转载口径 | 中文环境快照参考 | 时效性与完整性无保障 |
§7 生态与影响:一届挑战赛留下的基准遗产
7.1 在 ISIC 系列中的枢纽位置
2016-2020 五届挑战的规模曲线(900→2,000→10,015→25,331→33,126)中,2019 是第一个"三源聚合"届:它把 2018 届的单一中心数据(HAM10000)升级为多中心多设备数据,方法上直接回应了"实验室成绩能否迁移到野外图像"的质疑。BCN20000 的加入让"dermoscopic lesions in the wild"(皮肤镜野外病变)从 BCN 论文标题变成基准现实。2020 届的 DICOM 化与 patient-centric 切分,又是对 2019 届格式与泄漏教训的吸收——2019 届是整条曲线的方法学转折点。
7.2 官方排行榜的长尾生命力
- 官方 2019 leaderboard 在 2024 年重开为持续开放的 live leaderboard(64 支队伍记录在案),2024+ 官方主推 MILK10k 基准与 ISIC 2024 挑战(SLICE3D)——但 2019 榜仍开放提交,这在医学影像挑战中罕见
- live 榜第一名 DAISYLab 0.636 与 2019 冠军同机构同数值:五年间没有公开方法在官方协议下显著超越当年冠军——侧面证明该基准的难度设定与防过拟合设计(UNK+预置验证子集)经受住了时间检验
- 基准引用惯性:ISIC 2019 的 25,331/8 类包是后续论文使用频率最高的皮肤镜分类数据(IET/Frontiers/MDPI/ACM 等大量 2021-2026 论文以其为实验载体)
7.2.1 五年无人破榜的三种解释
- 协议强度:官方测试集含约四分之一 UNK,balanced 口径把弱类敏感度全数计入——刷常见类无济于事,弱类(DF/VASC/AK/SCC/UNK)没有实质突破就动不了总分。
- 数据天花板:官方协议下外部数据要声明、验证子集不可刷、测试集不可调参——工程红利被协议锁死后,剩余差距只能靠真实泛化能力填。
- 激励结构:2020 届与 MILK10k 分流了后来者的投入——顶尖团队转向新协议新数据,2019 榜的挑战者增量有限,头部成绩自然冻结。
三种解释不互斥,共同指向同一结论:63.6% 是这个数据包在诚实评估下的水位线——任何声称"大幅超越"的自切分数字,先过口径三问(§8)再说话。
7.3 63.6% vs 0.95:一课基准素养
后续文献在 ISIC 2019 上的自切分成绩普遍 0.92-0.95(accuracy 口径):
| 口径 | 成绩 | 设置 |
|---|---|---|
| 官方测试集(冠军) | balanced accuracy 63.6% | 含 UNK、官方切分、balanced 口径 |
| MDPI Appl. 2022(自切分) | accuracy 0.92 | 训练集内 70:30 切分、8 类、无 UNK |
| Frontiers 2025(自切分) | accuracy 94.5-95.0% | 同上类自切分 |
| ACM 2023(官方在线评估) | 按官方协议 | 测试集经自动系统评分 |
落差来源三重:切分不同(官方测试集分布与训练集有异+含 24.9% UNK)、指标不同(accuracy vs balanced accuracy)、协议不同(无验证调参 vs 反复调参)。引用时必须写明口径——这是本条目反复强调的基准素养(坑 6)。
7.3.1 两口径对照总表(做实验设计时抄这张)
| 设计要素 | 官方挑战协议 | 文献自切分惯例 |
|---|---|---|
| 训练数据 | 官方训练集 25,331 张(外部数据须声明) | 同左,或再并 PH2/SD-198 等 |
| 验证方式 | 无公开验证调参;测试集一次性提交 | 训练集内 train/val(常 70:30 或 80:20) |
| 测试 | 官方 8,238 张(含 UNK 2,047) | 自留出集(通常无 UNK) |
| 指标 | balanced multi-class accuracy(平均 recall),AUC 破平局 | accuracy / macro-F1 / AUC |
| 弱类 | UNK、DF、VASC、AK、SCC 敏感度主导成绩 | accuracy 被 NV 主导 |
| 可比性 | 唯一可与官方榜对比的口径 | 仅同协议论文间可比 |
| 复算工具 | isic-challenge-scoring + 测试 GT | 自实现(建议引用官方定义) |
7.4 中国团队与国际参与
- 2019 届官方 live 榜前 35 名中中国机构密集:DysionAI(鼎视智慧,当前第 2)、BITDeeper(北京理工大学)、SYSU-MIA-Group(中山大学)、Tencent Medical AI Lab、南方医科大学 MIP、中科院自动化所(两支)等
- 中文报道口径存照:2019-08-30 中国产业经济信息网报道鼎视智慧"夺得该全球顶级医学影像算法竞赛的第 1 名(基于公开数据)"——该表述为当时 live 榜快照+限定语,与最终官方名次(live 榜当前第 2)并存不悖(坑 5 相关)
- 国际参与:汉堡(冠军)、巴塞罗那/摩德纳/瓦伦西亚(AImageLab & PRHLT)、本古里安大学、萨班哲大学、IIT Ropar、ETRI 等——医学影像挑战赛的国际多元参与在 2019 届已成型
7.5 对方法学的三条持久影响
- OOD/开放集识别进入医学影像标配议题:UNK 协议之后,"模型必须能说不知道"从 CV 话题变成医学 AI 的评价维度;2020/2024 届与 MILK10k 均延续
- balanced accuracy 成为长尾医学分类的默认主指标:2019 官方 rationale(“更接近医生真实评估”)被后续大量挑战赛引用
- 多分辨率集成+损失平衡成为皮肤镜分类的强基线配方:冠军论文的配方在 2021-2026 年文献中仍是常用对照组
7.6 引用与影响面
- 基准引用惯性:25,331/8 类包是 2021-2026 年皮肤镜分类论文的最高频实验载体之一(本条目引用链中的 MMU/IET/MDPI/Frontiers/ACM 五路文献全部以它为主实验台)
- 方法学引文锚:冠军论文(arXiv:1910.03910)是多分辨率集成+loss balancing 配方的标准引用;SD-198 作 UNK 外部源的做法经由 arXiv:2101.03814 等复现研究扩散
- 协议引用锚:官方 Evaluation 节的 balanced accuracy 定义与 rationale(“closer to real evaluation of a dermatologist”)被后续挑战赛(含非皮肤领域)在设计文档中转引
- 数据治理引文锚:MMU 分析论文(Sci Dir 2021)以 ISIC 2016-2020 全系为对象做重叠/基准分析,其表 3/表 4/表 5 是本条目数据构成的主要分析口径——后续任何"ISIC 系数据族谱"工作都绕不开
- 中文社区影响:openi.pcl.ac.cn 等中文平台收录官方数据文本;鼎视智慧夺冠报道使 ISIC 挑战赛在中文医学 AI 圈的知名度在 2019 年达到高点
§8 方法学启示:检索与使用这份基准的四条守则
8.1 守则一:先问"哪套 GT"
HAM10000 论文 GT(7 类)、ISIC 2018 届 GT、ISIC 2019 聚合 GT(8 类)对重叠图像可能有标签差异(类别体系映射与重审);论文引用某张图的标签时,注明 GT 版本与下载渠道,可避免"同一张图两个标签"的假性数据错误。
8.2 守则二:切分要按 lesion_id 聚类
训练集 11,848 个唯一 lesion ID 对应 23,247 张图(平均约 2 张/病变),随机按图切分会把同一病变的近重复图分进训练与验证两侧,制造虚高成绩;正确做法是按 lesion_id 分组切分(group split)。缺 lesion_id 的 2,084 张需单独处理策略。2020 届直接升级为 patient-centric 切分——方向的印证。
8.3 守则三:UNK 的处理写清楚
报告官方口径成绩必须说明 UNK 策略(阈值法/外部数据训练/拒识头);自切分研究若忽略 UNK,应明示"本实验不含未知类协议"——两种口径的成绩不可放进同一张对照表(见 7.3)。
8.4 守则四:署名三句走完再用图
CC-BY-NC 的三源分别署名是使用前提(6.3);论文致谢、数据声明、产品说明里都应完整出现。MSK “© Anonymous” 一句同样不可省。第三方镜像的 license 标注以官方为准(坑 9)。
8.5 复现级基线训练骨架(group split + loss balancing + UNK 外部类)
import torch, pandas as pd, numpy as np
from torch.utils.data import Dataset, DataLoader
from sklearn.metrics import balanced_accuracy_score
CLASSES = ["MEL", "NV", "BCC", "AK", "BKL", "DF", "VASC", "SCC"] # 训练 8 类
df = pd.read_csv("ISIC_2019_Training_GroundTruth.csv")
df["label"] = df[CLASSES].values.argmax(axis=1)
# 1) group split:按 lesion_id 聚类切分,防 multiplets 泄漏(缺 ID 的图单列一层)
from sklearn.model_selection import GroupShuffleSplit
df["group"] = df["lesion_id"].fillna(df["image"]) # 无 lesion_id 的图自成一组
trv = GroupShuffleSplit(n_splits=1, test_size=0.1, random_state=42)
tr_idx, va_idx = next(trv.split(df, groups=df["group"]))
train_df, val_df = df.iloc[tr_idx], df.iloc[va_idx]
# 2) loss balancing:按类频倒数加权(冠军路线的核心;优于重采样)
counts = train_df["label"].value_counts().reindex(range(len(CLASSES)))
weights = torch.tensor((counts.sum() / (len(CLASSES) * counts)).values, dtype=torch.float32)
criterion = torch.nn.CrossEntropyLoss(weight=weights)
# 3) UNK 外部类(官方测试集口径):用 SD-198 等外部病类图作第 9 类
# unk_ds 输出 label=8 的样本;与 8 类训练集拼接训练 9 类头(略)
# 4) 训练循环(示意;分辨率/裁剪策略按冠军路线做多尺度分支)
# model = timm.create_model("efficientnet_b0", num_classes=9, pretrained=True)
# for epoch in range(EPOCHS):
# ... loss = criterion(logits, y); loss.backward(); opt.step()
# # 验证:balanced_accuracy_score(与官方主指标同义,按样本级 macro recall)
# print(balanced_accuracy_score(val_y, val_pred))
三处与"文献默认做法"的刻意差异,即本条目的方法学立场:切分按 lesion_id 而非按图(坑 10)、损失加权而非过采样(§4.2)、类别头 9 类而非 8 类(§2.4)。照抄默认做法得到的高分,在官方协议下都不作数。
8.6 评审者视角:用 ISIC 2019 的论文实验设计检查单
- 数据版本写了吗?(2019 聚合包 vs HAM/BCN 单包;GT 版本)
- 切分按 lesion_id 了吗?(有 multiplets 泄漏一律存疑)
- UNK 协议处理了吗?(无 UNK 实验须明示不含未知类)
- 指标是 balanced 口径吗?(accuracy 报告须加 macro 口径)
- 外部数据声明了吗?(官方协议要求;自切分也应声明)
- 署名三句齐全吗?(license 合规)
- 与官方 63.6% 对比了吗?(有则全表口径统一;无则说明理由)
- 多分辨率/多裁剪敏感性测了吗?(分辨率跨度近 4 倍是本基准的结构性变量)
§9 与库内条目的关系
9.1 家族图谱
ISIC Archive 主库(rid 56)—— 仓库层:全库图像/API/挑战托管
│
┌──────────────┼──────────────────┐
│ │ │
HAM10000 BCN20000 MSK 系图像
(rid 60) (rid 161) (匿名源,主库覆盖)
10,015 张 12,413 张 ≈2,903 张(倒推)
└──────────────┼──────────────────┘
▼
ISIC 2019 Challenge 训练集 25,331 张(本条目)
│
▼
ISIC 2020(33,126 train,DICOM,patient-centric)
│
▼
ISIC 2024 挑战 / MILK10k 基准(现行官方主推)
- 上游(数据来源层):ham10000(rid 60)——2018 届训练集、2019 届最大单一来源;bcn20000(rid 161)——2019 届第二来源、野外多样性担当;isic-archive(rid 56)——仓库层与 MSK 系图像归属
- 本体(事件层):isic-2019(本条目)——任务设计、评估协议、冠军、排行榜
- 下游(演进层):ISIC 2020/2024 与 MILK10k(官方页面口径;库内暂无独立条目)
- 横向(任务同域):皮肤影像分类同域可互链:PH2、SD-198 等外部基准(库内暂无);生物医学挑战赛范式同域:库内其他挑战赛条目
9.1.1 三条目+本条目 = 完整 ISIC 知识面
| 你想知道 | 去哪 | 一句话理由 |
|---|---|---|
| 这个图库整体多大、怎么检索 API | isic-archive(rid 56) | 仓库层视图,全库图像统一入口 |
| HAM10000 那 10,015 张的来龙去脉 | ham10000(rid 60) | 有 Sci Data 论文级的采集/标注叙事 |
| 巴塞罗那那 12,413 张的野外谱系 | bcn20000(rid 161) | 设备多样性与"wild"叙事的主场 |
| 2019 年比赛怎么打、谁赢了、指标怎么定 | 本条目 | 事件与协议只在这里 |
9.2 检索路径建议
- 想下载图像本体:官方 data 页直链(§6.1)或 isic-archive 条目(rid 56)的 API 路径;只需 HAM/BCN 子集时直接走 rid 60/161 条目的原始获取渠道
- 想复现冠军成绩/打官方榜:本条目 §3 协议 + §6 测试 GT + isic-challenge-scoring 开源代码
- 想了解 HAM10000 的采集与 Sci Data 论文细节:rid 60 条目(本条目不重复)
- 想了解 BCN20000 的野外设备多样性:rid 161 条目(本条目不重复)
- 想把 ISIC 2019 与 2018 届对照:rid 60 条目的"ISIC 2018 Training Set"别名口径 + 本条目 §2.5 版本链表
§10 避坑清单:十个已踩过或必踩的坑
坑 1:把 ISIC 2019 当独立新数据集收录
训练集 88.5%(22,428/25,331)图像已在 ham10000/bcn20000 两条目覆盖,MSK 增量也在 isic-archive 主库范围内。数据管理系统的收录决策请先读 §5 分工声明——本条目按"独立挑战赛条目"成稿,事件层不重复、数据层明确指向,检索者别再踩"三处下载同一批图"的坑。
坑 2:9 类还是 8 类?
训练 GT CSV 是 8 列 one-hot;第 9 类 UNK(None of the others)只在测试集存在。Kaggle 镜像页"25,331 images belonging to 9 classes"是任务口径(9 类分类),不是训练标签有 9 类——拿训练 CSV 找第 9 列会扑空,拿 9 分类头接 8 列 GT 会错位。
坑 3:官方页面的 CVPR 2019 残留文本
官方页面同时写着"The results are presented at the ISIC Skin Image Analysis Workshop @ CVPR 2019"与奖金"awarded after the MICCAI Workshop in Shenzhen, China, in October 2019"——CVPR 2019 在 6 月、早于 8 月提交截止,时间倒挂,疑为沿用上届页面的模板残留。检索者以 MICCAI 2019 深圳(10 月)为获奖/收节点口径,CVPR 句存照不采。
坑 4:冠军姓氏拼写
PMC8055397(Biomed Res Int 2021)把冠军写作 “Gassert et al.”——正确为 Nils Gessert(arXiv:1910.03910 作者页为证)。文献检索两拼法都要试;引用以 arXiv 作者页为准。
坑 5:legacy 榜名次倒挂与"第一名"口径
PMC8055397 记录 legacy 前三为 Gessert 63.6 / Cancerless 63.8 / ForCure 64.8——2/3 名表内数值高于第 1 名,与 balanced accuracy 主指标排名逻辑冲突,官方名次以冠军论文自述+官方 leaderboard 为准。另有中文媒体 2019-08-30 报道"鼎视智慧获第 1 名(基于公开数据)"——那是当时 live 榜快照+限定语,与最终官方名次并存。三种"第一名"口径(官方最终/表内数值/媒体快照)不可混写。
坑 6:63.6% 与 0.92+ 不可同表
官方测试集(含 UNK、balanced accuracy、无调参机会)冠军 63.6%;文献自切分 accuracy 普遍 0.92-0.95。切分/指标/UNK 协议三重不同。对照实验要么全套官方协议+官方评分代码,要么明示"自切分口径",绝不混表(§7.3)。
坑 7:CC-BY-NC 三源分别署名,缺一即违规
官方强制署名三句:BCN_20000 © Hospital Clínic de Barcelona;HAM10000 © ViDIR Group, Med Uni Vienna;MSK Dataset © Anonymous。MSK 句虽是匿名署名也不可省。只用 HAM 子集可只按 HAM10000 论文署名,但一旦使用"ISIC 2019: Training"聚合包名义,三句必须齐全。
坑 8:UNK 数量是单源数字
测试集 UNK 2,047 张出自 Frontiers in Medicine 2026 论文(单源);官方未单独公布。引用时注明口径;精确数字以官方测试 GT CSV(现公开,454KB)按列求和核验为最终依据。
坑 9:第三方镜像 license 误标
Kaggle agsam23 镜像标 CC0 Public Domain——与官方 CC-BY-NC 冲突,勿据此使用数据;andrewmvd 镜像标 CC BY-NC 4.0 正确。一律以官方 data 页口径为准,并按坑 7 完成署名。
坑 10:lesion multiplets 的切分泄漏
11,848 个唯一 lesion ID 覆盖 23,247 张图,同一病变存在多张不同放大倍率图像(multiplets);随机按图切分会泄漏近重复样本。验证/测试切分必须按 lesion_id 分组(group split);2,084 张缺 lesion_id 的图像需显式处理策略(§8.2)。
坑点使用说明:坑 1/2/6/10 是"数字会错"类(直接影响实验结论);坑 3/4/5 是"史实会错"类(影响叙事与引用);坑 7/9 是"合规会错"类(影响法律边界);坑 8 是"待核"类(数字可能更新)。四类坑的核验优先级:合规 > 数字 > 史实 > 待核。
§11 总结
11.1 三句话总结
- ISIC 2019 Challenge 是第 4 届 ISIC 皮肤镜分类挑战赛:25,331 张训练图(HAM10000+BCN20000+MSK 三源聚合、8 类)+ 8,238 张含 UNK 未知类的测试图,balanced accuracy 主指标,冠军 Gessert 团队多分辨率 EfficientNets 集成双任务登顶(63.6%/63.4%)。
- 它的持久遗产不是图像(图像都是既有的),而是协议:UNK 开放集陷阱、balanced accuracy 的"医生视角"哲学、开源评分代码、以及一个五年无人公开突破的持续排行榜。
- 对数据管理者的核心提醒:数据层高度撞库(88.5% 已在库内两条目),本条目按独立挑战赛条目成稿并做分工声明;对使用者的核心提醒:口径三问(哪套 GT/哪个切分/UNK 怎么处理)之后再比较任何两个数字。
11.2 适合谁
- 要复现/挑战官方成绩的团队:协议、测试 GT、评分代码、排行榜全链路公开,可直接开工
- 研究长尾分布/开放集识别的方法学者:54:1 失衡 + UNK 协议是现成的方法学试验场
- 做医学挑战赛设计的组织者:balanced accuracy rationale、验证分防刷榜、奖金与税务流程、开源评分审计——一套可直接借鉴的挑战赛运营范本
- 写皮肤影像综述的作者:版本链(2016→2024)与 63.6% vs 0.92 的口径课,是讨论"基准真实难度"的必引素材
11.3 不适合谁
- 只想"多拿一批新图"的团队:训练集 88.5% 图像已在 ham10000/bcn20000,纯数据增量仅 MSK 约 2,903 张——先读 §5
- 需要患者级纵向数据的研究:训练集只有 lesion_id 无 patient ID,年龄是近似分箱——patient-centric 研究请走 ISIC 2020
- 需要商业使用的团队:CC-BY-NC 不覆盖商业场景
- 需要 DICOM/嵌入 metadata 的工作流:2019 包是 JPEG+CSV,2020 届才 DICOM 化
11.4 30 秒决策卡
- 你要打官方榜/复现冠军?→ 是:§6 下载官方包+测试 GT,§3 协议,§4 冠军配方起点
- 你要一个干净的皮肤镜分类基准?→ 已有 HAM/BCN?是:不必重收 2019 包,按 §5.3 决策;否:官方包一步到位且自带协议
- 你要患者级/纵向研究?→ 走 ISIC 2020,本条目仅作谱系参考
- 你要商业部署?→ NC 许可挡路;找替代数据或另行授权
11.5 给三类角色的一句话
- 数据管理者:这是一个"事件条目"——收录它的理由是协议与榜单,不是图像;图像层请对照附录 O 的分工表防重复。
- 算法研究员:这是"口径最严格"的皮肤镜基准——遵守它(group split、balanced 口径、UNK 声明)得到的数字才与官方榜同 currency。
- 政策/运营者:这是医学挑战赛运营的参考范本——指标 rationale、防刷榜设计、评分审计、奖金流程四件事都写进了官方文本,可直接借鉴。
FAQ(高频问答 48 问)
A. 基础认知
Q1:ISIC 2019 是什么?
ISIC(国际皮肤影像协作组)主办的第 4 届皮肤病变分析挑战赛(2016/2017/2018/2019 序列),任务是皮肤镜图像九类分类(8 训练类+测试集 UNK 未知类),分图像-only 与图像+metadata 双赛道。
Q2:它和 ISIC Archive 什么关系?
Archive 是图像库(仓库层),挑战赛是每年一次的评测事件(事件层),数据包从 Archive 聚合导出。库内 isic-archive(rid 56)收仓库层,本条目收 2019 届事件层。
Q3:它和 HAM10000 什么关系?
HAM10000 的 10,015 张全部并入 2019 训练集(即 2018 届训练集原样成为 2019 届子集)。HAM 采集故事见库内 rid 60 条目。
Q4:它和 BCN20000 什么关系?
BCN20000 是 2019 届新增的巴塞罗那来源(MMU 口径 12,413 张进入 2019 训练集)。BCN 采集故事见库内 rid 161 条目。
Q5:为什么 2019 届重要?
三件事首次定标:三源多中心聚合、balanced accuracy 主指标、测试集 UNK 未知类协议。此后医学影像挑战赛的评估设计大量参照此届。
Q6:ISIC 2019 数据集 license 是什么?
CC-BY-NC(非商业),且署名须分别注明 BCN/HAM/MSK 三源(坑 7)。
B. 数据与获取
Q7:训练集多大?测试集多大?
训练 25,331 张 JPEG(9.1GB);测试 8,238 张 JPEG(3.6GB);合计 33,569 张。
Q8:图像分辨率是多少?
450×600 至 1024×1024(IET 口径),跨度近 4 倍——冠军方法用多分辨率输入回应。
Q9:metadata 有哪些字段?
训练:age_approx/sex/anatom_site_general/lesion_id;测试:age_approx/sex/anatom_site_general(无 lesion_id)。
Q10:lesion_id 缺失多少?
23,247 张有值、2,084 张缺失;唯一 ID 11,848 个(MMU 口径)。
Q11:测试集标签现在能拿到吗?
能。挑战期间不公开(自动在线评估);挑战结束后官方 data 页公开 8,238 条测试 GT(454KB,含评分与验证权重)。
Q12:哪里下载最靠谱?
官方 challenge.isic-archive.com/data/ 直链;API 走 isic-archive(rid 56)。第三方镜像注意 license 误标(坑 9)。
Q13:训练数据什么时候发布的?
官方页面未标注(遗留疑点);只知测试图计划 2019-08-02 发布,训练集不晚于 2019 年夏。
Q14:测试集 UNK 有多少张?
官方未单独公布;Frontiers Med 2026 单源口径 2,047 张(24.9%),待官方 GT CSV 核验(坑 8)。
C. 任务与评估
Q15:主指标怎么算?
balanced multi-class accuracy = 各类 TP/positives 的算术平均(等价 average recall);平局以 AUC 打破。
Q16:为什么不用 accuracy?
NV 占 50.8% 会主导 accuracy;官方 rationale 是 balanced 口径"更接近皮肤科医生的真实评估"。
Q17:validation score 是什么?
约 100 张预置非代表性子集上的 sanity check 分(随机提交约 0.3),官方明言不用于排名——防刷榜设计。
Q18:Task 1 和 Task 2 差在哪?
Task 2 可用 metadata;Task 2 选手必须同时提交 Task 1;两赛道各设前三名奖金。
Q19:评分代码可审计吗?
是。isic-challenge-scoring 包开源、宽松许可,官方为外部审计而发布。
Q20:还计算哪些指标?
sensitivity/specificity/accuracy/AUC/mAP/F1/AUC80/PPV/NPV 与聚合口径(平均 AUC、恶性 vs 良性、分类别 AUC),但排名只看 balanced accuracy。
D. 结果与基准
Q21:谁拿了冠军?成绩多少?
Gessert 等(TU Hamburg/UKE),多分辨率 EfficientNets 集成:Task 1 63.6%、Task 2 63.4%,双任务第一(arXiv:1910.03910 官方备注 First place)。
Q22:第二名第三名是谁?
PMC 口径 legacy 前三:2nd Cancerless(63.8)、3rd ForCure(64.8)——表内数值与名次倒挂存照(坑 5),官方名次以冠军自述+官方榜为准。
Q23:live leaderboard 是怎么回事?
官方 2019 榜于 2024 重开为持续开放的 live 榜(64 队):1st DAISYLab 0.636(当年冠军同机构同值)、2nd DysionAI 0.607、3rd AImageLab & PRHLT 0.593。
Q24:为什么文献里 0.92+ 的成绩比官方 63.6% 高这么多?
口径三重不同:自切分 vs 官方测试集、accuracy vs balanced accuracy、无 UNK vs 含 UNK——不可同表(坑 6)。
Q25:unknow 类怎么处理?
主流做法用外部数据(如 SD-198)训练第 9 类;也有阈值法/层级外类判定。冠军方法用外部数据补充训练集外病类。
Q26:奖金多少?谁发的?
每赛道前三 $4,000/$2,000/$1,000,Canfield Scientific 提供,2019 年 10 月深圳 MICCAI 工作坊后发放。
E. 使用与库内
Q27:我想只下载 HAM10000 那 10,015 张,用下 2019 包吗?
不必。直接用 ham10000(rid 60)条目的原始渠道;2019 包的价值在统一 8 类标签与官方协议。
Q28:用 2019 聚合包发表论文要怎么引用?
按官方要求三源分别署名(§6.3)+ 引用 Codella 2018 challenge 论文与 Tschandl 2018;BCN 部分加引 Hernández-Pérez 2024。
Q29:切分验证集要注意什么?
按 lesion_id 分组切分(group split),防 multiplets 泄漏;2,084 张缺 lesion_id 的图显式处理(坑 10)。
Q30:库内还有哪些相关条目?
isic-archive(rid 56,仓库层)、ham10000(rid 60,2018 届训练集)、bcn20000(rid 161,巴塞罗那源)——数据层细节都在那三条。
Q31:ISIC 2020/2024 在哪了解?
官方页面与 Rotemberg et al. 2020 论文(2020 届,33,126 train,DICOM,patient-centric);2024 挑战与 MILK10k 见 challenge.isic-archive.com 现行主页。库内暂无独立条目。
Q32:这届比赛对中国团队意义?
中国机构在前 35 名密集出现(鼎视智慧/北理工/中山大学/腾讯医疗 AI/南方医科大/中科院自动化所等),鼎视智慧曾以官方 live 榜前排成绩见诸中文报道——皮肤影像是当年中国医学 AI 国际竞赛参与度最高的赛道之一。
F. 工程与复现细节
Q33:官方提交格式是什么?
逐行 one-hot 的 CSV(8 或 9 列),提交系统自动做格式校验并即时返回 validation score;格式错误的常见翻车点是列序与图号对不上(validation score 会异常低,随机提交约 0.3 可作对照)。
Q34:怎么复算官方成绩?
挑战后测试 GT 已公开:下载 ISIC_2019_Test_GroundTruth.csv,按 §3.3.1 骨架或 isic-challenge-scoring 包复算 balanced accuracy;AUC 破平局逻辑以官方包为准。
Q35:多分辨率输入具体怎么做?
冠军路线是"多模型多尺度":为 EfficientNet 不同变体配置不同输入分辨率与裁剪(同尺寸裁剪/随机缩放裁剪),分别训练后子集搜索集成;单模型路线则是保持长宽比的缩放+随机裁剪增强。
Q36:metadata 缺值怎么处理?
age_approx/anatom_site_general/sex 均有缺值(测试集口径 “Other/unknown” 占比可观);常规做法是缺失类别化(unknown 列)——冠军的 dense 分支同样以类别嵌入处理,不建议均值插补。
Q37:想在 ISIC 2019 上练长尾方法,最该盯哪些类?
DF(239)、VASC(253)、SCC(628)、AK(867)四个长尾类的每类敏感度几乎决定 balanced accuracy 的上限;NK/平衡项调好后再看这四类的混淆矩阵收益最大。
Q38:官方测试集分布和训练集有什么已知差异?
测试集含 24.9% UNK(单源口径)且官方未承诺类别比例与训练集一致——这正是"闭集冠军在开放集上掉分"的结构性原因;复现时不要按训练集类别先验外推测试集。
Q39:现在提交还能上榜吗?
能。官方 2019 leaderboard 已重开为持续开放的 live 榜(64 队在案),提交走官方系统;注意排名按当前协议与评分权重,与 2019 年历史快照不完全同口径。
Q40:引用本条目数据时应报哪个抓取时点?
2026-09-28(官方页面/leaderboard/论文快照时点);官方 live 榜与文献计量类数字随时间变化,引用时注明时点是本库条目的通用要求。
G. 口径与合规
Q41:ISIC 2019、ISIC 2018、HAM10000 三者的 GT 有什么区别?
2018 届 GT=HAM10000 的 7 类口径;2019 届 GT=25,331 张的 8 类 one-hot(HAM 子集按 8 类体系重排,BKL 为合并类);三者类目映射与重审历史不同——同一张图在不同包里可能对应不同标签集合,引用必须注明 GT 版本。
Q42:可以在 Kaggle 上下完直接商用吗?
不可以。CC-BY-NC 不覆盖商业使用;且部分第三方镜像 license 标注有误(坑 9),商用授权需另行获得权利方(三源版权方)许可。
Q43:这篇条目和库内 ham10000 条目有重复吗?
无重复风险:本条目是挑战赛事件条目,数据层已按 §5/附录 O 分工声明指向 rid 60/161/56;ham10000 条目继续承载其数据本体细节。
Q44:用 ISIC 2019 训练的模型发论文,数据声明怎么写最稳?
四要素:训练集版本(ISIC 2019 Training,25,331 张)、外部数据清单(若有)、切分方式(按 lesion_id 分组)与指标口径(balanced accuracy 或注明 accuracy);许可声明附三源署名句。
Q45:冠军团队和 DAISYLab 到底什么关系?
同机构同方法谱系(TU Hamburg/UKE 的多分辨率 EfficientNets 集成),且 live 榜第一名的 0.636 与当年官方成绩 63.6% 精确一致;官方未发布正式说明,本条目按"机构+数值+方法三重吻合作一致性陈述"处理,不作超出证据的断言(§4.1)。
Q46:测试 GT 里的 scoring/validation weights 是什么?
官方测试 GT 文件(454KB)附带的评分与验证权重——官方评分器用它计算加权指标;自实现复算时若忽略权重,结果可能与官方口径有细微出入,建议直接用 isic-challenge-scoring。
Q47:BCN20000 为什么只进了一部分(12,413/20,000)?
BCN20000 全集 20,000 张中仅部分随 2019 届进入聚合包(MMU 口径 12,413),其余后续进入 2020 届——官方未逐张公布取舍标准;用 BCN 研究时引用其官方条目(rid 161)与期刊版论文(Hernández-Pérez 2024),勿把 20,000 全集与 2019 聚合包划等号。
Q48:ISIC 2019 会过期吗?
数据包长期有效(官方存档+live 榜持续开放);但"成绩快照"类数字(live 榜名次、文献计量)会随时间漂移——引用时注明时点,本条目维护计划见附录 N。
事实清单(硬事实 48 条)
- ISIC 2019 是 ISIC 主办的第 4 届皮肤病变分析挑战赛(2016/2017/2018/2019 序列)
- 训练集 25,331 张皮肤镜 JPEG,8 类 one-hot ground truth,9.1GB
- 测试集 8,238 张 JPEG,3.6GB,9 类口径(8 known+UNK)
- 合计 33,569 张
- 训练类别分布:MEL 4,522 / NV 12,875 / BCC 3,323 / AK 867 / BKL 2,624 / DF 239 / VASC 253 / SCC 628(四源互证)
- NV 占 50.8%,DF 0.9%,最大最小类比约 54:1
- 训练集来源:HAM10000 10,015(全集)+ BCN20000 12,413(MMU 口径)+ MSK ≈2,903(倒推)
- 相对 2018 届新增 SCC 类(628 张)与 BCN 源
- 图像分辨率 450×600 至 1024×1024
- 训练 metadata:age_approx/sex/anatom_site_general/lesion_id
- lesion_id 有值 23,247 张、缺失 2,084 张;唯一 ID 11,848 个
- 测试 metadata 无 lesion_id
- 测试图像计划发布日 2019-08-02(官方"planned release")
- 测试 metadata 2019-08-16 发布;Task 1 截止 2019-08-16;Task 2 截止 2019-08-23
- Task 2 参与者必须同时提交 Task 1
- 参赛者必须提交方法论文链接(官方要求)
- 主指标 balanced multi-class accuracy = 各类 TP/positives 算术平均 = average recall
- 平局以 AUC 打破;排名与颁奖只看 balanced accuracy
- 其他指标:sens/spec/acc/AUC/mAP/F1/AUC80/PPV/NPV
- validation score 基于约 100 张非代表性子集,仅 sanity check,随机提交约 0.3
- 评分代码 isic-challenge-scoring 开源可审计
- 奖金每赛道 $4,000/$2,000/$1,000,Canfield Scientific 提供
- 奖金在 2019 年 10 月深圳 MICCAI 工作坊后发放;官方页面另有 CVPR 2019 残留文本(存照矛盾)
- 赞助商:Canfield Scientific、IBM、MetaOptima
- Clinical Chairs:Malvehy(巴塞罗那)/ Halpern(MSKCC);CV Chair:Codella(IBM Research)
- 冠军:Nils Gessert 等 5 人(TU Hamburg/UKE),官方测试集 Task 1 63.6% / Task 2 63.4% 双第一
- 冠军方法:多分辨率 EfficientNets 集成+loss balancing+外部数据补 UNK+metadata dense 融合+集成子集搜索;CV 集成 BA 74.2%
- live leaderboard(2024 重开,64 队):DAISYLab 0.636 / DysionAI 0.607 / AImageLab & PRHLT 0.593
- legacy 前三(PMC 口径):Gessert 63.6 / Cancerless 63.8 / ForCure 64.8(名次-数值倒挂存照)
- license CC-BY-NC;三源分别署名为强制(MSK 匿名句不可省)
- 官方 data 页现提供测试 GT(454KB,含 scoring/validation weights)——挑战期间标签不公开的双口径
- 测试集 UNK 2,047 张(Frontiers Med 2026 单源,待核)
- 文献自切分成绩 0.92-0.95 accuracy 与官方 63.6% balanced accuracy 三重口径不可比
- UNK 外部数据主流源为 SD-198(arXiv:2101.03814 口径)
- 官方指定引用:Codella et al. 2018(arXiv:1902.03368)+ Tschandl 2018(Sci Data 5:180161)+ Codella 2017(arXiv:1710.05006)+ Hernández-Pérez 2024(Sci Data 11:641)
- 2024+ 官方转向 ISIC 2024 挑战与 MILK10k 基准;2019 live 榜仍开放
- 官方提交格式为逐行 one-hot CSV,提交系统自动格式校验并即时返回 validation score
- 官方页面注明 2019 届两赛道任务相似,共用同一页描述(模板自注)
- IEEE SPS 将 ISIC 2019 列入官方 data challenges 列表
- 组委会规则:委员会成员所属机构可参赛但须保证提交独立
- 图像命名 ISIC_xxxxxxx.jpg,图号是跨包稳定键(去重主键)
- 测试集 UNK 行在官方 GT 中表现为 8 known 列全 0、UNK 列置 1
- 官方测试 GT 文件"includes the scoring and validation weights"(含评分与验证权重)
- 训练集含同一病变不同放大倍率的多倍图(官方明言为数据集特色)
- 唯一图号键 ISIC_xxxxxxx 跨包稳定,可作多包联合去重主键
- live 榜前排 10 队中仅 3 队公开方法描述(官方透明度引导的自愿特征)
- metadata 各字段存在缺失(部位/性别缺值约 4% 量级,测试镜像口径),缺失模式可能携带中心/设备信息
- BCN20000 全集 20,000 张中仅部分进入 2019 聚合包,取舍标准官方未逐张公布
术语表(32 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| ISIC | International Skin Imaging Collaboration | 国际皮肤影像协作组,挑战赛主办方 |
| 皮肤镜 | dermoscopy | 带浸润液与放大的皮肤成像模态,皮肤癌诊断标准工具 |
| 黑色素瘤 | melanoma | 最致命的皮肤癌,MEL 类 |
| 黑色素细胞痣 | melanocytic nevus | 良性痣,NV 类,训练集第一大类 |
| 基底细胞癌 | basal cell carcinoma | 最常见皮肤恶性肿瘤,BCC 类 |
| 鳞状细胞癌 | squamous cell carcinoma | SCC 类,2019 届新增类别 |
| 光化性角化病 | actinic keratosis | 癌前病变,AK 类 |
| 良性角化病 | benign keratosis | BKL 类(日光性黑子/脂溢性角化病/扁平苔藓样角化病合并类) |
| 皮肤纤维瘤 | dermatofibroma | 良性病变,DF 类,最小类(239 张) |
| 血管病变 | vascular lesion | VASC 类 |
| UNK | unknown / None of the others | 测试集专属未知类,训练分布外图像 |
| balanced accuracy | normalized multi-class accuracy | 各类敏感度算术平均,主指标 |
| 平均召回率 | average recall | 与主指标语义等价 |
| AUC80 | AUC between 80-100% sensitivity | 高敏感度区间的 AUC 积分,官方辅助指标 |
| 长尾分布 | long-tailed distribution | 少数类占绝大多数样本的分布形态 |
| 损失平衡 | loss balancing | 按类频加权损失函数应对失衡 |
| 多分辨率集成 | multi-resolution ensemble | 不同输入分辨率的模型组合 |
| 集成子集搜索 | ensemble subset search | 从候选池搜索最优模型组合 |
| 元数据融合 | metadata fusion | 结构化临床信息与图像特征拼接 |
| 开放集识别 | open-set recognition | 识别训练类之外的未知类 |
| 分布外检测 | out-of-distribution (OOD) detection | 判别输入是否偏离训练分布 |
| 病变多倍图 | lesion multiplets | 同一病变多张不同倍率图像 |
| 组切分 | group split | 按病变/患者 ID 聚类的数据切分 |
| 验证分 | validation score | 预置小子集上的提交自检分,不用于排名 |
| 读片研究 | reader study | 算法与医生表现的对照实验 |
| 野外图像 | in the wild | 多设备多条件非受控采集的图像 |
| 患者中心切分 | patient-centric split | 按患者而非图像划分数据集(2020 届引入) |
| 金标准标签 | gold standard | 专家共识级诊断标签 |
| 感知哈希 | perceptual hash (phash) | 图像内容相似性指纹,近重复检测常用 |
| 阈值拒识 | confidence thresholding | 低于置信度阈值的输入判为未知类 |
| 版本链 | version lineage | 同一基准跨年份演化的代际关系 |
| 数据卡 | data card | 数据集的标准化自描述文档(ISIC 2019 缺失项) |
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| slug | isic-2019 |
| 正式名 | ISIC 2019 Challenge(Skin Lesion Analysis Towards Melanoma Detection 2019) |
| 条目类型 | 挑战赛条目(事件层);数据层指向 rid 56/60/161 |
| 主办 | ISIC(MSISCC) |
| 年份 | 2019(数据 2019 年发布,获奖收节点 2019-10 深圳 MICCAI) |
| 规模 | 25,331 train + 8,238 test |
| license | CC-BY-NC(三源分别署名强制) |
| 主指标 | balanced multi-class accuracy |
| 冠军 | Gessert et al., BA 63.6%(T1)/ 63.4%(T2) |
| 官方渠道 | challenge.isic-archive.com/data/ |
| 抓取时点 | 2026-09-28 |
附录 B:DAIMS 评估全表
| 维度 | 评分 | 依据 |
|---|---|---|
| D1 可发现性 | ★★★★★ | 官方站+DOI 论文链+IEEE SSP 收录+大量文献引用,可发现性满分档 |
| D2 可获取性 | ★★★★★ | 官方直链下载(训练 9.1GB/测试 3.6GB/GT/metadata 全套)+API,无需注册审批 |
| D3 格式可用性 | ★★★★☆ | JPEG+CSV 标准工具链直读;非 DICOM(2020 届才改进)扣半星 |
| I1 标注完整性 | ★★★★☆ | 训练集全量 8 类 gold standard+四字段 metadata;测试 GT 后补公开;无像素级标注 |
| I2 标注质量 | ★★★★☆ | 三来源均为专家级皮肤镜诊断(HAM/BCN 各有 Sci Data 论文背书);类目合并(BKL 三病合一)降低粒度 |
| M1 机器可读文档 | ★★★☆☆ | 官方页有任务/指标/署名说明,但无数据卡;采集设备/人口学分布要查来源论文 |
| M2 伦理合规 | ★★★☆☆ | CC-BY-NC 明确+MSK 匿名;但无患者知情/IRB 细节披露(在来源论文层) |
| S1 可持续性 | ★★★★★ | 挑战站 [Closed] 后数据仍全量可取+测试 GT 公开+live 榜持续开放,五年维护良好 |
| 综合 | 4.1/5 | AI-Ready 早期标杆;短板在文档层而非格式层 |
附录 C:逐项证据链自证
| 硬数字 | 一手来源 | 交叉验证 |
|---|---|---|
| 25,331 train / 8,238 test | 官方 challenge2019.isic-archive.com(抓取 2026-09-28) | MMU Sci Dir 2021 表 5;Frontiers 2026;ACM 2023 |
| 8 类分布(4522/12875/3323/867/2624/239/253/628) | MMU Sci Dir 2021 表 3 | MDPI Appl. 2022 表 1(绝对数);IET 2023(百分比);Frontiers 2026 |
| 三源构成(10015/12413/≈2903) | MMU Sci Dir 2021 表 4 | 倒推校验 25,331−22,428=2,903;官方署名三句(来源归属) |
| Task 截止日 08-16/08-23 | 官方页面(抓取原文) | openi.pcl.ac.cn 官方文本转载 |
| balanced accuracy 定义 | 官方页面 Evaluation 节(抓取原文) | IET 2023(“average sensitivity among classes”) |
| 奖金 $4000/$2000/$1000 | 官方页面 Awards 节(抓取原文) | —(单源官方) |
| 冠军 63.6%/63.4% | arXiv:1910.03910 摘要 | PMC8055397 表 2(Gessert 行 63.6) |
| live 榜 DAISYLab 0.636 / DysionAI 0.607 | challenge.isic-archive.com/leaderboards/2019(搜索快照 2026-09-28) | PMC8055397(Gessert 63.6 与 DAISYLab 同值同机构互证) |
| lesion_id 统计(23,247/2,084/11,848) | MMU Sci Dir 2021 | —(单源分析口径,标注) |
| UNK 2,047 | Frontiers Med 2026 | —(单源,坑 8 存照) |
| 测试 GT 现已公开(454KB) | challenge.isic-archive.com/data/(抓取) | ACM 2023(同期文献口径"not publicly available"——时间差存照) |
附录 D:数据获取决策树
需要 ISIC 2019 数据?
├─ 只要 HAM10000 子集 → 走 ham10000(rid 60)原始渠道,不碰 2019 包
├─ 只要 BCN20000 子集 → 走 bcn20000(rid 161)原始渠道
├─ 要完整官方协议(复现/打榜)
│ ├─ 官方 data 页下载:train 9.1GB + GT + test 3.6GB + test GT + metadata
│ ├─ 评分:isic-challenge-scoring(开源)+ 官方测试 GT 复算
│ └─ 署名:三源分别署名(坑 7)
├─ 只要 MSK 增量(≈2,903 张)→ ISIC Archive API(rid 56)按源筛选
└─ 要患者级纵向数据 → 改用 ISIC 2020(patient-centric,DICOM)
附录 E:许可条款细读
| 条目 | 官方口径 | 实操含义 |
|---|---|---|
| license | CC-BY-NC | 学术可用,商业受限 |
| 署名 | 三源分别注明(BCN/HAM/MSK) | 论文数据声明三句齐全;MSK 匿名句不可省 |
| 再分发 | CC-BY-NC 框架下可共享改编 | 携带同样署名与 NC 约束 |
| 模型权重 | 官方未表态 | 领域惯例可用;建议产品声明注明数据许可 |
| 第三方镜像 | andrewmvd=CC BY-NC 4.0(正确);agsam23=CC0(误标) | 一律以官方页为准(坑 9) |
| 引用 | Codella 2018 + Tschandl 2018 + 三源句 | Hernández-Pérez 2024(BCN 部分期刊版) |
附录 F:坑点档案(与 §10 对照)
| 坑号 | 一句话 | 后果 |
|---|---|---|
| 坑 1 | ISIC 2019 非独立新数据集(88.5% 重叠) | 重复收录/重复下载 |
| 坑 2 | 训练 GT 8 列,第 9 类只在测试 | 标签错位/找错列 |
| 坑 3 | 官方页 CVPR 2019 残留文本 vs MICCAI 深圳 | 获奖时间线写错 |
| 坑 4 | Gessert 被拼成 Gassert | 文献检索漏检 |
| 坑 5 | legacy 2/3 名数值倒挂;媒体"第一名"快照口径 | 名次写错 |
| 坑 6 | 63.6% 与 0.92+ 三重口径差 | 虚假对比表 |
| 坑 7 | 三源署名缺一即违规 | license 违约 |
| 坑 8 | UNK 2,047 为单源数字 | 数字失据 |
| 坑 9 | Kaggle 镜像 CC0 误标 | license 误用 |
| 坑 10 | multiplets 随机切分泄漏 | 虚高成绩 |
附录 G:双口径登记表
| # | 口径 A | 口径 B | 处理 |
|---|---|---|---|
| 1 | 官方页"results presented @ CVPR 2019" | 同页"奖金 MICCAI 2019 深圳 10 月后发" | 按 MICCAI 口径成稿,CVPR 句存照(模板残留) |
| 2 | 挑战期间测试标签不公开(ACM 2023 等) | 现官方 data 页提供测试 GT 454KB | 按时间点分别陈述(挑战后公开) |
| 3 | legacy 前三数值 Gessert 63.6 < Cancerless 63.8 < ForCure 64.8 | 官方名次 Gessert 第一 | 名次以冠军自述+官方榜为准,表内数值存照 |
| 4 | PMC 拼写 “Gassert” | arXiv 作者页 “Nils Gessert” | 以 arXiv 为准;检索两拼法都试 |
| 5 | BCN 进入 2019 训练集 12,413(MMU) | BCN 官方论文 19,424 进入 2019+2020 合并 | 两口径不同集合,不可对表;条目用 MMU 口径+注 |
| 6 | MSK 增补 ≈2,903(倒推) | MMU MSK 系合计 2,918 | 差 15 张口径未明,存照 |
| 7 | UNK 2,047(Frontiers 2026) | 官方未单独公布 | 单源存照,以官方 GT CSV 核验为最终依据 |
| 8 | 中文报道"鼎视智慧第 1 名(基于公开数据)"(2019-08-30) | 当前 live 榜 DysionAI 第 2(0.607) | 两口径均为真(时间点不同),并存陈述 |
| 9 | 训练数据发布日官方未标注 | 多源仅可上溯"2019 年内" | 遗留疑点 |
| 10 | 2019 届原始参赛队数官方未公布 | live 榜 64 队(2024 重开累计) | 勿混用,条目按官方未公布处理 |
附录 H:引文规范(BibTeX 友好格式)
挑战赛数据引用(官方要求):
Codella N, Rotemberg V, Tschandl P, et al. Skin Lesion Analysis Toward
Melanoma Detection 2018: A Challenge Hosted by the International Skin
Imaging Collaboration (ISIC). arXiv:1902.03368.
Tschandl P, Rosendahl C, Kittler H. The HAM10000 dataset. Sci Data
5, 180161 (2018). doi:10.1038/sdata.2018.161
三源署名(CC-BY-NC 强制):
BCN_20000 Dataset: (c) Department of Dermatology, Hospital Clínic de Barcelona
HAM10000 Dataset: (c) by ViDIR Group, Department of Dermatology, Medical
University of Vienna; https://doi.org/10.1038/sdata.2018.161
MSK Dataset: (c) Anonymous; https://arxiv.org/abs/1710.05006 ;
https://arxiv.org/abs/1902.03368
冠军方法论文:
Gessert N, Nielsen M, Shaikh M, Werner R, Schlaefer A. Skin Lesion
Classification Using Ensembles of Multi-Resolution EfficientNets with
Meta Data. arXiv:1910.03910 (2019).
BCN20000 期刊版:
Hernández-Pérez C, Combalia M, Podlipnik S, et al. BCN20000: Dermoscopic
lesions in the wild. Sci Data 11, 641 (2024).
附录 I:与库内 ham10000/bcn20000/isic-archive 条目的关系声明(强制分工)
本条目(isic-2019)为挑战赛事件条目:任务设计(§3)、冠军方法(§4)、基准演化(§7)为本体内容。数据层声明:训练集 25,331 张图像全部来自三个既有来源,其中 HAM10000(10,015 张,采集/标注/患者口径)归 ham10000(rid 60)条目;BCN20000(12,413 张,MMU 口径)归 bcn20000(rid 161)条目;MSK 系(≈2,903 张)的仓库层归属 isic-archive(rid 56)条目。本条目仅记录聚合关系、增量(SCC 类、UNK 协议)与重复性风险,不重复三条目的数据本体内容。若三条目与官方口径出现数据层冲突,以各来源论文与官方 data 页为准并在相应条目维护。
附录 J:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✓ | 官方挑战站+arXiv 引用体系 |
| F2 丰富元数据 | ◐ | 官方页有协议文档,无数据卡 |
| F3 明确引用标识 | ✓ | 官方给出标准引用文本 |
| A1 可元数据检索 | ✓ | IEEE SPS/官方站/论文生态 |
| A2 元数据可访问 | ✓ | HTTP 页面公开 |
| A3 数据可访问 | ✓ | 公开直链+API |
| I1 互操作格式 | ✓ | JPEG+CSV |
| I2 通用词表 | ◐ | 类别有官方缩写(MEL/NV/…),无 SNOMED 映射文件 |
| R1 溯源 | ✓ | 三源署名+版本链清晰 |
| R2 许可 | ✓ | CC-BY-NC 明示(署名义务详见坑 7) |
| R3 社区维护 | ✓ | live 榜持续开放+评分代码开源 |
附录 K:检索路径示范(关键词组合与查询式)
官方口径检索:
"ISIC 2019" challenge site:challenge.isic-archive.com
challenge2019.isic-archive.com (历史域名,现 [Closed] 重定向)
冠军与排行榜:
Gessert EfficientNets ISIC 2019 / arXiv:1910.03910
DAISYLab ISIC leaderboard / DysionAI ISIC
数据构成与重复性:
ISIC 2019 HAM10000 BCN20000 MSK composition
"ISIC 2019" "25,331" training images
ISIC datasets overlap analysis (MMU Sci Dir 2021 系核心文献)
协议与指标:
"ISIC 2019" "balanced accuracy" unknown class
isic-challenge-scoring github
避坑检索:
Gessert OR Gassert ISIC 2019 (坑 4 双拼法)
"ISIC 2019" UNK "2047" OR "2,047" (坑 8 待核数字)
附录 L:官方页面关键原文摘录(口径锚点)
| 主题 | 官方原文(challenge2019.isic-archive.com,抓取 2026-09-28) |
|---|---|
| 任务 | “The goal for ISIC 2019 is classify dermoscopic images among nine different diagnostic categories” |
| UNK | “the test dataset (planned release August 2nd) will contain an additional outlier class not represented in the training data, which developed systems must be able to identify” |
| 赛道 | “Two tasks will be available for participation: 1) classify dermoscopic images without meta-data, and 2) classify images with additional available meta-data.” |
| 截止 | “Task 1’s deadline will be August 16th. Task 2 will be August 23th, after release of test meta-data on August 16th.” |
| 强制论文 | “each competitor is required to submit a link to a manuscript describing the methods used to generate predictions” |
| 指标定义 | “the arithmetic mean of the (<category>_true_positives / <category>_positives) across each of the diagnostic categories… semantically equivalent to the average recall score” |
| 平局 | “Tied positions will be broken using the area under the receiver operating characteristic curve (AUC) metric.” |
| rationale | “…we want to rank for the more ambitious metric of normalized multiclass accuracy, as it is also closer to real evaluation of a dermatologist.” |
| 验证分 | “This validation score is not intended to be used for algorithm ranking or evaluation… a random submission generates a validation score of about 0.3.” |
| 评分审计 | “The code of the isic-challenge-scoring package is used for actual score computation. This code is open source, permissively licensed, and published, to facilitate external auditing.” |
| 奖金 | “Cash prizes of $4,000, $2,000, and $1,000 will be awarded to the first, second, and third place participants of image-only and meta-data tasks.” |
| 发放时点 | “The monetary prizes for the winners of the challenge will be awarded after the MICCAI Workshop in Shenzhen, China, in October 2019.” |
| 矛盾存照 | “The results are presented at the ISIC Skin Image Analysis Workshop @ CVPR 2019.”(与 MICCAI 口径并存,见坑 3) |
| 署名 | “the aggregate ‘ISIC 2019: Training’ data must be cited as: BCN_20000 Dataset… HAM10000 Dataset… MSK Dataset…” |
附录 M:缩写速查
| 缩写 | 全称 | 中文 |
|---|---|---|
| ISIC | International Skin Imaging Collaboration | 国际皮肤影像协作组 |
| MSKCC | Memorial Sloan Kettering Cancer Center | 纪念斯隆-凯特琳癌症中心 |
| UKE | University Medical Center Hamburg-Eppendorf | 汉堡-埃彭多夫大学医学中心 |
| MEL/NV/BCC/AK/BKL/DF/VASC/SCC/UNK | 九个诊断类别缩写 | 见 §2.2 表 |
| BA | balanced multi-class accuracy 简写 | 平衡多类准确率 |
| OOD | out-of-distribution | 分布外 |
| TTA | test-time augmentation | 测试时增强 |
| PPV/NPV | positive/negative predictive value | 阳性/阴性预测值 |
| GT | ground truth | 金标准标签 |
| CV | cross-validation | 交叉验证(本条目语境) |
| GT CSV | 官方 ground truth 表格文件 | 训练 8 列 / 测试 9 列(含 UNK) |
附录 N:维护计划与触发点
| 触发点 | 动作 |
|---|---|
| 官方 live leaderboard 名次变动(如 DysionAI/新队登顶) | 更新 §4.3/§7.2 与 INFOBOX 排行数字,登记抓取时点 |
| UNK 数量获得第二来源或官方公布 | 移出存照,升级为互证事实(§2.4/坑 8) |
| 官方对训练数据发布日/2019 原始参赛队数补充口径 | 消除遗留疑点(§9) |
| MILK10k/ISIC 2024 基准被库内收录 | 更新 §7.1 版本链与 §9 下游互链 |
| 第三方镜像 license 标注变化 | 复核坑 9 表 |
| 读者反馈训练集构成与官方 GT CSV 不符 | 以 GT CSV 为准修订 §2.1/§2.2 并存照 |
附录 O:与库内条目的数字分工对照(防重复引用错位)
| 数字 | 本条目口径 | 归属条目口径 | 不得混用处 |
|---|---|---|---|
| HAM10000 10,015 张 | 仅作为"2019 训练集来源占比"出现 | ham10000(rid 60) 条目详述其采集/标注/病例结构 | 本条目不写 HAM 的 7 类标签细节与病例结构 |
| BCN 12,413 张(MMU 口径) | 仅作为来源贡献数字 | bcn20000(rid 161) 条目详述"野外"设备谱系 | 本条目不展开 BCN 采集协议细节 |
| MSK 匿名源 | 仅署名句+倒推数字 | isic-archive(rid 56) 条目承载仓库层 | 本条目不写 MSK 系子数据集清单细节 |
| 25,331/8,238/协议/冠军 | 本条目本体 | 三条目均不承载 | — |
附录 P:ISIC 挑战赛 2016-2024 全系大事记
| 年份 | 事件 | 与 2019 届的关系 |
|---|---|---|
| 2016 | 首届挑战(ISBI 2016,二分类 900 train/379 test) | 协议雏形:官方评测+workshop 公布 |
| 2017 | ISBI 2017 挑战(3 类,2,000 train) | 官方引用链中的 Codella 2017(arXiv:1710.05006)即此届 |
| 2018 | 挑战扩容(7 类,10,015 train=HAM10000 全集);官方论文 arXiv:1902.03368 | 2019 届的图像基底与官方指定引用来源 |
| 2019 | 第 4 届:三源聚合 25,331 train + UNK 协议 + balanced accuracy 定标 | 本条目 |
| 2020 | 第 5 届:33,126 train(DICOM/patient-centric,Rotemberg et al.) | 吸收 UNK 教训,升级患者级切分 |
| 2021-2023 | 数据包长期开放;MMU 系统分析(2021)、自切分文献海量涌现 | 本条目引用链的文献主体 |
| 2024 | 官方重开 2019 live leaderboard;ISIC 2024 挑战(SLICE3D) | live 榜 64 队在案,冠军团队仍居首 |
| 2025-2026 | 官方主推 MILK10k 基准 | 官方页现行动态;2019 数据包继续全量开放 |
附录 Q:泄漏自查清单(用 ISIC 2019 做训练必查)
| # | 检查项 | 工具/方法 |
|---|---|---|
| 1 | 训练与验证集有无同 lesion_id 样本 | group split(§8.5)+ 断言校验 |
| 2 | 训练与验证有无内容近重复(重压缩/裁剪变体) | phash 汉明距离 ≤4 人工复核(§5.4) |
| 3 | 是否误把 2019 训练集图当作 2018/2020 包的独立样本 | 按 ISIC 图号取交集(§5.4 工序一) |
| 4 | 无 lesion_id 的 2,084 张是否自成一组 | fillna(image) 处理后复查组数 |
| 5 | 外部数据是否与测试集同源(SD-198 与 UNK 测试图的潜在重叠官方未排查) | 声明外部数据清单;避免用官方测试图号 |
| 6 | 验证指标是否 balanced 口径 | balanced_accuracy_score(macro recall) |
| 7 | 是否用测试集调过参(官方协议禁止) | 测试评估一次性;调参只在自留验证集 |
附录 R:官方 live leaderboard(2019 榜)前十名快照(2026-09-28)
| 名次 | 队伍 | 机构 | 方法 | 是否公开描述 | balanced accuracy |
|---|---|---|---|---|---|
| 1 | DAISYLab | TU Hamburg / UKE | Ensemble of Multi-Res EfficientNets + SEN154 | 是 | 0.636 |
| 2 | DysionAI | DYSION AI, Inc(北京鼎视智慧) | EfficientNetB3-B4-Seresnext101 集成 | 否 | 0.607 |
| 3 | AImageLab & PRHLT | Unimore & UPV | ensemble, OOD threshold | 否 | 0.593 |
| 4 | DermaCode | — | 13 models + hierarchical outlier selection | 否 | 0.578 |
| 5 | Nurithm Labs | Nurithm Labs | DenseNet-161 + random crops | 是 | 0.569 |
| 6 | Torus Actions | — | 简单测试策略 | 否 | 0.563 |
| 7 | BITDeeper | 北京理工大学 | MelaNet 深度密集注意力网络 | 否 | 0.558 |
| 8 | SYSU-MIA-Group | 中山大学 | 类中心开放集分类 | 否 | 0.557 |
| 9 | MelanoNorm_IITRopar | 印度理工学院鲁尔基 | Stacking + 长尾分布 | 否 | 0.546 |
| 10 | MH_team | — | Softmax/Sigmoid 集成 | 否 | 0.544 |
读表三注:①该榜为 2024 年重开的持续提交榜(64 队累计),非 2019 年原始快照;②第 1 名与 2019 冠军同机构同数值(0.636=63.6%),互为印证;③"是否公开描述"一列说明官方对方法透明的引导——前排 10 队中仅 3 队公开描述。
附录 S:数字索引(按主题分组的硬数字速查)
规模类:训练 25,331(9.1GB)|测试 8,238(3.6GB)|合计 33,569|分辨率 450×600 至 1024×1024|唯一 lesion ID 11,848|lesion_id 有值 23,247/缺失 2,084|UNK 2,047(单源)
类别类:MEL 4,522(17.8%)|NV 12,875(50.8%)|BCC 3,323(13.1%)|AK 867(3.4%)|BKL 2,624(10.4%)|DF 239(0.9%)|VASC 253(1.0%)|SCC 628(2.5%)|最大最小类比 ≈54:1|恶性三类合计 8,473(33.4%)
来源类:HAM10000 10,015|BCN20000 12,413(MMU 口径)|MSK ≈2,903(倒推)|重叠率 88.5%(22,428/25,331)
赛程类:测试图计划 2019-08-02|测试 metadata 2019-08-16|Task 1 截止 2019-08-16|Task 2 截止 2019-08-23|奖金节点 2019-10 深圳 MICCAI 后
成绩类:冠军 T1 63.6% / T2 63.4%|冠军 CV 集成 74.2%|live 榜 DAISYLab 0.636 / DysionAI 0.607 / AImageLab & PRHLT 0.593|验证分随机基线 ≈0.3|validation 子集 ≈100 张
协议类:奖金 $4,000/$2,000/$1,000 × 2 赛道|赞助 3 家(Canfield/IBM/MetaOptima)|组委会 9 人(2 Clinical Chairs + 1 CV Chair + 7 Co-Chairs,含身份重合口径见 §3.4)|评分代码 1 套(isic-challenge-scoring 开源)
附录 T:本条目生产档案
| 项 | 值 |
|---|---|
| 写手代理 | agent-d-isic2019 |
| 开工时间 | 2026-09-28T13:04(锁文件 writing/isic-2019/.lock) |
| 任务书 | rsi_dispatch/task_isic-2019.md(2026-09-26 v3 纪律包) |
| 开工三查 | 锁:不存在→自建;ps aux grep -c “[c]odebuddy” = 4;临时文件 /tmp/isic-2019_agent-d-isic2019_part1-5.md |
| 核验结论 | ISIC 2019 真实存在(官方站+arXiv+IEEE SPS+四路文献);与库内 rid 56/60/161 数据层高重叠、事件层独立——按用户指示走"独立挑战赛条目+分工声明"路线成稿 |
| 研究来源 | 官方 challenge2019.isic-archive.com(curl 全文);arXiv:1910.03910;Sci Dir S1361841521003509(MMU);IET cv2.12048;Frontiers fmed.2026.1841617;MDPI app112210593;PMC8055397;ACM 3616131.3616144;challenge2020 站口径;中文报道(cinic.org.cn);openi 镜像 |
| 成稿方式 | 5 part 直写拼接(每个 part 尾部空行) |
| 双零自检 | check_md.py PASS(0 ERROR / 0 WARN)+ preflight_check.py PASS(2026-09-28) |
附录 U:数据层 vs 事件层速判(一图防撞库)
| 特征 | 数据集条目(如 ham10000/bcn20000) | 挑战赛条目(本条目) |
|---|---|---|
| 核心内容 | 采集协议、标注流水线、病例结构 | 任务设计、评估协议、竞赛结果 |
| 数字主体 | 张数/患者数/设备谱系/类目细节 | 规模、时间线、指标、奖金、名次 |
| 时间属性 | 静态(数据定稿后不随时间变) | 动态(榜单/文献计量随时间漂移) |
| 重复风险 | 与同数据别名条目撞 | 与数据条目"看似撞"实为分工 |
| 撞库判据 | 数据本体同源即重复 | 数据重叠不触发,事件层独有即可成稿 |
| 维护触发 | 来源论文勘误/版本更新 | 榜单名次变动/新届发布/口径澄清 |
检索者判别口诀:问"图从哪来"走数据条目,问"比赛怎么打"走本条目;两问都有的工作流,按 §9.1.1 的路线图串行取材。
尾注
本条目由千方病案医数集写手代理 agent-d-isic2019 于 2026-09-28 编写。数据抓取时点 2026-09-28(官方页面、arXiv、leaderboard 快照);三源互证完成度:核心数字(25,331/8,238/类别分布/冠军成绩/时间线)四源以上互证;单源数字(UNK 2,047、lesion_id 统计)已逐条存照。事实档案见同目录 FACTS.md。本条目为挑战赛事件条目,与库内 isic-archive(rid 56)、ham10000(rid 60)、bcn20000(rid 161)构成"仓库层-来源层-事件层"分工,互为检索入口。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 评测基准 / 皮肤癌
- skincon — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- med-node — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- isic-2018 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集 / 皮肤癌
- derm12345 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准 / 皮肤癌
- isic-archive — 共享标签:医学影像 / 皮肤影像 / 挑战赛数据集 / 皮肤癌
- ph2 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 皮肤癌
- ddi — 共享标签:医学影像 / 皮肤影像 / 评测基准 / 皮肤癌
- dermacon-in — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 评测基准
- bcn20000 — 共享标签:医学影像 / 皮肤影像 / 皮肤癌
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

