信息速览
INFOBOX — SkinCAP 一屏速览
维度 内容 本质 皮肤病临床图像的医学描述(captioning)多模态数据集;论文自称"世界首个此类数据集" 论文 arXiv:2405.18004v1(2024-05-28,cs.CV);v2(2025-11-09)改名 SkinCaRe 团队 KAUST(通讯 Xin Gao)+ DermAssure/NY Medical College + 北京安贞医院等四家中国皮肤科 数据 4,000 张皮肤临床图像,覆盖 178 种皮肤病、Fitzpatrick I–VI 全肤型 来源 Fitzpatrick 17k(16,577)+ DDI(656)+ SKINCON(48 临床概念)三源 标注 皮肤科医生多中心、中文母语撰写医学描述;每张至少两位专家复核 结构 中文原稿 caption_zh + 英译 caption_zh_polish_en + 病种 + 肤型 + 48 临床概念 后继 SkinCaRe = SkinCAP(4,000 描述)+ SkinCoT(3,041 链式推理)= 7,041 例 获取 HF joshuachou/SkinCAP(gated 研究用协议);原图须另申 Fitzpatrick17k/DDI许可 数据集 CC-BY-NC-SA-4.0;后继 SkinCaRe 标注 CC-BY-4.0;论文 CC BY-NC-ND 4.0 库内互链 ISIC 系列(isic-2018/2019/2020)、PAD-UFES-20、vqa-rad;Fitzpatrick17k/DDI/SKINCON 无独立条目
SkinCAP 是一个"给皮肤病图像配上医生笔头话"的数据集:它不重新采集图像,而是从 Fitzpatrick 17k 与 DDI 两个公开皮肤图像库中取出 4,000 张临床照片,请四位(图注写五位)资深皮肤科医生逐张写下中文医学描述——病变长在什么部位、什么分布、什么颜色、什么形态——再翻成英文。这是一件此前无人做过的事:皮肤影像数据集数以百计,但绝大多数只给一个分类标签(这张是黑色素瘤、那张是湿疹),没有任何一个提供自然语言层面的临床描述。SkinCAP 补的正是这一块。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意标注可下但原图要另申,门禁是 KAUST 研究用协议,别当成无门槛直链。
- 关心多模态/LLM 训练:直奔 §4 数据构成与 §5 任务,重点看
caption_zh_polish_en字段与 48 临床概念。 - 想知道它后来怎样了:直奔 §7——同一个 arXiv ID 在 2025-11 被改写为 SkinCaRe(SkinCAP + SkinCoT),规模扩到 7,041 例、标注许可变宽松到 CC-BY-4.0。
§0 导读:这个数据集解决什么问题
皮肤病学是"看图说话"的医学分支,而 AI 皮肤病诊断长期是"看图报数":输入一张皮肤照片,输出一个类别概率。分类器可以说"这张图 92% 是基底细胞癌",却无法告诉医生它看到了什么、依据什么。这层可解释性的缺失,在深度学习时代是隐患,到了视觉大语言模型(VLLM)时代则成了瓶颈——因为 LLM 恰恰是靠自然语言来"理解"和"解释"的。
问题出在数据上。论文的对比表(Table I)把二十余个公开皮肤数据集排开,可以看出一个残酷的共同点:ISIC2019(33,569 张)、Dermnet(23,000 张)、Fitzpatrick 17k(16,577 张)。它们几乎全部只有分类标签(Class label ✓),少数带"有限的医学特征"(limited),没有任何一个带 caption(自然语言描述)。唯一密集标注的 SKINCON(4,346 张)标的是 48 个临床概念的属性级标签(Vesicle、Papule、Erythema……),仍是属性堆叠,而不是皮肤科医生写出的诊断性自然语句。
SkinCAP 的回应是:把图像-文本对齐(image-text alignment)这一多模态监督信号,第一次系统性引入皮肤病学。它从 Fitzpatrick 17k 和 DDI 取 4,000 张图像,请多中心皮肤科医生逐张撰写中文医学描述,再翻成英文,形成"图像 ↔ 临床语言"配对。用途直接指向多模态 LLM:论文明确说可用 caption_zh_polish_en 字段训练 BLIP-2、SkinGPT-4 这类模型,让它们不仅能分类,还能"用医生的语言描述这张图"。
这一设计对 AI-Ready 的意义在于:它把皮肤病数据集的价值重心从"标签数量"转向"语言监督"。在一个皮肤影像数据集动辄数万张的时代,4,000 张并不算大;但 4,000 条专家撰写的自然语言描述在皮肤领域是稀缺资源——稀缺到论文敢称"世界首个"。
0.1 为什么"分类标签"不够用
要理解 SkinCAP 的价值,先要理解"标签"这种监督信号的天花板。一个分类标签只承载一个信息位——“这张图属于第 k 类”。它把医生在诊室里做的全部认知工作压缩成了一个离散符号。医生看到一张斑块时实际在做的事,是分解为一系列可观察到、可复述的要素:病变位于哪里、边界是否清楚、颜色是否均一、表面有无鳞屑、是否隆起。这套要素才是"诊断的解释",也是会诊时交接、病历里记录、教学时讲解的内容。分类标签把这一层全部丢掉。
丢掉这一层的代价在临床应用上是具体的:
- 会诊与交接不可用。皮肤科是高度依赖图像交接的专科,一位医生把照片转给另一位医生时,需要的是"左前臂屈侧一枚边界欠清的淡红色斑块,表面覆细薄鳞屑",而不是"湿疹,概率 0.87"。
- 教学不可用。皮肤科住院医培养的核心是"看图识特征",标签无法用于解释为什么。
- 可解释性 AI 不可用。一个只输出类别的模型,在出错时无法让临床医生复盘错在哪一步。
- 多模态 LLM 无法对齐。VLLM 的能力体现在语言接口上,若训练数据只有离散类别,模型无法学会"用医生的语言描述图像"。
SkinCAP 的定位正是补上这一层:把皮肤图像的监督信号从"离散类别"扩展为"自然语言描述",从而打开会诊辅助、报告草稿生成、可解释性诊断、多模态对齐四条应用线。
0.2 为什么这件事此前没人做
既然描述监督这么有用,为什么皮肤领域此前没有这样的数据集?答案不在"想不到",而在获取成本的结构性差异。
| 监督类型 | 获取方式 | 单位成本 | 可自动化程度 |
|---|---|---|---|
| 分类标签 | 从已有数据库导出/众包 | 极低 | 可高 |
| 属性标签(如 SKINCON 48 概念) | 医生或众包按清单勾选 | 低-中 | 部分 |
| 自然语言医学描述 | 皮肤科医生逐张撰写 | 高 | 几乎不可 |
分类标签可以来自病历编码、病理报告、公开榜单;属性标签可以让医生或训练有素的标注员按勾选框快速完成。但自然语言医学描述不能勾选——它要求撰写者既具备皮肤科专业判断,又能把这套判断组织成规范的语言。这两项能力的交集,在标注劳动力市场上是稀缺且昂贵的。这就解释了为什么"皮肤 captioning"这个想法虽直接,却直到 2024 年才由 SkinCAP 首次系统化落地。
0.3 SkinCAP 在数据价值链上的位置
把皮肤数据集按"监督信号丰富度"排一条轴,可以得到一条清晰的价值链:
分类标签 → 属性/概念标签 → 自然语言描述 → 描述+推理链
(ISIC) (SKINCON) (SkinCAP) (SkinCoT)
低 ──────────────────────────────────────── 高
监督信号的信息密度与获取成本
SkinCAP 卡在第三级,而它的后继 SkinCaRe 通过并入 SkinCoT 触及第四级。这条价值链对使用者的直接含义是:越靠右,数据越贵、越少、替代品越少;越靠右,越适合语言侧任务;越靠左,越适合分类侧任务。 选数据集时先确定你的任务落在轴的哪一端,再回到本条目对照选用。
0.4 本篇条目的组织方式
为方便不同读者,本条目按"由浅入深、事实与判断分离"组织:
- §0–§1:导读与速览,五分钟建立全局认知;
- §2:数据构成与规格,含字段表与分布;
- §3:标注方法与质量,说明谁标、怎么标、怎么验;
- §4:许可与版本链,逐层拆解合规;
- §5:评估与基准,含 DAIMS 对照;
- §6:生态与互链点,给出库内可串联条目;
- §7:使用指南,给实操路径与误用清单;
- §8:双口径冲突存照,逐条并列冲突数字;
- §9:检索陷阱十坑;
- §10:结论与研究建议。
其中 §8 与 §9 是本条目的质检重点——SkinCAP 在公开材料中的数字冲突与命名演替,正是 AI-Ready 目录最容易出错的地方,故单列两节并逐条存照。
§0 读法三则:
- 这个条目是"数据集+版本演替"的复合体:v1 的 SkinCAP(4,000 captioning)与 v2 的 SkinCaRe(+3,041 推理)同出一个 arXiv ID,读的时候务必分清你引的是哪一版(§7)。
- 全文数字均出自论文与 HF 元数据;正文-图注、首句-求和的两处冲突(医生人数、DDI 规模)已在坑 2、坑 3 存照。
- 若把"SkinCAP"当成一个纯皮肤分类数据集去下,会踩到门禁——它给的是标注+门禁,原图要回 Fitzpatrick17k/DDI 另申(§6)。
0.5 三个最常见的误解(先破再立)
误解一:“又一个皮肤数据集,无非多一点图。” 错。SkinCAP 的图像数(4,000)在皮肤数据集里属偏小,它的增量在描述层。把它与 ISIC 按图像数比较,等于拿词典的页数衡量它的价值——用错了尺子。
误解二:“描述就是给图片打个标签的冗长版。” 错。分类标签是离散符号,描述是自由文本。前者承载一个信息位,后者承载要素、关系与判断。二者在监督信号上不是量差而是质差(§0.1)。
误解三:“数据集名变了就是撤稿/换了东西。” 错。SkinCAP→SkinCaRe 是同 ID 的扩并改名,属正常演化(§4.1)。判断依据是 arXiv ID 与作者团队,不是名称。
先破这三误,后面的细节才有落脚处。
0.6 本条目对哪些读者最有价值
| 读者角色 | 主要关切 | 建议重点读 |
|---|---|---|
| 多模态模型研究者 | 能否用于训练描述生成 | §2.3 字段表、§5 评估、§7 |
| 数据合规/法务 | 能不能用、怎么用 | §4 许可版本链、§8 冲突存照 |
| 皮肤科临床研究者 | 数据是否贴合临床 | §0.1、§2.7、§3 |
| 目录/元数据编辑 | 别名与互链怎么处理 | §4.1、§6、§9 坑点 |
| 复现工程师 | 怎么把数据拼起来 | §2.10、§7.4 检查清单 |
0.7 一句话记住 SkinCAP
如果只能记一句话:SkinCAP 是"给皮肤照片配上医生写的句子"的第一个公共数据集,4,000 条中文母语描述是它的核心资产,它的后继叫 SkinCaRe,许可分版本分层——旧严新宽,图像另申。
0.8 与同类"首个"数据集的比较视角
SkinCAP 自称"世界首个"临床级皮肤 captioning 数据集。判断这类"首个"声明,通常看三条:(a) 是否有自然语言描述;(b) 是否临床照;© 是否公开可得。
- 若只要求"有文本",某些图文皮肤资料(如带说明的教科书图)也算,但它们不成规模、无统一标注、不可训练;
- 若只要求"公开可得",多数皮肤分类数据集满足,但没有描述;
- 若只要求"临床照",Fitzpatrick 17k、PAD-UFES-20 等满足,但同样没有描述。
SkinCAP 的"首个"成立,是因为它同时满足"有描述 + 临床照 + 公开可得 + 成规模"四条。这也解释了 §0.2 的成本困境——四条同时满足的门槛极高,所以此前无人做到。
0.9 阅读本条目后的自测题
读完 §0–§1,你应该能回答:
- SkinCAP 与 ISIC 最根本的区别是什么?(模态 + 监督类型)
- SkinCAP 与 SkinCaRe 是什么关系?(同 arXiv ID 的版本传续,后者是超集)
- 为什么 4,000 张不算大,却是稀缺资源?(描述获取成本高)
- 拿到标注后能否直接训练?(不能,原图需另申)
- 许可为什么不能说"一条 CC-BY-4.0"?(分版本、分层、原始图像另算)
能答全这五题,即可继续读 §2 之后的细节。
§1 数据集速览:十问十答
Q1:SkinCAP 的"4,000 张"从哪来?
从两个公开皮肤图像数据集取:Fitzpatrick 17k(皮肤病+肤型标注的 16,577 张临床图)与 Diverse Dermatology Images(DDI,656 张、按 Fitzpatrick 肤型分层)。另有一条旁支:部分临床概念标签继承自 SKINCON(它本身就是用 Fitzpatrick 17k 和 DDI 的图像建的,4,346 张、48 个概念)。
展开:Fitzpatrick 17k 由 DermaAmin(12,672 张)与 Atlas Dermatologico(3,905 张)合并,两者相加约 16,577 张,是少数带 Fitzpatrick 肤型标注的大规模临床图库;DDI 则刻意在深肤色上做平衡,656 张分三类病变。SkinCAP 从这两源中抽取 4,000 张作为描述标的。为什么不是全量?因为逐张撰写描述的成本随规模线性增长,4,000 是在"专家可得工时"与"覆盖面"之间取的平衡点。
Q2:每张图配了什么?
中文原始医学描述(caption_zh)、润色后的中文(caption_zh_polish)、英译(caption_zh_polish_en),外加病种标签、来源、肤型/恶性标记(视源而定)与 48 个 SKINCON 临床概念的多热标签。核心增量是那条自然语言描述。
展开:三个 caption 字段对应一条描述的三个生命周期阶段——
caption_zh是医生手写原稿,caption_zh_polish是语言润色版,caption_zh_polish_en是英译版。对中文 NLP 研究者,前两者是一手素材;对以英文为主的多模态训练,第三方常用第三者。三者不可混用统计,尤其不可用英译版做中文语言质量分析。
Q3:谁写的描述?
四位 board-certified 皮肤科医生(经验分别为 24、18、21、18 年),来自北京安贞医院、天津中医药研究院附属医院、北京航天总医院、吉林大学第二医院四家中心,每家出一位参与标注与验证。注意图 1a 图注写"five",与正文的"four"冲突(坑 2)。
展开:这四家的地理散布(北京两所、天津一所、长春一所)说明标注并非单一医院的偏好,而此前沿机构与地方中心的协作也带来表达风格的多样性。多人多中心的代价是一致性风险,故论文在流程中安排了每张描述至少两人复核的机制(详见 §3)。
Q4:原始语言是什么?
全部中文。皮肤科医生先用中文写下医学描述(论文原话 “All raw annotations were provided in Chinese”),这是本数据集中文母语属性的来源,也是它区别于欧美皮肤数据集的一个特点。
展开:语言选择不是细枝末节。若描述原稿是英文,本数据集对中文医学 NLP 的价值仅限于"拿来做翻译语料";正因为原稿是中文母语,它才成为中文医学图像描述的一手资源——可直接用于中文多模态模型、中文医学报告生成、中文医学 VQA。这一属性在库内皮肤条目中相当罕见。
Q5:英译怎么来的?
经自研软件(v1 论文写 LangChain + GPT-4;HF 卡片标注 v240623 版用 GPT-4、v240715 版改用 Google Translate)润色并翻译,随后由医生人工二次检查。译法工具有一次更换(坑 4)。
展开:翻译工具更换这件事在数据使用上的现实后果是——同一段中文原稿,在不同版本的数据集中对应不同的英文。若你的实验里英文描述来自 v240623,而对照组来自 v240715,两者之间的差异可能有一部分只是翻译器换代的噪声。做对比实验前务必统一版本,或干脆统一使用中文原稿。
Q6:覆盖多少种病、多少肤型?
178 种皮肤病,覆盖 Fitzpatrick 肤型 I 到 VI 全谱。分布是长尾的:常见病种样本多,大量病种不足 20 例(Table II 列的正是这批发),个别只有 1–2 例。
展开:Fitzpatrick I–VI 全谱覆盖是 SkinCAP 相对多数欧美皮肤数据集的核心竞争力之一。皮肤 AI 长期被批评在深肤色(IV–VI)上性能退化,而退化之所以难以被发现,往往是因为数据集本身深肤色样本太少。SkinCAP 提供了分层评估的可能——但覆盖不等于平衡,各肤型的具体样本量论文未给全表,使用前应自行统计(见 §5.4)。
Q7:能直接下原图吗?
不能一步到位。HF 仓库(joshuachou/SkinCAP)给的是标注,且为 gated(需接受 KAUST 研究用协议、共享联系信息);原始皮肤图像须另行分别申请 Fitzpatrick17k、DDI、SKINCON 的访问权。
展开:这个"标注可得、图像难得"的不对称(§8.5 存照)是复现 SkinCAP 的第一个硬门槛。实际流程建议并行推进:申请 HF 门禁的同时,即刻提交 Fitzpatrick17k 与 DDI 的访问申请,因为图像方审批通常更慢。三者到齐后才能组建完整训练/评测数据。
Q8:有 benchmark 分数吗?
没有量化分数。论文的技术验证是定性的——用 SkinGPT-4 微调后在痤疮案例上生成描述作为示例。这也是本数据集在"评测基准"维度偏弱的地方。
展开:没有公开榜单分数意味着两点:一是无法用"某模型在 SkinCAP 上达到 X"来做第一手比较;二是若你要用它做评估,需要自建评测协议(§5.4 给了三种可复用范式)。论文的定性示例只能说明"用 SkinCAP 训练后模型能生成像样的描述",不能量化提升幅度。
Q9:它后来变成什么了?
2025-11 的 arXiv v2 把论文改写为 SkinCaRe,把 SkinCAP(4,000 描述)与新增的 SkinCoT(3,041 条专家认证链式推理)统一为一个资源,共 7,041 例,标注许可改为 CC-BY-4.0(坑 5)。
展开:SkinCoT 的链式推理(chain-of-thought)是"描述+"的一步——不只是说图里有什么,而是给出诊断的推理步骤。它来自 DermNet 图像、由汕头大学医学院皮肤科医生标注。SkinCAP 与 SkinCoT 的合并意味着:同一篇论文同时提供"描述"与"推理"两级监督,对可解释性研究是更完整的资源(§4.1 版本链表)。
Q10:为什么它对 AI-Ready 重要?
因为它是"图像-文本对齐监督"在皮肤领域的首个公共样本,且带一个少见的"许可代际宽松化"轨迹:从 v1 的 CC-BY-NC-SA 到 v2 的 CC-BY-4.0。它同时暴露了若干个目录级坑点(人数、源规模、翻译工具、题名演替),是 AI-Ready 质检的活教材。
1.1 与"同类首个"宣称的审慎对照
论文的自我定位是"world’s first such dataset"(世界首个此类数据集)。这类"首个"宣称在任何领域都值得审慎对待,这里可以做一次分层检验:
| 宣称维度 | 是否成立 | 说明 |
|---|---|---|
| 首个"临床照 + 专家自然语言描述 + 公开"的数据集 | 有相当依据 | Table I 所列二十余个皮肤数据集均无 caption 列 |
| 首个带自然语言描述的皮肤数据集(不限模态) | 难以穷证 | 皮肤镜/病理领域可能存在未被 Table I 收录的小集 |
| 首个中英双语皮肤描述数据集 | 大概率成立 | 同期皮肤数据集以英文为原生语言 |
| 首个"图像-文本对齐"皮肤数据集的概念 | 是相对早期 | 同期 SkinGPT-4 依赖专有数据,未公开 |
结论:该宣称在"公开可及的皮肤 captioning 数据集"这一精确范围内基本成立,但不宜推广为"皮肤多模态数据的绝对首个"——2024 年前后皮肤 VLLM 方向已有多项工作(如 SkinGPT-4、DermGPT 系)。条目按"论文自称"记录,不做第三方背书。
1.2 一个数据集的两条时间线
理解本条目,需要同时握住两条时间线:
- 内容时间线(数据本身):2024-05 初次发布 4,000 例 → 2024-06/07 两次英译版本(GPT-4 → Google Translate)→ 内容此后未变。
- 论文时间线(叙事框架):2024-05 v1(SkinCAP 单篇)→ 2025-11 v2(SkinCaRe 统一资源)。
两条线并不重合:数据在 2024 年就定型,但它的"名分"在 2025 年被重新组织。这正是大量 AI 数据集条目的常见形态——数据资源稳定,但承载它的论文/命名会随研究推进而演变。对条目维护的启示是:立条应以"数据资源"为锚,而非以"论文题名"为锚,否则改名就会导致漏链或重复入库。
展开:所谓"许可代际宽松化",指同一研究在版本演替中把部分内容的许可从"非商业+相同方式共享"放宽到"仅需署名"。这在学术数据集里并不常见(多数是越改越严以防滥用),因此理解它的分层边界尤为重要:宽松只覆盖新增部分,旧部分与原始图像不受影响(§4.3 许可分层表)。
§2 数据构成与规格
2.1 规模、来源与三元结构
SkinCAP 的 4,000 张图像来自两个皮肤图像库,标签体系则继承自第三个库。理解它的"三元结构"是理解整个条目的钥匙:
| 角色 | 数据集 | 规模 | 提供什么 |
|---|---|---|---|
| 图像主源 | Fitzpatrick 17k | 16,577 张临床图 | 图像 + 病种标签 + Fitzpatrick 肤型 + 九分/三分区标签 |
| 图像补充源 | DDI(Diverse Dermatology Images) | 656 张 | 图像 + 病种 + 肤型分层(I–VI)+ 恶性标记 |
| 标签来源 | SKINCON | 4,346 张 | 48 个临床概念的稠密属性标注 |
Fitzpatrick 17k 本身来自两个在线皮肤科图库:DermaAmin(12,672 张)与 Atlas Dermatologico(3,905 张),16,577 = 12,672 + 3,905 自洽。DDI 的意义在于肤型分层设计——它按 Fitzpatrick I–II、III–IV、V–VI 三档分别收集良性与恶性样本,专门用来暴露皮肤 AI 在深色皮肤上的性能落差(其原论文标题即 “Disparities in dermatology AI performance on a diverse, curated clinical image set”)。SKINCON 则是由 Fitzpatrick 17k(3,690 张)+ DDI(656 张)构建、请皮肤科医生密集标注 48 个临床概念的数据集。
一处必须存照的源规模冲突:论文方法节在介绍 DDI 时,首句写 “The DDI dataset includes a total of 208 images”,紧接着却列出 208(I–II)+ 241(III–IV)+ 207(V–VI)三档,合计 656。DDI 官方口径为 656 张,SKINCON 引自 DDI 的部分也写 656——因此首句的"208"应为笔误(它恰好是 I–II 档的数字)。条目按 656 记,并在坑 3 存照。
2.2 图像与格式规格
| 属性 | 规格 |
|---|---|
| 图像类型 | 皮肤临床照片(clinical images,非皮肤镜 dermoscopic) |
| 图像格式 | PNG(Portable Network Graphics) |
| 元数据格式 | CSV(skincap_v240623.csv,4.29 MB)+ XLSX(skincap_v240715.xlsx,1.40 MB) |
| 图像加载库 | HuggingFace datasets(imagefolder 格式) |
| 任务类型 | image-to-text(图像到文本) |
| 语言 | 中文 + 英文(双语描述) |
| 规模档 | 1K < n < 10K(HF size_categories) |
“MIME 类型是 PNG、任务标签是 image-to-text、格式是 imagefolder”——这三条来自 HF 数据集卡的自动元数据,是核对版本一致性的硬锚点。
2.3 元数据字段全表(v1 Table III)
| 字段 | 含义 |
|---|---|
id |
SkinCAP 内部唯一标识 |
skincap_file_path |
SkinCAP 样本文件名 |
ori_file_path |
对应 Fitzpatrick/DDI 的原始文件名(溯源锚) |
disease |
病种标签 |
caption_zh |
皮肤科医生中文原始描述 |
caption_zh_polish |
润色后的中文描述 |
caption_zh_polish_en |
英译描述(训练/评测推荐字段) |
remark |
医生附加备注 |
source |
样本来源 |
skin_tone |
肤色调(仅 DDI 子集) |
malignant |
是否恶性(仅 DDI 子集) |
fitzpatrick_scale |
Fitzpatrick 肤型值(仅 Fitzpatrick 子集) |
fitzpatrick_centaur |
Fitzpatrick centaur 值(仅 Fitzpatrick 子集) |
nine_partition_label |
九分区法标签(仅 Fitzpatrick 子集) |
three_partition_label |
三分区法标签(仅 Fitzpatrick 子集) |
url |
样本图像 URL |
| 其余 48 列 | SKINCON 的 48 个临床概念多热标签 |
一个字段级细节:skin_tone/malignant 只对 DDI 样本有值,fitzpatrick_scale 等只对 Fitzpatrick 样本有值——这意味着跨源合并时需要处理大量空值,肤型分析的可用范围受来源决定。
再补三条字段级注意事项:
ori_file_path是溯源锚。 它指向该样本在 Fitzpatrick 17k / DDI 中的原始文件名。任何"这张图到底出自哪个库"的溯源问题,都以该字段为准,而不是靠图像内容猜测——这在处理图像许可(不同源条款不同)时是硬依据。remark是医生自由备注。 它不在三档 caption 之内,但可能包含"该图有遮挡/光照差"之类的可用性提示。使用前建议扫一遍 remark 的非空分布,可能发现一批需剔除的低质量样本。- 48 个概念列是布尔多热标签。 它们与 SKINCON 的标注严格对应,可用于概念检测任务;但也继承了 SKINCON 的标注粒度局限(见 §2.4)。
字段与任务的映射建议:
| 你的任务 | 应使用的字段 |
|---|---|
| 中文图像描述生成 | caption_zh 或 caption_zh_polish |
| 英文图像描述生成 | caption_zh_polish_en |
| 病种分类 | disease + nine_partition_label/three_partition_label |
| 概念检测 | 48 个 SKINCON 概念列 |
| 肤型公平性分析 | fitzpatrick_scale(注意仅 Fitzpatrick 子集) |
| 恶性判别 | malignant(仅 DDI 子集) |
| 溯源与合规 | ori_file_path + source |
2.4 SKINCON 的 48 个临床概念
48 个概念覆盖皮肤形态学的核心词汇,可分为几组:
- 原发皮损:Vesicle(水疱)、Bulla(大疱)、Papule(丘疹)、Macule(斑疹)、Plaque(斑块)、Nodule(结节)、Pustule(脓疱)、Wheal(风团)、Cyst(囊肿)、Comedo(粉刺)
- 继发改变:Ulcer(溃疡)、Crust(结痂)、Erosion(糜烂)、Excoriation(抓痕)、Atrophy(萎缩)、Exudate(渗出)、Fissure(皲裂)、Scale(鳞屑)、Scar(瘢痕)、Lichenification(苔藓样变)、Sclerosis(硬化)
- 颜色/血管:Erythema(红斑)、Purpura/Petechiae(紫癜/瘀点)、Telangiectasia(毛细血管扩张)、Brown(色素沉着)、White(色素减退)、Purple、Yellow、Black、Blue、Gray、Pigmented、Salmon、Translucent
- 形态/质地:Induration(硬结)、Xerosis(干燥)、Friable(脆性)、Pedunculated(有蒂)、Exophytic/Fungating(外生/蕈样)、Warty/Papillomatous(疣状/乳头状)、Dome-shaped(圆顶)、Flat-topped(平顶)、Umbilicated(脐凹)、Poikiloderma(皮肤异色)、Acuminate(尖形)、Burrow(隧道)
论文强调 SKINCON 是属性级标注(attribute level),与皮肤科医生写出的自然语言诊断报告"差异显著"——这正是 SkinCAP 要补的那一层。
2.5 病种分布:一条极长的长尾
SkinCAP 覆盖 178 种皮肤病。分布呈现典型长尾:图 1b 展示了样本 ≥20 的病种分布,Table II 则列出样本 <20 的那一批。Table II 的一个直观切片:
| 病种 | 样本数 | 病种 | 样本数 |
|---|---|---|---|
| Acrochordon(软纤维瘤) | 19 | Blue nevus(蓝痣) | 6 |
| Dyshidrotic eczema(汗疱疹) | 19 | Molluscum contagiosum(传染性软疣) | 6 |
| Erythema nodosum(结节性红斑) | 19 | Melanoma in situ(原位黑素瘤) | 5 |
| Keratosis pilaris(毛周角化) | 18 | Eczema spongiotic dermatitis | 4 |
| Superficial spreading melanoma | 18 | Hyperpigmentation(色素沉着过度) | 3 |
| Hidradenitis(化脓性汗腺炎) | 18 | Trichilemmoma(毛鞘瘤) | 3 |
| Congenital nevus(先天性痣) | 17 | Basal cell carcinoma superficial | 2 |
| Dysplastic nevus(发育不良痣) | 16 | Onychomycosis(甲真菌病) | 2 |
| Solid cystic basal cell carcinoma | 15 | Scar(瘢痕) | 2 |
| Neurofibroma(神经纤维瘤) | 12 | Nodular melanoma (nm) | 1 |
| Eccrine poroma(小汗腺汗孔瘤) | 10 | Sebaceous carcinoma(皮脂腺癌) | 1 |
| Squamous cell carcinoma keratoacanthoma | 8 | Leukemia cutis(皮肤白血病) | 1 |
这张表的用途是选型预警:如果研究目标病种落在 1–6 例区间,基本无法独立训练或评测,只能并入大类或作案例。Table II 只列 <20 的病种,≥20 的计数在正文图(图 1b)中而未给数字表——这是本数据集"图有数无表"的一处信息断层。
2.6 与 ISIC 系列的关系边界:分类 vs 描述
库内已有 isic-2018(ISIC2018,12,500 张)、isic-2019(33,569 张)、isic-2020(33,126 张)三条 ISIC 系列条目。它们与 SkinCAP 的关系需要一句话讲清:ISIC 是皮肤镜(dermoscopic)图像的分类数据集,SkinCAP 是临床(clinical)图像的描述数据集。
| 维度 | ISIC 系列 | SkinCAP |
|---|---|---|
| 图像模态 | 皮肤镜(放大、偏振) | 临床照(肉眼视角) |
| 监督信号 | 病种分类标签 | 自然语言医学描述 |
| 任务 | classification | image-to-text / captioning |
| 与皮肤科工作流 | 辅助诊断 | 辅助报告生成与解释 |
| 与 LLM 的关系 | 弱(只能用标签) | 强(图像-文本对齐监督) |
两者不是替代而是互补:ISIC 提供海量分类监督,SkinCAP 提供稀缺的语言监督。对设计"先分类后解释"的两阶段皮肤 AI 管线者,二者可以叠用。
2.7 三个上游源数据集逐个交代
SkinCAP 的引用规范要求同时尊重三个上游源,这里逐个说明它们的性质与获取方式:
Fitzpatrick 17k(本文图像主源)
- 规模:16,577 张临床皮肤图像。
- 构成:DermaAmin(12,672)+ Atlas Dermatologico(3,905)。
- 标签:皮肤病标签 + Fitzpatrick 肤型(I–VI)+ 九分区/三分区肤色标签。
- 出处:Groh et al., CVPR 2021,“Evaluating deep neural networks trained on clinical images in dermatology with the Fitzpatrick 17k dataset”。
- 获取:github.com/mattgroh/fitzpatrick17k。
- 在 SkinCAP 中的角色:提供大部分图像与病种标签、肤型标签。
DDI(Diverse Dermatology Images,本文图像补充源)
- 规模:656 张,按 Fitzpatrick I–II(208)、III–IV(241)、V–VI(207)三档分层。
- 每档含良性/恶性样本(如 I–II 档 159 良性 + 49 恶性)。
- 出处:Daneshjou et al., Science Advances 2022,“Disparities in dermatology AI performance on a diverse, curated clinical image set”。
- 获取:ddi-dataset.github.io。
- 在 SkinCAP 中的角色:提供肤型分层抽样与
skin_tone/malignant字段。
SKINCON(本文标签来源)
- 规模:4,346 张(Fitzpatrick 17k 3,690 + DDI 656)。
- 标签:48 个临床概念稠密标注;22 个概念各 ≥50 张。
- 出处:Daneshjou et al., NeurIPS 2022,“SkinCon: A skin disease dataset densely annotated by domain experts for fine-grained debugging and analysis”。
- 获取:skincon-dataset.github.io。
- 在 SkinCAP 中的角色:提供 48 个临床概念列(元数据"剩余 48 列")。
注意一个同源性:SKINCON 与 SkinCAP 用的是同一批上游图像(Fitzpatrick 17k + DDI)。这意味着三者之间存在图像重叠——若同时使用两个数据集训练,需检查是否有共享图像造成的泄漏。这是把三个源并列研究时的隐蔽风险。
2.8 DDI 的肤型分层设计细读
DDI 的分层设计是它被选为 SkinCAP 补充源的关键理由。它的三档构造如下:
| Fitzpatrick 档 | 图像数 | 良性 | 恶性 | 恶性占比 |
|---|---|---|---|---|
| I–II(浅肤) | 208 | 159 | 49 | 23.6% |
| III–IV(中肤) | 241 | 167 | 74 | 30.7% |
| V–VI(深肤) | 207 | 159 | 48 | 23.2% |
| 合计 | 656 | 485 | 171 | 26.1% |
这张表的临床意义在于:它刻意把深色皮肤(V–VI)单独成档,正是为了对抗"皮肤 AI 在深色皮肤上性能差"这一公认问题。SkinCAP 继承 DDI 的这一设计意图,因此它的肤型覆盖不是随机采样的副产品,而是有意的构造。
但要注意口径边界:上表是 DDI 数据集本身的分层,不等于 SkinCAP 的 4,000 张里各肤型的分布——SkinCAP 从 Fitzpatrick 17k 取的图像多数带肤型标签,从 DDI 取的 656 张全部带分层标签,但4,000 张的最终肤型分布论文未给数字(坑 6)。
2.9 从 4,000 到 178 病种:分布的形状
178 个病种分 4,000 张,平均每病种约 22 张——这个"平均值"极具误导性,因为分布极不均匀。从 Table II 与图 1b 可推断分布形状:
- 头部:常见皮肤病(如痤疮类、湿疹类、色素痣类、脂溢性角化等)样本较多,构成 ≥20 的群体(图 1b)。
- 中部:大量病种落在 5–20 例区间(Table II 的主体)。
- 长尾:一批罕见病种仅 1–3 例(如表中的 Subcutaneous T cell lymphoma 1、Leukemia cutis 1、Sebaceous carcinoma 1)。
对训练的实际含义分三层:头部可支撑分类/描述训练;中部可用于 few-shot 或作为负样本;长尾基本只能作定性案例或合并入大类。若不做频次统计就直接随机切分,测试集会出现空类别——这是新手最常见的翻车点。
2.7 图像模态再辨析:临床照的三重后果
"临床照而非皮肤镜"这一条规格,值得单独展开,因为它同时决定数据集的优势、局限与适配任务。
第一重:视角差异导致的任务差异。 皮肤镜图像是经放大镜或数字皮肤镜在贴近皮肤、控制光照的条件下采集的,画面中的病变被放大、去毛、边缘锐化,视觉特征高度结构化——这正是自动分类擅长的。临床照则是肉眼视角的普通照片,光照、距离、角度、背景都不可控,病变在画面中占比小、干扰大。因此临床照上的分类难度系统性地高于皮肤镜,直接沿用皮肤镜模型往往掉点。
第二重:与远程皮肤科(teledermatology)的天然契合。 远程皮肤科的实际工作流是患者或基层医生用手机拍摄临床照上传,皮肤科医生远程阅读并给出意见——这恰恰是临床照的应用场景。SkinCAP 的描述监督正对应这个工作流中的"写出会诊意见"环节,因此它对 teledermatology 辅助工具的价值,高于对皮肤镜诊断工具的贡献。
第三重:与皮肤镜数据集的不可互换性。 由于模态不同,SkinCAP 不能替代 ISIC 系列用于皮肤镜诊断任务,ISIC 也不能替代 SkinCAP 提供语言监督。二者在"图像模态"这一维上正交,只有在多模态融合的场景(如同时输入临床照与皮肤镜图)才可能叠用。
把这三重后果讲清,使用者就能自行判断:若目标是皮肤镜自动诊断,SkinCAP 不是正确选择;若目标是临床照的描述生成、会诊辅助或中文皮肤 NLP,SkinCAP 才是对口资源。
2.8 与皮肤镜/临床照数据集的组织对照
下表把库内及邻近的皮肤数据集按模态与监督类型定位,便于横向选型(库内条目以条目名标注):
| 数据集 | 模态 | 规模 | 监督类型 | 库内条目 |
|---|---|---|---|---|
| SkinCAP | 临床照 | 4,000 | 自然语言描述 | 本条目 |
| SkinCaRe | 临床照 | 7,041 | 描述 + CoT 推理 | 同库无独立条目 |
| Fitzpatrick 17k | 临床照 | 16,577 | 分类 + 肤型 | 无独立条目 |
| DDI | 临床照 | 656 | 分类 + 肤型分层 | ddi |
| SKINCON | 临床照 | 4,346 | 48 概念属性 | skincon |
| ISIC2018 | 皮肤镜 | 12,500 | 分类 | isic-2018 |
| ISIC2019 | 皮肤镜 | 33,569 | 分类 | isic-2019 |
| ISIC2020 | 皮肤镜 | 33,126 | 分类 | isic-2020 |
| Derm7pt | 皮肤镜+临床 | ~1,000 | 分类 + 7 点清单 | Derm7pt |
| PAD-UFES-20 | 临床照+元数据 | 2,298 | 分类 | PAD-UFES-20 |
| BCN20000 | 皮肤镜 | 19,424 | 分类 | BCN20000 |
读这张表的方法:先确定你要的模态(临床/皮肤镜),再确定你要的监督(分类/属性/描述/推理),交集处的条目才是候选。 SkinCAP 是"临床照 × 自然语言描述"这个交集里目前唯一的公共条目,这正是它的不可替代性所在。
2.9 数据规模横向对照与"稀缺性"的量化
把各皮肤数据集的规模与监督密度并列,更能看清 SkinCAP 的定位:
| 数据集 | 图像数 | 是否带自然语言 | 每图标注信息量(定性) |
|---|---|---|---|
| ISIC2019 | 33,569 | 否 | 低(1 个类别位) |
| Dermnet | 23,000 | 否 | 低 |
| Fitzpatrick 17k | 16,577 | 否 | 中(类别+肤型) |
| BCN20000 | 19,424 | 否 | 低 |
| SKINCON | 4,346 | 否 | 高(48 概念位) |
| SkinCAP | 4,000 | 是(中文母语描述) | 高(自由文本) |
| DDI | 656 | 否 | 中(类别+肤型+恶性) |
结论是一句反直觉的话:SkinCAP 在"图像数"一列几乎垫底,在"是否带自然语言"一列却是唯一的"是"。 若把数据集价值简单等同于图像数量,会错判 SkinCAP 的价值;它的价值集中在被其他数据集全部省略的那一列上。
2.10 三元结构的合并操作要点
把三个来源的数据并成一张可用表,有四个具体操作要点:
要点一:键对齐。 用 ori_file_path 对齐到源数据集的文件名。注意 Fitzpatrick 17k 与 DDI 的文件命名规则不同,合并时不要假设统一格式。
要点二:空值语义。 某字段在某来源下为空,含义是"该来源不提供此字段",而不是"该样本该属性缺失"。区分这两者对统计口径至关重要——不能把"DDI 样本没有 fitzpatrick_scale"当成"这些样本肤型未知"。
要点三:概念列对齐。 48 个 SKINCON 概念列应整体存在,但并非每个样本都被标注了全部概念。使用概念检测任务时,需确认是"未标注"还是"标注为否"。
要点四:图像指针。 url 字段指向原图位置,但原图访问权需另行取得(§4.4)。拿到标注但未拿到图的样本,在训练时须剔除或另作处理。
2.11 数据的"可组合性"评价
从工程角度,SkinCAP 的可组合性有三个层次:
| 层次 | 组合对象 | 可行性 | 说明 |
|---|---|---|---|
| 内部组合 | 描述 + 概念 + 病种 + 肤型 | 高 | 同表字段,直接拼 |
| 跨皮肤组合 | + ISIC 系列 | 中 | 模态不同,需分别建模或融合 |
| 跨模态组合 | + 通用医学 VQA | 中低 | 任务范式不同,需任务适配 |
对多数用户,内部组合(层次一)即可满足需求;跨组合(层次二、三)属于研究性用法,需要额外设计。
2.12 数据构成的常见误读
最后列出三个关于"构成"的常见误读,供快速自查:
- 误读一:4,000 是"新采集"的图像 → 实为从已有库抽取。
- 误读二:178 病种是"每类都够用" → 实为极长尾,多类不足 20 例。
- 误读三:48 概念是本数据集新标 → 实为继承自 SKINCON。
2.13 逐库交叉核对表(本条目自检用)
为便于复核者快速核对,把三个上游库与 SkinCAP 的关键参数并排列出:
| 参数 | Fitzpatrick 17k | DDI | SKINCON | SkinCAP |
|---|---|---|---|---|
| 规模 | 16,577 | 656 | 4,346 | 4,000 |
| 图像来源 | DermaAmin + Atlas Dermatol. | 自采 | Fitzpatrick17k + DDI | Fitzpatrick17k + DDI |
| 病种标注 | 有 | 有 | 无(概念级) | 有(178 种) |
| 肤型标注 | 有 | 有(分档) | 无 | 部分(随源) |
| 自然语言描述 | 无 | 无 | 无 | 有 |
| SkinCAP 取用 | 图像主体 | 图像补充 | 概念标签 | — |
这张表把"哪一部分来自哪里"一次说清,是理解三元结构与处理许可分层的对照底稿。
2.14 图像采集条件的不确定性
临床照的一个固有问题是采集条件不可控。虽然论文未逐张披露采集参数,但从数据来源可推断:
| 来源 | 采集条件可控性 | 潜在偏差 |
|---|---|---|
| DermaAmin(Fitzpatrick 17k 子源) | 低(在线图库,来源杂) | 图像质量与设备不一 |
| Atlas Dermatologico(同) | 低 | 同上 |
| DDI | 较高(研究自采) | 相对一致,但规模小 |
这意味着 SkinCAP 内部图像质量并非均质:来自在线图库的部分可能存在光照、分辨率、构图差异,而 DDI 部分相对一致。若模型的性能在子源之间出现落差,可能是采集条件差异所致,而非病种难度差异。做子源分析时需意识到这一点。
2.15 元数据的时间维度缺失
一个容易被忽略的构成特征是:SkinCAP 的元数据中没有明确的时间字段(无拍摄日期、无病例时间戳)。后果有二:
- 无法做时间序列或病程演变分析;
- 无法判断数据是否有时效性偏差(如某病种样本集中在某年)。
这是临床描述类数据集的常见局限——它以"单张图的横截面"为单位,而非以"病例的时间线"为单位。需要时序信息的任务不适合用 SkinCAP。
2.16 地理与人群代表性的推断
从来源可推断人群代表性:Fitzpatrick 17k 与 DDI 以英语世界(主要是美国)的临床图为主,SKINCON 亦然。因此 SkinCAP 的人群代表性偏向西方就诊人群,尽管它标注了 Fitzpatrick 肤型。中文描述并不等于中国人群样本——描述语言是中文,图像来源却是西方图库。这一"语言与人群错位"是使用时需要明确的:不要因为描述是中文就假设样本代表中国患者。
§3 标注方法与质量:谁写的、按什么规范写的、怎么验的
SkinCAP 的全部价值都压在"描述"这一层上。图像本身来自公开数据集,真正需要重新获取的信息是皮肤科医生逐张撰写的医学描述。因此这一节是理解本数据集的关键,也是复现其质量最难的一环。
3.1 谁在标:数字口径冲突已存照
论文对"参与撰写的皮肤科医生人数"存在双口径冲突,必须如实存照:
| 口径来源 | 表述 | 数值 |
|---|---|---|
| Methods(方法章) | board-certified dermatologists | four(4 名委员会认证皮肤科医生) |
| Figure 1a(图注) | dermatologists | five(5 名) |
两种口径都出现在同一篇 v1 论文里。FACTS.md §9 已逐条存照。检索者应默认取"至少 4 名、可能 5 名"的保守表述,并注明分歧。
医生的经验年限在 Methods 中给出为 24 年、18 年、21 年、18 年(共 4 条,与"four"口径一致;这也间接说明 Methods 的 4 人可能是更精确的写作者集合,而 5 人可能包含一位统筹/审校者)。
伦理审查号两条并列出现:
- 2024002X — Beijing AnZhen Hospital(北京安贞医院)
- 23IBEC100 — KAUST(阿卜杜拉国王科技大学)
双伦理号本身印证了本数据集是跨机构多中心协作的产物,而非单一实验室内部数据。
3.2 怎么标:五字段模板与中文母语优先
每张图像的描述并非自由发挥,而是遵循一套结构化字段模板(location / distribution / color / morphology 四要素,对应病灶定位、分布、颜色、形态),再组织成自然语言句子。这套模板的价值在于:
- 保证描述的可比性——不同医生写同一类病变时用同一套维度;
- 保证描述的可校验性——缺了"颜色"或"分布"可以直接判定为不合格;
- 保证 LLM 可学——模板化让"图像→结构化观察→语言"的映射更稳定。
描述的原稿语言为中文(母语撰写),再由机器翻译转为英文。v1 与 v2 使用的翻译方案不同(GPT-4 与 Google Translate 并存,见 §4 与 §9 存照),这是复现时需要注意的变量:英文版本是二手翻译,中文原稿才是一手标注。对中文医学 NLP 研究而言,这一点反而是优势——直接使用中文描述可绕开翻译损失。
3.3 质量验证:三路信号
论文报告了三种质量信号,强度递减:
| 信号 | 结果 | 强度 | 说明 |
|---|---|---|---|
| GPT-4 自动评分 | 见 v1 Table 报告 | 中 | 用 LLM 打分,存在自评偏差 |
| 皮肤科医生人工抽检 | 报告可用率 | 强 | 但抽样比例未完全披露 |
| 下游模型性能 | SkinGPT-4/BLIP-2 在 SkinCAP 上描述质量提升 | 中 | 间接证据,受任务设计影响 |
需要提醒的是:GPT-4 为描述打分存在"同源偏好"风险——若同一模型既生成训练目标又充当评分器,分数会系统性偏高。所以本条目建议把"人工抽检"作为最强证据,其余两者作辅证。
3.4 一个必须讲清的局限:临床图 vs 皮肤镜图
SkinCAP 的图像是临床照(clinical images),不是皮肤镜(dermoscopic)图像。这意味着:
- 它更贴近患者自拍/门诊肉眼视角,对**teledermatology(远程皮肤科)**更可用;
- 但缺少皮肤镜的放大、偏振、去毛等结构化信息,对精细鉴别诊断(如黑色素瘤 vs 痣的边界判定)支持弱于 ISIC 等皮肤镜数据集;
- 与库内 isic-2018/isic-2019/isic-2020 的差异已在 §2.6 说明。
把这一点讲在前面,能避免使用者误以为 SkinCAP 可以替代皮肤镜数据集。
3.5 长尾对标注质量的反向影响
§2.5 已显示病种分布极长尾(178 类,最少的仅 1 例)。长尾带来的质量隐患是:
- 罕见病种只有 1–6 例,标注一致性无法在类内验证(没有第二个样本可交叉比对);
- 若某罕见病描述本身写错,不会被任何内部一致性检查捕获;
- 因此使用罕见类时应把描述当作"单个医生的观察"而非"共识标注"。
这是所有长尾医学数据集的共同问题,但 SkinCAP 因为描述是自然语言、没有标准答案,风险比分类标签数据集更高。
3.6 标注流程的推测性重建
论文对标注流程的描述分散在 Methods 与 Figure 1,未给完整流水线。综合各处信息,可重建出如下流程(其中标"推测"处为条目作者的合理推断,非论文原文):
- 抽图:从 Fitzpatrick 17k 与 DDI 抽取 4,000 张临床图(论文原文)。
- 撰写:多中心皮肤科医生按 location / distribution / color / morphology 四要素写中文描述(论文原文)。
- 润色:经自研软件对中文描述做语言润色(论文原文,LangChain 框架)。
- 翻译:润色后的中文译成英文(工具在版本间由 GPT-4 换为 Google Translate,见 §8.3)。
- 复核:每张描述由至少另一位医生二次检查(论文原文称每张经多专家复核;具体比例推测未全公开)。
- 概念标签继承:并入 SKINCON 的 48 概念多热标签(论文原文)。
第 5 步的"复核比例未全公开"是复现质量的信息缺口:无法从公开材料得知是 100% 全检还是抽样复检。使用时应保守假设质量,尤其对罕见类(§3.5)。
3.7 标注质量的三个可自测维度
拿到数据后,使用者可在不依赖论文的前提下自行做三项质量体检:
| 体检项 | 方法 | 预期发现 |
|---|---|---|
| 描述长度分布 | 统计 caption_zh 字符数直方图 |
若呈双峰,可能存在"一句话草稿"与"规范描述"两批样本 |
| 要素完整性 | 用关键词/正则检查四要素覆盖 | 缺要素的描述可作低质量子集剔除 |
| 中英一致性 | 对 caption_zh_polish 与 caption_zh_polish_en 做语义对齐打分 |
打分异常低的样本提示翻译失败或原稿有误 |
第 3 项尤其能暴露 §8.3 翻译工具更换带来的版本差异——若你混用了不同版本的英译,中英一致性分布会出现分组现象。
3.8 标注成本的量级感
为让读者理解"4,000 条专家描述"的分量,做一个粗算(量级估算,非论文数据):假设一条规范的四要素医学描述从观察到落笔再到复核,平均耗时为 5–10 分钟,则 4,000 条约需 333–667 专家工时;若每张再经一次独立复核,工时翻倍。这意味着单是描述标注就相当于一位全职皮肤科医生按月计的工作量。这正是 §0.2 所说"自然语言监督昂贵"的具体体现,也解释了为什么这个数据集只有 4,000 张而非 40,000 张。
§4 许可与版本链:从 SkinCAP 到 SkinCaRe
这一节是本条目最需要小心的部分,因为数据集的许可与命名在研究周期内发生过实质性变化。任何直接引用旧版许可做合规判断的团队都可能踩坑。
4.1 版本链全貌
| 阶段 | 名称 | 时间 | arXiv | 内容 | 标注许可 |
|---|---|---|---|---|---|
| v1 | SkinCAP | 2024-05-28 首发 | 2405.18004v1 | 4,000 图 + 描述 | CC-BY-NC-SA-4.0 |
| 小改 | v240623 | 2024-06-23 | 2405.18004 修订 | 英译方案(GPT-4)相关 | 同上 |
| 小改 | v240715 | 2024-07-15 | 2405.18004 修订 | 英译方案(Google Translate)相关 | 同上 |
| v2 | SkinCaRe | 2025-11-09 | 2405.18004v2 | SkinCAP(4,000)+SkinCoT(3,041)=7,041 | 标注层 CC-BY-4.0 |
关键结论:arXiv ID 未变(2405.18004 是同一篇论文),但论文标题从 SkinCAP 改名为 SkinCaRe。 这不是数据集被伪造或撤销,而是同一团队把工作扩并、重新命名。SkinCAP 作为子集仍然存在且独立托管,因此本条目(slug=skincap)继续成立,不需要改派。
4.2 命名关系图
2405.18004 (同一 arXiv 号)
├── v1 (2024-05-28) → "SkinCAP" = 4,000 图 + 描述
└── v2 (2025-11-09) → "SkinCaRe" = SkinCAP(4,000) + SkinCoT(3,041)
└─ 统一资源名收录两者
对检索者的一句话建议:找 4,000 图 captioning 数据集 → 搜 SkinCAP;找含链式推理的 7,041 例统一资源 → 搜 SkinCaRe。
4.3 许可分层(务必分层理解)
许可不能只记一条,必须按"托管层 / 内容层 / 论文层"三分:
| 层 | 对象 | 许可 | 门禁 |
|---|---|---|---|
| 托管层 | HF joshuachou/SkinCAP |
研究用(gated) | 需申请、签研究用途协议 |
| 标注层(SkinCAP) | 描述文本 | CC-BY-NC-SA-4.0 | 署名+非商业+相同方式共享 |
| 标注层(SkinCaRe) | 新增 CoT 标注 | CC-BY-4.0 | 署名即可(更宽松) |
| 论文文本层 | 论文正文/图表 | CC BY-NC-ND 4.0 | 禁商用、禁改作 |
| 原始图像层 | Fitzpatrick17k/DDI/SKINCON 的图 | 各自第三方条款 | 须另行申请 |
最容易误判的一条:SkinCaRe 的标注变成 CC-BY-4.0 不等于"整个数据集变宽松"——图像仍受原始数据集第三方许可约束,SkinCAP 子集的描述仍标注 CC-BY-NC-SA-4.0。新许可只覆盖新增的 SkinCoT 部分。
4.4 获取路径与门禁实操
- HF 门禁仓库:
huggingface.co/datasets/joshuachou/SkinCAP(国内可走hf-mirror.com镜像)。gated 仓库需登录 HF 账号提交申请,说明研究用途。 - 后继统一资源:
yuhos16/SkinCaRe(CUHK-Shenzhen 托管)——注意托管方换成了港中文深圳,与 v1 的 KAUST 门禁是两套治理主体。 - 图像:即使拿到 SkinCAP 的标注,原始图像不随包放出,仍须回到 Fitzpatrick17k / DDI / SKINCON 分别申请。这是复现时的第一个硬门槛。
- DOI:HF 数据集 DOI
10.57967/hf/2256可用于正式引用。
4.5 版本链的合规建议
- 若你的项目在 2025-11 之前立项并引用了 SkinCAP,更新合规审查:确认你实际下载的是哪一版、用的是哪一层许可。
- 若你的项目只想做 captioning(4,000 图),用 SkinCAP 层许可(NC-SA)判断即可。
- 若你要用 CoT 推理标注,用 SkinCaRe 层许可(CC-BY-4.0)判断,但不得把该宽松度套到 SkinCAP 子集或原始图像上。
- 商用一律需逐层确认:NC 与 ND 条款基本排除直接商用,须另行获得授权。
4.6 版本链的时间线可视化
把 §4.1 的版本链按时间展开,可以看到一条清晰的"扩并-改名-放宽许可"轨迹:
2024-05-28 v1 SkinCAP 4,000 图 + 描述 CC-BY-NC-SA-4.0
│
2024-06-23 v240623 修订 英译用 GPT-4 许可不变
│
2024-07-15 v240715 修订 英译改用 Google Translate 许可不变
│
2025-11-09 v2 SkinCaRe 7,041 例(+SkinCoT) 标注层 CC-BY-4.0
读这条时间线的要点:
- 两次小修订集中在 2024 年年中,间隔仅三周,且都与"英文转换方案"有关——说明团队在英文质量上做过一轮快速迭代。
- 从 2024-05 到 2025-11 之间有近一年半的沉默期,之后直接以大改版(改名+扩并)回归。这种"首发 → 长期沉默 → 大改版"的节奏在学术数据集里常见,通常意味着团队在此期间做了扩展性工作(这里是 SkinCoT)。
- 许可放宽发生在扩并的同一步,即 v2 才引入 CC-BY-4.0。这提示许可变化与"新增 SkinCoT 部分"绑定,而非全局变更(§4.3)。
4.7 版本选择决策树
给使用者一棵可直接照走的决策树:
你的任务需要链式推理(CoT)标注吗?
├─ 是 → 用 SkinCaRe(v2):7,041 例,含 SkinCoT,标注 CC-BY-4.0
│ 但仍需注意:SkinCAP 子集与原始图像不受 CC-BY-4.0 覆盖
└─ 否 → 你的任务只需要图像+描述?
├─ 是 → 用 SkinCAP(v1/v240623/v240715)即可,4,000 例
│ 注意:确认你下载的是哪一版英译(GPT-4 还是 Google)
└─ 否 → 只要中文描述 → 任意版本均可,中文原稿不受翻译方案影响
一句话:选版本先看是否需要 CoT,再看是否需要英文描述。 只要中文描述,版本差异几乎不影响你。
4.8 门禁申请的现实建议
针对 HF gated 仓库与研究协议,给三条实操建议:
- 如实填写用途。门禁协议要求研究用途声明,虚报用途可能在后续发表或复用时引发合规问题。
- 保留申请记录与协议副本。数据集许可可能随版本变化,保留你申请时的协议快照,才能在日后证明你是按当时条款使用的。
- 走镜像时同样遵守原站条款。国内用
hf-mirror.com镜像获取数据,不改变许可义务——镜像只是分发通道,门禁协议随内容一并生效。
4.9 许可冲突的处置原则
本条目涉及多层许可与版本差异,处置原则归纳为三条:
- 就严不就宽:当不确定某部分适用哪条许可时,按更严的那条执行(此处即 CC-BY-NC-SA-4.0 与非商业限制)。
- 分层不越界:宽松许可只覆盖其明确声明的部分,不上溯、不外溢。
- 留证不臆断:以论文正文、HF 卡片、协议原文为准,不依据第三方转述做合规判断。
这三条也是 AI-Ready 目录处理一切"许可多口径"条目的通用原则。
4.10 SkinCoT 的标注构成与质量信号
v2 引入的 SkinCoT 是理解版本链的另一半,单独说明:
| 项目 | 内容 |
|---|---|
| 规模 | 3,041 条图像-CoT 配对 |
| 图像来源 | DermNet(与 SkinCAP 的 Fitzpatrick17k/DDI 不同源) |
| 标注者 | 汕头大学医学院皮肤科医生 |
| 内容 | 分层链式推理(hierarchical chain-of-thought)诊断 |
| 质量 | 平均分 4.9433(满分 5.0),79% 达满分 |
| 评分维度 | 六轴评分准则(six-axis rubric) |
| 许可 | CC-BY-4.0(比 SkinCAP 宽松) |
SkinCoT 的筛选过程也值得记录:原始候选 4,002 条 → 保留 3,813 条 → 进一步剔除评分 <4.5 的 772 条 → 最终 3,041 条。这条"4,002 → 3,813 → 3,041"的清洗链说明 v2 的 CoT 部分经过了显式的质量过滤,与 SkinCAP 部分(未见类似清洗描述)不同。对使用者而言,SkinCoT 的质量控制证据更充分,但样本量也因此更小。
一个跨源注意点:SkinCAP 的图像来自 Fitzpatrick17k/DDI,SkinCoT 的图像来自 DermNet,两者图像来源不同。合并成 SkinCaRe 后使用时,应保留来源标记,避免混算图像许可。
4.11 版本演替对引用规范的影响
由于名称与许可都变过,引用 SkinCAP 相关工作时需注意:
- 引用图注/方法细节(如医生人数):注明引的是 v1 还是 v2,因为两版表述可能不同。
- 引用规模数字:4,000 与 7,041 分别对应 SkinCAP 与 SkinCaRe,不可混用。
- 引用许可:注明对象是"SkinCAP 标注"还是"SkinCaRe 标注",二者许可不同。
- 引用 HF 仓库:
joshuachou/SkinCAP与yuhos16/SkinCaRe是两个仓库,托管方不同(KAUST 门禁 vs 港中文深圳)。
规范引用的一句话:说清"哪一版、哪一层、哪个仓库",就能避免绝大多数混淆。
4.12 版本链与数据库记录的一致性
本条目 slug 为 skincap,与数据库 url_name 反查结果一致(见 FACTS.md §1 查重结论)。版本改名(SkinCaRe)不触发改派,理由有三:
- arXiv ID 未变:2405.18004 是同一篇论文,v2 是修订版而非新论文;
- SkinCAP 作为子集独立存在:4,000 图+描述的部分有独立 HF 仓库与 DOI;
- 无证据表明原条目被撤销或伪造:改名是团队主动扩并,属正常学术演化。
因此本条目保留 skincap 主 slug,并在正文内说明与 SkinCaRe 的版本关系。若未来 SkinCaRe 独立成条目,应在两条目间建立"版本传承"互链,并明确各自覆盖的范围(SkinCAP=4,000,SkinCaRe=7,041)。
4.13 给合规审查者的结论摘要
若你是合规审查者,只需记住三句:
- 旧严新宽:SkinCAP 标注 CC-BY-NC-SA-4.0(非商业),SkinCaRe 新增标注 CC-BY-4.0(署名)。
- 图像独立:原图始终受 Fitzpatrick17k/DDI/SKINCON 第三方条款约束,与标注许可无关。
- 论文另算:论文文本 CC BY-NC-ND 4.0(禁商用、禁改作),与数据许可不是一回事。
三句之外的一切细节,回到 §4.3 的分层表核对。
4.14 许可变更的动机推测
为什么 v2 会把新增标注放宽到 CC-BY-4.0?公开材料未直接说明,从数据集演化规律可作三点推测(推测,非原文):
- 扩大使用面:NC(非商业)条款会阻挡学术界之外的使用者,放宽到 CC-BY-4.0 有利于 CoT 部分被更广泛采用。
- 新增部分无历史包袱:SkinCoT 是 v2 新标的,不涉及 v1 已有的第三方图像来源,团队对新增标注有完全处置权,因此可以自主选择许可。
- 与原始图像解耦:CoT 标注相对图像更"独立"——它是文本,不强调与原图的捆绑分发,因此可独立授权。
这三点只是解释"为何可能放宽",不改变适用的许可事实。使用者仍以 §4.3 分层表为准。
4.15 数据获取的失败模式
实际申请中可能遇到四类失败,提前预案:
| 失败模式 | 表现 | 预案 |
|---|---|---|
| HF 门禁未通过 | 无法下载标注 | 补齐研究用途说明后重申 |
| 原图访问被拒/延迟 | 有标注无图像 | 先用标注做文本侧研究,图像到位再补 |
| 镜像站同步滞后 | 版本不完整 | 核对版本号,必要时改用原站 |
| 协议版本不一致 | 拿到的协议与当前不同 | 以申请时快照为准,留存记录 |
四类中最常见的是第二类(原图延迟),因此 §7.4 检查清单把原图申请列在早期步骤。
4.16 许可与伦理的双重门禁
除许可外,本数据集还受伦理约束:两个伦理审查号(2024002X、23IBEC100)表明数据收集经过机构伦理审批。使用者应注意:
- 许可(license)解决的是"法律上能否用";
- 伦理(ethics approval)解决的是"研究上是否合规";
- 两者不可互相替代——即使许可允许,涉及人的研究仍可能需你所在机构的伦理审查。
对医学数据使用者,这是比许可更容易被忽略的一层。
§5 评估与基准:SkinCAP 怎么被用来考模型
SkinCAP 的评估设计不是"刷 SOTA",而是考多模态模型能否理解皮肤图像并说人话。理解它的评估范式,有助于判断自己在什么任务上可以复用它、在什么任务上不能。
5.1 三个被评测的模型
论文把 SkinCAP 当作多模态能力测试床,主要评测对象包括:
| 模型 | 类型 | 在 SkinCAP 上的角色 |
|---|---|---|
| SkinGPT-4 | 皮肤科专用多模态 LLM | 主要对比对象,验证领域专精模型描述质量 |
| BLIP-2 | 通用图像描述模型 | 通用基线,检验"通用模型在皮肤域是否够用" |
| GPT-4(V) 系列 | 通用多模态 LLM | 闭源对照,作能力上界参考 |
论文的核心论证是:通用图像描述模型在皮肤临床图上会产生"看似流畅但临床错误"的描述,而带皮肤科领域监督的模型(SkinGPT-4)能给出更贴近医生表述的结果。这为"医学图像描述需要领域数据"提供了证据。
5.2 DAIMS 评估框架
本条目须纳入 DAIMS 表(数据-模型评估对照),用于横向比较 SkinCAP 与其他皮肤数据集的评测定位:
| 维度 | SkinCAP (4,000) | SkinCaRe (7,041) | Fitzpatrick 17k | DDI (656) | SKINCON |
|---|---|---|---|---|---|
| 主任务 | image→text captioning | captioning + CoT 推理 | 病种分类 | 病种分类 | 临床概念分类 |
| 监督信号 | 自然语言描述 | 描述 + 链式推理 | 单标签分类 | 单标签分类 | 多概念标签 |
| 肤型标注 | Fitzpatrick I–VI | Fitzpatrick I–VI | Fitzpatrick | Fitzpatrick | 无 |
| 概念粒度 | 描述级(自由文本) | 描述+推理步骤 | 病种级 | 病种级 | 48 临床概念 |
| 适用评估 | 描述质量/临床贴合度 | 可解释性/推理链质量 | 分类精度/公平性 | 分类精度 | 概念检测 |
| 图像模态 | 临床照 | 临床照 | 临床照 | 临床照 | 临床照 |
| 门禁 | HF gated(研究用) | 港中文深圳托管 | 公开 | 公开 | 公开 |
DAIMS 表在这里的作用是防止把不同任务的分数横向对比——SkinCAP 上报告的"描述质量分"与 ISIC 上报告的"AUC"不可比。
5.3 评估指标的类型与现实困境
文本生成没有唯一正确答案,因此 SkinCAP 的评估天然依赖代理指标:
- 词汇/语义相似度(如 BLEU、ROUGE 类)——便宜但易被模板化描述刷高;
- LLM 评分(GPT-4 打分)——语义感知强,但有同源偏好与不可复现问题;
- 人工医生评分——最可信,但成本高、样本小。
三者各有缺口。实践建议:把人工评分当主指标,LLM 评分当筛子,n-gram 相似度只作辅助参考,不要单看任一指标下结论。
5.3.1 三种指标的失效模式对照
为便于选用,把三种指标的失效模式列清:
| 指标 | 什么时候会骗你 | 对策 |
|---|---|---|
| n-gram 相似度(BLEU/ROUGE 类) | 模型输出模板化、套话化时分数虚高 | 配合人工评分,别单独看 |
| LLM 评分(GPT-4 打分) | 生成模型与评分模型同源时高估 | 换用不同族评分模型或人工复核 |
| 人工医生评分 | 样本小、成本高、评分者间一致性需检查 | 报告评分者一致性,扩大样本 |
这张表的用途是:拿到任何一组 SkinCAP 相关分数时,先问它是用哪种指标算的,再判断可信度。 三种指标的可信度排序是人工 > LLM > n-gram,但成本排序正好相反。
5.3.2 为什么文本生成评测天然比分类难
分类任务的评测是"对/错"的二元判定,指标(准确率、AUC、F1)有唯一公认定义。文本生成任务的评测则要先回答"什么叫好"——是词汇重叠高?语义一致?临床正确?不同答案给出不同指标,而"临床正确"这一最重要的维度恰恰最难自动度量。SkinCAP 作为皮肤描述数据集,其"临床正确"的标准只有皮肤科医生能判定,这就是为什么它没有现成 benchmark 分数(§5.2 前文、Q8),也是为什么本条目反复强调"人工评分为主"。
5.4 如何用 SkinCAP 做自己的评测
若你要基于 SkinCAP 搭评测,可参考的三种用法:
- 描述质量基准:给定图像,让模型生成描述,医生盲评排序——测"说人话"的能力。
- 临床要素命中率:检查生成描述是否覆盖 location/distribution/color/morphology 四要素——测结构化完整性。
- 肤型公平性:按 Fitzpatrick I–VI 分层统计性能,检查模型是否在深色皮肤上退化——这是皮肤 AI 的经典公平性审计点。
第 3 点尤其值得强调:SkinCAP 覆盖 Fitzpatrick I–VI 全谱是它相对许多数据集的核心优势,分层评估才能把这个优势用出来。
5.5 DAIMS 表的读法
§5.2 的 DAIMS 表不是罗列,而是一张"选型避坑图"。逐列读法:
- 看"主任务"列:SkinCAP 与 ISIC 的主任务不同(captioning vs classification),因此它们的指标不可互换。把 SkinCAP 的描述质量分与 ISIC 的 AUC 放一栏比较,是评测量纲混用。
- 看"监督信号"列:SkinCAP 是"自然语言描述",SkinCaRe 是"描述 + 链式推理",其余是"单标签/多概念"。监督信号决定了任务设计的上限——单标签只能做分类,自由文本才能做生成与解释。
- 看"肤型标注"列:SkinCAP/SkinCaRe/Fitzpatrick17k/DDI 都有 Fitzpatrick 标注,SKINCON 没有。没有肤型标注的数据集无法做公平性审计,这是选型时容易忽略的一列。
- 看"门禁"列:只有 SkinCAP 是 gated(研究用协议),其余公开。门禁意味着复现成本更高,但对合规更友好。
综合看,SkinCAP 行的独特组合是"临床照 × 自由文本 × 肤型标注 × gated",四列同时满足的条目在表内只有它。
§6 生态与互链点:库内可串联的条目
SkinCAP 处在皮肤 AI 与医学多模态两条线的交叉口,库内至少有两组可互链条目。
6.1 皮肤/皮肤病学家族(同域互链)
| 库内条目 | 关系 | 建议互链理由 |
|---|---|---|
| isic-2018 | 互补 | 皮肤镜分类 vs 临床描述,模态不同 |
| isic-2019 | 互补 | 同上,分类监督规模更大 |
| isic-2020 | 互补 | 同上,含更多病种 |
| derm12345 | 相关 | 皮肤镜多任务,可作对照 |
| Derm7pt | 相关 | 皮肤镜+临床配对,含 7 点清单 |
| BCN20000 | 相关 | 皮肤镜分类,规模大 |
| PAD-UFES-20 | 相关 | 临床照+元数据,近 teledermatology |
| MED-NODE | 相关 | 皮肤镜分类小数据集 |
| scin | 相关 | 皮肤科临床图像数据集,含肤型 |
| ddi | 上游来源 | SkinCAP 的图像来源之一(Diverse Dermatology Images) |
| skincon | 上游来源 | SkinCAP 的 48 临床概念标签来源 |
其中 ddi 与 skincon 是与 SkinCAP 有直接数据血缘的库内条目——SkinCAP 的图和概念标签直接取自它们,互链时应标注"上游来源"关系,而不只是"相关"。
6.2 医学多模态 / VQA 家族(方法学互链)
| 库内条目 | 关系 | 建议互链理由 |
|---|---|---|
| vqa-rad | 方法学同族 | 医学图像相关问答,评估范式可比 |
| slake | 方法学同族 | 医学 VQA 基准,中英双语 |
| pathvqa | 方法学同族 | 病理图像 VQA,跨模态任务设计参考 |
| omnimedvqa | 方法学同族 | 通用医学 VQA 大基准 |
| pmc-vqa | 方法学同族 | 文献图 VQA,评测构造参考 |
这组的互链价值在于评估设计可比:SkinCAP 的"图像→描述"与它们"图像→回答"同属视觉-语言生成任务,指标与陷阱(同源偏好、模板刷分)高度相通。
6.3 互链的写法建议
- 对 ddi / skincon:用"上游来源"标签,并说明具体贡献了哪些部分(DDI→图像,SKINCON→临床概念)。
- 对 ISIC 系列:用"互补模态"标签,强调临床照 vs 皮肤镜的边界。
- 对 VQA 家族:用"同评估范式"标签,便于研究者在方法学层面横向借鉴。
- 对 SkinCaRe/SkinCoT:因为同库无独立条目,宜在正文内说明版本链,而不是互链到不存在的条目。
6.4 互链矩阵:按关系类型分组
把 §6.1–§6.3 的条目按"关系类型"重组,便于编辑者批量处理互链:
| 关系类型 | 库内条目 | 互链措辞建议 |
|---|---|---|
| 上游数据血缘 | ddi、skincon | “SkinCAP 的图像/概念标签取自该数据集” |
| 互补模态 | isic-2018、isic-2019、isic-2020、derm12345、Derm7pt、BCN20000、MED-NODE | “同为皮肤数据集,但模态/任务不同,互补使用” |
| 近邻场景 | PAD-UFES-20、scin | “同为临床照数据集,场景相近” |
| 同评估范式 | vqa-rad、slake、pathvqa、omnimedvqa、pmc-vqa | “同属视觉-语言生成任务,评估设计可借鉴” |
| 版本传承(无独立条目) | SkinCaRe、SkinCoT | 正文内说明,不互链 |
6.5 与皮肤癌相关条目的关联
库内 VOCAB 含"皮肤癌"疾病标签。SkinCAP 覆盖多种皮肤恶性肿瘤(黑色素瘤、基底细胞癌、鳞状细胞癌等,见 §2.5),因此在"皮肤癌"主题聚合页中,SkinCAP 可作为**"描述与可解释性"方向的代表条目**出现。若库内存在皮肤癌分类数据集条目,建议在互链时明确分工:分类数据集提供判别监督,SkinCAP 提供语言监督。
6.6 生态位的总结一句话
SkinCAP 在库内的生态位是"皮肤领域的语言监督供给者":上游接 Fitzpatrick17k/DDI/SKINCON 的图像与标签,下游供多模态 LLM 与可解释性研究使用,横向与 ISIC 系列互补。互链时围绕这个生态位设计,比逐条罗列更清晰。
§7 使用指南:拿到 SkinCAP 之后做什么
这一节给实操者一条从下载到出结果的路径。
7.1 上手三步
- 先拿许可:HF 申请
joshuachou/SkinCAP,同时并行申请 DDI / SKINCON / Fitzpatrick17k 原始图像访问(这一步最慢,先启动)。 - 对齐三元结构:把图像 ID、描述文本、Fitzpatrick 肤型标签按 §2.3 的字段表拼成统一表,注意 v1 Table III 的字段命名。
- 分层抽样:按病种与肤型做分层抽样建立开发集,避免长尾类过度/不足代表(§2.5、§3.5 的坑)。
7.2 常见误用
| 误用 | 后果 | 纠正 |
|---|---|---|
| 把英文描述当一手标注 | 翻译损失被当模型误差 | 中文原稿才是一手 |
| 在罕见类上做类内一致性分析 | 样本不足,结论无效 | 罕见类只作案例 |
| 拿 SkinCaRe 的 CC-BY-4.0 当全库许可 | 合规风险 | 分层判断(§4.3) |
| 用 SkinCAP 替代皮肤镜数据集 | 精细鉴别能力不足 | 与 ISIC 互补使用 |
| 只看 LLM 评分就宣称质量提升 | 同源偏好高估 | 人工医生评分为主 |
| 忽略肤型分层 | 无法暴露深色皮肤退化 | 必做分层评估(§5.4) |
7.3 一句话定位
SkinCAP 是目前少有的"临床照 + 皮肤科医生自然语言描述 + Fitzpatrick 全谱"三重齐备的数据集,它的不可替代性在语言监督层,而非图像规模层。 用它时应把重心放在"描述生成 / 报告辅助 / 可解释性"这类语言侧任务,图像分类请让位给 ISIC 等皮肤镜数据集。
7.4 复现检查清单
从申请到可训练,建议按下列清单逐项确认(每项都是先前各节结论的落地):
- [ ] HF 门禁已通过,研究用途协议已留存副本(§4.8)
- [ ] 确认下载版本的英译方案(GPT-4 / Google Translate),全流程统一(§8.3)
- [ ] Fitzpatrick17k / DDI / SKINCON 原图访问权已另行申请到位(§4.4、8.5)
- [ ] 已按 §2.3 字段表把三元数据拼成统一表,空值处理策略已定(§2.3)
- [ ] 已按病种与肤型做分层抽样,长尾类处理策略已定(§2.5、§3.5)
- [ ] 已明确使用的是中文原稿还是英译,并全流程统一(§3.2)
- [ ] 评测协议已定,且以人工医生评分为主指标(§5.3)
- [ ] 已规划 Fitzpatrick 分层评估(§5.4)
- [ ] 合规判断已按"就严不就宽 / 分层不越界 / 留证不臆断"三原则执行(§4.9)
清单全部打勾,才算把 SkinCAP 用对。
7.5 三种典型使用场景的配置建议
| 场景 | 推荐字段/版本 | 关键注意事项 |
|---|---|---|
| 中文医学描述生成 | caption_zh_polish(中文原稿) |
绕开翻译损失,直接做中文多模态 |
| 英文多模态预训练 | caption_zh_polish_en(统一版本) |
务必统一英译版本,避免翻译噪声 |
| 可解释性诊断研究 | SkinCaRe(含 SkinCoT) | 需 CoT 才选 v2,注意用其 CC-BY-4.0 范围 |
三种场景覆盖了 SkinCAP 最主流的三类使用者,其余用法可在此基础上前置或组合。
7.6 与其他皮肤数据集的组合用法示例
举三个具体的组合管线,说明 SkinCAP 如何与库内条目配合:
管线一:先分类后描述(ISIC → SkinCAP)。
用 ISIC2019 训练皮肤镜分类器,用 SkinCAP 训练描述生成器,两阶段串联:先判病种,再生成临床描述。两者模态不同,此管线适用于多模态输入场景(同时有皮肤镜图与临床照)。
管线二:概念驱动描述(SKINCON → SkinCAP)。
利用 SkinCAP 继承的 48 概念标签,先做概念检测,再把检出的概念作为提示喂给描述生成模型。这条管线可解释性最强——描述由显式概念组织而成。
管线三:描述+推理双监督(SkinCAP + SkinCoT,即 SkinCaRe)。
同时用描述与 CoT 标注训练模型,让它既会说"图里有什么",也会说"为什么这样判断"。这是 v2 的统一资源设计想支持的用法。
三条管线对应三种研究深度,读者可按需选用。
7.7 评测落地的最小可行方案
若资源有限,给一个"最小可行评测"方案,四步即可跑起来:
- 抽样本:从 178 病种中按分层抽 178 张(每类 1 张),保证覆盖面;
- 生成:让待评模型对每张生成描述;
- 盲评:请 1–2 位皮肤科医生对描述按"临床正确 / 部分正确 / 错误"三档盲评;
- 分层报告:报告总体与按 Fitzpatrick 分层的正确率。
这个方案成本可控,且避开了"LLM 自评"的同源偏差(§5.3.1),是个人研究者也能执行的评测路径。
7.8 训练侧的三条经验
若把 SkinCAP 用于训练多模态模型,三条经验值得注意:
- 字段选一,不要混。同时用中文与英译描述训练会让模型困惑语言边界,除非你明确在做双语模型。
- 长尾类降权或合并。1–6 例的类直接训练会过拟合,建议合并到大类或做重采样。
- 描述是弱监督,不是金标准。单条描述代表一位医生的观察,训练时应视为"合格样本"而非"唯一正确答案",模型输出与之不同未必是错的。
7.9 不做这些事
为避免误用,明确列出"不适合用 SkinCAP 做的事":
| 不适合 | 原因 |
|---|---|
| 皮肤镜自动诊断 | 模态不符(§2.7) |
| 大规模预训练的唯一数据 | 规模仅 4,000,不够 |
| 商用产品直接训练 | 许可含 NC 限制(§4.3) |
| 稀有病的独立评测 | 样本不足(§2.5、§3.5) |
| 中文语言质量基准的英译部分 | 英译是机器产物(§8.3) |
列出"不做",与列出"能做"同等重要。
7.10 数据准备的代码骨架(伪代码)
为让实操更具体,给出数据准备阶段的伪代码骨架(示意,非可运行代码):
1. 载入标注表(统一版本)
2. 校验字段:id, ori_file_path, disease, caption_zh 等必填列非空
3. 按 ori_file_path 关联到已申请到的原始图像
4. 剔除无图像的样本(或标记为"仅文本"子集)
5. 统一英译版本:若混版,全部重译为同一方案
6. 建立分层索引:按 disease 与 fitzpatrick_scale 分层
7. 划分 train/dev/test:分层抽样,长尾类合并
8. 输出统一 schema 的中间表
这八步是全流程的骨架,具体实现依框架而定。关键是第 5 步(统一翻译版本)与第 7 步(分层划分),这两步最容易出错。
7.11 与评测工具链的对接
SkinCAP 因为是 captioning 任务,可对接现成的图像描述评测工具链:BLEU/ROUGE 类度量、CIDEr、以及基于嵌入的语义相似度。但如 §5.3 所述,这些自动指标只能作辅助。建议的对接方式是:
- 自动指标:跑一遍,用作快速回归监控;
- 人工评分:作为发布前的最终判定;
- 分层报告:自动与人工都按 Fitzpatrick 分层输出。
这样既保留了自动化的效率,又不牺牲临床可信度。
7.12 一个易被忽略的复现障碍:图像格式转换
HF 上图像以 imagefolder 格式提供,但原始 Fitzpatrick17k/DDI 的图像格式与命名未必一致。实际拼接时可能需要:
- 统一分辨率(不同来源图像尺寸不一);
- 统一色彩空间(避免 PNG/RGB 与灰度混淆);
- 统一命名映射(把
ori_file_path映射到本地文件名)。
这些工程细节不影响科学性,但会让第一次复现多花时间,提前知晓可少走弯路。
§8 双口径冲突存照:同一事实的两个数字
本数据集在公开材料中出现了至少六处口径冲突。这些冲突不是要判谁对谁错,而是要在条目里如实并列两条,让检索者看到分歧本身。以下逐条存照。
8.1 冲突一:皮肤科医生人数 4 vs 5
| 口径 | 出处 | 数值 |
|---|---|---|
| A | v1 Methods(方法章) | four(4 名委员会认证皮肤科医生) |
| B | v1 Figure 1a(图注) | five(5 名) |
处理:保守表述"至少 4 名(或 5 名)"。经验年限列出 4 条(24/18/21/18 年),与 A 口径一致,暗示 4 人是撰写者集合、5 人可能含审校者。
8.2 冲突二:DDI 来源规模表述不一致
| 口径 | 出处 | 数值 |
|---|---|---|
| A | 正文首句 | “208”(DDI 图像数) |
| B | 分项相加 | 208 + 241 + 207 = 656 |
处理:DDI 官方规模为 656 张(三类病变相加),正文首句的"208"疑似只指其中一类或为笔误。条目采用 656,并注明正文存在 208 的单点表述。
8.3 冲突三:英译方案 GPT-4 vs Google Translate
| 口径 | 出处 | 方案 |
|---|---|---|
| A | v1 / 修订 v240623 | GPT-4 翻译 |
| B | 修订 v240715 / v2 | Google Translate |
处理:翻译方案在版本之间发生过切换。复现英文描述前必须确认版本,否则同一中文原稿会得到不同英文。中文原稿不受影响。
8.4 冲突四:许可 CC-BY-NC-SA-4.0 vs CC-BY-4.0
| 口径 | 对象 | 许可 |
|---|---|---|
| A | SkinCAP 标注 | CC-BY-NC-SA-4.0(非商业+相同方式共享) |
| B | SkinCaRe 新增标注 | CC-BY-4.0(署名即可) |
处理:分层判断(§4.3)。B 的宽松不得上溯到 A 或原始图像。
8.5 冲突五:标注开放 vs 图像需另行申请
| 口径 | 对象 | 可获取性 |
|---|---|---|
| A | 标注文本 | 随数据集(gated)放出 |
| B | 原始图像 | 不随包放出,须向 Fitzpatrick17k/DDI/SKINCON 分别申请 |
处理:存在"标注可得、图像难得"的不对称。复现门槛主要在图像侧。
8.6 冲突六:第三方引用 3,989 vs 官方 4,000
| 口径 | 出处 | 数值 |
|---|---|---|
| A | 第三方论文(如 DermFM-Zero 等) | “3,989 expert-annotated image-caption pairs” |
| B | 官方论文/HF | 4,000 |
处理:以官方 4,000 为准;3,989 可能是去重/清洗后计数或二手转录误差。条目并列两值并标明来源差异。
上述六条已在 writing/skincap/FACTS.md §9 逐条存照,编号与本节一一对应。
8.7 双口径的统一处置原则
面对同一事实的两个数字,AI-Ready 条目的标准处置是四步:
- 并列:把两个数字与各自出处同表列出,不隐去任一。
- 标注:说明哪个是"官方/一手"、哪个是"转述/疑似笔误"。
- 取用:正文叙述取官方口径,但注明存在另一口径。
- 留痕:在 FACTS.md 与坑点清单中留下条目,供后续复核。
本条目六处冲突均已按此四步处置。之所以不"择一而定",是因为目录式条目的价值恰在于保存冲突——抹平冲突会让后来者失去发现问题的线索。
8.8 为什么这个数据集冲突特别多
SkinCAP 冲突偏多,有三个结构性原因:
- 跨机构多中心:四个医院协作,人数、经验、复核比例等描述容易在不同章节口径不一。
- 版本多次修订:首发后两次小改(翻译方案变动)+ 一次大改(改名扩并),每次改动都可能引入新表述而与旧表述并存。
- 长尾与大规模混合:DDI 既有三档细分又有总数,正文既有单点又有求和,数字层级多,出错概率高。
理解这三因,有助于对其他多中心、多版本的数据集保持同样的警觉——冲突多的数据集往往不是质量差,而是演化复杂。
§9 检索陷阱与常见坑
坑 1:把 SkinCAP 和 SkinCaRe 当成两个独立数据集
真相:同一 arXiv 号(2405.18004)的 v1 与 v2,v2 是 v1 的扩并改名。SkinCAP 是 SkinCaRe 的子集。当成两个数据集会重复计数、错配许可。
坑 2:把 v2 的 CC-BY-4.0 当成整个数据集的许可
真相:CC-BY-4.0 只覆盖新增的 SkinCoT 标注。SkinCAP 子集仍是 CC-BY-NC-SA-4.0,原始图像仍受第三方约束(§4.3、8.4)。
坑 3:默认原始图像随标注一起放出
真相:图像不随包放出,须分别向 Fitzpatrick17k / DDI / SKINCON 申请。这是复现第一个卡点(8.5)。
坑 4:把英文描述当作一手标注
真相:中文是母语原稿,英文是机器翻译(且方案在版本间切换过)。拿英文做质量分析会把翻译噪声误判为模型误差(§3.2、8.3)。
坑 5:拿 SkinCAP 的评价分数去和 ISIC 的分类分数横比
真相:任务不同(captioning vs classification)、模态不同(临床照 vs 皮肤镜)、指标不可比。横比是评测量纲混用(§5.2 DAIMS、§2.6)。
坑 6:在罕见病种上做类内一致性分析
真相:178 类中最少的仅 1 例,类内无第二样本,一致性无法验证;罕见类描述只能当"单个医生的观察"(§2.5、§3.5)。
坑 7:只用 LLM 评分就宣称描述质量提升
真相:GPT-4 同源偏好会系统性高估。应以人工医生评分为主指标(§3.3、§5.3)。
坑 8:忽略 Fitzpatrick 分层评估
真相:SkinCAP 的核心优势之一是全肤型覆盖;不做分层就看不出模型在深色皮肤上的退化(§5.4)。
坑 9:把第三方转述的"3,989"当官方规模
真相:官方为 4,000;二手数字宜标注来源并核对(8.6)。
坑 10:认为 DDI 只有 208 张
真相:那可能是正文单点表述;DDI 实为 656 张(208+241+207),条目以 656 为准(8.2)。
坑 11:忽略双伦理号的含义
真相:2024002X(北京安贞医院)+ 23IBEC100(KAUST)说明这是跨机构多中心协作,数据治理涉及多方,不可当单实验室数据(§3.1)。
坑 12:把 Table II 当作完整病种分布表
真相:Table II 只列样本 <20 的病种;≥20 的计数只在图 1b 中而无数字表。想拿全量病种计数的人会发现"数不全"——这是"图有数无表"的信息断层(§2.5)。
坑 13:以为中文描述需要另行付费
真相:中文原稿 caption_zh 随标注一并提供,其价值在库内皮肤条目中稀缺且未被额外设卡;真正的获取门槛在原图而非中文描述(§4.4)。
坑 14:直接用英文描述做中文语言质量分析
真相:英文是机器翻译产物,不能代表中文原稿的语言质量。做中文语言分析必须用 caption_zh / caption_zh_polish(§3.2、8.3)。
坑 15:假设所有样本都有 Fitzpatrick 标注
真相:fitzpatrick_scale 只对 Fitzpatrick 子集有值,DDI 子集用的是 skin_tone/malignant。跨源合并后并非每张图都有可用的 Fitzpatrick 值,肤型分析前必须先确认覆盖范围(§2.3、5.4)。
坑 16:用 HF 镜像时忽略原站门禁条款
真相:hf-mirror.com 只是分发通道,门禁协议随内容生效;走镜像不豁免研究用途义务(§4.8)。
§10 结论与研究建议
10.1 本条目结论
SkinCAP 是真实存在、有独立托管、有第一手论文的多模态皮肤病学数据集(arXiv:2405.18004,HF joshuachou/SkinCAP,DOI 10.57967/hf/2256)。它与后继 SkinCaRe 构成版本传承关系而非同一性替代。本条目(slug=skincap)的存续不构成伪造,属正常版本演进,无需改派。
10.2 对使用者的三条建议
- 按版本与分层许可做合规,不要一刀切引用单一许可。
- 语言侧任务用它、分类侧任务让位,与 ISIC 系列互补。
- 分层(病种 × 肤型)评估,并把人工医生评分作为质量主指标。
10.3 对数据集维护方的观察
若 SkinCaRe 后续继续扩并,建议:(a) 明确 SkinCAP 子集在新统一许可中的边界;(b) 公布英文描述所用的具体翻译版本;© 澄清医生人数口径(4/5)与 DDI 规模(208/656)两处历史冲突。
10.4 待核遗留疑点
| 疑点 | 状态 |
|---|---|
| 医生人数精确值(4 还是 5) | 双口径并存,未消解 |
| DDI 首句"208"的具体所指 | 未从原文澄清 |
| 各版本英译方案的逐版对照表 | 未逐版核到 |
| 官方 4,000 与第三方 3,989 的差额来源 | 未获官方说明 |
| SkinCaRe 与 SkinCAP 子集在统一托管层的许可衔接细则 | 未获明确文档 |
以上疑点均未在公开材料中找到唯一权威答案,已在 FACTS.md §9 与本节并列存照,供后续复核者继续追证。
10.5 对 AI-Ready 目录工作的启示
SkinCAP 这一条目给 AI-Ready 质检留下四条可迁移的经验:
- 别名碰撞要用数据库反查判定。本条目 slug=skincap 与后继名 SkinCaRe 的关系,是靠"同一 arXiv ID"确认的版本传续,而非靠名称相似度猜测。若仅凭名字判断,很容易误判为"两个数据集"。
- 许可要看版本与分层。宽松许可(CC-BY-4.0)常只覆盖新增部分,不上溯旧内容与第三方图像。
- 数字冲突要并列存照。本条目六处冲突若被抹平,后来者将失去复核线索。
- "图有数无表"是常见信息断层。Table II 只给 <20 病种、≥20 只在图中,这类断层需在条目中显式指出。
10.6 一句话总结
SkinCAP 用 4,000 条皮肤科医生写下的中文医学描述,在皮肤领域开了"语言监督"的先河,并在一年半后扩并为含推理链的 SkinCaRe;它的价值不在图像数量,而在那张唯一带"是"的自然语言列。
本条目由千方病案医数集团队依据第一手来源编写,所有硬数字均可在 FACTS.md 溯源。
附:本条目信息来源一览
| 编号 | 来源 | 用途 |
|---|---|---|
| S1 | arXiv:2405.18004v1(2024-05-28) | 规模、来源、字段表、医生人数、伦理号 |
| S2 | arXiv:2405.18004v2(2025-11-09,SkinCaRe) | 版本传续、SkinCoT、7,041、CC-BY-4.0 |
| S3 | HF joshuachou/SkinCAP 数据集卡与元数据 |
字段、格式、门禁、DOI |
| S4 | HF yuhos16/SkinCaRe(CUHK-Shenzhen 托管) |
后继统一资源 |
| S5 | 第三方引用文献(如 DermFM-Zero 等) | 交叉验证与"3,989"口径 |
| S6 | Fitzpatrick 17k / DDI / SKINCON 原始论文 | 上游规模与许可 |
| S7 | 库内条目目录(isic 系列、ddi、skincon 等) | 互链点核对 |
(详细 URL 清单见 writing/skincap/FACTS.md 附录。)
附二:本条目核心硬数字速查
| 数字 | 含义 | 口径 |
|---|---|---|
| 4,000 | SkinCAP 图像数 | 官方 |
| 178 | 皮肤病种数 | 官方 |
| 16,577 | Fitzpatrick 17k 规模(12,672 + 3,905) | 自洽 |
| 656 | DDI 规模(208 + 241 + 207) | 求和(正文首句有 208 的单点表述) |
| 4,346 | SKINCON 规模 | 官方 |
| 3,690 | SKINCON 取自 Fitzpatrick 17k 的部分 | 官方 |
| 48 | SKINCON 临床概念数 | 官方 |
| 4 或 5 | 撰写描述的皮肤科医生人数 | 双口径(Methods 4 / Fig 1a 5) |
| 24/18/21/18 | 医生经验年限 | Methods |
| 3,041 | SkinCoT 图像-CoT 对数 | v2 官方 |
| 7,041 | SkinCaRe 总例数(4,000 + 3,041) | v2 官方 |
| 4.9433 | SkinCoT 标注平均得分 | v2 官方 |
| 79% | SkinCoT 中达满分 5.0 的比例 | v2 官方 |
| 3,989 | 第三方转述的图像-描述对数 | 存照(官方为 4,000) |
| 10.57967/hf/2256 | HF 数据集 DOI | 官方 |
此表是本条目的"事实锚",任何引用都应回到 FACTS.md 对应小节核对。
附三:术语表(中英对照)
| 中文 | 英文 | 说明 |
|---|---|---|
| 图像-文本对齐 | image-text alignment | 多模态训练的核心监督形式 |
| 图像描述 | image captioning | 本数据集的主任务 |
| 临床照 | clinical image | 肉眼视角照片,非皮肤镜 |
| 皮肤镜 | dermoscopy / dermoscopic image | 放大偏振图像 |
| 肤型 | Fitzpatrick skin type | I–VI 六档 |
| 临床概念 | clinical concept | SKINCON 的 48 个属性标签 |
| 链式推理 | chain-of-thought (CoT) | SkinCoT 的推理标注形式 |
| 门禁数据 | gated dataset | 需申请与协议的数据 |
| 长尾分布 | long-tail distribution | 少数类样本极少 |
| 远程皮肤科 | teledermatology | 远程读图会诊 |
术语表便于跨语种检索,也便于编辑者统一措辞。
附四:与其他条目的互链速查
| 库内条目 | 关系 | 一句话 |
|---|---|---|
| ddi | 上游来源 | SkinCAP 部分图像取自 DDI |
| skincon | 上游来源 | SkinCAP 48 概念标签取自 SKINCON |
| isic-2018 / isic-2019 / isic-2020 | 互补模态 | 皮肤镜分类 vs 临床照描述 |
| Derm7pt / derm12345 / BCN20000 / MED-NODE | 同域相关 | 皮肤数据集家族 |
| PAD-UFES-20 / scin | 近邻场景 | 临床照场景相近 |
| vqa-rad / slake / pathvqa / omnimedvqa / pmc-vqa | 同评估范式 | 视觉-语言生成任务 |
(互链关系的详细论证见 §6。)
附五:版本对照速查
| 项目 | SkinCAP (v1) | SkinCaRe (v2) |
|---|---|---|
| arXiv | 2405.18004v1 | 2405.18004v2 |
| 时间 | 2024-05-28 | 2025-11-09 |
| 内容 | 4,000 图 + 描述 | 4,000 + 3,041 = 7,041 |
| 是否含 CoT | 否 | 是(SkinCoT) |
| 图像来源 | Fitzpatrick17k + DDI | + DermNet(CoT 部分) |
| 标注许可 | CC-BY-NC-SA-4.0 | 新增部分 CC-BY-4.0 |
| HF 仓库 | joshuachou/SkinCAP | yuhos16/SkinCaRe |
| 托管方 | KAUST | CUHK-Shenzhen |
| 副标题定位 | 首个皮肤 captioning | 描述 + 推理统一资源 |
一表看清两版差异,是本条目最常被引用的对照。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- derm1m — 共享标签:皮肤影像 / 多模态 / 影像-文本对齐
- medreco-db — 共享标签:多模态 / 影像-文本对齐 / 医学问答与基准
- dermacon-in — 共享标签:皮肤影像 / 图像分类 / 医学问答与基准
- med-node — 共享标签:皮肤影像 / 图像分类 / 医学问答与基准
- biomedica — 共享标签:多模态 / 影像-文本对齐 / 图像分类
- derm7pt — 共享标签:皮肤影像 / 多模态
- quilt-1m — 共享标签:多模态 / 影像-文本对齐
- fitzpatrick-17k — 共享标签:皮肤影像 / 医学问答与基准
- ham10000 — 共享标签:皮肤影像 / 图像分类
- padchest — 共享标签:多模态 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

