Derm1M (derm1m) — 百万级皮肤病视觉-语言数据集 — AI-Ready Wikipedia

皮肤病学首个百万级视觉-语言数据集——1,029,761 对图像-文本、390 种皮肤状况与 130 临床概念组织于四级专家本体,DermLIP 系列在零样本分类/概念识别/跨模态检索上显著超越 BiomedCLIP 与 MONET,CC BY-NC 4.0 于 HuggingFace 门槛获取

来源 五源教育资料:YouTube(45.6%,51,309 视频)+ PubMed(19.4%,566,571 篇)+ 医学论坛(15.1%,49,875 帖)+ 公开数据集(10.1%,SCIN+MSKCC)+ 教学材料(9.8%,68 份);经五步流水线清洗 + 四级专家本体知识增强,产出 refined/ontology/concept 三型文本发布时间: 2026-09-30最后更新: 2026-09-30 阅读 11
Derm1M (derm1m) — 百万级皮肤病视觉-语言数据集 — AI-Ready Wikipedia

信息速览

数据集名称Derm1M (derm1m) — 百万级皮肤病视觉-语言数据集 — AI-Ready Wikipedia
数据类型影像数据,文本数据,原始数据,人工标注
规模403,563 张唯一图像(1,029,761 对图像-文本;原始采集自 51,309 YouTube 视频/566,571 PubMed 文献/49,875 论坛帖)
接入方式五源教育资料:YouTube(45.6%,51,309 视频)+ PubMed(19.4%,566,571 篇)+ 医学论坛(15.1%,49,875 帖)+ 公开数据集(10.1%,SCIN+MSKCC)+ 教学材料(9.8%,68 份);经五步流水线清洗 + 四级专家本体知识增强,产出 refined/ontology/concept 三型文本
AI 就绪度

INFOBOX — Derm1M 一屏速览

维度 内容
本质 皮肤病学首个百万级视觉-语言数据集(非挑战赛、非采集,多源教育资源清洗+本体增强)
团队 Monash University(AIM for Health Lab)+ NUS + MedUni Vienna;通讯 Zongyuan Ge
论文 ICCV 2025 Highlight;arXiv:2503.14911(v1 2025-03-19 / v2 2025-04-13)
规模 1,029,761 对图像-文本,403,563 唯一图像,平均 caption 41 tokens
覆盖 390 种皮肤状况 / 130 临床概念 / 四级本体(371 种已安置,91.1%)
五源 YouTube 45.6% + PubMed 19.4% + 论坛 15.1% + 公开数据集 10.1% + 教材 9.8%
前三型 refined medical text 403,563 + ontology-based text 403,563 + concept-based text 222,635
模型 DermLIP 家族(B/16 与 PanDerm):零样本分类平均 58.79%(超 BiomedCLIP 44.08%)
检索 Holdout I2T R@10 59.98%;SkinCAP 超 MONET +5.97%
概念 零样本概念识别 AUROC 73.1%(超 MONET 1.1%)
获取 HuggingFace redlessone/Derm1M(gated=auto,需登录+接受条款)
许可 CC BY-NC 4.0(非商业;商用需单独授权)
库内互链 SCIN(源)、SkinCAP(前作+评测集)、SkinCon(概念集)、Derm7pt(评测集)、ISIC 系列(伪影/域)

Derm1M 是皮肤病学的一个"补课"数据集:在病理、眼科、放射等医学领域早已出现百万级视觉-语言语料(PMC-15M、Quilt-1M 等)的时候,皮肤病学最大的视觉-语言数据集 SkinCAP 只有 4,000 对图像-文本——不到前者的千分之一。Derm1M 一次性把这个数字抬到 1,029,761 对(257 倍于 SkinCAP,52 倍于最大的皮肤状况数据集 DermNet),并用一套由四位资深皮肤科医生协作制定的四级疾病本体把这些图像-文本结构化组织起来,再配 130 个临床概念标签。为了证明这套数据有用,团队用它训练了 CLIP 式模型 DermLIP,在零样本分类、少样本学习、概念识别与跨模态检索四类任务上全面超越 BiomedCLIP、MONET 等既有基础模型。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意是 gated(需登录接受条款)且非商业,不是无门禁直链。
  2. 关心它比谁强:直奔 §5 评估基准——零样本分类、跨模态检索两张对比表最有说服力。
  3. 做数据集工程:直奔 §3 与 §4——五步构建流水线、四级本体、三型文本增强是可直接借鉴的方法资产。

§0 导读:这个数据集解决什么问题

皮肤病学 AI 长期受困于一个结构性缺口:诊断本质上依赖视觉与文本的双重信息——医生看皮损图像的同时,要整合病史、症状、部位、肤色等上下文,并用标准化临床术语(如"非典型色素网络"“深色边缘伪影”)表达诊断推理。但既有的皮肤病数据集几乎都是"单标签"结构:HAM10000 只有 7 类色素性病变,SD-198 有 198 类但无文本与概念,DermNet 有 23 类共 19,500 张图,连最大的概念数据集 SkinCon 也只有 4,346 张图配 48 个概念。它们回答的是"这张图是什么病",却无法支撑"为什么这样判断"以及"用自然语言描述这张图"。

视觉-语言模型(VLM)提供了一条出路:用自然语言监督把图像与临床描述对齐,从而获得单标签之外的情境信息,支持从诊断到视觉问答、从概念解释到数据集偏差审计的多种应用。但皮肤病学恰恰缺一个够大的图像-文本语料来训练这种模型——此前唯一的皮肤病视觉-语言数据集 SkinCAP 只有 4,000 对,远远不够预训练所需规模。

Derm1M 的回答是规模化 + 结构化两手抓。规模化:从皮肤科医生与全科医生日常使用的教育资源里,采集 YouTube 教学视频(51,309 个 / 10,660 小时)、PubMed 开放获取文献(566,571 篇 / 约 360 万图)、医学论坛帖(49,875 条)、教学材料(68 份)与两个公开数据集(SCIN + MSKCC),经五步流水线清洗后得到 1,029,761 对图像-文本。结构化:由四位资深皮肤科医生先协作制定一个 128 类标准本体,再用大模型辅助扩展至 390 种疾病、四级层级(371 种已安置),并标准化出 130 个临床视觉概念(形态、颜色、形状、表面、分布、边界六类)。最终每条记录携带三类知识增强文本——本体路径文本、概念文本与融合后的精炼医学文本。

§0 读法三则:

  1. 这个条目的核心价值在"规模 × 结构"两个维度同时推进:规模解决"够不够训",结构解决"训出来能不能解释"。
  2. 全文硬数字分两层:原始采集量(51,309 视频 / 566,571 文献等)与最终产出量(1,029,761 对)——不要混用,前者是原料,后者是成品(坑 6)。
  3. 检索时注意"1M"是宣传口径(百万级),精确数是 1,029,761;与之并列的 403,563 是唯一图像数而非对数,二者常被混淆(坑 2)。

§1 数据集速览:十问十答

Q1:Derm1M 的 1,029,761 对从哪来?
五个教育类来源:YouTube(45.6%)、PubMed(19.4%)、医学论坛(15.1%)、公开数据集(10.1%)、教学材料(9.8%)。全部经 FFmpeg 关键帧提取、DenseNet121 皮肤图分类、Whisper 语音转写、GPT-4o 文本纠错等工具链清洗后配对。

Q2:403,563 和 1,029,761 是什么关系?
403,563 是唯一图像数,1,029,761 是图像-文本对数。一对多来自文本增强:每张图有一条精炼医学文本(403,563)和一条本体路径文本(403,563),另有 222,635 条概念文本——三型合计约 1,029,761。

Q3:390 和 130 分别是什么?
390 是覆盖的皮肤状况(疾病)数,组织在四级本体里;130 是临床概念数(形态/颜色/形状/表面/分布/边界六类视觉特征)。前者是"是什么病",后者是"长什么样"。

Q4:四级本体是怎么建的?
分两步:四位资深皮肤科医生先协作制定 128 类标准本体树;再用大模型在"保留原层级、精确安置、给出理由、系统处理不确定类"四原则下扩展,经 5 轮迭代人工验证,最终 371 种(91.1%)被安置、19 种未安置。

Q5:三型文本(refined/ontology/concept)是什么?
本体路径文本把疾病沿本体路径展开(如 folliculitis: inflammatory→infectious→bacterial→folliculitis);概念文本用 130 概念从原文抽取视觉特征;精炼医学文本把前两者融入原始描述,并整合病史、症状、部位、治疗等上下文。

Q6:DermLIP 是什么?
一套 CLIP 式对比学习模型,在 Derm1M 上从头训练。分两个发布版:DermLIP-B/16(ViT-B/16 视觉 + GPT77 文本)与 DermLIP-PanDerm(PanDerm-B 视觉 + PMB256 文本)。论文还评测了 ViT-B16 搭配 BiomedBert-77、PubMedBert-256 的组合。

Q7:它比现有模型强多少?
零样本分类四集平均:DermLIP-PanDerm 58.79% vs BiomedCLIP 44.08%(+14.7pp)。跨模态检索 holdout:I2T R@10 59.98%,超 BiomedCLIP 逾 43%。概念识别 AUROC 73.1%,超 MONET 1.1%。

Q8:我现在能拿到什么?
HuggingFace redlessone/Derm1M(数据集,gated=auto)、redlessone/DermLIP_ViT-B-16 与 redlessone/DermLIP_PanDerm-base-w-PubMed-256(模型权重)、GitHub SiyuanYan1/Derm1M(训练+评测代码)。

Q9:许可有什么限制?
CC BY-NC 4.0——署名、非商业。商用需单独授权。HF 分发还带使用条款勾选(确认非商业研究用途、负责任使用)。

Q10:为什么它对 AI-Ready 重要?
它同时具备大规模、结构化本体、临床概念与多型文本四要素,并提供公开权重与代码——是"医学视觉-语言数据集可复现闭环"的样本;但 gated + 非商业把可获取性压在中档,这也是它的 AI-Ready 评级要点。

§2 数据构成与规格

2.1 规模总览与三类文本的账

Derm1M 的 1,029,761 对图像-文本不是"一图一句"的简单平铺,而是一图多文本的结构。理解这个结构是理解后续一切评估的前提:

记录类型 数量 含义
唯一图像 403,563 去重后的皮肤病图像(dermoscopic + clinical)
refined medical text(精炼医学文本) 403,563 每图 1 条,融合本体+概念+原始描述
ontology-based text(本体路径文本) 403,563 每图 1 条,沿四级本体路径展开
concept-based text(概念文本) 222,635 有概念标注的图各 1 条
图像-文本对合计 1,029,761 403,563 + 403,563 + 222,635

三型文本的数量关系(403,563×2 + 222,635 = 1,029,761)恰好对上总数——这是核对本数据集口径最简单的一把钥匙:任何第三方转述里若出现"1,029,761 张图"或"403,563 对",都是把对数/图数互混(坑 2)。

平均 caption 长度 41 tokens。这个数字有两个口径来源:论文正文写 “mean length of 41”(tokens),GitHub TL;DR 表写 “41 words”——单位不同,以论文的 tokens 为准(坑 4)。41 token 的长度足以承载"病史 + 症状 + 部位 + 形态描述"的简短复合语义,但远不足以表达完整临床推理链,这也是为什么团队要在文本编码器上选 256 token 上下文的 PubMedBert。

2.2 五源构成与占比

来源 占比 原始采集量 配对方式
YouTube 45.6% 51,309 视频(10,660 小时);355 检索词;50 个频道 时间戳重叠 >50% 配对
PubMed 19.4% 566,571 篇(1990-2024,PMCOA);约 360 万图 XML caption / 最近 caption box
医学论坛 15.1% 49,875 帖(X/Twitter 14,099 + IIYI + Reddit) 主诉/临床发现结构化摘要
公开数据集 10.1% 2 个(SCIN + MSKCC)→ 17,137 对 元数据填模板
教学材料 9.8% 68 份(临床指南等) PyMuPDF 取图 + 最近 caption box / OCR

占比高度不均(YouTube 独占 45.6%)是这套数据最需要警惕的结构性偏斜:YouTube 教学视频的画面风格(叠加字幕、箭头标注、多图拼接)与真实临床摄影差距较大,模型若过度依赖 YouTube 风格,跨域泛化可能受累。论文用 DenseNet121 与 DINO 做了"是皮肤图/子图切分"的过滤,但来源风格的异质性并未规范化——这是 dataLimitations 中"源噪声"的实际落点(坑 5)。

原始采集量与最终产出的巨大落差同样值得记录:566,571 篇 PubMed 文献含约 360 万张图,最终进入数据集的只是其中一部分;51,309 个 YouTube 视频、10,660 小时素材,最终产出以对数计。采集量 ≠ 数据集规模,转述时必须区分(坑 6)。

2.3 本体结构与四级层级

Derm1M 最区别于"网络爬取图文对"的地方是它的结构化本体。构建分两阶段:

  1. 专家标准本体(128 类):四位资深皮肤科医生协作制定,定义标准实体及其层级关系,覆盖 128 个皮肤状况。
  2. LLM 扩展(至 390 类):以 128 类树为骨架,配 407 类疾病列表与专门的本体提示词,遵循四原则——(1) 保留原层级、(2) 精确安置每个疾病、(3) 给出安置理由、(4) 系统处理分类不确定的疾病;经 5 轮迭代 + 人工验证,最终本体树含 371 种皮肤疾病(占全集 91.1%),19 种因分类不确定未安置。

四级层级的语义(论文口径):从 broad categories(大类) 逐级细分到 specific subtypes(具体亚型)。以论文给出的例子看,一条典型路径形如"炎症性皮肤病 → 感染性 → 细菌性 → 毛囊炎(folliculitis)“。这种结构使模型能够做多粒度疾病理解——既能回答粗类"这是炎症性皮肤病”,也能下探到具体亚型。

本体只安置 371/390 这个事实有两层含义:其一,91.1% 的覆盖率已足以支撑层级学习与层级评测;其二,剩余 19 类没有层级标签,凡涉及"全疾病层级分类"的研究须显式排除这 19 类或单列处理。

2.4 130 个临床概念

130 个标准化临床概念覆盖六个视觉语义维度:morphology(形态)、colors(颜色)、shape characteristics(形状特征)、surface features(表面特征)、distribution patterns(分布模式)、border properties(边界属性)。这些概念是 Derm1M"可解释性"主张的载体:概念瓶颈模型(Concept Bottleneck Model, CBM)需要"类别标签 + 概念标注"双重监督,而医学里概念标注昂贵;Derm1M 的 130 概念让 CLIP 式模型能生成临床概念,从而支撑无标注 CBM 与错误审计。

数量的对比最能说明问题:既有最大的概念数据集 SkinCon 只有 48 个概念,Derm1M 是 130 个(约 2.7 倍),且与临床诊断工作流的术语对齐(如"非典型色素网络");伪影类概念(ruler/nail/hair/marker)则服务于数据集偏差审计。

2.5 元数据与字段结构

每条记录携带的元数据(据 HF dataset card 的 Data Instances 示例):

字段 语义
filename 图像文件名
truncated_caption 精炼医学文本(截断版,训练用)
disease_label 疾病类标签(390 类之一,单值)
hierarchical_disease_label 四级本体路径(逗号分隔)
skin_concept 概念标签(逗号分隔)
source 来源标识(如 pubmed)
source_type 来源类型(如 knowledge)

配套文件:concept.csv(逐图概念抽取结果)、ontology.json(皮肤疾病层级树,结构化 JSON)。这套结构既支持单标签分类(用 disease_label),也支持层级分类(用 hierarchical_disease_label)、概念识别(用 skin_concept)与图文检索(用 truncated_caption)。

2.6 版本与文件清单

HF 仓库(redlessone/Derm1M)的 siblings 文件清单与体量:

dataset_root/
├── Derm1M_v2_pretrain.csv      # 训练:文本 + 每图元数据
├── Derm1M_v2_validation.csv    # 验证:文本 + 每图元数据
├── concept.csv                 # 逐图概念标注
├── ontology.json               # 皮肤疾病层级树
├── pubmed.zip / youtube.zip / reddit.zip / twitter.zip / IIYI.zip
├── edu.zip / note.zip / public.zip / validation_data.zip
└── README.md

HF API 实测:usedStorage 35,000,772,329 B ≈ 32.6 GB(含全部图像分卷 zip)。文件名中的 v2 是版本标记——GitHub README 明确此为第二次修订命名。

2.7 数据质量的三档分层

Derm1M 的五源在质量上并不均质,理解这个"质量梯度"对使用者至关重要。若把五源按"文本可信度 + 图文对齐可靠性"排一个序:

档位 来源 文本可信度 对齐可靠性 说明
高 公开数据集(SCIN/MSKCC) 高(元数据填模板) 高 唯一非网络成分,质量最可控
中高 PubMed 高(科学写作) 中高(依赖 caption) 文献图-文对应较规范
中 教学材料 中高(指南文本) 中(依赖最近 caption box) 结构好但图文位置需匹配
中低 YouTube 中(旁白转写+GPT-4o 纠错) 中低(时间戳重叠配对) 口语化、易含无关内容
低 医学论坛 低(患者自述) 低(结构化摘要) 噪音最大、需重度清洗

由于 YouTube 占比高达 45.6%,而它恰是质量梯度中偏低的一档,这意味着Derm1M 的整体质量被最大来源拉向中档。使用者若追求高精度,应优先使用 PubMed/公开数据集子集(合计约 29.5%);若只求规模,则全量使用。论文用 DenseNet121、Whisper、GPT-4o 等做了清洗,但清洗无法把论坛口语变成科学语言,也无法保证视频字幕与关键帧的语义一一对应——这是"规模换质量"的必然代价,也是坑 5 的实质。

2.8 概念的分布与缺口

130 个概念并非均匀覆盖所有疾病。概念抽取依赖原始医学文本中存在对应描述——若某疾病的语料稀少或描述不含具体视觉特征词,其概念标注就会缺失。这解释了为什么概念文本只有 222,635 条(约占图像数的 55%),而本体文本与精炼文本覆盖全部 403,563 图。对使用者的含义:

  1. 概念监督是稀疏的:约 45% 的图像没有概念文本,概念识别类研究须注意样本覆盖。
  2. 概念偏斜可能继承源偏斜:常见炎症性皮肤病(语料多)的概念覆盖优于罕见病(语料少)。
  3. SkinCon 对照的价值:SkinCon 的 32 概念是专家逐图密集标注的,Derm1M 的概念是从文本抽取的,两者的标注机制不同——DermLIP 在 SkinCon 上评测时,用的是 SkinCon 自身的专家标注,而非 Derm1M 的抽取概念。

2.9 与"网络爬取图文对"的本质区别

论文反复将 Derm1M 与"noisy web-crawled pairs"(嘈杂网络爬取图文对)对立,这个对立的实质是什么?一句话:结构化 vs 散点。网络爬取的图文对通常是"图像 + 任意邻近文本",文本可能是广告、无关评论或噪声;Derm1M 的每一对都经过 (1) 皮肤科术语检索定向采集、(2) 图像分类过滤、(3) 文本清洗纠错、(4) 配对策略对齐、(5) 本体知识增强五道工序,最终每对携带 disease_label、hierarchical_disease_label、skin_concept 三重结构标签。这个区别决定了它能否支撑"层级分类""概念解释"这类需要结构信息的任务——普通爬取数据做不到。

§3 构建流水线:五步如何把教育资源变成百万语料

3.1 五步总览

论文的构建流程(Figure 2)分五步:

步骤 内容 关键工具
1 多源采集 从五类教育资源按皮肤科术语检索采集 355 检索词(YouTube)、58 关键词(论坛)、PMCOA
2 预处理 图像/视频、音频、文本三线预处理 FFmpeg、K-means、DenseNet121、DINO、EfficientNetV2-S、PCA、Whisper Large-V3、inaSpeechSegmenter、RAKE、OCR、NLTK、GPT-4o
3 图文清洗 图像线/文本线并行清洗 DenseNet121 分类、DINO 子图检测、GPT-4o 纠错、语言检测翻译
4 图文配对 各源定制配对策略 时间戳重叠 >50%、XML caption、子图正则
5 知识增强 术语标准化 + 本体构建 + 三型文本生成 390 类疾病表、130 概念表、LLM 辅助本体扩展

这套流水线的工程密度是它相对"网络爬取图文对"(如早期 CLIP 类医学数据)的核心差异:每一步都嵌入了质量控制,而非简单抓取配对。

3.2 数据采集的细节

YouTube:以 355 个皮肤科术语检索,每词取 top 200 视频,并人工筛选 50 个专门做皮肤病讲解的频道;优先保留 ≥224p 且 >30 秒的高清视频,共约 51,309 个(10,660 小时)。

PubMed:从 PMC 开放获取子集(1990-2024)用领域术语检索,得 566,571 篇文献、约 360 万张图。这是唯一"文献级"来源,文本质量最高(科学写作),但图-文对齐依赖 caption。

医学论坛:从 X/Twitter 的 58 个皮肤科相关关键词筛出 27 个频道(14,099 帖),加上 IIYI 与 Reddit,共 49,875 帖。论坛文本口语化、含大量患者自述,清洗难度最大——团队专门剔除广告、剔除"What is…"式提问句、抽取主诉与临床发现的结构化多面摘要。

教学材料:68 份皮肤科教学材料(临床指南等),用 PyMuPDF 提取图文,自动匹配最近的 caption 框;不可直接提取时用 OCR 转矢量格式再提取。

公开数据集:SCIN 与 MSKCC 两个高质量公开数据集,把临床元数据填入标准模板生成结构化文本,产出 17,137 对。这是唯一"非网络来源"的成分,也是质量最可控的一档。

3.3 采集量的"漏斗":从千万图到百万对

把采集到产出的漏斗画出来,能直观看到清洗的力度:

原始素材                                  最终产出
├── 566,571 PubMed 文献(约 360 万图)  ┐
├── 51,309 YouTube 视频(10,660 小时)  │   五步流水线      ┌── 1,029,761 对
├── 49,875 论坛帖                       ├──→ 清洗+配对+增强 ──┤   (403,563 唯一图)
├── 68 份教学材料                       │                   └── 三型文本
└── 2 个公开数据集(17,137 对)         ┘

这个漏斗有两点值得注意:其一,PubMed 贡献约 360 万张图,但最终唯一图像只有 403,563——去重与质量过滤淘汰了绝大部分;其二,YouTube 视频按关键帧提取后,每个视频可能贡献数十到数百对,是数量最大的来源(45.6%)。理解这个漏斗,就不会把"采集量"误读为"数据集规模"(坑 6)。

3.4 图像清洗的技术栈

图像清洗是流水线最重的一环,分三个子任务:

  1. 皮肤图判定:用 DenseNet121 分类器判定单个图像/关键帧是否为皮肤病图。对 YouTube,保留 >50% 关键帧含皮肤内容的视频(整视频级过滤)。
  2. 去噪与聚类:对其他来源,用 EfficientNetV2-S 提特征、PCA 降到 50 维、K-means 聚成 20 大类 × 20 子类,迭代人工检查直到只剩皮肤科内容。这一步剔除的是"误抓的非皮肤图"(图表、解剖示意图、无关照片)。
  3. 子图切分:医学图像常是多子图拼接(如 a/b/c 三例对照)。用 DINO 训练的目标检测器检测并分割子图,按从左到右、从上到下排序,再由分类器确认皮肤相关性。

关键帧提取的细节:FFmpeg 按帧间颜色直方图差计算,阈值自适应视频长度(5 分钟视频 0.008,200 分钟视频 0.25)——短视频用低阈值多取样,长视频用高阈值少取样,平衡覆盖率与冗余。

3.5 音频与文本清洗的技术栈

音频线:Whisper Large-V3 做语音转文字,inaSpeechSegmenter 评估旁白质量并过滤掉缺乏讲解的视频(避免只有背景音乐或无声的教学演示)。

YouTube 字幕三步清洗:(i) RAKE 算法提关键词、去停用词;(ii) GPT-4o 纠正医学术语错误(语音转写常把专业术语转错);(iii) 生成结构化摘要。

通用文本处理:语言检测与非英语翻译、过滤非医学信息块、上下文扩写医学术语缩写。

论坛文本处理:抽取主诉与临床发现的结构化多面摘要;摘要失败时抽取症状与疾病实体用分号连接;去除"What is…"式提问句(避免把问题当描述);人工检查剔除广告。

质量控制:删除少于 3 词或 10 字符的 caption;对 OCR 文本做拼写检查与连贯性增强。

这一整套文本处理的价值在于把"非结构化、口语化、含噪声"的原始文本提升为"结构化、专业、干净"的配对文本——它是 Derm1M 文本质量的直接来源,也是它相对普通爬取数据的核心优势。

3.6 配对策略:因源而异的对齐

图文配对是"这张图和哪段文字是一对"的问题,Derm1M 对不同来源用不同策略:

来源 配对依据 处理细节
YouTube 时间戳区间重叠 关键帧间时段为图像块、转写句为文本块,重叠 >50% 配对,必要时拼接多文本块;未匹配图像块对齐最近前序有文本关键帧
PubMed XML caption 图像与 XML 中的 caption 对应
教学材料 最近 caption box 自动匹配图像最近的文本框
子图 标记正则 用 (A)/(a) 等标记正则匹配子图与其子 caption

这套"因源而异"的策略说明了一个通用道理:不存在万能的图文配对法。视频靠时间、文献靠 XML 结构、教材靠空间邻近、子图靠标记——每个来源的图文关联机制不同,必须定制。可迁移到其他领域建库时的第一课。

3.7 知识增强:三型文本如何生成

第五步是 Derm1M 区别于普通图文数据集的关键。流程为:术语标准化 → 本体构建 → 三型文本生成。

术语标准化:先构建 390 类疾病列表(跨多个数据集调和术语,用 LLM 识别与合并同义病名),再建立 130 个标准化临床概念。

本体构建:见 §2.3——专家 128 类 + LLM 扩至 390 类(371 安置)。

三型文本生成:

  1. ontology-based text:识别原文中最终诊断的疾病,检索其本体层级路径(如 folliculitis: inflammatory → infectious → bacterial → folliculitis),转成结构化文本;
  2. concept-based text:用 130 概念表从原始医学文本抽取视觉特征;
  3. refined medical text:把本体文本与概念文本融合进原始描述,并整合病史、症状、部位、治疗等上下文。

同时抽取 body sites、symptoms、skin tone 等患者元数据做情境增强。最终每图承载多个层次的文本,使模型既能学"病名",也能学"层级归属"与"视觉概念"——这是它支撑可解释诊断与多粒度学习的机制基础。

3.8 流水线可复现性评估

对想复用这套流水线的团队,需要知道它的可复现门槛:

  • 代码公开度:GitHub 提供训练与评测代码,但数据构建(五步流水线)的完整代码未见于 README——构建过程在论文 Supplementary 描述,复现需自行实现。
  • 依赖工具多:FFmpeg、Whisper、DINO、GPT-4o 等十余种工具与模型,任一版本差异都可能影响产出。
  • LLM 依赖:文本纠错(GPT-4o)与本体扩展都依赖大模型,属于"随版本漂移"的组件,严格复现困难。
  • 人工介入:聚类结果需迭代人工检查、本体扩展需分轮人工验证——非全自动流程。

结论:Derm1M 的使用(下数据、跑模型)门槛低(HF + GitHub 足够),但它的复现(重造一份等价数据集)门槛高。这与它作为"教育资源挖掘范式"的定位一致——它证明了这条路可行,但完整复制仍需相当工程量。

§4 本体与临床概念:Derm1M 的结构化灵魂

4.1 为什么本体是"结构"而非装饰

一百万个图文对如果只是散点,价值有限;Derm1M 把它们挂在一棵疾病树上,价值才真正显现。本体解决三个具体问题:

  1. 多粒度监督:同一张图既可训练"是什么大类",也可训练"是什么亚型"——层级标签天然支持 coarse-to-fine 学习。
  2. 知识可解释:当模型预测"毛囊炎",本体路径能给出"炎症性→感染性→细菌性→毛囊炎"的推理骨架,把黑箱预测变成可追溯的层级判断。
  3. 评测可分层:可以分别评测大类精度与亚型精度,暴露模型在哪一层失效。

这也是论文反复强调的差异点:既有皮肤数据集即便有上百类(如 SD-198 的 198 类),也没有层级结构——它们是平坦的多分类,而 Derm1M 是四层树。

4.2 本体构建的双轨风险

本体构建采用"专家定骨架 + LLM 扩展"的双轨,这是效率与严谨之间的权衡,也埋着需要正视的风险:

  • 专家轨道(128 类):四位资深皮肤科医生协作,质量最高但规模有限。
  • LLM 轨道(扩展至 390 类):用大模型在四原则约束下扩展,经 5 轮迭代 + 人工验证,安置 371 类。但 LLM 的疾病归类可能带有训练数据里的偏见,或者对罕见病的层级判断不稳定——这正是不确定性未决的 19 类被"挂起"的原因。

使用者的实用建议:把 371 个已安置类当作可信层级标签,把 19 个未安置类仅作疾病标签使用,不要强行猜测其层级。论文提供 ontology.json,可直接读取这棵树。

4.3 130 概念与可解释诊断

130 个临床概念的语义分六维(形态/颜色/形状/表面/分布/边界),它们对应的是皮肤科医生描述皮损时的标准词汇。这种"概念层"的引入,直接服务于三类可解释性应用:

  • 概念瓶颈模型(CBM):模型先预测人可理解的概念(如"红斑"“丘疹”),再由概念推类别,使决策链可读。Derm1M 的 130 概念为皮肤病 CBM 提供了训练素材。
  • 细粒度错误分析:用框架(如 Domino 类方法)检测模型是否"因错误原因给出正确预测"、在不同人群上的性能差异与潜在偏差。
  • 伪影审计:伪影概念(ruler/nail/hair/marker)帮助识别数据集与模型的偏差来源——论文专门用 ISIC 数据集对比了 DermLIP 与 MONET 对伪影的识别(见 §5.4)。

概念数量的对照:SkinCon 48 个 → Derm1M 130 个。这 2.7 倍的扩展覆盖了六个视觉维度,使概念监督更全面。

4.4 与既有数据集的结构对比

论文 Table 1 给出了 Derm1M 与既有皮肤数据集的正面比较:

数据集 类型 多模态图 文本描述 概念标签 层级疾病 元信息 规模 概念数 状况数
HAM10000 分类 ✗ ✗ ✗ ✗ ✓ 10,015 0 7
SD-198 分类 ✗ ✗ ✗ ✗ ✗ 6,584 0 198
DermNet 分类 ✗ ✗ ✗ ✗ ✗ 19,500 0 23
Derm7pt 分类 ✓ ✗ ✓ ✗ ✗ 1,711 7 2
SkinCon 分类 ✗ ✗ ✓ ✗ ✗ 4,346 48 178
SkinCAP 视觉-语言 ✗ ✓ ✓ ✗ ✗ 4,000 48 178
Derm1M 视觉-语言 ✓ ✓ ✓ ✓ ✓ 1,029,761 130 390

这张表一句话概括:只有 Derm1M 在六个维度上全部打勾——多模态图像、文本描述、概念标签、层级疾病、元信息五项兼得,且规模领先一个数量级以上。

§5 评估基准:DermLIP 如何证明数据有用

5.1 实验设计与模型家族

论文用 Derm1M 训练 CLIP 式模型家族 DermLIP,在两轴组合上实验:

  • 视觉编码器:ViT-B16、PanDerm-B(PanDerm 皮肤病自监督基础模型的 base 版)
  • 文本编码器:GPT2-77(GPT77)、BiomedBert-77(BMB77)、PubMedBert-256(PMB256)

评测四类任务(八数据集):(1) 零样本疾病分类;(2) 少样本/全样本线性评测(1%/10%/100%);(3) 零样本概念识别;(4) 跨模态检索。基线分三类:通用 VLM(CLIP、SigLIP、CoCa)、生物医学 VLM(PMC-CLIP、BiomedCLIP、MONET)、另有 BiomedGPT-B 与 PanDerm-B/L 用于少样本对比。

5.2 零样本疾病分类

模型 视觉/文本编码器 HAM10000 Fitzpatrick17K PAD-UFES-20 Daffodil 平均
CLIP-B16 ViT-B16/GPT77 .2023 .0653 .4555 .4534 .2941
SigLIP ViT-B16/SigLIP64 .2502 .1007 .5315 .6995 .3955
CoCa ViT-B32/GPT77 .1796 .0647 .3623 .5424 .2873
PMC-CLIP ResNet50/PMB256 .5349 .0302 .4273 .3529 .3363
BiomedCLIP ViT-B16/PMB256 .6347 .0955 .4512 .5817 .4408
MONET ViT-L14/GPT77 .2967 .1397 .4425 .7215 .4001
DermLIP ViT-B16/GPT77 .6820 .2278 .6074 .7257 .5607
DermLIP ViT-B16/BMB77 .6647 .2740 .6095 .7497 .5745
DermLIP ViT-B16/PMB256 .5236 .3133 .6161 .7702 .5558
DermLIP PanDerm-B/PMB256 .6274 .3162 .6247 .7832 .5879

三个观察:

  1. 领域数据的增益是压倒性的:最优 DermLIP(58.79%)比最优生物医学基线 BiomedCLIP(44.08%)高 14.7 个百分点——在 113 类的 Fitzpatrick17K 上差距尤为惊人(.3162 vs .0955,超 3 倍)。
  2. 长文本上下文重要:PMB256(256 token)优于 GPT77/BMB77(77 token),因为 Derm1M 的描述偏长,需要更宽的上下文窗口。
  3. 领域视觉编码器重要:PanDerm-B(皮肤病自监督预训练)配 PubMedBert 达最佳。论文还特别指出,DermLIP 用更小的 ViT-B16 就能超越用了更大 ViT-L14 的 MONET——数据的质量弥补了模型规模的差距。

5.3 少样本/全样本学习与跨模态检索

线性评测(Table 3,四集平均 Acc):

模型 1% 10% 100%
BiomedGPT-B .421 .514 .596
PanDerm-B .501 .628 .747
PanDerm-L .567 .685 .802
MONET .530 .669 .753
DermLIP (PanDerm-B/PMB256) .586 .696 .793

标签稀缺场景(1%)优势最明显:DermLIP 58.6% 超次优 MONET 5.6 个百分点——这正是"大数据预训练换小样本能力"的直接证据。

跨模态检索(Table 4,R@10):

数据集 指标 DermLIP(PanDerm-B/PMB256) 次优基线
Holdout (n=9,806) I2T R@10 .5998 BiomedCLIP .1657
Holdout T2I R@10 .5930 BiomedCLIP .1541
SkinCAP (n=3,989) I2T R@10 .2018 MONET .1421
SkinCAP T2I R@10 .2128 MONET .1492

在内部 holdout 上,DermLIP 超 BiomedCLIP 逾 43%;在外部 SkinCAP 上超 MONET I2T 5.97%、T2I 6.36%。检索能力对皮肤病教学与临床决策支持(用文本找图)有直接价值。

5.4 零样本概念识别与伪影审计

  • 综合 AUROC:DermLIP(ViT-B16/GPT77) 73.1%,超 MONET 1.1%。
  • SkinCon(32 概念):DermLIP 提升 +2.3%。
  • Derm7pt(7 概念):68.8% vs MONET 68.9%——基本相当(DermLIP 未在此集上占优)。
  • 伪影识别(ISIC):DermLIP 准确识别 ruler/nail/hair/marker,MONET 对细微 ruler 与 nail 表现较差。

这一组结果最有价值的地方在伪影审计:能可靠识别"这是一把尺子/一片指甲",意味着模型可以在数据集中定位"非临床因素导致的预测偏差"——这正是 Derm1M 宣称的对"数据集错误审计与模型可解释性"的支撑。

5.5 基准结论的三条读法

  1. 看绝对数别只看排名:Fitzpatrick17K 上即使最优模型也只有 31.6%,说明 113 类细粒度分类远未解决——Derm1M 是"显著进步"而非"问题解决"。
  2. 注意增益口径差异:论文摘要说零样本分类 +9.85%、检索召回 +48.1%,而正文 Table 2 四集平均对比 BiomedCLIP 是 +11.99%、Table 4 holdout 超 BiomedCLIP 逾 43%——摘要与正文两套口径,引用须标来源(坑 3)。
  3. Derm7pt 持平是诚实信号:如果所有指标都碾压,反而要警惕;Derm7pt 上 68.8% vs 68.9% 的持平说明论文如实报告了不占优的结果。

5.6 概念识别与伪影审计的细节

五个应用方向里,“伪影审计"最能体现 Derm1M 的差异化价值,值得单独展开。皮肤镜图像里常混入非临床元素——尺子(测量用)、指甲(手指持镜)、毛发(遮挡)、标记(人工标注)。这些元素若被模型学成"诊断线索”,就会在真实场景中失效(真实临床图没有尺子)。Derm1M 的 130 概念包含伪影类概念,使模型能识别并定位这些偏差源。

论文的做法是在 ISIC 数据集上,让 DermLIP 与 MONET 分别给出"最可能含某伪影概念"的 top 10 图像,人工核对:

伪影类型 DermLIP MONET
ruler(尺子) 准确识别 对细微尺子识别差
nail(指甲) 准确识别 表现较差
hair(毛发) 准确识别 —
marker(标记) 准确识别 —

这张对比说明 DermLIP 不仅在"疾病分类"上强,在"识别非疾病元素"上同样强——后者对数据集清洗、模型可信度评估、临床部署前的偏差排查都有直接用途。概念瓶颈模型的思路正是建立在这类概念监督之上:先让模型说出"我看到了红斑、丘疹、分布在面部",再由这些概念推病名,使决策过程可读、可审计。

5.7 与皮肤病基础模型的对照:PanDerm 的双身份

理解 Derm1M 的评估不能只看横向对比,还要看它与 PanDerm 的纵向关系。PanDerm 作为自监督基础模型,本身就是一个强基线:

  • PanDerm-B(base 版)在线性评测中 1%/10%/100% 为 .501/.628/.747;
  • PanDerm-L(large 版)为 .567/.685/.802;
  • 而 DermLIP(PanDerm-B/PMB256)为 .586/.696/.793。

一个值得注意的现象:DermLIP 在 1% 与 10% 上超过 PanDerm-L(大模型),但在 100% 上(.793 vs .802)略低于 PanDerm-L。这说明视觉-语言预训练的优势主要体现在标签稀缺场景(少样本),当标注充足时,纯自监督大模型仍能追赶甚至反超。对工程选型的含义:标签少用 DermLIP,标签多用 PanDerm-L;或两者结合(DermLIP 初始化 + 全量微调)。

5.8 评测的诚实边界

论文结果里有三处"不占优"或"有限"的如实报告,值得单独点出,因为它们是判断数据集真实价值的锚点:

  1. Derm7pt 概念识别持平:DermLIP 68.8% vs MONET 68.9%——DermLIP 未占优。这与 SkinCon 上 +2.3% 形成对比,说明概念识别的增益依数据集而异。
  2. Fitzpatrick17K 绝对精度低:即便最优模型也只有 31.6%(113 类)——‘显著进步’不等于’可用’,细粒度皮肤病分类仍是开放难题。
  3. 摘要与正文档位差异:摘要"零样本 +9.85%"与正文"四集平均 vs BiomedCLIP +11.99%"并存,提示读者不应只信单一宣传数字(坑 3)。

承认这些边界,才能对"Derm1M 到底解决到什么程度"有准确判断:它把皮肤病图文数据从"稀缺"推到"够用",把零样本分类从"将将 40%“推到"接近 60%”,但距离临床可用的高精度还有明显距离。

5.9 复现论文数值的操作路径

对想复现 Table 2-4 的团队,路径如下:

# 1. 下数据(HF,gated,需先接受条款)
huggingface-cli download redlessone/Derm1M --repo-type dataset
# 2. 下权重
huggingface-cli download redlessone/DermLIP_PanDerm-base-w-PubMed-256
# 3. 克隆代码
git clone https://github.com/SiyuanYan1/Derm1M.git
# 4. 下载评测下游数据(README 的 Google Drive 链接,PAD/HAM/F17K/Daffodil/derm7pt/skincon)
# 5. 跑评测
bash script/zero_shot_benchmark.sh
bash script/linear_prob_benchmark.sh
bash script/concept_annotation_benchmark.sh
bash script/cross_retrieval.sh

复现时须注意三个口径陷阱:caption 长度单位(words/tokens,坑 4)、增益口径(摘要/正文,坑 3)、HF 版与 ICCV 版图像质量差异(坑 10)。若数值与论文有出入,先排查这三处。

5.10 从评估看数据集的真实定位

把 §5 的六张结果表合起来读,Derm1M 的定位可以概括为三句:

  1. 在"零样本"与"少样本"场景价值最大:58.79% 的零样本平均与 1% 标签下 58.6% 的评测,直接对应"无标注/少标注"的真实痛点。
  2. 检索与概念识别是差异化能力:holdout I2T R@10 59.98%(超 BiomedCLIP 逾 43%)与概念 AUROC 73.1%,是普通分类数据集给不了的能力。
  3. 绝对精度仍有天花板:Fitzpatrick17K 31.6%、Derm7pt 概念持平,说明它把地板抬高了一大截,但天花板还在。

对使用者的决策含义:如果你的痛点是"没有标注数据",Derm1M 是当前皮肤病领域最有力的工具;如果你的痛点是"需要 90%+ 的临床精度",Derm1M 是必要的基础设施而非终点,仍需领域微调与临床数据补充。

§6 获取与许可:门怎么进、有哪些限制

6.1 四种资产的四个入口

Derm1M 项目产出四类资产,入口与门禁各不相同:

资产 入口 许可 门槛
数据集 HuggingFace redlessone/Derm1M CC BY-NC 4.0 gated=auto(登录 + 勾选接受条款)
模型权重(B/16) HuggingFace redlessone/DermLIP_ViT-B-16 CC BY-NC 4.0 同上
模型权重(PanDerm) HuggingFace redlessone/DermLIP_PanDerm-base-w-PubMed-256 CC BY-NC 4.0 同上
代码 GitHub SiyuanYan1/Derm1M 见仓库 无(公开)
评测下游数据 GitHub README 的 Google Drive 链接 各原始数据集许可 见原数据集

6.2 gated 获取的实操

HF 数据集 redlessone/Derm1M 的 gated=auto 意味着:访问者须登录 HuggingFace 账号,并勾选接受一段使用条款,内容要点为——确认知悉数据集为 CC BY-NC 4.0、仅用于非商业研究、同意负责任与合乎伦理地使用、商用需单独取得创建者许可;同时填写用途、机构、研究目的三项。gated=auto 的"auto"指条款勾选后系统自动放行(无需人工审批),这与 PANDA-PLUS 那样的"邮件请求制"不同,但仍不是无门禁直链——自动化脚本需先配置 HF token 并接受条款。

抓取时点数据(2026-09-30):downloads 292、likes 28、created 2025-10-14、lastModified 2025-10-23、usedStorage 约 32.6 GB。模型仓库 DermLIP_PanDerm 创建于 2025-06-30,downloads 129、likes 13。

6.3 许可条款细读

数据集:CC BY-NC 4.0(署名-非商业 4.0 国际)

  • 允许:署名前提下复制、分发、改编用于非商业目的。
  • 限制:禁止商业使用;商用须向作者单独取得书面授权(GitHub 原文 “Commercial use requires separate permission”)。
  • 对训练模型的含义:以 CC BY-NC 数据训练的模型权重,其商用属性处于灰色地带——稳妥路径是商用前与作者确认,或改用许可更宽的数据。

论文:

  • 预印本(arXiv:2503.14911):arXiv.org perpetual non-exclusive license(arXiv 标准许可,非 CC 系列)。
  • 会议版:ICCV 2025 论文(IEEE 版权)。
  • 伴生 PanDerm 论文:CC BY 3.0(Nature Medicine Hybrid OA,Monash 资助)。

引用优先级:用数据引数据的许可(CC BY-NC 4.0),引观点引论文(arXiv/ICCV)。

6.4 AI-Ready 评估:双刃剑结构

以库内 AI-Ready 检查单过一遍:

  • 机器可读元数据:HF dataset card(含 features/splits/citation)+ concept.csv + ontology.json——优秀。
  • 公开直链:gated=auto——比邮件请求制更开放(可自动放行),但比无门禁直链更保守,AI-Ready 可获取性评中上。
  • 许可明确性:CC BY-NC 4.0 明确,但非商业限制会排除商用团队。
  • 可复现性:训练代码 + 评测代码 + 公开权重三件套齐全——这是它相对多数医学数据集的突出优势(多数只给数据不给可复现管线)。
  • 文档自洽:存在 “41 words” vs “41 tokens”、摘要增益 vs 正文分项两处口径不一致(坑 3、坑 4),不影响主线但自动化抽取需指定口径。

综合:AI-Ready 等级"中上"——数据、代码、权重、文档四齐全,可复现闭环完整;可获取性被 gated 与非商业许可双重收窄,是主要减分项。

6.5 扩展版本链(维护视角)

  • Derm1M_AgentAug(2026-08-11 发布):多智能体重述增强版,由作者 Xieji Li 发布于 Xieji-Li/Derm1M-AgentAug——用多智能体系统重新生成 caption,是 Derm1M 文本质量的升级方向。
  • Derm1M_Instruct:300K 高质量指令与多任务基准数据,官方预告"将发布"(抓取时点未上线)。
  • Derm1M-clean(williamljx/Derm1M-clean):第三方整理版,非官方,处理细节未核。

版本链的意义:Derm1M 正从"静态数据集"演化为"持续迭代的数据生态"——本体版 → 增强文本版 → 指令版。使用者订阅时应记录版本号(v2、AgentAug、Instruct)以免混用。

6.6 与其他获取模式的对照:gated-auto 的光谱位置

库内医学数据集的获取模式已形成一条光谱,从最严到最松排列,Derm1M 的位置值得标注:

档位 典型模式 库内参照 Derm1M
注册+审批(最严) 需申请与人工审核 部分受控访问数据集 —
邮件请求制 向作者邮件申请 PANDA-PLUS 掩码 —
gated-auto 登录+接受条款,自动放行 — ✅ Derm1M
注册即下 登录即可 Kaggle 型 —
无门禁直链(最松) 直接 URL 下载 HF 公开数据集 代码(GitHub)

Derm1M 落在"gated-auto"这一档:比邮件请求制开放(自动放行、无需等人工),比无门禁直链保守(需登录+接受条款)。这是团队在"合规要求"(非商业声明、负责任使用承诺)与"可获取性"之间取的平衡点。对自动化管线的实际影响:只要配好 HF token 并一次性接受条款,后续下载是可脚本化的——不像邮件请求制那样不可预测。

6.7 非商业许可的实际边界

CC BY-NC 4.0 的"非商业"(NC)条款在实操中有几个常见疑问,需要厘清:

  1. 学术研究算非商业吗? 一般算——高校科研、非营利研究通常落在 NC 允许范围内。但受企业资助、成果直接服务商业目标的研究,边界模糊,需个案判断。
  2. 用数据集训练的模型能商用吗? 灰色地带。CC 的 NC 约束的是"数据本身"的使用,但衍生的模型权重是否受 NC 约束,法律上无定论。稳妥做法是商用前与作者确认。
  3. 能在论文/报告中展示样例图吗? 可以——署名前提下,非商业的学术引用与展示通常允许。
  4. 能再分发数据集吗? 需遵守 CC BY-NC 4.0 的署名与相同方式约束;若原条款未明确再分发细则,建议指引使用者从官方 HF 仓库获取。

对企业的实用建议:若产品明确涉及皮肤病 AI 商业化,Derm1M 只能用作研究与原型验证,商用管线应改用许可更宽的数据、自采集数据,或与作者签订商业授权。

6.8 版本与时效:订阅式维护

Derm1M 是一个"活"的数据生态,其版本演进需要使用者主动跟踪:

  • 本体版(v1/v2):2025-10-15 公开,文件名带 v2 标记。
  • AgentAug 版:2026-08-11 发布,用多智能体重述系统改善文本质量——Xieji-Li/Derm1M-AgentAug。
  • Instruct 版:300K 指令数据,预告未发布。
  • clean 版:第三方整理的 williamljx/Derm1M-clean。

使用者的实践:在论文/项目的"数据"章节明确记录所用版本与抓取日期(如"Derm1M v2,HF redlessone,2026-09-30 抓取"),避免不同版本混用导致的不可复现。维护触发点见附录 N。

§7 生态与影响:一个实验室的皮肤病基础模型谱系

7.1 与 PanDerm 的血缘关系

Derm1M 不是孤立作品,它与 PanDerm(Nature Medicine 31(8):2691-2702, 2025-08)构成同一团队的"数据-模型"双支柱:

  • PanDerm:一个自监督多模态皮肤病基础模型,用超 200 万张真实皮肤病图像(来自 11 家临床机构、4 种成像模态)预训练,在 28 个基准上取得 SOTA;三次读者研究显示其在早期黑色素瘤检测上超临床医生 10.2%、在皮肤镜上提升医生诊断准确率 11%、在 128 种皮肤状况上提升非皮肤科医生 16.5%。
  • Derm1M:一个视觉-语言数据集,1,029,761 对。DermLIP-PanDerm 的视觉编码器 PanDerm-B 正是取自 PanDerm。

两者的分工清晰:PanDerm 走自监督大规模路线(无标签也能学表征),Derm1M 走语言监督路线(图文对齐获得概念可解释性);DermLIP 把两者结合,用 PanDerm 的视觉编码器配 Derm1M 的对齐训练。这一"自监督 + 视觉-语言"双路线,与病理领域的 UNI/CONCH 组合思路同构。

7.2 在皮肤病视觉-语言赛道的位置

数据集 年 规模(对) 概念数 状况数 层级 许可
SkinCAP 2023 4,000 48 178 ✗ —
Derm1M 2024-2025 1,029,761 130 390 ✓ CC BY-NC 4.0
同域参考:PMC-15M 2023 1,500 万(全医学,皮肤仅约 0.13%) — — ✗ —
同域参考:MedTrinity-25M 2024 2,500 万(全医学,皮肤仅约 0.03%) — — ✗ —

Derm1M 的定位可从两个参照系看:相对皮肤科专用数据集(SkinCAP),它规模扩大 257 倍并新增本体层级;相对通用医学大规模数据集(PMC-15M、MedTrinity-25M),它的皮肤内容浓度极高——论文指出 PMC-15M 里皮肤相关对仅约 20k(0.13%)、MedTrinity-25M 仅约 10k(0.03%),且缺乏临床知识与结构化文本。Derm1M 的差异化就在"垂直深度":规模不是最大,但皮肤相关浓度、结构化程度与概念覆盖是同类之最。

7.3 下游应用与生态位

论文列举了五个潜在应用方向,可作为使用者的价值地图:

  1. 模型解释:130 概念支撑概念瓶颈模型(CBM),生成更精确的临床概念。
  2. 细粒度错误分析:概念覆盖支撑数据/模型错误审计,识别人群间性能差异与偏差。
  3. 构建基础模型:规模足以训练更大参数量的皮肤病视觉-语言基础模型,或结构化为指令格式微调多模态大模型(如 LLaVA-Med)。
  4. 多模态任务:支持视觉问答——就皮损特征、肤色分析、鉴别诊断等复杂查询作答。
  5. 临床应用:支持 390 种皮肤状况的鉴别诊断,且是首个支持四级层级分类的公开皮肤数据集,可输出不同粒度的评估。

7.4 对库内皮肤影像生态的冲击

Derm1M 的出现改变了库内皮肤科条目的格局:此前库内皮肤影像条目多为单标签分类或分割数据集(isic 系列、BCN20000、derm12345、dermacon-in、PH2、PAD-UFES-20 等),彼此通过标签与图像域相关。Derm1M 引入视觉-语言这一新维度,成为库内皮肤科家族的"语义中枢"——它同时是 SCIN 的下游消费者、SkinCAP 的直接继任者、SkinCon/Derm7pt 概念评测的复用者。对检索者的实际含义:从任一皮肤科条目出发,都应能通过 Derm1M 抵达图-文对齐、概念识别与本体层级这组新检索面。

7.5 与通用医学视觉-语言数据集的关系

Derm1M 的出现需要放进"医学视觉-语言数据大爆发"的背景下理解。2023-2024 年,病理、放射、综合医学领域相继出现大规模图文数据集:

数据集 领域 规模 皮肤内容占比
Quilt-1M 病理 100 万 无
PMC-15M 综合生物医学 1,500 万 约 0.13%(约 20k)
MedTrinity-25M 综合医学 2,500 万 约 0.03%(约 10k)
Derm1M 皮肤病 103 万 100%

这张表揭示了 Derm1M 的生态位:在"绝对规模"上它远不及通用医学数据集,但在"领域浓度"上是它们的数百倍。通用数据集中皮肤内容不足千分之一,且缺乏临床知识与结构化文本,无法支撑皮肤病专用模型;Derm1M 用垂直深耕填补了这个缺口。这与 Quilt-1M 之于病理的逻辑一致——垂直领域需要垂直数据,通用数据的"稀释"无法替代。

对库内检索者的含义:Derm1M 应与病理的 Quilt-1M、眼科的 OphCLIP(论文引文提及)等构成"垂直领域视觉-语言数据集"家族,而非与通用医学大集合并列。这是按"领域浓度"而非"绝对规模"理解医学数据的正确视角。

7.6 潜在的下游生态

Derm1M 的五个应用方向(模型解释、错误分析、构建基础模型、多模态任务、临床应用)各自对应一类下游:

  • 可解释性方向:接概念瓶颈模型、接 Domino 类错误发现框架——需要 130 概念与 Disease 标签。
  • 基础模型方向:接更大参数量的皮肤病视觉-语言模型训练,或接 LLaVA-Med 类多模态大模型的指令微调(这正对应预告中的 Derm1M_Instruct)。
  • 多模态任务方向:接视觉问答——“这张图的皮损是什么形态”“肤色如何”“可能的鉴别诊断”——需要精炼医学文本与元数据。
  • 临床方向:接 390 类鉴别诊断与四级层级分类——需要 disease_label 与 hierarchical_disease_label。
  • 错误分析方向:接数据/模型偏差审计——需要伪影概念与人群元数据。

生态健康度的一个观察指标是"Derm1M_Instruct 是否如期发布"——若 300K 指令数据上线,则 Derm1M 从"预训练语料"升级为"可对齐的指令数据",其下游生态将显著扩展。这是附录 N 里优先级最高的维护触发点。

7.7 对皮肤病 AI 研究范式的意义

从更高的视角看,Derm1M 代表了皮肤病 AI 研究的一次范式迁移:

  1. 从"监督分类"到"视觉-语言预训练":早期皮肤病 AI 靠 ImageNet 迁移 + 有监督微调(ISIC 挑战赛范式),Derm1M 代表用大规模图文对做跨模态预训练的新范式。
  2. 从"单一标签"到"结构化知识":从"这张图是黑色素瘤"到"这张图是黑色素瘤、位于炎症性皮肤病→肿瘤→黑色素细胞肿瘤→黑色素瘤路径、表现出非典型色素网络等概念"——信息维度大幅扩展。
  3. 从"私人数据"到"公开可复现":PanDerm 用 200 万张机构私有图像(不可获取),Derm1M 用公开教育资源(CC BY-NC 可获取)——后者虽质量略逊,但可复现性远胜。

第三条尤其重要:Derm1M 与 PanDerm 形成"公开数据 + 私有数据"的互补——用公开的 Derm1M 复现和验证方法,用私有的 PanDerm 数据追求极致性能。这种"公开验证 + 私有冲刺"的双轨,正成为医学 AI 的常见模式。

§8 方法学启示:三条可迁移的经验

8.1 "教育资源挖掘 + 工具链清洗"是可复制的建库范式

Derm1M 的核心工程贡献之一,是证明教育资源(而非临床原始记录)可以产出高质量医学图文语料:YouTube 教学视频有旁白(可转写)、PubMed 文献有 caption(权威)、教学材料有结构化图文(高信噪比)——三者的共同点是"文本本就在图像附近",天然适合图文配对。可迁移的要点:

  1. 多源互补:单源难以兼顾规模与质量,五源组合后可按占比加权使用。
  2. 工具链分层:图像(DenseNet121 分类、DINO 子图)、音频(Whisper 转写)、文本(GPT-4o 纠错)各自专精,避免单一模型包打天下。
  3. 配对策略因源而异:时间戳(视频)、caption box(文献)、模板(公开数据集)——不存在万能配对法。

不适用场景:需要严格患者级去标识与知情同意追溯的研究(教育资源挖掘无法保证患者同意链路),以及需要精确病灶-诊断一一对应的高风险临床决策。

8.2 LLM 辅助本体扩展是效率与风险的平衡

用 LLM 把 128 类专家本体扩展到 390 类是本案的一个亮点,也是一处需警惕的设计。可迁移的正面经验:专家定骨架 + LLM 扩展 + 人工分轮验证的三段式,能把本体构建成本大幅降低;把"无法确定分类"的 19 类显式挂起(而非强行归类),是负责任的做法。风险面:LLM 的疾病归类可能继承训练数据的偏见或对罕见病不稳定;91.1% 的安置率意味着约 9% 的疾病无层级标签——任何"全疾病层级分类"研究必须显式处理这部分。

8.3 领域编码器 + 长文本上下文的双增益规律

DermLIP 的实验给出了两条可推广的工程结论:

  1. 领域特异编码器优于通用编码器:PanDerm-B(皮肤病自监督)配 PubMedBert(生物医学文本)达最佳,且 DermLIP 用 ViT-B16 就能超过用 ViT-L14 的 MONET——数据的领域对齐比模型规模更重要。
  2. 文本上下文长度匹配描述长度:Derm1M 描述偏长(平均 41 tokens 且含层级与概念),PMB256(256 token)优于 GPT77/BMB77——文本编码器的上下文窗口应匹配数据集的文本长度分布,否则长描述被截断。

这两条对任何垂直领域视觉-语言项目都有直接指导意义。

8.4 数据生产的视角:与临床采集型数据集的对照

医学视觉-语言数据有两条生产路线:临床采集型(如从医院 PACS 导出的报告-图像对)与教育资源挖掘型(本条目)。前者图像真实、报告权威,但受伦理与隐私约束、规模受限、机构偏斜重;后者规模大、来源多样、去标识成本低。Derm1M 代表后者,其代价是"源噪声"(网络内容的风格异质与质量参差)与"非临床上下文"(教学图非真实就诊场景)。工程落地时的取舍:需要真实临床分布的评测 → 临床采集型;需要大规模预训练语料 → 教育资源挖掘型(本条目);两者可组合成"挖掘预训练 + 临床微调"的管线。

8.5 数据构建的成本-质量曲线

Derm1M 的构建过程隐含一条"成本-质量曲线",对预算有限的团队有直接参考价值。把五步流水线的投入与产出对应起来:

工序 相对成本 质量贡献 可否精简
1 多源采集 中(爬取/API) 决定规模上限 否
2 预处理(图像/音频/文本) 高(十余种工具) 决定噪声下限 部分可(按需选工具)
3 图文清洗 高(含人工检查聚类) 决定对齐质量 部分可(抽样替代全量)
4 图文配对 中(按源定制) 决定对的有效性 否
5 知识增强(本体+概念+文本) 高(LLM + 专家) 决定结构价值(差异化核心) 否(这是灵魂)

两个可精简点很关键:预处理与清理环节可以用"抽样检查"替代"全量检查"来省成本(代价是噪声略高);但第 5 步知识增强不能省——去掉它,Derm1M 就退化成一个普通的图文数据集,失去四级本体与概念可解释性这两个核心卖点。对复刻者的建议:预算有限时,优先保证采集(1)、配对(4)、增强(5),压缩预处理(2)与清理(3)的人工投入。

8.6 领域数据 vs 通用数据的取舍判据

Derm1M 与 PMC-15M/MedTrinity-25M 的对比引出一个通用判据:什么时候该用垂直领域数据,什么时候该用通用大集?

判据 选垂直领域数据(如 Derm1M) 选通用医学大集(如 PMC-15M)
目标领域浓度 高(>90% 相关) 低(<1% 相关)
任务特定性 强(皮肤病概念/层级) 弱(泛医学问答)
需要结构化标签 是 否
团队算力/标注预算 有限(领域数据可省微调) 充足(通用数据需大量微调)
需要临床概念可解释 是 否

一句话判据:任务越垂直、越需要结构,越应选垂直领域数据。Derm1M 的 100% 皮肤浓度与四级本体,正是"垂直深耕"的典型答案;而通用的 PMC-15M 在皮肤病任务上因浓度过低而力不从心(皮肤相关仅 0.13%)。

8.7 可解释性的工程落地路径

Derm1M 的 130 概念支撑可解释性,但"从概念到可解释模型"有一条工程路径需要说明:

  1. 概念抽取:用 DermLIP 对图像做零样本概念识别,得到"图-概念"矩阵。
  2. 概念瓶颈层:把概念作为中间层,训练"图 → 概念 → 疾病"的两段式模型(CBM)。
  3. 审计与纠错:用概念识别结果检测数据集错误(如"标注为 X 病的图,概念却指向 Y")与模型偏差(如"某人群的预测错误率更高")。
  4. 解释输出:向医生展示"模型看到红斑、丘疹、面部分布,因此判断为痤疮"。

这条路径的价值在于把"黑箱诊断"变成"可追溯诊断",而 Derm1M 的 130 概念正是这条路径的数据基座。落地难点:概念识别的精度(AUROC 73.1%)尚未达到临床级,概念瓶颈层可能因概念预测错误而传递误差——这需要在使用时加置信度过滤与人工复核。

§9 与库内条目的关系

9.1 家族图谱

  • SCIN(库内):Derm1M 的两大公开数据源之一,直接上游。
  • skincap(库内):Derm1M 的唯一直接前作竞品(4,000 对),同时是 Derm1M 跨模态检索评测的外部下测集(SkinCAP n=3,989)。
  • skincon(库内):Derm1M 概念识别评测集(32 概念)与概念文本来源;SkinCAP 的母体。
  • Derm7pt(rid 110):Derm1M 概念识别评测集(7 点检查表概念)。
  • isic-2018 / isic-2019 / isic-2020:同域皮肤镜数据集,Derm1M 伪影概念评测(ISIC)的关联集。
  • BCN20000 / derm12345(rid 742)/ dermacon-in(rid 781):库内皮肤科分类同域条目,共享皮肤影像域。
  • PH2 / PAD-UFES-20 / HAM10000:零样本分类下游评测集家族。
  • panda-plus:虽属病理,但同为"医学视觉数据集 + 可复现基准"范式,可作方法论对照。

9.2 检索路径建议

  • 检索词组合:“Derm1M”(精确)+ “dermatology” + (“vision-language” OR “image-text”);注意与 “DermNet”(不同数据集)区分。
  • 若目标是直接可用数据:HF redlessone/Derm1M(gated,接受条款后自动放行)→ 权重 redlessone/DermLIP_* → GitHub 代码。
  • 若目标是概念可解释性:读 §4.3 与论文 §5 应用节,关注 130 概念与 CBM 的连接。
  • 若目标是前作对比:读 SkinCAP(库内)→ 本条目 §7.2。

9.3 库内皮肤科家族的三层结构

把库内皮肤相关条目按数据类型分层,Derm1M 的位置一目了然:

层 数据类型 库内代表 与 Derm1M 的关系
分类层 单标签图像分类 isic-2018/2019/2020、BCN20000、derm12345、dermacon-in、PH2、HAM10000、PAD-UFES-20 Derm1M 的下游评测/同域数据
分割层 图像分割 (库内相关分割条目) 与 Derm1M 共享图像域,任务不同
视觉-语言层 图像-文本对齐 SkinCAP、Derm1M Derm1M 是库内该层的最新与最大条目
概念层 概念标注 SkinCon Derm1M 复用其作评测集

Derm1M 的独特价值在于它是库内唯一同时横跨视觉-语言层与概念层的皮肤病条目:既有图文对齐(视觉-语言层),又含 130 概念(概念层),还自带本体层级(分类层的升级)。这让它成为库内皮肤科家族中连接度最高的"枢纽条目"。

9.4 跨家族的方法论联结

Derm1M 不只在皮肤科家族内有位置,它与其他家族也存在方法论联结:

  • 与病理家族(panda-plus 等):同为"医学视觉数据集 + 可复现基准"范式。panda-plus 用三层标注流水线 + CC BY-4.0 基准,Derm1M 用五步构建流水线 + 公开权重——两者都证明"数据构建方法本身是贡献"。
  • 与眼科/放射视觉-语言家族:同属医学视觉-语言赛道。Derm1M 引文提及 OphCLIP(眼科手术视频-语言预训练),说明该范式正在多专科扩散。
  • 与通用医学问答/基准家族:Derm1M 若发布 Instruct 版,将与库内的医学问答/指令数据集家族产生交集。

这些联结的检索意义:从 Derm1M 出发,可按"垂直医学视觉-语言"这条线索横向抵达病理、眼科、放射的同类条目,构成跨专科的方法论检索面。

9.5 检索路径补充

  • 从 scin(库内)出发 → 可达 Derm1M(SCIN 是其数据源)。
  • 从 skincap(库内)出发 → 可达 Derm1M(前作与继任关系)。
  • 从 skincon(库内)出发 → 可达 Derm1M(概念集复用)与 SkinCAP(母体关系)。
  • 从 Derm7pt(rid 110) 出发 → 可达 Derm1M(概念评测集关系)。
  • 从 isic 系列 出发 → 可达 Derm1M(伪影概念评测与同域关系)。

建议在库内皮肤科条目间建立"视觉-语言枢纽"Derm1M 的交叉引用,使检索者能从任一皮肤病条目发现图文对齐、概念识别与本体层级这组新检索面。

§10 避坑清单:十个已踩过的坑

坑 1:"1M"是宣传口径,精确数是 1,029,761。 标题与摘要常写"million-scale",精确数为 1,029,761 对。引用时用精确数,别用"约 100 万"模糊化——尤其在需要复算占比或核对三型文本账(403,563×2+222,635)时。

坑 2:403,563 是图像数不是对数,1,029,761 是对数不是图数。 二者常被互混。403,563 是唯一图像,1,029,761 是图像-文本对。若把"1,029,761"当作"张图"或把"403,563"当作"对",会导致规模描述错误。

坑 3:增益口径双版本(摘要 vs 正文)。 论文摘要写 DermLIP 超生物医学基础模型"零样本分类 +9.85%、跨模态检索召回 +48.1%";正文 Table 2 四集平均对比 BiomedCLIP 为 +11.99%,Table 4 holdout 超 BiomedCLIP 逾 43%。引用时须标明来自摘要还是正文表格。

坑 4:caption 长度单位双口径。 GitHub TL;DR 写 “41 words”,论文写 “41 tokens”。以论文 tokens 为准;转述时勿混用单位。

坑 5:数据源噪声是论文自曝的固有局限。 论文限制节明确 “noise introduced from educational resources”——网络内容(YouTube 字幕、论坛口语)虽经流水线清洗,仍非专家逐张审核。任何高精度临床用途都需自行验证子集质量。

坑 6:原始采集量 ≠ 数据集规模。 51,309 个 YouTube 视频(10,660 小时)、566,571 篇 PubMed 文献(约 360 万图)是采集量;1,029,761 对是最终产出。两者相差多个数量级,切勿把采集量当数据集规模引用。

坑 7:许可非商业,商用须单独授权。 CC BY-NC 4.0 明确禁止商业使用;以该数据训练的模型权重商用属性为灰色地带。商用前须与作者确认,或改用许可更宽的数据。

坑 8:HF 分发是 gated,不是无门禁直链。 redlessone/Derm1M 为 gated=auto——需 HF 登录 + 勾选接受条款(非商业、负责任使用)+ 填用途/机构/研究目的。自动化脚本须配 HF token 并接受条款;把它当"直接 wget"会失败。

坑 9(附加):本体覆盖率 91.1%,非全部 390 类都有层级标签。 371/390 已安置,19 类未安置。凡涉及层级分类的研究须显式排除或单列这 19 类。

坑 10(附加):HF 版与 ICCV 版图像质量略有差异。 GitHub 明示 HF 发布版"图像质量改善",与 ICCV 论文版"略有差异"。跨版本比较图像质量或复现论文数值时须注明版本。

§11 总结

11.1 三句话总结

  1. Derm1M 用 1,029,761 对图像-文本把皮肤病视觉-语言数据的规模从"数千对"抬到"百万对"(257 倍于 SkinCAP),并首次引入四级疾病本体与 130 临床概念。
  2. 其衍生模型 DermLIP 在零样本分类(58.79% 平均)、跨模态检索(holdout I2T R@10 59.98%)与概念识别(AUROC 73.1%)上全面超越 BiomedCLIP 与 MONET,证明数据规模+领域对齐的价值。
  3. 数据、代码、权重三件套公开(HF + GitHub),但 gated + CC BY-NC 4.0 把可获取性锁在"非商业研究"档,是其 AI-Ready 评级的主要减分项。

11.2 适合谁

  • 皮肤病视觉-语言/多模态模型团队:需要大规模图文预训练语料。
  • 可解释诊断研究者:需要概念标注与本体层级支撑 CBM 与错误审计。
  • 数据集工程研究者:五步流水线 + LLM 辅助本体是可借鉴的建库范式。
  • 医学基础模型评测者:DermLIP 提供可对标的皮肤病图文基线。

11.3 不适合谁

  • 商用团队(CC BY-NC 4.0 禁止商业使用)。
  • 需要专家逐张审核的高精度标签研究(源噪声固有)。
  • 需要全疾病层级标签的研究(本体仅覆盖 91.1%)。
  • 需要真实临床就诊分布的研究(数据源于教育材料,非就诊场景)。

11.4 30 秒决策卡

你的情况 行动
要立刻下数据跑通 HF redlessone/Derm1M(登录接受条款)+ GitHub 代码骨架
要皮肤病图文预训练 下数据集 + redlessone/DermLIP_* 权重对照
要做概念可解释性 读 §4.3 与概念文本,接 CBM 框架
要复现论文数值 用 GitHub 评测脚本 + Paper Table 2-4 对照,注意坑 3/4 口径
要商用 先与作者确认授权或换数据集(坑 7)
要引用本数据集 附录 W BibTeX;许可注明 CC BY-NC 4.0

FAQ(高频问答 24 问)

A. 基础认知

Q1:Derm1M 是挑战赛吗?
不是。它是数据集+模型+代码的研究项目,无比赛、无 leaderboard。

Q2:名字里的"1M"和 DermNet 有关吗?
无关。"1M"指百万级规模;DermNet 是另一个数据集(19,500 图/23 类),常被当作规模基线对比(52 倍)。

Q3:谁做的?
Monash University AIM for Health Lab 主导,合作 NUS 与 MedUni Vienna,通讯 Zongyuan Ge。

Q4:发表在哪里?
ICCV 2025(Highlight),预印本 arXiv:2503.14911。

Q5:和 SkinCAP 什么关系?
SkinCAP(4,000 对)是皮肤病唯一的前作视觉-语言数据集;Derm1M 规模是其 257 倍,且新增本体层级与更多概念。

Q6:和 SkinCon 什么关系?
SkinCon 是概念数据集(4,346 图/48 概念),既是 SkinCAP 的母体,也是 Derm1M 概念识别评测集之一(32 概念)。

Q7:最大的卖点一句话?
把皮肤病图文数据从"数千对"抬到"百万对",并用四级本体与 130 概念把无结构的数据变成有结构的知识库。

Q8:它自己有什么局限?
源噪声(论文自曝)、本体覆盖 91.1%、非商业许可、gated 获取、五源占比不均(YouTube 45.6%)。

Q9:开源吗?
数据+代码+权重三件套公开,但数据/权重 gated + 非商业。

Q10:PanDerm 和 DermLIP 什么关系?
PanDerm 是自监督皮肤病基础模型(Nature Medicine 2025),DermLIP 是在 Derm1M 上训练的视觉-语言模型;DermLIP-PanDerm 用 PanDerm 的视觉编码器 PanDerm-B。

B. 数据与获取

Q11:1,029,761 对是怎么构成的?
403,563 精炼医学文本 + 403,563 本体路径文本 + 222,635 概念文本 = 1,029,761。

Q12:为什么对数大于图数?
因为一图多文本(文本增强),每图至少 2 型文本,有概念标注的加第 3 型。

Q13:数据集有多大?
HF 实测约 32.6 GB(含全部图像分卷 zip)。

Q14:怎么下载?
HF redlessone/Derm1M,登录并接受条款(gated=auto 自动放行),或 huggingface-cli download 配 token。

Q15:能商用吗?
不能直接商用。CC BY-NC 4.0 禁止商业使用,需单独授权。

Q16:有哪些文件?
Derm1M_v2_pretrain.csv、Derm1M_v2_validation.csv、concept.csv、ontology.json + 各源图像 zip。

Q17:本体怎么用?
读 ontology.json,得到四级疾病树(371 类已安置);层级分类研究排除 19 未安置类。

Q18:有没有更新版本?
有:Derm1M_AgentAug(2026-08)、Derm1M_Instruct(预告);版本号须记录。

C. 模型与评估

Q19:DermLIP 有哪些版本?
发布两个权重:DermLIP-B/16(ViT-B16+GPT77)与 DermLIP-PanDerm(PanDerm-B+PMB256);论文另评测多种编码器组合。

Q20:零样本分类最强多少?
四集平均 58.79%(DermLIP PanDerm-B/PMB256),超 BiomedCLIP 44.08% 约 15pp。

Q21:检索能力如何?
Holdout I2T R@10 59.98%,超 BiomedCLIP 逾 43%;SkinCAP 超 MONET 约 6%。

Q22:概念识别如何?
综合 AUROC 73.1%(超 MONET 1.1%);SkinCon +2.3%;Derm7pt 持平(68.8% vs 68.9%)。

Q23:为什么 PubMedBert-256 比 GPT77 好?
因为 Derm1M 描述偏长(41 tokens,含层级与概念),256 token 上下文不截断,更匹配。

Q24:能复现论文数值吗?
GitHub 提供训练/评测脚本与下游数据链接;注意坑 3(摘要 vs 正文)与坑 4(words vs tokens)口径。

D. 生产与库内

Q25:本条目和库内 SCIN 什么关系?
SCIN 是 Derm1M 的两大公开数据源之一(贡献 10.1% 中的一部分)。

Q26:为什么强调坑点?
原始文档本身带双口径(words/tokens、摘要/正文增益)、gated 门禁与源噪声等缺陷,是 AI-Ready 质检的典型样本。

Q27:五源占比不均有什么影响?
YouTube 占 45.6%,其视频风格(字幕/箭头/多图拼接)与真实临床摄影差异大,可能导致模型对 YouTube 风格的过拟合。

Q28:如果只记住一件事?
Derm1M 把皮肤病图文数据规模抬了 257 倍并首次结构化(四级本体+130 概念),但它是 CC BY-NC 4.0 + gated,用前先看许可与门禁。

E. 复现与工程细节

Q29:HF 上怎么配置 token 下载 gated 数据?
先登录 HF 网页接受数据集条款,再本地 huggingface-cli login 或用 HF_TOKEN 环境变量;之后 huggingface-cli download redlessone/Derm1M --repo-type dataset 即可脚本化下载。

Q30:数据集有多大、下多久?
约 32.6 GB(含图像分卷 zip)。国内建议配 HF 镜像(hf-mirror.com)加速;分卷 zip 支持按需下载单源。

Q31:ontology.json 的结构是什么?
四级疾病层级树:从 broad categories 到 specific subtypes,含 371 个已安置疾病。可用 JSON 解析器读入,遍历得到每个疾病的层级路径。

Q32:concept.csv 有哪些列?
逐图概念抽取结果——每行对应一张图的概念标注(130 概念的子集)。具体列名以 HF 实际文件为准。

Q33:DermLIP 权重的视觉/文本编码器分别是什么?
DermLIP_ViT-B-16 = ViT-B/16 + GPT77;DermLIP_PanDerm-base-w-PubMed-256 = PanDerm-B + PubMedBert-256。加载用 open_clip 库。

Q34:为什么选 256 token 文本编码器?
因为 Derm1M 描述偏长(41 tokens,含层级与概念),且本体的四级路径更长。77 token 会截断,256 更匹配。

Q35:能把 Derm1M 用于临床产品吗?
不能直接。CC BY-NC 4.0 禁止商业使用;临床产品属商业场景,须与作者单独授权(坑 7)。

Q36:怎样做领域微调?
用 DermLIP 权重初始化,在自有标注数据上微调;或直接用 Derm1M 做二次预训练再在下游任务微调。标签少时 DermLIP 初始化收益最大。

Q37:五源能分开用吗?
能。每源图像分卷 zip 独立(pubmed/youtube/reddit/twitter/IIYI/edu/note/public),可只下需要的源子集(如只用 PubMed 高质量子集)。

Q38:怎么判断一张图属于哪个源?
记录里有 source 字段;也可按下载的 zip 来源区分。

Q39:概念覆盖不全怎么办?
概念文本仅约 55% 覆盖(222,635/403,563)。概念识别研究须注意样本覆盖;缺失概念的图可用于纯图文任务。

Q40:能直接用 truncated_caption 做检索评测吗?
能,这正是跨模态检索的文本侧输入。注意是"截断版"(truncated),完整精炼文本可能更长。

Q41:Derm1M 与 PanDerm 的权重能混用吗?
不能混用同一套——PanDerm 是自监督视觉模型(无文本侧),Derm1M 是图文对齐模型。但 DermLIP-PanDerm 的视觉编码器来自 PanDerm,属"复用"关系。

Q42:复现论文数值最常见的坑是什么?
三处:caption 单位(words/tokens,坑 4)、增益口径(摘要/正文,坑 3)、HF 版与 ICCV 版图像质量差异(坑 10)。

Q43:本条目后续会更新什么?
维护触发点见附录 N:最高优先级是 Derm1M_Instruct 发布(一旦上线,§6.5 版本链与下游生态整体扩写)。

Q44:为什么条目里收录了那么多原始数字?
因为 Derm1M 的价值一半在"可复算"——三型文本账(403,563×2+222,635)、五源占比、采集量漏斗都是可核对的硬数字,条目保留它们便于自动化抽取与交叉验证。

Q45:能做皮肤病视觉问答吗?
能。论文把 VQA 列为潜在应用(多模态任务方向);若 Derm1M_Instruct 发布,VQA 能力将进一步增强。

Q46:数据里的患者隐私如何处理?
数据源自公开教育资源(YouTube/PubMed/论坛/公开数据集),已去标识;论文未详述去标识流程细节,使用者须自行符合本地伦理要求。

Q47:五源里哪一源质量最高?
公开数据集(SCIN/MSKCC)质量最可控(元数据模板化);PubMed 次之(科学写作)。但两者合计仅约 29.5%,YouTube(质量偏低)占比最大(45.6%)。

Q48:能用它训练中文皮肤病模型吗?
Derm1M 文本为英文(language: en)。训练中文模型需自行翻译或另建中文图文对;概念与本体结构可复用。


事实清单(硬事实 30 条)

  1. Derm1M 含 1,029,761 对图像-文本,403,563 张唯一图像(ICCV 2025 / arXiv:2503.14911)。
  2. 组成:refined medical text 403,563 + ontology-based text 403,563 + concept-based text 222,635。
  3. 覆盖 390 种皮肤状况、130 个临床概念、四级本体。
  4. 本体:专家 128 类骨架 → LLM 扩展至 390 类;371 类(91.1%)已安置,19 类未安置。
  5. 平均 caption 长度 41 tokens(论文口径)。
  6. 五源占比:YouTube 45.6% + PubMed 19.4% + 论坛 15.1% + 公开数据集 10.1% + 教材 9.8%。
  7. 原始采集:51,309 YouTube 视频(10,660 小时)、566,571 PubMed 文献(约 360 万图)、49,875 论坛帖、68 份教材、2 个公开数据集(SCIN+MSKCC/17,137 对)。
  8. YouTube 用 355 个皮肤科术语检索、筛 50 个频道;论坛用 58 关键词筛 27 频道(14,099 帖)。
  9. 构建五步:多源采集→预处理→图文清洗→图文配对→知识增强。
  10. 工具链含 FFmpeg、K-means、DenseNet121、DINO、EfficientNetV2-S、PCA、Whisper Large-V3、inaSpeechSegmenter、RAKE、OCR、NLTK、GPT-4o。
  11. 配对:YouTube 时间戳重叠 >50%;PubMed/教材 XML caption/最近 caption box;子图正则匹配。
  12. 130 概念分六维:morphology/colors/shape/surface/distribution/border。
  13. 本体路径示例:folliculitis: inflammatory→infectious→bacterial→folliculitis。
  14. 团队:Monash(Yan/Hu/Jiang/Li/Ge)+ NUS(Fei)+ MedUni Vienna(Tschandl/Kittler),通讯 Zongyuan Ge。
  15. 论文 arXiv:2503.14911(v1 2025-03-19 / v2 2025-04-13),ICCV 2025 Highlight。
  16. 伴生论文 PanDerm:Nature Medicine 31(8):2691-2702, 2025-08, doi:10.1038/s41591-025-03747-y。
  17. DermLIP 视觉编码器:ViT-B16、PanDerm-B;文本编码器:GPT77、BMB77、PMB256。
  18. 零样本分类(四集平均):DermLIP-PanDerm 58.79% vs BiomedCLIP 44.08%。
  19. 线性评测(四集平均):DermLIP-PanDerm 1%=58.6% / 10%=69.6% / 100%=79.3%。
  20. 跨模态检索 holdout(n=9,806)I2T R@10:DermLIP-PanDerm 59.98%,超 BiomedCLIP 逾 43%。
  21. 跨模态检索 SkinCAP(n=3,989)I2T R@10:DermLIP-PanDerm 20.18%,超 MONET 5.97%。
  22. 零样本概念识别:DermLIP AUROC 73.1%(超 MONET 1.1%);SkinCon +2.3%;Derm7pt 68.8% vs 68.9%。
  23. 许可:数据集 CC BY-NC 4.0(商用需单独授权);预印本 arXiv perpetual non-exclusive license。
  24. HF 入口:redlessone/Derm1M(gated=auto);模型:redlessone/DermLIP_ViT-B-16、redlessone/DermLIP_PanDerm-base-w-PubMed-256。
  25. HF 抓取时点:downloads 292、likes 28、created 2025-10-14、lastModified 2025-10-23、约 32.6 GB。
  26. 代码:GitHub SiyuanYan1/Derm1M(训练+评测脚本)。
  27. 数据集公开时间线:权重 2025-07-01 → 评测码 2025-07-03 → 训练码 2025-09-07 → 数据 public 2025-10-15。
  28. 扩展:Derm1M_AgentAug(2026-08-11,Xieji-Li/Derm1M-AgentAug);Derm1M_Instruct(预告)。
  29. HF 版与 ICCV 版图像质量"略有差异"(作者明示)。
  30. 论文限制节自曝源噪声(noise from educational resources)。

术语表(26 条)

术语 释义
Vision-Language Dataset(视觉-语言数据集) 由图像-文本对构成、供图文对齐模型训练的数据集
VL(Vision-Language) 视觉-语言,指同时处理图像与文本的模型/任务
DermLIP 在 Derm1M 上训练的 CLIP 式皮肤病视觉-语言模型家族
PanDerm 皮肤病自监督多模态基础模型(Nature Medicine 2025),DermLIP-PanDerm 的视觉编码器来源
CLIP 对比语言-图像预训练模型,用图文对比学习对齐两个模态
Contrastive Learning(对比学习) 拉近正样本对、推远负样本对的表征学习范式
Ontology(本体) 疾病概念及其层级关系的结构化知识树
Hierarchical Disease Label(层级疾病标签) 疾病在四级本体中的路径标签
Clinical Concept(临床概念) 描述皮损视觉特征的标准术语(如红斑、丘疹),共 130 个
Morphology(形态) 概念维度之一,描述皮损的基本形态
Zero-shot Classification(零样本分类) 不针对目标类微调、直接预测未见类的分类
Few-shot Learning(少样本学习) 仅用少量标注(1%/10%)训练的评测范式
Linear Probe(线性探针) 冻结编码器、只训线性分类头以探测表征质量
Cross-modal Retrieval(跨模态检索) 以文搜图(T2I)/以图搜文(I2T)
R@10 / R@50 Recall@K,前 K 个结果中含正确答案的比例
Concept Identification(概念识别) 识别图像中是否含某临床概念的任务
AUROC 受试者工作特征曲线下面积,概念识别的常用指标
CBM(Concept Bottleneck Model,概念瓶颈模型) 先预测可理解概念、再由概念推类别的可解释模型
Artifact(伪影) 非临床因素的图像元素(尺子/指甲/毛发/标记),可致预测偏差
Caption(图像描述) 与图像配对的文本描述
Refined Medical Text(精炼医学文本) 融合本体+概念+原文的知识增强文本
Ontology-based Text(本体路径文本) 沿疾病本体层级路径展开的文本
Concept-based Text(概念文本) 用 130 概念从原文抽取视觉特征形成的文本
gated dataset 需登录/接受条款才能下载的 HF 数据集;Derm1M 为 gated=auto
CC BY-NC 4.0 署名-非商业 4.0 国际许可(Derm1M 数据集许可)
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维评估框架

附录

附录 A:条目信息速查卡

项 值
条目名 Derm1M
url_name derm1m
类型 视觉-语言数据集 + 模型族 + 代码(三件套)
论文 ICCV 2025 / arXiv:2503.14911
团队 Monash University AIM for Health Lab(合作 NUS + MedUni Vienna)
规模 1,029,761 对 / 403,563 唯一图像
覆盖 390 状况 / 130 概念 / 四级本体
许可 CC BY-NC 4.0(非商业,商用需单独授权)
抓取时点 2026-09-30
库内互链 scin / skincap / skincon / Derm7pt(110) / isic 系列 / derm12345(742) / dermacon-in(781)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 arXiv + ICCV OpenAccess + GitHub + HF 多入口;ICCV Highlight 提升曝光;但标题"1M"易与模糊规模描述混淆
A 可获取性 7 数据/权重 gated=auto(自动放行,优于邮件请求制),但非无门禁直链;代码公开直取
I 可互操作 8 CSV + JSON(ontology)+ 标准图像格式;HF datasets 无缝加载;概念与本体结构清晰
M 元数据质量 9 HF card(features/splits/citation)+ 论文完整表格(Table 1-4)+ concept.csv + ontology.json;仅 “words/tokens” 与摘要/正文口径微瑕
S 可持续性 8 依托 HF + GitHub 稳定托管;有 AgentAug/Instruct 迭代路线;非商业许可限制复用面
综合评级 8.0/10(优) 四件套齐全、可复现闭环完整,是医学视觉-语言数据集的标杆;可获取性被 gated 与非商业许可部分收窄

附录 C:逐项证据链自证

关键数字 来源 位置
1,029,761 对 / 403,563 图 论文 §3.2 Dataset Statistics arXiv HTML v2
三型文本 403,563+403,563+222,635 论文 §3.2 arXiv HTML v2
五源占比 45.6/19.4/15.1/10.1/9.8 论文 §3.2(Fig 1a) arXiv HTML v2
采集量 51,309/566,571/49,875/68/2 论文 §3.1 Step 1 arXiv HTML v2
本体 128→390,371 安置/19 未安置 论文 §3.1 Step 5 arXiv HTML v2
零样本表(58.79 vs 44.08) 论文 Table 2 arXiv HTML v2
线性评测表 论文 Table 3 arXiv HTML v2
检索表(59.98/20.18) 论文 Table 4 arXiv HTML v2
概念识别 73.1% 论文 §4.2(Fig 4) arXiv HTML v2
CC BY-NC 4.0 / gated GitHub License + HF API 抓取 2026-09-30
HF 292 downloads/32.6 GB HF API(hf-mirror) 抓取 2026-09-30
PanDerm Nature Medicine PubMed PMID 40481209 抓取 2026-09-30

附录 D:数据获取决策树

需求是什么?
├── 要大规模皮肤病图文预训练数据
│   └── HF redlessone/Derm1M(登录+接受 CC BY-NC 4.0 条款,自动放行)
├── 要皮肤病图文基线模型
│   └── HF redlessone/DermLIP_ViT-B-16 / DermLIP_PanDerm-base-w-PubMed-256
├── 要做概念可解释性 / 错误审计
│   └── concept.csv + ontology.json + 130 概念(读 §4.3)
├── 要复现论文数值
│   └── GitHub SiyuanYan1/Derm1M 评测脚本 + Table 2-4(注意坑 3/4 口径)
├── 要商用
│   └── 先与作者确认授权(坑 7),或改换许可更宽的数据集
└── 要全疾病层级分类
    └── 用 ontology.json 的 371 已安置类,排除 19 未安置类(坑 9)

附录 E:评测数据字典(HF fields)

字段 类型 取值域 语义
filename string — 图像文件名
truncated_caption string — 精炼医学文本(训练用)
disease_label string 390 类 疾病单值标签
hierarchical_disease_label string 四级路径 本体层级路径(逗号分隔)
skin_concept string 130 概念 概念标签(逗号分隔)
source string pubmed/youtube/… 来源标识
source_type string knowledge/… 来源类型

配置(HF API):default config,train=Derm1M_v2_pretrain.csv,valid=Derm1M_v2_validation.csv。

附录 F:零样本分类全表(Table 2 原始值)

模型 视觉/文本 HAM F17K PAD Daffodil 平均
CLIP-B16 ViT-B16/GPT77 .2023 .0653 .4555 .4534 .2941
SigLIP ViT-B16/SigLIP64 .2502 .1007 .5315 .6995 .3955
CoCa ViT-B32/GPT77 .1796 .0647 .3623 .5424 .2873
PMC-CLIP ResNet50/PMB256 .5349 .0302 .4273 .3529 .3363
BiomedCLIP ViT-B16/PMB256 .6347 .0955 .4512 .5817 .4408
MONET ViT-L14/GPT77 .2967 .1397 .4425 .7215 .4001
DermLIP ViT-B16/GPT77 .6820 .2278 .6074 .7257 .5607
DermLIP ViT-B16/BMB77 .6647 .2740 .6095 .7497 .5745
DermLIP ViT-B16/PMB256 .5236 .3133 .6161 .7702 .5558
DermLIP PanDerm-B/PMB256 .6274 .3162 .6247 .7832 .5879

附录 G:跨模态检索全表(Table 4 原始值,R@10 / R@50)

模型 Holdout I2T Holdout T2I SkinCAP I2T SkinCAP T2I
CLIP-B16 .0713/.1542 .0594/.1386 .0913/.2354 .0592/.1860
SigLIP .1184/.2314 .1109/.2221 .1329/.3184 .0955/.2585
CoCa .0669/.1477 .0514/.1244 .0857/.2351 .0682/.1985
PMC-CLIP .0751/.1589 .0627/.1381 .0672/.1908 .0649/.1855
BiomedCLIP .1657/.2789 .1541/.2761 .1359/.3429 .1238/.3304
MONET .1290/.2509 .1215/.2569 .1421/.3384 .1492/.3490
DermLIP ViT-B16/GPT77 .4069/.6021 .3966/.5992 .1567/.3632 .1594/.3567
DermLIP PanDerm-B/PMB256 .5998/.7610 .5930/.7605 .2018/.4327 .2128/.4620

附录 H:双口径登记表

# 项 口径 A 口径 B 处理
1 caption 长度单位 41 tokens(论文) 41 words(GitHub) 按论文 tokens
2 零样本增益 +9.85%(摘要) +11.99%(正文 Table 2 四集平均) 双记,标来源
3 检索增益 +48.1%(摘要) 逾 +43%(正文 Table 4 holdout vs BiomedCLIP) 双记,标来源
4 发布时点 “upon acceptance”(论文) 实际 2025-10-15(GitHub) 双记
5 本体类数 390 宣称 371 已安置(91.1%) 双记,层级研究用 371
6 图像质量版本 ICCV 版 HF 发布版(改善) 注明版本

附录 I:五源明细表

来源 占比 采集量 文本特征 清洗重点
YouTube 45.6% 51,309 视频/10,660 小时 旁白转写(口语) 关键帧/皮肤图分类/旁白过滤
PubMed 19.4% 566,571 篇/~360 万图 科学 caption 子图切分/正则配对
医学论坛 15.1% 49,875 帖 患者自述 去广告/去提问句/结构化摘要
公开数据集 10.1% SCIN+MSKCC/17,137 对 模板化 元数据填模板
教育材料 9.8% 68 份 指南文本 PyMuPDF/OCR

附录 J:构建流水线工具链

环节 工具 用途
视频处理 FFmpeg 关键帧提取
聚类去噪 K-means 图像聚类
皮肤图分类 DenseNet121 判定皮肤图
子图检测 DINO 复合图切分
特征提取 EfficientNetV2-S + PCA 层次聚类特征
语音转写 Whisper Large-V3 旁白转文字
旁白质量 inaSpeechSegmenter 过滤无讲解视频
关键词 RAKE 短语抽取去停用词
文本纠错 GPT-4o 医学术语纠正/摘要
文本工具 NLTK + OCR 通用文本处理
文档提取 PyMuPDF 教材图文提取

附录 K:引用规范

@inproceedings{yan2025derm1m,
  title     = {Derm1M: A Million-scale Vision-Language Dataset Aligned
               with Clinical Ontology Knowledge for Dermatology},
  author    = {Yan, Siyuan and Hu, Ming and Jiang, Yiwen and Li, Xieji and
               Fei, Hao and Tschandl, Philipp and Kittler, Harald and Ge, Zongyuan},
  booktitle = {Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
  year      = {2025},
  eprint    = {2503.14911},
  archivePrefix = {arXiv},
  url       = {https://arxiv.org/abs/2503.14911}
}

@article{yan2025panderm,
  title   = {A multimodal vision foundation model for clinical dermatology},
  author  = {Yan, Siyuan and Yu, Zhen and Primiero, Clare and others},
  journal = {Nature Medicine},
  volume  = {31},
  number  = {8},
  pages   = {2691--2702},
  year    = {2025},
  doi     = {10.1038/s41591-025-03747-y}
}

附录 L:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ arXiv:2503.14911 + GitHub repo + HF repo
F2 富元数据 ✅ HF card + 论文表格 + concept.csv/ontology.json
A1 可访问协议 ⚠️ gated=auto(自动放行)+ CC BY-NC 4.0(非商业)
A2 元数据可访问 ✅ 元数据与 card 始终开放
I1 互操作格式 ✅ CSV/JSON/HF datasets
I2 词汇表引用 ✅ 四级本体 + 130 标准化概念
R1 来源溯源 ✅ 五源明示 + 采集量披露
R3 可复现流程 ✅ 训练+评测代码 + 公开权重
AI-Ready 综合 中上 四件套齐全,可获取性受 gated + 非商业收窄

附录 M:与库内条目的关系声明

维度 SkinCAP Derm1M
规模 4,000 对 1,029,761 对
概念数 48 130
本体层级 无 四级(371 安置)
与 SkinCon 关系 SkinCAP 派生自 SkinCon 复用 SkinCon 作评测集
阅读顺序 先读(前作) 后读(继任+扩展)

两篇不冲突:SkinCAP 是皮肤病视觉-语言的开端,Derm1M 是规模化与结构化后的里程碑。

附录 N:维护计划与触发点

触发点 条件 动作 优先级
Derm1M_Instruct 发布 300K 指令数据上线 更新 §6.5 版本链与互链 1
AgentAug 论文化 多智能体重述版发论文 §6.5 升格 + 评估对比 2
第三方评测扩表 新论文用 Derm1M 训练新模型 §5 表扩行 3
许可变更 团队放宽商用或以其他许可发布 改写 §6 与 AI-Ready 评级 4
本体扩充 19 未安置类被安置 更新 §4.2 覆盖率 5

附录 O:缩写速查

缩写 全称
Derm1M Dermatology 1 Million
VL / VLM Vision-Language / Vision-Language Model
CLIP Contrastive Language-Image Pre-training
DermLIP Dermatology CLIP
PanDerm 皮肤病自监督多模态基础模型
CBM Concept Bottleneck Model
AUROC Area Under the ROC Curve
I2T / T2I Image-to-Text / Text-to-Image retrieval
R@K Recall@K
PMB256 PubMedBert(256 token 上下文)
BMB77 BiomedBert(77 token 上下文)
GPT77 GPT2(77 token 上下文)
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability

附录 P:基于本数据集的研究检查清单(10 项)

  1. 许可核对:用途是否落在非商业研究范围?商用须先获授权(坑 7)。
  2. 门禁准备:HF 需登录 + 接受条款 + 配 token(坑 8)。
  3. 规模口径:用 1,029,761 对 / 403,563 图,勿混(坑 1、坑 2)。
  4. 采集量 vs 产出:勿把 51,309 视频/566,571 文献当数据集规模(坑 6)。
  5. 本体覆盖:层级研究用 371 已安置类,排除 19 未安置类(坑 9)。
  6. 源偏斜:注意 YouTube 45.6% 的模态与场景偏斜,跨域评测须分层。
  7. 源噪声:高精度用途须自验子集质量(坑 5)。
  8. 增益口径:引用数值标来源(摘要 vs 正文)(坑 3)。
  9. 版本记录:注明使用 v2 / AgentAug / Instruct 哪个版本(坑 10)。
  10. 引用完整:数据引 Derm1M,视觉编码器引 PanDerm。

附录 Q:检索路径示范(关键词组合)

目标 推荐查询式 预期命中
本数据集 “Derm1M” AND (“vision-language” OR “image-text”) AND dermatology arXiv:2503.14911 / HF redlessone/Derm1M
模型权重 site:huggingface.co DermLIP / redlessone redlessone/DermLIP_*
伴生模型 “PanDerm” AND “foundation model” AND dermatology Nature Medicine 31(8):2691
前作竞品 “SkinCAP” AND dermatology SkinCAP 论文
概念集 “SkinCon” AND “concept” SkinCon 论文
反例(勿混) “DermNet”(≠ Derm1M) DermNet 数据集

附录 R:三型文本生成的伪代码骨架

# Derm1M 知识增强文本生成的逻辑骨架(据论文 §3.1 Step 5 复述,非官方代码)

def generate_ontology_text(disease_name, ontology_tree):
    """沿本体四级路径展开成结构化文本。"""
    path = ontology_tree.path_of(disease_name)   # e.g. [inflammatory, infectious, bacterial, folliculitis]
    return " → ".join(path)

def generate_concept_text(raw_medical_text, concept_list_130):
    """用 130 概念表从原文抽取视觉特征词。"""
    concepts = [c for c in concept_list_130 if c in raw_medical_text]
    return ", ".join(concepts)

def generate_refined_text(raw, ontology_text, concept_text, meta):
    """融合本体+概念+原文+元数据(病史/症状/部位/治疗)。"""
    return merge(raw, ontology_text, concept_text, meta)

这段骨架说明三型文本是"同一图像、不同粒度"的三个投影:本体文本给层级,概念文本给视觉特征,精炼文本给综合描述。训练时可按需选用其中之一或组合。

附录 S:库内互链的检索关键词矩阵

目标条目 关键检索词 与 Derm1M 的关系类型
scin SCIN, dermatology, public dataset 数据源(上游)
skincap SkinCAP, image-text, dermatology 前作竞品 + 评测集
skincon SkinCon, concept, dermatology 概念集 + 母体
Derm7pt Derm7pt, seven-point checklist 概念评测集
isic-2018/2019/2020 ISIC, dermoscopy, skin lesion 同域 + 伪影评测
BCN20000 BCN20000, dermoscopic 同域分类
derm12345 derm12345 同域分类
dermacon-in dermacon-in 同域分类
panda-plus PANDA-PLUS, WSI, pathology 方法论同族(跨专科)

附录 T:Derm1M 硬数字速查(可复算)

数字 值 复算关系
图像-文本对 1,029,761 = 403,563 + 403,563 + 222,635
唯一图像 403,563 精炼/本体文本各 1 条/图
概念文本 222,635 约 55% 图像有概念
皮肤状况 390 四级本体;371 已安置(91.1%)
临床概念 130 六维:形态/颜色/形状/表面/分布/边界
平均 caption 41 tokens 论文口径
本体已安置 371 390 × 91.1%
本体未安置 19 390 − 371
规模倍数 257× vs SkinCAP 4,000
皮肤浓度对照 PMC-15M 约 0.13% Derm1M 为 100%
HF 体量 35,000,772,329 B ≈ 32.6 GB

复算这 11 个数字之间的关系,即可验证第三方转述的准确性——尤其"1,029,761 = 403,563×2 + 222,635"与"371 = 390×91.1%"两条恒等式。

附录 U:本条目生产档案

  • 生产通道:任务头 task_derm1m.md(生成时间 2026-09-30T22:28:06)
  • 存在性核验:三轮搜索(WebSearch×3 + arXiv HTML v2 全文抓取 + GitHub 实抓 + HF API 实测,均通过 hf-mirror 镜像)共约 8 轮
  • 主要一手来源:arXiv:2503.14911(v2 全文,568KB HTML)、ICCV 2025 OpenAccess、GitHub SiyuanYan1/Derm1M、HF redlessone/Derm1M(API)、PanDerm Nature Medicine(PubMed PMID 40481209)
  • FACTS.md:writing/derm1m/FACTS.md 九节
  • 成稿方式:多块直写拼接(part1-5 + 扩展块),全程不用 Edit 追加正文(吸取"附录标题吞噬"教训)
  • 坑点:§10 十则(坑 1-10 "坑 N:"编号制)
  • description:成稿时即 ≤170 字符
  • 互链计划:正文内链 scin/skincap/skincon/Derm7pt(110)/isic 系列/derm12345(742)/dermacon-in(781)/panda-plus(方法论对照)

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(ICCV 2025 / arXiv:2503.14911)、GitHub 仓库、HuggingFace API 实测(hf-mirror 镜像)与伴生论文(Nature Medicine 31(8):2691)为源;caption 长度单位双口径、摘要与正文增益口径、HF 版与 ICCV 版图像质量差异等原始文档特征已在 §10 坑点与附录 H 存照。条目与库内 SCIN、SkinCAP、SkinCon、Derm7pt(rid 110)、ISIC 系列、derm12345(rid 742)、dermacon-in(rid 781)等条目互链,构成皮肤病影像与视觉-语言家族的完整检索面。后续维护触发点见附录 N。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • rex-in-the-wild — 共享标签:多模态 / 视觉问答 / 评测基准
  • pathvqa — 共享标签:多模态 / 视觉问答 / 评测基准
  • skincap — 共享标签:皮肤影像 / 多模态 / 影像-文本对齐
  • medreco-db — 共享标签:多模态 / 影像-文本对齐 / 视觉问答
  • ms-cxr-t — 共享标签:多模态 / 影像-文本对齐 / 评测基准
  • vlm3d — 共享标签:多模态 / 影像-文本对齐 / 评测基准
  • 3dreasonknee — 共享标签:多模态 / 视觉问答 / 评测基准
  • rexvqa — 共享标签:多模态 / 视觉问答 / 评测基准
  • biomedica — 共享标签:多模态 / 影像-文本对齐 / 评测基准
  • derm7pt — 共享标签:皮肤影像 / 多模态

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集