信息速览
INFOBOX — DFUC 2024 一屏速览
维度 内容 本质 MICCAI 2024 挂联挑战赛 + 任务数据集(第 4 届糖尿病足溃疡大挑战) 挂靠 MICCAI 2024(第 27 届,Marrakesh, Morocco),现场工作坊 2024-10-06 团队 Manchester Metropolitan University(Yap/Kendrick/Cassidy)+ FH Dortmund(Brüngel/Bracke/Friedrich)双主理 论文 LNCS 15335,书 DOI 10.1007/978-3-031-80871-5;overview 章节 DOI 10.1007/978-3-031-80871-5_10,pp.109-124 任务 自监督条件下的 DFU 实例分割——训练主分割集不带人工标注(任务设计而非疏漏) 数据 6,200 张足部照片 = 训练 4,000(原始 2,000 + 合成 2,000)+ 验证 200 + 测试 2,000 系列总库 DFUC 系列累计 11,000 张 DFU 图像(官方 Challenge Brief 口径) 基线 A:DINOv2 自监督特征 + probing(linear/multi-linear/multi-nonlinear 三档);B:GroundedDINO + SAM 开放词汇组合 评估 Dice / Jaccard(IoU)等分割标准指标 赛果 冠军 Murali et al.(DINOv2 + Attention U-Net):Dice 0.5709 / Jaccard 0.4793 核心发现 高自监督度下精确 DFU 分割"尚不可及"——与全监督 DFUC2022 冠军(Dice ≈0.83 量级)存在巨大代差 版本链 2020 检测(mAP 0.6940)→ 2021 分类(macro F1 0.6216)→ 2022 语义分割(Dice ≈0.83)→ 2024 自监督实例分割(Dice 0.5709) 获取 Brief PDF 公开(Zenodo)|数据本体签协议申请制|基线权重公开(HuggingFace 17.6 GB) 许可 三层异构:PDF CC BY-NC-ND-4.0|数据 EULA 申请制|基线权重 HF 公开|论文 Springer 版权 赛程 训练集 2024-05-31 → 验证 06-21 → 测试 07-01 → 截止 08-15 → 获奖公布 08-20 → 现场工作坊 10-06 论文池 11 支队伍投稿 → 8 篇 full papers + 2 篇 invited papers 库内互链 isic-archive(56)、derm7pt(110)、totalsegmentator(422)、chest-x-ray-segmentation(601)、chexmask-cxr-segmentation-data(602)、heart-lung-segmentations-data(610)、lung-segment-mimic-cxr(613)
DFUC 2024 是一场把"自监督"逼到医学分割极限的挑战赛:6,200 张糖尿病足溃疡(DFU)足部照片摆在参赛者面前,其中训练侧的 4,000 张(2,000 原始 + 2,000 合成)一张像素标注都不给,参赛者必须靠自监督/半监督策略从未标注数据里榨出分割能力。结果极具启发性——最佳队伍 Dice 只有 0.5709,而两年前全监督的 DFUC 2022 冠军 Dice 已到 0.83 量级。这道"自监督代价"的量化鸿沟,正是本届挑战赛留给医学影像社区最诚实的答卷。
对数据工程师而言,DFUC 2024 还是"可获取性三层异构"的教科书样本:挑战 Brief PDF 在 Zenodo 公开(但下载者里很多人把 2.7 MB 的说明书当成数据本体下走了,concept DOI 陷阱见坑 1);数据本体锁在签协议申请制后面;基线模型权重倒是 HuggingFace 全公开——"模型开放、数据受控、文档公开"的错位组合,是检索与复现时最容易踩空的地质断层。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——数据本体没有公开直链,Zenodo 那个 DOI 只是说明书 PDF,先读坑 1 再动手。
- 关心自监督方法:直奔 §3 双基线与 §5 赛果——DINOv2 probing 与 GroundedDINO+SAM 两条路线的起点,以及 8 篇 full paper 的方法谱系。
- 做版本链研究:直奔 §4 四届对照表——检测→分类→分割→自监督的代际逻辑,跨届指标不可直比的原因都在表后。
§0 导读:这个数据集解决什么问题
糖尿病足溃疡是全球糖尿病患者截肢的主要诱因之一,而溃疡面积的量化是伤口分级、愈合追踪与治疗方案调整的前置步骤——手工描边费时且观察者间差异大,因此"照片进、掩码出"的自动分割成为临床刚需。但 DFU 照片是分割问题里最难对付的一类:跨设备、跨光照、跨肤色采集,溃疡常与胼胝、坏疽、敷料、脚趾在颜色与纹理上纠缠,像素级真值本身就需要足病医师逐张勾画。标注贵,直接推高了每一届 DFUC 的组织成本,也构成了本届转向自监督的现实动机。
DFUC 系列的演进逻辑是"每届往上加一个维度":2020 年做检测(框出溃疡),2021 年做分类(四类判别),2022 年做全监督语义分割,2024 年则把监督信号整个抽走——训练主分割集不带人工标注,任务升级为自监督实例分割。这个设计的深层含义是:临床现实中未标注照片要多少有多少,而医师标注永远稀缺,挑战赛想回答的问题是"把标注从 100% 压到 0%,分割能力还剩多少"。答案在 §5:剩 0.5709 的 Dice,距全监督天花板 0.83 量级有巨大代差——这个数字本身就是本届最重要的科学产出。
数据侧的另一个杠杆是合成图像:训练集里 2,000 张为合成图像(按溃疡实例大小分组生成),与 2,000 张原始照片混编发放,供参赛者做自监督预训练与增广。多支队伍在论文中报告合成数据是他们的关键素材——这在 2024 年的医学挑战赛里是相当超前的配置,但其生成技术细节(GAN/扩散/传统增广)官方文档未充分展开,复现者只能按"实例大小分组"的字面描述自行推断(待核项,见坑 8 与附录证据链)。
组织侧,本届出现双主理格局:英国 Manchester Metropolitan University 的 Yap/Kendrick/Cassidy 是 DFUC 全系列的核心班底,德国 FH Dortmund 的 Brüngel/Bracke/Friedrich 加入共组并执笔基线与 overview——这也解释了为什么基线权重会以 FH Dortmund 研究者(BBracke)的个人 HuggingFace 账号公开发布。论文集收入 Springer LNCS 15335,8 篇 full papers + 2 篇 invited papers 从 11 支投稿队伍中评审产生。
最后是临床闭环的位置感:DFUC 2024 处在"照片 → 掩码 → 面积 → 分级 → 治疗决策"临床链路的最上游——分割质量每差一个点,下游的面积量化、愈合速率估计与截肢风险分级的误差都会被放大。这也让"自监督代价 0.26 Dice"不再是抽象的学术数字,而是可以换算成"哪些患者伤口被量错"的临床问题。邀请论文(Kendrick et al.)把临床划界主观性摆上台面,正是提醒所有参赛者:链路上游的真值本身就带不确定性,模型评估的解读要带着这份不确定性走完全程。
§0 读法三则:
- 本条目是"挑战赛 + 任务数据集 + 方法论文集"三合一:本体是 6,200 张照片与申请制发放协议,衍生品是 17.6 GB 基线权重与 LNCS 论文集,副产品是一条四届演进的方法论时间线——三者许可与获取方式各不相同(§6)。
- 全文统计数字均出自 overview 论文(LNCS 15335 pp.109-124)、Challenge Brief PDF 与 HuggingFace API 实测;唯一未三轮核验的对比锚点(DFUC2022 冠军 Dice 精确值)已在坑 8 存照。
- 检索时若把 Zenodo concept DOI 6362521 当"数据集下载入口"会空手而归——它聚合的当前版本 record 11468883 是一份 2.7 MB 的说明书 PDF,下载 4,999 次的数字恰恰证明大量使用者踩了这个坑(坑 1)。
§1 数据集速览:十问十答
Q1:DFUC 2024 是什么?
Diabetic Foot Ulcers Grand Challenge 2024,第 4 届糖尿病足溃疡大挑战,挂靠 MICCAI 2024(第 27 届,2024-10-06 在摩洛哥马拉喀什举办现场工作坊)。任务是自监督条件下的 DFU 实例分割——不是检测、不是分类、也不是全监督语义分割,这四个词分别对应 DFUC 四届的不同任务(§4)。
Q2:6,200 张怎么构成?
训练集 4,000 张(2,000 张原始照片 + 2,000 张合成图像,均不带人工像素标注)、验证集 200 张、测试集 2,000 张。验证/测试的实例分割标注由组织方提供、仅用于评估。注意训练集的"无标注"是任务设计——强迫参赛者用自监督/半监督策略利用未标注数据,不是数据没标完。
Q3:"自监督实例分割"到底是什么意思?
两个限定词都要扣紧。"自监督"指训练主分割集无人工标注,参赛者只能靠预训练特征、合成数据或半监督手段学习表示;"实例分割"指输出是溃疡的独立实例对象(每个溃疡一个掩码),而非前景/背景二分——后者是 DFUC 2022 的任务形态。
Q4:图像长什么样、怎么采的?
彩色 RGB 足部临床照片,跨设备、跨光照、跨肤色采集,DFUC 系列一贯难点是溃疡与胼胝、坏疽、敷料、脚趾的颜色纹理混淆。前作 DFUC 2022 为 4,000 张 640×480、由 5 位足病医师标注;2024 版分辨率未在 Brief 中统一规定口径,以申请到手的数据包为准。
Q5:谁主办的?
双主理:Manchester Metropolitan University(英国曼彻斯特城市大学,计算与数学系)的 Moi Hoon Yap(通讯组织者)、Connah Kendrick、Bill Cassidy——DFUC 全系列核心班底;FH Dortmund(德国多特蒙德应用技术大学)的 Raphael Brüngel、Benjamin Bracke、Christoph M. Friedrich——2024 届加入,基线与 overview 主要执笔人。临床合作含 Lancaster University 的 Neil D. Reeves 与 Lancashire Teaching Hospitals 的 Joseph M. Pappachan。
Q6:官方基线是什么?
两套刻意差异极大的基线(overview 原语"vastly different"):基线 A 是 DINOv2 自监督预训练特征 + probing(linear/multi-linear/multi-nonlinear 三档),展示"纯自监督特征能走多远";基线 B 是 GroundedDINO + SAM 开放词汇检测分割组合,展示"基础模型零训练"路线。权重在 HuggingFace BBracke/DFUC24_baselines 公开(17.6 GB)。
Q7:比赛结果如何?
冠军/最佳成绩为 Murali et al. 的 Multi-scale Attention Network(DINOv2 + Attention U-Net),Dice 0.5709 / Jaccard 0.4793。overview 官方结论直白:高自监督度下精确 DFU 分割"currently seems out of reach"——与 DFUC 2022 全监督冠军 Dice ≈0.83 量级对比,代差一目了然。
Q8:数据怎么获取?
三层:①挑战 Brief PDF 在 Zenodo 公开(concept DOI 6362521 → 版本 record 11468883,CC BY-NC-ND-4.0)——但它只是 2.7 MB 说明书;②数据本体签协议申请制:注册挑战账号、签署数据使用协议(EULA)后分批发放,训练/验证/测试均无公开直链;③基线权重 HuggingFace 公开下载。详见 §6 决策树。
Q9:和 DFUC 2020/2021/2022 什么关系?
同一系列四届演进:2020 检测(mAP 0.6940/F1 0.7434)→ 2021 分类(15,683 patches,macro F1 0.6216)→ 2022 语义分割(4,000 张 640×480,Dice ≈0.83 量级)→ 2024 自监督实例分割(6,200 张,Dice 0.5709)。注意年份跳号:没有 DFUC 2023。系列累计图像库 11,000 张(官方口径)。
Q10:论文在哪?
论文集 Springer LNCS 15335:“Diabetic Foot Ulcers Grand Challenge: 4th Challenge, DFUC 2024, Held in Conjunction with MICCAI 2024”,书 DOI 10.1007/978-3-031-80871-5;overview 论文为 Brüngel et al.,pp.109-124,章节 DOI 10.1007/978-3-031-80871-5_10。出版年存在"章节 Published 2024-10-06 vs 书卷 © 2025"双口径(坑 2)。
§2 数据构成:6,200 张的精确解剖
2.1 分区结构与规模
DFUC 2024 任务数据共 6,200 张足部照片,三分区结构如下:
| 分区 | 数量 | 构成 | 人工标注 | 用途 |
|---|---|---|---|---|
| 训练集 | 4,000 | 原始 2,000 + 合成 2,000 | 无(任务设计) | 自监督/半监督预训练与策略开发 |
| 验证集 | 200 | 原始照片 | 有(组织方提供,评估用) | 调参与模型选择 |
| 测试集 | 2,000 | 原始照片 | 有(组织方持有,用于排名) | 最终提交评估 |
注:表中"合成"指按溃疡实例大小分组生成的合成图像,随训练集同一协议发放。测试集 2,000 张是否附带完整实例真值公开(而非仅组织方持有)未在可抓取文档中明确(待核项)。
几个规模口径需要分开记:
- 任务口径 6,200:本届挑战赛的 train/val/test 三分区总量,frontmatter 与检索引用默认用这个。
- 系列口径 11,000:DFUC 系列累计构建的 DFU 图像总库(Challenge Brief 官方口径),2020 届数据(其中一部分)后来以 “DFUC2020 dataset” 论文(Cassidy et al.)独立发布,是 DFU 检测研究的标准基准。
- 前作口径 4,000(640×480):DFUC 2022 语义分割版数据,由 5 位足病医师标注——注意它与本届训练集的 4,000 是两回事,数字巧合但内容不同(坑 6 的衍生混淆点)。
2.2 合成训练图像:设计意图与信息缺口
训练集一半是合成图像,这是 DFUC 2024 相对前几届最激进的数据侧改动:
- 生成逻辑:按溃疡实例大小分组生成——即合成图像按目标实例的尺寸分布分桶,覆盖从微小溃疡到大面积溃疡的连续谱,让自监督预训练不会偏科于某一尺寸段。
- 官方用途定位:供自监督/弱监督策略使用。合成图像不带像素级真值参与训练(与原始训练图一致),但多支参赛队伍报告将其用于预训练与增广,是论文池中被反复利用的杠杆(§5)。
- 信息缺口:生成技术栈(GAN/扩散模型/传统图形学增广)在 Challenge Brief 与 overview 论文中均未充分展开;"实例大小分组"之外的可复现细节(生成器架构、真伪混合比例、域间隙处理)是明确的待核项。复现者若要自建同类合成集,只能按字面描述自行设计并做消融验证。
2.3 标注归属:监督信号在哪一侧
理解本届数据的关键是"监督信号的位置":
- 训练侧(4,000 张):零人工像素标注。这不是数据缺陷而是赛题设定——挑战赛要测的就是"无标注条件下的分割能力",参数化的说法是:把标注成本从监督管线中剥离,检验自监督表示学习在 DFU 域的迁移上限。
- 评估侧(200 + 2,000 张):实例分割标注由组织方提供,验证集给参赛者自查,测试集留给排行榜排名。标注一致性流程(是否多名医师交叉标注)沿用 DFUC 系列惯例(2022 届为 5 位足病医师),本届具体标注者数量未在可抓取文档中单列。
- 任务输出的形态:实例分割——每个溃疡是独立实例对象。这与 DFUC 2022 的语义前景/背景二分不同:足部照片可能同时存在多个溃疡灶,实例级输出才能支撑"逐个溃疡追踪愈合"的临床需求。
由此产生一个工程推论:任何"训练时用到了像素级标注"的方法(除评估侧合规使用外)都改变了任务性质——这正是 full paper #7 主动声明"监督式"的原因。使用本数据的团队在写论文时,监督源的声明应放在方法节的显要位置,这是本届数据集带来的学术写作新惯例。
2.4 图像特性与分割难点
DFU 照片是医学分割里公认的困难域,难点全部继承到了 2024 版:
- 采集异构:跨设备(手机/相机/临床专用设备)、跨光照(病房光/自然光/闪光灯)、跨肤色(不同人种足部色调差异)——同一溃疡在不同照片里的颜色分布可能完全不同。
- 形态混淆:溃疡常与胼胝(黄褐色角化)、坏疽(黑褐色)、敷料残留、脚趾轮廓在颜色与纹理上纠缠;DFUC 系列论文里"把正常皮肤褶皱当溃疡"与"把深色坏疽漏检"是高频错误模式。
- 实例歧义:一处溃疡可能被痂皮分割成多个外观区域——"一个溃疡还是两个"本身存在临床划界主观性,这也是 invited paper(Kendrick et al.,临床划界方法论,pp.1-14)专门讨论的问题。
按混淆源分类的高频错误画像:
| 混淆源 | 外观特征 | 典型错误方向 | 对策方向(参赛方法中可见) |
|---|---|---|---|
| 胼胝 | 黄褐色角化增厚 | 假阳性(误判为溃疡) | 颜色差异建模(如 #8 CDe) |
| 坏疽 | 黑褐色坏死区 | 漏检或边界过缩 | 多尺度注意力(如 #6) |
| 敷料/异物 | 白色/肤色覆盖物 | 掩码碎裂 | 实例完整性约束(#4 多阶段) |
| 脚趾/皮肤褶皱 | 规则暗色轮廓 | 假阳性 | 上下文/位置先验(#2 注意力法) |
| 痂皮分界 | 溃疡内部分区 | 实例数误判 | 临床划界先验(invited paper) |
这张表的用途:误差分析时把"错在哪个像素"升维成"错在哪个混淆源"——与论文池五类方法一一对应后,可以按自己数据的主要混淆源选方法起点。
2.5 三个规模口径的问答桌
问:为什么训练集要"原始+合成"对半混,而不是纯原始?
因为自监督任务的瓶颈在数据量而非标注:2,000 张原始照片不足以支撑稳定的自监督预训练,合成图像把训练池翻倍到 4,000,同时用"实例大小分组"保证溃疡尺寸分布连续覆盖——让预训练不至于偏科微小或巨大溃疡。
问:验证集只有 200 张,够用吗?
够调参不够下结论——200 张是模型选择与超参搜索的规模,不是统计推断的规模。这也是为什么最终排名看 2,000 张测试集,而论文里的显著性分析大多以测试集为样本。
问:前作 2022 的 4,000 张标注能不能拿来给 2024 训练集"补标注"?
不能跨届混用:两届的 4,000 张数字相同但内容无关(2022 是全标注 640×480 语义分割集,2024 是零标注的训练分区),且混用直接破坏自监督赛题设定。2022 数据是独立的可申请资源,做"监督上限"对照实验时另行走 2022 通道。
问:患者级数量为什么没公开?
DFU 影像的敏感性在于患者可识别(足部特征、皮肤病变组合),公开患者级元数据会提高重识别风险——DFUC 系列一贯只公开图像级口径,患者级去重与统计由组织方在协议层控制。引用时写"6,200 张图像(患者级数量未公开)"即可,不要自行折算。
2.6 与前作数据的纵向规格对照
| 规格 | DFUC 2022(前作) | DFUC 2024(本届) | 迁移提示 |
|---|---|---|---|
| 任务 | 语义分割(全监督) | 自监督实例分割 | 输出头要重写(前景二分→实例输出) |
| 规模 | 4,000 张 | 6,200 张(4,000/200/2,000) | 数字撞车,引用带届次 |
| 分辨率 | 640×480 | 未统一公开口径,以发放包为准 | 预处理管线不要沿用死值 |
| 标注 | 5 位足病医师全标注 | 训练侧零标注,评估侧组织方标注 | 监督信号位置完全不同 |
| 合成数据 | 无 | 2,000 张(实例大小分组) | 2024 独有杠杆 |
| 获取 | 2022 届通道独立申请 | EULA 申请制 | 两届协议互不通用 |
这表的实际用途:凡是"从 2022 管线迁移到 2024"或反向复用的工程决策,先过一遍此表的六行差异,再决定哪些组件可复用(数据加载、颜色增广)哪些必须重写(输出头、损失函数、评估器)。
§3 挑战设定与双基线
3.1 赛程时间线与参赛规则
2024 届赛程六个节点:
| 节点 | 日期(2024) |
|---|---|
| 训练集发放 | 05-31 |
| 验证集发放 | 06-21 |
| 测试集发放 | 07-01 |
| 提交截止 | 08-15 |
| 获奖公布 | 08-20 |
| MICCAI 现场工作坊(Marrakesh) | 10-06 |
参赛规则两条主干:①允许预训练模型——自监督任务的核心即允许无标签预训练,DINOv2 等通用自监督骨干合法;②测试集不可用于训练——测试数据只能用于最终提交评估,任何形式的信息泄漏(包括用测试集调参)都违反协议。平台承载于 grand-challenge.org(dfuc2024.grand-challenge.org)。
两条主干之外还有一条隐含边界值得预先声明:规则的 Grain 是"训练主分割集零人工标注",但对外部无标注数据(如图像库自备照片、其他公开足部照片集)是否可用于自监督预训练,当届规则文本的开放程度决定了方法的自由度——从论文池方法(大量使用官方合成图、DINOv2 通用预训练)看,外部无标注预训练在实践层面被广泛接受,但引用具体队伍成绩时仍应回到该队论文核对其监督源声明(§5.6 纪律 1)。
3.2 基线 A:DINOv2 特征 + probing 三档
FH Dortmund 系基线 A 的设计哲学是"先测出纯自监督特征的底线":
- 骨干:DINOv2 自监督预训练 ViT——在海量无标注自然图像上预训练的通用视觉特征,无需任何 DFU 标注即可提取。
- 三档 probing:linear(线性探针)、multi-linear(多层线性探针)、multi-nonlinear(多层非线性探针)——探针复杂度逐级上升,用于量化"DINOv2 特征里到底存了多少 DFU 分割信息、加深探针能挤出多少"。
- 解读价值:probing 成绩就是自监督特征的"免费上限"——任何参赛方法若低于 probing 线,说明其监督策略反而损伤了特征;高于 probing 线的部分才是参赛方法真正的增量。
3.3 基线 B:GroundedDINO + SAM 开放词汇组合
基线 B 走"基础模型零训练组合"路线:
- 管线:GroundedDINO(开放词汇检测器)以文本提示框选疑似溃疡区域 → SAM(Segment Anything)对框选区域做精细分割。
- 设计哲学:不训练任何参数,纯用通用基础模型的开放词汇能力 + 通用分割能力组合出 DFU 分割管线——检验"现成基础模型拼装"能到什么水平。
- 对照意义:与基线 A 构成"特征利用 vs 模型拼装"两条截然不同的起点,overview 原文称之为"vastly different baseline methods that highlight the potential diversity of welcome approaches"——刻意展示欢迎的多样性,而非给出唯一标准答案。
3.4 评估指标与复现要点
- 指标:Dice / Jaccard(IoU)等分割标准指标,实例级聚合方式以平台提交格式为准。
- 复现路径:基线权重在 HuggingFace
BBracke/DFUC24_baselines公开(2024-08-01 创建,17.6 GB),含 DINOv2 probing 三档权重与 GroundedDINO+SAM 组合管线;账号 BBracke 即基线作者 Benjamin Bracke(FH Dortmund)本人(坑 7)。 - 环境提示:huggingface.co 直连被封锁的网络环境走 hf-mirror.com 镜像(API 端点
/api/models/...可用;网页层有 IP 检测会跳提示页)。 - 注意边界:17.6 GB 是模型权重而非数据本体——基线开源但训练数据不开源,不要把"权重可下载"误读为"数据可下载"(坑 3 的姊妹混淆)。
3.5 双基线的战略含义
把两套基线放回"自监督代价"的主叙事里看:基线 A 测的是"通用自监督特征免费能拿多少",基线 B 测的是"通用基础模型零训练拼装能拿多少",冠军队伍(DINOv2 + Attention U-Net,Dice 0.5709)则展示了"自监督特征 + 轻量任务专用架构"的天花板。三条线合起来的图谱是:通用能力白拿的部分有限,任务专用设计能补一部分,但距离全监督 0.83 量级的天花板仍有巨大空隙——这个空隙就是后续研究(半监督、合成数据、域适应)的全部空间。
3.6 提交与评估流程细节
按 grand-challenge.org 惯例与本届赛程,提交-评估链路如下:
- 算法容器化:参赛者把推理管线打包为平台认可的算法容器(grand-challenge.org 的 algorithm 接口),保证评估环境一致;
- 验证集自查:06-21 发放后,参赛者对验证集 200 张自行评估、调整策略;
- 测试集封闭评估:07-01 发放测试集(规则:不可训练),08-15 截止前经容器提交,平台侧以组织方持有的实例标注计算 Dice/Jaccard;
- 排名与颁奖:08-20 公布获奖,10-06 现场工作坊报告。
这套流程的含义:排行榜上的每个数字都出自同构容器环境,方法差异而非工程环境差异主导成绩——跨论文比较时可默认环境变量已受控。
3.7 自监督赛道的高频失败模式
从 overview 结论与论文池回溯,本届常见折戟点有四类:
- 伪标注质量崩塌:用聚类/传统阈值生成伪掩码再监督训练,伪标签噪声在 DFU 的颜色纠缠区(胼胝/坏疽/敷料)被放大,性能反而低于纯 probing;
- 合成域过拟合:把 2,000 张合成图当真值分布使用、忽略域间隙,模型在真实测试照片上泛化失败;
- 实例-语义错配:沿用 2022 届语义分割思路输出前景/背景二分,在实例级评估下被逐实例拆分惩罚;
- 测试集信息泄漏:任何以测试集调参/选择模型的行为都违反规则——论文池中监督式参赛(#7)的透明声明反而示范了合规边界。
3.8 为什么"两套基线"是挑战赛设计范本
传统挑战赛基线是"一个弱起点",本届给出的是"两条相异起跑线":基线 A 回答"免费特征能走多远"(特征利用路线),基线 B 回答"现成大模型拼装能走多远"(零训练路线)。对参赛者,这是双锚点校准——你的方法必须同时说明"高于哪条线、高多少";对社区,这是可复用的评估框架——后来者在任何"少标注医学分割"任务上都可以照搬这套"特征 probing + 基础模型拼装"的双基线设计,把方法增量从环境噪声里剥离出来。
3.9 时间成本与人力画像(参赛视角)
- 窗口期约 11 周(05-31 拿训练集 → 08-15 截止),其中测试集窗口(07-01 起)仅 6 周——自监督预训练必须在拿到训练集后的前两周内并行启动,否则进度不可逆地挤压提交迭代。
- 算力画像:DINOv2 骨干冻结方案(基线 A 族)为特征抽取+轻量头训练,单卡周级可完成;从零适配/微调 ViT 级骨干则需多卡——论文池中冠军方案(DINOv2+Attention U-Net)属于前者,间接印证"冻结特征+好头"的性价比。
- 人力画像:2-4 人小队为论文池常态配置(算法 1-2 + 工程 1 + 医学顾问 0.5);医学顾问的作用集中在误差分析阶段(区分"分割错"与"真值划界主观")。
§4 版本链比较发现:DFUC 四届对照
4.1 四届全景表
DFUC 版本链是本条目的 FACTS 必答题——四届任务、规模、指标各不相同,跨届混引是检索与引用的高发事故区:
| 届 | 年份 | 任务 | 数据规模 | 最佳成绩(指标) |
|---|---|---|---|---|
| DFUC 2020 | 2020 | 溃疡检测(bounding box) | 2,000 train + 2,000 test | Deformable Conv,mAP 0.6940 / F1 0.7434 |
| DFUC 2021 | 2021 | 4 类分类(无溃疡/溃疡/愈合前/愈合后) | 15,683 patches(5,955 train + 5,734 test + 3,994 无标签) | ViT+DeiT,macro F1 0.6216 |
| DFUC 2022 | 2022 | 语义分割(全监督) | 4,000 张 640×480,5 位足病医师标注 | Dice ≈0.83 量级(全监督天花板) |
| DFUC 2024 | 2024 | 自监督实例分割 | 6,200(训练 2,000+2,000 / 验证 200 / 测试 2,000) | Dice 0.5709 / Jaccard 0.4793(Murali et al.) |
4.2 代际逻辑:每届加一个维度
四届连读是一条刻意加码的难度曲线:
- 2020 检测:回答"有没有溃疡、在哪"——边界框级别的定位问题,指标是 mAP/F1。
- 2021 分类:回答"这块区域是什么状态"——四类判别(无溃疡/溃疡/愈合前/愈合后),数据形态变成 15,683 个 patch,指标换成 macro F1;注意 3,994 张无标签 patch 已经在 2021 年就埋下半监督伏笔。
- 2022 语义分割:回答"溃疡的精确边界在哪"——全监督像素级分割,5 位足病医师标注 4,000 张 640×480,Dice 达到 ≈0.83 量级,确立了全监督天花板。
- 2024 自监督实例分割:同时加两个难度——把监督信号抽走(自监督)+ 把输出从前景/背景升级为独立实例(实例分割)。Dice 跌回 0.5709,这个跌幅本身就是"标注价值"的量化实验。
4.3 跨届比较的三条纪律
- 指标不可直比:mAP(检测)、macro F1(分类)、Dice(分割)三者度量不同任务,任何"DFUC 分数逐年变化"式图表都是伪比较。
- 年份跳号:没有 DFUC 2023——2022 与 2024 之间的空位不是数据丢失,是该年度未举办。检索时"DFUC 2023"的命中多为他人误写。
- "4,000"一词两义:DFUC 2022 的 4,000 张(640×480,全标注)与 DFUC 2024 训练集的 4,000 张(2,000 原始 + 2,000 合成,零标注)数字相同、内容完全不同,引用时必须带届次。
4.4 版本链三源互证
各届事实的交叉验证路径:①各届论文原文(Cassidy et al. 2020 DFUC dataset 论文、2021 分类 overview、2022 分割 overview、2024 overview);②MICCAI 挑战赛册页;③Zenodo 与 grand-challenge.org 平台记录。本条目所有版本链数字均可在至少两条路径中锚定(DFUC2022 冠军 Dice 精确值除外,见坑 8)。
实操演示——以"2021 届 15,683 patches"为例的三源走查:①2021 分类 overview 论文正文给出 5,955 train + 5,734 test + 3,994 无标签;②同期综述(Comput. Biol. Med. 135:104596)转写一致;③grand-challenge.org 2021 届页面描述规模同量级。三路读数闭合后该数字方可进入"精确值"档位——这正是本条目对待每个核心数字的标准流程,也是"待核"标签(如 ≈0.83)的由来。
4.5 各届权威文献坐标
| 届 | 权威文献 | 文献角色 |
|---|---|---|
| 2020 | Cassidy et al., DFUC dataset 论文 + 2020 overview | 数据集发布 + 检测赛果的双锚点;2020 数据后独立发布为检测标准基准 |
| 2021 | 2021 分类 overview | 15,683 patches 与 macro F1 0.6216 的口径来源 |
| 2022 | 2022 分割 overview | 4,000 张 640×480 / 5 位医师 / Dice 天花板的口径来源 |
| 2024 | 本条目 overview(LNCS 15335 pp.109-124) | 全部 2024 数字的第一来源 |
| 跨届 | Yap 组综述 Comput. Biol. Med. 135:104596(2021) | 覆盖 2020-2021 的方法谱系梳理 |
引用纪律:每届数字回各届 overview 与数据集论文溯源,综述只作地图不作数据源;2024 届数字一律经 LNCS 15335。
§5 赛果与论文池:8+2 的方法谱系
5.1 官方结论与冠军成绩
overview 论文的官方结论原话(意译加原文):“Even though accurate DFU segmentation currently seems out of reach when involving a higher level of self-supervision, respective contributions demonstrate promising kick-off strategies for scenarios in which unlabelled data needs to be harnessed.”——高自监督度下精确 DFU 分割尚不可及,但各贡献为"必须利用无标注数据"的场景展示了有前景的起跑策略。
冠军/最佳成绩:Murali et al.,Multi-scale Attention Network for Diabetic Foot Ulcer Segmentation Using Self-supervised Learning(LNCS 15335 pp.81-92)——DINOv2 + Attention U-Net,Dice 0.5709 / Jaccard 0.4793。与全监督 DFUC 2022 冠军(Dice ≈0.83 量级)的差距约 0.26 个 Dice 点,这就是"自监督代价"在本数据域的量化读数。
5.2 八篇 full papers 方法谱系
11 支队伍投稿,评审后 8 篇 full papers + 2 篇 invited papers 入集。8 篇 full papers 按页序:
| # | 论文(方法) | 作者 | 页码 | 方法要点 |
|---|---|---|---|---|
| 1 | Dinov2_Mask R-CNN | Yun ji Ban et al. | 17-28 | DINOv2 自监督特征接入 Mask R-CNN 检测分割框架 |
| 2 | ViT Attention 无监督分割 | Brodzicki et al.(波兰团队) | 29-41 | ViT 注意力机制的无监督分割利用 |
| 3 | Feature Correspondence Distillation | Wenhui Zhang, Abhirup Banerjee, Surajit Ray | 42-54 | 特征对应关系蒸馏 |
| 4 | Multi-stage Segmentation with SSL | Neetika Gupta, Ayush Nangia, Naimul Mefraz Khan | 55-67 | 多阶段自监督分割管线 |
| 5 | Post Challenge:SSL encoder 迁移慢性伤口库 | Guillaume Picaud, Marc Chaumont et al. | 71-80 | 将 SSL 编码器预训练迁移到慢性伤口异构数据库 |
| 6 | Multi-scale Attention Network(最佳成绩) | Murali et al. | 81-92 | DINOv2 + Attention U-Net,Dice 0.5709 |
| 7 | A Supervised Segmentation Solution | Xue Feng, Gaofeng Huang | 93-100 | 标题自曝"监督式"参赛——在自监督赛道上反其道而行 |
| 8 | CDe: Focus on the Color Differences | Yifan Wang et al. | 101-108 | 针对肤色/色彩差异的专门设计 |
2 篇 invited papers:①Kendrick/Cassidy/Pappachan et al. “Translating Clinical Delineation of Diabetic Foot Ulcers into Machine Interpretable Segmentation”(pp.1-14)——临床划界方法论,讨论"一个溃疡还是两个"的划界主观性如何翻译成机器可解释的真值;②overview 本身(pp.109-124)。
5.3 方法谱系的三条横向观察
- DINOv2 是全场最大公约数:冠军(#6)、#1、#4 均以 DINOv2 特征为起点——基线 A 的 probing 设计直接抬高了全场的特征下限。
- 合成数据是高频杠杆:多队报告用 2,000 张合成训练图做预训练或增广——§2.2 的"实例大小分组"设计被实战验证有效,尽管生成细节未公开。
- 监督式参赛的自我暴露:#7 论文标题直接写明 “A Supervised Segmentation Solution”——在自监督赛道上用监督方法参赛并如实声明,这种透明度对排行榜解读者反而是有用的校准信息:它提示 0.5709 之外的某些分数可能混入了监督信号,比较时需逐篇核对方法声明。
把三条观察合成的叙事线:本届论文池呈现"一个骨干(DINOv2)、一个杠杆(合成数据)、一个例外(监督式参赛)"的结构——骨干统一说明社区对通用自监督特征的共识,杠杆普遍说明官方合成数据的设计被实战采纳,例外的存在说明自监督赛道的边界治理仍在演化。三线并读,比单看冠军数字更能还原 2024 年医学分割社区的真实生态。
5.4 八篇 full papers 逐篇深读
#1 Dinov2_Mask R-CNN(Yun ji Ban et al.,pp.17-28)
把 DINOv2 冻结特征接入 Mask R-CNN 的经典检测分割框架:骨干不训、头网络监督训练。自监督策略的重心在"特征是否需要继续自监督适配"——本篇代表"通用特征 + 成熟检测头"的保守稳健路线,其成绩与基线 A probing 的差距直观反映 Mask R-CNN 头带来的增量。
#2 ViT Attention 无监督分割(Brodzicki et al.,pp.29-41,波兰团队)
利用 ViT 自注意力图的无监督分割信号:自监督 ViT 的注意力本身对前景对象敏感,本篇把这一性质推到 DFU 域——不引入或仅引入极少监督,探索"注意力的免费分割能力"边界,是论文池里自监督纯度最高的路线之一。
#3 Feature Correspondence Distillation(Wenhui Zhang, Abhirup Banerjee, Surajit Ray,pp.42-54)
特征对应蒸馏:让模型学习图像间/图像内的特征对应关系(哪块皮肤与哪块溃疡对应),把对应结构蒸馏进分割网络——对应学习是无监督分割的经典杠杆,在 DFU 域的价值在于跨照片的溃疡形态归一。
#4 Multi-stage Segmentation with SSL(Neetika Gupta, Ayush Nangia, Naimul Mefraz Khan,pp.55-67)
多阶段管线:粗定位→精分割→实例化的分阶段自监督设计,每阶段用不同的 SSL 信号。代表"把自监督当工程组件逐级组装"的路线,与 #1 的"一次接入"形成方法论对照。
#5 Post Challenge:SSL encoder 迁移慢性伤口库(Guillaume Picaud, Marc Chaumont et al.,pp.71-80)
赛后篇:把在本届学到的 SSL 编码器预训练迁移到慢性伤口异构数据库——这是本届自监督表示"可携带性"的直接验证,也是 DFUC 2024 对 DFU 之外伤口研究社区的外溢贡献。
#6 Multi-scale Attention Network(Murali et al.,pp.81-92,最佳成绩)
DINOv2 + Attention U-Net:自监督骨干 + 多尺度注意力解码器的组合。Dice 0.5709 的读数方法:多尺度设计照顾 DFU 溃疡的尺寸连续谱(与合成图像"按实例大小分组"呼应),注意力机制处理颜色纠缠区——冠军配方是"自监督特征 + 任务专用归纳偏置",而非更大的模型。
#7 A Supervised Segmentation Solution(Xue Feng, Gaofeng Huang,pp.93-100)
标题即声明:监督式方案参赛。在零标注赛道上引入监督信号并如实报告——成绩解读时必须与其他队伍分层比较;它的存在同时是排行榜方法论警示(名次 ≠ 自监督能力排序)与合规透明度样本。
#8 CDe: Focus on the Color Differences(Yifan Wang et al.,pp.101-108)
色彩差异专门设计:针对跨肤色采集导致的颜色分布漂移做显式建模(CDe = Color Differences)。直击 DFU 分割的第一物理难点——同一溃疡在不同肤色/光照下的颜色表征漂移,是论文池里"问题驱动型"设计的代表。
5.5 leaderboard 的可复核性说明
官方 leaderboard 页面(dfuc2024.grand-challenge.org)为 JS 渲染——curl 返回 HTTP 200 但无静态数据,直接抓取不可得。因此本条目所有成绩数字以 overview 论文(LNCS 15335 pp.109-124)为准;第三方复核同样应走论文路径而非页面抓取(坑 5)。
5.6 引用成绩时的四条操作纪律
- 先看方法声明再看分数:#7 监督式参赛的存在使"名次=自监督能力"的默认推断失效;每篇引用前核对其监督源声明。
- 指标配对完整:Dice 与 Jaccard 成对引用(0.5709/0.4793),单引其一会让读者无法交叉验算(两指标可互相近似换算核对)。
- 页码入注:LNCS 15335 各篇页码(§5.2 表)写进引用,避免"DFUC 2024 论文"级模糊指向。
- 量级与精确分层:2024 届冠军可写精确值(Dice 0.5709),2022 届对比值只写量级(≈0.83)——两层的核验状态不同(坑 8)。
§6 获取与许可:三层异构的完整地图
6.1 三层清单
| 层 | 内容 | 获取方式 | 许可 | 直链状态 |
|---|---|---|---|---|
| ① 文档层 | Challenge Brief PDF(2.7 MB,2024-04-23 发布版本) | Zenodo 公开下载 | CC BY-NC-ND-4.0(仅覆盖 PDF) | 公开直链 |
| ② 数据层 | 6,200 张照片本体(train/val/test) | 注册挑战账号 + 签署数据使用协议(EULA)后分批发放 | 协议约束(学术用途) | 无公开直链 |
| ③ 模型层 | 基线权重(DINOv2 probing 三档 + GroundedDINO+SAM) | HuggingFace 下载 | 随权重仓库声明 | 公开直链(17.6 GB) |
6.2 Zenodo 入口的精确坐标(坑 1 详述)
- concept DOI:10.5281/zenodo.6362521——概念 DOI(聚合全部版本的总入口)。
- 落地版本:concept DOI 当前解析到版本 record 11468883(2024-04-23 发布)——文件实为 2.7 MB Challenge Brief PDF,license cc-by-nc-nd-4.0,抓取时点下载 4,999 次。
- 陷阱机制:任务简介/二手文献常把 6362521 写成"数据集 DOI",检索者顺着 DOI 下到的是一份说明书而非数据本体——4,999 次下载里相当比例大概率是把它当数据下的。数据本体只经 EULA 通道发放,Zenodo 上没有、也不会有。
- 正确姿势:把 Zenodo 条目当"官方说明文档"读(赛程、规模、协议指引都在 PDF 里),然后按 PDF 指引走挑战账号 + EULA 通道申请数据。
6.3 EULA 申请制的操作要点
- 需注册 dfuc2024.grand-challenge.org(grand-challenge.org 平台)挑战账号;
- 签署数据使用协议(EULA)——医学影像申请制的标准条款:学术用途限定、禁止再分发、引用要求;
- 通过后分批发放(训练/验证/测试批次节奏见 §3.1 赛程,事后申请者按当期政策执行);
- 合成训练子集(2,000 张)随同一协议发放,不单独开放。
6.4 HuggingFace 基线仓库
- 仓库:
BBracke/DFUC24_baselines(2024-08-01 创建,17.6 GB); - 内容:DINOv2 linear / multi-linear / multi-nonlinear probing 权重 + GroundedDINO+SAM 组合管线;
- 账号身份:BBracke = Benjamin Bracke,FH Dortmund 基线作者本人账号——权重来源权威性直接挂钩官方(坑 7);
- 镜像提示:huggingface.co 直连受限环境用 hf-mirror.com(API 端点
/api/models/BBracke/DFUC24_baselines可查询元数据)。
6.5 数据获取决策树
需求是什么?
├── 只想了解挑战赛规则/规模/协议
│ └── Zenodo record 11468883(Brief PDF,CC BY-NC-ND-4.0,公开直链)
├── 想跑官方基线
│ └── HuggingFace BBracke/DFUC24_baselines(17.6 GB,公开直链)
│ └── 注意:无数据本体时只能对样例或自备影像推理
├── 想训练/评测分割模型
│ ├── 1) 注册 grand-challenge.org 挑战账号
│ ├── 2) 签署 EULA 申请数据(无公开直链,等分批发放)
│ └── 3) 等待期先用基线权重 + 论文方法谱系搭管线
├── 想引用成绩/写综述
│ └── 引 overview 论文(LNCS 15335 pp.109-124),勿引 leaderboard 抓取
└── 想做跨届比较
└── 按 §4.3 三条纪律,指标不得跨届直比
6.6 许可边界一句话
Zenodo PDF 的 CC BY-NC-ND-4.0 只覆盖说明书文档,不延伸到数据本体;数据本体的使用边界完全由 EULA 定义。把"PDF 是 CC 许可"误推为"数据是 CC 许可"是许可层最危险的级联误读(坑 3)。
给三类角色的许可提示各一句:数据使用者——引用成果时同时引 overview 论文与挑战赛(EULA 的引用条款以此为准);平台/库管理员——收录本数据相关资源时,PDF、数据、权重三层的许可字段必须分开建模;综述作者——描述许可时使用"文档 CC BY-NC-ND-4.0 / 数据 EULA 申请制 / 权重随 HF 仓库"的分层句式(附录 W 句式 3 可直接引用),不要写"数据集采用 CC 许可"这类单层表述。
6.7 获取路径的时间与风险成本估算
| 路径 | 时间成本 | 主要风险 | 缓解措施 |
|---|---|---|---|
| Zenodo PDF | 分钟级 | 误当数据(坑 1) | 读 PDF 本身即验证 |
| HF 基线权重 | 小时级(17.6 GB) | 镜像通道不稳定;误当数据(坑 7) | hf-mirror API 断点续传 |
| EULA 数据申请 | 周级起(审核+分批发放) | 赛事周期外发放政策不明(附录 B S 维度) | 提前申请;等待期先搭权重管线 |
| 2022 届旁路(对照实验) | 周级(独立协议) | 与 2024 协议混淆 | 两协议分档管理 |
综合建议:三线并行——当天拿 PDF 与权重,第一周内提交 EULA,等待期用权重+论文方法谱系完成管线预研;数据到位后直接进入训练迭代,把申请制的等待成本摊薄到工程预研期。
§7 生态与工具
7.1 平台与载体
| 载体 | 角色 | 可抓取性 |
|---|---|---|
| dfuc2024.grand-challenge.org | 挑战赛主场:注册、协议、发放、排行榜 | leaderboard 为 JS 渲染,静态抓取不可得(HTTP 200 但无数据) |
| Zenodo(concept 6362521 → record 11468883) | 官方文档存档:Challenge Brief PDF | 静态 API 可抓 |
| HuggingFace BBracke/DFUC24_baselines | 基线权重分发 | API 可抓(受限环境走 hf-mirror.com) |
| Springer LNCS 15335 | 论文集存档(书 + 章节 DOI) | 元数据可抓,正文付费墙 |
7.2 相关研究线
- DFU 检测综述:Yap 组 “Deep learning in DFUs detection”(Comput. Biol. Med. 135:104596, 2021)——DFU 计算视觉研究线的系统梳理,是跨届引用的枢纽文献。
- 慢性伤口数据库迁移:full paper #5(Picaud, Chaumont et al.,pp.71-80)把 SSL encoder 预训练迁移到慢性伤口异构库——DFUC 2024 的自监督表示被证明可作跨库起点。
- 临床动机链:DFU 患病率高、是截肢主要诱因;分割是伤口面积量化与愈合追踪的前置步骤——invited paper(Kendrick et al.,pp.1-14)从临床划界角度补全了"真值从哪来"的叙事。
- DFUC 之外的足溃疡分割资源:文献中另存有多家机构自建的 DFU 影像库(多不可公开获取),检索时注意与 DFUC 系列区分——冠名"DFUC"的只有本系列四届,其余为独立库,勿在引用中混同。
这四条研究线合起来构成"以 DFUC 为枢纽的足溃疡计算生态":上游是临床动机与综述地图,下游是跨库迁移应用,横向是同类资源区分——本条目在生态中的定位是"任务定义者与基准锚点",而非孤立的图片集。
7.3 工程工具箱
- 镜像通道:huggingface.co 直连受限环境走 hf-mirror.com——API 端点(
/api/models/...)可用,网页层有 IP 检测会跳提示页,脚本化抓取一律走 API。 - 平台数据习惯:grand-challenge.org 系列挑战赛的 leaderboard 普遍 JS 渲染,任何"抓排行榜"的自动化需求都应预设"不可得"预案,改走 overview 论文或 archive 版本。
- 版本链追踪:Zenodo concept DOI 适合做长期引用锚点,但引用数据时必须确认落地 record 的实际内容(本届的教训:concept DOI 落地的是 2.7 MB PDF)。
7.4 引用与检索资源坐标
| 资源 | 精确坐标 | 用途 |
|---|---|---|
| 挑战赛平台 | dfuc2024.grand-challenge.org | 规则原文、EULA 入口、赛程公告 |
| Zenodo 文档 | DOI 10.5281/zenodo.6362521(→ record 11468883) | Challenge Brief PDF:规模/赛程/协议权威口径 |
| 论文集 | Springer LNCS 15335,书 DOI 10.1007/978-3-031-80871-5 | 8+2 论文与 overview 的正式存档 |
| overview 章节 | DOI 10.1007/978-3-031-80871-5_10(pp.109-124) | 基线方法与官方成绩数字的唯一稳引用 |
| 基线权重 | HF BBracke/DFUC24_baselines(17.6 GB) |
复现起点;元数据走 hf-mirror API |
| DFU 检测综述 | Yap 组,Comput. Biol. Med. 135:104596(2021) | 跨届与跨方法研究线的枢纽文献 |
| 前作平台 | dfuc2022.grand-challenge.org(同族 dfuc2020/dfuc2021) | 版本链各届的规则与数据通道 |
检索提示:搜 “DFUC” 命中四届混杂,务必叠加年份限定词;搜 “DFUC 2023” 会命中他人误写(该届不存在,坑 6);搜 “DFUC dataset DOI” 高概率被导向 Zenodo PDF——先读坑 1。
7.5 DFUC 系列与相关文献年表
| 年份 | 事件 | 文献/载体 |
|---|---|---|
| 2020 | DFUC 2020 首届(检测任务);同期发布 DFUC 数据集论文 | Cassidy et al.; grand-challenge.org |
| 2021 | DFUC 2021 分类届(15,683 patches,含 3,994 无标签) | 2021 分类 overview |
| 2021 | DFU 深度学习检测综述发表 | Comput. Biol. Med. 135:104596 |
| 2022 | DFUC 2022 语义分割届(全监督天花板确立) | 2022 分割 overview |
| 2023 | 系列空档(无 DFUC 2023) | — |
| 2024-04-23 | Challenge Brief 上线 Zenodo(record 11468883) | Zenodo |
| 2024-05-31 ~ 08-20 | 2024 届赛程运行(训练发放至获奖公布) | grand-challenge.org |
| 2024-08-01 | 基线权重仓创建 | HF BBracke/DFUC24_baselines |
| 2024-10-06 | MICCAI 2024 现场工作坊(马拉喀什) | MICCAI 册页 |
| 2024-10-06 / © 2025 | LNCS 15335 章节线上/书卷版权(双口径) | Springer |
| 2026-09-26 | 本条目抓取与成稿时点 | 千方病案医数集 |
年表读法:2020-2022 三届一年一届节奏紧密,2023 空档后 2024 届重启并升维——空档期大概率对应任务形态重设计(语义分割→自监督实例分割)的准备期,此为合理推断而非文献记载。
§8 方法启示:这个挑战赛教会社区什么
8.1 自监督代价的量化方法论
DFUC 2024 最大的方法论贡献是把"标注价值"做成了可复现实验:同一临床域、同一任务形态(分割),全监督(2022,Dice ≈0.83 量级)与自监督(2024,Dice 0.5709)两届接力给出了跨时代的对照读数。任何做"少标注医学分割"研究的人,都应把这组数字当作现实校准点——自监督不是免费午餐,落差约 0.26 Dice 点的部分就是目前监督信号的真实市场价格。
8.2 probing 基线的设计模式
基线 A 的"三档 probing"(linear/multi-linear/multi-nonlinear)值得所有挑战赛组织者借鉴:它把"预训练特征里有多少任务信息"与"参赛者的任务设计带来多少增量"解耦成两条可分别读数的曲线。参赛者成绩高于 probing 线的部分才是方法创新,低于则说明监督策略反而损伤了特征——这个设计让本届的成绩解读有了共同的零点。
8.3 双基线的多样性宣言
overview 原文明确说两套基线是刻意"vastly different":自监督特征利用(DINOv2 probing)与基础模型零训练拼装(GroundedDINO+SAM)各代表一种起跑哲学。这是对"挑战赛基线=一个弱_baseline"惯例的有意修正——多样化的基线让不同流派的参赛者都有可对照的锚点。
8.4 合成数据作为标注替代的实战检验
2,000 张合成训练图与 2,000 张原始照片对半混编,被多支队伍用作预训练/增广杠杆——这是 2024 年时间点上医学挑战赛对生成式数据的超前配置。但细节不透明(生成器、配比、域间隙处理均未公开)意味着社区只能"用得上、复现不出"——合成数据的透明度与实效之间的落差,本身就是后续论文的机会题。
8.5 监督泄漏的透明化处理
full paper #7 标题自曝"Supervised"参赛,组织方仍收其入集——这传递了两个信号:①排行榜名次与方法声明需要分开读(对照 §5.3);②"自监督赛道里混入监督方法"的治理(规则条款 vs 荣誉机制)是挑战赛设计的新课题。引用本届成绩时,逐篇核对方法声明是基本功。
8.6 容器化评估对方法论文的隐性塑造
平台容器化提交(§3.6)意味着:方法论文里的"环境差异"解释空间被压缩,成绩差异更可归因于方法本身。这对学术生态的隐性价值常被低估——排行榜数字的"环境可信度"高于自报数字,综述引用时容器化赛果应优先于论文自报对照实验。
8.7 "自监督赛道里出现监督参赛"的治理启示
#7 的存在暴露了规则与荣誉机制的错位:规则只禁止测试集泄漏,未禁止"训练侧引入外部标注"(外部监督数据可能在规则灰区)。后续挑战赛设计者从中能提炼的治理条目:①赛道命名要显式定义"允许的监督源清单";②方法声明应作为提交流程的强制字段而非论文自觉;③排行榜分组(纯自监督组/开放组)比单一榜单更能服务科学比较。
8.8 对"合成数据能否替代标注"的阶段性答案
本届给出的答案是"能加成、不能替代":合成图像被多队有效利用(预训练/增广),但没有任何队伍报告仅靠合成+自监督逼近全监督水平——合成数据的确定性生成过程无法注入临床划界的主观一致性。后续研究的正确提问因此从"能不能替代"转向"合成多少、怎么配比,边际收益最大"——而这恰恰需要官方公开生成细节才能形成可比较的答案。
8.9 挑战赛组织者视角的正反经验清单
正面经验(可复制):
- 四届接力形成版本链——单届数据是快照,系列数据是趋势线,后者对社区的长期价值指数级更高;
- 双基线+probing 校准设计——把"方法增量"从"环境噪声"中剥离,成绩可解读性大增;
- 合成数据进训练集——在标注成本高企的域,官方下场提供生成数据是务实的成本工程;
- 容器化评估——环境同构让排行榜数字具备二次分析价值。
反面教训(应规避):
- 文档与数据的发布通道分离(Zenodo PDF vs EULA 数据)却未在文档层反复高亮——坑 1 的 4,999 次误下载是直接代价;
- 合成图像生成细节未公开——社区"用得上、复现不出",杠杆效力打了折扣;
- 赛道监督源治理粗放(允许 #7 监督式参赛混榜)——排行榜作为科学比较工具的可信度受损;
- 年份跳号(无 2023)无官方说明页——检索生态里的误写源头。
§9 库内关系:与千方病案医数集其他条目的连接
9.1 互链地图
| 库内条目 | record_id | 连接逻辑 |
|---|---|---|
| isic-archive | 56 | 皮肤影像申请制/分级获取的另一大宗:ISIC Archive 与 DFUC 同属"临床皮肤-照片域",获取模式同样是注册+条款约束 |
| derm7pt | 110 | 皮肤影像七点标注法数据集:与 DFUC 共享"皮肤病照片+语义标注"的域形态,可作为皮肤影像跨域预训练的参照 |
| chest-x-ray-segmentation | 601 | 胸片分割数据集:与 DFUC 2024 同为医学分割任务,可对比"影像域 vs 照片域"的自监督迁移差异 |
| chexmask-cxr-segmentation-data | 602 | 胸片掩码数据集:公开掩码发放模式与 DFUC 的 EULA 申请制形成可获取性光谱对照 |
| heart-lung-segmentations-data | 610 | 心肺分割掩码:另一"掩码公开直链"样本,反衬 DFUC 数据层的封闭性 |
| lung-segment-mimic-cxr | 613 | MIMIC-CXR 肺分割衍生集:法定访问协议(PhysioNet 凭证)与 DFUC EULA 同属"协议墙"谱系 |
| totalsegmentator | 422 | 全身 CT 自动分割工具/数据:工具开放+数据受控的组合与 DFUC"模型开放+数据申请制"结构同型 |
9.2 在可获取性光谱上的位置
库内条目已形成可获取性光谱(公开直链 → AWS Registry → Zenodo → 注册墙 → 请求制/协议墙)。DFUC 2024 的三层异构(文档公开直链 / 数据 EULA 申请制 / 模型公开直链)处于光谱中段偏封闭一侧,与 PANDA-PLUS"WSI 公开/掩码请求制/Bench 公开"的错位结构、与 MIMIC 系的凭证协议墙同属"数据本体受控"家族——但 DFUC 的特殊性在于连文档都可能被误当数据(concept DOI 陷阱),检索者掉坑率因此更高。
把这个位置感翻译成检索预期:从开放端条目(如 601/602/610 的"图像+掩码打包直链")迁移过来的用户,预期管理重点在"掩码不可直取";从封闭端条目(MIMIC 系)迁移来的用户,预期管理重点在"协议主体是赛事账号体系而非学术数据中心,长期有效性绑定赛事生命周期"。两端读者的共同动作是先读 §6.5 决策树再动手。
9.3 检索与引用建议
- 从皮肤影像条目(isic-archive/derm7pt)跳入的读者:注意 DFUC 照片是足部而非皮肤镜/皮损特写,域差异大于词汇相似。
- 从分割掩码条目(chest-x-ray-segmentation/chexmask/heart-lung/lung-segment)跳入的读者:DFUC 的标注不在公开渠道,不存在"下完图像顺手拿掩码"的路径。
- 从工具条目(totalsegmentator)跳入的读者:DFUC 24 基线权重可下载数据不可,复现分割管线前先确认自己有 EULA 数据通道。
9.4 与申请制/协议墙家族的三轴对照
| 条目 | 数据形态 | 访问控制 | 公开层 | 与 DFUC 2024 的对照轴 |
|---|---|---|---|---|
| isic-archive(56) | 皮肤临床+皮肤镜影像 | 注册 + 使用条款 | 图像与元数据大批公开 | 同为"照片域大宗",但 ISIC 批量公开 vs DFUC 分批 EULA |
| derm7pt(110) | 七点标注法皮损照片 | 学术申请 | 部分公开 | 同属皮肤相关照片域;标注体系(七点结构)vs DFUC 实例掩码 |
| chest-x-ray-segmentation(601) | 胸片 + 掩码 | 公开 | 直链 | 影像域公开掩码 vs 照片域申请制掩码 |
| chexmask-cxr-segmentation-data(602) | 胸片分割掩码 | 公开 | 直链 | 反衬 DFUC 数据层封闭性 |
| heart-lung-segmentations-data(610) | 心肺 CT 掩码 | 公开 | 直链 | 同上 |
| lung-segment-mimic-cxr(613) | MIMIC-CXR 肺分割 | PhysioNet 凭证 | 签协议后直链 | 同属"协议墙",但 MIMIC 协议标准化程度更高 |
| totalsegmentator(422) | 全身 CT 自动分割 | 工具开源 + 数据受控 | 模型直链 | 与 DFUC"模型开放/数据受控"同构的双层结构 |
三轴总结:①访问控制轴——公开直链(601/602/610)→ 凭证协议(613)→ EULA 申请制(dfuc-2024)梯度递进;②公开层轴——DFUC 与 totalsegmentator 同型(模型公开/数据受控),与 601/602/610 的"数据全公开"异型;③域轴——DFUC 独占足部照片生态位,与皮肤影像(56/110)相邻但非同域(足部照片 ≠ 皮肤镜影像)。
9.5 库内跳入场景与阅读路径
| 你从哪里来 | 你的问题 | 推荐阅读路径 |
|---|---|---|
| isic-archive / derm7pt | “足部数据怎么拿?” | §6.3 → 坑 1 → 坑 3 |
| chest-x-ray 系掩码条目 | “掩码在哪下?” | §6.1 表 → 9.2 → 附录 J |
| totalsegmentator | “权重下了就能跑吗?” | §3.4 → 附录 K |
| MIMIC 系条目 | “协议墙长什么样?” | §6.3 → 9.4 → 附录 E |
| PANDA-PLUS | “挑战赛+论文集结构像不像?” | §5 → §6 → 附录 B |
| 检索引擎直达 | “这数据能AI训练吗?” | §0 → §1 Q3 → §10 |
路径设计意图:不同入口的读者第一问不同——获取类问题全部收敛到 §6 与坑 1/坑 3;复现类问题收敛到 §3 与附录 F;比较类问题收敛到 §9 与附录 I-K。
§10 避坑清单:8 个高发坑
以下是本条目检索、下载、引用全链路中实测踩过或高概率踩中的坑,按链路顺序排列:
坑 1:把 Zenodo concept DOI 当数据下载入口
concept DOI 10.5281/zenodo.6362521 聚合的当前落地版本 record 11468883 实为 2.7 MB Challenge Brief PDF(cc-by-nc-nd-4.0),不是数据本体;其 4,999 次下载(抓取时点)里相当比例大概率是误下。数据本体只走挑战账号 + EULA 通道,Zenodo 上没有数据。凡见"DFUC 2024 数据集 DOI"字样,先确认落地 record 内容再动手。
坑 2:出版年双口径
Springer 章节页写 “Published: 06 October 2024”,书卷版权页写 “© 2025 Springer Nature Switzerland”,Google Scholar 部分条目显示 2025/2/7 记录口径。引用最稳写法:“LNCS 15335, 2024-10-06 线上 / 卷 © 2025”。单写任一年份都会与另一半检索结果对不上。
坑 3:把"PDF 是 CC 许可"级联误读为"数据是 CC 许可"
Zenodo PDF 的 CC BY-NC-ND-4.0 只覆盖说明书文档。数据本体的使用边界完全由 EULA 定义(学术用途、禁止再分发、引用要求),与 CC 许可无关。三层许可(PDF/数据/模型权重)各自独立,引用许可时必须分层写。
坑 4:把训练集"无标注"当数据缺陷
训练主分割集 4,000 张不带人工像素标注是自监督任务设计,不是标注未完成或疏漏。把"没标注"写成"数据质量差"或"标注待补"都是事实错误;监督信号在验证/测试评估侧,这是赛题的核心设定。
坑 5:试图抓取 leaderboard 静态数据
dfuc2024.grand-challenge.org 的排行榜为 JS 渲染——curl 返回 HTTP 200 但正文无静态数据,任何静态抓取脚本必然空手。官方成绩以 overview 论文(LNCS 15335 pp.109-124)为准;第三方复核同样走论文路径。
坑 6:版本链跨届混引
四届任务各异(检测/分类/语义分割/自监督实例分割)、指标各异(mAP/macro F1/Dice)、无 DFUC 2023 跳号、且"4,000 张"一词在 2022 届(全标注 640×480)与 2024 届训练集(2,000 原始+2,000 合成零标注)数字撞车。跨届比较必须带届次、任务、指标三要素,指标绝不可直接连线成"趋势"。
坑 7:不知道 HuggingFace 账号身份就引用权重
BBracke/DFUC24_baselines 的账号持有人 Benjamin Bracke 是 FH Dortmund 基线作者本人——权重权威性直接挂钩官方;但 17.6 GB 是模型权重不是数据本体,“基线开源”≠“数据开源”。受限网络环境走 hf-mirror.com API 端点,网页层有 IP 检测。
坑 8:把未核验数字写成精确值
DFUC 2022 冠军 Dice 的 ≈0.83 是文献口径,未经三轮核验到原始 leaderboard,本文全程以"≈0.83 量级"表述并列入待核项;同理,合成图像生成方法、测试集真值开放程度、Murali et al. 部分作者机构归属均属待核。写综述时的纪律:核验不足的数字要么标注口径来源,要么降格为量级表述,不得写成精确值。
坑点使用指南
- 下载前必读:坑 1、坑 3、坑 7——三个"以为是数据其实不是"的变体。
- 引用前必读:坑 2、坑 6、坑 8——三个"年份/届次/精度"事故区。
- 写作前必读:坑 4、坑 5——两个事实定性错误(任务设计≠缺陷;论文数字≠页面抓取)。
- 坑点编号被正文多处交叉引用(如 §0 读法、FAQ、附录 C),检索"坑 N"可全库定位同一坑的所有出现点。
§11 总结:一条版本链,一个时代问题
DFUC 2024 表面是一场比赛,实质是一次公开的社会实验:把医学分割的监督信号抽干之后,社区的真实水位在哪里?答案是 Dice 0.5709——比全监督天花板(≈0.83 量级)低出约 0.26 个点。这个数字不会让任何人心动,但它诚实得可贵:在"大模型时代标注已死"的喧哗里,DFUC 2024 给出了足溃疡域的实测证词——自监督表示(DINOv2 系)确实能用,但任务专用监督依然昂贵且不可替代。
对数据工程侧,本条目留下的操作要点浓缩为三句:下文件前先看落地 record 是什么(坑 1);读许可时按 PDF/数据/权重三层分开(坑 3);引用成绩时逐篇核对方法声明(§5.3)。对研究侧,则是一组值得反复引用的对照锚点:probing 三档基线、双基线多样性设计、合成数据杠杆、以及"8+2 论文池"里那篇自曝监督式的参赛论文——每一个都是挑战赛方法论的独立样本。
最后回到版本链:2020 检测、2021 分类、2022 分割、2024 自监督——DFUC 四届连起来读,就是"医学影像监督信号经济学"的四章连载。下一届无论往哪走(多模态?纵向愈合追踪?跨域泛化?),0.5709 这个起点都会被反复对标。
对千方病案医数集的读者,本条目的检索价值排序:①一个被 4,999 次误下载验证过的 DOI 陷阱标本(坑 1);②"模型开放/数据受控"结构家族的又一成员(与 totalsegmentator 同型,§9.4);③四届版本链作为跨届引用的方法论纪律样本(§4.3、坑 6);④0.5709 vs ≈0.83 这组对照读数——任何讨论"少标注医学分割"的文章都值得引用的现实锚点。若本条目只被记住一件事,应当是:先问口径,再看落地,最后才动手下载。
(本条目完。事实档案见同目录 FACTS.md;修订流程见附录 R 与附录 V;数据卡与判例表见附录 Y/II。)
FAQ:高频问答 60 问
Q1:DFUC 2024 的数据本体在哪里下载?
没有公开直链。需在 dfuc2024.grand-challenge.org 注册挑战账号、签署数据使用协议(EULA)后分批发放。Zenodo 上的 DOI 只是说明书 PDF(坑 1)。
Q2:Zenodo 上那个 DOI 到底是什么?
concept DOI 10.5281/zenodo.6362521 聚合到当前版本 record 11468883(2024-04-23 发布),内容是 2.7 MB 的 Challenge Brief PDF,license 为 CC BY-NC-ND-4.0(仅覆盖文档)。它不是数据。
Q3:训练集真的没有标注吗?
真的,且是任务设计:训练主分割集 4,000 张(2,000 原始 + 2,000 合成)不带人工像素标注,强迫参赛者用自监督/半监督策略。监督标注在验证集(200 张)与测试集(2,000 张)评估侧。
Q4:为什么 2024 年的任务比 2022 年还难?
因为同时加了两层难度:把监督信号抽走(自监督)+ 把输出从前景/背景二分升级为独立实例(实例分割)。冠亚军成绩的大幅回落正是任务升维的体现。
Q5:冠军成绩是多少?
Murali et al. 的 Multi-scale Attention Network(DINOv2 + Attention U-Net):Dice 0.5709 / Jaccard 0.4793(LNCS 15335 pp.81-92)。
Q6:DFUC 2022 冠军是多少?和 2024 能直接比吗?
文献口径 Dice ≈0.83 量级(未三轮核验到原始 leaderboard,见坑 8)。同为分割任务可作量级对照,但要注明"全监督语义 vs 自监督实例"的任务差异。
Q7:四届 DFUC 分别是什么任务?
2020 检测(bounding box,mAP 0.6940)、2021 分类(4 类,macro F1 0.6216,15,683 patches)、2022 语义分割(Dice ≈0.83 量级)、2024 自监督实例分割(Dice 0.5709)。没有 DFUC 2023。
Q8:11,000 张和 6,200 张什么关系?
11,000 是 DFUC 系列累计构建的图像总库(官方 Brief 口径),6,200 是 2024 届任务数据的 train/val/test 总量。两个口径并行存在,引用时注明。
Q9:2024 届训练集里的合成图像是什么?
2,000 张按溃疡实例大小分组生成的合成图像,与 2,000 张原始照片同协议发放,供自监督预训练/增广使用;多支参赛队伍实际用上了。生成技术细节官方未充分展开(待核)。
Q10:基线有哪些?
两套刻意差异极大的基线:A 为 DINOv2 自监督特征 + probing 三档(linear/multi-linear/multi-nonlinear);B 为 GroundedDINO + SAM 开放词汇组合。overview 原语称之为 “vastly different”。
Q11:基线权重在哪下载?多大?
HuggingFace BBracke/DFUC24_baselines(2024-08-01 创建,17.6 GB)。受限网络环境走 hf-mirror.com API 端点。
Q12:BBracke 是谁?
Benjamin Bracke,FH Dortmund 基线作者本人——账号与官方团队直接挂钩,权重来源权威。但 17.6 GB 是权重不是数据(坑 7)。
Q13:谁主办 DFUC 2024?
双主理:Manchester Metropolitan University(Yap/Kendrick/Cassidy,全系列核心)+ FH Dortmund(Brüngel/Bracke/Friedrich,基线与 overview 执笔);临床合作 Reeves(Lancaster University)与 Pappachan(Lancashire Teaching Hospitals)。
Q14:论文集在哪、收录了多少篇?
Springer LNCS 15335,书 DOI 10.1007/978-3-031-80871-5;11 支队伍投稿,评审后 8 篇 full papers + 2 篇 invited papers 入集。
Q15:overview 论文怎么引用?
Brüngel R, Kendrick C, Cassidy B, Bracke B, Friedrich CM, Reeves ND, Pappachan JM, Yap MH. “Diabetic Foot Ulcer Grand Challenge 2024: Overview and Baseline Methods.” LNCS 15335, pp.109-124, DOI 10.1007/978-3-031-80871-5_10。出版年双口径见 Q16。
Q16:出版年写 2024 还是 2025?
章节页 “Published: 06 October 2024”,书卷版权页 “© 2025”。最稳写法:“LNCS 15335, 2024-10-06 线上 / 卷 © 2025”(坑 2)。
Q17:测试集有标注吗?能给参赛者吗?
测试集 2,000 张由组织方持有标注用于排名;是否随申请向参赛者公开完整实例真值未在可抓取文档中明确(待核项)。规则明确测试集不可用于训练。
Q18:leaderboard 为什么抓不到?
页面 JS 渲染——HTTP 200 但无静态数据。官方数字以 overview 论文为准(坑 5)。
Q19:EULA 申请要什么?
挑战账号注册 + 签署数据使用协议(学术用途限定、禁止再分发、引用要求等标准条款),通过后分批发放,合成子集随同一协议发放、不单独开放。
Q20:可以只用基线权重不做申请吗?
可以下载权重并对自备影像推理,但训练/评测分割模型必须要有 EULA 数据通道——权重开源不等于数据开源。
Q21:允许用预训练模型吗?
允许,且正是任务核心:自监督赛题允许无标签预训练(DINOv2 等通用骨干合法)。唯一硬边界是测试集不可用于训练。
Q22:有队伍用监督方法参赛吗?
有。full paper #7(Xue Feng, Gaofeng Huang,pp.93-100)标题自曝 “A Supervised Segmentation Solution”。引用成绩时需逐篇核对方法声明(§5.3)。
Q23:DFU 分割的临床意义是什么?
溃疡面积量化是伤口分级、愈合追踪与治疗调整的前置步骤;DFU 是糖尿病患者截肢的主要诱因之一。实例级输出支撑"逐个溃疡追踪愈合"。
Q24:为什么 DFU 照片难分割?
跨设备/光照/肤色采集的异构性 + 溃疡与胼胝、坏疽、敷料、脚趾的颜色纹理纠缠 + 实例划界的临床主观性(invited paper 专门讨论)。
Q25:和 ISIC/皮肤影像数据集什么关系?
同属临床照片域,但 DFUC 是足部照片而非皮肤镜影像,域差异大;获取模式同为注册+协议约束(库内互链 isic-archive(56)、derm7pt(110))。
Q26:probing 基线有什么用?
它给出"自监督特征免费上限"的零点:参赛方法高于 probing 线的部分才是真增量,低于则说明监督策略损伤了特征——成绩解读的共同参照系。
Q27:2020 届数据现在还能用吗?
能。DFUC 2020 数据以 “DFUC2020 dataset” 论文(Cassidy et al.)独立发布,是 DFU 检测研究的标准基准,是 11,000 总库的一部分。
Q28:怎么引用本条目?
引用千方病案医数集条目页 https://www.qianfanghub.com/ai-ready-dataset/dfuc-2024/675,并注明抓取时点 2026-09-26;核心事实请回溯 overview 论文与 Challenge Brief 原文。
Q29:DFUC 2025 存在吗?
截至本条目抓取时点(2026-09-26),可核验的版本链止于 2024 届;后续届次信息本条目不做推测,请查 grand-challenge.org 平台现状。
Q30:这条数据集"AI-Ready"程度如何?
中等偏上:文档公开(Zenodo)、模型开放(HF 17.6 GB)、但数据本体协议墙 + 训练侧零标注,决定了它是"方法研究友好、数据即用性受限"的类型。DAIMS 评估见附录 B。
Q31:验证集 200 张用来干什么?
模型选择与调参,不是统计推断——200 张是"自查规模",最终成绩以 2,000 张测试集为准。不要用验证集成绩写论文主结论。
Q32:提交是怎么评估的?
grand-challenge.org 容器化提交:推理管线打包为算法容器,平台侧以组织方持有的测试集实例标注计算 Dice/Jaccard。环境同构,成绩差异可归因于方法。
Q33:可以用外部数据吗?
规则允许无标签预训练;外部标注数据的引入边界以当届规则原文为准——论文池 #7 的监督式参赛说明监督方法确实进入了赛道,引用成绩时务必逐篇核对方法声明。
Q34:probing 和 fine-tuning 的区别在本届有多重要?
决定性:probing 是基线(冻结特征+轻量头),多数参赛方法是"冻结/自监督适配骨干+任务头"——高于 probing 线的增量才是方法贡献。任何"低于基线 A"的成绩说明监督策略反而损伤了特征。
Q35:为什么 DINOv2 成了全场最大公约数?
通用自监督预训练、无需医学标注、patch token 天然适配密集预测——三重属性恰好对上本届"零标注 + 实例分割"的约束。冠军与 #1/#4 均以其为起点。
Q36:GroundedDINO+SAM 在 DFU 上表现如何?
基线 B 的意义是确立"零训练拼装"的下限而非冲榜——开放词汇检测对"ulcer/wound"类提示的敏感度、SAM 对模糊边界的过分割倾向,都使拼装管线能跑通但不占优。精确成绩以 overview 论文为准。
Q37:合成图像算"标注"吗?
不算:合成图与原始训练图一样不带人工像素标注。它的价值在预训练与增广的分布覆盖,不在监督信号。
Q38:DFUC 2024 的掩码是什么格式?
掩码随 EULA 发放包提供,格式未在公开文档中统一说明(待核项);公开层面无样例掩码可查——这是可互操作性评分(附录 B)偏低的主因。
Q39:能拿到 DFUC 2022 的数据吗?
走 2022 届自己的申请通道(dfuc2022.grand-challenge.org),与 2024 届协议独立。两届数据不可混用拼凑训练集。
Q40:引用四届成绩的正确姿势?
每届单独成句,带任务+指标+届次,例如"DFUC 2024(自监督实例分割)冠军 Dice 0.5709"。禁止跨指标连线、禁止省略届次("DFUC Dice 0.57"是错误写法)。
Q41:这条数据适合做什么研究?
①少标注/无标注医学分割方法;②合成数据在医学域的有效性;③基础模型(DINOv2/SAM)在照片域的迁移;④挑战赛方法论(双基线/probing 校准);⑤DFU 伤口量化临床应用。
Q42:不适合做什么?
①需要大规模患者级元数据的研究(未公开);②多中心统计推断(患者级信息缺失);③"开箱即用"产品化训练(数据要 EULA 且训练侧零标注)。
Q43:和 DFUC 2021 的无标签 patch 什么关系?
2021 届已有 3,994 张无标签 patch(半监督伏笔),2024 届把"无标注"推向整个训练分区——理念一脉相承,但规模与任务层级不同(patch 分类 vs 全图实例分割)。
Q44:条目里"待核"是什么意思?
指经三轮多源核验仍未锚定到一手来源的数字/事实(共 4 条,见坑 8 与附录 C)。条目对它们使用量级/口径化表述,不做精确化转写——这是本库的核验纪律。
Q45:为什么条目强调"下载 4,999 次"?
它是坑 1 的量化证据:一个 2.7 MB 的说明书 PDF 有近五千次下载,大概率包含大量"当数据下"的误用——提醒后来者看清落地 record 内容再动手。
Q46:能直接用基线权重做临床演示吗?
技术上可对自备影像推理,但临床使用需独立的验证与合规路径——基线权重定位是方法学起点,非医疗器械;EULA 条款同样约束演示用途,使用前读协议原文。
Q47:本条目与 FACTS.md 什么关系?
FACTS.md(同目录)是本条目的事实档案:全部数字的来源、抓取路径与待核清单。冲突时以 FACTS.md 的口径为准并优先回溯一手来源。
Q48:发现条目有错怎么办?
按附录 R 的维护守则处理:核对一手来源→更新 FACTS.md→同步修正成稿并在文末记录修订。勿直接改数字不留痕。
Q49:训练集 2,000 张原始照片从哪来?
属 DFUC 系列累计 11,000 张总库的组成部分(官方 Brief 口径),具体与 2020-2022 届数据的交集划分未在公开文档中逐张说明——引用"11,000 总库"与"6,200 任务口径"时保持两个口径并行,勿自行推断重叠率。
Q50:实例分割的"实例"在 DFU 里指什么?
每个独立的溃疡病灶为一个实例——足部可能同时存在多个溃疡灶,实例级输出要求逐个分割而非整体前景化,这正是"逐溃疡愈合追踪"的临床需求形态。
Q51:冠军方法为什么不直接微调 DINOv2?
在零标注约束下,全参微调缺乏监督信号来源;冠军(Murali et al.)采用 DINOv2 特征 + Attention U-Net 解码器的组合——骨干提供通用表示,任务结构由解码器与(可行的)半监督信号补足。
Q52:基线 B 的文本提示写什么?
开放词汇检测的提示工程(如 “ulcer, wound on skin”)是拼装管线的关键变量之一;官方基线的具体提示词以 HF 仓库实现为准,本条目不转写以免引入版本漂移。
Q53:为什么关注 Jaccard 而不仅是 Dice?
两指标对小目标重叠的敏感度不同(Jaccard 对欠分割更惩罚),DFU 溃疡实例普遍偏小——成对引用 Dice/Jaccard 能暴露"高 Dice 低 Jaccard"式的假阳性偏差。
Q54:这届有没有"大模型赢麻了"的剧情?
没有:零训练的基础模型拼装(基线 B)与自监督特征利用(基线 A)都没有冲到榜首,冠军靠的是"自监督骨干 + 任务专用注意力解码器"的工程组合——这是一个反"基础模型万能"叙事的实测样本。
Q55:挑战赛结束后数据还能申请吗?
平台与协议的长期有效性以 dfuc2024.grand-challenge.org 现状为准;本条目抓取时点(2026-09-26)未见发放终止公告,但赛事周期结束后政策变动风险已在附录 B 的 S 维度提示。
Q56:为什么本条目反复强调"口径"一词?
DFUC 的事故区几乎全是口径问题:6,200 vs 11,000(任务 vs 系列)、4,000 vs 4,000(两届撞车)、2024 vs 2025(出版年)、PDF 下载量 vs 数据下载量——把"先问口径"变成肌肉记忆,是本条目最想传递的检索素养。
Q57:可以用这数据做皮肤癌/皮肤病研究吗?
域不匹配:DFU 是慢性创面而非皮肤肿瘤,照片含大量足部解剖背景;做跨域研究(如"创面→皮损迁移")合法但要显式声明域差异,勿与 ISIC 系结果直接对标。
Q58:8 篇 full paper 哪几篇最适合入门复读?
建议顺序:#6(冠军,读"特征+解码器"组合)→ #1(读"特征+成熟框架"的保守路线)→ #8(读问题驱动设计)→ #5(读赛后迁移);#7 最后读并带着"监督边界"问题读。
Q59:如何核验本条目里某一个数字?
三步:①查附录 C 的来源映射表定位来源与位置;②优先回一手源(LNCS 章节/Zenodo PDF/HF API);③对不上一手源时以 FACTS.md 的口径与抓取时点为准,勿采二手转写。
Q60:这份数据的"AI-Ready"短板会补齐吗?
取决于组织方:若未来公开样例掩码、合成生成细节或转为注册制直链发放,A/I 两维度评分将显著上修——本条目附录 R 已列触发更新的具体事件清单。
事实清单:可核查断言 44 条
- DFUC 2024 全称 Diabetic Foot Ulcers Grand Challenge 2024,为第 4 届。
- 挂靠 MICCAI 2024(第 27 届),现场工作坊于 2024-10-06 在马拉喀什举办。
- 任务为自监督条件下的糖尿病足溃疡实例分割。
- 任务数据 6,200 张:训练 4,000(原始 2,000 + 合成 2,000)、验证 200、测试 2,000。
- 训练主分割集不带人工像素标注,为任务设计而非数据缺陷。
- DFUC 系列累计图像库为 11,000 张(Challenge Brief 官方口径)。
- 合成训练图像按溃疡实例大小分组生成;生成技术细节官方文档未充分展开。
- 验证/测试集实例分割标注由组织方提供,用于评估与排名。
- 主理团队为 Manchester Metropolitan University(Yap/Kendrick/Cassidy)与 FH Dortmund(Brüngel/Bracke/Friedrich)双核心。
- Moi Hoon Yap 为通讯组织者(ORCID 0000-0001-7681-4287)。
- 临床合作者含 Neil D. Reeves(Lancaster University)与 Joseph M. Pappachan(Lancashire Teaching Hospitals NHS FT)。
- 论文集为 Springer LNCS 15335,书 DOI 10.1007/978-3-031-80871-5。
- overview 章节 DOI 10.1007/978-3-031-80871-5_10,pp.109-124,八作者署名。
- 章节页 Published 2024-10-06,书卷版权页 © 2025 Springer Nature Switzerland(双口径)。
- 论文池为 11 支队伍投稿,评审后 8 篇 full papers + 2 篇 invited papers。
- overview 原文结论:高自监督度下精确 DFU 分割 “currently seems out of reach”。
- 冠军/最佳成绩:Murali et al.(pp.81-92)Dice 0.5709 / Jaccard 0.4793,方法为 DINOv2 + Attention U-Net。
- 基线 A 为 DINOv2 自监督特征 + probing 三档(linear/multi-linear/multi-nonlinear)。
- 基线 B 为 GroundedDINO + SAM 开放词汇组合,零训练拼装路线。
- overview 原语称两基线 “vastly different”,展示欢迎方法的多样性。
- 基线权重公开于 HuggingFace BBracke/DFUC24_baselines(2024-08-01 创建,17.6 GB)。
- BBracke 即基线作者 Benjamin Bracke(FH Dortmund)本人账号。
- 评估指标为 Dice / Jaccard(IoU)等分割标准。
- 参赛规则允许无标签预训练,测试集不可用于训练。
- 赛程:训练集 2024-05-31、验证 06-21、测试 07-01、截止 08-15、获奖 08-20、工作坊 10-06。
- Zenodo concept DOI 为 10.5281/zenodo.6362521,当前落地版本 record 11468883。
- record 11468883(2024-04-23 发布)实为 2.7 MB Challenge Brief PDF,license cc-by-nc-nd-4.0,抓取时点下载 4,999 次。
- 数据本体为签协议申请制(EULA),无公开直链,合成子集随同一协议发放。
- DFUC 2020 为检测任务,最佳 mAP 0.6940 / F1 0.7434(Deformable Conv)。
- DFUC 2021 为 4 类分类任务,15,683 patches(5,955 train + 5,734 test + 3,994 无标签),最佳 macro F1 0.6216(ViT+DeiT)。
- DFUC 2022 为全监督语义分割,4,000 张 640×480,5 位足病医师标注,冠军 Dice ≈0.83 量级(文献口径,未三轮核验)。
- DFUC 版本链无 2023 届(年份跳号)。
- DFUC 2020 数据以 “DFUC2020 dataset” 论文(Cassidy et al.)独立发布,为检测研究标准基准。
- 8 篇 full papers 含 DINOv2+Mask R-CNN(pp.17-28)、ViT 注意力无监督(pp.29-41)、特征对应蒸馏(pp.42-54)、多阶段 SSL(pp.55-67)、SSL 迁移慢性伤口库(pp.71-80)、多尺度注意力网络(pp.81-92)、监督式方案(pp.93-100)、色彩差异聚焦 CDe(pp.101-108)。
- 2 篇 invited papers:临床划界方法论(Kendrick et al.,pp.1-14)与 overview 本身(pp.109-124)。
- dfuc2024.grand-challenge.org leaderboard 为 JS 渲染,静态抓取不可得,官方数字以 overview 论文为准。
- 提交评估为平台容器化流程:算法容器统一环境,平台侧以组织方标注计算指标。
- 基线 A 的 probing 设计为成绩解读提供"自监督特征免费上限"零点。
- 冠军方法(#6)为 DINOv2 骨干 + 多尺度注意力解码器(Attention U-Net 族)。
- full paper #2 来自波兰团队(Brodzicki et al.),为论文池中自监督纯度最高的路线之一。
- full paper #5 为赛后篇,将 SSL 编码器预训练迁移至慢性伤口异构数据库(Picaud, Chaumont et al.)。
- full paper #7 标题自曝监督式参赛(Xue Feng, Gaofeng Huang),构成排行榜解读的方法论警示。
- invited paper 之一(Kendrick et al.,pp.1-14)讨论 DFU 临床划界主观性向机器可解释分割的转译。
- 患者级数量未公开,公开口径止于图像级(6,200 张/11,000 张两个图像级口径并行)。
术语表:42 个关键概念
| 术语 | 释义 |
|---|---|
| DFU(Diabetic Foot Ulcer) | 糖尿病足溃疡,糖尿病患者足部的慢性创面,截肢主要诱因之一 |
| DFUC | Diabetic Foot Ulcers Grand Challenge,糖尿病足溃疡大挑战系列赛(2020/2021/2022/2024 四届) |
| 实例分割(instance segmentation) | 输出每个对象实例的独立掩码;与前景/背景二分的语义分割相区别 |
| 语义分割(semantic segmentation) | 像素级类别标注(如溃疡/非溃疡),DFUC 2022 的任务形态 |
| 自监督学习(self-supervised learning) | 从无标注数据构造监督信号的学习范式,本届任务的核心约束 |
| 半监督(semi-supervised) | 少量标注 + 大量无标注混合训练的策略族,本届参赛方法常用 |
| probing | 冻结骨干特征、仅训练轻量探针头的评估法,用于测特征信息量 |
| DINOv2 | Meta 的自监督 ViT 预训练模型,本届基线与多支参赛队伍的特征骨干 |
| linear probing | 线性探针:特征上只训练线性层,特征信息量的下界读数 |
| multi-nonlinear probing | 多层非线性探针:探针复杂度上探,测特征可挖掘深度 |
| SAM(Segment Anything) | Meta 通用分割基础模型,基线 B 的分割执行器 |
| GroundedDINO | 开放词汇检测器,以文本提示框选目标,基线 B 的检测前端 |
| 开放词汇(open-vocabulary) | 用自然语言文本指定检测类别的模型能力 |
| 基础模型(foundation model) | 大规模预训练、跨任务迁移的通用模型;基线 B 展示其零训练拼装路线 |
| 合成数据(synthetic data) | 程序/模型生成的图像;本届训练集含 2,000 张,按溃疡实例大小分组 |
| EULA(数据使用协议) | End User License Agreement;DFUC 数据本体的发放与使用边界载体 |
| concept DOI | Zenodo 概念 DOI,聚合某数据集全部版本的总入口(本例 6362521) |
| version record | Zenodo 具体版本记录(本例 11468883,2.7 MB PDF) |
| CC BY-NC-ND-4.0 | 署名-非商业-禁止演绎许可;仅覆盖 Zenodo PDF 文档 |
| LNCS | Springer Lecture Notes in Computer Science;论文集所在丛书,卷 15335 |
| MICCAI | 医学图像计算与计算机辅助干预顶会;2024 年第 27 届于马拉喀什 |
| grand-challenge.org | 医学挑战赛托管平台,DFUC 2024 的注册/发放/排行载体 |
| mAP | mean Average Precision,检测任务指标(DFUC 2020) |
| macro F1 | 各类别 F1 的宏平均,分类任务指标(DFUC 2021,类别不平衡敏感) |
| Dice | 分割重叠度指标:2 |
| Jaccard(IoU) | 交并比,分割重叠度的另一标准读法 |
| 愈合前/愈合后(healing/healed) | DFUC 2021 四类分类中的两个状态类,反映纵向 wound 状态 |
| hf-mirror.com | HuggingFace 镜像站,直连受限环境的 API 通道 |
| 伪标注(pseudo-label) | 用模型预测当监督信号的训练技巧;噪声在 DFU 颜色纠缠区易被放大 |
| 域间隙(domain gap) | 合成数据/跨设备数据与目标分布之间的统计差异 |
| 跨肤色(cross-skin-tone) | 采集人群肤色多样带来的颜色分布漂移,DFU 照片核心难点之一 |
| 胼胝(callus) | 足部角化增厚,黄褐色外观易与溃疡混淆 |
| 坏疽(gangrene) | 组织坏死呈黑褐色,深度 DFU 常见形态,分割中易漏检/错检 |
| 敷料(dressing) | 伤口覆盖物,照片中的异物干扰源 |
| 愈合追踪(wound healing tracking) | 纵向测量溃疡面积变化的临床流程,实例分割的应用出口 |
| 伤口面积量化 | 由分割掩码换算溃疡面积,是 DFU 分割的临床价值落点 |
| 检测(detection) | 输出边界框的定位任务,DFUC 2020 形态 |
| bounding box | 目标外接矩形;检测任务的输出单元 |
| patch | 从全图裁出的图像块;DFUC 2021 的数据单元(15,683 个) |
| 无 DFUC 2023 | 版本链年份跳号事实:2022 与 2024 之间未办届 |
| 容器化提交 | grand-challenge.org 的评估方式:算法打包为统一环境容器 |
附录 A:元数据速览卡
| 字段 | 值 |
|---|---|
| slug | dfuc-2024 |
| 类型 | 挑战赛 + 任务数据集(自监督实例分割) |
| 挂靠 | MICCAI 2024(Marrakesh,2024-10-06 工作坊) |
| 团队 | MMU(Yap/Kendrick/Cassidy)+ FH Dortmund(Brüngel/Bracke/Friedrich) |
| 规模 | 6,200 张(4,000/200/2,000);系列总库 11,000 张 |
| 论文 | LNCS 15335(书 DOI 10.1007/978-3-031-80871-5;overview 章节 _10,pp.109-124) |
| 许可 | 三层异构(PDF CC BY-NC-ND-4.0 / 数据 EULA / 权重 HF 公开) |
| 抓取时点 | 2026-09-26 |
| 库内互链 | isic-archive(56)/derm7pt(110)/totalsegmentator(422)/chest-x-ray-segmentation(601)/chexmask-cxr-segmentation-data(602)/heart-lung-segmentations-data(610)/lung-segment-mimic-cxr(613) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | overview 论文 + Zenodo + grand-challenge.org 三路可索引;但"DFUC 2024"与 2020/2021/2022 届检索高度混杂,版本链跳号加剧混淆(坑 6) |
| A 可获取性 | 3 | 数据本体 EULA 申请制无公开直链——最大失分项;仅 PDF 与 17.6 GB 基线权重公开直链 |
| I 可互操作 | 5 | 足部照片为通用图像格式,但无标准元数据 schema;实例掩码格式随 EULA 发放包而定,无公开样例可查 |
| M 元数据质量 | 7 | Challenge Brief + overview 论文对规模/赛程/规则记载完备;合成图像生成细节与标注者信息缺口微降分 |
| S 可持续性 | 6 | Springer/Zenodo/grand-challenge.org 载体稳定;但数据发放依赖挑战赛账号体系活跃度,赛事周期结束后的长期发放政策未明 |
| 综合评级 | 5.6/10(中) | 文档与模型层开放度尚可,数据层申请制与训练侧零标注决定其"方法研究友好、数据即用性受限"定位 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/方式 |
|---|---|---|
| 6,200 = 4,000/200/2,000 | Challenge Brief + overview 论文 | Zenodo PDF 与 LNCS 15335 pp.109-124 |
| 11,000 总库口径 | Challenge Brief | Zenodo record 11468883 |
| 2,000 原始 + 2,000 合成 | Challenge Brief | Zenodo PDF(按实例大小分组生成) |
| 赛程六节点(05-31 至 10-06) | Challenge Brief | Zenodo PDF |
| 冠军 Dice 0.5709 / Jaccard 0.4793 | overview 论文 + Murali et al. | LNCS 15335 pp.81-92 |
| 8 full papers + 2 invited(11 投稿) | Springer 书页原文 | 书 DOI 10.1007/978-3-031-80871-5 |
| overview pp.109-124 / DOI _10 | Springer 章节页 | 章节元数据 |
| 书 © 2025 / 章节 Published 2024-10-06 | Springer 版权页 vs 章节页 | 双口径存照 |
| Zenodo record 11468883(2.7MB PDF,cc-by-nc-nd-4.0,4,999 下载) | Zenodo API | 抓取 2026-09-26 |
| HF 仓库 17.6 GB / 2024-08-01 创建 | HuggingFace API(hf-mirror 通道) | /api/models/BBracke/DFUC24_baselines |
| DFUC2020 mAP 0.6940 / F1 0.7434 | DFUC 2020 overview 论文 | Cassidy 系文献 |
| DFUC2021 macro F1 0.6216 / 15,683 patches | DFUC 2021 overview 论文 | 同上 |
| DFUC2022 4,000 张 640×480 / 5 位医师 | DFUC 2022 overview 论文 | Dice ≈0.83 为文献口径(待核 3) |
| 团队与 ORCID | Springer 作者页 / ORCID 注册记录 | 2026-09-26 检索 |
附录 D:四届版本链引用卡片
DFUC 2020|检测|2,000+2,000|mAP 0.6940 / F1 0.7434|Deformable Conv
DFUC 2021|分类|15,683 patches|macro F1 0.6216|ViT+DeiT
DFUC 2022|语义分割|4,000 张 640×480|Dice ≈0.83(文献口径)|全监督天花板
DFUC 2024|自监督实例分割|6,200(4,000/200/2,000)|Dice 0.5709|Murali et al.
注:无 2023 届;指标跨届不可直比;"4,000"一词在 2022/2024 两届撞车需带届次。
附录 E:EULA 申请材料清单(申请制核对单)
□ grand-challenge.org 平台账号(实名/机构邮箱)
□ 用途声明(学术研究范围、预期产出)
□ 机构隶属与负责人信息(按申请表要求)
□ 签署数据使用协议(含禁止再分发/引用义务条款)
□ 等待分批发放(train/val/test 批次节奏按当期政策)
□ 合成子集随主协议发放(无需单独申请,也不单独开放)
附录 F:自监督基线复现骨架(方法级 SOP)
# 复现基线 A(DINOv2 probing)的方法级骨架(伪代码,权重见 HF 仓库)
import torch
def load_dinov2_backbone():
# 官方 DINOv2 预训练权重;禁止在任何 DFU 标注上训练骨干
return torch.hub.load("facebookresearch/dinov2", "dinov2_vitb14")
def extract_features(backbone, images): # images: 足部照片 batch
with torch.no_grad():
return backbone.forward_features(images) # patch tokens
def probe(features, mode="multi_nonlinear", out_channels=1):
# linear / multi-linear / multi-nonlinear 三档探针,逐档上探
if mode == "linear":
head = torch.nn.Linear(features.shape[-1], out_channels)
else:
head = torch.nn.Sequential( # 多层结构按仓库实现为准
torch.nn.Linear(features.shape[-1], 256),
torch.nn.GELU() if mode == "multi_nonlinear" else torch.nn.Identity(),
torch.nn.Linear(256, out_channels),
)
return head(features)
# 基线 B(GroundedDINO + SAM)零训练组合:
# 1) 文本提示 "ulcer, wound on foot" → GroundedDINO 框选
# 2) 框内区域交给 SAM 输出实例掩码
# 3) 评估:与验证集实例掩码算 Dice / Jaccard
附录 G:合成数据使用策略清单(参赛方法回溯)
- 预训练杠杆:多队以 2,000 张合成图做自监督/弱监督预训练,再迁移到任务——最普遍用法。
- 增广杠杆:合成图与原始图混编,扩充训练分布、覆盖实例大小连续谱("按实例大小分组"的设计意图)。
- 域间隙风险:合成→真实的分布偏移未被官方量化;使用者的共识是"当增广用比当真值用安全"。
- 透明度缺口:生成器、配比、域间隙处理均未公开——引用合成数据效果时注明"官方细节未公开"。
- 复现建议:自建同类合成集时按"实例大小分组"字面设计并做消融,勿假设与官方生成器等价。
附录 GG:开放问题清单(留给后续研究与下一届)
- 合成数据的边际曲线:2,000 张合成图是"够用"还是"恰好"?合成:原始配比多少时增益饱和?——需要官方公开生成细节后才可能形成可比答案。
- 自监督代价的可压缩性:0.26 Dice 的代差中,多少可被半监督伪标注、多少可被更强的通用骨干(DINOv3 世代?)、多少必须靠临床侧标注流程降本补回?
- 实例划界的真值工程:临床"一个还是两个溃疡"的主观性能否以概率化真值/多标注重叠带形式进入评估协议(呼应 PANDA-PLUS 的概率化倡议)?
- 跨届表示继承:2022 届 4,000 张全标注数据能否合法地作为 2024 届的自监督预训练语料(仅用图像不用标注)?协议与科学性双重问题。
- 照片域的 scale law:DFUC 系列从 2,000→15,683 patches→4,000→6,200 的数据量震荡下,自监督表示质量与数据量的关系从未被受控验证。
- 发放的可持续模型:赛事生命周期结束后,EULA 发放能否转交长期学术数据托管(如 PhysioNet 模式)?
附录 HH:双文件结构说明(本稿 + FACTS.md)
| 文件 | 角色 | 冲突裁决 |
|---|---|---|
writing/dfuc-2024/FACTS.md |
事实档案:九节结构,逐条数字带来源与抓取时点,含 4 条待核 | 口径权威来源 |
writing/dfuc-2024/dfuc-2024_Wikipedia.md |
面向读者的成稿条目(本文件) | 读者入口;数字冲突时以 FACTS.md 为准 |
维护动线:任何更新先进 FACTS.md(带新抓取时点与新来源),再同步本稿;本稿的修订记录见附录 V。
附录 II:快问快答判例表(场景 → 结论 → 依据)
| # | 场景 | 结论 | 依据 |
|---|---|---|---|
| 1 | 顺着 Zenodo DOI 下载到 2.7MB PDF,怀疑下载错了 | 没错,PDF 就是 Zenodo 层全部内容;数据走 EULA | 坑 1 / §6.2 |
| 2 | 论文引用写 “LNCS 15335, 2024” | 可接受但最稳写法补 “(卷 © 2025)” | 坑 2 / 附录 T |
| 3 | 打算把掩码和图像打包转传给合作实验室 | 违反 EULA 禁止再分发条款,引导对方自行申请 | §6.3 / 附录 U |
| 4 | 用验证集 200 张选出模型后报告该成绩 | 不可作为最终成绩报告,最终以测试集为准 | §3.6 |
| 5 | 想把 2022 届 4,000 张标注图并入 2024 训练集 | 不可,两届协议独立且破坏任务设定 | Q39 / §2.6 |
| 6 | 成绩表里出现 Dice 0.83 的 2024 届队伍 | 数字张冠李戴,0.83 属 2022 量级 | 坑 6/8 |
| 7 | 写爬虫抓 dfuc2024 排行榜 | 必然空手,改引 overview 论文 | 坑 5 |
| 8 | 认为合成图带掩码可以直接监督训练 | 不带,合成图与原始图同为零标注 | Q37 / §2.2 |
| 9 | 只下载了 17.6 GB 权重就宣布"复现了 DFUC" | 只是复现了基线推理,训练/评测闭环缺数据 | 坑 7 / 附录 K |
| 10 | 把"11,000 张"写进 2024 届数据描述 | 口径混写,11,000 是系列总库 | §2.1 / 坑 6 |
| 11 | 检索 “DFUC 2023” 得到结果 | 结果为误写来源,该届不存在 | Q7 / 坑 6 |
| 12 | 用测试集样本调试可视化脚本 | 属信息泄漏风险行为,改用验证集 | Q17 / §3.1 |
| 13 | 在受限网络用网页版 HF 下载权重 | 会遇 IP 检测,改走 hf-mirror API | §6.4 / 坑 7 |
| 14 | 引用冠军成绩时只写 Dice 0.5709 | 应成对写 Jaccard 0.4793 并带页码 | §5.6 |
| 15 | 把本条目 DAIMS 总分 5.6 当官方评级 | 是本库自建评估口径,非官方 | 附录 B |
| 16 | 用外部标注的足部数据预训练后宣称"纯自监督" | 合规性与声明准确性存疑,须核对当届规则与论文声明 | §3.9 / §5.6 |
| 17 | 引用"下载 4,999 次"证明数据热度 | 该数字属文档层下载量,不得计为数据下载量 | 坑 1 / 附录 R |
| 18 | 发现分辨率规格后直接写进跨届比较表 | 2024 届分辨率无统一公开口径,比较表须留空并注待核 | §2.6 / 附录 C |
用法:本表是 FAQ 的"判例法"补充——FAQ 管"是什么",本表管"这种做法行不行"。审核与答疑时优先引用行号。
三条总判例收束全表:①凡"以为是 X 其实是 Y"的纠纷(PDF/数据、权重/数据、总库/任务),以 §6 三层表裁决;②凡"能不能做 Z"的合规问题,以 EULA 原文与 §3.1 规则两条主干裁决;③凡"数字该怎么写"的引用问题,以坑 2/坑 6/坑 8 三坑与附录 Q 三层校准裁决。三句判例覆盖本表 18 行的绝大多数适用场景。
附录 H:抓取留痕与环境记录
- 抓取时点:2026-09-26;代理环境
ps aux | grep -c "[c]odebuddy"= 4(开工时点留痕)。 - huggingface.co 直连封锁环境走 hf-mirror.com(API 端点可用,网页层有 IP 检测)。
- dfuc2022.grand-challenge.org 与 dfuc2024.grand-challenge.org 的 leaderboard 均 JS 渲染,静态抓取不可得;成绩数字一律取 overview 论文。
- Zenodo record 11468883 元数据经 Zenodo API 抓取(文件大小 2.7 MB / license cc-by-nc-nd-4.0 / 下载 4,999 次)。
- 本条目 FACTS 档案(九节)存于同目录 FACTS.md,与成稿同时交付;待核项 4 条已在坑 8 与附录 C 双处标注。
附录 I:与皮肤影像双条目的深度对照
| 对照点 | isic-archive(56) | derm7pt(110) | dfuc-2024(本条目) |
|---|---|---|---|
| 域 | 皮肤镜/临床皮肤照片 | 七点标注法皮损照片 | 足部临床照片 |
| 核心任务 | 皮肤癌分类/分割 | 七点结构标注(诊断结构) | 溃疡实例分割(自监督) |
| 规模 | 十万级图像大宗 | 千级结构化标注 | 6,200 张(任务口径) |
| 访问控制 | 注册 + 使用条款 | 学术申请 | EULA 申请制 + 分批发放 |
| 公开层 | 图像+元数据公开 | 部分公开 | 仅 PDF + 模型权重公开 |
| 共同点 | — | — | 三者同为"临床照片域",均非放射影像 |
| 引用注意 | ISIC 归档持续增长,规模引用要带时点 | 七点法术语勿与 ABCD 法则混写 | 版本链带届次,任务带形态 |
结论:皮肤影像检索者跳入本条目时,最大的认知迁移是"足部照片 ≠ 皮肤镜影像"——前者含大量解剖背景(脚趾/足跟/踝部),后者是皮损特写;两者间的模型迁移需重新适配背景抑制。
附录 J:与分割掩码四条目的深度对照
| 对照点 | chest-x-ray-segmentation(601) | chexmask-cxr(602) | heart-lung-segmentations(610) | lung-segment-mimic-cxr(613) |
|---|---|---|---|---|
| 域 | 胸片 | 胸片 | CT 心肺 | 胸片(MIMIC-CXR 衍生) |
| 掩码获取 | 公开直链 | 公开直链 | 公开直链 | PhysioNet 凭证后直链 |
| 标注形态 | 肺野分割掩码 | 胸片器官掩码 | 心脏/肺叶掩码 | 肺段掩码 |
| 与本条目对照 | 数据全公开 vs DFUC 数据受控 | 同左 | 同左 | 协议墙同族但标准化更高 |
结论:胸片域的"图像+掩码打包直链"模式是可获取性光谱最开放端;DFUC 2024 处于中段(模型开放/数据申请制),检索者迁移预期时应默认"掩码不在公开层"。
附录 K:与 totalsegmentator(422) 的结构同型对照
- 同型结构:两者都是"模型/工具层公开、数据层受控"的双层开放——totalsegmentator 开源全自动分割工具与权重,训练数据受机构协议约束;DFUC 2024 公开基线权重(17.6 GB),数据本体走 EULA。
- 差异点:totalsegmentator 的工具可对新数据自行推理(工具即产出);DFUC 基线权重只是起点,产出依赖 EULA 数据到位。
- 检索启示:从 totalsegmentator 跳入的读者容易高估"权重到手"的完成度——DFUC 的复现闭环必须补上数据申请环节。
附录 L:可获取性光谱全库定位
开放端 ◄──────────────────────────────────────────► 封闭端
[公开直链] [平台注册] [Zenodo/存档] [凭证协议] [EULA 申请制]
chest-x-ray- isic-archive dfuc-2024 lung-segment- dfuc-2024
segmentation derm7pt (文档层) mimic-cxr (数据层)
chexmask(602) panda-plus (613)
heart-lung(610) (Bench 层)
注:dfuc-2024 三层异构横跨三档——文档 Zenodo 公开、数据 EULA、模型 HF 公开。
附录 M:MICCAI 2024 挑战赛语境注记
- MICCAI 挑战赛是医学影像挑战赛的最高舞台之一,2024 年(第 27 届)于摩洛哥马拉喀什举办;DFUC 2024 属其中"四届老牌系列",有完整的 LNCS 论文卷存档——这使它比"一届性挑战赛"多出版本链维度。
- 挑战赛论文收入 LNCS 的惯例:卷号统一、章节 DOI 独立、出版年以版权页为准——引用 MICCAI 系挑战赛时"章节线上年 vs 卷版权年"双口径是普遍现象,本条目坑 2 只是该惯例的一个实例。
- grand-challenge.org 平台 + Springer 论文卷 + Zenodo 存档的三件套组合,是评估 MICCAI 系挑战赛数据集"可发现性"的标准检查面。
附录 N:临床术语速查
| 术语 | 临床含义 | 对分割的影响 |
|---|---|---|
| 糖尿病足溃疡 | 糖尿病患者下肢/足部慢性创面,神经病变+血管病变共同作用 | 分割的目标对象;面积量化即临床价值 |
| 胼胝 | 角质层受压增厚,黄褐色 | 与溃疡颜色纹理纠缠,高频假阳性源 |
| 坏疽 | 组织缺血坏死,黑褐色 | 深度溃疡的伴发形态;边界模糊,漏检高发 |
| 愈合中/愈合后 | 创面处于修复进程(2021 届分类的两个状态类) | 肉芽组织外观与溃疡相似,实例划界主观性大 |
| 截肢风险分级 | DFU 严重度的临床分级体系 | 分割面积是分级输入之一——自动化的临床动机 |
| 伤口面积量化 | 掩码面积 × 标定比例尺 → cm² | 实例级输出支撑逐溃疡纵向追踪 |
| 足病医师 | DFU 专病医师(2022 届标注者为 5 位) | 真值的临床权威来源;标注成本高的原因 |
附录 EE:检索关键词组合表(中英)
| 意图 | 推荐组合 | 避免组合 |
|---|---|---|
| 找 2024 届数据入口 | “DFUC 2024” + “grand-challenge” + “data use agreement” | “DFUC 2024 zenodo download” |
| 找基线复现 | “DFUC24_baselines” / “DFUC 2024 DINOv2 probing” | “DFUC 2024 github dataset” |
| 找赛果 | “DFUC 2024 overview” + “LNCS 15335” / “Murali” + “attention U-Net” | “DFUC leaderboard” |
| 找版本链 | “diabetic foot ulcer grand challenge” + 2020/2021/2022/2024 逐年 | “DFUC 2023”(不存在) |
| 找临床背景 | “diabetic foot ulcer” + “wound area” + “amputation” | “DFU segmentation clinical”(泛而无据) |
| 找合成数据讨论 | “DFUC 2024” + “synthetic” + “instance size” | “DFUC 2024 GAN”(生成器未公开) |
| 找组织团队 | “Moi Hoon Yap” / “Brüngel Friedrich Dortmund” + “diabetic foot” | “DFUC team”(歧义大) |
| 中文检索 | 糖尿病足溃疡 + 挑战赛 / 自监督 + 实例分割 | 糖尿病足数据集(混入非公开临床库) |
附录 FF:给下游工程团队的接入评估清单
若贵团队计划接入 DFUC 2024,按序自检:
[1] 数据合规:EULA 能否签署?用途是否落在学术声明范围内?
[2] 时间预算:申请等待期(周级)能否与工程预研并行?
[3] 算力预算:是否走"冻结骨干+轻量头"路线(单卡可行)?
[4] 基线起点:先跑通 HF 权重(DINOv2 probing / GroundedDINO+SAM)再谈改进
[5] 评估基建:Dice/Jaccard 双指标 + 实例级聚合器是否就绪?
[6] 口径管理:仓库/文档中 6,200 与 11,000 分字段存储,勿混写
[7] 引用资产:overview DOI(_10)、书 DOI、Zenodo record 三件已入库
[8] 版本锚定:FACTS.md 抓取时点与本文一致(2026-09-26),差异项先核后用
附录 O:常见检索错误词表(错误 → 改写)
| 错误检索词 | 问题 | 改写 |
|---|---|---|
| “DFUC 2023” | 该届不存在 | “DFUC 2022” 或 “DFUC 2024” |
| “DFUC 2024 dataset download zenodo” | 会被导向 2.7MB PDF | “DFUC 2024 grand-challenge EULA” |
| “DFUC Dice” | 跨届指标混杂 | “DFUC 2024 Dice 0.5709” / “DFUC 2022 Dice” |
| “DFUC dataset 4000” | 两届 4,000 撞车 | “DFUC 2022 4000 images 640x480” / “DFUC 2024 training 4000” |
| “DFUC2024 github data” | 数据无公开仓库 | “DFUC24_baselines huggingface”(权重) |
| “Diabetic foot challenge MICCAI 2023” | 年份错误 | “MICCAI 2024 diabetic foot ulcers grand challenge” |
| “DFUC leaderboard csv” | JS 渲染无静态数据 | overview 论文 pp.109-124 的成绩表 |
附录 P:四届数据形态对照(文本图)
2020 检测 [图像 2,000+2,000] 输出: 框 指标: mAP/F1
2021 分类 [patch 15,683] 输出: 类别 指标: macro F1
└ 3,994 张无标签(半监督伏笔)
2022 语义分割 [图像 4,000 @640x480] 输出: 前景/背景 掩码 指标: Dice≈0.83
└ 5 位足病医师全标注(监督天花板)
2024 实例分割 [图像 4,000/200/2,000] 输出: 实例掩码 指标: Dice 0.5709
└ 训练侧零标注(自监督约束)+ 2,000 张合成图
趋势:输出粒度变细(框→类→掩码→实例),监督信号递减(全标注→零标注)。
附录 Q:成绩解读的三层校准框架
- 第一层(零点):基线 A probing 三档——“自监督特征免费上限”。任何方法成绩先与 probing 线比:低于即方法损伤特征。
- 第二层(拼装下限):基线 B GroundedDINO+SAM——"零训练基础模型"读数。高于此线的部分是任务专用训练的增量。
- 第三层(天花板参照):DFUC 2022 全监督 Dice ≈0.83 量级——监督信号充足时的域上限。冠军 0.5709 与天花板的差值(≈0.26)即"自监督代价"读数。
- 使用纪律:三层读数来自不同任务形态/监督设定,只能做"校准解读"不能做"同表排名";引用时逐层标注来源(overview 论文/前届论文/文献口径)。
附录 R:条目维护守则
- 触发更新的事件:DFUC 系列新届发布;Zenodo record 变更(新版本落地);HF 仓库更新;overview 论文勘误;EULA/许可条款变动。
- 更新流程:先改同目录 FACTS.md(九节事实档案,注明抓取时点与新来源)→ 再同步修正本成稿对应段落 → 文末追加修订记录行。
- 待核项转正流程:任一待核(共 4 条)锚定一手来源后,从坑 8/附录 C 的待核标注中移出、写入正文并注明来源;不得直接改正文不留痕。
- 版本链纪律:新增届次时同步更新 §4 对照表、附录 D 引用卡、附录 P 形态图三处,保持版本链叙事一致。
- 禁止事项:不得把待核数字写成精确值;不得跨届合并指标;不得把 Zenodo 文档层下载量计入"数据下载量"。
附录 S:组织者与作者角色全表
| 姓名 | 机构 | 角色 | ORCID |
|---|---|---|---|
| Moi Hoon Yap | Manchester Metropolitan University(兼 Lancashire Teaching Hospitals) | 通讯组织者、DFUC 全系列核心 | 0000-0001-7681-4287 |
| Connah Kendrick | Manchester Metropolitan University | 组织核心、invited paper 一作 | 0000-0002-3623-6598 |
| Bill Cassidy | Manchester Metropolitan University | 组织核心、2020 数据集论文作者 | 0000-0003-3741-8120 |
| Raphael Brüngel | FH Dortmund(兼 IMIBE/IKIM Essen) | 基线与 overview 一作 | 0000-0002-6046-4048 |
| Benjamin Bracke | FH Dortmund | 基线作者、HF 权重仓持有人 | 0000-0003-4986-7142 |
| Christoph M. Friedrich | FH Dortmund | 基线团队资深作者 | 0000-0001-7906-0038 |
| Neil D. Reeves | Lancaster University | 临床合作(足病/生物力学) | — |
| Joseph M. Pappachan | Lancashire Teaching Hospitals NHS FT | 临床合作(内分泌) | — |
分工结构:英国侧出数据与临床通道(Yap 组系 DFUC 全系列数据持有人),德国侧出工程与基线(FH Dortmund 的 IMIBE/IKIM 管线经验)——双主理的互补性直接体现在成果分布上:数据协议走英国临床网络,权重仓走德国工程账号。
附录 T:2024 届赛程横道(文本甘特)
2024年 5月 6月 7月 8月 9月 10月
|----------|----------|----------|----------|-----|
训练发放 ▓(05-31)
验证发放 ▓(06-21)
测试发放 ▓(07-01)
提交窗口 ░░░░░░░░░░░▓(08-15)
评审计分 ░░▓(08-20)
工作坊筹备 ░░░░░░░░░░░░░░▓(10-06)
参赛者实操:05-31~07-01 自监督预训练黄金窗口(无测试集干扰期)
附录 U:数据安全与伦理注记
- 患者可识别风险:足部照片含皮肤病变组合与足部形态特征,属中敏感度临床影像;DFUC 系列以 EULA 禁止再分发为第一道防线,患者级元数据不公开为第二道。
- 合成图的价值:合成训练图像部分缓解了"增加训练量必须增加真实患者数据"的伦理压力——这是 2024 届数据设计的伦理正面价值(尽管生成细节未公开)。
- 使用者的合规底线:不转分发、不尝试重识别、不超出协议声明的用途范围、成果按协议要求引用挑战赛与 overview。
- 临床边界:基线与赛果均为研究代码,任何临床决策用途需独立验证与监管路径,本条目不构成任何临床指引。
附录 V:修订记录
| 日期 | 修订 | 依据 |
|---|---|---|
| 2026-09-26 | 初版成稿(九节 FACTS + 本条目) | 抓取时点 2026-09-26 的三源核验 |
附录 W:可直接引用的标准句式(综述素材包)
- “DFUC 2024 将糖尿病足溃疡分割推进到自监督范式:训练主分割集(4,000 张)不提供人工标注,冠军方法 Dice 仅 0.5709,与全监督 DFUC 2022(Dice ≈0.83 量级)形成约 0.26 的量化代差(Brüngel et al., LNCS 15335, pp.109-124)。”
- “该挑战赛的官方基线刻意差异化:DINOv2 probing 三档确立自监督特征的免费上限,GroundedDINO+SAM 组合确立零训练基础模型下限,为参赛成绩提供双层校准。”
- “DFUC 2024 的数据发放为三层异构:Zenodo 公开的 2.7 MB Challenge Brief PDF(CC BY-NC-ND-4.0)、EULA 申请制的数据本体、以及 HuggingFace 公开的 17.6 GB 基线权重——'模型开放、数据受控’结构的典型样本。”
- “DFUC 四届版本链(2020 检测/2021 分类/2022 语义分割/2024 自监督实例分割)构成医学影像’监督信号经济学’的纵向实验序列,跨届指标不可直比。”
附录 X:本条目的核验方法论留痕
- 三轮三源纪律:核心数字(6,200 分区、Dice 0.5709、17.6 GB、页码/DOI)均经 ≥2 独立源锚定(论文/Zenodo/HF API/平台页);无法双源锚定者入待核。
- 抓取通道:Zenodo API、hf-mirror.com API(/api/models/BBracke/DFUC24_baselines)、Springer 章节 meta、grand-challenge.org 静态部分。
- 不可得项的处理:leaderboard(JS 渲染)与合成生成细节(未公开)不强行赋值,转为"以论文为准"与"待核"两类处理。
- 环境留痕:抓取时点 2026-09-26;代理进程检查
ps aux | grep -c "[c]odebuddy"= 4;hf-mirror API 通道验证通过。 - FACTS 依赖:本条目全部事实的逐条来源映射在同目录 FACTS.md(九节),冲突时以 FACTS.md 为准。
附录 Y:机器可读数据卡(summary 卡片)
dataset_slug: dfuc-2024
full_name: Diabetic Foot Ulcers Grand Challenge 2024
task: self-supervised instance segmentation (diabetic foot ulcer)
n_images_total: 6200
splits: {train: 4000, train_synthetic: 2000_within_train, val: 200, test: 2000}
human_annotation_train: false
series_total_images: 11000
modality: color RGB clinical foot photographs
metrics: [Dice, Jaccard]
best_score: {dice: 0.5709, jaccard: 0.4793, team: "Murali et al."}
baseline_a: DINOv2 probing (linear/multi-linear/multi-nonlinear)
baseline_b: GroundedDINO + SAM
weights: {hf_repo: "BBracke/DFUC24_baselines", size_gb: 17.6}
proceedings: {series: "LNCS 15335", book_doi: "10.1007/978-3-031-80871-5", overview_doi: "10.1007/978-3-031-80871-5_10"}
zenodo: {concept_doi: "10.5281/zenodo.6362521", record: 11468883, content: "2.7MB brief pdf", license: "cc-by-nc-nd-4.0"}
data_access: "EULA application via grand-challenge.org (no public direct link)"
publication_year_note: "chapter 2024-10-06 / book (c) 2025"
captured_at: 2026-09-26
附录 Z:核心术语中英对照速查
| 中文 | 英文 | 备注 |
|---|---|---|
| 糖尿病足溃疡 | diabetic foot ulcer (DFU) | 目标对象 |
| 实例分割 | instance segmentation | 本届任务形态 |
| 自监督 | self-supervised | 训练约束 |
| 半监督 | semi-supervised | 常用策略族 |
| 探针/探测头 | probing | 基线 A 方法核 |
| 开放词汇检测 | open-vocabulary detection | 基线 B 前端 |
| 分割一切模型 | Segment Anything Model (SAM) | 基线 B 执行器 |
| 合成图像 | synthetic images | 2,000 张训练侧 |
| 数据使用协议 | End User License Agreement (EULA) | 数据层许可 |
| 概念 DOI | concept DOI | Zenodo 总入口 |
| 版本记录 | version record | Zenodo 落地实体 |
| 伤口面积量化 | wound area quantification | 临床价值出口 |
| 胼胝/坏疽 | callus / gangrene | 高频混淆物 |
| 愈合前/愈合后 | healing / healed | 2021 届分类状态类 |
| 多尺度注意力网络 | Multi-scale Attention Network | 冠军方法 |
附录 AA:挑战赛结构横向对照(医学影像四例)
| 结构要素 | DFUC 2024 | PANDA(前列腺分级) | ISIC 系挑战赛 | REFUGE(青光眼) |
|---|---|---|---|---|
| 任务形态 | 自监督实例分割 | 切片级分级 | 皮损分类/分割 | 视杯视盘分割 |
| 数据发放 | EULA 申请制 | Kaggle 公开 | 注册批量公开 | 平台公开 |
| 论文存档 | LNCS 15335 | 挑战赛报告+衍生论文 | 多年多卷 | LNCS 短文 |
| 标注密度 | 训练侧零标注 | 切片级 GS/ISUP | 图像级+部分分割 | 像素级掩码 |
| 版本链 | 四届(2020-2024) | 一届+衍生重标注 | 年度连届 | 少量届次 |
对照读数:DFUC 2024 在"标注密度"与"数据发放"两轴处于最严格端,但在"版本链长度"轴最丰富——它的不可替代性恰恰在纵向维度。
附录 BB:常见误解清单(误解 vs 事实)
| # | 常见误解 | 事实 |
|---|---|---|
| 1 | “Zenodo DOI 就是数据下载地址” | 落地 record 是 2.7 MB 说明 PDF(坑 1) |
| 2 | “论文是 2024 年的所以书也是 2024” | 章节 2024-10-06,书卷 © 2025(坑 2) |
| 3 | “PDF 是 CC 许可所以数据也是” | 数据边界由 EULA 定义(坑 3) |
| 4 | “训练集没标注,数据质量差” | 零标注是自监督任务设计(坑 4) |
| 5 | “排行榜能爬” | JS 渲染,静态抓取不可得(坑 5) |
| 6 | “DFUC 是连续年度赛” | 无 2023 届(坑 6) |
| 7 | “基线开源=数据开源” | 权重 17.6 GB 公开,数据 EULA(坑 7) |
| 8 | “DFUC 冠军 Dice 0.83” | 0.83 量级属 2022 全监督;2024 冠军 0.5709(坑 6/8) |
| 9 | “6,200 张是全部 DFUC 数据” | 系列总库 11,000 张口径并行 |
| 10 | “合成图像带真值掩码” | 与原始训练图同为零标注用途 |
附录 CC:EULA 发放包预期内容核对单
发放包应包含(按 Challenge Brief 与赛程口径推断,到手后逐项核对):
[ ] train/:原始照片 2,000 张 + 合成图像 2,000 张(无像素标注)
[ ] val/:照片 200 张 + 实例分割标注(评估自查用)
[ ] test/:照片 2,000 张(真值是否随包公开以实际发放为准,见待核 2)
[ ] 协议文件:EULA 副本与引用要求说明
[ ] 版本说明:批次号/日期/文件校验和(若有)
注意:分辨率规格无统一公开口径,到手后以实际文件实测并回填 FACTS.md。
附录 DD:三类读者的十分钟速读卡
数据工程师(只想把数据拿到手)
- 读 §6.1 三层表(1 分钟)→ 2. 读坑 1 与坑 3(2 分钟)→ 3. 按 §6.5 决策树走 EULA 通道,同时下载 PDF+权重(5 分钟)→ 4. 用附录 CC 核对单等发放包(2 分钟)。
算法研究员(关心自监督方法)
- 读 §3.2/§3.3 双基线(2 分钟)→ 2. 读 §5.1 冠军成绩与官方结论(2 分钟)→ 3. 读 §5.4 八篇深读挑三篇精读(4 分钟)→ 4. 用附录 Q 三层校准框架定位自己的起点(2 分钟)。
综述作者/引用者
- 读附录 W 标准句式(2 分钟)→ 2. 读坑 2/6/8 引用纪律(3 分钟)→ 3. 用附录 D 引用卡与附录 C 证据链抽查两个数字(3 分钟)→ 4. 需要更多时回 FAQ 定向检索(2 分钟)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- isic-2018 — 共享标签:医学影像 / 皮肤影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
- ph2 — 共享标签:医学影像 / 皮肤影像 / 医学图像分割 / 图像分类
- selma3d — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 挑战赛数据集
- camelyon16 — 共享标签:医学影像 / 图像分类 / 目标检测 / 挑战赛数据集
- heichole — 共享标签:医学影像 / 图像分类 / 目标检测 / 挑战赛数据集
- fgadr — 共享标签:医学影像 / 皮肤影像 / 医学图像分割 / 图像分类
- heart-lung-segmentations-data — 共享标签:医学影像 / 医学图像分割 / 目标检测
- acouslic-ai — 共享标签:医学影像 / 图像分类 / 挑战赛数据集
- isic-2019 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集
- isic-2020 — 共享标签:医学影像 / 皮肤影像 / 图像分类 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

