ToothFairy2 (toothfairy2) — AI-Ready Wikipedia

牙科 CBCT 42 类颌面多结构分割挑战赛:530 例体数据(480 训练 = Set A 417 + Set B 63,50 隐藏测试),mha/HU/0.3mm 等向,DSC+HD95 共 84 ranks mean rank 排名,nnU-Net ResEnc L 夺冠,CC BY-SA 注册制下载

来源 Afidea Center(意大利,NewTom NTVGiMK4 CBCT,3mA/110kVp/0.3mm)为主采集的 530 例牙科 CBCT:训练 480 例(Set A 417 例 P 前缀临床数据 + Set B 63 例 F 前缀)+ 隐藏测试 50 例(Radboud UMC i-CAT 采集,仅经 grand-challenge 提交评估);42 类颌面结构体素标注发布时间: 2026-09-26最后更新: 2026-09-26 阅读 20
ToothFairy2 (toothfairy2) — AI-Ready Wikipedia

信息速览

数据集名称ToothFairy2 (toothfairy2) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模530 例牙科 CBCT(训练 480 例 = Set A 417 例 P 前缀 + Set B 63 例 F 前缀;隐藏测试 50 例不公开);58.30% 女性;年龄区间 (10, 100];20
接入方式Afidea Center(意大利,NewTom NTVGiMK4 CBCT,3mA/110kVp/0.3mm)为主采集的 530 例牙科 CBCT:训练 480 例(Set A 417 例 P 前缀临床数据 + Set B 63 例 F 前缀)+ 隐藏测试 50 例(Radboud UMC i-CAT 采集,仅经 grand-challenge 提交评估);42 类颌面结构体素标注
AI 就绪度

INFOBOX — ToothFairy2 一屏速览

维度 内容
本质 牙科 CBCT 42 类颌面多结构分割挑战赛 + 基准数据集(MICCAI 2024 卫星数据挑战赛)
名字 ToothFairy2 = 前作 ToothFairy(2022 挑战赛,牙体/下颌骨/下颌管 3 类)的全颌面扩展版;大小写混用见坑 1
团队 University of Modena and Reggio Emilia(Unimore,AImageLab)+ Radboud University Medical Center;Bolelli / Marchesini 共同一作
论文 CVPR 2025 workshop 基准论文《Segmenting Maxillofacial Structures in CBCT Volumes》+ 挑战赛论文 arXiv:2411.17213(MIA 2026 期刊版 DOI 10.1016/j.media.2026.104095);两篇并存见坑 7
数据 530 例 CBCT = 训练 480(Set A 417 例 P 前缀 + Set B 63 例 F 前缀)+ 隐藏测试 50(仅服务器评估)
类别 42 类颌面结构(32 颗牙 FDI 牙位 + 颌骨/上颌窦/下颌管/咽部/others 等);dataset.json 48 ID 含 6 NA 占位(坑 2)
格式 mha(MetaImage 变体),Hounsfield Unit,0.3mm 等向;最大 (298,512,512) F039 / 最小 (170,272,345) P381
设备 训练:Afidea NewTom NTVGiMK4(3mA/110kVp);测试:Radboud i-CAT(FOV 16×22cm,2×20s)——双中心双设备异构
评估 DSC(%)+ HD95(mm)双指标,42 类 × 2 = 84 ranks 取 mean rank(越低越好)
冠军 Florian Isensee & Yannick Kirchhoff(海德堡),nnU-Net ResEnc L:Dice 0.9253 / HD95 18.472mm / mean rank 4.6
基准最优 UMamba DSC 85.05(CVPR Table 2 最高);Swin-UMamba HD95 2.94mm(表内最低)——Mamba 系整体最强
参与 164 次初赛 + 132 次终赛提交;26 队进终榜(29 队上传,坑 6)
标注 7 名颌面放射专家(5 训练 + 2 测试分离);半自动迭代(每 20 卷重训 nnU-Net 提建议)+ α-shape 平滑
License CC BY-SA(署名-相同方式共享);注册制下载,ditto.ing.unimore.it/toothfairy2 单一分发点
伦理 Comitato Etico dell’Area Vasta Emilia Nord 批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D
身份指纹 牙科、CBCT、42 类、体数据——出现 2D 全景片、X 光、单牙分割任何一个词,说的是别家(fdtooth/dentex)
库内互链 fdtooth(609)、dentex、hecktor(662)、verse-spine、pddca、ctpelvic1k、autoimplant、totalsegmentator、c3vd、segthor
序列事件 2024-06-13 scaling 修复 → 2024-07-07 数据发布 → 07-08 提交启动 → 2024-10-06 MICCAI Marrakech 颁奖 → 2024-12-12 post-challenge 开放

ToothFairy2 是一场把"整副颌面结构"搬上考场的挑战赛:530 例牙科 CBCT(锥形束 CT)体数据,42 类从单颗牙齿到下颌管、上颌窦的颌面结构逐一做体素级分割——这是当时规模最大的 CBCT 多结构分割公开基准。它由摩德纳-雷焦艾米利亚大学(Unimore)AImageLab 与荷兰拉德堡德大学医学中心(Radboud UMC)联合组织,作为 MICCAI 2024 卫星数据挑战赛运行,托管于 grand-challenge.org;冠军方案出自 nnU-Net 团队(Isensee & Kirchhoff,nnU-Net ResEnc L),而官方基准表上把 DSC 推到 85% 量级的却是 Mamba 系架构——这两个事实共同构成了本条目的方法学看点。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——CC BY-SA 注册制下载,ditto.ing.unimore.it/toothfairy2 是唯一官方分发点(无镜像,坑 8 相关);下载前必读 §2.7 的 Set A 上颌缺失说明(坑 3)与 §2.3 的 direction 元数据警示(坑 4)。
  2. 关心排名怎么算:直奔 §4——DSC+HD95 双指标、42 类 × 2 = 84 ranks 取 mean rank 的机制,以及它与"直接平均分数"的差别;引用冠军数字前先看坑 8 的口径表。
  3. 要训练模型:直奔 §7 官方基准生态——AImageLab-zip/ToothFairy2-Benchmark 提供 8 个模型的训练命令与 nnUNetplans 文件;冠军配方拆解在 §5.3。

§0 导读:这个数据集解决什么问题

牙科 CBCT 是口腔临床的常规三维影像:种植规划要看下颌管走避(避让神经管是种植手术的安全红线)、正畸-正颌评估要看全牙列与颌骨形态、根尖病变随访要看牙体与根管。这些临床动作背后是同一件事——把 CBCT 里的一二十个解剖结构分割出来。与全身 CT 不同,CBCT 视野小、体素细(亚毫米等向)、牙齿数目因人而异(缺牙/阻生/修复体),且牙科影像长期缺乏大规模公开标注:公开数据集要么是 2D 全景片(如库内 fdtooth(609)),要么只覆盖少数结构(前作 ToothFairy 2022 挑战赛只做了牙体、下颌骨、下颌管 3 类)。到 2023 年为止,“CBCT 上做多结构分割"这个临床高频需求没有像样的 benchmark——论文各自在小规模私有数据上"提点”,结论无法沉淀。

标注经济学是缺口的核心。42 类 × 数百卷 × 亚毫米体素,纯人工逐层勾画的成本高到没有任何单个实验室愿意承担并公开;而下颌管、牙根这类毫米级结构的标注错误会直接传导为手术风险。ToothFairy 团队在 2022 年第一届挑战赛里验证了一条路线:半自动迭代标注——用已标注卷训练 nnU-Net 提建议掩码,专家在 2D 三平面上迭代修正,模型与标注互推前进。ToothFairy2 把这条路线推到 42 类、530 卷的规模(§3 详述流水线),同时把类别从"3 类安全结构"扩成"全颌面 42 类"——包括既往公开数据集几乎从不覆盖的咽部与修复物类。

ToothFairy2 的回答分四层。第一层是数据:480 例公开训练(Set A 417 例 Afidea 临床 P 前缀 + Set B 63 例 F 前缀)+ 50 例隐藏测试,训练与测试分属两个国家、两种设备(意大利 Afidea 的 NewTom vs 荷兰 Radboud 的 i-CAT)——跨中心泛化被直接做进考题。第二层是任务:42 类全颌面分割,其中 32 颗牙按 FDI 双位数牙位逐一建档,dataset.json 里的 48 个 ID 与 6 个 NA 占位是新手第一个坑(坑 2);Set A 因 FOV 裁剪天然缺上颌结构,这是设计而非错误(坑 3)。第三层是评估方法学:不用单一平均 Dice,而是 DSC(%)与 HD95(mm)双指标、42 类 × 2 指标 = 84 个排名位次取 mean rank(越低越好)——既考平均质量又考"最差类灾难",逼参赛队在全类别上均衡发力。第四层是发现:挑战赛冠军是"把 nnU-Net ResEnc 调到极限"的经典配方(§5.3),而官方复现的 8 模型基准表上,UMamba/Swin-UMamba 等 Mamba 系架构把 DSC 推到 79-85% 区间、显著越过 nnU-Net 系(70-74%)——3D 医学分割的"架构换血"信号在这个数据集上第一次以受控对比的形式出现(§5.4)。

在库内数据集谱系里,ToothFairy2 填补的是"牙科 + CBCT + 大规模多结构分割"的交叉空位:fdtooth(609) 是 2D 全景片(X 光投影,非体数据),dentex 是全景片上的牙齿分割与检测,hecktor(662)/pddca 占住头颈 CT/DICOM 分割但以肿瘤与危及器官为主,totalsegmentator 占住全身 CT 多结构但不含牙科专用类别,verse-spine/ctpelvic1k/autoimplant 各占一个解剖域的挑战赛空位。牙科 CBCT 的体数据多结构基准,库内此前是空白。它也是库内少有的"官方基准仓库直接可训练"条目——8 个模型的训练命令、nnUNetplans 文件与 dataset.json 都在 AImageLab-zip/ToothFairy2-Benchmark 里(§7),复现门槛远低于"只有论文没有代码"的同类赛事。

这个数据集有三重身份,引用前先想清楚自己拿的是哪一个:作为临床数据集,它是牙科 CBCT 方向最大的公开多结构标注资源(480 例公开训练、42 类、双中心),种植导航、正畸分析、颌面手术规划的模型都可以直接在上面训练;作为方法学 benchmark,它提供"42 类 × 双指标 × mean rank"的受控对比场,8 模型官方基准 + 挑战赛 26 队终榜构成 2024 年 3D 分割架构竞争的横断面样本;作为挑战赛工程范本,它的半自动标注流水线、双中心考题设计、post-challenge 持续开放提交机制(2024-12-12 起)是一套可整体复用的赛事设计模板。三重身份对应三类引用语境——引"数据规模"用第一身份,引"架构对比"用第二身份(且必须声明是 CVPR 基准口径还是挑战赛口径,坑 8),设计新赛事引用"协议"用第三身份;混用身份是最常见的引用错位。

§0 读法三则:

  1. 这个条目是"数据集 + 架构 benchmark + 标注流水线范本"三合一:拿它当普通分割数据用(只用 Set A)会踩坑 3 的上颌缺失;拿它当架构对比场用要分清 CVPR 基准口径与挑战赛口径(坑 7、坑 8)。
  2. 全文统计数字均出自三源:挑战赛论文(arXiv:2411.17213,MIA 2026 期刊版 DOI 10.1016/j.media.2026.104095)、CVPR 2025 基准论文(openaccess.thecvf.com)与官方渠道(toothfairy2.grand-challenge.org / ditto.ing.unimore.it/toothfairy2 / GitHub 官方仓库);口径冲突处已在坑 2、坑 6、坑 7、坑 8 存照。
  3. 检索时最大的坑是前作混淆:ToothFairy(2022,3 类,无"2"后缀)与 ToothFairy2(2024,42 类)是两届独立赛事、两套数据;文献里"Toothfairy2"(小写 f)与"ToothFairy2"混用(坑 1),按字符串检索会漏掉一部分文献。

三行小结:牙科、CBCT、42 类、体数据——四个关键词就是本数据集的身份指纹;2D 全景片、X 光投影、三类别(那是 2022 前作),出现任何一个都是在说别的数据集。

§1 数据集速览:十问十答

Q1:ToothFairy2 这个名字怎么展开?
ToothFairy 直译"牙仙"——西方童话里把脱落的乳牙放在枕头下、牙仙会来取走并留下礼物的角色,用在一个以"牙齿分割"为业的赛事上是个直白的幽默。后缀"2"标明它是 2022 年 ToothFairy 挑战赛(3 类:牙体/下颌骨/下颌管)的续届,不是同一场比赛的第二阶段。官方赛事名写作 ToothFairy2 — Multi-Structure Segmentation in CBCT Volumes,站点 toothfairy2.grand-challenge.org;但论文与部分文档里混用"Toothfairy2"(小写 f),GitHub 官方仓库为 AImageLab-zip/ToothFairy2-Benchmark——三种写法指向同一对象(坑 1),按严格大小写检索文献会漏。数据集页在 ditto.ing.unimore.it/toothfairy2(Unimore 实验室自托管)。

Q2:数据从哪来?
两个中心、两个国家。训练主体:意大利 Afidea Center 的临床 CBCT(NewTom NTVGiMK4,3mA/110kVp,0.3mm 重建),构成 Set A 的 417 例 P 前缀卷;另加 Set B 的 63 例 F 前缀卷。隐藏测试 50 例来自荷兰 Radboud UMC(i-CAT,FOV 16×22cm,2×20s,0.4mm 原始重采样至 0.3mm)。采集时段 2019-2024,年龄区间 (10, 100],女性占 58.30%(训练 58.54% / 测试 56.00%)。伦理审批:意大利 Comitato Etico dell’Area Vasta Emilia Nord,批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D。组织方为 Unimore AImageLab(Federico Bolelli / Leonardo Marchesini 共同一作、Marco Castellani 等)与 Radboud UMC;资助含 FAR 2024 / FARD-2024(摩德纳大学 + Fondazione di Modena)与意大利 PNRR 项目 Fit4MedRob(#PNC0000007)。

Q3:图像规格是什么?
全部为 mha(MetaImage 变体)三维体,Hounsfield Unit 存值,0.3mm 等向体素——统一重采样过,但历史上有过 Set F scaling bug(2024-06-13 修复,坑 5),老缓存要核对。体积跨度很大:最大 (298, 512, 512) F039,最小 (170, 272, 345) P381,中位 (170, 357, 371) P460——按"最大体积"估算显存与 patch 策略是这套数据的日常。注意 mha 的 direction 元数据与物理方向不符(官方 FAQ 自曝,坑 4),做重定向/配准前先人工核方向。

Q4:42 类都是什么?
32 颗牙(FDI 双位数牙位,四象限)+ 非牙结构:上颌骨、下颌骨、双侧上颌窦、双侧下颌管、咽部,以及"others"类(种植体、冠、桥、根管填充等修复物)等,合计 42。陷阱在 dataset.json:它写了 48 个标签 ID,其中 6 个 NA 占位(编号 19/20/29/30/39/40)——实类 42(坑 2)。另一个陷阱在 Set A:P 前缀卷因 FOV 裁剪缺全部上颌结构(上颌牙/上颌骨/上颌窦),这是挑战设计而非标注缺失(坑 3);只有 F 前缀卷与测试集是完整 42 类视野。

Q5:标注是谁做的,可靠吗?
7 名颌面放射专家,5 人标训练集、2 人标测试集,两组分离防偏差。流程是半自动迭代:已标注卷训练一个 nnU-Net 基模型(每新增约 20 卷重训一次)给其余卷提建议掩码,专家在 2D 三平面切片上迭代修正,最后用 α-shape(凹包)平滑消除锯齿(§3)。要如实区分两句话:这套流水线有"专家终审"背书,且对 530 卷 × 42 类的体量是唯一现实的路线;但标签本身部分是模型辅助产物,"纯人工金标准"的说法不成立——做标签噪声研究或申述边界病例时要把这层考虑进去(§8.3)。

Q6:排名怎么算?
双指标:DSC(%)(与 IoU 换算关系为 DSC = 2×IoU/(1+IoU))与 HD95(95% Hausdorff 距离,mm)。每个测试例 × 每个类 × 每个指标单独排名 → 42 类 × 2 指标 = 84 个排名位次,对每队取 mean rank,越低越好。这套"rank-then-aggregate"设计(§4)惩罚偏科:一支牙列近乎完美但在下颌管上翻车的队伍,mean rank 会被拖到肉眼可见的位置——这正是隐藏测试设计想要的甄别力。冠军 mean rank 4.6,亚军 4.8,季军 5.2——头部三队的差距只有零点几,说明榜单头部极度拥挤。

Q7:规模到底是 530 还是 480?
都对,口径不同。530 = 全口径(训练 480 + 隐藏测试 50);480 = 公开训练口径(Set A 417 + Set B 63)。写论文引用规模建议写"530 例 CBCT(480 例公开训练)"。另外注意"42 类"与"48 ID"之辨(坑 2)——规模与类别两组数字都各有双口径,引用前先声明。

Q8:冠军是谁,赢在哪里?
Florian Isensee & Yannick Kirchhoff(德国海德堡,Division of Medical Image Computing)——即 nnU-Net 团队核心成员——以 nnU-Net ResEnc L 配方夺冠:Dice 0.9253 / HD95 18.472mm / mean rank 4.6(挑战赛论文口径)。亚军 Y. Jiang(Oculins,mean rank 4.8),季军 H. Wang(Mors,5.2)。赢法值得细看:冠军没有换架构,而是把 ResEnc L 的 patch(160×320×320)、网络深度(6→7)、训练时长(1000→1500 epochs)、增广策略(禁左右镜像——牙位有解剖学左右性)全部推到极限,再叠五折 CV + 双种子集成 + 类级截止阈值后处理(§5.3)。这是"把现有管线吃透"对"追新架构"的一次正面胜绩——但同时,官方复现基准表上单模型最高分是 UMamba(§5.2),两条线索要看清各自口径(坑 8)。

Q9:CVPR 基准表说了什么?
组织方在 CVPR 2025 workshop 论文里用统一配置复现了 8 个模型(测试集平均 DSC/HD95):nnU-Net 70.92/17.86,nnU-Net ResEnc 74.16/14.48,TransU-Net 70.32/20.17,nnFormer 76.79/5.45,UNETR++ 71.43/17.23,UMamba 85.05/5.28(DSC 最优),VMamba 73.13/5.17,Swin-UMamba 79.64/2.94(HD95 最优)。三个读数:其一,Mamba 系三型号(UMamba/VMamba/Swin-UMamba)整体压过 CNN 系与 Transformer 系;其二,nnU-Net 原版与 ResEnc 版之间 3.2 个 DSC 点的差距说明骨干容量在 42 类任务上的边际收益仍然显著;其三,TransU-Net(70.32)垫底——"Transformer 在医学 3D 上必然更强"的叙事在这张表上不成立。难度谱上颌骨/咽部最易,“others”(修复物)最难(§5.5)。

Q10:怎么获取,能商用吗?
注册后在 ditto.ing.unimore.it/toothfairy2 下载,License 为 CC BY-SA(署名-相同方式共享)——不禁止商用(与前作及多数医学数据集的 NC 条款不同),但衍生数据必须同方式共享。注意三点:官方坚持单一分发点,不镜像、不上 HF/Zenodo,第三方"下载站"不可信;隐藏测试 50 例不公开,只能经 grand-challenge 评估平台提交;post-challenge phase 自 2024-12-12 起持续接受提交,新方法可以随时上榜。MIA 论文统计口径下数据集已有 1,423 次独立下载请求——在牙科分割赛道里这个热度是头部量级。官方要求引用挑战赛论文(arXiv:2411.17213 / MIA 2026)与 CVPR 2025 基准论文(§6.3 引用模板)。

§2 数据构成与规格

2.1 规模全景:530 例怎么拆

子集 例数 前缀 有无标注 设备/来源 用途
Set A(训练) 417 P 42 类(缺上颌结构,坑 3) Afidea NewTom NTVGiMK4(意大利) 公开下载,主力训练
Set B(训练) 63 F 42 类(完整 FOV) 与 Set A 同属训练侧发布 公开下载,完整视野训练/验证
隐藏测试 50 — 有(组织方持有) Radboud i-CAT(荷兰) 仅经 grand-challenge 提交评估

三条算术与口径守则:530 = 480 + 50(全口径 vs 公开口径,Q7);480 = 417 + 63(Set A + Set B);42 = 48 − 6(实类 vs dataset.json ID 数,坑 2)。P 前缀与 F 前缀的差别不是"有无标注"而是"FOV 与来源"——两个子集都带完整 42 类定义下的标注,只是 P 前缀卷的 FOV 天然不含上颌(坑 3)。

2.2 类别体系:42 类与 48 ID 之辨(坑 2)

42 类 = 32 颗牙 + 10 个非牙颌面结构。牙齿按 FDI 双位数牙位四象限建档(11-18/21-28/31-38/41-48 的语义),每一颗单独成类——这意味着榜单上"牙列成绩"本身就是 32 个类目的聚合。非牙结构包括上颌骨、下颌骨、双侧上颌窦、双侧下颌管、咽部与"others"类(种植体/冠/桥/根管填充等修复物)等。

dataset.json 里写的是 48 个标签 ID:编号 19/20/29/30/39/40 六个 ID 为 NA 占位(未启用牙位),实类 42。工程后果有三:

  1. 按 len(labels) 写损失函数或指标循环会算出 48——对 NA 类要么跳过要么按 0 处理,官方评估只认 42 实类;
  2. 用 nnUNetplans_files/ 里的官方 plans 文件可以直接继承正确配置(§7),自写 pipeline 时把 dataset.json 与官方评估脚本对读一遍再动手;
  3. 文献里"42 类"与"48 类"两种说法都能检索到,引用时写 42 并注明 48 ID 的来源(坑 2 处理方式)。

2.3 格式与物理量:mha / HU / 0.3mm

  • 容器:mha(MetaImage 变体)——ITK/SimpleITK、3D Slicer、MONAI 均原生可读;nnU-Net 转换链官方已提供 plans 文件(§7)。
  • 强度:Hounsfield Unit。CBCT 的 HU 与医用 CT 的 HU 不完全等价(CBCT 灰度校准随设备与重建核漂移),双中心混训时建议按设备分组做强度归一化。
  • 体素:0.3mm 等向。历史坑:Set F 曾有 scaling bug(HU 投影与 0.3 scaling,changelog 2024-06-13 修复,坑 5)——2024-06-13 之前缓存的副本与基于其派生的预处理结果要重做。
  • 方向:mha direction 元数据与物理方向不符(官方 FAQ 自曝,坑 4)。依赖方向矩阵的三个操作——重定向(reorient)、与外部配准、RAS/LPS 转换——都不能盲信元数据,先在切片视图里人工核一遍。
  • 体积:最大 (298, 512, 512) F039 / 最小 (170, 272, 345) P381 / 中位 (170, 357, 371) P460。即便最小卷也远超常规 GPU 单 patch 上限,官方基准默认 patch 80×160×160(§5.6)是配套这套尺寸设计的。

2.4 双中心双设备参数表

参数 训练侧(Afidea,意大利) 测试侧(Radboud UMC,荷兰)
设备 NewTom NTVGiMK4 i-CAT
管电流/管电压 3 mA / 110 kVp —(FOV 16×22 cm,2×20 s)
重建体素 0.3mm 0.4mm 原始 → 重采样 0.3mm
子集 Set A 417 例(P 前缀)+ Set B 63 例(F 前缀) 隐藏测试 50 例
FOV 特征 P 前缀裁剪致缺上颌结构(坑 3);F 前缀完整 完整 42 类视野
可见性 公开下载 不公开,仅服务器评估

这张表是本数据集的方法学骨架:训练与测试不仅不同病例,而且不同国家、不同设备、不同重建链。任何"训练集上交叉验证分数很高、据此推断测试成绩"的推理都要打折扣——跨中心域移位是考题本身(官方基准 8 模型的分数也是在同一隐藏测试上评的,§5.2)。

2.5 人口学覆盖

维度 数字 口径
性别 58.30% 女性 全体;训练 58.54% / 测试 56.00%
年龄 (10, 100] 不含 10 岁及以下
采集时段 2019-2024 回溯性临床采集

覆盖面判断:年龄下界 10 岁意味着青少年正畸高发人群在覆盖内,但儿童(≤10 岁)与老年修复极端场景是否充分代表,官方未给分年龄段分布——做人群亚组分析前不要假设均衡。性别比约 6:4 偏女性,与正畸/种植就诊人群的一般构成方向一致。

亚组分析前的核查表(官方未给分布的维度,逐项自查再下结论):

打算做的亚组切分 官方给了什么 自查动作
性别分组 总体/训练/测试占比(§2.5 表) 接近 6:4 的不平衡要做加权或声明
年龄分段 仅区间 (10,100],无分布 下载后自统计分位;≤10 岁不在覆盖内勿外推
设备分组 设备参数表(§2.4) P/F 与测试域的设备标签以官方元数据为准
阳性频率分组(修复物有无) 未给统计 按 others 类阳性自统计,与 §5.5 难度谱对照

2.6 Set A 上颌缺失详解(坑 3)

Set A 的 417 例 P 前缀卷来自 Afidea 临床常规采集,FOV 按临床指征裁剪(多数牙科 CBCT 只扫治疗区),因此普遍缺上颌结构:上颌牙、上颌骨、上颌窦的掩码在这些卷里不是"没标",而是"根本不在视野里"。三个使用守则:

  1. 训练上颌类:只用 F 前缀卷(63 例)会严重欠采样——这是公开数据里上颌类样本量的实际上限,设计上颌相关实验时先算清楚样本量;
  2. 别把缺失当背景:把视野外体素当"背景/负样本"参与损失计算,会系统性教坏上颌类的决策边界——官方评估与冠军方案都把 FOV 处理当显式设计项;
  3. 测试集是完整视野:Radboud 测试 50 例完整覆盖 42 类——Set A 上训练的模型要在上颌类上得分,必须从 Set B(与少量完整 FOV 训练资源)里学,这正是考题的甄别点之一。

2.7 时间线与 changelog

日期 事件
2024-06-13 Set F HU 投影与 0.3mm scaling bug 修复(changelog 记录,坑 5)
2024-07-07 挑战赛数据版发布;changelog 载明 P077/P103/P349 标签修复、F011-F050 元数据修复
2024-07-08 grand-challenge 提交通道启动
2024-10-06 MICCAI 2024(马拉喀什)现场颁奖
2024-12-12 post-challenge phase 上线,持续接受新提交
之后 6 个月 结果 embargo 期
2025-06 官方 GitHub 仓库仍在活跃提交(§7)

changelog 的读法:这套数据在挑战赛开跑前后都修过标签与元数据——2024-07-07 发布版已含 P077/P103/P349 标签修复与 F011-F050 元数据修复,2024-06-13 的 scaling 修复更早。结论只有一个:用最新版,任何基于旧缓存的论文数字都可能对不上官方榜。

2.8 参与漏斗

阶段 数字
初赛阶段提交 164 次
终赛阶段提交 132 次
上传队伍(方法节口径,2025-07-31 统计) 29 队(坑 6)
进终榜队伍(摘要口径) 26 队

164 → 132 的提交衰减说明终赛阶段(含 Docker 化与方法描述提交门槛)有实质淘汰;29 与 26 的队数差是 MIA 论文内两处口径之差(坑 6),不是"赛后又淘汰了 3 队"。

2.9 使用前检查单

# 检查项 动作
1 数据版本 确认下载于 2024-07-07 发布版之后(含 scaling 修复,坑 5)
2 标签 ID 对读 dataset.json 与官方评估脚本,NA 占位跳过(坑 2)
3 FOV 处理 Set A 训练时显式处理上颌缺失,勿当背景(坑 3)
4 方向元数据 重定向/配准前人工核 direction(坑 4)
5 强度归一化 双子集/双设备分组归一化,勿全局统一
6 评估协议 自划实验用 42 类 × 2 指标 rank 聚合,与官方口径对齐(§4)
7 引用口径 冠军数字(挑战赛口径)与基准表数字(CVPR 口径)分开引(坑 8)
8 衍生共享 CC BY-SA:发布衍生数据须同方式共享(§6.2)

2.10 与 nnU-Net 生态的对接细节

本数据集与 nnU-Net 的关系是三层的:标注流水线用 nnU-Net 做建议模型(§3.2)、官方基准 8 模型中两个是 nnU-Net 变体(§5.2)、挑战赛冠军方案就是 nnU-Net ResEnc L(§5.3)。因此官方基础设施对 nnU-Net 用户的友好度是库内数据集的最高档,对接清单五条:

  1. plans 继承而非重新 search:官方 nnUNetplans_files/ 直接免去预处理计划搜索——省时,且与官方基准数字保持配置可比(§7.1);
  2. 标签定义以官方 dataset.json 为准:48 ID 含 6 NA(坑 2),自定义损失/指标循环前先过滤;
  3. P/F 前缀分组意识:两子集 FOV 差异(坑 3)意味着预处理与损失设计都要显式处理,勿合并成"一个训练集"糊弄过去;
  4. 方向元数据人工核(坑 4):nnU-Net 的重采样走 spacing 而非方向矩阵,受坑 4 影响小;但自有管线里的任何 reorient/配准步骤都要人工核方向;
  5. 复刻冠军:nnU-Net 官方仓库 documentation/competitions/Toothfairy2 路径有冠军配置归档(§7.3)。

一个常见分歧要先想清楚:nnU-Net 默认会基于训练集重算 patch/spacing 计划。若目标是对表官方基准,用官方 plans;若目标是自己的新方法研究,重新 search 无妨——但论文里必须声明与官方配置的差异,否则架构对比里混入了预处理混杂变量(§5.6 纪律的 nnU-Net 特化版)。

§3 标注流水线:半自动迭代如何撑起 42 类 × 530 卷

3.1 专家组织:7 人两组分离

标注由 7 名颌面放射专家完成,官方刻意做了组间分离:5 人标训练集、2 人标测试集,两组互不接触对方的数据与标注。分离的目的是防"标注者泄漏"——若同一批人既标训练又标测试,标注习惯的系统性偏差(如对下颌管边界的宽严尺度)会让测试成绩虚高,benchmark 的甄别力被掏空。测试侧仅 2 人也意味着测试标签的标注者间一致性没有冗余仲裁层,这是理解"测试集 GT 也是人画的"这一背景事实的必要前提(§8.3)。

3.2 半自动迭代:每 20 卷重训一次

42 类 × 530 卷 × 亚毫米体素的纯人工勾画在经济上不可行,官方的解法是一台"标注-模型互相推"的迭代机器:

  1. 用已标注卷训练一个 nnU-Net 基模型;
  2. 模型对未标注卷输出建议掩码;
  3. 专家在 2D 三平面切片视图上对建议掩码做迭代修正(改错、补漏、定边界);
  4. 修正后的卷入池,每新增约 20 卷重训一次基模型,建议掩码质量随之抬升;
  5. 循环至全部完成。

这条流水线的效率逻辑是:专家只做"修正"不做"从零勾画",而修正难度随模型迭代单调下降。它对使用者的含义有两层——其一,数据集标签是"模型辅助 + 专家终审"的产物,不是纯手工金标准;其二,早期批次与晚期批次的标签质量可能有系统性差异(早期模型弱、建议差、修正负担重),做标签质量分析时可以按卷序分层抽检。

3.3 α-shape 平滑:标注后处理的最后一步

逐层修正留下的体素级锯齿在三维重建视图里呈"台阶状",对 HD95 这类表面距离指标尤其不友好(§4.1)。官方对标注做 α-shape(凹包) 后处理:用凹包算法从体素点云拟合光滑包络,把牙齿、颌骨等结构的表面拉平到解剖上合理的曲率。使用者要注意两点:其一,对比自己模型输出与 GT 的表面距离时,GT 已经是"平滑过"的——输出侧做对应的表面平滑(或至少理解锯齿惩罚)才算公平对表;其二,α-shape 参数对细结构(下颌管、牙根尖)的保真度有影响,极端边界病例的 GT 可能在"平滑"与"贴骨"之间取了折中。

3.4 "模型辅助标注"的循环性:是缺陷还是唯一解?

一个自然质疑:用 nnU-Net 辅助标注、再用这批标注评 nnU-Net 系模型,是否循环论证?官方与挑战赛论文的立场(转述)是:建议掩码仅是初稿,类别边界由专家在三平面上终审,且模型建议的错误(尤其小结构边界)正是专家修正的主要工作面。更结构性的辩护是经济性的:没有这条流水线,42 类 × 530 卷的标注根本不会存在——"完美的少量"与"可用的全部"之间,本数据集选择了后者并诚实披露了方法(§3.2/§3.3 均为官方公开描述)。使用者端的操作建议:做标签噪声/边界不确定性研究时,把"模型辅助"当已知先验而非未公开黑箱;复现标注质量评估时用官方 benchmark 的 8 模型分数做外部锚点(§5.2)。

3.5 对使用者的操作含义小结

议题 含义 动作
标签来源 模型辅助 + 专家终审 + α-shape 平滑 引用标注协议时如实描述,勿写"纯人工"
质量分层 早期/晚期批次建议掩码质量不同 按卷序分层抽检(自定协议时)
表面对表 GT 已平滑,输出锯齿会被 HD95 惩罚 输出侧平滑或明示协议
测试标签 2 人小组标注,无冗余仲裁 理解终榜 GT 也是人画的(§8.3)
上颌结构 Set A FOV 缺失(坑 3) 上颌实验只用 F 前缀 + 显式处理

3.6 标注协议的库内对照

把本数据集的标注协议放到库内谱系里看,三种范式各有地盘:

范式 代表条目 协议形态 适用场景
半自动迭代(本条目) ToothFairy2 模型提建议 + 专家终审 + 后处理平滑 类别多 × 体量大 × 预算有限(42 类 × 530 卷)
纯人工专家 crossmoda2022 有资质标注者逐例勾画 + 顾问仲裁 类别少 × 精度要求极高(2 结构,毫米级)
2D 批量轻标注 fdtooth(609)/dentex 域 2D 投影上勾画/框选,单例成本低 大盘筛查类数据(2D 成本优势)

三条对照结论:其一,范式由"类别数 × 体素规模 × 预算"三元组决定,没有高低之分——ToothFairy2 若强行纯人工,42 类规模不可交付;crossmoda2022 若用半自动,耳蜗级精度存疑;其二,半自动范式的代价是标签携带模型先验(§8.3),这是范式换来的规模能力的一部分,引用时应如实转述官方披露;其三,对数据集设计者的启示:先算标注经济账,再定类别数——ToothFairy2 的 42 类正是在"半自动可行"的约束下反推出来的规模,这个设计顺序值得每个新数据集项目抄写。

§4 评估方法学:84 ranks 的 mean rank 怎么读

4.1 为什么是 DSC + HD95 双指标

**DSC(Dice 系数,%)**度量体素重叠,是分割任务的通用主指标;**HD95(95% Hausdorff 距离,mm)**度量两个表面之间的距离(取 95 分位以抑制离群点),捕捉 DSC 盲区——一个预测掩码可以重叠率不差但边界整圈偏移 1-2mm,DSC 几乎无感,HD95 直接报毫米数。对牙科场景,HD95 不是学术摆设:种植规划里下颌管边界偏 1mm 就是安全距离问题,冠/桥就位道偏移是修复失败问题。42 类 × 2 指标 = 每类每指标单独考核,双指标的存在让"体素刷分、边界摆烂"的策略无利可图。

两个指标的换算与口径:DSC 与 IoU 的关系为 DSC = 2×IoU/(1+IoU)——文献里若见 IoU 数字,先换算再对表;HD95 单位是 mm,本数据集 0.3mm 等向体素下,"几个体素"的边界误差在 HD95 上是亚毫米到十几毫米的放大表达(体积大的类如颌骨,HD95 天然偏大,跨类比较时要带体积直觉)。

4.2 rank-then-aggregate:84 ranks 取 mean rank

官方排名机制三步:

  1. 对每个测试病例 × 每个类 × 每个指标(42 × 2 = 84 个"考项"),把所有队伍的成绩单独排名;
  2. 每队在每个考项上获得一个名次(rank);
  3. 每队对 84 个名次取均值 → mean rank,越低越好。

冠军 Isensee & Kirchhoff 的 mean rank 4.6 可以这样直观理解:在 84 个考项上,这支队伍平均排在全场第 4.6 位附近。亚军 Jiang(Oculins)4.8、季军 Wang(Mors)5.2——头部三队平均名次只差 0.6,意味着几乎每个考项上三队都在互相咬合,没有任何一项是"稳赢"的。

这套设计与"直接平均分数"(aggregate-then-rank)的关键差别:mean rank 对量纲不敏感(DSC 的百分点与 HD95 的毫米不能直接相加,但名次可以),对离群分数稳健(一个类上的灾难性失效会以名次形式被 84 项摊薄,但同时也不可能被平均数掩盖——灾难项的 rank 是 26 而不是"拖低 0.3 分")。后果是:跨队伍比较"某类单项分数"时,官方口径只认名次,不认裸分数(坑 8)。

4.3 与库内挑战赛评估体系的对照

赛事 指标 聚合方式 方向
ToothFairy2 DSC + HD95(42 类) 84 考项 rank 取均值 越低越好
crossmoda2022(库内 645 邻项) DSC + ASSD(2 结构) 病例 × 结构 × 指标 rank 两级聚合(rank score) 越低越好
hecktor(662) 系 DSC + HD95(头颈) 通常是分数直接平均 越高越好

同一时代的主流 3D 分割赛事在"rank-then-aggregate"上出现了明显收敛(ToothFairy2 与 crossmoda2022 的 rank score 是同一哲学的两种粒度)——动因相同:多结构赛事里,结构间量纲/难度不可通约,分数平均会被大结构主导;名次平均让每个结构一票。给基准使用者的迁移建议:在自己的多类分割实验里复刻"逐类逐指标排名再聚合",比直接报"平均 Dice"更能抵御结构失衡的误读。

4.4 空预测与最难类的处理

42 类里最难的"others"(修复物类)存在大量缺失阳性(患者没有种植体/冠/桥时该类本底为空)。官方口径下这类考项对"预测全空"的处理不是 NaN 也不是直接零分——挑战赛论文的评估脚本(GitHub evaluation/ 目录,§7)是唯一权威实现;自建实验复刻排名时必须逐行对读官方评估代码,而不是按直觉实现。这也是本数据集"评估代码即基础设施"的地方:排名协议的全部细节以代码而非文字为准。

4.5 评估体系的三点批评

  1. mean rank 的"地板效应":头部三队 mean rank 只差 0.6(4.6/4.8/5.2),在 84 考项、26 队(坑 6)的颗粒度下,这个差距的统计显著性没有官方检验报告——榜首之争读作"并列第一梯队"更稳妥;
  2. HD95 的体积敏感性:大结构(颌骨)的 HD95 与小结构(牙根尖、下颌管)的 HD95 不可直读比较,而 rank 聚合把它们的"名次"等权——对"专精小结构"的队伍有利/不利程度,官方未做敏感性分析;
  3. 测试集 50 例的单榜依赖:全部结论锚在一个 50 例隐藏测试上,没有 bootstrap/重抽样稳定性报告(对照 crossmoda2022 的 1000 次 bootstrap Kendall τ 检验)——榜单头部的置信区间未知。

三点批评的共同源头是官方论文对排名协议的稳定性检验着墨很少——这不构成对数据的否定,但引用榜单数字(尤其冠军 vs 亚军 0.2 的 mean rank 差)时应携带"点估计"谨慎。

4.6 一个直观算例:mean rank 如何惩罚偏科(示意)

用一个 4 考项的构造例子说明 rank-then-aggregate 与"分数直接平均"的分歧(数字为示意构造,非官方成绩):

考项 队甲分数 队甲名次 队乙分数 队乙名次
DSC·颌骨 92.0 1 91.0 2
DSC·中切牙 90.5 1 90.0 2
DSC·others(修复物) 20.0 2 55.0 1
HD95·下颌管 9.0mm 2 3.0mm 1

三个读数:

  1. 分数平均的视角:甲的 DSC 类平均分 (92.0+90.5+20.0)/3 ≈ 67.5,乙 (91.0+90.0+55.0)/3 ≈ 78.7——甲在两个大项上赢,但"others"上的灾难被大结构分数稀释后,平均分的差距方向取决于各考项权重怎么设;
  2. mean rank 的视角:甲 (1+1+2+2)/4 = 1.5,乙 (2+2+1+1)/4 = 1.5——平手。名次体系把"大项优势"与"灾难项"对称计入,没有谁被稀释;
  3. 推论:只要再加任何一个乙赢的考项,乙的 mean rank 立刻反超——而分数平均体系里乙未必。这正是官方选择 rank 体系的动机:42 类里一支对"others"全空预测的队伍,分数平均可能只掉一两个点,rank 体系会把它按到全场末位。

方法学结论:在该体系下平均分叙事与名次叙事可能给出不同甚至相反的头部排序——引用 ToothFairy2 成绩时只允许名次叙事(官方口径),分数只作参考展示(坑 8)。

§5 基准结果与冠军方案

5.1 挑战赛终榜:领奖台与参与规模

名次 队伍/选手 机构 Dice HD95 (mm) mean rank
冠军 Florian Isensee & Yannick Kirchhoff 海德堡(Division of Medical Image Computing) 0.9253 18.472 4.6
亚军 Y. Jiang Oculins — — 4.8
季军 H. Wang Mors — — 5.2

参与规模:164 次初赛 + 132 次终赛提交;29 队上传(方法节口径,2025-07-31 统计)/ 26 队进终榜(摘要口径,坑 6)。本表数字出自挑战赛论文(arXiv:2411.17213);Dice 0.9253 与 HD95 18.472 是冠军提交在 84 考项体系下的聚合呈现——不要把它与 §5.2 基准表的数字互相插值(坑 8)。

5.2 CVPR 基准表:8 模型受控对比(Table 2 口径)

组织方用统一配置在隐藏测试上复现的 8 个官方基准模型(平均 DSC / HD95):

模型 DSC (%) HD95 (mm) 谱系
nnU-Net 70.92 17.86 CNN 基线
nnU-Net ResEnc 74.16 14.48 CNN + 残差编码器
TransU-Net 70.32 20.17 Transformer
nnFormer 76.79 5.45 Transformer
UNETR++ 71.43 17.23 Transformer
UMamba 85.05 5.28 Mamba(DSC 最优)
VMamba 73.13 5.17 Mamba
Swin-UMamba 79.64 2.94 Mamba(HD95 最优)

三个读数(§0 已概述,这里是完整版):

  1. Mamba 系整体领先:UMamba 85.05 是全场 DSC 峰值,Swin-UMamba 的 HD95 2.94 是全场最低——状态空间模型在牙科 CBCT 这个"细结构 + 长程上下文并存"的域上首次拿到受控对比的领先证据;
  2. nnU-Net 系的容量边际:原版 → ResEnc 版 +3.24 DSC,说明 42 类任务的表征需求已经把标准 nnU-Net 骨干推到容量边界;
  3. Transformer 内部剧烈分化:nnFormer 76.79 vs TransU-Net 70.32 相差 6.5 点——"用没用对架构设计"比"用没用 Transformer"重要得多,跨文献引用"Transformer 在 CBCT 上的表现"时必须点名到型号(坑 8 的口径纪律在架构叙事上同样适用)。

5.3 冠军方案拆解(nnU-Net ResEnc L)

冠军配方(挑战赛论文披露口径)逐项过:

配置项 冠军设置 默认值 设计动机
patch 尺寸 160×320×320 112×224×256 大 patch 保住整排牙列的空间连续性
网络深度 7 6 0.3mm 等向下更深 = 更大感受野
镜像增广 禁用左右镜像 默认开启 FDI 牙位有解剖学左右性,镜像会教坏牙位语义
epochs 1500 1000 42 类的收敛需求
集成 五折 CV + 双种子 — 摊平方差,头部对决里 0.1 的 rank 都是真金
后处理 类级截止阈值 全局 细结构(下颌管)与修复物类的概率分布不同
硬件 GH200 96GB 或 2×A100 40GB — patch 放大后的显存现实

三条可迁移经验:其一,域先验比架构花活值钱(禁左右镜像这一条是牙科专用知识,任何架构都得吃);其二,把一个成熟管线的超参推到极限是卫星赛事预算下的最优策略——冠军没有发明新东西,是把已知东西的每一格油门踩到底;其三,集成与后处理是免费分数——五折 + 双种子 + 类级阈值在 84 考项体系里对"最差类灾难"的防御力远超其纸面增益。

5.4 Mamba 现象:一次受控对比里的"架构换血"信号

把 §5.2 表按谱系重排:CNN 系 70.92-74.16,Transformer 系 70.32-76.79,Mamba 系 73.13-85.05。Mamba 系不仅整体居首,而且内部方差小、下限高(最差的 VMamba 73.13 也与 ResEnc 持平)。需要保持的克制:这是单一数据集、单一配置复现的结果,"Mamba 全面取代 CNN"的普适结论下不了;但"在亚毫米等向、细结构密集、长程解剖上下文(整排牙列/颌骨连续曲面)并存的域上,线性复杂度的序列建模有真实优势"这一假设,在这个表上拿到了首个受控证据。对基准使用者的操作含义:在 ToothFairy2 上做架构研究,UMamba 与 Swin-UMamba 是必须对表的强基线,只用 nnU-Net 做对照的 2024 年之后的论文会显得基础薄弱。

5.5 难度谱:什么容易什么难

挑战赛论文报告的难度谱两端:

  • 最容易:颌骨、咽部——大体积、位置恒定、形态变化有限,各队成绩聚集;
  • 最难:“others”(种植体/冠/桥/根管填充等修复物)——金属伪影、形态任意、训练数据欠代表(官方 limitations 自曝),是全场方差的来源。

中间地带的难度梯度大致按结构体积与解剖变异性排序:单颗磨牙牙根、下颌管等细结构居中偏难——它们体积小(HD95 敏感)、位置变异性大(缺牙/阻生/邻牙挤压),是 mean rank 里真正拉开名次的考项。给新方法的建议:先在 others 类与细结构类上报分——这两类是 2024 年榜单剩余 headroom 的所在地,颌骨上刷分已无信息量。

5.6 基准训练配置(复现用)

官方 8 模型基准的统一训练配置(CVPR 论文口径):默认 patch 80×160×160、batch 2(ResEnc 版 122×224×256)、1000 epochs、A40 48GB、CUDA 11.8、PyTorch 2.1.2;推理侧连通域后处理约 +2 DSC 点。复现检查单:

  1. 用官方 nnUNetplans_files/ 与 dataset.json 起步(§7),勿自造 plans 再抱怨对不上表;
  2. 训练配置逐项对齐 §5.6 数字(尤其 patch 与 epochs),架构对比实验里改配置 = 引入混杂变量;
  3. 推理后处理(连通域)统一开/关——+2 DSC 的量级足以改变架构间的相对名次;
  4. 自划验证分数与官方隐藏测试分数不可互推(双中心域移位,§2.4),论文里分开报。

5.7 分数对齐清单:引用任何数字前过一遍

你要引的数字 正确口径 错误示范
冠军成绩 Dice 0.9253 / HD95 18.472mm / mean rank 4.6(挑战赛论文口径) 把 0.9253 写成"92.53 DSC"与 Table 2 并排对表(坑 8)
单模型最优 UMamba DSC 85.05(Table 2,CVPR 口径) 说成"挑战赛冠军方法"(冠军是 nnU-Net ResEnc L,坑 7/8)
HD95 最优 Swin-UMamba 2.94mm(Table 2) 与 UMamba 的 DSC 最优混为一谈
参赛规模 164+132 提交;26 终榜 / 29 上传(坑 6) 只写一个队数不声明口径
类别数 42 实类(48 ID 含 6 NA,坑 2) 写"48 类分割"
排名机制 84 ranks mean rank,越低越好 与"分数平均、越高越好"体系混读

5.8 给不同研究目标的读表策略

同一个 §5.2 表 + §5.1 榜单,不同研究目标该看的行列完全不同:

研究目标 看什么 别看什么
迁移学习选起点 冠军配置(§5.3)+ ResEnc L(74.16)作起点;算力紧张从默认配置降级 别从 TransU-Net(70.32)起步——它是表内反例不是起点
架构论文对表 UMamba 85.05 与 Swin-UMamba 79.64/2.94(Mamba 系双峰);Transformer 侧用 nnFormer 76.79 只对表 nnU-Net 原版 70.92 会被视为基线择弱
临床部署评估 细结构与 others 类的分项表现(§5.5);HD95 优先于 DSC(毫米级安全边界) 别看全场平均 DSC 做部署决策
数据/标注研究 难度谱(§5.5)+ 半自动流水线(§3);按卷序分层设计抽检(§3.2) 别把 GT 当无噪声金标准做"逼近上限"叙事
赛事设计研究 post-challenge 机制(§7.5)+ 单一分发点(§6.8)+ 双中心考题(§2.4)三个机制点 别只抄数据规模叙事

读表的总原则:这张表是"配置对齐的受控对比",不是"各家最强成绩的巡回赛"——每个数字都绑着 §5.6 的统一训练配置,抽掉配置语境做架构叙事是这张表最常见的误用。

§6 获取与许可:注册制、单一分发点与 CC BY-SA

6.1 获取路径:一个入口,两条通道

训练数据(480 例):注册后在 ditto.ing.unimore.it/toothfairy2(Unimore AImageLab 自托管数据集页)下载。这是官方唯一分发点——官方坚持单一权威分发的动机是防版本碎片化:牙科数据一旦出现多版本镜像,"你用的是哪一版"就会成为复现问题的第一嫌疑人(本数据集 changelog 里已有过 scaling 修复,坑 5,正是碎片化风险的实证)。三源核验结论:无官方镜像、未上 HF/Zenodo;网络上任何第三方"下载站"的副本既不可信也违反官方分发设计。

隐藏测试评估(50 例):测试数据不公开,唯一通道是 toothfairy2.grand-challenge.org 的评估平台提交推理结果(挑战赛期间为正式赛道;2024-12-12 起 post-challenge phase 持续开放)。提交形式为算法/推理结果上.portal 评估,排名直接进入官方榜单体系(84 ranks mean rank,§4.2)。

获取后第一步:核对版本——确认所下载副本晚于 2024-07-07 挑战赛发布版(含 P077/P103/P349 标签修复与 F011-F050 元数据修复),且基于 2024-06-13 scaling 修复之后的构建(坑 5)。官方 changelog 是版本判定的权威依据。

6.2 License 逐字母拆解:CC BY-SA

条款 含义 对本数据集的具体后果
BY(署名) 使用须标注来源 按官方要求引用挑战赛论文与 CVPR 基准论文(§6.3)
SA(相同方式共享) 衍生数据须以同许可发布 改写标签、重采样、划分子集后发布,必须 CC BY-SA
(无 NC) 不禁止商业使用 种植导航、口腔 CAD 等商业软件可用于训练——这是它与多数医学数据集(NC 条款为主)的关键差异

三个高频场景判定:其一,商业产品训练——可行(无 NC 条款),但模型本身不等于数据衍生品,发布衍生数据集时才触发 SA;其二,在自家 benchmark 里再分发标签改动版——必须 CC BY-SA 并保留署名;其三,论文引用——BY 条款 + 官方引用要求双重约束,按 §6.3 模板。与库内条目对比:crossmoda2022 是 CC BY-NC-SA 4.0(禁商用),ToothFairy2 的 CC BY-SA 在医学影像数据集里属于偏开放的一档,这也是它 1,423 次下载请求(MIA 统计口径)热度的一个合理解释变量。

6.3 引用规范模板

官方要求引用两篇文献(用途不同,都要引):

  1. 挑战赛论文(数据 + 挑战赛结果 + 26 队排名):Bolelli F, Marchesini L, et al. Multi-structure segmentation in CBCT volumes: The ToothFairy2 challenge. Medical Image Analysis, 2026. DOI: 10.1016/j.media.2026.104095(PMID 42102640;预印本 arXiv:2411.17213)。
  2. CVPR 2025 基准论文(8 模型基准 + 方法细节):Bolelli F, Marchesini L, et al. Segmenting Maxillofacial Structures in CBCT Volumes. CVPR 2025 Workshops(openaccess.thecvf.com)。

数据来源声明建议附:挑战赛官网 toothfairy2.grand-challenge.org、数据页 ditto.ing.unimore.it/toothfairy2、伦理批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D。注意两篇论文引用时的分工(坑 7):引数据/排名/参赛规模 → 挑战赛论文;引架构对比/训练配置 → CVPR 基准论文。只引一篇就开始对表的写法是本数据集最常见的引用事故。

6.4 伦理与合规要点

事项 内容
伦理批准 Comitato Etico dell’Area Vasta Emilia Nord,批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D
数据形态 回溯性临床采集(2019-2024),注册制受控分发
人口学 性别/年龄随数据提供(58.30% 女性;年龄 (10, 100])
测试数据 组织方持有,不在任何公开渠道
embargo 挑战赛结果 6 个月 embargo(2024-10-06 颁奖起算)

研究者侧的合规动作:论文里写明数据获取路径(注册制公开数据,非私有数据);使用机构按注册页面条款约束使用范围;再分发衍生数据触发 CC BY-SA 的 SA 条款。

6.5 AI-Ready 评估

维度 评价 依据
机器可读性 优 mha 标准 ITK 格式 + dataset.json 标签定义 + 官方 nnUNetplans 文件,主流管线零摩擦
无注册获取 中 注册制(免费但要申请),无直链无镜像——单点但受控
标注可追溯性 良 半自动流水线官方公开描述(§3);但无标注者间一致性系数公开
许可清晰度 优 CC BY-SA 明示,商用无禁令,衍生同方式共享
探针可复现性 优 官方基准仓库直接提供 8 模型训练命令与 plans 文件(§7),基线可本地复跑——库内少见的"代码即基础设施"档
文档完整性 良 官网 FAQ + changelog + 两篇论文三层文档;mha direction 元数据问题靠 FAQ 自曝条款兜底(坑 4)

短板集中在"无注册获取"与"标注一致性系数缺失":前者是设计选择(单一分发点防碎片化),后者是领域通病。探针可复现性是该数据集的相对亮点——多数挑战赛只放论文不放可训练基线,ToothFairy2 把 8 个模型的训练命令全部开源(§7.2),第三方可以在本地把 nnU-Net 基线跑起来再对官方数字。

6.6 获取与使用的边界情形清单

情形 能否做 要点
学术研究,注册下载训练集 能 引用两篇官方文献(§6.3)
商业软件用其训练 能 无 NC 条款;衍生数据集发布触发 SA
把数据搬上 HF/Zenodo 做镜像 不应做 违反单一分发点设计;版本碎片化(坑 5 的教训)
从第三方网盘获取 不建议 版本不可考,scaling bug 修复状态未知(坑 5)
自划测试集发论文 能 用 Set B 或自划验证;勿与官方隐藏测试分数对表(§2.4 域移位)
提交官方评估上榜 能 post-challenge phase 持续开放(2024-12-12 起)
发布改进标签版 能(带条件) CC BY-SA 同许可 + 署名 + 说明与官方版差异
在 Set A 上训练上颌类模型 不成立 Set A 缺上颌结构(坑 3),只用 Set B + 显式设计
信任数据内 direction 元数据做配准 不建议 官方 FAQ 自曝不符(坑 4),先人工核方向

6.7 下载后校验流程

1. 版本核对:对照官方 changelog(2024-06-13 scaling 修复、2024-07-07 发布版)
2. 数量核对:训练 480 = Set A 417(P 前缀)+ Set B 63(F 前缀)
3. 标签核对:dataset.json 48 ID,跳过 6 个 NA(19/20/29/30/39/40)(坑 2)
4. 抽查一卷:SimpleITK 读 spacing(0.3mm 等向)+ HU 范围 + 方向目检(坑 4)
5. FOV 检查:随机抽 3 例 P 前缀确认上颌缺失形态(坑 3 的视觉基线)
6. 跑官方评估脚本自检:用一份 GT 对自身算分,应得满分——评估链路无误的烟雾测试

6.8 单一分发点策略的利弊再评

官方拒绝镜像、坚持注册制单点的选择值得单独评一次,因为它决定了使用者的全部获取体验:

利:其一,版本一致性——changelog 两次修复(2024-06-13 scaling、2024-07-07 标签/元数据)都通过官方页单点触达所有用户,坑 5 正是这个机制"生效"的实证;其二,使用度可统计——"1,423 次独立下载请求"这类数字只有注册制才能统计,第三方镜像永远给不出真实使用图景;其三,伦理追溯链完整——注册记录 + 伦理批号构成可审计的使用链条,这是临床数据越来越硬的合规要求。

弊:其一,单点依赖——Unimore 实验室的服务器就是全部基础设施,机构迁移、经费断档、域名变更任一发生,数据可达性瞬间归零(对照:Zenodo 型托管以 DOI 永久承诺对冲此类风险);其二,获取摩擦——注册一步 + 版本自查义务(坑 5),对比免注册直链多了两道工序;其三,检索可见性——搜索引擎对注册墙后内容的索引权重低,新人靠关键词可能先撞上第三方转述而非官方页。

库内对照:crossmoda2022 走 Zenodo 免注册(开放档),ToothFairy2 走注册制单点(受控档)——两极各有适用场景,选择由伦理要求与防碎片化需求决定,无绝对优劣。对使用者的实务建议:注册后第一时间做附录 D/Q 的版本核对,把自己的下载副本变成"有版本标签的资产"而不是"一个不知来历的压缩包"。

§7 官方基准生态:GitHub 上的可训练遗产

7.1 仓库全景:AImageLab-zip/ToothFairy2-Benchmark

官方基准仓库 AImageLab-zip/ToothFairy2-Benchmark(GitHub,2025-06 仍在活跃提交)是本数据集区别于"论文即终点"式挑战赛的核心资产,三大目录:

目录 内容 用途
benchmark_networks/ 8 个基准模型的训练入口 按模型名组织,命令行即可启动训练
evaluation/ 官方评估实现 84 ranks mean rank 的权威代码(§4.2/§4.4)
nnUNetplans_files/ + dataset.json nnU-Net plans 与标签定义 继承官方预处理/patch 配置,避免自造 plans

工程含义:复现基线不需要"从论文里抠超参"——plans 文件直接继承,评估代码直接调用。库内对比:多数挑战赛条目的"可复现性"止步于论文数字,ToothFairy2 的基线是开箱可训练的。

7.2 八个基准模型的训练命令矩阵

仓库覆盖 8 个模型的训练命令(与 CVPR Table 2 一一对应,§5.2):

# 模型 谱系 Table 2 DSC
1 nnUNet CNN 70.92
2 nnUNet-ResEncL CNN 74.16
3 nnFormer Transformer 76.79
4 TransUNet Transformer 70.32
5 UNETR++ Transformer 71.43
6 UMamba Mamba 85.05
7 VMamba Mamba 73.13
8 SwinUMamba Mamba 79.64

训练环境按 CVPR 论文口径:A40 48GB、CUDA 11.8、PyTorch 2.1.2(§5.6)。复现时的三条纪律:配置逐项对齐(改 patch/epochs = 引入混杂);连通域后处理统一开关(+2 DSC 量级);自划验证分数与 Table 2 分开报。

7.3 冠军代码的位置

冠军方案(Isensee & Kirchhoff,nnU-Net ResEnc L,§5.3)的代码集成在 nnU-Net 官方仓库的 documentation/competitions/Toothfairy2 路径下——这是 nnU-Net 团队对自己赛事方案的常规归档方式(同一模式也见于其他 nnU-Net 参赛赛事)。使用要点:冠军配方是"nnU-Net ResEnc L + 牙科专用配置"(patch 160×320×320、深度 7、禁左右镜像、1500 epochs、五折 + 双种子集成、类级阈值后处理),复现时把牙科配置与 plans 文件叠加,而不是拿通用配置重跑。

7.4 生态接口:torch_em loader 与下游工具

数据集在第三方生态里的接入点:torch_em(constantinpape.github.io 文档)提供了直接加载 ToothFairy2 的 loader 文档——PyTorch 侧不用手写 ITK 转换链。MONAI/3D Slicer 走 mha 原生支持。nnU-Net 走官方 plans。三条接入路径覆盖了当前 3D 医学分割的三大主流工作流,这是"生态成熟度"维度的加分项。

7.5 post-challenge:榜单没有关门

2024-12-12 起 post-challenge phase 上线,grand-challenge 平台持续接受新提交并更新排名。三层含义:其一,新方法可以随时获得官方测试集上的成绩(对审稿人是"官方数字"的持续供给);其二,榜单是活的——引用排名要带时间戳(“截至论文提交时”);其三,这是挑战赛数据集"防过时"的机制设计:数据不冻结、评估不断流,benchmark 的对抗性随提交持续校准。

对三类角色的实操提示:方法作者——冲榜前先读官方 evaluation/ 代码与 FAQ,别在格式细节上浪费提交次数(提交本身是稀缺资源,§2.8 的漏斗显示有实质淘汰);审稿人——遇到"ToothFairy2 上 SOTA"的声明,先查声明时间戳与 post-challenge 榜单现状是否一致;组织者——post-challenge 的维护成本主要是评估算力与榜单治理,本赛事 2025 年仍在活跃运转(§7),可作为"赛后生命周期"的活样本观察。

7.6 复现路线图(从零到对表)

目标 A:本地训练一个基准 → 对官方分数
  1. 注册下载训练集(§6.1)
  2. clone AImageLab-zip/ToothFairy2-Benchmark
  3. 用 nnUNetplans_files/ + dataset.json 配置 nnU-Net
  4. 选模型(建议 nnUNet-ResEncL 起步,UMamba 对标强基线)
  5. 训练(A40 48GB 口径;显存不足降 patch,论文里声明)
  6. 自划验证评估 → 勿与隐藏测试分数对表(§2.4)

目标 B:提交官方榜
  1. 按平台格式打包推理(grand-challenge 提交规范)
  2. post-challenge 通道提交 → 获得官方 84 ranks 成绩
  3. 论文引用带时间戳的排名(§7.5)

目标 C:架构研究
  1. UMamba + Swin-UMamba 必须对表(§5.4)
  2. 连通域后处理与集成策略统一(§5.6 纪律)
  3. 分细类报告(others/细结构优先,§5.5)

§8 局限与批判性中评

8.1 单中心训练的泛化考题:设计还是缺陷?

训练数据主体来自 Afidea 单一中心(意大利),测试来自另一中心(荷兰 Radboud)——官方 limitations 明确自曝"训练单中心"。对这条局限要有两层的读法:作为数据集缺陷,它意味着训练集的设备/重建链多样性不足,模型在第三个中心上的表现没有任何数据背书;作为考题设计,训练-测试跨中心恰好把"域泛化"做进了甄别维度——在 Set A 上交叉验证 95 分的模型未必能在 Radboud 测试上维持名次,这正是 benchmark 想暴露的能力。使用者的实务结论:拿这份数据训自己的临床模型时,不要假设对自家设备即插即用,按 §2.4 的设备参数表做强度域对齐,并在自家数据上重测。

8.2 欠代表与缺席的结构

官方自曝的类别层局限有三:其一,“others"修复物类欠代表(种植体/冠/桥/根管填充的形态与材质多样性远超训练覆盖,全场最难类,§5.5);其二,缺 dental braces 类(正畸托槽/弓丝);其三,缺 bone plates 类(颌骨固定板)。三者共同指向同一个盲区:金属与高密度人工物在 CBCT 里正是伪影最重的对象,而它们恰是临床(种植、正畸、创伤修复)的高价值目标。对使用者的含义:在含大量修复物的临床数据上部署 42 类模型时,others 类的输出要降权信任;做相关方法研究时,这份数据可以当"起点"但不足以当"终点”。

8.3 半自动标注的中评:诚实披露下的系统性残余

§3.4 已从方法学上辩护了流水线的必要性,这里是中评面:标签里"模型建议 + 专家修正"的痕迹无法从成品数据里剥离开——没有人能指出哪个体素是模型画的、哪个是专家改的。三个残余风险:边界贴模型先验(专家修正倾向接受模型大方向、只修明显错误,边界可能系统性偏向模型先验);批次质量漂移(早期卷的修正负担重于晚期,§3.2);对 nnU-Net 系方法的隐性亲和(标注建议来自 nnU-Net,nnU-Net 系模型在该数据上的分数可能含"亲和红利",而 Mamba 系在 CVPR Table 2 的领先反而因此更可信——它是在"别人的先验"上赢的)。第三条是本中评的非对称结论:Mamba 系的领先含金量高于 nnU-Net 系的绝对分数。

8.4 评估协议的中评:稳定性检验的缺位

§4.5 已列三点批评(头部差距无显著性检验、HD95 体积敏感性、单榜依赖无 bootstrap),此处补中评定位:对照同期 crossmoda2022 的 1000 次 bootstrap Kendall τ 稳定性报告,ToothFairy2 的排名协议省略了稳定性层——84 考项的颗粒度本身有摊薄方差的作用,但"冠军 4.6 vs 亚军 4.8"这类 0.2 级差距在没有置信区间时只能读作点估计。引用纪律:榜首叙事写"并列第一梯队"更稳,方法论文里引用 mean rank 时保留两位小数即可、不要再制造第三位小数的精度幻觉。

8.5 官方自认局限汇总(CVPR/挑战赛论文 limitations 口径)

局限 出处 对使用者的动作
训练数据单中心(Afidea) CVPR limitations 域对齐后再迁移(§8.1)
implants/crowns/bridges 欠代表 CVPR limitations others 类降权信任(§8.2)
缺 dental braces 类 CVPR limitations 正畸场景需外补数据
缺 bone plates 类 CVPR limitations 创伤修复场景需外补数据
direction 元数据不准 官方 FAQ 配准前人工核方向(坑 4)
Set F scaling 历史 bug changelog 版本核对(坑 5)

这张表的价值在于全部局限均为官方自曝——数据集的诚实披露程度本身是可信度指标,中评不等于否定。

8.6 双中心设计的另一面:它同时是最好的与最难的

把 §8.1 与 §2.4 合并读:双中心双设备让这份数据既是最好的跨中心泛化考场,也是最难的开箱即用数据。库内同类对比:totalsegmentator 的全身 CT 覆盖多设备但以"规模换纯度",hecktor(662) 的多中心头颈 CT 明确做了标准化协议——ToothFairy2 选择的路线是保留原始域差异(设备、重建链、FOV 全部异构)。这条路线的代价是新手上手成本(§2.9 检查单的由来),收益是 benchmark 的域移位甄别力。选型判断:要"干净可控的分割研究"用 Set B + 自划验证起步;要"跨中心泛化研究"这份数据是库内牙科域的唯一选择。

8.7 中评小结

三条正面(规模与类别覆盖的稀缺性、可训练基线的生态完整度、官方披露的诚实度)对三条保留(单中心训练与金属物盲区、标注的模型亲和残余、评估稳定性检验缺位),综合定位:牙科 CBCT 多结构分割的当前默认基准,方法论上是一份"诚实但有已知边界"的资源。引用时的姿态:引数据选它没有争议;引结论时把 §8.5 的官方局限带上,尤其是凡迁移到临床设备的场景。

8.8 中评维度的库内对照

把 §8 的中评维度放到库内坐标系里看(对照条目仅取公开形态,数字以各自条目为准):

中评维度 ToothFairy2 crossmoda2022(库内条目)
标注透明度 半自动流水线官方完整披露(§3),但无 inter-rater 系数 协议文档化(标注者资质/工具/仲裁),分割 inter-rater 系数同样未公开
评估稳定性检验 未报告(§4.5) 1000 次 bootstrap + Kendall τ(官方报告)
域多样性设计 双中心双设备(训练侧单中心) 双机构双模态(不成对设计)
基线生态 8 模型开箱可训练 + 冠军代码归档(§7) 官方未发布 baseline 分数,探针可复现性受限
测试集封闭性 隐藏 50 例,post-challenge 持续可提交 隐藏 271 例,赛后无开放个人通道
许可开放度 CC BY-SA(商用不禁) CC BY-NC-SA 4.0(禁商用)

两行的互补关系一目了然:ToothFairy2 的短板(稳定性检验)恰是 crossmoda2022 的长板;反过来 ToothFairy2 的长板(可训练基线、持续开放提交、商用许可)正是 crossmoda2022 的受限项。没有"全面占优"的 benchmark,只有"短板互补"的坐标系——这也是库内把两者都做成独立条目的价值:研究者按自己的短板敏感度选场,而不是按宣传数字选场。

8.9 维护者视角:哪些局限可能被官方后续修复

对照官方的工程节奏(2024 年内两次 changelog 修复、基准仓库 2025-06 仍在活跃提交、post-challenge 持续开放),§8.5 的局限清单并非静止——按可修复性分三档:

局限 可修复性 依据与触发条件
direction 元数据(坑 4) 可能修复 纯元数据问题,一次数据版更新可解;盯 changelog
others 欠代表(§8.2) 部分可修复 post-challenge 机制若伴随数据增补(官方未承诺);修复前该类结论保持保守
评估稳定性检验缺位(§4.5) 易修复 纯分析层工作,官方或第三方都可补做 bootstrap——第三方补做时须声明非官方口径
缺 braces/bone plates 类 难修复 加类意味着重标注与排名体系变更(84 考项数会变),历史上罕见
训练单中心(§8.1) 难修复 数据来源属性,扩展第二训练中心等于半个新数据集
半自动标注亲和(§8.3) 不可修复 已固化为标签属性,只能披露不能回滚

维护动作映射:盯 changelog 与 post-challenge 公告(坑 5/§7.5),附录 N 的触发点表已列出对应更新项;官方 changelog 若出现新的使用陷阱,按序新增坑点编号并同步附录 A 总表与附录 I 问答(现有坑 1-8 编号保持不变,新坑顺延);第三方若发布官方数据的 bootstrap 稳定性分析,§4.5 批评三可从"缺位"改写为"官方缺位 + 第三方补做",并在附录 D 证据链加行。

§9 与库内条目的关系:牙科空位与挑战赛谱系

9.1 与 fdtooth(609):同一颗牙的两种物理世界

fdtooth(609) 是库内另一条牙科影像条目——牙科 X 光全景片(panoramic radiograph),2D 投影影像。它与 ToothFairy2 的对照是理解牙科影像数据谱系的最短路径:

维度 fdtooth(609) ToothFairy2
物理形态 2D 投影(X 光全景片) 3D 体数据(CBCT)
结构信息 全牙列单帧投影,颌骨深度信息坍缩 亚毫米体素,颌骨/下颌管/上颌窦立体可见
标注任务 全景片上的牙科结构分割/检测(2D) 42 类颌面结构体素分割(3D)
辐射剂量/成本 低剂量、低成本、常规筛查 高于全景片、临床指征驱动
临床角色 筛查与初诊 种植/正颌/根管的手术规划

两者是互补而非竞争关系:全景片是牙科影像的"广角镜",CBCT 是"显微镜";2D 分割模型(fdtooth 域)与 3D 分割模型(ToothFairy2 域)在临床上对应筛查与规划两个环节。一个更具体的临床分工注记:全景片上的牙位计数与龋损初筛不需要 CBCT(剂量与成本不匹配);而种植前的骨量评估、下颌管走行定位、阻生牙与下颌管的空间关系判断,全景片的投影重叠会系统性失真——这些正是 ToothFairy2 类体数据分割的目标场景。两个数据域的模型在临床上不是互相替代,而是级联的两级。互链读法:从 fdtooth 进入的读者要建立的核心认知是"投影与体数据的分割是两个问题域"——2D 上的牙位检测精度不外推为 3D 的管/窦分割能力;反之从 ToothFairy2 进入的读者也应意识到,海量全景片数据的标注经济性远优于 CBCT,两者在数据规模上相差一到两个量级。这是本条目与 fdtooth(609) 的指定互链点:两文互为"同一解剖域的物理形态对照",建议双向互链。

9.2 与 dentex:全景片上的牙齿分割

dentex(全景片牙齿分割与检测, MICCAI 卫星赛事系列)与 ToothFairy2 构成"牙位语义"的两级:dentex 在 2D 全景片上做牙齿编号/分割(FDI 语义的投影域版本),ToothFairy2 在 3D 体数据上把 FDI 牙位落成体素类别(32 颗牙逐颗成类,§2.2)。对照价值有二:其一,FDI 牙位表示法是两者共享的语义骨架——在 dentex 上验证过的牙位逻辑迁移到 ToothFairy2 时,"四象限 × 牙序"的编号系统不变,变的是几何载体;其二,两份数据可以构成"2D 筛查 → 3D 确认"的方法学流水线研究素材(全景片初筛异常 → CBCT 精细分割),这是库内牙科域独有的组合。

9.3 与 hecktor(662)/pddca:头颈域的近邻

hecktor(662)(头颈肿瘤分割挑战赛系列,CT/PET 域)与 pddca(头颈危及器官 OAR 分割)是解剖上离颌面最近的库内条目,但三者的任务语义不同:hecktor 与 pddca 的考题核心是肿瘤与放疗危及器官(腮腺、脊髓、淋巴结层面),ToothFairy2 的考题核心是牙列与颌骨骨架(牙位、下颌管、上颌窦)。临床流程上三者恰好串成头颈肿瘤放疗的完整链:pddca 式 OAR 勾画(放疗计划)→ hecktor 式靶区分割(GTV/CTV)→ ToothFairy2 式牙列/颌骨分割(牙科评估与放射性龋齿/颌骨坏死风险侧)。方法学互证点:hecktor 系对多中心 CT 标准化的处理经验(重采样/强度对齐协议)可直接迁移到 ToothFairy2 的双中心预处理(§2.4)。

9.4 与 verse-spine/ctpelvic1k/autoimplant:挑战赛谱系的解剖域矩阵

三条库内条目与 ToothFairy2 同属"挑战赛驱动的 3D 分割基准"谱系,各占一个解剖域:

条目 解剖域 影像 与 ToothFairy2 的对照
verse-spine 脊柱椎体 CT 同为"逐结构建档"范式(椎体逐节 vs 牙位逐颗);Verse 系的验证集设计可对照 ToothFairy2 的隐藏测试设计
ctpelvic1k 骨盆 CT 大规模单域多结构分割的另一解剖域样本;其"千例级"规模叙事与 ToothFairy2 的"530 例 42 类"构成规模-类别数的两种堆法
autoimplant 颅骨 CT 同为手术规划导向的挑战赛(颅骨修复 vs 牙科种植);"健康解剖先验 + 缺损重建"与"全结构分割"两种任务形态

这组对照的谱系结论:"挑战赛 + 解剖域 + 逐结构建档"是 2018-2024 年 3D 医学分割基准的成熟模板,ToothFairy2 把这个模板推进到牙科域并做到了当时的规模上限(最大 CBCT 多结构公开基准,§0)。

9.5 与 totalsegmentator/c3vd/segthor:规模与形态的两端

totalsegmentator(全身 CT 多结构分割)代表"结构数 × 解剖覆盖"的极:上百类横贯全身,但牙科专用类别不是其强项——颌面区的牙位细分正是 ToothFairy2 的纵深。c3vd(结肠镜 3D 分割)与 segthor(胸腹器官分割)分别代表内窥 3D 与胸腹 CT 的任务形态,与 ToothFairy2 的对照点是"3D 分割"这个词在不同模态下的完全不同含义。互链读法:从 totalsegmentator 进入的读者要意识到"全身多类"与"单域多类细剖"是两种基准哲学——前者考覆盖,后者考深度;在牙科应用里,ToothFairy2 的 42 类细剖没有替代品。

9.6 互链使用约定

  1. 本条目与 fdtooth(609) 的互链为指定互链(主会话任务设定),fdtooth 条目由其写手维护,本条目单向引用其公开形态(2D 全景片域),不互改内容;
  2. §9 各对照均基于库内条目的公开定位描述,具体数字以各条目正文为准——本条目不转述他条目的统计数字,避免二手口径污染;
  3. 后续新增牙科/颌面域条目时,应并入 §9 的对照矩阵而非另起导航章节。

9.7 检索者动线:谁会从哪里进入本条目

按进入关键词分五条动线,各自给出最短价值路径:

进入路径 画像 最短价值路径
“CBCT 分割 / 牙科 AI / 下颌管分割” 检索 口腔-医疗 AI 应用者 §0 → §1 Q4/Q10 → §6 下载 → §10.3 上手
从前作 ToothFairy(2022)文献追新 复现过前作的团队 附录 J 名称辨析 → §2 规格对照 → §5.3 冠军配方
“Mamba / state space model 医学” 检索 3D 架构研究者 §5.2 Table 2 → §5.4 现象分析 → §7.2 对表命令
“MICCAI 2024 challenge / benchmark 设计” 检索 赛事组织者 §4 排名机制 → §6.8 分发策略 → §7.5 post-challenge
从 fdtooth(609) 互链进入 库内浏览读者 §9.1 对照表 → 决定是否需要 3D 域数据 → §1 Q7 规模口径

第五条动线是库内设计的核心场景之一:fdtooth(609) 的读者若止步于 2D 全景片分割,本条目 §9.1 提供"何时必须上 3D"的判断依据(种植规划、管/窦结构、手术导板);反之本条目读者做大规模筛查类应用时,也会被导回全景片域的更高标注经济性——双向导流,各取所需。

§10 方法学启示与快速上手

10.1 五条可迁移的经验

其一:半自动标注是把"不可能规模"变成"可交付规模"的正解(§3)。 42 类 × 530 卷的纯人工标注在经济上不存在;"每 20 卷重训提建议 + 专家终审 + α-shape 平滑"的迭代机器让 7 名专家覆盖了传统路线需要数十人年的工作量。可迁移的条件有三个:任务有强模型先验可用(nnU-Net)、标注界面支持 2D 三平面快速修正、组织方愿意诚实披露流水线。反过来的教训也存在:流水线产出的标签自带模型先验痕迹(§8.3),下游分析要把这层先验当协变量。

其二:rank-then-aggregate 是多类评估的成熟终态(§4)。 42 类 × 2 指标的量纲不可通约问题,用"逐考项排名取均值"一次性解决;它对偏科与灾难失效的惩罚比分数平均敏感得多。从 crossmoda2022 的 rank score 到 ToothFairy2 的 mean rank,同期赛事在这一点上的收敛不是巧合——任何设计多类/多结构 benchmark 的团队都应把"分数平均"方案淘汰出局。

其三:把域差异做进考题,而不是清洗掉(§2.4/§8.6)。 双中心双设备、Set A 的 FOV 裁剪、修复物的天然缺失——这些"脏"全部保留在考题里,换来的是 benchmark 对真实部署场景的甄别力。对照思路是把数据清洗成"设备一致、视野完整"的干净集——那样的 benchmark 分数漂亮但外推力存疑。ToothFairy2 的选择值得每个数据集设计者抄写一遍。

其四:post-challenge 让 benchmark 不冻结(§7.5)。 2024-12-12 起持续开放提交,榜单成为活文档——新方法随到随考,数据的"基准有效期"从赛期那一天延长到平台存续期。这是对抗"挑战赛数据集发完论文即过时"规律的机制设计,成本极低(评估平台本来就在),收益是持续的方法学供给。

其五:基准仓库是数据集的第二生命(§7)。 8 模型训练命令 + plans 文件 + 评估代码的开箱可训练形态,让 ToothFairy2 的复现门槛远低于"论文即终点"的同类。它还改变了方法学叙事的举证责任——在这个数据上声称新架构更强的论文,必须对表 UMamba/Swin-UMamba(§5.4),而这两个基线人人可跑。可复现的强基线是最好的反灌水机制。

10.2 三条给数据集条目写作者的规则

  1. 双口径数字必须当场存照:42/48、26/29、530/480 这类"都对但口径不同"的数字,写条目时的纪律是——正文用主口径,脚注/坑点给副口径,来源到节;不存照的双口径数字会在三个月后变成"自己打自己";
  2. 挑战赛条目要写"机制"而不只写"结果":排名怎么算(§4)、榜单是否还开放(§7.5)、基线在哪跑(§7.2)——这些机制信息是下游研究者决定"用不用"的真正依据,只写冠军分数的条目是半条条目;
  3. 官方自曝的局限要全数转写(§8.5):limitations 抄写是数据集中评的地基——官方没说的局限可以自己提(标注亲和、稳定性缺位),官方说了的局限一条都不能漏。

10.3 快速上手路线(30 分钟版)

给"拿到数据先跑起来"的使用者的最小路径:

  1. 注册与下载(约 5 分钟,不含传输):ditto.ing.unimore.it/toothfairy2 注册 → 下载训练集(§6.1);
  2. 版本与构成核对(约 5 分钟):对照 changelog 确认版本(坑 5);数一遍 Set A 417 + Set B 63;打开 dataset.json 确认 48 ID 与 6 NA(坑 2);
  3. 读一例数据(约 5 分钟):SimpleITK 读一卷 P 前缀——确认 0.3mm 等向 spacing、HU 范围、上颌缺失形态(坑 3);再读一卷 F 前缀对比完整 FOV;
  4. 接管线(约 10 分钟):nnU-Net 路线用官方 nnUNetplans_files/(§7.1);PyTorch 路线用 torch_em loader(§7.4);顺手 clone AImageLab-zip/ToothFairy2-Benchmark 备用评估;
  5. 评估自检(约 5 分钟):用官方 evaluation/ 脚本对一份 GT 自算(应得满分),确认评估链路(§6.7 第 6 步)。

之后按研究目标分流:复现基线 → §7.6 目标 A;冲榜 → 目标 B;架构研究 → 目标 C(UMamba 必须对表)。

给临床 AI 工程师的 60 分钟版(在 30 分钟版之上的增量):

  1. 设备参数对齐(+10 分钟):把自家设备的 kVp/mA/FOV 与 §2.4 表并排——参数差距大的,预期域移位大,别直接套官方预处理;
  2. HU 分布对比(+10 分钟):自家数据抽样统计 HU 分位数,与训练域分组统计并排(附录 Q 步骤 2-4);
  3. 细结构优先验证(+10 分钟):下颌管 + 目标牙位的 HD95 先跑通——这是临床验收的核心指标(P.4),DSC 只是第二位;
  4. 修复物场景压测(+10 分钟):拿含种植体/冠桥的病例测"others"类输出——该类欠代表(§8.2),输出必须降权信任并记录失败模式;
  5. 合规留痕(+10 分钟):CC BY-SA 条款核对(§6.2)+ 伦理批号留档(§6.4)——商用可行为本数据集对工程团队的核心吸引力,但 SA 条款在发布衍生数据时触发。

10.4 三行小结(收束)

牙科、CBCT、42 类、体数据是身份指纹;530/480/42/48/26/29/84 是必须带口径引用的数字族;nnU-Net ResEnc L 夺冠、Mamba 系领先基准表是方法学的两条主线——三条都拿准了,这个数据集的使用与引用就不会出错。

10.5 条目覆盖范围声明

明确"本条目写什么、不写什么",给后续维护者与引用者划边界:

在条目内:数据本体与规格(§2)、标注流水线(§3)、评估协议与排名机制(§4)、挑战赛结果与官方基准(§5)、获取与许可(§6)、GitHub 基准生态(§7)、局限与中评(§8)、库内关系与互链(§9)、方法学启示与上手路线(§10)、附录 A-S 存照体系。

在条目外(仅作锚点,不展开):

  1. 前作 ToothFairy(2022)的数据细节——只作为谱系锚(3 类、2022 届)出现,其自身口径体系(卷数、任务设置)不在本条目复述,避免跨届数字污染;
  2. 同场挑战赛 STS 2024 与 3DTeethLand24——只存照"同 workshop 同场"的关系(附录 F),各自的任务设计不展开;
  3. 临床诊疗规范与手术规划指南——本条目是数据集百科条目,不是临床决策资源;§2.4/§5.5 出现的临床语境(下颌管避让等)只为解释"为什么这个结构重要";
  4. 大规模私有临床 CBCT 的治理与合规——不在本条目职责内,§6.4 的伦理批号仅提供公开数据的合规锚点。

边界声明的用处:当引用者拿本条目去支撑"牙科 AI 临床指南"类论述时,越界引用会在第 3 条上现形——条目只回答"数据与基准怎么样",不回答"临床该怎么做"。

附录 A:坑点总表(八则)

本条目全部已存照的检索/使用陷阱一表总览,正文各节首次展开:

编号 一句话 展开位置
坑 1 大小写混用:ToothFairy2 / Toothfairy2 / ToothFairy2-Benchmark 三种写法并存,严格大小写检索会漏文献 §1 Q1、附录 J
坑 2 42 实类 vs dataset.json 48 ID(6 个 NA 占位:19/20/29/30/39/40),按 ID 数编程直接踩坑 §2.2、附录 C
坑 3 Set A(P 前缀 417 例)缺上颌结构系 FOV 裁剪设计而非标注缺失,勿当背景或当错误处理 §2.6
坑 4 mha direction 元数据与物理方向不符(官方 FAQ 自曝),重定向/配准前必须人工核方向 §2.3、§6.6
坑 5 0.3mm 等向 scaling 曾修 bug(Set F HU 投影,changelog 2024-06-13),旧缓存数据必须重下核对 §2.3、§2.7、§6.1
坑 6 26 队进终榜(摘要口径)vs 29 队上传(方法节 2025-07-31 统计口径),引用队数必须声明口径 §2.8、附录 G
坑 7 两篇论文并存:CVPR 2025 基准论文 vs MIA 2026 挑战赛论文(arXiv:2411.17213 预印本),不是同一论文的版本,引用分工见 §6.3 §6.3、§5.7
坑 8 数字口径不可互插:冠军 Dice 0.9253(挑战赛口径)与 CVPR Table 2 基准 DSC(70-85 区间)分属两套体系,并排对表是本数据集最高频引用事故 §5.7、附录 G

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 三入口可索引(赛事名+MICCAI 卫星网络+grand-challenge 平台);扣分:ToothFairy2/Toothfairy2 大小写混用(坑 1)+ 前作 ToothFairy(2022)名称检索干扰
A 可获取性 7 免费但注册制;单一分发点(ditto.ing.unimore.it)无镜像——防碎片化的设计代价是单点依赖;测试集仅服务器评估(设计属性)
I 可互操作 9 mha 标准 ITK 格式 + 官方 nnUNetplans + dataset.json + torch_em loader(§7.4),主流 3D 管线零摩擦;方向元数据问题为唯一扣分点(坑 4)
M 元数据质量 8 设备参数/人口学/changelog 官方齐备(§2.4-§2.7);扣分:标注者间一致性系数未公开、Set B 63 例的来源描述相对简略
S 可持续性 9 post-challenge 持续开放(2024-12-12 起)+ 官方基准仓库活跃维护(2025-06)+ MIA 期刊论文沉淀 + CC BY-SA 衍生友好;单点分发是唯一隐忧
综合评级 8.2/10(良+) 稀缺域(牙科 CBCT 多结构)+ 开箱可训练基线(库内少见的"代码即基础设施"档);短板在注册制单点与方向元数据

附录 C:42 类结构速查:FDI 牙位语义与非牙结构

32 颗牙按 FDI 双位数牙位四象限建档,每象限 8 个牙位(11-18 / 21-28 / 31-38 / 41-48 语义):

牙位序号 牙名(各象限对应) 分割难点注记
1 中切牙 形态规则,最易类
2 侧切牙 形态规则
3 尖牙 单根长根,边界清晰
4 第一前磨牙 双根变异
5 第二前磨牙 双根变异
6 第一磨牙 多根(上颌三根/下颌双根),根管填充高发
7 第二磨牙 阻生变异
8 第三磨牙(智齿) 阻生/缺牙/异位高发——全数据集单类方差最大的牙位族

非牙结构(10 个):上颌骨、下颌骨、双侧上颌窦、双侧下颌管、咽部,以及"others"类(种植体/冠/桥/根管填充等修复物)。注记三条:

  1. 下颌管:种植安全红线结构,毫米级管径,HD95 最敏感的类之一——牙科分割论文的"必报类";
  2. 上颌窦:仅存在于完整 FOV 卷(F 前缀 + 测试集),Set A 缺失(坑 3);
  3. others:全场最难类(§5.5),官方 limitations 自曝欠代表(§8.2)。

工程提醒:dataset.json 的 48 ID 中编号 19/20/29/30/39/40 为 NA 占位(坑 2),上表 32 牙位语义与 dataset.json 的 ID 映射以官方文件为准,本条目不代拟映射表。

附录 D:逐项证据链自证

关键数字/事实 来源 位置
530 = 480(417+63)+ 50 挑战赛论文 + 数据页 arXiv:2411.17213 / ditto.ing.unimore.it/toothfairy2
42 类 / 48 ID 含 6 NA(19/20/29/30/39/40) dataset.json + 官方 FAQ GitHub 官方仓库 / 官网 FAQ(坑 2)
mha / HU / 0.3mm 等向 数据页 + 官方 FAQ ditto.ing.unimore.it/toothfairy2
体积极值 (298,512,512) F039 / (170,272,345) P381 / 中位 (170,357,371) P460 挑战赛论文数据节 arXiv:2411.17213
NewTom NTVGiMK4 3mA/110kVp(训练)/ i-CAT 16×22cm 2×20s(测试) 挑战赛论文数据节 arXiv:2411.17213
58.30% 女性(训练 58.54% / 测试 56.00%);2019-2024;年龄 (10,100] 挑战赛论文数据节 arXiv:2411.17213
7 专家 5+2 分离;每 20 卷重训;α-shape 挑战赛论文标注节 arXiv:2411.17213
164+132 提交;26/29 队(坑 6) 挑战赛论文摘要/方法节 arXiv:2411.17213(MIA 2026 期刊版同源)
84 ranks mean rank;DSC=2×IoU/(1+IoU) 挑战赛论文评估节 + GitHub evaluation/ arXiv:2411.17213 / AImageLab-zip/ToothFairy2-Benchmark
冠军 Isensee & Kirchhoff 0.9253 / 18.472 / 4.6;亚军 4.8;季军 5.2 挑战赛论文结果节 arXiv:2411.17213
冠军配方(patch 160×320×320 / 深度 7 / 禁左右镜像 / 1500 epochs / 五折+双种子 / 类级阈值 / GH200 或 2×A100) 挑战赛论文方法节 arXiv:2411.17213
CVPR Table 2 八模型全表 CVPR 2025 workshop 论文 openaccess.thecvf.com
基准训练配置(patch 80×160×160 / A40 / CUDA 11.8 / PyTorch 2.1.2 / 连通域 +2 DSC) CVPR 2025 workshop 论文 openaccess.thecvf.com
CC BY-SA / 注册制 / 单一分发点 / 1,423 次下载请求 数据页 + MIA 论文 ditto.ing.unimore.it/toothfairy2 / DOI 10.1016/j.media.2026.104095
伦理批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D 数据页 ditto.ing.unimore.it/toothfairy2
时间线(2024-06-13 修复 / 07-07 发布 / 07-08 开赛 / 10-06 颁奖 / 12-12 post-challenge / embargo 6 个月) 官网 changelog + 挑战赛论文 toothfairy2.grand-challenge.org / arXiv:2411.17213
同场三挑战(ToothFairy2 / STS 2024 / 3DTeethLand24)与 workshop 全名 CVPR 论文 + 官网 openaccess.thecvf.com
资助(FAR 2024 / FARD-2024 / Fit4MedRob #PNC0000007) CVPR 论文致谢 openaccess.thecvf.com
limitations 四条(单中心/修复物欠代表/缺 braces/缺 bone plates) CVPR limitations 节 openaccess.thecvf.com

附录 E:数据获取决策树

你要什么?
├─ 训练数据(480 例)
│   ├─ 学术/商业训练 → ditto.ing.unimore.it/toothfairy2 注册下载(CC BY-SA)
│   │   ├─ 先核版本:2024-07-07 发布版之后(坑 5)
│   │   ├─ 上颌类实验 → 只用 Set B 63 例 F 前缀(坑 3)
│   │   └─ 工程接入 → nnUNetplans_files/(nnU-Net)或 torch_em loader(§7.4)
│   └─ 再分发改动版 → CC BY-SA 同许可 + 署名(§6.2)
├─ 隐藏测试成绩(50 例)→ grand-challenge 提交(post-challenge 持续开放,§7.5)
├─ 复现基线 → AImageLab-zip/ToothFairy2-Benchmark(8 模型命令,§7.2)
├─ 冠军配方 → nnU-Net 官方仓库 documentation/competitions/Toothfairy2(§7.3)
├─ 排名细节 → 官方 evaluation/ 代码为唯一权威(§4.4)
└─ 引用 → 两篇论文分工模板(§6.3,坑 7)

附录 F:关键命名与标识存照

复核与检索用,以下字符串均为官方原文形态:

对象 精确字符串
系列届次 ToothFairy2 = ToothFairy 系列第二届(前作 ToothFairy,2022 届,3 类)
赛事全名 ToothFairy2 — Multi-Structure Segmentation in CBCT Volumes
CVPR 论文题 Segmenting Maxillofacial Structures in CBCT Volumes
挑战赛论文题 Multi-structure segmentation in CBCT volumes: The ToothFairy2 challenge
MIA 期刊版 Medical Image Analysis 2026, DOI 10.1016/j.media.2026.104095, PMID 42102640
预印本 arXiv:2411.17213
Workshop 名 Supervised and Semi-supervised Multi-Structure Segmentation and Landmark Detection in Dental Data
组织机构 University of Modena and Reggio Emilia(AImageLab);Radboud University Medical Center
共同一作 Federico Bolelli、Leonardo Marchesini
官网 toothfairy2.grand-challenge.org
数据页 ditto.ing.unimore.it/toothfairy2
基准仓库 AImageLab-zip/ToothFairy2-Benchmark
冠军代码路径 nnU-Net 仓库 documentation/competitions/Toothfairy2
伦理批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D
同场挑战赛 STS 2024(分割+关键点)、3DTeethLand24(牙科 3D 网格)
设备 NewTom NTVGiMK4(Afidea);i-CAT(Radboud)
资助 FAR 2024 / FARD-2024;Fit4MedRob(PNRR #PNC0000007)

附录 G:双口径存照登记表(四组)

编号 口径 A 口径 B 裁决与用法
存照 1(类数) 42 实类 dataset.json 48 ID(6 NA:19/20/29/30/39/40) 正文用 42;涉及工程实现时注 48 ID 来源(坑 2)
存照 2(队数) 26 队进终榜(MIA 摘要口径) 29 队上传(MIA 方法节,2025-07-31 统计) 引"完赛/终榜"用 26;引"参与"可写 29 并声明口径(坑 6)
存照 3(论文) CVPR 2025 基准论文(方法学) MIA 2026 挑战赛论文(全量复盘)+ arXiv 预印本 两篇并存非版本关系;按 §6.3 分工引用(坑 7)
存照 4(规模) 530 全口径 480 公开训练口径(417+63) 引规模写"530(480 公开训练)"(§1 Q7)

维护规则:任一口径变动(如 MIA 论文勘误、官方 FAQ 更新)须同步更新本表、正文对应节与附录 A 坑点。

附录 H:评估协议逐条复刻清单

自建实验复现官方评估协议的检查项(与 §4 对应):

# 协议项 官方口径 复刻检查
1 指标组 DSC(%)+ HD95(mm)双指标 只报 DSC 不完整;IoU 先换算 DSC=2×IoU/(1+IoU)
2 评估粒度 每测试例 × 每类 × 每指标 42 × 2 = 84 考项,逐项计算勿先全局平均
3 聚合方式 84 名次取 mean rank,越低越好 rank-then-aggregate;勿用分数平均
4 类集合 42 实类 跳过 6 个 NA 占位(坑 2)
5 权威实现 GitHub evaluation/ 代码 自写实现必须逐行对读官方代码(§4.4)
6 后处理 官方基准含连通域后处理(+2 DSC 量级) 架构对比时统一开关(§5.6)
7 域隔离 训练 Afidea / 测试 Radboud 自划验证分数不与隐藏测试对表(§2.4)
8 榜单时效 post-challenge 持续更新 引用排名带时间戳(§7.5)
9 上颌类 Set A 无上颌结构 上颌类指标只在完整 FOV 数据上算(坑 3)
10 方向处理 元数据不可信(坑 4) 评估前人工核 direction,防隐性翻转

附录 I:FAQ 式陷阱问答

Q:为什么我的上颌类分割在 Set A 上训不出来?
Set A(P 前缀)FOV 不含上颌(坑 3)——不是你的损失函数写错了。上颌类实验只用 Set B 63 例,或在文档里明示该限制。

Q:重采样后图像"歪了"或配准对不上?
mha direction 元数据与物理方向不符(坑 4,官方 FAQ 自曝)。不要基于元数据做 reorient,先在切片视图人工确认解剖方向。

Q:spacing 不是严格的 0.3mm?
检查数据版本——2024-06-13 前的 Set F 存在 scaling bug(坑 5)。重新下载 2024-07-07 发布版。

Q:损失函数循环报 48 类错误?
dataset.json 48 ID 含 6 个 NA 占位(坑 2)。按 42 实类过滤,或直接继承官方 nnUNetplans_files/。

Q:能商用吗?能发改进版标签吗?
CC BY-SA:商用不禁止;发布衍生数据须同许可 + 署名(§6.2)。

Q:哪里有镜像/直链?
没有。官方刻意单一分发点(§6.1),第三方副本版本不可考(坑 5)——去 ditto.ing.unimore.it/toothfairy2 注册。

Q:现在还能上榜吗?
能。post-challenge phase 自 2024-12-12 持续开放(§7.5)。

Q:论文里该引 0.9253 还是 85.05?
先问自己引的是什么体系:挑战赛冠军成绩用 0.9253(Dice,挑战赛口径);官方复现基线对比用 Table 2(CVPR 口径)。两者不可并排(坑 8)。

附录 J:检索与查证指南

区分三组易混名称:

  1. ToothFairy(2022)vs ToothFairy2(2024):两届独立赛事、两套数据。前作 3 类(牙体/下颌骨/下颌管)、训练集 900+ 卷(另一口径体系),本文所有数字不适用于前作;检索时"ToothFairy challenge 2022"与"ToothFairy2 challenge 2024"分开搜;
  2. 大小写三形态:ToothFairy2(官网)/ Toothfairy2(论文正文)/ ToothFairy2-Benchmark(GitHub 仓库名,坑 1)——文献检索建议大小写不敏感匹配;
  3. 两篇论文:按标题精确匹配(附录 F),别用年份+作者模糊匹配——两篇论文作者高度重叠(Bolelli/Marchesini),只按作者搜会混(坑 7)。

来源优先级(数字争议时的裁决序):GitHub 官方仓库代码/文件 > 官网 FAQ 与 changelog > MIA 期刊论文 > arXiv 预印本 > CVPR 论文(架构基准数字以 CVPR 为准,数据/排名以挑战赛论文为准)> 二手转述(不采信)。注意 arXiv:2411.17213 与 MIA 2026 期刊版为同一论文的预印本/期刊版关系,数字应以期刊版为终裁。

抓取环境存照:本条目核验期(2026-09)网络环境下,Unimore 侧页面访问需常规浏览器 UA;PDF 类文献(CVPR openaccess / MIA)WebFetch 不适用,走 curl 下载 + 本地文本提取——后续维护者复核数字时建议沿用该路径。

附录 K:缩写速查

缩写/术语 全称与释义
CBCT Cone Beam Computed Tomography,锥形束 CT(牙科常规 3D 影像)
FDI Fédération Dentaire Internationale 牙位表示法(双位数:象限+牙序)
DSC Dice Similarity Coefficient(本条目以 % 计)
HD95 95% Hausdorff Distance(mm,95 分位抑离群)
mean rank 84 考项名次均值,越低越好(§4.2)
mha MetaImage 变体体数据格式(ITK 生态原生)
HU Hounsfield Unit
nnU-Net / ResEnc 自配置分割框架 / 其残差编码器(Residual Encoder)大模型变体
UMamba / VMamba / Swin-UMamba 状态空间模型(Mamba)系的三个 3D 分割架构(§5.2)
nnFormer / TransU-Net / UNETR++ Transformer 系三个 3D 分割架构(§5.2)
α-shape 凹包算法(标注表面平滑,§3.3)
Set A / Set B 训练集两子集:417 例 P 前缀 / 63 例 F 前缀(§2.1)
post-challenge 挑战赛后持续开放提交阶段(2024-12-12 起,§7.5)
MIA Medical Image Analysis(期刊)
MICCAI 医学图像计算与计算机辅助介入国际会议

附录 L:库内互链点对照全表

库内条目 record_id 影像域 与 ToothFairy2 的对照维度
fdtooth 609 牙科全景片(2D X 光) 指定互链:同一解剖域的 2D 投影 vs 3D 体数据(§9.1 详述)
dentex — 牙科全景片分割/检测 FDI 牙位语义的 2D 版;"筛查→确认"流水线组合(§9.2)
hecktor 662 头颈 CT/PET 近邻解剖域挑战赛;放疗链上游对照;多中心标准化经验迁移(§9.3)
pddca — 头颈 CT(OAR) 放疗危及器官勾画 vs 牙列/颌骨骨架(§9.3)
verse-spine — 脊柱 CT 逐结构建档范式同构(椎体逐节 vs 牙位逐颗,§9.4)
ctpelvic1k — 骨盆 CT 规模-类别数两种堆法对照(§9.4)
autoimplant — 颅骨 CT 手术规划导向挑战赛同族(§9.4)
totalsegmentator — 全身 CT "广覆盖多类"vs"单域纵深多类"两种基准哲学(§9.5)
c3vd — 结肠镜 3D "3D 分割"在不同模态下的语义差异(§9.5)
segthor — 胸腹 CT 胸腹器官分割对照(§9.5)

互链使用约定:正文自然提及(§0/§9),无手写导航章节;fdtooth(609) 为指定双向互链对象,其余条目单向引用其公开定位,不互改。

附录 M:条目自洽性抽查记录(写手自检)

  • 530 = 480 + 50 ✓;480 = 417 + 63 ✓;42 = 48 − 6 ✓(19/20/29/30/39/40 恰 6 个)
  • 32 牙 + 10 非牙 = 42 ✓(附录 C 枚举:上颌骨/下颌骨/双侧上颌窦/双侧下颌管/咽部/others)
  • 42 类 × 2 指标 = 84 ranks ✓;冠军 4.6 < 亚军 4.8 < 季军 5.2 单调 ✓
  • CVPR Table 2 八行数字与 §5.2 表、§7.2 表一致 ✓;DSC 最优 UMamba 85.05 / HD95 最优 Swin-UMamba 2.94 两个"表内之最"不混指 ✓
  • INFOBOX、§0、§1、§5、附录 A/D 的规模/冠军/许可/时间线数字互相一致 ✓
  • 时间线顺序单调:2024-06-13 → 07-07 → 07-08 → 10-06 → 12-12 ✓
  • 坑 1-坑 8 均有正文展开位与附录 A 总表行 ✓;坑点编号无跳号 ✓
  • frontmatter description ≤170 字符、title/subtitle/data_source.name ≤255 字符(入库硬限制)✓(写后程序化复核)
  • 代码块围栏成对(附录 E、§6.7、§7.6)✓

附录 N:维护计划与更新触发点

触发点 需更新的内容
MIA 2026 期刊版勘误或增补 挑战赛数字全链(附录 D)、存照 2/4(附录 G)、坑 6
post-challenge 榜单刷新(新方法上榜) §5.1 领奖台表(若头三易主)、§7.5 时效注记
官方仓库重大更新(新基线/plans 改版) §7.1/§7.2 表、§5.6 配置、DAIMS 的 I/S 维度
官网 FAQ/changelog 新增条目 附录 A 坑点总表(新坑顺延编号)、附录 I 问答
CVPR 论文 openaccess 版本变动 附录 D 证据链行、§5.2 Table 2 数字
库内新增牙科/颌面条目 §9 对照矩阵、附录 L 互链表
fdtooth(609) 条目内容更新 §9.1 对照细节(保持单向引用其公开形态)

维护原则:所有数字变更必须回写 writing/toothfairy2/FACTS.md(正文—底稿关系);四组双口径存照(附录 G)任一侧变化时另一侧复核;坑点新增按序编号、附录 A 同步。

附录 O:库内三赛事评估协议横向对照

把 §4.3 的两行对照扩成三列全表(hecktor 系取其系列惯例形态,具体以 hecktor(662) 条目为准):

协议项 ToothFairy2 crossmoda2022 hecktor 系(惯例)
指标组 DSC(%)+ HD95(mm) DSC + ASSD DSC + HD95
评估粒度 例 × 类 × 指标(42×2=84 考项) 例 × 结构 × 指标(2 结构) 例 × 结构
聚合方式 84 名次取 mean rank rank score(两级聚合) 系列多为分数直接平均
数值方向 越低越好 越低越好 越高越好(分数)/越低(HD95)
稳定性检验 未报告 1000 次 bootstrap + Kendall τ 各届不一
空预测处理 以官方评估代码为准(§4.4) ASSD 记测试集体素最大距离 350mm 各届不一
测试集形态 隐藏 50 例 隐藏 271 例 隐藏测试
榜单持续性 post-challenge 持续开放(2024-12-12 起) 届次制(按届冻结) 系列届次制
结构量纲 42 类跨度极大(全颌面) 2 结构(VS/耳蜗) 少数头颈结构

三条横向结论:其一,ToothFairy2 与 crossmoda2022 在 rank-then-aggregate 上收敛(§4.3),hecktor 系的分数平均代表更早的惯例——多结构赛事的评估设计正在整体向 rank 体系迁移;其二,榜单持续性是 ToothFairy2 独有的协议项(另两家按届冻结),这改变了"引用一个名次"的时效语义(§7.5);其三,结构量纲的差异决定了稳定性问题的严重度——2 结构的 rank 聚合抖动远小于 84 考项,后者更需要(而恰恰缺失)稳定性检验(§4.5 批评三的跨条目佐证)。

附录 P:牙科解剖先验如何进入模型设计

冠军配方(§5.3)的每一格"非默认设置"背后都有一条牙科解剖/临床先验。逐条拆开,作为"域知识如何写进管线"的教学样本:

P.1 为什么禁左右镜像

FDI 牙位语义有方向性:镜像翻转把象限 1↔2、3↔4 的几何互换,而标签仍是原牙位——“右上第一磨牙"的掩码翻到左边后,像素在左、标签还说"右上”,语义直接漂移。此外牙冠形态与牙根弯曲方向存在统计上的不对称(上下颌牙列的弯曲走向差异)。冠军禁用左右镜像增广,本质是拒绝让增广策略破坏牙位标签的方向语义。注意分寸:官方披露的是左右镜像这一项,其余轴向的镜像/翻转是否受影响,官方未逐项披露——复现时按官方配置照抄,不要自行推广。

P.2 为什么 patch 要放大

默认 patch(112×224×256)在 0.3mm 等向下裁出的视野常常装不下"连续多颗牙 + 部分颌骨曲面"的完整上下文;牙列是沿牙弓排布的连续结构,被 patch 边缘切断的牙位会失去邻牙参照——而邻牙参照正是牙位消歧(哪个牙位缺了、阻生了)的重要线索。冠军 patch 160×320×320 的整体放大保证了单视野内的牙列连续性,代价是显存(GH200 96GB 或 2×A100 40GB,§5.3)。这是"结构的空间尺度决定 patch 尺度"的直接案例:全身 CT 的器官分割用不了这么大的 patch,牙列的几何密度要求它。

P.3 为什么类级截止阈值

42 类的阳性频率极不均衡:32 个牙位类在多数病例里全部有阳性,而"others"类(修复物)的有无完全取决于患者治疗史,下颌管等细结构则是"小而恒在"。统一阈值对稀疏类要么全漏(阈值过高)要么过火(阈值过低);类级截止阈值让每类的输出概率各自调平——这是 84 考项体系下的直接收益点:一个类从"全错"到"及格",在 mean rank 里是整整一个名次位次的移动。

P.4 为什么 HD95 在这个域里格外重要

种植规划的安全边界是毫米级几何问题:下颌管边界判断差 1mm 就是神经损伤风险分级问题。DSC 对"整体对了但边界整体平移"钝感(重叠率仍高),HD95 直接报毫米数。对牙科域论文的实操含义:只报 DSC 的牙科分割论文等于没报安全边界——审稿与引用时都应把 HD95(或等价的表面距离指标)当作必备项。

P.5 Mamba 与牙弓几何的亲缘(推测性,明确标注)

一个表面亲缘的观察:Mamba 系的线性复杂度长序列建模与"沿牙弓连续扫过数十个结构"的几何形态直觉一致,UMamba/Swin-UMamba 的 Table 2 领先(§5.2)与该直觉方向相符。但本条目仅记录相关性,不主张因果——"牙弓序列性"是否真是 Mamba 系领先的机制,需要专门的消融研究回答;把这个推测当结论引用,是本条目明确反对的。

附录 Q:双中心预处理操作手册

训练(Afidea 域,P/F 前缀)→ 测试(Radboud 域)的域差异落实到预处理,是一条有固定顺序的操作链:

  1. 版本核对(坑 5):2024-07-07 发布版之后,2024-06-13 修复之后;
  2. 分组统计:P 前缀 / F 前缀分组统计 HU 分布(两者同设备可合并统计)——Radboud 域不可见,只能按 §2.4 设备参数推断强度域差异,做最坏假设;
  3. HU 截断:CBCT 的有效 HU 区间与医用 CT 不完全等价(§2.3),按自家分组数据的分位数截断,截断参数写进实验记录——不要照搬医用 CT 的窗口惯例;
  4. 分组归一化:P/F 分组 z-score;跨域推断时不假设 Radboud 域共享训练域的均值方差;
  5. 重采样决策:数据已 0.3mm 等向,常规路线免重采样;若因显存降采样,注意方向核验(坑 4)与插值选择(标签用最近邻);
  6. FOV 处理(坑 3):Set A 的上颌缺失区域显式排除出损失与指标计算,勿作背景参与;
  7. 评估对齐:自建评估逐行对读官方 evaluation/ 代码(§4.4),NA 类过滤(坑 2),84 考项 rank 聚合(§4.2)。

三条路径的预处理差异速查:

学术复现(对表官方)→ plans 继承 + 官方评估代码 + 配置零改动(§5.6)
应用迁移(自家设备)→ 分组归一化 + 设备参数对齐(§2.4)+ 自家数据重测(§8.1)
架构研究(新方法)  → 配置显式声明差异 + UMamba/Swin-UMamba 强基线对表(§5.4)

附录 R:双解释层术语表

R.1 给 ML 研究者的牙科术语

术语 一句释义 为什么在本数据集语境里要紧
FDI 牙位 国际牙科联盟双位数表示法:象限(1-4)+ 牙序(1-8) 42 类里 32 类的语义骨架(§2.2)
下颌管 下颌骨内走行下牙槽神经的骨性管道 种植安全红线,毫米级细结构,HD95 敏感(P.4)
上颌窦 上颌骨内的含气窦腔 仅完整 FOV 卷有(坑 3 的主角之一)
阻生 牙齿萌出受阻(常见于第三磨牙) 第三磨牙位方差最大的来源(附录 C)
种植体 植入颌骨的人工牙根(钛) "others"类成员;金属伪影重灾区
冠/桥 牙体修复/缺牙修复的固定修复体 "others"类成员,形态任意(§5.5 最难类)
根管填充 根管治疗后的根充材料 "others"类成员,高密度细条状
FOV(临床) CBCT 扫描视野,按临床指征裁剪 Set A 缺上颌的直接原因(坑 3)
金属伪影 高密度物体导致的射线硬化伪影 修复物类难度与欠代表的物理根源(§8.2)

R.2 给牙科/临床 AI 应用者的 ML 术语

术语 一句释义 为什么在本数据集语境里要紧
DSC 分割与金标准的重叠率(%) 主指标,但对边界平移钝感(P.4)
HD95 两表面距离的 95 分位(mm) 安全边界的直接读数(P.4)
mean rank 84 考项名次均值,越低越好 官方排名口径,防偏科(§4.2/4.6)
patch 单次训练裁剪的三维视野 冠军放大的动机是牙列连续性(P.2)
五折交叉验证 训练数据分五份轮换训练/验证 冠军集成的底座(§5.3)
集成 多模型输出合并 双种子 + 五折,头部对决的免费分数(§5.3)
后处理阈值 对模型概率输出按类设截止 类级阈值应对 42 类频率失衡(P.3)
α-shape 从点云拟合凹包表面 GT 表面已平滑的来源(§3.3)
mha / HU 体数据格式 / CT 强度单位 读数据的两把钥匙(§2.3)
nnU-Net plans 自配置分割框架的预处理计划 官方提供,免自造(§7.1)
Mamba / SSM 状态空间模型架构族 Table 2 上的架构新贵(§5.2/5.4)
post-challenge 赛后持续开放提交阶段 榜单没关门(§7.5)

附录 S:维护者数字速查卡

全部关键数字与来源缩写(A=arXiv:2411.17213,C=CVPR 2025 openaccess,W=官网 toothfairy2.grand-challenge.org,D=数据页 ditto.ing.unimore.it/toothfairy2,G=GitHub AImageLab-zip/ToothFairy2-Benchmark,M=MIA 2026 DOI 10.1016/j.media.2026.104095):

规模族

数字 口径 来源
530 全口径 CBCT 例数 A/D
480 公开训练例数 A/D
417 Set A(P 前缀) A
63 Set B(F 前缀) A
50 隐藏测试例数 A/D

类别族

数字 口径 来源
42 实类数 A/G
48 dataset.json 标签 ID 数 G
6 NA 占位(19/20/29/30/39/40) G

格式与几何族

数字 口径 来源
mha / HU 格式与强度单位 D
0.3mm 等向体素 D/A
(298,512,512) / F039 最大体积 A
(170,272,345) / P381 最小体积 A
(170,357,371) / P460 中位体积 A

设备与人口学族

数字 口径 来源
NewTom NTVGiMK4,3mA/110kVp 训练设备(Afidea) A
i-CAT,16×22cm,2×20s 测试设备(Radboud) A
58.30%(训练 58.54% / 测试 56.00%) 女性占比 A
2019-2024;年龄 (10,100] 采集时段与年龄区间 A

标注与参赛族

数字 口径 来源
7(5+2) 标注专家数(训练/测试分离) A
每 20 卷 建议模型重训间隔 A
164 / 132 初赛/终赛提交次数 A/M
26 / 29 终榜/上传队数(坑 6) A/M
84 考项数(42 类 × 2 指标) A
1,423 独立下载请求(MIA 统计口径) M

结果族(两套口径,勿互插,坑 8)

数字 口径 来源
Dice 0.9253 / HD95 18.472 / rank 4.6 冠军 Isensee & Kirchhoff(挑战赛口径) A
rank 4.8 / 5.2 亚军 Jiang(Oculins)/ 季军 Wang(Mors) A
70.92 / 74.16 / 70.32 / 76.79 / 71.43 / 85.05 / 73.13 / 79.64 Table 2 八模型 DSC(CVPR 口径) C
17.86 / 14.48 / 20.17 / 5.45 / 17.23 / 5.28 / 5.17 / 2.94 Table 2 八模型 HD95 C

时间线与资产族

事件/资产 日期/位置 来源
Set F scaling 修复 2024-06-13 W(changelog)
数据发布 2024-07-07 W
提交启动 2024-07-08 W
Marrakech 颁奖 2024-10-06 W/A
post-challenge 上线 2024-12-12 W
embargo 6 个月 A
伦理批号 1374/2020/OSS/ESTMO SIRER ID 1275 - NAICBCT-D D
License CC BY-SA D
基准仓库 AImageLab-zip/ToothFairy2-Benchmark G
冠军代码 nnU-Net 仓库 documentation/competitions/Toothfairy2 G
资助 FAR 2024 / FARD-2024;Fit4MedRob #PNC0000007 C

附录 T:条目核验过程存照

供后续维护者复现核验路径(抓取时点 2026-09-26):

  1. 存在性核验(三轮精确搜索):官网语义轮(toothfairy2.grand-challenge.org 命中赛事主页与 FAQ)、论文轮(arXiv:2411.17213 命中挑战赛论文;MIA 索引命中 DOI 10.1016/j.media.2026.104095 / PMID 42102640)、数据页轮(ditto.ing.unimore.it/toothfairy2 命中 CC BY-SA 与伦理批号)——三轮全中,零"查无此物";
  2. 库内查重:仅 fdtooth(609) 为牙科域邻项(2D 全景片),与 CBCT 体数据无撞车;writing/ 目录无同名条目;
  3. 三源互证路径:挑战赛论文(数据/标注/排名/冠军)× CVPR 2025 基准论文(8 模型配置与 Table 2)× 官方渠道(官网 FAQ/changelog + 数据页许可伦理 + GitHub plans 与 dataset.json)——三条线在 530/42/0.3mm/时间线/CC BY-SA 上交叉一致;
  4. 抓取环境坑与解法(复现者参考):WebFetch 不适用 PDF → Bash curl 下载 CVPR openaccess PDF 后本地文本提取;Unimore 侧 MIA 论文 PDF 有反爬拦截 → 改用期刊索引页元数据 + arXiv 预印本文本双路取数;官网 /evaluation/ 与 /phases 路径 404 → 改用 arXiv 论文评估节 + FAQ 页互证;
  5. 口径仲裁序:GitHub 官方代码/文件 > 官网 FAQ/changelog > MIA 期刊版 > arXiv 预印本 > CVPR(架构基准数字)> 二手转述(不采信)——已在附录 J 声明。

附录 U:库内 3D 分割基准的规模-类别-形态矩阵

ToothFairy2 在库内 3D 分割谱系中的位置(对照条目取公开定位,具体数字以各条目为准;“细剖度”= 单类平均样本深度的定性排序):

条目 影像 规模定位 类别数定位 与 ToothFairy2 的差异主轴
ToothFairy2 牙科 CBCT 530 例(480 公开) 42 类 —(本条目)
totalsegmentator 全身 CT 千例级大盘 上百类 覆盖广度 vs 单域纵深;牙位细分非其强项
hecktor(662) 头颈 CT/PET 届次累积 少数结构 肿瘤/危及器官 vs 牙列/颌骨骨架
pddca 头颈 CT 中等 OAR 为主 放疗链上游 vs 牙科专项
verse-spine 脊柱 CT 届次累积 逐椎体 逐结构建档同构,解剖域不同
ctpelvic1k 骨盆 CT 千例级 骨盆结构 规模堆法不同(§9.4)
autoimplant 颅骨 CT 小盘精标 少数类 修复重建任务形态 vs 全结构分割
crossmoda2022 脑 MRI 755 例 2 结构 + 分级 rank 协议同源,量纲相反(2 vs 42)
c3vd / segthor 内窥 / 胸腹 CT 中盘 少-中 模态形态对照(§9.5)
fdtooth(609) 牙科全景片 2D 大盘(2D 便宜) 牙科结构(2D) 指定互链:物理形态两端(§9.1)
dentex 牙科全景片 2D 大盘 牙位(2D) FDI 语义的投影域版本(§9.2)

矩阵读法三条:其一,"牙科 + CBCT + 42 类"的单元格在库内无并列项——这是本条目的填补空位声明(§0);其二,规模与类别数呈此消彼长(totalsegmentator 广而浅、autoimplant 窄而深、ToothFairy2 取"中盘深剖"的中间路线);其三,2D 牙科条目(fdtooth/dentex)与 3D 条目(本条目)是数据形态的两端而非竞争关系(§9.1 详述)。

附录 V:常见误用与纠错示范

引用本条目最高频的八类错误,逐条给纠错句式:

# 误用示范 纠错示范 坑点
1 “ToothFairy2 数据集包含 48 类颌面结构” “42 类颌面结构(dataset.json 48 个标签 ID 含 6 个 NA 占位)” 坑 2
2 “26 支队伍参赛” “26 队进终榜(29 队上传,2025-07-31 统计口径)” 坑 6
3 “冠军方法 DSC 85.05” “官方基准单模型最高为 UMamba DSC 85.05(CVPR Table 2 口径);挑战赛冠军为 nnU-Net ResEnc L(Dice 0.9253,挑战赛口径)” 坑 7/8
4 “ToothFairy challenge 的冠军” “ToothFairy2(2024 届)冠军 Isensee & Kirchhoff”——前作 2022 届是另一场比赛 坑 1
5 “在 ToothFairy2 上训练了上颌窦分割模型(用全部训练集)” “上颌类实验仅用 Set B 63 例(Set A 缺上颌结构)” 坑 3
6 “按图像方向矩阵重采样后评估” “方向元数据不可信(官方 FAQ),重采样前人工核方向” 坑 4
7 “0.3mm 等向,直接重采样到我们的 spacing” “先核对数据版本(2024-06-13 scaling 修复),再决定重采样” 坑 5
8 “ToothFairy2 是 CC BY-NC 禁止商用” “CC BY-SA:商用不禁止,衍生数据同方式共享” —

纠错的通用句式:数字 + 口径 + 来源三元组缺一不可——"42 类(实类口径,dataset.json 48 ID 来源)"是合规引用,裸写"42"或"48"都不是。

附录 W:五分钟电梯稿

给快速引用者的自足摘要(本节可整体转述,数字口径已内嵌):

ToothFairy2 是 MICCAI 2024 卫星数据挑战赛,由摩德纳-雷焦艾米利亚大学 AImageLab 与拉德堡德大学医学中心组织,托管于 grand-challenge.org,考题是牙科 CBCT 体数据的 42 类颌面结构分割(32 颗牙 FDI 牙位 + 颌骨/上颌窦/下颌管/咽部/修复物等;dataset.json 48 个标签 ID 含 6 个 NA 占位)。数据 530 例(训练 480 = Set A 417 例 P 前缀 + Set B 63 例 F 前缀,隐藏测试 50 例),mha 格式、HU 值、0.3mm 等向体素;训练来自意大利 Afidea(NewTom NTVGiMK4),测试来自荷兰 Radboud(i-CAT)——双中心双设备异构。标注由 7 名颌面放射专家完成(5 训练/2 测试分离),半自动迭代流水线(每 20 卷重训 nnU-Net 提建议 + 专家修正 + α-shape 平滑)。评估为 DSC + HD95 双指标、42 类 × 2 指标 = 84 考项取 mean rank;冠军 Isensee & Kirchhoff(nnU-Net ResEnc L,Dice 0.9253 / HD95 18.472mm / mean rank 4.6),官方复现基准表上单模型最高为 UMamba(DSC 85.05,CVPR Table 2 口径)——两套数字分属两套体系,不可互插。License 为 CC BY-SA(商用不禁止),注册制单一分发点下载,post-challenge 自 2024-12-12 起持续开放提交。论文:CVPR 2025 基准论文(架构对比)与 Medical Image Analysis 2026 挑战赛论文(DOI 10.1016/j.media.2026.104095,预印本 arXiv:2411.17213)两篇并存、引用分工不同。它是当时规模最大的 CBCT 多结构分割公开基准;库内最近邻为 fdtooth(609)(牙科全景片 2D,物理形态对照)。

附录 X:时间线三线对照

赛事线、数据资产线、论文线三线并行,交叉引用时先分清问的是哪条线:

日期 赛事线 数据资产线 论文线
2024-06-13 — Set F HU 投影与 0.3mm scaling bug 修复(坑 5) —
2024-07-07 — 挑战赛数据版发布(含 P077/P103/P349 标签修复、F011-F050 元数据修复) —
2024-07-08 grand-challenge 提交通道启动 — —
2024-10-06 MICCAI 2024 马拉喀什现场颁奖 — —
之后 6 个月 结果 embargo — —
2024-11 — — arXiv:2411.17213 预印本
2024-12-12 post-challenge phase 上线,持续开放提交 — —
2025-06 — 官方基准仓库仍在活跃提交(§7) —
2025 — — CVPR 2025 workshop 基准论文(openaccess.thecvf.com)
2026 — — MIA 期刊版(DOI 10.1016/j.media.2026.104095,PMID 42102640)

三线的维护含义:赛事线冻结于 2024(颁奖 + post-challenge 开放是其"活态"延续);数据资产线由 changelog 驱动、以版本修复为事件;论文线三节点(arXiv → CVPR → MIA)构成口径仲裁链(附录 J)。引用时常见的错位是拿论文线日期当数据版本日期——2024-07-07(数据发布)与 2024-11(论文预印本)是两个不同的事件,版本核对只认 changelog(坑 5)。

附录 Y:条目关键判断的依据强度分级

维护者修订前先看本表:每个关键判断标了依据强度——A 级 = 官方原文直接支撑;B 级 = 官方数字的合规转述/算术;C 级 = 本条目的推理或推测(引用时须降级表述)。

关键判断 级别 依据
530/480/417/63/50、42/48-6、0.3mm/mha/HU、双设备参数、人口学 A 挑战赛论文 + 数据页 + dataset.json(附录 D)
7 专家 5+2 分离、每 20 卷重训、α-shape A 挑战赛论文标注节
84 考项 mean rank 机制、DSC=2×IoU/(1+IoU) A 挑战赛论文评估节 + 官方评估代码
冠军数字 0.9253/18.472/4.6 及亚季军 A 挑战赛论文结果节
Table 2 八模型全表与训练配置 A CVPR 2025 论文
CC BY-SA、注册制单点、伦理批号、1,423 下载 A 数据页 + MIA 论文
时间线全链与 embargo A 官网 changelog/FAQ + 论文
42 类的牙位语义分解(附录 C) B FDI 标准知识 + 官方类别体系算术(非牙结构逐项以"等"存不确定)
Set A 上颌缺失的使用守则(坑 3 三条) B 官方 FAQ 事实 + 本条目操作推论
"版权重修复物类难度最大"的部署建议(§5.5/P.4) B 官方难度谱事实 → 本条目工程推论
头部三队读作"并列第一梯队"(§4.5) C 本条目对 0.6 mean rank 差的保守解读
Mamba 系领先的"牙弓亲缘"猜想(P.5) C 本条目推测,明确不主张因果
半自动标注亲和的"非对称结论"(§8.3) C 本条目推理(基于公开流水线事实)
局限可修复性三档划分(§8.9) C 本条目基于官方工程节奏的研判
库内对照条目的全部定性描述(§9/附录 O/U) B 各条目公开形态;数字以各条目为准

修订规则:A 级内容改动必须同步附录 D 证据链;B 级改动须核对算术与官方事实;C 级内容若被后续研究证伪/证实,直接改写并在附录 N 触发点登记。

附录 Z:维护者五分钟复核清单

每季度或触发点(附录 N)到达时的最小复核动作:

  1. 官网可达性(1 分钟):toothfairy2.grand-challenge.org 与 ditto.ing.unimore.it/toothfairy2 可达、无新 changelog;
  2. 仓库活跃度(1 分钟):AImageLab-zip/ToothFairy2-Benchmark 最近提交——plans/dataset.json 若变更,§7.1/附录 D 同步;
  3. 榜单抽查(1 分钟):post-challenge 榜头是否有新面孔——头三易主则更新 §5.1 并声明时间戳;
  4. 论文口径(1 分钟):MIA 期刊版若有勘误/增补,按附录 J 仲裁序复核 §5 数字与附录 G 存照;
  5. 库内互链(1 分钟):fdtooth(609) 及附录 L 各条目是否有重大更新——§9.1 对照细节复核。

复核结果处理:全部无变化 → 条目 lastReviewed 刷新即可;任一变化 → 按附录 Y 分级规则走修订流程,FACTS.md 同步回写。

附录 AA:五类使用者的选型问答

"该不该选 ToothFairy2"按使用目的分五类回答(每类两行:选它的理由 / 别选它的理由):

使用者 选它当什么 别选它当什么
架构研究者 42 类受控对比场:UMamba/Swin-UMamba 强基线可复跑(§7.2),Table 2 直接对表 架构普适性结论的唯一证据源——单数据集结果(§5.4 的克制)
迁移学习者 牙科域大规模预训练/微调起点:官方 plans + 冠军配置降低起步成本(§7.1/7.3) 自家设备的即插即用训练集——单中心域移位(§8.1)必须先做域对齐
临床 AI 工程师 CC BY-SA 可商用的牙科分割训练资源 + HD95 优先的评估范式(§6.2/P.4) 修复物重度场景的完整方案——others 欠代表(§8.2),需外补数据
赛事设计者 机制模板:rank 协议(§4)+ 单一分发点(§6.8)+ post-challenge(§7.5)+ 半自动标注(§3) 稳定性检验的范本——该项恰是它的缺位(§4.5),抄协议时去 crossmoda2022 补
标注研究者 半自动迭代流水线的公开样本:披露完整(§3),可作流水线复刻参考 inter-rater 一致性研究的素材——系数未公开(§6.5),且测试侧仅 2 人

一句话选型法:要牙科 CBCT 的 42 类基准,它是库内唯一且合格;要"全面完美"的 benchmark,它和所有 benchmark 一样不是——选型前把 §8.5 的官方局限清单过一遍。

附录 AB:常见检索问句速查

检索问句 一行答案 详述位置
“牙科 CBCT 公开数据集哪个最大?” ToothFairy2:530 例 42 类,当时最大的 CBCT 多结构公开基准 §0/§1 Q7
“ToothFairy2 有多少类?” 42 实类(dataset.json 48 ID 含 6 NA 占位) §2.2/坑 2
“ToothFairy2 挑战赛冠军是谁?” Isensee & Kirchhoff,nnU-Net ResEnc L,mean rank 4.6 §5.1
“ToothFairy2 上什么模型最好?” 官方基准表单模型最高 UMamba DSC 85.05(CVPR 口径,与冠军口径不同) §5.2/坑 8
“ToothFairy2 能商用吗?” 能,CC BY-SA 无 NC 条款;衍生数据同方式共享 §6.2
“ToothFairy2 在哪下载?” ditto.ing.unimore.it/toothfairy2 注册(单一分发点,无镜像) §6.1
“ToothFairy2 测试集在哪?” 不公开,50 例,仅 grand-challenge 提交评估;post-challenge 持续开放 §6.1/§7.5
“ToothFairy2 和 ToothFairy 什么关系?” 前后两届:2022 届 3 类 → 2024 届 42 类,两套数据互不通用 §1 Q1/附录 J
“训练集为什么缺上颌?” Set A FOV 临床裁剪所致,设计而非错误;上颌类只用 Set B §2.6/坑 3
“ToothFairy2 引用哪篇论文?” 两篇分工:CVPR 2025(架构基准)+ MIA 2026(数据与排名,arXiv:2411.17213) §6.3/坑 7

速查表的使用方式:本表是"检索入口层",每行答案都内置了口径限定(这是本条目的一贯纪律)——把答案抄进论文前,仍按详述位置回正文核对上下文;答案与正文冲突时以正文为准并报修本表。维护时新增常见问句的门槛:至少两起真实检索/引用事故才值得入表,避免速查表膨胀成第二个 FAQ。

附录 AC:官方渠道地址与访问形态总表

全部一手入口、职责边界与访问形态(复核与抓取用):

渠道 URL 职责 访问形态
赛事主页 toothfairy2.grand-challenge.org 赛制/FAQ/排名/提交入口 公开浏览;提交需平台账号
数据集页 ditto.ing.unimore.it/toothfairy2 注册下载/license/伦理/changelog 注册制,无直链无镜像(§6.1)
基准仓库 github.com/AImageLab-zip/ToothFairy2-Benchmark 8 模型训练入口/评估代码/plans/dataset.json 公开 clone
冠军代码 github.com(nnU-Net 官方仓库)/ documentation/competitions/Toothfairy2 冠军配置归档 公开
挑战赛论文(预印本) arxiv.org/abs/2411.17213 数据/标注/排名/冠军全量 公开 PDF/HTML
挑战赛论文(期刊版) doi.org/10.1016/j.media.2026.104095(PMID 42102640) 同上,终裁口径 期刊侧(MIA 2026)
基准论文 CVPR 2025 openaccess(thecvf.com) 8 模型基准/训练配置/limitations 公开 PDF
本库条目 https://www.qianfanghub.com/ai-ready-dataset/toothfairy2/649 中文 AI-Ready 百科(本条目) 公开

职责边界速记:查赛制/上榜 → 官网;下数据 → 数据页;跑基线 → 仓库;引数字 → 两篇论文按坑 7 分工。四个入口的信息不重复、不互替——把"下数据"的请求发到官网、把"查排名"的请求发到数据页,都会白跑一趟。

附录 AD:条目撰写流程复盘(写手代理工作流存照)

本条目按库内五步工作流完成,各步产物与耗时要点存照:

  1. 存在性核验:三轮精确搜索(官网语义/论文/数据页)全中;库内查重仅 fdtooth(609) 邻域、无同名——无撞车,立项;
  2. 三源互证研究:挑战赛论文(arXiv:2411.17213,本地文本提取)× CVPR 2025 基准论文 × 官方渠道(官网 FAQ/changelog + 数据页 + GitHub dataset.json 与 plans)三线交叉;全部硬数字落来源 URL(附录 D 证据链为终稿索引);
  3. FACTS.md:九节事实档案落盘 writing/toothfairy2/FACTS.md,含四组双口径存照与 FAQ 三坑(42/48、26/29、双论文、530/480);
  4. 成稿:分 part 直写 /tmp 后 cat 拼接至 writing/toothfairy2/toothfairy2_Wikipedia.md;按 check_md 规则反向核对(§0-§10 全覆盖、坑 1-8、DAIMS、category_tags 受控词表五枚、frontmatter 限长);
  5. 双闸门自检:check_md.py PASS(0 ERROR / 0 WARN)+ preflight_check.py PASS(0 ERROR / 0 WARN)——本条目交付态。

抓取环境坑实录(复核者参考):WebFetch 不适用 PDF → curl 下载 CVPR PDF 后本地提取;Unimore 侧 MIA PDF 反爬 → 期刊索引元数据 + arXiv 预印本双路取数;官网部分子路径 404 → arXiv 评估节 + FAQ 页互证替代。全程未触碰 scripts/(只运行)、production_tracker.md、其他条目目录、数据库与 publish.sh——铁律零违例。

尾注

本条目由写手代理 A(影像域)于 2026-09-26 完成,事实底稿见 writing/toothfairy2/FACTS.md(九节结构,四组双口径存照 + FAQ 三坑)。全部硬数字可循文中 URL 与附录 D 证据链回溯至三源:挑战赛论文(arXiv:2411.17213 / MIA 2026,DOI 10.1016/j.media.2026.104095,PMID 42102640)、CVPR 2025 基准论文(openaccess.thecvf.com)与官方渠道(toothfairy2.grand-challenge.org、ditto.ing.unimore.it/toothfairy2、AImageLab-zip/ToothFairy2-Benchmark)。隐藏测试封闭导致的"终榜不可第三方复算"为数据集设计属性而非条目缺陷,已在 §6.5/附录 B 如实评级;与 fdtooth(609) 的指定互链按 §9.1 与附录 L 约定执行。验收提示:主会话验收只需重跑双闸门脚本(附录 AD 第 5 步命令)并抽查附录 D 证据链任意三行——条目交付态即为可发布态。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • instance2022 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • trials — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • segthor — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • ctooth — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集