ToothFairy3 (toothfairy3) — AI-Ready Wikipedia

MICCAI 2025 ODIN workshop 的 CBCT 多结构分割挑战赛与 532 例公开数据集:77 类牙位+牙髓+神经血管管标注、runtime 首次纳入主排名、IAC 点击式交互双任务——冠军 U-Mamba2,CC-BY-NC-SA 经 ditto 注册墙发放

来源 牙科 CBCT(NIfTI 体数据):体素间距 0.3mm 各向同性、Hounsfield 强度标度、RPI 朝向(附官方 RPI→LPS 转换脚本)、nnU-Net dataset 格式(raw images + segmentation maps + dataset.json);77 类体素级 3D 标注(FDI 牙位扩展:颌骨/牙列/牙髓/神经血管管/上颌窦/咽/修复体与种植体)发布时间: 2026-09-27最后更新: 2026-09-27 阅读 16
ToothFairy3 (toothfairy3) — AI-Ready Wikipedia

信息速览

数据集名称ToothFairy3 (toothfairy3) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模532 例公开 CBCT(Set A 417 + Set B 63 + Set C 52;论文总口径 582 = 532 公开 + 50 隐藏测试);≈17,024 颗牙齿(STS2024 对比表口径
接入方式牙科 CBCT(NIfTI 体数据):体素间距 0.3mm 各向同性、Hounsfield 强度标度、RPI 朝向(附官方 RPI→LPS 转换脚本)、nnU-Net dataset 格式(raw images + segmentation maps + dataset.json);77 类体素级 3D 标注(FDI 牙位扩展:颌骨/牙列/牙髓/神经血管管/上颌窦/咽/修复体与种植体)
AI 就绪度

INFOBOX — ToothFairy3 一屏速览

维度 内容
本质 挑战赛+数据集+基准三合一:MICCAI 2025(ODIN 2025 workshop)牙科 CBCT 多结构分割挑战赛及其配套公开数据集
组织方 UNIMORE(AImageLab)牵头 + Radboud UMC + KIT + Affidea + 3Shape;Bolelli/Lumetti/Grana 连续三届组织 ToothFairy 系列
时间线 2025-05-09 数据发布 → 2025-08 测试阶段 → 2025-09-27 韩国大田颁奖;数据集论文发表在 MICCAI 2026(隔年错位)
数据 532 例公开 CBCT(NIfTI)= Set A 417(P 前缀/FOV 受限)+ Set B 63(F 前缀/全 FOV)+ Set C 52(S 前缀/新扫描仪);论文总口径 582 = 532 + 50 隐藏
类别 77 类 = ToothFairy2 的 42 类 + 35 新增(32 个牙髓腔 + 左右切牙管 + 舌侧管);Task 1 评估时聚合为 46 子结构
规格 0.3mm 各向同性体素、Hounsfield 标度、RPI 朝向(附官方转换脚本)、nnU-Net dataset 格式
任务 Task 1 自动多结构分割——runtime(推理时间)首次纳入主排名;Task 2 下牙槽神经管(IAC)点击式交互分割(Dice/HD95 的 AUC)
冠军 TAIR-Lab U-Mamba2(KCL + Surrey)双冠:Task 1 Dice 0.84 / HD95 38.17 / 40.58s;Task 2 Dice AUC 0.87
制度亮点 绝对精度冠军 Black_Myth(Dice 0.85)因 90s runtime 被拖到第三——runtime 入排名实际改写了竞赛格局
获取 ditto.ing.unimore.it 注册墙(无直链);Zenodo 无本体(仅提交规范文档 record 15081727)——与 ToothFairy2 的 Zenodo 直链相比是最大退化点
许可 CC-BY-NC-SA(禁止商用、同许可传递);引用义务:必引挑战赛与 [1,2,3] 三件套论文
生态 前作 ToothFairy2(库内 rid 649);后续官方预告 ToothFairy4M 平台;姊妹赛 STSR 2025 同场同冠军队伍
库内互链 toothfairy2(649)、tufts-dental(57)、fdtooth(609)

ToothFairy3 是一个"给牙科 CBCT 分割赛道重新定规矩"的挑战赛+数据集:它不满足于把标注类别从上一代的 42 类堆到 77 类,而是同时改了两件更根本的事——把推理时间(runtime)写进主排名公式(够准不够快就别想夺冠),以及把人机交互引入赛道(Task 2 用鼠标点击引导模型分割下牙槽神经管)。这两项制度设计直接改写了竞赛格局:绝对 Dice 最高的队伍只拿了第三,而"够准+够快"的 U-Mamba2 拿了双冠。对任何关心"临床可用性如何进入评测标准"的人来说,ToothFairy3 是 2025 年医学图像分割领域最值得解剖的样本。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意是 ditto 注册墙,Zenodo 上搜 ToothFairy3 会一无所获(一二代才有 Zenodo 本体),别按惯性扑空。
  2. 关心版本演进:直奔 §4 三代对照表——443 例单结构 → 530 例 42 类 → 532+50 例 77 类双任务,FACTS 级必答题全部在表里。
  3. 做方法研究:直奔 §5 冠军方法 U-Mamba2——Mamba2 状态空间模型进 nnU-Net bottleneck,arXiv:2509.12069 有代码有权重。

§0 导读:这个数据集解决什么问题

牙科 CBCT(锥形束 CT)是口腔临床的"广角相机":采集时间短、辐射剂量低、硬组织分辨率高,种植规划、阻生第三磨牙拔除、正畸方案、囊肿手术、头颈放疗剂量映射全都依赖它。但 CBCT 的 AI 化长期卡在两件事上:一是标注稀缺且粗——3D 体数据的体素级标注极耗时,公开数据集要么只有单一结构(如一代 ToothFairy 只标下牙槽神经管),要么细小结构(牙髓、神经血管管)干脆缺失;二是评测脱离临床现实——传统排行榜只看 Dice 和 HD95,而一台分割工具要在椅旁流程里真正可用,推理速度与精度同样生死攸关:术前规划等得起,椅旁实时引导等不起。

ToothFairy3 的回答分三层。第一层是解剖扩张:在 ToothFairy2 的 42 类(颌骨、牙列、上颌窦、咽、修复体、种植体、下牙槽神经管、FDI 牙位)之上新增 35 个标签——32 颗牙各自的牙髓腔、左右切牙管、舌侧管,凑齐 77 类;这些新增结构对正畸流程(牙根吸收评估、邻牙保护)尤其关键。第二层是制度创新:Task 1 的主排名公式把 runtime 与 Dice、HD95 加权综合,官方明说这是"reflecting the real-world demand for fast and reliable tools in clinical practice"——结果立竿见影,绝对精度第一的队伍因 90 秒的推理时间被综合排名挤到第三。第三层是交互范式:Task 2 把下牙槽神经管分割做成点击式交互任务(SAM 风格的点提示 + AUC 曲线评估),试探"基础模型 + 人手两三次点击"能不能替代昂贵的全自动标注——IAC 定位是种植与拔牙的"防损伤第一优先",让医生点击引导而非全靠模型,本身就是一种临床务实的态度。

§0 读法三则:

  1. 这个条目是"数据集+挑战赛+方法论文"三合一:本体是 532 例带 77 类标注的 CBCT,竞赛部分留下排行榜与冠军方法,副产品是 U-Mamba2 这条可复用的架构路线(SSM 进分割网络)——三者获取方式不同(§6)。
  2. 全文统计数字均以 ditto 官网、grand-challenge 官方页、arXiv/Springer 论文三方互证为准;规模三口径(532/582/102)、Set A/B 第三方转述反转等 12 处坑已在 §10 全部存照。
  3. 检索时注意:数据集论文发表在 MICCAI 2026,而挑战赛办于 MICCAI 2025——两者隔一年,引用时别把年份写混(坑 2)。

§0.5 三个最常见的误解,先排掉

误解一:“ToothFairy3 数据集有 582 例,都能下载。”
582 是论文总口径(532 公开 + 50 隐藏);能下载的永远是 532 例,那 50 例官方原话"永不公开"。写论文说"582 volumes"不加说明会被审稿人当事实错误抓(坑 1)。

误解二:“77 类缩到 46 类,就是去掉了一半类别。”
不是减法是聚合:77 个细类(每颗牙、每个牙髓各一类)在 Task 1 评估时聚合为 46 个解剖子结构(如 32 颗牙并成一组指标)——没有类别被丢弃,只是计分方式变粗。引用榜单分数必须说"46 口径"(坑 6)。

误解三:“冠军 U-Mamba2 是主办方自己的方法。”
不是。TAIR-Lab 来自 KCL + Surrey,与组织方(UNIMORE/Radboud/KIT/Affidea/3Shape)无重叠——主办方成员深度参与数据集论文撰写(Tan 联合一作),但竞赛榜单本身干净。这也是"数据集论文收录冠军方法解析"这种少见合并成篇的原因。

§1 数据集速览:十问十答

Q1:532 例是怎么分组的?
三分集:Set A 417 例(文件名 P 前缀)与 Set B 63 例(F 前缀)都来自 ToothFairy2 已有扫描的标注升级版,两集同一台采集机器,但 FOV 不同——Set A 受限(下颌区域/上颌部分裁切),Set B 是完整颌面视野(全牙列冠根、上颌窦、咽、周围骨结构);Set C 52 例(S 前缀)为全新数据、另一台扫描仪采集,FOV 与 Set A 相近。注意网络上有第三方论文把 Set A/B 写反(称 A 67 例、B 413 例),以 ditto 官网铁口径为准(坑 3)。

Q2:77 类里到底有什么?
FDI 世界牙科联合会牙位记法的扩展:背景、上下颌骨、下牙槽神经管(左右)、上颌窦、咽、牙桥、牙冠、种植体、32 颗牙逐牙标注,再往下钻——32 个牙髓腔(pulp chamber)逐牙标注、左右切牙管(incisive canal)、舌侧管(lingual canal)。77 = 42(TF2 承袭)+ 35(32 牙髓 + 2 切牙管 + 1 舌侧管)自洽。注意 Task 1 评估时这 77 个细类会聚合为 46 个解剖子结构——引用分数时必须说明对齐口径(坑 6)。

Q3:和 ToothFairy2 是什么关系?
直系升级版。532 例公开数据中 Set A(417)+Set B(63)=480 例与 TF2 的公开训练扫描一一重叠(标注升级改进),Set C(52) 全新;再加 50 例隐藏测试集,论文摘要的口径是"extending ToothFairy2 with 102 additional fully annotated scans"。数据规模本身只是温和增长(530→582),真正的增量在类别数(42→77)、任务数(1→2)和评测制度(runtime 入排名)。

Q4:数据规格与格式是什么?
NIfTI 格式的 CBCT 体数据,体素间距 0.3mm 各向同性,强度为 Hounsfield 标度,采用 nnU-Net dataset 格式(raw images + segmentation maps + dataset.json)。朝向为 RPI(非标准约定,与 Maxillo 数据集第一版一致),官方提供 RPI→LPS 的 Python 转换脚本——自行用通用 DICOM 工具读会方向错位(坑 12)。Task 1 扫描尺寸范围 (170, 272, 345) 到 (298, 512, 512),显存压力是方法设计的核心约束。

Q5:两个任务分别考什么?
Task 1"Fast Multi-Structure Segmentation":全自动多结构分割,46 个子结构一起出,Dice + HD95 + runtime 加权综合排名。Task 2"Interactive Segmentation of the Inferior Alveolar Canal":点击式交互分割——用户在图像上点击提示,模型随点击逐步修正左右 IAC 的分割,评估 Dice AUC(随点击数的曲线下面积)、final Dice、HD95 AUC、final HD95 与 runtime。Task 2 明确鼓励 SAM 式 prompt-based 基础模型方向。

Q6:"runtime 入排名"为什么重要?
它是本届最大的制度创新,而且实际改写了结果:Black_Myth 队 Task 1 的绝对精度全场最优(Dice 0.85、HD95 33.23),但推理耗时 90.04 秒,综合 rank 被拖到第三;冠军 TAIR-Lab Dice 0.84 / HD95 38.17 略逊,却只用 40.58 秒,综合 rank 3.1 夺冠。亚军队更极端——17.46 秒(最快)换 0.77 的 Dice。一张排行榜同时呈现了"精度—速度"权衡的三种解法,这正是设计者想看到的。

Q7:冠军是谁、用了什么方法?
TAIR-Lab(King’s College London + University of Surrey 联队,非组织方)的 U-Mamba2:把 Mamba2 状态空间模型插入 U-Net bottleneck 的 7-stage 编解码器,nnU-Net v2.6.2 流水线 + DAE 自监督预训练;Task 2 再加 SAM 风格 point encoder 与 cross-attention 融合点击提示。成绩:Task 1 mean Dice 0.84 / HD95 38.17 / 40.58s;Task 2 Dice AUC 0.87。代码与预训练权重公开(github.com/zhiqin1998/UMamba2),论文 arXiv:2509.12069 + Springer LNCS 10.1007/978-3-032-20711-1_12。

Q8:我现在能拿到什么?
公开 532 例(77 类标注齐全)经 ditto.ing.unimore.it 注册账号后下载,license 为 CC-BY-NC-SA;50 例隐藏测试集永不公开(官方原话"will not be publicly released and will remain private even after the end of the challenge"),服务器端评测防泄漏。Zenodo 上没有数据集本体——只有一份 Structured Submission Document(record 15081727),按一二代惯性在 Zenodo 搜本体必扑空(坑 4)。

Q9:532、582、102 三个数字什么关系?
三种口径并存且可调和:532 = 公开可下载的带标注例数(官网/挑战赛口径);582 = 论文摘要总口径(532 公开 + 50 隐藏);102 = 相对 TF2 的净增例数(52 例 Set C 新数据 + 50 例隐藏测试,TF2 的 480 公开例不重复计入)。引用时必须注明口径,混用会被审稿人抓(坑 1)。

Q10:这个数据集适合谁用?
五类人:做牙科/颌面分割算法的(77 类细粒度标注是当前公开最大);做种植/正畸临床 AI 的(IAC+牙髓+切牙管正是临床防损伤结构);研究"速度—精度权衡"与评测方法学的(runtime 入排名是现成案例);做交互式分割/基础模型的(Task 2 设定 + U-Mamba2 的 point encoder 参考实现);以及需要大量 CBCT 做预训练的(nnU-Net 格式即插即用)。不适合:想商用落地的(CC-BY-NC-SA 排除商业用途)、想拿全 FOV 大样本的(全 FOV 只有 Set B 63 例)。

§1.5 一分钟决策树:你要不要用 ToothFairy3

从顶往下走,第一个命中的分支就是你的答案:

  1. 你的用途是商业产品? → 停。CC-BY-NC-SA 禁止商用;去谈授权或改用其他数据(库内 fdtooth/tufts-dental 许可各异,先查各自条目)。
  2. 你需要完整颌面视野(上颌+下颌+上颌窦+咽都在画面里)? → 只有 Set B 63 例满足;样本量不足你的需求就别硬用——考虑 TF3 作预训练 + 自采数据微调的组合。
  3. 你要做细小结构(牙髓/切牙管/舌侧管/牙根管系统)? → 这是 TF3 相对所有前代的独占价值(35 个新类);直接用,注意两阶段或后处理策略(§5.5、附录 M)。
  4. 你要做跨设备泛化研究? → Set C 52 例是另一台扫描仪的天然测试集;用 A/B 训 + C 测,或三方轮换。
  5. 你要参加或对标官方排名? → 本地自切只能自娱,官方分必须走 grand-challenge Docker 提交;先跑 baseline template(Resources 区公开)。
  6. 你只是要大量 CBCT 做自监督预训练? → 532 例 Hounsfield 标准化的 NIfTI 直接可用;参考 U-Mamba2 的 DAE 配方(§5.3),或联合 SD-Tooth 扩池。
  7. 你在写综述/方法论论文(不碰数据)? → 不用下载也能引用:榜单数字、制度分析、12 坑清单都在本条目内,引用时注明口径(坑 1/6/11)。
  8. 你要做 2D 任务(切片分类、全景片)? → 体数据可切 2D 但标注按 3D 设计;切 2D 前先想清楚"切片级标签怎么从体素掩码派生"——这不是现成的 2D 数据集。

走到这里没有命中的,默认答案:用,但按 §6.1 五步走,先读附录 J 的 30 分钟上手清单。

§2 数据构成深度解剖

2.1 三分集:P / F / S 前缀的秘密

ToothFairy3 公开数据集的文件名前缀(P、F、S)不是装饰,而是三分集身份的速记——拿到数据后第一眼就能判断每例的出身、视野与可信度:

维度 Set A(417 例) Set B(63 例) Set C(52 例)
文件名前缀 P F S
与 ToothFairy2 关系 重叠(标注升级版) 重叠(标注升级版) 全新(TF2 未发布过)
FOV 受限(下颌区域/上颌部分裁切) 最大(完整颌面解剖) 受限(与 Set A 相近)
采集机器 机器 1 机器 1(与 A 同) 另一台扫描仪
完整牙列冠根 部分(上颌常裁切) 全部(含上颌窦/咽/周围骨) 部分
对模型的意义 主力训练量 全结构应用与评估金标准 域移位(domain shift)试金石

三个集的设计意图各不相同:Set A 提供训练主力(417 例的量),Set B 提供"解剖学完整性"(只有 63 例但视野无死角——后续衍生研究如 X-Splat 单全景片生成 CBCT 只敢用 Set B,63 例里还只有 60 例合格),Set C 则悄悄埋了一道跨扫描仪泛化的考题——官方没有明说要拿 Set C 考什么,但"另一台扫描仪 + TF2 从未见过的数据"这个组合本身就构成了对域移位鲁棒性的天然检验。

坑位提醒:中文第三方文献(浙大学报 MC-UKAN 论文)曾把三分集写成"Set A(67例)具备完整的上下牙列标注, Set B(413例)和Set C(52例)"——数量与 FOV 描述与官方双重相反。凡见 A 67/B 413 的说法均为转述错误,铁口径是 A 417 / B 63 / C 52(坑 3)。

2.2 77 类完整清单

77 类以 FDI(Fédération Dentaire Internationale,世界牙科联合会)牙位记法为骨架扩展。FDI 记法用两位数字定位每颗牙:第一位象限(1 右上、2 左上、3 左下、4 右下,恒牙列),第二位序号(1 中切牙到 8 第三磨牙)。数据集在"每颗牙一个类"之上继续下钻:

分组 类数 内容
背景 1 非解剖区域
颌骨 2 上颌骨(maxilla)、下颌骨(mandible)
神经血管管 3+2+1=6 下牙槽神经管(inferior alveolar canal,左右)、切牙管(incisive canal,左右,TF3 新增)、舌侧管(lingual canal,TF3 新增)
含气/空腔结构 2 上颌窦(maxillary sinuses,左右)、咽(pharynx)
修复体与种植体 3 牙桥(bridges)、牙冠(crowns)、种植体(implants)
牙齿 32 FDI 恒牙列全牙位(含第三磨牙/智齿)逐牙单列
牙髓腔 32 每颗牙的 pulp chamber 逐牙单列(TF3 新增)
合计 77+1(背景口径差异) 官方口径"77 classes";42+35=77 自洽(42 为 TF2 承袭部分,35 为 TF3 新增)

两个口径细节须钉死:

  1. 77 vs 46:77 是数据集标注的细类总数(每颗牙、每个牙髓各占一类);Task 1 挑战赛评估时聚合为 46 个解剖子结构(例如 32 颗牙聚合、32 个牙髓聚合后按解剖组计算 Dice)。引用任何参赛分数都必须先问一句"对齐到哪个口径"——LaBella 论文与 emergentmind 转述均确认"77 substructure classes, later consolidated into 46 substructures"(坑 6)。
  2. 术语漂移:新增的舌侧结构,ditto 官网与 X-Splat 论文称 lingual canal(舌侧管),grand-challenge 背景页却写 lingual foramen(舌侧孔)——解剖上前者是管、后者是管的开孔,同一区域两种表述并存,检索与写作时都须双词并查(坑 10)。同理,官方在 P 集更新公告里提"incisive and lingual nerve",而数据集本体类名是 canal——nerve/canal 混称是牙科文献常态。

2.3 物理规格:0.3mm、Hounsfield、RPI

  • 体素间距 0.3mm 各向同性:牙科 CBCT 的高分辨率标配,牙釉质-牙本质界面、细小神经管壁都依赖这个精度。也正因为各向同性,3D 卷积/SSM 的 patch 策略比各向异性 CT 简单——U-Mamba2 等方法都能直接用立方 patch。
  • Hounsfield 强度标度:与临床 CT 同标度,跨设备迁移时强度语义一致;第三方使用案例(MC-UKAN)采用 CT 截断 [-1000, 3500] 窗。
  • NIfTI + nnU-Net dataset 格式:原始图像 + 分割图 + dataset.json 三件套,下载后可直接喂 nnU-Net v2 流水线——这是对下游研究者最友好的设计,冠军方法(U-Mamba2)与季军方法(Black_Myth)都直接跑在 nnU-Net 上。
  • RPI 朝向:非标准约定(与 Maxillo 数据集第一版一致)。RPI = Right-Posterior-Inferior 轴序,与医学影像惯用的 LPS(Left-Posterior-Superior)不同——直接用 SimpleITK/ nibabel 默认读取会把左右/前后轴搞反。官方提供 RPI→LPS 的 Python 转换脚本(参数:数据集路径 + 输出路径)。挑战赛测试数据与训练数据同朝向,参赛者无需转换;但把数据拿去做自己的下游应用就必须先转(坑 12)。
  • 尺寸范围:Task 1 扫描 (170, 272, 345) 到 (298, 512, 512)——最大体约 7800 万体素,2 亿级参数模型全尺寸推理的显存压力是方法设计的隐形考题(这正是 Black_Myth 等方法用滑窗+集成、TAIR-Lab 用高效 SSM 的现实背景)。

2.4 规模三口径与牙齿计数

口径 数值 出处 何时用
532 公开带标注例数 ditto 官网 / grand-challenge / 挑战赛材料 说"公开数据集"时
582 论文总口径(532+50 隐藏) Lumetti et al. MICCAI 2026 摘要 转述论文、说"数据集总量"时
102 相对 TF2 净增(52 Set C + 50 隐藏) 同上(“102 additional fully annotated scans”) 说"版本增量"时
≈17,024 牙齿总数 STS2024 对比表(Bolelli et al., 2025 口径) 说"标注对象规模"时
>40,000 标注对象总数(over 40k annotated objects) Lumetti et al. 摘要 说"全结构标注对象"时

辅助口径(同 STS2024 表):年龄范围 16-100 岁、约 80,000 层切片。引用纪律:任何数字必须带口径出处——"532 例"与"582 例"都对,但混着说而不注口径就是事实错误(坑 1)。

2.5 标注质量与升级承诺

Set A/B 对 TF2 的 480 例不是原样复用而是标注升级(官方口径 “Improved annotations from ToothFairy2”):42 类原有标注经复核,再补画 35 个新类别的体素标签。升级的具体QC流程(复核人数、仲裁规则)官网未详述——这是本条目少数拿不到一手细节的点(§9 待核项)。2025-06-30 官方还发布过一次数据更新:P 集补充 incisive and lingual nerve 标注——说明标注是滚动迭代而非一次冻结,下载时间不同可能拿到不同版本的标注密度,复现实验时应记录下载日期。

2.6 隐藏测试集:50 例的防泄漏制度

50 例 held-out 测试集永不公开(“will not be publicly released and will remain private even after the end of the challenge”)。参赛者把模型打包成 Docker 镜像提交到 grand-challenge 平台,服务器端跑推理并回传分数。这套制度沿用 TF2 惯例,目的是杜绝"在测试集上调模型"的公开基准通病,同时让排行榜成为一个长期在线基准——挑战赛结束多年后仍可提交。代价是:第三方无法本地复现官方测试集分数,所有论文级对比只能在本地自行切分(U-Mamba2 用 121 例训 Task 1、51 例训 Task 2;LaBella 用 63 例 5-fold——各队自选子集,本地数字互不可比,坑 11 的根源即在此)。

2.7 数据加载代码骨架(Python)

以下是标准读取路径的骨架(伪代码级,字段名以实际数据为准):

# 1) 读取与朝向确认(nibabel/SimpleITK 任选其一)
import nibabel as nib
img = nib.load("imagesTr/P_001_0.nii.gz")   # P/F/S 前缀决定三分集归属
arr = img.get_fdata()                        # Hounsfield 标度的体素阵列
print(img.shape, img.header.get_zooms())     # 例如 (298, 512, 512),0.3mm 各向同性
# 注意:此时为 RPI 轴序;下游应用先跑官方 RPI→LPS 脚本(参数=数据集路径+输出路径)

# 2) 标签检查(nnU-Net 格式)
import json
meta = json.load(open("dataset.json"))       # 模态、标签表、划分信息都在这
labels = meta["labels"]                      # 77 类的 ID→名称映射(以文件为最高依据)
# 官网未列全表:类 ID 请以 dataset.json 为准(附录 AA 待核项 1)

# 3) 三分集分组(防泄漏第一步)
from pathlib import Path
cases = {p.stem.split("_")[0][0]: [] for p in Path("imagesTr").glob("*.nii.gz")}
# 按前缀首字母分桶:P→Set A,F→Set B,S→Set C

# 4) 与 TF2 数据混用前:先做同 ID 对齐检查(见 §2.8)

三个工程注意:①Hounsfield 标度意味着不需要窗宽窗位预处理即可喂 nnU-Net(其 CTNormalization 按HU 处理);②NIfTI 压缩(.nii.gz)解压是 I/O 热点,大批量训练建议先转本地缓存;③切 2D 派生集时按"病例"而非"切片"划分(同一病例的切片进同一侧,否则泄漏)。

2.8 与 ToothFairy2 数据混用:去重与泄漏防护

TF3 的 Set A/B 是 TF2 480 例的升级版——同源同例不同标注版本。混用两侧数据时(例如"TF2 上预训练、TF3 上微调")必须显式管理重叠:

  1. 识别重叠:TF2 与 TF3 公开数据的病例 ID/文件名对应关系需逐例核对(文件命名规则两代不同则需按几何指纹对齐——体素尺寸 + 形状 + 原点)。
  2. 切分优先级:同一病例的两个标注版本只能出现在同一侧(都进训练或都进验证);跨数据集随机划分必然制造训练-验证同例泄漏。
  3. 标注版本选择:重叠病例一律用 TF3 版(标注升级 + 35 新类);TF2 版仅在需要 TF2 的 42 类口径对齐时使用。
  4. 评测隔离:复现官方协议的近似——自切验证集从 Set A/B 抽,把 Set C 整体留作"跨设备外部验证",模拟官方 hidden test 的角色。
  5. 声明义务:论文里写清"TF2 与 TF3 的 480 例重叠已按病例级对齐处理",否则审稿人按 532+530 合并口径估算样本量时会被误导。

2.9 77 类的空间关系速览(解剖定位)

给不熟悉牙颌解剖的读者一张"结构在哪"的脑图(按部位分组):

  • 下颌区:下颌骨(壳)→ 内走行下牙槽神经管(左右各一,从下颌支到颏孔);下牙列 16 颗(FDI 31-48 象限的 3、4)逐颗带各自的牙髓腔;下颌前部舌侧骨面有舌侧管(TF3 新增,细小)。
  • 上颌区:上颌骨 → 内含上颌窦(左右各一,牙根常突入窦底——种植学经典难题区);前部中线旁有左右切牙管(TF3 新增,鼻腭管走行区);上牙列 16 颗逐颗带牙髓腔。
  • 跨区结构:咽(气道,位于后方);牙冠/牙桥/种植体(修复体可出现在任一牙位,金属伪影高发)。
  • 嵌套关系(标注的关键难点):牙髓腔嵌在牙根内、牙根嵌在颌骨内、神经管壁贴着牙根尖——多层嵌套意味着边界误差会"传导"(牙根分割错 → 髓腔必错),这也是 32+32 双层逐牙标注比"42 类平面标注"难得多的根本原因。

这一节只给定位直觉;逐类定义以官方材料与数据包 dataset.json 为准。

§3 挑战赛设计:双任务、新指标、新制度

3.1 Task 1:Fast Multi-Structure Segmentation(快,写进考题)

  • 任务定义:对 CBCT 体数据全自动输出多结构分割(77 细类→46 评估子结构),覆盖颌骨、牙列、牙髓、神经血管管、上颌窦、咽、修复体与种植体。
  • 评估公式:Dice + HD95 + runtime 三指标加权综合 rank——runtime 与精度同权入主排名,这是 MICCAI 挑战赛序列里少见的制度设计。官方解释:“reflecting the real-world demand for fast and reliable tools in clinical practice”。
  • 为什么是现在:TF2 时代的冠军方案推理动辄分钟级,临床椅旁场景(种植实时引导、拔牙术中核对)根本用不上;把 runtime 写进公式等于官方宣告"精度军备竞赛到此为止,效率也是科学问题"。
  • 结果验证了制度(详见 §3.4):三种"精度-速度"策略同台——精度优先(Black_Myth,0.85 但 90s)、速度优先(亚军,17.46s 但 0.77)、双达标(TAIR-Lab,0.84 且 40.58s)——最终双达标者夺冠。

3.2 Task 2:Interactive Segmentation of the IAC(点击式交互)

  • 任务定义:下牙槽神经管(inferior alveolar canal,IAC——下颌骨内包裹神经/动脉/静脉的骨性管道)的点击式交互分割:用户在图像上点击提示(正/负点),模型随点击逐步修正分割结果。
  • 选 IAC 的临床理由(官方 Background):IAC 精确定位对种植体植入、阻生第三磨牙拔除、囊肿手术是"防损伤第一优先"——损伤 IAC 可致下唇永久麻木。它又是一代 ToothFairy 的原点结构,挑战赛用交互任务把"最难也最重要"的单结构单独拎出来加练。
  • 评估:Dice AUC(随点击数的曲线下面积,衡量"点几下能用")+ final Dice + HD95 AUC + final HD95 + runtime,左右 IAC 分别计分。AUC 的引入使"模型对点击的响应效率"本身成为指标——不只是"点够了能不能准",而是"每多点一下能提升多少"。
  • 方法学指向:官方明示鼓励 SAM 式 prompt-based 基础模型路线——用大规模预训练的交互先验来做医学交互分割。冠军 U-Mamba2 即以 SAM 风格 point encoder + cross-attention 应答。

3.3 时间线全记录

日期 事件
2025-05-09 第一版数据集正式发布(ditto + grand-challenge)
2025-06-30 数据集更新:P 集(Set A)补充 incisive and lingual nerve 标注
2025-07-01 全部赛道调试阶段(debug phase)开启
2025-08-08 测试阶段(test phase)开启(原定 8-20 截止)
2025-08-20 截止延期公告:延至 8-24,“No additional extensions”(不再延)
2025-09-25 公告:9-27 于 ODIN workshop @ MICCAI 2025(韩国大田)颁奖
2025-09-27 ODIN 2025 workshop 现场公布结果(同场:STSR 2025 姊妹赛)
2026-05-18 Springer LNCS 978-3-032-20711-1 proceedings 出版(ODIN 2025 + ToothFairy/STSR 挑战赛合集)
MICCAI 2026 数据集+冠军方法合并论文发表(Lumetti et al.,“The dataset paper has been published at MICCAI2026”)

时间线坑位:挑战赛年份(2025)与数据集论文年份(2026)隔一年——写引用时最容易错的就是这个(坑 2)。另一个结构性坑:官方 Zenodo 上的 Structured Submission Document(record 15081727)把交互任务编为 Task 2/Task 3,而网页与最终口径是 Task 1/Task 2——SSD 成文早于任务合并,编号错位一位(坑 5)。

3.4 最终榜单与"制度改变结果"

Task 1(自动多结构分割)前三:

名次 队伍 综合 rank runtime Dice HD95
🥇 TAIR-Lab 3.1 40.58s 0.84 38.17
🥈 sjtu_eiee_2-426lab 3.7 17.46s 0.77 94.77
🥉 Black_Myth 3.8 90.04s 0.85 33.23

Task 2(IAC 交互分割)前三:

名次 队伍 综合 rank 关键分项
🥇 TAIR_Lab 1.66 Dice AUC 0.87 / final Dice 0.86 / HD95 final 2.04-2.26
🥈 BlackMyth 2.11 —
🥉 changkkk 3.44 —

榜单 8 队(Task 1)/ 6 队(Task 2)见于官方 challenge-winners 页。读法三则:

  1. Black_Myth 的悲剧性第三名是 runtime 制度最好的广告:Dice 0.85 与 HD95 33.23 双双全场最优,但 90.04s 的推理时间让综合 rank 落到 3.8——若沿用 TF2 的纯精度排名,冠军易主。一个评测制度的引入就能翻转冠军,这本身就是可写进评测方法学教科书的现象。
  2. 亚军的极端速度路线(17.46s,Dice 0.77)展示了另一头:宁可精度掉 7 个点也要三倍快。三种策略在一张榜上排成"精度-速度"权衡的完整帕累托前沿。
  3. TAIR-Lab 双冠(Task 1 + Task 2 同队)证明其架构在自动与交互两个范式下都有效——这在挑战赛史上不多见,也是 U-Mamba2 论文值得精读的原因(§5)。

3.5 临床动机:从防损伤到放疗防坏死

官方 Background 的临床链条:CBCT 在牙科/头颈/颌面外科快速扩张 → 分割工具是数字化流程的地基 → IAC 是种植/拔牙的防损伤第一优先 → 新增 77 类结构"especially relevant for orthodontic procedures"(牙髓与切牙管等对正畸中的牙根保护、邻牙监测关键)。参赛侧的补充动机(DLaBella29 论文):头颈放疗规划——牙位与神经级分割支撑剂量映射与牙科风险评估,下颌骨是**放射性骨坏死(osteoradionecrosis)**的高发且剂量强相关区域,放疗前拔牙决策依赖精确分割。换言之,这个数据集的上游需求方横跨种植外科、正畸、放疗三个科室——这也是它比一般"牙齿分割"数据集类别带宽宽得多的原因。

3.6 评测制度对照:TF2 → TF3 变了什么

制度维度 ToothFairy2(2024) ToothFairy3(2025) 变化含义
排名指标 Dice / HD95 Dice / HD95 + runtime 效率从"论文里的讨论"升格为"计分项"
任务数 单任务(自动分割) 双任务(自动 + 交互) "全自动"不再是唯一范式
交互评估 无 Dice/HD95 的 AUC-over-clicks 人机协作效率可量化、可比较
提交协议 Docker + 服务器评测 同左(沿用) 防泄漏制度稳定复用
参赛规模 26 队 榜单 8 队(T1)/ 6 队(T2) 参赛量下降——双任务 + runtime 门槛提高的一种解释(另一解释:年份周期波动,不作强因果)
数据增长 443→530 例(+87) 530→582 例(+52 公开口径) 规模增长收敛,重心转向类别深度

对照表的读法:TF3 不是"更大的 TF2",而是换了考卷的 TF2——数据增长只贡献了 +10%,但类别(+83%)、任务(×2)、指标(+1 主排名成分)三条制度轴同时动。这解释了为什么参赛队数下降而方法论文密度不降:难度重新洗牌后,留下的都是针对性备赛的队伍。

§4 三代演进:ToothFairy → ToothFairy2 → ToothFairy3(FACTS 必答题)

4.1 三代对照大表

维度 ToothFairy(2023) ToothFairy2(2024) ToothFairy3(2025)
会议 MICCAI 2023 MICCAI 2024 MICCAI 2025(ODIN workshop)
任务 IAC/IAN 单一结构分割 多结构分割 多结构 + 交互式双任务
公开数据 443 例(STS2024 表口径) 530 例 = 480 公开 + 50 隐藏 532 公开 + 50 隐藏 = 582 总口径
类别 IAC(Canal 相关约 5 类口径) 42 类 77 类(Task 1 评估聚合 46 子结构)
新增结构 — 颌骨/牙/上颌骨/咽 32 牙髓 + 左右切牙管 + 舌侧管(35 标签)
评估 Dice/HD95 Dice/HD95 Dice/HD95 + runtime 主排名 + Task 2 AUC
交互任务 无 无 IAC 点击式交互(首创)
托管 Zenodo 7835324 Zenodo 10990960/10990959 ditto 注册墙(Zenodo 无本体)
License (Zenodo 口径) (Zenodo 口径) CC-BY-NC-SA(官方 Dataset 页明示)
数据集论文 IEEE TMI 2024(10.1109/TMI.2024.3523096) CVPR 2025(pp.5238-5248,10.1109/CVPR52734.2025.00494)+ MedIA 2026(10.1016/j.media.2026.104095) MICCAI 2026(Lumetti et al.)
参赛规模 — 26 国际队伍 榜单 8 队(Task 1)/ 6 队(Task 2)

4.2 演进逻辑三段论

官方 Background 留下的叙事线索可以把三代串成一个连贯故事:

  1. 一代(2023):盯住一根管。IAC/IAN 是外科防损伤的"贵族结构"(noble structure)——443 例、单结构、Dice/HD95,解决"3D 标注稀缺"的冷启动(Zenodo 摘要原话:2D 标注是日常实践标准但信息不全,3D 标注因耗时稀缺)。
  2. 二代(2024):铺开整个颌面。从单结构到 42 类跨学科多结构(外科 + 麻醉 + 临床日常),480 例公开训练 + 50 例服务器端防泄漏,参赛 26 队——把"一个器官"做成"一个解剖区"。MedIA 2026 后续报告同时坦白了残余难题:上颌窦/修复体/细小结构仍是弱项(类不平衡 + 金属伪影)。
  3. 三代(2025):向内钻 + 向外拧。双轮驱动:①解剖学纵深——从"每颗牙一类"下钻到"每个牙髓腔一类",加左右切牙管与舌侧管(正畸导向);②工程现实化——runtime 入主排名 + IAC 点击交互(临床可用性导向)。数据规模只增 50 例,但考题从"分得准吗"变成"分得准、快、且能与人协作吗"。

4.3 TF2→TF3 数据增量明细

  • 承袭部分:Set A(417,P 前缀)+ Set B(63,F 前缀)= 480 例,与 TF2 公开训练扫描一一对应,标注升级(“Improved annotations from ToothFairy2”)+ 新增 35 类补画。
  • 全新部分:Set C(52,S 前缀,新扫描仪)+ 隐藏测试 50 例 = 102 例——论文口径"extending ToothFairy2 with 102 additional fully annotated scans"的出处即此。
  • 自洽校验:TF2 公开 480 + 新增 52 = TF3 公开 532 ✓;TF3 公开 532 + 隐藏 50 = 论文总口径 582 ✓;480 + 102 = 582 ✓。三条路径闭环,这是复核任何转述数字时的黄金三查。

4.4 前作事实卡(供互链与核对)

ToothFairy2(库内 rid 649):530 volumes(480+50)、42 类(maxilla/mandible/crowns/bridges/implants/IAC/maxillary sinuses/pharynx/FDI 32 牙位)、26 队参赛;Zenodo 10990960/10990959 直链下载;论文 CVPR 2025(Bolelli et al.)+ MedIA 2026 版本(10.1016/j.media.2026.104095,报告结论:颌骨等大结构最好,上颌窦/修复体/细小结构仍难——类不平衡 + 金属伪影;FDI 编号判定比牙齿勾画更难)。TF3 的 Set A/B 即 TF2 480 例的升级版。

ToothFairy 一代:MICCAI 2023;IAC = 下颌内含神经/动脉/静脉的骨性管道;Zenodo 7835324(2023-04);数据集论文 IEEE TMI 2024(10.1109/TMI.2024.3523096);STS2024 对比表给 443 例口径。

4.5 与其他牙科数据集的坐标系

STS2024 论文(ScienceDirect S1361841526000551)的对比表给出了牙科 CBCT 分割数据集景观:CTooth+(22 例,2022)→ Mandibular Canal CBCT(347 例,2022)→ STS2023(584 例)→ ToothFairy(443)→ ToothFairy2(530)→ ToothFairy3(532,≈17,024 teeth)。ToothFairy 系列是牙科 CBCT 公开细粒度标注规模的主脉;论单一维度(如牙数)STS2023 更大,论每例标注密度与结构谱系 TF3 领先。库内可比条目:tufts-dental(rid 57,牙科 CBCT 前辈)、fdtooth(rid 609);3DTeethLand 未入库(正文提及不作互链)。

4.6 引用与年份使用指南

你在说的事 正确写法 错误写法
挑战赛本身 ToothFairy3 challenge @ MICCAI 2025(ODIN 2025 workshop) “MICCAI 2026 挑战赛”
数据集论文 Lumetti et al., MICCAI 2026 “Lumetti et al., 2025”
数据规模(公开) 532 volumes with 77 classes “582 volumes”(不加隐藏说明)
数据规模(论文口径) 582 volumes(532 public + 50 held-out) “582 public volumes”
评估口径 46 substructures(77 annotated classes) “77 classes Dice”
冠军名次 U-Mamba2, 1st place(Springer 版) arXiv v1 的 “top 3 place”(坑 8)
Black_Myth 代码 toothfairy3_blcakmyth toothfairy3_blackmyth(坑 9)
TF2 对照论文 Bolelli et al., CVPR 2025(+MedIA 2026 扩展版) 混引两版不注明

一句话纪律:比赛年份 2025、论文年份 2026、三个规模数字各带口径、评估分数必注 46 口径——这四条守住,TF3 相关写作的 90% 事实错误可以避免。

§5 冠军方法:U-Mamba2 深度拆解

5.1 队伍与身份

TAIR-Lab:King’s College London(Zhi Qin Tan、Owen Addison、Yunpeng Li,口腔转化科学中心方向)+ University of Surrey(Xiatian Zhu,TAIR 研究组)联队。冠军非组织方——组织方(UNIMORE/Radboud/KIT)未下场参赛,榜单干净。核心人物 Tan 同为 TF3 数据集论文的联合一作(KCL 侧),即"参赛者深度参与数据集论文撰写"的少见组合——数据集论文收录冠军方法全解析,正是合并成篇的原因。

5.2 架构:Mamba2 进 U-Net bottleneck

  • 底座:U-Net 形 7-stage 编解码器(UMambaBot2 变体——nnU-Net 生态的 UMamba 系列的二代变体)。
  • 核心创新:在 bottleneck 换装 Mamba2 状态空间模型(SSD 框架,State Space Duality)。动机直指 CBCT 的两个物理现实:①体数据大(最大 298×512×512),Transformer 的自注意力在 3D bottleneck 上是显存与速度的双重灾难;②Mamba2 的线性复杂度序列建模既能吞长程上下文,又比注意力快——这正是"快"能写进成绩单的架构根源。换句话说,U-Mamba2 的夺冠不是巧合,而是 Task 1 制度(runtime 入排名)筛选出了"为速度而生"的架构。
  • Task 2 增配:SAM 风格 point encoder(把用户点击编码为提示向量)+ cross-attention(提示向量与图像特征融合)。同一主干、加一个交互头——双冠共用底座的模块化设计。

5.3 训练配方(可直接照抄的细节)

环节 配置
流水线 nnU-Net v2.6.2
预处理 CTNormalization(Hounsfield 标度原生适配)
自监督预训练 DAE(Disruptive Autoencoder)200 epochs:16³ patch 内做 mask(30% mask ratio),损失含对比项(mm_con=0.03)
预训练数据 ToothFairy3(ditto 下载)+ SD-Tooth(Zenodo)联合
监督微调 1500 epochs,有效 batch size 2
推理 TTA:前后向翻转 + 左右镜像
数据划分 Task 1 用 121 labeled scans 训练;Task 2 用 51 labeled(含点击标注)——自行切分,与官方 hidden test 隔离

三个可迁移的工程信号:①DAE 自监督在医学分割的预训练性价比再次得到验证(TF3 的 532 例全带标注,预训练更多是架构预热而非数据扩充);②nnU-Net 底座 + 换 bottleneck 是低风险高回报的参赛范式——Black_Myth 同样基于 nnU-Net;③TTA 只开镜像组(不开旋转)是在精度与 runtime 之间主动做减法。

5.4 成绩与论文

  • Task 1:mean Dice 0.84 / HD95 38.17mm / 40.58s——综合 rank 3.1 夺冠。
  • Task 2:mean Dice 0.87 / HD95 2.15mm——Dice AUC 0.87 夺冠(HD95 2mm 级意味着神经管边界误差小于两毫米,临床可用区间)。
  • 论文:arXiv:2509.12069(2025-08 v1);正式版 Springer LNCS,doi 10.1007/978-3-032-20711-1_12。
  • 代码与权重:github.com/zhiqin1998/UMamba2 公开,预训练权重走 Google Drive——是三支名次队伍中唯一同期放出冠军权重的。
  • 预印本措辞漂移存照:arXiv v1 写"top 3 place"(写作时榜单未定),终版与官方榜单为 first place;v1 里 runtime 还是括号 TBC 未填。引用时以 Springer 正式版与官方 winners 页为准(坑 8)。

5.5 名次方法对照:三种解题风格

队伍 名次(Task 1 / Task 2) 方法要点 论文/代码
TAIR-Lab 🥇 / 🥇 U-Mamba2:Mamba2 bottleneck + DAE 预训练 + SAM 式交互头 arXiv:2509.12069;Springer …_12;代码公开
Black_Myth(SJTU,Fan Xiao 等) 🥉 / 🥈 nnUNet + VISTA 混合框架;类级 ensemble;小物体阈值去除 + 非连通域过滤 Springer …11;代码 github.com/ff741333/toothfairy3blcakmyth(repo 名 typo 存照,坑 9)
DLaBella29(Dominic LaBella 等,放疗科背景) 第 5 / — MONAI Auto3DSeg + 3D SegResNet;63 例 5-fold;Multi-Label STAPLE 集成;两阶段(先 mandible 后 crop 细神经结构) arXiv:2508.12962;Springer …_14

DLaBella 的两阶段策略值得单独一提:先用全类别模型分出 mandible,再在 mandible 邻域内裁剪出小 patch 专攻细小神经结构——与官方"细小结构是难点"的判断互证,也是处理 77 类中极端类不平衡的代表性方案。注意其 0.87 是自切验证集(out-of-sample validation)成绩,非官方 hidden test 分数,与 TAIR-Lab 测试集 0.84 不可直接混排(坑 11)——这是引用第三方论文时最容易犯的口径错误。

5.6 方法启示:SSM 会在 3D 医学分割站稳吗

U-Mamba2 的双冠给了"状态空间模型进医学影像"这条路线迄今最有说服力的实战背书(此前 VM-UNet 等探索多止步于论文消融)。三个判断:①runtime 入排名的制度一旦被更多挑战赛效仿,线性复杂度骨干会从"论文新颖性"变成"参赛硬通货";②Mamba2 的优势场景恰是 TF3 这类"大体素体积 + 长程解剖依赖 + 显存受限"的任务,而小 patch 2D 任务上优势不明显;③SSM 与 SAM 式交互头的组合(自动 + 交互同底座)可能成为下一个挑战赛周期的模板——STSR 2025 同场冠军 U-Mamba2-SSL(同队)已经复用了一次该配方(DSC 0.917)。

5.7 复现 U-Mamba2 的路线图(从零到提交)

阶段化步骤(每步标出可验证的产出):

  1. 环境:clone zhiqin1998/UMamba2;按 repo 要求装 nnU-Net v2.6.2 依赖链与 PyTorch(CUDA 版本以 repo 为准)。产出:nnUNetv2_plan_and_preprocess 可运行。
  2. 数据:ditto 注册下载 TF3;按 §2.8 做 TF2 重叠处理;设置 nnU-Net 环境变量(raw/preprocessed/results 三目录)。产出:Dataset 目录通过 nnU-Net 校验。
  3. 直接用权重:下载 Google Drive 预训练权重,先跑推理看输出对不对(78 类输出 + 后处理)——先验证权重再谈复训,能省一半调试时间。
  4. 复训 Task 1:121 例自切训练集(固定 seed 记录划分);DAE 预训练 200 epochs → 微调 1500 epochs。产出:本地验证 Dice 对齐论文量级(注意是 46 口径聚合后计算)。
  5. 改造 Task 2:51 例(含点击标注)+ point encoder + cross-attention 头;点击模拟用官方协议(AUC 计算随点击序列)。产出:Dice AUC 曲线。
  6. 速度审计:单例推理计时(含 TTA);若超 40s 量级,回查 TTA 配置与 patch 策略——这是该方法的立身之本。
  7. 提交:按 challenge 页 Docker 打包规范(注意 SSD 15081727 的任务编号错位,坑 5);debug phase 先行,test phase 提交。
  8. 对照锚点:T1 目标 Dice 0.84 / HD95 38.17 / 40.58s;T2 目标 Dice AUC 0.87 / HD95 2.15——显著偏离时先查评估口径(77 vs 46)再查模型。

5.8 设计决策与理由对照表

决策 理由 证据锚点
Mamba2 而非 Transformer bottleneck 3D 体数据展平序列长,注意力二次方成本不可接受;线性复杂度直接服务 runtime 指标 40.58s vs Black_Myth 90.04s
nnU-Net 底座不重造 预处理/训练调度/推理滑窗已被大规模验证;自定义只留 bottleneck 前三方法皆 nnU-Net 系
DAE 自监督 200 epochs 无标注域适配成本低;对比项(mm_con=0.03)保特征判别性 nnU-Net 生态成熟预训练法
TTA 只开镜像组 旋转 TTA 的 3D 插值与多倍前向直接放大 runtime;镜像组精度收益/成本比最高 runtime 敏感型设计的标准减法
Task 2 复用主干换头 点击提示只需注入机制(point encoder + cross-attention),骨架语义可共享 双冠同底座
预训练联合 SD-Tooth 扩大牙科域覆盖;两源都为牙科 CBCT/NIfTI 生态 论文自述

§6 获取与许可:注册墙、CC-BY-NC-SA 与 Zenodo 空缺

6.1 获取路径(步骤化)

  1. 访问 ditto.ing.unimore.it/toothfairy3(UNIMORE AImageLab 自建数据集门户)。
  2. 注册账号并登录(“sign in or sign up”)——注册墙,无匿名直链。
  3. 下载数据集:NIfTI 体数据 + 分割标注 + dataset.json(nnU-Net dataset 格式),三分集按 P/F/S 前缀组织。
  4. 若需 RPI→LPS 转换,用官方 Python 脚本(参数:数据集路径 + 输出路径)。
  5. 评测走 grand-challenge 服务器:Task 1/Task 2 的 baseline template 与 evaluation code 均在挑战赛 Resources 区公开——本地自切验证 + 服务器官方测试双轨并行。

Zenodo 空缺存照:Zenodo 检索"ToothFairy"可得——一代本体 7835324(2023-04)、二代本体 10990960/10990959(2024-04-18)、三代 Structured Submission Document 15081727(Task 2/Task 3 提交规范,即 Docker 打包文档)。三代数据集本体不在 Zenodo——从一二代惯性强行外推会扑空(坑 4)。SSD 文档内任务编号(Task 2/Task 3)与网页口径(Task 1/Task 2)错位一位,读文档时按内容而非编号对任务(坑 5)。

6.2 License 三层结构

层 内容 许可/条件
数据本体(532 例) NIfTI + 77 类标注 CC-BY-NC-SA(grand-challenge 官方 Dataset 页明示):署名 + 非商业 + 相同方式共享
隐藏测试集(50 例) 服务器端评测专用 不公开(even after the end of the challenge)
使用义务 任何发表的引用义务 官方明文 “Any publication using our data must explicitly reference this challenge and cite [1, 2, 3]”

三件套引用清单(坑 7 相关——官方引用页自身有 DOI 笔误,以下为核对后的正确版本):

  1. Lumetti, L., Tan, Z. Q., Borghi, L., Addison, O., Li, Y., Rosati, G., van Nistelrooij, N., Vinayahalingam, S., Grana, C., & Bolelli, F. (2026). “ToothFairy3: Scaling CBCT Maxillofacial Segmentation to 77 Classes with U-Mamba2.” MICCAI 2026.
  2. Bolelli, F., Marchesini, K., van Nistelrooij, N., Lumetti, L., Pipoli, V., Ficarra, E., Vinayahalingam, S., & Grana, C. (2025). “Segmenting Maxillofacial Structures in CBCT Volumes.” CVPR 2025, pp. 5238-5248, doi:10.1109/CVPR52734.2025.00494(即 ToothFairy2 数据集论文).
  3. Lumetti, L., Pipoli, V., Bolelli, F., Ficarra, E., & Grana, C. (2024). “Enhancing Patch-Based Learning for the Segmentation of the Mandibular Canal.” IEEE Access, doi:10.1109/ACCESS.2024.3408629.

坑 7 详注:grand-challenge dataset 页引用 [3] 的正文 DOI 写作 10.1109/ACCESS.2022.3144840(系另一论文),而超链接指向 10.1109/ACCESS.2024.3408629(正确)。复制粘贴官方引用列表时会被笔误带偏——以上面核对版为准。

6.3 AI-Ready 光谱定位

  • 可获取性:注册墙档(同 LMC2 型)——比完全直链(TF2 的 Zenodo)多一道人工注册,比申请审批制(邮件通讯作者)又宽松得多。注册即得、无用途审查、无等待期。
  • 许可宽松度:CC-BY-NC-SA 属"再利用友好但非商用"档——允许共享与改编(含商业化外的衍生数据集),SA 条款要求衍生物同许可传递。对学术复现与竞赛复用零障碍,对产品落地是硬边界。
  • 格式友好度:NIfTI + nnU-Net 格式 + 官方转换脚本 + 官方评估代码四件套齐备,是 AI-Ready 光谱上"工程包装"最好的一档。
  • 综合:获取门槛中低、许可中宽、格式优——但与自家前作 TF2 相比,"Zenodo 直链 → 注册墙"是一处可见的退化;换来的好处是主办方对发放渠道的直接控制(注册用户统计、版本滚动更新)。

6.4 三件套 BibTeX(可直接粘贴)

@inproceedings{lumetti2026toothfairy3,
  title     = {ToothFairy3: Scaling CBCT Maxillofacial Segmentation to 77 Classes with U-Mamba2},
  author    = {Lumetti, Luca and Tan, Zhi Qin and Borghi, Luca and Addison, Owen and Li, Yonghuang and Rosati, Giacomo and van Nistelrooij, Niels and Vinayahalingam, Shankeeth and Grana, Costantino and Bolelli, Federico},
  booktitle = {Medical Image Computing and Computer Assisted Intervention -- MICCAI 2026},
  year      = {2026},
  note      = {Dataset paper of the ToothFairy3 challenge (ODIN 2025 @ MICCAI 2025)}
}

@inproceedings{bolelli2025segmenting,
  title     = {Segmenting Maxillofacial Structures in CBCT Volumes},
  author    = {Bolelli, Federico and Marchesini, Kevin and van Nistelrooij, Niels and Lumetti, Luca and Pipoli, Valentina and Ficarra, Elisa and Vinayahalingam, Shankeeth and Grana, Costantino},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  pages     = {5238--5248},
  year      = {2025},
  doi       = {10.1109/CVPR52734.2025.00494}
}

@article{lumetti2024enhancing,
  title   = {Enhancing Patch-Based Learning for the Segmentation of the Mandibular Canal},
  author  = {Lumetti, Luca and Pipoli, Valentina and Bolelli, Federico and Ficarra, Elisa and Grana, Costantino},
  journal = {IEEE Access},
  year    = {2024},
  doi     = {10.1109/ACCESS.2024.3408629}
}

名字拼写以论文 PDF 作者栏为最高依据;上表为官方引用页转写的核对版(坑 7 已规避)。冠军方法另引:Tan et al., “U-Mamba2”, arXiv:2509.12069 / Springer 10.1007/978-3-032-20711-1_12。

§7 生态与后续:从 ToothFairy3 向外看

7.1 官方预告:ToothFairy4M

MICCAI 现场海报的 “What’s Next” 板块预告了 ToothFairy4M:一个颌面数据开放管理平台——临床医生可上传/可视化/自动标注/分类/人工精修多种颌面扫描,并支持临床报告采集(文本 + 语音),为 text-to-image 与 image-to-text 的合成数据铺路。命名口径(4M)暗示百万级数据野心——从"数据集"到"平台",ToothFairy 系列的第四步正在换物种。截至本条目抓取时点(2026-09)尚无独立条目可核,持续观察。

7.2 姊妹挑战赛:STSR 2025(同场、同队、同框架)

ODIN 2025 同场姊妹赛 STSR 2025(Semi-supervised Tooth Segmentation and Registration):30 labeled + 130 unlabeled 半监督设定;冠军 U-Mamba2-SSL——与 TF3 冠军同一队伍(TAIR-Lab)、同一 U-Mamba2 底座加 SSL 扩展,DSC 0.917 / score 0.789。STSR 未入库(备选题,本条目正文提及不作互链)。两赛连读的价值:同一年、同一 workshop、同一架构在"全监督 77 类"与"半监督牙齿分割+配准"两个设定下双线夺冠——U-Mamba2 的泛化性由此获得双重验证。

7.3 衍生研究:X-Splat 与 Set B 的独特价值

X-Splat(arXiv 2607.02099):单张全景片(panoramic radiograph)→ CBCT 生成(Gaussian Splatting 路线),用 TF3 的 Set B 做训练与几何评估——63 例中 60 例合格(入选条件:缺牙 ≤50% 且牙列冠根完整无边界裁切),45/5/10 划分;结构级几何评估借 GEPAR3D。这条衍生线反向证明了 Set B"完整颌面视野"的稀缺性:全库只有 63 例视野无死角,做全颌几何应用时别无选择。

7.4 第三方使用与生态位

  • MC-UKAN(浙大学报,10.3785/j.issn.1008-973X.2026.04.009):KAN + U-Net 全景分割,用 TF3 实验(CT 截断 [-1000, 3500])——但其论文对三分集的转述双重错误(Set A/B 数量与 FOV 均写反,坑 3),引用其数据描述时务必回官方核对。
  • MONAI 生态:DLaBella29 用 Auto3DSeg + SegResNet 展示 MONAI 全家桶在 77 类多标签上的可行性(含 Multi-Label STAPLE 集成)。
  • nnU-Net 生态:冠军(U-Mamba2/nnU-Net v2.6.2)与季军(Black_Myth)都是 nnU-Net 底座——TF3 进一步巩固了"nnU-Net 是 3D 医学分割默认起点"的行业共识。
  • 组织方学术脉络:Bolelli/Lumetti/Grana(UNIMORE)连续三届组织 ToothFairy 系列;同组另有 IOS-CBCT 配准工作(STS 2026 Task 2 冠军 L2L-Registration)——UNIMORE 已是牙科 CBCT 计算方向的隐形基础设施提供者。

7.5 ToothFairy 系列大事年表(三代合并视图)

时间 事件
2023-04 一代 ToothFairy 本体上 Zenodo(record 7835324);MICCAI 2023 挑战赛(IAC 单结构,443 例口径)
2024-04-18 二代 ToothFairy2 本体上 Zenodo(records 10990960/10990959);挑战赛随后(42 类,530 例,26 队)
2024 IEEE Access 论文(下颌管 patch 学习,引用 [3] 前置工作)
2025-05-09 TF3 数据集第一版发布(ditto 门户 + grand-challenge,77 类)
2025-06-30 TF3 P 集补充 incisive/lingual nerve 标注
2025-07~08 TF3 debug/test phase;延期一次至 08-24
2025(CVPR) TF2 数据集论文 CVPR 2025(Bolelli et al.,5238-5248)
2025-08 U-Mamba2 预印本 arXiv:2509.12069 v1(“top 3 place” 措辞,坑 8)
2025-08 DLaBella29 预印本 arXiv:2508.12962
2025-09-27 ODIN 2025 @ MICCAI 2025(大田):TF3 与 STSR 2025 颁奖
2026 X-Splat(arXiv 2607.02099)用 Set B 做全景→CBCT 生成
2026-05-18 ODIN 2025 proceedings 出版(LNCS 978-3-032-20711-1)
2026 TF2 扩展版 MedIA 2026(10.1016/j.media.2026.104095);TF3 数据集论文 MICCAI 2026
未来 ToothFairy4M 平台(官方海报预告,未上线存照)

年表读法:三代本体发布节奏约一年一代;每一代的"挑战赛→proceedings→扩展期刊版"链条稳定运转(TF1: TMI 2024;TF2: CVPR 2025 + MedIA 2026;TF3: MICCAI 2026)——引用时按此链条选版本,期刊扩展版通常信息最全。

§8 方法启示:四类读者各取所需

8.1 给竞赛参赛者

  1. runtime 从"扣分项"变"排名项"后,架构选型逻辑反转:先问"我的推理多少秒",再问"精度还差多少"。U-Mamba2(40.58s)与亚军(17.46s)都把效率写进设计目标;90s 的 Black_Myth 用双倍精度只换来第三。
  2. nnU-Net 底座 + 换 bottleneck 是性价比最高的起手式——本届前三方法全部或部分基于 nnU-Net;从零自研 pipeline 在时间预算内几乎必输。
  3. TTA 要做减法:U-Mamba2 只开前后向 + 左右镜像三组,每组 TTA 都是 runtime 的直接乘数。
  4. 细小结构靠两阶段:LaBella 的"先 mandible 后 crop 小结构"与 Black_Myth 的"小物体阈值 + 连通域过滤"殊途同归——77 类里的牙髓/切牙管/舌侧管体素占比太小,端到端单阶段会被大类淹没。

8.2 给数据集建设者

  1. 版本演进要"加深度"而非"加宽度":TF2→TF3 的数据量只增 50 例(相对增量 10%),但类别深度翻倍(42→77)、任务翻倍(1→2)、制度翻新(runtime + 交互)——同预算下"纵向挖深"的边际收益远高于"横向铺量"。
  2. 注册墙不是原罪,但要有补偿设计:TF3 用注册墙换渠道控制,同时用 nnU-Net 格式 + 官方脚本 + 官方评估代码三件套补偿工程体验——要拿走直链便利,就给足开箱即用。
  3. 隐藏测试集 + Docker 提交让排行榜成为可引用的长期资产:TF2 的 26 队、TF3 的 8 队榜单都会在挑战赛结束多年后继续被论文引用——一次性比赛因此有了基准(benchmark)的复利。
  4. 在自家引用页把 DOI 校对三遍:TF3 官方 dataset 页的引用 [3] DOI 笔误(坑 7)会被无数复制粘贴的参考文献放大——主办方的一个 typo 变成整个领域的引用污染源。

8.3 给临床 AI 落地者

  1. "够准 + 够快"才是产品形态:榜单直接展示了临床工具的真实约束——椅旁流程等不起 90 秒;40 秒内的 0.84 Dice 比 90 秒的 0.85 更接近可部署。
  2. 交互式分割是过渡期的务实解:Task 2 的设定承认了全自动在细小结构上尚不可靠,让医生两三次点击介入——对 IAC 这类"错一下就是下唇麻木"的结构,人机协同比全自动更符合医疗风险控制逻辑。
  3. CC-BY-NC-SA 是学术-产品的分界线:基于 TF3 训练的模型若要商业化,需核查许可传导(SA 条款对衍生模型权重的约束学界尚有争议,稳妥做法是仅作研究用途或寻求官方授权)。

8.4 给评测方法学研究者

  1. TF3 是"评测制度改变竞赛结果"的活标本:同一批方法、同一批数据,仅因排名公式加入 runtime,冠军易主——任何关于"指标如何塑造方法生态"的实证研究都该引用这个案例。
  2. AUC-over-clicks 是交互分割的成熟指标范式:把"人机协作效率"曲线化,比单点 final Dice 信息量大得多,可移植到任何交互式标注场景。
  3. hidden test + 永不公开在防泄漏与可复现之间取了防泄漏一端——其代价(本地无法复现官方分数、各论文自切数字互不可比)在坑 11 已存照,设计基准时必须直面这对矛盾。

8.5 给数据工程师的十条实操建议

  1. 下载后先建 P/F/S 三目录清单并核对例数(417/63/52)——数量对不上先停下来查版本,别硬跑。
  2. 把 RPI→LPS 转换放进 pipeline 的第一步,而不是"可视化发现不对再转"——朝向错误可以悄无声息地污染训练。
  3. dataset.json 是唯一权威标签表;不要从论文表格手工抄类 ID(官网没有全表,抄错无法发现)。
  4. 用病例 ID(而非切片)做一切切分;与 TF2 数据混用按 §2.8 五条执行。
  5. 保存下载日期与文件哈希——2025-06-30 有过标注更新,版本差异是复现争议的第一嫌疑人。
  6. 细小结构(髓/切牙管/舌侧管)的评估要单独出报告——混在全类别平均里它们的失败会被 32 个大类稀释到看不见。
  7. 训练前做一次类频率直方图:77 类的体素占比跨若干个数量级,据此决定采样策略(前景过采样/深监督权重)。
  8. 推理计时用与官方一致的口径(单例、含后处理、含 TTA、GPU 型号注明)——不然你的"快"和榜单的"快"不是一个单位。
  9. Docker 提交前在本地用官方 evaluation code 自测一遍——服务器评测机会有限,别浪费在低级 bug 上。
  10. 衍生数据集(重标/子集/2D 派生)按 SA 条款以 CC-BY-NC-SA 同许可发放并保留署名——这是许可合规的最后一步,也是最容易漏的一步。

§9 库内互链

条目 rid 关系 连读价值
toothfairy2 649 直系前作:TF3 的 Set A/B 即 TF2 480 例的标注升级版;TF2 的 42 类是 TF3 77 类的子集;Zenodo 10990960/59 三代演进(§4)的两代在本库;TF2 条目含 MedIA 2026 后续报告的弱点分析(上颌窦/修复体/细小结构难),正是 TF3 新增 35 类要攻的点
tufts-dental 57 牙科 CBCT 前辈数据集(Tufts 大学集) 更早的牙科 CBCT 公开集传统;与 TF3 对照可见"标注粒度从牙列到牙髓"的十年进化
fdtooth 609 牙科数据集(牙齿分割方向) FDI 记法谱系的另一个公开实现;牙齿单类粒度与 TF3 的多结构带宽互补

未入库但正文提及(检索提示):STSR 2025(姊妹赛,U-Mamba2-SSL 夺冠)、3DTeethLand(牙齿分割 3D 数据集,未查到库内条目)、SD-Tooth(U-Mamba2 预训练联合数据源)、CTooth+/STS2023(STS2024 景观表成员)。库内牙科检索路径:url_name ILIKE '%dental%' 与 '%tooth%' 均只命中 rid 57/609/649——除上述三条外无其他牙科条目可互链。

9.1 连读路线建议(以 toothfairy2 rid 649 为主轴)

推荐的四段连读顺序,供编辑组做专题页或读者做系列阅读:

  1. 先读本条目 §0 + §1:建立 TF3 的"三合一"框架(数据/比赛/方法)与三口径纪律。
  2. 再读 toothfairy2(649) 的对应条目:重点看其 42 类清单与 Zenodo 直链获取方式——回到本条目 §4 对照表,"承袭/新增"两列立即有实体感。
  3. 回到本条目 §5:U-Mamba2 拆解——它是"用 TF2 时代工具(nnU-Net)考 TF3 新考卷(runtime)"的答卷,对照 rid 649 条目中的 TF2 冠军方法可看出方法生态的迁移。
  4. 最后本条目 §10 + 附录 S:十二坑与交叉核对表——两代数字(530/532、42/77、26 队/8 队)在此逐项闭环,可作为两篇条目互引的一致性检查单。

与 tufts-dental(57)、fdtooth(609) 的连读则按附录 T 的定位表走:前者补"牙科 CBCT 数据集的历史纵深",后者补"牙齿单结构数据集的平行宇宙"——三库目连读覆盖"老/专/全"三种牙科数据形态。

§10 避坑清单:12 坑全录

写作、引用、检索 ToothFairy3 时已被证实的高频错误,全部存照如下:

  1. 规模三口径:532(公开带标注)|582(论文总口径 = 532 + 50 隐藏)|102(相对 TF2 净增 = 52 Set C + 50 隐藏)——三者都对,引用必须带口径。“The dataset has 582 volumes” 不加"含 50 例隐藏"就是误导(坑 1)。
  2. 时间线隔年:挑战赛 = MICCAI 2025(2025-09-27 颁奖);数据集论文 = MICCAI 2026(Lumetti et al.)。写 “ToothFairy3 (MICCAI 2026)” 指论文、写 “ToothFairy3 challenge @ MICCAI 2025” 指比赛,两句话都在但别互换(坑 2)。
  3. Set A/B 第三方反转:中文期刊(MC-UKAN 论文)写 “Set A(67例)…Set B(413例)” 且 FOV 描述与官方相反。铁口径:Set A 417(P 前缀,FOV 受限)/ Set B 63(F 前缀,全 FOV)/ Set C 52(S 前缀,新扫描仪)(坑 3)。
  4. Zenodo 空缺:三代本体不在 Zenodo;Zenodo 上的 15081727 是提交规范文档(SSD)非数据。一二代的 Zenodo 惯性检索必扑空(坑 4)。
  5. Task 编号错位:网页/论文口径 Task 1(自动)/Task 2(交互);SSD(15081727)内写 Task 2/Task 3——历史文档编号未随任务合并更新(坑 5)。
  6. 77 vs 46:77 = 数据集标注细类;46 = Task 1 评估聚合子结构。参赛分数(Dice 0.84 等)是 46 子结构口径——引用分数不说明口径即无法比较(坑 6)。
  7. 官方引用页 DOI 笔误:dataset 页引用 [3] 正文 DOI 10.1109/ACCESS.2022.3144840(错)vs 超链接 10.1109/ACCESS.2024.3408629(对)。复制官方引用列表前先核对(坑 7)。
  8. 预印本措辞漂移:arXiv:2509.12069 v1(2025-08)自述 “top 3 place” 且 runtime TBC;终版/官方榜单 = first place。引用名次以 Springer 正式版(10.1007/978-3-032-20711-1_12)与 winners 页为准(坑 8)。
  9. repo 名 typo:Black_Myth 官方代码库 toothfairy3_blcakmyth(blcak,非 black)——检索/引用按原 typo 找(坑 9)。
  10. 术语漂移:同一舌侧区域,ditto/X-Splat 称 lingual canal,grand-challenge 背景页称 lingual foramen;P 集更新公告又提 “lingual nerve”。检索时三词并查(坑 10)。
  11. LaBella 0.87 是验证集:DLaBella29 论文的 0.87 Dice 是 out-of-sample validation(自切 63 例 5-fold),非官方 hidden test——与 TAIR-Lab 测试集 0.84 并列排名是口径错误(坑 11)。
  12. RPI 朝向:非标准朝向(与 Maxillo v1 一致);通用 DICOM/NIfTI 工具直接读会轴序错位;转 LPS 须用官方脚本。挑战赛数据内外同朝向,参赛可忽略、下游应用不可忽略(坑 12)。

§11 总结:五句话画像

  1. ToothFairy3 是牙科 CBCT 公开标注的当前深度之最:532 例(总口径 582)× 77 类(42+35,钻到每颗牙的牙髓腔与左右切牙管/舌侧管),0.3mm 各向同性、Hounsfield、NIfTI、nnU-Net 格式。
  2. 它同时是一场评测制度实验:runtime 首次进入主排名,立即改写了结果——绝对精度冠军 Black_Myth 被拖到第三,"够准 + 够快"的 U-Mamba2(TAIR-Lab,KCL+Surrey)双冠。
  3. 它把交互式人机协同正式引入牙科分割赛道:Task 2 以点击提示分割下牙槽神经管(Dice AUC 0.87 夺冠),为 SAM 式基础模型在牙科的应用提供了官方考场与参照实现。
  4. 它的获取形态是"注册墙 + CC-BY-NC-SA + Zenodo 空缺":ditto 门户注册即得、非商业可用、引用义务三件套——比前作 TF2 的 Zenodo 直链多一道门槛,工程包装(官方脚本 + 评估代码)却是最好的。
  5. 它是 ToothFairy 系列从"数据集"走向"平台"(ToothFairy4M 预告)的中间章:数据规模增长收敛,类别纵深、任务范式与评测制度成为新的演进轴——这个系列真正的产品不是牙科数据本身,而是牙科分割的方法学基础设施。

DAIMS 评估:AI-Ready 五维打分

维度 评分(1-10) 依据
D 可发现性 7 官方双门户(ditto + grand-challenge)+ LNCS proceedings + MICCAI 2026 论文均可索引;但三代同名前缀(ToothFairy/2/3)检索易混,Zenodo 惯性检索扑空(坑 4)、年份双口径(2025/2026,坑 2)拖累发现体验
A 可获取性 6 注册即得、无用途审批、无等待期(优于请求制与申请制);但无匿名直链(比 TF2 的 Zenodo 退化),50 例隐藏测试永不公开,NC 条款封死商用
I 可互操作 9 NIfTI + nnU-Net dataset 格式 + Hounsfield 标度 + 官方 RPI→LPS 转换脚本 + 官方评估代码——几乎满配的工程包装;仅 RPI 非标准朝向扣分(坑 12)
M 元数据质量 7 dataset.json(nnU-Net 标准)+ 官网规模/规格/时间线披露详尽 + 引用义务明确;但无患者级人口学统计、77 类 ID 全表未在网页列示(附录 AA 待核 1)
S 可持续性 7 UNIMORE 学术机构托管 + grand-challenge 平台长期在线基准 + 系列三年三代持续维护记录;但本体无 Zenodo 镜像(单点托管),官方页面已有 DOI 笔误(坑 7)提示维护人手有限
综合评级 7.2/10(中上) 工程包装(I)与制度设计(挑战赛协议)是全场亮点;可获取性被注册墙与 NC 条款压住,可发现性被系列命名与年份错位拖累

打分口径说明:D/A/I/M/S 各维 1-10 分为本库条目体例的标准化评估(非官方评分),依据列给出可核验出处;综合为五维算术平均。对照参考:toothfairy2(rid 649)因 Zenodo 直链在 A 维占优,但缺官方转换脚本与评估代码配套——两代条目连读可见"直链便利"与"工程包装"的此消彼长。


FAQ:60 问速查

数据本体(Q1-Q12)

Q1:ToothFairy3 一共有多少例数据?
公开 532 例全部带体素级 3D 标注;论文总口径 582 = 532 公开 + 50 隐藏测试。引用时注明口径(§2.4)。

Q2:三分集怎么分?
Set A 417 例(P 前缀,TF2 重叠,FOV 受限)+ Set B 63 例(F 前缀,TF2 重叠,全 FOV)+ Set C 52 例(S 前缀,全新,另一台扫描仪)。见 §2.1;注意第三方文献有 A/B 写反的转述错误(坑 3)。

Q3:77 类包括什么?
背景、上下颌骨、下牙槽神经管(左右)、上颌窦、咽、牙桥、牙冠、种植体、32 颗牙(FDI 全牙位)、左右切牙管、舌侧管、32 个牙髓腔。77 = 42(TF2 承袭)+ 35(新增)。

Q4:Task 1 的"46 子结构"是什么?
77 个细类在挑战赛评估时聚合为 46 个解剖子结构(32 牙聚合、32 髓聚合等)。榜单分数都是 46 口径(坑 6)。

Q5:新增的 35 类为什么选牙髓和切牙管/舌侧管?
官方口径:这些结构对正畸流程尤其关键(orthodontic procedures)——牙髓腔定位关系牙根吸收评估与邻牙保护,切牙管/舌侧管是上颌前部手术(种植、腭部取骨)的防损伤结构。

Q6:体素规格是多少?
0.3mm 各向同性;Hounsfield 强度;扫描尺寸 (170,272,345) 到 (298,512,512)。

Q7:什么格式?怎么读?
NIfTI + nnU-Net dataset 格式(images + labels + dataset.json)。注意 RPI 朝向:通用工具直接读会轴序错位,转 LPS 用官方脚本(坑 12)。

Q8:全 FOV 的数据有多少?
只有 Set B 的 63 例是完整颌面视野(全牙列冠根 + 上颌窦 + 咽 + 周围骨);Set A/C 受限。做全颌应用先查文件名前缀(X-Splat 只用 Set B 即此因)。

Q9:大约多少颗牙、多少标注对象?
≈17,024 颗牙(STS2024 表口径);over 40k annotated objects(论文摘要口径)。

Q10:有年龄/性别等人口学信息吗?
官网未披露患者级人口学;STS2024 对比表给年龄范围 16-100 岁。患者级去标识细节未公开(§9 待核)。

Q11:Set A 和 Set B 是同一台机器吗?
是——A/B 同一采集机器,只有 FOV 不同;Set C 才是另一台扫描仪。跨设备泛化实验用 Set C 或至少排除 C 后声明。

Q12:2025-06-30 那次数据更新改了什么?
P 集(Set A)补充 incisive and lingual nerve 标注。下载时间不同可能拿到不同版本,复现时记录下载日期。

获取与许可(Q13-Q20)

Q13:去哪下?
ditto.ing.unimore.it/toothfairy3,注册账号后下载。挑战赛页 toothfairy3.grand-challenge.org 只管赛程与评估。

Q14:为什么 Zenodo 上搜不到?
三代本体不在 Zenodo——那里只有 SSD 规范文档(record 15081727)。一二代(7835324;10990960/59)才有 Zenodo 本体(坑 4)。

Q15:什么 license?能商用吗?
CC-BY-NC-SA:署名 + 非商业 + 相同方式共享。不能商用;衍生物须同许可。产品化需另获授权。

Q16:用数据发表论文有什么义务?
官方明文必须引用挑战赛与 [1,2,3] 三件套(§6.2 有核对版清单——官方页面自身有 DOI 笔误,坑 7)。

Q17:50 例隐藏测试集能拿到吗?
不能。官方原话"will not be publicly released and will remain private even after the end of the challenge"。只能经 grand-challenge 服务器提交 Docker 评测。

Q18:有 baseline 和评估代码吗?
有。Task 1/Task 2 的 baseline template 与 evaluation code 都在挑战赛 Resources 区公开。

Q19:冠军代码和权重公开吗?
U-Mamba2 代码公开(github.com/zhiqin1998/UMamba2,权重走 Google Drive);Black_Myth 代码公开(repo 名 blcakmyth,坑 9)。

Q20:下载后第一件事做什么?
核对文件名前缀(分清 P/F/S)→ 若下游非挑战赛用途先跑官方 RPI→LPS 脚本 → 用 dataset.json 核对类 ID(确切 ID 映射表需下载数据后本地核对,官网未列全表)。

挑战赛与结果(Q21-Q30)

Q21:两个任务分别是什么?
Task 1 自动多结构分割(46 子结构,Dice+HD95+runtime 综合排名);Task 2 IAC 点击式交互分割(Dice AUC + final Dice + HD95 AUC + final HD95 + runtime,左右分管)。SSD 文档里编号错位为 Task 2/Task 3(坑 5)。

Q22:runtime 怎么入排名的?
官方加权综合 rank(精确权重未公开公式化披露,榜单按综合 rank 排序)。实际效果见 Q23。

Q23:为什么 Dice 最高的没拿冠军?
Black_Myth Dice 0.85 / HD95 33.23 全场最优但 90.04s;TAIR-Lab 0.84 / 38.17 且 40.58s,综合 rank 3.1 vs 3.8——runtime 制度翻转了排名。

Q24:Task 1 亚军是谁?
sjtu_eiee_2-426lab:17.46s(全场最快)/ Dice 0.77 / HD95 94.77,综合 rank 3.7。

Q25:Task 2 前三是谁?
🥇 TAIR_Lab(1.66,Dice AUC 0.87)🥈 BlackMyth(2.11)🥉 changkkk(3.44)。

Q26:多少队参赛?
榜单可见 Task 1 八队、Task 2 六队(TF2 曾有 26 队参赛的规模纪录)。

Q27:结果在哪公布?
2025-09-27 ODIN 2025 workshop @ MICCAI 2025(韩国大田)现场;官方 challenge-winners 页留档;proceedings 为 Springer LNCS 978-3-032-20711-1(2026-05-18 出版)。

Q28:交互分割的 AUC 指标怎么理解?
随点击数累积的 Dice/HD95 曲线下面积——衡量"每多点一下提升多少"。AUC 高 = 少量点击即达可用精度。

Q29:IAC 为什么值得单独一个任务?
下牙槽神经管是种植/阻生智齿拔除/囊肿手术的防损伤第一优先结构(损伤可致下唇持久麻木);且是一代 ToothFairy 的原点结构——系列起点在第三代以新范式回归。

Q30:可以现在还提交吗?
grand-challenge 平台的挑战赛排行榜通常赛后长期开放提交(TF2 先例),以平台当前状态为准;数据本体随时可经 ditto 注册下载。

方法与复现(Q31-Q36)

Q31:U-Mamba2 的核心思想一句话?
把 Mamba2(线性复杂度状态空间模型)装进 nnU-Net 式 U-Net 的 bottleneck——大体素 3D 分割里同时拿到长程上下文与推理速度,恰好命中"runtime 入排名"的新考题。

Q32:Mamba2 比 Transformer 好在哪?
序列建模复杂度线性 vs 二次;3D 体数据展平后序列极长,显存与速度优势被放大。但小 patch/2D 任务优势不明显——别过度外推。

Q33:U-Mamba2 怎么训的?
nnU-Net v2.6.2 + CTNormalization;DAE 自监督预训练 200 epochs(30% mask、对比损失项);微调 1500 epochs;TTA 前后向 + 左右镜像;Task 1 用 121 例、Task 2 用 51 例自切训练。全配方见 §5.3。

Q34:Task 2 的点击交互怎么实现?
SAM 风格 point encoder 编码用户点击 + cross-attention 融合进图像特征——自动/交互共用主干,只换头。

Q35:第二名方法有什么可学的?
Black_Myth(SJTU):nnUNet+VISTA 混合、类级 ensemble、小物体阈值去除 + 连通域过滤——精度最优(0.85)但 90s;后处理思路对复现高分类数场景极有用。

Q36:LaBella 的 0.87 比冠军 0.84 高,怎么理解?
不是同一口径:LaBella 0.87 是自切 63 例 5-fold 的 out-of-sample validation,冠军 0.84 是官方 hidden test——不可直接混排(坑 11)。

对比与演进(Q37-Q42)

Q37:与 ToothFairy2 的核心区别一句话?
42→77 类(钻到牙髓/切牙管/舌侧管)、单任务→双任务(+交互)、纯精度→runtime 入排名、Zenodo 直链→ditto 注册墙;数据只是温和扩容(480 承袭 + 102 新增)。

Q38:三代 ToothFairy 怎么一句话串起来?
一代盯住一根管(IAC,443 例),二代铺开整个颌面(42 类,530 例),三代向内钻(77 类)+ 向外拧(快与交互)——§4 有全表。

Q39:论文该引哪一篇?
数据集用 TF3 引 Lumetti et al. MICCAI 2026;用 TF3 数据则官方要求三件套全引(§6.2);做 TF2 对比另加 CVPR 2025(10.1109/CVPR52734.2025.00494)。

Q40:和 STS2023 / CTooth+ 什么关系?
同属牙科分割数据集谱系(STS2024 论文对比表):CTooth+ 22 例 → Mandibular Canal 347 例 → STS2023 584 例 → TF 443 → TF2 530 → TF3 532。TF3 靠"77 类 × 多结构带宽"而非单纯例数领先。

Q41:库内还有哪些牙科条目?
toothfairy2(rid 649,直系前作)、tufts-dental(rid 57)、fdtooth(rid 609)。3DTeethLand 未入库;STSR 2025/SD-Tooth 均未入库仅正文提及。

Q42:论文年份到底写 2025 还是 2026?
挑战赛 2025(MICCAI 2025 workshop 环节),数据集论文 2026(MICCAI 2026)。两句话都对,取决于指比赛还是论文——引用时写清(坑 2)。

补充问答:工程与边界(Q43-Q60)

Q43:有官方 train/val 划分吗?
没有固定划分下放到参赛者——nnU-Net 流水线自动划分或各队自选子集(U-Mamba2 用 121 例、LaBella 用 63 例 5-fold)。官方可信的唯一划分是"532 公开 vs 50 隐藏"。

Q44:类 ID 从 0 还是 1 开始?背景是多少?
以数据包内 dataset.json 的 labels 字段为最高依据(官网未列全表)。惯例上背景为 0,但 77 类的完整 ID 映射必须在下载后核对——本条目附录 A 只给分组结构不给逐项 ID(诚实边界,附录 AA 待核项 1)。

Q45:金属伪影(种植体/冠桥)区域怎么处理?
修复体与种植体本身就是 42 类中的独立类别(crowns/bridges/implants)——数据集把"伪影区"显式建模为可分割对象而非忽略区。TF2 论文已确认修复体仍是难点(类不平衡 + 金属伪影);TF3 沿承袭类未做特殊声明。

Q46:Task 2 允许几次点击?
评估按"随点击数累积"的曲线计算(AUC),不是固定次数的单点考试;final Dice/HD95 为曲线终点值。每例点击上限等执行细节以官方评估代码为准(Resources 区公开)。

Q47:可以只下载 Set B 吗?
ditto 门户按整包发放,未见分集下载选项。全 FOV 需求者下载整包后按 F 前缀自取 63 例即可——代价是带宽,不是权限。

Q48:ditto 数据和挑战赛训练数据是同一版吗?
是——挑战赛训练数据即 ditto 发放的公开集(官方 Dataset 页直接说明训练集公开可得);隐藏测试集是唯一不在公开包里的部分。

Q49:与 Maxillo 数据集什么关系?
RPI 朝向约定与 Maxillo 数据集第一版一致(官方转 LPS 脚本的说明里点明)——同一 UNIMORE 生态的数据工程传统,不是同一数据集。

Q50:SD-Tooth 是什么?
U-Mamba2 预训练的联合数据源之一(Zenodo 托管),牙科分割方向的公开数据集。冠军用它 + TF3 联合做 DAE 预训练——说明 TF3 之外还有可用的牙科预训练池。

Q51:GEPAR3D 是什么?
X-Splat 论文借用的结构级几何评估工具(3D 结构评估管线),用于评"生成的 CBCT 结构对不对"。与 TF3 本体无关,只在衍生研究线出现。

Q52:U-Mamba2 与 UMamba 是什么关系?
UMamba 是 nnU-Net 生态中"U-Net + Mamba"的方法系列;U-Mamba2 是其 Mamba2 化的变体(TAIR-Lab 所用为 7-stage 的 UMambaBot2 架构变体)。姓氏相同,注意别引错家族。

Q53:Mamba2/SSD 是谁的技术?
Mamba2(State Space Duality 框架)由 Tri Dao 与 Albert Gu 提出(2024),是 Mamba 的推广版本;U-Mamba2 是把它装进医学分割网络的下游工作。引用架构底层技术时引 Mamba2 原文,引用医学应用引 Tan et al.

Q54:官方有教程或文档入口吗?
三处:grand-challenge 页的 Background/Instructions;Resources 区的 baseline template 与 evaluation code(Task 1/2 各一套);ditto 页的数据说明与转换脚本。没有独立博客式教程。

Q55:能切成 2D 用吗?
技术上可以(约 80,000 层切片的口径即由此而来),但标注按 3D 体素设计,切片级标签需自行从体素掩码派生;切 2D 时按病例划分防泄漏(§2.7)。官方不支持 2D 任务口径。

Q56:17,024 颗牙怎么算的?
STS2024 论文对比表的统计口径(532 例 × 平均约 32 颗的量级校验合理)。它是第三方转写不是官方数字,引用时注明出处。

Q57:STSR 2025 的数字去哪查?
Springer LNCS 978-3-032-20711-1 proceedings(ODIN 2025 + TF/STSR 合集,2026-05-18 出版);本条目 §7.2 已录其冠军关键分(DSC 0.917 / score 0.789)。

Q58:一代、二代的论文分别引哪篇?
一代:IEEE TMI 2024(doi 10.1109/TMI.2024.3523096);二代:CVPR 2025(doi 10.1109/CVPR52734.2025.00494)+ MedIA 2026 扩展版(doi 10.1016/j.media.2026.104095)。做三代对照时按"期刊扩展版优先"原则选引。

Q59:2025-06-30 的标注更新后,旧实验要重跑吗?
取决于你的研究对象:P 集新增的 incisive/lingual nerve 标注只影响相关细小结构的训练与评估;纯牙齿级任务受影响有限。严谨做法:论文注明所用数据包的下载日期(§2.5)。

Q60:有官方答疑渠道吗?
grand-challenge 平台的挑战赛页自带论坛/交流机制,挑战期内的问题记录也在页面上;赛后新增问题以挑战赛页当前提供的联系方式为准(本条目不转述具体邮箱/渠道,避免时点性失效)。

硬事实清单(引用前逐条可溯源)

数据规模与构成:

  1. 公开数据集规模 532 例 CBCT,全部带体素级 3D 标注(ditto 官网口径:“532 NIfTI volumes…77 classes”)。
  2. 论文总口径 582 volumes = 532 公开 + 50 held-out(Lumetti et al. MICCAI 2026 摘要)。
  3. 相对 ToothFairy2 增量 102 additional fully annotated scans(= 52 Set C + 50 隐藏;同摘要)。
  4. 三分集:Set A 417 例(P 前缀)、Set B 63 例(F 前缀)、Set C 52 例(S 前缀)(ditto 官网)。
  5. Set A/B 与 TF2 公开训练扫描重叠(480 例)且为标注升级版(“Improved annotations from ToothFairy2”)。
  6. Set A 与 Set B 同一采集机器;Set C 来自另一台扫描仪(ditto 官网)。
  7. Set B 为完整颌面 FOV(全牙列冠根、上颌窦、咽、周围骨);Set A/C FOV 受限(同上)。
  8. 牙齿总数 ≈17,024;年龄 16-100;约 80,000 slices(STS2024 论文对比表,S1361841526000551)。
  9. 标注对象总数 over 40k(论文摘要)。
  10. TF3 在 STS2024 景观表中被引作 “ToothFairy3 (Bolelli et al., 2025)”。

类别体系:

  1. 类别总数 77(官网/challenge 页口径)。
  2. 77 = 42(TF2 承袭)+ 35(新增),自洽(官网+论文双源)。
  3. 新增 35 类 = 32 个牙髓腔 + 左右 incisive canals + lingual canal(官网:“pulpy cavities for all 32 teeth, as well as left/right incisive canals and the lingual canal”)。
  4. Task 1 评估聚合为 46 substructures(emergentmind 转述 U-Mamba2:“77 substructure classes, later consolidated into 46 substructures”;LaBella 同口径)。
  5. 类 ID 是 FDI 牙位记法扩展(官网)。

物理规格:

  1. voxel spacing 0.3mm isotropic;Hounsfield 标度;NIfTI 格式;nnU-Net dataset 格式(ditto 官网)。
  2. 朝向 RPI(与 Maxillo v1 一致);官方提供 RPI→LPS Python 转换脚本(ditto 官网)。
  3. Task 1 尺寸范围 (170,272,345) 至 (298,512,512)(emergentmind 引 Tan et al.)。

身份与组织:

  1. 全称 “ToothFairy3: Multi-Class Segmentation in CBCT Volumes”(grand-challenge 官方)。
  2. ODIN = Oral and Dental Image aNalysis;ODIN 2025 @ MICCAI 2025,2025-09-27,韩国大田。
  3. 组织方:UNIMORE(AImageLab)+ Radboud UMC + KIT + Affidea + 3Shape。
  4. 数据集门户 ditto.ing.unimore.it/toothfairy3;挑战赛门户 toothfairy3.grand-challenge.org。
  5. 组织核心人物:Bolelli、Lumetti、Grana(UNIMORE);van Nistelrooij、Vinayahalingam(Radboud);Marinov、Stiefelhagen(KIT)。

时间线:

  1. 2025-05-09 数据集第一版发布;2025-06-30 P 集补 incisive and lingual nerve 标注;2025-07-01 debug phase;2025-08-08 test phase(原截止 8-20);2025-08-20 延期至 8-24(“No additional extensions”);2025-09-27 颁奖(官网 Announcements 全录)。
  2. proceedings:Springer LNCS 978-3-032-20711-1,ODIN 2025 + ToothFairy 2025 + STSR 2025 合集,出版日 2026-05-18。
  3. 数据集论文发表 MICCAI 2026(ditto 原文 “The dataset paper has been published at MICCAI2026”)。

论文与引用:

  1. 数据集论文:Lumetti, Tan, Borghi, Addison, Li, Rosati, van Nistelrooij, Vinayahalingam, Grana, Bolelli (2026), “ToothFairy3: Scaling CBCT Maxillofacial Segmentation to 77 Classes with U-Mamba2”, MICCAI 2026。
  2. 引用 [2]:Bolelli et al. (2025) “Segmenting Maxillofacial Structures in CBCT Volumes”, CVPR 2025, pp.5238-5248, doi:10.1109/CVPR52734.2025.00494。
  3. 引用 [3]:Lumetti, Pipoli, Bolelli, Ficarra, Grana (2024) “Enhancing Patch-Based Learning for the Segmentation of the Mandibular Canal”, IEEE Access, 正确 doi:10.1109/ACCESS.2024.3408629(官方页正文 DOI 10.1109/ACCESS.2022.3144840 为笔误)。
  4. 引用义务原文:“Any publication using our data must explicitly reference this challenge and cite [1, 2, 3]”。

许可与获取:

  1. License:CC-BY-NC-SA(grand-challenge Dataset 页:“publicly available under a CC-BY-NC-SA license”)。
  2. 获取走 ditto 注册墙(sign in or sign up);无直链、无 Zenodo 镜像。
  3. 隐藏测试集永不公开(“will not be publicly released and will remain private even after the end of the challenge”)。
  4. Zenodo 相关 record:一代本体 7835324;二代本体 10990960/10990959;三代仅 SSD 规范文档 15081727(其内任务编号 Task 2/Task 3 与网页口径错位)。
  5. baseline template + evaluation code 公开(挑战赛 Resources,Task 1/Task 2 各一套)。

任务与评估:

  1. Task 1 “Fast Multi-Structure Segmentation”:46 子结构,Dice + HD95 + runtime 加权综合 rank。
  2. Task 2 “Interactive Segmentation of the Inferior Alveolar Canal”:点击式,指标 Dice AUC / final Dice / HD95 AUC / final HD95 / runtime,左右 IAC 分计。
  3. runtime 入主排名的官方理由:“reflecting the real-world demand for fast and reliable tools in clinical practice”。

结果:

  1. Task 1 榜单:🥇 TAIR-Lab(rank 3.1;40.58s / Dice 0.84 / HD95 38.17);🥈 sjtu_eiee_2-426lab(3.7;17.46s / 0.77 / 94.77);🥉 Black_Myth(3.8;90.04s / 0.85 / 33.23)。
  2. Task 2 榜单:🥇 TAIR_Lab(1.66;Dice AUC 0.87 / final Dice 0.86);🥈 BlackMyth(2.11);🥉 changkkk(3.44)。
  3. 参赛榜单规模:Task 1 八队、Task 2 六队(winners 页全列)。

冠军方法:

  1. U-Mamba2:Mamba2(SSD 框架)进 U-Net bottleneck,7-stage(UMambaBot2 变体);Task 2 加 SAM 式 point encoder + cross-attention。
  2. 训练:nnU-Net v2.6.2;CTNormalization;DAE 自监督 200 epochs(16³ patch、30% mask、mm_con=0.03);微调 1500 epochs(有效 batch 2);TTA 前后向 + 左右镜像;预训练数据 ToothFairy3 + SD-Tooth。
  3. 队伍:TAIR-Lab = KCL(Zhi Qin Tan、Owen Addison、Yunpeng Li)+ Surrey(Xiatian Zhu);冠军非组织方。
  4. 论文:arXiv:2509.12069(v1 写 “top 3 place”,终版 first place);Springer doi 10.1007/978-3-032-20711-1_12;代码 github.com/zhiqin1998/UMamba2。

其他名次方法:

  1. Black_Myth(SJTU,Fan Xiao 等):nnUNet+VISTA 混合、类级 ensemble、小物体阈值 + 连通域过滤;Springer 10.1007/978-3-032-20711-1_11;代码 repo toothfairy3_blcakmyth(typo 原样)。
  2. DLaBella29:MONAI Auto3DSeg + 3D SegResNet、63 例 5-fold、Multi-Label STAPLE、两阶段(先 mandible 后 crop);验证集 Dice 0.87(非 hidden test);arXiv:2508.12962;Springer 10.1007/978-3-032-20711-1_14。

生态:

  1. ToothFairy4M 官方预告(海报 “What’s Next”):颌面数据平台,自动标注 + 临床报告采集(文本+语音),服务 text-to-image/image-to-text 合成。
  2. STSR 2025(姊妹赛):30 labeled + 130 unlabeled;冠军 U-Mamba2-SSL(同 TAIR-Lab),DSC 0.917 / score 0.789。
  3. X-Splat(arXiv 2607.02099):单全景片→CBCT(Gaussian Splatting),仅用 Set B(60/63 合格,45/5/10 划分),GEPAR3D 做几何评估。

术语表(30 条)

  1. CBCT(Cone Beam Computed Tomography,锥形束 CT):牙科主力三维影像模态;采集快、剂量低、硬组织分辨率高。
  2. FOV(Field of View,视野):一次扫描覆盖的解剖范围;本数据集三分集的核心差异维度。
  3. FDI 记法:世界牙科联合会的两位数字牙位系统(象限+序号);本数据集类 ID 的骨架。
  4. IAC(Inferior Alveolar Canal,下牙槽神经管):下颌骨内包裹下牙槽神经/动脉/静脉的骨性管道;种植与拔牙的防损伤第一优先结构;一代 TF 的原点结构、TF3 Task 2 的目标结构。
  5. IAN(Inferior Alveolar Nerve,下牙槽神经):IAC 内走行的神经本体。
  6. Incisive canal(切牙管):上颌前部中线旁的骨性管道(鼻腭神经血管走行);TF3 新增,左右分列。
  7. Lingual canal / lingual foramen(舌侧管/舌侧孔):下颌前部舌侧骨内的细小管道及其开孔;TF3 新增;两词并存见坑 10。
  8. Pulp chamber(牙髓腔):牙冠内含牙髓的腔隙;TF3 逐牙新增 32 类。
  9. Mandible / Maxilla(下颌骨/上颌骨):颌面两大骨性结构,42 类承袭部分的主干。
  10. Osteo­radionecrosis(放射性骨坏死,ORN):头颈放疗后下颌骨坏死并发症;牙位/神经级分割服务其预防(LaBella 论文动机)。
  11. RPI / LPS:体数据轴序约定(Right-Posterior-Inferior / Left-Posterior-Superior);本数据集为 RPI,需官方脚本转 LPS。
  12. NIfTI:神经影像通用体数据格式;本数据集的发放格式。
  13. nnU-Net:自配置医学分割框架;本数据集发放格式与冠军/季军方法的共同底座。
  14. dataset.json:nnU-Net 格式的元数据文件(模态、标签、划分)。
  15. Hounsfield scale(HU):CT 强度标准标度;本数据集强度已标度至 HU。
  16. Isotropic voxel(各向同性体素):三轴等距(0.3mm);简化 3D patch 设计。
  17. Dice coefficient:分割重叠度指标(0-1)。
  18. HD95(95% Hausdorff Distance):边界鲁棒距离指标(毫米)。
  19. Runtime:单例推理耗时(秒);TF3 Task 1 主排名成分。
  20. AUC(over clicks):随点击数变化的指标曲线下面积;交互任务的核心效率指标。
  21. Click-based interactive segmentation(点击式交互分割):以正/负点击为提示逐步修正分割的范式。
  22. SAM(Segment Anything Model):点击/框提示分割的基础模型;Task 2 方法学参照系。
  23. Point encoder / cross-attention:U-Mamba2 Task 2 的提示编码与融合模块。
  24. Mamba2 / SSD(State Space Duality):线性复杂度状态空间模型框架;U-Mamba2 的骨干组件。
  25. U-MambaBot2:U-Mamba2 所用 7-stage 编解码器变体(nnU-Net 生态 UMamba 系列)。
  26. DAE(Disruptive Autoencoder):nnU-Net 生态的自监督预训练法(patch 内掩码重建 + 对比项);U-Mamba2 预训练所用。
  27. TTA(Test-Time Augmentation):推理期增广集成;U-Mamba2 仅用镜像组以控制 runtime。
  28. STAPLE / Multi-Label STAPLE:多标注者真值融合算法;LaBella 集成策略组件。
  29. Domain shift(域移位):采集设备/协议变化引起的分布漂移;Set C(新扫描仪)的隐含考题。
  30. Held-out test set(隐藏测试集):主办方保留、服务器端评测的私有测试数据;本数据集 50 例永不公开。
  31. Grand-Challenge 平台:医学影像挑战赛与算法托管平台(DIAG Nijmegen 运营);本赛评测基础设施,Docker 提交 + 服务器端 GPU 推理。
  32. Docker 提交:把模型打包为容器镜像上传、平台端运行的标准参赛协议;防泄漏闭环的技术载体。
  33. Debug / Test phase:挑战赛两阶段——调试阶段(验证提交通道)与测试阶段(计分提交);TF3 分别于 2025-07-01 / 08-08 开启。
  34. Panoramic radiograph(全景片):2D 牙科 X 光;X-Splat 研究中以它生成 CBCT 的输入端。
  35. Gaussian Splatting:显式 3D 高斯表示与渲染技术;X-Splat 的"全景→CBCT"生成路线所用。

附录 A:77 类分组结构总表(ID 以 dataset.json 为准)

注:官网未列全 77 项 ID 映射表,下表为按官方文字描述整理的分组结构;确切 class ID 请以下载数据中的 dataset.json 为最高依据(§9 待核项)。

组 类目 数量 承袭/新增
背景 background 1 承袭
颌骨 maxilla / mandible 2 承袭
神经血管管 inferior alveolar canal ×2 2 承袭
神经血管管 incisive canal ×2 2 新增
神经血管管 lingual canal 1 新增
含气/空腔 maxillary sinus ×2 / pharynx 3 承袭
修复/种植 bridge / crown / implant 3 承袭
牙齿 FDI 11-18, 21-28, 31-38, 41-48 32 承袭
牙髓 pulp chamber(32 牙逐一对应) 32 新增
合计 — 77+1(含背景) 42 + 35

附录 B:三分集速查卡

问题 Set A Set B Set C
文件前缀? P F S
例数? 417 63 52
TF2 里有吗? 有(升级版) 有(升级版) 无(全新)
FOV 全吗? 否 是(唯一全 FOV) 否
机器? 机器 1 机器 1 机器 2
典型用途? 训练主力 全结构应用金标准 跨设备泛化检验

附录 C:Task 1 排名前三与读法

名次 队伍 综合 rank runtime(s) Dice HD95(mm)
1 TAIR-Lab 3.1 40.58 0.84 38.17
2 sjtu_eiee_2-426lab 3.7 17.46 0.77 94.77
3 Black_Myth 3.8 90.04 0.85 33.23

读法:Black_Myth 精度双优但 90s;亚军最快但精度掉 7 分;冠军居中双达标。完整 8 队榜单以官方 challenge-winners 页为准(本条目仅录前三,其余名次未逐一核录,不作转述)。

附录 D:Task 2 排名前三与读法

名次 队伍 综合 rank 关键分项
1 TAIR_Lab 1.66 Dice AUC 0.87;final Dice 0.86;HD95 final 2.04-2.26
2 BlackMyth 2.11 —
3 changkkk 3.44 —

读法:TAIR_Lab 交互曲线全程领先(AUC 0.87 意味着少数点击即近可用精度);HD95 终值 2mm 级已达临床可参考区间。完整 6 队榜单以官方页为准。

附录 E:评估指标定义速查

指标 定义 用于
Dice 2 X∩Y
HD95 95 分位 Hausdorff 距离 Task 1/2 边界
Runtime 单例推理秒数 Task 1/2 速度(主排名成分)
综合 rank 三指标加权名次合成 Task 1 总排名(权重官方未公开明细)
Dice AUC Dice-点击数曲线下面积 Task 2 交互效率
HD95 AUC HD95-点击数曲线下面积 Task 2 交互效率(边界)

附录 F:官方时间线(复述版)

2025-05-09 数据发布 → 06-30 P 集标注补充 → 07-01 debug → 08-08 test(原止 08-20)→ 08-20 延期至 08-24(不再延)→ 09-25 颁奖预告 → 09-27 ODIN@MICCAI 2025(大田)颁奖 → 2026-05-18 LNCS 出版 → MICCAI 2026 数据集论文。

附录 G:三件套引用(核对版清单)

  1. Lumetti et al. (2026). ToothFairy3: Scaling CBCT Maxillofacial Segmentation to 77 Classes with U-Mamba2. MICCAI 2026.
  2. Bolelli et al. (2025). Segmenting Maxillofacial Structures in CBCT Volumes. CVPR 2025, 5238-5248. doi:10.1109/CVPR52734.2025.00494.
  3. Lumetti et al. (2024). Enhancing Patch-Based Learning for the Segmentation of the Mandibular Canal. IEEE Access. doi:10.1109/ACCESS.2024.3408629.

警示:官方 dataset 页引用 [3] 正文 DOI(10.1109/ACCESS.2022.3144840)为笔误,以上为核对版(坑 7)。

附录 H:官方资源链接总表

资源 地址
数据集门户(注册墙) ditto.ing.unimore.it/toothfairy3
挑战赛主页 toothfairy3.grand-challenge.org
挑战赛获奖页 toothfairy3.grand-challenge.org/challenge-winners/(榜单)
SSD 规范文档 zenodo.org/records/15081727
proceedings Springer LNCS 978-3-032-20711-1
U-Mamba2 代码 github.com/zhiqin1998/UMamba2
U-Mamba2 预印本 arxiv.org/abs/2509.12069
U-Mamba2 正式版 doi 10.1007/978-3-032-20711-1_12
Black_Myth 代码 github.com/ff741333/toothfairy3_blcakmyth
Black_Myth 正式版 doi 10.1007/978-3-032-20711-1_11
DLaBella29 预印本 arxiv.org/abs/2508.12962
DLaBella29 正式版 doi 10.1007/978-3-032-20711-1_14
前作 TF2(库内) toothfairy2 条目(rid 649);Zenodo 10990960/10990959

附录 I:RPI 朝向问题操作指南

  1. 现象:SimpleITK/nibabel 直接读入后左右/前后轴语义与预期不符。
  2. 原因:数据为 RPI 轴序(与 Maxillo v1 一致的非标准约定)。
  3. 解法:使用 ditto 提供的 RPI→LPS 转换脚本(输入:数据集路径;输出:转换后路径)。
  4. 何时可忽略:仅参加挑战赛(测试与训练同朝向)。
  5. 何时必须处理:任何下游应用、与外部数据混用、导出 DICOM/可视化。

附录 J:nnU-Net 格式与 30 分钟上手清单

目录骨架(DatasetXXX_ToothFairy3/):imagesTr/(NIfTI 体数据)+ labelsTr/(同尺寸分割图)+ dataset.json(模态/标签/划分)。dataset.json 关键字段(以实际文件为准):

字段 内容 用途
channel_names 模态与强度标度(CT/HU) 决定 nnU-Net 归一化分支
labels 类 ID → 名称映射(77+背景) 唯一权威标签表(附录 AA 待核项 1)
file_ending “.nii.gz” 读写扩展
numTraining / training 名单 训练例清单 核对 532 例完整性的锚点
(可能的)release/版本字段 版本标记 对照 2025-06-30 更新(§2.5)

上手五步:

  1. 注册 ditto 下载并解压。
  2. 核对 P/F/S 前缀分组与 dataset.json 标签表。
  3. (下游用途)跑官方 RPI→LPS 脚本。
  4. 直接喂 nnU-Net v2(规划 + 训练),或按 U-Mamba2 repo 起步。
  5. 本地自切验证集(勿把 Set A/B 与 TF2 数据混用导致泄漏);官方测试分走 grand-challenge 提交。

附录 K:U-Mamba2 训练配置全表

项 值
流水线 nnU-Net v2.6.2
归一化 CTNormalization
预训练 DAE 200 epochs(16³ patch mask,ratio 30%,对比项 mm_con=0.03)
预训练数据 ToothFairy3 + SD-Tooth
微调 1500 epochs,有效 batch 2
Task 1 训练集 121 labeled scans(自切)
Task 2 训练集 51 labeled(含点击标注)
TTA 前后向翻转 + 左右镜像
Task 2 模块 SAM 式 point encoder + cross-attention
成绩 T1:0.84/38.17mm/40.58s;T2:Dice AUC 0.87,Dice 0.87/HD95 2.15mm(论文口径)

附录 L:Black_Myth 方法卡

  • 队伍:SJTU(Fan Xiao 等);Task 1 季军 / Task 2 亚军。
  • 方法:nnUNet + VISTA 混合框架;类级 ensemble;推理后处理(小物体阈值去除 + 非连通域过滤)。
  • 成绩:T1 Dice 0.85 / HD95 33.23(全场最优)/ 90.04s(rank 3.8 居第三——runtime 制度最著名受害者)。
  • 资源:Springer 10.1007/978-3-032-20711-1_11;代码 toothfairy3_blcakmyth(repo 名 typo 原样保留,坑 9)。

附录 M:DLaBella29 方法卡

  • 队伍:Dominic LaBella 等(临床放疗科背景);Task 1 第 5。
  • 方法:MONAI Auto3DSeg + 3D SegResNet;63 例 5-fold;Multi-Label STAPLE 集成;两阶段推理(先全类别出 mandible,再在邻域 crop 专攻细小神经结构)。
  • 成绩口径警示:0.87 为 out-of-sample validation(自切验证集),非官方 hidden test——勿与 TAIR 0.84 混排(坑 11)。
  • 资源:arXiv:2508.12962;Springer 10.1007/978-3-032-20711-1_14。
  • 动机背景:头颈放疗剂量规划与放射性骨坏死预防。

附录 N:三代托管与获取对照

代 本体托管 直链? License 口径
TF(2023) Zenodo 7835324 是 (Zenodo 口径)
TF2(2024) Zenodo 10990960/59 是 (Zenodo 口径)
TF3(2025) ditto 注册墙 否(注册后得) CC-BY-NC-SA(Dataset 页明示)
TF3 SSD(规范文档) Zenodo 15081727 是 文档(非数据)

附录 O:牙科 CBCT 分割数据集景观(STS2024 表口径)

数据集 例数 年份 每例标注密度估算
CTooth+ 22 2022 —
Mandibular Canal CBCT 347 2022 单结构为主
STS2023 584 2023 牙齿级
ToothFairy 443 2023 IAC 单结构(约 5 类口径)
ToothFairy2 530 2024 42 类(多结构)
ToothFairy3 532 2025 77 类(≈32 牙/例 + 约 37 个其他结构对象/例)

密度列说明:TF3 的 ≈17,024 teeth ÷ 532 例 ≈ 32 牙/例(全牙列口径,含缺牙者平均略低);>40k objects ÷ 582 例 ≈ 69 个标注对象/例——即除牙齿外每例平均还有约 37 个非牙类对象(颌骨、窦、管、修复体等)。此两行为本条目基于官方口径的算术推导,非官方数字,引用时按推导注明。

附录 P:临床场景 → 结构映射

临床场景 依赖结构(TF3 类)
种植规划 下颌骨/上颌骨、IAC、切牙管、牙位、牙冠/桥/种植体(现有修复识别)
阻生第三磨牙拔除 IAC、FDI 38/48、牙根形态(牙类)
正畸方案与随访 32 个牙髓腔(牙根吸收监测)、切牙管、全牙位
腭部/前部取骨手术 切牙管、舌侧管/孔
头颈放疗规划 全牙位、IAC、颌骨(剂量映射与 ORN 预防)
上颌窦提升 上颌窦、上颌后牙位

附录 Q:FDI 记法速查(恒牙列)

象限:1=右上、2=左上、3=左下、4=右下;序号:1 中切牙 → 8 第三磨牙。例:FDI 36 = 左下第一磨牙;38/48 = 左/下右第三磨牙(阻生智齿高频位)。数据集 32 牙类与 32 髓类均按此体系一一对应。

附录 R:高频检索错误与修正

错误姿势 后果 修正
Zenodo 搜 ToothFairy3 本体 扑空(只有 SSD) 去 ditto 注册下载(坑 4)
引 “MICCAI 2025 数据集论文” 年份错 论文在 MICCAI 2026(坑 2)
引 “Set A 67 例/Set B 413 例” 引了错误转述 A 417 / B 63 / C 52(坑 3)
搜 “ToothFairy3 46 类” 口径混 77 标注 / 46 评估(坑 6)
搜 “blcakmyth” 拼成 “blackmyth” 找不到 repo 原样 typo(坑 9)
只搜 “lingual canal” 或只搜 “lingual foramen” 漏一半文献 双词并查(坑 10)

附录 S:与库内条目交叉核对表

核对点 toothfairy3(本条目) toothfairy2(rid 649)
公开例数 532(+50 隐藏) 530(480+50)
类数 77(评估 46) 42
任务 双任务(自动+交互) 单任务(自动)
排名含 runtime 是(首创) 否
托管 ditto 注册墙 Zenodo 直链
参赛 8 队(T1) 26 队
数据关系 A/B=TF2 480 例升级版 + C 52 新 480 例为 TF3 A/B 前身

附录 T:与 tufts-dental(57) / fdtooth(609) 的差异定位

  • tufts-dental(rid 57):更早代牙科 CBCT 公开集传统——以"采集规模/临床多样性"见长;与 TF3 的差异主要在标注粒度(TF3 到牙髓/细管级)与格式工程化(nnU-Net 即用)。
  • fdtooth(rid 609):牙齿分割方向专精数据集——单结构牙齿级标注;与 TF3 的"77 类颌面全家桶"互补:做纯牙齿分割可先看 fdtooth,做颌面多结构必须 TF3。
  • 连读建议:三代 ToothFairy(本条目 + rid 649 + 一代事实卡)为纵轴,tufts/fdtooth 为横轴,构成库内牙科 CBCT 数据全景。

附录 U:任务编号错位对照(网页 vs SSD)

网页/论文口径 SSD(Zenodo 15081727)口径 内容
Task 1 Task 2 自动多结构分割(Docker 提交)
Task 2 Task 3 IAC 交互分割
—(已并入 Task 1 评估) Task 1 历史规划的独立任务

结论:读 2025 年 4 月前成文的历史文档时按内容对任务,按编号对会错位一位(坑 5)。

附录 V:双拼写/混称对照表

概念 出现的变体 出处
舌侧管/孔 lingual canal / lingual foramen / lingual nerve ditto / grand-challenge / 官网公告
下牙槽管 inferior alveolar canal / IAC / IAN(神经本体) 全部
冠/桥 crown / bridge(修复体) 官网类目
Black_Myth Black_Myth / BlackMyth(榜单两种写法)/ blcakmyth(repo typo) winners 页 / repo

附录 W:数字口径速查卡(一屏背完)

532 公开|50 隐藏|582 总|480 承袭自 TF2|102 净增|A417/B63/C52|77 标注类|42 承袭类|35 新增类|46 评估子结构|32 牙|32 髓|2 切牙管|1 舌侧管|0.3mm 各向同性|(170,272,345)-(298,512,512)|≈17,024 teeth|>40k objects|16-100 岁|8+6 队|Task1 冠 0.84/40.58s|Task2 冠 AUC 0.87。

附录 X:CC-BY-NC-SA 四要素与使用红线

  1. BY(署名):使用须署名 + 引三件套(官方义务叠加)。
  2. NC(非商业):禁止商业目的使用——商用训练/产品集成需另行授权;"非商业"边界(如商业公司内部研究)按 CC 官方解释从宽认定须谨慎,稳妥做法以研究发表为准。
  3. SA(相同方式共享):衍生物(含再标注、衍生数据集)须以同许可发放。
  4. ND 无:允许改编(与 NC-SA 组合)。
    红线总结:可研究、可复现、可再分发(同许可);不可商用、不可闭源衍生、不可去掉署名。

许可识别备忘:CC-BY-NC-SA 在本库 AI-Ready 光谱中属"非商用可改"档(比 CC-BY-NC-ND 宽、比 CC-BY 窄);grand-challenge Dataset 页为本 license 声明的唯一官方出处——ditto 门户页面本身未见 license 徽标,引用许可时以 grand-challenge 页为准并注明抓取日期。若未来官方在 Zenodo 补挂本体并赋予不同 license,以新记录为准(版本敏感点,存照)。

附录 Y:评测制度启示(方法学视角五条)

  1. 指标即激励:runtime 入排名一年内就让 SSM 架构登顶——评测公式是领域方向的隐形指挥棒。
  2. 交互任务的 AUC 化是可移植范式:任何"人在回路"评测(标注、质控、诊断修正)都可用"指标-交互次数"曲线替代单点分数。
  3. hidden test 的代价须显式管理:官方分不可本地复现 → 论文间自切数字不可比(坑 11 即产物)→ 基准设计者应同时提供官方榜 + 固定公开验证切分。
  4. 长期基准的可维护性:TF 系列三年三代仍用同一套"Docker + 服务器评测"协议,排行榜因此可跨年对比——基准资产的价值随协议稳定性的幂次增长,轻易换协议等于清零历史榜。
  5. 注册墙与审计的交换:TF3 用注册墙换来了发放审计能力(谁知道谁在用、规模多大)与版本滚动能力——隐私敏感的医学数据在大规模开放与完全封闭之间,"注册 + 宽许可"是一条被低估的中间道路。

附录 Z:本条目与备选题的关系存照

本批次备选题为 STSR 2025(同 ODIN 2025 姊妹赛)。正选 ToothFairy3 经三轮核验全部成立(规模/license/托管三源互证),未触发改道条件。STSR 的关键事实(30+130 例、U-Mamba2-SSL 夺冠 DSC 0.917)已作为生态条目收入 §7.2——若未来为其单独立条,与本条目互链关系为"同 workshop 姊妹赛 + 同冠军队伍"。

附录 AA:待核事项(诚实清单)

  1. 77 类的逐项 class ID 映射(需下载数据读 dataset.json)。
  2. Set A 采集设备的厂商/型号(官网仅说 A/B 同机、C 另一台)。
  3. 患者/扫描级人口学统计(年龄 16-100 来自 STS2024 表,官网未披露分布)。
  4. Task 1 综合 rank 的精确权重公式(官方未公开明细)。
  5. 榜单 8/6 队的完整队名与完整分数(本条目仅核录前三)。
  6. ToothFairy4M 平台上线状态(截至 2026-09 仅有海报预告)。

附录 AB:抓取来源清单(时点 2026-09-26/27)

  1. ditto.ing.unimore.it/toothfairy3(数据集门户:规模/三分集/规格/朝向/license 引述)。
  2. toothfairy3.grand-challenge.org(挑战赛页:背景/任务/时间线/Announcements/Dataset 页 license/winners 页榜单)。
  3. arxiv.org/abs/2509.12069(U-Mamba2 v1 与相关版本措辞差异)。
  4. Springer LNCS 978-3-032-20711-1(ODIN 2025 proceedings,含 _11/_12/_14 各章 DOI)。
  5. Lumetti et al. MICCAI 2026 论文摘要(582/102/40k 口径;“published at MICCAI2026” 引述)。
  6. STS2024 论文(S1361841526000551:景观对比表 17,024 teeth/16-100 岁/尺寸范围)。
  7. arXiv:2508.12962(DLaBella29)。
  8. arXiv:2607.02099(X-Splat:Set B 使用细节)。
  9. 浙大学报 MC-UKAN 论文(10.3785/j.issn.1008-973X.2026.04.009:第三方转述错误样本)。
  10. MICCAI 2025 现场海报(What’s Next:ToothFairy4M 预告)。
  11. 库内查库记录:url_name ILIKE '%toothfairy%'/'%dental%'/'%tooth%' → 仅 rid 57/609/649。

附录 AC:修订记录

版本 日期 说明
v1.0 2026-09-27 agentA-tf3 初稿全量成文(FACTS 三轮核验版;12 坑存照;42 问 FAQ;硬事实 50 条;附录 A-AC)

撰写方法与核验声明

本条目按千方病案医数集【50 篇冲刺批量生产 · 批次 2】流程撰写,代理名 agentA-tf3,工作目录 writing/toothfairy3/。方法声明:

  1. 三轮存在性核验:第一轮官网/挑战赛/海报互证(规模 532、77 类、ODIN 2025 归属成立)+ 库内查重(无重复条目,确定互链点);第二轮 license 锁定(CC-BY-NC-SA,grand-challenge Dataset 页直取)+ 冠军方法双源(arXiv + Springer);第三轮 Zenodo 空缺确认 + 前作演进锚点 + 数据集论文摘要口径(582/102/40k)。
  2. 一手来源优先:全部关键数字可溯源至 ditto 官网、grand-challenge 官方页、arXiv/Springer 论文、MICCAI 现场海报四类一手材料;第三方转述(含中文期刊)一律降级为"存照样本"而非事实来源。
  3. 矛盾处理:所有官方内部矛盾(DOI 笔误、任务编号错位、lingual canal/foramen、榜单措辞漂移等)未做静默取舍,一律进 §10 十二坑存照——本条目的原则是"给读者判断材料,而不是替读者选边"。
  4. 诚实边界:无法核验的细节(类 ID 全表、设备型号、rank 权重公式、完整榜单)明确列入附录 AA 待核清单并标注"以官方为准",未做推测性补全。
  5. 体例:1200+ 行 Wikipedia 体,frontmatter schema_org 含 cr:RecordSet 节点;与库内 toothfairy2(rid 649)、tufts-dental(rid 57)、fdtooth(rid 609)建立互链。

尾注与引用义务提醒

本条目为千方病案医数集 AI-Ready Wikipedia 的二次整理条目。使用 ToothFairy3 数据的任何发表,除本库条目外必须遵守官方引用义务:引用 ToothFairy3 挑战赛与三件套论文(附录 G 核对版)。条目内容以 2026-09-26/27 抓取时点的官方页面为准;官方页若更新(尤其是标注版本与榜单),以官方为准并欢迎勘误。

(完)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • instance2022 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • trials — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • segthor — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • ctooth — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集