CTooth (ctooth) — 首个全标注 3D 牙科 CBCT 牙齿分割数据集与基准 — AI-Ready Wikipedia

CTooth: Fully Annotated 3D Dataset and Benchmark for Tooth Volume Segmentation on CBCT——杭州电子科技大学与伦敦玛丽女王大学等团队打造的首个公开全标注 3D 牙科 CBCT 数据集:22 个锥形束 CT 体数据、7363 张切片、5504 张专家逐体素标注,SKNet 3D U-Net 基准达 Dice 88.04%,请求制发放并衍生 CTooth+ 与 MICCAI 2023 STS-3D 挑战赛

来源 电子科技大学及其附属医院采集的牙科锥形束 CT(CBCT)体数据:22 个 volumes(7363 slices)、4 位放射影像专家 ITK-SNAP 逐体素二值牙齿标注(gold standard),涵盖缺牙/修复体/种植体/正畸器械等变异;扩展版 CTooth+ 追加 146 个未标注 volume(25876 未标注片)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 12
CTooth (ctooth) — 首个全标注 3D 牙科 CBCT 牙齿分割数据集与基准 — AI-Ready Wikipedia

信息速览

数据集名称CTooth (ctooth) — 首个全标注 3D 牙科 CBCT 牙齿分割数据集与基准 — AI-Ready Wikipedia
数据类型人工标注,专家验证,影像数据,原始数据
规模22 个 CBCT 体数据(volumes),共 7363 张切片(5504 张全标注;GitHub 口径 5803 张切片/4243 张含牙齿标注);患者信息编码脱敏,患者级数量未单独披露
接入方式电子科技大学及其附属医院采集的牙科锥形束 CT(CBCT)体数据:22 个 volumes(7363 slices)、4 位放射影像专家 ITK-SNAP 逐体素二值牙齿标注(gold standard),涵盖缺牙/修复体/种植体/正畸器械等变异;扩展版 CTooth+ 追加 146 个未标注 volume(25876 未标注片)
AI 就绪度

INFOBOX — CTooth 一屏速览

维度 内容
本质 首个公开的、全标注的 3D 牙科 CBCT 牙齿体积分割数据集与基准(非 2D 全景、非多类颌面分割)
团队 杭州电子科技大学 + 伦敦玛丽女王大学(QMUL)+ 浙江传媒学院 + 莱斯特大学 + 电子科技大学等联合;通讯 Qianni Zhang(QMUL)
论文 ICIRA 2022(arXiv:2206.08778,2022-06-17);扩展版 CTooth+ DALI@MICCAI 2022(arXiv:2208.01643)
数据 22 个 CBCT 体数据 / 7363 张切片 / 5504 张全标注(GitHub 口径:5803 slices,4243 含标注)
模态 CBCT(锥形束 CT),单一型号设备 + 标准化处理
标注 4 位放射影像专家,ITK-SNAP 逐体素二值牙齿掩码(gold standard);每卷 ≈6h 标注 + 1h 校对
变异 缺牙、修复体、种植体、正畸金属器械(金属伪影)、不同颌骨尺寸
任务 3D 牙齿体积语义分割(teeth/background 二值)
最佳基准 3D U-Net + SKNet 注意力模块:Dice 88.04% / IoU 78.71%
指标集 DSC、WDSC、IoU、SEN、PPV、HD、ASSD、SO、SD
获取 邮件请求制(acw499@qmul.ac.uk,先读 Data_requistion.md);无公开直链
许可 双口径:GitHub CC BY 4.0 vs Kaggle CC BY-NC 4.0(冲突)
衍生 CTooth+(+146 未标注 volume)→ MICCAI 2023 STS-3D 挑战赛
库内互链 ToothFairy2(649)、ToothFairy3(673)、fdtooth(609)、LNDb、dentex、3DTeethLand

CTooth 是牙科影像领域第一个公开的、全标注的 3D 锥形束 CT(CBCT,Cone Beam Computed Tomography)牙齿体积分割数据集与配套基准。它不只是一个数据包,而是一次"从 0 到 1"的数据集工程:在 CTooth 之前,公开的牙科数据集几乎全部是 2D 的口腔全景 X 光或根尖片,牙齿的三维空间信息被压缩与畸变;能被深度模型直接使用的三维 CBCT 数据要么是私人(in-house)资产,要么根本不存在。CTooth 用 22 个 CBCT 体数据、7363 张切片、5504 张由放射影像专家逐体素标注的"金标准"掩码,填上了这个空白,并配上一套可复现的 3D attention-based U-Net 基准——最佳 SKNet 变体达到 Dice 88.04% / IoU 78.71%。

这个条目的重要性还在于它是一段"谱系的起点":CTooth 之后,同团队发布了扩展版 CTooth+(保持 22 卷全标注,追加 146 卷未标注数据以支撑半监督/主动学习),MICCAI 2023 又将 CTooth 纳入 STS-3D 挑战赛任务。因此理解 CTooth,也是理解后来 ToothFairy 系列、多中心 CBCT 数据集这一整条牙科三维分割路线的钥匙。

导语读法三则:

  1. 只想下数据 / 评估可用性:直奔 §6 获取与许可——注意它没有公开直链,只能邮件申请,且许可在 GitHub 与 Kaggle 两处矛盾(CC BY 4.0 vs CC BY-NC 4.0)。
  2. 关心数据本体与规模:直奔 §2 与 §4——务必先分清 CTooth 与 CTooth+ 两个版本,以及切片数 7363 / 5803 / 5504 的三套口径。
  3. 关心基准与复现:直奔 §5——SKNet + 3D U-Net 的 Dice 88.04% / IoU 78.71% 是核心对标点,指标定义以 arXiv:2206.08778 原文为准。

§0 导读:这个数据集解决什么问题

三维牙齿分割(tooth volume segmentation)是计算机辅助牙科诊疗的前置条件。正畸手术要基于分割结果重建精确的三维牙齿模型;根管治疗要看清牙根的形态与弯曲度;种植规划要评估牙槽骨与邻牙的空间关系。没有准确的牙齿体积分割,这些下游任务都无从谈起。但在真实临床里,这一步长期依赖人工:放射科医师需在 CBCT 断层上逐层勾画每一颗牙,不仅主观性强(不同医师勾画结果存在观察者间变异),而且极为耗时——按论文口径,每个 volume 仅"标注"就约 6 小时,再加约 1 小时校对。

理论上深度学习可以显著降低这一负担,但深度学习的前提是大量带金标准的训练数据——而这恰恰是牙科三维领域最缺的东西。CTooth 论文在引言中给出了三条现状陈述:

  1. 传统浅层方法(基于区域、阈值、边界、聚类)只能在小型或私人数据集上评估,性能高度依赖手工特征工程;
  2. 少量做 3D 牙齿分割的研究多用 in-house 数据,代码与数据都不公开,导致结果无法复现、无法公平比较;
  3. 已有的公开牙科数据集几乎都是 2D 的——ISBI 2015 的 Dental X-ray Image 数据集(牙标志点检测与龋齿分割)、LNDb(全景 X 光的牙齿多边形标注)、一个很小的单牙冠龋齿分类数据集 Teeth_dataset——它们把牙齿的三维空间信息压缩进二维,损失了深度维度。

论文的原话是:“据我们所知,医学图像处理领域从未公开发布过任何 3D 牙科 CBCT 数据集。”(To our knowledge, no 3D dental CBCT dataset has ever been published for open-access in the medical image processing domain.)CTooth 因此被明确定位为这一领域的起点资源(research fundamental)。

CTooth 的回答分三层:

  • 第一层是数据:采集并公开一个全标注的 CBCT 数据集——22 个 volume、7363 张切片、5504 张专家逐体素标注的二值牙齿掩码,被表述为"tooth gold standard"。掩码与 CBCT 体素对齐,可直接训练牙齿体积分割模型。
  • 第二层是变异:数据并非"标准牙列"的理想样本,而是刻意纳入缺牙、修复体、种植体、正畸金属器械(会产生 CT 金属伪影)与不同颌骨尺寸,让基准贴近真实临床。
  • 第三层是基准:评测了 DenseVoxelNet、V-Net、3D HighResNet 等方法,并系统性地给 3D U-Net 施加不同注意力模块,给出可复现的性能基线——最佳为 3D U-Net + SKNet。

§0 读法三则:

  1. 这个条目写的是 2022-06 首发的 CTooth(22 卷);同团队 2022-08 发布的 CTooth+ 是扩展版(保留 22 卷全标注,追加 146 卷未标注)。两者同名系列、口径不同,正文与坑点章节逐处辨析(坑 1)。
  2. CTooth 的切片数存在三套公开口径(论文 7363 / GitHub 5803/4243 / 综述 5504),官方从未解释三者关系,本条目并列存照(坑 2)。
  3. 许可存在双口径冲突(GitHub CC BY 4.0 vs Kaggle CC BY-NC 4.0),直接影响商用判断(坑 3);数据本体是邮件请求制,没有公开直链(坑 4)。

§0.1 数据集身份证

把 CTooth 的"身份信息"压缩成一张卡片,便于快速核对:

字段 内容
官方名 CTooth
全称 CTooth: A Fully Annotated 3D Dataset and Benchmark for Tooth Volume Segmentation on Cone Beam Computed Tomography Images
slug ctooth
域 医学影像 / 牙科三维分割
模态 CBCT(锥形束 CT)
维度 3D(体素级)
任务 牙齿体积语义分割(二值)
规模 22 volumes / 7363 slices / 5504 全标注
标注 4 位放射影像专家,ITK-SNAP 逐体素
论文 ICIRA 2022(arXiv:2206.08778)
扩展 CTooth+(DALI@MICCAI 2022,arXiv:2208.01643)
官方入口 github.com/liangjiubujiu/CTooth
获取 邮件请求制(acw499@qmul.ac.uk)
许可 CC BY 4.0(GitHub)/ CC BY-NC 4.0(Kaggle)双口径
最佳基准 3D U-Net + SKNet,Dice 88.04% / IoU 78.71%
库内互链 ToothFairy2(649) / ToothFairy3(673) / fdtooth(609)

§0.2 三分钟阅读地图

本条目按"读法优先"组织,不同需求对应不同路径:

  • 需求:判断这个数据集能不能用 → 读 §1(十问十答)+ §8(局限)+ §6(获取与许可)。三节合读可在数分钟内判断可用性。
  • 需求:看数据规格细节 → 读 §2(构成与规格,含三口径辨析)+ §3(标注流程)。
  • 需求:复现或对标基准 → 读 §4(方法与发现)+ §5(基准与指标)。
  • 需求:写综述或做选型对比 → 读 §2.6(谱系表)+ §7(生态)+ 附录 B(DAIMS)。
  • 需求:避坑 → 直接读 §10(八个坑)与 §9.2(双口径存照清单)。

§0.3 一个必须记住的前提

本条目通篇区分两个版本:CTooth(22 卷,2022-06)与 CTooth+(22 卷 + 146 未标注卷,2022-08)。凡是看到"CTooth"这个词,先问一句:“指的是初版还是扩展版?”——因为规模数字(7363 vs 31380)、学习范式(全监督 vs +半监督/主动学习)、标注人员(4 位专家 vs 12 初 + 3 资深复核)都不同。这是本条目出现频率最高的辨析点(§2.5、坑 1)。

§0.4 三个必须先建立的概念

在深入细节之前,先建立三个概念,能显著降低阅读门槛:

概念一:CBCT 与普通 CT 的区别。CBCT(Cone Beam CT,锥形束 CT)与常规螺旋 CT 的根本区别在扫描几何:常规 CT 用扇形束逐层扫描、重建为轴位断层堆叠;CBCT 用锥形束一次旋转覆盖整个感兴趣区,剂量更低、牙颌区空间分辨率更高,但软组织对比与视野一致性不如常规 CT。牙科正是 CBCT 的主场。CTooth 采用 CBCT,意味着它面向的是"牙齿与颌骨"这类高对比硬组织,而非软组织。

概念二:语义分割 vs 实例分割。语义分割只回答"每个体素是不是牙齿";实例分割还要回答"这个体素属于第几颗牙"。CTooth 是前者(二值),ToothFairy2 是后者(逐牙 + 42 类)。这个区别决定了数据集能支撑什么任务(坑 7)。

概念三:"请求制"意味着什么。请求制(requisition)不是"收费",而是"需先申请、经审核后发放"。它常见于涉及患者影像的数据集,目的是合规追踪与用途约束。代价是自动化不可用(坑 4)。

§0.5 为什么这个条目值得读

即使你不做牙科方向,CTooth 也值得一读,因为它是一个教科书级的数据集工程案例:

  • 它演示了"从 0 到 1"建一个领域首个公开数据集的全过程:识别空白 → 采集 → 专家标注 → 变异覆盖 → 配套基准 → 扩展与挑战赛;
  • 它演示了"小而精"数据集的价值定位:不追规模,而追质量与难例覆盖;
  • 它演示了数据集常见的"成长烦恼":规模不足 → 扩量 → 引入半监督 → 催生挑战赛;
  • 它暴露了数据集治理的典型坑:许可口径不一、元数据留白、获取门槛、口径漂移。

这些经验与坑,几乎可以平移理解任何一个医学数据集。本条目因此在 §10 单列八个坑,并在 §9.2 列出双口径存照清单,供跨条目复用。

§0.6 本条目的事实来源与核验方式

本条目所有硬数字均来自三源互证,核验方式如下:

  1. 论文源:arXiv:2206.08778(主)与 arXiv:2208.01643(扩展),经 arXiv 官方页面实抓,确认作者、时间、规模、指标;
  2. 官方仓库源:github.com/liangjiubujiu/CTooth,实抓 README 与 Data_requistion.md,确认许可(CC BY 4.0)、规模(5803/4243)、获取方式(邮件请求)、BibTeX;
  3. 官方页源:kaggle.com/datasets/weiweicui/ctooth-dataset,实抓 License(CC BY-NC 4.0)与 Data Usage Agreement。

三源之间的一致处(规模 22 卷、专家标注、SKNet 基准、请求制)作为事实采用;冲突处(切片数 7363 vs 5803 vs 5504、许可 CC BY 4.0 vs CC BY-NC 4.0)逐条在 §9.2 存照,不做强行统一。二手来源(系统综述、聚合站)仅作背景与交叉印证,不作为事实依据。

§0.7 阅读本条目后你应该能回答的问题

读完本条目,你应当能清晰回答以下问题:

  1. CTooth 是什么、是不是第一个 3D 牙科 CBCT 公开数据集?
  2. CTooth 与 CTooth+ 的区别是什么?
  3. CTooth 的规模到底是多少,为什么会有不同数字?
  4. CTooth 的标签能做什么、不能做什么?
  5. CTooth 的最佳基准是多少、由谁取得?
  6. CTooth 怎么获取、许可是什么、能不能商用?
  7. CTooth 在牙科数据谱系中的位置,以及它和 ToothFairy 系列的关系。
  8. 使用 CTooth 最容易踩的坑有哪些?

若上述问题你都能回答,说明本条目已被有效吸收。

§1 数据集速览:十问十答

Q1:CTooth 的"22 个 volume / 7363 张切片"从哪来?
来自电子科技大学及其附属医院采集的牙科 CBCT 数据,经标准化处理后由团队整理成 22 个 CBCT 体数据(volumes),共 7363 张断层切片。论文强调所有图像来自同一型号设备并做过标准化处理,以保证一致性与可比性。注意 GitHub 仓库另给"5803 slices / 4243 含标注"口径,综述又并列 5504——三套数字的关系官方未明说(坑 2)。

Q2:成像模态是什么?
CBCT(锥形束计算机断层扫描,Cone Beam Computed Tomography)。CBCT 以锥形 X 束绕患者头部旋转采集,相比传统螺旋 CT 剂量更低、牙颌区域空间分辨率更高,是牙科术前检查的标准模态。CTooth 保留原始三维体素,而非投影成 2D。

Q3:标签是什么类型,有哪些类别?
二值语义分割标签:每个体素被标注为"牙齿(teeth)“或"背景(background)”。没有牙位编号(如 FDI 编号)、不区分牙体/牙根亚结构、不标注龋齿或牙周病理。因此它适合"牙齿体积分割"(semantic segmentation),但不直接支持"逐牙实例分割/牙位识别"(instance segmentation)——这是它与 ToothFairy2 等后续数据集最本质的差距(坑 7)。

Q4:谁标注的,可靠吗?
4 位经验丰富的放射影像解读专家(radiographic interpreters),用 ITK-SNAP 逐体素手工勾画 + 精修。系统综述补充为"四位牙科协会专家,每人约四年经验"。数据集被明确表述为"tooth gold standard",即作为牙齿分割的参考标准。标注质量是 CTooth 的核心卖点之一。

Q5:数据里有什么"难例"?
刻意纳入四类真实变异:(a)缺牙——不是每例都有完整牙列;(b)牙体修复体(充填物、烤瓷冠);(c)种植体(金属高密度影);(d)正畸金属器械(托槽、弓丝),会产生显著的金属伪影(metal artifact),最能考验分割算法的鲁棒性。此外还有不同患者的颌骨尺寸差异。论文的表述是这些变异用于保证"相对均匀的数据采样分布"。

Q6:基准性能是多少?
最佳模型是 3D U-Net + SKNet(Selective Kernel,选择性核)注意力模块,达 Dice 88.04%(0.8804)/ IoU 78.71%(0.7871)。综述另转引 WDSC 95.14%、Sensitivity 94.71%、PPV 82.3%。衍生解读称其在 Dice 上较 DenseVoxelNet 提升超 25%,优于 V-Net 与 3D HighResNet。

Q7:注意力模块到底有没有用?
论文的实验证据支持"有用"这一结论:注意力模块确实提升了牙齿区域的响应,同时抑制了背景与噪声(含金属伪影)的影响。其机制是让网络更聚焦于牙齿结构本身,而非被修复体、器械与背景干扰。SKNet 之所以最优,是因为它的多尺度感受野自适应选择能力,同时适配尺寸差异极大的目标——大磨牙与细窄的牙根/牙间缝隙。

Q8:现在能拿到数据吗?怎么拿?
能,但只能邮件请求制(requisition):先阅读官方仓库里的 Data_requistion.md 协议,再发邮件到 acw499@qmul.ac.uk 申请。官方记录所有申请邮箱,按批次发放下载链接。没有公开直链,wget 或 Kaggle 一键下载都拿不到本体(Kaggle 页只有一个 346KB 的占位图 slogan1.png,见坑 4)。官方称已收到超过 200 份申请。

Q9:CTooth 与 CTooth+ 什么关系?
同源不同版。CTooth(ICIRA 2022)是 22 卷全标注;CTooth+(DALI@MICCAI 2022)保留这 22 卷全标注,追加 146 卷未标注 volume(25876 未标注片),用于探索全监督 + 半监督 + 主动学习。合计 31380 scans。说"CTooth 有 31380 张扫描"是把 CTooth+ 的数字安到了 CTooth 头上(坑 1)。

Q10:为什么它对 AI-Ready(面向 AI 可用)重要?
因为它是牙科三维数据谱系的源头节点,且是一个"高研究价值、中等工程友好度"的样本:金标准质量高、真实变异丰富、有可复现基准,但规模偏小(22 卷)、标签粒度粗(二值)、获取有门槛(请求制)、许可不清(双口径)。它同时也是理解后续 ToothFairy 系列路线的最佳起点。

Q11:CTooth 用的什么标注工具?
ITK-SNAP——一款开源的三维医学图像交互式分割工具,支持轴状/冠状/矢状三视图同步勾画与三维表面预览。4 位放射影像专家用它逐体素标注牙齿掩码。

Q12:CTooth 有患者隐私风险吗?
论文明确患者信息经过编码脱敏(coded for the purpose of protecting privacy)。但患者级数量与人口学分布未披露,这既是隐私保护的体现,也构成元数据的一处留白。

Q13:CTooth 的伦理与资助信息?
论文致谢显示工作受国家自然科学基金(NSFC)资助,Grant No. U20A20386;数据由电子科技大学及其附属医院支持。

§1.1 速查指标卡

指标 / 字段 值 备注
volumes 22 论文主口径
slices(总) 7363 论文主口径;GitHub 5803
slices(全标注) 5504 论文主口径
标注专家 4 放射影像解读专家
标注工时/卷 ≈6h + 1h 校对 CTooth+ 论文口径
Dice(最佳) 88.04% 3D U-Net + SKNet
IoU(最佳) 78.71% 同上
WDSC 95.14% 综述转引
SEN 94.71% 综述转引
PPV 82.3% 综述转引
指标种类 9 项 DSC/WDSC/IoU/SEN/PPV/HD/ASSD/SO/SD
获取 请求制 无公开直链
许可 双口径 CC BY 4.0 / CC BY-NC 4.0

§2 数据构成与规格

2.1 规模、来源与采集

CTooth 的核心构成可概括为"22 卷 + 7363 片 + 5504 全标注",全部为牙科 CBCT:

属性 规格
体数据数量 22 个 CBCT volumes
切片总数 7363 slices(论文口径)
全标注切片 5504 slices
成像模态 CBCT(锥形束 CT)
设备 单一型号,标准化处理
采集机构 电子科技大学及其附属医院
患者信息 编码脱敏(coded for privacy)
标签类型 二值语义掩码(teeth / background)
标注工具 ITK-SNAP
标注人员 4 位放射影像专家

论文对采集的关键表述是"所有 CBCT 图像均来自同一型号设备,并经过标准化处理,以确保数据的一致性和可比性"。这一设计降低了设备引入的分布差异,利于内部一致性与可复现评测,但也意味着跨设备泛化性未经系统验证——真实临床中 CBCT 厂商与成像参数差异显著,直接迁移存在风险(§9.3)。

2.2 数据规格与对齐保证

属性 规格
数据类型 三维体素阵列(CBCT volume)
标签对齐 掩码与体素空间逐体素对齐
标签类别数 2(teeth / background)
标注粒度 体素级(voxel-wise)
数据变异 缺牙 / 修复体 / 种植体 / 正畸器械 / 颌骨尺寸
患者元数据 编码脱敏,患者级数量未单独披露

由于标签是二值的且与体素严格对齐,CTooth 可直接用于训练各类三维分割网络(3D U-Net、V-Net、nnU-Net 等),也可导入 ITK-SNAP、3D Slicer 等工具做可视化复核。

2.3 数据变异的四类难例

CTooth 刻意保留的变异,正是它与"理想牙列"数据集的分水岭:

  1. 缺牙(missing teeth):真实患者常有牙齿缺失,导致牙列不完整。模型若只在完整牙列上训练,遇到缺牙样本易产生假阳性。
  2. 牙体修复体(restorations):充填物、烤瓷冠、桥体等修复结构的密度与天然牙体不同,边界易混淆。
  3. 种植体(implants):钛合金种植体在 CBCT 上呈高密度影,且常伴随伪影,是分割的常见失败点。
  4. 正畸金属器械(appliances / braces):金属托槽与弓丝产生强烈的金属伪影(metal artifact)——条状伪影、暗带与条带会跨越牙齿边界,严重干扰分割。论文明确指出注意力机制有效的原因之一,就是能抑制这类伪影。

论文的表述是:纳入这些变异是为"确保相对均匀的数据采样分布(relative even data sampling distribution)"。含义是让数据集不偏向理想样本,而能覆盖临床中真实遇到的复杂情况。这直接提升了基准的区分度与临床相关性。

2.4 切片数三口径辨析(重要)

CTooth 的切片数存在至少三套公开口径,检索与引用时必须分清:

口径来源 切片总数 含标注数 说明
论文正文(ICIRA 2022) 7363 5504 主口径
GitHub 官方仓库 README 5803 4243 含牙齿标注者
Appl. Sci. 2024 综述 5803 4243 / 5504 并列 同一表格内两行并存

一个合理但未经官方证实的解释是:7363 是包含全部断层(含无牙区、上下颌外区域)的总切片数,5803/4243 可能是经某类筛选(如剔除无牙齿可见层面)后的计数,而 5504 是"被正式标注用于训练/评测"的切片数。官方从未明确解释三者关系,因此本条目以论文正文 7363 / 5504 为主口径,其余数字作存照(坑 2),不做强行统一。

对使用者的实务含义:报告 CTooth 规模时,务必注明口径来源;若你的复现结果与论文数字对不上,先怀疑是不是口径差异而非代码错误。

2.5 与 CTooth+ 的规模对照

CTooth+ 是同一团队在 CTooth 基础上的扩展版(DALI@MICCAI 2022,arXiv:2208.01643),两者关系是"同源、扩量":

项目 CTooth(2022-06) CTooth+(2022-08)
全标注 volumes 22 22(相同)
全标注切片 5504 5504
未标注 volumes — 146
未标注切片 — 25876
合计 scans 7363 slices 31380 scans
学习范式 全监督 全监督 + 半监督 + 主动学习
标注人员 4 位专家 12 位初级牙医(>2 年经验)+ 3 位资深专家(>10 年经验)复核

CTooth+ 的摘要原文:“We establish a 3D dental CBCT dataset CTooth+, with 22 fully annotated volumes and 146 unlabeled volumes… evaluate several state-of-the-art tooth volume segmentation strategies based on fully-supervised learning, semi-supervised learning and active learning, and define the performance principles.”

可见 CTooth+ 不是"更大的 CTooth",而是在保留 22 卷金标准的同时,补入大量未标注数据以支撑半监督/主动学习研究。这一设计思路与后来半监督医学分割的潮流一致。引用"CTooth 规模"时必须指明是哪一版(坑 1)。

2.6 数据集在牙科影像谱系中的位置

把 CTooth 放进牙科影像数据集的谱系,可以看清它的生态位:

数据集 模态 维度 规模 标签粒度 年份
Dental X-ray Image(ISBI) X 光 2D 小 标志点/龋齿 2015
LNDb 全景 X 光 2D 中 牙齿多边形 —
Teeth_dataset X 光 2D 小 龋齿分类 —
CTooth CBCT 3D 22 卷 二值语义 2022
CTooth+ CBCT 3D 22 标注 + 146 未标注 二值语义 2022
ToothFairy2 CBCT 3D 530 例 42 类颌面结构 2024
ToothFairy3 CBCT 3D 更大 多结构 2024-25

从表中可见一条清晰的演进路线:2D 全景 → 3D CBCT(CTooth 首发)→ 更大规模 + 更细粒度(ToothFairy 系列)。CTooth 的历史意义正在于它跨出了"2D 到 3D"这一步。

2.7 数据格式与工程接入提示

CTooth 的数据本体为 CBCT 体数据 + 二值掩码,工程接入时需注意以下实际问题:

  1. 格式:CBCT 体数据通常以 DICOM 序列或 NIfTI(.nii/.nii.gz)封装;掩码与之空间对齐。具体封装格式以申请后拿到的数据为准(官方页未逐条列明)。
  2. 预处理:CBCT 的 HU 值需做窗宽窗位(window level/width)截断,再归一化;各向异性体素通常需重采样到各向同性(如 1mm³),这些步骤直接影响分割性能。
  3. 训练框架:可接入 nnU-Net、MONAI、PyTorch + 自研 3D U-Net 等;官方 benchmark 仓库提供 PyTorch 实现(README 提及 “PyTorch 1.4+ support”)。
  4. 可视化复核:ITK-SNAP、3D Slicer、MITK 均可直接加载体数据与掩码做复核。
  5. 数据划分:论文的 train/val/test 划分需回原文核对;跨划分比较指标会失真。

2.8 为什么"22 卷"仍被认为有价值

单看数字,22 个 volume 在当今数据集尺度下确实很小(ToothFairy2 有 530 例)。但 CTooth 的价值不能用"绝对值"衡量,而要看它的历史坐标与数据质量:

  • 历史坐标:它是该品类第一个公开的 3D 全标注数据集,具有"从无到有"的意义;
  • 数据质量:专家逐体素标注(金标准),且有真实变异覆盖,比"大而糙"的数据更适合做方法论的验证集;
  • 基准价值:它给出了可复现的 attention U-Net 基线,为后续方法提供了对标锚点;
  • 方法论价值:它示范了"金标准 + 变异覆盖 + 配套基准"的数据集设计模板,被后续工作继承。

因此,把 CTooth 定位为"小样本、高质量、方法论样板"比定位为"训练大模型的原料库"更准确。

2.9 数据质量保证机制

CTooth 的质量保证主要依赖"专家 + 精修"两点:

  1. 专家标注:4 位放射影像解读专家,具备牙科解剖知识与影像解读经验;这是"金标准"称谓的来源。
  2. 精修流程:CTooth+ 论文明确"每卷 6 小时标注 + 1 小时检查与精修",说明存在独立的校对环节。

不过,质量保证机制也存在已识别的留白:

  • 未披露标注者间一致性(inter-rater agreement)指标,无法量化专家分歧;
  • 未说明分歧仲裁机制(遇到争议体素如何处理);
  • 未公开标注指南(annotation guideline),复现者无法得知边界判定规则。

这些留白不否定数据质量,但限制了对其"标签噪声"的评估能力(§8.4)。

2.10 常见误解澄清

围绕 CTooth,有几个高频误解值得澄清:

误解 事实
“CTooth 有 31380 张切片” 31380 是 CTooth+ 的合计 scans,CTooth 是 7363
“CTooth 能区分每颗牙” 不能,是二值语义标签(坑 7)
“CTooth 能公开下载” 不能,是邮件请求制(坑 4)
“CTooth 许可明确” 不明确,双口径冲突(坑 3)
“CTooth 就是 ToothFairy” 不是,两个不同团队、不同规模的数据集(坑 6)
“CTooth 用多中心数据” 不是,单一设备采集(§8.3)
“CTooth 的 88.04% 是当前 SOTA” 是 2022 年基线,后续已有更高(§4.6)

2.11 数据集卡(Datasheet 式速览)

按数据集卡片的惯例,把 CTooth 的关键元数据一次性列出,便于检索与引用:

类别 内容
目的 3D 牙齿体积语义分割研究
创建者 Cui Weiwei 等,多机构团队
资助 NSFC U20A20386
年份 2022
数据来源 电子科技大学及其附属医院
实例数 22 volumes
切片数 7363(5504 全标注)
模态 CBCT
标签 二值语义掩码
标注者 4 位放射影像专家
标注工具 ITK-SNAP
已知局限 规模小、单设备、二值标签、请求制、许可双口径
伦理 患者信息编码脱敏
维护 GitHub liangjiubujiu/CTooth

2.12 任务粒度在牙科分割里的三级台阶

牙科三维分割任务按标签粒度可分为三级台阶,CTooth 处在第一级:

台阶 任务 标签 代表数据集 难度
一级 牙齿体积分割(牙齿 vs 背景) 二值 CTooth 基础
二级 颌面多结构分割(牙/骨/神经/窦等) 多类 ToothFairy2(42 类) 进阶
三级 逐牙实例分割 + 牙位识别 实例 + 编号 Multi-center CBCT、ToothFairy2 高阶

为什么台阶划分重要:它直接决定数据集能支撑的临床任务。一级只能回答"这里有牙",二级能回答"这里是上颌窦、这里是下颌神经管"(对手术规划关键),三级能回答"这颗是右上第一磨牙"。CTooth 作为一级台阶的开创者,其历史价值在于"先把最简单的任务做扎实、做公开",为后续台阶奠定基础。

选择建议:若你的任务是"从 CBCT 提取牙列整体轮廓",CTooth 足够;若涉及神经管避让、上颌窦提升、种植位点规划,需选二级数据集;若涉及逐牙移动(正畸),需选三级数据集。

§3 标注流程:四位专家如何造出"金标准"

3.1 标注工具与流程

CTooth 的标注被表述为"gold standard"(金标准),其生产流程如下:

  1. 工具:ITK-SNAP——一款广泛用于医学图像三维分割的开源交互式软件。它支持在三个正交视图(轴状、冠状、矢状)上同步勾画,并实时生成三维表面预览,是牙科/颌面分割常用的标注平台。
  2. 人员:4 位经验丰富的放射影像解读专家(experienced radiographic interpreters)。系统综述进一步描述为"四位牙科协会专家,每人约四年经验"。
  3. 方式:逐体素(voxel-wise)手工勾画牙齿区域的二值掩码。
  4. 精修:标注后进行质检与修整。CTooth+ 论文写明"每个 volume 约 6 小时标注牙齿区域,另约 1 小时检查与精修"。

3.2 标注成本与规模瓶颈

标注成本是理解 CTooth 规模为何只有 22 卷的关键。按每卷 6 小时标注 + 1 小时校对估算,22 卷的纯标注工作量约为 154 人时;而 CTooth+ 论文明确记载,该数据集的采集、标注、复核全流程耗时约 10 个月。

这个成本结构解释了三个现象:

  • 为什么数据集只有 22 卷——逐体素牙科标注无法靠众包廉价扩张;
  • 为什么需要"金标准"定位——高成本必须由高质量来正当化;
  • 为什么 CTooth+ 要引入半监督/主动学习——用少量昂贵标注 + 大量廉价未标注数据,正是降低单位性能成本的现实路径。

3.3 标注质量与观察者间变异

论文把 CTooth 定性为"gold standard",即由专家共识产出的参考标准。但需要清醒认识到,任何人工标注都存在观察者间变异(inter-observer variability)——不同专家在牙根尖端、牙间缝隙、修复体边界等模糊区域可能给出不同判断。CTooth 论文未披露标注者间一致性(inter-rater agreement)的定量指标,这是数据集元数据上的一处留白(§9、坑点)。

对使用者的实务含义:CTooth 的"gold standard"应理解为"专家手工标注的参考",而非"绝对无误的真值"。在细窄牙根、金属伪影区等难例上,模型的"错误"可能恰好落在标注本身的模糊带内。

3.4 与其他牙科数据集标注方式的对比

数据集 标注工具/方式 标注者 粒度 特点
CTooth ITK-SNAP 逐体素 4 位放射专家 体素级二值 金标准,成本高
ToothFairy2 nnU-Net 体系 多专家 42 类体素 多结构,挑战赛
LNDb 多边形标注 放射专家 2D 多边形 全景片
Teeth_dataset 分类标签 — 图像级 龋齿二分类

CTooth 的标注方式(ITK-SNAP 逐体素 + 专家)属于"高成本高质量"一端;相比之下 2D 数据集的标注成本低得多,这也再次说明 3D 数据为何稀缺。

3.5 标注流程的可迁移经验

CTooth 的标注实践,对"如何造一个医学三维数据集"给出了几条可迁移的经验:

  1. 工具即协议:选 ITK-SNAP 这类支持三视图同步 + 三维预览的工具,能显著降低逐体素勾画的认知负担;
  2. 先定标签体系再动手:CTooth 选择了二值语义(简单、可靠),而非复杂的多类/实例标签——这是小团队在有限预算下的理性取舍;
  3. 成本要如实记账:6h 标注 + 1h 校对/卷 的口径,为后续任何"要不要扩量"的决策提供了基准;
  4. 难例要有意识保留:缺牙/修复/种植/正畸器械是"降低指标但提升价值"的样本,刻意纳入是数据集设计的关键判断;
  5. 考虑降本路径:CTooth+ 用未标注数据走半监督,说明团队清楚"纯人工扩量"不可持续。

这几条经验后来被 ToothFairy 系列、多中心 CBCT 数据集以不同形式继承与升级。

3.6 标注工时的经济学

把标注工时摊开算,能更直观理解 CTooth 的规模约束:

项 数值 备注
单卷标注 ≈6 小时 CTooth+ 论文
单卷校对 ≈1 小时 同上
单卷合计 ≈7 小时 —
22 卷合计 ≈154 人时 6+1 口径估算
全流程周期 ≈10 个月 CTooth+ 论文

如果要用纯人工把数据集扩到 ToothFairy2 的 530 例规模,按 7 小时/例估算需约 3710 人时——这解释了为什么"扩量"必须转向半监督(用未标注数据)或众包/分工(多标注者并行)。CTooth+ 的 12 位初级 + 3 位资深复核的组合,正是这种分工的雏形。

§4 论文的方法与主要发现

4.1 研究设计:先给基线,再改架构

CTooth 论文的实验设计分两步走:

第一步——评测 SOTA 基线。论文选取若干当时主流的三维医学分割方法作为对比基线,包括:

  • DenseVoxelNet:基于密集连接(DenseNet 思想)的三维分割网络;
  • V-Net:面向三维体数据的分割网络(Dice 损失起家);
  • 3D HighResNet:高分辨率三维网络。

这些方法在 CTooth 上给出可对标的基线性能。

第二步——构建 3D attention-based U-Net 变体。论文随后系统性地给 3D U-Net 施加不同的注意力模块(attention module),形成一系列变体进行对比。其核心假设是:注意力模块能让网络在牙齿区域"增强响应",同时抑制背景与噪声(含金属伪影)的干扰。

论文的实验证据支持了这一假设:注意力模块确实提升了牙齿区域的响应,并抑制了背景与噪声的影响。这是一个方向明确、可复现的结论,而非泛泛的"我们的方法更好"。

4.2 最佳结果与指标对照

CTooth 上的最佳结果由 3D U-Net + SKNet(Selective Kernel,选择性核)注意力模块取得:

指标 数值 说明
Dice(DSC) 88.04%(0.8804) 核心重叠指标
IoU 78.71%(0.7871) 交并比
WDSC 95.14% 加权 Dice(综述转引)
Sensitivity(SEN) 94.71% 敏感度(综述转引)
PPV 82.3% 阳性预测值(综述转引)

对比结论:attention-based 3D U-Net 框架在该数据集上优于其他 SOTA 方法;衍生解读称其在 Dice 上较 DenseVoxelNet 提升超过 25%,并持续优于 V-Net 与 3D HighResNet。

如何解读这组数字:Dice 88.04% 是"整体重叠"层面的表现;SEN 94.71% 高而 PPV 82.3% 相对低,暗示模型倾向于"多划"(召回高、精确率略低)——在牙齿分割中,这可能与牙根尖端的过分割或伪影区误判有关。使用者在对标时应注意指标组合,而非只看 Dice 一个数。

4.3 SKNet 为何有效:多尺度感受野自适应

SKNet(Selective Kernel Networks,选择性核网络) 的核心是"多尺度感受野自适应选择":

  1. 用不同尺寸的卷积核(不同感受野)并行提取特征;
  2. 通过门控(gating)机制对不同尺度特征加权融合;
  3. 网络从而能自适应地决定"看多大范围"最合适。

放在牙齿分割语境下,其优势在于同时适配尺寸差异极大的目标:

  • 大磨牙:需要大感受野才能捕捉整体;
  • 牙根 / 牙间狭窄缝隙:需要小感受野才能分辨细节、避免粘连。

论文的结论是:3D U-Net 结构中的注意力模块有助于提升牙齿区域的响应,SKNet 变体取得最佳表现。这一"注意力提升牙齿区域响应、抑制背景噪声"的机制性解释,是 CTooth 论文最有价值的发现之一——它不仅解释了性能提升,也指明了牙科分割的难点(背景干扰与伪影)。

4.4 关于"BM-Unet"命名的提示

部分二手解读站(如 lacuna.tiptreesystems.com)把 CTooth 的方法框架描述为 “BM-Unet(Benchmark U-Net)”,并列出一系列架构细节:Residual Encoder Blocks(REB)、Attention Bottleneck、Deep Supervision、Weighted Dice Loss 等。这些细节未在 arXiv 论文摘要与正文中以该命名出现,属于二手转述甚至再创作。

正式引用时请注意:

  • 以 arXiv:2206.08778 / 2208.01643 原文为准;
  • 论文原文的方法核心是"3D attention-based U-Net 变体",最佳为 SKNet 变体;
  • "BM-Unet"及其架构清单的可信度较低,不应作为论文事实引用(坑 5)。

4.5 论文的结论与展望

论文的结论明确:CTooth 为牙齿体积分割任务提供了一个新基准;注意力模块提升了牙齿区域响应;SKNet 变体最佳。展望部分,CTooth+ 论文进一步提出未来工作要"把 CTooth+ 扩展为多机构(multi-organization)数据集,纳入不同 CT 厂商的扫描与更多样化的患者人群",以提升模型泛化性与临床可用性。

这一展望并非空话——它直接预示了后续的多中心 CBCT 数据集与 ToothFairy 系列的诞生,也说明 CTooth 团队对自身规模局限有清醒认识。

4.6 实验结果解读的三个维度

为帮助读者正确使用 CTooth 的基准数字,这里从三个维度做解读:

维度一:绝对水平的定位。Dice 88.04% 在牙齿 CBCT 分割里属于"良好但非极致"——后续方法(如综述提到的 Multi-center CBCT 上 PMFSNet3D 的 Dice 91.30%)已超过这个水平。因此 CTooth 的 88.04% 应被理解为 2022 年的基线,而非上限。

维度二:方法的可迁移性。"注意力模块提升牙齿区域响应、抑制背景与噪声"这一结论具有普适性,可迁移到其他牙科分割任务(如 ToothFairy2 的多结构分割也大量使用注意力/Transformer 结构)。

维度三:指标的互补性。只看 Dice 会遗漏边界问题——SEN 94.71% 与 PPV 82.3% 的差距提示模型存在过分割倾向。复现或对比时应报告完整指标组(九项),而非单一 Dice。

4.7 与同期方法的横向位置

把 CTooth 的基准放进同期(2022 前后)牙科分割方法的大致谱系:

方法族 代表 特点 在 CTooth 上的表现
经典 CNN 分割 DenseVoxelNet、V-Net、3D HighResNet 无注意力 基线,低于 SKNet
注意力增强 U-Net 3D U-Net + 各类 attention 显式引导响应 最佳(SKNet)
后续大模型/Transformer nnU-Net、Transformer 系列 更强表征 论文未评测

CTooth 的贡献在于把"注意力"这一当时的增益点系统化地验证了一遍,给出了"哪种注意力最有效"(SKNet)的实证结论。

4.8 可复现性清单

若要在 CTooth 上复现论文结果,需准备的要素:

要素 状态 说明
数据 需申请 邮件请求制(坑 4)
代码 部分公开 GitHub benchmark 仓库(PyTorch)
预处理 需自行对齐 HU 窗宽窗位、重采样等
划分协议 需回原文核对 train/val/test 划分
SKNet 实现 需自行实现/找实现 论文给出架构思路,具体代码以期仓库为准
评测脚本 官方 benchmark 提供 九项指标
指标定义 论文给出 §5

可复现性风险点:

  1. 请求制导致数据获取有延迟,且不同批次数据的划分可能影响对比;
  2. SKNet 的 3D 实现细节(插入位置、通道数)对结果敏感,需仔细对齐;
  3. 单一设备数据在不同预处理下结果差异显著。

4.9 论文的核心图表速览

CTooth 论文的核心内容可归纳为几张关键表/图(依论文结构):

  1. 数据集构成表:22 volumes / 7363 slices 的规模与变异统计;
  2. 方法对比表:DenseVoxelNet / V-Net / 3D HighResNet vs attention U-Net 变体的指标;
  3. 最佳结果:3D U-Net + SKNet,Dice 88.04% / IoU 78.71%;
  4. 可视化:分割结果与注意力热力图,展示注意力模块对牙齿区域的增强;
  5. 指标定义:九项评测指标的公式与含义。

具体表号与图号以 arXiv:2206.08778 / 2208.01643 原文为准;本条目未逐页核对表号,故不标注图号。

4.10 为什么"注意力"成了牙科分割的标配

CTooth 的发现(注意力提升牙齿区域响应、抑制背景与噪声)之所以重要,是因为它点出了牙科 CBCT 分割的两个核心难题:

  1. 背景干扰:CBCT 视野中包含颌骨、软组织、空气、扫描床等多类结构,牙齿只占其中一小部分——模型必须"聚焦"才能正确分割;
  2. 金属伪影:修复体、种植体、正畸器械造成的条状伪影跨越牙齿边界,是天然的错误源——注意力机制能学会"忽略"这些伪影。

这两个难题在后续所有牙科 CBCT 分割工作中都反复出现,因此"注意力/Transformer"几乎成了牙科分割架构的标配。CTooth 是最早在公开牙科数据集上系统验证这一点的研究之一。这也解释了为什么 CTooth 的方法结论比它的数据规模影响更持久——规模会被后来者超越,方法论洞见不会。

§5 基准与评测指标

5.1 任务定义与评测对象

CTooth 定义的核心任务是 3D 牙齿体积语义分割:给定一个 CBCT 体数据,逐体素预测其属于牙齿(teeth)或背景(background),输出与输入空间对齐的二值掩码。评测对象是各类三维分割方法,从传统 SOTA 基线到 team 自研的 attention-based U-Net 变体。

5.2 评测指标集(九项)

Kaggle 官方页与论文给出完整的评测指标集,覆盖重叠、距离与表面三类:

指标 全称 类别 关注点
DSC Dice Similarity Coefficient 重叠 整体重叠度
WDSC Weighted Dice Similarity Coefficient 重叠 按目标加权的 Dice
IoU Intersection over Union 重叠 交并比
SEN Sensitivity 重叠/分类 召回率(少漏)
PPV Positive Predictive Value 重叠/分类 精确率(少误)
HD Hausdorff Distance 距离 最大边界偏差
ASSD Average Symmetric Surface Distance 距离 平均对称表面距离
SO Surface Overlap 表面 表面重叠率
SD Surface Dice 表面 表面 Dice

这套"重叠 + 距离 + 表面"的三类组合是医学图像分割评测的标准配法:

  • Dice / IoU / WDSC 反映整体体积重叠,对大体目标友好,对薄结构不敏感;
  • SEN / PPV 是一对权衡——高 SEN 低 PPV 意味着模型"宁可多划",反之则"宁可少划";
  • HD / ASSD / SO / SD 对边界与表面敏感,尤其适合评估牙根尖端、牙间缝隙这类薄结构——整体 Dice 很高但牙根尖端错一点,HD 就会显著恶化。

5.3 指标定义出处

指标定义的正式出处即 CTooth 论文(arXiv:2206.08778)。Kaggle 页明确指向该论文:“The definitions of the performance metrics are presented in this paper.”(链接指向 arXiv:2206.08778v1)。这意味着 CTooth 不仅提供数据,也提供了一套标准化的评测协议,是"数据集 + 基准"二合一的设计。

5.4 基准结果的复现要点

若要复现或对标 CTooth 基准,需注意:

  1. 口径:切片数 7363 / 5803 / 5504 的三口径会影响训练/测试划分的表述,务必注明(坑 2)。
  2. 划分协议:论文的 train/val/test 划分细节需回原文核对;不同划分会显著影响指标可比性。
  3. 预处理:CBCT 的 HU 值窗宽窗位、重采样到各向同性等预处理步骤会显著影响结果,须与论文一致。
  4. 注意力模块的具体实现:SKNet 在 3D U-Net 中的插入位置(编码器/解码器/瓶颈)对结果敏感,需回原文或代码库确认。

5.5 九项指标的直觉解读

为帮助非专业读者理解九项指标,这里给出直觉化的解释:

  • Dice(DSC):预测掩码与金标准掩码的重叠度,范围 0-1,1 为完全重合。对"整体大小对不对"敏感,对薄边界不敏感。
  • WDSC:给每颗牙/每个区域按重要性加权的 Dice,避免大目标主导指标。
  • IoU:交集/并集,与 Dice 单调相关(IoU = Dice/(2-Dice)),数值通常低于 Dice。
  • SEN(敏感度):所有真牙体素中被正确识别的比例——高 SEN 意味着"漏得少"。
  • PPV(阳性预测值):所有被判为牙的体素中真是牙的比例——高 PPV 意味着"误划少"。
  • HD(豪斯多夫距离):两组边界点之间的最大距离——对"最坏的那一个点"敏感,牙根尖端错一点就飙升。
  • ASSD:平均对称表面距离——HD 的"平均版",更稳健。
  • SO / SD:表面重叠率 / 表面 Dice——只看表面层,对薄结构友好。

组合读法:CTooth 的 Dice 88.04% 不错,但真正区分方法优劣的往往是 SEN/PPV 权衡与 HD/ASSD。一个 Dice 高但 HD 大的模型,可能在牙根尖端有系统性偏差——这对正畸/种植等需要精细根形态的应用是致命的。

5.6 交叉验证与统计显著性

论文未在本条目成稿时可核的范围内明确披露:

  • 是否做了交叉验证(cross-validation)或多折划分;
  • 报告的指标是单次运行还是多次平均;
  • 方法间差异是否有统计显著性检验。

这些信息影响"88.04% vs 次优方法"这一差距的可靠性。复现或引用时应回原文核对实验协议。这属于 CTooth 论文在实验报告完整性上的一处需注意点。

§6 获取与许可:三层资产的门怎么进

6.1 资产分布与获取渠道

CTooth 系列的资产分布在多个渠道,规则并不统一:

资产 渠道 许可 获取方式
数据集本体 GitHub liangjiubujiu/CTooth CC BY 4.0 邮件请求制
数据集本体 Kaggle weiweicui/ctooth-dataset CC BY-NC 4.0 邮件请求制
基准代码 GitHub benchmark/ 随仓库 公开仓库
论文 arXiv / ICIRA arXiv 默认 / 出版方 公开

6.2 请求制(requisition)完整流程

CTooth 本体没有公开直链,必须走申请,流程如下:

  1. 阅读协议:官方仓库中的 Data_requistion.md(数据申请协议),了解使用条款与引用要求;
  2. 发送邮件:邮件至 acw499@qmul.ac.uk(QMUL 的申请邮箱)请求访问权限;
  3. 等待发放:官方记录所有申请邮箱,按批次发放下载链接;官方称已收到超过 200 份申请;
  4. 合规引用:使用数据须同时引用 CTooth(ICIRA 2022)与 CTooth+(DALI@MICCAI 2022)两篇论文。

请求制的优点:可控分发、合规追踪、使用者可被联系。
请求制的缺点:无法在自动化流水线中直接拉取;复现门槛偏高;数据可用性依赖作者响应。

6.3 许可双口径冲突(必须存照)

同一数据集在官方两处标注了不一致的许可:

  • GitHub README 原文:“This work is licensed under a Creative Commons Attribution 4.0 International License”(CC BY 4.0,允许商用,仅需署名)。
  • Kaggle CTooth+ 页 License 栏:“Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)”(CC BY-NC 4.0,禁止商用)。

两者的差别直接决定能否商用:CC BY 4.0 可以商用(署名即可),CC BY-NC 4.0 禁止商用。同团队两处口径矛盾,本条目不做裁定,仅并列存照(坑 3)。 任何商用前的合规判断,都应与作者书面确认;学术使用则受"引用两篇论文"这一共同要求约束。

6.4 数据使用协议要点

Kaggle 页的 Data Usage Agreement 明确:“You are free to use and/or refer to the CTooth+ dataset in your own research, provided that you always cite the following manuscripts”——即使用与引用自由的前提是必须引用两篇论文:

  1. Cui, Weiwei et al. “CTooth: A Fully Annotated 3D Dataset and Benchmark…” ICIRA (2022).
  2. Cui, Weiwei et al. “CTooth+: A Large-scale Dental Cone Beam Computed Tomography Dataset and Benchmark…” DALI@MICCAI (2022).

注意:协议用"research"界定用途,未明确展开商用与再分发条款——这正是双口径冲突的根源。

6.5 版本链

CTooth(2022-06,ICIRA,arXiv:2206.08778)
   22 volumes / 7363 slices(5504 全标注)
        │
        ├──► CTooth+(2022-08,DALI@MICCAI,arXiv:2208.01643)
        │      22 全标注 volumes(5504 片)+ 146 未标注 volumes(25876 片)
        │
        └──► MICCAI 2023 STS-3D 挑战赛数据集(2023)
               CTooth 被挑战赛采用,用于 STS-3D 任务

6.6 对工程落地的提示

  • 不要写脚本硬拉 Kaggle/GitHub——本体不在那里,只有占位图与说明文件(坑 4);
  • 要预留申请周期——请求制发放有响应延迟,实验排期需提前;
  • 要做许可尽调——商用场景必须先解决 CC BY 4.0 vs CC BY-NC 4.0 的冲突(坑 3);
  • 要保留引用——衍生工作必须同时引用 CTooth 与 CTooth+ 两篇。

6.7 许可选择决策树

面对"我能不能用 CTooth"这个问题,可按以下决策树判断:

  1. 学术研究用途? → 可以。走请求制申请,使用后引用两篇论文。
  2. 要发表论文? → 可以(学术范畴),引用两篇论文;论文中报告规模时注明口径(坑 2)。
  3. 要商用(产品或商业服务)? → 不确定。GitHub 标 CC BY 4.0 允许,Kaggle 标 CC BY-NC 4.0 禁止。必须先与作者书面确认,切勿单凭 GitHub 标注行事。
  4. 要再分发数据本体或衍生数据? → 不确定。请求制协议未明确再分发条款,需与作者确认(坑 3)。
  5. 只是引用其结论/指标? → 可以,按学术引用规范即可。

6.8 与其他"请求制"数据集的共性

CTooth 的请求制模式并非孤例——许多医学数据集(尤其是涉及患者影像、需合规追踪的)都采用类似机制。其共性优劣如下:

方面 请求制表现
合规追踪 优(记录申请者)
复现门槛 高(不可自动化)
分发可控性 优
长期可用性 依赖作者维护
自动化流水线 不友好

CTooth 的特别之处在于:它是许可双口径 + 请求制的叠加,使得"可用性判断"比一般的请求制数据集更复杂(§6.3)。

6.9 获取流程的时间预期

对需要排期实验的团队,获取 CTooth 的时间线大致如下:

步骤 动作 预期耗时
1 阅读 Data_requistion.md 协议 数分钟
2 起草并发送申请邮件 数分钟
3 等待作者审核与批次发放 数天至数周(不确定)
4 接收下载链接并下载 视带宽而定
5 核对数据完整性 数小时

关键提示:步骤 3 的等待时间不可控,且官方是"按批次发放"。因此务必在项目开始前尽早申请,不要等到实验阶段才发现数据没到手。

§7 生态与影响:一条牙科三维数据谱系的起点

7.1 CTooth 在谱系中的位置

CTooth 的最大影响不在于它自身的规模,而在于它开启了"3D 牙科 CBCT 公开数据集"这一品类。在它之前是 2D 全景片的天下,在它之后是 ToothFairy 系列、多中心 CBCT 数据集、3DTeethSeg/3DTeethLand 等一条数据与挑战赛并进的路线。

7.2 直接衍生物

  • CTooth+(DALI@MICCAI 2022):同团队扩展版,追加 146 卷未标注数据,引入半监督与主动学习评测。
  • MICCAI 2023 STS-3D 挑战赛:CTooth 被挑战赛采用,作为 STS-3D 任务的数据集。官方更新记录显示 2023-03 挑战赛接收、2023-05 收到 200+ 申请、2023-11 追加经典方法 benchmark。

7.3 库内可互链条目(含 record_id)

条目 record_id 关系
toothfairy2 649 MICCAI 2024 牙科 CBCT 42 类颌面多结构分割,530 例;同域最直接互链
toothfairy3 673 ToothFairy 后续挑战赛,牙科 CBCT 分割谱系延续
fdtooth 609 芬兰 Findata 全景牙片(2D)数据集,口腔影像邻域
dentex — 牙科全景 X 光多任务(2D)
lndb / LNDb — 牙科全景 X 光 landmark(2D),CTooth 论文综述的 2D 前作
3dteethland — 3D 牙齿标志点检测(口内扫描 mesh),第三种模态
c3vd — 结肠镜视频,仅命名相近,无实质关系

7.4 互链逻辑

若要做"牙科影像数据全景"导航,CTooth 应作为 3D CBCT 分支的起点节点:

  • 向 ToothFairy2 / ToothFairy3(更细粒度、更大规模的 CBCT 挑战赛)——纵向"规模与粒度升级"互链;
  • 向 LNDb / dentex(2D 全景 X 光)——横向"模态代际"互链;
  • 向 3DTeethLand(口内扫描 3D mesh)——横向"模态扩展"互链;
  • 与 fdtooth(芬兰全景片)——"口腔影像数据源"互链。

7.5 方法论影响

CTooth 的"金标准 + 真实变异 + 配套基准"三件套,为后续牙科数据集确立了一个模板:数据要覆盖难例、要有专家标注、要给出可复现的评测协议。ToothFairy2 的 42 类精细标注、多中心 CBCT 的跨机构设计,都可视为这一模板的升级与泛化。CTooth 自己也通过 CTooth+ 演示了"用未标注数据降低标注成本"的半监督路线。

7.6 时间线全景

时间 事件
2022-06-17 CTooth 论文投至 arXiv(arXiv:2206.08778)
2022-07 论文被 ICIRA 2022 接收;官方预告将发布数据集
2022-08 CTooth+ 论文投至 arXiv(arXiv:2208.01643),被 DALI@MICCAI 2022 接收
2022-10 Kaggle CTooth+ 页上线
2023-03 CTooth 被 MICCAI 2023 挑战赛接收(STS-3D 任务)
2023-05 官方称收到超过 200 份数据申请
2023-11 官方追加经典医学分割方法 benchmark
2024 牙科 CBCT 分割系统综述(Appl. Sci. 2024)转引 CTooth 指标
2025 牙科 AI 分割综述(Springer 2025)将 CTooth 列为 3D 开源头

7.7 谁在用 CTooth

从公开文献看,CTooth 被以下类型的研究使用:

  • 三维分割方法研究:以 CTooth 为基准验证新架构(注意力、Transformer、nnU-Net 变体等);
  • 半监督/主动学习研究:以 CTooth+ 的"少量标注 + 大量未标注"设定做方法验证;
  • 牙科 AI 综述:作为 3D 牙科数据集的代表性条目被引用(Appl. Sci. 2024、Springer 2025);
  • 医学分割基准构建:作为"小而精"的难例基准使用。

7.8 生态位小结

一句话概括 CTooth 的生态位:它是牙科三维影像从"2D 时代"跨入"3D 时代"的第一块公开基石。论规模它不及后来者,论细分它不及 ToothFairy2,但论"从 0 到 1"的开创性,它是这条谱系上绕不开的起点节点。

7.9 数据集演进的"三部曲"模式

CTooth 的成长轨迹展示了一条医学数据集演进的常见"三部曲":

  1. 第一部·开创:识别领域空白,采集 + 专家标注,发布首个公开数据集并给出基准(CTooth 2022-06);
  2. 第二部·扩量:规模不足 → 追加数据、引入半监督/主动学习降低标注成本(CTooth+ 2022-08);
  3. 第三部·赛事化:接入挑战赛,吸引社区参与、形成 leaderboard 与持续迭代(MICCAI 2023 STS-3D)。

这条三部曲模式后来被许多医学数据集复用(如 PANDA → PANDA-PLUS、BraTS 系列等)。理解它,就能预判一个数据集未来可能往哪走——规模扩张、粒度细化、赛事化、多中心化几乎是必然方向。

7.10 对数据集建设者的启示

从 CTooth 的演进中,可以提炼出几条面向"想自己建数据集"的启示:

  1. 首个公开往往比最大规模更重要:CTooth 数据量不大,但因为是领域首个公开 3D 数据集,获得了持久的引用与生态地位;
  2. 难例是价值锚点:缺牙/修复/种植/正畸器械这些"降低指标"的样本,恰恰是数据集临床相关性的来源;
  3. 配套基准能显著放大影响力:只发数据不如"发数据 + 给基线",后者让社区能直接对标;
  4. 降本要趁早规划:规模扩张的成本会迅速失控,半监督/主动学习/多人分工是必由之路;
  5. 治理要先行:许可口径、元数据完整度、获取流程,若不在发布时想清楚,后期补救成本极高(CTooth 的许可双口径就是教训)。

§8 局限、风险与注意事项

8.1 规模局限:22 卷对深度学习偏小

22 个 volume 对训练深度三维分割网络仍显偏小。这是 CTooth 最被公认的短板。论文与 CTooth+ 都承认这一不足——CTooth+ 在结论中明确提出未来工作要"把 CTooth+ 扩展为多机构(multi-organization)数据集,纳入不同 CT 厂商的扫描与更多样化的患者人群",以提升泛化性与临床可用性。这一自我认知直接催生了后续的多中心 CBCT 数据集与 ToothFairy 系列。

风险的实务含义:在 CTooth 上训练或评测的模型,其性能数字不能直接外推到更大、更多样的临床数据;跨中心使用时须重新验证。

8.2 标签粒度局限:二值语义,无牙位

CTooth 的标签是二值语义(teeth vs background),不区分牙位。这意味着它不能直接用于需要"第几号牙"输出的临床应用,例如:

  • 逐牙正畸规划(需要知道移动的是哪颗牙);
  • 牙位识别(自动编号);
  • 逐牙面积/体积测量。

需要这类能力的任务应改用提供逐牙独立标签的数据集(如 ToothFairy2、Multi-center CBCT)。这是 CTooth 与其后续数据集之间最本质的能力差距(坑 7)。

8.3 泛化性局限:单一设备采集

CTooth 采集自单一型号 CBCT 设备并做了标准化处理。这带来内部一致性与可复现性的好处,代价是跨设备、跨中心泛化性未经系统验证。真实临床中 CBCT 厂商(NewTom、i-CAT、Planmeca 等)与成像参数差异显著,金属伪影的表现也因设备而异,直接迁移存在风险。

8.4 标注一致性元数据缺失

CTooth 论文**未披露标注者间一致性(inter-rater agreement)**的定量指标。虽然数据被表述为"gold standard",但哪个区域最易分歧、专家间分歧有多大,缺乏可查数据。这影响使用者对"标签噪声"的评估,也削弱了对高 SEP/低 PPV 等指标的解释力。

8.5 获取与合规风险

请求制 + 许可双口径,带来三重成本:

  • 工程成本:无法自动化拉取,CI/流水线需人工介入;
  • 合规成本:商用边界不清(CC BY 4.0 vs CC BY-NC 4.0),需书面确认;
  • 分发成本:再分发衍生数据需回到与作者的约定。

8.6 元数据与口径漂移风险

切片数三口径(7363 / 5803 / 5504)、工时口径(6h+1h vs 7h)等存在多处漂移,官方未系统澄清。自动化抓取与引用需指定口径,否则易出错(坑 2、坑 5)。

8.7 风险分级汇总

风险 等级 受影响人群 缓解方式
规模小、泛化弱 中 训练大模型者 仅作验证/微调,勿作主训练集
标签粒度粗 中 需逐牙识别的应用 改用逐牙标签数据集
单设备采集 中 跨中心部署者 跨中心重新验证
请求制获取 中 自动化流水线 提前申请,人工介入
许可双口径 高 商用者 书面确认授权
口径漂移 低 引用者 注明口径来源

8.8 与其他小规模医学数据集的共性风险

CTooth 的局限并非独有——许多"领域首个公开小数据集"都面临相似处境:

共性风险 CTooth 的具体表现
规模小 → 泛化有限 22 卷,单设备
获取受限 → 复现难 请求制
治理粗糙 → 许可模糊 双口径
元数据不全 → 难以评估偏倚 未披露标注者一致性
快速被超越 → 需持续更新 被 ToothFairy 系列在规模上超越

给使用者的心态提示:把 CTooth 当作"起点基准"而非"终局数据源",能最大程度发挥它的价值、回避它的短板。它的定位是"验证方法论的最小可用集",而非"训练生产模型的原料库"。

§9 与库内条目的关系(及存照)

9.1 库内关系图谱

CTooth 在千方病案医数集内处于"牙科 3D CBCT 起点"位置,建议互链条目:

条目 rid 互链理由 相关度
toothfairy2 649 同域(牙科 CBCT 3D 分割),更大规模更细粒度 高
toothfairy3 673 同系列后续挑战赛 高
fdtooth 609 口腔影像(全景片 2D) 中
dentex — 牙科全景 X 光多任务 中
lndb / LNDb — 牙科全景 X 光 landmark(论文综述前作) 中
3dteethland — 3D 牙齿(口内扫描模态) 中

9.1.1 互链优先级建议

若互链算法按标签相关度排序,CTooth 的库内互链应遵循以下优先级:

  1. 第一优先(同域 + 同模态 + 同任务):toothfairy2(649)——牙科 CBCT 3D 分割,最直接;
  2. 第二优先(同系列):toothfairy3(673)——谱系延续;
  3. 第三优先(同域 + 异模态):3dteethland(口内扫描)、dentex(2D 全景)、lndb(2D 全景);
  4. 第四优先(同域 + 异数据源):fdtooth(609)——口腔影像数据源。

标签层面:CTooth 与 toothfairy2 的 category_tags 高度重叠(医学影像 / CT / 医学图像分割),互链相关度最高,应作为首选互链目标。

9.2 双口径存照清单

本条目在成稿过程中识别出以下双口径/多口径冲突,逐条存照:

  1. 切片数三口径:论文 7363 slices vs GitHub 5803 slices(4243 含标注)vs 综述 5504 annotated images。本条目以论文 7363 / 5504 为主口径,其余存照(§2.4、坑 2)。
  2. 许可双口径:GitHub CC BY 4.0(可商用)vs Kaggle CC BY-NC 4.0(禁商用)。本条目并列存照、不裁定(§6.3、坑 3)。
  3. 标注工时双口径:CTooth+ 论文"6 小时标注 + 1 小时校对" vs 二手解读站"约 7 小时/卷"。本条目以论文口径为准(§3.1、坑 5)。
  4. 方法命名口径:论文"3D attention-based U-Net 变体(SKNet 最佳)" vs 二手解读"BM-Unet"及其架构清单。本条目以论文为准,二手命名仅作提示(§4.4、坑 5)。

9.3 遗留疑点

  1. CTooth 与 CTooth+ 是否共用同一 22 卷:几乎可以确定是(CTooth+ 是在 CTooth 基础上增补 146 未标注卷),但官方未逐字声明;实测需邮件申请,本轮无法直接镜像校验。
  2. Zenodo 是否有 CTooth 独立条目:本轮三源搜索未见 Zenodo 条目;官方渠道为 GitHub + Kaggle + 邮件请求三者。
  3. MICCAI 2023 STS-3D 与原始 22 卷的关系:挑战赛所用数据与原始 CTooth 22 卷是否为同一批、是否含子集,官方页未明确,勿自行推断(坑 8)。
  4. 标注者间一致性指标:论文未披露,属元数据留白。
  5. 患者级数量:论文只给"22 个 volume",未单独披露患者数(可能与 volume 一一对应,也可能不是),患者级统计缺失。

9.4 引用规范建议

引用 CTooth 时建议遵循以下规范:

  1. 规模必注口径:写"22 volumes / 7363 slices(论文口径)"或明确标注用哪一版、哪一口径;
  2. 区分版本:学术引用优先引 CTooth(ICIRA 2022);若涉及半监督/主动学习或未标注数据,须引 CTooth+(DALI@MICCAI 2022);
  3. 许可标注来源:报告许可时注明"GitHub CC BY 4.0 / Kaggle CC BY-NC 4.0",不擅自合并;
  4. 指标回原文:模型架构与 Dice/IoU 以 arXiv:2206.08778 为准,不引二手解读站;
  5. 双论文引用:使用数据本体时,按协议同时引用两篇论文。

§10 避坑清单:八个已踩过的坑

坑 1:CTooth 与 CTooth+ 是两个版本,别混引用。 CTooth(ICIRA 2022,22 卷,7363 片)与 CTooth+(DALI@MICCAI 2022,22 全标注卷 + 146 未标注卷,合计 31380 scans)是同源不同版。说"CTooth 有 31380 张扫描"是把 CTooth+ 的合计数字安到了 CTooth 头上。引用规模前先确认版本。

坑 2:切片数是三口径(7363 vs 5803 vs 5504)。 论文正文写 7363 slices;GitHub README 写 5803 slices(4243 含牙齿标注);综述并列 5504 annotated images。三个数字常被混用,官方从未解释关系。本条目以论文 7363 / 5504 为主口径,报告时务必注明口径来源。

坑 3:许可双口径(CC BY 4.0 vs CC BY-NC 4.0)。 GitHub 标 CC BY 4.0(可商用),Kaggle 标 CC BY-NC 4.0(禁商用)。同团队两处口径矛盾,直接影响商用合规判断。切勿一揽子引用,务必注明出处并建议与作者书面确认。

坑 4:数据是请求制,没有公开直链。 别指望 wget 或 Kaggle 一键下载——Kaggle 页只有一个 346KB 的 slogan1.png 占位图,真正的数据要邮件 acw499@qmul.ac.uk 申请(先读 Data_requistion.md)。自动化脚本若硬拉 Kaggle 会只得占位图。

坑 5:二手解读站的细节不可尽信。 部分聚合站(如 lacuna.tiptreesystems.com)给出"BM-Unet"“Sensitivity 94.71%”“每卷 7 小时”"5504 全标注"等细节,其中"BM-Unet"等命名与论文措辞有出入,工时口径(6h+1h vs 7h)也不一致。引用模型架构与指标请回到 arXiv:2206.08778 / 2208.01643 原文。

坑 6:CTooth 不是 ToothFairy。 二者都做牙科 CBCT 分割,但 CTooth 是 2022 年 22 卷的二值分割数据集(HDU/QMUL 团队),ToothFairy2 是 2024 年 530 例、42 类颌面多结构分割挑战赛(Unimore/Radboud 团队)。名称、规模、任务、团队、许可全不同,切勿因都带"tooth"而混为一条。

坑 7:CTooth 不做逐牙实例分割。 标签是二值语义(teeth vs background),没有牙位编号。需要"每颗牙单独一个标签"的任务(如 ToothFairy2、Multi-center CBCT)不能拿 CTooth 顶替。

坑 8:MICCAI 2023 STS-3D 与原始 22 卷的关系未公开明确。 CTooth 被 MICCAI 2023 挑战赛采用做 STS-3D 任务,但挑战赛所用数据与原始 CTooth 22 卷是否为同一批、是否含子集,官方页未明确说明,引用时勿自行推断。

§10.1 坑点速查表

坑 一句话 关键词
坑 1 CTooth ≠ CTooth+,版本别混 版本
坑 2 切片数三口径 7363/5803/5504 口径
坑 3 许可 CC BY 4.0 vs CC BY-NC 4.0 许可
坑 4 请求制,无公开直链 获取
坑 5 二手站 BM-Unet 等不可尽信 来源
坑 6 CTooth ≠ ToothFairy 同名
坑 7 二值标签,无牙位 粒度
坑 8 STS-3D 与 22 卷关系未明 推断

§10.2 一句话防御策略

  • 引用规模前:先问版本,再问口径;
  • 商用前:先拿书面许可,别看 GitHub 标签就动手;
  • 下数据前:先发邮件,别写自动化脚本;
  • 引架构前:先查 arXiv 原文,别抄二手站;
  • 选数据集前:先确认任务是"分割"还是"逐牙识别"。

§11 总结

CTooth 是 3D 牙科 CBCT 牙齿分割的开创性公开数据集。它用 22 个 CBCT 体数据、7363 张切片、5504 张由 4 位放射影像专家逐体素标注的"金标准"掩码,第一次把牙科数据从 2D 全景片推进到可支撑三维深度学习体素分割的 3D CBCT;它用覆盖缺牙、修复体、种植体、正畸器械等真实变异的设计,让基准贴近临床;它用 3D attention-based U-Net 的系统评测(最佳 SKNet,Dice 88.04% / IoU 78.71%),给出了可复现的性能基线。

它的主要短板也很清楚:规模偏小(22 卷)、标签粒度粗(二值、无牙位)、采集单一设备(跨设备泛化未验证)、获取有门槛(邮件请求制)、许可不清(CC BY 4.0 vs CC BY-NC 4.0 双口径)。这些短板正是同团队发布 CTooth+、并催生 MICCAI 2023 STS-3D 挑战赛与 ToothFairy 系列的直接动因。

在千方病案医数集的知识图谱中,CTooth 应作为牙科三维影像数据谱系的源头节点,向 ToothFairy2(rid 649)、ToothFairy3(rid 673)、fdtooth(rid 609)、LNDb、dentex、3DTeethLand 等条目互链。

不同读者的行动建议:

你的目标 建议路径
下数据做牙齿分割研究 直奔 §6,邮件申请(坑 4);注意许可冲突(坑 3)
复现/对标 SKNet 基准 直奔 §4、§5;指标定义以 arXiv:2206.08778 为准
选数据集做逐牙识别 CTooth 不合适(二值标签),改看 ToothFairy2(坑 7)
做数据集综述 §2.6 谱系表 + §4 基准结果可直接引用
评估工程可用性 读 §8 局限 + §6 获取;注意请求制与许可风险

附录 A:常见问答(补遗)

Q1:CTooth 到底有多少数据?
论文主口径为 22 个 CBCT 体数据、共 7363 张切片,其中 5504 张全标注(详见 §2.4 与坑 2 的三口径辨析)。

Q2:怎么下载 CTooth?
邮件请求制。先读官方 Data_requistion.md,再发邮件到 acw499@qmul.ac.uk 申请。无公开直链(见坑 4)。

Q3:CTooth 能直接商用吗?
不明确。GitHub 标 CC BY 4.0(可商用),Kaggle 标 CC BY-NC 4.0(禁商用),两处矛盾(见坑 3)。商用前须与作者书面确认。

Q4:CTooth 的标签能区分牙位吗?
不能。二值语义标签,只区分牙齿/背景(见坑 7)。

Q5:CTooth 和 CTooth+ 是什么关系?
同团队,CTooth+ 是扩展版:保留 22 卷全标注,追加 146 卷未标注(见 §2.5 与坑 1)。

Q6:CTooth 最好的分割性能是多少?
3D U-Net + SKNet 注意力模块,Dice 88.04%、IoU 78.71%(见 §4.2)。

Q7:CTooth 用的什么设备?
单一型号 CBCT,标准化处理;跨设备泛化未验证(见 §8.3)。

Q8:CTooth 支持哪些任务?
3D 牙齿体积语义分割(二值);不支持逐牙实例分割、牙位识别(见 §2.1、坑 7)。

附录 B:DAIMS 评估全表

DAIMS 是面向"面向机器的数据可用性"(Data Availability for Intelligent Machine Systems)的五维评估框架,分别考察数据集的可发现性、可获取性、可互操作性、元数据质量与可持续性。下表给出 CTooth 的逐维评估:

维度 英文 评级 说明
可发现性 Discoverability 中高 有明确论文(ICIRA 2022 / arXiv)、GitHub 官方仓库、Kaggle 页三处入口;但无独立官网,检索依赖论文与仓库名
可获取性 Accessibility 中低 邮件请求制,无公开直链;需阅读协议并申请,自动化拉取不可行;官方称已收到 200+ 申请
可互操作性 Interoperability 中 提供 CBCT 体数据 + 二值掩码,标准医学影像格式;可进入 nnU-Net / ITK-SNAP 等生态;但标签无标准化牙位编码(如 FDI 编号)
元数据 Metadata 中 论文给出规模、标注流程、指标定义较完整;但切片数存在多口径、许可标注矛盾、患者级元数据未披露
可持续性 Sustainability 中 GitHub 仓库持续维护(更新至 2023-11);有 2023 MICCAI 挑战赛与 CTooth+ 后续;但请求制发放与许可双口径带来长期合规不确定性
许可清晰度 License Clarity 低 核心风险:GitHub CC BY 4.0 与 Kaggle CC BY-NC 4.0 直接冲突(见坑 3)
AI-Ready 综合 — 中 金标准质量高、真实变异丰富、有基准;但规模小、无直链、标签粒度粗、许可不清,属"高研究价值、中等工程友好度"

附录 C:来源清单

C.1 一手来源(论文 / 官方仓库 / 官方页)

  1. 主论文:Cui W., Wang Y., Zhang Q., Zhou H., Song D., Zuo X., Jia G., Zeng L. CTooth: A Fully Annotated 3D Dataset and Benchmark for Tooth Volume Segmentation on Cone Beam Computed Tomography Images. ICIRA 2022. arXiv:2206.08778. https://arxiv.org/abs/2206.08778 (DOI: 10.48550/arXiv.2206.08778;Submitted 2022-06-17)
  2. 扩展论文:Cui W. et al. CTooth+: A Large-scale Dental Cone Beam Computed Tomography Dataset and Benchmark for Tooth Volume Segmentation. DALI@MICCAI 2022. arXiv:2208.01643. https://arxiv.org/abs/2208.01643
  3. 官方 GitHub 仓库:https://github.com/liangjiubujiu/CTooth (含 README、Data_requistion.md、benchmark/;镜像名 UCTooth-dataset)
  4. 官方 Kaggle 页:https://www.kaggle.com/datasets/weiweicui/ctooth-dataset (标题 CTooth+ dataset,含 License 与 Data Usage Agreement)

C.2 二手来源(综述 / 聚合,仅作背景)

  1. 系统综述:The Application of Artificial Intelligence for Tooth Segmentation in CBCT Images: A Systematic Review. Appl. Sci. 2024, 14, 6298.(转引 CTooth 指标与规模双口径)
  2. 系统综述:A review of tooth AI segmentation on medical data. Springer, 2025. https://link.springer.com/article/10.1007/s44352-025-00021-2
  3. 二手解读/聚合:figshare(作者预印本 PDF)、lacuna.tiptreesystems.com、selectdataset.com(细节需回原文核对,见坑 5)。

C.3 引用格式(BibTeX,官方给出)

@inproceedings{Cui2022CToothAF,
  title={CTooth: A Fully Annotated 3D Dataset and Benchmark for Tooth Volume Segmentation on Cone Beam Computed Tomography Images},
  author={Weiwei Cui and Yaqi Wang and Qianni Zhang and Huiyu Zhou and Dansheg Song and Xingyong Zuo and Gangyong Jia and Liaoyuan Zeng},
  booktitle={ICIRA},
  year={2022}
}

@inproceedings{Cui2022CToothAL,
  title={CTooth+: A Large-scale Dental Cone Beam Computed Tomography Dataset and Benchmark for Tooth Volume Segmentation},
  author={Weiwei Cui and Yaqi Wang and Yilong Li and Dansheg Song and Xingyong Zuo and Jiaojiao Wang and Yifan Zhang and Huiyu Zhou and Bun San Chong and Liaoyuan Zeng and Qianni Zhang},
  booktitle={DALI@MICCAI},
  year={2022}
}

附录 D:术语表

中文 英文 说明
锥形束 CT CBCT, Cone Beam Computed Tomography 牙科常用三维成像模态,低剂量高分辨
牙齿体积分割 Tooth Volume Segmentation 逐体素判定牙齿/背景的三维分割任务
金标准 Gold Standard 由专家人工标注的参考掩码
语义分割 Semantic Segmentation 只分"是不是牙齿",不区分个体
实例分割 Instance Segmentation 区分每一颗独立牙齿,CTooth 不提供
金属伪影 Metal Artifact 金属修复体/正畸器械在 CT 上造成的成像干扰
体素 Voxel 三维像素,体积最小单元
Dice 相似系数 DSC, Dice Similarity Coefficient 重叠度指标,越高越好
交并比 IoU, Intersection over Union 重叠度指标
敏感度 SEN, Sensitivity 召回率,衡量少漏
阳性预测值 PPV, Positive Predictive Value 精确率,衡量少误
豪斯多夫距离 HD, Hausdorff Distance 边界误差指标
选择性核 SKNet, Selective Kernel Network 多尺度感受野自适应选择的注意力模块
请求制 Requisition 邮件申请后发放数据的获取方式
DAIMS Data Availability for Intelligent Machine Systems 面向机器可用性的五维评估框架
半监督学习 Semi-supervised Learning 用少量标注 + 大量未标注训练(CTooth+ 引入)
主动学习 Active Learning 迭代挑选最有价值样本标注(CTooth+ 引入)

附录 E:库内牙科影像条目横向对比

条目 rid 模态 维度 规模 标签粒度 许可 获取
ctooth(本条) — CBCT 3D 22 卷 二值语义 双口径 请求制
toothfairy2 649 CBCT 3D 530 例 42 类颌面 CC BY-SA 注册制
toothfairy3 673 CBCT 3D 更大 多结构 — 注册制
fdtooth 609 全景 X 光 2D — — — —
3dteethland — 口内扫描 3D mesh 340 例 标志点 分层 Synapse
lndb — 全景 X 光 2D — landmark — —
dentex — 全景 X 光 2D — 多任务 — —

(“rid"为千方病案医数集数据库中的 record_id;”—"表示本条目成稿时未逐一核证。)

附录 E.1 CTooth 与 ToothFairy2 的逐项对比

鉴于二者最易混淆,这里做一次逐项对照:

维度 CTooth ToothFairy2
发布年份 2022 2024
团队 HDU / QMUL 等 Unimore / Radboud UMC
规模 22 例 530 例
标签粒度 二值语义 42 类颌面结构
任务 牙齿体积分割 颌面多结构分割
参赛/挑战赛 MICCAI 2023 STS-3D MICCAI 2024 ToothFairy2
格式 体数据 + 二值掩码 mha / HU / 0.3mm 等向
许可 双口径 CC BY-SA
获取 邮件请求制 注册制
排名方式 Dice/IoU 等 mean rank(DSC+HD95,84 ranks)
冠军方法 3D U-Net + SKNet nnU-Net ResEnc L

结论:二者都做牙科 CBCT 分割,但 CTooth 是"起点",ToothFairy2 是"升级"——理解这条升级线,就能理解牙科三维分割数据集这十年的演进方向:从"有没有"到"够不够大"再到"够不够细"。

附录 F:CTooth 关键数字一页纸

数字 含义 口径
22 CBCT 体数据数量 论文
7363 切片总数 论文主口径
5803 / 4243 切片总数 / 含牙齿标注 GitHub 口径
5504 全标注切片 论文 / CTooth+
146 CTooth+ 追加未标注体数据 CTooth+ 论文
25876 CTooth+ 未标注切片 CTooth+ 论文
31380 CTooth+ 合计 scans CTooth+ 论文
4 标注专家数 论文
≈6 + 1 单卷标注 + 校对小 CTooth+ 论文
≈10 采集标注复核总月数 CTooth+ 论文
88.04% 最佳 Dice 论文
78.71% 最佳 IoU 论文
95.14% WDSC 综述转引
94.71% Sensitivity 综述转引
82.3% PPV 综述转引
9 评测指标种类 Kaggle / 论文
200+ 数据申请数 官方 GitHub
2022 发布年份 论文
2023 MICCAI STS-3D 挑战赛年份 官方

条目小结:CTooth 是 3D 牙科 CBCT 牙齿分割的开创性公开数据集,以 22 卷、7363 张切片、5504 张专家逐体素标注的金标准、真实临床变异覆盖与 SKNet 3D U-Net 基准(Dice 88.04%)确立了其历史地位。它的主要短板是规模偏小、标签粒度粗(二值)、请求制获取与许可双口径;这些短板也正是同团队后续发布 CTooth+、并催生 MICCAI 2023 STS-3D 挑战赛与 ToothFairy 系列的直接动因。在千方病案医数集的知识图谱中,CTooth 应作为牙科三维影像数据谱系的源头节点,向 ToothFairy2(rid 649)、ToothFairy3(rid 673)、fdtooth(rid 609)、LNDb、dentex、3DTeethLand 等条目互链。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • 3dircadb — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • rexgrounding-ct — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准
  • nih-pancreas-ct — 共享标签:医学影像 / CT / 医学图像分割
  • abdomenct-1k — 共享标签:医学影像 / CT / 医学图像分割
  • word — 共享标签:医学影像 / CT / 医学图像分割
  • totalsegmentator — 共享标签:医学影像 / CT / 医学图像分割

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集