信息速览

ISBI 2015 头颅侧位片定点 — 头影测量标志点检测基准数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ISBI 2015 Cephalometric |
| 英文全称 | IEEE ISBI 2015 Grand Challenge - Automated Detection and Analysis for Diagnosis in Cephalometric X-ray Images |
| 别名/简称 | ISBI 2015 Cephalometric Grand Challenge 数据集、Cephalometric X-ray 400 |
| 疾病分类 | 错牙合畸形(ICD-11:DA0E.5 Malocclusion) |
| SNOMED CT | 707598004 Malocclusion(详见 §2.1b) |
| 数据模态 | 头颅侧位 X 光(灰度放射影像)+ 手工解剖标志点坐标 |
| AI 任务类型 | 解剖标志点检测(坐标回归/热图回归)、头影测量参数自动分类(Task2)、mm 级精度基准评测 |
| 样本总数 | 400 张头颅侧位 X 光(TrainingData 150 + Test1Data 150 + Test2Data 100)/ 19 点 × 2 名标注者 |
| 数据格式 | TIFF(挑战版记载)/ BMP(开源分发版)+ 标注坐标文本 |
| 许可证 | CC BY-SA 4.0(MDPI 2026 综述转引口径;以获取渠道实际声明为准) |
| 访问级别 | 开放(挑战期经官网注册申请;官方下载入口已失效,现经学术社区开源分发渠道获取) |
| DUO 标签 | NRES(无限制使用,限研究用途) |
| 语言 | 英文 |
| 首发日期 | 2015(IEEE ISBI 2015 Grand Challenge 发布) |
| 最后更新 | 2015 完整版(400 张,两期挑战合并后的最终形态,无官方后续迭代) |
| 发布机构 | IEEE ISBI 2015 Grand Challenge 组织方(中国台湾科技大学 Ching-Wei Wang 团队,联合中国台湾三军总医院牙科部) |
| 官方主页 | https://biomedicalimaging.org/2015?p=593(原挑战站已失效) |
| 下载地址 | 经学术社区开源分发渠道获取(官方下载入口已失效,见 §6.2) |
| DOI | 10.1109/TMI.2015.2412951(挑战论文,IEEE TMI 2015) |
| 引用次数 | 255+(Google Scholar,冠军方法论文 Lindner et al. 2016,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 规模与划分明确、GT 取平均稳定、评测协议完整;扣分项:官方下载入口失效、双标注版本并存易混用、无官方预处理脚本 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(错牙合畸形 ICD-11/SNOMED 编码、头影测量临床任务定义)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-16
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ISBI 2015 挑战期经官网注册申请下载、限研究用途;原挑战站已失效,现经学术社区开源分发渠道获取,许可与使用限制以实际获取渠道的声明为准。DUO 标签仅供参考。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? 这是 2015 年 IEEE ISBI 医学影像国际会议组织的头影测量挑战赛(Grand Challenge)官方数据集:400 张头颅侧位 X 光片,每张上面有 19 个解剖结构点(从蝶鞍、鼻根到颏前点、下颌角)的专家标注坐标。它来自中国台湾一家大型医院牙科部,受检者覆盖 6-60 岁,是牙科影像 AI 里"给 X 光片上的关键点自动定位"这件事公认的起点性基准。
为什么重要? 正畸医生做治疗计划前,要在头颅侧位片上手工找这些点、量出 ANB 等角度——这一步耗时且不同医生之间平均差约 1.73 mm。把这个过程自动化的前提,是有一个带可信答案、且用"毫米级误差 + 成功率"这种临床语言评价的公开基准。本数据集与配套的两篇挑战论文(IEEE TMI 2015、Medical Image Analysis 2016)共同定义了这套评测语言,至今仍是论文对比的标准舞台。
我能用它做什么? 训练/评测标志点检测模型(回归或热图皆可);把 19 个点连起来自动算头影测量角度(挑战赛 Task2);用它做牙科 X 光预训练、教学评测协议设计,或作为下游正畸辅助诊断系统的核心模块benchmark。注意它只限研究用途,且官方下载入口已失效,获取方式见 §6.2。
§1.1 技术摘要
ISBI 2015 头颅侧位片定点数据集由 IEEE ISBI 2015 Grand Challenge 组织方(中国台湾科技大学 Ching-Wei Wang 团队联合中国台湾三军总医院牙科部)发布,是 ISBI 2014 期挑战(300 张)的扩展版:新增 100 张现场决赛用图,合计 400 张 1935×2400 像素、0.1 mm/像素的灰度头颅侧位 X 光。按官方目录划分为 TrainingData(001-150,150 张)、Test1Data(151-300,150 张,场外线上评测)与 Test2Data(301-400,100 张,ISBI 2015 现场决赛评测)。每张图像由两名经验丰富的医师(正畸方向,一初级一资深)独立标注 19 个解剖标志点,两人间平均差 1.73 mm,官方 ground truth 取两人平均。评测指标为平均径向误差 MRE 与四档半径成功率 SDR(2/2.5/3/4 mm,其中 2 mm 被视为临床可接受精度阈值);Task2 要求由检测点推导八项头影测量参数(ANB/SNB/SNA/ODI/APDI/FHI/FHA/MW)并分类。2015 期冠军 Lindner 与 Cootes(曼彻斯特大学,随机森林回归投票)在 Test1 上取得 MRE 1.67 mm、SDR@2mm 73.68%,其方法论文发表于 Scientific Reports 2016,是后续深度学习方法的标准对照。
技术上需要预先知道的三个要点:图像是 460 万像素的大尺寸灰度图,输入策略与坐标换算直接决定成败(§6.3/坑点 8);标注以纯文本坐标分发且无官方数据字典,工程接缝(坐标顺序、点序约定)全部靠本页 §4 补齐;官方下载入口已失效,获取与版本核对纪律(§6.2/坑点 6)是开工前的第一件事。
§1.2 战略价值
临床价值维度:头影测量(cephalometry)是正畸诊断的底层语言——骨性 I/II/III 类分类、拔牙决策、正颌手术方案都建立在 SNA/SNB/ANB 等角度之上,而这些角度全部由 19 个标志点派生。标志点检测的精度直接决定自动头影测量的临床可用性:2 mm 半径被挑战论文定义为临床可接受阈值,SDR@2mm 因此成为论文通行的主指标。本数据集把"自动定点"从概念验证推进到了可横向比较的工程赛道,其冠军方法(SDR@2mm 73.68%)与后续深度学习方法(约 75.45%)之间的差距演进,清晰记录了牙科影像 AI 的第一代技术史。
工程与生态维度:这是牙科/口腔影像方向少有的"小而精"基准——数据量 400 张,任何实验室都能全量训练与复现,且评测协议(MRE + 四档 SDR + 逐点分析)已成为后续牙科标志点研究的默认语言。它与同站收录的 DENTEX(全景片牙齿检测)、Tufts Dental 等牙科数据集形成模态互补:全景片覆盖牙齿编号与病灶,头颅侧位片覆盖骨骼关系与生长型。对构建牙科 AI 产品矩阵的团队而言,本数据集是头影测量模块的验收基准;对学术团队而言,它是方法论文绕不开的对比表第一行。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与本集的差异化定位 |
|---|---|---|---|---|
| ISBI 2015 Cephalometric(本集) | 400 张(150/150/100) | 头颅侧位 X 光 | 19 点 × 双人独立标注取平均 | mm 级 SDR 评测协议的制定者,头影测量基准事实标准 |
| ISBI 2014 期数据 | 300 张 | 头颅侧位 X 光 | 19 点 × 双人标注 | 前身版本,挑战在北京现场决赛;2015 期含其全部影像 |
| 北京大学口腔医院集(PKU) | 102 张 | 头颅侧位 X 光 | 19 点 | 常作跨机构外部泛化测试集,非本集组成部分 |
| DENTEX | 全景片数千张 | 牙科全景片 | 牙齿编号 + 病灶 | 覆盖牙齿级检测与病灶,与本集骨骼关系分析互补 |
对比表的读法:本集的不可替代性不在规模(400 张在当下属于小数据集),而在评测协议的权威性与延续性——MRE + 四档 SDR 的报告语言、2 mm 临床阈值、两阶段赛制全部由本集及其挑战论文定义,任何新方法在此协议下的成绩可以直接进入领域叙事;PKU 集虽同样标注 19 点,但缺少挑战赛级的官方评测背书,因此文献惯例是"在本集上报榜、在 PKU 集上验证泛化"。
§1.4 版本时间轴
| 时间 | 事件 | 对使用者的影响 |
|---|---|---|
| 2014 | ISBI 2014 期头影测量挑战发布 300 张(Test1 + Test2 各 150),现场决赛在北京举行 | 大量早期论文(含 IEEE TMI 2015)基于 300 张口径,SDR 数字与 2015 期不可混比 |
| 2015 | ISBI 2015 期发布 400 张完整版(新增 Test2Data 100 张),现场决赛在纽约布鲁克林举行 | 现行标准口径:官方划分 150/150/100,两阶段成绩分开报告 |
| 2016 | Medical Image Analysis 31:63-76 固化评测协议;冠军方法论文发表于 Scientific Reports 6:33581 | 引用基准时以这两篇为协议出处 |
| 2016-2026 | 原挑战站失效,社区经开源分发渠道与工具库(含下载/划分脚本)传播 400 张完整版与双标注目录 | 获取与版本核对纪律见 §6.2 与坑点 6 |
| 2026 | MDPI 综述记载本集按 CC BY-SA 4.0 分发(转引口径) | 许可以实际获取渠道声明为准(§3 许可) |
时间轴的关键分岔在 2015 年:新增的 100 张 Test2Data 让"两阶段、两测试集"的评测结构定型,也埋下了此后十年文献间成绩混比的隐患——任何引用本集的论文,第一步都应声明所引为哪一期口径(坑点 2)。
§1.5 典型应用场景
- 自动头影测量系统:检测 19 点后自动计算 ANB/SNB/SNA 等角度,输出骨性分类与生长型判断,替代正畸医师的手工描点测量。
- 标志点检测方法基准:坐标回归与热图回归两条技术路线在同一协议下对比,MRE 与 SDR@2mm 为通行报告项。
- 牙科 X 光预训练骨干:以 400 张高清头颅侧位片预训练特征提取器,迁移至全景片、根尖片等下游牙科任务。
- 正畸教学与质控:将模型输出与双人标注差异(1.73 mm 量级)对照,用于住培教学中的描点一致性训练与读片质控。
- 厂商软件验收:头影测量软件的逐点精度验收(2/2.5/3/4 mm 半径分档报告)可直接沿用本集评测协议。
五个场景的优先级建议:研究团队从场景 2 切入(最直接的发表路径),工程团队按场景 1 → 5 递进(先定点、再测量、后验收),教学机构直接使用场景 4 的双人差异素材。
§2 医学背景
§2.1 ICD-11 编码映射
| 疾病/异常(中文) | 疾病/异常(英文) | ICD-11 编码 | 在数据集中的角色 |
|---|---|---|---|
| 错牙合畸形 | Malocclusion | DA0E.5 | 头影测量检查的核心适应证 |
| 牙弓关系异常 | Anomalies of dental arch relationship | DA0E.2 | ANB 等矢状关系测量的目标异常 |
| 颌-颅底关系异常 | Anomalies of jaw-cranial base relationship | DA0E.1 | SNA/SNB 角涉及的上/下颌相对颅底位置 |
| 牙位异常 | Anomalies of tooth position | DA0E.3 | 上下切齿切缘点的定位背景 |
§2.1b SNOMED CT 映射与 19 点解剖清单
SNOMED CT 映射:错牙合畸形对应 707598004 Malocclusion(BioPortal 收录,形态学异常轴);19 个标志点为解剖学定位概念,SNOMED CT 无一一对应的官方编码表,本页不作逐一映射。头影测量术对应的 MeSH 主题词为 D008310(Malocclusion 相关),可作为文献检索入口。
本数据集的 19 个标志点按固定顺序编号(L1-L19),硬组织点 13 个、软组织点 6 个,完整清单如下:
| 编号 | 缩写 | 中文名称 | 组织类型 |
|---|---|---|---|
| L1 | S | 蝶鞍点(Sella) | 硬组织 |
| L2 | N | 鼻根点(Nasion) | 硬组织 |
| L3 | O | 眶点(Orbitale) | 硬组织 |
| L4 | P | 耳点(Porion) | 硬组织 |
| L5 | A | 上齿槽座点(Subspinale, A point) | 硬组织 |
| L6 | B | 下齿槽座点(Supramentale, B point) | 硬组织 |
| L7 | Pog | 颏前点(Pogonion) | 硬组织 |
| L8 | Me | 颏下点(Menton) | 硬组织 |
| L9 | Gn | 颏顶点(Gnathion) | 硬组织 |
| L10 | Go | 下颌角点(Gonion) | 硬组织 |
| L11 | — | 下切齿切缘 | 硬组织 |
| L12 | — | 上切齿切缘 | 硬组织 |
| L13 | — | 上唇(前缘) | 软组织 |
| L14 | — | 下唇(前缘) | 软组织 |
| L15 | Sn | 鼻下点(Subnasale) | 软组织 |
| L16 | Pos | 软组织颏前点(Soft-tissue pogonion) | 软组织 |
| L17 | PNS | 后鼻棘(Posterior nasal spine) | 硬组织 |
| L18 | ANS | 前鼻棘(Anterior nasal spine) | 硬组织 |
| L19 | Ar | 关节点(Articulare) | 硬组织 |
§2.2 疾病简介与流行病学
错牙合畸形(malocclusion)是牙齿、牙弓与颌骨在形态、位置或关系上偏离理想的发育异常,表现为牙列拥挤、深覆合、反合、开合与双颌前突/后缩等,被世界卫生组织列为继龋病、牙周病之后的第三大口腔健康问题。全球文献报道的患病率区间极宽——儿童与青少年人群约 39%-93%——差异主要来自诊断标准(Angle 分类、IOTN 指数等)与纳入阈值的不同;一项覆盖 57 项研究的系统综述与荟萃分析给出青少年正畸治疗需求合并患病率 39.0%(95% CI 28.0-50.0,Ghafari et al., Epidemiology and Health 2019,DOI 10.4178/epih.e2019046)。骨性分类由 ANB 角等头影测量参数定义:ANB 约 0°-4° 为骨性 I 类,大于 4° 提示骨性 II 类(下颌后缩或上颌前突),小于 0° 提示骨性 III 类(下颌前突)。
头颅侧位 X 光(lateral cephalogram)是正畸门诊的标准检查:患者站立或坐位、头颅以耳-眶平面定向后从侧面投照,一张片同时显示颅底、上下颌骨、全牙列与面部软组织轮廓。它价格低、辐射剂量相对小、且一张片即可完成全部骨骼矢状关系测量,因此成为全球正畸诊断、生长评估与正颌计划的常规依据,也是牙科影像中标注体系最成熟、AI 落地路径最清晰的模态之一。
头影测量本身的历史可追溯到 20 世纪 30 年代——Broadbent 与 Hofrath 分别独立引入规范化头颅侧位投照与描点分析方法,此后近一个世纪里,"医师在胶片/屏幕上手工描点、量角、查表分类"的工作流程几乎没有结构性变化。本数据集所对应的 AI 任务,正是对这一百年流程中最耗时、最依赖经验的"描点"环节的自动化替代,这也是其临床意义的根源。
§2.3 临床任务定义
本数据集对应的临床任务有两层。Task1(定点检测):给定头颅侧位片,输出 19 个解剖标志点的像素坐标,以毫米级误差衡量——临床上医师手工描点用于测量角度,检测精度决定测量可信度。Task2(测量分类):由检测点推导八项头影测量参数——ANB、SNB、SNA(矢状骨骼关系),ODI(垂直向不调指数)、APDI(前后向不调指数),FHI、FHA(面高指数与面高),MW——并按参数区间分类,对应骨性分类与垂直生长型的自动化判读。两层任务串联,即构成"拍片 → 定点 → 测量 → 分类"的自动头影测量流水线;末端还可衔接正颌手术模拟与矫治方案推荐等下游应用。
任务定义的两条边界需要明确:本集的任务是"从片子上恢复测量",不是"从测量直接做诊断"——骨性分类只是测量值的区间映射,临床决策还需要年龄、软组织、功能因素等本集不包含的信息;同样,Task2 的分类准确率受误差链式传导影响(点误差 → 角度误差 → 类别翻转),不能与端到端分类任务的准确率直接类比。
§2.4 患者人群画像
| 维度 | 描述 |
|---|---|
| 来源机构 | 中国台湾三军总医院牙科部(2014 期 300 张明确记载;2015 期新增 100 张官方未逐条披露来源细节,MDPI 2026 记载 400 例均采集自同一设备) |
| 采集场景 | 正畸门诊头颅侧位 X 光检查 |
| 年龄范围 | 6-60 岁(乳牙期至成人全龄覆盖) |
| 性别构成 | 官方未披露 |
| 种族/地域构成 | 官方未系统披露;采集地为中国台湾台北 |
| 就医类型 | 口腔正畸就诊人群(含诊断评估与治疗计划阶段) |
人群画像的三个使用提醒:年龄跨度 6-60 岁是本集最独特的人群特征,儿童生长引导与成人正颌两个临床场景都能找到对应样本,但也意味着模型误差分析必须按年龄分层才有临床意义;性别与种族字段缺失使任何亚组声明都只能靠外测数据补足;正畸门诊的入组偏倚(非人群筛查)决定了它不能用于患病率估计类任务。
§2.5 临床价值
对正畸临床而言,本数据集支撑的自动定点价值体现在三处。其一,效率:手工描点加测量在单张片上需数分钟,自动流水线可将测量环节压缩到秒级并直接输出结构化角度报告。其二,一致性:双人标注平均差 1.73 mm 意味着人工测量存在毫米级观察者间方差,自动方法若能稳定进入 2 mm 临床阈值内(SDR@2mm 70% 以上),可显著降低同一患者复诊间测量漂移。其三,教学与质控:模型的逐点误差分布(尤其是 Go、Ar 等图像边缘骨点的低成功率)能反向提示医师培训中哪些点的判读规则最易走样。此外,六岁乳牙期到六十岁成人的全龄覆盖,使该基准对儿童生长引导治疗与成人正颌-正畸联合方案两个极端场景都有参考意义。
§2.6 金标准表
| 属性 | 内容 |
|---|---|
| 划分 | TrainingData 150 张(001-150)/ Test1Data 150 张(151-300)/ Test2Data 100 张(301-400) |
| 标注方式 | 人工双人独立描点,ground truth 取两人坐标平均 |
| 标注者 | 两名经验丰富的医师(正畸方向,一初级一资深) |
| 一致性 | 两人间平均差 1.73 mm |
| 标注性质 | 挑战赛官方金标准,经 IEEE TMI 2015 与 Medical Image Analysis 2016 两篇论文固化 |
| 评测性质 | 独立测试集不公开标签(挑战期),指标 MRE + SDR(2/2.5/3/4 mm) |
金标准的两个使用要点:其一,"GT 取平均"意味着官方标签是折中解而非单一医师判读,训练时目标更平滑、评测时不要拿单一医师口径硬比;其二,1.73 mm 间差是解读一切成绩的背景噪声——任何小于该量级的方法差异都不具备临床意义。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 规模 | 理由 |
|---|---|---|---|
| 复现 2015 挑战或对比近年论文 | 2015 完整版(400 张,官方 150/150/100 划分) | 400 张 | 与 Medical Image Analysis 2016 协议及绝大多数文献口径一致 |
| 对比 2014-2015 早期论文 | 2014 期口径(300 张,Test1/Test2 各 150) | 300 张 | IEEE TMI 2015 的数字基于 300 张版本,混用会系统性偏移 |
| 快速教学/原型验证 | 社区分发的双标注完整版(含 junior/senior 两套目录) | 400 张 | 可同时观察观察者间差异,适合标注质量教学 |
| 跨机构泛化评估 | 本集 + 北京大学口腔医院集(102 张)外部测试 | 400 + 102 | 仅用本集无法回答跨设备/跨人群泛化问题 |
矩阵的使用顺序:先确认自己要对比的文献口径(决定版本),再确认训练/测试纪律(决定划分),最后才考虑派生集捷径。最常见的错误是把矩阵从下往上读——先拿手头现成的派生集开训,最后才发现与目标论文口径对不上,全部评测作废重跑。
§3.1 模态详情
数据集为单一模态:头颅侧位 X 光。图像分辨率 1935×2400 像素,像素间距 0.1 mm,灰度单通道——换算物理视野约 19.4 cm × 24.0 cm,完整覆盖颅底至颏部与部分颈椎,足以支撑从蝶鞍到颏顶点全部 19 点的定位。像素精度 0.1 mm 意味着坐标标注的量化误差(±0.05 mm)远小于观察者间差(1.73 mm),不是误差主项;但 460 万像素的大图对网络输入策略提出了下采样与坐标缩放的纪律要求(见 §6.3 与坑点 8)。图像内含定位标记与软组织轮廓重叠区域,低对比软组织点(上/下唇)与高对比骨点(S、N)的灰度形态差异显著,是预处理与增强策略需要区别对待的地方。
从检测任务视角看,这张"大图"的信息分布极不均匀:19 个点中约一半集中在面部中下 1/3(牙槽、颏部、切齿),而 P(耳点)、Ar(关节点)、Go(下颌角点)贴在图像左右边缘,S(蝶鞍)孤悬颅底中部——这种空间分布决定了 coarse-to-fine 策略与全图上下文建模都比单纯裁剪中心区域更有效,也解释了为何边缘骨点在排行榜上长期垫底(§4.2 逐点难度)。
§3.2 按子集样本数
| 子集 | 编号范围 | 图像数 | 用途 |
|---|---|---|---|
| TrainingData | 001-150 | 150 | 挑战期公开训练集(含标注) |
| Test1Data | 151-300 | 150 | 场外线上评测阶段测试集(SDR 主报告口径) |
| Test2Data | 301-400 | 100 | ISBI 2015 现场决赛新收集测试集(分布与 Test1 有差异) |
| 合计 | 001-400 | 400 | 2014 期 300 张 + 2015 期新增 100 张 |
三个子集的角色不对称:TrainingData 是唯一挑战期公开标注的子集;Test1Data 承担"对外报告主成绩"的角色(文献绝大多数数字基于它);Test2Data 是现场决赛专用、且为后收集样本——它的存在使本集天然带有一个"时间外推"检验维度,这对方法鲁棒性分析是稀缺资源,不要当作普通额外测试集浪费掉。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 影像(挑战期官方口径) | TIFF | 多文献记载官方分发为 TIFF 灰度图 |
| 影像(开源分发版) | BMP | 学术社区开源分发版本多见 BMP |
| 标注坐标 | 文本(每图 19 行,每行 x y) | 点序按 L1-L19 固定顺序 |
| 标注目录 | 双版本并存 | junior 与 senior 两套独立标注目录并行分发 |
| 划分脚本 | 社区工具库附带 | 第三方工具库含 400 张下载/划分脚本(非官方) |
格式层的两处注意:坐标文本无表头、无点名列——行序即点序,L1-L19 的对应关系完全靠约定维持,任何自行重排都会静默破坏对齐(与坑点 4 同源);灰度位深在 TIFF/BMP 两个口径间可能不一致,加载时显式转换比依赖默认行为可靠(坑点 5)。
§3.4 存储大小
| 项目 | 数值 | 说明 |
|---|---|---|
| 单张影像(未压缩 8-bit 估算) | 约 4.6 MB | 1935×2400 像素 × 1 字节 |
| 影像总量(400 张估算) | 约 1.9 GB 量级 | 未压缩口径;实际取决于分发版本压缩 |
| 标注文本(双版本) | 数 MB 量级 | 15,200 行坐标文本 |
| 整体下载包 | 官方未披露精确大小 | 以实际获取渠道分发包为准 |
官方未披露分发包精确大小。按 400 张 1935×2400 未压缩 8-bit 灰度位图估算(约 4.6 MB/张),影像总量约 1.9 GB 量级,加双标注文本与文档后仍远小于 3 GB——属于单卡本地即可全量装载的小型基准。此为算术估算值,实际以获取渠道分发包为准。
§3.5 标注方式
纯人工标注:每张图像由两名医师分别独立描出 19 个点,官方 ground truth 取两人坐标平均;junior 与 senior 两版坐标同时分发(目录分离),使观察者间差异可被直接测量。没有像素级掩码、没有病灶框——标注体系完全围绕"点"构建,这也决定了损失函数与评测方式都应以点误差(欧氏距离)为中心,而不是分割或分类的惯用指标。
从标注产物的组织方式可以反推标注流程的设计意图:双人独立、版本并行、不互看——三个约束保证了两版标注的独立性,使 1.73 mm 的间差成为真实的观察者方差估计而非"抄近道后的表面一致"。复用本集做标注质量研究时,应保留这种独立结构,不要把两版标注混合后重新平均再谈一致性。
还原出来的标注流程大致为五步:按固定顺序(L1-L19)逐点描记,避免点间顺序漂移;双人各自独立完成全图,中途不互看;两人版本分别落盘,不在线上合并;汇总后计算逐点间差并核查异常;以两人平均作为官方 GT 冻结。其中第四步的逐点核查口径官方未完整披露,使用者只能从 1.73 mm 的均值反推。
§3.6 标注者资质与一致性
标注者为两名经验丰富的医师(正畸方向):一名为初级医师(junior)、一名为资深医师(senior)。两人独立标注后的平均径向差为 1.73 mm——这个数字本身就是数据集提供的重要校准锚点:任何模型若平均误差显著优于 1.73 mm,即可声称超越单人人工观察者一致性;2015 冠军 MRE 1.67 mm 恰好跨过这条线。注意挑战论文表述为"two experienced medical doctors"(两名经验丰富的医师),并非放射科医师;常见的"放射科医师双人标注"说法不准确。
| 对比项 | junior | senior | 官方 GT |
|---|---|---|---|
| 身份 | 经验较少的医师 | 经验丰富的医师 | 两人坐标平均 |
| 目录 | 400_junior | 400_senior | 由两者计算 |
| 典型用途 | 观察者差异分析 | 单版敏感性分析 | 挑战评测与论文对比 |
三人三口径的结构让本集可以回答多数数据集答不了的问题:你的模型到底在学"资深医师的判读"还是"医师们的共识"?两版分别评测即可分离这两种成分。
§3.7 采集周期
官方未披露精确采集时间窗。可确认的时间锚点如下:
| 锚点 | 时间 | 依据 |
|---|---|---|
| 2014 期 300 张采集完成 | ISBI 2014 挑战发布前 | 挑战发布时间线 |
| Test2Data 100 张收集完成 | ISBI 2015 现场决赛前 | 挑战官方页"新收集"表述 |
| 挑战摘要的 500 名患者提案 | 2015 期筹备阶段 | 挑战摘要口径(实际发布 400 张) |
挑战摘要曾表述建立 500 名患者数据库的提案口径,实际公开发布 400 张——两者相差的 100 张去向官方未披露,引用规模时应以 400 张为准,并注意区分"提案规模"与"发布规模"两种口径。
§3.8 地域覆盖
单中心数据集:影像来自中国台湾三军总医院牙科部(台北)。不存在多机构分层,也因此跨机构泛化必须借助外部集合(北京大学口腔医院 102 张是文献中最常用的外测集,见 §5.5 与 §7.8)。
地域单一性在评测解读上有直接的推论:本集上的 SDR 排名反映的是"同源分布下的方法排序",不能解读为"各方法在任意人群上的排序";反之,任何声称跨人群稳定的方法,都必须拿出本集之外的外测证据。引用本集成绩时附带单中心限定语,是审稿人常见的合规要求。
§3.9 设备规格
| 项目 | 规格 |
|---|---|
| 采集设备 | Soredex CRANEX Excel Ceph(芬兰 Tuusula) |
| 采集软件 | SorCom(记载版本 v3.1.5 / 2.0) |
| 分辨率 | 1935×2400 像素 |
| 像素间距 | 0.1 mm |
| 色深 | 灰度单通道 |
| 输出格式 | TIFF(挑战期记载)/ BMP(开源分发版) |
设备层有两点值得注意。其一,单设备单软件栈(Soredex CRANEX Excel Ceph + SorCom)意味着图像的噪声谱、动态范围与几何校准在全集中高度一致——对本集内评测是利好,对外推是明确边界。其二,0.1 mm 像素间距属于头颅侧位片的高分辨率档位,当下的正交/CCD 采集设备多数落在 0.1-0.3 mm 区间,接入自有数据时按 §6.3 的比例缩放纪律处理即可,不需要改动网络结构。
§3.10 深度溯源链
本集的完整溯源链条共六环,每一环都有文献或验证记录支撑:
- 采集:中国台湾三军总医院牙科部,Soredex CRANEX Excel Ceph + SorCom 软件,0.1 mm/像素(§3.9)。
- 标注:中国台湾科技大学团队组织,两名正畸方向医师双人独立标注,GT 取平均(§3.5-§3.6)。
- 首发:ISBI 2014 期挑战发布 300 张(Test1/Test2 各 150)。
- 扩展:ISBI 2015 期新增 100 张 Test2Data,发布 400 张完整版,现场决赛于纽约布鲁克林举行。
- 固化:IEEE TMI 2015 与 Medical Image Analysis 2016 两篇论文固化评测协议与官方成绩。
- 传承:冠军方法经 Scientific Reports 2016 发表;原官网失效后,学术社区经开源分发渠道与工具库延续数据与脚本。
使用者在获取时处于链条最后一环,应按坑点 6 的纪律核对所得版本是否为 400 张完整版,并把来源渠道与获取日期登记进实验记录——溯源链的最后一公里(你拿到的是哪一版)恰恰是文献复现性最常断裂的位置。
§4 数据结构
§4.0 目录树
以学术社区广泛流传的分发结构为例(不同重打包版本目录名略有差异,语义一致):
cepha400/
├── TrainingData/ # 训练集:001-150(150 张)
│ ├── 001.bmp # 头颅侧位 X 光(挑战期为 .tiff 口径)
│ ├── ...
│ └── 150.bmp
├── Test1Data/ # 场外测试集:151-300(150 张)
│ ├── 151.bmp
│ └── ...
├── Test2Data/ # 现场决赛测试集:301-400(100 张)
│ ├── 301.bmp
│ └── ...
├── 400_junior/ # 初级医师标注(400 张 × 19 点坐标)
│ └── 001.txt # 每行 "x y",共 19 行,按 L1-L19 顺序
├── 400_senior/ # 资深医师标注(结构与 junior 一致)
│ └── 001.txt
└── cepha400.py # 社区工具库附带下载/划分脚本(非官方)
树的三个读图要点:影像与标注通过编号字符串(001-400)跨目录对齐,不存在汇总索引文件;TrainingData 内的标注需自行与 400_* 目录连接——官方目录语义是"按角色组织"而非"按用途组织";cepha400.py 属于社区工具而非官方产物,重打包版本中可能不存在,不能作为结构必需项。
§4.1 DAIMS 字段字典
下表为本页从分发结构与文献中整理的字段字典(官方未随集分发字典,本表即补全件)。AI 用途一列标明该字段在建模流程中的典型角色;观测误差列区分"物理误差"(像素量化)与"语义误差"(观察者方差、定义歧义)两类来源。
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| image_id | Text | 图像编号,与文件名一致 | 001 | 样本主键/划分依据 | 无 | 无 | 001-400 |
| subset | Text | 所属子集目录 | Test1Data | 防泄漏划分 | 无 | 无 | TrainingData/Test1Data/Test2Data |
| image | ImageObject | 头颅侧位 X 光,1935×2400 灰度 | — | 模型输入 | 0.1 mm 像素间距 | 无 | 固定分辨率 |
| point_index | Integer | 标志点序号(L1-L19 固定顺序) | 10 | 任务头输出对齐 | 无 | 无 | 1-19 |
| point_name | Text | 解剖点缩写 | Go | 逐点误差分析 | 无 | 无 | 见 §2.1b 清单 |
| x_px | Float | 横坐标(图像坐标系) | 812.5 | 回归目标 | ±0.05 mm 量化 | 无 | 0-1934 |
| y_px | Float | 纵坐标(图像坐标系) | 1104.0 | 回归目标 | ±0.05 mm 量化 | 无 | 0-2399 |
| annotator_version | Text | 标注版本 | senior | 观察者间差异研究 | 1.73 mm 间均差 | 无 | junior/senior |
| measurement_name | Text | Task2 测量参数名 | ANB | 测量分类任务 | 由点误差传导 | 无 | ANB/SNB/SNA/ODI/APDI/FHI/FHA/MW |
| measurement_class | Text+Label | Task2 目标类别 | 骨性 II 类 | 分类监督 | 由点误差传导 | 无 | 参数区间决定 |
| point_definition | Text | 点的解剖定义 | 构造点/解剖点 | 误差来源分析 | 定义歧义传导 | 无 | 见 §4.5 |
字典的两处使用提示:point_index 是全数据集的"任务轴"——加载器、损失、指标、报告表都以 1-19 这条轴对齐,任何乱序都会静默污染逐点统计;point_definition(解剖点 vs 构造点)是本页补充的解释字段,官方未随集分发,构造点(Gn 等)的取法差异是 1.73 mm 间差的主要来源之一。
§4.2 标签分布
标注体系完全均衡:400 张图像 × 19 点 × 2 名标注者 = 15,200 个坐标标注,每图每点必标、无缺失文件,不存在类别不均衡问题。真正的"分布"问题在难度维,文献统计的量级示意如下:
| 难度档 | 代表点 | SDR@2mm 量级 | 失效模式 |
|---|---|---|---|
| 易 | S、N 等高对比骨点 | 90% 以上 | 偶发极端体型偏移 |
| 中 | 软组织点(上/下唇、Sn、Pos) | 70%-90% | 软组织厚度与闭口位差异 |
| 难 | Go、Ar、Gn 等边缘/构造点 | 低至 38% | 双侧界标判读与构造点切线取法 |
这是逐点报告而不是只报均值的直接依据(见坑点 7)。Task2 的八项测量分类标签由 GT 点计算派生,类别构成随参数而异,使用时应逐参数核对区间定义。
难度表的工程含义:难度与空间位置强相关——最难的三个点(Go/Ar/Gn)全部落在图像边缘或需要曲线拟合才能定义的区域,这解释了为什么全图上下文建模与 coarse-to-fine 策略在本集上收益显著;也提示数据增强中的大角度旋转对这些边缘点的破坏力远大于中心点(§6.6)。
§4.3 关键统计
| 统计项 | 数值 |
|---|---|
| 图像总数 | 400(150/150/100 三子集) |
| 标志点数 | 19(硬组织 13 + 软组织 6) |
| 坐标标注总数 | 15,200(400 × 19 × 2 名标注者) |
| 观察者间平均差 | 1.73 mm |
| 图像分辨率 | 1935×2400 像素,0.1 mm/像素 |
| 受检者年龄 | 6-60 岁 |
| 采集设备 | Soredex CRANEX Excel Ceph(单设备) |
| Task2 测量参数 | 8 项(ANB/SNB/SNA/ODI/APDI/FHI/FHA/MW) |
| 标注版本 | 2 套(junior / senior,官方 GT 取平均) |
| 采集设备数 | 1(Soredex CRANEX Excel Ceph,单中心) |
统计表的解读视角:这是一份"分子小、分母清"的基准——400 张影像、19 点、2 名标注者,所有派生数字(15,200 个坐标、1.73 mm 间差、四档 SDR)都可以在一张纸上核对完。这种算术透明度正是它成为教学与复现友好型基准的原因:任何复现者都能在十分钟内验证自己拿到的数据是否完整、口径是否正确。
§4.4 数据层级
数据集(400 张)
├── 子集层:TrainingData(150) / Test1Data(150) / Test2Data(100)
│ └── 图像层:编号 001-400,每编号一张侧位片
│ ├── 标注版本层:junior / senior(平行目录,互不混合)
│ │ └── 点层:L1-L19 固定顺序,(x, y) 像素坐标
│ └── 派生层:Task2 八项测量分类(由 GT 点计算)
数据层级为三层扁平结构:数据集 → 图像(400)→ 标注版本(junior/senior)→ 点(19)。没有患者-检查-序列的多级嵌套——每张影像视为独立样本,官方未披露是否存在同一受检者多次拍摄(纵向重复)的情况,故按患者级去重的常规操作在本集上无法执行,这正是跨集外测(§5.5)之外仍需注意的隐性泄漏面。图像与标注文本通过编号字符串精确对齐,加载器按 id 双表连接即可。
层级设计对工程的影响是双向的:扁平结构让 DataLoader 与目录遍历极简(无嵌套元数据要解析),但也意味着任何"患者级"语义(年龄、性别、复诊关系)都需要外部补充——本集不提供这些字段,跨集合并时只能依赖图像本身的形态学特征做对齐,这是一个明确的工程边界而非可绕过的实现细节。
§4.5 缺失值与信息性缺失
坐标层无缺失:每图 19 点必标,不存在"文件不存在"式的静默缺失。真正需要编码的是定义性模糊而非数据缺失——例如 Gn(颏顶点)是 S 与 Pog 连线同下颌骨下缘切线的交点(构造点),不同医师对构造点切线的取法会产生系统性偏移,这类歧义以观察者间差 1.73 mm 的形式体现在双标注差异里,而非以缺失标记体现。使用 senior 单版或两人平均作为 GT 时,应在实验记录中显式声明选择(坑点 1)。
缺失语义的完整性还带来一个评测纪律:由于不存在"某点未标"的情况,逐点指标的分母恒为 400 × 19(或对应测试集规模),任何报告 SDR 时分母不一致的做法都是协议错误——这也是核对他人论文评测协议有效性的快速检查项。
| 表面现象 | 实际语义 | 处理方式 |
|---|---|---|
| 标注文件缺失 | 分发包不完整(残缺版) | 按 §6.2 清单重新核对获取渠道 |
| 个别点坐标贴图像边缘 | 真实解剖位置(如 P、Ar 靠边) | 非异常,勿过滤 |
| 两版坐标差异大 | 观察者方差(尤其构造点) | 用逐点间差分析而非剔除 |
| 坐标为整数 | 像素级描记精度 | 非异常,量化误差远小于间差 |
§5 划分与使用建议
§5.1 官方划分
官方划分为 TrainingData 150 张(001-150)/ Test1Data 150 张(151-300)/ Test2Data 100 张(301-400)。挑战期 Test1 经线上系统评测,Test2 用于 ISBI 2015 现场决赛;两套成绩在挑战论文中分开报告(冠军 Test1 MRE 1.67 mm vs Test2 MRE 1.92 mm)。复现官方口径时须严格保持 150/150/100 且 Test2 不参与任何模型选择。
划分的一个隐藏细节是编号连续性:三个子集按编号区间连续切分而非随机打乱,这意味着编号顺序可能与采集顺序相关(Test2Data 为后收集即为例证)。复现者应保持编号切分原样,禁止在自己的划分中打乱重排后再与官方成绩对比。
§5.2 社区惯例划分
社区最著名的替代划分是 Payer 等人的 4 折交叉验证(在 400 张上每折约 100 张,常合并 TrainingData 与 Test1Data 参与轮换),经社区工具库整理后流传甚广;另有部分工作将 400 张按 3:1 随机重划。这些划分与官方 150/150/100 并存,是文献间 SDR 数字不可直接比较的首要原因(坑点 3)。
选择划分的经验法则:发论文对比文献选官方口径(可直接进对比表),做方法开发与消融选 4 折(方差更小、样本利用更充分),做产品选型选官方 Test1 + 自有临床数据双层(先证明协议内能力、再证明落地能力)。
把这条经验法则压缩成一句决策口令:先问对比对象是谁,再选划分——对比文献用官方口径、对比自己用交叉验证、对比临床用外测数据。三种目的使用三种划分且不混报,是本集使用纪律中性价比最高的一条。
§5.3 泄漏风险
本集患者级泄漏面较小(每张影像独立、无患者重复的公开记载),但有三处实际泄漏通道:其一,把 Test1Data 或 Test2Data 并入训练后仍引用官方测试成绩;其二,混用 2014 期 300 张口径与 2015 期 400 张口径——前者的 300 张全部包含在后者内,跨口径的训练/测试混合会使同一影像横跨两侧;其三,使用第三方派生集做预训练再用本集测试,若派生集本身来自同一批影像(社区重打包较多),泄漏同样成立。防御方式见坑点 3 与坑点 6。
| 泄漏通道 | 检查动作 | 触发条件 |
|---|---|---|
| 测试集混入训练 | 训练清单 ∩ {151-400} 应为空 | 目录合并加载、glob 全目录扫描 |
| 两期口径混合 | 确认训练数据只来自单一分发版本 | 同时持有 300/400 两版数据 |
| 派生集回声 | 比对派生集与本集图像哈希/尺寸指纹 | 预训练用了同名数据集的派生版 |
| 编号区间破坏 | 自建划分须避开官方区间语义 | 随机重划分后仍引用官方成绩 |
§5.4 交叉验证建议
在小数据集上,4 折或 5 折交叉验证(沿 Payer 划分口径)比单次 150/250 划分更能稳定估计泛化性能;轮换折内应固定图像编号而非重采样,并在每折报告 MRE 与 SDR@2mm 双指标。若目标是与文献直接对比,建议双轨制:交叉验证结果用于方法内部消融,官方 150/150/100 划分用于对外报告。
交叉验证的一个本集特有注意点:折间轮换会把 Test2Data 的后收集样本混入各折训练侧,等于用掉了它"时间外推"的检验价值;若需要保留这一维度,交叉验证应只在 300 张(2014 期)上进行,Test2Data 单独留作时间外推测试。
§5.5 外部验证建议
跨机构泛化只能靠外部集合回答:北京大学口腔医院集(102 张、19 点)是文献中最常用的外测集,另有部分工作使用本单位回溯性头颅侧位片。外测时应保持点集定义与坐标原点约定一致,并按逐点而非仅均值报告退化幅度(骨点与软组织点的跨机构退化模式差异显著)。
外部验证的执行清单:核对点集定义与本集 L1-L19 一致;统一坐标原点与方向约定;GT 口径对齐(单医师标注的外部集与本集"两人平均"存在系统差);逐点报告并单独跟踪 Go/Ar 的退化;把外测成绩作为上线门槛而非参考数字。
§6 AI 就绪指南
§6.0 云端快速启动
本数据集体量小(影像约 2 GB 量级),本地单卡即可完成全流程,无云平台强制需求。若在云端复现,任意通用 GPU 实例(8 GB 显存以上)均可:数据可通过社区工具库脚本下载(见 §6.2),加载与预处理逻辑与本节代码一致。
| 环境 | 最低配置 | 说明 |
|---|---|---|
| 本地 CPU | 4 核 / 8 GB 内存 | 数据下载、格式核对、Lindner 基线可行 |
| 本地 GPU | 8 GB 显存 | 热图回归全量训练(长边 1024) |
| 云端 GPU 实例 | 8-16 GB 显存 / 20 GB 磁盘 | 磁盘预留双份数据 + 哈希校验空间 |
§6.1 快速上手
下述代码假设目录结构为 §4.0 所示的 cepha400/:影像按 TrainingData/Test1Data/Test2Data 三目录组织,标注在 400_junior/ 与 400_senior/ 两个平行目录中按 <image_id>.txt 存储(每行 “x y” 共 19 行,按 L1-L19 顺序)。data_root 变量需拼接到该目录;最小可用子集为 TrainingData 150 张 + 任一标注目录。
# -*- coding: utf-8 -*-
"""快速上手:读一张头颅侧位片与其 19 点标注。
目录预期(data_root 拼接后):
data_root/TrainingData/001.bmp ... 150.bmp
data_root/400_senior/001.txt (每行 "x y",19 行,L1-L19 顺序)
注意:标注文本给出的是 (x, y) 像素坐标,与 numpy 图像的
(row, col) 索引顺序相反——这是本数据集最常见的加载坑(坑点 4)。
"""
import numpy as np
from PIL import Image
from pathlib import Path
DATA_ROOT = Path("cepha400") # ← 改成你的数据根目录
POINT_NAMES = [
"S", "N", "O", "P", "A", "B", "Pog", "Me", "Gn", "Go",
"IncLower", "IncUpper", "LipUpper", "LipLower", "Sn",
"Pos", "PNS", "ANS", "Ar",
] # L1-L19,与标注文件行序一一对应
def load_sample(image_id: str, annotator: str = "senior"):
img_path = DATA_ROOT / "TrainingData" / f"{image_id}.bmp"
img = np.asarray(Image.open(img_path).convert("L")) # (H=2400, W=1935)
txt = (DATA_ROOT / f"400_{annotator}" / f"{image_id}.txt").read_text()
pts = np.array([[float(v) for v in line.split()[:2]]
for line in txt.strip().splitlines()]) # (19, 2) → (x, y)
return img, pts # pts[:, 0]=x(列方向),pts[:, 1]=y(行方向)
img, pts = load_sample("001")
print(img.shape) # (2400, 1935)
print(dict(zip(POINT_NAMES, pts[:3].round(1).tolist())))
§6.2 数据获取
| 渠道 | 内容 | 门槛 | 说明 |
|---|---|---|---|
| IEEE ISBI 2015 挑战官方页 | 挑战介绍、协议与论文入口 | 无 | 官方下载入口已失效,此页作为历史与协议出处 |
| 学术社区开源分发(工具库附带脚本) | 400 张完整版 + junior/senior 双标注 + 划分脚本 | 无注册 | 现行主要获取方式;下载后按坑点 6 核对完整性 |
| 论文附录与项目主页(冠军及后续方法) | 部分作者提供数据镜像或处理脚本 | 视作者 | 适合需要复现特定方法的场景 |
获取流程三步:从挑战官方页确认协议口径(研究用途)→ 经社区开源渠道取 400 张完整版 → 解压后按"三子集 150/150/100 + 双标注目录齐全 + 每个标注文件 19 行"三项清单核对(任一不满足即可能拿到重打包残缺版,见坑点 6)。挑战期原流程为官网注册申请下载、限研究用途;官网已失效,许可以实际获取渠道声明为准。
获取后的登记清单(写入实验记录):来源渠道 URL 与获取日期;目录树哈希或文件清单哈希;影像数量与三子集分布;双标注目录是否齐全;抽检 3 张图像的分辨率(应为 1935×2400)。这五项登记直接对应坑点 5/6 的防御,也是日后任何复现问题排查的第一手证据。
§6.3 预处理全流程
流程四步:格式归一(BMP/TIFF 统一读为灰度 uint8/uint16)→ 分辨率归一(保持长宽比缩放,坐标同步缩放)→ 强度归一 + 局部对比增强(CLAHE 利于低对比软组织点)→ 输出热图或坐标两种监督形态。
import cv2
import numpy as np
IMG_SIZE = (1024, 1256) # (宽, 高):1935×2400 等比缩放约 0.523 倍
SCALE = 1024 / 1935 # 坐标缩放系数(x 方向;y 方向同比例)
def preprocess(img, pts):
"""img: (2400, 1935) uint8 灰度;pts: (19, 2) 原图 (x, y) 坐标。"""
# 1) 尺寸归一:保持纵横比,坐标同步缩放(否则标签错位,坑点 4 的延伸)
h0, w0 = img.shape
resized = cv2.resize(img, IMG_SIZE, interpolation=cv2.INTER_AREA)
pts_scaled = pts * [SCALE, SCALE]
# 2) 强度归一 + CLAHE:软组织点(上/下唇)对比度低,CLAHE 提升可检性
clahe = cv2.createCLAHE(clipLimit=2.0, tileGridSize=(16, 16))
img_eq = clahe.apply(resized)
img_eq = (img_eq.astype(np.float32) / 255.0)[None, ...] # (1, H, W)
# 3) 高斯热图监督(半径随缩放后的 mm 换算校准:0.1 mm/px × SCALE)
sigma_px = 2.0 / 0.1 * SCALE # 2 mm 半径 → 像素 σ
heatmaps = np.zeros((19, *IMG_SIZE[1::-1]), dtype=np.float32)
for i, (x, y) in enumerate(pts_scaled):
yy, xx = np.mgrid[0:IMG_SIZE[1], 0:IMG_SIZE[0]]
heatmaps[i] = np.exp(-((xx - x) ** 2 + (yy - y) ** 2) / (2 * sigma_px ** 2))
return img_eq.astype(np.float32), heatmaps, pts_scaled.astype(np.float32)
要点:缩放后像素间距从 0.1 mm 变为约 0.191 mm,评测前必须把预测坐标除以 SCALE 还原到原图尺度再计算毫米误差;2 mm 临床阈值对应原图 20 像素半径,不要在缩放图上直接用 20 像素判成功。
§6.4 PyTorch DataLoader
import torch
from torch.utils.data import Dataset, DataLoader
import numpy as np
from PIL import Image
from pathlib import Path
class Cepha400Dataset(Dataset):
"""ISBI 2015 头颅侧位片 19 点检测 Dataset。
data_root 预期结构(与 §4.0 目录树一致):
data_root/{TrainingData,Test1Data,Test2Data}/<id>.bmp
data_root/{400_junior,400_senior}/<id>.txt
输出:图像张量 (1, H, W)、原图尺度坐标 (19, 2)、图像 id。
"""
POINT_NAMES = ["S", "N", "O", "P", "A", "B", "Pog", "Me", "Gn", "Go",
"IncLower", "IncUpper", "LipUpper", "LipLower", "Sn",
"Pos", "PNS", "ANS", "Ar"]
def __init__(self, data_root, subset="TrainingData", annotator="senior",
img_size=(1024, 1256), augment=False):
self.root = Path(data_root)
self.img_dir = self.root / subset
self.ann_dir = self.root / f"400_{annotator}"
self.ids = sorted(p.stem for p in self.img_dir.glob("*"))
self.img_size = img_size
self.augment = augment
self.scale = img_size[0] / 1935 # 等比缩放系数
def __len__(self):
return len(self.ids)
def __getitem__(self, idx):
image_id = self.ids[idx]
img = np.asarray(Image.open(self.img_dir / f"{image_id}.bmp").convert("L"))
txt = (self.ann_dir / f"{image_id}.txt").read_text()
pts = np.array([[float(v) for v in line.split()[:2]]
for line in txt.strip().splitlines()], dtype=np.float32)
if self.augment:
img, pts = self._augment(img, pts)
h, w = img.shape
img_r = np.asarray(Image.fromarray(img).resize(self.img_size))
pts_s = pts * self.scale
img_t = torch.from_numpy(img_r.astype(np.float32) / 255.0)[None]
# 评测时将 pts_s / self.scale 还原到原图尺度再算毫米误差
return img_t, torch.from_numpy(pts_s), image_id
def _augment(self, img, pts):
# 小角度旋转 + 平移:硬点(S/N/Go)耐受力尚可,软组织点幅度减半
ang = np.random.uniform(-5, 5)
dx, dy = np.random.uniform(-20, 20, 2)
M = cv2.getRotationMatrix2D((img.shape[1] / 2, img.shape[0] / 2), ang, 1.0)
M[:, 2] += (dx, dy)
img = cv2.warpAffine(img, M, img.shape[::-1], flags=cv2.INTER_LINEAR)
ones = np.ones((19, 1), dtype=np.float32)
pts = (np.hstack([pts, ones]) @ M.T).astype(np.float32)
return img, pts
loader = DataLoader(Cepha400Dataset("cepha400", subset="TrainingData", augment=True),
batch_size=4, shuffle=True, num_workers=4, pin_memory=True)
§6.5 八大坑点
⚠️ 坑点 1:双标注版本并存,GT 定义不统一(分类:标签理解)
问题:数据以
400_junior与400_senior两个平行目录分发,不同论文取不同 GT——有的用 senior 单版,有的用两人平均(挑战官方口径),两套 GT 之间本身就是 1.73 mm 量级的系统差。
症状:同一模型同一测试集,自己复现的 MRE 与论文数字差 0.3-0.5 mm 却找不到代码 bug;对照实验里"复现 baseline 略差"的结论实际来自 GT 口径不一致。
解决:
- 简单方法:启动时打印所用 GT 口径到日志(
gt = "avg"或"senior"),所有对比实验强制同一口径。- 进阶方法:以两人平均为 GT 报告主结果,同时给出 senior 单版成绩作为敏感性分析;两者差值即观察者间不确定性传递。
- SOTA 方法:把 junior/senior 差异当作标签噪声建模(异方差回归或重标注置信加权),在损失里显式吸收 1.73 mm 的观察者方差。
参考:Wang et al., IEEE TMI 34(9):1890-1900, 2015(DOI 10.1109/TMI.2015.2412951);MDPI Diagnostics 16(17):2726(双版本记载)。
⚠️ 坑点 2:Test1 与 Test2 分布不同,两套成绩混报(分类:评估误用)
问题:Test1Data(151-300)为场外评测集,Test2Data(301-400)是现场决赛前新收集的 100 张,两者存在分布差异;挑战论文中冠军 Test1 MRE 1.67 mm、Test2 MRE 1.92 mm,Test2 系统性更难。
症状:论文表格里把 Test1 与 Test2 成绩取平均或混排在同一列;复现者用 Test2 调参后在 Test1 上"掉点",误判为过拟合。
解决:
- 简单方法:报告时两列分开写清
Test1/Test2,禁止合并平均。- 进阶方法:模型选择与早停只用 TrainingData 内部验证;Test1 只作对外评测,Test2 仅在最终锁定后跑一次。
- SOTA 方法:对两测试集分别做逐点 SDR 矩阵并排报告,显式展示分布差异集中在哪些点,作为方法鲁棒性证据。
参考:Wang et al., Medical Image Analysis 31:63-76, 2016;IET Computer Vision(DOI 10.1049/cvi2.70056)。
⚠️ 坑点 3:划分协议并存,基准分数不可直接比较(分类:评估误用)
问题:官方 150/150/100 划分、Payer 4 折交叉验证(每折约 100 张、常合并 Train+Test1 轮换)与各类随机 3:1 划分在文献中并存,测试集构成完全不同。
症状:自己 5 折均值 76% 的 SDR@2mm 对不上文献 73.68% 的"同数据集"成绩,误以为方法更强或更弱;综述表格排序失真。
解决:
- 简单方法:复现前先核对论文的划分协议与测试集定义,再决定对照哪一列数字。
- 进阶方法:双轨报告——交叉验证均值±标准差用于内部消融,官方 150/150/100 单次成绩用于文献对比,两者分列。
- SOTA 方法:在论文附录给出逐图像编号的测试清单(官方口径为 151-300 与 301-400),使任何复现可精确对齐。
参考:社区工具库 cepha400.py(4 折划分);Wang et al., Medical Image Analysis 31:63-76, 2016(官方口径)。
⚠️ 坑点 4:坐标 (x, y) 与 (row, col) 顺序错配(分类:工程陷阱)
问题:标注文本每行存的是
(x, y)(列, 行),而 numpy 图像数组索引是[row, col]、热图生成与argmax返回也各有约定;三处顺序任何一处不一致即静默错位。
症状:训练损失正常下降,但可视化叠加图上所有点呈对称镜像或整体翻转;SDR 恒为 0 而坐标逐点误差看起来"不算离谱"。
解决:
- 简单方法:加载后立即做一次叠加可视化人眼校验 19 点位置(S 在颅中窝、Go 在下颌角)。
- 进阶方法:在 Dataset 内固定"内部一律 (row, col)、与外界交互一律 (x, y)"的单一转换点,配单元测试断言坐标落在图像范围内。
- SOTA 方法:在评测脚本里加入不变性自检——对同一预测分别按两种顺序计算 SDR,两者差异应接近 0,否则报警。
参考:社区工具库 DeepWiki 文档(坐标翻转记载);§6.1 注释。
⚠️ 坑点 5:TIFF 与 BMP 两种格式记载并存,像素口径有差异风险(分类:预处理陷阱)
问题:挑战期官方分发为 TIFF 的记载与开源分发版普遍为 BMP 的事实并存;不同重打包版本在位深(8/16 bit)、灰度窗与压缩选项上可能不一致。
症状:同一份代码在不同来源数据上预处理结果不同——CLAHE 后对比度分布明显漂移;跨来源训练/测试的模型分数不可复现。
解决:
- 简单方法:加载时统一
convert("L")归为 8-bit 灰度,并记录每张图的 dtype 与灰度直方图统计。- 进阶方法:对全量 400 张做一遍完整性扫描(分辨率必须 1935×2400、方差非零),把异常图像清单写入数据卡。
- SOTA 方法:将像素统计(均值/分位数)纳入数据版本指纹,与划分协议一起锁进实验配置,跨版本结果不混报。
参考:Springer Artificial Intelligence Review(DOI 10.1007/s10462-025-11135-8);§3.3。
⚠️ 坑点 6:官网失效与重打包派生集,须认准 400 张完整版(分类:工程陷阱)
问题:原挑战站已失效,社区流传多个重打包版本——有的只含 TrainingData、有的把两期 300/400 张混装、有的丢失双标注目录;文件名与目录命名也不统一。
症状:复现论文时数据量对不上(300 vs 400);找不到 Test2Data 导致只能报 Test1 成绩;他人用你的权重复现失败只因数据版本不同。
解决:
- 简单方法:下载后数三样——影像 400、子集 150/150/100、每标注文件 19 行,缺一即视为残缺版。
- 进阶方法:在实验记录中登记数据来源 URL、获取日期与目录树哈希;引用时注明"400 张完整版(2015 期)"而非泛称 ISBI 数据。
- SOTA 方法:团队内建数据登记表(版本、构成、来源、许可口径),所有实验引用登记表条目;对重打包版本单独编号隔离。
参考:IEEE ISBI 2015 挑战官方页(https://biomedicalimaging.org/2015?p=593);§6.2。
⚠️ 坑点 7:逐点难度差异巨大,平均指标掩盖骨点退化(分类:偏倚陷阱)
问题:19 点难度极不均匀——软组织点 SDR@2mm 可达 90% 以上,而 Go(下颌角点)等双侧骨性界标在部分研究中低至 38%;均值被易点拉高,最难的点决定临床可用性。
症状:整体 SDR@2mm 75% 看起来"达标",但自动测量的 ANB 角仍不可用——因为 A、B 两点的个别失败直接击穿角度计算;不同方法间的排名在逐点层面完全洗牌。
解决:
- 简单方法:任何结果表都附 19 点逐点 SDR 行,禁止只报均值。
- 进阶方法:把 Task2 的八项测量误差(度数)与逐点误差一起报告,直接回答"测量是否可用"而非"点是否可检"。
- SOTA 方法:对困难点(Go/Ar/Gn)采用解剖先验(下颌缘曲线拟合)或难度感知采样,单独跟踪其收敛曲线。
参考:Angle Orthodontist 2021(PMC8084461,表 2 逐点统计)。
⚠️ 坑点 8:460 万像素大图过激下采样,mm 级精度被插值吃掉(分类:预处理陷阱)
问题:1935×2400 直接 resize 到 256×256(常见 backbone 输入)后,像素间距从 0.1 mm 变为约 0.75 mm,2 mm 临床阈值只剩不到 3 像素余量,插值模糊直接摧毁细点定位。
症状:小分辨率训练的模型在 SNA/SNB 等角度计算上系统性偏大;SDR@2mm 上不去而 SDR@4mm 正常——典型"精度档位塌陷"。
解决:
- 简单方法:保持长边 ≥1024(缩放系数约 0.523),评测前坐标除以缩放系数还原原图尺度。
- 进阶方法: coarse-to-fine 两级策略——低分辨率粗定位 + 以预测点为中心裁剪原分辨率局部图精修,兼顾显存与精度。
- SOTA 方法:热图监督的 σ 按"缩放后的 2 mm 对应像素数"动态校准(§6.3 代码),并在验证集上扫描 σ 敏感性。
参考:§6.3;Lindner et al., Scientific Reports 6:33581, 2016(多尺度回归投票思路)。
§6.6 数据增强
| 增强方式 | 安全性 | 说明 |
|---|---|---|
| 小角度旋转(±5°) | ✅ 安全 | 同步变换坐标;软组织点敏感,幅度宜减半 |
| 小幅平移/缩放(±20 px,0.9-1.1×) | ✅ 安全 | 坐标同步变换;缩放后注意 mm 换算 |
| CLAHE/对比度抖动 | ✅ 安全 | 利于低对比软组织点;避免过强噪声注入 |
| 水平翻转 | ❌ 危险 | 头颅侧位有固定朝向约定,翻转破坏解剖左右关系 |
| 垂直翻转 | ❌ 危险 | 重力方向与颈椎序列被破坏,点定义全部失效 |
| 大角度旋转(>15°) | ❌ 危险 | 偏离投照规范,真实采集不会出现该分布 |
增强幅度的总原则:一切以"模拟真实采集变化"为界——投照角度的抖动、体位偏移、曝光条件波动都是安全增强的物理依据;而翻转、大角度旋转改变了解剖约定本身,模型会学到影像库中不存在的分布。拿不准时用叠加可视化检查增强样本上 19 点是否仍在解剖学合理位置。
§6.7 模型推荐
| 模型/路线 | 适用性 | 说明 |
|---|---|---|
| 随机森林回归投票(Lindner & Cootes) | 基线经典 | 冠军方法;patch 采样 + RBF voting,工程可复现 |
| 热图回归 CNN(U-Net/HRNet) | 主流首选 | 逐点热图 + argmax/soft-argmax;注意坑点 8 的分辨率纪律 |
| 空间配置整合热图回归(Payer 等) | 精度导向 | 引入解剖构型先验,社区 4 折口径的代表方法 |
| Transformer/ViT 混合架构 | 研究探索 | 大图 patch 化后全局上下文强,400 张样本下需强正则 |
模型选择的判断顺序:先用 Lindner 基线校准评测管线(确认 SDR 计算与文献对得上),再上热图回归主力模型,最后才考虑架构创新——顺序颠倒的团队常在"自研架构不如基线"的假象上浪费周期,实际是评测管线有 bug(坑点 4)或分辨率纪律失守(坑点 8)。
§6.8 硬件需求
| 场景 | 显存 | 说明 |
|---|---|---|
| 热图回归(长边 1024,batch 4) | 8 GB | 消费级单卡即可全量训练 |
| 热图回归(长边 2048 或 coarse-to-fine 精修) | 16-24 GB | 精修阶段原分辨率局部图显存开销大 |
| 推理/评测 | 4 GB | 单张推理毫秒级,CPU 亦可 |
硬件结论:这是全站最"平民"的影像基准之一——单张 2400p 灰度图、400 张总量,一台游戏本即可完成从复现到改进的完整闭环。显存瓶颈只出现在"原分辨率精修"环节,coarse-to-fine 的裁剪策略正是为此设计(§6.3)。
§6.9 评估指标代码
评测实现的三点说明:坐标误差在原图尺度按欧氏距离计算,再乘像素间距 0.1 mm 转为毫米;SDR 按"逐点误差 ≤ 半径"判定后取全体百分比,分子分母与挑战论文一致(分母恒为点总数,§4.5);逐点 SDR 单独输出,供困难点监控与论文逐点表使用。
import numpy as np
RADII = (2.0, 2.5, 3.0, 4.0) # mm,SDR 四档半径;2 mm 为临床可接受阈值
def evaluate(pred, gt, pixel_spacing=0.1):
"""pred/gt: (N, 19, 2) 原图像素坐标 (x, y)。
返回 dict:MRE、SD 与各半径 SDR(百分比,保留两位小数)。
"""
err_mm = np.linalg.norm(pred - gt, axis=-1) * pixel_spacing # (N, 19)
out = {
"MRE_mm": round(float(err_mm.mean()), 2),
"SD_mm": round(float(err_mm.std()), 2),
}
for r in RADII:
out[f"SDR@{r}mm_%"] = round(float((err_mm <= r).mean() * 100), 2)
out["per_point_SDR@2mm_%"] = (err_mm <= 2.0).mean(axis=0).round(4) * 100
return out
# 期望对照:2015 冠军 Test1 → MRE 1.67, SD 1.48,
# SDR@2/2.5/3/4 = 73.68 / 80.21 / 85.19 / 91.47
§6.10 MLOps 笔记
三条纪律。其一,数据指纹入库:把来源渠道、获取日期、目录树哈希与 GT 口径(平均/senior)写进实验配置,任何分数可回溯(坑点 1/5/6)。其二,评测锁定:Test1/Test2 分开报告、最终模型锁定后才允许触碰测试集;交叉验证折内选择与官方口径评测双轨分离(坑点 2/3)。其三,逐点监控:上线后的自动头影测量服务应持续跟踪 Go/Ar/Gn 等困难点的 SDR@2mm 而非只看均值——困难点退化是扫描协议或人群漂移的最早信号(坑点 7)。
落到工具链上的映射:数据指纹 → DVC/Dolt 等版本化工具登记;评测锁定 → CI 中把测试集路径设为只读工件;逐点监控 → 把 §6.9 的 per_point_SDR@2mm 输出直接接监控面板,按点报警而不是按均值报警。三件事都不需要重型基建,却覆盖了本集最典型的三个生产事故面。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 单中心偏倚 | 全部影像来自中国台湾三军总医院牙科部单台设备 | 高 | 外部验证(PKU 102 张等)后再谈泛化 |
| 年龄混合 | 6-60 岁全龄混布,儿童牙列期与成人骨形态差异大且未分层 | 中 | 按年龄段分层评测;儿童应用单独验证 |
| 标注者极少 | 每图仅 2 名标注者,观察者方差刻画有限 | 中 | 以 1.73 mm 间差为下界解读 GT 不确定性 |
| 挑战赛策展偏倚 | 队列按挑战需求策展而非人群抽样 | 中 | 禁止人群级患病率外推 |
| 难度不均衡 | 骨点(Go/Ar)与软组织点难度悬殊,均值指标失真 | 高 | 强制逐点报告(坑点 7) |
偏倚表的整体结论:本集的五类偏倚里有三类(单中心、年龄混合、策展偏倚)属于"先天构造",无法通过数据处理消除、只能靠评测设计与外部验证对冲;两类(标注者极少、难度不均衡)属于"可量化偏倚",本集的双标注结构反而提供了比多数数据集更好的量化条件。使用者应在论文 limitation 部分明确引用前者的存在,并在方法部分利用后者(如难度加权训练)。
§7.2 标注质量
标注质量的量化锚点是 1.73 mm 的双人平均差与"GT 取平均"的官方定义——前者说明任何方法的天花板对标的是"两名医师的折中"而非解剖真值;后者意味着 GT 实际上平滑掉了部分观察者噪声,对训练是利好(目标更稳定),对评测则要求解读 MRE 时留出 GT 自身不确定性的余量。挑战期为比赛目的组织标注,无第三方仲裁与多点复标记录;构造点(Gn 等)的定义歧义以间差形式体现(§4.5)。
三个实操推论:任何 MRE 差异小于约 0.5 mm 的方法对比都应视为统计噪声区间内的打平;把 GT 当作无噪声真值做强拟合(如极端小的损失权重约束)有过拟合观察者偏好的风险;若条件允许,用 junior/senior 两版分别评测一次,方法排序的稳定性本身就是有价值的报告内容。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 换设备/换医院扫描协议 | 高 | 单中心单设备(Soredex)训练分布,跨设备未见系统验证 |
| 儿童牙列期患者 | 中 | 6-60 岁混合但未分层,牙列期骨点形态差异大 |
| 直接外推到全景片任务 | 高 | 模态不同(侧位 vs 全景),点集定义不通用 |
| 借助 PKU 102 张外测 | 可控 | 文献常规做法,逐点退化可控于 mm 级(§7.8) |
泛化表的实操结论:本集上训练的模型应默认视为"同设备同协议"模型——跨设备应用是外测问题而非调参问题;儿童牙列期场景在启用前必须单独验证;全景片方向的迁移应从共享骨干预训练的角度设计,而不是直接复用点检测头。
§7.4 伦理与合规
影像在公开分发前完成匿名化,不含直接标识符、无文本报告或人口学表格;MDPI 2026 使用声明记载其为完全匿名化的公开人体数据,二次分析无需额外伦理批准。侧位片显示颅面骨骼与软组织侧影,使用者不得尝试面部重建或身份推断。挑战期获取限研究用途,现行许可以获取渠道实际声明为准(CC BY-SA 4.0 为综述转引口径)。
合规检查的三项动作:确认获取渠道附带的许可声明并截图存档(官网失效后这一步尤其重要);论文与产品文档中按渠道声明原文引用许可而非转引综述;衍生数据集再分发时遵守 CC BY-SA 4.0 的相同方式共享要求(若采用该口径)。
§7.5 公平性
人口学信息(性别、种族)官方未披露,无法做亚组公平性审计;可执行的替代审计是年龄亚组评测——在 6-12 岁(牙列期)与成人亚组上分别计算逐点 SDR,检验模型是否系统性偏向成人骨形态。另外,软组织点(唇、颏)的定位受软组织厚度影响,不同人群面型差异可能引入与种族相关的隐性误差,跨人群应用前应以本地数据校准。
公平性维度的诚实结论是:本集提供了做公平性评测的物理条件(全龄覆盖、双标注),但不提供元数据条件(无人口学表)。团队若以公平性为卖点,需要自行补充年龄元数据或引入带人口学标签的外部集合,而不能指望本集直接产出公平性证明。
§7.6 数据漂移
本集采集窗口与设备代际固定(Soredex CRANEX Excel Ceph、0.1 mm 像素间距);当今门诊主流为平板探测器与低剂量协议,图像噪声谱与动态范围已有代际差。长期部署的自动头影测量系统应把"本集校准 → 本机构新片校准"设为周期动作,并以困难点(Go/Ar)SDR@2mm 为哨兵指标——它对扫描协议变化的敏感度高于均值指标。
漂移监控的实操建议:以季度为周期在本机构新片上抽检逐点 SDR,与本集基线的差值超过 5 个百分点即触发协议审查(投照参数、像素间距、患者体位三个检查点);漂移确认后优先做输入端适配(重采样到 0.1 mm 等效间距、窗宽对齐),其次才考虑重训练。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | 每图一条记录单元,19 点标注按固定行序存储 |
| 2 | 有唯一标识符列 | ✅ | 图像编号 001-400 全局唯一 |
| 3 | 无 Unicode 或特殊字符 | ✅ | 编号与目录命名全 ASCII |
| 4 | 无重复行 | ✅ | 400 张独立影像,无重复编号 |
| 5 | 缺失值已识别并编码 | ✅ | 每图 19 点必标,坐标层无缺失 |
| 6 | 标签列被明确标识 | ✅ | 双标注目录分离,点序固定 L1-L19 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 不适用类别分组;Task2 参数区间无官方分组文档 |
| 8 | 已提供偏倚评估 | ⚠️ | 单中心事实明确,无系统偏倚评估文档(§7.1 本页补全) |
| 9 | 附带数据字典 | ⚠️ | 官方仅描述规模与点数;本页 §4.1 已补全字段字典 |
| 10 | 信息性缺失有解释 | ⚠️ | 构造点定义歧义无官方说明文档(§4.5) |
| 11 | 有设备/采集记录 | ✅ | 设备型号、像素间距、采集软件均有文献记载(§3.9) |
| 12 | 共线性已检查 | ⚠️ | 影像任务不适用表格共线性;19 点间解剖相关性无官方分析 |
| 13 | 有编码映射 | ⚠️ | 疾病层有 ICD-11/SNOMED 映射(§2.1);19 点无官方编码表 |
| 14 | 时间戳处理 | ❌ | 精确采集窗口官方未披露,无时间戳随集分发 |
| 15 | 提供划分建议 | ✅ | 官方 150/150/100 划分明确(§5.1) |
| 16 | 有泄漏讨论 | ✅ | 两期数据包含关系明确(300 ⊂ 400),本页 §5.3 已汇总 |
| 17 | 标签分布已记录 | ✅ | 15,200 个标注完整均衡,逐点难度统计有文献支撑(§4.2) |
| 18 | 测量偏倚已讨论 | ⚠️ | 双标注间差 1.73 mm 已知;GT 取平均的偏倚效应无量化分析 |
| 19 | 有外部验证建议 | ⚠️ | PKU 外测为文献惯例,但无结构化建议文档(§5.5 本页补全) |
| 20 | 有版本记录 | ⚠️ | 2014 期/2015 期两版关系明确,但无官方版本号与变更日志 |
| 21 | 附预处理脚本 | ⚠️ | 无官方脚本;社区工具库脚本非官方口径(§6.3 本页提供) |
| 22 | 合规要求清晰 | ⚠️ | 研究用途明确,但 CC BY-SA 4.0 仅为综述转引口径(§3 许可) |
| 23 | 多模态对齐 | ⚠️ | 单模态;影像-坐标-测量三层对齐依赖文件命名约定 |
| 24 | 去标识化说明 | ⚠️ | 匿名化事实明确,官方未详述自身脱敏流程(§7.4) |
DAIMS 评分:13.5 / 24(11 项 ✅ + 11 项 ⚠️ + 2 项 ❌)
评分解读:作为 2015 年挑战赛数据集,其核心工程维度(唯一标识、结构规整、标注完整、官方划分、设备记录)达到了同期少见的完整度——15,200 个标注无一缺失、双人版本并行可查,是"小而规整"的典范。短板集中在元数据透明度:采集时间戳缺失、官方数据字典与版本变更日志缺位、许可口径依赖转引、无官方预处理脚本,这四类缺口是老牌挑战赛数据集在"AI 就绪"新标准下的典型画像。
对你意味着什么:可以直接把本集当作"开箱即训"的检测基准——加载、训练、评测的全部工程风险都集中且可控(坐标顺序、下采样、GT 口径三个坑,本页 §6 已给代码级防御);但不要把它当作生产级数据管线模板——接入自家数据时必须补齐时间戳、版本与许可审计三件事,且对外报告任何数字前先声明所用 GT 口径与划分协议。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 北京大学口腔医院集(102 张) | 北京大学口腔医院 | 19 点检测 | 逐点 SDR/MRE(mm 级) | 跨机构退化集中在骨性界标点 | 文献最常用外测口径,验证跨设备泛化必经之路 |
| 本机构回溯性头颅侧位片 | 各研究自采 | 19 点检测 + 测量误差 | SDR@2mm + ANB 角度误差 | 协议相关,逐点差异显著 | 部署前校准的必要步骤 |
只录有同行评审支撑的外测结果;泛化结论以逐点报告为准(§7.1 难度不均衡偏倚)。
外测矩阵的读法提醒:外部验证的成绩"下降"不是失败信号而是信息本身——退化集中在哪些点、哪个难度档,直接指示了本地校准需要采集多少数据、标注哪类病例。把外测当一次性验收而非持续校准的起点,是生产环境最常见的误用。
§8 基准性能与生态
§8.1 排行榜
⚠️ 数值不可直接比较的原因:Test1(150 张,场外)与 Test2(100 张,现场)分布不同;Payer 4 折等社区划分与官方 150/150/100 并存;GT 口径(两人平均 vs senior 单版)亦有差异。比较前先对齐协议(坑点 2/3)。
| 排名 | 模型/方法 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| — | 深度学习方法(Test1,Angle Orthod 2021 报道) | SDR@2/2.5/3/4 = 75.45/83.66/88.92/94.24%,MRE 1.76 mm | 2021 | 热图回归 + 解析坐标还原 | Angle Orthodontist 2021 论文(PMC8084461) | 部分 |
| 1 | Lindner & Cootes 随机森林回归投票(Test1) | SDR@2/2.5/3/4 = 73.68/80.21/85.19/91.47%,MRE 1.67 mm / SD 1.48 | 2015 | patch 采样 + RBF 回归投票 | Lindner C, Wang CW, Huang CT, Li CH, Chang SW, Cootes TF. Scientific Reports 6:33581, 2016. DOI 10.1038/srep33581 | 部分 |
| 1 | Lindner & Cootes(Test2,现场决赛) | SDR@2/2.5/3/4 = 66.11/72.0/77.63/87.42%,MRE 1.92 mm / SD 1.24 | 2015 | 同上 | 同上 | 部分 |
| 前代 | 2014 期挑战最佳(100 张同集对比) | SDR@2mm 71.48% | 2014 | 挑战期参赛方法 | Wang CW et al. IEEE TMI 34(9):1890-1900, 2015. DOI 10.1109/TMI.2015.2412951 | — |
| 对照 | Lindner & Cootes 在 2014 期 100 张上的成绩 | SDR@2mm 74.84%(较 2014 最佳 +4.4%,2 mm 档 +6.6%) | 2016 | 同冠军方法 | 同 Lindner 2016 | 部分 |
榜单的三个解读要点:其一,冠军在 Test1 与 Test2 上的落差(73.68% → 66.11%,SDR@2mm 口径)直接量化了分布差异的代价,是评估自家方法鲁棒性的现成参照;其二,深度学习方法 75.45% 相对冠军的 +1.77 个百分点,处于 GT 观察者间不确定性的边缘区间,解读时应克制;其三,2014 期 71.48% 与 2015 期数字不可混排——两者测试集构成不同。
§8.2 SOTA 总结与选型建议
技术演进脉络清晰:2014-2015 年随机森林回归投票定下基线(SDR@2mm 73.68%),此后热图回归 CNN 把 Test1 整体推进到约 75.45%,深度学习时代的主要增益来自分辨率纪律(坑点 8)与解剖构型先验。选型建议:追求可复现基线选 Lindner 路线(patch 回归投票,400 张样本下无需 GPU 也能跑通);追求当前精度选热图回归 + coarse-to-fine 精修;生产部署优先 Task2 测量误差而非 SDR——角度误差直接对应临床判读。所有方法的共同天花板是 GT 自身的 1.73 mm 观察者间差。
按团队目标的细粒度建议:方法研究团队应把精力放在困难点(Go/Ar/Gn)与 Task2 测量误差上——易点已接近饱和,边际增益集中在难区;工程团队应优先复现热图回归基线并锁定分辨率纪律,再谈架构升级;临床转化团队则应从第一天起用角度误差而非像素误差设定验收标准,避免"SDR 好看、角度不可用"的返工。
§8.3 评测协议
官方协议分两阶段:场外阶段经线上系统对 Test1Data(150 张)评测,现场阶段在 ISBI 2015(纽约布鲁克林)对 Test2Data(100 张)决赛评测。指标两套:Task1 报告逐点径向误差的均值 MRE、标准差 SD 与四档半径成功率 SDR(2/2.5/3/4 mm,2 mm 为临床可接受阈值);Task2 报告由检测点计算的八项头影测量参数(ANB/SNB/SNA/ODI/APDI/FHI/FHA/MW)分类准确率。协议细节固化于 IEEE TMI 2015 与 Medical Image Analysis 2016 两篇论文,后续文献(含 MICCAI 2019 相关工作,DOI 10.1007/978-3-030-32248-9_97)沿用同一口径。
| 协议要素 | 规格 | 复现要点 |
|---|---|---|
| 场外阶段 | Test1Data 150 张,线上评测 | 成绩单以 SDR 四档 + MRE/SD 报告 |
| 现场阶段 | Test2Data 100 张,ISBI 2015 决赛 | 新收集样本,分布与 Test1 有差 |
| 径向误差 | 欧氏距离 × 0.1 mm/像素 | 必须先还原到原图尺度再计算 |
| 成功判定 | 误差 ≤ 半径(2/2.5/3/4 mm) | 2 mm 档为主指标 |
| Task2 分类 | 八项测量参数分类准确率 | 由预测点计算,误差链式传导 |
§8.4 相关数据集
| 数据集 | 关系 | 差异 |
|---|---|---|
| ISBI 2014 期数据(300 张) | 上游版本 | 2015 期 400 张完整包含其影像;口径与成绩不可混比 |
| 北京大学口腔医院集(102 张) | 外部验证集 | 跨机构泛化测试的文献惯例口径 |
| DENTEX(站内收录) | 同域不同模态 | 全景片牙齿编号与病灶检测,与本集骨骼关系分析互补 |
| Tufts Dental(站内收录) | 同域 | 牙科教学影像集合,标注体系与本集点式标注不同 |
| MIMIC-CXR / CheXpert(站内收录) | 胸片方向 | 模态与任务正交,仅作为医疗 X 光大集合生态参照 |
选择组合的两种典型策略:做牙科垂直方向,本集 + DENTEX + Tufts Dental 覆盖"骨骼关系 + 牙齿病灶"两大主线,共用牙科 X 光骨干网络预训练;做通用 X 光方法论,本集 + 胸片集合(MIMIC-CXR、CheXpert)可验证"点式定位"与"区域分类"两种监督形态之间的迁移性。两条路线都不应把本集仅当作预训练语料——其评测协议才是最值钱的部分。
§8.5 关键论文 Top5
- Wang CW, Huang CT, Hsieh MC, Li CH, Chang SW, et al. “Evaluation and Comparison of Anatomical Landmark Detection Methods for Cephalometric X-Ray Images: A Grand Challenge.” IEEE Transactions on Medical Imaging 34(9):1890-1900, 2015. DOI 10.1109/TMI.2015.2412951 — 2014 期挑战论文,定义了 mm 级 SDR 评测语言与临床可接受阈值。
- Wang CW, Huang CT, Lee JH, Li CH, Chang SW, et al. “A benchmark for comparison of dental radiography analysis algorithms.” Medical Image Analysis 31:63-76, 2016. — 2015 期挑战论文,固化 400 张完整版协议与两阶段成绩,是引用本数据集的规范出处。
- Lindner C, Wang CW, Huang CT, Li CH, Chang SW, Cootes TF. “Fully automatic system for accurate localisation and analysis of cephalometric landmarks in lateral cephalograms.” Scientific Reports 6:33581, 2016. DOI 10.1038/srep33581 — 冠军方法完整技术报告,随机森林回归投票路线的代表作。
- Ghafari M, Bahadivand-Chegini S, Nadi T, Doosti-Irani A. “The global prevalence of dental healthcare needs and unmet dental needs among adolescents: a systematic review and meta-analysis.” Epidemiology and Health 41:e2019046, 2019. DOI 10.4178/epih.e2019046 — 错牙合治疗需求流行病学锚点(§2.2 数字出处)。
- Payer C, Štern D, Bischof H, Urschler M 等热图回归系列工作(MICCAI 2019 相关论文,DOI 10.1007/978-3-030-32248-9_97) — 社区 4 折划分口径的代表方法与评测协议延续者。
- Springer Artificial Intelligence Review(DOI 10.1007/s10462-025-11135-8,2025) — 牙科影像 AI 系统综述,本集设备规格(Soredex CRANEX Excel Ceph)与 TIFF 格式记载的转引源。
§8.6 社区活跃度
本集的社区形态是"经典基准的长尾活跃":挑战本身已收官,但作为牙科标志点检测的默认对比表,每年仍有新论文引用其协议与数字;社区维护以开源工具库(下载/划分/加载脚本)与复现仓库为主,散见于 GitHub 与论文附录。官网失效后未出现统一的官方镜像,社区分发呈多点并存的格局(坑点 6 的版本核对纪律因此必要)。冠军方法论文 255+ 引用(Google Scholar,截至 2026-09)可作生态热度参考。
活跃度的结构特征值得注意:本集的社区不是"issue 区答疑问"型,而是"论文引用链"型——绝大多数技术讨论发生在论文与综述的对比表里,而非某个集中仓库。这意味着遇到问题时应优先查挑战论文与综述(§8.5、§9.2),而不是期待官方渠道答复;官网失效后官方支持事实上已经终止。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| IEEE ISBI 2015 挑战官方页 | 官方历史页 | https://biomedicalimaging.org/2015?p=593 | 协议与挑战背景的权威出处 |
| Wang TMI 2015 挑战论文 | 评测协议 | https://doi.org/10.1109/TMI.2015.2412951 | SDR 指标定义与 2014 期基准 |
| Wang MedIA 2016 论文 | 协议固化 | Medical Image Analysis 31:63-76 | 400 张完整版口径与两阶段成绩 |
| Lindner Sci Rep 2016 | 冠军方法 | https://doi.org/10.1038/srep33581 | 基线复现首选 |
| 社区工具库(landmarker 等) | 数据/脚本 | 经学术社区开源渠道分发 | 下载、划分与加载脚本(非官方) |
生态使用的建议路径:以挑战页确认协议 → 以两篇挑战论文为评测口径权威 → 以冠军论文为基线实现参照 → 社区工具库仅用于获取数据与工程便利。杜绝反向依赖(把社区脚本当协议出处),这是版本混乱的直接来源。
对生态状态的一句话总结:本集的一切权威口径(协议、成绩、许可)都可以在挑战页与两篇挑战论文里找到原文,而一切工程便利(下载、脚本、派生集)都在社区手里——把两类资源的使用边界划清,是本集区别于"官方全程托管"型数据集的使用纪律。这也意味着:本页 §9.1 与 §9.2 的分组不是随意的目录学安排,而是这条纪律的直接映射。
§9 相关资源与引用
§9.1 官方资源
- IEEE ISBI 2015 Grand Challenge 挑战页(Challenge #1 Cephalometric):https://biomedicalimaging.org/2015?p=593
- 2014 期挑战论文(IEEE TMI 2015):https://doi.org/10.1109/TMI.2015.2412951
- 2015 期挑战论文(Medical Image Analysis 2016):Medical Image Analysis 31:63-76
- 冠军方法论文(Scientific Reports 2016):https://doi.org/10.1038/srep33581
- 原挑战站(历史存档口径):www-o.ntust.edu.tw/~cweiwang/ISBI2015/challenge1/(已失效,2026-09-16 验证)
以上资源中,挑战页与两篇挑战论文是理解本集的必读入口:前者保留赛事组织与两阶段赛制的一手记载,后者分别固化 2014 期与 2015 期的评测协议与全部官方成绩。
§9.2 社区与工具资源
- 社区工具库(下载/划分/加载脚本,含双标注目录支持):经学术社区开源分发渠道获取(非官方)
- 深度学习逐点基准统计(Angle Orthodontist 2021):PMC8084461
- 牙科影像算法基准综述(Artificial Intelligence Review,2025):DOI 10.1007/s10462-025-11135-8
- CC BY-SA 4.0 口径记载(MDPI Diagnostics 2026):MDPI Diagnostics 16(17):2726
以上社区资源均非官方渠道:工具库脚本是社区整理、综述与期刊记载属二手转述。正式实验请以挑战论文协议为准,社区资源适合获取数据与快速验证场景;下载后按坑点 6 清单核对版本完整性。
§9.3 BibTeX 引用
以下三条覆盖数据使用的主要引用场景(协议与 2014 期基准、2015 期数据条目本身、冠军方法);其余文献按 §9.1/§9.2 所列 DOI 引用。
@article{wang2015evaluation,
author = {Wang, Ching-Wei and Huang, Cheng-Ta and Hsieh, Ming-Chieh and
Li, Chung-Hsing and Chang, Sheng-Wei and Li, Wei-Cheng and others},
title = {Evaluation and Comparison of Anatomical Landmark Detection Methods
for Cephalometric X-Ray Images: A Grand Challenge},
journal = {IEEE Transactions on Medical Imaging},
volume = {34},
number = {9},
pages = {1890--1900},
year = {2015},
doi = {10.1109/TMI.2015.2412951}
}
@article{wang2016benchmark,
author = {Wang, Ching-Wei and Huang, Cheng-Ta and Lee, Jia-Hong and
Li, Chung-Hsing and Chang, Sheng-Wei and Siao, Ming-Jhih and others},
title = {A benchmark for comparison of dental radiography analysis algorithms},
journal = {Medical Image Analysis},
volume = {31},
pages = {63--76},
year = {2016}
}
@article{lindner2016fully,
author = {Lindner, Christian and Wang, Ching-Wei and Huang, Cheng-Ta and
Li, Chung-Hsing and Chang, Sheng-Wei and Cootes, Timothy F.},
title = {Fully automatic system for accurate localisation and analysis of
cephalometric landmarks in lateral cephalograms},
journal = {Scientific Reports},
volume = {6},
pages = {33581},
year = {2016},
doi = {10.1038/srep33581}
}
§9.4 引用指南
三条原则。其一,引用数据集本体时以 Medical Image Analysis 2016(wang2016benchmark)为条目出处——它对应 400 张完整版;只做 2014 期口径对比时引 IEEE TMI 2015。其二,报告 SDR/MRE 数字时必须同时声明测试集(Test1/Test2)、划分协议(官方 150/150/100 或 4 折)与 GT 口径(平均/senior),否则数字无意义(坑点 1/2/3)。其三,方法对比引 Scientific Reports 2016(lindner2016fully)为基线出处。
一条加分惯例:在论文的数据集段落同时给出本页 URL 与数据指纹(获取渠道、日期、子集分布),审稿与复现者可以按图索骥核对你的实验版本——这在本集这种"官方渠道失效、社区多点分发"的数据集上尤其能体现工作量与严谨性。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| fast-model(CodeBuddy Code) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch / WebFetch(多源检索) | 2026-09-15/16 | 9 组检索核实:官方名称与主办方、来源机构、规模划分、19 点清单、标注协议、评测指标与冠军成绩、许可口径、ICD-11/SNOMED 编码、流行病学数字 |
检索结果直接改写了种子信息的三处错误(来源机构、主办者、标注者身份),详见 §10.5 与 FACTS.md 纠错记录。
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从挑战官方页、挑战论文、冠军方法论文与综述文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。所有硬数字均以 §10.3 所列来源核实,未经核实的信息一律省略或标注"官方未披露"。
§10.3 输入来源
以下 16 条来源覆盖本页全部事实性内容,编号同时用于编辑部审核追溯:
- IEEE ISBI 2015 Grand Challenge 挑战官方页(挑战名称、两阶段赛制、主办方与规模口径):https://biomedicalimaging.org/2015?p=593
- Wang CW et al., 2015, IEEE Transactions on Medical Imaging 34(9):1890-1900. DOI 10.1109/TMI.2015.2412951(2014 期协议、三军总医院来源、标注协议、SDR 基准)
- Wang CW et al., 2016, Medical Image Analysis 31:63-76(2015 期 400 张完整版协议与两阶段成绩)
- Lindner C, Wang CW, Huang CT, Li CH, Chang SW, Cootes TF, 2016, Scientific Reports 6:33581. DOI 10.1038/srep33581(冠军方法与 Test1/Test2 全部成绩)
- Angle Orthodontist 2021 论文(PMC8084461):深度学习逐点 SDR 统计与困难点分析
- MDPI Diagnostics 16(17):2726(2026):CC BY-SA 4.0 口径、400 例 6-60 岁单设备记载、匿名化使用声明
- Springer Artificial Intelligence Review(DOI 10.1007/s10462-025-11135-8):设备规格(Soredex CRANEX Excel Ceph)、TIFF 格式记载
- IET Computer Vision(DOI 10.1049/cvi2.70056):150/150/100 划分口径与 PKU 102 张外部测试惯例
- arXiv 2501.10984(表 1):19 标志点完整清单与双人标注协议
- 社区工具库 landmarker 及其文档(cepha400.py 划分脚本、400_junior/400_senior 双标注目录、坐标 (x,y) 顺序记载、官网失效验证)
- MICCAI 2019 相关论文(DOI 10.1007/978-3-030-32248-9_97):评测协议延续
- Payer 等热图回归系列工作:4 折交叉验证划分口径
- FindACode ICD-11 索引(DA0E Dentofacial anomalies 区块:DA0E.1/DA0E.2/DA0E.3/DA0E.5):https://findacode.com/icd-11/block-339662111.html
- NCBO BioPortal SNOMED CT(707598004 Malocclusion):https://bioportal.bioontology.org/ontologies/SNOMEDCT
- Ghafari M et al., 2019, Epidemiology and Health 41:e2019046. DOI 10.4178/epih.e2019046(青少年错牙合治疗需求患病率荟萃分析)
- 原挑战站 www-o.ntust.edu.tw/~cweiwang/ISBI2015/challenge1/ 404 验证记录(2026-09-16)与 ICD-11/SNOMED 编码在线工具核验记录
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| INFOBOX 与 §1 概览 | 千方病案医学编辑部 | 逐字段对照 FACTS.md 与来源 URL 复核 | ✅ 已通过 |
| §2 医学背景 | 千方病案医学编辑部 | ICD-11/SNOMED 编码与流行病学数字逐项对照来源 | ✅ 已通过 |
| §3-§5 数据规格与划分 | 千方病案医学编辑部 | 数字逐项对照挑战论文与社区文档,划分口径逐源核对 | ✅ 已通过 |
| §6 AI 就绪指南与坑点 | 千方病案医学编辑部 | 代码逻辑走查 + 坑点与论文/社区文档逐条比对 | ✅ 已通过 |
| §7-§8 质量评估与基准 | 千方病案医学编辑部 | DAIMS 24 项逐项评估 + 基准数字对照冠军论文 | ✅ 已通过 |
| §C JSON-LD | 千方病案医学编辑部 | 与 frontmatter schema_org 序列化一致性核对 | ✅ 已通过 |
校验的执行标准:每张表的关键数字回溯到 §10.3 来源页面的原文表述;种子信息与检索结果不符的三处(来源机构、主办者、标注者身份)已按检索结果改写并留痕于正文相应位置。
§10.5 AI 生成章节标注
全文(frontmatter、INFOBOX、§0-§10、§C)由 AI 生成初稿,经千方病案医学编辑部按 §10.4 所列方式交叉审核后发布;文中全部数字与结论以 §10.3 所列来源为准,检索未核实的信息已整行省略或标注"官方未披露"而非占位。
人工复核的重点包括三类内容:全部规模数字(400 张、150/150/100、19 点、1.73 mm、15,200 标注)与挑战论文及社区文档的一致性;冠军成绩(Test1/Test2 两组 SDR 四档数字)与 Scientific Reports 2016 的对应关系;种子纠错三处(来源机构为中国台湾三军总医院牙科部、主办者为 Ching-Wei Wang 团队、标注者为两名正畸方向医师)在正文各节的表述统一性。
§10.6 最后人工审核日期
最后一次人工审核日期:2026-09-16
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- fitzpatrick-17k — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- serv-ct — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- simcol3d — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- chexstruct-cxreasonbench — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- 3dteethland — 共享标签:医学影像 / 目标检测 / 评测基准
- montgomery-tb — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- mrnet — 共享标签:医学影像 / 医学问答与基准 / 评测基准
- dentex — 共享标签:医学影像 / 医学问答与基准 / 目标检测
- prostate158 — 共享标签:医学影像 / 目标检测 / 评测基准
- monuseg — 共享标签:医学影像 / 医学问答与基准 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
