信息速览
INFOBOX — Learn2Reg 2023 一屏速览
维度 内容 本质 MICCAI 2023 医学图像配准挑战赛——持续评测平台型基准(非单一数据集论文),配准领域的"ImageNet 式"基础设施 组织方 Uni Lübeck(Mattias Heinrich)+ UKSH(Malte Sieren)+ Radboudumc & Fraunhofer MEVIS(Alessa Hering) 官方记录 Zenodo 10.5281/zenodo.7844799(2023-04-19,挑战赛描述记录——注意不是论文) 2023 任务 Task 1:NLST2023 胸部 CT 吸气-呼气跨期配准(扩展两阶段);Task 2:ThoraxCBCT 放疗 FBCT↔CBCT 跨模态配准(新增) NLST2023 210 对(170/10/30)@224×192×224/1.5mm;2023 扩展=双专家每例 >100 landmarks + 肺结节 TRE 入榜 ThoraxCBCT 19 例/38 对(11/3/5)@390×280×300/1.0mm,源 TCIA 4D-Lung(20 名 NSCLC 患者,183 GB,CC BY 3.0) 提交制 Type 2 Docker 为主(test 窗口 2023-09-14 至 09-29)+ phase 2 组织方代跑训练 Docker 排名 Medical Decathlon 式:逐指标 Wilcoxon p<0.05 → metric rank 0.1-1.0 → 任务 rank=几何平均 NLST 冠军 LapIRNv2(TRE 1.441 mm,rank 0.800;未配准基线 10.40 mm) ThoraxCBCT 冠军 SynDeeds(rank 0.705,DSC 70.16%);ConvexAdam 为组织方 baseline(0.710,不参评) 指标家族 TRE / TRE30 / TRE(KP) / TREnodules / Dice / HD95 / SDlogJ / runtime 许可 源数据公开(CC BY 4.0 + CC BY 3.0);预处理包平台注册制;隐藏评测层请求制 生态位 2019 tutorial → 2020/2021 → 2022 → 2023 → 2024/2025 → 2026(PSMAReg + Learn2Breath);OncoReg spin-off 数字时点 全部排行与规模数字固定于 2026-09-26 抓取时点;排行榜为活系统
Learn2Reg 2023 是医学图像配准领域的年度基准挑战赛:它不是一个"采集-标注-发布"式的传统数据集,而是一套任务化的持续评测基础设施——把脑、腹、胸多个解剖部位、CT/MR/超声多模态、同患者/异患者、有/无监督的场景拆成并列任务,用统一的 Docker 提交通道、统一的统计检验排名与公开排行榜,把学习式与传统式配准算法放到同一把尺子上。2023 届的两件大事,一是把肺癌筛查 NLST 的吸气-呼气跨期配准任务升级为两阶段制(组织方代跑参赛者的训练 Docker 于隐藏大样本上),把"肺结节 TRE"这个临床指标正式搬进排名;二是新增 ThoraxCBCT 任务,首次把放疗科真实的 FBCT-CBCT 跨模态、跨呼吸相位、跨数月时间差配准难题端上基准台面。
从数据工程的角度看,2023 届还留下一个常被忽略的贡献:它示范了"上游收藏→任务包→隐藏评测层"的三层数据供给侧结构。上游(TCIA 的 NLST 与 4D-Lung)保持最大开放;中层(重采样、配对、预对齐、掩码、keypoints 的任务包)承担"消除工程方差"的职责;顶层(隐藏测试与统计排名)承担"排名公信力"的职责——三层各司其职,开放与严谨不再互相牺牲。这个结构对本库其他"数据集 vs 基准"类条目(评测基准向的 VOCAB 标签家族)具有直接的借鉴意义。
导语读法三则:
- 只想下数据跑基线:直奔 §6 获取与许可——源数据 TCIA 公开直链,挑战赛预处理包平台注册制,隐藏测试标注请求制,三层别混。
- 关心"谁最强":直奔 §4 结果与排行——注意 ConvexAdam 是 baseline 不参评、SynDeeds 才是 ThoraxCBCT 官方冠军(坑 6),NLST 2023 结果出自 2024 总结论文(坑 2)。
- 设计自己的挑战赛:直奔 §3 评测体系——两阶段设计、Wilcoxon 显著性排名、多指标几何平均,是可整体复用的赛制模板。
行文约定四条(全文生效):术语首现标注英文原文(如"靶注册误差(Target Registration Error, TRE)");所有排行与规模数字可溯源至 FACTS/附录 B 的三源登记;"例/对/患者"三种计数单位严格区分;届别与任务名永远与数字同行出现。
§0 导读:这个基准解决什么问题
医学图像配准(image registration)是把两幅图像——不同时相、不同模态、不同患者——几何对齐的基础操作:肺结节随访要看两次 CT 之间病灶长了没有,放疗计划要把 CT 上的靶区映射到当天的 CBCT 上,脑研究要把所有人的 MRI 拉进同一坐标系。它是"做得好不好全看下游用着顺不顺"的典型:同一个算法在论文里 Dice 0.9,换到医院真实 CBCT 上可能完全失效。
在 Learn2Reg 出现之前,这个领域恰恰缺"同一把尺子"。各论文各用各的数据、各报各的指标,学习式方法在 OASIS 脑数据上训练、从没见过带伪影的术中 CBCT;传统优化方法被默认贴上"慢"的标签;一个方法的超参数是为它自己的测试集调的。Learn2Reg 用四件事对准这些痛点:多任务并列(强制方法在解剖、模态、监督条件迥异的任务间证明自己)、Docker 制提交(组织方统一环境复现,防"评测漂移")、隐藏测试(test 标签不发放,只交位移场或算法)、统计化排名(逐指标 Wilcoxon 显著性检验后计 rank,拒绝单指标定胜负)。
2023 届是这条路线的定型点。Zenodo 官方记录里写明了两大动机:其一,泛化不足——挑战赛数据永远不可能穷举临床场景,所以推动"自配置(self-configuring)"算法,让超参数选择成为流水线的自动环节;其二,指标的临床相关性不足——肺部的解剖 landmark 只是肿瘤相关结构的代理,所以 2023 把"治疗相关靶结构"与"肺结节 TRE"直接纳入评测。这两点决定了 2023 届的两个任务形态:NLST2023 的两阶段制与 ThoraxCBCT 的新增。
0.1 "基准"与"数据集"的辨析:为什么这个条目长成这样
对习惯了"下载数据集→跑模型→报指标"的读者,Learn2Reg 的形态需要一次对齐:
| 维度 | 传统数据集(如库内多数条目) | Learn2Reg 2023 |
|---|---|---|
| 核心资产 | 一批图像+标注 | 任务包+评测代码+排行榜+赛制 |
| 获取 | 下载即用 | 分层:源数据公开/包注册制/隐藏请求制 |
| 规模语义 | 例数即规模 | 每任务各自规模,且含隐藏层不可知部分 |
| 复现含义 | 在同一份数据上复跑 | 在同一接口(位移场/Docker)上复跑 |
| 时效 | 静态快照 | 持续开放(2019-2026 运营中) |
| 引用对象 | 数据论文 | Zenodo 记录+多篇论文+平台页(坑 2 的根源) |
这解释了本条目的三个写法选择:规模数字必须带任务名与口径(§2);结果必须带届别与来源(§4);获取必须分三层说(§6)。
对库内条目读者的三点直接含义:其一,引用本条目数据时,"record 指向的是挑战赛"而非某一组文件——下载入口、许可、规模都要按任务与层查(§6.1 表是唯一权威分流器);其二,本条目的结果数字是"排行榜快照"性质,随届次与提交动态演化,条目内所有排行数字均固定于 2026-09-26 抓取时点;其三,若你在为另一个数据集设计评测,本条目 §3 的赛制与 §10 的坑位清单可以整体作为设计评审单。
0.2 三分钟版本
- 是什么:MICCAI 2023 的医学图像配准挑战赛,双任务(NLST2023 跨期肺 CT 配准 + ThoraxCBCT 跨模态放疗配准)+ 历届任务持续开放。
- 给谁用:做配准算法的(打榜)、做放疗/肺结节临床 AI 的(选型)、研究评测方法学的(借鉴赛制)。
- 规模:NLST2023 210 对 + ThoraxCBCT 38 对 + 历史包近千例;监督标注三件套(landmarks/掩码/keypoints)。
- 最强者:NLST 上 LapIRNv2(TRE 1.441 mm)、ThoraxCBCT 上 SynDeeds(官方冠军,ConvexAdam baseline 更高但不参评)。
- 许可:源数据 CC BY(4.0/3.0)公开;包与隐藏层有门槛。
- 最大坑:双官网+三份"NLST 榜"+TMI 论文年份错配——引用前先对届别(§10)。
0.3 关键人物与机构速记
| 人物/机构 | 角色 | 在 2023 届的足迹 |
|---|---|---|
| Mattias Heinrich(Uni Lübeck) | 创始组织者、系列灵魂人物 | Zenodo 记录一作;DeedsBCV/SynDeeds/ConvexAdam 系方法的源头;MDL-UzL 组织 |
| Alessa Hering(Radboudumc & Fraunhofer MEVIS) | 联合组织者 | Zenodo 记录合作者;肺配准(多解剖约束 CNN)路线代表;后延续至 2026 届组织名单 |
| Malte Sieren(UKSH) | 临床侧组织者 | Zenodo 记录合作者;OncoReg 邀请讲者——临床放疗视角的接口 |
| Christoph Großbröhmer(Uni Lübeck) | 平台与评测工程 | Zenodo 记录合作者;ConvexAdam 合作者 |
| Junyu Chen(JHU) | 新一代领衔者 | 2024 LUMIR 任务负责人;2026 届主席;NLST 基准的当代维护者 |
| Uni Lübeck / UKSH / Radboudumc | 三机构组合 | 数据打包、临床标注(UKSH 放疗科)、方法与平台(Radboudumc+Fraunhofer MEVIS) |
机构背景的一个注脚:Lübeck 组(MDL-UzL)同时是 Deeds、PDD-Net、ConvexAdam、SynDeeds 一整条方法线的作者——"组织方=最强 baseline 的作者"是这个基准的特色,也正因为如此才有了"baseline 不参评"的规则设计(坑 6 的制度根源)。同一批人既造尺子又做选手,公信力靠两件事兜底:评测代码全开源(谁都能复算排名)+ baseline 强制标记(谁都不许冒充冠军)。
§0 读法三则:
- 条目主角是"挑战赛+数据包+评测体系"三位一体:数据规模要看任务包口径(§2),排行数字要看来源届别(坑 2、坑 8),获取方式要看三层许可(§6)。
- 本条目所有排行数字均可溯源:NLST 2023 表出自 MELBA/arXiv 总结论文(arXiv 2509.01217 §4.1.4 Table 1),ThoraxCBCT 2023 表出自 OncoReg 论文(arXiv 2503.23179 Table 2),源 URL 均已落在 FACTS 与正文。
- 检索时若把 learn2reg.github.io 当主站,会拿到 2020-2022 的旧信息——2023 起官方主站是 learn2reg.grand-challenge.org(坑 1)。
§1 数据集速览:十问十答
Q1:Learn2Reg 2023 到底是"一个数据集"还是"一场比赛"?
两者都是,但核心是"带数据包的持续评测平台"。2023 届发布了两个任务数据包(NLST2023 与 ThoraxCBCT),并把历届数据(Lung CT、OASIS、CuRIOUS、AbdomenCT-CT、Abdomen MR-CT、Hippocampus)留在 learn2reg-test 平台持续开放——你可以今天提交算法、明天拿排名。对检索者,这意味着"Learn2Reg 数据集"永远要追问到任务级;对复用者,这意味着 2023 届的数字并不会随挑战赛结束而冻结——排行榜是活的。
Q2:NLST2023 包里有什么?
210 对同患者吸气-呼气胸部 CT(170 train / 10 val / 30 test),统一重采样到 224×192×224、1.5 mm 各向同性。2023 扩展的关键在标注:每例由两位医学专家独立标注超过 100 个解剖 landmark,并加入治疗相关靶结构与肺结节标注(后者产生 TREnodules 指标)。包内还附肺掩码与仿射预对齐——组织方的立场很明确:把工程杂活从参赛者手里拿走,让比赛聚焦配准本身。
Q3:NLST 的原始数据从哪来?
美国国家肺癌筛查试验(NLST)——NEJM 2011 那篇证实低剂量 CT 筛查降低肺癌死亡率的里程碑研究(DOI 10.1056/nejmoa1102873)的影像遗产,经 TCIA 发布(DOI 10.7937/TCIA.HMQ8-J677),CC BY 4.0。这个出身决定了数据的临床气质:受试者是高危吸烟人群、扫描是低剂量协议、随访间隔以月计——正是"筛查-随访"闭环里配准最该工作的场景。
Q4:ThoraxCBCT 又是什么?
放疗科的"日常 vs 教科书"差距:治疗前患者要做高质量扇束 CT(FBCT)做计划,治疗中每天用低剂量锥束 CT(CBCT)摆位——两者模态不同、呼吸相位相反、还可能隔着几个月。任务是从 TCIA 4D-Lung 的 20 名局部晚期 NSCLC 患者里取 19 例,每例 1 张 FBCT(最大吸气相)+2 张 CBCT(最大呼气相,疗程首尾),构成 38 对。第一个配对考验"近期跨模态",第二个配对考验"跨模态+跨数月"——后者是真实放疗自适应流程里最疼的一刀。
Q5:ThoraxCBCT 的标注质量如何?
半自动加人工验证:分割掩码 13 个结构(TotalSegmentator 生成、经配准传播到 CBCT、UKSH 临床医生验证);landmark 全部手动勾画、平均每对 16 个、覆盖整个躯干而不只是肺;另有体干二值掩码与 DeedsBCV 导出的配对 Förstner keypoints 供自监督训练。注意这里的"半自动金标准"属性——掩码不是纯手工(坑点见附录 C),做标注质量研究时要点明。
Q6:怎么提交、怎么排名?
验证阶段每天可多次上传位移场或 Docker,实时上榜;测试阶段(2023-09-14 至 09-29)要么上传位移场(Type 1)要么交 Docker(Type 2)。排名按 Medical Decathlon 赛制:每个指标做两两 Wilcoxon 显著性检验(p<0.05),按"胜场"映射到 0.1-1.0 的 metric rank,任务总 rank 是各指标 rank 的几何平均。几何平均的选择是刻意的:一项指标崩盘就拖垮总分,"偏科冠军"在 Learn2Reg 体系里活不长。
Q7:2023 年谁赢了?
NLST 2023 冠军 LapIRNv2(TRE 1.441 mm,rank 0.800),组织方 corrfield baseline 以 1.638 mm 跟随;ThoraxCBCT 官方冠军 SynDeeds(rank 0.705,DSC 70.16%),但注意 ConvexAdam 作为组织方 baseline rank 0.710 更高却不参评——"赢"的定义在这里有讲究(坑 6)。两场胜利恰好代表两条路线:LapIRNv2 是纯学习式级联网络的胜利,SynDeeds 是"学习式修图+传统配准"混合路线的胜利。
Q8:数据能直接下载吗?
分三层:TCIA 源数据(NLST CC BY 4.0、4D-Lung CC BY 3.0)公开直链;挑战赛预处理包(NLST2023.zip 等)经 grand-challenge 平台注册后从 Uni Lübeck 云发放(未登录直探返回 401);test 标注与隐藏数据 upon request 或只提供在线评测。MONAI 官方 tutorial 直接以 NLST2023.zip 为教学素材——这是"包可直接用于教学与原型"的最好背书。
Q9:为什么它对 AI-Ready 重要?
它是"评测即服务"范式的样本:数据公开、评测代码开源(GitHub MDL-UzL/L2R)、排名可统计复核,但隐藏层标注刻意不发放——这是防数据泄漏的设计选择,代价是本地完整复现受限。条目 §6 按 DAIMS 五维给出评级。对库内其他条目,它还是"源数据-预处理包-评测层"三层异构许可的极端案例:同一任务数据可以同时是 CC BY 公开与请求制封闭。
Q10:它和库内其他条目什么关系?
腹部跨模态对应库内 chaos(CT-MRI 腹部数据,Abdomen MR-CT 任务的原料之一)、amos;肺配准的前辈是 pddca(DIRLab 4DCT);头颈跨模态配准有 hecktor 系列;配准挑战家族还有 fetreg、reg2026;ThoraxCBCT 的掩码生成用了 totalsegmentator。详见 §9 互链网络。一句话:本条目是"配准家族"的枢纽——按解剖(腹/胸/脑/头颈)、按模态(CT/MR/PET/超声)、按工具(TotalSegmentator/nnU-Net)三个方向都能从它出发继续检索。
1.1 一图流:2023 届全景
MICCAI 2023 · Learn2Reg
├── Task 1 NLST2023 (extended)
│ ├── 数据:TCIA NLST → 210 对 (170/10/30) @224×192×224, 1.5mm
│ ├── 监督:双专家 >100 landmarks/例 + 肺结节 + 靶结构(隐藏层)
│ ├── 赛制:phase 1 公开榜 → phase 2 组织方代跑训练 Docker(隐藏大样本)
│ ├── 指标:TRE-LM / TRE-KP / SDlogJ / TRE30 / TREnodules / runtime
│ └── 冠军:LapIRNv2 (TRE 1.441mm, rank 0.800)
└── Task 2 ThoraxCBCT (new)
├── 数据:TCIA 4D-Lung → 19 例 / 38 对 (11/3/5) @390×280×300, 1.0mm
├── 监督:13 结构半自动掩码 + 手动 landmarks (~16/对) + Förstner keypoints
├── 赛制:Type 1 位移场 或 Type 2 Docker;OncoReg spin-off 接 type 3
├── 指标:Dice / TRE-KP / HD95 / SDlogJ / runtime
└── 冠军:SynDeeds (rank 0.705);ConvexAdam baseline 0.710 不参评
持续开放:Lung CT / OASIS / CuRIOUS / AbdomenCT-CT / AbdomenMRCT / Hippocampus(learn2reg-test)
1.2 规模全景:从任务包到上游收藏的完整账本
以"一份数据到底有多少"为线索,把 2023 届相关的所有数字放在一张账本里(每行注明口径,防止跨层误引):
| 数据层 | 计数口径 | 数字 | 上游/下游关系 |
|---|---|---|---|
| TCIA NLST 收藏(上游) | 受试者/影像系列 | 数万受试者级筛查队列(NEJM 2011 试验人群) | NLST2023 包的源 |
| NLST2023 挑战赛包(下游) | 配对 | 210 对(170/10/30) | 仿射预对齐+1.5mm 重采样 |
| NLST2023 隐藏扩展层 | 未披露 | 组织方持有(含靶结构/结节标注) | phase 2 代跑训练用 |
| TCIA 4D-Lung 收藏(上游) | 患者/体量 | 20 患者、183.04 GB、347,330 幅 | ThoraxCBCT 包的源 |
| ThoraxCBCT 任务包(下游) | 例/配对 | 19 例、38 对(11/3/5) | 1mm 重采样+掩码+keypoints |
| OncoReg type 3 私有集 | 例 | 27 例(25 患者,15/3/9 三折) | UKSH 常规放疗数据,不发放 |
| pre-2022 历史包合计 | 例 | 近千例(OASIS 455+Hippocampus 394+其他) | learn2reg-test 持续开放 |
| 2020-2021 两届提交 | 方法/队 | 65+ 方法、20+ 队 | 评测规模(非数据规模) |
这张账本的读法:纵向看层(上游收藏永远大于等于下游任务包),横向看任务(不同任务的"例"语义不同——NLST 的"例"是配对,ThoraxCBCT 的"例"是患者研究)。凡在摘要、数据卡或数据库字段里填规模数字,先对照本表选行。
1.3 常见检索词与命中面对照
| 你会搜的词 | 会命中什么 | 别混淆什么 |
|---|---|---|
| Learn2Reg 2023 | 本条目:双任务挑战赛届次 | Learn2Reg tutorial(2019)、Learn2Reg 2024/2026 |
| NLST registration | NLST2023 任务(本条目) | NLST 原始筛查试验本身(NEJM 2011) |
| ThoraxCBCT | 本条目 Task 2 + OncoReg 论文 | 4D-Lung 收藏(上游,规模更大) |
| Learn2Reg OASIS | 历史任务包(脑异患者) | OASIS 原始队列(Washington University) |
| Learn2Reg Abdomen | AbdomenCT-CT/Abdomen MR-CT 包 | 库内 chaos/amos(原料与延伸) |
| L2R docker | Type 2 提交规范 | MDL-UzL/L2R 仓库名 |
| learn2reg grand-challenge | 现役主站 | learn2reg.github.io(老站,坑 1) |
| OncoReg | ThoraxCBCT 的 spin-off(type 3) | 学习式方法 DINO-Reg(其冠军) |
这张表的用法:先把你的检索词定位到"届-任务-层"三要素之一,再进对应章节——本条目 §2 管层(数据)、§4 管届(结果)、§7 管谱系(届次)。
§2 数据构成与规格
2.1 总览:2023 届的两个任务包与历史任务矩阵
| 任务 | 届别 | 模态 | 患者域 | 训练/验证/测试 | 指标组合 | 源数据 license |
|---|---|---|---|---|---|---|
| NLST2023(extended) | 2022 起设、2023 扩展 | CT↔CT | 同患者(吸气-呼气跨期) | 170/10/30 对 | TRE(LM)/TRE(KP)/SDlogJ+TRE30+TREnodules | CC BY 4.0(TCIA NLST) |
| ThoraxCBCT(new) | 2023 新增 | FBCT↔CBCT | 同患者(跨模态+跨时相) | 11/3/5 例(22/6/10 对) | Dice/TRE(KP)/HD95/SDlogJ+runtime | CC BY 3.0(TCIA 4D-Lung) |
| Lung CT(LungC) | 2020-2021 | CT↔CT | 同患者 | 20/—/10 例 | TRE(landmark)/Dice | Zenodo 合集 |
| OASIS | 2020-2021 | MR T1w↔MR T1w | 异患者 | 416/—/39 例 | Dice(35 labels)/SDlogJ | Zenodo 合集 |
| CuRIOUS | 2020-2021 | MR T1w/FLAIR↔US | 同患者(术中) | 22/—/10 例 | TRE(9-18 landmarks) | Zenodo 合集 |
| Abdomen CT-CT | 2020-2021 | CT↔CT | 异患者 | 30/—/20 例 | Dice(13 labels) | Zenodo 合集 |
| Abdomen MR-CT | 2020-2021 | MR T1w↔CT | 同患者 | 8/—/8 对(+90 unpaired) | Dice(4-9 labels) | TCIA/BCV/CHAOS 混合 |
| Hippocampus MR | 2020-2021 | MR T1w↔MR T1w | 异患者 | 263/—/131 例 | Dice(2 labels) | VUMC/Decathlon 派生 |
这张矩阵本身就是 Learn2Reg 的方法论宣言:配准的难点不是单一的——小样本(Abdomen 仅 30 训练例)、大形变(肺吸气-呼气)、多模态(MR-CT、MR-US)、部分视野(CuRIOUS 术中超声)、小结构(海马)、噪声标注(腹部手工标签)被刻意拆散到不同任务,让"在 A 任务第一名"的算法去 B 任务现形。TMI 论文把这八类挑战(多模态、少/噪声标注、部分视野、小数据集、大形变、小结构、无监督、缺失对应)做成了方法-任务矩阵——每支参赛队被逐格标注"用了什么、没做什么",这是配准方法学第一次被完整地图谱化。
八类挑战逐类说明(对应任务与典型失效方式):
| 挑战 | 代表任务 | 典型失效方式 |
|---|---|---|
| 多模态扫描 | Abdomen MR-CT、CuRIOUS | 强度相似度在跨模态下失效,算法"对齐了伪影" |
| 少/噪声标注 | Abdomen 系 | 过拟合薄标签,评测结构外的形变失控 |
| 部分视野 | CuRIOUS 术中 US | 视野外结构被强行"对齐"到错误位置 |
| 小数据集 | Abdomen CT-CT(30 训练) | 深度网络欠拟合或记忆化 |
| 大形变 | Lung CT/NLST | 单尺度网络捕获范围不足,直接落到局部极小 |
| 小结构 | Hippocampus | 体素级损失被大背景淹没,微小结构对齐被牺牲 |
| 无监督注册 | 各包 unpaired 部分 | 无金标准时形变合理性(折叠)失控 |
| 缺失对应 | 术前后对比(对 2 型) | 解剖本身变化,强行一一对应反而制造错误 |
这八行表是读 §4 榜单的"解码器":每个方法在某任务上的名次变化,几乎都能在其中两三行的失效方式里找到解释。
2.2 NLST2023:从筛查试验到配准基准
2.2.1 NLST 是什么:一次临床试验的影像遗产
NLST(National Lung Screening Trial,国家肺癌筛查试验)是美国 ACRIN 与 Lung Screening Study 联合的随机对照试验:5 万余名 55-74 岁高危(重度吸烟史)受试者随机分入低剂量螺旋 CT 组与胸片组,NEJM 2011 论文(Aberle et al., DOI 10.1056/nejmoa1102873)报告低剂量 CT 使肺癌死亡率相对降低 20%。试验停止后,其系列影像(同一患者多次低剂量 CT、间隔数月到数年)经 TCIA 开放(DOI 10.7937/TCIA.HMQ8-J677)。
对配准研究,这批数据有三个天然优点:
- 同患者多时相:筛查随访协议天然提供"基线-复查"对,正是 intra-patient 配准的定义场景;
- 临床真实性:低剂量协议的噪声、高危人群的肺气肿/结节/术后改变——真实世界的困难样本,而非健康志愿者;
- 明确的临床终点:配准好坏直接关联"结节长没长、长多快"的判读——这是 TREnodules 指标合法性的来源。
一个常被忽视的背景:NLST 影像进入配准领域经过了"筛查试验→TCIA 开放→挑战赛任务化"三层转手,每层都有自己的引用要求(试验论文、收藏 DOI、任务记录)。这也是本条目坚持"三段式引用链"的原因——任何一层缺引,都会让下游研究的数据溯源在审稿中断裂。
2.2.2 挑战赛预处理包规格
| 项目 | 规格 |
|---|---|
| 配对 | 210 对(170 train / 10 val / 30 test),固定-移动对=同患者吸气-呼气 |
| 图像尺寸 | 224×192×224 |
| 体素间距 | 1.5×1.5×1.5 mm(各向同性重采样) |
| 预对齐 | 仿射预对齐 |
| 附加数据 | 肺掩码;2023 扩展另发预测语义标签(phase 2 隐藏集含靶结构与结节标注) |
| 分发 | NLST2023.zip(Uni Lübeck 云,平台注册制)+ NLST_dataset.json 配对清单 |
| 下游标准引用 | MONAI 官方 tutorial(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb)以 NLST2023.zip 为默认素材 |
2023 扩展评测的三处关键升级:
- 双专家独立 landmark:每例超过 100 个解剖标志点由两名医学专家各自独立标注——提供了可以量化标注者间离散度的金标准,也使 TRE 的统计检验更扎实。专家独立标注(而非共识标注)还保留了一个隐藏福利:研究者可以用它研究 landmark 标注本身的不确定性。
- 治疗相关靶结构:把放疗语境下真正要跟踪的结构纳入评测,回应"landmark 只是代理"的批评(Zenodo 记录原文:lung landmarks are only a proxy for relevant tumour lesions)。
- TREnodules 入榜:肺结节层面的靶注册误差直接进入排名,Top-4 方法在结节上的误差(1.135-1.434 mm)约为 MONAI/UCLA 基线的一半——筛查-随访闭环里最被临床关心的数字首次有了榜单位次。
2.2.3 规模口径的精确说明
规模口径提示:210 对(170/10/30)是挑战赛包的官方口径,与 MONAI tutorial、DEQReg 等多个独立来源一致;个别文献(如 SAMCL,arXiv 2406.17575)报告 294/42/84 幅图像(即 147/21/42 对)系其自述的 3 mm 重采样口径。两个口径的比例都是 7:1:2,差异只在配对计数方式与预处理。任何引用必须注明口径,详见坑 4。2023 扩展在公开包之外还有组织方持有的隐藏扩展集(含非公开标注),其规模不随包披露——这也意味着"NLST2023 总量"没有单一权威数字,公开可及部分以上述 210 对为准。
2.2.4 预处理流水线:从 DICOM 到任务对
组织方把"脏活"标准化成了一条可描述的流水线,理解它有助于判断你自己的数据适不适合用同一套基准:
| 步骤 | 操作 | 设计动机 |
|---|---|---|
| 1 配对抽取 | 从 NLST 系列中取同患者吸气-呼气两次扫描 | intra-patient 跨期场景 |
| 2 重采样 | 各向同性 1.5 mm、统一 224×192×224 | 消除分辨率异质性,统一显存负担 |
| 3 仿射预对齐 | 提供初始对齐 | 把"大平移"从难度里剥离,聚焦形变本身 |
| 4 掩码生成 | 肺掩码随包发放 | 训练正则与快速评测双用途 |
| 5 标注(2023 扩展) | 双专家 >100 landmarks/例+结节/靶结构(隐藏层) | 统计检验级金标准+临床指标 |
| 6 打包分发 | NLST2023.zip + NLST_dataset.json 配对清单 | 平台注册制+MONAI 生态直连 |
同样的流水线逻辑在 ThoraxCBCT 上再跑一遍(重采样 1.0 mm、人工预对齐大平移、掩码+keypoints 三件套)——两条流水线合起来构成了"配准任务包"的可复制模板,这也是 L2R 数据被后续届次与新任务(PSMAReg/Learn2Breath)沿用的原因。
2.3 ThoraxCBCT:把放疗室搬进基准
2.3.1 临床问题:IGRT 的三重错位
图像引导放疗(IGRT)的日常是这样运转的:患者先做一次高质量 CT(放疗计划 CT)勾画靶区与危及器官;治疗开始后每次摆位用治疗床自带的 CBCT 快速扫描、与计划 CT 配准后校正位置;疗程持续数周,肿瘤可能缩小、肺可能塌陷、患者可能消瘦。于是配准算法面对的是三重错位同时发生:
| 错位维度 | 具体表现 | 对算法的考验 |
|---|---|---|
| 模态错位 | FBCT(诊断级剂量、软组织清晰)vs CBCT(低剂量、散射伪影、杯状伪影) | 相似度度量要跨模态稳健(MIND/LNCC 类),伪影不伪装成解剖 |
| 呼吸错位 | FBCT 采于最大吸气、CBCT 采于最大呼气 | 大形变(膈肌位移可达数厘米)、肺体积剧变 |
| 时间错位 | 对 2 中 FBCT 与 CBCT 相隔通常数月 | 解剖本身变化:肿瘤消长、胸水、肺不张 |
2.3.2 数据链路:从 TCIA 收藏到任务包
上游:TCIA 4D-Lung 收藏——“Data from 4D Lung Imaging of NSCLC Patients (Version 2)”(DOI 10.7937/K9/TCIA.2016.ELN8YGLE):
| 项目 | 内容 |
|---|---|
| 人群 | 20 名局部晚期 NSCLC 患者(放化疗期间,总剂量 64.8-70 Gy,每日 1.8/2 Gy 分割) |
| 4D-FBCT | Philips Brilliance Big Bore 16 排螺旋 CT,10 呼吸相位分箱(0-90%),3 mm 层厚;模拟期全员采集,14/20 名患者疗程中每周加采 |
| 4D-CBCT | Varian On-Board Imager,约 2500 投影/8-10 分钟,125 kVp/20 mA/20 ms 半扇弓,10 相位 FDK 重建(in-house) |
| 呼吸管理 | 全部采集配视听生物反馈(audio-visual biofeedback) |
| 其他标注 | 单名放射肿瘤医生在全部 4D-FBCT 与部分 CBCT 的所有 10 相位勾画靶区与 OAR(RTSTRUCT);7 名患者瘤内/瘤周金标 fiducial |
| 体量 | 183.04 GB / 589 studies / 6,690 series / 347,330 images |
| 描述论文 | Hugo et al. 2017, Medical Physics 44(2):762-771, DOI 10.1002/mp.12059;Balik et al. 2013(PMCID PMC3647023) |
下游:Learn2Reg 任务化打包(OncoReg 论文 Table 1/正文口径):
| 项目 | ThoraxCBCT 规格 |
|---|---|
| 例数 | 19 例(11 train / 3 val / 5 test),每例 2 配对 → 38 对 |
| 每例构成 | 1×FBCT(治疗前,最大吸气相)+ 2×CBCT(疗程首、尾,最大呼气相) |
| 两个子任务 | 对 1:FBCT-CBCT_t0(时间相近);对 2:FBCT-CBCT_end(通常相隔数月) |
| 图像尺寸 | 390×280×300 |
| 体素间距 | 1.0×1.0×1.0 mm(各向同性) |
| 预对齐 | 大平移人工校正(manual pre-alignment) |
| 分割掩码 | 半自动 13 结构(肺、肿瘤、心脏/脊髓/食管/气管/主动脉等 OAR、椎骨/肋骨/锁骨/肩胛骨等骨结构)——FBCT 缺失掩码由 TotalSegmentator 生成、经配准传播至 CBCT、UKSH 临床医生验证 |
| Landmarks | 全手动,平均每对 16 个,覆盖全躯干(不限于肺):气道分叉、主动脉弓顶、心尖与骨性结构关键点等 |
| Keypoints | 配对 Förstner keypoints(基于 DeedsBCV 位移场导出)——供 keypoint 自监督训练 |
| 体干掩码 | 每幅图像附二值 body-trunc mask(TotalSegmentator 生成) |
这个任务的三重难点组合在配准基准里是首见:跨模态(FBCT 与 CBCT 的剂量、伪影、软组织对比度差异)、跨呼吸相位(吸气相固定 vs 呼气相移动,大形变)、跨时间(对 2 相隔数月,解剖本身可能变化)。它把"配准评测"从计算机视觉式的人造场景推向了放疗科室的真实工作流。与既往 L2R 任务"聚焦肺内"不同,ThoraxCBCT 的 keypoint 采样横跨整个躯干——评测覆盖面也随之"出肺"。
2.3.4 两种 CT 的物理差异(为什么跨模态难)
| 参数 | 4D-FBCT(计划 CT) | 4D-CBCT(摆位 CBCT) |
|---|---|---|
| 设备 | Philips Brilliance Big Bore 16 排螺旋 | Varian On-Board Imager(加速床载) |
| 用途 | 放疗计划勾画 | 每次摆位验证 |
| 采集 | 螺旋扫描,10 呼吸相位分箱 | 约 2500 投影/8-10 分钟慢弧,10 相位 FDK 重建 |
| 剂量/管参数 | 诊断级 | 125 kVp/20 mA/20 ms(低剂量) |
| 典型伪影 | 少 | 散射伪影、杯状伪影、金属(金标)伪影 |
| 软组织对比 | 高 | 低(肿瘤边界常模糊) |
对配准算法,这张表翻译过来就是:基于强度相似度的方法要扛伪影(MIND/LNCC 类对比度不变度量因此吃香);基于学习特征的方法要扛域差(FBCT 训练的特征到 CBCT 上会漂移)——SynDeeds 干脆先合成再配准,ConvexAdam 则用 nnU-Net 特征跨模态桥接。两条路线在 §4.2 的榜单上正面相遇,并非偶然。
还有一层容易被忽略的物理:CBCT 的 10 呼吸相位由约 2500 个投影分箱重建而来——每个相位只分到约 250 个投影,图像噪声与伪影天然比全剂量 FBCT 严重。这意味着 ThoraxCBCT 的"跨模态"不只是设备差异,还是"信息量差异":moving 图像(CBCT)本身携带的解剖证据就比 fixed 少。跨模态配准的文献常把这类问题称为"quality asymmetry"(质量不对称)——它是 §4.2 榜单上覆盖类指标(Dice/HD95)整体低于单模态任务的物理学根源。
由此还能推出一条使用建议:在 ThoraxCBCT 上,“先修图再配准”(SynDeeds)与"特征桥接"(ConvexAdam)都不改变 CBCT 信息量不足的事实——若下游只需要特定结构(如肿瘤)的对齐,把结构掩码作为约束先验(任务包已提供 13 结构掩码)往往比继续堆配准网络更划算。
2.3.3 标注流水线的工程启示
ThoraxCBCT 的标注流程值得单独记录,因为它示范了"大模型工具+医生验证"的现代医学标注配方:
- FBCT 缺失的分割掩码用 TotalSegmentator 自动生成(而非从零人工勾画);
- 掩码经配准传播到 CBCT(CBCT 上人工勾画 13 结构成本过高);
- UKSH 临床医生逐例验证——人工只做质量闸门,不做生产力单元;
- 全躯干 landmarks 纯手动(这一步无法自动化,也最贵——所以每对只 16 个);
- 训练自监督所需的密集对应关系用 DeedsBCV 自动导出(明确标注了来源算法,供方法学研究时溯源偏差)。
这套配方与库内 synthrad 等条目描述的合成数据标注逻辑相通:自动生成、人工验证、来源透明。
2.4 历史任务包:pre-2022 数据矩阵的持续开放
2023 届没有废弃历史任务,而是让它们在 learn2reg-test 平台继续接受提交。Zenodo 合集 DOI 10.5281/zenodo.3835682 打包了 pre-2022 数据。各包规格(Datasets 页官方口径):
| 数据包 | 尺寸/间距 | 例数(train/test) | 标注 | 附加 | 下载体积 |
|---|---|---|---|---|---|
| Lung CT | 192×192×208 @1.75×1.25×1.75mm | 30(20/10) | 100 landmarks/例 | 肺掩码 | 530 MB |
| OASIS | 160×192×224 @1×1×1mm | 455(416/39) | 35 anatomical labels | — | 1.3 GB |
| CuRIOUS | 256×256×288 @~0.5×0.5×0.5mm | 32(22/10) | 9-18 landmarks/例 | — | 2.6 GB |
| Abdomen CT-CT | 192×160×256 @2×2×2mm | 50(30/20) | 13 器官 labels | — | 1 GB |
| Abdomen MR-CT | 192×160×192 @2×2×2mm | 16 对(8/8)+90 unpaired | 4 labels(train)/9 labels(test) | ROI 掩码 | 1.8 GB |
| Hippocampus MR | 64×64×64 @1×1×1mm | 394(263/131) | 2 labels(头+体) | — | 54 MB |
几个值得注意的构成细节:
- Abdomen CT-CT 来自门静脉对比期的临床采集(512×512×53-368 不等、层厚 1.5-7.0 mm),13 个器官标签(脾、双肾、胆囊、食管、肝、胃、主动脉、下腔静脉、门/脾静脉、胰腺、双肾上腺)由两名受训 6 个月的本科生初标、放射医生 MIPAV 逐体积复核——"少而脏"的标注正是任务设计想考验的噪声标注场景。
- Abdomen MR-CT 是三层来源的"缝合"数据集:TCGA-B8/BP/DD 系列受试者(TCIA)+ Beyond Cranial Vault(BCV)挑战 + CHAOS 收藏,16 对外另配 90 对无配对 CT/MR 供无监督实验。它的存在使库内 chaos 条目成为直接上游(CHAOS 数据的原始出处)。
- Hippocampus MR 派生自 Vanderbilt 精神表型库(90 健康成人 + 105 精神障碍患者:56 精神分裂症、32 分裂情感障碍、17 精神分裂样障碍),经 Medical Decathlon 进入配准领域——异患者配准中"最像分类任务"的一支,也是"小结构+大数据集"象限的唯一代表。
- CuRIOUS 是唯一的多模态术中任务(MR T1w/FLAIR→超声),部分视野与术中形变使它成为"最像手术导航"的包。
- Lung CT(2020 版)是 NLST 的精神前身:30 例、每例 100 个 landmark、吸气-呼气配对——2023 的 NLST 扩展相当于把这个任务搬进真实筛查数据并放大标注密度。
六包的用途指引(按研究目标分派):
| 你的目标 | 推荐包 | 理由 |
|---|---|---|
| 快速验证新配准网络 | Hippocampus MR(54 MB,394 例) | 体量小、迭代快、异患者 Dice 可即时自评 |
| 测试多模态稳健性 | Abdomen MR-CT、CuRIOUS | 跨模态+部分视野双重压力 |
| 模拟临床部署 | Lung CT→NLST2023、ThoraxCBCT | 真实采集噪声与临床指标 |
| 研究标签噪声影响 | Abdomen 系(本科生标注+医生复核) | 已知的标注噪声结构 |
| 大样本监督实验 | OASIS(455 例 35 labels) | 学习式方法的"主场" |
| 复刻历史排行 | 对应包+TMI 论文参数 | 排名代码开源可复算 |
这张指引表的隐含结论:六个历史包并非"旧数据仓库",而是按目标分派的工具架——体量小的适合迭代、标注脏的适合研究噪声、真实采集的适合临床模拟。Learn2Reg 把它们留着持续开放,正是让不同成熟度的方法各取所需。
2.5 规格对照:2023 任务包与库内同域数据集
把两个 2023 任务包放到库内同域数据集旁边,可以看出 Learn2Reg"小而精+重标注"的选型口味:
| 数据集 | 模态 | 规模 | 标注重心 | 与 L2R 的关系 |
|---|---|---|---|---|
| NLST2023(本条目) | CT↔CT | 210 对 | 双专家 landmarks+结节 | 基准任务本体 |
| 4D-Lung(上游) | 4D-FBCT+4D-CBCT | 20 患者/183 GB | RTSTRUCT+金标 | ThoraxCBCT 源 |
| pddca/POPI(库内 454) | 4D CT | 10-31 例 | 100 landmarks/例 | 肺配准前代基准(landmark 传统同源) |
| chaos(库内 337) | CT+MR 腹部 | 100 例 | 器官分割 | Abdomen MR-CT 任务原料之一 |
| amos(库内 76) | CT+MR 腹部 | 500 例 | 15 器官 | 跨模态腹部配准的扩展评测场 |
| ct-rate(库内 546) | CT | 508 例 | 纵隔淋巴结 | 跨期胸 CT 的随访形态 |
| totalsegmentator(库内 422) | CT | 大规模 | 全身分割模型 | ThoraxCBCT 掩码生成工具 |
对照的结论:Learn2Reg 任务包的绝对规模在医学影像界属于"小型",但其标注密度(每例 >100 双专家 landmark、逐例掩码+keypoints+掩码三件套)与评测基础设施(隐藏测试+统计排名)是库里少见的。这决定了它的最佳用途是方法对比与算法选型,而不是从头预训练一个大模型。
§3 挑战赛设计:任务、指标与排名机制
3.1 挑战赛分型与两阶段赛制
grand-challenge 体系的提交分型(2023 年的语境):
| 分型 | 提交内容 | 隐藏程度 | 2023 应用 |
|---|---|---|---|
| Type 1 | 位移场(申请下载 test 图像,标签隐藏) | 图像半隐藏+标签全隐藏 | 2023 test 期可选通道 |
| Type 2 | Docker 算法(统一 GPU 评测,含 runtime) | 组织方代跑 | 2023 主推通道;NLST phase 2 同理 |
| Type 3 | Docker,训练也在隐藏数据上完成 | 图像+标签全隐藏 | OncoReg type 3(2023-12 启动) |
Learn2Reg 2023 的组织设计(Zenodo 记录 + OncoReg 论文互证):
Validation Phase(验证期):参赛者用公开的训练/验证数据开发算法,对验证病例计算位移场上传 grand-challenge.org;每天可多次提交,结果实时进入公开排行榜——鼓励迭代,也让"调参过拟合验证集"的行为可见。
Test Phase(测试期):2023-09-14 开放至 2023-09-29 23:59 CET(learn2reg-test.grand-challenge.org 专站)。两种通道任选:Type 1 上传位移场,或 Type 2 提交 Docker 由组织方统一硬件评测并附加推理运行时统计。
NLST 的进一步升级——两阶段制(Zenodo 记录):phase 1 照常本地训练提交;phase 1 优胜队伍改交训练用 Docker,由组织方在包含非公开标注的更大肺部/胸部数据集(解剖 landmarks、几何 keypoint correspondences、治疗相关靶结构、语义分割四类监督)上代跑训练再评测——参赛者根本见不到这些数据。训练出的网络随后经 grand-challenge 公开发放。这是把"防泄漏"推到极致的设计:连训练集都藏起来一半。
2023 届年内时间线(多源拼合):
| 时点 | 事件 |
|---|---|
| 2023-04-19 | Zenodo 挑战赛记录 v1 发布(任务设计与创新说明) |
| 2023 年中 | L2R23 data release 论坛帖发布两任务数据包(NLST2023/ThoraxCBCT) |
| 2023-08-09 | 仓库更新 L2R23_Snapshot_NLST / L2R23_Snapshot_ThoraxCBCT 排名 notebook |
| 2023-09-14 | test 提交窗口开启(learn2reg-test 专站) |
| 2023-09-29 23:59 CET | test 提交截止 |
| MICCAI 2023 workshop | 结果讨论与颁奖(NLST:LapIRNv2;ThoraxCBCT:SynDeeds) |
| 2023-12-06 | OncoReg type 3 kickoff(虚拟帮助会) |
| 2024-01-31 | OncoReg 最终 Docker 截止 |
| 2024-02-20 | OncoReg 虚拟 winter workshop(收官) |
这份时间线的用途:任何"2023 届成绩何时产生"的疑问都可在表中定位——公开任务的成绩产生于 9 月窗口与 MICCAI workshop 之间,OncoReg type 3 的成绩则是 2024 年 2 月——引用时别把两者混为"2023 结果"。
3.2 指标家族:四个维度合成一张榜
Learn2Reg 的评测哲学是"没有任何单一指标能抓住配准质量"(官方文档原文口径),因此每任务捆绑一组互补指标。读这张表的方法是先看"维度"列——同一维度内的指标互为冗余(TRE 与 TRE-KP),跨维度的指标互为制衡(TRE 与 SDlogJ):
| 维度 | 指标 | 含义 | 2023 应用 |
|---|---|---|---|
| 准确性 | TRE(mm) | 靶注册误差:landmark/keypoint 经形变后的距离误差 | NLST(TRE-LM/TRE-KP)、ThoraxCBCT(TRE-KP) |
| 准确性(临床) | TREnodules | 肺结节层面 TRE | NLST 2023 新增 |
| 覆盖 | Dice/DSC(%) | 解剖标签经形变后的重叠度 | ThoraxCBCT(13 结构)、Abdomen、OASIS |
| 覆盖(边界) | HD95(mm) | 表面距离 95 百分位 | ThoraxCBCT |
| 鲁棒性 | TRE30 | 最差 30% landmark 的 TRE | NLST |
| 合理性 | SDlogJ | log Jacobian | |
| 效率 | runtime | Docker 统一 GPU 实测推理时间 | Type 2 提交者 |
四个维度的互补关系可以这样理解:TRE 回答"点对上了吗",Dice/HD95 回答"面对上了吗",TRE30 回答"最难的案例崩了吗",SDlogJ 回答"形变场物理上说得通吗",runtime 回答"临床等得起吗"。任何一个维度缺失,都会产生被论文里优雅数字掩盖的失败模式——例如只报 TRE 的方法可以在 landmark 附近过拟合、在器官边缘产生折叠位移场。
Jacobian 行列式指标值得单说:位移场若发生折叠(Jacobian ≤ 0),拓扑结构被破坏,下游任何"沿位移场传播剂量/轮廓"的应用都会出 silent failure。放疗场景里这意味着剂量可能被映射到错误的解剖位置——SDlogJ 进榜把"形变合理性"从论文里的附加实验变成了硬性排名项,这是 Learn2Reg 对放疗社区最直接的制度善意。
指标间的冲突不是理论风险,2023 两个任务都有实例:NLST 上 Birmingham 的 TRE(1.425 mm)低于冠军 LapIRNv2(1.441 mm),但鲁棒性与平滑性次之,总 rank 反而低两个身位;ThoraxCBCT 上 SSKJLBW 的 HD95(17.60 mm)全场最佳、SDlogJ(0.26)全场最差——边界对得越紧、内部形变越拧巴。这两例合起来说明:"哪个指标重要"取决于下游用法——结节测量场景看 TREnodules,剂量累积场景看 SDlogJ,轮廓传播场景看 Dice/HD95。Learn2Reg 不替你做这个选择,它只是把所有维度并排摆出来。
3.3 排名机制:统计显著性与几何平均
排名代码(GitHub MDL-UzL/L2R ranking 目录)完全开源,规则为:
- 对任务内每个指标,所有方法两两做 Wilcoxon signed-rank 检验(p<0.05 记显著差异);
- 每对显著比较中"赢"的一方得 1 胜场;按胜场数排序后线性映射到 [0.1, 1.0] 的 metric rank(并列共享分值);
- 任务总 rank = 该任务全部指标 metric rank 的几何平均——意味着任何一项指标崩盘都会拖垮总排名;
- 未提交(或无 Docker)的方法直接记最低 0.1。
用 ThoraxCBCT 2023 的真实数字演算一遍排名逻辑的后果:Fourier-Net 的 TRE(4.03 mm)与 TRE30(3.85 mm)全场最低,但 DSC 61.91% 与 HD95 47.80 mm 接近垫底——它的准确性与覆盖维度互相抵消,总 rank 只有 0.535;SynDeeds 没有拿到任何单指标第一,但每一项都在前排,几何平均把它推到 0.705。官方 baseline ConvexAdam 的 0.710 则说明:混合路线的天花板被组织方自己标注了出来。
这套设计刻意惩罚"偏科生",同时给"全面但不极致"的 baseline 留出视野——这正是官方把 ConvexAdam 放进榜单当参照物的目的:它既是靶子也是标尺。
3.4 自配置(self-configuring)路线的制度化
2023 届最鲜明的学术议程是把"自动超参数选择"写进赛制。Zenodo 记录原文:挑战赛数据永远无法穷举临床应用,要让超参数选择成为自动流水线的一部分。具体措施(Task 3 从 2022 的改进延续):
- 提供一组 baseline 算法(含 ConvexAdam、corrField 等)作为实现参照;
- 发布 dummy 数据集(含监督与评测配置文件),让参赛者在正式提交前完整走通评测链路;
- 测试时提供预测语义标签(nnU-Net 风格),供特征提取类方法使用;
- 开放 sanity check 通道——提交零位移场即可校验评测管线(仓库另附 zero-deformation fields);
- 改进时间线,给 Docker 实现与调试留足窗口。
成果可以从方法谱系看出:ConvexAdam(凸优化+Adam 实例优化+自动超参搜索)在 2020-2021 跨任务总分第一,2023 年又以 baseline 身份继续压制一众专用算法——"少学习、多配置"路线与深度学习路线的正面竞争,是 Learn2Reg 对配准方法学最大的公开实验。这场实验的阶段性结论(§5.3)已经写进了 TMI 论文:纯端到端深度学习并没有统治这个领域,混合与自配置路线站稳了脚跟。
自配置议程的延伸影响在基准之外:当"选择超参数"本身成为被评测的能力,方法论文的评价标准就从"在固定配置下刷点"转向"在陌生任务上自动达成合理配置"——这与 2024/2026 届不断加入新域(术中、显微镜、核医学)的选task逻辑形成呼应:新任务越陌生,自配置的价值越大。
3.5 赛制的可移植性:设计自己的配准评测能抄什么
Learn2Reg 2023 的赛制是一个可以被整体移植的模板,逐条对应"你办评测时该抄什么":
| Learn2Reg 设计 | 解决的问题 | 移植成本 |
|---|---|---|
| 多任务并列而非单任务 | 防"单任务特化"刷榜 | 高(要凑多套标注) |
| 仿射预对齐统一发放 | 把工程杂活与算法创新分离 | 低 |
| 验证期每日多次提交+实时榜 | 观察过拟合行为、降低参赛门槛 | 低(grand-challenge 现成) |
| test 期 Type 1/2 双通道 | 兼顾轻量参与与可复现性 | 中 |
| 训练 Docker 代跑(NLST phase 2) | 连训练集都能隐藏、防数据泄漏 | 高(组织方算力投入) |
| Wilcoxon 显著性+几何平均排名 | 拒绝单指标定胜负与噪声冠军 | 低(代码开源可直接用) |
| baseline 常驻榜单 | 给社区锚点+隔离组织方优势 | 中 |
| 零位移场 sanity check | 消灭坐标系/方向类低级错误 | 极低 |
| SDlogJ 入榜 | 把形变合理性变成硬指标 | 低 |
| TREnodules 临床指标入榜 | 让排名对齐临床关心的东西 | 高(要额外临床标注) |
移植时的常见错误是只抄"隐藏测试"不抄"显著性排名"——结果榜单被验证集噪声主导,前排名次在统计上不可区分,赛制公信力反而受损。Learn2Reg 的经验是:隐藏+统计检验+多指标几何平均是一个整体,拆开来用会互相抵消。
赛制移植前的自检问题(对照 Learn2Reg 逐项打勾):
- 我的任务有没有至少一个"非平均数"指标(最差百分位/边界距离)?
- 有没有形变合理性指标(Jacobian 类)?
- test 标签是否真的不可被参赛者间接重建(公开验证集与 test 是否同源同分布泄漏)?
- 排名是否做了显著性检验?样本量撑得起吗?
- baseline 是否覆盖传统与学习两派?是否明确标注不参评身份?
- 有没有零解 sanity check 通道?
- runtime 与硬件口径是否固化并披露?
- 数据发布与结果发布的时间线是否留出 Docker 调试期?
- 临床指标(若有)是否由临床专家定义而非工程侧内推?
- 届次结束后排行榜是否保持开放(持续评测)?
十问全绿即是"Learn2Reg 级"评测设计;缺三项以上建议先补齐再开赛——这是 2019-2023 四届迭代用真实事故换来的清单。
§4 结果与排行榜分析
4.1 NLST 2023:LapIRNv2 的标杆战
来源声明:本节全部数字出自 Learn2Reg 2024 总结论文(arXiv 2509.01217 v3,MELBA 2025:034)§4.1.4 Table 1——该表是 2023 届 NLST 官方结果的唯一系统化出处;grand-challenge 在线榜与 GitHub snapshot notebook 为同源补充,与论文表口径一致。
官方表彰名单(双专家 >100 landmarks/例):
| 名次 | 队伍/方法 | TRE (mm) | SDlogJ | Rank |
|---|---|---|---|---|
| 1 | LapIRNv2(Mok & Chung 条件级联网络) | 1.441 | 0.042 | 0.800 |
| 2 | corrfield(组织方 baseline:Förstner keypoint+最小生成树) | 1.638 | 0.038 | 0.670 |
| 3 | Birmingham(Jia et al. 迭代式深度均衡方法系) | 1.425 | 0.045 | 0.553 |
| 4 | UKE | 2.435 | 0.062 | 0.489 |
| 5 | MONAI baseline | 2.042 | 0.039 | 0.452 |
| 6 | UCLA | 2.934 | 0.071 | 0.352 |
| — | initial(未配准) | 10.40 | — | — |
三点解读:
- 深度学习垄断前排但传统方法紧咬。冠军 LapIRNv2 是纯学习式级联网络;第二名却是传统优化式 baseline corrfield——按 TRE 绝对值看,Birmingham(1.425 mm)甚至比冠军还低,输在鲁棒性与形变合理性的均衡上。这个"传统方法只慢不差"的证据链从 TMI 论文延续到了 2023。
- 临床指标与学术指标一致。TREnodules(肺结节 TRE)Top-4 达 1.135-1.434 mm,约为 MONAI/UCLA 基线误差的 50%,且与 landmark TRE 排序高度吻合——"筛查-随访"闭环最关心的结节跟踪精度,可以由 landmark 精度良好预测,这为后续基准只用 landmark 提供了正当性依据。
- runtime 进入临床可接受区。前排方法执行时间为数秒级,官方评述"轻量学习式 MONAI baseline 也表现良好"——配准作为预处理步骤的工程成本已经不构成瓶颈。
从未配准基线 10.40 mm 到冠军 1.441 mm,任务把"配准能带来什么"压缩成了一个 7 倍因子;而 1.441 mm 已低于典型 CT 层厚(1-5 mm)——在这个数据上,配准误差进入亚体素区间,继续提升的边际收益要靠临床判断而非 leaderboard。
逐名次细读(与 §5 方法卡对照):
- LapIRNv2(0.800):级联式由粗到细是"大形变"的标准答案;它不是单项最准(Birmingham 的 TRE 更低),而是 TRE+SDlogJ 双优——印证几何平均奖励均衡。
- corrfield(0.670):传统 keypoint 路线的体面成绩。它没有训练过程、不需要数据,证明在"有良好预对齐+关键点可检测"的场景里,经典方法仍是性价比之王。
- Birmingham(0.553):DEQ 深度均衡路线,TRE 绝对值全场最低(1.425 mm)但 TRE30/SDlogJ 拖后——"最准但不最稳"的教科书案例。
- MONAI baseline(0.452):官方教学级轻量网络。它的存在意义是"下限锚点":连教学配置都在未配准基线上提升 5 倍,说明任务的预对齐已经把问题驯化到可学习区间。
- UKE(0.489)/ UCLA(0.352): specialised 深度方案。UCLA 的 SDlogJ 0.071 最差——形变平滑性欠账直接反映在排名上。
4.2 ThoraxCBCT 2023:SynDeeds 与 baseline 的微妙关系
OncoReg 论文 Table 2(官方结果表,含组织方 baseline):
| 方法 | TRE↓(mm) | TRE30↓(mm) | DSC↑(%) | HD95↓(mm) | SDlogJ↓ | Rank↑ |
|---|---|---|---|---|---|---|
| initial(未配准) | 11.91 | 16.26 | 29.04 | 48.13 | — | — |
| ConvexAdam(组织方 baseline,不参评) | 4.93 | 4.98 | 68.40 | 38.00 | 0.10 | 0.710 |
| SynDeeds(官方冠军) | 6.01 | 5.67 | 70.16 | 22.97 | 0.15 | 0.705 |
| Niftyreg(传统基线) | 4.90 | 4.51 | 62.11 | 43.41 | 0.05 | 0.577 |
| DeedsBCV | 8.76 | 7.38 | 69.00 | 22.38 | 0.16 | 0.537 |
| Fourier-Net | 4.03 | 3.85 | 61.91 | 47.80 | 0.07 | 0.535 |
| SSKJLBW | 5.80 | 7.44 | 69.45 | 17.60 | 0.26 | — |
任务叙事的三个看点:
- "赢"的定义:ConvexAdam 总 rank 0.710 高于 SynDeeds 0.705,但它是组织方提供的 baseline、按规则不参评冠军——官方冠军是 SynDeeds(Deeds 前置一个学习式图像合成模块:先把 CBCT 的伪影"修图"再用 Deeds 配准)。两者的 DSC(68.40 vs 70.16)与 TRE(4.93 vs 6.01)互有胜负,差距远小于未配准基线(DSC 29.04、TRE 11.91)。任何"2023 ThoraxCBCT 冠军是谁"的叙述都必须写清这层(坑 6)。
- 单指标冠军全是"偏科生":TRE 最低 Fourier-Net(4.03 mm)DSC 却最低档;HD95 最低 SSKJLBW(17.60 mm)SDlogJ 最差(0.26,形变最不平滑);传统 Niftyreg 的 SDlogJ 全场最优(0.05)但 DSC 只有 62%。跨模态任务上"准确性-覆盖-平滑"三角确实难兼得——这正是几何平均排名要暴露的结构性事实。
- 跨模态+跨相位+跨时间的复合难度被量化:即便冠军,DSC 70.16% 也显著低于同组织方方法在单模态肺任务上的表现(NLST 上 Dice 类指标普遍更高)——CBCT 伪影与呼吸相位差构成了真实的性能天花板。OncoReg 论文自己的评述是:官方冠军与 baseline “在多数指标上非常接近”——冠军的含义是"在参赛者中最好",不是"问题已解决"。
逐方法细读(供选型时按需求对号):
- 要覆盖(Dice):SynDeeds 70.16% 最高,DeedsBCV 69.00% 与 SSKJLBW 69.45% 紧随——三者都带"结构感知"成分;
- 要点准(TRE):Fourier-Net 4.03 mm、Niftyreg 4.90 mm、ConvexAdam 4.93 mm——傅里叶域参数化与经典优化在点级打平;
- 要边界(HD95):SSKJLBW 17.60 mm、DeedsBCV 22.38 mm、SynDeeds 22.97 mm——边界好的方案不一定点准,反之亦然;
- 要平滑(SDlogJ):Niftyreg 0.05、ConvexAdam/Fourier-Net 0.10/0.07——传统正则化路线在合理性上稳定占优;
- 综合(Rank):SynDeeds 0.705 是唯一在四个维度都不垫底的参赛者——跨模态任务的"均衡税"最贵也最值。
4.3 横向读法与不可比性警示
- 各任务指标组合、数据规模、预对齐状态不同,跨任务分数不可直接比较,官方比较单位只有"任务内 rank"与跨任务 rank 的几何平均(且仅对提交≥4 个任务的方法有意义)。
- NLST 2023 的 6 队是官方表彰名单口径(2024 论文 Table 1);验证期实际提交队伍数更多但未在可核来源中披露——引用"参赛规模"时只能说 2020-2021 两届合计 20+ 队/65+ 方法(TMI 论文口径)。
- 历史 baseline 的存在使"第一名"叙事复杂化:corrField/ConvexAdam/MONAI 等官方 baseline 会与参赛者同榜展示,读榜先看身份列。
- OncoReg 论文还提醒了一个工程细节: trainable 方法在 NVIDIA RTX 4000 SFF Ada(20 GB 显存)上重训练评测,runtime 不计排名——不同届次的硬件基线不同,跨届比 runtime 无意义。
读榜三条军规(本条目 §4 全节的方法论总结):
- 先认身份再认名次——榜单上 baseline 与参赛者并列展示,冠军归属以"参评者中 rank 最高"为准;
- 先问届别再引数字——同一任务名(NLST)在 2022/2023 两个榜与论文表中指标组不同,混引即错;
- 先看显著性再谈优劣——小样本任务上未过 Wilcoxon p<0.05 的差距,严格说只是"并列"。
4.4 历史纵深:2020-2021 六任务奠定了什么
要理解 2023 结果的含金量,需要回看 TMI 论文记录的 2020-2021 届结论(六任务:Lung CT、OASIS、CuRIOUS、Abdomen CT-CT、Abdomen MR-CT、Hippocampus MR):
- 参与规模:20+ 国际团队、65+ 方法提交——配准领域第一次有了可比样本量级的公开竞赛数据。
- 任务-方法图谱:TMI 论文 Table 2 对每支队伍逐格标注(无监督/监督、相似度度量、正则化、优化器、架构)——MIND/LNCC/NGF 相似度、扩散/弯曲能正则、Adam/凸优化/L-BFGS 的使用频率第一次可统计。
- 关键教训:OASIS(最大标注集)吸引了最多学习式方案——大标注数据决定深度学习参与度;Lung CT 上学习方法更多样(传统/纯学习/混合并存);Hippocampus 上学习方法显著占优——训练集包含评测结构时学习式方法"作弊般"受益,这本身就是一条基准设计警告。
- 速度迷思破除:GPU 加速下优化式方法 3D 配准降到秒级,"学习式必然快"不成立——这条结论直接影响 2023 届保留传统方法 baseline 的决策。
2022 届(NLST 首秀 + Type 3 试验)与 2023 届(本条目)是这些教训的制度化:NLST 把"真实筛查数据+临床指标"变成常设任务;两阶段与 Type 3 把"隐藏"从 test 标签扩展到训练数据;自配置把"跨任务泛化"从口号变成排名项。
值得单独记录的一个 2020-2021 遗产是方法-任务勾选矩阵(TMI 论文 Table II):每支参赛队被逐格标注监督方式、相似度度量、正则项、优化器与架构。这张矩阵在当时是描述性统计,到 2023 年已经变成方法设计的查表工具——想用 NGF 的可以看谁在多模态任务上靠它拿到名次,想用扩散正则的可以看它在肺任务上的表现。Learn2Reg 之所以能"跨届积累",正是靠这类结构化记录让每届的方法学信息不随比赛结束而蒸发。
4.5 临床深读:一个肺结节随访闭环里的配准
把 NLST 任务的数字翻译回诊室场景:一位高危吸烟者在年度筛查中查出 8 mm 磨玻璃结节,半年后复查——放射科医生要回答"它长了吗"。这需要把两次 CT 的结节对齐比较,人工找对应费时且误差大;配准算法自动对齐后,结节体积倍增时间(volume doubling time)的计算才能自动化。此时:
- TRE 1.441 mm(冠军水平)意味着结节边界的定位误差低于一层 1.5 mm 重建图像——体积测量误差主要由分割而非配准主导;
- TRE30 与 TREnodules 分开报(后者 1.135-1.434 mm)意味着"最难 30% 案例"与"结节所在处"都被单独审计——胸膜旁结节、肺不张区这些配准失效重灾区不再是平均数里的隐形项;
- SDlogJ 0.042 意味着位移场没有折叠——沿它传播的结节轮廓不会翻转自交。
放疗场景(ThoraxCBCT)则多一层:配准结果要支撑"当天的 CBCT 上肿瘤到底在哪、剂量覆盖住了吗"的判断。冠军 DSC 70.16% 的另一面是 30% 的覆盖缺口——其中相当部分发生在 CBCT 伪影区。OncoReg 论文由此把"图像修复+配准"(SynDeeds 路线)与"特征对齐"(ConvexAdam 路线)的路线之争留给了后续届次。
这两段临床翻译是本条目把"排行数字"变成"使用证据"的核心:数字来自论文表格(可溯源),解读框架来自任务的官方动机陈述(Zenodo/OncoReg 原文),二者没有混入条目作者的外推。
4.6 一个检索者的最小结论集
如果只带三条结论离开本条目:
- 胸 CT 跨期配准的公开基准选 NLST2023:210 对、双专家标注、临床指标齐备、MONAI tutorial 开箱即用;冠军级方法(LapIRNv2 类级联+实例优化)是复现起点。
- 放疗 CBCT 配准的公开基准选 ThoraxCBCT:38 对、13 结构掩码+全躯干 landmarks、跨模态跨相位跨时间三重难度齐备;SynDeeds 的"先修图再配准"与 ConvexAdam 的"特征+凸优化"是两条已验证路线。
- 任何排行引用先过届别关:2023 的结果表在 2024 论文与 OncoReg 论文里,不在 TMI 论文里——TMI 论文是 2020-2021 的(坑 2 是本条目最高频引用事故)。
§5 方法景观:谁在打这个基准、用什么打
5.1 官方 baseline 工具箱
| 方法 | 类型 | 一句话原理 | 官方角色 |
|---|---|---|---|
| corrField | 传统/无学习 | Förstner keypoint 上 MIND-SSC 特征+最小生成树精确消息传递 | NLST baseline(rank 0.670) |
| ConvexAdam | 混合 | nnU-Net 语义特征/MIND → 耦合凸优化 → Adam 实例优化;自动超参选择 | ThoraxCBCT baseline(0.710 不参评);2020-2021 跨任务总分第一 |
| DeedsBCV | 传统 | 稀疏 keypoints+块匹配 CVH | ThoraxCBCT 参评(0.537);keypoint 导出工具 |
| NiftyReg | 传统 | 经典 B 样条自由形变 | ThoraxCBCT 参评(0.577) |
| MONAI baseline | 学习式 | 官方 tutorial 的轻量配准网络 | NLST 参评(0.452) |
baseline 的战略价值:一是给新参赛队"及格线"(打不过 NiftyReg 说明方法有问题);二是给社区"可复现锚点"(corrField 有 grand-challenge 公共 algorithm 页,一键调用);三是隔离"组织方优势"(ConvexAdam 是组织方成员参与开发的方法,以 baseline 身份出现避免"裁判员夺冠"争议——但也造成坑 6 的叙述陷阱)。
5.2 学习式阵营的谱系
- LapIRN / LapIRNv2(Mok & Chung,香港中文):条件级联配准——由粗到细的多级形变估计,每级只处理上一级残差。NLST 2023 冠军(TRE 1.441 mm,rank 0.800);2020-2021 亦多任务获奖(README 奖牌记录:两金一银一铜)。它的胜出路径印证了"大形变任务要靠多尺度"的老经验。
- SynDeeds(Heinrich 组,Lübeck):传统 Deeds 前置学习式图像合成模块——把低质量 CBCT 的伪影"修复"回干净外观再配准。ThoraxCBCT 2023 官方冠军(DSC 70.16%)。OncoReg 论文给了它的完整描述:图像合成被表述为加性去噪问题,网络学习残差而非重建干净图像。这是"深度学习修图+传统配准"混合路线在跨模态任务上的标杆胜利。
- Fourier-Net:在傅里叶域参数化位移场(低频形变自然平滑、参数量小),TRE 全场最低(4.03 mm)但 DSC/HD95 偏弱——"点对得准、面对不齐"的典型偏科样本。
- VoxelMorph++(Heinrich & Hansen):U-Net 骨干+离散化 heatmap 预测头,用 Förstner keypoints 做自监督,多通道实例优化;OncoReg(type 3 隐藏数据)亚军——说明 keypoint 自监督路线在域外数据上也能存活。
- DINO-Reg Ensemble(Song et al. 2024):OncoReg type 3 冠军,隐藏数据上 TRE 与 DSC 双第一——自监督预训练特征(DINO 系)进入配准主赛场的信号。
- Birmingham / DEQ 系(Jia et al.):深度均衡模型(DEQ)把迭代优化"蒸馏"进网络,无限步隐式求解;NLST 2023 的 TRE 绝对值全场最低(1.425 mm)但综合 rank 第三。
- SSKJLBW:ThoraxCBCT 上 HD95 最低(17.60 mm)——边界对齐最好的方案,但 SDlogJ 0.26 最差,位移场平滑性拖垮综合排名。
Lübeck 方法线时间轴(组织方自己的方法演进,亦是基准设计演进的镜像):
| 年份 | 方法 | 步骤意义 |
|---|---|---|
| 2012-2013 | Deeds(BCV) | 稀疏关键点+块匹配的经典基座,后成为 keypoint 导出工具 |
| 2015 | corrField | keypoint+最小生成树——"无学习也能打"的证明 |
| 2019 | PDD-Net | 概率密度位移——深度特征进入 Lübeck 线 |
| 2021-2022 | ConvexAdam | 特征学习+凸优化+自动超参——自配置路线成熟 |
| 2023 | SynDeeds | 图像修复+配准两段式——跨模态(CBCT)特化 |
| 2024 | VoxelMorph++ / DINO-Reg 系 | heatmap 自监督与自监督预训练特征接棒 |
这条时间轴与 Learn2Reg 届次几乎同步演进——组织方一边办赛一边用自家方法"探路",baseline 的更替史就是"当代最强配置"的更替史。检索方法学论文时,从这条线切入可以快速理解每代 baseline 的设计动机。
5.3 三条方法学结论(官方口径)
- 速度迷思破除:GPU 加速下传统优化式配准的 3D 计算降到数秒级,CNN 特征提取反而常是耗时大头——"学习式必然快"不成立(TMI 论文核心结论之一,2023 届再次验证)。
- 标签监督的适用边界:分割标签监督主要利好异患者配准(Abdomen CT-CT 上 Dice 提升约 20 个百分点);同患者场景(NLST)keypoint 自监督与无监督相似度度量(MIND/LNCC/NGF)更占优。这条边界画定了"要不要花预算标数据"的决策依据。
- 混合架构是主流赢家:排名前排普遍是"深度特征/修复+传统优化"或"学习式网络+实例优化"的组合——纯端到端回归位移场的范式并未统治基准。ConvexAdam(特征学习+凸优化)与 SynDeeds(图像修复+Deeds)两个最高分方案都是混合体。
5.4 方法卡:两场冠军战的战术细节
LapIRNv2(NLST 冠军)
- 架构:条件级联(conditional)多级配准网络——每级以前一级的形变为条件继续细化,天然匹配"呼吸形变由粗到细"的物理结构;
- 监督:NLST 提供 landmark/keypoint 监督信号,级联各级共享;
- 胜负手:TRE(1.441 mm)与 SDlogJ(0.042)同时前三——大形变任务的"准"与"稳"兼得;
- 复用建议:MONAI tutorials 有同系条件级联实现,适合作为"从基线到前排"的第一跳。
SynDeeds(ThoraxCBCT 冠军)
- 架构:学习式图像合成(修复 CBCT 伪影)+ 经典 Deeds 优化配准的两段式;
- 关键设计:合成模块被表述为加性残差问题(学习"退化-干净"之差而非直接重建),训练信号稳定;
- 胜负手:DSC 70.16% 全场最高、HD95 22.97 mm 前列——"把伪影修掉再配准"在覆盖类指标上红利最大;
- 局限:TRE(6.01 mm)低于 Fourier-Net/ConvexAdam——点级精度不是它的强项,恰好说明跨模态任务里"覆盖"与"点准"可以走完全不同的优化路径。
两卡合读的启示:2023 年的两场胜利都没有发明新理论,而是把"任务的难点结构"翻译成"模块化流水线"——这是 Learn2Reg 系基准对方法学最实在的引导作用。
复现提示两则:LapIRNv2 的条件级联思想在 MONAI tutorials 有同族实现,可直接改造为 NLST 参赛骨架;SynDeeds 的图像合成模块概念上可替换为任何 CBCT 去伪影模型(如库内 synthrad 类生成器),替换后应在 ThoraxCBCT 验证集上重跑全部四指标——覆盖类指标的收益与点级指标的损失需要一起看。
§6 获取、许可与 AI-Ready 评级
6.1 三层获取路径
| 层 | 内容 | 入口 | 状态(2026-09-26 探测) |
|---|---|---|---|
| 源数据层 | TCIA NLST(CC BY 4.0);TCIA 4D-Lung 183.04 GB(CC BY 3.0) | cancerimagingarchive.net 收藏页公开直链/TCIA Data Retriever | 公开可用 |
| 预处理层 | NLST2023.zip(224×192×224@1.5mm,170/10/30 对);ThoraxCBCT 包(38 对+掩码+keypoints);pre-2022 合集(Zenodo 3835682) | grand-challenge 平台注册 → Uni Lübeck 云(cloud.imi.uni-luebeck.de/s/…/download) | 平台注册制;未登录 HEAD 直探返回 401 |
| 评测层 | test 图像与全部监督标注;OncoReg type 3 私有数据(UKSH 25 患者常规放疗 CT) | upon request(邮件 learn2reg@gmail.com)或 grand-challenge 在线评测(learn2reg-test) | 请求制/仅服务 |
复现路径两条:
- 最低成本路线:TCIA 下载 4D-Lung/NLST 源数据自行预处理,或经 MONAI 官方 tutorial(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb)以 NLST2023.zip 为素材训练+本地验证集评测——评测代码与零位移场 sanity check 在 GitHub MDL-UzL/L2R。
- 打榜路线:grand-challenge 注册 → 下载任务包 → 验证期上传位移场 → 测试期交 Docker(组织方 GPU 实测 runtime)。
获取路径决策树:
你的目标是?
├── 训练/方法研究(要数据本体)
│ ├── 只要原始影像 → TCIA 源层(NLST / 4D-Lung,公开直链)
│ └── 要官方配对与标注 → 平台注册 → 任务包(NLST2023 / ThoraxCBCT)
├── 方法对比(要排名)
│ ├── 快速自评 → MONAI tutorial + 验证集本地评测
│ └── 正式名次 → 验证期上传 → test 期位移场/Docker
└── 临床选型(要证据)
├── 肺随访场景 → §4.1 NLST 数字 + TREnodules
└── 放疗 CBCT 场景 → §4.2 ThoraxCBCT 数字 + §7.3 OncoReg 域外对照
6.2 许可的分层声明
- NLST 源数据:CC BY 4.0(TCIA 收藏页明示;数据引用要求附 DOI 10.7937/TCIA.HMQ8-J677 与 NEJM 2011/TCIA 平台论文引文)。
- 4D-Lung 源数据:CC BY 3.0(引用要求:Hugo et al. 2016 TCIA DOI + Hugo et al. 2017 Medical Physics + Balik et al. 2013)。
- 挑战赛预处理包:平台注册制发放,无统一开放 license 声明——重分发前应视为仅限研究使用。
- 评测代码:GitHub MDL-UzL/L2R 公开(仓库未见 LICENSE 文件——按 GitHub 默认条款处理,引用代码请注明仓库)。
- Zenodo 挑战赛记录(7844799/7844798)与 pre-2022 合集(3835682)各自带 Zenodo license 标注,引用前逐记录核对。
许可层与数据层的对应关系(一条记忆线):越接近原始数据越开放(CC BY),越接近评测过程越封闭(注册/请求制)。这不是疏忽而是设计——开放源数据保证研究自由,封闭评测标注保证排名公信力。
许可三层的高频追问:
- “CC BY 4.0 和 CC BY 3.0 差在哪?”——对使用者几乎无差(署名即自由),差别在版本条款细节;引用时照抄各自收藏页标注的版本号即可,不要统一写成"CC BY"。
- “预处理包改了重采样,我还算用 CC BY 数据吗?”——衍生数据处理在 CC BY 框架内自由;灰色地带是"挑战赛配对与切分方案"本身——忠实复刻官方切分再分发,等于变相再分发预处理包,建议只分发"来源+代码"让他人复现。
- “隐藏层标注能买吗?”——非卖品;组织方提供的是评测服务而非数据本身,这是排名公信力的物质基础。
6.3 DAIMS 评级
| 维度 | 评分(0-5) | 依据 |
|---|---|---|
| D 可发现性 | 4.5 | grand-challenge 平台+Zenodo DOI+TMI/MELBA 论文三重索引;但 learn2reg.github.io 老站与 grand-challenge 双站并存有检索混淆成本(坑 1) |
| A 可获取性 | 3.0 | 源数据公开直链+预处理包平台注册可及;401 直链门槛与 test 标注请求制拉低;无统一开放 license |
| I 可互操作性 | 4.0 | NIfTI 统一格式、各向同性重采样、JSON 配对清单、MONAI/nnU-Net 生态直连;评测输入为标准位移场 |
| M 元数据 | 4.0 | 官方 Datasets 页逐包规格+TCIA 收藏页完整 DICOM 元数据;缺预处理包的机器可读数据卡 |
| S 可持续性 | 4.5 | 2019-2026 连续运营、排行榜持续开放、代码开源、后续届次(2026 CodaBench)已启动——基准寿命在医学 AI 领域罕见 |
| AI-Ready 综合 | 4.0/5 | "评测即服务"范式的标杆:公开数据+开源评测+隐藏测试的可复现性设计完备;扣分项在预处理包的注册制与统一 license 缺位 |
评级的两点说明:D 维扣分源于双官网割裂而非内容缺失——信息本身完备且免费,只是需要知道去哪找;A 维扣分是"分层获取"结构的必然代价,源数据层实际是满分的,拉低总分的是预处理包(401 门槛)与隐藏层(请求制)。若未来官方把预处理包迁至开放镜像(如 Zenodo/HF),A 维可升 4.5、综合可升 4.5——这是本条目最重要的升级触发点。
6.4 引用清单(逐 DOI)
| 引用对象 | DOI/来源 |
|---|---|
| 挑战赛 2023 官方记录 | 10.5281/zenodo.7844799(姊妹 7844798) |
| 2020-2021 基准论文 | 10.1109/TMI.2022.3213983(IEEE TMI 42(3):697-712;arXiv 2112.04489) |
| 2022-2024 总结论文 | 10.59275/j.melba.2025-gc8c(arXiv 2509.01217) |
| OncoReg spin-off 论文 | arXiv 2503.23179(MELBA 2026 特刊) |
| NLST 筛查试验 | 10.1056/nejmoa1102873(NEJM 365(5):395-409) |
| TCIA 平台 | 10.1007/s10278-013-9622-7(J Digit Imaging 26:1045-1057) |
| NLST 影像 | 10.7937/TCIA.HMQ8-J677 |
| 4D-Lung 影像 | 10.7937/K9/TCIA.2016.ELN8YGLE |
| 4D-Lung 描述论文 | 10.1002/mp.12059(Med Phys 44(2):762-771) |
| 4D-CBCT 方法论文 | Balik et al. 2013(PMCID PMC3647023) |
| ConvexAdam | IEEE TMI 扩展版(xplore 10681158)/ CVPR 2023 版 |
| pre-2022 数据合集 | 10.5281/zenodo.3835682 |
| 姊妹记录 | 10.5281/zenodo.7844798(与 7844799 同内容双记录) |
| 持续评测站 | learn2reg-test.grand-challenge.org |
| OncoReg 提交仓库 | github.com/MDL-UzL/OncoReg |
| 评测代码 | github.com/MDL-UzL/L2R |
6.5 复现成本估算
| 路线 | 数据获取 | 算力 | 人力 | 可达结果 |
|---|---|---|---|---|
| TCIA 源数据自建 | 183 GB 下载+自写预处理 | 单卡可训 NLST 级别 | 1-2 周工程 | 自建任务包,指标需自行对齐官方 |
| 官方包+MONAI tutorial | 平台注册下载 | 单卡(tutorial 默认配置) | 1-3 天 | NLST 本地训练+验证集评测 |
| 在线打榜 | 平台注册+Docker 打包 | 组织方 GPU(test 期) | 1 周(含 sanity check) | 官方排行榜位次与全部指标 |
| OncoReg type 3 | 邮件申请(不发放数据) | 自备训练算力 | 按申请流程 | 隐藏集评测分数(持续开放) |
成本估算的基准假设:单卡(≥16 GB 显存)可完成 NLST 级训练与 ThoraxCBCT 推理;官方排行评测的算力由组织方承担;OncoReg type 3 的重训练在组织方指定 GPU(RTX 4000 SFF Ada 20GB)上统一执行——参赛者本地算力只影响开发迭代速度,不影响最终评测公平性。这是"评测即服务"在算力维度的体现:把硬件差异从排名变量里剔除。
6.6 库内 AI-Ready 光谱中的位置
对照库内其他条目的 AI-Ready 形态,Learn2Reg 2023 占据一个独特象限:
| 条目 | 数据形态 | 开放度 | 评测设施 |
|---|---|---|---|
| 本条目 Learn2Reg 2023 | 挑战赛任务包+隐藏层 | 中(三层混合) | 满分型(排行榜+评测代码+统计排名) |
| TCIA 源数据系(如 lctsc) | 原始 DICOM | 高(CC BY) | 无 |
| 大模型预训练系(如 abdomenct-1k) | 大规模重采样包 | 高 | 无 |
| 请求制系(如掩码 upon request 类) | 标注件 | 低 | 无 |
一句话:Learn2Reg 是库内"数据开放度中等、评测开放度最高"的样本——它把开放性花在评测与代码上而非全部标注上。检索者若目标是"训练数据",走 TCIA 源层;若目标是"方法对比",走任务包+排行榜。两种目标对应两种 AI-Ready 读法,条目 §6.1 的三层表是分流器。
§7 生态与谱系:从 tutorial 到 CodaBench
7.1 八年路线图
| 年份 | 形态 | 关键内容 |
|---|---|---|
| 2019 | MICCAI 深圳 Learn2Reg Tutorial | 专家讲座+实操——社区启蒙,非竞赛 |
| 2020 | 首届 challenge(Type 1) | 六数据集雏形+开源评测/排名代码 |
| 2021 | 第二届(Type 1) | 同六任务(Lung CT/OASIS/CuRIOUS/Abdomen CT-CT/Abdomen MR-CT/Hippocampus),两届合计 20+ 队/65+ 方法 |
| 2022 | 第三届(MICCAI workshop) | 引入 NLST;试验 Type 3(全隐藏);自配置赛制起步 |
| 2023 | 第四届(本条目) | NLST 扩展两阶段制+双专家 landmark+TREnodules;新增 ThoraxCBCT;OncoReg spin-off 启动 |
| 2024 | 第五届 | 三新任务:ReMIND2Reg(术中超声,Harvard/BWH Reuben Dorent 组)、LUMIR(大规模脑异患者,JHU Junyu Chen 组)、COMULISglobe SHG/BF(显微镜——首个显微配准基准) |
| 2025 | 第六届 | LNCS proceedings 出版(DOI 10.1007/978-3-032-25169-5) |
| 2026 | 第七届(MICCAI Strasbourg) | 迁至 CodaBench 托管;Task 1 PSMAReg(与 SNMMI 合作);Task 2 Learn2Breath(COPDGene) |
路线图的两条主线一目了然:任务面从"六任务平台"(2020-2021)收窄为"双任务深耕"(2023)再扩张为"三任务+显微"(2024)与"学会联办双任务"(2026);制度面从 Type 1 一路推向 Type 3,平台从 grand-challenge 自研页迁到 CodaBench 引擎。每一步都保留上一届的任务作为历史包持续开放——"加法式演进、不减法退役"是 Learn2Reg 数据资产八年不缩水的直接原因。
7.2 2026 届的两个新任务:路线图的下一站
2026 届的选题继续沿"临床科室真实痛点"推进,且首次与专业学会联合办赛:
- Task 1 PSMAReg(与 SNMMI 核医学与分子影像学会合作,Junyu Chen 主导):治疗前-随访全身 PSMA PET/CT 纵向配准,服务治疗计划、剂量测定与疗效评估。规模:训练+验证 597 例 PET/CT(378 名患者,其中 164 名有两次以上随访);测试 262 例(131 名患者)。难点:治疗前后解剖变化、多模态表观差异、PET 定量保持——"形变不能破坏 SUV"是核医学版的 SDlogJ 困境。
- Task 2 Learn2Breath(与 COPDGene 多中心研究合作):吸气-呼气胸部 CT 配准,服务肺生物力学与疾病进展量化。规模:200 对训练+10 对验证;测试 100 对(体积差 ≥2 L 的重度病例)。COPDGene 的慢阻肺人群把"大形变"推向极端——2 升的肺体积差比 NLST 的常规呼吸差更陡峭。
这两任务都标注了"internally acquired"测试集——组织方持有的内部采集数据做测试,公开部分只到验证为止:隐藏评测的范式已经完全内化。共性也值得记:PSMAReg(核医学纵向)与 Learn2Breath(呼吸力学)都把"公开训练+隐藏测试+临床学会背书"三件套齐装满员——Learn2Reg 2023 年立下的"临床相关性优先"路线至此完成制度化。
7.3 OncoReg:从 ThoraxCBCT 长出的肿瘤学分支
OncoReg 是 2023 届的直接衍生品,两步走:
- 第一步(type 1/2):MICCAI 2023 后即启动,围绕 ThoraxCBCT 与扩展 NLST(加病灶标注)公开竞赛——本条目 §4 的结果表即此阶段产物。
- 第二步(type 3):2023-12-06 kickoff,把 ThoraxCBCT 换成完全隐藏的私有数据——UKSH(石勒苏益格-荷尔斯泰因大学医院)放疗科常规采集的 25 名肺癌患者(27 例、每例 2 配对),3-fold CV 划分(15/3/9),256×192×192@1.5mm,52 结构半自动掩码、平均 25 landmarks/对、ConvexAdam 导出 keypoints、呼吸相位不同步(比 ThoraxCBCT 更贴近真实摆位场景)。深度学习方法以重训练方式参赛(组织方统一在 NVIDIA RTX 4000 SFF Ada 20GB 上重训练与评测),2024-02-20 虚拟 winter workshop 收官,DINO-Reg Ensemble 夺冠(TRE 与 DSC 双第一),VoxelMorph++ 与 ConvexAdam 跟进,传统 DeedsBCV/NiftyReg 垫底——域外真实数据上,学习式与混合式进一步拉开差距。
OncoReg 的意义在证明了一条"基准孵化"路径:公开任务(ThoraxCBCT)积累方法与信任 → 私有隐藏数据(type 3)检验域外泛化 → MELBA 特刊沉淀论文。官方宣称的初心也值得一记:全球每年超过 170 万人死于肺癌——配准的精度直接决定放疗剂量画在哪。
ThoraxCBCT(公开)与 OncoReg type 3(私有)的规格对照(OncoReg 论文 Table 1):
| 项目 | ThoraxCBCT(公开) | OncoReg type 3(私有) |
|---|---|---|
| 例数 | 19 例(2 对/例=38 对) | 27 例(2 对/例),3-fold CV 15/3/9 |
| 患者来源 | TCIA 4D-Lung(试验性采集) | UKSH 常规放疗临床数据(25 患者) |
| 呼吸相位 | 同步(FBCT 吸气/CBCT 呼气,受控) | 不同步(真实摆位,相位随机) |
| 图像规格 | 390×280×300 @1.0 mm | 256×192×192 @1.5 mm |
| 掩码 | 13 结构(部分标注) | 52 结构(全量标注) |
| Landmarks | 平均 16/对 | 平均 25/对 |
| Keypoints 导出 | DeedsBCV | ConvexAdam |
| 获取 | 平台注册下载 | 仅评测服务 |
这张对照表是"公开基准→真实域外"鸿沟的量化呈现:结构数翻四倍、landmark 密度提高 56%、呼吸相位从受控变随机——公开榜上的好成绩迁移到 type 3 隐藏集时出现了明显衰减(冠军易主为 DINO-Reg Ensemble,传统方法垫底)。做临床部署预期管理时,这张表比任何排名都更直接。
对 2023 届本身的定位,这张表也给出一个注脚:ThoraxCBCT 公开包的成绩(冠军 DSC 70.16%)应读作"该任务的上界参考"而非"临床可达成水平"——OncoReg 论文正是用私有域外数据标定了这段差距,这也是 Learn2Reg 系条目在库内特有的"自带域外对照"优势。
7.4 影响力外溢
- NLST 成为胸 CT 配准的事实基准:2025 年的 MICCAI 配准新方法论文(如隐式形变/可学习核方法)仍以"Learn2Reg 2023 挑战赛的 NLST 数据"报告 TRE/TRE30/SDlogJ,并直接对标 uniGradICON、ModeT、H-ViT、NICE-Trans、WiNet 等历史成绩——一个挑战赛数据集变成独立存在的方法学舞台。
- 评测代码的公共品化:Wilcoxon 显著性排名、零位移场 sanity check、位移场 I/O 规范——L2R 仓库的这套工具被后续配准类挑战赛反复借用;grand-challenge 的 algorithm 容器模式(corrField 等公开算法页)也成了"论文方法可直接调用"的先例。
- “训练即提交”(phase 2 代跑训练 Docker):2023 年在 NLST 上的制度实验,为 Type 3 赛制成熟铺路,也预演了 2024/2026 届的大规模隐藏评测。
- 组织团队的连续性:Heinrich(Lübeck)—Hering(Radboudumc/Fraunhofer MEVIS)组合贯穿 2020-2023;2024 起 JHU 的 Junyu Chen 团队接管主导,Hering/Heinrich 转为共同组织——基准的代际交接在医学 AI 领域罕见地平稳完成。
- MONAI/nnU-Net 生态的标准化效应:官方 tutorial 与 nnU-Net 特征接口让"配准新方法"的进入门槛降到"会训分割网络"的水平——2024 届参赛队的背景多样性(含纯放疗科团队)可部分归功于此。
- 对其他影像挑战赛的反哺:TREnodules(任务指标临床化)与 phase 2 代跑训练(防泄漏制度化)两项设计被后续非配准类挑战赛讨论与效仿——Learn2Reg 的赛制输出已成为 grand-challenge 社区的公共知识。
- 开放评测代码的示范效应:把评测与排名代码(连零位移场 sanity check)作为一等公民发布,让"挑战赛结束即失明"的常见病在本系列不存在——2023 届的每一次排名变动今天仍可独立复算,这在对时间敏感的系统综述里价值极高。
7.5 grand-challenge 平台机制速览
Learn2Reg 的持续运营依托 grand-challenge 平台的一套机制,理解它们有助于解读页面行为:
| 机制 | 表现 | 对检索者的含义 |
|---|---|---|
| challenge 归档 | 主站导航含 Archive(L2R’20 至 L2R’25 各任务独立入口) | 历届结果从归档进,不混在现页 |
| leaderboard 快照 | 各任务榜独立 URL(如 evaluation/thoraxcbct/leaderboard) | 引用时给出具体榜 URL+日期 |
| 删除线标记 | L̶2̶R̶’̶2̶2̶ ̶N̶L̶S̶T̶ 表示已弃用版本 | 弃用榜数字勿再引用(坑 8) |
| algorithms 容器页 | corrField 等 baseline 有公共 algorithm 页 | 不参赛也能一键调用 baseline |
| 论坛 | 数据发布/FAQ 帖(部分登录墙) | 登录墙内容以公开页与论文为准 |
| CodaBench 迁移 | 2026 届起比赛引擎换为 CodaBench | 老 API/自动化的引用者注意接口变化 |
7.6 出版物轨迹
| 年份 | 出版物 | 载体 |
|---|---|---|
| 2022/2023 | TMI 基准论文(2020-2021 届总结) | IEEE TMI 42(3):697-712 |
| 2025 | 2024 届总结+NLST 2023 结果 | MELBA 2025:034(DOI 10.59275/j.melba.2025-gc8c) |
| 2025 | 2025 届 proceedings | Springer LNCS(DOI 10.1007/978-3-032-25169-5) |
| 2026 | OncoReg 论文(ThoraxCBCT 规格+结果) | MELBA 特刊/arXiv 2503.23179 |
| 2026 | 2026 届启动 | CodaBench + MICCAI Strasbourg |
| 持续 | NLST 对标文献流 | MICCAI/IPMI 等新方法论文的基准表 |
这条轨迹本身是个信号:Learn2Reg 选择"每届沉淀一篇开放式期刊总结"(MELBA)而非"只发 LNCS 会议短文"——总结论文里带着完整的排行数据表,这正是 2023 届数字今天仍可精确引用的原因。
§8 使用指南:三条复现路线与 12 项检查
8.1 三条复现路线
路线 A——源数据重建(最彻底):从 TCIA 拉 NLST/4D-Lung 原始 DICOM → 按官方预处理(重采样、配对、预对齐)自建 → 用 L2R 仓库评测代码算指标。适合要做方法学审计或扩展标注的团队;成本最高。注意 4D-Lung 的 DICOM 含全部 10 个呼吸相位与 RTSTRUCT,任务包只取了最大吸气/呼气相——自建时先明确你要哪个相位的子集。
路线 B——任务包直训(最常用):grand-challenge 注册下载 NLST2023.zip / ThoraxCBCT 包 → MONAI tutorial 跑通 NLST 基线 → 换自己的模型 → 验证集本地评测。NLST_dataset.json 的 training_paired_images 字段即配对清单;tutorial 的 transform 链把 keypoint 变换放在最后加载——这是容易踩的工程细节。
路线 C——在线打榜(最省心):注册 grand-challenge → 验证期上传位移场拿实时排名 → 测试期(持续开放的历史任务)提交 Docker。注意打榜前先用零位移场文件做 sanity check,评测管线不通是最常见的第一晚翻车原因。
8.2 提交物规格:位移场与 Docker
位移场(Type 1 与验证期):
- 3D 位移场,NIfTI 格式,与 fixed 图像同网格;
- 单位为毫米(与体素间距解耦——评测代码按 mm 计 TRE);
- 在整个体积上评测(官方口径:evaluation across the full volume);
- 提交前用仓库提供的零位移场文件做管线自检——零场应得 initial TRE(NLST 10.40 mm / ThoraxCBCT 11.91 mm),对不上说明坐标系或方向有错。
Docker(Type 2):
- grand-challenge algorithms 平台容器规范(输入/输出接口声明);
- 组织方统一 GPU 评测并记录 runtime(runtime 参与 2023 排名叙述但 OncoReg type 3 明确不计分);
- NLST phase 2 的训练 Docker 还要包含训练入口——组织方在隐藏数据上代跑训练。
runtime 的评测口径(跨届可比性说明):
| 届次 | 硬件口径 | 是否计分 |
|---|---|---|
| 2020-2021 | 未统一约束(TMI 论文自述为设计局限) | 否 |
| 2023 | 组织方统一 GPU、Docker 实测 | 计入排名叙述 |
| OncoReg type 3 | NVIDIA RTX 4000 SFF Ada 20GB | 明确不计分 |
| 2026 | CodaBench 引擎(口径随任务页披露) | 以任务页为准 |
位移场提交的高频错误清单(来自零场 sanity check 的设计动机):
- 坐标系搞反(RAS/LPS)——TRE 变得比未配准还大或出现负向偏移;
- 单位搞错(体素 vs 毫米)——1.0 mm 体素的任务上误差恰差一个 spacing 倍数,最易漏检;
- 网格错位(位移场与 fixed 图像仿射不一致)——评测端重采样后整体错位;
- 方向翻转(z 轴上下颠倒)——肺任务上"膈肌顶"跑到"肺尖";
- 形变场折叠未检查——Dice 可能尚可但 SDlogJ 崩坏,几何平均被拖垮。
前四类都会被零场自检直接暴露(零场应精确复现 initial TRE),第五类要靠自己的 SDlogJ 预检——官方把 zero-deformation fields 文件放进仓库就是为此。
8.3 TCIA 源数据下载操作要点
走源数据层时的实用要点:
- 4D-Lung:收藏页提供两种入口——全量包(.tcia 清单文件,配 TCIA Data Retriever 下载,183.04 GB)与 IDC 云检索(portal.imaging.datacommons.cancer.gov,按 collection_id=4d_lung 过滤)。自建 ThoraxCBCT 口径需取每患者的 planning FBCT(吸气相)+ 疗程首尾 CBCT(呼气相)——先读 Hugo 2017 论文的相位定义再动手。
- NLST:体量远大于 4D-Lung,按受试者检索;挑战赛包只取了其中一小部分配对,自建配对要自己定义"吸气-呼气"判据(挑战赛口径未逐步公开,完全复刻 170/10/30 的切分不可行——这也是优先用官方包的理由)。
- 通用:TCIA 下载强制要求引用数据 DOI 与指定论文(收藏页 Citations 节),商用另核 TCIA 数据使用政策。
下载排障三则:一、TCIA Data Retriever 对大清单(4D-Lung 6,690 series)会分批断点续传,日志里 series 级重试属正常;二、IDC 云入口适合只要子集的场景(按 collection_id=4d_lung 过滤后可导出选定 series),比全量 183 GB 轻得多;三、两条入口的 DICOM 内容一致但打包方式不同,比对来源时认 UID 不认文件名。
8.4 基于 Learn2Reg 数据的研究检查清单(12 项)
- 口径先行:引用规模数字时注明口径——NLST 210 对(170/10/30)是挑战赛包口径,SAMCL 等文献的 147/21/42 对是自述重采样口径(坑 4)。
- 层数分离:TCIA 源数据(20 患者/183 GB)与 ThoraxCBCT 任务包(19 例/38 对)不是一个东西(坑 3),规模、license、引用对象都要分层。
- baseline 识别:读榜先认身份列——ConvexAdam/corrField/MONAI/NiftyReg 是官方 baseline,"第一名"与"官方冠军"可能不同人(坑 6)。
- 届别对齐:NLST 2023 结果出自 2024 总结论文;learn2reg.github.io 上是 2020-2022 旧榜;grand-challenge 现页是 2026 版——先确认届别再引数字(坑 1、坑 2、坑 8)。
- 指标四件套:报 TRE 必须同时报 TRE30(鲁棒性)与 SDlogJ(合理性),单指标叙述会被审稿人抓住。
- 显著性检验:宣称"A 优于 B"前自查 Wilcoxon p<0.05 是否成立——Learn2Reg 的 rank 体系只认显著差异,小样本任务(ThoraxCBCT 验证集仅 6 对)尤甚。
- 预对齐依赖:ThoraxCBCT 附带人工大平移校正、NLST 附带仿射预对齐——你的方法若从零处理原始 DICOM,成绩不与榜上直接可比。
- 呼吸相位语义:FBCT=吸气相、CBCT=呼气相是任务设定而非数据缺陷;跨相位大形变是特性,不要"矫正"掉。
- keypoints 的来源:ThoraxCBCT 的配对 keypoints 由 DeedsBCV 导出——用它们做自监督训练会把 Deeds 的偏差带进你的模型,做方法学对比时应声明。
- 掩码的半自动属性:13 结构掩码经 TotalSegmentator 生成+配准传播+UKSH 医生验证——是"半自动金标准",不是纯手工;OncoReg 私有集才是全量标注(52 结构)。
- 许可分层:源数据 CC BY(4.0/3.0)≠ 预处理包可再分发;衍生数据发布前核对 §6.2 五条。
- 引用完整:数据引 TCIA DOI,任务设计引 Zenodo 7844799,结果表引 MELBA/arXiv 2509.01217 与 arXiv 2503.23179——三个来源缺一不可。
8.4 常见误区 FAQ
Q:我能在自己论文里说"在 Learn2Reg 上达到 SOTA"吗?
能,但要写清任务、届别、指标与是否含 baseline 对比;"SOTA"若来自在线提交,注明提交时间与排行榜版本——排行榜是活的。
Q:验证集能用来调参吗?
赛制允许(验证期每日多次提交就是明示),但 test 成绩的泛化责任自负——验证集 6-10 对的小样本意味着"调到验证最优"很容易过拟合,排名里的 Wilcoxon 检验部分就是为了吸收这种噪声。
Q:NLST 的训练对能和其他肺数据集(如 LIDC/库内 luna16 系)混训吗?
数据层面无禁止,但混训后模型不再是"L2R NLST 口径"的参赛者,成绩与榜上不可比;方法学研究可自由混训,基准对比要守口径。
Q:ThoraxCBCT 的两个配对要分开建模吗?
官方按 2 对/例评测(时间相近对+数月对),两类错位难度不同;论文报告细分对成绩(T0 vs END)是加分项——OncoReg 论文即按此展开讨论。
Q:runtime 怎么测才有效?
只在 Type 2 Docker 通道有意义(组织方统一硬件);自己电脑上测的秒数没有基准可比性。
Q:我可以只报验证集成绩发论文吗?
技术上可以(验证集公开),但审稿风险高——验证集只有 6-10 对,且与 test 同分布;稳妥写法是"验证集本地评测 + 在线平台正式评测"双口径。
Q:Learn2Reg 的排名代码能用在非医学数据上吗?
能,ranking 代码只依赖逐案例分数矩阵与 Wilcoxon 检验;移植时注意其"未提交记 0.1 分"的约定是否适配你的场景。
Q:2023 届的 Docker 还能跑吗?
部分 baseline(corrField 等)有常驻 algorithm 页可调用;参赛者的 Docker 依平台策略保留,运行环境(驱动/CUDA)随平台演进可能需适配——引用 runtime 数字时注明届次硬件。
8.5 快速上手:跑通 NLST 基线的步骤清单(不含训练,约半天)
- 注册 grand-challenge 账号,加入 Learn2Reg challenge(Join);
- 从 Datasets 页或任务页获取 NLST2023 下载入口(遇 401 走平台内链,坑 5);
- 解包后核对 NLST_dataset.json:training_paired_images 应有 170 条、validation 10 条;
- 打开 MONAI tutorial notebook(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb),按其 transform 链(keypoint 变换最后加载)载入验证集;
- 用仓库提供的 zero-deformation field 先跑一遍评测:TRE 应接近 10.40 mm(未配准基线)——对不上先查坐标方向,不要开训;
- 换任意可用模型(或 MONAI baseline)在验证集上出第一版 TRE/TRE30/SDlogJ 三指标;
- 与官方 NLST 榜单(TRE-LM/TRE-KP/SDlogJ 组)对照定位自己处于 0.1-1.0 rank 的哪一段;
- 需要正式名次再走验证期上传/测试期 Docker(§3.1)。
ThoraxCBCT 同构:包内 11 train/3 val 例、掩码+keypoints 齐备,评测指标组换为 Dice/TRE-KP/HD95/SDlogJ;先跑零场(TRE 11.91 mm/DSC 29.04%)自检。
§9 库内互链网络:配准家族的检索面
Learn2Reg 2023 在本库中的位置是"配准挑战赛家族"的中枢节点,向下连接各解剖部位与模态的数据集条目:
| 库内条目(record_id) | 关联逻辑 | 检索场景 |
|---|---|---|
| chaos(337) | 腹部 CT-MRI 跨模态多器官数据——Learn2Reg Abdomen MR-CT 任务的三源数据之一(CHAOS 名列其引用 Readme),跨模态配准同题 | 查"腹部 MR-CT 配准原料" |
| amos(76) | 腹部 CT+MRI 多器官 500 例——跨模态跨中心腹部配准的自然延伸评测场 | 查"腹部多器官跨模态" |
| abdomenct-1k(402) | 千例腹部 CT——异患者腹部配准可扩展训练池 | 查"腹部配准扩数据" |
| ctpelvic1k(465)/ ctspine1k(443)/ verse-spine(435) | 盆腔/脊柱 CT 大样本——骨性结构配准与 ThoraxCBCT"骨结构掩码"路线同源 | 查"骨性解剖配准" |
| ct-rate(546) | 纵隔淋巴结 CT——同患者跨期胸 CT 的另一形态 | 查"胸 CT 跨期随访" |
| rider-lung-ct(267)/ lctsc(277) | TCIA 肺部 CT——与 NLST/4D-Lung 同库同源的放疗与随访场景 | 查"TCIA 肺放疗数据" |
| pddca(454) | DIRLab POPI 4DCT——肺 4D 配准的前代基准,100 landmarks 传统直接可比 | 查"肺配准老基准" |
| fetreg(343) | 胎儿 MRI 配准挑战——MICCAI 配准挑战家族的产科分支 | 查"配准挑战赛家族" |
| hecktor(461)/ hecktor2026(638) | 头颈 PET-CT/CBCT 配准挑战——同"跨模态+放疗"配方 | 查"头颈放疗配准" |
| autopet(468)/ autopet-v(634) | 全身 PET-CT 自配准挑战——SUV 保持与形变合理性的同类矛盾 | 查"核医学配准" |
| reg2026(639) | 配准方向后续挑战条目——届次演进链的下一环 | 查"配准挑战 2026" |
| totalsegmentator(422) | ThoraxCBCT 掩码生成与体干掩码的直接工具——标注流水线依赖 | 查"标注工具链" |
| synthrad(671) | 跨模态合成(MR→CT 等)——ThoraxCBCT 的 SynDeeds"合成后配准"路线的姊妹问题 | 查"跨模态合成替代配准" |
| nih-pancreas-ct(367) | 腹部 CT 小结构标注——异患者腹部任务的补充评测面 | 查"腹部小结构" |
| fastmri(23) | 快速 MRI 重建——序列级对齐问题的近亲领域 | 查"跨模态重建-配准交界" |
| duke-breast-mri(440) | 乳腺 MRI——异模态异患者对齐的候选延伸域 | 查"乳腺影像配准延伸" |
互链叙事三则:
- "挑战赛家族"横向链:pddca(2010s,传统 landmark)→ fetreg/hecktor(2020s,跨模态专科化)→ Learn2Reg(平台化多任务)→ reg2026/hecktor2026(延续)——一条"配准评测基础设施化"的完整时间线。
- "工具-数据"纵向链:totalsegmentator 既是独立条目又是 ThoraxCBCT 标注管线的零件——标注工具与基准数据的共生关系在本库其他条目(如 nnU-Net 系)反复出现。
- "同题异解"链:跨模态对齐问题在 synthrad(生成式合成)、SynDeeds(合成+配准)、hecktor/autopet(直接配准)三条路线并存——检索者按问题而非按数据集检索时,这组互链最有价值。
9.2 三条检索路径(按读者目的分流)
按解剖部位走:
- 胸/肺:本条目(NLST/ThoraxCBCT)→ pddca(454) → rider-lung-ct(267) → lctsc(277) → ct-rate(546)
- 腹部:chaos(337) → amos(76) → abdomenct-1k(402) → ctpelvic1k(465) → nih-pancreas-ct(367)
- 脊柱/骨:verse-spine(435) → ctspine1k(443)(骨性配准与 ThoraxCBCT 骨掩码同域)
- 头颈/脑:hecktor(461) → hecktor2026(638) →(脑异患者历史包 OASIS,见 §2.4)
按模态对走:
- CT↔CT(跨期):NLST2023(本条目)→ pddca(454)
- CT↔MR(跨模态):chaos(337) → amos(76) → synthrad(671, 合成路线)
- CBCT↔CT(放疗):ThoraxCBCT(本条目)→ hecktor(461)
- PET↔CT:autopet(468) → autopet-v(634) →(2026 PSMAReg,见 §7.2)
按工具链走:
- 分割→配准标注:totalsegmentator(422) →(本条目 §2.3.3 流水线)
- 自监督对应点:ThoraxCBCT keypoints →(ConvexAdam/VoxelMorph++ 路线,§5)
- 评测与排名:MDL-UzL/L2R →(附录 D 伪代码)
- 跨模态合成替代:synthrad(671) →(SynDeeds 修图路线,§5.4)
三张路径图合起来覆盖了"我要做 X 配准"句式的大多数填空:X∈{部位}×{模态对}×{工具偏好}。每条路径的终点都是库内可下载数据或本条目的具体章节。
9.1 互链落点核对表(正文内链 5 处 + 表格 19 点)
按本库互链惯例,正文中至少 5 处出现库内条目内链语义(不依赖表格):
- §2.4 Abdomen MR-CT 的 CHAOS 来源 → 库内 chaos(rid 337);
- §2.3 标注流水线的 TotalSegmentator → 库内 totalsegmentator(rid 422);
- §4.4/§4.1 肺配准 landmark 传统与 DIRLab 前代 → 库内 pddca(rid 454);
- §5.4 SynDeeds"合成后配准" ↔ 跨模态合成 → 库内 synthrad(rid 671);
- §7.6/§7.1 挑战赛家族届次链 → 库内 hecktor2026(rid 638)、reg2026(rid 639)、fetreg(rid 343)。
表格版 19 点全景见上表。发布后由 link_builder 重建为导航链接。
§10 坑点清单:检索与复用必读的八则
坑 1:双官网并存,老站不可达且内容停在旧届
learn2reg.github.io 与 learn2reg.grand-challenge.org 长期并存:前者是 2020-2022 时代的老官网(本次核验中直连与 Wayback 快照均不可达),后者是现役主站——首页展示的却是 2026 届内容,2023 届信息藏在 Datasets、OncoReg 与归档页。检索 Learn2Reg 2023 若只看 github.io 或只看主站首页,都会拿错届别的信息。示例场景:有人在老站看到"Task 1-4"的四任务结构(2021 届),误当成 2023 届任务列表。处理:一律以 learn2reg.grand-challenge.org 为准,历史信息进归档页找。
坑 2:“Learn2Reg 2023 没有独立论文”——年份错配高发
Zenodo 记录(10.5281/zenodo.7844799,2023-04-19)只是挑战赛描述记录,不是论文;IEEE TMI 论文(10.1109/TMI.2022.3213983,2023;42(3):697-712)覆盖的是 2020-2021 届(六任务、20+ 队、65+ 方法);2022-2023 届的正式总结要等到 2024 届总结论文(MELBA 2025,arXiv 2509.01217)与 OncoReg 论文(arXiv 2503.23179)。示例场景:论文写"NLLST 2023 数据,方法见 Hering et al. TMI 2023"——引的却是 2021 届的任务与结果。处理:结果表按届别引对应来源——NLST 2023 表引 arXiv 2509.01217 §4.1.4,ThoraxCBCT 2023 表引 arXiv 2503.23179 Table 2。
坑 3:ThoraxCBCT ≠ 4D-Lung——规模引用必须分层
L2R 任务包只含 19 例(11/3/5,38 对),是 TCIA 4D-Lung 收藏(20 名局部晚期 NSCLC 患者、183.04 GB、347,330 幅图像)的子集重打包。把"20 患者/183 GB"当 ThoraxCBCT 任务规模引用,或把"19 例"当 4D-Lung 收藏规模引用,都会错。示例场景:数据管理平台把 4D-Lung 收藏页的体量字段直接填进"Learn2Reg ThoraxCBCT"条目。处理:规模分层表述——上游收藏 vs 下游任务包,两层各有 DOI。
坑 4:NLST 规模多口径并存
挑战赛预处理包口径:210 对(170 train/10 val/30 test)、224×192×224@1.5mm(MONAI 官方 tutorial、DEQReg 论文、数据目录站三源一致);SAMCL 论文(arXiv 2406.17575)写 294/42/84 幅图像(=147/21/42 对,自述 3mm 重采样口径);2023 扩展版又叠加隐藏数据与双专家 >100 landmarks/例。示例场景:两篇综述引用 NLST 规模相差 40%,各自都没错——只是口径不同。处理:默认引用 210 对(170/10/30)并注明"挑战赛包口径";见到其他数字先问预处理口径。
坑 5:Lübeck 云下载直链返回 401
Datasets 页挂的三个下载直链(cloud.imi.uni-luebeck.de/s/…/download)在未登录状态 HEAD 探测均返回 401——链接需要平台会话或已轮换。裸链下载会失败。示例场景:脚本化的数据管道把 Datasets 页直链写死,部署后整链失败。处理:经 grand-challenge 平台注册进入;源数据走 TCIA 公开直链不受影响;自动化管道应对 401 做人工介入降级。
坑 6:“谁是 ThoraxCBCT 冠军”——baseline 与参赛者必须区分
官方结果表里 ConvexAdam 总 rank 0.710 高于 SynDeeds 0.705,但 ConvaxAdam 是组织方提供的 baseline、不参评;官方冠军是 SynDeeds(DSC 70.16%、TRE 6.01 mm)。NLST 任务同理——corrfield(0.670)是官方 baseline。示例场景:新闻稿写"ConvexAdam 赢得 2023 ThoraxCBCT"——方法上说得通(rank 最高),赛制上是错的。处理:叙述冠军时写"官方冠军 SynDeeds(组织方 baseline ConvexAdam 未参评)",勿省略括号里的半句。
坑 7:license 三层混合,没有统一答案
NLST 源数据 CC BY 4.0、4D-Lung 源数据 CC BY 3.0、挑战赛预处理包平台注册制无统一开放 license、test 标注 upon request、评测代码仓库无 LICENSE 文件、Zenodo 各记录另有标注。示例场景:把 NLST2023.zip 重打包上传到第三方数据仓库——预处置包层没有授权再分发的明确许可。处理:按 §6.2 五层分别声明;衍生数据发布前的最小安全集=只用 TCIA 源层并附完整引用链。
坑 8:三个"NLST 榜"指标互不相同,勿混
grand-challenge 排行榜侧栏里"L̶2̶R̶’̶2̶2̶ ̶N̶L̶S̶T̶"(删除线=2022 版已弃用)与"NLST"(2023 版)并存:前者指标 TRE(LM)/SDlogJ/TRE(KP),后者 Dice/TRE(KP)/HD95/SDlogJ;而 2024 论文 Table 1 的 NLST 2023 结果表用 TRE/SDlogJ/Rank 三列。三个榜的队伍、指标、届别都不同。示例场景:把 2022 榜的 TRE-LM 数字与 2023 论文表的 TRE 直接对比,得出"方法退步"的错误结论。处理:引用任何 NLST 数字时注明"哪一届+哪个指标组+哪个来源"。
附录 A:核验时点与抓取存照
| 项目 | 时间/结果 |
|---|---|
| 本条目抓取与核验时点 | 2026-09-26(北京时间) |
| grand-challenge Datasets 页 | 成功抓取(HTML 51,854 B),确认 L2R-2023 两数据包与 license 引用 |
| grand-challenge 主页 | 成功抓取,展示 2026 届+组织者名单+出版物列表 |
| grand-challenge OncoReg 页 | 成功抓取,确认 spin-off 时间线与组织者五人 |
| Zenodo 7844799 | 成功抓取(WebFetch),确认 v1 2023-04-19、作者三机构、Task 1/3 创新描述 |
| TCIA 4D-Lung 收藏页 | 成功抓取(WebFetch),确认 20 患者/183.04 GB/CC BY 3.0 |
| arXiv 2509.01217(v3 全文 HTML) | 成功抓取(243,755 B),提取 NLST 2023 结果表与沿革段落 |
| arXiv 2503.23179(ar5iv 全文) | 成功抓取(152,928 B),提取 ThoraxCBCT Table 1/2 与 type 3 规格 |
| learn2reg.github.io | 直连与 Wayback 均失败(网络层阻断)——存照不引用 |
| grand-challenge L2R23 data release 论坛帖 | Forbidden(登录墙)——存照 |
| Uni Lübeck 云三下载直链 | HEAD 均 401——存照 |
| GitHub MDL-UzL/L2R 主页与 ranking 目录 | 成功抓取(WebFetch),确认排名规则与 L2R23 snapshot notebook |
| MONAI NLST tutorial(jsdelivr CDN 镜像) | 成功抓取(707,504 B),确认使用 NLST2023.zip+NLST_dataset.json |
| huggingface 主站/hf-mirror | 未使用(无官方 HF 镜像需求;无 Learn2Reg 官方 HF 数据集) |
核验覆盖度小结:官方侧(grand-challenge 三页+Zenodo)与学术侧(TMI/MELBA/OncoReg 三论文)全部直抓成功;数据上游(TCIA 两收藏)直抓成功;不可达项(老官网、论坛帖、Lübeck 云直链)均已定位并给出替代路径——核心数字无一条单源孤证。登录墙与 401 项不影响已发布事实,只影响"一手复算",已在坑 2/坑 5 处理。
附录 B:三源核验登记表(核心数字)
| # | 核心事实 | 源 1 | 源 2 | 源 3 | 结论 |
|---|---|---|---|---|---|
| 1 | 2023 届两任务=NLST 扩展+ThoraxCBCT | Zenodo 7844799(Task 1/3 创新) | Datasets 页(New L2R-2023 两包) | learn2reg-test 页(“two tasks: Extended NLST and ThoraxCBCT”) | 三源一致 |
| 2 | ThoraxCBCT 19 例/38 对(11/3/5) | arXiv 2503.23179 正文 | 同文 Table 1 | 4D-Lung TCIA 页(上游 20 患者自洽) | 一致 |
| 3 | 4D-Lung 上游 20 患者/183.04 GB/CC BY 3.0 | TCIA 收藏页 | Datasets 页引用(DOI+CC BY 3.0) | Hugo 2017 论文 DOI(10.1002/mp.12059) | 一致 |
| 4 | NLST 源 CC BY 4.0 | Datasets 页 | TCIA NLST DOI 记录 | NEJM 2011 引用链 | 一致 |
| 5 | NLST 2023 结果表(LapIRNv2 1.441mm/rank 0.800 等) | arXiv 2509.01217 §4.1.4 Table 1 | grand-challenge NLST leaderboard 指标组(TRE-LM/TRE-KP/SDlogJ) | 双专家 >100 landmarks 表述(同文) | 一致(表为官方口径) |
| 6 | ThoraxCBCT 2023 结果表(SynDeeds 0.705/ConvexAdam baseline 0.710) | arXiv 2503.23179 Table 2 | OncoReg 官方页(三方法 workshop 叙事) | ThoraxCBCT leaderboard 指标组(Dice/TRE(KP)/HD95/SDlogJ) | 一致 |
| 7 | test 窗口 2023-09-14 至 09-29 | learn2reg-test 页 | Zenodo 记录(两阶段设计) | OncoReg 论文 Validation/Test Phase 描述 | 一致 |
| 8 | 2020-2021 两届 20+ 队/65+ 方法 | TMI 论文摘要(PubMedID 36264729) | arXiv 2509.01217 §2.2 | Stanford Health Care 论文页 | 一致 |
| 9 | NLST 包 210 对(170/10/30)@224×192×224/1.5mm | MONAI tutorial(NLST2023.zip) | DEQReg 论文转述 | 数据目录站(selectdataset) | 三二手源一致(一手直链 401,存照) |
| 10 | 2026 届 PSMAReg 597/262、Learn2Breath 200/10/100 | grand-challenge 主页 | CodaBench 任务链接 | SNMMI 合作表述 | 一致 |
| 11 | OncoReg type 3 数据 25 患者/27 例/3-fold | OncoReg 官方页(kickoff 日期) | arXiv 2503.23179 Table 1 | grand-challenge OncoReg 页收官叙事 | 一致 |
| 12 | 排名规则(Wilcoxon p<0.05+几何平均+0.1 下限) | MDL-UzL/L2R ranking readme | 2024 论文(Antonelli et al. Medical Decathlon 引用) | 附录 D 伪代码与 ThoraxCBCT 实测位次互洽 | 一致 |
附录 C:任务包数据字典
NLST2023(NLST_dataset.json + NIfTI 对)
| 字段/文件 | 类型 | 语义 |
|---|---|---|
| training_paired_images[].fixed / .moving | NIfTI 路径 | 吸气相(fixed)/呼气相(moving)224×192×224@1.5mm |
| training_keypoints / validation_keypoints | JSON | 配对解剖关键点(双专家 >100/例,2023 扩展) |
| lung masks | NIfTI | 肺掩码(Dice 类评测/预筛用) |
| displacement field(提交物) | NIfTI/.nii.gz | 3D 位移场(mm),评测接口唯一输入 |
| test 集监督 | 隐藏 | landmark/结节/靶结构标注仅组织方持有(TRE/TREnodules 在线评测) |
ThoraxCBCT(打包 NIfTI)
| 字段 | 类型 | 语义 |
|---|---|---|
| image(FBCT/CBCT ×2) | NIfTI 390×280×300@1.0mm | 治疗前 FBCT(吸气)+ 疗程首尾 CBCT(呼气) |
| label mask | NIfTI | 半自动 13 结构(肺、肿瘤、OAR、骨结构;TotalSegmentator+配准传播+UKSH 验证) |
| landmarks | CSV/JSON | 手动解剖标志点(平均 16/对,全躯干) |
| Förstner keypoints | JSON | DeedsBCV 位移场导出的配对关键点(自监督用) |
| body trunc mask | NIfTI | 体干二值掩码(背景分离) |
| zero-deformation field | NIfTI | sanity check 用零位移场(L2R 仓库) |
标注质量的独立评估建议(使用者的尽调清单):
- 掩码层是"TotalSegmentator 自动+传播+UKSH 医生验证"的半自动产物——用前抽 5-10 例做目视 QA,重点看配准传播到 CBCT 的边界(膈顶、心脏缘);
- landmarks 为纯手动(平均 16/对),但未公开标注者间一致度——对 TRE 的解释要留"金标准本身有方差"的余量;
- keypoints 由 DeedsBCV 导出,属于"模型生成的伪真值"——用它训练的模型上限受 Deeds 精度约束,对比实验时建议同时保留 landmark 评测;
- 两个子任务(t0 对 vs end 对)的难度结构不同——分拆报告比合并平均更有信息量(OncoReg 论文即如此处理)。
附录 D:排名机制伪代码(L2R ranking 目录口径)
for metric in task.metrics:
for a, b in pairs(submissions):
p = wilcoxon_signed_rank(scores[a][metric], scores[b][metric])
if p < 0.05: wins[better(a,b)] += 1
metric_rank[m] = 0.1 + 0.9 * normalize(wins) # 0.1-1.0,并列共享
task_rank = geometric_mean(metric_rank.values()) # 任一指标崩盘即拖垮总分
未提交者: metric_rank = 0.1
baseline 方法: 计 rank 展示,不参与冠军评定
排名实例演算(以 ThoraxCBCT 2023 的 Fourier-Net 为例):TRE 4.03(第一)+ TRE30 3.85(第一)贡献两个高 rank,但 DSC 61.91(倒数)与 HD95 47.80(倒数)贡献两个低 rank,SDlogJ 0.07(次低)中等——几何平均后 0.535,被"每项都在前排"的 SynDeeds(0.705)反超。这就是"没有任何单一指标能抓住配准质量"的数学化表达。
附录 E:检索路径示范
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 2023 官方记录 | Learn2Reg Challenge 2023 Zenodo / DOI 10.5281/zenodo.7844799 | 记录页(含全文描述) |
| 2023 结果表 | Learn2Reg 2024 NLST results / arXiv 2509.01217 | MELBA/arXiv §4.1.4 |
| ThoraxCBCT 规格 | ThoraxCBCT OncoReg 4D-Lung / arXiv 2503.23179 | OncoReg 论文 Table 1/2 |
| 源数据 | TCIA NLST HMQ8-J677 / TCIA 4D-Lung ELN8YGLE | TCIA 收藏页 |
| 评测代码 | github MDL-UzL L2R ranking | 仓库(evaluation/ranking/zero fields) |
| 训练样板 | MONAI tutorial learn2reg NLST paired lung CT | 3d_registration notebook |
| 历史六任务 | Learn2Reg TMI 10.1109/TMI.2022.3213983 / Zenodo 3835682 | TMI 论文+合集 |
| 2026 届 | Learn2Reg 2026 PSMAReg Learn2Breath CodaBench | grand-challenge 主页 |
| 论文复用案例 | “Learn2Reg NLST” TRE TRE30 SDlogJ MICCAI 2025 | 新方法论文的 NLST 对标表 |
| OncoReg type 3 | OncoReg challenge UKSH type 3 / arXiv 2503.23179 | OncoReg 论文 §3-4 |
| MONAI 训练样板 | MONAI tutorial learn2reg NLST | jsdelivr/项目 MONAI tutorials |
| 排名规则原文 | MDL-UzL/L2R ranking readme | GitHub 仓库 |
检索卫生两条:一、凡引用 Learn2Reg 数字先问"哪一届+哪个任务+哪个来源"(坑 2/坑 8);二、grand-challenge 论坛帖与 test 站有登录墙,抓不到的内容以已公开的 Datasets/OncoReg 页与论文为准,勿以讹传讹。
附录 F:双口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | NLST 规模 | 210 对(170/10/30,挑战赛包/MONAI/DEQReg) | 147/21/42 对(SAMCL 3mm 重采样自述口径) | 按 A 引用并注口径 |
| 2 | ThoraxCBCT 规模 | 19 例/38 对(L2R 任务包) | 20 患者/183.04 GB(TCIA 4D-Lung 上游) | 分层各自引用 |
| 3 | ThoraxCBCT 第一名 | SynDeeds(官方冠军,rank 0.705) | ConvexAdam(rank 0.710,组织方 baseline 不参评) | 双写+身份注明 |
| 4 | “Learn2Reg 论文” | TMI 2023(42(3):697-712,覆盖 2020-2021) | MELBA 2025(含 2022-2023 总结) | 按届别引用 |
| 5 | 官网 | learn2reg.grand-challenge.org(现役) | learn2reg.github.io(老站,本次不可达) | 以 grand-challenge 为准 |
| 6 | 参赛规模 | 20+ 队/65+ 方法(2020-2021 两届合计,TMI 口径) | 各届单独数字(未系统披露) | 只引合计口径 |
| 7 | runtime 地位 | NLST 2023 计入排名叙述 | OncoReg type 3 明确不计分 | 注明届别口径 |
数字漂移说明:本条目所有排行与规模数字固定于 2026-09-26 抓取时点;Learn2Reg 排行榜为活系统,新提交会改变相对位次但不改变论文表格(表格数字永久可溯)。两类数字在条目内的呈现原则:论文表格数字(§4 主表)优先,平台实时榜仅在"持续开放"语境引用并注明日期。若未来官方发布 2023 届独立总结论文且数字与本条目不一致,按附录 K 触发更新流程,以新论文为准并在附录 F 追记漂移行。
附录 G:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | Zenodo DOI(挑战赛记录)+ TCIA DOI(源数据)+ 任务包平台 ID |
| F2 富元数据 | ✅ | Datasets 页逐包规格+TCIA DICOM 元数据+论文表格 |
| A1 可访问协议 | ⚠️ | 源数据公开直链;预处理包注册制(401 门槛);test 标注请求制 |
| A2 元数据可访问 | ✅ | 即便数据有门槛,规格与引用链始终开放 |
| I1 互操作格式 | ✅ | NIfTI+JSON+标准位移场接口;MONAI/nnU-Net 生态直连 |
| I2 词汇表引用 | ✅ | TRE/Dice/HD95/SDlogJ 均为社区标准指标并开源实现 |
| R1 来源溯源 | ✅ | 每个任务包到 TCIA DOI 的派生链完整 |
| R3 可复现流程 | ✅ | 评测代码+零场 sanity check+dummy 数据集+baseline 全开源 |
| AI-Ready 综合 | 4.0/5 | "评测即服务"标杆;扣分在注册制与统一 license 缺位 |
附录 H:术语中英对照(首现标注回查表)
| 中文 | 英文 | 备注 |
|---|---|---|
| 医学图像配准 | medical image registration | 本条目主题 |
| 形变配准 | deformable registration | 相对 rigid/affine |
| 靶注册误差 | target registration error, TRE | 配准核心指标 |
| 解剖标志点 | anatomical landmark | 手动标注的金标准 |
| 关键点 | keypoint | 自动检测点(Förstner 系) |
| 位移场 | displacement field | 提交物本体 |
| 雅可比行列式 | Jacobian determinant | 折叠检测 |
| 靶区/危及器官 | target / organ at risk, OAR | 放疗术语 |
| 扇束 CT / 锥束 CT | fan-beam CT / cone-beam CT, FBCT/CBCT | ThoraxCBCT 双模态 |
| 图像引导放疗 | image-guided radiation therapy, IGRT | 临床场景 |
| 自配置 | self-configuring | 超参自动选择路线 |
| 跨期/跨患者 | intra-/inter-patient | 患者域二分 |
| 吸气相/呼气相 | inspiratory / expiratory phase | 呼吸相位 |
| 低剂量 CT | low-dose CT, LDCT | NLST 筛查协议 |
| 排行榜 | leaderboard | 持续评测载体 |
附录 I:缩写速查
| 缩写 | 全称 |
|---|---|
| L2R | Learn2Reg(挑战赛简称) |
| TRE / TRE30 | Target Registration Error / 最差 30% landmark 的 TRE |
| TRE-KP / TRE-LM | keypoints / landmarks 口径的 TRE |
| TREnodules | 肺结节层面 TRE(2023 新增) |
| DSC / Dice | Dice Similarity Coefficient |
| HD95 | Hausdorff Distance 95th percentile |
| SDlogJ | 标准差 of log Jacobian determinant(形变折叠指标) |
| FBCT / CBCT | Fan-Beam CT / Cone-Beam CT |
| IGRT | Image-Guided Radiation Therapy(图像引导放疗) |
| OAR | Organ At Risk(危及器官) |
| NLST | National Lung Screening Trial |
| NSCLC | Non-Small Cell Lung Cancer |
| TCIA | The Cancer Imaging Archive |
| UKSH | Universitätsklinikum Schleswig-Holstein |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| Type 1/2/3 | 挑战赛提交分型:位移场 / Docker 算法 / 全隐藏 |
| FDK | Feldkamp-Davis-Kress(CBCT 重建算法) |
| MIND / LNCC / NGF | 配准常用相似度度量(模态稳健) |
| RTSTRUCT | DICOM 放疗结构集(靶区/OAR 轮廓) |
| DEQ | Deep Equilibrium Model(深度均衡模型) |
| CVH | Compressed Volumetric Haar(Deeds 块匹配特征) |
| FFD / B-spline | 自由形变形变模型(NiftyReg 系) |
| VDT | Volume Doubling Time(结节体积倍增时间,随访场景) |
| PSMA | Prostate-Specific Membrane Antigen(2026 PSMAReg 任务) |
| COPDGene | Genetic Epidemiology of COPD(2026 Learn2Breath 数据源) |
附录 J:届次-任务-结果速查总表
| 届次 | 任务 | 冠军/最佳 | 数字锚点 |
|---|---|---|---|
| 2020-2021 | 六任务(Lung CT/OASIS/CuRIOUS/Abdomen CT-CT/Abdomen MR-CT/Hippocampus) | ConvexAdam(跨任务总分第一) | 20+ 队/65+ 方法;速度迷思破除 |
| 2022 | NLST 首秀+历史任务 | —(Type 3 试验) | L̶2̶R̶’̶2̶2̶ 榜已弃用(删除线) |
| 2023 | NLST2023 | LapIRNv2(rank 0.800) | TRE 1.441 mm;initial 10.40 mm |
| 2023 | ThoraxCBCT | SynDeeds(rank 0.705) | DSC 70.16%;ConvexAdam baseline 0.710 |
| 2023 冬(OncoReg type 3) | UKSH 隐藏集 | DINO-Reg Ensemble | 25 患者私有;VoxelMorph++ 亚军 |
| 2024 | ReMIND2Reg/LUMIR/COMULISSHGBF | next-gen-nn 跨任务稳定 | VROC 拿下 COMULISglobe SHG/BF 第一 |
| 2025 | 持续评测 | — | LNCS proceedings 出版 |
| 2026 | PSMAReg/Learn2Breath(CodaBench) | 进行中 | 597/262 与 200/10/100 |
届次叙述补注:2024 届两支全勤队(VROC 与 next-gen-nn)展示了两种极端策略——VROC 全程优化式(任务特定预处理+Demons 力)与 next-gen-nn 全程学习式(三个任务全部前十、LUMIR 第二)——它们的分化被 2024 总结论文用作"跨任务泛化"命题的活体实验。2025 届 proceedings 落地 Springer LNCS(978-3-032-25169-5),意味着 Learn2Reg 与 MICCAI 的关系从"workshop 附属"升级为"正式出版分支"。2026 届换引擎(CodaBench)与学会联办(SNMMI)是组织层面的两次升级——前者为可编程赛制(CodaBench 支持自定义评测器),后者为临床数据供给开辟了学会背书的通道。
附录 K:本条目生产档案
- 生产通道:50 篇冲刺批量生产·批次 3,代理 agentB-l2r(slug=learn2reg;备选 SegRap2023 未启用——主选三轮核验通过无需改道)
- 开工三查:锁文件创建(agentB-l2r 1790460694);part 文件唯一化(/tmp/learn2reg_agentB-l2r_part1-5.md);环境留痕
ps aux | grep -c "[c]odebuddy"= 4 - 研究:WebSearch×5+WebFetch×6+curl 直抓(grand-challenge/TCIA/arXiv/ar5iv/MONAI tutorial CDN 镜像)共约 15 轮;learn2reg.github.io 直连与 Wayback 均不可达已存照
- FACTS.md:writing/learn2reg/FACTS.md 九节
- 成稿方式:五 part 直写拼接(part1-5),每 part 尾留空行
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- 互链计划:chaos/amos/pddca/fetreg/hecktor/hecktor2026/reg2026/autopet/autopet-v/totalsegmentator/verse-spine/abdomenct-1k/ctpelvic1k/ctspine1k/ct-rate/rider-lung-ct/lctsc/synthrad/nih-pancreas-ct 共 19 点(§9 表)
- 更新触发点:2026 届数据发布(PSMAReg/Learn2Breath 包下载可用时)→ §7.2 与附录 J 扩行;官方 2023 独立总结论文若现身 → 坑 2 解除
交接清单(下一位编辑者从这里接手):FACTS.md 九节为唯一事实底稿;本成稿五 part 源文件在 /tmp/learn2reg_agentB-l2r_part1-5.md(会话期有效,长期以拼接后的 writing/learn2reg/learn2reg_Wikipedia.md 为准);租约锁 writing/learn2reg/.lock 到此任务完成后可释放;遗留疑点仅附录 A 标注的三项(老站原文、Zenodo 3835682 license、各届精确提交队伍数),均不阻塞发布。
附录 L:Learn2Reg 2023 与同类 MICCAI 挑战赛的对照
把 2023 年前后活跃的 MICCAI 配准类挑战赛放在一起,方便按需选型:
| 挑战赛 | 部位/模态 | 形态特色 | 与 Learn2Reg 的关系 |
|---|---|---|---|
| Learn2Reg 2023(本条目) | 脑/腹/胸,CT/MR/US | 多任务平台+持续榜+统计排名 | 平台型母体 |
| OncoReg(2023-2024) | 肺,FBCT↔CBCT | Learn2Reg 的肿瘤学 spin-off,type 3 隐藏数据 | 子事件(同组织方) |
| Hecktor(2021-2026) | 头颈,PET-CT/CBCT | 聚焦放疗靶区,配准+分割复合 | 同"跨模态+放疗"配方(库内 rid 461/638) |
| AutoPET(2022-2024) | 全身 PET/CT | 淋巴瘤病灶,自配准 | 形变合理性矛盾的同题(库内 rid 468/634) |
| FetReg(2021) | 胎儿 MRI | 产科移动伪影 | MICCAI 配准挑战家族(库内 rid 343) |
| Reg2026(2026) | — | 配准方向后续挑战 | 届次演进链(库内 rid 639) |
| PDDCA/POPI(2010s) | 肺 4DCT | landmark 传统源头 | Learn2Reg 的"前史"(库内 rid 454) |
选型口诀:平台型需求(多任务、打榜、持续评测)→ Learn2Reg;专科纵深(头颈/核医学/产科)→ 对应专科挑战赛;历史对照(landmark 传统的根)→ PDDCA。
附录 M:数据复用合规问答(5 条)
- **我能否把 NLST2023.zip 镜像到国内网盘供实验室共享?**预处理包无明确再分发许可,稳妥做法是共享 grand-challenge 注册链接让同事自取;纯实验室内部使用风险低,公开发布不行。
- **我能否用 4D-Lung 原始 DICOM 训练商业产品?**源层 CC BY 3.0 允许商用(含署名),但 TCIA 数据使用政策另有附加条款(如不得声称背书)——商用前逐条核对 TCIA 政策页。
- **论文里贴 ThoraxCBCT 的测试集可视化结果可以吗?**test 监督标注不公开,但位移场可视化(自己方法的输出)无碍;引用官方指标数字需注明来自排行榜/论文。
- **我的挑战赛要不要也用 Wilcoxon 排名?**小样本任务(<30 例)强烈建议——平均分在小样本上极不稳定,Learn2Reg 的做法是把这些噪声显式建模进排名。
- **引用本条目时最短引用链是什么?**任务设计引 Zenodo 7844799 + 结果引 arXiv 2509.01217(NLST)/2503.23179(ThoraxCBCT)+ 数据引 TCIA DOI——三段式,缺一会被审稿人补刀。
- **我能在 Learn2Reg 数据上预训练再发到别处吗?**源层(TCIA,CC BY)可以;预处理包层没有授权再分发,重训产物(权重)发布一般无碍,但应说明训练数据来源与许可层级。
- **验证集能发论文吗?**能,验证集是公开的;但只报验证集成绩并暗示"达到挑战赛水平"会被质疑——test 成绩只能来自官方评测。
- **双专家 landmark 的分歧数据公开吗?**2023 扩展的标注细节由组织方持有;公开包只含合并后的监督信号——做标注不一致研究需联系组织方(learn2reg@gmail.com)。
- **排行榜上的历史成绩会被复算改变吗?**排名代码开源、快照可查(leaderboard history 功能),但新提交会改变相对位次——引用时给日期戳。
- **OncoReg 的 25 患者私有数据现在还能评测吗?**官方页明示"We offer a continuation of the evaluation beyond the completion of the challenge"——邮件申请即可,这是"评测即服务"长期化的直接例证。
附录 N:发布前最终自检记录
| 检查 | 结果 |
|---|---|
| check_md.py(行数/章节/坑点/DAIMS/G3 纯净度/围栏配对/category_tags 受控词表) | 见最终运行输出 |
| preflight_check.py(锚点唯一/标题重复) | 见最终运行输出 |
| frontmatter 长度 | title/subtitle/data_source.name ≤255 字符;description ≤170 字符(成稿时即按限编写) |
| title 后缀 | " — AI-Ready Wikipedia \ |
| URL 占位 | https://www.qianfanghub.com/ai-ready-dataset/learn2reg/685 ✅ |
| 坑点格式 | “坑 N:” 编号制 1-8 ✅ |
| DAIMS 表 | §6.3 ✅ |
| category_tags | 医学影像/CT/MRI/挑战赛数据集/评测基准/肺癌(VOCAB 内 6 词) ✅ |
| cover_image_prompt | 淡色封面插画+浅米白底+青绿淡紫暖橙淡金+结尾禁令句 ✅ |
| 临时文件唯一化 | /tmp/learn2reg_agentB-l2r_part1-5.md(无裸命名,无竞争写入) ✅ |
| 租约锁 | writing/learn2reg/.lock(agentB-l2r 1790460694,全程持有) ✅ |
| 环境留痕 | ps aux \ |
| 查重 | ai_ready_dataset 无 learn2reg 同名条目(record 查询空) ✅ |
| 备选改道 | SegRap2023 未启用(主选三轮核验通过,无需证伪改道) ✅ |
附录 J2:库内互链条目全表(19 点,供 link_builder 重建)
| record_id | url_name | 关联强度 | 关联语 |
|---|---|---|---|
| 337 | chaos | 强 | Abdomen MR-CT 任务数据源(CHAOS) |
| 76 | amos | 强 | 腹部跨模态配准延伸 |
| 454 | pddca | 强 | 肺 4D 配准前代基准 |
| 422 | totalsegmentator | 强 | ThoraxCBCT 掩码生成工具 |
| 639 | reg2026 | 强 | 配准挑战届次链 |
| 638 | hecktor2026 | 中 | 挑战赛家族 |
| 461 | hecktor | 中 | 头颈跨模态放疗配准 |
| 343 | fetreg | 中 | 产科配准挑战 |
| 468 | autopet | 中 | PET-CT 配准 |
| 634 | autopet-v | 中 | PET-CT 配准续届 |
| 402 | abdomenct-1k | 中 | 腹部配准训练池 |
| 465 | ctpelvic1k | 弱 | 盆腔骨性配准域 |
| 443 | ctspine1k | 弱 | 脊柱骨性配准域 |
| 435 | verse-spine | 弱 | 脊柱分割/配准域 |
| 546 | ct-rate | 弱 | 胸 CT 跨期随访 |
| 267 | rider-lung-ct | 弱 | TCIA 肺 CT |
| 277 | lctsc | 弱 | TCIA 肺放疗 CT |
| 671 | synthrad | 中 | 跨模态合成姊妹问题 |
| 367 | nih-pancreas-ct | 弱 | 腹部小结构补充 |
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-26,抓取与核验时点见附录 A。事实陈述以 grand-challenge 官方页(Datasets/OncoReg/主页)、Zenodo 记录(10.5281/zenodo.7844799)、IEEE TMI 论文(10.1109/TMI.2022.3213983)、MELBA 总结论文(10.59275/j.melba.2025-gc8c / arXiv 2509.01217)与 OncoReg 论文(arXiv 2503.23179)为源;双官网割裂、2023 无独立论文、规模多口径、baseline 与冠军之辨等原始文档陷阱已在坑点(§10)与附录 F 存照。条目与库内 chaos(rid 337)、amos(rid 76)、pddca(rid 454)、fetreg(rid 343)、hecktor(rid 461)、hecktor2026(rid 638)、reg2026(rid 639)、autopet(rid 468)、totalsegmentator(rid 422)等条目互链,构成医学图像配准挑战赛家族的完整检索面。Learn2Reg 系列仍在演进(2026 届已启动于 CodaBench),后续届次数据发布时按附录 K 触发更新。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- lnq — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 肺癌
- ulf-enc — 共享标签:医学影像 / MRI / 挑战赛数据集 / 评测基准
- osic-pulmonary-fibrosis — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- nsclc-radiogenomics — 共享标签:医学影像 / CT / 肺癌
- medpix — 共享标签:医学影像 / CT / MRI
- toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- curvas — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- toothfairy3 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- stsr — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
- nsclc-radiomics — 共享标签:医学影像 / CT / 肺癌
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

