Learn2Reg 2023(learn2reg)— AI-Ready Wikipedia

MICCAI 2023 医学图像配准挑战赛:NLST 胸部 CT 吸气-呼气跨期配准扩展(双专家 >100 landmark+肺结节 TRE)与新增 ThoraxCBCT 放疗 FBCT-CBCT 跨模态配准(TCIA 4D-Lung 19 例 38 对)双任务 Docker 制评测,SynDeeds 与 LapIRNv2 分获冠军

来源 NLST:TCIA NLST 胸部 CT(DOI 10.7937/TCIA.HMQ8-J677,CC BY 4.0)重采样 224×192×224@1.5mm;ThoraxCBCT:TCIA 4D-Lung(DOI 10.7937/K9/TCIA.2016.ELN8YGLE,CC BY 3.0)FBCT/CBCT 重打包 390×280×300@1.0mm+13 结构掩码+landmarks(16/对)+Förstner keypoints;评测代码 MDL-UzL/L2R发布时间: 2026-09-27最后更新: 2026-09-27 阅读 21
Learn2Reg 2023(learn2reg)— AI-Ready Wikipedia

信息速览

数据集名称Learn2Reg 2023(learn2reg)— AI-Ready Wikipedia
数据类型影像数据,人工标注,挑战赛数据
规模NLST2023 挑战赛包 210 对(170 train/10 val/30 test,源自 TCIA NLST 筛查人群);ThoraxCBCT 19 例(11/3/5,每例 2 配对=38 对,
接入方式NLST:TCIA NLST 胸部 CT(DOI 10.7937/TCIA.HMQ8-J677,CC BY 4.0)重采样 224×192×224@1.5mm;ThoraxCBCT:TCIA 4D-Lung(DOI 10.7937/K9/TCIA.2016.ELN8YGLE,CC BY 3.0)FBCT/CBCT 重打包 390×280×300@1.0mm+13 结构掩码+landmarks(16/对)+Förstner keypoints;评测代码 MDL-UzL/L2R
AI 就绪度

INFOBOX — Learn2Reg 2023 一屏速览

维度 内容
本质 MICCAI 2023 医学图像配准挑战赛——持续评测平台型基准(非单一数据集论文),配准领域的"ImageNet 式"基础设施
组织方 Uni Lübeck(Mattias Heinrich)+ UKSH(Malte Sieren)+ Radboudumc & Fraunhofer MEVIS(Alessa Hering)
官方记录 Zenodo 10.5281/zenodo.7844799(2023-04-19,挑战赛描述记录——注意不是论文)
2023 任务 Task 1:NLST2023 胸部 CT 吸气-呼气跨期配准(扩展两阶段);Task 2:ThoraxCBCT 放疗 FBCT↔CBCT 跨模态配准(新增)
NLST2023 210 对(170/10/30)@224×192×224/1.5mm;2023 扩展=双专家每例 >100 landmarks + 肺结节 TRE 入榜
ThoraxCBCT 19 例/38 对(11/3/5)@390×280×300/1.0mm,源 TCIA 4D-Lung(20 名 NSCLC 患者,183 GB,CC BY 3.0)
提交制 Type 2 Docker 为主(test 窗口 2023-09-14 至 09-29)+ phase 2 组织方代跑训练 Docker
排名 Medical Decathlon 式:逐指标 Wilcoxon p<0.05 → metric rank 0.1-1.0 → 任务 rank=几何平均
NLST 冠军 LapIRNv2(TRE 1.441 mm,rank 0.800;未配准基线 10.40 mm)
ThoraxCBCT 冠军 SynDeeds(rank 0.705,DSC 70.16%);ConvexAdam 为组织方 baseline(0.710,不参评)
指标家族 TRE / TRE30 / TRE(KP) / TREnodules / Dice / HD95 / SDlogJ / runtime
许可 源数据公开(CC BY 4.0 + CC BY 3.0);预处理包平台注册制;隐藏评测层请求制
生态位 2019 tutorial → 2020/2021 → 2022 → 2023 → 2024/2025 → 2026(PSMAReg + Learn2Breath);OncoReg spin-off
数字时点 全部排行与规模数字固定于 2026-09-26 抓取时点;排行榜为活系统

Learn2Reg 2023 是医学图像配准领域的年度基准挑战赛:它不是一个"采集-标注-发布"式的传统数据集,而是一套任务化的持续评测基础设施——把脑、腹、胸多个解剖部位、CT/MR/超声多模态、同患者/异患者、有/无监督的场景拆成并列任务,用统一的 Docker 提交通道、统一的统计检验排名与公开排行榜,把学习式与传统式配准算法放到同一把尺子上。2023 届的两件大事,一是把肺癌筛查 NLST 的吸气-呼气跨期配准任务升级为两阶段制(组织方代跑参赛者的训练 Docker 于隐藏大样本上),把"肺结节 TRE"这个临床指标正式搬进排名;二是新增 ThoraxCBCT 任务,首次把放疗科真实的 FBCT-CBCT 跨模态、跨呼吸相位、跨数月时间差配准难题端上基准台面。

从数据工程的角度看,2023 届还留下一个常被忽略的贡献:它示范了"上游收藏→任务包→隐藏评测层"的三层数据供给侧结构。上游(TCIA 的 NLST 与 4D-Lung)保持最大开放;中层(重采样、配对、预对齐、掩码、keypoints 的任务包)承担"消除工程方差"的职责;顶层(隐藏测试与统计排名)承担"排名公信力"的职责——三层各司其职,开放与严谨不再互相牺牲。这个结构对本库其他"数据集 vs 基准"类条目(评测基准向的 VOCAB 标签家族)具有直接的借鉴意义。

导语读法三则:

  1. 只想下数据跑基线:直奔 §6 获取与许可——源数据 TCIA 公开直链,挑战赛预处理包平台注册制,隐藏测试标注请求制,三层别混。
  2. 关心"谁最强":直奔 §4 结果与排行——注意 ConvexAdam 是 baseline 不参评、SynDeeds 才是 ThoraxCBCT 官方冠军(坑 6),NLST 2023 结果出自 2024 总结论文(坑 2)。
  3. 设计自己的挑战赛:直奔 §3 评测体系——两阶段设计、Wilcoxon 显著性排名、多指标几何平均,是可整体复用的赛制模板。

行文约定四条(全文生效):术语首现标注英文原文(如"靶注册误差(Target Registration Error, TRE)");所有排行与规模数字可溯源至 FACTS/附录 B 的三源登记;"例/对/患者"三种计数单位严格区分;届别与任务名永远与数字同行出现。

§0 导读:这个基准解决什么问题

医学图像配准(image registration)是把两幅图像——不同时相、不同模态、不同患者——几何对齐的基础操作:肺结节随访要看两次 CT 之间病灶长了没有,放疗计划要把 CT 上的靶区映射到当天的 CBCT 上,脑研究要把所有人的 MRI 拉进同一坐标系。它是"做得好不好全看下游用着顺不顺"的典型:同一个算法在论文里 Dice 0.9,换到医院真实 CBCT 上可能完全失效。

在 Learn2Reg 出现之前,这个领域恰恰缺"同一把尺子"。各论文各用各的数据、各报各的指标,学习式方法在 OASIS 脑数据上训练、从没见过带伪影的术中 CBCT;传统优化方法被默认贴上"慢"的标签;一个方法的超参数是为它自己的测试集调的。Learn2Reg 用四件事对准这些痛点:多任务并列(强制方法在解剖、模态、监督条件迥异的任务间证明自己)、Docker 制提交(组织方统一环境复现,防"评测漂移")、隐藏测试(test 标签不发放,只交位移场或算法)、统计化排名(逐指标 Wilcoxon 显著性检验后计 rank,拒绝单指标定胜负)。

2023 届是这条路线的定型点。Zenodo 官方记录里写明了两大动机:其一,泛化不足——挑战赛数据永远不可能穷举临床场景,所以推动"自配置(self-configuring)"算法,让超参数选择成为流水线的自动环节;其二,指标的临床相关性不足——肺部的解剖 landmark 只是肿瘤相关结构的代理,所以 2023 把"治疗相关靶结构"与"肺结节 TRE"直接纳入评测。这两点决定了 2023 届的两个任务形态:NLST2023 的两阶段制与 ThoraxCBCT 的新增。

0.1 "基准"与"数据集"的辨析:为什么这个条目长成这样

对习惯了"下载数据集→跑模型→报指标"的读者,Learn2Reg 的形态需要一次对齐:

维度 传统数据集(如库内多数条目) Learn2Reg 2023
核心资产 一批图像+标注 任务包+评测代码+排行榜+赛制
获取 下载即用 分层:源数据公开/包注册制/隐藏请求制
规模语义 例数即规模 每任务各自规模,且含隐藏层不可知部分
复现含义 在同一份数据上复跑 在同一接口(位移场/Docker)上复跑
时效 静态快照 持续开放(2019-2026 运营中)
引用对象 数据论文 Zenodo 记录+多篇论文+平台页(坑 2 的根源)

这解释了本条目的三个写法选择:规模数字必须带任务名与口径(§2);结果必须带届别与来源(§4);获取必须分三层说(§6)。

对库内条目读者的三点直接含义:其一,引用本条目数据时,"record 指向的是挑战赛"而非某一组文件——下载入口、许可、规模都要按任务与层查(§6.1 表是唯一权威分流器);其二,本条目的结果数字是"排行榜快照"性质,随届次与提交动态演化,条目内所有排行数字均固定于 2026-09-26 抓取时点;其三,若你在为另一个数据集设计评测,本条目 §3 的赛制与 §10 的坑位清单可以整体作为设计评审单。

0.2 三分钟版本

  • 是什么:MICCAI 2023 的医学图像配准挑战赛,双任务(NLST2023 跨期肺 CT 配准 + ThoraxCBCT 跨模态放疗配准)+ 历届任务持续开放。
  • 给谁用:做配准算法的(打榜)、做放疗/肺结节临床 AI 的(选型)、研究评测方法学的(借鉴赛制)。
  • 规模:NLST2023 210 对 + ThoraxCBCT 38 对 + 历史包近千例;监督标注三件套(landmarks/掩码/keypoints)。
  • 最强者:NLST 上 LapIRNv2(TRE 1.441 mm)、ThoraxCBCT 上 SynDeeds(官方冠军,ConvexAdam baseline 更高但不参评)。
  • 许可:源数据 CC BY(4.0/3.0)公开;包与隐藏层有门槛。
  • 最大坑:双官网+三份"NLST 榜"+TMI 论文年份错配——引用前先对届别(§10)。

0.3 关键人物与机构速记

人物/机构 角色 在 2023 届的足迹
Mattias Heinrich(Uni Lübeck) 创始组织者、系列灵魂人物 Zenodo 记录一作;DeedsBCV/SynDeeds/ConvexAdam 系方法的源头;MDL-UzL 组织
Alessa Hering(Radboudumc & Fraunhofer MEVIS) 联合组织者 Zenodo 记录合作者;肺配准(多解剖约束 CNN)路线代表;后延续至 2026 届组织名单
Malte Sieren(UKSH) 临床侧组织者 Zenodo 记录合作者;OncoReg 邀请讲者——临床放疗视角的接口
Christoph Großbröhmer(Uni Lübeck) 平台与评测工程 Zenodo 记录合作者;ConvexAdam 合作者
Junyu Chen(JHU) 新一代领衔者 2024 LUMIR 任务负责人;2026 届主席;NLST 基准的当代维护者
Uni Lübeck / UKSH / Radboudumc 三机构组合 数据打包、临床标注(UKSH 放疗科)、方法与平台(Radboudumc+Fraunhofer MEVIS)

机构背景的一个注脚:Lübeck 组(MDL-UzL)同时是 Deeds、PDD-Net、ConvexAdam、SynDeeds 一整条方法线的作者——"组织方=最强 baseline 的作者"是这个基准的特色,也正因为如此才有了"baseline 不参评"的规则设计(坑 6 的制度根源)。同一批人既造尺子又做选手,公信力靠两件事兜底:评测代码全开源(谁都能复算排名)+ baseline 强制标记(谁都不许冒充冠军)。

§0 读法三则:

  1. 条目主角是"挑战赛+数据包+评测体系"三位一体:数据规模要看任务包口径(§2),排行数字要看来源届别(坑 2、坑 8),获取方式要看三层许可(§6)。
  2. 本条目所有排行数字均可溯源:NLST 2023 表出自 MELBA/arXiv 总结论文(arXiv 2509.01217 §4.1.4 Table 1),ThoraxCBCT 2023 表出自 OncoReg 论文(arXiv 2503.23179 Table 2),源 URL 均已落在 FACTS 与正文。
  3. 检索时若把 learn2reg.github.io 当主站,会拿到 2020-2022 的旧信息——2023 起官方主站是 learn2reg.grand-challenge.org(坑 1)。

§1 数据集速览:十问十答

Q1:Learn2Reg 2023 到底是"一个数据集"还是"一场比赛"?
两者都是,但核心是"带数据包的持续评测平台"。2023 届发布了两个任务数据包(NLST2023 与 ThoraxCBCT),并把历届数据(Lung CT、OASIS、CuRIOUS、AbdomenCT-CT、Abdomen MR-CT、Hippocampus)留在 learn2reg-test 平台持续开放——你可以今天提交算法、明天拿排名。对检索者,这意味着"Learn2Reg 数据集"永远要追问到任务级;对复用者,这意味着 2023 届的数字并不会随挑战赛结束而冻结——排行榜是活的。

Q2:NLST2023 包里有什么?
210 对同患者吸气-呼气胸部 CT(170 train / 10 val / 30 test),统一重采样到 224×192×224、1.5 mm 各向同性。2023 扩展的关键在标注:每例由两位医学专家独立标注超过 100 个解剖 landmark,并加入治疗相关靶结构与肺结节标注(后者产生 TREnodules 指标)。包内还附肺掩码与仿射预对齐——组织方的立场很明确:把工程杂活从参赛者手里拿走,让比赛聚焦配准本身。

Q3:NLST 的原始数据从哪来?
美国国家肺癌筛查试验(NLST)——NEJM 2011 那篇证实低剂量 CT 筛查降低肺癌死亡率的里程碑研究(DOI 10.1056/nejmoa1102873)的影像遗产,经 TCIA 发布(DOI 10.7937/TCIA.HMQ8-J677),CC BY 4.0。这个出身决定了数据的临床气质:受试者是高危吸烟人群、扫描是低剂量协议、随访间隔以月计——正是"筛查-随访"闭环里配准最该工作的场景。

Q4:ThoraxCBCT 又是什么?
放疗科的"日常 vs 教科书"差距:治疗前患者要做高质量扇束 CT(FBCT)做计划,治疗中每天用低剂量锥束 CT(CBCT)摆位——两者模态不同、呼吸相位相反、还可能隔着几个月。任务是从 TCIA 4D-Lung 的 20 名局部晚期 NSCLC 患者里取 19 例,每例 1 张 FBCT(最大吸气相)+2 张 CBCT(最大呼气相,疗程首尾),构成 38 对。第一个配对考验"近期跨模态",第二个配对考验"跨模态+跨数月"——后者是真实放疗自适应流程里最疼的一刀。

Q5:ThoraxCBCT 的标注质量如何?
半自动加人工验证:分割掩码 13 个结构(TotalSegmentator 生成、经配准传播到 CBCT、UKSH 临床医生验证);landmark 全部手动勾画、平均每对 16 个、覆盖整个躯干而不只是肺;另有体干二值掩码与 DeedsBCV 导出的配对 Förstner keypoints 供自监督训练。注意这里的"半自动金标准"属性——掩码不是纯手工(坑点见附录 C),做标注质量研究时要点明。

Q6:怎么提交、怎么排名?
验证阶段每天可多次上传位移场或 Docker,实时上榜;测试阶段(2023-09-14 至 09-29)要么上传位移场(Type 1)要么交 Docker(Type 2)。排名按 Medical Decathlon 赛制:每个指标做两两 Wilcoxon 显著性检验(p<0.05),按"胜场"映射到 0.1-1.0 的 metric rank,任务总 rank 是各指标 rank 的几何平均。几何平均的选择是刻意的:一项指标崩盘就拖垮总分,"偏科冠军"在 Learn2Reg 体系里活不长。

Q7:2023 年谁赢了?
NLST 2023 冠军 LapIRNv2(TRE 1.441 mm,rank 0.800),组织方 corrfield baseline 以 1.638 mm 跟随;ThoraxCBCT 官方冠军 SynDeeds(rank 0.705,DSC 70.16%),但注意 ConvexAdam 作为组织方 baseline rank 0.710 更高却不参评——"赢"的定义在这里有讲究(坑 6)。两场胜利恰好代表两条路线:LapIRNv2 是纯学习式级联网络的胜利,SynDeeds 是"学习式修图+传统配准"混合路线的胜利。

Q8:数据能直接下载吗?
分三层:TCIA 源数据(NLST CC BY 4.0、4D-Lung CC BY 3.0)公开直链;挑战赛预处理包(NLST2023.zip 等)经 grand-challenge 平台注册后从 Uni Lübeck 云发放(未登录直探返回 401);test 标注与隐藏数据 upon request 或只提供在线评测。MONAI 官方 tutorial 直接以 NLST2023.zip 为教学素材——这是"包可直接用于教学与原型"的最好背书。

Q9:为什么它对 AI-Ready 重要?
它是"评测即服务"范式的样本:数据公开、评测代码开源(GitHub MDL-UzL/L2R)、排名可统计复核,但隐藏层标注刻意不发放——这是防数据泄漏的设计选择,代价是本地完整复现受限。条目 §6 按 DAIMS 五维给出评级。对库内其他条目,它还是"源数据-预处理包-评测层"三层异构许可的极端案例:同一任务数据可以同时是 CC BY 公开与请求制封闭。

Q10:它和库内其他条目什么关系?
腹部跨模态对应库内 chaos(CT-MRI 腹部数据,Abdomen MR-CT 任务的原料之一)、amos;肺配准的前辈是 pddca(DIRLab 4DCT);头颈跨模态配准有 hecktor 系列;配准挑战家族还有 fetreg、reg2026;ThoraxCBCT 的掩码生成用了 totalsegmentator。详见 §9 互链网络。一句话:本条目是"配准家族"的枢纽——按解剖(腹/胸/脑/头颈)、按模态(CT/MR/PET/超声)、按工具(TotalSegmentator/nnU-Net)三个方向都能从它出发继续检索。

1.1 一图流:2023 届全景

MICCAI 2023 · Learn2Reg
├── Task 1  NLST2023 (extended)
│   ├── 数据:TCIA NLST → 210 对 (170/10/30) @224×192×224, 1.5mm
│   ├── 监督:双专家 >100 landmarks/例 + 肺结节 + 靶结构(隐藏层)
│   ├── 赛制:phase 1 公开榜 → phase 2 组织方代跑训练 Docker(隐藏大样本)
│   ├── 指标:TRE-LM / TRE-KP / SDlogJ / TRE30 / TREnodules / runtime
│   └── 冠军:LapIRNv2 (TRE 1.441mm, rank 0.800)
└── Task 2  ThoraxCBCT (new)
    ├── 数据:TCIA 4D-Lung → 19 例 / 38 对 (11/3/5) @390×280×300, 1.0mm
    ├── 监督:13 结构半自动掩码 + 手动 landmarks (~16/对) + Förstner keypoints
    ├── 赛制:Type 1 位移场 或 Type 2 Docker;OncoReg spin-off 接 type 3
    ├── 指标:Dice / TRE-KP / HD95 / SDlogJ / runtime
    └── 冠军:SynDeeds (rank 0.705);ConvexAdam baseline 0.710 不参评
持续开放:Lung CT / OASIS / CuRIOUS / AbdomenCT-CT / AbdomenMRCT / Hippocampus(learn2reg-test)

1.2 规模全景:从任务包到上游收藏的完整账本

以"一份数据到底有多少"为线索,把 2023 届相关的所有数字放在一张账本里(每行注明口径,防止跨层误引):

数据层 计数口径 数字 上游/下游关系
TCIA NLST 收藏(上游) 受试者/影像系列 数万受试者级筛查队列(NEJM 2011 试验人群) NLST2023 包的源
NLST2023 挑战赛包(下游) 配对 210 对(170/10/30) 仿射预对齐+1.5mm 重采样
NLST2023 隐藏扩展层 未披露 组织方持有(含靶结构/结节标注) phase 2 代跑训练用
TCIA 4D-Lung 收藏(上游) 患者/体量 20 患者、183.04 GB、347,330 幅 ThoraxCBCT 包的源
ThoraxCBCT 任务包(下游) 例/配对 19 例、38 对(11/3/5) 1mm 重采样+掩码+keypoints
OncoReg type 3 私有集 例 27 例(25 患者,15/3/9 三折) UKSH 常规放疗数据,不发放
pre-2022 历史包合计 例 近千例(OASIS 455+Hippocampus 394+其他) learn2reg-test 持续开放
2020-2021 两届提交 方法/队 65+ 方法、20+ 队 评测规模(非数据规模)

这张账本的读法:纵向看层(上游收藏永远大于等于下游任务包),横向看任务(不同任务的"例"语义不同——NLST 的"例"是配对,ThoraxCBCT 的"例"是患者研究)。凡在摘要、数据卡或数据库字段里填规模数字,先对照本表选行。

1.3 常见检索词与命中面对照

你会搜的词 会命中什么 别混淆什么
Learn2Reg 2023 本条目:双任务挑战赛届次 Learn2Reg tutorial(2019)、Learn2Reg 2024/2026
NLST registration NLST2023 任务(本条目) NLST 原始筛查试验本身(NEJM 2011)
ThoraxCBCT 本条目 Task 2 + OncoReg 论文 4D-Lung 收藏(上游,规模更大)
Learn2Reg OASIS 历史任务包(脑异患者) OASIS 原始队列(Washington University)
Learn2Reg Abdomen AbdomenCT-CT/Abdomen MR-CT 包 库内 chaos/amos(原料与延伸)
L2R docker Type 2 提交规范 MDL-UzL/L2R 仓库名
learn2reg grand-challenge 现役主站 learn2reg.github.io(老站,坑 1)
OncoReg ThoraxCBCT 的 spin-off(type 3) 学习式方法 DINO-Reg(其冠军)

这张表的用法:先把你的检索词定位到"届-任务-层"三要素之一,再进对应章节——本条目 §2 管层(数据)、§4 管届(结果)、§7 管谱系(届次)。

§2 数据构成与规格

2.1 总览:2023 届的两个任务包与历史任务矩阵

任务 届别 模态 患者域 训练/验证/测试 指标组合 源数据 license
NLST2023(extended) 2022 起设、2023 扩展 CT↔CT 同患者(吸气-呼气跨期) 170/10/30 对 TRE(LM)/TRE(KP)/SDlogJ+TRE30+TREnodules CC BY 4.0(TCIA NLST)
ThoraxCBCT(new) 2023 新增 FBCT↔CBCT 同患者(跨模态+跨时相) 11/3/5 例(22/6/10 对) Dice/TRE(KP)/HD95/SDlogJ+runtime CC BY 3.0(TCIA 4D-Lung)
Lung CT(LungC) 2020-2021 CT↔CT 同患者 20/—/10 例 TRE(landmark)/Dice Zenodo 合集
OASIS 2020-2021 MR T1w↔MR T1w 异患者 416/—/39 例 Dice(35 labels)/SDlogJ Zenodo 合集
CuRIOUS 2020-2021 MR T1w/FLAIR↔US 同患者(术中) 22/—/10 例 TRE(9-18 landmarks) Zenodo 合集
Abdomen CT-CT 2020-2021 CT↔CT 异患者 30/—/20 例 Dice(13 labels) Zenodo 合集
Abdomen MR-CT 2020-2021 MR T1w↔CT 同患者 8/—/8 对(+90 unpaired) Dice(4-9 labels) TCIA/BCV/CHAOS 混合
Hippocampus MR 2020-2021 MR T1w↔MR T1w 异患者 263/—/131 例 Dice(2 labels) VUMC/Decathlon 派生

这张矩阵本身就是 Learn2Reg 的方法论宣言:配准的难点不是单一的——小样本(Abdomen 仅 30 训练例)、大形变(肺吸气-呼气)、多模态(MR-CT、MR-US)、部分视野(CuRIOUS 术中超声)、小结构(海马)、噪声标注(腹部手工标签)被刻意拆散到不同任务,让"在 A 任务第一名"的算法去 B 任务现形。TMI 论文把这八类挑战(多模态、少/噪声标注、部分视野、小数据集、大形变、小结构、无监督、缺失对应)做成了方法-任务矩阵——每支参赛队被逐格标注"用了什么、没做什么",这是配准方法学第一次被完整地图谱化。

八类挑战逐类说明(对应任务与典型失效方式):

挑战 代表任务 典型失效方式
多模态扫描 Abdomen MR-CT、CuRIOUS 强度相似度在跨模态下失效,算法"对齐了伪影"
少/噪声标注 Abdomen 系 过拟合薄标签,评测结构外的形变失控
部分视野 CuRIOUS 术中 US 视野外结构被强行"对齐"到错误位置
小数据集 Abdomen CT-CT(30 训练) 深度网络欠拟合或记忆化
大形变 Lung CT/NLST 单尺度网络捕获范围不足,直接落到局部极小
小结构 Hippocampus 体素级损失被大背景淹没,微小结构对齐被牺牲
无监督注册 各包 unpaired 部分 无金标准时形变合理性(折叠)失控
缺失对应 术前后对比(对 2 型) 解剖本身变化,强行一一对应反而制造错误

这八行表是读 §4 榜单的"解码器":每个方法在某任务上的名次变化,几乎都能在其中两三行的失效方式里找到解释。

2.2 NLST2023:从筛查试验到配准基准

2.2.1 NLST 是什么:一次临床试验的影像遗产

NLST(National Lung Screening Trial,国家肺癌筛查试验)是美国 ACRIN 与 Lung Screening Study 联合的随机对照试验:5 万余名 55-74 岁高危(重度吸烟史)受试者随机分入低剂量螺旋 CT 组与胸片组,NEJM 2011 论文(Aberle et al., DOI 10.1056/nejmoa1102873)报告低剂量 CT 使肺癌死亡率相对降低 20%。试验停止后,其系列影像(同一患者多次低剂量 CT、间隔数月到数年)经 TCIA 开放(DOI 10.7937/TCIA.HMQ8-J677)。

对配准研究,这批数据有三个天然优点:

  1. 同患者多时相:筛查随访协议天然提供"基线-复查"对,正是 intra-patient 配准的定义场景;
  2. 临床真实性:低剂量协议的噪声、高危人群的肺气肿/结节/术后改变——真实世界的困难样本,而非健康志愿者;
  3. 明确的临床终点:配准好坏直接关联"结节长没长、长多快"的判读——这是 TREnodules 指标合法性的来源。

一个常被忽视的背景:NLST 影像进入配准领域经过了"筛查试验→TCIA 开放→挑战赛任务化"三层转手,每层都有自己的引用要求(试验论文、收藏 DOI、任务记录)。这也是本条目坚持"三段式引用链"的原因——任何一层缺引,都会让下游研究的数据溯源在审稿中断裂。

2.2.2 挑战赛预处理包规格
项目 规格
配对 210 对(170 train / 10 val / 30 test),固定-移动对=同患者吸气-呼气
图像尺寸 224×192×224
体素间距 1.5×1.5×1.5 mm(各向同性重采样)
预对齐 仿射预对齐
附加数据 肺掩码;2023 扩展另发预测语义标签(phase 2 隐藏集含靶结构与结节标注)
分发 NLST2023.zip(Uni Lübeck 云,平台注册制)+ NLST_dataset.json 配对清单
下游标准引用 MONAI 官方 tutorial(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb)以 NLST2023.zip 为默认素材

2023 扩展评测的三处关键升级:

  1. 双专家独立 landmark:每例超过 100 个解剖标志点由两名医学专家各自独立标注——提供了可以量化标注者间离散度的金标准,也使 TRE 的统计检验更扎实。专家独立标注(而非共识标注)还保留了一个隐藏福利:研究者可以用它研究 landmark 标注本身的不确定性。
  2. 治疗相关靶结构:把放疗语境下真正要跟踪的结构纳入评测,回应"landmark 只是代理"的批评(Zenodo 记录原文:lung landmarks are only a proxy for relevant tumour lesions)。
  3. TREnodules 入榜:肺结节层面的靶注册误差直接进入排名,Top-4 方法在结节上的误差(1.135-1.434 mm)约为 MONAI/UCLA 基线的一半——筛查-随访闭环里最被临床关心的数字首次有了榜单位次。
2.2.3 规模口径的精确说明

规模口径提示:210 对(170/10/30)是挑战赛包的官方口径,与 MONAI tutorial、DEQReg 等多个独立来源一致;个别文献(如 SAMCL,arXiv 2406.17575)报告 294/42/84 幅图像(即 147/21/42 对)系其自述的 3 mm 重采样口径。两个口径的比例都是 7:1:2,差异只在配对计数方式与预处理。任何引用必须注明口径,详见坑 4。2023 扩展在公开包之外还有组织方持有的隐藏扩展集(含非公开标注),其规模不随包披露——这也意味着"NLST2023 总量"没有单一权威数字,公开可及部分以上述 210 对为准。

2.2.4 预处理流水线:从 DICOM 到任务对

组织方把"脏活"标准化成了一条可描述的流水线,理解它有助于判断你自己的数据适不适合用同一套基准:

步骤 操作 设计动机
1 配对抽取 从 NLST 系列中取同患者吸气-呼气两次扫描 intra-patient 跨期场景
2 重采样 各向同性 1.5 mm、统一 224×192×224 消除分辨率异质性,统一显存负担
3 仿射预对齐 提供初始对齐 把"大平移"从难度里剥离,聚焦形变本身
4 掩码生成 肺掩码随包发放 训练正则与快速评测双用途
5 标注(2023 扩展) 双专家 >100 landmarks/例+结节/靶结构(隐藏层) 统计检验级金标准+临床指标
6 打包分发 NLST2023.zip + NLST_dataset.json 配对清单 平台注册制+MONAI 生态直连

同样的流水线逻辑在 ThoraxCBCT 上再跑一遍(重采样 1.0 mm、人工预对齐大平移、掩码+keypoints 三件套)——两条流水线合起来构成了"配准任务包"的可复制模板,这也是 L2R 数据被后续届次与新任务(PSMAReg/Learn2Breath)沿用的原因。

2.3 ThoraxCBCT:把放疗室搬进基准

2.3.1 临床问题:IGRT 的三重错位

图像引导放疗(IGRT)的日常是这样运转的:患者先做一次高质量 CT(放疗计划 CT)勾画靶区与危及器官;治疗开始后每次摆位用治疗床自带的 CBCT 快速扫描、与计划 CT 配准后校正位置;疗程持续数周,肿瘤可能缩小、肺可能塌陷、患者可能消瘦。于是配准算法面对的是三重错位同时发生:

错位维度 具体表现 对算法的考验
模态错位 FBCT(诊断级剂量、软组织清晰)vs CBCT(低剂量、散射伪影、杯状伪影) 相似度度量要跨模态稳健(MIND/LNCC 类),伪影不伪装成解剖
呼吸错位 FBCT 采于最大吸气、CBCT 采于最大呼气 大形变(膈肌位移可达数厘米)、肺体积剧变
时间错位 对 2 中 FBCT 与 CBCT 相隔通常数月 解剖本身变化:肿瘤消长、胸水、肺不张
2.3.2 数据链路:从 TCIA 收藏到任务包

上游:TCIA 4D-Lung 收藏——“Data from 4D Lung Imaging of NSCLC Patients (Version 2)”(DOI 10.7937/K9/TCIA.2016.ELN8YGLE):

项目 内容
人群 20 名局部晚期 NSCLC 患者(放化疗期间,总剂量 64.8-70 Gy,每日 1.8/2 Gy 分割)
4D-FBCT Philips Brilliance Big Bore 16 排螺旋 CT,10 呼吸相位分箱(0-90%),3 mm 层厚;模拟期全员采集,14/20 名患者疗程中每周加采
4D-CBCT Varian On-Board Imager,约 2500 投影/8-10 分钟,125 kVp/20 mA/20 ms 半扇弓,10 相位 FDK 重建(in-house)
呼吸管理 全部采集配视听生物反馈(audio-visual biofeedback)
其他标注 单名放射肿瘤医生在全部 4D-FBCT 与部分 CBCT 的所有 10 相位勾画靶区与 OAR(RTSTRUCT);7 名患者瘤内/瘤周金标 fiducial
体量 183.04 GB / 589 studies / 6,690 series / 347,330 images
描述论文 Hugo et al. 2017, Medical Physics 44(2):762-771, DOI 10.1002/mp.12059;Balik et al. 2013(PMCID PMC3647023)

下游:Learn2Reg 任务化打包(OncoReg 论文 Table 1/正文口径):

项目 ThoraxCBCT 规格
例数 19 例(11 train / 3 val / 5 test),每例 2 配对 → 38 对
每例构成 1×FBCT(治疗前,最大吸气相)+ 2×CBCT(疗程首、尾,最大呼气相)
两个子任务 对 1:FBCT-CBCT_t0(时间相近);对 2:FBCT-CBCT_end(通常相隔数月)
图像尺寸 390×280×300
体素间距 1.0×1.0×1.0 mm(各向同性)
预对齐 大平移人工校正(manual pre-alignment)
分割掩码 半自动 13 结构(肺、肿瘤、心脏/脊髓/食管/气管/主动脉等 OAR、椎骨/肋骨/锁骨/肩胛骨等骨结构)——FBCT 缺失掩码由 TotalSegmentator 生成、经配准传播至 CBCT、UKSH 临床医生验证
Landmarks 全手动,平均每对 16 个,覆盖全躯干(不限于肺):气道分叉、主动脉弓顶、心尖与骨性结构关键点等
Keypoints 配对 Förstner keypoints(基于 DeedsBCV 位移场导出)——供 keypoint 自监督训练
体干掩码 每幅图像附二值 body-trunc mask(TotalSegmentator 生成)

这个任务的三重难点组合在配准基准里是首见:跨模态(FBCT 与 CBCT 的剂量、伪影、软组织对比度差异)、跨呼吸相位(吸气相固定 vs 呼气相移动,大形变)、跨时间(对 2 相隔数月,解剖本身可能变化)。它把"配准评测"从计算机视觉式的人造场景推向了放疗科室的真实工作流。与既往 L2R 任务"聚焦肺内"不同,ThoraxCBCT 的 keypoint 采样横跨整个躯干——评测覆盖面也随之"出肺"。

2.3.4 两种 CT 的物理差异(为什么跨模态难)
参数 4D-FBCT(计划 CT) 4D-CBCT(摆位 CBCT)
设备 Philips Brilliance Big Bore 16 排螺旋 Varian On-Board Imager(加速床载)
用途 放疗计划勾画 每次摆位验证
采集 螺旋扫描,10 呼吸相位分箱 约 2500 投影/8-10 分钟慢弧,10 相位 FDK 重建
剂量/管参数 诊断级 125 kVp/20 mA/20 ms(低剂量)
典型伪影 少 散射伪影、杯状伪影、金属(金标)伪影
软组织对比 高 低(肿瘤边界常模糊)

对配准算法,这张表翻译过来就是:基于强度相似度的方法要扛伪影(MIND/LNCC 类对比度不变度量因此吃香);基于学习特征的方法要扛域差(FBCT 训练的特征到 CBCT 上会漂移)——SynDeeds 干脆先合成再配准,ConvexAdam 则用 nnU-Net 特征跨模态桥接。两条路线在 §4.2 的榜单上正面相遇,并非偶然。

还有一层容易被忽略的物理:CBCT 的 10 呼吸相位由约 2500 个投影分箱重建而来——每个相位只分到约 250 个投影,图像噪声与伪影天然比全剂量 FBCT 严重。这意味着 ThoraxCBCT 的"跨模态"不只是设备差异,还是"信息量差异":moving 图像(CBCT)本身携带的解剖证据就比 fixed 少。跨模态配准的文献常把这类问题称为"quality asymmetry"(质量不对称)——它是 §4.2 榜单上覆盖类指标(Dice/HD95)整体低于单模态任务的物理学根源。

由此还能推出一条使用建议:在 ThoraxCBCT 上,“先修图再配准”(SynDeeds)与"特征桥接"(ConvexAdam)都不改变 CBCT 信息量不足的事实——若下游只需要特定结构(如肿瘤)的对齐,把结构掩码作为约束先验(任务包已提供 13 结构掩码)往往比继续堆配准网络更划算。

2.3.3 标注流水线的工程启示

ThoraxCBCT 的标注流程值得单独记录,因为它示范了"大模型工具+医生验证"的现代医学标注配方:

  1. FBCT 缺失的分割掩码用 TotalSegmentator 自动生成(而非从零人工勾画);
  2. 掩码经配准传播到 CBCT(CBCT 上人工勾画 13 结构成本过高);
  3. UKSH 临床医生逐例验证——人工只做质量闸门,不做生产力单元;
  4. 全躯干 landmarks 纯手动(这一步无法自动化,也最贵——所以每对只 16 个);
  5. 训练自监督所需的密集对应关系用 DeedsBCV 自动导出(明确标注了来源算法,供方法学研究时溯源偏差)。

这套配方与库内 synthrad 等条目描述的合成数据标注逻辑相通:自动生成、人工验证、来源透明。

2.4 历史任务包:pre-2022 数据矩阵的持续开放

2023 届没有废弃历史任务,而是让它们在 learn2reg-test 平台继续接受提交。Zenodo 合集 DOI 10.5281/zenodo.3835682 打包了 pre-2022 数据。各包规格(Datasets 页官方口径):

数据包 尺寸/间距 例数(train/test) 标注 附加 下载体积
Lung CT 192×192×208 @1.75×1.25×1.75mm 30(20/10) 100 landmarks/例 肺掩码 530 MB
OASIS 160×192×224 @1×1×1mm 455(416/39) 35 anatomical labels — 1.3 GB
CuRIOUS 256×256×288 @~0.5×0.5×0.5mm 32(22/10) 9-18 landmarks/例 — 2.6 GB
Abdomen CT-CT 192×160×256 @2×2×2mm 50(30/20) 13 器官 labels — 1 GB
Abdomen MR-CT 192×160×192 @2×2×2mm 16 对(8/8)+90 unpaired 4 labels(train)/9 labels(test) ROI 掩码 1.8 GB
Hippocampus MR 64×64×64 @1×1×1mm 394(263/131) 2 labels(头+体) — 54 MB

几个值得注意的构成细节:

  • Abdomen CT-CT 来自门静脉对比期的临床采集(512×512×53-368 不等、层厚 1.5-7.0 mm),13 个器官标签(脾、双肾、胆囊、食管、肝、胃、主动脉、下腔静脉、门/脾静脉、胰腺、双肾上腺)由两名受训 6 个月的本科生初标、放射医生 MIPAV 逐体积复核——"少而脏"的标注正是任务设计想考验的噪声标注场景。
  • Abdomen MR-CT 是三层来源的"缝合"数据集:TCGA-B8/BP/DD 系列受试者(TCIA)+ Beyond Cranial Vault(BCV)挑战 + CHAOS 收藏,16 对外另配 90 对无配对 CT/MR 供无监督实验。它的存在使库内 chaos 条目成为直接上游(CHAOS 数据的原始出处)。
  • Hippocampus MR 派生自 Vanderbilt 精神表型库(90 健康成人 + 105 精神障碍患者:56 精神分裂症、32 分裂情感障碍、17 精神分裂样障碍),经 Medical Decathlon 进入配准领域——异患者配准中"最像分类任务"的一支,也是"小结构+大数据集"象限的唯一代表。
  • CuRIOUS 是唯一的多模态术中任务(MR T1w/FLAIR→超声),部分视野与术中形变使它成为"最像手术导航"的包。
  • Lung CT(2020 版)是 NLST 的精神前身:30 例、每例 100 个 landmark、吸气-呼气配对——2023 的 NLST 扩展相当于把这个任务搬进真实筛查数据并放大标注密度。

六包的用途指引(按研究目标分派):

你的目标 推荐包 理由
快速验证新配准网络 Hippocampus MR(54 MB,394 例) 体量小、迭代快、异患者 Dice 可即时自评
测试多模态稳健性 Abdomen MR-CT、CuRIOUS 跨模态+部分视野双重压力
模拟临床部署 Lung CT→NLST2023、ThoraxCBCT 真实采集噪声与临床指标
研究标签噪声影响 Abdomen 系(本科生标注+医生复核) 已知的标注噪声结构
大样本监督实验 OASIS(455 例 35 labels) 学习式方法的"主场"
复刻历史排行 对应包+TMI 论文参数 排名代码开源可复算

这张指引表的隐含结论:六个历史包并非"旧数据仓库",而是按目标分派的工具架——体量小的适合迭代、标注脏的适合研究噪声、真实采集的适合临床模拟。Learn2Reg 把它们留着持续开放,正是让不同成熟度的方法各取所需。

2.5 规格对照:2023 任务包与库内同域数据集

把两个 2023 任务包放到库内同域数据集旁边,可以看出 Learn2Reg"小而精+重标注"的选型口味:

数据集 模态 规模 标注重心 与 L2R 的关系
NLST2023(本条目) CT↔CT 210 对 双专家 landmarks+结节 基准任务本体
4D-Lung(上游) 4D-FBCT+4D-CBCT 20 患者/183 GB RTSTRUCT+金标 ThoraxCBCT 源
pddca/POPI(库内 454) 4D CT 10-31 例 100 landmarks/例 肺配准前代基准(landmark 传统同源)
chaos(库内 337) CT+MR 腹部 100 例 器官分割 Abdomen MR-CT 任务原料之一
amos(库内 76) CT+MR 腹部 500 例 15 器官 跨模态腹部配准的扩展评测场
ct-rate(库内 546) CT 508 例 纵隔淋巴结 跨期胸 CT 的随访形态
totalsegmentator(库内 422) CT 大规模 全身分割模型 ThoraxCBCT 掩码生成工具

对照的结论:Learn2Reg 任务包的绝对规模在医学影像界属于"小型",但其标注密度(每例 >100 双专家 landmark、逐例掩码+keypoints+掩码三件套)与评测基础设施(隐藏测试+统计排名)是库里少见的。这决定了它的最佳用途是方法对比与算法选型,而不是从头预训练一个大模型。

§3 挑战赛设计:任务、指标与排名机制

3.1 挑战赛分型与两阶段赛制

grand-challenge 体系的提交分型(2023 年的语境):

分型 提交内容 隐藏程度 2023 应用
Type 1 位移场(申请下载 test 图像,标签隐藏) 图像半隐藏+标签全隐藏 2023 test 期可选通道
Type 2 Docker 算法(统一 GPU 评测,含 runtime) 组织方代跑 2023 主推通道;NLST phase 2 同理
Type 3 Docker,训练也在隐藏数据上完成 图像+标签全隐藏 OncoReg type 3(2023-12 启动)

Learn2Reg 2023 的组织设计(Zenodo 记录 + OncoReg 论文互证):

Validation Phase(验证期):参赛者用公开的训练/验证数据开发算法,对验证病例计算位移场上传 grand-challenge.org;每天可多次提交,结果实时进入公开排行榜——鼓励迭代,也让"调参过拟合验证集"的行为可见。

Test Phase(测试期):2023-09-14 开放至 2023-09-29 23:59 CET(learn2reg-test.grand-challenge.org 专站)。两种通道任选:Type 1 上传位移场,或 Type 2 提交 Docker 由组织方统一硬件评测并附加推理运行时统计。

NLST 的进一步升级——两阶段制(Zenodo 记录):phase 1 照常本地训练提交;phase 1 优胜队伍改交训练用 Docker,由组织方在包含非公开标注的更大肺部/胸部数据集(解剖 landmarks、几何 keypoint correspondences、治疗相关靶结构、语义分割四类监督)上代跑训练再评测——参赛者根本见不到这些数据。训练出的网络随后经 grand-challenge 公开发放。这是把"防泄漏"推到极致的设计:连训练集都藏起来一半。

2023 届年内时间线(多源拼合):

时点 事件
2023-04-19 Zenodo 挑战赛记录 v1 发布(任务设计与创新说明)
2023 年中 L2R23 data release 论坛帖发布两任务数据包(NLST2023/ThoraxCBCT)
2023-08-09 仓库更新 L2R23_Snapshot_NLST / L2R23_Snapshot_ThoraxCBCT 排名 notebook
2023-09-14 test 提交窗口开启(learn2reg-test 专站)
2023-09-29 23:59 CET test 提交截止
MICCAI 2023 workshop 结果讨论与颁奖(NLST:LapIRNv2;ThoraxCBCT:SynDeeds)
2023-12-06 OncoReg type 3 kickoff(虚拟帮助会)
2024-01-31 OncoReg 最终 Docker 截止
2024-02-20 OncoReg 虚拟 winter workshop(收官)

这份时间线的用途:任何"2023 届成绩何时产生"的疑问都可在表中定位——公开任务的成绩产生于 9 月窗口与 MICCAI workshop 之间,OncoReg type 3 的成绩则是 2024 年 2 月——引用时别把两者混为"2023 结果"。

3.2 指标家族:四个维度合成一张榜

Learn2Reg 的评测哲学是"没有任何单一指标能抓住配准质量"(官方文档原文口径),因此每任务捆绑一组互补指标。读这张表的方法是先看"维度"列——同一维度内的指标互为冗余(TRE 与 TRE-KP),跨维度的指标互为制衡(TRE 与 SDlogJ):

维度 指标 含义 2023 应用
准确性 TRE(mm) 靶注册误差:landmark/keypoint 经形变后的距离误差 NLST(TRE-LM/TRE-KP)、ThoraxCBCT(TRE-KP)
准确性(临床) TREnodules 肺结节层面 TRE NLST 2023 新增
覆盖 Dice/DSC(%) 解剖标签经形变后的重叠度 ThoraxCBCT(13 结构)、Abdomen、OASIS
覆盖(边界) HD95(mm) 表面距离 95 百分位 ThoraxCBCT
鲁棒性 TRE30 最差 30% landmark 的 TRE NLST
合理性 SDlogJ log Jacobian
效率 runtime Docker 统一 GPU 实测推理时间 Type 2 提交者

四个维度的互补关系可以这样理解:TRE 回答"点对上了吗",Dice/HD95 回答"面对上了吗",TRE30 回答"最难的案例崩了吗",SDlogJ 回答"形变场物理上说得通吗",runtime 回答"临床等得起吗"。任何一个维度缺失,都会产生被论文里优雅数字掩盖的失败模式——例如只报 TRE 的方法可以在 landmark 附近过拟合、在器官边缘产生折叠位移场。

Jacobian 行列式指标值得单说:位移场若发生折叠(Jacobian ≤ 0),拓扑结构被破坏,下游任何"沿位移场传播剂量/轮廓"的应用都会出 silent failure。放疗场景里这意味着剂量可能被映射到错误的解剖位置——SDlogJ 进榜把"形变合理性"从论文里的附加实验变成了硬性排名项,这是 Learn2Reg 对放疗社区最直接的制度善意。

指标间的冲突不是理论风险,2023 两个任务都有实例:NLST 上 Birmingham 的 TRE(1.425 mm)低于冠军 LapIRNv2(1.441 mm),但鲁棒性与平滑性次之,总 rank 反而低两个身位;ThoraxCBCT 上 SSKJLBW 的 HD95(17.60 mm)全场最佳、SDlogJ(0.26)全场最差——边界对得越紧、内部形变越拧巴。这两例合起来说明:"哪个指标重要"取决于下游用法——结节测量场景看 TREnodules,剂量累积场景看 SDlogJ,轮廓传播场景看 Dice/HD95。Learn2Reg 不替你做这个选择,它只是把所有维度并排摆出来。

3.3 排名机制:统计显著性与几何平均

排名代码(GitHub MDL-UzL/L2R ranking 目录)完全开源,规则为:

  1. 对任务内每个指标,所有方法两两做 Wilcoxon signed-rank 检验(p<0.05 记显著差异);
  2. 每对显著比较中"赢"的一方得 1 胜场;按胜场数排序后线性映射到 [0.1, 1.0] 的 metric rank(并列共享分值);
  3. 任务总 rank = 该任务全部指标 metric rank 的几何平均——意味着任何一项指标崩盘都会拖垮总排名;
  4. 未提交(或无 Docker)的方法直接记最低 0.1。

用 ThoraxCBCT 2023 的真实数字演算一遍排名逻辑的后果:Fourier-Net 的 TRE(4.03 mm)与 TRE30(3.85 mm)全场最低,但 DSC 61.91% 与 HD95 47.80 mm 接近垫底——它的准确性与覆盖维度互相抵消,总 rank 只有 0.535;SynDeeds 没有拿到任何单指标第一,但每一项都在前排,几何平均把它推到 0.705。官方 baseline ConvexAdam 的 0.710 则说明:混合路线的天花板被组织方自己标注了出来。

这套设计刻意惩罚"偏科生",同时给"全面但不极致"的 baseline 留出视野——这正是官方把 ConvexAdam 放进榜单当参照物的目的:它既是靶子也是标尺。

3.4 自配置(self-configuring)路线的制度化

2023 届最鲜明的学术议程是把"自动超参数选择"写进赛制。Zenodo 记录原文:挑战赛数据永远无法穷举临床应用,要让超参数选择成为自动流水线的一部分。具体措施(Task 3 从 2022 的改进延续):

  • 提供一组 baseline 算法(含 ConvexAdam、corrField 等)作为实现参照;
  • 发布 dummy 数据集(含监督与评测配置文件),让参赛者在正式提交前完整走通评测链路;
  • 测试时提供预测语义标签(nnU-Net 风格),供特征提取类方法使用;
  • 开放 sanity check 通道——提交零位移场即可校验评测管线(仓库另附 zero-deformation fields);
  • 改进时间线,给 Docker 实现与调试留足窗口。

成果可以从方法谱系看出:ConvexAdam(凸优化+Adam 实例优化+自动超参搜索)在 2020-2021 跨任务总分第一,2023 年又以 baseline 身份继续压制一众专用算法——"少学习、多配置"路线与深度学习路线的正面竞争,是 Learn2Reg 对配准方法学最大的公开实验。这场实验的阶段性结论(§5.3)已经写进了 TMI 论文:纯端到端深度学习并没有统治这个领域,混合与自配置路线站稳了脚跟。

自配置议程的延伸影响在基准之外:当"选择超参数"本身成为被评测的能力,方法论文的评价标准就从"在固定配置下刷点"转向"在陌生任务上自动达成合理配置"——这与 2024/2026 届不断加入新域(术中、显微镜、核医学)的选task逻辑形成呼应:新任务越陌生,自配置的价值越大。

3.5 赛制的可移植性:设计自己的配准评测能抄什么

Learn2Reg 2023 的赛制是一个可以被整体移植的模板,逐条对应"你办评测时该抄什么":

Learn2Reg 设计 解决的问题 移植成本
多任务并列而非单任务 防"单任务特化"刷榜 高(要凑多套标注)
仿射预对齐统一发放 把工程杂活与算法创新分离 低
验证期每日多次提交+实时榜 观察过拟合行为、降低参赛门槛 低(grand-challenge 现成)
test 期 Type 1/2 双通道 兼顾轻量参与与可复现性 中
训练 Docker 代跑(NLST phase 2) 连训练集都能隐藏、防数据泄漏 高(组织方算力投入)
Wilcoxon 显著性+几何平均排名 拒绝单指标定胜负与噪声冠军 低(代码开源可直接用)
baseline 常驻榜单 给社区锚点+隔离组织方优势 中
零位移场 sanity check 消灭坐标系/方向类低级错误 极低
SDlogJ 入榜 把形变合理性变成硬指标 低
TREnodules 临床指标入榜 让排名对齐临床关心的东西 高(要额外临床标注)

移植时的常见错误是只抄"隐藏测试"不抄"显著性排名"——结果榜单被验证集噪声主导,前排名次在统计上不可区分,赛制公信力反而受损。Learn2Reg 的经验是:隐藏+统计检验+多指标几何平均是一个整体,拆开来用会互相抵消。

赛制移植前的自检问题(对照 Learn2Reg 逐项打勾):

  1. 我的任务有没有至少一个"非平均数"指标(最差百分位/边界距离)?
  2. 有没有形变合理性指标(Jacobian 类)?
  3. test 标签是否真的不可被参赛者间接重建(公开验证集与 test 是否同源同分布泄漏)?
  4. 排名是否做了显著性检验?样本量撑得起吗?
  5. baseline 是否覆盖传统与学习两派?是否明确标注不参评身份?
  6. 有没有零解 sanity check 通道?
  7. runtime 与硬件口径是否固化并披露?
  8. 数据发布与结果发布的时间线是否留出 Docker 调试期?
  9. 临床指标(若有)是否由临床专家定义而非工程侧内推?
  10. 届次结束后排行榜是否保持开放(持续评测)?

十问全绿即是"Learn2Reg 级"评测设计;缺三项以上建议先补齐再开赛——这是 2019-2023 四届迭代用真实事故换来的清单。

§4 结果与排行榜分析

4.1 NLST 2023:LapIRNv2 的标杆战

来源声明:本节全部数字出自 Learn2Reg 2024 总结论文(arXiv 2509.01217 v3,MELBA 2025:034)§4.1.4 Table 1——该表是 2023 届 NLST 官方结果的唯一系统化出处;grand-challenge 在线榜与 GitHub snapshot notebook 为同源补充,与论文表口径一致。

官方表彰名单(双专家 >100 landmarks/例):

名次 队伍/方法 TRE (mm) SDlogJ Rank
1 LapIRNv2(Mok & Chung 条件级联网络) 1.441 0.042 0.800
2 corrfield(组织方 baseline:Förstner keypoint+最小生成树) 1.638 0.038 0.670
3 Birmingham(Jia et al. 迭代式深度均衡方法系) 1.425 0.045 0.553
4 UKE 2.435 0.062 0.489
5 MONAI baseline 2.042 0.039 0.452
6 UCLA 2.934 0.071 0.352
— initial(未配准) 10.40 — —

三点解读:

  1. 深度学习垄断前排但传统方法紧咬。冠军 LapIRNv2 是纯学习式级联网络;第二名却是传统优化式 baseline corrfield——按 TRE 绝对值看,Birmingham(1.425 mm)甚至比冠军还低,输在鲁棒性与形变合理性的均衡上。这个"传统方法只慢不差"的证据链从 TMI 论文延续到了 2023。
  2. 临床指标与学术指标一致。TREnodules(肺结节 TRE)Top-4 达 1.135-1.434 mm,约为 MONAI/UCLA 基线误差的 50%,且与 landmark TRE 排序高度吻合——"筛查-随访"闭环最关心的结节跟踪精度,可以由 landmark 精度良好预测,这为后续基准只用 landmark 提供了正当性依据。
  3. runtime 进入临床可接受区。前排方法执行时间为数秒级,官方评述"轻量学习式 MONAI baseline 也表现良好"——配准作为预处理步骤的工程成本已经不构成瓶颈。

从未配准基线 10.40 mm 到冠军 1.441 mm,任务把"配准能带来什么"压缩成了一个 7 倍因子;而 1.441 mm 已低于典型 CT 层厚(1-5 mm)——在这个数据上,配准误差进入亚体素区间,继续提升的边际收益要靠临床判断而非 leaderboard。

逐名次细读(与 §5 方法卡对照):

  • LapIRNv2(0.800):级联式由粗到细是"大形变"的标准答案;它不是单项最准(Birmingham 的 TRE 更低),而是 TRE+SDlogJ 双优——印证几何平均奖励均衡。
  • corrfield(0.670):传统 keypoint 路线的体面成绩。它没有训练过程、不需要数据,证明在"有良好预对齐+关键点可检测"的场景里,经典方法仍是性价比之王。
  • Birmingham(0.553):DEQ 深度均衡路线,TRE 绝对值全场最低(1.425 mm)但 TRE30/SDlogJ 拖后——"最准但不最稳"的教科书案例。
  • MONAI baseline(0.452):官方教学级轻量网络。它的存在意义是"下限锚点":连教学配置都在未配准基线上提升 5 倍,说明任务的预对齐已经把问题驯化到可学习区间。
  • UKE(0.489)/ UCLA(0.352): specialised 深度方案。UCLA 的 SDlogJ 0.071 最差——形变平滑性欠账直接反映在排名上。

4.2 ThoraxCBCT 2023:SynDeeds 与 baseline 的微妙关系

OncoReg 论文 Table 2(官方结果表,含组织方 baseline):

方法 TRE↓(mm) TRE30↓(mm) DSC↑(%) HD95↓(mm) SDlogJ↓ Rank↑
initial(未配准) 11.91 16.26 29.04 48.13 — —
ConvexAdam(组织方 baseline,不参评) 4.93 4.98 68.40 38.00 0.10 0.710
SynDeeds(官方冠军) 6.01 5.67 70.16 22.97 0.15 0.705
Niftyreg(传统基线) 4.90 4.51 62.11 43.41 0.05 0.577
DeedsBCV 8.76 7.38 69.00 22.38 0.16 0.537
Fourier-Net 4.03 3.85 61.91 47.80 0.07 0.535
SSKJLBW 5.80 7.44 69.45 17.60 0.26 —

任务叙事的三个看点:

  1. "赢"的定义:ConvexAdam 总 rank 0.710 高于 SynDeeds 0.705,但它是组织方提供的 baseline、按规则不参评冠军——官方冠军是 SynDeeds(Deeds 前置一个学习式图像合成模块:先把 CBCT 的伪影"修图"再用 Deeds 配准)。两者的 DSC(68.40 vs 70.16)与 TRE(4.93 vs 6.01)互有胜负,差距远小于未配准基线(DSC 29.04、TRE 11.91)。任何"2023 ThoraxCBCT 冠军是谁"的叙述都必须写清这层(坑 6)。
  2. 单指标冠军全是"偏科生":TRE 最低 Fourier-Net(4.03 mm)DSC 却最低档;HD95 最低 SSKJLBW(17.60 mm)SDlogJ 最差(0.26,形变最不平滑);传统 Niftyreg 的 SDlogJ 全场最优(0.05)但 DSC 只有 62%。跨模态任务上"准确性-覆盖-平滑"三角确实难兼得——这正是几何平均排名要暴露的结构性事实。
  3. 跨模态+跨相位+跨时间的复合难度被量化:即便冠军,DSC 70.16% 也显著低于同组织方方法在单模态肺任务上的表现(NLST 上 Dice 类指标普遍更高)——CBCT 伪影与呼吸相位差构成了真实的性能天花板。OncoReg 论文自己的评述是:官方冠军与 baseline “在多数指标上非常接近”——冠军的含义是"在参赛者中最好",不是"问题已解决"。

逐方法细读(供选型时按需求对号):

  • 要覆盖(Dice):SynDeeds 70.16% 最高,DeedsBCV 69.00% 与 SSKJLBW 69.45% 紧随——三者都带"结构感知"成分;
  • 要点准(TRE):Fourier-Net 4.03 mm、Niftyreg 4.90 mm、ConvexAdam 4.93 mm——傅里叶域参数化与经典优化在点级打平;
  • 要边界(HD95):SSKJLBW 17.60 mm、DeedsBCV 22.38 mm、SynDeeds 22.97 mm——边界好的方案不一定点准,反之亦然;
  • 要平滑(SDlogJ):Niftyreg 0.05、ConvexAdam/Fourier-Net 0.10/0.07——传统正则化路线在合理性上稳定占优;
  • 综合(Rank):SynDeeds 0.705 是唯一在四个维度都不垫底的参赛者——跨模态任务的"均衡税"最贵也最值。

4.3 横向读法与不可比性警示

  • 各任务指标组合、数据规模、预对齐状态不同,跨任务分数不可直接比较,官方比较单位只有"任务内 rank"与跨任务 rank 的几何平均(且仅对提交≥4 个任务的方法有意义)。
  • NLST 2023 的 6 队是官方表彰名单口径(2024 论文 Table 1);验证期实际提交队伍数更多但未在可核来源中披露——引用"参赛规模"时只能说 2020-2021 两届合计 20+ 队/65+ 方法(TMI 论文口径)。
  • 历史 baseline 的存在使"第一名"叙事复杂化:corrField/ConvexAdam/MONAI 等官方 baseline 会与参赛者同榜展示,读榜先看身份列。
  • OncoReg 论文还提醒了一个工程细节: trainable 方法在 NVIDIA RTX 4000 SFF Ada(20 GB 显存)上重训练评测,runtime 不计排名——不同届次的硬件基线不同,跨届比 runtime 无意义。

读榜三条军规(本条目 §4 全节的方法论总结):

  1. 先认身份再认名次——榜单上 baseline 与参赛者并列展示,冠军归属以"参评者中 rank 最高"为准;
  2. 先问届别再引数字——同一任务名(NLST)在 2022/2023 两个榜与论文表中指标组不同,混引即错;
  3. 先看显著性再谈优劣——小样本任务上未过 Wilcoxon p<0.05 的差距,严格说只是"并列"。

4.4 历史纵深:2020-2021 六任务奠定了什么

要理解 2023 结果的含金量,需要回看 TMI 论文记录的 2020-2021 届结论(六任务:Lung CT、OASIS、CuRIOUS、Abdomen CT-CT、Abdomen MR-CT、Hippocampus MR):

  • 参与规模:20+ 国际团队、65+ 方法提交——配准领域第一次有了可比样本量级的公开竞赛数据。
  • 任务-方法图谱:TMI 论文 Table 2 对每支队伍逐格标注(无监督/监督、相似度度量、正则化、优化器、架构)——MIND/LNCC/NGF 相似度、扩散/弯曲能正则、Adam/凸优化/L-BFGS 的使用频率第一次可统计。
  • 关键教训:OASIS(最大标注集)吸引了最多学习式方案——大标注数据决定深度学习参与度;Lung CT 上学习方法更多样(传统/纯学习/混合并存);Hippocampus 上学习方法显著占优——训练集包含评测结构时学习式方法"作弊般"受益,这本身就是一条基准设计警告。
  • 速度迷思破除:GPU 加速下优化式方法 3D 配准降到秒级,"学习式必然快"不成立——这条结论直接影响 2023 届保留传统方法 baseline 的决策。

2022 届(NLST 首秀 + Type 3 试验)与 2023 届(本条目)是这些教训的制度化:NLST 把"真实筛查数据+临床指标"变成常设任务;两阶段与 Type 3 把"隐藏"从 test 标签扩展到训练数据;自配置把"跨任务泛化"从口号变成排名项。

值得单独记录的一个 2020-2021 遗产是方法-任务勾选矩阵(TMI 论文 Table II):每支参赛队被逐格标注监督方式、相似度度量、正则项、优化器与架构。这张矩阵在当时是描述性统计,到 2023 年已经变成方法设计的查表工具——想用 NGF 的可以看谁在多模态任务上靠它拿到名次,想用扩散正则的可以看它在肺任务上的表现。Learn2Reg 之所以能"跨届积累",正是靠这类结构化记录让每届的方法学信息不随比赛结束而蒸发。

4.5 临床深读:一个肺结节随访闭环里的配准

把 NLST 任务的数字翻译回诊室场景:一位高危吸烟者在年度筛查中查出 8 mm 磨玻璃结节,半年后复查——放射科医生要回答"它长了吗"。这需要把两次 CT 的结节对齐比较,人工找对应费时且误差大;配准算法自动对齐后,结节体积倍增时间(volume doubling time)的计算才能自动化。此时:

  • TRE 1.441 mm(冠军水平)意味着结节边界的定位误差低于一层 1.5 mm 重建图像——体积测量误差主要由分割而非配准主导;
  • TRE30 与 TREnodules 分开报(后者 1.135-1.434 mm)意味着"最难 30% 案例"与"结节所在处"都被单独审计——胸膜旁结节、肺不张区这些配准失效重灾区不再是平均数里的隐形项;
  • SDlogJ 0.042 意味着位移场没有折叠——沿它传播的结节轮廓不会翻转自交。

放疗场景(ThoraxCBCT)则多一层:配准结果要支撑"当天的 CBCT 上肿瘤到底在哪、剂量覆盖住了吗"的判断。冠军 DSC 70.16% 的另一面是 30% 的覆盖缺口——其中相当部分发生在 CBCT 伪影区。OncoReg 论文由此把"图像修复+配准"(SynDeeds 路线)与"特征对齐"(ConvexAdam 路线)的路线之争留给了后续届次。

这两段临床翻译是本条目把"排行数字"变成"使用证据"的核心:数字来自论文表格(可溯源),解读框架来自任务的官方动机陈述(Zenodo/OncoReg 原文),二者没有混入条目作者的外推。

4.6 一个检索者的最小结论集

如果只带三条结论离开本条目:

  1. 胸 CT 跨期配准的公开基准选 NLST2023:210 对、双专家标注、临床指标齐备、MONAI tutorial 开箱即用;冠军级方法(LapIRNv2 类级联+实例优化)是复现起点。
  2. 放疗 CBCT 配准的公开基准选 ThoraxCBCT:38 对、13 结构掩码+全躯干 landmarks、跨模态跨相位跨时间三重难度齐备;SynDeeds 的"先修图再配准"与 ConvexAdam 的"特征+凸优化"是两条已验证路线。
  3. 任何排行引用先过届别关:2023 的结果表在 2024 论文与 OncoReg 论文里,不在 TMI 论文里——TMI 论文是 2020-2021 的(坑 2 是本条目最高频引用事故)。

§5 方法景观:谁在打这个基准、用什么打

5.1 官方 baseline 工具箱

方法 类型 一句话原理 官方角色
corrField 传统/无学习 Förstner keypoint 上 MIND-SSC 特征+最小生成树精确消息传递 NLST baseline(rank 0.670)
ConvexAdam 混合 nnU-Net 语义特征/MIND → 耦合凸优化 → Adam 实例优化;自动超参选择 ThoraxCBCT baseline(0.710 不参评);2020-2021 跨任务总分第一
DeedsBCV 传统 稀疏 keypoints+块匹配 CVH ThoraxCBCT 参评(0.537);keypoint 导出工具
NiftyReg 传统 经典 B 样条自由形变 ThoraxCBCT 参评(0.577)
MONAI baseline 学习式 官方 tutorial 的轻量配准网络 NLST 参评(0.452)

baseline 的战略价值:一是给新参赛队"及格线"(打不过 NiftyReg 说明方法有问题);二是给社区"可复现锚点"(corrField 有 grand-challenge 公共 algorithm 页,一键调用);三是隔离"组织方优势"(ConvexAdam 是组织方成员参与开发的方法,以 baseline 身份出现避免"裁判员夺冠"争议——但也造成坑 6 的叙述陷阱)。

5.2 学习式阵营的谱系

  • LapIRN / LapIRNv2(Mok & Chung,香港中文):条件级联配准——由粗到细的多级形变估计,每级只处理上一级残差。NLST 2023 冠军(TRE 1.441 mm,rank 0.800);2020-2021 亦多任务获奖(README 奖牌记录:两金一银一铜)。它的胜出路径印证了"大形变任务要靠多尺度"的老经验。
  • SynDeeds(Heinrich 组,Lübeck):传统 Deeds 前置学习式图像合成模块——把低质量 CBCT 的伪影"修复"回干净外观再配准。ThoraxCBCT 2023 官方冠军(DSC 70.16%)。OncoReg 论文给了它的完整描述:图像合成被表述为加性去噪问题,网络学习残差而非重建干净图像。这是"深度学习修图+传统配准"混合路线在跨模态任务上的标杆胜利。
  • Fourier-Net:在傅里叶域参数化位移场(低频形变自然平滑、参数量小),TRE 全场最低(4.03 mm)但 DSC/HD95 偏弱——"点对得准、面对不齐"的典型偏科样本。
  • VoxelMorph++(Heinrich & Hansen):U-Net 骨干+离散化 heatmap 预测头,用 Förstner keypoints 做自监督,多通道实例优化;OncoReg(type 3 隐藏数据)亚军——说明 keypoint 自监督路线在域外数据上也能存活。
  • DINO-Reg Ensemble(Song et al. 2024):OncoReg type 3 冠军,隐藏数据上 TRE 与 DSC 双第一——自监督预训练特征(DINO 系)进入配准主赛场的信号。
  • Birmingham / DEQ 系(Jia et al.):深度均衡模型(DEQ)把迭代优化"蒸馏"进网络,无限步隐式求解;NLST 2023 的 TRE 绝对值全场最低(1.425 mm)但综合 rank 第三。
  • SSKJLBW:ThoraxCBCT 上 HD95 最低(17.60 mm)——边界对齐最好的方案,但 SDlogJ 0.26 最差,位移场平滑性拖垮综合排名。

Lübeck 方法线时间轴(组织方自己的方法演进,亦是基准设计演进的镜像):

年份 方法 步骤意义
2012-2013 Deeds(BCV) 稀疏关键点+块匹配的经典基座,后成为 keypoint 导出工具
2015 corrField keypoint+最小生成树——"无学习也能打"的证明
2019 PDD-Net 概率密度位移——深度特征进入 Lübeck 线
2021-2022 ConvexAdam 特征学习+凸优化+自动超参——自配置路线成熟
2023 SynDeeds 图像修复+配准两段式——跨模态(CBCT)特化
2024 VoxelMorph++ / DINO-Reg 系 heatmap 自监督与自监督预训练特征接棒

这条时间轴与 Learn2Reg 届次几乎同步演进——组织方一边办赛一边用自家方法"探路",baseline 的更替史就是"当代最强配置"的更替史。检索方法学论文时,从这条线切入可以快速理解每代 baseline 的设计动机。

5.3 三条方法学结论(官方口径)

  1. 速度迷思破除:GPU 加速下传统优化式配准的 3D 计算降到数秒级,CNN 特征提取反而常是耗时大头——"学习式必然快"不成立(TMI 论文核心结论之一,2023 届再次验证)。
  2. 标签监督的适用边界:分割标签监督主要利好异患者配准(Abdomen CT-CT 上 Dice 提升约 20 个百分点);同患者场景(NLST)keypoint 自监督与无监督相似度度量(MIND/LNCC/NGF)更占优。这条边界画定了"要不要花预算标数据"的决策依据。
  3. 混合架构是主流赢家:排名前排普遍是"深度特征/修复+传统优化"或"学习式网络+实例优化"的组合——纯端到端回归位移场的范式并未统治基准。ConvexAdam(特征学习+凸优化)与 SynDeeds(图像修复+Deeds)两个最高分方案都是混合体。

5.4 方法卡:两场冠军战的战术细节

LapIRNv2(NLST 冠军)

  • 架构:条件级联(conditional)多级配准网络——每级以前一级的形变为条件继续细化,天然匹配"呼吸形变由粗到细"的物理结构;
  • 监督:NLST 提供 landmark/keypoint 监督信号,级联各级共享;
  • 胜负手:TRE(1.441 mm)与 SDlogJ(0.042)同时前三——大形变任务的"准"与"稳"兼得;
  • 复用建议:MONAI tutorials 有同系条件级联实现,适合作为"从基线到前排"的第一跳。

SynDeeds(ThoraxCBCT 冠军)

  • 架构:学习式图像合成(修复 CBCT 伪影)+ 经典 Deeds 优化配准的两段式;
  • 关键设计:合成模块被表述为加性残差问题(学习"退化-干净"之差而非直接重建),训练信号稳定;
  • 胜负手:DSC 70.16% 全场最高、HD95 22.97 mm 前列——"把伪影修掉再配准"在覆盖类指标上红利最大;
  • 局限:TRE(6.01 mm)低于 Fourier-Net/ConvexAdam——点级精度不是它的强项,恰好说明跨模态任务里"覆盖"与"点准"可以走完全不同的优化路径。

两卡合读的启示:2023 年的两场胜利都没有发明新理论,而是把"任务的难点结构"翻译成"模块化流水线"——这是 Learn2Reg 系基准对方法学最实在的引导作用。

复现提示两则:LapIRNv2 的条件级联思想在 MONAI tutorials 有同族实现,可直接改造为 NLST 参赛骨架;SynDeeds 的图像合成模块概念上可替换为任何 CBCT 去伪影模型(如库内 synthrad 类生成器),替换后应在 ThoraxCBCT 验证集上重跑全部四指标——覆盖类指标的收益与点级指标的损失需要一起看。

§6 获取、许可与 AI-Ready 评级

6.1 三层获取路径

层 内容 入口 状态(2026-09-26 探测)
源数据层 TCIA NLST(CC BY 4.0);TCIA 4D-Lung 183.04 GB(CC BY 3.0) cancerimagingarchive.net 收藏页公开直链/TCIA Data Retriever 公开可用
预处理层 NLST2023.zip(224×192×224@1.5mm,170/10/30 对);ThoraxCBCT 包(38 对+掩码+keypoints);pre-2022 合集(Zenodo 3835682) grand-challenge 平台注册 → Uni Lübeck 云(cloud.imi.uni-luebeck.de/s/…/download) 平台注册制;未登录 HEAD 直探返回 401
评测层 test 图像与全部监督标注;OncoReg type 3 私有数据(UKSH 25 患者常规放疗 CT) upon request(邮件 learn2reg@gmail.com)或 grand-challenge 在线评测(learn2reg-test) 请求制/仅服务

复现路径两条:

  • 最低成本路线:TCIA 下载 4D-Lung/NLST 源数据自行预处理,或经 MONAI 官方 tutorial(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb)以 NLST2023.zip 为素材训练+本地验证集评测——评测代码与零位移场 sanity check 在 GitHub MDL-UzL/L2R。
  • 打榜路线:grand-challenge 注册 → 下载任务包 → 验证期上传位移场 → 测试期交 Docker(组织方 GPU 实测 runtime)。

获取路径决策树:

你的目标是?
├── 训练/方法研究(要数据本体)
│   ├── 只要原始影像 → TCIA 源层(NLST / 4D-Lung,公开直链)
│   └── 要官方配对与标注 → 平台注册 → 任务包(NLST2023 / ThoraxCBCT)
├── 方法对比(要排名)
│   ├── 快速自评 → MONAI tutorial + 验证集本地评测
│   └── 正式名次 → 验证期上传 → test 期位移场/Docker
└── 临床选型(要证据)
    ├── 肺随访场景 → §4.1 NLST 数字 + TREnodules
    └── 放疗 CBCT 场景 → §4.2 ThoraxCBCT 数字 + §7.3 OncoReg 域外对照

6.2 许可的分层声明

  1. NLST 源数据:CC BY 4.0(TCIA 收藏页明示;数据引用要求附 DOI 10.7937/TCIA.HMQ8-J677 与 NEJM 2011/TCIA 平台论文引文)。
  2. 4D-Lung 源数据:CC BY 3.0(引用要求:Hugo et al. 2016 TCIA DOI + Hugo et al. 2017 Medical Physics + Balik et al. 2013)。
  3. 挑战赛预处理包:平台注册制发放,无统一开放 license 声明——重分发前应视为仅限研究使用。
  4. 评测代码:GitHub MDL-UzL/L2R 公开(仓库未见 LICENSE 文件——按 GitHub 默认条款处理,引用代码请注明仓库)。
  5. Zenodo 挑战赛记录(7844799/7844798)与 pre-2022 合集(3835682)各自带 Zenodo license 标注,引用前逐记录核对。

许可层与数据层的对应关系(一条记忆线):越接近原始数据越开放(CC BY),越接近评测过程越封闭(注册/请求制)。这不是疏忽而是设计——开放源数据保证研究自由,封闭评测标注保证排名公信力。

许可三层的高频追问:

  • “CC BY 4.0 和 CC BY 3.0 差在哪?”——对使用者几乎无差(署名即自由),差别在版本条款细节;引用时照抄各自收藏页标注的版本号即可,不要统一写成"CC BY"。
  • “预处理包改了重采样,我还算用 CC BY 数据吗?”——衍生数据处理在 CC BY 框架内自由;灰色地带是"挑战赛配对与切分方案"本身——忠实复刻官方切分再分发,等于变相再分发预处理包,建议只分发"来源+代码"让他人复现。
  • “隐藏层标注能买吗?”——非卖品;组织方提供的是评测服务而非数据本身,这是排名公信力的物质基础。

6.3 DAIMS 评级

维度 评分(0-5) 依据
D 可发现性 4.5 grand-challenge 平台+Zenodo DOI+TMI/MELBA 论文三重索引;但 learn2reg.github.io 老站与 grand-challenge 双站并存有检索混淆成本(坑 1)
A 可获取性 3.0 源数据公开直链+预处理包平台注册可及;401 直链门槛与 test 标注请求制拉低;无统一开放 license
I 可互操作性 4.0 NIfTI 统一格式、各向同性重采样、JSON 配对清单、MONAI/nnU-Net 生态直连;评测输入为标准位移场
M 元数据 4.0 官方 Datasets 页逐包规格+TCIA 收藏页完整 DICOM 元数据;缺预处理包的机器可读数据卡
S 可持续性 4.5 2019-2026 连续运营、排行榜持续开放、代码开源、后续届次(2026 CodaBench)已启动——基准寿命在医学 AI 领域罕见
AI-Ready 综合 4.0/5 "评测即服务"范式的标杆:公开数据+开源评测+隐藏测试的可复现性设计完备;扣分项在预处理包的注册制与统一 license 缺位

评级的两点说明:D 维扣分源于双官网割裂而非内容缺失——信息本身完备且免费,只是需要知道去哪找;A 维扣分是"分层获取"结构的必然代价,源数据层实际是满分的,拉低总分的是预处理包(401 门槛)与隐藏层(请求制)。若未来官方把预处理包迁至开放镜像(如 Zenodo/HF),A 维可升 4.5、综合可升 4.5——这是本条目最重要的升级触发点。

6.4 引用清单(逐 DOI)

引用对象 DOI/来源
挑战赛 2023 官方记录 10.5281/zenodo.7844799(姊妹 7844798)
2020-2021 基准论文 10.1109/TMI.2022.3213983(IEEE TMI 42(3):697-712;arXiv 2112.04489)
2022-2024 总结论文 10.59275/j.melba.2025-gc8c(arXiv 2509.01217)
OncoReg spin-off 论文 arXiv 2503.23179(MELBA 2026 特刊)
NLST 筛查试验 10.1056/nejmoa1102873(NEJM 365(5):395-409)
TCIA 平台 10.1007/s10278-013-9622-7(J Digit Imaging 26:1045-1057)
NLST 影像 10.7937/TCIA.HMQ8-J677
4D-Lung 影像 10.7937/K9/TCIA.2016.ELN8YGLE
4D-Lung 描述论文 10.1002/mp.12059(Med Phys 44(2):762-771)
4D-CBCT 方法论文 Balik et al. 2013(PMCID PMC3647023)
ConvexAdam IEEE TMI 扩展版(xplore 10681158)/ CVPR 2023 版
pre-2022 数据合集 10.5281/zenodo.3835682
姊妹记录 10.5281/zenodo.7844798(与 7844799 同内容双记录)
持续评测站 learn2reg-test.grand-challenge.org
OncoReg 提交仓库 github.com/MDL-UzL/OncoReg
评测代码 github.com/MDL-UzL/L2R

6.5 复现成本估算

路线 数据获取 算力 人力 可达结果
TCIA 源数据自建 183 GB 下载+自写预处理 单卡可训 NLST 级别 1-2 周工程 自建任务包,指标需自行对齐官方
官方包+MONAI tutorial 平台注册下载 单卡(tutorial 默认配置) 1-3 天 NLST 本地训练+验证集评测
在线打榜 平台注册+Docker 打包 组织方 GPU(test 期) 1 周(含 sanity check) 官方排行榜位次与全部指标
OncoReg type 3 邮件申请(不发放数据) 自备训练算力 按申请流程 隐藏集评测分数(持续开放)

成本估算的基准假设:单卡(≥16 GB 显存)可完成 NLST 级训练与 ThoraxCBCT 推理;官方排行评测的算力由组织方承担;OncoReg type 3 的重训练在组织方指定 GPU(RTX 4000 SFF Ada 20GB)上统一执行——参赛者本地算力只影响开发迭代速度,不影响最终评测公平性。这是"评测即服务"在算力维度的体现:把硬件差异从排名变量里剔除。

6.6 库内 AI-Ready 光谱中的位置

对照库内其他条目的 AI-Ready 形态,Learn2Reg 2023 占据一个独特象限:

条目 数据形态 开放度 评测设施
本条目 Learn2Reg 2023 挑战赛任务包+隐藏层 中(三层混合) 满分型(排行榜+评测代码+统计排名)
TCIA 源数据系(如 lctsc) 原始 DICOM 高(CC BY) 无
大模型预训练系(如 abdomenct-1k) 大规模重采样包 高 无
请求制系(如掩码 upon request 类) 标注件 低 无

一句话:Learn2Reg 是库内"数据开放度中等、评测开放度最高"的样本——它把开放性花在评测与代码上而非全部标注上。检索者若目标是"训练数据",走 TCIA 源层;若目标是"方法对比",走任务包+排行榜。两种目标对应两种 AI-Ready 读法,条目 §6.1 的三层表是分流器。

§7 生态与谱系:从 tutorial 到 CodaBench

7.1 八年路线图

年份 形态 关键内容
2019 MICCAI 深圳 Learn2Reg Tutorial 专家讲座+实操——社区启蒙,非竞赛
2020 首届 challenge(Type 1) 六数据集雏形+开源评测/排名代码
2021 第二届(Type 1) 同六任务(Lung CT/OASIS/CuRIOUS/Abdomen CT-CT/Abdomen MR-CT/Hippocampus),两届合计 20+ 队/65+ 方法
2022 第三届(MICCAI workshop) 引入 NLST;试验 Type 3(全隐藏);自配置赛制起步
2023 第四届(本条目) NLST 扩展两阶段制+双专家 landmark+TREnodules;新增 ThoraxCBCT;OncoReg spin-off 启动
2024 第五届 三新任务:ReMIND2Reg(术中超声,Harvard/BWH Reuben Dorent 组)、LUMIR(大规模脑异患者,JHU Junyu Chen 组)、COMULISglobe SHG/BF(显微镜——首个显微配准基准)
2025 第六届 LNCS proceedings 出版(DOI 10.1007/978-3-032-25169-5)
2026 第七届(MICCAI Strasbourg) 迁至 CodaBench 托管;Task 1 PSMAReg(与 SNMMI 合作);Task 2 Learn2Breath(COPDGene)

路线图的两条主线一目了然:任务面从"六任务平台"(2020-2021)收窄为"双任务深耕"(2023)再扩张为"三任务+显微"(2024)与"学会联办双任务"(2026);制度面从 Type 1 一路推向 Type 3,平台从 grand-challenge 自研页迁到 CodaBench 引擎。每一步都保留上一届的任务作为历史包持续开放——"加法式演进、不减法退役"是 Learn2Reg 数据资产八年不缩水的直接原因。

7.2 2026 届的两个新任务:路线图的下一站

2026 届的选题继续沿"临床科室真实痛点"推进,且首次与专业学会联合办赛:

  • Task 1 PSMAReg(与 SNMMI 核医学与分子影像学会合作,Junyu Chen 主导):治疗前-随访全身 PSMA PET/CT 纵向配准,服务治疗计划、剂量测定与疗效评估。规模:训练+验证 597 例 PET/CT(378 名患者,其中 164 名有两次以上随访);测试 262 例(131 名患者)。难点:治疗前后解剖变化、多模态表观差异、PET 定量保持——"形变不能破坏 SUV"是核医学版的 SDlogJ 困境。
  • Task 2 Learn2Breath(与 COPDGene 多中心研究合作):吸气-呼气胸部 CT 配准,服务肺生物力学与疾病进展量化。规模:200 对训练+10 对验证;测试 100 对(体积差 ≥2 L 的重度病例)。COPDGene 的慢阻肺人群把"大形变"推向极端——2 升的肺体积差比 NLST 的常规呼吸差更陡峭。

这两任务都标注了"internally acquired"测试集——组织方持有的内部采集数据做测试,公开部分只到验证为止:隐藏评测的范式已经完全内化。共性也值得记:PSMAReg(核医学纵向)与 Learn2Breath(呼吸力学)都把"公开训练+隐藏测试+临床学会背书"三件套齐装满员——Learn2Reg 2023 年立下的"临床相关性优先"路线至此完成制度化。

7.3 OncoReg:从 ThoraxCBCT 长出的肿瘤学分支

OncoReg 是 2023 届的直接衍生品,两步走:

  • 第一步(type 1/2):MICCAI 2023 后即启动,围绕 ThoraxCBCT 与扩展 NLST(加病灶标注)公开竞赛——本条目 §4 的结果表即此阶段产物。
  • 第二步(type 3):2023-12-06 kickoff,把 ThoraxCBCT 换成完全隐藏的私有数据——UKSH(石勒苏益格-荷尔斯泰因大学医院)放疗科常规采集的 25 名肺癌患者(27 例、每例 2 配对),3-fold CV 划分(15/3/9),256×192×192@1.5mm,52 结构半自动掩码、平均 25 landmarks/对、ConvexAdam 导出 keypoints、呼吸相位不同步(比 ThoraxCBCT 更贴近真实摆位场景)。深度学习方法以重训练方式参赛(组织方统一在 NVIDIA RTX 4000 SFF Ada 20GB 上重训练与评测),2024-02-20 虚拟 winter workshop 收官,DINO-Reg Ensemble 夺冠(TRE 与 DSC 双第一),VoxelMorph++ 与 ConvexAdam 跟进,传统 DeedsBCV/NiftyReg 垫底——域外真实数据上,学习式与混合式进一步拉开差距。

OncoReg 的意义在证明了一条"基准孵化"路径:公开任务(ThoraxCBCT)积累方法与信任 → 私有隐藏数据(type 3)检验域外泛化 → MELBA 特刊沉淀论文。官方宣称的初心也值得一记:全球每年超过 170 万人死于肺癌——配准的精度直接决定放疗剂量画在哪。

ThoraxCBCT(公开)与 OncoReg type 3(私有)的规格对照(OncoReg 论文 Table 1):

项目 ThoraxCBCT(公开) OncoReg type 3(私有)
例数 19 例(2 对/例=38 对) 27 例(2 对/例),3-fold CV 15/3/9
患者来源 TCIA 4D-Lung(试验性采集) UKSH 常规放疗临床数据(25 患者)
呼吸相位 同步(FBCT 吸气/CBCT 呼气,受控) 不同步(真实摆位,相位随机)
图像规格 390×280×300 @1.0 mm 256×192×192 @1.5 mm
掩码 13 结构(部分标注) 52 结构(全量标注)
Landmarks 平均 16/对 平均 25/对
Keypoints 导出 DeedsBCV ConvexAdam
获取 平台注册下载 仅评测服务

这张对照表是"公开基准→真实域外"鸿沟的量化呈现:结构数翻四倍、landmark 密度提高 56%、呼吸相位从受控变随机——公开榜上的好成绩迁移到 type 3 隐藏集时出现了明显衰减(冠军易主为 DINO-Reg Ensemble,传统方法垫底)。做临床部署预期管理时,这张表比任何排名都更直接。

对 2023 届本身的定位,这张表也给出一个注脚:ThoraxCBCT 公开包的成绩(冠军 DSC 70.16%)应读作"该任务的上界参考"而非"临床可达成水平"——OncoReg 论文正是用私有域外数据标定了这段差距,这也是 Learn2Reg 系条目在库内特有的"自带域外对照"优势。

7.4 影响力外溢

  • NLST 成为胸 CT 配准的事实基准:2025 年的 MICCAI 配准新方法论文(如隐式形变/可学习核方法)仍以"Learn2Reg 2023 挑战赛的 NLST 数据"报告 TRE/TRE30/SDlogJ,并直接对标 uniGradICON、ModeT、H-ViT、NICE-Trans、WiNet 等历史成绩——一个挑战赛数据集变成独立存在的方法学舞台。
  • 评测代码的公共品化:Wilcoxon 显著性排名、零位移场 sanity check、位移场 I/O 规范——L2R 仓库的这套工具被后续配准类挑战赛反复借用;grand-challenge 的 algorithm 容器模式(corrField 等公开算法页)也成了"论文方法可直接调用"的先例。
  • “训练即提交”(phase 2 代跑训练 Docker):2023 年在 NLST 上的制度实验,为 Type 3 赛制成熟铺路,也预演了 2024/2026 届的大规模隐藏评测。
  • 组织团队的连续性:Heinrich(Lübeck)—Hering(Radboudumc/Fraunhofer MEVIS)组合贯穿 2020-2023;2024 起 JHU 的 Junyu Chen 团队接管主导,Hering/Heinrich 转为共同组织——基准的代际交接在医学 AI 领域罕见地平稳完成。
  • MONAI/nnU-Net 生态的标准化效应:官方 tutorial 与 nnU-Net 特征接口让"配准新方法"的进入门槛降到"会训分割网络"的水平——2024 届参赛队的背景多样性(含纯放疗科团队)可部分归功于此。
  • 对其他影像挑战赛的反哺:TREnodules(任务指标临床化)与 phase 2 代跑训练(防泄漏制度化)两项设计被后续非配准类挑战赛讨论与效仿——Learn2Reg 的赛制输出已成为 grand-challenge 社区的公共知识。
  • 开放评测代码的示范效应:把评测与排名代码(连零位移场 sanity check)作为一等公民发布,让"挑战赛结束即失明"的常见病在本系列不存在——2023 届的每一次排名变动今天仍可独立复算,这在对时间敏感的系统综述里价值极高。

7.5 grand-challenge 平台机制速览

Learn2Reg 的持续运营依托 grand-challenge 平台的一套机制,理解它们有助于解读页面行为:

机制 表现 对检索者的含义
challenge 归档 主站导航含 Archive(L2R’20 至 L2R’25 各任务独立入口) 历届结果从归档进,不混在现页
leaderboard 快照 各任务榜独立 URL(如 evaluation/thoraxcbct/leaderboard) 引用时给出具体榜 URL+日期
删除线标记 L̶2̶R̶’̶2̶2̶ ̶N̶L̶S̶T̶ 表示已弃用版本 弃用榜数字勿再引用(坑 8)
algorithms 容器页 corrField 等 baseline 有公共 algorithm 页 不参赛也能一键调用 baseline
论坛 数据发布/FAQ 帖(部分登录墙) 登录墙内容以公开页与论文为准
CodaBench 迁移 2026 届起比赛引擎换为 CodaBench 老 API/自动化的引用者注意接口变化

7.6 出版物轨迹

年份 出版物 载体
2022/2023 TMI 基准论文(2020-2021 届总结) IEEE TMI 42(3):697-712
2025 2024 届总结+NLST 2023 结果 MELBA 2025:034(DOI 10.59275/j.melba.2025-gc8c)
2025 2025 届 proceedings Springer LNCS(DOI 10.1007/978-3-032-25169-5)
2026 OncoReg 论文(ThoraxCBCT 规格+结果) MELBA 特刊/arXiv 2503.23179
2026 2026 届启动 CodaBench + MICCAI Strasbourg
持续 NLST 对标文献流 MICCAI/IPMI 等新方法论文的基准表

这条轨迹本身是个信号:Learn2Reg 选择"每届沉淀一篇开放式期刊总结"(MELBA)而非"只发 LNCS 会议短文"——总结论文里带着完整的排行数据表,这正是 2023 届数字今天仍可精确引用的原因。

§8 使用指南:三条复现路线与 12 项检查

8.1 三条复现路线

路线 A——源数据重建(最彻底):从 TCIA 拉 NLST/4D-Lung 原始 DICOM → 按官方预处理(重采样、配对、预对齐)自建 → 用 L2R 仓库评测代码算指标。适合要做方法学审计或扩展标注的团队;成本最高。注意 4D-Lung 的 DICOM 含全部 10 个呼吸相位与 RTSTRUCT,任务包只取了最大吸气/呼气相——自建时先明确你要哪个相位的子集。

路线 B——任务包直训(最常用):grand-challenge 注册下载 NLST2023.zip / ThoraxCBCT 包 → MONAI tutorial 跑通 NLST 基线 → 换自己的模型 → 验证集本地评测。NLST_dataset.json 的 training_paired_images 字段即配对清单;tutorial 的 transform 链把 keypoint 变换放在最后加载——这是容易踩的工程细节。

路线 C——在线打榜(最省心):注册 grand-challenge → 验证期上传位移场拿实时排名 → 测试期(持续开放的历史任务)提交 Docker。注意打榜前先用零位移场文件做 sanity check,评测管线不通是最常见的第一晚翻车原因。

8.2 提交物规格:位移场与 Docker

位移场(Type 1 与验证期):

  • 3D 位移场,NIfTI 格式,与 fixed 图像同网格;
  • 单位为毫米(与体素间距解耦——评测代码按 mm 计 TRE);
  • 在整个体积上评测(官方口径:evaluation across the full volume);
  • 提交前用仓库提供的零位移场文件做管线自检——零场应得 initial TRE(NLST 10.40 mm / ThoraxCBCT 11.91 mm),对不上说明坐标系或方向有错。

Docker(Type 2):

  • grand-challenge algorithms 平台容器规范(输入/输出接口声明);
  • 组织方统一 GPU 评测并记录 runtime(runtime 参与 2023 排名叙述但 OncoReg type 3 明确不计分);
  • NLST phase 2 的训练 Docker 还要包含训练入口——组织方在隐藏数据上代跑训练。

runtime 的评测口径(跨届可比性说明):

届次 硬件口径 是否计分
2020-2021 未统一约束(TMI 论文自述为设计局限) 否
2023 组织方统一 GPU、Docker 实测 计入排名叙述
OncoReg type 3 NVIDIA RTX 4000 SFF Ada 20GB 明确不计分
2026 CodaBench 引擎(口径随任务页披露) 以任务页为准

位移场提交的高频错误清单(来自零场 sanity check 的设计动机):

  1. 坐标系搞反(RAS/LPS)——TRE 变得比未配准还大或出现负向偏移;
  2. 单位搞错(体素 vs 毫米)——1.0 mm 体素的任务上误差恰差一个 spacing 倍数,最易漏检;
  3. 网格错位(位移场与 fixed 图像仿射不一致)——评测端重采样后整体错位;
  4. 方向翻转(z 轴上下颠倒)——肺任务上"膈肌顶"跑到"肺尖";
  5. 形变场折叠未检查——Dice 可能尚可但 SDlogJ 崩坏,几何平均被拖垮。

前四类都会被零场自检直接暴露(零场应精确复现 initial TRE),第五类要靠自己的 SDlogJ 预检——官方把 zero-deformation fields 文件放进仓库就是为此。

8.3 TCIA 源数据下载操作要点

走源数据层时的实用要点:

  • 4D-Lung:收藏页提供两种入口——全量包(.tcia 清单文件,配 TCIA Data Retriever 下载,183.04 GB)与 IDC 云检索(portal.imaging.datacommons.cancer.gov,按 collection_id=4d_lung 过滤)。自建 ThoraxCBCT 口径需取每患者的 planning FBCT(吸气相)+ 疗程首尾 CBCT(呼气相)——先读 Hugo 2017 论文的相位定义再动手。
  • NLST:体量远大于 4D-Lung,按受试者检索;挑战赛包只取了其中一小部分配对,自建配对要自己定义"吸气-呼气"判据(挑战赛口径未逐步公开,完全复刻 170/10/30 的切分不可行——这也是优先用官方包的理由)。
  • 通用:TCIA 下载强制要求引用数据 DOI 与指定论文(收藏页 Citations 节),商用另核 TCIA 数据使用政策。

下载排障三则:一、TCIA Data Retriever 对大清单(4D-Lung 6,690 series)会分批断点续传,日志里 series 级重试属正常;二、IDC 云入口适合只要子集的场景(按 collection_id=4d_lung 过滤后可导出选定 series),比全量 183 GB 轻得多;三、两条入口的 DICOM 内容一致但打包方式不同,比对来源时认 UID 不认文件名。

8.4 基于 Learn2Reg 数据的研究检查清单(12 项)

  1. 口径先行:引用规模数字时注明口径——NLST 210 对(170/10/30)是挑战赛包口径,SAMCL 等文献的 147/21/42 对是自述重采样口径(坑 4)。
  2. 层数分离:TCIA 源数据(20 患者/183 GB)与 ThoraxCBCT 任务包(19 例/38 对)不是一个东西(坑 3),规模、license、引用对象都要分层。
  3. baseline 识别:读榜先认身份列——ConvexAdam/corrField/MONAI/NiftyReg 是官方 baseline,"第一名"与"官方冠军"可能不同人(坑 6)。
  4. 届别对齐:NLST 2023 结果出自 2024 总结论文;learn2reg.github.io 上是 2020-2022 旧榜;grand-challenge 现页是 2026 版——先确认届别再引数字(坑 1、坑 2、坑 8)。
  5. 指标四件套:报 TRE 必须同时报 TRE30(鲁棒性)与 SDlogJ(合理性),单指标叙述会被审稿人抓住。
  6. 显著性检验:宣称"A 优于 B"前自查 Wilcoxon p<0.05 是否成立——Learn2Reg 的 rank 体系只认显著差异,小样本任务(ThoraxCBCT 验证集仅 6 对)尤甚。
  7. 预对齐依赖:ThoraxCBCT 附带人工大平移校正、NLST 附带仿射预对齐——你的方法若从零处理原始 DICOM,成绩不与榜上直接可比。
  8. 呼吸相位语义:FBCT=吸气相、CBCT=呼气相是任务设定而非数据缺陷;跨相位大形变是特性,不要"矫正"掉。
  9. keypoints 的来源:ThoraxCBCT 的配对 keypoints 由 DeedsBCV 导出——用它们做自监督训练会把 Deeds 的偏差带进你的模型,做方法学对比时应声明。
  10. 掩码的半自动属性:13 结构掩码经 TotalSegmentator 生成+配准传播+UKSH 医生验证——是"半自动金标准",不是纯手工;OncoReg 私有集才是全量标注(52 结构)。
  11. 许可分层:源数据 CC BY(4.0/3.0)≠ 预处理包可再分发;衍生数据发布前核对 §6.2 五条。
  12. 引用完整:数据引 TCIA DOI,任务设计引 Zenodo 7844799,结果表引 MELBA/arXiv 2509.01217 与 arXiv 2503.23179——三个来源缺一不可。

8.4 常见误区 FAQ

Q:我能在自己论文里说"在 Learn2Reg 上达到 SOTA"吗?
能,但要写清任务、届别、指标与是否含 baseline 对比;"SOTA"若来自在线提交,注明提交时间与排行榜版本——排行榜是活的。

Q:验证集能用来调参吗?
赛制允许(验证期每日多次提交就是明示),但 test 成绩的泛化责任自负——验证集 6-10 对的小样本意味着"调到验证最优"很容易过拟合,排名里的 Wilcoxon 检验部分就是为了吸收这种噪声。

Q:NLST 的训练对能和其他肺数据集(如 LIDC/库内 luna16 系)混训吗?
数据层面无禁止,但混训后模型不再是"L2R NLST 口径"的参赛者,成绩与榜上不可比;方法学研究可自由混训,基准对比要守口径。

Q:ThoraxCBCT 的两个配对要分开建模吗?
官方按 2 对/例评测(时间相近对+数月对),两类错位难度不同;论文报告细分对成绩(T0 vs END)是加分项——OncoReg 论文即按此展开讨论。

Q:runtime 怎么测才有效?
只在 Type 2 Docker 通道有意义(组织方统一硬件);自己电脑上测的秒数没有基准可比性。

Q:我可以只报验证集成绩发论文吗?
技术上可以(验证集公开),但审稿风险高——验证集只有 6-10 对,且与 test 同分布;稳妥写法是"验证集本地评测 + 在线平台正式评测"双口径。

Q:Learn2Reg 的排名代码能用在非医学数据上吗?
能,ranking 代码只依赖逐案例分数矩阵与 Wilcoxon 检验;移植时注意其"未提交记 0.1 分"的约定是否适配你的场景。

Q:2023 届的 Docker 还能跑吗?
部分 baseline(corrField 等)有常驻 algorithm 页可调用;参赛者的 Docker 依平台策略保留,运行环境(驱动/CUDA)随平台演进可能需适配——引用 runtime 数字时注明届次硬件。

8.5 快速上手:跑通 NLST 基线的步骤清单(不含训练,约半天)

  1. 注册 grand-challenge 账号,加入 Learn2Reg challenge(Join);
  2. 从 Datasets 页或任务页获取 NLST2023 下载入口(遇 401 走平台内链,坑 5);
  3. 解包后核对 NLST_dataset.json:training_paired_images 应有 170 条、validation 10 条;
  4. 打开 MONAI tutorial notebook(3d_registration/learn2reg_nlst_paired_lung_ct.ipynb),按其 transform 链(keypoint 变换最后加载)载入验证集;
  5. 用仓库提供的 zero-deformation field 先跑一遍评测:TRE 应接近 10.40 mm(未配准基线)——对不上先查坐标方向,不要开训;
  6. 换任意可用模型(或 MONAI baseline)在验证集上出第一版 TRE/TRE30/SDlogJ 三指标;
  7. 与官方 NLST 榜单(TRE-LM/TRE-KP/SDlogJ 组)对照定位自己处于 0.1-1.0 rank 的哪一段;
  8. 需要正式名次再走验证期上传/测试期 Docker(§3.1)。

ThoraxCBCT 同构:包内 11 train/3 val 例、掩码+keypoints 齐备,评测指标组换为 Dice/TRE-KP/HD95/SDlogJ;先跑零场(TRE 11.91 mm/DSC 29.04%)自检。

§9 库内互链网络:配准家族的检索面

Learn2Reg 2023 在本库中的位置是"配准挑战赛家族"的中枢节点,向下连接各解剖部位与模态的数据集条目:

库内条目(record_id) 关联逻辑 检索场景
chaos(337) 腹部 CT-MRI 跨模态多器官数据——Learn2Reg Abdomen MR-CT 任务的三源数据之一(CHAOS 名列其引用 Readme),跨模态配准同题 查"腹部 MR-CT 配准原料"
amos(76) 腹部 CT+MRI 多器官 500 例——跨模态跨中心腹部配准的自然延伸评测场 查"腹部多器官跨模态"
abdomenct-1k(402) 千例腹部 CT——异患者腹部配准可扩展训练池 查"腹部配准扩数据"
ctpelvic1k(465)/ ctspine1k(443)/ verse-spine(435) 盆腔/脊柱 CT 大样本——骨性结构配准与 ThoraxCBCT"骨结构掩码"路线同源 查"骨性解剖配准"
ct-rate(546) 纵隔淋巴结 CT——同患者跨期胸 CT 的另一形态 查"胸 CT 跨期随访"
rider-lung-ct(267)/ lctsc(277) TCIA 肺部 CT——与 NLST/4D-Lung 同库同源的放疗与随访场景 查"TCIA 肺放疗数据"
pddca(454) DIRLab POPI 4DCT——肺 4D 配准的前代基准,100 landmarks 传统直接可比 查"肺配准老基准"
fetreg(343) 胎儿 MRI 配准挑战——MICCAI 配准挑战家族的产科分支 查"配准挑战赛家族"
hecktor(461)/ hecktor2026(638) 头颈 PET-CT/CBCT 配准挑战——同"跨模态+放疗"配方 查"头颈放疗配准"
autopet(468)/ autopet-v(634) 全身 PET-CT 自配准挑战——SUV 保持与形变合理性的同类矛盾 查"核医学配准"
reg2026(639) 配准方向后续挑战条目——届次演进链的下一环 查"配准挑战 2026"
totalsegmentator(422) ThoraxCBCT 掩码生成与体干掩码的直接工具——标注流水线依赖 查"标注工具链"
synthrad(671) 跨模态合成(MR→CT 等)——ThoraxCBCT 的 SynDeeds"合成后配准"路线的姊妹问题 查"跨模态合成替代配准"
nih-pancreas-ct(367) 腹部 CT 小结构标注——异患者腹部任务的补充评测面 查"腹部小结构"
fastmri(23) 快速 MRI 重建——序列级对齐问题的近亲领域 查"跨模态重建-配准交界"
duke-breast-mri(440) 乳腺 MRI——异模态异患者对齐的候选延伸域 查"乳腺影像配准延伸"

互链叙事三则:

  1. "挑战赛家族"横向链:pddca(2010s,传统 landmark)→ fetreg/hecktor(2020s,跨模态专科化)→ Learn2Reg(平台化多任务)→ reg2026/hecktor2026(延续)——一条"配准评测基础设施化"的完整时间线。
  2. "工具-数据"纵向链:totalsegmentator 既是独立条目又是 ThoraxCBCT 标注管线的零件——标注工具与基准数据的共生关系在本库其他条目(如 nnU-Net 系)反复出现。
  3. "同题异解"链:跨模态对齐问题在 synthrad(生成式合成)、SynDeeds(合成+配准)、hecktor/autopet(直接配准)三条路线并存——检索者按问题而非按数据集检索时,这组互链最有价值。

9.2 三条检索路径(按读者目的分流)

按解剖部位走:

  • 胸/肺:本条目(NLST/ThoraxCBCT)→ pddca(454) → rider-lung-ct(267) → lctsc(277) → ct-rate(546)
  • 腹部:chaos(337) → amos(76) → abdomenct-1k(402) → ctpelvic1k(465) → nih-pancreas-ct(367)
  • 脊柱/骨:verse-spine(435) → ctspine1k(443)(骨性配准与 ThoraxCBCT 骨掩码同域)
  • 头颈/脑:hecktor(461) → hecktor2026(638) →(脑异患者历史包 OASIS,见 §2.4)

按模态对走:

  • CT↔CT(跨期):NLST2023(本条目)→ pddca(454)
  • CT↔MR(跨模态):chaos(337) → amos(76) → synthrad(671, 合成路线)
  • CBCT↔CT(放疗):ThoraxCBCT(本条目)→ hecktor(461)
  • PET↔CT:autopet(468) → autopet-v(634) →(2026 PSMAReg,见 §7.2)

按工具链走:

  • 分割→配准标注:totalsegmentator(422) →(本条目 §2.3.3 流水线)
  • 自监督对应点:ThoraxCBCT keypoints →(ConvexAdam/VoxelMorph++ 路线,§5)
  • 评测与排名:MDL-UzL/L2R →(附录 D 伪代码)
  • 跨模态合成替代:synthrad(671) →(SynDeeds 修图路线,§5.4)

三张路径图合起来覆盖了"我要做 X 配准"句式的大多数填空:X∈{部位}×{模态对}×{工具偏好}。每条路径的终点都是库内可下载数据或本条目的具体章节。

9.1 互链落点核对表(正文内链 5 处 + 表格 19 点)

按本库互链惯例,正文中至少 5 处出现库内条目内链语义(不依赖表格):

  1. §2.4 Abdomen MR-CT 的 CHAOS 来源 → 库内 chaos(rid 337);
  2. §2.3 标注流水线的 TotalSegmentator → 库内 totalsegmentator(rid 422);
  3. §4.4/§4.1 肺配准 landmark 传统与 DIRLab 前代 → 库内 pddca(rid 454);
  4. §5.4 SynDeeds"合成后配准" ↔ 跨模态合成 → 库内 synthrad(rid 671);
  5. §7.6/§7.1 挑战赛家族届次链 → 库内 hecktor2026(rid 638)、reg2026(rid 639)、fetreg(rid 343)。

表格版 19 点全景见上表。发布后由 link_builder 重建为导航链接。

§10 坑点清单:检索与复用必读的八则

坑 1:双官网并存,老站不可达且内容停在旧届
learn2reg.github.io 与 learn2reg.grand-challenge.org 长期并存:前者是 2020-2022 时代的老官网(本次核验中直连与 Wayback 快照均不可达),后者是现役主站——首页展示的却是 2026 届内容,2023 届信息藏在 Datasets、OncoReg 与归档页。检索 Learn2Reg 2023 若只看 github.io 或只看主站首页,都会拿错届别的信息。示例场景:有人在老站看到"Task 1-4"的四任务结构(2021 届),误当成 2023 届任务列表。处理:一律以 learn2reg.grand-challenge.org 为准,历史信息进归档页找。

坑 2:“Learn2Reg 2023 没有独立论文”——年份错配高发
Zenodo 记录(10.5281/zenodo.7844799,2023-04-19)只是挑战赛描述记录,不是论文;IEEE TMI 论文(10.1109/TMI.2022.3213983,2023;42(3):697-712)覆盖的是 2020-2021 届(六任务、20+ 队、65+ 方法);2022-2023 届的正式总结要等到 2024 届总结论文(MELBA 2025,arXiv 2509.01217)与 OncoReg 论文(arXiv 2503.23179)。示例场景:论文写"NLLST 2023 数据,方法见 Hering et al. TMI 2023"——引的却是 2021 届的任务与结果。处理:结果表按届别引对应来源——NLST 2023 表引 arXiv 2509.01217 §4.1.4,ThoraxCBCT 2023 表引 arXiv 2503.23179 Table 2。

坑 3:ThoraxCBCT ≠ 4D-Lung——规模引用必须分层
L2R 任务包只含 19 例(11/3/5,38 对),是 TCIA 4D-Lung 收藏(20 名局部晚期 NSCLC 患者、183.04 GB、347,330 幅图像)的子集重打包。把"20 患者/183 GB"当 ThoraxCBCT 任务规模引用,或把"19 例"当 4D-Lung 收藏规模引用,都会错。示例场景:数据管理平台把 4D-Lung 收藏页的体量字段直接填进"Learn2Reg ThoraxCBCT"条目。处理:规模分层表述——上游收藏 vs 下游任务包,两层各有 DOI。

坑 4:NLST 规模多口径并存
挑战赛预处理包口径:210 对(170 train/10 val/30 test)、224×192×224@1.5mm(MONAI 官方 tutorial、DEQReg 论文、数据目录站三源一致);SAMCL 论文(arXiv 2406.17575)写 294/42/84 幅图像(=147/21/42 对,自述 3mm 重采样口径);2023 扩展版又叠加隐藏数据与双专家 >100 landmarks/例。示例场景:两篇综述引用 NLST 规模相差 40%,各自都没错——只是口径不同。处理:默认引用 210 对(170/10/30)并注明"挑战赛包口径";见到其他数字先问预处理口径。

坑 5:Lübeck 云下载直链返回 401
Datasets 页挂的三个下载直链(cloud.imi.uni-luebeck.de/s/…/download)在未登录状态 HEAD 探测均返回 401——链接需要平台会话或已轮换。裸链下载会失败。示例场景:脚本化的数据管道把 Datasets 页直链写死,部署后整链失败。处理:经 grand-challenge 平台注册进入;源数据走 TCIA 公开直链不受影响;自动化管道应对 401 做人工介入降级。

坑 6:“谁是 ThoraxCBCT 冠军”——baseline 与参赛者必须区分
官方结果表里 ConvexAdam 总 rank 0.710 高于 SynDeeds 0.705,但 ConvaxAdam 是组织方提供的 baseline、不参评;官方冠军是 SynDeeds(DSC 70.16%、TRE 6.01 mm)。NLST 任务同理——corrfield(0.670)是官方 baseline。示例场景:新闻稿写"ConvexAdam 赢得 2023 ThoraxCBCT"——方法上说得通(rank 最高),赛制上是错的。处理:叙述冠军时写"官方冠军 SynDeeds(组织方 baseline ConvexAdam 未参评)",勿省略括号里的半句。

坑 7:license 三层混合,没有统一答案
NLST 源数据 CC BY 4.0、4D-Lung 源数据 CC BY 3.0、挑战赛预处理包平台注册制无统一开放 license、test 标注 upon request、评测代码仓库无 LICENSE 文件、Zenodo 各记录另有标注。示例场景:把 NLST2023.zip 重打包上传到第三方数据仓库——预处置包层没有授权再分发的明确许可。处理:按 §6.2 五层分别声明;衍生数据发布前的最小安全集=只用 TCIA 源层并附完整引用链。

坑 8:三个"NLST 榜"指标互不相同,勿混
grand-challenge 排行榜侧栏里"L̶2̶R̶’̶2̶2̶ ̶N̶L̶S̶T̶"(删除线=2022 版已弃用)与"NLST"(2023 版)并存:前者指标 TRE(LM)/SDlogJ/TRE(KP),后者 Dice/TRE(KP)/HD95/SDlogJ;而 2024 论文 Table 1 的 NLST 2023 结果表用 TRE/SDlogJ/Rank 三列。三个榜的队伍、指标、届别都不同。示例场景:把 2022 榜的 TRE-LM 数字与 2023 论文表的 TRE 直接对比,得出"方法退步"的错误结论。处理:引用任何 NLST 数字时注明"哪一届+哪个指标组+哪个来源"。


附录 A:核验时点与抓取存照

项目 时间/结果
本条目抓取与核验时点 2026-09-26(北京时间)
grand-challenge Datasets 页 成功抓取(HTML 51,854 B),确认 L2R-2023 两数据包与 license 引用
grand-challenge 主页 成功抓取,展示 2026 届+组织者名单+出版物列表
grand-challenge OncoReg 页 成功抓取,确认 spin-off 时间线与组织者五人
Zenodo 7844799 成功抓取(WebFetch),确认 v1 2023-04-19、作者三机构、Task 1/3 创新描述
TCIA 4D-Lung 收藏页 成功抓取(WebFetch),确认 20 患者/183.04 GB/CC BY 3.0
arXiv 2509.01217(v3 全文 HTML) 成功抓取(243,755 B),提取 NLST 2023 结果表与沿革段落
arXiv 2503.23179(ar5iv 全文) 成功抓取(152,928 B),提取 ThoraxCBCT Table 1/2 与 type 3 规格
learn2reg.github.io 直连与 Wayback 均失败(网络层阻断)——存照不引用
grand-challenge L2R23 data release 论坛帖 Forbidden(登录墙)——存照
Uni Lübeck 云三下载直链 HEAD 均 401——存照
GitHub MDL-UzL/L2R 主页与 ranking 目录 成功抓取(WebFetch),确认排名规则与 L2R23 snapshot notebook
MONAI NLST tutorial(jsdelivr CDN 镜像) 成功抓取(707,504 B),确认使用 NLST2023.zip+NLST_dataset.json
huggingface 主站/hf-mirror 未使用(无官方 HF 镜像需求;无 Learn2Reg 官方 HF 数据集)

核验覆盖度小结:官方侧(grand-challenge 三页+Zenodo)与学术侧(TMI/MELBA/OncoReg 三论文)全部直抓成功;数据上游(TCIA 两收藏)直抓成功;不可达项(老官网、论坛帖、Lübeck 云直链)均已定位并给出替代路径——核心数字无一条单源孤证。登录墙与 401 项不影响已发布事实,只影响"一手复算",已在坑 2/坑 5 处理。

附录 B:三源核验登记表(核心数字)

# 核心事实 源 1 源 2 源 3 结论
1 2023 届两任务=NLST 扩展+ThoraxCBCT Zenodo 7844799(Task 1/3 创新) Datasets 页(New L2R-2023 两包) learn2reg-test 页(“two tasks: Extended NLST and ThoraxCBCT”) 三源一致
2 ThoraxCBCT 19 例/38 对(11/3/5) arXiv 2503.23179 正文 同文 Table 1 4D-Lung TCIA 页(上游 20 患者自洽) 一致
3 4D-Lung 上游 20 患者/183.04 GB/CC BY 3.0 TCIA 收藏页 Datasets 页引用(DOI+CC BY 3.0) Hugo 2017 论文 DOI(10.1002/mp.12059) 一致
4 NLST 源 CC BY 4.0 Datasets 页 TCIA NLST DOI 记录 NEJM 2011 引用链 一致
5 NLST 2023 结果表(LapIRNv2 1.441mm/rank 0.800 等) arXiv 2509.01217 §4.1.4 Table 1 grand-challenge NLST leaderboard 指标组(TRE-LM/TRE-KP/SDlogJ) 双专家 >100 landmarks 表述(同文) 一致(表为官方口径)
6 ThoraxCBCT 2023 结果表(SynDeeds 0.705/ConvexAdam baseline 0.710) arXiv 2503.23179 Table 2 OncoReg 官方页(三方法 workshop 叙事) ThoraxCBCT leaderboard 指标组(Dice/TRE(KP)/HD95/SDlogJ) 一致
7 test 窗口 2023-09-14 至 09-29 learn2reg-test 页 Zenodo 记录(两阶段设计) OncoReg 论文 Validation/Test Phase 描述 一致
8 2020-2021 两届 20+ 队/65+ 方法 TMI 论文摘要(PubMedID 36264729) arXiv 2509.01217 §2.2 Stanford Health Care 论文页 一致
9 NLST 包 210 对(170/10/30)@224×192×224/1.5mm MONAI tutorial(NLST2023.zip) DEQReg 论文转述 数据目录站(selectdataset) 三二手源一致(一手直链 401,存照)
10 2026 届 PSMAReg 597/262、Learn2Breath 200/10/100 grand-challenge 主页 CodaBench 任务链接 SNMMI 合作表述 一致
11 OncoReg type 3 数据 25 患者/27 例/3-fold OncoReg 官方页(kickoff 日期) arXiv 2503.23179 Table 1 grand-challenge OncoReg 页收官叙事 一致
12 排名规则(Wilcoxon p<0.05+几何平均+0.1 下限) MDL-UzL/L2R ranking readme 2024 论文(Antonelli et al. Medical Decathlon 引用) 附录 D 伪代码与 ThoraxCBCT 实测位次互洽 一致

附录 C:任务包数据字典

NLST2023(NLST_dataset.json + NIfTI 对)

字段/文件 类型 语义
training_paired_images[].fixed / .moving NIfTI 路径 吸气相(fixed)/呼气相(moving)224×192×224@1.5mm
training_keypoints / validation_keypoints JSON 配对解剖关键点(双专家 >100/例,2023 扩展)
lung masks NIfTI 肺掩码(Dice 类评测/预筛用)
displacement field(提交物) NIfTI/.nii.gz 3D 位移场(mm),评测接口唯一输入
test 集监督 隐藏 landmark/结节/靶结构标注仅组织方持有(TRE/TREnodules 在线评测)

ThoraxCBCT(打包 NIfTI)

字段 类型 语义
image(FBCT/CBCT ×2) NIfTI 390×280×300@1.0mm 治疗前 FBCT(吸气)+ 疗程首尾 CBCT(呼气)
label mask NIfTI 半自动 13 结构(肺、肿瘤、OAR、骨结构;TotalSegmentator+配准传播+UKSH 验证)
landmarks CSV/JSON 手动解剖标志点(平均 16/对,全躯干)
Förstner keypoints JSON DeedsBCV 位移场导出的配对关键点(自监督用)
body trunc mask NIfTI 体干二值掩码(背景分离)
zero-deformation field NIfTI sanity check 用零位移场(L2R 仓库)

标注质量的独立评估建议(使用者的尽调清单):

  • 掩码层是"TotalSegmentator 自动+传播+UKSH 医生验证"的半自动产物——用前抽 5-10 例做目视 QA,重点看配准传播到 CBCT 的边界(膈顶、心脏缘);
  • landmarks 为纯手动(平均 16/对),但未公开标注者间一致度——对 TRE 的解释要留"金标准本身有方差"的余量;
  • keypoints 由 DeedsBCV 导出,属于"模型生成的伪真值"——用它训练的模型上限受 Deeds 精度约束,对比实验时建议同时保留 landmark 评测;
  • 两个子任务(t0 对 vs end 对)的难度结构不同——分拆报告比合并平均更有信息量(OncoReg 论文即如此处理)。

附录 D:排名机制伪代码(L2R ranking 目录口径)

for metric in task.metrics:
    for a, b in pairs(submissions):
        p = wilcoxon_signed_rank(scores[a][metric], scores[b][metric])
        if p < 0.05: wins[better(a,b)] += 1
    metric_rank[m] = 0.1 + 0.9 * normalize(wins)   # 0.1-1.0,并列共享
task_rank = geometric_mean(metric_rank.values())   # 任一指标崩盘即拖垮总分
未提交者: metric_rank = 0.1
baseline 方法: 计 rank 展示,不参与冠军评定

排名实例演算(以 ThoraxCBCT 2023 的 Fourier-Net 为例):TRE 4.03(第一)+ TRE30 3.85(第一)贡献两个高 rank,但 DSC 61.91(倒数)与 HD95 47.80(倒数)贡献两个低 rank,SDlogJ 0.07(次低)中等——几何平均后 0.535,被"每项都在前排"的 SynDeeds(0.705)反超。这就是"没有任何单一指标能抓住配准质量"的数学化表达。

附录 E:检索路径示范

目标 推荐查询式 预期命中
2023 官方记录 Learn2Reg Challenge 2023 Zenodo / DOI 10.5281/zenodo.7844799 记录页(含全文描述)
2023 结果表 Learn2Reg 2024 NLST results / arXiv 2509.01217 MELBA/arXiv §4.1.4
ThoraxCBCT 规格 ThoraxCBCT OncoReg 4D-Lung / arXiv 2503.23179 OncoReg 论文 Table 1/2
源数据 TCIA NLST HMQ8-J677 / TCIA 4D-Lung ELN8YGLE TCIA 收藏页
评测代码 github MDL-UzL L2R ranking 仓库(evaluation/ranking/zero fields)
训练样板 MONAI tutorial learn2reg NLST paired lung CT 3d_registration notebook
历史六任务 Learn2Reg TMI 10.1109/TMI.2022.3213983 / Zenodo 3835682 TMI 论文+合集
2026 届 Learn2Reg 2026 PSMAReg Learn2Breath CodaBench grand-challenge 主页
论文复用案例 “Learn2Reg NLST” TRE TRE30 SDlogJ MICCAI 2025 新方法论文的 NLST 对标表
OncoReg type 3 OncoReg challenge UKSH type 3 / arXiv 2503.23179 OncoReg 论文 §3-4
MONAI 训练样板 MONAI tutorial learn2reg NLST jsdelivr/项目 MONAI tutorials
排名规则原文 MDL-UzL/L2R ranking readme GitHub 仓库

检索卫生两条:一、凡引用 Learn2Reg 数字先问"哪一届+哪个任务+哪个来源"(坑 2/坑 8);二、grand-challenge 论坛帖与 test 站有登录墙,抓不到的内容以已公开的 Datasets/OncoReg 页与论文为准,勿以讹传讹。

附录 F:双口径登记表

# 项 口径 A 口径 B 处理
1 NLST 规模 210 对(170/10/30,挑战赛包/MONAI/DEQReg) 147/21/42 对(SAMCL 3mm 重采样自述口径) 按 A 引用并注口径
2 ThoraxCBCT 规模 19 例/38 对(L2R 任务包) 20 患者/183.04 GB(TCIA 4D-Lung 上游) 分层各自引用
3 ThoraxCBCT 第一名 SynDeeds(官方冠军,rank 0.705) ConvexAdam(rank 0.710,组织方 baseline 不参评) 双写+身份注明
4 “Learn2Reg 论文” TMI 2023(42(3):697-712,覆盖 2020-2021) MELBA 2025(含 2022-2023 总结) 按届别引用
5 官网 learn2reg.grand-challenge.org(现役) learn2reg.github.io(老站,本次不可达) 以 grand-challenge 为准
6 参赛规模 20+ 队/65+ 方法(2020-2021 两届合计,TMI 口径) 各届单独数字(未系统披露) 只引合计口径
7 runtime 地位 NLST 2023 计入排名叙述 OncoReg type 3 明确不计分 注明届别口径

数字漂移说明:本条目所有排行与规模数字固定于 2026-09-26 抓取时点;Learn2Reg 排行榜为活系统,新提交会改变相对位次但不改变论文表格(表格数字永久可溯)。两类数字在条目内的呈现原则:论文表格数字(§4 主表)优先,平台实时榜仅在"持续开放"语境引用并注明日期。若未来官方发布 2023 届独立总结论文且数字与本条目不一致,按附录 K 触发更新流程,以新论文为准并在附录 F 追记漂移行。

附录 G:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ Zenodo DOI(挑战赛记录)+ TCIA DOI(源数据)+ 任务包平台 ID
F2 富元数据 ✅ Datasets 页逐包规格+TCIA DICOM 元数据+论文表格
A1 可访问协议 ⚠️ 源数据公开直链;预处理包注册制(401 门槛);test 标注请求制
A2 元数据可访问 ✅ 即便数据有门槛,规格与引用链始终开放
I1 互操作格式 ✅ NIfTI+JSON+标准位移场接口;MONAI/nnU-Net 生态直连
I2 词汇表引用 ✅ TRE/Dice/HD95/SDlogJ 均为社区标准指标并开源实现
R1 来源溯源 ✅ 每个任务包到 TCIA DOI 的派生链完整
R3 可复现流程 ✅ 评测代码+零场 sanity check+dummy 数据集+baseline 全开源
AI-Ready 综合 4.0/5 "评测即服务"标杆;扣分在注册制与统一 license 缺位

附录 H:术语中英对照(首现标注回查表)

中文 英文 备注
医学图像配准 medical image registration 本条目主题
形变配准 deformable registration 相对 rigid/affine
靶注册误差 target registration error, TRE 配准核心指标
解剖标志点 anatomical landmark 手动标注的金标准
关键点 keypoint 自动检测点(Förstner 系)
位移场 displacement field 提交物本体
雅可比行列式 Jacobian determinant 折叠检测
靶区/危及器官 target / organ at risk, OAR 放疗术语
扇束 CT / 锥束 CT fan-beam CT / cone-beam CT, FBCT/CBCT ThoraxCBCT 双模态
图像引导放疗 image-guided radiation therapy, IGRT 临床场景
自配置 self-configuring 超参自动选择路线
跨期/跨患者 intra-/inter-patient 患者域二分
吸气相/呼气相 inspiratory / expiratory phase 呼吸相位
低剂量 CT low-dose CT, LDCT NLST 筛查协议
排行榜 leaderboard 持续评测载体

附录 I:缩写速查

缩写 全称
L2R Learn2Reg(挑战赛简称)
TRE / TRE30 Target Registration Error / 最差 30% landmark 的 TRE
TRE-KP / TRE-LM keypoints / landmarks 口径的 TRE
TREnodules 肺结节层面 TRE(2023 新增)
DSC / Dice Dice Similarity Coefficient
HD95 Hausdorff Distance 95th percentile
SDlogJ 标准差 of log Jacobian determinant(形变折叠指标)
FBCT / CBCT Fan-Beam CT / Cone-Beam CT
IGRT Image-Guided Radiation Therapy(图像引导放疗)
OAR Organ At Risk(危及器官)
NLST National Lung Screening Trial
NSCLC Non-Small Cell Lung Cancer
TCIA The Cancer Imaging Archive
UKSH Universitätsklinikum Schleswig-Holstein
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
Type 1/2/3 挑战赛提交分型:位移场 / Docker 算法 / 全隐藏
FDK Feldkamp-Davis-Kress(CBCT 重建算法)
MIND / LNCC / NGF 配准常用相似度度量(模态稳健)
RTSTRUCT DICOM 放疗结构集(靶区/OAR 轮廓)
DEQ Deep Equilibrium Model(深度均衡模型)
CVH Compressed Volumetric Haar(Deeds 块匹配特征)
FFD / B-spline 自由形变形变模型(NiftyReg 系)
VDT Volume Doubling Time(结节体积倍增时间,随访场景)
PSMA Prostate-Specific Membrane Antigen(2026 PSMAReg 任务)
COPDGene Genetic Epidemiology of COPD(2026 Learn2Breath 数据源)

附录 J:届次-任务-结果速查总表

届次 任务 冠军/最佳 数字锚点
2020-2021 六任务(Lung CT/OASIS/CuRIOUS/Abdomen CT-CT/Abdomen MR-CT/Hippocampus) ConvexAdam(跨任务总分第一) 20+ 队/65+ 方法;速度迷思破除
2022 NLST 首秀+历史任务 —(Type 3 试验) L̶2̶R̶’̶2̶2̶ 榜已弃用(删除线)
2023 NLST2023 LapIRNv2(rank 0.800) TRE 1.441 mm;initial 10.40 mm
2023 ThoraxCBCT SynDeeds(rank 0.705) DSC 70.16%;ConvexAdam baseline 0.710
2023 冬(OncoReg type 3) UKSH 隐藏集 DINO-Reg Ensemble 25 患者私有;VoxelMorph++ 亚军
2024 ReMIND2Reg/LUMIR/COMULISSHGBF next-gen-nn 跨任务稳定 VROC 拿下 COMULISglobe SHG/BF 第一
2025 持续评测 — LNCS proceedings 出版
2026 PSMAReg/Learn2Breath(CodaBench) 进行中 597/262 与 200/10/100

届次叙述补注:2024 届两支全勤队(VROC 与 next-gen-nn)展示了两种极端策略——VROC 全程优化式(任务特定预处理+Demons 力)与 next-gen-nn 全程学习式(三个任务全部前十、LUMIR 第二)——它们的分化被 2024 总结论文用作"跨任务泛化"命题的活体实验。2025 届 proceedings 落地 Springer LNCS(978-3-032-25169-5),意味着 Learn2Reg 与 MICCAI 的关系从"workshop 附属"升级为"正式出版分支"。2026 届换引擎(CodaBench)与学会联办(SNMMI)是组织层面的两次升级——前者为可编程赛制(CodaBench 支持自定义评测器),后者为临床数据供给开辟了学会背书的通道。

附录 K:本条目生产档案

  • 生产通道:50 篇冲刺批量生产·批次 3,代理 agentB-l2r(slug=learn2reg;备选 SegRap2023 未启用——主选三轮核验通过无需改道)
  • 开工三查:锁文件创建(agentB-l2r 1790460694);part 文件唯一化(/tmp/learn2reg_agentB-l2r_part1-5.md);环境留痕 ps aux | grep -c "[c]odebuddy" = 4
  • 研究:WebSearch×5+WebFetch×6+curl 直抓(grand-challenge/TCIA/arXiv/ar5iv/MONAI tutorial CDN 镜像)共约 15 轮;learn2reg.github.io 直连与 Wayback 均不可达已存照
  • FACTS.md:writing/learn2reg/FACTS.md 九节
  • 成稿方式:五 part 直写拼接(part1-5),每 part 尾留空行
  • 坑点:§10 八则(坑 1-8"坑 N:"编号制)
  • 互链计划:chaos/amos/pddca/fetreg/hecktor/hecktor2026/reg2026/autopet/autopet-v/totalsegmentator/verse-spine/abdomenct-1k/ctpelvic1k/ctspine1k/ct-rate/rider-lung-ct/lctsc/synthrad/nih-pancreas-ct 共 19 点(§9 表)
  • 更新触发点:2026 届数据发布(PSMAReg/Learn2Breath 包下载可用时)→ §7.2 与附录 J 扩行;官方 2023 独立总结论文若现身 → 坑 2 解除

交接清单(下一位编辑者从这里接手):FACTS.md 九节为唯一事实底稿;本成稿五 part 源文件在 /tmp/learn2reg_agentB-l2r_part1-5.md(会话期有效,长期以拼接后的 writing/learn2reg/learn2reg_Wikipedia.md 为准);租约锁 writing/learn2reg/.lock 到此任务完成后可释放;遗留疑点仅附录 A 标注的三项(老站原文、Zenodo 3835682 license、各届精确提交队伍数),均不阻塞发布。

附录 L:Learn2Reg 2023 与同类 MICCAI 挑战赛的对照

把 2023 年前后活跃的 MICCAI 配准类挑战赛放在一起,方便按需选型:

挑战赛 部位/模态 形态特色 与 Learn2Reg 的关系
Learn2Reg 2023(本条目) 脑/腹/胸,CT/MR/US 多任务平台+持续榜+统计排名 平台型母体
OncoReg(2023-2024) 肺,FBCT↔CBCT Learn2Reg 的肿瘤学 spin-off,type 3 隐藏数据 子事件(同组织方)
Hecktor(2021-2026) 头颈,PET-CT/CBCT 聚焦放疗靶区,配准+分割复合 同"跨模态+放疗"配方(库内 rid 461/638)
AutoPET(2022-2024) 全身 PET/CT 淋巴瘤病灶,自配准 形变合理性矛盾的同题(库内 rid 468/634)
FetReg(2021) 胎儿 MRI 产科移动伪影 MICCAI 配准挑战家族(库内 rid 343)
Reg2026(2026) — 配准方向后续挑战 届次演进链(库内 rid 639)
PDDCA/POPI(2010s) 肺 4DCT landmark 传统源头 Learn2Reg 的"前史"(库内 rid 454)

选型口诀:平台型需求(多任务、打榜、持续评测)→ Learn2Reg;专科纵深(头颈/核医学/产科)→ 对应专科挑战赛;历史对照(landmark 传统的根)→ PDDCA。

附录 M:数据复用合规问答(5 条)

  1. **我能否把 NLST2023.zip 镜像到国内网盘供实验室共享?**预处理包无明确再分发许可,稳妥做法是共享 grand-challenge 注册链接让同事自取;纯实验室内部使用风险低,公开发布不行。
  2. **我能否用 4D-Lung 原始 DICOM 训练商业产品?**源层 CC BY 3.0 允许商用(含署名),但 TCIA 数据使用政策另有附加条款(如不得声称背书)——商用前逐条核对 TCIA 政策页。
  3. **论文里贴 ThoraxCBCT 的测试集可视化结果可以吗?**test 监督标注不公开,但位移场可视化(自己方法的输出)无碍;引用官方指标数字需注明来自排行榜/论文。
  4. **我的挑战赛要不要也用 Wilcoxon 排名?**小样本任务(<30 例)强烈建议——平均分在小样本上极不稳定,Learn2Reg 的做法是把这些噪声显式建模进排名。
  5. **引用本条目时最短引用链是什么?**任务设计引 Zenodo 7844799 + 结果引 arXiv 2509.01217(NLST)/2503.23179(ThoraxCBCT)+ 数据引 TCIA DOI——三段式,缺一会被审稿人补刀。
  6. **我能在 Learn2Reg 数据上预训练再发到别处吗?**源层(TCIA,CC BY)可以;预处理包层没有授权再分发,重训产物(权重)发布一般无碍,但应说明训练数据来源与许可层级。
  7. **验证集能发论文吗?**能,验证集是公开的;但只报验证集成绩并暗示"达到挑战赛水平"会被质疑——test 成绩只能来自官方评测。
  8. **双专家 landmark 的分歧数据公开吗?**2023 扩展的标注细节由组织方持有;公开包只含合并后的监督信号——做标注不一致研究需联系组织方(learn2reg@gmail.com)。
  9. **排行榜上的历史成绩会被复算改变吗?**排名代码开源、快照可查(leaderboard history 功能),但新提交会改变相对位次——引用时给日期戳。
  10. **OncoReg 的 25 患者私有数据现在还能评测吗?**官方页明示"We offer a continuation of the evaluation beyond the completion of the challenge"——邮件申请即可,这是"评测即服务"长期化的直接例证。

附录 N:发布前最终自检记录

检查 结果
check_md.py(行数/章节/坑点/DAIMS/G3 纯净度/围栏配对/category_tags 受控词表) 见最终运行输出
preflight_check.py(锚点唯一/标题重复) 见最终运行输出
frontmatter 长度 title/subtitle/data_source.name ≤255 字符;description ≤170 字符(成稿时即按限编写)
title 后缀 " — AI-Ready Wikipedia \
URL 占位 https://www.qianfanghub.com/ai-ready-dataset/learn2reg/685 ✅
坑点格式 “坑 N:” 编号制 1-8 ✅
DAIMS 表 §6.3 ✅
category_tags 医学影像/CT/MRI/挑战赛数据集/评测基准/肺癌(VOCAB 内 6 词) ✅
cover_image_prompt 淡色封面插画+浅米白底+青绿淡紫暖橙淡金+结尾禁令句 ✅
临时文件唯一化 /tmp/learn2reg_agentB-l2r_part1-5.md(无裸命名,无竞争写入) ✅
租约锁 writing/learn2reg/.lock(agentB-l2r 1790460694,全程持有) ✅
环境留痕 ps aux \
查重 ai_ready_dataset 无 learn2reg 同名条目(record 查询空) ✅
备选改道 SegRap2023 未启用(主选三轮核验通过,无需证伪改道) ✅

附录 J2:库内互链条目全表(19 点,供 link_builder 重建)

record_id url_name 关联强度 关联语
337 chaos 强 Abdomen MR-CT 任务数据源(CHAOS)
76 amos 强 腹部跨模态配准延伸
454 pddca 强 肺 4D 配准前代基准
422 totalsegmentator 强 ThoraxCBCT 掩码生成工具
639 reg2026 强 配准挑战届次链
638 hecktor2026 中 挑战赛家族
461 hecktor 中 头颈跨模态放疗配准
343 fetreg 中 产科配准挑战
468 autopet 中 PET-CT 配准
634 autopet-v 中 PET-CT 配准续届
402 abdomenct-1k 中 腹部配准训练池
465 ctpelvic1k 弱 盆腔骨性配准域
443 ctspine1k 弱 脊柱骨性配准域
435 verse-spine 弱 脊柱分割/配准域
546 ct-rate 弱 胸 CT 跨期随访
267 rider-lung-ct 弱 TCIA 肺 CT
277 lctsc 弱 TCIA 肺放疗 CT
671 synthrad 中 跨模态合成姊妹问题
367 nih-pancreas-ct 弱 腹部小结构补充

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-26,抓取与核验时点见附录 A。事实陈述以 grand-challenge 官方页(Datasets/OncoReg/主页)、Zenodo 记录(10.5281/zenodo.7844799)、IEEE TMI 论文(10.1109/TMI.2022.3213983)、MELBA 总结论文(10.59275/j.melba.2025-gc8c / arXiv 2509.01217)与 OncoReg 论文(arXiv 2503.23179)为源;双官网割裂、2023 无独立论文、规模多口径、baseline 与冠军之辨等原始文档陷阱已在坑点(§10)与附录 F 存照。条目与库内 chaos(rid 337)、amos(rid 76)、pddca(rid 454)、fetreg(rid 343)、hecktor(rid 461)、hecktor2026(rid 638)、reg2026(rid 639)、autopet(rid 468)、totalsegmentator(rid 422)等条目互链,构成医学图像配准挑战赛家族的完整检索面。Learn2Reg 系列仍在演进(2026 届已启动于 CodaBench),后续届次数据发布时按附录 K 触发更新。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • lnq — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 肺癌
  • ulf-enc — 共享标签:医学影像 / MRI / 挑战赛数据集 / 评测基准
  • osic-pulmonary-fibrosis — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
  • nsclc-radiogenomics — 共享标签:医学影像 / CT / 肺癌
  • medpix — 共享标签:医学影像 / CT / MRI
  • toothfairy2 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准
  • nsclc-radiomics — 共享标签:医学影像 / CT / 肺癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集