LNQ 2023 (lnq) — AI-Ready Wikipedia

MICCAI 2023 纵隔淋巴结 CT 分割量化挑战赛——513 患者对比增强胸部 CT(训练 383 部分标注/验证 20/测试 100 全标注双协议),rank-then-aggregate 评估,冠军 Skeleton Suns DSC 71.2%/ASSD 2.95mm,数据经 TCIA 以 CC BY 4.0 全量公开

来源 多中心多癌种对比增强胸部 CT(512×512,层间距 3.0-3.8mm,面内 0.8-0.9mm)+ 纵隔 >1cm 淋巴结 3D 分割掩码(NRRD);训练集来自临床试验工作流部分标注,验证/测试集经 3D Slicer 4.11 全标注发布时间: 2026-09-27最后更新: 2026-09-27 阅读 17
LNQ 2023 (lnq) — AI-Ready Wikipedia

信息速览

数据集名称LNQ 2023 (lnq) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模513 患者(女 239/男 274,2007-2020 年采集);训练 383 / 验证 20 / 测试 100
接入方式多中心多癌种对比增强胸部 CT(512×512,层间距 3.0-3.8mm,面内 0.8-0.9mm)+ 纵隔 >1cm 淋巴结 3D 分割掩码(NRRD);训练集来自临床试验工作流部分标注,验证/测试集经 3D Slicer 4.11 全标注
AI 就绪度

INFOBOX — LNQ 2023 一屏速览

维度 内容
本质 MICCAI 2023 官方挑战赛(LNQ workshop):CT 纵隔内所有短轴径 >1cm 淋巴结的 3D 分割与量化
任务 单类目标 3D 分割——纵隔淋巴结在 CT 里既小又与血管/食管分界模糊,是小目标分割(small object segmentation)的标杆难题
数据 513 患者对比增强胸部 CT(女 239/男 274,2007-2020):训练 383(部分标注)/ 验证 20 / 测试 100(均全标注)
癌种 前六占约 60%:乳腺癌 80、CLL 74、NSCLC 58、霍奇金 38、SCLC 30、肾细胞癌 25
规格 512×512;层间距训练/验证 3.0mm、测试 3.8mm;面内 0.8-0.9mm;48-656 层(中位 114)
注释 训练集=临床试验工作流部分标注;验证/测试=3D Slicer 4.11 轴向徒手全标注(参照矢状/冠状面);NRRD 分发
评估 DSC + ASSD,rank-then-aggregate(逐例排名再聚合)+ bootstrap;Kendall’s τ=1 [0.87-1],名次极稳
参赛 208 队注册 → 16 队(5 国)进验证榜 → 6 队(3 国)进测试;验证期 2023-05-01 至 08-30(每日 3 次提交)
冠军 Skeleton Suns(Deissler et al.):nnU-Net + 残差编码器 + TotalSegmentator 背景伪标签 + 外部淋巴结数据;DSC 71.2 [63.4-78.6]%、ASSD 2.95 [2.13-5.05]mm(唯一中位 ASSD<3mm)
亚军/季军 IMR(70.0%/4.15mm)、CompAI(69.0%/5.05mm);四至六名 Hilab、IMI、SKJP(2.5D EfficientNet-B7)
获取 双轨:挑战赛版注册制(grand-challenge)|TCIA 版 CC BY 4.0 全量公开(35.27GB,2024-08-28,DOI 10.7937/QVAZ-JA09)
论文 MELBA Vol 3,DOI 10.59275/j.melba.2025-d482(2025-01-29 发表);arXiv:2408.10069(2024-08-19)
提案存档 Zenodo DOI 10.5281/zenodo.7844666(2023-04-19,11 位作者联署)——挑战赛设计先于赛事 5 个月存档
代码可得性 规则强制前 5 名交代码+Docker;季军 CompAI 公开 GitLab 复现仓库;冠军配方三件套均可经开源组件拼装
库内互链 instance2022(645)、amos(76)、totalsegmentator(422)、abdomenct-1k(402)

LNQ 2023 是一场"把分割难题压到最小尺度"的挑战赛:别的比赛在分割肝、脾、肺这些大器官,它只要求勾出纵隔里那些短轴径刚过 1 厘米、紧贴血管与食管的淋巴结。513 例多癌种对比增强胸部 CT、208 支注册队伍、冠军团 dice 系数(DSC)中位数只有 71.2%——这个在器官分割里"不及格"的分数,恰恰是纵隔淋巴结小目标分割当前的世界水平。它由 MICCAI 2023 官方认证,全套数据现已在 The Cancer Imaging Archive(TCIA)以 CC BY 4.0 无限制公开,是 CT 小目标分割方向最值得跑分的公开基准之一。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——TCIA 版 CC BY 4.0 有直链,挑战赛版是注册制,别走错门。
  2. 关心挑战赛结果:直奔 §4 挑战赛设计与结果——rank-then-aggregate 评估与六强成绩表都在那里。
  3. 想复现冠军:直奔 §5 冠军方案解剖——nnU-Net 残差编码器+背景伪标签+外部数据的三件套配方,以及三条"后处理反噬"教训。

阅读地图(按出发点选路径):

我要下载数据        -> §1 Q9-Q12 -> §2.7 -> §6 -> 附录 H
我要跑基线          -> §3.3 -> §5.4 -> 附录 K -> FAQ E 组
我要对标成绩        -> §4.4 -> §4.8 -> 附录 C/G
我要设计评测协议    -> §4.3 -> §4.7 -> §7.4 -> 附录 D
我要写引用/数据卡   -> §6.5 -> §7.6 -> §10.1 -> FAQ Q40
我只想快速了解      -> INFOBOX -> §0 -> FAQ A 组

§0 导读:这个数据集解决什么问题

纵隔淋巴结(mediastinal lymph node)是肿瘤分期、放疗靶区勾画和疗效评估的关键解剖结构,但它也是 CT 上最难分割的目标之一:健康成年人的纵隔淋巴结短轴径多在 1 厘米上下,在 3 毫米层厚的 CT 里只占两三层、几十个像素;它的密度与血管、食管接近,边界在窗位里若隐若现;不同观察者对"算不算一枚淋巴结"的判断也不一致。过去十余年,学界为这个问题积累了 CT Lymph Nodes(Roth 等 2015)等数据集,但普遍存在规模小、患者背景单一、缺乏统一评测的问题——模型在各自数据上自我比较,很难说清"纵隔淋巴结分割到底做到了什么水平"。

LNQ 2023(Mediastinal Lymph Node Quantification,纵隔淋巴结量化挑战赛)对这个问题给出了三件套回答。第一件是数据:513 例多癌种对比增强胸部 CT,覆盖乳腺癌、慢性淋巴细胞白血病(CLL)、非小细胞肺癌(NSCLC)、霍奇金淋巴瘤、小细胞肺癌(SCLC)、肾细胞癌等真实临床分布——这不是一个"健康志愿者+几个病例"的玩具集,而是从 2007-2020 年临床试验工作流里攒出来的真实队列。第二件是评测协议:不比单帧 dice,而是 rank-then-aggregate——先在每个病例、每个指标上给所有队伍排名,再聚合名次,配合 bootstrap 重采样给出置信区间;事后验证显示名次的 Kendall’s τ=1,几乎不可撼动。第三件是透明:赛事全程公开(组织方自称 completely open challenge),前五名队伍须提交代码与 Docker 镜像,最终数据在 TCIA 全量公开。

LNQ 2023 的价值主张可以一句话概括:在所有人都说"淋巴结分割很难"的领域,它把"很难"变成了可测量的 71.2%。这个数字同时划定了上界与下界——它告诉算法工程师"别指望开箱即用的分割模型在纵隔淋巴结上复现器官分割的 95%+“,也告诉临床研究者"小目标分割的改进空间还非常大”。

§0 读法三则:

  1. 本条目是"数据集+挑战赛复盘+冠军配方"三合一:本体是 513 例 CT 与掩码,挑战赛是评估协议的权威出处,冠军方案是当前最优实践——三者许可与获取方式不同(§6)。
  2. 全文硬数字均出自 MELBA 专刊论文(DOI 10.59275/j.melba.2025-d482)、挑战赛官网(lnq2023.grand-challenge.org)与 TCIA 收藏页三源交叉核验;第三方口径冲突已在 §10 八坑逐条存照。
  3. 检索时注意命名家族:LNQ / LNQ 2023 / Mediastinal-Lymph-Node-SEG(TCIA collection 名)指的是同一个数据集(坑 6),别只拿一个名字搜。

0.1 为什么偏偏是"1 厘米"

短轴径 >1cm 是放射学报告里"淋巴结值得记录"的经典阈值——它不是解剖学边界,而是几代人临床经验的操作公约数:小于它的淋巴结多数为反应性增生,逐个报告只会淹没信号;大于它则值得进入分期与随访的决策链。LNQ 把这个临床公约数直接搬进任务定义,带来两个好处:模型输出与放射科报告语义对齐(勾出来的每一枚都是"医生会写进报告的"),以及掩码边界有客观标准可依(1cm 卡尺一量,无需猜"标到底算不算")。

代价同样明确:亚厘米级淋巴结(临床上其实也在看)被排除在监督信号之外。所以 LNQ 的 71.2% 回答的是"临床报告阈值的淋巴结分割",不是"任意尺寸淋巴结检测"——引用成绩时别混淆这两个问题的范围。

0.2 MICCAI 挑战赛生态里的 LNQ

MICCAI 是医学影像计算的旗舰会议,其卫星挑战赛生态是数据集基准的重要孵化器。LNQ 2023 的时间线是标准的挑战赛节奏:2023 年 4 月提案存档(Zenodo)→ 5-8 月验证榜 → 9 月测试截止 → 10 月 MICCAI 2023 LNQ workshop 公布名次 → 论文与数据随后分批落库(arXiv 2024-08、TCIA 2024-08-28、MELBA 2025-01)。

它在这个生态里的辨识度来自三点:难度定位(不比大器官比小目标,71.2% 的天际线直白地标记了领域边界);统计自觉(rank-then-aggregate + bootstrap + Kendall’s τ,把"名次可信吗"写进结论);开放闭环(数据、协议、结果、代码四个环节全部有公开落点)。挑选挑战赛数据集复现时,这三点也是现成的尽职调查清单。

0.3 谁应该用这个数据集

三类用户的三个用法:

  1. 分割算法研究者——把 LNQ 当"小目标试金石":你的模型在大器官上 95%+ 不代表什么,在纵隔淋巴结上先过 60% 再谈架构创新;六强成绩表(§4.4)就是你的对照系。
  2. 临床 AI 工程师——把 LNQ 当"现实检查器":部分标注、层厚不齐、癌种混杂、成团病灶——这些你在产品里迟早遇到的脏东西,基准里全有;先在 LNQ 上跑通,再谈落地。
  3. 数据集/评测研究者——把 LNQ 当"协议范本":双标注协议怎么写、验证集怎么设、名次稳定性怎么报、前排代码怎么强制——§4.3、§7.4 与附录 D 逐条拆好了。

§1 数据集速览:十六问十六答

Q1:LNQ 2023 到底"量"什么?
分割并计数纵隔内所有短轴径大于 1 厘米的淋巴结。>1cm 是影像学上"淋巴结值得报告"的经典阈值,任务因此直接对齐临床工作流:模型输出=每枚淋巴结的 3D 掩码,量化(quantification)由掩码计数与径线测量自然导出。

Q2:513 例是什么构成?
513 名患者的对比增强胸部 CT,女 239、男 274,采集年份 2007-2020,背景以肿瘤患者为主:癌种前六位为乳腺癌 80 例、CLL 74 例、NSCLC 58 例、霍奇金淋巴瘤 38 例、SCLC 30 例、肾细胞癌 25 例,合计约占 60%——分布刻意贴近"纵隔淋巴结在临床上被认真看"的人群。

Q3:切分怎么划的?
随机 76%/4%/20%:训练 383 例、验证 20 例、测试 100 例。训练集为部分标注,验证与测试集共 120 例为全标注——这个不对称是理解本数据集一切坑的钥匙(坑 7)。

Q4:"部分标注"是什么意思?
训练集 383 例的掩码来自既往临床试验工作流:当时的临床软件(如 Yunu/PIM)只勾选对治疗决策有意义的淋巴结灶,其余未标注——未标注不等于不存在。验证/测试集则由标注员在 3D Slicer 4.11 里逐层勾出所有可见淋巴结,为全标注。

Q5:影像规格如何?
对比增强 CT,512×512 矩阵,面内分辨率 0.8-0.9mm;层间距训练/验证 3.0mm、测试 3.8mm——测试切片更厚,同一枚淋巴结占的层数更少,任务更难;每例层数 48-656,中位 114 层。

Q6:标注质量如何保证?
验证/测试集标注在 3D Slicer 4.11 中用 Draw 工具沿轴向徒手勾画,勾画每一层时同步参照矢状面与冠状面确认边界,再经医生复核。掩码以 NRRD 格式与影像配套分发(TCIA 版同时提供 DICOM)。

Q7:挑战赛怎么评?
两个指标:DSC(Dice 相似系数)与 ASSD(平均对称表面距离)。聚合方式为 rank-then-aggregate——先在每个病例、每个指标上把所有队伍排名,再对名次求平均得出最终 rank score;配合 bootstrap 重采样给出置信区间。

Q8:名次稳定吗?
稳定到罕见:bootstrap 下的 Kendall’s τ=1(95% CI 0.87-1),即重采样几乎不改变六强排序。引用"冠军是 Skeleton Suns"时不需要加任何"可能变动"的限定。

Q9:参赛规模多大?
208 支队伍注册,16 支(来自 5 个国家)进入验证榜,6 支(3 个国家)进入测试榜。验证期 2023-05-01 至 2023-08-30,每队每日最多 3 次提交;测试提交截止 2023-09-20;名次在 MICCAI 2023 的 LNQ workshop 上公布。

Q10:成绩是什么水平?
冠军 Skeleton Suns:DSC 中位 71.2%(置信区间 63.4-78.6%)、ASSD 中位 2.95mm(2.13-5.05mm),是六强中唯一 ASSD 中位数低于 3mm 的队伍;亚军 IMR 70.0%/4.15mm;季军 CompAI 69.0%/5.05mm。作为对照,主流器官分割基准上 nnU-Net 类模型的 DSC 普遍 90% 以上——70% 出头就是小目标的现实。

Q11:冠军赢在哪?
三件套:nnU-Net 框架+大容量残差编码器(ResEnc)作基座;用 TotalSegmentator 的器官预测做背景伪标签,让模型"顺便"学会纵隔里哪些不是淋巴结;再用 TCIA CT Lymph Nodes 与 Bouget 2023 精修版等外部全标注淋巴结数据预训练。没有魔法,全是数据工程。

Q12:我现在能拿到什么?
双轨:挑战赛版在 grand-challenge.org 注册后经算法容器访问;TCIA 版(collection 名 Mediastinal-Lymph-Node-SEG)已于 2024-08-28 全量公开,CC BY 4.0,35.27GB,含 513 例全部影像与掩码——做研究走 TCIA 直链即可。

Q13:这堆名字(LNQ/LNQ 2023/Mediastinal-Lymph-Node-SEG)是一回事吗?
是。LNQ 与 LNQ 2023 是挑战赛名,Mediastinal-Lymph-Node-SEG 是数据在 TCIA 的 collection 名,LNQ-MELBA 是专刊论文口径。检索时建议全名族并查,只拿一个名字会漏资源(坑 6)。

Q14:官网在哪,能看到什么?
lnq2023.grand-challenge.org——任务定义、规则(前五名交代码+Docker)、评估指南(rank-then-aggregate 细节)与排行榜页都在;部分子页面为动态渲染,核心数字以 MELBA 论文为准。

Q15:谁在背后?
组织委员会跨 NYU Langone Health、Brigham and Women’s Hospital、MIM Software、Case Western Reserve University、University of Twente 等机构,代表人物含一作 Anahita Dorent、Andriy Fedorov、Awais Mansoor、Wenkui Yu;提案阶段即有 11 位作者联署存档。

Q16:它和十年前那批淋巴结分割数据集什么关系?
继承者与整合者:TCIA CT Lymph Nodes(Roth 2015)等提供了早期数据点,LNQ 用"真实临床队列+统一评测协议+权威榜单"把它们收进一个可比的框架——冠军方案甚至直接用那些老数据当外部训练资源(§5.2)。

§2 数据构成与规格

2.1 总体规模与切分

LNQ 2023 数据本体的骨架是一张 513 例的切分表:

切分 例数 占比 标注协议 层间距 用途
训练集 383 ~76% 部分标注(临床试验工作流) 3.0mm 参赛队自行训练
验证集 20 ~4% 全标注(3D Slicer 4.11) 3.0mm 验证榜实时评测
测试集 100 ~20% 全标注(3D Slicer 4.11) 3.8mm 终榜评测(挑战赛期私有)
合计 513 100% — — —

三个设计动机值得展开:

  1. 测试集切厚层(3.8mm)是有意加难。训练/验证用 3.0mm 层间距,测试用 3.8mm——同一枚 1cm 淋巴结在 3.0mm 层里占 3-4 层,在 3.8mm 层里可能只占 2-3 层,3D 上下文更稀薄。这模拟了真实临床里"机器不同、协议不同、层厚不齐"的困境,也是测试集 DSC 普遍低于验证榜的结构性原因之一。
  2. 验证集只有 20 例,是刻意的。验证榜每日可提交 3 次、持续近 4 个月,如果验证集大,参赛队会把它当第二个训练集过拟合;20 例刚好够区分好坏,不够喂饱过拟合。
  3. 测试集 100 例提供统计功效。bootstrap 重采样要在例数上做文章,100 例让置信区间不至于宽到没意义——冠军 DSC 的 63.4-78.6% 区间就是在这 100 例上算出来的。

2.2 患者背景与癌种分布

数据来自 2007-2020 年间的多中心临床试验队列,性别比女 239:男 274。癌种背景的前六位(合计约 60%):

癌种 例数 备注
乳腺癌 80 纵隔淋巴结是乳腺癌分期常规评估区
CLL(慢性淋巴细胞白血病) 74 血液系统肿瘤,纵隔淋巴结肿大常见
NSCLC(非小细胞肺癌) 58 纵隔淋巴结分期直接决定治疗策略
霍奇金淋巴瘤 38 论文专项分析:显著更难(bulky/成团淋巴结)
SCLC(小细胞肺癌) 30 纵隔侵犯高发
肾细胞癌 25 淋巴转移路径可经纵隔

这个分布有两个直接的工程含义:

  • 标签语义随癌种漂移。不同临床试验对 “>1cm 需要勾画” 的实操标准不同(例如淋巴瘤试验关注 bulky 病灶、肺癌试验关注分期站点),训练集的部分标注因此带有癌种相关的工作流烙印——这不是缺陷而是真实临床的写照,但用它训练时要知道自己在学什么。
  • 霍奇金淋巴瘤是"难度放大器"。MELBA 论文的专项分析显示,霍奇金病例的成团(conglomerate)与巨大(bulky)淋巴结显著拉低分割成绩(组间差异检验 p 值落在 0.009-0.27 区间)——成团淋巴结连"算一枚还是几枚"都成为评分歧义源。

2.3 影像规格参数表

参数 数值
模态 对比增强 CT(ceCT)
矩阵 512×512(面内)
面内分辨率 0.8-0.9 mm
层间距 训练/验证 3.0mm;测试 3.8mm
每例层数 48-656 层(中位 114)
采集年份 2007-2020
分发格式 NRRD(影像+掩码配套);TCIA 版另含 DICOM 原始序列

2.4 标注对象:什么是"一枚淋巴结"

任务定义是纵隔内所有短轴径 >1cm 的淋巴结。这个定义带来三个边界效应:

  1. 单类目标。掩码里只有"淋巴结"一类,不区分站点(station)、不区分良恶性、不区分转移与否。站点归属与性质判断留给下游模型——LNQ 只解决"找出来、描出来"。
  2. 1cm 阈值以下的淋巴结不在掩码里。纵隔里大量 5-9mm 的小淋巴结在真实临床中也会被放射科医生观察,但它们不构成本数据集的监督信号——把 LNQ 模型直接用于全淋巴结检测时,会系统性漏掉亚厘米级目标。
  3. 每例淋巴结数量从个位数到数十个不等。部分标注的训练集里,数量由当年临床试验的勾画范围决定;全标注的验证/测试集里,数量由该患者的解剖决定。论文未给出逐例淋巴结总数的中位数统计,引用时不要自行推算。

2.5 数据字典(TCIA 版字段视角)

字段/内容 说明
Subject ID 患者级唯一标识(513 个)
Series 每患者影像序列(共 1,026 个 series;66,870 幅图像)
影像文件 DICOM 原始序列 + NRRD 体数据
掩码文件 NRRD,单标签体数据(淋巴结=1,背景=0)
Collection 名 Mediastinal-Lymph-Node-SEG(TCIA 收藏页口径)
DOI 10.7937/QVAZ-JA09
总体积 35.27 GB
License CC BY 4.0

字段语义三条注意:①"images 66,870"是 DICOM 层面计数(series×层数),不是 66,870 个独立样本——患者级样本量永远是 513;②"1,026 series"多于患者数,因部分患者含多个序列(如平扫+增强或多次采集),训练时按患者分组防泄漏;③manifest 下载按 series 组织,落盘后要按 Subject 重组目录再建索引(附录 H Step 5)。

2.6 与同类 CT 数据集的规模对位

把 LNQ 放进库内 CT 条目的坐标系里看,它的"小"是刻意的精准:

数据集 规模 目标 与 LNQ 的关系
instance2022(645) 3,060 例腹部 CT 13 器官全标注 大器官全监督范式,DSC 普遍 85%+
AMOS(76) 600 例(CT+MRI) 15 器官 多模态器官分割,任务难度低于小目标
TotalSegmentator(422) 1,204 例全身 CT 104 结构 LNQ 冠军方案的背景伪标签直接来源
AbdomenCT-1K(402) 1,000 例腹部 CT 多器官 大规模器官分割的代表
LNQ 2023 513 例胸部 CT 纵隔 >1cm 淋巴结(单类) 小目标单类分割的专项基准

同样是"CT+3D 掩码",器官分割的 DSC 天花板在 90% 区间,而纵隔淋巴结的世界水平只有 71.2%——这个落差本身就是 LNQ 存在的理由。

为什么小目标会难出 20 个百分点?难度来源可以拆成四层,层层叠加:

  1. 物理层:1cm 目标 × 3mm 层厚 = 目标在 z 轴只有 3-4 层,3D 上下文极度稀薄;层间部分容积效应让边界层的密度值失真。
  2. 对比层:淋巴结与周围血管、食管的 CT 密度接近,常规纵隔窗里"边界"更多是经验判读而非物理突变——这是与肝包膜、肺纹理这类高对比边界的本质区别。
  3. 语义层:什么算一枚(成团怎么拆)、勾到血管壁还是留缝隙、1cm 阈值卡在哪个径线——每个判定都有观察者间方差。
  4. 评测层:目标小意味着一像素的边界差在 DSC 里被放大——同一个模型,器官分割的 DSC 波动 0.5 个点,淋巴结分割可能波动 5 个点。

这四层解释了为什么 LNQ 六强全部在"数据工程"而非"架构"上做文章(§5.5):物理与对比层的天花板模型改不了,语义层被协议锁死,剩下能动的只有数据。

2.7 获取与下载实操(TCIA 轨)

TCIA 版的下载有三条常规路径,按顺手程度排序:

  1. NBIA 下载器 + manifest。在 TCIA 收藏页(DOI 10.7937/QVAZ-JA09)选 “Download -> Image” 生成 manifest 文件(.tcia 格式),再用 NBIA Data Retriever 打开 manifest 批量拉取——适合要全量 35.27GB 的场景。
  2. REST API 逐例抓取。TCIA 的 REST 接口可按 collection 名 “Mediastinal-Lymph-Node-SEG” 列出 513 个 Subject 与 1,026 个 series,按需下subset——适合只要验证 20 例做快速评测的场景。
  3. 第三方镜像。部分聚合站点提供转存,但 LNQ 的第三方口径讹误多(坑 1/坑 2),镜像的切分描述未必可靠——数据本体以 TCIA 原站为准。

下载后的目录语义:每个 Subject 下含原始 DICOM 序列与 NRRD 体数据(影像+掩码同几何对齐)。建议下载完先抽验三件事:体数据尺寸与 DICOM 层数一致、掩码非空且仅含值 0/1、验证/测试例的掩码连通域个数与论文口径量级相符(个位数到数十枚)。

2.8 Python 读取骨架(标准库用法)

以下为 NRRD 路线的最小读取骨架(工具用法示例,非官方加载器——LNQ 无官方 Python 加载器,这是互操作性扣分项,见附录 B):

import SimpleITK as sitk
import numpy as np

# 影像与掩码(NRRD 路线)
img = sitk.ReadImage("train_001_image.nrrd")
seg = sitk.ReadImage("train_001_mask.nrrd")

a_img = sitk.GetArrayFromImage(img)   # (Z, Y, X)
a_seg = sitk.GetArrayFromImage(seg)   # 同几何对齐,单标签体

# 几何信息(层间距在 z 轴:训练/验证 3.0mm,测试 3.8mm)
spacing = img.GetSpacing()            # (sx, sy, sz)
print("spacing:", spacing, "shape:", a_img.shape)

# 掩码自检:非空、二值、连通域粗计数
vals = np.unique(a_seg)
assert set(vals.tolist()) <= {0, 1} and a_seg.sum() > 0

from scipy import ndimage
nodes, n_nodes = ndimage.label(a_seg)     # 3D 连通域 ≈ 淋巴结枚数(粗口径)
print("连通域(≈淋巴结枚数):", n_nodes)

两点提醒:其一,ndimage.label 数出来的是 3D 连通域,成团淋巴结会被算作一个连通域——这不是"枚数"的医学口径,只是数据自检的粗代理;其二,验证/测试集的连通域应在个位数到数十个量级,若拿到几百个连通域大概率是读错了文件或几何没对齐。

2.9 层厚与重采样的工程注意事项

训练/验证 3.0mm 与测试 3.8mm 的层厚差(坑 8)落到工程上是三件事:

  1. nnU-Net 会自动处理,但你要知道它处理了什么。nnU-Net 按训练集的 median spacing(约 0.8×0.8×3.0mm)配置网络与采样;推理测试集时它自动重采样到训练 spacing 再回来——这个过程对用户透明,但意味着你在测试集上的真实"原始分辨率成绩"与重采样后的成绩不是一回事。
  2. 自己写管线时的对齐策略。若自建训练管线,建议把所有数据重采样到统一 spacing(各向同性 1.0-1.5mm 或保持面内原始分辨率、层向插值到 2-3mm);淋巴结是小目标,层向过度下采样会让 3 层高的目标直接消失。
  3. 评测时的几何一致性。DSC 对重采样敏感但不致命,ASSD 以 mm 计——评测前务必确认预测掩码被拉回原始 spacing 再算指标,否则表面距离会被层厚放大或缩小。

2.10 三个常见下载陷阱

  1. 第三方镜像的口径污染。聚合站点对 LNQ 的描述讹误率高(540 例、393 例等,见坑 1/坑 2),其"转存数据"的切分与元数据未必与官方一致——数据本体与切分信息只认 TCIA 原站与论文。
  2. NRRD 与 DICOM 几何漂移。同一患者的 DICOM 序列与 NRRD 体数据应在同一几何系,但个别工具链在格式转换时会引入方向(LPS vs RAS)或原点差异——混用两种格式训练前,先抽验影像与掩码的 GetDirection()/GetOrigin() 一致。
  3. 层间距字段想当然。有人假设全数据集层间距统一为 3.0mm——测试集是 3.8mm。任何按统一 spacing 写死的预处理(如按层厚换算物理尺寸的逻辑)都要加分支。

§3 注释流水线:一套数据、两套协议

3.1 为什么会有两套协议

LNQ 的训练集不是为挑战赛新标的数据,而是从既有临床试验工作流里"回收"的:这些病例当年在临床软件(如 Yunu、PIM)里做过淋巴结勾画,勾画的动机是治疗——放疗靶区、疗效评估、分期记录。临床工作流只关心"这个患者当下需要评估的淋巴结",因此掩码只覆盖临床相关灶,这就是部分标注(partial annotation)。

验证集与测试集则是为挑战赛新建的:组织方召集标注员,在 3D Slicer 4.11 中按统一协议勾画每例的所有可见淋巴结(>1cm),这是全标注(exhaustive annotation)。

两套协议的差异不是"粗标 vs 精标",而是覆盖语义的根本不同:

维度 训练集(部分标注) 验证/测试集(全标注)
勾画动机 临床决策(治疗相关灶) 基准评测(穷尽所有 >1cm)
勾画工具 临床软件(Yunu/PIM 等) 3D Slicer 4.11(Draw 工具)
勾画方式 沿用试验协议,逐灶勾选 轴向逐层徒手勾画,参照矢状/冠状面
未标注区域含义 可能存在未报告的淋巴结 视为真阴性背景
模型训练风险 检出未标注淋巴结会被计为假阳性 无此风险

3.2 全标注协议的实操细节

MELBA 论文对验证/测试集的标注流程给出了可复现的操作描述:

  1. 工具与版本:3D Slicer 4.11,内置 Draw(Labelmap)工具。
  2. 勾画平面:以轴向(axial)逐层徒手描边为主平面。
  3. 交叉参照:每层勾画时同步查看矢状面与冠状面重建,确认淋巴结的 3D 边界——淋巴结与血管的粘连区在轴向上最难判,冠状面往往能分开"上下两枚"还是"同一枚"。
  4. 纳入标准:短轴径 >1cm 且位于纵隔内。
  5. 复核:标注完成后经医生复核。

这套协议值得注意的一点是它的"手绘"属性:没有用半自动工具(区域生长、水平集)预生成再人工修边,而是逐层徒手勾画——这保证了边界语义的一致性(全部出自同一勾画标准),代价是边界可能带有 1-2 像素的徒手抖动。对 ASSD 这种以毫米计的表面距离指标,徒手抖动是不可忽略的噪声底,也是为什么 ASSD 的置信区间(如冠军的 2.13-5.05mm)比 DSC 的更宽。

3.3 部分标注对训练的实际影响

如果你打算用训练集训练,必须处理部分标注的假阴性标签噪声:模型检出了一枚真实的淋巴结,但当年临床试验没勾它,损失函数会把它当假阳性惩罚。三种常见应对(论文及参赛队实践口径):

  1. 直接硬训。接受噪声——部分标注来自真实临床,模型学到的工作流语义与评测语义虽不完全一致,但冠军方案证明这条路能走通(配外部数据补充监督)。
  2. 外部全标注数据混合。Skeleton Suns 的核心配方之一:用 TCIA CT Lymph Nodes(Roth 等 2015)与 Bouget 2023 精修版这些全标注淋巴结数据做预训练或联合训练,给模型"穷尽式"监督的先验,再在 LNQ 部分标注上微调。
  3. 伪标签/一致性策略。对训练集做初次预测,把高置信度但未标注的区域从损失里排除或转正——六强方案里有队伍采用类似思路,但论文未逐一披露细节,复现时以各队论文为准。

3.4 标注一致性:LNQ 没有给你答案的地方

诚实地说:LNQ 论文没有报告验证/测试集标注的观察者间一致性统计(例如双标 Kappa 或 Dice)。这意味着"全标注"本身作为 ground truth 的不确定度是未量化的。两处间接证据提示这种不确定度真实存在:

  • 霍奇金成团淋巴结的评分离散("算一枚还是三枚"直接影响 DSC 与计数);
  • ASSD 指标对边界语义高度敏感(表面距离 1mm 的判定差异就会进入指标)。

对使用者的建议:把 LNQ 的全标注当作"协议化的参考标准"而非"解剖学真理",报告成绩时引用官方置信区间,不要自行把 DSC 小数点后的差异解读为方法学优劣——rank-then-aggregate + bootstrap 的整套设计就是为了让结论停在"名次"这个它能支撑的粒度上。

3.5 标注成本的量级感受

论文未披露逐例标注耗时,但可以用协议参数做个量级推算:全标注每例需处理 48-656 层(中位 114 层),逐层徒手勾画每层几十秒量级,加上矢状/冠状面交叉核对与复核环节——单例人力成本在"小时"量级,120 例全标注是"人月"量级的工程。这也是为什么挑战赛只对 120 例做全标注、训练集直接回收临床部分标注:穷尽式标注的边际成本,在 513 例全量上不可承受。这个约束不是 LNQ 独有,而是整个医学分割数据集生态的共性——理解了它,就理解了为什么"部分标注+外部数据"会成为冠军配方而不是权宜之计。

3.6 为什么挑战赛敢用部分标注的训练集

一个合理的疑问:既然部分标注有假阴性噪声,为什么不重新全标训练集?三个原因让组织方保留了两套协议:

  1. 生态真实性。临床工作流的部分标注恰恰是"真实世界里你能拿到的数据"——任何声称服务临床的模型,最终都要面对这种带缺口的数据。
  2. 评测纯净性。验证/测试集全标注保证了评测信号无歧义——训练端可以脏,评测端不能脏,这是基准设计的底线。
  3. 外部数据补偿通道。规则允许使用外部公开数据,全标注淋巴结数据(Roth 2015、Bouget 2023)成了天然的监督补充——冠军方案证明了这条通道有效。

换句话说,LNQ 把"数据不完美"本身设计进了任务:它考的不只是模型架构,还有参赛队处理真实世界标签缺口的数据工程能力——这正是它区别于"干净玩具基准"的地方。

3.7 数据集设计流派里的 LNQ

把 LNQ 放进"医学分割数据集是怎么来的"的谱系里,能看到三种流派:

流派 做法 代表 优势 代价
新采集型 为数据集专门立项采集+标注 AMOS(76) 等多中心项目 协议统一、元数据齐 成本高、周期长
临床回收型 回收既有临床工作流的影像与标注 LNQ 训练集 真实分布、边际成本低 标注语义不统一(部分标注)
重标注/精修型 对既有公开数据补新标注 Bouget 2023(精修 Roth 2015) 修正历史质量问题 受制于原数据可用性

LNQ 的聪明之处在于组合:本体走临床回收型拿真实分布与规模,验证/测试集按新采集标准补全标注,再开放外部数据通道让重标注型资源(Bouget 2023)进来补监督。三条流派各取所长——这个组合结构本身就是可复用的数据集工程模板。

3.8 两代勾画工具链的差异

训练集(临床软件勾画)与验证/测试集(3D Slicer 勾画)的差异,除了覆盖语义,还有工具代际差:

维度 临床软件(Yunu/PIM 等) 3D Slicer 4.11(验证/测试)
设计目标 治疗工作流(靶区、疗效、分期记录) 通用科研标注
勾画交互 按临床协议逐灶快速勾选 Draw 工具逐层精勾+多平面核对
交叉参照 视临床场景而定(通常仅轴向) 轴向主勾+矢状/冠状同步核对
输出语义 “治疗需要的灶” “所有 >1cm 淋巴结”

对使用者的实操含义:训练集掩码的边界质量与覆盖范围都带着"临床节奏"的痕迹——勾得快、勾得省,松边界与漏灶并存。这不是要你歧视这批数据(冠军硬训照样赢),而是提醒:在训练集上算出的任何"掩码统计"(平均枚数、平均体积)都不是全标注口径,做数据统计时只用验证/测试 120 例。

§4 挑战赛设计与结果

4.1 赛制时间线

节点 日期/规则
提案存档 Zenodo DOI 10.5281/zenodo.7844666(2023-04-19,11 位作者联署)
验证榜开放 2023-05-01
验证榜关闭 2023-08-30(每队每日最多 3 次提交)
测试提交截止 2023-09-20(测试集数据不下发,容器推送至 grand-challenge 执行)
名次公布 MICCAI 2023(2023-10)LNQ workshop
论文预印 arXiv:2408.10069(2024-08-19)
数据全量公开 TCIA 2024-08-28(CC BY 4.0)
专刊论文 MELBA Vol 3,DOI 10.59275/j.melba.2025-d482(2025-01-29)

4.2 参赛漏斗与开放承诺

208 支队伍注册 → 16 支(5 个国家)进入验证榜 → 6 支(3 个国家)进入测试榜。组织方在官网强调这是 completely open challenge——数据、评测协议与参赛结果全部公开,并且规则页明确:最终榜前五名队伍须提交代码与 Docker 镜像。这条"给名次就交代码"的规则让 LNQ 的前排成绩全部具备可复核性,在挑战赛生态里属于少见的硬要求。

评估在 grand-challenge 平台经算法容器进行:参赛队上传推理容器,平台在隔离环境里跑验证/测试集,参赛队自始至终接触不到测试影像本体(挑战赛期间)。这也是为什么测试集 DSC 的"私有→公开"时间线值得单独存照(坑 3)。

赛制的三个防作弊细节(各对应一类常见榜单污染):

  1. 测试数据不下发(对治"下载测试集调参"):推理只在平台的容器环境里发生,测试影像在挑战赛期出不了机房。
  2. 每日 3 次提交限额(对治"把验证榜当训练信号"):把榜单试错的边际成本抬高,四个月窗口内的有效迭代次数被物理限制。
  3. 验证集仅 20 例(对治"验证集过拟合"):样本少到无法支撑精细的验证集爬坡,名次聚合进一步吸收残余抖动。

三条合起来构成一个设计立场:榜单的可信度不是靠参与者自律,而是靠机制把作弊路径堵死——这是后来者设计挑战赛时最值得逐条对照的清单。

4.3 评估协议:rank-then-aggregate

LNQ 的评估设计是它对方法学社区的主要贡献之一,核心三步:

  1. 逐例逐指标排名。对每个病例,把所有队伍在该病例上的 DSC 排名、ASSD 排名(ASSD 越小越好)。
  2. 聚合名次。对名次求平均,得到每支队伍的综合 rank score——直接比较名次而非原始分数,天然免疫离群病例对均值的拉扯。
  3. bootstrap 置信。对测试集做 bootstrap 重采样,检验名次的稳定性——结果 Kendall’s τ=1(95% CI 0.87-1),重采样几乎不改变六强排序。

为什么这很重要:医学分割挑战赛的经典痛点是"A 队 DSC 71.2%、B 队 71.0%,就差 0.2 个点,换批数据排名可能颠倒"。rank-then-aggregate + bootstrap 把这种脆弱性显式量化了——LNQ 用数据证明自己的名次不是抽签,而是结构性差距。后来者引用 LNQ 结果时,正确姿势是引用名次与置信区间,而不是裸比较 DSC 小数。

4.4 六强成绩表(MELBA 论文口径)

名次 队伍 Rank score DSC 中位 [95% CI] ASSD 中位 [95% CI](mm) 备注
1 Skeleton Suns 2.1 71.2 [63.4-78.6]% 2.95 [2.13-5.05] 唯一 ASSD 中位 <3mm
2 IMR — 70.0% 4.15 最小尺寸后处理反噬(见 §5.3)
3 CompAI — 69.0% 5.05 误删小组件导致掉名(见 §5.3)
4 Hilab — — — 论文 Table 2 收录方法细节
5 IMI — — — 最小尺寸后处理反噬案例之一
6 SKJP — — — 2.5D EfficientNet-B7 路线

未列出的名次细节(四至六名的具体 DSC/ASSD 数值)以论文 Table 3 为准;本条目只把三源核验过的数字写进硬事实,避免转引误差。四至六名的方法特征是核验过的:SKJP 走 2.5D EfficientNet-B7 路线(六强中唯一非 nnU-Net 系基座),Hilab 与 IMI 的完整成绩见论文。

六强方法特征对比(论文 Table 2 口径的定性拆解):

队伍 基座 关键组件 外部数据 后处理教训
Skeleton Suns(1) nnU-Net + ResEnc TotalSegmentator 背景伪标签 CT Lymph Nodes + Bouget 2023 无(靠数据工程而非输出端剪刀)
IMR(2) nnU-Net 系 — 有 最小尺寸后处理负收益
CompAI(3) nnU-Net 系 — — 误删小型连通域,从榜首滑落
Hilab(4) 论文 Table 2 收录 — — —
IMI(5) nnU-Net 系 — — 最小尺寸后处理负收益
SKJP(6) 2.5D EfficientNet-B7 2.5D 路线 — —

("—"为论文未在定性拆解中突出的维度;完整细节以论文 Table 2 为准。)

六强的三个结构性结论:

  1. 全监督完胜。六强全部是全监督方案,弱监督/半监督路线没有进入前排——在部分标注的训练集上,外部全标注数据的补充(如冠军方案)比"巧妙利用噪声标签"的算法创新更有效。
  2. nnU-Net 系基座统治。六强中五支以 nnU-Net 或其变体为基座,唯一例外的 SKJP 用 2.5D EfficientNet-B7 仍居末位——小目标分割的技术底座与大器官并无二致,差距在数据工程。
  3. DSC 70% 是一条整齐的天际线。前三名挤在 69-71.2% 的窄带里,说明方法差异(4-5 个百分点)远小于任务本身的难度(对比器官分割的 90%+)。

4.5 霍奇金淋巴瘤:难度不是均匀分布的

论文的失败案例分析给出一个值得单独立碑的发现:霍奇金淋巴瘤病例的成绩显著更差。bulky(巨大)与 conglomerate(成团)淋巴结让两类指标同时恶化——成团病灶的"枚数歧义"直接冲击计数类量化,巨大病灶的异质内部(坏死区、融合边界)拉低表面距离。组间差异检验的 p 值区间为 0.009-0.27(不同子分析口径)。

对使用者的含义:如果你用 LNQ 评测自己的模型,按癌种分层报告比报一个总分更有信息量——一个在 CLL 病例上 75%、在霍奇金病例上 55% 的模型,和一个均匀 65% 的模型,临床含义完全不同。

4.6 验证榜 vs 测试榜:数字落差怎么读

参赛队普遍观察到验证榜成绩高于测试榜成绩,这个落差有三个结构性来源,读数字时先扣除:

  1. 层厚差(坑 8):验证 3.0mm vs 测试 3.8mm——测试目标更扁、上下文更薄。
  2. 过拟合曝光差:验证榜开放近四个月、每日 3 次提交,队伍事实上在验证集上迭代了大量轮次;测试集只此一回。这不是作弊而是榜单机制的内生属性,LNQ 用小验证集(20 例)+名次聚合把它压到了可控范围。
  3. 数据分布差:三段切分随机抽取,但 20 例与 100 例的小样本统计波动天然存在——bootstrap 给出的置信区间就是为此准备的。

因此正确读法是:只比同一榜内的相对名次,不跨榜比绝对值。论文的最终结论全部基于测试榜 + bootstrap,这也是为什么引用 LNQ 成绩时应引 Table 3(测试口径)而非任何验证榜快照。

4.7 评估协议伪代码(rank-then-aggregate 骨架)

# 输入: scores[team][case] = DSC, dists[team][case] = ASSD(越小越好)
# 输出: rank score per team + bootstrap 稳定性

ranks = []
for metric, cases in [("dsc", scores), ("assd", dists)]:
    for case_id in all_cases:
        # 每例: 按该指标给所有队伍排名(ASSD 升序、DSC 降序)
        order = rank_teams_across(cases, case_id, metric)
        ranks.append(order)

# 聚合: 每队名次平均 -> rank score(越小越好)
rank_score = {team: mean(position(team, r) for r in ranks) for team in teams}

# 稳定性: 对 100 例测试集做 bootstrap 重采样,重算名次,
# 统计重采样名次与原名次的 Kendall's tau 分布 -> 置信区间

骨架里最有迁移价值的一行是"每例排名再平均":它把"某队在难例上崩盘"的惩罚限制在该例的名次内,而不是让其 DSC 离群值污染整队均值。复刻 LNQ 式评测时,这一行是协议的灵魂。

4.8 引用 LNQ 成绩的礼仪

挑战赛成绩是"高stakes、易误引"的数字类型,四条引用规则:

  1. 六强名次可裸引——Kendall’s τ=1 背书,"冠军是 Skeleton Suns"不需要限定语。
  2. DSC/ASSD 中位数必须带区间——"71.2%“单数字引用在 reviewer 眼里是残缺的,正确写法"71.2 [63.4-78.6]%”。
  3. 验证榜快照不要引——近四个月窗口内的验证榜名次随时变动,且非最终口径;一切以测试榜(Table 3)为准。
  4. 跨任务比较要挂语境——拿 71.2% 与器官分割 90%+ 对比时,写明"单类小目标 vs 多器官大目标"的任务差异,别让读者以为 nnU-Net 退步了。

§5 冠军方案解剖:Skeleton Suns 的三件套

5.1 成绩与身份

冠军队伍 Skeleton Suns(Deissler et al.)以 rank score 2.1 登顶:DSC 中位 71.2%(bootstrap 95% CI 63.4-78.6%)、ASSD 中位 2.95mm(2.13-5.05mm)。ASSD 中位低于 3mm 意味着分割边界平均偏离参考边界不到 3mm——在层间距 3.8mm 的测试集上,这大约是"边界误差不到一层"的水平,对小目标而言是扎实的成绩。

rank score 2.1 本身也值得读:六队排名聚合后的分数落在 2-6 区间(第 n 名约得 n),2.1 意味着冠军在绝大多数病例上都是第一、偶尔第二——是"全面领先"而非"靠个别病例爆冷"。配合 Kendall’s τ=1,这套数字讲述的是统治级而非幸运级的第一名。反过来读亚军与季军的分差(70.0% vs 69.0%),在名次聚合下同样是结构性差距——LNQ 的窄带分数不是"大家水平一样",而是"难度把大家的绝对水平都压到了同一量级,但相对差距依然清晰"。

5.2 配方三件套

冠军方案的公开描述可以拆成三个正交组件,每个都可以独立移植:

组件一:nnU-Net + 残差编码器(ResEnc)基座。不用自研架构,直接站在 nnU-Net 的自动配置流水线上,把编码器换成大容量残差编码器(nnU-Net ResEnc 配置)。在小目标任务里,更大的感受野与更强的下采样特征对"在低分辨率层留住小目标"至关重要——这与器官分割里 ResEnc 收益递减的结论形成有趣对照。

组件二:TotalSegmentator 背景伪标签。用 TotalSegmentator(库内条目 totalsegmentator/422)对 LNQ 影像推断全身器官掩码,把这些器官作为背景伪标签加入训练——模型不再面对"一片均质背景+几个前景"的学习信号,而是被迫在"这些是心腔、那些是食管、剩下这个小的才是淋巴结"的解剖语境里定位目标。对边界与血管密度高度相似的纵隔目标,这一步直接把假阳性率打了下来。

组件三:外部全标注淋巴结数据。预训练/联合训练阶段引入外部淋巴结分割数据:

  • TCIA CT Lymph Nodes(Roth 等 2015):90 例全标注腹部/盆腔/胸部淋巴结数据集,淋巴结分割方向的老牌公开资源;
  • Bouget 2023 精修版:对上述资源的精修再发布(89 卷、387 个 ≥1cm 淋巴结的空间标注,共 2,912 个淋巴结),修正了原版的标注质量问题。

注意第三组件的隐性含义:冠军并不是在 LNQ 的 383 例上赢的,而是在"LNQ 383 例 + 外部淋巴结数据"的合并分布上赢的。规则允许使用外部数据(挑战赛开放性的一部分),这让 LNQ 的冠军成绩同时是一次"公开淋巴结数据生态的集体胜利"——TCIA CT Lymph Nodes 沉淀十年,最终在 LNQ 榜上兑现。

两个外部资源的速览卡(引用它们时用):

资源 规模 标注 在冠军配方中的角色
TCIA CT Lymph Nodes(Roth 等 2015) 90 例全标注 腹部/盆腔/胸部淋巴结 预训练/联合训练的主数据源
Bouget 2023 精修版 89 卷、387 个 ≥1cm 淋巴结灶(共 2,912 结) SAD 精修 修正原版标注质量后再入训练

选型提示:两份资源同源(精修关系),不要当成独立数据集重复计数;引用时分别挂各自出处,混写会引入"90+89 例"式的重复统计错误。

5.3 失败者教训:三条后处理反噬

MELBA 论文记录的三条"好心办坏事"案例,比冠军配方更有迁移价值:

  1. CompAI 的误删小组件。一支前排队伍(第三名 CompAI)在推理后处理中把小型连通域当作误检删除——结果把真正的微小淋巴结一起删了,名次因此从榜首滑落。教训:在"目标本身就是小连通域"的任务里,任何基于尺寸的后处理阈值都在和任务定义打架。
  2. IMI 的最小尺寸过滤。类似的:以最小体积阈值清理输出,反降成绩——1cm 短轴径的球体体积约 0.5mL,但实际勾画的淋巴结受层厚影响体积波动大,阈值切不准。
  3. IMR 的同类尝试。亚军 IMR 也报告了最小尺寸后处理的负收益。

三条教训合成一句话:在 LNQ,模型输出的每个连通域都值得被尊重——想提升成绩,去改数据与训练(如冠军三件套),不要在输出端加启发式剪刀。

5.4 复现建议(按代价排序)

  1. 零成本起步:nnU-Net 默认配置直接在 383 例训练集上开训——这是所有队伍的地板,也大概率是你的第一版 baseline。
  2. 低成本进阶:加 TotalSegmentator 背景伪标签(组件二独立有效,不依赖外部淋巴结数据)。
  3. 完整复刻:引入 TCIA CT Lymph Nodes + Bouget 2023 做预训练或联合训练(组件三),把残差编码器配上。
  4. 对照自检:在验证集(20 例,公开)上自评 DSC/ASSD,与六强验证榜成绩对表——测试集虽已公开,但拿测试集反复调试会让你的成绩失去"基准"含义,评测请以验证集为准。

5.5 为什么 nnU-Net 在小目标上依然是王者

六强里五支 nnU-Net 系,这个结果值得单独讨论。直觉上,1cm 目标在 3mm 层厚里只占两三层,似乎该轮到"为小目标量身定制"的架构(注意力增强、多尺度融合、2.5D 切片级分类器)翻身——但榜单没有支持这种直觉。三个解释:

  1. nnU-Net 解决的是管线问题而非架构问题。重采样、patch 采样、损失加权、数据增强的自动配置,这些工程决策在目标任务上的影响常常大于骨干网络的选择。小目标任务尤其如此:patch 里该不该放前景、小目标该不该过采样,nnU-Net 的默认策略已经是好的起点。
  2. 架构创新的收益被数据质量锁死。部分标注的假阴性噪声对任何架构一视同仁;在外部全标注数据补充监督之前,架构精修的天花板很低——这解释了为什么冠军把创新预算花在数据上(伪标签+外部数据)而不是网络上。
  3. 2.5D 路线的失败有信息量。SKJP 的 2.5D EfficientNet-B7 排第六——把 3D 上下文压扁成 2D 切片,对"上下靠两三层就没了"的淋巴结是致命的。这反向确认了 3D 上下文在小目标分割里的不可替代性。

5.6 三个组件的迁移边界

冠军三件套各自能走多远、在哪里失效:

组件 直接迁移场景 失效场景
nnU-Net + ResEnc 基座 几乎所有 3D 医学分割(器官/病灶/腺体) 2D 任务、超大数据集(训练成本)
TotalSegmentator 背景伪标签 任何"目标嵌在解剖密集区"的胸腔/腹腔/盆腔任务 头颈等 TotalSegmentator 覆盖弱、或目标本身是分割对象之一的场景(背景里混入前景)
外部全标注数据预训练 同模态同域有历史数据集的一切任务 域差距过大(如 CT→MRI)、外部数据标注口径与目标任务冲突时

特别提醒第二行的失效模式:如果你的目标任务本身就是 TotalSegmentator 能分割的结构之一,把它的预测当背景伪标签会把前景教成背景——LNQ 幸运在淋巴结不在 TotalSegmentator 的分割清单里,"邻居器官"与"目标"天然互斥。迁移前先检查这个互斥性。

5.7 小目标分割工具箱(按 LNQ 证据分级)

把六强实践与通用经验汇成一个工具箱,按"LNQ 榜单证据强度"分级:

一级(榜单直接验证,放心用):

  • nnU-Net 基座(五/六强采用,含冠军);
  • 大容量残差编码器(冠军采用,小目标任务收益明确);
  • TotalSegmentator 背景伪标签(冠军采用);
  • 外部同域全标注数据预训练/联合训练(冠军采用)。

二级(反向证据,明确别做):

  • 尺寸阈值后处理(CompAI/IMI/IMR 三连负例);
  • 2.5D 压扁上下文(SKJP 列第六的反例)。

三级(通用实践,LNQ 未直接验证):

  • 深监督与小目标过采样(nnU-Net 内建);
  • 测试时增强(TTA);
  • 模型集成(榜单未披露前排是否使用,复现时自行权衡)。

使用建议:先把一级清单跑通(这就是 §5.4 的四步),再考虑三级项做增量实验;二级项在 LNQ 类任务上默认排除——除非你的目标定义恰好允许删小连通域(例如已按站点过滤的下游任务)。

§6 获取与许可:双轨之门怎么进

6.1 轨道一:TCIA 版(AI-Ready 首选入口)

项目 内容
Collection 名 Mediastinal-Lymph-Node-SEG
发布日期 2024-08-28
许可 CC BY 4.0(署名即可,无使用限制条款)
体量 35.27 GB;513 subjects / 1,026 series / 66,870 images
格式 DICOM 原始序列 + NRRD(影像与掩码配套)
DOI 10.7937/QVAZ-JA09(数据引用:Idris et al. 2024)
内容 全量:训练 383(部分标注)+ 验证 20 + 测试 100(全标注)

CC BY 4.0 意味着只要署名,研究、复现、基准评测、衍生数据集构建都不需要额外授权——这是 LNQ 能进入 AI-Ready 数据集生态的关键资格。引用署名建议同时挂两条:数据 DOI(10.7937/QVAZ-JA09)与方法论文 DOI(10.59275/j.melba.2025-d482)。

6.2 轨道二:挑战赛版(grand-challenge)

项目 内容
官网 lnq2023.grand-challenge.org
获取方式 注册制:注册账号、接受 EULA 后访问;测试期推理经算法容器提交,不下发数据
适用场景 复现挑战赛完整流程(容器评测、排行榜对表);浏览官方文档与规则页

6.3 怎么选

你的需求是什么?
├── 训练/评测淋巴结分割模型
│   └── TCIA 直链下载(CC BY 4.0),验证集 20 例自评
├── 复现挑战赛榜单成绩
│   ├── 1) TCIA 拿全量数据训练
│   ├── 2) 严格按论文协议在测试 100 例跑一次(只跑一次)
│   └── 3) 与 MELBA 论文 Table 3 对表
├── 提交算法到官方容器评测
│   └── grand-challenge 注册 + 打包 Docker + 提交
└── 只想引用"小目标分割难度"论点
    └── 引论文 DSC 71.2% 与六强窄带,注明坑 3 时间线

6.4 许可边界与常见误用

  1. 不要把两轨许可混写。"LNQ 是 CC BY 4.0"这句话只在 TCIA 版语境下成立;挑战赛版受 grand-challenge EULA 约束(坑 5)。
  2. CC BY 4.0 的署名义务。衍生数据集、榜单、论文引用都须附数据 DOI 与组织方署名——宽松不等于无义务。
  3. 患者隐私已处理。TCIA 发布版为去标识数据(HIPAA 合规口径),但这不豁免你按 CC BY 4.0 署名与按伦理规范使用。

6.5 引用格式建议

一条 LNQ 成绩引用至少应挂三条文献:数据(TCIA DOI)、方法论文(MELBA DOI)、以及所用外部数据(如用了冠军配方里的 Roth 2015 与 Bouget 2023)。BibTeX 骨架:

@dataset{lnq2023_tcia,
  title       = {Mediastinal-Lymph-Node-SEG (LNQ 2023 Challenge Dataset)},
  year        = {2024},
  publisher   = {The Cancer Imaging Archive},
  doi         = {10.7937/QVAZ-JA09},
  note        = {CC BY 4.0; 513 subjects}
}

@article{lnq2023_melba,
  title   = {The LNQ 2023 challenge: Benchmarking machine learning methods
             for the segmentation of small and subtle lymph nodes in CT},
  journal = {Medical Imaging with Deep Learning},
  volume  = {3},
  year    = {2025},
  doi     = {10.59275/j.melba.2025-d482}
}

引用时的三条自查:①论文标题以 PDF 原文为准(本条目中文转述,英文标题引原文);②不要引用镜像页的 2024-AAAA DOI(坑 4);③成绩数字带置信区间引用(“DSC 71.2 [63.4-78.6]%”),裸引中位数会被 reviewer 追问。

§7 生态与影响

7.1 LNQ 在淋巴结分割文献链上的位置

淋巴结 CT 分割是一个有十余年积累的方向,LNQ 2023 的角色是把散点收敛成基准:

数据集 规模 标注 角色
TCIA CT Lymph Nodes(Roth 2015) 90 例 全标注(腹部/盆腔/胸部) 老牌公开资源;LNQ 冠军外部数据源
Bouget 2023 精修版 89 卷/387 灶(共 2,912 结) SAD 精修(≥1cm) 对上者的质量再发布
St. Olavs 医院 15 卷 15 卷/384 结 全标注 挪威单中心验证资源
NSCLC-Radiomics / Radiogenomics / Interobserver TCIA 生态 各异 肺癌淋巴结相关研究的配套资源
LNQ 2023 513 例 双协议(部分/全) 统一基准+权威榜单

注意这个生态的因果方向:LNQ 没有新采集数据(训练集回收自临床工作流),它的新意在于协议、规模与评测——然后把十年公开数据生态(Roth 2015 → Bouget 2023)拉进来一起兑现在榜单上。

7.2 MELBA 专刊与官方存档

LNQ 的最终成果不是一篇单点论文,而是 MELBA(Medical Imaging with Deep Learning)2025 年 Vol 3 专刊论文(DOI 10.59275/j.melba.2025-d482,2025-01-29 发表,CC-BY 4.0)。专刊口径下,论文同时承担三个职能:挑战赛复盘(赛制与六强)、基准发布(数据与协议的权威描述)、方法对照(Table 2 逐队方法拆解)。提案文档另有 Zenodo 存档(DOI 10.5281/zenodo.7844666,2023-04-19,11 位作者联署)。

7.3 前排队伍的后续

  • Skeleton Suns(冠军):Deissler et al. 的 nnU-Net ResEnc 配方在 challenge 后有独立论文发表,配方三件套(§5.2)已成为纵隔淋巴结分割的事实基线。
  • CompAI(季军):公开了复现代码仓库(GitLab),是六强里代码可得性最直接的入口。
  • SKJP(第六):2.5D EfficientNet-B7 路线作为"非 nnU-Net 反例"被后续方法学讨论反复引用。

7.4 对挑战赛生态的方法学影响

rank-then-aggregate + bootstrap + 强制前排交码这套组合拳,在 MICCAI 挑战赛生态里属于可引用的设计样本:它证明了"小验证集+名次聚合+稳定性检验"能把 208 支队伍的赛事做成一个统计上站得住的基准。后续医学分割挑战赛(无论器官还是病灶方向)在遭遇"前三名 DSC 只差 0.3%"的评分争议时,LNQ 的评估设计是现成的参照系。

这套设计里三个细节特别值得抄:

  1. 验证集故意小(20 例)。验证集的作用是"够区分好坏"而不是"够训练调参"——大验证集会变成事实上的第二训练集。
  2. 提交频率限额(每日 3 次)。把"榜上试错"的成本抬高,抑制对验证集的隐式过拟合。
  3. 名次稳定性作为结论的一部分。Kendall’s τ 不是装饰性统计,而是"这个榜单可信吗"的直接回答——后来者设计榜单时应把它列为默认输出。

7.5 与 TCIA 生态的长期关系

LNQ 数据落在 TCIA(The Cancer Imaging Archive)这一长期维护的开放影像库中,与库内其他肿瘤影像 collection(NSCLC-Radiomics、NSCLC-Radiogenomics、NSCLC-Interobserver 等)共享分发基础设施与引用规范。对数据集工程来说,这个落点有三重长期价值:

  • DOI 稳定解析:10.7937/QVAZ-JA09 由 TCIA 的 DOI 体系维护,引用不会随官网下线失效;
  • 版本事件留痕:2024-08-28 的发布日期、体量(35.27GB)、例数(513 subjects/1,026 series/66,870 images)在收藏页有权威记录,任何第三方讹误都可对照溯源;
  • 生态组合:同库的淋巴结相关 collection 可与 LNQ 组合使用(如把 NSCLC 系列当域外测试),组合口径在论文中写明即可。

7.6 三类论文各自该引什么

你在写什么 最小引用集 加分引用
用 LNQ 评测新分割模型 TCIA DOI + MELBA DOI(数据与协议) 评估协议出处段(rank-then-aggregate 细节)
提出"小目标分割"方法 MELBA DOI(难度标定)+ 六强成绩对照 霍奇金分层分析(§4.5)佐证难度结构
数据集工程/挑战赛设计研究 MELBA DOI + Zenodo 提案 DOI Kendall’s τ 稳定性作为设计证据

一个常见疏漏:引用 LNQ 时只挂 MELBA 论文不挂数据 DOI——数据本身是独立成果(Idris et al. 2024,TCIA),挂数据 DOI 才是对标注与发布工作的完整致谢,也是 CC BY 4.0 署名义务的一部分。

§8 方法学启示:四条可迁移的经验

  1. 部分标注不是废数据,是带语义的真实数据。LNQ 训练集的"漏标"来自真实临床工作流,冠军方案直接硬训+外部数据补监督就能登顶。翻译成通用经验:临床回收数据的标注缺口,优先用同域外部全标注数据补,而不是急着发明弱监督算法。
  2. 小目标任务禁用尺寸后处理。CompAI/IMI/IMR 三连反例(§5.3)指向一条硬规则:当目标本身就是"小连通域"时,任何尺寸阈值启发式都在错杀。这一条适用于所有小病灶任务(微转移灶、小结节、小息肉)。
  3. 背景伪标签是小目标分割的杠杆。TotalSegmentator 器官预测当背景监督,等于免费给模型上了"纵隔解剖课"。这条杠杆对任何"目标嵌在解剖结构密集区"的任务(颅内核团、盆腔淋巴结、腹腔小腺体)都可复制。
  4. 评测协议要预设"名次会被质疑"。rank-then-aggregate + bootstrap + Kendall’s τ 的组合把"排名是否可靠"变成可报告的统计量。任何需要区分 0.2 个百分点名次的评测,都值得抄这套作业。
  5. 验证集要小得"故意"。20 例验证集+每日 3 次限额的组合,把验证榜的过拟合空间压到最小。验证集不是训练资源,设计基准时别把它做大做全。
  6. "完全开放"是可运营的承诺。数据(TCIA)、协议(评估页)、结果(专刊论文)、代码(前五名强制)四个环节全部有公开落点,LNQ 证明了开放性可以逐环节落实,而不只是口号——后来者做挑战赛时,逐项对照这四个环节即可自检开放程度。

§9 与库内条目的关系

选这四个互链对象的理由:它们与 LNQ 共享同一技术栈(3D nnU-Net 系、同模态 CT、同任务族 3D 分割),且都已在库内成条——互链不是"沾边的都链",而是"读者从本条目出发最可能需要的下一站"。

条目 关系 一句话说明
instance2022(645) 同域 CT 分割、范式对照 13 器官大目标全监督的天花板范式(DSC 85%+),反衬 LNQ 小目标 71% 的难度
AMOS(76) 同域 CT/MRI 器官分割 多模态器官分割代表;与 LNQ 共享"3D nnU-Net 基座"技术栈
totalsegmentator(422) 直接技术依赖 LNQ 冠军方案的背景伪标签来源——库内互链里唯一"进冠军配方"的条目
abdomenct-1k(402) 同域大规模 CT 分割 千例级腹部多器官数据集;规模对照组

互链逻辑:这四个条目与 LNQ 构成"CT 分割难度光谱"——器官级(instance2022/AMOS/AbdomenCT-1K,DSC 85%+)到结构级小目标(LNQ,DSC 71%),TotalSegmentator 则横跨光谱、既是器官分割产品又是 LNQ 的数据组件。

联动用法三条:

  1. 难度标定:拿同一个 nnU-Net 配置分别跑库内器官条目与 LNQ,得到的 DSC 差(85%+ vs 71%)就是你手头数据管线的"小目标惩罚"基线——差异远大于此说明你的小目标处理有问题。
  2. 组件复用:totalsegmentator(422) 条目里的推理用法可直接服务于 LNQ 训练的背景伪标签步骤(§5.2 组件二),两个条目的工作流可以串成一条管线。
  3. 切域评测:AMOS/instance2022/AbdomenCT-1K 的器官掩码可给 LNQ 影像提供解剖上下文特征(部位过滤、ROI 裁剪辅助),跨条目组合时在方法里写明来源版本。

§10 避坑清单:八个已踩过的坑

坑 1:训练集数 383 vs 393。第三方站点 aifasthub 写 “393 partial cases form training”——与论文 Table 1 的 383 不符,疑为笔误或混入边界处理口径。以论文+TCIA 互证的 383 为准;见到 393 即为转引失真。

坑 2:总人数 513 vs 540。selectdataset 写 “540 patients”——论文与 TCIA(513 subjects)双源均为 513。540 系第三方讹误,别让检索快照污染你的数字。

坑 3:测试集"私有→公开"时间线。论文写作时口径为 “test set remained private”(挑战赛期间的事实),但 TCIA 已于 2024-08-28 全量公开含测试集在内的全部数据。引用 2023-2024 年间文献的测试成绩时注意:那时测试集确实私有;今天你拿公开测试集复现的成绩,与榜单成绩在访问历史上不同源——复现请只跑一次并以验证集做日常评测。

坑 4:DOI 占位符 2024-AAAA vs 正式 2025-d482。arxiv-vanity 等镜像页显示 MELBA DOI 为 10.59275/j.melba.2024-AAAA——这是排版系统的占位符。正式 DOI 为 10.59275/j.melba.2025-d482(论文 PDF 与 arXiv 官方记录一致)。引用前查 PDF 原文,别信镜像。

坑 5:许可双轨混写。"LNQ 是 CC BY 4.0"只在 TCIA 版成立;挑战赛版是注册制(EULA+容器)。写论文/数据卡时必须区分入口,否则审稿人或合规同事会来找你。

坑 6:命名家族混淆。LNQ / LNQ 2023 / Mediastinal-Lymph-Node-SEG(TCIA collection 名)/ LNQ-MELBA(专刊口径)指同一数据集。只拿 “LNQ” 检索会漏掉 TCIA 的数据页;只拿 collection 名检索会漏掉挑战赛文档。全名族并查。

坑 7:"全标注"误读。513 例中仅验证 20+测试 100 为全标注;训练 383 例是部分标注(临床工作流只勾临床相关灶)。把训练集当全监督标签直接训练,会把"检出了未标注淋巴结"错罚成假阳性——处理方案见 §3.3。

坑 8:层间距不对称。训练/验证 3.0mm vs 测试 3.8mm——测试域结构性更难。跨切分比较数字(如"验证集 DSC 75% 但测试只有 71%")时,先扣掉层厚差异再谈方法优劣;用 3D 插值把训练数据重采样到测试层距,是合理的对齐手段,但要在方法里写明。

10.1 十条快速自检(写 LNQ 相关内容时逐条打勾)

  1. 总例数写的是 513(不是 540)?
  2. 训练例数写的是 383(不是 393)?
  3. "全标注"只用于描述验证/测试 120 例?
  4. 引用 MELBA 论文 DOI 是 2025-d482(不是 2024-AAAA)?
  5. 许可表述区分了 TCIA 版(CC BY 4.0)与挑战赛版(注册制)?
  6. 提到测试集时标注了"2024-08-28 起公开"的时间线?
  7. DSC/ASSD 数字带了 bootstrap 置信区间?
  8. 检索/引用时用全名族(含 Mediastinal-Lymph-Node-SEG)?
  9. 提到层间距时区分了 3.0 与 3.8mm?
  10. 没有把尺寸阈值后处理当作"提分技巧"推荐?

§11 总结

LNQ 2023 用一场赛事回答了三个问题。纵隔淋巴结分割现在做到什么水平?——全监督+外部数据的最好成绩是 DSC 71.2%、ASSD 2.95mm,与器官分割的 90%+ 之间隔着一条"小目标鸿沟"。这样的基准怎么搭才可信?——513 例真实临床队列、双标注协议、rank-then-aggregate 名次聚合、bootstrap 稳定性(Kendall’s τ=1)、前排强制交码。数据能不能真正开放?——挑战赛注册制起步,终点是 TCIA CC BY 4.0 全量公开(35.27GB,DOI 10.7937/QVAZ-JA09)。

对三类读者各送一句:做分割算法的,这里有你逃不掉的小目标地板分与三条后处理反噬教训;做临床 AI 落地的,霍奇金病例的难度分层提醒你别用总分打包票;做数据集工程的,"临床工作流回收+统一评测协议+专刊论文"这条路径本身就是可复制的模板。

一段话速记版(转述给同事时用):

LNQ 2023 是 MICCAI 2023 的纵隔淋巴结 CT 分割挑战赛,513 例多癌种对比增强胸部 CT(训练 383 部分标注/验证 20/测试 100 全标注),任务是把纵隔里所有 >1cm 的淋巴结勾出来;评估用 DSC+ASSD 的名次聚合协议,208 支报名队里六强进测试,冠军 Skeleton Suns 用 nnU-Net 残差编码器+TotalSegmentator 背景伪标签+外部淋巴结数据的组合做到 DSC 71.2%、ASSD 2.95mm,名次稳定性 τ=1;数据 2024 年 8 月起在 TCIA 以 CC BY 4.0 全量公开,做研究直接下载即可,唯一要记住的坑是训练集是部分标注、测试层更厚。

FAQ(高频问答 46 问)

A. 基础认知

Q1:LNQ 是什么比赛的缩写?
Mediastinal Lymph Node Quantification——纵隔淋巴结量化挑战赛,MICCAI 2023 官方挑战赛之一,名次在其卫星会 LNQ workshop 上公布。

Q2:任务一句话是什么?
在对比增强胸部 CT 里,把纵隔内所有短轴径大于 1 厘米的淋巴结逐个勾出 3D 掩码——单类目标、单模态、纯分割任务。

Q3:谁组织的?
LNQ 组织委员会,核心成员来自 NYU Langone Health(一作 Anahita Dorent)、Brigham and Women’s Hospital(Andriy Fedorov)、MIM Software(Awais Mansoor)、Case Western Reserve University、University of Twente 等,提案文档有 11 位作者联署(Zenodo DOI 10.5281/zenodo.7844666)。

Q4:为什么只标 >1cm 的淋巴结?
1cm 短轴径是影像学"淋巴结值得报告"的经典阈值,任务定义直接对齐放射科工作流;更小的亚厘米级淋巴结不在本数据集的监督信号里。

Q5:数据是新的吗?
训练集不是——383 例回收自 2007-2020 年的临床试验工作流(当年为治疗决策勾画的灶);验证/测试集是为挑战赛新标的。数据"新"在协议与基准,不在采集。

Q6:论文在哪?
MELBA(Medical Imaging with Deep Learning)2025 Vol 3 专刊:DOI 10.59275/j.melba.2025-d482(2025-01-29 发表,CC-BY 4.0);另有 arXiv:2408.10069(2024-08-19)预印版。注意镜像站的 DOI 占位符 2024-AAAA 是错的(坑 4)。

Q7:它解决的最大卖点一句话?
把"纵隔淋巴结分割很难"变成了可测量的 71.2%——小目标分割的世界水平首次有了带置信区间的权威基准。

Q8:它的主要局限?
训练集部分标注(坑 7)、测试层更厚(坑 8)、单类目标不含纵隔其他结构、标注观察者间一致性未量化、人群偏肿瘤患者(前六癌种约占 60%)。

B. 数据与获取

Q9:一共多少数据?多大?
513 例患者(女 239/男 274):训练 383、验证 20、测试 100;TCIA 版总体积 35.27GB,含 1,026 个 series、66,870 幅图像。

Q10:去哪下载?
TCIA collection “Mediastinal-Lymph-Node-SEG”(DOI 10.7937/QVAZ-JA09,CC BY 4.0)直链下载;或经 NNB/NBIA 下载器批量取。挑战赛版在 lnq2023.grand-challenge.org 注册访问。

Q11:什么格式?
TCIA 版同时给 DICOM 原始序列与 NRRD 体数据,掩码为 NRRD 单标签体(淋巴结=1);Python 侧用 SimpleITK/nrrd 库即可读取。

Q12:影像规格是什么?
512×512 矩阵、面内 0.8-0.9mm、层间距训练/验证 3.0mm 与测试 3.8mm、每例 48-656 层(中位 114)、对比增强。

Q13:患者都是什么病?
以肿瘤患者为主:乳腺癌 80、CLL 74、NSCLC 58、霍奇金淋巴瘤 38、SCLC 30、肾细胞癌 25(前六约占 60%),其余分散在其他癌种。

Q14:训练集的"部分标注"到底是什么意思?
当年的临床软件只勾选治疗相关淋巴结灶,未勾区域不等于没有淋巴结。拿它训练时,模型检出未标注淋巴结会被损失函数错罚为假阳性——应对方案见 §3.3(坑 7)。

Q15:验证/测试集的标注怎么做的?
3D Slicer 4.11 的 Draw 工具沿轴向逐层徒手勾画,每层同步参照矢状与冠状面确认边界,医生复核后发布——全标注、穷尽式。

Q16:能商用吗?
TCIA 版为 CC BY 4.0,商用理论上可行但须署名并遵守其条款;建议商用前核对 TCIA 收藏页的许可声明原文,挑战赛版则受 grand-challenge EULA 约束,两码事(坑 5)。

Q17:测试集现在能拿到吗?
能。2024-08-28 起 TCIA 全量公开(含测试 100 例全标注);但挑战赛期间(2023 年)测试集确实私有——引用旧文献时注意时间线(坑 3)。

Q18:想要更多淋巴结数据去哪找?
同生态资源:TCIA CT Lymph Nodes(Roth 2015,90 例全标注)、Bouget 2023 精修版(89 卷/2,912 结)、St. Olavs 15 卷 384 结、NSCLC-Radiomics 等系列(§7.1)。

C. 挑战赛与评估

Q19:多少队伍参加?
208 支注册、16 支(5 国)进验证榜、6 支(3 国)进测试榜;验证期 2023-05-01 至 08-30,每队每日 3 次提交上限;测试截止 2023-09-20。

Q20:怎么评分?
两个指标:DSC(Dice 系数,越大越好)与 ASSD(平均对称表面距离,越小越好);聚合用 rank-then-aggregate——逐例逐指标排名后对名次求平均。

Q21:为什么用名次聚合而不是平均 DSC?
免疫离群病例与微小分数差的干扰:一例崩盘不会毁掉均值,0.2 个百分点的差距也不会被当成真实差距。配合 bootstrap 检验名次稳定性。

Q22:名次稳定吗?
bootstrap 下 Kendall’s τ=1(95% CI 0.87-1)——重采样几乎不改变六强排序,这是挑战赛里罕见的稳定性水平,引用冠军无需加"可能变动"限定。

Q23:冠军是谁?成绩多少?
Skeleton Suns(Deissler et al.):rank score 2.1,DSC 中位 71.2%(63.4-78.6%)、ASSD 中位 2.95mm(2.13-5.05mm),六强中唯一 ASSD 中位破 3mm 关口的队伍。

Q24:二三名是谁?
亚军 IMR(DSC 70.0%、ASSD 4.15mm)、季军 CompAI(69.0%、5.05mm);四至六名 Hilab、IMI、SKJP(2.5D EfficientNet-B7 路线,六强中唯一非 nnU-Net 系基座)。

Q25:前排要交代码吗?
要。规则明确最终榜前五名须提交代码与 Docker 镜像——LNQ 前排成绩全部具备可复核性,这在挑战赛生态里属于少见的硬要求。

Q26:霍奇金淋巴瘤病例为什么难?
bulky(巨大)与 conglomerate(成团)淋巴结带来"枚数歧义"与异质内部(坏死、融合边界),组间差异检验 p 值 0.009-0.27——用 LNQ 评测时建议按癌种分层报告。

D. 方法与复现

Q27:冠军用的什么模型?
nnU-Net 基座+大容量残差编码器(ResEnc 配置),不是自研架构——小目标分割的技术底座与大器官一致,差距在数据工程。

Q28:冠军的三件套配方是什么?
①nnU-Net+ResEnc 基座;②TotalSegmentator 器官预测做背景伪标签(模型在解剖语境里学定位);③外部全标注淋巴结数据(TCIA CT Lymph Nodes+Bouget 2023)预训练/联合训练。

Q29:我能直接跑出 71.2% 吗?
不能指望开箱即得——71.2% 是"基座+背景伪标签+外部数据"三件套的合奏。零成本起步先跑 nnU-Net 默认配置当 baseline,再按 §5.4 逐级加组件。

Q30:后处理删小连通域能提分吗?
大概率掉分——CompAI(误删小组件从榜首滑落)、IMI、IMR 三连反例都在 §5.3。目标本身就是小连通域时,任何尺寸阈值启发式都在和任务定义打架。

Q31:用哪个集做日常调参?
验证集 20 例(公开且全标注)。测试集虽已公开,但拿它反复调参会毁掉成绩的"基准"含义——复现榜单请只跑一次测试。

Q32:和 TotalSegmentator、AMOS 这类数据集什么关系?
同一技术栈(3D nnU-Net 系)、不同难度段:器官分割(DSC 85%+,见 instance2022/AMOS/TotalSegmentator/AbdomenCT-1K)与 LNQ 的小目标(71.2%)构成 CT 分割难度光谱;TotalSegmentator 还是冠军配方的直接组件。

E. 工程实操

Q33:NBIA 下载器怎么用?
TCIA 收藏页点 Download 生成 .tcia manifest 文件 → 安装 NBIA Data Retriever → 打开 manifest → 批量下载。全量 35.27GB;只要验证 20 例的话用 REST API 按 Subject ID 挑着下更快。

Q34:下载完怎么快速自检数据没坏?
三查:①影像与掩码的 NRRD 几何(shape/spacing)一致;②掩码值域仅 {0,1} 且非空;③验证/测试例的 3D 连通域个数在个位数到数十量级(§2.8 有自检代码)。

Q35:掩码里的连通域数就是淋巴结枚数吗?
不严格。成团淋巴结在 3D 连通域意义上是一枚——ndimage.label 的计数是工程代理口径,不是放射学口径;做计数类量化任务时要意识到这个歧义在参考标准里同样存在。

Q36:层厚不一致,训练前要重采样吗?
nnU-Net 自动处理(按训练集 median spacing 配置);自建管线建议统一重采样到 1.0-1.5mm 各向同性或保持面内分辨率+层向 2-3mm。淋巴结是小目标,层向过度下采样会直接抹掉目标(§2.9)。

Q37:评测 ASSD 时有什么几何陷阱?
算指标前把预测掩码重采样回原始 spacing——否则表面距离按重采样后的层厚计算,3.0 与 3.8mm 的差会直接混进 ASSD 数字里。

Q38:能用 LNQ 训练"检测亚厘米淋巴结"的模型吗?
不能。任务定义只含 >1cm 淋巴结,亚厘米目标不在监督信号里(部分标注训练集尤其如此);要研究亚厘米目标,需另找数据源并另行标注。

Q39:想给 LNQ 结果加解剖上下文(站点过滤等)怎么办?
用 TotalSegmentator 或 AMOS 系模型的器官预测做上下文特征(如纵隔 ROI 精修、血管邻近性过滤),这是榜单允许的输入端增强;注意别把器官预测当输出后处理去"删东西"(§5.3 教训)。

Q40:写数据卡/论文时的最小引用集是什么?
三条:TCIA 数据 DOI(10.7937/QVAZ-JA09)、MELBA 论文 DOI(10.59275/j.melba.2025-d482)、外加你实际使用的外部数据(如 Roth 2015)。BibTeX 骨架见 §6.5。

F. 边界与误用

Q41:LNQ 能用来评测"纵隔多结构分割"吗?
不能。掩码只有淋巴结一类(附录 E),没有血管/心脏/食管等结构标注;多结构评测请用 instance2022/AMOS/TotalSegmentator 系数据,LNQ 只答"淋巴结这一件事"。

Q42:能把验证 20 例并进训练集吗?
技术上可行(数据是 CC BY 4.0),但你的成绩将无法与验证榜/测试榜任何数字对表——评测锚点被你自己拆了。做基准研究别动切分;做纯应用另说,但要在论文里声明非官方切分。

Q43:外部数据的使用有边界吗?
挑战赛规则允许外部公开数据(冠军就是这么赢的),但外部数据的许可各自独立——Roth 2015 与 Bouget 2023 的引用与许可条款要逐个核对,别把"LNQ 开放"当成"所有相关数据都开放"。

Q44:模型在 LNQ 上成绩好,能直接上临床吗?
不能直接推。71.2% 意味着约三成的边界误差,且数据只覆盖 >1cm 淋巴结与肿瘤患者背景——临床部署需要独立的前瞻验证、亚厘米能力补充与科室工作流适配,LNQ 是研发基准不是放行证书。

Q45:亚厘米淋巴结研究有什么替代数据?
LNQ 明确不含亚厘米目标(任务定义使然,见 Q38/Q41);研究亚厘米目标需要另找带完整淋巴结标注的数据源并自行补标,或与临床合作按研究协议标注——引用 LNQ 时不要把它说成"全尺寸淋巴结数据集"。

Q46:发现第三方资料与本条目数字冲突时信谁?
按证据等级:MELBA 论文原文(最高)> TCIA 收藏页 > 官网存档 > 本条目(三源核验的转述)> 第三方聚合站(已知多处讹误,见坑 1/坑 2 与附录 G)。冲突数字先回论文 PDF 对原文。


事实清单(硬事实 45 条)

  1. LNQ = Mediastinal Lymph Node Quantification,MICCAI 2023 官方挑战赛,任务为 CT 纵隔内短轴径 >1cm 淋巴结的 3D 分割。
  2. 数据总量 513 例患者对比增强胸部 CT(女 239/男 274,采集 2007-2020)。
  3. 切分随机 76%/4%/20%:训练 383 / 验证 20 / 测试 100(论文 Table 1 口径)。
  4. 训练集为部分标注(临床试验工作流,Yunu/PIM 等软件勾选临床相关灶)。
  5. 验证/测试集(120 例)为全标注:3D Slicer 4.11,Draw 工具轴向逐层徒手勾画,参照矢状/冠状面,医生复核。
  6. 癌种前六占约 60%:乳腺癌 80、CLL 74、NSCLC 58、霍奇金 38、SCLC 30、肾细胞癌 25。
  7. 影像规格:512×512,面内 0.8-0.9mm,层间距训练/验证 3.0mm、测试 3.8mm,每例 48-656 层(中位 114)。
  8. 分发格式 NRRD(TCIA 版另含 DICOM);掩码为单标签 3D 体数据。
  9. 评估指标 DSC + ASSD;聚合协议 rank-then-aggregate(逐例逐指标排名→名次平均)。
  10. bootstrap 重采样下 Kendall’s τ=1(95% CI 0.87-1),六强名次稳定。
  11. 参赛漏斗:208 队注册 → 16 队(5 国)验证榜 → 6 队(3 国)测试榜。
  12. 验证期 2023-05-01 至 2023-08-30,每队每日 3 次提交;测试提交截止 2023-09-20。
  13. 规则要求最终榜前五名提交代码与 Docker 镜像。
  14. 冠军 Skeleton Suns(Deissler et al.):rank score 2.1,DSC 71.2 [63.4-78.6]%,ASSD 2.95 [2.13-5.05]mm。
  15. 冠军是六强中唯一 ASSD 中位 <3mm 的队伍。
  16. 冠军配方:nnU-Net + 残差编码器(ResEnc)+ TotalSegmentator 背景伪标签 + 外部全标注淋巴结数据(TCIA CT Lymph Nodes + Bouget 2023 精修版)。
  17. 亚军 IMR:DSC 70.0%、ASSD 4.15mm;季军 CompAI:DSC 69.0%、ASSD 5.05mm。
  18. 第四至六名:Hilab、IMI、SKJP;SKJP 为六强唯一非 nnU-Net 系基座(2.5D EfficientNet-B7)。
  19. 六强全部为全监督方案;五支以 nnU-Net 系为基座。
  20. CompAI 因误删小型连通域的后处理从榜首滑落;IMI 与 IMR 的最小尺寸后处理同样负收益。
  21. 霍奇金淋巴瘤病例显著更难(bulky/conglomerate),组间差异检验 p 值 0.009-0.27。
  22. 外部数据生态:TCIA CT Lymph Nodes(Roth 2015,90 例)、Bouget 2023 精修版(89 卷/387 灶/共 2,912 结)、St. Olavs(15 卷/384 结)。
  23. MELBA 专刊论文 DOI 10.59275/j.melba.2025-d482(Received 2024-08-20 / Published 2025-01-29,Vol 3,CC-BY 4.0)。
  24. arXiv 预印 2408.10069(v1 2024-08-19);镜像页 DOI “2024-AAAA” 为占位符。
  25. Zenodo 提案 DOI 10.5281/zenodo.7844666(2023-04-19,11 位作者联署)。
  26. TCIA collection 名 Mediastinal-Lymph-Node-SEG:2024-08-28 发布,CC BY 4.0,35.27GB,513 subjects / 1,026 series / 66,870 images,DOI 10.7937/QVAZ-JA09(引用 Idris et al. 2024)。
  27. 挑战赛版获取为注册制(grand-challenge EULA + 算法容器提交)。
  28. 论文写作时测试集私有(“test set remained private”),2024-08-28 起 TCIA 全量公开——时间线双口径。
  29. 第三方口径错误:selectdataset 写 540 patients(实为 513);aifasthub 写 393 训练例(论文为 383)。
  30. 组织方代表机构:NYU Langone Health、Brigham and Women’s Hospital、MIM Software、Case Western Reserve University、University of Twente 等;代表人物 Anahita Dorent、Andriy Fedorov、Awais Mansoor、Wenkui Yu。
  31. 官网规则页明确最终榜前五名须提交代码与 Docker 镜像;评估页公开 rank-then-aggregate 细节。
  32. 官网自称 completely open challenge;部分子页面(数据/提交说明)为 JS 动态渲染。
  33. 季军 CompAI 公开 GitLab 复现代码仓库;冠军 Skeleton Suns 配方全部由开源组件拼装(nnU-Net+TotalSegmentator+公开外部数据)。
  34. LNQ 无官方 HuggingFace 数据集镜像(HF 与 hf-mirror 均无官方库),获取以 TCIA 直链为唯一权威通道。
  35. 数据本体的身份字段:TCIA collection Mediastinal-Lymph-Node-SEG,513 subjects 唯一患者级键;series 1,026、images 66,870。
  36. 任务定义的纳入标准:纵隔内、短轴径 >1cm;掩码单类,不含站点/良恶性标签。
  37. 验证集 20 例的设计动机:小到无法喂饱过拟合、大到能区分好坏,配合每日 3 次提交限额。
  38. 测试集 100 例支撑 bootstrap 置信区间(冠军区间宽 15.2 个百分点 DSC——小样本不确定度的如实呈现)。
  39. 挑战赛评估经 grand-challenge 算法容器执行,参赛队挑战赛期间接触不到测试影像本体。
  40. 全标注协议为徒手逐层勾画(非半自动预生成+修边),保证边界语义一致性,代价是 1-2 像素徒手抖动进入 ASSD 噪声底。
  41. rank score 2.1 的读法:六队聚合分数约等于名次本身(2.1≈“绝大多数病例第一、偶尔第二”),冠军为统治级而非爆冷级。
  42. 亚军与季军的 1 个百分点分差(70.0% vs 69.0%)在名次聚合与 τ=1 背书下同为结构性差距,非评测噪声。
  43. 外部资源同源提醒:TCIA CT Lymph Nodes 与 Bouget 2023 为精修关系,不可当独立数据集重复计数(90+89 式加法是错的)。
  44. DICOM 层面 66,870 幅图像 ≠ 66,870 个样本;患者级样本量恒为 513,series 1,026 含同一患者的多序列。
  45. 训练集掩码上的任何统计(枚数/体积)都不是全标注口径;全标注口径统计只能基于验证/测试 120 例。

术语表(48 条)

术语 释义
LNQ Mediastinal Lymph Node Quantification,纵隔淋巴结量化挑战赛(MICCAI 2023)
纵隔(mediastinum) 两肺之间、胸骨与脊柱之间的胸腔中央区,心脏大血管/气管食管/淋巴结所在
淋巴结短轴径 影像报告淋巴结大小的标准径线;>1cm 为"值得报告"的经典阈值
DSC(Dice) Dice 相似系数:分割与参考的重叠度量,1 为完全重合
ASSD 平均对称表面距离:两分割表面间点到点的平均距离(mm),越小越好
rank-then-aggregate 先逐例排名再聚合名次的评测协议,免疫离群与微小分数差
Kendall’s τ 名次一致性统计量;τ=1 表示 bootstrap 重采样不改变排序
bootstrap 有放回重采样法,用于估计统计量置信区间
部分标注(partial annotation) 只勾选目标子集(此处为临床相关灶);未标注≠不存在
全标注(exhaustive annotation) 勾选所有符合标准的目标;未标注区域可视为背景
3D Slicer 开源医学影像平台;LNQ 全标注用其 4.11 版 Draw 工具
NRRD Nearly Raw Raster Data,医学影像体数据常用格式
TCIA The Cancer Imaging Archive,NCI 支持的开放肿瘤影像库
DICOM 医学数字影像通信标准;TCIA 分发的原始序列格式
nnU-Net 自配置 U-Net 分割框架,医学分割事实基线
ResEnc 残差编码器配置;冠军方案把 nnU-Net 编码器升级为大容量 ResEnc
背景伪标签 用现成模型(TotalSegmentator)推断的器官掩码当背景监督信号
TotalSegmentator 全身 CT 多结构分割工具(库内 totalsegmentator/422),冠军伪标签来源
CT Lymph Nodes Roth 等 2015 发布的 TCIA 淋巴结分割数据集(90 例)
Bouget 2023 对 CT Lymph Nodes 的精修再发布(89 卷/2,912 结,SAD 标注)
bulky / conglomerate 淋巴瘤术语:巨大淋巴结 / 多枚融合成团;LNQ 霍奇金病例的难度来源
CLL 慢性淋巴细胞白血病,LNQ 数据第二大癌种背景(74 例)
NSCLC / SCLC 非小细胞肺癌(58 例)/ 小细胞肺癌(30 例)
grand-challenge 医学影像挑战赛托管平台,LNQ 官网与评测基础设施所在
EULA 最终用户许可协议;挑战赛版数据的访问条件
MELBA Medical Imaging with Deep Learning,LNQ 专刊论文发表的期刊
NBIA / Data Retriever TCIA 的影像下载基础设施/配套下载器,manifest(.tcia)批量拉取
manifest(.tcia) TCIA 下载清单文件,NBIA 下载器按其逐 series 拉取
SimpleITK / nrrd Python 读取 NRRD/DICOM 体数据的常用库
spacing 体数据三轴物理间距;LNQ 关心 z 轴层间距 3.0/3.8mm
重采样(resampling) 把体数据按目标 spacing 插值;小目标任务的层向采样是生死线
连通域(connected component) 二值掩码中相互连接的前景区域;粗口径的"枚数"代理
patch 采样 训练时从体数据裁子块;nnU-Net 自动配置前景过采样
2.5D 逐切片(或薄块)处理、不建完整 3D 上下文的路线;SKJP 采用,列第六
站点(station) 纵隔淋巴结的解剖分区编号系统(如肺癌分期用);LNQ 掩码不含此信息
放疗靶区勾画 临床中淋巴结分割的主要用途之一;部分标注训练集的原始动机
分期(staging) 肿瘤 TNM 分期中 N(淋巴结)维度的判定,纵隔淋巴结评估的核心场景
rank score rank-then-aggregate 聚合后的最终名次分数(越小越好;冠军 2.1)
置信区间(95% CI) bootstrap 给出的区间估计;引用 LNQ 成绩时应连带引用
假阳性/假阴性 误检(把背景当淋巴结)/漏检或"检出未标注目标被错罚"(部分标注陷阱)
伪标签(pseudo-label) 用模型预测当监督信号;冠军用 TotalSegmentator 器官预测做背景
域偏移(domain shift) 训练与测试分布差异;LNQ 的层厚差是最小可测样例
grand-challenge 算法容器 平台的隔离评测机制:队伍交 Docker、平台跑数据
纵隔窗 观察纵隔结构常用的 CT 窗宽窗位预设;淋巴结与软组织在此窗下对比度有限
TNM 分期 肿瘤分期体系,N 维度即淋巴结受累;NSCLC 背景病例的核心临床语境
SAD 逐淋巴结空间标注口径(Bouget 2023 用语)
DICOM-SEG DICOM 的分割对象标准;TCIA 部分资源的掩码分发格式(LNQ 以 NRRD 为主)
前景过采样 训练采样策略:提高含前景 patch 的出现频率,小目标训练的标配

附录

附录 A:来源与抓取存照

来源 URL 抓取时点 用途
挑战赛官网首页 https://lnq2023.grand-challenge.org/ 2026-09-26 全称、任务定义(>1cm)、"completely open challenge"表述
官网规则页 lnq2023.grand-challenge.org/rules/ 2026-09-26 前 5 名交代码+Docker、赛程
官网评估页 lnq2023.grand-challenge.org/evaluation-guideline/ 2026-09-26 DSC+ASSD、rank-then-aggregate 细节
MELBA 论文 PDF https://www.melba-journal.org/pdf/2025:001.pdf 2026-09-26 Table 1/2/3、标注协议、bootstrap、数据声明(DOI 10.59275/j.melba.2025-d482)
arXiv 记录 https://arxiv.org/abs/2408.10069 2026-09-26 v1 2024-08-19、正式 DOI 交叉确认
Zenodo 提案 DOI 10.5281/zenodo.7844666 2026-09-26 2023-04-19、11 作者联署
TCIA 收藏页 DOI 10.7937/QVAZ-JA09(经 doi.org 解析) 2026-09-26 CC BY 4.0、35.27GB、513 subjects、1,026 series、66,870 images、2024-08-28
第三方(存照用) selectdataset(“540 patients”)、aifasthub(“393 cases”) 2026-09-26 口径错误证据(坑 1/坑 2)

核验过程备注(供复核者追溯):

  1. 官网子页面存在大小写路径陷阱:/Dataset/、/Rules/ 等大写路径返回 404,真实路径为小写(/data/、/rules/ 等)——从首页 HTML 的链接清单提取后重抓成功。
  2. 官网排行榜页为 JS 动态加载,静态抓取只得到 “Loading Results…”——六强数字因此改从 MELBA 论文 Table 3 获取(更权威且带置信区间)。
  3. TCIA 主站与 Zenodo 对 curl 不友好(超时/SSL 失败),改经 doi.org 解析 + WebFetch 获取元数据成功——数字与论文侧互证一致。
  4. MELBA 论文页无独立 HTML 版,PDF 直链(melba-journal.org/pdf/2025:001.pdf)下载后转文本提取表格——本条目所有论文侧数字均可回溯到该 PDF 的对应 Table。
  5. 第三方站点(selectdataset、aifasthub 等)数字与论文冲突,按坑 1/坑 2 存照处理——不采信,仅记录为"讹误存在证据"。

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 官网+MELBA 论文+TCIA 三页均开放可索引;但四套命名(LNQ/LNQ 2023/Mediastinal-Lymph-Node-SEG/LNQ-MELBA)增加检索摩擦(坑 6)
A 可获取性 9 TCIA CC BY 4.0 全量直链(35.27GB)+挑战赛注册制次入口;无任何请求制环节
I 可互操作 8 DICOM+NRRD 双格式、TCIA 标准分发、DOI 存档;扣分项:无官方 Python 加载器,NRRD 掩码需自接 SimpleITK/nrrd
M 元数据质量 8 论文表格完备(Table 1-3)+TCIA 元数据规范;训练集部分标注语义需读者自行消化(坑 7),第三方口径讹误多(坑 1/2)
S 可持续性 8 TCIA 平台长期维护+双 DOI 存档;grand-challenge 官网随赛事冻结但内容仍在线
综合评级 8.2/10(高) AI-Ready 光谱的头部样本:直链可取+许可宽松+文档权威+协议透明;主要扣分在标注语义不对称与命名混乱

附录 C:逐项证据链自证

关键数字 来源 位置
513 患者 / 383-20-100 切分 MELBA 论文 Table 1
女 239/男 274 / 2007-2020 MELBA 论文 数据节(Table 1)
癌种前六 80/74/58/38/30/25 MELBA 论文 Table 1
层间距 3.0/3.8mm、面内 0.8-0.9mm、48-656 层 MELBA 论文 数据节
3D Slicer 4.11 / Draw / 轴向徒手 MELBA 论文 注释协议节
208/16/6 参赛漏斗、5 国/3 国 MELBA 论文+官网 挑战赛结果节
rank-then-aggregate、Kendall’s τ=1 [0.87-1] MELBA 论文 评估协议节
冠军 DSC 71.2 [63.4-78.6]% / ASSD 2.95 [2.13-5.05]mm MELBA 论文 Table 3
IMR 70.0%/4.15mm、CompAI 69.0%/5.05mm MELBA 论文 Table 3
TotalSegmentator 伪标签 + 外部数据配方 MELBA 论文 Table 2(Skeleton Suns 方法行)
CompAI/IMI/IMR 后处理反噬 MELBA 论文 结果讨论节
霍奇金更难(p=0.009-0.27) MELBA 论文 失败分析节
前 5 名交代码+Docker 官网规则页 /rules/
TCIA 35.27GB/513/1,026/66,870/CC BY 4.0/2024-08-28 TCIA 收藏页 DOI 10.7937/QVAZ-JA09
Zenodo 2023-04-19/11 作者 Zenodo 记录页 DOI 10.5281/zenodo.7844666
arXiv v1 2024-08-19 arXiv 记录 abs/2408.10069

未能核验事项(诚实披露,正文引用处均已规避):

  1. 验证榜 16 队的完整名次与分数——官网排行榜 JS 动态加载未取到,且论文以测试榜为准;正文不做验证榜数字断言。
  2. 四至六名(Hilab/IMI/SKJP)的具体 DSC/ASSD 数值——论文 Table 3 有载但本轮抽取未逐格核对,正文只写方法特征(SKJP 2.5D EfficientNet-B7)。
  3. 组织委员会完整名单——已知 11 位提案联署作者与代表人物,未逐一列全;正文用"代表人物"口径。
  4. 标注 SOP 原文全文——官网 /rules/ 部分内容为动态渲染;正文协议描述以 MELBA 论文方法节为准。
  5. 每例淋巴结枚数的中位数统计——论文未给出该汇总口径,正文明确提示读者勿自行推算(§2.4)。

附录 D:评测协议复刻清单(想搭一个"LNQ 式"基准时逐条打勾)

数据层
├── 真实临床队列(多癌种/多中心),不追求"干净"分布
├── 随机切分并冻结:训练大头/验证小口(防过拟合榜)/测试足量(撑 bootstrap)
├── 双标注协议如实写明:哪些是部分标注、哪些是全标注
└── 域差异如实写明:不同切分的采集参数差异(LNQ:层厚 3.0 vs 3.8mm)

标注层
├── 统一工具与版本(LNQ:3D Slicer 4.11)
├── 勾画平面+交叉参照平面写进 SOP(LNQ:轴向主勾+矢状/冠状参照)
├── 纳入标准量化(LNQ:短轴径 >1cm)
└── 医生复核环节留痕

评测层
├── ≥2 个互补指标(重叠类 DSC + 距离类 ASSD)
├── rank-then-aggregate 名次聚合,不用裸均值
├── bootstrap 重采样报告名次稳定性(Kendall's τ)
└── 前排强制交代码/容器(可复核性)

发布层
├── 数据经可信仓库发布并挂 DOI(LNQ:TCIA,CC BY 4.0)
├── 论文挂开放许可(LNQ:MELBA CC-BY 4.0)
└── 时间线口径声明:哪些成绩来自"数据私有期",公开后如何复现

附录 E:数据字典(掩码语义与训练建议)

内容 语义 使用建议
掩码值 1 纵隔内短轴径 >1cm 淋巴结(单类,不分站点/性质) 直接当前景类训练;勿再细分
掩码值 0(训练集) 背景或未勾画的淋巴结(部分标注) 假阴性噪声区——见 §3.3 三种应对
掩码值 0(验证/测试) 纯背景(全标注) 可放心当真阴性
DICOM 序列 原始对比增强 CT 窗宽窗位自调;淋巴结观察常用纵隔窗
NRRD 体数据 重采样/对齐后的体数据(与掩码同几何) 训练主入口;与掩码逐体素对齐
亚厘米淋巴结 不在掩码里(任务定义之外) 别拿 LNQ 评全尺寸淋巴结检测

附录 F:冠军配方复现骨架(伪代码)

# 阶段 0:数据获取(TCIA 直链,CC BY 4.0)
#   tcia collection: Mediastinal-Lymph-Node-SEG(513 例,NRRD/DICOM)
#   外部数据: TCIA CT Lymph Nodes (Roth 2015) + Bouget 2023 精修版

# 阶段 1:背景伪标签(组件二)
#   对全部 LNQ CT 跑 TotalSegmentator -> 器官掩码
#   掩码值域映射: 非淋巴结器官=背景类(多类), 其余=待定

# 阶段 2:外部预训练(组件三)
#   在 CT Lymph Nodes + Bouget 上按 nnU-Net 流程预训练
#   目标类别: 淋巴结(单类); 允许跨域(腹/盆/胸)

# 阶段 3:LNQ 微调(组件一)
#   nnU-Net ResEnc 配置; 训练集 383 例(部分标注,硬训)
#   背景 = TotalSegmentator 器官伪标签 + 未标注区
#   验证: 20 例全标注; 每 epoch 算 DSC/ASSD

# 阶段 4:推理与自评
#   对验证 20 例推理 -> DSC/ASSD 逐例 -> 与论文验证榜对表
#   测试 100 例只跑一次(若复现榜单), 与 Table 3 对表
#   禁止: 尺寸阈值后处理(坑见 §5.3)

附录 G:常见错误口径对照表

你可能看到的写法 实际情况 出处
“540 patients” 513(论文+TCIA 双源) selectdataset(坑 2)
“393 training cases” 383(论文 Table 1) aifasthub(坑 1)
“DOI 10.59275/j.melba.2024-AAAA” 10.59275/j.melba.2025-d482 arxiv-vanity 镜像占位符(坑 4)
“LNQ 数据集 CC BY 4.0 开放” 仅 TCIA 版成立;挑战赛版注册制 混轨表述(坑 5)
“513 例全标注淋巴结分割数据集” 仅 120 例全标注;训练 383 部分标注 概括失真(坑 7)
“测试集不可获取” 2023-2024 年属实;2024-08-28 起 TCIA 全量公开 时间线(坑 3)
“Mediastinal-Lymph-Node-SEG 是另一个数据集” 就是 LNQ 的 TCIA collection 名 命名家族(坑 6)

附录 H:TCIA 下载与读取 step-by-step

Step 1 定位收藏页
  - 从 doi.org/10.7937/QVAZ-JA09 解析到 TCIA 收藏页(Mediastinal-Lymph-Node-SEG)
  - 核对四要素:CC BY 4.0 / 2024-08-28 / 513 subjects / 35.27GB
Step 2 生成清单
  - Download -> Image -> 生成 .tcia manifest
  - 只需要验证 20 例:改用 REST API 按 Subject ID 精准取
Step 3 批量下载
  - 安装 NBIA Data Retriever -> 打开 manifest -> 等待 35.27GB 落盘
Step 4 结构自检(抽样 3-5 例即可)
  - DICOM series 与 NRRD 影像层数一致
  - 掩码二值、非空、与影像同几何
  - 验证/测试例连通域数量级正常(个位数到数十)
Step 5 建立本地索引
  - 按 subject_id / split(train/val/test)/ 标注协议(partial/exhaustive)
    建 CSV 索引表——把"部分标注 vs 全标注"作为一等字段(坑 7 的工程化防线)
Step 6 训练/评测分流
  - 训练只用 383 例(记得部分标注语义)
  - 日常调参只用验证 20 例
  - 测试 100 例锁定,复现榜单时一次性使用

附录 I:癌种背景与使用注意(前六癌种逐行)

癌种 例数 纵隔淋巴结受累的临床语境 使用注意
乳腺癌 80 分期与疗效评估的常规评估区 分布相对"典型",适合当默认子群
CLL 74 血液肿瘤,纵隔淋巴结肿大常见且多发 多发弥漫病例多,枚数歧义上升
NSCLC 58 分期直接决定治疗策略(站点语义强) 与分期工作流结合研究价值最高
霍奇金淋巴瘤 38 bulky/conglomerate 病灶多 难度放大器:评测务必单独分层(§4.5)
SCLC 30 纵隔侵犯高发 病灶负荷大,边界融合常见
肾细胞癌 25 淋巴转移路径可经纵隔 例数最少的前六成员,分层统计功效有限

两条通用注意:其一,前六合计约占 60%,其余四成分散在其他癌种——分层报告时小子群的置信区间会很宽,别过度解读;其二,"癌种"是背景标签而非掩码属性,掩码本身不含病灶性质信息。

附录 J:版本与时间线总表(引用时对表用)

时点 事件 权威凭证
2023-04-19 挑战赛提案 Zenodo 存档(11 作者) DOI 10.5281/zenodo.7844666
2023-05-01 验证榜开放(每日 3 次提交) 官网/论文
2023-08-30 验证榜关闭 官网/论文
2023-09-20 测试提交截止(容器评测,测试集私有) 官网/论文
2023-10 MICCAI 2023 LNQ workshop 公布名次 会议
2024-08-19 论文预印 arXiv v1 arXiv:2408.10069
2024-08-20 MELBA 收稿(Received) 论文页
2024-08-28 TCIA 全量公开(CC BY 4.0,含测试集) DOI 10.7937/QVAZ-JA09
2025-01-29 MELBA 正式发表(Vol 3) DOI 10.59275/j.melba.2025-d482
2026-09-26 本条目三源核验抓取时点 见附录 A

附录 K:nnU-Net 复现命令骨架(标准用法,非官方脚本)

# 前提:nnU-Net v2 已安装,环境变量 NNUNET_RAW / NNUNET_PREPROCESSED 已配置
# 步骤 0 数据转换:TCIA NRRD -> nnU-Net Dataset 格式(imagesTr/labelsTr + dataset.json)
#   - 训练 383 例入 imagesTr;验证 20 例留作自评,不进训练
#   - labels 只含 {0 背景, 1 淋巴结};dataset.json 的 labels 字段对应
#   - 部分标注语义保留(不要试图"补零"未勾画区域)

# 步骤 1 计划与预处理(nnU-Net 自动配置 spacing/patch/增广)
nnUNetv2_plan_and_preprocess -d DATASET_ID --verify_dataset_integrity

# 步骤 2 基线训练(3d_fullres 默认配置)
nnUNetv2_train DATASET_ID 3d_fullres 0        # fold 0
#   进阶:改用 ResEnc 配置(对应冠军组件一)
nnUNetv2_train DATASET_ID 3d_fullres_resenc 0

# 步骤 3 验证集自评(20 例全标注)
nnUNetv2_predict -i VAL_DIR -o PRED_DIR -d DATASET_ID -c 3d_fullres
#   - 预测掩码重采样回原始 spacing 后再算 DSC/ASSD(附录 H Step 6 / Q37)

# 步骤 4 背景伪标签(组件二,进阶)
#   对 LNQ CT 跑 TotalSegmentator -> 器官掩码 -> 映射为多类背景并入训练标签
#   注意:淋巴结不在 TotalSegmentator 清单内,前景/背景互斥成立(§5.6)

# 步骤 5 外部数据预训练(组件三,进阶)
#   TCIA CT Lymph Nodes + Bouget 2023 先训 -> 权重迁移到 LNQ 微调
#   外部数据的许可与引用逐条核对(Q43)

# 禁用项:推理输出不做任何尺寸阈值过滤(§5.3 三连反例)

骨架只到"能跑"为止;冠军级成绩还需要在三件套上做完整工程(外部数据混合比例、增广细节、集成与否),以冠军论文与论文 Table 2 为准。

附录 L:常见误解 vs 事实速查

误解 事实
“数据集很大,适合从零预训练” 513 例是基准规模不是预训练规模;预训练请去外部数据(§5.2 组件三)
“513 例全标注,拿来就训” 仅 120 例全标注;训练 383 例部分标注,直接硬训会吃假阴性噪声(坑 7)
“DSC 71.2% 说明模型不行” 71.2% 是世界冠军水平;小目标的 71% 难度当量大器官的 95%(§2.6)
“删掉小连通域能清洗预测” 三连反例证明反降分;小连通域正是目标本身(§5.3)
“验证集 20 例太小没法用” 小是刻意的防过拟合设计;自评 DSC/ASSD 绰绰有余(§4.2)
“测试集不可得,没法复现” 2024-08-28 起 TCIA 全量公开(坑 3 的当前时点答案)
“LNQ 掩码区分淋巴结转移与否” 不区分;单类掩码,性质判断留给下游(§2.4)
“层间距统一 3mm” 测试集 3.8mm;预处理写死 3.0 会出事(坑 8)
“用 2D 切片模型更快更省” 2.5D 路线列第六;z 轴上下文对小目标是刚需(§5.5)
“TCIA 版和挑战赛版是两个数据集” 同一数据集的两个分发轨;许可与访问方式不同(坑 5/坑 6)

尾注

本条目为千方病案医数集 AI-Ready Wikipedia 之 LNQ 2023 条目。所有硬数字经官网(lnq2023.grand-challenge.org)、MELBA 专刊论文(DOI 10.59275/j.melba.2025-d482)与 TCIA 收藏页(DOI 10.7937/QVAZ-JA09)三源交叉核验,抓取时点 2026-09-26;与第三方口径的冲突已在 §10 八坑与附录 G 存照。条目立场:转引数字以论文与数据仓库为最终依据,第三方聚合站点仅作对照。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • instance2022 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • learn2reg — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 肺癌
  • rexgrounding-ct — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准 / 肺癌
  • lndb — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肺癌
  • asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集