LNDb (lndb) — 肺结节 CT 外部验证数据库与 Fleischner 随访挑战赛 — AI-Ready Wikipedia

葡萄牙波尔图 CHUSJ 单中心 294 例胸部 CT 与 1429 个唯一发现——LIDC-IDRI 的独立外部补充库,单盲标注暴露真实观察者间变异,附 312 次眼动追踪与 2017 Fleischner 随访四任务挑战赛

来源 葡萄牙波尔图 CHUSJ 单中心回顾性采集 2016–2018 胸部 CT(Siemens,层厚 1.0[0.5;1.0] mm,平面内像素 0.63±0.09 mm)+ 5 位放射科医生单盲标注(1,897 标注→1,429 唯一发现,含九特征评分、质心与分割)+ 312 次眼动追踪 + 2017 Fleischner 随访四任务挑战赛 + v4 医学报告结构化(292 份报告)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 10
LNDb (lndb) — 肺结节 CT 外部验证数据库与 Fleischner 随访挑战赛 — AI-Ready Wikipedia

信息速览

数据集名称LNDb (lndb) — 肺结节 CT 外部验证数据库与 Fleischner 随访挑战赛 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模294 例 CT(294 患者;164 例男性占 55.8%;中位年龄 66,范围 19-98);训练/验证集 236 + 独立测试集 58
接入方式葡萄牙波尔图 CHUSJ 单中心回顾性采集 2016–2018 胸部 CT(Siemens,层厚 1.0[0.5;1.0] mm,平面内像素 0.63±0.09 mm)+ 5 位放射科医生单盲标注(1,897 标注→1,429 唯一发现,含九特征评分、质心与分割)+ 312 次眼动追踪 + 2017 Fleischner 随访四任务挑战赛 + v4 医学报告结构化(292 份报告)
AI 就绪度

INFOBOX — LNDb 一屏速览

维度 内容
本质 独立采集的胸部 CT 肺结节数据库 + 派生挑战赛(非 LIDC-IDRI 子集/重标注)
官方定位 LIDC-IDRI 的外部补充库(external dataset complimentary to LIDC-IDRI),提供可比的独立外部验证
团队 INESC TEC(波尔图)+ CHUSJ 圣若昂中心医院 + FEUP + FMUP;组织者 João Pedrosa
数据 294 例 CT(CHUSJ 2016–2018);164 男性(55.8%);中位年龄 66
标注 5 位放射科医生(R1–R5)单盲;1,897 标注 → 1,429 唯一发现;九特征评分 + 质心 + 分割
独有资产 312 次眼动追踪阅读记录(库内首见);比 LIDC-IDRI 更彻底的 <3 mm 与非结节标注
划分 训练/验证 236 + 独立测试 58(测试标注公开)
三篇主文献 arXiv:1911.08434(数据集)/ MedIA 2021;70:102027(挑战赛)/ Scientific Data 2024;11:512(v4 报告标注)
挑战赛四任务 主挑战 Fleischner 随访分类 + 检测 + 分割 + 纹理(2017 Fleischner 指南 4 类)
挑战赛成绩 947 注册 / 11 有效提交;随访 κ 0.580、分割 Jaccard 0.567、纹理 κ 0.733
核心发现 LNDb 检测一致性 0.32低于 LIDC-IDRI 0.38(单盲+小节点多);CAD 跨库部署性能断崖(0.926→远低)
获取 Zenodo records/8348419 公开直链(~30.3 GB,非注册墙非请求制)
许可 数据集 CC BY-NC-ND(禁商用禁演绎)|论文 C CC BY-4.0|论文 B Elsevier
库内互链 lidc-idri19(上游参照)、luna16237(不可比的检测基准)、deeplesion17、nlst317

LNDb 是肺结节 AI 研究里一个"补短板"式的关键数据集:LIDC-IDRI 占据了这个领域近二十年的事实标准地位,但它有一个结构性缺陷——所有结节都来自美国多个机构、且采用"两轮非盲修正"的标注流程,放射科医生会互相看对方的标记再修正自己的结论。这带来两个后果:一是图像分布集中在北美人群与设备;二是标注一致性被流程人为抬高,掩盖了真实临床中医生"各看各的"时的不确定性。

LNDb 的回答是:换一个机构、换一套标注规程、重新采集一批 CT,用葡萄牙波尔图单中心的 294 例数据,以"单盲"(各医生独立标注、不互看)的方式测一次真实的观察者间变异,并把这份变异本身当作数据集的科学产出。它不是 LIDC-IDRI 的 2.0,而是它的一面对照镜——同一套九特征、同样的纳入标准,但不同的采集地、不同的协议、不同的难度剖面。本节目的核心任务,就是把这面镜子的三重划界讲清楚:它与 lidc-idri(19) 是互补参照而非版本迭代,与 luna16(237) 因评估协议差异不可直接比较,与 deeplesion(17) 在任务粒度与标注体系上完全不同。

导语读法三则:

  1. 只想下数据:直奔 §6——Zenodo records/8348419 是公开直链(CC BY-NC-ND),不用注册不用申请,但注意禁商用与禁演绎。
  2. 关心"LNDb 和 LIDC-IDRI 到底差在哪":直奔 §4 与 §9——单盲 vs 两轮非盲、单中心 vs 多中心、小节点占比、一致性数值,一段连读。
  3. 做外部验证实验设计:直奔 §7 与 §8——CAD 跨库性能断崖、LUNA16 不可比声明、Fleischner 随访任务定义,是选型与引用的直接依据。

§0 导读:这个数据集解决什么问题

肺结节计算机辅助诊断(CAD)的二十年,几乎是围绕 LIDC-IDRI 展开的。这个美国多中心数据库提供了 1,018 例胸部 CT 与四位放射科医生的详尽标注(分割+九特征评分),后续衍生的 LUNA16、Tianchi 等检测基准又进一步把它变成了标准化擂台。但"一个标准"同时意味着"一个盲区":当一个模型在 LIDC-IDRI 上刷到 0.9 以上的 CPM,我们其实不知道它是学会了"识别肺结节",还是学会了"识别 LIDC-IDRI 这个特定数据集"。换一批来自不同国家、不同扫描仪、不同人群的 CT,它还准吗?

LNDb 就是为回答这个问题而生的。它做了一件在数据集领域看似朴素、实则工程量巨大的事:在葡萄牙波尔图的一家医院,用与 LIDC-IDRI 相同的标注口径,重新采集并标注了 294 例胸部 CT。它的官方自述把这个意图说得很直白——“developed as an external dataset complimentary to LIDC-IDRI…allows the community to perform an external and comparable validation”(作为 LIDC-IDRI 的外部补充数据集开发……使社区能够进行外部的、可比较的验证)。

但 LNDb 不止于"再来一份"。它在设计上做了三个刻意的偏移,每一个都让这份数据具有独立的方法学价值:

  1. 单盲标注取代两轮非盲修正。LIDC-IDRI 的流程是"先各标、再互看、后修正",一致性因此只反映"判定误差"(这个发现算不算结节);LNDb 让五位医生各标各的、互不知情,一致性同时反映"判定误差+固定误差"(在 3D 图像里到底有没有找到它)。结果是 LNDb 的检测一致性(0.32)低于 LIDC-IDRI(0.38)——这不是标注质量更高或更低,而是更接近真实临床中医生独立工作时的状态。

  2. 标注所有尺寸结节,不止 ≥3 mm。LIDC-IDRI 要求医生聚焦 ≥3 mm 结节;LNDb 的主任务明确是"找出所有结节,不论尺寸"。这直接导致 LNDb 里 <3 mm、<5 mm 的小结节比例显著更高(尤其 R2、R5 两位医生),检测任务因此更难,分割的 Jaccard 也更低。

  3. 记录眼动数据。LNDb 在医生标注过程中采集了 312 次 CT 阅读的眼动追踪记录——这在库内是独一份的资产,它把"医生看到了哪里、忽略了哪里"变成了可研究的信号,为"CAD 应作为医生的盟友而非对手"这一设计哲学(论文原文 “allies of radiologists rather than as competition”)提供了数据底座。

在这批数据之上,团队又组织了 LNDb 挑战赛(与 ICIAR 2020 会议合办),把问题从"检测一个结节"升级为"给出临床随访建议"——依据 2017 Fleischner 学会肺结节指南,从 CT 预测患者该多久复查。挑战赛含主挑战(Fleischner 分类)加三个子挑战(检测、分割、纹理),947 人注册、11 份有效提交,最佳结果在随访预测上达到 quadratic weighted Cohen’s kappa 0.580。2024 年,团队又发布 LNDb v4,把 292 份医学报告结构化并与图像注释做匹配,首次把"放射科医生文字描述了什么"与"图像上标了什么"对齐,让文本与图像两条标注来源可以互相印证。

§0 读法三则:

  1. 本条目是"独立采集数据集 + 观察者间变异研究 + 挑战赛基准 + 版本迭代(v1–v4)"的复合体,四部分的时间线与许可各不相同(§2、§6)。
  2. 全文硬数字以 arXiv:1911.08434(数据集论文,含一致性详表)、MedIA 2021(挑战赛论文)与 Zenodo records/8348419(官方文件清单)为三源,第三方转引口径(如"1018 结节"“1033 lesions”)已在 §10 坑点与 §9 存照。
  3. 理解 LNDb 的关键动作是"与 LIDC-IDRI 逐项对照"(§4)与"与 LUNA16 划清不可比性"(§7)——不做这两步对照,就会把它的价值误读成"又一个小一号的 LIDC-IDRI"。

§1 数据集速览:十问十答

Q1:LNDb 和 LIDC-IDRI 是什么关系?
官方定位是"外部补充库"——不是子集、不是重标注、不是版本迭代,而是独立采集的对照队列。两者共享九特征评分体系与相似的纳入标准,但采集机构、地域、协议、难度剖面都不同。用途上:LIDC-IDRI 用于训练/内验,LNDb 用于独立的外部验证。

Q2:294 例从哪来?
葡萄牙波尔图圣若昂中心医院(Centro Hospitalar e Universitário de São João,CHUSJ),2016 至 2018 年间回顾性采集。全部在 CHUSJ 伦理委员会批准下获得,采集前完成去标识(仅保留患者出生年份与性别)。没有一例是为本数据集专门扫描的。

Q3:谁标的、怎么标的?
5 位放射科医生(R1–R5),每人至少 4 年经验,采用单盲方式独立标注。标注分配不均:90 例由 3 位医生标、145 例由 2 位、59 例仅 1 位。每位医生实际标注的 CT 数:R1 125 / R2 90 / R3 81 / R4 162 / R5 161。

Q4:标了多少东西?
5 位医生累计产生 1,897 条标注,去重后对应 1,429 个唯一发现(unique findings)——包含各尺寸结节与非结节可疑病变。每条含质心坐标、分割掩码与九项主观特征评分。

Q5:九特征是哪九个?
subtlety(隐蔽度)、internal structure(内部结构)、calcification(钙化)、sphericity(球形度)、margin(边缘)、lobulation(分叶)、spiculation(毛刺)、texture(纹理)、malignancy(恶性度)。与 LIDC-IDRI 同套。评分范围:internal structure 1–4、calcification 1–6、其余 1–5。

Q6:什么是 Fleischner 随访任务?
2017 年 Fleischner 学会发布的肺结节管理指南,依据结节数目、体积(<100 mm³ / 100–250 mm³ / ≥250 mm³)与纹理(solid/part solid/GGO)给出复查建议。LNDb 挑战赛的主任务就是让算法从 CT 直接预测这个随访类别。

Q7:挑战赛有哪些任务、结果如何?
四部分:主挑战 Fleischner 随访分类 + 子挑战 A 检测 + 子挑战 B 分割 + 子挑战 C 纹理分类。947 人注册、11 份有效提交。结果:随访 quadratic κ 0.580、分割 Jaccard 0.567、纹理 quadratic κ 0.733;检测在 1 FP/scan 下灵敏度 <0.4(agreement 1)/<0.7(agreement 2)。

Q8:眼动数据是怎么回事?
医生标注时同步采集眼动追踪,共 312 次 CT 阅读记录。用途是研究观察者注意力、医学图像上的搜索行为,以及人机协作(CAD 作为"第二双眼睛")的设计依据。这是库内独有的数据类型。

Q9:我现在能拿到什么、怎么拿?
Zenodo records/8348419 公开直链,约 30.3 GB:CT(.mhd/.raw)、分割掩码、标注 CSV(allNods.csv / chars_trainNodules.csv / rad2Fleischner.csv / text2Fleischner.csv / report.csv 等)、测试集、README、脚本。不需要注册、不需要申请,但许可是 CC BY-NC-ND——禁商用、禁演绎。

Q10:为什么它对 AI-Ready 重要?
它是"外部验证专用数据集"的教科书样本:明确反对自己成为另一个训练集,而是把"跨机构/跨协议泛化"做成可测量的实验。它同时暴露了 CAD 的真实软肋——同一网络在 LIDC-IDRI 上 0.926 灵敏度 @0.25 FP/scan,换到 LNDb 却要 5.99 FP/scan 才追上平均医生。这种"性能断崖"的可见性,正是一个 AI-Ready 数据集最该提供的价值。

§2 数据构成与规格

2.1 规模、来源与机构构成

LNDb 的 294 例 CT 全部来自单一机构:

维度 规格
采集机构 CHUSJ(Centro Hospitalar e Universitário de São João,葡萄牙波尔图)
采集年代 2016–2018(回顾性)
患者数 294(1 患者 1 例,患者级采集避免重复)
性别构成 男性 164 例(55.8%)
年龄 中位 66;最小 19、最大 98
标注医生 5 位(R1–R5),各 ≥4 年经验
标注协议 单盲(各医生独立,不互看)

单中心设计与多中心的 LIDC-IDRI 形成直接对照。单中心的好处是设备与人群高度同质——全部 Siemens 扫描仪、全部葡萄牙人群,因此数据集内部的图像风格一致;代价是跨机构泛化测试的价值全靠"与外部对照"来体现,它本身不能作为多机构覆盖的代表。对使用者的含义:拿 LNDb 做外部验证时,你测的是"从你的数据泛化到波尔图单中心"这一特定方向,而非"泛化到全世界"。

2.2 采集参数(Table I 全转)

这是评估"图像域漂移"的关键信息:

参数 取值
扫描仪型号 Siemens Sensation Cardiac 64 = 107(36.4%)/Siemens Somatom Definition Flash = 59(19.5%)/Siemens Somatom go.Up = 137(45.2%)
管电压峰值 kV 120 [100;140]
平均管电流 mA 161.9 ± 128.4
卷积核 Standard 4(1.4%)/Sharp 160(54.6%)/Very sharp 126(43.0%)/Extremely sharp 3(1.0%)
平面内像素尺寸 0.63 ± 0.09 mm
层厚 1.0 [0.5;1.0] mm
图像层数 318.5 [251;631]

三处值得强调:

  1. 全部 Siemens:三种型号覆盖低端到高端,但没有 GE、Philips、Canon 等其他厂商。论文明确把这一点列为泛化性局限——模型在 LNDb 上表现好,不代表对非 Siemens 设备也好。库内多条外部研究(如 LungMate)都引用了这个局限。
  2. 层厚 1.0 mm 上限(含 0.5 mm):纳入标准明确"排除层厚 >1 mm 者"。这与 LUNA16 的">2.5 mm 排除"口径不同——LNDb 的层厚更薄、更细,这正是 CAD 跨库性能下降的原因之一(论文归因:“the slice thickness distribution is significantly different between the two databases”)。
  3. 层数 251–631:单例体数据规模适中,适合 3D 网络端到端训练,不会像某些高分辨率队列那样爆显存。

2.3 纳入与排除标准

LNDb 的纳入标准基于 LIDC-IDRI 标准改造,流程如下:

  • 纳入:>18 岁的患者;无既往癌症史
  • 排除(图像层面):使用静脉造影剂的 CT;层厚 >1 mm 的 CT
  • 排除(阅读层面):某位放射科医生首次阅读时若发现其他肺病理、噪声、运动或其他伪影,则该 CT 排除
  • 排除(结节层面):首次阅读若发现 >6 个结节或单个结节平面内 >30 mm,则该 CT 排除
  • 注意阈值方向的差异:纳入阶段的">6 结节排除",与标注阶段的"标注时发现 >6 结节不作为排除理由"——两条规则作用于流程的不同阶段,转述时不可混为一谈(§10 坑点 7)

2.4 五位医生的标注分配

医生 标注 CT 数
R1 125
R2 90
R3 81
R4 162
R5 161

按"每例 CT 被几位医生标注"统计:

每例 CT 的标注医生数 CT 数
3 位医生 90
2 位医生 145
1 位医生 59
合计 294

这个分布有一个直接的方法学后果:"agreement level"在不同 CT 上的含义不一致。如果一个明显结节所在的 CT 恰好只被 1 位医生标注,那么该结节的一致性水平就是 1(“所有标注者都同意”),但这显然高估了真实共识。正因如此,LUNA16 用"取 agreement level≥3 结节"来构造评估集的做法在 LNDb 上无法套用——论文明确声明"a direct comparison between LUNA16 and LNDb results not feasible"(§7 详述)。

2.5 训练/验证/测试划分

划分 CT 数 说明
训练/验证集 236 挑战赛期间用于提交与调参
测试集 58 v2 起公开标注;挑战赛评估仍开放接收提交
合计 294 —

挑战赛的评估设计把测试集(58 例)的标注 withheld,参赛者提交预测后由组织方评测。v2(2022-10)把测试文件加入 Zenodo 仓库,使得第三方也能在统一测试集上复现——这是本数据集可复现性的重要一步。

2.6 唯一发现、标注量与"未去重"的信息

项 数值
总标注(5 位医生累计) 1,897
唯一发现(去重后) 1,429
含内容 结节(各尺寸)+ 非结节可疑病变
每条标注内容 质心 + 分割 + 九特征评分

“1,897 → 1,429"的差额本身就是观察者间变异的一个侧面:同一位患者身上同一个结节可能被多位医生各自标了一次,去重后才算一个"发现”。1,429 这个口径在数据集论文与 2025 年 Nature 子刊综述中一致(Table 8),是本条目采用的标准口径。

2.7 独有资产:312 次眼动阅读记录

LNDb 在医生标注过程中采集了眼动追踪数据,共 312 次 CT 阅读记录(readings)。这是数据集论文明确强调的差异化设计,论文原文:

“the fact that eyetracking was used during manual annotation of the images allows for the development of collaborative strategies for CAD, ensuring that CAD systems are designed as allies of radiologists rather than as competition.”

眼动数据的价值在于它记录的不只是"结论"(这是不是结节),还有"过程"(医生的视线在哪些区域停留、哪些区域被略过)。这对两类研究尤其关键:

  1. 观察者行为研究:为什么某些结节被漏检?是"没看到"(fixation error)还是"看到了但判断为非结节"(decision error)?眼动数据能区分这两者——这正是 LNDb 单盲标注比 LIDC-IDRI 更能暴露"固定误差"的原因。
  2. 人机协作设计:CAD 系统应该在哪里提示才能最有效?眼动数据能告诉设计者医生"巡逻"的路径与盲区。

遗留疑点:312 次眼动记录在论文中被提及,但在 Zenodo v4 的公开文件清单中未见独立的 eye-tracking 文件(可能是压缩包内的隐藏文件,或需另行申请)。使用者若专门需要眼动数据,建议先核对压缩包内容或联系作者。

§3 与 LIDC-IDRI 的对照:为什么需要第二面镜子

3.1 两套标注协议的根本差异

理解 LNDb 价值的关键,是理解它与 LIDC-IDRI 在标注协议上的根本不同:

维度 LIDC-IDRI LNDb
机构 美国多中心(多机构) 葡萄牙单中心(CHUSJ)
规模 1,018 例 CT 294 例 CT
标注者 4 位放射科医生 5 位放射科医生
标注协议 两轮:先盲标 → 互看修正 单盲:各标各的,不互看
标注对象 聚焦 ≥3 mm 结节 所有尺寸结节 + 非结节
小节点占比 低 高(尤其 R2/R5)
眼动数据 无 有(312 readings)
结节总数 >2,600(≥3 mm) 1,429 唯一发现(全尺寸)

其中最关键的是协议差异:LIDC-IDRI 的两轮流程(“first, each radiologist marked lesions in a blinded fashion; then, in a second unblinded round, they reviewed each other’s marks to finalize their own annotations”)是一个共识收敛过程——医生们在第二轮看到别人的标记后修正自己,最终的一致性因此被人为抬高。而 LNDb 的单盲流程不提供这个收敛机会,医生们各自独立完成,最终一致性反映的是"真实临床中各自工作时"的状态。

3.2 一致性含义的数学后果

这个协议差异带来一个微妙的后果,论文用了一整段来解释:

“The LIDC-IDRI detection agreement can be solely attributed to decision error…On LNDb, however, the detection agreement compounds the decision and fixation errors, i.e. the process of actually finding a nodule in the 3D CT image.”

翻译过来:LIDC-IDRI 的检测一致性只反映"两位医生对同一个已找到的发现判断是否一致"(decision error);LNDb 的一致性还叠加了"两位医生是否都真正找到了这个结节"(fixation error)。因此:

  • LIDC-IDRI 的高一致性部分是流程的产物,不是纯粹的真实变异性度量
  • LNDb 的较低一致性更接近真实临床,因为它没有经过修正收敛

再加上 LNDb 小节点占比更高(小节点更难判定"算不算结节"),decision error 也被放大。两个因素叠加,使 LNDb 的检测一致性(0.32)低于 LIDC-IDRI(0.38)成为合乎预期的结果,而非标注质量更差。

3.3 与库内 lidc-idri(19) 的划界

在千方病案医数集库内,这两条目的定位必须清晰区分:

  • lidc-idri(rid 19):肺结节 CT 影像的参考数据库(reference database)——规模最大、标注最全、事实标准。它是这个领域多数模型的训练基础。
  • lndb(本条目):外部验证专用库——不追求规模与训练用途,追求"独立、可比、暴露真实变异"。

正确的关系是互补对照,不是版本迭代。检索者若把 LNDb 当作"LIDC-IDRI 的更新版"会完全误解其设计意图;若把它当作"训练数据扩充"则用错了它的长处。它的正确用法是:在 LIDC-IDRI 上训练或调参,在 LNDb 上测外部泛化,并把两者的性能落差本身作为研究对象。

3.4 与库内 luna16(237) 的划界

LUNA16 和 LNDb 都是"肺结节检测基准",但构建逻辑正好相反:

维度 LUNA16(rid 237) LNDb(本条目)
来源 从 LIDC-IDRI 筛选(排除 >2.5 mm 层厚等) 新采集独立队列
规模 888 CT / 1,186 结节(≥3 mm) 294 CT / 1,429 唯一发现(全尺寸)
样本标准 结节需 ≥3/4 医生接受 各 CT 标注医生数可变(1–3 位)
评估协议 FROC + CPM(限 agreement≥3) Ad/Jaccard/kappa + Fleischner 随访
与 LIDC-IDRI 关系 派生(子集) 独立(对照)
性能可比性 与 LIDC-IDRI 同源可比 论文明确声明与 LUNA16 不可直接比

LNDb 论文对"不可比"的声明是明确且带技术理由的:

“These inherent differences in annotation and agreement mean that the criteria used in LUNA16 for computing performance (limiting to nodules with agreement level of 3 or higher) could not be used, which makes a direct comparison between LUNA16 and LNDb results not feasible.”

即:LUNA16 的评估集要求结节被至少 3 位医生接受,而 LNDb 的各 CT 标注医生数从 1 到 3 不等,根本无法构造"所有结节都有 ≥3 位医生背书"的子集。因此,任何把 LNDb 的检测分数与 LUNA16 排行榜直接比较的做法都是方法学错误的。LNDb 的定位恰恰是:因为无法对齐 LUNA16 的协议,所以它提供了一个协议之外的、更接近临床的评估视角。

§3 读法三则:

  1. 与 lidc-idri(19) 对照记为"互补",与 luna16(237) 对照记为"不可比",这两个结论要牢记。
  2. 看到任何声称"LNDb 检测 CPM 达到 X"的论文,先检查它是否忽略了"不可比"声明。
  3. LNDb 的一致性数字(0.32)不是"比 LIDC-IDRI 差",而是"用不同协议测的"——引用时必须带上协议背景。

§4 挑战赛:从"数据集"到"四任务链"

4.1 挑战赛设计哲学:为什么不是"再办一场检测赛"

绝大多数肺结节挑战赛(LUNA16、DSB2017)都只考检测——把结节找出来、算 FROC 曲线。LNDb 挑战赛(LNDb Challenge on Automatic Lung Cancer Patient Management)的设计者刻意避开了这个套路,而是把临床路径拆成一条任务链:

官方任务陈述:“participants are asked to automatically detect and segment the nodules, classify their texture, and provide a follow-up recommendation according to the Fleischner guidelines.”

四个任务串联起来,覆盖的是"一位放射科医生读完一套 CT 后需要交付的全部内容":

  1. 检测(Detection)——找出所有结节位置
  2. 分割(Segmentation)——给出每个结节的 3D 边界
  3. 纹理分类(Texture Characterization)——判定 solid / part-solid / GGO
  4. 随访推荐(Follow-up Recommendation)——按 Fleischner 指南给出"多久后复查"

前三项是图像层任务,第四项是决策层任务。这个"从像素到决策"的链条,是 LNDb 挑战赛区别于库内所有其他肺癌条目的核心特征。

4.2 主挑战详解:Fleischner 随访推荐

主挑战(Main Challenge)的输入是一套完整 CT + 该 CT 上所有被标注结节的质心坐标,输出是一个随访类别。类别体系直接取自 2017 Fleischner Society 肺结节随访指南,共 4 类,判定依据三个变量:

判定变量 取值 说明
结节数目 单个 / 多个 单发 vs 多发
结节体积 <100 mm³ / 100–250 mm³ / ≥250 mm³ 三个体量档
结节纹理 solid / part-solid / GGO 实性/部分实性/磨玻璃

为什么选 Fleischner 而不是"良恶性二分类"? 论文给出了一个务实的理由:病理金标准(活检/手术)在筛查人群中稀缺——绝大多数被检出的结节不会走到病理验证。若强行做良恶性分类,标签会高度依赖"随访随访出来的临床结局"这个代理指标,噪声极大。而 Fleischner 推荐是医生在真实临床中必须交付的、可逐例复现的决策输出,它有明确规则、有临床共识、不需要病理金标准。这使主挑战成为一个"可严格评分、临床有意义、标签无争议"的任务。

评分用 quadratic weighted Cohen’s kappa(二次加权科恩卡帕)——因为随访类别是有序的(比如"3 个月复查"与"6 个月复查"的差别小于"3 个月复查"与"无需随访"),标注错误应有不同惩罚。线性加权或无序 kappa 都不合适。挑战赛最终最大 kappa 为 0.580。

4.3 三个子挑战

Sub-Challenge A:结节检测(Nodule Detection)

输入 CT,输出结节位置列表。评估沿用 FROC 风格:报告不同 FP/scan 水平下的灵敏度,并分别按两个 agreement level 统计:

  • agreement level 1:只要被任意一位标注该 CT 的医生标过即算真阳性
  • agreement level 2:需被至少两位医生标过才计入真阳性集合

结果:灵敏度 <0.4(agreement 1)/ <0.7(agreement 2)@ 1 FP/scan。这个数字低于 LUNA16 上的典型成绩,原因有两层:一是 LNDb 的小结节比例更高(更难),二是单盲协议下"被两位医生独立找到"的比例天然更低——这个低分是数据集设计想要暴露的真实难度,而不是"任务变简单了但队伍变弱了"。

Sub-Challenge B:结节分割(Nodule Segmentation)

输入 CT + 给定结节的质心,输出结节 3D 掩码。注意"给定质心"这个设计:它把检测误差与分割误差解耦,专门考分割算法本身,避免"检测漏了导致分割无从谈起"。评估指标为 Jaccard 指数(交并比)。结果:最大 Jaccard 0.567。

这个数字有意思的地方在于它超过了观察者间变异性:数据集论文报告医生之间的分割 Jaccard 一致性为 0.57±0.14(见 §5),而挑战赛第一名达到 0.567——即算法已经达到了"一位医生 vs 另一位医生"的一致性水平。这通常被解读为"该任务已基本被解决"的信号,但也需要对小节点的分割做具体分析。

Sub-Challenge C:结节纹理分类(Texture Characterization)

输入 CT + 结节位置,输出三分类:solid / part-solid / GGO(实性 / 部分实性 / 磨玻璃)。评估用 quadratic weighted Cohen’s kappa(因为 solid→part-solid→GGO 是"实性程度递减"的有序谱)。结果:最大 0.733。

论文特别指出 part-solid(部分实性)是最难分类的类别——它在图像上介于 solid 与 GGO 之间,"实性成分占多少算 part-solid"本身就有主观性,医生之间也难达成一致。

4.4 参赛规模与结果解读

947 位用户注册(grand-challenge 平台),最终收到 11 个有效提交(至少参与一个子挑战)。

注册数 vs 有效提交数的巨大落差(947:11,约 1.2%) 本身是一个值得记录的现象。它反映了这类"多任务链"挑战的参与门槛:主挑战需要参赛者不仅做检测,还要把检测结果接续到纹理分类、再接续到 Fleischner 规则映射——这是一个完整的系统集成任务,而非单一模型的比拼。多数注册者可能在评估了工作量后放弃。

四任务汇总:

任务 评估指标 最佳成绩 备注
主挑战(Fleischner 随访) quadratic weighted kappa 0.580 有序 4 类
Sub A(检测) 灵敏度 @ 1 FP/scan <0.4 (agr.1) / <0.7 (agr.2) 双 agreement level
Sub B(分割) Jaccard 0.567 已超医生间一致性 (0.57)
Sub C(纹理) quadratic weighted kappa 0.733 part-solid 最难

结果解读三则:

  1. 分割任务基本成熟:0.567 已逼近医生间上限,继续堆算力的边际收益低;后续研究应转向"小节点分割"与"跨协议泛化"。
  2. 检测任务仍是瓶颈:两个 agreement level 下都没超过 0.7,说明"找出所有结节"(尤其小结节)依然依赖标注协议的选择。
  3. 决策层任务(随访)最难:0.580 远低于纹理分类的 0.733,说明"从图像特征映射到临床决策"这一步的信息损失最大——这正是 LNDb 挑战赛最有价值的设计选择:它把评测的重点放在了最难的那一环。

§5 获取、许可与文件清单

5.1 license:CC BY-NC-ND 的三层结构与常见误读

LNDb 的许可状况是本条目最需要"逐层拆开"的部分,因为数据集、论文、衍生报告三者许可不同:

资产 许可 说明
数据集本体(Zenodo records/8348419) CC BY-NC-ND 署名-非商业-禁止演绎
论文 A(arXiv:1911.08434) arXiv 默认(非独占) 预印本
论文 B(MedIA 70:102027) Elsevier 版权 订阅制
论文 C(Scientific Data 11:512) CC BY-4.0 开放获取
v4 报告派生标注 随数据集(CC BY-NC-ND) 由 v3/v4 加入

Zenodo 页面给出的官方解读原文:

“YOU ARE GRANTED ACCESS TO THE DATASET FOR USE IN YOUR RESEARCH AS LONG AS YOU CREDIT OUR WORK/PUBLICATIONS, BUT YOU CANNOT CHANGE THEM IN ANY WAY OR USE THEM COMMERCIALLY”

CC BY-NC-ND 的两个限制需要逐条辨析:

  • NC(非商业):商业产品的训练、商业公司的内部研发、SaaS 产品的后端使用都受限。这是 LNDb 与 LIDC-IDRI 在使用自由度上的关键差异点之一(LIDC-IDRI 为 CC BY 3.0,允许商业使用)。任何想用 LNDb 做商用模型的企业必须先获得作者授权。
  • ND(禁止演绎):不得发布修改版。注意这个限制的边界:在 LNDb 上训练模型、发布模型权重、发表基于 LNDb 的实验结果,通常不构成"演绎"(因为你不是在分发数据集的修改版);但重新标注、重新分割、并把结果作为衍生数据集发布,则会触碰 ND 条款。这是使用 LNDb 时最容易被忽略的合规问题——重标注 LNDb 并公开发布,法律上是高危操作(对照库内 panda-plus(560) 重标注 PANDA 并公开分发,其可行性依赖于 PANDA 本体为 CC BY-NC-SA 而非 ND——ND 是比 SA 严格得多的限制)。

常见误读警示:

  • 误读 1:“论文 C 是 CC BY-4.0,所以数据也是 CC BY-4.0”——错。论文授权与数据授权分离。
  • 误读 2:“arXiv 预印本公开,所以数据可商用”——错。预印本可读 ≠ 数据集可商用。
  • 误读 3:“既然禁止演绎,我就不能做数据增强/预处理了”——错。为训练而做的内部预处理不构成对外分发演绎版;但把预处理后的版本对外发布则是。

5.2 获取方式:公开直链,无需申请

与库内部分条目(如 panda-plus 的注释掩码需向通讯作者申请)不同,LNDb 本体在 Zenodo 上是公开直链下载:

  • 主入口:https://zenodo.org/records/8348419(v4)
  • 无需注册、无需机构邮箱、无需 DUA(数据使用协议)签署
  • 挑战赛页面:https://lndb.grand-challenge.org/

这意味着:任何研究者可以在几分钟内完成下载并开始工作,工程门槛极低。这也是 LNDb 被广泛用作外部验证集的实用原因之一——作为对照实验的数据源,低获取摩擦是重要的。

5.3 v4 文件清单详解(总 ~30.3 GB)

Zenodo v4 的文件结构按功能分为四组:

(1)CT 图像本体(约 30.3 GB 的主要部分)

文件 大小 内容
data0.rar – data5.rar 各 3.8–4.2 GB,共 ~24.3 GB 训练/验证集 CT(236 例)
testdata0.rar 2.9 GB 测试集 CT 第一部分
testdata1.rar 3.1 GB 测试集 CT 第二部分
masks.rar 22.3 MB 分割掩码(测试集/训练集掩码)

CT 格式为 MetaImage(.mhd 头文件 + .raw 数据体)——这是 ITK/SimpleITK 生态的原生格式,可直接用 SimpleITK、ITK-SNAP、3D Slicer 读取。分割掩码同样为 MetaImage,命名规则为 LNDbXXXX_radR.mhd:即"某 CT 的第 R 位医生标注的全部结节分割",掩码内像素值即分割标识(不同数值对应不同结节实例)。

(2)标注数据(CSV 表格)

文件 大小 内容
allNods.csv 162.4 kB 所有结节/发现的汇总表
chars_trainNodules.csv 69.8 kB 训练集结节的九特征评分表
testNodules.csv 124.9 kB 测试集结节表(含质心)
testCTs.csv 278 B 测试集 CT 清单
report.csv 24.2 kB 医学报告(v3 加入)
rad2Fleischner.csv 55.6 kB 医生标注 → Fleischner 类别映射
text2Fleischner.csv 28.6 kB 文本报告 → Fleischner 类别映射
LNDbAcqParams.csv 43.7 kB 每例 CT 的采集参数表(关键!用于按扫描仪/层厚分层分析)

LNDbAcqParams.csv 值得单独强调:它逐例给出扫描仪型号、kV、mA、卷积核、像素尺寸、层厚、层数——做域偏移(domain shift)研究时这是必需的分层变量表。库内多数 CT 数据集不提供这种粒度的采集元数据。

(3)文档与脚本

文件 大小 内容
README.pdf 390.6 kB 数据集说明
help.txt 2.3 kB 变量说明(v4 新增)
scripts.zip 7.7 kB 辅助脚本
submission.zip 744.4 kB 提交模板(挑战赛格式)
trainset_csv.zip 78.0 kB 训练集 CSV 打包

(4)版本演进的含义

版本 日期 变化 研究意义
v1 2022-06-04 仓库创建 基础图像 + 标注
v2 2022-10-06 加入测试文件 可做完整评测
v3 2023-09-01 加入医学报告匹配 首次把文本报告与图像注释关联
v4 2023-09-15 加入 help.txt 变量说明 降低使用门槛

v3 的意义被普遍低估:它不只是"多了几个 CSV",而是把 LNDb 从"纯图像数据集"升级为"图文配对数据集"。医生实际是怎么用自然语言描述这些结节的?报告文本与图像标注之间有怎样的对应与遗漏?这些问题在 v3 之后才可以被系统研究(论文 C 即为此而作)。

5.4 使用前置检查清单

下载 LNDb 后,建议按以下顺序做一致性核对:

  1. 核对采集参数:用 LNDbAcqParams.csv 确认自己分析的每例 CT 的层厚与扫描仪,因为 0.5 mm 与 1.0 mm 层厚的结节在体素层面差异巨大。
  2. 核对标注医生数:每例 CT 的标注医生数是 1/2/3 不等——做多医生一致性研究时必须先按此分层,否则会误算。
  3. 区分 train 与 test:testNodules.csv 只给测试集,chars_trainNodules.csv 只给训练集——两者不可混用。
  4. 确认掩码命名规则:LNDbXXXX_radR.mhd 中的 R 是医生编号,不是结节编号。
  5. 注意 license 边界:NC + ND 双重限制,商用与大范围 redistributribution 前须确认合规。

§6 观察者间变异性:LNDb 最核心的科研贡献

6.1 为什么"变异性"本身是数据产品

在 LNDb 之前,肺结节数据集的主流叙事是"提供尽可能接近金标准的标注"——LIDC-IDRI 的两轮共识流程、LUNA16 的"≥3 位医生接受"筛选,都是在消除医生之间的分歧,把数据集打磨成一个干净的目标。

LNDb 反其道而行:它保留并测量分歧。这不是标注质量的退让,而是一个明确的方法学主张——如果你的模型要在真实临床部署,那么它面对的本来就是"医生之间不一致"的世界;用被共识打磨过的数据训练、再在被共识打磨过的数据上评测,会得到一个乐观的假象。

因此 LNDb 的"变异性数字"不是副产品,而是设计目标本身。这也是它被库内称为"第二面镜子"的根本原因(对照 lidc-idri(19) 这面"被磨平的镜子")。

6.2 检测一致性:0.32 的解剖

论文为每一位医生的配对计算了检测一致性 Ad(agreement),数值越高表示两位医生在"哪些发现算结节"上越一致:

配对 Ad
R1–R2 0.31
R1–R3 0.34
R2–R3 0.32
R2–R4 0.23
R2–R5 0.40
R4–R5 0.31
All vs All 0.32
LIDC-IDRI 参考 0.38

读法三则:

  1. 整体 0.32 低于 LIDC-IDRI 的 0.38,但如前所述(§3.2),这是因为 LNDb 的一致性叠加了 fixation error,且小节点更多——不是标注更差。
  2. 配对之间的落差本身有信息:R2–R4 最低(0.23),R2–R5 最高(0.40)。这说明"变异性不是均匀的噪声,而是有结构的"——某些医生组合的判读风格差异特别大。这为"个性化标注建模"提供了素材:与其追求一个统一的共识标签,不如学习"这位医生会怎么标"。
  3. R2 与谁都低,与 R5 却高——从医生标注量看,R2 标了 90 例、R5 标了 161 例,两位都是较活跃的标注者。这个配对结构的具体成因论文未完全展开,属于待核细节。

6.3 分割一致性:一个"看指标"的经典陷阱

LNDb 与 LIDC-IDRI 的分割一致性被并列报告,结果初看是矛盾的:

指标 LNDb LIDC-IDRI 谁更一致?
MAD(平均绝对距离) 0.45 ± 0.21 mm 0.48 ± 0.38 mm LNDb 更一致
HD(豪斯多夫距离) 2.13 ± 1.35 mm 2.92 ± 3.15 mm LNDb 更一致
Jaccard(交并比) 0.57 ± 0.14 0.66 ± 0.13 LIDC-IDRI 更一致

同一个数据集,同一批标注,三个指标两个说"更一致"、一个说"更不一致"——这不是数据问题,而是指标问题。 解释如下:

  • MAD 与 HD 是"距离类"指标:它们测的是两个掩码边界之间的平均/最大距离。LNDb 的小结节多,小节点即使边界形状差异大,绝对距离也小(因为整体就小),所以距离类指标看起来更一致。同时 LNDb 的 HD 标准差(1.35)远小于 LIDC-IDRI(3.15),说明 LNDb 没有极端离群的分割差异。
  • Jaccard 是"比例类"指标:它测的是交集/并集之比,对相对形状差异敏感。小结节的相对差异会被放大——一个 3 mm 结节上差 1 mm,Jaccard 就会掉很多,而同样的 1 mm 差异在 20 mm 结节上几乎不影响 Jaccard。

这个例子的价值远超 LNDb 本身:它说明"分割一致性可以用互相矛盾的指标来描述"。任何引用分割一致性数字的论文,如果不说明用的是哪个指标,其结论都不可直接比较。这也是评估自己的分割模型时必须同时报告距离类与比例类指标的原因。

6.4 特征一致性:钙化是唯一的例外

九项特征的观察者间一致性(kappa 或类似指标)整体高于 LIDC-IDRI——但有一个显著例外:calcification(钙化)。

论文的解释是:放射科医生常常把钙化的某个中间类别与相邻类别视为等价。具体来说,钙化评分共有 6 档(1–6),而医生在实际判读中倾向于把"类别 3"与"类别 5"混用(两者在某些钙化形态下确实难以区分)。这种"类别边界模糊"造成了系统性的低一致性。

这给所有做"多档主观评分"数据集的人一个警示:评分档位数越多,不代表信息量越大——如果相邻档位对医生没有可操作的区别,多出来的档位只会制造噪声(虚假的变异性)。这与"Pitfall"中"主观量表档位设计"的教训直接呼应。

6.5 Fleischner 随访一致性:一个分层的悖论

论文报告了一个有趣的分层结果:LNDb 在 Fleischner 扫描级一致性上低于 LIDC-IDRI,但在 Fleischner 的体积类与纹理类一致性上反而更高。

如何理解这个悖论?关键在于**"扫描级 Fleischner 一致性"是一个复合量**——它由三部分组成:

  1. 结节是否被检出(检测一致性)
  2. 结节体积档判定一致性
  3. 结节纹理档判定一致性

LNDb 在(2)(3)上更好,但在(1)上更差(因为 fixation error 叠加)。复合起来,检测这一环的劣势压倒了另两环的优势,于是整体一致性更低。

这是一个"木桶效应"的绝佳案例:在串联的临床决策链上,最弱的一环决定整体表现。这也解释了为什么 LNDb 挑战赛把 Fleischner 随访设为主挑战——它是对整条链的综合考试,任何一个环节的短板都会体现在最终分数上。

6.6 CAD 性能断崖:本条目最值得记录的一组数字

LNDb 论文做的对照实验,其结果对任何做医学影像部署的人都应该警醒:

同一个 CAD 网络,在 LIDC-IDRI 上可达 0.926 灵敏度 @ 0.25 FP/scan;拿到 LNDb 上,要达到与平均放射科医生相当的灵敏度,需要 5.99 FP/scan(agreement 1)甚至 5.80 FP/scan(agreement 2)。

而平均放射科医生达到同样的灵敏度,只需要 0.85 / 0.88 FP/scan。

把所有数字放在一起:

场景 达到"平均医生灵敏度"所需 FP/scan
CAD 在 LDC-IDRI 自测 0.25
平均放射科医生(LNDb 上实测) 0.85 / 0.88
CAD 跨库部署到 LNDb 5.99 / 5.80

跨库部署让假阳性率膨胀了约 24 倍。 论文归因于三点:

  1. 训练数据的结节尺寸偏差:CAD 只用 LIDC-IDRI(仅 ≥3 mm 结节)训练,遇到 LNDb 的大量小结节时无从判断。
  2. 层厚分布差异巨大:LNDb 的层厚分布(1.0 [0.5;1.0] mm)与 LIDC-IDRI 不同,体素分辨率变化导致纹理特征漂移。
  3. 单盲标注下"真阳性"的定义更接近临床实况:LNDb 的评分基准本身更严格。

这个数字的政策含义:任何声称"CAD 达到医生水平"的研究,如果只在单一数据集内评测,其结论不构成部署证据。必须做跨库外部验证,而 LNDb 正是为此准备的"第二考场"。

6.7 眼动数据:区分"没看到"与"判错"

LNDb 独有的 312 次眼动阅读记录,为上述一致性问题提供了一个"解剖刀"级的工具。前文(§2.7)已经介绍过它的价值,此处深化到方法论层面:

在判断"两位医生为什么在不同意"时,传统数据集只能给出"他们标了不同的结节"这一结论。而眼动数据可以进一步区分:

  • Fixation error(注视失败):医生的视线根本没落在结节区域——这是"漏看",与模型漏检同构。
  • Decision error(决策错误):医生的视线扫过了该区域,但判定"这不是结节"——这是"判读差异",与模型的假阳性/假阴性判定差异同构。

为什么这个区分重要? 因为它决定了 CAD 系统应该"怎么帮":

  • 如果主要误差是 fixation error,CAD 应该做"巡逻提示"(把可疑区域标出来让医生别漏)
  • 如果主要误差是 decision error,CAD 应该做"第二意见"(对医生已看到的区域给出独立判读)

LNDb 论文原话把这一点上升到了设计哲学:

“ensuring that CAD systems are designed as allies of radiologists rather than as competition”

这条数据的稀缺性:库内绝大多数医学影像数据集(包括 lidc-idri(19)、luna16(237)、deeplesion(17))都没有眼动追踪。LNDb 是库内罕见的"带认知过程数据"的放射影像数据集。做"人机交互 / 医生行为建模 / 眼球运动分析"方向的研究者,LNDb 几乎是不可替代的。

待核提醒:312 次眼动记录在 Zenodo v4 的公开文件清单中未见独立文件,实际获取方式需进一步确认(可能含于压缩包或需联系作者)。在依赖该数据前,请先完成获取性核验。

§7 生态位与外部影响

7.1 三篇论文构成的知识链

LNDb 的文献生态由三篇互补论文构成,各自承担不同角色:

论文 载体 年份 角色
论文 A arXiv:1911.08434 2019 数据集描述 + 一致性分析(Table I–V)
论文 B MedIA 70:102027 2021 挑战赛报告 + 各任务结果
论文 C Scientific Data 11:512 2024 v4 报告标注方法论

引用时的关键区分:

  • 引用数据集本体参数(294 CT、采集参数、医生分配)→ 论文 A
  • 引用挑战赛成绩(947 注册、0.580 kappa)→ 论文 B
  • 引用报告匹配方法(三阶段流水线)→ 论文 C

常见错误:把观察者间一致性详表(Table II–V,出自论文 A)误引为论文 B 的内容。论文 A 承担变异性分析,论文 B 承担挑战赛结果——这是两个不同的贡献,引用时必须分辨。

7.2 作为外部验证集的广泛使用

LNDb 的核心生态价值在于"外部验证专用库"这一定位,这使它频繁出现在以下类型的研究中:

  1. 分割算法的跨库泛化测试:在 LIDC-IDRI 训练分割模型,在 LNDb 上测外部表现。因为 LNDb 的分割标注是"每棵结节都被独立分割",它提供了与训练集协议不同的测试条件。
  2. 恶性风险模型的校准检验:在 LIDC-IDRI 上训练恶性预测模型,在 LNDb 上看预测概率是否需要重新校准。
  3. 三维生成模型的评估:LNDb 被用于评估 3D VAE 等生成模型的重建质量(对照 Cell Reports Methods 2024 的"1033 lesions 子集口径",见 §9 口径冲突 1)。
  4. 标注方法论研究:单盲 vs 两轮共识的对比研究天然需要两个不同协议的数据集,LNDb 与 LIDC-IDRI 恰好构成一对。

7.3 与库内条目的生态关系

(1)lidc-idri(19):互补对照(最强关联)

已在 §3.3 详述。核心一句话:LNDb 是 LIDC-IDRI 的独立外部补充库,不是它的子集、不是它的重标注、不是它的更新版。 二者关系是"同一任务、不同协议、可对照",其价值恰恰来自差异。

(2)luna16(237):同为检测基准,构建逻辑相反

已在 §3.4 详述。核心一句话:LUNA16 从 LIDC-IDRI 筛选(派生),LNDb 是新采集(独立);论文明确声明二者不可直接比较。 理解这一点,就能避免"把 LNDb 的检测分数往 LUNA16 排行榜上放"这一方法学错误。

(3)deeplesion(17):任务粒度不同

DeepLesion 是跨部位全身病灶检出数据库(bookmark 式单点标注 + 多类病灶),LNDb 是专注肺结节的九特征 + 分割 + 眼动 + Fleischner 决策链。二者的差异是"广度 vs 深度":

维度 DeepLesion(rid 17) LNDb(本条目)
病灶类型 多类(全身) 单类(肺结节)
标注形式 bookmark 单点 质心 + 3D 分割 + 九特征
决策任务 无 Fleischner 随访
认知数据 无 眼动(312 readings)

(4)nlst(317):筛查大队列 vs 可复现对照集

NLST(National Lung Screening Trial)是数万人规模的肺癌筛查试验。它的规模优势是不可替代的,但它的数据可获取性受限(需申请、有严格 DUA),且由于是试验设计,图像与标注协议与日常临床不同。LNDb 则提供了"公开直链、协议透明、可完全复现"的对照集。在 NLST 上做不了快速迭代实验时,LNDb 是可用的替代评估场。

(5)nsclc-radiogenomics(257) / nsclc-radiomics(247):下游恶性验证的补充

这两个条目是含真实癌灶的肺癌影像组学队列(有病理确认的恶性肿瘤)。LNDb 的结节多为筛查中发现的、未定性的结节(多数无病理结局)。二者可以串联:用 LNDb 做"结节检测与特征刻画",再用 nsclc-radiogenomics/nsclc-radiomics 做"恶性度验证"。

(6)padchest(117):伊比利亚半岛的区域互补

PadChest 是西班牙的多机构胸片(X-ray)多标签数据集,LNDb 是葡萄牙的胸部 CT。二者同属伊比利亚半岛医学影像资源,地域相近但模态不同(X-ray vs CT)、医院不同(西班牙多中心 vs 葡萄牙单中心)。对"南欧人群的胸部影像模型泛化"研究,二者构成一条地域线索。

(7)弱关联家族(胸部影像)

rsna-pneumonia(712)、siim-acr-pneumothorax(737)、osic-pulmonary-fibrosis(739)、nih-chestx-ray14(15)、chestx-det10(137) 等——均属"胸部影像"大类,但任务(肺炎/气胸/纤维化/14 类胸片标签)与 LNDb(肺结节)无直接重叠,仅在"胸部影像 AI"的宽泛语境下互为背景。

7.4 区域与机构的独特性

LNDb 的单中心属性(全部来自 CHUSJ,波尔图)在某些场景下是局限(人群多样性不足),在另一些场景下是优势:

  • 优势:单中心意味着扫描协议相对一致(虽然有三台 Siemens 机型,但同院操作规范统一),这排除了"多中心协议混杂"这一混淆因素——对比 LIDC-IDRI 的多中心异质性,LNDb 的跨中心泛化问题被"转移"到了跨机型(3 台 Siemens)与跨层厚上。这是一个被精心控制的实验设计:把变异性聚焦到"标注者"和"机型"两个可控变量上。
  • 局限:294 例全部为葡萄牙人群,跨种族/跨地域泛化需谨慎。任何在 LNDb 上表现良好的模型,若要部署到亚洲或非洲人群,仍需额外验证。

7.5 LNDb 的"未完成议程"

作为一个明确以"批判性复现"为使命的数据集,LNDb 实际上提出了几个它自己也没能完全回答的问题:

  1. "共识标签"是不是一个伪目标? LNDb 数据表明医生之间的真实一致性(0.32)远低于传统数据集报告的数值。如果真实世界就是低一致性的,那么以"高一致性共识标签"为学习目标,是否从一开始就错了方向?
  2. 如何构建"分布感知"的评估? 既然一致性有结构(R2–R4 低、R2–R5 高),评估指标是否应该按医生组合分层报告,而不是给一个整体数字?
  3. CAD 应该模仿谁? 如果医生之间都不一致,CAD 应该对齐"平均医生"、对齐"某位特定医生"、还是自成一派?LNDb 的眼动数据暗示答案可能是"CAD 应该补足医生的盲区,而不是复制医生的风格"——但它没有给出量化方案。

这三问至今(2026 年)仍未有公认答案,这正是 LNDb 持续被引用的原因:它把一个被忽视的问题摆上了台面。

§8 方法学启示:从 LNDb 能学到什么

8.1 数据集设计层面

启示 1:把"变异性"当作一等公民来报告。

传统数据集论文报一个"标注质量"数字就结束了。LNDb 的做法是逐配对、逐指标、分层报告一致性,并把由此得出的"真实临床变异性"作为核心卖点。这带来一个具体好处:后续研究可以用这些数字作为"人类上限"的参考——例如挑战赛分割第一名 0.567 之所以有意义,正是因为有"医生间 0.57±0.14"这个参照。没有变异性数字,性能数字就失去了刻度。

启示 2:协议差异本身就是一种资产。

单盲 vs 两轮共识的差异,让两个数据集可以互为对照。如果你在设计数据集时发现自己"和现有数据集很像",那么刻意在协议上做出差异化(不同的标注流程、不同的纳入标准、不同的任务定义),反而可能创造出更大的价值——因为对照实验需要的是"可控的差异",而不是"更多的同类数据"。

启示 3:纳入标准要显式、可复现、可质疑。

LNDb 的纳入与排除标准写得非常具体(>18 岁、无癌症史、无造影、层厚 ≤1 mm、首次阅读 >6 结节排除、单结节 >30 mm 排除)。这种显式规则让使用者能判断自己的用例是否落在数据集的分布内。含糊的纳入标准是数据集最常见的隐性缺陷。

8.2 任务设计层面

启示 4:用"决策链"而不是"单点任务"来组织评测。

LNDb 挑战赛的四任务链(检测→分割→纹理→随访)揭示了"木桶效应"——这也是 §6.5 那个悖论的来源。如果你的模型要部署到临床,那么评测就应该覆盖整条链,而不是只测其中最成熟的一环。 只报分割 Jaccard 的论文,无法说明该模型在"随访决策"上的表现。

启示 5:把最难的任务设为主挑战。

LNDb 把 Fleischner 随访(最综合、最难、最优临床价值)设为主挑战,而把分割(最成熟)设为子挑战。这是值得学习的优先级安排:主挑战应该指向"最有价值但仍未解决的问题",而不是"最容易刷分的问题"。

8.3 评估层面

启示 6:权重选择要有临床依据。

Fleischner 随访与纹理分类都用 quadratic weighted kappa,理由是类别有序且相邻错误的代价不等。这是一个通用的教训:任何有序类别任务的评估,都要先问"错一档和错三档是否应该同罚"——如果不同,就必须用加权指标。

启示 7:同时报告距离类与比例类分割指标。

§6.3 的矛盾(MAD 说 LNDb 更一致、Jaccard 说不一致)说明单一指标会被数据分布欺骗。当结节尺寸分布不均匀时,距离类指标(MAD/HD)与比例类指标(Jaccard/Dice)会给出相反的结论。正确做法是两者都报,并说明尺寸分布。

8.4 部署层面

启示 8:跨库评测是不可协商的。

§6.6 的"24 倍假阳性膨胀"是整个 LNDb 文献中最有冲击力的发现。它说明同库自测的性能数字几乎没有部署参考价值。任何"我们的 CAD 达到医生水平"的声明,都必须附上在至少一个独立数据集上的外部验证——而 LNDb 正是为承担这一角色而设计的。

启示 9:注意训练数据的隐性偏差。

CAD 在 LNDb 上的失败被归因于"训练数据仅含 ≥3 mm 结节"。这是一个通用的陷阱:任何在筛选后的数据上训练的模型,都会把筛选标准当作隐含假设。要打破这个陷阱,训练数据本身就必须覆盖目标部署场景的完整分布(包括那些"看起来不值得标注"的小结节——而这恰是 LNDb 特意保留的)。

8.5 合规层面

启示 10:许可条款要逐条读,尤其是 ND。

CC BY-NC-ND 的 ND 条款意味着重标注并发布 LNDb 的高危性(见 §5.1)。这在实践中容易被忽略,因为研究者的直觉是"重标注是学术贡献,应该被鼓励"。但在 ND 条款下,重标注并分发是一个需要作者明确授权才能做的动作。 设计数据集时,如果你希望别人能重标注你的数据(像 panda-plus 那样),就不要选 ND。

§9 与库内条目的关系总表

9.1 关系总表

库内条目 rid 关系类型 一句话划界
lidc-idri 19 互补对照(最强) LNDb 是 LIDC-IDRI 的独立外部补充库;同一任务、不同协议(单盲 vs 两轮)、不同地域(葡萄牙 vs 美国多中心)
luna16 237 不可直接比较 LUNA16 从 LIDC-IDRI 筛选派生;LNDb 独立新采集;论文明确声明评估准则不可迁移
deeplesion 17 任务粒度不同 DeepLesion 全身多类病灶 bookmark 标注;LNDb 专注肺结节 + 九特征 + 眼动 + Fleischner
nlst 317 规模 vs 可复现 NLST 数万人级筛查试验(受限获取);LNDb 公开直链可完全复现的对照集
nsclc-radiogenomics 257 下游补充 含病理确认癌灶的影像组学队列,可用于 LNDb 结节的下游恶性验证
nsclc-radiomics 247 下游补充 同上,Aerts 影像组学经典队列
padchest 117 区域互补 西班牙多机构胸片 vs 葡萄牙单中心胸 CT;伊比利亚半岛医学影像双支点
chest-imagenome 330 无图像重叠 胸片场景图结构;与 LNDb 的 CT 无直接交叉
rsna-pneumonia 712 弱关联 胸部影像家族,任务(肺炎)不同
siim-acr-pneumothorax 737 弱关联 胸部影像家族,任务(气胸)不同
osic-pulmonary-fibrosis 739 弱关联 胸部影像家族,任务(纤维化)不同
nih-chestx-ray14 15 弱关联 胸片多标签;模态与任务均不同

9.2 检索者速查:什么需求该用 LNDb

你的需求 推荐用 理由
训练肺结节检测模型(大规模) lidc-idri(19) / luna16(237) 规模与标注成熟度更高
测模型跨库泛化 lndb 独立协议、公开直链、有官方"不可比"声明作为方法学护栏
研究医生变异性 lndb 单盲协议 + 逐配对一致性数据
研究医生认知过程 lndb 唯一的 312 次眼动记录
做 Fleischner 随访决策模型 lndb 唯一提供 Fleischner 类别映射的数据集
图文配对(报告 → 结节) lndb v3/v4 292 份报告 + 三阶段匹配
商用模型训练 lidc-idri(19)(CC BY 3.0) LNDb 的 NC 条款禁止商用
重标注并公开发布衍生数据集 panda-plus 类(SA 许可) LNDb 的 ND 条款禁止演绎分发
全身多类病灶检出 deeplesion(17) LNDb 只做肺结节

§10 避坑清单(十条)

坑点 1 — 把 LNDb 当作"LIDC-IDRI 的更新版/子集"

最常见的误解。LNDb 是独立新采集的队列(葡萄牙 CHUSJ 2016–2018),不是 LIDC-IDRI 的筛选、重标或扩展。把它当"更多数据"用会低估其设计意图,把它当"重标版"用则完全搞错结构(对照库内 panda-plus(560) 那种"重标注"结构,二者完全不同)。正确读法:互补对照。

坑点 2 — 把 LNDb 的检测一致性(0.32)当作"标注质量差"

0.32 低于 LIDC-IDRI 的 0.38,但成因是协议差异(单盲叠加 fixation error)+ 小节点占比高,不是标注水平。引用这个数字时必须带上协议背景,否则会得出相反结论。

坑点 3 — 把 LNDb 的检测分数与 LUNA16 排行榜直接比较

论文原文明确声明"a direct comparison between LUNA16 and LNDb results not feasible",理由是 LNDb 各 CT 标注医生数从 1 到 3 不等,无法构造 LUNA16 要求的"≥3 位医生接受"子集。任何这种比较都是方法学错误。

坑点 4 — 混用三个不同层级的 license

数据集 = CC BY-NC-ND;论文 C = CC BY-4.0;论文 B = Elsevier 版权。“论文开放获取"不等于"数据可自由使用”。商用前必须单独确认数据集许可。

坑点 5 — 忽略 ND 条款去做重标注分发

ND(禁止演绎)意味着把重标注后的 LNDb 版本公开发布是高危操作。内部训练用的预处理不算演绎,但对外分发修改版会触碰条款。要与作者协商获得授权。

坑点 6 — 用单一分割指标下结论

MAD/HD 说 LNDb 分割更一致,Jaccard 说更不一致(§6.3)。距离类与比例类指标在结节尺寸分布不均时会给出相反结论。必须同时报告并说明尺寸分布。

坑点 7 — 误算每例 CT 的"标注医生数"

LNDb 的每例 CT 由 1 到 3 位医生标注不等(90 例 3 位 / 145 例 2 位 / 59 例 1 位)。做多医生一致性研究时必须先按此分层,否则会把"只有 1 位医生标注"的 CT 错误地纳入配对计算。

坑点 8 — 忽略采集参数的分层作用

LNDb 有三台 Siemens 机型(Sensation Cardiac 64 / Somatom Definition Flash / Somatom go.Up)、层厚从 0.5 到 1.0 mm。不做分层分析会掩盖"机型/层厚导致的性能差异"——而这恰恰是跨库泛化研究中最需要识别的混淆因素。用 LNDbAcqParams.csv 分层。

坑点 9 — 认为眼动数据可直接下载

312 次眼动阅读记录在论文中被强调,但 Zenodo v4 公开文件清单中未见独立 eye-tracking 文件。依赖该数据前必须先完成获取性核验(可能含于压缩包或需联系作者)。

坑点 10 — 把"1429 唯一发现"与"结节"混为一谈

官方口径是 1,897 个标注 → 1,429 个 unique findings,其中包含非结节的可疑发现(LNDb 要求医生标注"与结节相似但非结节"的发现,比 LIDC-IDRI 更彻底)。第三方报道的"1018 个结节""1033 lesions"是不同口径的子集或转述。引用时务必标明口径来源。

坑点 11 — 假设训练/验证集内部划分已公开

已知测试集为 58 例,训练/验证集合计 294−58=236 例。但论文未明确 train/validation 的内部再分比例(挑战赛期间两者合并使用)。不要臆造划分比例。

坑点 12 — 忽略 v3/v4 版本差异

v3(2023-09-01)加入了医学报告匹配(report.csv、rad2Fleischner.csv、text2Fleischner.csv、allNods.csv),v4 加入 help.txt。引用"LNDb 有医学报告"时须指明是 v3 及以后;引用 v1/v2 时代的研究则无报告数据。

坑点 13 — 把 292 份报告当作 294 份

v4 提供 292 份医学报告,对应 294 例 CT——即有 2 例缺报告。做图文配对研究时会出现"有图无文"的样本,需在数据加载阶段显式处理。

坑点 14 — 用"结节体积"时忽略 Fleischner 的档位边界

Fleischner 类别依赖体积三档(<100 mm³ / 100–250 mm³ / ≥250 mm³)。靠近边界的结节(如 249 mm³ vs 251 mm³)会因分割的微小差异而跨档,进而导致随访建议变化——这是"分割误差 → 决策变化"的传导链,评测时需注意。

坑点 15 — 误读挑战赛截止日期的"双写"

grand-challenge 页面对测试集提交截止与结果公布日期存在修订残留(“17 February, 2020 20 February, 2020”、“18 February, 2020 20 February, 2020”)。引用时间线时以论文 B(MedIA 2021)的正式记录为准,并注明页面存在双写。

坑点 16 — 把论文 B 的年份写成 2020

MedIA 论文的正式卷期为 2021(Vol 70, 102027);BU 仓储的接受版页眉标注 “(2020)”。引用按正式卷期 2021。

§11 总结

LNDb 是一个用"差异"而非"规模"来定义自身价值的数据集。它只有 294 例 CT,不到 LIDC-IDRI 的三分之一;它的一致性数字(0.32)比 LIDC-IDRI(0.38)更低;它在挑战赛上的成绩(检测灵敏度 <0.7)看起来也不亮眼。任何用"更大的数据、更高的分数"作为尺度的读者,都会低估它。

但它在四件事上做到了库里其他条目做不到的事:

  1. 提供了一个协议独立的外部考场。CAD 在 LIDC-IDRI 上 0.25 FP/scan,跨库到 LNDb 需要 5.99 FP/scan——24 倍的性能断崖是它贡献给整个领域的最重要的一个数字。没有 LNDb,这个断崖会一直藏在"同库自测"的乐观数字后面。
  2. 保留了而不是抹平了观察者间变异。单盲协议下,医生之间 0.32 的检测一致性才是真实临床的样子。LNDb 把这面"未经打磨的镜子"交给了社区。
  3. 提供了唯一的眼动追踪数据(312 readings),把"医生为什么漏检"从猜测变成了可测量的 fixation error / decision error 二分。
  4. 把评测从"单点任务"扩展为"完整决策链":检测→分割→纹理→Fleischner 随访,并刻意把最难的一环设为主挑战。

对千方病案医数集的使用者而言,LNDb 的正确位置是:与 lidc-idri(19) 并列的"第二面镜子",与 luna16(237) 并列但明确"不可比"的检测基准,以及库内唯一带认知过程数据的肺结节资源。 它不适合做训练数据的规模扩张,但任何声称"达到临床可用"的肺结节模型,都应该在它上面过一遍。

最后,三条使用红线需要重复:NC(禁止商用)、ND(禁止演绎分发)、与 LUNA16 不可直接比较。这三条决定了 LNDb 能被用来做什么,以及不能被用来做什么。

DAIMS 评估表(数据集 AI-Ready 成熟度 24 项)

# 维度 项 评级 说明
1 可发现性 稳定标识(DOI) ✅ 满足 Zenodo DOI + arXiv/MedIA/SciData 三篇 DOI
2 可发现性 元数据完整 ✅ 满足 Zenodo + README.pdf + help.txt
3 可发现性 检索关键词 ✅ 满足 Zenodo 标签 + grand-challenge 页
4 可发现性 版本标识 ✅ 满足 v1–v4 明确版本链
5 可访问性 公开直链 ✅ 满足 Zenodo 公开下载,无注册墙
6 可访问性 无需 DUA ✅ 满足 无数据使用协议签署
7 可访问性 格式通用 ⚠️ 部分 MetaImage(.mhd/.raw)+ RAR 压缩需解压
8 可访问性 传输效率 ⚠️ 部分 ~30.3 GB,无分块/流式方案
9 互操作性 标准影像格式 ✅ 满足 MetaImage 为 ITK 生态标准
10 互操作性 表结构清晰 ✅ 满足 CSV 表 + help.txt 变量说明
11 互操作性 与其他数据集可桥接 ✅ 满足 与 LIDC-IDRI 同套九特征可直接映射
12 互操作性 本体/受控词表 ⚠️ 部分 Fleischner 类别有受控定义,但无外部本体映射
13 可复用性 许可明确 ✅ 满足 CC BY-NC-ND 明确
14 可复用性 允许商用 ❌ 不满足 NC 条款禁止商用
15 可复用性 允许演绎 ❌ 不满足 ND 条款禁止修改分发
16 可复用性 标注文档完整 ✅ 满足 README.pdf + 论文 A 详载
17 可复用性 基线/提交模板 ✅ 满足 submission.zip + train/val 格式
18 可复用性 评测脚本 ⚠️ 部分 scripts.zip 提供辅助脚本,非完整评测器
19 可复现性 划分明确 ⚠️ 部分 测试集 58 例明确,train/val 内部比例未公开
20 可复现性 采集参数可查 ✅ 满足 LNDbAcqParams.csv 逐例提供
21 可复现性 标注者信息 ✅ 满足 5 位医生 + 标注分配表
22 可复现性 结果可复现 ✅ 满足 挑战赛成绩公开于论文学 B
23 AI 就绪度 任务定义明确 ✅ 满足 四任务链定义完整
24 AI 就绪度 变异性数据公开 ✅ 满足 逐配对一致性 + 眼动数据

总分:24 项中 18 项满足 / 5 项部分满足 / 2 项不满足(另有 1 项计入部分满足)。最主要的减分项集中在许可限制(NC + ND,第 14、15 项)与数据体量/格式工程(第 7、8 项)——前者是法律约束,后者是工程成本。

FAQ(高频问答 30 问)

A. 基础认知

Q1:LNDb 是一个挑战赛还是一个数据集?
两者都是。数据集是本体(294 例 CT 肺结节库,2020 年发布);挑战赛(LNDb Grand Challenge)是建在其上的竞赛(2019-11 启动,与 ICIAR 2020 合办)。数据集可单独下载使用,挑战赛提供标准化评测。

Q2:LNDb 全称和缩写怎么来的?
Lung Nodule Database——肺结节数据库。缩写 LNDb 是 Lung Nodule Database 的紧凑形式("b"为 database 的尾字母)。

Q3:它和 LIDC-IDRI 到底什么关系?
官方定位"外部补充库(external dataset complimentary to LIDC-IDRI)"。独立采集、无图像重叠、共享九特征评分体系、用于外部验证。不是子集、不是重标注、不是版本迭代(坑 1)。

Q4:谁做的?
INESC TEC(葡萄牙波尔图的研究所)联合 CHUSJ(圣若昂中心医院)、FEUP(波尔图大学工程学院)、FMUP(波尔图大学医学院)。组织者 João Pedrosa(PhD,INESC TEC),论文 11 位作者。

Q5:数据从哪来?
葡萄牙波尔图 CHUSJ,2016–2018 年回顾性采集,全部经伦理批准并去标识。没有一例为数据集专门扫描。

Q6:规模多大?
294 例 CT(294 患者)、164 男性(55.8%)、中位年龄 66;5 位医生标注产生 1,897 标注 → 1,429 唯一发现;训练/验证 236 + 测试 58。

Q7:发表在哪里?
三篇:arXiv:1911.08434(数据集,2019);Medical Image Analysis 70:102027(挑战赛,2021);Scientific Data 11:512(v4 报告标注,2024)。

Q8:最大的卖点一句话?
它是"给 LIDC-IDRI 时代做外部验证的那面镜子"——用单盲标注和独立采集,把"模型到底有没有真正泛化"变成可测量的实验。

Q9:它自己有什么局限?
单中心、全 Siemens、单盲协议使检测一致性含义不同、钙化标签不可靠、总体规模小于 LIDC-IDRI——论文讨论节与 dataLimitations 全部自曝。

Q10:开源吗?
公开直链(Zenodo records/8348419),无需注册无需申请,但许可是 CC BY-NC-ND(禁商用禁演绎)。

B. 数据与获取

Q11:294 例怎么选的?
回顾性采集,纳入标准基于 LIDC-IDRI(>18 岁、无既往癌症史),排除造影 CT、层厚 >1 mm、首次阅读有>6 结节或单结节>30 mm 者。

Q12:标注了什么?
每条含质心坐标 + 分割掩码 + 九特征评分(subtlety/internal structure/calcification/sphericity/margin/lobulation/spiculation/texture/malignancy)。还标注了非结节可疑病变——比 LIDC-IDRI 更彻底。

Q13:九特征评分范围?
internal structure 1–4;calcification 1–6;其余 1–5。与 LIDC-IDRI 同套。

Q14:什么是"唯一发现(unique findings)"?
1,897 条原始标注去重后得到 1,429 个——同一位患者同一结节被多位医生各标一次,去重后算一个发现。

Q15:数据是什么格式?
CT 与分割均为 MetaImage(.mhd/.raw);标注为 CSV。分割按医生分离,命名 LNDbXXXX_radR.mhd。

Q16:怎么下载?
Zenodo records/8348419 直接下,约 30.3 GB。文件包括 data0–5.rar、testdata0–1.rar、masks.rar、多个 CSV、README.pdf。

Q17:能用它训练商用模型吗?
不能直接。数据集是 CC BY-NC-ND——NC 禁商业、ND 禁演绎。商用需另行获得授权。(注意:v4 论文是 CC BY-4.0,但那是论文不是数据。)

Q18:测试集公开吗?
公开。v2(2022-10)起测试集文件加入 Zenodo。挑战赛评估通道至论文发表时仍接收提交。

C. 观察者变异与一致性

Q19:为什么 LNDb 的一致性比 LIDC-IDRI 低?
两个原因:(1)单盲协议——没有两轮非盲修正的收敛过程,一致性同时含"决策误差+固定误差";(2)小节点占比高——小节点更难判定。这是协议差异,不是标注质量更差(§3.2、坑见 §10)。

Q20:检测一致性具体多少?
All-vs-All Ad = 0.32;LIDC-IDRI 参考 0.38。各医生对 0.23–0.40 不等。

Q21:分割一致性呢?
MAD 0.45±0.21 mm / HD 2.13±1.35 mm / Jaccard 0.57±0.14(LNDb);对照 LIDC-IDRI 的 0.48/2.92/0.66——LNDb 在 MAD/HD 更好、Jaccard 更差。

Q22:为什么钙化一致性特别低?
医生把类别 3(Solid)与类别 5(Central)视为等价,导致系统性混用。论文建议:只用"有/无钙化"二值化(坑 6)。

Q23:随访一致性为什么低?
扫描级随访一致性低于 LIDC-IDRI——尽管体积/纹理类一致性更高。原因是检测环节的低一致性传导到了最终随访决策。

Q24:CAD 在 LNDb 上表现如何?
同一网络在 LIDC-IDRI 可达 0.926 灵敏度 @0.25 FP/scan,换到 LNDb 要 5.99 FP/scan 才追上平均医生——跨库性能断崖(§4.6)。

D. 挑战赛

Q25:挑战赛有哪些任务?
四部分:主挑战 Fleischner 随访分类 + 子挑战 A 检测 + 子挑战 B 分割 + 子挑战 C 纹理分类。

Q26:什么结果?
947 注册 / 11 有效提交。随访 quadratic κ 0.580;分割 Jaccard 0.567(超观察者变异);纹理 quadratic κ 0.733;检测灵敏度 <0.4/<0.7 @1 FP/scan。

Q27:Fleischner 指南是什么?
2017 Fleischner 学会肺结节管理指南,按结节数目、体积(<100/100-250/≥250 mm³)、纹理(solid/part solid/GGO)给出随访建议,共 4 类。

Q28:为什么分割 Jaccard"超过观察者间变异"很重要?
它说明算法与医生标注的一致性已超过医生彼此的一致性——但论文提醒"谁赢取决于指标",体积随访研究应优先体积指标(§5.5)。

Q29:检测结果能和 LUNA16 比吗?
不能。论文明确声明因标注协议差异直接比较不可行(坑 2)。LUNA16 限 agreement≥3 结节,LNDb 各 CT 标注医生数可变,构造不出该子集。

Q30:为什么注册 947 但只有 11 份提交?
挑战赛时间紧(约 3 个月)、任务重(四任务+会议论文),筛选出的是深度投入的少数团队。这也是公开第三方评测有限的原因。

E. v4 与生态

Q31:v4 加了什么?
医学报告结构化——292 份报告转表格 + 报告结节与图像注释匹配,新增 chars_trainNodules.csv / report.csv / allNods.csv / rad2Fleischner.csv / text2Fleischner.csv 五文件。

Q32:报告匹配有什么意义?
它让"文本描述"与"图像标注"两种独立来源可以对齐比较,暴露各自精度与偏差——使 LNDb 升级为多源标注一致性研究平台(§8.3)。

Q33:v4 论文和数据集许可一样吗?
不一样。数据集 CC BY-NC-ND;v4 论文(Scientific Data)CC BY-4.0(坑 4)。

Q34:LNDb 在文献里主要被怎么用?
主要作为外部验证集(分割、恶性风险、生成模型)和观察者变异基准。是被引用最广的"非 LIDC-IDRI 外部对照"之一(§8.4、§7.3)。

Q35:眼动数据怎么用?
312 次 CT 阅读记录,用于观察者行为研究(区分"没看到"vs"看到但判为非结节")和人机协作设计(CAD 作为"第二双眼睛")。注意:Zenodo v4 文件清单未见独立眼动文件,专门需要时先核对(§2.7 遗留疑点)。

F. 复现与工程

Q36:怎么复现"训练 LIDC-IDRI、测试 LNDb"?
下载 Zenodo → 预处理对齐训练侧(层厚/间距/HU 窗)→ 按 agreement level 分层算灵敏度@FP/scan(勿用 CPM)→ 报告与内验分数并列,突出跨库落差(§7.4)。

Q37:训练/验证的内部怎么分?
论文未明确。建议自行按患者级划分(避免同患者泄漏)并声明(§7.6 遗留疑点)。

Q38:分割文件怎么按医生对齐?
文件命名 LNDbXXXX_radR.mhd——XXXX 为 CT 编号、R 为医生(1–5)。做医生间一致性需先按医生拉同一 CT 的分割再看重叠(§7.5)。

Q39:怎么引用才规范?
数据引 Zenodo(10.5281/zenodo.8348419);数据集描述引 arXiv:1911.08434;挑战赛结果引 MedIA 2021;70:102027;v4 引 Scientific Data 2024;11:512。检测结果务必带"与 LUNA16 不可比"声明。

Q40:能用它声称"模型可泛化吗"?
能声称"从 LIDC-IDRI 泛化到波尔图单中心诊断 CT",不能声称"跨制造商"或"多中心"泛化——全 Siemens、单中心(坑 8)。

G. 库内与元问题

Q41:本条目为什么叫 lndb?
数据集官方缩写即 LNDb,slug 取小写 lndb,与库内命名(url_name 小写)一致。

Q42:本条目与 lidc-idri(19)、luna16(237) 冲突吗?
不冲突、是互补。lidc-idri 记参照本体,luna16 记派生检测基准,本条目记独立外部验证库。三者互为上下游,检索任一都应提示其余。

Q43:如果我只记住一件事?
LNDb 是独立采集的外部验证库(不是 LIDC-IDRI 的子集),它的检测分数不可与 LUNA16 比——这两条是正确使用它的前提。


事实清单(硬事实 42 条)

  1. LNDb 含 294 例胸部 CT,全部来自葡萄牙波尔图 CHUSJ 单中心,回顾性采集于 2016–2018。
  2. 人口学:164 例(55.8%)男性;中位年龄 66;最小 19、最大 98。
  3. 官方自定位为"LIDC-IDRI 的外部补充库(external dataset complimentary to LIDC-IDRI)",用于独立外部验证。
  4. 团队:INESC TEC + CHUSJ + FEUP + FMUP;组织者 João Pedrosa(INESC TEC)。
  5. 数据集论文:Pedrosa et al., “LNDb: A Lung Nodule Database on Computed Tomography”, arXiv:1911.08434(v1 2019-11-19;v3 2019-12-19)。
  6. 挑战赛论文:Pedrosa et al., “LNDb challenge on automatic lung cancer patient management”, Medical Image Analysis 70 (2021): 102027,DOI 10.1016/j.media.2021.102027。
  7. v4 论文:Ferreira et al., “LNDb v4: pulmonary nodule annotation from medical reports”, Scientific Data 11.1 (2024): 512,DOI 10.1038/s41597-024-03345-6。
  8. 标注医生:5 位(R1–R5),各 ≥4 年经验,单盲独立标注。
  9. 标注分配:90 例由 3 位医生、145 例由 2 位、59 例由 1 位标注。
  10. 各医生标注 CT 数:R1 125 / R2 90 / R3 81 / R4 162 / R5 161。
  11. 累计 1,897 条标注 → 1,429 个唯一发现(含各尺寸结节与非结节可疑病变)。
  12. 眼动追踪数据:共 312 次 CT 阅读记录。
  13. 训练/验证集 236 例;独立测试集 58 例。
  14. 扫描仪:Siemens Sensation Cardiac 64 = 107(36.4%)/ Somatom Definition Flash = 59(19.5%)/ Somatom go.Up = 137(45.2%)——全部 Siemens。
  15. 采集参数:kV 120[100;140];mA 161.9±128.4;平面内像素 0.63±0.09 mm;层厚 1.0[0.5;1.0] mm;层数 318.5[251;631]。
  16. 卷积核分布:Standard 4(1.4%)/ Sharp 160(54.6%)/ Very sharp 126(43.0%)/ Extremely sharp 3(1.0%)。
  17. 纳入排除:>18 岁、无既往癌症史;排除造影 CT、层厚>1 mm、首次阅读>6 结节或单结节>30 mm 者。
  18. 九特征:subtlety/internal structure/calcification/sphericity/margin/lobulation/spiculation/texture/malignancy(与 LIDC-IDRI 同套)。
  19. 评分范围:internal structure 1–4;calcification 1–6;其余 1–5。
  20. LNDb 要求标注所有尺寸结节(不限 ≥3 mm),故 <3 mm/<5 mm 结节比例显著高于 LIDC-IDRI。
  21. 检测一致性 Ad:All-vs-All 0.32(各医生对 0.23–0.40);LIDC-IDRI 参考 0.38。
  22. 分割一致性(LNDb All-vs-All):MAD 0.45±0.21 mm / HD 2.13±1.35 mm / Jaccard 0.57±0.14。
  23. 分割一致性(LIDC-IDRI):MAD 0.48±0.38 mm / HD 2.92±3.15 mm / Jaccard 0.66±0.13。
  24. 特征一致性整体高于 LIDC-IDRI,唯钙化显著更低(因医生把类别 3 与 5 视为等价)。
  25. 扫描级 Fleischner 随访一致性低于 LIDC-IDRI(尽管体积/纹理类一致性更高)。
  26. CAD 达平均医生灵敏度需 5.99 FP/scan(agreement 1)/ 5.80 FP/scan(agreement 2);医生仅需 0.85/0.88 FP/scan。
  27. 同一网络在 LIDC-IDRI 子集可达 0.926 灵敏度 @0.25 FP/scan——跨库性能断崖。
  28. 挑战赛:947 位用户注册、11 份有效提交。
  29. 主挑战(随访)最佳 quadratic weighted κ = 0.580。
  30. 子挑战 A(检测):灵敏度 <0.4(agreement 1)/<0.7(agreement 2)@1 FP/scan。
  31. 子挑战 B(分割)最佳 Jaccard = 0.567(超观察者间变异)。
  32. 子挑战 C(纹理)最佳 quadratic weighted κ = 0.733(part-solid 最难)。
  33. 挑战赛时间线:训练集 2019-11-20 / 训练验证提交与 ICIAR 论文 2020-02-10 / 测试集 2020-02-11 / 测试提交 2020-02-17~20 / 结果 2020-02-18~20。
  34. 数据集许可:CC BY-NC-ND(署名-非商业-禁止演绎)。
  35. 获取方式:Zenodo records/8348419 公开直链,~30.3 GB。
  36. 版本链:发布 2020-11-20 → v1 2022-06-04 → v2 2022-10-06(测试文件)→ v3 2023-09-01(报告匹配)→ v4 2023-09-15(help.txt)。
  37. v4 释放 292 份医学报告结构化(294 例中 2 例缺报告)+ 报告-注释匹配。
  38. v4 新文件:chars_trainNodules.csv / report.csv / allNods.csv / rad2Fleischner.csv / text2Fleischner.csv。
  39. 分割格式 MetaImage,命名 LNDbXXXX_radR.mhd(含该医生该 CT 全部结节分割)。
  40. 资助:ERDF/COMPETE 2020 + FCT 项目 PTDC/EEI-SII/6599/2014(POCI-01-0145-FEDER-016673);FCT 奖学金 SFRH/BD/120435/2016。
  41. 挑战赛与 ICIAR 2020 会议合办;LNDetector 项目背景(FCT 资助的肺癌筛查系统)。
  42. 库内互链:lidc-idri(19)、luna16(237)、deeplesion(17)、nlst(317)、nsclc-radiogenomics(257)、nsclc-radiomics(247)、padchest(117)、chest-imagenome(330)。

术语表(28 条)

术语 释义
LNDb Lung Nodule Database,本条目数据集
CHUSJ Centro Hospitalar e Universitário de São João,葡萄牙波尔图圣若昂中心医院(采集机构)
INESC TEC 葡萄牙系统与计算机工程、技术与科学研究所(主办方)
FEUP / FMUP 波尔图大学工程学院 / 医学院
单盲标注(single blind) 各医生独立标注、互不看对方结果——LNDb 与 LIDC-IDRI 的关键协议差异
两轮非盲修正 LIDC-IDRI 协议:先盲标→互看→修正(产生共识收敛)
唯一发现(unique finding) 去重后的结节/病变——LNDb 1,429 个
质心(centroid) 结节中心坐标
分割掩码(segmentation mask) 结节边界的像素级标注
九特征 subtlety/internal structure/calcification/sphericity/margin/lobulation/spiculation/texture/malignancy
Fleischner 指南 2017 学会肺结节管理指南,4 类随访建议
GGO Ground Glass Opacity,磨玻璃影
part-solid 部分实性结节(纹理三类之一,最难分类)
solid 实性结节
Fleischner 体积分箱 <100 mm³ / 100–250 mm³ / ≥250 mm³
随访建议(follow-up) 患者复查间隔建议——挑战赛主任务的输出
检测一致性 Ad 结节检测的观察者间一致性
分割一致性 MAD(平均绝对偏差)/ HD(Hausdorff 距离)/ Jaccard
Jaccard(IoU) 分割重叠度
MAD Mean Absolute Deviation,平均绝对偏差(mm)
HD Hausdorff Distance,豪斯多夫距离(mm)
Cohen’s κ(加权) 扣除随机一致的一致性系数;quadratic weight 对严重分歧重罚
Agreement 一致率(判定相同的样本占比)
quadratic weighted κ 二次加权 κ——随访/纹理分类的评估指标
FROC Free-Response ROC,检测任务的灵敏度-假阳性曲线
CPM Competition Performance Metric——LUNA16 指标,LNDb 因协议差异不适用
固定误差(fixation error) 医生是否真正找到结节(区别于"判定是否算结节"的决策误差)
决策误差(decision error) 对已找到的发现判断是否为结节
眼动追踪(eye tracking) 记录医生视线路径的数据——LNDb 312 次阅读记录
LNDetector 项目名(FCT 资助的肺癌筛查系统)
ICIAR 2020 挑战赛合办会议
CC BY-NC-ND 署名-非商业-禁止演绎(LNDb 数据集许可)
CC BY-4.0 署名即可自由使用(v4 论文许可)
MetaImage(.mhd/.raw) 医学影像通用格式,LNDb 的 CT 与分割格式

附录

附录 A:条目信息速查卡

项 值
条目名 LNDb
url_name lndb
类型 独立采集数据集 + 观察者变异研究 + 挑战赛 + 版本迭代(v1–v4)
论文 arXiv:1911.08434 / MedIA 2021;70:102027 / Sci Data 2024;11:512
团队 INESC TEC + CHUSJ + FEUP + FMUP(波尔图)
规模 294 例 CT(236 训练/验证 + 58 测试);1,429 唯一发现
许可 数据集 CC BY-NC-ND;v4 论文 CC BY-4.0
获取 Zenodo records/8348419(公开直链,~30.3 GB)
抓取时点 2026-09-30
库内互链 lidc-idri(19)/luna16(237)/deeplesion(17)/nlst(317)/nsclc-radiomics(247)/nsclc-radiogenomics(257)/padchest(117)/chest-imagenome(330)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 三篇高影响力论文 + Zenodo + grand-challenge 多入口;文献引用广泛
A 可获取性 8 Zenodo 公开直链,无注册墙无请求制;扣分于 CC BY-NC-ND 限制商业/演绎
I 可互操作 7 MetaImage 通用格式 + CSV 标注;无官方 DICOM 转换脚本
M 元数据质量 8 README.pdf + help.txt + 采集参数表 + 挑战赛页任务定义完备
S 可持续性 9 Zenodo 长期托管 + grand-challenge 平台,非个人主页单点
综合评级 8.2/10(高) 可获取性与可发现性突出;许可限制与格式细节微降分

附录 C:逐项证据链自证

关键数字 来源 位置
294 例 / 164 男性 / 中位 66 arXiv:1911.08434 方法节 ar5iv 全文
扫描仪/kV/mA/层厚参数 arXiv:1911.08434 Table I ar5iv 全文
1,897 标注 → 1,429 唯一发现 arXiv:1911.08434 + Nature Table 8 ar5iv 全文
312 眼动阅读记录 arXiv:1911.08434 ar5iv 全文
检测一致性 Ad 0.32 arXiv:1911.08434 Table II ar5iv 全文
分割一致性 MAD/HD/Jaccard arXiv:1911.08434 Table III ar5iv 全文
钙化类别 3≈5 解释 arXiv:1911.08434 讨论节 ar5iv 全文
CAD 0.926@0.25 断崖 arXiv:1911.08434 讨论节 ar5iv 全文
947 注册 / 11 提交 MedIA 2021 摘要 Elsevier/BU 仓储
随访 κ 0.580/分割 0.567/纹理 0.733 MedIA 2021 摘要 Elsevier/BU 仓储
挑战赛时间线与四任务 grand-challenge 官网 lndb.grand-challenge.org
版本链 v1–v4 Zenodo records/8348419 描述 Zenodo 页
CC BY-NC-ND Zenodo records/8348419 Zenodo 页
文件清单与大小 Zenodo records/8348419 Files Zenodo 页
v4 292 报告 / 五文件 Sci Data 2024 摘要 nature.com

附录 D:数据获取决策树

需求是什么?
├── 想直接下数据做实验
│   └── Zenodo records/8348419(CC BY-NC-ND,~30.3 GB,公开直链)
├── 想做外部验证(训练 LIDC-IDRI、测试 LNDb)
│   ├── 1) 下 LNDb 全集
│   ├── 2) 预处理对齐训练侧(层厚/间距/HU 窗)
│   └── 3) 按 agreement level 分层报告,声明单中心单厂商局限
├── 想引用"观察者变异"论点
│   └── 引 arXiv:1911.08434 Table II–V(一致性)+ 单盲协议背景
├── 想引用挑战赛基准
│   └── 引 MedIA 2021 结果,务必注明"检测与 LUNA16 不可比"
├── 想研究文本-图像标注一致性
│   └── 用 v4 文件(report.csv/allNods.csv/rad2Fleischner.csv/text2Fleischner.csv)
└── 想做商业应用
    └── 先解决 CC BY-NC-ND 的 NC/ND 限制(需另行授权)

附录 E:采集参数表(Table I 全转)

参数 取值
Siemens Sensation Cardiac 64 107(36.4%)
Siemens Somatom Definition Flash 59(19.5%)
Siemens Somatom go.Up 137(45.2%)
管电压峰值 kV 120 [100;140]
平均管电流 mA 161.9 ± 128.4
卷积核 Standard 4(1.4%)
卷积核 Sharp 160(54.6%)
卷积核 Very sharp 126(43.0%)
卷积核 Extremely sharp 3(1.0%)
平面内像素尺寸 mm 0.63 ± 0.09
层厚 mm 1.0 [0.5;1.0]
图像层数 318.5 [251;631]

附录 F:观察者间一致性总表

指标 LNDb(All vs All) LIDC-IDRI 方向
检测一致性 Ad 0.32 0.38 LNDb 低
分割 MAD (mm) 0.45 ± 0.21 0.48 ± 0.38 LNDb 好
分割 HD (mm) 2.13 ± 1.35 2.92 ± 3.15 LNDb 好
分割 Jaccard 0.57 ± 0.14 0.66 ± 0.13 LNDb 低
特征一致性 整体较高 参考 LNDb 好(除钙化)
钙化一致性 显著低 参考 LNDb 低
扫描级随访一致性 较低 参考 LNDb 低

附录 G:挑战赛四任务与结果总表

任务 输入 → 输出 评估指标 最佳结果
主挑战 Fleischner 分类 CT → 随访建议 quadratic weighted κ 0.580
子挑战 A 检测 CT → 结节 灵敏度 @ FP/scan <0.4(ag1)/<0.7(ag2)@1FP
子挑战 B 分割 CT + 质心 → 掩码 Jaccard 0.567(超观察者变异)
子挑战 C 纹理 CT + 质心 → 三类 quadratic weighted κ 0.733

附录 H:分割一致性逐医生对明细

医生对 MAD (mm) HD (mm) Jaccard
R1 vs R2 0.46 ± 0.26 2.19 ± 1.52 0.57 ± 0.15
R1 vs R3 0.49 ± 0.19 2.45 ± 1.65 0.58 ± 0.12
R2 vs R3 0.53 ± 0.18 2.26 ± 1.44 0.54 ± 0.14
R2 vs R4 0.32 ± 0.18 1.51 ± 0.39 0.58 ± 0.17
R2 vs R5 0.28 ± 0.04 1.58 ± 0.52 0.62 ± 0.07
R4 vs R5 0.41 ± 0.19 1.88 ± 0.89 0.57 ± 0.14
All vs All 0.45 ± 0.21 2.13 ± 1.35 0.57 ± 0.14

附录 I:检测一致性逐医生对明细

医生对 Ad
R1 vs R2 0.31
R1 vs R3 0.34
R2 vs R3 0.32
R2 vs R4 0.23
R2 vs R5 0.40
R4 vs R5 0.31
All vs All 0.32
LIDC-IDRI 0.38

附录 J:九特征与评分范围

特征 评分范围 备注
subtlety(隐蔽度) 1–5 —
internal structure(内部结构) 1–4 范围与其他不同
calcification(钙化) 1–6 一致性低,建议二值化
sphericity(球形度) 1–5 —
margin(边缘) 1–5 —
lobulation(分叶) 1–5 —
spiculation(毛刺) 1–5 —
texture(纹理) 1–5 solid/part solid/GGO 三类映射
malignancy(恶性度) 1–5 主观判断,非确诊

附录 K:版本链与文件对照

版本 日期 新增文件
发布 2020-11-20 原始数据集
v1 2022-06-04 仓库创建
v2 2022-10-06 testdata0.rar / testdata1.rar / testNodules.csv / testCTs.csv
v3 2023-09-01 chars_trainNodules.csv / report.csv / allNods.csv / rad2Fleischner.csv / text2Fleischner.csv
v4 2023-09-15 help.txt + 版本控制记录

附录 L:与 LIDC-IDRI / LUNA16 三维对照

维度 LIDC-IDRI (19) LUNA16 (237) LNDb(本条目)
来源 美国多中心 LIDC-IDRI 派生 葡萄牙单中心新采集
规模 1,018 CT 888 CT / 1,186 结节 294 CT / 1,429 发现
标注协议 两轮非盲修正 沿用 LIDC-IDRI 单盲独立
检测一致性 0.38 — 0.32
评估指标 一致性/分类 FROC + CPM 灵敏度@FP + κ + Fleischner
性能可比性 参照系 与 LNDC-IRI 同源可比 与 LUNA16 不可比
用途 训练/内验 检测擂台 外部验证/观察者变异

附录 M:CC BY-NC-ND 条款细读

  1. BY(署名):必须注明来源与作者——引用 Pedrosa et al. 的论文。
  2. NC(非商业):不得用于商业目的——商业产品训练、商业化服务受限。
  3. ND(禁止演绎):不得修改、再分发演绎版本——不能在 LNDb 上发布"增强版数据集"。
  4. 边界提醒:NC-ND 约束的是数据集;你的分析论文的许可由你自己的出版方决定。
  5. 与论文许可的区分:v4 论文是 CC BY-4.0(宽松),但数据集仍是 NC-ND——勿混(坑 4)。

附录 N:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 LNDb 是独立采集,非 LIDC-IDRI 子集/重标注 用途判断
坑 2 检测分数不可与 LUNA16 直接比(协议差异) 引用/对标
坑 3 口径总量是 1,429 唯一发现,非 1018/1033 数字引用
坑 4 数据集 CC BY-NC-ND ≠ v4 论文 CC BY-4.0 商用/许可
坑 5 grand-challenge 页日期双写 时间线引用
坑 6 钙化六分类不可靠,应二值化 特征使用
坑 7 ">6 结节"规则分纳入/标注两阶段 转述
坑 8 全 Siemens 单中心,不可声称多厂商泛化 外部验证声明

附录 O:四条方法学启示

  1. 外部验证专用数据集是一种独立类型——价值在"差异被精确刻画"而非数据量。
  2. 标注协议是一等公民——一致性数字必须与协议同报。
  3. 细粒度标签可能过度精细——钙化案例警示类别定义需临床共识。
  4. 评估指标锚定临床终点——体积随访优先体积指标,筛查减负关注工作流价值。

附录 P:复现管线骨架(代码注释版)

# 1. 下载(Zenodo 公开直链)
#    records/8348419: data0-5.rar / testdata0-1.rar / masks.rar / *.csv

# 2. 解压与组织
#    data*.rar -> 训练/验证 CT (LNDbXXXX.mhd/.raw)
#    testdata*.rar -> 测试 CT
#    masks.rar -> 分割 (LNDbXXXX_radR.mhd)

# 3. 预处理(对齐训练侧,避免域漂移)
#    - 重采样到训练侧像素间距(LNDb 平面内 0.63±0.09 mm)
#    - HU 肺窗裁剪 [-1000, 400] 或 [-1000, 600]
#    - 归一化与训练侧一致

# 4. 评估(勿用 CPM!)
#    检测: 按 agreement level 1/2 分层,灵敏度@FP/scan
#    分割: Jaccard + MAD + HD(并报体积误差)
#    随访: Fleischner 映射后 quadratic weighted κ

# 5. 报告
#    - 声明单中心单厂商局限
#    - 与 LIDC-IDRI 内验分数并列,突出跨库落差
#    - 注明 LNDb v4 版本与 CC BY-NC-ND 许可

附录 Q:检索决策树

你想找什么?
├── LNDb 数据集本体
│   └── Zenodo records/8348419(CC BY-NC-ND)
├── 数据集论文
│   └── arXiv:1911.08434(肺结节数据库)
├── 挑战赛论文与结果
│   └── MedIA 2021;70:102027
├── v4 报告标注
│   └── Scientific Data 2024;11:512
├── 挑战赛任务定义
│   └── lndb.grand-challenge.org
├── 外部验证集(同赛道)
│   └── lidc-idri(19) / luna16(237) / Tianchi
└── 想与 LUNA16 比 LNDb 检测分数?
    └── 不可行——协议差异使直接比较不成立(坑 2)

附录 R:双口径登记表

# 项 口径 A 口径 B 处理
1 结节/发现总量 1,429 unique findings(官方/arXiv) 1018 结节(第三方报道)/ 1033 lesions(子集口径) 按官方 1,429
2 挑战赛测试提交截止 2020-02-17 2020-02-20 页面双写,注明
3 挑战赛结果公布 2020-02-18 2020-02-20 页面双写,注明
4 论文 B 年份 2021(正式卷期) 2020(BU 仓储接受版页眉) 按 2021 引
5 许可层级 数据集 CC BY-NC-ND v4 论文 CC BY-4.0 分层引用

附录 S:维护计划与触发点

触发点 条件 动作 优先级
新版本 LNDb v5+ 发布 更新版本链与文件清单 1
挑战赛重开 平台重启评测 更新结果与基线 2
眼动数据公开 眼动文件独立发布 §2.7 遗留疑点消解 2
新外部验证论文 更多方法用 LNDb 评测 §7.3/§8.4 扩表 3
许可变更 数据集许可调整 §6 与附录 M 改写 4

附录 T:引文规范

@article{pedrosa2019lndb,
  title   = {LNDb: A Lung Nodule Database on Computed Tomography},
  author  = {Pedrosa, João and Aresta, Guilherme and Ferreira, Carlos and
             Rodrigues, Márcio and Leitão, Patrícia and Silva Carvalho, André and
             Rebelo, João and Negrão, Eduardo and Ramos, Isabel and
             Cunha, António and Campilho, Aurélio},
  journal = {arXiv preprint arXiv:1911.08434},
  year    = {2019}
}

@article{pedrosa2021lndbchallenge,
  title   = {LNDb challenge on automatic lung cancer patient management},
  author  = {Pedrosa, João and Aresta, Guilherme and Ferreira, Carlos and others},
  journal = {Medical Image Analysis},
  volume  = {70},
  pages   = {102027},
  year    = {2021},
  doi     = {10.1016/j.media.2021.102027}
}

@article{ferreira2024lndbv4,
  title   = {LNDb v4: pulmonary nodule annotation from medical reports},
  author  = {Ferreira, Carlos A. and others},
  journal = {Scientific Data},
  volume  = {11},
  number  = {1},
  pages   = {512},
  year    = {2024},
  doi     = {10.1038/s41597-024-03345-6}
}

@dataset{pedrosa2023lndbdataset,
  title     = {LNDb Dataset},
  author    = {Pedrosa, João and others},
  year      = {2023},
  publisher = {Zenodo},
  version   = {v4},
  doi       = {10.5281/zenodo.8348419}
}

附录 U:AI-Ready / FAIR 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(Zenodo 10.5281/zenodo.8348419)+ 论文 DOI
F2 富元数据 ✅ README.pdf + help.txt + 采集参数表 + 挑战赛页
A1 可访问协议 ✅ Zenodo 公开直链(无门禁)
A2 元数据可访问 ✅ 元数据始终开放
I1 互操作格式 ⚠️ MetaImage/CSV 通用;无官方 DICOM 转换
I2 词汇表引用 ✅ Fleischner/LIDC 九特征标准术语
R1 来源溯源 ✅ 采集机构/伦理/协议明示
R3 可复现流程 ✅ 测试集公开 + 评估脚本 + 挑战赛基线
许可限制 ⚠️ CC BY-NC-ND 禁商用/演绎
AI-Ready 综合 高 可获取性与可发现性突出;许可与格式为扣分项

附录 V:缩写速查

缩写 全称
LNDb Lung Nodule Database
CHUSJ Centro Hospitalar e Universitário de São João
INESC TEC Instituto de Engenharia de Sistemas e Computadores, Tecnologia e Ciência
FEUP / FMUP Faculdade de Engenharia / Faculdade de Medicina da Universidade do Porto
CAD Computer-Aided Diagnosis
Ad / Ac 检测一致性 / 特征一致性
MAD / HD Mean Absolute Deviation / Hausdorff Distance
FROC Free-Response Receiver Operating Characteristic
CPM Competition Performance Metric
GGO Ground Glass Opacity
κ / κw Cohen’s kappa / weighted kappa
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
FCT Fundação para a Ciência e a Tecnologia(葡萄牙科技基金会)
ICIAR International Conference on Image Analysis and Recognition

附录 W:临床随访研究检查清单(10 项)

  1. 许可核对:你的用途是否触犯 CC BY-NC-ND 的 NC/ND?(商用/演绎需另行授权)
  2. 外部验证声明:报告时写明"单中心、全 Siemens、回顾性诊断 CT"。
  3. 指标选择:检测用灵敏度@FP/scan(勿用 CPM);随访用 quadratic weighted κ。
  4. 不可比声明:任何检测结果都注明"与 LUNA16 不可直接比较"。
  5. 一致性对照:把你的模型-医生一致性与 §4 的医生间一致性并列展示。
  6. 钙化处理:若用九特征,钙化应二值化(坑 6)。
  7. 分层报告:检测结果按 agreement level 1/2 分层。
  8. 患者级划分:若自行切分训练/验证,按患者级避免泄漏(§7.6)。
  9. 版本声明:注明使用 LNDb v4 及对应文件。
  10. 口径统一:总量用 1,429 唯一发现(坑 3)。

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30。事实陈述以 arXiv:1911.08434(数据集论文,含观察者间一致性详表)、Pedrosa et al. MedIA 2021;70:102027(挑战赛)、Ferreira et al. Scientific Data 2024;11:512(v4 报告标注)与 Zenodo records/8348419(官方文件清单与版本链)为四源,经三源互证。第三方转引口径(“1018 结节”“1033 lesions”)与页面日期双写、许可层级差异等原始文档特征已在坑点与附录 R 存照。条目与库内 lidc-idri(19)、luna16(237)、deeplesion(17)、nlst(317)、nsclc-radiomics(247) 等条目互链,构成肺结节 CT 影像与肺癌筛查家族的完整检索面。后续维护触发点见附录 S。

条目定位一句话:LNDb 是肺结节 AI 领域的外部验证与观察者变异专用库——它不试图取代 LIDC-IDRI,而是做它的一面镜子;正确使用它的前提是牢记两件事:它是独立采集(非子集),它的检测分数与 LUNA16 不可比。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肺癌
  • luna16 — 共享标签:医学影像 / CT / 目标检测 / 肺癌
  • segthor — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • lidc-idri — 共享标签:医学影像 / CT / 医学图像分割 / 目标检测
  • lctsc — 共享标签:医学影像 / CT / 医学图像分割 / 肺癌
  • sliver07 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • btcv — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集