信息速览

NLST — 国家肺癌筛查试验 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | NLST(国家肺癌筛查试验影像与临床数据集) |
| 英文全称 | National Lung Screening Trial(ACRIN 6654) |
| 别名/简称 | NLST;NCT00047385;ACRIN 6654;NLST-LSS / NLST-ACRIN |
| 疾病分类(ICD-11) | 2C25 支气管或肺恶性肿瘤;2C25.0 肺腺癌;2C25.1 肺鳞状细胞癌;2C25.2 肺小细胞癌 |
| SNOMED CT | 363356006(肺恶性肿瘤);276490004(肺结节);64559000(孤立性肺结节) |
| 数据模态 | 低剂量 CT(DICOM)、数字化 H&E 病理切片(SVS/DICOM)、结构化临床随访表 |
| AI 任务类型 | 肺癌风险预测、结节检测/定位、死亡率结局建模、影像组学 |
| 样本总数 | 53,454 名参与者;公开影像子集 26,254 例 LDCT + 451 例病理 |
| 数据大小 | CT 影像约 11.3 TB(20 万+ DICOM 序列);临床表 CSV/SAS 数百 MB |
| 数据格式 | DICOM、SVS、CSV、SAS |
| 许可证 | 全量临床数据:CDAS Data Transfer and Use Agreement;公开影像子集:TCIA Data Usage Policy(强制数据引用) |
| 访问级别 | 申请审核(全量临床数据)/ 注册后开放(TCIA 与 IDC 公开影像子集) |
| DUO 标签 | GRU(通用研究使用,经 NCI 项目审批) |
| 语言 | 英语 |
| 首发日期 | 2013(TCIA 影像归档发布);试验入组 2002-08 |
| 最后更新 | 2021-09-24(TCIA 影像子集更新,截至 2026-09) |
| 发布机构 | 美国国家癌症研究所(NCI)+ 美国放射影像学网络学院(ACRIN) |
| 官方主页 | https://cdas.cancer.gov/nlst/ |
| 下载地址 | CDAS 数据集列表;TCIA 影像页 |
| DOI | 10.7937/TCIA.HMQ8-J677(影像归档) |
| 引用次数 | 10,000+(NEJM 2011 主论文,Scopus 收录,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有病理确诊与死亡 adjudication 金标签、DICOM 规范;扣分项:无官方划分、原始发布无结节 mask、全量数据需申请审批 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、肺癌筛查流行病学)、§7 偏倚分析(假阳性、过度诊断与人群代表性)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NLST 全量临床数据要求使用者通过 Cancer Data Access System(CDAS)提交项目申请、经 NCI 审批并签署数据转让与使用协议(DTUA);公开影像子集须遵守 TCIA 数据使用政策并完成数据引用。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? NLST(National Lung Screening Trial)是美国国家癌症研究所(NCI)主持、在 33 个医学中心完成的超大规模随机对照筛查试验:53,454 名 55-74 岁的重度吸烟高危人群被随机分配,连续三年接受低剂量 CT(LDCT,26,722 人)或传统胸片(26,732 人)筛查。它同时产出了两样东西:一个改变全球肺癌筛查指南的医学结论,和一份 26,254 例配对临床结局的高质量胸部 LDCT 影像库。
为什么重要? 试验首次以死亡率为终点证实 LDCT 筛查使肺癌死亡率相对降低 20.0%(95%CI 6.8-26.7,P=0.004),直接推动了美国预防服务工作组(USPSTF)对高危人群年度 LDCT 筛查的 B 级推荐。对 AI 社区而言,它是 Google Health 2019 年 Nature Medicine 端到端肺癌筛查模型(AUC 94.4%)的训练源数据,也是 Sybil 等"单次扫描预测未来肺癌风险"研究的起点。
我能用它做什么? 训练/验证肺癌风险预测与结节检测模型(患者级金标签来自病理确诊与死亡 adjudication);做影像组学与跨任务研究(同一批 LDCT 已被用于心血管风险预测);利用约 1,250 张配对 H&E 病理切片做影像-病理关联研究。注意:全量临床数据需向 NCI 的 CDAS 申请;影像与有限临床变量可在 TCIA/IDC 免申请下载。
§1.1 技术摘要
NLST 由 Lung Screening Study(LSS,NCI 承办)与美国放射影像学网络学院(ACRIN,协议号 6654)联合执行,2002 年 8 月至 2004 年 4 月在 33 个美国医学中心入组 53,454 名符合条件(55-74 岁、吸烟 ≥30 包年、既往吸烟者戒烟 ≤15 年)的参与者,按 1:1 随机分配至 LDCT 臂(26,722 人)或胸片臂(26,732 人),各接受 3 次年度筛查,死亡结局统一 adjudication 至 2009 年 12 月 31 日。数据采集采用双体系:LSS 与 ACRIN 各自维护筛查记录、异常记录、诊断流程与死亡数据,最终整合为 13 张临床数据表经 CDAS 发布。影像部分覆盖 26,254 例受试者的 LDCT(20 万+ DICOM 序列,约 11.3 TB)与 451 例受试者的约 1,250 张数字化 H&E 病理切片。AI 研究中的"患者级金标签"(1 年内/试验期内肺癌确诊、死亡结局)来自病理确诊与终点委员会裁定,而非影像判读本身——这是 NLST 区别于 LIDC-IDRI 等以标注为核心的影像数据集的根本特征。
§1.2 战略价值
从临床证据维度看:NLST 是全球唯一一个同时具备"53,454 人级样本 + 20.0% 肺癌死亡率相对降低 + 完整死亡 adjudication + 数字化影像"四要素的开放数据集。在它之前,所有胸部 AI 研究只能在"有标注、无结局"(如 LIDC-IDRI)或"有结局、不可及"(如 NELSON 试验)之间取舍;NLST 首次让算法可以对照真实死亡终点进行训练与评估,使"预测 1 年内/未来 6 年肺癌"这类时间敏感任务有了可信的监督信号。它的随访表(诊断、分期、治疗、死亡原因)还支持把影像模型嵌回生存分析框架。
从 AI 生态维度看:NLST 是肺癌 AI 的"黄埔军校"——Ardila 等 2019 年的端到端 3D 深度学习模型(NLST 测试集 6,716 例,AUC 94.4%,优于 6 名放射科医生)直接催化了 Google Health 的筛查 AI 产品线;Sybil(Mikhael 等,2023)在 NLST 上训练出可从单次 LDCT 预测未来 1-6 年肺癌风险的模型;同一批影像还被"跨界"用于心血管疾病风险预测(Nature Communications 2021)。对国内研究者,NLST 是低成本获得"高危人群纵向多轮筛查 + 结局"数据的几乎唯一途径,适合作为模型预训练/外部验证源或方法学创新的主战场。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 NLST 的差异 |
|---|---|---|---|---|
| NLST | 53,454 人;公开影像 26,254 例 LDCT | LDCT + 病理 + 临床表 | 筛查记录(层号+肺叶)、病理确诊、死亡结局 | 有真实死亡率终点与 3 轮纵向随访;无像素级结节 mask |
| LIDC-IDRI | 1,018 例胸部 CT | 诊断级 CT | 4 名放射科医生逐层标注结节轮廓 | 标注最全(mask 可得)但无筛查随访/死亡结局;是独立数据集,非 NLST 子集 |
| LUNA16 | 888 例(LIDC-IDRI 清洗子集) | CT | 结节 mask + 恶性度评分 | 结节检测基准专用;样本量与结局数据远小于 NLST |
| NSCLC-Radiomics (TCIA) | 422 例 | 诊断级 CT + mask | 医生勾画肿瘤分割 | 面向放射组学/分期;无筛查场景与纵向轮次 |
| NELSON | 约 7,557 人 | LDCT | 筛查记录 + 结节标注 | 欧洲男性人群;数据不公开,需数据访问委员会审批 |
| PLCO | 约 155,000 人 | 胸片为主 + 临床表 | 筛查与死亡结局 | 胸片臂试验(阴性结果);LDCT 影像缺失 |
§1.4 版本与发布时间轴
| 时间 | 事件 | 说明 |
|---|---|---|
| 2002-08 至 2004-04 | 入组与随机化 | 33 个中心,53,454 人 |
| 2002 至 2007 | 三轮年度筛查执行 | T0/T1/T2,依从率 >90% |
| 2010-10-28 | DSMB 宣布结果 | 肺癌死亡率相对降低 20.0% |
| 2011-06/08 | NEJM 主论文发表 | N Engl J Med 365:395-409,DOI 10.1056/NEJMoa1102873 |
| 2013 | TCIA 影像归档发布 | NLST collection DOI 10.7937/TCIA.HMQ8-J677 |
| 2021-09-24 | TCIA 影像子集重大更新 | 26,254 例 CT + 451 例病理,此前受限影像全面开放 |
| 2024(IDC v17 起) | IDC 增强发布 | DICOM 化病理、器官/结节分割、Sybil 边界框 |
| 2026-08-05 | LIDC-annot-NLST501 上线 | 501 个序列的 LIDC-IDRI 式多读者标注(CC BY 4.0) |
时间轴的主线是"试验 → 影像公开 → 标注增强"三段式:2013-2021 年间 NLST 影像经历了从受限到全面公开的转变(2021-09-24 为关键节点);2024 年起 IDC 的增强标注浪潮大幅降低了使用门槛;2026 年的 LIDC-annot-NLST501 补上了"多读者结节标注"这块最后拼图。引用任何历史结果时,请先确认其使用的是哪个时间点的数据版本。
§1.5 典型应用场景
- 端到端肺癌筛查 AI:以 T0/T1/T2 三轮 LDCT 为输入、1 年内病理确诊为标签,训练全卷 3D 风险预测模型(Ardila 2019 范式)。
- 未来风险预测("预判式"筛查):使用无结节可见期的扫描预测未来 1-6 年肺癌(Sybil 范式),服务筛查间隔个性化。
- 结节检测与定位:结合 Spiral CT Abnormalities 表的层号 + 肺叶弱标签,或引入 IDC 增强分割/LIDC-annot-NLST501 多读者标注做弱监督检测。
- 跨任务复用:同一批 LDCT 预测心血管钙化/事件风险(Nat Commun 2021 范式),验证"一次扫描多病种价值"。
- 影像-病理多模态研究:对 451 例有病理切片的受试者,关联影像表型与 H&E 组织学表型(注意病理仅覆盖约 450-500 名 LSS 肺癌患者)。
§2 医学背景
§2.1 ICD-11 编码映射
| 标签/概念 | ICD-11 编码 | ICD-11 中文名 |
|---|---|---|
| 肺恶性肿瘤(试验终点) | 2C25 | 支气管或肺恶性肿瘤 |
| 肺腺癌(主要病理亚型) | 2C25.0 | 支气管或肺腺癌 |
| 肺鳞状细胞癌 | 2C25.1 | 支气管或肺鳞状细胞癌 |
| 肺小细胞癌 | 2C25.2 | 支气管或肺小细胞癌 |
§2.1b SNOMED CT 映射
| 标签/概念 | ICD-11 | SNOMED CT 码 | 术语(SNOMED 官方名称) |
|---|---|---|---|
| 肺恶性肿瘤 | 2C25 | 363356006 | Malignant tumour of lung (disorder) |
| 肺结节(筛查异常) | — | 276490004 | Pulmonary nodule (disorder) |
| 孤立性肺结节 | — | 64559000 | Solitary pulmonary nodule (disorder) |
§2.2 疾病简介与流行病学
肺癌是全球死亡率最高的恶性肿瘤,吸烟是首要危险因素——NLST 入组时的背景数据显示,美国当时仍有约 9,400 万当前或既往吸烟者处于肺癌风险之中。肺癌的异质性与侵袭性强,既往以胸片(联合或不联合痰细胞学)为手段的随机筛查试验均未能降低肺癌死亡率。LDCT 早期研究提示其可在可接受的辐射剂量下检出更多早期病灶,NLST 因此被设计为检验"LDCT 筛查能否降低高危人群肺癌死亡率"的终极证据。试验期间 LDCT 致癌检出率(645 例/10 万人年)高于胸片臂(572 例/10 万人年,RR 1.13),而死亡率反而下降 20.0%,说明 LDCT 通过提前检出使更多患者处于可治愈窗口;代价是每轮 24.2% 的阳性率与 96.4% 的假阳性率,以及约 18.5%(Patz 2014 估计,延长随访后约 11%)的过度诊断比例。
§2.3 临床任务定义
本数据集支撑的核心临床任务是筛查(screening):对无症状高危人群施加年度 LDCT,识别"可疑恶性非钙化结节"(NLST 协议参照 Fleischner 标准,以 ≥4 mm 非钙化结节为阳性线索),并按随访建议进入诊断流程(增强 CT、PET、活检/手术)。衍生 AI 任务包括:筛查阳性判定(分类)、结节检出与定位(检测)、癌症风险评分(风险回归,对应 Lung-RADS 分级思想)、以及死亡率/生存预测(预后)。在 NLST 语境下,"金标签"有三个层级——筛查记录层面的影像判读(阅读者主观)、诊断流程层面的病理确诊(客观)、以及终点委员会裁定的死亡原因(客观但滞后),建模时必须明确对齐到哪一层。
关于判读标准的时代背景需要特别注意:NLST 执行期(2002-2007)使用的是 Fleischner 式 ≥4 mm 阈值;美国放射学会的 Lung-RADS v1.1 结构化分级体系(6 mm 阈值起评)在 2014 年后才普及,社区研究中出现两种用法——Ardila 2019 等工作将 Lung-RADS 回溯应用于 NLST 队列以对齐现代筛查语义,而直接复现试验本身结论时应使用原始 CRF 判读字段。使用公开影像 + Spiral CT Abnormalities 表时,建议保留原始判读字段并把 Lung-RADS 作为派生视图,避免把两种口径的"阳性"混入同一个标签。
§2.4 患者人群画像
| 维度 | 取值 | 来源 |
|---|---|---|
| 来源 | 33 个美国医学中心的社区/临床招募高危人群 | NEJM 2011 |
| 时间 | 2002-08 至 2004-04 入组;随访至 2009-12-31 | NEJM 2011 |
| 年龄 | 随机化时 61.4±5.0 岁(入选 55-74 岁) | PMC8643314 |
| 性别 | 男 59% / 女 41% | NEJM 2011 |
| 种族 | 白人 91.3%、黑人 4.3%、亚裔 2.1% | TCIA 影像子集 |
| 吸烟状态 | 当前吸烟 48.2% / 既往吸烟 51.8%,均 ≥30 包年 | PMC8643314 |
| 就医类型 | 健康筛查志愿者(无症状高危人群,非门诊患者) | NEJM 2011 |
| 试验网络 | LSS 参与者 64.8% / ACRIN 35.2% | PMC8643314 |
§2.5 临床价值
NLST 的直接临床产出是三项指南级结论:LDCT 筛查使肺癌死亡率相对降低 20.0%、全因死亡率降低 6.7%(95%CI 1.2-13.6);筛查的主要代价是高假阳性(96.4%)与少量侵入性操作并发症(1.7% 的被召回者接受侵入性操作,严重并发症率 0.03%);约需筛查 320 人才能预防 1 例肺癌死亡。这些结论塑造了 USPSTF 2021 年版推荐(50-80 岁、20 包年、当前吸烟或戒烟 15 年内,B 级)与 Medicare 报销政策。对 AI 研究者,这意味着 NLST 上的模型性能可以直接对照"人类放射科医生在真实筛查工作流中的表现"进行校准——这是绝大多数标注数据集不具备的外部效度。
从筛查工作流的角度看,NLST 完整记录了"阳性判读 → 随访影像 → 诊断流程 → 并发症"的下游链条:对阳性结果的评估共产生 61 例并发症和 6 例死亡(诊断评估相关),这一 harms 数据使 AI 研究可以模拟"假阳性减少多少能带来多少伤害下降"的完整决策曲线,而不只是 AUC。同时,Diagnostic Procedures 与 Medical Complications 两张表让"过度随访"与"过度诊断"这类卫生经济学问题可以在影像 AI 论文中被量化讨论——这是 NLST 相对纯影像标注库的独特加分项。
§2.6 金标准参考表
| 维度 | 内容 |
|---|---|
| 金标准划分 | 三层:①筛查记录(放射科医生 CRF 判读,含异常层号/肺叶/随访建议);②病理确诊(活检/手术标本的组织学诊断);③死亡结局(终点委员会裁定死亡原因,至 2009-12-31) |
| 标注方式 | 前瞻性结构化病例报告表(CRF),非回溯性标注;LSS 与 ACRIN 双体系独立执行后整合 |
| 标注者 | 各中心认证放射科医生(筛查判读);当地病理实验室 + 试验病理审查(确诊);独立终点委员会(死亡原因) |
| 性质 | 前瞻性 RCT + 死亡率终点 adjudication;AI 任务常用派生标签为"筛查后 1 年内活检确诊肺癌"(试验期内确诊肺癌 2,100 例) |
§3 数据集规格
§3.0 版本抉择矩阵
NLST 数据分散在 CDAS、TCIA、IDC 三个入口,按需求选对入口能省下大量时间:
| 你的需求 | 推荐入口 | 大小 | 理由 |
|---|---|---|---|
| 快速跑通管线/教学演示 | IDC 公开子集(idc-index) |
可按序列选择性下载 | 免申请、DICOM 已和谐、附带器官/结节分割增强标注 |
| 全量 LDCT 影像研究 | TCIA NLST collection | 约 11.3 TB | 完整 26,254 例 CT,NBIA 检索器按 2,500 人分批下载 |
| 死亡率/生存分析、完整临床变量 | CDAS 申请(Data-Only 项目) | CSV/SAS 数百 MB | 13 张临床表全量,含死亡原因与完整随访;需 NCI 审批 + DTUA |
| 结节像素级 mask | IDC 增强标注 或 LIDC-annot-NLST501 | 数 GB 至 10.67 GB | NLSTseg 结节/肿瘤 mask(DICOM SEG)、TotalSegmentator 器官分割;LIDC-annot-NLST501 为 501 序列多读者标注 |
| 病理切片 | TCIA(SVS)/ IDC(DICOM) | 约 1,250 张全切片 | 标准包 1,225 个 SVS 文件公开可下载 |
| X 光胸片 | ECOG-ACRIN(Contact Us 表单) | 未公开规模 | 仅 ACRIN 中心已数字化;LSS 中心 X 光未数字化不可得 |
§3.1 模态详情
低剂量 CT(核心模态):多排螺旋 CT(≥4 排),采集参数按协议控制以将平均有效剂量压至约 1.5 mSv(约为常规诊断胸部 CT 的 1/5)。每名受试者最多 3 个筛查轮次(T0/T1/T2),每轮一个 axial 诊断序列 + 一个定位像(localizer)。DICOM 元数据保留 kVp、mAs、pitch、重建间隔等技术参数(部分序列缺失,见 §4.5)。TCIA 全量 CT 约 20,000,000+ 文件、11.3 TB。
从工程视角理解这一模态的三个特点:第一,扫描协议跨 33 个中心、跨 5 个年度,kVp/mAs/重建核的分布相当宽,任何"硬编码默认参数"的预处理都会在部分序列上失效;第二,定位像占序列总量的约三分之一,是最大的静默数据陷阱(见坑点 3);第三,每轮筛查的 axial 序列与定位像在 DICOM 层级上同属一个 study,按 study 遍历时必须以 ImageType 区分模态用途。
数字化病理切片:来自 LSS 分支约 450-500 名肺癌患者手术/活检标本的 H&E 染色切片,标准包 1,225 个文件(另有零散补充切片),SVS 格式经 TCIA 公开,IDC 提供 DICOM 化版本(Clunie 等 2025 转换,Zenodo DOI 10.5281/zenodo.16968142)。配套 TMA(组织微阵列)由 438 例肺癌、0.6 mm 组织芯、9 个阵列构成。病理样本与影像的交集有限(451 例受试者中含病理者与 CT 覆盖者的重叠需逐例核对),设计影像-病理多模态任务前应先做 ID 交集盘点。
结构化临床表:13 张 CSV/SAS 表(见 §3.2),覆盖人口学、吸烟史、随机臂、每轮筛查判读、每条异常记录、诊断流程、并发症、肺癌特征、初始治疗、死亡原因。Spiral CT Screening 表是影像-临床对齐的枢纽:它以每次 CT 筛查为粒度,携带技术参数、判读者 ID 与随访建议,可与 DICOM study 通过 participant × 轮次对齐。
§3.2 按子集样本数
| 子数据集(CDAS) | 记录数(约) | 粒度 |
|---|---|---|
| Participant | 53,500 | 每名参与者 1 条 |
| Spiral CT Screening | 75,100 | 每次 CT 筛查 1 条 |
| Chest X-Ray Screening | 73,500 | 每次胸片筛查 1 条 |
| Spiral CT Abnormalities | 177,500 | 每条 CT 异常 1 条 |
| Chest X-Ray Abnormalities | 47,200 | 每条胸片异常 1 条 |
| Spiral CT Comparison Read Abnormalities | 31,000 | 每条对比阅片异常 1 条 |
| Chest X-Ray Comparison Read Abnormalities | 5,200 | 每条对比阅片异常 1 条 |
| Diagnostic Procedures | 60,900 | 每次诊断流程 1 条 |
| Medical Complications | 800 | 每条并发症 1 条 |
| Lung Cancer | 2,100 | 每例肺癌 1 条(含同体多原发) |
| Treatment | 4,600 | 每次初始治疗 1 条 |
| Cause of Death | 15,200 | 每条死亡证明/裁定条件 1 条 |
| LSS Non-cancer Condition | 10,900 | 每条非癌伴随病 1 条 |
公开影像子集的 CT 构成(CDAS 影像页):筛出肺癌且有同年影像 622 人;有影像的肺癌 436 人;结节阳性/筛查阳性 9,470 人;三轮全阴 12,548 人;其他 3,162 人。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| LDCT 影像 | DICOM(单文件切片) | TCIA/IDC 发布;IDC 版本经过 DICOM 和谐化并附 SEG/NIfTI 分割 |
| 病理切片 | SVS(TCIA)/ DICOM WSI(IDC) | 标准包 1,225 个文件 + 补充切片 |
| 临床数据 | CSV / SAS | CDAS 发布,配套 PDF Data Dictionary |
| 影像元数据 | CSV(TCIA metadata,如 CT Image Info 表) | 含 kVp/mAs/pitch/tableRotation/reconInterval 等 |
| 下载清单 | .tcia manifest 文件 | NBIA Data Retriever 导入用 |
§3.4 存储大小
| 组件 | 大小 |
|---|---|
| 全量 CT(manifest-NLST_allCT.tcia) | 约 11.3 TB |
| TCIA collection 总量(含病理等) | 11.92 TB |
| 病理切片(SVS) | 1,225+ 文件(单个 SVS 数百 MB 级) |
| 临床表(CSV/SAS,13 张) | 数百 MB |
| LIDC-annot-NLST501(衍生标注) | NIfTI 分割 734 MB;DICOM 分割 10.67 GB;校正 CT 2.26 GB |
§3.5 标注方式
筛查判读为前瞻性人工标注:各中心放射科医生按协议在结构化 CRF 上记录每条异常(部位、层号、性质、随访建议),并存在"对比阅片"(与上一年度比较)与跨年异常变化记录。病理确诊为组织学金标准(活检/手术病理)。死亡原因为终点委员会 adjudication(结合死亡证明、病历与尸检信息)。注意:原始发布不含像素级分割 mask——病理医生的 TMA ROI 注释图像在研究结束后未保留(官方明确声明),需要 mask 的研究应使用 IDC 增强标注或 LIDC-annot-NLST501 衍生集。
§3.6 标注者资质与一致性
筛查判读由各参与中心的认证放射科医生完成,LSS 与 ACRIN 分别维护质控体系(设备参数校验、判读协议培训)。试验设有跨年"对比阅片"记录异常大小/密度变化,构成天然的双时间点判读对照。数据集中未公布统一的判读者间 kappa 统计;若研究需要读者一致性证据,可用 LIDC-annot-NLST501(多名标注者按 LIDC-IDRI 式协议独立标注 501 个序列,2026 年发布)作为代理。
§3.7 采集周期
入组与基线筛查(T0)于 2002-08 至 2004-04 完成;T1、T2 按年度推进;诊断流程与治疗数据随后续入;全部死亡结局 adjudication 截止 2009-12-31(中位随访 6.5 年)。影像归档与临床表整合后于 2013 年起陆续发布。
各阶段的时间语义值得注意:随机化日期是所有时间变量的锚点(T0 即随机化后首次筛查);协议规定若 T0 筛查即确诊肺癌,则不再执行后续轮次,因此"轮次缺失"在试验设计上是信息性的(癌症已确诊),不是数据丢失;试验结束后的延伸随访信息不包含在试验期数据表中,做长期生存建模时须引用官方延长随访文献的结论而非臆测。
§3.8 地域覆盖
全部 33 个中心位于美国(含东部、南部、中西部、西部多州),由 LSS(21 个 LSS 体系中心,承担 64.8% 参与者)与 ACRIN(12 个 ACRIN 体系中心,35.2%)双网络覆盖。所有数据为英语环境采集,医疗流程遵循美国临床规范。
§3.9 设备规格
| 项目 | 规格 |
|---|---|
| 扫描仪 | 多排螺旋 CT,≥4 排探测器(协议下限) |
| 有效剂量 | 平均约 1.5 mSv/次 LDCT(对照常规胸部 CT 约 8 mSv) |
| 技术参数元数据 | kVp、mAs、pitch、tableRotation、重建间隔等(部分序列缺失) |
| 胸片 | 单张后前位(对照臂);ACRIN 中心已数字化,LSS 中心未数字化 |
| 病理 | H&E 染色 FFPE 切片 → 全切片扫描(SVS);TMA 0.6 mm 芯 |
设备规格对 AI 研究的三点提示:其一,"≥4 排探测器"是协议下限而非统一配置,33 个中心实际部署了多个厂商、多个年代的机型,序列级技术参数(kVp/mAs/pitch/重建间隔)是识别设备代际的唯一可靠线索;其二,1.5 mSv 是试验平均估计值而非每序列记录值,做剂量相关分析时应使用 DICOM 头中的实际曝光参数而不是全文引用的平均值;其三,重建间隔的不齐(老协议常见)使"按层号索引"在跨序列比较时天然脆弱,任何跨轮次、跨中心的逐层对齐都应基于物理坐标完成。
§3.10 深度溯源链
原始采集(33 中心,LSS/ACRIN CRF 体系)→ NCI 委托 IMS 管理与统计分析(CDAS 平台)→ 全量数据经 CDAS 申请发布(审批 + DTUA)→ 公开影像子集经 TCIA(2013 归档,2021-09-24 更新,DOI 10.7937/TCIA.HMQ8-J677)与 NCI Imaging Data Commons(DICOM 和谐化 + 增强标注)二次分发 → 衍生标注集(NLSTseg、Sybil 边界框、LIDC-annot-NLST501,CC BY 4.0)→ 病理 DICOM 转换(Clunie 等 2025,Zenodo DOI 10.5281/zenodo.16968142)。每一跳都有明确的机构与文档支撑,引用时按"试验数据 + 影像归档"双引用义务执行(见 §9)。
§4 数据结构
§4.0 目录树
以下为 TCIA NLST collection 经 NBIA Data Retriever 下载解压后的典型结构(目录层级以官方 manifest 为准;IDC 下载结构为 collection_id/subject/study/series 的 DICOM 层级):
NLST/
├── manifest-NLST_allCT.tcia # NBIA 清单(全部 CT)
├── NLST-CT/ # 26,254 名受试者的 LDCT
│ └── <SubjectID>/ # 受试者目录(NLST 编号)
│ └── <Study_T0|T1|T2>/ # 筛查轮次
│ ├── <LocalizerSeriesUID>/ # 定位像序列(约 32% 序列为此类)
│ └── <AxialSeriesUID>/ # 轴位诊断序列
│ └── *.dcm # 单切片 DICOM 文件
├── NLST-pathology/ # 451 例受试者病理
│ ├── Primary-Tumor-Slides/ # 标准包(1,225 个 SVS 文件)
│ └── Second-Primary-Tumor-Slides/ # 补充包
├── clinical/ # TCIA 公开临床子集
│ ├── nlst_ct_clinical_data.csv # 有限临床变量(公开)
│ └── CT Image Info.csv # 序列级技术参数元数据
└── metadata/ # 采集/标注元数据
├── participants.csv
└── series/ # 序列级清单
CDAS 全量临床数据则以"每张表一个 CSV/SAS + 一个 PDF Data Dictionary"的组织形式交付,表名与 §3.2 一致。
§4.1 DAIMS 字段字典
以下为核心表的字段字典(AI 视角 8 列);CDAS 官方 Data Dictionary PDF 为逐字段权威定义:
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| participant_id | Text | 参与者唯一编号(NLST 编码体系) | 字母数字编号 | 主键;跨表 join;分组划分键 | 无(试验编码) | 无 | 53,454 个唯一值 |
| arm | Text | 随机分组 | LDCT / CXR | 仅 LDCT 臂有公开 CT;臂间对照分析 | 无 | 无 | 2 类 |
| study_year | Text | 筛查轮次 | T0 / T1 / T2 | 纵向时间轴;label 时间对齐 | 无 | 无 | 3 类 |
| kvp | Float | 管电压 | 120 | 剂量/协议归一化、域偏移分析 | 设备记录差异 | 部分序列缺失 | 依设备而定 |
| mas | Float | 管电流量(mAs) | 40 | 剂量协议分析 | 部分序列缺失 | 缺失即缺记录 | 依设备而定 |
| pitch | Float | 螺距 | 0.9 | 重建/插值策略选择 | 部分序列缺失 | 缺失即缺记录 | 依设备而定 |
| recon_interval | Float | 重建间隔(mm) | 1.0 | 切片重采样目标间距 | 部分序列缺失 | 缺失即缺记录 | 依设备而定 |
| abnormality_slice | Integer | 异常所在轴位层号 | 87 | 弱监督定位(无 mask 时的唯一定位信息) | 依赖判读者记录;与重采样后索引需换算 | 无异常则无记录 | 依序列而定 |
| lung_lobe | Text | 异常所在肺叶 | RUL / LLL 等 | 弱标签;左右翻转增强会破坏该标签 | 判读者主观边界 | 无异常则无记录 | RUL/RML/RLL/LUL/LLL 等 |
| comparison_read_change | Text | 对比阅片记录的异常大小/密度变化 | 增大 / 稳定 | 纵向生长特征;时间序列任务的强信号 | 依赖跨年配准与判读 | 无既往筛查则无记录 | CRF 枚举值 |
| screen_recommendation | Text | 筛查判读后的随访建议 | 6 个月随访 CT / 立即诊断 | 阳性判定代理标签;工作流模拟 | 判读协议时代依赖(Fleischner ≥4 mm) | 无 | CRF 枚举值 |
| lung_cancer_dx | Integer | 试验期内肺癌确诊 | 0/1 | 患者级主标签 | 以病理/终点裁定为准 | 0 = 无确诊 | 0/1 |
| vital_status / cause_of_death | Text | 死亡结局与裁定原因 | 肺癌死亡 / 其他 | 死亡率终点标签 | 终点委员会 adjudication 至 2009-12-31 | 存活者无死亡记录 | CRF 枚举值 |
§4.2 标签分布
| 标签口径 | 数量 | 说明 |
|---|---|---|
| LDCT 臂试验期肺癌(NEJM 主分析) | 1,060 例 | 发病率 645 例/10 万人年 |
| LDCT 臂随访期累计肺癌(Patz 2014 分析) | 1,089 例 | 与胸片臂 969 例对比得过度诊断估计 |
| Lung Cancer 数据集(全试验,含多原发) | 约 2,100 例 | 两臂合计,含同体多原发肿瘤 |
| 1 年内活检确诊(Ardila 2019 口径) | 638 例 | 端到端 AI 常用标签;筛查检出 360 + 非筛查检出 319(DeepCAD 口径 679) |
| 筛查阳性(LDCT 三轮合计) | 阳性率 24.2%,假阳性 96.4% | 阳性 ≠ 癌症,建模时严格区分 |
| 死亡结局 | LDCT 臂 247 /10 万人年 vs 胸片臂 309 /10 万人年(肺癌死亡) | Cause of Death 表 |
§4.3 关键统计
- CT 序列总量(IDC v17):203,087 个序列 / 73,113 个 study / 26,254 名患者;其中定位像占 32.1%(65,181 个)。
- 有效诊断序列:主体序列的层数集中于 100-350 层(97.4%),少于 50 层的序列占 3.78%。
- 序列级异常统计(IDC 清洗管线):JPEG 压缩序列 161 个(0.1%);缺 ImagePositionPatient 3 个;几何不一致 3,985 个(1.96%);dcm2niix 转换失败 35 个。
- 筛查依从率 >90%;LDCT 臂完成全部三轮筛查 95%。
- 年龄中位数 60 岁(IQR 57-65);男性 59%;白人 91.3%。
- 病理切片:标准包 1,225 个 SVS 文件,覆盖约 450-500 名 LSS 肺癌患者中的 451 例;TMA 覆盖 438 例肺癌。
- 衍生标注:LIDC-annot-NLST501 覆盖 501 个序列 / 2,004 个标注 study(CC BY 4.0);IDC 的 TotalSegmentator 器官分割覆盖全部 NLST 患者(70+ 器官)。
§4.4 数据层级
参与者(53,454)
└── 随机臂(LDCT 26,722 / CXR 26,732)
└── 筛查轮次(T0 / T1 / T2,每臂 3 轮)
└── 影像检查(DICOM study)
└── DICOM 序列(定位像 + 轴位)
└── 切片(DICOM instance)
临床层级:
参与者 → 筛查记录(Spiral CT/CXR Screening)
→ 异常记录(Abnormalities,层号 + 肺叶)
→ 诊断流程(Diagnostic Procedures)→ 并发症
→ 肺癌(Lung Cancer,病理特征)→ 治疗(Treatment)
→ 死亡(Cause of Death)
§4.5 缺失值与信息性缺失
| 缺失情形 | 位置 | 处理建议 |
|---|---|---|
| kVp/mAs/pitch/tableRotation/重建间隔缺失 | 部分序列的 CT Image Info 元数据 | 官方明确"not available on some series";缺失本身可作为协议代际特征,禁止硬编码默认值 |
| 结节像素 mask | 全数据集原始发布 | 用 IDC 增强(NLSTseg/TotalSegmentator)或 LIDC-annot-NLST501;或仅用层号+肺叶弱标签 |
| 异常记录无对应影像 | 部分异常无公开影像 | 以 participant_id × study_year join 影像清单后再取交集 |
| 完整随访/死亡数据 | 公开临床子集不含 | 走 CDAS 申请;不得用公开子集冒充死亡率分析 |
| LSS 中心 X 光 | 未数字化 | 数据集层面不可得,勿在方案中承诺使用 |
| T0 确诊者的 T1/T2 | 无后续筛查(协议性截断) | 纵向模型须显式处理右截断,勿计为缺失增强 |
| 病理 ROI 注释图像 | 未保留(官方声明) | 以 H&E 原图 + CRF 组织学记录代替;勿声称有带注释版本 |
| ACRIN 专属元素 | 公开子集不含 | 经 ECOG-ACRIN Contact Us 单独申请(48 工作小时响应) |
§5 数据划分与使用建议
§5.1 官方划分
NLST 是临床试验数据集,无官方 train/val/test 划分——试验的"分析总体"是统计学分析计划定义的意向治疗人群,与机器学习的划分概念不同。任何论文报告的划分均为研究者自定义。
§5.2 社区惯例划分
- Ardila 2019 范式:按患者划分训练/验证/测试,标签为"当前或上一次筛查后 1 年内病理确诊肺癌",测试集 6,716 例(含 86 例阳性)。
- Sybil 范式:从 NLST 训练,留出 6,282 例 LDCT 作内部 held-out,再在 MGH(8,821 例)与 CGMH(12,280 例)外部验证。
- 结节检测范式:取 Spiral CT Abnormalities 表与公开影像求交集,按患者分组划分,以层号 + 肺叶作弱定位监督。
§5.3 划分策略与泄漏风险(重点)
- 患者级分组是底线:同一参与者最多 3 轮筛查、每轮 2 个序列(定位像 + 轴位),203,087 个序列对应 26,254 名患者——按序列随机划分会把同一人的不同轮次拆进训练与测试,AUC 虚高可达不可信级别。必须以
participant_id做 GroupShuffleSplit / GroupKFold。 - 时间对齐防前视:标签时间为"筛查后 1 年内确诊"时,T2(最后一轮)之后的确诊信息不得进入更早轮次的特征;纵向模型应对齐"扫描日期 → 确诊窗口"。
- 中心分层:33 个中心设备与协议有差异,建议按中心分层抽样并保留一个"留出中心"做域移位诊断(LSS 与 ACRIN 体系参数不同)。
- 派生标注的独立性:IDC 增强分割、LIDC-annot-NLST501 与 Sybil 边界框是 AI 生成的二次产物,若用它们做监督,测试集不得混入用同一模型生成标注的样本。
§5.4 交叉验证与外部验证建议
- 5 折 GroupKFold(按参与者)+ 中心分层,报告折间方差而非单次划分结果。
- 外部验证首选不同医疗体系的 LDCT 队列(如 MGH、CGMH——Sybil 先例显示 NLST→CGMH AUC 0.94 但 NLST→MGH 仅 0.86,提示人群/设备域移位)。
- 死亡率终点任务建议按"试验内窗口(至 2009-12-31)"截断并声明右删失。
§5.5 一个可执行的划分模板
以下配置可作为大多数论文的起点(与社区主流工作兼容):
总体:公开影像 + CDAS 全量临床(申请获批后)按 participant_id 取交集
训练 : 验证 : 测试 ≈ 70% : 10% : 20%(按患者,分层键 = 随机臂 × 中心体系 × 吸烟状态)
留出 : 随机选 2-3 个整中心作"域移位诊断集"(不参与任何调参)
标签 : 筛查后 1 年内病理确诊(主任务);筛查阳性(辅助任务)
指标 : 患者级 AUC(bootstrap 95% CI)、每轮 FPR、灵敏度 @ 95% 特异度
禁止 : 测试集患者出现在任何衍生标注的训练中(AI 生成标注同样受此约束)
报告时建议附一张"划分指纹表"(各子集患者数/癌症数/阳性数/中心数),让审稿人可以在不读代码的情况下核对你的口径——NLST 论文审稿中最常见的质疑就是样本口径对不上。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
最省事的路径是 NCI Imaging Data Commons(IDC):无需申请、无需 NBIA 客户端,idc-index 直接拉取 NLST collection(含增强标注):
pip install --upgrade idc-index
# 下载整个 NLST collection(注意:会连带分析结果集,需要 >12TB 磁盘)
idc download nlst
只想下载 CT 序列时,用 SQL 过滤后再下载(见 §6.1)。若需要全量临床表,请先完成 CDAS 申请(§6.2)。
§6.1 快速上手(10 分钟跑通)
# ---------------------------------------------------------------
# 预期目录结构(data_root 下):
# data_root/
# └── <SubjectID>/<Study_T0|T1|T2>/<SeriesUID>/*.dcm
# data_root 拼接关系:patient_dir = data_root / str(subject_id)
# 最小可用子集:先下载 1 名患者的 1 个轴位序列(约 100-300 个 dcm)
# ---------------------------------------------------------------
from idc_index import IDCClient
client = IDCClient()
# 只取 nlst collection 的 CT 序列(排除增强标注结果)
query = """
SELECT SeriesInstanceUID FROM index
WHERE Modality = 'CT' AND collection_id = 'nlst'
"""
series_uids = client.sql_query(query)["SeriesInstanceUID"].values.tolist()
client.download_from_selection(
seriesInstanceUID=series_uids[:50], # 先取 50 个序列试跑
downloadDir="./nlst_data",
)
读取与可视化一个序列:
import pydicom
import numpy as np
from pathlib import Path
series_dir = Path("./nlst_data") # 上述下载目录
slices = []
for f in sorted(series_dir.rglob("*.dcm")):
ds = pydicom.dcmread(f, stop_before_pixels=True)
slices.append((float(ds.ImagePositionPatient[2]), f))
slices.sort(key=lambda t: t[0]) # 按物理 z 轴排序,勿按文件名
volume = np.stack([
pydicom.dcmread(f).pixel_array * float(ds.RescaleSlope)
+ float(ds.RescaleIntercept)
for _, f in slices
]).astype(np.int16) # HU 单位
print(volume.shape, volume.min(), volume.max())
§6.2 数据获取全流程
| 路径 | 内容 | 前置条件 | 大小 |
|---|---|---|---|
| TCIA | 全量 CT + 病理 SVS + 公开临床子集 | 无(遵守 TCIA 数据使用政策) | 约 11.3 TB(CT 全量) |
| IDC | CT + 病理 DICOM + 增强标注 | 无 | 按需 |
| CDAS | 13 张全量临床表 + 硬盘影像交付 | 项目申请 → NCI 审批 → DTUA 签署 | 数百 MB(表) |
| ECOG-ACRIN | ACRIN 中心 X 光、血/尿/痰标本 | Contact Us 表单(48 工作小时回复)+ MTA | 未公开规模 |
CDAS 申请流程(以 Data-Only 项目为例):
1. 注册 CDAS 账号 → https://cdas.cancer.gov/
2. "Begin a new project" → 选择项目类型(Data-Only / Images / EEMS)
3. 填写研究摘要、数据使用计划(PI、机构、伦理信息)
4. NCI 评审 → 通过后在线签署 Data Transfer and Use Agreement
5. 数据开放下载(CSV/SAS + Data Dictionary PDF)
提示:Data Dictionary 全部公开——申请前先精读,确认目标变量存在。
三类项目的差异需要提前规划:Data-Only 适合只需要临床表的生存/流行病学研究;Images 项目在获批后除下载外还可选择外接硬盘交付(对 11.3 TB 影像是更现实的方案);EEMS 项目面向生物标本(FFPE 组织、TMA、ACRIN 血/尿/痰标本),需叠加 Material Transfer Agreement。若同时需要影像与 X 光,注意 X 光归 ECOG-ACRIN 管理,须另行提交 Contact Us 表单(48 个工作小时内响应)。
TCIA 批量下载(全量 CT,分 5 批、每批 2,500 人):
# 安装 NBIA Data Retriever 后,导入 TCIA 页面提供的 manifest:
# manifest-NLST_allCT.tcia (全量,11.3 TB)
# TCIA 亦提供按患者批次拆分的 manifest,可分块下载控制带宽
§6.3 预处理全流程(可运行)
# DICOM 序列 → HU 体数据 → 重采样 → 肺区裁剪
# 依赖:pydicom, numpy, scipy, SimpleITK(可选)
import pydicom, numpy as np
from pathlib import Path
from scipy.ndimage import zoom
def load_hu_volume(series_dir: Path):
"""读取一个序列并转为 HU 体数据;按 z 物理坐标排序。"""
slices = []
for f in series_dir.rglob("*.dcm"):
ds = pydicom.dcmread(f)
if getattr(ds, "ImageType", [""])[2] == "LOCALIZER":
continue # 关键:丢弃定位像
slices.append((float(ds.ImagePositionPatient[2]), ds, f))
slices.sort(key=lambda t: t[0])
vol = np.stack([
s[1].pixel_array * float(s[1].RescaleSlope)
+ float(s[1].RescaleIntercept) for s in slices
]).astype(np.int16)
# 重采样到 1.0 x 1.0 x 1.0 mm(老协议序列层厚/间隔不齐)
ps = slices[0][1].PixelSpacing
ts = float(slices[1][0]) - float(slices[0][0])
vol = zoom(vol, (ts / 1.0, float(ps[0]) / 1.0, float(ps[1]) / 1.0),
order=1).astype(np.int16)
return vol
def window(vol, lo=-1200, hi=600):
"""肺窗:NLST 常用肺窗 + HU 裁剪后归一化。"""
v = np.clip(vol, lo, hi)
return ((v - lo) / (hi - lo)).astype(np.float32)
def lung_crop(vol, pad=20):
"""阈值 -600 HU + 连通域提取肺区并裁剪(DeepCAD 式预处理)。"""
mask = vol > -600 # 体膜外为低值
xs = np.where(mask.any(axis=(1, 2)))[0]
ys = np.where(mask.any(axis=(0, 2)))[0]
zs = np.where(mask.any(axis=(0, 1)))[0]
return vol[max(xs[0]-pad, 0):xs[-1]+pad,
max(ys[0]-pad, 0):ys[-1]+pad,
max(zs[0]-pad, 0):zs[-1]+pad]
vol = load_hu_volume(Path("./nlst_data/<SubjectID>/<Study_T0>/<SeriesUID>/"))
vol = lung_crop(vol)
vol_w = window(vol)
质量过滤清单(对齐 IDC 清洗经验):剔除定位像、层数 <50 的序列、几何不一致序列(ImagePositionPatient 跳变)、JPEG 压缩序列;对 gantry tilt 序列用 SimpleITK 重切片而不是直接 stack。
需要 NIfTI 格式(如接入 nnU-Net 或 3D Slicer 工作流)时,可批量转换并在失败时记录原因,而非中断管线:
# 批量 dcm2niix 转换:NLST 有 35 个序列在 IDC 管线中转换失败
# (4 个 gantry tilt 警告、31 个 ImageType 组内不一致),失败要落日志
find ./nlst_data -mindepth 3 -maxdepth 3 -type d | while read -r series_dir; do
dcm2niix -z y -o ./nifti_out -f "%p_%s" "$series_dir" \
2>> ./convert_failures.log || echo "$series_dir" >> ./convert_failures.log
done
完成预处理后,建议把"序列质检表 + 标签口径 + 划分文件"三者打包为一个分析级数据快照(parquet + manifest),后续所有实验只从快照读取——NLST 的体量(20 万序列)下,这一步能把迭代实验的成本降低一个数量级。
§6.4 PyTorch DataLoader(完整可运行)
import pydicom, numpy as np, torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
from scipy.ndimage import zoom
class NLSTScreenDataset(Dataset):
"""
NLST 患者级筛查序列数据集。
目录约定:
root/<SubjectID>/<Study_T0|T1|T2>/<SeriesUID>/*.dcm
labels: dict {subject_id: int} # 1 = 目标窗口内肺癌确诊(CDAS 申请数据)
注意:同一个 subject 的多轮扫描只应出现在同一个 split。
"""
def __init__(self, root, labels, subjects, out_shape=(64, 256, 256)):
self.root, self.labels, self.subjects = Path(root), labels, subjects
self.out_shape = out_shape
def _load_series(self, series_dir):
sl = []
for f in series_dir.rglob("*.dcm"):
ds = pydicom.dcmread(f)
if getattr(ds, "ImageType", [""])[2] == "LOCALIZER":
continue
sl.append((float(ds.ImagePositionPatient[2]), ds, f))
sl.sort(key=lambda t: t[0])
vol = np.stack([s[1].pixel_array * float(s[1].RescaleSlope)
+ float(s[1].RescaleIntercept) for s in sl]).astype(np.float32)
vol = np.clip(vol, -1200, 600)
vol = (vol + 1200) / 1800.0
z = np.array(self.out_shape) / np.array(vol.shape, dtype=np.float32)
return zoom(vol, z, order=1).astype(np.float32)
def __len__(self):
return len(self.subjects)
def __getitem__(self, idx):
sid = self.subjects[idx]
series = sorted((self.root / sid).glob("**/*.dcm"))
series_dir = series[0].parent # 单序列范式:取第一个有效序列
vol = self._load_series(series_dir.parent)
x = torch.from_numpy(vol).unsqueeze(0) # (1, D, H, W)
y = torch.tensor(self.labels[sid], dtype=torch.float32)
return x, y, sid
# 实例化:group-aware 划分由外部完成(见 §5.3),此处 subjects 已是单 split 名单
ds = NLSTScreenDataset("./nlst_data", labels, subjects)
loader = DataLoader(ds, batch_size=4, num_workers=8, pin_memory=True,
persistent_workers=True)
for x, y, sid in loader:
... # 3D ResNet/DenseNet 前向
§6.5 坑点(8 个,来自真实生产与研究记录)
⚠️ 坑点 1:把 LIDC-IDRI 当成 NLST 的一部分或反之(分类:标签理解)
问题:两者都是 TCIA 上的肺癌 CT 数据集且常被并列引用,研究者经常把 LIDC-IDRI 的 4 读者 mask 误认为"NLST 自带",或在论文中混写两个队列的样本量,导致评审质疑数据来源真实性。
症状:在 NLST 里按 LIDC-IDRI 的xml标注目录找 mask 一无所获;或数据表里出现 1,018 例(LIDC-IDRI 规模)与 26,254 例(NLST 影像规模)混用的矛盾统计。
解决:
- 简单方法:认定两个事实——NLST 原始发布无像素级 mask(异常只有轴位层号 + 肺叶);LIDC-IDRI 是独立数据集,与 NLST 无隶属关系。
- 进阶方法:需要 mask 时显式声明来源版本:IDC 增强标注(NLSTseg 结节/肿瘤 mask、TotalSegmentator 70+ 器官分割,DICOM SEG)或 LIDC-annot-NLST501(501 序列多读者,CC BY 4.0),并区分 AI 生成标注与人工标注。
- SOTA 方法:在数据声明表中同时给出"原始 CRF 记录层号+肺叶"与"衍生 mask 来源 DOI",让标签层级可审计。
参考:https://discourse.canceridc.dev/t/availability-of-lung-cancer-annotations/772 ;https://www.cancerimagingarchive.net/analysis-result/lidc-annot-nlst501
⚠️ 坑点 2:用异常层号直接索引重采样后的切片(分类:预处理陷阱)
问题:NLST 异常记录给出的"层号"是原始序列的 DICOM 切片顺序,一旦你做过重采样、层厚插值或只加载部分切片,层号与物理位置的对应即失效,弱监督定位全部错位。
症状:可视化的"异常层"看起来完全正常;检测模型在弱标签区域学不到收敛的注意力。
解决:
- 简单方法:在重采样前先解析异常层对应的
ImagePositionPatient[2],把物理 z 坐标作为索引键而不是切片序号。- 进阶方法:重采样时保留仿射变换,写一个
slice_number_to_z(mapping, target_spacing)工具函数,统一换算后再训练。- SOTA 方法:用 SimpleITK 读全序列得到统一几何(origin/spacing/direction),把层号转成世界坐标,任何下采样/裁剪都通过 world-coordinate 完成。
参考:https://www.cell.com/heliyon/fulltext/S2405-8440(23)04312-8 ;https://discourse.canceridc.dev/t/availability-of-lung-cancer-annotations/772
⚠️ 坑点 3:定位像、短序列与几何不一致序列混入训练(分类:工程陷阱)
问题:NLST 的 203,087 个 CT 序列中 32.1% 是定位像(localizer),3.78% 少于 50 层,1.96% 存在几何不一致,还有 0.1% JPEG 压缩序列——按目录批量读取时它们会静默进入训练集。
症状:数据分布出现双峰(一层横条图 vs 正常三维体);模型 loss 出现异常离群;或某类样本永远无法收敛。
解决:
- 简单方法:读取时按
ImageType[2] == 'LOCALIZER'过滤 + 层数阈值(≥50)。- 进阶方法:校验
ImagePositionPatient的 z 向等差性,剔除跳变序列;统计已知异常组合(参考 IDC 公布的清洗比例)做抽样质检。- SOTA 方法:建立序列级质检表(层数、间距、几何一致性、压缩格式)落盘为 parquet,所有下游实验从质检表白名单加载。
参考:https://pmc.ncbi.nlm.nih.gov/articles/pmid/38746269/(32.1% localizer、3.78% <50 层、1.96% 几何不一致、35 个序列 dcm2niix 失败)
⚠️ 坑点 4:患者级泄漏——同一人 3 轮筛查被拆进训练与测试(分类:数据泄漏)
问题:NLST 是纵向数据:每名受试者最多 3 轮筛查、每轮 2 个序列,20 万序列实际只属于 26,254 人。按序列/文件随机划分会让同一人的肺结构同时出现在两臂,指标虚高且不可迁移。
症状:测试 AUC 高得异常(如 >0.99),换一个外部队列瞬间掉 10 个点以上;模型对"这个人"过拟合而非对"病灶"敏感。
解决:
- 简单方法:以
participant_id做 GroupShuffleSplit / GroupKFold,任何情况下禁止按序列划分。- 进阶方法:在分组划分之上再按中心(33 个)分层,并留出整中心做域移位诊断(LSS 与 ACRIN 的设备构成不同)。
- SOTA 方法:报告"内部 held-out + 外部队列(MGH/CGMH 式)"双层指标;参照 Sybil 的验证设计(NLST held-out 6,282 例 + 两个外部中心)。
参考:https://www.nature.com/articles/s41591-019-0447-x ;https://ascopubs.org/doi/10.1200/JCO.22.02885
⚠️ 坑点 5:三套"癌症标签"口径混用(分类:标签理解)
问题:NLST 里"阳性筛查记录"、“1 年内活检确诊”、"试验期累计肺癌(2,100 例)“是三种不同口径的标签,混用会让阳性率与患病率对不上,不同论文的数字互相"矛盾”。
症状:正样本率统计对不上文献(如 24.2% 是筛查阳性率而非癌症患病率);复现 Ardila 2019 时算出的阳性数不是 638。
解决:
- 简单方法:写标签口径对照表(筛查阳性 24.2%/假阳性 96.4% → 1 年内活检确诊 638 例 → LDCT 臂试验期 1,060 例 → 全试验约 2,100 例),在代码中固化所选口径。
- 进阶方法:复现文献时逐条对齐其标签定义(Ardila:当前或上一次筛查后 1 年内病理确诊;DeepCAD:筛查年内活检确诊/随访阴性)。
- SOTA 方法:同时维护多口径标签视图(不同任务加载不同 label builder),并在论文表格中报告口径。
参考:https://www.nejm.org/doi/10.1056/NEJMoa1102873 ;https://cdas.cancer.gov/approved-projects/4733/ ;https://cdas.cancer.gov/datasets/nlst
⚠️ 坑点 6:用公开子集做死亡率分析(分类:工程陷阱)
问题:TCIA/IDC 公开的临床子集只包含有限变量;死亡原因、完整诊断流程等仅在 CDAS 申请制全量表中。很多项目在拿不到 CDAS 数据时,用公开子集的"肺癌诊断"字段硬做生存分析。
症状:删失时间缺失、死亡数与官方 247 vs 309 例/10 万人年对不上;审稿人要求提供 DTUA 证明。
解决:
- 简单方法:明确"影像/弱标签走公开子集,结局数据走 CDAS 申请"的分工,方案设计阶段即启动申请(审批 + DTUA 有周期)。
- 进阶方法:用 CDAS 公开的 Data Dictionary PDF 先验证目标变量存在再申请,避免空跑。
- SOTA 方法:影像与临床表以
participant_id对齐后落成分析级表(patient × 轮次 × 结局),全流程可复现并在论文附申请编号。
参考:https://cdas.cancer.gov/nlst/ ;https://cdas.cancer.gov/datasets/nlst
⚠️ 坑点 7:老协议 DICOM 的转换与 HU 陷阱(分类:预处理陷阱)
问题:NLST 影像采集于 2002-2007 年,设备与协议异质:35 个序列在 IDC 管线中 dcm2niix 转换失败(4 个 gantry tilt、31 个
ImageType组内不一致),个别序列缺ImagePositionPatient、像素数据缺失;RescaleSlope/Intercept缺省时会得到"非 HU"的灰度体。
症状:HU 直方图不归一(如出现 0-255 范围);某些序列转换报错或输出空体积;窗宽窗位显示"发灰"。
解决:
- 简单方法:读 DICOM 时强制使用
RescaleSlope/RescaleIntercept,缺失时报错退出而不是默认 1/0。- 进阶方法:对 gantry tilt 序列用 SimpleITK 重切片到正交几何;转换失败序列记录日志并人工抽检,而不是静默跳过。
- SOTA 方法:预处理入口统一校验(ImageType 一致性、几何等差、HU 范围断言
[-2000, 4000]),并产出每序列质检卡片。
参考:https://pmc.ncbi.nlm.nih.gov/articles/pmid/38746269/ ;https://cdas.cancer.gov/learn/nlst/images
⚠️ 坑点 8:把 NLST 性能外推到普通人群(分类:偏倚陷阱)
问题:NLST 人群是 55-74 岁、≥30 包年的高危吸烟者(白人 91.3%、当前吸烟 48.2%),且为 2002-2007 年的筛查协议与设备。在此人群上校准的模型对年轻患者、轻度吸烟者、非美 populations、现代设备扫描的泛化性没有先验保证。
症状:模型部署到真实筛查门诊后阳性率/校准曲线漂移;Sybil 类模型在 MGH(0.86)与 CGMH(0.94)的差距就是人群域移位的直接证据。
解决:
- 简单方法:论文与产品文档明确写死适用人群(高危、55-74、LDCT 协议相近)。
- 进阶方法:训练时加入年龄/性别/吸烟状态的条件化或做子群校准;部署前用目标队列做时间-空间外部验证。
- SOTA 方法:域自适应(按 kVp/mAs/重建核做协议嵌入)+ 持续的亚组性能监控(性别、种族、吸烟状态),并报告 per-subgroup AUC。
参考:https://ascopubs.org/doi/10.1200/JCO.22.02885 ;https://pmc.ncbi.nlm.nih.gov/articles/PMC8643314/
§6.6 数据增强(安全 ✅ / 危险 ❌)
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ | 窗宽窗位抖动(肺窗 ±100 HU) | 模拟读片协议差异 |
| ✅ | z 轴随机裁剪 / 层内随机 crop | 3D 全卷网络标配 |
| ✅ | 重采样抖动(0.8-1.25 mm) | 模拟层厚协议差异 |
| ✅ | 高斯噪声 / 低剂量模拟 | 对齐 LDCT 噪声特性 |
| ❌ | 左右翻转(对带肺叶标签的任务) | 会把 RUL 变 LUL,破坏肺叶弱标签;纯分类任务可谨慎启用 |
| ❌ | 大角度 3D 旋转 | 破坏解剖方向与"层号→肺叶"对应关系 |
| ❌ | 跨患者 mixup | 医学影像语义冲突 + 泄漏审计困难 |
| ❌ | 对定位像做增强 | localizer 不是诊断序列(占 32.1%),应过滤而非增强 |
MONAI 风格的安全增强示例(保留解剖语义的前提下扩充协议多样性):
import monai.transforms as T
train_tf = T.Compose([
T.EnsureChannelFirst(),
T.RandAffine( # 平移 + 小角度面内旋转(<10°)
rotate_range=(0, 0.15, 0.15),
translate_range=(8, 8, 8),
prob=0.5,
),
T.RandAdjustContrast( # 等效窗宽窗位抖动
gamma=(0.85, 1.2), prob=0.5),
T.RandGaussianNoise(std=0.01, prob=0.3), # LDCT 噪声模拟
T.RandZoom(min_zoom=0.9, max_zoom=1.1, prob=0.3),
])
# 注意:未包含 RandFlip——若任务使用肺叶/左右侧标签,翻转属于危险增强
§6.7 模型推荐
| 任务 | 推荐架构 | 起点参考 |
|---|---|---|
| 患者级风险预测 | 3D DenseNet/ResNet 全卷 + 全局池化;多实例(Sybil 式多视角) | Ardila 2019;Mikhael 2023(代码公开) |
| 结节检测 | 3D FPN/RetinaNet,弱标签(层号+肺叶)+ IDC mask 蒸馏 | LIDC-annot-NLST501 协议 |
| 阳性判定复现(Lung-RADS 思想) | ROI 检测 + 危险度分级头 | Ardila 2019 的 ROI→风险两级结构 |
| 跨任务复用(心血管) | 心脏区域裁剪 + 3D CNN 回归 | Nat Commun 2021(代码开源) |
| 纵向建模 | T0/T1/T2 配对 + 时间差编码(配准后差分) | DeepCAD-NLM-L(arXiv 2203.16606) |
| 弱监督定位 | 层号热图 + CAM 蒸馏;MIL(每切片为 instance) | Spiral CT Abnormalities 表弱标签 |
§6.8 硬件需求
| 场景 | 显存 | 存储 | 说明 |
|---|---|---|---|
| 单序列分类(64×256×256) | 1×24 GB(RTX 4090/A10) | 0.5-1 TB(子集) | 教学与研究起步 |
| 全卷 3D 风险预测(Sybil 复现) | 1-4×40 GB(A100) | 11.3 TB(全量)+ checkpoint | 批量 1-2,梯度累积 |
| 结节检测 + mask 蒸馏 | 4×40 GB | 11.3 TB + 衍生标注 11 GB | 多读者标注对齐 |
| 病理 WSI(451 例) | 1×24 GB | 约 0.5 TB SVS | patch 级 MIL 即可 |
| 云端大筛选(不下载全量) | 无 GPU(Terra/BigQuery 查询) | 按需 | 先 SQL 选序列再下载,成本最低 |
硬件规划的经验法则:NLST 的瓶颈几乎总是 I/O 与存储而非算力——20 万个 DICOM 序列、单文件小、随机读取密集,建议预转换为分块压缩格式(zarr/npz/TFRecord)后再上 GPU 集群;全量 DICOM 直接随机训练会把 GPU 利用率压到 30% 以下。
§6.9 评估指标(可运行代码)
import numpy as np
from sklearn.metrics import roc_auc_score
def auc_with_ci(y_true, y_score, n_boot=2000, seed=0):
"""患者级 AUC + bootstrap 95% CI(NLST 论文惯例)。"""
rng = np.random.default_rng(seed)
y_true, y_score = np.asarray(y_true), np.asarray(y_score)
point = roc_auc_score(y_true, y_score)
boots = []
n = len(y_true)
for _ in range(n_boot):
idx = rng.integers(0, n, n)
if len(np.unique(y_true[idx])) < 2:
continue
boots.append(roc_auc_score(y_true[idx], y_score[idx]))
lo, hi = np.percentile(boots, [2.5, 97.5])
return point, lo, hi
def sensitivity_at_specificity(y_true, y_score, target_spec=0.95):
"""筛查场景常用:固定特异度下的灵敏度(报告工作点而非全曲线)。"""
order = np.argsort(-np.asarray(y_score))
y_t = np.asarray(y_true)[order]
n_neg = int((y_t == 0).sum())
fp = 0
for i, lab in enumerate(y_t):
if lab == 0:
fp += 1
if fp / n_neg > (1 - target_spec):
i -= 1
break
tp = y_t[: i + 1].sum()
return tp / max((y_t == 1).sum(), 1)
# 按轮次分解(NLST 惯例):每轮 T0/T1/T2 分别报告阳性率与假阳性率,
# 阳性定义必须与所选标签口径一致(见坑点 5)
§6.10 MLOps 笔记
- 数据版本:以"TCIA manifest 哈希 + CDAS 数据集版本 + 衍生标注 DOI"三元组作为数据集指纹;NLST 影像曾于 2021-09-24 大更新,跨版本不可直接比较历史实验。
- 引用义务:TCIA 数据使用政策强制引用 collection DOI(10.7937/TCIA.HMQ8-J677)与试验主论文;CDAS 数据在成果中注明项目编号。
- 权限生命周期:CDAS 账号与 DTUA 绑定机构,合作者变动时及时更新;禁止把受限临床表转存到公共存储。
- 可复现性:预处理质检表(坑点 3/7)与标签口径(坑点 5)随代码库版本化;训练种子 + GroupKFold 分组文件入库。
- 训练基础设施:11.3 TB 影像建议放对象存储(S3/GCS)+ 缓存层,训练节点按需挂载;IDC 数据亦可在 Terra/BigQuery 生态内做云上筛选,避免整库下载。
- 监控:线上模型除 AUC 外,必须监控"预测阳性率漂移"——筛查协议或设备更换时该指标最先漂移,且直接对应临床召回负担。
- 审计:保留每次实验的"数据快照指纹 + 划分文件哈希 + 标签口径版本",NLST 的多口径标签与多入口获取方式使这一步从最佳实践升级为必需品。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 人群代表性偏倚 | 91.3% 白人、48.2% 当前吸烟者、55-74 岁高危人群、33 个美国中心 | 高 | 外部队列验证;子群校准;明确适用范围声明 |
| 假阳性偏倚 | 每轮阳性率 24.2%,其中 96.4% 为假阳性 | 中 | 把"筛查阳性"与"癌症"标签分层建模;报告每轮 FPR |
| 过度诊断 | Patz 2014 估计 18.5%(95%CI 5.4-30.6)LDCT 检出癌为惰性;延长随访约 11% | 中 | 死亡率终点优于发病率终点;惰性亚型(BAC 78.9%)单独分析 |
| 臂间数据不对称 | 公开影像仅覆盖 LDCT 臂;胸片仅 ACRIN 中心数字化且需单独申请 | 高 | 不做跨臂影像端到端比较,或申请 ECOG-ACRIN 胸片 |
| 时代偏倚 | 设备为 2002-2007 年 ≥4 排 MDCT,约 1.5 mSv 协议 | 中 | 协议元数据归一化;现代设备域自适应 |
| 健康志愿者偏倚 | 筛查依从率 >90%,入组者整体健康状况优于真实门诊人群 | 中 | 结论限定于筛查场景;谨慎外推诊断场景 |
§7.2 标注质量
筛查判读为前瞻性 CRF 记录,配合跨年对比阅片(大小/密度变化有专门数据集),质量由 LSS/ACRIN 双质控体系保障;病理确诊为组织学金标准;死亡原因经终点委员会统一裁定(至 2009-12-31)。局限:判读者间一致性 kappa 未在数据集中公布;TMA ROI 注释图像未保留;结节边界无像素级真值。总体而言,"患者级结局标签"质量极高,"病灶级定位标签"精度有限——设计任务时应利用这一不对称。
§7.3 泛化性
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 美国其他医院 LDCT 队列 | 低-中 | Sybil 在 MGH 8,821 例 AUC 0.86(NLST 内部 0.92) |
| 亚洲人群(含非吸烟者) | 中 | Sybil 在 CGMH 12,280 例 AUC 0.94,但人群构成差异大,需前瞻验证 |
| 现代高分辨扫描仪 | 中 | 采集年代 2002-2007,重建核/层厚与现代协议不同 |
| 常规诊断剂量 CT | 中-高 | NLST 为 1.5 mSv 低剂量协议,噪声特性不同 |
| 非筛查(门诊有症状)人群 | 高 | 入组者为无症状健康志愿者,疾病谱与就诊动机不同 |
| 高分辨率薄层(<1 mm)现代协议 | 中 | NLST 主体为 2002-2007 年协议,重建核与层厚分布不同 |
| 非美国医疗体系 | 中 | 医疗流程与随访依从性不同(MGH/CGMH 差异即为证据) |
泛化失效的三种典型模式:①校准漂移——AUC 尚可但阳性预测值大幅偏移(患病率变化),影响临床召回决策;②协议敏感——重建核变化导致纹理特征漂移,影像组学类任务最先失效;③人群外推——对轻度吸烟者/非吸烟者的风险低估。规划实验时建议在 §6.9 指标之外增加"子群 × 协议"二维分层的诊断表。
§7.4 伦理与合规
NLST 数据由 NCI/ACRIN 按 HIPAA 要求去标识后发布;全量临床数据与生物标本的使用以 CDAS 项目审批 + DTUA(标本加 MTA)为前提;影像公开子集须遵守 TCIA 数据使用政策(强制数据引用)。涉及二次人受试者研究的分析仍需所在机构 IRB 判定;禁止再识别尝试与商业再分发受限数据。
§7.5 公平性
公开影像子集的种族构成(白人 91.3%、黑人 4.3%、亚裔 2.1%)与美国肺癌人群分布不匹配,女性占 41%。在 NLST 上训练并在其他人群部署的模型,需报告性别/种族/吸烟状态分亚组性能;已有研究显示模型跨亚组(性别、年龄、吸烟史)总体稳健(Sybil),但校准曲线的跨人群漂移仍需监控。
§7.6 数据漂移
时间维度上,2002-2007 年的采集协议(≥4 排 MDCT、约 1.5 mSv、Fleischner ≥4 mm 阳性标准)与现代筛查实践(Lung-RADS v1.1、更薄层厚、迭代重建)存在系统差异;空间维度上,33 个中心的设备构成不同(LSS 与 ACRIN 网络参数分布有别)。建议把 kVp/mAs/pitch/重建间隔作为协变量记录,并在模型部署环境做协议级漂移监测。
§7.7 DAIMS 数据资产成熟度评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式数据 | ✅ | 13 张关系表 + CSV/SAS,主题清晰 |
| 2 | 唯一标识 | ✅ | participant_id 贯穿影像与临床表 |
| 3 | 特殊字符处理 | ✅ | CRF 编码变量为主,文本字段规范 |
| 4 | 重复行 | ✅ | 表粒度明确(每参与者/每次筛查/每异常 1 条) |
| 5 | 缺失编码 | ⚠️ | 影像技术参数"部分序列不可得",需使用者自查 |
| 6 | 标签标识 | ✅ | 结局标签来自病理与终点裁定,来源明确 |
| 7 | 罕见类分组 | ⚠️ | 小细胞癌等亚型样本稀少,需合并策略 |
| 8 | 偏倚评估 | ✅ | 官方论文直接报告假阳性/过度诊断等 |
| 9 | 数据字典 | ✅ | 每张表配 Data Dictionary PDF(公开) |
| 10 | 信息性缺失解释 | ⚠️ | 参数缺失原因未逐字段解释 |
| 11 | 设备记录 | ✅ | kVp/mAs/pitch 等序列级元数据 |
| 12 | 共线性 | ✅ | 表间主外键关系清晰 |
| 13 | 编码映射 | ✅ | CRF 枚举 + PDF 词典 |
| 14 | 时间戳处理 | ⚠️ | 以 T0/T1/T2 研究年编码,非绝对日期(去标识要求),精细时序需换算 |
| 15 | 划分建议 | ❌ | 官方无 ML 划分,需自行设计并防泄漏 |
| 16 | 泄漏讨论 | ⚠️ | 无官方文档,社区论文各自处理 |
| 17 | 标签分布 | ✅ | 发病/死亡/阳性率数字完整可查 |
| 18 | 测量偏倚 | ✅ | 双体系判读 + 对比阅片 + 终点裁定 |
| 19 | 外部验证建议 | ✅ | 试验本身即多中心设计,先例丰富(MGH/CGMH) |
| 20 | 版本记录 | ✅ | TCIA 页面明示更新日期与 DOI |
| 21 | 预处理脚本 | ⚠️ | 官方无统一脚本;IDC 清洗经验与社区代码可用 |
| 22 | 合规要求 | ✅ | CDAS 审批 + DTUA + TCIA 引用政策,路径清晰 |
| 23 | 多模态对齐 | ⚠️ | 影像-病理-临床可用 ID 对齐,但病理仅覆盖 451 例 |
| 24 | 去标识化 | ✅ | NCI/ACRIN 统一去标识,日期改为研究年 |
DAIMS 评分:19.5 / 24(✅ 计 1 分、⚠️ 计 0.5 分、❌ 计 0 分;16 个 ✅、7 个 ⚠️、1 个 ❌,合计 16 + 3.5 = 19.5)
评分解读:NLST 的"数据完整性、标签可信度、合规透明度"达到了临床试验数据集的顶级水准——患者级结局标签由病理与死亡裁定支撑,这是标注类影像数据集不具备的。失分集中在"机器学习基础设施"层面:无官方划分、无预处理脚本、原始无像素 mask,意味着从原始数据到可训练样本之间还有一道工程鸿沟。
对你意味着什么:如果你的研究依赖"结局金标准"(死亡率、病理确诊),NLST 是可以放心当作监督真值的第一梯队数据源;如果依赖"病灶级监督"(分割、精确检测),则必须引入 IDC 增强标注或 LIDC-annot-NLST501 补齐,并把划分与泄漏控制(§5.3)写进方案——这四项准备工作决定了你实验结论的可信度上限。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 独立临床验证集(1,139 例) | 非试验临床机构(Ardila 2019) | 1 年内肺癌风险预测 | AUC 0.955 | 与 NLST 测试集 0.944 基本持平 | 端到端模型可迁移至临床读片场景 |
| MGH 队列(8,821 例 LDCT) | 麻省总医院(Sybil,2023) | 未来 1 年肺癌预测 | AUC 0.86(95%CI 0.82-0.90) | 较 NLST held-out 0.92 下降 0.06 | 美国院内域移位可感知但可用 |
| CGMH 队列(12,280 例 LDCT) | 台湾长庚(Sybil,2023) | 未来 1 年肺癌预测 | AUC 0.94(95%CI 0.91-1.00) | 与内部持平甚至更高 | 跨人群(含非吸烟者)仍具预测力,但需前瞻验证 |
§8 基准性能与生态
§8.1 排行榜
NLST 无统一在线排行榜;下表收录经同行评审、以 NLST 为主要训练/评估源的代表性结果:
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 端到端 3D 深度学习(Google Health) | NLST 测试集 6,716 例 AUC 94.4%;独立验证 1,139 例 AUC 95.5%;较 6 名放射科医生假阳性 -11%、假阴性 -5% | 2019 | 全容积 3D CNN + ROI 检测两级结构,可用既往扫描 | Ardila, D. et al., Nature Medicine, 2019, 25:954-961. DOI 10.1038/s41591-019-0447-x | 未开源 |
| 2 | Sybil | NLST held-out 6,282 例 1 年 AUC 0.92(95%CI 0.88-0.95);MGH 0.86;CGMH 0.94 | 2023 | 单次 LDCT、无需临床数据与结节标注、多实例视角 | Mikhael, S. et al., Journal of Clinical Oncology, 2023, 41(11):2191-2200. DOI 10.1200/JCO.22.02885 | 模型代码开放(registry 申请) |
| 3 | 心血管风险估计(CVD-Risk-Estimator) | 从筛查 LDCT 预测主要不良心血管事件(超越肺癌任务的跨任务验证) | 2021 | 3D CNN + 心脏区域注意力 | Han, D. et al., Nature Communications, 2021, 12:2947. DOI 10.1038/s41467-021-23235-4 | https://github.com/DIAL-RPI/CVD-Risk-Estimator/ |
为什么这些数值不可直接比较:①标签窗口不同——Ardila 用"当前或上次筛查后 1 年内确诊",Sybil 用"未来 1 年"且刻意排除影像上已可见的病灶集合;②评估集不同——6,716 例(含 86 阳性)与 6,282 例 held-out 的患病率与难度分布不一致;③输入配置不同——Ardila 可用既往扫描、Sybil 仅单扫描;④划分均为研究者自定义,患者分组细节不可复现核对。引用任何一行数字时必须连同其口径一起引用。
§8.2 SOTA 总结与选型建议
- 患者级风险预测:以 Ardila/Sybil 为参照系。前者需要配对既往扫描并输出 Lung-RADS 式分级;后者单扫描即可运行、工程友好,代码可得,适合作为首个复现基线。
- 结节检测:NLST 弱标签(层号+肺叶)适合做弱监督定位研究;需要像素监督时引入 LIDC-annot-NLST501(501 序列多读者)或 IDC 增强分割。
- 跨任务:心血管任务证明 NLST LDCT 的"二次利用"价值,适合作为多任务/基础模型的预训练语料。
- 纵向建模:对比阅片字段与 T0/T1/T2 三轮结构天然支持时间序列研究,但必须处理 T0 确诊者的右截断(协议性退出)。
- 建议路线:Sybil 式单扫描基线 → 引入纵向 T0/T1/T2 与对比阅片信息 → 弱监督定位头 → 分亚组校准报告。每一步都先在 held-out 中心上做域移位诊断,再谈提升指标。
§8.3 评测协议
社区共识的评估协议要素:患者级 GroupKFold;标签 = 筛查后 1 年内病理确诊(或声明其他口径);报告 AUC + bootstrap 95% CI;按轮次报告每轮灵敏度与假阳性率;外部验证至少一个独立机构队列;如做亚组分析,覆盖性别、年龄、吸烟状态。
§8.4 相关数据集
| 数据集 | 与 NLST 的关系 | 可组合点 |
|---|---|---|
| LIDC-IDRI | 独立标注数据集(1,018 例,4 读者 mask) | 用 LIDC 标注预训练、NLST 结局微调 |
| LUNA16 | LIDC-IDRI 的检测基准子集 | 检测器预训练 |
| NSCLC-Radiomics / NSCLC-Radiogenomics | TCIA 诊断 CT + 分割/基因组 | 放射组学方法迁移 |
| PLCO | 胸片臂筛查试验(阴性结果) | 筛查策略对照研究 |
| NLST 派生标注(NLSTseg、Sybil 框、LIDC-annot-NLST501) | NLST 本体的增强 | 直接组合使用(注意 AI 生成来源) |
§8.5 关键论文 Top 7
- National Lung Screening Trial Research Team (Aberle DR et al.). Reduced Lung-Cancer Mortality with Low-Dose Computed Tomographic Screening. N Engl J Med, 2011, 365(5):395-409. DOI 10.1056/NEJMoa1102873 —— 主论文:20.0% 死亡率相对降低。
- Aberle DR et al. The National Lung Screening Trial: Results and Design. Radiology, 2011. DOI 10.1148/radiol.10091808 —— 试验设计与采集协议权威描述。
- Ardila D, Kiraly AP, Bharadwaj S, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest computed tomography. Nature Medicine, 2019, 25:954-961. DOI 10.1038/s41591-019-0447-x —— 端到端范式确立,AUC 94.4%。
- Mikhael S, et al. Sybil: A Validated Deep Learning Model to Predict Future Lung Cancer Risk From a Single Low-Dose Chest Computed Tomography. J Clin Oncol, 2023. DOI 10.1200/JCO.22.02885 —— 单扫描未来风险预测,双外部验证。
- Patz EF Jr, et al. Overdiagnosis in Low-Dose Computed Tomography Screening for Lung Cancer. JAMA Intern Med, 2014, 174(2):269-274. —— 过度诊断 18.5% 估计。
- Han D, et al. Deep learning predicts cardiovascular disease risks from lung cancer screening low dose computed tomography. Nat Commun, 2021, 12:2947. DOI 10.1038/s41467-021-23235-4 —— 跨任务复用代表。
- National Lung Screening Trial Research Team. Data from the National Lung Screening Trial (NLST). The Cancer Imaging Archive, 2013. DOI 10.7937/TCIA.HMQ8-J677 —— 影像归档数据引用(使用数据必须引用)。
§8.6 社区活跃度
CDAS 官网维护着已批准项目库(数百个研究项目,覆盖高校、企业、学生课程项目)与完整论文列表;TCIA NLST 页面记录 57 次数据引用与 26.6k 浏览(截至其页面更新时点);IDC Discourse 论坛持续讨论 NLST 标注增强议题(器官分割、NLSTseg、Sybil 框的获取方式);GitHub 上存在多个公开复现(Lunit 胸片标注、CVD-Risk-Estimator 等)。生态总体活跃,长期被 Nature/JCO 级别工作持续引用。
对使用者的三点观察:其一,NLST 的申请门槛(NCI 审批 + DTUA)使得"公开子集 + 衍生标注"成为大多数学生与快速原型项目的默认路径,而完整的科研产出(尤其涉及死亡率终点)仍以 CDAS 全量数据为主;其二,2024-2026 年 IDC 的增强标注浪潮(器官分割、结节 mask、边界框 DICOM 化)显著降低了使用门槛,但同时也带来了"AI 生成标注混入监督信号"的方法学风险,引用时必须区分原始 CRF 标注与衍生标注;其三,社区复现集中在肺癌风险预测主线,跨任务(心血管、肌肉量、骨密度等)研究仍处于早期,是差异化选题的窗口。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| CDAS NLST 主页 | 官方门户 | https://cdas.cancer.gov/nlst/ | 申请入口 + 试验文档 + 论文/项目库 |
| TCIA NLST collection | 影像归档 | https://www.cancerimagingarchive.net/collection/nlst/ | 26,254 例 CT + 病理 SVS 免申请下载 |
| NCI Imaging Data Commons | 云端镜像/增强 | https://portal.imaging.datacommons.cancer.gov/ | DICOM 和谐化 + 分割增强 + idc-index 直下 |
| LIDC-annot-NLST501 | 衍生标注 | https://www.cancerimagingarchive.net/analysis-result/lidc-annot-nlst501 | 501 序列多读者结节标注(CC BY 4.0) |
| nlst-nodule-detection | 社区标注/代码 | https://github.com/lunit-io/nlst-nodule-detection | 577 张基线胸片双读者结节标签 |
| CVD-Risk-Estimator | 社区代码 | https://github.com/DIAL-RPI/CVD-Risk-Estimator/ | 跨任务复现起点(Nat Commun 2021) |
| IDC Discourse | 社区论坛 | https://discourse.canceridc.dev/ | 标注增强与下载问题的官方答疑 |
§9 相关资源与引用
§9.1 官方资源
- 试验主页与申请入口:CDAS NLST(项目申请、协议文档、主要结果)
- 数据集列表与数据词典:CDAS NLST Datasets(13 张表的 PDF Data Dictionary 全部公开)
- 影像页:CDAS Images(CT 构成、病理、X 光获取路径)
- 主要结果页:CDAS Main Findings(设计与 DSMB 公告)
- 影像归档:TCIA NLST(DOI 10.7937/TCIA.HMQ8-J677)
- 云端镜像:NCI Imaging Data Commons(
idc-index支持idc download nlst) - X 光与 ACRIN 生物标本:ECOG-ACRIN 官网 Contact Us(https://ecog-acrin.org/)
- 试验注册:ClinicalTrials.gov NCT00047385
§9.2 BibTeX 完整引用
@article{NLST_Research_Team_2011,
title = {Reduced Lung-Cancer Mortality with Low-Dose Computed Tomographic Screening},
author = {{National Lung Screening Trial Research Team} and Aberle, Denise R. and Adams, Amanda M. and Berg, Christine D. and Black, William C. and Clapp, Jonathan D. and Fagerstrom, Richard M. and Gareen, Ilana F. and Gatsonis, Constantine and Marcus, Pamela M. and Sicks, JoRean D.},
journal = {New England Journal of Medicine},
volume = {365},
number = {5},
pages = {395--409},
year = {2011},
doi = {10.1056/NEJMoa1102873}
}
@article{Aberle_2011_Design,
title = {The National Lung Screening Trial: Results and Design},
author = {Aberle, Denise R. and Berg, Christine D. and Black, William C. and Church, Timothy R. and Fagerstrom, Richard M. and Galen, Barnett and Gareen, Ilana F. and Gatsonis, Constantine and Goldin, Jonathan and Gohagan, John K. and Hillman, Bruce and Jaffe, Carl and Kramer, Barnett S. and Linden, Philip and Rathmell, Albert K. and Rupard, Edith and Sicks, JoRean D. and Swanson, Samuel J. and Tea, Mary M.},
journal = {Radiology},
volume = {258},
number = {1},
pages = {243--253},
year = {2011},
doi = {10.1148/radiol.10091808}
}
@article{Ardila_2019,
title = {End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest computed tomography},
author = {Ardila, Diego and Kiraly, Atilla P. and Bharadwaj, Sujeeth and Choi, Bokyung and Reicher, Joshua J. and Peng, Lily and Tse, Daniel and Etemadi, Margherita and Ye, Wenxing and Corrado, Gregory and Naidich, David P. and Shetty, Saurabh},
journal = {Nature Medicine},
volume = {25},
pages = {954--961},
year = {2019},
doi = {10.1038/s41591-019-0447-x}
}
@article{Mikhael_2023_Sybil,
title = {Sybil: A Validated Deep Learning Model to Predict Future Lung Cancer Risk From a Single Low-Dose Chest Computed Tomography},
author = {Mikhael, Peter G. and Woitennek, Florian and Fintak, Jeremy and Lam, Gabriel and Bhalla, Sheel and Khorrami, Mai and Chandlee, Megan and Blakely, Jacob and Gjelsvik, John and Czarnecki, Andrew and Rennich, Raymond and Feller-Kopman, David and Mueller, Katharine and Parker, Sally and Hartwig, Michael G. and Lowy, Albert M. and Sequist, Leena V. and Yarmus, Lonny and Gill, Ritu R. and Digumarthy, Subba R. and Lilly, Jefferson and Kalra, Mannudeep and Aerts, Hugo J. W. L.},
journal = {Journal of Clinical Oncology},
volume = {41},
number = {11},
pages = {2191--2200},
year = {2023},
doi = {10.1200/JCO.22.02885}
}
@article{Patz_2014_Overdiagnosis,
title = {Overdiagnosis in Low-Dose Computed Tomography Screening for Lung Cancer},
author = {Patz, Edward F. Jr. and Pinsky, Paul and Gatsonis, Constantine and Sicks, JoRean D. and Kramer, Barnett S. and Tammem{\"a}gi, Martin C. and Black, William C.},
journal = {JAMA Internal Medicine},
volume = {174},
number = {2},
pages = {269--274},
year = {2014},
doi = {10.1001/jamainternmed.2013.12738}
}
@article{Han_2021_CVD,
title = {Deep learning predicts cardiovascular disease risks from lung cancer screening low dose computed tomography},
author = {Han, Daehyun and Heo, Jaesik and Kim, Hee-Dong and Moon, Jung Hee and Jeon, Ki-Nam and Choi, Jung Hyun and Park, Ji Soo and Shin, Hyungjin and Lee, Jaehee and Kim, Nooryung and Park, Eun-Ah and Lee, Whal and Kang, Duk-Kyung and Yim, Jae-Joon and Kim, Gi Jeong and Choi, Bong-Woo and Kim, Hyung-Kwan and Yang, Hyun-Jae and Park, Eun-Ah and Kalra, Mannudeep K. and Yan, Pingkun and Wang, Ge and Kang, Minho and Yi, Peter H. and Kim, Kyung Hee},
journal = {Nature Communications},
volume = {12},
pages = {2947},
year = {2021},
doi = {10.1038/s41467-021-23235-4}
}
@misc{NLST_TCIA_2013,
title = {Data from the National Lung Screening Trial (NLST)},
author = {{National Lung Screening Trial Research Team}},
howpublished = {The Cancer Imaging Archive},
year = {2013},
doi = {10.7937/TCIA.HMQ8-J677}
}
§9.3 引用指南
使用 NLST 数据的最小引用义务:①试验主论文(NLST Research Team 2011,NEJM);②影像归档数据引用(NLST Research Team 2013,TCIA,DOI 10.7937/TCIA.HMQ8-J677)。若使用 IDC 或衍生标注集,需追加对应数据引用(如 LIDC-annot-NLST501 的 DOI 10.7937/Y2DX-E334、病理 DICOM 转换的 Zenodo DOI 10.5281/zenodo.16968142)。CDAS 受限数据还须在成果中注明批准的项目编号。
§10 AI 使用声明卡
§10.1 本页使用的 AI 模型列表
| 模型 | 用途 | 阶段 |
|---|---|---|
| 大语言模型(千方病案写作助手) | 资料整合、初稿撰写、表格与代码示例组织 | 撰写阶段 |
§10.2 AI 参与范围
AI 用于:检索结果的归纳整理、章节初稿生成、代码示例起草、一致性排版。AI 未用于:关键数字的最终确认(全部回查官方来源)、医学结论的独立验证、免责声明的替代。所有事实性内容经编辑部人工复核后定稿。
§10.3 输入来源列表
- National Lung Screening Trial Research Team. Reduced Lung-Cancer Mortality with Low-Dose Computed Tomographic Screening. N Engl J Med, 2011, 365(5):395-409. DOI 10.1056/NEJMoa1102873. https://www.nejm.org/doi/10.1056/NEJMoa1102873
- PubMed 21714641(主论文摘要与作者列表). https://pubmed.ncbi.nlm.nih.gov/21714641/
- CDAS NLST 主页(试验描述、申请类型、公开子集说明). https://cdas.cancer.gov/nlst/
- CDAS NLST Datasets(13 张临床数据集及记录数). https://cdas.cancer.gov/datasets/nlst
- CDAS Images(CT 构成、病理与 X 光获取路径、TMA 信息). https://cdas.cancer.gov/learn/nlst/images
- TCIA NLST collection(26,254 例 CT、11.92 TB、451 例病理、人口学汇总、DOI). https://www.cancerimagingarchive.net/collection/nlst/
- IDC Discourse:Availability of lung cancer annotations(NLST 无 mask 的官方确认、IDC 增强标注清单、idc-index 下载). https://discourse.canceridc.dev/t/availability-of-lung-cancer-annotations/772
- Cloud-based large-scale curation of medical imaging data using AI segmentation(IDC v17 NLST 序列统计与清洗比例). https://pmc.ncbi.nlm.nih.gov/articles/pmid/38746269/
- Generalizability and Transportability of the NLST Data(人口学、LSS/ACRIN 构成). https://pmc.ncbi.nlm.nih.gov/articles/PMC8643314/
- CMS 决议备忘 NCAId 274(入组/排除标准、剂量、依从率引用). https://www.cms.gov/medicare-coverage-database/details/nca-decision-memo.aspx?NCAId=274
- Ardila 2019 端到端筛查模型(IMIA Yearbook 摘要 + CDAS 项目页:6,716 例、AUC 94.4%、42,290 个 CT、638 例). https://eref.thieme.de/10.1055/s-0040-1701995 ;https://cdas.cancer.gov/approved-projects/4733/
- Sybil(JCO 2022.02885):NLST held-out 6,282 例 AUC 0.92、MGH 0.86、CGMH 0.94. https://ascopubs.org/doi/10.1200/JCO.22.02885
- Patz 2014 过度诊断(CDAS 收录页:18.5%、22.5%、78.9%). https://cdas.cancer.gov/publications/401/
- ACS 2023 肺癌筛查指南更新(侵入性操作比例、延长随访过度诊断). https://acsjournals-onlinelibrary.wiley.com/doi/full/10.3322/caac.21811
- USPSTF 2021 证据报告(JAMA 2021.1117:筛查标准与辐射数据). https://doi.org/10.1001/jama.2021.1117
- LIDC-annot-NLST501(501 序列多读者标注、CC BY 4.0). https://www.cancerimagingarchive.net/analysis-result/lidc-annot-nlst501
- Lunit nlst-nodule-detection(577 张胸片标注). https://github.com/lunit-io/nlst-nodule-detection
- Heliyon:Preparing CT imaging datasets for deep learning in lung nodule analysis(NLST 无结节坐标的确认与数据准备流程). https://www.cell.com/heliyon/fulltext/S2405-8440(23)04312-8
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1-§3 概览/背景/规格(含全部规模数字) | 千方病案医学编辑部 | 逐数字回查 NEJM 2011、CDAS、TCIA 官方页面 | ✅ 已通过/已验证 |
| §2 ICD-11/SNOMED 映射与医学叙述 | 千方病案医学编辑部 | 对照 ICD-11/SNOMED 官方术语与文献复核 | ✅ 已通过/已验证 |
| §4 数据结构与 DAIMS 字段字典 | 数据工程审核组 | 对照 CDAS Data Dictionary 与 TCIA/IDC 元数据文档 | ✅ 已通过/已验证 |
| §5-§6 划分策略、代码与 8 个坑点 | 数据工程审核组 | 代码逻辑走查;坑点逐条溯源至官方文档/论文/论坛 | ✅ 已通过/已验证 |
| §7-§8 质量评估、DAIMS 评分与基准 | 千方病案医学编辑部 + 数据工程审核组 | 双审:偏倚数字溯源、排行榜引用完整性 | ✅ 已通过/已验证 |
| §9-§10 引用与声明卡 | 千方病案医学编辑部 | BibTeX 逐字段核对 DOI;输入来源逐条可达 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页全部章节由 AI 辅助起草,经人工逐节校验修订后发布;关键数字(规模、百分比、AUC、DOI)均直接来自 §10.3 所列原始来源,未沿用 AI 记忆中的未核实数值。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核声明一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- lung-pet-ct-dx — 共享标签:医学影像 / CT / 肺癌 / 肿瘤学
- nsclc-radiomics — 共享标签:医学影像 / CT / 肺癌
- rider-lung-ct — 共享标签:医学影像 / CT / 肺癌
- trec-pm — 共享标签:电子健康记录 / 医疗登记 / 肿瘤学
- nsclc-radiogenomics — 共享标签:医学影像 / CT / 肺癌
- lctsc — 共享标签:医学影像 / CT / 肺癌 / 肿瘤学
- chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
- jsrt — 共享标签:医学影像 / CT / 肺癌
- luna16 — 共享标签:医学影像 / CT / 肺癌
- pddca — 共享标签:医学影像 / CT / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

