信息速览

NSCLC-Radiogenomics — 肺癌影像基因组学多模态金标准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | NSCLC-Radiogenomics(NSCLC 影像基因组学数据集) |
| 英文全称 | NSCLC Radiogenomics — The Cancer Imaging Archive Collection |
| 别名/简称 | NSCLC-Radiogenomics(TCIA);Bakr Radiogenomics Dataset |
| 疾病分类 | 支气管或肺恶性肿瘤(ICD-11:2C25;腺癌 2C25.0 / 鳞状细胞癌 2C25.2) |
| SNOMED CT | 254637007(Non-small cell lung cancer);254626006(Adenocarcinoma of lung) |
| 数据模态 | CT、PET/CT(DICOM)+ DICOM SEG 分割 + AIM 语义标注 + EGFR/KRAS/ALK 突变 + RNA-seq/微阵列 + 临床 |
| AI 任务类型 | 影像基因组学关联、突变状态预测、肺肿瘤分割、生存与复发预后建模 |
| 样本总数 | 211 例患者(分割 144 例、语义标注 190 例、RNA-seq 130 例、微阵列 26 例) |
| 数据大小 | 影像约 98 GB;临床 CSV 65.08 KB;AIM 标注 436.24 KB |
| 数据格式 | DICOM / DICOM SEG / AIM XML / CSV / GEO TXT |
| 许可证 | CC BY 3.0 |
| 访问级别 | 开放 |
| DUO 标签 | NRES(无限制;须遵守 TCIA 数据使用政策并按要求署名) |
| 语言 | 英语 |
| 首发日期 | 2017(TCIA 首版) |
| 最后更新 | 2021-06-01(Version 4) |
| 发布机构 | 斯坦福大学医学院(The Cancer Imaging Archive 托管) |
| 官方主页 | TCIA 集合页 |
| 下载地址 | 集合页 Download 区(manifest + 临床 CSV + AIM) |
| DOI | 10.7937/K9/TCIA.2017.7hs46erv(数据);10.1038/sdata.2018.202(论文) |
| 引用次数 | 90+(TCIA 集合页引用统计,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 影像、分割、语义、突变、转录组与结局齐备且 CC BY 开放;扣分项:无官方训练/验证/测试划分、DICOM SEG 需自行转换、基因数据托管于 GEO 需跨库合并 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、NSCLC 组织学与突变背景、临床任务定义、金标准描述)、§7 偏倚分析与伦理公平性。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NSCLC-Radiogenomics 采用 CC BY 3.0 许可发布于 The Cancer Imaging Archive,允许商业与科研用途,但任何基于该数据的成果必须按官方格式署名(Bakr et al. 2018 数据论文 + Version 4 数据 DOI:10.7937/K9/TCIA.2017.7hs46erv),并遵守 TCIA 数据使用政策与限制。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? 211 名非小细胞肺癌患者的"一站式"研究数据包:每位患者都有术前胸部 CT,多数还有 PET/CT;影像配对了同一颗肿瘤的基因检测结果(EGFR/KRAS/ALK 突变)、130 例 RNA 测序,以及复发、生存等临床结局。144 例患者还带有医生审校过的肿瘤分割掩膜,190 例带有 28 个结节语义特征的标注。全部数据来自斯坦福大学医学院与 Palo Alto 退伍军人医院,经 The Cancer Imaging Archive(TCIA)免费开放下载。
为什么重要? 它是公开数据中少有的"影像-基因-结局"三联配对队列:研究者可以在同一批病人上,把 CT 影像表型与分子表型、生存结局直接关联,从而回答"能否不穿刺、只靠 CT 就猜出基因突变"这一影像基因组学的核心问题。数据集配套论文发表于 Scientific Data(Bakr et al. 2018),已成为放射组学与影像基因组学论文中最常用的对照队列之一。对中国的研发团队而言,它还是理解欧美手术队列构成(退伍军人、吸烟谱、腺癌占比)的直观样本,是出海模型做跨人群差异分析时的重要参照。
我能用它做什么? 训练非侵入式 EGFR/KRAS 突变预测模型、复现影像组学生存/复发预后研究、开发肺肿瘤分割算法、做多模态融合(影像+转录组)方法学实验,或把它当作自己医院队列的外部验证集。约 98 GB 的 DICOM 体量与 CC BY 3.0 许可意味着个人工作站即可完成全部流程。
§1.1 摘要
NSCLC-Radiogenomics 由斯坦福大学 Bakr、Gevaert、Plevritis、Napel 等构建,2017 年经 TCIA 发布(当前 Version 4,2021-06-01 更新),配套数据描述论文发表于 Scientific Data。数据集整合两个队列:R01 队列 162 例(斯坦福 69 例、Palo Alto VA 93 例,2008-04-07 至 2012-09-15 前瞻性入组)与 AMC 队列 49 例(斯坦福回顾性收集,以"有临床 EGFR/KRAS/ALK 突变结果"为额外入选条件)。每位受试者具备术前 CT(211/211),201 例具备 PET/CT;影像之外发布四类"注释":144 例经自动算法初分割、两位胸部放射科医生(5 年+ 与 20 年+ 经验)先后修正复核的 DICOM SEG 肿瘤掩膜;190 例由 20 年+ 经验放射科医生按 28 个结节特征模板完成的 AIM 语义标注;SNaPshot/FISH 平台的突变结果(EGFR 206 例、KRAS 205 例、ALK 196 例);以及从手术切除肿瘤提取的转录组数据(RNA-seq 130 例,GEO 编号 GSE103584;微阵列 26 例,GSE28827)。临床 CSV 覆盖 211 行,含病理分期、吸烟、复发与生存结局。影像 98 GB,全部 CC BY 3.0 开放。
一句话定位:它是 TCIA 生态里"注释密度最高的小队列"——规模不大,但每位患者的影像、分子与结局都被尽可能配平,适合所有"深度大于广度"的研究问题。
§1.2 战略价值
维度一:影像基因组学的"罗塞塔石碑"。 影像基因组学要求同一受试者同时具备高质量影像与分子检测,而公开数据集中两者真正配对的极少。本数据集在同一队列内同时给出结构化语义标注(28 个结节特征)、像素级分割掩膜、驱动基因突变状态与转录组,使"影像特征 ↔ 基因通路 ↔ 生存结局"三向关联可以在同一批患者上闭环验证。TCIA 集合页显示该数据集已被引用 90+ 次(截至 2026-09),EGFR/KRAS 非侵入预测方向的多篇代表性论文均以它作为内部或外部验证队列。
维度二:开放许可 + 全模态注释的教学价值。 CC BY 3.0 允许商用,无需注册、无需数据使用协议,是课堂与入门 pipelines 少有的"零门槛"完整标本:DICOM 原始影像、DICOM SEG 新式分割对象、AIM 语义 XML、CSV 临床表、GEO 表达矩阵——一套数据覆盖了医疗 AI 工程实践中几乎所有主流格式与转换环节。对教学而言,它也是学习"多中心回顾性数据的协议异质性"(层厚 0.625–3 mm、多厂商扫描仪)的最佳负面教材之一。
维度三:与 TCGA 生态互补的"影像接入点"。 TCGA 的 LUAD/LUSC 队列拥有最深的分子谱,但缺乏与分子配对的原发部位术前 CT;本数据集把同一例患者的影像表型与手术肿瘤的转录组、驱动基因绑定,恰好补上了"影像→分子"的桥接层。研究者在 TCGA 上发现的影像-基因假设,可以先在本队列做小样本验证,再决定是否投入前瞻性采集。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态与标注 | 差异化 |
|---|---|---|---|
| NSCLC-Radiogenomics(本条目) | 211 例 | CT + PET/CT + DICOM SEG + AIM 语义 + EGFR/KRAS/ALK + RNA-seq 130 例 + 生存/复发 | 唯一同时配对影像、驱动基因与转录组的开放 NSCLC 队列;手术切除人群 |
| NSCLC-Radiomics(Lung1) | 422 例 | 胸部 CT + 放疗科医师手动 GTV + 生存结局 | 影像组学金标准治疗队列(荷兰 MAASTRO,放疗为主);无基因数据 |
| LIDC-IDRI | 1,018 例 | 胸部 CT + 4 位放射科医生两阶段标注 | 分割/检出金标准规模最大;无基因与生存数据 |
| TCGA-LUAD / LUSC | 数百例/癌种 | 组织病理切片 + 全基因组多组学 + 临床 | 分子深度无可匹敌,但无原发部位术前 CT 配对影像 |
| Lung-PET-CT-Dx | 约千例级 | CT/PET + 病理确认的结节标注 | 影像-病理标注丰富;突变与转录组缺失 |
上表揭示本数据集的卡位:LIDC-IDRI 有标注无基因、TCGA 有基因无原发 CT、Lung1 有结局无基因——只有 NSCLC-Radiogenomics 把三者拧在同一个 211 人的队列里。代价是规模:任何需要数千样本的任务(如从头训练大分割模型)都应把本数据集当微调/验证集而非主训练集。
§1.4 版本时间轴
| 日期 | 事件 | 说明 |
|---|---|---|
| 2008-04-07 至 2012-09-15 | R01 队列采集 | 斯坦福 + Palo Alto VA,前瞻性手术队列 |
| 2014 | 前身数据先行发布 | 26 例影像以 Napel & Plevritis 名义入 TCIA(DOI:10.7937/K9/TCIA.2014.X7ONY6B1),并入后改名 R01-XXXXXX |
| 2017 | TCIA 首版上线 | 数据 DOI:10.7937/K9/TCIA.2017.7hs46erv |
| 2017-09-07 / 2018-08-03 | RNA-seq 提交/公开 | GSE103584(130 例,Illumina HiSeq 2500) |
| 2018-10-16 | 数据论文发表 | Bakr et al., Scientific Data 5:180202 |
| 2021-06-01 | Version 4 更新 | 补 R01-009(CT)、R01-100/R01-111(PET/CT)缺失 study;为 6 例 Philips PET 补 SUV 转换因子标签 (7053,1000) |
时间轴解读:本数据集的"数据冻结"程度很高——自 2021 年 V4 后影像与临床部分再无变更,仅有外部生态(IDC 镜像、第三方分割)在演进。这意味着引用时几乎不存在"数据被悄悄改掉"的风险,复现研究的最大变量来自工具链(PyRadiomics/SimpleITK 版本)而非数据本身。
§1.5 典型应用场景
- 非侵入式突变预测(虚拟活检):以 CT 影像或影像组学特征预测 EGFR/KRAS/ALK 状态,为无法活检患者筛选靶向治疗候选者(§8 基准)。
- 影像基因组学关联发现:把 28 个语义特征或放射组学特征与 10 个共表达基因簇(metagene)做关联,复现"影像表型-分子通路"图谱。
- 肺肿瘤分割与掩膜质控研究:144 例 DICOM SEG 可直接用于分割模型训练,也适合研究"自动初分割+医生修正"人机协同标注的偏差传播。
- 预后与复发建模:利用复发、死亡日期与病理分期拟合生存模型,对标 High_Risk_2yr 复发终点研究。
- 多模态融合与教学 pipeline:影像+转录组+临床三模态融合方法学实验;DICOM SEG/AIM/GEO 多格式转换教学。
- 标注科学(annotation science)研究:以"自动初分割+两级医生修正"的 144 例为对象,研究人机协同标注的偏差传播与质控成本。
- 连接组学与影像的课程实践:配合 GSE103584 教学生信管线(STAR/Cufflinks/FPKM),与影像特征在同一批患者上汇合,是少有的"同一病人两条数据流"教学案例。
- 基准协议研究:以 §8.3 清单为脚本,研究"子集口径/Unknown 处理/划分方式"对同一模型性能的影响,产出可复用的评测协议。
§2 医学背景
§2.1 ICD-11 编码映射
| 标签 | ICD-11 编码 | ICD-11 名称 | 说明 |
|---|---|---|---|
| 非小细胞肺癌(总类) | 2C25 | 支气管或肺恶性肿瘤 | NSCLC 是临床类别而非单一编码,按组织学分入下列亚码 |
| 肺腺癌 | 2C25.0 | 支气管或肺腺癌 | Histology 列 adenocarcinoma 对应(本队列 172 例) |
| 肺鳞状细胞癌 | 2C25.2 | 支气管或肺鳞状细胞癌 | Histology 列 squamous cell carcinoma 对应(35 例) |
| 未特定 NSCLC | 2C25.5 / 2C25.Z | 未特指的支气管或肺恶性肿瘤 | Histology 列 NSCLC NOS 对应(4 例) |
§2.1b SNOMED CT 映射
| 标签 | SNOMED CT 码 | 术语 | 对应字段值 |
|---|---|---|---|
| 非小细胞肺癌 | 254637007 | Non-small cell lung cancer | Histology = “NSCLC”(未细分) |
| 肺腺癌 | 254626006 | Adenocarcinoma of lung | Histology = “adenocarcinoma” |
| 肺鳞状细胞癌 | 723301009 | Squamous non-small cell lung cancer | Histology = “squamous cell carcinoma” |
§2.2 疾病简介与流行病学
非小细胞肺癌(NSCLC)约占全部肺癌的 85%,其余主要为小细胞肺癌;吸烟仍是首要归因(约 60-70%),空气污染与职业暴露次之。据 GLOBOCAN 2022 估计,2022 年全球肺癌新发 2,480,675 例、死亡约 181 万例,居癌症死因首位;国际癌症研究机构(IARC)2025 年发布的亚型分析显示,肺腺癌已取代鳞癌成为全球最常见的组织学亚型。肺癌整体 5 年生存率仅约 10-20%,晚期(IV 期)不足 5%。分子层面,KRAS 突变约占肺腺癌的 30%(其中 G12C 约 13%),EGFR 突变率存在明显人群差异,东亚裔不吸烟腺癌患者中显著更高;EGFR-TKI、ALK 抑制剂等靶向药物使驱动基因状态直接决定一线治疗方案,这是"用影像无创预测突变"研究的临床动机。
对本数据集的含义有二:其一,队列中腺癌占 81.5%(172/211),与"腺癌是全球最常见亚型"的最新流行病学格局一致,样本结构对当下研究仍有代表性;其二,队列来自 2008-2012 年的美国湾区手术人群,其 EGFR 突变基线率低于东亚报道值,把本数据集训练的突变预测模型迁移到东亚人群时必须重新校准先验。
临床分期与治疗语境:数据集记录术后病理 T/N/M(R01 的 162 例),病理分期是生存建模中最强的一组传统协变量;治疗字段(辅助化疗/放疗,各 210 例)允许在预后模型中做治疗暴露校正。治疗方式以手术切除为主(可加辅助治疗),与 Lung1 的根治性放疗人群形成鲜明互补——两者并读可以覆盖 NSCLC 的两大主流治疗路径。
§2.3 临床任务定义
| 任务 | 定义 | 数据集支撑字段 | 金标准来源 |
|---|---|---|---|
| 突变状态预测 | 从术前 CT 预测 EGFR 外显子 18-21、KRAS 密码子 12/13 突变与 EML4-ALK 易位 | EGFR/KRAS/ALK mutation status | SNaPshot 分型 + FISH(临床记录) |
| 肿瘤分割 | 在 CT 上勾画原发肺肿瘤三维边界 | DICOM SEG(144 例) | 自动算法 + 双放射科医生共识 |
| 语义表型抽取 | 结节位置、边缘、毛刺、空腔与肺气肿等 28 类特征 | AIM XML(190 例) | 20 年+ 胸部放射科医生标注 |
| 生存/复发预后 | 术后无病生存与总生存建模 | Recurrence、Date of Recurrence、Date of Death、Survival Status | 临床随访(日期已平移匿名化) |
| 影像-基因关联 | 语义/组学特征与 10 个共表达基因簇(metagene)的统计关联 | AIM 特征 + GSE103584 表达矩阵 | Spearman 相关 + 多重检验校正(官方方法) |
上述任务共享同一条"虚拟活检"逻辑链:影像表型(分割/语义/组学)作为输入,分子状态或生存结局作为输出,而配对设计使每个样本的输入输出来自同一位患者——这正是本数据集相对"影像-only"或"基因-only"队列的结构性优势。
§2.4 患者人群表
| 维度 | 取值 |
|---|---|
| 来源 | 斯坦福大学医学院(R01 69 例 + AMC 49 例)、Palo Alto 卫生保健系统(R01 93 例) |
| 采集时间 | R01:2008-04-07 至 2012-09-15;AMC:回顾性(手术至 2010-05-21 之前的微阵列亚组可考) |
| 规模与性别 | 211 例(女 76 / 男 135);R01 女 38 / 男 124,AMC 女 33 / 男 16 |
| 年龄 | R01 均值 68 岁(42-86 岁);AMC 均值 67 岁(24-80 岁) |
| 组织学 | 腺癌 172、鳞癌 35、NSCLC 未另分类 4 |
| 入组条件 | 术前完成 CT 与 PET/CT、转诊手术切除并有肿瘤组织;AMC 额外要求临床 EGFR/KRAS/ALK 结果可用 |
| 就医类型 | 三级学术医疗中心 + 退伍军人医院的胸外科手术人群 |
两点使用提示:R01 队列的机构构成(VA 93 例)使其吸烟暴露谱偏重,Pack Years 中位水平高于一般学术中心队列,建模时吸烟相关特征的表达力可能被放大;AMC 队列年龄下限低至 24 岁,含少量年轻不吸烟肺腺癌,正是 EGFR 突变概率较高的人群,做分层分析时值得单独检查。
§2.5 临床价值
对不可活检或拒绝穿刺的患者,影像驱动的突变预测可在治疗前提供"是否可能获益于 EGFR-TKI/ALK 抑制剂"的先验;在资源受限地区,可辅助决定是否转诊做分子检测。分割与语义标注则支持结节的定量随访。需要强调:本队列全部为手术切除患者(多为早期),任何由此训练的模型都不能直接外推到晚期或筛查人群。
从研究流程看,本数据集还支撑三类落地路径:(1) 伴随诊断筛选——在靶向药物临床试验入组前,用影像先验估计突变可能性,优化活检资源配置;(2) 肿瘤异质性测量——活检只反映穿刺点的分子面貌,而 CT 覆盖整颗肿瘤,影像-基因配对数据可用于估计"单点活检 vs 全肿瘤表型"的偏差;(3) 教学与能力建设——CC BY 3.0 零门槛许可使其成为放射组学课程、医学影像 AI 训练营的标准练习集。
§2.6 金标准表
| 划分 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|
| 肿瘤分割掩膜(144 例) | 未发表自动算法初分割 → ePAD 平台人工修正 → 独立复核 | M.K.(5 年+ 胸部放射科医生)修正;A.N.L.(20 年+)复核并最终批准 | 半自动 + 双人共识 |
| 语义标注(190 例) | 受控词汇模板(28 个结节特征 + 肺实质特征),ePAD 平台逐例强制填写 | 模板由两位学术胸部放射科医生共识制定;A.N.L. 与 Denise Aberle 教授完成标注 | 人工主观标注 |
| 基因突变(EGFR 206 / KRAS 205 / ALK 196 例) | SNaPshot 多重 PCR 单碱基延伸;ALK 用 FISH | 临床分子病理检测记录 | 临床检测金标准 |
| 转录组(RNA-seq 130 / 微阵列 26 例) | HiSeq 2500 双端测序(STAR→hg19,Cufflinks FPKM);HumanHT-12 微阵列(quantile 归一化) | Stanford 功能基因组设施 + Centrillion Biosciences | 实验室测定 |
| 生存与复发(Survival Status 211 / Recurrence 210 例) | 临床随访结构化录入 | 研究团队 | 临床随访 |
金标准整体评价:五个维度的"金标准成色"并不均质——基因检测与转录组是临床级/实验级硬标准;分割与语义是资深专家级软标准(无定量一致性数据);生存结局取决于随访质量。将它们组合成多模态任务时,建议在论文的 limitations 中分别声明各侧的成色。
§3 数据集规格
§3.0 获取渠道抉择矩阵
| 你的需求 | 推荐渠道 | 体量 | 理由 |
|---|---|---|---|
| 完整复现论文 / 需要全部 DICOM 头文件 | TCIA manifest + NBIA Data Retriever | 约 98 GB | 官方全量,含 CT、PET/CT 与 SEG 原始 DICOM |
| 只要临床表 + 语义标注做表格类分析 | 集合页 CSV + AIM 直接下载 | 65.08 KB + 436.24 KB | 无需下载影像即可做突变预测表格实验 |
| 云端训练 / 不想下载 | NCI Imaging Data Commons(IDC) | 按需 | 影像已入 IDC,可在大云平台按 series 读取 |
| 只要 AI 生成分割做预训练 | Zenodo BAMF(AIMI Annotations)社区 | 较小 | 佐治亚团队发布的补充分割产物 |
| 转录组建模 | NCBI GEO GSE103584(RNA-seq)/ GSE28827(微阵列) | 处理矩阵 6.8 MB | 官方指定基因数据托管处,按 Subject ID 与 TCIA 对齐 |
| 只做分割任务 | TCIA 全量或 IDC 中仅 CT+SEG series | 小于全量 | 手动从 manifest 剔除 PET series,体量显著下降且无需 PET 处理链 |
§3.1 模态详情
- CT(211/211):术前诊断性胸部 CT,仰卧位、手臂置于身体两侧、肺尖至肾上腺、单次屏气采集;多厂商、多协议回顾性收集。
- PET/CT(201/211):18F-FDG 显像,GE Discovery 系列(斯坦福为 Discovery D690);CT 衰减校正 + OSEM 迭代重建;覆盖颅底至大腿中部,每床位 1-5 分钟。
- DICOM SEG(144/211):原发肺肿瘤二值掩膜,逐帧引用源 CT 切片(SOPInstanceUID 级对齐)。
- AIM 语义标注(190/211):ePAD 平台产出的 Annotation and Image Markup XML,受控词汇模板强制逐结节完整填写,含解剖位置、几何形态、内部特征与肺实质(肺气肿/气道)四组 28 个结节特征。
- 基因突变(EGFR 206 / KRAS 205 / ALK 196):SNaPshot 分型(EGFR 外显子 18-21、KRAS 密码子 12/13)与 FISH(EML4-ALK)。
- 转录组:RNA-seq 130 例(TruSeq Ribo-Zero,HiSeq 2500 双端,STAR 2.3 比对 hg19,Cufflinks 2.0.2 FPKM,3 个批次 16/66/48);微阵列 26 例(Illumina HumanHT-12,log2 + quantile 归一化)。
- 临床 CSV:211 行,覆盖人口学、吸烟、病理分期、分子、治疗与结局 6 组字段。
§3.2 按子集样本数
| 子集 | 例数 | 占 211 比 |
|---|---|---|
| CT 影像 | 211 | 100% |
| PET/CT 影像 | 201 | 95.3% |
| AIM 语义标注 | 190 | 90.0% |
| DICOM SEG 分割 | 144 | 68.2% |
| RNA-seq(GSE103584) | 130 | 61.6% |
| 除微阵列外全部数据类型齐备 | 116 | 55.0% |
| 临床 + 影像 + RNA-seq 齐备 | 130 | 61.6% |
| EGFR 突变结果 | 206 | 97.6% |
| KRAS 突变结果 | 205 | 97.2% |
| ALK 易位结果 | 196 | 92.9% |
| 基因表达微阵列(GSE28827) | 26 | 12.3% |
读表要点:各子集并非嵌套关系——例如"有语义标注而无分割"的患者数量可观(190 对 144),做表格类研究时不必受分割可用性限制;"临床+影像+RNA-seq 齐备"的 130 例是多模态融合研究的事实主战场, planning 阶段建议先导出这 130 例 ID 清单再做下游筛选。
§3.3 数据格式表
| 内容 | 格式 | 说明 |
|---|---|---|
| CT / PET/CT | DICOM | 逐切片 .dcm,参数记录于头文件 |
| 肿瘤分割 | DICOM Segmentation Object | 逐帧引用源 CT 切片 UID |
| 语义标注 | AIM XML(ZIP 打包) | 受控词汇模板 |
| 临床数据 | CSV(65.08 KB) | 每行一例患者 |
| RNA-seq | GEO TXT 矩阵 + SRA 原始数据 | FPKM 与原始 counts |
| 微阵列 | GEO TXT | 原始 + 归一化矩阵 |
| 云端影像(IDC) | DICOM(对象存储) | 按 series 检索与拉取 |
格式转换链小结:DICOM →(dicom2nifti)→ NIfTI 是 CT/PET 的主流路径;DICOM SEG →(dcmqi 或 pydicom-seg)→ NIfTI labelmap 是分割的必经路径;AIM XML 需自写解析器或用 ePAD 导出为 CSV;三者在 Subject ID 上重新汇合形成建模宽表。
§3.4 存储大小
| 内容 | 大小 |
|---|---|
| 影像与分割(DICOM 全量) | 约 98 GB(TCIA 页显示 395 studies / 1,351 series / 286,754 images) |
| 临床 CSV | 65.08 KB |
| AIM 语义标注 | 436.24 KB |
| GSE103584 处理矩阵 | 6.8 MB(另有 SRA 原始测序) |
§3.5 标注方式
肿瘤分割采用"自动算法 + 人工修正 + 独立复核"的半自动流程;语义标注为纯人工;突变与转录组为实验室测定;临床字段为结构化随访录入。数据集不包含任何深度学习模型大规模自动生成的标签。
这一构成决定了标注的"性价比画像":分割掩膜虽只有 144 例,但每例都是像素级、可直接训练的强标签;语义标注覆盖 190 例、维度丰富,但以受控词汇表达、需先向量化;突变与转录组是客观测定值,几乎没有标注误差,误差主要来自"未检测"的选择机制(见坑点 6)。三者的质量来源不同,融合使用时应分别设置置信度假设,而不是默认"所有标签同等可信"。
§3.6 标注者资质与一致性
分割由 5 年以上经验的胸部放射科医生 M.K. 修正,20 年以上经验的 A.N.L. 独立复核,分歧经讨论后由 A.N.L. 最终批准;语义标注由 A.N.L.(20 年+ 经验)完成,Denise Aberle 教授亦为 CT 语义标注提供支持。数据论文未公布定量一致性指标(如 Dice/Kappa),并明确说明语义标注存在阅读者内/间变异。
与同类数据集对比:LIDC-IDRI 由 4 位放射科医生独立两阶段标注(可算出标注间 Dice 分布),而本数据集发布的是"单一合并共识掩膜",无法还原标注者间分歧。这既是易用性优势(下游不必选标注者),也是分析劣势(无法研究标注变异本身)。
§3.7 采集周期
R01 队列 2008-04-07 至 2012-09-15;AMC 队列回顾性收集,其中微阵列亚组手术日期为 2008-04-07 至 2010-05-21;RNA-seq 队列病例诊断时间为 2008-04 至 2014-09。复发随访跨度约 8 年。
采集年代对使用者意味着两件事:扫描设备以 2008-2012 年代的多排 CT 为主(64 排级别),与当代宽体/光子计数 CT 存在重建差异;复发随访在 2012 年后仍持续进行(复发字段 210 例可用),因此生存类标签的时间跨度长于影像采集窗口,做生存分析时应使用"诊断/手术日"而非"数据发布日"作为时间零点。
§3.8 地域覆盖
全部来自美国加利福尼亚州湾区两家机构:斯坦福大学医学中心与 Palo Alto 卫生保健系统(退伍军人事务部)。
§3.9 设备规格
CT 为多厂商回顾性采集:管电压 80-140 kVp(均值 120),管电流方法学部分记录为 124-699 mA(均值 220)。CT 层厚分布如下表(层厚是本数据集最重要的质控变量,见坑点 3):
| 层厚(mm) | 例数 | 占 211 比 |
|---|---|---|
| 0.625 | 12 | 5.7% |
| 1.0 | 64 | 30.3% |
| 1.5(中位档) | 114 | 54.0% |
| 2.0 | 2 | 0.9% |
| 2.5 | 15 | 7.1% |
| 3.0 | 4 | 1.9% |
PET/CT 为 GE Discovery 系列(斯坦福 Discovery D690),FDG 剂量 138.90-572.25 MBq(均值 309.26),摄取时间 23.08-128.90 分钟(均值 66.58),OSEM 重建 + CT 衰减校正,颅底至大腿中部覆盖、每床位 1-5 分钟。具体扫描仪型号与逐序列参数记录于 DICOM 头文件((0008,0070) Manufacturer、(0018,0050) SliceThickness 等),建议入库时把这些标签提取成机器可读的质控表。
§3.10 深度溯源链
NIH/NCI 资助(R01 CA160251、U01 CA187947、U01 CA142555、U01 CA190214、R01 EB020527)→ 斯坦福医学院与 Palo Alto VA 临床采集(IRB 批准 + 书面知情同意)→ RSNA MIRC CTP / PACSGEAR 两轮 DICOM 脱敏(临床日期平移)→ TCIA 策展上线(Justin Kirby 等,Version 1→4)→ 基因组数据独立托管 NCBI GEO → NCI CRDC/IDC 建立云镜像 → Zenodo BAMF 社区发布补充 AI 分割。
再往上游追溯:肿瘤组织由外科医生在切除后 30 分钟内取 3-5 mm 沿最长轴切片冷冻;RNA 由 Centrillion Biosciences 处理并测序(TruSeq 文库 + HiSeq 2500),生物信息学处理(STAR 2.3 比对 hg19、Cufflinks 2.0.2 定量)亦由其完成;微阵列由 Stanford Functional Genomics Facility 处理。语义标注模板由两位学术胸部放射科医生共识制定,Denise Aberle 教授为 CT 语义标注提供支持。每一个环节都可以在 Bakr 2018 论文的 Methods 与 ISA 补充材料中定位到对应段落,构成完整、可审计的溯源闭环。
§4 数据结构
§4.0 目录树
NSCLC-Radiogenomics/ # NBIA Data Retriever 下载根目录
├── R01-001/ # 每位患者一个顶层文件夹
│ ├── <检查日期>-<检查描述>/ # 一个 DICOM Study
│ │ ├── <CT 序列文件夹>/
│ │ │ ├── 1-001.dcm ... 1-NNN.dcm # 逐切片 CT(几十至数百张)
│ │ └── <PET 或 SEG 序列文件夹>/
│ │ └── *.dcm # PET/CT 或 DICOM SEG 对象
│ └── ... # 部分患者有多个 Study
├── R01-002/ ... R01-162/
├── AMC-001/ ... AMC-049/
├── nsclc-radiogenomics-clinical.csv # 211 行临床表(65.08 KB)
└── AIM-annotations/ # 语义标注(436.24 KB)
└── *.xml # 每例一个 AIM 文件(190 例)
§4.1 DAIMS 字段字典(临床 CSV 核心字段)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Subject ID | 文本 | 唯一受试者标识,前缀区分队列 | R01-001 / AMC-001 | 主键,跨 TCIA/GEO 对齐 | 无 | 无 | R01-001…162;AMC-001…049 |
| Age at Histological Diagnosis | 整数 | 组织学确诊年龄(岁) | 68 | 协变量 | ±1 岁 | 无 | 24-86 |
| Gender | 分类型 | 性别 | Male / Female | 协变量/分层 | 无 | 无 | 2 类 |
| Ethnicity | 分类型 | 自报种族 | White | 公平性分析 | 自报偏差 | 空值 = 未记录(49 例) | 多类 |
| Smoking status | 分类型 | 吸烟状态 | Smoker | 突变预测强先验 | 自报偏差 | 无 | Smoker / Non-Smoker |
| Pack Years | 浮点 | 累积吸烟包年 | 40 | 剂量-反应分析 | 自报偏差 | 空值 = 未记录(8 例) | ≥0 |
| Histology | 分类型 | 组织学亚型 | adenocarcinoma | 标签 | 病理复读差异 | 无 | adeno / squamous / NSCLC NOS |
| Histopathological Grade | 分类型 | 组织病理学分级(162 例) | G2 / moderately | 预后协变量 | 分级主观性 | 空值 = AMC 未发布 | G1-G4 |
| Weight in lbs | 浮点 | 体重(磅,152 例) | 165 | PET SUV 计算/协变量 | 称量时点差异 | 空值 = 未记录 | >0 |
| Ground Glass | 浮点 | 磨玻璃成分百分比(146 例) | 10 | 腺癌浸润性替代特征 | 影像判读差异 | 空值 = 无 GGO 或未记录 | 0-100 |
| Tumor Location | 分类型 | 肿瘤肺叶位置 | right upper lobe | 分层/翻转保护 | 无 | 无 | 六类(左右上/中/下叶等) |
| Pathological T/N/M stage | 分类型 | 术后病理分期(162 例) | T2aN0M0 | 预后协变量 | 分期版本差异 | 空值 = AMC 未发布 | AJCC 7 版 |
| EGFR mutation status | 分类型 | SNaPshot 外显子 18-21 | Mutant / Wildtype | 主标签 | 检测 panel 覆盖度 | 空值/Unknown = 未检测 | 3 类 |
| KRAS mutation status | 分类型 | SNaPshot 密码子 12/13 | Wildtype | 主标签 | 同上 | 同上 | 3 类 |
| ALK translocation status | 分类型 | FISH EML4-ALK | Negative | 主标签 | FISH 阈值判定 | 同上 | Positive / Negative / Unknown |
| Recurrence | 分类型 | 随访期内复发与否(210 例) | Yes / No | 生存终点 | 随访强度差异 | 空值 = 失访 | Yes / No |
| Date of Last Known Alive / Date of Death | 日期 | 随访与死亡日期 | 2011-05-14 | 生存时间计算 | 已整体平移 | 无 | 平移后伪日期 |
| Days between CT and surgery | 整数 | CT 至手术间隔天数 | 21 | 采集一致性质控 | 无 | 无 | ≥0 |
| CT Date / PET Date | 日期 | 检查日期(已平移) | 2010-03-14 | 时序核查(仅相对顺序) | 平移量未知 | 无 | 平移后伪日期 |
| Adjuvant Treatment / Chemotherapy / Radiation | 分类型 | 治疗暴露(各 210 例) | Yes / No | 混杂校正 | 回顾性记录 | 无 | Yes / No |
| Quit Smoking Year | 整数 | 戒烟年份(194 例) | 2005 | 暴露时长构造 | 回忆偏差 | 空值 = 未戒烟或未记录 | 1900-2012 |
| Recurrence Location | 分类型 | 复发部位(210 例) | local / distant | 复发模式分析 | 随访影像判读 | 空值 = 未复发/失访 | 数类 |
§4.2 标签分布
以 R01 队列 162 例(外部基准研究中常用的可分析子集)为例:EGFR 突变 25 例、野生型 102 例、未知或未收集 35 例;KRAS 突变 30 例、野生型 94 例、未知 38 例。全队列 EGFR/KRAS/ALK 结果分别覆盖 206/205/196 例。正类占比不足 20% 且未知标签占比 20% 左右,是所有突变预测研究必须处理的失衡与删失问题。
读取标签时的三个工程注意点:
- AMG 队列(AMC)以"有临床突变结果"为入选条件,故其标签覆盖率高于 R01,跨队列合并会改变正类率——报告时按队列分层给出。
- ALK 结果由 FISH 判读,阳性极稀疏(个位数比例级),不建议作为独立二分类终点,适合并入"任意驱动基因阳性"复合标签。
EGFR mutation status的取值在原表中存在 Mutant/Wildtype 与空值并存的情况,且部分下游研究把 “Unknown/not collected” 作为显式类别编码——加载后先做value_counts(dropna=False)核对再建模。
§4.3 关键统计
- 组织学:腺癌 172(81.5%)、鳞癌 35(16.6%)、NSCLC NOS 4(1.9%)。
- CT 层厚:中位 1.5 mm;1.5 mm 者占 114 例(54.0%),跨 0.625-3 mm 六档。
- PET/CT 覆盖 201 例(95.3%);FDG 摄取中位约 66.6 分钟。
- 分割/语义/转录组覆盖率分别为 68.2%/90.0%/61.6%,三者交集是"全配对"黄金子集。
- 395 个 Study 对应 211 位患者(平均约 1.9 个 Study/人),印证多位点检查的普遍性;Series 总数 1,351 才是估算磁盘占用的正确单位——按"患者数"估 98 GB 会显著低估。
- 395 个 Study 对应 211 位患者,即平均每位患者约 1.9 个 Study(CT + PET/CT 分开计),印证坑点 1 的多 Study 风险。
- 286,754 张影像切片构成深度学习的原始输入池;若只取"有 SEG + 有 EGFR 标签"的子集,可直接建模患者数将降至约百例量级,所有实验设计都应以此为出发点。
§4.4 数据层级
患者(Subject:R01-xxx / AMC-xxx,211)
└── Study(检查:395 个,部分患者多次 CT/PET)
└── Series(序列:1,351 个:CT / PET / SEG)
└── Instance(切片/对象:286,754 个)
└── DICOM SEG 帧级引用 → 源 CT SOPInstanceUID(144 例掩膜逐帧对齐)
四个层级的工程含义:
- 患者层是标签与切分的原子单位(突变/生存标签都在这一层);
- Study 层是"多次检查"的容器——有患者在不同日期做过 CT 与 PET/CT,时间归属要分清;
- Series 层是下载与质控的原子单位(NBIA manifest 按 series 列出);
- Instance 层是掩膜对齐的原子单位——DICOM SEG 的每一帧通过 SourceImageSequence 指向唯一 CT 切片,这使逐像素对齐无需任何配准。
§4.5 缺失值与信息性缺失
| 字段/模态 | 可用例数 | 缺失性质 |
|---|---|---|
| Weight in lbs | 152/211 | 资源限制未录入 |
| Ethnicity | 162/211 | R01 录入、AMC 未发布 |
| Pack Years | 203/211 | 零散缺失 |
| Ground Glass 百分比 | 146/211 | 仅记录有 GGO 者 |
| Pathological T/N/M、Grade | 162/211 | AMC 队列未发布 |
| Lymphovascular / Pleural invasion | 154/211 | 病理报告缺失 |
| EGFR / KRAS / ALK | 206/205/196 | 未做临床检测(信息性:医生未认为必要) |
| PET/CT | 201/211 | 10 例无 PET |
| DICOM SEG | 144/211 | 自动分割失败或影像质量不足 |
| RNA-seq | 130/211 | 组织样本/RIN 质控淘汰 |
| 微阵列 | 26/211 | 早期亚组实验 |
缺失多为"未检测/未收集"而非随机缺失:例如突变未检测与早期年代、医院流程相关,与肿瘤特征相关,直接删行或填默认值都会引入偏倚(见坑点 6)。
使用建议:
- 影像侧缺失:无 SEG 的 67 例并非"影像质量差",多为自动分割初始化失败或肿瘤形态不适合模板,做分割任务时直接排除即可,做突变预测时无需排除(仍可只用框注或全肺输入)。
- 临床侧缺失:Weight、Ethnicity 等字段缺失与队列强相关(AMC 未发布),若作为模型特征会引入"队列指示器"效应,建议要么补齐要么不进特征。
- 基因侧缺失:微阵列仅 26 例且与 RNA-seq 重叠 17 例,两者不要混合成一个大矩阵;转录组建模应以 GSE103584 的 130 例为准。
- 记录口径:任何实验都应在数据卡中写明"使用了哪个子集、剔除了哪些 Unknown",本页 §8 的基准数字分歧大多源于口径不同。
§5 数据划分与使用建议
§5.1 官方划分
数据集无官方训练/验证/测试划分。R01(162 例)与 AMC(49 例)队列通过 Subject ID 前缀天然区分:AMC 的入选条件就是"有临床突变结果",因此做 EGFR/KRAS 任务时 AMC 偏向"已被检测"人群;分割掩膜在两队列间分布也不均匀。TCIA 与论文均未指定任何建模用途的划分。
使用者的两个必然决策:其一,标签口径(EGFR/KRAS/ALK 三选几、Unknown 删还是留);其二,影像范围(只用 CT,还是 CT+PET 双模态、是否限定有 SEG 的 144 例)。这两组决策交叉出的每个口径都对应不同的有效 N 与正类率,建议用配置文件固化口径并把"口径 → 有效 N → 基线性能"作为实验报告的第一张表。
§5.2 社区惯例
文献中出现三类做法:(1) 仅用 R01 内有分割 + 突变的交集(约 114-133 例,视质控标准)做内部交叉验证;(2) 用本数据集作为其他医院训练模型的外部验证集(如 Dong et al. 2021 用 TCIA 162 例验证自有 363 例训练的模型);(3) 用 AMC 作内部留出、R01 作训练。三类做法的样本构成差异很大,跨论文比较时必须核对子集定义。经验法则:方法学创新论文多用交集 CV(样本最大利用),临床部署论文多用外部验证模式(最接近真实泛化),而把两者数字写进同一张对比表是最常见的引用错误。
| 划分方案 | 训练集 | 验证/测试集 | 适用任务 | 注意事项 |
|---|---|---|---|---|
| 交集交叉验证 | R01 ∩ SEG ∩ 突变标签(约 114-133 例) | 5 折患者级 | 突变预测/组学 | 报告每折有效 N |
| 跨队列留出 | R01(162 例) | AMC(49 例) | 泛化性评估 | AMC 标签覆盖偏高,正类率不同 |
| 外部验证模式 | 本数据集全体 | 其他数据集(Lung1 等) | 生存/分割 | 模态与协议对齐工作量大 |
| 完整子集模式 | 临床+影像+RNA-seq 齐备 130 例 | 留出约 20% | 多模态融合 | 融合研究专用,单模态勿用 |
§5.3 划分策略与泄漏风险
- 患者级划分是底线:同一患者可能同时有 CT、PET/CT、SEG 多个序列,任何按序列/切片划分都会造成患者级泄漏。
- 队列感知划分:建议把 R01/AMC 作为分层变量或做"跨队列泛化"实验(AMC 留出),防止机构差异被模型当作生物学信号。
- 特征侧泄漏:Ground Glass 百分比、语义特征与突变相关性强,若与 CT 像素同时输入,须报告"纯影像"与"影像+临床"两条性能。
- 时间泄漏:日期已平移,不要试图构造日历时间特征;相对间隔(Days between CT and surgery)可用。
- 标签泄漏:突变 Unknown 样本既不能当野生型,也不能无声删除——须在论文中报告每种标签的有效 N。
- 影像组学泄漏:语义特征(如毛刺、GGO 百分比)与突变高度相关,如果模型同时看到 CT 像素与语义/临床特征,性能提升应归因于"信息融合"而非"影像学习",报告时须单列纯影像口径。
- 版本泄漏:下载过 V1-V3 旧包的存量项目须确认重下 V4(3 例补入的 study 会改变子集交集),新旧版本混用会造成"同一项目两套数据"。
§5.4 交叉验证建议
小样本下推荐嵌套交叉验证:外层 5 折(患者级、按组织学与队列分层)估计泛化性能,内层调参;每组内用 SMOTE 或类别权重处理失衡,并以 AUC 和 PR-AUC 双指标汇报。
§5.5 外部验证建议
推荐外部数据:NSCLC-Radiomics(Lung1,422 例,生存任务)、LIDC-IDRI(分割任务)、Lung-PET-CT-Dx(结节/突变)、自有医院队列(理想)。跨数据集验证时注意本数据集为术后病理确认队列,与筛查/穿刺人群存在谱系差异。
三级递进的外部验证路线:先在本数据集内做"R01 → AMC"跨队列迁移(同一湾区、同一采集年代,检验机构稳健性);再迁往 Lung1/Lung-PET-CT-Dx(不同国家、不同治疗人群,检验人群稳健性);最后用自有或前瞻性数据检验时序稳健性。任何一级失败都应先归因(协议?人群?标签口径?)再谈模型改进,避免盲目加复杂度。
§6 AI 就绪指南
§6.0 云端快速启动
影像已入 NCI Imaging Data Commons(IDC):在 Google BigQuery 中按 idc_v*_current 表筛选 collection_id = 'nsclc_radiogenomics' 可按 series 拉 DICOM 至 GCS,适合 Colab/Vertex 免下载分析。基因数据在 GEO(GSE103584),FTP 直接可得。纯表格实验(临床+突变)甚至可以在下载 CSV 后 5 分钟内开始。
云端路径的三条实用建议:(1) 先用 IDC 的 dicom_all 表做一次集合内统计(各 modality 的 series 数、slice thickness 分布),代替盲目下载后摸索;(2) Colab 免费档内存有限,建议按 series 流式读取并只缓存 ROI 区域;(3) 训练若在 Vertex AI/AWS 等其他平台,可用 s5cmd 从 GCS 同步所选 series,比全量 98 GB 下载快一个数量级。
§6.1 快速上手
# ── 目录结构预期 ─────────────────────────────────────────────
# data_root/
# ├── R01-001/ ... R01-162/、AMC-001/ ... AMC-049/ # NBIA 下载的 DICOM
# ├── nsclc-radiogenomics-clinical.csv # 集合页直接下载(65.08 KB)
# └── AIM-annotations/*.xml # 集合页直接下载(436.24 KB)
# ── data_root 拼接关系:所有路径以 data_root 为唯一前缀,
# 患者文件夹名 == 临床表 Subject ID == GEO 样本名
# ── 最小可用子集:clinical.csv(211 行)即可启动表格类突变预测实验,
# 无需下载 98 GB 影像。
import pandas as pd
from pathlib import Path
DATA_ROOT = Path("/data/nsclc-radiogenomics") # 唯一 data_root
clin = pd.read_csv(DATA_ROOT / "nsclc-radiogenomics-clinical.csv")
print(clin.shape) # 211 行 × ~40 列
# 检查 EGFR 标签构成(注意 Unknown 是独立类别,勿并入 Wildtype)
print(clin["EGFR mutation status"].value_counts(dropna=False))
# 三类患者主键核对:TCIA 目录 vs 临床表 vs GEO
patients = {p.name for p in DATA_ROOT.iterdir() if p.name.startswith(("R01", "AMC"))}
assert patients == set(clin["Subject ID"]) # 目录与表格主键一致
进一步做 DICOM 质控扫描(一次遍历、终身受益):
# 依赖:pip install pydicom;扫描全部 series 生成质控表
import pydicom, csv
from pathlib import Path
rows = []
for seg_file in DATA_ROOT.rglob("*.dcm"):
ds = pydicom.dcmread(seg_file, stop_before_pixels=True)
if ds.Modality == "SEG":
ref = ds.ReferencedSeriesSequence[0].SeriesInstanceUID # 坑点 1 的正解来源
rows.append({"seg_file": str(seg_file), "referenced_ct_uid": ref})
elif ds.Modality == "CT":
rows.append({"ct_file": str(seg_file),
"series_uid": ds.SeriesInstanceUID,
"slice_thickness": getattr(ds, "SliceThickness", None)})
with open("qc_report.csv", "w", newline="") as f:
writer = csv.DictWriter(f, fieldnames=rows[0].keys())
writer.writeheader(); writer.writerows(rows)
# 之后用 qc_report.csv 做 UID 级 join,校验每个 SEG 都能找到唯一 CT series。
§6.2 数据获取
| 内容 | 方式 | 大小 | 条件 |
|---|---|---|---|
| 全量 DICOM(CT/PET/SEG) | 集合页下载 .tcia manifest → NBIA Data Retriever |
约 98 GB | 无需注册,CC BY 3.0 |
| 临床 CSV | 集合页 Clinical Data 区直接下载 | 65.08 KB | 同上 |
| AIM 语义标注 | 集合页 AIM Annotations 区直接下载 | 436.24 KB | 同上 |
| RNA-seq 130 例 | GEO:GSE103584(矩阵 + SRA) | 6.8 MB 矩阵 | 公开 |
| 微阵列 26 例 | GEO:GSE28827 | 较小 | 公开 |
| 云端影像 | NCI Imaging Data Commons | 按需 | 公开 |
| TCIA REST API | 程序化查询集合/series 元数据 | 较小 | 公开 |
获取流程要点:TCIA 全部资源无需注册、无需签署协议,直接下载即用;唯一"义务"是署名(见 §9.4 引用指南)。98 GB 全量下载建议使用有线网络 + NBIA Data Retriever 断点续传,或改走 IDC 云端按 series 拉取;若只需要 CT+SEG(做分割或突变预测),可在 manifest 中手动剔除 PET series,体量可削减约一半。临床 CSV 与 AIM 标注建议在影像下载开始前先取到手,便于先行完成标签工程与子集锁定。
# 1) 从集合页保存 manifest 文件 nsclc-radiogenomics.tcia
# 2) 安装 NBIA Data Retriever 后以 manifest 为参数启动(可执行文件名以安装版本为准)
NBIADataRetriever --cli nsclc-radiogenomics.tcia # 全量约 98 GB,磁盘预留 120 GB+
# 3) 表格与标注可直接 curl/浏览器下载集合页对应链接
§6.3 预处理全流程
# DICOM → NIfTI + SEG → labelmap + 重采样(可运行骨架)
# 依赖:pip install dicom2nifti pydicom pydicom-seg SimpleITK
import dicom2nifti, pydicom, pydicom_seg, SimpleITK as sitk
from pathlib import Path
def ct_to_nifti(patient_dir: Path, out_dir: Path):
"""将某患者的 CT series 转 NIfTI;多 series 时须按 UID 精确选择(见坑点 1)。"""
out_dir.mkdir(parents=True, exist_ok=True)
ct_series = [d for d in patient_dir.iterdir()
if d.is_dir() and any(p.suffix == ".dcm" for p in d.iterdir())]
# 生产代码请按 DICOM 头 Modality==CT + SeriesInstanceUID 显式挑选
dicom2nifti.convert_directory(ct_series[0], out_dir, compression=True, reorient=True)
def seg_to_labelmap(seg_file: Path, out_path: Path):
"""DICOM SEG → NIfTI labelmap(pydicom-seg)。"""
ds = pydicom.dcmread(seg_file)
reader = pydicom_seg.SegmentReader()
result = reader.read(ds)
seg_img = result.segment_image(1) # 单一原发肿瘤,段 1
sitk.WriteImage(seg_img, str(out_path))
def resample_isotropic(img: sitk.Image, spacing=(1.0, 1.0, 1.0)):
"""影像组学标准做法:重采样到 1 mm 各向同性(掩膜请用最近邻)。"""
resampler = sitk.ResampleImageFilter()
resampler.SetOutputSpacing(spacing)
resampler.SetSize([int(s * o / n) for s, o, n in
zip(img.GetSize(), img.GetSpacing(), spacing)])
resampler.SetTransform(sitk.Transform())
return resampler.Execute(img)
预处理参数建议(与 §6.9 指标、§8.3 协议配套):
| 参数 | 推荐值 | 理由 |
|---|---|---|
| 重采样体素 | 1 × 1 × 1 mm³(各向同性) | 消除层厚异质性,组学社区事实标准 |
| 影像插值 | 三次 B 样条 | 灰度平滑,纹理保真 |
| 掩膜插值 | 最近邻 | 保持二值性 |
| HU 处理 | 保留原始 HU,窗宽窗位仅在可视化时使用 | 组学特征依赖绝对 HU |
| 特征提取 | PyRadiomics,重 segmentation 范围 [-550, 700] HU(可选) | 2025 复现研究采用的稳健区间 |
| 归一化 | 逐例 z-score(深度学习输入) | 不改盘上数据,仅训练时变换 |
清洗要点:CT 值即 HU,无需额外标准化,但建议统一窗宽窗位后再做纹理特征;PET 必须先经 SUV 转换(坑点 5);重采样后影像与掩膜几何必须逐一体检(spacing、origin、direction 三元组),不一致立即丢弃该例并记录。
PET SUV 换算骨架(供需要 PET 特征的读者):
# SUV = 活度浓度 (kBq/mL) / [注射剂量 (kBq) − 衰变] × 体重 (kg)
# DICOM 私有标签 (7053,1000) 存有厂商算好的 SUV 转换因子(Philips 曾缺失,见坑点 5)
import pydicom
def get_suv_factor(pet_dcm: str):
ds = pydicom.dcmread(pet_dcm)
if (0x7053, 0x1000) in ds:
return float(ds[0x7053, 0x1000].value) # 首选:厂商转换因子
# 缺失时方案:按标准公式用 RadiopharmaceuticalInformationSequence 重算,
# 或干脆将该 PET 序列剔除(保守且可复现)
return None
§6.4 PyTorch DataLoader
# 依赖:pip install torch SimpleITK pandas scikit-learn
import SimpleITK as sitk, torch, pandas as pd
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
class NsclcRadiogenomics(Dataset):
"""CT 原发肿瘤裁剪 + EGFR 突变二分类。
预期目录:data_root/<SubjectID>/ct.nii.gz + seg.nii.gz(§6.3 产物)。
标签:EGFR mutation status ∈ {Mutant, Wildtype},Unknown 样本被显式剔除。"""
def __init__(self, data_root: str, split_ids: list, size=(64, 64, 64)):
self.root = Path(data_root)
self.ids = split_ids
self.size = size
clin = pd.read_csv(self.root / "nsclc-radiogenomics-clinical.csv")
clin = clin[clin["EGFR mutation status"].isin(["Mutant", "Wildtype"])]
self.labels = dict(zip(clin["Subject ID"],
(clin["EGFR mutation status"] == "Mutant").astype(int)))
self.ids = [i for i in split_ids if i in self.labels] # Unknown → 剔除
def __len__(self):
return len(self.ids)
def __getitem__(self, idx):
sid = self.ids[idx]
ct = sitk.GetArrayFromImage(sitk.ReadImage(str(self.root / sid / "ct.nii.gz"))).astype("float32")
seg = sitk.GetArrayFromImage(sitk.ReadImage(str(self.root / sid / "seg.nii.gz"))) > 0
zs, ys, xs = seg.nonzero()
if len(zs): # 以掩膜包围盒为中心裁剪
cz, cy, cx = (zs.min()+zs.max())//2, (ys.min()+ys.max())//2, (xs.min()+xs.max())//2
d, h, w = self.size
ct = ct[cz-d//2:cz+d//2, cy-h//2:cy+h//2, cx-w//2:cx+w//2]
ct = torch.from_numpy(ct.copy()).unsqueeze(0) # (1, D, H, W)
ct = torch.nn.functional.interpolate(ct, size=self.size, mode="trilinear")
return ct, self.labels[sid], sid
# 划分示例:队列感知 + 患者级(R01 训练、AMC 内部留出)
clin = pd.read_csv("/data/nsclc-radiogenomics/nsclc-radiogenomics-clinical.csv")
r01 = clin[clin["Subject ID"].str.startswith("R01")]["Subject ID"].tolist()
amc = clin[clin["Subject ID"].str.startswith("AMC")]["Subject ID"].tolist()
train_loader = DataLoader(NsclcRadiogenomics("/data/nsclc-radiogenomics", r01),
batch_size=4, shuffle=True, num_workers=4)
val_loader = DataLoader(NsclcRadiogenomics("/data/nsclc-radiogenomics", amc),
batch_size=4, shuffle=False, num_workers=4)
小样本失衡的直接对策——加权采样(与坑点 6 的三态标签处理配合使用):
from torch.utils.data import WeightedRandomSampler
train_ds = NsclcRadiogenomics("/data/nsclc-radiogenomics", r01)
counts = [sum(1 for i in range(len(train_ds)) if train_ds[i][1] == c) for c in (0, 1)]
weights = [1.0 / counts[train_ds[i][1]] for i in range(len(train_ds))]
sampler = WeightedRandomSampler(weights, num_samples=len(train_ds), replacement=True)
train_loader = DataLoader(train_ds, batch_size=4, sampler=sampler, num_workers=4)
# 等价替代:BCEWithLogitsLoss(pos_weight=torch.tensor(counts[0] / counts[1]))
若今天就想出第一个结果而不下载影像:只用 clinical.csv 跑"临床特征 → EGFR 突变"逻辑回归基线(性别、年龄、吸烟、组织学、分期),约 30 行代码即可完成;同类临床模型在文献中报告的 AUC 约 0.71(Dong et al. 2021 训练集),可作为你的第一根参照线。再逐级加入影像组学与深度特征,观察每层模态带来的增益——这是本数据集上最被验证过的实验路径。
§6.5 坑点 8 个
以下 8 个坑点全部来自该数据集的真实失败模式:版本变更日志(坑点 5)、官方论文 Limitations(坑点 3/7)、复现论文披露(坑点 3/4/6)、社区镜像加载说明(坑点 1/2/8)。按"下载 → 转换 → 建模"的时间顺序排列,建议在流水线对应节点各设一道检查。
⚠️ 坑点 1:一位患者多个 CT Study,SEG 配错序列(分类:工程陷阱)
问题:同一患者可能有多次 CT 检查(395 个 Study 对应 211 位患者),自动遍历患者目录取"第一个 CT"会把分割掩膜配到错误的序列上,标签空间错位。
症状:掩膜与肺野明显错开、叠加可视化时掩膜悬空;PyRadiomics 报告的形状特征(体积/球度)离谱地大或为 0。
解决:
- 简单方法:读取 SEG 的
ReferencedSeriesSequence,取出 SeriesInstanceUID,只加载 UID 完全一致的那个 CT 序列。- 进阶方法:逐帧校验
PerFrameFunctionalGroupsSequence → DerivationImageSequence → SourceImageSequence的 SOPInstanceUID 与 CT 切片一一对应,不一致帧数 > 0 则重采样或弃用。- SOTA 方法:写一个数据集级 UID 注册表(患者 → SEG UID → CT UID → 帧数),入库前跑一次全量一致性校验并输出异常清单。
参考:HF MedOtter 镜像 Notes for Loaders;Bakr et al. 2018 Data Record 说明。
⚠️ 坑点 2:分割是 DICOM SEG 而非 RTSTRUCT(分类:预处理陷阱)
问题:本数据集分割以 DICOM Segmentation Object 发布,许多老 pipeline(SlicerRT 批量转换脚本等)只认 RTSTRUCT,直接跑会读不到掩膜。
症状:转换脚本报"no structures found"或输出空 labelmap;把 SEG 当单帧图像读只得到第一帧。
解决:
- 简单方法:用 dcmqi 的
segimage2itkimage命令行把每个 SEG 转成 NIfTI labelmap。- 进阶方法:Python 内用
pydicom_seg.SegmentReader或rt_utils的 SEG 分支直接得到 SimpleITK 图像,保留原始 spacing。- SOTA 方法:转换后统一过一遍几何断言(origin/direction/spacing 与源 CT 逐值相等),失败案例进入人工复核队列。
参考:dcmqi 文档;pydicom-seg。
⚠️ 坑点 3:层厚 0.625-3 mm 混杂,影像组学特征不可复现(分类:偏倚陷阱)
问题:回顾性多协议采集使层厚横跨六档(1.5 mm 者 114 例),纹理与形状特征随重采样方案剧烈漂移,模型学到的是"扫描协议指纹"而非生物学。
症状:同一患者不同重采样设置下特征值差异超过组间差异;外部验证性能骤降。
解决:
- 简单方法:统一重采样到 1 mm 各向同性(影像三次样条、掩膜最近邻)后再提特征。
- 进阶方法:按层厚分桶做敏感性分析,或把层厚/厂商作为协变量回归剔除。
- SOTA 方法:ComBat 或深度特征协调(harmonization),并在留出机构上验证协调增益。
参考:Schöneck et al. 2025, Life 15(1):83(本数据集清洗后 211→143 例可用);Bakr et al. 2018 Limitations。
⚠️ 坑点 4:部分掩膜包含空气或肺实质(分类:预处理陷阱)
问题:自动初分割即便经医生修正,仍存在把周围肺实质/空气并入 ROI 的案例(文献点名 R01-075、R01-069),形状与纹理特征被污染。
症状:ROI 内 HU 直方图出现 -1000 附近的空气峰;体积/表面积比异常;训练时个别样本损失异常小。
解决:
- 简单方法:逐例绘制 HU 直方图 + 三视图叠加,人工剔除空气占比超阈值的案例。
- 进阶方法:形态学开运算 + 连通域分析剥离松散外溢区域,记录改动量。
- SOTA 方法:用 nnU-Net 对 144 例掩膜做"再标注",以模型-人工不一致率作为质控分数分层保留。
参考:Schöneck et al. 2025(Figure 1 展示 R01-075/R01-069 的掩膜缺陷)。
⚠️ 坑点 5:PET 像素值不是 SUV,转换因子缺失(分类:工程陷阱)
问题:PET DICOM 像素值需经
SUV Type Conversion Factor(标签 (7053,1000),私有)换算;早期版本部分 Philips PET 缺失该标签,V4 仅补了 R01-074/077/079/089/098/137 六例。
症状:PET 特征量纲混乱,同一病灶摄取值跨厂商不可比;SUVmean 出现个位数以下或数百的异常值。
解决:
- 简单方法:检查每个 PET series 是否存在 (7053,1000),缺失即从分析中剔除该 PET。
- 进阶方法:按标准 SUV 公式从 DICOM 元数据(活度、体重、衰变时间)重算,或仅使用经 CT 衰减校正后的相对强度做深度学习输入。
- SOTA 方法:PET 仅做"有/无摄取"或二值化阈值特征,规避跨厂商量化差异。
参考:TCIA 集合页 Version 4 更新说明。
⚠️ 坑点 6:突变 Unknown 标签≠野生型(分类:标签理解)
问题:R01 队列 EGFR 未知 35 例、KRAS 未知 38 例;这些"未检测"与检测决策相关(医生认为不需要检测者),并非随机缺失,混入负类会系统性低估突变率。
症状:把 Unknown 计入野生型后 AUC 虚高或虚低不稳;不同论文报告的同一数据集基线率差异明显(EGFR 突变占比 15%-20% 区间波动)。
解决:
- 简单方法:只保留 Mutant/Wildtype 两个确定性标签,并在结果中报告有效 N。
- 进阶方法:把 Unknown 视为删失,做半监督或多实例学习;或对"是否被检测"建模(倾向得分)校正选择偏倚。
- SOTA 方法:报告"完整案例 + 意向检测"双口径结果,并做敏感性分析。
参考:Dong et al. 2021, Quant Imaging Med Surg(Table 1 明确列出 Unknown 行)。
⚠️ 坑点 7:临床日期整体平移 + 基因数据在 GEO,跨库合并有讲究(分类:工程陷阱)
问题:为匿名化,所有临床日期被逐患者平移(保持相对顺序),绝对日期失去意义;RNA-seq 又托管在 GEO(130 例),跨库 join 时还叠加 3 个测序批次(16/66/48)。
症状:按日期做季节性/队列年代特征完全失效;RNA-seq 主成分分析按批次而非按组织学分簇。
解决:
- 简单方法:只用相对间隔(如 Days between CT and surgery、生存天数),删除一切日历日期特征。
- 进阶方法:GEO 矩阵按 Subject ID 与 TCIA 对齐后,将批次作为协变量做 limma 去批次或直接纳入设计矩阵。
- SOTA 方法:影像-转录组融合前先在 RNA-seq 子集内做批次校正 + 变换稳定(log2 FPKM → z-score),再与影像特征做典型相关。
参考:Bakr et al. 2018(日期平移说明);GSE103584。
⚠️ 坑点 8:无官方划分 + 小样本,切片级切分引发患者级泄漏(分类:数据泄漏)
问题:数据集无官方划分;211 例、有效标签更少,若按切片或序列随机切分,同一患者的切片同时出现在训练与测试中,性能虚高常见 10 个百分点以上。
症状:测试 AUC 高达 0.9+ 但换队列立刻崩盘;不同论文复现结果方差极大。
解决:
- 简单方法:GroupShuffleSplit/GroupKFold 以 Subject ID 为组做患者级划分。
- 进阶方法:以 R01/AMC 队列为外层留出(跨机构泛化),内层嵌套 CV 调参;类别失衡用组内分层。
- SOTA 方法:报告"跨数据集外部验证"结果(如 NSCLC-Radiomics Lung1、Lung-PET-CT-Dx),并给出 DeLong 检验或 bootstrap 置信区间。
参考:Moreno et al. 2021(小样本集成策略);Dong et al. 2021(TCIA 作为外部验证集的范式)。
§6.6 数据增强
| 类别 | 操作 | 说明 |
|---|---|---|
| ✅ 安全 | 随机 90° 旋转、随机裁剪(以掩膜为中心)、Z-score/窗宽窗位抖动、轻度高斯噪声 | 不改变左右侧与 HU 语义 |
| ✅ 安全 | 掩膜最近邻插值、影像三线性插值的重采样 | 重采样阶段的标准操作 |
| ❌ 危险 | 水平翻转 | 改变病灶左右侧与 Tumor Location 语义 |
| ❌ 危险 | 直方图均衡/强对比度拉伸 | 破坏 HU 与影像组学可复现性 |
| ❌ 危险 | 大幅弹性形变 | 伪造毛刺/分叶等语义特征,扭曲形状特征 |
| ❌ 危险 | 对掩膜用三线性插值 | 产生非 0/1 灰度掩膜 |
增强策略的判断标准只有一条:任何改变"HU 值语义、左右侧语义、肿瘤形态语义"的算子都会同时破坏本数据集的影像组学可复现性与语义标注一致性。小样本下更实用的"增广"其实是利用两个队列与多种子下采样的重复实验,而不是激进的像素级形变。
§6.7 模型推荐
| 任务 | 推荐模型 | 起点 |
|---|---|---|
| 突变预测(CT) | 2.5D 多视图 CNN(如 9 视图 inception-attention-resnet 集成)或小样本 3D ResNet+临床特征拼接 | Dong et al. 2021;Moreno et al. 2021 |
| 突变预测(表格/组学) | PyRadiomics + 逻辑回归/XGBoost + 特征选择 | Shiri et al. 2020;Schöneck et al. 2025 |
| 肿瘤分割 | nnU-Net v2(144 例掩膜微调) | 官方框架 |
| 生存/复发建模 | Cox-PH / DeepSurv,终点 High_Risk_2yr | 2025 复发融合研究 |
| 影像-转录组融合 | 双塔编码器 + 典型相关/注意力融合 | GSE103584 子集 |
| 自监督预训练 | MoCo/SimMIM 于 144 例 CT+掩膜,再微调 | 数据量小,预训练优于从零训练 |
模型选型通用原则:211 例量级下,“预训练 + 小容量头"几乎总是优于"从头训练大模型”;凡报告深度学习结果,都应并列一个组学/临床基线以证明复杂度是必要的。
§6.8 硬件需求
| 场景 | 配置 | 说明 |
|---|---|---|
| 表格/组学实验 | CPU 8 核 + 32 GB 内存 | 无需 GPU,98 GB 影像可不下 |
| 3D CNN 训练 | 单卡 11-24 GB(RTX 3090/4090 级) | 64³ 裁剪 + batch 4-8 足够 |
| nnU-Net 分割 | 单卡 11 GB | 144 例规模 1 天内可训完 |
| 存储 | ≥ 120 GB SSD | 98 GB 解压 + NIfTI 缓存 |
| 云端替代 | Colab/Vertex + IDC 拉取 | 零本地存储,适合教学场景 |
§6.9 评估指标代码
# 突变预测评估:AUC + PR-AUC + bootstrap 置信区间(小样本必配)
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score
def evaluate(y_true, y_score, n_boot: int = 2000, seed: int = 42):
rng = np.random.default_rng(seed)
auc, ap = roc_auc_score(y_true, y_score), average_precision_score(y_true, y_score)
boots = []
for _ in range(n_boot):
idx = rng.integers(0, len(y_true), len(y_true))
if len(set(y_true[idx])) < 2:
continue
boots.append(roc_auc_score(y_true[idx], y_score[idx]))
lo, hi = np.percentile(boots, [2.5, 97.5])
return {"AUC": auc, "AUC 95% CI": (lo, hi), "PR-AUC": ap}
生存任务(复发/死亡终点)补充指标:
# C-index + 时间依赖 AUC(High_Risk_2yr 二值化终点可用普通 AUC)
from lifelines.utils import concordance_index
def cindex(durations, events, risk_scores):
return concordance_index(durations, -risk_scores, events) # 分数越高风险越大 → 取负号
# 报告规范:同时给出 C-index、High_Risk_2yr 的 AUC/ACC、以及 KM 曲线 log-rank p 值。
指标选择的两条经验:其一,AUC 对类别失衡稳健但小样本下方差大,必须配 bootstrap 区间(上例 2,000 次重采样是文献惯例);其二,PR-AUC 在正类不足 20% 时比 AUC 更能反映"找得出几个真突变",做临床导向报告时两者都应给出。
§6.10 MLOps 笔记
- 版本锚定:下载时记录 TCIA Version 4(2021-06-01)与 manifest 哈希;GEO 记录 GSE103584 下载日期,防上游静默更新。
- DICOM 质控门:入库前自动校验层厚、厂商、SEG 引用 UID 三项,生成拒绝清单。
- 配置驱动:把"有效标签定义、子集过滤器、重采样参数"写入 YAML,实验可复现。
- 数据卡:跟踪每个实验使用的有效 N(不同任务 96-201 不等),避免论文间数字错误对齐。
- DVC/MLflow:影像不进 Git,用 DVC 指针;每次运行记录子集定义与随机种子。
- 多人协作的口径守则:所有"有效子集"定义(Unknown 处理、SEG 可用性、队列选择)写入 README 并配统计脚本,团队三人以上时口径漂移几乎必然发生。
- 队列标签传播:把 R01/AMC 前缀写入每条样本的元数据,使所有实验日志、特征重要性分析都能按队列下钻,定位"机构指纹"。
- 转换产物缓存:NIfTI 与 labelmap 生成成本高,落盘后用"源 DICOM UID + 转换参数哈希"作为缓存键,避免重复转换。
- 三人成规:任何"有效子集"的定义(含 Unknown 处理、SEG 可用性、队列选择)都应写进 README 并配一个统计脚本,团队三人以上时口径漂移几乎必然发生。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 全部为手术切除患者,偏向可切除早期 NSCLC,晚期缺席 | 高 | 外推到筛查/晚期人群前必须重新验证 |
| 机构与人群偏倚 | 两家加州机构,VA 退伍军人占比高,男性 135/211 | 中 | 按队列/性别分层评估 |
| 协议异质性 | 层厚 0.625-3 mm、多厂商、未统一重建协议 | 高 | 重采样 + 协变量校正/ComBat |
| 标签缺失偏倚 | 突变"未检测"非随机(与临床决策相关) | 高 | 完整案例分析 + 检测倾向建模 |
| 标注主观性 | 语义标注有阅读者内/间变异;结节模板不适用中央型/肺炎型肿瘤 | 中 | 优先使用定量特征做下游任务 |
| 阶段性技术偏倚 | 2008-2012 采集,PET 重建(OSEM)与当代深度学习重建时代不同 | 中 | 部署前做漂移监测 |
| 随访与幸存者偏倚 | 复发随访依赖复查节奏,无复发性记录者可能被记为"未复发" | 中 | 敏感性分析:按随访时长分层重估终点 |
§7.2 标注质量
分割经双人两级复核(5 年+ 修正、20 年+ 批准),但未公布 Dice/Kappa 等定量一致性指标;自动初分割来源算法未公开,个别掩膜存在空气/实质污染(坑点 4)。语义标注由单一资深放射科医生完成,数据论文明确其主观性。基因检测使用临床级平台(SNaPshot/FISH),可信度高,但 panel 覆盖有限(EGFR 仅 4 个外显子,罕见突变可能漏检)。
由此产生两条使用纪律:其一,把 144 例掩膜当作"共识参考"而非"绝对真值",在做分割基准时结论应表述为"相对该参考的差异";其二,语义 AIM 特征适合做关联分析与弱监督信号,不建议直接作为强标签训练分类器——多篇研究已观察到语义特征与组学特征在同一队列上的预测力各有胜负。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 外部医院 CT(不同厂商/协议) | 高:纹理特征漂移 | Schöneck 2025 清洗后仅 143/211 可用;Dong 2021 外部验证 AUC 下降约 5 个百分点 |
| 筛查人群小结节 | 高:结节模板与分割针对可见肿块 | Bakr 2018 明确语义模板为结节设计、不覆盖中央型/肺炎型表现 |
| 当代 PET 重建 | 中:SUV 量化差异 | V4 专门修补 Philips SUV 转换因子缺失问题 |
| 东亚人群 EGFR 突变谱 | 高:突变基线率不同(东亚更高) | 数据集为美国湾区队列,EGFR 突变占比低于东亚报道 |
| 纵隔/中央型肿瘤 | 高:语义模板不覆盖 | Bakr 2018 明确模板为结节设计,不含肺炎型表现 |
§7.4 伦理
数据采集经斯坦福与 VA 机构 IRB 批准并取得书面知情同意;发布前经两轮 DICOM 脱敏(MIRC CTP/PACSGEAR + 上传前 CTP 复检),临床日期逐患者平移;不含面部等直接标识信息。CC BY 3.0 允许商业用途,但署名义务不可豁免。
两条边界提醒:其一,数据虽已脱敏,仍属"源自人体的研究数据",发表衍生成果时应遵守所在机构对公开人类数据二次使用的伦理申报要求;其二,若把本数据与其他队列合并分析,合并后的隐私保护等级取决于最严格的那一方,例如与受控访问数据集拼接时,整体应继承更严格的访问政策。
§7.5 公平性
种族字段仅 162 例可用且以自报类别为主;男性占比 64%,退伍军人来源进一步影响年龄与吸烟谱。东亚裔等人群的突变分布代表性不足,跨人群部署存在公平性风险,建议在论文中报告分亚组性能。
| 亚组维度 | 队列构成 | 公平性风险 | 缓解动作 |
|---|---|---|---|
| 性别 | 男 135 / 女 76 | 模型对女性结节特征欠拟合 | 分层评估 + 重加权 |
| 种族 | 仅 162 例有记录,自报类别 | 亚组样本过小,无法训练可靠子模型 | 只做描述性审计,不做子组训练 |
| 年龄 | 24-86 岁(两队列均值 67-68) | 年轻患者稀少 | 评估时按年龄分箱监控 |
| 吸烟史 | 137 烟民/25 非烟民(R01 内) | 不吸烟者 EGFR 先验不同 | 将吸烟状态纳入临床基线并报告增益 |
§7.6 数据漂移
2010 年代的 CT/PET 采集与当代低剂量筛查 CT、深度学习重建存在系统性差异;突变检测已从 SNaPshot/FISH 走向 NGS 大 panel。使用本数据训练的模型部署前应监测输入分布(层厚、厂商、人群)与标签先验漂移。
建议的漂移监控面板(部署环境):
| 监控项 | 统计量 | 告警阈值(示例) | 对应本数据集的根因 |
|---|---|---|---|
| 层厚分布 | PSI/KS 检验 | p < 0.01 或 PSI > 0.2 | 训练集 1.5 mm 占 54%,若线上以 5 mm 常规 CT 为主即触发 |
| HU 直方图 | 分位数漂移 | P10/P90 漂移 > 10 HU | 重建核/剂量的年代差异 |
| 突变先验率 | 正类率 | 与训练集差异 > 1.5 倍 | 人群/地域 EGFR 基线率不同 |
| PET 可用率 | 缺失率 | > 训练期 20 个百分点 | PET 检查流程变化(本集 PET 覆盖 95.3%) |
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 临床 CSV 一行一患者,主键 Subject ID |
| 2 | 唯一标识 | ✅ | R01-xxx/AMC-xxx 全局唯一,GEO 同名对齐 |
| 3 | 特殊字符 | ✅ | DICOM/CSV 均为标准 ASCII 字段名 |
| 4 | 重复行 | ✅ | 临床表无重复主键 |
| 5 | 缺失编码 | ⚠️ | 空值与 Unknown 混用,需自行统一 |
| 6 | 标签标识 | ✅ | 突变/复发/死亡字段显式命名 |
| 7 | 罕见类分组 | ⚠️ | ALK 阳性约 5% 级别,类别极稀疏 |
| 8 | 偏倚评估 | ✅ | 论文 Limitations 与本页 §7.1 系统覆盖 |
| 9 | 数据字典 | ✅ | Bakr 2018 Tables 3-5 + ISA 补充材料 |
| 10 | 信息性缺失解释 | ⚠️ | 未逐列说明缺失原因,需结合资源限制推断 |
| 11 | 设备记录 | ✅ | 厂商/层厚/管电压电流记录于 DICOM 与论文 Table 5 |
| 12 | 共线性 | ✅ | 临床字段独立性强;吸烟组内需自查 |
| 13 | 编码映射 | ✅ | 组织学/分期可直接映射 ICD-11/SNOMED(§2.1) |
| 14 | 时间戳处理 | ⚠️ | 日期逐患者平移,绝对时间不可用 |
| 15 | 划分建议 | ⚠️ | 无官方划分,需自行设计患者级/队列级切分 |
| 16 | 泄漏讨论 | ⚠️ | 论文未讨论;本页坑点 1/8 补齐多序列与划分泄漏 |
| 17 | 标签分布 | ⚠️ | 突变正类 <20% 且 Unknown 约 20% |
| 18 | 测量偏倚 | ⚠️ | 多协议未协调,组学特征随采集漂移 |
| 19 | 外部验证建议 | ✅ | IDC/Lung1/Lung-PET-CT-Dx 等可作外部集 |
| 20 | 版本记录 | ✅ | TCIA V1-V4 变更日志公开 |
| 21 | 预处理脚本 | ⚠️ | 官方无预处理代码,依赖社区工具链 |
| 22 | 合规要求 | ✅ | CC BY 3.0 + TCIA 使用政策,零注册门槛 |
| 23 | 多模态对齐 | ⚠️ | SEG→CT 需 UID 级手工校验;GEO 跨库合并 |
| 24 | 去标识化 | ✅ | 双轮 CTP 脱敏 + 日期平移 |
DAIMS 评分:18.5 / 24(✅ 13 项 × 1 + ⚠️ 11 项 × 0.5 + ❌ 0 项)
评分解读:18.5/24 属于"结构优秀、细节需施工"的区间。数据集在标识体系、去标识化、许可合规与版本管理上达到公开数据集的一流水准(13 项全绿),失分集中在"无官方划分、无预处理脚本、多模态对齐靠手工、缺失语义需推断"这些工程友好度维度——这正是一线研究者在小样本多模态数据上最常见的实际负担。
对你意味着什么:(1) 直接把临床 CSV + 影像挂上项目前,先跑一遍坑点 1/2/5 对应的 UID、SEG 与 SUV 校验,能省掉 80% 的"结果诡异"排查;(2) 划分和预处理没有官方件,把本页 §6.3/§6.4 的管线与 §5.3 的患者级/队列级划分当成起跑线并在论文中写明自定义口径;(3) 突变标签必须按"Mutant/Wildtype/Unknown"三态处理并报告有效 N;(4) 想要"开箱即训"的丝滑体验,请选 IDC 云端入口或 Zenodo BAMF 分割补充包。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| TCIA NSCLC-Radiogenomics(162 例) | 太原理工/山西省肿瘤医院(内部 363 例训练) | EGFR/KRAS 突变预测 | 外部 AUC 0.813 / 0.742 | 较内部 AUC 0.866 下降约 5 个百分点 | 跨中心泛化可行但一致性衰减(Dong et al. 2021) |
| 自有 68 例独立验证集 | Shiri et al. 多模态队列 | EGFR/KRAS 预测 | AUC≈0.75(CT) | — | PET 加入未增益(Shiri et al. 2020) |
| 内部队列 ↔ TCIA 双向 | 科隆大学医院 + TCIA | KRAS 识别 | 五折 CV + 交叉验证 | 显著(两域分布差异) | 协议协调是跨库前提(Schöneck et al. 2025) |
| TCIA 内部小样本集成 | 南美/南佛罗里达团队 | EGFR/KRAS 预测 | EGFR CNN AUC 0.846 | 集成后 ACC +5.7 个百分点 | SCAV 投票缓解小样本不稳(Moreno et al. 2021) |
§8 基准性能与生态
§8.1 突变预测基准(使用本数据集或以其为外部验证)
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | CNN 集成 + SCAV 投票 | EGFR AUC 0.846 / ACC 0.857 | 2021 | 多 CNN 基模型 + Selective Class Average Voting | Moreno, S. et al., Tomography 7(2):154-168, 2021. DOI: 10.3390/tomography7020014 | 未公开 |
| 2 | MMDL 多通道多任务网络(外部验证于本数据集) | EGFR AUC 0.813 / KRAS AUC 0.742(TCIA 162 例验证) | 2021 | 9 视图 inception-attention-resnet + 自适应加权多任务 | Dong, Y. et al., Quantitative Imaging in Medicine and Surgery, 2021. DOI: 10.21037/qims-20-600 | 未公开 |
| 3 | CT 放射组学 + 逻辑回归 | EGFR/KRAS AUC≈0.75 | 2020 | K-Best+方差阈值特征选择;PET 加入后≈0.74 | Shiri, I. et al., Molecular Imaging and Biology 22(4):1132-1148, 2020. DOI: 10.1007/s11307-020-01487-8 | 未公开 |
| 4 | 放射组学 ML pipeline | KRAS 特征显著差异 + 跨库验证 | 2025 | PyRadiomics + 5 折 CV;清洗后 143 例 | Schöneck, M. et al., Life 15(1):83, 2025. DOI: 10.3390/life15010083 | 未公开 |
⚠️ 上表数值不可直接比较:各研究的训练/验证子集定义(R01 全体、有分割交集、清洗后交集)、终点二值化(Unknown 处理)与交叉验证协议均不同,且样本量普遍不足 200,置信区间宽。
§8.2 SOTA 总结与选型建议
EGFR 非侵入预测的公开最优水平稳定在 AUC 0.75-0.85 区间,KRAS 略低;加入临床特征(性别、吸烟)普遍 +3-5 个百分点。复现建议:先做"PyRadiomics + 逻辑回归"基线(一天可完成),再上 2.5D/3D CNN;把"影像 only"与"影像+临床"双口径写入报告,并始终用患者级组划分。
选型决策树:
- 只有 CPU / 一天内要结果 → 临床特征 + PyRadiomics 形状/纹理特征 + 逻辑回归(Shiri 2020 范式)。
- 单卡 GPU / 追复现数字 → 2.5D 九视图 CNN(Dong 2021 范式)或 CNN 集成 + SCAV(Moreno 2021 范式)。
- 目标是方法学创新 → 影像-转录组双塔融合(GSE103584 子集 130 例)或生存-突变多任务学习。
- 目标是落地 → 把本数据集只当外部验证集之一,主体训练数据必须来自目标人群。
- 任何路线的共同底线 → 患者级划分 + Unknown 三态处理 + bootstrap 区间,缺一不可(对应坑点 6/8 与 §6.9)。
- 组学特征路线的附加底线 → 特征提取参数(bin 宽、重 segmentation 区间、插值)必须写进论文附录,否则跨研究比较无从谈起。
§8.3 评测协议
社区默认协议:(1) 子集 = 有分割 + 有突变标签;(2) Unknown 样本剔除并报告有效 N;(3) 5 折患者级交叉验证(按组织学/队列分层)或 R01 训练-AMC 留出;(4) 指标 AUC + ACC + 敏感度/特异度 + PR-AUC;(5) 重采样与特征提取参数(PyRadiomics 默认或 IBSI 对齐)随论文公开。生存任务通用终点为 High_Risk_2yr(2 年内复发)与总生存 C-index。
以"Dong et al. 2021 外部验证协议"为蓝本的复现清单:
- 训练集:自有或公开队列(原文 363 例),测试集固定为本数据集的 R01 162 例;
- 标签:EGFR 取 Mutant/Wildtype(未知 35 例不进测试),KRAS 同理;
- 输入:CT 瘤区裁剪 + 9 视图(或等效三平面),1 mm 各向同性重采样;
- 指标:验证集 AUC/ACC/SEN/SPE/F1 全套报告(原文 EGFR AUC 81.29%、ACC 75.06%);
- 消融: clinical-only / radiomics-only / deep-learning 三条基线并列;
- 随机种子与划分索引随代码发布,保证第三方可复算。
- 独立测试集若来自其他机构,应同时报告协议元数据(厂商/层厚/重建核),便于归因性能衰减;
- 全部比较基于同一套预测分数文件,禁止按"最好的一折"选择性汇报。
补充约束:R01 162 例中实际"有分割且标签确定"者不足此数,若你的复现不依赖分割掩膜(如全肺多实例学习),可使用全部 162 例;两套口径的数字不可混排在同一张表里。
§8.4 相关数据集
| 数据集 | 与本数据集关系 | 互补点 |
|---|---|---|
| NSCLC-Radiomics(Lung1,422 例) | 同为 TCIA NSCLC 影像组学队列 | 治疗人群 + 生存金标准,可作生存任务外部验证 |
| LIDC-IDRI(1,018 例) | 分割金标准 | 大规模多医生标注,适合预训练分割骨干 |
| Lung-PET-CT-Dx | CT/PET + 病理结节标注 | 补充结节检出与病理关联 |
| TCGA-LUAD/LUSC | 深度分子谱 | 无配对 CT,但可作转录组通路先验来源 |
| GSE103584 / GSE28827 | 本数据集的基因侧本体 | 官方指定托管处 |
| NLST 筛查队列 | 低剂量 CT 大规模人群 | 作"手术队列 → 筛查人群"泛化的对照边界参考 |
组合使用建议:分割任务"LIDC-IDRI 预训练 → 本集 144 例微调"是性价比最高的路径;突变任务"本集做外部验证之一"比"本集做主训练"更能经受审稿检验;转录组分析建议与 TCGA-LUAD 通路数据库联动,把 130 例样本放进已知通路框架解释,而非从头做全基因组挖掘。
§8.5 关键论文 Top 7
- Bakr, S. et al. A radiogenomic dataset of non-small cell lung cancer. Scientific Data 5:180202 (2018). DOI: 10.1038/sdata.2018.202 — 数据集官方描述论文。
- Aerts, H.J.W.L. et al. Decoding tumour phenotype by noninvasive imaging using a quantitative radiomics approach. Nature Communications 5:4006 (2014). DOI: 10.1038/ncomms5006 — 影像组学奠基方法,本数据集组学分析的方法学源头。
- Lambin, P. et al. Predicting outcomes in radiation oncology—multifactorial decision support systems. Nature Reviews Clinical Oncology 10:27-40 (2013) — 提出"决策支持需多因子输入"的框架背景。
- Dong, Y. et al. Multi-channel multi-task deep learning for predicting EGFR and KRAS mutations of NSCLC on CT images. Quantitative Imaging in Medicine and Surgery (2021). DOI: 10.21037/qims-20-600 — 以本数据集为外部验证的深度学习范式。
- Moreno, S. et al. A Radiogenomics Ensemble to Predict EGFR and KRAS Mutations in NSCLC. Tomography 7(2):154-168 (2021). DOI: 10.3390/tomography7020014 — 小样本集成与 SCAV 投票。
- Shiri, I. et al. Next-Generation Radiogenomics Sequencing for Prediction of EGFR and KRAS Mutation Status in NSCLC Patients Using Multimodal Imaging and Machine Learning Algorithms. Molecular Imaging and Biology 22(4):1132-1148 (2020). DOI: 10.1007/s11307-020-01487-8 — CT vs PET 特征贡献系统比较。
- Schöneck, M. et al. Machine Learning-Based Radiomics Analysis for Identifying KRAS Mutations in NSCLC from CT Images. Life 15(1):83 (2025). DOI: 10.3390/life15010083 — 数据清洗与掩膜缺陷的系统披露。
- 多模态影像组学融合预测 NSCLC 术后复发研究. Journal of Cancer Research and Clinical Oncology (2025). DOI: 10.1007/s00432-025-06311-w — 以 R01 队列复发终点(High_Risk_2yr)为任务的 CT+PET 融合范式。
§8.6 社区活跃度
TCIA 集合页统计 18.9k 次浏览、数据 DOI 被引用 90+ 次(截至 2026-09);论文 PMCID PMC6190740 开放获取。社区讨论主要通过 TCIA Helpdesk 与 IDC 论坛进行;Hugging Face 等镜像(如 MedOtter/NSCLC-Radiogenomics)与 Zenodo BAMF 分割社区是二次分发最活跃的两处。
活跃度特征:本数据集没有 Papers with Code 独立排行榜,社区产出以"作为验证队列出现在方法论论文中"为主流形态;2020-2025 年间每年都有新论文以其为内部或外部验证集(突变预测、复发预测、特征协调等方向)。对使用者而言,这意味着"最新 SOTA"更多散落在期刊而非统一榜单,跟踪建议以 Google Scholar 引用本数据集 DOI 的最新论文为线索。跟踪时区分两类引用:方法论文(把本集当验证队列)与数据论文(描述本集本身),引用价值以前者为主。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| TCIA 集合页 | 官方主页 | https://www.cancerimagingarchive.net/collection/nsclc-radiogenomics/ | 版本日志、下载与引用格式 |
| NCI Imaging Data Commons | 云镜像 | https://imaging.datacommons.cancer.gov/ | BigQuery/GCS 按需取数 |
| NBIA Data Retriever | 下载工具 | TCIA 官网 Download 页 | manifest 驱动的官方下载器 |
| NCBI GEO GSE103584 | 基因数据 | https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE103584 | RNA-seq 130 例矩阵与 SRA |
| NCBI GEO GSE28827 | 基因数据 | https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE28827 | 微阵列 26 例 |
| Zenodo BAMF 社区 | 补充分割 | TCIA 页 External Resources 入口 | AIMI Annotations AI 生成分割 |
| PyRadiomics | 特征工具 | https://github.com/AIM-Harvard/pyradiomics | 影像组学事实标准 |
| dcmqi / pydicom-seg | SEG 转换 | https://qiicr.org/dcmqi/ | DICOM SEG → NIfTI |
| ePAD | 标注平台 | https://epad.stanford.edu/ | 语义标注与分割修正的原始工具 |
| TCIA Helpdesk / 论坛 | 社区支持 | https://www.cancerimagingarchive.net/ 首页入口 | 数据问题官方答疑渠道 |
| 3D Slicer | 可视化/QC | https://www.slicer.org/ | DICOM+SEG 叠加质控与 NIfTI 导出 |
| ITK-SNAP | 可视化/QC | http://www.itksnap.org/ | 配准与掩膜校验(2025 复发研究使用) |
生态判断:本数据集没有专属的官方 GitHub 仓库(区别于 PhysioNet 系数据集),其"官方工具链"事实上由 TCIA 通用工具(NBIA、ePAD)+ 社区通用库(PyRadiomics、dcmqi)构成。这意味着工具链的版本漂移全部由使用者自行管理,也意味着升级自由度更高——选择哪种组合完全取决于项目需要,而非官方绑定。
§9 相关资源与引用
§9.1 官方资源
- 集合主页与版本日志:TCIA NSCLC-Radiogenomics
- 数据论文全文(开放获取):Scientific Data 5:180202(PMCID: PMC6190740)
- 转录组数据:GSE103584、GSE28827
- 云端访问:NCI Imaging Data Commons;NCI Cancer Research Data Commons(CRDC)
- 数据使用政策:TCIA Data Usage Policy
- ISA 补充材料:论文页 sdata2018202-isa1.zip(采集与处理元数据的结构化描述)
§9.2 工具与教程
- NBIA Data Retriever(manifest 下载)
- dcmqi 与 pydicom-seg(DICOM SEG 转换)
- PyRadiomics(特征提取)、3D Slicer(可视化质控)
- Hugging Face MedOtter 镜像(含 SEG-CT 配对说明)
- TCIA 数据使用政策与引用要求(投稿前的合规自查清单)
- TCIA API 文档(程序化检索集合元数据)
§9.3 BibTeX 引用块
@article{bakr2018radiogenomic,
title = {A radiogenomic dataset of non-small cell lung cancer},
author = {Bakr, Shaimaa and Gevaert, Olivier and Echegaray, Sebastian and
Ayers, Kelsey and Zhou, Mu and Shafiq, Majid and Zheng, Hong and
Benson, Jalen Anthony and Zhang, Weiruo and Leung, Ann N C and
Kadoch, Michael and Hoang, Chuong D and Shrager, Joseph and
Quon, Andrew and Rubin, Daniel L and Plevritis, Sylvia K and
Napel, Sandy},
journal = {Scientific Data},
volume = {5},
pages = {180202},
year = {2018},
doi = {10.1038/sdata.2018.202}
}
@misc{bakr2017tcia,
title = {Data for NSCLC Radiogenomics (Version 4) [Data set]},
author = {Bakr, S. and Gevaert, O. and Echegaray, S. and Ayers, K. and
Zhou, M. and Shafiq, M. and Zheng, H. and Zhang, W. and
Leung, A. and Kadoch, M. and Shrager, J. and Quon, A. and
Rubin, D. and Plevritis, S. and Napel, S.},
year = {2021},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/K9/TCIA.2017.7hs46erv}
}
@article{dong2021multichannel,
title = {Multi-channel multi-task deep learning for predicting {EGFR} and
{KRAS} mutations of non-small cell lung cancer on {CT} images},
author = {Dong, Yunyun and Hou, Lina and Yang, Wenkai and Han, Jiahao and
Wang, Jiawen and Qiang, Yan and Zhao, Juanjuan and Hou, Jiaxin and
Song, Kai and Ma, Yulan and Kazihise, Ntikurako Guy Fernand and
Cui, Yanfen and Yang, Xiaotang},
journal = {Quantitative Imaging in Medicine and Surgery},
year = {2021},
doi = {10.21037/qims-20-600}
}
@article{moreno2021ensemble,
title = {A Radiogenomics Ensemble to Predict {EGFR} and {KRAS} Mutations
in {NSCLC}},
author = {Moreno, Silvia and Bonfante, Mario and Zurek, Eduardo and
Cherezov, Dmitry and Goldgof, Dmitry and Hall, Lawrence and
Schabath, Matthew},
journal = {Tomography},
volume = {7},
number = {2},
pages = {154--168},
year = {2021},
doi = {10.3390/tomography7020014}
}
@article{shiri2020nextgen,
title = {Next-Generation Radiogenomics Sequencing for Prediction of {EGFR}
and {KRAS} Mutation Status in {NSCLC} Patients Using Multimodal
Imaging and Machine Learning Algorithms},
author = {Shiri, Isaac and Salavati, Moones and Rajaei, Hamid and
Arabi, Hossein and Zaidi, Habib},
journal = {Molecular Imaging and Biology},
volume = {22},
number = {4},
pages = {1132--1148},
year = {2020},
doi = {10.1007/s11307-020-01487-8}
}
@article{schoeneck2025kras,
title = {Machine Learning-Based Radiomics Analysis for Identifying {KRAS}
Mutations in Non-Small-Cell Lung Cancer from {CT} Images:
Challenges, Insights and Implications},
author = {Sch{\"o}neck, Mirjam and Rehbach, Nicolas and
Lotter-Becker, Lars and Persigehl, Thorsten and
Lennartz, Simon and Lourenco Caldeira, Liliana},
journal = {Life},
volume = {15},
number = {1},
pages = {83},
year = {2025},
doi = {10.3390/life15010083}
}
§9.4 引用指南
使用本数据集时必须在成果中同时署名:(1) 数据论文 Bakr et al. 2018;(2) 数据集本身 “Bakr, S. et al. Data for NSCLC Radiogenomics (Version 4) [Data set]. The Cancer Imaging Archive (2021). DOI: 10.7937/K9/TCIA.2017.7hs46erv”。使用 GEO 转录组子集时请同时引用对应 GEO 编号。如使用 IDC 云镜像或 Zenodo BAMF 分割,须追加相应来源署名。
署名示例(论文数据节可直接粘贴):
Data: Bakr, S. et al. Data for NSCLC Radiogenomics (Version 4) [Data set].
The Cancer Imaging Archive (2021). DOI: 10.7937/K9/TCIA.2017.7hs46erv
Paper: Bakr, S. et al. A radiogenomic dataset of non-small cell lung cancer.
Scientific Data 5:180202 (2018). DOI: 10.1038/sdata.2018.202
Transcriptomics subset: NCBI GEO GSE103584 (n=130) / GSE28827 (n=26).
§10 AI 使用声明卡
§10.1 AI 模型列表
本页面在撰写过程中使用了大语言模型辅助(代码生成、结构化整理、多语言表达润色),核心数据与结论均来自 §10.3 所列公开文献与官方文档。页面内没有使用任何 AI 生成影像、AI 合成病例数据或 AI 推断的统计数字。
§10.2 AI 参与范围
AI 参与了初稿起草、代码示例生成、表格结构化与格式统一;事实核查、数字溯源、医学与工程审核由人工完成。所有关键数字均有内联来源链接。AI 未参与任何原始数据的产生、修改或标注,页面对数据集的描述不构成对数据本身的二次加工。
§10.3 输入来源列表
- Bakr, S. et al. A radiogenomic dataset of non-small cell lung cancer. Scientific Data 5:180202 (2018). DOI: 10.1038/sdata.2018.202
- Bakr, S. et al. Data for NSCLC Radiogenomics (Version 4) [Data set]. The Cancer Imaging Archive (2021). DOI: 10.7937/K9/TCIA.2017.7hs46erv
- TCIA 集合页(NSCLC-Radiogenomics,含 Version 4 变更日志与集合统计). https://www.cancerimagingarchive.net/collection/nsclc-radiogenomics/
- NCBI GEO Series GSE103584(NSCLC RNA-seq,130 例). https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE103584
- NCBI GEO Series GSE28827(NSCLC 基因表达微阵列,26 例). https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE28827
- Napel, S. & Plevritis, S.K. NSCLC Radiogenomics 前身影像(26 例). The Cancer Imaging Archive (2014). DOI: 10.7937/K9/TCIA.2014.X7ONY6B1
- Dong, Y. et al. Multi-channel multi-task deep learning for predicting EGFR and KRAS mutations of NSCLC on CT images. Quant Imaging Med Surg (2021). DOI: 10.21037/qims-20-600
- Moreno, S. et al. A Radiogenomics Ensemble to Predict EGFR and KRAS Mutations in NSCLC. Tomography 7(2):154-168 (2021). DOI: 10.3390/tomography7020014
- Shiri, I. et al. Next-Generation Radiogenomics Sequencing… Molecular Imaging and Biology 22(4):1132-1148 (2020). DOI: 10.1007/s11307-020-01487-8
- Schöneck, M. et al. Machine Learning-Based Radiomics Analysis for Identifying KRAS Mutations… Life 15(1):83 (2025). DOI: 10.3390/life15010083
- 多模态影像组学融合预测 NSCLC 术后复发研究. Journal of Cancer Research and Clinical Oncology (2025). DOI: 10.1007/s00432-025-06311-w
- WHO Lung Cancer Fact Sheet(2022 全球肺癌负担与 NSCLC 占比). https://www.who.int/news-room/fact-sheets/detail/lung-cancer
- IARC Press Release 359:Global lung cancer incidence according to subtype(2025). https://www.iarc.who.int/wp-content/uploads/2025/02/pr359_E.pdf
- Hugging Face 镜像 MedOtter/NSCLC-Radiogenomics(SEG-CT 配对与加载说明). https://huggingface.co/datasets/MedOtter/NSCLC-Radiogenomics
- dcmqi / pydicom-seg 工具文档(DICOM SEG 转换). https://qiicr.org/dcmqi/
- WHO ICD-11 浏览器(2C25 系列编码)与 SNOMED CT International Edition(254637007 等术语). https://icd.who.int/
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED/流行病学) | 千方病案医学编辑部 | 与 WHO ICD-11 浏览器、SNOMED CT 术语源及 WHO/IARC 公开统计交叉核对 | ✅ 已通过 |
| §3-§4 数据规格与字段字典 | 千方病案医学编辑部(数据工程) | 与 Bakr 2018 Tables 3-5、TCIA 集合页元数据逐项核对 | ✅ 已通过 |
| §6 预处理代码与坑点 | 千方病案医学编辑部(数据工程) | 代码骨架运行级审查;坑点逐条溯源到论文/TCIA/镜像文档 | ✅ 已通过 |
| §7 质量评估与 DAIMS | 千方病案医学编辑部 | 与论文 Limitations、社区复现报告交叉验证 | ✅ 已通过 |
| §8 基准数字 | 千方病案医学编辑部 | 逐条核对原始论文摘要/表格 | ✅ 已通过 |
| §9-§10 引用与声明 | 千方病案医学编辑部 | DOI/GEO 编号逐一点击验证 | ✅ 已通过 |
§10.5 AI 生成章节标注
§1.0/§1.2 的叙事性段落与 §6 代码骨架由 AI 辅助起草,经人工逐行校订;其余章节由 AI 结构化整理人工提供的核实事实。所有由 AI 生成的中间内容在进入发布版前均通过 §10.4 所列人工校验流程;任何无法溯源到 §10.3 输入来源的句子已在审校阶段删除。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
