信息速览

Lung-PET-CT-Dx — 肺癌 PET/CT 双模态诊断数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Lung-PET-CT-Dx |
| 英文全称 | Lung Computed Tomography and Positron Emission Tomography for Diagnosis of Lung Cancer |
| 别名/简称 | Lung-PET-CT-Dx、Lung PET CT Dx(TCIA Collection 名) |
| 疾病分类 | 支气管或肺恶性肿瘤(ICD-11:2C25 总类;2C25.0 腺癌 / 2C25.1 小细胞癌 / 2C25.2 鳞状细胞癌 / 2C25.3 大细胞癌,详见 §2.1) |
| SNOMED CT | 93880001 肺原发恶性肿瘤 / 254626006 肺腺癌 / 254632001 肺小细胞癌 / 254634000 肺鳞状细胞癌 / 254637007 非小细胞肺癌(详见 §2.1b) |
| 数据模态 | CT + PET(同机 PET/CT,18F-FDG) |
| AI 任务类型 | 肺癌病灶检测、组织学亚型分类、PET/CT 多模态融合、影像组学特征提取 |
| 样本总数 | 355 例受试者 / 436 个检查(Study)/ 1,295 个序列 / 251,135 幅图像 |
| 数据大小 | 127.18 GB(DICOM 影像)+ 16.5 MB(标注 XML)+ 35.94 KB(临床 XLSX) |
| 数据格式 | DICOM、PASCAL VOC XML、XLSX |
| 许可证 | CC BY 4.0(影像、标注 XML、临床 XLSX 三项资源一致) |
| 访问级别 | 开放(TCIA Data Retriever 直接下载,需署名并引用 DOI) |
| DUO 标签 | GRU(通用研究使用;依 CC BY 4.0 署名要求) |
| 首发日期 | 2020(DOI 注册年份) |
| 最后更新 | 2020-12-22(Version 5) |
| 发布机构 | 哈尔滨医科大学第二附属医院(采集);TCIA / NCI IDC(托管) |
| 官方主页 | https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/ |
| 下载地址 | https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/(经 TCIA Data Retriever) |
| DOI | 10.7937/TCIA.2020.NNC2-0461 |
| 引用次数 | 58+(TCIA 官方统计,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 标注质量高、License 开放、影像规格完整;扣分项:无官方数据划分、无端到端预处理脚本、需自行解析 XML 逐层边界框并处理 PET/CT 分辨率差异 |
| 页面状态 | published |
§0 E-E-A-T 与免责声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 2C25 族编码、SNOMED CT 映射、肺癌流行病学数字)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Lung-PET-CT-Dx 的影像、标注 XML 与临床数据表均以 CC BY 4.0 发布,使用时必须署名并附带数据集 DOI(10.7937/TCIA.2020.NNC2-0461)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? Lung-PET-CT-Dx 是一个同时包含 PET 与 CT 两种影像的肺癌公开数据集,托管于美国癌症影像档案(TCIA)。它收录了 355 名患者的 PET/CT 扫描,每名患者的癌症类型都经过活检病理确认,分为腺癌、鳞状细胞癌、小细胞癌和大细胞癌四类,并配有放射科医生逐层勾画的病灶边界框和一份临床数据表。
为什么重要? 肺癌是全球和中国发病与死亡人数最高的恶性肿瘤之一(2022 年全球新发 248.1 万、中国新发 106.1 万)。多数公开肺癌影像数据集只有 CT,而 PET 能反映病灶的代谢活性,是临床鉴别诊断与分期的重要手段。该数据集把 PET、CT、病理亚型和逐层病灶标注配齐在同一批患者上,为多模态 AI 研究提供了稀缺的训练资源。
我能用它做什么? 训练和评测肺癌病灶检测模型(输出边界框)、四类组织学亚型的分类器、PET/CT 融合网络,或把该数据集当作跨队列外部验证的基准。数据以 CC BY 4.0 开放,商用研究也可使用,只需署名并引用官方 DOI。
§1.1 摘要
Lung-PET-CT-Dx 由哈尔滨医科大学第二附属医院回顾性采集:入组临床疑似肺癌、接受标准肺活检并完成 18F-FDG PET/CT 显像的患者,共 355 例。每例包含 CT(512×512 像素、约 1 mm 面内分辨率、肺窗与纵隔窗重建)与 PET(200×200 像素、约 4.07 mm 面内分辨率、与 CT 层数相同)两条 DICOM 序列,总计 436 个检查、1,295 个序列、251,135 幅图像。四类亚型受试者数为腺癌 251、鳞状细胞癌 61、小细胞癌 38、大细胞癌 5,亚型信息均经活检组织病理确诊,并编码于受试者 ID 的字母后缀。标注由 5 名胸部放射科医生(2 名年资超过 15 年、其余超过 5 年)两阶段完成:1 人勾画、4 人核验,输出 PASCAL VOC XML 格式的逐层边界框。数据集当前版本为 Version 5(2020-12-22),该版本为全部 355 例补充了临床数据,并按提交方判定移除了 8 例需进一步检查的受试者。官方基线由 2 名深度学习研究者训练多个检测模型,验证集 mAP 约 0.87。
§1.2 战略价值
维度一:PET/CT 多模态的稀缺性。 公开肺癌影像资源以纯 CT 为主(如 LIDC-IDRI、NSCLC-Radiomics),同时保留 PET 与 CT、且逐层对齐、共享同一批病理确诊患者的开放数据集极少。Lung-PET-CT-Dx 的 PET 与 CT 来自同一台设备的同次显像、层数一致,使逐层融合、代谢-形态关联分析等任务无需繁琐的跨设备配准即可开展。对多模态学习研究者而言,这是把"代谢信息"引入检测与分类任务的直接入口。
维度二:病理确认的标签可靠性。 数据集的亚型标签来自活检组织病理,而非影像回顾判读;边界框由 5 名放射科医生两阶段标注并核验。标签链条"影像 → 边界框 → 病理亚型"完整可追溯,使其在"影像表型 ↔ 分子/组织学表型"关联研究中比纯影像回顾标注的数据集更具公信力,也常被用作其他队列(如 NSCLC-Radiomics、NSCLC-Radiogenomics)外部验证的训练源。
维度三:低门槛许可与可复用生态。 三项资源(影像、标注、临床表)统一 CC BY 4.0,无需注册、培训或签署协议即可下载,显著降低了课程设计、论文复现与产品原型验证的合规成本。围绕数据集已形成可用生态:官方推荐 pascal-voc-tools 解析库与可视化示例、NCI IDC 提供云端浏览、Zenodo 有两套第三方派生标注可作交叉参照,公开检测基线(官方 mAP≈0.87 与三篇 YOLO 系论文)为复现提供了锚点。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 差异化 |
|---|---|---|---|---|
| Lung-PET-CT-Dx | 355 例 / 251,135 幅 | CT + PET(同机同次) | PASCAL VOC XML 逐层边界框(5 名放射科医生两阶段) | 四类恶性亚型均经活检病理确诊,含 PET 代谢信息与临床数据表 |
| LIDC-IDRI | 1,018 例 | CT | 4 名放射科医生两阶段标注(结节轮廓与恶性度评分) | 肺筛查结节基准,无 PET,亚型未经病理逐一确诊 |
| NSCLC-Radiomics | 422 例 | CT | 病灶分割轮廓 + 影像组学特征 | NSCLC 预后与组学建模,无 PET |
| NSCLC-Radiogenomics | 211 例 | CT + 分子谱 | 影像特征 + 基因组关联 | 影像基因组学,无逐层病灶框 |
对比要点:本数据集的独特位置是"同机 PET/CT + 病理亚型 + 逐层框"三者齐备;若研究只需要大规模 CT 结节检测,LIDC-IDRI 体量更大;若只需要组学建模,NSCLC-Radiomics 自带特征表更省事。选数据集先看任务需要的监督信号,再看规模。
§1.4 版本时间轴
| 时间 | 版本 | 事件 |
|---|---|---|
| 2020 | 初版 | 数据集发布,DOI 10.7937/TCIA.2020.NNC2-0461 注册于 TCIA |
| 2020-12-22 | Version 5(当前) | 为全部 355 例受试者补充临床数据表;因提交方判定需进一步检查而移除 8 例受试者 |
§1.5 典型应用场景
- 肺癌病灶检测基准:以 XML 逐层边界框为监督,训练/评测 YOLO、Faster R-CNN、DETR 等检测器,官方基线 mAP 约 0.87 可作参照。
- 组织学亚型分类:以 ID 字母后缀为标签(A/B/E/G),做影像级四分类,或结合病灶区域特征提升亚型判别。
- PET/CT 融合建模:利用同机同层对齐特性,研究代谢-形态融合特征对检测与分类的增益。
- 跨队列外部验证:把在本数据集训练的模型迁移到 NSCLC-Radiomics(422 例)、NSCLC-Radiogenomics(211 例)等公开队列,评估泛化性(已有同行评审先例)。
- 影像组学特征研究:在病理确认的亚型队列上提取 CT/组学特征,探索影像-组织学关联。
- 教学与基准教学:数据规模适中(127 GB 级)、标签结构清晰,适合作为医学影像检测课程的实战数据集;配合官方可视化代码可在一节课内完成"下载→解析→可视化"闭环。
§2 医学背景与术语映射
§2.1 ICD-11 编码映射
数据集覆盖的四类亚型均属 ICD-11 第 2C25 族"支气管或肺恶性肿瘤":
| 标签(受试者后缀字母) | 例数 | ICD-11 编码 | ICD-11 名称 |
|---|---|---|---|
| 腺癌(A) | 251 | 2C25.0 | 支气管或肺腺癌 |
| 小细胞癌(B) | 38 | 2C25.1 | 支气管或肺小细胞癌 |
| 鳞状细胞癌(G) | 61 | 2C25.2 | 支气管或肺鳞状细胞癌 |
| 大细胞癌(E) | 5 | 2C25.3 | 支气管或肺大细胞癌 |
| (参考)总类 | 355 | 2C25 | 支气管或肺恶性肿瘤 |
| (参考,本数据集未含)原位癌 | 0 | 2E62.2 | 支气管或肺原位癌 |
| (参考,本数据集未含)神经内分泌肿瘤 | 0 | 2C25.4 | 支气管或肺类癌/神经内分泌肿瘤 |
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 腺癌 | 2C25.0 | 254626006 | Pulmonary adenocarcinoma(肺腺癌) |
| 小细胞癌 | 2C25.1 | 254632001 | Small cell carcinoma of lung(肺小细胞癌) |
| 鳞状细胞癌 | 2C25.2 | 254634000 | Squamous cell carcinoma of lung(肺鳞状细胞癌) |
| 大细胞癌 | 2C25.3 | 254637007 | Non-small cell lung cancer(NSCLC;大细胞癌无独立专码时归入 NSCLC 节点) |
| 肺原发恶性肿瘤(总类) | 2C25 | 93880001 | Primary malignant neoplasm of lung(肺原发恶性肿瘤) |
| 肺恶性肿瘤 | — | 363358000 | Malignant tumor of lung(肺恶性肿瘤) |
§2.2 疾病简介与流行病学
肺癌起源于支气管黏膜或腺上皮,按组织学分为非小细胞肺癌(NSCLC)与小细胞肺癌(SCLC)两大类。NSCLC 约占肺癌的 80–85%,其中腺癌约 40%、鳞状细胞癌 25–30%、大细胞癌 10–15%;SCLC 约占 13–15%(Merck Manual)。腺癌多为外周型病灶、与吸烟及不吸烟人群均相关;鳞癌与小细胞癌与吸烟史关联更强;大细胞癌为除外性诊断,占比较低。Lung-PET-CT-Dx 仅收录恶性亚型,不含良性结节对照,这一点在构建"良恶性鉴别"任务时必须注意。
流行病学上,据 GLOBOCAN 2022 估计,2022 年全球肺癌新发约 248.1 万例、死亡约 181.7 万例,居恶性肿瘤发病与死亡首位;中国同年肺癌新发约 106.1 万例、死亡约 73.3 万例,同样是发病率与死亡率最高的癌种。低剂量 CT 筛查已被证明能降低高危人群肺癌死亡率,而 PET/CT 在临床中用于病灶代谢评估、分期与治疗方案决策——这正是该数据集两种模态并存的临床背景。
从影像学角度,四类亚型的典型表现各有侧重:腺癌常表现为外周磨玻璃影或混合磨玻璃结节,代谢升高程度与实性成分相关;鳞状细胞癌多为中心型肿块,常伴阻塞性肺炎与中央坏死;小细胞癌进展快,典型表现为肺门/纵隔大肿块伴广泛淋巴结肿大;大细胞癌多为外周大肿块、坏死常见,影像表现缺乏特异性,这正是其病理确诊不可替代的原因。需要强调的是,上述描述为教科书级典型模式,实际病灶表现谱系宽,模型应学习分布而非记忆典型征象。
§2.3 临床任务定义
- 病灶检测(主要任务):在 CT(或 PET)逐层影像上定位肺癌病灶并输出边界框;标注为逐层边界框而非三维分割,模型输出粒度应与之一致。
- 亚型分类:对受试者级影像预测四类组织学亚型(腺癌/小细胞癌/大细胞癌/鳞癌)。注意本数据集无良性对照,不能直接用于"结节良恶性鉴别"任务。
- 分期与预后:数据集未提供 TNM 分期与生存结局字段,相关任务需外接其他资源。
- 多模态融合:PET 提供代谢信息(摄取程度),CT 提供形态信息;两序列同机采集、层数一致,适合做逐层特征融合研究。
任务与标注的对应关系:
| 任务 | 输入粒度 | 输出形式 | 对应监督来源 |
|---|---|---|---|
| 病灶检测 | 单层 CT(或 PET) | 边界框 + 类别/前景 | PASCAL VOC XML object/bndbox |
| 亚型分类 | 受试者级影像 | 4 类概率向量 | 受试者 ID 后缀字母(A/B/E/G) |
| 多模态融合 | 同层 CT+PET | 检测或分类结果 | XML 边界框 + ID 字母 |
| 影像组学 | 病灶 ROI | 特征向量/风险评分 | 边界框内区域 + 病理亚型 |
§2.4 患者人群
| 维度 | 内容 |
|---|---|
| 来源机构 | 哈尔滨医科大学第二附属医院(中国黑龙江省哈尔滨市,单中心) |
| 入组方式 | 回顾性队列:临床疑似肺癌、行标准肺活检并完成 18F-FDG PET/CT 显像 |
| 确诊方式 | 活检组织病理学确诊组织学亚型 |
| 年龄/性别分布 | 官方页面未公开汇总统计 |
| 种族/地域 | 中国东北单中心人群,官方未公开细分 |
| 就医类型 | 因疑似肺癌就诊并行活检与 PET/CT 的患者 |
| 人群使用提示 | 疑似肺癌且完成活检的富病灶队列,与筛查人群(大量良性结节)分布差异大,不可互推 |
§2.5 临床价值
对临床 AI 而言,该数据集的价值在于把"影像可见性"与"病理金标准"绑定:病灶位置由放射科医生逐层勾画,亚型由活检病理确认,二者共同构成端到端的监督信号。它可支撑三类转化方向:其一,辅助检测——在 CT 报告之前自动提示病灶位置,减轻漏诊;其二,亚型预判——在活检前提供组织学可能性排序,帮助规划活检路径;其三,PET 价值量化——在统一队列上比较"CT 单模态 vs CT+PET"的性能差,为 PET 检查的适应证提供证据。
§2.6 金标准对照
| 项目 | 内容 |
|---|---|
| 参考标准 | 活检组织病理学(组织学亚型确诊) |
| 影像标注 | 5 名胸部放射科医生两阶段标注:1 人勾画、4 人核验(2 名年资 >15 年、其余 >5 年),工具 Labellmg |
| 标注形式 | PASCAL VOC XML 逐层边界框(非三维分割) |
| 标注性质 | 人工监督标注;每例勾画者唯一,勾画者间变异未量化 |
| 官方基线 | 2 名深度学习研究者训练多个检测模型,验证集 mAP≈0.87 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 完整数据 + 临床表 | Version 5(2020-12-22) | 127.18 GB + 16.5 MB + 35.94 KB | 唯一为全部 355 例补充临床数据的版本,也是当前默认发布版 |
| 追溯被移除的 8 例 | TCIA 版本历史中的旧版存档 | 略小 | V5 因提交方判定需进一步检查移除 8 例,旧版可对照受试者清单 |
| 快速探索标签结构 | 仅标注 XML + 临床 XLSX | 约 17 MB | 无需下载 127 GB 影像即可确认亚型计数与边界框格式 |
§3.1 模态详情
| 参数 | CT | PET |
|---|---|---|
| 像素矩阵 | 512×512 | 200×200 |
| 面内分辨率 | 约 1 mm | 约 4.07 mm |
| 重建层厚 | 2 mm | 1 mm |
| 层间隔 | 0.625–5 mm | 与 CT 层数相同、逐层对应 |
| 显像剂/剂量 | —(衰减校正 CT:180 mAs / 120 kVp / pitch 1.0) | 18F-FDG 4.44 MBq/kg(0.12 mCi/kg) |
| 采集时机 | — | 注射后约 60 分钟开始采集 |
| 注射剂量区间 | — | 168.72–468.79 MBq(295.8±64.8) |
| 摄取时间 | — | 27–171 min(70.4±24.9) |
| 患者准备 | — | 血糖 <11 mmol/L、禁食 ≥6 小时 |
| 重建算法 | 含平扫、增强、3D 重建序列 | TrueX 飞行时间(TOF)重建,CT 衰减校正 |
| 扫描范围 | 肺部 | 颅底至大腿中段,自由呼吸 |
§3.2 子集样本数
| 组织学亚型 | 受试者后缀字母 | 受试者数 | 占比 |
|---|---|---|---|
| 腺癌 | A | 251 | 70.7% |
| 鳞状细胞癌 | G | 61 | 17.2% |
| 小细胞癌 | B | 38 | 10.7% |
| 大细胞癌 | E | 5 | 1.4% |
| 合计 | — | 355 | 100% |
注:另有文献以"检查(Study)"为统计口径给出 A=264、G=62、B=44(IEEE Access 2024),与受试者级计数(251/61/38)并存并不矛盾——部分受试者拥有不止一个检查,合计 436 个 Study。跨文献比较时务必先确认统计口径。
§3.3 数据格式
| 组件 | 格式 | 说明 |
|---|---|---|
| 影像 | DICOM | CT 与 PET 分序列存储,含标准 DICOM 头(UID、几何、剂量参数) |
| 病灶标注 | PASCAL VOC XML | 逐层边界框(object/bndbox),可用官方推荐的 pascal-voc-tools 解析 |
| 临床数据 | XLSX | Version 5 补充,覆盖全部 355 例受试者 |
格式层面的三点工程提示:其一,DICOM 内 CT 与 PET 以 Modality 字段区分(PET 记作 PT),不要按文件夹名猜测;其二,XML 为标准 PASCAL VOC 结构,pascal-voc-tools 之外用 xml.etree 亦可直接解析;其三,XLSX 读取建议锁定 openpyxl 并保留原始单元格类型,避免日期列被自动转换。
§3.4 存储大小
| 资源 | 大小 |
|---|---|
| DICOM 影像 | 127.18 GB |
| 标注 XML | 16.5 MB |
| 临床 XLSX | 35.94 KB |
| 合计(下载预留) | 建议 ≥150 GB 磁盘空间(含解压临时空间) |
§3.5 标注方式
人工监督标注:放射科医生在 Labellmg 中对含病灶的层面逐层勾画矩形边界框,输出 PASCAL VOC XML。每个 object 对应一个层面的一个病灶框,不含像素级分割掩码。官方提供解析库(pascal-voc-tools)与可视化示例代码,用于把 XML 框叠加回 DICOM 影像。
标注流程分两阶段:
| 阶段 | 参与者 | 产出 |
|---|---|---|
| 阶段一:勾画 | 1 名胸部放射科医生 | 含病灶层面的逐层矩形边界框(Labellmg) |
| 阶段二:核验 | 另外 4 名放射科医生 | 对全部勾画框逐一审核修正后定稿 |
§3.6 标注者资质与一致性
标注团队共 5 名胸部放射科医生:2 名年资超过 15 年,其余 3 名超过 5 年。流程为两阶段:1 名医生勾画全部边界框,另外 4 名逐一核验修正。数据集未公布勾画者间一致性统计(如 Kappa 或 mAP 复现),使用者若需量化标注可靠性,可在小样本上自行复标注估计。
§3.7 采集周期
官方页面未披露具体采集起止年份;数据集于 2020 年在 TCIA 发布(DOI 注册 2020 年),当前 Version 5 更新于 2020-12-22。引用时建议以"2020 年发布、回顾性采集"表述,避免臆测年份区间。
§3.8 地域覆盖
中国黑龙江省哈尔滨市,单一中心(哈尔滨医科大学第二附属医院)。无多中心数据,地域与设备Vendor多样性有限,跨中心泛化需外部验证。
写作与汇报中的表述模板:“来自中国哈尔滨单一中心的 355 例病理确诊肺癌回顾性队列”——单中心与回顾性两个限定词建议始终保留,它们直接决定结果的泛化边界。
§3.9 设备规格
PET 为 TrueX 飞行时间(TOF)重建的 PET/CT 同机设备;PET/CT 中的 CT 组件用于解剖成像与衰减校正(180 mAs、120 kVp、pitch 1.0)。官方页面以参数形式披露设备能力,未汇总逐例设备型号清单;DICOM 头内含逐例设备字段,需要时可直接从文件读取。
与预处理直接相关的 DICOM 头关键字段:
| DICOM 字段 | 用途 | 注意事项 |
|---|---|---|
| Modality | 区分 CT / PT 序列 | PET 在 DICOM 中记作 PT 而非 PET |
| Rows / Columns | 像素矩阵(512×512 或 200×200) | 用于自动识别模态网格 |
| PixelSpacing | 面内物理分辨率 | CT 约 1 mm、PET 约 4.07 mm |
| InstanceNumber | 层序号 | CT 与 PET 逐层对齐的连接键 |
| RescaleSlope / Intercept | CT 灰度→HU 换算 | 必读,跳过将得到伪灰度 |
| StudyDate / SeriesDate | 检查与序列时间 | 漂移监控分桶依据 |
| RadionuclideTotalDose 等剂量字段 | PET SUV 换算输入 | 坑点 8 的进阶换算依赖 |
§3.10 深度溯源链
| 层级 | 证据 |
|---|---|
| 采集机构 | 哈尔滨医科大学第二附属医院(TCIA 官方页面署名;致谢 Huiping Han、Funing Yang、Rui Wang) |
| 托管平台 | TCIA(正式页)+ NCI IDC(门户镜像,模态记为 SR/SEG/CT/PT) |
| 数据引用 | Li P, Wang S, Li T, Lu J, HuangFu Y, Wang D (2020). A Large-Scale CT and PET/CT Dataset for Lung Cancer Diagnosis (Lung-PET-CT-Dx). DOI: 10.7937/TCIA.2020.NNC2-0461 |
| 版本审计 | TCIA 页面版本历史(V5 于 2020-12-22 移除 8 例并补充临床数据) |
| 派生资源 | BAMF-AIMI-Annotations(DOI: 10.5281/zenodo.8345959)、Lung-PET-CT-Dx-Annotations(DOI: 10.5281/zenodo.16989819) |
§4 数据结构
§4.0 目录树
数据解压后的结构示意(受试者文件夹名为"编号_亚型字母",具体命名以实际解压结果与官方 manifest 为准):
Lung-PET-CT-Dx/
├── 000001_A/ # 受试者文件夹:6 位编号 + 亚型字母(A=腺癌)
│ ├── 1.xxx-CT.../ # CT 序列(DICOM,数百层 .dcm 文件)
│ │ ├── 1-001.dcm
│ │ └── ...
│ └── 2.xxx-PT.../ # PET 序列(DICOM,与 CT 层数相同)
│ ├── 2-001.dcm
│ └── ...
├── 000002_A/
├── 000006_G/ # 字母后缀随亚型变化(A/B/E/G)
├── ...
├── Annotations/ # PASCAL VOC XML 逐层边界框
│ └── <受试者>.xml
└── clinical.data.xlsx # 临床数据表(35.94 KB,Version 5 补充)
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Subject ID | 文本 | 受试者伪匿名标识,后缀字母即亚型 | 000001_A | 主键、分组划分、标签来源 | 无(人工编制) | 无 | 355 个唯一值 |
| 亚型字母 | 字符 | A=腺癌、B=小细胞癌、E=大细胞癌、G=鳞癌 | A | 分类标签(映射 ICD-11/SNOMED) | 病理确诊,可信度高 | 无 | |
| Study Instance UID | 文本 | DICOM 检查唯一标识 | 1.2.840… | 检查级分组、防泄漏 | 无 | 无 | DICOM UID |
| Series Instance UID | 文本 | DICOM 序列唯一标识 | 1.2.840… | 序列级定位 CT/PET | 无 | 无 | DICOM UID |
| Modality | 枚举 | 序列模态(CT/PT) | CT | 模态路由与融合 | 无 | 无 | |
| InstanceNumber | 整数 | 层序号,CT 与 PET 共用层索引 | 87 | 逐层对齐两模态 | 无 | 无 | 1–层数 |
| RescaleSlope/Intercept | 浮点 | CT 灰度到 HU 的线性系数 | 1 / −1024 | HU 归一化(必做) | 设备标定 | 无 | 设备相关 |
| bndbox(xmin,ymin,xmax,ymax) | 整数×4 | 该层病灶边界框像素坐标 | 214,183,341,310 | 检测监督信号 | 勾画者间变异未量化 | 无框=该层无病灶 | 图像矩阵内 |
| XML object name | 文本 | 病灶条目标签(PASCAL VOC 结构) | 病灶对象节点 | 框-层-受试者关联 | 命名以实际文件为准 | — | VOC 节点 |
| 临床字段(XLSX) | 混合 | Version 5 补充的临床变量,列名以表头为准 | — | 协变量分析 | 官方未发布字典 | 空单元格 | 以表头为准 |
§4.2 标签分布
受试者级亚型分布呈明显长尾:腺癌 251(70.7%)、鳞癌 61(17.2%)、小细胞癌 38(10.7%)、大细胞癌 5(1.4%)。最大类比最小类多 50 倍,直接训练会导致大细胞癌几乎学不到;分层抽样、加权损失或类别合并策略见 §6.5 坑点 4。逐层框数分布官方未公布,可用解析脚本自行统计:
from pathlib import Path
import xml.etree.ElementTree as ET
boxes_per_subject = {}
for xml in Path("data_root/Annotations").glob("*.xml"):
boxes_per_subject[xml.stem] = sum(1 for _ in ET.parse(xml).getroot().iter("object"))
print(sorted(boxes_per_subject.values(), reverse=True)[:10]) # 框数 Top10 受试者
§4.3 关键统计
| 指标 | 数值 | 说明 |
|---|---|---|
| 受试者 | 355 | 每例均含 PET 与 CT |
| 检查(Study) | 436 | 部分受试者多个检查(含平扫/增强/3D 重建序列组合) |
| 序列 | 1,295 | CT 与 PET 分序列 |
| 图像 | 251,135 | CT 与 PET 所有层面 |
| 亚型计数 | 251/61/38/5 | 腺癌/鳞癌/小细胞癌/大细胞癌(受试者级) |
| 官方基线 | mAP≈0.87 | 多检测模型、验证集 |
§4.4 数据层级
层级为"受试者 → 检查(Study) → 序列(Series) → 切片(Instance)"。受试者以伪匿名编号+亚型字母标识;一个检查下并存 CT 与 PET 序列(部分受试者另有平扫/增强/3D 重建序列,共 436 个检查、1,295 个序列);PET 与病灶层面的 CT 逐层对应(层数相同);边界框挂在切片层。任何集合级划分都必须以受试者为最小单元。
| 层级 | 数量级 | 标识符 | 关键关系 |
|---|---|---|---|
| 受试者 | 355 | 编号_亚型字母(如 000001_A) | 亚型标签挂载点、划分最小单元 |
| 检查(Study) | 436 | Study Instance UID | 部分受试者多个检查 |
| 序列(Series) | 1,295 | Series Instance UID | CT/PT/重建序列 |
| 切片(Instance) | 251,135 | SOP Instance UID + InstanceNumber | PET 与 CT 逐层对齐;边界框挂载点 |
§4.5 缺失值与信息性缺失
临床 XLSX 中个别字段允许空单元格,官方未提供统一的信息性缺失编码(即"未测/未记录/不适用"不加区分)。影像侧缺失主要来自版本历史:Version 5 移除了 8 例受试者,旧版清单与新版混用会产生"找不到文件夹"的假性缺失。处理建议:以 V5 受试者清单为基准做外键校验;临床字段缺失在建模时按"缺失类别"显式编码,避免把空值静默填充为零。
§5 数据划分与使用建议
§5.1 官方划分
官方未提供任何 train/validation/test 划分。官方基线仅说明由 2 名深度学习研究者训练多个检测模型并在验证集上取得 mAP≈0.87,未披露划分细节。
这意味着:任何论文中出现的具体 train/test 数量(如 261/94 之类)都是作者自设协议而非官方口径,引用时必须回溯到原论文核对划分描述;本页面的基准比较也全部遵循这一原则(见坑点 5)。
§5.2 社区惯例划分
- 按受试者 6:2:2 划分:YOLO-ED(PLoS One 2025)在 204 例子集上按患者隔离划分 6:2:2、每例取 30 张 CT 层面,是可复现性较好的参照协议。
- 跨队列外部验证:Gouveia 等(Appl. Sci. 2025)把跨队列评估路径扩展到 NSCLC-Radiomics(422 例)与 NSCLC-Radiogenomics(211 例),为本数据集作为训练源的外部验证提供了同行评审先例。
一个可直接复用的受试者级分层划分示例:
from collections import Counter
from sklearn.model_selection import StratifiedGroupKFold
# subjects: ["000001_A", ...];组=受试者,层=亚型字母
subjects = sorted(p.name for p in Path("data_root").iterdir() if p.is_dir())
groups = [s for s in subjects] # 每个受试者自成一组
y = [s.split("_")[-1] for s in subjects] # 分层键:亚型字母
print(Counter(y)) # 应为 {'A': 251, 'G': 61, 'B': 38, 'E': 5}
sgk = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
folds = list(sgk.split(subjects, y, groups))
# 第 0 折做 train/val/test 6:2:2 拆分,或直接 5 折交叉验证
§5.3 划分策略建议与泄漏风险
- 最小单元必须是受试者:同一受试者的相邻 CT 层面高度相似,按层面随机划分会让测试集近乎"背答案",mAP 虚高(详见 §6.5 坑点 1)。
- 分层受试者划分:按亚型比例分层抽样(尤其保证大细胞癌 5 例的分布),可用
sklearn.model_selection.StratifiedGroupKFold以受试者为组。 - 检查/序列归属:部分受试者有多个检查(436 Study > 355 受试者),分组键应取 Subject ID 而非 Study UID。
- 冻结测试集:论文基准建议冻结一份按受试者分层的测试集并在版本控制中登记受试者清单,避免后续实验"无意窥视"。
§5.4 交叉验证建议
小样本亚型研究建议 5 折受试者级分层交叉验证;大细胞癌仅 5 例,每折至多 1 例,该类指标方差极大,建议同时报告合并大细胞癌后的"三分类"指标作为稳定性参照。
§5.5 外部验证建议
优先顺序:NSCLC-Radiomics(422 例,纯 CT)→ NSCLC-Radiogenomics(211 例)→ 自建院内队列。跨队列时注意域移位(扫描仪、重建核、层厚差异),建议先做灰度直方图与体素间距对齐再评测。
§5.6 使用前检查单
动笔训练之前,以下 7 项逐条打勾可避免本数据集绝大多数的返工:
- 受试者数 = 355、Study 数 = 436、图像数 = 251,135(版本与镜像校验,坑点 6)。
- 亚型计数 = 腺癌 251 / 鳞癌 61 / 小细胞癌 38 / 大细胞癌 5(字母映射校验,坑点 3)。
- 划分键是 Subject ID 而非 Study UID(436 > 355,坑点 1)。
- CT 读图前完成 HU 换算与肺窗配置(坑点 7)。
- PET 已重采样到 CT 网格或统一物理网格(坑点 2)。
- PET 像素值已完成标准化或 SUV 换算(坑点 8)。
- 评测脚本能输出 per-class AP 并单独跟踪大细胞癌(坑点 4)。
§6 AI 就绪指南
§6.0 云端快速启动
TCIA 官方分发渠道为 Data Retriever 客户端与 NBIA REST API,暂无官方 Hugging Face/Kaggle 镜像。云端最小可用路径:先只下载标注 XML 与临床 XLSX(约 17 MB)验证标签管线,再经 NBIA API 或 Data Retriever 分批拉取受试者级 DICOM。Colab 免费盘约 100 GB,装不下 127.18 GB 全量影像,建议按受试者子集分批挂载。
若必须云端全量处理,两条路径:其一是 NCI IDC 门户的云端副本(免下载直接在大内存实例上访问集合);其二是把 Data Retriever 放在对象存储网关机后台分批拉取、训练机只挂载所需受试者。两条路径都请保留下载清单与时间戳,便于坑点 6 的版本审计。
§6.1 快速上手
代码之前先确认目录结构预期:data_root 下是 355 个"编号_亚型字母"受试者文件夹 + 标注 XML + 临床 XLSX;data_root / 受试者名 拼出受试者目录;最小可用子集是任一受试者文件夹及其对应 XML,能跑通"读 DICOM → HU → 叠加边界框"即可开始。
# 最小验证脚本:读取单个受试者的 CT 序列并打印其亚型
# 预期目录结构:
# data_root/
# ├── 000001_A/ # 受试者文件夹(编号_亚型字母)
# │ ├── <CT 序列文件夹>/*.dcm
# │ └── <PET 序列文件夹>/*.dcm
# ├── Annotations/ # PASCAL VOC XML
# └── clinical.data.xlsx
from pathlib import Path
import pydicom
data_root = Path("data_root")
subject = sorted(p.name for p in data_root.iterdir() if p.is_dir())[0]
subtype_letter = subject.split("_")[-1] # 'A' -> 腺癌
print(subject, subtype_letter)
dcm_files = list((data_root / subject).rglob("*.dcm"))
ds = pydicom.dcmread(dcm_files[0])
print(ds.Modality, ds.Rows, ds.Columns, len(dcm_files))
跑通最小验证后,建议先做一张"框叠加图"确认 XML 与影像的层对应关系(官方也推荐先可视化再训练):
<details>
<summary>边界框叠加可视化脚本(点击展开,约 25 行)</summary>
import matplotlib.pyplot as plt
import numpy as np
def show_subject_with_boxes(data_root: str, subject: str, xml_path: str):
"""把某受试者全部含框层面拼成网格图,肉眼校验框-层对应。"""
boxes_by_slice = {}
root = ET.parse(xml_path).getroot()
# PASCAL VOC 无层号字段时,框与层面的对应以官方可视化代码/清单为准
for obj in root.iter("object"):
b = obj.find("bndbox")
boxes_by_slice.setdefault(obj.find("filename").text if obj.find("filename") is not None else "0", []).append(
[int(b.find(t).text) for t in ("xmin", "ymin", "xmax", "ymax")])
ct_dir = next((data_root / subject).glob("*CT*"))
files = sorted(ct_dir.glob("*.dcm"), key=lambda p: int(pydicom.dcmread(p, stop_before_pixels=True).InstanceNumber))
n = min(len(files), 16)
fig, axes = plt.subplots(4, 4, figsize=(12, 12))
for ax, f in zip(axes.ravel(), files[:n]):
img = window_hu(load_ct_slice(f), 1400, -700)
ax.imshow(img, cmap="gray"); ax.axis("off")
for box in boxes_by_slice.get(f.name, []):
ax.add_patch(plt.Rectangle((box[0], box[1]), box[2]-box[0], box[3]-box[1],
fill=False, edgecolor="orange", linewidth=1.5))
fig.suptitle(f"{subject}({subject.split('_')[-1]} 亚型)")
plt.show()
</details>
§6.2 数据获取
| 组件 | 获取方式 | 大小 |
|---|---|---|
| DICOM 影像 | TCIA Data Retriever(GUI)或 NBIA REST API | 127.18 GB |
| 标注 XML | 与影像同一下发清单(Data Retriever 勾选) | 16.5 MB |
| 临床 XLSX | 同上,Version 5 起 | 35.94 KB |
下载完成后的自检清单:
| 检查项 | 期望值 | 失败处理 |
|---|---|---|
| 受试者文件夹数 | 355 | 疑似旧版镜像,重新下载(坑点 6) |
| 亚型字母分布 | A 251 / G 61 / B 38 / E 5 | 核对字母映射表(坑点 3) |
| .tcia 清单文件 | 已归档 | 重下并存档,绑定实验版本 |
| 临床 XLSX 行数 | 355 | 与受试者清单做外键比对 |
| 单受试者 PET/CT 层数 | 相同 | 检查是否漏下载某一序列 |
# 方式一(推荐):安装 TCIA Data Retriever 桌面端
# 1. 打开 https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/
# 2. 点击 "Download Data" 生成 .tcia 清单文件
# 3. Data Retriever 打开该清单 -> 选择输出目录 -> 下载
# 方式二:NBIA REST API(按受试者分批,适合服务器)
import requests, subprocess, json, pathlib
BASE = "https://services.cancerimagingarchive.net/nbia-api/services/v1"
# 1) 取集合内所有受试者
patients = requests.get(f"{BASE}/getPatients", params={"Collection": "Lung-PET-CT-Dx"}, timeout=60)
patient_list = [p["PatientId"] for p in patients.json()]
print(len(patient_list)) # 应为 355;若不一致,检查是否命中旧版镜像(见坑点 6)
# 2) 逐受试者取序列清单(此处仅演示,实际下载建议官方 Data Retriever 或 nbia tooling)
下载完成后立即做三件校验:受试者数 = 355;Study 数 = 436;图像总数 = 251,135。
§6.3 预处理全流程
步骤 1:CT 灰度 → HU(必做)。
import pydicom, numpy as np
def load_ct_slice(path):
ds = pydicom.dcmread(path)
img = ds.pixel_array.astype(np.float32)
img = img * float(getattr(ds, "RescaleSlope", 1)) + float(getattr(ds, "RescaleIntercept", 0))
return img # 单位:HU
步骤 2:窗宽窗位(肺窗为主窗)。
def window_hu(img, ww=1400, wl=-700):
lo, hi = wl - ww / 2, wl + ww / 2
return np.clip((img - lo) / (hi - lo), 0, 1).astype(np.float32)
# 肺窗 WW1400/WL-700 用于病灶检测;纵隔窗 WW350/WL40 用于纵隔结构。不要把原始 HU 直接转 uint8。
步骤 3:解析 PASCAL VOC XML 边界框。
import xml.etree.ElementTree as ET
def parse_boxes(xml_path):
root = ET.parse(xml_path).getroot()
boxes = []
for obj in root.iter("object"):
b = obj.find("bndbox")
boxes.append([int(b.find(t).text) for t in ("xmin", "ymin", "xmax", "ymax")])
return boxes # 每层 0-N 个框;该层无框即无病灶
步骤 4:PET 重采样与值处理。
# PET(200×200@4.07mm) 与 CT(512×512@1mm) 层数相同但面内网格不同:
# 上采样到 CT 网格(或统一重采样到 1mm 各向同性)后再融合;PET 原始像素值不是 SUV,
# 跨患者比较前需按 DICOM 头单位换算或做 per-volume 标准化(见坑点 8)。
import torch.nn.functional as F
pet = torch.from_numpy(pet_volume).unsqueeze(0).unsqueeze(0) # (1,1,D,200,200)
pet_up = F.interpolate(pet, size=(D, 512, 512), mode="trilinear", align_corners=False)
步骤 5:下载完整性三数校验(入库前必跑)。
from pathlib import Path
from collections import Counter
data_root = Path("data_root")
subjects = [p.name for p in data_root.iterdir() if p.is_dir()]
assert len(subjects) == 355, f"受试者数 {len(subjects)} != 355,疑似旧版镜像(坑点 6)"
print(Counter(s.split("_")[-1] for s in subjects))
# 期望:{'A': 251, 'G': 61, 'B': 38, 'E': 5};任一不符立即停下核对字母映射(坑点 3)
§6.4 PyTorch DataLoader
<details>
<summary>完整 Dataset 类(点击展开,约 60 行)</summary>
import xml.etree.ElementTree as ET
from pathlib import Path
import numpy as np
import pydicom
import torch
from torch.utils.data import Dataset, DataLoader
# 目录结构预期(解压后):
# data_root/
# ├── 000001_A/… # 受试者文件夹:编号_亚型字母(A=腺癌 B=小细胞 E=大细胞 G=鳞癌)
# ├── …/ # 共 355 个受试者文件夹
# ├── Annotations/… # PASCAL VOC XML(XML 与受试者的对应关系以官方清单为准)
# └── clinical.data.xlsx
class LungPetCtDxDetectionDataset(Dataset):
"""CT 逐层病灶检测数据集:按受试者返回 (volume, boxes, label)。"""
LABEL_MAP = {"A": 0, "B": 1, "E": 2, "G": 3}
WW, WL = 1400, -700 # 肺窗
def __init__(self, data_root: str, subjects, ann_dir="Annotations", img_size=512):
self.data_root = Path(data_root)
self.ann_dir = self.data_root / ann_dir
self.subjects = list(subjects)
self.img_size = img_size
def _load_ct_volume(self, subj_dir: Path) -> np.ndarray:
cands = [p for p in subj_dir.rglob("*.dcm")
if pydicom.dcmread(p, stop_before_pixels=True).Modality == "CT"]
cands.sort(key=lambda p: int(pydicom.dcmread(p, stop_before_pixels=True).InstanceNumber))
slope = float(pydicom.dcmread(cands[0], stop_before_pixels=True).get("RescaleSlope", 1))
inter = float(pydicom.dcmread(cands[0], stop_before_pixels=True).get("RescaleIntercept", 0))
vol = np.stack([pydicom.dcmread(p).pixel_array for p in cands]).astype(np.float32)
return vol * slope + inter # HU
@staticmethod
def _window(img: np.ndarray, ww: float, wl: float) -> np.ndarray:
lo, hi = wl - ww / 2, wl + ww / 2
return np.clip((img - lo) / (hi - lo), 0, 1).astype(np.float32)
def _parse_boxes(self, xml_path: Path) -> np.ndarray:
if not xml_path.exists():
return np.zeros((0, 4), dtype=np.float32)
root = ET.parse(xml_path).getroot()
boxes = [ [int(o.find("bndbox").find(t).text) for t in ("xmin", "ymin", "xmax", "ymax")]
for o in root.iter("object") ]
return np.asarray(boxes, dtype=np.float32).reshape(-1, 4)
def __len__(self):
return len(self.subjects)
def __getitem__(self, idx: int):
subj = self.subjects[idx]
label = self.LABEL_MAP[subj.split("_")[-1]]
vol = self._window(self._load_ct_volume(self.data_root / subj), self.WW, self.WL)
boxes = self._parse_boxes(self.ann_dir / f"{Path(subj).stem}.xml") # XML 命名以官方清单为准
return torch.from_numpy(vol), torch.from_numpy(boxes), label
</details>
# 实例化:务必按受试者划分(坑点 1),此处展示 6:2:2 受试者级划分
import random
subjects = sorted(p.name for p in Path("data_root").iterdir() if p.is_dir())
random.Random(42).shuffle(subjects)
n = len(subjects) # 应为 355
train_sub, val_sub, test_sub = (subjects[: int(0.6 * n)],
subjects[int(0.6 * n): int(0.8 * n)],
subjects[int(0.8 * n):])
train_set = LungPetCtDxDetectionDataset("data_root", train_sub)
train_loader = DataLoader(train_set, batch_size=2, shuffle=True, num_workers=4, pin_memory=True)
§6.5 八个坑点
⚠️ 坑点 1:按层面随机划分造成患者级泄漏(分类:数据泄漏)
问题:251,135 幅图像来自 355 名患者,同一受试者相邻层面几乎相同;若以图像/层面为单位随机划分 train/test,测试集中会出现与训练集近乎相同的层面,性能严重虚高。
症状:验证 mAP 轻松 0.95+;换一家医院或新一批患者后 mAP 骤降至 0.6 左右且方差极大。
解决:
- 简单方法:以 Subject ID 为分组键做
GroupShuffleSplit,保证同一受试者的所有层面只出现在一个集合。- 进阶方法:受试者级 6:2:2 划分并按亚型分层——YOLO-ED(PLoS One 2025)在 204 例上按患者隔离 6:2:2、每例取 30 张 CT,是可复现的参照协议。
- SOTA 方法:受试者级划分 + 冻结测试集 + 跨队列外部验证(如训练于本数据集、测试于 NSCLC-Radiomics 422 例),报告内外部性能差作为泛化证据。
参考:Zeng et al., PLoS One 2025(DOI: 10.1371/journal.pone.0330732);Gouveia et al., Appl. Sci. 2025(DOI: 10.3390/app15031148)
⚠️ 坑点 2:PET 与 CT 网格不一致,直接拼接报错(分类:预处理陷阱)
问题:CT 为 512×512 像素、约 1 mm 面内分辨率;PET 为 200×200 像素、约 4.07 mm。两序列层数相同但面内网格不同,直接在通道维拼接会形状不匹配,且 PET 病灶在粗网格上更小,错误插值会稀释代谢信号。
症状:RuntimeError: Sizes of tensors must match;或融合模型PET 分支输出对病灶几乎无响应。
解决:
- 简单方法:PET 逐层双线性/三线性上采样到 CT 网格后拼接。
- 进阶方法:用 DICOM 头
ImagePositionPatient/ImageOrientationPatient/PixelSpacing把两模态重采样到同一物理空间网格(如 1 mm 各向同性),再做几何一致融合。- SOTA 方法:物理空间统一网格 + ROI 对齐池化(对边界框区域做 ROI Align 取 PET 代谢特征),避免全图插值带来的边界模糊。
参考:TCIA 官方页面影像规格;Wang et al., Bioengineering 2024(DOI: 10.3390/bioengineering11080767)
⚠️ 坑点 3:受试者 ID 亚型字母映射错位(E vs C)(分类:标签理解)
问题:亚型编码在受试者 ID 的字母后缀:A=腺癌、B=小细胞癌、E=大细胞癌、G=鳞癌。TCIA 正式页记大细胞癌为 E,而 NCI IDC 门户页面曾把该字母误记为 C;跨平台抓取元数据时极易把映射表抄错。
症状:按"存在 C 后缀受试者"过滤得到空集;亚型统计对不上官方的 251/61/38/5。
解决:
- 简单方法:以 TCIA 正式 collection 页面的字母表为准(A/B/E/G),忽略门户页差异。
- 进阶方法:写断言脚本:解析全部 ID 后缀并断言计数为腺癌 251、鳞癌 61、小细胞癌 38、大细胞癌 5,任何不符立即失败。
- SOTA 方法:用第三方派生标注(BAMF-AIMI-Annotations,DOI: 10.5281/zenodo.8345959)交叉核对受试者-亚型映射,双源一致再入库。
参考:TCIA collection 页面;NCI IDC 门户(https://portal.imaging.datacommons.cancer.gov/collections/lung_pet_ct_dx)
⚠️ 坑点 4:大细胞癌仅 5 例的极端长尾(分类:偏倚陷阱)
问题:受试者级计数 251/61/38/5,最大类比最小类多 50 倍;大细胞癌在交叉验证中每折至多 1 例,指标方差极大。
症状:大细胞癌召回率长期为 0,或偶发 100% 但毫无稳定性;YOLO-ED 报告 LCC 精度仅 85.7% 且明确归因于"仅 5 例"。
解决:
- 简单方法:把大细胞癌并入"其他 NSCLC"做三分类,报告合并指标作稳定性参照。
- 进阶方法:按类加权采样或 Focal Loss,并对每类单独报告 per-class AP 与置信区间。
- SOTA 方法:长尾感知训练(类别平衡采样 + 解耦分类头),并引用 YOLOv8-LCM 等针对该数据集长尾设计的模型思路。
参考:Zeng et al., PLoS One 2025;Wang et al., Bioengineering 2024(DOI: 10.3390/bioengineering11080767)
⚠️ 坑点 5:跨论文基准数字不可直接比较(分类:评估误用)
问题:官方无统一划分,各论文自行取子集与划分(YOLO-ED 用 204 例 6:2:2;ACS-YOLO 用自有划分),且统计口径混杂(受试者级 251/61/38/5 vs Study 级 264/62/44);不同文献间亚型计数甚至存在互换讹误。
症状:在排行榜上直接比"谁的 mAP 高",得出与复现实验相反的结论。
解决:
- 简单方法:引用任何基准数字时注明其划分协议与子集规模,不跨协议排序。
- 进阶方法:自建统一评测协议(同一受试者冻结测试集 + 同一 IoU 阈值 + per-class AP),把公开数字仅作量级参照。
- SOTA 方法:报告 95% 置信区间(受试者级 bootstrap),并用官方基线 mAP≈0.87 作为 sanity check 锚点。
参考:Gouveia et al., Appl. Sci. 2025(DOI: 10.3390/app15031148);IEEE Access 2024(DOI: 10.1109/ACCESS.2024.3462629)
⚠️ 坑点 6:版本缓存与旧镜像导致受试者数不一致(分类:工程陷阱)
问题:Version 5(2020-12-22)移除了 8 例受试者并补充临床数据;从旧 manifest、旧镜像或历史博客链接获取的数据可能多出 8 例,与官方临床表外键对不上。TCIA 官方分发依赖 Data Retriever,手拼下载链接通常不可行。
症状:受试者目录数不等于 355;临床 XLSX 出现匹配不到的受试者,或反之。
解决:
- 简单方法:下载后立即断言受试者=355、Study=436、图像=251,135,不一致先查版本。
- 进阶方法:统一经 TCIA Data Retriever 或 NBIA API 获取,并在实验记录中保存 .tcia 清单文件与下载日期。
- SOTA 方法:把受试者清单哈希纳入 MLOps 元数据,数据版本与模型版本绑定(DVC/LakeFS 均可)。
参考:TCIA collection 页面版本历史
⚠️ 坑点 7:CT 窗宽窗位与各向异性层间距(分类:预处理陷阱)
问题:CT 层间隔在 0.625–5 mm 之间不等(各向异性体数据),且临床阅读依赖双窗(肺窗 WW1400/WL−700、纵隔窗 WW350/WL40);直接把 HU 线性压到 uint8 或用默认单窗,会把纵隔结构或淡淡的磨玻璃病灶裁掉。
症状:可视化里病灶边界框"悬空"看不见目标;3D 卷积模型因 z 向插值失真而退化。
解决:
- 简单方法:检测任务统一用肺窗;输入前显式
window_hu(img, 1400, -700)。- 进阶方法:三通道分别编码肺窗、纵隔窗与原始 HU 截断区间;重采样到 1 mm 各向同性再进 3D 模型。
- SOTA 方法:保留 HU 直到增强阶段再配窗(augmentation 内随机窗宽微调),既保留信息又增加鲁棒性。
参考:TCIA 官方页面 CT 参数;LIDC-IDRI 社区预处理惯例
⚠️ 坑点 8:PET 像素值不是 SUV,跨患者不可比(分类:预处理陷阱)
问题:PET DICOM 的像素值是重建后的计数量纲(或标定派生值),并非标准化摄取值 SUV;不同注射剂量(168.72–468.79 MBq)与摄取时间(27–171 min)下,同一病灶的原始像素值可差数倍。
症状:PET 分支统计量在不同受试者间漂移巨大;"代谢越高病灶越恶性"的常识性假设在模型里完全失灵。
解决:
- 简单方法:per-volume z-score 标准化,消除例间剂量差。
- 进阶方法:按 DICOM PET SUV 标准换算 SUVbw(依赖 DICOM 头的 Units、RadionuclideTotalDose、DecayFactor 等字段)。
- SOTA 方法:在统一换算为 SUVbw 的基础上,把注射剂量与摄取时间作为协变量记录进实验元数据,便于域适应分析。
参考:DICOM PET SUV 换算标准;TCIA 官方页面采集协议(18F-FDG 4.44 MBq/kg、注射后约 60 min)
§6.6 数据增强策略
| 策略 | 判定 | 说明 |
|---|---|---|
| 随机水平翻转 | ✅ 安全 | 肺部左右近似对称,检测任务常用 |
| 小角度旋转(±10°) | ✅ 安全 | 模拟摆位差异 |
| 窗宽窗位微调 | ✅ 安全 | 在 HU 域内进行,模拟重建差异 |
| 随机裁剪含框区域 | ✅ 安全 | 保证边界框同步变换 |
| 亮度/对比度直接拉伸 8-bit 图 | ❌ 危险 | 破坏 HU 物理意义,应先 HU 后配窗 |
| z 向大幅弹性形变 | ❌ 危险 | 层间隔各向异性(0.625–5 mm),形变会伪造不存在的解剖 |
| PET 值直方图均衡 | ❌ 危险 | 扰乱代谢量纲,跨患者不可比 |
| 随机 gamma/噪声注入 | ⚠️ 慎用 | 仅在 CT HU 域内小幅度使用;PET 分支禁用 |
| 跨受试者 CutMix | ❌ 危险 | 会把两名患者的解剖拼在一起,生成不存在的病灶组合 |
§6.7 模型推荐
| 任务 | 推荐模型 | 起点理由 |
|---|---|---|
| 病灶检测(2D) | YOLOv8/YOLOv5 家族 | 该数据集公开基准集中于此(YOLO-ED 0.905、ACS-YOLO 0.9706 均为 YOLO 系) |
| 病灶检测(多模态) | 双分支 YOLO/Faster R-CNN + 中间融合 | PET/CT 同层对齐,中间融合成本最低 |
| 亚型分类 | ResNet/ViT + 病灶 ROI 池化 | 受试者级标签,先框后类可对齐病理区域 |
| 分割(辅助) | nnU-Net(3D PET-CT) | Ghosh 等 2025 已在本数据集上做多队列分割压力测试 |
| 外部验证 | 任意训练好的检测/分类模型 | 直接迁移至 NSCLC-Radiomics/Radiogenomics,对照 Gouveia 2025 协议 |
§6.8 硬件需求
| 场景 | 显存 | 建议 |
|---|---|---|
| 2D 检测(YOLOv8s,512×512) | ≥8 GB | batch 8–16 |
| 2D 检测(YOLOv8x/mosaic) | ≥16 GB | batch 4–8 |
| PET/CT 双分支融合 | ≥24 GB | 双编码器 + 插值缓存 |
| 全量 127 GB 存储 | — | SSD 优先;解压预留 ≥150 GB |
| CPU/内存 | — | 数据加载为 DICOM 逐文件解码,建议 ≥16 核、64 GB 内存并开启 num_workers |
§6.9 评估指标代码
# COCO 风格 mAP:与官方基线(mAP≈0.87 量级)对齐的第一步
from torchmetrics.detection import MeanAveragePrecision
metric = MeanAveragePrecision(box_format="xyxy", iou_type="bbox")
for preds, targets in eval_loader:
metric.update(preds, targets) # preds/targets 均为 dict,含 boxes/scores/labels
result = metric.compute()
print(result["map"], result["map_50"], result["map_75"])
# per-class AP:/classes 数组顺序与你的 label 映射一致(A=0, B=1, E=2, G=3)
print("A(腺癌):", result["map_per_class"][0].item(),
"B(小细胞):", result["map_per_class"][1].item(),
"E(大细胞):", result["map_per_class"][2].item(),
"G(鳞癌):", result["map_per_class"][3].item())
# 提醒:务必同时输出 per-class AP,尤其单独跟踪大细胞癌(仅 5 例,见坑点 4)
§6.10 MLOps 笔记
- 数据版本化:受试者清单(355 个 ID)+ .tcia 下载清单哈希入库,绑定每次实验(坑点 6)。
- 划分快照:把 6:2:2 受试者划分清单提交版本控制,杜绝"重跑划分"导致的隐性泄漏(坑点 1)。
- 口径登记:在实验卡片里写明统计口径(受试者级 vs Study 级)与评测 IoU(坑点 5)。
- 监控:上线后按月监测输入窗宽分布与 PET 值分布漂移(坑点 7/8)。
- 可复现性:随机种子、pydicom/torch 版本、Data Retriever 下载日期与 .tcia 清单一并归档,保证"同一哈希可复现同一数据视图"。
- 许可传递:CC BY 4.0 的署名义务要写进模型卡与产品文档,衍生数据集再分发沿用兼容许可(坑点 6 的版本哈希也应带许可声明)。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单中心偏倚 | 全部数据来自哈尔滨医科大学第二附属医院一家机构 | 高 | 外部验证(NSCLC-Radiomics/Radiogenomics)后再谈部署 |
| 入组偏倚 | 回顾性入组"疑似肺癌+活检+PET/CT"人群,缺良性对照与早期筛查人群 | 高 | 不用于良恶性鉴别;扩充良性队列前仅作亚型研究 |
| 长尾偏倚 | 大细胞癌仅 5 例(1.4%) | 高 | 合并类别或加权训练,per-class 报告(坑点 4) |
| 标注偏倚 | 每例 1 人勾画 4 人核验,勾画者间变异未量化 | 中 | 小样本复标注估计一致性;避免把框当像素级真值 |
| 口径混淆 | 受试者级(355)与 Study 级(436)计数并存 | 低 | 写明口径(坑点 5) |
§7.2 标注质量
5 名胸部放射科医生(2 名 >15 年资、3 名 >5 年资)两阶段流程:1 人勾画、4 人核验,工具 Labellmg,输出 PASCAL VOC XML 逐层边界框。亚型标签来自活检病理,链条完整。局限:未公布勾画者间一致性(Kappa/复测 mAP);边界框为矩形、不贴合不规则病灶边缘;未提供像素级掩码。使用建议:把边界框当"弱定位监督"而非精确轮廓,分割任务需自行获得像素级标注或用框内区域近似。
标注质量使用要点:
- 框是"层面级提示":一个受试者的病灶可能只勾了代表性层面,未勾层面不等于无病灶,训练时的负样本采样要考虑这一点。
- 核验 ≠ 多数投票:4 人核验是审核流程而非独立重复标注,不能当成 5 人一致的"共识标签"使用。
- 病理标签与框标签解耦:亚型(ID 字母)来自病理,位置(框)来自影像;二者结合做 ROI 级亚型分类是合理路径,但不要倒推"框内即全部肿瘤细胞"。
- 复标注成本可控:如有放射科合作者,随机抽 30 例复标注即可估计勾画者间 mAP,为论文补充标注可靠性证据。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨医院(其他城市/国家) | 高:扫描仪、重建核、人群构成变化 | 单中心数据;Gouveia 2025 跨队列报告域移位为主要挑战 |
| 跨设备 Vendor | 中高:HU 标定与 PET 重建差异 | 官方未公布逐例设备型号清单 |
| 良性结节场景 | 极高:数据集无良性对照 | 官方亚型清单全部为恶性 |
| 大细胞癌检测 | 极高:仅 5 例 | YOLO-ED 报告 LCC 精度 85.7% 并归因样本量 |
| PET 采集协议差异 | 中:摄取时间 27–171 min 跨度大 | 官方披露参数区间 |
§7.4 伦理与合规
数据经 TCIA 标准去标识化处理,受试者以伪匿名编号+亚型字母标识;回顾性采集与发表由提交方负责,数据以 CC BY 4.0 开放(影像、标注、临床表三项一致)。使用者义务:署名并在论文/产品中引用 DOI 10.7937/TCIA.2020.NNC2-0461;不得声称数据集背书任何临床结论;衍生分发需沿用兼容许可。
两点伦理提示:其一,虽然数据已去标识,PET/CT 影像在极端情况下仍可能被重新识别,任何公开演示应避免直接展示含完整面部/体表信息的定位像;其二,模型输出(亚型预测)在临床语境中属于高风险决策支持,展示或部署时应明确标注"研究用途、未经临床验证",避免误导患者。
§7.5 公平性
队列为中国东北单中心人群,年龄/性别/种族细分官方未公开;模型在其他人群(不同种族、吸烟谱、基础病谱)上的表现未经验证。若用于多人群部署,应补充本地校准集并监测 per-group 性能差。
§7.6 数据漂移
数据冻结于 2020-12-22(V5),此后无更新;临床扫描实践(迭代重建、深度学习重建、低剂量协议)持续演进,2020 年前采集的影像与当前设备输出存在协议代差。部署侧建议按采集年份/设备分桶监控输入分布,并准备域适应或再校准流程。
可操作的漂移监控三步:第一步,登记训练数据的 DICOM 头统计基线(PixelSpacing、重建层厚、HU 直方图、PET 值分布);第二步,线上按周对比新数据与基线的 PSI/KL 散度,任一模态超阈值即告警;第三步,把告警样本沉淀为再校准集,触发周期性再训练评审。PET 侧要特别注意注射剂量与摄取时间两个协变量(官方区间 168.72–468.79 MBq、27–171 min),它们本身就是天然的漂移源。
§7.7 DAIMS 24 项数据就绪度清单
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 临床 XLSX 一行一受试者 |
| 2 | 唯一标识 | ✅ | 受试者伪匿名 ID 唯一;DICOM Study/Series UID 完整 |
| 3 | 特殊字符 | ✅ | DICOM/XML 标准编码,未见解析异常报告 |
| 4 | 重复行 | ✅ | 官方清单无重复受试者报告 |
| 5 | 缺失编码 | ⚠️ | 临床表缺失项以空单元格呈现,无统一缺失码 |
| 6 | 标签标识 | ✅ | 亚型编码于 ID 字母后缀(A/B/E/G)+ XML 结构 |
| 7 | 罕见类分组 | ⚠️ | 大细胞癌仅 5 例,官方未提供合并/分组指引 |
| 8 | 偏倚评估 | ⚠️ | 单中心回顾性,官方未附偏倚分析 |
| 9 | 数据字典 | ✅ | TCIA 页面 + pascal-voc-tools 提供字段与格式说明 |
| 10 | 信息性缺失解释 | ❌ | V5 移除 8 例仅给原因分类,字段级缺失无解释编码 |
| 11 | 设备记录 | ⚠️ | DICOM 头含设备字段,官方未汇总逐例设备型号清单 |
| 12 | 共线性 | ❌ | 临床表极小(35.94 KB),无共线性说明或预处理指引 |
| 13 | 编码映射 | ✅ | 可映射 ICD-11 2C25 族与 SNOMED CT(§2.1/§2.1b) |
| 14 | 时间戳处理 | ✅ | DICOM 头自带 Study/Series 时间字段,同机 PET/CT 天然同步 |
| 15 | 划分建议 | ⚠️ | 官方无划分;社区惯例按受试者 6:2:2 |
| 16 | 泄漏讨论 | ❌ | 官方文档未讨论层面级泄漏风险,需使用者自行按受试者分组 |
| 17 | 标签分布 | ✅ | 官方页面给出四亚型受试者计数(251/61/38/5) |
| 18 | 测量偏倚 | ⚠️ | 每例 1 人勾画 4 人核验,勾画者间变异未量化 |
| 19 | 外部验证建议 | ✅ | 官方基线 + Gouveia 2025 跨队列验证路径有同行评审先例 |
| 20 | 版本记录 | ✅ | 版本历史完整,V5 移除 8 例有明确说明 |
| 21 | 预处理脚本 | ⚠️ | 官方提供解析库与可视化代码,无端到端 pipeline |
| 22 | 合规要求 | ✅ | CC BY 4.0 三项资源一致,署名+DOI 义务明确 |
| 23 | 多模态对齐 | ⚠️ | PET/CT 同层数但面内分辨率 4.07 mm vs 1 mm,需自行重采样 |
| 24 | 去标识化 | ✅ | TCIA 标准去标识化管线,伪匿名 ID |
DAIMS 评分:17.5 / 24
评分解读:影像结构、标识体系、版本与合规维度扎实(13 项达标);短板集中在"元说明类"——官方没有划分、泄漏讨论与字段级缺失编码,多模态对齐与长尾处理也要使用者自建。属于"底子好、说明书薄"的典型影像数据集。
从 24 项的分布看:✅ 13 项集中在数据本体(标识、格式、版本、许可),说明采集方把"数据本身"做得很规范;⚠️ 9 项集中在"使用方法与使用风险"的方法论层,这是多数 TCIA 影像数据集的共同形态(数据开放、协议自担);❌ 2 项(信息性缺失解释、共线性)源于临床表极薄——它只是 Version 5 补充的 35.94 KB 附表,指望它支撑深度临床建模并不现实。
对你意味着什么:可以直接把工程力气花在三个地方——按受试者划分与划分快照(补泄漏讨论缺口)、PET 网格重采样与 SUV 换算(补对齐缺口)、大细胞癌策略(合并或加权);不要期待官方文档回答划分与缺失问题,自建断言脚本(355/436/251,135 三数校验)是第一天的作业。若你的研究需要丰富的临床协变量(分期、吸烟史、基因突变),应转向 NSCLC-Radiogenomics 等队列或另行申请院内数据,而不是在本数据集上硬挖。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| NSCLC-Radiomics(422 例) | TCIA 公开队列 | 影像特征/腺癌预测跨队列迁移 | 见原文(定性:下降) | 明显下降 | 单中心 PET/CT → 多中心 CT 存在显著域移位,特征稳定性受重建协议影响 |
| NSCLC-Radiogenomics(211 例) | TCIA 公开队列 | 同上第二外部队列 | 见原文(定性:下降) | 明显下降 | 跨队列一致下降提示需要域适应而非单纯扩样 |
来源:Gouveia M, et al. Comparing 2D and 3D Feature Extraction Methods for Lung Adenocarcinoma Prediction Using CT Scans: A Cross-Cohort Study. Appl. Sci. 2025, 15(3): 1148. DOI: 10.3390/app15031148。
§8 基准性能与生态
§8.1 排行榜
⚠️ 下表数字来自不同论文的自选子集与划分协议,不可直接横向比较(见坑点 5),仅供量级参照。
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | YOLOv8-LCM | mAP@0.5 0.977±0.0065 | 2024 | 长尾感知 CT 病灶检测+亚型分类 | Wang L, Zhang C, Zhang Y, Li J. An Automated Diagnosis Method for Lung Cancer Target Detection and Subtype Classification-Based CT Scans. Bioengineering, 2024, 11(8): 767. DOI: 10.3390/bioengineering11080767 | 未公开 |
| 2 | ACS-YOLO | mAP@0.5 0.9706(P 0.9607 / R 0.9489 / mAP@0.5:0.95 0.5583) | 2022 | YOLOv5 + 自适应错分敏感损失(长尾) | 梁智欣, 邓戈龙, 魏夏平, 等. 长尾分布下的 PET-CT 肺癌图像的深度学习网络检测与定位探索. 中国医学物理学杂志, 2022, 39(12): 1473-1484. DOI: 10.3969/j.issn.1005-202X.2022.12.004 | 未公开 |
| 3 | YOLO-ED | mAP@0.5 0.905(P 0.907 / R 0.904,2.53M 参数) | 2025 | 改进 YOLOv8 高效检测;同表 Faster R-CNN 0.819、DETR 0.846、YOLOv3 0.843、YOLOv5 0.851、YOLOv7 0.865、YOLOv8 0.873 | Zeng Q, Hu T, Chen Z, Zheng J, Li J, Pan Y. YOLO-ED: An efficient lung cancer detection model based on improved YOLOv8. PLoS One, 2025, 20(9): e0330732. DOI: 10.1371/journal.pone.0330732 | https://github.com/111sadf/YOLO-ed |
| 4 | 官方基线(多检测模型) | mAP≈0.87(验证集) | 2020 | 2 名深度学习研究者、多模型对比 | Li P, Wang S, Li T, Lu J, HuangFu Y, Wang D. A Large-Scale CT and PET/CT Dataset for Lung Cancer Diagnosis (Lung-PET-CT-Dx). The Cancer Imaging Archive, 2020. DOI: 10.7937/TCIA.2020.NNC2-0461 | 未随数据集发布 |
§8.2 SOTA 总结与选型建议
公开基准集中在 YOLO 系检测器:轻量化方向 YOLO-ED 以 2.53M 参数拿到 0.905,长尾方向 ACS-YOLO 与 YOLOv8-LCM 均在 0.97 量级。选型建议:追求部署效率选 YOLOv8s/YOLO-ED 起点;研究长尾机制选 ACS-YOLO/YOLOv8-LCM 思路复现;需要多模态融合证据时自行构建双分支并只与本数据集内部基线(0.87)对齐比较。所有公开数字均未使用统一冻结测试集,复现时以自己的受试者冻结集为准。
两点判断:第一,0.87→0.977 的提升区间已经比较拥挤,纯检测架构微调的边际收益有限,新研究建议把精力放在 PET 融合增益、亚型可解释性与外部验证上;第二,亚型分类公开结果远少于检测,跨队列亚型迁移(本数据集 → 其他病理确认队列)是更值得投入的空白方向。
§8.3 评测协议
报告基准时建议固定:受试者级 6:2:2 划分(或 5 折分层交叉验证);输入 512×512 肺窗;IoU 0.5 报 mAP@0.5、0.5:0.95 报 COCO mAP;per-class AP 单列(尤其大细胞癌);随机种子与划分清单公开。
推荐写入论文实验节的协议卡片:
| 协议项 | 推荐值 | 理由 |
|---|---|---|
| 划分单元 | 受试者(355) | 杜绝层面级泄漏(坑点 1) |
| 划分比例 | 6:2:2 或 5 折分层 | 与 YOLO-ED 协议对齐、小类可分层 |
| 输入 | CT 单通道肺窗(可加 PET 通道) | 与官方参数一致(512×512) |
| IoU 阈值 | mAP@0.5 与 mAP@0.5:0.95 双报 | 与公开基准可比 |
| 必报项 | per-class AP + 95% CI | 大细胞癌方差极大(坑点 4/5) |
| 锚点 | 官方基线 mAP≈0.87 | sanity check |
§8.4 相关数据集
| 数据集 | 规模 | 模态 | 与本数据集的关系 |
|---|---|---|---|
| NSCLC-Radiomics | 422 例 | CT | 常用外部验证目标队列 |
| NSCLC-Radiogenomics | 211 例 | CT+分子谱 | 影像-基因组关联,外部验证补充 |
| LIDC-IDRI | 1,018 例 | CT | 纯 CT 结节基准,无 PET,可互补评测检测泛化 |
| NLST | 约 2.6 万例筛查 | CT | 大规模低剂量 CT 筛查队列,人群构成差异大 |
选用提示:做检测泛化优先配 LIDC-IDRI(标注口径成熟);做跨队列组学优先配 NSCLC-Radiomics(已有 Gouveia 2025 先例可对照);做"筛查场景 vs 临床确诊场景"的分布差异分析配 NLST,但要注意两者病灶谱系几乎不重叠。
§8.5 关键论文 Top 6
- Li P, Wang S, Li T, Lu J, HuangFu Y, Wang D (2020). A Large-Scale CT and PET/CT Dataset for Lung Cancer Diagnosis (Lung-PET-CT-Dx). The Cancer Imaging Archive. DOI: 10.7937/TCIA.2020.NNC2-0461 — 数据集官方引用条目。
- Wang L, et al. (2024). An Automated Diagnosis Method for Lung Cancer Target Detection and Subtype Classification-Based CT Scans. Bioengineering 11(8): 767. DOI: 10.3390/bioengineering11080767 — 长尾感知检测+亚型分类,公开最优量级。
- Zeng Q, et al. (2025). YOLO-ED: An efficient lung cancer detection model based on improved YOLOv8. PLoS One 20(9): e0330732. DOI: 10.1371/journal.pone.0330732 — 轻量化检测+多检测器横向对比+受试者隔离划分协议。
- 梁智欣, 等 (2022). 长尾分布下的 PET-CT 肺癌图像的深度学习网络检测与定位探索. 中国医学物理学杂志 39(12): 1473-1484. DOI: 10.3969/j.issn.1005-202X.2022.12.004 — 针对长尾的 ACS-YOLO。
- Gouveia M, et al. (2025). Comparing 2D and 3D Feature Extraction Methods for Lung Adenocarcinoma Prediction Using CT Scans: A Cross-Cohort Study. Appl. Sci. 15(3): 1148. DOI: 10.3390/app15031148 — 跨队列(含 NSCLC-Radiomics/Radiogenomics)外部验证范式。
- Dunn B, Pierobon M, Wei Q (2023). Automated Classification of Lung Cancer Subtypes Using Deep Learning and CT-Scan Based Radiomic Analysis. Bioengineering 10(6): 690. DOI: 10.3390/bioengineering10060690 — CT 影像组学+深度学习的亚型自动分类方法。
§8.6 社区活跃度
截至 2026-09,TCIA 正式页统计 36.2k 次浏览、58 次引用;数据集状态 Complete(发布后冻结,无进行中的更新分支)。生态工具成熟:官方推荐 pascal-voc-tools 解析库、Data Retriever 下载端、NCI IDC 门户提供云端浏览与两套第三方派生标注(Zenodo)。
引用来源分布:58 次引用集中于检测方法学论文(YOLO 系占主导)与多模态/组学研究;2025 年新出现的引用(如 Yu et al. 小病灶感知融合分类、Ghosh et al. 3D nnU-Net 多队列分割压力测试)显示生态正从"单模态检测"向"多模态与跨队列"方向扩展。跟踪新引用的最简方式是订阅数据 DOI 页面与 Google Scholar 提醒。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| TCIA collection 页 | 官方主页 | https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/ | 规模/版本/标注协议/license 权威来源 |
| TCIA Data Retriever | 下载客户端 | https://www.cancerimagingarchive.net/access-data/ | 官方分发渠道,支持 .tcia 清单 |
| pascal-voc-tools | Python 库(PyPI) | https://pypi.org/project/pascal-voc-tools/ | 官方推荐的 XML 解析工具 |
| NCI IDC 门户 | 云端浏览 | https://portal.imaging.datacommons.cancer.gov/collections/lung_pet_ct_dx | 免下载浏览影像与派生资源 |
| BAMF-AIMI-Annotations | 派生标注 | DOI: 10.5281/zenodo.8345959 | 第三方再标注,可交叉核对 |
| Lung-PET-CT-Dx-Annotations | 派生标注 | DOI: 10.5281/zenodo.16989819 | 第三方再标注 |
| YOLO-ED 仓库 | 模型代码 | https://github.com/111sadf/YOLO-ed | 复现 2025 轻量化基线 |
§9 相关资源与引用
§9.1 官方资源
- TCIA collection 页面(官方主页、版本历史、标注协议、license):https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/
- TCIA 数据获取说明(Data Retriever 与 API):https://www.cancerimagingarchive.net/access-data/
- TCIA Wiki(NBIA REST API、DICOM 字段与工具说明):https://wiki.cancerimagingarchive.net/
- NCI IDC 门户(云端浏览):https://portal.imaging.datacommons.cancer.gov/collections/lung_pet_ct_dx
- 数据 DOI:https://doi.org/10.7937/TCIA.2020.NNC2-0461
- 派生标注:BAMF-AIMI-Annotations(https://doi.org/10.5281/zenodo.8345959)、Lung-PET-CT-Dx-Annotations(https://doi.org/10.5281/zenodo.16989819)
- 官方推荐解析工具:pascal-voc-tools(PyPI)与官方可视化示例代码
§9.2 BibTeX 引用块
@misc{li2020lungpetctdx,
title = {A Large-Scale CT and PET/CT Dataset for Lung Cancer Diagnosis (Lung-PET-CT-Dx)},
author = {Li, P. and Wang, S. and Li, T. and Lu, J. and HuangFu, Y. and Wang, D.},
year = {2020},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/TCIA.2020.NNC2-0461}
}
@article{wang2024automated,
title = {An Automated Diagnosis Method for Lung Cancer Target Detection and Subtype Classification-Based CT Scans},
author = {Wang, L. and Zhang, C. and Zhang, Y. and Li, J.},
journal = {Bioengineering},
volume = {11}, number = {8}, pages = {767},
year = {2024},
doi = {10.3390/bioengineering11080767}
}
@article{zeng2025yoloed,
title = {YOLO-ED: An efficient lung cancer detection model based on improved YOLOv8},
author = {Zeng, Q. and Hu, T. and Chen, Z. and Zheng, J. and Li, J. and Pan, Y.},
journal = {PLoS One},
volume = {20}, number = {9}, pages = {e0330732},
year = {2025},
doi = {10.1371/journal.pone.0330732}
}
@article{gouveia2025comparing,
title = {Comparing 2D and 3D Feature Extraction Methods for Lung Adenocarcinoma Prediction Using CT Scans: A Cross-Cohort Study},
author = {Gouveia, M. and Mendes, T. and Rodrigues, E. M. and Oliveira, H. P. and Pereira, T.},
journal = {Applied Sciences},
volume = {15}, number = {3}, pages = {1148},
year = {2025},
doi = {10.3390/app15031148}
}
@article{dunn2023automated,
title = {Automated Classification of Lung Cancer Subtypes Using Deep Learning and CT-Scan Based Radiomic Analysis},
author = {Dunn, B. and Pierobon, M. and Wei, Q.},
journal = {Bioengineering},
volume = {10}, number = {6}, pages = {690},
year = {2023},
doi = {10.3390/bioengineering10060690}
}
@article{liang2022longtail,
title = {长尾分布下的 PET-CT 肺癌图像的深度学习网络检测与定位探索},
author = {梁智欣 and 邓戈龙 and 魏夏平 and 等},
journal = {中国医学物理学杂志},
volume = {39}, number = {12}, pages = {1473--1484},
year = {2022},
doi = {10.3969/j.issn.1005-202X.2022.12.004}
}
§9.3 引用指南
使用本数据集时:论文正文至少引用数据 DOI(10.7937/TCIA.2020.NNC2-0461)并注明 TCIA 与采集机构;若使用派生标注,请同时引用对应 Zenodo DOI;若复用本页面的坑点分析或 DAIMS 结论,请注明千方病案医数集页面链接与审核日期(2026-09-05)。
命名建议:方法名首次出现时标注数据来源,如 “…… trained on Lung-PET-CT-Dx (TCIA, DOI: 10.7937/TCIA.2020.NNC2-0461)”;表格中报告基准数字时附上划分协议脚注(受试者级 6:2:2 或 5 折),避免与采用其他协议的结果直接同列比较。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-15 | 9 组检索:TCIA 官方页面、亚型计数交叉验证、ICD-11/SNOMED 编码核实、基准论文元数据、派生资源 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 TCIA 官方页面、数据 DOI 条目与同行评审论文中整理结构化信息并交叉验证规模与亚型计数;(2) 核实并修正 ICD-11 与 SNOMED CT 编码映射(多源比对);(3) 生成 §6 的 Python 代码示例;(4) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(5) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(6) 构建 §C 统一 JSON-LD @graph。所有硬数字均有 §10.3 所列来源,种子信息与检索冲突处以检索结果为准并逐条记录于同目录 FACTS.md。
§10.3 输入来源
- TCIA Lung-PET-CT-Dx 官方 collection 页面(规模 355 例/436 Study/1,295 序列/251,135 图像、版本历史、标注协议、license、致谢):https://www.cancerimagingarchive.net/collection/lung-pet-ct-dx/
- Li P, Wang S, Li T, Lu J, HuangFu Y, Wang D (2020). A Large-Scale CT and PET/CT Dataset for Lung Cancer Diagnosis (Lung-PET-CT-Dx). The Cancer Imaging Archive. DOI: 10.7937/TCIA.2020.NNC2-0461
- GLOBOCAN 2022 全球与中国肺癌新发/死亡估计(经 WHO 西太平洋索引 WPRIM 收录文献转载):https://wprim.whocc.org.cn/admin/article/articleDetailPage?WPRIMID=1212755&articleId=1294168
- Merck Manual 肺癌组织学占比(NSCLC 80–85%,腺癌约 40%、鳞癌 25–30%、大细胞 10–15%;SCLC 13–15%):https://merck.com/mmpe/sec05/ch062/ch062b.html
- WHO ICD-11 编码(2C25 族及亚码,经 PMC12004595 与 KEGG br08411 交叉核实):https://pmc.ncbi.nlm.nih.gov/articles/PMC12004595/
- SNOMED CT UMLS 映射(肺腺癌 254626006、肺小细胞癌 254632001、肺鳞状细胞癌 254634000、NSCLC 254637007):JMIR 2022, e40361, https://www.jmir.org/2022/11/e40361/XML
- Zeng Q, et al. (2025). YOLO-ED. PLoS One 20(9): e0330732. DOI: 10.1371/journal.pone.0330732(含同表 Faster R-CNN/DETR/YOLOv3-v8 对比与 204 例划分协议)
- Wang L, et al. (2024). An Automated Diagnosis Method for Lung Cancer Target Detection and Subtype Classification-Based CT Scans. Bioengineering 11(8): 767. DOI: 10.3390/bioengineering11080767
- Gouveia M, et al. (2025). Comparing 2D and 3D Feature Extraction Methods for Lung Adenocarcinoma Prediction Using CT Scans: A Cross-Cohort Study. Appl. Sci. 15(3): 1148. DOI: 10.3390/app15031148
- Dunn B, Pierobon M, Wei Q (2023). Automated Classification of Lung Cancer Subtypes Using Deep Learning and CT-Scan Based Radiomic Analysis. Bioengineering 10(6): 690. DOI: 10.3390/bioengineering10060690
- 梁智欣, 邓戈龙, 魏夏平, 等 (2022). 长尾分布下的 PET-CT 肺癌图像的深度学习网络检测与定位探索. 中国医学物理学杂志 39(12): 1473-1484. DOI: 10.3969/j.issn.1005-202X.2022.12.004
- IEEE Access 2024(Study 级计数 A=264/G=62/B=44 交叉印证,DOI: 10.1109/ACCESS.2024.3462629):https://oadoi.org/10.1109/ACCESS.2024.3462629
- NCI IDC 门户 Lung-PET-CT-Dx collection(模态 SR/SEG/CT/PT、派生标注入口):https://portal.imaging.datacommons.cancer.gov/collections/lung_pet_ct_dx
- Zenodo 派生标注:BAMF-AIMI-Annotations(DOI: 10.5281/zenodo.8345959)与 Lung-PET-CT-Dx-Annotations(DOI: 10.5281/zenodo.16989819)
- 数据集生态综述页(Yu et al. 2025-08-06 多模态分类、Ghosh et al. 2025-08-26 3D nnU-Net 多队列分割压力测试):https://www.emergentmind.com/topics/lung-pet-ct-dx-dataset
- YOLO-ED 官方代码仓库:https://github.com/111sadf/YOLO-ed
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、流行病学) | 千方病案医学编辑部 | 与 PMC12004595、KEGG、JMIR 2022 多源交叉比对 | ✅ 已通过 |
| §3 数据集规格(规模、影像参数、版本) | 千方病案医学编辑部 | 与 TCIA 官方页面逐项比对 | ✅ 已验证 |
| §4 数据结构(字段字典、亚型计数) | 千方病案医学编辑部 | 官方页面 + IEEE Access 2024 口径交叉验证 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 与 YOLO-ED/Gouveia 论文协议比对 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 官方 pascal-voc-tools 文档比对 | ✅ 已通过 |
| §8 基准与引用 | 千方病案医学编辑部 | 论文原文 DOI 逐条核对 | ✅ 已验证 |
§10.5 AI 生成章节标注
全文初稿由 AI 生成:frontmatter、INFOBOX、§1-§9 正文与 §C JSON-LD 均为 AI 起草后经编辑部交叉审核;§0 免责声明为编辑部固定模板;§10.4 所列模块的数字与结论均经人工与原始来源逐项核对。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致;引用计数快照截至 2026-09-15)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- lctsc — 共享标签:医学影像 / CT / 肿瘤学 / 肺癌
- nsclc-radiomics — 共享标签:医学影像 / CT / 肺癌
- rider-lung-ct — 共享标签:医学影像 / CT / 肺癌
- nlst — 共享标签:医学影像 / CT / 肿瘤学 / 肺癌
- jsrt — 共享标签:医学影像 / CT / 肺癌
- luna16 — 共享标签:医学影像 / CT / 肺癌
- nsclc-radiogenomics — 共享标签:医学影像 / CT / 肺癌
- autopet — 共享标签:医学影像 / CT / 肿瘤学
- ct-rate — 共享标签:医学影像 / CT / 肺癌
- synthrad — 共享标签:医学影像 / CT / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
