信息速览

RIDER Lung CT — 重复扫描肺癌 CT AI-Ready Wikipedia
INFOBOX
| 数据集名称 | RIDER Lung CT(Coffee-break Lung CT) |
| 英文全称 | Coffee-break Lung CT Collection with Scan Images Reconstructed at Multiple Imaging Parameters |
| 别名/简称 | RIDER-LUNG-CT、RIDER 肺 CT 重复扫描、RIDER test-retest 集合 |
| 疾病分类 | 肺恶性肿瘤——非小细胞肺癌(ICD-11:2C25 肺癌 / 见 §2.1) |
| SNOMED CT | 254637007 Non-small cell carcinoma of lung / 363358000 Malignant tumor of lung(详见 §2.1b) |
| 数据模态 | CT(X 射线计算机断层扫描,重复扫描多重建参数)+ DICOM SEG 病灶分割 |
| AI 任务类型 | 病灶分割、影像组学特征可重复性、测量变异性分析、图像重建参数鲁棒性、数据协调(harmonization) |
| 样本总数 | 32 名患者 / 100 研究 / 936 序列 / 81,548 张图像(V3) |
| 数据大小 | 43.01 GB(V3 DICOM)/ 8.85 GB(V2) |
| 数据格式 | DICOM(CT + SEG)+ Lesion Notes XLS |
| 许可证 | CC BY 4.0(V3 影像与分割)/ Lesion Notes 为 CC BY 3.0 |
| 访问级别 | 开放(注册 TCIA 后用 NBIA Data Retriever 免费下载) |
| DUO 标签 | 开放数据(TCIA 数据使用政策要求引用署名) |
| 语言 | 英文(元数据与标注说明) |
| 首发日期 | 2012-10-18(V1)/ 2009-07-01(Zhao Radiology 论文发表) |
| 最后更新 | 2024-06-25(V3,新增全部患者六设置 CT + SEG) |
| 发布机构 | Memorial Sloan Kettering Cancer Center(MSKCC),经 NCI/The Cancer Imaging Archive(TCIA)发布 |
| 官方主页 | https://www.cancerimagingarchive.net/?p=43451 |
| 下载地址 | https://www.cancerimagingarchive.net/?p=43451 |
| DOI | 10.7937/k9/tcia.2015.u1x8a5nr(数据 V3)/ 10.1148/radiol.2522081593(Zhao 2009)/ 10.1038/s41597-024-04085-3(2024 数据论文) |
| 引用次数 | 38+(TCIA 页面标注,截至 2024-06) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 影像组学可重复性研究的世界级参考集、标注完整、2024 年扩为六设置;扣分项:无官方 train/test 划分、需自行实现队列组织、配套 SEG 分散在分析结果子集 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、NSCLC 病灶测量与 RECIST 临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(DICOM 层级、六设置组织、subject 标识体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 MSKCC、NCI、The Cancer Imaging Archive(TCIA)无任何商业利益关联。本页面不销售 RIDER Lung CT 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 MSKCC、NCI 或 TCIA 的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。RIDER Lung CT 为开放数据,使用前须在 TCIA 注册,并遵守 TCIA 数据使用政策与限制;引用时必须包含官方指定的 DOI 引用(Data Citation Required)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? RIDER Lung CT(Reference Image Database to Evaluate Therapy Response)是由美国国家癌症研究所(NCI)发起的 RIDER 计划下、Memorial Sloan Kettering 癌症中心贡献的一组「咖啡杯重复扫描」胸部 CT:32 名非小细胞肺癌(NSCLC)患者在同一天、同一台扫描仪、同一协议下、约 15 分钟内被连续扫描两次。因为两次扫描间隔极短、肿瘤几乎没有任何生长变化,这一对「test–retest」图像恰好完整记录了纯粹由设备、摆位、患者与测量方法带来的噪声——医学上称之为「零假设下的测量变异」。2024 年该集合被扩展:每一幅原始扫描都被重建为 1.25/2.5/5 mm 三种层厚 × 肺/标准两种重建核共 6 种图像设置(M-setting),并附带 32 例病灶的放射科医生勾画参考标准。
为什么重要? 要判断某次治疗后肿瘤尺寸变化到底「算不算缩小」,必须先知道测量本身有多大的误差。RIDER Lung CT 提供了医学影像界稀缺的「真实零变化」地面真值:同一肿瘤、同一天、只是被重拍了一次。由此可以量化 CT 肿瘤单径/双径/体积测量的变异性(Zhao 2009 结论:单径变化 ≥8% 才超过测量噪声),也成了影像组学(radiomics)领域的基石——2014 年 Aerts 那篇引用极高的 Nature Communications 论文正是用这 31 组 test-retest 影像来筛选「可重复的影像组学特征」。它是评估 CT 重建参数对定量成像特征影响、做数据协调与算法鲁棒性测试的世界级参考集。
我能用它做什么? 你可以用它训练病灶分割模型并在重复扫描上检验分割的稳定性;用它做影像组学特征的可重复性筛选(ICC/Cronbach 阈值过滤不稳定特征);用它研究不同 CT 重建参数对 AI 特征的影响并测试去协调/归一化方法;还可以把它当作验证「你的量化算法在零生理变化下不会虚报变化」的标准测试台。数据为开放许可(CC BY 4.0),注册 TCIA 后即可免费下载。
§1.1 摘要
RIDER Lung CT 是一组用于评估肿瘤治疗反应量化测量的公开重复扫描 CT 影像集合,隶属于 NCI 发起的 Reference Image Database to Evaluate Therapy Response(RIDER)计划,由 Memorial Sloan Kettering 癌症中心采集并通过 The Cancer Imaging Archive(TCIA)发布。数据本体为 32 例确诊非小细胞肺癌(NSCLC)的患者,每例在同一天于同一台 GE CT 上、同一成像协议下、约 15 分钟内完成两次全胸部 CT 扫描(即「咖啡杯重复扫描」设计),使肿瘤在两次扫描间处于近似零生理变化状态,从而隔离出成像链路本身的测量噪声。
原始的单设置版本(1.25 mm 层厚 + 肺重建核,1.25L)自 2012 年随 RIDER 项目在 TCIA 发布,成为影像组学领域公认的 test-retest 可重复性分析资源。2024 年 6 月发布的 V3 扩展了全部六种重建设置:每幅原始扫描按 1.25、2.5、5 mm 三种层厚与 lung、standard 两种重建核重建为 6 组图像(1.25L/1.25S/2.5L/2.5S/5L/5S),并将体积扩至 43.01 GB、32 受试 100 研究 936 序列 81,548 张图像,同时补充了由经验放射科医生基于院内分割算法校正的 32 例病灶 DICOM SEG 勾画。全部影像经 DICOM Supplement 142 临床去标识化处理,受试以 RIDER-XXX 不透明编码标识。
该数据集的独特价值在于它同时提供了「重复扫描(inter-scan 变异性)」与「多重建设置(imaging-parameter 敏感性)」两种受控变异的维度,使其成为验证量化成像生物标志物(QIB)、影像组学特征稳定性、以及 AI 分割/分类方法鲁棒性的标准测试平台。Zhao 2009(Radiology)确立单径 ≥8% 变化阈值;Aerts 2014(Nature Communications)以其中 31 组扫描筛选稳定影像组学特征;2024 年 Scientific Data 数据论文进一步规范了六设置版的数据记录与分割协议。
从方法论结构看,本集合属于 RIDER 计划下的「coffee-break」重复测量分支。RIDER 计划由 NCI 通过一系列与学术中心的合同开展,覆盖 CT、PET/CT、DCE MRI、扩散加权 MRI 等多个模态与肺、乳腺、神经等器官部位;MSKCC 承担其中的肺 CT 重复测量,其目标是生成一个「肿瘤零生理变化」但完整包含扫描噪声、摆位误差与患者运动伪影的公共参考集,以便把治疗疗效的测量从噪声中分离出来。RIDER 的长期目标是促成跨商业成像平台的数据采集与分析协调,从而支持将影像作为治疗反应生物标志物的多中心临床试验。MSKCC 贡献的这 32 例、每例两次系列肺部 CT 数据,正是这一宏观目标在肺癌 CT 模态上的具体落点。
在数据组织上,需特别留意 test 与 retest 的关系。TCIA 以 StudyInstanceUID 区分两次扫描,以 SeriesInstanceUID 区分同一扫描内的六种重建设置;Lesion Notes 表格则记录了每个病灶在两个扫描中的示例图像与坐标。理解「患者-扫描-设置-切片」的四级嵌套是正确做统计与防泄漏的前提(详见 §4.4 与 §5.3)。同时,由于去标识化剥离了年龄、性别等人口学字段,本集合并不支持人口亚组分析,研究者应将范围限定在成像方法与算法鲁棒性的层面。
§1.2 战略价值
维一——影像组学与量化成像的可重复性金标准。 影像组学研究从医学影像中提取成百上千个定量特征(强度、形状、纹理、小波)用于肿瘤表型刻画与预后建模,但特征若随扫描设备、层厚、重建核或一次重摆位而剧烈漂移,则模型毫无临床应用价值。RIDER Lung CT 是全球极少数公开的「真实患者 test-retest」集合:Aerts 等以其中 31 组对 440 个特征计算 intraclass correlation 稳定秩,据此筛出稳定特征并构建四特征预后签名,确立了「先可重复性筛选、再预后建模」的影像组学方法学范式。此后大量影像组学可重复性研究以本集合作外部验证锚点(如以 CCC ≥0.85 判别鲁棒特征的跨集合研究)。这一「测量噪声地面真值」角色短期难以被普通临床影像取代,是其不可替代的战略价值所在。
维二——CT 重建参数鲁棒性与数据协调(harmonization)研究基准。 多中心 CT 因扫描仪厂商、重建核、层厚差异,令定量成像特征与 AI 模型出现系统漂移。RIDER Lung CT 的六设置设计(同一原始投影、同一患者,仅改变层厚与重建核)把「成像参数」这一混杂因素从「患者个体差异」与「扫描间隔生理变化」中干净地剥离出来,使研究者能精确测量并校正重建参数对特征值的影响。2024 年扩集即明确面向这一用途:比较六种参数设置下的 QIB、验证数据协调方法、识别最适合肺肿瘤影像组学的 CT 参数组合。它是 CT 参数敏感性研究的受控实验平台,弥补了传统回顾性队列无法分离该变量的缺陷。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 RIDER Lung CT 的差异化 |
|---|---|---|---|---|
| RIDER Lung CT(本数据集) | 32 例 NSCLC 同日重复扫描 | CT + SEG | 32 病灶放射科医生勾画(六设置) | 同机同日 test-retest + 多重建核,唯一「真实零变化」CT 集合 |
| RIDER-LUNGCT-SEG(分析结果) | 31/32 例 | CT + RTSTRUCT/SEG | 肿瘤医生盲法 GTV 手工 + 自动分割 | 侧重分割变异性,无临床结局 |
| RIDER Phantom PET-CT | 20 组体模 | PET/CT | 体模协议 | 体模而非患者,测仪器重复性 |
| RIDER Lung PET-CT | 244 例纵向 | PET/CT | 无 | 治疗纵向变化,非同日重复 |
| NSCLC-Radiomics(Lung1) | 422 例训练队列 | CT | 临床结局 | 有生存结局,无重复扫描 |
| LIDC-IDRI | 1,010 例 | CT | 结节 4 医生双读标注 | 筛查人群结节,非治疗反应测量 |
| Lung-PET-CT-Dx | 涉及多个 | PET/CT | 分期结局 | 无同日重复设计 |
横向对比显示,RIDER Lung CT 在「真实患者、同日重复、零生理变化」这个坐标系上是独一无二的。LIDC-IDRI 虽拥有大量带专家标注的肺结节 CT,但其数据来自筛查人群、以结节检出与表征为主,不提供同一患者的重复扫描,因此无法直接量化「测量工具自身的重复性」。NSCLC-Radiomics(Lung1 等)带生存结局、规模更大,却没有 test-retest 结构,故影像组学论文常用 RIDER 做特征稳定性的「校验锚点」,再用 Lung1 做预后训练——两者互补而非竞争。RIDER 家族内,Phantom PET-CT 等体模集合虽然能测仪器重复性,但体模缺乏真实患者的解剖复杂性与运动伪影,无法完全替代患者重复扫描;而 Lung PET-CT 是纵向随访、间隔较长,包含真实疗效变化,反而无法作为「零变化」参考。因此对需要严格控制生理变化的研究,患者级同日重复 CT 仍是不可替代的首选。
§1.4 版本时间轴
| 版本/事件 | 日期 | 规模变化 | 说明 |
|---|---|---|---|
| 影像采集 | 约 2009 年前 | 32 例同日双扫描 | MSKCC 前瞻性 IRB 研究(NCT00579852) |
| Zhao 论文发表 | 2009-07-01 | — | Radiology 252(1):263–272 确立测量变异性基准 |
| TCIA V1 | 2012-10-18 | 32/46/153/15,509 | RIDER 计划单设置(1.25L)首传 |
| TCIA V2 | 2014-11-14 | 32/46/153/15,509,8.85 GB | 修正 RIDER-8509201188 重复序列;CC BY 3.0 |
| Aerts 论文发表 | 2014-06-03 | — | Nature Communications 用 31 组做影像组学稳定性筛选 |
| M-setting 扩集 | 2024-06-25(V3) | 32/100/936/81,548,43.01 GB | 新增全部六设置 CT + SEG;CC BY 4.0 |
| 2024 数据论文 | 2024 | — | Scientific Data 10.1038/s41597-024-04085-3 描述六设置版 |
版本时间轴的阅读要点:① 患者与病灶本体自 2012 年即固定为 32 例,后续版本不新增患者,只调整重建覆盖与质量;② 许可在 V2(CC BY 3.0)与 V3(CC BY 4.0)间有变化,引用与再分发义务随之调整;③ 2024 年六设置扩集是「从 1 种设置到 6 种设置」的能力跃迁,而非量的堆叠——它让研究者从只能测「同设置重扫变异性」扩展到能测「重建参数敏感性」;④ 早期(2009 前)的原始采集早于任何 TCIA 发布,追溯原始协议应以 Zhao 2009 与 2024 数据论文为准而非版本号。做文献综述时,若你引用一篇 2015 年前、基于 RIDER 的影像组学研究,其数据面几乎必然是单设置 1.25L——与新六设置研究的结果在「参数带宽」上不可直接等同,需在对比时说明设置范围。
§1.5 典型应用场景
- 影像组学特征可重复性筛选:用 test–retest 两组扫描计算每个特征在重复测量间的稳定系数(ICC、CCC、Cronbach α),剔除不稳定特征后再进行预后建模或特征选择——这是 RIDER 最经典、引用最多的用途。
- 病灶分割模型的鲁棒性基准:训练分割模型后,在 32 例的两次同日扫描与六重建设置上检验其掩膜/体积输出的稳定性,识别对层厚与重建核敏感的分割算法。
- 肿瘤测量变异性方法学研究:量化单径、双径与体积测量在重复扫描下的 95% 一致性界限,验证新的自动测量算法是否能把测量噪声压到 RECIST/WHO 阈值以下。
- CT 成像参数协调(harmonization)研究:对比六种重建设置下的 QIB 与 AI 特征漂移,开发并验证跨中心/跨参数的数据归一化方法。
- AI 模型的泛化鲁棒性压力测试:把六设置版本当作天然的数据增强/分布偏移源,测试模型在重建参数变化下的表现衰减,评估方法在真实多中心部署前的稳健度。
以最经典的第 1 个场景为例,一个完整的可重复性筛选工作流通常包含五步:
- 下载并解析 32 例 test/retest(建议先取 1.25L 单设置,约 8.85 GB,见 §6.2)。
- 用同一分割/特征提取管线分别在 test 与 retest 上对同一病灶提取特征(如 PyRadiomics 的 440+ 特征)。
- 对每个特征计算 test-retest 间的稳定系数(ICC/CCC,可参考 §6.9 的实现)并排序。
- 设定稳定阈值(如 CCC≥0.85)选出一批「稳定特征」进入后续建模。
- 在带生存结局的独立队列(如 NSCLC-Radiomics/Lung1)上验证这些稳定特征的预后价值——RIDER 本身不参与预后训练,只负责去噪。
其余场景依此类推,核心都落在「用零变化的成对数据把测量噪声与真实信号分离」这一思想上。更完整的分步代码见 §6.1–§6.4。
§2 医学背景
§2.1 ICD-11 编码表
| ICD-11 代码 | 类别 | 中文名 | 在本数据集中的意义 |
|---|---|---|---|
| 2C25 | 恶性肺肿瘤 | 肺恶性肿瘤 | 数据集中 32 例均为肺癌 |
| 2C25.0 | — | 非小细胞肺癌(细分亚型) | 全部纳入患者的病理类型 |
| XH9MZ6 | — | 腺癌(adenocarcinoma,字典扩展) | 常见的 NSCLC 亚型之一 |
| XH4N58 | — | 鳞状细胞癌(squamous carcinoma,字典扩展) | 常见的 NSCLC 亚型之一 |
说明:NSCLC 在 ICD-11 中主要由 2C25 肺恶性肿瘤及其 .Y/.Z 亚类表示,具体组织学亚型属 WHO 肿瘤分类体系;表中扩展码供编码检索参考。
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 代码 | 术语(SNOMED 英文) |
|---|---|---|---|
| 非小细胞肺癌 | 2C25 | 254637007 | Non-small cell carcinoma of lung |
| 肺癌(恶性肿瘤) | 2C25 | 363358000 | Malignant tumor of lung |
| 计算机断层扫描 | 非编码 | 77477000 | Computed tomography of chest |
| 肿瘤大小(测量) | 非编码 | 250545002 | Tumor size measurement |
| 治疗反应评估 | 非编码 | 386434001 | Assessment of response to treatment |
§2.2 疾病简介与流行病学
肺癌是全球癌症死亡的首要原因,非小细胞肺癌(NSCLC)约占肺癌病例的 80% 以上,涵盖腺癌、鳞癌与大细胞癌等主要亚型。在治疗过程中,影像学是评估肿瘤对放化疗与靶向治疗反应的核心手段——临床上广泛采用 WHO/RECIST 标准,以 CT 图像上肿瘤单径(unidimensional)或双径(bidimensional)尺寸的变化判定完全缓解、部分缓解、稳定或进展。然而肿瘤尺寸测量本身携带设备与读数噪声:同一肿瘤在不同扫描、不同摆位、不同读片者、不同层厚与重建核下会测得略异的值,若治疗前后的变化淹没在这些噪声里,则可能造成假性进展或假性缓解。
这一「测量噪声」问题对疗效生物标志物的开发有深远影响。若一次真实的肿瘤缩小被读片者判定为无变化,患者可能被错误地留在无效且昂贵的治疗方案中;反之,若仅因重摆位或不同重建导致的名义尺寸缩小被判为「缓解」,则可能过早切换治疗。因此,业界需要知道在「没有任何生理变化」的前提下,同一病灶的量化测量究竟会在多大范围内漂移——这正是所谓「零假设」数据:只包含采集与分析方法引入的噪声,而不包含疾病本身的信号。RIDER 计划的「coffee-break」重复扫描设计,就是为每一种模态与测量工具估计这个零假设下的测量方差。
RIDER 计划正是针对这一临床痛点而设立:为量化治疗反应的影像测量建立可重复、可互比的公开参考数据。RIDER Lung CT 用「同日两次扫描、肿瘤零生理变化」的实验设计,直接量出「没有疗效变化时测量会漂移多少」,从而定义疗效判定所需的真实最小变化量。Zhao 2009 据此给出经典结论:单径变化需 ≥8% 才超出计算机辅助测量的变异范围,可作为评估患者治疗结局的显著性界值。这一界值对临床研究的效应量设计与样本量计算有直接的量化指导意义:若疗效研究把「进展」判定建立在小于测量噪声的变化上,其结论在统计上不可靠。
值得强调的是,本数据集的医学本体是「病灶测量的元研究」,而非直接的患者诊疗数据。它回答的是「如何测量」而非「患者是什么病、预后如何」——它是把 CT 肿瘤测量与影像组学推向临床级可靠性所需的「测量科学」基础设施。因此,理解本数据集的关键在于把注意力放在测量变异性、重复性、与成像参数敏感性上,而不是把它当作一个新的肺癌诊断或预后队列来使用。
§2.3 临床任务定义
| 任务 | 定义 | 在本数据集中的体现 |
|---|---|---|
| 病灶测量 | 在 CT 上量化肿瘤单径/双径/体积 | 3 名放射科医生手工测量 + 软件辅助(Zhao 2009) |
| 治疗反应测量变异性评估 | 判断测量噪声是否淹没真实疗效信号 | 同日重复扫描的 95% 一致性界限 |
| 病灶分割 | 勾画肿瘤边界供体积/特征计算 | 32 例 DICOM SEG 参考勾画 |
| 影像组学特征可重复性 | 评估定量特征在重复扫描下是否稳定 | ICC/CCC 稳定秩筛选(Aerts 2014) |
| 成像参数敏感性 | 评估重建参数对定量成像的影响 | 六设置(3 层厚 × 2 核)对比 |
需要强调的是,上述前两项任务(病灶测量与变异性评估)本质是「测量科学」而非「疾病诊断」:它们服务于判断一个治疗前后变化在统计上是否可信,而不是判断病灶的良恶性。本数据集中并没有良/恶性或病理亚型的类别标签——若研究者把病灶测量任务误解为分类任务,就会因为缺少真实标签而陷入坑点 6 所述的方法学误区。病灶分割(第三项)在本集中有可用的 DICOM SEG 监督信号,但它标的是「肿瘤边界在哪里」,同样不含「这是什么病」。因此,适合的 AI 任务应当是那些只需要解剖边界与像素强度的任务(分割、体积测量、特征提取与稳定性评估),而非需要组织学或结局语义的任务。
§2.4 患者人群
| 属性 | 取值 | 来源 |
|---|---|---|
| 来源 | Memorial Sloan Kettering Cancer Center,纽约 | TCIA 官方页 |
| 时间 | 2009 年前采集(论文 2009 发表) | Radiology |
| 人数 | 32 | TCIA |
| 诊断 | 非小细胞肺癌(NSCLC) | TCIA |
| 治疗状态 | 接受系统治疗中(研究入组) | TCIA 描述 |
| 性别/年龄 | 未在公开元数据中披露(去标识化后省略) | — |
| 就医类型 | 肿瘤中心住院/门诊治疗随访 | — |
| 病灶数 | 每例 1 个病灶(全集合 32 病灶) | Scientific Data 2024 |
人群局限提示:本集合的患者均为在 MSKCC 接受系统治疗的 NSCLC 患者,属于「正在接受治疗」而非「初诊筛查」人群;每例仅记录一个病灶,未覆盖多发转移或同时性多原发。去标识化剥离了年龄、性别、种族、吸烟史与治疗细节等字段,意味着研究者无法用它做任何人口学分层分析,也无法复现 Zhao 2009 若涉及的亚组(如按性别/年龄)——因为那些信息并未随公开数据发布。若你的问题需要人群描述性统计,应转向带完整临床元数据的集合;RIDER 只适合回答「成像测量/算法在噪声下的行为」这类不依赖人口学标签的方法学问题。
§2.5 临床价值
RIDER Lung CT 的临床价值不是直接诊断,而是为「量化成像作为疗效生物标志物」提供了方法学地基。其一,它给出了 CT 肿瘤测量的真实噪声水平:Zhao 2009 显示计算机辅助测量的单径 95% 一致性界限约 (−7.3%, 6.2%),据此提出 ≥8% 的变化判据,直接影响临床研究中如何判定疾病进展的样本量与效应量设计。其二,它为影像组学等新兴 AI 定量方法提供了「哪些特征真实反映肿瘤、哪些只是测量噪声」的可重复性标尺,降低将噪声特征误报为生物标志物的假阳性风险。其三,六设置扩集进一步揭示了层厚与重建核对定量特征的系统性影响,为多中心影像标准化与数据协调(harmonization)提供直接证据。
从更广的转化医学视角看,这套数据回答的是一个放之各癌种而皆准的方法学问题:把一个量化读数当作生物标志物之前,必须先知道它的测量误差有多大。 无论 RECIST 时代的单径、双径,还是影像组学时代的高维特征,乃至将来深度学习直接输出的肿瘤负担,都受制于同样的噪声约束。RIDER Lung CT 把「真实生理零变化」这一最难获得的实验条件落到公共数据集上,意味着任何研究者都能在此量出自家的测量/算法在该零变化条件下会产生多少虚假波动——这一验证在缺乏该数据集时往往因伦理与操作成本而无法开展。正因如此,它的影响横跨放射学方法学、药物临床试验设计(确定可被可靠检测的最小疗效)、以及影像组学的工程规范三个层面。
§2.6 金标准
| 划分维度 | 标注/划分方式 | 标注者 | 性质 |
|---|---|---|---|
| 病灶分割参考 | 32 病灶(每例 1 个),放射科医生借助院内算法校正后勾画 | 有经验放射科医生 | 专家人工+算法辅助半自动 |
| 肿瘤测量参考 | 单径/双径手工测量(Zhao 2009) | 3 名放射科医生 | 专家人工(含重复读片) |
| 体积/双径自动测量 | 计算机软件辅助 | 算法 | 自动 |
| GTV 手工勾画(RIDER-LUNGCT-SEG) | 盲法 GTV 手工 + 院内自动分割 | 放射肿瘤医生(对全部勾画盲) | 专家人工 + 自动 |
| 疾病真相 | 零生理变化(同日重复) | 实验设计假设 | 结构性参考 |
注意:本数据集不含病理金标准或临床结局标签,其「金标准」是实验设计层面的零变化假设,而非组织学诊断——任何基于分割的验证都应理解这一区别。
为什么「零变化假设」可信。 同日两次扫描间隔仅约 15 分钟,患者在同一次就医中被要求离机后重新摆位扫描,期间肿瘤几乎不可能发生可在 CT 上观测的宏观生长或消退——可观测的肿瘤体积变化通常以周为时间尺度演化。因此,任何在 test 与 retest 之间测量到的差异都可归因于:(1) 患者摆位与呼吸运动的差异;(2) 扫描仪重建与噪声;(3) 病灶边界在层厚/重建核下的显示差异;(4) 读片者或算法的勾画差异。这套实验正是为把「真实疗效信号」与「以上四类测量噪声」区分开而设计的。反之,若研究目标是纵向随访中的真实疗效变化,则应使用间隔较长的队列(如 RIDER Lung PET-CT 的 244 例纵向研究)——两类数据解决的问题不同,使用时应各归其位。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本/子集 | 大小 | 理由 |
|---|---|---|---|
| 影像组学可重复性筛选(经典做法) | V2 单设置 1.25L(RIDER Lung CT) | 8.85 GB | Aerts 2014 同款数据,社区研究可比 |
| 重建参数敏感性 / 六设置对比 | V3 六设置(M-setting Repeat Lung CT) | 43.01 GB | 唯一含全部 3 层厚 × 2 核的版本 |
| 分割模型鲁棒性基准(含掩膜) | V3 全套 CT + SEG | 43.01 GB | 六设置下掩膜齐备 |
| 快速原型 / 2D 分割实验 | Kaggle 2D PNG 衍生版 | 视需 | 已切片对齐掩膜,免去 DICOM 解析 |
| 分割变异性研究 | RIDER-LUNGCT-SEG(独立分析结果) | 956.69 MB | 肿瘤医生盲法 GTV + 自动分割对照 |
§3.1 模态详情
数据模态为 X 射线计算机断层扫描(CT)及其衍生病灶分割,不涉及 PET/MR。每例患者做一次扫描被重建为 6 组图像设置,每组对应一种「层厚 × 重建核」组合:层厚取 1.25、2.5、5 mm 三档,重建核取 lung(肺、锐化)与 standard(标准、平滑)两档,记号分别为 1.25L、1.25S、2.5L、2.5S、5L、5S。原单设置版本 1.25L 自 2012 年随 RIDER 项目发布,六设置版本于 2024 年 6 月补齐。采集使用 GE CT 设备;文中给出的采集参数示例包括管电流 299–441 mA(二次扫描 298–351 mA)、pitch 1.375:1(0.984:1)。病灶标注为 DICOM SEG 格式。所有影像按 DICOM Supplement 142 临床去标识化。
这六种设置的设计依据是它们在肺癌临床实践与临床试验中的普遍使用。1.25 mm 的薄层 + 肺核(1.25L)是影像组学与精确体积测量的常见选择,因其提供较锐利的边缘与较细的空间采样;而 5 mm 厚层 + 标准核(5S)则更接近一些机构做常规随访与病灶追踪时的默认重建,牺牲空间分辨但降低噪声、提升信噪比。介于两者之间的 2.5 mm 与各核组合覆盖了从筛查、病灶追踪到放射治疗计划的常见参数带宽。因此,把这六种设置并置于同一批患者上,等于在一个受控条件下「扫掠」了真实世界常用的成像参数域——这正是研究定量特征对层厚与重建核敏感性的理想实验平台。相较把多中心差异与患者差异纠缠在一起的回顾性数据,这里的参数差异被干净地隔离了出来。
设置维度对定量成像的影响方向。 结合影像学经验与前述稳定性文献,可从两个参数轴预判差异来源:
| 参数轴 | 变化方向 | 对定量特征/测量的典型影响 |
|---|---|---|
| 层厚增厚(1.25→2.5→5 mm) | 空间分辨下降、部分容积效应增强 | 体积偏小、纹理被平滑、锐利边缘特征(如小波高频)更易不稳定 |
| 重建核(LUNG→STND) | 边缘由锐利变平滑、噪声谱改变 | HU 直方图方差与纹理能量变化、边缘相关特征漂移 |
| 两层叠乘 | 噪声与空间分辨的耦合作用 | 高阶纹理/小波特征最敏感、一阶均值相对稳健 |
这一「定性先验」有助于你在读结果时区分「生理差异」与「参数伪影」:若某特征在层厚从 1.25 增至 5 mm 时显著漂移,多半是空间分辨与部分容积效应所致,而非肿瘤真实变化——这正是做参数敏感性/协调研究时要捕捉与校正的对象。
§3.2 子集样本数
| 子集/版本 | 患者 | 研究 | 序列 | 图像 | 大小 | 许可 |
|---|---|---|---|---|---|---|
| V1(1.25L,2012) | 32 | 46 | 153 | 15,509 | — | — |
| V2(1.25L,2014) | 32 | 46 | 153 | 15,509 | 8.85 GB | CC BY 3.0 |
| V3(六设置,2024) | 32 | 100 | 936 | 81,548 | 43.01 GB | CC BY 4.0 |
| RIDER-LUNGCT-SEG(分析结果) | 31 | 43 | 118 | 118(RTSTRUCT/SEG) | 956.69 MB | CC BY 3.0 |
患者层面恒为 32 例(RIDER-LUNGCT-SEG 为 31 例)。V3 相较 V2 的研究/序列/图像数激增,是因为同一原始扫描被重建为多组参数设置并以独立系列存储。
规模解读。 从 15,509 张(V2 单设置)增至 81,548 张(V3 六设置)看似翻了五倍多,但底层患者与原始采集并未增加——增长全部来自把每幅扫描重建为六种(层厚 × 重建核)组合并把它们作为独立 DICOM 系列存放。这带来一个重要推论:图像文件数不等于独立信息量。对统计模型而言,同一设置内的相邻切片、以及同一原始扫描的不同设置,都共享大量底层解剖信息,属高度相关的观察而非独立样本。因此,任何按「图像张数」来评估有效样本规模的做法都会高估数据集的实际自由度。若要做分割模型的监督训练,真正的独立样本上限是 32 例患者(或按病灶 32 个);若做可重复性分析,样本单元是 32 个 test-retest 患者对;若做重建设置对比,则是在患者×设置的受控网格上观察,仍需以患者为随机效应来推断。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 原始 CT | DICOM(CT) | 16 位 Hounsfield 值,多系列按设置分组 |
| 病灶勾画 | DICOM SEG | 像素级二值掩膜对象 |
| Lesion Notes | Microsoft Excel(XLS) | 含病灶 RIDER ID、示例图像、双扫描坐标 |
| 元数据摘录 | TCIA 站点 + IDC | 通过 NBIA/TCIA 检索 |
§3.4 存储大小
V3 影像主体 43.01 GB(DICOM),另配 Lesion Notes XLS 约 464.5 KB;如需本地全量六设置版建议预留 ≥100 GB 磁盘(含下载与解压)。仅需经典单设置影像组学研究时,V2 的 8.85 GB 更精简。若使用 Kaggle 2D PNG 衍生版,则按实际切分数(49 CT–SEG 配对、52,981 切片与掩膜)另行估算。
§3.5 标注方式
病灶分割以「人工为主、算法辅助」方式进行:一名有经验放射科医生借助院内肺病灶分割算法(已集成到基于开源 Weasis 的图像分析平台),在算法初稿基础上用轮廓编辑工具校正得到最终勾画。为降低读片记忆偏倚,32 个病灶的分割拆分为 12 个读片会话(每个会话处理一个图像设置:2 次重复 × 6 设置/扫描),任意两次读片会话间隔 2–3 周。Zhao 2009 的测量标注则来自 3 名放射科医生的独立手工测量(含对首幅扫描的二次重复读数)与计算机软件辅助测量。RIDER-LUNGCT-SEG 另提供放射肿瘤医生对 31 例盲法手工 GTV 与院内自动分割的结果。
§3.6 标注者资质与一致性
标注者为有经验的放射科医生与放射肿瘤医生。一致性方面:Zhao 2009 报告 3 名放射科医生单径/双径手工测量的可重复性(同幅重读)与可再现性(跨扫描)的 CCC 均 ≥0.96,计算机辅助测量更高(CCC 达 1.00)。这为分割/测量质量提供了方法学层面的高一致性背书。六设置分割未逐读者做差异统计,但通过 2–3 周会话间隔设计显式抑制了跨设置记忆偏倚。
§3.7 采集周期
同一天内完成两次全胸部 CT 扫描,两次间隔约 15 分钟(间隔极短,近似零生理肿瘤变化)。前瞻性研究经 IRB 批准并获取患者知情同意,登记于 ClinicalTrials.gov(NCT00579852),在治疗过程中按系统治疗方案采集。完整集合采集至 2009 年论文发表时已完备,此后仅做重建/重发布而非新增患者。
§3.8 地域覆盖
单中心、单国采集:美国纽约州纽约市 Memorial Sloan Kettering Cancer Center。全部 32 例来自该中心接受系统治疗的 NSCLC 患者。这一地理/中心单一性意味着结论的外推需谨慎(详见 §7 偏倚分析)。
§3.9 设备规格
| 属性 | 取值 |
|---|---|
| 设备厂商 | GE(GE CT equipment) |
| 层厚设置 | 1.25 mm / 2.5 mm / 5 mm |
| 重建核 | lung(锐化)/ standard(平滑) |
| 管电流(示例) | 299–441 mA(首扫)/ 298–351 mA(二次扫描) |
| Pitch(示例) | 1.375:1 / 0.984:1 |
| 扫描对象 | 全胸部(肺野)CT |
设备与协议代差提示:上述管电流/pitch 数值来自 2024 数据论文对某批次的示例描述,意在说明协议大致范围;不同患者的实际参数可能有差异,且原文示例在「首扫/二次扫描」间显示了略异的管电流范围(299–441 mA 对 298–351 mA),提示采集分两次且存在轻微参数波动。引用具体参数时请回到每幅 DICOM 头的标签为准,避免以某一示例概括全集。此外,数据来自约 2000 年代末的 GE 设备——若你的目标是在当前多中心/多厂商设备上部署,需注意协议代差可能引入的系统性漂移(见 §7.6),而不能假定本集参数仍代表现代常规。
§3.10 深度溯源链
采集(MSKCC,GE CT)→ 同日重复两次扫描(约 15 min 间隔,零生理变化假设)→ 原始投影按 6 组设置重建(层厚 × 重建核)→ 病灶分割(放射科医生 + 院内算法)→ DICOM Supplement 142 去标识化 → 1.25L 设置 2012 年经 RIDER 计划入 TCIA → 六设置 2024-06 以 V3 扩展 → 衍生分析结果 RIDER-LUNGCT-SEG 独立发布。每一环节的去标识化与格式规范均由 TCIA 策展流程保障,但 TCIA 明确声明其策展只保证数据完整性与可发现性,不验证采集过程或社区分析结论。
溯源中的可审计线索。 下表把数据从原始采集到 AI 可用的每一步所留的「可审计证据」列出,方便你在复现与报告时核对:
| 溯源环节 | 可审计证据 | 存放位置 |
|---|---|---|
| 患者入组 | ClinicalTrials.gov 标识 NCT00579852 | 官方登记 |
| 采集协议 | 管电流/pitch/层厚/重建核 | DICOM 头 + 2024 数据论文 |
| 去标识化 | DICOM Supplement 142 | 数据论文 + TCIA |
| 版本修正 | V2 重复序列移除记录 | TCIA 版本历史 |
| 分割标注 | 12 会话、2–3 周间隔协议 | 2024 数据论文 |
| 集合归属 | RIDER-XXX 受试 + collection ID | DICOM/TCIA |
对复现的意义。 溯源链中每一项都可落到具体 DICOM 标签或官方文档,意味着你可以从原始 .dcm 出发完整重建论文所用数据面而无需依赖第三方缓存。这是本集合相对部分「黑盒」医学数据集的工程优势:方法学与数据版本都可逐层审计。建议把「引用了哪些层级、核对了哪些 UID、用了哪个版本」写入方法节,使任何后续研究都能在相同数据面上复现——这也是影像组学可重复性研究本身的应有之义。
§4 数据结构
§4.0 目录树
rider-lung-ct/
├── RIDER-LungCT-version3/ # V3 六设置影像(NBIA 下载根)
│ ├── RIDER-11291649406/ # 患者级目录,ID 形如 RIDER-XXX
│ │ ├── <studyUID-Test>/ # 第一次检查(test)
│ │ │ ├── <seriesUID-1.25L>/ # 设置 1.25L
│ │ │ │ └── *.dcm # 轴向切片
│ │ │ ├── <seriesUID-2.5S>/ # 设置 2.5S(同一 test 的另一重建)
│ │ │ └── ...
│ │ ├── <studyUID-Retest>/ # 第二次检查(retest)
│ │ │ └── <seriesUID-...>/ # 各设置系列
│ │ └── <SEG-seriesUID>/ # 病灶 SEG 掩膜系列
│ ├── RIDER-2283289298/
│ └── ... # 共 32 个患者目录
├── LesionNotes (RIDER Lung CT).xls # 病灶坐标注释
└── (Metadata清单) # TCIA/IDC 检索导出的 csv
注解:每例患者的 test 与 retest 是两个不同的 StudyInstanceUID;同一 Study 下的 6 个 SeriesInstanceUID 对应 6 种重建设置;SEG 掩膜可能作为独立系列出现并需按 SOPInstanceUID/FrameOfReferenceUID 与对应 CT 对齐。目录命名因下载器而异,切勿依赖文件夹名判读设置——请一律从 DICOM 头的 SliceThickness / ConvolutionKernel 读取(见 §6.1 的
setting_key)。
§4.1 DAIMS 字段字典
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SubjectID(RIDER-XXX) | Text | 不透明患者编码 | RIDER-11291649406 | 患者级分组/防泄漏 | 无 | 无 | 32 个唯一值 |
| CollectionID | Text | 归属集合 | RIDER LUNG CT | 溯源 | 无 | 无 | 固定 |
| StudyInstanceUID | UID | 一次扫描(重复 1 或 2) | 1.3.6.1.4.1.9328.50.1.x | 区分 test/retest | 无 | 无 | 每例 2 |
| SeriesInstanceUID | UID | 一设置一组图像 | 1.3.6.1.4.1.9328.50.1.x | 六设置分组 | 无 | 无 | V3 936 |
| SliceThickness | Float | 层厚(mm) | 1.25 | 参数敏感性分组 | 设备标称 | 无 | 1.25/2.5/5 |
| ReconstructionKernel | Text | 重建核 | LUNG | 参数敏感性分组 | 设备标称 | 无 | LUNG/STND |
| SOPInstanceUID | UID | 单张切片 | 1.3.6.1.4.1.9328.50.1.x | 图像级对齐 | 无 | 无 | 81,548 |
| PixelData / HU | Int16 | CT 衰减 | −1000~3000 | 特征/分割输入 | 重建与设备噪声 | 空气 HU≈−1000 | 依设备 |
| Rows/Columns/Spacing | 元数据 | 图像维度与像素间距 | 512×512 | 重采样/统一网格 | 采集设定 | 无 | 依设置 |
| Lesion ROI(SEG) | Binary mask | 病灶勾画 | 掩膜 | 分割监督 | 勾画主观性 | 无掩膜=非病灶 | |
| Lesion Notes(XLS) | 结构化 | 病灶 ID/坐标 | RIDER-XX | 病灶定位 | — | 无 | 32 行 |
§4.2 标签分布
| 维度 | 分布 |
|---|---|
| 患者 | 32 例唯一 |
| 病灶 | 每例 1 个,共 32 个(NSCLC 病灶) |
| 重复次数 | 每例 2(test + retest) |
| 重建设置 | 每扫描 6(1.25L/1.25S/2.5L/2.5S/5L/5S),V3 |
| SEG 分割(RIDER-LUNGCT-SEG) | 31/32 例,GTV 手工 + 自动 |
| 类别标签 | 本集合不提供病理亚型/结局等类别标签 |
§4.3 关键统计
- 患者数:32(NSCLC)。
- 同日扫描间隔:约 15 分钟。
- V3 规模:100 研究 / 936 系列 / 81,548 图像 / 43.01 GB。
- 6 重建设置:1.25L、1.25S、2.5L、2.5S、5L、5S。
- Zhao 2009 一致性:医生手工测量 CCC ≥0.96;计算机辅助 CCC 1.00;单径 95% 一致性界限 (−7.3%, 6.2%)。
- Zhao 2009 判定界值:单径变化 ≥8% 视为超出测量变异。
把规模与测量学统计并列,可帮你判断「样本量够不够、指标意味着什么」:
| 数量维度 | 数值 | 用途提示 |
|---|---|---|
| 患者(病灶) | 32 | 影像组学稳定秩的样本上限 |
| 同日扫描对 | 32 | test-retest 可重复性分析的最小单元 |
| 六设置体数据 | 32×2×6 = 384 系列单元 | 参数敏感性/协调研究的观测网格 |
| RIDER-LUNGCT-SEG | 31/32 | 分割变异性分析覆盖 |
| 医生手工测量 CCC | ≥0.96 | 人级测量高一致背书 |
| 计算机辅助 CCC | 1.00 | 自动测量高度可复现 |
| 单径 95% 界限 | (−7.3%, 6.2%) | 验收自动算法的达标线 |
| ≥8% 单径变化 | 显著性界值 | 疗效判定最小可信变化 |
需要强调:32 例对「训练深度学习分割」是偏小的样本,但对「量化测量变异性 / 特征稳定性」这类元研究是恰到好处的规模——它不追求覆盖人群,而是追求在同一批患者上穷尽式地剥离各种测量噪声来源。若用它训练需要大规模数据的模型,务必结合其他肺癌影像集做预训练或数据扩充,并仅把 RIDER 当作稳定性/迁移验证面。
§4.4 数据层级
患者(32)→ 检查/研究(每例 2 次:test、retest)→ 系列(每扫描 × 6 设置 = 每例 12 图像系列)→ 切片(轴向 DICOM 文件)。病灶分割以 SEG 系列锚定到对应 CT 系列,同一病灶在 6 个设置下各有其勾画版本,形成「患者-重复-设置-分割」的立体嵌套结构。理解这一层级对正确做统计独立性与防泄漏至关重要(见 §5.3、§6.5)。
一个具体示例。 假设取患者 RIDER-2283289298 的 test 扫描。该扫描在 TCIA 中会对应 6 个 SeriesInstanceUID,每个分别承载 1.25L、1.25S、2.5L、2.5S、5L、5S 中某一设置的重建体数据;同一患者的 retest 扫描(第二次检查,StudyInstanceUID 不同)又各自再挂 6 个设置系列。于是这位患者横跨「2 次检查 × 6 设置」= 12 个 CT 系列,外加对应的 SEG 分割系列。若你的目标是「看同一患者在层厚变化下体积测量怎么漂移」,你会取这位患者的 1.25L 与 5L 两个系列分别测体积再求差;若目标是「看同日重扫对同一设置的影响」,则取 test 与 retest 的 1.25L 两个系列。两种问题访问的数据面不同,却都指向同一位患者的同源解剖——这正是需要在统计设计上格外小心的根源。
§4.5 缺失值与信息性缺失
本影像集合不以表格形式提供临床字段,故传统「缺失单元格」有限。需注意的要点:(1) 每个患者只有一个病灶被勾画,非病灶切片在掩膜上即为背景(0),属于「信息性」而非缺失;(2) RIDER-LUNGCT-SEG 分析子集覆盖 31/32 例(缺 1 例),若把不同 TCIA 集合简单合并会出现患者缺失;(3) 六设置 SEG 仅存在于 V3,若只下载 V2 则无分割掩膜;(4) 去标识化会剔除年龄/性别等 DICOM 人口学标签,缺失属于预期去标识化结果而非错误。建议自行维护一份患者→集合→设置→分割的存在性清单。
§5 划分与使用建议
§5.1 官方划分
本数据集未提供任何官方的 train/validation/test 划分。TCIA 仅按患者组织数据,所有 32 例均可作为影像组学可重复性分析的「全量参考集」。传统上研究社区把 RIDER 当作稳定特征筛选集而非训练-测试集,例如 Aerts 2014 用全部 31/32 组只计算稳定性秩(不训练预测器),再用独立的 Lung1 队列训练预后模型——即 RIDER 仅参与「特征预筛」,不进入监督训练。
§5.2 社区惯例划分
常见社区做法包括:(1) 稳定特征筛选用全部 32 例的 test-retest(成对样本,天然成组);(2) 分割/分类训练时,将患者按 8:2 或 leave-one-patient-out 划分,且严格保证同一患者的 test、retest 与 6 个设置都落在同一折内;(3) Kaggle 2D 衍生版已有 49 CT–SEG 配对的切片级组织,可据此按患者分组做 GroupShuffleSplit;(4) 若做六设置对比,把「设置」作为分层维度而非随机丢弃维度。
§5.3 泄漏风险(重点)
| 风险来源 | 泄漏方式 | 影响 | 规避 |
|---|---|---|---|
| 同一患者多次扫描 | test/retest 与 6 设置若跨折,同源数据泄漏 | 特征/分割性能虚高 | 患者级 GroupKFold,勿按切片随机切 |
| 2D 切片压平 | 相邻轴向切片高度相关 | 严重高估分割指标 | 按体积/患者分组,勿按切片随机 |
| 六设置同源 | 同一原始扫描的 6 种重建高度相关 | 参数敏感性结论被重复计数 | 统计单位取患者/扫描而非设置×切片 |
| SEG 跨集合合并 | RIDER-LUNGCT-SEG 与 V2/V3 混用出现缺失/重复患者 | 掩膜-图像错配 | 建患者清单核对存在性 |
§5.4 交叉验证建议
- 用患者级分组做 k 折(推荐 4–5 折),fold 内不可混入同一 RIDER-XXX 的任何扫描或设置。
- 做重建设置泛化评估时采用「leave-one-setting-out」或「训练在一层厚/核、测试在另一层厚/核」的协议,直接量化参数漂移。
- 分割指标宜按体积(Dice/HD95)并在患者层面聚合 ± 置信区间,避免切片级混淆导致的乐观偏差。
- 影像组学可重复性评估不涉及训练,直接用 test-retest 成对差异计算 ICC/CCC 即可。
患者级分组的分割训练可这样落地:
# 依赖:sklearn, pandas
from sklearn.model_selection import GroupKFold
# manifest 每行一个「患者-设置」体数据单元;folds 按 patient 分组,绝不跨患者泄漏
X = manifest["file"].tolist() # 体数据路径(占位示意)
y = manifest["label"].tolist() # 分割/分类标签
groups = manifest["patient"].tolist() # RIDER-XXX
gkf = GroupKFold(n_splits=5)
for fold, (tr, va) in enumerate(gkf.split(X, y, groups)):
tr_patients = set(pd.Series(groups).iloc[tr])
va_patients = set(pd.Series(groups).iloc[va])
# 断言:训练与验证的患者集合不相交
assert tr_patients.isdisjoint(va_patients), "患者泄漏!"
print(f"fold {fold}: 训练患者 {len(tr_patients)},验证患者 {len(va_patients)}")
若使用 Kaggle 的 2D PNG 衍生版(切片级 .csv),务必把上述
groups换成patient_id,并对每个 fold 断言不同患者的切片不交错,因为相邻轴向切片的相关性会让按切片随机划分得到虚高指标。
§5.5 外部验证建议
任何在 RIDER 上筛选出的稳定特征或训练出的分割模型,都应在独立影像数据集上做外部验证再宣称泛化。可选外部数据:LIDC-IDRI(结节分割)、NSCLC-Radiomics(Lung1/Lung2,预后关联)、NSCLC-Radiomics-Interobserver1(多勾画稳定性)、以及 4D-CT(如 ESTRO 36 研究中用 4DCT 相位替代 test-retest 的思路)。特别注意验证「跨设备/跨重建参数」的稳健性,因为 RIDER 全部采自 GE 设备。
§6 AI 就绪指南
§6.0 云端快速启动
若不想本地搭建环境,可借助 NCI 的 Imaging Data Commons(IDC)在云上直接查询与分析 RIDER Lung CT:IDC 提供 DICOM 层级索引与云端数据科学基础设施,可通过 Google Cloud Storage 拉取对象或使用 IDC SDK 检索 Series/SEG,无需完整下载 43.01 GB 即可开展探索性分析。Kaggle 上也存在由 TCIA 数据切片处理而成的 2D PNG 版(52,981 张 CT + 对应掩膜),适合快速做分割原型,但请务必阅读其与源数据的差异(见坑点 7)。
云端起步的建议路径:
- 在 IDC 门户搜索集合 “RIDER Lung CT”,按 SeriesInstanceUID 筛选出你要的 test/retest 与 1.25L 系列。
- 用 Google Cloud Storage 直接
gsutil cp拉取对象清单中的 DICOM,而不必下载 43 GB 全量。 - 用
idc-index/ BigQuery 检查每例的 SeriesCount 与 setting 覆盖,生成 manifest 后再进预处理。 - 对仅做特征可重复性/统计的用户,IDC 的影像对象 + 少量
.dcm即可跑通 ICC/CCC,无需本地重采样。 - 仅当你需要逐体素重采样做分割训练时,才考虑本地全量下载(预留 ≥100 GB 磁盘)。
IDC 与 TCIA 镜像同一策展来源,但对象命名/层级以 IDC 的 DICOMweb 为准,两者 UID 一致、路径不同。若你已在 TCIA 下载过,无需在 IDC 重复下载;反之亦然——保持单一来源可避免版本歧义。
§6.1 快速上手
下面给出获取并组织数据的脚本框架。要点:① 目录结构按「患者/研究/系列」组织,data_root 指向 NBIA 下载根目录;② 同一患者的 test 与 retest 是两个 StudyInstanceUID,6 个重建设置为多个 SeriesInstanceUID;③ 最小可用子集——若只做可重复性演示,取 2–3 例患者的 1.25L test/retest 即可。
# 环境假设:已用 NBIA Data Retriever 下载 V3 到 data_root
# 依赖:pip install pydicom numpy pandas
import os, pydicom, numpy as np
DATA_ROOT = "/path/to/rider-lung-ct" # NBIA 下载根目录
def find_dicom_files(root):
"""遍历目录收集全部 .dcm 文件路径"""
dcm = []
for dirpath, _, files in os.walk(root):
for f in files:
if f.lower().endswith((".dcm", ".ima")) or f.endswith(".dcm"):
dcm.append(os.path.join(dirpath, f))
return dcm
all_files = find_dicom_files(DATA_ROOT)
print(f"共发现 {len(all_files)} 个 DICOM 文件")
# 读一个文件预览元数据(SeriesDescription 常含层厚/重建核线索)
ds = pydicom.dcmread(all_files[0], stop_before_pixels=True)
print("Modality:", ds.Modality, "| StudyUID:", ds.StudyInstanceUID)
下面的辅助函数帮你在不清点每个文件的像素时,仅凭 DICOM 头即可判读「这是某患者、某次检查的哪一设置」,并组装出成对(test/retest)的 1.25L 最小子集:
def setting_key(ds):
"""从 DICOM 头提取 (层厚, 重建核) 标准化键"""
st = float(getattr(ds, "SliceThickness", 1.25))
# ConvolutionKernel 常写成 "LUNG" / "STANDARD"(厂商相关)
kern = str(getattr(ds, "ConvolutionKernel", "LUNG")).upper()
return f"{st:.2f}mm_{kern}"
def pair_125L_by_patient(manifest):
"""对每例患者,返回 (test_1.25L, retest_1.25L) 的文件列表对"""
from collections import defaultdict
bucket = defaultdict(list) # (patient, setting) -> [(study, file)]
for row in manifest.itertuples():
bucket[(row.patient, row.setting)].append((row.study, row.file))
pairs = []
for (patient, setting), items in bucket.items():
if setting.startswith("1.25") and "LUNG" in setting:
studies = {s for s, _ in items}
if len(studies) >= 2: # test 与 retest 都存在
by_study = defaultdict(list)
for s, f in items:
by_study[s].append(f)
# 取两个 study 各一组成对
it = iter(by_study.values())
a, b = next(it), next(it)
pairs.append((patient, a, b))
print(f"得到 {len(pairs)} 对同日 1.25L test-retest")
return pairs # [(RIDER-XXX, [test files], [retest files])]
此「仅用 DICOM 头构建 manifest」的办法最省磁盘与时间,是上手阶段把 43 GB 变成 32 对 1.25L 可分析体数据的高效入口。若发现某患者只有单个 study 或某 setting 缺失,多半与版本修正史(见坑点 8)有关,请以该患者实际序列为准并如实记录。
读取 DICOM 的 SEG 掩膜建议使用
highdicom或 TCIA 分析生态中成熟的读取器,见 §6.4。
§6.2 数据获取
获取 RIDER Lung CT 需要 TCIA 注册与 NBIA Data Retriever。下载与申请流程见下表。
| 项目 | 值 |
|---|---|
| 托管平台 | The Cancer Imaging Archive(TCIA) |
| 注册 | 在 TCIA 官网注册免费账号 |
| 下载工具 | NBIA Data Retriever(TCIA 提供) |
| 影像大小 | 43.01 GB(V3) |
| 许可 | CC BY 4.0(V3 影像/SEG) |
| 引用要求 | 使用必须引用官方 DOI(Data Citation Required) |
| 去标识化 | DICOM Supplement 142 |
# 检索提示:在 NBIA Data Retriever 中定位集合 "RIDER Lung CT",
# 选择 Version 3(43.01 GB)下载全部 CT 与 SEG。
# 若仅需经典影像组学研究,可选 Version 2(8.85 GB,单设置 1.25L)。
# 病灶注释 Lesion Notes(.xls,约 464.5 KB)也需一并下载。
§6.3 预处理全流程
预处理的目标是得到标准化、可训练的 3D 体数据与对齐掩膜。关键决策:HU 裁剪窗、各向同性重采样、设置分组。
import numpy as np, pydicom
from scipy.ndimage import zoom
def load_ct_volume(dcm_paths, target_spacing=1.0):
"""把一组轴向切片载入并重采样为各向同性体数据(HU)"""
slices = [pydicom.dcmread(p) for p in dcm_paths]
slices.sort(key=lambda s: float(s.ImagePositionPatient[2]))
spacing = slices[0].PixelSpacing
# 关键:Rescale Slope/Intercept 把原始值转成 HU
slope = float(slices[0].RescaleSlope); inter = float(slices[0].RescaleIntercept)
vol = np.stack([s.pixel_array.astype(np.float32) * slope + inter for s in slices])
# 各向同性重采样(轴向间距依赖 SliceThickness)
old = np.array([spacing[0], spacing[1],
float(getattr(slices[0], "SliceThickness", spacing[0]))])
factor = old / target_spacing
vol = zoom(vol, factor, order=1)
return vol, target_spacing
# HU 裁剪窗(参考衍生数据集常用 [-1024, 600])
def clip_hu(vol, lo=-1024.0, hi=600.0):
return np.clip(vol, lo, hi)
因为同一患者的 6 个设置只是重建不同,它们的像素间距、层厚与 HU 域可能不同——在做「跨设置对比」前必须先重采样到同一网格与同一 HU 裁剪,否则差异会被重建设置混淆(见坑点 5)。
把 DICOM 组织成「患者 × 设置」清单。 关键工程动作是把散落的 .dcm 文件聚合回「一次检查 × 一个重建设置」的体数据单元,并生成供实验复现的患者清单。
import pandas as pd, os
import pydicom
def build_manifest(dcm_paths):
"""为每例患者建立 (检查, 设置) -> 文件列表 的清单"""
rows = []
for p in dcm_paths:
ds = pydicom.dcmread(p, stop_before_pixels=True)
# 用关键标签构造 (患者, 检查, 设置) 三键
setting = f"{float(getattr(ds,'SliceThickness',1.25)):.2f}_{getattr(ds,'ConvolutionKernel','LUNG')}"
rows.append({
"patient": ds.PatientID, # RIDER-XXX
"study": ds.StudyInstanceUID, # test or retest
"series": ds.SeriesInstanceUID,
"setting": setting, # 1.25_LUNG 等
"file": p,
})
df = pd.DataFrame(rows)
# 校验:每例应出现 2 个不同 study(test/retest)
print("每例研究数:\n", df.groupby("patient")["study"].nunique().value_counts())
return df
manifest = build_manifest(all_files)
manifest.to_csv("rider_manifest.csv", index=False)
上述清单会把文件聚成可用于 volume 组装的单元;若要核对六设置齐全性,可按 setting 聚合计数。多数情况下 SeriesDescription(如含 “1.25 LUNG”)也能辅助判读设置,但以 SliceThickness 与 ConvolutionKernel 两个结构化标签为准更可靠。
§6.4 PyTorch DataLoader
下面给一个返回成对(test/retest 或不同设置)patch 的 Dataset,供可重复性与分割训练使用。
# 依赖:torch, pydicom, highdicom
import torch, numpy as np, pydicom
from torch.utils.data import Dataset, DataLoader
from highdicom.seg import SegmentationReader
class RIDERRepeatPairDataset(Dataset):
"""按患者返回 (图像A, 图像B) 成对,A/B 可为两次扫描或两种重建设置"""
def __init__(self, pairs, transform=None):
self.pairs = pairs # list of (imgA_path, imgB_path)
self.transform = transform
def __len__(self):
return len(self.pairs)
def __getitem__(self, idx):
a = torch.from_numpy(self._load(self.pairs[idx][0])).float()
b = torch.from_numpy(self._load(self.pairs[idx][1])).float()
if self.transform:
a, b = self.transform(a), self.transform(b)
return a, b
def _load(self, path):
return np.load(path) # 预存的 HU 体数据 .npy
# 实例化:把 32 例做成 (test,retest) 成对,患者级分组
pairs = [...] # [(p_test_1.25L, p_retest_1.25L), ...] 共 32 对
ds = RIDERRepeatPairDataset(pairs)
loader = DataLoader(ds, batch_size=4, shuffle=True, num_workers=2)
# 读取 DICOM SEG 掩膜并与对应 CT 对齐
import highdicom
def load_seg_mask(seg_path):
seg = highdicom.Segmentation.from_file(seg_path)
mask = seg.get_mask(0) # 首段二值掩膜
return mask.astype(np.uint8)
§6.5 坑点 8 个
⚠️ 坑点 1:把 test/retest 与六设置当成独立样本导致伪重复(分类:数据泄漏 / 工程陷阱)
问题:同一患者的两次扫描与同一原始扫描的 6 种重建共享大量底层解剖信息,若被当作独立样本进训练/统计,会系统性高估指标、低估方差。
症状:Dice/分类精度异常高、交叉验证折间差异极小、显著性检验几乎必显著。
解决:
- 简单方法:按患者(RIDER-XXX)做 GroupKFold,禁止按切片或 SeriesInstanceUID 随机切。
- 进阶方法:统计与训练的单位统一为「患者级聚合」;报告指标时给出患者间置信区间。影像组学可重复性分析直接用成对差异,不经任何训练。
- SOTA 方法:把「重复」与「设置」建模为分层/多水平随机效应(mixed-effects),量化 within-patient 与 between-patient 方差成分。
参考:TCIA RIDER-Lung-CT 官方页
⚠️ 坑点 2:六设置由同一原始扫描重建,跨设置结论不等同于独立重扫(分类:标签理解 / 数据泄漏)
问题:1.25L/2.5L/5L/…6 个设置来自同一投影数据,反映的是「重建参数」变异而非「重新采集」变异;把它们当作 6 个独立扫描会混淆两种噪声来源。
症状:声称「多中心/多扫描器鲁棒性」时证据不足,或重建参数间差异被低估。
解决:
- 简单方法:报告时明确写「同一原始扫描的六种重建设置」,勿称六次独立扫描。
- 进阶方法:做参数敏感性分析时固定患者与投影,只改变层厚/核;结论限定为「重建参数的影响」。
- SOTA 方法:若要研究完整采集变异,需把 RIDER 同日重扫(test-retest)作为外部位移补充到六设置之上,二者组合才能覆盖采集+重建两层噪声。
参考:Scientific Data 2024 数据论文
⚠️ 坑点 3:版本 V2/V3 规模与许可混用导致计数错误(分类:工程陷阱)
问题:V2(单设置 1.25L,8.85 GB,CC BY 3.0)与 V3(六设置,43.01 GB,CC BY 4.0)规模、许可均不同,直接合并统计会报错患者/图像数并混淆许可归属。
症状:报告"15,509 张"却指 V3,或把 V3 新增 SEG 与 V2 混用出现掩膜缺失。
解决:
- 简单方法:在 README 中显式标注你所用的 version 与对应 DOI(如 V3 的 10.7937/k9/tcia.2015.u1x8a5nr)。
- 进阶方法:写下载脚本时锁定 Version 字段,并对 SeriesCount/ImageCount 做断言校验。
- SOTA 方法:用 Imaging Data Commons 的对象清单核对 SeriesInstanceUID 全集,确保与论文声明一致。
参考:TCIA 版本历史
⚠️ 坑点 4:分析子集(RIDER-LUNGCT-SEG)只含 31/32 例(分类:标签理解 / 偏倚陷阱)
问题:RIDER-LUNGCT-SEG 覆盖 31/32 例(缺 1 例),若把 CT 主集与分割子集当同人数直接 merge 会错配。
症状:部分患者的掩膜缺失、患者计数对不上、按患者索引时报 KeyError。
解决:
- 简单方法:合并前生成「患者 × 是否有 SEG」的存在性矩阵,显式处理缺那 1 例。
- 进阶方法:始终以 CT 主集患者为锚,掩膜用 SOPInstanceUID/StudyInstanceUID 对齐,缺失用 np.nan/哨兵编码而非静默丢弃。
- SOTA 方法:把「有无分割」作为信息性缺失变量纳入分析设计,评估其对结论稳健性的影响。
参考:RIDER-LUNGCT-SEG
⚠️ 坑点 5:不同重建设置 HU 域、间距与层厚不同,直接比较会混淆(分类:预处理陷阱)
问题:同一扫描在不同层厚/重建核下,像素间距、切片厚度与 HU 噪声特性不同,未对齐就做跨设置特征/分割比较会混入重建设置差异。
症状:同一病灶在 1.25L 与 5S 下算出的纹理/体积特征系统性不同,或掩膜与图像错位。
解决:
- 简单方法:预处理统一做 HU 裁剪(如 [−1024, 600])与各向同性重采样到同一 target_spacing,再做所有下游分析。
- 进阶方法:对每种设置记录其真实 PixelSpacing/SliceThickness,重采样使用实际值而非假设值。
- SOTA 方法:将重建核/层厚作为显式协变量或条件输入纳入模型(参数感知建模),以量化而非抹平其影响。
参考:Kaggle 衍生版说明(HU 窗处理)
⚠️ 坑点 6:本集合无病理/结局标签,误当监督分类会出错(分类:评估误用)
问题:RIDER 只提供零变化重复扫描与分割,不含肿瘤病理金标准或生存结局;把它当 NSCLC 诊断/预后标注集使用会得出误导性结论。
症状:想训「肿瘤良恶性分类/预后预测」却找不到标签,或硬凑代理标签导致任务定义失真。
解决:
- 简单方法:明确本集合适用于可重复性/鲁棒性分析,预后建模请改用带结局的 NSCLC-Radiomics 等集合。
- 进阶方法:若需分割监督,用官方 DICOM SEG 作为金标准即可,不需额外标签。
- SOTA 方法:把 RIDER 作为特征筛选/稳定性验证层,叠加在带结局数据集之上做完整预后管线(Aerts 2014 范式)。
参考:RIDER-LUNGCT-SEG 说明(无临床结局)
⚠️ 坑点 7:Kaggle 2D 衍生版切片级组织带来的泄漏与语义差异(分类:工程陷阱 / 数据泄漏)
问题:第三方把 3D 体积切成 2D 轴向 PNG(52,981 切片),切片间强相关;若按切片随机划分会严重高估性能,且其 HU 窗与原始 DICOM 不一致。
症状:在衍生版训出的分割 Dice 虚高,直接迁移到原始 DICOM 或真实部署时崩。
解决:
- 简单方法:使用衍生版时按 patient_id 做 GroupShuffleSplit,绝不对 slice 随机切。
- 进阶方法:阅读其预处理说明(HU 窗 [−1024,600]→[0,255]),在原始 DICOM 上复算以保持一致,勿把 8-bit 归一化值与 HU 直接混用。
- SOTA 方法:正式研究建议回到 TCIA 原始 DICOM,以体数据为单位分析;衍生版仅用于快速原型验证算法正确性。
参考:Kaggle RIDER Lung CT
⚠️ 坑点 8:TCIA 曾修正重复/重复患者序列,下载后需自查一致性(分类:工程陷阱)
问题:V2 时发现 RIDER-8509201188 含两条相同序列(重复 UID 1.3.6.1.4.1.9328.50.1.64033480205396366773922006817138551096)并移除一条,但正确二次序列当时无法补齐;同类 RIDER 集合还发生过两 ID 实为同一患者的去重。
症状:个别患者只有 1 组有效扫描、或出现近乎重复的系列,影响成对 test-retest 构造。
解决:
- 简单方法:下载后按患者核对 Study/Series 数量,标记只有单次有效扫描的患者并说明。
- 进阶方法:对每例做 Series 指纹(平均 HU 或体数据哈希)去重,识别异常重复序列。
- SOTA 方法:引用 TCIA 官方版本发布说明并记录你实际用到的患者/序列 UID 白名单,保证实验可复现。
参考:TCIA 版本历史(V2 修正说明)
§6.6 数据增强
安全增强(不破坏可重复性语义)✅:几何增强(小幅旋转/翻转/平移——但肺解剖翻转需谨慎)适用于分割训练;亮度/HU 抖动模拟噪声、弹性形变模拟摆位差异,可用于训练对重建核/摆位更鲁棒的模型。
危险增强 ❌:切勿把「同一患者另一扫描/另一设置」当作数据增强随意混入,因其与测试样本同源会造成泄漏;也不要用会破坏 HU 定量域的强裁剪改变特征值语义——影像组学特征对强度分布敏感,任何 HU 变换都会让已筛选特征失效。
§6.7 模型推荐
| 任务 | 推荐模型 | 说明 |
|---|---|---|
| 病灶分割(3D) | nnU-Net | 医学分割事实标准,含自适应预处理 |
| 病灶分割(2D 切片) | U-Net / DeepLab | 用于 Kaggle 2D 原型 |
| 影像组学稳定特征筛选 | 无需模型,ICC/CCC + Friedman | Aerts 2014 方法 |
| 可重复性评估 | Bland-Altman / mixed-effects | Zhao 2009 的量化框架 |
| 参数协调 | ComBat / 深度域自适应 | 用于六设置差异校正 |
| 测量误差上限估计 | two-way mixed ICC(ICC(2,1)) | 估计 reader×setting 交互方差 |
选型说明:对「同患者跨设置」的体数据,建议优先用体素级/体积级模型而非纯 2D 切片模型——因为相邻切片的空间相关性极强,2D 处理会引入切片方向与层厚(1.25 vs 5 mm)的耦合伪影,而这些恰恰是本数据集想剥离的变量。影像组学稳定性评估(ICC/CCC)本质是统计而非学习任务,不需要神经网络;深度学习方法主要用于分割(nnU-Net)或参数感知的域自适应协调。若追求临床可信的体积测量,把 Zhao 2009 的 Bland-Altman 界限作为「方法达标线」来检验你的算法是否把噪声压到 1.25L 的 (loa) 之下,是简洁有效的验收标准。
§6.8 硬件需求
| 配置 | 用途 | 说明 |
|---|---|---|
| CPU + 16 GB 内存 | DICOM 解析、影像组学特征、可重复性统计 | 特征提取可用单机 |
| 单张 GPU 8–16 GB | 3D 分割(nnU-Net) | V3 全套 43 GB 需 >64 GB 磁盘 |
| 云端(IDC/GCP) | 免下载探索 | 43 GB 全套不必本地拉取 |
§6.9 评估指标代码
可重复性评估是 RIDER 的核心指标,给出计算 ICC/CCC 与 Bland-Altman 界限的代码。
import numpy as np
def concordance_correlation(a, b):
"""Lin 一致性相关系数(CCC)"""
a, b = np.asarray(a, float), np.asarray(b, float)
m = np.mean(a) - np.mean(b); va = np.var(a); vb = np.var(b)
cov = np.mean((a - np.mean(a)) * (b - np.mean(b)))
return 2 * cov / (va + vb + m**2)
def bland_altman_limits(a, b):
"""95% 一致性界限,返回百分比形式"""
a, b = np.asarray(a, float), np.asarray(b, float)
d = (b - a) / np.mean((np.abs(a) + np.abs(b)) / 2) * 100 # 相对差%
mean_d, sd = np.mean(d), np.std(d, ddof=1)
return mean_d - 1.96 * sd, mean_d + 1.96 * sd
# 示例:对 32 例的单径测量算 test-retest CCC 与一致性界限
uni_test = [10.0, 12.0, 8.0, ...] # 例
uni_retest = [10.5, 11.8, 8.4, ...]
print("CCC:", concordance_correlation(uni_test, uni_retest))
print("95% 界限:", bland_altman_limits(uni_test, uni_retest))
对影像组学特征做「跨 test-retest 稳定性」评分时,常用 ICC(2,1)(two-way mixed)作为特征是否可重复的排序依据——这正是 Aerts 2014 用来给 440 个特征打稳定秩的方法。下面给出一个最小可运行实现。
def icc_two_way_mixed(y, target):
"""ICC(2,1):two-way random effects, single measurement。
y: (subjects, raters/conditions),target 为本数据集的 test vs retest。"""
import numpy as np
n, k = y.shape
sb = np.var(y.mean(axis=1), ddof=1) * k # between-subject variance
sw = np.var(y.mean(axis=0), ddof=1) * n # between-rater variance
se = np.var(y - y.mean(0) - y.mean(1)[:, None] + y.mean(), ddof=1) * (n * k)
# 简化估计(忽略交互项含 reader 固定成分差异时的更严格公式见教科书)
msb = sb / (n - 1) if n > 1 else np.nan
return (msb) / (msb + se / (n - 1)) if n > 1 else np.nan
# 用法:把 440 个特征在 32 例 test/retest 上各自抽出,逐一算 ICC
# feats_test: (32, 440), feats_retest: (32, 440)
# stable = [icc_two_way_mixed(np.stack([feats_test[:,f], feats_retest[:,f]]).T, 2) for f in range(440)]
真实影像组学 ICC 实现建议使用成熟库(如
pingouin的icc或 scikit-learn 生态),并注意样本量仅 32 例时的估计方差——ICC 对离群患者敏感,可在个体水平检查 Bland-Altman 散点确认无系统漂移后再采信稳定秩。
§6.10 MLOps 笔记
- 版本锁定:记录所用 TCIA version(V2/V3)与 DOI,实验报告必须注明六设置 vs 单设置。
- 患者级文件清单:生成并提交 patients→series→mask 的 manifest,确保不同成员使用同一子集。
- HU 定量一致性:整条 pipeline 禁止出现与原始 HU 语义冲突的归一化,统一入口函数处理 Rescale 再裁剪。
- 数据版本化:把 manifest + 预处理脚本入版本库;六设置扩集后旧实验需重跑确认不因新增系列而失效。
- 可复现性报告:记录 SliceThickness/ReconstructionKernel 使用策略(固定某设置 or 跨设置),避免方法不可比。
为了在团队或跨时间复现,建议提交一份只读的 data_config.yaml 描述你实际用到的数据面:
collection: RIDER-Lung-CT
version: 3 # TCIA Version 3(六设置扩集)
doi: 10.7937/k9/tcia.2015.u1x8a5nr
setting_policy: fixed # fixed=只用某设置;all=跨六设置
selected_settings: [1.25L] # 若 fixed
scan_scope: test_and_retest # 是否用同日双扫描
use_official_seg: true # 是否用官方 DICOM SEG
derived_2d_kaggle: false # 是否误用了衍生 2D 版(一般应 false)
normalization: {hu_lo: -1024, hu_hi: 600, resample_mm: 1.0}
manifest: rider_manifest.csv # 患者-设置-文件清单(入库版本化)
在 README 或论文方法节中附上这份 yaml,配合 manifest 的 git commit hash,即可让任何协作者或评审者精确定位你所用的 RIDER 数据面,消除「你说的 81,548 张 vs 我看到的 15,509 张」这类版本歧义(见坑点 3)。
运行治理建议:分割/特征训练任务建议用 DVC 或类似工具管理体数据产物与中间缓存,避免在每次重跑时重复解压 43 GB;对医学影像,将去标识化的 DICOM 保存在受控存储,不经云上传第三方未授权仓库;把「患者级分组 CV」封装为团队共享函数,从机制上杜绝成员各自切片级随机切分导致的泄漏性指标。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 中心/设备偏倚 | 全部采自单中心、GE 设备 | 高 | 跨厂商/跨中心外部验证后方可泛化 |
| 人群偏倚 | 接受系统治疗的 NSCLC,无人口学披露 | 中 | 不作普适人群统计推断 |
| 病灶选择偏倚 | 每例只勾画 1 个病灶 | 中 | 结果限定于「单病灶/原发灶」场景 |
| 注释主观性 | 分割由单医生主导(有算法辅助) | 中 | 结合 RIDER-LUNGCT-SEG 多勾画集做稳健性 |
| 版本偏倚 | V2/V3 覆盖范围与许可不同 | 低 | 明确标注所用 version 与 DOI |
| 无结局偏倚 | 无病理/生存标签 | 高(对结局任务) | 不用于预后监督,仅用于可重复性 |
§7.2 标注质量
分割标注经「放射科医生 + 院内算法」半自动流程并在 Weasis 平台校正;为抑制记忆偏倚,12 个读片会话以 2–3 周间隔进行。Zhao 2009 的测量一致性数据是最强的质量证据:3 名放射科医生手工测量单径/双径在重复扫描(可再现性)与重读(可重复性)间的 CCC 均 ≥0.96,计算机辅助达 1.00。影像组学特征层面的稳定性则由 Aerts 2014 以 ICC 秩与多勾画集的交叉筛选支撑。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨 GE→其他厂商 | 中-高 | 单厂商采集,特征/算法可能受重建差异影响 |
| 跨层厚/核(本集内) | 已受控 | 六设置设计可测但需显式建模 |
| 从可重复性到预后 | 高 | 无结局标签,RIDER 只做特征筛选层 |
| 多病灶/多发结节 | 中 | 每例单病灶,多病灶表现未知 |
§7.4 伦理
采集为前瞻性 IRB 批准研究并获患者知情同意(ClinicalTrials.gov NCT00579852),影像经 DICOM Supplement 142 去标识化,受试以不透明 RIDER-XXX 编码标识。TCIA 数据使用政策要求使用者在下载后遵守并正确引用。研究者需注意去标识化后的数据仍承载真实解剖影像,使用时应尊重患者隐私与 TCIA 的再发布限制,勿擅自二次公开。
§7.5 公平性
由于去标识化省略年龄/性别/种族等人群维度,本集合无法支持人口学亚组公平性分析。任何在 RIDER 上训练的模型若要声称跨人群公平,必须在保留人群标签的外部数据上验证。这是设计层面的局限,研究者不应在无标签情况下推断或声称公平性保证。
§7.6 数据漂移
本集合为回顾性、单时间点采集(约 2009 年前后),不设纵向随访,因此不存在「时间漂移」问题;但其反映的是约 2000 年代末的 GE 扫描协议。若用于训练面向当前设备的 AI 模型,存在「设备/协议代差漂移」风险——层厚设置、重建核演变、管电压等可能与现代多中心数据不一致,跨时代部署前需外部适配验证。
§7.7 DAIMS 评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 图像/序列按患者-系列组织,清单可导出宽表 |
| 2 | 唯一标识 | ✅ | SOPInstanceUID/StudyInstanceUID 唯一,患者 RIDER-XXX 唯一 |
| 3 | 特殊字符 | ✅ | 编码规范,无异常字符 |
| 4 | 重复行 | ✅ | V2 曾去重患者重复序列,V3 已清理 |
| 5 | 缺失编码 | ⚠️ | 无结构化临床表;患者缺分割需自行识别 |
| 6 | 标签标识 | ✅ | SEG 段标签明确(GTV) |
| 7 | 罕见类分组 | ⚠️ | 每例 1 病灶,罕见事件类无现成分组 |
| 8 | 偏倚评估 | ⚠️ | 单中心/单厂商偏倚已识别但无法在集内消除 |
| 9 | 数据字典 | ⚠️ | DICOM 标准自带标签;无集中列数据字典,需自行提炼 |
| 10 | 信息性缺失解释 | ✅ | 去标识化导致人口学缺失,属预期 |
| 11 | 设备记录 | ✅ | 设备/层厚/重建核在 DICOM 头与论文中均有 |
| 12 | 共线性 | ⚠️ | 六设置同源高度相关,需建模处理 |
| 13 | 编码映射 | ⚠️ | 无病理编码映射;病灶仅以解剖标注 |
| 14 | 时间戳处理 | ⚠️ | 同日双扫描,时间差无集中表,需解析头 |
| 15 | 划分建议 | ❌ | 无官方 train/test 划分 |
| 16 | 泄漏讨论 | ✅ | 患者同源风险清楚,社区已强调按患者分组 |
| 17 | 标签分布 | ✅ | 32 病灶/患者/设置的分布文档可梳理 |
| 18 | 测量偏倚 | ✅ | Zhao 2009 提供了量化测量偏倚的完整方法 |
| 19 | 外部验证建议 | ✅ | 论文与社区普遍做跨集合外部验证 |
| 20 | 版本记录 | ✅ | V1/V2/V3 版本历史在 TCIA 完整记录 |
| 21 | 预处理脚本 | ⚠️ | 官方无脚本;依赖社区与本文档 |
| 22 | 合规要求 | ✅ | CC BY 4.0 + 引用要求明确 |
| 23 | 多模态对齐 | ⚠️ | CT 与 SEG 对齐良好,但与 PET/临床异模态需自行处理 |
| 24 | 去标识化 | ✅ | DICOM Supplement 142 去标识化 |
DAIMS 评分:16.5 / 24
评分解读:RIDER Lung CT 在唯一标识、去标识化、测量偏倚量化、版本记录等影像学基础维度表现优异,得益于其严谨的采集与 TCIA 策展;主要扣分集中在「AI 使用便利性」维度——无官方划分、无官方预处理脚本、无集中数据字典、无结构化临床结局表。这使它作为「测量/特征参考集」而非「开箱即用训练集」得分最高。
对你意味着什么:如果你做影像组学可重复性或测量变异性研究,可直接以官方数据为准并使用本文 §6 的脚本组织队列;如果要做监督分割/预后训练,请自备患者级划分与预处理管线,并始终保留患者清单 manifest。切勿因无官方划分而按切片随机切——那是本集合最容易犯且代价最高的错误。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Aerts 2014(Lung2/Radboud,n=225) | Radboud/MAASTRO | RIDER 稳定特征的预后验证 | CI 0.65(Lung2) | RIDER 只做特征筛选 | 稳定特征预后信息泛化到独立 NSCLC 队列 |
| Aerts 2014(H&N1/H&N2) | VU/MAASTRO | 跨癌种预后验证 | CI 0.69 / 0.69 | RIDER 特征跨肺癌→头颈 | 稳定特征具跨癌种预后表型 |
| ESTRO 36 跨集合鲁棒性 | 多中心 | 4DCT 替代 test-retest 的特征鲁棒性 | CCC≥0.85 稳定特征数 | RIDER 为参考基准 | 34/70 非滤波与 122/472 小波特征在双集皆稳 |
外部验证的读法。 上表揭示一个重要的方法学事实:RIDER 的验证模式不是「在同一任务上比谁的模型分数高」,而是「检验在 RIDER 上筛出的稳定特征/测量阈值能否迁移到独立采集」。Aerts 2014 的 CI 值(0.65–0.69)衡量的不是 RIDER 本身的性能,而是稳定影像组学特征在另一队列上的预后区分能力——RIDER 只充当「去噪过滤器」,验证的主体其实是带结局的 Lung2/H&N 队列。因此,读者不应用这些 CI 去评判 RIDER「建模好不好」,而应理解它为「稳定特征能跨癌种泛化」提供了证据。这也就解释了为何本集合的 SOTA 概念(见 §8.2)是方法学范式而非精度纪录——在使用本数据集时,把评估对象界定清楚(测量变异性、特征稳定性、还是跨集迁移)比追求单一分数更重要。
§8 基准性能与生态
§8.1 排行榜
| 排名 | 模型/方法 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Aerts 四特征影像组学签名 | CI 0.65–0.69(Lung2/H&N1/H&N2) | 2014 | RIDER 稳定性秩 + 多勾画集筛选 + Cox | Aerts et al., 2014, Nat Commun 5:4006. DOI: 10.1038/ncomms5006 | TCIA Radiomics-Tumor-Phenotypes |
| 2 | Zhao 计算机辅助体积测量 | 单径 95% 界限 (−7.3%, 6.2%) | 2009 | 同日重复扫描 + Bland-Altman | Zhao et al., 2009, Radiology 252:263–272. DOI: 10.1148/radiol.2522081593 | — |
注意:RIDER 本身极少被用作「谁在排行榜上跑最高分」的监督竞赛集,其基准是「量化测量的变异性界值」与「稳定特征的筛选结果」,与图像分类/分割 SOTA 的分数不可直接比较。上表列出的是建立这些基准的原始方法,而非互拼精度的模型排名。
§8.2 SOTA 总结与选型建议
RIDER 领域的方法学「标准答案」是:先用 test-retest 算出每个影像组学特征的稳定性(ICC/CCC 阈,如 CCC≥0.85 或 ICC 高秩),只保留稳定特征,再在有结局的大队列上做预后/分类建模。选型建议:分割任务用 nnU-Net 并以官方 SEG 为金标准;特征可重复性任务不必上深度学习,直接做一致性统计即可;若要跨设置/跨厂商鲁棒,把「重建参数」纳入建模(参数感知)比事后归一化更稳健。
§8.3 评测协议
- 可重复性:Lin CCC / 组内相关系数(ICC)/ Bland-Altman 95% 界限;阈值自定(社区常用 CCC≥0.85)。
- 稳定特征数:在给定阈值下 test 与 retest 特征一致的占比。
- 分割:Dice、Hausdorff 95、体积差%,在 32 例成对与六设置上报告并给患者级 CI。
- 参数漂移:同一患者的 1.25L 与 5S 特征/体积差值的分布与显著性。
- 报告纪律:必须注明所用 version 与「单设置 vs 六设置」,否则跨研究不可比。
做可重复性/参数敏感性研究前,先明确下列协议决策并写进方法节,可避免大量返工:
| 协议决策 | 可选做法 | 对本数据集的意义 |
|---|---|---|
| 稳定性指标 | ICC / Lin CCC / Pearson / Cronbach α | 指标不同则稳定特征集不同,须声明 |
| 稳定性阈值 | CCC≥0.85 / ICC≥0.8 等 | 阈值影响入选特征数量,勿隐式选取 |
| 特征提取版本 | PyRadiomics / 自定义 + 量化参数 | 跨工具/量化参数不一致会改变结果 |
| 比较基准 | 单设置 vs 六设置 | 六设置结果不能与单设置历史研究直接比 |
| 分组单位 | 患者 / 扫描 / 切片 | 切片级会引入强相关,须用患者 |
| 结论范围 | 重建参数内 / 跨厂商 | RIDER 单厂商,跨厂商需外部数据 |
§8.4 相关数据集
| 数据集 | 定位 | 与 RIDER Lung CT 关系 |
|---|---|---|
| NSCLC-Radiomics(Lung1/2/3) | 带结局肺队列 | 预后验证端 |
| RIDER-LUNGCT-SEG | RIDER 分割变异性 | 同源分析子集 |
| RIDER Phantom PET-CT / MRI | 体模重复测量 | RIDER 家族 |
| RIDER Lung PET-CT | 244 例纵向 PET/CT | RIDER 家族,非同日重复 |
| LIDC-IDRI | 筛查结节 | 独立结节分割资源 |
| 4DCT 呼吸相位集 | 呼吸相位替代 test-retest | 特征鲁棒性替代数据 |
§8.5 关键论文 Top5
- Zhao et al. (2009), Radiology 252(1):263–272. DOI: 10.1148/radiol.2522081593 — 确立同日重复 CT 上单径/双径/体积测量的变异性与 ≥8% 单径变化判据(本数据集的主要发表)。
- Aerts et al. (2014), Nature Communications 5:4006. DOI: 10.1038/ncomms5006 — 用 RIDER test-retest 筛选可重复影像组学特征并构建跨癌种预后签名,确立影像组学稳定性范式。
- Clark et al. (2017), Scientific Data 4:170124. DOI: 10.1038/sdata.2017.124 — TCIA 公开影像集合总览,系统描述 RIDER Lung CT 及去标识化与策展。
- Zhao, B., Schwartz, L. H., Kris, M. G., & Riely, G. J. (2015). Coffee-break Lung CT Collection…[Dataset]. TCIA. DOI: 10.7937/k9/tcia.2015.u1x8a5nr — 数据集官方数据引用(Data Citation Required)。
- Li, D., Zhao, B. 等 (2024), Scientific Data 11. DOI: 10.1038/s41597-024-04085-3 — 描述六设置(M-setting)扩集版的数据记录与分割协议。
论文脉络解读。 这五篇文献勾勒出 RIDER Lung CT 从临床问题到数据资产再到 AI 方法学范式的完整脉络。Zhao 2009 是数据集的「出生证明」:它用严格的一致性统计证明了同日重复 CT 高度可重复,并给出计算机辅助单径测量需 ≥8% 变化才算显著的操作性判据,直接回应了「肿瘤尺寸变化多少才可信」这一困扰疗效试验设计的核心问题。Aerts 2014 则把它从一个「测量方法学研究样本」升级为「影像组学的方法学基础设施」:通过 test-retest 算出每个特征的稳定性秩,与多勾画集的稳定性结合后筛选出 100 个最稳特征,再从中构建跨癌种预后的四特征签名——这个「先在稳定数据上筛特征、再到带结局队列上建模」的流程,成为此后影像组学论文反复套用的标准范式。Clark 2017 与 2024 数据论文分别从「TCIA 平台策展总览」与「六设置扩集数据记录」两个层面保障了数据的可发现性与可复现性,而 Zhao 2015 的数据 DOI 则是任何复用本集合成果都必须引用的法律/学术署名锚点。
§8.5b 生态内可复现性研究脉络
除上述奠基性论文外,RIDER 已成为影像组学「跨集合可复现性」研究的公共试验场。ESTRO 36 会议上的一项研究把 RIDER 的 test-retest 作为参照,检验了「4DCT 的不同呼吸相位能否替代同日重复扫描来选择稳定特征」——结果显示 34/70(49%)非滤波特征与 122/472(26%)小波特征在 RIDER 与 4D-Lung 两个数据集中同时稳定,而此前认定的四个预后特征在两个数据集的 CCC 均 >0.95,说明 RIDER 上筛选的稳定特征能较好地在独立采集上复现。另有研究在 RIDER 肺数据上评估不同特征提取工具的一致性,发现 43 个报告为稳定的特征中有 29 个在不同工具/量化参数下保持稳定的秩排序(rs>0.8),印证了「可重复性筛选」的价值,也提示跨工具复用时须统一量化参数与强度阈值。这些工作共同确立了 RIDER 作为「零变化稳定特征筛选标准集」的社区共识地位。
§8.6 社区活跃度
RIDER Lung CT 是 TCIA 上知名度最高的肺癌影像集合之一(截至 2024-06 页面标注 38+ 引用、1.1 万+ 浏览量)。其核心价值在影像组学社区被反复引用:Aerts 2014 的方法学持续被后续研究当作可重复性筛选的标准步骤,ESTRO 36 与多篇影像组学综述把 RIDER 当作跨扫描重复性的参考锚点。社区也围绕它衍生了独立分析结果(RIDER-LUNGCT-SEG)与第三方 2D 处理版,生态在 TCIA/IDC 与 Kaggle 均有体现。
从社区演进的信号看,本集合的热度经历了两波:第一波随 2014 年影像组学爆发而起(作为稳定特征筛选集被高频引用),第二波随 2024 年六设置扩集而重启(面向重建参数敏感性/数据协调的新应用)。两波热度都指向同一个底层需求——定量影像需要可复现的噪声参考。与纯粹的图像分割竞赛集不同,RIDER 的「引用价值」不在于被当作刷榜训练集,而在于其方法学贡献被写进综述与指南。因此评估它的社区活跃度,与其看下载量,不如看在论文「Methods/稳定性分析」段落中被引用为 test-retest 参考的次数——那才是它活跃度的真实度量。研究者加入这一生态最有效的方式,是用官方六设置版做一项参数敏感性/协调研究并在方法节清晰交代数据面,使后续可复现研究能直接对齐。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/规模(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| TCIA RIDER-Lung-CT | 官方集合 | https://www.cancerimagingarchive.net/?p=43451 | 38+ 引用 | 权威数据源 |
| RIDER-LUNGCT-SEG | 官方分析结果 | https://www.cancerimagingarchive.net/?p=45881 | — | GTV 分割变异性 |
| Imaging Data Commons | 云数据基础设施 | https://portal.imaging.datacommons.cancer.gov/ | — | 免下载查询分析 |
| Kaggle RIDER 2D | 衍生处理版 | https://www.kaggle.com/datasets/suvadipchakraborty/rider-lung-ct | 公开 | 快速分割原型 |
§9 相关资源与引用
§9.1 官方资源
| 资源 | 链接 | 说明 |
|---|---|---|
| TCIA 官方集合页 | https://www.cancerimagingarchive.net/?p=43451 | 数据下载、版本历史、引用 |
| 数据引用 DOI | 10.7937/k9/tcia.2015.u1x8a5nr | 使用必引 |
| Zhao 2009 原始论文 | https://doi.org/10.1148/radiol.2522081593 | 主要发表 |
| 2024 数据论文 | https://doi.org/10.1038/s41597-024-04085-3 | 六设置版描述 |
| RIDER-LUNGCT-SEG | https://www.cancerimagingarchive.net/?p=45881 | 分割分析结果 |
| Imaging Data Commons | https://portal.imaging.datacommons.cancer.gov/ | 云查询分析 |
§9.2 使用注意事项
TCIA 数据使用政策要求:下载前注册,使用后必须引用官方数据 DOI;遵守 CC BY 4.0 署名要求;不擅自违反去标识化承诺或二次发布。任何衍生出版物应同时在「Data Citation」与「Publication Citation」两处正确引用 Zhao 2009 与数据集 DOI。
§9.3 BibTeX 引用
@article{Zhao2009Evaluating,
title = {Evaluating Variability in Tumor Measurements from Same-day Repeat
{CT} Scans of Patients with Non--Small Cell Lung Cancer},
author = {Zhao, Binsheng and James, Leonard P and Moskowitz, Chaya S and
Guo, Pingzhen and Ginsberg, Michelle S and Lefkowitz, Robert A and
Qin, Yilin and Riely, Gregory J and Kris, Mark G and
Schwartz, Lawrence H},
journal = {Radiology},
volume = {252},
number = {1},
pages = {263--272},
year = {2009},
doi = {10.1148/radiol.2522081593}
}
@article{Aerts2014Decoding,
title = {Decoding Tumour Phenotype by Noninvasive Imaging Using a
Quantitative Radiomics Approach},
author = {Aerts, Hugo JWL and Velazquez, Emmanuel Rios and Leijenaar,
Ralph TH and Parmar, Chintan and Grossmann, Patrick and
Carvalho, Sara and Bussink, Johan and Monshouwer, Ren{\'e} and
Haibe-Kains, Benjamin and Rietveld, Derek and others},
journal = {Nature Communications},
volume = {5},
pages = {4006},
year = {2014},
doi = {10.1038/ncomms5006}
}
@article{Zhao2015Coffee,
title = {Coffee-break Lung CT Collection with Scan Images Reconstructed at
Multiple Imaging Parameters (Version 3) [Data set]},
author = {Zhao, Binsheng and Schwartz, Lawrence H and Kris, Mark G and
Riely, Gregory J},
year = {2015},
doi = {10.7937/k9/tcia.2015.u1x8a5nr}
}
@article{Li2024Annotated,
title = {Annotated Test-Retest Dataset of Lung Cancer {CT} Scan Images
Reconstructed at Multiple Imaging Parameters},
author = {Li, Donghao and Zhao, Binsheng and {others}},
journal = {Scientific Data},
volume = {11},
year = {2024},
note = {六设置(M-setting)扩集版的数据记录与分割协议描述},
doi = {10.1038/s41597-024-04085-3}
}
@article{Wee2020RIDER,
title = {RIDER Lung CT Segmentation Labels from: Decoding Tumour Phenotype
by Noninvasive Imaging Using a Quantitative Radiomics Approach
[Data set]},
author = {Wee, Leonard and Aerts, Hugo JWL and Kalendralis, Petros and
Dekker, Andre},
year = {2020},
doi = {10.7937/tcia.2020.jit9grk8}
}
@article{Clark2017Public,
title = {The Public Cancer Radiology Imaging Collections of {The} Cancer
Imaging Archive},
author = {Clark, Kenneth and Vendt, Bruce and Smith, Kirk and Freymann,
John and Kirby, Justin and Koppel, Paul and Moore, Stephen and
Phillips, Stanley and Maffitt, David and Pringle, Michelle and
others},
journal = {Scientific Data},
volume = {4},
pages = {170124},
year = {2017},
doi = {10.1038/sdata.2017.124}
}
§9.4 引用指南
发表成果时:(1) 正文引用 Zhao 2009 作为方法学来源;(2) 数据使用引用 Zhao 2015 数据集 DOI;(3) 若用到六设置版分割,加引 2024 Scientific Data 数据论文;(4) 若用分割变异性数据,引用 RIDER-LUNGCT-SEG 的 Wee/Aerts 数据 DOI 与 Aerts 2014。遗漏 TCIA Data Citation 会被视为违反数据使用政策。
建议在提交前用下列清单自查引用完整性:
- [ ] Data Citation:
Zhao, B., Schwartz, L. H., Kris, M. G., & Riely, G. J. (2015). Coffee-break Lung CT Collection… Version 3 [Dataset]. The Cancer Imaging Archive. https://doi.org/10.7937/k9/tcia.2015.u1x8a5nr - [ ] Publication Citation:Zhao 2009(若讨论测量变异性)或 Aerts 2014(若讨论影像组学稳定性)。
- [ ] 若用六设置扩集:加引 2024 Scientific Data 数据论文(10.1038/s41597-024-04085-3)。
- [ ] 若用 RIDER-LUNGCT-SEG 分割:加引其数据 DOI 与 Aerts 2014。
- [ ] 方法节已写明所用 version(V2/V3)与设置范围(单设置 or 六设置)。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1–§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 5 组检索:官方页、RIDER 背景、Zhao 论文、Aerts 影像组学、TCIA 集合综述交叉验证 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 TCIA 官方页、Zhao 2009、Aerts 2014 与 2024 Scientific Data 数据论文整理结构化事实;(2) 生成 §6 的 Python 预处理/DataLoader/评估代码;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- TCIA RIDER-LUNG-CT 官方集合页(含版本历史、规模、引用、六设置说明)
- Zhao et al. (2009), Radiology 252(1):263–272(DOI: 10.1148/radiol.2522081593)
- Aerts et al. (2014), Nature Communications 5:4006(DOI: 10.1038/ncomms5006)
- Li, D., Zhao, B. 等 (2024), Scientific Data(DOI: 10.1038/s41597-024-04085-3)
- Clark et al. (2017), Scientific Data 4:170124(DOI: 10.1038/sdata.2017.124)
- RIDER-LUNGCT-SEG 分析结果页(DOI: 10.7937/tcia.2020.jit9grk8)
- RIDER 计划 NCI Wiki 页与 RIDER Combined Report 2008
- RIDER Phantom PET-CT / Lung PET-CT 等家族集合页
- PubMed PMID 19561260(Zhao 2009 摘要与结论)
- Nature 官方 ncomms5006 全文(数据/方法细节)
- ESTRO 36 摘要(4DCT 替代 test-retest 的跨集合鲁棒性研究)
- Kaggle RIDER Lung CT 2D 衍生版页
- selectdataset/三方转载的采集与 NCT00579852 描述
- 千方病案医数集内部写作宪法与格式规范
- Google Scholar / TCIA 页面引用快照(截至 2024-06 与 2026-09)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11 映射、人群统计、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(版本矩阵、规模、设备) | 千方病案医学编辑部 | 与 TCIA 官方页面交叉比对 | ✅ 已验证 |
| §4 数据结构(DAIMS、目录树、缺失) | 千方病案医学编辑部 | 与 TCIA/Scientific Data 元数据交叉比对 | ✅ 已验证 |
| §5 数据划分与泄漏 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方协议比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准与生态表述 | 千方病案医学编辑部 | 与原文及 TCIA 引用交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0–§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
