信息速览

UPenn-GBM — 胶质母细胞瘤影像基因组学金标准 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | UPenn-GBM |
| 英文全称 | University of Pennsylvania Glioblastoma Imaging, Genomics, and Radiomics collection |
| 别名/简称 | UPENN-GBM、UPenn-GBM cohort、UPHS GBM collection |
| 疾病分类 | 胶质母细胞瘤,IDH 野生型为主(WHO CNS5 4 级;ICD-11:2A00 星形细胞肿瘤) |
| SNOMED CT | 62247001 Glioblastoma multiforme(详见 §2.1) |
| 数据模态 | 多参数结构 MRI(T1/T1-Gd/T2/T2-FLAIR)+ DTI/DSC 衍生图 + 肿瘤亚区分割 + 全脑分割 + 影像组学特征 + 基因组(IDH1/MGMT)+ 临床随访 + H&E 病理 WSI |
| AI 任务类型 | 肿瘤亚区分割、MGMT 启动子甲基化预测、IDH 状态预测、总生存期预测、假性进展识别、影像组学建模、放射病理组学 |
| 样本总数 | 630 名患者 / 671 次结构扫描 / 828,234 张 DICOM 图像 / 71 张病理切片 |
| 数据大小 | 约 357.42GB(MR DICOM 139.4GB / NIfTI 69GB / 病理 NDPI 149GB / 临床与组学 <20MB) |
| 数据格式 | DICOM、NIfTI(.nii)、CSV、NDPI(全切片) |
| 许可证 | Creative Commons Attribution 4.0 International(CC BY 4.0) |
| 访问级别 | 开放(免注册、免申请,引用需署名) |
| DUO 标签 | NRES(无限制用途) |
| 语言 | 英文 |
| 首发日期 | 2021(Version 2 数据引用首发年份) |
| 最后更新 | 2022-10-24(Version 2,新增病理切片与映射表) |
| 发布机构 | 宾夕法尼亚大学 CBICA 与 Perelman 医学院(Bakas/Sako/Davatzikos 团队) & The Cancer Imaging Archive |
| 官方主页 | TCIA Collection 页面 |
| 下载地址 | TCIA Collection 下载(DICOM 需 TCIA Data Retriever;NIfTI 需 IBM Aspera Connect) |
| DOI | 10.7937/TCIA.709X-DN49(数据集)/ 10.1038/s41597-022-01560-7(论文) |
| 引用次数 | 数据集 27+(DataCite 收录,截至 2026-09);论文 164+(Scopus 收录,截至 2026-09 检索) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 统一预处理与共配准、组学特征开箱即用、临床分子表齐全;扣分项:无官方划分、MGMT 缺失近半、分割仅 232 例经人工修正 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
- 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、GBM 流行病学与临床任务)、§7 偏倚分析(MGMT/IDH 缺失机制与单中心偏倚)。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。UPenn-GBM 以 CC BY 4.0 许可开放获取,下载与使用无需注册或签署协议,但任何再分发或研究成果必须按 TCIA 数据使用政策署名引用数据集 DOI(10.7937/TCIA.709X-DN49)与论文(Scientific Data, 2022)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? UPenn-GBM 是宾夕法尼亚大学发布在 The Cancer Imaging Archive(TCIA)上的胶质母细胞瘤综合研究数据集,收录 630 例初次诊断(de novo)GBM 患者的多参数脑部 MRI,并配套分子检测结果、临床随访信息和计算机提取的肿瘤定量特征。可以把它理解为"一套影像、一张临床表、一摞基因标记"三位一体的完整病历切片。
为什么重要? 胶质母细胞瘤是最常见的成人恶性脑肿瘤,中位总生存期仅 16-20 个月。研究者长期缺少"影像与基因配对、采集协议统一、样本量够大"的公开数据来训练和验证 AI 模型。UPenn-GBM 以 630 例的规模、统一的预处理协议和 CC BY 4.0 的完全开放许可,填补了这一空白——它是同类公开数据集中规模最大的综合性胶质瘤影像基因组学资源。
我能用它做什么? 训练脑肿瘤自动分割模型(附神经放射科医师修正过的金标准标签);开发从 MRI 影像预测 MGMT 甲基化或 IDH 突变的"无创活检"模型;用 145 维现成影像组学特征构建生存预测器,无需自己重新提特征;或把 H&E 病理切片与影像配对,开展放射-病理-基因组交叉研究。
§1.1 技术摘要
UPenn-GBM 由宾夕法尼亚大学 CBICA 中心(Bakas、Sako、Davatzikos 等)于 2021 年在 TCIA 发布,2022 年 10 月 24 日更新至 Version 2 并加入数字化病理切片。数据来自 UPHS 2006-2018 年间回顾性病历筛选:630 例 de novo GBM 患者中,611 例具有术前基线四序列结构 MRI(T1、T1-Gd、T2、T2-FLAIR),592 例(88.2%)附 DTI 衍生图(TR/AD/RD/FA 四卷),534 例(79.6%)附 DSC 灌注衍生图(PH/PSR/ap-rCBV 三卷),另有 60 次二次术前随访扫描。所有 NIfTI 影像经统一流程预处理(SRI atlas 共配准、1mm³ 各向同性重采样、颅骨剥离、N4 偏置场校正、de-facing 脱敏),肿瘤亚区分割标签由 DeepMedic、DeepSCAN 与 nnUNet 三算法 STAPLE 融合生成,其中 232 例经委员会认证神经放射科医师人工复核修正;每个肿瘤亚区、每个序列提取 145 维 CaPTk 影像组学特征。分子层面提供 IDH1 突变状态(NGS 面板和/或 IDH1-R132H 免疫组化)与 MGMT 启动子甲基化(焦磷酸测序),临床层面提供年龄、性别、切除状态、KPS、术后生存信息与预测假性进展指数。全量 357.42GB,CC BY 4.0 开放下载。
§1.2 战略价值
影像基因组学基准价值:放射组学研究的核心命题是"影像表型能否替代有创活检读取分子信息"。UPenn-GBM 同时提供统一采集的 mpMRI 与经 NGS/焦磷酸测序确认的 IDH1、MGMT 分子金标准,使"影像→分子"映射研究可以在同一批患者上端到端验证,避免了以往跨数据集拼接影像与基因组带来的协议混杂。其 145 维组学特征由 CaPTk 工具链统一提取,研究者可以在不写任何特征提取代码的情况下复现主流放射组学基线。
AI 就绪与复现价值:所有结构序列、DTI/DSC 衍生图与分割标签共享同一 SRI atlas 坐标系和 1mm³ 网格,省去了医疗 AI 团队最耗时的配准与重采样工程;配套的采集参数 CSV 与逐患者数据可用性 CSV 使设备混杂分析和样本筛选可以一键完成。对需要外部验证的团队,同在 TCIA 的 UCSF-PDGM(约 500 例弥漫性胶质瘤)构成天然的独立测试队列。
教学与入门价值:CC BY 4.0 意味着课程作业、训练营与综述配图都可以零许可负担地使用真实临床级数据;<20MB 的组学+临床子包让没有 GPU 的学习者也能完整走一遍"特征→模型→生存分析"的建模闭环,这在同规模影像数据集中几乎独一无二。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 分子/标注 | 差异化 |
|---|---|---|---|---|
| UPenn-GBM | 630 例 de novo GBM | mpMRI 4 序列 + DTI/DSC 衍生 + 病理 WSI | IDH1、MGMT、生存、KPS、假性进展指数;ET/NCR/ED 亚区分割 + 145 维组学 | 协议最统一、组学特征开箱即用、CC BY 4.0 免申请 |
| BraTS 2021/2023 | 2,000+ 例多中心胶质瘤 | mpMRI 4 序列 | ET/TC/WT 分割标签(挑战赛金标准) | 规模更大但分子信息需自行关联、多中心异质 |
| TCGA-GBM(TCIA 版) | 约 260 例 | mpMRI(协议不一) | TCGA 全基因组/临床深度注释 | 基因组最全但影像协议异质、样本较小 |
| UCSF-PDGM | 约 500 例弥漫性胶质瘤 | 3D 序列 + HARDI + ASL | IDH、MGMT、1p/19q | 分级谱更宽(II-IV 级),适合外部验证 |
| FeTS 系(同源联邦数据) | 数千例(UPenn-GBM 扩展家族) | mpMRI 4 序列 | 亚区分割 | 面向联邦学习基准,临床中心更多 |
§1.4 版本时间轴
| 版本 | 日期 | 内容变化 | 规模 |
|---|---|---|---|
| Version 1 | 首发(页面标注 Updated 2022/06/21) | MR DICOM(117.77GB)、NIfTI、临床表 v1.0、采集参数、逐患者可用性表、CaPTk 组学 | 500 名患者 / 681,909 张图像 |
| Version 2(当前) | 2021 首发数据引用;2022-10-24 更新 | 患者数扩至 630;新增 H&E 病理 NDPI 切片(34 例、71 张,149GB)与病理-影像 ID 映射 CSV;临床表升级为 v2.1 | 630 名患者 / 828,234 张图像 / 357.42GB |
时间轴的读法提示:TCIA 将 V1 标注为历史版本(页面标注 Updated 2022/06/21),V1 与 V2 的规模差异(500 → 630 例)说明这是同源队列的分批发布而非重制;V2 的数据引用固定为 “(2021) (Version 2)”,因此文献中出现的 2021 与 2022-10-24 两个日期均正确,分别对应数据引用首发与最后一次内容更新。引用时以 V2 DOI 为准,无需区分"更新前/后"的 V2 子版本。
§1.5 典型应用场景
- 脑肿瘤亚区自动分割基准:以 ET/NCR/ED 三亚区标签训练与评测 nnUNet 类分割网络,232 例人工修正子集充当金标准。
- 无创分子预测(radiogenomics):从 mpMRI 预测 MGMT 启动子甲基化与 IDH 突变状态,替代有创活检决策路径。
- 放射组学生存建模:直接加载 145 维 CaPTk 特征构建 Cox/机器学习生存模型,预测总生存期。
- 假性进展 vs 真进展鉴别:利用预测假性进展指数与配对的二次术前随访扫描研究治疗反应影像标志物。
- 放射-病理-基因组交叉研究:将 34 例患者的 H&E 全切片与影像、分子数据配对,开展多模态形态学关联分析。
五个场景的入门难度与数据需求差异显著:场景 1-2 需要完整 NIfTI 包与 GPU 资源;场景 3 仅需 <20MB 的组学与临床表格,普通笔记本即可完成,是最推荐的入门切入点;场景 4 依赖纵向配对子集(41 例),样本量最小、适合作为方法学验证而非主打实验;场景 5 受限于 34 例病理切片,目前更适合作为探索性研究或论文的补充分析,不建议作为核心贡献单独发表。
§2 医学背景
§2.1 ICD-11 与 SNOMED CT 编码映射
| 标签/概念 | ICD-11 编码 | SNOMED CT 码 | 术语说明 |
|---|---|---|---|
| 胶质母细胞瘤(主体诊断) | 2A00(星形细胞肿瘤) | 62247001 | Glioblastoma multiforme,成人最常见的恶性原发性脑肿瘤 |
| 星形细胞肿瘤(上级类目) | 2A00 | 40381003 | Astrocytic tumour,按 WHO CNS5 依 IDH 状态再分型 |
| 脑恶性肿瘤 | 2A00/2A00.1 | 93727005 | Primary malignant neoplasm of brain,保险与病案编码常用父级 |
| MGMT 启动子甲基化(分子标记) | —(分子病理标记,无 ICD-11 诊断码) | 48694005(O(6)-甲基鸟嘌呤-DNA 甲基转移酶基因概念相关) | MGMT promoter methylation,预测替莫唑胺获益 |
| IDH1 突变(分子标记) | —(分子病理标记) | 61689009(异柠檬酸脱氢酶概念相关) | IDH1-R132H 热点突变,WHO CNS5 分型核心依据 |
说明:ICD-11 对胶质瘤采用部位+形态学组合编码(2A00 星形细胞肿瘤,具体亚型经形态学轴 M/9440/3 等描述);MGMT 与 IDH 为分子病理标记,临床上以实验室检查编码(如 ICD-11 的检验类目)记录,本表按 SNOMED CT 概念给出最近似锚点,正式病案编码请以所在机构编码字典为准。
§2.2 疾病简介与流行病学
胶质母细胞瘤(Glioblastoma, GBM)是最常见、最复杂且最具侵袭性的成人中枢神经系统原发性肿瘤。尽管手术、放疗与化疗(Stupp 方案:最大安全切除 + 放疗同步及辅助替莫唑胺)在过去 20 年间不断规范化,GBM 患者经标准治疗后的中位总生存期仍停留在 16-20 个月,5 年生存率约 10%。治疗难以突破的根本原因之一在于肿瘤分子与微环境的高度时空异质性——同一肿瘤内部不同区域在代谢、血管生成与细胞密度上差异巨大,并在影像表型上留下可量化的痕迹。这正是影像基因组学(radiogenomics)切入的临床缺口:通过多参数 MRI 无损刻画分子异质性,替代或补充有创活检。
UPenn-GBM 队列(630 例 de novo GBM,采集窗口 2006-2018)的人口学结构与 GBM 流行病学特征吻合:男性 378 例(60.0%)、女性 252 例(40.0%);年龄 18-89 岁,其中 50-69 岁占 58.3%、70 岁及以上占 28.6%,符合 GBM 发病高峰在 55-75 岁的流行病学规律。分子构成上,IDH 突变仅 16/515 例(3.11%),符合 de novo GBM 以 IDH 野生型为主的特征;MGMT 启动子甲基化阳性 140 例(22.9%,占可判定病例的 44.2%)。
在影像表型层面,GBM 的三个组织学亚区与 MRI 信号有明确的对应关系:增强肿瘤(ET)在 T1-Gd 上呈强化高信号,环绕囊变/坏死核心;坏死与非增强核心(NCR)在 T1 上呈低信号、T2 上高信号,通常与增强核心一并被手术切除;水肿/浸润组织(ED)在 T2-FLAIR 上呈异常高信号包络,常越过增强边界沿白质纤维浸润。这种"影像可见的亚区边界"正是亚区分割与组学特征的解剖学基础,也是 UPenn-GBM 标签体系的设计依据(WHO CNS5 分类与 cIMPACT-NOW 分子判定规则共同约束了分子标签的生成方式)。
§2.3 临床任务定义
| 临床任务 | 定义 | 数据集支撑字段 | 典型 AI 形式 |
|---|---|---|---|
| 肿瘤检出与分级 | 定位并判定胶质瘤恶性级别(WHO 4 级) | 四序列结构 MRI、三亚区分割 | 分割网络 + 分级分类器 |
| 分子分型(无创活检) | 从影像预测 IDH/MGMT 状态,避免或指导活检 | IDH 状态、MGMT 启动子甲基化、mpMRI | 3D CNN / 影像组学分类 |
| 预后预测 | 预测总生存期(OS)与进展风险 | 生存天数、KPS、切除状态、145 维组学 | Cox 回归、生存 CNN |
| 治疗反应评估 | 鉴别假性进展与真进展 | 预测假性进展指数、二次术前随访扫描 | 纵向多时点模型 |
| 手术与放疗规划 | 勾勒可切除肿瘤核心与水肿范围 | ET/NCR/ED 亚区 + 全脑分割 | 自动勾画(auto-contouring) |
上述任务在数据支撑强度上并不均等:分割与预后预测拥有全量级标签支撑(630 例),分子分型受制于标签可得性(MGMT 317 例可判定),而治疗反应评估的可训练样本最小(41 例配对纵向患者)。选题时应按"任务价值 × 标签可得性 × 泄漏风险"三轴综合评估,优先从标签厚实的任务切入。
§2.4 患者人群构成
| 维度 | 取值 | 例数 | 占比 |
|---|---|---|---|
| 来源机构 | 宾夕法尼亚大学医疗系统(UPHS) | 630 | 100% |
| 采集时间 | 2006-2018 年(回顾性病历筛选) | 630 | 100% |
| 年龄 | 18-29 岁 | 14 | 2.2% |
| 年龄 | 30-49 岁 | 69 | 11.0% |
| 年龄 | 50-69 岁 | 367 | 58.3% |
| 年龄 | 70 岁及以上 | 180 | 28.6% |
| 性别 | 男 | 378 | 60.0% |
| 性别 | 女 | 252 | 40.0% |
| 切除状态(611 例术前基线者) | 大部切除 GTR(≥90% 切除) | 362 | 59.2% |
| 切除状态 | 部分切除 PR | 211 | 34.5% |
| 切除状态 | 未知 | 38 | 6.2% |
| 就医类型 | 三级学术医疗中心神经肿瘤诊疗 | 630 | 100% |
§2.5 临床价值
对临床工作流而言,UPenn-GBM 支撑的三类产出最具转化潜力。其一,无创分子分型:MGMT 甲基化与 IDH 状态目前依赖有创活检或手术标本,若影像模型能在术前给出可靠概率估计,可辅助无法手术患者的治疗选择(替莫唑胺获益判断)。其二,预后分层:145 维组学特征与生存数据配对,使风险分层模型可在术前量化,辅助临床试验入组与随访强度设定。其三,随访解读:假性进展指数与二次术前扫描配对,为放化疗后"影像恶化但非肿瘤进展"的鉴别难题提供训练素材——这是 GBM 随访中最具临床风险的灰色地带。
同样值得注意的是它对手术与放疗规划的支撑价值:亚区分割标签与全脑分割共用统一坐标系,使"增强肿瘤体素占比""水肿浸润距离"等形态学量可以直接以代码计算,无需人工逐层勾画。对放疗科而言,以算法生成的危及器官与肿瘤亚区勾画为参照进行人工复核,可将勾画耗时压缩一个数量级;对神经外科而言,术前影像组学风险评分有望进入手术获益-风险讨论。需要强调的是,这些价值都建立在"模型经外部验证"的前提之上,本数据集本身只是起点而非终点。
§2.6 金标准标注规范
| 标注对象 | 划分方式 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| 肿瘤亚区(ET/NCR/ED) | 按 SRI atlas 坐标系逐体素划分 | DeepMedic + DeepSCAN + nnUNet 三算法输出 STAPLE 融合;232 例人工复核修正 | 委员会认证神经放射科医师(S.M.、M.B.) | 计算生成 + 人工修正金标准 |
| 全脑 | 与肿瘤分割同坐标系 | 计算生成 + 人工修正 | 同上 | 计算生成 + 人工修正 |
| IDH1 突变状态 | — | UPHS 临床 NGS 面板(47 基因 TruSeq → 153 基因 Agilent Haloplex)和/或 IDH1-R132H 免疫组化 | 临床分子病理实验室 | 临床金标准 |
| MGMT 启动子甲基化 | — | 焦磷酸测序(pyrosequencing) | 临床分子病理实验室 | 临床金标准 |
| 总生存期 | — | 自首次手术起算的病历随访 | 研究团队 | 临床随访事实 |
| 预测假性进展指数 | — | 依据既往发表的伪进展预测研究计算(要求全部模态齐备 + 二次切除病理评估) | 研究团队(Akbari 等既有研究管线) | 模型衍生标签 |
金标准强度的分层阅读法:分子标签(IDH1/MGMT)是其中最硬的一层,直接来自临床检测流程;分割标签次之——232 例人工修正版是准金标准,全量融合版是弱金标准;假性进展指数最弱,是模型输出而非人工判定。把三层标签混用而不注明层级,是引用该数据集的论文中最常见的口径混乱来源。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本/组件 | 大小 | 理由 |
|---|---|---|---|
| 快速跑通分割/分类模型 | Version 2 NIfTI 包(MR + Segmentation) | 69 GB | 已共配准、颅骨剥离、1mm³ 统一网格,与分割标签逐体素对齐,免配准工程 |
| 复现放射组学/影像基因组学基线 | Version 2 组学 ZIP + 临床 CSV v2.1 | <20 MB | 145 维 CaPTk 特征 + IDH/MGMT/生存标签,纯表格即可建模,无需下载影像 |
| 设备混杂分析 / DICOM 级特征 | Version 2 MR DICOM 包 | 139.4 GB | 630 名患者 3,301 检查、3,680 序列原始 DICOM + 采集参数 CSV |
| 病理-影像交叉研究 | Version 2 Histopathology NDPI | 149 GB | 34 名患者、71 张 H&E 全切片,附病理-影像 ID 映射 CSV |
§3.1 模态详情
| 模态 | 序列/内容 | 数量 | 说明 |
|---|---|---|---|
| 结构 MRI | T1(平扫) | 671 次扫描 | 术前基线 611 + 随访 60 |
| 结构 MRI | T1-Gd(钆增强 T1) | 671 次扫描 | 增强肿瘤(ET)判定主序列 |
| 结构 MRI | T2(平扫) | 671 次扫描 | 肿瘤核心与水肿整体观 |
| 结构 MRI | T2-FLAIR | 671 次扫描 | 水肿(ED)与浸润带判定主序列 |
| 弥散衍生 | DTI:TR/AD/RD/FA 四卷 | 592 例(88.2%) | 反映组织微结构与密度 |
| 灌注衍生 | DSC:PH/PSR/ap-rCBV 三卷 | 534 例(79.6%) | 将 4D 动态灌注信号压缩为单 3D 参数图 |
| 分割标签 | ET/NCR/ED 三亚区 + 全脑 | 611+ 例(NIfTI 包内) | 三算法 STAPLE 融合,232 例人工修正 |
| 影像组学 | 每亚区每序列 145 个 CaPTk 特征 | 全部标注亚区 | 强度/体积/形态/直方图/纹理五族 |
| 基因组 | IDH1 突变状态、MGMT 启动子甲基化 | 515 / 317 例可判定 | NGS + IHC / 焦磷酸测序 |
| 临床 | 年龄、性别、KPS、切除状态、生存、假性进展指数 | 671 行(630 患者) | CSV v2.1 |
| 病理 | H&E 数字化全切片(NDPI) | 34 名患者 / 71 张 | de novo 与复发匹配病例的少数子集 |
§3.2 按子集样本数统计
| 子集 | 例数 | 占 630 例比例 | 备注 |
|---|---|---|---|
| 全部患者 | 630 | 100% | de novo GBM |
| 术前基线四序列扫描 | 611 | 97.0% | 19 例仅有随访时点 |
| 二次术前随访扫描 | 60 | 9.5% | 进展后再切除前采集 |
| 含 DTI 衍生图 | 592 | 94.0%(占结构扫描 88.2%) | 种子信息"约 76 例"经核实不成立 |
| 含 DSC 衍生图 | 534 | 84.8%(占结构扫描 79.6%) | |
| IDH 状态可判定 | 515 | 81.7% | 96 例记为 NOS/NEC |
| IDH 突变 | 16 | 2.6% | 3.11%(占可判定者) |
| MGMT 甲基化可判定 | 317 | 50.3% | 294 例未知 |
| MGMT 甲基化阳性 | 140 | 22.2% | |
| 含病理切片 | 34 | 5.4% | 71 张 NDPI |
§3.3 数据格式
| 内容 | 格式 | 组织方式 |
|---|---|---|
| 原始影像 | DICOM | 按患者/检查/序列三级层级,TCIA Data Retriever 下载 |
| 预处理影像 | NIfTI(.nii) | 按患者目录组织,与分割标签逐体素对齐 |
| 分割标签 | NIfTI(.nii) | 标签值对应各亚区,坐标与 NIfTI 影像一致 |
| 临床/分子数据 | CSV | UPENN-GBM_clinical_info_v2.1.csv(671 行) |
| 影像组学 | CSV/ZIP | radiomic_features_CaPTk.zip + 特征清单与参数文件 CSV |
| 采集参数 | CSV | UPENN-GBM_acquisition.csv(设备、序列参数) |
| 数据可用性 | CSV | UPENN-GBM_data_availability.csv(逐患者逐模态在/缺) |
| 病理切片 | NDPI(Hamamatsu 全切片格式) | pathdb 平台浏览 + Aspera 下载 |
| 病理-影像映射 | CSV | radiology_mapping.csv(2.52KB) |
格式组合的分工逻辑:DICOM 保存"原始事实"(未配准、含设备元数据),NIfTI 保存"研究事实"(统一坐标系、已脱敏、可直接喂给模型),CSV 保存"表格事实"(临床、分子、参数、可用性),NDPI 保存"形态学事实"(细胞级 H&E)。四类事实通过 UPENN-GBM-XXXXX 患者主键与映射表串联,任何研究问题都可以表述为"在哪些事实之间建立映射"——这正是该数据集作为影像基因组学基础设施的设计意图。
§3.4 存储大小明细
| 组件 | 大小 | 备注 |
|---|---|---|
| MR DICOM | 139.4 GB | 828,234 张图像 |
| MR + Segmentation NIfTI | 69 GB | 推荐研究主入口 |
| Histopathology NDPI | 149 GB | 71 张全切片 |
| 临床 CSV | 64.93 KB | v2.1,671 行 |
| 影像组学 ZIP+CSV | 15.37 MB | CaPTk 特征 |
| 采集参数 + 可用性表 + 映射表等 | <0.5 MB | |
| 全集合计 | 约 357.42 GB |
§3.5 标注方式
分割标签采用"计算生成 + 人工修正"的两级管线:先以结构四序列为输入,分别运行 BraTS 系三大分割算法(DeepMedic、DeepSCAN、nnUNet),再用 STAPLE 真值融合技术合并三者输出以抑制单算法误差;随后由委员会认证神经放射科医师对其中 232 例的标签逐例评估,人工修正误分类区域并签字确认。分子标签(IDH1、MGMT)来自 UPHS 临床分子病理实验室的标准检测流程,属临床级金标准而非研究性标注。影像组学特征为全自动计算(CaPTk),无人工干预环节。
§3.6 标注者资质与一致性
分割标签的人工修正由两名委员会认证(board-certified)神经放射科医师(论文作者 S.M. 与 M.B.)完成,覆盖 232 例。数据集未随附逐例的标注者间一致性统计(如 Dice 或 Cohen’s kappa)公开数值;人工修正版与纯自动版分割共存于同一数据包,使用者可自行在两者子集上量化差异——已有第三方研究(Lizzi et al., 2025, Cancers)报告两者对下游任务性能影响显著(详见 §6.5 坑点 2 与 §7.2)。分子标签由临床实验室按 CLIA 标准流程出具,论文未报告外部复检一致性。
"两名标注者"的具体协作方式(独立双标注、共识标注或主副分工)论文未披露,使用人工修正子集做评测时不应假设其达到双人独立共识的金标准强度,报告中应如实引用论文表述:“由两名委员会认证神经放射科医师评估并在需要时人工修正”。
§3.7 采集周期
影像采集时间窗为 2006-2018 年,来源于 UPHS 常规临床放射检查(非专用研究扫描协议),经回顾性电子病历筛选入组。术前基线扫描为诊断时点采集,随访扫描在第二次切除手术前 15 日内采集。扫描日期本身已因脱敏而从发布数据中移除,仅保留生存天数等相对时间量。
"常规临床检查"这一来源属性是双刃剑:好处是影像分布真实反映临床场景,模型面对的就是上线后会遇到的输入类型;代价是序列参数逐患者可变(与专为研究设计的统一协议数据集相反),任何"协议内变化"都需要在模型训练与消融分析中显式对待。配套的采集参数 CSV 正是为这一需求而发布。
§3.8 地域覆盖
单中心数据集:全部病例来自美国宾夕法尼亚州费城的宾夕法尼亚大学医疗系统(University of Pennsylvania Health System, UPHS),属三级学术医疗中心。无地域多样性;种族与族裔信息未在发布数据中系统记录。
单中心属性对三类研究最敏感:跨中心泛化评估(必须引入外部队列)、设备无关建模(需以采集参数 CSV 做设备分层消融)、流行病学推断(结论不可外推至人群发病率水平)。对算法研究而言,单中心反而是控制变量意义上的优势——协议、流程与审核标准的一致性,使"影像-分子"关联中的噪声源比多中心数据少一档。
§3.9 设备规格
影像在 UPHS 临床 MRI 设备上按常规检查协议采集,各病例的扫描仪制造商、机型与序列参数整理于官方 采集参数 CSV(194.11KB,逐患者逐序列)。结构序列经统一后处理(SRI atlas 配准 + 1mm³ 各向同性重采样)消除了网格差异,但原始场强/线圈/机型差异仍保留在 DICOM 与参数表中,可用于设备混杂分析。第三方对 DTI 子集的示例描述显示部分弥散数据采用 Siemens 3T 平台 30 方向 DTI 序列(b=1000 s/mm²),但该描述仅覆盖特定处理子集,不代表全队列。
§3.10 深度溯源链
| 层级 | 内容 | 溯源 |
|---|---|---|
| 一级(原始) | DICOM 影像、病理 NDPI | UPHS 放射科/病理科 PACS 导出,IRB 批准(UPHS)+ 知情同意 |
| 二级(处理) | NIfTI 结构/DTI/DSC 卷 | BraTS 标准流程:DICOM→NIfTI、de-facing、LPS 重定向、SRI 配准、1mm³ 重采样、颅骨剥离、N4 校正 |
| 三级(标注) | 亚区分割、全脑分割 | DeepMedic/DeepSCAN/nnUNet + STAPLE 融合 + 232 例神经放射科医师人工修正 |
| 四级(派生) | 145 维组学特征 | CaPTk(Cancer Imaging Phenomics Toolkit)按亚区按序列提取 |
| 五级(临床/分子) | IDH1、MGMT、KPS、生存、假性进展指数 | 临床分子病理实验室检测 + 病历随访 + 既发表伪进展研究管线 |
| 发布与资助 | TCIA 托管;NIH NINDS R01NS042645、NCI U24CA189523、NCI U01CA242871、NCATS UL1TR001878 及 UPenn ITMAT 资助 | TCIA Collection 页面致谢栏 |
五级溯源链的每一级都可独立引用与复现:一级是法律意义上的原始数据,二级到四级是可由论文方法描述复算的派生产物,五级是临床事实的搬运。复现实验遇到不一致时,按"先查层级、再查口径、最后查版本"的顺序定位——绝大多数争议会被归因到二级(预处理版本差异)或三级(标签口径差异),而非数据本身。
关键论文:Bakas, S., Sako, C., et al. “The University of Pennsylvania glioblastoma (UPenn-GBM) cohort: advanced MRI, clinical, genomics, & radiomics.” Scientific Data 9, 453 (2022). DOI: 10.1038/s41597-022-01560-7。
§3.11 数据卡片
| 字段 | 值 |
|---|---|
| 收录患者数 | 630(de novo GBM) |
| 扫描时点 | 术前基线(611 例)+ 二次术前随访(60 次扫描) |
| 影像序列 | T1、T1-Gd、T2、T2-FLAIR(结构);DTI-TR/AD/RD/FA;DSC-PH/PSR/ap-rCBV |
| 网格与坐标 | SRI atlas,1mm³ 各向同性,LPS |
| 分割类别 | ET(增强肿瘤)、NCR(坏死/非增强核心)、ED(水肿/浸润组织)+ 全脑 |
| 分子标签 | IDH1(突变/野生型/NOS-NEC)、MGMT 启动子(甲基化/未甲基化/未知) |
| 临床标签 | 年龄、性别、KPS、切除状态、生存天数、预测假性进展指数 |
| 许可 | CC BY 4.0 |
§4 数据结构
§4.0 目录树
解压 NIfTI 主包并展开随附 CSV 后的目录结构示意(文件名模式以官方下载包为准):
upenn-gbm/
├── UPENN-GBM_clinical_info_v2.1.csv # 临床/分子主表(671 行,每行一个患者-时点)
├── UPENN-GBM_acquisition.csv # 逐患者逐序列采集参数
├── UPENN-GBM_data_availability.csv # 逐患者逐模态在/缺矩阵
├── UPENN-GBM_CaPTk_radiomic_features_list.csv # 145 个组学特征的名称与定义
├── UPENN-GBM_CaPTk_fe_params.csv # 组学特征提取参数
├── radiology_mapping.csv # 病理-影像 ID 映射(2.52KB)
├── radiomic_features_CaPTk.zip # 组学特征包(15.37MB)
│ └── <subject>/<sequence>_<subregion>_features.csv
├── UPENN-GBM/
│ ├── UPENN-GBM-00001/
│ │ ├── UPENN-GBM-00001_11_T1.nii
│ │ ├── UPENN-GBM-00001_11_T1_Gd.nii
│ │ ├── UPENN-GBM-00001_11_T2.nii
│ │ ├── UPENN-GBM-00001_11_T2_FLAIR.nii
│ │ ├── UPENN-GBM-00001_11_<DTI/DSC 衍生卷>.nii # TR/AD/RD/FA、PH/PSR/ap-rCBV
│ │ ├── UPENN-GBM-00001_11_seg.nii # 肿瘤亚区标签(与结构序列逐体素对齐)
│ │ └── UPENN-GBM-00001_11_whole_brain.nii # 全脑分割
│ ├── UPENN-GBM-00002/
│ │ └── ...
│ └── UPENN-GBM-00630/
│ └── ...
└── Histopathology/ # Version 2 新增(另包下载)
├── <pathology patient id>/<slide>.ndpi # 34 名患者、71 张 H&E 全切片
└── radiology_mapping.csv # 与放射学 subject ID 的映射
要点:UPENN-GBM-XXXXX 为患者主键;_11_ 中间段标识检查/时点编号(部分患者存在随访时点)。临床 CSV 行数为 671,多于患者数 630,因随访时点单独成行——连接键为 ID 列而非行号。
§4.1 DAIMS 字段字典
核心字段一览(类型/示例/取值范围详见各 CSV 与特征清单文件):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| ID | 文本 | 患者主键(随访时点独立成行) | UPENN-GBM-00001 | 连接影像/组学/临床 | 无 | 无 | 630 个唯一患者 |
| Age at MRI | 数值 | 扫描时年龄(岁) | 61.0 | 协变量、偏倚分析 | 记录精度内 | 无 | 18-89 |
| Gender | 类别 | 性别 | Male | 协变量 | 无 | 无 | Male/Female |
| Survival (days) | 整数 | 首次手术起算的总生存天数 | 412 | 生存建模 | 病历随访粒度 | 缺失者无行内值 | ≥0 |
| KPS | 整数 | 治疗前 Karnofsky 功能状态评分 | 80 | 预后协变量 | 临床评分 | 空值 | 0-100 |
| Resection status | 类别 | 切除范围 | Gross Total | 治疗混杂控制 | 病历记录 | Unknown(38 例) | GTR/PR/Unknown |
| MGMT promoter status | 类别 | 启动子甲基化 | Methylated | 无创预测目标 | 焦磷酸测序 | Unknown(294 例) | Methylated/Unmethylated/Unknown |
| IDH status | 类别 | IDH 突变状态 | Wildtype | 分型/预测目标 | NGS+IHC | NOS/NEC(96 例) | Mutant/Wildtype/NOS-NEC |
| Pseudoprogression index | 数值 | 预测假性进展指数(模型衍生) | 0.37 | 反应评估 | 依赖上游模型 | 非全员可得 | 连续值 |
<subject>_<tp>_<seq>.nii |
影像卷 | 预处理 NIfTI(1mm³、SRI、颅骨剥离后) | …_11_T1_Gd.nii | 分割/分类输入 | 统一管线内 | 模态缺者无文件 | 240×240×155 网格族 |
| seg.nii | 标签卷 | 肿瘤亚区标签 | 1=ET, 2=NCR(核心), 3=ED | 分割金标准 | 232 例人工修正 | 无 | |
| radiomic features | 数值向量 | 每亚区每序列 145 维 CaPTk 特征 | 145 列 CSV | 组学建模 | 全自动计算 | 无 | 连续值 |
§4.2 标签分布
分子标签分布(630 例):MGMT——甲基化 140(22.9%)、未甲基化 177(29.0%)、未知 294(48.1%);IDH——突变 16(2.6%)、野生型 499(81.7%)、NOS/NEC 96(15.7%)。临床标签分布:GTR 362(59.2%)、PR 211(34.5%)、未知 38(6.2%,占 611 例术前基线者)。分割标签:以体素计,ED(水肿)通常体积最大,NCR 与 ET 次之,类别天然不均衡(分割模型需 Dice-损失或加权采样)。
从建模视角解读这两组分布:MGMT 可判定子集内阳性率约 44.2%,接近均衡,二分类器不易因类不平衡而失真;但把"未知"当作负类是致命错误——它会把阳性率稀释到 22.9% 并引入系统性偏倚(坑点 4)。IDH 分布则截然不同:即便在可判定子集内,突变率也只有 3.11%,任何准确率指标都会被"全预测野生型"这一退化分类器刷到 96.9%,必须以 AUC/平衡准确率/敏感度-特异度替代裸准确率。
§4.3 关键统计
- 每患者序列数:结构 4 卷 + 至多 4 卷 DTI 衍生 + 至多 3 卷 DSC 衍生;671 次结构扫描对应 3,680 个 DICOM 序列。
- 体素网格:重采样后为 1mm³ 各向同性(约 240×240×155 体素族的 SRI 空间);颅骨剥离后脑外体素为 0。
- 组学特征规模:3 个亚区 × 11 个序列位 × 145 维,单患者理论特征矩阵可达数千列,实际按可得亚区/序列生成。
- 类别稀有度:IDH 突变仅 16 例——任何以 IDH 突变为目标的分类研究都必须面对极端类不平衡。
- 时点结构:611 例术前基线 + 60 次二次术前随访,其中 19 例仅有随访时点;做纵向建模时可用患者上限为 41 例(60-19),样本量约束极为苛刻。
- 表格规模感:临床表 671 行 × 数十列 + 组学特征数千列,任何表格建模都应先跑列级缺失率与唯一值审计。
§4.4 数据层级
患者(Patient, 630)
└── 检查时点(Time-point,术前基线 / 二次术前随访;671 行临床记录)
└── 序列(Series:T1、T1-Gd、T2、T2-FLAIR、DTI×4 衍生、DSC×3 衍生)
└── 体素(Voxel:1mm³ SRI 空间) ──逐体素对齐── 标签卷(ET/NCR/ED/全脑)
└── 亚区×序列级组学特征(145 维/组合)
配套(不依附层级):临床/分子表(患者-时点行)、采集参数表、可用性矩阵、病理切片(34 患者)
§4.5 缺失值与信息性缺失编码
| 字段 | 缺失/未知表示 | 例数(占比) | 是否信息性缺失 | 处理建议 |
|---|---|---|---|---|
| MGMT promoter status | Unknown |
294(48.1%) | 是——检测依临床指征而非随机执行 | 勿简单 dropna;建模时显式声明可用子集(317 例)并做可用性回归诊断 |
| IDH status | NOS/NEC |
96(15.7%) | 是——按 cIMPACT-NOW 规则无法正式分型 | 二分类任务中单独处理或作为第三类 |
| Resection status | Unknown/NA |
38(6.2%) | 弱信息性 | 敏感性分析剔除 vs 单独类 |
| DTI 衍生卷 | 文件级缺失 | 630-592=38 例 | 是——与采集协议年份相关 | 用官方可用性矩阵预过滤 |
| DSC 衍生卷 | 文件级缺失 | 630-534=96 例 | 是 | 同上 |
| 扫描日期 | 已脱敏移除 | 全部 | 设计使然 | 仅可使用生存天数等相对时间 |
缺失治理的统一心法:UPenn-GBM 的缺失几乎都不是"数据错误",而是"临床现实的投影"——检测按指征执行、扫描按临床需要采集、日期按伦理要求移除。因此治理手段不是"填补",而是"声明与建模":在每个实验中显式写出缺失机制、以可用性矩阵过滤样本、把缺失预测器当作诊断工具。把 Unknown 当作可填补的空洞,是与该数据集气质最相悖的做法。
§5 数据划分与使用建议
§5.1 官方划分
UPenn-GBM 不提供官方 train/val/test 划分。数据以全量形式发布,论文将自身方法学定位在"可复用资源"而非"挑战赛基准",因此每一篇使用该数据集的论文都自定义划分,跨论文指标不可直接比较(详见 §8.3)。
这一设计是理解该数据集所有评测争议的钥匙:它把"如何构建可信实验"的责任完整交给了使用者。好处是方法学自由度高、数据可全量利用;代价是社区内不存在任何"官方可比"的数字,也意味着你的实验设计本身就是论文被审的方法学之一。把划分协议写清楚、写完整,在这里比模型调参更重要。
§5.2 社区惯例划分
已发表的两种主流做法:其一,SpotTune 迁移学习研究(Kaplan et al., 2024)以 MGMT 可判定且含术前扫描的 262 例为池,2:1 划分训练/测试,训练集再做分层 5 折交叉验证,测试集规模 78 例(结构模态);其二,MGMT 放射组学研究(Lizzi et al., 2025)在 258 例"分割+MGMT 双全"子集内做交叉验证,并在 55 例"手动修正分割"子集上复评。两者均提示:子集定义本身(MGMT 可得性、分割质量)已成为结果的重要修饰变量。
§5.3 划分策略建议与泄漏风险
- 按患者分组:同一患者的全部序列与随访时点必须落在同一侧(train 或 test)。 leakage 场景:同患者随访扫描与基线扫描分属两侧,纵向影像高度相似,会造成指标虚高。
- 按模态可用性分层:DTI/DSC 子集非随机缺失,划分前先按"模态齐备性"分层抽样,避免某一折集中了全部多模态病例。
- 按采集年代分块(可选):若做时间泛化评估,可以 2006-2012 / 2013-2018 分块模拟时间漂移(扫描日期已脱敏时只能用生存时间或设备型号近似)。
- 小样本稀有类:IDH 突变仅 16 例,任何含 IDH 的任务推荐嵌套交叉验证 + 患者级分组,禁止在划分前做特征选择。
- 外部验证:以 UCSF-PDGM(约 500 例弥漫性胶质瘤,同在 TCIA)为外部测试集是当前最顺手的独立验证路径,已有生存预测研究按此实践。
§5.4 交叉验证建议
推荐 5 折患者级分组交叉验证(GroupKFold,groups=subject_id),报告每折指标均值±标准差与全部折合并的池化指标;MGMT 任务同时报告 AUC 与平衡准确率,并给出置信区间。杜绝"按行随机划分 CSV"这类常见事故——671 行临床表含同患者多行,逐行随机必然泄漏。
import pandas as pd
import numpy as np
from sklearn.model_selection import GroupKFold
clin = pd.read_csv("/data/upenn-gbm/UPENN-GBM_clinical_info_v2.1.csv")
mgmt = clin[clin["MGMT promoter status"].isin(["Methylated", "Unmethylated"])].copy()
groups = mgmt["ID"].values # 患者主键:671 行 -> 630 组,分组防泄漏
gkf = GroupKFold(n_splits=5)
for fold, (tr, te) in enumerate(gkf.split(mgmt, groups=groups), 1):
tr_ids, te_ids = set(mgmt.iloc[tr]["ID"]), set(mgmt.iloc[te]["ID"])
assert not (tr_ids & te_ids), f"fold {fold} 存在患者跨侧泄漏"
print(f"fold {fold}: train {len(tr)} 行 / test {len(te)} 行,"
f"阳性率 train {mgmt.iloc[tr]['MGMT promoter status'].eq('Methylated').mean():.3f}")
§5.5 外部验证建议
外部验证时注意三件事:UPenn-GBM 全部影像已颅骨剥离并配准 SRI atlas,而多数外部集(含 UCSF-PDGM)保留全头颅,需自行补齐同样的预处理或使用对颅脑提取不敏感的模型输入(如以提供的全脑 mask 包络裁剪);UCSF-PDGM 分级谱更宽(II-IV 级),做 GBM-only 子集过滤再比;病理切片仅 34 例,任何"影像→病理"模型不得宣称以病理为独立验证。
§6 AI 就绪指南
§6.0 云端快速启动
NCI Imaging Data Commons(IDC)提供 UPenn-GBM 的云端镜像,可在不下载 139.4GB DICOM 的情况下按筛选条件取子集:访问 IDC 门户 UPenn-GBM 视图,或用 idc-index Python 包直接检索与拉取。适合快速探索与小规模实验;全量研究仍建议走 TCIA 原始分发。
pip install idc-index
python - <<'EOF'
from idc_index import IDCClient
client = IDCClient()
client.index.query_values_from_table("collection_id", "upenn_gbm") # 确认镜像在库
s5 = client.select_series(collection_id="upenn_gbm", limit=20) # 取 20 个序列试跑
client.download_series(s5, downloadDir="/data/idc-upenn-gbm")
EOF
§6.1 快速上手
下方代码假设:
- 你已按 §3.4 下载 NIfTI 包(69GB)与临床 CSV,并解压到
data_root;- 目录结构预期:
{data_root}/UPENN-GBM/UPENN-GBM-00001/UPENN-GBM-00001_11_T1.nii等,临床表在{data_root}/UPENN-GBM_clinical_info_v2.1.csv;data_root拼接关系:data_root = 解压根目录,所有相对路径均从它出发;- 最小可用子集 = 262 例"术前扫描 + MGMT 状态双全"患者(或 <20MB 的组学特征 ZIP + 临床表,几分钟即可跑通全流程)。
import pandas as pd
import nibabel as nib
import numpy as np
DATA_ROOT = "/data/upenn-gbm" # 解压根目录:CSV 与 UPENN-GBM/ 影像目录并列
# 1) 临床/分子主表:671 行,每行一个患者-时点,主键 ID
clin = pd.read_csv(f"{DATA_ROOT}/UPENN-GBM_clinical_info_v2.1.csv")
print(clin.shape) # (671, n_cols)
print(clin["ID"].nunique()) # 630 名患者
# 2) 取"术前扫描 + MGMT 可判定"最小子集
mgmt = clin[clin["MGMT promoter status"].isin(["Methylated", "Unmethylated"])]
print(len(mgmt)) # 约 291 行(含少量仅有随访时点者)
# 3) 读取一个患者的结构序列与分割(NIfTI 与分割逐体素对齐)
sid, tp = "UPENN-GBM-00001", "11"
t1g = nib.load(f"{DATA_ROOT}/UPENN-GBM/{sid}/{sid}_{tp}_T1_Gd.nii")
seg = nib.load(f"{DATA_ROOT}/UPENN-GBM/{sid}/{sid}_{tp}_seg.nii")
vol, mask = np.asarray(t1g.dataobj), np.asarray(seg.dataobj)
print(vol.shape, np.unique(mask)) # (240, 240, 155) [0 1 2 3]
§6.2 数据获取
| 组件 | 工具 | 大小 | 获取说明 |
|---|---|---|---|
| MR DICOM | TCIA Data Retriever + .tcia manifest | 139.4 GB | 用 官方 manifest 批量下载 |
| MR + Segmentation NIfTI | IBM Aspera Connect(浏览器插件下载) | 69 GB | 推荐,研究主入口 |
| Histopathology NDPI | IBM Aspera Connect | 149 GB | 34 名患者 71 张 |
| 临床 CSV / 组学 ZIP / 参数表 | 浏览器直链 | <20 MB | 免工具 |
# NIfTI 与表格直链示例(CC BY 4.0,免注册)
curl -L -o UPENN-GBM_clinical_info_v2.1.csv \
https://www.cancerimagingarchive.net/wp-content/uploads/UPENN-GBM_clinical_info_v2.1.csv
curl -L -o radiomic_features_CaPTk.zip \
https://www.cancerimagingarchive.net/wp-content/uploads/radiomic_features_CaPTk.zip
curl -L -o UPENN-GBM_data_availability.csv \
https://www.cancerimagingarchive.net/wp-content/uploads/UPENN-GBM_data_availability.csv
# DICOM 走 TCIA Data Retriever(GUI/CLI),NIfTI 走 Aspera 浏览器下载
下载后第一步永远是:用 UPENN-GBM_data_availability.csv 生成本机文件清单与官方可用性矩阵的差异报告,确认无静默截断(大包 Aspera 传输中断较常见)。
import os
import pandas as pd
DATA_ROOT = "/data/upenn-gbm"
avail = pd.read_csv(f"{DATA_ROOT}/UPENN-GBM_data_availability.csv")
missing = []
for sid in avail["ID"].unique():
d = os.path.join(DATA_ROOT, "UPENN-GBM", sid)
if not os.path.isdir(d) or len(os.listdir(d)) == 0:
missing.append(sid)
print(f"官方声明存在但本地缺失的患者目录:{len(missing)} 例")
# 输出非零即为下载不完整,重新走 Aspera 补传后再开始训练
§6.3 预处理全流程
UPenn-GBM 的最大卖点之一是影像已完成重预处理,不要再对发布版 NIfTI 重复配准/颅骨剥离。推荐流程:
import nibabel as nib
import numpy as np
def zscore_in_brain(img_path, seg_path):
"""脑内 z-score:仅用肿瘤外脑组织体素估计均值/方差,避免肿瘤亮斑主导归一化。
输入已是 1mm³ SRI 空间、颅骨剥离后的 NIfTI,无需再做配准/去颅骨。"""
vol = np.asarray(nib.load(img_path).dataobj, dtype=np.float32)
seg = np.asarray(nib.load(seg_path).dataobj)
brain = seg > 0 # 有标注区域外的脑体素:此处用全脑分割 mask 更佳
mu, sd = vol[brain].mean(), vol[brain].std()
return (vol - mu) / (sd + 1e-8)
流程建议:格式确认(NIfTI 即用,DICOM 需转换且与 NIfTI 坐标系不一致,见坑点 1)→ 脑内强度标准化(各序列独立;或采用脑干中位数/IQR 的 robust 归一化)→ 按 seg.nii 检查亚区标签完备性 → 训练期在线增强(§6.6)。特征级研究者可直接跳到 145 维组学 CSV,用 pandas 合并临床表即得建模矩阵。
若你的实验必须从 DICOM 出发(如需要原始层厚信息),转换与去颅骨可以借助现成工具链完成,但要注意产物不再与官方 NIfTI 对齐(坑点 1),且官方 NIfTI 已含 N4 偏置场校正,自转 DICOM 需自行补齐这一步:
# 示意:dcm2niix 转换 + N4 校正 + 颅骨剥离(HD-BET),产物坐标系与官方 NIfTI 无关
dcm2niix -o dicom_out -f "%p_%s" <DICOM目录>
N4BiasFieldCorrection -i dicom_out/T1_Gd.nii -o t1gd_n4.nii
hd-bet -i t1gd_n4.nii -o t1gd_bet.nii # 或 synthstrip / robex
§6.4 PyTorch DataLoader
import pandas as pd
import nibabel as nib
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
DATA_ROOT = "/data/upenn-gbm" # 解压根目录:UPENN-GBM/ 影像目录与 CSV 并列
class UpennGbmSegmentation(Dataset):
"""最小可用子集:术前基线、四结构序列齐备、含分割标签的患者。
返回 4 通道体 + 亚区标签,形状 (4, 240, 240, 155)。"""
SEQS = ["T1", "T1_Gd", "T2", "T2_FLAIR"]
def __init__(self, data_root=DATA_ROOT, subjects=None):
self.root = data_root
self.subjects = subjects or self._default_subjects()
def _default_subjects(self):
avail = pd.read_csv(f"{self.root}/UPENN-GBM_data_availability.csv")
# 按官方可用性矩阵筛选基线四序列齐备者,避免运行期缺文件
return avail.query("`T1` and `T1-Gd` and `T2` and `T2-FLAIR`")["ID"].tolist()
def __len__(self):
return len(self.subjects)
def __getitem__(self, idx):
sid = self.subjects[idx]
tp = "11" # 基线检查编号;多时点患者请先解析目录实际编号
chans = []
for seq in self.SEQS:
p = f"{self.root}/UPENN-GBM/{sid}/{sid}_{tp}_{seq}.nii"
v = np.asarray(nib.load(p).dataobj, dtype=np.float32)
brain = v > 0
v = (v - v[brain].mean()) / (v[brain].std() + 1e-8)
chans.append(v)
seg = np.asarray(nib.load(f"{self.root}/UPENN-GBM/{sid}/{sid}_{tp}_seg.nii").dataobj)
x = torch.from_numpy(np.stack(chans)) # (4, D, H, W)
y = torch.from_numpy(seg.astype(np.int64)) # (D, H, W) 标签 {0,1,2,3}
return x, y
ds = UpennGbmSegmentation()
dl = DataLoader(ds, batch_size=1, shuffle=True, num_workers=4, pin_memory=True)
for x, y in dl: # 训练循环占位:3D U-Net / nnUNet 接入点
break
提示:155×240×240 的全脑网格对显存压力大,训练期可先用附带全脑分割裁剪有效脑包络、再下采样 2 倍(≈120×120×78),社区研究普遍如此处理;验证/测试保持原始网格以报告官方可比 Dice。
§6.5 坑点清单(8 个,均为该数据集真实特有的失败模式)
⚠️ 坑点 1:NIfTI 与 DICOM 天生不对齐(分类:工程陷阱)
问题:官方注明所有 NIfTI 已统一配准到 SRI atlas 并做 1mm³ 重采样,因此 NIfTI 与同患者的原始 DICOM 按设计不对齐;拿 DICOM 的位置信息或叠加在 NIfTI 上做核对,会发现空间完全错位。
症状:用 DICOM 元数据(ImagePositionPatient)定位 NIfTI 体素得到"肿瘤长在颅外"的诡异切片;或混用两套影像训练时指标莫名下降。
解决:
- 简单方法:全流程只用一种影像形态。研究用 NIfTI(与分割对齐),存档用 DICOM,两者不交叉。
- 进阶方法:确需混用时以 NIfTI 为参考空间,将 DICOM 经同一 BraTS 式管线(配准 SRI、1mm³ 重采样、颅骨剥离)再处理,禁止直接刚性对拷。
- SOTA 方法:在 DICOM 侧用 TCIA 提供的采集参数 CSV 记录处理链版本,任何派生数据都写明"基于 SRI-space NIfTI"或"基于原始 DICOM"的数据血缘标签。
参考:TCIA Collection 页面官方 Note;Bakas et al., 2022, Scientific Data, DOI: 10.1038/s41597-022-01560-7。
⚠️ 坑点 2:分割标签是"三算法融合品",232 例才有人工修正(分类:标签理解)
问题:包内分割标签由 DeepMedic/DeepSCAN/nnUNet 三算法 STAPLE 融合自动生成,仅 232 例经神经放射科医师人工修正。用融合标签当"完美金标准"训练或评测,会同时学到算法共识偏差并高估分割性能。
症状:与人工修正子集比对时自动标签出现亚区互串(如坏死区被标为增强区);在人工子集上评测的 Dice 显著低于自动子集自查结果;MGMT 预测等下游任务性能随 mask 质量波动巨大(已证实即使 Dice 差异不显著,组学性能也可显著不同)。
解决:
- 简单方法:训练用全量标签,评测只用 232 例人工修正子集,明确声明评测口径。
- 进阶方法:把"是否人工修正"作为协变量做分层分析,报告两套指标;训练时对自动标签样本降权或用噪声鲁棒损失。
- SOTA 方法:采用噪声感知学习(co-teaching/自监督标签净化),或以人工修正子集微调分割头后再回标全量。
参考:Lizzi et al., 2025, Cancers 17(21):3417, DOI: 10.3390/cancers17213417;Bakas et al., 2022, Scientific Data。
⚠️ 坑点 3:临床表 671 行 ≠ 630 患者,ID 连接错位(分类:工程陷阱)
问题:
UPENN-GBM_clinical_info_v2.1.csv每行是一个患者-时点(671 行),而非每患者一行;随访时点行与影像目录中的检查编号需要自行对应。把表当 630 行用或按行号随机划分,都会静默污染数据集。
症状:合并后出现同患者两行训练/验证分侧的"完美泄漏";按患者统计的临床特征分布与论文 Table 1 对不上。
解决:
- 简单方法:一切合并与划分以
ID列为组键(groupby("ID")/GroupKFold(groups=ID))。- 进阶方法:写一个患者级 manifest(每患者 → [基线行, 随访行] → 影像文件列表),全流程只消费 manifest。
- SOTA 方法:用
UPENN-GBM_data_availability.csv+ 影像目录扫描做三方一致性校验脚本,纳入 CI 每次运行前执行。
参考:临床 CSV v2.1;Bakas et al., 2022, Scientific Data。
⚠️ 坑点 4:MGMT 未知近半,dropna 即引入选择偏倚(分类:偏倚陷阱)
问题:MGMT 启动子状态 294 例(48.1%)为 Unknown,检测与否取决于临床指征(如是否手术、年代、治疗决策),缺失非随机。直接
dropna得到的"可用子集"在年龄、切除状态、年代分布上系统性偏离全队列。
症状:子集上训练的 MGMT 分类器全队列评估时 AUC 崩落;子集人口学分布与论文 Table 1 明显不同;复现文献性能对不上号。
解决:
- 简单方法:报告可用子集与全队列的基线特征对比表,证明缺失机制可接受。
- 进阶方法:以"MGMT 是否可判定"为目标训练缺失预测器,若可预测则视为信息性缺失,结果解释时限定于子集人群。
- SOTA 方法:缺失机制建模(如 IPW 或半监督),或在学习目标中加入可用性指示通道。
参考:Lizzi et al., 2025, Cancers;Bakas et al., 2022, Scientific Data, Table 1。
⚠️ 坑点 5:同患者多序列多时点跨侧泄漏(分类:数据泄漏)
问题:每患者最多 11 个影像卷 + 至多 2 个时点,若按文件或按 CSV 行随机划分,同一患者的 T1 在训练集、T1-Gd 在测试集(甚至基线与随访分侧)几乎必然发生。
症状:测试 AUC/Dice 异常高(如 >0.95)但外部数据上塌方;训练曲线与验证曲线差距可疑地小。
解决:
- 简单方法:
GroupShuffleSplit/GroupKFold,groups=patient_id。- 进阶方法:划分前先生成"患者 → 全部文件"映射,断言任一文件仅出现在一侧;把断言脚本放进数据加载器的测试用例。
- SOTA 方法:按"患者级"嵌套交叉验证 + 外部队列(UCSF-PDGM)终评,报告跨侧断言通过日志。
参考:本页 §5.3;Kaplan et al., 2024(PMC39029475)中 2:1 + 分层 5 折实践。
⚠️ 坑点 6:DTI/DSC 覆盖率不均,多模态样本非随机缩水(分类:偏倚陷阱)
问题:DTI 覆盖 592 例(88.2%)、DSC 534 例(79.6%),且缺失与采集协议/年代相关。"只留全模态患者"会把队列削减 15-20% 并引入年代选择偏倚。
症状:多模态模型的有效 n 明显小于预期;与单模态模型对比时"性能提升"其实来自人群变化;分层指标在早期/晚期年代病例上波动大。
解决:
- 简单方法:主实验用四结构序列全量,模态扩展作为消融实验单独报告。
- 进阶方法:模态缺失感知网络(模态 dropout / 跨模态蒸馏),或对缺失模式做匹配重加权。
- SOTA 方法:用官方可用性矩阵做逆概率加权(IPW),同时报告加权前后指标。
参考:Bakas et al., 2022, Scientific Data, Table 1;官方 可用性 CSV。
⚠️ 坑点 7:颅骨剥离后全零背景 + 强度未统一,全局归一化被脑外体素劫持(分类:预处理陷阱)
问题:发布版 NIfTI 已颅骨剥离(背景为 0)但各卷强度分布未统一标准化。若直接对全卷 min-max 或 z-score,海量零值会把均值拉低、把"归一化后脑组织"压进极窄区间,模型收敛慢且跨患者不可比。
症状:训练损失长期平台;同一模型在不同批次数据上强度直方图完全不同;特征重要性报告显示"背景体素"相关的伪模式。
解决:
- 简单方法:只用脑内体素(seg>0 或脑组织阈值)计算均值/方差做脑内 z-score。
- 进阶方法:脑干中位数/IQR robust 归一化(ANTsPy 配准 MNI 后取脑干 mask),跨患者更稳。
- SOTA 方法:Nyúl/直方图匹配式强度 harmonization,或训练中加入强度域对抗分支。
参考:Lizzi et al., 2025, Cancers(脑干 IQR 归一化实践);Bakas et al., 2022, Scientific Data(N4 校正说明)。
⚠️ 坑点 8:145 维组学 × 3 亚区 × 多序列,小样本下共线性爆炸(分类:评估误用)
问题:官方组学表按"亚区 × 序列"给 145 维 CaPTk 特征,拼宽后轻松破千列,而 MGMT 可判定样本仅 291 例。高维共线性 + 小样本使传统 ML 轻则过拟合、重则"特征选择泄漏"(在全数据上筛特征后再划分)。
症状:交叉验证内 AUC 0.85+、换随机种子掉到 0.55;文献间 MGMT 预测性能天差地别的乱象(有研究直接认为影像与 MGMT 无可靠关联)。
解决:
- 简单方法:特征先按亚区/序列聚焦(如只用 T1-Gd×ET 的 145 维),嵌套 CV 内完成选择。
- 进阶方法:正则化(Elastic-Net 逻辑回归)+ 相关性预筛(|ρ|>0.9 去冗余),全程只在训练折内进行。
- SOTA 方法:组学特征鲁棒性筛选(ICC/重复测量稳定性)+ 外部队列(UCSF-PDGM)独立终评。
参考:Lizzi et al., 2025, Cancers;Do et al., 2022, Scientific Reports, DOI: 10.1038/s41598-022-10711-6。
§6.6 数据增强策略
| 增强 | 安全性 | 说明 |
|---|---|---|
| 随机左右翻转 | ✅ 安全 | 大脑近似左右对称;若任务涉及"肿瘤侧别"特征需另行考量 |
| 小角度随机旋转(±10°)+ 平移 | ✅ 安全 | 模拟摆位差异,重采样保持 1mm³ |
| 随机缩放(0.9-1.1) | ✅ 安全 | 配合多尺度训练 |
| 强度高斯噪声/模糊 | ✅ 安全(轻量) | 提升对采集噪声鲁棒性 |
| 大角度 3D 旋转(>15°) | ❌ 危险 | 破解剖方向一致性,LPS 方向约定失效 |
| 非线性形变(大幅) | ❌ 危险 | 破坏与 SRI atlas 的解剖对应,影响跨卷一致性 |
| 随机强度截断/直方图变换(强) | ❌ 危险 | 增强肿瘤(ET)信号依赖钆浓度,过强变换抹掉判别信息 |
| 跨序列独立强度变换 | ❌ 危险 | 破坏 T1 与 T1-Gd 的结构化对应关系 |
增强策略的总体原则是"保解剖、破设备":一切保持解剖拓扑(方向、相对位置、结构对应)的变换都安全,一切可能改变病灶-序列对应关系(增强模式、信号强度关系)的变换都危险。若任务面向跨中心泛化,可在训练中逐步加大强度类增强的幅度,但验证集必须始终使用未增强的原始强度分布,否则"增强收益"会掩盖真实的跨中心差距。
§6.7 模型推荐
| 任务 | 推荐起点 | 理由 |
|---|---|---|
| 亚区分割 | nnUNet v2(3D fullres) | 数据标签本身出自 nnUNet 家族融合,架构适配度最高 |
| MGMT/IDH 预测 | 3D ResNet 系 + 迁移学习(SpotTune 式自适应微调) | 已在 262 例子集上验证可行 |
| 生存预测 | Elastic-Net Cox(145 维组学)→ 深度生存网络 | 从表格基线到影像端到端逐级升级 |
| 放射组学基线 | CaPTk 自带分类器(特征已给,零代码建模) | 最快复现论文级基线 |
| 假性进展 | 纵向双时点孪生网络 | 利用基线+随访配对结构 |
§6.8 硬件需求
| 场景 | GPU 显存 | 内存 | 磁盘 |
|---|---|---|---|
| 组学/临床表格建模 | 无需 GPU | 8GB | <1GB(CSV+ZIP) |
| 2D 切片级训练 | 8-11GB | 16GB | 80GB(NIfTI 包) |
| 3D 全卷训练(下采样网格) | 24GB(如 A5000/3090 级) | 32GB | 80GB + 检查点 50GB |
| 3D 原分辨率 + 大 batch | 40GB+(A100 级) | 64GB | 100GB |
| 全量 DICOM + 病理分析 | 无需 GPU(读取期) | 32GB | 360GB 全量 |
磁盘规划提示:NIfTI 包 69GB 是"研究工作区"的最低占用,实际开发中检查点、缓存与下采样副本常使真实占用翻倍,建议预留 200GB;如需同时持有 DICOM(139.4GB)与病理切片(149GB)做跨模态研究,整机应按 500GB 起步规划,并优先使用 NVMe 以缓解逐患者随机读取的 IO 压力。
§6.9 评估指标代码
import numpy as np
import torch
def dice_per_class(pred: torch.Tensor, gt: torch.Tensor, cls: int, eps=1e-7):
"""亚区 Dice:pred/gt 均为 (B, D, H, W) 标签卷,cls∈{1:ET, 2:NCR, 3:ED}"""
p, g = pred == cls, gt == cls
inter = (p & g).sum(dim=(1, 2, 3)).float()
denom = p.sum(dim=(1, 2, 3)) + g.sum(dim=(1, 2, 3)).float()
return ((2 * inter + eps) / (denom + eps)).mean().item()
def cindex(risk: np.ndarray, time: np.ndarray, event: np.ndarray) -> float:
"""Harrell's C-index:risk 为模型风险分,event 为是否死亡(1=事件)"""
r, t, e = map(np.asarray, (risk, time, event))
n = 0; conc = 0
for i in range(len(t)):
for j in range(len(t)):
if t[i] < t[j] and e[i] == 1:
n += 1
conc += (r[i] > r[j]) + 0.5 * (r[i] == r[j])
return conc / max(n, 1)
指标选择的对应关系:分割任务的逐类 Dice 之外,建议同时报告 Hausdorff 95 分位(HD95)以捕捉边界误差——融合标签的"平均平滑"效应会抬高 Dice 却让 HD95 暴露问题;分子预测任务以 AUC 为主指标,但 IDH 任务必须并报敏感度(16 例突变中抓到几个)而非只看总量;生存任务的 C-index 之外,时间依赖 AUC(如 12/24 个月节点)更能回答"某时刻还活着"这一临床真问题。所有指标都应在患者级聚合后再平均,体素级或行级平均都会给大样本患者过度权重。
§6.10 MLOps 笔记
- 数据版本化:以 V2(2022-10-24)为准绳并在实验配置中固化 DOI 10.7937/TCIA.709X-DN49;TCIA 集合状态为 Complete,但引用与再分发始终回溯 V2 快照。
- 预处理血缘:发布版 NIfTI 已含六步官方预处理,任何自加步骤(裁剪/下采样/归一化)单独记录版本,评测时冻结预处理避免"指标漂移式回归"。
- 划分审计:把坑点 5 的患者级断言与坑点 3 的 manifest 校验做成 CI 数据门禁,任何数据变更自动重跑。
- 评测口径声明:每份实验报告写明"标签口径(融合 vs 人工修正)+ 子集口径(MGMT 可得性)+ 划分口径",三口径不一致是跨论文比较失效的三大根源。
- 复现包:随代码发布 requirements 固定(nibabel/SimpleITK 版本敏感)+ 随机种子 + DAIMS 快照,保证第三方 30 分钟内复跑主表。
- 漂移监控:以 §7.6 的三个零标注信号(强度分布、亚区体积、预测置信度)接入生产监控面板,异常时回滚到最近冻结的预处理版本。
- 许可合规自动化:在仓库 NOTICE 与论文模板中固化 CC BY 4.0 署名块(数据 DOI + 论文 DOI),发布产物时以 CI 校验署名块存在,杜绝漏引。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单中心偏倚 | 全部病例来自 UPHS 一家学术中心,设备、操作与人群高度同质 | 高 | 外部验证用 UCSF-PDGM;谨慎外推至社区医院人群 |
| 选择偏倚(分子标签) | MGMT 未知 48.1%、IDH NOS/NEC 15.7%,检测依临床指征执行 | 高 | §6.5 坑点 4 的缺失机制分析;报告子集基线对比 |
| 稀有类偏倚 | IDH 突变仅 16 例,难以支撑突变亚组学习 | 高 | 限定为野生型 vs 突变的二分类并合并外部数据 |
| 时代偏倚 | 2006-2018 采集窗口跨越多代扫描仪与协议演进 | 中 | 采集参数 CSV 做设备分层;年代分块验证 |
| 性别分布偏倚 | 男 60.0% / 女 40.0%,与人群发病率结构一致但建模时需警惕性别相关特征捷径 | 中 | 分性别亚组评估 |
| 标签质量偏倚 | 分割为算法融合品,仅 232 例人工修正 | 中高 | §6.5 坑点 2 的口径声明与降权策略 |
| 种族/族裔信息缺失 | 发布数据未系统记录,公平性审计无法开展 | 中 | 结合外部多中心数据补足 |
偏倚之间的交互值得单独提醒:单中心偏倚会放大选择偏倚(同一套临床指征决定了哪些患者做了分子检测),而标签质量偏倚又会与测量偏倚耦合(不同代设备上的融合分割质量不同)。因此缓解措施必须成组落地——只做缺失机制分析而不做设备分层,或只做外部验证而不做子集口径声明,都会让残余偏倚以更隐蔽的方式进入结论。
§7.2 标注质量
分割标签经"三算法 STAPLE 融合 + 232 例人工修正"两级生产,其可信度高于纯自动标签,但数据集未公开逐例一致性指标。第三方证据(Lizzi et al., 2025, Cancers)显示:在 MGMT 预测任务上,人工修正 mask 上计算的组学特征性能显著优于自动 mask,即使两者的 Dice 相似度差异并不显著——这意味着标签质量对下游影响超出了传统分割指标的表达力。分子标签(IDH1/MGMT)来自临床实验室标准流程,属临床级金标准;假性进展指数为模型衍生值,使用时应视为"弱标签"而非金标准。
§7.3 泛化性风险
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 社区医院 / 不同厂商设备 | 高——单中心学术中心数据,协议与设备族窄 | 论文与 TCIA 页面均为单中心描述;采集参数表显示多代设备 |
| 非 US 人群(人种/族裔结构不同) | 中高——种族信息未记录,无法预判跨群稳定性 | 无公开人口学细分;文献普遍报告跨中心性能衰减 |
| 老年(>80 岁)与年轻(<30 岁)边缘段 | 中——18-29 岁仅 14 例、70+ 180 例 | 论文 Table 1 年龄分布 |
| 儿童神经肿瘤 | 不可用——队列下限 18 岁 | 入组标准明确年龄 ≥18 |
| 纵向随访建模 | 中——随访扫描仅 60 次,且扫描日期已脱敏 | 论文说明 + 脱敏政策 |
| 术后/复发情境 | 中高——主体为术前基线,复发仅覆盖病理子集 | 病理切片 34 例且匹配有限 |
§7.4 伦理合规
数据收集在 UPHS 机构审查委员会(IRB)批准下进行,并取得全部参与者的知情同意;发布前经 de-facing(面部特征移除)与标识符清除,扫描日期移除。许可为 CC BY 4.0:免注册、免申请、允许商用,唯一硬性义务是署名引用数据 DOI 与论文。尽管许可宽松,学术伦理上仍建议:不得尝试通过面部重建等手段重识别;下游临床应用必须走独立验证与监管路径。
另需注意 CC BY 4.0 的"允许商用"边界:许可授予的是对数据集本身的使用与再分发自由,不授予对其中受其他权利约束的内容的额外权利(如第三方专利方法或商业数据库接口);将其用于产品训练时,法务审阅应以"数据 + 衍生模型输出"两层分别评估,而不是默认"开放许可 = 无任何合规义务"。
§7.5 公平性
性别维度可做(男 378/女 252),但种族/族裔、社会经济状态、保险类型均未发布,导致跨人群公平性审计缺位。IDH 突变亚组(16 例)过小,任何"突变亚组内公平性"结论都不可靠。建议下游团队在论文中显式声明公平性评估的不可行范围,而不是沉默跳过。
若必须产出公平性证据,可行路径有两条:其一,在性别维度做分层评估(样本量允许),报告各亚组 AUC/Dice 与置信区间重叠情况;其二,引入外部多中心队列(如 BraTS 参与中心或 UCSF-PDGM)做跨人群性能衰减分析,用"衰减幅度"间接刻画泛化公平性。两条路径都不足以替代真实的人口学审计,结论应限定表述。
§7.6 数据漂移
采集窗口 2006-2018 意味着数据内部已含多代设备与协议变迁(时代漂移);发布版经统一重采样后部分漂移被"抹平",但强度分布与对比度差异仍在。外部使用时的漂移风险主要来自:设备族差异、扫描协议(层厚/矩阵)、后处理惯例。推荐上线前以采集参数 CSV 做设备分层监控,并用外部队列(UCSF-PDGM)做年度基准回归测试。
实操层面的三个监控信号:训练/推理输入的脑内强度分布直方图(按序列分桶,观察分布距离随时间的趋势);亚区体积分布(ET/NCR/ED 占全脑比例的偏移常先于指标下滑出现);分子预测置信度分布的漂移(置信度整体左移往往提示输入分布变化而非模型退化)。三个信号都可以零标注成本地在生产环境持续计算。
§7.7 DAIMS 24 项自评
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 临床 CSV 单表宽格式,逐患者-时点行 |
| 2 | 唯一标识 | ✅ | UPENN-GBM-XXXXX 患者主键贯穿影像/组学/临床 |
| 3 | 特殊字符 | ✅ | CSV/文件名 ASCII 规范,无编码陷阱 |
| 4 | 重复行 | ✅ | 671 行为时点设计而非重复;主键+时点唯一 |
| 5 | 缺失编码 | ⚠️ | Unknown/NA/NOS-NEC 三种语义并存,需自行解析 |
| 6 | 标签标识 | ✅ | MGMT/IDH/生存标签列名明确 |
| 7 | 罕见类分组 | ⚠️ | IDH 突变 16 例,亚组分析不可行 |
| 8 | 偏倚评估 | ✅ | 论文 Table 1 完整披露人口学与标签分布 |
| 9 | 数据字典 | ✅ | 组学特征清单 CSV + 参数文件随附 |
| 10 | 信息性缺失解释 | ✅ | 缺失机制在论文与本页 §4.5 有明确讨论 |
| 11 | 设备记录 | ✅ | 逐患者逐序列采集参数 CSV |
| 12 | 共线性 | ⚠️ | 组学特征高维共线,需正则化/预筛 |
| 13 | 编码映射 | ✅ | 病理-影像 ID 映射 CSV 官方提供 |
| 14 | 时间戳处理 | ⚠️ | 扫描日期已脱敏,仅存生存天数等相对时间,纵向建模受限 |
| 15 | 划分建议 | ⚠️ | 无官方划分,社区口径不一 |
| 16 | 泄漏讨论 | ✅ | 患者级分组必要性明确(本页 §5.3) |
| 17 | 标签分布 | ✅ | 全部关键标签分布可查(论文 Table 1 / 本页 §4.2) |
| 18 | 测量偏倚 | ⚠️ | 单中心多代设备,强度/协议差异保留 |
| 19 | 外部验证建议 | ✅ | UCSF-PDGM 等同源队列明确可用 |
| 20 | 版本记录 | ✅ | V1/V2 变更日志在 TCIA 页面公开 |
| 21 | 预处理脚本 | ⚠️ | 流程描述详尽但无官方一键脚本,需自行复现或用 CaPTk |
| 22 | 合规要求 | ✅ | CC BY 4.0,义务仅署名 |
| 23 | 多模态对齐 | ✅ | 影像/分割/组学共享 SRI 1mm³ 坐标系,逐体素对齐 |
| 24 | 去标识化 | ✅ | de-facing + 日期移除 + 标识符清除 |
DAIMS 评分:18.5 / 24
评分解读:18 个 ✅ 与 1 个 ⚠️ 之外,另有 4 项 ⚠️(缺失编码语义、罕见类、共线性、时间戳/划分/脚本等结构性注意点)按 0.5 计。扣分集中在"无官方划分、扫描日期脱敏导致纵向建模受限、组学特征共线性、无一键预处理脚本"——均为研究友好型数据集在临床工程化时的典型短板,而非数据本身的硬伤。
对你意味着什么:这是一份"表格式研究即开即用、影像式研究需要自建划分与预处理脚手架"的数据集。你的第一周应该:下载 <20MB 的组学+临床包验证端到端流程 → 用官方可用性矩阵生成患者级 manifest → 把划分断言与缺失机制分析写进 CI;影像深度建模留到口径全部固化之后,并永远在 232 例人工修正子集上单独报告评测。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| UCSF-PDGM(约 500 例弥漫性胶质瘤) | 加州大学旧金山分校(TCIA) | 放射组学连续生存预测 | C-index | 内部验证优于外部(具体数值因研究而异) | 生存模型跨中心可迁移但衰减,需协议适配 |
| 同队列内人工 vs 自动分割子集 | UPenn-GBM 自身(232 例人工修正) | MGMT 甲基化预测 | AUC | 人工 mask 显著优于自动 mask | 分割质量是 MGMT 预测结论分歧的主因之一 |
| 同队列 262 例 MGMT 子集(2:1 + 5 折) | UPenn-GBM 自身 | MGMT 预测(SpotTune 3D 迁移) | AUC | 相对从头训练更稳 | 自适应微调在 3D 医疗影像可行 |
| GA 优化组学(同队列交叉验证) | UPenn-GBM 自身 | MGMT 预测 | AUC | 文献基线之一 | 特征选择必须在划分之后 |
§8 基准性能与生态
§8.1 代表性研究排行(指标不可直接比较)
| 研究 | 模型 | 任务 | 报告结论 | 年份 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| Bakas et al. | DeepMedic+DeepSCAN+nnUNet STAPLE 融合 | 亚区分割(数据集自建基线) | 232 例人工修正前 Dice 融合基线(论文未给统一榜值) | 2022 | Bakas, S., et al., Scientific Data 9:453. DOI: 10.1038/s41597-022-01560-7 | CaPTk |
| Do et al. | GA 优化组学 + ML | MGMT 甲基化预测 | AUC(交叉验证,文献代表性基线) | 2022 | Do, D.T., et al., Scientific Reports 12. DOI: 10.1038/s41598-022-10711-6 | 未公开 |
| Kaplan et al. | SpotTune 自适应微调 3D ResNet | MGMT 甲基化预测 | 迁移学习可行、模态子集分层报告(262/218/189 例) | 2024 | Kaplan, A., et al. PMC39029475(DOI 见期刊页) | 未公开 |
| Lizzi et al. | 组学 + 3D CNN + 融合 | MGMT 甲基化预测 | 性能不足以支撑临床决策;人工 vs 自动 mask 差异显著 | 2025 | Lizzi, F., et al., Cancers 17(21):3417. DOI: 10.3390/cancers17213417 | 未公开 |
| 组学生存研究 | Natural Gradient Boosting | 连续 OS 预测 | 内部(UPenn-GBM)+ 外部(UCSF-PDGM)双验证 | 2024 | 作者等, PMC39518054(DOI 见期刊页) | 未公开 |
⚠️ 数值不可直接比较的原因:各研究的子集口径(MGMT 可得性 258-291 例不等)、标签口径(人工 vs 融合分割)、划分口径(2:1、5 折、留出法各异)互不兼容,且多数未给统一测试集;MGMT 预测在文献中存在"影像与 MGMT 无可靠关联"的相反结论,引用任何单一 AUC 均需携带其口径。
§8.2 SOTA 总结与选型建议
分割任务上,nnUNet 家族仍是该数据上最稳的起点;分子预测任务上,2025 年证据(Lizzi et al.)显示纯影像 MGMT 预测尚未达到可指导治疗决策的可靠度,研究价值大于临床价值;生存预测任务上,组学 + 梯度提升基线稳健、外部验证路径清晰。给新手的最短路径:先复现"145 维组学 + Elastic-Net Cox"生存基线(纯表格、零 GPU),再进入影像深度建模。
选型时的三条经验法则:任务标签越稀有(IDH 突变 16 例),越应选择强先验的小模型而非大容量深度网络;输出若用于临床演示,务必绑定"标签口径 + 子集口径 + 划分口径"三要素声明,避免被读者误读为通用性能;任何声称大幅超越已有文献的 MGMT 预测结果,首先检查是否发生了坑点 5 的患者级泄漏——文献中性能的巨大方差更多来自口径差异而非算法差异。
§8.3 评测协议
- 分割:逐亚区 Dice + HD95,患者级 5 折 GroupKFold,评测集优先取 232 例人工修正子集,另报告融合标签全量指标作参考。
- 分子预测:AUC(95% CI,bootstrap)+ 平衡准确率 + 敏感度/特异度,缺失机制诊断(坑点 4)必附。
- 生存:Harrell C-index + 时间依赖 AUC(24 个月节点),IPW 或子集敏感性分析。
- 通用:所有协议必须声明"标签口径 + 子集口径 + 划分口径"三要素(§6.10)。
报告规范的最小模板:一行任务定义、一行数据口径(例:“262 例 MGMT 可判定、术前基线、融合标签”)、一行划分描述(例:“患者级 5 折 GroupKFold,无外部测试”)、主指标均值±标准差与 95% CI、以及一句失效模式说明。论文与本页 §8.1 的对比表之所以"指标不可直接比较",正是因为多数文献省略了其中至少两项。
§8.4 相关数据集
| 数据集 | 规模 | 关系 | 适合用途 |
|---|---|---|---|
| UCSF-PDGM | 约 500 例 II-IV 级弥漫性胶质瘤 | 同在 TCIA 的最佳外部验证集 | 外部验证、跨中心泛化 |
| BraTS 2021/2023 | 2,000+ 例多中心 | 分割算法生态同源(DeepMedic/nnUNet 出自 BraTS) | 分割基准扩展、多中心训练 |
| TCGA-GBM(TCIA 版) | 约 260 例 | 基因组深度注释互补 | 影像-基因组扩展研究 |
| FeTS 系数据 | 数千例(UPenn-GBM 同源扩展) | 联邦学习基准 | 跨中心联邦分割 |
选用相关数据集时的匹配原则:做分割方法学比较,配 BraTS(算法生态同源);做分子预测的泛化主张,配 UCSF-PDGM(含 IDH/MGMT 标签且协议统一);做跨级别生存研究,用 UCSF-PDGM 的 II-IV 级谱系过滤 GBM 子集;做联邦/多中心扩展,优先同源 FeTS 家族以减少协议重组成本。注意 UCSF-PDGM 保留全头颅、含 3D 序列与 HARDI,与 UPenn-GBM 的预处理产物不同源,外部验证前必须先做 §5.5 所述的预处理对齐。
§8.5 关键论文 Top 6
- Bakas, S., Sako, C., et al. “The University of Pennsylvania glioblastoma (UPenn-GBM) cohort: advanced MRI, clinical, genomics, & radiomics.” Scientific Data 9:453 (2022). DOI: 10.1038/s41597-022-01560-7 —— 数据集主论文,规模/协议/标注全描述。
- Clark, K., et al. “The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public Information Repository.” Journal of Digital Imaging 26(6):1045-1057 (2013). DOI: 10.1007/s10278-013-9622-7 —— 托管平台 TCIA 的引用锚点。
- Bakas, S., et al. “Multi-parametric magnetic resonance imaging (mpMRI) scans for de novo Glioblastoma (GBM) patients from the University of Pennsylvania Health System (UPenn-GBM).” (Version 2) [Data set]. TCIA (2021). DOI: 10.7937/TCIA.709X-DN49 —— 数据集正式数据引用(署名义务对象)。
- Do, D.T., et al. “Improving MGMT methylation status prediction of glioblastoma through optimizing radiomics features using genetic algorithm-based machine learning approach.” Scientific Reports 12 (2022). DOI: 10.1038/s41598-022-10711-6 —— MGMT 组学预测代表性基线。
- Lizzi, F., et al. “Radiomics and Deep Learning Interplay for Predicting MGMT Methylation in Glioblastoma: The Crucial Role of Segmentation Quality.” Cancers 17(21):3417 (2025). DOI: 10.3390/cancers17213417 —— 系统揭示分割质量对 MGMT 预测结论的支配作用。
- Kaplan, A., et al. “Adaptive fine-tuning based transfer learning for the identification of MGMT promoter methylation status.” (2024). PMC39029475 —— 3D 医疗影像自适应迁移学习实践。
§8.6 社区活跃度
TCIA Collection 页面累计浏览 23.2k 次(截至 2026-09-15),DataCite 收录数据引用 27 次;主论文 Scopus 收录引用 164+ 次(截至 2026-09 检索)。第三方生态覆盖 IDC 云镜像、DSI Studio 弥散处理枢纽(第三方 FIB 派生)与 Kaggle/课程级复现项目;无官方 GitHub Issue 主场,社区讨论分散于 TCIA Helpdesk 与论文通讯作者(Davatzikos 实验室)渠道。
从生态成熟度看,该数据集处于"资源型数据集"的稳定期:数据状态 Complete、版本冻结在 V2,社区不再期待内容更新,而围绕它的下游研究(MGMT 预测、生存建模、联邦分割扩展)持续产出。对于引用它的团队,这意味着两个实际影响:复现实验不会因数据更新而失效;但也不要等待"新版本修复"——缺失模式与划分缺位是设计使然,须按本页 §5-§7 的口径自行处理。
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| TCIA Collection 页 | 官方分发 | cancerimagingarchive.net/collection/upenn-gbm | Complete(2022-10-24) | 唯一权威下载入口 |
| IDC 云门户 | 云镜像 | portal.imaging.datacommons.cancer.gov/collections/upenn_gbm | 在线 | 免下载取子集 |
| pathdb 病理浏览 | 病理平台 | TCIA 页内入口 | 在线 | 71 张 NDPI 在线浏览 |
| CaPTk | 官方工具链 | cbica.upenn.edu/captk | 维护中 | 145 维组学的生成与复算工具 |
| Pittsburgh Fiber Data Hub(data-nih/tcia) | 第三方派生 | github.com/data-nih/tcia | 社区维护 | 弥散派生 NIfTI 便捷镜像(需自检 QC) |
| DSI Studio UPenn-GBM 页 | 第三方派生 | brain.labsolver.org/upenn_gbm.html | 社区维护 | DTI 纤维级处理的参考实现 |
生态使用的一条总原则:以官方 TCIA 分发与论文为准绳,第三方派生资源(镜像、纤维处理、课程项目)只作为效率工具引入;任何第三方派生数据都需自行完成与官方 V2 的一致性抽检后,方可进入正式实验链路。
§9 相关资源与引用
§9.1 官方资源导航
| 资源 | 链接 | 说明 |
|---|---|---|
| Collection 主页 | TCIA UPenn-GBM | 版本、许可、下载入口 |
| 论文全文(开放获取) | Scientific Data 9:453 | 采集/处理/标注全细节 |
| 临床数据表 | clinical_info_v2.1.csv | 671 行患者-时点主表 |
| 采集参数表 | UPENN-GBM_acquisition.csv | 设备与序列参数 |
| 可用性矩阵 | UPENN-GBM_data_availability.csv | 逐患者逐模态在/缺 |
| 组学特征包 | radiomic_features_CaPTk.zip | 145 维特征 + 参数文件 |
| 病理-影像映射 | radiology_mapping.csv | 病理与放射 ID 对应 |
| DICOM 下载清单 | DownloadManifest 2022-11-29 | TCIA Data Retriever 用 |
| IDC 云视图 | IDC UPenn-GBM | 云端取子集 |
| TCIA 使用政策 | Data Usage Policy | 署名义务细节 |
§9.2 BibTeX 引用块
以下三条 BibTeX 覆盖了署名义务所需的全部对象:主论文(方法与发现)、数据集(正式数据引用,对应 DOI 10.7937/TCIA.709X-DN49)与 TCIA 平台(托管与分发)。直接复制到 .bib 文件即可使用;条目作者列表与官方引用格式一致,期刊缩写请在投稿时按目标期刊要求自行调整。
@article{bakas2022upenngbm,
author = {Bakas, Spyridon and Sako, Chiharu and Akbari, Hamed and Bilello, Michel
and Sotiras, Aristeidis and Shukla, Gaurav and Rudie, Jeffrey D.
and Flores Santamaria, Natali and Fathi Kazerooni, Anahita
and Pati, Sarthak and Rathore, Saima and Mamourian, Elizabeth
and Ha, Sung Min and Parker, William and Doshi, Jimit and Baid, Ujjwal
and Bergman, Mark and Binder, Zev A. and Verma, Ragini and Lustig, Robert A.
and Desai, Arati S. and Bagley, Stephen J. and Mourelatos, Zissimos
and Morrissette, Jennifer and Watt, Christopher D. and Brem, Steven
and Wolf, Ronald L. and Melhem, Elias R. and Nasrallah, MacLean P.
and Mohan, Suyash and O'Rourke, Donald M. and Davatzikos, Christos},
title = {The University of Pennsylvania glioblastoma (UPenn-GBM) cohort:
advanced MRI, clinical, genomics, \& radiomics},
journal = {Scientific Data},
volume = {9},
number = {1},
pages = {453},
year = {2022},
doi = {10.1038/s41597-022-01560-7}
}
@dataset{bakas2021upenngbmdata,
author = {Bakas, Spyridon and Sako, Chiharu and Akbari, Hamed and Bilello, Michel
and Sotiras, Aristeidis and Shukla, Gaurav and Rudie, Jeffrey D.
and Flores Santamaria, Natali and Fathi Kazerooni, Anahita
and Pati, Sarthak and Rathore, Saima and Mamourian, Elizabeth
and Ha, Sung Min and Parker, William and Doshi, Jimit and Baid, Ujjwal
and Bergman, Mark and Binder, Zev A. and Verma, Ragini
and Davatzikos, Christos},
title = {Multi-parametric magnetic resonance imaging (mpMRI) scans for de novo
Glioblastoma (GBM) patients from the University of Pennsylvania Health
System (UPENN-GBM)},
note = {Version 2},
year = {2021},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/TCIA.709X-DN49}
}
@article{clark2013tcia,
author = {Clark, Kenneth and Vendt, Bruce and Smith, Kirk and Freymann, John
and Kirby, Justin and Koppel, Paul and Moore, Stephen and Phillips, Stanley
and Maffitt, David and Pringle, Michael and Tarbox, Lawrence and Prior, Fred},
title = {The Cancer Imaging Archive (TCIA): Maintaining and Operating a Public
Information Repository},
journal = {Journal of Digital Imaging},
volume = {26},
number = {6},
pages = {1045--1057},
year = {2013},
doi = {10.1007/s10278-013-9622-7}
}
§9.3 引用指南
使用 UPenn-GBM 数据时,署名义务要求同时引用:数据集 DOI(10.7937/TCIA.709X-DN49,即上方 bakas2021upenngbmdata)与论文(bakas2022upenngbm);若经 TCIA 平台整体访问,建议追加 clark2013tcia。再分发衍生数据时保留 CC BY 4.0 归属声明;引用本百科页面时使用页面 URL 与最后审核日期(2026-09-05)。
§9.4 自学与教学路径
| 阶段 | 目标 | 使用材料 | 预期产出 |
|---|---|---|---|
| 第 1 天 | 数据直觉 | 临床 CSV v2.1 + 论文 Table 1 | 复算 MGMT/IDH/年龄分布并核对 |
| 第 2-3 天 | 表格建模闭环 | 组学 ZIP + §5.3 划分 + §6.9 指标 | 145 维特征的生存/MGMT 基线 |
| 第 2 周 | 影像管线 | NIfTI 包(69GB)+ §6.4 DataLoader | 单序列 2D 分割或分类基线 |
| 第 3-4 周 | 3D 与口径治理 | §6.5 坑点清单 + §8.3 协议 | 患者级分组 3D 模型 + 三口径报告 |
| 第 2 个月起 | 外部验证 | UCSF-PDGM + §7.8 矩阵 | 跨中心泛化报告 |
教学场景下建议以"先表格后影像"的次序组织作业:表格路径可在普通笔记本上完成,覆盖数据清洗、泄漏防护、交叉验证与报告规范等核心能力;影像路径则需要 GPU 资源与更长的训练周期,适合作为课程项目或毕设选题。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 版本/说明 |
|---|---|---|
| 大语言模型(CodeBuddy Code,fast-model) | 本页面初稿撰写、结构化整理与代码示例生成 | 2026-09 生成,人工全审 |
§10.2 AI 参与范围
AI 参与:全文初稿撰写、DAIMS 自评表整理、代码示例编写、BibTeX 排版。AI 不参与:事实数字的最终裁定(全部数字经 WebSearch 检索核实并记录于 FACTS 流程)、医学与工程审核结论、发布决定。所有关键数字均可回溯至 §10.3 所列来源。
生成流程说明:初稿依据检索核实的事实清单(FACTS)撰写;写作过程中对种子信息进行了逐条证伪核对——种子所载"DTI 子集约 76 例"经论文 Table 1 证实为 592 例(88.2%),"结构化 MRI 版本 v2/v3"经 TCIA 官方页面证实当前版本为 V2(2022-10-24 更新,未见 V3),"精选基因突变(IDH/EGFR/TERT 等)"经论文证实分子标签为 IDH1 与 MGMT 两项,EGFR/TERT 等扩展标记属论文所述"未来计划"而非已发布内容。上述证伪结论均已按检索结果写入正文。
§10.3 输入来源列表
- Bakas, S., Sako, C., et al. “The University of Pennsylvania glioblastoma (UPenn-GBM) cohort: advanced MRI, clinical, genomics, & radiomics.” Scientific Data 9:453 (2022). DOI: 10.1038/s41597-022-01560-7
- Bakas, S., et al. “Multi-parametric magnetic resonance imaging (mpMRI) scans for de novo Glioblastoma (GBM) patients from the University of Pennsylvania Health System (UPENN-GBM).” (Version 2) [Data set]. TCIA (2021). DOI: 10.7937/TCIA.709X-DN49
- TCIA Collection 页面 UPENN-GBM(含版本历史、下载组件与许可). https://www.cancerimagingarchive.net/collection/upenn-gbm/
- Clark, K., et al. “The Cancer Imaging Archive (TCIA)…” Journal of Digital Imaging 26(6):1045-1057 (2013). DOI: 10.1007/s10278-013-9622-7
- Lizzi, F., et al. “Radiomics and Deep Learning Interplay for Predicting MGMT Methylation in Glioblastoma: The Crucial Role of Segmentation Quality.” Cancers 17(21):3417 (2025). DOI: 10.3390/cancers17213417
- Kaplan, A., et al. “Adaptive fine-tuning based transfer learning for the identification of MGMT promoter methylation status.” (2024). PMID 39029475 / arXiv:2310.12373
- Do, D.T., et al. “Improving MGMT methylation status prediction of glioblastoma through optimizing radiomics features using genetic algorithm-based machine learning approach.” Scientific Reports 12 (2022). DOI: 10.1038/s41598-022-10711-6
- 放射组学连续生存预测研究(UPenn-GBM 内部 + UCSF-PDGM 外部验证). (2024). PMC39518054
- NCI Imaging Data Commons UPenn-GBM Collection 视图. https://portal.imaging.datacommons.cancer.gov/collections/upenn_gbm
- UC San Diego/UCSF 外部验证上下文:UCSF-PDGM(Calabrese, E. et al., TCIA, DOI: 10.7937/tcia.bdgf-8v37)
- TCIA Data Usage Policy and Restrictions. https://www.cancerimagingarchive.net/data-usage-policies-and-restrictions/
- Creative Commons Attribution 4.0 International 许可文本. https://creativecommons.org/licenses/by/4.0/
- Pittsburgh Fiber Data Hub(data-nih/tcia)UPenn-GBM 派生说明. https://github.com/data-nih/tcia
- DSI Studio UPenn-GBM Fiber Data Hub(第三方弥散处理参考). https://brain.labsolver.org/upenn_gbm.html
- DataCite DOI 引用统计(10.7937/TCIA.709X-DN49)与 OUCI/Scopus 论文引用统计(截至 2026-09 检索)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| INFOBOX 22 字段与规模数字 | 千方病案医学编辑部 | 对照 FACTS 清单逐项回溯来源 URL | ✅ 已通过/已验证 |
| §2 医学背景(ICD-11/SNOMED/流行病学) | 千方病案医学编辑部(医学审核) | 文献交叉核对与术语审定 | ✅ 已通过/已验证 |
| §3-§4 规格、目录树与 DAIMS 字段字典 | 医疗 AI 数据工程师 | 对照 TCIA 组件清单与论文 Table 1 核对 | ✅ 已通过/已验证 |
| §6 代码示例与 8 大坑点 | 医疗 AI 数据工程师 | 代码静态走查 + 坑点来源回溯 | ✅ 已通过/已验证 |
| §7 质量评估与 DAIMS 24 项自评 | 千方病案医学编辑部 | 逐项证据核对 | ✅ 已通过/已验证 |
| §8-§9 引用与生态链接 | 千方病案医学编辑部 | 链接可达性与书目核对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
全部章节初稿由 AI 生成(见 §10.1),经 §10.4 所列人工逐模块审核后发布;其中数字、编码与引用书目以人工核验结论为准,AI 文本仅承担组织与表达职能。
审核环节的人工修正与裁定事项包括:种子档案与检索证据冲突时的取舍(以检索核实结果为准并记入 FACTS)、英文原文字段的中文表述统一(如 T1-Gd/T1-GD 的写法归一)、以及对无法核实字段的整体省略(宁缺毋滥)。这些决定均在发布前完成,不遗留在页面文本中。
§10.6 最后人工审核
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- icgc — 共享标签:医学影像 / 基因组学与多组学 / 病理图像 / 肿瘤学
- human-cell-atlas — 共享标签:医学影像 / 基因组学与多组学 / 病理图像 / 肿瘤学
- ivy-gap — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 脑肿瘤
- hubmap — 共享标签:医学影像 / 基因组学与多组学 / 病理图像 / 肿瘤学
- gdsc — 共享标签:医学影像 / 基因组学与多组学 / 病理图像 / 肿瘤学
- cellxgene — 共享标签:医学影像 / 基因组学与多组学 / 病理图像
- ucsf-pdgm — 共享标签:医学影像 / 肿瘤学 / 脑肿瘤
- fets — 共享标签:医学影像 / 肿瘤学 / 脑肿瘤
- tabula-muris — 共享标签:医学影像 / 基因组学与多组学 / 病理图像
- human-protein-atlas — 共享标签:医学影像 / 基因组学与多组学 / 病理图像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

