信息速览

UCSF-PDGM — 术前弥漫性胶质瘤多序列 MRI AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | UCSF-PDGM |
| 英文全称 | UCSF Preoperative Diffuse Glioma MRI |
| 别名/简称 | The University of California San Francisco Preoperative Diffuse Glioma MRI;UCSF-PDGM v5 |
| 疾病分类 | ICD-11 2A00(弥漫性星形细胞瘤,含 2A00.0 IDH 突变型 / 2A00.1 IDH 野生型);2A01.0(少突胶质瘤 IDH 突变与 1p/19q 共缺失型) |
| SNOMED CT | 93722004(Glioma,形态学编码);12738006(Brain,解剖结构) |
| 数据模态 | 脑 MRI:T1、T1c、T2、T2/FLAIR、SWI、DWI、3D ASL 灌注、55 方向 HARDI + 多腔隙肿瘤分割 + 临床/分子表格 |
| AI 任务类型 | 肿瘤分割、分子分型预测(IDH/MGMT/1p19q)、WHO 分级、生存预测、影像组学 |
| 样本总数 | 501 例术前 MRI 检查(495 名唯一患者,v3 起更正) |
| 数据大小 | 约 142 GB(v5 影像)+ 54.97 KB(临床 CSV) |
| 数据格式 | NIfTI(.nii.gz)、CSV、BVAL/BVEC |
| 许可证 | CC BY 4.0 |
| 访问级别 | 开放(TCIA 公开下载,需按 Data Usage Policy 引用) |
| DUO 标签 | GRU(通用研究使用) |
| 语言 | 英语(临床元数据与官方文档) |
| 首发日期 | 2022(v1,随论文发布) |
| 最后更新 | 2025-05-30(v5) |
| 发布机构 | UCSF 智能影像中心(ci2)与宾夕法尼亚大学 CBICA;The Cancer Imaging Archive(TCIA)托管 |
| 官方主页 | TCIA UCSF-PDGM Collection |
| 下载地址 | TCIA Data Access(需 IBM Aspera Connect) |
| DOI | 10.7937/tcia.bdgf-8v37 |
| 引用次数 | 30 条(TCIA 收录引用出版物,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方已提供非线性配准、颅骨剥离与 DTI 派生图,分割经专家校正;扣分项:无官方训练/测试划分,需自行排除 BraTS 2021 重叠(约 60%)与 6 例重复检查 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核:千方病案医学编辑部交叉审核 §2 医学背景(WHO 2021 弥漫性胶质瘤分子分型、ICD-11/SNOMED CT 映射)与 §7 偏倚分析。
数据工程审核:千方病案医学编辑部交叉审核(医疗 AI 数据工程师),审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 与坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。UCSF-PDGM 以 CC BY 4.0 许可发布,托管于 The Cancer Imaging Archive(TCIA),使用者须遵守 TCIA Data Usage Policy and Restrictions,并在成果中给出含 DOI 的数据引用。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? UCSF-PDGM 是美国加州大学旧金山分校(UCSF)发布的术前弥漫性胶质瘤脑 MRI 公开数据集,托管于 The Cancer Imaging Archive(TCIA)。它收录 2015-2021 年间 501 例术前 MRI 检查(495 名唯一患者),全部为手术病理证实的 WHO II-IV 级弥漫性胶质瘤,统一使用 3T 设备与标准化 3D 多序列协议扫描,并附肿瘤分割掩膜、分子标签(IDH、MGMT、1p/19q)与生存数据。
为什么重要? 在它之前,公开胶质瘤 MRI 数据集大多只有 4 个结构序列(T1、T1c、T2、FLAIR),且扫描设备与参数五花八门。UCSF-PDGM 把 3D 序列、ASL 灌注、55 方向 HARDI 扩散成像装进了统一协议,等于同时提供了"结构 + 血流 + 微观扩散"三个维度的信息,并按 WHO 2021 分子分型标准配好了基因标签,为影像-基因联合建模提供了难得的标准化样本。
我能用它做什么? 训练与基准测试肿瘤分割模型(分割掩膜与 BraTS 2021 同一套标签约定);做 IDH 突变、1p/19q 共缺失、MGMT 甲基化的无创影像预测;开发 WHO 分级与生存期预测模型;以及研究 ASL/HARDI 这类高级序列在 AI 中的价值。注意:约 60% 病例与 BraTS 2021/2023 重叠,联合使用时必须先排除交集。
§1.1 技术摘要
UCSF-PDGM 由 UCSF 智能影像中心(ci²)与宾夕法尼亚大学 CBICA 联合构建,Corresponding Author 为 Evan Calabrese,论文发表于《Radiology: Artificial Intelligence》2022 年第 4 卷第 6 期(Calabrese et al., 2022)。队列在单一医学中心连续纳入 2015-2021 年经组织病理学确诊的成人 WHO II-IV 级弥漫性胶质瘤患者,排除任何既往脑肿瘤治疗史(活检史除外,共 69 例,占 14%)。所有检查在 GE Discovery 750 3T 扫描仪与 Invivo 8 通道头线圈上按同一协议完成,序列包括 3D T2、T2/FLAIR、SWI、DWI、增强前后 T1、3D ASL 灌注与 2D 55 方向 HARDI。影像后处理由数据方统一完成:FSL 6.0.2 eddy 涡流校正与 DTIFIT 张量拟合、ANTs 非线性配准至 T2/FLAIR 参考空间(1 mm 各向同性)、深度学习颅骨剥离(ecalabr/brain_mask)。肿瘤分割走 BraTS 2021 流程:既往获奖算法集成自动分割,再由受训放射科医生逐例校正并由 2 名专家审核批准。分子标签覆盖全部病例的 IDH 状态(UCSF500 靶向测序)、grade III/IV 的 MGMT 启动子甲基化(qPCR)与 1p/19q 共缺失(FISH)。数据当前版本为 v5(2025-05-30 更新,TCIA)。
§1.2 战略价值
维度一:协议标准化带来的"纯对照"价值。 多数公开胶质瘤数据集是跨中心、跨厂商影像的"大杂烩",模型性能提升很难剥离扫描协议差异的干扰。UCSF-PDGM 的 501 例检查全部来自同一台 3T 扫描仪和同一套 3D 协议,相当于把"设备域漂移"这个变量固定住了。这让它的最佳用途不是刷分割榜,而是做受控变量研究:新序列(ASL、HARDI、SWI)到底带来多少增益?新的分子预测网络架构提升是真提升还是过拟合?在这份数据上得到的结论内部效度极高——代价是跨中心泛化必须靠外部数据集验证。
维度二:分子标签与 WHO 2021 分型齐备的"放射组学基础设施"。 数据集为全部病例提供 IDH 状态、为 grade III/IV 提供 MGMT 甲基化、以 FISH 提供 1p/19q 共缺失,并给出 WHO 2021 最终诊断与分级。这与 2021 年后胶质瘤研究的金标准分层完全对齐,意味着基于该数据发表的放射组学/深度学习分子预测结果可以直接与当代临床语境对话,不需要再为"该队列 WHO 2016 分型还是 2021 分型"辩护。对做 IDH 无创预测、1p/19q 共缺失筛查、MGMT 甲基化影像替代标志物的团队,这是少数几个标签质量与影像质量同时达标的公开选择。
维度三:与 BraTS 生态互为补充。 分割掩膜遵循 BraTS 2021 标签约定(0/1/2/4),官方元数据直接给出每个病例的 BraTS21 ID 与分 cohorts,团队可以在 BraTS 训练的大模型上做"同一标签体系下的外部域测试",也可以把 UCSF-PDGM 当作高质量验证池——前提是先排除约 60% 的重叠病例(详见坑点 1)。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 扫描协议 | 分割标注 | 分子/临床标签 | 与 UCSF-PDGM 的差异化 |
|---|---|---|---|---|---|
| UCSF-PDGM | 501 例检查 / 495 名患者 | 单中心 3T GE,标准化 3D 协议,含 ASL + 55 方向 HARDI + SWI | AI 集成 + 医生校正 + 2 名专家批准(BraTS 约定 0/1/2/4) | IDH 全覆盖;MGMT(grade III/IV);1p/19q;EOR;OS | 本页主角:协议最统一,高级序列最全 |
| TCGA-GBM | 262 例 | 多中心多厂商,参数不一 | 专家手工(BraTS 前身流程) | 基因组 + 临床(TCGA 体系) | 胶质母细胞瘤专项,协议异质;261 例亦被 BraTS 收录 |
| BraTS 2021(RSNA-ASNR-MICCAI) | 论文发表时口径 542 例含 243 例 TCGA-GBM 术前病例,2021 扩展后规模更大 | 多中心多厂商 | 挑战赛金标准 | MGMT 子集(2021 增设分类任务) | 全球分割基准;与 UCSF-PDGM 约 60% 重叠,不可同时用作独立测试 |
| UPenn-GBM | 数百例 | 单中心 UPenn 多参数 MRI + 教训学习派生 | 专家校正 | 基因组 + 影像组学特征 | 同为单中心标准化 3T 协议,是 UCSF-PDGM 最理想的跨中心外部验证搭档 |
这张表的选型含义:追求协议内部效度(受控实验)→ UCSF-PDGM;追求规模与多中心多样性(泛化先验)→ BraTS 系;追求基因组纵深挖掘 → TCGA-GBM;追求跨中心外验 → UPenn-GBM。四者构成互补而非互替关系,唯一需要主动管理的是 UCSF-PDGM 与 BraTS 之间约 60% 的重叠——把它用作联用增益(同标签域适应)还是隔离风险(独立测试失效),完全取决于 §5.3 的过滤纪律。
§1.4 版本时间轴
| 版本 | 更新日期 | 关键变化 | 对使用者的影响 |
|---|---|---|---|
| v1 | 2022 | 随论文首发,501 例 | 初版 |
| v2 | 2022-11-30 | 修复 tumor_segmentation 整数取整错误;新增 BraTS21 ID 映射(官方确认,防泄漏);T1gad_bias 更名 T1c_bias | 使用分割前务必 ≥v2;联合 BraTS 研究自此有官方对照表 |
| v3 | 2023-01-11 | 发现 6 例为其他病例的短期随访成像,唯一患者数更正为 495;重复病例重命名(如 UCSF-PDGM-0433_FU007d) | 患者级统计以 495 为准;数据泄漏防护(坑点 2) |
| v4 | 2023-04-07 | 新增 bvec/bval 下载项与 metadata glossary | 弥散数据可复现性提升 |
| v5 | 2025-05-30 | 修复 DTI_eddy_noreg 头方向问题;每例新增 eddy 旋转后 bvecs | 弥散管线建议直接采用 v5,11,523 → 12,030 series |
版本选择的三个常见误区:其一,“最新版只对 DTI 用户有意义”——错,v5 同样是分割用户的默认选择(v2 的取整修复继承在内);其二,“引用旧版论文就要用旧版数据”——复现实验时数据版本可以升、结果表口径要注明,引用格式写 Version 5 并说明与原论文的版本差异;其三,“Previous Versions 只是存档”——v2/v3/v4 各自的勘误说明是理解坑点 1/2/6 的第一手材料,写 related work 时值得引用。
§1.5 典型应用场景
- 术前肿瘤分割基准:以专家校正的三腔隙掩膜(强化肿瘤/坏死核心/瘤周水肿)训练 nnU-Net、Swin UNETR 等 3D 分割网络,按 BraTS 约定报告 Dice 与 HD95。
- IDH/1p/19q 无创预测:用 T1c/T2/FLAIR 或全序列输入做分子分型分类,向术前活检替代标志物方向研究(外部基准:仅 3D 形状特征即可达 IDH AUROC 0.902,见 §8.1)。
- WHO 分级与生存建模:结合分级标签、EOR 与 OS 天数构建多模态预后模型。
- 高级序列价值验证:ASL 灌注与 HARDI 派生图(FA/MD/AD/RD)在标准协议下齐备,适合做"加序列能否涨点"的消融研究。
- 跨中心泛化研究:与 UPenn-GBM、RHUH-GBM 组成训练-外验对,量化单中心模型的域漂移损失(§7.3)。
- 教学与课程实验:HF 结构子集 6.24 GB 即可支撑"医学影像分割入门"全流程——下载、重映射标签、训练 2D/3D 小模型、按 BraTS 指标评估,一个下午的实验课时即可完成闭环。
- 数据治理与合规研究:CC BY 4.0 + TCIA 政策 + IRB 豁免 + 去标识化(颅骨剥离去面部)构成一个完整的公开医学数据治理样本,适合作为数据管理课程案例。
§2 医学背景
§2.1 疾病编码映射(ICD-11)
本数据集覆盖 WHO 2021 分类下的成人型弥漫性胶质瘤谱系。ICD-11 相关编码如下:
| 标签 | ICD-11 编码 | ICD-11 中文名 | 在本数据集中的体现 |
|---|---|---|---|
| 弥漫性星形细胞瘤(总类) | 2A00 | 弥漫性星形细胞瘤 | 数据集主体疾病类别 |
| IDH 突变型弥漫性星形细胞瘤 | 2A00.0 | IDH 突变型 | grade II 83%、grade III 67% 病例携带 IDH 突变 |
| IDH 野生型弥漫性星形细胞瘤 / 胶质母细胞瘤 | 2A00.1 | IDH 野生型 | grade IV 403 例的主体类型(IDH 突变仅 8%) |
| 少突胶质瘤 | 2A01.0 | IDH 突变与 1p/19q 共缺失型少突胶质瘤 | 1p/19q 共缺失:grade II 20%、grade III 5% |
§2.1b 术语映射(SNOMED CT)
| 标签 | SNOMED CT | 术语类型 | 说明 |
|---|---|---|---|
| 胶质瘤(病变本体) | 93722004 | 形态学编码 | Glioma,弥漫性胶质瘤的上级形态学术语 |
| 脑(解剖部位) | 12738006 | 解剖结构 | Brain,病灶器官定位 |
| 胶质瘤诊断(临床所见) | 93722004 关联临床发现条目 | 临床发现 | 配合解剖部位编码使用 |
§2.2 疾病简介与流行病学
弥漫性胶质瘤(diffuse glioma)是起源于脑胶质细胞的浸润性肿瘤,是成人最常见的原发性恶性脑肿瘤类型(Zhu et al., PNAS 2025)。其组织学边界与影像边界均模糊,手术难以完整切除,治疗依赖"最大安全切除 ± 放化疗"的组合。2021 年第五版 WHO 中枢神经系统肿瘤分类(WHO CNS5)把弥漫性胶质瘤的分组主轴从组织学分级转向分子参数:IDH 突变状态与 1p/19q 共缺失共同决定肿瘤的类别归属(星形细胞瘤 vs 少突胶质瘤),再叠加 CNS WHO grade 2-4 分级;IDH 野生型、组织学高级别的成人肿瘤归入胶质母细胞瘤(GBM),是其中预后最差的类型。这正是 UCSF-PDGM 设计标签体系时对齐的框架:IDH 全覆盖、MGMT 覆盖 grade III/IV、1p/19q 以 FISH 判读,WHO 2021 最终诊断逐例给出。
在本数据集的 501 例检查中,grade IV 占 403 例(80%),grade II 与 grade III 分别为 55 例(11%)与 42 例(9%);男性在各级别中均占约 56-60%(TCIA 集合页)。这一构成反映三级转诊中心的术前手术队列特征:低级别肿瘤未必都在该中心术前成像,而 grade IV 几乎全部进入手术路径。
三个分子标志物为什么值得无创预判——这是理解本数据集标签设计的钥匙:
- IDH:IDH 突变型胶质瘤整体预后显著优于野生型,且对化疗(如 PCV/TMZ 方案)反应更好。术前若能无创判读,可影响切除范围决策(突变型更倾向最大安全切除以保留功能)与活检取样策略。本数据集 grade II/III 中 IDH 突变率分别为 83%/67%,grade IV 仅 8%,构成经典的"分级越高、突变越少"梯度。
- 1p/19q 共缺失:少突胶质瘤的诊断性分子标志,对烷化剂化疗高度敏感,是"放化疗 vs 先化疗"治疗排序的关键依据。本数据集中其占比在 grade II 为 20%、grade III 为 5%、grade IV 不足 1%——注意这是本页所有标签中最不均衡的一个,直接建模时类别失衡问题最严重(见坑点 7)。
- MGMT 启动子甲基化:甲基化的 GBM 对替莫唑胺获益更明确。本数据集 grade IV 中 63% 呈高甲基化;MGMT 用甲基化敏感 qPCR 以 0-17 个甲基化位点计数给出,既可作二分类也可作连续变量使用,这在公开数据集中相对少见。
需要强调:数据集中的分子标签全部来自临床检测(UCSF500 靶向 NGS 面板、qPCR、FISH),是组织病理级金标准而非影像推断值,因此适合作为训练目标;而训练出的影像推断模型输出的只是"术前概率估计",不能反过来替代组织检测。
§2.3 临床任务定义
| 临床任务 | 定义 | 数据集支撑 | AI 任务形态 |
|---|---|---|---|
| 术前诊断与分级 | 依 WHO CNS5 用分子参数 + 组织学分级确定肿瘤类别与级别 | WHO grade、WHO 2021 最终诊断、IDH、1p/19q | 多分类 / 多标签分级 |
| 术前分子分型 | 无创预判 IDH、1p/19q、MGMT,辅助手术与治疗决策 | IDH 全覆盖、MGMT(III/IV)、1p/19q(FISH) | 二分类 / 弱监督影像组学 |
| 肿瘤分割与体积测量 | 勾画强化肿瘤、坏死核心、瘤周水肿,支撑手术计划与随访 | 三腔隙分割掩膜(BraTS 约定 0/1/2/4) | 3D 多类语义分割 |
| 预后与生存预测 | 结合影像、分子与切除范围估计生存 | OS(天)、vital status、EOR | 回归 / 生存分析 |
| 功能影像量化 | 利用 ASL 灌注与 HARDI 扩散参数刻画肿瘤微环境 | 3D ASL、55 方向 HARDI 及 FA/MD/AD/RD 派生图 | 影像生物标志物研究 |
上表五项任务的难度在本数据集上呈明显梯度:分割最成熟(BraTS 生态完整,及格线清晰);IDH 分类次之(信号较强,多个独立工作复现到 AUROC 0.9 档);1p/19q 分类再度(正类稀少,指标易被失衡扭曲);MGMT 与生存预测最难(影像信号弱、删失机制复杂,Warman 2024 的 MGMT AUROC 0.445 甚至低于随机)。选题时建议从梯度上端切入,把下端作为"高级序列增量"的检验场而非主攻目标。
§2.4 患者人群
| 维度 | 描述 |
|---|---|
| 来源机构 | UCSF 医疗中心(单中心,美国加州旧金山) |
| 入组时间 | 2015-2021 |
| 纳入标准 | 成人、组织病理学确诊 WHO II-IV 级弥漫性胶质瘤、术前标准化 3T MRI、初次肿瘤切除与基因检测在本中心完成 |
| 排除标准 | 任何既往脑肿瘤治疗史(活检不算,69 例、14% 成像前有活检) |
| WHO 分级构成 | grade II 55 例(11%)、grade III 42 例(9%)、grade IV 403 例(80%) |
| 性别构成 | 男性占比 56%/60%/60%(grade II/III/IV) |
| 种族/民族 | 官方元数据未逐例提供(省略) |
| 就医类型 | 三级学术医疗中心术前手术队列 |
把纳入/排除标准翻译成研究设计语言:这是一条**"确诊→标准化术前成像→手术→分子检测"的全流程管道**,每位患者在同一家机构完成影像与组织检测,避免了两中心数据配对的系统误差。代价是队列天然偏向"能手术"的患者:跨过这条管道的漏斗依次是初诊(全人群)、到 UCSF 就诊(三级转诊)、术前标准化成像(排除外院初始检查)、手术+分子检测(最终入组)。理解这个漏斗,才能理解为什么本队列不能代表流行病学意义上的胶质瘤全人群。
§2.5 临床价值
对临床端,这份数据支撑的价值链条是:术前无创分子分型(减少对活检组织量的依赖、提前锁定治疗策略)→ 术前分割与切除范围规划(三腔隙体积直接关联手术可达性)→ 术后预后分层(分子 + 影像 + EOR 的联合模型)。对算法端,它是检验"高级序列是否有临床增量"的实验场:ASL 提供不带电离辐射的灌注信息,HARDI 提供白质纤维尺度上的微观结构信息,而这两类序列在多数公开胶质瘤数据集中缺失。数据集作者在论文中的定位也正在于此:把公开胶质瘤 MRI 从"4 个对比度"推进到"结构 + 扩散 + 灌注"的完整术前影像包(Calabrese et al., 2022)。
第三类受益者是监管与卫生技术评估(HTA)视角的研究者:单中心、单一设备、统一后处理的设计让"影像 AI 输入一致性"第一次成为可假设的前提,这正是在此类数据上讨论算法变更控制(version-locked 输入分布)比在多中心大杂烩上更接近真实监管语境的原因。
§2.6 参考标准(金标准)
| 目标变量 | 标注/测量方式 | 标注者 | 性质 |
|---|---|---|---|
| 肿瘤三腔隙分割 | BraTS 2021 流程:既往获奖算法 ensemble 自动分割 → 逐例人工校正 → 专家审批 | 受训放射科医生校正,2 名专家审核批准 | AI 辅助 + 人工确认(专家级) |
| IDH 突变状态(含 subtype) | UCSF500 捕获靶向 NGS 面板 | 临床分子病理实验室 | 组织病理金标准 |
| MGMT 启动子甲基化 | 甲基化敏感 qPCR(0-17 个甲基化位点计数) | 临床分子病理实验室 | 临床级检测 |
| 1p/19q 共缺失 | 荧光原位杂交(FISH) | 临床细胞遗传实验室 | 临床级检测 |
| 切除范围(EOR) | 手术记录 + 术后即刻 MRI 报告复核 | 主治团队 | 病历金标准 |
| 总生存期(OS) | 自initial diagnosis起以天计至死亡或末次随访 | 电子病历回顾 | 病历金标准 |
注意"金标准"与"参考标准"的区别:分割掩膜与分子标签是各自领域的参考标准(临床级、可追溯),但参考标准本身也有误差传播——AI 初始化的分割可能把系统性偏置传给校正者,qPCR 对 MGMT 的灵敏度低于甲基化测序。引用本数据集训练的模型时,其性能上限应表述为"对齐参考标准的性能",而非"等于真实病理的性能"。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 肿瘤分割基准训练 | v5(或 v2+) | 约 142 GB | v2 起修复分割取整错误并附 BraTS21 映射;v5 为当前完整版 |
| 弥散张量/纤维束追踪研究 | v5 | 约 142 GB | v5 修复 DTI_eddy_noreg 头方向并提供 eddy 旋转后 bvecs |
| 与 BraTS 2021/2023 联合建模 | v5 | 约 142 GB | 依赖 metadata_v5.csv 的 BraTS21 ID 与 cohorts 列排除交集 |
| 快速教学/轻量实验 | HuggingFace BraTS 格式结构子集 | 6.24 GB | 仅 T1/T1c/T2/FLAIR + tumor_segmentation,495 例,NIfTI 几何已统一 |
| 复现历史论文 | 对应论文声明版本(v2/v3/v4) | 142-156 GB | v2-v4 仍可从 TCIA Previous Versions 区下载 |
§3.1 模态详情
| 序列 | 维度/加权 | 采集要点 | AI 用途 |
|---|---|---|---|
| T1(pre-contrast) | 3D T1 加权 | 解剖基准 | 解剖分割、灰白质对比 |
| T1c(post-contrast) | 3D 增强前 T1 + 钆造影剂 | 造影剂为 gadobutrol 0.1 mL/kg 或 gadoterate 0.2 mL/kg | 强化肿瘤(ET)识别、血脑屏障破坏量化 |
| T2 | 3D T2 加权 | 与 FLAIR 联合判水肿 | 水肿与囊变分析 |
| T2/FLAIR | 3D T2/FLAIR | 作为配准参考空间(1 mm 各向同性) | 瘤周水肿(ED)、全肿瘤轮廓 |
| SWI | 磁敏感加权 | 显示微出血与矿化 | 血管与出血相关特征 |
| DWI | 弥散加权 | eddy 校正后输出各向同性 DWI 与 ADC | 细胞密度、坏死鉴别 |
| HARDI | 2D 55 方向高角分辨率弥散 | FSL 6.0.2 eddy(outlier replacement on、topup off)+ DTIFIT | 白质浸润、纤维束成像 |
| DTI 派生图 | FA/MD/AD/RD + L1/L2/L3 特征值 | 由 DTIFIT 简单最小二乘拟合 | 弥散定量特征 |
| 3D ASL | 动脉自旋标记灌注 | 无创灌注 | 肿瘤血流灌注、分级线索 |
| 分割掩膜 | tumor_segmentation | 标签 0/1/2/4(BraTS 约定) | 分割金标准 |
| 全脑/脑实质掩膜 | brain_segmentation、brain_parenchyma_segmentation | 深度学习颅骨剥离产物 | ROI 提取、归一化 |
| 临床/分子表格 | UCSF-PDGM-metadata_v5.csv + glossary | 501 行(检查级) | 标签与分层变量 |
§3.1b 任务-序列速查
不是每个任务都需要全量 142 GB。按下表选序列组合,可显著降低下载与预处理成本:
| 你的任务 | 最小序列组合 | 建议额外引入 | 理由 |
|---|---|---|---|
| 三腔隙分割 | T1、T1c、T2、T2/FLAIR + tumor_segmentation | 全脑掩膜(裁剪 ROI) | BraTS 四对比度约定,HF 结构子集(6.24 GB)即够 |
| IDH/1p19q 分类 | T2/FLAIR + T1c(瘤体+水肿形态) | ASL 灌注图 | 水肿形态与瘤体强化是文献主信号;ASL 提供灌注增量 |
| MGMT 预测 | T1c + T2/FLAIR | SWI(微出血/铁沉积线索) | MGMT 影像信号弱,多模态兜底(注意 Warman 2024 形状特征 AUROC 仅 0.445) |
| 灌注定量研究 | 3D ASL + T2/FLAIR(配准参考) | T1c(对照强化) | ASL 无创、无电离辐射,与 DSC 对比研究的基础 |
| 弥散/纤维束研究 | HARDI 55 方向 + bvec/bval + 派生 FA/MD/AD/RD | DTI_eddy 变体 | 必须用 v5(rotated bvecs),见坑点 6 |
| 生存/预后建模 | 上述任一 + metadata 全表 | — | EOR、vital status、OS(天)是现成标签 |
提示:即使只用四个结构序列,也建议下载完整 metadata CSV——BraTS21 交集过滤(坑点 1)与
_FU重复过滤(坑点 2)都依赖它。
§3.2 按子集样本数
| 子集 | 例数 | 占比 | 说明 |
|---|---|---|---|
| WHO grade II | 55 | 11% | IDH 突变为主(83%) |
| WHO grade III | 42 | 9% | IDH 突变 67%,MGMT 已检测 |
| WHO grade IV | 403 | 80% | IDH 突变仅 8%,MGMT 甲基化 63% |
| 唯一患者(检查去重后) | 495 | — | 6 例为短期随访成像,v3 起重命名标注 |
| 成像前有活检史 | 69(14%) | — | 官方允许保留 |
| 与 BraTS 2021 重叠 | 约 298(约 60%) | — | metadata 的 BraTS21 ID 列可逐例识别 |
子集数字是检查级口径(501 例),与患者级(495)交叉时会差 6 例——做任何"按分级分组的患者数"统计前,先按 §5.6 模板过滤 _FU 检查,否则低级别组的例数可能被随访检查虚增。另注:约 60% 的 BraTS 重叠并非均匀分布在各级别,低级别与高级别的交集比例可能不同,精确到级别的重叠数请以自己 metadata 过滤后的统计为准(官方未按级别公布该拆分)。
§3.3 数据格式
| 内容 | 格式 | 说明 |
|---|---|---|
| 影像与分割 | NIfTI(.nii.gz) | 每例一个文件夹,文件名携带序列缩写 |
| 临床/分子元数据 | CSV | UCSF-PDGM-metadata_v5.csv(501 行)+ glossary(1.92 KB) |
| 弥散配套 | BVAL/BVEC(文本 + ZIP) | v5 附 eddy 旋转后 bvecs |
§3.4 存储大小
- v5 影像包:约 142 GB(12,030 series);v4 为约 156 GB(11,523 series),差值主要来自体积压缩与文件组织调整(TCIA)。
- 临床 CSV:54.97 KB;metadata glossary:1.92 KB;bval/bvec:每个约 1 KB 级。
- HuggingFace BraTS 格式结构子集:6.24 GB(495 例 × 5 卷)。
磁盘与带宽规划:全量 v5 建议预留 ≥300 GB(142 GB 压缩包 + 解压副本 + 预处理缓存);Aspera 下载中断可续传,NBIA 命令行适合服务器无图形环境;若带宽受限,可先只勾选 metadata CSV + 若干病例文件夹验证管线,再批量拉取。注意 TCIA 以 series 为最小下载单元,同一病例的 15+ 个文件可能分批到达,解压后以病例文件夹完整性校验为准。
§3.5 标注方式
肿瘤分割采用"AI 集成 + 人工校正"的两段式标注:先由既往 BraTS 获胜算法组成 ensemble 自动分割,再由受训放射科医生逐例校正,最后由 2 名专家审核批准。分割包含三个腔隙:强化肿瘤(ET)、坏死/非强化肿瘤核心(NCR/NET)、瘤周 FLAIR 异常(水肿,ED)。全脑与脑实质掩膜由公开深度学习算法 ecalabr/brain_mask 生成。分子标签全部来自临床检测(NGS/qPCR/FISH),非影像推断值。
§3.6 标注者资质与一致性
官方描述了标注者资质(受训放射科医生 + 2 名专家审核),但未发布观察者间一致性指标(如 Dice 或 Cohen’s kappa)。使用者在论文中应表述为"expert-corrected, expert-approved segmentation",不要写成"fully manual ground truth"。这一表述差异在审稿中常被质疑,提前按事实表述可以避免返工。
若研究确实需要人工一致性数据,可行的补救路径:抽取 20-30 例由本机构放射科医生独立重标注,报告其与官方掩膜的一致性作为"跨机构一致性"代理指标;或引用 BraTS 2021 官方流程的既往一致性研究作为背景支持。两条路径都无法替代官方数字,但能显著加强方法学叙述。
§3.7 采集周期
2015-2021 年,单中心连续入组。期间跨过两种钆造影剂使用阶段(gadobutrol 与 gadoterate),做强度相关建模时应把造影剂类型作为协变量检验(见 §7.6 数据漂移)。
§3.8 地域覆盖
美国加利福尼亚州旧金山,UCSF 医疗中心单一机构。无多中心、多国数据。
§3.9 设备规格
| 项目 | 规格 |
|---|---|
| 扫描仪 | GE Discovery 750,3.0 T(全部 501 例统一) |
| 接收线圈 | Invivo 专用 8 通道头线圈 |
| 造影剂 | gadobutrol(Gadovist)0.1 mL/kg 或 gadoterate(Dotarem)0.2 mL/kg |
| 弥散处理 | FSL 6.0.2 eddy + DTIFIT(简单最小二乘) |
| 配准 | ANTs 自动非线性配准至 T2/FLAIR 1 mm 空间 |
| 颅骨剥离 | 深度学习算法 ecalabr/brain_mask |
§3.10 深度溯源链
UCSF PACS(原始术前检查)→ 数据方统一后处理(eddy/DTIFIT/ANTs/brain_mask)→ BraTS 2021 分割流程(ensemble + 人工校正 + 专家批准)→ TCIA 收录(v1 2022 → v5 2025-05-30,DOI 10.7937/tcia.bdgf-8v37)→ 用户下载(Aspera)。每一步均有公开记录:后处理参数见 TCIA 集合页 Methods 节,版本差异见 Previous Versions,分割流程见 Calabrese et al., 2022。
链路断点排查:结果异常时按链路自上而下定位——原始采集问题(同期其他中心数据也异常?)→ 后处理问题(v5 changelog 是否覆盖?如 DTI_eddy_noreg 头修复)→ 分割流程问题(是否用了 v2 前的取整错误版本)→ 下载完整性问题(series 数与 12,030 对不上?)。每一环都有官方记录可查,这是本数据集溯源链的实用价值:任何异常都能落到具体环节与具体版本。
§4 数据结构
§4.0 目录树
ucsf-pdgm-v5/
├── UCSF-PDGM-metadata_v5.csv # 501 行检查级临床/分子元数据(含 BraTS21 ID 列)
├── UCSF-PDGM-metadata_glossary.csv # 元数据字段释义
├── UCSF-PDGM-0004_nifti/ # 每例一个文件夹(4 位编号)
│ ├── UCSF-PDGM-0004_T1.nii.gz # 平扫 T1
│ ├── UCSF-PDGM-0004_T1c.nii.gz # 增强 T1(另有 _T1c_bias N4 校正变体)
│ ├── UCSF-PDGM-0004_T2.nii.gz # 3D T2
│ ├── UCSF-PDGM-0004_FLAIR.nii.gz # T2/FLAIR(配准参考空间)
│ ├── UCSF-PDGM-0004_SWI.nii.gz
│ ├── UCSF-PDGM-0004_DWI.nii.gz # eddy 校正后各向同性 DWI
│ ├── UCSF-PDGM-0004_ADC.nii.gz
│ ├── UCSF-PDGM-0004_ASL.nii.gz # 3D ASL 灌注
│ ├── UCSF-PDGM-0004_DTI_eddy_FA.nii.gz # 各向异性分数
│ ├── UCSF-PDGM-0004_DTI_eddy_L1.nii.gz # 特征值(DTIFIT 输出)
│ ├── UCSF-PDGM-0004_DTI_eddy_L2.nii.gz
│ ├── UCSF-PDGM-0004_DTI_eddy_L3.nii.gz
│ ├── UCSF-PDGM-0004_DTI_eddy_MD.nii.gz # 平均 diffusivity
│ ├── UCSF-PDGM-0004_DTI_eddy_noreg.nii.gz # 原始方向/spacing 的 4D DWI(v5 修复头)
│ ├── UCSF-PDGM-0004_tumor_segmentation.nii.gz # 标签 0/1/2/4(BraTS 约定)
│ ├── UCSF-PDGM-0004_brain_segmentation.nii.gz # 全脑掩膜
│ ├── UCSF-PDGM-0004_brain_parenchyma_segmentation.nii.gz # 脑实质掩膜
│ ├── UCSF-PDGM-0004_HARDI.bval / .bvec # 55 方向弥散配套(v5 含 eddy 旋转后 bvec)
│ └── ...
├── UCSF-PDGM-0005_nifti/
│ └── ...
└── UCSF-PDGM-0433_FU007d_nifti/ # v3 起随访检查带 _FUxxx 后缀(例)
文件命名规则速记:{case_id}_{SEQ}.nii.gz,其中 case_id 统一 4 位补零;_FU 后缀数字是距基线检查的天数(FU007d = 第 7 天随访);DTI_eddy 前缀表示经 FSL eddy 校正的弥散产物链(_noreg 为保留原始方向的 4D DWI,v5 修复其 NIfTI 头);_T1c_bias 是 N4 偏置场校正变体(HF 结构子集不含,完整版提供)。glob 模板建议 "{root}/UCSF-PDGM-*_nifti/UCSF-PDGM-*_{seq}.nii.gz",并用正则把 _FU\w* 段从 case_id 中剥离后再 join metadata。
§4.1 DAIMS 字段字典
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patient_id / case_id | Text | 检查级 ID;元数据 3 位补零,图像文件 4 位 | UCSF-PDGM-004 / UCSF-PDGM-0004 | 主键连接 | join 前必须归一化 | — | 0001-0501(含 _FU 后缀变体) |
| T1 / T1c / T2 / FLAIR | ImageObject(NIfTI) | 结构序列,已非线性配准至 FLAIR 1 mm 空间并颅骨剥离 | shape (240, 240, 155) | 分割/分类输入 | 已处理,勿重复配准 | — | 240×240×155,1 mm |
| T1c_bias | ImageObject | N4 偏置场校正版增强 T1 | 同上 | 强度归一化敏感任务 | — | — | 同上 |
| DWI / ADC | ImageObject | eddy 校正后弥散 | 同上 | 细胞密度特征 | 涡流残余 | — | 同上 |
| HARDI.bval/.bvec | Text | 55 方向弥散配套;v5 bvec 已随 eddy 旋转 | bval 值域见文件 | 弥散模型拟合 | v4 前需自行旋转 bvec | — | 55 方向 |
| DTI_eddy_FA/MD/AD/RD/L1/L2/L3 | ImageObject | DTIFIT 派生定量图 | 同结构序列 | 弥散定量特征 | 简单最小二乘拟合 | — | 同上 |
| ASL | ImageObject | 3D 动脉自旋标记灌注 | 同上 | 灌注特征 | CBF 半定量 | — | 同上 |
| tumor_segmentation | ImageObject | 三腔隙肿瘤掩膜,BraTS 标签 0/1/2/4 | 标签 4=ET、2=ED、1=NCR | 分割监督 | AI 辅助 + 专家校正 | — | |
| brain_segmentation / brain_parenchyma_segmentation | ImageObject | 全脑/脑实质掩膜 | 二值掩膜 | ROI 与归一化 | DL 自动生成 | — | |
| WHO CNS grade | Integer(Label) | CNS WHO 分级 | 4 | 分级任务标签 | 病理金标准 | — | |
| IDH | Text(Label) | IDH 突变状态(UCSF500 NGS) | Mutant / Wildtype | 分子分型标签 | 临床检测 | unknown | |
| MGMT promoter status | Text(Label) | 启动子甲基化(qPCR,0-17 位点) | methylated / unmethylated | 分子分型标签 | 临床检测 | blank(多数低级别未测) | |
| 1p/19q | Text(Label) | FISH 判读共缺失 | co-deletion / intact | 分子分型标签 | 临床检测 | unknown / relative co-deletion | |
| EOR | Text(Label) | 切除范围(手术记录 + 术后 MRI 复核) | GTR / STR / biopsy | 预后建模协变量 | 病历回顾 | blank | |
| OS / vital status | Integer / Text | 生存天数(自initial diagnosis起);死亡=1,存活=0 | 512;1 | 生存分析标签 | 病历回顾 | — | 非负整数 |
§4.2 标签分布
- 分割标签:全病例含背景 0;坏死/非强化核心(1)401 例有体素、瘤周水肿(2)501 例、强化肿瘤(4)426 例(openmedlab 统计)。
- WHO grade:II 55 / III 42 / IV 403。
- IDH:grade II 83% 突变、grade III 67%、grade IV 8%;全队列 IDH 野生型占绝对多数(80% 的 grade IV 为主)。
- MGMT:grade IV 63% 甲基化;grade III 部分检测;grade II 大多未测(结构性缺失)。
- 1p/19q 共缺失:grade II 20%、grade III 5%、grade IV <1%——全队列罕见类。
这组分布的三个读法:其一,分割标签的腔隙覆盖率递减(水肿 501 例全有 → 强化 426 例),意味着"无强化肿瘤"的病例真实存在于低级别亚组,模型必须学会输出"全背景之外的合理腔隙组合",而不是假设三腔隙齐备;其二,分子标签沿分级呈单调梯度(IDH 83%→67%→8%),模型可能学到"分级即代理"的捷径,任何 IDH 分类工作都应报告控制分级后的分层性能;其三,1p/19q 罕见类的绝对数量(grade II 55 例 × 20% ≈ 11 例量级)提醒我们:任何以此为主标签的研究都在个位数到两位数的正类上做评估,置信区间宽到必须报告。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 体素矩阵 | 240×240×155,1 mm 各向同性(配准重采样后) | HF 数据卡 |
| 每例结构序列 | T1/T1c/T2/FLAIR + SWI + DWI/ADC + ASL + DTI 派生图 | TCIA 页面 |
| series 总数(v5) | 12,030 | TCIA 页面 |
| 脑实质掩膜体积中位数 | 约 915.69 cm³ | openmedlab 统计 |
| 瘤周水肿体积中位数 | 约 50.28 cm³ | openmedlab 统计 |
| 强化肿瘤体积中位数 | 约 17.68 cm³ | openmedlab 统计 |
体积统计口径提示:上述中位数来自 openmedlab 对体素计数 × 1 mm³ 的换算,与本集官方未发布体积统计不冲突;自己在复算时注意先按标签值(1/2/4)分腔隙、再剔除 _FU 检查,否则 6 例随访会把"同一患者"的体积计入两次,拉偏分布尾部。
§4.4 数据层级
患者(495 名唯一)
└── 术前 MRI 检查(501 例;6 例为另 6 名患者的短期随访)
└── 序列/文件(12,030 series;每例 15+ 个 NIfTI)
└── 体素(240×240×155,1 mm,标签 0/1/2/4)
临床/分子表格:检查级一行,字段见 §4.1
§4.5 缺失值与信息性缺失
| 字段 | 缺失形态 | 是否信息性 | 处理建议 |
|---|---|---|---|
| MGMT promoter status | grade II 大多 blank | 是(与分级强相关) | 建模时加"未检测"指示位,勿当随机缺失插补 |
| 1p/19q | unknown / relative co-deletion 混在标签中 | 部分 | 分类前明确三值/四值语义 |
| Biopsy prior to imaging | blank | 否(真无活检) | 按官方 glossary 语义处理 |
| IDH subtype | 依赖 NGS 面板判读 | 否 | 保持官方原始值 |
| 种族/民族 | 未逐例提供 | — | 该维度公平性分析不可行,勿自行推断 |
§4.6 临床/分子 CSV 字段字典
UCSF-PDGM-metadata_v5.csv(501 行,检查级)关键字段语义如下(完整定义以官方 glossary 为准):
| 字段组 | 字段(示例语义) | 取值/单位 | 建模注意 |
|---|---|---|---|
| 标识 | 病例 ID | UCSF-PDGM-XXX(3 位补零) | 与图像文件名(4 位补零)join 前需归一化,见坑点 3 |
| 随访标记 | 检查 ID 含 _FU 后缀 |
如 UCSF-PDGM-0433_FU007d(FU 后数字为距基线天数) |
属于短期随访检查,跨患者划分前剔除或按患者分组 |
| 人口学 | sex | M/F | 男性占比 56-60% |
| 人口学 | age | 诊断时年龄(岁) | 成人为主 |
| 分级 | WHO CNS grade | 2/3/4 | 55/42/403 例,重失衡 |
| 诊断 | WHO 2021 最终诊断 | WHO CNS5 类别文本 | 与 ICD-11 2A00.x 映射见 §2.1 |
| 分子 | IDH status(含 subtype) | 突变/野生型 + 亚型 | UCSF500 NGS 面板,全覆益 |
| 分子 | MGMT promoter status / index | 甲基化状态 + 0-17 位点计数 | grade II 大多未检测(信息性缺失) |
| 分子 | 1p/19q codeletion | co-deletion / non-co-deletion / relative co-deletion 等 | 非纯二值,先做语义清洗 |
| 手术 | EOR(切除范围) | biopsy / STR / GTR | 手术记录金标准 |
| 手术 | Biopsy prior to imaging | 是/否(blank 即否) | 69 例(14%)成像前有活检 |
| 预后 | vital status | 存活/死亡 | 生存分析事件指示 |
| 预后 | OS | 自诊断起以天计 | 与 vital status 联用做 Cox/DeepSurv |
| 防泄漏 | BraTS21 ID、BraTS21 Segmentation Cohort、BraTS21 MGMT Cohort | ID 或空 | 空值=不与 BraTS 2021 重叠;排交集只保留空值行 |
§5 划分与使用建议
§5.1 官方划分
没有官方训练/验证/测试划分。 官方提供的是 BraTS21 归属映射与 cohorts 列,供使用者自行构建无泄漏划分。任何论文声称"UCSF-PDGM 官方测试集"均不准确。
官方不设划分是刻意的:501 例检查中约 60% 与 BraTS 2021 重叠、6 例互为随访重复,任何固定划分都会随"是否排除 BraTS 交集"这一使用前提而失效。因此本数据集的"正确用法"是把划分视为实验设计的一部分——引用他人结果时,先问对方用了什么划分,再看数字。
§5.2 社区惯例划分
社区常见做法是 5 折交叉验证(患者级),如 MTS-UNET 在 UCSF-PDGM 上按 5 折 CV 报告平均 Dice 87%。也有工作把 UCSF-PDGM 整体作训练池、以 UPenn-GBM/RHUH-GBM 作外部测试(域泛化范式)。
划分透明度清单(建议随论文/模型卡一并列出):所用数据集版本号(v5);BraTS 交集排除数(应约 298,若你排除了更多需解释);_FU 检查处理方式;折划分文件哈希;分层键(grade × IDH 与否)。缺任何一项,他人都无法判断你的数字与基线是否同一口径。
§5.3 泄漏风险(重点)
UCSF-PDGM 有两处真实泄漏源,均为官方文档明示:
- BraTS 交集:约 298/495(约 60%)病例同时出现在 BraTS 2021(继承到 BraTS 2023)。若模型在 BraTS 训练、再在 UCSF-PDGM 测试(或反之),评估即被污染。metadata_v5.csv 的 BraTS21 ID / BraTS21 Segmentation Cohort / BraTS21 MGMT Cohort 列可逐例识别交集。
- 6 例重复患者:v3 前同一患者以两个 ID 存在(如 0315 与 0433),患者级划分不处理会同时落入训练与测试。
泄漏自查三行代码(任何划分生成后必跑):
assert train_ids.isdisjoint(val_ids), "病例级泄漏"
assert not any(i.startswith("UCSF-PDGM-") and "_FU" in i for i in train_ids | val_ids), "_FU 检查未过滤"
overlap = set(meta.loc[meta["fold"] == fold, "BraTS21 ID"].dropna())
assert not overlap, "BraTS 交集未排除"
若第三条 assert 报出的 ID 为空集,说明你的 v5 metadata 列名对不上(以 glossary 为准),此时宁可停下排查,也不要"先跑着看"。
§5.4 交叉验证建议
- 按唯一患者分层:以 WHO grade × IDH 状态双层分层,保证每折的稀有类(1p/19q 共缺失、grade II)分布接近。
- 固定随机种子并把折划分文件入库版本控制,避免"读前人代码发现划分对不上"。
- 若同时用 BraTS:先从 UCSF-PDGM 剔除 BraTS21 ID 非空的病例,或从训练侧剔除交集,二选一并写明。
- 每折规模预期:排交集与
_FU后约 195-200 例患者,5 折每折验证侧约 40 例,其中 grade II 约 11 例、1p/19q 共缺失不足 3 例——稀有类的每折数字要直接写进论文,提醒读者分类指标的置信区间宽度。
§5.5 外部验证建议
推荐外验池:UPenn-GBM(同为单中心标准化协议,域差异最小)、RHUH-GBM 与 Ivy GAP(MTS-UNET 的外验组合)、LGG-1p19q Deletion(1p/19q 专项)。外验时注意各数据集预处理差异(是否颅骨剥离、是否 N4 校正),必要时把 UCSF-PDGM 的配准/剥离管线逆向下游统一。
| 外验数据集 | 获取渠道 | 与本集的主要域差 |
|---|---|---|
| UPenn-GBM | TCIA(Scientific Data 9:453) | 机构/厂商不同;序列协议自成体系(含 DSC 灌注) |
| RHUH-GBM | TCIA | 欧洲中心、厂商差异、无 ASL/HARDI |
| Ivy GAP | Allen Brain Atlas | 覆盖范围与临床协议差异大,适合机制研究而非直接外验 |
| LGG-1p19q Deletion | TCIA | 低级别为主,分级构成与本集几乎倒置 |
§5.6 推荐划分的可运行模板
import pandas as pd
from sklearn.model_selection import StratifiedGroupKFold
meta = pd.read_csv("UCSF-PDGM-metadata_v5.csv")
# 1) 剔除与 BraTS 2021 交集(列名以官方 glossary 为准)
meta = meta[meta["BraTS21 ID"].isna()].copy()
# 2) 剔除短期随访检查(_FU 后缀),回退到唯一患者
meta = meta[~meta["ID"].str.contains("_FU")]
# 3) 分层键:grade × IDH(稀有类分层);组键:唯一患者
meta["strat"] = meta["WHO CNS grade"].astype(str) + "_" + meta["IDH status"]
sgkf = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
meta["fold"] = -1
for fold, (_, val_idx) in enumerate(sgkf.split(meta, meta["strat"], groups=meta["ID"])):
meta.loc[val_idx, "fold"] = fold
meta[["ID", "fold"]].to_csv("ucsf_pdgm_folds.csv", index=False)
三个约定缺一不可:BraTS 交集过滤(防坑点 1 的 60% 重叠泄漏)、_FU 过滤(防坑点 2 的 6 例跨 ID 重复)、按患者分组(501 检查 ≠ 495 患者,分组错误会让随访检查分别落入训练/验证两侧)。
§6 AI 就绪指南
§6.0 云端快速启动
TCIA 全量下载依赖 IBM Aspera Connect(桌面插件),云端 Colab 不友好。轻量路径是用 HuggingFace 上的 BraTS 格式结构子集(6.24 GB,495 例 × T1/T1c/T2/FLAIR + 分割)先跑通训练循环,再决定是否拉全量:
# Colab / 任意 Linux 环境:拉取 BraTS 格式结构子集(6.24 GB)
pip install -q huggingface_hub nibabel monai
python -c "
from huggingface_hub import snapshot_download
snapshot_download(repo_id='MedOtter/UCSF-PDGM', repo_type='dataset',
local_dir='ucsf-pdgm-subset')
"
§6.1 数据获取与快速上手
目录结构预期(data_root 拼接关系):data_root 指向解压后的 ucsf-pdgm-v5/,病例文件夹名为 UCSF-PDGM-XXXX_nifti,序列文件为 {case_id}_{SEQ}.nii.gz。最小可用子集:T1c + FLAIR + tumor_segmentation 三个文件即可跑通分割基线。
import glob, os
import nibabel as nib
import numpy as np
DATA_ROOT = "ucsf-pdgm-v5" # ← 数据解压根目录,与上面的目录树对应
# 病例目录模式:{DATA_ROOT}/UCSF-PDGM-XXXX_nifti/UCSF-PDGM-XXXX_{SEQ}.nii.gz
def load_case(data_root, case_id, sequences=("T1c", "FLAIR", "tumor_segmentation")):
"""读取一个病例的指定序列,返回 shape (C, 240, 240, 155) 的数组。"""
folder = os.path.join(data_root, f"{case_id}_nifti")
vols = []
for seq in sequences:
path = os.path.join(folder, f"{case_id}_{seq}.nii.gz")
vols.append(nib.load(path).get_fdata(dtype=np.float32))
return np.stack(vols) # 通道维在最前,MONAI/nnU-Net 均可消化
case = load_case(DATA_ROOT, "UCSF-PDGM-0004")
print(case.shape) # (3, 240, 240, 155)
print(np.unique(case[-1])) # 分割标签 ∈ {0., 1., 2., 4.} —— 注意没有 3!
全量获取:在 TCIA 集合页 的 Data Access 区安装 IBM Aspera Connect 后点击 Download(142 GB),或使用 NBIA 命令行。临床表格 UCSF-PDGM-metadata_v5.csv 与 glossary 独立下载(几十 KB)。
云端全量路线(服务器无图形界面时):TCIA 提供 NBIA 检索清单(manifest 文件,tciaDownload 工具逐 series 拉取),配合 nohup 后台跑,142 GB 约需数小时;也可在 Colab 挂载 Google Drive 后用 HF 子集 + 按需从 TCIA 补下载目标病例的 ASL/HARDI series。无论哪条路线,下载完成后先跑 §4.0 的命名 glob 校验(病例文件夹数应与 metadata 行数对上,注意 501 行 vs 495 个文件夹的差异即坑点 2 本身)。
§6.2 下载方式对照
| 方式 | 内容 | 大小 | 适用场景 |
|---|---|---|---|
| TCIA + Aspera Connect | 全量 v5 影像 + CSV + bval/bvec | 约 142 GB | 完整研究 |
| TCIA 单项下载 | 仅 CSV / bval / bvec | KB 级 | 补齐元数据 |
| HuggingFace 镜像(MedOtter/UCSF-PDGM) | BraTS 格式结构子集 | 6.24 GB | 快速上手、教学 |
HF 子集一行加载(Python ≥3.9,需 pip install datasets nibabel):
from huggingface_hub import snapshot_download
# 6.24 GB,495 例 × {T1, T1c, T2, FLAIR, tumor_segmentation},BraTS 命名惯例
local = snapshot_download(repo_id="MedOtter/UCSF-PDGM", repo_type="dataset")
# 下载后目录为 BraTS 格式结构,可直接套用 §6.3 步骤 1 的标签重映射
注意:HF 子集强度未做 N4 校正、几何已统一到 1 mm;若论文需要完整序列(ASL/HARDI)或 _bias 变体,仍须回 TCIA 全量下载。
§6.3 预处理全流程
官方已做:ANTs 非线性配准到 FLAIR 1 mm 空间、颅骨剥离(brain_mask)、eddy 校正与 DTIFIT。使用者仍需做:标签重映射、强度归一化、(可选)N4 校正、划分过滤。
import numpy as np
# 步骤 1:BraTS 标签重映射 0/1/2/4 → 0/1/2/3(类别索引连续化)
def remap_brats(seg: np.ndarray) -> np.ndarray:
out = np.zeros_like(seg, dtype=np.uint8)
out[seg == 1] = 1 # NCR/NET 坏死与非强化核心
out[seg == 2] = 2 # ED 瘤周水肿
out[seg == 4] = 3 # ET 强化肿瘤(BraTS 用 4,必须显式映射)
return out
# 步骤 2:脑掩膜内 z-score 强度归一化(逐模态)
def normalize(vol: np.ndarray, brain_mask: np.ndarray) -> np.ndarray:
vals = vol[brain_mask > 0]
mean, std = vals.mean(), vals.std() + 1e-8
return (vol - mean) / std
# 步骤 3:划分过滤——剔除与 BraTS 2021 交集 + 重复检查(伪代码)
# import pandas as pd
# meta = pd.read_csv("UCSF-PDGM-metadata_v5.csv")
# keep = meta[meta["BraTS21 ID"].isna()] # 排除 BraTS 交集(列名以 glossary 为准)
# keep = keep[~keep["patient_id"].str.contains("_FU")] # 排除随访重复检查
清洗规则:读入后校验每卷 shape 为 (240, 240, 155) 且 affine 一致;分割标签集合 ⊆ {0,1,2,4};VOI 外无 NaN。标准化一律在脑掩膜内统计(全图统计会被背景 0 拉偏)。
DTI 用户的额外三步(仅 HARDI/DTI 相关研究需要,结构分割用户可跳过):
# 步骤 4(DTI 专用):确认 bvec 已随 eddy 旋转,否则梯度表与体素错位
# v5 起每例附带 eddy 旋转后 bvecs;若你下载的是 v4 或更早,必须自行旋转:
# bvecs_rot = eddy 当前输出中的 rotated_bvecs 列(FSL eddy --repol 运行后自动产生)
# 或用原 bvec 左乘 eddy 的仿射场逆变换——成本高,直接换 v5 更实际。
import numpy as np
bvals = np.loadtxt("UCSF-PDGM-0004_DTI_eddy.bval") # 55 方向 + b0
bvecs = np.loadtxt("UCSF-PDGM-0004_DTI_eddy.bvec") # 注意:v4 及更早未旋转,见坑点 6
# 步骤 5(DTI 专用):体素级校验——派生图(FA/MD/AD/RD、L1/L2/L3)与 4D DWI 空间必须逐体素对齐
# fa.shape == dwi.shape[1:] 且 fa.affine ≈ dwi.affine(容差 1e-4)
# 几何变体(_space-T2/FLAIR vs _space-native)不可混入同一批拟合,见坑点 4。
# 步骤 6(DTI 专用):不要用 L1/L2/L3 反推张量方向做纤维束追踪——
# 官方只发布 DTIFIT 特征值,未含完整张量(见 §4.5 之后的坑点 6);追踪请从 4D DWI 自行拟合。
§6.4 PyTorch DataLoader
import os, pandas as pd, numpy as np, nibabel as nib, torch
from torch.utils.data import Dataset, DataLoader
class UCSFPDGMSegDataset(Dataset):
"""最小分割数据集:T1c/FLAIR/T2 输入 + 三腔隙分割。
预期目录:{root}/UCSF-PDGM-XXXX_nifti/UCSF-PDGM-XXXX_{seq}.nii.gz
meta CSV 中的 ID 为 3 位补零,此处统一转为 4 位与文件名对齐。"""
SEQ = ("T1c", "T2", "FLAIR")
def __init__(self, root: str, meta_csv: str, exclude_brats_overlap=True):
self.root = root
meta = pd.read_csv(meta_csv, dtype=str)
id_col = next(c for c in meta.columns if "patient" in c.lower() or "ID" in c)
ids = meta[id_col].str.extract(r"(\d+)")[0].str.zfill(4) # 3 位 → 4 位(坑点 3)
meta = meta.assign(case_id="UCSF-PDGM-" + ids)
if exclude_brats_overlap:
brats_col = next((c for c in meta.columns if "BraTS21 ID" in c), None)
if brats_col:
meta = meta[meta[brats_col].isna()] # 排除 BraTS 交集(坑点 1)
meta = meta[~meta["case_id"].str.contains("_FU", na=False)] # 排除重复检查(坑点 2)
self.cases = [c for c in meta["case_id"]
if os.path.isdir(os.path.join(root, f"{c}_nifti"))]
def __len__(self):
return len(self.cases)
def _load(self, case_id, seq):
path = os.path.join(self.root, f"{case_id}_nifti", f"{case_id}_{seq}.nii.gz")
return nib.load(path).get_fdata(dtype=np.float32)
def __getitem__(self, idx):
cid = self.cases[idx]
x = np.stack([self._load(cid, s) for s in self.SEQ]) # (3, D, H, W)
seg = self._load(cid, "tumor_segmentation")
brain = self._load(cid, "brain_segmentation") > 0
for c in range(x.shape[0]): # 脑掩膜内 z-score
vals = x[c][brain]
x[c] = (x[c] - vals.mean()) / (vals.std() + 1e-8)
y = np.zeros_like(seg, dtype=np.int64)
y[seg == 1], y[seg == 2], y[seg == 4] = 1, 2, 3 # 0/1/2/4 → 0/1/2/3
return torch.from_numpy(x), torch.from_numpy(y)
loader = DataLoader(UCSFPDGMSegDataset("ucsf-pdgm-v5", "UCSF-PDGM-metadata_v5.csv"),
batch_size=2, shuffle=True, num_workers=4, pin_memory=True)
x, y = next(iter(loader))
print(x.shape, y.shape) # torch.Size([2, 3, 240, 240, 155]) ...
§6.5 八大坑点
⚠️ 坑点 1:约 60% 病例与 BraTS 2021/2023 重叠,双数据集同用即泄漏(分类:数据泄漏)
问题:495 例中约 298 例(约 60%)同时被 BraTS 2021 收录,BraTS 2023 胶质瘤数据又继承自 BraTS 2021。若模型见过 BraTS 训练集,再在 UCSF-PDGM 上"外部测试",评估指标会被严重高估;反向同理。
症状:在 BraTS 训练的模型迁到 UCSF-PDGM 时分割 Dice 异常地高、与跨中心外验论文的数量级不符;或两数据集混训后验证集成绩好得反常。
解决:
- 简单方法:读取
UCSF-PDGM-metadata_v5.csv,凡BraTS21 ID非空的病例,要么从 UCSF-PDGM 侧剔除,要么从 BraTS 训练侧剔除,全程只用一侧。- 进阶方法:写一个持久化的
exclude_list.json(病例 ID 列表)纳入版本控制,所有实验脚本读同一份黑名单,避免不同实验剔除口径不一致。- SOTA 方法:按 BraTS 2023 官方数据划分文档核对继承关系,并在论文中显式报告"UCSF-PDGM 独立子集(n=197)"的样本量。
参考:TCIA 集合页 Data Citation 与 v2 变更说明;HuggingFace 数据卡 Benchmark-overlap warning
⚠️ 坑点 2:6 例"重复患者"双 ID,患者级划分必漏(分类:数据泄漏)
问题:v3 官方勘误确认 6 例检查是其他病例的短期随访成像(如 UCSF-PDGM-0315 实为 0433 的 7 天后复查),因此唯一患者是 495 而非 501。不处理则同一患者会分别落入训练与测试。
症状:患者级 5 折划分后验证集 Dice/精度系统性偏高且方差小;逐折排查发现同一_FU病例同时出现。
解决:
- 简单方法:按文件名过滤,凡带
_FU后缀(如UCSF-PDGM-0433_FU007d)的病例在训练与测试划分前合并或剔除。- 进阶方法:用 metadata CSV 构造 patient_id → 检查列表的映射,
GroupKFold按患者分组切分。- SOTA 方法:升级到 v5 并以官方重命名后的 ID 体系为准,把 495 作为患者级统计的唯一口径写进论文。
参考:TCIA v3 版本说明(Previous Versions)
⚠️ 坑点 3:元数据 ID 3 位补零、图像文件 4 位,直接 join 得空表(分类:工程陷阱)
问题:metadata CSV 的 ID 形如
UCSF-PDGM-004(3 位补零),图像文件夹与文件名是UCSF-PDGM-0004(4 位)。直接按字符串 join 合并元数据与影像会得到 0 行。
症状:DataFrame.merge后样本数骤减为 0 或个位数;os.path.exists全部 False。
解决:
- 简单方法:join 前统一去掉
UCSF-PDGM-前缀,str.zfill(4)归一为 4 位整数再拼接。- 进阶方法:封装
normalize_id()工具函数(见 §6.4 代码),单元测试覆盖 3 位/4 位/_FU后缀三种形态。- SOTA 方法:数据接入层先做 ID 一致性断言(assert 覆盖率 100%),CI 中跑一个"行数守恒"检查。
参考:HuggingFace 数据卡 Joining metadata to images
⚠️ 坑点 4:影像已配准颅骨剥离,混用 noreg/bias 变体会破坏几何(分类:预处理陷阱)
问题:官方把各对比度非线性配准到 FLAIR 1 mm 空间并颅骨剥离,但同目录下还有
DTI_eddy_noreg(v5 起保留原始方向/spacing 的 4D DWI)与_bias(N4 校正)等变体。把它们当同一坐标系直接堆叠,体素会错位。
症状:分割掩膜叠在影像上明显偏移;DTI 派生图与结构序列对不齐;训练 loss 不降且可视化时脑边缘有"重影"。
解决:
- 简单方法:结构序列只用配准版;确需
noreg原始几何时,重新走一遍 ANTs 配准并把 affine 写回。- 进阶方法:加载后断言
nib.load(...).shape == (240, 240, 155)且各序列 affine 全等,不等即报错退出。- SOTA 方法:以 FLAIR 为参考空间建立 case 级几何指纹(shape + affine 哈希),入库前统一校验。
参考:TCIA Image Pre-Processing 节;v5 版本说明(DTI_eddy_noreg 头修复)
⚠️ 坑点 5:分割标签是 0/1/2/4 而非 0/1/2/3(分类:标签理解)
问题:分割掩膜沿用 BraTS 约定,标签值 4 表示强化肿瘤(ET),不存在标签 3。直接把掩膜喂给
CrossEntropyLoss或用argmax比较会静默出错。
症状:分类头 out_channels=4 时 ET 全部错位;指标里 ET Dice 为 0 或异常;np.unique(seg)出现 4 导致 one-hot 越界。
解决:
- 简单方法:读入后立即重映射
4 → 3(见 §6.3 步骤 1),训练全程使用连续类别索引。- 进阶方法:在 Dataset 里断言
set(np.unique(seg)) ⊆ {0,1,2,4},防止 v1/v2 老版本残留的取整错误混入。- SOTA 方法:保留 BraTS 原值域做评估(与挑战赛指标可比),仅在 loss 计算前临时映射。
参考:HuggingFace 数据卡 Tumor segmentation labels;BraTS 2021 基准论文
⚠️ 坑点 6:DTI 只给特征值图,bvec 未旋转会毁掉张量拟合(分类:预处理陷阱)
问题:官方只提供 L1/L2/L3 特征值图而不含张量文件(官方说明:可从 4D DWI 用 DTIFIT 自行导出);且 v4 及更早版本的 bvec 未随 eddy 校正旋转——涡流校正后梯度方向已变,用旧 bvec 直接拟合张量是错的。
症状:FA 图出现方向性伪影;纤维束追踪结果整体旋转错位;复现论文 DTI 指标对不上。
解决:
- 简单方法:直接用官方现成 FA/MD/AD/RD 图,绕开自拟合。
- 进阶方法:需要原始 DWI 拟合时升级 v5,使用官方 eddy 旋转后的 bvecs,再跑 FSL DTIFIT。
- SOTA 方法:对 v4 及以下版本自行实现 bvec 旋转(eddy 输出旋转矩阵右乘 bvec 矩阵),并用手动选择胼胝体 ROI 验证主特征值方向。
参考:TCIA Detailed Description(L1/L2/L3 与 DTIFIT 说明);v5 版本说明(rotated bvecs)
⚠️ 坑点 7:80% grade IV + IDH 野生型主导,准确率指标虚高(分类:偏倚陷阱)
问题:队列 80% 为 grade IV,IDH 突变在 grade IV 中仅 8%,1p/19q 共缺失全队罕见(grade IV <1%)。IDH/分级二分类模型只要偏向多数类,accuracy 就能轻松达到 80%+,却毫无临床价值。
症状:准确率 0.9+ 但少数类召回率接近 0;混淆矩阵呈"一条对角线 + 一条竖线";跨论文比较时成绩与临床直觉严重脱节。
解决:
- 简单方法:报告 balanced accuracy、MCC、F1 与 AUROC,弃用裸 accuracy。
- 进阶方法:分层采样(grade × IDH 双层)+ 类别加权损失或 focal loss;稀有类(1p/19q 共缺失约几十例)考虑类别合并或过采样并在论文披露。
- SOTA 方法:按 grade 分层报告性能(II/III/IV 各自的 AUROC),并给出 95% CI(如 Warman 2024 的 AUROC 置信区间写法)。
参考:TCIA 集合页 demographic 节;Bas & Ozturk-Isik(不均衡类分布讨论)
⚠️ 坑点 8:单中心单设备训练的模型,跨中心掉点严重(分类:评估误用)
问题:全部 501 例来自同一台 GE Discovery 750 和同一套协议,模型学到的"域指纹"(强度分布、噪声纹理、几何)在跨中心数据上不成立。把内部 CV 成绩当成泛化性能写进论文是最常见的评估误用。
症状:内部 5 折 Dice 87%,迁到 UPenn-GBM/RHUH-GBM 等外部集立刻掉 3-5 个点(MTS-UNET 实测 87% → 84%);IDH 分类器外验 AUROC 明显缩水。
解决:
- 简单方法:论文同时报告内部 CV 与外部验证两组数字,明确标注数据来源。
- 进阶方法:训练侧加入强度/几何域随机化,或用 UPenn-GBM 做留一域验证(leave-one-domain-out)。
- SOTA 方法:联邦学习框架下的多中心训练(Bas & Ozturk-Isik 实测 FL 相对 CL 有可量化的性能损失),并预注册外验协议。
参考:Calabrese et al., 2022 单中心队列描述;OMT-APC 多中心研究(PNAS 2025)
§6.6 数据增强
- ✅ 安全:沿左右轴镜像(脑近似对称,BraTS 惯例)、小幅随机旋转/缩放(±15°、±0.1)、脑掩膜内随机 gamma/强度扰动、随机裁剪到肿瘤包围盒附近。
- ❌ 危险:三腔隙标签与影像使用不同插值(标签必须最近邻);对 DWI/ADC 做跨模态强度混合(破坏定量语义);对 SWI 做重度强度变换(磁敏感对比度会被摧毁);跨造影剂类型(gadobutrol vs gadoterate)混合归一化统计量而不加协变量。
MONAI 表达(等价于上述安全集):
from monai.transforms import Compose, RandAffined, RandGaussianNoised, EnsureChannelFirstd
train_tf = Compose([
EnsureChannelFirstd(keys=["img", "seg"]),
RandAffined(keys=["img", "seg"], prob=0.5,
rotate_range=(0.26, 0, 0), # ±15°
scale_range=(0.1, 0.1, 0.1),
mode=("bilinear", "nearest"), # 标签必须 nearest
spatial_size=(128, 128, 128)),
RandGaussianNoised(keys=["img"], prob=0.2, std=0.01),
])
§6.7 模型推荐
| 任务 | 推荐模型 | 起步理由 |
|---|---|---|
| 三腔隙分割 | nnU-Net v2 | 无需调参即可逼近 SOTA,BraTS 生态验证充分 |
| 三腔隙分割(Transformer) | Swin UNETR / 3D UX-Net | 与 MTS-UNET 基线可比 |
| IDH/1p19q/MGMT 分类 | 2D/3D ResNet + 影像组学融合 | Bas & Ozturk-Isik 的 2D U-Net 编码器方案可作为强基线 |
| 生存预测 | Cox 深度模型(DeepSurv) + EOR/分子协变量 | OS 天数与 vital status 字段齐备 |
| 弥散研究 | DIPY + 官方 FA/MD 图 | 避免自拟合踩坑点 6 |
nnU-Net v2 落地要点:把每个病例整理为 imagesTr/UCSF-PDGM-XXXX_0000.nii.gz(T1)/_0001(T1c)/_0002(T2)/_0003(FLAIR)+ labelsTr/(重映射后 0-3 标签),dataset.json 中 labels 写 {"background": 0, "NCR": 1, "ED": 2, "ET": 3}。nnU-Net 默认配置(3D fullres,patch 约 128³ 级别)在 240×240×155 输入上无需改动;训练侧记得用上面 §5.6 的折划分文件替代其默认随机划分,并把 BraTS 交集排除列表作为参数传入。若显存不足 24 GB,改用 nnU-Net 的 3D lowres 先行或减半 batch size,不建议降 patch 到小于肿瘤包围盒。
§6.8 硬件需求
| 场景 | 显存 | 存储 | 说明 |
|---|---|---|---|
| 2D 切片级分类 | ≥8 GB | 100 GB(子集)+ 200 GB 缓存 | 可先下 6.24 GB 结构子集 |
| 3D 分割训练 | ≥24 GB(A100/4090 级) | ≥300 GB SSD | 240×240×155 三通道,patch 128³ |
| 全量弥散/纤维束 | ≥32 GB RAM | ≥200 GB 空闲 | bvec 处理在 CPU 侧 |
低资源路线:只有 CPU 或单张 8 GB 卡时,用 HF 结构子集 + 2D 切片级分类/轻量 3D(patch 96³ 或 2.5D)仍可完成教学级实验;把 resize/重采样放在数据落盘阶段一次性完成,训练时只做内存读取。24 GB 以下显存跑 nnU-Net 3D fullres 会 OOM,退到 nnU-Net 自动选择的 lowres 配置即可,不要手工魔改网络结构。
§6.9 评估指标代码
import numpy as np
def dice(pred: np.ndarray, gt: np.ndarray) -> float:
"""单类 Dice。pred/gt 为 0/1 二值图。"""
inter = np.logical_and(pred, gt).sum()
return 2.0 * inter / (pred.sum() + gt.sum() + 1e-8)
def multiclass_dice(pred_idx: np.ndarray, gt_idx: np.ndarray, n_class=4):
"""对 ET/ED/NCR 三腔隙分别计算再平均(背景不计)。"""
return {c: dice(pred_idx == c, gt_idx == c) for c in range(1, n_class)}
def balanced_accuracy(y_true, y_pred, n_class=2):
"""不均衡分子标签的稳健指标(见坑点 7)。"""
recalls = [((y_pred == c) & (y_true == c)).sum() / max((y_true == c).sum(), 1)
for c in range(n_class)]
return float(np.mean(recalls))
分割任务按 BraTS 惯例报告 ET/TC/WT 的 Dice 与 HD95;分子分类报告 AUROC + 95% CI + MCC。
HD95 的轻量实现(无依赖兜底版;生产环境建议直接用 medpy.metric.binary.hd95 或 MONAI HausdorffDistanceMetric):
def hd95(pred: np.ndarray, gt: np.ndarray, voxel_spacing=(1.0, 1.0, 1.0)) -> float:
"""95% Hausdorff 距离(mm)。空集约定:双空=0,单空=返回 +inf 由调用方裁决。"""
from scipy.ndimage import distance_transform_edt as edt
if not pred.any() and not gt.any():
return 0.0
if not pred.any() or not gt.any():
return float("inf")
d_pred = edt(~pred, sampling=voxel_spacing)[gt] # gt 边界点到 pred 的距离
d_gt = edt(~gt, sampling=voxel_spacing)[pred]
return float(np.percentile(np.concatenate([d_pred, d_gt]), 95))
§6.10 MLOps 笔记
- 把
UCSF-PDGM-metadata_v5.csv、exclude_list.json(BraTS 交集与_FU名单)与折划分文件一并提交版本控制,数据指纹(SHA256)写进实验跟踪系统。 - 论文与模型卡明确标注"UCSF-PDGM v5",避免 v2/v3 时代的已知错误(分割取整、6 例重复)回流。
- 外验数据集(UPenn-GBM 等)的预处理管线差异要写成配置文件,保证可复现。
可复现性 checklist(投稿前逐项打勾):
| # | 项目 | 达标标准 |
|---|---|---|
| 1 | 数据版本 | 声明 “UCSF-PDGM v5”,给出 DOI + 访问日期 |
| 2 | 排除清单 | BraTS 交集数、_FU 检查数两个数字出现在方法节 |
| 3 | 折划分 | 划分文件(含随机种子)随代码发布 |
| 4 | 预处理 | 重映射/归一化/裁剪以配置文件描述,含插值方式 |
| 5 | 环境 | requirements/pip freeze 快照入库 |
| 6 | 指标 | 主次指标 + 每折方差 + 混淆矩阵(分类)齐备 |
| 7 | 哈希 | 关键中间产物 SHA256 写入实验跟踪系统 |
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 分级失衡 | grade IV 占 80%,低级别稀少 | 高 | 分层划分 + 稳健指标(坑点 7) |
| 分子标签失衡 | IDH 野生型主导;1p/19q 共缺失罕见(grade IV <1%) | 高 | 类别加权/合并稀有类,报告 AUROC + CI |
| 单中心单设备 | 全部来自一台 GE 3T 扫描仪 | 高 | 外部验证(UPenn-GBM 等) |
| 性别偏倚 | 男性 56-60% | 中 | 按性别分层评估 |
| AI 辅助分割 | ensemble 自动 + 人工校正,非纯手工 | 中 | 结果表述用 expert-corrected;对分割边界不确定性保持谦抑 |
| 造影剂不一致 | 两种钆剂(0.1/0.2 mL/kg)分期使用 | 中 | 造影剂类型作为协变量检验 |
| MGMT 结构性缺失 | 多数低级别未检测 | 中 | "未检测"指示位建模(§4.5) |
| 转诊选择偏倚 | 三级中心术前手术队列 | 低-中 | 结论限定于手术人群 |
§7.2 标注质量
分割走 BraTS 2021 官方流程(ensemble → 医生校正 → 2 名专家批准),标签体系与全球最大胶质瘤基准完全一致,这是其可信度的主要来源。但注意三点:官方未发布观察者间一致性数字;v2 之前的 tumor_segmentation 存在整数取整错误(已修复);校正幅度官方未逐例公开。分子标签来自临床检测(NGS/qPCR/FISH),非研究级复测,可信度等同院内临床报告。
标签可信度分层(建模时的先验认知):分割标签 = AI 初始化 + 专家校正,边界质量可信但可能继承算法系统性偏置;IDH/1p19q = 组织级检测,最高可信;MGMT = qPCR 计数法,方法学灵敏度有文献争议,建议同时用连续位点数与二值化两套口径跑敏感性分析;EOR = 手术记录 + 影像报告复核,属病历级而非独立裁决级。不同可信度标签不宜混在同一个"真值"叙事里讨论。
§7.3 泛化性
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 跨中心(其他医院/其他厂商设备) | 高:强度域与几何域双重漂移 | MTS-UNET 内验 Dice 87% → 外验 84%(arXiv 2503.06828) |
| 与 BraTS 混合训练 | 中-高:交集泄漏或域混淆 | 官方 v2 起提供 BraTS21 映射防泄漏 |
| 低级别胶质瘤为主的门诊筛查 | 高:队列 80% grade IV,先验严重不符 | TCIA demographic 节 |
| 弥散定量下游(纤维束) | 中:bvec 版本与几何变体混用 | v5 版本说明(rotated bvecs) |
上表前两行是"数据组合方式"造成的失效,后两行是"使用场景错配"造成的失效——前者靠 §5.6 的过滤纪律解决,后者靠选题时诚实评估队列-场景匹配度解决。泛化性问题的本质不是"数据不够好",而是单中心数据的定义使然:固定设备与协议换来内部效度,必然牺牲部署侧的域覆盖。
§7.4 伦理与合规
数据采集经 UCSF 机构审查委员会(IRB)批准并豁免知情同意(回顾性研究);TCIA 依其标准政策完成去标识化;配准后的影像已颅骨剥离,面部与外部解剖进一步被移除。使用层面:CC BY 4.0 + TCIA Data Usage Policy,商业用途亦被许可但须署名;发表成果必须引用数据 DOI(10.7937/tcia.bdgf-8v37)与论文 DOI(10.1148/ryai.220058)。
合规操作清单:使用前阅读 TCIA Data Usage Policy 全文;二次分发(含 HF 等镜像)须保留原始署名与 DOI 并声明自己的改动(CC BY 4.0 的 ShareAlike 不强制,但 Attribution 必须);衍生标注(如再标注的子分割)建议同样走 CC BY 4.0 回馈社区;涉及患者隐私的疑问以 TCIA 与 UCSF 官方答复为准,本页不构成法律意见。
§7.5 公平性
性别分布轻度偏男(56-60%);年龄以成人为主;种族/民族未逐例提供,相关公平性分析在本数据上不可行。分子标签的严重不均衡本身构成算法公平性风险:对 1p/19q 共缺失等稀有亚型的模型性能不应外推。
公平性评估的可操作建议:把"性别 × 分级"作双层亚组,分别报告主指标,任何亚组间差异超过 5 个百分点须在论文中显式讨论;不要用重采样"抹平"性别比例来制造表面公平,应保留真实流行病学构成并诚实报告亚组差异;跨中心部署时,接收人群的分级构成与本队列(80% grade IV)的偏离程度本身就是最大的公平性变量。
§7.6 数据漂移
2015-2021 采集期内存在可预期漂移:造影剂由 gadobutrol 期间过渡到 gadoterate 期间(剂量 0.1 vs 0.2 mL/kg);扫描序列参数可能随院内协议微调。建议把采集年份/造影剂类型作为元特征,在纵向对比实验中检验其影响。
| 漂移源 | 可观测变量 | 检验方法 |
|---|---|---|
| 造影剂换代 | metadata 中造影剂记录(gadobutrol vs gadoterate) | 按造影剂分组重跑模型,比较组间 AUROC/Dice 差 |
| 采集年份 | 检查日期字段 | 按年分桶的性能曲线;突变年份对应院内协议变更 |
| 扫描参数微调 | series 级参数(TCIA 逐 series 提供) | 对关键参数(TR/TE/b 值)做分层评估 |
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 元数据单表 CSV,501 行检查级记录 |
| 2 | 唯一标识 | ⚠️ | 患者唯一但 ID 补零位数不一致(3 位 vs 4 位),需归一化 |
| 3 | 特殊字符 | ✅ | ID 与文件名均为字母数字,无特殊字符 |
| 4 | 重复行 | ⚠️ | 6 例为同一患者的随访检查,患者级分析须去重 |
| 5 | 缺失编码 | ✅ | blank / unknown 编码在 glossary 中明确定义 |
| 6 | 标签标识 | ✅ | 分割标签 0/1/2/4 遵循 BraTS 公开约定 |
| 7 | 罕见类分组 | ✅ | 稀有类(1p/19q 共缺失、grade II)官方有占比披露 |
| 8 | 偏倚评估 | ✅ | 分级/分子/性别构成官方全部给出数字 |
| 9 | 数据字典 | ✅ | UCSF-PDGM-metadata_glossary.csv 逐字段释义 |
| 10 | 信息性缺失解释 | ✅ | MGMT 未测与分级强相关的结构性缺失有据可查 |
| 11 | 设备记录 | ✅ | 扫描仪/线圈/造影剂型号与剂量完整公开 |
| 12 | 共线性 | ✅ | WHO 2021 最终诊断与 grade/IDH/1p19q 的映射关系可核 |
| 13 | 编码映射 | ✅ | v2 起提供 BraTS21 ID 官方映射 |
| 14 | 时间戳处理 | ⚠️ | OS 以天数给出,无原始日期(脱敏所致),时序分析受限 |
| 15 | 划分建议 | ⚠️ | 无官方 train/test 划分,需自行构建 |
| 16 | 泄漏讨论 | ✅ | v2 官方主动加 BraTS 映射防泄漏;v3 勘误重复病例 |
| 17 | 标签分布 | ✅ | 分割/分子/分级分布全部可从官方数字推导 |
| 18 | 测量偏倚 | ⚠️ | 分割为 AI 集成 + 校正,非独立双盲人工标注 |
| 19 | 外部验证建议 | ✅ | 与 UPenn-GBM/RHUH-GBM/Ivy GAP 组合路径清晰 |
| 20 | 版本记录 | ✅ | v1-v5 每版变更逐条公开 |
| 21 | 预处理脚本 | ⚠️ | brain_mask 与 eddy/DTIFIT 参数公开,但无一键全流程脚本 |
| 22 | 合规要求 | ✅ | CC BY 4.0 + TCIA Data Usage Policy,义务清晰 |
| 23 | 多模态对齐 | ✅ | 全部序列非线性配准至 FLAIR 1 mm 空间,体素级对齐 |
| 24 | 去标识化 | ✅ | TCIA 标准脱敏 + 颅骨剥离去面部 |
DAIMS 评分:20.5 / 24
评分解读:这属于医疗影像公开数据集的第一梯队水平。扣分集中在四项半分项:ID 填充位数不一致、6 例重复检查需人工处理、无官方划分、OS 无原始日期、分割含 AI 辅助成分。这些都不是数据质量问题,而是"使用前需要一点工程约定"的问题——官方甚至已经把防泄漏映射和勘误记录主动做完了,这在公开数据集里相当少见。
对你意味着什么:(1) 你可以直接信任其分割与分子标签做基准研究,不需要重新标注;(2) 动手前先完成三件事——ID 归一化函数、BraTS 交集黑名单、_FU 病例过滤(§6.4 代码已内置全部三项),做完这三件事,其余数据风险很低;(3) 如果你的论文需要"纯人工标注"叙事,请改用 expert-corrected 表述,或转用 BraTS 原始手工子集。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Ivy GAP + UPenn-GBM + RHUH-GBM | 多机构 | 三腔隙分割(MTS-UNET) | 平均 Dice 84%±3.51、HD 4.13±1.96 mm | 内验 87% → 外验 84%(约 -3 点) | 跨中心掉点可量化,域漂移真实存在(arXiv 2503.06828) |
| 自体盲测子集 | —(Neurosurgery 2024) | 3D 形状 → IDH / 1p19q / MGMT | AUROC 0.902 / 0.949 / 0.445 | 不适用(形态学-only 首证) | 形状特征足以预测 IDH/1p19q,MGMT 不可(Warman et al.) |
| 集中式 vs 联邦学习 | —(MDPI) | IDH 二分类 | CL+NSF:acc 0.949、AUC 0.971;FL 最优策略 acc 0.949 | FL≈CL(聚合策略敏感) | 隐私保护训练在本队列可行,损失可控(Bas & Ozturk-Isik) |
| TCGA 独立外测(多中心联合模型) | PNAS 2025 | WHO grade / IDH / 1p19q | acc 0.855 / 0.917 / 0.809 | UCSF-PDGM 为训练池之一 | 单队列数据可支撑多中心泛化模型(OMT-APC) |
外验实践建议:外验集的预处理态要与 UCSF-PDGM 对齐(是否剥离、是否 N4、是否配准到 1 mm),否则测的是"预处理差"而非"域泛化";外验前冻结全部超参,禁止在外验集上做任何选择;跨中心掉点(约 -3 Dice 点)应作为结论写进论文,而不是当作需要"调参修掉"的 bug。
§8 基准性能与生态
§8.1 已发表结果排行
以下结果来自不同协议(输入序列、划分、预处理各异),数值不可直接横向比较,仅供选型参考。
| 排名 | 模型/工作 | 任务与性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | MTS-UNET | 分割:5 折 CV 平均 Dice 87%±1.82(ET 89/ED 88/NCR 82) | 2025 | 多尺度 transformer + CMD 模块 | arXiv 2503.06828 | 未公开 |
| 2 | 2D U-Net 编码器分类器 | IDH 分类:acc 0.949、F1 0.951、AUC 0.971(CL+NSF) | 2025 | 肿瘤聚焦软滤波 + 年龄/性别协变量 | Bas A, Ozturk-Isik E, MDPI(IDH Mutation Assessment in Gliomas) | 未公开 |
| 3 | OMT-APC | 多中心分割 lesion-wise Dice 0.880;外测 TCGA IDH acc 0.917 | 2025 | 最优质量传输 + 张量 SVD 预分类 | Zhu Z et al., PNAS 122, 2500004122, doi:10.1073/pnas.2500004122 | 未公开 |
| 4 | 3D 形状 + 机器学习 | IDH AUROC 0.902(95% CI 0.875-0.929);1p/19q 0.949 | 2024 | 拓扑形状特征,无影像强度输入 | Warman P et al., Neurosurgery(Glioma Three-Dimensional Shape Predicts Underlying Genetic Mutations) | 未公开 |
如何使用这张表:分割行(1、3)对齐 BraTS 惯例指标,可作为你 nnU-Net 基线的"及格线"——5 折 CV Dice 显著低于 85% 时优先检查划分泄漏(§5.3)而非调参;分类行(2、4)中 1p/19q 的 0.949 是"形状特征在重失衡上偏乐观"的例子,复现时务必同时报告各类召回与混淆矩阵(坑点 7)。所有行代码均未公开,意味着复现成本完全落在预处理对齐上。
§8.2 SOTA 总结与选型建议
分割任务上 nnU-Net 仍是性价比最高的起点,Transformer 系(Swin UNETR/MTS-UNET)在边界质量(HD95)上有增量;分子分型任务的共识是"肿瘤聚焦预处理 + 简单分类头 + 临床协变量"强于盲目堆大模型;MGMT 的影像预测在多类方法上均不稳(形状特征 AUROC 仅 0.445),不建议作为主攻方向。
选型决策树:目标是刷分割 SOTA → nnU-Net v2 基线 + Swin UNETR 消融;目标是分子分型 → 先复现"肿瘤 ROI + 2D 编码器 + 协变量"强基线(acc 0.949 档),再上 3D/注意力结构看增量;目标是方法学创新(如最优传输、联邦学习)→ 把本数据当受控训练池、外验用 UPenn-GBM(§7.8 已有先例可对齐);目标是临床落地评估 → 先写清 grade 失衡下的预期性能上限,再谈部署。
§8.3 评测协议
分割:BraTS 标签约定 + ET/TC/WT 的 Dice 与 HD95,5 折患者级 CV;分子分类:AUROC + 95% CI + MCC,分层采样(grade × IDH);生存:C-index。所有协议必须先执行 §6.5 坑点 1/2 的过滤,否则结果无效。
| 协议项 | 分割 | 分子分类 | 生存 |
|---|---|---|---|
| 主指标 | Dice(ET/WT/TC 分列) | AUROC + 95% CI | C-index |
| 次指标 | HD95(mm)、IoU | MCC、各亚类召回 | 时间相关 AUC |
| 划分 | 5 折患者级 CV(§5.6) | 分层(grade × IDH)5 折 | 同分类划分,train 内嵌套 CV 调参 |
| 先决过滤 | BraTS 交集 + _FU 排除 |
同左 + 稀有类合并策略声明 | 同左 + 删失机制说明 |
| 最低报告项 | 每折均值±标准差 | 混淆矩阵 + 校准曲线 | 基线(Kaplan-Meier)对照 |
任何一项缺失都会让结果难以与 §8.1 排行对齐——尤其"先决过滤"行,未排 BraTS 交集的分割数字可比性为零。
§8.4 相关数据集
| 数据集 | 规模(发表口径) | 关系 | 联用价值 |
|---|---|---|---|
| BraTS 2021/2023 | 论文发表时口径 542 例(含 243 例 TCGA-GBM 术前) | 约 60% 交集 | 同标签体系域适应研究(先排交集) |
| UPenn-GBM | 单中心标准化队列 | 平行队列 | 最佳跨中心外验搭档(同为标准化预处理) |
| TCGA-GBM | 262 例 | 上游经典队列 | 与 TCGA 分子基因组数据深挖 |
| Ivy GAP / RHUH-GBM | — | 外验池 | 已被 MTS-UNET 等采用 |
| LGG-1p19q Deletion | 专项队列 | 互补 | 1p/19q 共缺失稀有类扩充 |
| Calabrese 2020/2021 前作 | — | 同团队方法学前作 | 模拟增强(Radiol AI e200276)与 IDH 识别(Sci Rep 10:11852)的思路来源 |
联用三原则:先查 BraTS21 ID 列排交集再合并任何 BraTS 系数据;跨集统一到"配准后 1 mm + 颅骨剥离"的同一预处理态再训练;训练/验证折内不允许出现同一患者的两次检查。
§8.5 关键论文 Top 6
- Calabrese E, Villanueva-Meyer JE, Rudie JD, Rauschecker AM, Baid U, Bakas S, Cha S, Mongan JT, Hess CP. The University of California San Francisco Preoperative Diffuse Glioma MRI Dataset. Radiology: Artificial Intelligence 4(6):e220058, 2022. doi:10.1148/ryai.220058 —— 数据集原始论文。
- Calabrese E, et al. (2022). UCSF-PDGM (Version 5) [Dataset]. The Cancer Imaging Archive. doi:10.7937/tcia.bdgf-8v37 —— 数据引用本体。
- Baid U, et al. The RSNA-ASNR-MICCAI BraTS 2021 Benchmark on Brain Tumor Segmentation and Radiogenomic Classification. arXiv:2107.02314 —— 分割流程与标签约定的基准背景。
- Bakas S, et al. The University of Pennsylvania glioblastoma (UPenn-GBM) cohort. Scientific Data 9:453, 2022 —— 平行队列,外验首选。
- WHO Classification of Tumours Editorial Board. Central Nervous System Tumours, 5th ed. (WHO CNS5, 2021) —— 分子分型框架。
- Zhu Z, et al. OMT and tensor SVD-based deep learning model for segmentation and predicting genetic markers of glioma. PNAS 2025, doi:10.1073/pnas.2500004122 —— 以本数据为训练池的多中心 SOTA。
建议阅读顺序:新人先读 1(了解队列与协议设计动机)→ 3(对齐标签与指标约定)→ 2 的 TCIA 集合页 changelog(理解 v1→v5 每次勘误的原因,这比读任何二手总结都可靠);做分子预测再读 5 与 §8.1 引用的分类工作;做外验设计读 4 与 6 的外验节。
§8.6 社区活跃度
TCIA 集合页浏览 30.4k、收录引用出版物 30 条(截至 2026-09);HuggingFace BraTS 格式镜像近月下载约 210 次;官方维护的 ecalabr/brain_mask 工具仓库持续可用。整体属于"稳定被引、持续有人用"的中等热度核心数据集。
更新追踪方式:TCIA 集合页的 changelog 区记录每次版本勘误(v1→v5 全部可查);引用出版物清单在集合页 Publications 区滚动更新,适合做引用网络追踪;数据集本身无 RSS/邮件通知,重大变更通常同步到 Calabrese 团队的论文勘误与 TCIA 首页公告。做长期项目建议在 CI 里固化 v5 的文件清单哈希,上游一变即可感知。
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| TCIA 集合页 | 官方主页 | cancerimagingarchive.net/collection/ucsf-pdgm | 在线,v5 | 唯一权威下载与文档源 |
| ecalabr/brain_mask | 预处理工具 | github.com/ecalabr/brain_mask | 公开 | 官方同款颅骨剥离算法 |
| HF 结构子集 | 社区镜像 | huggingface.co/datasets/MedOtter/UCSF-PDGM | 6.24 GB / 495 例 | 快速上手 |
| openmedlab 统计页 | 社区文档 | Awesome-Medical-Dataset | 在线 | 体素统计与文件结构速查 |
| FSL / ANTs | 依赖工具 | fsl.fmrib.ox.ac.uk / stnava.github.io/ANTs | 稳定 | eddy、DTIFIT、配准复现 |
生态快照的读法:这是一个"官方一手源唯一、社区镜像为辅"的数据集——所有严谨工作都应回溯 TCIA 原始源,HF/openmedlab 镜像仅作快速验证与速查。镜像与官方版本存在天然时滞(如 HF 结构子集不含 _bias 变体与 ASL/HARDI),引用时注明自己实际使用的下载源与版本。
§9 相关资源与引用
§9.1 官方资源
- 数据下载与文档:TCIA UCSF-PDGM Collection(含 Detailed Description 与 Previous Versions)
- 数据 DOI:10.7937/tcia.bdgf-8v37
- 原始论文:Radiology: Artificial Intelligence 4(6):e220058;预印本 arXiv:2109.00356
- 机构发布说明:UCSF ci² 新闻页
- 配套工具:ecalabr/brain_mask
建议的资源使用顺序:首次接触者按"TCIA 集合页 Detailed Description → 论文 Methods → 集合页 changelog"的顺序读,三份材料互为校验(集合页给操作事实、论文给设计动机、changelog 给已知问题);动手前再下载 metadata CSV + glossary 通读字段定义;最后才决定下载全量还是 HF 子集。跳过前两步直接下载数据,是踩进 §6.5 各坑点的最常见路径。
§9.2 BibTeX
@dataset{calabrese2022ucsfpdgm,
author = {Calabrese, Evan and Villanueva-Meyer, Javier E. and Rudie, Jeffrey D. and
Rauschecker, Andreas M. and Baid, Ujjwal and Bakas, Spyridon and
Cha, Soonmee and Mongan, John T. and Hess, Christopher P.},
title = {The University of California San Francisco Preoperative Diffuse Glioma MRI (UCSF-PDGM)},
version = {5},
year = {2022},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/tcia.bdgf-8v37},
url = {https://www.cancerimagingarchive.net/collection/ucsf-pdgm/}
}
@article{calabrese2022ucsfpaper,
author = {Calabrese, Evan and Villanueva-Meyer, Javier E. and Rudie, Jeffrey D. and
Rauschecker, Andreas M. and Baid, Ujjwal and Bakas, Spyridon and
Cha, Soonmee and Mongan, John T. and Hess, Christopher P.},
title = {The University of California San Francisco Preoperative Diffuse Glioma MRI Dataset},
journal = {Radiology: Artificial Intelligence},
volume = {4},
number = {6},
pages = {e220058},
year = {2022},
doi = {10.1148/ryai.220058}
}
@article{baid2021brats,
author = {Baid, Ujjwal and Ghodasara, Satyam and Mohan, Suyash and Bilello, Michel and
Calabrese, Evan and Colak, Erdem and others},
title = {The RSNA-ASNR-MICCAI BraTS 2021 Benchmark on Brain Tumor Segmentation
and Radiogenomic Classification},
journal = {arXiv preprint arXiv:2107.02314},
year = {2021}
}
@article{bakas2022upenn,
author = {Bakas, Spyridon and others},
title = {The University of Pennsylvania glioblastoma (UPenn-GBM) cohort:
Advanced MRI, clinical, genomics, \& radiomics},
journal = {Scientific Data},
volume = {9},
pages = {453},
year = {2022}
}
引用组合建议:纯使用数据 → calabrese2022ucsfpdgm(数据 DOI)+ calabrese2022ucsf(论文)双引;与 BraTS 联合 → 再加 baid2021brats;外验用 UPenn-GBM → 再加 bakas2022upenn。TCIA 官方明确要求出版物报告数据 DOI,缺数据引用的论文不会被收录进其 Publications 清单。
§9.3 引用指南
使用本数据集发表成果时:正文引用原始论文(Calabrese et al., 2022),数据来源引用 TCIA 数据 DOI 并注明版本号(如 Version 5);若与 BraTS 联用,须同时引用 BraTS 基准论文并在方法节报告交集排除清单。
§9.4 常见问题 FAQ
Q1:到底该引用 501 例还是 495 例?
引用"501 例术前 MRI 检查(495 名唯一患者,其中 6 例为其他病例的短期随访)"。只写一个数字都是错的:501 是检查数(TCIA Studies 口径),495 是患者数(v3 勘误后口径)。
Q2:我应该下载哪个版本?
一律 v5(2025-05-30),除非复现历史论文明确要求旧版。v5 集成了此前所有修复(分割取整、6 例重复、bvec/bval、rotated bvecs)。旧版仍可从 TCIA Previous Versions 区获取,但带着已知错误。
Q3:只有 8 GB 显存/低带宽,还能用吗?
可以。先下 HuggingFace 的 BraTS 格式结构子集(6.24 GB,495 例 × T1/T1c/T2/FLAIR + 分割),足以完成分割基线与大部分分类实验;ASL/HARDI 研究才需要全量 142 GB。
Q4:为什么我的 IDH 分类复现结果虚高?
最常见原因是 BraTS 交集泄漏:约 298/495(~60%)病例同时出现在 BraTS 2021 中,若训练/验证两侧都含这些病例的变体,模型记住了病人而非模式。按 §5.6 模板过滤后重跑。
Q5:metadata 里为什么找不到某个 ID 的图像?
两种情况:该行是 _FU 随访检查(图像文件夹以 4 位 ID 命名,需归一化后再找);或 ID 补零位数不匹配(metadata 3 位 UCSF-PDGM-004 vs 图像 4 位 UCSF-PDGM-0004),join 前 zfill(4)。
Q6:分割标签 3 去哪了?
BraTS 约定标签就是 0/1/2/4,没有 3(4=ET 强化肿瘤)。这是历史约定不是数据缺陷,PyTorch CrossEntropyLoss 前需重映射为连续索引(见 §6.3 步骤 1)。
Q7:可以用它做商业产品训练吗?
CC BY 4.0 允许商业用途,但必须署名并遵守 TCIA Data Usage Policy,发表/分发时引用数据 DOI 与论文 DOI。产品落地前请自行完成所在辖区的合规审查(本页 §0 免责条款第三段)。
Q8:为什么 TCIA 页面写 501,HuggingFace 卡片写 495?
口径不同:501 是检查数(TCIA Studies),495 是唯一患者数(v3 勘误后)。HF 子集按"每患者一个 BraTS 格式病例"组织,因此显示 495。两者都对,引用时写全口径(见 Q1)。
Q9:ASL 和 SWI 有公开基准数字吗?
截至本页核实(2026-09),尚无以这两类序列为主输入的权威公开基准;现有排行(§8.1)均基于结构序列或形状特征。这既是空白也是机会——前提是先复现结构序列基线,再引入 ASL/SWI 做严格消融。
Q10:metadata 的 501 行和 495 个病例文件夹,以哪个为准组织 Dataset?
以图像文件夹(患者级,495)为遍历主体、metadata 为查询表:用 zfill(4) 归一化后的 ID 做 join,_FU 检查按需挂到基线病例下或整体剔除。反向(以 501 行 CSV 驱动)会在 6 个随访 ID 上报 FileNotFoundError——那不是数据损坏,是口径差异(Q8)。
§10 AI 使用声明卡
§10.1 本页面生产使用的 AI 模型
| 环节 | 模型 | 用途 |
|---|---|---|
| 资料检索与整合 | 大型语言模型(CodeBuddy 生产写手) | WebSearch 结果汇总、章节起草 |
§10.2 AI 参与范围
AI 参与:文献检索、事实汇总、初稿撰写、代码示例起草。人类参与:结构规范制定(写作宪法)、事实抽查核对、最终审核签发。所有规模、版本、许可与基准数字均溯源至 §9.1 所列官方来源,见页面根部 FACTS 事实清单约束。
§10.3 输入来源
- TCIA UCSF-PDGM Collection(官方集合页)
- UCSF-PDGM v5 数据 DOI
- Calabrese et al., 2022, Radiology: Artificial Intelligence 4(6):e220058
- Calabrese et al., 2021(arXiv:2109.00356 预印本)
- UCSF ci² 数据集发布新闻
- TCIA 集合页(stage 站镜像,demographic 数字)
- HuggingFace MedOtter/UCSF-PDGM 数据卡
- openmedlab Awesome-Medical-Dataset:UCSF-PDGM
- MTS-UNET(arXiv:2503.06828)
- Warman et al., 2024, Neurosurgery(3D 形状预测基因)
- Bas & Ozturk-Isik(MDPI,IDH 集中/联邦学习)
- Zhu et al., 2025, PNAS(OMT-APC 多中心研究)
- Scholars@Duke 论文条目(发表元数据)
- UCSF500 面板方法文献(Neuro-Oncology)
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| INFOBOX 与规模数字 | 千方病案医学编辑部 | 对照 TCIA 官方页逐项核对 | ✅ 已通过/已验证 |
| 版本时间轴 | 千方病案医学编辑部 | 对照 TCIA Previous Versions 逐版核对 | ✅ 已通过/已验证 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | WHO CNS5 与 ICD-11/SNOMED 复核 | ✅ 已通过/已验证 |
| §4 数据字典与 §6 代码 | 千方病案医学编辑部(数据工程) | 代码静态走查 + 字段溯源 | ✅ 已通过/已验证 |
| §6.5 坑点 | 千方病案医学编辑部(数据工程) | 溯源至版本说明/官方数据卡 | ✅ 已通过/已验证 |
| §8 基准数字 | 千方病案医学编辑部 | 对照原始论文摘要逐项核对 | ✅ 已通过/已验证 |
| §8.4 相关数据集与规模 | 千方病案医学编辑部 | 对照各数据集官方页核对 | ✅ 已通过/已验证 |
| §9.4 FAQ 口径 | 千方病案医学编辑部 | 与 §1.3/§3.2/§5.3 数字交叉核对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
除上述人工校验模块外,§1.0 速览、§1.2 战略价值、§7.7 DAIMS 评分解读与"对你意味着什么"由 AI 起草并经编辑审核后发布。
§10.6 最后人工审核
最后人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- fets — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
- brats-africa — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
- duke-breast-mri — 共享标签:医学影像 / MRI / 肿瘤学
- rembrandt — 共享标签:医学影像 / MRI / 脑肿瘤
- pi-cai — 共享标签:医学影像 / MRI / 肿瘤学
- synthrad — 共享标签:医学影像 / MRI / 肿瘤学
- atlas-liver-tumor — 共享标签:医学影像 / MRI / 肿瘤学
- ivy-gap — 共享标签:医学影像 / 脑肿瘤 / 肿瘤学
- upenn-gbm — 共享标签:医学影像 / 脑肿瘤 / 肿瘤学
- cptac-imaging — 共享标签:医学影像 / MRI / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
