信息速览
INFOBOX — BraTS-PED 一屏速览
维度 内容 本质 MICCAI BraTS 挑战赛儿科脑肿瘤分割赛道(BraTS-PED/BraTS-PEDs)2023-2025 三届官方数据集 联盟 CBTN(儿童脑肿瘤网络)+ CONNECT + DIPG/DMG Registry + ASNR + MICCAI;宾大 CBIG 技术统筹 论文 2023 届 arXiv:2305.17033;2024 届 arXiv:2404.15009;数据论文 DOI 10.7937/DX5C-TJ86 数据 患者来源 464(CBTN 120 + DMG/DIPGR 256 + Boston Children’s 61 + Yale 27);挑战赛 metadata 457;TCIA 影像 348 subjects / 1,649 series / 32.7 GB 模态 T1w / T1CE / T2w / T2-FLAIR 四序列 mpMRI,1 mm³ 各向同性,SRI24 图谱空间共配准 标注 儿科四区:ET(强化)/ NET(非强化)/ CC(囊性)/ ED(水肿);组合 TC=ET+NET+CC,WT=全肿瘤 任务 纯分割(三届一贯;挑战赛层面无生存预测任务——但数据临床目录含 OS/PFS 变量) 拆分 2024 届:训练 261 / 验证 91 / 测试 86(盲测,标签不公开);2025 届(Lighthouse Task-6):训练 256 指标 Lesion-wise DSC + Lesion-wise HD95 双指标;MedPerf 容器化盲评 冠军 2023 Capellán-Martín;2024 Astaraki;2025 Yuxiao Yi(测试集 WT 92.6% / TC 91.8%) 获取 Synapse(注册+DUA)|TCIA(CC BY 4.0 公开)|CBTN/NCI CDC(患者级临床数据) 许可 CC BY 4.0(TCIA 官方口径;HF 第三方镜像自称 NC,冲突存照见 §7) 库内互链 brats(成人主赛道)、brats-africa(资源受限改编)、fets(联邦学习)、upenn-gbm(成人胶质瘤)
BraTS-PED 是"把成人脑肿瘤分割的成功范式完整搬到儿童"的一次系统性移植:成人 BraTS 挑战赛用十年时间证明了"统一预处理 + 统一标注协议 + 盲测服务器"可以把全球几百个团队的分割算法放在同一把尺子下比较,而这把尺子直到 2023 年才第一次为儿童脑肿瘤专门铸造。它不采集新数据,而是把北美四个大型儿科神经肿瘤数据联盟——CBTN、CONNECT、DIPG/DMG Registry、Boston Children’s 与 Yale 的存档——汇集为 464 例儿童脑肿瘤多参数 MRI(mpMRI),按儿科特有的"四区标注"协议(ET/NET/CC/ED)重标,并连续三年(2023、2024、2025)作为 MICCAI BraTS 挑战赛的儿科赛道官方数据集向全球开放。
导语读法三则:
- 只想下数据:直奔 §7 获取与许可——注意三层异构:影像在 TCIA/Synapse,患者级临床数据在 CBTN 门户与 NCI Cancer Data Commons,测试集标签谁都不给(坑 5)。
- 关心"464 还是 457 还是 348":直奔 §2 与坑 1——三个数字各有所指,混用会被审稿人抓住。
- 做挑战赛复现或报名:直奔 §4 赛制与冠军榜 + §6 AI-Ready 指南——lesion-wise 双指标与"禁用额外数据"条款直接决定方案上限。
§0 导读:这个数据集解决什么问题
儿童中枢神经系统(CNS)肿瘤是儿童癌症死亡的首要原因,而在所有儿童脑肿瘤中,预后最残酷的一类恰好也是数据最稀缺的一类。儿童高级别胶质瘤(pediatric high-grade glioma, pHGG)5 年生存率不足 20%;弥漫中线胶质瘤 H3K27M 变异型(DMG,其脑桥形态即 DIPG,弥漫内生型脑桥胶质瘤)中位生存不足一年,几乎无长期生存者。发病率低(pHGG 约占儿童 CNS 肿瘤的一到两成)、治疗中心分散、单中心十年攒不满一个像样的队列——这是全球儿科神经肿瘤影像研究共同面对的"数据荒"。成年人可以在 BraTS 上用 1,500+ 例训练一个分割模型,儿科研究者却长期只能拿几十例的院内数据"小锅炒"。
BraTS-PED 的回答是联盟化汇集 + 标准化竞赛。2022 年起,MICCAI BraTS 组委会与北美儿科肿瘤数据联盟合作,把分散在 CBTN(Children’s Brain Tumor Network,儿童脑肿瘤网络)、CONNECT 联盟、DIPG/DMG Registry(DIPGR)、Boston Children’s Hospital 与 Yale University 五个来源的术后-术前 mpMRI 存档汇集起来,按成人 BraTS 已验证的流水线(共配准、1 mm³ 重采样、去识别、统一 NIfTI 格式)规范化,再按儿科工作组的四区标注协议(依据 RAPNO 反应评估工作组的推荐,区别于成人三区)由神经放射专家标注。2023 年首届儿科赛道(BraTS-PED 2023)发布即配套论文(arXiv:2305.17033);2024 届在数据组成大幅重叠的基础上扩充并更新论文(arXiv:2404.15009);2025 届并入 BraTS-Lighthouse 2025 框架,成为其 Task-6,训练集换血为 256 例并继续盲评。
这个数据集对三类人有直接价值。对分割算法研究者,它是唯一的儿童脑肿瘤大规模"同尺竞赛":lesion-wise Dice 与 lesion-wise HD95 双指标、MedPerf 容器化盲评、禁止额外数据预训练的公平条款,让方法比较真正可比。对儿科临床研究者,它是罕见的可以横跨四个中心做影像-结局联合建模的公开影像库——数据目录携带总生存(OS)与无进展生存(PFS)变量(注意:这是数据变量而非挑战赛任务,坑 2)。对AI 医疗工程团队,它提供了一套儿科专用的隐私处理范式(区别于成人 skull-strip 的专用 defacing 流程)与完整的预处理-评测开源底座(CaPTk、FeTS、Synapse、MedPerf),可直接复用为院内数据管线的模板。
§0 读法三则:
- 这个条目讲的是"一个数据集、三届比赛、三层数字":464/457/348 三个规模口径各有所指(§2 存照),261/91/86 的拆分又与它们对不上(坑 6)——数字打架不是笔误,是数据集跨平台分发的固有形态。
- 任务定义核验结论先行:三届赛道均为纯分割任务,官方挑战赛层面没有生存预测赛道;"生存预测"出现在成人 BraTS-GLI 赛道与部分衍生研究里,别把成人赛道的任务说明书搬到儿科(坑 2)。
- 标注体系是"儿科四区"(ET/NET/CC/ED),与成人 BraTS 的三区(NCR/ED/ET)不同构,直接把成人标注映射代码套过来会静默出错(坑 3)。
0.1 三条使用原则(先于一切细节)
- 引用三件套:任何正式产出(论文/报告/产品文档)同时引用数据 DOI(10.7937/DX5C-TJ86)与两篇 arXiv 论文(设计 2404.15009 + 结果 2407.08855)——单引其一都是不完整引用;
- 届次意识:本数据集以"届"为版本单位演化(2023/2024/2025 三届标签空间与训练集均不同),任何复现与比较先声明届次;
- 任务边界:分割是唯一官方任务,生存结局在元数据层——越界使用要显式声明为扩展实验(§4.8 句式)。
§1 数据集速览:十问十答
Q1:BraTS-PED 的数据从哪来?
2024 届论文口径下,患者来源共 464 例,来自四个渠道:儿童脑肿瘤网络 CBTN 120 例、DIPG/DMG Registry(DIPGR)256 例、Boston Children’s Hospital 61 例、Yale University 27 例。CBTN 与 CONNECT 提供多中心协作网络与数据治理,DIPGR 队列(256 例来源)是本数据集最大特色——弥漫中线胶质瘤/脑桥胶质瘤的公开影像在全球范围内屈指可数,这一队列直接把"最难做研究的肿瘤"变成了主力板块。
Q2:为什么有的文章说 464,有的说 457,TCIA 上又只有 348?
三个数字各有所指:464 是 2024 论文的患者来源总数;457 是 NCI CCDI(Cancer Data Commons)目录里带临床 metadata 的例数;348 是 TCIA 影像收藏里实际放行的受试者数(1,649 个 series,32.7 GB)。差异来自跨平台分发:部分患者影像走 CBTN 自有通道未入 TCIA,或临床 metadata 覆盖与影像放行不同步。引用时务必写明口径(坑 1)。
Q3:图像规格是什么?
每例四序列 mpMRI:T1w、T1CE(T1 对比增强)、T2w、T2-FLAIR。经官方 BraTS Pipeline 处理后为 1 mm³ 各向同性重采样的 NIfTI,共配准到 SRI24 图谱空间,并经儿科专用 defacing 流程去识别。标注为单标签体素图 NIfTI,数值编码随 BraTS 2024 约定。
Q4:标注怎么定义的?和成人 BraTS 一样吗?
不一样,这是本数据集最重要的方法学特征。成人 BraTS 用三区:NCR(坏死核心)、ET(强化肿瘤)、ED(瘤周水肿)。儿科赛道按 RAPNO 工作组推荐改用四区:ET(强化肿瘤)、NET(非强化肿瘤)、CC(囊性成分)、ED(水肿)。组合标签为 TC=ET+NET+CC(肿瘤核心)与 WT=全肿瘤(ET+NET+CC+ED)。儿科肿瘤囊变、非强化成分远比成人常见,"NET 与 CC 单列"正是为了匹配儿童肿瘤的影像生物学(坑 3)。
Q5:任务到底是什么?有没有生存预测?
三届赛道均为纯分割任务:输入四序列 MRI,输出 ET/TC/WT 等亚区域的体素级预测,以 lesion-wise DSC 与 lesion-wise HD95 双指标盲评。挑战赛层面没有生存预测赛道——"方向性生存预测"是成人 BraTS-GLI 赛道的任务,网络资料常把两者混为一谈(坑 2)。不过数据本体的临床目录确实携带 OS/PFS 结局变量,做影像-生存联合建模研究可以直接取用(经 CBTN/NCI CDC 申请)。
Q6:训练/验证/测试怎么拆的?
2024 届挑战赛口径:训练 261 例、验证 91 例、测试 86 例。注意 261+91=352 与 TCIA 放行的 348 差 4 例、三段和 438 与 464 差 26 例,官方未给出逐例映射表(坑 6)。测试集标签完全不公开, submissions 以容器提交到 MedPerf 平台盲评。2025 届(BraTS-Lighthouse Task-6)训练集为 256 例,测试集例数未在公开页面披露。
Q7:用什么指标排名?历年冠军是谁?
官方双指标:lesion-wise Dice Similarity Coefficient(DSC)与 lesion-wise 95% Hausdorff Distance(HD95),先按病例级"病灶"为单位计算再聚合,比传统的切片/全局 Dice 更抗小病灶失分。冠军榜(官方 BraTS Orchestrator GitHub 汇总):2023 年第 1 名 Daniel Capellán-Martín(MGH/HMS,MedNeXt 变体);2024 年第 1 名 Mehdi Astaraki,第 2 名 Tim Mulvany,第 3 名 Sarim Hashmi;2025 年第 1 名 Yuxiao Yi(测试集 WT 92.6%、TC 91.8%),第 2 名 Meng-Yuan Chen,第 3 名 Haitao Yu。注意验证榜与测试榜冠军可以是不同团队(坑 7)。
Q8:license 是什么?能商用吗?
主口径为 CC BY 4.0——TCIA 收藏页(DOI 10.7937/DX5C-TJ86)明确标注。但要注意三点:Synapse 托管的挑战赛版需要注册账号并签署数据使用协议(DUA);患者级临床数据的获取需经 CBTN 门户 / NCI Cancer Data Commons 的项目审批;HuggingFace 上有第三方镜像页面自称 CC BY-NC 4.0,与官方冲突,商用前必须回到官方渠道核实(坑 4)。
Q9:数据是原始 DICOM 还是预处理过的?
挑战赛分发版是预处理后的:共配准 → 1 mm³ 重采样 → defacing → 质控,全部由官方 BraTS Pipeline(CaPTk + FeTS 组件)完成,开箱即训。TCIA 收藏另有原始采集层级的归档。官方 FAQ 明示了 4 例已知问题病例(如 BraTS-PED-00024-000 颅骨未剥离),并要求不要在论文中把它们当作模型失败案例引用(坑 8)。
Q10:和库内其他条目什么关系?
它是库内 BraTS 家族的儿科分支:brats(成人主赛道, Glioma/Adult)是它方法学上的"父模板";brats-africa 是同一范式在资源受限环境的改编;fets 提供了它预处理流水线的联邦学习姊妹项目;upenn-gbm 是成人胶质瘤的影像-生存同门。四区标注、儿科 defacing、DIPG 队列是它区别于所有这些"亲戚"的三张名片。
1.5 数据集名片(一屏速览)
| 项目 | 内容 |
|---|---|
| 正式名 | The Brain Tumor Segmentation in Pediatric Magnetic Resonance Imaging (BraTS-PEDs) |
| 挑战赛冠名 | CBTN-CONNECT-DIPGR-ASNR-MICCAI BraTS-PEDs(2023/2024);BraTS Lighthouse 2025 Task-6 PED(2025) |
| 主办机构 | 宾夕法尼亚大学、儿童国家医院、Sage Bionetworks 等,作者 70+ |
| 病种 | 儿童高级别胶质瘤(HGG)、弥漫中线胶质瘤(DMG)、DIPG |
| 规模(主口径) | 464 例患者:训练 261 / 验证 91 / 测试 86 |
| 数据形态 | 四序列 mpMRI(T1/T1CE/T2/T2-FLAIR),NIfTI,1mm³,SRI24 配准,defaced |
| 标注 | RAPNO 四区(ET/NET/CC/ED)+ 派生 TC/WT;半自动预分割+人工精修+神经放射科终审 |
| 任务 | 纯分割(lesion-wise DSC + HD95);无生存预测子任务(元数据含 OS/PFS) |
| License | CC BY 4.0(TCIA 官方,DOI 10.7937/DX5C-TJ86) |
| 主托管 | TCIA(32.7 GB)+ Synapse(syn53708249 / syn64153130)+ CBTN + NCI CDC |
| 三届冠军 | 2023 Capellán-Martín / 2024 Astaraki / 2025 测试榜 Yi、验证榜 Li |
| 最新 SOTA | 2025 测试集:WT 92.6 / TC 91.8 / CC 62.7(Dice %) |
| 库内家族 | brats (rid 24)、brats-africa (rid 683)、本条目 |
| 抓取时点 | 2026-09-27 |
§2 数据构成与规格
2.1 规模、拆分与三个口径
BraTS-PEDs 的规模数字是检索者的第一个必修课——同一个数据集在三个权威位置给出三个不同的总数,且各有出处:
| 口径 | 数字 | 出处 | 含义 |
|---|---|---|---|
| 挑战赛论文口径 | 464 例患者 | arXiv:2404.15009;PLOS ONE (2025) 0323398;arXiv:2412.04094 三源一致 | 挑战赛队列全部儿科 HGG 患者(含测试集) |
| TCIA / NCI CCDI 元数据口径 | 457 例 | TCIA challenge metadata TSV(457 条);CCDI 目录 “Number of Cases 457” | 正式发表的数据集元数据覆盖数 |
| TCIA 图像托管口径 | 348 subjects / 1,649 series | TCIA 收藏页 Images (Training and Validation) 行 | 实际可下载的图像 subject 数(训练+验证) |
三个口径的差值官方没有给出统一对账表。464 是挑战赛论文中拆分到机构的可验证数字(120+256+61+27=464,严丝合缝),本条目以 464 为主口径;457 与 348 在引用时须注明出处与口径。348 与"训练 261+验证 91=352"之间差的 4 例,恰好 TCIA 页披露了 4 例已知质量问题案例,但是否同一批未有官方说明——不要替官方圆这个数。
挑战赛内部的三段拆分(arXiv:2412.04094 是目前唯一把三个数字写齐的来源):
- 训练集 261 例:mpMRI + 专家标注,参赛者可自由下载训练;
- 验证集 91 例:仅 mpMRI 无标注,可多次向在线平台提交预测;
- 测试集 86 例:影像与标注都不发布,参赛者上传容器化算法,由 Synapse/MedPerf 平台在受控环境盲评,永不公开。
261+91+86=438,比 464 少 26 例。差额部分的归属(是否为质量筛除、注册对齐失败或从未进挑战流程的储备数据)没有任何官方文件解释。引用规模时建议写"464 例挑战赛队列(训练 261/验证 91/测试 86)"并让读者看到这个差额,而不是静默取整。
2.2 机构来源与入组标准
464 例的机构构成(arXiv:2404.15009 明确四家来源):
- International DIPG/DMG Registry:256 例(55%)——国际 DIPG/DMG 登记库,弥漫中线胶质瘤专病登记,占比过半决定了整个数据集以脑干/中线病变为显著特色;
- CBTN(Children’s Brain Tumor Network):120 例(26%)——儿童脑肿瘤网络,2011 年起运行的北美多中心儿科神经肿瘤数据协作体;
- Boston Children’s Hospital:61 例(13%);
- Yale University:27 例(6%)。
入组标准(2024 届设计论文原文):
- 组织学确认的高级别胶质瘤(高级别星形细胞瘤、DMG),或影像学/组织学证实的 DIPG;
- 治疗初(treatment-naive)成像时四序列结构 MRI 齐全。
排除标准:影像质量低或伪影严重到无法可靠分割者;月龄不足 1 个月的婴儿。
这个入组框定了数据集的适用边界:只有儿童 HGG 谱系,没有低级别胶质瘤、没有髓母细胞瘤等其他儿科肿瘤。论文讨论部分明确预告未来会扩展更多组织学与术后影像,但截至 2025 届仍是治疗初 HGG 专用。
2.3 影像规格与统一预处理
每例四个序列:T1 平扫(T1)、T1 钆增强(T1CE/T1-Gd)、T2 加权(T2)、T2-FLAIR。这是脑肿瘤分割的标准四件套,与成人 BraTS 完全对齐,便于跨赛道迁移模型。
原始扫描来自不同机构、不同厂商、不同协议——论文直言"image acquisition protocols and MRI equipment differ across different institutions, resulting in heterogeneity in image quality"。数据集发布前统一走了一遍"BraTS Pipeline"(公开实现于 CaPTk 与 FeTS 工具):
- DICOM→NIfTI 转换,转换过程剥离 DICOM 头中的受保护健康信息(PHI)完成去标识;
- 仿射配准到 SRI24 模板(SRI24 atlas 在 Zenodo 公开,也是 BraTS 儿科赛道的标准配准模板);
- 重采样至 1mm³ 各向同性体素;
- 儿科专用自动 defacing——注意这是儿童特调工具(d3b-center/peds-auto-defacing-public),成人 defacer 直接用在儿童头上效果不佳,这也是 2025 届"保留非颅骨剥离图像"难点的技术背景。
预处理完成后单病例约含四个 NIfTI 体积 + 一个分割掩码,TCIA 整包下载 32.7 GB(需 IBM Aspera Connect 插件,浏览器直连下载不可用——这是实操层面的第一个摩擦点)。
2.4 标注体系:RAPNO 四区 + 两个组合标签
这是 BraTS-PEDs 相对成人 BraTS 最需要认真对待的差异。成人 BraTS 体系的三个标注子区域是坏死/非强化核心(NCR)、瘤周水肿(ED)、强化肿瘤(ET);儿科 2024 届起改用 RAPNO(Response Assessment in Pediatric Neuro-Oncology)工作组推荐的高级别胶质瘤/DIPG 疗效评估分区:
| 标签 | 全称 | 定义要点 |
|---|---|---|
| ET | enhancing tumor(强化肿瘤) | T1CE 上强化的肿瘤区域 |
| NET | non-enhancing tumor(非强化肿瘤) | T1/T1CE 低信号的非强化肿瘤实质 |
| CC | cystic component(囊变成分) | 肿瘤囊变区域 |
| ED | edema(水肿) | 瘤周水肿/浸润区 |
| TC | tumor core(肿瘤核心) | ET+NET+CC 的简单二值合并 |
| WT | whole tumor(整体肿瘤) | ET+NET+CC+ED 的简单二值合并 |
两个关键理解点:
第一,NET 与 CC 的拆分是儿童特需。 DIPG/DMG 的典型影像表现是弥漫浸润、囊变混合,"非强化"部分里分清肿瘤实质与囊变直接影响放疗靶区与疗效判定,成人体系的 NCR 粗颗粒到儿科场景不够用。2024 届设计论文把这称为相对 2023 届的"processing pipeline and tumor subregions"核心改动。
第二,TC/WT 是派生标签而非独立标注。 论文明确这两个组合是子区域掩码的"简单二值相加"。这意味着六个指标的误差不是独立的:ET/NET/CC/ED 的错误会同时传导进 TC/WT。读排行榜时 WT/TC 高分不代表四个子区域都好——2025 届测试集冠军成绩 WT 92.6% 而 CC 只有 62.7%,差出 30 个百分点,就是例证。
标注生产采用半自动流水线(详见 §3),测试集按 BraTS 2024 总规程执行双人独立标注以评估 inter-rater reliability。
2.5 已知质量问题案例(TCIA 官方披露)
TCIA 收藏页直接列出了 4 例已知问题,检索者在下游使用前应主动核对这些 ID:
- BraTS-PED-00024-000(训练集):整例图像已被颅骨剥离(skull-stripped)——与全体"保留颅骨"的口径不符;
- BraTS-PED-00098-000(训练集):仅 t1c 序列被颅骨剥离;
- BraTS-PED-00281-000(验证集):方向与其他数据不同;
- BraTS-PED-00287-000(验证集):头部倾斜。
2025 届挑战赛干脆把"真实世界数据杂质"(以非颅骨剥离图像为代表的 non-skull-stripped 情况)列为官方难点之一——参赛论文里反复出现先在干净数据上训练、再在杂质数据上微调的三段式策略。换句话说:脏数据在这里不是缺陷,而是被官方确认的基准特性,写鲁棒性论文时这是一个可以引用的官方口径。
2.6 与 2025 届数据的关系:不是简单的年份滚动
2025 届(BraTS Lighthouse 2025,Task-6 PED)的训练集是 256 例(Macquarie 参赛论文口径),比 2024 届的 261 例还少 5 例。这说明两届数据集并非简单滚动扩容:2025 届对训练集做了清洗/调整,并系统性地引入了前述"非颅骨剥离"的真实世界杂质。检索者复现 2025 届论文时务必确认自己下载的是哪一届的训练集(Synapse 2024: syn53708249;2025: syn64153130),混用两届数据做"复现"会出现对不上论文数字的悬案。
另外,2025 届"officially scored, unseen validation set (n = 91)"(Springer LNCS 参赛论文口径)与 2024 届验证集 91 例数字相同,两届是否复用同一批验证数据没有官方确认——本条目存照不下结论。
2.7 元数据层:随包下载的两份 TSV 与临床变量
除影像与掩码外,TCIA 包内还有两份 TSV 元数据,这是做队列分析或多组学联动的原料:
- 成像元数据 TSV(58 KB,112 studies 粒度):采集参数等影像学元信息;
- 挑战赛元数据 TSV(30 KB,457 条记录):人口学与挑战相关变量——注意 457 这个口径数字正是从这里来的。
NCI CCDI 目录对数据内容给出的官方描述值得整段记住:“multiparametric structural MRI, expert tumor segmentations, imaging acquisition parameters, demographic variables, and clinical outcomes such as overall and progression-free survival”(多参数结构 MRI、专家肿瘤分割、成像采集参数、人口学变量、以及总体生存与无进展生存等临床结局)。CCDI 的核心数据元素页还给出:457 例全部为 High-Grade Glioma 诊断、年龄均为儿童及青年(<40 岁)、性别/种族/族裔在公开层均为"Not Reported"——这是去标识化处理的直接体现,做亚组分析前先确认公开元数据的粒度上限。
对生存研究者的提示再强调一次:OS/PFS 变量的存在是在数据目录描述层确认的,挑战赛公开包对这些变量的呈现粒度(逐例数值 vs 摘要)应以实际下载的 TSV 为准;更深层的临床数据(治疗、分子分型等)需要走 CBTN 数据访问流程另行申请,与本数据集公开包是两条通道。
2.8 三届规格对照总表
| 维度 | 2023 届 | 2024 届 | 2025 届(Lighthouse Task-6) |
|---|---|---|---|
| 挑战赛定位 | 首个儿科 BraTS 赛道 | 续办,标注体系切换 | 并入 BraTS Lighthouse 矩阵 |
| 训练集 | —(未获独立口径确认) | 261 例 | 256 例(含非颅骨剥离杂质) |
| 验证集 | — | 91 例 | 91 例(是否复用存照待核) |
| 测试集 | 不公开 | 86 例 | 不公开 |
| 标注体系 | 近成人式分区 | RAPNO 四区(ET/NET/CC/ED) | 沿用 2024 四区 |
| 主要 Synapse | syn51156910(下载 syn51514108) | syn53708249 | syn64153130 |
| 设计论文 | arXiv:2305.17033 | arXiv:2404.15009 | Lighthouse 论文集(LNCS) |
| 结果论文 | arXiv:2305.17033 系 | arXiv:2407.08855 | LNCS ISBN 978-3-032-16365-3 |
读这张表的三个落点:①复现任何一届论文前先对表确认届次;②标注语义以 2024 为分界线,2023 届掩码不可与 2024 后混算;③"验证集 91"跨 2024/2025 两届数字相同,但两届是否同一批数据无官方确认,保守做法是按届各取各的。
2.9 四序列信号特征速查(读片与建模对照)
| 序列 | 典型信号行为 | 对哪个标签最有信息量 |
|---|---|---|
| T1 平扫 | 解剖参考;肿瘤实质多为低信号 | NET(低信号肿瘤实质) |
| T1CE(钆增强) | 血脑屏障破坏处强化(高信号) | ET(强化即 ET 的定义域) |
| T2 | 水分敏感;囊变与水肿均高信号 | CC(囊变 T2 明显高信号)与 ED |
| T2-FLAIR | 抑制自由水后,结合水病变仍高信号 | ED(水肿/浸润带)与浸润性肿瘤边界 |
四条实用推论:①ET 的检测本质上是"看 T1CE",DIPG 常常不强化,所以 DIPG 病例 ET 标签缺失多为真实病理而非标注错误;②CC 与 ED 在 T2 上都亮,区分靠形态(囊变有占位感与边界、水肿呈指状浸润)——这正是 CC 难自动化的影像学根源;③NET 与 ED 的区分需要 T1+FLAIR 交叉(T1 低 + FLAIR 高且非囊性 → 倾向 NET);④模型输入做序列 dropout 消融时,去掉 T1CE 会重创 ET、去掉 FLAIR 会重创 ED/WT——可用来验证数据加载正确性。
2.10 人口学粒度的正确理解
CCDI 目录显示 457 例在公开层性别/种族/族裔均为 “Not Reported”、年龄仅以"儿童及青年(<40 岁)"分层。这不是数据缺失,而是去标识化设计:这三种属性组合在罕见病小队列里是强再识别风险因子(k-匿名原则下的主动抑制)。研究者的对策:需要人口学细粒度的研究(如年龄分层分析),公开元数据大概率不满足,应规划 CBTN 数据访问通道,并在论文里说明公开层粒度限制;只做影像建模的研究则不受影响。
§3 标注流水线:半自动预分割 + 神经放射科终审
3.1 三步生产链
BraTS-PEDs 的标注不是纯手工逐层画出来的,论文描述的生产链是"半自动分割 → 迭代精修 → 专家终审"三步:
- 算法预分割:用儿科自动分割方法(即上文 d3b-center 儿科分割流水线,peds-brain-seg-pipeline-public)对每例生成 ET/NET/CC/ED 四子区域初稿——先让算法干粗活;
- 人工迭代精修:标注员在预分割基础上逐层修正、编辑标签,处理囊变边界、强化边缘等算法易错区;
- 专家终审:由有经验的神经放射科医生(neuroradiologists)逐例审核定稿,ASNR(美国神经放射学会)作为专业学会参与了大部分数据的标注审核协作。
这套"算法打底 + 人力精修 + 专家把关"的模式,与成人 BraTS 2024 各赛道(自动预分割 + 神经放射科医生精修批准 + 高级医生审核)以及库内 panda-plus 条目的"学生注释 + 高年级复核 + 专家终审"三层流水线在结构上同构,但省掉了从零注释的人力成本——预分割算法本身就是数年 BraTS 生态的产出。
3.2 为什么预分割打底对儿童数据格外重要
儿童脑瘤标注的人力账比成人更贵:DIPG/DMG 病变弥漫、边界模糊,四序列交叉判读的难度高;而符合资质的儿科神经放射科医生本来就是稀缺资源。把初稿交给算法、把专家时间留给仲裁与定稿,是在"稀缺专家 × 弥漫病变"约束下的理性配置。
这也解释了标注的另一个设计:测试集双人独立标注。在专家稀缺的前提下,一致性评估只留给决定名次的测试集——训练集标注走效率优先的单人定稿流程(预分割打底后专家终审),测试集走双盲流程评估 inter-rater reliability。两套流程的成本分配本身就是这个数据集方法学上值得学习的一点。
3.3 标注的可追溯性边界
需要如实告知检索者的边界:逐例标注者身份、每位标注者的经验年限、标注耗时等明细未公开。可考证的是"半自动 + 人工精修 + 神经放射科终审"的流程描述、ASNR 的组织性参与、以及测试集双人独立标注的规程。这与部分数据集(如 panda-plus 有完整的人员结构与工时记录)相比,标注过程元数据的透明度是偏简的。做标注质量研究(如一致性建模)时,可用的公开信息主要是最终掩码本身与测试集双标规程,而非人员级元数据。
3.4 与成人标注体系的迁移注意
把成人 BraTS 训练的模型或标注习惯直接迁移到本数据集,会踩三类标签语义差:
- 成人 NCR(坏死)与儿科 NET(非强化肿瘤)定义不同——成人的 NCR 主要对应 T1/T1CE 双低信号的坏死核心,儿科 NET 是"非强化的肿瘤实质",病理内涵更宽;
- 儿科新增 CC(囊变成分)——成人体系没有这个独立标签,囊变多被并入 NCR 或水肿处理;
- 水肿标签的边界行为不同——DIPG 的"水肿"与浸润肿瘤常常分不开,ED 在儿科的语义比成人更模糊。
如果目标是把成人预训练模型迁移过来,最省事的做法是先重读 RAPNO 的疗效评估定义文档,再对标签做一次语义映射审查——直接按标签编号硬对齐(0/1/2/3 对号入座)是复现失败的经典来源。
3.5 六标签的临床语义与建模范式差异
把六个标签放回临床语境,理解它们各自"难在哪、值多少":
| 标签 | 临床意义 | 建模范式要点 |
|---|---|---|
| ET | 强化肿瘤≈血脑屏障破坏的活动性病灶,化疗/放疗反应最敏感的观察窗 | T1CE 通道主导;DIPG 常无强化,样本内方差大 |
| NET | 非强化肿瘤实质,与浸润进展相关 | T1 平扫低信号+T2/FLAIR 信号综合判断,易与水肿混淆 |
| CC | 囊变成分,儿童 DMG 常见的囊性退变 | 边界过渡带模糊,是 2025 冠军成绩最低的区(62.7%) |
| ED | 瘤周水肿与浸润的混合体 | FLAIR 主导;语义天然模糊,宁可理解为"非核心异常区" |
| TC | 手术/放疗靶区最关心的"实体核心" | 派生标签,误差由三个子区传导 |
| WT | 肿瘤整体负荷,疗效评估的总账 | 派生标签,最容易做高(2025 冠军 92.6%),单独引用意义有限 |
由此得出两条读榜单的规矩:第一,比较两篇论文时只对子区域(ET/NET/CC/ED),TC/WT 是派生量、分辨率低;第二,模型选型/论文宣称进步时,看 CC 和 ET 的改善幅度才有含金量——WT 从 91% 到 92% 的叙事在儿科赛道是廉价叙事。
3.6 标注质量的自查建议(拿到数据后的第一小时)
结合 TCIA 披露的已知问题与预处理口径,建议每个新拿到数据的团队先跑一遍五步自查:
- 核对问题案例:BraTS-PED-00024-000、00098-000(颅骨剥离)、00281-000(方向)、00287-000(倾斜)四例先定位,决定剔除还是特判;
- 抽验配准:随机抽 20 例叠加掩码目视检查 SRI24 对齐——若你打算换模板或重配准,先确认原始对齐质量;
- 检查标签完整性:扫描全部训练掩码的标签值域(是否只含预期整数标签),统计六区逐例出现率——DIPG 病例 ET 缺失可能是真实病理(无强化)而非标注遗漏,需要结合临床背景判断;
- 体素间距确认:确认名义 1mm³ 与文件头实际 spacing 一致(迁移到自定义流水线时最易被忽视);
- 届次标记:若同时持有 2024(261 例)与 2025(256 例)训练集,在文件系统层显式分目录并做差集——两届的差集本身就是"官方清洗了什么"的线索。
这五步的直接成本约一到两小时,换来的是后续所有实验的口径确定性——对儿科这种"每个病例都珍贵"的队列,混入一例口径错误的样本代价远高于成人大数据集。
3.7 衍生标注/模型的发布声明清单
基于本集训练模型或再标注后发布产出时,随包声明建议包含(对照官方文档可全部溯源):
- [ ] 数据来源:BraTS-PEDs(TCIA DOI)+ 届次(2024 V1 / 2025 Lighthouse);
- [ ] 所用拆分:训练/验证使用范围(是否触碰验证集训练,见 Q47);
- [ ] 标签声明:六区域语义(§2.4 表),标注体系届次(RAPNO 四区自 2024 起);
- [ ] 预处理声明:官方 BraTS Pipeline 已内建;自行追加的预处理逐项列出;
- [ ] 已知问题处理:官方 4 例问题案例的处理方式(剔除/保留及理由);
- [ ] 评估口径:lesion-wise DSC/HD95 + 官方评估包版本;自建指标须声明差异;
- [ ] license 传递:衍生数据 CC BY 4.0 署名;模型许可独立声明(建议 CC BY 4.0 对齐);
- [ ] 局限声明:队列以 DIPG/DMG 为主(55%),外推边界(§6.7)。
§4 挑战赛设计与三年战况
4.1 任务定义:三届一贯的纯分割
2023、2024、2025 三届的任务定义完全一致:输入四序列 mpMRI,输出六个区域(ET/NET/CC/ED/TC/WT)的体积分割。这里必须正面回应一个高频误解——
BraTS-PEDs 没有生存预测子任务。“方向性生存预测”(survival prediction)是 BraTS 成人胶质瘤赛道(BraTS-GLI/BraTS-Africa 系)的任务设计,儿科赛道从 2023 年首届设计论文到 2025 届规程,任务始终只有分割。容易混淆的原因有二:一是数据集元数据层确实携带总体生存(OS)与无进展生存(PFS)结局变量(NCI CCDI 目录明言 “clinical outcomes such as overall and progression-free survival”),做生存建模研究的人在数据层面确实能找到原料;二是 2025 届参赛论文会提到"分割精度支撑生存预测的预后建模"作为临床动机——动机是动机,任务是任务,两者在挑战赛规程里是两回事。
做一个"能上挑战赛排行榜"的模型,参赛者只能用训练集数据训练(2024 设计论文明确禁止使用任何额外公开/私有数据与预训练模型),容器化提交后由平台在测试集盲评。论文发表阶段可以补充外部数据实验,但必须单列挑战赛数据成绩并讨论差异。
4.2 三阶段流程与评估指标
挑战赛三阶段(2024 届设计):
- 训练阶段:发放训练集(影像+标注),参赛者开发模型;
- 验证阶段:训练数据发放约三周后发放验证集(无标注),可多次提交在线评测,成绩用于撰写 MICCAI LNCS 短文;验证阶段头部队伍受邀在 MICCAI 年会 BraTS 环节做口头报告;
- 测试/排名阶段:提交容器化算法,平台在 withheld 测试集上评估排名,MICCAI 年会公布最终名次。
2024 届的在线评测三件套:CaPTk(本地桌面工具)、FeTS 前端、Synapse 在线平台(syn53708249,powered by MedPerf 评测框架)。
评估指标沿用 BraTS 2024 家族统一标准:
- lesion-wise DSC:按病灶(lesion)逐个计算 Dice 相似系数再聚合——真负体素不计入,避免大病灶主导评价;
- lesion-wise HD95:95 分位 Hausdorff 距离,压 outlier 后度量表面距离误差(毫米);
- 多维排名:对 DSC 与 HD95(按区域聚合)的各维排名求和定总名次——单一维度好看救不了总榜。
4.3 三届冠军榜(官方 BraTS 包口径)
官方 Python 包(GitHub: Astarakee/BraTS,维护者即 2024 届冠军 Astaraki 本人)收录的儿科赛道历届前三:
| 届次 | 第 1 名 | 第 2 名 | 第 3 名 |
|---|---|---|---|
| 2023 | Daniel Capellán-Martín et al. | Andriy Myronenko et al. | Yubo Zhou |
| 2024 | Mehdi Astaraki | Tim Mulvany et al. | Sarim Hashmi et al. |
| 2025 | Yuxiao Yi et al. | Meng-Yuan Chen et al. | Haitao Yu et al. |
2025 届额外值得记录的双榜现象:验证榜第一与测试榜第一是不同团队——验证榜第一是 Xiaolong Li 团队(上海交大,改进 nnU-Net:加宽残差编码器 + SE 注意力 + 深度可分离卷积,验证集 Dice TC/WT 0.928),测试榜第一是 Yuxiao Yi 团队(同为上海交大,nnU-Net + Swin UNETR + HFF-Net 频域集成)。验证榜登顶不等于测试榜夺冠,引用 2025 届"冠军"时必须说清是哪个榜。
4.4 2025 届测试集冠军成绩单
Yuxiao Yi 团队(Frequency-Aware Ensemble Learning)在 2025 届未见测试集上的 lesion-wise Dice:
| 区域 | Dice |
|---|---|
| WT(整体肿瘤) | 92.6% |
| TC(肿瘤核心) | 91.8% |
| NET(非强化肿瘤) | 85.7% |
| ED(水肿) | 83.2% |
| ET(强化肿瘤) | 72.9% |
| CC(囊变成分) | 62.7% |
这组数字是理解儿科分割难度的最好切片:WT/TC 冲上 92% 的同时,CC 只有 62.7%、ET 72.9%——囊变边界与稀疏强化依然是儿科赛道远未解决的硬骨头。DIPG/DMG 的囊变成分形态不规则、边界过渡模糊,是六区里公认最难的一个;做方法改进的研究者,CC 就是主攻方向,这也是各届参赛论文花大篇幅设计增强策略与后处理的原因。
参赛论文共识的三大技术难点:①ET 在 DIPG 中稀少(强化少是 DIPG 病理特性);②CC 边界不规则;③机构间成像异质(2025 届再叠加非颅骨剥离杂质)。主流方案基座是 nnU-Net 及其残差编码器变体,差异化竞争集中在注意力机制、频域分解、多模型集成与针对杂质的域适应。
4.5 从 2023 到 2025 的演进线索
- 2023(首届):确立儿科赛道,标注沿用较接近成人的体系,证明多联盟儿科队列+挑战赛模式的可行性;
- 2024(换标注):标注体系切换到 RAPNO 四区(新增 NET/CC 拆分),处理流水线升级,数据扩到 464 例,结果论文 arXiv:2407.08855;数据集正式登陆 TCIA(2025/12/19 Version 1);
- 2025(入 Lighthouse + 加杂质):并入 BraTS Lighthouse 2025(Task-6),训练集调至 256 例,官方引入非颅骨剥离等真实世界杂质作为基准特性,评测平台迁移至 syn64153130。
给检索者的实用推论:复现 2024 届论文用 syn53708249/TCIA,复现 2025 届论文用 syn64153130,两者训练集不同(261 vs 256),标注体系以 2024 届 RAPNO 四区为分界——2023 届的标签语义与 2024 之后不可直接混用。
4.6 2025 届参赛技术路线抽样总表
2025 届 LNCS 论文集里可考的儿科赛道方案,一表看尽当前 SOTA 的构成套路:
| 团队 | 架构基座 | 差异化设计 | 公开成绩 | 排名口径 |
|---|---|---|---|---|
| Yuxiao Yi et al.(上海交大) | nnU-Net(γ=0.7)+ Swin UNETR + HFF-Net | 可调初始化规模、BraTS 2021 预训练迁移给 Swin UNETR、频域分解分离组织轮廓与纹理 | 测试集 Dice:WT 92.6 / TC 91.8 / NET 85.7 / ED 83.2 / ET 72.9 / CC 62.7(%) | 测试榜第 1 |
| Xiaolong Li et al.(上海交大) | 改进 nnU-Net | 加宽残差编码器 + SE 注意力、3D 深度可分离卷积、特异性驱动正则、小尺度高斯初始化、两步后处理 | 验证集 Dice:WT 0.928 / TC 0.928 / NET 0.910 / ED 0.967 / ET 0.826 / CC 0.759 | 验证榜第 1 |
| Macquarie 团队(Tavallaii et al.) | 注意力引导 3D U-Net | 多模态+通道注意力、多步肿瘤感知组合增强流水线 | 3 折交叉验证:WT 0.90±0.03 / TC 0.91±0.03 / ET 0.81±0.04 / NET 0.87±0.05 / CC 0.77±0.05 / ED 0.95±0.02;HD95(WT) 8.2±0.5 mm | 训练集自评 |
| LNCS 第 39 章团队 | 三段式 U-Net | 干净数据训练→杂质数据微调→后处理精修(域适应路线) | 验证集 lesion-wise Dice:WT 0.945 / TC 0.944 / NET 0.917,单张消费级 GPU 完成 | 官方计分验证集 |
这张表有四个可操作的读法:
- nnU-Net 仍是万能底座——四个抽样方案里三个以 nnU-Net 为基座,儿科赛道还没有出现"非 U-Net 范式"的胜利;
- 数据策略与模型创新平分秋色——冠军方案的两大支柱之一是"把 2021 成人预训练迁移到儿科"(注意:2025 届规则允许了预训练,与 2024 届"禁预训练"不同,引用规则时注明届次);
- 域适应是 2025 年的显学——非颅骨剥离杂质直接催生了"干净训练→脏数据微调"的三段式,第 39 章团队用单张消费级 GPU 打进官方计分前列,说明该赛道的算力门槛对个人研究者友好;
- CC 是公共洼地——所有方案 CC 成绩都垫底(0.62-0.77),突破 CC 大约等于突破整个赛道的下一个 SOTA。
4.7 三届演进的设计逻辑
把三届放进一条时间线,能看到基准设计者的两难与取舍:
- 2023(建立范式):首届儿科赛道证明"多联盟儿科队列 + BraTS 标准评估"可行。代价是标注体系沿用成人式分区,对 DIPG/DMG 的囊变-浸润混合形态刻画不足。
- 2024(修正语义):切换到 RAPNO 四区(NET/CC 拆分),队列扩到 464 例,结果论文与数据集正式发表跟上。语义修正的代价是与 2023 届标签空间不兼容——两年成绩不可直接纵向比较,这是基准演化必然付出的"断代"成本。
- 2025(引入真实):并入 Lighthouse 矩阵、训练集重整为 256 例、官方引入非颅骨剥离杂质。设计哲学从"干净的实验室基准"转向"带临床噪声的部署预演",同时放开预训练、强调计算效率。
给基准设计者的启示:BraTS-PEDs 三年走完"可行→语义精修→现实化"三步,每一步都付出过兼容性代价(2023→2024 标签断裂、2024→2025 训练集更换)。基准不演化会僵死,演化必然断代——把断代点写进文档(本条目 §2.8 表)是检索者唯一能指望的对账材料。
4.8 与成人生存预测任务的一墙之隔(辨析补记)
"数据集含 OS/PFS 变量"与"挑战赛有生存预测任务"的边界,值得单独一段讲透,因为检索场景里这两个问题总是一起来:
- 成人侧:BraTS 2021-2024 的成人胶质瘤赛道长期设有生存预测子任务(基于影像+临床特征预测 overall survival),"方向性生存预测"类任务设计也出现在成人挑战系——库内 brats 主条目(rid 24)有完整记载。
- 儿科侧:三届 BraTS-PEDs 设计论文的挑战目标均为"volumetric segmentation"(2023 届摘要原词),从未设立生存子任务。组织方在 2023 届论文中引用过 DIPG 临床生存预测模型文献(Jansen et al.),但那是临床背景铺垫,不是任务设计。
- 数据侧:CCDI 目录确认元数据带 OS/PFS。也就是说,原料在、任务无——影像组学生存预测(radiomic survival modeling)完全可以在这个队列上做,只是不会有"官方生存预测排行榜"给你当基准,需要自建交叉验证协议并显式声明非挑战赛口径。
写论文时的安全表述:“BraTS-PEDs 提供带生存结局元数据的儿科 HGG 影像队列,其官方挑战任务为分割;本文的生存分析为非挑战赛扩展实验。”——这样既吃到数据红利,又不越权宣称挑战赛背书。
4.9 排名机制详解:rank summation 为什么防单点作弊
BraTS 家族多维排名的规则是"各指标排名求和"。设某赛道按六个区域 × 两种指标(DSC、HD95)共 12 个榜单分别排名,队伍最终名次 = 12 个名次之和,小者胜。这个设计的防御性:
- 防单区特化:一个只优化 WT 的模型会在 WT 榜拿第 1,但在 CC/ET/NET/ED 各榜崩盘,总排名仍然落后;
- 防指标投机:Dice 高但边界粗糙(HD95 差)的模型与"边界精但漏检"的模型都无法靠单一维度登顶;
- 对检索者的含义:读排行榜要找"总名次",只引用单区单指标成绩容易误导(比如把"某榜 WT 第 1"写成"冠军")。2025 届验证榜/测试榜双榜并存(§4.3)进一步说明引用时必须四要素齐全:届次 × 榜别(验证/测试) × 指标 × 区域。
4.10 参赛决策指南:要不要下场打一届
把"用数据"与"打比赛"分开决策——前者拿到数据即完成,后者是一笔显著的时间/算力投资。下场的判断清单:
适合下场的信号:
- 你的方法创新点与赛道痛点对口(CC 边界、稀疏 ET、杂质鲁棒性——§4.4/§4.6);
- 团队有容器工程能力(盲评提交的是 Docker 化推理,不是预测文件);
- 能接受"仅用赛方数据训练"的约束(2025 届允许预训练,规则按届读);
- 目标产出与 LNCS 论文/ MICCAI 曝光兼容。
不建议下场的信号:
- 只想给论文加一个"参与了国际挑战"的点缀——验证阶段多次提交的成本不低,且不进决赛无排序收益;
- 方法依赖赛外大规模预训练且无法在规则内说明(各届规则不同,先读规程);
- 无 GPU 资源——冠军级方案虽可在消费级单卡训练(§4.6 第 39 章先例),但多折集成与消融的算力预算仍不可忽略。
时间线预算(以 2025 届节奏为参照):训练数据发布后约三周发放验证集,验证期提交窗口数周,随后容器提交与测试盲评;从组队到测试榜出分的现实周期以月计。 最大化验证阶段的提交多样性(不同后处理/集成配置),它是廉价的上分杠杆。
上分杠杆排序(参赛论文共识):①后处理(连通域清理、小病灶策略)几乎白拿分;②多模型集成(nnU-Net 系 + Transformer 系异构集成)稳定加 1-3 个点;③针对 CC 的专用分支/损失设计是拉开差距的地方;④域适应(干净→杂质微调)在 2025 届规则下收益显著。
§5 获取与许可:多平台的门怎么进
5.1 五个入口一张表
| 入口 | 内容 | 许可 | 备注 |
|---|---|---|---|
| TCIA(cancerimagingarchive.net) | 训练+验证图像与掩码(348 subjects/1,649 series,32.7GB NIfTI)+ 元数据 TSV | CC BY 4.0(官方口径) | DOI 10.7937/DX5C-TJ86;下载需 IBM Aspera Connect 插件 |
| Synapse 2024 届(syn53708249) | 挑战赛全套(训练/验证+挑战文档) | 平台注册制 | 2024 届官方大本营;页面登录墙 |
| Synapse 2025 届(syn64153130) | BraTS Lighthouse 2025 Task-6 全套 | 平台注册制 | 2025 届官方大本营 |
| CBTN 门户(cbtn.org) | 部分影像(无标注),可联动基因组/临床数据 | CBTN 数据访问政策 | 适合做多组学 linkage 的团队 |
| NCI Cancer Data Commons | 影像子集(无标注) | NCI 基础设施政策 | 长期保存冗余 |
HuggingFace 的 chehablab/BraTS_PED_2024 是第三方镜像(4.06 GB,NIfTI 转图格式,53,940 个样本条目),方便快速浏览但有两个雷:其一,它自声明 CC BY-NC 4.0 并要求致谢 chehablab.com,与 TCIA 的 CC BY 4.0 冲突——引用许可一律以 TCIA 官方页为准;其二,镜像时间点固定,不随官方更新。
5.2 实操路径建议
想直接训练模型:TCIA 下载训练+验证(Aspera 插件装好,32.7 GB 一次到位),或 Synapse 注册后按届取数据。NIfTI+1mm³+SRI24 配准意味着拿到即可入 nnU-Net 流水线,无需自己做重采样对齐。
想参加挑战赛:Synapse 对应届次项目页注册 → 遵守"仅用训练集训练"的限制 → 验证阶段在线提交 → 测试阶段提交容器化算法。评估平台后端是 MedPerf(MLCommons 的联邦基准框架,Nature Machine Intelligence 2023 有专门论文)。
想调用历届冠军算法:官方 BraTS Python 包一行代码即可(PediatricAlgorithms.BraTS25_1 调用 2025 冠军、BraTS24_1 调用 2024 冠军),适合当强基线。注意冠军算法均标注不支持 CPU 推理。
想做多组学研究:CBTN 门户取无标注影像并联结基因组/临床数据;生存结局(OS/PFS)变量在元数据层,能否取到取决于 CBTN/NCI 通道的数据访问审批,而非 TCIA 公开包本身。
5.3 License 细读与引用义务
TCIA 官方口径 CC BY 4.0:允许商用、允许修改再分发,义务是署名。TCIA 数据使用政策要求的引用格式(检索者直接复制):
Fathi Kazerooni, A., Khalili, N., Liu, X., Jiang, Z., Gandhi, D., Pavaine, J., … Linguraru, M. G. (2025). The Brain Tumor Segmentation in Pediatric Magnetic Resonance Imaging (BraTS-PEDs) (Version 1) [Data set]. The Cancer Imaging Archive. https://doi.org/10.7937/DX5C-TJ86
学术写作中还应同时引用挑战赛设计论文(arXiv:2404.15009)与结果论文(arXiv:2407.08855)——数据集、设计论文、结果论文三件套是组织方明确要求的完整引用链。
CC BY-NC 4.0 从何而来? HuggingFace 镜像页脚的自声明。数据提交方(挑战赛组织方)从未在 TCIA、Synapse 或论文中为数据本体声明 NC 条款(BraTS 家族历史上部分赛道用 CC BY-NC-SA,成人非洲赛道等各有口径,但儿科数据集登陆 TCIA 后的官方口径就是 CC BY 4.0)。镜像方叠加 NC 声明可能是保守起见的自我保护。检索者的安全做法:跟着 TCIA 走 CC BY 4.0 署名义务;如需绝对保守的商用场景,自行评估镜像声明带来的不确定性。
5.4 AI-Ready 评估
按库内 AI-Ready 光谱打分,这个数据集处于高位:
- ✅ 标准格式(NIfTI)、统一预处理(1mm³/SRI24/defacing 一步到位);
- ✅ 标签结构清晰(六个区域、语义明确、RAPNO 官方背书);
- ✅ 主力部分(训练+验证)CC BY 4.0 公开直取;
- ✅ 基线算法一行调用(官方包封装三届冠军);
- ✅ 元数据 TSV(成像参数、人口学变量)随包下载;
- ⚠️ 下载通道依赖 Aspera 插件(对自动化流水线不友好);
- ⚠️ 测试集不公开(设计使然,盲评需要,但对想全量分析的检索者是无法绕过的天花板);
- ⚠️ 规模三口径、两届训练集不同等口径陷阱需要读者自己弄清——本条目的价值就是把这些雷提前排掉。
5.7 下载通道选型:TCIA vs Synapse 的实操对比
| 维度 | TCIA | Synapse(按届项目页) |
|---|---|---|
| 内容 | 训练+验证图像与掩码(348 subjects,32.7 GB)+ 两份 TSV | 挑战赛全套:训练/验证 + 规程文档 + 提交入口 |
| 通道 | 浏览器 + IBM Aspera Connect 插件 | synapseclient(Python/CLI),Token 鉴权 |
| 自动化友好度 | 低(插件依赖) | 高(命令行可脚本化、可断点续传) |
| 版本锚点 | DOI 10.7937/DX5C-TJ86,Version 1(2025/12/19) | 项目页按届组织,无 DOI 级版本锚 |
| 引用优惠 | 正式数据引用格式(CC BY 4.0 署名义务) | 引用挑战赛页 + 数据 DOI 组合 |
| 适合谁 | 正式研究引用 + 一次性全量获取 | 流水线集成 + 参赛 + 按需分批取数 |
实操建议一句话:正式研究以 TCIA 为主通道(可引用、可版本锚定),自动化流水线用 Synapse CLI 拉取,两通道拿到的内容以同一批 subject ID 对账后再入库。
5.8 获取与使用合规清单(发布前过一遍)
- [ ] 署名:引用 TCIA 格式(附录 O 模板句),含 DOI;同时引挑战赛设计/结果论文;
- [ ] license 一致性:正文与仓库声明统一写 CC BY 4.0(TCIA 口径),不引用 HF 镜像的 NC 声明;
- [ ] 再识别禁令:遵守 TCIA 数据使用政策,不做(也不协助)个体再识别尝试;
- [ ] 衍生分发:若再分发预处理衍生数据,显著标注改动内容、保留原署名,不暗示原组织方背书;
- [ ] 届次声明:写明所用届次(2024 V1 / 2025 Lighthouse)与训练集例数;
- [ ] 任务边界:不宣称"数据集用于生存预测挑战"(§4.8 安全句式);
- [ ] 测试集隔离:不尝试从容器平台侧探测/重构测试集;
- [ ] 问题案例披露:使用中剔除/特判官方 4 例时,在论文中显式说明。
5.9 多通道下载一致性校验清单
TCIA、Synapse(2024/2025)、CBTN、NCI CDC 多通道并存是把双刃剑:可得性强,但内容一致性要自己把关。入库前跑一遍:
- subject ID 对账:各通道拿到的 ID 集合求差,差集逐个归因(届次差/质量筛除/通道同步延迟),写进项目文档;
- 文件完整性:NIfTI 头可读 + 形状/spacing 一致(名义 1mm³)+ 掩码标签值域合法(§3.6);
- 掩码-影像对齐抽查:随机 20 例叠加目视(错位配准是下游一切实验的隐形毒药);
- 版本锚定:记录 TCIA 版本日期(V1, 2025/12/19)与 Synapse 快照/下载日期,双时间戳入库;
- license 传递:衍生数据包继承署名义务,随包携带 CC BY 4.0 声明与本条目附录 O 的引用句。
§6 生态与影响:一个挑战赛家族的儿科支线
6.1 在 BraTS 家族中的位置
MICCAI BraTS 挑战赛自 2012 年起以成人胶质瘤为主线积累了十二年基准资产,2023 年起裂变出多赛道矩阵:成人胶质瘤(BraTS-GLI)、脑转移瘤(BraTS-MET)、脑膜瘤放疗(BraTS-MEN-RT)、儿科(BraTS-PEDs)、撒哈拉以南非洲(BraTS-SSA,库内 brats-africa 条目)、泛化性(BraTS-GoAT)、合成(BraSyn)、修复(BraTS-Inpainting)等。2024 年儿科赛道与非洲赛道、成人赛道共享同一套评估协议(lesion-wise DSC/HD95 + 排名求和),构成"同一 metric 体系、不同人群与病灶谱"的可横向比较矩阵。
对库内检索者的含义:brats(rid 24,成人主线)、brats-africa(rid 683,域偏移主题)、brats-pediatric(本条目,儿童人群主题) 三个条目合起来正好覆盖 BraTS 2024 的三个人群/场景轴,模型在成人↔儿童、资源充足↔资源受限两个方向上的泛化实验,可以三库联用。
6.2 数据联盟与基础设施层
这个数据集的组织结构是"学术联盟 + 非营利基础设施"的组合:
- 数据联盟层:CBTN(2011 年起,北美儿科神经肿瘤数据共享网络)、International DIPG/DMG Registry(专病登记)、CONNECT(神经肿瘤临床试验网络)、ASNR(放射科医生专业学会,标注人力);
- 学术组织层:宾夕法尼亚大学(Kazerooni/Bakas 线,数据工程与组织)、儿童国家医院(Linguraru 线,临床与标注组织)、Sage Bionetworks(Synapse 平台运营);
- 评测基础设施层:Synapse(Sage Bionetworks 运营的挑战赛平台)+ MedPerf(MLCommons 的开放基准执行框架,容器化提交、联邦评测);
- 资助层:NIH NCI/ITCR(U01CA242871)、NCI(UH3CA236536)、Pediatric Brain Tumor Foundation、DIPG/DMG Research Funding Alliance。
NIH 资助背景解释了数据的长尾分发策略:除 TCIA/Synapse 外,影像子集同步进入 NCI Cancer Data Commons,保证"NCI 支持的基础设施内长期可用"——这是公共资助数据集的典型冗余设计,对担心链接腐坏的检索者是好消息。
6.3 下游工具链与学术辐射
官方工具链(TCIA"External Resources"栏披露,均开源):
- CaPTk:Cancer Imaging Phenomics Toolkit,BraTS Pipeline 的官方实现载体之一;
- 儿科自动 defacing 工具(d3b-center/peds-auto-defacing-public);
- 儿科分割流水线(d3b-center/peds-brain-seg-pipeline-public)——标注生产链的第一环;
- BraTS Orchestrator Python 包(Astarakee/BraTS):三届儿科冠军算法一行调用,另有 BrainLes 社区的 PeTu 包聚焦儿科肿瘤。
学术辐射:挑战赛参赛方法收入 Springer LNCS(2025 届论文集含上海交大两支队伍、Macquarie 等多支队伍的儿科赛道论文);独立第三方研究持续把它当基准——PLOS ONE (2025) 的 T1w/T2w 比值图研究(结论:加入该衍生通道不改善儿科分割)、Northwestern 团队的放射科推理驱动架构(arXiv:2411.01390,在 CBTN 外部 30 例上对比 2023 冠军算法)等。一个数据集能同时供养挑战赛论文、方法学论文和"反直觉"的阴性结果论文,是基准健康的标志。
临床背景数字(组织方论文口径,写论文可直接引用):儿童中枢神经系统肿瘤是儿童癌症死亡首因;儿童高级别胶质瘤五年生存率不足 20%。
6.6 数据联盟视角:为什么是这四家
回看 464 例的四家来源,能读出数据联盟组建的隐性逻辑:
- DIPG/DMG Registry(256 例,55%):专病登记库天然带纵向随访与标准化临床数据,是队伍的"主力舰"——它的占比直接把数据集的中心语义锚定在中线/脑干弥漫胶质瘤上,这也解释了 CC/NET 标注体系为何如此设计(DIPG 影像的灵魂正是囊变与浸润的辨析)。
- CBTN(120 例):网络型协作体,价值不在例数而在可扩展性——CBTN 门户与基因组/临床数据的联动通道,使这个影像队列天然具备多组学延展的接口。
- Boston Children’s(61 例)+ Yale(27 例):学术医院的补充份额,提供联盟外的成像协议多样性。
这个结构的可迁移结论:多联盟数据集的机构配比决定了它的临床语义重心。引用本数据集做"D 儿科胶质瘤"的泛化声明时,记得 55% 是 DIPG/DMG——它更像"儿科弥漫中线胶质瘤队列(带 HGG 补充)“,而不是均匀的"儿科胶质瘤横截面”。
6.7 儿科神经肿瘤影像资源的本集定位
在"儿科脑肿瘤公开影像"这个狭窄品类里,本集的位置可以用三句话锚定:
- 它是唯一的多机构儿童 HGG 治疗初分割基准——同品类其他公开资源要么单中心小队列、要么不含分割标注、要么病种不同(髓母细胞瘤/视神经胶质瘤等本集刻意未覆盖);
- 它是 DIPG/DMG 影像的全球最公开集中地——DIPG Registry 贡献的 256 例在全球公开资源中几乎独一份,其稀缺性高于数据集总量本身;
- 它不是泛儿科影像库——需要其他病种、其他年龄层(婴幼儿)、治疗后影像的研究者,本集只提供 HGG/DMG/DIPG 治疗初这一个横截面,跨界需求请回 CBTN 全库或等待官方扩展(2024 设计论文预告的方向)。
6.8 数据引用学:三种引用对象的分工
围绕这个数据集的产出有三种"引用对象",职责不同:
| 引用对象 | 载体 | 何时引用 |
|---|---|---|
| 数据集本体 | TCIA DOI 10.7937/DX5C-TJ86 | 任何使用了影像/标注的场合(必引) |
| 挑战赛设计论文 | arXiv:2404.15009(2024)/2305.17033(2023) | 描述队列构成、任务定义、标注协议时 |
| 结果论文 | arXiv:2407.08855(2024);LNCS 论文集(2025) | 引用排行榜名次、冠军成绩、参赛方法 |
常见错误是"只引数据 DOI 不引设计论文"——数据 DOI 指向 TCIA 收藏页,不含 RAPNO 协议细节与机构拆分依据;审稿人核对标注语义时会要求补引。反向错误是"只引 arXiv 不引数据 DOI"——数据本体发表信息缺失,不符合 TCIA 数据引用政策(其使用政策明确要求带 DOI 的数据引用)。三件套原则(§0.1)就是为同时堵住这两类缺口。
§7 方法学启示:三条可迁移的经验
7.1 "专病登记库 × 挑战赛"是稀有病种数据集的可行解
儿童 HGG 单中心攒不出样本量,这个数据集用"专病登记(DIPG/DMG Registry 贡献 55%)+ 多中心网络(CBTN)+ 学术医院补边"的联盟结构解决了——总量不大(464 例)但对这个病种已是全球最大公开标注队列。可迁移的判断标准:当一个病种的年度病例数撑不起单中心数据集时,先看有没有现成的专病登记与协作网络可以汇流,而不是从零建库。库内 brats-africa(跨机构协作补资源缺口)与本条目(跨机构协作补稀有度缺口)是同一方法论的两个应用方向。
7.2 标注体系应该跟着疗效评估指南走,而不是跟着前作走
2024 届把标注从成人式分区切到 RAPNO 四区,是整个数据集最专业的一步:RAPNO 是儿童神经肿瘤疗效评估的国际指南工作组,用它的分区意味着分割输出可以无缝对接临床试验的疗效判定语义。给标注体系选型的启示:医学分割标签的"正确"分类学不在同行论文里,而在临床疗效评估指南里——跟着指南走,数据的临床转化通道才是直的。
7.3 脏数据可以是被官方确认的基准特性
2025 届把非颅骨剥离图像等"真实世界杂质"明确写进挑战赛难点,而非默默清洗掉。这对数据集构建者的启示是分层的:如果目标是训练生产模型,清洗;如果目标是benchmark方法鲁棒性,受控的不干净本身就是测试维度。BraTS 家族在 2025 年的这一转向(Lighthouse 各赛道普遍引入真实世界杂质)值得做基准设计的检索者整段阅读。
7.4 第四条经验:统一评估协议是跨赛道比较的前提
BraTS 2024-2025 家族(成人/儿童/非洲/转移/脑膜瘤/泛化等赛道)共享 lesion-wise DSC + HD95 与排名求和规则,这使"同一个模型在儿科 vs 成人 vs 非洲队列上的表现"成为可直接量化的问题——arXiv:2412.04094 这类跨赛道方法论文能存在,协议统一是前提条件。对基准设计者:人群可以分赛道,指标语言必须统一;一旦各赛道自造指标,家族的横向研究价值就归零。
7.5 第五条经验:数据正式发表(TCIA 化)是挑战赛数据的"养老保障"
大量挑战赛数据集随赛事热度消退而失养(链接腐坏、版本混乱、无正式引用格式)。BraTS-PEDs 选择登陆 TCIA——DOI 固定、版本化(Version 1, 2025/12/19)、元数据规范、多冗余托管(NCI Cancer Data Commons 兜底)——把"挑战赛纪念品"升格为"可长期引用的科学资产"。给数据集构建者的对照问题:你的数据集在赛事结束后,有没有一个不依赖赛事组织者热情的长期家园?
7.6 第六条经验:透明披露与口径对账是两件事
这个数据集的文档文化有个耐人寻味的两面性:披露很透明,对账不给力。4 例问题案例逐个点名(TCIA 页)、license 口径明确、预处理流水线全部开源——透明度拉满;但 464/457/348 三口径并存、26 例差额、两届训练集关系,全都没有官方对账表。给基准建设者的教训:披露"我们知道什么"与对账"数字为什么对不上"是两种文档工作,后者才是检索者真正卡壳的地方——本条目 §2.1 与附录 H 的存在,就是在替官方补这份对账作业。
§8 与库内条目的关系
8.1 家族图谱
- brats(rid 24):BraTS 主条目,成人胶质瘤主线(2012-2024 十二年基准)。与本条目共享四序列规格、评估协议、nnU-Net 生态;差异在人群(成人↔儿童)与标注体系(NCR/ED/ET ↔ ET/NET/CC/ED)。跨人群泛化实验的两个端点。
- brats-africa(rid 683):BraTS 2024 撒哈拉以南非洲赛道,成人胶质瘤 + 跨机构域偏移主题。与本条目同属 2024 家族、共享 metric 与容器化提交流程;差异在资源场景(资源受限↔多联盟充裕采集)与人群(成人↔儿童)。
- 建议三个条目互相放置"家族成员"链接:成人主线、非洲域偏移、儿科人群三轴互补,无重叠冲突。
8.2 检索路径建议
- 找"儿童脑肿瘤分割基准"→ 本条目(唯一儿科赛道);
- 找"成人胶质瘤分割历史基准"→ brats(rid 24);
- 找"低资源/域偏移分割"→ brats-africa(rid 683)+ 本条目 2025 届杂质设计可作补充阅读;
- 找"多序列 MRI 预处理标准流程"→ 本条目 §2.3(BraTS Pipeline)与 brats 主条目互参。
8.3 跨条目组合检索的三个高价值场景
- 人群泛化矩阵:用同一分割框架分别在本集(儿童)与 brats(rid 24,成人)上训练/评测——四序列规格与指标协议一致,人群轴是唯一变量,是研究"年龄对分割迁移影响"的干净设置。
- 资源梯度轴:brats-africa(rid 683,资源受限采集)→ 本集(多联盟标准化预处理)→ brats 主线(十二年成熟基准),构成"低资源→标准化→成熟"的资源梯度,可用于研究预处理投入对模型性能的边际贡献。
- 标注语义演化案例组:成人体系(NCR/ED/ET)→ 儿童体系(ET/NET/CC/ED,RAPNO)→ 转移瘤体系(WT/TC/ET+SNFH/NETC/RC,BraTS-MET 2024 引入切除腔 RC)——三个条目合读,是"分割标注分类学随临床需求演化"的现成教学案例。
8.4 三个高频咨询场景的类型化解答
场景一:“我在做儿童胶质瘤自动分割的毕业课题,从哪开始?”
路径:§1.5 名片 → TCIA 拿训练集 → 附录 N 接 nnU-Net → 官方包冠军当基线 → 主攻 CC/ET 写创新点。时间预算:数据就绪半天,基线复现约一周。
场景二:“我要证明我的成人模型在儿童上也能用/不能用。”
路径:§3.4 标签映射审查 → 成人模型零样本推理本集验证集 → 按 §2.4 语义对齐后算 lesion-wise 指标 → 与 §4.6 参赛成绩对照定位差距来源(人群差 vs 标签差 vs 预处理差)。注意:这是扩展实验口径,不是挑战赛口径。
场景三:“审稿人要求补充多中心泛化验证。”
路径:§2.2 机构拆分留了天然分组(DIPGR/CBTN/BCH/Yale)——leave-one-center-out 的泛化协议可直接构造;引用 §2.3 的机构异质性原文与 2025 届杂质设计做讨论背书。
§9 避坑清单:十个已踩过的坑
坑 1:规模三口径混用。 464(挑战赛论文)/457(TCIA 元数据与 CCDI 目录)/348(TCIA 图像 subjects)同时流通。写论文引用 464 例训练 261 例没问题,但若与 TCIA 下载包对不上数,先想起 457/348 两个口径,不要怀疑自己下载坏了。
坑 2:261+91+86≠464。 三段拆分之和 438,与总数差 26 例,官方无解释。有的第三方文章只写"464 例数据集"而不写拆分,有的只写训练 261——都别当成对方错了,两套数字各有出处。
坑 3:把生存预测当成挑战赛任务。 "方向性生存预测"是成人赛道的任务;儿科三届均为纯分割。元数据层的 OS/PFS 变量与"挑战赛任务"是两码事。复现检索时如果拿儿科赛道去对标生存预测论文,方向就错了。
坑 4:HF 镜像的 license 陷阱。 HuggingFace chehablab/BraTS_PED_2024 自声明 CC BY-NC 4.0,TCIA 官方是 CC BY 4.0。直接从 HF 镜像抄 license 声明会导致引用错误,商用评估时尤其要回到 TCIA 官方页核对。
坑 5:两届训练集不同还混着用。 2024 届训练 261 例、2025 届训练 256 例,且 2025 届刻意引入非颅骨剥离杂质。复现 2025 论文却下载 2024 数据(或反之),数字对不上是必然。Synapse 两个 ID(syn53708249 vs syn64153130)务必对应届次。
坑 6:2023 届与 2024 后标签语义不同。 2024 届切换到 RAPNO 四区体系(新增 NET/CC 拆分)。把 2023 届的掩码与 2024 届掩码直接当同一标签空间做时间序列分析,会引入系统性标签漂移。
坑 7:把 HF 镜像的 rows 数当例数。 第三方镜像页显示 “53,940 rows”——那是转存格式切片后的条目数(每例多序列/多切片展开),不是患者数。例数永远以 464/261 口径为准。
坑 8:把 4 例已知问题当"数据集质量差"或"算法失败借口"。 官方主动披露问题案例是透明度加分项;正确用法是按 §3.6 自查流程定位处理,而非全盘怀疑标注质量,也勿在自己模型掉分时归因于这几例。
坑 9:用 2023 届模型/掩码直接评估 2024 届数据(或反之)。 标签空间已断代(§2.8),跨届直接推理-评估会产生系统性错位分数。跨届比较必须重新映射标签并声明协议。
坑 10:认为"1mm³ 重采样 = 原始分辨率"。 数据集是重采样后的统一几何,原始采集矩阵/层厚各机构不同(成像元数据 TSV 可查)。做分辨率敏感研究(如小病灶检测)时,勿把重采样几何当原生采集精度宣称。
§10 总结
10.1 三句话总结
- 这是 MICCAI BraTS 挑战赛的儿科赛道数据集:464 例儿童高级别胶质瘤(DIPG/DMG 为主力)治疗初 mpMRI 四序列 + RAPNO 四区专家标注,CBTN/DIPG Registry 等国际联盟共建,2023-2025 连办三届,是目前最大的公开儿童 HGG 标注影像队列。
- 主力部分(训练+验证,348 subjects)在 TCIA 以 CC BY 4.0 正式发表(DOI 10.7937/DX5C-TJ86),NIfTI + 1mm³ + SRI24 配准 + defacing 全部预处理到位,历届冠军算法一行可调,是 AI-Ready 程度很高的"即取即用"基准。
- 使用前必须过三道口径关:规模三口径(464/457/348)、两届训练集不同(261/256)、HF 镜像 license 冲突(NC vs 官方 BY)——本条目 §9 的六个坑覆盖了全部已知雷区。
10.2 适合谁
- 医学图像分割研究者:儿科脑肿瘤方向目前最优的公开基准,三届冠军算法可当强基线;
- 儿科神经肿瘤影像研究者:RAPNO 对齐的标注语义可直接对接疗效评估叙事;
- 挑战赛/方法学论文作者:评估协议(lesion-wise DSC/HD95)与成人赛道统一,跨赛道比较是天然选题;
- 放疗靶区/手术规划工程团队:四序列+子区域结构就是靶区勾画的输入形态;
- 多组学研究团队:CBTN 通道可联动基因组/临床数据(需另行申请)。
10.3 不适合谁
- 找低级别胶质瘤或其他儿科肿瘤(髓母细胞瘤等)者——本集仅 HGG/DMG/DIPG;
- 想做生存预测挑战赛复现者——儿科赛道无此任务(元数据有 OS/PFS 但不是挑战赛基准);
- 需要测试集全量分析者——测试 86 例永不公开;
- 对下载工具有洁癖的自动化流水线——Aspera 插件是绕不开的摩擦(可评估 Synapse 客户端替代)。
10.4 30 秒决策卡
- 做儿童 HGG 分割方法 → 直接用:TCIA 取训练+验证,官方包调 2025 冠军当基线,主攻 CC/ET 难区;
- 做跨人群泛化 → 本集(儿童)+ brats(成人)双端点,注意标签体系差异做语义映射;
- 做生存/多组学 → 别用挑战赛任务框架,走 CBTN/NCI 通道申请元数据与临床数据;
- 只想要一个"儿科脑 MRI 大数据集"快速验证流水线 → 可以,但记得它是纯 HGG 治疗初队列,别当泛儿科数据用。
10.5 一分钟行动清单(打印级)
- 确定届次(2024 复现 → syn53708249/TCIA;2025 → syn64153130);
- 下载后先跑 §3.6 五步自查(含 4 例问题案例定位);
- 确认标签语义映射(儿科四区,勿对号成人标签);
- 基线用官方包冠军算法,指标用 lesion-wise DSC/HD95;
- 报告成绩时写清:哪一届、训练集例数、验证 or 测试口径;
- 引用三件套(DOI + 两篇 arXiv),license 按 TCIA CC BY 4.0 署名。
10.6 给组织方的三条反馈建议(以用户身份)
- 发布口径对账表:464/457/348 与 438/464 的差异数,一页表即可终结社区的全部猜测;
- 发布两届训练集 diff 清单:2024(261 例)与 2025(256 例)的 subject 级增删列表,让复现者不再盲猜"官方清洗了什么";
- 声明验证集届间关系:2024/2025 两届验证集均为 91 例,一句话说明是否复用,可消除一个系统性混淆源。
FAQ(高频问答 42 问)
A. 基础认知
Q1:BraTS-PEDs、BraTS-PED、BraTS-Pediatric 是同一个东西吗?
是。BraTS-PEDs 是 2023/2024 届官方拼写(带 s,复数风格);BraTS-PED 是 2025 届及媒体文献中的简称(BraTS 2025 Task-6 PED);本库 slug 取 brats-pediatric。条目正文以 BraTS-PEDs 指称官方数据集本体。
Q2:数据集和挑战赛是一回事吗?
数据集是挑战赛的载体。数据集本体(影像+标注)已在 TCIA 独立正式发表(DOI 10.7937/DX5C-TJ86),不参加挑战赛也能下载使用;挑战赛是围绕它的年度基准活动(2023/2024/2025 三届)。
Q3:为什么儿童脑肿瘤要单独一个赛道?
儿童脑肿瘤的影像表型、标注分区需求(囊变/非强化的拆分)、伦理约束(去标识与 defacing 要求更高)都与成人差异显著,成人模型直接迁移效果差(多篇参赛论文实证)。独立赛道才能建立公平的儿科基准。
Q4:数据是什么时候采集的?
回顾性队列,各联盟机构历史累积采集,挑战赛 2023-2025 年组织发布;具体采集年份跨度未在公开文件中给出(元数据 TSV 含成像参数可自行查)。
Q5:有多少作者/多少机构参与?
设计论文作者 70+ 人,来自数十家机构(论文署名横跨北美与欧洲主要儿科神经肿瘤中心);数据来源四家(CBTN/DIPG Registry/BCH/Yale),标注协作由 ASNR 组织。
B. 数据与获取
Q6:训练集里能拿到什么?
四序列 mpMRI(NIfTI)+ 六区域分割掩码(ET/NET/CC/ED/TC/WT)+ 元数据 TSV。训练集 261 例(2024 届)。
Q7:验证集和测试集呢?
验证集 91 例:只有影像无标注,用于在线提交评测。测试集 86 例:完全不公开,容器化算法提交后由平台盲评。
Q8:下载 32.7 GB 必须用 Aspera 吗?
TCIA 官方下载通道要求 IBM Aspera Connect 浏览器插件。替代路径:Synapse 客户端(命令行 synapse get)或 NCI Cancer Data Commons。自动化流水线建议走 Synapse CLI。
Q9:数据是匿名的吗?
是。DICOM 头 PHI 在转换时剥离、MRI defacing(儿科专用工具)已做、经各联盟伦理流程去标识后发布。TCIA 页标注该收集符合其去标识化政策。
Q10:CBTN 门户的数据和这个数据集什么关系?
CBTN 门户提供部分同源影像(无分割标注),且可与 CBTN 的基因组、临床数据联动——适合多组学研究;要带标注的版本就走 TCIA/Synapse。
Q11:SRI24 是什么?一定要懂吗?
SRI24 是数据配准的目标脑模板(已在 Zenodo 公开)。所有图像都对齐到它,因此你拿到的数据空间坐标系统一。做新分割或配准研究时需要知道这一点;只训练分割模型可以不深究。
Q12:HuggingFace 上那个镜像能用吗?
能用但不建议作为正式引用来源:它是第三方(chehablab)转存,license 声明(CC BY-NC 4.0)与官方(TCIA CC BY 4.0)冲突,且不随官方更新。快速预览可以,正式项目走官方。
C. 标注与任务
Q13:掩码的标签值是什么?
NIfTI 整数标签:四个子区域各一个值(ET/NET/CC/ED),TC 与 WT 为二值组合掩码(派生自子区域相加)。逐序列解读见 §2.4 表格。
Q14:为什么没有"坏死"标签?成人 BraTS 不是有 NCR 吗?
2024 届改用 RAPNO 儿科分区:非强化的肿瘤实质归 NET、囊变单列 CC,成人式"坏死核心"的粗颗粒分类在 DIPG/DMG 场景信息量不足。这是有意的体系切换,不是遗漏。
Q15:标注质量如何评估?
生产端是"半自动预分割→人工精修→神经放射科终审"三步;评估端是挑战赛统一协议:测试集双人独立标注评 inter-rater reliability,排名用 lesion-wise DSC + HD95。逐例标注者明细未公开。
Q16:能用这个数据集做生存预测吗?
挑战赛层面不能(任务只有分割)。研究层面:元数据携带 OS/PFS 结局变量,若经 CBTN/NCI 通道获得临床数据链接,可以做影像-生存关联研究——但这超出数据集公开包本身的边界。
Q17:一例只有一个肿瘤吗?
该队列以单发/主病灶为主(高级别胶质瘤特征),但协议按 lesion-wise 指标设计,允许多病灶场景。测试集评测按病灶逐个计算再聚合。
D. 挑战赛
Q18:2025 届和 2024 届比赛有什么不同?
2025 届并入 BraTS Lighthouse(Task-6),训练集调整为 256 例,官方引入非颅骨剥离等真实世界杂质,平台迁至 syn64153130。任务定义与指标不变。
Q19:验证榜第一就是冠军吗?
不是。2025 届验证榜第一(Li 团队)与测试榜第一(Yi 团队)是不同团队。最终名次以测试榜为准。
Q20:参赛可以用预训练模型吗?
2024 届规则禁止:不得用 BraTS-PEDs 之外的公开/私有数据训练或预训练(保证公平)。论文阶段可补外部数据实验但须单列挑战赛数据成绩。
Q21:历届冠军算法在哪里能直接用?
官方 Python 包(GitHub Astarakee/BraTS,pip 可装):PediatricAlgorithms.BraTS23_1/24_1/25_1 分别调用三届冠军,GPU 推理。适合当强基线。
Q22:成绩的天花板在哪里?
2025 届测试集冠军:WT 92.6% / TC 91.8%,但 CC 仅 62.7%、ET 72.9%——囊变与稀疏强化是明确的方法学洼地,也是发文机会。
E. 许可与引用
Q23:商用允许吗?
数据本体按 TCIA 口径 CC BY 4.0,商用允许,义务是按 TCIA 要求的格式署名引用(含 DOI)。若绝对保守,注意 HF 镜像叠加的 NC 声明争议。
Q24:正确的引用组合是什么?
三件套:数据集(TCIA DOI 10.7937/DX5C-TJ86)+ 设计论文(arXiv:2404.15009)+ 结果论文(arXiv:2407.08855)。用 2025 届数据另引其论文集。
Q25:训练出的模型有使用限制吗?
CC BY 4.0 不约束模型权重本身的再许可,但严谨做法是在模型卡中注明训练数据来源与许可。
F. 工程与复现
Q26:数据形状是标准 240×240×155 吗?
成人 BraTS 的经典形状;儿科数据统一重采样到 1mm³ 各向同性并配准 SRI24,具体尺寸以实际文件为准(不要按成人记忆值硬编码输入尺寸)。
Q27:nnU-Net 能直接跑吗?
可以,数据格式(四序列 NIfTI + 整数标签掩码)与 nnU-Net 预期兼容,注意六个标签的映射配置。多篇 2025 届参赛论文就是 nnU-Net 变体。
Q28:官方预处理后还需要自己做 skull-stripping 吗?
不需要,且要小心:数据保留颅骨(除 TCIA 披露的 4 例已知问题),自行剥离可能与基准口径不一致。2025 届官方难点就是处理非剥离图像。
Q29:和成人 BraTS 模型迁移的推荐姿势?
先做标签语义映射审查(NCR≠NET、儿科多出 CC),再考虑用官方包的冠军算法在儿科数据上做零样本基线,最后才是微调。直接按标签编号硬对齐是经典复现事故。
Q30:元数据 TSV 里有什么?
两份:成像元数据(112 studies,采集参数等)与挑战赛元数据(457 条,人口学/挑战相关变量)。生存结局变量在挑战赛元数据层。
G. 命令与代码速查(增补)
Q31:Synapse 下载的最小命令序列?
注册 synapse.org → 个人设置生成 Personal Access Token → pip install synapseclient → synapse get -r syn53708249(2024 届整包)或按文件夹 ID 选择性下载。2025 届同法换 syn64153130。CLI 等价:synapse -u <token> get -r <synID>。
Q32:官方评估脚本在哪里?
挑战赛项目页提供评估包(与 CaPTk/Synapse 评测一致的 lesion-wise DSC/HD95 实现);BrainLes 社区工具链(BraTS 包、PeTu 包)亦内置一致口径的指标实现。自建评测务必对齐 lesion-wise 定义(真负体素不计入)。
Q33:冠军算法包的调用样例?
from brats import PediatricSegmenter; from brats.constants import PediatricAlgorithms → PediatricSegmenter(algorithm=PediatricAlgorithms.BraTS25_1).infer_single(t1c=..., t1n=..., t2f=..., t2w=..., output_file=...)。注意:仅 GPU(冠军算法均不支持 CPU 推理);输入为四序列 NIfTI 路径。
Q34:如何批量校验掩码标签值域?
遍历训练掩码 NIfTI:np.unique(mask) 应仅含预期的子区域整数码;同时统计各标签体素占比、逐例出现率(§3.6 第三步),异常清单与 4 例已知问题对照。
Q35:官方包还封装了哪些儿科相关赛道?
同一包覆盖 BraTS 家族多赛道(成人胶质瘤、GoAT 泛化、Inpainting、MEN、MET、SSA、Synthesis 等),儿科类为 PediatricSegmenter(2023/2024/2025 三届前三名算法枚举 BraTS23_1-3 / BraTS24_1-3 / BraTS25_1-3)。
H. 与其他儿科数据集的关系(增补)
Q36:为什么不直接用 CBTN 全量数据?
CBTN 是临床网络数据湖(含基因组/临床/影像),面向合规审批的研究者;BraTS-PEDs 是从中切出的"分割就绪"基准(统一预处理+专家标注+公开 license)。做分割基准研究用后者,做多组学深度研究走前者,两者互补不互斥。
Q37:和 PICI 等其他儿科影像数据集相比?
公开可得的"儿童脑肿瘤+专家分割+多序列"基准极度稀缺,本集在该品类内没有同规模对手(464 例 HGG vs 多数公开儿科序列为个位数到数十例)。其他儿科影像资源多为特定病种(视神经胶质瘤、髓母细胞瘤等)小队列或不含分割标注——注意这些病种本集刻意未覆盖,别拿本集当"泛儿科脑 MRI"用。
Q38:想研究后治疗/术后影像怎么办?
本集明确为治疗初(treatment-naive)队列;术后/治疗后是 2024 届设计论文预告的未来方向(成人侧已有 BraTS 2024 post-treatment 赛道,库内 brats 主条目可查)。当前请勿用本集做术后影像研究。
I. 争议与开放问题(增补)
Q39:规模口径分歧会被官方澄清吗?
未见官方对账文件。可能解释包括:入组后质量筛除、四序列完整性复核淘汰、测试集独立抽样的口径差。检索者立场:按附录 H 句式并列口径,等待官方数据卡更新。
Q40:348 与 352 的差 4 例就是那 4 例问题案例吗?
数字巧合诱人,但 TCIA 页未做此声明,问题案例也在可下载集合内(不是被移除)。按"未解释"存照,勿当结论引用。
Q41:MELBA 论文(10.59275/j.melba.2025-f6fg)是什么?
CCDI 目录"Published In"列出的正式发表载体之一(MELBA 为机器学习与生物医学成像开放期刊)。本条目截稿时未逐页核对其内容与 arXiv 版差异,存照备查。
Q42:2025 届验证榜/测试榜冠军不同,官方最终承认哪个?
挑战赛惯例以测试榜为最终名次(MICCAI 年会公布口径);验证榜第一的荣誉在论文中通常表述为"validation leaderboard first place"。两支团队(同为上海交大)各有 LNCS 章节收录。
Q46:数据能用于机器学习竞赛平台之外的闭源产品吗?
CC BY 4.0 不禁止商用闭源,义务是署名;但建议产品文档中保留数据来源与许可声明,并自查 TCIA 使用政策条款(重点:再识别禁令与衍生声明)。
Q47:验证集可以拿来训练吗?
规则上验证集仅供提交评测(防止过拟合官方验证分布);学术自由层面无强制,但用于训练后其提交成绩失去意义,论文中须显式声明,且不可与挑战赛排名混谈。
Q48:两届数据集的差集(2024 有而 2025 无的病例)有清单吗?
无官方清单。实用做法:两届训练集按 subject ID 求差(§3.6 第五步),差集即官方清洗线索——但注意差集可能混入编号体系调整,勿直接当"被剔除病例"引用。
Q49:TCIA 与 Synapse 拿到的数据需要互相对账吗?
建议做。两通道由不同团队维护、更新节奏不同(TCIA 版本化、Synapse 按届),subject 级对账(ID 差集)应在入库前完成,差异记录到项目文档——尤其混用两通道数据训练时。
Q50:论文里报告成绩的标准句式是什么?
四要素缺一不可:“第 X 届(20XX)× 哪个榜(validation/test)× 哪个指标(lesion-wise DSC/HD95)× 哪些区域”。反例:“我们的 Dice 达到 92%”——无届次、无榜别、无区域,无法复核。
Q51:数据集后续更新如何追踪?
TCIA 收藏页标注版本(当前 Version 1,2025/12/19 更新)与 DOI(DOI 不变、版本递进);挑战赛动态跟 Synapse 对应届次项目页。引用时注明所用版本日期。
Q52:本条目的信息边界?
抓取时点 2026-09-27;LNCS 2025 论文集仅核验了摘要级信息(冠军成绩、排名、方法概述),未逐页核对全部儿科赛道章节;MELBA 论文(10.59275/j.melba.2025-f6fg)未深读。后续版本应优先补这两块。
Q53:可以用本集数据做模型蒸馏/合成数据生成的种子吗?
数据层面 CC BY 4.0 允许(署名+声明改动);但蒸馏出的模型若宣称"挑战赛性能"须回官方协议评测。合成数据的医学声明(“基于真实儿童 HGG 生成”)需同时满足 license 义务与研究伦理审查。
Q54:官方包的冠军算法输出能直接当伪标签用吗?
可以(CC BY 4.0 + 算法开源许可允许),这正是官方包的设计用途之一;但注意 2025 冠军在 CC 区仅 62.7% Dice——伪标签的 CC 通道噪声会很大,建议只用作预分割底稿(复刻 §3.1 流水线的第一环),终稿仍需人工精修。
Q55:本条目与 FACTS.md 的关系?
本条目面向数据集检索者(how to use),FACTS.md 面向编辑部内部(what we verified:三源核验记录、口径存照、待核清单)。两者数字必须一致——若后续更新发现口径变化,以 FACTS.md 的再核验为先,条目随后同步。
Q56:为什么训练集 261 例在部分论文里被写成"n=261 patients"而另一些写"n=261 cases"?
本集一个 subject 对应一次治疗初扫描(多序列打包),患者=扫描=case,两写法等价;但引用 TCIA 的 “348 subjects / 1,649 series” 时要分清 subject(患者级)与 series(序列级文件数,约 5 个/例:四序列+掩码)。
Q57:测试集 86 例不公开,那论文里的"test Dice"都是官方跑的?
是——参赛者提交容器,官方在受控环境推理并回传指标;论文作者拿到的是官方回传成绩,不是自己算的。第三方论文若自称"在 BraTS-PEDs 测试集上评估",要么是官方流程参与者,要么表述不严谨(常见替代:自留出训练集子集/外部 CBTN 数据,注意甄别)。
Q58:数据集的正式简称到底用哪个?
正式文档首选 BraTS-PEDs(官方拼写);2025 届语境用 BraTS-Lighthouse 2025 Task-6 (PED) 亦可;本库条目名 BraTS-Pediatric 为检索友好命名。同一文档内选一个用到底,首现处给全称。
事实清单(硬事实 40 条)
-
官方全称:The Brain Tumor Segmentation in Pediatric Magnetic Resonance Imaging (BraTS-PEDs);挑战赛冠名 CBTN-CONNECT-DIPGR-ASNR-MICCAI BraTS-PEDs。
-
首届 2023 年(arXiv:2305.17033,2023-05-26),首个儿科 BraTS 赛道。
-
2024 届设计论文 arXiv:2404.15009(2024-04-23)。
-
2024 届结果论文 arXiv:2407.08855。
-
2025 届并入 BraTS Lighthouse 2025,赛内代号 Task-6(PED),Synapse syn64153130。
-
数据集正式发表:TCIA,DOI 10.7937/DX5C-TJ86,Version 1 更新于 2025/12/19。
-
挑战赛队列总数:464 例儿童高级别胶质瘤患者(论文口径)。
-
机构来源:CBTN 120 + DIPG/DMG Registry 256 + Boston Children’s 61 + Yale 27 = 464。
-
TCIA/CCDI 元数据口径 457 例。
-
TCIA 图像托管口径 348 subjects / 1,649 series。
-
拆分:训练 261 / 验证 91 / 测试 86(arXiv:2412.04094 口径;三段和 438)。
-
病种:HGG(高级别星形细胞瘤)、DMG(弥漫中线胶质瘤)、DIPG(弥漫内生型脑桥胶质瘤)。
-
纳入:组织学确诊 HGG 或影像/组织学证实 DIPG + 治疗初四序列齐全;排除:质量不合格、<1 月龄婴儿。
-
四序列:T1、T1CE(钆增强)、T2、T2-FLAIR。
-
预处理:DICOM→NIfTI 去 PHI、SRI24 模板配准、1mm³ 各向同性重采样、儿科自动 defacing(BraTS Pipeline,经 CaPTk/FeTS)。
-
标注体系(2024 起):RAPNO 推荐四子区域 ET/NET/CC/ED + 组合 TC/WT。
-
TC/WT 为子区域掩码简单二值相加的派生标签。
-
标注生产:儿科自动分割预生成 → 人工迭代精修 → 神经放射科医生终审(ASNR 协作);测试集双人独立标注。
-
任务:纯分割(三届一贯),无生存预测子任务。
-
元数据含人口学变量与 OS/PFS 生存结局变量(CCDI 目录口径)。
-
评估指标:lesion-wise DSC + lesion-wise HD95,多维排名求和。
-
参赛限制:禁止用额外数据训练/预训练。
-
评估平台:Synapse(2024: syn53708249)+ MedPerf(syn511569100029)+ CaPTk/FeTS 本地工具。
-
2023 届冠军:Daniel Capellán-Martín et al.。
-
2024 届冠军:Mehdi Astaraki(二名 Tim Mulvany,三名 Sarim Hashmi)。
-
2025 届测试榜冠军:Yuxiao Yi et al.(二名 Meng-Yuan Chen,三名 Haitao Yu);验证榜第一 Xiaolong Li et al.(不同团队)。
-
2025 测试集冠军 Dice:WT 92.6% / TC 91.8% / NET 85.7% / ED 83.2% / ET 72.9% / CC 62.7%。
-
2025 届训练集 256 例(Macquarie 参赛论文口径),与 2024 届 261 例不同。
-
TCIA 披露 4 例已知质量问题:BraTS-PED-00024-000 / 00098-000(颅骨剥离)、00281-000(方向)、00287-000(倾斜)。
-
数据 license:CC BY 4.0(TCIA 官方);HF 第三方镜像自声明 CC BY-NC 4.0(冲突存照)。
-
TCIA 下载体积 32.7 GB,需 IBM Aspera Connect 插件。
-
资助:NIH NCI/ITCR U01CA242871、NCI UH3CA236536、Pediatric Brain Tumor Foundation、DDRFA。
-
官方下游工具:CaPTk、儿科 defacing 工具、儿科分割流水线、BraTS Orchestrator Python 包(冠军算法一行调用)。
-
儿童 CNS 肿瘤为儿童癌症死亡首因;儿童 HGG 五年生存率 <20%(论文口径)。
-
评测基础设施为 Synapse(托管/门户)+ MedPerf(容器化盲评执行,MLCommons,Nature Machine Intelligence 2023 有专文)。
-
SRI24 模板为儿科赛道统一配准目标(Zenodo 公开)。
-
2024 届设计论文预告未来扩展方向:更多机构与组织学类型、术后/治疗后影像。
-
CCDI 目录口径:457 例全部 High-Grade Glioma、年龄儿童及青年(<40 岁)、性别/种族/族裔公开层 Not Reported。
-
CBTN 建立于 2011 年,为北美多中心儿科神经肿瘤数据协作网络。
-
官方 BraTS 包中历届儿科冠军算法均不支持 CPU 推理(GPU required)。
术语表(30 条)
| 术语 | 全称/原文 | 释义 |
|---|---|---|
| BraTS | Brain Tumor Segmentation | MICCAI 脑肿瘤分割挑战赛,2012 年起的社区基准 |
| HGG | High-Grade Glioma | 高级别胶质瘤,成人儿童均为恶性度最高的胶质瘤谱系 |
| DMG | Diffuse Midline Glioma | 弥漫中线胶质瘤,H3 K27M 变异为主的中线恶性胶质瘤 |
| DIPG | Diffuse Intrinsic Pontine Glioma | 弥漫内生型脑桥胶质瘤,位于脑桥的 DMG 亚型 |
| mpMRI | multiparametric MRI | 多参数 MRI,本集指四序列结构像组合 |
| T1CE / T1-Gd | contrast-enhanced T1 | 钆对比剂增强 T1 加权像 |
| T2-FLAIR | T2 fluid-attenuated inversion recovery | 抑制自由水的 T2 像,水肿/病变敏感 |
| ET | Enhancing Tumor | 强化肿瘤(T1CE 上强化区域) |
| NET | Non-Enhancing Tumor | 非强化肿瘤(非强化的肿瘤实质) |
| CC | Cystic Component | 囊变成分 |
| ED | Edema | 水肿/瘤周浸润区 |
| TC | Tumor Core | 肿瘤核心 = ET+NET+CC |
| WT | Whole Tumor | 整体肿瘤 = ET+NET+CC+ED |
| RAPNO | Response Assessment in Pediatric Neuro-Oncology | 儿科神经肿瘤疗效评估工作组,本集标注分区的依据 |
| CBTN | Children’s Brain Tumor Network | 儿童脑肿瘤网络(数据联盟,2011 年起) |
| DIPGR | International DIPG/DMG Registry | 国际 DIPG/DMG 专病登记库(贡献 55% 病例) |
| CONNECT | COllaborative Network for NEuro-oncology Clinical Trials | 神经肿瘤临床试验协作网络 |
| ASNR | American Society of Neuroradiology | 美国神经放射学会(标注协作主力) |
| DSC / Dice | Dice Similarity Coefficient | 分割重叠度指标,本集按 lesion-wise 计算 |
| HD95 | 95% Hausdorff Distance | 95 分位 Hausdorff 表面距离(mm) |
| SRI24 | SRI24 atlas | 数据统一配准的目标脑模板(Zenodo 公开) |
| CaPTk | Cancer Imaging Phenomics Toolkit | BraTS Pipeline 官方实现工具之一 |
| FeTS | Federated Tumor Segmentation | 联邦肿瘤分割平台/工具,BraTS 生态组件 |
| MedPerf | — | MLCommons 开放基准执行框架,挑战赛评测后端 |
| defacing | — | 去面部处理(MRI 隐私保护步骤,本集用儿科专用版本) |
| lesion-wise | — | 按病灶逐个计算再聚合的评价方式(区别于全图体素级) |
| treatment-naive | 治疗初 | 未接受治疗前采集的影像,本集入组条件 |
| lesion | 病灶 | lesion-wise 指标的计算单元 |
| LNCS | Lecture Notes in Computer Science | Springer 会议论文集系列(挑战赛论文载体) |
| Aspera | IBM Aspera Connect | TCIA 下载所需的高速传输插件 |
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| slug | brats-pediatric |
| 条目 URL | https://www.qianfanghub.com/ai-ready-dataset/brats-pediatric/688 |
| 数据集正式名 | The Brain Tumor Segmentation in Pediatric Magnetic Resonance Imaging (BraTS-PEDs) |
| 数据 DOI | 10.7937/DX5C-TJ86(TCIA) |
| 主论文 | arXiv:2404.15009(设计)+ arXiv:2407.08855(结果) |
| 规模主口径 | 464 例患者;训练 261/验证 91/测试 86 |
| License | CC BY 4.0(TCIA 官方口径) |
| 任务 | 纯分割(ET/NET/CC/ED/TC/WT),无生存预测 |
| 挑战赛平台 | Synapse syn53708249(2024)/ syn64153130(2025) |
| 最新冠军 | 2025 测试榜 Yuxiao Yi et al.(WT Dice 92.6%) |
| 抓取时点 | 2026-09-27 |
附录 B:DAIMS 评估全表
| 维度 | 评估 | 说明 |
|---|---|---|
| D1 可发现性 | ★★★★★ | TCIA+Synapse+CCDI+官方包多入口,DOI 固定,检索"pediatric brain tumor segmentation"必命中 |
| D2 可获取性 | ★★★★☆ | 训练+验证公开直取;扣分项:Aspera 插件摩擦、Synapse 注册墙、测试集不公开 |
| D3 格式互操作 | ★★★★★ | NIfTI 标准格式、1mm³ 统一重采样、SRI24 配准、整数标签掩码,主流框架即取即用 |
| D4 标注质量 | ★★★★☆ | 半自动+人工精修+神经放射科终审三步链、RAPNO 指南对齐、测试集双标;扣分:人员级标注元数据未公开 |
| D5 文档完备 | ★★★★☆ | 设计论文+结果论文+TCIA 收藏页+挑战赛 wiki 完整;扣分:规模口径分歧无官方对账 |
| D6 许可清晰 | ★★★★☆ | TCIA CC BY 4.0 明确;扣分:HF 第三方镜像 NC 声明制造混淆噪音 |
| D7 维护可持续 | ★★★★☆ | NCI 基础设施冗余托管(TCIA/Cancer Data Commons)、三届滚动维护;扣分:Synapse 届次页面分散 |
| D8 伦理合规 | ★★★★★ | 联盟伦理流程+PHI 剥离+儿科专用 defacing+去标识发布 |
| 综合评级 | AI-Ready 高位 | 即取即用型基准,主要成本在口径核对而非技术清洗 |
附录 C:逐项证据链自证
| 硬断言 | 来源 |
|---|---|
| 464 例、机构拆分 120/256/61/27 | arXiv:2404.15009(设计论文);arXiv:2412.04094;PLOS ONE 0323398 三源互证 |
| 训练 261/验证 91/测试 86 | arXiv:2412.04094(唯一三段全写来源);261 另有 PLOS ONE/medRxiv 互证 |
| 457 与 348 口径 | TCIA 收藏页(348 subjects/1,649 series、challenge metadata 457);CCDI 目录(457) |
| RAPNO 四区标注 | arXiv:2404.15009v3(“recommended by RAPNO working group”);MDPI 综述(2025)互证 |
| 无生存预测任务 | arXiv:2305.17033 摘要(2023)、arXiv:2404.15009 全文(2024)均为纯分割定义;OS/PFS 变量在 CCDI 目录元数据描述 |
| CC BY 4.0 | TCIA 收藏页 License 列(官方) |
| DOI 10.7937/DX5C-TJ86 | TCIA 收藏页 + HF 镜像引用块 + CCDI 目录三源一致 |
| 冠军榜三届 | GitHub Astarakee/BraTS(官方包,2024 冠军本人维护);2025 冠军另有 Springer LNCS 39/40 章(Yi 团队 rank 1st 自述)互证 |
| 2025 冠军成绩六区 Dice | Springer LNCS 第 40 章(Yi et al.)摘要 |
| 2025 验证榜第一(Li 团队) | Springer LNCS 第 38 章(Li et al.)摘要(“first place on the Task-6 validation leaderboard”) |
| 4 例已知质量问题 | TCIA 收藏页原文列表 |
| 2025 训练集 256 例 | Macquarie 参赛论文(researchers.mq.edu.au 收录)“BraTS-PEDs 2025 training set (256 cases)” |
| 32.7 GB / Aspera | TCIA 收藏页 Images 行 |
| MedPerf syn511569100029 | PLOS ONE 0323398 / medRxiv 25325530(“Data were obtained through Synapse and MedPerf systems”) |
附录 D:数据获取决策树
需要分割标注?
├─ 是 → 需要 2024 届口径(论文复现主流)
│ ├─ 走 TCIA:CC BY 4.0 + DOI 引用,Aspera 下载 32.7GB(训练+验证 348 subjects)
│ └─ 走 Synapse syn53708249:注册后获取挑战赛全套(含挑战文档)
│ → 需要 2025 届口径(Lighthouse Task-6 复现)
│ └─ 走 Synapse syn64153130(训练集 256 例,含杂质设计)
└─ 否 → 只要影像做多组学/联合分析
├─ CBTN 门户(cbtn.org):可联动基因组/临床数据(走 CBTN 数据访问审批)
└─ NCI Cancer Data Commons:NCI 长期托管子集
需要冠军算法当基线?
└─ pip 装 BraTS 官方包 → PediatricAlgorithms.BraTS25_1(GPU)
附录 E:坑点档案(与 §9 对照)
| 坑 | 一句话 | 触发场景 | 解法 |
|---|---|---|---|
| 坑 1 | 规模三口径 464/457/348 | 引用规模、对账下载量 | 主口径 464+注明出处;对账看 §2.1 表 |
| 坑 2 | 261+91+86=438≠464 | 写拆分句 | 引用 2412.04094 并保留差额事实 |
| 坑 3 | 生存预测不是任务 | 复现/综述定位 | 任务写纯分割;OS/PFS 归元数据层 |
| 坑 4 | HF 镜像 NC 声明 | 抄 license | 以 TCIA 页为准(CC BY 4.0) |
| 坑 5 | 两届训练集不同 | 复现 2025 论文 | syn53708249↔2024、syn64153130↔2025 |
| 坑 6 | 2023/2024 标签语义断裂 | 跨届合并数据 | RAPNO 四区自 2024 起;2023 不混入 |
附录 F:与库内 BraTS 家族条目的关系声明
| 条目 | rid | 人群 | 主题 | 互链建议 |
|---|---|---|---|---|
| brats | 24 | 成人 | 胶质瘤分割主线基准(2012-2024) | 本条目"家族成员"段互链;跨人群泛化端点 |
| brats-africa | 683 | 成人 | 撒哈拉以南非洲域偏移赛道 | 本条目"家族成员"段互链;资源场景对照 |
| brats-pediatric | 本条目 | 儿童 | 儿科 HGG 分割(2023-2025) | — |
三个条目共享:四序列 mpMRI 规格、lesion-wise DSC/HD95 指标、nnU-Net 生态、容器化盲评模式。差异轴:人群(成人/成人/儿童)、资源场景(充裕/受限/联盟充裕)、标注体系(NCR/ED/ET 系/RAPNO 儿科系)。
附录 G:许可与引用速查
- 数据本体:CC BY 4.0(TCIA,Version 1 2025/12/19)——署名即合规;
- 必引三件套:数据 DOI 10.7937/DX5C-TJ86 + arXiv:2404.15009 + arXiv:2407.08855;
- 2025 届使用另加:BraTS Lighthouse 2025 论文集(Springer LNCS,ISBN 978-3-032-16365-3);
- HF 镜像(如确需引用):chehablab/BraTS_PED_2024(自声明 CC BY-NC 4.0,要求致谢 chehablab.com)——与官方口径冲突,正式项目不推荐;
- TCIA 数据使用政策:引用义务 + 禁止试图再识别个体(TCIA 通用条款)。
附录 H:规模口径对账表(写作与引用专用)
| 你要写的句子 | 推荐表述 | 数字来源 |
|---|---|---|
| 数据集规模(论文综述) | “464 例儿童高级别胶质瘤的多机构 mpMRI 队列(训练 261/验证 91/测试 86)” | arXiv:2404.15009 + arXiv:2412.04094 |
| 引用 TCIA 下载数据 | “TCIA 托管训练与验证图像 348 subjects / 1,649 series(32.7 GB NIfTI)” | TCIA 收藏页 |
| 引用元数据覆盖 | “挑战赛元数据记录 457 例” | TCIA metadata TSV / CCDI |
| 三口径并提 | “论文口径 464 例;TCIA/CCDI 元数据口径 457 例;TCIA 图像托管 348 subjects——口径差异官方未对账” | 本条目 §2.1 |
| 拆分与总数的差 | “三段拆分合计 438 例,与 464 的差额官方未解释” | 本条目 §2.1 |
附录 I:常见复现失败模式清单(八条)
- 拿成人形状硬编码:按成人 BraTS 240×240×155 预分配输入张量——儿科数据统一 1mm³ 重采样后尺寸不同,先读 NIfTI 头再建模型。
- 标签空间硬对齐:把成人标签编号直接映射(0/1/2/3 对号入座)——儿科是 ET/NET/CC/ED 四区语义,映射前先做语义审查(§3.4)。
- 届次混装:2024(261 例)与 2025(256 例)训练集混在一个目录训练,然后对照任意一届论文数字——必然对不上。
- 误剥颅骨:对官方保留颅骨的数据自行 skull-stripping 再对标挑战赛成绩——破坏了与基准一致的输入分布(除 4 例已知问题案例外应保留颅骨)。
- 忽略 lesion-wise 口径:用全图体素级 Dice 复现对比 lesion-wise DSC 的论文成绩——指标定义不同,数字不可比。
- 验证集当测试集:在 91 例验证集上调参后报告其成绩当"测试成绩"——官方测试 86 例盲评才是终榜口径。
- HF 镜像数据复现 TCIA 论文:第三方镜像(4.06 GB,转存格式)与官方包在格式与完整性上不保证一致——复现一律走 TCIA/Synapse。
- 生存变量越界使用:假设挑战赛公开包逐例带 OS/PFS——以实际 TSV 字段为准;更深层临床数据走 CBTN 审批,勿在论文里声称数据集"含生存预测任务"。
附录 J:检索决策树(按研究目的)
你的目的是?
├─ 训练/改进儿科分割模型
│ ├─ 快速基线 → TCIA 下载 + 官方包调 2025 冠军(BraTS25_1)
│ └─ 冲 SOTA → 主攻 CC/ET 洼地;先读 §4.6 技术路线表
├─ 跨人群/域偏移研究
│ ├─ 成人↔儿童 → 本集 + brats(rid 24),先做标签语义映射
│ └─ 杂质鲁棒性 → 本集 2025 届设计(官方杂质)+ brats-africa(rid 683)
├─ 影像-生存关联研究
│ └─ 元数据 TSV 评估变量粒度 → 不足则走 CBTN/NCI 通道申请
│ (论文表述见 §4.8 安全句式)
├─ 标注方法学研究
│ └─ 半自动+终审流水线(§3)+ 测试集双标规程;人员级明细未公开
└─ 只想跑通一个 MRI 分割流水线
└─ 本集即取即用(NIfTI/1mm³/SRI24 就绪),注意 Aspera/Synapse 通道选择
附录 K:按角色的 30 分钟上手指南
分割算法研究者:读 §2.3/§2.4(规格与标签)→ TCIA 下载训练集 → pip install 官方 BraTS 包跑通 2025 冠军推理 → 用官方评估脚本算 lesion-wise 指标建立基线 → 主攻 CC。
临床/转化研究者:读 §0/§1 与 §2.2(队列构成)→ 检查挑战赛元数据 TSV 的变量粒度 → 决定走公开包还是 CBTN 申请 → 引用走附录 G 三件套。
数据工程/流水线开发者:读 §5.1(五入口表)与附录 I 失败模式 → 选 Synapse CLI 通道(自动化友好)→ 校验 NIfTI 头 spacing 与标签值域(§3.6 五步自查)→ 建立届次分目录。
综述/教材写作者:读 §4.7(三届演进)与 §7(方法学启示)→ 规模引用按附录 H 句式 → 勿把生存预测写进挑战赛任务(坑 3)。
附录 L:本条目双口径存照总表
| 存照项 | 口径 A | 口径 B | 本条目处理 |
|---|---|---|---|
| 患者总数 | 464(挑战赛论文) | 457(TCIA/CCDI 元数据) | 主口径 464,§2.1 三口径并陈 |
| 图像托管数 | 348 subjects(TCIA) | 261+91=352(挑战赛拆分推算) | 差 4 例存照,不圆数 |
| 拆分总和 | 261+91+86=438 | 464(总数) | 差 26 例存照,引用时保留差额 |
| 2025 验证集 | n=91(Springer 39 章口径) | 2024 届验证亦 91 | 是否复用未确认,存照 |
| 2025 训练集 | 256 例(Macquarie 口径) | 2024 届 261 例 | 分届列表(§2.8) |
| License | CC BY 4.0(TCIA 官方) | CC BY-NC 4.0(HF 第三方镜像) | 以 TCIA 为准,冲突披露(§5.3) |
| 2025 榜首 | 测试榜 Yi 团队 | 验证榜 Li 团队 | 双榜并陈(§4.3/§4.6) |
| 官方拼写 | BraTS-PEDs(2023/2024) | BraTS-PED(2025 简称) | 条目名 brats-pediatric,正文注明谱系 |
附录 M:lesion-wise DSC 与 HD95 的计算骨架
评估协议是跨论文比较的生命线,核心实现逻辑(与官方口径一致的定义骨架,供自建评测对齐):
# 伪代码骨架:与 BraTS 官方 lesion-wise 口径对齐的关键点
def lesionwise_dsc(pred, gt, label):
# 1) 取出该标签的二值掩码
p, g = (pred == label), (gt == label)
# 2) 连通域分析:按 lesion(病灶)逐个处理,而非全图体素
lesions = connected_components(g) # ground truth 侧逐病灶
dscs = []
for lesion in lesions:
tp = (pred_in(lesion) & lesion).sum()
# 3) 真负体素(双方都为空的远处体素)不计入——防止大片正常脑组织稀释指标
fp = (p & ~g_in_lesion_context()).sum()
fn = (~p & lesion).sum()
dscs.append(2*tp / (2*tp + fp + fn))
return aggregate(dscs) # 聚合策略以官方评估包为准
def hd95(pred, gt, label):
# 表面距离:两侧表面点集的 Hausdorff 距离取 95 分位
# 4) 空掩码处理规则必须与官方一致(通常该例不计或记罚,读评估包文档)
return percentile(surface_distances(pred==label, gt==label), 95)
四条对齐纪律:①官方评估包为唯一仲裁(论文成绩以 Synapse/MedPerf 回传为准);②空预测/空真值的边界情形处理必须复刻官方规则;③六个区域分别计算,勿只报平均;④如需与排行榜对比,确认该届该榜(验证/测试)再对号。
附录 N:nnU-Net 快速接入骨架
# 数据目录布局(nnU-Net v2 惯例,四序列命名映射)
# imagesTr/
# BraTS-PED-00001-000_0000.nii.gz # 0000 = T1
# BraTS-PED-00001-000_0001.nii.gz # 0001 = T1CE
# BraTS-PED-00001-000_0002.nii.gz # 0002 = T2
# BraTS-PED-00001-000_0003.nii.gz # 0003 = T2-FLAIR
# labelsTr/
# BraTS-PED-00001-000.nii.gz # 整数标签掩码(ET/NET/CC/ED 语义映射见 §2.4)
# dataset.json # 模态声明 + 标签声明(六区域)
nnUNetv2_plan_and_preprocess -d DATASET_ID --verify_dataset_integrity
nnUNetv2_train DATASET_ID 3d_fullres 0 # 5 折交叉验证
nnUNetv2_find_best_configuration DATASET_ID
三条儿科特调提醒:①dataset.json 的标签声明必须按儿科四区语义写,勿复制成人模板的 NCR 声明;②数据已 1mm³ 统一,nnU-Net 的自动重采样计划会尊重原 spacing,预期与挑战赛预处理一致;③2025 届含非颅骨剥离样本,若走"干净训练→全量微调"策略(§4.6 第 39 章路线),先按 §3.6 做颅骨状态筛查再分池。
附录 O:论文 Methods 段数据声明模板(可直接改写)
We used the CBTN-CONNECT-DIPGR-ASNR-MICCAI BraTS-PEDs dataset (The Cancer Imaging Archive, DOI: 10.7937/DX5C-TJ86; challenge design: arXiv:2404.15009; challenge results: arXiv:2407.08855). The cohort comprises 464 pediatric patients with high-grade glioma (including DMG/DIPG) collected via CBTN (n=120), the International DIPG/DMG Registry (n=256), Boston Children’s Hospital (n=61), and Yale University (n=27); per-challenge splits are 261 training (with expert annotations), 91 validation, and 86 withheld testing cases. Each case contains four structural mpMRI sequences (T1, T1CE, T2, T2-FLAIR) pre-processed by the BraTS Pipeline (DICOM-to-NIfTI with PHI removal, SRI24 atlas registration, 1 mm³ isotropic resampling, pediatric-specific defacing). Reference annotations follow the RAPNO working-group subregions: enhancing tumor (ET), non-enhancing tumor (NET), cystic component (CC), and edema (ED), with derived tumor core (TC = ET+NET+CC) and whole tumor (WT = ET+NET+CC+ED) labels. The dataset is distributed under CC BY 4.0. [If 2025 edition: the BraTS-Lighthouse 2025 Task-6 training set (n=256) with officially retained non-skull-stripped cases was used instead; note the two editions are not identical.]
模板四处可调:①届次句(2024/2025 二选一并声明);②拆分句(如只用训练集,显式写"only the training cohort (n=261)"并引 PLOS ONE 2025 先例);③生存研究追加句(“metadata include overall and progression-free survival variables per the NCI CCDI catalog; no survival-prediction task is defined in the challenge”);④机构句(按实际用到的子集调整)。
附录 P:库内互链声明(供发布时嵌入)
发布互链锚点(三端口):
- 端口一:brats (rid 24) — 成人胶质瘤主线(人群轴对端);
- 端口二:brats-africa (rid 683) — 撒哈拉以南非洲域偏移赛道(资源轴对端);
- 端口三:本条目 brats-pediatric — 人群轴-儿童端;标注体系轴-RAPNO 儿科四区。
检索关键词桥:儿童胶质瘤、DIPG、DMG、儿科肿瘤分割、RAPNO。
互链语义:三条目共享评估协议与容器化盲评模式,分别在人群(成人/儿童)与资源(充裕/受限)两轴上互为对端;建议三向互链(A→B、A→C、B→C 全闭环),并在各条目"家族图谱"小节放置本声明块的对应端口。
附录 Q:大事记时间线(2023-2026)
| 时间 | 事件 |
|---|---|
| 2023-05-26 | 首届 BraTS-PEDs 挑战赛论文发布(arXiv:2305.17033) |
| 2023 | 第一届儿科赛道举办;冠军 Capellán-Martín et al. |
| 2024-04-23 | 2024 届设计论文发布(arXiv:2404.15009);标注体系切换 RAPNO 四区 |
| 2024-07 | 2024 届结果论文(arXiv:2407.08855);冠军 Astaraki |
| 2024-12 | 跨赛道方法论文披露三段拆分 261/91/86(arXiv:2412.04094) |
| 2025 | BraTS Lighthouse 2025 Task-6(PED);训练集 256 例;引入非颅骨剥离杂质;测试榜冠军 Yi et al. |
| 2025 | TCIA 正式发表 Version 1(DOI 10.7937/DX5C-TJ86,页面标注更新 2025/12/19) |
| 2025-09-23 | MICCAI 2025(Daejeon)Lighthouse 挑战赛会场 |
| 2026-04-01 | 2025 届挑战赛论文集 Springer LNCS 上线(ISBN 978-3-032-16365-3) |
| 2026-09-27 | 本条目抓取与核验时点 |
附录 R:检索关键词地图(中英双语)
中文主关键词:儿童脑肿瘤分割、儿科胶质瘤数据集、DIPG 影像数据集、弥漫中线胶质瘤 MRI、儿童高级别胶质瘤、脑肿瘤分割挑战赛、儿科医学图像分割、RAPNO 标注。
英文主关键词:pediatric brain tumor segmentation, BraTS-PEDs, BraTS-PED, childhood glioma dataset, DIPG MRI dataset, diffuse midline glioma imaging, pediatric high-grade glioma, RAPNO segmentation, CBTN imaging, lesion-wise Dice。
组合检索建议:病种词 × 方法词(如 “DIPG” + “nnU-Net” / “DIPG” + “radiomics”);机构词 × 任务词(“CBTN” + “segmentation benchmark”);指标词限流(“lesion-wise” + “pediatric”)可显著提高命中精度,避开成人 BraTS 的海量同名文献。
附录 S:成人 BraTS-GLI 与本集的逐维度对照
| 维度 | 成人 BraTS-GLI(2024,rid 24 主题) | 本集(BraTS-PEDs) |
|---|---|---|
| 人群 | 成人弥漫性胶质瘤(多为术后/治疗后场景) | 儿童 HGG/DMG/DIPG(治疗初) |
| 规模 | ~2,200 例(2024 届口径) | 464 例 |
| 标注体系 | ET / NETC / SNFH / RC(引入切除腔 RC) | ET / NET / CC / ED(RAPNO 儿科四区) |
| 任务 | 分割(2024 届成人组另设生存预测系任务于其他赛道) | 分割(三届一贯,无生存任务) |
| 数据特色 | 治疗后影像的切除腔语义 | 囊变成分拆分 + DIPG 弥漫形态 |
| 共享协议 | lesion-wise DSC + HD95、排名求和、容器盲评 | 相同 |
| 引用差异 | 各届论文+数据 DOI | TCIA DOI 10.7937/DX5C-TJ86 + arXiv 双论文 |
附录 T:研究问题 → 本条目章节对照表
| 你的研究问题 | 先读 | 关键字段/工具 |
|---|---|---|
| 儿科分割 SOTA 到哪了 | §4.6/§4.9 | 2025 双榜成绩、rank summation |
| 怎么复现某届冠军 | §4.6 + 附录 N | 官方包枚举、nnU-Net 接入 |
| 队列构成/偏倚 | §2.2/§6.7 | 机构配比 55% DIPGR |
| 标注语义/跨体系迁移 | §2.4/§3.4/§3.5 | RAPNO 四区、标签映射 |
| 影像-生存关联 | §2.7/§4.8/§2.10 | OS/PFS 在元数据层、CCDI 粒度 |
| 数据获取自动化 | §5.7/FAQ G 组 | Synapse CLI、对账 |
| 引用与合规 | §5.8/附录 O/附录 U | 三件套、CC BY 4.0 句式 |
| 基准设计方法论 | §4.7/§7/§7.6 | 三届演进、断代成本 |
附录 U:错误引用 → 正确引用对照
| 错误写法 | 问题 | 正确写法 |
|---|---|---|
| “BraTS-PED 数据集包含 464 例带标注的 MRI” | 验证/测试无标注 | “464 例队列:训练 261 例带标注、验证 91 例无标注、测试 86 例不公开” |
| “该数据集用于生存预测挑战” | 任务证伪(坑 3) | “官方任务为分割;元数据含 OS/PFS 供扩展研究” |
| “数据采用 CC BY-NC 4.0 许可” | HF 镜像误传(坑 4) | “CC BY 4.0(TCIA 官方口径)” |
| “我们的 Dice 达到 92%,超过冠军” | 四要素缺失(Q50) | “2025 届测试集 lesion-wise WT DSC 92.6%(Yi et al., rank 1)” |
| “BraTS-PEDs 2025 数据集(261 例训练)” | 届次错配(坑 5) | “2025 届训练集 256 例(2024 届为 261 例)” |
| “基于 464 例训练了模型” | 拆分失实(坑 2) | “基于训练集 261 例训练(挑战赛队列共 464 例)” |
附录 V:术语首现索引
| 术语 | 首现位置 |
|---|---|
| HGG/DMG/DIPG | §0 |
| RAPNO 四区(ET/NET/CC/ED) | §0/§2.4 |
| 三口径(464/457/348) | §2.1 |
| BraTS Pipeline/1mm³/SRI24/defacing | §2.3 |
| TC/WT 派生标签 | §2.4 |
| lesion-wise DSC/HD95 | §1(Q7)/§4.2 |
| rank summation | §4.9 |
| Synapse/MedPerf 双层基础设施 | §6.4 |
| 三届断代 | §2.8/§4.7 |
| k-匿名/Not Reported | §2.10 |
附录 W:儿科神经肿瘤影像资源格局(本集定位对照)
| 资源 | 性质 | 标注 | 许可 | 与本集关系 |
|---|---|---|---|---|
| BraTS-PEDs(本集) | 多联盟分割基准(464 例 HGG/DMG/DIPG 治疗初) | RAPNO 四区专家标注 | CC BY 4.0(TCIA) | — |
| CBTN 门户 | 临床网络数据湖(影像+基因组+临床) | 无分割标注(部分影像) | CBTN 数据访问审批 | 本集影像的上游来源之一;多组学联动通道 |
| NCI Cancer Data Commons | NCI 基础设施镜像 | 无标注 | NCI 政策 | 本集影像的冗余托管(长期保存) |
| NCI CCDI 目录 | 数据目录/索引层 | — | — | 本集的官方编目(457 例口径出处) |
| 成人 BraTS 系列(rid 24) | 成人基准家族 | NCR/ED/ET 系 | 各届口径 | 人群轴对端;协议同源 |
格局结论(附录 W):在"儿科脑肿瘤 + 专家分割 + 宽松许可"的交叉点上,本集目前没有同规模竞品;CBTN/NCI 通道是它的上游与冗余,不是竞品。检索者若被其他"儿科 MRI 数据集"营销页吸引,先核对三件事:病例数(个位数到数十例的小队列很常见)、是否有专家级分割标注、许可是否允许研究使用——多数情况下会回到本集。
Q56:为什么训练集 261 例在部分论文里被写成"n=261 patients"而另一些写"n=261 cases"?
本集一个 subject 对应一次治疗初扫描(多序列打包),患者=扫描=case,两写法等价;但引用 TCIA 的 “348 subjects / 1,649 series” 时要分清 subject(患者级)与 series(序列级文件数,约 5 个/例:四序列+掩码)。
Q57:测试集 86 例不公开,那论文里的"test Dice"都是官方跑的?
是——参赛者提交容器,官方在受控环境推理并回传指标;论文作者拿到的是官方回传成绩,不是自己算的。第三方论文若自称"在 BraTS-PEDs 测试集上评估",要么是官方流程参与者,要么表述不严谨(常见替代:自留出训练集子集/外部 CBTN 数据,注意甄别)。
Q58:数据集的正式简称到底用哪个?
正式文档首选 BraTS-PEDs(官方拼写);2025 届语境用 BraTS-Lighthouse 2025 Task-6 (PED) 亦可;本库条目名 BraTS-Pediatric 为检索友好命名。同一文档内选一个用到底,首现处给全称。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- lisa2025 — 共享标签:医学影像 / MRI / 医学图像分割 / 儿科 / 挑战赛数据集
- brats — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤 / 挑战赛数据集
- bonbid-hie — 共享标签:医学影像 / MRI / 医学图像分割 / 儿科 / 挑战赛数据集
- crossmoda-2023 — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤 / 挑战赛数据集
- hc18 — 共享标签:医学影像 / 医学图像分割 / 儿科 / 挑战赛数据集
- brats-africa — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- rembrandt — 共享标签:医学影像 / MRI / 脑肿瘤
- promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- crossmoda2022 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

