BraTS-Africa — AI-Ready Wikipedia

撒哈拉以南非洲成人胶质瘤 mpMRI 分割数据集:146 例尼日利亚 1.5T 影像(95 例弥漫性胶质瘤+51 例其他脑肿瘤),MICCAI-CAMERA-Lacuna Fund 挑战赛 2023-2024 两届基准,专家三阶段标注,TCIA CC BY 4.0 公开——为 LMIC 资源受限场景补上全球脑瘤 AI 地图中最空缺的一块

来源 尼日利亚多家诊断中心(TCIA 口径 6 家/NOAJ 论文口径 7 家)临床常规采集的回顾性术前脑 1.5T mpMRI(T1/T1-CE/T2/T2-FLAIR,2010-01~2022-12),经 AfNiA 汇总,按 BraTS 协议预处理(SRI24 配准、1mm³ 重采样、N4 校正、颅骨剥离)并三阶段专家标注 ET/NETC/SNFH 三肿瘤子区域发布时间: 2026-09-27最后更新: 2026-09-27 阅读 20
BraTS-Africa — AI-Ready Wikipedia

信息速览

数据集名称BraTS-Africa — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模146 例患者(95 例弥漫性胶质瘤 + 51 例其他脑肿瘤);挑战赛口径 2023 年 95 例 / 2024 年 115 例
接入方式尼日利亚多家诊断中心(TCIA 口径 6 家/NOAJ 论文口径 7 家)临床常规采集的回顾性术前脑 1.5T mpMRI(T1/T1-CE/T2/T2-FLAIR,2010-01~2022-12),经 AfNiA 汇总,按 BraTS 协议预处理(SRI24 配准、1mm³ 重采样、N4 校正、颅骨剥离)并三阶段专家标注 ET/NETC/SNFH 三肿瘤子区域
AI 就绪度

BraTS-Africa:给全球最缺数据的地方补一块脑瘤拼图

INFOBOX — BraTS-Africa 一屏速览

维度 内容
本质 MICCAI BraTS 挑战赛簇面向**撒哈拉以南非洲(SSA)**的胶质瘤分割数据集+卫星挑战赛(2023/2024 两届)
官方全名 MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge;2024 年为 BraTS 2024 簇 Task 4
数据本体 146 例尼日利亚术前脑 1.5T mpMRI(T1/T1-CE/T2/T2-FLAIR)= 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤
采集 2010-01~2022-12,多诊断中心(TCIA 口径 6 家/NOAJ 口径 7 家),经 AfNiA 汇总
挑战赛拆分 2023:60 训练/15 验证/20 测试(95 例);2024:60/35/20(115 例,测试标签扣留)
标注 nnU-Net 预标注 → 10 名住院医精修 → 2 名注册放射科医生复核 → BraTS 专家神经放射医生终审;ET/NETC/SNFH 三子区域
预处理 BraTS 标准流水线:SRI24 配准、1mm³ 各向同性重采样、N4 偏置场校正、颅骨剥离(CaPTk 1.9.0 + nnU-Net + ITK-SNAP 4.0.0)
两届成绩 2023 上榜 9 队(12 国)、2024 上榜 6 队(7 国);2024 前六名 DSC +9.4%、HD95 -57.21%
获取 预处理版+标签 CC BY 4.0 TCIA 公开(Aspera,1.6GB);未处理原始图 NIH 政策受限;挑战赛数据 Synapse 注册
DOI 数据:10.7937/v8h6-8x67(TCIA,2024-08-31 注册);两届总结论文:10.1093/noajnl/vdag082
核心特色 LMIC(低资源)影像的真实分布:低场设备、层厚 3-5mm、对比度差、序列缺失——全球脑瘤 AI 的天然域偏移测试床
库内互链 brats(主赛本体)、fets(联邦学习)、pengwin(脑膜瘤放疗)、upenn-gbm、rembrandt、ucsf-pdgm、BCN20000
生产声明 2026-09-27 由 agentA-bratsafrica 生产;三源互证,抓取核验时点与证据分级见附录 A/A2

BraTS-Africa 是一个"把顶级赛事搬到全球影像最薄弱角落"的数据集工程:自 2012 年起持续领跑脑肿瘤分割的 BraTS 挑战赛,在前十年里积累的训练数据几乎全部来自高收入国家的 3T 设备;而撒哈拉以南非洲的胶质瘤死亡率不降反升,当地 1.5T 低场设备拍出的图像对比度更差、层厚更厚、序列更容易缺失。BraTS-Africa 在 2023-2024 年把尼日利亚多家诊断中心的真实临床数据(146 例,其中 95 例弥漫性胶质瘤)按 BraTS 标准预处理、专家三阶段标注后开放,并连办两届 MICCAI 挑战赛,用成绩单证明:在主赛上接近满分的算法,搬到这块数据上会重新面对一个"不一样的赛题"。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意 146 例的"公开"只覆盖预处理版,未处理原始图的下载通道已因 NIH 政策下线(坑 4)。
  2. 关心模型泛化:直奔 §7 LMIC 场景与图像质量——SNR/CNR 量化对比与 SSA 独有临床特征是本条目的灵魂。
  3. 分不清它和 BraTS 主赛:直奔 §4 关系专节——三套例数口径(146/115/95)、两届拆分、规则差异一张表说清(坑 1)。

一分钟导航(全文 11 节 + FAQ + 附录的功能地图):

你想知道 去哪 关键产出
数据长什么样 §2 146 例构成/设备矩阵/文件结构/三套拆分
标签靠谱吗 §3 三阶段流水线/单专家终审声明
和 brats 主赛什么关系 §4 必答对照表/十 Task 全景/泄漏警告
挑战赛成绩 §5 两届队伍数/指标公式/解读陷阱
怎么下载与合规 §6 门禁全表/实操问答/CC BY 4.0 边界
凭什么说"难" §7 MRIQC 五指标/域偏移清单/公平性边界
学术生态位 §8 论文谱系/大事记/易混淆对象辨析
快速避坑 §10 八个坑一次读完
30 秒决策 §11 决策卡
深度问答 FAQ 42 问
引用格式 附录 D BibTeX 三件套

时间线速览(详细版见 §8.4):

时点 事件
2010-01~2022-12 尼日利亚多中心临床常规采集(1.5T,四序列 mpMRI)
2023-05 首届挑战赛启动(BraTS 2023 簇分割子任务,时名 BraTS2023-SSA),95 例胶质瘤上线
2023-10 2023 届终评:9 队上榜(12 国),MICCAI 温哥华卫星活动
2024-04-16 BraTS 2024 簇设计文档发布(Zenodo 10978906),SSA 列为 Task 4
2024-05~08 第二届挑战赛:115 例拆分(60/35/20),规则收紧
2024-08-31 TCIA DOI 注册(10.7937/v8h6-8x67);146 例全集 version 1(2024-09-04 页面更新)
2024-10 2024 届终评:6 队上榜(7 国),MICCAI 马拉喀什卫星活动
2024-12 Zenodo 出现 5001_BraTS-SSA_2023 模型记录(14510931/14510932,非数据本体,坑 3)
2025 两篇正式论文发表:NOAJ vdag082(两届总结)、Radiol Artif Intell e240528(数据集描述)
2026(抓取时点) 本条目撰写;第三方综述数字污染已存照(坑 5),TCIA version 1 仍为现行版本

§0 导读:这个数据集解决什么问题

胶质瘤(glioma)是最常见的原发性脑肿瘤,也是最致命的癌种之一——约 30%-80% 的患者在确诊后五年内死亡,胶质母细胞瘤(glioblastoma, GBM)患者约 80% 活不过两年。过去三十年,美国凭借研究积累把胶质瘤死亡率降低了约 7%;1990-2016 年间全球北方(Global North)的胶质瘤死亡率下降了 10%-30%。同一时间窗里,撒哈拉以南非洲的胶质瘤死亡率平均上升了约 25%。死亡率的剪刀差背后是一整条诊断-治疗链的资源缺口:就诊晚、HIV 等感染性合并症高发、治疗设施短缺,以及一个对 AI 落地最关键的事实——当地影像科和神经放射专家极度稀缺,且医疗影像基础设施落后。

BraTS 挑战赛(International Brain Tumor Segmentation Challenge)自 2012 年起为脑肿瘤分割提供了事实上的全球基准,到 2021 年数据集已扩至 2000+ 例、2023 年簇扩至 4500+ 例。但这些数据几乎全部来自高收入国家:3T 高场设备、标准协议、完整四序列。把这些数据上训练出的最先进模型直接用于 SSA 临床,会遇到三重鸿沟:

鸿沟 内容 对模型的直接影响
设备代差 SSA 广泛使用 1.5T 低场设备(本数据集 146 例无一例外),磁化率伪影与强度不均更重 强度分布整体偏移,依赖高强度先验的模型失准
采集异构 各中心自定协议,层厚 3-5mm 非各向同性,序列缺失常见 空间分辨率突变、插值平滑、输入通道信息量不齐
疾病分布 就诊晚(瘤体大)、胶质瘤病样表现更多、感染性类似物与合并症背景更复杂 病变尺度与形态先验失效,假阳/假阴模式改变

三重鸿沟叠加成典型的域偏移(domain shift):模型在自家数据上 Dice 0.9,换到 SSA 图像上没有人知道还剩多少——而没有任何一个公开数据集能系统地量化这件事,直到 BraTS-Africa 出现。

BraTS-Africa 出现后仍未解决的开放问题(使用前建立预期):

  • 规模天花板:146 例对"测量域偏移"够用,对"在域内训练出鲁棒模型"仍然紧张——小数据方法学本身还是开放课题;
  • 泛化半径:尼日利亚→非洲其他国家的分布外推(西非 vs 东非 vs 南非的设备谱、疾病谱差异)没有数据支撑;
  • 标注天花板:单专家终审+无分子标签,决定了它只能回答"影像学分割"层面的问题;
  • 时间性:采集止于 2022-12,设备在换代、协议在演化,快照式数据与持续漂移的真实世界之间有时滞。

BraTS-Africa 的回答是一套"数据+赛事+网络"的组合拳。数据层面:把尼日利亚多家诊断中心 2010-2022 年的回顾性术前 mpMRI 经非洲神经影像归档(AfNiA,Africa Neuroimaging Archive)汇总,按 BraTS 协议统一预处理,由"住院医精修→注册放射科医生复核→BraTS 专家终审"三阶段流水线标注三个肿瘤子区域,最终 146 例在 TCIA 以 CC BY 4.0 公开。赛事层面:2023、2024 连办两届挑战赛(隶属 MICCAI BraTS 簇),评估沿用 lesion-wise DSC 与 HD95,模型以 MLCube 容器经 MedPerf 平台自动评测。网络层面:依托 CAMERA 协作(其本职即为非洲 MRI 教育与科研联盟)与 Lacuna Fund for Health Equity 资助,把数据采集、专家培训与赛事激励(非洲队伍专项资助)拧成一股可持续扩充的机制。

这个条目还站在三个学科的交界处,各学科读者会带走不同的东西:

  • 医学图像分割:一个现成的"分布外评测集"与一条成熟的低资源迁移路线(§5、§7);
  • 全球健康/健康信息学:一个把"影像可及性不平等"翻译成可测量指标与可复用基础设施的案例(§7.1、§7.7);
  • 公平性机器学习(fairness ML):一个比"人口统计分组"更底层的公平性样本——不平等先于算法存在,数据工程是干预的第一杠杆(§7.5-§7.7)。

三学科交界处的独特提醒:分割社区关心"指标",全球健康社区关心"机制",fairness 社区关心"权力结构"——BraTS-Africa 的完整性恰恰在于三者都有可核实的内容:指标有两届榜单,机制有 AfNiA/CAMERA/Lacuna 三件套,权力结构至少有"谁在终审标签、谁拿资助、谁上榜单"的公开记录。

§0 读法三则:

  1. 这个条目是"数据集+挑战赛+公平性叙事"三合一:本体是 146 例标注 mpMRI,赛事是两届 MICCAI 挑战赛,叙事是"AI 医疗公平"的实证案例——三者共享同一套数字,但口径不同(§1 Q3)。
  2. 全文统计数字均出自 TCIA 官方页、NOAJ 两届总结论文(vdag082)、Radiology: Artificial Intelligence 数据描述论文(e240528)与 arXiv:2305.19369,三源互证;多口径冲突处在坑点清单集中存照。
  3. 检索时"BraTS-Africa"“BraTS2023-SSA”"BraTS-SSA"三个名字指同一件事的不同侧面,Zenodo 上的"5001_BraTS-SSA_2023"却是模型记录而非数据本体——命名考古见坑 7。

§1 数据集速览:十问十答

Q1:BraTS-Africa 的"146 例"怎么构成?
TCIA 全集口径:146 例患者,其中 95 例为弥漫性胶质瘤(含低级别胶质瘤 LGG 与胶质母细胞瘤/高级别胶质瘤 GBM/HGG),51 例为其他脑肿瘤(other neoplasms of the brain)。146 例均附专家标注的肿瘤子区域与扫描地点/设备/诊断元数据。95/51 的拆分来自 DataCite 注册描述与 Radiology AI 论文,是官方口径而非第三方估算。

Q2:图像是怎么来的?
尼日利亚多家诊断中心 2010 年 1 月至 2022 年 12 月作为标准临床护理采集的回顾性术前脑 MRI,全部为 1.5T 设备(Siemens Magnetom Essenza、Philips Achieva、GE SIGNA Explorer/Creator),四序列 mpMRI(T1、T1-CE、T2、T2-FLAIR),从 PACS 提取为 DICOM 后转 NIfTI。采集不是研究专用协议——这是它"真实世界分布"价值的来源,也是它"难"的来源。

Q3:为什么还有 95 和 115 两个数字?
那是挑战赛口径:2023 届用 95 例胶质瘤(60 训练+15 验证+20 测试);2024 届扩展为 115 例(60 训练+35 验证+20 新测试,其中 35=2023 的 15 验证与 20 测试并入,测试标签扣留)。146 例 TCIA 全集是 2024 年 8 月发布的"最终形态",比任何单届挑战赛都大。三个数字的关系图见 §2.1。

Q4:预处理做了什么,原始数据也公开吗?
按 BraTS 标准流水线:LPS 重定向→T1-CE 刚性配准到 SRI24 模板→1mm³ 各向同性重采样→其余序列间接配准→N4 偏置场校正→颅骨剥离→强度归一化。预处理版(146 例 730 studies,1.6GB)CC BY 4.0 公开可下载;未处理原始 NIfTI(585 studies)受 NIH 受控数据政策限制,下载通道已下线——这意味着外部用户无法从头复现预处理管线,只能使用官方预处理产物。

Q5:标注流程与可靠度?
nnU-Net 预标注→10 名放射科住院医受训精修→2 名 board-certified 放射科医生复核→一位有 5 年以上脑肿瘤分割经验的美国 board-certified 神经放射专家终审批准(ITK-SNAP 4.0.0 逐例进行)。标签为 BraTS 2024 三子区域方案:ET(增强肿瘤)/NETC(非增强肿瘤核心)/SNFH(周围非增强 FLAIR 高信号)。流水线细节见 §3。

Q6:挑战赛办得怎么样?
2023 届 9 支队伍上榜(参与者来自 12 国);2024 届 6 支队伍(7 国)。评估指标沿用 BraTS 的 lesion-wise DSC 与 HD95 加权组合。2024 届前六名相对 2023 届 DSC 提升 9.4%、HD95 降低 57.21%——一年时间在小数据上仍有可观进步空间。2023 届上榜方法包括 nnU-Net 改造(ODConv2D)、AGU-Net、TCuP-GAN、SAM+YOLOv8 等,全景见 §5.3。

Q7:这数据"难"在哪,为什么值得专门设一个赛道?
三件事叠加:1.5T 低场+厚层厚(3-5mm)带来的低对比度/低分辨率;序列缺失与采集协议异构;SSA 疾病谱特点(就诊晚、瘤体大、胶质瘤病样表现、感染性类似物)。用 MRIQC 五指标(SNR/CNR/CJV/EFC/QI1)对 50 例未处理 BraTS-Africa 与 50 例 TCGA-GBM 对照扫描做统计比较,差异显著(P<.05)——这使它成为全球脑瘤 AI 域偏移评测中样本量最大的"真实低资源"数据之一(§7.2)。

Q8:和库内 brats 条目什么关系?
同一家族:BraTS-Africa 是 BraTS 挑战赛簇的 SSA 分赛道——2023 年为 BraTS 2023 挑战赛五个分割子任务之一(BraTS2023-SSA),2024 年并入 BraTS 2024 Cluster of Challenges 成为 Task 4。训练集 60 例与 BraTS 2023-SSA 完全一致。但数据来源、设备分布、标注终审团队与主赛不同,两者不可混为一谈(§4 专节、坑 1)。

Q9:我现在能拿到什么?
三层:预处理图像+分割标签走 TCIA 公开下载(CC BY 4.0,需 IBM Aspera Connect 插件);XLSX 元数据公开直链;挑战赛训练/验证数据在 Synapse 注册获取(2023: syn51156910;2024: syn59059780);测试集标签不公开。实操细节与门禁全表见 §6。

Q10:谁能用它做什么?
分割模型开发者用它做低资源/域偏移评测与迁移学习;方法学研究者用它研究"预训练-微调"在数据分布突变下的行为;全球健康研究者用它论证 LMIC AI 落地的可行性;教学场景用它展示"真实世界影像长什么样"。不适合:需要分子分型标注(IDH/MGMT)、多时间点纵向随访、或儿童肿瘤的研究(§11.3)。

§1 补充:五个常见误解,一次拆完

误解一:“BraTS-Africa 是 BraTS 数据集的非洲子集。”
反了。BraTS-Africa 的数据来自独立的采集网络(尼日利亚多中心、AfNiA 汇总),与主赛数据零重叠;它"属于"BraTS 的是赛制、协议与评估体系,不是数据。把它理解成"主数据的非洲抽样"会同时犯两个错:既低估其采集独立性,又高估其与主数据的可比性。

误解二:“146 例都是胶质瘤。”
146 例 = 95 例(挑战赛口径)/115 例(2024 口径)弥漫性胶质瘤 + 51 例其他脑肿瘤。51 例的存在让全集可以服务更广的脑肿瘤研究,但也意味着"拿全集跑胶质瘤分割基准"之前要先做子集过滤(§2.5)。

误解三:“数据在 Zenodo 上。”
BraTS-Africa 的数据本体 DOI 在 TCIA。Zenodo 10978906 是 2024 簇十个 Task 的设计文档;Zenodo 14510931/14510932 是名为 5001_BraTS-SSA_2023 的模型记录。三条 Zenodo 线索都搜得到"BraTS"和"SSA"字样,但没有一条是数据下载页(坑 3)。

误解四:“图像质量差所以不能用于严肃研究。”
质量差异是特性不是缺陷。MRIQC 五指标的统计对照让"质量差"变成可量化的实验变量;对域泛化、公平性、预处理鲁棒性研究而言,这种"不完美"正是价值所在。当然,若你的研究假设要求高质量 3T 数据,这个数据集确实不合适——那是研究设计不匹配,不是数据不好。

误解五:“2024 届成绩提升 9.4% 说明问题快解决了。”
两届比较建立在不同的测试集与不同的规则基线上(2024 禁额外数据预训练进排名),且 6 队上榜的小样本使统计功效有限。更稳的读法是"该赛道仍有大改进空间"而非"接近解决"。

§2 数据构成与规格

2.1 规模、来源与多口径例数

BraTS-Africa 的例数在不同语境下有三个数字,全部正确、各有用途——这是使用该数据集前必须建立的第一层心智模型:

口径 例数 构成 出处
TCIA 全集(发布口径) 146 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤 TCIA collection 页/DataCite(DOI 10.7937/v8h6-8x67)
2023 挑战赛(胶质瘤子集) 95 60 训练 / 15 验证 / 20 测试 NOAJ vdag082、Radiol AI e240528、arXiv:2305.19369
2024 挑战赛(胶质瘤子集) 115 60 训练 / 35 验证 / 20 新测试 NOAJ vdag082(35=15 验证+2023 的 20 测试并入)

时间线上的逻辑关系:95 例胶质瘤在 2023 年 6 月作为挑战赛数据上线(其中 20 例扣留作测试);2024 届把 2023 的测试集并入验证集并新增 20 例测试,合计 115 例;2024 年 8 月底 TCIA 发布的 146 例全集在 115 例胶质瘤之外补充了 51 例其他脑肿瘤。三个数字的包含-演变关系一图流:

        2023 届           2024 届                TCIA 全集
   ┌─────────────┐   ┌─────────────┐      ┌──────────────────┐
   │ 95 例胶质瘤  │   │ 115 例胶质瘤 │      │     146 例        │
   │ 60/15/20    │ → │ 60/35/20    │ ───→ │ 115 胶质瘤        │
   │             │   │  ↑并入测试15 │      │ + 51 其他脑肿瘤    │
   └─────────────┘   │  新测试 20   │      └──────────────────┘
                     └─────────────┘
   测试标签始终扣留;146 例全集图像与标签公开(预处理版)

来源机构方面,数据经 AfNiA(Africa Neuroimaging Archive)汇总。NOAJ 论文列出 7 家尼日利亚诊断中心:Crestview Radiology Ltd.(拉各斯)、Lagos University Teaching Hospital(LUTH)、Lagos State University Teaching Hospital(LASUTH)、Lily Hospital Benin、NSIA Kano Diagnostic Center、MedHub Africa Owerri、National Hospital Abuja。而 TCIA collection 页与 DataCite 描述均写"six diagnostic centers",且 TCIA 设备明细表只列 5 家(CRV、LASUTH、LILY、NKDC、MEDHUB)。两口径的差值最可能落在 LUTH(Lagos University Teaching Hospital)的归属上(坑 2)。引用时建议:机构名单引 NOAJ(7 家),规模总述引 TCIA(6 家),并注明口径。

纳入标准:2010-01~2022-12 期间、具有脑肿瘤临床表现的脑 MRI,涵盖中枢神经系统肿瘤、弥漫性胶质瘤、LGG 或 GBM/HGG。排除标准:非 MRI 影像、2010 年以前或 2022 年 12 月以后的扫描。

2.2 设备与原始采集规格

TCIA 设备明细表(BraTS-Africa_TCIA_datainfo_v2.xlsx 配套页面)列出的 1.5T 设备矩阵:

中心(缩写) 厂商 型号 T1 分辨率 (mm) T2 分辨率 (mm) T2-FLAIR 分辨率 (mm)
CRV(Crestview Radiology) Siemens Magnetom Essenza 1×1×5 1×1×5 1×1×5
LASUTH Philips Achieva 1×1×4.5 1×1×5 1×1×5
LILY(Lily Hospital Benin) GE SIGNA Explorer 1×1×3 1×1×3 1×1×3
NKDC(NSIA Kano Diagnostic Center) Siemens Magnetom Essenza 1×1×5 1×1×5 1×1×5
MEDHUB(MedHub Africa Owerri) GE SIGNA Creator 1×1×4 1×1×4 1×1×4

三个观察点:第一,全部为 1.5T——没有一台 3T,这与 BraTS 主赛数据形成代差;第二,层面内 1mm 但层厚 3-5mm,是明显的非各向同性采集,重采样到 1mm³ 必然引入层间插值伪信息;第三,三家厂商(Siemens/Philips/GE)五种型号并存,强度分布与伪影模式天然异构——对域泛化研究是富矿,对追求单一分布的训练是噪声源。

第四个观察藏在表格外:设备表中 NKDC(NSIA Kano Diagnostic Center)位于卡诺(尼日利亚北部),其余中心集中于拉各斯/贝宁城/奥韦里(南部)——地理跨度本身就说明这不是单一城市便利样本,而是有意构建的多区域采集网络(这也与 AfNiA 的全国性归档定位一致)。每例扫描的"地点"字段让使用者可以把这条地理轴纳入分析,是主赛数据没有的维度。

每个扫描以 DICOM 从 PACS 提取、去标识去面(de-facing)后转 NIfTI,“保留原始分辨率与方向”(unprocessed 版);预处理版则进入 BraTS 流水线(§2.3)。

2.3 预处理流水线:与 BraTS 主赛完全对齐

为了让 SSA 数据能直接进入既有 BraTS 工具链,预处理完全沿用国际 BraTS 挑战赛协议,工具链为 CaPTk 1.9.0(DICOM→NIfTI、SRI24 配准、重采样)+ nnU-Net(颅骨剥离、强度归一化、预标注)+ ITK-SNAP 4.0.0(标注审核):

  1. 重定向:全部 mpMRI 体数据重定向到 LPS(左-后-上)坐标系;
  2. 锚定配准:以 T1-CE(钆对比后 T1)为锚,6 自由度刚性配准并基于 SRI atlas 重采样到 1mm³ 各向同性;
  3. 级联配准:T1、T2、T2-FLAIR 先求对 T1-CE 的刚性变换矩阵,再与"T1-CE→SRI"变换矩阵复合,间接配准到公共模板;
  4. 偏置场校正:全部序列做 N4 校正,缓解低场设备更严重的磁场不均引起的强度不均匀;
  5. 脑提取:标准颅骨剥离,去除颈部、脂肪、眼球与颅骨等非脑组织,生成脑掩膜;
  6. 强度归一化:nnU-Net 自定义流程完成。

预处理后每例的四个序列与分割标签体数据规格统一(1mm³ 等向)。第三方复现实验(如 BraTS-SSA 参赛方案)统计的预处理后体数据尺寸约在 136×170×140 至 240×240×155 范围——同一数据集不同来源描述的矩阵尺寸不一,正是"官方预处理产物 vs 自行重采样"两种口径的痕迹(坑 8)。

每一步"为什么这么做"的注解(理解流水线比复述流水线更重要):

  • 为什么以 T1-CE 为配准锚? 钆对比后 T1 上解剖结构(脑室、脑沟)与病灶边界同时清晰,是四序列中空间特征最丰富的一路;先把它钉到 SRI24,其余序列"搭车"过去,误差传播链最短。
  • 为什么 6 自由度刚性就够? 同一患者同一次检查的四序列,头动是刚体运动;引入缩放/形变(更高自由度)反而会把设备差异伪装成解剖差异。
  • 为什么重采样到 1mm³? 主赛数据的标准规格——上游 3-5mm 层厚在这里被超采样插值。注意:插值不创造信息,只是让维度对齐;层间细节的缺失是物理事实,模型侧不要假装 1mm³ 就有 1mm 分辨率。
  • 为什么 N4 校正不可省? 低场强下磁场不均导致的强度漂移更严重;不校正的话,跨中心训练时模型会把"扫描仪位置"当特征学进去。
  • 为什么颅骨剥离要清到眼球与颈部? 去面(de-facing)负责隐私,颅骨剥离负责建模——把非脑组织清干净后,分割网络的感受野全部花在脑组织上,也顺带消除了一个再识别通道。
  • 为什么还要强度归一化? 三厂商五型号的绝对强度刻度互不可比;归一化把"设备指纹"压到最低,是跨中心训练的第一道防线。

这六条注解合起来就是一份"为什么 BraTS 协议在低资源数据上更重要"的清单:同样的步骤在 3T 标准协议数据上是"例行公事",在 1.5T 混合协议数据上是"决定成败"。

2.4 标签体系:三个肿瘤子区域

标注沿用 BraTS 协议的三子区域方案(2024 年命名法):

标签 英文全称 定义要点 不包含
ET Enhancing Tumor(增强肿瘤) 钆对比后 T1 相对平扫 T1 信号明显增高的全部肿瘤部分 邻近异常增粗血管;固有 T1 高信号
NETC Non-Enhancing Tumor Core(非增强肿瘤核心) 肿瘤核心(外科通常切除部分)中不强化的一切:坏死、囊变、钙化、延伸入瘤的外生性骨质增生;含瘤内出血与脂肪等固有 T1 高信号 强化成分
SNFH Surrounding Non-Enhancing FLAIR Hyperintensity(周围非增强 FLAIR 高信号) 肿瘤核心周围、不属于核心的全部 FLAIR 信号异常范围 非肿瘤性 FLAIR 异常(陈旧梗死、微血管缺血性白质改变等)

论文特别提醒:这三个子区域是影像学定义而非生物学实体——例如 ET 的边界依赖 T1c 上的强化表现,而强化与否受血脑屏障状态与设备对比度影响。在低场设备上,这一"影像学定义"与真实肿瘤范围的偏差会被进一步放大,是解读该数据集标注时必须携带的背景。

标签体数据本身为单通道整型 NIfTI,背景为 0、三个子区域各占一个非零值;下游若需 BraTS 传统"整瘤 WT / 肿瘤核心 TC / 增强瘤 ET"三通道派生,可按包含关系合成(WT=ET∪NETC∪SNFH,TC=ET∪NETC,ET=ET)。注意传统口径的"TC"在新命名体系下对应 ET∪NETC 的并集而非 NETC 单独——新旧缩写混用是文献对照的高频错误源(坑 6)。

第三方统计(openmedlab 口径,基于 2023 训练集 60 例):NETC 出现率约 91.7%(55/60),Oedema 与 ET 全部出现;NETC 体积中位数约 9cm³、ET 中位数约 28cm³、水肿区中位数约 94cm³——大瘤体、大水肿是 SSA 晚就诊特征的直观体现。(该统计为第三方口径,官方论文未逐例公开体积表,引用时注明。)

2.5 与 146 例全集的关系边界

使用前必须分清三层资产:

  1. 挑战赛子集(95→115 例胶质瘤):Synapse 下载,训练/验证公开、测试标签扣留,服务于排名评估;
  2. TCIA 全集(146 例):含 51 例非胶质瘤脑肿瘤,预处理版 CC BY 4.0,服务于研究社区;
  3. 未处理原始 NIfTI(146 例 585 studies):TCIA 页面在册但下载通道 Unavailable(NIH 政策),目前实际不可获取。

一个容易踩的坑:51 例"其他脑肿瘤"没有公开的逐例病理构成表(只有 XLSX 诊断字段),文献中"BraTS-Africa 146 例胶质瘤数据集"的表述不准确——严格说是"146 例脑肿瘤,其中 95 例(2023)或 115 例(2024)用于胶质瘤分割挑战赛"。

51 例扩充的双重价值与两重陷阱:

价值一,研究面拓宽——分割标签体系(三个肿瘤子区域)在非胶质瘤脑肿瘤上的适用性本身是研究问题:脑膜瘤、转移瘤等在"ET/NETC/SNFH"框架下的表现与胶质瘤不同,这为"标签体系可迁移性"提供了素材;价值二,负样本池——做胶质瘤检测/分类时,非胶质瘤肿瘤是天然的难负样本来源。

陷阱一,标签语义错位——三子区域定义是按胶质瘤影像学特征写的(如 NETC 含"外生性骨质增生"),机械套用到其他肿瘤类型会产生语义模糊的标注;陷阱二,队列构成不可分解——51 例的病理类型分布未公开明细,想做"按肿瘤类型分层"的研究者要先向 XLSX 诊断字段逐例确认,且无法保证每层有足够样本量。

2.6 文件结构与病例 ID

TCIA 预处理版沿用 BraTS 家族的目录与命名惯例,每例一个目录、五个文件(四个序列+一个分割):

BraTS-Africa/
├── BraTS-SSA-00001-000/
│   ├── BraTS-SSA-00001-000-t1n.nii.gz      # T1 加权(非增强)
│   ├── BraTS-SSA-00001-000-t1c.nii.gz      # T1 加权(钆对比后,配准锚点)
│   ├── BraTS-SSA-00001-000-t2w.nii.gz      # T2 加权
│   ├── BraTS-SSA-00001-000-t2f.nii.gz      # T2-FLAIR
│   └── BraTS-SSA-00001-000-seg.nii.gz      # 三子区域分割标签
├── BraTS-SSA-00002-000/
│   └── ...
└── ...

ID 规则解读:BraTS-SSA-XXXXX-YYY 中五位数段为患者标识、三位数段为研究/时相标识(本数据集均为术前单时相,三位段通常为 000)。注意三点:其一,ID 前缀 BraTS-SSA 承袭 2023 届注册名(BraTS2023-SSA),不代表数据只含 SSA 胶质瘤子集——51 例非胶质瘤扩充同样使用该前缀;其二,从 ID 数字段无法读出训练/验证/测试归属,分箱靠 Synapse 拆分表;其三,序列文件名后缀在不同年份的 BraTS 材料中有 -t1n/-t1c/-t2w/-t2f 与 -t1/-t1ce/-t2/-flair 两套写法,读代码时按目录内实际文件名适配。

一个具体案例(假想 ID,展示命名逻辑而非真实条目):BraTS-SSA-00042-000-t1c.nii.gz 应读作"SSA 数据集、患者 00042、该患者首个(也是唯一)研究时相、钆对比后 T1 序列"——同一患者的五个文件共享 BraTS-SSA-00042-000 前缀,只是序列后缀不同。若你下载后发现某患者目录缺某个序列文件,先查 TCIA 页面的 sanity check 说明再怀疑下载完整性——官方预处理产物保证四序列齐全,缺文件几乎总是下载中断所致。

配合 TCIA 的 XLSX 元数据(每例的扫描地点、设备型号、诊断),可以重建"中心×设备×诊断"的交叉表——这是本数据集相对主赛多出的一个分析维度(主赛数据不带逐例中心归属)。

2.7 三套拆分的对照与使用场景

拆分口径 数据量 公开内容 适用场景 不适用场景
2023 挑战赛(95 例:60/15/20) 95 训练 60(带标签)+验证 15(不带标签) 复现 2023 届成绩、历史对比 用 2023 测试 20 例自评(标签扣留)
2024 挑战赛(115 例:60/35/20) 115 训练 60+验证 35(均公开图像,验证无标签) 2024 届复现、迁移学习基准 测试 20 例自评
TCIA 全集(146 例) 146 全部图像+标签(预处理版) 自由实验、跨中心分析、非胶质瘤研究 与挑战赛排行榜直接对齐(拆分不同)

最关键的一条使用纪律:TCIA 全集的 146 例图像与挑战赛的 115 例有重叠——如果你用 TCIA 全集(含标签)训练后再去 Synapse 挑战赛验证集上"刷分",属于数据泄漏(训练集 60 例+验证 35 例均在全集内且带标签)。做严肃基准时二选一:要么完全用 TCIA 全集自建拆分,要么完全遵守挑战赛拆分,不要混用。

2.8 与 BraTS 主赛数据的规格对照

维度 BraTS 主赛(2021-2024 成人胶质瘤主数据) BraTS-Africa
场强 3T 为主(部分 1.5T) 全部 1.5T
层厚 1mm 各向同性采集 3-5mm 采集后重采样
厂商/协议 多中心但协议较统一 三厂商五型号、各中心自定协议
序列完整性 四序列完整为入组条件 预处理版要求完整;原始临床场景缺失常见
体数据规格 240×240×155(1mm³) 同规格(重采样产物)
目录/ID BraTS-GLI-… / BraTS-PED-… 等 Task 前缀 BraTS-SSA-…
患者数(胶质瘤) 数千例 95-115 例
逐例中心归属 不公开(部分子集除外) XLSX 提供扫描地点与设备

对照的结论一句话:下游格式完全互通,上游分布完全不同——这正是"主赛预训练→Africa 微调"成为标准姿势、也是"Africa 数据成为域偏移试金石"的同一枚硬币的两面。

2.9 元数据能回答的四个多维问题

TCIA 附带 XLSX(扫描地点、设备型号、诊断)使本数据集支持四类主赛数据难以支持的分层分析:

  1. 厂商效应:Siemens(Essenza)×2、Philips(Achieva)、GE(Explorer/Creator)的强度分布与伪影模式不同——可以把厂商作为分组变量,测模型跨厂商泛化;
  2. 层厚效应:3mm(LILY)至 5mm(CRV/NKDC)的原始层厚梯度——研究"重采样损失与原始层厚的关系"的现成自变量;
  3. 中心效应:按"扫描地点"聚合,可做 leave-one-center-out 式的中心外推实验(数据量允许粗粒度版本);
  4. 诊断构成:按诊断字段过滤胶质瘤/非胶质瘤子集,或在 51 例扩充上做"分割标签在非胶质瘤上的适用性"检验。

四个方向的共同前提:先读 XLSX 字段口径(列名、缺失标记),再做聚合——元数据表只有 17KB,逐例核对成本很低,是本数据集使用前性价比最高的十分钟。

§3 标注流水线:三阶段把 DL 预标注变成参考标准

3.1 为什么用"预标注+人工精修"而非纯手工

146 例 × 四序列 × 三子区域的全手工体绘制,在专家资源稀缺的语境下(SSA 神经放射医生本来就少)既慢又贵。BraTS-Africa 采用与 BraTS 主赛一致的"DL 预标注+分层人工审核"模式:custom nnU-Net 先对每例做三子区域预分割,人工从"画"退到"改",效率与一致性同时受益。这也意味着:预标注模型的系统性偏差(如在低对比度图像上倾向保守)会被带入参考标签的初稿,依赖后续人工层级纠偏。

3.2 三阶段人员结构与职责

阶段 人员 职责 工具
0 预标注 custom nnU-Net 生成 ET/NETC/SNFH 三子区域初稿(按 BraTS 2023 标签定义) nnU-Net
1 精修 10 名放射科住院医(radiology residents) 受训后逐例精修 DL 分割,形成参考标签草案 ITK-SNAP 4.0.0
2 复核 2 名 board-certified 放射科医生 逐例复核纠错、统一判定尺度 ITK-SNAP 4.0.0
3 终审 1 名美国 board-certified 神经放射专家(>5 年脑肿瘤分割经验,含 DL 方法开发经验) 逐例批准,形成 ground truth ITK-SNAP 4.0.0

这套"住院医劳动+注册医生把关+资深专家终审"的三层结构与库内 PANDA-PLUS 的"学生注释+高年级复核+30 年专家终审"高度同构——在标注经济学上,两者都把最贵的专家时间压缩到最后一道工序。差异在于 BraTS-Africa 的终审是单人单点(一位 BraTS 专家),没有披露多位专家间一致性检验数据;对标注噪声敏感的使用者应把标签视为"单专家参考标准"而非"多专家共识"。

3.3 标注定义中的临床判断

官方标注协议里埋着几处需要经验判断的规则,值得摘录(它们直接决定标签质量的上限):

  • ET 排除血管:即使异常增粗的邻近血管在 T1c 上同样强化,也不计入 ET——这要求标注者有区分"强化血管 vs 强化肿瘤"的能力,而在低分辨率图像上两者灰度接近;
  • NETC 吞并固有 T1 高信号:瘤内出血、脂肪等非坏死成分计入 NETC,因为它代表"外科医生会切除的核心非强化部分"——这是一个手术视角而非纯病理视角的定义;
  • SNFH 排除非肿瘤性 FLAIR 异常:陈旧梗死、微血管缺血改变要从水肿/浸润区中剔除——在合并 HIV、脑血管病负担高的 SSA 人群中,这类"背景干扰"更常见,标注难度更高。

论文用一句话概括了所有这些定义的局限:“The BraTS tumor sub-regions are image-based and may not reflect strict biologic entities”——子区域是影像学构造物,不严格对应生物学实体。

3.4 标注协议的跨体系对照

三子区域标签在不同文献体系中的对应关系(读第三方论文时的翻译表):

本文体系(BraTS 2024) BraTS 传统口径 常见同义写法 语义要点
ET ET(enhancing tumor) 增强肿瘤、强化区 T1c 强化部分
NETC NCR/NET(necrotic & non-enhancing tumor core) 坏死核心、非强化核心 非强化的瘤核心(含坏死/囊变/出血)
SNFH ED(peritumoral edema) 水肿区、FLAIR 异常区 核心外的 FLAIR 高信号
(派生)WT whole tumor 整瘤 ET+NETC+SNFH 并集
(派生)TC tumor core 瘤核心 ET+NETC 并集

两点提醒:其一,传统"TC"在新体系中对应 ET∪NETC 的并集,而 NETC 单独只覆盖其中的非强化部分——把 NETC 当成旧"TC"直接比较是常见错误;其二,旧"ED"(edema)到新"SNFH"的不只是改名:SNFH 的定义强调"FLAIR 异常"这一影像学表现而非"水肿"这一病理推测,命名变化的背后是定义的收紧。

3.5 质量控制之外的"数据质量体检"

除标注审核外,团队还对数据本身做了影像质量对照实验:从 146 例中随机抽 50 例未处理扫描,与 50 例未处理 TCGA 胶质母细胞瘤扫描(BraTS 2021 子集)对照,用 MRIQC 22.0.6 计算五个标准质量指标——SNR(信噪比)、CNR(对比噪声比)、CJV(联合变异系数,反映强度不均伪影与头动)、EFC(熵聚焦准则,反映鬼影与模糊)、QI1(伪影损坏体素占比)——两组做两尾 t 检验(P<.05)。这是"SSA 影像质量系统性偏低"从轶事上升为统计事实的关键一步,也是后续一切域偏移讨论的实证锚点(§7.2)。

3.6 “预标注会不会把偏差写进真值”——方法学问答

这套流水线最容易收到的质疑与回应:

Q:nnU-Net 预标注在低质量图像上会犯系统性错误,谁来兜底?
A:设计上由人工三阶段兜底——住院医的职责正是修正 DL 错误(论文明确训练内容包括"refine the results of the deep learning–generated segmentations")。但要诚实承认:如果某类错误(如强强化血管误入 ET)在低对比度图像上对人也难分辨,三阶段都漏掉的概率不为零,且论文未发布逐阶段修正率统计。

Q:为什么不做成多专家共识标注?
A:神经放射专家在该场景下是极度稀缺资源——本数据集的组织初衷之一就是"当地专家少"。三阶段设计是"用注册医生+受训住院医的层级劳动换专家终审时间"的现实折中。使用者应把标签理解为"单专家批准的参考标准"(reference standard by a single expert),在论文中如实声明,而非"共识真值"。

Q:跨中心的标注尺度一致吗?
A:标注统一在预处理后数据上进行(图像已归一化到同一空间与强度框架),且由同一批人跨中心标注,尺度漂移风险低于"各中心各自标注再合并"的模式。但设备差异导致的图像表现差异(如 GE 与 Siemens 的 FLAIR 对比度不同)仍可能引起边界判定的系统性倾斜——这属于数据集固有属性,论文未做标注者间一致性(inter-rater)量化,引用者需自知。

Q:能拿这套标签做弱监督/噪声标签研究吗?
A:可以但需谨慎:标签是"DL 预标注+人工修正"的产物,本身就是"模型生成-人工净化"的混合体。做噪声标签建模时,应把预标注来源写入实验设计,避免把"预标注模型的系统偏差"误当成"人类标注噪声"。

3.7 与其他标注生产模式的横向对照

模式 代表 人员结构 特点
预标注+三层人工(本数据集) BraTS-Africa DL 预标注→住院医→注册医生→资深专家终审 单专家终审,成本低,适合专家稀缺场景
预标注+三层人工(病理版) PANDA-PLUS(库内 panda-plus) DL/学生注释→高年级复核→30 年专家终审 同构流水线在病理域的对应物
多专家共识 部分放射组学数据集 多名资深医生独立标注+仲裁 一致性可量化,成本最高
单专家全权 多数小数据集 一名专家从头画到尾 简单,但无交叉验证

BraTS-Africa 与 PANDA-PLUS 的同构性不是巧合:两者都在"专家时间是最贵资源"的约束下,把"最贵的人放在最后一道工序",用结构化分工把专家时间压缩到只做终审。差异在下游:BraTS-Africa 的标签直接服务挑战赛排名(一致性要求被排行榜标准化消化),PANDA-PLUS 的标签则用于暴露上游数据集的标签噪声——同一套生产逻辑,一个用于建立基准,一个用于批判基准。

3.8 工作量与产能账(估算性讨论)

官方未公布逐例标注工时,但可以做一个透明的量级估算(以下为本文推算,非官方数字,引用时须注明):146 例 × 每例 4 个序列的体数据审核,即便"预标注承担 80% 的画线工作",人工精修+复核+终审合计按每例 1-3 小时专家/半专家时间估算,总投入在数百人时量级——这正是为什么项目需要 Lacuna Fund 资助、CAMERA 网络的人力组织,以及为什么"预标注+分层审核"几乎是唯一可行的技术路线(纯手工 146 例 × 4 序列 × 3 子区域全连标注可能要千级人时)。

这个估算的反面教训同样重要:SSA 场景下"雇不到足够的神经放射专家"不是修辞——一位美国 board-certified 神经放射医生终审全部 146 例(且是兼职、跨时区、远程)本身就是资源约束的直接体现。数据集工程的瓶颈从来不是算法,而是"谁有时间把标签画对"。

§2-§3 小结:数据的"规格"(四序列 NIfTI、1mm³、BraTS 目录惯例)是给机器读的,数据的"语境"(1.5T、3-5mm 层厚、多厂商、临床常规采集)是给研究者读的——只看到前者,你会把它当成"小号 BraTS";只看到后者,你会错过"与主数据零成本互通"的工程红利。两半合起来,才是这块数据集的正确打开方式。

§4 与 BraTS 主赛的关系:同一簇,不同世界(必读)

4.1 家族关系一句话

BraTS-Africa 是 BraTS 挑战赛簇(Cluster of Challenges)的撒哈拉以南非洲分赛道:2023 年作为 BraTS 2023 挑战赛的五个分割子任务之一(时名 BraTS2023-SSA / BraTS-Africa)首办;2024 年并入 BraTS 2024 Cluster of Challenges 成为 Task 4——“Brain Glioma in the underserved sub-Saharan African patient population”。它与主赛(Adult Glioma Segmentation)、脑膜瘤(MEN)、儿科(PED)、转移瘤(METS)、修复(Inpainting)、合成(Synthesis)等 Task 并列,共享评估协议、提交平台(Synapse)与 MICCAI 卫星活动,但数据、人群、设备分布完全独立。

理解这个家族关系的背景是 BraTS 十余年的演进脉络(数据来自 2024 簇设计文档的官方回顾):2012 年创办,此后十年聚焦成人脑胶质瘤的公平基准建设;2021 年 RSNA-ASNR-MICCAI 三方合作(RSNA=北美放射学会、ASNR=美国神经放射学会)把数据集扩展到 2000+ 例;2023 年首届 Cluster of Challenges 把数据集扩到 4500+ 例,并首次纳入"服务不足人群"(underserved populations)维度——SSA 赛道即为该维度的第一个落地;2024 年簇进一步扩展至 4000 例新 MRI+28 万病理样本、十个 Task。BraTS-Africa 出现的时机正是 BraTS 从"单一技术基准"转向"多维度临床责任"的转折点——这不是巧合,而是设计。

4.2 FACTS 必答题:与库内 brats(24)条目的三点区分

维度 braats 主赛(库内 brats 条目口径) BraTS-Africa
数据来源 北美/欧洲多中心为主,经 TCGA/TCIA 等高质量归档 尼日利亚多诊断中心临床常规采集,经 AfNiA 汇总
设备 3T 为主、层厚 1mm、序列完整 全部 1.5T、层厚 3-5mm、序列缺失常见
规模 主赛成人胶质瘤数千例(2024 簇全集约 4000 例 MRI + 28 万病理样本) 95 例(2023)→115 例(2024)→146 例全集
标签 ET/NETC/ET 加 CC/RC 分层(2024 扩展命名) ET/NETC/SNFH 三子区域(术前胶质瘤)
训练集 大数据、可直接端到端训练 60 例训练——必须依赖预训练/迁移学习
挑战赛排名口径 与全球 SOTA 同台 2024 规则:用额外数据预训练的模型不参与排名
数据时间窗 持续滚动更新(每年新数据) 固定窗口 2010-2022(version 1 快照)
资助背景 学会/企业赞助体系 Lacuna Fund 健康公平专项+CAMERA 网络

第三行最后一格值得展开:2023 届允许参赛者用 BraTS 主数据等额外资源预训练,但必须双报告(只用 Africa 数据的结果 + 加补数据的结果分开写);2024 届直接收紧——凡用额外数据做模型开发或预训练的提交不进排名。这条规则变化的动机正是保护本赛道的"域偏移测试"纯度:如果人人带着大数据预训练的模型来,小数据赛道的独立意义就被稀释了。

量级对比一句就够震撼:主赛 2024 簇合并叙述约 4000 例 MRI 训练资源(各 Task 合计)+ 28 万病理样本,Africa 赛道全部胶质瘤标注数据是 95-115 例——两个数量级的落差,被同一个评估体系衡量。这不是组织者偏心,而是 SSA 场景下"有什么就用什么"的真实映射;挑战赛的意义之一,正是让全球社区在"大数据赛道"之外,正视"小数据赛道"的方法学是完全不同的学问。

4.3 数据级联关系

  • 2023 届:95 例胶质瘤(60 训练+15 验证+20 测试);与 BraTS 2023-SSA 的训练数据完全一致(同一批 60 例);
  • 2024 届:35 例验证 = 2023 的 15 例验证 + 20 例测试(公开拆分重排);新增 20 例测试;训练 60 例不变;
  • TCIA 全集:146 例 = 2024 口径的 115 例胶质瘤之外的补充+51 例其他脑肿瘤(严格说是"另有 51 例",其中胶质瘤总数 95+20=115 中的 20 例新测试在 TCIA 全集中同样存在)。

拆分演变的文字图:

2023:  [训练 60 | 验证 15 | 测试 20(扣留)]                    = 95
2024:  [训练 60 | 验证 35 = 15 + 20(2023测试转正) | 测试 20(新)] = 115
TCIA : [挑战赛用过的 115 例 + 从未参赛的 51 例其他脑肿瘤]           = 146

一句话总结:在 TCIA 下载的 146 例里,可以复原挑战赛的全部训练与验证数据;但测试集的参考标签从未公开——用 146 例全集做实验的研究者,实际上拿到的是"挑战赛训练+验证+一部分未公开拆分的测试影像(无标签)+51 例扩充"。

4.4 BraTS 2024 簇十个 Task 全景(本赛道定位)

Task 名称 划界维度
1 Post-Treatment Adult Glioma(治疗后成人胶质瘤) 肿瘤类型×时间点
2 Post-Treatment Intracranial Meningioma(治疗后脑膜瘤) 肿瘤类型×时间点
3 Pre- and Post-Treatment Brain Metastases(脑转移瘤) 肿瘤类型×时间点
4 Brain Glioma in the underserved sub-Saharan African patient population(= BraTS-Africa) 人群/地区
5 Pre-Treatment Pediatric Tumor Patients(儿科肿瘤) 人群(年龄)
6 Generalizability of Segmentation Methods Across (Pre-treated) Tumors 技术维度(泛化性)
7 Evaluation of Augmentation Techniques(与 FDA 合作) 技术维度(增广评估)
8 MRI Synthesis(合成) 技术维度
9 MRI Inpainting(修复) 技术维度
10 Assessing the Heterogeneous Histologic Landscape of Glioma(组织学) 模态(病理)

在这张全景表里,BraTS-Africa 与儿科赛道是仅有的两个"以人群划界"的 Task——区别在于儿科划的是年龄轴,SSA 划的是资源与地理轴。2024 年 10 个 Task 中 6 个(1-3、6、7、10)为新增,SSA 赛道则是从 2023 连任的"保留项目",说明组织者对"人群代表性"命题的承诺是持续性的而非一届性。

4.5 关系三连问(快速自测)

Q:BraTS-Africa 算不算"BraTS 2024 数据集"的一部分?
算也不算:算——它被 2024 簇设计文档(Zenodo 10978906)正式列为 Task 4,簇级统计(“4000 例 MRI”)通常把各 Task 数据合并叙述;不算——它的数据 DOI(TCIA 10.7937/v8h6-8x67)、获取通道(Synapse 子集+TCIA 全集)、标签终审团队与主数据相互独立。写论文引用时分开引 DOI,不要把 Africa 数据算进主数据例数,反之亦然。

Q:在主数据上训练的模型可以直接报名 Africa 赛道吗?
2023 届可以(须双报告);2024 届可以提交但不参与排名。这条规则是理解两届成绩不可直接混比的钥匙。

Q:库内 brats 条目里为什么查不到这 146 例?
因为两个条目管的是不同的资产边界:brats 条目覆盖主赛主数据(数千例高资源多中心数据),本条目覆盖 SSA 卫星赛道与其数据集。两份数据在文件格式层面互通(同规格 NIfTI),在数据层面无重叠(病例 ID 前缀不同:主数据为 BraTS-GLI 等任务前缀,本数据集为 BraTS-SSA)。

4.6 为什么不单独开条目而不合并进主赛

三个理由:其一,数据分布差异大到足以让"在 BraTS 主数据上的排名"与"在 BraTS-Africa 上的排名"产生结构性不同——这正是设独立赛道的初衷;其二,获取通道不同(Synapse 挑战赛子集 vs TCIA 全集)、license 口径不同(主赛 CC BY 4.0 一体化 vs Africa 预处理版公开+原始版受限);其三,两届总结论文(NOAJ vdag082)与数据集描述论文(Radiol AI e240528)是独立于主赛论文的文献体系,引用链应当分开。

§4 小结:记住一个比喻——BraTS 主赛与 BraTS-Africa 像同一所大学里"本部校区"与"海外分校":章程(协议)、考试(指标)、学位(MICCAI 发表)一致,但生源(人群)、校舍(设备)、师资(标注专家)完全独立。申请哪边、引用哪边、把成绩单交给谁看,都要先想清楚自己在哪一侧。

§5 挑战赛设计与结果:两届成绩单

5.1 赛制设计

两届挑战赛沿用 BraTS 惯例的"三段式"赛程(以 2024 年日期为例):

  1. 5 月:训练数据发布(含参考标签);
  2. 6 月(约 3 周后):验证数据发布(无标签),参赛者可反复提交到在线排行榜;
  3. 8 月:提交截止,组织者用隐藏测试集与扣留参考标签终评。

赛程时间轴(两届通用节奏):

阶段 时间 参赛者拿到什么 组织者做什么
注册 5 月起 Synapse 账号+数据条款 团队注册审核
训练期 5-6 月 训练数据(带标签) 社区答疑
验证期 6-8 月 验证数据(无标签)+在线排行榜 维护评估服务
终评期 8 月 提交容器+方法短论文 隐藏测试集终评
发布期 10 月(MICCAI) 口头/海报展示 公布排名、颁奖

参赛产出三件套:预测分割图像文件 + 8-10 页方法短论文(经 CMT 提交)+ MLCube 容器化模型(经 MedPerf 平台自动评测)。容器由 MLCommons 维护的 GaNDLF(Generally Nuanced Deep Learning Framework)框架自动生成——这意味着评审跑的是可复现的容器,而非"截图式"结果。评估指标为 lesion-wise DSC(Dice 相似系数)与 HD95(95% Hausdorff 距离)的加权组合,对验证集与测试集分别计算。

激励设计上有两个与"公平"直接挂钩的细节:其一,为提升非洲团队参与度,非洲最佳排名队伍获得资金支持出席 MICCAI 大会(2023 温哥华、2024 马拉喀什),2023 届另设现金奖;其二,上榜队伍受邀将短论文扩写为 LNCS 会议论文(MICCAI proceedings)。

5.2 两届参与与成绩

届 年份 上榜队伍 参与者来源国 数据口径 规则要点
第一届 2023 9 队 12 国 95 例(60/15/20) 允许补充数据,须明示并双报告
第二届 2024 6 队 7 国 115 例(60/35/20) 用额外数据开发/预训练不参与排名

核心横向结论(NOAJ 论文):与 2023 届相比,2024 届排名前六的方法 DSC 提升 9.4%、HD95 降低 57.21%(Welch’s t-test 检验两届差异;另做 paired t-test 比较"仅用非洲数据训练 vs 非洲数据+额外数据训练"的模型表现差)。一年之内、在 60 例训练数据上,指标仍有如此幅度的移动,说明这个赛道远未饱和——同样的问题在主赛上早已进入小数点后两位的拉锯。

关于"参与规模"的口径提示:9 队/6 队是满足提交标准并进入排名的队伍数(“met the submission criteria and were ranked”);12 国/7 国是上榜队伍的参与者国籍统计。注册未上榜、中途退出的团队不计入这两组数字——引用时写"上榜 X 队"而非"共 X 队参加",是精确性的底线。

赛后数据复用规则(两届延续):训练集与参考标签公开供研究;验证集图像公开、标签扣留但开放在线评估;测试集完全扣留。这使得挑战赛结束后的"排行榜复读"不可能,所有赛后比较只能在验证集或自建拆分上进行——引用 2023/2024 届排名数字时,注意那是官方终评时点的快照。

5.3 评估指标的数学骨架

两届沿用的指标定义(与主赛一致):

记某子区域有 L 个病灶(lesion),第 i 个病灶的预测为 Pi、参考标签为 Gi:

lesion-wise DSC = (1/L) Σᵢ Dice(Pi, Gi),其中 Dice(P,G) = 2|P∩G| / (|P|+|G|)

lesion-wise HD95 = (1/L) Σᵢ HD95(Pi, Gi)
   HD95:预测边界点到参考边界点距离分布的第 95 百分位
        (比最大 Hausdorff 距离对离群点更稳健)

最终得分 = DSC 与 HD95 的加权组合(沿用主赛权重惯例)

三个读数要点:其一,lesion-wise(逐病灶)而非体素级整体 Dice——把一个大瘤与多个小瘤同等对待,小病灶的 Dice 波动被平均进来,对分割碎裂的惩罚更真实;其二,HD95 对"边界距离"敏感,在层厚 3-5mm 重采样的数据上,层间插值造成的边界平滑会同时影响 DSC 与 HD95 的解读;其三,按子区域分别计算再报告——SSA 大瘤体大水肿的分布下,SNFH 的 Dice 天然高、NETC 天然低,只看单一总分等于把最容易的题当成了全部成绩。

5.4 2023 届上榜方法概览

NOAJ 论文表 1 按排名 1→9 记录了 2023 届上榜方法(摘录):

  • nnU-Net 系改造:以 nnU-Net 为骨架,引入 Omni-Directional Dynamic Convolution(ODConv2D)替换 Conv3D 层等改进;
  • 3D U-Net + 优化框架:以预处理、后处理与迁移学习为核心的组合方案;
  • AGU-Net:五级滤波器尺寸、深监督(deep supervision)、多尺度输入、单注意力模块的架构(使用 NVIDIA Tesla V100S 32GB 训练);
  • TCuP-GAN:Temporal Cubic PatchGAN——基于 U-Net、2D ConvLSTM 与 PatchGAN 的 3D 体积到体积翻译模型;
  • SAMBA:Segment Anything Model(SAM)+ YOLOv8 定位网络(硬件信息未披露)。

方法谱系的两个信号:第一,nnU-Net 系依然是低资源场景的默认起点,改造集中在动态卷积与迁移策略;第二,SAM 等基础分割模型开始被试水到该赛道,但信息完整度低——"信息未提供"本身就是低资源赛道论文生态的一个注脚。

把九个上榜方法横向摊开,可以提炼一张"低资源分割方案共性"清单:

共性维度 上榜方法的普遍选择 背后原因
架构基座 nnU-Net / 3D U-Net 系(含 AGU-Net) 小数据上自配置框架的先验最强
迁移策略 主数据预训练+微调(2023 届普遍使用) 60 例无法从零收敛
卷积改造 动态卷积(ODConv2D)、多尺度输入、深监督 补偿低分辨率细节损失
生成式思路 TCuP-GAN 体积到体积翻译 把分割重述为跨域翻译问题
基础模型试水 SAM+YOLOv8 定位(SAMBA) 探索大模型先验是否可迁移
硬件门槛 单卡 V100 级即可参赛 与主赛动辄多卡 ensemble 形成反差

最后一行值得展开:主赛头部方案的标配是多模型集成+测试时增广+大规模预训练,而 Africa 赛道的上榜配置明显"轻"——这既是数据量决定的(大集成容易过拟合 60 例),也是赛道普惠意图的体现。

5.5 从 SIGN 看迁移学习的正确姿势

Radiology: Artificial Intelligence 论文(e240528)给出了一条与挑战赛并行的学术线:SIGN 模型(SimIlarity weiGhted self-eNsembling framework,Zhang et al.)专为"案例少+图像噪"的场景设计。实验设计两轮:初评用 BraTS 2020 的 660 例与 ISLES 2015 的 114 例(50/25/25 拆分)训练;重训阶段加入 BraTS-Africa 95 例(60/15/20 拆分)并以 BraTS 2021 数据辅助(90/10 拆分)。结论:SIGN 在两轮评估中整体表现最佳,且在用 BraTS-Africa 重训后仍保持领先——对比其他 SOTA 方法(DML 距离度量学习、MAML 元学习、MLDG-Seg 域泛化、PROTO 原型学习等),"为噪声设计"的方法论在真实低资源数据上得到了验证。

这篇论文还有一个容易被忽略的实验细节值得点出:它同时报告了"Dice 相似系数、accuracy、Hausdorff 距离"三套指标在"加入非洲数据重训前 vs 重训后"的对照(表格以均值±标准差呈现,非洲数据行在上、未含非洲数据的初评结果在括号内)——这种"同表双轨"的报告方式本身就是低资源研究的模板:让读者一眼看到"数据换血带来了什么"。

对使用者的启示:BraTS-Africa 的 60 例训练集不支持从零训练 3D 分割网络;文献中的有效路径高度一致——主数据预训练 + 分层/分层抽样微调(如 radiomics 特征聚类分层)+ 模型集成 + 后处理(arXiv:2412.04111 即一例:14 个形状特征+93 个强度特征经 PCA 降维后 k-means 聚类,按聚类分层切折,使每折病变类型均衡)。

5.6 成绩解读的四个陷阱

陷阱一:9.4% 是相对量不是绝对分。
"DSC 提升 9.4%"是两届前六名方法得分的相对比较(Welch’s t-test),论文未在摘要层给出绝对分数区间——把它读成"DSC 从 0.85 涨到 0.94"是无据推算。引用时写"相对提升 9.4%"并给出处。

陷阱二:两届测试集不同。
2023 终测 20 例(当时扣留),2024 终测是新的 20 例——两届成绩比较建立在"不同测试样本"之上,Welch’s t-test 是对方法得分分布的检验,不是同一考卷的重考。严格说这是"两届方法水平"的比较,而非"模型在同一分布上的进步量"。

陷阱三:上榜≠全部参赛。
9 队/6 队是"满足提交标准并进入排名"的队伍数(“met the submission criteria and were ranked”),注册与尝试提交的队伍多于上榜数——把上榜数当参与规模会低估赛事热度、高估完成率。

陷阱四:2024 的"纯净"规则提高了难度基线。
2024 届禁止用额外数据预训练的模型进排名,等于让所有上榜方法都在"60 例+迁移权重冻结判定"的更窄跑道上比赛——成绩提升的含金量更高,但直接与 2023 成绩画趋势线在方法学上不严谨。

陷阱五(附加):别用主赛名次预测本赛道名次。
主赛与 Africa 赛道的数据分布、样本量、规则三重不同,主赛榜单头部的团队未必参加或上榜本赛道;跨赛道引用某团队名次时必须注明赛道。

5.7 挑战赛之外:这个数据集改变了什么

  • 话语权:MICCAI 簇连续两年为 SSA 保留独立 Task,配套非洲团队出席资助,是顶会挑战赛体系内少见的结构性倾斜;
  • 方法论:用 MRIQC 五指标把"低资源影像"变成可测量的统计事实,为后续一切域偏移/公平性研究提供了可引用的锚点;
  • 机制:CAMERA(MRI 教育与科研联盟)+ AfNiA(归档)+ Lacuna Fund(资助)构成了"采集-培训-归档-赛事"四环闭环,论文明确将其定位为"从非洲其他国家持续扩充数据集"的基础设施——也就是说,146 例是这个机制的第一批产出,而非终点。

5.8 两届规则与数据逐项对照

事项 2023 届 2024 届
所属 BraTS 2023 挑战赛分割子任务(BraTS2023-SSA) BraTS 2024 簇 Task 4
胶质瘤数据 95 例(60/15/20) 115 例(60/35/20;35 含 2023 测试 20 例)
额外数据政策 允许补充(含 BraTS 主数据),须明示+双报告 用于开发/预训练即不参与排名
上榜队伍 9 队(12 国) 6 队(7 国)
测试集 20 例(首次使用) 20 例(全新,标签扣留)
提交形态 MLCube/MedPerf + CMT 短论文 + Synapse 预测 同左(体系延续)
奖励 前三名现金奖+非洲队伍出席资助 非洲队伍出席资助(出席地马拉喀什)
成绩相对变化 —(基线届) 前六名 DSC +9.4%、HD95 -57.21%

对照表的阅读姿势:两届之间没有一项数据口径完全相同(数据量、拆分、规则、测试集都变了),所以任何"2024 比 2023 进步 X"的表述都必须绑定其统计检验口径(§5.6 陷阱二);唯一稳定的比较锚点是评估指标体系本身。

引用榜单结果时的三条注意:

  1. 写清届别与口径——"2023 届第 N 名(9 队上榜)"比"全球第 N 名"准确得多,后一种写法容易被误读为跨赛道名次;
  2. 区分验证成绩与测试成绩——验证集成绩是参赛者可以反复刷的(多次提交取最优),测试成绩是一次性终评,两者不可混用;
  3. 方法名与队名对齐——LNCS 短论文以方法为题,榜单以队伍为序,交叉引用时以 NOAJ 表 1 的映射为准,避免把同队多方案计为多队。

§6 获取与许可:三层资产、三种门

6.1 资产与门禁总表

资产 载体 规模 License 获取方式
预处理 mpMRI + 专家分割标签 TCIA(Radiology Images and Segmentations - BraTS 2023 Challenge) 146 subjects / 730 studies / 1.6GB CC BY 4.0 TCIA 页面公开下载(需 IBM Aspera Connect 插件,faspex 通道)
未处理原始 NIfTI 图像 TCIA(Unprocessed NIfTI radiology Images) 146 subjects / 585 studies NIH Controlled Data Access Policy(受限) 下载通道 Unavailable(页面标注)——因图像或可重建人脸,NIH 政策调整后登录下载已下线
扫描仪与诊断信息 XLSX(BraTS-Africa_TCIA_datainfo_v2.xlsx) 17KB CC BY 4.0 TCIA 页面公开直链
2023 挑战赛训练/验证数据 Synapse(syn51156910) 95 例拆分 挑战赛数据使用条款 Synapse 注册
2024 挑战赛训练/验证数据 Synapse(syn59059780) 115 例拆分(60/35 公开部分) 挑战赛数据使用条款 Synapse 注册(www.synapse.org/brats)
测试集参考标签 扣留 20+20 例 不公开 —(仅组织者持有,用于终评)

数据引用为强制项(Data Citation Required):引用格式为 Adewole, M., Rudie, J.D., Gbadamosi, A., Zhang, D., Raymond, C., et al. (2024) Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa) (version 1) [Dataset]. The Cancer Imaging Archive. https://doi.org/10.7937/v8h6-8x67

获取路径决策树(按你的身份对号入座):

你要做什么?
├── 复现/对比挑战赛成绩
│   └── → Synapse 注册 → 按届下载(2023: syn51156910 / 2024: syn59059780)
│       └── 注意:官方测试集无标签,只能提交在线评估或引用官方快照
├── 自由研究(分割/迁移/域偏移)
│   └── → TCIA 下载预处理版(CC BY 4.0,Aspera)
│       └── 先读 XLSX 元数据过滤胶质瘤子集
├── 需要 1.5T 元数据做分层分析
│   └── → TCIA XLSX(公开直链,17KB)+ 预处理版联用
├── 需要原始未处理数据
│   └── → 目前无通道(NIH 政策受限)→ 改用预处理版或放弃该研究设计
└── 只想了解/教学
    └── → 引用 NOAJ vdag082 + Radiol AI e240528 两篇开放论文

6.2 AI-Ready 视角下的可得性光谱

以"拿到即可喂给模型"的标准衡量:

  • 喂给模型的门槛:低。预处理版已是 1mm³ 等向、颅骨剥离、强度归一化的 NIfTI,与 BraTS 主数据同构——任何为 BraTS 写的 dataloader 几乎零改动即可用(目录命名沿用 BraTS 惯例的 BraTS-SSA-xxxxx-xxx 病例 ID + 五文件结构)。
  • 复现预处理的门槛:不可得。未处理原始图受控,外部用户无法验证/复现 SRI24 配准、N4 校正等预处理决策,也无法做"原始→预处理"的端到端学习(如对预处理不敏感的域适应研究受限)。
  • 对比实验的门槛:低。主赛数据同样经 BraTS 官方流水线处理,"主数据预训练→Africa 微调"的迁移学习范式在数据规格层面天然成立——这正是两届挑战赛参赛方案的主流路线。

6.4 下载实操要点

  1. 下载器:TCIA 的大包走 IBM Aspera(faspex),浏览器直链不可用;需要安装 Aspera Connect 插件或用 ascp 命令行下载(TCIA 页面提供带通行码的 faspex 包链接)。
  2. 病例 ID 规则:BraTS-SSA-xxxxx-xxx(五位数患者+三位数研究),从 ID 无法直接读出胶质瘤/非胶质瘤与训练/验证归属——分箱靠 Synapse 拆分表(§2.6)。
  3. 不要把 146 例当同质全集用:95/115 例胶质瘤与 51 例其他肿瘤的标签含义不同(后者是"其他脑肿瘤"的诊断层面归属,三子区域标注是否适用需逐例核对 XLSX 诊断字段)。
  4. 引用双 DOI:数据引 TCIA DOI(10.7937/v8h6-8x67),方法学论述引 NOAJ(10.1093/noajnl/vdag082)与 Radiol AI(10.1148/ryai.240528)——不要用 Zenodo 10978906 指代本数据集(坑 3)。
  5. CC BY 4.0 的归属义务:TCIA 附加 Data Usage Policy,要求包含完整引用与 DOI;再分发衍生数据集时保留相同归属。
  6. 体量预期:预处理版约 1.6GB(TCIA collection 页总计口径 3.7GB,含受限部分与元数据),普通带宽下 Aspera 传输数分钟量级——体量小是该数据集对算力受限研究者的隐形友好。

6.5 获取问答五则

Q:Synapse 数据和 TCIA 数据选哪个?
做挑战赛复现或排行榜对比→Synapse(拆分与官方评估一致);做自由研究、跨中心分析、非胶质瘤研究→TCIA 全集。两者图像有重叠,基准实验二选一(§2.7)。

Q:可以重新分发下载到的数据吗?
CC BY 4.0 允许再分发与商用,但须保留归属与 DOI;TCIA Data Usage Policy 另有附加要求(如不得试图身份重识别)。混合再分发(把 BraTS-Africa 与其他数据打包)时保持来源可分是最稳妥的做法。

Q:原始 DICOM 在哪?
本 collection 原始层为"未处理 NIfTI"(不是 DICOM),且受 NIH 政策限制、下载通道已下线(坑 4)。若研究确需原始数据(如自定义预处理、去颅骨前处理研究),需按 NIH Controlled Data Access Policy 流程另行申请,当前无公开通道。

Q:Aspera 下载失败怎么办?
检查 Aspera Connect 插件版本与 UDP 端口(默认 33001)连通性;防火墙环境可用 ascp 的 TCP 回退模式。TCIA 帮助文档提供各平台客户端指引。

Q:有容器/云镜像吗?
官方未发布 AWS Open Data 或 Kaggle 镜像(截至核验时点)。医学影像社区常见第三方转存不可信——以 TCIA 官方通道为唯一来源,保证数据完整性(文件哈希)与合规性。

6.6 AI-Ready 总评

得分点 失分点
与 BraTS 主数据同构(dataloader 零改动) Aspera 插件门槛(对自动化流水线不友好)
CC BY 4.0 主资产公开 原始数据受控且通道下线,预处理不可复现
XLSX 元数据公开直链(中心/设备/诊断) 测试标签扣留,挑战赛基准无法本地复现
体量小(1.6GB),边缘环境可用 无官方容器/云镜像,自动化获取路径单一

一句话:"喂给模型"的门槛很低,"端到端复现"的门是关着的——这是典型的"预处理产物开放型"AI-Ready 数据集(同类:多数 BraTS 簇成员)。

6.7 CC BY 4.0 条款快读(数据资产部分)

针对"预处理图像+分割标签+XLSX 元数据"这三件 CC BY 4.0 资产:

你可以 你必须 你不能(TCIA 附加)
商业使用、修改、再分发 署名(附完整数据引用+DOI) 试图身份重识别(去标识数据)
构建衍生数据集/模型权重 标注修改(若分发修改版) 声称 TCIA 背书你的衍生品
跨国使用(无地域限制) 遵守 TCIA Data Usage Policy 全文 将受限资产(未处理图)与公开资产混发

模型权重算不算"衍生数据集"存在解释空间——社区惯例:仅用公开图像+标签训练的权重可以按 CC BY 4.0 对待,但训练混合了受限/私有数据的权重不能借本数据集的许可背书。保守做法:在模型卡(model card)里写明训练数据构成与本数据集 DOI。

6.8 库内获取方式光谱中的坐标

条目 获取形态 与 BraTS-Africa 的对照
brats(主赛) 挑战赛/官方渠道开放下载 同构规格、主赛无"原始版受控"问题
rembrandt TCIA 公开 同在 TCIA 生态,无 NIH 受限资产
ucsf-pdgm TCIA/多渠道公开 高资源对照面
upenn-gbm 注册申请制 BraTS-Africa 的原始版若开放将取相似形态
BCN20000 学术申请制 区域整合型数据集的不同门禁模式

放进这张光谱里看,BraTS-Africa 的门禁组合(公开主体+受控原始层+挑战赛注册层)在库内不算最严苛,但"原始层通道下线"是独有的死结——其他申请制数据集至少留着申请路径。

§7 LMIC 场景与图像质量:这个数据集真正独特的地方

7.1 临床背景:为什么 SSA 的胶质瘤问题长这样

NOAJ 论文给出的流行病学底色:

  • 胶质瘤患者约 30%-80% 在确诊后五年内死亡(NOAJ 开篇口径);GBM 约 80% 两年内死亡(arXiv:2305.19369 口径);
  • 美国过去 30 年胶质瘤死亡率下降约 7%;1990-2016 年全球北方下降 10%-30%;同期 SSA 平均上升约 25%;
  • 剪刀差的多因素解释:就诊延迟(delayed presentation)、HIV 等感染性合并症高发、治疗基础设施严重短缺、诊断(神经放射/神经病理)与治疗(神经外科/肿瘤内科/医学物理师)专业人才缺口。

对数据集而言,这些因素全部"显影"在图像里:晚就诊→大瘤体、大水肿、跨中线表现更常见;感染合并症→非肿瘤性 FLAIR 异常背景多,标注与模型判别难度都更高;设备落后→序列缺失、对比度差。所以 BraTS-Africa 不只是"非洲版的 BraTS",而是一个疾病谱与采集条件同时偏移的双重量分布。

死亡率剪刀差的成因链(论文归纳的多因素模型):

环节 高收入国家 SSA 现实 对数据/模型的投射
就诊 筛查与转诊体系较完善 就诊延迟,晚期表现多 大瘤体、大水肿样本占比高
合并症 感染负担较低 HIV 等感染性合并症高发 非肿瘤性 FLAIR 异常背景复杂
诊断人力 神经放射/病理专家充足 专家稀缺,诊断瓶颈 手动标注产能低→依赖半自动流水线
治疗 手术/放疗/化疗可及 治疗设施短缺 标准治疗可及性正改善中——AI 辅助诊断的窗口期
影像设备 3T 为主、维保完善 1.5T 为主、序列缺失 域偏移的直接来源

最后一行的"窗口期"值得展开:论文明确指出,随着标准治疗(手术切除、放疗、同步化疗)在 SSA 逐步铺开,"用机器学习做早期发现、精确治疗靶点识别、进展与疗效预测"的研究若继续缺失 SSA 数据,生存差距只会进一步拉大——这是 BraTS-Africa 立项的伦理紧迫性来源,而不只是"补数据"的技术动作。

7.2 图像质量的统计事实

Radiology AI 论文的质量对照实验(50 例未处理 BraTS-Africa vs 50 例未处理 TCGA-GBM,MRIQC 22.0.6,两尾 t 检验 P<.05)测了五个维度:

指标 含义 低质量方向
SNR 信噪比 越低越差
CNR 对比噪声比(组织可分辨度) 越低越差
CJV 联合变异系数(强度不均伪影+头动) 越高越差
EFC 熵聚焦准则(鬼影与模糊程度) 越高越差
QI1 伪影损坏体素占比 越高越差

论文结论方向:SSA 组在这些指标上系统性劣于 TCGA 组。叠加采集侧事实——全 1.5T、层厚 3-5mm、三家厂商五种型号、按各中心自定协议扫描——构成了教科书级的域偏移源清单:设备代差(field strength)、分辨率(各向异性体素)、厂商/序列参数(vendor/protocol shift)、病变谱(disease spectrum shift)。

方法学上值得记录的是这个实验的设计选择:对照组选 TCGA-GBM(而非 BraTS 主赛混合集),把"肿瘤类型"变量锁死(都是 GBM 级别病变),使组间差异主要归因于采集条件而非疾病构成;用 MRIQC 而非自造指标,使结果可与影像质量文献对话;随机抽 50/50 并做统计检验而非展示个案。这套设计可以直接被后续低资源数据集论文复用——事实上它已成为"证明我的数据集难"的标准姿势之一。

7.3 五个质量指标怎么读进模型设计

MRIQC 指标劣化 图像上的表现 对分割模型的具体影响 常见对策
SNR 低 组织纹理颗粒感强 小病灶(NETC)边界抖动,Dice 方差大 强度去噪/预训练权重冻结前层
CNR 低 灰白质、瘤-水肿对比弱 SNFH 与正常 FLAIR 信号带粘连 多序列融合、注意力机制
CJV 高 强度不均(bias field)残留 同一组织跨区域强度漂移,模型学成位置函数 N4 校正参数敏感性消融
EFC 高 鬼影/模糊 层间结构拖影,3D 卷积核吃到假边界 各向异性卷积/2.5D 方案
QI1 高 大片伪影损坏区 输入域外样本,预测不可信 质量门控/不确定性估计

这张表的用法:不是每个指标都要对策齐上——先在自己模型上测"哪个子区域的 Dice 对哪个指标最敏感"(把 MRIQC 分数当协变量做回归),把工程预算花在敏感项上。

7.4 一个严谨泛化实验的设计模板

如果你要在这块数据上做域偏移/泛化研究,文献与官方材料拼出的"防审稿人四板斧":

  1. 锁定训练分布:主数据(或其子集)预训练,全部超参与种子登记——BraTS 主数据各版本(2021/2023/2024)规模不同,声明你用的是哪个;
  2. 冻结评估协议:lesion-wise DSC+HD95、按 ET/NETC/SNFH 分子区域、同一预处理(官方 1mm³ 产物)——预处理不同则一切不可比;
  3. 三层对照:域内对照(主数据 held-out)→ 域外目标(BraTS-Africa 验证/自建拆分)→ 消融层(如"仅换设备子集"“仅换厂商”),把"掉分"分解到域偏移的具体维度;
  4. 报不确定性:小数据上单次划分的 Dice 波动很大——至少多种子重复+报标准差;官方挑战赛的两届统计(Welch/paired t-test)是可以借鉴的显著性报告格式。

反模式同样值得列出:在 TCIA 全集上训练后报"在 BraTS-Africa 验证集上的成绩"(泄漏);用 2023 届测试集的影像自评后与 2024 届榜单对比(拆分混淆);把 MRIQC 质量分数与模型误差做相关后宣称因果(观察性证据)。

7.5 对模型开发者的三条实操含义

  1. 预训练不是可选项而是必需品:60 例训练集无法从零支撑 3D 网络收敛;2023 届上榜方法全部带迁移学习背景,2024 届把"用额外数据"的模型移出排名,等于把"迁移学习的度量"单独留给主赛道,本赛道专注"小数据上限"。
  2. 预处理敏感性放大:1mm³ 重采样对 5mm 层厚的插值平滑会抹掉细节——在高质量数据上无关紧要的预处理选择(插值核、灰度截断分位)在这里显著影响 Dice;做消融实验时要预注册预处理方案。
  3. 评估要看子区域拆开:晚就诊大瘤体的 SNFH 巨大而弥散(Dice 天然偏高),NETC 小而碎(Dice 波动大)——只报整瘤 WT-Dice 会掩盖模型真实短板;两届论文均按子区域报告。

7.6 全球低资源医学影像数据集中的位置

数据集 区域 模态 规模 与 BraTS-Africa 的关系
BraTS-Africa 尼日利亚(SSA) 脑 mpMRI 146 例(标注) 本条目
BraTS 主数据 高收入国家为主 脑 mpMRI 数千例 预训练源与"高资源端"对照
BM-BraTS 簇其他 Task 混合 脑 mpMRI/病理 各 Task 数十至数千例 同簇方法学互通
各类 SSA 影像倡议(CAMERA 网络产出) 非洲多国 MRI(多部位) 持续扩充 同一机制的上游供给

在"低资源影像数据集"的版图上,BraTS-Africa 的稀缺性在于三点:它是顶会挑战赛体系内、带排行榜的 SSA 数据(不是"发布了就没人管"的静态数据集);它是四序列完整标注的脑肿瘤数据(SSA 公开标注脑影像中规模最大者——论文原话为"非洲成人术前胶质瘤的最大公开标注回顾性队列");它带设备/中心元数据(可做采集条件分层分析)。

7.7 公平性叙事的边界

用这个数据集讲"AI 医疗公平"故事时有三条克制线:其一,它证明的是"SSA 数据可以被收集、标注并纳入全球基准",而不是"模型已在非洲落地"——挑战赛到 2024 年仍只有 6 支队伍上榜;其二,单国(尼日利亚)数据不能外推为"非洲分布",论文自己也把"从其他国家扩充"列为未来工作;其三,1.5T 数据训练的模型不等于适配所有 LMIC——南亚、拉美的分布同样是未采样的大陆。正确的读法是:BraTS-Africa 把"低资源"从修辞变成了可下载、可复现、可排名的实证对象。

7.8 生态三缺口:人、机、数据的连锁短板

论文背景部分把 SSA 的困境拆成了相互咬合的三层(这也是理解本数据集"为什么长这样"的地图):

  1. 人的缺口:神经放射医生、神经病理医生、神经外科医生与医学物理师稀缺——诊断与治疗两端同时缺人。后果:手动肿瘤分析只在少数城市中心可行,AI 恰好补"人少活多"的位置;
  2. 机的缺口:影像基础设施落后(低场设备、老化维保、对比剂供应链)——后果就是本数据集的图像质量画像(§7.2)与序列缺失常态;
  3. 数据的缺口:稀缺人手优先服务临床而非科研,标注产能低——全球数据版图上 SSA 长期空白,模型"没见过"这类分布,临床部署又无从验证,形成循环。

BraTS-Africa 的干预点选在第三层(供数据+办赛事),并借 CAMERA 向第一层回流(培养本地影像人才)、借质量画像对第二层做实证记录。三层视角下,单看"146 例分割标签"会低估它的杠杆位置——它是链条上唯一可复制的开源环节。

§6-§8 小结:获取上"三层门禁"(公开/受限/注册)各有钥匙;叙事上"三学科接口"各有抓手;文献上"四层谱系"各有引用场景。这个数据集的全部复杂性都可以收拢为一句话:它是被小心设计过的——从许可分层到规则收紧到激励倾斜,每一步都有明确的意图,理解意图比记住数字更重要。

§8 生态与影响:文献谱系与库内坐标

8.1 论文谱系四层

  1. 赛事设计层:arXiv:2305.19369(2023 届设计)→ Zenodo 10.5281/zenodo.10978906(2024 簇 Task 1-10 总设计文档,2024-04-16);
  2. 赛事总结层:Neuro-Oncology Advances vdag082(2025,两届总结,含 2023 届 9 队方法表与两届统计检验);
  3. 数据集描述层:Radiology: Artificial Intelligence e240528(2025-07,146 例全集描述+MRIQC 质量对照+SIGN 重训结果);
  4. 参赛方法层:LNCS 短论文群(MICCAI BraTS proceedings)与独立 arXiv(如 2412.04111 分层微调迁移学习方案)。

8.2 在 BraTS 家族中的位置

BraTS 2024 簇共 10 个 Task(Post-Treatment Adult Glioma、Post-treatment Meningioma、Brain Metastases、SSA(Task 4)、Pediatric、Generalizability、Augmentation(与 FDA 合作)、MRI Synthesis、MRI Inpainting、Histology),BraTS-Africa 是其中唯一以人群/地区(而非肿瘤类型或技术维度)划界的赛道。库内相关条目:

  • brats(rid 24):主赛本体与主数据集——迁移学习的预训练源;其条目视角是"全球基准的演进史",本条目视角是"基准的公平性边界",两者拼合才是完整图景;
  • fets:FeTS 联邦学习(BraTS 衍生的联邦训练倡议)——同为"数据分布异构"命题,但解法是联邦而非集中;fets 假设"数据都在但出不了门",BraTS-Africa 承认"有些数据根本还没被收集"——问题的两级;
  • pengwin:BraTS 系脑膜瘤放疗规划赛道——同簇不同 Task,展示了簇内"分割→临床应用"的另一种延伸方向;
  • upenn-gbm:UPenn GBM 纵向数据——高质量高资源的对照组样本,含随访与分子层信息,恰好覆盖 BraTS-Africa 的三个空白(纵向、分子、高场强);
  • rembrandt / ucsf-pdgm:高收入国家胶质瘤 MRI 归档——与 BraTS-Africa 形成"资源梯度"对比面,适合做"同一模型跨数据集性能阶梯"的研究设计;
  • BCN20000:巴塞罗那脑瘤库——另一种多中心区域整合模式(欧洲视角),与 AfNiA 的"欠发达地区归档"模式互为镜像。

8.3 被引用的方式(谁在用它)

从文献引用形态看,BraTS-Africa 已成为两类论文的标准组件:其一,泛化性/域偏移评测——把在主数据上训练的模型放到 SSA 数据上测衰减;其二,公平性/LMIC AI 论述——作为"低资源数据集工程"的范例引用(连同 AfNiA、CAMERA 机制)。第三方综述偶见"BraTS-Africa ≈750 cases"的数字(疑为把 2025 年后续扩展或簇级合并口径误植),与官方 146/115/95 不符——引用官方论文与 TCIA 页面为准(坑 5)。

8.4 引用场景矩阵(写论文时引哪篇)

你的论文涉及 必引 建议加引
使用了 146 例数据 TCIA DOI(10.7937/v8h6-8x67,强制) Radiol AI e240528
声称"SSA/低资源基准" NOAJ vdag082 arXiv:2305.19369
讨论两届挑战赛成绩 NOAJ vdag082 MICCAI LNCS 对应短论文
讨论 SSA 影像质量 Radiol AI e240528(MRIQC 实验) MRIQC 方法学文献
讨论非洲影像基础设施 NOAJ vdag082 CAMERA 相关文献
BraTS 2024 簇全景 Zenodo 10978906 主赛年度论文
标签体系/预处理协议 Radiol AI e240528 + 主赛协议文献 CaPTk/nnU-Net 原文

矩阵的逻辑:数据 DOI 永远在场(TCIA 硬要求);其余按"你引用的结论是谁得出的"归属——这句朴素的话是防引用错位(如拿簇设计文档当数据出处,坑 3)的根本办法。

8.5 大事记与后续版本预期(2010-2025)

时间 事件
2010-01 最早的数据采集窗口开启(尼日利亚多中心临床常规扫描)
2012 BraTS 挑战赛创办(此后十年主数据不含非洲人群)
2020 前后 CAMERA 联盟运转,非洲 MRI 教育与科研网络成形;AfNiA 归档建设
2022-12 采集窗口关闭(入组截止:2022-12-31 前的扫描)
2023-05 首届挑战赛发布训练数据(95 例胶质瘤,60 带标签);arXiv:2305.19369 发布
2023-08 2023 届提交截止与终评(9 队上榜)
2023-10 MICCAI 2023 温哥华卫星活动;非洲获奖队伍获出席资助
2024-04-16 BraTS 2024 簇设计文档上 Zenodo(10.5281/zenodo.10978906),SSA 为 Task 4
2024-05 第二届开赛:训练 60 例 + 验证扩至 35 例;规则收紧(额外数据预训练不进排名)
2024-08 2024 届终评(6 队上榜);两届前六名 DSC +9.4%、HD95 -57.21%
2024-08-31 TCIA 数据 DOI 注册(10.7937/v8h6-8x67);146 例全集 version 1(页面 09-04 更新)
2024-10 MICCAI 2024 马拉喀什卫星活动
2024-12-18 Zenodo 出现 5001_BraTS-SSA_2023 模型记录(14510931/14510932)
2025-07 Radiology: Artificial Intelligence 数据集描述论文刊出(e240528);NOAJ 两届总结论文(vdag082)刊出
2025-10 MICCAI 2025 BraTS LNCS proceedings 收录两届参赛方法短论文

读这张表的三个感受:从"窗口关闭"到"数据上线"只用了半年(2023-01 至 2023-06 之间完成汇总-预处理-标注),速度快得依赖预标注流水线;从首届开赛到 146 例全集公开相隔 15 个月,数据释放节奏与赛事节奏咬合;从 DOI 注册到两篇正式论文相隔约 11 个月,符合期刊周期。

8.6 易混淆对象辨析(搜到这些名字别认错)

检索命中的名字 它实际是什么 与本条目关系
BraTS-Africa / BraTS-Africa Challenge 本条目主体(数据集+两届赛事) ✓
BraTS2023-SSA 2023 届在 BraTS 2023 中的注册名 同物异名(坑 7)
ASNR-MICCAI-BraTS2023-SSA-Challenge-* 2023 届数据目录前缀 同物异名
5001_BraTS-SSA_2023(Zenodo 14510931/2) 模型/内容记录(Rachit Saluja) 非数据本体(坑 3)
The Brain Tumor Segmentation (BraTS) Cluster of Challenges(Zenodo 10978906) 2024 簇十 Task 设计文档 包含 Task 4=SSA 的元文档,非数据
BraTS 2023-Adult-Glioma / BraTS-GLI-* 主赛成人胶质瘤数据 不同数据集(预训练源)
BRACS 乳腺病理数据集(库内 bracs) 纯属拼写相近,零关系
Brats(挪威地名) 与医学无关 检索噪音

这张表的实用价值在检索排错:BraTS-Africa 的检索结果常被"Brats(地名)"“BRACS(乳腺)”"BraTS 主赛"三类噪音稀释,加上精确限定词(sub-Saharan、glioma、Nigeria、TCIA)可快速聚焦。

§9 与库内条目的关系

9.1 家族图谱

BraTS 主赛(brats, rid 24)── 簇关系 ──┬── BraTS-Africa(本条目,Task 4/SSA 分赛道)
                                        ├── pengwin(脑膜瘤放疗规划赛道)
                                        ├── fets(联邦学习倡议,BraTS 衍生)
                                        └── upenn-gbm(UPenn GBM 纵向归档)
高资源胶质瘤 MRI 对照面 ── rembrandt ── ucsf-pdgm ── BCN20000

9.2 检索路径建议

检索目标 起点条目 关系
主赛数据/主数据预训练源 brats(rid 24) BraTS-Africa 的数据协议、评估指标、工具链全部继承自主赛
联邦/分布式训练对照 fets 同为分布异构命题,解法路径相反(联邦 vs 集中)
同簇其他 Task pengwin 展示 BraTS 簇 2024 的完整赛道版图
高资源胶质瘤对照 rembrandt、ucsf-pdgm、upenn-gbm 构成"资源梯度"比较研究的另一端
区域多中心整合模式 BCN20000 与 AfNiA 模式对照

9.3 互链锚点词

在库内其他条目中建议以下锚点词指向本条目:撒哈拉以南非洲、SSA、低资源/低收入国家(LMIC)、域偏移(domain shift)、1.5T、泛化性(generalizability)、健康公平(health equity)、Lacuna Fund。反向:本条目指向 brats 的锚点为"主赛/主数据/预训练源"。

§10 避坑清单:八个已踩过的坑

坑 1:三套例数口径并存(146/115/95),错配即翻车。
146=TCIA 全集(95 弥漫性胶质瘤+51 其他脑肿瘤);115=2024 挑战赛胶质瘤(60/35/20);95=2023 挑战赛胶质瘤(60/15/20)。文献中最常见的错误是把 146 写成"146 例胶质瘤"(实际胶质瘤 95-115 例),或把 60 例训练集当成全集。引用任何数字必须先声明口径。

坑 2:中心数 six vs seven 双口径。
TCIA collection 页/DataCite/lanfrica 均写"six diagnostic centers";NOAJ 论文写"seven (7) diagnostic imaging centers"并逐一列名(含 LUTH);TCIA 设备明细表又只列 5 家。三种说法各有出处。本文策略:机构名单引 NOAJ,总述引 TCIA,均注明口径。

坑 3:Zenodo DOI 10978906 不是 BraTS-Africa 的数据 DOI。
它是 BraTS 2024 Cluster of Challenges 的总设计文档 DOI(Task 1-10 的 PDF,515.8kB)。BraTS-Africa 数据本体的正式 DOI 是 TCIA 的 10.7937/v8h6-8x67。Zenodo 上确有含"SSA"字样的独立记录——5001_BraTS-SSA_2023(doi:10.5281/zenodo.14510931/14510932,Rachit Saluja 2024-12-18 注册)——但那是模型/内容记录,不是数据本体。检索者若循"Africa 子集在 Zenodo 有独立记录"的线索去找数据集,会被引到模型记录上。

坑 4:"146 例公开"是半真话。
公开可下载的是预处理版(730 studies,1.6GB,CC BY 4.0);未处理原始 NIfTI(585 studies)受 NIH Controlled Data Access Policy 限制,且 TCIA 页面已将下载通道标为 Unavailable(因图像可能重建人脸)。任何声称"含原始 DICOM/未处理数据"的使用计划目前无法执行。

坑 5:第三方数字污染(≈750 例、75 例、30 例测试)。
ScienceDirect 2026 综述写"BraTS-Africa (≈750 cases)"——与官方 146 不符,疑为后续扩展/簇级合并口径误植;selectdataset.com 写"75 例"且自述自相矛盾(60+35≠75);openmedlab 写 2023 测试集 30 例(官方论文为 20)。一切以 TCIA 页面 + NOAJ vdag082 + Radiol AI e240528 为准。

坑 6:标签缩写跨年改名(NC/ED → NETC/SNFH)。
2023 届与早期第三方资料用 NC(non-enhancing core)、edema 等叫法;BraTS 2024 统一为 ET/NETC/SNFH 命名。两套缩写指同一套分割概念,但混用时会与"整个肿瘤 WT/TC/ET"的旧三分类体系(主赛 2021 前口径)相撞——特别是"TC"在新旧体系里定义不同。读代码时以标签文件数值(1/2/3 或 0-3)+ 官方命名对照为准。

坑 7:三个名字一个东西(BraTS-Africa / BraTS2023-SSA / BraTS-SSA)。
2023 届注册名 BraTS2023-SSA(Synapse 页面、目录前缀 ASNR-MICCAI-BraTS2023-SSA-Challenge-*)、论文简称 BraTS-Africa、病例 ID 前缀 BraTS-SSA——三个名字并存于官方材料。检索时三者都要试;引用时建议统一为 BraTS-Africa 并注明年份。

坑 8:预处理后尺寸的来源分歧。
官方预处理产物按 BraTS 惯例约 240×240×155(1mm³);部分参赛/复现方案自述"平均 136×170×140 后重采样到 160×160×160"等尺寸——那是自行二次重采样的结果,不是官方规格。核对数据时以官方 1mm³ 口径为准,警惕把第三方 pipeline 的中间尺寸当成数据集属性。

§11 总结

11.1 三句话总结

  1. BraTS-Africa 把 BraTS 全球基准第一次系统性扩展到撒哈拉以南非洲——146 例尼日利亚 1.5T 真实临床 mpMRI(95 例弥漫性胶质瘤+51 例其他脑肿瘤),BraTS 协议预处理+三阶段专家标注,CC BY 4.0 在 TCIA 公开。
  2. 两届 MICCAI 挑战赛(2023:9 队 12 国;2024:6 队 7 国)证明小数据赛道仍有大空间——2024 前六名 DSC +9.4%、HD95 -57.21%,且规则收紧后迁移学习的度量和"纯 SSA 数据上限"被明确分开。
  3. 它的方法学遗产是把"低资源影像"变成可测量的统计事实(MRIQC 五指标对照)和可持续的机制(AfNiA 归档+CAMERA 培训+Lacuna Fund 资助),而不仅是发布一批数据。

11.2 适合谁

  • 需要真实低资源/域偏移测试床的分割模型开发者(预训练模型健康体检);
  • 研究迁移学习、小样本微调、模型集成策略的方法学团队;
  • 全球健康/健康公平方向的 AI 研究者与政策论证者;
  • 需要多厂商、多协议、非各向同性采集的鲁棒性评测设计者。

11.3 不适合谁

  • 需要 IDH/1p19q/MGMT 等分子分型标注的研究(本数据集无);
  • 需要纵向/治疗后随访影像的研究(全部为术前);
  • 期待大规模训练集的端到端预训练(训练集仅 60 例);
  • 需要原始 DICOM/未处理数据或预处理过程可复现性的工作(原始版受限不可得)。

11.4 30 秒决策卡

你要做什么 用它吗 关键提醒
主数据预训练→低资源微调 用 60 例训练集+Synapse/TCIA 双通道,坑 1 口径先分清
域偏移/泛化评测 用 MRIQC 证据链+全 1.5T 特性是天然变量
LMIC 公平性研究 用 引 NOAJ+Radiol AI 论文,别用第三方污染数字(坑 5)
分子分型/纵向研究 不用 无分子标签、无随访
复现预处理管线 不可行 原始图 NIH 受限(坑 4)

11.5 常见错误用法 Top 5(从文献与社区实践归纳)

  1. 口径错:把 146 写成"146 例胶质瘤"——实际胶质瘤 95-115 例,51 例是其他脑肿瘤;
  2. 泄漏:TCIA 全集(带标签)训练→挑战赛验证集自评——训练集与验证集在全集内重叠(§2.7);
  3. 越界:用官方测试集影像自评并给出"DSC=X"——参考标签从未公开,成绩无锚;
  4. 错引:数据引用写 Zenodo 10978906(簇设计文档)而非 TCIA DOI——DOI 错位等于数据不可溯源;
  5. 过读:把两届 DSC +9.4% 画成"能力增长曲线"——两届数据与规则都不同,只支持"届间比较"这一种表述。

FAQ(高频问答 42 问)

A. 基础认知

Q1:BraTS-Africa 是独立数据集还是 BraTS 的子集?
既是子集又是独立数据集:挑战赛子集(95/115 例胶质瘤)是 BraTS 簇 Task 4 的官方数据;TCIA 146 例全集是独立发布、独立 DOI、含 51 例非胶质瘤扩充的完整 collection。协议与工具链继承 BraTS,数据来源与人群独立。

Q2:官方全名是什么?
挑战赛:MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge。数据集:Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa)。

Q3:数据从哪些国家来?
全部来自尼日利亚(多诊断中心)。"Africa"是愿景名——论文明确以"从非洲其他国家持续扩充"为未来机制,当前版本是纯尼日利亚数据。

Q4:都是成人吗?
挑战赛口径为成人弥漫性胶质瘤(2021 WHO CNS 肿瘤分类)。儿科病例不在本数据集(儿科由 BraTS 簇 Pediatric Task 覆盖)。

B. 数据与获取

Q5:在哪下载?
TCIA:https://www.cancerimagingarchive.net/collection/brats-africa/ (Aspera 下载)。挑战赛数据:Synapse syn51156910(2023)/ syn59059780(2024)。

Q6:要注册吗?
TCIA 公开部分不需要;Synapse 挑战赛数据需要 Synapse 账号并接受数据使用条款。

Q7:能拿到测试集标签吗?
不能。2023 的 20 例与 2024 新增的 20 例测试参考标签由组织者扣留用于终评,从未公开。

Q8:51 例"其他脑肿瘤"是什么病理类型?
官方未逐例公开病理构成,仅 XLSX 元数据含诊断字段。做胶质瘤专项研究时建议先按 XLSX 过滤出胶质瘤子集。

Q9:四个序列都完整吗?
预处理版要求全部四序列(经 sanity check);原始采集层面序列缺失在 SSA 临床常见——这正是本数据集的特色背景,但官方预处理产物已做完整性筛查。

C. 挑战赛与结果

Q10:两届挑战赛分别多少队伍?
2023:9 队上榜(12 国参与者);2024:6 队上榜(7 国)。

Q11:2024 成绩提升多少?
2024 排名前六的方法相对 2023:DSC 提升 9.4%、HD95 降低 57.21%(NOAJ 论文 Welch’s t-test 口径)。

Q12:2024 规则最大变化是什么?
用额外数据(如 BraTS 主数据)做模型开发或预训练的提交不参与排名——把"纯 SSA 数据上限"从迁移学习混合成绩中剥离。

Q13:模型怎么提交?
MLCube 容器化模型经 MedPerf 平台提交,GaNDLF 框架自动生成容器;方法短论文经 CMT 提交;预测分割文件经 Synapse 提交评估。

Q14:评估指标是什么?
lesion-wise DSC 与 HD95 的加权组合(沿用 BraTS 惯例),对验证/测试集分别计算并按子区域报告。

D. 方法学

Q15:从零训练可行吗?
不可行——60 例训练集无法支撑 3D 网络从零收敛。文献主流:主数据预训练+微调+集成+后处理。

Q16:有没有推荐的基线?
nnU-Net 是社区默认起点(2023 届上榜多为 nnU-Net 改造);SIGN(相似度加权自集成)在 Radiol AI 论文的两轮评估中整体最佳。

Q17:标注可靠吗?
nnU-Net 预标注+10 名住院医精修+2 名注册放射科医生复核+1 名美国 board-certified 神经放射专家终审。注意:终审为单专家,无公开的多专家一致性数据。

Q18:标签数值怎么映射?
三子区域方案(ET/NETC/SNFH),标签文件为单通道整型体数据;对照官方命名与第三方资料的 NC/edema 旧称时注意坑 6。

E. 许可与合规

Q19:商用可以吗?
预处理版 CC BY 4.0 允许商用(需归属);但 TCIA Data Usage Policy 附加归属义务;未处理原始图受 NIH 政策约束(当前不可得)。

Q20:引用什么 DOI?
数据:10.7937/v8h6-8x67;论文:10.1093/noajnl/vdag082(赛事总结)、10.1148/ryai.240528(数据集描述)、arXiv:2305.19369(2023 设计)。

Q21:Zenodo 10978906 是什么?
BraTS 2024 簇总设计文档(Task 1-10),不是 BraTS-Africa 数据 DOI——详见坑 3。

F. 生态与延伸

Q22:数据集会继续扩大吗?
论文将 AfNiA+CAMERA+Lacuna Fund 机制定位为持续扩充框架,目标是纳入非洲其他国家数据;但截至本文抓取时点,TCIA version 1(2024-09-04)仍为 146 例。

Q23:和 FeTS 什么关系?
同为 BraTS 衍生但命题不同:FeTS 解决"数据不能出门"的联邦训练,BraTS-Africa 解决"数据本身来自低资源分布"的公平性与泛化性。

Q24:在哪里能看到 2023 届参赛方法细节?
NOAJ vdag082 表 1 按排名列出 9 队方法(nnU-Net/ODConv2D、AGU-Net、TCuP-GAN、SAMBA 等);扩写论文见 MICCAI BraTS LNCS proceedings。

G. 复现与工程

Q25:怎么把 146 例切成自己的 train/val?
先按 XLSX 诊断字段分出胶质瘤/非胶质瘤;若目标是与文献可比,建议沿用"中心分层+诊断分层"的拆分逻辑(保持每折设备构成相近),并在论文中声明与官方挑战赛拆分不可互比。

Q26:dataloader 需要改什么?
几乎不用改——目录结构、文件命名、体数据规格均与 BraTS 主数据同构(§2.6/§2.8)。要改的通常是:类别数(3 子区域)、可能的名字后缀适配(-t1n/-t1c/-t2w/-t2f 两套写法)。

Q27:能看到 2024 届上榜代码吗?
部分队伍在 GitHub 公开(组织方鼓励但不强制);NOAJ 论文表 1 记录方法描述与引用入口。MedPerf 平台持有提交的 MLCube 容器,但容器不是公开制品。

Q28:怎么统计各中心的样本量?
用 TCIA XLSX 元数据按"扫描地点"列聚合即可得到中心×例数交叉表;设备型号列可做厂商分布分析。这是主赛数据不提供的分析维度。

Q29:MRIQC 质量指标能自己重算吗?
对预处理版可以(MRIQC 直接吃 NIfTI),但结果与论文的"未处理对照"不可比——论文测的是原始采集质量,你测的是预处理后质量。原始图不可得,未处理质量指标无法外部复现。

Q30:数据增强有什么特别建议?
针对低场特性:强度域增广(gamma、偏置场模拟、Rician 噪声模拟)比几何增广更关键;层间插值不确定性可以用随机层间缩放模拟;有论文用合成/增广手段在 SSA 数据上验证泛化(同簇 Task 7 即 FDA 合作增广评估赛道)。

Q31:体积小,能做 self-supervised 预训练吗?
146 例做大规模自监督偏少;文献路线是反向的——用主数据/公开脑 MRI 库(如健康人+主赛)做自监督或监督预训练,再在 BraTS-Africa 上微调评测。

H. 生态与延伸(续)

Q32:AfNiA 是什么?
Africa Neuroimaging Archive——非洲神经影像归档,本数据集的原始汇聚层:尼日利亚各中心临床扫描先进入 AfNiA,再按 BraTS 协议加工输出。它是"CAMERA 教育-归档-研究"闭环的存储环节。

Q33:CAMERA 是什么?
Consortium for Advancement of MRI Education and Research in Africa——非洲 MRI 教育与科研推进联盟。挑战赛官方全名中的"CAMERA"即指它;其价值在"人"的层面:没有本地-trained 影像人才,数据与模型都不可持续。

Q34:Lacuna Fund 是什么?
面向全球南方数据公平的资助基金,Health and Equity 方向资助了本数据集的策展与标注。数据集的"标注劳动力成本"视角(§3)正是这类资助的典型适用场景。

Q35:有 2025 届吗?
挑战赛随 BraTS 簇年度滚动;2025 年簇的 SSA 赛道延续情况以当年 BraTS/CBIGR 官方公告为准——本条目事实边界止于 2024 届与 146 例 version 1。

Q36:能用它训练分类/生存预测模型吗?
能做影像-only 的分级/分类探索(XLSX 有诊断字段),但无生存随访、无分子标签(IDH/MGMT/1p19q),做不了有意义的生存预测研究——这也是它与 upenn-gbm 等纵向数据集的本质分工。

Q37:为什么标题说它是"域偏移测试床"而不是"另一个分割数据集"?
因为它的价值密度在"分布"而非"规模":146 例不足以训练大模型,但足以测量"高资源训练的模型在低资源分布上掉多少分"——这个测量主赛数据自己永远做不了。

I. 失败模式与坑位自检

Q38:最常见的实验设计错误是什么?
用 TCIA 全集(含标签)训练后去挑战赛验证集刷分——数据泄漏(§2.7)。第二名:把 51 例非胶质瘤混进胶质瘤分割训练。第三名:拿"146 例胶质瘤"的表述直接进论文——例数口径错误(坑 1)。

Q39:读别人论文时怎么快速验真?
三查:查例数口径是否声明(146/115/95);查测试集是否自造(官方测试标签未公开,任何"在官方测试集上 DSC=X"的非参赛论文都值得怀疑);查 Zenodo 10978906 是否被当数据源引用(坑 3)。

Q40:预处理版上还能做"预处理研究"吗?
做不了端到端(原始图不可得,坑 4),但可以研究"预处理参数敏感性"的上游模拟——在预处理版上施加扰动(模拟不同 N4 强度、不同插值)观察模型稳健性。这是可行的降级路径。

Q41:51 例"其他脑肿瘤"值得单独研究吗?
作为"分割标签在非胶质瘤上的行为"的探针很有价值(脑膜瘤、转移瘤等在三区域标签体系下如何表现,官方未细说);作为"第二个人群基准"则披露不足——诊断构成没有公开明细表。

Q42:如果想帮 SSA 做点事,除了发论文还能做什么?
现实路径:参赛(2023/2024 届非洲队伍有专项资助机制);给 CAMERA 类联盟做教学材料;把模型做成能在 1.5T、断网、低算力环境跑的轻量形态——最后这条是 SSA 落地的真瓶颈,也是这个数据集设置之初就想撬动的研究方向。

J. 写给四种读者的特别提示

给初学者:先用 60 例训练集+nnU-Net 跑通 baseline,再谈创新;不要一上来就设计复杂模型——60 例的规模会把一切过拟合倾向放大到荒谬。

给审稿人:看到"BraTS-Africa 上验证"的投稿,先查三件事——例数口径、是否用官方测试集宣称成绩(不可信,标签未公开)、是否声明了单专家标注的局限。

给数据集建设者:这个案例的可复制清单是——借成熟协议(BraTS)降低规格决策成本;借预标注流水线降低标注成本;借顶会赛事制造激励;借专项基金覆盖"公平性溢价"。四件事缺一,数据集的完成度都会打折。

给临床医生:本数据集是研究资源而非临床工具;标签来自影像学定义(非病理确认的生物学实体),任何向临床决策的迁移都需要前瞻验证——这正是组织者自己强调的边界。

事实清单(硬事实 40 条)

  1. 数据集正式名:Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa)。
  2. 挑战赛官方全名:MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge。
  3. TCIA DOI:10.7937/v8h6-8x67(2024-08-31 DataCite 注册;version 1,2024-09-04 更新)。
  4. 全集规模:146 例 = 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤。
  5. 2023 挑战赛拆分:60 训练/15 验证/20 测试(95 例胶质瘤)。
  6. 2024 挑战赛拆分:60 训练/35 验证/20 新测试(115 例胶质瘤;35=15+2023 的 20)。
  7. 采集时间窗:2010-01 至 2022-12;全部术前、回顾性、临床常规采集。
  8. 设备:全部 1.5T(Siemens Magnetom Essenza ×2、Philips Achieva、GE SIGNA Explorer、GE SIGNA Creator)。
  9. 原始层厚 3-5mm,层面内 1mm(非各向同性)。
  10. 模态:T1、T1-CE、T2、T2-FLAIR 四序列 mpMRI;DICOM→NIfTI。
  11. 来源国:尼日利亚;TCIA 口径 6 中心/NOAJ 口径 7 中心(含 LUTH);经 AfNiA 汇总。
  12. 资助:Lacuna Fund for Health Equity;协作:CAMERA。
  13. 预处理:LPS 重定向→T1-CE 刚性配准 SRI24→1mm³ 各向同性重采样→N4 偏置场校正→颅骨剥离→强度归一化。
  14. 工具链:CaPTk 1.9.0 + nnU-Net + ITK-SNAP 4.0.0。
  15. 标注三阶段:10 名住院医精修→2 名注册放射科医生复核→1 名美国 board-certified 神经放射专家(>5 年经验)终审。
  16. 标签:ET/NETC/SNFH 三子区域(BraTS 2024 命名)。
  17. TCIA 预处理版:146 subjects/730 studies/1.6GB,CC BY 4.0。
  18. TCIA 未处理版:146 subjects/585 studies,NIH Controlled 受限,下载通道 Unavailable。
  19. Synapse:2023=syn51156910;2024=syn59059780。
  20. 2023 届:9 队上榜、12 国。
  21. 2024 届:6 队上榜、7 国。
  22. 两届比较:2024 前六 DSC +9.4%、HD95 -57.21%(Welch’s t-test)。
  23. 2024 规则:用额外数据开发/预训练的模型不参与排名。
  24. 提交形态:MLCube 容器(MedPerf 平台)+ GaNDLF 框架;短论文经 CMT。
  25. 质量对照:50 例未处理 BraTS-Africa vs 50 例 TCGA-GBM,MRIQC 22.0.6 五指标(SNR/CNR/CJV/EFC/QI1),P<.05。
  26. 流行病学:SSA 胶质瘤死亡率 1990-2016 升约 25%(全球北方降 10%-30%;美国 30 年降 7%)。
  27. 胶质瘤存活:30%-80% 五年内死亡(NOAJ);GBM 约 80% 两年内死亡(arXiv 摘要)。
  28. SIGN(SimIlarity weiGhted self-eNsembling)在初评与 BraTS-Africa 重训两轮中整体最佳。
  29. BraTS 2024 簇 10 个 Task;BraTS-Africa 为 Task 4;簇总设计文档 Zenodo DOI 10.5281/zenodo.10978906(2024-04-16)。
  30. 论文:NOAJ 2025;8(1):vdag082(PMC13141146);Radiol Artif Intell 2025;7(4):e240528(PMCID PMC12319694);arXiv:2305.19369。
  31. 挑战赛 2023 届允许补充数据但须双报告;2024 届改为不进排名——两届成绩不可直接画趋势线。
  32. 2023 届方法短论文 8-10 页,经 CMT 提交;上榜者受邀扩写为 LNCS 会议论文。
  33. TCIA collection 总计口径 3.7GB;预处理可下载包 1.6GB(730 studies)。
  34. 数据引用为强制(Data Citation Required),须含 DOI 10.7937/v8h6-8x67 与 TCIA Data Usage Policy 归属。
  35. 主办核心人物:Udunna C. Anazodo(McGill/MNI + Crestview Radiology)、Maruf Adewole、Jeffrey D. Rudie、Spyridon Bakas(UPenn)、Bjoern Menze、Ujjwal Baid 等。
  36. 纳入标准:2010-01~2022-12 之间、具脑肿瘤临床表现的脑 MRI(CNS 肿瘤/弥漫性胶质瘤/LGG/GBM-HGG);排除:非 MRI 或窗口外扫描。
  37. 预处理产线以 T1-CE 为配准锚(6 自由度刚性→SRI24→1mm³),其余序列复合变换间接配准。
  38. 终审专家资质口径:美国 board-certified 神经放射医生、5 年以上脑肿瘤分割经验(含 DL 方法开发)。
  39. 两届统计检验:Welch’s t-test(届间比较)+ paired t-test(African-only vs +额外数据训练比较)。
  40. 2024 届 Africa 非洲参赛队伍成绩激励为出席 MICCAI 2024(马拉喀什)的资金支持;2023 届另有现金奖(温哥华)。

DAIMS 评估表(AI-Ready 数据管理成熟度)

维度 得分 评注
D1 可发现性 4/5 TCIA 专页+DataCite DOI+三篇论文互引,检索面完整;扣分在命名多轨(BraTS-Africa/BraTS2023-SSA/BraTS-SSA)易致检索漏检
D2 可获取性 3/5 预处理版 CC BY 4.0 公开但需 Aspera 插件;原始版受控不可得;挑战赛数据需 Synapse 注册——三层门禁
D3 互操作性 5/5 完全对齐 BraTS 规格(NIfTI、1mm³、目录/ID 惯例),BraTS 生态工具链零成本复用
D4 复用性 3/5 CC BY 4.0+完整引用指南;但无分子标签、无纵向数据、预处理不可复现、测试标签扣留,限制研究面
D5 溯源性 4/5 中心/设备/时间窗/标注流水线披露充分;单专家终审与多口径数字(146/115/95;6/7 中心)需引用者自行调和
总评 19/25 规格与协议继承 BraTS 而高度 AI-Ready;扣分集中在获取门禁与多口径治理,属"高互操作、中等可得"型数据集

评分稳定性的两个触发器(何时需要重评):其一,若 NIH 政策调整使未处理原始 NIfTI 恢复获取,D2 上调至 4/5、D4 上调至 4/5(预处理可复现);其二,若 TCIA 发布 version 2(新增国家数据或更大例数),D1/D5 相关口径全部需要重核——届时本条目的例数三口径(146/115/95)需要增补第四套口径。

P1:本数据集最容易被误读的数字一览(引用前自查):

数字 常见误读 正确表述
146 “146 例胶质瘤” 146 例脑肿瘤(95 例弥漫性胶质瘤+51 例其他脑肿瘤)
115 “全集 115 例” 2024 届挑战赛胶质瘤口径(60/35/20)
60 “60 例数据集” 训练集例数(全集的子集)
9.4% “DSC 达到 0.9X” 2024 前六名相对 2023 届的 DSC 相对提升
57.21% “HD95 误差 57” 2024 前六名相对 2023 届的 HD95 相对下降
6/7 家中心 “6 家(唯一口径)” TCIA 口径 6 家、NOAJ 论文口径 7 家(坑 2)
2010-2022 “近三年采集” 固定历史窗口,数据为快照式发布
1.5T “低场=低质量数据集” 采集事实与统计对照(§7.2),不构成价值判断

附录 A:来源清单与核验时点

证据等级说明:本条目事实分三级——一级证据(TCIA collection 页、TCIA/DataCite DOI 记录、挑战赛官方论文原文)为一切硬数字的来源;二级证据(Zenodo 簇设计文档、Synapse 页面元信息、主办方机构页)用于赛事结构与定位;三级证据(第三方数据集目录、综述转述、参赛者复现记录)只用于交叉检验并在冲突时让位于一二级,其数字不得直接引用(坑 5 的污染源多在三级)。

来源 URL/DOI 等级 用途 核验时点
TCIA collection 页 https://www.cancerimagingarchive.net/collection/brats-africa/ 一 规模/设备/license/获取 2026-09-27
TCIA 数据 DOI https://doi.org/10.7937/v8h6-8x67 一 数据引用 2026-09-27
NOAJ 两届总结论文 https://doi.org/10.1093/noajnl/vdag082(PMC13141146) 一 拆分/队伍/指标/中心名单 2026-09-27
Radiol AI 数据集描述论文 https://doi.org/10.1148/ryai.240528(PMC12319694) 一 146 例口径/质量对照/license 2026-09-27
arXiv 2023 届设计 https://arxiv.org/abs/2305.19369 一 LMIC 背景/2023 口径 2026-09-27
BraTS 2024 簇设计文档 https://doi.org/10.5281/zenodo.10978906 二 Task 4 定位/簇全景 2026-09-27
DataCite ORCID 记录 https://commons.datacite.org/orcid.org/0000-0002-2567-9465 一 95+51 构成/注册日期 2026-09-27
Zenodo 独立记录(模型) https://doi.org/10.5281/zenodo.14510931 二 坑 3 存照 2026-09-27
Synapse 2024 数据页 https://www.synapse.org/Synapse:syn59059780 二 挑战赛数据入口 2026-09-27(经第三方转述核验)
openmedlab BraTS2023-SSA 条目 github.com/openmedlab/Awesome-Medical-Dataset 三 交叉检验(其"30 测试"与官方冲突,坑 5) 2026-09-27

附录 A2:核验方法自述(可复制的三源互证流程)

本条目采用的三源互证流程(供后续维护者复用):

  1. 第一轮(存在性):泛化关键词搜索(BraTS-Africa + Zenodo + MICCAI + challenge)确认对象存在、规模量级与核心归属——命中 TCIA collection 页、Zenodo 簇文档、NOAJ 论文三大一级源;
  2. 第二轮(细节核验):逐字段抓取——TCIA 页面(规模/设备/license/获取方式全文)、DataCite 注册记录(95+51 构成、注册日期)、PMC 全文(Radiol AI e240528 与 NOAJ vdag082,后者经 Europe PMC REST API 获取全文 XML)——建立"每个硬数字至少两个一级源"的矩阵;
  3. 第三轮(冲突仲裁):列出所有口径冲突(例数 146/115/95、中心 6/7、测试 20/30、Zenodo 归属),逐条回溯到最权威的原始出处仲裁,无法仲裁的以"多口径并存"存照(坑 1/2/5)。

冲突仲裁的三条原则:官方论文 > 官方页面 > 第三方目录;期刊论文 > 预印本 > 会议摘要;有统计检验的结论 > 无检验的叙述。任何一处"正文说 A、表格说 B"的原始文档内冲突,按论文正文优先并在坑点存照。

附录 B:检索路径示范

目标 推荐查询式 预期命中
数据本体 site:cancerimagingarchive.net BraTS-Africa / DOI 10.7937/v8h6-8x67 TCIA collection 页
两届总结 “BraTS-Africa challenge” AND (“sub-Saharan” OR SSA) NOAJ vdag082
数据集论文 “BraTS-Africa Dataset” AND “African Populations” Radiol AI e240528
2023 设计 BraTS-Africa 2023 arXiv SSA glioma segmentation arXiv:2305.19369
参赛方案 BraTS-Africa 2024 transfer learning nnU-Net SSA arXiv:2412.04111 等 LNCS/arXiv
反例(勿引) “BraTS-Africa 750 cases” / selectdataset “75 例” 第三方污染数字(坑 5)

检索卫生两条:一、凡遇"BraTS-SSA"字样先分辨是病例 ID 前缀、2023 届注册名还是 Zenodo 模型记录;二、任何例数引用前先声明口径(146 全集/115 挑战赛 2024/95 挑战赛 2023)。

附录 C:术语对照表(中英首现速查)

术语 全称/英文 释义
BraTS Brain Tumor Segmentation Challenge 国际脑肿瘤分割挑战赛(2012 起,MICCAI 卫星)
SSA Sub-Saharan Africa 撒哈拉以南非洲
LMIC Low- and Middle-Income Countries 低收入与中等收入国家
AfNiA Africa Neuroimaging Archive 非洲神经影像归档(数据汇聚层)
CAMERA Consortium for Advancement of MRI Education and Research in Africa 非洲 MRI 教育与科研推进联盟
Lacuna Fund Lacuna Fund for Health Equity 资助全球南方数据公平的基金
TCIA The Cancer Imaging Archive 癌症影像归档(数据托管方)
mpMRI multi-parametric MRI 多参数磁共振(本数据集:T1/T1-CE/T2/T2-FLAIR)
T1-CE contrast-enhanced T1(T1c) 钆对比剂增强后 T1 加权
T2-FLAIR T2 Fluid-Attenuated Inversion Recovery T2 液体衰减反转恢复序列
ET Enhancing Tumor 增强肿瘤(分割标签)
NETC Non-Enhancing Tumor Core 非增强肿瘤核心(分割标签;旧称 NC/NET)
SNFH Surrounding Non-Enhancing FLAIR Hyperintensity 周围非增强 FLAIR 高信号(分割标签;旧称 edema/ED)
GBM/HGG Glioblastoma / High-Grade Glioma 胶质母细胞瘤/高级别胶质瘤
LGG Low-Grade Glioma 低级别胶质瘤
胶质瘤病 gliomatosis cerebri 弥漫浸润性胶质瘤表现,SSA 疑似比例更高
SRI24 SRI24 atlas(SRI 24-space anatomical atlas) 配准目标解剖模板
N4 N4 bias field correction 偏置场校正算法
颅骨剥离 skull-stripping / brain extraction 去除非脑组织
de-facing de-identification by face removal 去面(去标识)处理
CaPTk Cancer Imaging Phenomics Toolkit 影像处理工具包(DICOM 转换/配准/重采样)
ITK-SNAP ITK-SNAP 半自动分割标注/审核软件
nnU-Net nnU-Net 自配置分割框架(预标注与基线)
DSC/Dice Dice Similarity Coefficient 分割重叠度量
HD95 95% Hausdorff Distance 边界距离度量(95 分位)
lesion-wise 逐病灶 以病灶为单位的评估聚合方式
MLCube MLCube 容器规范 模型容器化提交格式
MedPerf MedPerf 平台 MLCommons 的模型基准评测平台
GaNDLF Generally Nuanced Deep Learning Framework MLCommons 维护的医学 DL 框架(自动生成 MLCube)
Synapse Sage Bionetworks Synapse 数据共享与排行榜平台
CMT Microsoft Conference Management Toolkit 短论文投稿系统
MRIQC MRI Quality Control 标准化 MRI 质量评估工具(SNR/CNR/CJV/EFC/QI1)
domain shift 域偏移 训练与部署数据分布不一致
WHO 2021 WHO Classification of Tumors of the CNS (2021) 中枢神经系统肿瘤分类(诊断依据)

附录 D:引用格式示例

数据集(强制归属):

@dataset{adewole_2024_bratsafrica,
  author = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and
            Zhang, Dong and Raymond, Confidence and others},
  title  = {Expanding the Brain Tumor Segmentation (BraTS) data to include
            African Populations (BraTS-Africa) (version 1)},
  year   = {2024},
  publisher = {The Cancer Imaging Archive},
  doi    = {10.7937/v8h6-8x67}
}

两届总结论文:

@article{adewole_2025_noaj,
  author  = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and others},
  title   = {Brain tumor segmentation in Sub-Saharan Africa patient population:
             The BraTS-Africa challenge},
  journal = {Neuro-Oncology Advances},
  year    = {2025},
  volume  = {8},
  number  = {1},
  pages   = {vdag082},
  doi     = {10.1093/noajnl/vdag082}
}

数据集描述论文:

@article{adewole_2025_ryai,
  author  = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and others},
  title   = {The BraTS-Africa Dataset: Expanding the Brain Tumor Segmentation
             Data to Capture African Populations},
  journal = {Radiology: Artificial Intelligence},
  year    = {2025},
  volume  = {7},
  number  = {4},
  pages   = {e240528},
  doi     = {10.1148/ryai.240528}
}

引用卫生三条:一、TCIA 要求"Data Citation Required"——任何使用必须带上数据 DOI;二、不要把 Zenodo 10978906(簇设计文档)写进数据引用;三、引例数时写明口径(146/115/95)。


维护交接卡(后续代理/编辑请先读)

事项 说明
触发重核的条件 TCIA collection 页例数/版本变化;BraTS 簇公告新一届 SSA 赛道;Radiol AI/NOAJ 勘误
重核优先级 1 例数三口径(146/115/95)——任何新版本发布立即失效
重核优先级 2 原始图获取状态(NIH 政策)——影响坑 4 与 DAIMS D2/D4 评分
重核优先级 3 Zenodo 侧新增记录(模型/数据)——影响坑 3 的归属表述
不要动的事实 两届队伍数(9/6)、DSC +9.4%、HD95 -57.21%、设备型号表、标注三阶段——均有一级源
本条目自产的推算 §3.8 工作量估算、§7.3 对策表——已在文中声明"本文推算",维护时勿当官方数字
互链硬锚 brats = rid 24(库内唯一 brats URL);其余互链对象 rid 以当时库内查询为准
环境留痕 生产代理 agentA-bratsafrica;生产时点 ps aux codebuddy 进程数=5;part 临时文件 /tmp/brats-africa_agentA-bratsafrica_part1-5.md
备选改道记录 正选 brats-africa 三源核验通过,未触发改道;备选 crossmoda-2023 未启用(库内 crossmoda2022 无冲突,但正选证真后无需改道)

尾注

版本存照:本条目基于 TCIA version 1(2024-09-04 更新,146 例)与两届挑战赛(2023/2024)的官方事实边界撰写;对"BraTS-Africa"这一名称在 2025 年及以后的赛事续办、数据扩版(第三方综述已出现 ≈750 例口径)不在本版本事实边界内,后续版本应重核 TCIA collection 页与当年 BraTS 簇公告。

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点见附录 A。事实陈述以 TCIA collection 页(DOI 10.7937/v8h6-8x67)、NOAJ 两届总结论文(10.1093/noajnl/vdag082)、Radiology: Artificial Intelligence 数据描述论文(10.1148/ryai.240528)与 arXiv:2305.19369 为源,三源互证;三套例数口径、双中心口径、Zenodo 归属、license 异构、第三方数字污染等原始文档与传播层面的缺陷已在坑点清单存照。条目与库内 brats(rid 24)、fets、pengwin、upenn-gbm、rembrandt、ucsf-pdgm、BCN20000 等条目互链,构成脑肿瘤 MRI"资源梯度"家族的完整检索面。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ucsf-pdgm — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
  • fets — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
  • crossmoda-2023 — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
  • promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 肿瘤学
  • rembrandt — 共享标签:医学影像 / MRI / 脑肿瘤
  • brats — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
  • trackrad — 共享标签:医学影像 / MRI / 医学图像分割 / 肿瘤学
  • brats-pediatric — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
  • medical-decathlon — 共享标签:医学影像 / MRI / 医学图像分割
  • pannuke — 共享标签:医学影像 / 医学图像分割 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集