信息速览
BraTS-Africa:给全球最缺数据的地方补一块脑瘤拼图
INFOBOX — BraTS-Africa 一屏速览
维度 内容 本质 MICCAI BraTS 挑战赛簇面向**撒哈拉以南非洲(SSA)**的胶质瘤分割数据集+卫星挑战赛(2023/2024 两届) 官方全名 MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge;2024 年为 BraTS 2024 簇 Task 4 数据本体 146 例尼日利亚术前脑 1.5T mpMRI(T1/T1-CE/T2/T2-FLAIR)= 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤 采集 2010-01~2022-12,多诊断中心(TCIA 口径 6 家/NOAJ 口径 7 家),经 AfNiA 汇总 挑战赛拆分 2023:60 训练/15 验证/20 测试(95 例);2024:60/35/20(115 例,测试标签扣留) 标注 nnU-Net 预标注 → 10 名住院医精修 → 2 名注册放射科医生复核 → BraTS 专家神经放射医生终审;ET/NETC/SNFH 三子区域 预处理 BraTS 标准流水线:SRI24 配准、1mm³ 各向同性重采样、N4 偏置场校正、颅骨剥离(CaPTk 1.9.0 + nnU-Net + ITK-SNAP 4.0.0) 两届成绩 2023 上榜 9 队(12 国)、2024 上榜 6 队(7 国);2024 前六名 DSC +9.4%、HD95 -57.21% 获取 预处理版+标签 CC BY 4.0 TCIA 公开(Aspera,1.6GB);未处理原始图 NIH 政策受限;挑战赛数据 Synapse 注册 DOI 数据:10.7937/v8h6-8x67(TCIA,2024-08-31 注册);两届总结论文:10.1093/noajnl/vdag082 核心特色 LMIC(低资源)影像的真实分布:低场设备、层厚 3-5mm、对比度差、序列缺失——全球脑瘤 AI 的天然域偏移测试床 库内互链 brats(主赛本体)、fets(联邦学习)、pengwin(脑膜瘤放疗)、upenn-gbm、rembrandt、ucsf-pdgm、BCN20000 生产声明 2026-09-27 由 agentA-bratsafrica 生产;三源互证,抓取核验时点与证据分级见附录 A/A2
BraTS-Africa 是一个"把顶级赛事搬到全球影像最薄弱角落"的数据集工程:自 2012 年起持续领跑脑肿瘤分割的 BraTS 挑战赛,在前十年里积累的训练数据几乎全部来自高收入国家的 3T 设备;而撒哈拉以南非洲的胶质瘤死亡率不降反升,当地 1.5T 低场设备拍出的图像对比度更差、层厚更厚、序列更容易缺失。BraTS-Africa 在 2023-2024 年把尼日利亚多家诊断中心的真实临床数据(146 例,其中 95 例弥漫性胶质瘤)按 BraTS 标准预处理、专家三阶段标注后开放,并连办两届 MICCAI 挑战赛,用成绩单证明:在主赛上接近满分的算法,搬到这块数据上会重新面对一个"不一样的赛题"。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意 146 例的"公开"只覆盖预处理版,未处理原始图的下载通道已因 NIH 政策下线(坑 4)。
- 关心模型泛化:直奔 §7 LMIC 场景与图像质量——SNR/CNR 量化对比与 SSA 独有临床特征是本条目的灵魂。
- 分不清它和 BraTS 主赛:直奔 §4 关系专节——三套例数口径(146/115/95)、两届拆分、规则差异一张表说清(坑 1)。
一分钟导航(全文 11 节 + FAQ + 附录的功能地图):
| 你想知道 | 去哪 | 关键产出 |
|---|---|---|
| 数据长什么样 | §2 | 146 例构成/设备矩阵/文件结构/三套拆分 |
| 标签靠谱吗 | §3 | 三阶段流水线/单专家终审声明 |
| 和 brats 主赛什么关系 | §4 | 必答对照表/十 Task 全景/泄漏警告 |
| 挑战赛成绩 | §5 | 两届队伍数/指标公式/解读陷阱 |
| 怎么下载与合规 | §6 | 门禁全表/实操问答/CC BY 4.0 边界 |
| 凭什么说"难" | §7 | MRIQC 五指标/域偏移清单/公平性边界 |
| 学术生态位 | §8 | 论文谱系/大事记/易混淆对象辨析 |
| 快速避坑 | §10 | 八个坑一次读完 |
| 30 秒决策 | §11 | 决策卡 |
| 深度问答 | FAQ | 42 问 |
| 引用格式 | 附录 D | BibTeX 三件套 |
时间线速览(详细版见 §8.4):
| 时点 | 事件 |
|---|---|
| 2010-01~2022-12 | 尼日利亚多中心临床常规采集(1.5T,四序列 mpMRI) |
| 2023-05 | 首届挑战赛启动(BraTS 2023 簇分割子任务,时名 BraTS2023-SSA),95 例胶质瘤上线 |
| 2023-10 | 2023 届终评:9 队上榜(12 国),MICCAI 温哥华卫星活动 |
| 2024-04-16 | BraTS 2024 簇设计文档发布(Zenodo 10978906),SSA 列为 Task 4 |
| 2024-05~08 | 第二届挑战赛:115 例拆分(60/35/20),规则收紧 |
| 2024-08-31 | TCIA DOI 注册(10.7937/v8h6-8x67);146 例全集 version 1(2024-09-04 页面更新) |
| 2024-10 | 2024 届终评:6 队上榜(7 国),MICCAI 马拉喀什卫星活动 |
| 2024-12 | Zenodo 出现 5001_BraTS-SSA_2023 模型记录(14510931/14510932,非数据本体,坑 3) |
| 2025 | 两篇正式论文发表:NOAJ vdag082(两届总结)、Radiol Artif Intell e240528(数据集描述) |
| 2026(抓取时点) | 本条目撰写;第三方综述数字污染已存照(坑 5),TCIA version 1 仍为现行版本 |
§0 导读:这个数据集解决什么问题
胶质瘤(glioma)是最常见的原发性脑肿瘤,也是最致命的癌种之一——约 30%-80% 的患者在确诊后五年内死亡,胶质母细胞瘤(glioblastoma, GBM)患者约 80% 活不过两年。过去三十年,美国凭借研究积累把胶质瘤死亡率降低了约 7%;1990-2016 年间全球北方(Global North)的胶质瘤死亡率下降了 10%-30%。同一时间窗里,撒哈拉以南非洲的胶质瘤死亡率平均上升了约 25%。死亡率的剪刀差背后是一整条诊断-治疗链的资源缺口:就诊晚、HIV 等感染性合并症高发、治疗设施短缺,以及一个对 AI 落地最关键的事实——当地影像科和神经放射专家极度稀缺,且医疗影像基础设施落后。
BraTS 挑战赛(International Brain Tumor Segmentation Challenge)自 2012 年起为脑肿瘤分割提供了事实上的全球基准,到 2021 年数据集已扩至 2000+ 例、2023 年簇扩至 4500+ 例。但这些数据几乎全部来自高收入国家:3T 高场设备、标准协议、完整四序列。把这些数据上训练出的最先进模型直接用于 SSA 临床,会遇到三重鸿沟:
| 鸿沟 | 内容 | 对模型的直接影响 |
|---|---|---|
| 设备代差 | SSA 广泛使用 1.5T 低场设备(本数据集 146 例无一例外),磁化率伪影与强度不均更重 | 强度分布整体偏移,依赖高强度先验的模型失准 |
| 采集异构 | 各中心自定协议,层厚 3-5mm 非各向同性,序列缺失常见 | 空间分辨率突变、插值平滑、输入通道信息量不齐 |
| 疾病分布 | 就诊晚(瘤体大)、胶质瘤病样表现更多、感染性类似物与合并症背景更复杂 | 病变尺度与形态先验失效,假阳/假阴模式改变 |
三重鸿沟叠加成典型的域偏移(domain shift):模型在自家数据上 Dice 0.9,换到 SSA 图像上没有人知道还剩多少——而没有任何一个公开数据集能系统地量化这件事,直到 BraTS-Africa 出现。
BraTS-Africa 出现后仍未解决的开放问题(使用前建立预期):
- 规模天花板:146 例对"测量域偏移"够用,对"在域内训练出鲁棒模型"仍然紧张——小数据方法学本身还是开放课题;
- 泛化半径:尼日利亚→非洲其他国家的分布外推(西非 vs 东非 vs 南非的设备谱、疾病谱差异)没有数据支撑;
- 标注天花板:单专家终审+无分子标签,决定了它只能回答"影像学分割"层面的问题;
- 时间性:采集止于 2022-12,设备在换代、协议在演化,快照式数据与持续漂移的真实世界之间有时滞。
BraTS-Africa 的回答是一套"数据+赛事+网络"的组合拳。数据层面:把尼日利亚多家诊断中心 2010-2022 年的回顾性术前 mpMRI 经非洲神经影像归档(AfNiA,Africa Neuroimaging Archive)汇总,按 BraTS 协议统一预处理,由"住院医精修→注册放射科医生复核→BraTS 专家终审"三阶段流水线标注三个肿瘤子区域,最终 146 例在 TCIA 以 CC BY 4.0 公开。赛事层面:2023、2024 连办两届挑战赛(隶属 MICCAI BraTS 簇),评估沿用 lesion-wise DSC 与 HD95,模型以 MLCube 容器经 MedPerf 平台自动评测。网络层面:依托 CAMERA 协作(其本职即为非洲 MRI 教育与科研联盟)与 Lacuna Fund for Health Equity 资助,把数据采集、专家培训与赛事激励(非洲队伍专项资助)拧成一股可持续扩充的机制。
这个条目还站在三个学科的交界处,各学科读者会带走不同的东西:
- 医学图像分割:一个现成的"分布外评测集"与一条成熟的低资源迁移路线(§5、§7);
- 全球健康/健康信息学:一个把"影像可及性不平等"翻译成可测量指标与可复用基础设施的案例(§7.1、§7.7);
- 公平性机器学习(fairness ML):一个比"人口统计分组"更底层的公平性样本——不平等先于算法存在,数据工程是干预的第一杠杆(§7.5-§7.7)。
三学科交界处的独特提醒:分割社区关心"指标",全球健康社区关心"机制",fairness 社区关心"权力结构"——BraTS-Africa 的完整性恰恰在于三者都有可核实的内容:指标有两届榜单,机制有 AfNiA/CAMERA/Lacuna 三件套,权力结构至少有"谁在终审标签、谁拿资助、谁上榜单"的公开记录。
§0 读法三则:
- 这个条目是"数据集+挑战赛+公平性叙事"三合一:本体是 146 例标注 mpMRI,赛事是两届 MICCAI 挑战赛,叙事是"AI 医疗公平"的实证案例——三者共享同一套数字,但口径不同(§1 Q3)。
- 全文统计数字均出自 TCIA 官方页、NOAJ 两届总结论文(vdag082)、Radiology: Artificial Intelligence 数据描述论文(e240528)与 arXiv:2305.19369,三源互证;多口径冲突处在坑点清单集中存照。
- 检索时"BraTS-Africa"“BraTS2023-SSA”"BraTS-SSA"三个名字指同一件事的不同侧面,Zenodo 上的"5001_BraTS-SSA_2023"却是模型记录而非数据本体——命名考古见坑 7。
§1 数据集速览:十问十答
Q1:BraTS-Africa 的"146 例"怎么构成?
TCIA 全集口径:146 例患者,其中 95 例为弥漫性胶质瘤(含低级别胶质瘤 LGG 与胶质母细胞瘤/高级别胶质瘤 GBM/HGG),51 例为其他脑肿瘤(other neoplasms of the brain)。146 例均附专家标注的肿瘤子区域与扫描地点/设备/诊断元数据。95/51 的拆分来自 DataCite 注册描述与 Radiology AI 论文,是官方口径而非第三方估算。
Q2:图像是怎么来的?
尼日利亚多家诊断中心 2010 年 1 月至 2022 年 12 月作为标准临床护理采集的回顾性术前脑 MRI,全部为 1.5T 设备(Siemens Magnetom Essenza、Philips Achieva、GE SIGNA Explorer/Creator),四序列 mpMRI(T1、T1-CE、T2、T2-FLAIR),从 PACS 提取为 DICOM 后转 NIfTI。采集不是研究专用协议——这是它"真实世界分布"价值的来源,也是它"难"的来源。
Q3:为什么还有 95 和 115 两个数字?
那是挑战赛口径:2023 届用 95 例胶质瘤(60 训练+15 验证+20 测试);2024 届扩展为 115 例(60 训练+35 验证+20 新测试,其中 35=2023 的 15 验证与 20 测试并入,测试标签扣留)。146 例 TCIA 全集是 2024 年 8 月发布的"最终形态",比任何单届挑战赛都大。三个数字的关系图见 §2.1。
Q4:预处理做了什么,原始数据也公开吗?
按 BraTS 标准流水线:LPS 重定向→T1-CE 刚性配准到 SRI24 模板→1mm³ 各向同性重采样→其余序列间接配准→N4 偏置场校正→颅骨剥离→强度归一化。预处理版(146 例 730 studies,1.6GB)CC BY 4.0 公开可下载;未处理原始 NIfTI(585 studies)受 NIH 受控数据政策限制,下载通道已下线——这意味着外部用户无法从头复现预处理管线,只能使用官方预处理产物。
Q5:标注流程与可靠度?
nnU-Net 预标注→10 名放射科住院医受训精修→2 名 board-certified 放射科医生复核→一位有 5 年以上脑肿瘤分割经验的美国 board-certified 神经放射专家终审批准(ITK-SNAP 4.0.0 逐例进行)。标签为 BraTS 2024 三子区域方案:ET(增强肿瘤)/NETC(非增强肿瘤核心)/SNFH(周围非增强 FLAIR 高信号)。流水线细节见 §3。
Q6:挑战赛办得怎么样?
2023 届 9 支队伍上榜(参与者来自 12 国);2024 届 6 支队伍(7 国)。评估指标沿用 BraTS 的 lesion-wise DSC 与 HD95 加权组合。2024 届前六名相对 2023 届 DSC 提升 9.4%、HD95 降低 57.21%——一年时间在小数据上仍有可观进步空间。2023 届上榜方法包括 nnU-Net 改造(ODConv2D)、AGU-Net、TCuP-GAN、SAM+YOLOv8 等,全景见 §5.3。
Q7:这数据"难"在哪,为什么值得专门设一个赛道?
三件事叠加:1.5T 低场+厚层厚(3-5mm)带来的低对比度/低分辨率;序列缺失与采集协议异构;SSA 疾病谱特点(就诊晚、瘤体大、胶质瘤病样表现、感染性类似物)。用 MRIQC 五指标(SNR/CNR/CJV/EFC/QI1)对 50 例未处理 BraTS-Africa 与 50 例 TCGA-GBM 对照扫描做统计比较,差异显著(P<.05)——这使它成为全球脑瘤 AI 域偏移评测中样本量最大的"真实低资源"数据之一(§7.2)。
Q8:和库内 brats 条目什么关系?
同一家族:BraTS-Africa 是 BraTS 挑战赛簇的 SSA 分赛道——2023 年为 BraTS 2023 挑战赛五个分割子任务之一(BraTS2023-SSA),2024 年并入 BraTS 2024 Cluster of Challenges 成为 Task 4。训练集 60 例与 BraTS 2023-SSA 完全一致。但数据来源、设备分布、标注终审团队与主赛不同,两者不可混为一谈(§4 专节、坑 1)。
Q9:我现在能拿到什么?
三层:预处理图像+分割标签走 TCIA 公开下载(CC BY 4.0,需 IBM Aspera Connect 插件);XLSX 元数据公开直链;挑战赛训练/验证数据在 Synapse 注册获取(2023: syn51156910;2024: syn59059780);测试集标签不公开。实操细节与门禁全表见 §6。
Q10:谁能用它做什么?
分割模型开发者用它做低资源/域偏移评测与迁移学习;方法学研究者用它研究"预训练-微调"在数据分布突变下的行为;全球健康研究者用它论证 LMIC AI 落地的可行性;教学场景用它展示"真实世界影像长什么样"。不适合:需要分子分型标注(IDH/MGMT)、多时间点纵向随访、或儿童肿瘤的研究(§11.3)。
§1 补充:五个常见误解,一次拆完
误解一:“BraTS-Africa 是 BraTS 数据集的非洲子集。”
反了。BraTS-Africa 的数据来自独立的采集网络(尼日利亚多中心、AfNiA 汇总),与主赛数据零重叠;它"属于"BraTS 的是赛制、协议与评估体系,不是数据。把它理解成"主数据的非洲抽样"会同时犯两个错:既低估其采集独立性,又高估其与主数据的可比性。
误解二:“146 例都是胶质瘤。”
146 例 = 95 例(挑战赛口径)/115 例(2024 口径)弥漫性胶质瘤 + 51 例其他脑肿瘤。51 例的存在让全集可以服务更广的脑肿瘤研究,但也意味着"拿全集跑胶质瘤分割基准"之前要先做子集过滤(§2.5)。
误解三:“数据在 Zenodo 上。”
BraTS-Africa 的数据本体 DOI 在 TCIA。Zenodo 10978906 是 2024 簇十个 Task 的设计文档;Zenodo 14510931/14510932 是名为 5001_BraTS-SSA_2023 的模型记录。三条 Zenodo 线索都搜得到"BraTS"和"SSA"字样,但没有一条是数据下载页(坑 3)。
误解四:“图像质量差所以不能用于严肃研究。”
质量差异是特性不是缺陷。MRIQC 五指标的统计对照让"质量差"变成可量化的实验变量;对域泛化、公平性、预处理鲁棒性研究而言,这种"不完美"正是价值所在。当然,若你的研究假设要求高质量 3T 数据,这个数据集确实不合适——那是研究设计不匹配,不是数据不好。
误解五:“2024 届成绩提升 9.4% 说明问题快解决了。”
两届比较建立在不同的测试集与不同的规则基线上(2024 禁额外数据预训练进排名),且 6 队上榜的小样本使统计功效有限。更稳的读法是"该赛道仍有大改进空间"而非"接近解决"。
§2 数据构成与规格
2.1 规模、来源与多口径例数
BraTS-Africa 的例数在不同语境下有三个数字,全部正确、各有用途——这是使用该数据集前必须建立的第一层心智模型:
| 口径 | 例数 | 构成 | 出处 |
|---|---|---|---|
| TCIA 全集(发布口径) | 146 | 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤 | TCIA collection 页/DataCite(DOI 10.7937/v8h6-8x67) |
| 2023 挑战赛(胶质瘤子集) | 95 | 60 训练 / 15 验证 / 20 测试 | NOAJ vdag082、Radiol AI e240528、arXiv:2305.19369 |
| 2024 挑战赛(胶质瘤子集) | 115 | 60 训练 / 35 验证 / 20 新测试 | NOAJ vdag082(35=15 验证+2023 的 20 测试并入) |
时间线上的逻辑关系:95 例胶质瘤在 2023 年 6 月作为挑战赛数据上线(其中 20 例扣留作测试);2024 届把 2023 的测试集并入验证集并新增 20 例测试,合计 115 例;2024 年 8 月底 TCIA 发布的 146 例全集在 115 例胶质瘤之外补充了 51 例其他脑肿瘤。三个数字的包含-演变关系一图流:
2023 届 2024 届 TCIA 全集
┌─────────────┐ ┌─────────────┐ ┌──────────────────┐
│ 95 例胶质瘤 │ │ 115 例胶质瘤 │ │ 146 例 │
│ 60/15/20 │ → │ 60/35/20 │ ───→ │ 115 胶质瘤 │
│ │ │ ↑并入测试15 │ │ + 51 其他脑肿瘤 │
└─────────────┘ │ 新测试 20 │ └──────────────────┘
└─────────────┘
测试标签始终扣留;146 例全集图像与标签公开(预处理版)
来源机构方面,数据经 AfNiA(Africa Neuroimaging Archive)汇总。NOAJ 论文列出 7 家尼日利亚诊断中心:Crestview Radiology Ltd.(拉各斯)、Lagos University Teaching Hospital(LUTH)、Lagos State University Teaching Hospital(LASUTH)、Lily Hospital Benin、NSIA Kano Diagnostic Center、MedHub Africa Owerri、National Hospital Abuja。而 TCIA collection 页与 DataCite 描述均写"six diagnostic centers",且 TCIA 设备明细表只列 5 家(CRV、LASUTH、LILY、NKDC、MEDHUB)。两口径的差值最可能落在 LUTH(Lagos University Teaching Hospital)的归属上(坑 2)。引用时建议:机构名单引 NOAJ(7 家),规模总述引 TCIA(6 家),并注明口径。
纳入标准:2010-01~2022-12 期间、具有脑肿瘤临床表现的脑 MRI,涵盖中枢神经系统肿瘤、弥漫性胶质瘤、LGG 或 GBM/HGG。排除标准:非 MRI 影像、2010 年以前或 2022 年 12 月以后的扫描。
2.2 设备与原始采集规格
TCIA 设备明细表(BraTS-Africa_TCIA_datainfo_v2.xlsx 配套页面)列出的 1.5T 设备矩阵:
| 中心(缩写) | 厂商 | 型号 | T1 分辨率 (mm) | T2 分辨率 (mm) | T2-FLAIR 分辨率 (mm) |
|---|---|---|---|---|---|
| CRV(Crestview Radiology) | Siemens | Magnetom Essenza | 1×1×5 | 1×1×5 | 1×1×5 |
| LASUTH | Philips | Achieva | 1×1×4.5 | 1×1×5 | 1×1×5 |
| LILY(Lily Hospital Benin) | GE | SIGNA Explorer | 1×1×3 | 1×1×3 | 1×1×3 |
| NKDC(NSIA Kano Diagnostic Center) | Siemens | Magnetom Essenza | 1×1×5 | 1×1×5 | 1×1×5 |
| MEDHUB(MedHub Africa Owerri) | GE | SIGNA Creator | 1×1×4 | 1×1×4 | 1×1×4 |
三个观察点:第一,全部为 1.5T——没有一台 3T,这与 BraTS 主赛数据形成代差;第二,层面内 1mm 但层厚 3-5mm,是明显的非各向同性采集,重采样到 1mm³ 必然引入层间插值伪信息;第三,三家厂商(Siemens/Philips/GE)五种型号并存,强度分布与伪影模式天然异构——对域泛化研究是富矿,对追求单一分布的训练是噪声源。
第四个观察藏在表格外:设备表中 NKDC(NSIA Kano Diagnostic Center)位于卡诺(尼日利亚北部),其余中心集中于拉各斯/贝宁城/奥韦里(南部)——地理跨度本身就说明这不是单一城市便利样本,而是有意构建的多区域采集网络(这也与 AfNiA 的全国性归档定位一致)。每例扫描的"地点"字段让使用者可以把这条地理轴纳入分析,是主赛数据没有的维度。
每个扫描以 DICOM 从 PACS 提取、去标识去面(de-facing)后转 NIfTI,“保留原始分辨率与方向”(unprocessed 版);预处理版则进入 BraTS 流水线(§2.3)。
2.3 预处理流水线:与 BraTS 主赛完全对齐
为了让 SSA 数据能直接进入既有 BraTS 工具链,预处理完全沿用国际 BraTS 挑战赛协议,工具链为 CaPTk 1.9.0(DICOM→NIfTI、SRI24 配准、重采样)+ nnU-Net(颅骨剥离、强度归一化、预标注)+ ITK-SNAP 4.0.0(标注审核):
- 重定向:全部 mpMRI 体数据重定向到 LPS(左-后-上)坐标系;
- 锚定配准:以 T1-CE(钆对比后 T1)为锚,6 自由度刚性配准并基于 SRI atlas 重采样到 1mm³ 各向同性;
- 级联配准:T1、T2、T2-FLAIR 先求对 T1-CE 的刚性变换矩阵,再与"T1-CE→SRI"变换矩阵复合,间接配准到公共模板;
- 偏置场校正:全部序列做 N4 校正,缓解低场设备更严重的磁场不均引起的强度不均匀;
- 脑提取:标准颅骨剥离,去除颈部、脂肪、眼球与颅骨等非脑组织,生成脑掩膜;
- 强度归一化:nnU-Net 自定义流程完成。
预处理后每例的四个序列与分割标签体数据规格统一(1mm³ 等向)。第三方复现实验(如 BraTS-SSA 参赛方案)统计的预处理后体数据尺寸约在 136×170×140 至 240×240×155 范围——同一数据集不同来源描述的矩阵尺寸不一,正是"官方预处理产物 vs 自行重采样"两种口径的痕迹(坑 8)。
每一步"为什么这么做"的注解(理解流水线比复述流水线更重要):
- 为什么以 T1-CE 为配准锚? 钆对比后 T1 上解剖结构(脑室、脑沟)与病灶边界同时清晰,是四序列中空间特征最丰富的一路;先把它钉到 SRI24,其余序列"搭车"过去,误差传播链最短。
- 为什么 6 自由度刚性就够? 同一患者同一次检查的四序列,头动是刚体运动;引入缩放/形变(更高自由度)反而会把设备差异伪装成解剖差异。
- 为什么重采样到 1mm³? 主赛数据的标准规格——上游 3-5mm 层厚在这里被超采样插值。注意:插值不创造信息,只是让维度对齐;层间细节的缺失是物理事实,模型侧不要假装 1mm³ 就有 1mm 分辨率。
- 为什么 N4 校正不可省? 低场强下磁场不均导致的强度漂移更严重;不校正的话,跨中心训练时模型会把"扫描仪位置"当特征学进去。
- 为什么颅骨剥离要清到眼球与颈部? 去面(de-facing)负责隐私,颅骨剥离负责建模——把非脑组织清干净后,分割网络的感受野全部花在脑组织上,也顺带消除了一个再识别通道。
- 为什么还要强度归一化? 三厂商五型号的绝对强度刻度互不可比;归一化把"设备指纹"压到最低,是跨中心训练的第一道防线。
这六条注解合起来就是一份"为什么 BraTS 协议在低资源数据上更重要"的清单:同样的步骤在 3T 标准协议数据上是"例行公事",在 1.5T 混合协议数据上是"决定成败"。
2.4 标签体系:三个肿瘤子区域
标注沿用 BraTS 协议的三子区域方案(2024 年命名法):
| 标签 | 英文全称 | 定义要点 | 不包含 |
|---|---|---|---|
| ET | Enhancing Tumor(增强肿瘤) | 钆对比后 T1 相对平扫 T1 信号明显增高的全部肿瘤部分 | 邻近异常增粗血管;固有 T1 高信号 |
| NETC | Non-Enhancing Tumor Core(非增强肿瘤核心) | 肿瘤核心(外科通常切除部分)中不强化的一切:坏死、囊变、钙化、延伸入瘤的外生性骨质增生;含瘤内出血与脂肪等固有 T1 高信号 | 强化成分 |
| SNFH | Surrounding Non-Enhancing FLAIR Hyperintensity(周围非增强 FLAIR 高信号) | 肿瘤核心周围、不属于核心的全部 FLAIR 信号异常范围 | 非肿瘤性 FLAIR 异常(陈旧梗死、微血管缺血性白质改变等) |
论文特别提醒:这三个子区域是影像学定义而非生物学实体——例如 ET 的边界依赖 T1c 上的强化表现,而强化与否受血脑屏障状态与设备对比度影响。在低场设备上,这一"影像学定义"与真实肿瘤范围的偏差会被进一步放大,是解读该数据集标注时必须携带的背景。
标签体数据本身为单通道整型 NIfTI,背景为 0、三个子区域各占一个非零值;下游若需 BraTS 传统"整瘤 WT / 肿瘤核心 TC / 增强瘤 ET"三通道派生,可按包含关系合成(WT=ET∪NETC∪SNFH,TC=ET∪NETC,ET=ET)。注意传统口径的"TC"在新命名体系下对应 ET∪NETC 的并集而非 NETC 单独——新旧缩写混用是文献对照的高频错误源(坑 6)。
第三方统计(openmedlab 口径,基于 2023 训练集 60 例):NETC 出现率约 91.7%(55/60),Oedema 与 ET 全部出现;NETC 体积中位数约 9cm³、ET 中位数约 28cm³、水肿区中位数约 94cm³——大瘤体、大水肿是 SSA 晚就诊特征的直观体现。(该统计为第三方口径,官方论文未逐例公开体积表,引用时注明。)
2.5 与 146 例全集的关系边界
使用前必须分清三层资产:
- 挑战赛子集(95→115 例胶质瘤):Synapse 下载,训练/验证公开、测试标签扣留,服务于排名评估;
- TCIA 全集(146 例):含 51 例非胶质瘤脑肿瘤,预处理版 CC BY 4.0,服务于研究社区;
- 未处理原始 NIfTI(146 例 585 studies):TCIA 页面在册但下载通道 Unavailable(NIH 政策),目前实际不可获取。
一个容易踩的坑:51 例"其他脑肿瘤"没有公开的逐例病理构成表(只有 XLSX 诊断字段),文献中"BraTS-Africa 146 例胶质瘤数据集"的表述不准确——严格说是"146 例脑肿瘤,其中 95 例(2023)或 115 例(2024)用于胶质瘤分割挑战赛"。
51 例扩充的双重价值与两重陷阱:
价值一,研究面拓宽——分割标签体系(三个肿瘤子区域)在非胶质瘤脑肿瘤上的适用性本身是研究问题:脑膜瘤、转移瘤等在"ET/NETC/SNFH"框架下的表现与胶质瘤不同,这为"标签体系可迁移性"提供了素材;价值二,负样本池——做胶质瘤检测/分类时,非胶质瘤肿瘤是天然的难负样本来源。
陷阱一,标签语义错位——三子区域定义是按胶质瘤影像学特征写的(如 NETC 含"外生性骨质增生"),机械套用到其他肿瘤类型会产生语义模糊的标注;陷阱二,队列构成不可分解——51 例的病理类型分布未公开明细,想做"按肿瘤类型分层"的研究者要先向 XLSX 诊断字段逐例确认,且无法保证每层有足够样本量。
2.6 文件结构与病例 ID
TCIA 预处理版沿用 BraTS 家族的目录与命名惯例,每例一个目录、五个文件(四个序列+一个分割):
BraTS-Africa/
├── BraTS-SSA-00001-000/
│ ├── BraTS-SSA-00001-000-t1n.nii.gz # T1 加权(非增强)
│ ├── BraTS-SSA-00001-000-t1c.nii.gz # T1 加权(钆对比后,配准锚点)
│ ├── BraTS-SSA-00001-000-t2w.nii.gz # T2 加权
│ ├── BraTS-SSA-00001-000-t2f.nii.gz # T2-FLAIR
│ └── BraTS-SSA-00001-000-seg.nii.gz # 三子区域分割标签
├── BraTS-SSA-00002-000/
│ └── ...
└── ...
ID 规则解读:BraTS-SSA-XXXXX-YYY 中五位数段为患者标识、三位数段为研究/时相标识(本数据集均为术前单时相,三位段通常为 000)。注意三点:其一,ID 前缀 BraTS-SSA 承袭 2023 届注册名(BraTS2023-SSA),不代表数据只含 SSA 胶质瘤子集——51 例非胶质瘤扩充同样使用该前缀;其二,从 ID 数字段无法读出训练/验证/测试归属,分箱靠 Synapse 拆分表;其三,序列文件名后缀在不同年份的 BraTS 材料中有 -t1n/-t1c/-t2w/-t2f 与 -t1/-t1ce/-t2/-flair 两套写法,读代码时按目录内实际文件名适配。
一个具体案例(假想 ID,展示命名逻辑而非真实条目):BraTS-SSA-00042-000-t1c.nii.gz 应读作"SSA 数据集、患者 00042、该患者首个(也是唯一)研究时相、钆对比后 T1 序列"——同一患者的五个文件共享 BraTS-SSA-00042-000 前缀,只是序列后缀不同。若你下载后发现某患者目录缺某个序列文件,先查 TCIA 页面的 sanity check 说明再怀疑下载完整性——官方预处理产物保证四序列齐全,缺文件几乎总是下载中断所致。
配合 TCIA 的 XLSX 元数据(每例的扫描地点、设备型号、诊断),可以重建"中心×设备×诊断"的交叉表——这是本数据集相对主赛多出的一个分析维度(主赛数据不带逐例中心归属)。
2.7 三套拆分的对照与使用场景
| 拆分口径 | 数据量 | 公开内容 | 适用场景 | 不适用场景 |
|---|---|---|---|---|
| 2023 挑战赛(95 例:60/15/20) | 95 | 训练 60(带标签)+验证 15(不带标签) | 复现 2023 届成绩、历史对比 | 用 2023 测试 20 例自评(标签扣留) |
| 2024 挑战赛(115 例:60/35/20) | 115 | 训练 60+验证 35(均公开图像,验证无标签) | 2024 届复现、迁移学习基准 | 测试 20 例自评 |
| TCIA 全集(146 例) | 146 | 全部图像+标签(预处理版) | 自由实验、跨中心分析、非胶质瘤研究 | 与挑战赛排行榜直接对齐(拆分不同) |
最关键的一条使用纪律:TCIA 全集的 146 例图像与挑战赛的 115 例有重叠——如果你用 TCIA 全集(含标签)训练后再去 Synapse 挑战赛验证集上"刷分",属于数据泄漏(训练集 60 例+验证 35 例均在全集内且带标签)。做严肃基准时二选一:要么完全用 TCIA 全集自建拆分,要么完全遵守挑战赛拆分,不要混用。
2.8 与 BraTS 主赛数据的规格对照
| 维度 | BraTS 主赛(2021-2024 成人胶质瘤主数据) | BraTS-Africa |
|---|---|---|
| 场强 | 3T 为主(部分 1.5T) | 全部 1.5T |
| 层厚 | 1mm 各向同性采集 | 3-5mm 采集后重采样 |
| 厂商/协议 | 多中心但协议较统一 | 三厂商五型号、各中心自定协议 |
| 序列完整性 | 四序列完整为入组条件 | 预处理版要求完整;原始临床场景缺失常见 |
| 体数据规格 | 240×240×155(1mm³) | 同规格(重采样产物) |
| 目录/ID | BraTS-GLI-… / BraTS-PED-… 等 Task 前缀 | BraTS-SSA-… |
| 患者数(胶质瘤) | 数千例 | 95-115 例 |
| 逐例中心归属 | 不公开(部分子集除外) | XLSX 提供扫描地点与设备 |
对照的结论一句话:下游格式完全互通,上游分布完全不同——这正是"主赛预训练→Africa 微调"成为标准姿势、也是"Africa 数据成为域偏移试金石"的同一枚硬币的两面。
2.9 元数据能回答的四个多维问题
TCIA 附带 XLSX(扫描地点、设备型号、诊断)使本数据集支持四类主赛数据难以支持的分层分析:
- 厂商效应:Siemens(Essenza)×2、Philips(Achieva)、GE(Explorer/Creator)的强度分布与伪影模式不同——可以把厂商作为分组变量,测模型跨厂商泛化;
- 层厚效应:3mm(LILY)至 5mm(CRV/NKDC)的原始层厚梯度——研究"重采样损失与原始层厚的关系"的现成自变量;
- 中心效应:按"扫描地点"聚合,可做 leave-one-center-out 式的中心外推实验(数据量允许粗粒度版本);
- 诊断构成:按诊断字段过滤胶质瘤/非胶质瘤子集,或在 51 例扩充上做"分割标签在非胶质瘤上的适用性"检验。
四个方向的共同前提:先读 XLSX 字段口径(列名、缺失标记),再做聚合——元数据表只有 17KB,逐例核对成本很低,是本数据集使用前性价比最高的十分钟。
§3 标注流水线:三阶段把 DL 预标注变成参考标准
3.1 为什么用"预标注+人工精修"而非纯手工
146 例 × 四序列 × 三子区域的全手工体绘制,在专家资源稀缺的语境下(SSA 神经放射医生本来就少)既慢又贵。BraTS-Africa 采用与 BraTS 主赛一致的"DL 预标注+分层人工审核"模式:custom nnU-Net 先对每例做三子区域预分割,人工从"画"退到"改",效率与一致性同时受益。这也意味着:预标注模型的系统性偏差(如在低对比度图像上倾向保守)会被带入参考标签的初稿,依赖后续人工层级纠偏。
3.2 三阶段人员结构与职责
| 阶段 | 人员 | 职责 | 工具 |
|---|---|---|---|
| 0 预标注 | custom nnU-Net | 生成 ET/NETC/SNFH 三子区域初稿(按 BraTS 2023 标签定义) | nnU-Net |
| 1 精修 | 10 名放射科住院医(radiology residents) | 受训后逐例精修 DL 分割,形成参考标签草案 | ITK-SNAP 4.0.0 |
| 2 复核 | 2 名 board-certified 放射科医生 | 逐例复核纠错、统一判定尺度 | ITK-SNAP 4.0.0 |
| 3 终审 | 1 名美国 board-certified 神经放射专家(>5 年脑肿瘤分割经验,含 DL 方法开发经验) | 逐例批准,形成 ground truth | ITK-SNAP 4.0.0 |
这套"住院医劳动+注册医生把关+资深专家终审"的三层结构与库内 PANDA-PLUS 的"学生注释+高年级复核+30 年专家终审"高度同构——在标注经济学上,两者都把最贵的专家时间压缩到最后一道工序。差异在于 BraTS-Africa 的终审是单人单点(一位 BraTS 专家),没有披露多位专家间一致性检验数据;对标注噪声敏感的使用者应把标签视为"单专家参考标准"而非"多专家共识"。
3.3 标注定义中的临床判断
官方标注协议里埋着几处需要经验判断的规则,值得摘录(它们直接决定标签质量的上限):
- ET 排除血管:即使异常增粗的邻近血管在 T1c 上同样强化,也不计入 ET——这要求标注者有区分"强化血管 vs 强化肿瘤"的能力,而在低分辨率图像上两者灰度接近;
- NETC 吞并固有 T1 高信号:瘤内出血、脂肪等非坏死成分计入 NETC,因为它代表"外科医生会切除的核心非强化部分"——这是一个手术视角而非纯病理视角的定义;
- SNFH 排除非肿瘤性 FLAIR 异常:陈旧梗死、微血管缺血改变要从水肿/浸润区中剔除——在合并 HIV、脑血管病负担高的 SSA 人群中,这类"背景干扰"更常见,标注难度更高。
论文用一句话概括了所有这些定义的局限:“The BraTS tumor sub-regions are image-based and may not reflect strict biologic entities”——子区域是影像学构造物,不严格对应生物学实体。
3.4 标注协议的跨体系对照
三子区域标签在不同文献体系中的对应关系(读第三方论文时的翻译表):
| 本文体系(BraTS 2024) | BraTS 传统口径 | 常见同义写法 | 语义要点 |
|---|---|---|---|
| ET | ET(enhancing tumor) | 增强肿瘤、强化区 | T1c 强化部分 |
| NETC | NCR/NET(necrotic & non-enhancing tumor core) | 坏死核心、非强化核心 | 非强化的瘤核心(含坏死/囊变/出血) |
| SNFH | ED(peritumoral edema) | 水肿区、FLAIR 异常区 | 核心外的 FLAIR 高信号 |
| (派生)WT | whole tumor | 整瘤 | ET+NETC+SNFH 并集 |
| (派生)TC | tumor core | 瘤核心 | ET+NETC 并集 |
两点提醒:其一,传统"TC"在新体系中对应 ET∪NETC 的并集,而 NETC 单独只覆盖其中的非强化部分——把 NETC 当成旧"TC"直接比较是常见错误;其二,旧"ED"(edema)到新"SNFH"的不只是改名:SNFH 的定义强调"FLAIR 异常"这一影像学表现而非"水肿"这一病理推测,命名变化的背后是定义的收紧。
3.5 质量控制之外的"数据质量体检"
除标注审核外,团队还对数据本身做了影像质量对照实验:从 146 例中随机抽 50 例未处理扫描,与 50 例未处理 TCGA 胶质母细胞瘤扫描(BraTS 2021 子集)对照,用 MRIQC 22.0.6 计算五个标准质量指标——SNR(信噪比)、CNR(对比噪声比)、CJV(联合变异系数,反映强度不均伪影与头动)、EFC(熵聚焦准则,反映鬼影与模糊)、QI1(伪影损坏体素占比)——两组做两尾 t 检验(P<.05)。这是"SSA 影像质量系统性偏低"从轶事上升为统计事实的关键一步,也是后续一切域偏移讨论的实证锚点(§7.2)。
3.6 “预标注会不会把偏差写进真值”——方法学问答
这套流水线最容易收到的质疑与回应:
Q:nnU-Net 预标注在低质量图像上会犯系统性错误,谁来兜底?
A:设计上由人工三阶段兜底——住院医的职责正是修正 DL 错误(论文明确训练内容包括"refine the results of the deep learning–generated segmentations")。但要诚实承认:如果某类错误(如强强化血管误入 ET)在低对比度图像上对人也难分辨,三阶段都漏掉的概率不为零,且论文未发布逐阶段修正率统计。
Q:为什么不做成多专家共识标注?
A:神经放射专家在该场景下是极度稀缺资源——本数据集的组织初衷之一就是"当地专家少"。三阶段设计是"用注册医生+受训住院医的层级劳动换专家终审时间"的现实折中。使用者应把标签理解为"单专家批准的参考标准"(reference standard by a single expert),在论文中如实声明,而非"共识真值"。
Q:跨中心的标注尺度一致吗?
A:标注统一在预处理后数据上进行(图像已归一化到同一空间与强度框架),且由同一批人跨中心标注,尺度漂移风险低于"各中心各自标注再合并"的模式。但设备差异导致的图像表现差异(如 GE 与 Siemens 的 FLAIR 对比度不同)仍可能引起边界判定的系统性倾斜——这属于数据集固有属性,论文未做标注者间一致性(inter-rater)量化,引用者需自知。
Q:能拿这套标签做弱监督/噪声标签研究吗?
A:可以但需谨慎:标签是"DL 预标注+人工修正"的产物,本身就是"模型生成-人工净化"的混合体。做噪声标签建模时,应把预标注来源写入实验设计,避免把"预标注模型的系统偏差"误当成"人类标注噪声"。
3.7 与其他标注生产模式的横向对照
| 模式 | 代表 | 人员结构 | 特点 |
|---|---|---|---|
| 预标注+三层人工(本数据集) | BraTS-Africa | DL 预标注→住院医→注册医生→资深专家终审 | 单专家终审,成本低,适合专家稀缺场景 |
| 预标注+三层人工(病理版) | PANDA-PLUS(库内 panda-plus) | DL/学生注释→高年级复核→30 年专家终审 | 同构流水线在病理域的对应物 |
| 多专家共识 | 部分放射组学数据集 | 多名资深医生独立标注+仲裁 | 一致性可量化,成本最高 |
| 单专家全权 | 多数小数据集 | 一名专家从头画到尾 | 简单,但无交叉验证 |
BraTS-Africa 与 PANDA-PLUS 的同构性不是巧合:两者都在"专家时间是最贵资源"的约束下,把"最贵的人放在最后一道工序",用结构化分工把专家时间压缩到只做终审。差异在下游:BraTS-Africa 的标签直接服务挑战赛排名(一致性要求被排行榜标准化消化),PANDA-PLUS 的标签则用于暴露上游数据集的标签噪声——同一套生产逻辑,一个用于建立基准,一个用于批判基准。
3.8 工作量与产能账(估算性讨论)
官方未公布逐例标注工时,但可以做一个透明的量级估算(以下为本文推算,非官方数字,引用时须注明):146 例 × 每例 4 个序列的体数据审核,即便"预标注承担 80% 的画线工作",人工精修+复核+终审合计按每例 1-3 小时专家/半专家时间估算,总投入在数百人时量级——这正是为什么项目需要 Lacuna Fund 资助、CAMERA 网络的人力组织,以及为什么"预标注+分层审核"几乎是唯一可行的技术路线(纯手工 146 例 × 4 序列 × 3 子区域全连标注可能要千级人时)。
这个估算的反面教训同样重要:SSA 场景下"雇不到足够的神经放射专家"不是修辞——一位美国 board-certified 神经放射医生终审全部 146 例(且是兼职、跨时区、远程)本身就是资源约束的直接体现。数据集工程的瓶颈从来不是算法,而是"谁有时间把标签画对"。
§2-§3 小结:数据的"规格"(四序列 NIfTI、1mm³、BraTS 目录惯例)是给机器读的,数据的"语境"(1.5T、3-5mm 层厚、多厂商、临床常规采集)是给研究者读的——只看到前者,你会把它当成"小号 BraTS";只看到后者,你会错过"与主数据零成本互通"的工程红利。两半合起来,才是这块数据集的正确打开方式。
§4 与 BraTS 主赛的关系:同一簇,不同世界(必读)
4.1 家族关系一句话
BraTS-Africa 是 BraTS 挑战赛簇(Cluster of Challenges)的撒哈拉以南非洲分赛道:2023 年作为 BraTS 2023 挑战赛的五个分割子任务之一(时名 BraTS2023-SSA / BraTS-Africa)首办;2024 年并入 BraTS 2024 Cluster of Challenges 成为 Task 4——“Brain Glioma in the underserved sub-Saharan African patient population”。它与主赛(Adult Glioma Segmentation)、脑膜瘤(MEN)、儿科(PED)、转移瘤(METS)、修复(Inpainting)、合成(Synthesis)等 Task 并列,共享评估协议、提交平台(Synapse)与 MICCAI 卫星活动,但数据、人群、设备分布完全独立。
理解这个家族关系的背景是 BraTS 十余年的演进脉络(数据来自 2024 簇设计文档的官方回顾):2012 年创办,此后十年聚焦成人脑胶质瘤的公平基准建设;2021 年 RSNA-ASNR-MICCAI 三方合作(RSNA=北美放射学会、ASNR=美国神经放射学会)把数据集扩展到 2000+ 例;2023 年首届 Cluster of Challenges 把数据集扩到 4500+ 例,并首次纳入"服务不足人群"(underserved populations)维度——SSA 赛道即为该维度的第一个落地;2024 年簇进一步扩展至 4000 例新 MRI+28 万病理样本、十个 Task。BraTS-Africa 出现的时机正是 BraTS 从"单一技术基准"转向"多维度临床责任"的转折点——这不是巧合,而是设计。
4.2 FACTS 必答题:与库内 brats(24)条目的三点区分
| 维度 | braats 主赛(库内 brats 条目口径) | BraTS-Africa |
|---|---|---|
| 数据来源 | 北美/欧洲多中心为主,经 TCGA/TCIA 等高质量归档 | 尼日利亚多诊断中心临床常规采集,经 AfNiA 汇总 |
| 设备 | 3T 为主、层厚 1mm、序列完整 | 全部 1.5T、层厚 3-5mm、序列缺失常见 |
| 规模 | 主赛成人胶质瘤数千例(2024 簇全集约 4000 例 MRI + 28 万病理样本) | 95 例(2023)→115 例(2024)→146 例全集 |
| 标签 | ET/NETC/ET 加 CC/RC 分层(2024 扩展命名) | ET/NETC/SNFH 三子区域(术前胶质瘤) |
| 训练集 | 大数据、可直接端到端训练 | 60 例训练——必须依赖预训练/迁移学习 |
| 挑战赛排名口径 | 与全球 SOTA 同台 | 2024 规则:用额外数据预训练的模型不参与排名 |
| 数据时间窗 | 持续滚动更新(每年新数据) | 固定窗口 2010-2022(version 1 快照) |
| 资助背景 | 学会/企业赞助体系 | Lacuna Fund 健康公平专项+CAMERA 网络 |
第三行最后一格值得展开:2023 届允许参赛者用 BraTS 主数据等额外资源预训练,但必须双报告(只用 Africa 数据的结果 + 加补数据的结果分开写);2024 届直接收紧——凡用额外数据做模型开发或预训练的提交不进排名。这条规则变化的动机正是保护本赛道的"域偏移测试"纯度:如果人人带着大数据预训练的模型来,小数据赛道的独立意义就被稀释了。
量级对比一句就够震撼:主赛 2024 簇合并叙述约 4000 例 MRI 训练资源(各 Task 合计)+ 28 万病理样本,Africa 赛道全部胶质瘤标注数据是 95-115 例——两个数量级的落差,被同一个评估体系衡量。这不是组织者偏心,而是 SSA 场景下"有什么就用什么"的真实映射;挑战赛的意义之一,正是让全球社区在"大数据赛道"之外,正视"小数据赛道"的方法学是完全不同的学问。
4.3 数据级联关系
- 2023 届:95 例胶质瘤(60 训练+15 验证+20 测试);与 BraTS 2023-SSA 的训练数据完全一致(同一批 60 例);
- 2024 届:35 例验证 = 2023 的 15 例验证 + 20 例测试(公开拆分重排);新增 20 例测试;训练 60 例不变;
- TCIA 全集:146 例 = 2024 口径的 115 例胶质瘤之外的补充+51 例其他脑肿瘤(严格说是"另有 51 例",其中胶质瘤总数 95+20=115 中的 20 例新测试在 TCIA 全集中同样存在)。
拆分演变的文字图:
2023: [训练 60 | 验证 15 | 测试 20(扣留)] = 95
2024: [训练 60 | 验证 35 = 15 + 20(2023测试转正) | 测试 20(新)] = 115
TCIA : [挑战赛用过的 115 例 + 从未参赛的 51 例其他脑肿瘤] = 146
一句话总结:在 TCIA 下载的 146 例里,可以复原挑战赛的全部训练与验证数据;但测试集的参考标签从未公开——用 146 例全集做实验的研究者,实际上拿到的是"挑战赛训练+验证+一部分未公开拆分的测试影像(无标签)+51 例扩充"。
4.4 BraTS 2024 簇十个 Task 全景(本赛道定位)
| Task | 名称 | 划界维度 |
|---|---|---|
| 1 | Post-Treatment Adult Glioma(治疗后成人胶质瘤) | 肿瘤类型×时间点 |
| 2 | Post-Treatment Intracranial Meningioma(治疗后脑膜瘤) | 肿瘤类型×时间点 |
| 3 | Pre- and Post-Treatment Brain Metastases(脑转移瘤) | 肿瘤类型×时间点 |
| 4 | Brain Glioma in the underserved sub-Saharan African patient population(= BraTS-Africa) | 人群/地区 |
| 5 | Pre-Treatment Pediatric Tumor Patients(儿科肿瘤) | 人群(年龄) |
| 6 | Generalizability of Segmentation Methods Across (Pre-treated) Tumors | 技术维度(泛化性) |
| 7 | Evaluation of Augmentation Techniques(与 FDA 合作) | 技术维度(增广评估) |
| 8 | MRI Synthesis(合成) | 技术维度 |
| 9 | MRI Inpainting(修复) | 技术维度 |
| 10 | Assessing the Heterogeneous Histologic Landscape of Glioma(组织学) | 模态(病理) |
在这张全景表里,BraTS-Africa 与儿科赛道是仅有的两个"以人群划界"的 Task——区别在于儿科划的是年龄轴,SSA 划的是资源与地理轴。2024 年 10 个 Task 中 6 个(1-3、6、7、10)为新增,SSA 赛道则是从 2023 连任的"保留项目",说明组织者对"人群代表性"命题的承诺是持续性的而非一届性。
4.5 关系三连问(快速自测)
Q:BraTS-Africa 算不算"BraTS 2024 数据集"的一部分?
算也不算:算——它被 2024 簇设计文档(Zenodo 10978906)正式列为 Task 4,簇级统计(“4000 例 MRI”)通常把各 Task 数据合并叙述;不算——它的数据 DOI(TCIA 10.7937/v8h6-8x67)、获取通道(Synapse 子集+TCIA 全集)、标签终审团队与主数据相互独立。写论文引用时分开引 DOI,不要把 Africa 数据算进主数据例数,反之亦然。
Q:在主数据上训练的模型可以直接报名 Africa 赛道吗?
2023 届可以(须双报告);2024 届可以提交但不参与排名。这条规则是理解两届成绩不可直接混比的钥匙。
Q:库内 brats 条目里为什么查不到这 146 例?
因为两个条目管的是不同的资产边界:brats 条目覆盖主赛主数据(数千例高资源多中心数据),本条目覆盖 SSA 卫星赛道与其数据集。两份数据在文件格式层面互通(同规格 NIfTI),在数据层面无重叠(病例 ID 前缀不同:主数据为 BraTS-GLI 等任务前缀,本数据集为 BraTS-SSA)。
4.6 为什么不单独开条目而不合并进主赛
三个理由:其一,数据分布差异大到足以让"在 BraTS 主数据上的排名"与"在 BraTS-Africa 上的排名"产生结构性不同——这正是设独立赛道的初衷;其二,获取通道不同(Synapse 挑战赛子集 vs TCIA 全集)、license 口径不同(主赛 CC BY 4.0 一体化 vs Africa 预处理版公开+原始版受限);其三,两届总结论文(NOAJ vdag082)与数据集描述论文(Radiol AI e240528)是独立于主赛论文的文献体系,引用链应当分开。
§4 小结:记住一个比喻——BraTS 主赛与 BraTS-Africa 像同一所大学里"本部校区"与"海外分校":章程(协议)、考试(指标)、学位(MICCAI 发表)一致,但生源(人群)、校舍(设备)、师资(标注专家)完全独立。申请哪边、引用哪边、把成绩单交给谁看,都要先想清楚自己在哪一侧。
§5 挑战赛设计与结果:两届成绩单
5.1 赛制设计
两届挑战赛沿用 BraTS 惯例的"三段式"赛程(以 2024 年日期为例):
- 5 月:训练数据发布(含参考标签);
- 6 月(约 3 周后):验证数据发布(无标签),参赛者可反复提交到在线排行榜;
- 8 月:提交截止,组织者用隐藏测试集与扣留参考标签终评。
赛程时间轴(两届通用节奏):
| 阶段 | 时间 | 参赛者拿到什么 | 组织者做什么 |
|---|---|---|---|
| 注册 | 5 月起 | Synapse 账号+数据条款 | 团队注册审核 |
| 训练期 | 5-6 月 | 训练数据(带标签) | 社区答疑 |
| 验证期 | 6-8 月 | 验证数据(无标签)+在线排行榜 | 维护评估服务 |
| 终评期 | 8 月 | 提交容器+方法短论文 | 隐藏测试集终评 |
| 发布期 | 10 月(MICCAI) | 口头/海报展示 | 公布排名、颁奖 |
参赛产出三件套:预测分割图像文件 + 8-10 页方法短论文(经 CMT 提交)+ MLCube 容器化模型(经 MedPerf 平台自动评测)。容器由 MLCommons 维护的 GaNDLF(Generally Nuanced Deep Learning Framework)框架自动生成——这意味着评审跑的是可复现的容器,而非"截图式"结果。评估指标为 lesion-wise DSC(Dice 相似系数)与 HD95(95% Hausdorff 距离)的加权组合,对验证集与测试集分别计算。
激励设计上有两个与"公平"直接挂钩的细节:其一,为提升非洲团队参与度,非洲最佳排名队伍获得资金支持出席 MICCAI 大会(2023 温哥华、2024 马拉喀什),2023 届另设现金奖;其二,上榜队伍受邀将短论文扩写为 LNCS 会议论文(MICCAI proceedings)。
5.2 两届参与与成绩
| 届 | 年份 | 上榜队伍 | 参与者来源国 | 数据口径 | 规则要点 |
|---|---|---|---|---|---|
| 第一届 | 2023 | 9 队 | 12 国 | 95 例(60/15/20) | 允许补充数据,须明示并双报告 |
| 第二届 | 2024 | 6 队 | 7 国 | 115 例(60/35/20) | 用额外数据开发/预训练不参与排名 |
核心横向结论(NOAJ 论文):与 2023 届相比,2024 届排名前六的方法 DSC 提升 9.4%、HD95 降低 57.21%(Welch’s t-test 检验两届差异;另做 paired t-test 比较"仅用非洲数据训练 vs 非洲数据+额外数据训练"的模型表现差)。一年之内、在 60 例训练数据上,指标仍有如此幅度的移动,说明这个赛道远未饱和——同样的问题在主赛上早已进入小数点后两位的拉锯。
关于"参与规模"的口径提示:9 队/6 队是满足提交标准并进入排名的队伍数(“met the submission criteria and were ranked”);12 国/7 国是上榜队伍的参与者国籍统计。注册未上榜、中途退出的团队不计入这两组数字——引用时写"上榜 X 队"而非"共 X 队参加",是精确性的底线。
赛后数据复用规则(两届延续):训练集与参考标签公开供研究;验证集图像公开、标签扣留但开放在线评估;测试集完全扣留。这使得挑战赛结束后的"排行榜复读"不可能,所有赛后比较只能在验证集或自建拆分上进行——引用 2023/2024 届排名数字时,注意那是官方终评时点的快照。
5.3 评估指标的数学骨架
两届沿用的指标定义(与主赛一致):
记某子区域有 L 个病灶(lesion),第 i 个病灶的预测为 Pi、参考标签为 Gi:
lesion-wise DSC = (1/L) Σᵢ Dice(Pi, Gi),其中 Dice(P,G) = 2|P∩G| / (|P|+|G|)
lesion-wise HD95 = (1/L) Σᵢ HD95(Pi, Gi)
HD95:预测边界点到参考边界点距离分布的第 95 百分位
(比最大 Hausdorff 距离对离群点更稳健)
最终得分 = DSC 与 HD95 的加权组合(沿用主赛权重惯例)
三个读数要点:其一,lesion-wise(逐病灶)而非体素级整体 Dice——把一个大瘤与多个小瘤同等对待,小病灶的 Dice 波动被平均进来,对分割碎裂的惩罚更真实;其二,HD95 对"边界距离"敏感,在层厚 3-5mm 重采样的数据上,层间插值造成的边界平滑会同时影响 DSC 与 HD95 的解读;其三,按子区域分别计算再报告——SSA 大瘤体大水肿的分布下,SNFH 的 Dice 天然高、NETC 天然低,只看单一总分等于把最容易的题当成了全部成绩。
5.4 2023 届上榜方法概览
NOAJ 论文表 1 按排名 1→9 记录了 2023 届上榜方法(摘录):
- nnU-Net 系改造:以 nnU-Net 为骨架,引入 Omni-Directional Dynamic Convolution(ODConv2D)替换 Conv3D 层等改进;
- 3D U-Net + 优化框架:以预处理、后处理与迁移学习为核心的组合方案;
- AGU-Net:五级滤波器尺寸、深监督(deep supervision)、多尺度输入、单注意力模块的架构(使用 NVIDIA Tesla V100S 32GB 训练);
- TCuP-GAN:Temporal Cubic PatchGAN——基于 U-Net、2D ConvLSTM 与 PatchGAN 的 3D 体积到体积翻译模型;
- SAMBA:Segment Anything Model(SAM)+ YOLOv8 定位网络(硬件信息未披露)。
方法谱系的两个信号:第一,nnU-Net 系依然是低资源场景的默认起点,改造集中在动态卷积与迁移策略;第二,SAM 等基础分割模型开始被试水到该赛道,但信息完整度低——"信息未提供"本身就是低资源赛道论文生态的一个注脚。
把九个上榜方法横向摊开,可以提炼一张"低资源分割方案共性"清单:
| 共性维度 | 上榜方法的普遍选择 | 背后原因 |
|---|---|---|
| 架构基座 | nnU-Net / 3D U-Net 系(含 AGU-Net) | 小数据上自配置框架的先验最强 |
| 迁移策略 | 主数据预训练+微调(2023 届普遍使用) | 60 例无法从零收敛 |
| 卷积改造 | 动态卷积(ODConv2D)、多尺度输入、深监督 | 补偿低分辨率细节损失 |
| 生成式思路 | TCuP-GAN 体积到体积翻译 | 把分割重述为跨域翻译问题 |
| 基础模型试水 | SAM+YOLOv8 定位(SAMBA) | 探索大模型先验是否可迁移 |
| 硬件门槛 | 单卡 V100 级即可参赛 | 与主赛动辄多卡 ensemble 形成反差 |
最后一行值得展开:主赛头部方案的标配是多模型集成+测试时增广+大规模预训练,而 Africa 赛道的上榜配置明显"轻"——这既是数据量决定的(大集成容易过拟合 60 例),也是赛道普惠意图的体现。
5.5 从 SIGN 看迁移学习的正确姿势
Radiology: Artificial Intelligence 论文(e240528)给出了一条与挑战赛并行的学术线:SIGN 模型(SimIlarity weiGhted self-eNsembling framework,Zhang et al.)专为"案例少+图像噪"的场景设计。实验设计两轮:初评用 BraTS 2020 的 660 例与 ISLES 2015 的 114 例(50/25/25 拆分)训练;重训阶段加入 BraTS-Africa 95 例(60/15/20 拆分)并以 BraTS 2021 数据辅助(90/10 拆分)。结论:SIGN 在两轮评估中整体表现最佳,且在用 BraTS-Africa 重训后仍保持领先——对比其他 SOTA 方法(DML 距离度量学习、MAML 元学习、MLDG-Seg 域泛化、PROTO 原型学习等),"为噪声设计"的方法论在真实低资源数据上得到了验证。
这篇论文还有一个容易被忽略的实验细节值得点出:它同时报告了"Dice 相似系数、accuracy、Hausdorff 距离"三套指标在"加入非洲数据重训前 vs 重训后"的对照(表格以均值±标准差呈现,非洲数据行在上、未含非洲数据的初评结果在括号内)——这种"同表双轨"的报告方式本身就是低资源研究的模板:让读者一眼看到"数据换血带来了什么"。
对使用者的启示:BraTS-Africa 的 60 例训练集不支持从零训练 3D 分割网络;文献中的有效路径高度一致——主数据预训练 + 分层/分层抽样微调(如 radiomics 特征聚类分层)+ 模型集成 + 后处理(arXiv:2412.04111 即一例:14 个形状特征+93 个强度特征经 PCA 降维后 k-means 聚类,按聚类分层切折,使每折病变类型均衡)。
5.6 成绩解读的四个陷阱
陷阱一:9.4% 是相对量不是绝对分。
"DSC 提升 9.4%"是两届前六名方法得分的相对比较(Welch’s t-test),论文未在摘要层给出绝对分数区间——把它读成"DSC 从 0.85 涨到 0.94"是无据推算。引用时写"相对提升 9.4%"并给出处。
陷阱二:两届测试集不同。
2023 终测 20 例(当时扣留),2024 终测是新的 20 例——两届成绩比较建立在"不同测试样本"之上,Welch’s t-test 是对方法得分分布的检验,不是同一考卷的重考。严格说这是"两届方法水平"的比较,而非"模型在同一分布上的进步量"。
陷阱三:上榜≠全部参赛。
9 队/6 队是"满足提交标准并进入排名"的队伍数(“met the submission criteria and were ranked”),注册与尝试提交的队伍多于上榜数——把上榜数当参与规模会低估赛事热度、高估完成率。
陷阱四:2024 的"纯净"规则提高了难度基线。
2024 届禁止用额外数据预训练的模型进排名,等于让所有上榜方法都在"60 例+迁移权重冻结判定"的更窄跑道上比赛——成绩提升的含金量更高,但直接与 2023 成绩画趋势线在方法学上不严谨。
陷阱五(附加):别用主赛名次预测本赛道名次。
主赛与 Africa 赛道的数据分布、样本量、规则三重不同,主赛榜单头部的团队未必参加或上榜本赛道;跨赛道引用某团队名次时必须注明赛道。
5.7 挑战赛之外:这个数据集改变了什么
- 话语权:MICCAI 簇连续两年为 SSA 保留独立 Task,配套非洲团队出席资助,是顶会挑战赛体系内少见的结构性倾斜;
- 方法论:用 MRIQC 五指标把"低资源影像"变成可测量的统计事实,为后续一切域偏移/公平性研究提供了可引用的锚点;
- 机制:CAMERA(MRI 教育与科研联盟)+ AfNiA(归档)+ Lacuna Fund(资助)构成了"采集-培训-归档-赛事"四环闭环,论文明确将其定位为"从非洲其他国家持续扩充数据集"的基础设施——也就是说,146 例是这个机制的第一批产出,而非终点。
5.8 两届规则与数据逐项对照
| 事项 | 2023 届 | 2024 届 |
|---|---|---|
| 所属 | BraTS 2023 挑战赛分割子任务(BraTS2023-SSA) | BraTS 2024 簇 Task 4 |
| 胶质瘤数据 | 95 例(60/15/20) | 115 例(60/35/20;35 含 2023 测试 20 例) |
| 额外数据政策 | 允许补充(含 BraTS 主数据),须明示+双报告 | 用于开发/预训练即不参与排名 |
| 上榜队伍 | 9 队(12 国) | 6 队(7 国) |
| 测试集 | 20 例(首次使用) | 20 例(全新,标签扣留) |
| 提交形态 | MLCube/MedPerf + CMT 短论文 + Synapse 预测 | 同左(体系延续) |
| 奖励 | 前三名现金奖+非洲队伍出席资助 | 非洲队伍出席资助(出席地马拉喀什) |
| 成绩相对变化 | —(基线届) | 前六名 DSC +9.4%、HD95 -57.21% |
对照表的阅读姿势:两届之间没有一项数据口径完全相同(数据量、拆分、规则、测试集都变了),所以任何"2024 比 2023 进步 X"的表述都必须绑定其统计检验口径(§5.6 陷阱二);唯一稳定的比较锚点是评估指标体系本身。
引用榜单结果时的三条注意:
- 写清届别与口径——"2023 届第 N 名(9 队上榜)"比"全球第 N 名"准确得多,后一种写法容易被误读为跨赛道名次;
- 区分验证成绩与测试成绩——验证集成绩是参赛者可以反复刷的(多次提交取最优),测试成绩是一次性终评,两者不可混用;
- 方法名与队名对齐——LNCS 短论文以方法为题,榜单以队伍为序,交叉引用时以 NOAJ 表 1 的映射为准,避免把同队多方案计为多队。
§6 获取与许可:三层资产、三种门
6.1 资产与门禁总表
| 资产 | 载体 | 规模 | License | 获取方式 |
|---|---|---|---|---|
| 预处理 mpMRI + 专家分割标签 | TCIA(Radiology Images and Segmentations - BraTS 2023 Challenge) | 146 subjects / 730 studies / 1.6GB | CC BY 4.0 | TCIA 页面公开下载(需 IBM Aspera Connect 插件,faspex 通道) |
| 未处理原始 NIfTI 图像 | TCIA(Unprocessed NIfTI radiology Images) | 146 subjects / 585 studies | NIH Controlled Data Access Policy(受限) | 下载通道 Unavailable(页面标注)——因图像或可重建人脸,NIH 政策调整后登录下载已下线 |
| 扫描仪与诊断信息 | XLSX(BraTS-Africa_TCIA_datainfo_v2.xlsx) | 17KB | CC BY 4.0 | TCIA 页面公开直链 |
| 2023 挑战赛训练/验证数据 | Synapse(syn51156910) | 95 例拆分 | 挑战赛数据使用条款 | Synapse 注册 |
| 2024 挑战赛训练/验证数据 | Synapse(syn59059780) | 115 例拆分(60/35 公开部分) | 挑战赛数据使用条款 | Synapse 注册(www.synapse.org/brats) |
| 测试集参考标签 | 扣留 | 20+20 例 | 不公开 | —(仅组织者持有,用于终评) |
数据引用为强制项(Data Citation Required):引用格式为 Adewole, M., Rudie, J.D., Gbadamosi, A., Zhang, D., Raymond, C., et al. (2024) Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa) (version 1) [Dataset]. The Cancer Imaging Archive. https://doi.org/10.7937/v8h6-8x67
获取路径决策树(按你的身份对号入座):
你要做什么?
├── 复现/对比挑战赛成绩
│ └── → Synapse 注册 → 按届下载(2023: syn51156910 / 2024: syn59059780)
│ └── 注意:官方测试集无标签,只能提交在线评估或引用官方快照
├── 自由研究(分割/迁移/域偏移)
│ └── → TCIA 下载预处理版(CC BY 4.0,Aspera)
│ └── 先读 XLSX 元数据过滤胶质瘤子集
├── 需要 1.5T 元数据做分层分析
│ └── → TCIA XLSX(公开直链,17KB)+ 预处理版联用
├── 需要原始未处理数据
│ └── → 目前无通道(NIH 政策受限)→ 改用预处理版或放弃该研究设计
└── 只想了解/教学
└── → 引用 NOAJ vdag082 + Radiol AI e240528 两篇开放论文
6.2 AI-Ready 视角下的可得性光谱
以"拿到即可喂给模型"的标准衡量:
- 喂给模型的门槛:低。预处理版已是 1mm³ 等向、颅骨剥离、强度归一化的 NIfTI,与 BraTS 主数据同构——任何为 BraTS 写的 dataloader 几乎零改动即可用(目录命名沿用 BraTS 惯例的
BraTS-SSA-xxxxx-xxx病例 ID + 五文件结构)。 - 复现预处理的门槛:不可得。未处理原始图受控,外部用户无法验证/复现 SRI24 配准、N4 校正等预处理决策,也无法做"原始→预处理"的端到端学习(如对预处理不敏感的域适应研究受限)。
- 对比实验的门槛:低。主赛数据同样经 BraTS 官方流水线处理,"主数据预训练→Africa 微调"的迁移学习范式在数据规格层面天然成立——这正是两届挑战赛参赛方案的主流路线。
6.4 下载实操要点
- 下载器:TCIA 的大包走 IBM Aspera(faspex),浏览器直链不可用;需要安装 Aspera Connect 插件或用
ascp命令行下载(TCIA 页面提供带通行码的 faspex 包链接)。 - 病例 ID 规则:
BraTS-SSA-xxxxx-xxx(五位数患者+三位数研究),从 ID 无法直接读出胶质瘤/非胶质瘤与训练/验证归属——分箱靠 Synapse 拆分表(§2.6)。 - 不要把 146 例当同质全集用:95/115 例胶质瘤与 51 例其他肿瘤的标签含义不同(后者是"其他脑肿瘤"的诊断层面归属,三子区域标注是否适用需逐例核对 XLSX 诊断字段)。
- 引用双 DOI:数据引 TCIA DOI(10.7937/v8h6-8x67),方法学论述引 NOAJ(10.1093/noajnl/vdag082)与 Radiol AI(10.1148/ryai.240528)——不要用 Zenodo 10978906 指代本数据集(坑 3)。
- CC BY 4.0 的归属义务:TCIA 附加 Data Usage Policy,要求包含完整引用与 DOI;再分发衍生数据集时保留相同归属。
- 体量预期:预处理版约 1.6GB(TCIA collection 页总计口径 3.7GB,含受限部分与元数据),普通带宽下 Aspera 传输数分钟量级——体量小是该数据集对算力受限研究者的隐形友好。
6.5 获取问答五则
Q:Synapse 数据和 TCIA 数据选哪个?
做挑战赛复现或排行榜对比→Synapse(拆分与官方评估一致);做自由研究、跨中心分析、非胶质瘤研究→TCIA 全集。两者图像有重叠,基准实验二选一(§2.7)。
Q:可以重新分发下载到的数据吗?
CC BY 4.0 允许再分发与商用,但须保留归属与 DOI;TCIA Data Usage Policy 另有附加要求(如不得试图身份重识别)。混合再分发(把 BraTS-Africa 与其他数据打包)时保持来源可分是最稳妥的做法。
Q:原始 DICOM 在哪?
本 collection 原始层为"未处理 NIfTI"(不是 DICOM),且受 NIH 政策限制、下载通道已下线(坑 4)。若研究确需原始数据(如自定义预处理、去颅骨前处理研究),需按 NIH Controlled Data Access Policy 流程另行申请,当前无公开通道。
Q:Aspera 下载失败怎么办?
检查 Aspera Connect 插件版本与 UDP 端口(默认 33001)连通性;防火墙环境可用 ascp 的 TCP 回退模式。TCIA 帮助文档提供各平台客户端指引。
Q:有容器/云镜像吗?
官方未发布 AWS Open Data 或 Kaggle 镜像(截至核验时点)。医学影像社区常见第三方转存不可信——以 TCIA 官方通道为唯一来源,保证数据完整性(文件哈希)与合规性。
6.6 AI-Ready 总评
| 得分点 | 失分点 |
|---|---|
| 与 BraTS 主数据同构(dataloader 零改动) | Aspera 插件门槛(对自动化流水线不友好) |
| CC BY 4.0 主资产公开 | 原始数据受控且通道下线,预处理不可复现 |
| XLSX 元数据公开直链(中心/设备/诊断) | 测试标签扣留,挑战赛基准无法本地复现 |
| 体量小(1.6GB),边缘环境可用 | 无官方容器/云镜像,自动化获取路径单一 |
一句话:"喂给模型"的门槛很低,"端到端复现"的门是关着的——这是典型的"预处理产物开放型"AI-Ready 数据集(同类:多数 BraTS 簇成员)。
6.7 CC BY 4.0 条款快读(数据资产部分)
针对"预处理图像+分割标签+XLSX 元数据"这三件 CC BY 4.0 资产:
| 你可以 | 你必须 | 你不能(TCIA 附加) |
|---|---|---|
| 商业使用、修改、再分发 | 署名(附完整数据引用+DOI) | 试图身份重识别(去标识数据) |
| 构建衍生数据集/模型权重 | 标注修改(若分发修改版) | 声称 TCIA 背书你的衍生品 |
| 跨国使用(无地域限制) | 遵守 TCIA Data Usage Policy 全文 | 将受限资产(未处理图)与公开资产混发 |
模型权重算不算"衍生数据集"存在解释空间——社区惯例:仅用公开图像+标签训练的权重可以按 CC BY 4.0 对待,但训练混合了受限/私有数据的权重不能借本数据集的许可背书。保守做法:在模型卡(model card)里写明训练数据构成与本数据集 DOI。
6.8 库内获取方式光谱中的坐标
| 条目 | 获取形态 | 与 BraTS-Africa 的对照 |
|---|---|---|
| brats(主赛) | 挑战赛/官方渠道开放下载 | 同构规格、主赛无"原始版受控"问题 |
| rembrandt | TCIA 公开 | 同在 TCIA 生态,无 NIH 受限资产 |
| ucsf-pdgm | TCIA/多渠道公开 | 高资源对照面 |
| upenn-gbm | 注册申请制 | BraTS-Africa 的原始版若开放将取相似形态 |
| BCN20000 | 学术申请制 | 区域整合型数据集的不同门禁模式 |
放进这张光谱里看,BraTS-Africa 的门禁组合(公开主体+受控原始层+挑战赛注册层)在库内不算最严苛,但"原始层通道下线"是独有的死结——其他申请制数据集至少留着申请路径。
§7 LMIC 场景与图像质量:这个数据集真正独特的地方
7.1 临床背景:为什么 SSA 的胶质瘤问题长这样
NOAJ 论文给出的流行病学底色:
- 胶质瘤患者约 30%-80% 在确诊后五年内死亡(NOAJ 开篇口径);GBM 约 80% 两年内死亡(arXiv:2305.19369 口径);
- 美国过去 30 年胶质瘤死亡率下降约 7%;1990-2016 年全球北方下降 10%-30%;同期 SSA 平均上升约 25%;
- 剪刀差的多因素解释:就诊延迟(delayed presentation)、HIV 等感染性合并症高发、治疗基础设施严重短缺、诊断(神经放射/神经病理)与治疗(神经外科/肿瘤内科/医学物理师)专业人才缺口。
对数据集而言,这些因素全部"显影"在图像里:晚就诊→大瘤体、大水肿、跨中线表现更常见;感染合并症→非肿瘤性 FLAIR 异常背景多,标注与模型判别难度都更高;设备落后→序列缺失、对比度差。所以 BraTS-Africa 不只是"非洲版的 BraTS",而是一个疾病谱与采集条件同时偏移的双重量分布。
死亡率剪刀差的成因链(论文归纳的多因素模型):
| 环节 | 高收入国家 | SSA 现实 | 对数据/模型的投射 |
|---|---|---|---|
| 就诊 | 筛查与转诊体系较完善 | 就诊延迟,晚期表现多 | 大瘤体、大水肿样本占比高 |
| 合并症 | 感染负担较低 | HIV 等感染性合并症高发 | 非肿瘤性 FLAIR 异常背景复杂 |
| 诊断人力 | 神经放射/病理专家充足 | 专家稀缺,诊断瓶颈 | 手动标注产能低→依赖半自动流水线 |
| 治疗 | 手术/放疗/化疗可及 | 治疗设施短缺 | 标准治疗可及性正改善中——AI 辅助诊断的窗口期 |
| 影像设备 | 3T 为主、维保完善 | 1.5T 为主、序列缺失 | 域偏移的直接来源 |
最后一行的"窗口期"值得展开:论文明确指出,随着标准治疗(手术切除、放疗、同步化疗)在 SSA 逐步铺开,"用机器学习做早期发现、精确治疗靶点识别、进展与疗效预测"的研究若继续缺失 SSA 数据,生存差距只会进一步拉大——这是 BraTS-Africa 立项的伦理紧迫性来源,而不只是"补数据"的技术动作。
7.2 图像质量的统计事实
Radiology AI 论文的质量对照实验(50 例未处理 BraTS-Africa vs 50 例未处理 TCGA-GBM,MRIQC 22.0.6,两尾 t 检验 P<.05)测了五个维度:
| 指标 | 含义 | 低质量方向 |
|---|---|---|
| SNR | 信噪比 | 越低越差 |
| CNR | 对比噪声比(组织可分辨度) | 越低越差 |
| CJV | 联合变异系数(强度不均伪影+头动) | 越高越差 |
| EFC | 熵聚焦准则(鬼影与模糊程度) | 越高越差 |
| QI1 | 伪影损坏体素占比 | 越高越差 |
论文结论方向:SSA 组在这些指标上系统性劣于 TCGA 组。叠加采集侧事实——全 1.5T、层厚 3-5mm、三家厂商五种型号、按各中心自定协议扫描——构成了教科书级的域偏移源清单:设备代差(field strength)、分辨率(各向异性体素)、厂商/序列参数(vendor/protocol shift)、病变谱(disease spectrum shift)。
方法学上值得记录的是这个实验的设计选择:对照组选 TCGA-GBM(而非 BraTS 主赛混合集),把"肿瘤类型"变量锁死(都是 GBM 级别病变),使组间差异主要归因于采集条件而非疾病构成;用 MRIQC 而非自造指标,使结果可与影像质量文献对话;随机抽 50/50 并做统计检验而非展示个案。这套设计可以直接被后续低资源数据集论文复用——事实上它已成为"证明我的数据集难"的标准姿势之一。
7.3 五个质量指标怎么读进模型设计
| MRIQC 指标劣化 | 图像上的表现 | 对分割模型的具体影响 | 常见对策 |
|---|---|---|---|
| SNR 低 | 组织纹理颗粒感强 | 小病灶(NETC)边界抖动,Dice 方差大 | 强度去噪/预训练权重冻结前层 |
| CNR 低 | 灰白质、瘤-水肿对比弱 | SNFH 与正常 FLAIR 信号带粘连 | 多序列融合、注意力机制 |
| CJV 高 | 强度不均(bias field)残留 | 同一组织跨区域强度漂移,模型学成位置函数 | N4 校正参数敏感性消融 |
| EFC 高 | 鬼影/模糊 | 层间结构拖影,3D 卷积核吃到假边界 | 各向异性卷积/2.5D 方案 |
| QI1 高 | 大片伪影损坏区 | 输入域外样本,预测不可信 | 质量门控/不确定性估计 |
这张表的用法:不是每个指标都要对策齐上——先在自己模型上测"哪个子区域的 Dice 对哪个指标最敏感"(把 MRIQC 分数当协变量做回归),把工程预算花在敏感项上。
7.4 一个严谨泛化实验的设计模板
如果你要在这块数据上做域偏移/泛化研究,文献与官方材料拼出的"防审稿人四板斧":
- 锁定训练分布:主数据(或其子集)预训练,全部超参与种子登记——BraTS 主数据各版本(2021/2023/2024)规模不同,声明你用的是哪个;
- 冻结评估协议:lesion-wise DSC+HD95、按 ET/NETC/SNFH 分子区域、同一预处理(官方 1mm³ 产物)——预处理不同则一切不可比;
- 三层对照:域内对照(主数据 held-out)→ 域外目标(BraTS-Africa 验证/自建拆分)→ 消融层(如"仅换设备子集"“仅换厂商”),把"掉分"分解到域偏移的具体维度;
- 报不确定性:小数据上单次划分的 Dice 波动很大——至少多种子重复+报标准差;官方挑战赛的两届统计(Welch/paired t-test)是可以借鉴的显著性报告格式。
反模式同样值得列出:在 TCIA 全集上训练后报"在 BraTS-Africa 验证集上的成绩"(泄漏);用 2023 届测试集的影像自评后与 2024 届榜单对比(拆分混淆);把 MRIQC 质量分数与模型误差做相关后宣称因果(观察性证据)。
7.5 对模型开发者的三条实操含义
- 预训练不是可选项而是必需品:60 例训练集无法从零支撑 3D 网络收敛;2023 届上榜方法全部带迁移学习背景,2024 届把"用额外数据"的模型移出排名,等于把"迁移学习的度量"单独留给主赛道,本赛道专注"小数据上限"。
- 预处理敏感性放大:1mm³ 重采样对 5mm 层厚的插值平滑会抹掉细节——在高质量数据上无关紧要的预处理选择(插值核、灰度截断分位)在这里显著影响 Dice;做消融实验时要预注册预处理方案。
- 评估要看子区域拆开:晚就诊大瘤体的 SNFH 巨大而弥散(Dice 天然偏高),NETC 小而碎(Dice 波动大)——只报整瘤 WT-Dice 会掩盖模型真实短板;两届论文均按子区域报告。
7.6 全球低资源医学影像数据集中的位置
| 数据集 | 区域 | 模态 | 规模 | 与 BraTS-Africa 的关系 |
|---|---|---|---|---|
| BraTS-Africa | 尼日利亚(SSA) | 脑 mpMRI | 146 例(标注) | 本条目 |
| BraTS 主数据 | 高收入国家为主 | 脑 mpMRI | 数千例 | 预训练源与"高资源端"对照 |
| BM-BraTS 簇其他 Task | 混合 | 脑 mpMRI/病理 | 各 Task 数十至数千例 | 同簇方法学互通 |
| 各类 SSA 影像倡议(CAMERA 网络产出) | 非洲多国 | MRI(多部位) | 持续扩充 | 同一机制的上游供给 |
在"低资源影像数据集"的版图上,BraTS-Africa 的稀缺性在于三点:它是顶会挑战赛体系内、带排行榜的 SSA 数据(不是"发布了就没人管"的静态数据集);它是四序列完整标注的脑肿瘤数据(SSA 公开标注脑影像中规模最大者——论文原话为"非洲成人术前胶质瘤的最大公开标注回顾性队列");它带设备/中心元数据(可做采集条件分层分析)。
7.7 公平性叙事的边界
用这个数据集讲"AI 医疗公平"故事时有三条克制线:其一,它证明的是"SSA 数据可以被收集、标注并纳入全球基准",而不是"模型已在非洲落地"——挑战赛到 2024 年仍只有 6 支队伍上榜;其二,单国(尼日利亚)数据不能外推为"非洲分布",论文自己也把"从其他国家扩充"列为未来工作;其三,1.5T 数据训练的模型不等于适配所有 LMIC——南亚、拉美的分布同样是未采样的大陆。正确的读法是:BraTS-Africa 把"低资源"从修辞变成了可下载、可复现、可排名的实证对象。
7.8 生态三缺口:人、机、数据的连锁短板
论文背景部分把 SSA 的困境拆成了相互咬合的三层(这也是理解本数据集"为什么长这样"的地图):
- 人的缺口:神经放射医生、神经病理医生、神经外科医生与医学物理师稀缺——诊断与治疗两端同时缺人。后果:手动肿瘤分析只在少数城市中心可行,AI 恰好补"人少活多"的位置;
- 机的缺口:影像基础设施落后(低场设备、老化维保、对比剂供应链)——后果就是本数据集的图像质量画像(§7.2)与序列缺失常态;
- 数据的缺口:稀缺人手优先服务临床而非科研,标注产能低——全球数据版图上 SSA 长期空白,模型"没见过"这类分布,临床部署又无从验证,形成循环。
BraTS-Africa 的干预点选在第三层(供数据+办赛事),并借 CAMERA 向第一层回流(培养本地影像人才)、借质量画像对第二层做实证记录。三层视角下,单看"146 例分割标签"会低估它的杠杆位置——它是链条上唯一可复制的开源环节。
§6-§8 小结:获取上"三层门禁"(公开/受限/注册)各有钥匙;叙事上"三学科接口"各有抓手;文献上"四层谱系"各有引用场景。这个数据集的全部复杂性都可以收拢为一句话:它是被小心设计过的——从许可分层到规则收紧到激励倾斜,每一步都有明确的意图,理解意图比记住数字更重要。
§8 生态与影响:文献谱系与库内坐标
8.1 论文谱系四层
- 赛事设计层:arXiv:2305.19369(2023 届设计)→ Zenodo 10.5281/zenodo.10978906(2024 簇 Task 1-10 总设计文档,2024-04-16);
- 赛事总结层:Neuro-Oncology Advances vdag082(2025,两届总结,含 2023 届 9 队方法表与两届统计检验);
- 数据集描述层:Radiology: Artificial Intelligence e240528(2025-07,146 例全集描述+MRIQC 质量对照+SIGN 重训结果);
- 参赛方法层:LNCS 短论文群(MICCAI BraTS proceedings)与独立 arXiv(如 2412.04111 分层微调迁移学习方案)。
8.2 在 BraTS 家族中的位置
BraTS 2024 簇共 10 个 Task(Post-Treatment Adult Glioma、Post-treatment Meningioma、Brain Metastases、SSA(Task 4)、Pediatric、Generalizability、Augmentation(与 FDA 合作)、MRI Synthesis、MRI Inpainting、Histology),BraTS-Africa 是其中唯一以人群/地区(而非肿瘤类型或技术维度)划界的赛道。库内相关条目:
- brats(rid 24):主赛本体与主数据集——迁移学习的预训练源;其条目视角是"全球基准的演进史",本条目视角是"基准的公平性边界",两者拼合才是完整图景;
- fets:FeTS 联邦学习(BraTS 衍生的联邦训练倡议)——同为"数据分布异构"命题,但解法是联邦而非集中;fets 假设"数据都在但出不了门",BraTS-Africa 承认"有些数据根本还没被收集"——问题的两级;
- pengwin:BraTS 系脑膜瘤放疗规划赛道——同簇不同 Task,展示了簇内"分割→临床应用"的另一种延伸方向;
- upenn-gbm:UPenn GBM 纵向数据——高质量高资源的对照组样本,含随访与分子层信息,恰好覆盖 BraTS-Africa 的三个空白(纵向、分子、高场强);
- rembrandt / ucsf-pdgm:高收入国家胶质瘤 MRI 归档——与 BraTS-Africa 形成"资源梯度"对比面,适合做"同一模型跨数据集性能阶梯"的研究设计;
- BCN20000:巴塞罗那脑瘤库——另一种多中心区域整合模式(欧洲视角),与 AfNiA 的"欠发达地区归档"模式互为镜像。
8.3 被引用的方式(谁在用它)
从文献引用形态看,BraTS-Africa 已成为两类论文的标准组件:其一,泛化性/域偏移评测——把在主数据上训练的模型放到 SSA 数据上测衰减;其二,公平性/LMIC AI 论述——作为"低资源数据集工程"的范例引用(连同 AfNiA、CAMERA 机制)。第三方综述偶见"BraTS-Africa ≈750 cases"的数字(疑为把 2025 年后续扩展或簇级合并口径误植),与官方 146/115/95 不符——引用官方论文与 TCIA 页面为准(坑 5)。
8.4 引用场景矩阵(写论文时引哪篇)
| 你的论文涉及 | 必引 | 建议加引 |
|---|---|---|
| 使用了 146 例数据 | TCIA DOI(10.7937/v8h6-8x67,强制) | Radiol AI e240528 |
| 声称"SSA/低资源基准" | NOAJ vdag082 | arXiv:2305.19369 |
| 讨论两届挑战赛成绩 | NOAJ vdag082 | MICCAI LNCS 对应短论文 |
| 讨论 SSA 影像质量 | Radiol AI e240528(MRIQC 实验) | MRIQC 方法学文献 |
| 讨论非洲影像基础设施 | NOAJ vdag082 | CAMERA 相关文献 |
| BraTS 2024 簇全景 | Zenodo 10978906 | 主赛年度论文 |
| 标签体系/预处理协议 | Radiol AI e240528 + 主赛协议文献 | CaPTk/nnU-Net 原文 |
矩阵的逻辑:数据 DOI 永远在场(TCIA 硬要求);其余按"你引用的结论是谁得出的"归属——这句朴素的话是防引用错位(如拿簇设计文档当数据出处,坑 3)的根本办法。
8.5 大事记与后续版本预期(2010-2025)
| 时间 | 事件 |
|---|---|
| 2010-01 | 最早的数据采集窗口开启(尼日利亚多中心临床常规扫描) |
| 2012 | BraTS 挑战赛创办(此后十年主数据不含非洲人群) |
| 2020 前后 | CAMERA 联盟运转,非洲 MRI 教育与科研网络成形;AfNiA 归档建设 |
| 2022-12 | 采集窗口关闭(入组截止:2022-12-31 前的扫描) |
| 2023-05 | 首届挑战赛发布训练数据(95 例胶质瘤,60 带标签);arXiv:2305.19369 发布 |
| 2023-08 | 2023 届提交截止与终评(9 队上榜) |
| 2023-10 | MICCAI 2023 温哥华卫星活动;非洲获奖队伍获出席资助 |
| 2024-04-16 | BraTS 2024 簇设计文档上 Zenodo(10.5281/zenodo.10978906),SSA 为 Task 4 |
| 2024-05 | 第二届开赛:训练 60 例 + 验证扩至 35 例;规则收紧(额外数据预训练不进排名) |
| 2024-08 | 2024 届终评(6 队上榜);两届前六名 DSC +9.4%、HD95 -57.21% |
| 2024-08-31 | TCIA 数据 DOI 注册(10.7937/v8h6-8x67);146 例全集 version 1(页面 09-04 更新) |
| 2024-10 | MICCAI 2024 马拉喀什卫星活动 |
| 2024-12-18 | Zenodo 出现 5001_BraTS-SSA_2023 模型记录(14510931/14510932) |
| 2025-07 | Radiology: Artificial Intelligence 数据集描述论文刊出(e240528);NOAJ 两届总结论文(vdag082)刊出 |
| 2025-10 | MICCAI 2025 BraTS LNCS proceedings 收录两届参赛方法短论文 |
读这张表的三个感受:从"窗口关闭"到"数据上线"只用了半年(2023-01 至 2023-06 之间完成汇总-预处理-标注),速度快得依赖预标注流水线;从首届开赛到 146 例全集公开相隔 15 个月,数据释放节奏与赛事节奏咬合;从 DOI 注册到两篇正式论文相隔约 11 个月,符合期刊周期。
8.6 易混淆对象辨析(搜到这些名字别认错)
| 检索命中的名字 | 它实际是什么 | 与本条目关系 |
|---|---|---|
| BraTS-Africa / BraTS-Africa Challenge | 本条目主体(数据集+两届赛事) | ✓ |
| BraTS2023-SSA | 2023 届在 BraTS 2023 中的注册名 | 同物异名(坑 7) |
| ASNR-MICCAI-BraTS2023-SSA-Challenge-* | 2023 届数据目录前缀 | 同物异名 |
| 5001_BraTS-SSA_2023(Zenodo 14510931/2) | 模型/内容记录(Rachit Saluja) | 非数据本体(坑 3) |
| The Brain Tumor Segmentation (BraTS) Cluster of Challenges(Zenodo 10978906) | 2024 簇十 Task 设计文档 | 包含 Task 4=SSA 的元文档,非数据 |
| BraTS 2023-Adult-Glioma / BraTS-GLI-* | 主赛成人胶质瘤数据 | 不同数据集(预训练源) |
| BRACS | 乳腺病理数据集(库内 bracs) | 纯属拼写相近,零关系 |
| Brats(挪威地名) | 与医学无关 | 检索噪音 |
这张表的实用价值在检索排错:BraTS-Africa 的检索结果常被"Brats(地名)"“BRACS(乳腺)”"BraTS 主赛"三类噪音稀释,加上精确限定词(sub-Saharan、glioma、Nigeria、TCIA)可快速聚焦。
§9 与库内条目的关系
9.1 家族图谱
BraTS 主赛(brats, rid 24)── 簇关系 ──┬── BraTS-Africa(本条目,Task 4/SSA 分赛道)
├── pengwin(脑膜瘤放疗规划赛道)
├── fets(联邦学习倡议,BraTS 衍生)
└── upenn-gbm(UPenn GBM 纵向归档)
高资源胶质瘤 MRI 对照面 ── rembrandt ── ucsf-pdgm ── BCN20000
9.2 检索路径建议
| 检索目标 | 起点条目 | 关系 |
|---|---|---|
| 主赛数据/主数据预训练源 | brats(rid 24) | BraTS-Africa 的数据协议、评估指标、工具链全部继承自主赛 |
| 联邦/分布式训练对照 | fets | 同为分布异构命题,解法路径相反(联邦 vs 集中) |
| 同簇其他 Task | pengwin | 展示 BraTS 簇 2024 的完整赛道版图 |
| 高资源胶质瘤对照 | rembrandt、ucsf-pdgm、upenn-gbm | 构成"资源梯度"比较研究的另一端 |
| 区域多中心整合模式 | BCN20000 | 与 AfNiA 模式对照 |
9.3 互链锚点词
在库内其他条目中建议以下锚点词指向本条目:撒哈拉以南非洲、SSA、低资源/低收入国家(LMIC)、域偏移(domain shift)、1.5T、泛化性(generalizability)、健康公平(health equity)、Lacuna Fund。反向:本条目指向 brats 的锚点为"主赛/主数据/预训练源"。
§10 避坑清单:八个已踩过的坑
坑 1:三套例数口径并存(146/115/95),错配即翻车。
146=TCIA 全集(95 弥漫性胶质瘤+51 其他脑肿瘤);115=2024 挑战赛胶质瘤(60/35/20);95=2023 挑战赛胶质瘤(60/15/20)。文献中最常见的错误是把 146 写成"146 例胶质瘤"(实际胶质瘤 95-115 例),或把 60 例训练集当成全集。引用任何数字必须先声明口径。
坑 2:中心数 six vs seven 双口径。
TCIA collection 页/DataCite/lanfrica 均写"six diagnostic centers";NOAJ 论文写"seven (7) diagnostic imaging centers"并逐一列名(含 LUTH);TCIA 设备明细表又只列 5 家。三种说法各有出处。本文策略:机构名单引 NOAJ,总述引 TCIA,均注明口径。
坑 3:Zenodo DOI 10978906 不是 BraTS-Africa 的数据 DOI。
它是 BraTS 2024 Cluster of Challenges 的总设计文档 DOI(Task 1-10 的 PDF,515.8kB)。BraTS-Africa 数据本体的正式 DOI 是 TCIA 的 10.7937/v8h6-8x67。Zenodo 上确有含"SSA"字样的独立记录——5001_BraTS-SSA_2023(doi:10.5281/zenodo.14510931/14510932,Rachit Saluja 2024-12-18 注册)——但那是模型/内容记录,不是数据本体。检索者若循"Africa 子集在 Zenodo 有独立记录"的线索去找数据集,会被引到模型记录上。
坑 4:"146 例公开"是半真话。
公开可下载的是预处理版(730 studies,1.6GB,CC BY 4.0);未处理原始 NIfTI(585 studies)受 NIH Controlled Data Access Policy 限制,且 TCIA 页面已将下载通道标为 Unavailable(因图像可能重建人脸)。任何声称"含原始 DICOM/未处理数据"的使用计划目前无法执行。
坑 5:第三方数字污染(≈750 例、75 例、30 例测试)。
ScienceDirect 2026 综述写"BraTS-Africa (≈750 cases)"——与官方 146 不符,疑为后续扩展/簇级合并口径误植;selectdataset.com 写"75 例"且自述自相矛盾(60+35≠75);openmedlab 写 2023 测试集 30 例(官方论文为 20)。一切以 TCIA 页面 + NOAJ vdag082 + Radiol AI e240528 为准。
坑 6:标签缩写跨年改名(NC/ED → NETC/SNFH)。
2023 届与早期第三方资料用 NC(non-enhancing core)、edema 等叫法;BraTS 2024 统一为 ET/NETC/SNFH 命名。两套缩写指同一套分割概念,但混用时会与"整个肿瘤 WT/TC/ET"的旧三分类体系(主赛 2021 前口径)相撞——特别是"TC"在新旧体系里定义不同。读代码时以标签文件数值(1/2/3 或 0-3)+ 官方命名对照为准。
坑 7:三个名字一个东西(BraTS-Africa / BraTS2023-SSA / BraTS-SSA)。
2023 届注册名 BraTS2023-SSA(Synapse 页面、目录前缀 ASNR-MICCAI-BraTS2023-SSA-Challenge-*)、论文简称 BraTS-Africa、病例 ID 前缀 BraTS-SSA——三个名字并存于官方材料。检索时三者都要试;引用时建议统一为 BraTS-Africa 并注明年份。
坑 8:预处理后尺寸的来源分歧。
官方预处理产物按 BraTS 惯例约 240×240×155(1mm³);部分参赛/复现方案自述"平均 136×170×140 后重采样到 160×160×160"等尺寸——那是自行二次重采样的结果,不是官方规格。核对数据时以官方 1mm³ 口径为准,警惕把第三方 pipeline 的中间尺寸当成数据集属性。
§11 总结
11.1 三句话总结
- BraTS-Africa 把 BraTS 全球基准第一次系统性扩展到撒哈拉以南非洲——146 例尼日利亚 1.5T 真实临床 mpMRI(95 例弥漫性胶质瘤+51 例其他脑肿瘤),BraTS 协议预处理+三阶段专家标注,CC BY 4.0 在 TCIA 公开。
- 两届 MICCAI 挑战赛(2023:9 队 12 国;2024:6 队 7 国)证明小数据赛道仍有大空间——2024 前六名 DSC +9.4%、HD95 -57.21%,且规则收紧后迁移学习的度量和"纯 SSA 数据上限"被明确分开。
- 它的方法学遗产是把"低资源影像"变成可测量的统计事实(MRIQC 五指标对照)和可持续的机制(AfNiA 归档+CAMERA 培训+Lacuna Fund 资助),而不仅是发布一批数据。
11.2 适合谁
- 需要真实低资源/域偏移测试床的分割模型开发者(预训练模型健康体检);
- 研究迁移学习、小样本微调、模型集成策略的方法学团队;
- 全球健康/健康公平方向的 AI 研究者与政策论证者;
- 需要多厂商、多协议、非各向同性采集的鲁棒性评测设计者。
11.3 不适合谁
- 需要 IDH/1p19q/MGMT 等分子分型标注的研究(本数据集无);
- 需要纵向/治疗后随访影像的研究(全部为术前);
- 期待大规模训练集的端到端预训练(训练集仅 60 例);
- 需要原始 DICOM/未处理数据或预处理过程可复现性的工作(原始版受限不可得)。
11.4 30 秒决策卡
| 你要做什么 | 用它吗 | 关键提醒 |
|---|---|---|
| 主数据预训练→低资源微调 | 用 | 60 例训练集+Synapse/TCIA 双通道,坑 1 口径先分清 |
| 域偏移/泛化评测 | 用 | MRIQC 证据链+全 1.5T 特性是天然变量 |
| LMIC 公平性研究 | 用 | 引 NOAJ+Radiol AI 论文,别用第三方污染数字(坑 5) |
| 分子分型/纵向研究 | 不用 | 无分子标签、无随访 |
| 复现预处理管线 | 不可行 | 原始图 NIH 受限(坑 4) |
11.5 常见错误用法 Top 5(从文献与社区实践归纳)
- 口径错:把 146 写成"146 例胶质瘤"——实际胶质瘤 95-115 例,51 例是其他脑肿瘤;
- 泄漏:TCIA 全集(带标签)训练→挑战赛验证集自评——训练集与验证集在全集内重叠(§2.7);
- 越界:用官方测试集影像自评并给出"DSC=X"——参考标签从未公开,成绩无锚;
- 错引:数据引用写 Zenodo 10978906(簇设计文档)而非 TCIA DOI——DOI 错位等于数据不可溯源;
- 过读:把两届 DSC +9.4% 画成"能力增长曲线"——两届数据与规则都不同,只支持"届间比较"这一种表述。
FAQ(高频问答 42 问)
A. 基础认知
Q1:BraTS-Africa 是独立数据集还是 BraTS 的子集?
既是子集又是独立数据集:挑战赛子集(95/115 例胶质瘤)是 BraTS 簇 Task 4 的官方数据;TCIA 146 例全集是独立发布、独立 DOI、含 51 例非胶质瘤扩充的完整 collection。协议与工具链继承 BraTS,数据来源与人群独立。
Q2:官方全名是什么?
挑战赛:MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge。数据集:Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa)。
Q3:数据从哪些国家来?
全部来自尼日利亚(多诊断中心)。"Africa"是愿景名——论文明确以"从非洲其他国家持续扩充"为未来机制,当前版本是纯尼日利亚数据。
Q4:都是成人吗?
挑战赛口径为成人弥漫性胶质瘤(2021 WHO CNS 肿瘤分类)。儿科病例不在本数据集(儿科由 BraTS 簇 Pediatric Task 覆盖)。
B. 数据与获取
Q5:在哪下载?
TCIA:https://www.cancerimagingarchive.net/collection/brats-africa/ (Aspera 下载)。挑战赛数据:Synapse syn51156910(2023)/ syn59059780(2024)。
Q6:要注册吗?
TCIA 公开部分不需要;Synapse 挑战赛数据需要 Synapse 账号并接受数据使用条款。
Q7:能拿到测试集标签吗?
不能。2023 的 20 例与 2024 新增的 20 例测试参考标签由组织者扣留用于终评,从未公开。
Q8:51 例"其他脑肿瘤"是什么病理类型?
官方未逐例公开病理构成,仅 XLSX 元数据含诊断字段。做胶质瘤专项研究时建议先按 XLSX 过滤出胶质瘤子集。
Q9:四个序列都完整吗?
预处理版要求全部四序列(经 sanity check);原始采集层面序列缺失在 SSA 临床常见——这正是本数据集的特色背景,但官方预处理产物已做完整性筛查。
C. 挑战赛与结果
Q10:两届挑战赛分别多少队伍?
2023:9 队上榜(12 国参与者);2024:6 队上榜(7 国)。
Q11:2024 成绩提升多少?
2024 排名前六的方法相对 2023:DSC 提升 9.4%、HD95 降低 57.21%(NOAJ 论文 Welch’s t-test 口径)。
Q12:2024 规则最大变化是什么?
用额外数据(如 BraTS 主数据)做模型开发或预训练的提交不参与排名——把"纯 SSA 数据上限"从迁移学习混合成绩中剥离。
Q13:模型怎么提交?
MLCube 容器化模型经 MedPerf 平台提交,GaNDLF 框架自动生成容器;方法短论文经 CMT 提交;预测分割文件经 Synapse 提交评估。
Q14:评估指标是什么?
lesion-wise DSC 与 HD95 的加权组合(沿用 BraTS 惯例),对验证/测试集分别计算并按子区域报告。
D. 方法学
Q15:从零训练可行吗?
不可行——60 例训练集无法支撑 3D 网络从零收敛。文献主流:主数据预训练+微调+集成+后处理。
Q16:有没有推荐的基线?
nnU-Net 是社区默认起点(2023 届上榜多为 nnU-Net 改造);SIGN(相似度加权自集成)在 Radiol AI 论文的两轮评估中整体最佳。
Q17:标注可靠吗?
nnU-Net 预标注+10 名住院医精修+2 名注册放射科医生复核+1 名美国 board-certified 神经放射专家终审。注意:终审为单专家,无公开的多专家一致性数据。
Q18:标签数值怎么映射?
三子区域方案(ET/NETC/SNFH),标签文件为单通道整型体数据;对照官方命名与第三方资料的 NC/edema 旧称时注意坑 6。
E. 许可与合规
Q19:商用可以吗?
预处理版 CC BY 4.0 允许商用(需归属);但 TCIA Data Usage Policy 附加归属义务;未处理原始图受 NIH 政策约束(当前不可得)。
Q20:引用什么 DOI?
数据:10.7937/v8h6-8x67;论文:10.1093/noajnl/vdag082(赛事总结)、10.1148/ryai.240528(数据集描述)、arXiv:2305.19369(2023 设计)。
Q21:Zenodo 10978906 是什么?
BraTS 2024 簇总设计文档(Task 1-10),不是 BraTS-Africa 数据 DOI——详见坑 3。
F. 生态与延伸
Q22:数据集会继续扩大吗?
论文将 AfNiA+CAMERA+Lacuna Fund 机制定位为持续扩充框架,目标是纳入非洲其他国家数据;但截至本文抓取时点,TCIA version 1(2024-09-04)仍为 146 例。
Q23:和 FeTS 什么关系?
同为 BraTS 衍生但命题不同:FeTS 解决"数据不能出门"的联邦训练,BraTS-Africa 解决"数据本身来自低资源分布"的公平性与泛化性。
Q24:在哪里能看到 2023 届参赛方法细节?
NOAJ vdag082 表 1 按排名列出 9 队方法(nnU-Net/ODConv2D、AGU-Net、TCuP-GAN、SAMBA 等);扩写论文见 MICCAI BraTS LNCS proceedings。
G. 复现与工程
Q25:怎么把 146 例切成自己的 train/val?
先按 XLSX 诊断字段分出胶质瘤/非胶质瘤;若目标是与文献可比,建议沿用"中心分层+诊断分层"的拆分逻辑(保持每折设备构成相近),并在论文中声明与官方挑战赛拆分不可互比。
Q26:dataloader 需要改什么?
几乎不用改——目录结构、文件命名、体数据规格均与 BraTS 主数据同构(§2.6/§2.8)。要改的通常是:类别数(3 子区域)、可能的名字后缀适配(-t1n/-t1c/-t2w/-t2f 两套写法)。
Q27:能看到 2024 届上榜代码吗?
部分队伍在 GitHub 公开(组织方鼓励但不强制);NOAJ 论文表 1 记录方法描述与引用入口。MedPerf 平台持有提交的 MLCube 容器,但容器不是公开制品。
Q28:怎么统计各中心的样本量?
用 TCIA XLSX 元数据按"扫描地点"列聚合即可得到中心×例数交叉表;设备型号列可做厂商分布分析。这是主赛数据不提供的分析维度。
Q29:MRIQC 质量指标能自己重算吗?
对预处理版可以(MRIQC 直接吃 NIfTI),但结果与论文的"未处理对照"不可比——论文测的是原始采集质量,你测的是预处理后质量。原始图不可得,未处理质量指标无法外部复现。
Q30:数据增强有什么特别建议?
针对低场特性:强度域增广(gamma、偏置场模拟、Rician 噪声模拟)比几何增广更关键;层间插值不确定性可以用随机层间缩放模拟;有论文用合成/增广手段在 SSA 数据上验证泛化(同簇 Task 7 即 FDA 合作增广评估赛道)。
Q31:体积小,能做 self-supervised 预训练吗?
146 例做大规模自监督偏少;文献路线是反向的——用主数据/公开脑 MRI 库(如健康人+主赛)做自监督或监督预训练,再在 BraTS-Africa 上微调评测。
H. 生态与延伸(续)
Q32:AfNiA 是什么?
Africa Neuroimaging Archive——非洲神经影像归档,本数据集的原始汇聚层:尼日利亚各中心临床扫描先进入 AfNiA,再按 BraTS 协议加工输出。它是"CAMERA 教育-归档-研究"闭环的存储环节。
Q33:CAMERA 是什么?
Consortium for Advancement of MRI Education and Research in Africa——非洲 MRI 教育与科研推进联盟。挑战赛官方全名中的"CAMERA"即指它;其价值在"人"的层面:没有本地-trained 影像人才,数据与模型都不可持续。
Q34:Lacuna Fund 是什么?
面向全球南方数据公平的资助基金,Health and Equity 方向资助了本数据集的策展与标注。数据集的"标注劳动力成本"视角(§3)正是这类资助的典型适用场景。
Q35:有 2025 届吗?
挑战赛随 BraTS 簇年度滚动;2025 年簇的 SSA 赛道延续情况以当年 BraTS/CBIGR 官方公告为准——本条目事实边界止于 2024 届与 146 例 version 1。
Q36:能用它训练分类/生存预测模型吗?
能做影像-only 的分级/分类探索(XLSX 有诊断字段),但无生存随访、无分子标签(IDH/MGMT/1p19q),做不了有意义的生存预测研究——这也是它与 upenn-gbm 等纵向数据集的本质分工。
Q37:为什么标题说它是"域偏移测试床"而不是"另一个分割数据集"?
因为它的价值密度在"分布"而非"规模":146 例不足以训练大模型,但足以测量"高资源训练的模型在低资源分布上掉多少分"——这个测量主赛数据自己永远做不了。
I. 失败模式与坑位自检
Q38:最常见的实验设计错误是什么?
用 TCIA 全集(含标签)训练后去挑战赛验证集刷分——数据泄漏(§2.7)。第二名:把 51 例非胶质瘤混进胶质瘤分割训练。第三名:拿"146 例胶质瘤"的表述直接进论文——例数口径错误(坑 1)。
Q39:读别人论文时怎么快速验真?
三查:查例数口径是否声明(146/115/95);查测试集是否自造(官方测试标签未公开,任何"在官方测试集上 DSC=X"的非参赛论文都值得怀疑);查 Zenodo 10978906 是否被当数据源引用(坑 3)。
Q40:预处理版上还能做"预处理研究"吗?
做不了端到端(原始图不可得,坑 4),但可以研究"预处理参数敏感性"的上游模拟——在预处理版上施加扰动(模拟不同 N4 强度、不同插值)观察模型稳健性。这是可行的降级路径。
Q41:51 例"其他脑肿瘤"值得单独研究吗?
作为"分割标签在非胶质瘤上的行为"的探针很有价值(脑膜瘤、转移瘤等在三区域标签体系下如何表现,官方未细说);作为"第二个人群基准"则披露不足——诊断构成没有公开明细表。
Q42:如果想帮 SSA 做点事,除了发论文还能做什么?
现实路径:参赛(2023/2024 届非洲队伍有专项资助机制);给 CAMERA 类联盟做教学材料;把模型做成能在 1.5T、断网、低算力环境跑的轻量形态——最后这条是 SSA 落地的真瓶颈,也是这个数据集设置之初就想撬动的研究方向。
J. 写给四种读者的特别提示
给初学者:先用 60 例训练集+nnU-Net 跑通 baseline,再谈创新;不要一上来就设计复杂模型——60 例的规模会把一切过拟合倾向放大到荒谬。
给审稿人:看到"BraTS-Africa 上验证"的投稿,先查三件事——例数口径、是否用官方测试集宣称成绩(不可信,标签未公开)、是否声明了单专家标注的局限。
给数据集建设者:这个案例的可复制清单是——借成熟协议(BraTS)降低规格决策成本;借预标注流水线降低标注成本;借顶会赛事制造激励;借专项基金覆盖"公平性溢价"。四件事缺一,数据集的完成度都会打折。
给临床医生:本数据集是研究资源而非临床工具;标签来自影像学定义(非病理确认的生物学实体),任何向临床决策的迁移都需要前瞻验证——这正是组织者自己强调的边界。
事实清单(硬事实 40 条)
- 数据集正式名:Expanding the Brain Tumor Segmentation (BraTS) data to include African Populations (BraTS-Africa)。
- 挑战赛官方全名:MICCAI-CAMERA-Lacuna Fund BraTS-Africa Challenge。
- TCIA DOI:10.7937/v8h6-8x67(2024-08-31 DataCite 注册;version 1,2024-09-04 更新)。
- 全集规模:146 例 = 95 例弥漫性胶质瘤 + 51 例其他脑肿瘤。
- 2023 挑战赛拆分:60 训练/15 验证/20 测试(95 例胶质瘤)。
- 2024 挑战赛拆分:60 训练/35 验证/20 新测试(115 例胶质瘤;35=15+2023 的 20)。
- 采集时间窗:2010-01 至 2022-12;全部术前、回顾性、临床常规采集。
- 设备:全部 1.5T(Siemens Magnetom Essenza ×2、Philips Achieva、GE SIGNA Explorer、GE SIGNA Creator)。
- 原始层厚 3-5mm,层面内 1mm(非各向同性)。
- 模态:T1、T1-CE、T2、T2-FLAIR 四序列 mpMRI;DICOM→NIfTI。
- 来源国:尼日利亚;TCIA 口径 6 中心/NOAJ 口径 7 中心(含 LUTH);经 AfNiA 汇总。
- 资助:Lacuna Fund for Health Equity;协作:CAMERA。
- 预处理:LPS 重定向→T1-CE 刚性配准 SRI24→1mm³ 各向同性重采样→N4 偏置场校正→颅骨剥离→强度归一化。
- 工具链:CaPTk 1.9.0 + nnU-Net + ITK-SNAP 4.0.0。
- 标注三阶段:10 名住院医精修→2 名注册放射科医生复核→1 名美国 board-certified 神经放射专家(>5 年经验)终审。
- 标签:ET/NETC/SNFH 三子区域(BraTS 2024 命名)。
- TCIA 预处理版:146 subjects/730 studies/1.6GB,CC BY 4.0。
- TCIA 未处理版:146 subjects/585 studies,NIH Controlled 受限,下载通道 Unavailable。
- Synapse:2023=syn51156910;2024=syn59059780。
- 2023 届:9 队上榜、12 国。
- 2024 届:6 队上榜、7 国。
- 两届比较:2024 前六 DSC +9.4%、HD95 -57.21%(Welch’s t-test)。
- 2024 规则:用额外数据开发/预训练的模型不参与排名。
- 提交形态:MLCube 容器(MedPerf 平台)+ GaNDLF 框架;短论文经 CMT。
- 质量对照:50 例未处理 BraTS-Africa vs 50 例 TCGA-GBM,MRIQC 22.0.6 五指标(SNR/CNR/CJV/EFC/QI1),P<.05。
- 流行病学:SSA 胶质瘤死亡率 1990-2016 升约 25%(全球北方降 10%-30%;美国 30 年降 7%)。
- 胶质瘤存活:30%-80% 五年内死亡(NOAJ);GBM 约 80% 两年内死亡(arXiv 摘要)。
- SIGN(SimIlarity weiGhted self-eNsembling)在初评与 BraTS-Africa 重训两轮中整体最佳。
- BraTS 2024 簇 10 个 Task;BraTS-Africa 为 Task 4;簇总设计文档 Zenodo DOI 10.5281/zenodo.10978906(2024-04-16)。
- 论文:NOAJ 2025;8(1):vdag082(PMC13141146);Radiol Artif Intell 2025;7(4):e240528(PMCID PMC12319694);arXiv:2305.19369。
- 挑战赛 2023 届允许补充数据但须双报告;2024 届改为不进排名——两届成绩不可直接画趋势线。
- 2023 届方法短论文 8-10 页,经 CMT 提交;上榜者受邀扩写为 LNCS 会议论文。
- TCIA collection 总计口径 3.7GB;预处理可下载包 1.6GB(730 studies)。
- 数据引用为强制(Data Citation Required),须含 DOI 10.7937/v8h6-8x67 与 TCIA Data Usage Policy 归属。
- 主办核心人物:Udunna C. Anazodo(McGill/MNI + Crestview Radiology)、Maruf Adewole、Jeffrey D. Rudie、Spyridon Bakas(UPenn)、Bjoern Menze、Ujjwal Baid 等。
- 纳入标准:2010-01~2022-12 之间、具脑肿瘤临床表现的脑 MRI(CNS 肿瘤/弥漫性胶质瘤/LGG/GBM-HGG);排除:非 MRI 或窗口外扫描。
- 预处理产线以 T1-CE 为配准锚(6 自由度刚性→SRI24→1mm³),其余序列复合变换间接配准。
- 终审专家资质口径:美国 board-certified 神经放射医生、5 年以上脑肿瘤分割经验(含 DL 方法开发)。
- 两届统计检验:Welch’s t-test(届间比较)+ paired t-test(African-only vs +额外数据训练比较)。
- 2024 届 Africa 非洲参赛队伍成绩激励为出席 MICCAI 2024(马拉喀什)的资金支持;2023 届另有现金奖(温哥华)。
DAIMS 评估表(AI-Ready 数据管理成熟度)
| 维度 | 得分 | 评注 |
|---|---|---|
| D1 可发现性 | 4/5 | TCIA 专页+DataCite DOI+三篇论文互引,检索面完整;扣分在命名多轨(BraTS-Africa/BraTS2023-SSA/BraTS-SSA)易致检索漏检 |
| D2 可获取性 | 3/5 | 预处理版 CC BY 4.0 公开但需 Aspera 插件;原始版受控不可得;挑战赛数据需 Synapse 注册——三层门禁 |
| D3 互操作性 | 5/5 | 完全对齐 BraTS 规格(NIfTI、1mm³、目录/ID 惯例),BraTS 生态工具链零成本复用 |
| D4 复用性 | 3/5 | CC BY 4.0+完整引用指南;但无分子标签、无纵向数据、预处理不可复现、测试标签扣留,限制研究面 |
| D5 溯源性 | 4/5 | 中心/设备/时间窗/标注流水线披露充分;单专家终审与多口径数字(146/115/95;6/7 中心)需引用者自行调和 |
| 总评 | 19/25 | 规格与协议继承 BraTS 而高度 AI-Ready;扣分集中在获取门禁与多口径治理,属"高互操作、中等可得"型数据集 |
评分稳定性的两个触发器(何时需要重评):其一,若 NIH 政策调整使未处理原始 NIfTI 恢复获取,D2 上调至 4/5、D4 上调至 4/5(预处理可复现);其二,若 TCIA 发布 version 2(新增国家数据或更大例数),D1/D5 相关口径全部需要重核——届时本条目的例数三口径(146/115/95)需要增补第四套口径。
P1:本数据集最容易被误读的数字一览(引用前自查):
| 数字 | 常见误读 | 正确表述 |
|---|---|---|
| 146 | “146 例胶质瘤” | 146 例脑肿瘤(95 例弥漫性胶质瘤+51 例其他脑肿瘤) |
| 115 | “全集 115 例” | 2024 届挑战赛胶质瘤口径(60/35/20) |
| 60 | “60 例数据集” | 训练集例数(全集的子集) |
| 9.4% | “DSC 达到 0.9X” | 2024 前六名相对 2023 届的 DSC 相对提升 |
| 57.21% | “HD95 误差 57” | 2024 前六名相对 2023 届的 HD95 相对下降 |
| 6/7 家中心 | “6 家(唯一口径)” | TCIA 口径 6 家、NOAJ 论文口径 7 家(坑 2) |
| 2010-2022 | “近三年采集” | 固定历史窗口,数据为快照式发布 |
| 1.5T | “低场=低质量数据集” | 采集事实与统计对照(§7.2),不构成价值判断 |
附录 A:来源清单与核验时点
证据等级说明:本条目事实分三级——一级证据(TCIA collection 页、TCIA/DataCite DOI 记录、挑战赛官方论文原文)为一切硬数字的来源;二级证据(Zenodo 簇设计文档、Synapse 页面元信息、主办方机构页)用于赛事结构与定位;三级证据(第三方数据集目录、综述转述、参赛者复现记录)只用于交叉检验并在冲突时让位于一二级,其数字不得直接引用(坑 5 的污染源多在三级)。
| 来源 | URL/DOI | 等级 | 用途 | 核验时点 |
|---|---|---|---|---|
| TCIA collection 页 | https://www.cancerimagingarchive.net/collection/brats-africa/ | 一 | 规模/设备/license/获取 | 2026-09-27 |
| TCIA 数据 DOI | https://doi.org/10.7937/v8h6-8x67 | 一 | 数据引用 | 2026-09-27 |
| NOAJ 两届总结论文 | https://doi.org/10.1093/noajnl/vdag082(PMC13141146) | 一 | 拆分/队伍/指标/中心名单 | 2026-09-27 |
| Radiol AI 数据集描述论文 | https://doi.org/10.1148/ryai.240528(PMC12319694) | 一 | 146 例口径/质量对照/license | 2026-09-27 |
| arXiv 2023 届设计 | https://arxiv.org/abs/2305.19369 | 一 | LMIC 背景/2023 口径 | 2026-09-27 |
| BraTS 2024 簇设计文档 | https://doi.org/10.5281/zenodo.10978906 | 二 | Task 4 定位/簇全景 | 2026-09-27 |
| DataCite ORCID 记录 | https://commons.datacite.org/orcid.org/0000-0002-2567-9465 | 一 | 95+51 构成/注册日期 | 2026-09-27 |
| Zenodo 独立记录(模型) | https://doi.org/10.5281/zenodo.14510931 | 二 | 坑 3 存照 | 2026-09-27 |
| Synapse 2024 数据页 | https://www.synapse.org/Synapse:syn59059780 | 二 | 挑战赛数据入口 | 2026-09-27(经第三方转述核验) |
| openmedlab BraTS2023-SSA 条目 | github.com/openmedlab/Awesome-Medical-Dataset | 三 | 交叉检验(其"30 测试"与官方冲突,坑 5) | 2026-09-27 |
附录 A2:核验方法自述(可复制的三源互证流程)
本条目采用的三源互证流程(供后续维护者复用):
- 第一轮(存在性):泛化关键词搜索(BraTS-Africa + Zenodo + MICCAI + challenge)确认对象存在、规模量级与核心归属——命中 TCIA collection 页、Zenodo 簇文档、NOAJ 论文三大一级源;
- 第二轮(细节核验):逐字段抓取——TCIA 页面(规模/设备/license/获取方式全文)、DataCite 注册记录(95+51 构成、注册日期)、PMC 全文(Radiol AI e240528 与 NOAJ vdag082,后者经 Europe PMC REST API 获取全文 XML)——建立"每个硬数字至少两个一级源"的矩阵;
- 第三轮(冲突仲裁):列出所有口径冲突(例数 146/115/95、中心 6/7、测试 20/30、Zenodo 归属),逐条回溯到最权威的原始出处仲裁,无法仲裁的以"多口径并存"存照(坑 1/2/5)。
冲突仲裁的三条原则:官方论文 > 官方页面 > 第三方目录;期刊论文 > 预印本 > 会议摘要;有统计检验的结论 > 无检验的叙述。任何一处"正文说 A、表格说 B"的原始文档内冲突,按论文正文优先并在坑点存照。
附录 B:检索路径示范
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 数据本体 | site:cancerimagingarchive.net BraTS-Africa / DOI 10.7937/v8h6-8x67 | TCIA collection 页 |
| 两届总结 | “BraTS-Africa challenge” AND (“sub-Saharan” OR SSA) | NOAJ vdag082 |
| 数据集论文 | “BraTS-Africa Dataset” AND “African Populations” | Radiol AI e240528 |
| 2023 设计 | BraTS-Africa 2023 arXiv SSA glioma segmentation | arXiv:2305.19369 |
| 参赛方案 | BraTS-Africa 2024 transfer learning nnU-Net SSA | arXiv:2412.04111 等 LNCS/arXiv |
| 反例(勿引) | “BraTS-Africa 750 cases” / selectdataset “75 例” | 第三方污染数字(坑 5) |
检索卫生两条:一、凡遇"BraTS-SSA"字样先分辨是病例 ID 前缀、2023 届注册名还是 Zenodo 模型记录;二、任何例数引用前先声明口径(146 全集/115 挑战赛 2024/95 挑战赛 2023)。
附录 C:术语对照表(中英首现速查)
| 术语 | 全称/英文 | 释义 |
|---|---|---|
| BraTS | Brain Tumor Segmentation Challenge | 国际脑肿瘤分割挑战赛(2012 起,MICCAI 卫星) |
| SSA | Sub-Saharan Africa | 撒哈拉以南非洲 |
| LMIC | Low- and Middle-Income Countries | 低收入与中等收入国家 |
| AfNiA | Africa Neuroimaging Archive | 非洲神经影像归档(数据汇聚层) |
| CAMERA | Consortium for Advancement of MRI Education and Research in Africa | 非洲 MRI 教育与科研推进联盟 |
| Lacuna Fund | Lacuna Fund for Health Equity | 资助全球南方数据公平的基金 |
| TCIA | The Cancer Imaging Archive | 癌症影像归档(数据托管方) |
| mpMRI | multi-parametric MRI | 多参数磁共振(本数据集:T1/T1-CE/T2/T2-FLAIR) |
| T1-CE | contrast-enhanced T1(T1c) | 钆对比剂增强后 T1 加权 |
| T2-FLAIR | T2 Fluid-Attenuated Inversion Recovery | T2 液体衰减反转恢复序列 |
| ET | Enhancing Tumor | 增强肿瘤(分割标签) |
| NETC | Non-Enhancing Tumor Core | 非增强肿瘤核心(分割标签;旧称 NC/NET) |
| SNFH | Surrounding Non-Enhancing FLAIR Hyperintensity | 周围非增强 FLAIR 高信号(分割标签;旧称 edema/ED) |
| GBM/HGG | Glioblastoma / High-Grade Glioma | 胶质母细胞瘤/高级别胶质瘤 |
| LGG | Low-Grade Glioma | 低级别胶质瘤 |
| 胶质瘤病 | gliomatosis cerebri | 弥漫浸润性胶质瘤表现,SSA 疑似比例更高 |
| SRI24 | SRI24 atlas(SRI 24-space anatomical atlas) | 配准目标解剖模板 |
| N4 | N4 bias field correction | 偏置场校正算法 |
| 颅骨剥离 | skull-stripping / brain extraction | 去除非脑组织 |
| de-facing | de-identification by face removal | 去面(去标识)处理 |
| CaPTk | Cancer Imaging Phenomics Toolkit | 影像处理工具包(DICOM 转换/配准/重采样) |
| ITK-SNAP | ITK-SNAP | 半自动分割标注/审核软件 |
| nnU-Net | nnU-Net | 自配置分割框架(预标注与基线) |
| DSC/Dice | Dice Similarity Coefficient | 分割重叠度量 |
| HD95 | 95% Hausdorff Distance | 边界距离度量(95 分位) |
| lesion-wise | 逐病灶 | 以病灶为单位的评估聚合方式 |
| MLCube | MLCube 容器规范 | 模型容器化提交格式 |
| MedPerf | MedPerf 平台 | MLCommons 的模型基准评测平台 |
| GaNDLF | Generally Nuanced Deep Learning Framework | MLCommons 维护的医学 DL 框架(自动生成 MLCube) |
| Synapse | Sage Bionetworks Synapse | 数据共享与排行榜平台 |
| CMT | Microsoft Conference Management Toolkit | 短论文投稿系统 |
| MRIQC | MRI Quality Control | 标准化 MRI 质量评估工具(SNR/CNR/CJV/EFC/QI1) |
| domain shift | 域偏移 | 训练与部署数据分布不一致 |
| WHO 2021 | WHO Classification of Tumors of the CNS (2021) | 中枢神经系统肿瘤分类(诊断依据) |
附录 D:引用格式示例
数据集(强制归属):
@dataset{adewole_2024_bratsafrica,
author = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and
Zhang, Dong and Raymond, Confidence and others},
title = {Expanding the Brain Tumor Segmentation (BraTS) data to include
African Populations (BraTS-Africa) (version 1)},
year = {2024},
publisher = {The Cancer Imaging Archive},
doi = {10.7937/v8h6-8x67}
}
两届总结论文:
@article{adewole_2025_noaj,
author = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and others},
title = {Brain tumor segmentation in Sub-Saharan Africa patient population:
The BraTS-Africa challenge},
journal = {Neuro-Oncology Advances},
year = {2025},
volume = {8},
number = {1},
pages = {vdag082},
doi = {10.1093/noajnl/vdag082}
}
数据集描述论文:
@article{adewole_2025_ryai,
author = {Adewole, Maruf and Rudie, Jeffrey D. and Gbadamosi, Anu and others},
title = {The BraTS-Africa Dataset: Expanding the Brain Tumor Segmentation
Data to Capture African Populations},
journal = {Radiology: Artificial Intelligence},
year = {2025},
volume = {7},
number = {4},
pages = {e240528},
doi = {10.1148/ryai.240528}
}
引用卫生三条:一、TCIA 要求"Data Citation Required"——任何使用必须带上数据 DOI;二、不要把 Zenodo 10978906(簇设计文档)写进数据引用;三、引例数时写明口径(146/115/95)。
维护交接卡(后续代理/编辑请先读)
| 事项 | 说明 |
|---|---|
| 触发重核的条件 | TCIA collection 页例数/版本变化;BraTS 簇公告新一届 SSA 赛道;Radiol AI/NOAJ 勘误 |
| 重核优先级 1 | 例数三口径(146/115/95)——任何新版本发布立即失效 |
| 重核优先级 2 | 原始图获取状态(NIH 政策)——影响坑 4 与 DAIMS D2/D4 评分 |
| 重核优先级 3 | Zenodo 侧新增记录(模型/数据)——影响坑 3 的归属表述 |
| 不要动的事实 | 两届队伍数(9/6)、DSC +9.4%、HD95 -57.21%、设备型号表、标注三阶段——均有一级源 |
| 本条目自产的推算 | §3.8 工作量估算、§7.3 对策表——已在文中声明"本文推算",维护时勿当官方数字 |
| 互链硬锚 | brats = rid 24(库内唯一 brats URL);其余互链对象 rid 以当时库内查询为准 |
| 环境留痕 | 生产代理 agentA-bratsafrica;生产时点 ps aux codebuddy 进程数=5;part 临时文件 /tmp/brats-africa_agentA-bratsafrica_part1-5.md |
| 备选改道记录 | 正选 brats-africa 三源核验通过,未触发改道;备选 crossmoda-2023 未启用(库内 crossmoda2022 无冲突,但正选证真后无需改道) |
尾注
版本存照:本条目基于 TCIA version 1(2024-09-04 更新,146 例)与两届挑战赛(2023/2024)的官方事实边界撰写;对"BraTS-Africa"这一名称在 2025 年及以后的赛事续办、数据扩版(第三方综述已出现 ≈750 例口径)不在本版本事实边界内,后续版本应重核 TCIA collection 页与当年 BraTS 簇公告。
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点见附录 A。事实陈述以 TCIA collection 页(DOI 10.7937/v8h6-8x67)、NOAJ 两届总结论文(10.1093/noajnl/vdag082)、Radiology: Artificial Intelligence 数据描述论文(10.1148/ryai.240528)与 arXiv:2305.19369 为源,三源互证;三套例数口径、双中心口径、Zenodo 归属、license 异构、第三方数字污染等原始文档与传播层面的缺陷已在坑点清单存照。条目与库内 brats(rid 24)、fets、pengwin、upenn-gbm、rembrandt、ucsf-pdgm、BCN20000 等条目互链,构成脑肿瘤 MRI"资源梯度"家族的完整检索面。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ucsf-pdgm — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
- fets — 共享标签:医学影像 / MRI / 脑肿瘤 / 肿瘤学
- crossmoda-2023 — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
- promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 肿瘤学
- rembrandt — 共享标签:医学影像 / MRI / 脑肿瘤
- brats — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
- trackrad — 共享标签:医学影像 / MRI / 医学图像分割 / 肿瘤学
- brats-pediatric — 共享标签:医学影像 / MRI / 医学图像分割 / 脑肿瘤
- medical-decathlon — 共享标签:医学影像 / MRI / 医学图像分割
- pannuke — 共享标签:医学影像 / 医学图像分割 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

