信息速览
BONBID-HIE 2024:第二届波士顿新生儿脑损伤数据集挑战赛
INFOBOX:条目速览
| 字段 | 内容 |
|---|---|
| 条目 slug | bonbid-hie |
| 正式名称 | 2nd BONBID-HIE Challenge for Lesion Segmentation and Outcome Prediction |
| 中文译名 | 第二届 BONBID-HIE 挑战赛:病灶分割与结局预测 |
| 缩写含义 | BONBID = BOston Neonatal Brain Injury Dataset;HIE = Hypoxic-Ischemic Encephalopathy(缺氧缺血性脑病) |
| 数据集构成 | Part I(分割数据,133 例)+ Part II(结局数据,237 例)+ 2024 届新增 BCH 无标注数据 |
| 主记录 | Zenodo record 10978874,DOI 10.5281/zenodo.10978874,2024-04-16 发布 |
| Part I 记录 | Zenodo record 10602767(v3,concept DOI 10.5281/zenodo.8104102),完全开放下载 |
| Part II 记录 | Zenodo record 13690270(concept DOI 10.5281/zenodo.13690269),restricted,需申请 |
| 宿主会议 | MICCAI 2024(Medical Image Computing and Computer Assisted Intervention 年会) |
| 任务 | Track 1:HIE 病灶分割;Track 2:2 岁神经发育结局二分类预测 |
| 影像模态 | 扩散加权 MRI 衍生图:ADC(表观扩散系数图)与 Z-ADC(标准化图) |
| 发布机构 | Boston Children’s Hospital + Harvard Medical School + Massachusetts General Hospital |
| 核心人物 | Rina Bao(组织者)、Yangming Ou(PI,ORCID 0000-0002-7726-6208)、P. Ellen Grant |
| 资助 | NIH R03HD104891、R21NS121735、R61NS126792 |
| License | Part I:CC BY-NC-ND 2.5;Part II:CC BY-NC-ND 2.0(restricted);GitHub README 另载 CC BY-NC 4.0 口径 |
| 官网 | https://bonbid-hie2024.grand-challenge.org/ |
| 官方 GitHub | https://github.com/baorina/BONBID-HIE-MICCAI-MICCAI2024 |
| 前身 | BONBID-HIE 2023(MICCAI 2023,单一分割任务,官网 https://hiechallenge.github.io/ ) |
| 测试集规模 | Track 1 hidden test N=44;Track 2 hidden test N=53;验证集 N=4(仅 docker 冒烟测试) |
| 下载热度 | Part I 全版本累计 5,177 次下载 / 6,442 次浏览 / 2.9 TB(截至本条目核验日) |
| 本条目 URL | https://www.qianfanghub.com/ai-ready-dataset/bonbid-hie/663 |
§0 导语:这是一份什么样的数据集
BONBID-HIE 2024 是一组围绕「新生儿缺氧缺血性脑病」(Hypoxic-Ischemic Encephalopathy,下文简称 HIE)构建的深度学习挑战赛数据集合称。它并非单一压缩包,而是由三条 Zenodo 记录、两个数据部分(Part I 与 Part II)以及配套的挑战赛基础设施(官网、评估 docker、GitHub 仓库)共同组成的有机整体。主记录发布于 2024 年 4 月 16 日,作为依托 MICCAI 2024 年会举办的第二届 BONBID-HIE 挑战赛的官方数据入口,主记录编号 10978874,DOI 为 10.5281/zenodo.10978874。
这份资源最鲜明的身份标签是「两个第一」:其一,Part I 是首个公开提供新生儿脑损伤专家手工分割标注的数据集——在它出现之前,想做新生儿 HIE 病灶自动分割的研究者几乎没有可用的公开标注数据;其二,它是首个把「围产期影像」与「两年后神经发育结局」放进同一场挑战赛的资源,Track 2 任务直接要求参赛算法从出生早期的扩散 MRI 预测孩子两岁时的发育结局。
理解这份数据集,有三个绕不开的关键词:
- 小而弥散的病灶。HIE 的脑损伤病灶往往体积很小且呈多灶分布,据 Part I 论文(bioRxiv 2023.06.30.546841)统计,超过 50% 的患者病灶体积不足全脑体积的 1%。这与脑肿瘤分割中常见的大块、局灶病灶形成了鲜明对照——官方主记录明确以此为定位差异,提示参赛者不能照搬脑肿瘤分割的技术预期。
- 双任务设计。2024 届把 2023 届的单一分割任务扩展为双赛道:Track 1 沿袭病灶分割(133 例标注数据支撑),Track 2 新增 2 岁神经发育结局预测(237 例两院合并结局数据支撑),后者把「影像即预后」的临床命题直接变成了一个有基准、有 hidden test 的可比较任务。
- 临床纵深。数据背后是波士顿儿童医院(BCH)、哈佛医学院(HMS)与麻省总医院(MGH)二十余年新生儿脑影像临床工作流的沉淀,由 NIH 三项基金(R03HD104891、R21NS121735、R61NS126792)资助,以 3-4 年回溯收集方式整合而成。
对中文使用者而言,本条目同时承担「数据字典」与「避坑指南」两个职能:§3-§6 拆解数据构成、任务定义、标注协议与获取方式;§6.5 集中列出十个高频坑点;§7-§8 还原两届挑战赛的赛制与基准;§10 给出 DAIMS 五维评估与使用建议。
0.1 五分钟速览:谁该用、怎么用
- 如果你做医学图像分割:下载 Part I v3(Zenodo 10602767,免申请、直接下载),用 1ADC_ss 与 2Z_ADC 作输入、3LABEL 作标签,按 Dice/MASD/NSD 三指标评测。注意这是小病灶任务,直接照搬脑肿瘤分割管线大概率水土不服(见坑 8)。
- 如果你做影像组学或预后预测:Part II(Zenodo 13690270)提供 NICU 结局与 2 岁神经认知结局标签,但它是 restricted 资源,需要先在 Zenodo 提交访问申请(见坑 3)。不良结局的判定标准见 §4.3。
- 如果你复现挑战赛成绩:2023 届测试集 BONBID2023_Test.zip 是加密的,密码在挑战赛结束后才公开(见坑 4);2024 届采用 docker 提交制,hidden test 只能在官方服务器上运行,你拿不到测试集本身。
- 如果你引用数据规模:133、237、近 300 三个口径各有出处与含义,混用会被审稿人抓住(见坑 1 与坑 6)。
0.2 两届挑战赛一句话关系
先给出本条目「必答题」的结论,详细论证见 §7.1:**2023 届(第一届,MICCAI 2023)只有单一病灶分割任务,发布的是 Part I 的前身版本(133 例标注数据);2024 届(第二届,MICCAI 2024)将其扩展为「分割 + 结局预测」双任务,分割数据经 Zenodo 版本链(V1→v2→v3)沿用并升级,同时新增 Part II 结局数据(237 例)与 BCH 无标注数据(支持无监督方法开发)。**换言之,2023 届是 2024 届的子集与试点,2024 届是 2023 届的任务扩展与数据增补。
§1 名称、身份与建条结论
1.1 正式名称与缩写拆解
本数据集的正式名称出现在挑战赛主记录与官网首页:
2nd BONBID-HIE Challenge for Lesion Segmentation and Outcome Prediction
(第二届 BONBID-HIE 挑战赛:病灶分割与结局预测)
名称的三个组成部分各自承载信息:
- BONBID:BOston Neonatal Brain Injury Dataset 的缩写,即「波士顿新生儿脑损伤数据集」。这个缩写直接点明了数据的三要素——来源地(波士顿)、人群(新生儿)、内容(脑损伤影像与临床信息)。
- HIE:Hypoxic-Ischemic Encephalopathy,缺氧缺血性脑病。这是围产期窒息导致的脑组织缺氧缺血性损伤,是新生儿急性脑病最主要的病因之一,也是本数据集所有影像与结局数据的临床母题。
- 2024 / 2nd:第二届,依托 MICCAI 2024 年会。第一届(2023)的官网以 GitHub Pages 形式存在(https://hiechallenge.github.io/ ),第二届官网迁移至 grand-challenge.org 平台(https://bonbid-hie2024.grand-challenge.org/ )。
值得注意的是「BONBID-HIE 2024」与「BONBID-HIE 数据集」两个说法的关系:前者指第二届挑战赛这一赛事事件及其官方数据包(主记录 10978874),后者泛指 BCH/HMS/MGH 团队多年来持续构建与发布的新生儿脑损伤数据资源(以 Part I 与 Part II 两条数据记录为载体)。本条目两者兼述,以 2024 届挑战赛为叙事主轴。
1.2 主记录的三重身份
Zenodo 主记录 10978874 在元数据上同时扮演三个角色:
- 挑战赛官方记录:记录类型为 article/dataset 混合,描述文本完整给出了两届挑战赛的背景、任务定义与引用格式,是引用本赛事时的规范锚点。
- 数据导航枢纽:主记录本身不承载大体积数据文件,而是通过描述文本与关联字段指向 Part I(10602767)与 Part II(13690270)两条数据记录。
- 人物与资助的元数据载体:主记录列出了团队信息(项目负责人 Yangming Ou,ORCID 0000-0002-7726-6208)以及实验室受 NIH R03、R61、R21 资助、十余年组织数据的背景说明。一个元数据层面的细节:主记录中第一作者被拼作「Bao, Rino」,而 Part I 记录与全部论文均作「Rina Bao」——这是 Zenodo 元数据的手工录入误差,引用时以论文署名为准(详见坑 9)。
1.3 三条 Zenodo 记录的分工
| 记录 | 编号 | DOI | 角色 | 访问级别 |
|---|---|---|---|---|
| 挑战赛主记录 | 10978874 | 10.5281/zenodo.10978874 | 赛事说明、引用锚点、元数据枢纽 | 开放 |
| Part I(分割数据) | 10602767(v3) | 10.5281/zenodo.10602767 | 133 例 MRI + 专家标注 | 开放,免申请直接下载 |
| Part II(结局数据) | 13690270 | 10.5281/zenodo.13690270 | 237 例 NICU + 2 岁结局 | restricted,需申请 |
需要强调的是,Part I 的 10602767 是版本链中的最新版(v3),它继承自 concept DOI 10.5281/zenodo.8104102 名下的历史版本(详见 §6.1)。Part II 的 concept DOI 为 10.5281/zenodo.13690269,目前只有 v1 一版(2024-09-05 发布)。
1.4 库内查重与建条记录
本条目入库前已执行同名/近似名查重:
SELECT record_id, url_name
FROM ai_ready_dataset
WHERE status = 1 AND url_name ILIKE '%bonbid%';
查询返回 0 行,即库内不存在任何 url_name 含 bonbid 的已发布条目,bonbid-hie 可安全新建。执行时间为本条目核验日(2026-09-27),执行通道为项目统一的 scripts/qf_psql.sh 只读查询。
配套的互链检索(按 brain、MRI、neonatal 等关键词族)返回 32 个候选条目,经筛选确认五个高相关互链对象:FeTS(rid 476)、healthy-brain-network(rid 245)、Medical Segmentation Decathlon(rid 77)、instance2022(rid 645)、fastMRI(rid 23)。互链逻辑详见 §10.1。
1.5 与同域数据集的辨识
避免与以下几类资源混淆:
- BONBID-HIE 2023:第一届赛事资源,任务单一(仅分割),其数据记录与 2024 届 Part I 是同一 concept DOI 下的不同版本,不构成两份独立数据集。
- 通用新生儿脑 MRI 队列(如 dHCP 类发育队列):那些队列以正常发育或多种病理混合为主,不含专家病灶标注,也不与长期结局绑定;BONBID-HIE 的每一例都是确诊或高度疑似的 HIE 患儿,且 Part I 逐例带分割标注。
- 脑肿瘤分割数据集(如 BraTS、FeTS):任务形态相似(病灶分割挑战赛),但病灶形态学、影像序列(T1/T2/FLAIR 对比 ADC/Z-ADC)与人群(成人肿瘤患者对比新生儿 HIE)均不同,方法不可直接迁移。
§2 临床背景:为什么 HIE 值得一个专属数据集
2.1 HIE 的流行病学与疾病负担
缺氧缺血性脑病是围产期窒息的直接后果:胎儿或新生儿在出生前后经历缺氧与脑血流灌注不足,脑组织发生选择性易损区坏死、弥散受限等一系列病理改变。按 Part I 论文的口径,HIE 在足月儿中的发生率约为 1~5/1000;而挑战赛主记录的表述为「影响约 0.5% 的新生儿」。两个口径并不矛盾——前者是足月儿人群的发病率区间,后者是全部新生儿(含早产儿)的粗略占比——但引用时须注明出处与口径(见坑 1 的姊妹坑:流行率双口径)。
HIE 的严重性在于其结局谱系的宽与重。依据挑战赛与 Part II 论文的表述,中重度 HIE 患儿出现不良神经发育结局的比例在 30%-50%(arXiv 2411.03456 口径)或 35%-50%(Zenodo 主记录口径)之间,不良结局涵盖认知/运动/语言发育迟缓、脑瘫、视听障碍乃至死亡。这意味着每一年都有数量可观的患儿家庭需要在出生后数日内面对高度不确定的预后判断。
2.2 治疗现状与预后判断的临床困境
HIE 的标准治疗是治疗性亚低温(therapeutic hypothermia),即在出生后 6 小时内将患儿体温降至 33-34 摄氏度并维持约 72 小时。这一疗法的多中心 RCT 证据可追溯至 2005 年《新英格兰医学杂志》的里程碑研究——而这项研究的牵头人 Seetha Shankaran 医生,后来正是 BONBID-HIE 2023 届 workshop 的受邀专家,这条人物线索从侧面印证了数据集团队与临床试验传统之间的传承关系。
然而亚低温只对部分患儿有效,治疗后仍有约四成患儿遗留不良结局。临床面临的核心困境是预后判断的时间窗:
- 临床体征(意识状态、肌张力、惊厥)在生后早期高度不稳定;
- 传统 MRI 序列(T1/T2)在急性期的病灶显示能力有限;
- 而预后决策(是否升级生命支持、如何安排康复随访)却必须尽早做出。
扩散加权 MRI 衍生的 ADC 图(表观扩散系数图)因对急性缺氧缺血损伤高度敏感,成为这一窗口内最有价值的定量影像标志物。问题在于:ADC 值的判读高度依赖经验,而全世界有经验的新生儿神经影像专家数量远不能满足需求——这正是把「专家判读」转化为「可计算问题」的临床原动力。
2.3 影像标志物与 AI 的机会窗口
ADC 图在 HIE 中的价值有两条互补的利用路径,恰好对应 2024 届挑战赛的两个赛道:
- 路径一:把 ADC 图上的病灶画出来(Track 1,分割)。自动分割的价值不止于省人力:分割得到的病灶体积、分布等定量特征本身即是预后预测的中间变量。但如 §2.4 所述,HIE 病灶的「小而弥散」形态使这一任务的技术难度与常规分割任务不可同日而语。
- 路径二:把 ADC 图直接映射到结局(Track 2,结局预测)。跳过中间的分割步骤,让模型端到端地从生后早期影像预测 2 岁神经发育结局。这条路径的挑战在于标签维度:结局标签是人群水平的稀疏监督信号,237 例样本要支撑一个泛化良好的预测模型并不宽裕。
两条路径共享同一套输入表示——去颅骨的 ADC 图(1ADC_ss)与 Z-ADC 图(2Z_ADC)。官方选择只发布衍生图而非原始 DICOM,既是去标识化的需要,也统一了输入分布,这个设计选择的影响见 §5.3 与坑 7。
2.4 二十年临床工作流的沉淀
主记录描述文本给出了这条数据的纵深:团队实验室受 NIH R03、R61、R21 三项基金持续资助,十余年致力于新生儿脑损伤数据的组织工作;数据集整体依托 20 年临床工作流,以 3-4 年回溯收集的方式整合 MGH 与 BCH 两家三级医疗中心的 NICU 资源。落到具体的患者编号上,文件名前缀 MGHNICU_xxx 清晰地标记了数据来源院系。
这种「临床工作流内生」的数据生产方式带来了两个直接后果。第一,数据质量与临床真实性高度绑定:扫描协议、随访安排、结局评估都嵌入在真实诊疗流程中,而非为研究目的单独定制。第二,数据的积累速度受制于临床节奏:HIE 本身是相对低发的急症(见 §2.1),一家中心一年能纳入的合格病例有限,这解释了为什么两届挑战赛、四个版本的迭代之后,标注数据的规模仍停留在「百」量级——也解释了为什么 2024 届要引入无标注数据与无监督方法的赛道空间(见 §3.3)。
2.5 从 2023 到 2024:任务扩展的临床逻辑
把两届挑战赛的任务演进放回临床语境,扩展逻辑一目了然:
- 2023 届解决的是「有没有」的问题:发布首个公开标注数据集,让 HIE 分割这个领域从无到有,并验证社区方法在 Dice/MASD/NSD 指标下的基准水位。
- 2024 届解决的是「有没有用」的问题:分割只是中间步骤,临床真正关心的是「这个孩子两年后会不会正常走路、说话、上学」。新增的 Track 2 直接以 2 岁结局为目标函数,把整场挑战赛的意义锚定在长期预后上。
这一演进与 Part II 论文(arXiv 2411.03456)的发表节奏互为表里:Part II 数据于 2024 年 9 月 5 日发布(restricted),论文于 2024 年 11 月挂出 arXiv(2411.03456),为 Track 2 提供了方法学与结局定义的正式文献支撑。
§3 数据构成:Part I 与 Part II 的完整拆解
3.1 Part I:分割数据集(133 例)
Part I 是整个 BONBID-HIE 体系的基石,其正式名称见 Part I 论文标题:BOston Neonatal Brain Injury Dataset for Hypoxic Ischemic Encephalopathy (BONBID-HIE): Part I. MRI and Manual Lesion Annotation(bioRxiv 2023.06.30.546841,2023 年 6 月 30 日挂出预印本)。
核心构成:
- 样本量:133 例 HIE 患儿的脑扩散 MRI,每一例均附带神经放射专家的手工病灶标注。论文摘要明确将其定位为「首个公开的新生儿脑扩散 MRI 与专家病灶标注数据集」。
- 数据来源:MGH NICU(文件名前缀
MGHNICU_可证);2024 届新增的 BCH 无标注数据作为补充通道(见 §3.3)。 - 影像内容:只发布扩散加权的衍生定量图,不含 T1/T2 等常规序列——输入空间被刻意收窄到 ADC 与 Z-ADC 两个通道。
- 标注内容:二值病灶掩膜(3LABEL),由专家在 ADC/Z-ADC 图上逐层勾画。
- 数据分割:官方划分 Train(训练)/ Val(验证)/ Test(测试)三个子集,其中 2023 届测试集为加密发布(见坑 4),2024 届 hidden test 则完全不落地(见 §7.3)。
Part I v3(record 10602767)的实际文件清单与体积如下(Zenodo Files 页数据):
| 文件 | 体积 | 说明 |
|---|---|---|
| BONBID2023_Train.zip | 56.3 MB | 训练子集(影像 + 标注) |
| BONBID2023_Test.zip | 27.3 MB | 2023 届测试子集,加密 |
| BONBID2023_Val.zip | 1.1 MB | 验证子集 |
| atlases.tar.gz | 583.7 kB | 正常脑与病灶概率图谱 |
| Readme | 507 B | 说明文件 |
几个值得注意的观察:其一,全部数据加起来不足 100 MB——这是因为发布的是 2D/3D 衍生 ADC 图而非原始 DICOM 序列,单例体积极小;其二,Val 子集只有 1.1 MB,官方在 2024 届官网数据页注明验证集仅 N=4,且只用于 docker 冒烟测试、不计入排名(见 §7.3);其三,atlases.tar.gz 里的图谱是 Z-ADC 标准化流程的参照物,做无监督方法开发的参赛者离不开它。
截至本条目核验日,Part I 记录(concept DOI 10.5281/zenodo.8104102 名下全部版本)累计获得 5,177 次下载、6,442 次浏览、2.9 TB 总下载流量。对一个百 MB 量级的专科数据集而言,这一热度在同领域中相当突出,也从侧面反映了 HIE 分割数据的历史稀缺。
3.2 Part II:结局数据集(237 例)
Part II 的正式文献载体是论文 BOston Neonatal Brain Injury Data for Hypoxic Ischemic Encephalopathy (BONBID-HIE): II. 2-year Neurocognitive Outcome and NICU Outcome(arXiv 2411.03456,2024 年 11 月)。其核心事实:
- 样本量:237 例,论文摘要明确标注为「second release … 237 patients」。这是 MGH 与 BCH 两院合并的队列规模。
- 标签构成:每例患者携带两类结局字段——NICU outcome(出院时的临床状态)与 2-year outcome(两岁神经认知结局)。
- 2 岁结局的判定依据:Bayley-III 婴幼儿发育量表各域分数、GMFCS 粗大运动功能分级、视听状态与生存状态(详见 §4.3)。
- 访问级别:Zenodo record 13690270 的
access_right字段为 restricted——页面可见、元数据可读,但文件列表为空,需提交访问申请获批后才能下载。 - 热度:即便受限,截至核验日仍累计 355 次下载、1,908 次浏览,说明申请-获批通道的实际流通量并不低。
Part II 与 Part I 的关系需要精确表述:两者是同一患者生态系的不同标签平面,但样本集并不等同——Part I 的 133 例是「有影像 + 有标注」的子集,Part II 的 237 例是「有结局随访」的两院合并集合。做 Track 2 结局预测时,训练数据来自 Part II 中带结局标签的子集;做 Track 1 分割时,训练数据来自 Part I 的 133 例。官方并未公布两集合的患者 ID 交集规模,引用时不要自行假设「237 包含 133」或两者互斥(见坑 10)。
3.3 无标注 BCH 数据(2024 届新增)
2024 届挑战赛在官网数据页明确新增了来自 BCH 的无标注影像数据。其设计意图写在赛制里:Track 1 允许监督、半监督、无监督任意方法,而无标注数据的加入,为参赛者提供了在 133 例标注样本之外做自监督预训练、伪标签或分布适配的合法原料。
这一设计回应的是 HIE 分割的真实困境:标注数据永远稀缺( expert 级逐层勾画的成本极高),而无标注扫描在临床 PACS 中俯拾皆是。把「能否善用无标注数据」纳入竞赛维度,是 2024 届相对于 2023 届在方法论导向上的一个静默但重要的转向。
3.4 样本数三口径对照表
「这个数据集到底有多少例」是引用中最容易出错的地方,三个口径各有严格出处:
| 口径 | 数字 | 出处 | 语义 |
|---|---|---|---|
| Part I 分割子集 | 133 | bioRxiv 摘要;Zenodo 10602767 描述 | 有影像 + 有专家标注的例数 |
| Part II 结局队列 | 237 | arXiv 2411.03456 摘要(second release) | 两院合并、有 NICU/2 岁结局随访的例数 |
| 宣传口径 | 近 300 | Zenodo 10978874 主记录描述(nearly 300 samples) | 两部分数据的总体宣传规模 |
本条目的处理原则:正文与元数据以 133/237 为准,「近 300」只作存照与背景表述。原因有二:第一,133 与 237 各自有正式论文背书,可核查、可引用;第二,「近 300」是主记录描述中的模糊量词,既无法拆分到具体任务,也无法排除两集合间的患者重叠。凡在对比表、元数据 patient_count 等结构化位置,一律填 237(数据集覆盖的患者总数上限)并附口径说明。
3.5 每患者文件结构
Part I 数据包内的每例患者目录遵循固定命名规范。以 MGH 来源、编号 001、第一次访视为例(依据 bioRxiv 全文 Figure 6 与 Zenodo 包内实际文件名):
MGHNICU_001-VISIT_01/
├── 0ADC_MGHNICU_001-VISIT_01-ADC_defaced.nii.gz
│ (0ADC:原始 ADC 图,已去面部识别特征)
├── 1ADC_ss_MGHNICU_001-VISIT_01-ADC_defaced.nii.gz
│ (1ADC_ss:去颅骨 ADC 图, skull-stripped,任务主输入之一)
├── 2Z_ADC_Zmap_MGHNICU_001-VISIT_01-ADC_smooth2mm_clipped10.nii.gz
│ (2Z_ADC:Z-score 标准化 ADC 图,平滑 2mm、截断处理,任务主输入之二)
├── 3LABEL_MGHNICU_001-VISIT_01-ADC_defaced.nii.gz
│ (3LABEL:专家二值病灶标注掩膜)
├── clinical_data.xlsx
│ (临床变量表:胎龄、窒息指标、治疗信息等)
├── Readme
└── License
命名规则的四个要点:
- 数字前缀即处理管线序号:0ADC→1ADC_ss→2Z_ADC→3LABEL 构成从原始图到任务就绪数据的递进序列,参赛者可按需选取输入层级。
-defaced后缀是去标识化承诺:所有影像在发布前已移除面部解剖特征(面部是 MRI 中最主要的再识别风险点)。- Z-ADC 文件名内嵌处理参数:
smooth2mm_clipped10表明该图经过 2mm 平滑与截断处理,标准化参照即 atlases.tar.gz 中的正常图谱。 - 输出格式为
.mha/.nii.gz:分割提交要求输出二值掩膜(*.mha),与 ITK/MedPy 生态兼容。
3.6 图谱与辅助资源
atlases.tar.gz(583.7 kB)解压后包含正常脑 ADC 图谱与病灶概率图谱两类参照物,其用途有二:一是 Z-ADC 标准化的统计学基础(每个体素的 Z 值 = 相对正常图谱同位置分布的偏离程度);二是无监督方法的先验来源——病灶在 Z-ADC 空间中的位置与幅度天然带有「偏离正常即可疑」的先验语义,这是 HIE 影像区别于其他病理分割任务的独特便利。
2024 届官方 GitHub 仓库(baorina/BONBID-HIE-MICCAI-MICCAI2024)按 lesionseg 与 outcomepred 两个目录组织代码资源,前者提供 Track 1 的基线与评估工具,后者提供 Track 2 的相应工具;2023 届仓库(baorina/BONBID-HIE-MICCAI2023)则保留了评估 docker(bonbidhie_eval)与算法示例 docker 的历史版本。
§4 双任务定义:Track 1 与 Track 2
4.1 Track 1:HIE 病灶分割
任务形式化:给定单例患者的 1ADC_ss(去颅骨 ADC)与/或 2Z_ADC(Z-ADC 标准化图),输出同尺寸的二值病灶掩膜(*.mha),逐体素预测「异常弥散受限区域」。评价指标为 Dice、MASD、NSD 三件套(见 §4.4)。
方法自由度:官网规则明确允许监督、半监督、无监督任意范式。这是 2024 届的一个显著放宽——配合 §3.3 的无标注 BCH 数据,纯自监督路线(自编码器预训练 + 少量标注微调、基于图谱先验的异常检测、伪标签自训练等)都被纳入合法空间。
与 2023 届的关系:任务定义连续,输入输出规范一致;变化在于数据规模(沿用 Part I 版本链最新版)与无标注数据的加入。2023 届的参赛经验(14 个算法、120 个研究组下载,见 §8.1)通过 IEEE TMI 总结论文(DOI 10.1109/TMI.2025.3638977)沉淀为社区基准。
技术难点定位:官方主记录用一段非常直白的文字为这个任务定调——HIE 分割是小而弥散病灶任务,与脑肿瘤等大而局灶的病灶任务(后者 Dice 普遍可达 0.8 以上)本质不同。超过 50% 的患者病灶不足全脑体积 1%,意味着:
- 逐体素的类别极度不平衡,朴素交叉熵会被背景淹没;
- Dice 对小目标的数值波动剧烈,几枚体素的增减即可改变名次;
- 边界类指标(MASD/NSD)在细碎病灶上的分辨力高于区域重叠指标;
- 经典的「大感受野 + 深监督」肿瘤分割配方未必最优,多尺度与小目标敏感设计更关键。
4.2 Track 2:2 岁神经发育结局预测
任务形式化:给定 HIE 患儿生后早期的 ADC/Z-ADC 影像,输出二分类标签——1 = adverse(不良结局),0 = normal(正常结局)。这是 2024 届新增赛道,也是整个赛事最具临床野心的部分:它把「影像即预后」这一命题变成了有统一基准、有 hidden test、有公开排名的可比较任务。
训练数据:来自 Part II 中带结局标签的子集(两院合并队列的一部分;官网未单独公布 Track 2 训练集的确切例数,成稿以 237 为队列上限并注明其为两院合计口径,见 FACTS 待核项)。
与 Track 1 的技术分野:Track 2 的监督信号是「一人一标签」的弱监督——没有逐体素的病灶位置信息,模型必须自己学会「看哪里」。这使得 Track 2 天然适合影像组学特征 + 浅层分类器、弱监督定位、多实例学习等方法族,与 Track 1 的密集预测方法族形成互补。两赛道共用输入表示但方法论几乎正交,这正是官方拆成两个 track 而非一个多任务赛道的原因。
4.3 不良结局的临床定义
Track 2 的标签定义并非主办方自定义,而是沿用美国 NRN(Neonatal Research Network,新生儿研究协作网)推荐的不良结局判定标准。依据 Part II 论文(arXiv 2411.03456),符合以下任一条件即记为不良结局(1):
- Bayley-III 量表任一域分数 < 85:Bayley Scales of Infant and Toddler Development, Third Edition 覆盖认知、语言(表达与理解)、运动(粗大与精细)等域,任一域低于均值一个标准差即触发;
- GMFCS 分级 2-5 级:粗大运动功能分类系统(Gross Motor Function Classification System)2 级及以上,对应不同程度的脑瘫相关运动受限;
- 失明或听力障碍:感觉通道的永久性损伤单独构成不良结局;
- 2 岁随访前死亡:死亡直接计为不良结局。
全部条件均不满足(Bayley-III 各域 ≥85、GMFCS 1 级、视听正常、随访期存活)记为正常结局(0)。
这一定义的两点解读:其一,它把「死亡并入不良结局」处理为序联最重的等级,避免了幸存者偏差对标签分布的扭曲;其二,「任一域 <85」的并集逻辑使不良标签的灵敏度优先于特异度——这是儿科随访研究的主流保守取向。使用者在构建自己的二分类或多分类变体时,若改变这套定义,须在论文中显式声明并与 NRN 口径做敏感性对照,否则与挑战赛基准不可比。
4.4 评价指标体系
Track 1 三指标(依据 LNCS 14567 参赛论文与 2023 届评估 docker 的公开设定):
| 指标 | 全称 | 度量对象 | 对小病灶的敏感度 |
|---|---|---|---|
| Dice | Dice Similarity Coefficient | 预测与标注的体素重叠度(2 倍交集除以体积和) | 高波动:小目标下对零星误差极敏感 |
| MASD | Mean Average Surface Distance | 分割边界间的平均对称表面距离 | 中:以距离缓和体素级抖动 |
| NSD | Normalized Surface Distance | 边界距离落在容差内的表面比例(归一化) | 高:边界质量导向,官方排名主指标之一 |
三者的组合逻辑清晰:Dice 给出全局重叠水位,MASD 惩罚大尺度边界偏离,NSD 以容差带刻画边界精细度。官方排名同时参考三项,参赛论文(如密苏里大学队,见 §8.2)也以三项全面占优作为方法有效性的论证方式。
Track 2 指标:二分类标准指标族(官方评估 docker 内实现),包括 AUROC、准确率、敏感度/特异度等;由于不良结局在队列中占比接近半数(30%-50% 量级,见 §2.1),类别失衡程度远轻于常规疾病预测任务,指标选择的空间比 Track 1 宽松。
指标谱系的出处可上溯至 Dice 的 1945 年原始论文——主记录的参考文献区直接引用了 Dice 1945 与表面距离类指标的原始文献,这种「指标考古」式的引用在挑战赛数据集中并不多见,也从侧面反映了组织方对评估严谨性的自我要求。
4.5 提交与评估的工程形态
两届挑战赛共享同一套工程哲学:算法不下载数据,数据不下台。
- 参赛者向组织方提交打包为 docker 镜像的推理算法;
- 官方服务器在 hidden test set(Track 1 N=44、Track 2 N=53)上运行镜像并产出结果;
- 评估 docker(bonbidhie_eval)执行指标计算并生成排名。
这套设计(grand-challenge.org 平台的标准能力)保证了 hidden test 的隐藏性,同时把环境依赖的适配成本转移给了参赛者——docker 冒烟测试(Val 集 N=4)正是为此设置的安全阀。参赛合规细节与两个容易踩中的规则坑(附加输出要求、获奖开源要求)见 §7.4 与坑 5。
(Part 2 完,接 Part 3)
§5 标注协议与数据质量
5.1 专家手工标注的来源与地位
Part I 的每一份 3LABEL 掩膜都出自神经放射专家在 ADC/Z-ADC 图上的逐层手工勾画。这份标注的历史地位需要放在领域背景中理解:在 BONBID-HIE Part I 发布(2023 年 7 月,Zenodo V1)之前,新生儿 HIE 的分割研究几乎只能在私有数据上进行,公开基准的缺席使方法之间不可比较、进展不可积累。Part I 论文摘要明确以「首个公开的新生儿脑扩散 MRI 与专家病灶标注数据集」自任,这一「第一」的含金量是整份数据集被反复引用的核心理由。
标注对象是「弥散受限异常区域」而非某种特定病理亚型。HIE 的损伤谱系包括皮层与皮层下弥散受限、基底节/丘脑选择性易损、分水岭分布损伤等多种形态,专家勾画时遵循的是影像学上的异常信号判读标准,而非单一病理实体的解剖学定义。使用者若想把标签用于病灶亚型分类,需要在标注协议之外自行引入额外的形态学规则——这是数据集的能力边界,不是标注缺陷。
5.2 病灶形态学:小、散、多变
Part I 论文给出的描述性统计(摘要与正文)勾勒了这套标注的形态学画像:
- 体积分布极端偏斜:超过 50% 的患者,病灶总体积不足全脑体积的 1%。极端个案中,病灶仅以数枚小灶的形式散在于易损区。
- 多灶性:HIE 病灶常沿血管分水岭、皮层脊髓束敏感区等解剖逻辑多灶分布,单一大块病灶反而是少数。
- Z-ADC 空间中的高对比:经图谱标准化后,病灶在 Z-ADC 图上表现为显著的偏离正常分布的亮区/暗区,这为阈值化与异常检测类方法提供了先验抓手。
对标注质量的实际影响有三:其一,小病灶的标注边界天然带有更高的观察者间变异(体素级的取舍),复现研究时应预期标注噪声下限高于脑肿瘤等大病灶数据集;其二,1% 量级的病灶体积比意味着任何以「像素数」为分母的损失函数都需要重新配平;其三,官方选择同时发布 ADC 与 Z-ADC 两个层级的输入,实质上是承认了「原始强度域」与「标准化域」方法路线的并存——有的方法吃原始 ADC 的绝对值信息,有的方法吃 Z 值的相对偏离信息。
5.3 去标识化与伦理处理
所有发布影像均经过 defaced(去面部) 处理,文件名中的 -defaced 后缀即为此承诺的物证。面部是 MRI 数据再识别的最大风险源,对儿科数据尤甚;去面部处理在扩散衍生图上执行,同时保留了脑实质区域的定量完整性。
临床变量(clinical_data.xlsx)与结局标签(Part II)以独立文件与影像分离,访问级别也做了分级:影像标注完全开放,结局数据 restricted。这种「数据分层 + 访问分级」的安排是敏感儿科队列数据的常见合规范式——影像本身经去标识化后风险较低,而连接「影像-身份-长期结局」的完整链条则须通过申请审核来管控。
需要说明的是,本条目基于公开可得的记录与论文撰写,患者层面的伦理审批细节(IRB 编号、知情同意的具体模式)以论文与 Zenodo 记录中的正式表述为准,本条目不作转述性推断。
5.4 已知的数据质量局限
综合论文、主记录与官网信息,可确认的局限清单如下(与 frontmatter 的 rai:dataLimitations 一致):
- 样本量天花板:133 例标注数据对深度模型而言仍属小样本,五折交叉验证等重采样策略是论文生态的标配而非可选项。
- 单区域两中心:MGH 与 BCH 均为美国东北部三级医疗中心,扫描设备、协议与人群构成的外推性未经验证。
- 衍生图而非原始序列:只发布 ADC/Z-ADC 意味着无法基于原始 DWI 重算 b 值组合、无法做多序列融合,也锁死了输入分辨率的上限。
- 结局随访的完整性依赖:2 岁结局依赖家庭随访配合,失访机制若与病情相关(病重失访或康复良好不再复查),会给标签分布引入难以度量的偏倚。
- 标注的单专家性质:公开材料未提供多标注者一致性数据(如 Dice between raters),观察者间变异只能通过小病灶任务的天然波动间接感知。
这些局限不影响数据集在「公开基准」意义上的价值,但决定了结论的适用边界——在论文的 limitations 章节如实引用这五条,几乎是使用本数据的道德义务。
§6 获取方式、版本链与 License
6.1 Zenodo 版本链全景
BONBID-HIE 的发布史是一条清晰的版本链,两届挑战赛的数据在这条链上无缝衔接:
Part I 链(concept DOI 10.5281/zenodo.8104102):
| 版本 | Record | 发布时间 | 事件 |
|---|---|---|---|
| V1 | 8104103 | 2023-07-01 | 第一届(MICCAI 2023)训练数据发布,注册开放 |
| v2 | 10045994 | 2023-12-01 | 第一届赛后修订 |
| v3 | 10602767 | created 2024-02-01 | 当前推荐版本,官网数据页注明「请下载 v3,完全开放、无需申请」 |
Part II 链(concept DOI 10.5281/zenodo.13690269):
| 版本 | Record | 发布时间 | 事件 |
|---|---|---|---|
| v1 | 13690270 | 2024-09-05 | 第二届 Track 2 结局数据发布(restricted) |
主记录:10978874(v1,2024-04-16),赛事说明与元数据枢纽,不承载大文件。
三个版本相关的实操结论:
- 引用数据时引 concept DOI(8104102 / 13690269)可保证跨版本可解析,引具体 record(10602767)则锁定版本,两种引用姿势各有场景,论文中建议显式写明所用版本。
- 2023 届测试集(BONBID2023_Test.zip)随 V1/v2 一路加密,密码在挑战赛结束后于官网数据页公开——这是「赛后公开」机制的第一处物证。
- 2024 届的训练数据发布日期在官网数据页经历了三次改期(8/15 → 9/1 → 9/6),最终与 Part II 数据(9/5)几乎同步落地;引用「训练数据发布时间」时应以「2024 年 9 月初」为最终口径(见坑 2 的日期坑)。
6.2 获取途径清单
| 途径 | 对象 | 门槛 | 入口 |
|---|---|---|---|
| Zenodo 直接下载 | Part I v3 全部文件 | 无需申请、无需登录 | https://zenodo.org/records/10602767 |
| Zenodo 访问申请 | Part II 结局数据 | 提交申请、等待获批 | https://zenodo.org/records/13690270 |
| GitHub 开源代码 | 评估 docker、基线与示例算法 | 无 | https://github.com/baorina/BONBID-HIE-MICCAI-MICCAI2024 与 BONBID-HIE-MICCAI-MICCAI2023 |
| 挑战赛平台 | 参赛、提交 docker、查看排名 | 注册 grand-challenge.org 账号 | https://bonbid-hie2024.grand-challenge.org/ |
| 联系组织方 | 合作、数据问题 | 邮件 | Rina.Bao@childrens.harvard.edu / Yangming.Ou@childrens.harvard.edu |
2023 届官网(https://hiechallenge.github.io/ )仍保留第一届的完整时间线、workshop 信息(含 Seetha Shankaran 受邀报告)与重要日期表,是研究两届沿革的一手资料。
6.3 License 三口径存照
本数据集的许可信息存在三处口径不一致,这是核验过程中确认的重要事实,成稿全部如实存照:
| 来源 | 位置 | 口径 |
|---|---|---|
| Zenodo 10602767(Part I) | Rights 字段(页面图标与文本) | CC BY-NC-ND 2.5 Generic |
| bioRxiv Part I 论文 | 全文许可声明 | CC BY-NC-ND 2.0(指向 creativecommons.org/licenses/by-nc-nd/2.0/) |
| Zenodo 13690270(Part II) | API license 字段 | cc-by-nc-nd-2.0(且 access_right=restricted) |
| GitHub README(2023/2024 两仓库) | 使用条款段落 | CC BY-NC 4.0(allowing academic use with credit, prohibiting commercial use) |
四条记录、三种版本号、两个许可族(ND 与非 ND)。本条目的采信策略:
- 数据文件本身以 Zenodo 各记录的 Rights 字段为准——Part I 按 CC BY-NC-ND 2.5,Part II 按 CC BY-NC-ND 2.0。Zenodo 是数据的法定发布渠道,其记录内嵌的许可声明优先级最高。
- 代码与 docker以 GitHub README 口径(CC BY-NC 4.0)为准。
- 跨口径的共识层可以安全概括为三句:禁止商业使用(NC,四处一致);引用须署名(BY,四处一致);ND(禁止演绎/分发衍生版本)在 Zenodo 与 bioRxiv 口径中存在、在 README 口径中未强调——对数据文件保守处理为含 ND,对代码按其 README 实际文本执行。
实务提醒:若你的使用场景涉及再分发修改版数据(如重采样、裁剪后的教学版),ND 条款构成实质障碍,应先联系组织方书面确认;若只是下载后在论文与模型训练中使用并署名引用,四个口径下都没有争议。
6.4 使用合规速查清单
- 论文与产品中引用主记录 DOI 10.5281/zenodo.10978874,数据另引对应 Part 记录;
- 不将数据或其衍生用于商业用途;
- Part II 只经申请通道获取,不通过任何二次分发渠道转手;
- 尊重挑战赛附加规则:参赛提交须附「不使用预训练/公开数据」的附加输出(见 §7.4),获奖队伍须开源代码;
- 引用样本数时核对 §3.4 的三口径表,不写「约 300 例患者」这类混进口径的表述;
- 二次分析报告指标时保留 Dice/MASD/NSD 三件套,不要只报单一 Dice 与官方排名对照。
§6.5 坑点清单:十个高频坑
以下坑点按「核验过程中确认的真实出入」与「赛制规则里的隐形门槛」两类组织,编号全局连续。
坑 1:样本数三口径混用
133(Part I)、237(Part II)、近 300(主记录宣传)三个数字在公开材料中并存,混用的典型事故现场是:综述表格里写「BONBID-HIE 包含近 300 例标注数据」——错了两处:300 是宣传口径而非精确数,且标注数据只有 133 例。正确姿势见 §3.4 对照表;结构化字段(数据库、对比表)一律用 133/237 并注明语义。
坑 2:日期口径漂移
三个时间点各有口径陷阱:训练数据发布日(官网改期三次 8/15→9/1→9/6,最终落地 9 月初);Part I v3 的 Zenodo created 日期(2024-02-01)与官网指引上线时间不同步;主记录发布日(2024-04-16)容易与数据就绪日(9 月初)混淆——4 月发布的是「赛事与元数据」,9 月才是训练数据全量可用的时点。写时间线时逐点核对本条目 §6.1 与 §7.5。
坑 3:把 Part II 当公开数据直接下载
Part II 的 Zenodo 页面元数据完全公开(描述、统计、license 可见),但 access_right=restricted、API 文件列表为空。直接 zenodo_get 13690270 只会得到空目录。必须走页面上的 access request 通道;申请获批前,任何「文件清单」类描述都无法核验(本条目 accordingly 不写 Part II 文件大小,见 FACTS 待核项)。
坑 4:2023 届测试集加密
BONBID2023_Test.zip(27.3 MB)是加密的,密码在 2023 挑战赛结束后才于官网公开。历史脚本里对该 zip 直接 unzip 会失败;如果你的复现流程沿用老版本 Readme,注意密码获取步骤。2024 届则更进一步——hidden test 完全不发布,只有官方服务器能跑。
坑 5:用了旧版数据还不知道
Part I 有 V1(8104103)→ v2(10045994)→ v3(10602767)三个版本。老教程、旧仓库的下载链接可能仍指向 V1/v2;官网数据页明确指引使用 v3。v2→v3 之间的修订内容未逐条公告,复现 2023 届成绩时若强求与当时参赛者完全同分布,需要锁定当时的版本号;做新研究则一律 v3 起步。
坑 6:把宣传口径写进正式文本
「nearly 300 samples」只出现在主记录描述里,属宣传量词。在任何需要精确性的场合(论文表格、数据卡、对比实验)引用它都会被同行评审抓住。同理,「20 年临床工作流」是工作流历史长度,不是数据时间跨度——数据本身以 3-4 年回溯收集为主(见 §2.4)。
坑 7:混淆两届的任务范围
2023 届只有分割任务;结局预测是 2024 届新增。反方向同样危险:2024 届官方数据页的部分表述沿用了 2023 届的数据组织方式,读者容易误以为「237 例都有分割标注」——错,标注只随 Part I 的 133 例发布。引用任何一届的「任务 + 数据」组合时,先查届别再查部分。
坑 8:照搬脑肿瘤分割的预期与管线
官方主记录的定位表述值得逐字读:HIE 是小而弥散病灶任务,脑肿瘤是大而局灶任务(后者 Dice ≥0.8 是常态)。把 BraTS 赛道上的冠军配方原样搬来,在 Track 1 上可能连 NSD 的容差带都进不了。正确预期:小目标敏感的多尺度设计、Z-ADC 先验的显式利用、对 1% 病灶比的损失配平,以及「Dice 数值整体显著低于脑肿瘤赛道是正常现象」的心理建设。
坑 9:作者名拼写误差
Zenodo 主记录中第一作者写作「Bao, Rino」,而 Part I 记录与全部论文均为「Rina Bao」。这是元数据手工录入误差。引用与致谢以论文署名为准;若你的文献管理工具从 Zenodo 抓取元数据,注意手动修正,别让「Rino Bao」流入参考文献表。
坑 10:假设 Part I 与 Part II 的患者集合关系
「237 是否包含 133」「两集合交集多大」——官方材料均未公布,本条目核验过程亦无法确认。做联合建模(影像 + 结局)时,只能使用两集合的显式字段,不能自行假设任何 ID 映射;确有需要时联系组织方(§6.2 邮箱)。同理,Track 2 训练集的确切例数官网未单独公布,237 是两院合计的队列上限,写作与建模时都按「上限」而非「精确训练集大小」处理。
(Part 3 完,接 Part 4)
§7 挑战赛设计与赛制:两届沿革全景
7.1 必答:2023 届与 2024 届的版本关系
本条目按核验纪律对「两届关系」做了三源交叉核验(官网两代、Zenodo 记录链、论文链),结论如下,与任务简报中的任何预置说法无关,全部以可点开的原始来源为准:
核心结论:2023 届是数据试点,2024 届是任务扩展;分割数据经 Zenodo 版本链沿用,结局数据为 2024 届全新增量。
分四个维度陈述证据:
维度一:任务范围
- 2023 届(官网 hiechallenge.github.io,第一届)只设单一病灶分割任务。其名称、任务页与提交说明均不含结局预测。
- 2024 届(官网 bonbid-hie2024.grand-challenge.org)扩展为双任务:Track 1 病灶分割 + Track 2 两年神经发育结局预测。主记录标题「Lesion Segmentation and Outcome Prediction」即是明证。
维度二:分割数据的血缘
- 2023 届训练数据以 Zenodo V1(record 8104103,2023-07-01)首发,与 Part I 论文(bioRxiv 2023.06.30.546841,2023-06-30 挂出)互为表里;
- 该数据经 v2(10045994,2023-12-01)修订,再以 v3(10602767,created 2024-02-01)延续至 2024 届——官网 2024 数据页直接指引「请下载 v3」。三个版本同属 concept DOI 10.5281/zenodo.8104102,血缘关系由 Zenodo 版本机制背书。
- 换言之:2024 届的分割数据不是新采集,而是同一条数据链的最新版。
维度三:结局数据的增量
- Part II(record 13690270,2024-09-05)在 2023 届的所有材料中不存在,其论文(arXiv 2411.03456,2024-11)自述为「second release … 237 patients」;
- 237 例来自 MGH 与 BCH 两院合并,含 NICU 结局与 2 岁神经认知结局,专为 Track 2 服务;
- 同时 2024 届新增 BCH 无标注影像数据,明确服务于 Track 1 的无监督方法开发——这也是 2023 届所没有的。
维度四:赛制基建
- 2023 届:数据下载 + 算法提交,评估 docker 开源(bonbidhie_eval),赛果以 14 个算法的排名与 IEEE TMI 总结论文(DOI 10.1109/TMI.2025.3638977)收束;
- 2024 届:全面 docker 提交制 + hidden test(Track 1 N=44 / Track 2 N=53)+ 附加合规输出 + 获奖开源要求,基建在 grand-challenge.org 平台上完成升级。
一句话总结:想理解 BONBID-HIE 2024,就把它读作「2023 那份 133 例分割数据集的 v3 版 + 一份 237 例的结局新数据 + 一套更严格的 docker 赛制」的组合体。
7.2 2023 届:从数据发布到 workshop 的完整时间线
2023 届的关键节点(全部有源,来源:hiechallenge.github.io 重要日期表与 Zenodo 记录):
| 日期 | 事件 |
|---|---|
| 2023-06-30 | Part I 论文预印本挂出(bioRxiv 2023.06.30.546841) |
| 2023-07-01 | 训练数据 Zenodo V1 发布(record 8104103);挑战赛注册开放 |
| 2023-10-16 | BONBID-HIE 2023 Workshop(Zoom 线上),受邀专家 Seetha Shankaran(2005 NEJM 亚低温 RCT PI) |
| 赛后 | 测试集密码公开;v2 修订发布(2023-12-01) |
| 2025 | 总结论文刊出 IEEE TMI(DOI 10.1109/TMI.2025.3638977,PMID 41379890) |
2023 届的两个遗产最值得记录:其一,参与规模——120 个研究组下载数据、14 个算法最终提交(Zenodo 主记录与 IEEE TMI 摘要双源印证);其二,评估基建开源——评估 docker 与算法示例 docker 至今可在 2023 届 GitHub 仓库获取,为赛后社区提供了现成的指标复现工具。
Shankaran 医生的受邀报告是 2023 届的一个象征性时刻:把挑战赛的技术叙事接回了亚低温疗法的临床试验传统(见 §2.2),提示参赛者这个赛道的终极评价者是儿科学界而非计算机学界。
7.3 2024 届赛制:docker 提交与 hidden test
2024 届的赛制要素(来源:官网 submission-guidelines 与数据页):
| 要素 | 设定 |
|---|---|
| 提交形态 | 推理算法打包为 docker 镜像提交至组织方 |
| 运行位置 | 官方服务器,hidden test set 上执行 |
| Track 1 测试规模 | N=44(hidden) |
| Track 2 测试规模 | N=53(hidden) |
| 验证集 | N=4,仅供 docker 冒烟测试,不计排名 |
| 训练数据发布 | 2024-09 初(官网日期三次改期后落地) |
| 排名呈现 | GitHub 仓库内 RANKINGS2024.png 等官方材料 |
| 论文出口 | 参赛论文收入 Springer LNCS vol. 14567(2024-10-24 online) |
hidden test 的双规模设计本身就携带信息:Track 2 的测试集(53)比 Track 1(44)更大,而 Track 2 的标注数据反而更稀缺——这暗示组织方对结局预测任务的评测稳定性给予了额外保障(二分类任务的单例波动更影响名次)。
验证集 N=4 的极小设定是docker 赛制的功能性设计:它只验证「你的镜像能否在官方环境跑通」,不提供任何统计意义上的调参信号。误把 Val 集当调参集是参赛实操中的隐性事故源(参见坑 4 的 2023 版本对应物)。
7.4 参赛合规的两大特殊要求
官网规则中有两条超出常规挑战赛的合规要求,直接塑造了参赛方法的合法性边界:
- 「不用预训练/公开数据」的附加输出:参赛者在提交算法结果的同时,须额外提交一组证明方法未依赖外部预训练权重或公开数据的附加输出。这条规则的意图是保证排名反映方法在 HIE 数据本身上的能力,而非大规模预训练的迁移红利——对小样本医学影像赛道而言,这是把「公平」操作化为可验证输出的罕见做法。
- 获奖队伍须开源代码:名次与开源义务绑定,确保赛果可复现、社区可继承。这与官方同时开源评估 docker 的行为一脉相承。
对计划复用参赛代码的研究者,这两条规则意味着:LNCS 14567 收录的方法与获奖开源仓库是两条并行的可信代码来源,且后者附带「在无外部数据条件下达成该成绩」的合规声明。
7.5 两届合并时间线总表
| 日期 | 事件 | 届别 |
|---|---|---|
| 2023-06-30 | Part I 预印本(bioRxiv 2023.06.30.546841) | 2023 |
| 2023-07-01 | Part I V1 发布(8104103);2023 届注册开放 | 2023 |
| 2023-10-16 | 2023 Workshop(线上,Seetha Shankaran 受邀) | 2023 |
| 2023-12-01 | Part I v2(10045994) | 跨届 |
| 2024-02-01 | Part I v3 created(10602767) | 跨届 |
| 2024-04-16 | 2024 届主记录发布(10978874 v1) | 2024 |
| 2024-08/09 | 训练数据发布(官网三次改期 8/15→9/1→9/6,最终 9 月初) | 2024 |
| 2024-09-05 | Part II 发布(13690270,restricted) | 2024 |
| 2024-10-24 | LNCS 14567 参赛论文集 online | 2024 |
| 2024-11 | Part II 论文挂 arXiv(2411.03456) | 2024 |
| 2025 | IEEE TMI 2023 届总结论文刊出(10.1109/TMI.2025.3638977) | 2023 |
这张表的实用价值在于消歧:任何「BONBID-HIE 某年某月发生了什么」的引用都能在此落点;四个 Zenodo 编号(8104103 / 10045994 / 10602767 / 13690270)与主记录(10978874)的时序关系一目了然。
§8 基准水位与方法生态
8.1 2023 届的参与规模与社区发现
2023 届的量化遗产:120 个研究组下载数据,14 个算法完成提交。这组数字(双源:Zenodo 主记录描述 + IEEE TMI 摘要)在挑战赛文献中的意义可以从两个方向解读:
- 从供给端看,14 个算法意味着社区对这一全新任务的兴趣快速兑现——一个此前不存在公开数据的小众临床任务,首年即吸引到两位数的方法提交;
- 从评测端看,2023 届的 14 组结果构成了 2024 届 Track 1 的隐含基准线:任何 2024 年的新方法都可以回头与 TMI 论文报告的 2023 分布对照,判断自己的改进是否落在噪声之外。
TMI 总结论文(2025,DOI 10.1109/TMI.2025.3638977)是理解这届赛果的一手文献,其摘要级信息包括参与统计与对任务难度的定性结论;参赛方法的具体名次表在官方仓库以图片形式存档(RANKINGS2024.png 对应 2024 届;2023 届名次见官网与 TMI 论文正文)。
8.2 2024 届方法例证:Swin-UNETR 五折集成
LNCS 14567(MICCAI 2024 Workshop 论文集,2024-10-24 online)收录的参赛论文中,密苏里大学的方案(chapter DOI 10.1007/978-3-031-71626-3_2)是一个有代表性的公开例证:
- 骨干:Swin-UNETR(基于 Swin Transformer 的 UNETR 变体);
- 训练策略:五折交叉验证 + ensemble;
- 对照结论:在 Dice、MASD、NSD 三项指标上全面优于其复现的 U-Net 3D 基线;
- 合规姿态:符合 §7.4 的附加输出要求(无外部预训练红利的声明路径)。
这一例证的生态意义大于名次意义:它验证了两件事——其一,把 3D 医学影像的通用大模型骨干(Swin-UNETR 由 Volume 组学社区贡献)落到 HIE 小病灶任务上,方向可行;其二,「五折 + ensemble」这类小样本标配策略在本任务上同样是默认起手式。截至本条目核验日,2024 届全部参赛队的最终名次数字未逐条公开核验(RANKINGS2024.png 为图片格式,见 FACTS 待核项),本条目不虚构名次表,具体名次以官方材料为准。
8.3 官方开源资产清单
两届挑战赛沉淀的可直接复用工程资产:
| 资产 | 位置 | 内容 |
|---|---|---|
| 2023 届仓库 | github.com/baorina/BONBID-HIE-MICCAI2023 | 评估 docker(bonbidhie_eval)、算法示例 docker、历史说明 |
| 2024 届仓库 | github.com/baorina/BONBID-HIE-MICCAI-MICCAI2024 | lesionseg 目录(Track 1 工具链)、outcomepred 目录(Track 2 工具链)、排名图 |
| 评估指标实现 | 上述仓库内 | Dice / MASD / NSD 的官方实现口径 |
| 数据图谱 | Part I v3 包内 atlases.tar.gz | 正常脑与病灶概率图谱(Z-ADC 标准化参照) |
实操建议:复现或对比实验的第一步永远是接官方评估 docker,而不是自写指标——MASD/NSD 的容差参数、表面提取方式等实现细节有官方口径,自写版本与官方数字对不上是文献中出现过的常见返工原因。
8.4 任务难度定位:与脑肿瘤分割的系统性对照
主记录为 Track 1 写下的定位文字,值得作为该任务的方法论纲领完整展开:
| 维度 | 脑肿瘤分割(BraTS/FeTS 类) | BONBID-HIE Track 1 |
|---|---|---|
| 病灶形态 | 大而局灶,单发或多发大块 | 小而弥散,>50% 患者病灶 <1% 脑体积 |
| 影像序列 | 多序列(T1/T1c/T2/FLAIR) | 单一扩散衍生(ADC/Z-ADC) |
| Dice 常规水位 | ≥0.8 属常见水平 | 显著更低,小病灶下 Dice 波动大 |
| 指标重心 | Dice 为主 | Dice + MASD + NSD 三件套并重 |
| 方法范式 | 大感受野密集预测 | 小目标敏感设计 + 异常检测/先验融合 |
| 样本量 | 数百至上千 | 133 例标注 |
这张对照表的方法论结论:从脑肿瘤赛道迁移到 HIE 赛道,需要重做的不是「换骨干」,而是重设评估预期(Dice 水位)、重配损失平衡(1% 病灶比)、重选输入表示(Z-ADC 先验的显式利用)。
8.5 文献出口与引用网络
围绕本数据集的文献四层结构,引用时按需取用:
- 数据描述论文:Part I(bioRxiv 2023.06.30.546841)与 Part II(arXiv 2411.03456)——引用数据本身时必引;
- 赛事总结论文:IEEE TMI 2025(10.1109/TMI.2025.3638977)——引用 2023 届赛果与社区基准时引;
- 参赛方法论文:LNCS 14567 各章(如 10.1007/978-3-031-71626-3_2)——引用具体方法对比时引;
- 指标考古文献:Dice 1945 原始论文与表面距离类指标文献(主记录参考文献区)——方法论溯源时引。
四层之外,主记录本体(DOI 10.5281/zenodo.10978874)是数据集引用的规范锚点,Zenodo 会为 concept DOI 维护跨版本的稳定解析。
(Part 4 完,接 Part 5)
§9 机构、人物与资助生态
9.1 三家机构与地理格局
BONBID-HIE 的机构构成是一条「医院-医学院-合作医院」的经典哈佛系链条:
| 机构 | 角色 | 数据中的痕迹 |
|---|---|---|
| Boston Children’s Hospital(BCH,波士顿儿童医院) | 数据来源院之一;组织者 Rina Bao 的驻地;2024 届无标注数据提供方 | 联系邮箱域名 childrens.harvard.edu |
| Harvard Medical School(HMS,哈佛医学院) | 学术母体;PI Yangming Ou 与资深专家 P. Ellen Grant 的教职所在 | Zenodo 主记录元数据、ORCID 记录 |
| Massachusetts General Hospital(MGH,麻省总医院) | 数据来源院之一(NICU 队列主力) | 文件名前缀 MGHNICU_ |
三家机构的分工在数据产品上留下了清晰指纹:Part I 的带标注影像以 MGH NICU 队列为主体(文件命名可证),Part II 的结局队列由 MGH 与 BCH 两院合并而成(arXiv 论文明示),2024 届新增的无标注数据来自 BCH。理解这一点对跨中心建模实验设计有直接意义——「院别」是这份数据里天然存在的批次变量。
9.2 核心人物谱
- Rina Bao, PhD:波士顿儿童医院博士后,两届挑战赛的组织者,Part I 与 Part II 论文的第一作者,官方 GitHub 仓库(baorina)的所有者。Zenodo 主记录中其名被录入为「Bao, Rino」——拼写误差,引用以论文署名「Rina Bao」为准(坑 9)。
- Yangming Ou, PhD:哈佛医学院放射学副教授,项目负责人(Zenodo 主记录 project leader 字段),ORCID 0000-0002-7726-6208。Part II 论文共同作者,实验室长期从事脑影像定量分析与图谱构建——Z-ADC 标准化路线的方法学底色与其研究背景高度吻合。
- P. Ellen Grant, MD:哈佛医学院放射学与儿科教授,Fetal-Neonatal Neuroimaging and Developmental Science Center(胎儿-新生儿神经影像与发育科学中心)主任。临床神经放射权威,为标注质量提供最终专业背书。
- Seetha Shankaran, MD:2023 届 workshop 受邀专家(非团队核心)。其 2005 年 NEJM 全身亚低温 RCT 是 HIE 治疗学的奠基研究,这份受邀关系标定了数据集与临床试验传统的承继关系(见 §2.2、§7.2)。
联系通道:Rina.Bao@childrens.harvard.edu 与 Yangming.Ou@childrens.harvard.edu(官方材料公开)。涉及 Part II 申请之外的学术合作、患者集合关系确认(坑 10)等事项,此为正门。
9.3 资助体系
NIH 三项基金构成数据集的资金底座(arXiv 2411.03456 致谢部分与 Zenodo 主记录描述双源):
| 基金号 | 机构 | 语义 |
|---|---|---|
| R03HD104891 | NICHD(Eunice Kennedy Shriver 国家儿童健康与人类发展研究所) | 小额探索性研究资助(R03),HD 系列为儿童健康方向 |
| R21NS121735 | NINDS(国家神经疾病与卒中研究所) | 探索性资助(R21),NS 系列为神经科学方向 |
| R61NS126792 | NINDS | R61/R33 过渡型资助的前段,通常对应「工具验证到多中心验证」的路径设计 |
三项基金的阶段安排(R03 → R21 → R61)本身就是一份「数据集成长史」:从探索性数据整理,到方法学建设,再到面向多中心验证的过渡资助——这与两届挑战赛的节奏(2023 试点、2024 扩展)在时间上互为镜像。引用基金信息时建议保留完整编号(含 NS/HD 前缀),便于在 NIH RePORTER 系统中追溯。
§10 相关资源互链与 DAIMS 评估
10.1 库内互链条目(qianfanghub 站内)
本条目与库内以下条目建立互链,rid 以站内数据库编号为准:
| 互链条目 | rid | 互链逻辑 |
|---|---|---|
| FeTS — 跨机构联邦脑肿瘤分割 MRI | fets (476) | 同为脑 MRI 病灶分割挑战数据集;BONBID 主记录明确以脑肿瘤大病灶为反差参照(§8.4),两者构成「大局灶 vs 小弥散」的任务光谱两端 |
| healthy-brain-network — 儿童青少年脑队列 | healthy-brain-network (245) | 儿科人群脑影像队列互链:HBN 覆盖儿童青少年临床谱系,BONBID 深入新生儿急性期,两者共同勾勒发育脑影像的年龄轴 |
| Medical Segmentation Decathlon | medical-decathlon (77) | 医学分割挑战赛范式与指标体系(Dice 系)互链:MSD 是多器官多肿瘤的通用分割基准,BONBID 是单病种深挖型基准,赛制设计互为参照 |
| instance2022 | instance2022 (645) | brief 指定互链:实例分割挑战类条目,与本条目同属计算机视觉挑战赛生态的跨域参照 |
| fastMRI | fastmri (23) | MRI 数据生态弱互链:fastMRI 深入原始 k 空间与重建问题,BONBID 使用衍生定量图,两者代表 MRI 数据产品链的上下游 |
互链使用建议:站在 BONBID 视角,476(FeTS)与 77(MSD)适合支撑「任务难度与赛制」的对比论述;245(HBN)适合支撑「儿科脑影像」的人群谱系论述;645 与 23 适合做生态位补充。反向从这些条目进入本条目的读者,建议先读 §0.1 五分钟速览再决定使用路径。
10.2 站外相关资源地图
库外与本数据集构成互补或竞争关系的资源,按关系类型分列:
- 上游(数据生产侧):MGH 与 BCH 的新生儿脑 MRI 临床工作流(不公开);NIH 基金体系内其他新生儿脑损伤项目。
- 同层(同类挑战赛数据):BraTS 系列与 FeTS(肿瘤端,见上表);MICCAI 2024 其他挑战赛数据集(LNCS 14567 同卷可查)。
- 下游(方法消费侧):Swin-UNETR 等 3D 医学影像骨干模型(MONAI 生态);NNU-Net 等自适配分割框架(社区在小样本任务上的默认起手式)。
- 评测基建:grand-challenge.org 平台(2024 届赛制宿主);官方评估 docker(§8.3)。
10.3 DAIMS 五维评估
DAIMS(Data AI-Readiness 评估框架:Documentation / Accessibility / Interoperability / Metadata / Sustainability)对本数据集的逐维打分与依据:
| 维度 | 得分(满分 5) | 依据与说明 |
|---|---|---|
| D 文档完备度 | 4.5 | 两篇数据论文(bioRxiv + arXiv)+ Zenodo 详尽描述 + 官网任务页 + GitHub README,文档矩阵完整;扣分项:观察者间一致性等标注协议细节未公开量化 |
| A 可获取性 | 3.5 | Part I 免申请直接下载(加分),Part II restricted 需申请(合理但抬高门槛),2023 测试集加密(历史遗留);总体获取摩擦中低 |
| I 互操作性 | 4.0 | 标准格式(NIfTI/MHA)、固定目录结构、官方评估 docker、ITK/MedPy 兼容;扣分项:只发布衍生 ADC/Z-ADC 图,原始序列缺失限制了对输入表示的自主重定义 |
| M 元数据质量 | 3.0 | Zenodo 元数据结构完整(含 ORCID、基金号、DOI 链),但存在作者名拼写误差(Bao, Rino)、样本数三口径并存、license 三口径并存等需人工核正的问题 |
| S 可持续性 | 4.0 | NIH 三基金持续资助、两届赛事节奏稳定、版本链管理规范(concept DOI)、赛果开源要求;扣分项:挑战赛结束后社区更新频率有待观察 |
**综合:3.8/5,AI-Ready 定级:高(带两处元数据核正提醒)。**一句话画像:文档与工程基建接近满配的小样本临床数据集,适合作为「低数据量 + 弱标签 + 临床落地」三重挑战的方法试验场;使用者需自带元数据核正(坑 1/6/9)与 license 口径意识(§6.3)。
10.4 适用与不适用场景清单
适合:
- 小样本医学影像分割方法研究(自监督、半监督、图谱先验、小目标敏感架构);
- 影像-结局弱监督建模与影像组学预后研究(Track 2 范式);
- 医学挑战赛方法论研究(docker 赛制、合规设计、指标体系比较);
- 新生儿神经影像教学与专家判读算法的原型验证;
- 跨任务泛化研究的「小弥散病灶」测试端(与脑肿瘤端对照)。
不适合或不建议:
- 需要原始 DWI/DICOM 的序列工程研究(数据集只发布衍生图);
- 大规模预训练或基础模型训练(133 例标注的量级决定的硬边界);
- 多中心泛化的严格验证(两中心、单区域,见 §5.4);
- 对标注一致性有量化要求的标注方法学研究(无多标注者数据);
- 任何商业用途(NC 条款全口径一致,见 §6.3)。
10.5 上手路线建议
给三类典型用户的五步上手路线:
分割研究者:读 Part I 论文 → 下载 v3(10602767)→ 用官方评估 docker 建立指标基线 → 复现 Swin-UNETR 五折方案(LNCS 14567)作对照 → 引入 Z-ADC 先验或无标注 BCH 数据做增量。
预后建模者:读 Part II 论文(arXiv 2411.03456)→ 提交 Zenodo 访问申请(13690270)→ 获批后核对 NRN 结局定义与自己的标签变体(§4.3)→ 从影像组学 + 浅层分类器起步建立可解释基线 → 再上深度端到端。
挑战赛复现者:读官网 submission-guidelines → 区分两届赛制(§7.1-§7.3)→ 2023 届走「公开测试集 + 密码赛后公开」路径,2024 届只能走 docker 提交路径 → 锁定数据版本号(v3)→ 结果对照 TMI 论文或官方排名图。
附录 A:术语表
| 术语 | 全称/原文 | 释义 |
|---|---|---|
| HIE | Hypoxic-Ischemic Encephalopathy | 缺氧缺血性脑病,围产期窒息所致脑损伤,本数据集的临床母题 |
| ADC | Apparent Diffusion Coefficient | 表观扩散系数图,DWI 的定量衍生图,急性缺血病灶呈低 ADC |
| Z-ADC | Z-score standardized ADC | 相对正常脑图谱做 Z-score 标准化后的 ADC 图,文件名带 smooth2mm_clipped10 等处理参数 |
| 1ADC_ss | skull-stripped ADC | 去颅骨 ADC 图,任务主输入之一 |
| 3LABEL | lesion label mask | 专家手工二值病灶掩膜,Track 1 的监督信号 |
| defaced | — | 去面部处理,MRI 去标识化的标准操作,文件名以 -defaced 后缀标记 |
| MASD | Mean Average Surface Distance | 平均对称表面距离,Track 1 三指标之一 |
| NSD | Normalized Surface Distance | 归一化表面距离(容差带内边界比例),Track 1 三指标之一 |
| Bayley-III | Bayley Scales of Infant and Toddler Development, 3rd Ed. | 婴幼儿发育量表第三版,2 岁结局判定的核心工具,任一域 <85 记不良 |
| GMFCS | Gross Motor Function Classification System | 粗大运动功能分级(1-5 级),2-5 级记不良 |
| NRN | Neonatal Research Network | 美国新生儿研究协作网,不良结局判定标准的推荐来源 |
| NICU | Neonatal Intensive Care Unit | 新生儿重症监护室,出院结局(NICU outcome)的采集场景 |
| MGH | Massachusetts General Hospital | 麻省总医院,Part I 队列来源院(MGHNICU_ 前缀) |
| BCH | Boston Children’s Hospital | 波士顿儿童医院,Part II 合并队列来源院之一,2024 届无标注数据提供方 |
| concept DOI | — | Zenodo 版本族的总 DOI(Part I: 8104102;Part II: 13690269),跨版本稳定解析 |
| hidden test | — | 不对参赛者公开的官方测试集,docker 在官方服务器上运行 |
| 冒烟测试 | smoke test | 官方术语语境下指 Val 集(N=4)上验证 docker 可运行性,不计排名 |
| therapeutic hypothermia | — | 治疗性亚低温,HIE 标准疗法,2005 年 NEJM RCT 奠基 |
| LNCS | Lecture Notes in Computer Science | Springer 计算机讲义丛书,2024 届参赛论文集所载卷(vol. 14567) |
| docker 提交制 | — | 以容器镜像提交算法、官方环境运行的赛制,grand-challenge.org 标准能力 |
附录 B:文献与来源清单
- Bao R, Song Y, Bates SV, et al. BOston Neonatal Brain Injury Dataset for Hypoxic Ischemic Encephalopathy (BONBID-HIE): Part I. MRI and Manual Lesion Annotation. bioRxiv 2023.06.30.546841. DOI: 10.1101/2023.06.30.546841.
- Bao R, Ou Y, et al. BOston Neonatal Brain Injury Data for Hypoxic Ischemic Encephalopathy (BONBID-HIE): II. 2-year Neurocognitive Outcome and NICU Outcome. arXiv:2411.03456, 2024.
- 2nd BONBID-HIE Challenge for Lesion Segmentation and Outcome Prediction. Zenodo, record 10978874, DOI: 10.5281/zenodo.10978874, 2024-04-16.
- BONBID-HIE Part I(v3). Zenodo, record 10602767, DOI: 10.5281/zenodo.10602767(concept: 10.5281/zenodo.8104102).
- BONBID-HIE Part II. Zenodo, record 13690270, DOI: 10.5281/zenodo.13690270(concept: 10.5281/zenodo.13690269), restricted, 2024-09-05.
- BONBID-HIE 2023 挑战赛总结. IEEE Transactions on Medical Imaging, 2025. DOI: 10.1109/TMI.2025.3638977(PMID 41379890).
- 密苏里大学参赛方案(Swin-UNETR 五折集成). In: MICCAI 2024 Workshop proceedings, LNCS vol. 14567. DOI: 10.1007/978-3-031-71626-3_2, online 2024-10-24.
- 2024 届挑战赛官网:https://bonbid-hie2024.grand-challenge.org/ (含 /data/ 与 /submission-guidelines/ 页面).
- 2023 届挑战赛官网:https://hiechallenge.github.io/ (含重要日期表与 workshop 信息).
- 官方 GitHub(2024):https://github.com/baorina/BONBID-HIE-MICCAI-MICCAI2024 (lesionseg / outcomepred 两目录,README 载 CC BY-NC 4.0 口径).
- 官方 GitHub(2023):https://github.com/baorina/BONBID-HIE-MICCAI2023 (评估 docker bonbidhie_eval 与示例算法).
- CC BY-NC-ND 2.5:https://creativecommons.org/licenses/by-nc-nd/2.5/ ;CC BY-NC-ND 2.0:https://creativecommons.org/licenses/by-nc-nd/2.0/ .
- Dice, L. R. Measures of the amount of ecologic association between species. Ecology, 1945(主记录参考文献区所引指标原始文献).
- Shankaran S, et al. Whole-body hypothermia for neonates with hypoxic-ischemic encephalopathy. New England Journal of Medicine, 2005(亚低温奠基 RCT;Shankaran 为 2023 届 workshop 受邀专家).
- Yangming Ou ORCID:https://orcid.org/0000-0002-7726-6208 .
附录 C:本条目核验记录
C.1 核验纪律执行情况
- 三轮存在性核验:完成。第一轮(WebSearch 多关键词)确认 BONBID-HIE 2024 挑战赛、Zenodo 记录与两篇论文的检索可见性;第二轮(WebFetch 实抓)直接抓取 Zenodo API 与官网页面获取元数据级事实;第三轮(论文链核验)经 arXiv 摘要与 bioRxiv 记录锁定样本数、结局定义与基金号。
- 三源互证:最终动用 6+ 独立来源——挑战赛官网(2023 与 2024 两代)、Zenodo 记录 ×3(10602767 / 10978874 / 13690270)、GitHub 官方仓库 ×2、bioRxiv 论文、arXiv 论文、Springer LNCS 章节、IEEE TMI 论文。全部核心数字均有至少两条独立来源路径。
- 必答题三源核验:两届版本关系(§7.1)经官网两代 + Zenodo 版本链 + 论文链三路交叉,未沿用任务简报中的任何预置表述。
C.2 关键事实的核验路径举例
| 事实 | 核验路径 |
|---|---|
| Part I 133 例 | bioRxiv 摘要 + Zenodo 10602767 描述(双源一致) |
| Part II 237 例(second release) | arXiv 2411.03456 摘要原文(single 源但为正式论文自述) |
| 主记录「近 300」宣传口径 | Zenodo 10978874 描述原文(仅存照用) |
| 测试集 Track1 N=44 / Track2 N=53 / Val N=4 | 官网 /data/ 页(实抓) |
| 2023 届 120 组下载 / 14 算法 | Zenodo 主记录描述 + IEEE TMI 摘要(双源) |
| Part II restricted + cc-by-nc-nd-2.0 | Zenodo API 实抓(access_right 与 license 字段原文) |
| Part I CC BY-NC-ND 2.5 | Zenodo 10602767 Rights 字段(页面实抓) |
| GitHub CC BY-NC 4.0 | 两仓库 README 使用条款段落(实抓) |
| 不良结局四条件定义 | arXiv 2411.03456 正文(NRN 推荐来源注明) |
| >50% 患者病灶 <1% 脑体积 | bioRxiv 摘要 |
| 病灶小弥散 vs 脑肿瘤大局灶定位 | Zenodo 10978874 描述原文 |
| Swin-UNETR 五折集成例证 | LNCS 14567 chapter 10.1007/978-3-031-71626-3_2 |
| 训练数据发布三次改期 | 官网 /data/ 页历史口径(8/15→9/1→9/6) |
| NIH 三基金号 | arXiv 2411.03456 致谢 + Zenodo 主记录描述(双源) |
| 下载统计 5177/6442/2.9TB 与 355/1908 | Zenodo stats(10602767 页面与 13690270 API) |
C.3 查重与互链检索记录
-- 查重(返回 0 行,无撞车)
SELECT record_id, url_name FROM ai_ready_dataset
WHERE status = 1 AND url_name ILIKE '%bonbid%';
-- 互链候选检索(返回 32 行,筛选出 5 个高相关)
SELECT record_id, url_name, title FROM ai_ready_dataset
WHERE status = 1 AND (title ILIKE '%brain%' OR title ILIKE '%MRI%'
OR title ILIKE '%segmentation%' OR title ILIKE '%neonatal%' ...);
确认的互链对象与 rid:fets (476)、healthy-brain-network (245)、medical-decathlon (77)、instance2022 (645)、fastmri (23)。
C.4 无法核验事项(如实披露)
- 2024 届各参赛队最终名次数字(RANKINGS2024.png 为图片,未做 OCR 级提取;本条目不引用具体名次);
- Part II 的文件大小与文件清单(restricted,API files 为空;本条目 accordingly 不写);
- 2024 届 Track 2 训练集的确切例数(官网未单列;本条目以 237 为两院合计上限口径处理);
- Part I 与 Part II 的患者集合交集规模(官方未公布;本条目按坑 10 处理)。
附录 D:常见问题(FAQ)
Q1:BONBID-HIE 2024 到底是多少例数据?
A:看任务。分割任务用 Part I 的 133 例(带专家标注);结局预测用 Part II 队列(两院合计 237 例);「近 300」是主记录宣传口径,不用于精确引用(§3.4)。
Q2:需要申请才能下载吗?
A:Part I v3 不需要,Zenodo 直接下载;Part II 需要,Zenodo 页面提交 access request(§6.2、坑 3)。
Q3:2023 届的数据还能用吗?和 2024 届什么关系?
A:能用,且本质上是同一份数据——2023 届发布的 Part I 经 V1→v2→v3 版本链沿用至 2024 届,官网指引使用 v3;2024 届的增量是 Part II 结局数据与 BCH 无标注数据(§7.1)。
Q4:为什么官方只给 ADC/Z-ADC,不给原始 DWI?
A:去标识化(defaced 衍生图)与输入分布统一的综合考量;代价是放弃了序列层面的再处理自由(§5.4 局限 3)。
Q5:我用脑肿瘤分割的现成管线能直接刷分吗?
A:大概率不理想。病灶小而弥散(>50% 患者 <1% 脑体积),需要小目标敏感设计与 Z-ADC 先验利用,Dice 水位预期也要重设(§8.4、坑 8)。
Q6:Track 2 的「不良结局」是怎么定义的?
A:NRN 推荐口径:Bayley-III 任一域 <85、GMFCS 2-5、失明或听障、2 岁前死亡,满足任一即记 1(§4.3)。
Q7:可以商用吗?
A:不可以。四处 license 口径(2.5 / 2.0 / 2.0 / 4.0)在「禁商用」上完全一致(§6.3)。
Q8:能再分发我处理过的数据版本吗?
A:Zenodo 口径含 ND(禁止演绎分发),重分发修改版需先联系组织方书面确认(§6.3 实务提醒)。
Q9:Val 集可以用来调参吗?
A:2024 届 Val 集 N=4 只用于 docker 冒烟测试,官方明确不计排名;统计意义上也不足以支撑调参(§7.3)。
Q10:引用时 DOI 用哪个?
A:数据集整体引主记录 10.5281/zenodo.10978874;具体数据另引 concept DOI(Part I 8104102 / Part II 13690269)或锁定版本引 10602767 / 13690270(§6.1)。
Q11:两届挑战赛的测试集我能拿到吗?
A:2023 届测试集 zip 加密、密码赛后于官网公开,可以拿到;2024 届 hidden test 不发布,只能经 docker 提交由官方运行(坑 4、§7.3)。
Q12:作者名字到底怎么写?
A:论文署名 Rina Bao;Zenodo 主记录的「Bao, Rino」是录入误差(坑 9)。
附录 E:本条目元信息
| 项 | 值 |
|---|---|
| 条目 slug | bonbid-hie |
| 条目 URL | https://www.qianfanghub.com/ai-ready-dataset/bonbid-hie/663 |
| 撰写代理 | agentA-bonbid |
| 批次 | 50 篇冲刺批量生产 · 批次 1 |
| 核验日期 | 2026-09-27(系统日期 2026-09-26/27) |
| 事实底稿 | writing/bonbid-hie/FACTS.md(九节,全部核心数字带源) |
| 来源数 | 6+ 独立来源(官网 ×2、Zenodo ×3、GitHub ×2、bioRxiv、arXiv、LNCS、IEEE TMI) |
| 存照项 | 样本数三口径、license 三口径、流行率双口径、作者名拼写误差、发布日期三次改期、README 与 restricted 并存 |
| 待核项 | 2024 届名次数字、Part II 文件清单、Track 2 训练集确切例数、两 Part 患者交集 |
附录 F:HIE 神经影像学基础(面向算法工程师的速成)
F.1 为什么 ADC 图上病灶是亮的/暗的
理解这份数据的第一性原理是弥散加权成像的物理语义:
- DWI(扩散加权成像):磁共振对水分子布朗运动的敏感序列。水分子扩散越自由,信号衰减越快。
- ADC(表观扩散系数图):从至少两个 b 值的 DWI 计算出的定量图,单位 mm²/s,直接反映水分子扩散能力。ADC 值越低,扩散越受限。
- 细胞毒性水肿:缺血缺氧后,细胞膜上钠钾泵失效,细胞内水肿,细胞体积膨大、细胞外间隙收窄——水分子运动空间被压缩,ADC 值下降。
- 在 ADC 图上的表现:急性弥散受限区域呈低信号(暗区);在 DWI(b1000)上呈高信号(亮区)。BONBID 发布的是 ADC 系图,病灶在 1ADC_ss 上表现为暗区。
工程视角的两个推论:其一,病灶与正常脑组织在 ADC 值域上有系统性偏移,这是阈值法与异常检测可用武之地的原因;其二,ADC 是定量图(有物理单位),不像 DWI 信号受 T2 穿透效应混杂——这也是官方选择 ADC 而非 DWI 作为发布格式的定量方法学理由。
F.2 新生儿脑的易损区解剖
HIE 病灶的空间分布不是随机的,而是遵循发育阶段的代谢-血管解剖逻辑:
| 易损结构 | 解剖位置 | 损伤时相与机制 | 对分割的含义 |
|---|---|---|---|
| 皮层与皮层下白质 | 沿中央沟旁、枕叶皮层带 | 重度 HIE 的典型累及区 | 病灶呈薄壳状贴皮层分布,2D 切片上易被低估 |
| 基底节/丘脑 | 丘脑腹外侧核、壳核后部 | 急性近窒息的重度损伤靶点 | 深部小灶,体积小但预后权重高 |
| 分水岭区 | 大脑前/中动脉与中/后动脉供血边界 | 部分性窒息的血压依赖性灌注不足 | 沿血管域边界分布,多灶连片 |
| 内囊后肢 | 皮层脊髓束通路 | 重度损伤时信号消失(正常髓鞘化高点反转为异常) | 预后标志物(PLIC 评估),非病灶本体但高度相关 |
对算法设计的直接启示:病灶先验是强结构化的——它偏爱特定解剖区域、特定形态(薄壳/小灶/分水岭带)。把解剖图谱先验(atlases.tar.gz 正是为此准备)编码进模型或后处理,比让网络从 133 例里自己 rediscover 这些先验经济得多。
F.3 Z-ADC:个体内标准化的方法学价值
2Z_ADC 的 Z 变换公式语义:对每个体素,Z = (该体素 ADC − 正常脑同位置图谱的参考分布均值) / 参考分布标准差(图谱即 atlases.tar.gz 内容;文件名中的 smooth2mm 与 clipped10 是平滑核宽与截断参数)。
这一变换的三个方法学红利:
- 消除个体间绝对值漂移:不同扫描仪、不同患儿间 ADC 绝对值存在系统性差异,Z 值把「偏离个体自身正常基线」变成可比量;
- 单通道即可解释:Z > 2 的体素天然携带「统计异常」语义,无监督方法的初筛阈值可以直接借统计学惯例;
- 跨中心可比性:Z 空间中的病灶表达比原始 ADC 空间更接近分布对齐,这对只有两中心数据、却希望外推的场景是实用的缓冲。
代价与边界:Z 变换依赖图谱与个体的配准质量,配准失败会在 Z 图上制造伪异常;同时 Z 变换抹掉了绝对 ADC 信息——某些利用组织绝对弛豫/扩散值的研究路线无法在 Z 图上执行。这就是官方同时保留 1ADC_ss 与 2Z_ADC 两个层级的原因:两条输入表示的哲学不同,留给方法路线的选择空间。
F.4 新生儿脑影像与成人脑影像的差异清单
从成人神经影像背景转入本数据集的工程师,需要校准的差异点:
- 髓鞘化进度:新生儿脑白质大部分未髓鞘化,水含量高、整体 T1/T2 信号对比与成人几乎相反;ADC 绝对值显著高于成人脑;
- 颅骨与囟门:颅缝未闭、囟门存在,CT/MRI 表现与成人不同;去颅骨处理(1ADC_ss)在新生儿语境下的解剖边界与成人工具的默认假设不同;
- 扫描协议约束:NICU 患儿需保温、监护、镇静管理,扫描时长与序列选择受临床约束,运动伪影与序列简化是常态;
- 病灶尺度:成人卒中弥散受限灶以血管域为单位,HIE 小灶以毫米计——这是 §8.4 难度对照的解剖学根源。
附录 G:建模路线详解(附代码骨架)
G.1 数据加载:从目录结构到训练样本
依据 §3.5 的目录规范,一个最小可用的 PyTorch Dataset 骨架(演示用,以官方数据包实际文件名为准):
import glob
import os
import nibabel as nib
import numpy as np
import torch
from torch.utils.data import Dataset
class BonbidSegDataset(Dataset):
"""Track 1 分割任务的 Dataset 骨架。
目录约定(Part I v3,Zenodo 10602767):
Train/ 下每例患者一个目录,含 1ADC_ss / 2Z_ADC / 3LABEL 前缀文件。
"""
def __init__(self, root: str, use_z_adc: bool = True):
self.cases = sorted(glob.glob(os.path.join(root, "*")))
self.use_z_adc = use_z_adc
def _load(self, pattern: str) -> np.ndarray:
paths = glob.glob(os.path.join(self.case_dir, pattern))
if len(paths) != 1:
raise FileNotFoundError(f"expect exactly 1 file for {pattern}, got {len(paths)}")
return nib.load(paths[0]).get_fdata().astype(np.float32)
def __getitem__(self, idx: int):
self.case_dir = self.cases[idx]
adc = self._load("1ADC_ss*")
inputs = [adc]
if self.use_z_adc:
inputs.append(self._load("2Z_ADC*"))
label = self._load("3LABEL*")
image = np.stack(inputs, axis=0)
return torch.from_numpy(image), torch.from_numpy(label[None, ...].astype(np.float32))
def __len__(self) -> int:
return len(self.cases)
三个工程要点:其一,glob 断言「每前缀恰好一个文件」可以把数据包完整性检查前移到数据加载层;其二,ADC 与 Z-ADC 通道的量纲不同(前者有物理单位、后者是标准化分数),双通道输入时通道级归一化策略要分开设计;其三,标签是 float 型 0/1 体素图,损失函数侧建议配 Dice loss 或 focal 变体以应对 1% 病灶比(坑 8)。
G.2 指标计算:官方口径优先
参考实现只用于理解指标语义,提交与论文引用一律以官方评估 docker(bonbidhie_eval)输出为准:
import numpy as np
def dice_score(pred: np.ndarray, label: np.ndarray) -> float:
"""Dice 系数:2|A∩B| / (|A|+|B|)。空-空情形按惯例记 1。"""
pred_b, label_b = pred.astype(bool), label.astype(bool)
denom = pred_b.sum() + label_b.sum()
if denom == 0:
return 1.0
return float(2.0 * np.logical_and(pred_b, label_b).sum() / denom)
def surface_distance_stats(pred: np.ndarray, label: np.ndarray):
"""MASD/NSD 的语义示意:表面距离需借助距离变换实现。
生产实现请直接采用官方评估 docker 的口径(含容差参数与
表面提取方式),此处仅示意「以距离变换求表面距离」的思路。
"""
raise NotImplementedError(
"MASD/NSD 涉及容差与表面提取的官方参数,请使用 bonbidhie_eval"
)
刻意让 MASD/NSD 抛出 NotImplementedError 是本文档的姿态:这两个指标的容差参数(NSD 的 tolerance)与表面定义有官方口径,自造口径会与榜单不可比(§8.3 实操建议)。
G.3 Track 2 的三种经典路线
以「影像 → 二分类结局」为骨架,文献生态中可辨识的三条路线:
路线一:影像组学 + 浅层分类器。在 ADC/Z-ADC 上提取强度直方图统计、纹理特征(GLCM/GLRLM)、病灶候选区统计量,接 logistic 回归/随机森林。优点:样本效率高、可解释、对 237 例量级友好;缺点:特征工程依赖先验,上限受制于手工特征的表达力。
路线二:弱监督深度学习。以 Track 1 的分割掩膜做辅助监督(多任务:分割 + 结局),让网络在「看哪里」上获得中间信号;或用病灶概率图做空间注意力先验。优点:利用了 Part I 的标注资产;缺点:两集合患者关系未知(坑 10),联合训练的数据划分要小心泄漏。
路线三:端到端自监督/无监督表征学习。在 133 例标注 + BCH 无标注数据上做自监督预训练(MAE/对比学习/ masked image modeling),再以少量结局标签微调分类头。优点:契合 2024 届无标注数据的赛道导向;缺点:预训练目标与结局预测的相关性没有保证,需要消融验证。
三条路线的公平对照建议共用同一数据划分与同一评估 docker(Track 2 指标走官方口径),并在论文中报告置信区间——237 例量级下,单点指标的排序噪声不可忽略。
G.4 交叉验证与不确定性
133 例(Track 1)与 237 例(Track 2)量级下的标准动作清单:
- 五折交叉验证是社区默认配置(LNCS 14567 例证亦然),分层抽样按「病灶体积分位」或「结局标签比例」分层更稳;
- ensemble 是小样本任务的免费午餐:五折模型平均常带来 1-2 个点的稳定收益;
- 报告指标时给出折间标准差或 bootstrap 置信区间,尤其在 Dice 这种小目标高波动指标上;
- 训练/验证/测试的任何触碰 hidden test 的行为都不存在——test 只在官方侧运行,本地能做的就是 CV 与 Val(N=4)冒烟。
G.5 可解释性:这个赛道的隐藏评分项
把方法投稿到临床导向的场合(MICCAI workshop、儿科影像期刊),可解释性几乎是隐性门槛:
- 分割任务本身自带可解释性(掩膜可视化),重点是病灶检出的小灶召回展示——漏检一枚 5 mm 丘脑小灶与漏检一大片皮层的临床意义不同,案例分析要覆盖这两种情形;
- 结局预测任务必须给出「模型在看哪里」的证据:Grad-CAM/注意力图覆盖在 ADC 图上,并与已知易损区解剖(附录 F.2)做定性对照;
- 报告假阴性案例的影像学复核:模型漏掉的病灶是「专家共识内的真病灶」还是「边界性表现」,这一步直接决定临床读者对工作的信任度。
附录 H:实操数据卡与检查清单
H.1 一页数据卡(速查)
| 项 | 值 |
|---|---|
| 数据集 | BONBID-HIE 2024(第二届挑战赛官方数据) |
| 部分 | Part I:133 例分割数据(开放);Part II:237 例结局数据(restricted);BCH 无标注数据(2024 届) |
| 输入 | 1ADC_ss(去颅骨 ADC)、2Z_ADC(标准化 ADC) |
| 输出 | Track 1:二值掩膜(.mha);Track 2:0/1 结局标签 |
| 文件格式 | NIfTI(.nii.gz)与 MHA |
| 指标 | Track 1:Dice + MASD + NSD;Track 2:AUROC 等分类指标(官方 docker 口径) |
| 版本 | Part I 用 v3(10602767);引用 concept DOI 8104102 / 13690269;主记录 10978874 |
| License | Part I CC BY-NC-ND 2.5;Part II CC BY-NC-ND 2.0;代码 CC BY-NC 4.0(README);共识:禁商用 |
| 获取 | https://zenodo.org/records/10602767 (直接);https://zenodo.org/records/13690270 (申请) |
| 代码 | https://github.com/baorina/BONBID-HIE-MICCAI-MICCAI2024 |
| 官网 | https://bonbid-hie2024.grand-challenge.org/ |
| 引用论文 | bioRxiv 2023.06.30.546841;arXiv 2411.03456;IEEE TMI 10.1109/TMI.2025.3638977 |
| 站内条目 | https://www.qianfanghub.com/ai-ready-dataset/bonbid-hie/663 |
H.2 下载后五分钟自检清单
- 解压 BONBID2023_Train.zip,抽查任一患者目录:0ADC/1ADC_ss/2Z_ADC/3LABEL 四前缀文件齐全、文件名含
-defaced; - 用 nibabel 打开 1ADC_ss 与 3LABEL,确认二者仿射矩阵(affine)一致、形状一致——不一致说明拿错版本或文件损坏;
- 统计标签非零体素占比:多数患者应在 1% 上下或更低(对应 §5.2 的形态学画像),若某例异常偏大,先核对版本再看是否为真实大灶;
- 解压 atlases.tar.gz 并与 2Z_ADC 的 Z 语义对照(Z≈0 处应落在图谱正常区);
- 记录所用版本号(v3,record 10602767)进实验日志——复现性从这里开始(坑 5)。
H.3 论文写作检查清单(引用本数据集时)
- 样本数按任务拆分表述:分割 133 例、结局 237 例(两院合计),不出现「约 300 例」;
- 版本号显式:Part I v3(Zenodo record 10602767);
- 结局定义显式:NRN 推荐口径四条件(若自行修改定义,附与 NRN 口径的敏感性对照);
- license 标注:CC BY-NC-ND(数据)+ CC BY-NC 4.0(代码),并说明使用符合 NC 限制;
- 指标三件套完整:Dice、MASD、NSD 并报,与官方评估 docker 口径对齐;
- 限制章节覆盖 §5.4 五条局限中的适用项;
- 作者署名引用 Rina Bao / Yangming Ou / P. Ellen Grant,不沿 Zenodo 拼写误差;
- 两届表述清晰:2023 届单任务(分割)、2024 届双任务(分割 + 结局),不混写。
H.4 站内导航
- 本条目:https://www.qianfanghub.com/ai-ready-dataset/bonbid-hie/663
- 互链条目:FeTS(rid 476)、healthy-brain-network(rid 245)、Medical Segmentation Decathlon(rid 77)、instance2022(rid 645)、fastMRI(rid 23)——见 §10.1 的互链逻辑表。
- 延伸阅读顺序建议:先读 §0 与本附录 H.1 数据卡建立全局感,再按用户身份走 §10.5 上手路线,坑点清单(§6.5)在动手前通读一遍。
(全文完)
附录 I:从原始发布到 AI-Ready:本条目的加工说明
I.1 原始形态与 AI-Ready 差距分析
BONBID-HIE 的原始发布形态(Zenodo + 官网 + GitHub)面向的是「参赛者与临床研究者」,与「AI 可直接消费的结构化知识」之间存在若干差距。本条目的加工工作即针对这些差距:
| 维度 | 原始发布形态 | 本条目的 AI-Ready 加工 | 残差(仍需人工/外部) |
|---|---|---|---|
| 样本数表述 | 133 / 237 / 近 300 三口径散布于不同文档 | 口径对照表(§3.4)+ 结构化字段取 237 并注明语义 | 无(已消解) |
| License | 四处三种版本号(2.5/2.0/2.0/4.0) | 三口径存照表(§6.3)+ 采信策略 + 实务提醒 | 涉及 ND 的再分发仍需联系组织方 |
| 版本链 | 三版本三记录,官网指引分散 | 全景表(§6.1)+ 引用姿势建议 | 无 |
| 访问分级 | 页面可见但 restricted 语义易误读 | 获取途径清单(§6.2)+ 专项坑点(坑 3) | Part II 申请审批仍走人工 |
| 结局定义 | 论文正文内嵌、NRN 语境依赖 | 四条件独立成节(§4.3)+ 变体使用警告 | 无 |
| 任务-数据映射 | 两届材料分散、易混淆 | 必答题专节(§7.1)+ 对照总表(附录 K) | 无 |
| 文件结构 | bioRxiv 图示 + 实际包内命名 | 带注释目录树(§3.5)+ 代码骨架(§G.1) | 具体文件名以实际包为准 |
| 元数据拼写 | Zenodo「Bao, Rino」误差 | 存照 + 以论文署名为准的方针(坑 9) | Zenodo 侧记录本身未修正 |
I.2 cr:RecordSet 视角下的记录集建模
本条目 frontmatter 的 schema_org 采用 cr:RecordSet 节点式建模(croissant 风格),设计考量如下:
- 记录单元:以「患者-访视」为一条记录(record),而非以文件为记录——这符合数据集的临床语义(一个患者是一次随访评估的原子),也与目录结构(每患者一目录)对齐;
- 字段平面:四个 cr:RecordField 对应四类字段平面——1ADC_ss(影像输入平面)、2Z_ADC(标准化输入平面)、3LABEL(分割监督平面)、clinical_outcome(结局监督平面)。两平面输入 + 两平面监督的 2×2 结构,正是双任务设计的最小形式化;
- 平面可用性差异:3LABEL 仅 Part I 提供、clinical_outcome 仅 Part II 提供,这一「平面-部分」的映射关系在字段 description 中显式声明,防止下游 AI 把四个字段误读为全量共有;
- rai:dataLimitations:负责任 AI 扩展字段承载 §5.4 与 §10.3 的局限清单,使「数据的不能」与「数据的能」在元数据层同权重可见——AI 代理读数据卡时先读 limitations 是本站的建模立场。
I.3 标签体系与检索设计
category_tags 的六个取词与理由(全部取自站内受控词表):
| 标签 | 层级 | 选择理由 |
|---|---|---|
| 医学影像 | L1 | 数据集的一级学科归属(影像数据) |
| MRI | L2(影像) | 模态精确标签,检索 MRI 生态的主入口 |
| 医学图像分割 | L2(影像) | Track 1 任务的直接方法论标签 |
| 脑影像 | L2(神经科学) | 解剖部位标签,连接神经科学侧检索 |
| 挑战赛数据集 | L2(问答与基准) | 资源形态标签,连接挑战赛类条目族 |
| 儿科 | DISEASE | 人群标签,连接儿科临床侧检索 |
六个标签共覆盖三条检索路径:模态路径(MRI→医学影像)、任务路径(医学图像分割→挑战赛数据集)、人群/解剖路径(儿科→脑影像)。data_tags 另行给出更细的字段级标签(ADC 图、Z-ADC 图、病灶分割掩膜、NICU 结局、Bayley-III 结局、脑图谱),供字段级检索与过滤使用。互链相关度算法按 category_tags 计算,故本条目与 FeTS(脑肿瘤分割)、MSD(分割挑战)、HBN(儿科脑影像)将在标签空间天然邻近——这与 §10.1 人工确认的互链逻辑一致,标签与人工互链互为印证。
I.4 双口径存照的编辑方针
本条目对「来源之间打架」的信息执行统一方针,在此透明披露供后续维护者沿用:
- 结构化字段取可核验口径:patient_count=237(正式论文自述的最大合并队列),license 按发布渠道分层采信;
- 叙事文本双写:正文先给采信口径、随后存照差异(如「1~5/1000 vs ~0.5%」并存句式),不静默取舍;
- 宣传量词不入结构化字段:「近 300」「20 年工作流」只作背景表述并标注出处性质;
- 拼写误差存照不修正源头:Zenodo 侧的「Bao, Rino」如实记录、成稿用论文署名,不臆测源头何时修正;
- 无法核验的信息显式空缺:Track 2 训练例数、2024 名次数字等四项(附录 C.4)宁缺毋错。
附录 J:已知问题登记簿
以下登记簿汇总核验过程中确认的全部问题,按层级分组,供后续维护与本站质量体系复用。每条含证据位置与影响评估。
J.1 元数据层
| 编号 | 问题 | 证据 | 影响 | 处置 |
|---|---|---|---|---|
| M-01 | 主记录作者名「Bao, Rino」拼写误差 | Zenodo 10978874 vs 论文署名 | 文献引用与作者检索噪声 | 存照(坑 9),引用用论文署名 |
| M-02 | 样本数三口径并存 | 133(bioRxiv)/ 237(arXiv)/ 近 300(Zenodo 主记录) | 引用混乱、综述错误高发 | 对照表(§3.4),结构化字段取 237 |
| M-03 | License 三口径并存 | Zenodo Rights / bioRxiv 声明 / GitHub README | ND 语义边界模糊 | 分层采信(§6.3),共识层「禁商用」可靠 |
| M-04 | Part II API files 为空 | Zenodo API 实抓 | 第三方无法核验 Part II 文件构成 | 成稿不写 Part II 文件清单 |
| M-05 | 训练数据发布日期官网三次改期 | 官网 /data/ 历史口径 8/15→9/1→9/6 | 时间线引用漂移 | 以「2024 年 9 月初」为最终口径 |
J.2 数据层
| 编号 | 问题 | 证据 | 影响 | 处置 |
|---|---|---|---|---|
| D-01 | Part I 存在三个版本 | Zenodo 8104103/10045994/10602767 | 旧链接复现分布漂移 | 版本链表(§6.1),新研究一律 v3 |
| D-02 | 2023 测试集加密 | BONBID2023_Test.zip 加密、密码赛后公开 | 直接解压失败 | 坑 4,流程中补密码获取步骤 |
| D-03 | Part I 与 Part II 患者集合关系未知 | 官方材料未公布 ID 映射 | 联合建模存在泄漏风险 | 坑 10,需要时联系组织方 |
| D-04 | 无多标注者一致性数据 | 公开材料未见 rater 一致性统计 | 标注噪声下限无法量化 | §5.4 局限 5,论文如实引用 |
| D-05 | Track 2 训练集确切例数未公布 | 官网未单列 | 结局任务样本量只能按上限 237 估 | 附录 C.4 待核项 |
| D-06 | 只发布衍生图、无原始序列 | Zenodo 包内容 | 序列级再处理与多序列融合不可行 | §5.4 局限 3 |
J.3 赛制层
| 编号 | 问题 | 证据 | 影响 | 处置 |
|---|---|---|---|---|
| S-01 | 2024 hidden test 不发布 | 官网 submission-guidelines | 离线复现 2024 榜单不可行 | 只能 docker 提交,或对照 2023 公开测试 |
| S-02 | Val 集 N=4 仅冒烟用途 | 官网数据页 | 误作调参集产生过拟合噪声 | §7.3,坑点体系覆盖 |
| S-03 | 附加输出要求易被忽略 | 官网规则(不用预训练/公开数据的附加输出) | 提交被判不合规 | §7.4 清单化 |
| S-04 | 2024 名次数字仅图片存档 | RANKINGS2024.png | 名次引用无法逐条核验 | 本条目不引用具体名次(附录 C.4) |
J.4 登记簿使用说明
- 本登记簿与坑点清单(§6.5)是同一事实的两面:坑点面向「使用者动作」,登记簿面向「质量体系与维护」;
- 后续若 Zenodo 侧修正拼写(M-01)或公开新版本(D-01),应以增补条目而非改写历史条目的方式维护;
- 各条处置列的内部引用(坑 N / 章节号)在条目重排时需同步检查。
附录 K:两届挑战赛全维对照总表
| 维度 | BONBID-HIE 2023(第一届) | BONBID-HIE 2024(第二届) |
|---|---|---|
| 宿主 | MICCAI 2023 | MICCAI 2024 |
| 官网 | hiechallenge.github.io | bonbid-hie2024.grand-challenge.org |
| 任务数 | 1(病灶分割) | 2(Track 1 分割 + Track 2 结局预测) |
| 分割数据 | Part I V1(record 8104103,2023-07-01) | Part I v3(record 10602767,同 concept 链沿用) |
| 标注数据规模 | 133 例 | 133 例(同一数据链的最新版) |
| 结局数据 | 无 | Part II 237 例(record 13690270,restricted,2024-09-05) |
| 无标注数据 | 无 | BCH 无标注影像(支持无监督开发) |
| 方法限制 | 未见同等附加输出要求 | 须提交「不用预训练/公开数据」的附加输出 |
| 测试形态 | 公开加密 zip(密码赛后公开) | hidden test:Track 1 N=44 / Track 2 N=53,仅官方服务器运行 |
| 验证集 | 常规小验证集(Val zip 1.1MB) | N=4,仅 docker 冒烟 |
| 提交形态 | 算法提交(docker 化评估配套) | 全量 docker 提交制 |
| 评估基建 | bonbidhie_eval docker(开源) | 官方评估口径延续,仓库分 lesionseg / outcomepred |
| 参与规模 | 120 个研究组下载、14 个算法提交 | (本条目未逐条核验名次,见附录 C.4) |
| 论文出口 | IEEE TMI 总结论文(2025,10.1109/TMI.2025.3638977) | LNCS vol. 14567 参赛论文集(2024-10-24 online) |
| 数据论文 | Part I(bioRxiv 2023.06.30.546841) | Part II(arXiv 2411.03456) |
| 里程碑意义 | 首个公开新生儿脑损伤分割标注数据集 | 首个影像→2 岁结局的可比较预测基准 |
| 获奖 | 获奖队伍须开源 | (承袭并显式化:获奖队伍须开源代码) |
对照表的三个阅读结论:
- 数据血缘单一:分割数据从头到尾是一条 Zenodo 版本链,「两届两份数据」是最常见的误读;
- 增量全部服务于新任务:2024 届真正的新东西(Part II、无标注数据、hidden test 双轨)全部指向结局预测与更严格的无泄漏评测;
- 基建只增不减:评估 docker、开源要求、合规输出逐届累积,2023 届资产在 2024 届语境下依然可用。
(全文完)
附录 L:引用格式与 BibTeX
L.1 推荐引用组合
按使用目的选择引用组合(全部条目已在附录 B 给出完整书目信息):
- 使用分割数据(Part I):主记录 DOI + Part I 记录 DOI + Part I 论文(bioRxiv);
- 使用结局数据(Part II):主记录 DOI + Part II 记录 DOI + Part II 论文(arXiv);
- 对比 2023 届赛果:加引 IEEE TMI 总结论文;
- 对比 2024 届方法:加引 LNCS 14567 对应章节;
- 综述性提及:主记录 DOI + 两篇数据论文即可覆盖。
L.2 BibTeX 模板
以下条目基于公开元数据整理,投稿前请以出版社页面最终核准:
@article{bonbid_part1_2023,
author = {Bao, Rina and Song, Yang and Bates, Stephen V. and others},
title = {{BOston Neonatal Brain Injury Dataset for Hypoxic Ischemic
Encephalopathy (BONBID-HIE): Part I. MRI and Manual Lesion Annotation}},
journal = {bioRxiv},
year = {2023},
doi = {10.1101/2023.06.30.546841},
note = {Preprint}
}
@misc{bonbid_challenge_2024,
author = {{BONBID-HIE Challenge Organizers}},
title = {{2nd BONBID-HIE Challenge for Lesion Segmentation and
Outcome Prediction}},
howpublished = {Zenodo, record 10978874},
year = {2024},
doi = {10.5281/zenodo.10978874}
}
@misc{bonbid_part2_2024,
author = {{BONBID-HIE Team}},
title = {{BONBID-HIE: Part II. 2-year Neurocognitive Outcome and
NICU Outcome}},
howpublished = {Zenodo, record 13690270, restricted access},
year = {2024},
doi = {10.5281/zenodo.13690270}
}
@misc{bonbid_part1_v3,
author = {{BONBID-HIE Team}},
title = {{BONBID-HIE Part I (v3): MRI and Manual Lesion Annotation}},
howpublished = {Zenodo, record 10602767},
year = {2024},
doi = {10.5281/zenodo.10602767}
}
作者列表的占位语义:Part I 论文的完整作者序(Bao R, Song Y, Bates SV, et al.)以 bioRxiv 页面为准,BibTeX 中 beyond 第三作者的 et al. 处理遵循目标期刊格式;Part II 论文同样以 arXiv 页面作者序为准。这正是「元数据以论文为准」方针(I.4)在引用环节的落点。
L.3 数据可用性声明模板
论文 Data Availability 部分的可直接改写模板:
The BONBID-HIE Part I dataset (133 MRI studies with expert lesion
annotations) is publicly available at Zenodo (record 10602767,
DOI: 10.5281/zenodo.10602767; concept DOI: 10.5281/zenodo.8104102),
distributed under CC BY-NC-ND 2.5. The Part II outcome dataset
(237 patients with NICU and 2-year neurocognitive outcomes from two
centers) is available upon request via Zenodo (record 13690270,
DOI: 10.5281/zenodo.13690270), under CC BY-NC-ND 2.0. This study used
version v3 of Part I. Adverse outcome labels follow the NRN-recommended
definition. No commercial use was made of the data.
模板要点:版本号显式、两个 DOI 并引、license 明示、结局定义口径声明、NC 合规声明——五个审稿人常见追问一次覆盖。
附录 M:跨学科用户的阅读路径
M.1 临床背景读者(新生儿科/放射科)
- 主线:§0 → §2(临床背景全读)→ §4.3(结局定义)→ §10.5 上手路线;
- 关注点:亚低温与预后的时间窗(§2.2)、不良结局四条件(§4.3)、数据临床纵深(§2.4);
- 可跳过:附录 G 的代码骨架、I.2 的元数据建模。
M.2 机器学习工程师
- 主线:§0.1 → §3.5(文件结构)→ §4.1/§4.4(任务与指标)→ §8.4(难度定位)→ 附录 F → 附录 G;
- 关注点:通道归一化(G.1)、官方评估口径(G.2)、五折与 ensemble(G.4)、可解释性隐性门槛(G.5);
- 动手前必读:坑 4/5/8 与 H.2 自检清单。
M.3 数据治理与合规人员
- 主线:§5.3(去标识化)→ §6.3(license 三口径)→ §6.4(合规速查)→ J.1(元数据层登记簿);
- 关注点:restricted 通道(坑 3)、ND 对再分发的约束、四口径并存的历史成因;
- 决策点:任何再分发/二次发布计划先过 §6.3 实务提醒。
M.4 数据集方法论研究者
- 主线:§7.1(两届关系)→ §7.4(合规设计)→ 附录 I(AI-Ready 加工)→ 附录 K(全维对照);
- 关注点:docker 赛制与公平性操作化(附加输出机制)、指标体系设计(三件套的互补逻辑)、登记簿与坑点的双面结构(J.4)。
附录 N:条目维护说明
- 事实底稿:本条目全部核心数字的原始出处登记于 writing/bonbid-hie/FACTS.md(九节结构),条目与 FACTS 冲突时以 FACTS 的来源 URL 为仲裁;
- 核验日期锚点:所有统计类数字(下载量、浏览量、文件体积)以 2026-09-27 核验日为快照,引用时注意时效;
- 更新触发条件:Zenodo 元数据修正(如 M-01 拼写)、Part I 新版本发布、Part II 解禁或新版本、2024 届名次数字获得可核验文本源——任一发生时按附录 J 登记簿的增补规则维护;
- 与本站体系的关系:本条目的 DAIMS 打分(§10.3)与登记簿(附录 J)遵循站内数据集条目的统一框架,供跨条目横向比较。
(全文完)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- aims-tbi — 共享标签:医学影像 / MRI / 医学图像分割 / 脑影像 / 挑战赛数据集
- lisa2025 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 儿科
- brats-pediatric — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集 / 儿科
- hc18 — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 儿科
- ulf-enc — 共享标签:医学影像 / MRI / 脑影像 / 挑战赛数据集
- ixi-brain — 共享标签:医学影像 / MRI / 脑影像
- selma3d — 共享标签:医学影像 / 医学图像分割 / 脑影像 / 挑战赛数据集
- topaneu2026 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- promise12 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
- crossmoda2022 — 共享标签:医学影像 / MRI / 医学图像分割 / 挑战赛数据集
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

