INSTANCE2022 (instance2022) — AI-Ready Wikipedia

首个公开的颅内出血 3D 体素级分割基准:200 例 NCCT 各向异性体积(0.42×0.42×5mm),四指标 aggregate-then-rank 排名、HD=inf 劣后争议、小血肿与 SAH 双瓶颈,2026-09 起数据完全公开

来源 北京大学首钢医院 2017-2019 年确诊 ICH 患者回顾性 NCCT 200 例(NIfTI,512×512×20-70,0.42×0.42×5mm 各向异性,体素级二值血肿掩码,Seg3D 粗标+10 位放射科医生精修互检)发布时间: 2026-09-26最后更新: 2026-09-26 阅读 18
INSTANCE2022 (instance2022) — AI-Ready Wikipedia

信息速览

数据集名称INSTANCE2022 (instance2022) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模200 例 NCCT 3D 体积(100 训练 + 30 验证 + 70 封闭测试);10 位资深放射科医生参与标注精修
接入方式北京大学首钢医院 2017-2019 年确诊 ICH 患者回顾性 NCCT 200 例(NIfTI,512×512×20-70,0.42×0.42×5mm 各向异性,体素级二值血肿掩码,Seg3D 粗标+10 位放射科医生精修互检)
AI 就绪度

INFOBOX — INSTANCE2022 一屏速览

维度 内容
本质 首个公开的颅内出血 3D 体素级分割挑战赛+基准数据集(MICCAI 2022 卫星赛事)
名字 INSTANCE = INtracranial hemorrhage SegmenTAtioN ChallengE
团队 哈尔滨工业大学感知计算研究中心(李翔宇/罗 Gongning/王宽全/Shuo Li)+ 北京大学首钢医院
论文 arXiv:2301.03281(2023-01-09,35 作者,含 NVIDIA Myronenko 等参赛队跨队署名);截至 2026-09 无正式期刊版
数据 200 例 NCCT = 100 训练 + 30 验证 + 70 封闭测试;512×512×20-70;DICOM→NIfTI 保留原始 HU
各向异性 面内 0.42mm vs 层厚 5mm ≈ 12:1——立题核心难点
任务 出血区域体素级二值分割(五亚型合并,掩码不携带亚型标签)
标注 Seg3D 粗标 → 资深放射科医生逐例精修 → 全体交叉互检 + 多数投票(10 位医生口径)
评估 DSC↑/NSD↑/RVD↓/HD↓ 四指标;aggregate-then-rank 三步排名;HD=inf 队伍劣后
冠军 vegetable:DSC 69.25±19.14(nnU-Net 2D/3D 混合+集成)
DSC 单项第一 nvauto(NVIDIA Auto3DSeg):DSC 72.06,但 HD=inf 劣后屈居第 2
基线 SLEX-NET 重训版:DSC 52.83±28.92
双瓶颈 小血肿(<15000 mm³ 者 DSC 常<0.3);SAH 最难(平均 DSC 0.41)
参与 500+ 申请、70 队获批、验证期 350+ 提交、13 队进入决赛
获取 2022-2026.09 签协议邮件发放 → 2026-09-11 起公开下载(GC 平台);代码 Apache-2.0
库内互链 isles(495)、acdc(511)、mms(516)、ct-rate(546)、abdomenct-1k(402)、totalsegmentator
身份指纹 脑 / CT / 二值 / 体素级——出现心脏、MRI、多类、切片级任何一个词,说的都是别家数据集
开放化节点 2026-09-11 数据完全公开(此前 2022.03-2026.09 为注册墙)

INSTANCE2022 是一场"在 12:1 的各向异性上考 3D 分割"的挑战赛:它把层厚 5mm、面内分辨率 0.42mm 的平扫头颅 CT(NCCT)作为考卷——层间信息稀疏到让 3D 卷积优势存疑、面内细节又精细到值得榨取——并要求算法在体素级圈出颅内出血。它发布 200 例带体素级掩码的 NCCT 体积,是颅内出血方向第一个公开的 3D 体素级分割基准(此前的 RSNA-ASNR-MICCAI 2022 同名赛事是 2D 切片级分类);2026 年 9 月 11 日起数据对公众完全开放,使其又成为一个"注册墙→公开化"的演化样本。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意 2026-09-11 已公开下载,但公开后协议约束是否保留尚待核。
  2. 关心排名怎么算:直奔 §4 与 §5——HD=inf 劣后规则和 DSC 最高者屈居第 2 的争议案例都在那里。
  3. 要训练模型:直奔 §5 双瓶颈两段与附录 G——小血肿和 SAH 是所有队伍的分水岭,别拿全集平均分自我安慰。

§0 导读:这个数据集解决什么问题

颅内出血(intracranial hemorrhage, ICH)是卒中死亡的首要类型,发病 1 个月内死亡率约 40%;血肿体积是干预决策与预后评估的核心指标——但临床常规靠 ABC/2 公式手工估算,对不规则大血肿误差显著。自动分割本应接手这件事,却在数据层面卡了壳:在 INSTANCE2022 之前,公开数据不存在体素级标注的 ICH 3D 分割基准。此前的同名大赛事 RSNA-ASNR-MICCAI Brain Hemorrhage(2022,Kaggle)只做 2D 切片级的多类分类——告诉你是哪一层、哪类出血,不告诉你边界在哪里。而边界(体积)恰恰是临床最需要的量。

第二个被低估的难点是各向异性。NCCT 出于扫描速度与辐射剂量考虑,层厚通常 5mm,而面内分辨率可达 0.42mm——两个方向的采样密度相差约 12 倍。3D 卷积沿 z 轴插值出来的"层间上下文"近乎虚构,纯 2D 方法又浪费面内的连续结构。这是几乎所有 3D 医学影像任务都隐含存在的坑,INSTANCE2022 把它直接变成了考题本身。

INSTANCE2022 的回答分三层。第一层是数据:200 例 NCCT(北京大学首钢医院 2017-2019 年回顾性采集),训练 100 例带体素级二值掩码,验证 30 例、测试 70 例不发放 GT,从根源上防过拟合与榜单刷分。第二层是基准设计:DSC、NSD、RVD、HD 四指标 + aggregate-then-rank 三步排名,其中"HD=inf 队伍劣后"的规则(漏检一个血肿的队伍不能靠平均值得利)与论文赛后"建议未来弃用 HD"的反思,构成了评估方法学上少见的现场辩论。第三层是发现:13 支决赛队伍全部是 U-Net 系、7 支用 nnU-Net、10 支上集成,但冠军是一个 2D/3D 混合方案;小血肿(<15000 mm³)与 SAH 亚型构成两道所有队伍都迈不过去的坎。这些结论对任何做 3D 医学分割的人都直接可迁移。

在库内数据集谱系里,INSTANCE2022 填补的是"神经影像 + CT + 病灶级分割"的交叉空位:isles(495)占住缺血侧的 MRI 分割,ct-rate(546)等占住 CT 域的器官/报告维度,而"CT 上的病灶体素级标注"此前是空白。它也是库内少数"赛事生命周期完整可见"的条目——从注册、比赛、发榜到四年半后公开化,每一步都有官方时间戳可查(§6.2)。

§0 读法三则:

  1. 这个条目是"挑战赛+数据集+评估方法学案例"三合一:数据本体、排名规则、赛后反思各有独立价值,引用时先想清楚自己要的是哪一层。
  2. 全文统计数字均出自挑战赛总结论文(arXiv:2301.03281)与官方 GitHub/官网;与第三方(openmedlab)统计冲突处已在坑 3、坑 8 存照。
  3. 检索时最大的坑是同名混淆:INSTANCE2022 是脑 NCCT 分割,不是心脏 LGE-CMR(委托方 brief 记作"心脏 LGE-CMR 挑战赛、ICCES/MICCAI 联合赛事",坑 1);也与 RSNA-ASNR-MICCAI 2022 ICH 分类赛(Kaggle)不是同一赛事(坑 9)。

三行小结:脑部、CT、二值、体素级——四个关键词就是本数据集的身份指纹;心脏/MRI/多类/切片级,出现任何一个都是在说别的数据集。

§1 数据集速览:十问十答

Q1:INSTANCE2022 这个名字怎么展开?
论文原文逐词拆解:INtracranial hemorrhage SegmenTAtioN ChallengE——颅内出血分割挑战赛。全称 The 2022 Intracranial Hemorrhage Segmentation Challenge on Non-Contrast head CT,即 2022 年平扫头颅 CT 颅内出血分割挑战赛。注意缩写里藏着一个"TA":这是把 SegmeNTAtioN 拆开的产物,不是笔误;真正的笔误在论文 Fig.1 把脑室内出血缩写成 IPH(坑 5)。

Q2:数据从哪来?
北京大学首钢医院 2017-2019 年确诊 ICH 的患者回顾性 NCCT,经该院批准收集,共 200 例。主办方为哈尔滨工业大学计算机科学与技术学院感知计算研究中心与北京大学首钢医院,研究受 NSFC(62001144/62272135/62001141)与深圳市科技创新委员会资助。

Q3:图像规格是什么?
原始 DICOM 转为 NIfTI(.nii.gz),体积尺寸 512×512×20 到 512×512×70(官方范围口径),面内 spacing 0.42mm、层厚 5mm(官方均匀化口径)。NIfTI 内保留原始 HU 值——参赛者可自定义窗宽窗位,官方建议 90HU/40HU。训练集 100 例带掩码,验证集 30 例仅图像,测试集 70 例不发放。

Q4:各向异性为什么是核心难点?
层厚 5mm vs 面内 0.42mm,体素各向异性比约 12:1(各向异性比 = 面内 spacing ÷ 层厚;逐例实测最高可到 24:1,坑 3)。对 3D 卷积网络,z 轴相邻体素在物理上相距 5mm——层间"上下文"基本靠插值想象;对 2D 方法,出血在层间的延伸关系又完全丢失。最终冠军方案是 2D/3D 混合集成(§5.4),说明这个问题没有单边最优解。

Q5:掩码是谁标的,可靠吗?
粗到细三段流水线:医学影像研究生与放射科医生用 Seg3D 平台粗标 → 资深放射科医生逐例精修 → 全体放射科医生交叉互检(double-check)+ 多数投票定稿。官方 GitHub 口径为"10 位经验丰富的放射科医生精修"。细节见 §3。

Q6:掩码里有什么类别?
只有一个:前景=出血(全部五类亚型 IPH/IVH/SAH/SDH/EDH 合并),背景=其余。掩码不携带亚型标签——这是论文自曝的局限(V-D1 节),做亚型多类分割的人需要自己重标或换 BHSD 等多类基准(§7.3)。

Q7:排名怎么算的?
四指标:DSC(重叠)↑、NSD(归一化表面距离)↑、RVD(相对体积差)↓、HD(Hausdorff 距离,mm)↓。排名法 aggregate-then-rank 三步:测试集逐例指标取平均 → 每个指标单独排名 → 四个名次平均为最终名次。HD=inf(预测里完全没有某个测试血肿)的队伍在该指标劣后名次——原则是漏诊等于严重临床错误。详见 §4。

Q8:谁赢了?
冠军 alias 为 vegetable,综合 DSC 69.25±19.14(nnU-Net 2D/3D 混合+Dice/加权 CE+集成)。DSC 单项最高的是亚军队 nvauto(NVIDIA Auto3DSeg/MONAI,DSC 72.06),但因为它漏检了测试血肿导致 HD=inf,按规则劣后为第 2 名——这是全场最有教学价值的案例(§4.3)。13 支队伍全排名见 §5.1。

Q9:我现在能拿到什么?
2026 年 9 月 11 日起,数据集在 Grand Challenge 平台对公众开放下载(此前四年半需签协议邮件个案发放)。官方 GitHub 代码(基线+docker 规则+赛果表)为 Apache-2.0。论文在 arXiv 免费可得。注意:测试集 70 例的 GT 至今未公开,最终排名无法第三方复现。

Q10:为什么它对 AI-Ready 重要?
两点。其一,它是颅内出血 3D 体素级分割的"第一块公开基准",后续多类出血分割研究(BHSD 等)都以它为对比起点。其二,它完整走过了"注册墙(签协议邮件发放)→ 赛后开放提交 → 完全公开下载"的演化路径,2026-09-11 的公开节点距本条目撰写仅半月——是研究数据集开放策略的鲜活样本。

§2 数据构成与规格

2.1 三层划分与规模

INSTANCE2022 数据本体为 200 例 NCCT 3D 体积,按"训练可看、验证半开、测试全闭"原则切成三层:

划分 例数 发放内容 用途 GT 状态
训练集 100 图像 + 体素级掩码(train/data 001-100 + train/label 001-100) 本地训练、交叉验证 公开
开放验证集 30 仅图像(evaluation 101-130) 在线验证榜提交 不发放(官方服务器评估)
封闭测试集 70 不发放 最终排名(docker 打包本地推演) 至今未公开

三层设计是典型的挑战赛防刷分结构:验证榜允许无限试错(350+ 有效提交),但最终名次由从未见过的 70 例决定,队伍必须提交 docker 镜像在组织者环境内跑完推理。这个设计后来被证明有效——验证榜名次与最终名次出现了明显重排(验证榜第 6 的 crainet 79.53 高于验证榜第 1 的 vegetable 79.12,而最终排名 vegetable 第 1、crainet 第 6),说明"验证榜刷分"确实存在。

100/30/70 的比例本身也有信息量:训练集只占一半——一半的例数养三套流程(训练公开、验证在线、测试封存),测试集占比 35% 远高于常规论文 10-20% 的留出惯例,说明组织者把"最终排名的可信度"置于"参赛者可用训练数据量"之上。这个取舍在 DSC 标准差里可见回报:±19 的波动幅度下,70 例的样本量刚好够让名次差异越过统计噪声(论文配了显著性检验)。

数据采集的临床口径:2017-2019 年北京大学首钢医院确诊 ICH 的患者回顾性序列,经该院伦理批准。亚型临床诊断覆盖五类——IPH(脑实质出血)、IVH(脑室内出血)、SAH(蛛网膜下腔出血)、SDH(硬膜下出血)、EDH(硬膜外出血)——但逐例亚型构成比例未公开,使用者无法核验各亚型样本量是否均衡。

2.2 图像格式与 HU 值保留

每例为 DICOM→NIfTI(.nii.gz)转换产物,体积尺寸官方范围为 512×512×20 到 512×512×70(第三方 openmedlab 逐例统计口径为 min (430,512,24) / median (512,512,29) / max (512,560,40),两口径并存见坑 8)。训练集 100 例合计 2,993 个 2D 层面(openmedlab 统计口径)。

一个对建模者重要的细节:NIfTI 文件内保留原始 HU 值,不做预窗化。官方推荐窗宽窗位 90HU/40HU(软组织窗观察出血的标准设置),但参赛者可以自由设计多窗输入——事实上这也是强队伍的普遍做法:亚军队 nvauto 的三通道方案族里,"单层面×三种 CT 窗"与"9 通道(相邻层+多窗)"都是可选项(附录 N),多窗让不同密度差的血液成分(急性血 40-80HU、凝血更高、血清化更低)在不同窗下各自可见。对比某些发布前已窗化归一到 [0,1] 的数据集,INSTANCE2022 在 AI-Ready 的"保留原始物理量"维度上是正面样本——它把"怎么窗"的设计自由留给了使用者,而不是替使用者锁死一种预处理。

拿到数据后,每个 NIfTI header 上值得先登记的五要素:三轴 spacing(get_zooms(),坑 3 的根源所在)、体积维度(20-70 层的 z 轴差异直接影响 batch/patch 策略)、数据类型(图像多为 int16 的 HU 值;掩码类型不保证 uint8,需显式二值化)、仿射矩阵方向(qform/sform,DICOM→NIfTI 转换的左右/前后方向陷阱)、以及层厚与层间距是否一致(同一卷内 layer thickness 与 spacing 不同的情形会造成几何错位)。附录 J 的加载骨架已把 spacing 检查纳入第一步。

2.3 spacing 与各向异性:官方口径与第三方波动

spacing 是本条目最重要的技术规格,存在两套口径:

口径 数值 来源
官方(论文+教程) 0.42mm × 0.42mm × 5mm arXiv:2301.03281;NVIDIA MONAI 教程同口径
第三方逐例统计 min (0.37, 0.37, 4.4) / median (0.45, 0.45, 5.0) / max (0.60, 0.60, 10.0) openmedlab 对发放训练集的实测

两者不构成矛盾:官方给的是"典型/均匀化"表述,第三方给的是逐例波动范围。但使用者的正确姿势是对每例读 NIfTI header 取真实 spacing 再做重采样,不要拿 0.42×0.42×5 一刀切——尤其 max 层厚 10.0mm 的存在意味着有些例子的各向异性比高达 24:1,比立题宣传的 12:1 还极端。论文/报告里引用本数据集时的口径声明模板:“官方标称 0.42×0.42×5mm;本实验逐例读 header 重采样(实测分布见 openmedlab 第三方统计)”——一句话同时覆盖两个口径,审稿人无从挑刺。

各向异性本身是本挑战赛的立题核心:面内 0.42mm 的分辨率足以看清 2-3mm 的微小出血灶,而 5mm 层厚意味着相邻层面之间 4.58mm 的物理空间没有任何采样。对 3D 卷积,z 向感受野里大半是插值产物;对 2D 卷积,跨层延伸的血肿(典型如 IVH 沿脑室铸型、SAH 沿脑沟蔓延)会变成"同一病灶的多个独立切片"。最终排名里 2D/3D 混合的冠军与纯 3D 队伍的位次分布,是这个问题最直接的实证回答(§5.3)。

预处理选型上,各向异性数据有四条路线,各有代价:

路线 做法 代价
逐层 2D 放弃层间建模,逐层独立分割 丢失跨层连续性;IVH/SAH 这类蔓延型病灶受伤
等向重采样 z 向插值到 0.42mm 等向 插值出虚假层间细节,3D 核会"认真学习"它们
保留原 spacing 3D 网络直接吃各向异性体素 感受野物理意义变形,需各向异性感知的卷积/池化
nnU-Net 自动 框架按 spacing 分布自动选目标 spacing 与 2D/3D 配置 需要接受框架决策;本赛事 7/13 队的选择

INSTANCE2022 上没有单边赢家(§5.2),但"等向重采样+全 3D"这条看似自然的路线没有出单项第一——插值层间细节的风险是实打实的。

2.4 掩码规格:二值的取舍

掩码为体素级二值图(0=背景,1=出血),与图像逐体素对齐,同尺寸 NIfTI 发布。五类亚型在掩码层面合并为一个前景类——论文 V-D1 明确承认这是局限:亚型"对临床诊断很重要",但本版数据未提供(坑 7)。

这个取舍可以理解(亚型标注的互检成本远高于"有没有出血"),但对使用者是实打实的功能缺失:

  • 想做多类亚型分割:本数据集不能直接用,需考虑 BHSD(2023 多类 3D 出血基准)或自行重标(§7.3);
  • 想做亚型条件分析(比如"SAH 为什么难"):只能靠测试集四分位体积分组与论文披露的亚型级聚合数字(SAH 平均 DSC 0.41),没有逐例亚型表;
  • 只关心"出血在哪、多大"(体积定量是最初动机):二值掩码完全够用,且少一层标签噪声。

工程处理上二值掩码还有两个注意点:其一,NIfTI 掩码的数据类型不保证是 uint8——加载后先做 np.unique 检查再二值化(mask > 0),避免浮点掩码或插值残差污染训练;其二,若做过任何重采样/裁剪增强,掩码必须用最近邻插值而图像用线性/双线性——混用插值方式是二值掩码出现"0.5 类灰边"的头号原因。这两点在同批发放的其他 NIfTI 数据集上也通用。

2.5 血肿体积分布:小血肿是主要矛盾

血肿体积是这个任务的临床终点,其分布决定了基准分数的地板:

  • 训练集统计(openmedlab 口径):min 0.2 cm³ / median 11.46 cm³ / max 155.11 cm³;
  • 测试集分组(论文口径,四分位):[0, 4213] / [4213, 7235] / [7235, 19640] / [19640, +inf) mm³。

论文 V-B 的核心发现是:体积小于 15000 mm³(15 cm³)的血肿上,多数队伍 DSC 常低于 0.3——不到中位数水平的一半。也就是说中位数(11.46 cm³)附近的样本恰好落在"最难"区间,而测试集四分位分组里最小的两组(<7235 mm³)全是重灾区。这不是队伍水平问题,而是任务内在难度:小血肿在 5mm 层厚下常常只占 1-2 个层面、几十到几百个体素,部分容积效应把边界糊成一团。使用者若只在全集平均 DSC 上对标,会系统性高估方法在小病灶临床场景里的可用性。

由此推出本条目最想传递的一条评估纪律:凡在本数据集上报分,必须分层报——至少按测试集四分位体积分组各报一行(或参照论文做法按 [0,4213]/[4213,7235]/[7235,19640]/[19640,+inf) mm³ 四组),小体积组单独给结论。全集均值在这个任务上几乎是最具误导性的单一数字:它可以被大血肿上的好成绩抬高,同时掩盖小血肿上的全军覆没。这一纪律同样适用于任何"病灶小且分布偏斜"的分割任务。

2.6 与 RSNA-ASNR-MICCAI 2022 Brain Hemorrhage 的边界

检索"颅内出血挑战赛 2022"必然撞上 RSNA-ASNR-MICCAI Brain Hemorrhage(Kaggle),两者极易混淆但完全不同(坑 9):

维度 INSTANCE2022 RSNA-ASNR-MICCAI 2022
任务 3D 体素级二值分割 2D 切片级多类分类
输出 体素级掩码(出血区域) 切片级标签(出血/类型/位置)
数据量 200 例 3D 体积 约 200 万张 2D 切片
影像 NCCT(同一模态) NCCT(同一模态)
主办 哈工大+北京大学首钢医院(MICCAI 2022 卫星) RSNA/ASNR/MICCAI 联合(Kaggle)
标注 体素级(10 位放射科医生流水线) 切片级(多位医生投票)
公开状态 2026-09-11 起公开 Kaggle 常年公开

一句话记忆:RSNA 赛回答"这张切片有没有出血、哪类";INSTANCE2022 回答"这个病人的出血在哪个体素、体积多大"。两者在文献里常被并列引用为"分类-分割"互补对,但数据、标签、评估完全不可互换。

混淆的实际代价不止于引用出错:两个数据集的下载渠道(Kaggle vs GC)、许可约束、文件形态(海量 2D 切片 vs 200 个 3D 体积)、甚至"训练一个基线要多久"都不同——拿 RSNA 的训练脚本跑 INSTANCE 会死在数据加载,反过来则死在显存。检索到任何"2022 颅内出血挑战赛"的结果时,先认平台(Kaggle/GC)再认任务(分类/分割),两步就能避开坑 9。

2.7 参与漏斗与 docker 机制

从注册到决赛的参与漏斗(论文 IV-A 口径,单源):

阶段 数量 门槛
申请 500+ 提交注册意向
获批 70 队 签署数据使用协议(2022 年拒绝过未签申请者)
验证榜活跃 30 队 350+ 有效提交
决赛完赛 13 队 docker 镜像 + 短论文(2022-08-14 截止)

漏斗的收窄主要发生在"签协议→坚持到提交 docker"两道坎:前者筛掉了不认真或无法满足协议条件的申请者,后者筛掉了工程能力不足或算力不继的队伍。docker 提交制是全流程的技术关键:队伍把推理代码封装为容器镜像提交,由组织者在统一环境对 70 例测试集运行——这同时解决了三个问题:测试数据零泄露、运行环境标准化、评测过程不可干预。仓库内的 docker 规则与示例至今保留(Apache-2.0),任何想复刻这套赛制的人可以直接拿去当模板(附录 D 决策树"要设计新挑战赛"分支)。需要注意 docker 制的一个隐性约束:容器内推理有运行时限(附录 O),重度集成方案(nvauto 的 18 模型)必须优化吞吐——挑战赛分数里隐含了效率分。

§3 标注流水线:三段粗到细如何保证体素级质量

3.1 三段流水线

体素级标注比切片级分类贵几个数量级,INSTANCE2022 的解法是粗到细(coarse-to-fine)三段:

  1. 粗标:医学影像研究生与放射科医生在 Seg3D(犹他大学 SCI 研发的开源体数据标注平台)上圈出出血区域——研究生出主力劳动,医生把关方向;
  2. 精修:资深放射科医生逐例修订粗标掩码,修正边界、剔除假阳性(如钙化、伪影、正常血管结构);
  3. 交叉互检 + 多数投票:全体放射科医生对精修结果交叉复查(double-check),分歧处多数投票定稿。

官方 GitHub 的对外口径是"refined labeling from 10 experienced radiologists"(10 位经验丰富的放射科医生精修)——粗标人力未披露具体人数,只知道包含医学影像研究生。

三段的职责与质量贡献并不均等:

层 执行者 决定的质量维度 成本属性
粗标 研究生+医生(Seg3D) 召回(有没有漏掉的出血区) 最大人力项,可并行
精修 资深放射科医生逐例 精确度(边界与假阳性) 稀缺专家工时,不可替代
互检+投票 全体放射科医生 一致性(收敛群体边界) 边际成本低,协调成本高

读表要点:这套结构的"质量上限"卡在精修层的专家水平,"下限"由互检层的投票兜住——粗标层再差也只是增加精修工作量,不会直接进入最终掩码。这是它比"单人标注+抽检"模式稳健的根本原因。

3.2 为什么需要"互检+投票"这一层

NCCT 出血标注的观察者间变异集中在三类边界情形:小血肿与钙化的鉴别、SAH 沿脑沟的薄层蔓延、靠近颅骨内板的 SDH 与伪影区分。单一医生的判定在这些情形下会漂移,交叉互检+多数投票把"个人边界"收敛为"群体边界"。这与病理领域 PANDA-PLUS(库内条目)"学生粗注→专家终审"的单人终审结构不同:INSTANCE 用的是委员会收敛模式,付出的是更多医生工时,换来的是边界判定的群体一致性。两种模式没有绝对优劣——委员会模式适合"边界争议大、类内异质性高"的任务(出血正是),单人终审适合"有明确金标准层次"的任务(Gleason 分级正是;后者正是库内条目 PANDA-PLUS 的流水线,两相对照可读 §8.4 与该条目 §3)。

3.3 标注质量对下游指标的传导

标注质量直接塑造了四指标的地板与天花板。NSD(表面距离)与 HD(边界距离)类指标对掩码边界的体素级抖动极其敏感——如果不同医生对 SAH 薄层蔓延的边界判断差 1-2 个体素,任何算法都拿不到高分。这解释了两个现象:其一,NSD 全场最高也只有 53.59%(冠军),表面一半以上的采样半径内边界对不齐;其二,论文把 SAH 单独点名(平均 DSC 0.41),其中既有任务难度,也有标注共识难度。读排行榜时要把"算法学瓶颈"与"标注收敛瓶颈"分开算账——本数据集上两者纠缠在一起,无法完全分离。一个间接信号是 NSD 的全场水位:冠军也只有 53.59%,即在给定的容差半径下,边界对齐率刚过一半——这个数字里有多少是算法画不准、多少是医生之间本就没对齐,论文没有(也无法)给出分解;把它全记在算法头上是不公平的读法。

3.4 临床动机链条(为什么值得做)

论文 I 节给了一条完整的动机链:ICH 占卒中死亡首位 → 1 个月死亡率约 40% → 血肿体积是干预阈值与预后核心指标 → 临床标准做法是 ABC/2 手工估算 → ABC/2 对不规则大血肿(尤其 SDH 的月牙形、IVH 的脑室铸型)误差显著 → 需要体素级自动分割提供可靠体积。这条链上每一环都有文献支撑,也让"二值分割"这个看似保守的任务定义有了明确的临床落点:不需要区分子型,先把体积量准。RVD(相对体积差)进入四指标体系正是这条链的指标化——它测的就是"体积量得准不准"。

3.5 标注成本账与流水线可复制性

体素级标注的成本可以从结构反推:粗标(研究生,Seg3D 逐层圈画)+ 精修(资深医生逐例修订)+ 交叉互检(全体医生过目+分歧投票),三层都要按例计工时;200 例、平均 29 层(openmedlab 统计 median (512,512,29))、2,993 个训练层面的标注面,是一个"月级团队工时"量级的工程。官方未公布逐例耗时,但三层结构与 10 位医生的口径足以说明:这套数据集的主要成本在标注人力而非采集。

对想复制这条流水线的团队,三条可迁移要点:其一,粗标工具选支持体数据的平台(Seg3D 之外,3D Slicer/MONAI Label 亦可),2D 切片工具会在层间一致性上吃亏;其二,精修权限必须给到资深临床医生——INSTANCE 的质量上限来自这一层,而不是粗标的数量;其三,交叉互检+多数投票的"分歧登记"值得保留(即便最终只发布投票结果),分歧案例本身就是后续一致性研究的原料——INSTANCE 未公开这类登记,是它的文档缺口之一(FAQ Q19)。

§4 评估方法学:四指标与 aggregate-then-rank

4.1 四指标各测什么

INSTANCE2022 的评估体系由四个互补指标构成,每个都有明确的临床转译:

指标 全称 方向 测什么 临床转译
DSC Dice Similarity Coefficient ↑ 预测与 GT 的重叠度(2×交/和) "找全了吗、找对了吗"的综合分
NSD Normalized Surface Dice ↑ 边界在容差半径内的表面占比 “边界划得准吗”(对体积定量敏感)
RVD Relative Volume Difference ↓ \ 预测体积−GT 体积\
HD Hausdorff Distance (mm) ↓ 最坏情形边界距离 “最糟的错有多离谱”(漏检→inf)

四个指标合起来覆盖"重叠-边界-体积-最坏情形"四个正交维度,比单一 DSC 榜单丰富得多。其中 RVD 直接对应血肿体积定量的临床需求——一个 DSC 高但 RVD 大的模型意味着"画了很多对的地方,但整体画大了/小了",对剂量决策类应用是危险的。

为什么是这四个(而不是常见的 DSC+HD 两件套):DSC 是社区通用语,保留它为了可比性;NSD 的入选是对 HD 不稳健性的补丁——HD 对单个离群边界体素敏感,NSD 用"容差半径内表面占比"把边界质量变成有界量;RVD 是临床终点的直接指标化(§3.4 动机链的最后一环);HD 保留最坏情形的"报警器"角色——然后赛事马上被它的 inf 特性上了一课(§4.3)。四指标的组合本身记录了一条方法学演化路径:从"一个重叠分"到"重叠+稳健边界+体积+最坏情形"的多维体检。

4.2 排名法:aggregate-then-rank 三步

四指标分数不能直接加权(量纲不同、分布各异),INSTANCE2022 采用"先聚合、后排名"三步:

  1. 聚合:每支队伍在 70 例测试集上的逐例指标取平均,得到四个标量;
  2. 单指标排名:按 DSC/NSD/RVD/HD 分别给 13 支队伍排名次;
  3. 综合:四个名次取平均,即为最终排名;并列时以 DSC 名次优先。

这个设计的优点是不受指标量纲与离群分数影响(一支在某指标上爆雷的队伍最多丢一个名次的权重);缺点是丢失了分数差距信息——第 1 与第 2 名 DSC 差 2.81 分(69.25 vs 72.06),在排名法里只体现为 1 个名次。论文 Fig.6 另配 one-sided Wilcoxon signed-rank 显著性检验(5% 水平)逐指标标注队伍间差异是否显著,部分弥补了排名法的粗糙。

排名法与"标准化分数加权"两种路线的对照,适合在设计自家评测时参考:

维度 aggregate-then-rank(本赛事) 分数标准化加权(常见替代)
量纲处理 天然免疫(只排名次) 需 z-score/min-max 等预处理
离群分数 影响≤1 个名次 可被单个极端值拖走
分数差距信息 丢失(69.25 与 72.06 同为"名次差 1") 保留
inf/坏值 需要专门规则(HD=inf 劣后) 一个 inf 污染整列
可解释性 "四个名次的平均"直白 权重设置本身需要辩护

INSTANCE 的选择体现了"宁要粗糙但要稳"的赛事工程哲学;代价则是本条目反复出现的现象——综合名次与单项分数脱钩(坑 6)。设计自家评测时的三个动作:先列错误类型清单(漏诊/大错位/体积偏差各值多少)、再选指标组合覆盖清单、最后定合成规则并在开赛前公示——INSTANCE 的四指标覆盖了前两步,第三步(HD 劣后)的争议本可通过赛前公示避免。

4.3 HD=inf 事件:规则、争议与反思

这是 INSTANCE2022 最有教学价值的评估案例。规则设定:若预测中完全缺失某个测试血肿,该例 HD 记为 inf;HD 为 inf 的队伍在该指标排名中劣后(排到所有 HD 有限的队伍之后),原则是漏诊等于严重临床错误,不能靠其余样本的好分数平均掉。

直接后果:亚军队 nvauto(NVIDIA Auto3DSeg,18 个 2D SegResNet 模型集成)DSC 72.06 为全场单项最高、NSD/RVD 也不差,但因漏检至少一个测试血肿导致 HD=inf,HD 名次被劣后,四个名次平均后屈居第 2;冠军 vegetable 在 DSC 上低 2.81 分但 HD 有限(35.27mm),综合名次反超。事后看 NVIDIA 教程页的自述——“won 2nd place (1st place in terms of Dice score)”——与论文 Table IV 完全互证。

更有价值的是组织者赛后的自我反思(论文 V 节):HD=inf 情形下"inf"不是一个可比较的数值,劣后规则虽保住了临床直觉,却让 HD 名次实际上退化为"是否漏检"的二元开关;论文因此建议未来挑战赛弃用 HD、保留 DSC/NSD/RVD。这段反思对任何要设计医学分割榜单的团队都是现成的先例:最坏情形指标(HD)与平均型指标(DSC/NSD)的冲突没有免费解,要么像 INSTANCE 一样接受"劣后"的粗糙,要么在指标设计上提前堵死 inf。事后的设计选项至少有四个:其一,截断 HD(cap 到固定上限如 100mm),保留"坏但可排序";其二,改用鲁棒变体(95% HD),牺牲最坏情形敏感性换排序性;其三,把"漏检"从 HD 中拆出、作为独立的零/非零二元门指标;其四,如论文最终建议,弃用 HD 只留 DSC/NSD/RVD——但要意识到这会丢掉"漏检报警器",需要另外的机制补位。INSTANCE 的实践证明:规则争议要在发榜前解决,这堂课上完了两遍(发榜一次、反思一次)。

4.4 与库内其他挑战赛评估体系的对照

把 INSTANCE2022 放进库内挑战赛条目的评估谱系,能看清它的位置:

条目 指标体系 排名法 防漏诊设计
INSTANCE2022 DSC/NSD/RVD/HD 四指标 aggregate-then-rank HD=inf 劣后(赛后建议弃用 HD)
ISLES 2022(isles, 495) 多指标聚合(ATLANTIS 体系) 排名聚合 无 inf 机制(缺血灶不会"整块缺失")
ACDC(acdc, 511) DSC + HD 单指标直读 无
M&Ms(mms, 516) DSC + HD(跨域分组) 域内排名 无

INSTANCE2022 是库内唯一一个把"漏检"上升为排名规则、又赛后主动反思该规则的条目——这一来一回让它成为评估方法学教学的完整案例。对库内使用者的实操建议:读这些挑战赛条目的评估节时,把"指标怎么算"和"名次怎么合成"分开检查——很多争议其实出在后者(合成规则)而非前者(指标定义),INSTANCE 的 HD=inf 事件两层各占一半。

§5 结果与基准:13 队排名、方法谱系与两大瓶颈

5.1 最终排名全表(论文 Table IV 口径)

测试集 70 例、四指标、aggregate-then-rank 的最终结果(DSC/NSD 以 % 计,RVD 无量纲,HD 以 mm 计):

排名 队伍 alias DSC NSD RVD HD 方法要点
1 vegetable 69.25±19.14 53.59±15.65 0.21±0.20 35.27±28.47 nnU-Net 2D/3D 混合、Dice+加权 CE、集成、patch-based
2 nvauto 72.06±21.07 53.43 0.26 inf NVIDIA Auto3DSeg:18 个 2D SegResNet 集成(CV Dice 0.7959,DGX-1 4×V100)
3 mec-lab 69.00 51.25 0.31 inf 南方医科大学;nnU-Net 3D + 轮廓损失
4 ibot 68.94 — — — —
5 stubmers 67.97 — — — —
6 crainet 67.39 — — — —
7 superembrace 66.84 — — — —
8 scan 65.28 — — — —
9 dolphins 64.97 — — — —
10 nic-vicorob 62.14 — — — —
11 2i_mtl 61.95 — — — —
12 avich 57.04 — — — —
13 visal 40.22 — — — —
基线 SLEX-NET(重训) 52.83±28.92 38.42 0.725 309.06±287.31 组织者前作架构在 INSTANCE 数据重训

读表五则:

  1. DSC 分数带整体压扁:冠军也只有 69.25,第 4-11 名挤在 61.95-68.94 的 7 分带宽里——远低于 ACDC 心脏分割 90+ 的常见水平,直观体现任务难度;
  2. HD=inf 覆盖面惊人:13 队中仅 T1/T7/T11/T12/T13 五队 HD 有限——八支队伍(含第 2、3 名)都至少漏检过一个测试血肿;
  3. DSC 与综合名次不一致是常态而非例外(T2/T3 的 DSC 都高于 T1),引用时必须区分"单项最高"与"综合冠军";
  4. 基线离冠军 16.4 分(52.83 vs 69.25),说明数据集本身提供了充分的改进空间,不是"随便都能刷满"的水基准;
  5. 最后一名断崖(visal 40.22,比第 12 名低 16.8 分)通常对应训练配置失败而非方法路线差异。

验证榜(Table III)参考数字:验证榜第 1 名 79.12(vegetable)、第 6 名 crainet 79.53、nvauto 78.21、基线 64.08。验证榜分数普遍高于测试集(79 vs 69),且名次重排——防过拟合设计的目的达成。

分数水位的横向定位(同样是"分割"这个任务名下):

任务 代表基准 SOTA 水平 DSC 与 INSTANCE 的差距来源
心脏 CMR 腔分割 ACDC(acdc, 511) 0.91+ 等向高分辨率、器官边界清晰
大器官 CT 分割 TotalSegmentator 谱系 0.85-0.95 目标大、训练数据海量
肿瘤分割(BraTS 类) BraTS 0.88-0.93 MRI 等向、社区多年迭代
ICH NCCT 分割 INSTANCE2022 0.6925(综合) 12:1 各向异性+小目标+单中心 200 例

约 20 个百分点的差距不是"社区水平不行",而是任务难度的诚实反映——这也是为什么"拿 INSTANCE 分数与器官分割分数比较"毫无意义,但"拿 INSTANCE 的 2D/3D 路线分布推断其他各向异性任务"很有意义。

5.2 方法谱系:全员 U-Net 系的收敛

论文 Table II 汇总的 13 队方法统计:

  • 骨干:13/13 全部 U-Net 变体(含 nnU-Net、SegResNet 系、Attention U-Net 等)——无一队使用 Transformer 主干拿到更高名次;
  • nnU-Net 采用率:7/13 直接使用或改造 nnU-Net(其自带的重采样/patch/集成策略与各向异性任务天然契合);
  • 集成:10/13 使用模型集成(冠军与亚军都是重度集成者);
  • 2D/3D 路线:4 队 2D、7 队 3D、2 队 2D/3D 混合——前三名恰好是 2D/3D 混合×1、纯 2D 集成×1、纯 3D×1,路线之争没有单边赢家;
  • 数据增强:13/13 全部使用;
  • 后处理:仅 1 队使用(TFE 类连通域清理等)——后处理在这个任务上几乎没人做出增益。

方法收敛本身是信息:当 13 支队伍、350+ 次验证提交、一个赛季的试错全部收敛到"U-Net 系+nnU-Net+集成+增强"时,说明当前方法论的边际改进空间在数据侧而非模型侧——下一个百分点的来源应该是更多数据、亚型标签或更好的各向异性处理,而不是换个主干。

方法谱系速查(论文 Table II 汇总口径):

设计维度 分布 读法
主干 13/13 U-Net 系 无 Transformer 队伍进入前列——卷积先验在小数据+各向异性下仍占优
nnU-Net 7/13 框架即方法论:自动重采样/patch/集成全部内置
集成 10/13 困难任务上的"免费午餐",前三名全员集成
维度路线 2D×4 / 3D×7 / 混合×2 与"3D 更自然"的直觉相反,2D 路线出了单项 DSC 第一
数据增强 13/13 唯一的全票项
后处理 1/13 连通域清理类增益在本任务上未被验证为普遍有效

5.3 两大瓶颈:小血肿与 SAH

论文 V-B 点名了两道所有队伍的公共难关:

瓶颈一:小血肿。 体积 <15000 mm³ 的血肿上多数队伍 DSC 常 <0.3(注意论文此处"15000 m³"为单位笔误,应为 mm³,见坑 4)。机理:5mm 层厚下小血肿仅占 1-2 个层面、数十到数百体素,部分容积效应使边界 HU 值介于血与脑组织之间,任何阈值与分割器都在这层糊掉的过渡带上挣扎。临床后果最重(小血肿恰恰是"要不要干预"的灰色地带),算法表现却最差——这是本基准最值得后续工作攻击的点。对要在小血肿区做改进的后续工作,论文数据隐含两条路径提示:其一,检测-分割解耦——先用高召回检测器定位(小血肿的代价集中在召回端),再对检出区域做局部精细分割,把"找没找到"与"画得准不准"分开优化;其二,窗策略倾斜——小血肿的 HU 对比度在窄窗下更可辨,亚军队的多窗方案(附录 N)是对这个方向的间接支持。两条路径都还没在 INSTANCE2022 上被系统验证,属于留给社区的开放题。

瓶颈二:SAH。 蛛网膜下腔出血的平均 DSC 仅 0.41,为五亚型最难。机理:SAH 沿脑沟与基底池呈薄层蔓延,形态高度不规则、边界与脑脊液信号接近,且常常双侧多灶。对二值掩码而言,亚型难度的差异只能从论文的亚型级聚合数字侧面观察(逐例亚型表未公开),但这已经足够指导实践:如果你的应用场景 SAH 占比高(如动脉瘤破裂后随访),INSTANCE2022 训练出的模型需要额外谨慎评估。更务实的做法是把 SAH 场景的验收拆开——先用"漏检率=0"做检测红线(临床首先要的是"有没有"的高召回信号),再谈精细分割的体积定量;用平均 DSC 单指标验收 SAH 模型,风险结构是错位的。

5.4 冠军方案的启示:2D/3D 折中

冠军 vegetable(论文附录指向 Li and Chen, 2022 的 nnU-Net 2D/3D 混合方案)的配置:nnU-Net 框架、2D 与 3D 配置混合训练、Dice+加权交叉熵损失、模型集成、patch-based 推理。把五个组件拆开看各自的贡献逻辑:nnU-Net 提供"不踩坑的地板"(自动 spacing 感知重采样、patch 策略、训练计划);2D/3D 混合对冲路线风险(两种感受野各取所长,等价于对"层间信息到底有多少可用"这个问题本身不下注);Dice+加权 CE 同时照顾重叠目标与前景极度不平衡(血肿体素占比极小);集成压方差;patch 推理控制显存并天然带边界平滑。它给各向异性分割留下一条可迁移的经验:在 12:1 各向异性下,"2D 抓面内细节 + 3D 抓跨层连续性"的折中比单押一边稳——纯 2D 的亚军队(nvauto,DSC 单项第一)证明 2D 路线在重叠类指标上不输,纯 3D 的季军(mec-lab)证明 3D 也能到 69,但综合名次第一的恰是混合者。NVIDIA 后来把 INSTANCE 收录进 MONAI Auto3DSeg 官方教程(其亚军方案完整复现于教程中),等于给这条经验盖了工程界的章。

5.5 基线 SLEX-NET:重训口径与引用注意

官方基线 SLEX-NET(Squeeze-and-Excitation Long-axis Extra-branch Network)来自组织者前作(IEEE JBHI 2022, doi:10.1109/JBHI.2021.3103850)。三个引用注意点:

  1. 重训口径:原论文的数据集与 INSTANCE 数据集不同,榜单上的 52.83±28.92 是"该架构在 INSTANCE 数据上重新训练"的结果,不能与 SLEX-NET 原论文的分数混引(坑 2);
  2. 分数解读:52.83 的 DSC 与 0.725 的 RVD 说明基线在体积定量上离可用很远(体积平均偏差 72.5%),但 HD 309.06mm 有限(不漏检),反而让它在 HD 名次上好于八支决赛队——一个纯粹的"指标体系反差样本";
  3. 检索坑:openmedlab 等第三方给的 ieeexplore 9511297 链接是 SLEX-NET 原论文而非 INSTANCE2022 总结论文——INSTANCE2022 至今没有正式期刊版,主引用只能是 arXiv:2301.03281(坑 2)。

5.7 给基准使用者的分数对齐清单

要在文献或自家实验中"对齐 INSTANCE2022 的数字",逐项自查:

检查项 合格标准
榜别 明说验证榜(79 档)还是测试终榜(69 档)还是自留出集
指标集 四指标全报;只报 DSC 会被质疑选择性报告
分层 按体积分组报小血肿组(§2.5 纪律)
协议 名次合成规则说明(aggregate-then-rank,勿与分数平均混淆)
口径 基线 52.83 标注"重训";spacing/体积标注官方/第三方口径
复现声明 终榜引用注明"组织者环境、GT 未公开";自家结果给出复现代码路径

六项全过的对比实验,才具备与 13 队榜单或后续文献对话的资格——这也是本条目把评估协议写这么长的原因:INSTANCE2022 的可复用价值一半在数据、一半在这套协议。

5.6 参赛生态:方法、算力与开源

把 13 支决赛队伍当作一个生态切片看,有三点值得记录:

算力跨度巨大但名次不与算力成正比。 亚军 nvauto 用 DGX-1(4×V100)跑 1600 epoch、18 模型集成,是全场算力天花板;而冠军 vegetable 的 nnU-Net 混合方案在论文附录的配置描述里并未显示同量级资源。中游队伍的普遍配置是单机多卡+轻量集成。这说明在前 10 名的带宽里(61.95-72.06),方法与训练策略的贡献大于原始算力。

集成的边际收益明显。 10/13 队集成,且前三名全是集成者(混合集成/18 模型/不确定性集成)。在 DSC 只有 0.6-0.7 水位的困难任务上,集成几乎是"免费"的 1-2 个百分点——但也意味着单模型推理成本被放大 10 倍以上,临床部署时要重新权衡(这也是"挑战赛分数≠部署可用"的又一例证)。

开源率极低。 论文 V-D3 自述 13 队仅 1 队开源了自己的方案代码。对组织者而言这直接削弱了基准的"可复现贡献"——好在 NVIDIA 把亚军方案完整公开(附录 N)+ 官方基线 Apache-2.0,社区至少有一条可复现的强方法路径。论文同时预告了未来届次的改进方向:弃用 HD、多任务扩展、强制开源——若举办,本条目附录 G 的维护触发点将启动增补。

§6 获取与许可:从注册墙到公开化

6.1 资产三层、获取三种

INSTANCE2022 的可获取资产分三层,许可各不相同:

资产 位置 许可/条件 当前状态(2026-09)
数据本体(200 例 NIfTI) Grand Challenge 平台 instance.grand-challenge.org/Dataset/ 2022-2026.09:签使用协议→邮件 INSTANCE2022@outlook.com 个案发放;2026-09-11 起:公开下载 公开(公开后是否保留协议约束待核,见 6.3)
官方代码(基线+docker+赛果) github.com/PerceptionComputingLab/INSTANCE2022 Apache-2.0(LICENSE 文件原文核验) 公开
总结论文 arxiv.org/abs/2301.03281 arXiv 默认许可(未正式发表) 公开

代码仓库内还包含:Baseline(基线训练代码)、docker 规则与示例(参赛提交的技术规格)、Agreements/instance2022_agreements.pdf(数据使用协议,2022-03-31 提交)、Challenge result/instance_result.xlsx(赛果表,2025-06-03 上传)。三层资产间的引用关系值得注意:数据(GC)→ 由协议(GitHub PDF)治理 → 由代码(GitHub Baseline)示范用途 → 由论文(arXiv)记录结果——四个实体分散在三个平台,任何一处引用都应同时给出"数据+论文"两个定位符(FAQ Q31 的引用格式即按此设计)。

6.2 时间线:一个数据集的开放化历程

把数据可得性单独拉成时间线,能看到一条完整的"注册墙→公开化"演化曲线:

时点 事件 数据可得性
2022-03-28 注册开放(签协议→邮件申请) 仅获批者
2022-04-06 训练集发布 70 支获批队伍
2022-07-15 验证集发布+验证榜开放 同上
2022-08-14 docker+短论文提交截止 —
2022-09-18 MICCAI 2022(新加坡)宣布获奖者 —
2023-01-09 总结论文提交 arXiv 学术界可读不可得数据
2026-09-11 GC 官网 NEWS:数据集对公众完全开放 任何人可下载

前四年半(2022.03-2026.09)里,数据严格走"签协议→邮件个案发放"通道,2022 年曾拒绝未签协议的申请者。2026-09-11 的 NEWS 原文(GC 官网快照):“We have made the dataset open to the public!!!..get access to the data download link in the Dataset part of this challenge page”。这个节点距本条目撰写(2026-09-26)仅半月,所有依赖此数据的下游工作(BHSD 对比实验、SAH 分割研究等)此前实际只能在申请获批后进行。

逐节点解读这条时间线:注册墙阶段(03-28 至 04-06 之间)筛人靠协议;训练集发放后数据在获批圈内半封闭流通;验证榜期(07-15 起)是唯一的公开试错窗口;arXiv 论文(2023-01)让"结果"公开但"数据"仍封闭——这是挑战赛数据集的典型中间态:知识开放、物料封闭;2026-09-11 的公开化把物料也打开了,整个生命周期闭环。对研究数据治理的人来说,这个"知识先行、物料滞后四年半"的节奏是可量化的样本:从论文公开到数据公开间隔约 3 年 8 个月。

6.3 公开化之后:两个待核问题

公开下载是重大利好,但有两个问题截至抓取时点无法核验(GC 数据页对爬虫返回 403,需登录视角;协议 PDF 条款未成功抓取,坑 10):

  1. 协议约束是否保留:公开下载是否仍绑定原使用协议(禁止再分发、学术用途限制、引用义务)?保守做法是下载前通读 Agreements PDF 并按其执行;
  2. GC 账号要求:GC 平台下载通常仍需注册平台账号(免费),"公开"指不再需要个案审批而非无门槛匿名下载。

核验这两个问题的操作路径:登录 GC 平台访问 Dataset 页(人工视角)看下载入口旁是否列有协议条款;比对 Agreements PDF 与页面的许可表述是否一致;如有歧义,邮件 INSTANCE2022@outlook.com(官方联系通道,FACTS 存照)书面确认并把回复留档——这也是附录 G 把"条款重申"列为最高优先维护触发点的原因。

6.4 AI-Ready 评估

按库内 DAIMS 框架评估(完整打分表见附录 B):

  • 可得性:公开直链(GC 平台),4 年半注册墙史后终于全开放——高分但历史包袱仍在(旧文献里全是"upon request"口径);
  • 机器可读性:NIfTI 标准格式+保留原始 HU+规整文件命名(001-100 双目录结构)——直接可被 MONAI/nnU-Net 管线吞入,高分组;
  • 标注可用性:体素级掩码+训练集全公开 GT——但无亚型标签、无逐例元数据(年龄性别未发放)、无逐例 spacing 清单;
  • 文档完备性:论文+Zenodo 挑战赛描述文档(doi:10.5281/zenodo.6362221)+GitHub README 三层文档,但协议 PDF 条款与逐例元数据缺位;
  • 可复现性:基线代码 Apache-2.0+验证榜公开,但测试集 GT 不发放、最终排名不可第三方复现——这是挑战赛类数据集的结构性上限。

综合定位:AI-Ready 中上水平,各向异性 3D 分割方向的事实标准输入,短板在元数据与亚型标签而非格式与可得性。

6.5 与库内可获取性光谱的对照

把本条目放进库内数据集的获取方式光谱,INSTANCE2022 占据一个独特位置:

获取模式 库内代表 INSTANCE2022 位置
公开直链(CC 类许可) 多数 Kaggle/HF 数据集 2026-09-11 后进入此档
注册下载(免费账号) GC 平台多数挑战赛数据 当前状态大概率在此档
签协议+邮件个案发放 请求制标注数据(如 PANDA-PLUS 掩码) 2022.03-2026.09 在此档四年半
封闭不发放 各挑战赛测试集 70 例测试集永久在此档

值得注意的是它的"档位迁移"轨迹:绝大多数库内条目终生停留在单一档位,而 INSTANCE2022 在四年半内完成了"签协议个案制→公开直链"的迁移——这种迁移在库内仍属少数,且迁移后旧文献的"upon request"口径与本条目的公开口径并存(引用时注意时点)。

§7 生态与影响

7.1 主办方谱系

INSTANCE2022 出自哈尔滨工业大学感知计算研究中心(GitHub org 即 PerceptionComputingLab)与北京大学首钢医院的联合团队。核心人物:一作 Xiangyu Li(李翔宇)与二作 Gongning Luo(罗 Gongning)为组织主力,Kuanquan Wang(王宽全,感知计算研究中心主任)与末位作者 Shuo Li 为学术带头人;医院侧由 Hongyu Wang 等负责数据与标注。资助方为 NSFC(62001144/62272135/62001141)与深圳市科技创新委员会(RCBS20210609103820029/JCYJ20210324131800002)。

总结论文的 35 人署名是一份"组织者+决赛选手"混合名单:NVIDIA 的 Andriy Myronenko 与 Md Mahfuzur Rahman Siddiquee(亚军队 nvauto)、TU Darmstadt 的 Antoine P. Sanner 与 Anirban Mukhopadhyay、深圳队的 Xingyu Zhao 与 Weiping Liu、Toronto 的 Bradley J. MacIntosh、Girona/UdL 的 Valeriia Abramova 与 Xavier Lladó 等参赛队代表跨队署名——MICCAI 挑战赛总结论文的典型署名模式,既是致谢也是数据集社区的"创始名单"。

7.2 工业界端口:NVIDIA MONAI 教程

NVIDIA 把 INSTANCE22 官方收录为 MONAI Auto3DSeg 教程任务:教程用 Auto3DSeg 自动流水线(2D SegResNet 系 18 模型集成)在 4×V100 DGX-1 上复现了亚军方案,交叉验证 Dice 0.7959,并在教程页自述"won 2nd place (1st place in terms of Dice score)"——与论文 Table IV 的 T2 行完全互证(这也是少数有工业界独立旁证的数字)。对使用者,这个教程是全框架复现亚军结果的最低成本路径:不需要自己拼 nnU-Net 配置,Auto3DSeg 的自动搜索+集成已给出接近 SOTA 的模板。复现路径五步:装 MONAI → 按 Auto3DSeg 目录约定放置训练数据(images/labels)→ 调用 Auto3DSeg 启动(自动完成算法选择、超参搜索、K 折训练)→ 18 模型集成推理 → 用附录 K 的协议算四指标。教程在 4×V100 上跑通了全程;更小算力可减少集成模型数并接受分数下降(CV Dice 0.7959 是 18 模型的口径)。教程之外还有两条开源路径:其一是官方 Baseline(仓库内,Apache-2.0)——分数低(重训 52.83 口径)但结构极简,适合当"管线通了没有"的冒烟测试;其二是复现季军思路(nnU-Net 3D+轮廓损失)——轮廓类损失对边界质量(NSD/HD)的增益逻辑在多数框架里可移植。三条路径覆盖"冒烟—逼近 SOTA—边界专项"三种预算。

7.3 域内景观:出血分割基准的坐标系

把 INSTANCE2022 放进颅内出血数据集景观(论文相关工作+后续文献口径):

数据集/赛事 任务粒度 亚型 规模 可得性
CQ500 影像科自用基准 分类为主 491 例 公开
RSNA-ASNR-MICCAI 2022 2D 切片级分类 5 类+位置 ~200 万切片 Kaggle 公开
INSTANCE2022 3D 体素级二值分割 合并(不分) 200 例 2026-09 公开
BHSD(2023) 3D 体素级多类分割 5 类分列 404 例 公开

INSTANCE2022 的历史坐标是"第一个公开的 3D 体素级 ICH 分割基准"——在它之前,体素级分割研究只能用私有数据或非公开标注;在它之后,BHSD 等多类基准把亚型维度补上。两者构成"二值(大而早)→多类(晚而全)"的接力,今天做出血分割应该两个都跑:INSTANCE2022 用于对齐历史文献与验证各向异性策略,BHSD 用于亚型细分类。

为什么二值先于多类出现(而多类反而更晚更小)?因为"有没有出血"的标注争议远小于"是哪种出血"——SAH/SDH 在靠近颅骨区域的鉴别连放射科医生之间都有分歧(§3.2)。INSTANCE 用二值任务换到了标注可行性与质量上限,代价是亚型信息缺失(坑 7);BHSD 们补亚型时必须重新面对标注收敛问题。这条"任务定义×标注可行性"的权衡线,是解读任何医学分割数据集演进史的通用透镜。

7.4 后续学术使用与第三方收录

以 INSTANCE2022 为对比基准或数据源的后续工作可归为四类:

  • 多类出血分割接力:BHSD(2023)在论文中直接对标 INSTANCE2022,把"二值→五类"作为自己的差异化定位(§7.3 接力表);
  • 专项瓶颈研究:SAH 分割专项(2024)等把 INSTANCE2022 的"SAH 最难(DSC 0.41)"结论作为立题依据;
  • 评测基准综述:医学分割评测基准类综述(MedSG-Bench 2025 等)把 INSTANCE2022 收录为"挑战赛型基准"的代表性样本;
  • 方法学教学案例:HD=inf 劣后事件在多篇评估方法学讨论中被引为"最坏情形指标设计"的公开案例。

第三方收录方面:openmedlab/Awesome-Medical-Dataset 收录本数据集并提供独立统计(本条目 spacing/尺寸/体积分布第三方口径的全部来源);MICCAI 官方 biomedical-challenges 列表以 Zenodo DOI 10.5281/zenodo.6362221 登记;NVIDIA MONAI 教程收录任务(§7.2);NVIDIA 团队自出版技术报告 arXiv:2209.10648 记录亚军方案全细节(附录 N)。需要注意第三方统计与官方口径的双口径问题(坑 3、坑 8)——引用时先声明口径来源。

§8 方法学启示:四条可迁移的经验

8.1 各向异性是 3D 医学分割的第一性约束

INSTANCE2022 把 12:1 各向异性从"实现细节"提升为"考题本身",结果 13 支强队的路线分布(4×2D、7×3D、2×混合)与前三名的构成(混合/2D/3D 各一)共同证明:没有普适的 2D vs 3D 答案,只有与 spacing 结构匹配的答案。任何拿到新 3D 数据集的人,第一件事应该是画 spacing 分布而不是画标注分布——具体动作:逐例读 NIfTI header 的 get_zooms(),画三轴直方图与各向异性比(max/min 轴)散点,再决定路线(§2.3 的四路线选型表可直接套用)。层厚过 5mm 时,nnU-Net 的自动配置(其内部就有 2D/3D 级联决策)至少是安全的起点。

8.2 最坏情形指标与平均型指标的冲突需要显式设计

HD=inf 劣后规则是一堂公开的方法学课:漏检在平均型指标(DSC)里只值"一例的低分",在临床里却是"一个病人的血肿没看见"。INSTANCE 的处理(劣后)保住了临床直觉但牺牲了排序粒度,赛后建议弃用 HD 是承认这个设计的粗糙。可迁移的结论:设计评估体系时先问"哪种错误的临床代价不对称",不对称就给最坏情形指标独立通道(劣后/加门/分组报告),并在赛事前写死规则——规则争议要在发榜前解决, INSTANCE 把这堂课上完了两遍(发榜一次、反思一次)。

8.3 防刷分三层结构是挑战赛工程的成熟模板

训练公开+验证半开+测试全闭、docker 提交、验证榜与终榜分离——这套结构在 INSTANCE2022 上运行良好(验证榜名次与终榜显著重排证明了其必要性)。但它的代价同样清楚:测试集 GT 永不公开,终榜永远不可第三方复现,赛后方法学审计(比如论文 V 节的 HD 反思)只能依赖组织者自查。库内挑战赛条目(isles/acdc/mms)都有同款结构同款代价——引用挑战赛结果时,"不可复现的终榜"应当被当作数据集的固有局限写明,而不是当成真理引用。

8.4 标注委员会模式的适用边界

INSTANCE 的"粗标→精修→交叉互检+多数投票"委员会流水线,与 PANDA-PLUS(库内条目)的"学生粗注→单人专家终审"流水线构成两种标注生产模式的原型对照:前者适合边界争议大、观察者间变异高的任务(出血边界),用群体收敛换一致性;后者适合存在明确专业层次的任务(Gleason 分级),用最高资质单人拍板换标签风格统一。选择模式的判断变量是"标注任务的争议结构"——边界型争议走委员会,分级型争议走权威。

8.5 单中心是回顾性收集的默认约束

INSTANCE2022 全部 200 例来自北京大学首钢医院单中心——论文把它列入自曝局限(FAQ Q9),但它值得单独一节,因为这是几乎所有"医院回顾性收集"类数据集的默认属性,使用者经常低估其后果:扫描设备/协议绑定单院(第三方实测层厚波动 4.4-10.0mm 正是单院多设备协议的痕迹)、人群构成绑定医院服务半径、扫描-标注习惯绑定本院科室流程。对 INSTANCE2022 而言,单中心不改变它作为方法基准的价值(比较的是算法而非泛化),但任何"训练于 INSTANCE → 部署于自家医院"的迁移都应视作跨域问题对待——先用小规模本地数据做校准评估再上线。这一条与 §8.1 的 spacing 检查共同构成"拿到新医学数据集先做的两件事"。

8.6 给数据集条目写作者的三条规则

本条目的写作过程本身沉淀出三条可复用的条目工程规则:

  1. 坑点编号全局唯一:坑 1-10 在正文、FAQ、附录多处引用,编号一旦重复或漂移,读者按号跳转会踩空——先定编号表(§10),再向全文散布引用,最后用对照表(附录 L)回查闭环;
  2. 双口径必须登记成表:spacing/体积/单位笔误这类"官方 vs 第三方"差异散落在正文各处,读者不可能自己拼齐——集中登记(附录 F)+ 正文锚点双向引用,是双口径的唯一可持续管法;
  3. 生命周期时间线单列一节:挑战赛类数据集的"注册墙→公开化"演化决定了一切获取相关描述的时点有效性(§6.2),把时间线压成一行表并给每个节点打时间戳,比任何叙述性描述都抗过时。

§9 与库内条目的关系

9.1 家族图谱

INSTANCE2022 在库内的关系网分三条线:

卒中-脑影像线(最近邻):

  • isles(495)——ISLES 2022 缺血性卒中分割挑战赛:同为 MICCAI 2022 卫星赛事、同为脑部 3D 分割基准、同走 GC 平台 docker 提交制,恰好构成"出血 vs 缺血"的成对样本。病理对象(出血性卒中 NCCT vs 缺血性卒中 MRI 多序列)、病灶形态(团块状血肿 vs 弥散改变的梗死灶)、评估细节均不同。两者连读是理解"挑战赛设计如何被病理特性塑造"的最佳对照:INSTANCE 把最坏情形(漏检)写进规则,ISLES 则面对的是"边界本身都不唯一"的半软标注问题。
  • ct-rate(546)——CT-RATE 胸部 CT:同模态、库内 CT 域条目代表,带影像-报告对齐维度(INSTANCE 没有);两者对照可看"CT 数据集+临床文本"与"CT 数据集+体素标注"两条不同的 AI-Ready 路径。ct-rate 的多设施采样设计恰是 INSTANCE 单中心结构(§8.5)所缺的维度。
  • abdomenct-1k(402)/ctspine1k(443)——器官/椎体分割 CT 大规模基准:任务粒度不同(器官边界清晰 vs 出血边界模糊),但各向异性问题同样存在,nnU-Net 谱系方法通用;ctspine1k 的椎体 CT 与 INSTANCE 共享"2D/3D 路线权衡"的问题结构。

挑战赛方法学线:

  • acdc(511)——ACDC 心脏 CMR 分割挑战赛:库内挑战赛条目的"简单端"代表(DSC 普遍 90+),与 INSTANCE2022 的"困难端"(冠军 69.25、末名 40.22)构成难度光谱两极。读榜常识"分数带宽度=任务难度"用这对条目演示最直观。
  • mms(516)——M&Ms 心脏 CMR 多中心多域挑战赛:共享"公开训练+封闭测试+统一指标"的赛制骨架与"域偏移"关注点;其域分组评估是 INSTANCE 没有的维度,而 INSTANCE 的最坏情形指标(HD)是 M&Ms 没有的维度——两个赛事的评估设计互补。
  • totalsegmentator——nnU-Net 谱系大规模器官分割:方法论直接同源(nnU-Net 是 INSTANCE 冠军与 7/13 队伍的底座),可互为方法学脚注;其"大数据+强框架碾压任务特调"的结论,恰是 INSTANCE"小数据+集成妥协"结论的对照面。

外部任务谱系线(条目内已建对照表):RSNA-ASNR-MICCAI 2022(2D 分类,§2.6 对照表)、BHSD(多类 3D 接力,§7.3 对照表)——互链时直接跳读两表。

9.2 检索路径建议

你搜的词 应到达 路径
颅内出血 / 脑出血 分割 数据集 本条目 + BHSD 线索 §0/§7.3
各向异性 3D 分割 本条目 §2.3/§5.3 + totalsegmentator
挑战赛 评估 排名 协议 本条目 §4 + acdc/mms/isles 评估节
MICCAI 2022 challenge 本条目 + isles 同届卫星赛事
CT 神经影像 / NCCT 本条目 + ct-rate CT 域网络
INSTANCE / INSTANCE2022 本条目 注意避开普通词 instance 噪音,加 2022 后缀检索

反向检索——从本条目出发,以下问题可以直接得到答案:

问题 答案位置
颅内出血 3D 分割的公开数据集有哪些? §7.3 景观表(INSTANCE/BHSD/CQ500/RSNA)
2022 年各向异性数据上 2D 还是 3D 好? §5.2/§5.4(13 队实证:无单边最优)
医学分割挑战赛怎么设计排名协议? §4.2/§4.3(aggregate-then-rank + HD 教训)
血肿自动分割现在到什么水平? §5.1(综合冠军 69.25,DSC 单项 72.06)
小目标分割分数低是数据问题还是方法问题? §5.3/§2.5(部分容积效应+标注收敛双重来源)
签协议数据集是怎么走向公开的? §6.2 时间线(2022 注册墙→2026-09-11 公开)

§10 避坑清单:十个已踩过的坑

以下十坑全部来自真实检索/转述/引用场景。按性质可分四类——身份坑(坑 1/9:认错赛事)、数字坑(坑 3/4/5/8:口径与笔误)、规则坑(坑 2/6:引用与排名协议)、治理坑(坑 7/10:数据能力边界与条款状态)。附录 L 提供与正文的对照索引;十坑中有四坑(1/4/5/2 的一半)源自论文自身笔误或第三方汇总页误链——一手来源也要带着怀疑读。

坑 1:身份误记——是脑 NCCT,不是心脏 LGE-CMR。
本条目委托 brief 曾把 INSTANCE2022 写成"心脏 LGE-CMR 心肌梗死疤痕/水肿分割挑战赛(ICCES/MICCAI 联合赛事)“——错误。INSTANCE2022 是脑部平扫 CT 颅内出血分割(MICCAI 2022 卫星);ICCES 与它无关;心脏 LGE-CMR 方向另有 LAScarQS2022/EMIDEC/MyoPS 等赛事。三轮核验(官网/GitHub/arXiv 全文)后才落笔,任何引用先对全称"The 2022 Intracranial Hemorrhage Segmentation Challenge on Non-Contrast head CT”。

坑 2:论文身份混引——无期刊版,别错引 SLEX-NET。
INSTANCE2022 总结论文截至 2026-09 只有 arXiv:2301.03281,没有正式期刊版;第三方汇总页给的 ieeexplore 9511297 链接是基线 SLEX-NET 的 JBHI 论文。连锁坑:基线分数 52.83±28.92 是"SLEX-NET 架构在 INSTANCE 数据上重训"的口径,与 SLEX-NET 原论文在自己数据上的分数不可互换。三个引用动作(找 INSTANCE 论文/引基线分数/引 SLEX-NET 原文)要分别核对。

坑 3:spacing 双口径,别一刀切。
官方口径 0.42×0.42×5mm 是均匀化表述;openmedlab 逐例统计 median 0.45×0.45×5.0、max 层厚 10.0mm。引用时声明口径来源;预处理时逐例读 NIfTI header 重采样,尤其 max 层厚 10mm 的例子各向异性比高达 24:1。

坑 4:"15000 m³"是单位笔误。
论文 V-B 写小血肿阈值 “15000 m³”——应为 15000 mm³(15 cm³,约一个高尔夫球到网球之间)。部分二手转述以讹传讹。本条目一律按 mm³。

坑 5:IPH/IVH 缩写撞车是论文笔误。
论文 Fig.1 标题把脑室内出血写成 “intraventricular hemorrhage (IPH)”——应为 IVH;IPH 是 intraparenchymal hemorrhage(脑实质出血)的既定缩写。论文自身笔误已被后续文献转述扩散。本条目一律按 IVH 正名,见到"IPH=脑室内"的表述即踩坑。

坑 6:DSC 最高≠冠军,HD=inf 会劣后。
亚军队 nvauto DSC 72.06 全场最高,但漏检测试血肿致 HD=inf,按规则在 HD 名次劣后,综合屈居第 2;13 队里 8 队 HD=inf。引用排名必须区分"综合冠军(vegetable 69.25)“与"DSC 单项最高(nvauto 72.06)”——混引即错。NVIDIA 自述"won 2nd place (1st place in terms of Dice score)"(arXiv:2209.10648)是正确表述的模板。

坑 7:掩码是二值的,别当多类用。
五亚型合并在一个前景类里,掩码无亚型通道;逐例亚型构成比例也未公开。做亚型分割请转 BHSD 或自行重标;论文 V-D1 自曝此局限。想在 INSTANCE 上做亚型条件分析,只有论文披露的亚型级聚合数字(SAH 0.41)可用。

坑 8:体积范围双口径。
体积尺寸官方口径"512×512×20 到 512×512×70"(范围表述)与 openmedlab"min (430,512,24)/max (512,560,40)"(逐例统计)并存——不矛盾但要选边声明;同理训练集体积统计(median 11.46 cm³ 等)是第三方口径。

坑 9:与 RSNA-ASNR-MICCAI 2022 Brain Hemorrhage 混淆。
同年(2022)、同病种(ICH)、同模态(NCCT),但完全不同赛事:RSNA 赛是 Kaggle 2D 切片级多类分类(约 200 万切片),INSTANCE2022 是 GC 平台 3D 体素级二值分割(200 例)。数据、标签、评估、许可全部不可互换,文献里两者常被并列引用为"分类-分割"互补对,读引用时要分辨说的是哪一个。

坑 10:公开化≠无门槛,条款状态未重申。
2026-09-11 起数据公开下载,但 GC 平台大概率仍需免费注册账号;原使用协议(Agreements/instance2022_agreements.pdf,2022-03-31 提交)在公开化之后是否仍约束用途与再分发,官方未重申,条款全文亦未公开转录。商用或再分发前:读协议 PDF + 必要时邮件 INSTANCE2022@outlook.com 确认。

坑点之外,还有两个结构局限——它们不是"坑"(可以绕开),而是使用前就要接受的天花板:其一,标注一致性系数(kappa/Dice between annotators)从未公开,标注者间变异无法定量(FAQ Q19),标注收敛瓶颈与算法瓶颈在分数里纠缠不清(§3.3);其二,单中心单设备(§8.5),泛化推断需自担。前者靠官方补文档才能解决(附录 G 触发点),后者只能靠使用者的跨域评估纪律。

§11 总结

11.1 三句话总结

  1. INSTANCE2022 是首个公开的颅内出血 3D 体素级分割基准:200 例 NCCT(100 训练/30 验证/70 封闭测试)、二值掩码、四指标 aggregate-then-rank 排名,冠军 vegetable 综合 DSC 69.25±19.14,DSC 单项最高的 nvauto(72.06)因 HD=inf 劣后居次。
  2. 它最有价值的产出不止是数据:12:1 各向异性下 2D/3D 无单边最优的 13 队实证、HD=inf 劣后规则与赛后弃用 HD 的反思、小血肿(<15000 mm³ DSC 常<0.3)与 SAH(DSC 0.41)两道公共瓶颈,共同构成一份完整的评估方法学与任务难度档案。
  3. 2026-09-11 起数据完全公开(此前四年半注册墙),代码 Apache-2.0,NVIDIA 官方教程提供亚军方案全流程复现——是当前进入出血 3D 分割方向成本最低的事实起点。

三个数字速记:200(例数:100/30/70)、12:1(各向异性比,逐例最高 24:1)、69.25 / 72.06(综合冠军 DSC / DSC 单项最高,注意两者属于不同队伍)——任何引用报不对这三个数,先回头查口径(坑 3/坑 6)。

11.2 适合谁

  • 做各向异性 3D 分割方法研究的人:天然的难度基准,2D/3D 路线之争有 13 个数据点可引,双瓶颈与末名断崖(visal 40.22)都是现成的失败案例分析素材;
  • 卒中影像 CAD 工程团队:血肿体积定量的临床动机直连 RVD 指标,"重叠-边界-体积-最坏情形"四指标体系可直接搬进产品验收标准;
  • 设计医学 AI 挑战赛的组织者:三层防刷分结构(§5.1)、aggregate-then-rank(§4.2)、HD 负面清单(§4.3)是现成的赛事设计文档,且附带了"赛后反思"的完整闭环;
  • 研究数据集开放策略的人:注册墙(2022.03)→赛后开放提交→完全公开(2026.09)的完整时间线(§6.2)是难得的一手演化样本。

11.3 不适合谁

  • 需要亚型标签的人:掩码不分五亚型、逐例亚型比例未公开,请转 BHSD 或自标(坑 7);
  • 需要病人元数据/纵向随访的人:年龄、性别、临床病程、随访、影像报告均未发放;
  • 想独立复现最终排名的人:测试集图像与 GT 永不公开,终榜只有组织者环境可复现,第三方的"对标终榜"声明本质上不可审计;
  • 期待轻量 2D 任务或即插即用切片数据集的人:200 例 3D 体积+体素级标注的训练开销远高于 2D 切片分类任务,先算算力预算。

11.4 30 秒决策卡

你的需求 答案
只要"出血在哪、体积多大" 本数据集 ✅,二值掩码正合用,RVD 是核心验收指标
要分亚型 ❌ 转 BHSD;或本数据集+自行重标
要对比 2022-2025 文献基线 ✅ 本数据集是那段文献的事实标准,13 队分数可引
单卡算力有限 可行:冠军/亚军方案都是 2D 系,2D 路线不需要海量显存;Auto3DSeg 教程可起步
要发"超越 SOTA"声明 先复现 vegetable 的 2D/3D 混合与 nvauto 的 18 模型集成再谈;注意终榜不可复现,你的对比只能对验证集或自留出集,且要报四指标而非单一 DSC
要商用 ⚠️ 先核协议条款(坑 10),邮件确认
找最新榜首 GC post-challenge 榜单实时页(本条目抓取时反爬未收录,Q30)

11.5 三类读者的最小阅读集

  • 只想下数据(15 分钟):INFOBOX → §1 Q7/Q9 → §6.1/§6.2 → 附录 R 操作手册 → 下载前扫一眼坑 10;
  • 要训练/改进模型(1 小时):§2 全部 → §5.3 双瓶颈 → §5.4 冠军拆解 → 附录 J 代码骨架 → 附录 N 亚军报告要点;
  • 要设计挑战赛/评估协议(40 分钟):§4 全部 → §2.7 docker 机制 → §8.2/§8.3 → 附录 I 算法骨架 → 附录 P 未来届次预告。

FAQ(高频问答 46 问)

A. 基础认知

Q1:INSTANCE2022 是数据集还是比赛?
两者都是:先是一场与 MICCAI 2022 联合举办的分割挑战赛,赛后留下一个公开基准数据集(200 例 NCCT+掩码+评测协议+榜单)。本条目把两者作为一体记录。

Q2:名字 INSTANCE 是什么缩写?
论文原文逐词拆解:INtracranial hemorrhage SegmenTAtioN ChallEngE——把"颅内出血分割挑战"揉成一个英文单词,大写字母标出拼接痕迹。注意与 “instance”(普通英文词/编程术语)无关,检索时加 2022 后缀更准。

Q3:它和 MICCAI 什么关系?和 ICCES 有关系吗?
MICCAI 2022(第 25 届,新加坡)的卫星挑战赛,获奖者需在 MICCAI 会期做汇报。ICCES 与它无关——"ICCES/MICCAI 联合赛事"的说法源自生产候选清单的误记(坑 1)。

Q4:谁组织的?
哈尔滨工业大学计算机学院感知计算研究中心(学术带头 Shuo Li,中心主任王宽全)联合北京大学首钢医院(数据来源与临床标注方)。一作李翔宇(Xiangyu Li,HIT)。

Q5:这是第一个颅内出血分割数据集吗?
不是第一个 ICH 数据集,但是第一个公开的 3D 体素级 ICH 分割基准——此前的 ICH 分割研究均在内部数据集+自定义指标上评测,无法横向比较。论文的 first 宣称限定在"公开基准+统一协议"口径。

Q6:发表在哪里?
挑战赛总结论文为 arXiv:2301.03281(2023-01),截至 2026-09 无期刊正式版;赛事本身在 MICCAI 官方挑战赛列表登记(Zenodo doi:10.5281/zenodo.6362221)。引用注意别错引基线 SLEX-NET 的 JBHI 论文(坑 2)。

Q7:任务是什么?
NCCT 3D 体积中颅内出血区域的体素级二值分割。临床终点是血肿体积量化(RVD 指标直接对应),分割是手段。

Q8:最大的卖点一句话?
把急诊科最常见、以前只能"各自在内部数据上自己考自己"的脑出血分割,第一次放进统一的公开考场——并顺手把"各向异性数据上 2D 还是 3D"这个争论变成了有 13 个数据点的实证问题。

Q9:它自己有什么局限?
论文自曝三条:单中心单设备(泛化受限)、掩码不含亚型(多类研究受限)、参赛代码开源非强制(13 队仅 1 队开源)。加上测试集不公开,构成四个使用边界。

Q10:开源吗?
数据 2026-09-11 起公开下载;官方代码(基线/docker 示例)Apache-2.0;13 队技术论文公开;但测试集不公开、13 队里只有 1 支队伍开源了自己的方案代码。

B. 数据与获取

Q11:数据怎么下载?
访问 https://instance.grand-challenge.org/Dataset/——2026-09-11 起页面直接提供下载链接。此前(2022-03 至 2026-09)需签协议邮件个案申请。

Q12:训练集文件结构是什么?
train/data/001-100.nii.gz(图像)+ train/label/001-100.nii.gz(掩码)+ evaluation/101-130.nii.gz(验证图像,无掩码)。文件按序号命名,无患者 ID 映射表公开。

Q13:能拿到测试集吗?
不能。70 例测试集图像与标签均不发放,评测只能通过 GC 平台提交 docker 由组织者侧运行。这是封闭测试的设计属性,不是获取障碍。

Q14:NIfTI 里的 HU 值是原始的吗?
是。论文明确保留原始 HU(未预窗化),参考窗宽窗位 90/40HU 只是元信息。使用者可以自选窗策略——13 队用出了单窗到三窗三通道的多种方案。

Q15:spacing 到底是 0.42 还是 0.37-0.60 波动?
官方口径统一为 0.42×0.42×5mm;第三方统计的 0.37-0.60 面内波动疑为原始 DICOM 值。以官方为准做方法设计,第三方口径只作背景了解(坑 3)。

Q16:数据能商用吗?
不确定。公开化之前有书面协议(条款含用途约束);公开化之后官方未重申条款状态。商用或再分发前应阅读 GitHub Agreements 里的协议 PDF 并必要时联系官方邮箱确认(坑 10)。

Q17:赛后再提交成绩可以吗?
可以。论文结论明示 post-challenge 提交在 GC 平台持续开放——这也是它"基准属性"的来源之一。提交需按 docker 规则封装(仓库有示例)。

Q18:有机器可读的元数据文件吗?
官方提供的是 NIfTI+协议 PDF+论文,无标准机器可读元数据卡(无 HF dataset card/Datasheet)。本条目的 schema_org 块是库内补齐层,检索与引用请以官方三源为准。

C. 标注与质量

Q19:10 位放射科医生是怎么协作的?
研究生+医生用 Seg3D 粗标 → 资深医生逐例精修 → 全体医生交叉互检他人标注、讨论后多数投票定稿。没有公开标注一致性系数(如 kappa)——这是文档缺口,使用者无法定量评估标注者间变异。

Q20:掩码质量有第三方验证吗?
无独立第三方审计。参考信号是相对间接的:13 支队伍在验证/测试集上的表现分布、以及基线与冠军的差距(0.5283→0.6925),间接说明标签噪声没有淹没任务信号。

Q21:为什么只标一个类?
任务定位是体积量化(临床终点),二值掩码让标注成本与评测协议都可控。亚型标注被列为未来工作。想做多类的使用者请看 BHSD 等后继数据集。

Q22:SAH 病例占比多少?
未公开。论文只给了按亚型分组的平均 DSC(SAH 0.41 最低),没有给各亚型例数——这使得"按亚型重加权训练"类研究无法在公开信息下设计。

Q23:小血肿有多少例?
训练集无逐例体积表公开;第三方统计给出中位 11.46 cm³、最小 0.2 cm³。测试集的四分位分组([0,4213] 等 mm³)来自论文。逐例清单不公开。

D. 评测与结果

Q24:为什么 DSC 0.7206 的队伍不是冠军?
排名用四指标综合(各指标名次取平均),nvauto 因漏检小血肿致 HD=inf,在 HD 上被列劣后名次,综合落到第 2。冠军 vegetable 四指标全面且无一爆表(坑 6)。

Q25:HD=inf 具体怎么处理?
所有 HD 为 inf 的队伍在该指标上同列一个名次,劣于所有 HD 有限的队伍。组织者理由:把小血肿漏成正常扫描是最严重的错误,不应被平均数稀释。

Q26:验证榜和测试榜分数为什么差这么多?
验证集 DSC 79 档 vs 测试集 69 档,掉约 10 个百分点。原因包括:测试集难例更多(小血肿构成)、验证集被反复用于调参(自适应过拟合)、封闭测试无调参机会。这是挑战赛评测的标准现象,也提醒引用分数时注明是哪个榜。

Q27:基线 SLEX-NET 是弱基线吗?
不是弱到失真的基线:它是组织者 2022 年发表于 IEEE JBHI 的已发表方法,在 INSTANCE 数据上重训后 DSC 0.5283。13 队中 12 队超过它,冠军超出 16 个百分点——提升幅度是在有意义的基线之上测得的。

Q28:13 支队伍里 nnU-Net 占 7 支,说明什么?
说明 nnU-Net 在各向异性 CT 上的默认强势地位,同时说明默认 nnU-Net 不够——冠军赢在 2D/3D 混合与不确定性集成这些"超出默认配置"的设计。

Q29:能在本地复现测试集成绩吗?
不能本地复算(无测试数据),但可以本地用训练集交叉验证近似复现各队方法(多支队伍论文给出了完整超参),再经 GC 平台提交获得官方测试分数。

Q30:最新 SOTA 是多少?
挑战赛榜单冠军 0.6925(2022 赛季)。赛后的 post-challenge 榜单持续接受提交,截至抓取时点未能抓取其当前榜首分数(GC 页面反爬)——引用最新成绩前请查 GC leaderboard 实时页。

E. 与其他数据集/条目的关系

Q31:和 RSNA 2022 出血赛事什么关系?
无数据或组织关联。RSNA-ASNR-MICCAI(Kaggle)是 2D 切片级多类分类;INSTANCE2022 是 3D 体素级二值分割。同年同病种、任务形态不同,混引是高发错误(坑 9)。

Q32:和 BHSD 什么关系?
互补递进:INSTANCE2022(2022,二值、200 例、挑战赛协议)→ BHSD(2023,多类亚型、更大规模、普通数据集形态)。后者直接回应前者"亚型不标注"的局限。

Q33:和库内 isles(495)什么关系?
卒中影像两侧:isles 是缺血性卒中(MRI 多模态)病变分割挑战赛,INSTANCE2022 是出血性卒中(CT 单模态)。两者连读是"同病种谱系两极"的天然对照,也是跨模态方法迁移的参照系。

Q34:和 acdc/mms(心脏 CMR 挑战赛条目)什么关系?
方法学同构:三者都是 MICCAI 挑战赛基准(公开训练+封闭测试+统一指标)。心脏短轴 CMR 同样层厚大于面内分辨率,INSTANCE 的 2D/3D 折中结论对心脏条目使用者有直接参考价值。

Q35:为什么库内给它 slug 叫 instance2022?
按赛事官方名 INSTANCE2022 小写规范化;库内查重确认无 instance/instance2x 重名(fdtooth 等其他缩写不冲突)。

F. 工程与复现细节

Q36:预处理该怎么做?
13 队共识:归一化(人人做)+窗策略(自选,三窗三通道是多队验证的强方案)+可选颅骨剥离/裁剪。重采样注意保留 5mm 层厚信息——把它重采样成各向同性会插值出虚假的层间细节。

Q37:直接用 nnU-Net 能跑出多少?
参考 7 支 nnU-Net 队伍的区间:测试 DSC 约 62-69%。NVIDIA Auto3DSeg 官方教程(公开代码)在验证集 5 折 CV Dice 约 0.79,可作为工程起点。

Q38:数据量 100 例训练够吗?
对"从零训练大模型"不够,对"微调/自适应 nnU-Net 类强先验框架"够用——这正是 13 队几乎全员集成+数据增强的背景。200 例级别的任务也是自监督预训练+小样本微调路线的合理试验场。

Q39:掩码是什么数值格式?
二值(0=背景,1=出血前景),NIfTI 格式。亚型信息不在掩码里(坑 7)。

Q40:论文之外还有哪些一手资料?
GC results 页面的 13 队技术短论文(比总结论文细节多一个量级);NVIDIA NVAUTO 方案报告(arXiv:2209.10648,含完整超参);GitHub 仓库的 Baseline 目录与 docker 规则。

Q41:本条目后续会更新什么?
维护触发点见附录 G:优先级最高的是"许可条款在公开化后的官方重申"(一旦官方明确,§6.2/坑 10 整体改写);其次是 GC 当前榜首分数抓取与期刊正式发表追踪。

Q42:如果只记住一件事?
INSTANCE2022 把"在正确的指标与排名协议下比"变成了和"把分割做好"同等重要的事——0.7206 的 Dice 输给 0.6925 的故事,值得每个报分数的人贴在工位上。

G. 报分与合规

Q43:用这个数据集报分,最小合规集是什么?
四件套:报明是验证集还是自留出集(终榜不可复现,Q29);四指标全报而非单一 DSC(§4.1);按体积分层报小血肿组(§2.5 分层纪律);引用数字注明口径(官方论文/第三方统计,坑 3/8)。做到这四条,你的分数才能被别人严肃比较。

Q44:能商用吗?能再分发吗?
都走同一条路:先读 GitHub 仓库 Agreements/instance2022_agreements.pdf——公开化之后官方未重申条款状态(坑 10),协议在公开后是否延续约束未核验。有明确商用/再分发需求时,邮件 INSTANCE2022@outlook.com 书面确认并留档。在此之前,按"协议仍有效"的保守假设行事。

Q45:验证集 30 例怎么用最划算?
两阶段:先用 5 折交叉验证(在 100 例训练集内部切)做方法迭代,把验证集留作"准最终考试"只在关键决策点用——30 例样本量小,反复对它调参会快速失效(Q26 的自适应过拟合在 30 例上更快)。

Q46:训练 100 例怎么切交叉验证?
参照亚军队口径:5 折、按例(patient-level)切而非按层切——同一病人的切片绝不能跨训练/验证两折(层间高度相关,按层切会泄漏);各向异性强的病例分布尽量在各折均衡(可按层厚分层抽样)。NVIDIA 报告的 CV Dice 0.7959 即 5 折口径。


事实清单(硬事实 40 条)

  1. INSTANCE2022 全称 The 2022 Intracranial Hemorrhage Segmentation Challenge on Non-Contrast head CT,缩写展开 INtracranial hemorrhage SegmenTAtioN ChallEngE。
  2. 与第 25 届 MICCAI(2022,新加坡)联合举办,卫星赛事,部署于 Grand Challenge 平台。
  3. 主办:哈尔滨工业大学感知计算研究中心 + 北京大学首钢医院;联系邮箱 INSTANCE2022@outlook.com。
  4. 数据:200 例 NCCT,来自北京大学首钢医院 2017-2019 年确诊 ICH 患者回顾性队列(经院方批准)。
  5. 划分:训练 100(含 GT)+ 开放验证 30(无 GT)+ 封闭测试 70(不发放)。
  6. 格式:DICOM 逐卷转单文件 NIfTI(.nii.gz);体积 512×512×20 至 512×512×70(论文口径)。
  7. spacing 官方口径 0.42×0.42×5mm;各向异性比约 12:1。
  8. 保留原始 HU 值;参考窗宽窗位 90HU/40HU。
  9. 亚型覆盖:IPH/IVH/SAH/SDH/EDH 五类患者均有;掩码不区分亚型(二值)。
  10. 标注:Seg3D 粗标(研究生+医生)→ 资深放射科医生精修(README 口径 10 位)→ 全体交叉互检+多数投票定稿。
  11. 参与漏斗:500+ 申请 → 70 队获批(签协议)→ 30 队验证榜 350+ 提交 → 13 队完赛(论文口径)。
  12. 赛程:2022-03-28 注册;04-06 训练集;07-15 验证集;08-07 验证榜截止;08-14 docker 截止;09-18 颁奖。
  13. 2026-09-11 数据集完全公开下载(GC 官网 NEWS)。
  14. 四指标:DSC↑/NSD↑/RVD↓/HD↓;排名协议"先聚合后排名"(测试集平均→各指标排名→名次取平均)。
  15. HD=inf 的队伍同列劣后名次;论文建议未来弃用 HD。
  16. 基线 SLEX-NET(组织者前作,IEEE JBHI 2022 doi:10.1109/JBHI.2021.3103850)重训:测试 DSC 52.83±28.92、NSD 38.42、RVD 0.725、HD 309.06。
  17. 冠军 vegetable:DSC 69.25±19.14、NSD 53.59±15.65、RVD 0.21±0.20、HD 35.27±28.47;nnU-Net 2D/3D 混合、Dice+WCE、集成、patch-based。
  18. 亚军 nvauto(NVIDIA Auto3DSeg):DSC 72.06±21.07 单指标第一,HD=inf;18 模型集成,CV Dice 0.7959。
  19. 季军 mec-lab:DSC 69.00;nnU-Net 3D+轮廓损失;不确定性集成。
  20. 13 队全部 U-Net 系;7/13 nnU-Net;10/13 集成;4 队 2D/7 队 3D/2 队 2D-3D 混合;仅 1 队后处理。
  21. 13 队 alias:vegetable/nvauto/mec-lab/ibot/stubmers/crainet/superembrace/scan/dolphins/nic-vicorob/2i_mtl/avich/visal(论文 Table I)。
  22. 测试集 DSC 区间 40.22%-72.06%;整体水位远低于常见器官分割任务。
  23. 小血肿瓶颈:<15000 mm³(论文笔误作 m³)的病例 DSC 常 <0.3;体积分组四组单调上升。
  24. SAH 最难:全方法平均 DSC 0.41。
  25. 测试集体积四分组:[0,4213]/[4213,7235]/[7235,19640]/[19640,∞) mm³。
  26. 验证榜参考:T1 79.12/T6 79.53/T2 78.21;基线 64.08(Table III)。
  27. 显著性检验:单侧 Wilcoxon 符号秩,5%。
  28. 训练集血肿体积(第三方口径):min 0.2/median 11.46/max 155.11 cm³;训练集 2D 层数 2,993。
  29. 代码许可:Apache-2.0(GitHub LICENSE 文件)。
  30. 数据使用协议:Agreements/instance2022_agreements.pdf(2022-03-31 提交);全文条款未公开转录(待核)。
  31. 论文:arXiv:2301.03281(v1 2023-01-09、v2 2023-01-12),35 作者,截至 2026-09-26 无期刊正式版。
  32. Zenodo 挑战赛描述 doi:10.5281/zenodo.6362221(Li, Wang, Liu, Wang, Xu, Liang, Mar 2022);MICCAI 官方挑战赛列表同款登记。
  33. 资助:NSFC 62001144/62272135/62001141;深圳市科技创新委员会 RCBS20210609103820029/JCYJ20210324131800002。
  34. 奖金:冠军 500/亚军 300/季军 200 美元+单指标第一名电子证书;获奖需 MICCAI 会期汇报。
  35. 赛后提交:post-challenge leaderboard 在 GC 平台持续开放(论文结论明示)。
  36. NVAUTO 方案报告 arXiv:2209.10648(Siddiquee/Myronenko 等);MONAI Auto3DSeg 官方教程收录 INSTANCE22 任务。
  37. 论文 Fig.1 笔误:脑室内出血缩写写作 IPH(应为 IVH)。
  38. spacing/体积范围双口径:openmedlab 第三方统计与官方口径并存(坑 3/8)。
  39. openmedlab 汇总页的 ieeexplore 链接(9511297)是基线 SLEX-NET 论文,非挑战赛论文。
  40. 13 队中仅 1 队开源代码(论文 V-D3 自述)。

术语表(30 条)

术语 释义
ICH(intracranial hemorrhage) 颅内出血;卒中的高致死类型,本数据集的目标病灶
NCCT(non-contrast head CT) 非增强(平扫)头颅 CT;ICH 急诊诊断金标准检查
各向异性(anisotropic) 体素三轴分辨率不等;本数据集 0.42×0.42×5mm,比例约 12:1
层厚(slice thickness) CT 单层采集的 z 向厚度;5mm 为急诊 NCCT 常规加速配置
HU(Hounsfield Unit) CT 密度单位;本数据保留原始值,出血约 40-80HU
窗宽窗位 CT 显示的密度窗口设置;本数据参考 90HU/40HU,可自定义
NIfTI 神经影像标准文件格式;本数据每例一个 .nii.gz
Seg3D 犹他大学 SCI 开发的体数据标注软件;本数据粗标工具
IPH 脑实质出血(intraparenchymal hemorrhage)
IVH 脑室内出血(intraventricular hemorrhage);论文笔误写作 IPH(坑 5)
SAH 蛛网膜下腔出血;五亚型中最难分割(平均 DSC 0.41)
SDH 硬膜下出血
EDH 硬膜外出血
GT(ground truth) 参考真值;本数据指放射科医生多轮定稿的体素掩码
DSC(Dice Similarity Coefficient) 重叠率指标,0-1;本基准主指标
NSD(Normalized Surface Dice) 归一化表面 Dice;有界边界指标,HD 的稳健替代
RVD(Relative Volume Difference) 体积相对误差;直接对应血肿量化临床需求
HD(Hausdorff Distance) 最坏边界距离;漏检时发散为 inf(本基准协议教训)
先聚合后排名(aggregate-then-rank) 先对测试集取指标平均、再各指标排名、最后名次取平均的排名协议
post-challenge leaderboard 赛后持续开放的提交榜单;基准长期生命力的载体
nnU-Net 自配置分割框架;13 队中 7 支采用
Auto3DSeg NVIDIA MONAI 的自动化分割管线;亚军队方案来源,官方教程收录本任务
2.5D/2D/3D 实现 逐层 2D 卷积、混合通路、全 3D 卷积三种处理体积的架构路线
集成(ensemble) 多模型预测融合;10/13 队采用
不确定性集成 对高不确定性病例改用投票等策略的融合方式;季军队方案核心
三窗三通道 单层面取三种 CT 窗各作一个输入通道的输入策略;亚军队方案族成员之一
容差半径 τ NSD 计算中的表面容差参数;τ 的取值需跨数据集比较时核对
docker 提交 把算法封装为容器由组织者侧运行的评测方式;保证测试封闭性
ABC/2 法 临床血肿体积手工估算公式;自动分割的对照基线
血肿扩张(hematoma expansion) 出血后再出血增大现象;基线 SLEX-NET 的建模对象
协议墙 数据获取前必须签署使用协议的治理方式;INSTANCE2022 2022-2026.09 的发放模式
封闭测试集(held-out test set) 图像与标签均不公开、仅经平台提交评测的最终考试集;本数据 70 例

附录

附录 A:条目信息速查卡

项 值
条目名 INSTANCE2022
url_name instance2022
类型 挑战赛+基准数据集(三合一:赛事/数据/协议)
论文 arXiv:2301.03281(预印本;Zenodo doi:10.5281/zenodo.6362221)
团队 哈工大感知计算研究中心 + 北京大学首钢医院
规模 200 例 NCCT(100/30/70 三分)
许可 数据 GC 平台公开(2026-09-11 起);代码 Apache-2.0
抓取时点 2026-09-26
库内互链 isles(495)/acdc(511)/mms(516)/ct-rate(546)/totalsegmentator/abdomenct-1k(402)/stroke-scale-mimic-iii(596)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 专有名称+MICCAI 官方列表+GC 平台收录,三入口可索引;小风险:instance 普通词检索噪音
A 可获取性 8 数据 2026-09-11 起公开直链+代码 Apache-2.0;扣分:测试集不可获取(设计属性)、许可条款公开化后未重申
I 可互操作 7 NIfTI 标准格式+原始 HU 保留,进 nnU-Net/MONAI 管线零摩擦;扣分:无标准机器可读元数据卡
M 元数据质量 7 论文表格完备(排名/方法/指标协议);扣分:三处笔误(IVH→IPH、m³、spacing 口径)与标注一致性系数缺失
S 可持续性 7 GC 平台长期托管+post-challenge 榜单开放;扣分:单点依赖 GC 与官方邮箱、论文未正式发表
综合评级 7.4/10(良) 公开直链+强代码生态+协议完备;短板在文档笔误与许可模糊带

附录 C:逐项证据链自证

关键数字 来源 位置
200 例(100/30/70) 官方论文 III-A + README About + NVAUTO 报告 arXiv:2301.03281 / GitHub / arXiv:2209.10648
spacing 0.42×0.42×5mm 官方论文 III-A + NVAUTO 教程 arXiv / paul-reiners tutorials
四指标与排名协议 官方论文 III-B arXiv:2301.03281
冠军 69.25/基线 52.83 官方论文 Table IV + NVAUTO 报告 Table 2 arXiv 两篇互证
nvauto 72.06/HD inf/综合第 2 官方论文 Table IV + NVAUTO 报告自述 arXiv 两篇互证
13 队 alias 表 官方论文 Table I arXiv:2301.03281
方法谱系(7/13 nnU-Net 等) 官方论文 IV-B + Table II arXiv:2301.03281
小血肿瓶颈/SAH 0.41 官方论文 IV-C/V-B + Fig.3/5 arXiv:2301.03281
500+ 申请/70 获批/350+ 提交 官方论文 IV-A(单源) arXiv:2301.03281
时间线 README Schedule + 论文 III GitHub/arXiv 互证
Apache-2.0 GitHub LICENSE 原文 PerceptionComputingLab/INSTANCE2022
2026-09-11 数据公开 GC 官网 NEWS 快照 instance.grand-challenge.org
Zenodo 6362221 NVAUTO 报告引文 [5] + MICCAI 官方列表 arXiv:2209.10648/miccai.org
训练集体积统计 openmedlab 汇总(第三方) Awesome-Medical-Dataset

附录 D:数据获取决策树

需求是什么?
├── 只想跑通一个强基线
│   └── GC 下数据(公开直链)→ GitHub Baseline 或 MONAI Auto3DSeg 教程
├── 要报官方可比成绩
│   └── 本地训练 → 按 docker 规则封装 → GC submission 页提交 → 四指标同报
├── 要做多类(亚型)分割研究
│   └── 本数据不可用(二值掩码)→ BHSD 等多类数据集;本数据作二值对照
├── 要引用基准结果
│   ├── 常规引用 → arXiv:2301.03281 Table IV + 排名协议
│   └── 赛事描述引用 → Zenodo doi:10.5281/zenodo.6362221
└── 要设计新挑战赛
    └── 读 §4.3 指标负面清单 + §4.2 排名协议 + §6.2 治理时间线

附录 E:引文规范

数据集引用(官方 README 指定格式):

@misc{li2023stateoftheart,
  title={The state-of-the-art 3D anisotropic intracranial hemorrhage
         segmentation on non-contrast head CT: The INSTANCE challenge},
  author={Li, Xiangyu and Luo, Gongning and Wang, Kuanquan and Wang, Hongyu
          and Liu, Jun and Liang, Xinjie and Jiang, Jie and Song, Zhenghao
          and Zheng, Chunyue and Chi, Haokai and Xu, Mingwang and others},
  year={2023},
  eprint={2301.03281},
  archivePrefix={arXiv},
  primaryClass={eess.IV}
}

赛事描述引用:Li X, Wang K, Liu J, Wang H, Xu M, Liang X. The 2022 Intracranial Hemorrhage Segmentation Challenge on Non-Contrast head CT (NCCT). Mar 2022. doi:10.5281/zenodo.6362221。

基线方法引用(如同时讨论基线):Li X, Luo G, Wang W, Wang K, Gao Y, Li S. Hematoma Expansion Context Guided Intracranial Hemorrhage Segmentation and Uncertainty Estimation. IEEE J Biomed Health Inform. 2022;26(3):1140-1151. doi:10.1109/JBHI.2021.3103850。

亚军方案引用(如讨论 Auto3DSeg 基线):Siddiquee MMR, Yang D, He Y, Xu D, Myronenko A. Automated segmentation of intracranial hemorrhages from 3D CT. arXiv:2209.10648 (2022)。

附录 F:双口径登记表

项 口径 A 口径 B 条目采用 处理
spacing 官方 0.42×0.42×5mm(论文+NVAUTO) openmedlab min(0.37,0.37,4.4)/median(0.45,0.45,5.0)/max(0.60,0.60,10.0) 官方 第三方存照为原始波动参考(坑 3)
体积尺寸 论文范围 512×512×20-70 openmedlab min(430,512,24)/median(512,512,29)/max(512,560,40) 官方范围 统计口径并存(坑 8)
小血肿阈值单位 论文原文 “15000 m³” 后续转述 15000 mm³ mm³ 原文笔误存照(坑 4)
IVH 缩写 论文 Fig.1 写 IPH 标准缩写 IVH IVH 原文笔误存照(坑 5)
数据许可状态 2022-2026.09 协议个案制 2026-09-11 后公开下载 分时段双口径 协议延续性待核(坑 10)
论文身份 arXiv 预印本 openmedlab 暗示有 IEEE 版(实为基线论文) arXiv 混引风险存照(坑 2)

附录 G:维护计划与触发点

  • 许可条款重申:一旦官方就公开化后的数据条款作出明示(仓库或 GC 页面),改写 §6.2 与坑 10——优先级最高。
  • 论文正式发表:2301.03281 若被期刊接收,更新 §1/§6/坑 2 与引文格式。
  • GC 榜单抓取:post-challenge 榜单当前榜首分数(本条目因页面反爬未能收录),可经人工访问补录。
  • 亚型标注扩展:若组织者发布亚型/体积标注扩展版(论文承诺的未来工作),§2.4 与坑 7 需整体改写。
  • INSTANCE 后续届次:论文提及未来 INSTANCE 挑战赛(弃用 HD、多任务、强制开源),一旦举办需增补谱系段。

附录 H:13 队方法配置全表(论文 Table I/II 口径)

排名 alias 队伍/机构(可考者) 骨干 维度路线 集成 特殊组件
1 vegetable 论文附录指向 Li and Chen, 2022(团队真名未直接披露) nnU-Net 2D/3D 混合 ✓ Dice+加权 CE、patch-based
2 nvauto NVIDIA(Siddiquee/Myronenko 等,arXiv:2209.10648) SegResNet 系 2D 切片级 18 模型 Auto3DSeg、深监督、三窗三通道
3 mec-lab 南方医科大学 nnU-Net 3D ✓ 轮廓损失、不确定性集成
4 ibot 未披露 U-Net 系 — — —
5 stubmers 未披露 U-Net 系 — — —
6 crainet 未披露 U-Net 系 — — —
7 superembrace 未披露 U-Net 系 — — HD 有限五队之一
8 scan 未披露 U-Net 系 — — —
9 dolphins 未披露 U-Net 系 — — —
10 nic-vicorob VICOROB(Girona,可考 Abramova/Lladó 署名) U-Net 系 — — —
11 2i_mtl 未披露 U-Net 系 — — HD 有限五队之一
12 avich 未披露 U-Net 系 — — HD 有限五队之一
13 visal 未披露 U-Net 系 — — —

4-13 名细节论文正文未逐队展开(Table I 提供 alias 与附录索引);决赛队伍技术短论文可在 GC results 页逐队查阅(页面反爬,需人工访问)。冠军队伍真实身份未披露(FACTS 存照 9)。

附录 I:四指标数学定义与排名算法

设预测 P、金标准 G(二值体素集),V(·) 为体素体积和,∂(·) 为表面。

DSC  = 2|P∩G| / (|P| + |G|)                              ∈ [0,1],↑
NSD  = (S(P ∩ B(G,τ)) + S(G ∩ B(P,τ))) / (S(∂P) + S(∂G))    容差 τ 内表面符合率,↑
RVD  = |V(P) − V(G)| / V(G)                              ↓(体积定量临床动机的指标化)
HD   = max( sup_{p∈∂P} d(p, ∂G),  sup_{g∈∂G} d(g, ∂P) )  mm,↓;单侧表面为空 → inf

aggregate-then-rank 三步:
1) score[i][m] = mean over 70 test cases of metric m for team i
2) rank[i][m]  = rank of score[i][m](HD=inf 队伍同列、劣后于全部有限 HD 队伍)
3) final[i]    = mean(rank[i][DSC], rank[i][NSD], rank[i][RVD], rank[i][HD])
                 并列时以 DSC 名次优先

附录 J:数据加载与训练骨架(MONAI / nnU-Net)

# INSTANCE2022 训练集加载骨架(100 例图像+掩码)
# 依赖: pip install monai nibabel torch
from pathlib import Path
import nibabel as nib
import numpy as np
from monai.transforms import (
    Compose, LoadImaged, EnsureChannelFirstd, Spacingd,
    ScaleIntensityRanged, RandAffined, ToTensord,
)

ROOT = Path("INSTANCE2022")  # 官方下载解压目录
pairs = [{"image": str(p), "label": str(ROOT / "train" / "label" / p.name)}
         for p in sorted((ROOT / "train" / "data").glob("*.nii.gz"))]

def case_spacing(path):  # 各向异性关键步:逐例读 header(勿硬编码,坑 3)
    return tuple(float(x) for x in nib.load(path).header.get_zooms()[:3])

tf = Compose([
    LoadImaged(keys=["image", "label"]),           # NIfTI,保留原始 HU
    EnsureChannelFirstd(keys=["image", "label"]),
    ScaleIntensityRanged(keys="image", a_min=0, a_max=90,
                         b_min=0.0, b_max=1.0, clip=True),  # 出血窗 90/40,可改多窗
    RandAffined(keys=["image", "label"], prob=0.5,
                rotate_range=(0.1, 0.1, 0.1), mode=("bilinear", "nearest")),
    ToTensord(keys=["image", "label"]),
])

sample = tf(pairs[0])
img, seg = sample["image"], sample["label"]
print(case_spacing(pairs[0]["image"]), img.shape)  # e.g. (0.45, 0.45, 5.0) (1, 512, 512, 29)
# 掩码二值:前景=1(全部亚型合并,无亚型通道,坑 7)
assert set(np.unique(seg.numpy())) <= {0.0, 1.0}

nnU-Net 路线(推荐起点,冠军底座):转换为 nnU-Net v2 原始格式(imagesTr/labelsTr + dataset.json,labels {0: “background”, 1: “hemorrhage”})→ nnUNetv2_plan_and_preprocess → 分别跑 2d 与 3d_fullres 配置 → 集成两路预测——即冠军 2D/3D 混合思路的最小复现。重采样交给 nnU-Net 自动决策(其内部有各向异性感知的 2D/3D 级联逻辑,见 §8.1)。

附录 K:aggregate-then-rank 复现骨架

# 在自留出集上复刻 INSTANCE 评估协议(测试集无 GT,终榜不可第三方复算,Q29)
import numpy as np
import pandas as pd
from scipy.stats import rankdata
from scipy.ndimage import distance_transform_edt

def dsc(p, g):
    denom = p.sum() + g.sum()
    return 2 * np.logical_and(p, g).sum() / denom if denom else 1.0

def rvd(p, g):
    return abs(int(p.sum()) - int(g.sum())) / g.sum() if g.sum() else 0.0

def hd_or_inf(p, g):
    if g.sum() and not p.sum():          # 漏检 → inf(坑 6 的来源)
        return np.inf
    dp = distance_transform_edt(~p)
    dg = distance_transform_edt(~g)
    return max((dp * g).max(), (dg * p).max())

def aggregate_then_rank(scores: pd.DataFrame,
                        higher_better=("DSC", "NSD")) -> pd.Series:
    """scores: index=team, columns=[DSC, NSD, RVD, HD],已对每例聚合"""
    ranks = pd.DataFrame(index=scores.index)
    for m in scores.columns:
        r = rankdata(scores[m], method="average")
        if m not in higher_better:        # RVD/HD 越小越好
            r = rankdata(-scores[m], method="average")
        if m == "HD":                     # HD=inf 劣后规则(§4.3)
            inf_mask = np.isinf(scores[m])
            r = np.where(inf_mask, (~inf_mask).sum() + 1, r)
        ranks[m] = r
    return ranks.mean(axis=1).sort_values()

# scores_df = pd.DataFrame(..., columns=["DSC", "NSD", "RVD", "HD"])
# print(aggregate_then_rank(scores_df))

附录 L:坑点档案对照(§10 索引)

坑 一句话 正文锚点 触发场景
1 脑 NCCT 非心脏 LGE-CMR;非 ICCES §0/§2.6 brief 转述、检索词撞名
2 无期刊版;ieeexplore 9511297=SLEX-NET;基线为重训口径 §5.5 找论文 DOI、引基线分数
3 spacing 双口径 §2.3 预处理、复现采样
4 15000 m³→mm³ §5.3 读论文 V-B、转述瓶颈数字
5 IPH/IVH 笔误 §2.1/附录 Z 读图注、二手转述
6 DSC 最高≠冠军(HD=inf 劣后) §4.3/§5.1 引排名、写 SOTA 声明
7 掩码二值无亚型 §2.4 设计多类模型、找亚型标签
8 体积范围双口径 §2.2 引规格
9 非 RSNA-ASNR-MICCAI 2022 分类赛 §2.6 同年同病种检索
10 公开化≠无门槛,条款未重申 §6.3 下载数据、商用、再分发

附录 M:验证榜-终榜对照与读榜守则

榜 参考分数(论文口径) 性质
验证榜 Table III T1 vegetable 79.12 / T6 crainet 79.53 / T2 nvauto 78.21 / 基线 64.08 在线可反复提交(30 例)
测试终榜 Table IV 冠军 69.25 / 亚军 72.06(DSC) / 基线 52.83 docker 封闭评测(70 例)

读榜四守则:

  1. 引用任何分数先报是哪个榜(79 档≠69 档,掉约 10 个百分点是标准现象);
  2. 综合名次与单项分数分开报(坑 6);名次差要过显著性检验(单侧 Wilcoxon 符号秩,5%)再解读;
  3. 验证榜名次≠终榜名次(crainet 验证第 1 分数高于 vegetable,终榜综合被 vegetable 反超)——防刷分设计生效的证据;
  4. post-challenge 榜单实时分数以 GC leaderboard 页为准(本条目抓取时反爬未收录,Q30)。

附录 N:NVAUTO 方案报告要点(arXiv:2209.10648,亚军一手来源)

NVIDIA 团队的技术报告(Siddiquee, Yang, He, Xu, Myronenko,2022-09-21)是 13 队中公开最完整的方案文档,要点:

  • 路线:切片级 2D SegResNet(MONAI),拒绝 3D 卷积——理由与 §5.3 一致:各向异性下 3D 核引入插值噪声;
  • 输入策略:三通道方案族——三个相邻 2D 层面 / 单层面三种 CT 窗 / 9 通道(相邻层+多窗组合),多窗让不同密度差的血液成分可见;
  • 训练:深监督(多尺度损失)、1600 epoch、Auto3DSeg 自动调参;
  • 提交:18 模型集成(多折+多检查点);
  • 结果:测试 DSC 0.721(单项第一)、综合第 2;内部 5 折 CV Dice 0.7959;HD=inf(作者归因于小血肿漏检/远处假阳性);
  • 赛后主张:高各向异性临床 CT 上 2D 常优于 3D;未来方向为 outlier 专用损失与 2.5D 混合架构。

该报告与总结论文 Table IV 及 MONAI 官方教程三方互证,是全数据集可信度最高的单一方案记录;复现成本也最低(教程代码公开)。

附录 O:Docker 提交规则要点(复刻赛制用)

官方仓库 docker 规则与示例(Apache-2.0)的核心约束,供设计同类挑战赛或复现提交流程者参考:

提交物:单容器镜像(含推理代码+依赖+权重),不包含测试数据
输入:  /input/ 下的 NIfTI 测试体积(组织者挂载)
输出:  /output/ 下的同名二值掩码(.nii.gz,与输入同尺寸同 spacing)
接口:  容器入口脚本按 GC 平台算法模板约定执行
评估:  组织者环境运行 → 逐例四指标 → aggregate-then-rank(附录 I)
时限:  每例推理有运行时间上限(超时按失败计,具体阈值以仓库规则文件为准)

要点解读:输出必须是原始 spacing 的同尺寸掩码——任何重采样都必须逆变换回原坐标系,这是各向异性任务在工程上的隐形考题(坑 3 的实践面);运行时限意味着重度集成方案(如 nvauto 的 18 模型)必须优化推理吞吐,挑战赛分数隐含了效率约束。

附录 P:未来届次与谱系展望

总结论文结论节对后续 INSTANCE 届次的预告(截至抓取时点未举办,触发点见附录 G):

  • 弃用 HD:IV 节反思的直接落地——未来的指标体系预计保留 DSC/NSD/RVD,以边界稳健指标替代最坏情形指标;
  • 多任务扩展:亚型多类分割、血肿扩张预测等方向被点名(与基线 SLEX-NET 的建模对象呼应);
  • 强制开源:针对 13 队仅 1 队开源(§5.6)的生态短板;
  • 数据扩展:亚型标注扩展版被列为未来工作(附录 G 维护触发点之一)。

若新届次启动,本条目的更新路径:新增谱系小节、§4.3 指标反思补"落地确认"、§7.3 景观表加行、附录 E 未披露行按新披露信息补全。

附录 Q:条目自洽性抽查记录(写手自检)

  • 冠军数字链:INFOBOX(69.25±19.14)↔ §5.1 表 ↔ FAQ Q18/Q24 ↔ 事实清单 17 ↔ 附录 C 一致;
  • 亚军双口径链:DSC 72.06 单项第一 + HD=inf + 综合第 2 ↔ arXiv:2209.10648(0.721/2nd/CV 0.7959)互证,FAQ Q18/Q30、附录 N 一致;
  • 坑点编号链:§10(坑 1-10 定义)↔ 附录 L(索引)↔ 正文散布引用(坑 1:§0;坑 2:§5.5;坑 3:§2.3;坑 4:§5.3;坑 5:§1-Q1/附录 Z;坑 6:§4.3/FAQ-Q24;坑 7:§2.4/FAQ-Q39;坑 8:§2.2;坑 9:§2.6;坑 10:§6.3/FAQ-Q16)逐一对应;
  • 节号引用链:FAQ/附录中的 § 引用(§2.4/§4.2/§4.3/§6.2/§6.3/§7.3 等)与实际章节一一核对;
  • 双口径登记:附录 F 六行与 §2.2/§2.3/§5.5/坑 4/坑 5/坑 10 正文表述一致。

附录 R:数据下载操作手册(GC 平台)

1. 访问 https://instance.grand-challenge.org/
2. 注册/登录 GC 账号(免费;平台级账号,非赛事专属)
3. 进入 Dataset 页 → 阅读 2026-09-11 NEWS 与页面说明
4. 点击下载链接获取数据包(train 100 例图像+掩码 / evaluation 30 例图像)
5. 下载前:读 GitHub 仓库 Agreements/instance2022_agreements.pdf(坑 10)
6. 解压后核对:train/data 001-100.nii.gz + train/label 001-100.nii.gz
   + evaluation 101-130.nii.gz;逐例读 header 登记真实 spacing(坑 3)
7. 若页面结构变化(GC 平台会改版),以官网实时页面为准并回填本附录

附录 S:35 人署名网络速览

总结论文的 35 人署名是"组织者+参赛队代表"混合模式,可考者按角色分组:

角色 可考人物 所属
组织核心 Xiangyu Li(一作)、Gongning Luo、Kuanquan Wang、Shuo Li(末位/学术带头人) 哈工大感知计算研究中心
医院侧 Hongyu Wang 等 北京大学首钢医院
亚军队 Md Mahfuzur Rahman Siddiquee、Andriy Myronenko(另有 Yang/He/Xu 见 arXiv:2209.10648) NVIDIA
欧洲参赛侧 Antoine P. Sanner、Anirban Mukhopadhyay(TU Darmstadt)+ Ahmed E. Othman(临床合作);Valeriia Abramova、Xavier Lladó(Girona/UdL,对应 nic-vicorob 可考线索) 德国/西班牙
其他 Xingyu Zhao、Weiping Liu(深圳);Bradley J. MacIntosh(Toronto);Moona Mazher、Abdul Qayyum 多机构

跨队署名的含义:终榜上的对手同时是论文的共同作者——挑战赛总结论文的社区契约模式(名次归名次,社区共建归共建)。这也意味着论文对各队方法的描述经过了当事队伍确认,Table I/II 的方法学登记可信度高于一般二手汇总。

附录 T:常见错误用法清单(反面模式)

反面模式 后果 正确做法
只报全集平均 DSC 掩盖小血肿崩溃(§2.5) 按四分位体积分组分层报分
拿终榜分数当可复现结果 终榜无 GT、不可第三方审计(§11.3) 引用时注明"挑战赛终榜(组织者环境)"
把二值掩码当亚型标注用 类别定义错误(坑 7) 转 BHSD 或自标
硬编码 spacing 0.42/5.0 max 层厚 10mm 的病例几何失真(坑 3) 逐例读 header
把 52.83 当 SLEX-NET 原论文结果 口径混引(坑 2) 标注"INSTANCE 数据重训口径"
引 “IPH=脑室内出血” 缩写张冠李戴(坑 5) 按 IVH 正名
拿 INSTANCE 分数与器官分割比较 水位不可比(§5.1 横向表) 只在各向异性任务间横比
公开化=随便再分发 协议状态未核(坑 10) 先读协议 PDF/邮件确认
报"我超过了 0.6925"而不报协议 终榜不可复现、验证/测试混淆(Q21/Q29) 对齐协议:自留出集+四指标+分层报告

附录 U:检索关键词登记表

语种 推荐检索词 去噪提示
中文 颅内出血分割挑战赛;脑出血分割数据集;平扫CT 出血 3D 分割 加"2022"或"INSTANCE"收敛
英文 INSTANCE2022; intracranial hemorrhage segmentation challenge; NCCT hemorrhage dataset instance 是普通词,务必带 2022/挑战赛限定
组合 INSTANCE 2022 MICCAI; anisotropic hemorrhage segmentation 找论文加 arXiv 2301.03281
平台 instance.grand-challenge.org; PerceptionComputingLab INSTANCE2022 GitHub org 名与赛事名不同,勿混

检索验证三步:任何搜索结果先对全称(坑 1)→ 再对平台(GC vs Kaggle,坑 9)→ 最后对任务(分割 vs 分类、二值 vs 多类,坑 7/9)。三步全过再读细节,可避开绝大多数身份类误引。

附录 V:核验过程与抓取环境存照

本条目撰写(2026-09-26)的核验路径存照,供后续维护者理解证据等级:

  • 一手来源三件套:arXiv:2301.03281 全文(经 ar5iv 渲染版抓取)、官方 GitHub 仓库(LICENSE/README/Schedule/Agreements 目录列表)、GC 官网(About 页与 NEWS 快照);
  • 互证来源:NVIDIA 方案报告 arXiv:2209.10648(WebSearch 核验通过,DSC 0.721/2nd/CV 0.7959 三方互证)、openmedlab 汇总页(第三方统计口径来源)、MICCAI 官方挑战赛列表(Zenodo DOI 登记);
  • 抓取受限项:GC Dataset 页与 leaderboard 页对爬虫返回 403(需登录视角,内容经官网 NEWS 快照与论文转述补齐);GitHub raw 协议 PDF 抓取失败(条款全文未转录,坑 10)——两项均已列入附录 G 维护触发点;
  • r.jina.ai 代理通道当日不可用,改用 ar5iv 直抓成功——抓取基础设施的状态会过时,后续维护者应优先尝试一手 URL 直达。

附录 Y:域别勘误核验记录(心脏 LGE-CMR → 脑部 NCCT)

委托候选清单把 INSTANCE2022 描述为"心脏 LGE-CMR 心肌梗死疤痕/水肿分割挑战赛(ICCES/MICCAI 联合赛事)"。存在性核验三轮结论:官网(instance.grand-challenge.org)首页明确标注 “The 2022 Intracranial Hemorrhage Segmentation Challenge on Non-Contrast head CT (NCCT)”;官方 GitHub About/Task 节为 ICH on NCCT;arXiv:2301.03281 标题/摘要/数据描述均为颅内出血 NCCT,MICCAI 2022(非 ICCES)联合举办。

结论:INSTANCE2022 实体真实存在、规模与获取可查证,仅委托描述存在域别张冠李戴。心脏 LGE-CMR 疤痕/水肿方向的真实候选应为 LAScarQS2022(左心房疤痕)、EMIDEC(心肌梗死认证)、MyoPS(心肌病理分割)等赛事——若需心脏条目应另立候选。本条目按实际事实(脑 CT)撰写并在坑 1 全程存照。

附录 Z:缩写速查

缩写 全称 中文
INSTANCE INtracranial hemorrhage SegmenTAtioN ChallEngE 颅内出血分割挑战赛
ICH Intracranial Hemorrhage 颅内出血
NCCT Non-Contrast head CT 非增强头颅 CT
IPH Intraparenchymal Hemorrhage 脑实质出血
IVH Intraventricular Hemorrhage 脑室内出血
SAH Subarachnoid Hemorrhage 蛛网膜下腔出血
SDH Subdural Hemorrhage 硬膜下出血
EDH Epidural Hemorrhage 硬膜外出血
DSC Dice Similarity Coefficient Dice 相似系数
NSD Normalized Surface Dice 归一化表面 Dice
RVD Relative Volume Difference 相对体积差
HD Hausdorff Distance 豪斯多夫距离
GC Grand Challenge 医学影像挑战赛平台
MICCAI Medical Image Computing and Computer Assisted Intervention 医学影像计算与计算机辅助介入国际会议
HIT Harbin Institute of Technology 哈尔滨工业大学
WCE Weighted Cross-Entropy 加权交叉熵
CV Cross-Validation 交叉验证

附录 W:与 isles(495)逐维对照(同届卫星赛事镜像)

维度 INSTANCE2022 ISLES 2022(isles, 495)
病理 出血性卒中 缺血性卒中
模态 NCCT 单模态 MRI 多序列(DWI/ADC 等)
病灶形态 团块状血肿,边界相对可辨 弥散病灶,边界本身半模糊
任务 3D 体素级二值分割 3D 体素级分割
最坏情形设计 HD=inf 劣后(漏检=严重错误) 无 inf 机制(缺血灶不整块缺失)
数据规模 200 例(100/30/70) 以库内 isles 条目登记口径为准
平台 Grand Challenge Grand Challenge

对照读法:同届、同平台、同任务形态的两场赛事,因病理与模态不同而演化出不同的评估细节——挑战赛设计是被病理特性塑造的,不存在普适模板。

尾注

本条目由千方病案医数集写手代理 A(影像域)于 2026-09-26 独立完成核验与撰写。核心数字三源互证(官方论文 arXiv:2301.03281、官方 GitHub 仓库、Grand Challenge 官网快照;辅以 NVAUTO 方案报告 arXiv:2209.10648 与 openmedlab 汇总页交叉核对)。抓取环境限制:GC 部分页面(Dataset/leaderboard)反爬不可达,相关内容经官网 NEWS 快照与论文转述存照;GitHub raw PDF(协议全文)抓取失败,条款转录列入待核。条目域别勘误(心脏 LGE-CMR → 脑部 NCCT)的完整理由见 FACTS.md 第 1 节与坑 1。

本条目与 writing/instance2022/FACTS.md(事实档案,九节)构成一对文件:FACTS 存证据链与 12 条存照/待核项,本条目存叙述与解读;FACTS 第 9 节的全部存照已映射进正文坑点(坑 1-10)、附录 F(双口径登记)、附录 G(维护触发点)与附录 V(核验过程存照)。两文件应同版本维护。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • curvas — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • mitoem — 共享标签:医学影像 / 医学图像分割 / 挑战赛数据集 / 评测基准 / 脑影像
  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • rsna-intracranial-hemorrhage — 共享标签:医学影像 / CT / 挑战赛数据集 / 评测基准 / 脑影像
  • asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • ulf-enc — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 脑影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集