ISLES — 缺血性卒中病灶分割挑战系列 AI-Ready Wikipedia

六届 MICCAI 挑战、逾 900 例多中心卒中影像基准

来源 MICCAI ISLES Challenge Organizing Committee url: https://www.isles-challenge.org/发布时间: 2026-09-16最后更新: 2026-09-25 阅读 44
ISLES — 缺血性卒中病灶分割挑战系列 AI-Ready Wikipedia

信息速览

数据集名称ISLES — 缺血性卒中病灶分割挑战系列 AI-Ready Wikipedia
数据类型逾 900 例多中心影像,NIfTI+BIDS 格式,约 99GB 最大单届,CC BY 4.0 开放,6 届连续基准
规模逾 900 例检查(六届累计,含跨届重叠)
接入方式MICCAI ISLES Challenge Organizing Committee url: https://www.isles-challenge.org/
AI 就绪度

数据集封面

ISLES — 缺血性卒中病灶分割挑战系列 AI-Ready Wikipedia

INFOBOX

数据集名称 ISLES(Ischemic Stroke Lesion Segmentation)挑战系列数据集
英文全称 Ischemic Stroke Lesion Segmentation Challenge Datasets 2015-2024
别名/简称 ISLES、ISLES 2015/2016/2017/2018/2022/2024、ISLES’22、ISLES’24
疾病分类 缺血性脑卒中(ICD-11:8B11 脑梗死 / 8B11.0 大脑动脉闭塞或狭窄所致脑梗死 / 8B11.5 未特指的脑梗死)
SNOMED CT 422504002 Ischemic stroke / 62914000 Cerebrovascular accident / 230690007 Cerebral infarction(详见 §2.1b)
数据模态 多光谱脑 MRI(DWI/ADC/FLAIR/T1/T2)+ 动态磁敏感灌注 MRI(PWI 系列)+ 头颅 CT 平扫/血管成像/灌注成像(NCCT/CTA/CTP)+ 临床表格数据
AI 任务类型 三维病灶分割、病灶结局预测、灌注-弥散不匹配估计、梗死体积定量、血管闭塞检测、90 天功能结局(mRS)回归与分类、跨中心泛化评估
样本总数 六届累计逾 900 例影像检查(含跨届重叠病例,不可简单相加);单届最大为 ISLES 2022 的 400 例
数据大小 ISLES 2024 压缩后约 99 GB;ISLES 2022 训练集约 6 GB;ISLES 2016 约 9.14 GB(30 例子集)
数据格式 NIfTI(.nii / .nii.gz);临床表格 CSV;扫描仪元数据 JSON;ISLES 2024 全量遵循 BIDS 目录规范
许可证 CC BY 4.0(ISLES 2015-2018 重发布、ISLES 2022 训练集);CC BY-NC-SA 4.0(ISLES 2024)
访问级别 开放(2015-2018、2022 训练集);注册后开放(ISLES 2024 训练集);测试集历届均不公开,仅在线评测
DUO 标签 GRU, HMB, NPUNCU, PUB(ISLES 2024 另受 NCU 限制)
语言 英文(全部文档、标签与临床字段)
首发日期 2015-04(ISLES 2015 训练集经 SMIR 平台发布)
最后更新 2026-04-22(ISLES’24 期刊数据论文在线发表,Radiology: Artificial Intelligence)
发布机构 MICCAI ISLES 挑战组织委员会(慕尼黑工业大学、伯尔尼大学、汉堡-埃彭多夫大学医学中心、icometrix 等)
官方主页 https://www.isles-challenge.org/
下载地址 https://doi.org/10.5281/zenodo.7153326(ISLES 2022 训练集);https://doi.org/10.5281/zenodo.17736412(2015-2018 合集)
DOI 10.1038/s41597-022-01875-5(ISLES 2022 数据论文)/ 10.1016/j.media.2016.07.009(ISLES 2015 论文)/ 10.1148/ryai.250603(ISLES’24 数据论文)
引用次数 671+(ISLES 2015 论文,Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方划分明确、指标脚本开源、NIfTI+BIDS 规范;扣分项:跨届异质性强、测试集真值永久封闭、2015-2018 标注协议文档较薄
页面状态 published

§0 E-E-A-T 与审核声明

本词条由千方病案医学编辑部组织撰写,并经交叉审核。所有关键数字(例数、模态组合、评测指标、榜单成绩)均回溯至官方挑战主页、数据论文或同行评审文献,检索日期为 2026-09-16。

医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、卒中影像学定义、mRS 与 NIHSS 量表的临床含义)、§7 偏倚分析(阅片者间差异、点状栓塞灶标注不足的临床后果)。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略与跨届泄漏风险、§6 预处理 Pipeline 和八个坑点、§8 排行榜数值的可比性说明。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ISLES 2015-2018 与 ISLES 2022 训练集以 CC BY 4.0 发布,ISLES 2024 以 CC BY-NC-SA 4.0 发布(禁止商业使用、要求相同方式共享)。历届测试集真值均不公开。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

本词条的独特价值在于:它把六届挑战当作一个连续演进的技术史来写,而非六份独立的说明书。对于任一届,读者能查到该届的子任务定义、例数、模态、标注协议、评测指标与可核实的榜单;对于跨届使用,读者能查到泄漏关系、许可证差异与数值不可比的边界。这正是检索单一届论文无法获得的视角。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? ISLES 是 MICCAI 自 2015 年起连续举办的缺血性卒中病灶分割挑战系列。它不是一个数据集,而是六届挑战的合集:2015 年分 SISS(亚急性病灶分割)与 SPES(急性灌注病灶估计)两个子任务;2016 与 2017 转而预测卒中病灶的最终结局;2018 用急性 CT 灌注数据去推断随后的 DWI 梗死核心;2022 用 400 例多中心多模态 MRI 把急性到亚急性梗死分割推向大数据规模;2024 把急性 CT、随访 MRI 与三个月临床结局串成纵向队列。数据格式统一为 NIfTI,2024 届完全遵循 BIDS 目录规范。

为什么重要? 卒中病灶分割长期受困于"结果不可比":每个人用自己的数据、自己的指标、自己的划分,论文数字无法横比。ISLES 是第一个系统性地用统一评测框架解决这个问题的卒中影像基准。它带来的不只是数据,还有一套被反复修订的评测协议——从 2015 年的 Dice+ASSD,到 2022 年引入病灶级 F1、病灶计数差与体积差的多指标平均排名。这套协议的副产品是 DeepISLES:直接由 2022 届前十名方法集成而成,在 1685 例外部队列上超过此前最优方法 7.4% Dice,并在图灵式测试中被神经放射科医师认为优于人工分割。

我能用它做什么? 最典型的用法是训练并评测三维梗死分割模型。ISLES 2022 的 250 例公开训练集是当前中文社区最常用的入口:CC BY 4.0 许可、约 6 GB、DWI+ADC+FLAIR 三通道,官方还提供了读图、可视化与指标计算脚本。如果你关心泛化性,2022 届的设计本身就包含"训练时未见过的中心"与"再灌注治疗前采集的病例"两类外部考验。如果你做的是纵向建模或影像组学,2024 届的 149 例公开训练集提供 CT+MRI+临床结局的完整链条,但受 CC BY-NC-SA 4.0 限制,不可用于商业产品。

§1.1 摘要

ISLES(Ischemic Stroke Lesion Segmentation)是由 MICCAI 社区组织的缺血性卒中影像挑战系列,首办于 2015 年,至 2024 年已举办六届。其核心目标始终是同一个:为自动化的卒中病灶分割算法提供可比较、可复现的公共基准。为实现这一点,每一届都公开一批多中心脱敏影像及其专家标注(训练集),同时保留一批不公开的测试集用于在线评测,并发布统一的评测脚本与排名规则。系列的演进并非线性扩张,而是任务焦点与模态组合的多次转向。2015 届建立双子任务框架(SISS 亚急性分割、SPES 急性灌注估计),用 64 例与 50 例的规模完成了首次全社区横比,结论是灌注病灶估计可行而亚急性病灶分割精度不足。2016 与 2017 届把问题从"当前病灶在哪里"改为"最终梗死灶会到哪里",引入 4D-PWI 与多种灌注参数图,2017 是 2016 的超集。2018 届转向 CT 灌注,用 103 例患者在 CTP 上预测随后 DWI 上的梗死核心,直接对接 DAWN 与 DEFUSE-3 试验所确立的临床决策逻辑。2022 届是规模与规范性的分水岭:400 例(训练 250、测试 150)多厂商 MRI,DWI+ADC+FLAIR 三通道,四级人机混合标注流程,并把评测扩展为 Dice、病灶级 F1、病灶计数差、体积差四指标平均排名。2024 届则第一次把时间维度做进数据:急性期 CT(NCCT/CTA/CTP)、2-9 天随访 MRI(DWI/ADC/FLAIR)与三个月临床结局共同构成 245 例纵向队列,并提供了血管闭塞掩膜与 Willis 环解剖标注。系列的遗产溢出学术边界——由 2022 届优胜方法集成而来的 DeepISLES 已成为经临床验证、可在外部 1685 例队列上复现的卒中分割模型。

§1.2 战略价值

维度一:它是卒中影像 AI 的"公共度量衡",价值在协议而非数据量。 医疗 AI 领域最昂贵的成本不是算力,而是"论文 A 与论文 B 的数字无法比较"所导致的重复劳动。ISLES 的核心贡献是把评测这件事标准化:统一的训练/测试划分、统一的真值空间、统一的指标实现、统一的多指标排名规则。2015 届论文明确记载,之所以采用离站评测而非现场评测,是因为既往现场评测(如若干脑肿瘤与心脏分割挑战)常因与算法性能无关的工程因素而失败;测试集真值对参赛者隐藏,以避免在测试集上调参。这一设计选择此后被历届沿用,也构成了本系列最重要的方法学资产。对使用者而言,这意味着两件事:ISLES 的榜单是少数可以放心引用的卒中分割排名;同时,它的测试集真值永久封闭,你无法独立复算官方成绩。

维度二:六届的模态转向本身就是一份"什么模态能干什么"的实证地图。 单看某一届,你只会知道该届任务;横看六届,你会得到一组关于模态能力的经验结论:多光谱 MRI(DWI+FLAIR+T1+T2)足以支撑亚急性病灶定位但边界困难;灌注参数图(MTT/rCBF/rCBV/Tmax/TTP)能刻画急性灌注缺损且在最优方法上达到体积拟合 r=0.93;CT 灌注可以预测随后的 DWI 梗死核心(2018 届的核心命题);而把 CT、MRI 与临床变量纵向串联,才能触及"梗死如何生长、患者最终如何"这类真正有临床决策价值的问题(2024 届的命题)。这条演进链条对选型有直接指导意义:如果你的任务只需要分割急性梗死,2022 届的 MRI 数据是成熟选择;如果你的问题是治疗决策与预后,2024 届的纵向结构无法被前几届替代。

维度三:系列的产出已经反向进入临床工具链,形成闭环。 ISLES 2022 的排行榜不是终点。组织者把前十名方法集成成 DeepISLES,在 1685 例外部数据上验证,Dice 提升 7.4%、F1 提升 12.6%,并让神经放射科医师在图灵式测试中更偏好算法分割。更值得注意的是,ISLES 2024 的参考标准正是由 DeepISLES 预分割、再由两名高年资神经放射科医师质控修正而成。挑战产出的算法成为下一届挑战的真值生产工具——这在医学影像基准史上是罕见的闭环,也提示了一条重要的使用边界:两届之间存在方法学依赖,不能当作完全独立的证据。

§1.3 同类数据集横向对比

数据集 发布年份 规模 模态 标注方式 差异化定位
ISLES 2015(SISS/SPES) 2015 64 例(SISS)+ 50 例(SPES) DWI/FLAIR/T1/T2 + 灌注 MRI 专家分割(单层真值) 首个卒中分割公共基准;建立离站评测范式
ISLES 2016 2016 训练 35 / 测试 19 4D-PWI/ADC/MTT/rCBF/rCBV/Tmax/TTP 神经放射科医师勾画 ~90 天随访最终梗死灶 首次把任务从分割转为结局预测
ISLES 2017 2017 训练 43 / 测试 32 同上(2016 的超集) 同上 2016 的扩容版;两届不可当独立测试集
ISLES 2018 2018 103 例(63/40) CT 灌注 → DWI 真值 专家分割 DWI 梗死核心 唯一以 CTP 为输入的早期届次;对接再灌注决策
ISLES 2022 2022 400 例(训练 250 / 测试 150) DWI+ADC+FLAIR(多厂商 1.5T/3T) 四级人机混合,含阅片者间一致性实验 规模最大、文档最完备、社区最常用
ISLES 2024 2024 245 例(训练 149 / 测试 96) NCCT/CTA/CTP + DWI/ADC/FLAIR + 临床 DeepISLES 预分割 + 双专家质控 唯一纵向多模态队列,含 90 天结局
ATLAS v2.0 2022 1,271 例(655 训练等) 单通道 T1w 专家 + 半自动质控 跨急/亚急/慢性、单模态 T1,与 ISLES 2022 并行但患者不重叠
与本品差异 — ISLES 六届累计逾 900 例 MRI 为主 + CT 两届 逐届协议不同 唯一覆盖"分割 → 结局预测 → 纵向多模态"完整问题谱的系列

说明:表中"与本品差异"行强调 ISLES 的系列属性。其他卒中影像数据集多为单一版本发布,而 ISLES 是连续六届,任务定义随临床问题演进,因此更适合作为方法学沿革的研究对象,而非静态训练集。

§1.4 版本时间轴

时间 届次 关键事件
2015-02 ISLES 2015 挑战启动,参与者经文献综述与邮件列表定向征集
2015-04 ISLES 2015 SISS 与 SPES 训练集经 SMIR 平台发布
2015-09-14 ISLES 2015 测试集发布,一周内截止提交;SMIR 注册用户超 120
2015-10 ISLES 2015 MICCAI 2015(慕尼黑)workshop 公布结果;SISS 14 队、SPES 7 队参赛
2016 ISLES 2016 任务转向病灶结局预测;35 例训练队列
2017 ISLES 2017 队列扩至 43 例训练(新增 8 例),成为 2016 的超集
2018-06-14 ISLES 2018 注册开放并分发 CT 灌注训练数据(103 例)
2018-07-03 ISLES 2018 因部分病例 DICOM-NIfTI 转换问题更新训练集
2018-08-10 ISLES 2018 修复评估脚本缺陷,要求重新上传测试结果,截止延期至 08-17
2018-09-16 ISLES 2018 与 BraTS、BrainLes Workshop 联合的 MICCAI 2018 全天卫星活动;公布前五名
2022-05-17 ISLES 2022 第一批训练数据发布(原定 05-10,顺延一周)
2022-06-15 ISLES 2022 Docker 提交系统开放
2022-07-15 ISLES 2022 Docker 提交系统关闭
2022-09-18 ISLES 2022 MICCAI 2022 期间与 BrainLes Workshop 联合举办
2022-12 ISLES 2022 数据论文发表于 Scientific Data(9:762)
2024-08 ISLES 2024 挑战论文与数据论文预印本发布(arXiv:2408.10966 / 2408.11142)
2025 ISLES 2015-2018 原 SMIR 平台停运后,四届数据重发布于 Zenodo(CC BY 4.0)
2025-08-09 ISLES 系列 DeepISLES 论文发表于 Nature Communications(16:7357)
2026-04-22 ISLES 2024 数据论文正式发表于 Radiology: Artificial Intelligence 8(3)

§1.5 典型应用场景

  1. 三维梗死分割模型开发与公平横比:用 ISLES 2022 的 250 例公开训练集训练(若干基线用 5 折交叉验证),再以官方四指标协议报告结果,可直接与榜单上的 PAT、SEALS、NVAUTO 等方法对照。这是本系列最高频的用法。
  2. 跨中心与跨治疗方案泛化性研究:ISLES 2022 的测试集刻意混合了训练期已见中心、未见中心(汉堡)以及再灌注治疗前采集的病例,天然构成三个泛化维度。研究者可以只利用公开训练集内部的中心划分来近似复现这一评估结构。
  3. 灌注-弥散不匹配与梗死生长预测:ISLES 2016/2017 提供完整的灌注参数图与 90 天随访真值,ISLES 2024 进一步提供急性 CT 与 2-9 天 MRI 的配对,两者共同支撑"从急性影像预测最终梗死范围"的建模。
  4. 多任务学习与辅助标注:ISLES 2024 同时提供病灶掩膜、大血管闭塞掩膜与 Willis 环多类解剖掩膜,适合训练多任务网络,也可作为半自动标注工具的评估床。
  5. 临床生物标志物提取的方法学验证:DeepISLES 论文展示了从分割结果中提取临床生物标志物并与临床卒中评分相关的完整流程,为"分割只是手段、生物标志物才是目的"这类研究提供了可复用的范式。

§2 医学背景

§2.1 ICD-11 编码映射

ISLES 覆盖的是缺血性脑卒中(脑梗死)这一疾病实体,其影像表现为脑组织因血流中断而发生的不可逆损伤(梗死核心)及其周围的低灌注但可挽救组织(缺血半暗带)。ICD-11 相关编码如下。

标签 ICD-11 编码 中文名 在 ISLES 中的角色
主要疾病 8B11 脑梗死 全部六届的目标疾病
主要疾病细分 8B11.0 大脑动脉闭塞或狭窄所致脑梗死 ISLES 2018/2024 的大血管闭塞标注直接对应
主要疾病细分 8B11.1 颈内动脉闭塞或狭窄所致脑梗死 2018/2024 入组病例的常见病因
主要疾病细分 8B11.5 未特指的脑梗死 部分病例编码回退至此类
主要疾病细分 8B11.Y 其他特指的脑梗死 栓塞性多发点状梗死(2022 届重点纳入)
症状相关 8B11.2 未特指的脑动脉闭塞或狭窄 影像上表现为血管闭塞但梗死范围未定
相关状况 8B20 脑出血 排除标准(ISLES 仅针对缺血性)
危险因素 8B11 相关 高血压、心房颤动、糖尿病等 临床表型字段涉及的共病,非影像标注目标

说明:ISLES 的数据发布不附带逐例 ICD-11 编码(官方未披露编码字段),上表为按疾病实体与标注内容建立的映射,用于跨数据集检索与队列定义,不可直接用于逐例编码。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语
缺血性卒中 8B11 422504002 Ischemic stroke (disorder)
脑血管意外 8B11 62914000 Cerebrovascular accident (disorder)
脑梗死 8B11 230690007 Cerebral infarction (disorder)
大脑动脉闭塞 8B11.0 372300006 Occlusion of cerebral artery (disorder)
梗死核心(影像) 8B11 449717003 Cerebral infarct core (observable entity)
缺血半暗带 8B11 449717004 Ischemic penumbra (observable entity)
弥散加权成像 — 44654005 Diffusion weighted magnetic resonance imaging (procedure)
灌注加权成像 — 450545008 Perfusion weighted magnetic resonance imaging (procedure)
CT 灌注成像 — 447177000 Computed tomography perfusion study (procedure)
机械取栓术 — 705173008 Endovascular thrombectomy (procedure)

说明:SNOMED CT 码用于跨术语体系检索,例如在电子健康记录中定位"接受过机械取栓且存在 DWI 病灶"的病例。ISLES 数据本身不含 SNOMED 字段。

§2.2 疾病简介与流行病学

缺血性脑卒中由脑动脉阻塞导致局部脑组织缺血坏死,是全球致死与致残的主要病因之一。卒中幸存者中,有相当高比例遗留永久性残疾。近十余年来,血管内再灌注治疗显著改善了颅内大血管闭塞患者的预后,而影像引导的治疗决策进一步放大了这一改善:CT 与 MRI 的选择性应用,使得医师能区分"已经不可逆坏死的梗死核心"与"低灌注但仍可挽救的半暗带",从而决定是否、以及如何实施再灌注治疗。DAWN 与 DEFUSE-3 两项试验正是这一逻辑的临床支柱,ISLES 2018 届的挑战设定即直接援引它们作为动机。

影像学的技术难点在于三点。第一,病灶形态极度异质:从占据整个大脑中动脉供血区的巨大皮层梗死,到散布全脑的点状栓塞灶,体积跨度可达数百毫升。第二,边界本质上模糊:DWI 信号在梗死边缘因部分容积效应而逐渐衰减,勾画者不得不借助高分辨率 FLAIR 上水肿表现来推断边界。第三,时间演化使同一病灶在不同阶段呈现不同面貌,亚急性期的"假性正常化"尤其削弱 DWI 的对比度。这三难共同解释了为什么人工分割既耗时又存在显著的阅片者间差异,也解释了为什么自动化分割值得追求。

§2.3 临床任务定义

ISLES 各届对应的临床任务可归入以下四类。

任务类型 临床问题 对应届次 输出形式
病灶分割 当前影像上病灶位于何处、体积多大 2015(SISS)、2022、2024 体素级二值掩膜
灌注估计 急性期低灌注组织的范围与程度 2015(SPES)、2016、2017 体素级或体积级灌注缺损估计
结局预测 最终梗死灶将扩展至何处 2016、2017、2018、2024 随访影像空间上的最终梗死掩膜
预后与功能评估 患者 90 天后功能状态如何 2016(mRS)、2024(mRS 等) 序数分级或回归值

需要特别注意的是,“结局预测"与"病灶分割"在数据层面看起来相似(都是输出一个掩膜),但评估逻辑完全不同:结局预测的输入是急性期影像,真值来自数天后的随访影像,因此模型必须处理配准误差与病灶演化,而不能简单地"看图描边”。混淆这两类任务是最常见的方法学误用之一。

§2.4 患者人群特征

维度 ISLES 2015 ISLES 2016/2017 ISLES 2018 ISLES 2022 ISLES 2024
来源中心 德国吕贝克为主(56/64)及多中心 多中心(含伯尔尼) 多中心 慕尼黑、伯尔尼(训练);加汉堡(测试) 慕尼黑、苏黎世
采集时间窗 亚急性期 急性期影像 + ~90 天随访 发病 8 小时内 CTP,其后 3 小时内 MRI 急性至早期亚急性(部分为再灌注治疗前) 超急性 CT + 2-9 天 MRI
年龄 官方未披露逐届统计 官方未披露 官方未披露 官方未披露总体统计量 见随附临床表 demographic_baseline.csv
性别 官方未披露 官方未披露 官方未披露 官方未披露总体统计量 见随附临床表
种族/族裔 官方未披露 官方未披露 官方未披露 官方未披露 官方未披露
就医类型 住院卒中患者 住院卒中患者 急诊卒中(再灌注治疗候选) 住院卒中患者(含取栓后病例) 急诊入院并接受再灌注治疗
排除标准 严重运动伪影致图像不可诊断者 官方未披露 不满足时间窗者 仅排除严重运动伪影病例;不因信号丢失、空间畸变或场强而排除 官方未披露

一个重要的实务提醒:ISLES 2022 的数据论文明确说明,除"运动伪影严重到无法临床诊断"的病例外,不因信号丢失、空间畸变等其他潜在质量问题排除病例,且不特别区分 1.5 T 与 3 T,阅片者对采集模式设盲。这意味着数据保留了真实世界的异质性,也意味着使用者不能假定图像质量高度统一。

§2.5 临床价值

ISLES 的核心临床价值可以概括为"把分割从研究手势变成可测量的量"。梗死体积与病灶数目是卒中诊断分级、治疗决策与预后评估的基础量,但人工勾画耗时且变异大,使得这些量在常规临床中难以稳定获得。自动化分割一旦可靠,可以支撑三类应用:在急性期辅助判断核心与半暗带的比例,为再灌注治疗决策提供定量依据;在亚急性与慢性期提供可复现的病灶负荷指标,用于随访与二级预防评估;在研究中提供标准化的影像表型,使不同队列的结论可以互相印证。DeepISLES 在 1685 例外部数据上的表现、以及其提取的生物标志物与临床卒中评分的强相关性,正是这一价值的实证。

§2.6 金标准定义

届次 划分方式 标注方式 标注者 性质
ISLES 2015(SISS) 训练 28 / 测试 36 专家在 MRI 上分割亚急性梗死灶 临床专家(单阅片者) 参考标准,非共识标注
ISLES 2015(SPES) 训练 30 / 测试 20 以灌注-弥散不匹配定义靶区 临床专家 参考标准,含方法学定义
ISLES 2016/2017 训练/测试 × 原空间/配准空间 神经放射科医师在 ~90 天随访影像上勾画最终梗死灶,置于急性期影像空间 神经放射科医师 单一层次真值,无多阅片者标注层
ISLES 2018 训练 63 / 测试 40 CTP 输入,专家分割随后 DWI 上的梗死核心 临床专家 跨模态真值(输入与真值不同模态)
ISLES 2022 训练 250 / 测试 150 四级人机混合:算法预分割 → 受训医学生编辑 → 住院医师修订 → 高年资神经放射科医师终审;工具为 ITK-Snap 或 3D Slicer 多名标注者分层协作,终审者均具 10 年以上卒中影像经验 参考标准 + 阅片者间一致性实验(10 例重勾画)
ISLES 2024 训练 149 / 测试 96 DeepISLES 自动生成初始掩膜,再由两名神经放射科医师质控与人工修正核验 两名具 10 年以上经验的神经放射科医师 算法预分割 + 专家核验的混合金标准

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
训练三维梗死分割模型并希望与社区横比 ISLES 2022 训练集 约 6 GB(250 例) 规模最大、CC BY 4.0 无商业限制、官方指标脚本齐备、榜单可查
研究跨中心泛化或再灌注治疗前后差异 ISLES 2022(利用官方训练/测试设计逻辑) 约 6 GB 官方设计本身即含未见中心与治疗前病例两个泛化维度
做灌注成像到梗死预测的建模 ISLES 2016 或 2017 9.14 GB(2016 的 30 例子集)/ 更大 提供完整灌注参数图与 90 天随访真值;注意两届为超集关系
研究 CT 灌注预测 DWI 核心 ISLES 2018 官方未披露 唯一以 CTP 为输入、DWI 为真值的届次
纵向多模态 + 临床结局建模 ISLES 2024 训练集 约 99 GB(压缩) 唯一提供 CT+MRI+90 天 mRS 的纵向队列;须注册,且 CC BY-NC-SA 4.0
需要血管闭塞或 Willis 环解剖标注 ISLES 2024 约 99 GB 只有该届提供 lvo-msk 与 cow-msk
复现历史方法学或做教学演示 ISLES 2015 双子任务 较小 规模小、概念清晰,适合讲清"分割 vs 灌注估计"的区别
商业产品开发 仅 ISLES 2015-2018、2022 训练集 视届次 CC BY 4.0 允许商业使用(须署名);ISLES 2024 为 NC 许可,不可

§3.1 模态详情

模态 全称 物理含义 覆盖届次 分割用途
DWI 弥散加权成像 反映水分子弥散受限,急性缺血最敏感 2015、2018(真值)、2022、2024 急性梗死核心的定位与边界(主序列)
ADC 表观弥散系数 DWI 信号的定量图,去除 T2 穿透效应 2016、2017、2022、2024 与 DWI 联合确认真性弥散受限
FLAIR 液体衰减反转恢复 抑制脑脊液信号,凸显水肿与陈旧病灶 2015、2022、2024 辅助区分新旧病灶、协助边界判断
T1w T1 加权成像 解剖参考 2015 解剖参照
T2w T2 加权成像 显示水肿 2015 解剖参照与病灶显影
4D-PWI 动态磁敏感灌注加权成像 造影剂首过的时间序列 2016、2017 生成灌注参数图的源数据
MTT / rCBF / rCBV / Tmax / TTP 灌注参数图 各类血流动力学指标 2016、2017 半暗带与灌注缺损估计
NCCT CT 平扫 排除出血、显示早期缺血改变 2024 参考空间与配准基准
CTA CT 血管成像 显示血管走行与闭塞位置 2018、2024 血管闭塞掩膜与 Willis 环解剖
CTP CT 灌注成像(4D,55 个时间点) 脑血流动力学的时间序列 2018、2024 灌注缺损与最终梗死预测
临床表格 phenotype CSV 基线人口学与 90 天结局 2024(2016 含 mRS 标签) 多模态融合建模

§3.2 各届样本量

届次 训练集 测试集 合计 来源
ISLES 2015 SISS 28 36 64 综述文献与原始论文
ISLES 2015 SPES 30 20 50 同上
ISLES 2016 35 19 54 期刊综述汇总表
ISLES 2017 43 32 75 期刊综述汇总表
ISLES 2018 63 40 103 官网记录 103 例,与综述拆分一致
ISLES 2022 250 150 400 官方数据论文
ISLES 2024 149 96 245 官方期刊数据论文

口径提示:ISLES 2015 的 SISS 与 SPES 是两个独立子任务,病例集合不完全相同,不可合并为 114 例单一队列。ISLES 2016 与 2017 存在超集关系(2016 是 2017 的子集),跨届累计数若直接相加会重复计数。ISLES 2024 的病例数在预印本中记为训练 150 / 测试 100,期刊版为 149 + 96 = 245,本词条采用期刊版。六届累计逾 900 例为"含重叠的影像检查数",不是去重后的独立患者数——去重后的独立患者数官方未披露。

§3.3 数据格式

届次 影像格式 结构 附加文件
ISLES 2015 NIfTI(.nii) 每例每模态一个文件,按 VSD.Brain.XX.O.MR_<模态> 命名 无
ISLES 2016/2017 NIfTI(.nii) Training/Testing × Native/CoRegistered 四套 无
ISLES 2018 NIfTI Training/Testing 两套 无
ISLES 2022 NIfTI(.nii.gz) BIDS 风格,含 DWI/ADC/FLAIR 与掩膜 DICOM 元数据 JSON、概率病灶图谱
ISLES 2024 NIfTI(.nii.gz) 严格 BIDS:rawdata / derivatives / phenotype 三层 demographic_baseline.csv、outcome.csv

§3.4 存储大小

届次/子集 大小 说明
ISLES 2016(30 例公开子集) 9.14 GB HuggingFace 镜像统计;含 4D-PWI 大体积序列
ISLES 2022 训练集(250 例) 约 6 GB Zenodo 发布;剥颅骨后体积显著减小
ISLES 2024 训练集(149 例) 约 99 GB(压缩) 含 4D CTP、CTA 与多套配准副本
ISLES 2015/2017/2018 官方未披露 原文未给出统一归档体积统计

实务提示:ISLES 2016/2017 的单例体积主要由 4D-PWI 决定,论文镜像描述其单例可达 112-199 MB;而 ISLES 2022 经过剥颅骨处理,250 例总量仅约 6 GB。不要把不同届次的大小直接换算为"每例成本"。

§3.5 标注方式

届次 标注性质 流程 质量保障
2015 人工专家分割 临床专家在 MRI 上勾画病灶 单阅片者,无一致性实验报告
2016/2017 人工专家分割 在 ~90 天随访影像上勾画最终梗死灶,映射回急性期空间 神经放射科医师执行
2018 人工专家分割 在随后 DWI 上勾画梗死核心 专家执行;曾因评估脚本缺陷重评
2022 人机混合(四级) 算法预分割 → 医学生编辑 → 住院医师修订 → 高年资医师终审 终审者 10 年以上经验;含 10 例阅片者间实验;质控者对预分割来源设盲
2024 机器预分割 + 专家核验 DeepISLES 生成 → 两名神经放射科医师质控修正 两名 10 年以上经验神经放射科医师核验

ISLES 2022 的标注流程值得单独说明。算法预分割最初只用单一 MRI 模态(B=1000 DWI)训练,但最终专家标注综合了全部三个模态——因为临床上判断病灶真伪需要 ADC 与 FLAIR 辅助(例如区分颅底 DWI 伪影、区分 T2 穿透效应与真性弥散受限)。论文因此明确建议:使用该数据集训练分割算法时,应整合全部三个序列以获得最佳结果。这是一个由标注流程直接推导出的建模建议,容易被忽略。

§3.6 标注者资质与一致性

ISLES 2022 是系列中唯一公开发表阅片者间一致性实验的届次。实验选取 10 例,覆盖大梗死与小梗死、大血管闭塞型与栓塞型、以及不同解剖部位,由两名神经放射科医师(分别具 16 年与 10 年以上经验)独立重新勾画。

对比 Dice 均值(标准差) 体积差(ml)均值(标准差) Dice 范围
数据集标注 vs 阅片者 II 0.90(0.09) 2.37(2.59) [0.69, 0.98]
数据集标注 vs 阅片者 III 0.86(0.13) 6.56(13.37) [0.61, 0.98]
阅片者 II vs 阅片者 III 0.83(0.12) 7.22(11.32) [0.57, 0.98]

这组数字有三个重要含义。第一,人类专家之间的 Dice 只有 0.83,这意味着任何模型在 Dice 上超过 0.85 之后,继续提升的空间在统计上已经接近标注噪声的上限。第二,数据集标注与单个专家的 Dice(0.90、0.86)高于两个专家彼此(0.83),说明多层级人机混合流程确实降低了单阅片者偏差。第三,体积差的标准差极大(最高 13.37 ml),提示边界判断的不确定性远大于病灶整体定位的不确定性。

论文同时披露了一个对使用者极为重要的偏倚:在审查此前为其他研究项目所做的标注时,专家发现"梗死边界常被勾画得过于保守,导致梗死体积被低估",且"大量点状栓塞性小梗死几乎总是被标注不足"。这个偏倚不是 ISLES 特有的疏漏,而是人工勾画卒中病灶的固有困难,但它对模型训练有直接影响:模型会倾向于学会低估体积、漏检小病灶。

§3.7 采集周期

届次 数据采集时期 发布时期
ISLES 2015 2015 年前及 2015 年内的历史病例 训练集 2015-04,测试集 2015-09-14
ISLES 2016 官方未披露具体年份区间 2016 年
ISLES 2017 官方未披露具体年份区间 2017 年
ISLES 2018 官方未披露具体年份区间 训练集 2018-06-14,测试集 2018-08-03
ISLES 2022 官方未披露具体年份区间;测试集含再灌注治疗前与后病例 训练数据 2022-05-17(第一批)
ISLES 2024 纵向:入院急性期至 90 天随访 预印本 2024-08,期刊 2026-04-22

§3.8 地域覆盖

ISLES 数据的地理来源高度集中于欧洲德语区的大学附属卒中中心。

城市/机构 国家 参与届次
慕尼黑(慕尼黑工业大学附属医院,Klinikum rechts der Isar) 德国 2015 起多届;2022 训练与测试;2024
伯尔尼(Inselspital,伯尔尼大学) 瑞士 2015 起多届;2022 训练与测试;2024 组织方
汉堡(汉堡-埃彭多夫大学医学中心 UKE) 德国 2022 测试集(训练期未见中心)
吕贝克(石勒苏益格-荷尔斯泰因大学医学中心) 德国 2015 SISS 主要来源(56/64)
弗赖堡 德国 参与过挑战相关工作(组织方名单含弗赖堡大学)
苏黎世(苏黎世大学 USZ) 瑞士 2024
全球参赛团队 多国 历届均有来自欧洲、北美、亚洲的团队参赛

地理偏倚的直接后果是:模型在 ISLES 上表现良好,只证明了它能处理欧洲三级卒中中心的影像与人群分布。对亚洲人群、社区医院、不同扫描协议的可迁移性,需要另行验证。

§3.9 设备规格

维度 情况
MRI 厂商 Philips 与 Siemens 多厂商混合(ISLES 2022 官方说明)
场强 1.5 T 与 3 T 混合;阅片者对场强设盲
CT 设备 ISLES 2018/2024;2024 明确使用多种 CT 与 MRI 扫描仪以提升泛化性
序列参数 逐例 DICOM 元数据以 JSON 形式随 ISLES 2022 发布(如可获得)
影像处理 ISLES 2022:HD-BET 脑提取,Elastix 刚性配准 FLAIR 至 DWI,DWI/ADC 剥颅骨后回归原始空间
空间分辨率 ISLES 2022 中 FLAIR 分辨率高于 DWI/ADC;社区常见做法是重采样至 1×1×1 mm

一个被反复记录在案的工程事实:ISLES 2022 的 FLAIR 与 DWI/ADC 参考空间存在轻微错位,且分辨率更高。NVAUTO 团队(Dice 最高)因此选择完全弃用 FLAIR,只用 DWI+ADC。这是该数据集最著名的一条实践教训,§6.5 将其列为独立坑点。

§3.10 深度溯源链

层级 内容
原始临床来源 各参与中心的 PACS 系统,按各届入组标准回顾性或前瞻性筛选病例
伦理与合规 依据各中心所在国(德国、瑞士)与欧盟的医学影像采集法规与质量规范;数据发布前完成不可逆去标识化
去标识化处理 剥颅骨(脑提取)、移除面部特征、清除 DICOM 头中的身份信息
标注层 专家勾画或人机混合预分割 + 专家核验,生成 NIfTI 掩膜
后处理层 配准、重采样、剥颅骨、回归原始空间
发布层 SMIR(2015-2018 原始)→ Zenodo(2022 及 2015-2018 重发布);Grand Challenge(在线评测)
镜像层 社区在 HuggingFace 等平台建立镜像(如 hugging-science/isles24-stroke)

§4 数据结构

§4.0 目录结构预览

以下为 ISLES 2022 训练集(官方 Zenodo 发布形态)的典型目录结构。

ISLES-2022/
├── raw_data/                           # 各例原始空间影像
│   ├── sub-stroke0001/
│   │   ├── ses-0001/
│   │   │   ├── sub-stroke0001_ses-0001_dwi.nii.gz       # 弥散加权成像(主序列)
│   │   │   ├── sub-stroke0001_ses-0001_adc.nii.gz       # 表观弥散系数图
│   │   │   └── sub-stroke0001_ses-0001_flair.nii.gz     # FLAIR(分辨率更高、轻微错位)
│   │   └── ...
│   ├── sub-stroke0002/
│   └── ...                             # 共计 250 例训练病例
├── der_dwi/                            # 与 DWI 空间一致的派生副本
│   ├── sub-stroke0001_ses-0001_dwi.nii.gz
│   ├── sub-stroke0001_ses-0001_adc.nii.gz
│   ├── sub-stroke0001_ses-0001_flair.nii.gz
│   └── sub-stroke0001_ses-0001_msk.nii.gz   # 真值掩膜(二值,位于 DWI/ADC 参考空间)
├── der_flair/                          # 与 FLAIR 空间一致的派生副本
│   └── ...
└── ...

ISLES 2024 采用严格 BIDS 三层结构,形态如下。

ISLES24/
├── rawdata/
│   └── sub-stroke0001/
│       ├── ses-01/                     # 急性入院 CT
│       │   ├── *_ncct.nii.gz           # CT 平扫(参考空间)
│       │   ├── *_cta.nii.gz            # CT 血管成像
│       │   ├── *_ctp.nii.gz            # CT 灌注(4D,55 个时间点)
│       │   └── perfusion-maps/         # cbf / cbv / mtt / tmax
│       └── ses-02/                     # 2-9 天后随访 MRI
│           ├── *_dwi.nii.gz
│           └── *_adc.nii.gz
├── derivatives/
│   └── sub-stroke0001/
│       ├── ses-01/
│       │   ├── *_space-ncct_cta.nii.gz
│       │   ├── *_space-ncct_ctp.nii.gz
│       │   ├── *_space-ncct_lvo-msk.nii.gz    # 大血管闭塞掩膜(二值)
│       │   ├── *_space-ncct_cow-msk.nii.gz    # Willis 环解剖(多类)
│       │   └── perfusion-maps/                # 配准后的 cbf/cbv/mtt/tmax
│       └── ses-02/
│           ├── *_space-ncct_dwi.nii.gz
│           ├── *_space-ncct_adc.nii.gz
│           └── *_space-ncct_lesion-msk.nii.gz # 最终梗死灶(金标准)
└── phenotype/
    └── sub-stroke0001/
        ├── ses-01/*_demographic_baseline.csv  # 基线人口学
        └── ses-02/*_outcome.csv               # 90 天结局

关键结构约定:ISLES 2024 中,每例受试者的原始 NCCT 与 derivatives 下所有标记 space-ncct 的体数据(CTA、灌注图、DWI/ADC、全部掩膜)共享同一体素网格(形状、间距、仿射矩阵完全一致)。因此 NCCT 本身就是参考空间,不存在 space-ncct_ncct 这样的文件。一个完全对齐的"输入+标签堆叠"等于原始 NCCT 加上 derivatives 中的 space-ncct 模态与 space-ncct_lesion-msk。

§4.1 DAIMS 字段字典

以下以 ISLES 2022 与 ISLES 2024 合并视角给出核心字段字典。影像体素数据本身不是表格字段,而是以文件对象形式承载;下表描述的是"每例一条记录"的逻辑表结构,用于构建索引、划分与评估。

字段名 类型 说明 示例值 AI 用途 观测误差 缺失编码 取值范围
case_id string 病例唯一标识 sub-stroke0001 划分、去重、追溯的键 无 不适用(必填) 届次内唯一
edition categorical 所属届次 ISLES2022 跨届筛选与泄漏规避 无 不适用 2015/2016/2017/2018/2022/2024
session categorical 纵向会话(2024) ses-01 区分急性期与随访 无 2015-2022 无此维度 ses-01/ses-02
dwi_path file DWI 体数据路径 …/sub-stroke0001_ses-0001_dwi.nii.gz 主输入通道 边缘信号渐变导致边界模糊 该届无 DWI 则整行省略 3D 体数据
adc_path file ADC 体数据路径 …/adc.nii.gz 第二输入通道 依赖 DWI 与 T2 校正 同上 3D 体数据
flair_path file FLAIR 体数据路径 …/flair.nii.gz 边界辅助通道 与 DWI 参考空间轻微错位 同上 3D 体数据
ncct_path file CT 平扫路径(2024) …/ncct.nii.gz 参考空间基准 早期缺血改变对比度低 非 2024 届省略 3D 体数据
ctp_path file CT 灌注 4D 路径 …/ctp.nii.gz 灌注特征提取 4D 时间重采样引入误差 非 2018/2024 届省略 4D 体数据(55 时间点)
lesion_msk_path file 真值掩膜路径 …/lesion-msk.nii.gz 监督标签 边界过保守导致体积低估 测试集不提供 二值
lesion_volume_ml float 病灶体积(毫升) 42.7 回归目标、分层分析 随边界判断波动,阅片者间体积差可达 13 ml 量级 可由掩膜计算 0 至约 482
n_lesions integer 不相连病灶个数 7 病灶级 F1 的分母 小病灶易被漏标 可由连通域计算 0 至约 126
lvo_msk_path file 大血管闭塞掩膜(2024) …/lvo-msk.nii.gz 多任务辅助标签 CTA 上人工勾画,受血管走行影响 非 2024 届省略 二值
cow_msk_path file Willis 环解剖掩膜(2024) …/cow-msk.nii.gz 多类解剖分割 多类标注的类别不平衡 非 2024 届省略 多类标签
nihss_baseline integer 基线 NIHSS 评分 12 临床融合特征 评分者间差异 空值 0-42
mrs_90d ordinal 90 天改良 Rankin 量表 3 预后预测标签 序数标签的阈值敏感性 空值 0-6
center categorical 来源中心 Munich 中心级泛化分析 训练集不含全部中心 官方未逐例披露 Munich/Bern/Hamburg/Zurich

说明:center 字段在 ISLES 2022 训练集中并未逐例公开披露,官方仅在数据论文层面说明训练集来自慕尼黑与伯尔尼、测试集额外含汉堡。因此做中心级分析时,实际可行的做法是使用官方提供的测试集中心划分逻辑,或在训练集内部用可获得的元数据近似分组。

§4.2 标签分布

ISLES 的标签是体素级二值掩膜,其"分布"的描述维度不是类别频次,而是病灶形态与体积统计。

统计维度 ISLES 2022 观测 临床含义
病灶体积范围 0 至约 482 ml 从阴性病例到占据大部分半球的巨大梗死
单患者不相连病灶数 0 至约 126 栓塞性多发点状梗死是主要难点来源
阴性病例 少量(疑似卒中但未见病灶) 训练模型避免"凭空捏造病灶"
血管供血区分布 以大脑中动脉供血区与幕下血管为主 训练集与测试集分布经刻意对齐
幕下病例占比 训练集比测试集约多 10% 分布差异可能影响评估公平性
大脑中动脉区占比 测试集比训练集约多 10% 同上

标签的极端不平衡是最重要的分布特征:多数体素为背景,病灶体素占比通常在千分之几量级。这直接导致两类经典失败:模型全部预测为背景即可获得极高的体素准确率,因此准确率不是可用指标;以及小病灶在 Dice 中被大病灶"淹没"。

§4.3 关键统计

指标 数值 来源
六届累计影像检查数 逾 900 例(含跨届重叠) 各届官方数据汇总
单届最大规模 400 例(ISLES 2022) 官方数据论文
最大公开训练集 250 例(ISLES 2022) 官方数据论文
ISLES 2022 相对 2015 规模倍数 超过 6 倍(400 vs 64) 官方数据论文
阅片者间 Dice(2022,10 例) 0.83(标准差 0.12) 官方数据论文
官方默认指标数 2022/2024 均为 4 个 官方仓库与论文
参与机构洲别 以欧洲为主,参赛团队涵盖欧、美、亚 官方组织者与参赛名单
测试集真值公开状态 历届均不公开 历届官方说明

§4.4 数据层级关系

届次(edition:2015 / 2016 / 2017 / 2018 / 2022 / 2024)
  └─ 病例(case_id:一例患者的一次影像检查)
      └─ 会话(session:仅 ISLES 2024 有 ses-01 急性期 / ses-02 随访)
          └─ 模态(modality:dwi / adc / flair / ncct / cta / ctp / 灌注图)
              └─ 三维体数据(volume:形状 × 体素间距 × 仿射矩阵)
                  └─ 切片(slice:2D 训练与可视化单元)
                      └─ 体素(voxel:分割与损失计算的最小单位)

跨届还有一层隐含关系:ISLES 2016 的病例集合是 ISLES 2017 的严格子集,ISLES 2024 的真值生成依赖 ISLES 2022 训练的模型。这两条关系不在任何文件里以字段形式表达,必须由使用者主动纳入划分决策。

§4.5 缺失值与信息性缺失编码

ISLES 的影像数据本身不存在传统意义上的"缺失值"(每个模态要么存在要么整例不存在),但存在若干具有信息量的缺失模式,必须区别对待。

缺失模式 表现 是否信息性 处理建议
FLAIR 缺失或错位 ISLES 2022 中 FLAIR 与 DWI 参考空间轻微错位、分辨率更高 是(反映采集协议差异) 不要直接叠三通道;先刚性配准或将该通道排除
测试集掩膜缺失 全部届次的测试集均无 lesion-msk 是(设计使然,防止调参) 不得用测试集做任何模型选择
临床字段缺失 ISLES 2024 的 phenotype CSV 中部分字段为空 是(真实世界登记数据特征) 用显式掩膜标记缺失,勿用零填充当作真实值
阴性病例(体积为 0) 少量病例无病灶 是(真实临床情形) 保留于训练集,勿当作标注错误删除
中心标签缺失 ISLES 2022 未逐例披露 center 否(披露策略限制) 中心级分析需另寻元数据或使用官方划分逻辑
无 CTP/NCCT 非 2018/2024 届次 否(届次设计差异) 跨届统一建模时按届次分支处理

实务建议:把"缺失"与"零"严格区分。ISLES 2024 的阴性病例体积为 0 是真实观测;而临床字段的空值是缺失,二者在损失函数与评估中应有不同处理——例如对缺失的 mRS 不给损失,对体积为 0 的阴性病例正常给分割损失。


§5 数据划分与使用建议

§5.1 官方划分

ISLES 历届均采用"公开训练集 + 隐藏测试集"的二元划分,测试集真值由组织方保管,参赛者只能通过提交预测获得成绩。各届规模已在 §3.2 给出。划分策略上的关键设计出现在 ISLES 2022:训练集来自慕尼黑与伯尔尼两个中心,测试集则来自三个中心(含训练期未见的汉堡),并且包含再灌注治疗前采集的超急性病例。官方说明此举的目的是同时评估三个递进的泛化维度——已见中心的新扫描、未见中心的新扫描、以及同一已见中心但在不同治疗时相采集的扫描。此外,官方刻意让训练集与测试集在病灶形态谱上保持相似(均覆盖从巨大皮层梗死到点状缺血),并在血管供血区分布上尽量对齐(幕下与大脑中动脉区各约 10% 的差异)。

ISLES 2024 的划分更为直接:149 例公开训练、96 例隐藏测试,全部来自慕尼黑与苏黎世两个中心,评估通过提交 Docker 容器在隐藏测试集上运行完成。

§5.2 社区惯例划分

由于官方只公开训练集,社区事实上的标准做法是在公开训练集内部做交叉验证,并以官方测试榜单作为最终报告。ISLES 2022 上的常见配置包括:

划分方式 折数 典型用途
5 折交叉验证 5 单模型开发与消融实验;NVAUTO 等方案采用
3 次 5 折独立重复 15 个模型 集成的基座,降低划分偶然性
训练/验证 8:2 单次划分 1 快速原型与超参初筛
留出中心交叉验证 视中心数 模拟跨中心泛化(需中心标签支持)

一个必须强调的实践:社区在报告结果时常混用"交叉验证 Dice"与"官方隐藏测试集 Dice",两者数值不可直接互换。ISLES 2022 的官方榜单使用的是隐藏测试集成绩。

§5.3 泄漏风险

ISLES 系列存在三类真实的泄漏风险,逐条给出规避方法。

第一类:跨届病例复用。 ISLES 2016 是 ISLES 2017 的严格超集——2017 的训练队列由 2016 的 35 例扩至 43 例,公开发布的 30 例 2016 数据在 2017 集合中携带完全相同的训练编号与相同的撤回 ID 集合 {3, 17, 25, 29, 34}。因此绝不能把 ISLES 2016 与 ISLES 2017 当作两个独立测试集。规避方法:按 training_ 编号做集合交运算,取差集后才可用于独立评估。

第二类:真值与模型的循环依赖。 ISLES 2024 的参考标准由 DeepISLES 预分割后经专家修正产生,而 DeepISLES 由 ISLES 2022 的前十名方法集成而来。这意味着在 ISLES 2024 上评估一个在 ISLES 2022 上训练、且架构与 DeepISLES 成员相近的模型时,会高估其真实泛化能力——因为真值本身带有该模型家族的"偏好"。规避方法:报告结果时明确说明这一依赖;如需无偏评估,应使用完全独立的第三方队列。

第三类:中心级重叠。 慕尼黑同时参与 ISLES 2022 与 ISLES 2024。虽然官方明确说明两届之间无共享影像、无患者复用(模态与患者均不同:2022 为纯 MRI DWI 队列,2024 为急性卒中 CT 队列),但中心级的采集协议相似性仍可能带来分布接近。规避方法:跨届实验时不要把"跨数据集验证"直接等同于"跨机构验证"。

§5.4 划分策略建议

使用场景 建议策略 理由
方法论文(追求与榜单可比) 用全部 250 例训练,仅以官方隐藏测试集报告 与榜单数字同源可比
模型选择与消融 训练集内 5 折交叉验证,固定随机种子并公开折划分文件 可复现,避免折划分差异造成的虚假提升
泛化性研究 按中心或按治疗方案分层留出(需元数据支持) 模拟官方测试集的三个泛化维度
小数据场景(2015/2016) 留一法或重复 10 折 样本量小,单次划分方差过大
纵向建模(2024) 按患者划分而非按会话划分 同一患者两个会话必须同侧,否则泄漏

最后一条最容易被忽视:ISLES 2024 的每例患者有 ses-01 与 ses-02 两个会话。若按会话随机划分,同一患者的急性期影像可能进训练集而随访影像进验证集,导致验证指标虚高。必须按 case_id 做分组划分。

§5.5 交叉验证建议

对 ISLES 2022 这样规模的数据集,推荐的做法是至少 5 折交叉验证,并在报告中给出各折的均值与标准差而非单一数值。原因在于病灶体积分布极度长尾:少数巨大梗死病例对 Dice 均值的贡献远超其数量占比,单次划分下某个折恰好包含或不包含这些病例,会使折间 Dice 波动达到可观量级。若计算资源允许,做 3 次独立的 5 折(共 15 个模型)并集成,既能降低划分偶然性,也是榜单前列方案(如 NVAUTO)采用的策略。评估时应同时报告体素级 Dice 与病灶级 F1,因为两者对"小病灶漏检"这一主要失败模式的敏感度截然不同。

§5.6 外部验证建议

ISLES 自身的外部验证资源有限,建议按以下优先顺序寻找独立队列:本系列内部的其他届次(注意 2016/2017 超集问题);DeepISLES 论文使用过的 1685 例外部队列(该文提供了可复现的评估协议);以及公开的其他卒中影像队列。评估时须统一预处理与指标实现——跨队列比较中最常见的技术性偏差来自重采样分辨率、剥颅骨方法与连通域定义的不一致,而非模型本身。若在 ISLES 2022 上训练后用 ISLES 2024 验证,务必在论文中声明真值生成依赖(见 §5.3)。


§6 AI 就绪指南

§6.0 云端快速启动

ISLES 2022 训练集约 6 GB,可以在免费层级的云端环境(如 16 GB 内存、单块 16 GB 显存 GPU 的交互式笔记本)中完成完整的数据加载、小规模训练与指标验证。ISLES 2024 约 99 GB,建议使用带大容量持久磁盘的环境,并优先只解压所需的病例子集。官方为 ISLES 2022 与 ISLES 2024 各提供了一个 Jupyter 入门笔记本(前者在 isles22 仓库,后者在 isles24 仓库),内容涵盖读图、可视化与用官方指标评估一个简单分割方法。建议的第一步就是跑通这两个笔记本,而不是直接写自己的训练脚本。

§6.1 快速上手

以下脚本假定目录结构如下:data_root 指向解压后的 ISLES 2022 根目录,每例影像位于 data_root/der_dwi/ 下的平铺命名空间(形如 sub-stroke0001_ses-0001_dwi.nii.gz),真值掩膜位于同一空间并以 _msk.nii.gz 结尾。最小可用子集为任意 5 例,足以验证读取与指标计算链路。

# 依赖:pip install nibabel numpy
# 目录预期:
#   data_root/der_dwi/sub-stroke0001_ses-0001_dwi.nii.gz
#   data_root/der_dwi/sub-stroke0001_ses-0001_adc.nii.gz
#   data_root/der_dwi/sub-stroke0001_ses-0001_flair.nii.gz
#   data_root/der_dwi/sub-stroke0001_ses-0001_msk.nii.gz
# 若使用 raw_data/ 结构,请自行改为 glob 递归匹配,逻辑完全相同。
import glob
import os
import nibabel as nib
import numpy as np
data_root = "/path/to/ISLES-2022"
# 收集全部真值掩膜,掩膜路径反推模态路径(约定式命名,无需解析 JSON)
msk_files = sorted(glob.glob(os.path.join(data_root, "der_dwi", "*_msk.nii.gz")))
print(f"找到 {len(msk_files)} 例")
case_msk = msk_files[0]
dwi_path = case_msk.replace("_msk.nii.gz", "_dwi.nii.gz")
adc_path = case_msk.replace("_msk.nii.gz", "_adc.nii.gz")
# 读取:DWI 与 ADC 与掩膜共享体素网格,可直接堆叠
dwi_img = nib.load(dwi_path)
dwi = dwi_img.get_fdata(dtype=np.float32)
adc = nib.load(adc_path).get_fdata(dtype=np.float32)
msk = nib.load(case_msk).get_fdata(dtype=np.float32)
print("DWI 形状:", dwi.shape, "间距:", dwi_img.header.get_zooms())
print("掩膜唯一值:", np.unique(msk), "病灶体素数:", int(msk.sum()))
print("病灶体积(ml):", msk.sum() * np.prod(dwi_img.header.get_zooms()) / 1000.0)

预期输出形如:DWI 形状 (197, 233, 189) 间距 (1.0, 1.0, 1.0)、掩膜唯一值 [0. 1.]、病灶体积约 42.7 ml。若掩膜唯一值出现除 0 与 1 之外的值,说明读取的不是二值掩膜或存在插值导致的中间值,应先二值化再计算指标。

§6.2 数据获取

届次 获取方式 链接 大小 流程
ISLES 2015-2018 Zenodo 直接下载 https://doi.org/10.5281/zenodo.17736412 官方未披露 无需申请,CC BY 4.0
ISLES 2022 训练集 Zenodo 直接下载 https://doi.org/10.5281/zenodo.7153326 约 6 GB 无需申请,CC BY 4.0
ISLES 2022 测试集 不公开 https://isles22.grand-challenge.org/ — 仅通过 Docker 提交参与评测
ISLES 2024 训练集 注册挑战后获取 / Zenodo 记录 https://doi.org/10.5281/zenodo.17652035 约 99 GB 注册 + 遵守数据使用政策,CC BY-NC-SA 4.0
ISLES 2024 测试集 不公开 https://github.com/ezequieldlrosa/isles24 — 仅通过 Docker 容器提交
概率病灶图谱(2022) Zenodo https://doi.org/10.5281/zenodo.7335305 官方未披露 直接下载
社区镜像(2024) HuggingFace https://huggingface.co/datasets/hugging-science/isles24-stroke 约 99 GB 遵守原始许可
# 以 ISLES 2022 训练集为例(Zenodo 记录页提供逐文件下载)
# 1) 从 https://doi.org/10.5281/zenodo.7153326 获取最新版本的文件列表
# 2) 下载后校验并解压
mkdir -p /data/isles22 && cd /data/isles22
# 将下载的压缩包放入当前目录后:
tar -xzvf ISLES-2022.tar.gz
# 3) 快速核对病例数(掩膜数应等于 250)
find . -name "*_msk.nii.gz" | wc -l

获取流程上的三个实务提醒。第一,ISLES 2015-2018 的原始托管平台 SMIR(smir.ch)已经停止服务,旧的下载链接会失效,请一律使用 Zenodo 重发布记录。第二,Zenodo 重发布是分版本的,同一数据集可能存在多个 DOI(如 17736412 与 17736411),引用时请指向你实际下载的那一版。第三,ISLES 2024 的 HuggingFace 镜像统计显示其月下载量约 1,890 次(截至 2025-11,镜像 v7),说明社区使用活跃,但镜像不改变原始许可,商业使用仍被禁止。

§6.3 预处理全流程

ISLES 2022 的官方后处理已经完成了一部分工作(剥颅骨、FLAIR 到 DWI 的刚性配准),因此社区预处理的主要任务是空间对齐、强度标准化与裁剪。流程如下。

import glob
import os
import nibabel as nib
import numpy as np
def load_case(msk_path):
    """读入一例的输入与标签,返回 numpy 数组与体素间距。"""
    dwi_path = msk_path.replace("_msk.nii.gz", "_dwi.nii.gz")
    adc_path = msk_path.replace("_msk.nii.gz", "_adc.nii.gz")
    flair_path = msk_path.replace("_msk.nii.gz", "_flair.nii.gz")
    dwi_img = nib.load(dwi_path)
    dwi = dwi_img.get_fdata(dtype=np.float32)
    adc = nib.load(adc_path).get_fdata(dtype=np.float32)
    msk = nib.load(msk_path).get_fdata(dtype=np.float32) > 0.5  # 严格二值化
    return dwi, adc, flair_path, msk, dwi_img.header.get_zooms()[:3]
def zscore_nonzero(volume):
    """仅在脑组织体素上做 z-score,避免大量背景体素拉偏统计量。"""
    mask = volume > 0
    if mask.sum() == 0:
        return volume
    out = np.zeros_like(volume, dtype=np.float32)
    out[mask] = (volume[mask] - volume[mask].mean()) / (volume[mask].std() + 1e-8)
    return out
def crop_to_brain(dwi, adc, msk, margin=8):
    """按非零前景裁剪,减小显存占用;各通道与标签必须使用同一包围盒。"""
    fg = dwi > 0
    if fg.sum() == 0:
        return dwi, adc, msk
    idx = np.argwhere(fg)
    lo = np.maximum(idx.min(0) - margin, 0)
    hi = np.minimum(idx.max(0) + margin + 1, dwi.shape)
    sl = tuple(slice(int(a), int(b)) for a, b in zip(lo, hi))
    return dwi[sl], adc[sl], msk[sl]

FLAIR 的处理需要单独说明:官方已做刚性配准,但配准后的 FLAIR 仍与 DWI/ADC 参考空间存在轻微偏移,且分辨率更高。若要把 FLAIR 作为第三通道,必须先重采样到 DWI 的网格并按仿射矩阵对齐(例如使用 SimpleITK 或 nibabel 的 resample_from_to),或者干脆采用榜单最高 Dice 方案的做法——只用 DWI 与 ADC。不要在不检查对齐的情况下直接把三个数组堆叠,那会引入系统性偏移。

§6.4 PyTorch DataLoader

import glob
import os
import nibabel as nib
import numpy as np
import torch
from torch.utils.data import DataLoader, Dataset
class ISLES2022Dataset(Dataset):
    """ISLES 2022 二值梗死分割数据集。
    目录预期:data_root/der_dwi/ 下平铺 *_msk.nii.gz 及其同名前缀的
    _dwi.nii.gz / _adc.nii.gz。传入 cases 列表可显式控制划分,
    便于复现交叉验证折。
    """
    def __init__(self, data_root, cases=None, patch_size=(128, 128, 96), train=True):
        self.data_root = data_root
        all_cases = sorted(glob.glob(os.path.join(data_root, "der_dwi", "*_msk.nii.gz")))
        self.cases = all_cases if cases is None else cases
        self.patch_size = patch_size
        self.train = train
    def __len__(self):
        return len(self.cases)
    def _normalize(self, volume):
        mask = volume > 0
        if mask.sum() == 0:
            return volume.astype(np.float32)
        out = np.zeros_like(volume, dtype=np.float32)
        out[mask] = (volume[mask] - volume[mask].mean()) / (volume[mask].std() + 1e-8)
        return out
    def _random_crop(self, dwi, adc, msk):
        """训练时以病灶为中心随机采样,缓解极端前景-背景不平衡。"""
        target = self.patch_size
        pad = [max(0, t - s) for t, s in zip(target, dwi.shape)]
        if any(p > 0 for p in pad):
            dwi = np.pad(dwi, [(0, p) for p in pad])
            adc = np.pad(adc, [(0, p) for p in pad])
            msk = np.pad(msk, [(0, p) for p in pad])
        idx = np.argwhere(msk > 0)
        if len(idx) > 0 and self.train:
            center = idx[np.random.randint(len(idx))]
        else:
            center = np.array(dwi.shape) // 2
        start = [int(np.clip(c - t // 2, 0, max(0, s - t)))
                 for c, t, s in zip(center, target, dwi.shape)]
        sl = tuple(slice(s, s + t) for s, t in zip(start, target))
        return dwi[sl], adc[sl], msk[sl]
    def __getitem__(self, index):
        msk_path = self.cases[index]
        dwi_path = msk_path.replace("_msk.nii.gz", "_dwi.nii.gz")
        adc_path = msk_path.replace("_msk.nii.gz", "_adc.nii.gz")
        dwi = self._normalize(nib.load(dwi_path).get_fdata(dtype=np.float32))
        adc = self._normalize(nib.load(adc_path).get_fdata(dtype=np.float32))
        msk = (nib.load(msk_path).get_fdata(dtype=np.float32) > 0.5).astype(np.float32)
        dwi, adc, msk = self._random_crop(dwi, adc, msk)
        # 加通道维:[2, D, H, W],2 个输入通道(DWI + ADC)
        image = np.stack([dwi, adc], axis=0)
        label = msk[None, ...]
        return torch.from_numpy(image.copy()), torch.from_numpy(label.copy())
def build_loaders(data_root, seed=0, val_ratio=0.2, batch_size=2):
    """按固定种子做训练/验证划分,保证折划分可复现。"""
    cases = sorted(glob.glob(os.path.join(data_root, "der_dwi", "*_msk.nii.gz")))
    rng = np.random.RandomState(seed)
    perm = rng.permutation(len(cases))
    n_val = max(1, int(len(cases) * val_ratio))
    val_cases = [cases[i] for i in perm[:n_val]]
    tr_cases = [cases[i] for i in perm[n_val:]]
    tr_ds = ISLES2022Dataset(data_root, tr_cases, train=True)
    va_ds = ISLES2022Dataset(data_root, val_cases, train=False)
    return (DataLoader(tr_ds, batch_size=batch_size, shuffle=True, num_workers=4),
            DataLoader(va_ds, batch_size=1, shuffle=False, num_workers=2))
if __name__ == "__main__":
    train_loader, val_loader = build_loaders("/path/to/ISLES-2022")
    images, labels = next(iter(train_loader))
    print("批形状:", tuple(images.shape), "标签形状:", tuple(labels.shape))
    print("前景体素占比:", float(labels.mean()))

关键设计说明:以病灶为中心随机采样(而非全图滑窗)是把训练信号集中在前景的常用手段,能把前景占比从千分之几提升到可训练的量级;两个输入通道各自独立做非零 z-score 而不是共享统计量,因为 DWI 与 ADC 的强度尺度完全不同;划分按固定种子生成并显式传入 Dataset,使交叉验证折可被完整复现。

§6.5 坑点 8 个

⚠️ 坑点 1:ISLES 2022 的 FLAIR 与 DWI 参考空间不对齐(分类:预处理陷阱)

问题:官方发布的 FLAIR 分辨率高于 DWI/ADC,且与 DWI 参考空间存在轻微错位。若直接把三个序列堆叠为三通道输入,模型会学到由错位产生的伪相关特征,而非病灶本身的影像特征,导致验证集 Dice 虚高、外部测试骤降。
症状:训练损失正常下降,交叉验证 Dice 看起来不差,但在官方隐藏测试集上明显偏低;可视化预测结果时发现病灶预测沿某方向系统性偏移;把 FLAIR 通道单独置零后性能几乎不变(说明模型没有真正在使用它)。
解决:

  1. 简单方法:只用 DWI + ADC 两个通道,完全弃用 FLAIR。ISLES 2022 官方榜单 Dice 最高的 NVAUTO 队伍正是这么做的,理由是 FLAIR 存在配准误差与分辨率不匹配。
  2. 进阶方法:先把 FLAIR 重采样到 DWI 网格并对齐仿射矩阵,再检查三者是否共享同一 header(形状、间距、affine 一致),确认后才三通道输入。可用 nibabel 的 resample_from_to 或 SimpleITK 完成,重采样后务必用重叠可视化做质量抽检。
  3. SOTA 方法:把模态对齐本身建模为可评估的环节——在验证集上做逐通道消融实验,用差异图定位错位区域,仅在配准质量达标的子集上启用 FLAIR;同时在论文中报告使用与不使用 FLAIR 的两组结果。
    参考:Siddiquee et al., 2022, arXiv:2209.09546(NVAUTO 方案明确弃用 FLAIR);官方数据论文的 FLAIR 分辨率与配准说明。

⚠️ 坑点 2:把 ISLES 2016 与 ISLES 2017 当作两个独立数据集(分类:数据泄漏)

问题:ISLES 2017 是 ISLES 2016 的严格超集。2017 的训练队列由 2016 的 35 例增至 43 例,而公开发布的 2016 数据(30 例子集)在 2017 集合中携带完全相同的训练编号与相同的撤回 ID 集合。用一个集合训练、另一个集合测试,等于把训练样本当测试样本,指标完全不具参考价值。
症状:跨届评估出现异常高的 Dice(明显高于任一届论文报告的水平);模型在"外部验证"上几乎不损失性能,与常识相悖;检查病例编号时发现两侧 ID 大量重合。
解决:

  1. 简单方法:任何实验前先做集合交运算,按 training_ 编号匹配两届病例,从评估集中剔除交集,只在差集(2017 独有的 13 例)上报告。
  2. 进阶方法:建立一张跨届病例指纹表(病例编号 + 体积 + 形状哈希),在实验流水线中作为自动断言,一旦检测到训练/测试指纹重叠即报错中断。
  3. SOTA 方法:把系列视为一个整体的病例池,先全局去重再按官方届次标记做分层划分,并在论文中给出明确的去重方法与去重前后病例数对照表。
    参考:HuggingFace 数据集卡(isles2016)跨数据集重叠说明;Winzeck et al., 2018, Frontiers in Neurology 9:679。

⚠️ 坑点 3:用体素准确率或纯体素 Dice 评估,掩盖小病灶漏检(分类:评估误用)

问题:卒中病灶体素占比极低(单患者不相连病灶数可达 126 个,其中大量是点状栓塞灶)。只报告体素级 Dice 会让"完全漏掉所有小病灶、但把大病灶勾得不错"的模型拿到高分,而这恰恰是临床上最危险的失败模式——多发点状梗死是判断栓塞性病因的关键证据。
症状:体素 Dice 达到 0.8 以上,但可视化时模型对小病灶完全无输出;病灶计数差远大于 1;病灶级 F1 明显低于 Dice(例如 Dice 0.82 而 F1 只有 0.57)。
解决:

  1. 简单方法:同时报告病灶级 F1 与病灶计数差。这两个指标正是 ISLES 2022 官方四指标中的两个,专门用于捕捉小病灶漏检。
  2. 进阶方法:改用病灶级损失(如基于连通域的 Tversky 或 focal 变体),或在采样时对小病灶加权,使每个病灶无论大小都获得相近的训练信号。
  3. SOTA 方法:采用级联/两阶段结构——第一阶段做粗定位以保证召回,第二阶段做精细化分割;或引入检测头显式预测病灶中心,再在局部细化,从结构上避免小病灶被平均掉。
    参考:ISLES 2022 官方评测协议(isles22 仓库与 leaderboard);Hernandez Petzsche et al., 2022, Scientific Data 9:762(指标选择理由)。

⚠️ 坑点 4:把官方已剥颅骨的影像再次剥颅骨(分类:预处理陷阱)

问题:ISLES 2022 官方明确说明已在去标识化阶段用 HD-BET 完成脑提取,DWI 与 ADC 均经剥颅骨处理。若沿用其他数据集的惯性再跑一次剥颅骨工具,或在归一化时以"全图非零"为前景判据,会把脑组织边界误削或把统计量算偏。
症状:预处理后脑边缘出现不自然的削切平面;强度归一化后图像整体偏亮或偏暗;与未做二次处理的基线相比,Dice 反而下降几个百分点。
解决:

  1. 简单方法:跳过剥颅骨步骤,直接用官方给的体数据。归一化时以前景(非零)体素计算均值与标准差,而不是全图。
  2. 进阶方法:在流水线中加一个"是否为剥颅骨数据"的断言检查(例如统计零体素占比,剥颅骨后通常远超一半),避免误对已处理数据重复处理。
  3. SOTA 方法:把预处理步骤作为超参数纳入交叉验证(剥与不剥两分支),用数据说话,并在论文中报告该消融结果。
    参考:Hernandez Petzsche et al., 2022, Scientific Data 9:762(Post-annotation data pre-processing 一节,HD-BET 与剥颅骨说明)。

⚠️ 坑点 5:忽略真值本身的体积低估偏倚(分类:偏倚陷阱)

问题:ISLES 2022 的官方数据论文披露,专家在审查既往标注时发现"梗死边界常被勾画得过于保守,导致梗死体积被低估",且小点状栓塞灶"几乎总是被标注不足"。如果不了解这一点,你可能会把模型的系统性能偏差误判为模型缺陷,而去"修正"一个其实正确的行为。
症状:模型预测的体积系统性大于真值(Dice 尚可但体积差长期为正);人工检查时发现模型的边界比官方掩膜更贴合 FLAIR 上的水肿范围;换一个阅片者重新勾画同一批病例后,模型与人工的一致性反而更高。
解决:

  1. 简单方法:报告体积差指标而非只看 Dice,并在论文局限性中明确引用官方披露的标注偏倚。
  2. 进阶方法:利用官方多阅片者实验数据(10 例重勾画,阅片者间 Dice 仅 0.83)量化"标注噪声上限",据此判断模型性能提升是否已进入噪声区。
  3. SOTA 方法:使用官方发布的三维概率病灶图谱(Zenodo 7335305)作为先验,或采用多阅片者标签建模(对冲突体素不强行二值化),把标注不确定性显式纳入训练目标。
    参考:Hernandez Petzsche et al., 2022, Scientific Data 9:762(inter-rater analysis 与 Table 3);官方概率病灶图谱 DOI 10.5281/zenodo.7335305。

⚠️ 坑点 6:在 ISLES 2024 上按会话随机划分,造成同患者泄漏(分类:数据泄漏)

问题:ISLES 2024 每例患者有两个会话(ses-01 急性 CT、ses-02 随访 MRI)。若按会话随机划分训练/验证集,同一患者的急性期影像可能进训练而随访影像进验证,两个会话共享同一大脑解剖与同一病灶演化,验证指标会显著虚高。
症状:验证指标异常高且早期就收敛;把验证集换成真正未见过的患者时性能断崖式下降;检查划分文件时发现同一 case_id 出现在两侧。
解决:

  1. 简单方法:按 case_id 做分组划分(GroupShuffleSplit 或按患者 ID 取模),确保同一患者的全部会话落在同一侧。
  2. 进阶方法:在流水线中加入断言,校验训练与验证的 case_id 集合交集为空,并把该断言纳入持续集成流程。
  3. SOTA 方法:把纵向结构本身作为建模对象——用 ses-01 预测 ses-02 的最终梗死,在患者层面做交叉验证,并在论文中明确报告"按患者划分"的划分协议。
    参考:ISLES’24 官方 GitHub 仓库(BIDS 结构与 phenotype 组织说明);Riedel et al., 2024, arXiv:2408.11142。

⚠️ 坑点 7:测试集真值不可得,却试图用测试集做模型选择(分类:评估误用)

问题:ISLES 历届测试集真值均不公开(2015 届论文即明确说明测试集真值由组织方保管并对参赛者隐藏,以避免在测试集上调参)。社区常见的误用是把少量提交配额反复用于挑选模型,实际上把测试集变成了验证集,导致报告成绩乐观偏倚;另一种误用是误以为存在可下载的测试集标签。
症状:论文中声称"在 ISLES 2022 测试集上做模型选择";多次提交以观察榜单变化来调超参;试图在 HuggingFace 等镜像中寻找测试集掩膜而不得。
解决:

  1. 简单方法:所有模型选择与超参搜索严格在公开训练集的交叉验证内完成,测试集只提交一次作为最终报告。
  2. 进阶方法:建立内部评估的完整记录(折划分、种子、指标分布),用交叉验证的均值与标准差判断改进是否显著,而不是用测试集榜单的位次变化判断。
  3. SOTA 方法:遵循挑战赛事的提交次数限制与报告规范,在论文中披露全部提交次数与每次提交的目的,使读者能评估选择偏倚的程度。
    参考:Maier et al., 2017, Medical Image Analysis 35:250-269(离站评测设计理由);ISLES 2022 官方榜单页面。

⚠️ 坑点 8:把跨届 Dice 数字直接横向对比(分类:评估误用)

问题:六届的模态、任务定义、真值空间、指标集合与排名规则都不同:2015 SISS 用 Dice + ASSD,2016/2017 是结局预测,2018 的输入与真值跨模态,2022/2024 用四指标平均排名且 2024 的真值由算法预生成。把不同届的 Dice 写进同一张对比表当作"进步"证据,是方法学上不成立的。
症状:表格中把 2015 年的某个 Dice 与 2022 年的 0.824 并列;用"某某年做到 0.9 而某年只有 0.7"论证技术进步;引用综述中非官方的 IDC 指标(如 2016 年 3.37、2017 年 4.53)当作 Dice。
解决:

  1. 简单方法:跨届对比表中明确标注每行的指标名、取值口径(体素级/病灶级)、数据划分与是否为官方榜单成绩;不合并不同指标的行。
  2. 进阶方法:只做同届同指标的比较;若必须跨届叙述,改用定性表述(如"任务焦点从分割转向结局预测")而非数值排序。
  3. SOTA 方法:参照挑战方法学文献中关于"排行榜应谨慎解读"的建议,报告指标的同时给出置信区间或折间波动,明确哪些差异在统计上不显著。
    参考:Maier-Hein et al., 2018, Nature Communications 9:5217(为何生物医学挑战排名需谨慎解读);各届官方指标定义。

§6.6 数据增强

增强手段 安全性 说明
随机翻转(左右) ⚠️ 慎用 病灶空间分布有血管供血区规律,左右翻转会破坏与临床不对称性相关的线索;若使用,须验证不损害性能
随机仿射(小角度旋转、缩放、平移) ✅ 安全 幅度控制在 ±10 度、±10% 以内,模拟摆位差异
强度缩放与偏移 ✅ 安全 模拟扫描仪差异;幅度不宜过大,避免破坏 DWI/ADC 的对比度语义
高斯噪声 ✅ 安全 小幅添加(σ 约为归一化后强度的 0.05)可提升稳健性
Gamma 校正 ⚠️ 慎用 DWI 与 ADC 的强度具有物理含义,非线性变换可能破坏 ADC 的定量性质
随机裁剪至病灶中心 ✅ 安全 应对极端前景-背景不平衡的标准手段(见 §6.4)
弹性形变 ⚠️ 慎用 过强的形变会改变病灶形状的临床语义,尤其影响小病灶定位
MixUp / CutMix ❌ 危险 两例脑影像混合会产生解剖上不可能的结构,对边界敏感的分割任务是误导
生成式合成病灶 ❌ 危险 合成病灶的纹理与真实 DWI 信号分布不符,易导致模型学到虚假特征
测试时增强(TTA) ✅ 安全 多尺度与多翻转推理后融合,是榜单前列方案的常见组件

§6.7 模型推荐表

模型 类型 适用场景 优势 注意
3D U-Net 编码-解码 CNN 通用基线 结构简单、复现容易、社区实现多 需处理显存与输入尺寸的矛盾
SegResNet 残差编码-解码 CNN + 深监督 ISLES 2022 首选基线 官方榜单最高 Dice 方案使用;MONAI 内置 需要较大显存;深监督增加实现复杂度
nnU-Net 自动配置的 U-Net 追求开箱即用的强基线 自动处理预处理与超参;跨任务稳健 需转换为 nnU-Net 的数据格式
Swin UNETR 等注意力网络 Transformer 类分割网络 大数据、长程依赖建模 全局上下文建模能力强 数据量小时易过拟合
级联两阶段网络 检测 + 分割 小病灶漏检严重时 显式提升召回,改善病灶级 F1 流程复杂,两阶段误差会累积
集成模型(多折/多架构) 集成 追求榜单级性能 榜单前列普遍采用(如 15 模型集成) 推理成本成倍增加

选型建议:如果目标是与官方榜单可比,优先复现 SegResNet + 深监督 + 多折集成这条已被验证有效的路径(NVAUTO 用该路径取得 Dice 0.824);如果目标是快速获得一个稳健基线用于后续研究,nnU-Net 的自动配置能节省大量调参时间;如果核心痛点是点状小病灶漏检,应考虑级联或带检测头的结构,而非单纯更换编码器。

§6.8 硬件需求

任务 显存需求 存储需求 备注
数据加载与可视化 无 GPU 需求 6 GB(2022)/ 99 GB(2024) 可在常规工作站完成
3D U-Net 小批量训练(固定 128×128×96 块) 12-16 GB 同上 batch size 1-2
SegResNet 训练(192×192×128 输入) 24-32 GB 同上 榜单方案使用该输入尺寸
15 模型集成训练 24-32 GB(串行)或更高(并行) 同上 + 检查点空间 训练时长随模型数线性增长
5 折交叉验证 单折可承受即可 同上 无法并行时串行执行
ISLES 2024 全量处理 16 GB 以上 ≥300 GB(含解压与派生) 建议先按子集验证流水线

§6.9 评估指标代码

import numpy as np
from scipy import ndimage
STRUCTURE = np.ones((3, 3, 3))  # 26 邻域连通性;若用 6 邻域请改为 None 并注明
def dice(pred, target, eps=1e-8):
    """体素级 Dice 系数。pred 与 target 均为二值数组。"""
    pred = pred.astype(bool)
    target = target.astype(bool)
    inter = np.logical_and(pred, target).sum()
    return float((2.0 * inter + eps) / (pred.sum() + target.sum() + eps))
def lesion_wise_f1(pred, target, structure=STRUCTURE):
    """病灶级 F1:以连通域为单位,反映小病灶漏检与虚假病灶。"""
    pred = pred.astype(bool)
    target = target.astype(bool)
    pred_lab, n_pred = ndimage.label(pred, structure=structure)
    target_lab, n_target = ndimage.label(target, structure=structure)
    if n_pred == 0 and n_target == 0:
        return 1.0
    if n_pred == 0 or n_target == 0:
        return 0.0
    hit_pred, hit_target = set(), set()
    for p in range(1, n_pred + 1):
        overlap = target_lab[pred_lab == p]
        overlap = overlap[overlap > 0]
        if overlap.size > 0:
            hit_pred.add(p)
            hit_target.update(np.unique(overlap).tolist())
    tp = len(hit_target)
    fp = n_pred - len(hit_pred)
    fn = n_target - tp
    denom = 2 * tp + fp + fn
    return float((2 * tp) / denom) if denom > 0 else 0.0
def lesion_count_difference(pred, target, structure=STRUCTURE):
    """绝对病灶计数差:|预测病灶数 - 真值病灶数|。"""
    n_pred = ndimage.label(pred.astype(bool), structure=structure)[1]
    n_target = ndimage.label(target.astype(bool), structure=structure)[1]
    return int(abs(n_pred - n_target))
def absolute_volume_difference(pred, target, voxel_volume_ml):
    """绝对体积差(毫升)。"""
    return float(abs(pred.sum() - target.sum()) * voxel_volume_ml)
def mean_rank_over_metrics(per_case_metrics, higher_is_better):
    """复现官方排名逻辑:各指标逐例排名后取平均,全体病例再取平均。
    per_case_metrics: {指标名: [每例该指标值, ...]}
    higher_is_better: {指标名: bool},体积差与计数差为 False。
    注意:真实排名需要跨团队的同一组数值,此处给出单队列内部的相对排名实现。
    """
    names = list(per_case_metrics.keys())
    n_cases = len(next(iter(per_case_metrics.values())))
    case_ranks = []
    for c in range(n_cases):
        ranks = []
        for name in names:
            vals = np.asarray(per_case_metrics[name][c], dtype=float)
            order = np.argsort(-vals if higher_is_better[name] else vals)
            r = np.empty_like(order)
            r[order] = np.arange(1, len(vals) + 1)
            ranks.append(r[0])
        case_ranks.append(np.mean(ranks))
    return float(np.mean(case_ranks))

指标实现的三个易错点。第一,Dice 的分母在预测与真值同时为空(阴性病例)时为 0,必须用 eps 保护,并明确阴性病例应当计为 1.0(完全正确)还是从均值中剔除——官方在这一点的处理会显著影响小病灶队列的最终分数。第二,病灶级 F1 的连通域定义(6 邻域还是 26 邻域)会影响病灶计数,从而改变 F1 与计数差,报告时必须写明。第三,官方排名是"逐指标逐例排名后取平均",不是"各指标均值后再排名",两者的结果不同,复现榜单时务必按官方逻辑实现。

§6.10 MLOps 笔记

环节 建议
数据版本 记录 Zenodo DOI 与下载日期;同一数据集可能存在多个 DOI(如 17736412 与 17736411),不可混用
划分固化 把交叉验证折划分文件单独存盘并纳入版本控制,报告中引用同一文件
指标实现 直接采用官方仓库的指标脚本,或与之做数值对齐测试,避免自定义实现引入偏差
显存管理 用块采样而非整图输入;推理时用滑窗加高斯加权融合
集成策略 多折集成优于单折;若资源有限,优先增加折数而非增大单模型
提交纪律 严格限制测试集提交次数并记录每次提交的目的;把测试集当作一次性资源
复现清单 记录随机种子、框架版本、GPU 型号、输入块尺寸、损失函数形式与权重(这些变量对 ISLES 上的 Dice 波动影响常达 1-3 个百分点)
许可合规 ISLES 2024 为 CC BY-NC-SA 4.0,禁止商业使用且要求相同方式共享;ISLES 2015-2018、2022 训练集为 CC BY 4.0,可用于商业但须署名

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解方式
地理偏倚 数据来自德国与瑞士的大学附属卒中中心(慕尼黑、伯尔尼、汉堡、吕贝克、苏黎世、弗赖堡) 高 引入亚洲、美洲、社区医院队列做外部验证;报告时声明地理适用范围
选择偏倚 病例多来自能接受再灌注治疗、且影像确证卒中的患者(2018 届明确要求 8 小时时间窗) 高 注意阴性病例覆盖率低带来的假阳性风险;明确目标人群定义
标注偏倚(体积低估) 官方披露梗死边界常被勾画过保守,导致梗死体积系统性低估 高 报告体积差;参照阅片者间实验量化噪声上限;使用概率病灶图谱
标注偏倚(小病灶欠标) 点状栓塞性小梗死几乎总被标注不足,而这类病灶恰是判因关键 高 使用病灶级 F1 与计数差评估;对可疑病例回看原图确认
设备偏倚 多厂商(Philips/Siemens)、多场强(1.5T/3T)混合,阅片者对场强设盲 中 报告分场强性能;避免推理时假定固定采集协议
时间偏倚 2015-2018 届的临床实践与当代存在差距(再灌注治疗普及度不同) 中 时代敏感性研究优先用 2022/2024 届
方法学偏倚(跨届) 2024 届真值由 2022 届训练的 DeepISLES 预分割产生 中 声明依赖;不用 2024 届作为 2022 届模型的独立外部验证
语言与文化偏倚 全部文档与临床字段为英文,缺少中文语境下的量表解读 低 使用时自行核对 mRS、NIHSS 的中文临床含义

§7.2 标注质量

ISLES 的标注质量在同时代卒中影像数据集中处于较高水平,但分届差异明显。ISLES 2015/2016/2017/2018 为专家单阅片者或少数阅片者勾画,未公开发表阅片者间一致性实验,因此其真值的可重复性缺乏量化证据。ISLES 2022 采用了系列中最严格的流程:算法预分割、受训医学生编辑、神经放射科住院医师修订、高年资神经放射科医师终审的四级流水线,且后续质控环节对预分割来源设盲,以降低标注偏倚;同时公开了 10 例重勾画实验,得到阅片者间 Dice 0.83(标准差 0.12)、数据集标注与单专家 Dice 0.90 与 0.86 的结果。这组数据说明数据集标注质量高于单个专家,但也确立了一个不可忽视的上限:模型 Dice 超过约 0.85 后,进一步提升已接近标注噪声区。ISLES 2024 采用机器预分割加双专家核验的混合方式,效率高但引入了对 DeepISLES 的方法学依赖(见坑点 2 与 §5.3)。

§7.3 泛化性风险

应用场景 失效风险 证据
跨中心部署(训练中心 → 新医院) 中高 ISLES 2022 官方刻意将未见中心(汉堡)放入测试集,明确指出引入未见中心通常导致整体性能下降
跨采集时相(治疗后 → 治疗前) 中高 官方说明测试集含再灌注治疗前采集的超急性病例,与训练集的治疗后病例不同
跨场强(3T 训练 → 1.5T 部署) 中 数据混合场强且阅片者对场强设盲,但未报告分场强性能
小病灶主导的临床应用 高 官方榜单中最低的病灶级 F1 仅 57.35,远低于同级 Dice;文献明确指出小点状栓塞灶标注不足
非欧洲人群 高 数据地理来源高度集中于欧洲;官方未提供跨种族验证
跨疾病(卒中 → 其他脑病灶) 高 模型在卒中数据上训练,对肿瘤、脱髓鞘等病灶无适用性证据
儿童与青年卒中 高 数据以成人卒中为主,官方未披露年龄分布

§7.4 伦理声明

ISLES 全部数据在发布前完成不可逆去标识化。ISLES 2022 明确说明采用 HD-BET 基于掩膜进行脑提取以实现去标识化,随后用配准后的脑掩膜对 DWI 与 ADC 剥颅骨,剥颅骨完成后所有序列回归原始空间再发布。ISLES 2024 的标识符为挑战内部 BIDS 编号(形如 sub-stroke0001),不含姓名、出生日期、病历号或面部特征,CT 与 MR 均为仅含脑组织的视野。采集过程依据德国、瑞士与欧盟的医学影像法规及扫描仪厂商的工业标准,并经各机构伦理审批。使用者的合规义务在于遵守许可:ISLES 2015-2018 与 2022 训练集为 CC BY 4.0(须署名),ISLES 2024 为 CC BY-NC-SA 4.0(禁止商业使用,衍生作品须相同方式共享),且使用 ISLES 2024 的 Willis 环掩膜时须额外引用 TopCoW 挑战论文。

§7.5 公平性考量

三个值得关注的公平性问题。第一,人群代表性:数据来自欧洲三级卒中中心,对非洲、南亚、东亚人群的代表性未经评估;在缺乏本地验证的情况下将模型部署于其他人群,可能因颅骨形态、脑体积与血管解剖差异而产生系统性偏差。第二,医疗可及性偏差:入组病例多能获得再灌注治疗与高质量影像,而全球多数卒中患者无法获得这些资源,因此该数据集训练的模型隐含地以"可及高级卒中中心"为前提。第三,标注语言与量表的文化适用性:mRS 与 NIHSS 在不同语言与文化背景下的评定一致性存在差异,跨语言使用时需重新评估。为缓解这些问题,建议在论文中明确声明适用范围,并在可能的条件下开展本地队列的外部验证。

§7.6 数据漂移

ISLES 系列本身存在明确的代际漂移。临床侧,2015 年至 2024 年间血管内取栓从试验阶段走向常规实践,缺血半暗带评估的软件与指南持续更新,导致入组病例的治疗背景与影像表现随时间变化。技术侧,扫描仪与序列参数持续演进,且 2022 届混合了 1.5 T 与 3 T 而 2015 届主要是单一中心设备。这些差异意味着用早期届次训练、在当代临床部署会面临显著的分布漂移。实践建议:把届次当作一个显式变量纳入数据选择与误差分析;做时代敏感性研究时优先使用 2022 与 2024 届;报告模型性能时给出数据采集年份区间,使读者能判断漂移风险。

§7.7 DAIMS 24 项检查

# 检查项 状态 说明
1 宽格式 ✅ 影像按病例-模态组织为独立文件,临床表为宽格式 CSV(一行一例)
2 唯一标识 ✅ 病例标识在届次内唯一(sub-stroke#### 与 training_ 编号),可用作主键
3 特殊字符 ✅ 文件名使用 BIDS 规范字符集(小写字母、数字、连字符、下划线)
4 重复行 ⚠️ 单届内无重复;跨届存在病例复用(2016 是 2017 子集),需主动去重
5 缺失编码 ⚠️ 临床表空值无统一缺失编码约定,需自行约定并显式处理
6 标签标识 ✅ 真值以独立掩膜文件承载,命名规范且二值明确
7 罕见类分组 ⚠️ 小点状栓塞灶是临床关键但训练信号极弱,官方未提供罕见类分组方案
8 偏倚评估 ✅ 官方数据论文系统披露标注偏倚、阅片者间差异与中心引入的影响
9 数据字典 ⚠️ 2022/2024 文档完备;2015-2018 的字段与目录含义主要依赖论文描述
10 信息性缺失解释 ⚠️ 测试集掩膜缺失、FLAIR 错位等具有信息量但未统一编码
11 设备记录 ⚠️ 2022 提供 DICOM 元数据 JSON(如可获得),非全覆盖且未逐例强制
12 共线性 ✅ 影像特征与临床变量间的共线性由使用者自行评估;数据层面无冗余派生列
13 编码映射 ⚠️ 官方未提供 ICD-10/ICD-11 逐例映射,跨术语体系检索需自建
14 时间戳处理 ✅ 2024 届以 ses-01/ses-02 显式表达纵向时间结构;时间已脱敏为相对会话
15 划分建议 ✅ 官方提供明确的训练/测试划分及设计理由
16 泄漏讨论 ✅ 官方披露 2016/2017 超集关系与跨届中心重叠
17 标签分布 ✅ 官方给出体积范围、病灶数范围与血管供血区分布
18 测量偏倚 ✅ 官方量化阅片者间 Dice 与体积差,披露体积低估与小病灶欠标
19 外部验证建议 ✅ DeepISLES 论文提供了 1685 例外部队列的验证范式
20 版本记录 ✅ 各届有明确年份标识;2015-2018 重发布有独立 DOI 与许可说明
21 预处理脚本 ✅ 官方提供 isles22 与 isles24 仓库,含读图、可视化与指标脚本
22 合规要求 ✅ 许可明确(CC BY 4.0 / CC BY-NC-SA 4.0),并附数据使用政策
23 多模态对齐 ⚠️ 2024 届共配准完备(体素网格完全一致);2022 届 FLAIR 与 DWI 存在轻微错位
24 去标识化 ✅ 官方文档明确记录 HD-BET 脑提取与不可逆匿名化流程

DAIMS 评分:15.5 / 24

评分解读:15.5/24 的分数落点,反映的是一个"文档质量分届递减、工程规范分届递增"的系列。得分项高度集中在 2022 与 2024 两届:官方数据论文系统披露了标注流程、阅片者间一致性、去标识化方法与偏倚分析,官方仓库提供了可运行的指标脚本,2024 届更是做到了 BIDS 规范与体素网格完全共配准,这四项在现代影像数据集中属于难得的完备度。扣分项则几乎全部集中在两个来源:一是跨届异质性——2015-2018 四届的字段含义、目录组织与标注协议缺少同等详细的文档,且许可证在 2025 年重发布时发生过变化(收集级 CC BY 4.0 与文件夹内保留的 ODC-ODbL 声明并存);二是系列固有的封闭性设计——测试集真值永久不公开,这不是缺陷而是挑战赛的立身之本,但它确实使"独立复算官方成绩"这一数据科学常规动作无法完成。此外,缺少逐例 ICD 编码、临床缺失值无统一编码约定、2022 届 FLAIR 的轻微错位,都是需要使用者自行补齐的工程负债。

对你意味着什么:如果你只使用 ISLES 2022 或 2024 届,你实际拿到的是一个文档接近一流的影像数据集,可以直接进入建模阶段——官方指标脚本让评估环节几乎不需要自己写代码,2024 届的共配准设计让多模态堆叠不需要额外配准。如果你的课题需要横跨六届做方法学纵向研究,或需要追溯到 2015-2018 的原始标注协议细节,那么请把"自行建立字段映射表、自行处理跨届去重、自行确认每届的实际许可"作为项目的第一阶段工作,而不是边做边补。如果你的目标是与官方榜单可比,请从一开始就接受"测试集只提交一次"的纪律;如果你的目标是产出可用于临床的产品,请注意 ISLES 2024 不可商用这一硬约束,并把 ISLES 2022 训练集作为可商用路径的主力。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
1685 例大规模外部队列 多中心(DeepISLES 论文所汇队列) DWI 梗死分割 Dice、病灶级 F1 Dice 较此前最优方法提升 7.4%,F1 提升 12.6% DeepISLES 集成方法的泛化性优于任何单一来源方法
神经放射科医师主观评价(图灵式测试) 多中心专家 分割质量盲评 专家偏好率 不适用 医师更偏好 DeepISLES 的分割结果而非人工标注
ISLES 2022 未见中心(汉堡) UKE 汉堡 梗死分割 官方四指标 官方指出引入未见中心通常导致性能整体下降 跨中心泛化是主要风险来源,被设计进测试集
ISLES 2022 治疗时相差异(再灌注前 vs 后) 伯尔尼(治疗前)与慕尼黑/汉堡(治疗后) 梗死分割 官方四指标 官方未单独披露分时相数值 时相差异被设计为独立的泛化维度
2015 SISS 与 SPES 结果对比 多中心 亚急性分割 vs 急性灌注估计 Dice、ASSD 不适用(不同任务) 灌注病灶估计可行性高(最优方法体积拟合 r 达 0.93),亚急性分割精度仍不足
ISLES 2024 真值生成链 DeepISLES(由 ISLES 2022 训练) 最终梗死灶标注 不适用 方法学依赖 2024 届真值由 2022 届训练模型预分割,两届不可视为独立证据

§8 基准性能与生态

§8.1 官方排行榜

ISLES 2022 是系列中榜单最完整、最常被引用的届次。官方使用四个指标:体素级 Dice、病灶级 F1、病灶计数差、体积差;对每个指标分别排名,再对各指标排名取平均得到综合排名。

综合排名 团队 Dice 病灶级 F1 病灶计数差 体积差 年份 关键技术 代码
1 PAT 78.69 82.46 2.28 5.10 2024 多模态双分支集成,融合脑肿瘤表征迁移学习 Xu et al., 2024, Journal of Digital Imaging
2 SEALS 78.06 80.42 2.32 4.97 2022 多模态分割 + 后处理,榜单综合排名第一 见官方排行榜页面
3 NAUTO(NVAUTO) 78.39 78.82 2.54 5.04 2022 MONAI SegResNet + Auto3DSeg,15 模型集成,仅用 DWI+ADC MONAI Auto3DSeg
4 Swan 76.33 75.26 2.88 5.14 2022 多模态三维分割 见官方排行榜页面
5 PLORAS 71.24 69.32 3.76 4.85 2022 体积差排名第一,但 Dice 偏低 见官方排行榜页面
6 VICOROB 72.25 69.35 3.54 5.52 2022 多模态分割与后处理 见官方排行榜页面
7 CTRL-KCL 74.28 74.16 3.04 64.69 2022 体积差显著异常,提示后处理失效 见官方排行榜页面
8 MIRC 70.35 68.51 3.66 7.13 2022 多模态分割 见官方排行榜页面
9 CREATIS 68.82 67.17 4.40 7.86 2022 多模态分割 见官方排行榜页面
10 Dolphins 67.90 57.35 5.51 7.27 2022 病灶级 F1 最低,小病灶漏检明显 见官方排行榜页面

完整引用:团队成绩引用自官方榜单汇总文献(Xu et al., 2024, Journal of Digital Imaging, DOI 10.1007/s10278-024-01099-6, Table 6);NVAUTO 方法描述引用自 Siddiquee et al., 2022, arXiv:2209.09546(MICCAI ISLES 2022 challenge report, NVIDIA)。

数值不可直接比较的原因(四条):第一,榜单中的 Dice 与 F1 是体素级与病灶级两种不同口径,不能互换。第二,PAT 队成绩发表于 2024 年,其他队伍为 2022 年挑战期成绩,时间口径不同,且 PAT 论文报告的是在其自身复现环境下的评估。第三,各队的后处理强度差异极大——CTRL-KCL 的 Dice 达 74.28 但体积差高达 64.69,说明其分割结果在体积上严重失衡,单看 Dice 会得出错误结论。第四,官方综合排名是"逐指标逐例排名后取平均",因此综合排名第一(SEALS)的 Dice 并非最高(NAUTO 的 0.824 最高),引用时必须说明是哪个维度上的第一。

ISLES 2015 的可核实排名:SPES 子任务前两名依次为 CH-Insel 与 DE-UzL(体积拟合线性回归 r 分别为 0.87 与 0.93);SISS 子任务第三名由赫尔辛基团队(Halme、Korvenoja、Salli)获得。ISLES 2018 的可核实排名:冠军 Tao Song(华东师范大学与商汤科技)、第二名 Liu Pengbo(北京工业大学)、第三名 Yu Chen(腾讯优图实验室)、第四名 Xiaojun Hu(码隆科技)、第五名 Albert Clérigues García(赫罗纳大学 VICOROB 研究所)。ISLES 2016 与 2017 的冠军队伍名称在可访问的官方页面中未披露,此处不臆造。

§8.2 SOTA 总结与选型建议

从 ISLES 2022 榜单可以提炼出四条具有普适性的结论。第一,多折集成是稳定提升性能的核心手段:NVAUTO 用 3 次 5 折得到的 15 个模型集成,取得了最高的 Dice 0.824。第二,模态选择需要经过验证,而非越多越好:NVAUTO 弃用 FLAIR 只保留 DWI+ADC,反而取得最高 Dice;这提示在配准质量不达标时,引入额外模态的收益可能为负。第三,跨任务迁移学习确实有效:用 BraTS 2021 脑肿瘤数据预训练为卒中分割带来了 0.5-1% 的 Dice 提升,说明不同脑病灶之间共享可迁移的深层特征。第四,单一指标的优化会导致其他指标劣化:CTRL-KCL 的 Dice 不低但体积差失控,Dolphins 的 Dice 尚可但 F1 最低;因此选型时应先明确下游应用关心哪些指标,再选择在该指标组合上表现均衡的方案,而非盲目追求 Dice 最高的模型。

§8.3 评测协议

要素 ISLES 2015 ISLES 2016/2017 ISLES 2018 ISLES 2022 ISLES 2024
主要指标 Dice、ASSD 结局预测相关指标(含 Dice) Dice 等分割指标 Dice、病灶级 F1、病灶计数差、体积差 同 2022
是否使用 HD SISS 使用;SPES 不使用 官方未披露 官方未披露 官方未使用 官方未使用
排名方式 相对排名 官方未完整披露 官方未完整披露 逐指标逐例排名后取平均 同 2022
提交方式 结果掩膜上传 结果掩膜上传 结果掩膜上传 Docker 容器 Docker 容器
评测平台 SMIR SMIR SMIR Grand Challenge Grand Challenge

SPES 不使用 HD 的理由由 2015 届论文明确给出:灌注区估计的临床关注点是体积信息,且部分病灶包含空洞,HD 不适于衡量分割质量。这一段说明至今仍是理解"指标选择应服从临床问题"的经典案例。

数据集 机构 任务 与 ISLES 的关系
ATLAS v2.0 南加州大学(USC) 单通道 T1w 跨急慢性卒中病灶分割 与 ISLES 2022 并行举办(Task 2),患者不重叠
BraTS MICCAI 社区 脑肿瘤分割 NVAUTO 用其做预训练,迁移到 ISLES 提升 0.5-1% Dice
TopCoW 慕尼黑工业大学等 Willis 环拓扑感知分割 ISLES 2024 的 Willis 环掩膜来自该挑战,使用时须一并引用
DAWN / DEFUSE-3 试验影像 多中心临床试验 再灌注治疗决策 ISLES 2018 的临床动机来源
各类卒中影像队列 多机构 梗死分割与预后 可作 ISLES 的外部验证队列,须统一预处理与指标

§8.5 关键论文

  1. Maier O., Menze B.H., von der Gablentz J., et al. ISLES 2015 — A public evaluation benchmark for ischemic stroke lesion segmentation from multispectral MRI. Medical Image Analysis, 35:250-269, 2017. DOI 10.1016/j.media.2016.07.009。贡献:建立首个卒中分割公共评测框架,提出离站评测与隐藏测试集真值的设计,系统分析 21 种方法的结果并给出"灌注估计可行、亚急性分割精度不足"的结论。
  2. Winzeck S., Hakim A., McKinley R., et al. ISLES 2016 and 2017 — Benchmarking Ischemic Stroke Lesion Outcome Prediction Based on Multispectral MRI. Frontiers in Neurology, 9:679, 2018. DOI 10.3389/fneur.2018.00679。贡献:把任务从当前病灶分割推进到最终梗死灶结局预测,并记录了 2017 对 2016 的超集关系。
  3. Hernandez Petzsche M.R., de la Rosa E., Hanning U., et al. ISLES 2022: A multi-center magnetic resonance imaging stroke lesion segmentation dataset. Scientific Data, 9:762, 2022. DOI 10.1038/s41597-022-01875-5。贡献:发布 400 例多中心多模态 MRI 数据集,建立四级人机混合标注流程,公开阅片者间一致性实验与概率病灶图谱。
  4. de la Rosa E., Su R., Reyes M., et al. ISLES’24: Final Infarct Prediction with Multimodal Imaging and Clinical Data. Where Do We Stand? arXiv:2408.10966, 2024。贡献:设定 ISLES 2024 的挑战命题,讨论最终梗死预测的现状与瓶颈。
  5. Riedel E.O., de la Rosa E., Baran T.A., et al. ISLES’24 — A Real-World Longitudinal Multimodal Stroke Dataset. arXiv:2408.11142, 2024(期刊版:Radiology: Artificial Intelligence, 8(3), 2026, DOI 10.1148/ryai.250603)。贡献:发布首个纵向多模态多中心卒中数据集,含急性 CT、随访 MRI 与 90 天临床结局。
  6. Siddiquee M.M.R., Yang D., He Y., Xu D., Myronenko A. Automated ischemic stroke lesion segmentation from 3D MRI — ISLES 2022 challenge report. arXiv:2209.09546, 2022。贡献:官方榜单最高 Dice(0.824)方案的技术报告,公开弃用 FLAIR、使用 MONAI SegResNet 集成与跨任务预训练的关键决策。
  7. de la Rosa E., Reyes M., Liew S.L., et al. DeepISLES: a clinically validated ischemic stroke segmentation model from the ISLES’22 challenge. Nature Communications, 16:7357, 2025. DOI 10.1038/s41467-025-62373-x。贡献:把挑战优胜方法集成为经临床验证的工具,在 1685 例外部数据上验证并完成图灵式专家偏好测试。
  8. Maier-Hein L., Eisenmann M., Reinke A., et al. Why rankings of biomedical image analysis competitions should be interpreted with care. Nature Communications, 9:5217, 2018。贡献:方法学层面的元分析,系统说明生物医学挑战排名的不确定性来源,是解读 ISLES 榜单的必要参照。

§8.6 社区活跃度

维度 情况
官方代码仓库 isles22 与 isles24 两个 GitHub 仓库,提供读图、可视化与指标脚本
衍生模型仓库 DeepISLES 开源(github.com/ezequieldlrosa/DeepIsles),已产品化
数据镜像活跃度 ISLES 2024 的 HuggingFace 镜像月下载约 1,890 次(截至 2025-11,镜像 v7)
学术影响力 ISLES 2015 论文被引 671+(截至 2026-09);ISLES 2016/2017 论文被引 214+
挑战连续性 2015 至 2024 连续六届,是卒中影像领域持续时间最长的分割系列
社区讨论 主要围绕跨届复用、FLAIR 配准、小病灶漏检三类问题

§8.7 生态快照

资源 类型 链接 状态(截至 2026-09) 推荐理由
ISLES 官方主页 门户 https://www.isles-challenge.org/ 活跃 历届信息与最新届次入口
isles22 官方仓库 代码 https://github.com/ezequieldlrosa/isles22 活跃 官方指标脚本的唯一权威来源
isles24 官方仓库 代码 https://github.com/ezequieldlrosa/isles24 活跃 BIDS 结构说明与入门笔记本
DeepISLES 开源实现 代码 https://github.com/ezequieldlrosa/DeepIsles 活跃 经临床验证的现成强基线
ISLES 2022 训练集 数据 https://doi.org/10.5281/zenodo.7153326 可下载 CC BY 4.0,最常用的建模入口
ISLES 2015-2018 合集 数据 https://doi.org/10.5281/zenodo.17736412 可下载 SMIR 停运后的唯一稳定来源
ISLES 2024 训练集镜像 数据 https://huggingface.co/datasets/hugging-science/isles24-stroke 活跃 获取最新纵向队列的便捷路径
概率病灶图谱 数据 https://doi.org/10.5281/zenodo.7335305 可下载 空间先验与标注不确定性建模
MONAI Auto3DSeg 框架 https://monai.io/apps/auto3dseg 活跃 复现榜单前列方案的自动化工具

§9 相关资源与引用

§9.1 官方资源

§9.2 教程与工具

资源 用途
isles22 官方 GitHub 仓库 读图、可视化与官方四指标计算脚本
isles24 官方 GitHub 仓库 BIDS 数据加载入门笔记本与 Docker 提交说明
DeepISLES 开源仓库 可直接运行的临床级分割推理流程
MONAI Auto3DSeg 自动化 3D 分割流水线,复现榜单方案
Nibabel / SimpleITK NIfTI 读写与重采样配准

§9.3 引用格式

BibTeX 引用块(按所用届次选用相应条目):

@article{maier2017isles,
  title   = {ISLES 2015 - A public evaluation benchmark for ischemic stroke
             lesion segmentation from multispectral MRI},
  author  = {Maier, Oskar and Menze, Bjoern H. and von der Gablentz, Janina and
             H{\"a}ni, Levin and Heinrich, Mattias P. and others},
  journal = {Medical Image Analysis},
  volume  = {35},
  pages   = {250--269},
  year    = {2017},
  doi     = {10.1016/j.media.2016.07.009}
}

@article{winzeck2018isles,
  title   = {ISLES 2016 and 2017 - Benchmarking Ischemic Stroke Lesion
             Outcome Prediction Based on Multispectral MRI},
  author  = {Winzeck, Stefan and Hakim, Arsany and McKinley, Richard and
             Pinto, Jos{\'e} A. and Alves, Victor and others},
  journal = {Frontiers in Neurology},
  volume  = {9},
  pages   = {679},
  year    = {2018},
  doi     = {10.3389/fneur.2018.00679}
}

@article{hernandezpetzsche2022isles,
  title   = {ISLES 2022: A multi-center magnetic resonance imaging stroke
             lesion segmentation dataset},
  author  = {Hernandez Petzsche, Moritz R. and de la Rosa, Ezequiel and
             Hanning, Uta and Wiest, Roland and Valenzuela, Waldo and others},
  journal = {Scientific Data},
  volume  = {9},
  pages   = {762},
  year    = {2022},
  doi     = {10.1038/s41597-022-01875-5}
}

@article{riedel2024isles24,
  title   = {ISLES'24 -- A Real-World Longitudinal Multimodal Stroke Dataset},
  author  = {Riedel, Evamaria Olga and de la Rosa, Ezequiel and Baran, The Anh
             and Hernandez Petzsche, Moritz and Baazaoui, Hakim and others},
  journal = {arXiv preprint arXiv:2408.11142},
  year    = {2024}
}

@article{delarosa2024isles24challenge,
  title   = {ISLES'24: Final Infarct Prediction with Multimodal Imaging and
             Clinical Data. Where Do We Stand?},
  author  = {de la Rosa, Ezequiel and Su, Ruisheng and Reyes, Mauricio and
             Riedel, Evamaria Olga and Kofler, Florian and Menze, Bjoern},
  journal = {arXiv preprint arXiv:2408.10966},
  year    = {2024}
}

@article{delarosa2025deepisles,
  title   = {DeepISLES: a clinically validated ischemic stroke segmentation
             model from the ISLES'22 challenge},
  author  = {de la Rosa, Ezequiel and Reyes, Mauricio and Liew, Sook-Lei and
             Hutton, Alexandre and Wiest, Roland and others},
  journal = {Nature Communications},
  volume  = {16},
  pages   = {7357},
  year    = {2025},
  doi     = {10.1038/s41467-025-62373-x}
}

引用指南:使用 ISLES 2015 数据时引用 Maier 等 2017;使用 2016/2017 数据时引用 Winzeck 等 2018(并在方法中说明两届的超集关系);使用 2022 数据时引用 Hernandez Petzsche 等 2022;使用 2024 数据时同时引用 Riedel 等 2024 与 de la Rosa 等 2024,并在使用 Willis 环掩膜时额外引用 TopCoW 挑战论文(Yang 等 2023, arXiv:2312.17670);引用榜单成绩时注明其来源文献与评估口径。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途
通用大语言模型 文献信息抽取、章节结构组织、草稿撰写与语言润色
检索增强检索器 官方主页、Zenodo 记录、期刊论文页面的信息定位与交叉核验

§10.2 AI 参与范围

AI 参与的范围包括:从公开文献与官方页面中抽取例数、模态、日期、指标与榜单数值;按既定章节结构组织内容;生成代码示例的初稿;对同一条事实在多个来源之间做一致性比对。AI 未参与的范围包括:医学判断(ICD-11 与 SNOMED CT 映射的临床合理性)、榜单数值的最终确认、药监与合规相关表述。

§10.3 输入来源列表

  1. ISLES 官方主页:https://www.isles-challenge.org/
  2. ISLES 2018 官方专页:http://www.isles-challenge.org/ISLES2018/
  3. Maier O. et al., Medical Image Analysis 35:250-269, 2017, DOI 10.1016/j.media.2016.07.009
  4. PMC 全文(ISLES 2015 论文):https://www.ncbi.nlm.nih.gov/pmc/articles/PMC5099118/
  5. Winzeck S. et al., Frontiers in Neurology 9:679, 2018, DOI 10.3389/fneur.2018.00679
  6. Hernandez Petzsche M.R. et al., Scientific Data 9:762, 2022, DOI 10.1038/s41597-022-01875-5
  7. Nature 全文页(ISLES 2022 数据论文):https://www.nature.com/articles/s41597-022-01875-5
  8. PMC 全文(ISLES 2022 数据论文,含阅片者间分析):https://pmc.ncbi.nlm.nih.gov/articles/pmid/36496501/
  9. Zenodo 重发布记录(ISLES 2015-2018 合集):https://doi.org/10.5281/zenodo.17736412
  10. Riedel E.O. et al., Radiology: Artificial Intelligence 8(3), 2026, DOI 10.1148/ryai.250603
  11. Riedel E.O. et al., arXiv:2408.11142, 2024
  12. de la Rosa E. et al., arXiv:2408.10966, 2024
  13. Siddiquee M.M.R. et al., arXiv:2209.09546, 2022(ISLES 2022 挑战技术报告)
  14. de la Rosa E. et al., Nature Communications 16:7357, 2025, DOI 10.1038/s41467-025-62373-x
  15. ISLES’24 官方 GitHub 仓库:https://github.com/ezequieldlrosa/isles24
  16. 综述汇总表(ISLES 2015-2018 各届样本量与最高 IDC):https://pmc.ncbi.nlm.nih.gov/articles/PMC8707263/
  17. 榜单汇总(ISLES 2022 前十名):https://link.springer.com/article/10.1007/s10278-024-01099-6/tables/6
  18. ISLES 2022 训练集(Zenodo):https://doi.org/10.5281/zenodo.7153326
  19. 概率病灶图谱(Zenodo):https://doi.org/10.5281/zenodo.7335305
  20. 赫尔辛基大学研究门户(ISLES 2015 SISS 第三名记录):https://researchportal.helsinki.fi/en/prizes/isles-ischemic-stroke-lesion-segmentation-challenge-2015/

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景与 ICD-11/SNOMED CT 映射 千方病案医学编辑部 对照 ICD-11 与 SNOMED CT 条目逐项复核 ✅ 已通过
§3 数据集规格(例数、模态、日期) 千方病案医学编辑部 与官方数据论文及挑战主页逐项比对 ✅ 已通过
§6 代码与坑点 千方病案医学编辑部 本地运行代码、核对坑点在官方文档与论文中的依据 ✅ 已通过
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部 逐项对照数据论文披露内容评估 ✅ 已通过
§8 排行榜数值与引用 千方病案医学编辑部 与榜单汇总文献及方法论文逐位核对 ✅ 已通过
§9 引用格式与 §10 声明 千方病案医学编辑部 核对 DOI、卷期页码与作者列表 ✅ 已通过

§10.5 AI 生成章节标注

全文由 AI 起草并经人工逐节校验。AI 生成比例较高的章节为 §1(概览与摘要)、§4(数据结构)、§6(代码与坑点);人工实质性修订较多的章节为 §2(医学映射)、§3(规格数值)、§7(偏倚与 DAIMS 评估)、§8(榜单与不可比性说明)。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-05(与 §0 审核日期一致)。

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • wmh-challenge — 共享标签:神经科学 / 医学图像分割 / 心血管疾病 / 挑战赛数据集 / 脑影像
  • atlas-v2 — 共享标签:神经科学 / 医学图像分割 / 心血管疾病 / 脑影像
  • adhd-200 — 共享标签:电子健康记录 / 神经科学 / 脑影像
  • camus — 共享标签:医学图像分割 / 心血管疾病 / 挑战赛数据集
  • adni — 共享标签:电子健康记录 / 神经科学 / 脑影像
  • crossmoda2022 — 共享标签:神经科学 / 医学图像分割 / 挑战赛数据集
  • aims-tbi — 共享标签:医学图像分割 / 挑战赛数据集 / 脑影像
  • mms-2 — 共享标签:医学图像分割 / 心血管疾病 / 挑战赛数据集
  • cmrxmotion — 共享标签:医学图像分割 / 心血管疾病 / 挑战赛数据集
  • lvquant — 共享标签:医学图像分割 / 心血管疾病 / 挑战赛数据集

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集