CHAOS — 健康腹部跨模态器官分割基准 AI-Ready Wikipedia

80 名健康受试者 CT+MRI 四器官分割挑战数据(开放获取)

来源 Dokuz Eylül 大学医院(土耳其伊兹密尔) url: https://chaos.grand-challenge.org/发布时间: 2026-09-13最后更新: 2026-09-25 阅读 44
CHAOS — 健康腹部跨模态器官分割基准 AI-Ready Wikipedia

信息速览

数据集名称CHAOS — 健康腹部跨模态器官分割基准 AI-Ready Wikipedia
数据类型80 名健康受试者,约 2.0 GB DICOM+PNG,CT 40 例 + MRI 120 序列,四器官手工标注,Zenodo 开放下载
规模80 名健康受试者(40 例 CT + 40 例 MRI)
接入方式Dokuz Eylül 大学医院(土耳其伊兹密尔) url: https://chaos.grand-challenge.org/
AI 就绪度

数据集封面

CHAOS — 健康腹部跨模态器官分割基准 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 CHAOS
英文全称 Combined (CT-MR) Healthy Abdominal Organ Segmentation
别名/简称 CHAOS Challenge(ISBI 2019)
疾病分类 不适用 — 健康受试者正常腹部解剖,无 ICD-11 疾病编码(结构编码见 SNOMED CT 行)
SNOMED CT 肝 10200004;右肾 71616005;左肾 64133005;脾 39699005
数据模态 CT(门静脉期增强)+ MRI(T1-DUAL 同/反相位、T2-SPIR)
AI 任务类型 医学图像语义分割(单器官、多器官、跨模态共 5 类任务)
样本总数 80 名受试者、160 个 DICOM 序列集(CT 40 + MRI 120);CT 与 MRI 各 20 训练 + 20 测试
数据大小 约 2.0 GB(训练集 890.8 MB + 测试集 1.1 GB,Zenodo ZIP)
数据格式 DICOM(影像,MR 为 12-bit)+ PNG(分割掩膜)
许可证 CC BY-NC-SA 4.0(Attribution-NonCommercial-ShareAlike 4.0 International)
访问级别 开放(Zenodo 直接下载,无需注册;在线评测需 grand-challenge 账号)
DUO 标签 GRU + NCU(通用研究使用 + 非商业,NC 条款依许可证)
语言 英文(官网、提交手册与评测代码)
首发日期 2019-04-11(ISBI 2019 现场赛,Zenodo 数据集同步发布)
最后更新 2019-04-11(Zenodo v1.03,当前版本)
发布机构 Dokuz Eylül 大学医院(土耳其伊兹密尔)
官方主页 https://chaos.grand-challenge.org/
下载地址 https://zenodo.org/records/3431873
DOI 10.5281/zenodo.3362844
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 有官方划分与四指标评测代码(MATLAB/Python/Julia),但 DICOM 解析、掩膜灰度值映射与 NIfTI 转换需手动实现,且无官方预处理/训练脚本
页面状态 published

§0 可信度与审核声明

  • 医学审核:[千方病案医学编辑部](腹部影像方向)交叉审核:§2 医学背景(健康人腹部解剖与影像序列)、§7.1 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 交叉审核完整性:医学与数据工程两条线分别覆盖本页面的临床表述与工程结论;所有关键数字均在 §10.3 输入来源中有可回溯出处。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CHAOS 数据通过 Zenodo 开放获取,按 CC BY-NC-SA 4.0 许可(署名—非商业性使用—相同方式共享),测试集分割金标准由官方保留、永不公开。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? CHAOS(Combined (CT-MR) Healthy Abdominal Organ Segmentation)是一套健康人腹部 CT 与 MRI 影像及器官分割标注,2019 年 4 月随 IEEE ISBI 国际会议在威尼斯举办的同名词挑战赛发布。它包含 80 名健康受试者:40 人做了门静脉期增强 CT,40 人做了包含 T1-DUAL(同/反相位)与 T2-SPIR 序列的 1.5T MRI。CT 影像标注了肝脏,MRI 影像则把肝脏、脾脏、左肾、右肾四个器官都逐层勾画了出来。

为什么重要? 在 CHAOS 之前,腹部分割基准几乎都是单一模态(以 CT 为主)且聚焦肿瘤病灶;真实临床中医生却在 CT 与 MRI 之间来回工作。CHAOS 用同一套评测体系把"单模态分割"“跨模态分割”"多器官分割"放在了同一个擂台上,并给出了一个至今被反复引用的结论:模型在单模态肝脏分割上 DICE 可达 0.95-0.98,但跨模态任务会掉到 0.88 左右——这个"跨模态鸿沟"成了域适应与模态不变表征研究的标准试金石。

我能用它做什么? 训练和评测腹部器官分割模型;研究 CT↔MRI 的跨模态学习、域适应或图像翻译;为下游活体肝移植供体体积评估等任务做方法验证。数据在 Zenodo 无需注册即可下载(约 2.0 GB),还配有官方四指标评测代码,可以直接接入 grand-challenge.org 的在线评测系统与全球成绩榜。

§1.1 摘要

CHAOS 由土耳其伊兹密尔 Dokuz Eylül 大学医院组织,挑战赛于 2019-04-11 与 IEEE ISBI 2019 同场举行。数据采集自该院放射科的常规临床流程:80 名健康成人中 40 例接受门静脉期增强 CT(512×512 分辨率,层厚 2.0-3.2 mm),40 例接受 1.5T Philips MRI 上腹部扫描(256×256 分辨率,层厚 4.4-8.0 mm),每组 20 例训练 + 20 例测试,划分时按分辨率、层厚与年龄分层。标注由 3 名经验分别为 10、12、28 年的放射学专家逐层手工勾画,多数投票定稿,并明确了下腔静脉(IVC)一般不计入肝脏的规则。挑战赛设计了 5 个互补任务(跨模态肝、CT 肝、MRI 肝、跨模态多器官、MRI 多器官),评测使用 DICE、RAVD、ASSD、MSSD 四指标并按专家间一致性阈值映射为 0-100 分。数据于 2019-04-11 以 v1.03 版本在 Zenodo 发布(DOI 10.5281/zenodo.3362844),挑战结果发表于 Medical Image Analysis(2021 年,第 69 卷)。截至 2026-09,Zenodo 全版本累计下载 32,316 次,在线评测通道持续开放。整份影像均为健康器官(无肿瘤、无病灶),这一"正常解剖"定位既是它的方法学价值,也是使用时最大的泛化前提。

§1.2 战略价值

维度一:跨模态基准的稀缺性。 公开腹部基准中长期由 CT 主导(SLIVER07、LiTS、MSD 肝脏任务均为纯 CT),MRI 因缺乏 HU 值那样的标准化强度标尺、且序列多变,长期缺少带多器官金标准的公开数据。CHAOS 同时提供增强 CT 与三种 MRI 序列(T1-DUAL 同相位、反相位、T2-SPIR),并且是刻意"不配对"的设计——CT 与 MR 来自不同患者,迫使模型学习可跨模态迁移的解剖表征而非依赖患者内配对信息。挑战论文中跨模态任务性能从 DICE 0.98 跌至 0.88 的量化结论,已成为域适应、模态不变表征、MR 图像合成等方向论文的标准引用锚点。

维度二:评测方法学的范本。 CHAOS 没有只看 DICE:它把体积差(RAVD)与表面距离(ASSD/MSSD)纳入综合分,并按"专家间一致性"设定 0 分阈值(DICE≤0.8、RAVD≥5%、ASSD≥15 mm、MSSD≥60 mm 记零),把"算法是否能用于临床"翻译成了可解释的分数。此外,挑战论文用超过 1,500 名参赛者、550 余份提交的数据专门分析了"多提交偷看(peeking)现象"对排行榜的污染,为整个领域的挑战赛组织方法学提供了警示案例。

维度三:健康解剖基线的不可替代性。 因为只含健康器官,CHAOS 提供了无病灶干扰的"正常解剖分割"基线:器官体积、形态学测量的方法学验证可以直接以此为准,再迁移到病理数据上。官方数据显示单模态肝脏分割 DICE 已达 0.95-0.98,而 MSSD 仍停留在约 21 mm 量级——这一"重叠指标饱和、边界指标不足"的现象本身就是继续研究的理由,也解释了为何该数据集至今仍出现在新分割架构(如 nnU-Net 后续工作)的评测组合中。

维度四:获取成本几乎为零的"教学级"基准。 数据无需注册即可从 Zenodo 下载,总体积约 2.0 GB;官方评测代码提供 MATLAB、Python、Julia 三种实现;提交手册与模板齐全。对课程项目、方法课作业或新团队的 pipeline 冒烟测试而言,这是一套"下载当天即可跑通读取-训练-评测全链路"的数据集——这种低摩擦特性也是它长期保持社区热度(Zenodo 全版本 32,316 次下载,截至 2026-09)的直接原因。

§1.3 同类数据集横向对比

数据集 规模 模态 标注 与 CHAOS 的差异化
CHAOS 80 名受试者 / 160 个序列集 增强 CT + MRI(T1-DUAL in/opp、T2-SPIR) CT 肝;MRI 肝/脾/双肾 唯一同时覆盖 CT 与多序列 MRI 的多器官分割挑战基准;健康人;unpaired 跨模态设计
SLIVER07 20 训练 + 10 测试 CT 肝 2007 年肝脏分割挑战鼻祖,仅 CT、仅肝;CHAOS 官网明确将自身 CT 任务定位为其延续
LiTS 131 训练 + 70 测试 CT 肝 + 肿瘤 聚焦肝癌病灶分割;不含 MRI、不含肾/脾
MSD Task03/08 201 例(肝)/443 例(肝血管) CT 肝、肝血管 多器官套件中的肝脏子任务,纯 CT,含病理病例
BTCV 30 例 CT 13 个腹部器官 器官类别更多,但无 MRI、规模小、无挑战赛评测体系
AMOS 约 600 例 CT + MRI 腹部多器官 2022 年后出现的 CT+MR 多器官套件,规模更大,但任务设计与四指标评测协议不同于 CHAOS

注:对比表数字为各数据集公开材料中的常见统计值,用于说明定位差异;具体使用前请以各自官方页面为准。

从表中可以读出 CHAOS 的生态位:它不是"最大"的腹部分割数据,而是把"跨模态(CT+MRI)、多序列、健康解剖、挑战赛评测体系"四个属性同时占住的唯一选项;需要病理病例或更大规模时应转向 LiTS/MSD/AMOS,并把 CHAOS 用作方法学基线与跨模态试金石。

§1.4 版本时间轴

时间 版本/事件 说明
2019-04-11 ISBI 2019 现场赛(威尼斯) 训练集赛前约 3 个月发布,测试集现场赛前 24 小时发放并当场评测
2019-04-11 Zenodo v1.03(当前版本) 训练集(890.8 MB,含 GT)与测试集(1.1 GB,无 GT)ZIP 打包发布,DOI 10.5281/zenodo.3362844;另有 v1.0-v1.02 等历史版本记录
2019-04 起 在线评测开放 grand-challenge.org 提交通道持续开放,实时成绩公布于 Results 页
2020-10-01 在线提交统计截止点 挑战论文统计窗口:Task1 在线 30 份、Task2 在线 379 份、Task3 在线 178 份提交
2021-04 挑战结果论文发表 Medical Image Analysis 第 69 卷,文章号 101950

时间轴提示:数据本身自 2019-04-11 的 v1.03 后不再更新,后续演进全部发生在评测生态侧(在线提交、结果页更新、社区转换脚本)。

§1.5 典型应用场景

  1. 腹部器官分割模型基准评测:用官方 20/20 划分与四指标协议横向对比分割架构(U-Net 变体、nnU-Net、Transformer 类等)。
  2. 跨模态与域适应研究:利用 unpaired CT/MR 设计跨模态学习、模态不变表征、MR→CT 或 CT→MR 图像翻译实验。
  3. 活体肝移植供体术前评估方法学验证:门静脉期增强 CT 肝脏体积测量是移植供体评估的核心环节,CHAOS 的 CT 任务即以此为临床背景(挑战论文与配套的活体供肝分割对比研究均有论述)。
  4. 多器官 MRI 分割预训练:四器官 MRI 标注可用于预训练权重,再迁移至病理或小器官任务。
  5. 教学与方法学训练:5 个任务设计、四指标评分与 peeking 现象分析,是"挑战赛如何科学组织"的现成教材。
  6. 跨模态图像翻译与非配对生成建模:unpaired CT/MR 属性使其成为 CycleGAN 类非配对方法与解剖先验约束研究的天然测试床。

§2 医学背景

§2.1 标签体系与术语映射

CHAOS 的"标签"是正常解剖结构而非疾病诊断,因此不涉及 ICD-11 疾病编码;结构层面的标准术语映射采用 SNOMED CT 解剖结构码。

标签(器官) ICD-11 SNOMED CT 术语
肝 Liver 不适用(健康解剖,无疾病诊断) 10200004 Liver structure(肝结构)
右肾 Right kidney 不适用(健康解剖,无疾病诊断) 71616005 Right kidney structure(右肾结构)
左肾 Left kidney 不适用(健康解剖,无疾病诊断) 64133005 Left kidney structure(左肾结构)
脾 Spleen 不适用(健康解剖,无疾病诊断) 39699005 Spleen structure(脾结构)

说明:ICD-11 的编码对象是疾病与健康问题,健康受试者的正常器官影像不落入其编码范围;若下游应用将分割结果用于疾病诊断(如脂肪肝定量),应另行建立与 ICD-11 相应疾病编码的映射,并完成临床验证。SNOMED CT 侧选择"结构(structure)"层级的编码而非"身体部位"层级,因为它与分割掩膜"体素属于某个器官实体"的语义最贴合,可直接用于标注体系与放射语料的对齐。

§2.2 临床背景与流行病学视角

腹部器官(肝、肾、脾)的精确分割是多项临床流程的底层能力:三维可视化与 3D 打印需先从 DICOM 序列中提取目标器官;活体肝移植供体评估需要准确的单肝体积、残肝体积测量;腹主动脉手术前需要分析脏器血管的起源与走行以定位移植物。官方挑战描述明确将"门静脉期增强 CT 肝分割(供肝术前评估)"与"MRI 四器官分割"列为两大目标。

从疾病负担看,肝移植与慢性肝病、肾脏疾病的全球需求持续增长,影像驱动的形态学/体积学评估(术前规划、随访)是标准环节;但需要强调:CHAOS 本身不含病理影像(无肿瘤、无转移灶),它服务的是上述临床流程的"正常解剖测量与规划"环节,而非疾病检出。对疾病流行病学数字本条目不做展开——引用具体发病率数字前请查阅权威流行病学来源,避免把数据集定位与疾病统计混为一谈。

临床流程 需要的分割能力 CHAOS 对应支撑
活体肝移植供体术前评估 门静脉期 CT 肝脏分割与体积测量 Task 2 / CT 子集(增强 CT 即为此场景采集)
腹主动脉手术规划 器官轮廓与血管出入关系分析 官网挑战描述中明确列出的应用之一
器官体积随访(如肾体积跟踪) CT/MR 多器官稳定勾画 Task 3/5 / MRI 四器官子集
跨模态临床工作流(CT 与 MR 混用) 模态无关的统一分割系统 Task 1/4 的跨模态设定

另一个被挑战论文反复强调的技术背景:CT 有以 HU 为锚的标准化动态范围,而 MRI 没有类似标尺,强度随设备、序列与扫描参数漂移,且临床常规采集伴随各类伪影——这正是 MR 分割更难、跨模态鸿沟存在的底层原因,也是 CHAOS 坚持纳入多序列 MRI 的价值所在。

§2.3 临床任务定义

任务类型 输入 输出 临床用途
筛查/测量(形态学) 腹部 CT 或 MRI 序列 器官掩膜 器官体积、形态学随访(如肾体积跟踪)
术前规划(分割 + 重建) 门静脉期增强 CT 肝脏掩膜 → 三维重建 活体肝移植供体的肝体积/切面规划
定位(血管关系分析) 腹部 CT/MRI 器官掩膜辅助 腹主动脉手术移植物定位时分析血管出入
研究性任务(跨模态) CT 与 MRI 混合训练集 单一系统跨模态输出 检验模型是否学到模态不变的解剖表征

五种挑战任务的映射关系:Task 1(跨模态肝)可视为 Task 2(CT 肝)与 Task 3(MR 肝)的并集;Task 4(跨模态多器官)是 Task 1 向多器官的扩展;Task 5(MR 多器官)是 Task 3 向四器官的扩展。注意 CT 侧四器官标注不存在,Task 4 的多器官评测只发生在 MR 测试数据上。

§2.4 患者人群画像

维度 CT 队列 MR 队列
来源 Dokuz Eylül 大学医院(土耳其伊兹密尔) 同左
例数 40 40
性别 22 男 / 18 女 23 男 / 17 女
年龄 18-63 岁(均值 44.85±11.29) 18-76 岁(均值 54.60±14.25)
健康状态 健康成人,无腹部病灶 同左
种族 官方未披露 官方未披露
就医类型 常规临床流程采集 同左

注:两个队列来自不同患者(unpaired),且年龄构成存在差异(MR 队列平均年龄高约 10 岁),见 §7.1 偏倚分析。读取数据时不存在任何个体级人口学字段——本表即为官方可得的全部人群信息,跨队列统计研究需要额外数据源。

§2.5 临床价值

对临床 AI 而言,CHAOS 回答了三个此前缺乏量化答案的问题:其一,单模态分割是否已"够用"——官方结果显示 CT/MR 单模态肝分割 DICE 达 0.98/0.95,但 MSSD 仍在 21 mm 上下,说明体积测量的重叠精度已可接受、边界精度(决定手术切缘)仍有差距;其二,一个系统跨 CT/MR 工作要付出多大代价——跨模态任务 DICE 掉到 0.88、全器官任务掉到 0.85,量化了模态鸿沟;其三,多任务多器官模型是否更优——总体比单器官专用模型低约 5%,提示"一个模型分割所有器官"并非免费午餐。这三条结论直接指导临床 AI 产品的选型:供肝评估等高风险场景应坚持单模态专用模型 + 距离类指标验收。

落到工程实践的三个"直接可执行"的推论:验收标准应把 DICE 与 MSSD/ASSD 并列(否则边界误差会被重叠指标掩盖);模型选型时先明确部署模态,避免为"全模态通用"支付跨模态精度税;体积测量类应用应在验收中设 RAVD 上限(官方 5% 阈值是现成的参考线)。

§2.6 金标准参考表

维度 内容
划分 CT 20 训练 + 20 测试;MRI 20 训练 + 20 测试;按分辨率、层厚、年龄分层,训练集覆盖全部难度类型
标注方式 逐层人工勾画(2D 标注、3D 体系使用),掩膜以 PNG 序列分发
标注者 3 名放射学专家(经验 10、12、28 年),多数投票定稿;特殊情况(如 IVC 归属)联合决定
性质 共识金标准(consensus-based);测试集金标准由官方保留用于挑战评测,永不公开
标注规则 IVC 体素一般不计入肝脏,除非其完全位于肝轮廓内

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐获取方式 大小 理由
训练自己的分割模型 Zenodo 下载 CHAOS_Train_Sets.zip(v1.03) 890.8 MB 含 DICOM 影像与全部 GT 掩膜,无需注册
参加挑战/查看在线排名 官网 Join 后经 grand-challenge.org 提交测试集预测 1.1 GB(测试集) 测试集 GT 永不公开,在线系统是唯一官方评测途径
只要掩膜做快速实验 用社区转换脚本(如 jonasteuwen/chaos-challenge)自建 NIfTI/npz 同上 官方只发布 DICOM+PNG 原格式,无 NIfTI 官方版
二次分发或衍生数据集 必须遵守 CC BY-NC-SA 4.0 — 需署名、注明修改、非商业且以相同许可共享
查看现有成绩 官网 Results 页 — 无需提交即可查看已发布榜单

§3.1 模态详情

规格 CT MRI
临床场景 门静脉期增强扫描(对比剂注射后肝实质强化最大期) 上腹部常规序列
序列/期相 单期(portal venous phase) T1-DUAL in-phase、T1-DUAL opposed-phase、T2-SPIR
序列集数(训练+测试) 20 + 20 60 + 60(3 序列 × 20/20)
患者数 40(22 男/18 女,18-63 岁) 40(23 男/17 女,18-76 岁)
空间分辨率 512×512 256×256
面内间距 X/Y 0.54-0.79 mm 0.72-2.03 mm
层厚 2.0-3.2 mm 4.4-8.0 mm
每序列集切片数 78-294(均值 160) 26-50(均值约 32×3)
全数据集文件数 6,407 738×3
位深 — 12-bit DICOM
设备 官方未披露具体型号 1.5T Philips MRI

关键结构关系:T1-DUAL 的同相位与反相位影像已配准,共享同一份 GT;T1 与 T2 之间未配准。CT 与 MR 来自不同患者。

§3.1b 影像文件统计

统计项 CT MRI
每序列集切片数 78-294(均值 160) 26-50(各序列均值约 32)
全数据集切片文件数 6,407 738×3(三个序列合计)
空间分辨率 512×512 256×256
X/Y 面内间距 0.54-0.79 mm 0.72-2.03 mm
层厚 2.0-3.2 mm 4.4-8.0 mm

以上数字来自挑战论文数据规格表(Table II);MR 的"均值 32×3"意为每个患者的三个序列集各有约 32 层。

§3.2 子集样本数表

子集 序列集数 含 GT 说明
Train_Sets/CT 20 是 仅肝脏掩膜
Train_Sets/MR 60(T1-DUAL in 20 + T1-DUAL opp 20 + T2-SPIR 20) 是 肝/右肾/左肾/脾掩膜;in/opp 共享 GT
Test_Sets/CT 20 否(永不公开) 仅 DICOM
Test_Sets/MR 60 否(永不公开) 仅 DICOM
合计 160 — 训练 80 + 测试 80 个序列集

§3.3 数据格式表

对象 格式 说明
影像 DICOM(.dcm) 原始格式分发;MR 为 12-bit;文件名形如 i0000,0000b.dcm
影像目录 DICOM_anon 已移除患者相关信息的匿名目录
分割掩膜 PNG 序列 CT:liver_GT_000.png 等;MR:liver_GT_*.png、rkidney_GT_*.png、lkidney_GT_*.png、spleen_GT_*.png
打包 ZIP CHAOS_Train_Sets.zip(890.8 MB)、CHAOS_Test_Sets.zip(1.1 GB)

§3.3b 文件命名与对应规则

对象 命名模式 对应规则
CT DICOM i0000,0000b.dcm(序号递增) 与 Ground/liver_GT_* 按序号对应,但社区复现发现疑似整体倒序(坑点 2)
CT 掩膜 liver_GT_000.png 起的三位数序号 与 CT 切片逐一对应,二值前景
MR T1-DUAL DICOM T1DUAL/DICOM_anon/inphase/ 与 T1DUAL/DICOM_anon/opphase/ 两个子目录 共用 T1DUAL/Ground/ 下同一套掩膜
MR T2-SPIR DICOM T2SPIR/DICOM_anon/ 使用 T2SPIR/Ground/ 下独立掩膜
MR 掩膜 {liver,rkidney,lkidney,spleen}_GT_*.png 四套 序列集内逐层与 DICOM 对应,多值灰度编码

§3.4 存储大小

  • 官方 Zenodo 发布:训练集 890.8 MB + 测试集 1.1 GB,合计约 2.0 GB(截至 2026-09 的 v1.03 记录)。
  • 转换为 NIfTI 并重采样后体积会有变化(压缩与位深不同),无官方数字,请以本地转换结果为准。
  • 生态规模参考:Zenodo 记录页显示全版本累计下载数据量 76.2 TB、32,316 次下载(截至 2026-09)。

§3.5 标注方式

人工标注。所有 2D 切片由 3 名放射学专家逐层手工勾画,最终形状经多数投票产生;面对特殊情况(如下腔静脉是否计入肝脏)由专家联合决定。这一"宁可慢也要一致"的流程是为产出可复用的共识金标准。CT 病例仅标注肝脏(与 CT 任务定位一致);MR 病例标注肝、右肾、左肾、脾四器官。

选择"逐层 2D 勾画 + 多数投票"而非单人 3D 勾画有两层考量:其一,2D 层面多数投票天然规避了不同专家层间错位导致的 3D 破碎面;其二,投票保留了轮廓的离散决策属性(每个体素要么在要么不在),使下游体积类指标(RAVD)的语义清晰。代价是 3D 表面可能存在轻微的层间锯齿,使用者在做表面距离指标时应理解这一误差来源。

§3.6 标注者资质与一致性

三位标注者分别有 10、12、28 年放射学经验,构成"中年资 + 高年资"梯度。官方采用多数投票而非平均轮廓,保留了轮廓的离散决策属性。官方材料未公布逐例的标注者间一致性系数(如 Dice-on-GT 或 kappa),使用者在关键应用中应自行做小规模复标注实验校准。

§3.7 采集周期

官方材料未公开逐例扫描日期。可核实的锚点为:数据以 v1.03 于 2019-04-11 在 Zenodo 发布;在线评测窗口为 2019-04-11 至论文统计截止的 2020-10-01;本条目 frontmatter 的 temporalCoverage 以 2019/2020 覆盖该发布与评测窗口。

两个事件时点可辅助理解采集与发布节奏:训练数据在 2019 年现场赛约三个月前发布供参赛者开发;测试数据在挑战当日仅提前 24 小时发放给现场参赛者,赛后才进入 Zenodo 公开渠道。

§3.8 地域覆盖

单中心:土耳其伊兹密尔(İzmir)Dokuz Eylül 大学医院。数据集描述中明确全部病例来自该院放射科,不存在多中心分层,跨中心泛化需外部验证(见 §7.3)。

§3.9 设备规格

MRI 设备为 1.5T Philips(输出 12-bit DICOM);CT 扫描仪型号官方材料未披露。对域适应研究而言,"单设备、单中心"意味着 CHAOS 训练的模型天然缺少设备多样性先验,跨设备迁移应作为独立实验设计。

12-bit 位深还有一层工程含义:MR 像素值动态范围与常见 8-bit 显示管线不同,读取时保持原始位深(pydicom 的 pixel_array 不会自动缩放)、在预处理里显式处理动态范围,可以避免"图像看起来正常、强度统计却错一档"的隐性错误。

§3.10 深度溯源链

环节 主体 说明
采集 Dokuz Eylül 大学医院放射科 土耳其伊兹密尔,常规临床流程
组织与标注 Kavur、Selver、Dicle、Barış、Gezer 等 + 3 名放射学专家 多数投票共识标注
发布 Zenodo(DOI 10.5281/zenodo.3362844,v1.03) 2019-04-11
持续评测 grand-challenge.org(CHAOS 官网) 在线提交通道持续开放
结果发表 Medical Image Analysis 69:101950(2021) DOI 10.1016/j.media.2020.101950
社区生态 开源脚本与数据集索引 jonasteuwen/chaos-challenge(转换参考实现)、openmedlab/Awesome-Medical-Dataset(第三方统计索引)

§4 数据结构

§4.0 目录树

CHAOS_Train_Sets.zip
└── Train_Sets/
    ├── CT/
    │   ├── 1/
    │   │   ├── DICOM_anon/            # CT 影像切片(i0000,0000b.dcm …)
    │   │   └── Ground/                # 肝脏掩膜(liver_GT_000.png …)
    │   ├── 2/
    │   └── …
    └── MR/
        ├── 1/
        │   ├── T1DUAL/
        │   │   ├── DICOM_anon/
        │   │   │   ├── inphase/       # T1 同相位 DICOM
        │   │   │   └── opphase/       # T1 反相位 DICOM(与 inphase 配准)
        │   │   └── Ground/            # 四器官掩膜 PNG(与 in/opphase 共用)
        │   └── T2SPIR/
        │       ├── DICOM_anon/        # T2-SPIR DICOM(未与 T1 配准)
        │       └── Ground/            # 四器官掩膜 PNG
        ├── 2/
        └── …

CHAOS_Test_Sets.zip
└── Test_Sets/
    ├── CT/{1,…}/DICOM_anon/           # 仅有影像,无 Ground(GT 永不公开)
    └── MR/{1,…}/{T1DUAL,T2SPIR}/DICOM_anon/

目录树要点:CT 与 MR 的患者目录都是纯数字命名;CT 病例没有序列子目录层,MR 病例则固定为 T1DUAL/T2SPIR 两层结构;Ground 只出现在训练集侧。

§4.1 DAIMS 数据字典

字段名 类型 说明 示例值 AI 用途 观测误差/陷阱 信息性缺失编码 取值范围
患者目录名 Integer 每名患者一个数字目录 1 患者级分组与交叉验证划分 CT 与 MR 各自成套编号,无跨模态同名患者 无 官方未公开完整编号清单
模态 Text CT 或 MR CT 决定预处理分支 CT 与 MR 强度语义完全不同(HU vs 相对信号) 无
序列 Text MR 子目录名 T1DUAL / T2SPIR MR 任务内分组 T1 与 T2 未配准,不可当同一 3D 体 无 {T1DUAL, T2SPIR}(CT 无此层)
相位 Text T1-DUAL 子目录 inphase / opphase 化学位移伪影研究、脂肪定量探索 in/opp 已配准且共享 GT,不可当独立样本翻倍 无 {inphase, opphase}(仅 T1DUAL)
DICOM 切片 DICOM 文件 单层影像 i0000,0000b.dcm 2D 切片训练的最小单元 MR 12-bit 位深,直接线性映射到 8-bit 会截断 无 CT 512×512;MR 256×256
DICOM 序列标识 UID SeriesInstanceUID 标识一个序列集 1.2.840.113619.… 开头的 UID 字符串 稳健的序列分组主键 UID 仅在单次导出内稳定,不可跨导出批次比较 无 DICOM UID 字符串
层内分辨率 Integer DICOM Rows/Columns 512(CT)/256(MR) 输入尺寸规划与显存估算 两模态分辨率不同,混合训练时需统一重采样 无
切片位置 Float ImagePositionPatient/SliceLocation 沿 z 轴递增的物理位置 体排序与层间距计算 文件名顺序与物理位置可能不一致,一律以位置排序 无 设备相关
层内间距 Float DICOM PixelSpacing 0.54-0.79 mm(CT) MSSD/ASSD 换算 mm 的必需参数 忘记按 spacing 重采样会让距离指标错数倍 无 CT 0.54-0.79;MR 0.72-2.03
层厚 Float DICOM SliceThickness 2.0-3.2 mm(CT) 3D 重采样目标分辨率 MR 层厚 4.4-8.0 mm,z 向重采样必须考虑 无 CT 2.0-3.2;MR 4.4-8.0
GT 掩膜(CT) PNG 肝脏二值掩膜 liver_GT_000.png CT 任务监督信号 掩膜切片顺序与 DICOM 疑似倒置(见坑点 2) 无 前景 1 / 背景 0
GT 掩膜(MR) PNG 四器官多值灰度掩膜 rkidney_GT_003.png MR 任务监督信号 灰度值 55/110/175/240 且有抗锯齿过渡值(见坑点 1) 无 {55, 110, 175, 240} 及过渡值
器官标签 Integer 掩膜灰度→器官 55=肝 多器官任务类别映射 直接以灰度为类别号会引入非法类别 无
测试集预测 NIfTI/PNG 序列 提交格式 按提交手册模板 在线评测输入 缺失 case 计 0 分并拉低总分(见坑点 5) 无 官方模板规定
患者人口学 — 官方仅发布队列级统计 年龄均值 44.85±11.29(CT) 偏倚分析 无个体级数据,不可做个体分层研究 无 见 §2.4

§4.2 标签分布

MR 掩膜的灰度值约定(源自官方掩膜编码,社区脚本按区间映射以兼容抗锯齿过渡值):

灰度值 器官 社区映射区间(兼容过渡值)
55 肝脏 55 < v ≤ 70 → 肝
110 右肾 110 < v ≤ 135 → 右肾
175 左肾 175 < v ≤ 200 → 左肾
240 脾脏 240 < v ≤ 255 → 脾
0 / 其余 背景 其余 → 背景

CT 掩膜为二值 PNG(肝脏前景)。四器官在 20 例 MR 训练集中均为 100% 覆盖(每例均有四器官标注)。

一个实践细节:由于过渡灰度的存在,"区间映射"比"精确值映射"更稳健,但区间端点的选择应以原始灰度峰值为锚(55/110/175/240),不要随意收紧或放宽区间;重采样后若发现掩膜类别面积异常变化,优先检查是否在映射前做了插值。

§4.3 关键统计

  • 训练集切片总数:11,496(CT 与两类 MR 序列合计;第三方 Awesome-Medical-Dataset 统计)。
  • 测试集侧:40 例患者(CT 20 + MR 20;MR 含 60 个序列集)仅有影像,无任何标签。
  • 体素间距(第三方统计,训练集):min (0.56, 0.56, 1.00)、median (0.69, 0.69, 1.60)、max (0.79, 0.79, 2.0) mm;体积尺寸 max (512, 512, 266)。
  • 器官体积统计(第三方统计,cm³,min/median/max):肝 7/341/1,367;右肾 81/734/1,471;左肾 75/898/1,711;脾 47/801/1,093。
  • 器官体积跨度极大(肝最小 7 cm³ vs 最大 1,367 cm³),提示训练集内存在切面范围差异,体积类指标(RAVD)评估时应逐例观察。

§4.4 数据层级

数据层级为:患者 →(模态)→ 序列集 → 切片。要点:① CT 与 MR 是不同患者,不存在"患者内跨模态"层级;② T1-DUAL 的 in/opphase 两目录属同一序列集、共享掩膜,是"序列集内配对层级";③ 每个 DICOM 切片与一张 GT PNG 按序号对应(CT 侧存在疑似倒序,见坑点 2)。任何按切片随机划分训练/验证集的做法都会打破该层级造成切片级泄漏——必须以患者(或至少序列集)为划分单位。

"共享 GT"在文件系统层面有直接体现:T1-DUAL 的 inphase 与 oppphase 是同一 T1DUAL 目录下的两个 DICOM 子目录,而 Ground 掩膜直接放在 T1DUAL/Ground/(不区分相位);T2SPIR 则拥有自己独立的 Ground 目录。因此加载器应以"患者×序列集(T1DUAL/T2SPIR)"为样本键,把 in/opp 作为同一样本的两个视图,而不是两个独立样本。

§4.5 缺失值与信息性缺失

缺失类型 范围 性质 处理建议
测试集 GT 全部 40 例测试患者的掩膜 结构性缺失(官方有意保留,永不公开) 经在线系统评测;本地实验以官方训练集自行再划分
CT 多器官标注 全部 CT 病例仅肝标注 设计性缺失(与 CT 任务定位一致) CT 上不可评估肾/脾分割
个体人口学 所有病例 未分发 队列级统计见 §2.4
标注者一致性数值 所有病例 官方未公布 需要时自行复标注估计

本数据集不存在"用特殊编码表示缺失"的场景(影像数据的缺失即文件不存在),无需信息性缺失值解码。唯一需要"解释性对待"的缺失是:CT 病例的肾/脾掩膜不存在属官方有意设计(CT 任务只评肝),统计多器官覆盖率时不要把 CT 子集计入"缺标注"分母。

§4.6 数据质量红线(读取校验清单)

读取管线建议内置以下断言,任何一条失败即中止并报警:

  1. 每个 CT 病例:DICOM 切片数 == 掩膜 PNG 数(不一致优先怀疑倒序/缺层)。
  2. 每个 MR 序列集:inphase 与 oppphase 切片数相等(配准关系成立的前提)。
  3. 掩膜 np.unique 落在 {0, 55, 110, 175, 240} 及其过渡区间内;出现其他大类别值立即报警。
  4. spacing/层厚在 DICOM 头内全序列一致(社区脚本中有对该约束的显式 assert)。
  5. 重采样后掩膜仅含 {0,1,2,3,4}(最近邻插值生效的证明)。

§5 划分与使用建议

§5.1 官方划分

官方将 CT 与 MRI 各分为 20 训练 + 20 测试,划分时以分辨率、层厚、患者年龄为分层标准,并确保训练集覆盖全库观测到的所有难度(CT 对比剂导致的 HU 范围变化、肝实质非均匀纹理、平面视图突变、MR 偏置场效应等)。训练集带 GT,测试集仅影像。

这套"先分层、再覆盖难度"的划分思路可以直接迁移到使用者的自定义复划分:先按层厚与器官体积把 20 例训练患者分桶,再在桶内轮流分配,即可得到分布均衡的 k 折。

§5.2 社区惯例划分

在线评测通道开放后,社区常见做法有三种:① 只用官方训练集做 k 折交叉验证(20 例样本量下常用 5 折);② 训练集内部再分出 2-4 例做验证;③ 直接把测试集当黑盒、经在线系统提交。由于官方测试集 GT 永不公开,任何"在测试集上调参"的行为只能通过多次提交间接实现——这正是挑战论文批评的 peeking 现象,实践中应避免。

§5.3 泄漏风险与划分策略建议

泄漏源 场景 严重程度 缓解
切片级随机划分 同一患者的相邻切片分入训练与验证 高 一律按患者级(或序列集级)划分
T1 in/opp 共享 GT 把 inphase 与 oppphase 当两个独立样本分别划入两侧 高 以序列集(患者×序列)为划分单位,in/opp 永远同侧
多提交偷看 反复向在线系统提交并按反馈调参 中 限制提交次数;论文已证明多次提交后的成绩含 peeking 成分
跨模态信息泄漏 用测试患者信息构造归一化统计 低 归一化参数仅从训练集估计

§5.4 交叉验证建议

20 例训练集建议 5 折患者级交叉验证并报告折间标准差;划分时保持各折间层厚与器官体积分布均衡(可用器官体积中位数分层)。若同时用 CT 与 MR 训练跨模态模型,注意 CT/MR 本就无患者重叠,混合后再交叉验证即可。

在线评测通道长期开放(截至 2026-09 仍可提交),这为纵向方法比较提供了同一把尺子;但应把提交当作稀缺资源规划——每次提交都应绑定代码版本与明确假设,避免退化为"用测试集调参"。一个务实的节奏:本地交叉验证收敛 → 冻结模型 → 一次性提交确认口径 → 之后仅在真正的方法迭代后提交。

§5.5 外部验证建议

内部 DICE 高不等于可迁移。建议至少在一个外部腹部数据集上验证:病理 CT(如 LiTS/MSD 肝脏子集,验证健康→病灶退化)、多器官 CT(如 BTCV/AMOS,验证器官泛化)、外中心 MR(任何外院 T1/T2 腹部序列,验证单中心偏倚)。评测应同时报告 DICE 与 MSSD/ASSD,理由见坑点 7。

§5.6 在线评测提交检查单

检查项 要求 不满足的后果
case 覆盖 输出全部测试 case 缺失 case 计 0 分并计入总分
格式 按官方提交手册与模板(PNG 序列等) 评测服务器解析失败
命名 目录/文件名与官方模板一致 无法匹配 case 记 0
指标口径 提交前用官方 CHAOS-evaluation 自检 本地与在线分数口径不一致
提交频次 每次提交记录代码版本与动机 多次提交引入 peeking 嫌疑

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

数据在 Zenodo 公开托管,任何带外网的 Linux 环境均可直接拉取(无需注册、无 token):

# 约需 2 GB 磁盘;Zenodo 支持断点续传
wget -c "https://zenodo.org/records/3431873/files/CHAOS_Train_Sets.zip?download=1" -O CHAOS_Train_Sets.zip
unzip -q CHAOS_Train_Sets.zip   # 得到 Train_Sets/{CT,MR}

Colab/Kaggle 上可直接运行上述命令;Grand Challenge 平台则用于在线提交评测(见 §6.2)。Kaggle 用户可将两个 ZIP 以 Dataset 形式导入工作区避免重复下载;Colab 建议把解压结果放在 Google Drive 挂载目录,防止临时盘回收。

§6.1 快速上手:读取一例并可视化

# 预期目录结构(data_root 下):
#   Train_Sets/CT/{1..N}/DICOM_anon/*.dcm + Ground/liver_GT_*.png
#   Train_Sets/MR/{1..N}/T1DUAL/DICOM_anon/{inphase,opphase}/*.dcm + Ground/*.png
#   Train_Sets/MR/{1..N}/T2SPIR/DICOM_anon/*.dcm + Ground/*.png
# data_root 即解压后的 Train_Sets 所在目录;下面用一例 MR T2-SPIR 做最小可用子集演示。
import glob, os
import numpy as np
import pydicom
from PIL import Image

DATA_ROOT = "Train_Sets/MR/1/T2SPIR"
dcm_files = sorted(glob.glob(os.path.join(DATA_ROOT, "DICOM_anon", "*.dcm")))
gt_files = sorted(glob.glob(os.path.join(DATA_ROOT, "Ground", "*.png")))

vol = np.stack([pydicom.dcmread(f).pixel_array.astype(np.float32) for f in dcm_files])  # (D, H, W)
mask = np.stack([np.array(Image.open(f)) for f in gt_files])                             # (D, H, W) 灰度: 55/110/175/240
print("volume:", vol.shape, "mask unique:", np.unique(mask)[:8])

最小可用子集:一例 T2SPIR(约 30-50 张切片)即可跑通读取→映射→训练全链路。

CT 变体的最小读取(注意 GT 翻转校验,详见坑点 2):

# CT 一例的最小读取示例;data_root 为解压后的 Train_Sets 目录
import glob, os
import numpy as np
import pydicom
from PIL import Image

CT_ROOT = "Train_Sets/CT/1"
dcm_files = sorted(glob.glob(os.path.join(CT_ROOT, "DICOM_anon", "*.dcm")))
gt_files = sorted(glob.glob(os.path.join(CT_ROOT, "Ground", "liver_GT_*.png")))
vol = np.stack([pydicom.dcmread(f).pixel_array for f in dcm_files])
gt = np.stack([np.array(Image.open(f)) for f in gt_files])
assert vol.shape[0] == gt.shape[0], "切片数不一致:优先排查掩膜倒序与缺层"
print(vol.shape, gt.shape, np.unique(gt))   # CT 掩膜为二值(肝=1)

§6.2 数据获取

项 内容
下载页 https://chaos.grand-challenge.org/Download/(指向 DOI 10.5281/zenodo.3362844)
直接地址 https://zenodo.org/records/3431873
文件 CHAOS_Train_Sets.zip(890.8 MB,含 GT);CHAOS_Test_Sets.zip(1.1 GB,无 GT)
校验 官方提供 MD5:训练包 df21053002a1cc86df918a87da3b2c19;测试包 da6efc17118d7375654ab268473a5555
版本 v1.03(2019-04-11);另有 v1.0-v1.02 历史版本记录,concept DOI 统一指向 10.5281/zenodo.3362844
申请流程 无需注册直接下载;在线评测需在 grand-challenge.org 注册并 Join CHAOS
许可 CC BY-NC-SA 4.0:署名 + 相同方式共享 + 非商业
提交材料 按官方 CHAOS_Submission_Manual 与模板打包预测结果上传

注册与提交流程:① 在 grand-challenge.org 注册账号并 Join CHAOS 挑战;② 按手册整理预测输出(PNG 序列,覆盖全部测试 case);③ 按官方模板打包 ZIP;④ 在对应 Task 页上传;⑤ 等待服务器自动评测,在 Results 页查看分数。全程无人工评审环节,分数即提交质量的第一反馈。

§6.3 预处理全流程

核心三步:掩膜灰度映射 → 体重建与属性对齐 → 重采样标准化。

# 第 1 步:MR 掩膜灰度值 → 器官类别 ID(0 背景 / 1 肝 / 2 右肾 / 3 左肾 / 4 脾)
# 必须用区间映射吸收抗锯齿过渡灰度,不能直接用 == 判断(见坑点 1)
import numpy as np

def map_mr_mask(gray: np.ndarray) -> np.ndarray:
    out = np.zeros_like(gray, dtype=np.uint8)
    out[(gray > 55) & (gray <= 70)] = 1    # liver
    out[(gray > 110) & (gray <= 135)] = 2  # right kidney
    out[(gray > 175) & (gray <= 200)] = 3  # left kidney
    out[(gray > 240) & (gray <= 255)] = 4  # spleen
    return out
# 第 2 步:DICOM 切片 → SimpleITK 3D 体(继承 spacing/origin/direction)
# 第 3 步:统一重采样到目标 spacing(建议 1.0×1.0×1.0 mm),CT 窗位/归一化分开处理
import glob, os
import SimpleITK as sitk

def build_volume(dcm_dir: str) -> sitk.Image:
    files = sorted(glob.glob(os.path.join(dcm_dir, "*.dcm")))
    reader = sitk.ImageSeriesReader()
    reader.SetFileNames(files)          # 按 DICOM 内部位置排序,避免文件名顺序陷阱
    return reader.Execute()

def resample(img: sitk.Image, spacing=(1.0, 1.0, 1.0)) -> sitk.Image:
    rs = sitk.ResampleImageFilter()
    rs.SetOutputSpacing(spacing)
    rs.SetSize([int(s * o / n) for s, o, n in
                zip(img.GetSize(), img.GetSpacing(), spacing)])
    rs.SetOutputOrigin(img.GetOrigin()); rs.SetOutputDirection(img.GetDirection())
    rs.SetInterpolator(sitk.sitkLinear)
    return rs.Execute(img)
# 掩膜重采样请改用 sitkNearestNeighbor,避免类别插值出非法值。

清洗与标准化要点:CT 用 HU 语义(体数据内即 HU,可加窗到肝窗范围),MR 强度无标准标尺,建议按序列分别做 z-score 或 0-99.5 百分位裁剪后再归一化;数据增强阶段对 T1 in/opphase 必须施加完全相同的空间变换(见坑点 3)。

CT 侧归一化示例(保留 HU 语义的窗内线性变换):

# CT 归一化示例:肝窗范围内线性裁剪,把增强限制在临床相关动态范围
import numpy as np

def ct_window(vol: np.ndarray, lo: float = -100.0, hi: float = 250.0) -> np.ndarray:
    # 门静脉期肝实质与增强血管的主要 HU 动态范围,可按任务微调窗宽窗位
    return np.clip((vol - lo) / (hi - lo), 0.0, 1.0).astype(np.float32)

§6.4 PyTorch DataLoader 完整代码

<details>
<summary>展开完整 Dataset + DataLoader 代码(约 60 行)</summary>

# CHAOS MR 四器官分割 Dataset:患者级 3D 读取 + 掩膜映射 + 患者级划分
# 目录预期:root/MR/{patient}/{T1DUAL,T2SPIR}/... ;此处以 T2SPIR 单序列演示
import glob, os, random
import numpy as np
import pydicom
import SimpleITK as sitk
import torch
from torch.utils.data import Dataset, DataLoader
from PIL import Image

ORGAN_MAP = {1: "liver", 2: "right_kidney", 3: "left_kidney", 4: "spleen"}

class ChaosMrDataset(Dataset):
    def __init__(self, root: str, patient_ids, target_spacing=(1.0, 1.0, 1.0)):
        self.root, self.ids, self.spacing = root, list(patient_ids), target_spacing

    def _resample(self, img: sitk.Image, is_mask: bool) -> sitk.Image:
        rs = sitk.ResampleImageFilter()
        rs.SetOutputSpacing(self.spacing)
        rs.SetSize([round(s * o / n) for s, o, n in
                    zip(img.GetSize(), img.GetSpacing(), self.spacing)])
        rs.SetOutputOrigin(img.GetOrigin()); rs.SetOutputDirection(img.GetDirection())
        rs.SetInterpolator(sitk.sitkNearestNeighbor if is_mask else sitk.sitkLinear)
        return rs.Execute(img)

    def __len__(self):
        return len(self.ids)

    def __getitem__(self, idx):
        pid = self.ids[idx]
        seq_dir = os.path.join(self.root, "MR", str(pid), "T2SPIR")
        # 用 ImageSeriesReader 按 DICOM 几何排序,规避文件名顺序问题
        reader = sitk.ImageSeriesReader()
        reader.SetFileNames(reader.GetGDCMSeriesFileNames(
            os.path.join(seq_dir, "DICOM_anon")))
        vol = self._resample(reader.Execute(), is_mask=False)
        gt_files = sorted(glob.glob(os.path.join(seq_dir, "Ground", "*.png")))
        gray = np.stack([np.array(Image.open(f)) for f in gt_files])
        gray = self._resample(sitk.GetImageFromArray(gray.astype(np.uint8)), is_mask=True)
        vol_np = sitk.GetArrayFromImage(vol).astype(np.float32)
        msk_np = sitk.GetArrayFromImage(gray)
        # MR 归一化:1-99 百分位裁剪 + 缩放(逐序列,不用全局统计)
        lo, hi = np.percentile(vol_np, (1, 99))
        vol_np = np.clip((vol_np - lo) / max(hi - lo, 1e-6), 0, 1)
        msk_np = ((msk_np > 55) & (msk_np <= 70)) * 1 \
               + ((msk_np > 110) & (msk_np <= 135)) * 2 \
               + ((msk_np > 175) & (msk_np <= 200)) * 3 \
               + ((msk_np > 240) & (msk_np <= 255)) * 4
        return (torch.from_numpy(vol_np[None]),                     # (1, D, H, W)
                torch.from_numpy(msk_np.astype(np.int64)))          # (D, H, W)

def patient_split(root: str, n_total: int, val_ratio: float = 0.2, seed: int = 0):
    pids = list(range(1, n_total + 1)); random.Random(seed).shuffle(pids)
    n_val = max(2, round(n_total * val_ratio))
    return pids[n_val:], pids[:n_val]   # 患者级划分,杜绝切片泄漏

if __name__ == "__main__":
    root = "Train_Sets"
    tr, va = patient_split(root, n_total=20)
    dl = DataLoader(ChaosMrDataset(root, tr), batch_size=1, num_workers=2)
    vol, msk = next(iter(dl))
    print(vol.shape, msk.shape, torch.unique(msk))  # 检查类别 {0,1,2,3,4}

</details>

跨模态任务(Task 1/4)的混合训练骨架——CT 与 MR 统一接口、模型不感知模态来源:

<details>
<summary>展开跨模态混合训练 Dataset 骨架(约 25 行)</summary>

# 跨模态混合训练骨架(Task 1/4 设定):同一系统处理 CT 与 MR,不告知模型模态
# 关键差异:CT 用 HU 窗归一化、仅肝二值标签;MR 按序列百分位归一化、四类别标签
import numpy as np
import torch

class ChaosCrossModal(torch.utils.data.Dataset):
    def __init__(self, ct_items, mr_items):
        # ct_items: [(vol(HU), mask{0/1}), ...];mr_items: [(vol, mask{0..4}), ...]
        self.items = [("ct", x) for x in ct_items] + [("mr", x) for x in mr_items]

    def __len__(self):
        return len(self.items)

    def __getitem__(self, i):
        mod, (vol, msk) = self.items[i]
        if mod == "ct":
            vol = np.clip((vol + 100.0) / 350.0, 0, 1)   # HU 窗 [-100, 250]
            msk = (msk > 0).astype(np.int64)             # CT 仅肝二值
        else:
            lo, hi = np.percentile(vol, (1, 99))         # MR 逐序列归一化
            vol = np.clip((vol - lo) / max(hi - lo, 1e-6), 0, 1)
            msk = msk.astype(np.int64)                   # MR 保持 {0..4}
        return torch.from_numpy(vol[None].astype(np.float32)), torch.from_numpy(msk)
# 说明:做 Task 1(仅肝跨模态)时,把 MR 标签 2-4 映射为背景即可共用同一输出头。

</details>

§6.5 八大坑点

⚠️ 坑点 1:MR 掩膜灰度值不是 0/1/2/3/4,而是 55/110/175/240(分类:标签理解)

问题:CHAOS 的 MR 分割掩膜 PNG 用非连续灰度值编码器官(肝 55、右肾 110、左肾 175、脾 240),且轮廓处存在抗锯齿产生的过渡灰度;若直接把灰度当类别号或用 == 判等,会丢掉大量边界像素并引入非法类别。
症状:训练损失不收敛或类别分布诡异;可视化时器官轮廓"缺一圈";np.unique 出现大量非预期灰度值。
解决:

  1. 简单方法:按区间映射:(55,70]→肝、(110,135]→右肾、(175,200]→左肾、(240,255]→脾,其余为背景(与社区转换脚本一致)。
  2. 进阶方法:先统计每张掩膜的 np.unique,确认四个主峰与过渡带后,用"最近主峰归属"策略处理过渡值,再重采样(掩膜一律用最近邻插值)。
  3. SOTA 方法:将掩膜转 NIfTI 前先在原始分辨率上完成映射,重采样放在映射之后,避免过渡值被插值放大。
    参考:https://github.com/jonasteuwen/chaos-challenge/blob/master/build_chaos_dataset.py (区间映射源头实现)

⚠️ 坑点 2:CT 掩膜切片顺序与 DICOM 影像疑似倒置(分类:工程陷阱)

问题:社区复现中发现 CT 病例的 Ground/liver_GT_*.png 序列顺序与 DICOM_anon 切片顺序呈上下翻转关系,直接按文件名序号配对会让肝脏掩膜对到身体另一端的切片上。
症状:CT 任务训练损失正常下降但验证 DICE 接近 0;叠加显示影像与掩膜时解剖位置明显错位(掩膜"飘"在腹腔外)。
解决:

  1. 简单方法:对每个 CT 病例做一次视觉校验(ITK-SNAP 叠加显示);若确认翻转,将掩膜序列 [::-1] 后再配对。
  2. 进阶方法:不按文件名排序,改用 SimpleITK ImageSeriesReader.GetGDCMSeriesFileNames 按 DICOM 几何位置排序影像,再用翻转后的掩膜一一对应,并在代码中保留断言(切片数必须相等)。
  3. SOTA 方法:批量脚本中自动校验每例的掩膜-影像重叠率(前景占比、质心距离),对异常病例报警,防止个别病例静默错位污染训练集。
    参考:https://github.com/jonasteuwen/chaos-challenge/blob/master/build_chaos_dataset.py (源码注释 “they seem to be flipped”)

⚠️ 坑点 3:T1-DUAL 同/反相位共享同一份 GT,且未与 T2 配准(分类:数据泄漏)

问题:官方明确 T1-DUAL 的 inphase 与 oppphase 已配准、共享同一掩膜;T1 与 T2 之间未配准。把 in/opp 当作两个独立样本统计或划分,会虚增样本量并造成两折间信息重复;把 T1 掩膜直接挪给 T2 使用则完全是错误标注。
症状:交叉验证折间分数异常接近;用 T1 GT 评 T2 模型时 DICE 异常低且轮廓系统性错位。
解决:

  1. 简单方法:划分、统计、增强一律以"患者×序列集"为单位;in/opp 永远绑在同一侧。
  2. 进阶方法:对 in/opp 组做联合增强(同一随机参数同时作用于两个相位输入,符合官方允许的"同一系统处理 T1 双相位"设定);T2 单独建立样本索引。
  3. SOTA 方法:利用 in/opp 配对特性构建双通道输入或化学位移伪影一致性正则,把"共享 GT"从负担变成信号。
    参考:https://arxiv.org/html/2001.06535v2 (挑战论文 3.1.2 节数据规格)

⚠️ 坑点 4:CT 与 MR 来自不同患者,不存在配对关系(分类:预处理陷阱)

问题:数据集名字里的 “Combined” 容易让人误以为 CT/MR 是同患者配对数据;实际两模态来自完全不同的患者(论文自称 unpaired cross-modality dataset)。据此做配对训练、循环一致性图像翻译或跨模态逐体对比都是无效实验。
症状:pix2pix/CycleGAN 类配对训练崩溃或不收敛;"同一患者 CT vs MR"的对比分析无法开展。
解决:

  1. 简单方法:跨模态任务按官方 Task 1 定义做"单系统跨模态分割"(混合训练集 + 不告知模型模态来源),而非配对生成。
  2. 进阶方法:图像翻译研究采用非配对框架(CycleGAN/CUT 类),并在论文中明确声明 unpaired 属性。
  3. SOTA 方法:用解剖先验(器官形状/位置约束)替代逐像素配对监督,在 unpaired 条件下约束翻译一致性。
    参考:https://www.sciencedirect.com/science/article/abs/pii/S1361841520303145 (挑战论文数据描述)

⚠️ 坑点 5:测试集 GT 永不公开,且缺失 case 计 0 分(分类:评估误用)

问题:40 例测试患者的金标准由官方保留用于挑战评测、声明"永不公开";官方评分中缺失 case 记 0 分并计入总分。本地"测试集自评"不存在,而提交时哪怕只漏了几个 case,总分也会被 0 分大幅拉低。
症状:本地训练集内调出的高分在排行榜上大幅缩水;提交后分数远低于预期却找不到原因(往往是缺 case 或格式不符)。
解决:

  1. 简单方法:本地实验以官方训练集自行划分验证集;提交前用官方评测代码(CHAOS-evaluation)离线自检格式完整性。
  2. 进阶方法:按官方提交模板逐 case 校验文件数与命名,写 CI 脚本保证"40 例全量输出"。
  3. SOTA 方法:把"缺 case 计 0"纳入训练管线的冒烟测试——任何网络异常时降级输出空预测而非缺文件。
    参考:https://chaos.grand-challenge.org/Download/ ;https://github.com/emrekavur/CHAOS-evaluation

⚠️ 坑点 6:距离指标必须按 DICOM 元数据换算毫米,像素距离会错数倍(分类:评估误用)

问题:ASSD/MSSD 的临床含义建立在物理毫米之上;官方明确距离类指标要依据 DICOM 元数据(pixel spacing、image position、image orientation)仿射换算。CT 与 MR 的面内间距(0.54-0.79 vs 0.72-2.03 mm)与层厚(2.0-3.2 vs 4.4-8.0 mm)差异巨大,直接在像素空间算距离毫无可比性。
症状:自算 MSSD 与官方分数对不上;CT 与 MR 的"像素距离"量级相近但物理距离差近一倍,导致错误结论。
解决:

  1. 简单方法:从 SimpleITK/DICOM 读取 spacing 后在物理空间计算表面距离(sitk.HausdorffDistanceImageFilter 等)。
  2. 进阶方法:重采样到各向同性 1 mm 网格后再算,并把 spacing 信息随预测一起保存,保证复现一致。
  3. SOTA 方法:直接复用官方 CHAOS-evaluation 的 MATLAB/Python/Julia 实现,保证与排行榜完全同源。
    参考:https://ar5iv.arxiv.org/html/2001.06535 (评测章节);https://github.com/emrekavur/CHAOS-evaluation

⚠️ 坑点 7:只报 DICE 会严重高估临床可用性——官方四指标各有 0 分阈值(分类:评估误用)

问题:CHAOS 评测把 DICE、RAVD、ASSD、MSSD 分别映射到 0-100 分并设定资格阈值(DICE≤0.8、RAVD≥5%、ASSD≥15 mm、MSSD≥60 mm 得 0 分),缺失 case 计 0。官方结果证明单模态肝分割 DICE 已 0.95-0.98 而 MSSD 仍约 21 mm:重叠指标饱和掩盖了边界误差。
症状:论文里 DICE 0.98 的模型,在供肝体积评估场景因边界/体积误差被判不可用;自评分数与官方综合分差距大。
解决:

  1. 简单方法:一律并行报告 DICE + RAVD + ASSD + MSSD 四项,按官方阈值给出综合分。
  2. 进阶方法:复现官方 0-100 映射(阈值内线性映射、阈值外 0 分),对逐例分数画分布而非只报均值。
  3. SOTA 方法:在自建验证集上把"专家间一致性"作为及格线的思想迁移过去——先测标注者间差异,再给算法定验收阈值。
    参考:https://ar5iv.arxiv.org/html/2001.06535 (评分系统与阈值表)

⚠️ 坑点 8:许可证为 CC BY-NC-SA 4.0(非商业 + 相同方式共享),与部分论文表述不一致(分类:工程陷阱)

问题:官方下载页明确数据按 Attribution-NonCommercial-ShareAlike 4.0 International 许可;而挑战论文正文一处写作 “CC-BY-SA 4.0”。以 NC 条款为准意味着:商业产品使用该数据(或其衍生标注)需要另行授权;分发衍生数据必须以相同许可共享并注明修改。
症状:产品化路径中被合规审查卡住;把 CHAOS 衍生数据并入商业训练集后遭遇许可冲突。
解决:

  1. 简单方法:科研与评测场景直接使用并按官方 Publications 页引用三篇指定文献即可。
  2. 进阶方法:商业项目评估替代数据源(如自采或商业授权数据),或联系版权方获取商业授权书面文件。
  3. SOTA 方法:企业内部建立数据许可台账,把"Zenodo 许可字段 + 官方 Download 页声明"双重记录,避免单点引用出错。
    参考:https://chaos.grand-challenge.org/Download/ ;https://chaos.grand-challenge.org/Publications

§6.6 数据增强

分模态的增强安全边界:

增强操作 CT MR T1-DUAL(in/opp) MR T2-SPIR
随机左右翻转 ✅(CT 无肾标注,无标签交换问题) ❌ 须同步交换左右肾标签 ❌ 同左
同参数空间变换(旋转/缩放/平移) ✅ ✅ in/opp 必须同一参数 ✅
随机 gamma/对比度 ⚠️ 窗内进行,保留 HU 语义 ✅ ✅
弹性形变 ✅ 小幅 ✅ 小幅且对 in/opp 同参数 ✅
强度域随机化(模拟设备差异) ⚠️ 谨慎 ✅ 有助跨序列稳健 ✅
  • 安全 ✅ 总则:几何增强对 in/opp 相位组施加同一参数;掩膜永远最近邻插值;CT 的强度类增强在肝窗内进行。
  • 危险 ❌ 总则:对 T1 in/opp 相位施加不同空间变换(破坏配准);对掩膜使用线性/双线性插值(产生非法类别);跨模态强度迁移增强后混入单模态训练而不告知模型。
  • 官方对提交者的增强策略统计显示,成功方法普遍采用旋转/平移/缩放类几何增强与非线性强度变换,未见"危险增强"被高分方法采用。

§6.7 模型推荐

模型 推荐场景 依据
nnU-Net(自配置框架) 首选基线,单模态与多器官任务 Task3 在线冠军(75.10±7.61),无需手动调参
Attention U-Net 及其改版 单器官(肝)任务 Task1 现场冠军 OvGUMEMoRIAL 采用其改版(PReLU + 多尺度金字塔)
经典 U-Net 变体 快速消融实验 挑战中除一支队伍外全员为 U-Net 变体,社区复现资源最多
集成(多模型融合) 冲榜/稳定性 nnU-Net 与 MedianCHAOS 均为集成方法,官方确认其有效性
跨模态单系统 Task 1/4 研究性任务 官方规则禁止模态间独立模型融合,需共享模块的统一系统
半自动/交互式方法 临床对照与边界精修 官方对比研究显示交互式方法在边界类指标上可优于纯深度模型

选型提示:挑战论文的消融结论明确指出,多数队伍在"单器官专用"与"多任务全器官"之间的差异约 5%,且部分多器官版本反而更稳——为单一临床器官做产品时不要默认多任务模型更优,应在该器官的验证集上单独对比后决策。

§6.8 硬件需求

场景 最低配置 建议配置
2D 切片训练(U-Net 类) 1× GPU 8 GB 显存 1× GPU 11-16 GB
3D 体训练(nnU-Net 默认 patch) 1× GPU 11 GB 1× GPU 24 GB(A100/4090 级)
5 折交叉验证 + 集成 单卡串行数天 多卡并行或分折调度
数据预处理 CPU 8 GB 内存 CPU 32 GB(3D 重采样峰值内存较大)
2D 切片级推理/教学演示 CPU 或 1× GPU 4 GB 1× GPU 8 GB

说明:数据总量仅约 2.0 GB,瓶颈在 3D 重采样与训练算力而非存储。教学场景下,一例 T2SPIR 序列(约 30-50 层)即可完成从读取到训练的全部演示,笔记本 CPU 亦可在分钟级完成预处理。

§6.9 评估指标代码

<details>
<summary>展开 DICE / RAVD / ASSD / MSSD 与官方阈值评分实现(约 45 行)</summary>

# 与官方四指标一致的简化实现(物理空间,输入为 SimpleITK 图像或 numpy+spacing)
import numpy as np

def _surfacedistances(pred: np.ndarray, gt: np.ndarray, spacing):
    from scipy.ndimage import distance_transform_edt
    d_pred = distance_transform_edt(~pred, sampling=spacing)
    d_gt = distance_transform_edt(~gt, sampling=spacing)
    return d_pred[gt], d_gt[pred]   # gt→pred 与 pred→gt 两个方向

def dice(pred: np.ndarray, gt: np.ndarray) -> float:
    inter = np.sum(pred & gt)
    return 2 * inter / max(np.sum(pred) + np.sum(gt), 1)

def ravd(pred: np.ndarray, gt: np.ndarray) -> float:
    return abs(np.sum(pred) - np.sum(gt)) / max(np.sum(gt), 1) * 100.0  # %

def assd_mssd(pred: np.ndarray, gt: np.ndarray, spacing) -> tuple:
    a, b = _surfacedistances(pred.astype(bool), gt.astype(bool), spacing)
    if a.size == 0 or b.size == 0:
        return float("inf"), float("inf")
    return float((a.sum() + b.sum()) / (a.size + b.size)), float(max(a.max(initial=0), b.max(initial=0)))

def chaos_score(dice_v: float, ravd_v: float, assd_v: float, mssd_v: float) -> dict:
    # 官方阈值:超阈值直接 0 分;阈值内线性映射到 [0,100]
    def linear(x, best, thresh):  # best=满分值, thresh=零分线
        if x >= thresh: return 0.0
        return 100.0 * (1.0 - (x - best) / (thresh - best))
    s_dice = 100.0 if dice_v > 0.8 else 0.0 if dice_v <= 0.0 else (dice_v - 0.0) / 0.8 * 100.0
    return {
        "DICE": min(100.0, s_dice),
        "RAVD": linear(ravd_v, 0.0, 5.0),
        "ASSD": linear(assd_v, 0.0, 15.0),
        "MSSD": linear(mssd_v, 0.0, 60.0),
    }
# 注:生产环境请直接使用官方实现对齐排行榜口径:
# https://github.com/emrekavur/CHAOS-evaluation

使用说明:上述实现的要点是把"距离换算到物理毫米"与"资格阈值评分"分开——前者决定数值是否正确,后者决定分数是否可比。自检方式:用一份训练集 GT 同时作为预测与真值跑一遍,四指标应得到满分;再对预测施加已知幅度的形变,观察各指标的变化方向是否与官方论文描述一致。

</details>

§6.10 MLOps 笔记

  • 版本锚定:数据用 Zenodo v1.03(DOI 10.5281/zenodo.3362844)锁定;在实验配置中记录 MD5(训练包 df21053002a1cc86df918a87da3b2c19)。
  • 可复现划分:患者级划分种子入库(见 §6.4 patient_split),任何"顺手重新划分"都需登记。
  • 评测口径:所有对外报告的分数必须来自官方 CHAOS-evaluation 实现或与官方阈值评分对齐的包装器,防止"自算 DICE 0.98"与官方综合分混淆。
  • 在线提交纪律:把在线评测当作 scarce resource——记录每次提交的代码版本与动机,避免论文批评的 peeking 行为。
  • 合规卡点:CI 中加入许可证检查(CC BY-NC-SA 4.0),衍生数据集出库前确认署名 + 相同方式共享 + 非商业三要素。
  • 数据血缘:把"原始 ZIP → 解压 → 掩膜映射 → NIfTI"的每一步脚本与版本提交到代码库;任何一次再划分都要有对应 commit 与配置快照。
  • 监控口径:训练侧监控四指标而非仅 DICE;数据侧监控 spacing/层厚分布直方图,及时捕捉读入错误或外部数据混入。
  • 失败模式演练:把"缺 case 计 0 分"“掩膜倒序”"灰度未映射"三个已知事故做成单元测试用例,任何管线改动后回归验证。
  • 文档同步:模型卡中固定引用本条目的 §3 规格(spacing、层厚、划分)与 §7.1 偏倚清单,避免下游团队重复整理或误述数据属性。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解
单中心偏倚 全部 80 例来自 Dokuz Eylül 大学医院,设备与扫描协议单一 高 外部多中心验证;跨中心微调
健康人群偏倚 全部为无病灶健康器官,无肿瘤/转移/囊肿 高 病理任务需换用 LiTS/MSD 等病灶数据集验证
CT/MR 队列失配 CT 队列均值 44.85±11.29 岁,MR 队列 54.60±14.25 岁,年龄构成差异约 10 岁 中 跨模态结论解读时考虑人群差异
规模偏倚 每模态仅 20 例训练,统计功效有限 中 5 折交叉验证 + 报告折间方差;谨慎做复杂模型比较
种族信息缺失 官方未披露种族构成 中 公平性评估受限;跨人群泛化需自证

§7.2 标注质量

金标准由 10/12/28 年经验的三名放射学专家多数投票产生,特殊情形(IVC 归属等)联合决定,并形成显式规则(IVC 体素一般不计入肝脏)。官方未公布逐例标注者间一致性数值——这是数据集透明度的已知缺口;对体积测量类下游应用,建议自行复标注估算观察者间差异,再设定算法验收线(官方评分阈值即以专家间一致性为依据设计的思路)。

复标注的最小可行方案:请一名放射学医师对随机抽取的 5-10 个训练病例独立重勾,计算其与官方 GT 的 DICE 与 MSSD——这一小实验既能量化观察者间基线,也能顺带验证你对掩膜读取与排序的正确性(坑点 1/2 的自检)。

§7.3 泛化性风险

部署场景 失效风险 证据
病理腹部(肿瘤/术后) 高:健康解剖先验可能失效 数据集定义即排除病灶(官方摘要)
跨中心 CT/MR 高:单中心单设备协议 采集地单一(§3.8/§3.9)
跨模态单系统(CT+MR 同模型) 高:官方实测 DICE 从 0.98/0.95 降至 0.88(肝)与 0.85(全器官) 挑战论文摘要
1.5T 以外场强/新序列 中:MR 强度无标准化 挑战论文对 MR 无 HU 标准化的讨论
边界敏感场景(手术切缘) 中:MSSD 实测约 21 mm 量级 挑战论文结果
大规模预训练语料场景 中:每模态仅 20 例训练 数据规模本身(§3.2)

§7.4 伦理

影像以原始 DICOM 格式分发,唯一修改是移除患者相关信息(匿名目录 DICOM_anon)。数据为健康受试者常规临床采集,Zenodo 公开获取。官方材料未公开伦理审批编号等细节;使用者开展二次研究时应依据自身机构的伦理要求评估(公开去标识数据的豁免条件因法域而异)。测试集金标准永不公开的安排同时服务于评测公平与受试者数据最小暴露。

两点延伸提示:其一,"仅移除 DICOM 患者信息"意味着影像本身(解剖内容)仍可能被熟悉该病例的人识别,二次分发衍生标注时应保持同等的去标识化强度;其二,CC BY-NC-SA 的"相同方式共享"条款会传染到衍生标注数据,构建合并数据集时需逐源核查许可兼容性。

§7.5 公平性

可用人口学信息仅限队列级年龄与性别(CT:22 男/18 女;MR:23 男/17 女),无种族、社会经济与地域多样性记录,无法开展细粒度公平性审计。跨性别比例尚均衡;但单中心样本使"人群代表性"这一维度天然不足,向其他人群迁移时应补充外部验证并报告分层性能。

对公平性敏感的应用(如面向不同人群的筛查产品),建议的补强路径:先在外部多中心数据上复算器官体积分布,确认与 CHAOS 第三方统计(§4.3)无系统性偏移;再按性别/年龄段报告分割性能差异;最后把"单中心、健康人群"的局限写入模型卡与用户文档。

§7.6 数据漂移

数据冻结于 2019 年发布版本(v1.03 后无更新),不存在动态版本漂移问题;真正的漂移风险在"部署侧":2019 年的 1.5T MR 协议与当代临床影像(更高场强、重建算法、薄层 CT)之间存在采集协议漂移。长期维护的模型应建立输入影像协议监控(层厚、间距、序列参数直方图),漂移告警后再决定是否增量微调。

监控对象 指标 告警思路
输入影像协议 层厚/面内间距分布 相对训练分布出现系统性偏移即告警
强度分布 CT HU 直方图;MR 归一化后统计量 分布检验显著偏离训练分布
输出质量 验证集 MSSD 滚动均值 连续多批上升即触发复检
评测一致性 本地验证分与在线评测分差 差距异常扩大提示口径漂移

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ⚠️ 影像数据集无宽格式表;元数据需从 DICOM 头自行提取
2 唯一标识 ✅ 患者编号 + 序列 + 切片文件名层级唯一
3 特殊字符 ✅ 文件名与目录均为 ASCII 数字命名
4 重复行 ⚠️ T1 in/opp 共享 GT 属有意设计,统计时需按序列集去重
5 缺失编码 ⚠️ 测试集 GT 结构性缺失(官方保留)
6 标签标识 ⚠️ MR 掩膜灰度 55/110/175/240 非常规类别 ID,需映射
7 罕见类分组 ✅ 四器官在训练集中均为每例全标注,无罕见类
8 偏倚评估 ⚠️ 官方披露单中心/健康人群属性,但无系统偏倚量化
9 数据字典 ⚠️ 有 Submission Manual 说明文档,无机器可读数据字典
10 信息性缺失解释 ✅ 测试集 GT 保留规则官方明确声明
11 设备记录 ⚠️ MRI 设备已知(1.5T Philips),CT 设备型号未披露
12 共线性 ✅ 不适用(非表格型数据)
13 编码映射 ⚠️ 掩膜灰度→器官映射依赖社区约定,官方文档含提交模板
14 时间戳处理 ✅ 静态影像数据,不涉及时序字段
15 划分建议 ✅ 官方 20/20 划分 + 分层标准公开透明
16 泄漏讨论 ⚠️ 论文专章讨论提交侧 peeking;数据侧 T1 共享 GT 需使用方自行防泄漏
17 标签分布 ⚠️ 官方未发布器官体积统计表(第三方整理可用,见 §4.3)
18 测量偏倚 ✅ 三人多数投票共识标注,规则显式(IVC 处理)
19 外部验证建议 ✅ 官方在线评测持续开放,测试集独立可回溯
20 版本记录 ✅ Zenodo DOI 版本化(v1.0-v1.03),MD5 公开
21 预处理脚本 ❌ 官方无预处理/训练脚本,需社区脚本或自研
22 合规要求 ⚠️ CC BY-NC-SA 4.0 非商业条款与论文表述存在差异,需法务确认
23 多模态对齐 ⚠️ T1 in/opp 已配准共享 GT;T1 与 T2 未配准;CT/MR 无配对
24 去标识化 ✅ DICOM_anon 移除患者相关信息,官方声明匿名化处理

DAIMS 评分:16.5 / 24

评分解读:12 个 ✅ + 11 个 ⚠️ + 1 个 ❌。数据本身的结构与合规基础扎实(标识、划分、版本、去标识化全部到位),短板集中在"开箱即用工程化"——掩膜编码特殊、无预处理脚本、无机器可读字典,使得从下载到首个可训练张量之间有约半天的工程距离。

对你意味着什么:如果你在做方法研究,CHAOS 级别的元数据质量足够支撑论文级评测,把工程预算投给 §6.3 预处理与 §6.9 官方口径评测即可;如果你在做产品化原型,先解决两件事——掩膜灰度映射与 CT 掩膜顺序校验(坑点 1/2),并把 CC BY-NC-SA 的非商业限制提前写进选型结论;如果你在准备论文复现,直接用 Zenodo v1.03 + 官方评测代码的组合,可以完全对齐排行榜口径。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
官方测试集(CT 肝,Task 2) Dokuz Eylül 大学(保留集) 单模态肝分割 DICE 最高 0.98±0.00 训练集内未报告基线 单模态 CT 重叠指标接近饱和
官方测试集(MR 肝,Task 3) 同上 单模态肝分割 nnU-Net 综合分 75.10±7.61(DICE 0.95±0.01) 较 CT 任务 MSSD 更差(20.85±10.63 mm) MR 低分辨率放大空间误差
官方测试集(跨模态肝,Task 1) 同上 跨模态肝分割 DICE 0.88±0.15 较单模态下降约 0.07-0.10 DICE 跨模态鸿沟的量化证据
官方测试集(跨模态全器官,Task 4) 同上 跨模态多器官 DICE 0.85±0.21、MSSD 33.17±38.93 mm 全器官方差显著增大 肾/脾在跨模态下更难
活体肝移植供体数据 Dokuz Eylül 大学医院(配套研究) 半自动 vs 深度自动肝分割 见 Diagnostic and Interventional Radiology 26:11-21(2020) 临床队列 CHAOS 方法栈向供体评估迁移的可行性验证

注:上表均来自同行评审的挑战论文(Medical Image Analysis 69:101950, 2021)与配套研究;各任务评测窗口、提交次数不同,数值不可跨表直接比较。"相对内部变化"列以挑战论文报告的单模态→跨模态同任务对比为参照。


§8 基准性能与生态

§8.1 排行榜(代表成绩)

排名/角色 模型 性能(综合分 0-100) 年份 关键技术 完整引用 代码
Task3 在线冠军 nnU-Net 75.10±7.61(DICE 0.95±0.01,ASSD 1.32±0.83 mm) 2021 自配置 U-Net 框架 + 集成 Isensee et al.(参赛方法),收录于 Kavur et al., 2021, Medical Image Analysis 69:101950. DOI 10.1016/j.media.2020.101950 https://github.com/MIC-DKFZ/nnUNet
Task3 现场冠军 PKDIA 70.71±6.40(DICE 0.94±0.01) 2019 U-Net 变体 Kavur et al., 2021, Medical Image Analysis 69:101950. DOI 10.1016/j.media.2020.101950 未公开
Task1 现场冠军 OvGUMEMoRIAL 55.78±19.20(DICE 0.88±0.15) 2019 Attention U-Net 改版(PReLU、多尺度金字塔、Tversky loss) Kavur et al., 2021, Medical Image Analysis 69:101950. DOI 10.1016/j.media.2020.101950 未公开
在线优秀方法 Metu_MMLab 见官方结果页 2020-2021 U-Net 变体(在线期最优之二) Kavur et al., 2021, Medical Image Analysis 69:101950. DOI 10.1016/j.media.2020.101950 未公开
集成基线 MedianCHAOS 见官方结果页 2019 多模型中值融合 Kavur et al., 2021, Medical Image Analysis 69:101950. DOI 10.1016/j.media.2020.101950 未公开

数值不可直接比较:现场赛(2019-04,测试集仅提前 24 小时发放)与在线赛(2019-04 至 2020-10,允许多次提交)的评测窗口不同;各任务数据难度不同;部分在线高分因无法验证或 peeking 嫌疑被论文排除。完整实时榜单见官方 Results 页 https://chaos.grand-challenge.org/Results_CHAOS/。

§8.2 SOTA 总结与选型建议

  • 肝脏单模态分割在该数据集上已接近重叠指标上限(DICE 0.95-0.98),再卷 DICE 意义有限;改进空间在 MSSD/ASSD(边界精度)与 RAVD(体积差)。
  • 跨模态与多器官任务仍有约 0.10 DICE 与大方差的差距,是论文创新点的合理落点(域适应、模态不变表征、解剖先验)。
  • 实用选型:基线直接上 nnU-Net;跨模态研究先复现 Task1/Task4 的官方结论再谈改进。
你的目标 建议 理由
论文基线 nnU-Net + 官方四指标口径 与在线冠军同源,可信度最高
方法创新 跨模态 Task 1/4 或多器官 Task 5 实测差距大(DICE 0.85-0.88),有明确改进空间
工程验收 5 折交叉验证 + 并行报告 MSSD 20 例样本量下最稳健的估计方式
产品原型 单模态专用模型起步 多任务模型约 -5%,跨模态更弱,风险递增

§8.3 评测协议

四指标(DICE/RAVD/ASSD/MSSD)→ 按专家一致性阈值做 0-100 线性映射(DICE≤0.8、RAVD≥5%、ASSD≥15 mm、MSSD≥60 mm 记 0 分)→ 逐例四指标均分 → 全测试例平均为队伍总分,缺失 case 计 0 分。距离类指标按 DICOM 元数据换算毫米。提交经 grand-challenge.org 服务器自动评测,结果实时公布。

指标 最优值 资格阈值(超过即 0 分)
DICE 1 ≤0.80
RAVD 0% ≥5%
ASSD 0 mm ≥15 mm
MSSD 0 mm ≥60 mm

阈值内按线性映射折算 0-100 分;这套"资格线 + 连续分"的双层设计把临床可接受性(专家间一致性)内嵌进了排行榜,是 CHAOS 评测协议最值得借鉴的部分。

数据集 模态 任务 与 CHAOS 关系
SLIVER07 CT 肝 CHAOS CT 任务的前辈基准(官网明确对照)
LiTS CT 肝 + 肿瘤 病灶方向互补;健康→病灶泛化验证可用
MSD Decathlon Task03/08 CT 肝/肝血管 多器官套件中的肝脏子任务
BTCV CT 13 器官 多器官 CT 方向的外部验证集
AMOS CT+MR 腹部多器官 后续出现的跨模态多器官基准,可作外部验证
TotalSegmentator CT 全身 100+ 结构 大规模多结构分割池,适合抽腹部子集做规模更大的外部验证(规模以其官方页为准)

§8.5 关键论文 Top 7

  1. Kavur, A.E., Gezer, N.S., Barış, M., Aslan, S., Conze, P.-H., et al. “CHAOS Challenge - combined (CT-MR) healthy abdominal organ segmentation.” Medical Image Analysis 69:101950, 2021. DOI 10.1016/j.media.2020.101950 —— 挑战官方总结论文:5 任务结果、四指标分析、peeking 现象与多提交效应。
  2. Kavur, A.E., Selver, M.A., Dicle, O., Barış, M., Gezer, N.S. “CHAOS - Combined (CT-MR) Healthy Abdominal Organ Segmentation Challenge Data (Version v1.03).” Zenodo, 2019. DOI 10.5281/zenodo.3362844 —— 数据集本体引用。
  3. Kavur, A.E., Gezer, N.S., Barış, M., Şahin, Y., Özkan, S., Baydar, B., et al. “Comparison of semi-automatic and deep learning-based automatic methods for liver segmentation in living liver transplant donors.” Diagnostic and Interventional Radiology 26:11-21, 2020. DOI 10.5152/dir —— CHAOS 前身研究:临床(活体供肝)场景下自动与交互式方法对比。
  4. Isensee, F., Jaeger, P.F., Kohl, S.A.A., Petersen, J., Maier-Hein, K.H. “nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation.” Nature Methods 18:203-211, 2021. DOI 10.1038/s41592-020-01008-z —— CHAOS Task3 在线冠军方法框架的原始论文。
  5. Oktay, O., Schlemper, J., Folgoc, L.L., Lee, M., Heinrich, M., et al. “Attention U-Net: Learning Where to Look for the Pancreas.” MIDL 2018. arXiv:1804.03999 —— Task1 冠军 OvGUMEMoRIAL 的基础架构。
  6. Ronneberger, O., Fischer, P., Brox, T. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” MICCAI 2015. DOI 10.1007/978-3-319-24574-4_28 —— 参赛方法几乎全员的基础架构。
  7. Heimann, T., Van Ginneken, B., Styner, M.A., et al. “Comparison and Evaluation of Methods for Liver Segmentation from CT Datasets.” IEEE TMI 28(8):1251-1261, 2009. DOI 10.1109/TMI.2009.30138 —— SLIVER07 挑战总结,CHAOS 官网定位自身的对照系。

§8.6 社区活跃度

  • 参与规模:超过 1,500 名参赛者、550 余份提交(挑战论文统计)。
  • 平台:grand-challenge.org 在线评测持续开放,官网 Results 页实时更新。
  • Zenodo 热度:全版本 views 42,483、downloads 32,316(截至 2026-09)。
  • 讨论渠道:官方 Google Group(chaos-challenge)。
  • 官方在线提交通道与 Results 页多年持续维护,截至 2026-09 仍开放提交。
  • 学术影响侧证:挑战论文是跨模态分割综述与域适应论文的常引文献;数据集四指标协议被后续腹部分割挑战借鉴。
  • 维护状态:数据侧自 v1.03 冻结,生态侧(评测服务器、结果页、社区脚本)持续活跃,属于"低维护高可用"型基准。
  • 衍生资源:社区存在基于 CHAOS 的切片级 JPG/NPY 衍生数据包(如 GitHub 教程仓库自行打包的版本),使用时应回溯到 Zenodo 原始发布并核对 MD5,避免引入二次加工误差。
  • 生态脚本:社区维护的数据转换实现(jonasteuwen/chaos-challenge 等)与数据集索引条目(openmedlab/Awesome-Medical-Dataset)。

§8.7 生态快照

资源 类型 链接 热度指标(截至 2026-09) 推荐理由
CHAOS 官网 官方平台 https://chaos.grand-challenge.org/ 持续开放在线评测 任务定义、提交手册、结果页入口
Zenodo v1.03 数据托管 https://zenodo.org/records/3431873 32,316 次下载 / 76.2 TB 唯一官方数据出口,MD5 校验齐全
CHAOS-evaluation 官方评测代码 https://github.com/emrekavur/CHAOS-evaluation MATLAB/Python/Julia 三语实现 与排行榜口径完全对齐
jonasteuwen/chaos-challenge 社区转换脚本 https://github.com/jonasteuwen/chaos-challenge 长期被引用的参考实现 掩膜区间映射与 CT 翻转处理的第一手参考
Awesome-Medical-Dataset (CHAOS 条目) 数据集索引 https://github.com/openmedlab/Awesome-Medical-Dataset/blob/main/resources/CHAOS.md 社区维护 切片数/间距/器官体积等第三方统计
挑战论文 arXiv 版 论文 https://arxiv.org/abs/2001.06535 期刊 DOI 同步 免费获取全文方法与结果细节

§9 相关资源与引用

§9.1 官方资源清单

§9.2 BibTeX 引用

@article{CHAOS2021,
  title     = {{CHAOS Challenge - combined (CT-MR) healthy abdominal organ segmentation}},
  journal   = {Medical Image Analysis},
  publisher = {Elsevier BV},
  volume    = {69},
  pages     = {101950},
  year      = {2021},
  month     = Apr,
  issn      = {1361-8415},
  doi       = {10.1016/j.media.2020.101950},
  url       = {https://www.sciencedirect.com/science/article/pii/S1361841520303145},
  author    = {A. Emre Kavur and N. Sinem Gezer and Mustafa Barış and Sinem Aslan and Pierre-Henri Conze and Vladimir Groza and Duc Duy Pham and Soumick Chatterjee and Philipp Ernst and Savaş Özkan and Bora Baydar and Dmitry Lachinov and Shuo Han and Josef Pauli and Fabian Isensee and Matthias Perkonigg and Rachana Sathish and Ronnie Rajan and Debdoot Sheet and Gurbandurdy Dovletov and Oliver Speck and Andreas Nürnberger and Klaus H. Maier-Hein and Gözde {Bozdağı Akar} and Gözde Ünal and Oğuz Dicle and M. Alper Selver}
}

@dataset{CHAOSdata2019,
  author    = {Ali Emre Kavur and M. Alper Selver and Oğuz Dicle and Mustafa Barış and N. Sinem Gezer},
  title     = {{CHAOS - Combined (CT-MR) Healthy Abdominal Organ Segmentation Challenge Data}},
  month     = Apr,
  year      = {2019},
  publisher = {Zenodo},
  version   = {v1.03},
  doi       = {10.5281/zenodo.3362844},
  url       = {https://doi.org/10.5281/zenodo.3362844}
}

@article{CHAOSdonors2020,
  author    = {A. E. Kavur and N. S. Gezer and M. Barış and Y. Şahin and S. Özkan and B. Baydar and others},
  title     = {Comparison of semi-automatic and deep learning-based automatic methods for liver segmentation in living liver transplant donors},
  journal   = {Diagnostic and Interventional Radiology},
  volume    = {26},
  pages     = {11--21},
  year      = {2020},
  doi       = {10.5152/dir.2019.19025}
}

§9.3 引用指南

官方 Publications 页要求:使用 CHAOS 挑战任何材料时,引用挑战论文(CHAOS2021)、数据集(CHAOSdata2019)及其前身交互式方法对比研究(CHAOSdonors2020)三项工作。使用评测代码时建议同时标注代码仓库版本。

Zenodo 记录页亦提供现成的单条引用格式,可直接复制:

  • IEEE 样式:A. E. Kavur, M. A. Selver, O. Dicle, M. Barış, and N. S. Gezer, “CHAOS - Combined (CT-MR) Healthy Abdominal Organ Segmentation Challenge Data”. Zenodo, 11-Apr-2019.
  • APA 样式:Kavur, A. E., Selver, M. A., Dicle, O., Barış, M., & Gezer, N. S. (2019). CHAOS - Combined (CT-MR) Healthy Abdominal Organ Segmentation Challenge Data (Version v1.03) [Data set]. Zenodo. https://doi.org/10.5281/zenodo.3362844

§9.4 常见问题

Q:下载数据需要注册吗?
不需要。Zenodo 记录页可直接下载训练与测试两个 ZIP;只有向在线评测系统提交结果才需要 grand-challenge 账号。

Q:测试集的金标准可以申请吗?
不可以。官方在多处明确"测试集金标准永不公开,相关请求将被忽略",这是为保护在线评测的公证性。

Q:有官方的 NIfTI 版本吗?
没有。官方只发布 DICOM 影像 + PNG 掩膜的原格式;NIfTI/npz/NPY 等转换依赖社区脚本或自行实现(注意坑点 1 与坑点 2)。

Q:商业产品可以使用该数据吗?
官方下载页标注许可为 CC BY-NC-SA 4.0(含非商业条款)。科研评测可直接使用并按规定引用;商业使用需另行获得授权,切勿仅凭论文中"CC-BY-SA"表述做合规判断。

Q:CT 侧能练习多器官分割吗?
不能直接练。CT 病例只有肝脏掩膜(官方有意设计);想做多器官方法学,请使用 MR 子集,或转向 BTCV/AMOS 等多器官 CT 数据集。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 起草模型:fast-model(CodeBuddy Code 内置模型),负责资料聚合、结构化写作与代码示例生成。

§10.2 AI 参与范围

AI 完成了检索结果的整合与全篇初稿撰写(含 frontmatter、INFOBOX、正文、JSON-LD、代码示例)。人工编辑负责事实核查(对照官方 Zenodo 记录、官网与挑战论文)、医学与工程审核、坑点真实性与合规复核。AI 生成内容中不包含任何未在 §10.3 来源清单中出现的数据断言;查证不到的字段(如引用次数、CT 设备型号、逐例扫描日期)均按规范省略而非填充估计值。

§10.3 输入来源列表

  1. Kavur, A.E., Selver, M.A., Dicle, O., Barış, M., Gezer, N.S. “CHAOS - Combined (CT-MR) Healthy Abdominal Organ Segmentation Challenge Data (Version v1.03).” Zenodo, 2019. DOI 10.5281/zenodo.3362844. https://zenodo.org/records/3431873
  2. Zenodo concept record(版本聚合与下载统计). DOI 10.5281/zenodo.3362844. https://zenodo.org/record/3362844
  3. CHAOS 官网 - Combined Healthy Abdominal Organ Segmentation. https://chaos.grand-challenge.org/Combined_Healthy_Abdominal_Organ_Segmentation/
  4. CHAOS 官网 - Download(许可与提交手册). https://chaos.grand-challenge.org/Download/
  5. CHAOS 官网 - Publications and Citations. https://chaos.grand-challenge.org/Publications/
  6. Kavur, A.E., et al. “CHAOS Challenge – Combined (CT-MR) Healthy Abdominal Organ Segmentation.” arXiv:2001.06535. https://arxiv.org/abs/2001.06535
  7. 挑战论文 arXiv 全文 v1(数据规格表 II、标注协议). https://export.arxiv.org/pdf/2001.06535v1
  8. 挑战论文 arXiv 全文 v2(5 任务定义、IVC 标注规则). https://arxiv.org/html/2001.06535v2
  9. 挑战论文 ar5iv 全文 v3(评测协议、提交统计表 6、CC-BY-SA 表述). https://ar5iv.arxiv.org/html/2001.06535
  10. Kavur, A.E., et al. “CHAOS challenge - combined (CT-MR) healthy abdominal organ segmentation.” Medical Image Analysis 69:101950, 2021. https://www.sciencedirect.com/science/article/abs/pii/S1361841520303145
  11. jonasteuwen/chaos-challenge(掩膜灰度映射与 CT 翻转参考实现). https://github.com/jonasteuwen/chaos-challenge/blob/master/build_chaos_dataset.py
  12. sarah-antillia/ImageMask-Dataset-CHAOS-CT-Liver(目录结构与 CT GT 命名). https://github.com/sarah-antillia/ImageMask-Dataset-CHAOS-CT-Liver
  13. openmedlab/Awesome-Medical-Dataset CHAOS 条目(第三方统计). https://github.com/openmedlab/Awesome-Medical-Dataset/blob/main/resources/CHAOS.md
  14. emrekavur/CHAOS-evaluation(官方评测代码). https://github.com/emrekavur/CHAOS-evaluation
  15. OpenAIRE 数据记录(Zenodo 版本 DOI 列表). https://explore.openaire.eu/search/result?pid=10.5281/zenodo.3362845
  16. Grand Challenge 官方评测结果页(Task5 逐例指标样例). https://chaos.grand-challenge.org/evaluation/3b933374-a66c-4eb2-86d7-c0662eabb118/
  17. MIC-DKFZ/nnUNet(冠军方法代码仓库). https://github.com/MIC-DKFZ/nnUNet

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
规模数字(80 例/160 序列集/切片与间距范围) 千方病案医学编辑部 对照挑战论文表 II 与 Zenodo 记录逐项核对 ✅ 已通过/已验证
许可证与获取流程 千方病案医学编辑部 对照官网 Download 页原文核对 ✅ 已通过/已验证
医学背景与标注协议 千方病案医学编辑部 对照挑战论文 §3.3-3.4 核对 ✅ 已通过/已验证
8 个坑点真实性 千方病案医学编辑部(数据工程) 对照社区参考实现与官方文档核对 ✅ 已通过/已验证
基准数字与引用完整性 千方病案医学编辑部 对照挑战论文摘要与官网 Results 页核对 ✅ 已通过/已验证
代码示例可运行性 千方病案医学编辑部(数据工程) 依赖版本与路径静态审查 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全篇初稿由 AI 起草;其中 §6 代码示例、§7.7 DAIMS 评估、§8 生态表为 AI 依据上述来源归纳生成,均已经人工审核修订。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • amos — 共享标签:医学影像 / 多模态 / CT / MRI / 医学图像分割
  • medical-decathlon — 共享标签:医学影像 / CT / MRI / 医学图像分割
  • medpix — 共享标签:医学影像 / 多模态 / CT / MRI
  • 3dreasonknee — 共享标签:医学影像 / 多模态 / MRI / 医学图像分割
  • radimagenet — 共享标签:医学影像 / CT / MRI
  • nih-pancreas-ct — 共享标签:医学影像 / CT / 医学图像分割
  • abdomenct-1k — 共享标签:医学影像 / CT / 医学图像分割
  • word — 共享标签:医学影像 / CT / 医学图像分割
  • totalsegmentator — 共享标签:医学影像 / CT / 医学图像分割
  • han-seg — 共享标签:医学影像 / CT / 医学图像分割

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集