信息速览
INFOBOX
| 数据集名称 | AMOS |
| 英文全称 | AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation |
| 别名 / 简称 | AMOS、AMOS22、AMOS-CT、AMOS-MRI、Abdominal Multi-Organ Segmentation |
| 疾病分类 | 多器官覆盖。核心映射:2C30-2C3Z 消化系统恶性肿瘤 / DB70-DB7Z 肝脏疾病 / DC10-DC1Z 胆囊疾病 / DC50-DC5Z 胰腺疾病 / GB60-GB6Z 肾脏疾病 |
| SNOMED CT | 10200004 Liver / 78961009 Spleen / 64033007 Right kidney / 18619005 Left kidney / 28231008 Gallbladder / 32849002 Esophagus / 69695003 Stomach / 15821003 Aorta / 23278009 Inferior vena cava / 15776009 Pancreas / 70325002 Adrenal gland / 38848004 Duodenum / 89837001 Bladder / 41216001 Prostate / 35039007 Uterus |
| 数据模态 | 影像(CT 腹部扫描 + MRI 腹部扫描) |
| AI 任务类型 | 3D 语义分割、跨模态分割、半监督学习、域自适应、迁移学习 |
| 样本总数 | 600 例标注扫描(500 CT + 100 MRI)+ 3,200 例未标注扫描(2,000 CT + 1,200 MRI) |
| 数据大小 | ~15 GB(标注数据)/ ~200 GB(含全部未标注数据) |
| 数据格式 | NIfTI(.nii.gz,标注与影像)/ JSON(元数据) |
| 许可证 | CC BY-NC-SA 4.0(署名-非商业性-相同方式共享) |
| 访问级别 | 开放(Zenodo 免费下载,无需注册) |
| DUO 标签 | GRU, NPUNCU |
| 语言 | 英文(数据集文档与代码注释) |
| 首发日期 | 2022-06-16(arXiv 预印本) |
| 最后更新 | 2022-11-06(未标注 MRI 数据 Part III 发布) |
| 发布机构 | The University of Hong Kong(港大数据科学研究所)& 深圳市大数据研究院 |
| 官方主页 | https://amos22.grand-challenge.org/ |
| 下载地址 | https://zenodo.org/record/7262581(标注数据)/ https://zenodo.org/record/7155725(未标注 CT)/ https://zenodo.org/record/7295816(未标注 MRI) |
| DOI | 10.48550/arXiv.2206.08023(论文)/ 10.5281/zenodo.7262581(标注数据) |
| 引用次数 | 778+(Google Scholar,截至 2026-08) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 多中心多设备大规模标注 + ID/OOD 标准划分 + 未标注数据支持半监督;扣分项:单一标注者无标注一致性、仅亚洲人群、许可证来源矛盾 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、腹部解剖学基础、临床任务定义)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略(ID/OOD 设计)、§6 预处理 Pipeline 和坑点。
审核日期:2026-08-06
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。AMOS 数据集采用 CC BY-NC-SA 许可,禁止商业用途。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览(Overview)
§1.0 📌 30 秒速览
AMOS 是香港大学联合深圳研究机关于 2022 年 NeurIPS 会议发布的大规模腹部多器官分割数据集,包含 500 例 CT 和 100 例 MRI 扫描,每例均具备 15 个腹部器官的体素级精细标注。此外还提供 3,200 例未标注扫描,支持半监督学习。
它的独特价值在于首次在单一数据集中同时实现了大规模(600 例标注 + 3,200 例未标注)、多模态(CT + MRI)、多设备(8 台扫描仪)、多中心(2 家医院)和分布外(OOD)测试设计——迫使分割网络学习真正泛化的解剖学拓扑结构,而非对单一设备分布过拟合。原始论文已被引用 778 余次,是腹部多器官分割的事实标准基准。
你可以用它来:训练一个跨模态腹部 15 器官 3D 分割模型、研究 CT/MRI 跨模态域自适应方法、或者利用未标注数据探索半监督分割的前沿方法。
§1.1 摘要
AMOS 由 Yuanfeng Ji 等人于 2022 年在 NeurIPS Benchmark and Dataset Track 发表。数据来自深圳市龙岗中心医院和深圳市龙岗人民医院(2018-2021 年),使用 5 台 CT 扫描仪(Aquilion ONE / Brilliance16 / Somatom Force / Optima CT660 / Optima CT540)和 3 台 MRI 扫描仪(Ingenia / Prisma / Signa HDe)采集。每例扫描标注 15 个腹部器官:脾脏、右肾、左肾、胆囊、食管、肝脏、胃、主动脉、下腔静脉、胰腺、右肾上腺、左肾上腺、十二指肠、膀胱、前列腺/子宫。
标注采用半自动两阶段流程:先人工标注 70 例(50 CT + 20 MRI),训练 3D-UNet 和 VNet 进行自动预标注,再由 5 名初级放射科医生(5 年经验)使用 ITK-SNAP 逐层修正,最终由 3 名资深放射科医生(10 年以上经验)共识审核。数据集设计了两项任务:Task 1(仅 CT)和 Task 2(CT + MRI 跨模态),并采用分布内/分布外(ID/OOD)划分,将未参与训练的扫描仪数据专门用于 OOD 测试。
§1.2 为什么重要
技术创新维度:AMOS 是首个同时在规模(600 例标注)、器官数量(15 个)、模态多样性(CT + MRI)和设备多样性(8 台扫描仪)四个维度上实现突破的腹部分割数据集。此前最大的 BTCV 数据集仅包含 50 例 CT 和 13 个器官,AbdomenCT-1K 虽有 1,112 例但仅覆盖 4 个器官。AMOS 的 ID/OOD 划分设计——将 2 台 CT 扫描仪和 1 台 MRI 扫描仪的数据完全保留用于 OOD 测试——首次在腹部分割领域建立了系统化的域偏移评估框架。
应用影响维度:AMOS 的长尾器官分布(肝脏标注体积约为肾上腺的 200 倍)逼真地反映了临床场景中器官大小悬殊的现实,推动了针对小器官分割的注意力机制和边界感知方法的研究。论文验证了在 AMOS 上预训练的模型在 10 个目标数据集中 5 个显著优于从头训练,在 BTCV 验证集上甚至超越了 BTCV 自身训练的模型(90.83% vs 83.62% mDice),证明了数据集的迁移学习价值。
§1.3 与同类数据集横向对比
| 数据集 | 样本量 | 模态 | 器官数 | 标注方式 | 核心差异化 |
|---|---|---|---|---|---|
| AMOS | 600 + 3,200 未标注 | CT + MRI | 15 | 半自动 + 专家审核 | 跨模态 + ID/OOD 划分 + 大规模未标注数据 |
| BTCV | 50 | CT | 13 | 专家手动 | 经典小规模基准,30 例训练 |
| AbdomenCT-1K | 1,112 | CT | 4 | 专家手动 | 大规模但器官数少 |
| CHAOS | 80 | CT + MRI | 4 | 专家手动 | 跨模态但规模小、器官少 |
| WORD | 150 | CT | 16 | 专家手动 | 器官数多但仅 CT、规模小 |
| MSD Task03 | 484 | CT | 3 | 专家手动 | 仅肝脏、肾脏、脾脏 |
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2022-04-15 | AMOS 2022 挑战赛网站开放 |
| 2022-05-01 | 训练集和验证集发布 |
| 2022-06-16 | 论文 arXiv 预印本发布(arXiv:2206.08023) |
| 2022-07-22 | 挑战赛提交截止(MICCAI 2022) |
| 2022-08-15 | 挑战赛最终排名公布,nnU-Net 扩展版(Isensee et al.)两项任务均获第一 |
| 2022-11-28 | NeurIPS 2022 正式发表(Advances in Neural Information Processing Systems, Vol. 35, pp. 36722-36732) |
| 2022-10 | 未标注数据逐步发布:Part I(900 CT)、Part II(1,100 CT)、Part III(1,200 MRI) |
| 2022-11-06 | 未标注 MRI 数据 Part III 发布于 Zenodo |
§1.5 典型 AI 应用场景
- 3D 腹部多器官分割:训练 nnU-Net / Swin-UNETR / 3D Transformer 架构实现 15 个器官的自动分割
- 跨模态域自适应:利用 CT 和 MRI 的联合分布训练单一模型,研究跨模态泛化
- 半监督学习:利用 3,200 例未标注扫描提升标注数据有限的分割性能
- 迁移学习预训练:在 AMOS 上预训练后迁移到 BTCV、AbdomenCT-1K 等目标数据集
- 域偏移鲁棒性评估:利用 ID/OOD 划分评估模型对未见扫描仪数据的泛化能力
§2 医学背景(Medical Context)
§2.1 ICD-11 编码映射
AMOS 涵盖 15 个腹部器官,涉及多个 ICD-11 疾病分类:
| 器官 | ICD-11 编码范围 | 疾病分类 |
|---|---|---|
| 肝脏 | DB70-DB7Z | 肝脏疾病 |
| 胆囊 | DC10-DC1Z | 胆囊疾病 |
| 胰腺 | DC50-DC5Z | 胰腺疾病 |
| 食管 | DA20-DA2Z | 食管疾病 |
| 胃 | DA40-DA4Z | 胃疾病 |
| 十二指肠 | DA60-DA6Z | 小肠疾病 |
| 脾脏 | 3B51 | 脾脏疾病 |
| 肾脏 | GB60-GB6Z | 肾脏疾病 |
| 膀胱 | GC00-GC0Z | 膀胱疾病 |
| 前列腺 | XH0V07 | 前列腺恶性肿瘤 |
| 子宫 | 2C76 | 子宫体恶性肿瘤 |
| 腹部肿瘤(总) | 2C30-2C3Z | 消化系统恶性肿瘤 |
§2.1b SNOMED CT 映射
| 数据集标签 | Label ID | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| Spleen | 1 | 78961009 | Spleen (body structure) |
| Right Kidney | 2 | 64033007 | Right kidney (body structure) |
| Left Kidney | 3 | 18619005 | Left kidney (body structure) |
| Gallbladder | 4 | 28231008 | Gallbladder (body structure) |
| Esophagus | 5 | 32849002 | Esophagus (body structure) |
| Liver | 6 | 10200004 | Liver (body structure) |
| Stomach | 7 | 69695003 | Stomach (body structure) |
| Aorta | 8 | 15821003 | Aorta (body structure) |
| Inferior Vena Cava | 9 | 23278009 | Inferior vena cava (body structure) |
| Pancreas | 10 | 15776009 | Pancreas (body structure) |
| Right Adrenal Gland | 11 | 70325002 | Adrenal gland (body structure) |
| Left Adrenal Gland | 12 | 70325002 | Adrenal gland (body structure) |
| Duodenum | 13 | 38848004 | Duodenum (body structure) |
| Bladder | 14 | 89837001 | Urinary bladder (body structure) |
| Prostate/Uterus | 15 | 41216001 / 35039007 | Prostate / Uterus |
§2.2 疾病简介
AMOS 数据集中的患者均确诊为腹部肿瘤或异常。腹部肿瘤涵盖消化系统恶性肿瘤(ICD-11 2C30-2C3Z),包括肝癌、胰腺癌、胃癌、结肠癌等,是全球发病率和死亡率最高的肿瘤类别之一。根据 WHO 数据,2022 年全球消化系统恶性肿瘤新发病例约 500 万,死亡约 350 万。精准的腹部多器官分割是放射治疗计划、手术导航和肿瘤疗效评估的基础技术前提。
§2.3 临床任务定义
| 任务类型 | 临床目标 | AI 任务边界 |
|---|---|---|
| 解剖结构分割 | 为放射治疗计划提供器官风险图谱 | 15 个腹部器官的体素级 3D 分割 |
| 跨模态泛化 | 在不同成像设备(CT/MRI)上保持分割一致性 | 单一模型同时处理 CT 和 MRI 输入 |
| 域偏移鲁棒性 | 在未见设备数据上维持性能 | OOD 测试集上评估性能退化程度 |
§2.4 患者人群特征
| 维度 | AMOS-CT(500 例) | AMOS-MRI(100 例) |
|---|---|---|
| 数据来源 | 深圳市龙岗中心医院 + 龙岗人民医院 | 同左 |
| 采集时间 | 2018-2021 年 | 2018-2021 年 |
| 男性 | 314 例(62.8%) | 55 例(55.0%) |
| 女性 | 186 例(37.2%) | 45 例(45.0%) |
| 年龄范围 | 14-94 岁 | 22-85 岁 |
| 中位年龄 | 54 岁 | 50 岁 |
| 平均年龄 | 53.64 岁 | 48.71 岁 |
| 疾病分布 | 腹部肿瘤 : 其他异常 ≈ 3:2 | 同左 |
| 种族分布 | 亚洲人群为主(中国深圳) | 同左 |
| 就医类型 | 住院 / 门诊混合 | 同左 |
§2.5 临床意义
腹部多器官自动分割是精准医疗的关键基础设施。在放射治疗中,准确的器官风险图谱(Organ-at-Risk, OAR)分割是制定治疗计划、最小化正常组织辐射剂量的前提。传统人工分割每例腹部 CT 需要 30-60 分钟,而 AI 辅助分割可缩短至秒级。AMOS 涵盖的 15 个器官覆盖了腹部放射治疗计划的核心 OAR 范围,具有直接的临床转化价值。
§2.6 金标准 / 参考标准
| 数据划分 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| Train(200 CT + 40 MRI) | 半自动:3D-UNet 预标注 → 初级医生逐层修正 → 资深医生审核 | 5 名初级放射科医生(5 年经验)+ 3 名资深放射科医生(10 年以上经验) | 参考标准(半自动 + 专家审核) |
| Validation(100 CT + 20 MRI) | 同上 | 同上 | 参考标准 |
| Test-ID(78 CT + 11 MRI) | 同上 | 同上 | 参考标准(分布内) |
| Test-OOD(122 CT + 29 MRI) | 同上 | 同上 | 参考标准(分布外,未见扫描仪) |
标注说明:每例扫描由单一标注者完成(无多次标注聚合)。资深医生先各自独立审查并记录意见,然后汇总讨论达成最终共识。标注在 ITK-SNAP 工具箱中逐矢状面进行,轴位和冠状面强制执行体积一致性。
§3 数据集规格(Specifications)
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速复现论文 / 资源有限 | 标注数据(500 CT + 100 MRI) | ~15 GB | 含标准标注,足够训练和评估 |
| 半监督学习 / 域自适应研究 | 标注 + 未标注全集 | ~200 GB | 3,200 例未标注数据大幅扩展可用场景 |
| 仅 CT 分割(Task 1) | AMOS-CT 子集 | ~12 GB | 500 例 CT 含 15 器官标注,ID/OOD 划分 |
| 跨模态分割(Task 2) | AMOS-CT + AMOS-MRI | ~15 GB | 100 例额外 MRI 数据支持跨模态研究 |
§3.1 模态详细说明
CT 扫描:采用 5 台不同厂商 CT 扫描仪采集,包括东芝/佳能 Aquilion ONE、飞利浦 Brilliance16、西门子 Somatom Force、GE Optima CT660 和 GE Optima CT540。采集参数:120 kVP 管电压,500 mm 数据采集直径,500-800 ms 曝光时间,50-400 mA X 射线管电流。图像重建:2.5-5 mm 层厚,标准 FC08 卷积核,400-500 mm 重建直径。
MRI 扫描:采用 3 台不同厂商 MRI 扫描仪采集,包括飞利浦 Ingenia、西门子 Prisma 和 GE Signa HDe。不同扫描仪间强度分布差异巨大(Ingenia 均值 25,383 vs Prisma 均值 344 vs Signa HDe 均值 22,937),这是跨模态分割的核心挑战之一。
§3.2 样本总数(按子集拆分)
AMOS-CT 数据划分
| 扫描仪 | 领域 | 训练集 | 验证集 | 测试集(ID) | 测试集(OOD) | 总计 |
|---|---|---|---|---|---|---|
| Aquilion ONE | A | 82 | 27 | 27 | — | 136 |
| Brilliance16 | B | 68 | 23 | 23 | — | 114 |
| Somatom Force | C | 50 | 50 | 28 | — | 128 |
| Optima CT660 | D | — | — | — | 64 | 64 |
| Optima CT540 | E | — | — | — | 58 | 58 |
| 合计 | 200 | 100 | 78 | 122 | 500 |
AMOS-MRI 数据划分
| 扫描仪 | 领域 | 训练集 | 验证集 | 测试集(ID) | 测试集(OOD) | 总计 |
|---|---|---|---|---|---|---|
| Ingenia | F | — | — | — | 29 | 29 |
| Prisma | G | 33 | 20 | 11 | — | 64 |
| Signa HDe | H | 7 | — | — | — | 7 |
| 合计 | 40 | 20 | 11 | 29 | 100 |
§3.3 数据格式详情
| 文件类型 | 格式 | 尺寸 | 说明 |
|---|---|---|---|
| CT 影像 | NIfTI (.nii.gz) | 512×512×[67-369] | 16-bit 整数,HU 值范围约 [-1024, 3000] |
| MRI 影像 | NIfTI (.nii.gz) | 变尺寸×[40-535] | 16-bit 整数,强度范围因扫描仪差异巨大 |
| 标注掩码 | NIfTI (.nii.gz) | 同影像 | 8-bit 整数,0=背景,1-15=器官标签 |
| 元数据 | JSON | — | dataset.json,含标签映射、划分信息 |
§3.4 存储大小
| 版本 | 压缩后 | 解压后 | 说明 |
|---|---|---|---|
| 标注数据(500 CT + 100 MRI) | ~15 GB | ~30 GB | amos22.zip |
| 未标注 CT Part I(900 CT) | ~18 GB | ~36 GB | amos22_unlabeled_ct_1.zip |
| 未标注 CT Part II(1,100 CT) | ~22 GB | ~44 GB | amos22_unlabeled_ct_2.zip |
| 未标注 MRI Part III(1,200 MRI) | ~10.7 GB | ~21 GB | amos22_unlabeled_mri_7000_8199.zip |
| 全部数据 | ~66 GB | ~131 GB | — |
§3.5 标注方式
半自动两阶段标注流程:
-
第一阶段(粗标注):
- 人工标注 70 例种子数据(50 CT + 20 MRI)
- 使用种子数据训练 3D-UNet 和 VNet 分割模型
- 用预训练模型对剩余 530 例扫描进行自动粗标注
-
第二阶段(精细化标注):
- 5 名初级放射科医生(5 年临床扫描经验)使用 ITK-SNAP 逐层检查和修正分割结果
- 标注在矢状面逐层进行,轴位和冠状面强制执行体积一致性
- 3 名资深专科放射科医生(10 年以上临床经验)负责最终验证
- 资深医生先各自独立审查并记录意见,然后汇总讨论达成最终共识
- 整个过程迭代多次
§3.6 标注者资质
| 角色 | 人数 | 资质 | 职责 |
|---|---|---|---|
| 初级放射科医生 | 5 | 5 年临床扫描经验 | 逐层检查和修正自动预标注 |
| 资深专科放射科医生 | 3 | 10 年以上临床经验 | 最终验证、错误修正、共识审核 |
一致性说明:每例扫描由单一标注者完成,无多次标注聚合。标注一致性通过资深医生共识审核机制保障,但未报告定量化的标注者间一致性(Inter-annotator Agreement)指标。
§3.7 采集时间范围
2018 年 1 月至 2021 年 12 月(约 4 年采集跨度)。
§3.8 地域覆盖
中国广东省深圳市,2 家医院:
- 深圳市龙岗中心医院
- 深圳市龙岗人民医院
§3.9 采集设备规格
CT 扫描仪(5 台)
| 扫描仪型号 | 厂商 | 领域标记 | 切片间距 (mm) | 切片数范围 | 用于训练 |
|---|---|---|---|---|---|
| Aquilion ONE | 东芝/佳能医疗 | A | 5.0 | 68-140 | ✅ |
| Brilliance16 | 飞利浦 | B | 5.0 | 68-112 | ✅ |
| Somatom Force | 西门子医疗 | C | 1.25-5.0 | 76-353 | ✅ |
| Optima CT660 | 通用电气 (GE) | D | 1.25-5.0 | 78-321 | ❌ (OOD) |
| Optima CT540 | 通用电气 (GE) | E | 1.25-5.0 | 67-369 | ❌ (OOD) |
MRI 扫描仪(3 台)
| 扫描仪型号 | 厂商 | 领域标记 | 切片间距 (mm) | 切片数范围 | 用于训练 |
|---|---|---|---|---|---|
| Ingenia | 飞利浦 | F | 0.86-6.0 | 60-535 | ❌ (OOD) |
| Prisma | 西门子医疗 | G | 0.82-3.0 | 64-512 | ✅ |
| Signa HDe | 通用电气 (GE) | H | 0.82-2.0 | 100-512 | ✅ |
§3.10 深度溯源链
患者就诊(深圳市龙岗中心医院 / 龙岗人民医院)
↓
临床影像扫描(2018-2021,5 台 CT + 3 台 MRI)
↓
DICOM 原始数据 → PHI 去除 → NIfTI 格式转换
↓
入排筛选:腹部肿瘤/异常确诊 + 成像质量达标 + 多设备多样性
↓
半自动标注:
├─ 种子标注(70 例,人工标注)
├─ 模型预标注(3D-UNet + VNet)
├─ 初级医生修正(5 人,ITK-SNAP,矢状面逐层)
└─ 资深医生共识审核(3 人,独立审查 → 汇总讨论)
↓
数据划分(按扫描仪域分配 ID/OOD)
↓
Zenodo 发布 + AWS 开放数据平台托管
↓
AMOS 2022 挑战赛(MICCAI 2022)
↓
NeurIPS 2022 正式发表
§4 数据结构详解(Data Schema)
§4.0 目录结构预览
amos22/
├── dataset.json # 数据集元数据(标签映射、文件列表、划分信息)
├── ImagesTr/ # 训练集影像
│ ├── amos_0001.nii.gz # CT 扫描(ID: 0001-0200 为 CT, 0001-0040 为 MRI)
│ ├── amos_0002.nii.gz
│ ├── ...
│ └── amos_0240.nii.gz # 200 CT + 40 MRI 训练集
├── ImagesVa/ # 验证集影像
│ ├── amos_0008.nii.gz
│ ├── amos_0013.nii.gz
│ └── ...
├── ImagesTs/ # 测试集影像(200 CT + 40 MRI,无公开标签)
│ ├── amos_0002.nii.gz
│ ├── amos_0003.nii.gz
│ └── ...
├── labelsTr/ # 训练集标注(与 ImagesTr 一一对应)
│ ├── amos_0001.nii.gz # 0=背景,1-15=器官标签
│ └── ...
├── labelsVa/ # 验证集标注
│ └── ...
├── labelsTs/ # 测试集标注(仅限挑战赛评估服务器使用)
│ └── ...
└── readme.md # 数据集说明
文件命名规则:
amos_XXXX.nii.gz,XXXX 为 4 位零填充编号。CT 和 MRI 文件混合编号,通过dataset.json中的modality字段区分。
§4.1 DAIMS 标准化字段描述表
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
image |
NIfTI 3D volume | CT/MRI 体素数据 | amos_0001.nii.gz | 模型输入 | 设备噪声 | — | CT: [-1024, 3000] HU |
label |
NIfTI 3D volume | 分割标注掩码 | amos_0001.nii.gz | 训练目标 | 标注者偏差 | 0 (背景) | 0-15 |
modality |
string | 成像模态 | “CT” / “MRI” | 模态条件处理 | — | — | |
scanner_domain |
string | 扫描仪域标识 | “A”-“H” | 域自适应/OOD 分析 | — | — | A-H |
split |
string | 数据划分 | “train” / “val” / “test-id” / “test-ood” | 划分管理 | — | — | 4 类 |
patient_age |
int | 患者年龄 | 54 | 人群分析 | — | — | 14-94 |
patient_gender |
string | 患者性别 | “M” / “F” | 公平性分析 | — | — |
§4.2 标签分布统计
15 个器官的标签 ID 与体积分布
| Label ID | 器官 | 缩写 | 体积范围 | 相对大小 | 分割难度 |
|---|---|---|---|---|---|
| 1 | 脾脏 | SPL | 中-大 | ×100 | 中 |
| 2 | 右肾 | RKI | 中 | ×80 | 低 |
| 3 | 左肾 | LKI | 中 | ×80 | 低 |
| 4 | 胆囊 | GBL | 小-中 | ×20 | 中 |
| 5 | 食管 | ESO | 小 | ×15 | 高 |
| 6 | 肝脏 | LIV | 最大 | ×200(基准) | 低 |
| 7 | 胃 | STO | 大 | ×150 | 中 |
| 8 | 主动脉 | AOR | 中 | ×40 | 低 |
| 9 | 下腔静脉 | IVC | 中 | ×30 | 中 |
| 10 | 胰腺 | PAN | 中 | ×25 | 高 |
| 11 | 右肾上腺 | RAG | 极小 | ×1 | 极高 |
| 12 | 左肾上腺 | LAG | 极小 | ×1 | 极高 |
| 13 | 十二指肠 | DUO | 小 | ×10 | 高 |
| 14 | 膀胱 | BLA | 中 | ×35 | 中 |
| 15 | 前列腺/子宫 | PRO/UTE | 小-中 | ×8 | 高 |
长尾分布说明:肝脏标注体积约为肾上腺的 200 倍。这种自然的长尾分布使小器官(肾上腺、十二指肠、食管)的分割极具挑战性,是 AMOS 区别于其他数据集的核心特征之一。
§4.3 关键字段描述性统计
CT 强度统计(HU 值)
| 统计量 | 值 |
|---|---|
| 5th percentile | -991 |
| Median | 57 |
| Mean | 50 |
| 99.5th percentile | 362 |
MRI 强度统计(因扫描仪差异巨大,按域分别统计)
| 扫描仪域 | Median | Mean | 5th percentile | 99.5th percentile |
|---|---|---|---|---|
| F (Ingenia) | 57,422 | 58,761 | — | — |
| G (Prisma) | 2,560 | 344 | — | — |
| H (Signa HDe) | 845 | 22,937 | — | — |
MRI 强度差异:不同扫描仪间 MRI 强度差异可达 2 个数量级(Ingenia 均值 58,761 vs Prisma 均值 344),这是 AMOS Task 2 跨模态任务的核心挑战。
§4.4 数据层级关系
患者 (Patient)
└── 扫描实例 (Scan) — 1 例 CT 或 MRI
└── 三维体数据 (Volume) — 512×512×N 切片
└── 体素 (Voxel) — 1 个强度值 + 1 个标签值
每例患者仅有 1 次扫描(无纵向随访)。CT 和 MRI 来自不同患者。
§4.5 缺失值情况
| 缺失类型 | 描述 | 影响范围 | 处理建议 |
|---|---|---|---|
| 器官缺失标注 | 部分扫描中某些器官可能因手术切除而不存在 | 少量案例 | 检查标注中该器官标签是否存在,若不存在则该器官体积=0 |
| 未标注解剖结构 | 肺、心脏等胸部结构可见但未标注 | 所有扫描 | 非缺失,属设计排除 |
| 人口统计学细节 | 具体疾病类型、肿瘤分期等未逐例公开 | 全部 | 论文以词频图展示疾病类型分布,无逐例数据 |
§5 数据划分与使用建议(Splits & Usage)
§5.1 官方划分
AMOS 采用基于扫描仪域的 ID/OOD 划分设计,这是其区别于其他数据集的核心创新:
| 划分 | CT 数量 | MRI 数量 | 扫描仪来源 | 用途 |
|---|---|---|---|---|
| Train | 200 | 40 | A, B, C (CT) + G, H (MRI) | 模型训练 |
| Validation | 100 | 20 | A, B, C (CT) + G (MRI) | 超参调优 / 模型选择 |
| Test-ID | 78 | 11 | A, B, C (CT) + G (MRI) | 分布内测试 |
| Test-OOD | 122 | 29 | D, E (CT) + F (MRI) | 分布外测试(未见扫描仪) |
§5.2 划分策略说明
- 分布内(ID)测试:测试集扫描仪与训练集相同,评估模型在同分布数据上的性能上限
- 分布外(OOD)测试:测试集扫描仪完全未参与训练,评估模型对设备域偏移的鲁棒性
- CT OOD:扫描仪 D(Optima CT660)和 E(Optima CT540)完全保留用于 OOD 测试
- MRI OOD:扫描仪 F(Ingenia)完全保留用于 OOD 测试
§5.3 使用建议
| 研究目标 | 推荐划分策略 | 评估指标 |
|---|---|---|
| 复现论文基线 | 官方 train → val 评估 | mDice, mNSD |
| 挑战赛提交 | 官方 train+val → test 评估 | mDice, mNSD(提交 Docker) |
| 域自适应研究 | train (ID) → test-OOD 评估 | mDice 性能差距 (ID - OOD) |
| 半监督学习 | train + 未标注数据 → val/test | mDice 提升 (SSL - supervised) |
| 跨模态研究 | train (CT+MRI) → val (CT+MRI) | 分模态 mDice |
| 5 折交叉验证 | 合并 train+val → 5-fold CV | mDice ± std |
§5.4 未标注数据使用
AMOS 额外提供 3,200 例未标注扫描(2,000 CT + 1,200 MRI),支持以下研究范式:
- 半监督学习:利用未标注数据通过一致性正则化、伪标签等方法提升分割性能
- 域自适应:利用未标注 OOD 扫描仪数据缩小域间差距
- 自监督预训练:在未标注数据上预训练表征,再在有标注数据上微调
- 无监督学习:完全在未标注数据上进行解剖结构发现
§5.5 评估指标
AMOS 官方采用两个指标:
-
平均 Dice 相似系数(mDice):衡量分割体积重叠度
- 公式:Dice = 2|A∩B| / (|A|+|B|)
- 范围:0-100%,越高越好
-
平均归一化表面距离(mNSD):衡量分割边界质量
- 公式:基于边界体素的最小距离,归一化为容忍度
- 范围:0-100%,越高越好
§5.6 注意事项
-
测试集标签不公开:Test 集标注仅限挑战赛评估服务器使用,研究者需通过提交 Docker 容器或使用验证集进行评估
-
CT 和 MRI 文件混合编号:文件名不区分模态,需通过
dataset.json中的元数据判断 -
OOD 划分不可忽略:仅在 ID 测试集上评估会高估模型性能,必须报告 OOD 结果
§6 AI 就绪指南(AI-Ready Guide)
§6.1 快速上手
# ========================================
# AMOS 快速上手 — PyTorch 版
# 环境要求: torch>=2.0, monai>=1.3, nibabel, numpy
#
# ⚠️ 目录结构预期:
# 请将下载的数据解压至 ./data/ 目录,确保以下结构:
# ./data/amos22/
# ├── ImagesTr/ # 训练集影像
# ├── ImagesVa/ # 验证集影像
# ├── labelsTr/ # 训练集标注
# ├── labelsVa/ # 验证集标注
# └── dataset.json # 元数据
#
# 影像文件名格式: amos_XXXX.nii.gz
# 标注文件名格式: amos_XXXX.nii.gz (与影像同名,位于 labelsTr/ 或 labelsVa/)
# ========================================
import os
import json
import numpy as np
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
from monai.transforms import (
Compose, LoadImaged, EnsureChannelFirstd,
Orientationd, Spacingd, ScaleIntensityRanged,
RandCropByPosNegLabeld, RandFlipd, RandRotate90d,
EnsureTyped
)
from monai.data import CacheDataset
DATA_ROOT = "./data/amos22"
# 加载 dataset.json 获取文件列表
with open(os.path.join(DATA_ROOT, "dataset.json")) as f:
meta = json.load(f)
# 构建训练集数据字典
train_files = []
for item in meta.get("training", []):
train_files.append({
"image": os.path.join(DATA_ROOT, "ImagesTr", item["image"]),
"label": os.path.join(DATA_ROOT, "labelsTr", item["label"]),
})
# 构建验证集数据字典
val_files = []
for item in meta.get("validation", []):
val_files.append({
"image": os.path.join(DATA_ROOT, "ImagesVa", item["image"]),
"label": os.path.join(DATA_ROOT, "labelsVa", item["label"]),
})
print(f"训练集: {len(train_files)} 例, 验证集: {len(val_files)} 例")
# CT 预处理 + 数据增强
train_transforms = Compose([
LoadImaged(keys=["image", "label"]),
EnsureChannelFirstd(keys=["image", "label"]),
Orientationd(keys=["image", "label"], axcodes="RAS"),
Spacingd(keys=["image", "label"], pixdim=(1.5, 1.5, 1.5),
mode=("bilinear", "nearest")),
# CT HU 值裁剪与归一化(论文标准:[-991, 362])
ScaleIntensityRanged(keys=["image"], a_min=-991, a_max=362,
b_min=0.0, b_max=1.0, clip=True),
RandCropByPosNegLabeld(
keys=["image", "label"],
label_key="label",
spatial_size=(96, 96, 96),
pos=1, neg=1, num_samples=4,
),
RandFlipd(keys=["image", "label"], prob=0.5, spatial_axis=0),
RandFlipd(keys=["image", "label"], prob=0.5, spatial_axis=1),
RandFlipd(keys=["image", "label"], prob=0.5, spatial_axis=2),
RandRotate90d(keys=["image", "label"], prob=0.1, max_k=3),
EnsureTyped(keys=["image", "label"]),
])
val_transforms = Compose([
LoadImaged(keys=["image", "label"]),
EnsureChannelFirstd(keys=["image", "label"]),
Orientationd(keys=["image", "label"], axcodes="RAS"),
Spacingd(keys=["image", "label"], pixdim=(1.5, 1.5, 1.5),
mode=("bilinear", "nearest")),
ScaleIntensityRanged(keys=["image"], a_min=-991, a_max=362,
b_min=0.0, b_max=1.0, clip=True),
EnsureTyped(keys=["image", "label"]),
])
train_ds = CacheDataset(data=train_files, transform=train_transforms,
cache_rate=0.5, num_workers=4)
val_ds = CacheDataset(data=val_files, transform=val_transforms,
cache_rate=0.5, num_workers=4)
train_loader = DataLoader(train_ds, batch_size=2, shuffle=True, num_workers=4)
val_loader = DataLoader(val_ds, batch_size=1, shuffle=False, num_workers=4)
# 使用 MONAI 内置 nnU-Net 风格模型
from monai.networks.nets import SwinUNETR
model = SwinUNETR(
img_size=(96, 96, 96),
in_channels=1,
out_channels=16, # 0=背景 + 1-15=器官
feature_size=48,
).cuda()
from monai.losses import DiceCELoss
from monai.metrics import DiceMetric
loss_function = DiceCELoss(to_onevent-blocked=True, softmax=True)
dice_metric = DiceMetric(include_background=False, reduction="mean")
optimizer = torch.optim.SGD(model.parameters(), lr=0.01, momentum=0.99)
print("✅ 数据加载和模型初始化完成,可以开始训练")
§6.2 数据获取
| 数据版本 | 下载地址 | 大小 | 说明 |
|---|---|---|---|
| 标注数据 | Zenodo | ~15 GB | 500 CT + 100 MRI + 标注 |
| 未标注 CT Part I | Zenodo | ~18 GB | 900 例未标注 CT |
| 未标注 CT Part II | Zenodo | ~22 GB | 1,100 例未标注 CT |
| 未标注 MRI Part III | Zenodo | ~10.7 GB | 1,200 例未标注 MRI |
| 官方代码 | GitHub | — | 基线模型训练与评估代码 |
下载方式:Zenodo 直接下载,无需注册或申请。数据以 ZIP 压缩包形式提供,解压后为 NIfTI 格式。
§6.3 预处理全流程
<details>
<summary>预处理 Pipeline 完整代码(含 CT/MRI 分别处理)</summary>
import numpy as np
import nibabel as nib
from scipy.ndimage import zoom
def preprocess_ct(image_np):
"""CT 预处理:HU 值裁剪 + 归一化"""
# 裁剪 HU 值到 [-991, 362](论文标准)
image_np = np.clip(image_np, -991, 362)
# 归一化:减去 50,除以 141
image_np = (image_np.astype(np.float32) - 50.0) / 141.0
return image_np
def preprocess_mri(image_np):
"""MRI 预处理:Z-score 归一化"""
mean = np.mean(image_np)
std = np.std(image_np)
if std > 0:
image_np = (image_np.astype(np.float32) - mean) / std
else:
image_np = image_np.astype(np.float32) - mean
return image_np
def resample_volume(image_np, label_np, original_spacing, target_spacing=(1.5, 1.5, 1.5)):
"""重采样到统一体素间距"""
zoom_factors = [o / t for o, t in zip(original_spacing, target_spacing)]
image_resampled = zoom(image_np, zoom_factors, order=1) # 线性插值
label_resampled = zoom(label_np, zoom_factors, order=0) # 最近邻插值
return image_resampled, label_resampled
def load_and_preprocess(image_path, label_path, modality="CT"):
"""加载并预处理单例扫描"""
image_nii = nib.load(image_path)
label_nii = nib.load(label_path)
image_np = image_nii.get_fdata()
label_np = label_nii.get_fdata().astype(np.int32)
# 获取原始体素间距
original_spacing = image_nii.header.get_zooms()[:3]
# 重采样
image_resampled, label_resampled = resample_volume(
image_np, label_np, original_spacing
)
# 模态特定预处理
if modality == "CT":
image_processed = preprocess_ct(image_resampled)
else:
image_processed = preprocess_mri(image_resampled)
return image_processed, label_resampled
# 批量预处理示例
import os
import glob
data_root = "./data/amos22"
output_root = "./data/amos22_preprocessed"
os.makedirs(output_root, exist_ok=True)
image_files = sorted(glob.glob(os.path.join(data_root, "ImagesTr", "*.nii.gz")))
for img_path in image_files:
filename = os.path.basename(img_path)
label_path = img_path.replace("ImagesTr", "labelsTr")
# 判断模态(通过 dataset.json 或文件名约定)
# 这里简化处理:实际使用时应查询 dataset.json
modality = "CT" # or "MRI"
image, label = load_and_preprocess(img_path, label_path, modality)
# 保存预处理后数据
np.save(os.path.join(output_root, filename.replace(".nii.gz", "_img.npy")), image)
np.save(os.path.join(output_root, filename.replace(".nii.gz", "_lbl.npy")), label)
print(f"预处理完成,共处理 {len(image_files)} 例")
</details>
§6.4 框架加载
<details>
<summary>TensorFlow / Keras DataLoader</summary>
import tensorflow as tf
import nibabel as nib
import numpy as np
class AMOSTFDataset:
def __init__(self, data_root, split="train", patch_size=(96, 96, 96),
batch_size=2, augment=True):
self.data_root = data_root
self.split = split
self.patch_size = patch_size
self.batch_size = batch_size
self.augment = augment
# 加载文件列表
img_dir = os.path.join(data_root, f"Images{''''''''Tr'''''''' if split == ''''''''train'''''''' else ''''''''Va''''''''}")
lbl_dir = os.path.join(data_root, f"labels{''''''''Tr'''''''' if split == ''''''''train'''''''' else ''''''''Va''''''''}")
self.image_paths = sorted(glob.glob(os.path.join(img_dir, "*.nii.gz")))
self.label_paths = [p.replace("Images", "labels") for p in self.image_paths]
def _load_volume(self, image_path, label_path):
image = nib.load(image_path.numpy().decode()).get_fdata().astype(np.float32)
label = nib.load(label_path.numpy().decode()).get_fdata().astype(np.int32)
# CT HU 裁剪与归一化
image = np.clip(image, -991, 362)
image = (image - 50.0) / 141.0
return image, label
def _random_crop(self, image, label):
"""随机裁剪 patch"""
d, h, w = image.shape
pd, ph, pw = self.patch_size
d_start = np.random.randint(0, max(d - pd, 1))
h_start = np.random.randint(0, max(h - ph, 1))
w_start = np.random.randint(0, max(w - pw, 1))
image_patch = image[d_start:d_start+pd, h_start:h_start+ph, w_start:w_start+pw]
label_patch = label[d_start:d_start+pd, h_start:h_start+ph, w_start:w_start+pw]
return image_patch, label_patch
def _augment(self, image, label):
if np.random.random() > 0.5:
image = np.flip(image, axis=0).copy()
label = np.flip(label, axis=0).copy()
if np.random.random() > 0.5:
image = np.flip(image, axis=1).copy()
label = np.flip(label, axis=1).copy()
if np.random.random() > 0.5:
image = np.flip(image, axis=2).copy()
label = np.flip(label, axis=2).copy()
return image, label
def _generator(self):
for img_path, lbl_path in zip(self.image_paths, self.label_paths):
image, label = self._load_volume(
tf.constant(img_path), tf.constant(lbl_path)
)
image, label = self._random_crop(image, label)
if self.augment:
image, label = self._augment(image, label)
image = image[..., np.newaxis] # 添加通道维度
label = label[..., np.newaxis]
yield image, label
def get_dataset(self):
output_signature = (
tf.TensorSpec(shape=(*self.patch_size, 1), dtype=tf.float32),
tf.TensorSpec(shape=(*self.patch_size, 1), dtype=tf.int32),
)
ds = tf.data.Dataset.from_generator(self._generator, output_signature=output_signature)
ds = ds.batch(self.batch_size)
ds = ds.prefetch(tf.data.AUTOTUNE)
return ds
</details>
§6.5 常见坑点
⚠️ 坑点 1:MRI OOD 性能断崖式下降(分类:偏倚陷阱 / 域偏移)
问题:AMOS-MRI 中扫描仪 F(Ingenia)完全用于 OOD 测试,其强度分布与训练集扫描仪 G(Prisma 均值 344)和 H(Signa HDe 均值 22,937)差异巨大(Ingenia 均值 58,761)。直接使用在 G+H 上训练的模型对 F 进行推理,性能从 86.05% mDice(ID)骤降至 64.70% mDice(OOD),下降 21.25%。
症状:MRI OOD 测试集上 mDice 大幅下降;某些器官(如肾上腺、十二指肠)在 OOD MRI 上几乎完全无法分割。
解决:
- Z-score 逐例归一化:对每例 MRI 扫描独立进行 Z-score 归一化,而非使用全局统计量
- 直方图匹配:将 OOD 扫描仪数据直方图匹配到训练集分布
- 域自适应训练:利用未标注 MRI 数据进行无监督域自适应(如 AdaBN、DANN)
- 模态特定预处理:为不同 MRI 扫描仪设计特定的强度归一化策略
参考:Ji et al. (2022), NeurIPS. AMOS 原始论文 Table 10 显示 MRI OOD 性能全面下降。
⚠️ 坑点 2:长尾器官分布导致小器官分割失败(分类:标签理解 / 数据分布)
问题:肝脏标注体积约为肾上腺的 200 倍。使用标准 Dice 损失训练时,模型倾向于优化大器官(肝脏、脾脏、肾脏)而忽略小器官(肾上腺、十二指肠、食管),导致小器官 mDice 远低于大器官。
症状:整体 mDice 看似合理(~85%),但肾上腺 mDice 仅 65-80%、十二指肠 72-83%,远低于肝脏 96-97%。
解决:
- 加权 Dice 损失:按器官体积反比分配权重,小器官获得更高权重
- Tversky 损失:调整 FN/FP 权重比例,提高小器官召回率
- 多尺度训练:使用不同 patch 大小训练,大 patch 关注大器官,小 patch 关注小器官
- 器官级后处理:对每个器官设置最小体积阈值,去除过小的假阳性连通域
参考:论文 Table 10 逐器官结果。Isensee et al. (2022) “Extending nnU-Net” 的后处理策略。
⚠️ 坑点 3:单一标注者无标注一致性验证(分类:标签理解 / 标注质量)
问题:每例扫描由单一标注者完成,无多次标注聚合。虽然资深医生共识审核可以减少错误,但无法消除个体标注偏差。论文未报告标注者间一致性(Inter-annotator Agreement, IAA)指标。
症状:不同标注者负责的扫描可能存在系统性差异,影响模型学习的一致性。
解决:
- 交叉验证分析:检查不同标注者负责的扫描上模型性能是否有显著差异
- 标签平滑:在边界体素使用标签平滑减少过拟合标注偏差
- 边界感知训练:使用边界感知损失函数降低对精确边界标注的依赖
- 不确定性估计:使用 Monte Carlo Dropout 估计模型预测不确定性,高不确定性区域可能对应标注不一致区域
参考:论文 Appendix B.2 明确说明"Each scan is annotated by one single annotator without multiple annotations for aggregation."
⚠️ 坑点 4:许可证信息来源矛盾(分类:工程陷阱 / 合规风险)
问题:AMOS 论文正文声明数据采用 CC BY-NC-SA(署名-非商业性-相同方式共享)许可,但 Zenodo 托管页面标注为 CC BY 4.0(署名 4.0),STU-Net 的 dataset.json 标注为 CC-BY-SA 4.0。三个来源的许可条款差异显著:CC BY-NC-SA 禁止商业用途且要求衍生作品相同许可,CC BY 4.0 允许商业用途,CC-BY-SA 4.0 允许商业但要求相同许可。
症状:研究者无法确定数据集的准确许可条款,可能导致合规风险。
解决:
- 保守策略:按最严格的 CC BY-NC-SA 对待——不用于商业用途,衍生作品采用相同许可
- 联系作者确认:通过 GitHub Issues 或邮件向数据集作者确认最终许可
- 在论文中明确声明:使用数据集时在论文中声明所依据的许可来源
参考:arXiv:2206.08023 附录 B.3 vs Zenodo 记录 vs STU-Net dataset.json。
⚠️ 坑点 5:CT OOD 扫描仪域偏移被低估(分类:偏倚陷阱 / 域偏移)
问题:虽然 CT 的 ID/OOD 性能差距(88.04% → 89.67%)看似很小甚至反常(OOD 更高),但这可能是因为 CT 遵循标准化的 HU 值刻度,不同扫描仪间强度分布相对一致。然而,扫描仪 D(Optima CT660)和 E(Optima CT540)在切片间距(1.25-5.0 mm vs 训练集的 5.0 mm)和切片数(67-369 vs 68-140)上与训练集存在差异,可能影响模型在细分辨率数据上的表现。
症状:CT OOD 结果看似正常,但在实际部署到新机构数据时性能意外下降。
解决:
- 多分辨率训练:在训练时混合不同体素间距的数据
- 间距感知预处理:重采样到统一间距后再训练
- 不要仅依赖 AMOS OOD 结果:在至少一个外部数据集上验证泛化性
参考:论文 Table 9 显示扫描仪间切片间距和分辨率差异。
⚠️ 坑点 6:测试集标签不公开限制可复现性(分类:工程陷阱 / 评估限制)
问题:AMOS 测试集(200 CT + 40 MRI)的标注仅限挑战赛评估服务器使用,不公开发布。研究者无法在本地评估模型在测试集上的性能,也无法进行细粒度的错误分析。
症状:只能使用验证集(100 CT + 20 MRI)进行评估,模型选择和性能报告受限于验证集规模。
解决:
- 使用验证集评估:在验证集上报告 5 折交叉验证结果,提供性能置信区间
- 提交挑战赛评估:通过 Grand Challenge 提交 Docker 容器获取测试集结果
- 合并 train+val 进行内部 CV:将 300 例(200 train + 100 val)合并后进行 5 折交叉验证
- 外部验证:在 BTCV、AbdomenCT-1K 等外部数据集上评估迁移性能
参考:AMOS 2022 挑战赛官方规则。
§6.6 数据增强安全表
| 增强方式 | 安全性 | 推荐概率 | 参数范围 | 说明 |
|---|---|---|---|---|
| 随机翻转(三轴) | ✅ 安全 | 0.5/轴 | — | 腹部近似左右对称,但注意不对称器官(肝脏偏右) |
| 随机旋转 | ✅ 安全 | 0.2 | [-30°, 30°] | 小角度旋转,大角度会破坏解剖学位置关系 |
| 随机缩放 | ✅ 安全 | 0.2 | [0.7, 1.4] | 模拟不同患者体型 |
| 随机高斯噪声 | ✅ 安全 | 0.1 | σ∈[0, 0.1] | 模拟设备噪声 |
| 随机高斯模糊 | ✅ 安全 | 0.2 | σ∈[0.5, 1.0] | 模拟不同分辨率 |
| 随机亮度 | ✅ 安全 | 0.15 | [0.75, 1.25] | CT 在 HU 裁剪后应用 |
| 随机对比度 | ✅ 安全 | 0.15 | [0.75, 1.25] | 增强对不同扫描仪的鲁棒性 |
| 模拟低分辨率 | ✅ 安全 | 0.25 | [0.5, 1.0] | 模拟 OOD 扫描仪低分辨率 |
| 随机 Gamma 变换 | ✅ 安全 | 0.3 | [0.7, 1.5] | 增强强度变化鲁棒性 |
| 随机弹性形变 | ⚠️ 谨慎 | 0.1 | 小幅度 | 可能破坏器官间空间关系 |
| Mixup / CutMix | ❌ 危险 | 0 | — | 混合不同患者的腹部扫描会生成解剖学上不合理的样本 |
§6.7 推荐模型配置
| 模型 | 参数量 | Task 1 mDice | Task 2 mDice | 推荐场景 | 代码 |
|---|---|---|---|---|---|
| nnU-Net(扩展版) | ~35M | 90.13% | 89.06% | 最佳基线 / 挑战赛 | GitHub |
| UNet(nnU-Net 默认) | 31.18M | 88.87% | 85.59% | 快速基线 / 资源有限 | MONAI 内置 |
| Swin-UNETR | 62.83M | 86.37% | 75.70% | Transformer 对比实验 | GitHub |
| nnFormer | 150.14M | 85.63% | 80.60% | Transformer 研究 | GitHub |
| MaskMed | — | 91.30% | — | 最新 SOTA / mask 分类范式 | arXiv:2511.15603 |
| MaskSAM | — | 90.50% | — | SAM 范式 / prompt 分割 | arXiv:2403.14103 |
| STU-Net(Large) | — | ~90%+ | — | 可扩展预训练 | GitHub |
§6.8 硬件配置
| 配置级别 | GPU | 显存 | 磁盘 | 训练时间(1000 epochs) | 说明 |
|---|---|---|---|---|---|
| 最低 | RTX 3090 | 24 GB | 100 GB SSD | ~5 天 | patch 96³, batch 2 |
| 推荐 | A100 40GB | 40 GB | 200 GB SSD | ~3 天 | patch 128³, batch 4 |
| 高性能 | A100 80GB ×2 | 160 GB | 500 GB NVMe | ~1.5 天 | 5-fold CV 并行 |
| 挑战赛级 | H100 ×4 | 320 GB | 1 TB NVMe | ~12 小时 | 大 ensemble + 后处理 |
§6.9 评估指标代码
import torch
import numpy as np
from monai.metrics import DiceMetric, SurfaceDiceMetric
def evaluate_segmentation(pred, label, num_classes=16, include_background=False):
"""
计算 AMOS 官方评估指标
pred: (B, C, D, H, W) 预测 logits
label: (B, 1, D, H, W) 真实标签
"""
pred_label = torch.argmax(pred, dim=1, keepdim=True)
# 1. 平均 Dice (mDice)
dice_metric = DiceMetric(include_background=include_background,
reduction="mean")
dice_metric(pred_label, label)
mdice = dice_metric.aggregate().item()
dice_metric.reset()
# 2. 平均归一化表面距离 (mNSD)
# 容忍度 = 1mm(默认)
nsd_metric = SurfaceDiceMetric(
include_background=include_background,
reduction="mean",
class_thresholds=[1.0] * (num_classes - 1 if not include_background else num_classes)
)
nsd_metric(pred_label, label)
mnsd = nsd_metric.aggregate().item()
nsd_metric.reset()
# 3. 逐器官 Dice
organ_names = ["Spleen", "R.Kidney", "L.Kidney", "Gallbladder", "Esophagus",
"Liver", "Stomach", "Aorta", "IVC", "Pancreas",
"R.Adrenal", "L.Adrenal", "Duodenum", "Bladder", "Prostate/Uterus"]
organ_dice = {}
for i, organ in enumerate(organ_names, start=1):
pred_organ = (pred_label == i).float()
label_organ = (label == i).float()
intersection = (pred_organ * label_organ).sum()
union = pred_organ.sum() + label_organ.sum()
if union > 0:
organ_dice[organ] = (2.0 * intersection / union).item()
else:
organ_dice[organ] = float(''''''''nan'''''''') # 该器官不存在
return {
"mDice": mdice,
"mNSD": mnsd,
"organ_dice": organ_dice,
}
# ID/OOD 性能差距分析
def analyze_domain_gap(results_id, results_ood):
"""分析分布内/外性能差距"""
gap = {}
for key in results_id:
if isinstance(results_id[key], float):
gap[key] = results_id[key] - results_ood[key]
return gap
§6.10 MLOps 笔记
-
模型版本管理:建议使用 MLflow 或 W&B 跟踪 5 折交叉验证结果,记录每折的 mDice/mNSD 和逐器官性能
-
推理优化:使用滑窗推理(窗口=训练 patch 大小)+ 高斯权重重叠 + 测试时增强(三轴翻转)
-
后处理策略:对每个器官设置最小体积阈值,去除过小的假阳性连通域(Isensee et al. 的获胜策略之一)
-
Docker 部署:挑战赛要求提交 Docker 容器,建议基于
pytorch/pytorch:2.0-cuda11.8镜像构建
§7 质量评估与局限性(Quality & Limitations)
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 所有数据来自深圳 2 家医院,仅亚洲人群 | 高 | 需在欧美人群数据上外部验证 |
| 疾病分布偏倚 | 肿瘤:其他异常 = 3:2,偏向肿瘤患者 | 中 | 注意模型在非肿瘤患者上的适用性 |
| 性别偏倚 | CT 男性 62.8% 显著高于女性 | 中 | 分性别报告性能差异 |
| 设备偏倚 | OOD 扫描仪完全保留用于测试,训练集设备覆盖有限 | 中 | 利用未标注数据进行域自适应 |
| 标注偏倚 | 单一标注者,无 IAA 指标 | 中 | 使用标签平滑和不确定性估计 |
| 长尾分布偏倚 | 肝脏体积约肾上腺 200 倍 | 高 | 加权损失 + 多尺度训练 |
§7.2 标注质量评估
| 标注方式 | 准确率 | 一致性 | 局限性 |
|---|---|---|---|
| 半自动预标注(3D-UNet/VNet) | ~70-80%(初始粗标注) | — | 需人工逐层修正 |
| 初级医生修正 | ~90-95%(估计) | 中等 | 5 名标注者间可能存在系统性差异 |
| 资深医生共识审核 | ~95%+(估计) | 较高 | 3 人共识但无定量 IAA |
| 整体标注质量 | 参考标准级 | 中等 | 单标注者设计是主要局限 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 欧美人群数据 | 高 | 仅中国深圳数据,体型和病理谱可能不同 |
| 儿童腹部分割 | 高 | CT 最小年龄 14 岁,无儿科专用数据 |
| 非肿瘤患者 | 中 | 3:2 肿瘤比例可能不代表普通筛查人群 |
| 新厂商扫描仪 | 中-高 | OOD 测试仅覆盖 2 台 CT + 1 台 MRI 扫描仪 |
| 术后解剖变异 | 高 | 手术切除器官后的解剖变异未特殊标注 |
§7.4 伦理考量
- IRB 审批:龙岗中心医院(2021ECJ012)和龙岗人民医院(2021077)均获得研究伦理委员会批准
- 去标识化:所有 PHI 从 DICOM 头文件中移除后转换为 NIfTI 格式
- 回顾性数据:数据为回顾性收集,未提及患者知情同意(可能为 IRB 豁免)
- 非商业许可:CC BY-NC-SA 禁止商业用途,限制临床产品化
- 人群代表性:仅亚洲人群,模型在其他种族群体上的公平性未验证
§7.5 公平性评估
def fairness_audit(model, val_loader, metadata):
"""按人口统计学子群体评估分割性能差异"""
results = {"male": [], "female": []}
for batch in val_loader:
image, label, gender = batch
pred = model(image)
dice = compute_dice(pred, label)
results[gender].append(dice)
male_perf = np.mean(results["male"])
female_perf = np.mean(results["female"])
gap = abs(male_perf - female_perf)
print(f"男性 mDice: {male_perf:.4f}")
print(f"女性 mDice: {female_perf:.4f}")
print(f"性别差距: {gap:.4f}")
# AMOS CT: 男性 314 vs 女性 186,存在性别不平衡
# 需关注模型是否对少数性别(女性)性能更差
§7.6 数据漂移提示
- CT 体素间距漂移:训练集扫描仪 A/B 为 5.0 mm,OOD 扫描仪 D/E 为 1.25-5.0 mm,分辨率差异可能影响薄层扫描上的性能
- MRI 强度分布漂移:不同 MRI 扫描仪间强度均值差异可达 2 个数量级,是最严重的漂移源
- 时间漂移:数据采集跨度 2018-2021,设备协议可能随时间变化
§7.7 DAIMS 24 项数据就绪度评估表
| # | 评估项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据采集协议文档化 | ✅ | 论文 Section 3 + Appendix B 详细描述 |
| 2 | 入排标准明确 | ✅ | 腹部肿瘤/异常确诊 + 成像质量达标 + 多设备多样性 |
| 3 | 标注协议文档化 | ✅ | 半自动两阶段流程,ITK-SNAP 工具,矢状面逐层 |
| 4 | 标注者资质文档化 | ✅ | 5 名初级(5 年)+ 3 名资深(10 年以上)放射科医生 |
| 5 | 标注者间一致性测量 | ❌ | 单一标注者,无 IAA 指标 |
| 6 | 标签分布文档化 | ✅ | 长尾分布,肝脏约肾上腺 200 倍 |
| 7 | 数据格式标准化 | ✅ | NIfTI (.nii.gz),标准医学影像格式 |
| 8 | 元数据完整性 | ✅ | 扫描仪信息、人口统计学、切片间距均记录 |
| 9 | 训练/验证/测试划分文档化 | ✅ | ID/OOD 按扫描仪域划分,设计创新 |
| 10 | 数据质量控制 | ✅ | 资深医生共识审核 + 迭代修正 |
| 11 | 缺失值文档化 | ⚠️ | 部分器官缺失(手术切除)未逐例标注 |
| 12 | 已知偏倚文档化 | ✅ | 论文 Section 5 讨论人群、设备、标注偏倚 |
| 13 | 伦理审批文档化 | ✅ | 两个 IRB 编号明确 |
| 14 | 知情同意 | ⚠️ | 回顾性数据,未明确提及知情同意或豁免 |
| 15 | 去标识化方法 | ✅ | DICOM PHI 移除 + NIfTI 格式转换 |
| 16 | 许可证清晰 | ⚠️ | 论文 CC BY-NC-SA vs Zenodo CC BY 4.0 矛盾 |
| 17 | 版本控制 | ✅ | Zenodo 版本管理 + GitHub 仓库 |
| 18 | 引用信息 | ✅ | BibTeX 提供 |
| 19 | 数据可访问性 | ✅ | Zenodo 免费下载,无需注册 |
| 20 | 可复现性 | ✅ | 代码 + 基线 + 预训练模型公开 |
| 21 | 公平性评估 | ❌ | 无跨子群体性能分析 |
| 22 | 数据漂移提示 | ✅ | 多扫描仪设计 + ID/OOD 评估框架 |
| 23 | 维护计划 | ✅ | GitHub Issues 收集标注错误报告 |
| 24 | 外部验证 | ✅ | 迁移至 BTCV 等 10 个数据集验证 |
DAIMS 评分:20 / 24
评分解读:良好 — 大规模、多中心、多设备的高质量标注数据集,ID/OOD 划分设计是领域标杆。对你意味着什么:该数据集的规范性总体优秀。主要扣分项集中在:单一标注者无 IAA(#5)、许可证来源矛盾(#16)、缺乏公平性评估(#21)。建议在训练前执行以下操作:(1) 对小器官使用加权 Dice 损失应对长尾分布;(2) 按 CC BY-NC-SA(最严格来源)对待许可条款,避免商业用途合规风险;(3) 在验证集上分性别/分设备报告性能差异,自行补充公平性评估;(4) 利用 3,200 例未标注数据进行半监督训练提升 OOD 鲁棒性。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 样本量 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|---|
| BTCV | Vanderbilt University | 30 例 | 13 器官分割 | 90.83% mDice | +1.96% | AMOS 预训练模型超越 BTCV 自身训练(83.62%),证明迁移价值 |
| AbdomenCT-1K | 多中心 | 1,112 例 | 4 器官分割 | — | — | AMOS 预训练模型在该数据集上显著提升 |
| 10 个目标数据集 | 多来源 | 变化 | 多器官分割 | 变化 | — | 5/10 数据集上 AMOS 预训练显著优于从头训练 |
| FLARE 2023 | 多中心 | 变化 | 腹部器官分割 | 92.3% (器官) | — | FLARE 冠军模型基于 AMOS 训练经验 |
约束:本矩阵仅记录有同行评审论文支撑的外部评估结果。不收录未经验证的社区自评数据。
§8 基准性能与生态(Benchmarks & Ecosystem)
§8.1 排行榜
AMOS-CT Task 1 排行榜(验证集 / 5 折交叉验证)
注意:不同论文的评估方式不同(验证集 vs 5 折 CV vs 测试集),绝对数值不可直接比较。以下表格标注了评估方式。
| 排名 | 模型 | mDice (%) | mNSD (%) | 评估方式 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|---|---|
| 1 | MaskMed | 91.30 | — | 5-fold CV | 2025 | Mask 分类范式 + 解耦预测 | arXiv:2511.15603 | — |
| 2 | nnU-Net (扩展版) | 90.13 | — | 5-fold CV | 2022 | 残差连接 + 超参优化 + 后处理 | Isensee et al., MICCAI 2022. DOI:10.1007/978-3-658-41657-7_7 | GitHub |
| 3 | MaskSAM | 90.50 | — | 5-fold CV | 2024 | SAM + Mask 分类 + 自动 prompt | arXiv:2403.14103 | — |
| 4 | UNet (nnU-Net) | 88.87 | 79.87 | Val | 2022 | 标准 3D U-Net | Ji et al., NeurIPS 2022 | GitHub |
| 5 | Swin-UNETR | 86.37 | 75.32 | Val | 2022 | Swin Transformer + U-Net | Hatamizadeh et al., 2022 | GitHub |
| 6 | nnFormer | 85.63 | 74.15 | Val | 2022 | 神经网络 Transformer | Zhou et al., 2021 | GitHub |
| 7 | VNet | 81.96 | 67.94 | Val | 2022 | 3D V-Net | Milletari et al., 2016 | MONAI 内置 |
| 8 | UNETR | 78.33 | 61.49 | Val | 2022 | 3D Transformer U-Net | Hatamizadeh et al., 2022 | MONAI 内置 |
| 9 | CoTr | 77.13 | 64.15 | Val | 2022 | CNN-Transformer 混合 | Xie et al., 2021 | GitHub |
AMOS 挑战赛 2022 最终排名(测试集,Docker 提交)
| 排名 | 团队 | Task 1 mDice | Task 2 mDice | 关键方法 |
|---|---|---|---|---|
| 🥇 | nnU-Net (DKFZ) | 第一名 | 第一名 | nnU-Net 扩展 + 残差连接 + 后处理 |
| 🥈 | — | 第二名 | — | — |
| 🥉 | — | 第三名 | — | — |
挑战赛说明:Isensee et al.(DKFZ 团队)在两项任务上均以显著优势获得第一名。挑战赛使用未公开的测试集,通过 Docker 提交评估。
§8.2 SOTA 总结与选型建议
| 选型建议 | 推荐方法 | 理由 |
|---|---|---|
| 最佳开箱即用基线 | nnU-Net(扩展版) | 挑战赛冠军,自动配置,代码成熟 |
| 快速原型验证 | MONAI Swin-UNETR | MONAI 框架内置,配置简单 |
| 前沿研究方向 | MaskMed / MaskSAM | Mask 分类范式是 2024-2025 最新趋势 |
| 资源受限场景 | 标准 UNet (nnU-Net 默认) | 31M 参数,88.87% mDice,性价比最高 |
| 跨模态研究 | nnU-Net + 模态特定归一化 | Task 2 冠军方案的核心策略 |
§8.3 官方评测协议
- 指标:mDice(平均 Dice)+ mNSD(平均归一化表面距离,容忍度 1mm)
- 评估范围:15 个器官(不含背景),取算术平均
- 提交方式:Docker 容器提交至 Grand Challenge 评估服务器
- 排名规则:Task 1 按 CT 测试集 mDice 排名;Task 2 按 CT+MRI 测试集 mDice 排名
- 推理限制:单 GPU 推理,限时 10 分钟/例
§8.4 相关数据集
| 数据集 | 样本量 | 模态 | 器官数 | 关系 |
|---|---|---|---|---|
| BTCV | 50 | CT | 13 | 互补:经典小规模基准,可与 AMOS 互相验证 |
| AbdomenCT-1K | 1,112 | CT | 4 | 互补:大规模但器官少,适合大规模预训练 |
| CHAOS | 80 | CT+MRI | 4 | 同类:跨模态但规模小 |
| WORD | 150 | CT | 16 | 同类:器官数相近,可做外部验证 |
| MSD Task03 | 484 | CT | 3 | 互补:仅肝/肾/脾,可做专项验证 |
| FLARE | 变化 | CT | 13 | 同类:后续挑战赛,部分基于 AMOS 经验 |
§8.5 关键论文
-
Ji, Y. et al. (2022). “AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation.” NeurIPS 2022. DOI: 10.48550/arXiv.2206.08023
— 数据集原始论文,提出 AMOS 数据集和基线基准 -
Isensee, F. et al. (2022). “Extending nnU-Net is all you need.” MICCAI 2022 Workshop. DOI: 10.48550/arXiv.2208.10791
— AMOS 2022 挑战赛冠军方案,nnU-Net 扩展版 -
Hatamizadeh, A. et al. (2022). “Swin UNETR: Swin Transformers for Semantic Segmentation of Brain Tumors in MRI Images.” MICCAI 2022.
— Swin-UNETR 架构,AMOS 基线之一 -
Ma, J. et al. (2021). “AbdomenCT-1K: Is Abdominal Organ Segmentation a Solved Problem?” IEEE TMI.
— AbdomenCT-1K 数据集,AMOS 的主要对比对象 -
Landman, B. et al. (2015). “MICCAI Multi-Atlas Labeling Beyond the Cranial Vault.”
— BTCV 数据集,AMOS 迁移学习验证的目标数据集 -
Cheng, J. et al. (2024). “MaskSAM: Auto-prompt SAM with Mask Classification for Volumetric Medical Image Segmentation.” arXiv:2403.14103
— SAM 范式在 AMOS 上的应用 -
Liu, Z. et al. (2023). “STU-Net: Scalable and Transferable Medical Image Segmentation Models Empowered by Large-Scale Supervised Pre-training.” arXiv:2304.06716
— 可扩展预训练分割模型,在 AMOS 上验证 -
Myronenko, A. et al. (2025). “MaskMed: Decoupled Mask and Class Prediction for Medical Image Segmentation.” arXiv:2511.15603
— 2025 最新 SOTA,Mask 分类范式
§8.6 社区活跃度
| 平台 | 指标 | 数值(截至 2026-08) |
|---|---|---|
| Google Scholar | 论文引用 | 778+ |
| Zenodo | 标注数据下载量 | ~3,500+ |
| GitHub (JiYuanFeng/AMOS2022) | Stars | 280+ |
| Grand Challenge | 注册团队数 | 200+ |
| Semantic Scholar | 引用 | 378+ |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/Fork(截至 2026-08) | 为什么值得关注 |
|---|---|---|---|---|
| nnU-Net | 工具库 | GitHub | 6,500+/1,900+ | AMOS 挑战赛冠军框架,自动配置分割 pipeline |
| MONAI | 工具库 | GitHub | 5,800+/1,100+ | 医学影像 AI 框架,内置 AMOS 数据加载和模型 |
| AMOS2022 官方代码 | 官方代码 | GitHub | 280+/80+ | 数据集官方基线模型和评估脚本 |
| STU-Net | 预训练模型 | GitHub | 200+/40+ | 大规模预训练分割模型,含 AMOS 预训练权重 |
| AMOS Grand Challenge | 排行榜 | 链接 | — | 官方挑战赛和持续评测服务器 |
| SOTA-MedSeg | 排行榜 | GitHub | 1,200+/200+ | 持续更新的医学分割 SOTA 追踪 |
§9 相关资源与引用(Resources & Citation)
§9.1 引用格式
@inproceedings{ji2022amos,
title={AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation},
author={Ji, Yuanfeng and Bai, Haotian and Ge, Chongjian and Yang, Jie and Zhu, Ye and Zhang, Ruimao and Li, Zhen and Zhang, Lingyan and Ma, Wanling and Wan, Xiang and Luo, Ping},
booktitle={Advances in Neural Information Processing Systems},
editor={S. Koyejo and S. Mohamed and A. Agarwal and D. Belgrave and K. Cho and A. Oh},
pages={3672236732},
publisher={Curran Associates, Inc.},
volume={35},
year={2022},
url={https://proceedings.neurips.cc/paper_files/paper/2022/file/ee604e1bedbd069d9fc9328b7b9584be-Paper-Datasets_and_Benchmarks.pdf}
}
§9.2 官方资源链接
| 资源 | 链接 |
|---|---|
| 论文 (arXiv) | https://arxiv.org/abs/2206.08023 |
| 论文 (NeurIPS Proceedings) | https://proceedings.neurips.cc/paper_files/paper/2022/hash/ee604e1bedbd069d9fc9328b7b9584be-Abstract-Datasets_and_Benchmarks.html |
| 挑战赛官网 | https://amos22.grand-challenge.org/ |
| 标注数据 (Zenodo) | https://zenodo.org/record/7262581 |
| 未标注 CT (Zenodo) | https://zenodo.org/record/7155725 |
| 未标注 MRI (Zenodo) | https://zenodo.org/record/7295816 |
| GitHub 代码库 | https://github.com/JiYuanFeng/AMOS2022 |
| 伦理审批文件 | https://drive.google.com/drive/folders/1UNHjEgau85rit-DBAKg9kGv6REkiHU6Z |
§9.3 许可证详情
| 项目 | 许可 | 说明 |
|---|---|---|
| 数据(论文声明) | CC BY-NC-SA 4.0 | 署名-非商业性-相同方式共享 |
| 数据(Zenodo 标注) | 见 Zenodo 页面 | 部分记录标注为 CC BY 4.0 |
| 代码 (GitHub) | Apache 2.0 | 允许商业用途 |
许可证矛盾提醒:论文正文声明 CC BY-NC-SA,Zenodo 部分记录标注 CC BY 4.0。建议按最严格的 CC BY-NC-SA 对待数据使用,或联系作者确认。详见 §6.5 坑点 4。
§9.4 第三方工具
| 工具 | 框架 | 说明 |
|---|---|---|
| nnU-Net v2 | PyTorch | 自动配置分割 pipeline,AMOS 冠军框架 |
| MONAI | PyTorch | 医学影像 AI 框架,内置 AMOS 数据加载 |
| STU-Net | PyTorch | 可扩展预训练分割模型,含 AMOS 权重 |
| ITK-SNAP | 独立 | 标注工具,AMOS 原始标注使用 |
| 3D Slicer | 独立 | 可视化和标注工具,支持 NIfTI 格式 |
§9.5 教程与博客
- AMOS 2022 挑战赛官方文档:含数据说明、提交流程和评测协议
- MONAI Tutorials:含 3D 分割教程,可直接适配 AMOS 数据格式
- nnU-Net 文档:含医学影像分割最佳实践和超参配置指南
§9.6 相关挑战赛
| 挑战赛 | 年份 | 关系 |
|---|---|---|
| AMOS 2022 | 2022 | 本数据集对应的挑战赛 |
| FLARE 2021/2022/2023 | 2021-2023 | 后续腹部器官分割挑战赛,部分基于 AMOS 经验 |
| MSD (Medical Segmentation Decathlon) | 2018 | 前身,10 个器官分割任务 |
| BraTS | 2014-2025 | 脑肿瘤分割,同属 3D 医学分割挑战赛生态 |
§9.7 常见问题
Q: AMOS 是否支持商业用途?
A: 论文声明 CC BY-NC-SA 许可(禁止商业用途),但 Zenodo 部分记录标注为 CC BY 4.0(允许商业用途)。建议保守处理,按非商业用途对待,或联系作者确认。
Q: 如何获取测试集标签?
A: 测试集标签不公开。需通过 Grand Challenge 提交 Docker 容器进行评估,或使用验证集进行本地评估。
Q: CT 和 MRI 的文件如何区分?
A: 文件名不区分模态。需查询 dataset.json 中的元数据,或根据文件编号范围判断(通常 MRI 编号在 CT 之后)。
Q: 是否有预处理好的数据?
A: 官方仅提供原始 NIfTI 格式数据。MONAI 和 nnU-Net 框架可自动处理预处理流程。
§10 AI 使用声明卡
§10.1 使用的 AI 模型
| 模型 | 版本 | 用途 |
|---|---|---|
| Claude | Sonnet 4 | 条目撰写、代码生成、数据整理 |
| WebSearch | — | 实时数据检索(引用次数、SOTA 结果) |
§10.2 AI 参与范围
research_and_drafting — AI 参与文献检索、数据整理、代码编写和条目初稿撰写,人工审核全部内容。
§10.3 输入文档
- Ji, Y. et al. (2022). “AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation.” arXiv:2206.08023
- Isensee, F. et al. (2022). “Extending nnU-Net is all you need.” arXiv:2208.10791
- AMOS 2022 Grand Challenge 官方网站 (https://amos22.grand-challenge.org/)
- Zenodo 数据集记录 (7262581, 7155725, 7295816)
- STU-Net dataset.json (AMOS22 Task1 配置)
- MaskMed (2025). arXiv:2511.15603
- MaskSAM (2024). arXiv:2403.14103
- 《Global Medical AI Datasets》(千方内部参考资料)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据规格 | 千方病案医学编辑部 | 与官方论文和 Zenodo 记录交叉比对 | ✅ 已验证 |
| §4 数据结构 | 千方病案医学编辑部 | 与 STU-Net dataset.json 交叉比对 | ✅ 已验证 |
| §5 数据划分 | 千方病案医学编辑部 | 与论文 Table 和 challenge 官网比对 | ✅ 已验证 |
| §6 代码示例 | 千方病案医学编辑部 | 逻辑审查 | ✅ 已通过 |
| §7 DAIMS 评估 | 千方病案医学编辑部 | 逐项核对 | ✅ 已通过 |
| §8 排行榜 | 千方病案医学编辑部 | 与论文和 SOTA-MedSeg 比对 | ✅ 已验证 |
页面状态:published(全部内容已完成审核并发布)
