AMOS

AMOS (Abdominal Multi-Organ Segmentation) | 千方病案医数集

来源 深圳市大数据研究院 / 香港中文大学(深圳)/ 香港大学 / 中山大学发布时间: 2026-07-29最后更新: 2026-07-29 阅读 1

INFOBOX

数据集名称 AMOS (Abdominal Multi-Organ Segmentation)
英文全称 AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation
别名 / 简称 AMOS、AMOS22、AMOS22 挑战赛数据集
疾病分类 腹部多器官覆盖。核心映射:DB98 腹部/盆腔器官异常 / 2D10 肝恶性肿瘤 / 2C11 胃恶性肿瘤 / 2C10 胰腺恶性肿瘤 / MD81 脾肿大 等多疾病谱
SNOMED CT 10200004 Liver / 78961009 Spleen / 64033007 Kidney / 697480004 Gallbladder / 714488004 Pancreas / 103611000119108 Duodenum 等 15 类映射(详见 §2.2)
数据模态 影像(CT / MRI)
AI 任务类型 3D 语义分割、跨模态域适应、OAR 自动勾画
样本总数 600 例扫描(500 CT + 100 MRI),来自 600 名独特患者
数据大小 ~24.2 GB(amos22.zip 压缩包)/ ~89.5 GB(解压后 NIfTI)
数据格式 NIfTI(.nii.gz),nnU-Net 兼容目录结构
许可证 CC BY 4.0(Creative Commons Attribution 4.0 International)
访问级别 开放(直接下载,无需注册审核)
DUO 标签 GRU, PUB
语言 英文(文档)、中文(参与机构)
首发日期 2022-05-01(MICCAI 2022 AMOS22 挑战赛训练集发布)
最后更新 2022-10-10(完整数据集 Zenodo 公开发布)
发布机构 深圳市大数据研究院 / 香港中文大学(深圳)/ 香港大学 / 中山大学 / 龙岗中心医院 / 龙岗区人民医院
官方主页 https://amos22.grand-challenge.org/
下载地址 https://zenodo.org/records/7262581
DOI 10.5281/zenodo.7262581
引用次数 1,200+(Google Scholar,截至 2026-07)
AI 就绪度评分 ⭐⭐⭐⭐ (4/5) — 标准 nnU-Net 兼容目录结构 + 体素级高质量标注 + 官方 train/val/test 划分;扣分项:单城市双中心来源、MRI 样本量仅 100 例
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 映射、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部] 交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-07-29

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议(CC BY 4.0)。AMOS 数据集可自由用于研究和商业用途,但需按协议标注出处。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§1 数据集概览

§1.0 📌 30 秒速览

AMOS 是全球最大规模的多模态腹部多器官分割基准数据集,由深圳市大数据研究院、香港中文大学(深圳)等机构联合深圳两家医院于 2022 年发布。它提供 500 例 CT 和 100 例 MRI 扫描,每例附带 15 个腹部器官的体素级语义分割标注,覆盖脾、肝、双肾、胰腺、胃等关键器官。

它的独特价值在于临床多样性——数据采集自 8 台不同厂商的扫描设备、涵盖平扫与增强扫描、涉及肿瘤与非肿瘤患者——这种设计使 AMOS 成为评估分割算法泛化能力的理想压力测试平台,而非仅仅一个"刷榜"数据集。基于 AMOS 的 MICCAI 2022 挑战赛吸引了全球 550 支队伍参赛。

你可以用它来:训练一个腹部多器官 3D 分割模型、研究跨模态域适应(CT → MRI)、评估自动勾画系统在放疗 OAR 场景中的临床可行性。

§1.1 摘要

AMOS(Abdominal Multi-Organ Segmentation)由 Yuanfeng Ji 等人创建,通过回顾性采集深圳龙岗中心医院和龙岗区人民医院 2017-2022 年的临床数据,构建了当时规模最大、器官覆盖面最广的腹部多器官分割基准。数据集采用 nnU-Net 标准目录结构发布,所有图像和标注均为 NIfTI 格式(.nii.gz),标注流程采用"AI 预标注 + 5 名初级放射科医生修正 + 3 名 10 年以上经验资深放射科医生终审"的三阶段迭代精细化策略,确保了高质量体素级标注。AMOS 挑战赛包含两条赛道:Task 1 为纯 CT 器官分割(500 例),Task 2 为 CT+MRI 跨模态分割(额外 100 例 MRI)。核心论文发表于 NeurIPS 2022

§1.2 战略价值分析

技术创新维度:AMOS 解决了"多器官分割基准规模不足"的行业瓶颈。在它之前,主流数据集(如 BTCV 的 30 例 / 13 器官、LiTS 的 131 例 / 1 器官、KiTS 的 300 例 / 1 器官)要么器官覆盖窄,要么样本量有限,难以全面评估 3D 分割架构的系统性能力。AMOS 的 15 个器官 + 600 例多模态数据直接改变了这一格局,为 nnU-Net / SwinUNETR / UNETR / CoTr 等架构提供了公平的综合评测台。

生态推动维度:AMOS 挑战赛 550 支队伍的参与规模证明了这个数据集的社区牵引力。更重要的是,AMOS 的 nnU-Net 兼容格式使其无缝接入全球最成熟的医学图像分割工具链——研究者下载后即可用 nnUNetv2_plan_and_preprocess 一键启动实验。这种"设计即生产力"的工程思维,让 AMOS 成为腹部分割研究的默认基准,极大降低了复现门槛。

应用影响维度:自动腹部分割是疾病诊断、手术规划、放疗 OAR 勾画的核心预处理步骤。AMOS 多中心/多厂商的特性使研究者能验证算法在跨机构部署时的鲁棒性——这是从"实验室模型"到"临床产品"中最关键的考验。

§1.3 同类数据集对比

数据集 样本量 器官数 模态 标注方式 核心差异化
AMOS (2022) 600 (500 CT + 100 MRI) 15 CT + MRI AI+初级+资深三重审核 最大规模、跨模态、临床多样性
BTCV (2015) 30 13 CT 人工 早年的多器官分割经典基准
LiTS (2019) 201 2 (肝+肿瘤) CT 人工 肝脏与肝肿瘤分割专项
KiTS19 300 2 (肾+肿瘤) CT 人工 肾脏与肾肿瘤分割专项
CHAOS (2019) 60 4 CT + MRI 人工 较早的 CT/MRI 双模态尝试
FLARE21 511 4 CT 人工 大规模但器官数少
FLARE22 2,300 13 CT 半自动+人工 更大规模,关注半监督/低资源
TotalSegmentator 1,204 104 CT 半自动+人工 全身体段覆盖,器官数远超 AMOS

§1.4 版本演进时间轴

时间 事件
2022-04-15 AMOS22 挑战赛官网正式上线,开放队伍注册
2022-05-01 训练集与验证集发布
2022-06-16 核心论文 arXiv 预印本发布 (2206.08023)
2022-07-17 挑战赛第一阶段提交截止
2022-09 MICCAI 2022 DALI Workshop 获奖队伍报告
2022-10-10 完整数据集(含测试集)Zenodo 公开发布 (DOI: 10.5281/zenodo.7262581)
2022-12 正式发表于 NeurIPS 2022 Datasets and Benchmarks Track
2024-06 AMOS-MM 扩展(MICCAI 2024):2,000+ 例 CT + 双语放射学报告 + VQA 任务

§1.5 典型 AI 应用场景

  1. 3D 腹部多器官语义分割:训练一个统一模型同时分割 15 个腹部器官——肝、脾、双肾、胰、胃、胆囊、食管、主动脉、下腔静脉、双肾上腺、十二指肠、膀胱、前列腺/子宫。
  2. 跨模态域适应:利用 Task 2(CT+MRI)探索单一模型在两种模态下的分割一致性,研究 CT→MRI 或 MRI→CT 的域迁移策略。
  3. 长尾器官分割:肾上腺(体积约肝脏的 1/200)和十二指肠是典型的小目标/长尾器官,适合研究类别不平衡下的分割算法优化。
  4. CT 自动 OAR(危及器官)勾画:评估自动勾画算法在放疗计划中的临床可行性,比较 nnU-Net / Auto3DSeg / SwinUNETR 的量化性能与医师主观评分。
  5. 自监督预训练(SSL):利用 500+100 CT/MRI 体积进行 3D 图像自监督预训练,为下游小样本腹部分割任务迁移表征。

§2 医学背景

§2.1 ICD-11 疾病分类编码

ICD-11 编码 中文疾病名 与 AMOS 的关联
DB98 腹部/盆腔器官异常,未特指 数据集中最常见的临床指征
2D10 肝和肝内胆管恶性肿瘤 肝脏分割 → 肿瘤负担评估
2C11 胃恶性肿瘤 胃分割 → 放疗靶区勾画
2C10 胰腺恶性肿瘤 胰腺分割 → 胰头癌可切除性评估
2C12 肾恶性肿瘤 肾脏分割 → 肾部分切除术规划
MD81 脾肿大 脾脏分割 → 脾体积定量
1802 腹主动脉瘤 主动脉分割 → 动脉瘤直径测量

§2.2 SNOMED CT 映射

AMOS 标签 ID 器官英文名 器官中文名 SNOMED CT SNOMED CT 术语
1 Spleen 脾脏 78961009 Spleen (body structure)
2 Right Kidney 右肾 9846003 Right kidney (body structure)
3 Left Kidney 左肾 9847007 Left kidney (body structure)
4 Gallbladder 胆囊 697480004 Gallbladder (body structure)
5 Esophagus 食管 32849002 Esophagus (body structure)
6 Liver 肝脏 10200004 Liver (body structure)
7 Stomach 69695003 Stomach (body structure)
8 Aorta 主动脉 15825003 Aorta (body structure)
9 Inferior Vena Cava 下腔静脉 8993003 Inferior vena cava (body structure)
10 Pancreas 胰腺 714488004 Pancreas (body structure)
11 Right Adrenal Gland 右肾上腺 2715800 Right adrenal gland (body structure)
12 Left Adrenal Gland 左肾上腺 3371006 Left adrenal gland (body structure)
13 Duodenum 十二指肠 103611000119108 Duodenum (body structure)
14 Bladder 膀胱 89837001 Bladder (body structure)
15 Prostate/Uterus 前列腺/子宫 41216001 / 35039007 Prostate (body structure) / Uterus (body structure)

§2.3 疾病描述

腹部器官疾病是全球疾病负担的主要来源之一。原发性肝癌年新发病例约 90 万(全球),5 年生存率仅 18%;胃癌年新发约 100 万;肾脏肿瘤在全身肿瘤中占比约 2-3%。这些疾病的精准诊断和治疗规划严重依赖腹部 CT/MRI 图像中器官的精确分割——而手动勾画不仅耗时(一份完整的腹部多器官勾画约需 2-4 小时),还存在显著的操作者间差异。

§2.4 临床任务定义

临床任务 描述
器官定位与分割 在腹部 CT/MRI 体积中精确分割 15 个关键器官的体素级轮廓
形态学定量 基于分割结果计算各器官体积,辅助肝纤维化/脾肿大/肾萎缩等定量诊断
OAR 勾画 在放疗计划中自动勾画危及器官,确保辐射剂量不超出耐受阈值
手术规划 重建肝脏/肾脏/胰腺的三维形态,辅助肝切除/肾部分切除/胰十二指肠切除的术前规划

§2.5 患者人群特征

维度 特征
数据来源 深圳龙岗中心医院、深圳龙岗区人民医院(2 家中国南方医院)
采集时间 2017-2022
患者总数 600 名(CT: 500, MRI: 100)
年龄分布(CT) 范围 14-94 岁;中位数 54 岁;均值 53.64 岁
年龄分布(MRI) 范围 22-85 岁;中位数 50 岁;均值 48.71 岁
性别比例(CT) 男 314 / 女 186(62.8% / 37.2%)
性别比例(MRI) 男 55 / 女 45(55% / 45%)
疾病类型 腹部肿瘤约 60%,其他腹部异常约 40%(不含健康人对照)
种族分布 未公开释放

§2.6 金标准 / 参考标准

数据划分 标注方式 标注者 金标准性质
Train (200 CT + 40 MRI) AI 预标注 + 人工精修 5 名初级放射科医生(逐例检查)→ 3 名资深放射科医生(10+ 年,终审) 体素级金标准(多轮迭代精细化)
Valid (100 CT + 20 MRI) 同 Train 同 Train 体素级金标准
Test (200 CT + 40 MRI) 同 Train 同 Train(标注不公开发布,仅评测服务器使用) 体素级金标准(私有)

标注质量控制:第二阶段的"人工修正 + 反馈分发"循环被重复多次,有效减少了单个标注者的系统性偏差。三位资深放射科医生(均超 10 年临床经验)负责所有最终验证,显著提升了标注一致性——但论文未公开报道标注者间一致性系数(如 Dice inter-rater / Cohen’‘’‘’‘’‘’‘’‘’‘’'s κ)。

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
标准腹部分割研究(CT only) AMOS22 Task 1 ~22 GB(CT 部分) 500 例 CT 含全标注,任务单一、评测成熟
跨模态分割研究 AMOS22 Task 2 ~24.2 GB(完整包) 含额外 100 例 MRI,需处理 CT/MRI 双模态归一化
3D 医学报告生成 AMOS-MM (2024) 更大(2,088 例) 含 CT 影像 + 中英双语放射学报告
医学 VQA AMOS-MM Task 2 19,562 Q&A 对 基于 CT 影像的临床问答

§3.1 模态详细说明

CT 扫描(500 例):覆盖 5 台 CT 扫描仪(来自 3 个厂商),包含平扫(non-contrast)和增强扫描(contrast-enhanced)。层间距范围 1.25-5.0 mm,切片数 67-369。像素强度因扫描仪而异——详见 §3.9 设备规格表。

MRI 扫描(100 例):覆盖 3 台 MRI 扫描仪,层间距 0.82-6.0 mm,切片数 60-535。MRI 的强度标准化是跨模态分割的主要挑战——没有 CT 的 HU 标度,不同序列和厂商的强度分布差异巨大。

§3.2 样本总量

子集 CT MRI 总计 标注可用性
Training 200 40 240 ✅ 图像 + 标注
Validation 100 20 120 ✅ 图像 + 标注
Test 200 40 240 ✅ 图像(公开)/ 标注(私有,仅评测服务器)
总计 500 100 600

§3.3 数据格式

文件类型 格式 说明
图像体积 NIfTI (.nii.gz) 3D 各向异性体积,int16 数据类型,nnU-Net 兼容
分割标注 NIfTI (.nii.gz) 与图像同名,uint8 整型标签 (0=背景, 1-15=器官)
元数据 JSON (dataset.json) nnU-Net 标准配置:标签映射、模态说明、样本列表
整体打包 ZIP (amos22.zip) 24.2 GB 单个压缩包

§3.4 存储大小

版本 压缩大小 解压后大小
amos22.zip(完整数据集) ~24.2 GB ~89.5 GB
仅 CT 部分(估算) ~22 GB ~80 GB
不含标注的原始 DICOM 不可获取 不可获取

§3.5 标注方法

AMOS 采用三阶段迭代精细化标注流程:

  1. 第一阶段(AI 自动预标注):使用预训练的 3D-UNet / VNet 等分割模型对全部 CT/MRI 体积进行自动预测,生成粗略的伪标注掩码。这一阶段将每个病例的标注启动成本从数小时压缩到数分钟。

  2. 第二阶段(初级放射科医生迭代修正):5 名训练有素的初级放射科医生接收第一阶段伪标注,逐例检查每个器官的分割轮廓,修正偏差和遗漏。修正结果汇总后反馈给团队,进行多轮交叉审查。

  3. 第三阶段(资深放射科医生终审):3 名具有 10 年以上腹部影像诊断经验的资深放射科医生对所有标注进行最终验证和必要微调。

迭代机制:第二阶段内部循环多次——标注审查 → 错误修正 → 反馈分发 → 再次审查——这一交互式过程有效减少了单点偏差,但也意味着标注者的独立性与一致性度量(如 pair-wise Dice)未被分离报告。

§3.6 标注者资质

标注者角色 人数 资质 工作内容
AI 模型 多个 3D-UNet / VNet 预训练分割模型 第一阶段:自动生成伪标注
初级放射科医生 5 名 训练有素 第二阶段:逐例检查、修正分割错误
资深放射科医生 3 名 10 年以上临床腹部影像经验 第三阶段:终审验证

未公开信息:标注者间 Dice 系数 / Cohen’‘’‘’‘’‘’‘’‘’‘’‘s κ / Fleiss’‘’‘’‘’‘’‘’‘’‘’’ κ 等一致性度量指标。DAIMS 评估中将此项标记为未满足。

§3.7 数据采集时间范围

2017 年至 2022 年,约 5 年回顾性采集窗口。

§3.8 地理覆盖

维度 详情
城市 中国深圳
医院数量 2 家(龙岗中心医院、龙岗区人民医院)
代表性 中国南方人群,不能自然地代表其他种族/地域的患者群体

§3.9 采集设备规格

扫描仪代号 模态 厂商 强度中位数 强度均值 5 百分位 99.5 百分位 层间距范围 切片数范围
AMOS-CT-A CT 厂商标识 A 69 63.76 -967 403 5.0/5.0/5.0 68-140
AMOS-CT-B CT 厂商标识 B 45 25 -989 158 5.0/5.0/5.0 68-112
AMOS-CT-C CT 厂商标识 C 63 53.68 -996 401 1.25-5.0 76-353
AMOS-CT-D CT 厂商标识 D 61 0.54 -994 337 1.25-5.0 78-321
AMOS-CT-E CT 厂商标识 E 59 56 -979 353 1.25-5.0 67-369
AMOS-MRI-F MRI 厂商标识 F 574 2258 76 1591 0.86-6.0 60-535
AMOS-MRI-G MRI 厂商标识 G 256 0 344 1666 0.82-3.0 64-512
AMOS-MRI-H MRI 厂商标识 H 845 2293 74 7145 0.82-2.0 100-512

来源:AMOS 论文 Table 9,扫描仪厂商名称在论文附录中被隐去以保护商业信息。CT 强度单位为 HU(Hounsfield Units),MRI 强度为任意单位。

§3.10 深度溯源链

临床诊疗流程(患者就诊于龙岗中心医院/龙岗区人民医院)
    │  适应症:腹部肿瘤 / 其他腹部异常
    │  检查类型:腹部 CT 平扫 / 增强 / MRI
    ▼
PACS 系统存储(DICOM 格式)
    │  自动检索:按检查类型和日期范围批量提取
    │  去标识化:移除 DICOM 头文件中的患者识别信息
    ▼
DICOM → NIfTI 格式转换(dcm2niix / 自研工具)
    │  保留 HU 值(CT)/ 原始强度(MRI)
    ▼
AMOS 原始图像库(.nii.gz)
    │  第一轮:AI 模型自动预标注(3D-UNet / VNet)
    │  第二轮:5 名初级放射科医生 → 迭代修正循环
    │  第三轮:3 名资深放射科医生 → 终审验证
    ▼
AMOS 最终标注库(labelsTr / labelsVa)
    │  组织为 nnU-Net 标准目录结构
    ▼
Zenodo 公开发布(CC BY 4.0)
    amos22.zip (24.2 GB) — 含图像 + 训练/验证标注 + 测试图像
    DOI: 10.5281/zenodo.7262581

§4 数据结构详解

§4.0 目录结构预览

解压 amos22.zip 后,获得 nnU-Net 兼容的标准数据集目录:

amos22/
├── dataset.json              # nnU-Net 元数据:标签映射、模态、文件列表
├── ImagesTr/                 # 训练集图像 (240 例: 200 CT + 40 MRI)
│   ├── amos_0001.nii.gz
│   ├── amos_0004.nii.gz
│   └── ...
├── labelsTr/                 # 训练集标注 (240 例)
│   ├── amos_0001.nii.gz      # 与 ImagesTr 按文件名一一对应
│   ├── amos_0004.nii.gz
│   └── ...
├── ImagesVa/                 # 验证集图像 (120 例: 100 CT + 20 MRI)
│   ├── amos_0008.nii.gz
│   ├── amos_0013.nii.gz
│   └── ...
├── labelsVa/                 # 验证集标注 (120 例)
│   ├── amos_0008.nii.gz
│   ├── amos_0013.nii.gz
│   └── ...
├── ImagesTs/                 # 测试集图像 (240 例: 200 CT + 40 MRI) — 标注私有
│   ├── amos_0002.nii.gz
│   ├── amos_0003.nii.gz
│   └── ...
└── readme.md

§4.1 标签编码与分布

标签 ID 器官 体素量级 相对丰度 难点级别
0 背景
1 Spleen (脾) 中等 (~10⁵)
2 Right Kidney (右肾) 中等 中(左右混淆)
3 Left Kidney (左肾) 中等 中(左右混淆)
4 Gallbladder (胆囊) 小 (~10⁴) 高(体积小、形态变异性大)
5 Esophagus (食管) 小-中 低-中 高(薄壁管状、边界模糊)
6 Liver (肝脏) 大 (~10⁶-10⁷) 最高 极低(最大器官)
7 Stomach (胃) 大-中 中-高 中(壁塌陷/扩张变化)
8 Aorta (主动脉) 中(管状分支)
9 Inferior Vena Cava (下腔静脉) 中-小 中-低 中(管状、边界模糊)
10 Pancreas (胰腺) 中-小 中-低 高(边界弥散)
11 Right Adrenal Gland (右肾上腺) 极小 (~10³) 极低 极高(仅数层可见)
12 Left Adrenal Gland (左肾上腺) 极小 (~10³) 极低 极高(仅数层可见)
13 Duodenum (十二指肠) 极高(管状、不连续)
14 Bladder (膀胱) 中-大 中-高
15 Prostate/Uterus (前列腺/子宫) 中(性别依赖)

长尾特性:肝脏体素量约为肾上腺的 200 倍,十二指肠约为肝脏的 1/50。这种天然的长尾分布使 AMOS 成为评估类别不平衡分割算法的理想基准。

§4.2 DAIMS 标准化字段描述表

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
image int16 3D 数组 腹部 CT/MRI 体积 (512, 512, 98) 模型输入 采集噪声、部分容积效应 无(所有扫描完整) CT: [-1024, 3071] HU; MRI: 任意
label uint8 3D 数组 语义分割掩码 (512, 512, 98) 训练目标 标注者偏差、小器官边缘不确定性 [0, 15] 整数
spacing float[3] 体素间距 (mm) [0.68, 0.68, 5.0] 重采样、物理量计算 NIfTI 头文件精度 随扫描仪而异 >0
affine float[16] 4×4 仿射矩阵 NIfTI affine 配准、坐标变换 浮点精度 每例有 4×4 矩阵
modality enum 图像模态 CTMRI 预处理(归一化策略) 正确分类 已由目录结构区分

§4.3 关键描述性统计

CT 强度统计:5 台 CT 扫描仪间 HU 值分布的均值和百分位存在系统性偏移(见表 §3.9),其中 AMOS-CT-D 的平均 HU 值(0.54)显著低于其他 CT 扫描仪,提示可能以肺部窗为主或包含大量低密度区域。预处理时需注意按扫描仪分批进行 Z-score 归一化或采用 nnU-Net 的数据驱动裁剪策略。

MRI 强度统计:三台 MRI 扫描仪的强度分布完全不可比——均值从 0 到 2,293,99.5 百分位从 1,508 到 7,145。跨 MRI 设备和序列的强度归一化是 Task 2 的核心技术挑战。

空间分辨率:CT 切片内分辨率通常为 0.6-1.0 mm(XY),层间距 1.25-5.0 mm(Z)——各向异性。MRI 的切片内和层间分辨率变化更大。

§4.4 数据层级关系

医院采集 → 患者(600 名独特个体)
    患者 → CT 扫描(唯一,1 例/患者) 或 MRI 扫描(唯一,1 例/患者)
        扫描 → 3D 体积 (NIfTI, D × H × W)
            体积 → 体素(每个体素 1 个标签 0-15)

关键约束:每名患者仅贡献 1 例扫描(1 次检查),不存在同一患者的多次随访——因此无需考虑患者级数据泄漏(patient-level leakage),但也不能用于纵向分析(如肿瘤进展跟踪)。

§5 数据划分与使用建议

§5.1 官方划分方案

划分 CT 数量 MRI 数量 总计 用途
Training 200 40 240 模型训练
Validation 100 20 120 超参数调优、模型选择
Test 200 40 240 最终性能评估(标注私有)

划分方式:随机按患者划分(Random Patient-Level Split),且训练/验证/测试集中年龄、性别、疾病类型(肿瘤 vs 其他)的分布被手动设置为一致。

§5.2 交叉验证建议

官方推荐5 折交叉验证(5-fold cross-validation) 作为标准实验协议,这也是 AMOS 论文基线模型的训练策略和挑战赛获胜方案(Isensee et al.)使用的方法。每折约 192 例训练 + 48 例验证。使用交叉验证的 5 个模型集成可以稳定提升 Dice 约 0.5-1.5 个百分点。

§5.3 Task 1 vs Task 2 训练策略

策略 Task 1(CT only) Task 2(CT+MRI)
输入模态 仅 CT(240 train/120 val/240 test) CT + MRI(280 train/140 val/280 test)
归一化 nnU-Net CT 方案(数据驱动裁剪+归一化) Z-score 归一化(全局均值和标准差)
数据增强 标准 nnU-Net 3D 增强 可考虑额外的域自适应增强
评估指标 DSC + NSD DSC + NSD

§5.4 评估指标

AMOS 挑战赛使用的核心评估指标:

  • DSC(Dice Similarity Coefficient)2|X ∩ Y| / (|X| + |Y|),体素级重叠度量,范围 [0, 1]。对所有非背景标签取平均值。

  • NSD(Normalized Surface Dice):基于表面距离的 Dice 变体,对边界误差的惩罚比体素 Dice 更温和,容忍度通常设为 1 mm。

§6 AI 就绪指南

§6.0 云端快速启动

无需 GPU 的第一公里:由于 AMOS 的 nnU-Net 兼容格式,任何安装 nnU-Net v2 的环境均可零配置启动:

# 1. 下载数据集
wget https://zenodo.org/records/7262581/files/amos22.zip
unzip amos22.zip -d /data/amos22/

# 2. 设置 nnU-Net 环境变量
export nnUNet_raw="/data/nnUNet_raw"
export nnUNet_preprocessed="/data/nnUNet_preprocessed"
export nnUNet_results="/data/nnUNet_results"

# 3. 转换格式并开始预处理
nnUNetv2_plan_and_preprocess -d 032 verify_dataset_integrity

# 4. 训练(5 折交叉验证,CNN 3D fullres)
nnUNetv2_train 032 3d_fullres 0
nnUNetv2_train 032 3d_fullres 1
# ... folds 2, 3, 4

AMOS 也可通过 amid(AMOS Integrated Dataset)、MONAI 教程和 HuggingFace Datasets 镜像直接访问。

模型 类型 推荐度 说明
nnU-Net v2 CNN (AutoML) ⭐⭐⭐⭐⭐ 挑战赛冠军方案;自动配置、强力基线
MedNeXt CNN+Transformer ⭐⭐⭐⭐ 在 AMOS 上较 nnU-Net 提升 ~1% DSC
CoTr CNN+Transformer 混合 ⭐⭐⭐⭐ 表现稳健,小器官优势
SwinUNETR Transformer ⭐⭐⭐ 大器官表现好,小器官弱于 nnU-Net
UNETR Transformer ⭐⭐⭐ 基线 Transformer 模型,性能低于 CNN 方案
Auto3DSeg AutoML 集合 ⭐⭐⭐⭐ MONAI 的自动化方案,与 nnU-Net 接近
STU-Net CNN ⭐⭐⭐⭐ 大规模预训练 3D U-Net,迁移至 AMOS 表现优异

§6.2 预处理 Pipeline

import nibabel as nib
import numpy as np
from pathlib import Path

# 加载 CT 体积与标注
img = nib.load(''''''''''''''''amos22/ImagesTr/amos_0001.nii.gz'''''''''''''''')
lbl = nib.load(''''''''''''''''amos22/labelsTr/amos_0001.nii.gz'''''''''''''''')

img_data = np.asarray(img.dataobj, dtype=np.float32)  # (H, W, D)
lbl_data = np.asarray(lbl.dataobj, dtype=np.uint8)

# CT 强度裁剪(按 nnU-Net 标准,剪去超出 HU 范围的异常值)
img_data = np.clip(img_data, -1024, 3071)

# Z-score 归一化(逐例,或使用 nnU-Net 的全局统计量)
if is_ct:
    # 基于前景体素(非零区域)计算统计量
    mask = img_data > -500  # 前景掩码
    mean = img_data[mask].mean()
    std  = img_data[mask].std()
    img_data = (img_data - mean) / max(std, 1e-8)
else:  # MRI
    # 全局 Z-score
    img_data = (img_data - img_data.mean()) / max(img_data.std(), 1e-8)

# 重采样至目标间距(如 1.5 mm 各向同性)
# 推荐使用 nnU-Net 的自动规划或 MONAI 的 Spacing

§6.3 PyTorch Dataset 示例

import torch
from torch.utils.data import Dataset
import nibabel as nib
import numpy as np

class AMOSDataset(Dataset):
    """AMOS 3D 腹部器官分割 Dataset。

    Args:
        image_dir: ImagesTr / ImagesVa 路径
        label_dir: labelsTr / labelsVa 路径
        samples: 文件名列表(不含后缀)
    """
    LABEL_NAMES = [
        ''''''''''''''''background'''''''''''''''', ''''''''''''''''spleen'''''''''''''''', ''''''''''''''''right_kidney'''''''''''''''', ''''''''''''''''left_kidney'''''''''''''''',
        ''''''''''''''''gallbladder'''''''''''''''', ''''''''''''''''esophagus'''''''''''''''', ''''''''''''''''liver'''''''''''''''', ''''''''''''''''stomach'''''''''''''''',
        ''''''''''''''''aorta'''''''''''''''', ''''''''''''''''ivc'''''''''''''''', ''''''''''''''''pancreas'''''''''''''''', ''''''''''''''''right_adrenal'''''''''''''''',
        ''''''''''''''''left_adrenal'''''''''''''''', ''''''''''''''''duodenum'''''''''''''''', ''''''''''''''''bladder'''''''''''''''', ''''''''''''''''prostate_uterus''''''''''''''''
    ]

    def __init__(self, image_dir, label_dir, samples):
        self.image_dir = Path(image_dir)
        self.label_dir = Path(label_dir)
        self.samples = samples

    def __len__(self):
        return len(self.samples)

    def __getitem__(self, idx):
        sid = self.samples[idx]
        img_path = self.image_dir / f''''''''''''''''{sid}.nii.gz''''''''''''''''
        lbl_path = self.label_dir / f''''''''''''''''{sid}.nii.gz''''''''''''''''

        img = np.asarray(
            nib.load(img_path).dataobj, dtype=np.float32
        )  # (H, W, D)
        lbl = np.asarray(
            nib.load(lbl_path).dataobj, dtype=np.uint8
        )

        # 转为 (C=1, D, H, W) 格式
        img = torch.from_numpy(img)[None]
        lbl = torch.from_numpy(lbl)[None]

        return img, lbl

§6.4 训练建议

  1. 从小器官的"体积门控"开始:肾上腺和十二指肠在某些切片中可能不存在——训练时确保 Dataloader 不会因为空标签而崩溃。
  2. 使用 nnU-Net 的默认配置作为起点:nnU-Net 已经内置了针对各向异性医学图像的优化(3D fullres 配置、patch size 自动调优、数据增强策略)。在 nnU-Net 基础上改进,而非从零搭建。
  3. 左右器官混淆是常见问题:肾脏和肾上腺的左右标签在深度学习模型预测中容易混淆——建议在推理后处理中增加基于空间位置的左右纠正逻辑(详见坑点 #4)。
  4. MRI 归一化是 Task 2 成败的关键:参见 nnU-Net 的"noCT"设置——不要对 MRI 使用 CT 的窗口裁剪策略。
  5. 5 折交叉验证集成:是提升 DSC 最稳定的方法,提升幅度 0.5-1.5%。

§6.5 评估函数

def dice_score(pred, target, num_classes=16, ignore_background=True):
    """
    计算多类 Dice 系数。

    Args:
        pred: (B, D, H, W) 或 (D, H, W), 预测标签
        target: 同上, 真值标签
        num_classes: 类别数 (含背景)
        ignore_background: 是否排除背景 (标签 0)

    Returns:
        per_class_dice: (num_classes,) 各类别 Dice
        mean_dice: 均值(排除背景后的平均值)
    """
    start = 1 if ignore_background else 0
    dices = []
    for c in range(start, num_classes):
        pred_c = (pred == c)
        target_c = (target == c)
        intersection = (pred_c & target_c).sum()
        union = pred_c.sum() + target_c.sum()
        if union > 0:
            dices.append(2.0 * intersection / union)
        else:
            dices.append(float(''''''''''''''''nan''''''''''''''''))
    per_class = np.array(dices)
    mean_dice = np.nanmean(per_class)
    return per_class, mean_dice


def nsd(pred, target, spacing, tau=1.0):
    """
    Normalized Surface Dice。

    Args:
        pred: 预测掩码
        target: 真值掩码
        spacing: 体素间距 (mm)
        tau: 容忍距离 (mm), 默认 1.0

    Returns:
        mean_nsd: 均值 NSD
    """
    from scipy.ndimage import distance_transform_edt

    # 体素→ mm 转换
    voxel_tau = tau / np.array(spacing)

    # 计算边界距离
    pred_border = pred ^ binary_erosion(pred)
    targ_border = target ^ binary_erosion(target)

    dist_pred = distance_transform_edt(~pred_border, sampling=spacing)
    dist_targ = distance_transform_edt(~targ_border, sampling=spacing)

    tp_pred = np.sum(targ_border &amp; (dist_targ < tau))
    tp_targ = np.sum(pred_border &amp; (dist_pred < tau))

    nsd = (tp_pred + tp_targ) / (np.sum(pred_border) + np.sum(targ_border))
    return nsd

§6.6 公开预训练权重

模型 来源 说明
nnU-Net v2 (AMOS Task 1) nnU-Net 官方模型库 挑战赛获胜配置
STU-Net (AMOS) STU-Net GitHub 大规模预训练,已针对 AMOS 微调
TotalSegmentator GitHub 104 器官模型,可部分覆盖 AMOS 的 15 个器官

§6.7 计算资源估算

配置 GPU 训练时间(单折) 显存需求 说明
nnU-Net 3d_fullres (默认) 1× A100 80GB ~48 h (240 例) ~40 GB 推荐
nnU-Net 3d_fullres (默认) 1× RTX 4090 24GB ~72 h ~22 GB batch_size=2
nnU-Net 3d_lowres 1× RTX 3090 24GB ~30 h ~16 GB 降分辨率,性能略低
5 折交叉验证 (3d_fullres) 5× A100 ~48 h (并行) ~200 GB 完整训练协议

§6.8 坑点与解决方案

⚠️ 坑点 #1:CT 扫描仪间的 HU 值不一致

AMOS 包含 5 台不同厂商的 CT 扫描仪,HU 值分布存在系统性偏移。如果将所有 CT 数据合并做全局 Z-score 归一化,模型可能学到以 HU 值区分扫描仪而非器官边界的"捷径"。

解决:使用 nnU-Net 的数据驱动归一化(按病例 foreground 统计量 %0.5-%99.5 百分位裁剪,而非全局归一化)。或者在 Dataloader 中按扫描仪批次独立归一化。对于扫描仪鲁棒性研究,可通过评估各扫描仪子集的 Dice 进行分层分析。

⚠️ 坑点 #2:MRI 归一化——没有万能方案

MRI 强度值为任意单位(arbitrary units),不同序列(T1/T2/质子密度)和设备间差异可达数个数量级。Task 2 要求同一模型处理 CT 和 MRI——但 CT 的 HU 裁剪方案(如 np.clip(img, -1024, 3071))对 MRI 毫无意义。

解决

  • 对 MRI 使用简单的全局 Z-score 归一化(nnU-Net “noCT” 方案)

  • 如果使用跨模态统一模型,在训练时对 CT 和 MRI 分别计算各自的归一化统计量

  • 可探索 GAN 风格的 CycleGAN 域转换作为预处理

⚠️ 坑点 #3:损伤文件

amid 库文档指出 ID 55145437 的两个文件在 ZIP 存档中已损坏,无法正常读取。这两个文件不会影响大部分实验(600 例中仅 2 例),但需要在 Dataloader 中做好 try/except 保护。

解决:在数据加载循环中加入异常处理;如果使用 amid 库,它会自动跳过损坏文件。

⚠️ 坑点 #4:左右器官混淆

肾脏和肾上腺的左/右标签在模型预测中容易混淆——因为它们在解剖学上呈镜像对称,深度学习模型缺乏空间上下文时无法可靠区分。

解决

  • 后处理策略:将预测的肾/肾上腺掩码合并为一个联合类,然后对每个连通区域计算其在图像中的左右空间位置,根据质心 x 坐标分配左右标签。这是 AMOS 挑战赛冠军方案(Isensee et al.)的关键技巧。

  • 作为输入增强,可以将"患者左右方向"以通道或条件方式注入模型。

⚠️ 坑点 #5:Prostate/Uterus 合并类

标签 15 在前列腺和子宫之间不区分——这是同一标签 ID 对应两个互斥器官的场景。绝大多数患者只会出现其中一个,但模型并不知道该患者的性别。

解决:由于患者性别信息未在数据集中公开,这个标签在女性和男性患者中天然对应不同的解剖结构。评测时会以 ground truth 和预测的 Dice 计算——如果模型在女性患者上将前列腺区域误标为 uterus,但真值恰好是 uterus,Dice 不受影响。但如果希望通过外部知识(如从 CT 体积推断性别)改进分割,需注意潜在的伦理问题。

⚠️ 坑点 #6:层间距各向异性

CT 切片内分辨率(0.6-1.0 mm)远高于层间分辨率(1.25-5.0 mm)——典型的各向异性体积。如果直接对所有数据做各向同性重采样(如 1.0 mm),层间插值可能引入伪影。

解决:使用 nnU-Net 的自动 3d_fullres 配置,它根据目标间距的中位数确定重采样策略,保留了 Z 轴的部分各向异性以降低插值噪声。不建议自行粗暴重采样。

⚠️ 坑点 #7:标注不完整性(正常解剖结构未被标记)

AMOS 只标注了 15 个指定器官,其他腹部结构(如肠道、输尿管、淋巴结、血管分支、骨骼)未被标记。如果模型在这些未标注结构上产生假阳性预测,评估时这些区域会被判为"正确背景"而不受惩罚——但这不代表临床安全。

解决:在部署前进行定性审核——检查分割结果中是否出现不应该存在的假阳性区域。对于高风险应用(如手术规划),可能需要补充标注额外的关键解剖结构。

⚠️ 坑点 #8:无健康人对照

AMOS 的全部患者均为医院就诊人群(60% 肿瘤,40% 其他异常),不含健康体检者。这意味着解剖结构可能因疾病而变形(如肝肿瘤导致肝叶肿大、腹水导致器官移位)。训练在"异常人群"上的模型不一定能在健康人群筛查场景中可靠工作。

解决:如需向健康人筛查场景迁移,建议使用外部健康人群数据(如部分 BTCV 或 TotalSegmentator 的子集)进行验证或微调。

§6.9 数据增强策略

nnU-Net 默认的数据增强已经足够强大,包括:随机旋转/缩放、弹性形变、Gamma 校正、镜像翻转。针对 AMOS 的特性,可额外考虑:

  • CutMix / MixUp 3D:从不同扫描仪混合同一器官的 patch,强迫模型关注解剖形态而非扫描仪特征

  • MRI 特定的增强:随机对比度拉伸(模拟不同序列)、随机偏置场(模拟 MRI 不均匀场)

  • 器官缺失模拟:随机移除某些小器官的标签(模仿部分标注场景),提升模型在真实世界中遇到部分标注数据的鲁棒性

§7 质量评估与局限性

§7.1 数据质量评估

维度 评估 说明
标注质量 ⭐⭐⭐⭐ 三重审校(AI + 初级 + 资深),但未报告 IAA
数据完整性 ⭐⭐⭐⭐ 仅 2/600 例文件损坏
跨模态一致性 ⭐⭐⭐ CT/MRI 强度不可比,需独立归一化
多中心泛化性 ⭐⭐⭐ 双中心但同城,域漂移程度有限
类别平衡性 ⭐⭐ 严重长尾,肾上腺体素量仅为肝脏的 1/200

§7.2 已知偏倚

偏倚类型 严重程度 描述 对 AI 的影响
地域偏倚 🔴 高 仅中国南方单城市双中心 向其他种族/地域人群泛化需验证
性别偏倚 🟡 中 CT 男女比 314:186(1.69:1) 女患者的分割性能可能低于男患者
疾病偏倚 🟡 中 60% 肿瘤,无健康人对照 正常解剖的基线分割可能不准确
年龄偏倚 🟡 中 中位年龄 54 岁,儿童仅 14 岁最低 儿科腹部器官分割可能误差较大
MRI 样本不足 🔴 高 仅 100 例 MRI(含 40 例训练) MRI 分割模型严重欠拟合
标注者偏倚 🟢 低 多名放射科医生 + 迭代修正 系统性偏倚已被多轮修正削弱
扫描仪偏倚 🟡 中 8 台设备,5 厂商 模型可能利用扫描仪特征走"捷径"

§7.3 受保护的评估指标(MRI 子集)

由于 MRI 仅占整个数据集的 16.7%(100/600),训练集仅 40 例 MRI,建议单独报告 MRI 验证集上的 per-organ Dice——而非仅报告 CT+MRI 混合均值。这能揭示跨模态泛化的真实差距。

§7.4 DAIMS 24 项数据就绪度评估

# DAIMS 检查项 状态 说明
1 Dataset description provided 清晰的学术论文 + 挑战赛描述
2 Intended task specified 多器官语义分割、单一任务清晰
3 Motivation for dataset construction specified 明确陈述规模与多样性不足的动机
4 Data generation/collection process described 回顾性采集、PACS 提取、DICOM→NIfTI
5 Dataset splits defined Train/Val/Test 240/120/240,患者级划分
6 Number of cases reported 600 例(500 CT + 100 MRI)
7 Demographic information reported ⚠️ 年龄和性别已报告,种族未披露
8 Data collection period reported 2017-2022
9 Institutions and geography specified 深圳龙岗,2 家医院
10 Equipment/Scanner information disclosed ⚠️ 8 台设备(5 厂商),但厂商名称已隐去
11 Inclusion/exclusion criteria specified ⚠️ 简述"腹部肿瘤或其他异常"+“正常排除”,但无详细入排标准
12 Annotation protocol described AI + 5 初级 + 3 资深迭代,流程清晰
13 Annotator qualifications reported 初级和资深放射科医生的资质和人数明确
14 Inter-annotator agreement (IAA) reported 未报告——这是 DAIMS 中最关键的缺失项
15 Data size (storage) reported 24.2 GB 压缩
16 File format specified NIfTI (.nii.gz)
17 Label distribution analyzed ⚠️ 定性描述长尾,未提供精确器官体素统计
18 Missing data patterns described 2 例损坏被社区发现
19 Known quality issues transparently described 论文描述标注过程的局限性
20 Ethical approval status stated 未明确引用 IRB 批准号
21 Patient consent status stated 未明确描述知情同意获取方式
22 De-identification process described 去标识化,但方法细节少
23 Limitations explicitly discussed 论文讨论节中明确提及单中心、MRI 少等局限
24 Benchmark baselines provided nnU-Net / nnFormer / SwinUNETR / CoTr / UNETR

DAIMS 评估总结:AMOS 在 DAIMS 24 项中满足 17 项(含 ⚠️ 部分满足),DAIMS 评分 18.0/24。两个关键缺失项为「标注者间一致性未报告」(医学图像分割数据集的硬性指标)和「IRB 批准号 / 知情同意细节未披露」——后者在 NeurIPS 数据集论文中常见,但对于追求临床级可复现性的用户是需要注意的信息缺口。主要扣分集中在文档透明度而非数据质量本身。

§7.5 AI 就绪度评估(Bridge2AI 七维框架)

Bridge2AI 维度 评级 说明
Data Quality 🟢 高 三重审校,NIfTI 标准格式
Data Size 🟢 高 600 例 3D 体积,标准规模
Data Diversity 🟡 中 双中心,单城市,1 人口/种族
Annotation Quality 🟡 中 高质量流程,但 IAA 未知
Provenance 🟢 高 从 PACS 到 Zenodo 的链路清晰
Accessibility 🟢 高 CC BY 4.0,无注册障碍
FAIR-ness 🟢 高 Zenodo DOI + 标准格式 + 可发现

§7.6 外部验证矩阵

验证目标 推荐数据集 样本量 验证维度
多中心泛化(中国) FLARE22 2,300 13 器官,大规模多中心 CT
多中心泛化(欧美) BTCV 30 13 器官,但样本量小
全身段覆盖 TotalSegmentator 1,204 104 器官/结构
跨模态泛化 CHAOS 60 CT+MRI 双模态双器官
临床可接受性 放疗 OAR 研究 不等 专家 Likert 评分,非纯量化

§7.7 与 FLARE21/22 的关系

AMOS 和 FLARE 系列挑战赛(2021-2022)是同期竞争的两个腹部器官分割基准:

维度 AMOS22 FLARE21 FLARE22
样本量 600 (500 CT + 100 MRI) 511 (仅 CT) 2,300 (仅 CT)
器官数 15 4 13
模态 CT + MRI CT only CT only
关注点 跨模态 + 多器官 + 多样性 快速 + 低资源半监督 大规模 + 半监督 + 低资源
许可证 CC BY 4.0 非商业 非商业
规模定位 器官最全面的多模态基准 快速分割的先驱 最大规模的多器官 CT 数据集

AMOS 的优势在于跨模态挑战 + 15 器官覆盖,FLARE22 的优势在于 2,300 例的大规模 + 13 器官。两者在腹部分割领域的互补关系明显,研究者常将 AMOS 作为"多模态难度测试",将 FLARE22 作为"大规模泛化验证"。

§8 基准性能与生态

§8.1 排行榜

方法 年份 Task 1 DSC Task 1 NSD Task 2 DSC Task 2 NSD 说明
Extending nnU-Net (Isensee et al.) 2022 90.13 92.83 89.06 91.80 🥇 挑战赛冠军,残差编码器+定制后处理
MedNeXt (Roy et al.) 2023 89.87 92.95 混合 Conv+Transformer 架构
MOTC 2024 91.61 全局-局部信息并行融合
CoTr 2022 90.67 CNN+Transformer 嵌套
SwinUNETR 2022 89.36 纯 Transformer
nnU-Net (标准基线) 2022 89.38-90.82 87.45-89.0 自动配置基线
Residual U-Net + DS 2022 89.36 80.71 88.80 80.71 深度监督残差 U-Net
UNETR 2022 85.89 纯 Transformer 基线

注:Task 2 的提交者明显少于 Task 1,跨模态分割的技术难度使得该赛道的参与度和成熟度远低于 CT only 赛道。DSC 值是五折交叉验证均值或测试集结果,各论文报告的评估协议可能有差异。

§8.2 逐器官 nnU-Net 基准性能

以下为 nnU-Net 在 AMOS 验证集上的 per-organ Dice(来源:AMOS 论文基线 + momodel.cn 复现):

器官 Dice (%) 难度 主要误差来源
Spleen (脾) 97.5 极低 边界平滑过度
Liver (肝) 97.6 极低 肝顶/肝底部分层模糊
Left Kidney (左肾) 96.9 与脾脏/肾上腺边界
Right Kidney (右肾) 96.4 与肝脏/肾上腺边界
Aorta (主动脉) 96.0 远端分支缺失
Stomach (胃) 94.8 壁塌陷/充盈状态变化
IVC (下腔静脉) 93.2 管壁薄、对比度低
Bladder (膀胱) 91.3 充盈程度变化
Prostate/Uterus (前列腺/子宫) 88.2 性别依赖、形态变异
Pancreas (胰腺) 88.0 边界弥散、与十二指肠混淆
Gallbladder (胆囊) 87.7 小体积、形态变异性大
Esophagus (食管) 86.4 薄壁管状、在多层中不连续
Duodenum (十二指肠) 85.0 极高 管状不连续、与胰腺混淆
Left Adrenal (左肾上腺) 81.9 极高 极小体积、仅数层可见
Right Adrenal (右肾上腺) 81.3 极高 极小体积、仅数层可见
均值(15 器官) ~90.8

§8.3 临床可接受性评估

Ram et al.(2025)对 nnU-Net、Auto3DSeg 和 SwinUNETR 在 AMOS 上的分割结果进行了三名医师的盲法 Likert 评分:

模型 平均 DSC 平均 sDSC HD95 (mm) 医师 Likert 中位数
nnU-Net 0.924 0.938 4.26 4.57
Auto3DSeg 0.902 0.919 8.76 4.49
SwinUNETR 0.837 0.844 13.93

Likert 评分:5 = 无需修改即可临床使用,4 = 仅需微小编辑,3 = 比从零手动勾画更省时。nnU-Net 的 4.57 分表示其 90%+ 的自动轮廓仅需微小编辑或无需编辑即可用于放疗 OAR 场景。

§8.4 关键参考论文

论文 作者/年份 贡献
AMOS: A Large-Scale Abdominal Multi-Organ Benchmark Ji et al., NeurIPS 2022 数据集定义、基线评测、挑战赛组织
Extending nnU-Net is all you need Isensee et al., 2022 🥇 AMOS22 冠军方案:残差编码器+定制后处理
MedNeXt: Transformer-driven Scaling of ConvNets Roy et al., MICCAI 2023 混合 Conv-Transformer 架构,AMOS 上提升 ~1%
Assessing quantitative performance of AutoML frameworks Ram et al., 2025 nnU-Net vs Auto3DSeg vs SwinUNETR + 医师盲法评估
MOTC: Parallel Fusion of Global and Local Information PMC, 2024 在 AMOS 上 91.61 DSC
STU-Net: Scalable and Transferable Medical Image Segmentation Huang et al., 2023 大规模预训练 U-Net,含 AMOS 微调权重
AMOS-MM: Abdominal Multimodal Analysis Challenge Ji et al., MICCAI 2024 AMOS 的 VLM 扩展:放射学报告生成 + VQA

§8.5 生态快照

资源 链接 说明
官方挑战赛主页 https://amos22.grand-challenge.org/ 排行榜、数据下载、文档
Zenodo 数据仓库 https://zenodo.org/records/7262581 24.2 GB 数据包,CC BY 4.0
新 AMOS 官网 https://era-ai-biomed.github.io/amos 含 AMOS-MM 扩展,2025 年上线
arXiv 论文 arXiv:2206.08023 数据集详细描述和技术细节
NeurIPS 2022 发表版 NeurIPS 2022, Vol.35, pp.36722-36732 正式学术引用版本
nnU-Net GitHub https://github.com/MIC-DKFZ/nnUNet AMOS 的推荐训练框架
amid (AMOS Integrated Dataset) https://github.com/neuro-ml/amid Python 库,一键加载 AMOS 数据
MONAI https://monai.io 含 AMOS 兼容的 Auto3DSeg pipeline
SOTA-MedSeg 排行榜 https://github.com/PerPerZXY/SOTA-MedSeg 持续跟踪 AMOS 最新性能
HuggingFace 镜像 https://huggingface.co/datasets/sathiiii/amos22 社区镜像,方便在线实验

§9 相关资源与引用

§9.1 官方数据集引用

@article{ji2022amos,
  title  = {AMOS: A large-scale abdominal multi-organ benchmark
           for versatile medical image segmentation},
  author = {Ji, Yuanfeng and Bai, Haotian and Ge, Chongjian and
           Yang, Jie and Zhu, Ye and Zhang, Ruimao and
           Li, Zhen and Zhang, Lingyan and Ma, Wanling and
           Wan, Xiang and others},
  journal = {Advances in Neural Information Processing Systems},
  volume  = {35},
  pages   = {3672236732},
  year    = {2022}
}

§9.2 AMOS-MM 扩展引用

@article{ji2024amosmm,
  title  = {AMOS-MM: Abdominal Multimodal Analysis Challenge},
  author = {Ji, Yuanfeng and Ge, Chongjian and Li, Ruijiang and
           Luo, Ping},
  year   = {2024},
  note   = {MICCAI 2024 Challenge}
}

§9.3 其他相关资源

  • CADS 标准化数据集:HuggingFace 上的 0038_amos 条目提供了标准化的 AMOS 数据卡,含字段级描述和许可信息

  • Awesome-Medical-Dataset:GitHub 上的 AMOS 条目提供了中文版数据集概述和下载直链

  • AMID 库:neuro-ml/amid 提供了一个 Python API,可用 ds = AMOS(root=''''''''''''''''/path/'''''''''''''''') 一键加载全部数据并获取 ds.image(id) / ds.mask(id) 的 NumPy 数组

§10 AI 使用声明卡

§10.1 本条目使用的 AI 工具

用途 工具 日期
信息检索与文献调研 AI 辅助检索 2026-07-29
数据集论文内容提取 AI 辅助解析 2026-07-29
草稿撰写 AI 辅助写作 2026-07-29

§10.2 人工审核声明

本条目由千方病案医学编辑部依据以下资料交叉审核:

  • AMOS 原始论文(arXiv:2206.08023, NeurIPS 2022)
  • AMOS22 挑战赛官方网站和排行榜
  • Zenodo 数据仓库元数据(DOI: 10.5281/zenodo.7262581)
  • 社区代码库(amid, nnU-Net, STU-Net, SOTA-MedSeg)
  • 外部研究论文(Ram et al. 2025, Roy et al. 2023 等)

§10.3 时效性声明

  • AMOS22 完整数据集已于 2022-10-10 冻结发布(Zenodo 版本 v1),此后无新增扫描
  • 排行榜数据截至 2025 年初,后续可能更新——请通过官方排行榜确认最新结果
  • 引用次数(1,200+)为 Google Scholar 截至 2026-07 的估值

§10.4 人工校验表

校验项目 状态
ICD-11 编码映射 ✅ 已核查 7 种主要疾病编码
SNOMED CT 映射 ✅ 已核查 15 种器官术语映射
INFOBOX 必填字段 ✅ 全部 25 项已填写
版本抉择矩阵 ✅ 含 AMOS22 Task 1/2 + AMOS-MM 扩展
DAIMS 24 项评估 ✅ 完成,得分 18.0/24
坑点与解决方案 ✅ 8 个坑点,每个含具体解决策略
基准性能数据 ✅ 逐器官 Dice + 排行榜 + 临床 Likert 评估
代码示例 ✅ PyTorch Dataset + 评估函数 + 预处理 Pipeline
外部验证矩阵 ✅ 5 个场景推荐
外部链接验证 ✅ 全部可访问(2026-07 检查)
中英混排格式 ✅ 符合 G2 排版规范
页面状态 ✅ published — 正文已消除全部未定稿标记
返回 AI Ready 数据集