信息速览

WORD 全腹器官数据集 — 全腹 16 器官 CT 分割基准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | WORD 全腹器官数据集 |
| 英文全称 | Whole abdominal ORgan Dataset(WORD) |
| 别名/简称 | WORD;全腹器官分割数据集 |
| 疾病分类(ICD-11) | 2C82(前列腺癌)、2C77(宫颈癌)、2B92(直肠癌)、2D50/2D51(继发性恶性肿瘤,含骨与软组织转移) |
| SNOMED CT | 腹部解剖结构概念映射(肝脏 10200004、肾脏 64033007 等,详见 §2.1b) |
| 数据模态 | CT(放疗定位平扫,单期相,无增强) |
| AI 任务类型 | 3D 医学图像多器官分割(含 scribble 弱监督与知识蒸馏基准) |
| 样本总数 | 150 例 CT / 30,495 层 |
| 数据大小 | 512×512 × 159-330 层体数据(官方未公布精确磁盘体积) |
| 数据格式 | NIfTI(.nii.gz) |
| 许可证 | GPL-3.0 |
| 访问级别 | 申请审核(学术邮箱申请,约 2 日内批准,README 更新后已开放直链) |
| DUO 标签 | NPUNCU(非商业非营利);IRB(已获隐私与伦理审查批准) |
| 语言 | 英文(标注文件与官方文档) |
| 首发日期 | 2021-11(arXiv v1 与 GitHub 仓库创建) |
| 最后更新 | 2024-09(README 修正与维护) |
| 发布机构 | 电子科技大学 Healthcare Intelligence Laboratory(HiLab) |
| 官方主页 | GitHub - HiLab-git/WORD |
| 下载地址 | GitHub - HiLab-git/WORD(申请 Google Drive / 百度网盘) |
| DOI | 10.1016/j.media.2022.102642 |
| 引用次数 | 270+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有官方 100/20/30 划分、评测脚本与全开源代码;扣分项:需学术邮箱申请获取、无一键训练脚本、测试集标注需单独下载 |
| 页面状态 | published |
§0 专家审核与可信度声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、放疗危及器官勾画流程)、§7 偏倚分析(癌种构成、单中心偏倚)。
数据工程审核:千方病案医学编辑部交叉审核。医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。WORD 数据集采用 GPL-3.0 许可并限定学术研究用途,禁止商业使用、临床直接应用与二次开发,需通过学术邮箱向官方申请下载权限与解压密码。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? WORD(Whole abdominal ORgan Dataset,全腹器官数据集)是一个开源的腹部 CT 多器官分割数据集。它收录了 150 名患者在放疗定位阶段拍摄的平扫 CT(共 30,495 层),并由资深肿瘤科医师逐层手工勾画了 16 个腹部器官与解剖结构,从肝脏、双肾到容易漏勾的食管、十二指肠和肾上腺,全部提供逐体素的精确边界。数据按 100 训练、20 验证、30 测试的官方划分发布(Luo et al., MedIA 2022)。
为什么重要? 在 WORD 出现之前,公开的腹部分割数据集要么规模小(BTCV 仅 50 例),要么只标了少数大器官(AbdomenCT-1K 的 1,062 例只有肝、脾、肾、胰四类)。放疗计划的危及器官(OAR)勾画恰恰需要覆盖全腹、从零手工、经专家共识确认的高质量标注——WORD 是第一个同时满足这三点的公开数据集,并且额外提供了仅占稠密标注体素不足 4% 的 scribble 稀疏标注,为降低标注成本的研究打开了大门。
我能用它做什么? 你可以训练和评测全腹部多器官分割模型、研究 scribble 弱监督学习、做轻量化模型的知识蒸馏(官方提供了完整蒸馏基准),也可以用它评估你的模型在"放疗定位平扫"这一特殊影像协议下的表现。但请注意:它不能替代多期相增强 CT 数据集,也不允许商业用途。
§1.1 技术摘要
WORD 由电子科技大学 Healthcare Intelligence Laboratory(HiLab)联合上海人工智能实验室、四川大学华西医院等机构构建,论文发表于 Medical Image Analysis 2022(DOI 10.1016/j.media.2022.102642)。数据采集自单一放疗中心,全部为 SIEMENS 扫描仪拍摄的放疗定位平扫 CT:每体积 159-330 层、512×512 矩阵、面内分辨率 0.976 mm × 0.976 mm、层间距 2.5-3.0 mm。标注流程为一名 7 年经验资深肿瘤科医师以 ITK-SNAP 逐层从零勾画,再由一名 20 年以上经验的肿瘤专家审核修订形成共识标签,全程遵循 RTOG 放疗勾画指南(MedIA 2022 论文 §3.2)。
官方基准使用 nnUNet 框架统一训练 10 种 2D/3D 方法,3D nnUNet 以平均 Dice 87.44% 居首;大器官(肝、脾、肾、胃、膀胱、股骨头)Dice 均超 85%,而食管、十二指肠、肾上腺三类小器官 Dice 低于 70%,构成任务的真实难点。论文还评估了 scribble 弱监督(pCE+EM+IVM,平均 Dice 76.81%)、知识蒸馏(LCOVNet+KD,Dice 85.82%、仅 0.82M 参数)以及跨数据集泛化(在 BTCV 上显著域偏移),形成了此后被广泛引用的腹部分割基准线。
技术脉络上,WORD 的贡献可以拆成四条互相支撑的线索:数据——全腹 16 类从零手工标注填补了"结肠/小肠/直肠"长期缺位的空白;基准——统一协议下的 10 方法横向评测确立了后续论文的对照口径;标注经济学——scribble 稀疏标注与配套弱监督方法把"再标 1 万层要多少钱"变成可计算的问题;临床适用性——用户研究直接测量模型输出与三名肿瘤科医师修订结果之间的差距。这四条线索使它同时服务算法研究者、系统部署者与临床转化团队三类读者,也是本页按此结构组织内容的依据。
§1.2 战略价值
维度一:任务定义的完整性。 此前腹部分割基准普遍只覆盖 4-13 个器官,且"肠道、结肠、直肠"等无固定形态的器官长期缺位。WORD 的 16 类标签首次在公开数据集中覆盖全腹部连续解剖,其作者明确指出,在 WORD 之前几乎没有同时具备结肠、小肠和直肠标注的公开数据集(arXiv Table 1)。这使得"全腹器官分割是否已被解决"这一问题有了严肃的否定答案:大器官接近饱和,小器官仍是开放难题。对研究者而言,这 16 类中自带一条由易到难的天然难度梯度,非常适合诊断模型的真实短板。
维度二:标注经济性的示范。 WORD 同时发布了稠密标注与 scribble 稀疏标注两套真值,并量化了两者成本差距:scribble 标注的体素量整体不足稠密标注的 4%,即节省超过 96% 的标注工作量(MedIA 2022 Table 10)。官方弱监督方法 pCE+EM+IVM 将 scribble 基线的平均 Dice 从 72.06% 提升到 76.81%。对于计划自建放疗 OAR 勾画数据的团队,这套"稠密小规模 + 稀疏大规模"的组合策略是可以直接复用的成本-质量权衡模板。
维度三:临床落地的参照系。 论文邀请三名来自不同医院的初级肿瘤科医生独立修订模型预测,量化了深度模型与人类医师的差距:大器官上模型输出仅需少量修改即可临床可用,小器官上差距仍然巨大(MedIA 2022 用户研究)。这为"自动勾画进入放疗流程"设定了明确的验收口径,也使 WORD 成为放疗 AI 产品评测中最常被引用的公开参照。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 器官/结构数 | 标注方式 | 差异化要点 |
|---|---|---|---|---|
| WORD(本页) | 150 例 CT / 30,495 层 | 16 | 从零手工勾画 + 专家共识 + scribble | 全腹覆盖、放疗定位平扫、单中心同设备、含弱监督与蒸馏基准 |
| BTCV(2015) | 50 例 CT | 13 | 手工勾画 | 规模小但为最经典的腹部多器官基准,含血管结构 |
| DenseVNet(2018) | 90 例 CT | 8 | 部分复用 BTCV | 与 BTCV 高度重叠,器官数少 |
| CT-ORG(2020) | 140 例 CT | 5 | 半自动工具 + 人工修正 | 含肺与骨骼,但器官覆盖窄 |
| AbdomenCT-1K(2021) | 1,062 例 CT | 4 | 模型预标注 + 医师修正 | 规模大但仅肝、脾、肾、胰四类 |
| AMOS(2022) | 500 例 CT + 100 例 MR | 15 | 手工勾画 | 多模态多中心,CT/MR 联合任务 |
| FLARE 2022(2022) | 2,300 例 CT | 13 | 竞赛多中心 | 规模最大,但含大量无标注数据,跨中心异质性强 |
对比可见:WORD 的核心竞争力不在"规模最大",而在"全腹 16 类 + 从零手工标注 + 协议同质"三者兼得,代价则是单中心、单设备、单一期相带来的泛化性局限(arXiv Table 1)。
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2021-10-30 | GitHub 仓库创建 | HiLab-git/WORD 仓库公开(Ecosyste.ms 快照) |
| 2021-11-03 | arXiv v1 发布 | 论文初版(arXiv:2111.02403),数据集随论文开放申请 |
| 2022-09-16 | 评测脚本补充 | 官方提交 word_metrics_computing.py,统一 Dice/HD95 计算口径 |
| 2022-10-06 | 测试集标注公开 | WORD_V0.1.0_labelsTs.zip 直接放入仓库,30 例测试标签可下载 |
| 2022-11 | MedIA 正式发表 | Medical Image Analysis Vol 82, 102642(PubMed 36223682) |
| 2023-02-13 | arXiv v5 | 论文修正若干表格结果与描述 |
| 2024-09-04 | README 更新 | 修正描述并推荐 RAOS 鲁棒性评测数据集(GitHub) |
§1.5 典型应用场景
- 放疗危及器官自动勾画:以 WORD 训练的模型为放疗定位 CT 生成 16 类 OAR 初稿,医师仅需少量修订即可纳入放疗计划系统,这是论文用户研究直接验证过的路径。
- 全腹多器官分割方法研究:16 类标签自带大/小器官难度梯度,适合验证 3D 卷积、Transformer 与拓扑保持等方法的真实短板。
- scribble 弱监督与标注经济性研究:官方发布的稀疏标注与 pCE+EM+IVM 基线,是弱监督医学分割论文的标准对照设置之一。
- 轻量化与高效推理:官方知识蒸馏基准(LCOVNet、DMFNet 等骨干 + KD)为显存受限的临床部署环境提供了速度-精度权衡参照。
- 域偏移与泛化评测:配合官方在 LiTS 上新标注的 20 例全腹外部评测集与后续 RAOS 鲁棒性数据集,可系统评估跨中心泛化能力。
§2 医学背景
§2.1 ICD-11 编码映射
WORD 的患者人群为腹部/盆腔恶性肿瘤的放疗患者,其癌种构成对应 ICD-11 疾病章节如下:
| ICD-11 编码 | 中文名称 | 与 WORD 的关系 |
|---|---|---|
| 2C82 | 前列腺恶性肿瘤 | WORD 第一大癌种(训练集 28 例) |
| 2C77 | 子宫颈恶性肿瘤 | WORD 第二大癌种(训练集 29 例) |
| 2B92 | 直肠恶性肿瘤 | WORD 第三大癌种(训练集 26 例) |
| 2D50 | 呼吸或消化系统继发性恶性肿瘤 | 部分转移瘤病例(训练集 17 例中的消化系统转移) |
| 2D51 | 其他系统或部位继发性恶性肿瘤 | 部分转移瘤病例(如骨转移、软组织转移) |
映射依据论文 Table 2 的临床特征表(MedIA 2022):训练集中前列腺癌 28 例、宫颈癌 29 例、直肠癌 26 例,其余 17 例为转移瘤(骨转移、软组织转移等)。
§2.1b SNOMED CT 解剖结构映射
16 类器官标签对应的 SNOMED CT 解剖结构概念如下(用于标签语义互操作):
| 器官标签 | 中文名 | SNOMED CT 概念 |
|---|---|---|
| Liver | 肝脏 | 10200004(Liver structure) |
| Spleen | 脾脏 | 78904004(Spleen structure) |
| Kidney (L/R) | 左肾/右肾 | 64033007(Kidney structure) |
| Stomach | 胃 | 69695003(Stomach structure) |
| Gallbladder | 胆囊 | 71854001(Gallbladder structure) |
| Esophagus | 食管 | 32849002(Esophageal structure) |
| Pancreas | 胰腺 | 15776009(Pancreatic structure) |
| Rectum | 直肠 | 34402009(Rectum structure) |
| Urinary Bladder | 膀胱 | 89837001(Urinary bladder structure) |
| Adrenal gland (L/R) | 肾上腺 | 23495009(Adrenal structure) |
其余标签(十二指肠、结肠、小肠、股骨头)未列入本表是因为其 SNOMED CT 概念编码需以官方浏览器核对,本页不给出未经核实的编码。
§2.2 疾病与临床背景
WORD 患者群覆盖前列腺癌、宫颈癌、直肠癌及转移瘤四类放疗常见适应证。前列腺癌是男性最常见的恶性肿瘤之一,放疗(外照射或联合近距离治疗)是其主要根治手段之一;宫颈癌在开展筛查的地区发病率持续下降,但中晚期患者仍以放化疗为主要治疗方式;直肠癌则以新辅助放化疗联合手术为标准路径。这三类肿瘤的共同特征是:靶区邻近大量对剂量敏感的正常组织——前列腺癌计划需保护膀胱与直肠,宫颈癌计划需保护小肠、结肠与双肾,直肠癌计划需保护股骨头与膀胱。因此,精确的全腹多器官勾画是这三类放疗计划共同的刚性需求(RTOG 放疗勾画指南)。
流行病学层面需要特别注意:WORD 采集自单一中国放疗中心,其癌种构成(前列腺/宫颈/直肠为主)反映的是放疗科收治结构,而非一般人群的癌症发病率结构;使用本数据集得到的任何流行病学推论都必须谨慎。论文未公布采集的具体年份区间,仅说明整个数据集的标注与共识流程历时约 15 个月(MedIA 2022 §3.2)。
从放疗计划的角度看,三类主癌种对 OAR 勾画的需求各有侧重。前列腺癌放疗的核心矛盾是前列腺靶区与膀胱、直肠两大危及器官直接相邻,膀胱充盈状态与直肠壁的勾画精度直接决定剂量-体积直方图(DVH)的约束达标率,因此 WORD 中膀胱与直肠两类标签对前列腺癌计划价值最高。宫颈癌放疗(外照射联合近距离治疗)需要在小肠、结肠受量与宫颈靶区覆盖之间权衡,盆腔骨髓抑制风险还要求关注髂骨与股骨头受量,全腹 16 类勾画中结肠、小肠、双肾、股骨头等标签均为计划评估的关键输入。直肠癌新辅助放疗以盆腔野为主,股骨头与膀胱是标准限量器官,男性患者还需评估射野对性功能相关结构的影响。这三类肿瘤的共同特征是:靶区邻近大量对剂量敏感的正常组织,因此精确的全腹多器官勾画是它们共同的刚性需求(RTOG 放疗勾画指南)。
还需要理解放疗定位平扫与诊断 CT 的临床语义差异:放疗定位 CT 的成像目的是获取治疗计划所需的几何基准与组织电子密度信息(用于剂量计算),而非病灶检出。因此扫描协议采用统一的定位固定装置与较厚层间距,追求的是病例间几何一致性与剂量计算精度,图像上不显示强化病灶。这意味着 WORD 的标签语义是"放疗勾画语义"——器官边界以放疗计划系统的勾画规范为准,与诊断影像报告中放射科医师的视觉评估习惯存在细微差别。
§2.3 临床任务定义
WORD 对应的临床任务是放疗计划中的危及器官(Organ at Risk, OAR)勾画,属于治疗规划类任务而非筛查或诊断任务。临床流程为:患者完成放疗定位 CT 扫描后,放疗科医师在计划系统中逐层勾画靶区与全部相关 OAR,随后物理师据此计算剂量分布。手工勾画全部腹部器官需要医师逐层检查,单例耗时以小时计,且 junior 医师对食管、肾上腺等小结构的勾画一致性差(MedIA 2022 §1)。AI 任务因此定义为:给定放疗定位平扫 CT 体积,输出 16 类器官的逐体素分割,评价指标为 Dice 与 95% Hausdorff 距离。与诊断任务不同,OAR 勾画对边界精度(HD95)和剂量敏感的小器官完整性更敏感,漏勾几毫米的直肠壁即可改变剂量报告结论。
§2.4 患者人群构成
以下为论文 Table 2 公布的临床特征(训练/验证/测试):
| 特征 | 训练集(n=100) | 验证集(n=20) | 测试集(n=30) |
|---|---|---|---|
| 年龄中位数(范围) | 47(28-75) | 52(32-78) | 49(26-72) |
| 男性 | 63 | 12 | 13 |
| 女性 | 37 | 8 | 17 |
| 前列腺癌 | 28 | 7 | 10 |
| 宫颈癌 | 29 | 6 | 5 |
| 直肠癌 | 26 | 3 | 8 |
| 其他(转移瘤) | 17 | 4 | 7 |
要点:男性占多数(训练集 63:37)源于前列腺癌入组;三个子集的癌种比例明显不同——验证集宫颈癌占比 30% 而测试集直肠癌占比 26.7%,这解释了跨子集评估时的方差来源(MedIA 2022 Table 2)。
使用该表时的三点提示:第一,年龄以中位数与范围呈现,未提供均值与标准差,做年龄匹配的对照分析时应采用非参数方法;第二,"其他(转移瘤)"未在论文中细分子类(骨转移、软组织转移等),将这一组当作独立类别建模时需要意识到其内部异质性;第三,表中分布是数据集层面的统计,逐例的诊断标签未随数据包逐行发布,需要逐例元数据的团队应在获得数据后自行登记(这也是 §5.2 分层划分代码以"团队自行登记的 cases.csv"为前提的原因)。
§2.5 临床价值
对放疗科而言,基于 WORD 训练的自动勾画模型的价值体现在三个层面:其一,将 OAR 勾画从逐层手工操作压缩为"机器初稿 + 人工微调",论文用户研究证实大器官(肝、脾、肾、胃、膀胱、股骨头)上模型输出接近临床可用,仅需少量修订;其二,统一了勾画标准——模型输出遵循 RTOG 指南的共识标签训练,可减少 junior 医师之间的个体差异;其三,为自适应放疗(ART)提供了快速重勾画能力,使分次间解剖变化的评估成为可能。需要注意的是,小器官(尤其肾上腺、十二指肠、食管)上模型与医师差距仍然显著,临床部署时必须保留医师复核环节(MedIA 2022 用户研究)。
对研究者而言,WORD 的临床价值还有一层"协议真实感":它保留了放疗定位 CT 的全部工程摩擦(厚层间距、平扫对比度、单设备偏置),而非经过清洗的理想化数据。在这类数据上验证过的管线,迁移到真实放疗科工作流时遇到的意外会显著少于在诊断增强 CT 上训练的模型,这使它成为放疗 AI 工程化研究里少数"数据即场景"的公开资源。
§2.6 标注金标准
| 维度 | 内容 |
|---|---|
| 金标准划分 | 16 类器官逐体素共识标签(consensus label) |
| 标注方式 | 从零手工勾画(ITK-SNAP,轴位逐层),不使用模型预标注 |
| 标注者 | 1 名资深肿瘤科医师(7 年经验)初勾;1 名肿瘤专家(20 年以上经验)审核修订 |
| 一致性机制 | 分歧病例讨论后形成共识标签;资深医师与共识的差异率在肝脏等大器官上低于 2 个 Dice 点 |
| 标注规范 | 遵循 RTOG(Radiation Therapy Oncology Group)放疗勾画指南 |
| 附加真值 | 每例另配 scribble 稀疏标注(体素占比不足稠密标注的 4%);单例勾画约 1.2-2.6 小时、审核约 0.4-1.0 小时 |
来源:MedIA 2022 §3.1-3.2 与 Table 3。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐获取物 | 获取方式 | 理由 |
|---|---|---|---|
| 完整训练与评测(最常见) | WORD 完整包(imagesTr/labelsTr/imagesTs + labelsTs) | 网盘申请或 README 直链 + 仓库内 labelsTs zip | 官方 100/20/30 划分齐全,评测可复现论文 Table 4 |
| 只想快速验证管线 | imagesTr 子集 + labelsTs(测试标注) | 仓库内 WORD_V0.1.0_labelsTs.zip 直下 | 测试标注无需申请,先跑通数据读取与评测脚本 |
| 弱监督研究 | scribble 稀疏标注 | 随完整包发布(scribbles_generator.py 可复现生成) | 与 pCE+EM+IVM 基线直接对齐 |
| 跨中心鲁棒性评测 | RAOS 数据集 | 单独仓库 Luoxd1996/RAOS | WORD 作者 2024 年发布的挑战性病例集,MICCAI 2024 |
§3.1 模态详情
WORD 全部 150 例均为放疗定位平扫 CT(pre-radiotherapy planning CT),这是理解本数据集的关键前提:扫描目的不是诊断,而是获取放疗计划所需的几何基准,因此全部为无增强(non-contrast)单期相扫描,无任何外观增强处理,扫描定位与层间距在病例间高度一致。具体参数:SIEMENS 扫描仪(单一厂商)、512×512 矩阵、每体积 159-330 层、面内分辨率 0.976 mm × 0.976 mm、层间距 2.5-3.0 mm。这意味着 WORD 的 CT 在 HU 分布、软组织对比度上系统性地不同于诊断增强 CT——肝脏病灶在平扫中不显影,且层间距明显大于常见诊断协议的 1.0-1.25 mm(MedIA 2022 §3.1)。
从工程视角看,这一协议组合带来三个直接推论:第一,"同质性强"意味着模型容易学到协议特征而非解剖特征,泛化实验中跨库性能下降主要来自协议差异而非人群差异,做域适应时应优先对齐强度分布与 spacing 而非人群属性;第二,无增强扫描下部分器官边界(如门静脉血管、胆囊壁)对比度低,这些正是基准成绩中中低分类别的物理来源;第三,2.5-3.0 mm 的厚层间距使层向插值误差成为所有管线绕不开的问题,任何直接在层向上做大幅插值或降采样的操作都会被小器官指标放大惩罚。使用者在设计管线时应把这三个推论转化为约束:域适应先对齐物理参数、边界学习关注低对比度器官、层向操作保守化。
§3.2 子集样本数
| 子集 | 例数 | 层数 | 用途 |
|---|---|---|---|
| 训练集 | 100 | 20,115 | 模型训练(官方基准亦用其训练) |
| 验证集 | 20 | 4,103 | 超参选择与早停 |
| 测试集 | 30 | 6,277 | 最终评测(标签 2022-10 起公开) |
| 合计 | 150 | 30,495 | — |
外部评测集:官方从 LiTS 中选取 20 例覆盖全腹的 CT 并新标注 16 器官,用于泛化评估,随论文发布(MedIA 2022 §3.1)。
§3.3 数据格式
| 内容 | 格式 | 命名示例 |
|---|---|---|
| CT 体积 | NIfTI(.nii.gz) | word_001.nii.gz |
| 器官标注 | NIfTI(.nii.gz,标签值 0-16) | word_001.nii.gz(与图像同名对应) |
| scribble 标注 | NIfTI(.nii.gz) | 与稠密标注同构,仅部分体素非零 |
| 评测脚本 | Python | word_metrics_computing.py |
| 稀疏标注生成 | Python | scribbles_generator.py |
§3.4 存储大小
官方论文与仓库均未公布数据集的精确磁盘体积。可由参数估算量级:以单层 512×512×2 字节、平均约 203 层/例计,150 例原始体数据约为数十 GB 量级(未压缩),实际 NIfTI 压缩后体积以解压后为准。本页不给出来源不明的具体 GB 数字,下载前请以网盘页面显示为准。
§3.5 标注方式
WORD 采用全人工从零标注(annotate from scratch),这是它与 AbdomenCT-1K(模型预标注 + 医师修正)和 CT-ORG(半自动工具 + 修正)的核心区别。论文明确指出:初始预标注会锚定医师对低对比度边界的判断,而从零勾画可以避免这一系统性偏倚(arXiv v3 Table 1 注释)。除稠密标签外,每例配有 scribble 稀疏标注,其体素占用比例按器官从膀胱的 1.58% 到肾上腺的 19.76% 不等(肾上腺因结构细小,"稀疏"标注的相对成本反而最高),整体节省超过 96% 的标注成本(MedIA 2022 Table 10)。
§3.6 标注者资质与一致性
标注链为"资深医师初勾 → 专家审核 → 分歧讨论 → 共识标签"。论文 Table 3 报告了标注者间不一致率:以肝脏为例,资深医师与共识标签的差异约 1.73 个 Dice 点,专家与共识的差异约 0.89 个 Dice 点,一致性处于很高水平。全部勾画与共识讨论遵循 RTOG 放疗勾画指南,使标签语义与放疗临床实践直接对齐(MedIA 2022 §3.2)。
§3.7 采集周期
论文未公布 CT 扫描的起止年份,仅说明整个数据集的标注与共识流程历时约 15 个月(MedIA 2022 §3.2)。数据集以 V0.1.0 发布至今未见含新病例的扩展版本;作者在 README 中声明未来可能扩展更多患者、器官、模态与医院数据(GitHub README)。
§3.8 地域覆盖
单中心:中国西部一家放疗中心(论文未具名,标注医师来自不同医院)。因此数据在地域、设备与协议三个维度上均高度同质,这既是标注质量的优势,也是跨中心泛化的隐患(详见 §7.3)。
§3.9 设备规格
全部 150 例由 SIEMENS 扫描仪完成(单一厂商单一型号口径),平扫、无增强、层间距 2.5-3.0 mm、面内 0.976 mm × 0.976 mm(MedIA 2022 §3.1)。设备与协议的同质性意味着任何"在 WORD 上表现良好"的结论都不能直接外推到多厂商混合环境。
§3.10 深度溯源链
原始 CT 扫描(SIEMENS,放疗定位,单中心)→ 匿名化处理(删除临床治疗细节)→ 隐私与伦理审查委员会批准 → 资深肿瘤科医师 ITK-SNAP 逐层勾画 → 肿瘤专家审核修订 → 分歧讨论 → 共识标签发布(V0.1.0,NIfTI 格式,GitHub/网盘分发)→ 2022-10 补充发布测试集标注 → 2024-09 README 维护更新。每一环节的说明均可在论文 §3 与 GitHub README 中溯源(MedIA 2022、GitHub)。
§4 数据结构
§4.0 目录树
数据集解压后的典型目录结构如下(以官方基准代码预期布局为准):
word_root/
├── imagesTr/ # 训练+验证集 CT 图像(120 例)
│ ├── word_001.nii.gz
│ ├── word_002.nii.gz
│ └── ...
├── labelsTr/ # 训练+验证集 16 器官标注(120 例)
│ ├── word_001.nii.gz # 标签值 0-16,与图像同名对应
│ └── ...
├── imagesTs/ # 测试集 CT 图像(30 例)
│ ├── word_1xx.nii.gz
│ └── ...
├── labelsTs/ # 测试集标注(2022-10 起公开)
│ └── ... # 来自仓库内 WORD_V0.1.0_labelsTs.zip
├── scribbles/ # scribble 稀疏标注(随包或经生成脚本复现)
├── word_metrics_computing.py # 官方 Dice/HD95 评测脚本
├── scribbles_generator.py # scribble 标注生成脚本
└── annotation_template/ # 标注模板示例
§4.1 DAIMS 字段字典
| 字段/对象 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 文件名(case_id) | 文本 | 病例唯一标识,图像与标签同名对应 | word_001 | 索引与划分控制 | 无 | 无 | word_001 至 word_150 |
| CT 体积体素值 | int16 | 原始 HU 值 | -1000 至 3000+ | 窗宽窗位与强度归一化输入 | 部分体积效应 | 无 | -1024 至 3,071(典型) |
| 层数 | 整数 | 每体积轴位层数 | 159-330 | 滑窗推理分块规划 | 无 | 无 | 159-330 |
| 面内分辨率 | 浮点(mm) | 0.976 × 0.976,病例间一致 | 0.976 | 重采样参数 | 几何量化误差 | 无 | 0.976 |
| 层间距 | 浮点(mm) | 病例间 2.5-3.0 mm 不等 | 2.5 | 各向同性重采样 | 无 | 无 | 2.5-3.0 |
| 器官标签 | uint8 | 0 为背景,1-16 为器官类别 | 8(胰腺) | 分割监督信号 | 标注者间约 1-2 Dice 点差异 | 无 | 0-16 |
| scribble 标注 | uint8 | 稀疏涂抹式标签,值域同上 | 8 | 弱监督监督信号 | 稀疏采样偏差 | 非零即已标注 | 0-16 |
| 癌种构成 | 分组统计 | 论文 Table 2 而非逐侧行级字段 | 前列腺癌 | 分层划分与偏倚分析 | 无 | 无 | 四类 |
| 子集归属 | 分组 | train/val/test | train | 划分控制 | 无 | 无 | 100/20/30 |
§4.2 标签分布
16 类标签为:1 肝脏、2 脾脏、3 左肾、4 右肾、5 胃、6 胆囊、7 食管、8 胰腺、9 十二指肠、10 结肠、11 小肠、12 肾上腺、13 直肠、14 膀胱、15 左股骨头、16 右股骨头(背景为 0)。类别间体素量极不均衡:论文 Fig. 2 给出的代表性器官体积为肝脏约 1,300 mL、胃约 450 mL、脾脏约 250 mL、双肾各约 200 mL,而食管、肾上腺等小结构的体积比肝脏低两个数量级以上(MedIA 2022 Fig. 2)。这一分布直接决定了基准成绩的形态:大器官 Dice 普遍超 85%,肾上腺类小器官 Dice 不足 70%。
§4.3 关键统计
- 总层数 30,495;单例层数 159-330,均值约 203 层(由 30,495/150 折算)。
- scribble 标注体素占稠密标注比例:整体不足 4%;肾上腺最高(19.76±4.34%)、右股骨头最低(1.08±0.28%)(MedIA 2022 Table 10)。
- 训练集性别比 63 男 : 37 女;三个子集年龄中位数 47-52 岁。
- 癌种分布跨子集显著不同(详见 §2.4 表)。
- 官方基准中表现最好与最差的类别差近 20 个 Dice 点(肝脏 96.45% vs 十二指肠 68.31%,nnUNet(3D)),类别难度梯度陡峭。
- 官方弱监督基线与全监督上界之间约 10 个 Dice 点的差距(76.81% vs 86.67%),量化了标注成本-精度的权衡空间。
- 蒸馏系最优学生模型(LCOVNet+KD)的参数量仅约教师 nnUNetV2(3D) 的 2.6%(0.82M vs 31.18M),推理时间不足其一半(0.21 s vs 0.47 s)。
§4.4 数据层级
WORD 的数据层级为:患者(150 人)→ 放疗定位检查(每人 1 次 CT,无纵向随访)→ CT 体积(NIfTI)→ 轴位切片(159-330 层)。由于每名患者仅有一例扫描,患者级与病例级划分等价,不存在纵向泄漏问题;但要注意部分社区工作会将切片打散为 2D 样本,此时同一患者的切片必须整体留在同一子集内。
§4.5 缺失值与信息性缺失
影像数据不存在表格意义上的缺失行或缺失字段:每例均有完整的 16 类稠密标签与 scribble 标注。唯一的"零值语义"问题在标签层面:背景(0)同时承担"非器官组织"与"该器官在此切片不存在"两层含义,这是多类分割的正常设定,但在计算逐类指标时必须忽略不存在的类别,而不是把"该切片上无肾上腺"计入肾上腺的负样本(详见坑点 8)。
§5 划分与使用建议
§5.1 官方划分
官方划分为 100 训练(20,115 层)/ 20 验证(4,103 层)/ 30 测试(6,277 层),为随机划分但未说明是否按癌种分层;论文全部基准均在此划分上完成,测试集标签自 2022-10 起公开(MedIA 2022 §3.1)。社区后续工作(如多篇中文核心期刊论文)普遍沿用同一划分以保证可比性。
§5.2 划分策略建议
若需自建划分(例如做交叉验证),建议满足三点:其一,按患者划分而非按切片划分;其二,对癌种做分层采样,使前列腺/宫颈/直肠癌比例在各折间接近整体分布,避免复现官方划分中验证集宫颈癌占比 30% 而测试集 16.7% 的不均衡;其三,固定随机种子并公开划分清单,否则数字不可比。
按癌种分层的划分代码示例(癌种清单需由团队自行登记,WORD 未逐例发布诊断字段):
# 前提:团队已将 150 例的癌种登记为 cases.csv(case_id, diagnosis 两列)
# 原则:患者级划分 + 癌种分层 + 固定种子 + 划分清单入库
import pandas as pd
from sklearn.model_selection import StratifiedKFold
df = pd.read_csv("cases.csv") # case_id, diagnosis
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
for fold, (tr_idx, va_idx) in enumerate(skf.split(df, df["diagnosis"])):
tr = df.iloc[tr_idx]["case_id"].tolist()
va = df.iloc[va_idx]["case_id"].tolist()
# 训练折内再按癌种分层抽出小比例做折内验证,避免触碰固定测试集
print(f"fold {fold}: train={len(tr)} val={len(va)}")
# 将 (fold, train_ids, val_ids) 写入 splits/ 目录并随代码入库
若沿用官方 100/20/30 划分,则无需运行上述代码,直接使用论文与官方仓库公开的划分即可;此时请勿再对验证集做任何超参迭代后拿测试集反复评估。
§5.3 泄漏风险
- 患者级泄漏:每名患者仅 1 例扫描,官方划分下不存在跨子集患者重复,泄漏风险主要来自自建划分时的切片级打散(2D 训练设置中最常见)。
- 预处理统计泄漏:HU 裁剪边界、归一化均值方差等统计量必须在训练集内计算后再应用到验证/测试集;在全量数据上计算统计是本数据集最隐蔽的泄漏形式。
- 超参泄漏:验证集仅 20 例,反复在其上选超参会造成过拟合验证集,最终报告应以测试集单次评估为准。
- 外部评测集混用:官方在 LiTS 上新标注的 20 例只能用于最终泛化评估,绝不能参与任何训练或模型选择,否则外部验证失去意义。
§5.4 交叉验证建议
150 例的体量适合 5 折患者级交叉验证(每折约 120/30 例);报告均值±标准差,并与官方 100/20/30 单次划分的结果分开陈述。若做弱监督研究,每折内同步复制 scribble 设置以控制变量。
§5.5 外部验证建议
推荐两级外部验证:第一级使用官方 LiTS 20 例全腹标注(16 器官,与 WORD 标签同构)评估跨扫描协议泛化;第二级使用同团队的 RAOS 挑战性病例集(MICCAI 2024,Luoxd1996/RAOS)评估真实临床困难场景。论文已有基准显示:WORD 预训练的 nnUNetV2(3D) 在 LiTS-20 上平均 Dice 87.66%,但在 TCIA 上降至 75.39%、BTCV 上 70.23%,说明跨数据集泛化远未解决(MedIA 2022 Table 6/7)。
执行时的一条纪律:两级外部集都必须保持"只见一次"的地位——模型选型、超参调整与阈值设定全部在 WORD 内部完成,外部集只用于最终报告。若外部结果不理想后回头在外部集上迭代,再以同一集合报告提升幅度,等于把外部验证降级成了验证集,这是迁移学习报告中最常见的方法学缺陷。
§6 AI 就绪指南
§6.0 云端快速启动
WORD 没有官方云端一键环境,获取必须经过网盘申请或 README 直链。最快的启动路径是:
- 在 GitHub 仓库 获取下载链接(README 提供百度网盘提取码与 Google Drive 申请入口)。
- 下载完整包并解压(解压密码见官方 README 说明,由学术邮箱申请获得)。
- 直接从仓库下载 WORD_V0.1.0_labelsTs.zip,先用测试集标注跑通评测脚本 word_metrics_computing.py。
- 将解压目录挂载到你的训练环境,进入 §6.1。
§6.1 快速上手
以下代码假设你已按 §4.0 目录树解压数据。data_root 必须指向包含 imagesTr/ 等子目录的根目录,代码内不再额外拼接子目录名。
# 目录结构预期:data_root/ 下含 imagesTr、labelsTr、imagesTs、labelsTs
# data_root 拼接关系:os.path.join(data_root, "imagesTr", f"{case_id}.nii.gz")
# 最小可用子集:任意 1 对 imagesTr/labelsTr 同名文件即可跑通本代码
import nibabel as nib
import numpy as np
from pathlib import Path
data_root = Path("/data/word_root")
img = nib.load(data_root / "imagesTr" / "word_001.nii.gz")
lbl = nib.load(data_root / "labelsTr" / "word_001.nii.gz")
img_np = np.asarray(img.dataobj) # HU 值,int16
lbl_np = np.asarray(lbl.dataobj) # 标签 0-16
print("图像 shape:", img_np.shape) # (512, 512, 层数 159-330)
print("标签类别:", np.unique(lbl_np)) # [0, 1, ..., 16]
print("voxel spacing:", img.header.get_zooms()) # (0.976, 0.976, 2.5-3.0)
关键校验点:图像与标签的 affine 与 shape 必须完全一致;层间距从 header 的 zooms 第三项读取,不要写死 2.5 或 3.0。
下载完成后,建议先跑一遍全量一致性校验(配对完整性、层数总量、标签值域),再进入训练环节:
# 全量校验:150 对同名配对、总层数 30,495、标签值域 0-16
# 任何一项不满足都说明解压或目录组织有误(见坑点 7)
import nibabel as nib
import numpy as np
from pathlib import Path
data_root = Path("/data/word_root")
img_ids = {p.stem.replace(".nii", "") for p in (data_root / "imagesTr").glob("*.nii.gz")}
lbl_ids = {p.stem.replace(".nii", "") for p in (data_root / "labelsTr").glob("*.nii.gz")}
assert img_ids == lbl_ids, f"配对不完整:缺失 {img_ids ^ lbl_ids}"
total_slices = 0
for case in sorted(img_ids):
img = nib.load(data_root / "imagesTr" / f"{case}.nii.gz")
lbl = nib.load(data_root / "labelsTr" / f"{case}.nii.gz")
assert img.shape == lbl.shape[:3], f"{case} 图像-标签 shape 不一致"
assert np.allclose(img.affine, lbl.affine), f"{case} affine 不一致"
vals = np.unique(np.asarray(lbl.dataobj))
assert vals.min() >= 0 and vals.max() <= 16, f"{case} 标签值域异常: {vals}"
total_slices += img.shape[2]
print(f"校验通过:{len(img_ids)} 例,总层数 {total_slices}") # 120 例应为 24,218 层
训练与验证合计 120 例、24,218 层(20,115 + 4,103),加上测试集 30 例 6,277 层后总数应为 30,495 层。
§6.2 数据获取
| 获取渠道 | 内容 | 前置条件 | 说明 |
|---|---|---|---|
| GitHub 仓库直链 | 测试集标注 labelsTs zip | 无 | WORD_V0.1.0_labelsTs.zip,2022-10 起公开 |
| Google Drive | 完整数据包 | 学术邮箱申请(约 2 日审批;README 更新后已放宽) | 邮箱后缀需与机构一致 |
| 百度网盘 | 完整数据包 | 提取码见官方 README | 解压密码经学术邮箱申请发放 |
| RAOS 单独仓库 | 挑战性病例评测集 | 仓库内说明 | Luoxd1996/RAOS |
申请邮件模板(官方 README 规定格式):
To: luoxd1996 (at) gmail (dot) com
Subject: WORD dataset access request
Name/Homepage/Google Scholar: <你的可核实身份入口>
Primary Affiliation: <机构全称>
Job Title: <Professor / Associate Professor / Ph.D. 等>
Affiliation Email: <必须以 .edu 结尾,密码将发至此邮箱>
How to use: Academic research only, not for commercial use
or second-development.
§6.3 预处理全流程
官方基准直接以 nnUNet 的自动预处理为准;若自建管线,推荐以下流程(窗宽窗位与重采样参数对结果影响显著):
# 预处理三步:HU 裁剪 -> 各向同性重采样 -> 强度标准化
# 裁剪边界与统计量必须在训练集内计算(见 §5.3 泄漏风险)
import numpy as np
import nibabel as nib
from scipy.ndimage import zoom
HU_LOW, HU_HIGH = -175.0, 250.0 # 腹部软组织常用窗;nnUNet 会自动重算
TARGET_SPACING = (1.5, 1.5, 2.0) # (x, y, z) mm;追求高精度可尝试各向同性 1.5
def preprocess(img_path: str, lbl_path: str):
img = nib.load(img_path)
lbl = nib.load(lbl_path)
spacing = np.array(img.header.get_zooms()[:3], dtype=np.float32) # (0.976, 0.976, 2.5-3.0)
x = np.asarray(img.dataobj, dtype=np.float32)
y = np.asarray(lbl.dataobj, dtype=np.uint8)
x = np.clip(x, HU_LOW, HU_HIGH)
scale = spacing / np.array(TARGET_SPACING, dtype=np.float32)
x = zoom(x, scale, order=1) # 图像线性插值
y = zoom(y, scale, order=0) # 标签最近邻插值,防止标签值被插值污染
x = (x - x.mean()) / (x.std() + 1e-8)
return x.astype(np.float32), y.astype(np.uint8)
要点:标签必须用最近邻插值(order=0),否则标签值 1-16 之间会产生无意义的新值;HU 裁剪边界与标准化统计量来自训练集汇总,禁止用全体数据计算。
若计划复现官方基准,推荐直接走 nnUNetV2 格式转换,而非手写预处理——官方全部数字均基于 nnUNet 框架:
nnUNetV2 数据集目录组织(Dataset001_WORD 示例):
nnUNet_raw/Dataset001_WORD/
├── dataset.json # 通道数 1、标签定义、模态说明
├── imagesTr/
│ ├── WORD_001_0000.nii.gz # _0000 后缀表示第 1 个模态(单模态 CT)
│ └── ...
├── labelsTr/
│ ├── WORD_001.nii.gz # 标签值 0-16 与 dataset.json 的 labels 对应
│ └── ...
└── imagesTs/ # 测试图像(labelsTs 不进入 raw 目录)
dataset.json 的 labels 字段需逐条列出 background=0 与 16 类器官,
channel_names 使用 {"0": "CT"},file_ending 为 ".nii.gz"。
训练命令:nnUNetv2_train 3d_fullres(或 2d),与官方协议保持 5 折或单折设置一致。
注意 nnUNet 会自动完成 spacing 重采样、HU 统计与滑窗推理配置,这正是官方协议"无 TTA + 默认配置"口径的实现载体;手写预处理与 nnUNet 预处理的数字不可混用比较。
§6.4 PyTorch DataLoader
<details>
<summary>点击展开完整 Dataset + DataLoader 代码(约 60 行)</summary>
# 数据层级:患者 -> CT 体积 -> 轴位切片;同一患者的切片必须整体留在同一子集
# data_root 拼接关系:imagesTr/ 与 labelsTr/ 同名配对
import os
import numpy as np
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
from scipy.ndimage import zoom
class WordVolumeDataset(Dataset):
"""逐体积读取的 Dataset:内存受限时建议按滑窗块采样而非整卷加载。"""
def __init__(self, data_root, case_ids, target_spacing=(1.5, 1.5, 2.0),
hu_range=(-175.0, 250.0), crop_size=(128, 160, 160)):
self.img_dir = os.path.join(data_root, "imagesTr")
self.lbl_dir = os.path.join(data_root, "labelsTr")
self.cases = case_ids
self.target_spacing = target_spacing
self.hu_range = hu_range
self.crop_size = crop_size
def __len__(self):
return len(self.cases)
def _resample(self, arr, order, spacing):
scale = np.array(spacing, dtype=np.float32) / np.array(
self.target_spacing, dtype=np.float32)
return zoom(arr, scale, order=order)
def _random_crop(self, x, y):
dz, dy, dx = self.crop_size
sz, sy, sx = x.shape
z0 = np.random.randint(0, max(sz - dz, 1) + 1)
y0 = np.random.randint(0, max(sy - dy, 1) + 1)
x0 = np.random.randint(0, max(sx - dx, 1) + 1)
return (x[z0:z0 + dz, y0:y0 + dy, x0:x0 + dx],
y[z0:z0 + dz, y0:y0 + dy, x0:x0 + dx])
def __getitem__(self, idx):
case = self.cases[idx]
img = nib.load(os.path.join(self.img_dir, f"{case}.nii.gz"))
lbl = nib.load(os.path.join(self.lbl_dir, f"{case}.nii.gz"))
spacing = np.array(img.header.get_zooms()[:3], dtype=np.float32)
x = np.asarray(img.dataobj, dtype=np.float32)
y = np.asarray(lbl.dataobj, dtype=np.uint8)
x = np.clip(x, *self.hu_range)
x = self._resample(x, 1, spacing) # 图像线性插值
y = self._resample(y, 0, spacing) # 标签最近邻插值
mean, std = x.mean(), x.std()
x = (x - mean) / (std + 1e-8)
x, y = self._random_crop(x, y)
return (torch.from_numpy(x.copy()).float()[None],
torch.from_numpy(y.copy()).long())
# 构建调用:case_ids 从官方划分清单读取;num_workers 按机器调整
loader = DataLoader(
WordVolumeDataset("/data/word_root", [f"word_{i:03d}" for i in range(1, 101)]),
batch_size=2, shuffle=True, num_workers=4, pin_memory=True)
for x, y in loader:
print(x.shape, y.shape, int(y.max())) # (2,1,128,160,160) ... <=16
break
</details>
滑窗推理(sliding window inference)是 WORD 全分辨率测试的标准姿势,以下为最小实现:
<details>
<summary>点击展开滑窗推理代码(约 45 行)</summary>
# 滑窗推理:应对 512×512×159-330 的全分辨率体积(见坑点 2)
# 窗口与重叠度参照 nnUNet 默认策略的简化版
import numpy as np
import torch
import torch.nn.functional as F
def sliding_window_inference(model, volume, window=(64, 160, 160), overlap=0.5):
"""volume: (1, D, H, W) 已预处理的张量;返回 (num_classes, D, H, W) 概率图。"""
device = next(model.parameters()).device
model.eval()
_, D, H, W = volume.shape
dz, dy, dx = window
step = tuple(int(s * (1.0 - overlap)) for s in window)
probs = None
count = torch.zeros((1, D, H, W), dtype=torch.float32, device=device)
with torch.no_grad():
for z in range(0, max(D - dz, 0) + 1, step[0]):
for y in range(0, max(H - dy, 0) + 1, step[1]):
for x in range(0, max(W - dx, 0) + 1, step[2]):
patch = volume[:, z:z + dz, y:y + dy, x:x + dx]
pad = (0, max(dx - patch.shape[3], 0),
0, max(dy - patch.shape[2], 0),
0, max(dz - patch.shape[1], 0))
patch = F.pad(patch, pad)
logits = model(patch.to(device))
p = F.softmax(logits, dim=1).cpu()
if probs is None:
probs = torch.zeros((1, p.shape[1], D, H, W))
probs[:, :, z:z + dz, y:y + dy, x:x + dx] += p[:, :, :patch.shape[1] - pad[-1] or None]
count[:, z:z + dz, y:y + dy, x:x + dx] += 1.0
return probs / count.clamp(min=1.0)
# 使用:pred = sliding_window_inference(net, x[None]).argmax(1)
# 提示:生产环境建议直接用 MONAI 的 sliding_window_inference 或 nnUNetPredictor
</details>
§6.5 坑点清单
⚠️ 坑点 1:各向异性 spacing 直接 resize 摧毁小器官边界(分类:预处理陷阱)
问题:WORD 面内分辨率 0.976 mm 而层间距 2.5-3.0 mm,层向分辨率比面内低约 3 倍。若用简单 resize 到立方体网格或直接把体积 reshape 成固定形状,食管、肾上腺等毫米级结构会在层向被拉伸变形,监督信号与推理输出同时失真。
症状:训练损失正常收敛,但验证集上食管、肾上腺的 HD95 达到数十毫米;3D 渲染图中小器官呈"拉丝"状;同一模型在 spacing 正确的重采样下指标显著提升。
解决:
- 简单方法:按 header zooms 读取真实 spacing,用 scipy.zoom 以 scale = spacing / target_spacing 重采样,图像 order=1、标签 order=0。
- 进阶方法:对齐 nnUNet 的自动重采样策略(按目标 spacing 中位数与各向异性程度自适应选择插值阶数),并把层间距逐例记录进数据字典,禁止假设全局统一。
- SOTA 方法:直接使用 nnUNetV2 全自动管线做预处理与滑窗推理,官方论文全部基准即基于 nnUNet 框架完成,可比性最强。
参考:MedIA 2022 §4.1(实现细节);nnUNet
⚠️ 坑点 2:全分辨率整卷推理显存溢出与推理过慢(分类:工程陷阱)
问题:WORD 单例高达 512×512×330 的分辨率,官方论文明确指出高分辨率带来大显存占用与长推理时间:每模型训练超过 6 GPU 天,单例全分辨率推理超过 5 分钟(GTX1080TI、无 TTA)。整卷直接前向在多数显卡上直接 OOM。
症状:CUDA out of memory;或勉强跑通但每例推理超过 5 分钟,批量评测 30 例测试集需要小时级等待。
解决:
- 简单方法:滑窗推理(如 96×160×160 窗口、半窗重叠),配合 torch.no_grad 与混合精度,显存占用稳定且精度基本无损。
- 进阶方法:降低输入分辨率至 64×160×160 后训练轻量学生网络。官方蒸馏基准显示 nnUNetV2(3D) 在该输入下单例推理仅 0.47 秒。
- SOTA 方法:知识蒸馏——用预训练 nnUNetV2(3D) 作教师,蒸馏 LCOVNet(0.82M 参数)可达 Dice 85.82%、单例 0.21 秒;DMFNet+KD 达 Dice 85.1%(MedIA 2022 Table 8)。
参考:MedIA 2022 推理高效学习章节
⚠️ 坑点 3:只用 Mean Dice 掩盖小器官的灾难性失败(分类:评估误用)
问题:WORD 16 类体素量跨越两个数量级以上,平均 Dice 被大器官主导。官方基准中 nnUNet(3D) 均值 87.44% 看似优秀,但十二指肠仅 68.31%、肾上腺 72.38%、食管 78.51%——小器官才是全腹分割的真实瓶颈,只报均值会得出"任务已解决"的错误结论。
症状:汇报"平均 Dice 87%+"后,临床试跑时发现肾上腺勾画频繁缺失或十二指肠与胰腺粘连;审稿人要求补充逐类指标时才发现短板。
解决:
- 简单方法:逐类报告 Dice 与 HD95,并额外报告食管/十二指肠/肾上腺三类小器官的均值,与官方 Table 4 逐类对齐。
- 进阶方法:按器官体积分箱(大器官/中器官/小器官)统计,并加入前景缺失率(该例预测中某小器官完全不出现的比例)作为强失败信号。
- SOTA 方法:在官方评测脚本 word_metrics_computing.py 上扩展,统一 Dice 与 HD95 的实现口径后再横向比较(官方基于 medpy)。
参考:官方评测脚本;MedIA 2022 Table 4/5
⚠️ 坑点 4:跨协议域偏移——放疗定位平扫模型在诊断 CT 上暴跌(分类:偏倚陷阱)
问题:WORD 全部为单中心放疗定位平扫 CT(SIEMENS、无增强、2.5-3.0 mm 层间距)。官方泛化实验显示,WORD 预训练的 nnUNetV2 在 BTCV 上平均 Dice 仅 70.23%(2D 版仅 49.10%)、TCIA 上 75.39%,而同模型在 LiTS-20 上高达 87.66%——域差距由影像协议与强度分布差异主导。
症状:在 WORD 上调出的模型,上线对接院内诊断增强 CT 后整体指标下跌 10-30 个 Dice 点,且不同厂商设备下跌幅度不一致。
解决:
- 简单方法:接入新数据前先做 HU 分布直方图对比(论文 Fig. 5 的做法),量化域间距后再决定微调策略。
- 进阶方法:用目标域少量标注微调,或采用强度归一化对齐 + 浅层冻结的迁移策略;将 BTCV/TCIA 风格数据混入训练做域随机化。
- SOTA 方法:用官方 LiTS-20 外部评测集与 RAOS 挑战性病例集建立"内部 → 外部"两级评测制度,把泛化指标纳入发布门槛。
参考:MedIA 2022 Table 6/7 与 Fig. 5;RAOS
⚠️ 坑点 5:标签值与类别数的口径错位(分类:标签理解)
问题:WORD 标签为背景 0 + 器官 1-16 共 17 个值;而论文在部分表格中把左右肾上腺按"肾上腺"一个类别口径叙述,导致读者在 16 类与 17 值之间混淆。常见错误是把网络输出通道数设为 16(丢掉背景或丢掉最后一类),或重映射时按 16 类口径错位排序。
症状:训练即报 CUDA device assert 或交叉熵索引越界;或评测时全部类别 Dice 整体错位一位,某些类别出现 0。
解决:
- 简单方法:读取任一标签体积执行 np.unique,确认取值集合恰为 0-16;网络输出通道数 = 类别数(含背景)。
- 进阶方法:在数据加载层写死官方类别表(0 背景、1 肝脏、2 脾脏、3 左肾、4 右肾、5 胃、6 胆囊、7 食管、8 胰腺、9 十二指肠、10 结肠、11 小肠、12 肾上腺、13 直肠、14 膀胱、15 左股骨头、16 右股骨头),任何映射都通过该表完成。
- SOTA 方法:在评测脚本中按官方 Table 4 的逐类顺序输出,保证与论文逐类可比。
参考:arXiv Table 1 与 Fig. 1 类别表
⚠️ 坑点 6:把 scribble 稀疏标注当稠密 mask 直接监督(分类:标签理解)
问题:scribble 标注只在结构内部或边缘的稀疏笔触处有值,若按普通分割损失直接训练,未标注体素会被误当背景,小器官(肾上腺、食管、十二指肠)性能大幅劣化。
症状:用 scribble 训练的模型小器官 Dice 掉到全监督一半以下(论文中 pCE 基线均值仅 72.06%,肾上腺类甚至不足全监督的 2/3);预测图中细小结构整体消失。
解决:
- 简单方法:改用部分交叉熵(pCE):仅在被 scribble 标注的体素上计算损失,忽略未标注体素。
- 进阶方法:叠加熵最小化(EM)与类内强度方差最小化(IVM)正则,官方配置 λ 均为 0.1,可达均值 Dice 76.81%。
- SOTA 方法:对比后续 scribble 弱监督文献(如 DMSPS,MedIA 2024)时保持骨干与划分一致,或使用官方 7×7 笔触膨胀敏感性分析作为稳健性检验(膨胀至 7×7 时均值 Dice 80.71%)。
参考:MedIA 2022 Table 11/14;scribbles_generator.py
⚠️ 坑点 7:获取链路繁琐导致的目录与版本混乱(分类:工程陷阱)
问题:WORD 采取"网盘申请 + 学术邮箱发解压密码"的获取方式(约 2 日审批,README 更新后已放宽),测试集标注又是仓库内单独 zip。团队多人协作时极易出现"有人用旧划分清单、有人没解压 labelsTs、有人目录层级不同"的混合状态。
症状:评测脚本报找不到文件或标签全 0;同一份代码组内复现结果不一致;论文投稿后被质疑测试集标签来源。
解决:
- 简单方法:数据到位后立即校验 150 对图像-标签同名配对与 30,495 总层数,再冻结目录结构写入 README。
- 进阶方法:用固定版本号(V0.1.0)与 SHA256 清单锁定数据版本,labelsTs 单独校验后并入主目录。
- SOTA 方法:接入 DVC 或等价的数据版本管理,把"数据版本 + 代码版本 + 划分清单"三件套绑定到每一次实验记录。
参考:官方 README 获取说明
⚠️ 坑点 8:癌种失衡划分 + HD95 离群值让结果不可复现(分类:数据泄漏)
问题:官方 100/20/30 划分中三个子集的癌种构成差异明显(验证集宫颈癌 30% vs 测试集 16.7%),随机种子变化会同时改变子集难度;同时 HD95 在个别失败预测上呈重尾分布(nnUNet(3D) 均值 HD95 10.33±26.65,标准差近均值 2.6 倍),单次报告容易被离群值拉偏。此外预处理统计若在全量数据上计算,构成隐蔽泄漏。
症状:同一方法换随机种子后均值 Dice 波动超过 1 个点;HD95 远大于文献值;审稿人复现失败。
解决:
- 简单方法:固定全部随机种子并公开划分清单;HD95 报告中位数与 95 分位,不只报均值±标准差。
- 进阶方法:自建划分时按癌种分层 5 折交叉验证,均值±标准差与官方单次划分结果分开陈述;HU 统计仅在训练折内计算。
- SOTA 方法:完全复用官方划分与无 TTA 协议(官方为公平比较关闭了测试时增强),评测统一走 word_metrics_computing.py 口径。
参考:MedIA 2022 Table 2/5 与 §4.1 协议
坑点速查表(按使用阶段索引):
| 使用阶段 | 坑点 | 一句话守则 |
|---|---|---|
| 数据获取 | 坑点 7 | 校验 150 对配对与 30,495 总层数后再冻结目录 |
| 预处理 | 坑点 1 | 永远读 header spacing,标签用最近邻插值 |
| 预处理 | 坑点 4 | 域适应先对齐 HU 分布与 spacing,再谈模型 |
| 标签 | 坑点 5 | 输出通道数 = 17(背景 + 16 类) |
| 标签 | 坑点 6 | scribble 只配 pCE 系损失,禁止当稠密 mask |
| 训练 | 坑点 2 | 滑窗或蒸馏,不要整卷硬算 |
| 训练 | 坑点 8 | 统计只在训练集内算,种子与划分入库 |
| 评估 | 坑点 3 | 永远同时报逐类 Dice 与中位数 HD95 |
| 评估 | 坑点 8 | HD95 报中位数与 95 分位,警惕重尾 |
§6.6 数据增强
| 增强方式 | 建议 | 理由 |
|---|---|---|
| 随机镜像(左右) | ✅ 安全 | 腹部近似左右对称(左/右肾、肾上腺、股骨头成对出现),注意镜像后需交换左右成对标签 |
| 随机旋转(小角度)与弹性形变 | ✅ 安全 | 对边界学习有效,nnUNet 默认增强已验证 |
| 亮度/对比度扰动与 Gamma 变换 | ✅ 安全 | 提升跨设备强度鲁棒性 |
| 随机裁剪 + 大器官过采样 | ✅ 安全 | 缓解小器官在裁剪块中不出现的问题 |
| 直接 90° 旋转层向轴 | ❌ 危险 | 破坏各向异性 spacing 的几何关系,层向被错误加密 |
| 强 Z 轴翻转 | ❌ 危险 | 腹部上下解剖不对称(肝脏偏右、胃偏左),翻转引入错误解剖先验 |
| 用插值后的标签再增强 | ❌ 危险 | 任何对标签的非最近邻插值都会产生非法标签值 |
增强强度的一点经验法则:由于 WORD 层间距已达 2.5-3.0 mm,层向几何类增强(旋转、形变)的幅度应比等向数据更保守,否则插值误差会与厚层几何误差叠加;强度类增强(Gamma、亮度)则可适当放开,以覆盖跨设备 HU 分布差异。左右镜像在本数据集上几乎无收益——双肾、肾上腺、股骨头等成对结构已由标签显式区分左右,镜像后若忘记交换标签索引,反而会引入系统性标签错误。
§6.7 模型推荐
| 模型 | 在 WORD 上的表现 | 适用场景 | 来源 |
|---|---|---|---|
| nnUNet(3D) | 均值 Dice 87.44%,官方最佳 | 追求最高精度的默认选择 | MedIA 2022 Table 4 |
| nnUNetV2(3D) | 均值 Dice 87.41%,蒸馏教师首选 | 作为知识蒸馏教师或强基线 | 同上 |
| ResUNet(2D) | 均值 Dice 86.67%,HD95 8.6 mm | 显存受限的 2D 训练 | 同上 |
| AttUNet(3D) | 均值 Dice 86.21%,HD95 7.13 mm 全场最优 | 关注边界精度的场景 | 同上 |
| UNETR(3D) | 均值 Dice 79.77% | Transformer 结构对照(小数据下偏弱) | 同上 |
| LCOVNet + KD | 均值 Dice 85.82%,0.82M 参数,0.21 s/例 | 临床端轻量化部署 | 同上 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 | 依据 |
|---|---|---|---|
| 数据预处理 | 32 GB 内存 CPU | 64 GB 内存 | 单例重采样峰值内存以 GB 计 |
| 2D 训练(batch=12) | 单卡 11 GB(GTX1080TI 级) | 单卡 24 GB | 官方 2D 基线配置 |
| 3D 训练(batch=2) | 单卡 11 GB | 8 卡(官方 8×GTX1080TI) | 官方训练超 6 GPU 天/模型 |
| 推理(滑窗) | 单卡 8 GB | 单卡 11 GB+ | 输入 64×160×160 时单例 0.2-0.5 秒 |
§6.9 评估指标代码
# 与官方 word_metrics_computing.py 口径对齐:逐类 Dice + HD95(medpy)
import numpy as np
from medpy.metric.binary import hd95
def dice_per_class(pred: np.ndarray, gt: np.ndarray, num_classes: int = 17):
dices = {}
for c in range(1, num_classes): # 跳过背景 0
p, g = pred == c, gt == c
if not g.any(): # 该例不含此器官:不计入该类统计
continue
inter = np.logical_and(p, g).sum()
dices[c] = 2.0 * inter / (p.sum() + g.sum())
return dices
def hd95_per_class(pred: np.ndarray, gt: np.ndarray, num_classes: int = 17):
hd = {}
for c in range(1, num_classes):
p, g = pred == c, gt == c
if not g.any() or not p.any():
continue
hd[c] = hd95(p, g)
return hd
def summarize(results_list):
"""多例汇总:逐类均值与全体均值。results_list 为 dice_per_class 输出的列表。"""
merged = {}
for r in results_list:
for c, v in r.items():
merged.setdefault(c, []).append(v)
per_class = {c: float(np.mean(v)) for c, v in sorted(merged.items())}
overall = float(np.mean(list(per_class.values())))
return per_class, overall
注意:该例中不存在的器官必须跳过而不是计 0 分(与 §4.5 呼应);报告均值时同时给出逐类表与中位数 HD95。汇总口径请与官方 word_metrics_computing.py 保持一致——官方对每例逐类计算后取类别均值,再对例数取平均的层级关系需要逐行确认,这是社区数字对不上的高频原因之一。
§6.10 MLOps 笔记
- 数据版本化:锁定 V0.1.0 与 labelsTs 的哈希值,划分清单随代码入库。
- 评测口径冻结:全组统一 medpy 实现、跳过缺失类、无 TTA,任何偏差写入实验记录。
- 逐类监控:训练与线上评估均按 16 类监控,重点看食管、十二指肠、肾上腺三类小器官的滑窗式劣化。
- 蒸馏资产复用:教师模型(nnUNetV2(3D))的预测 logits 可离线生成一次并缓存,供多个轻量学生网络复用。
- 外部评测纪律:LiTS-20 与 RAOS 仅在发布前运行一次,纳入模型卡而非迭代依据。
- 标注反哺流程:将模型预测导入 ITK-SNAP 供医师修订,修订结果回流入训练集时需重新走专家共识,形成"预测-修订-共识-再训练"闭环;此时新批次数据的划分清单必须与旧批次的患者清单做去重交叉检查。
- 推理服务化:滑窗推理参数(窗口尺寸、重叠度、混合精度开关)作为模型 artifact 的一部分随权重一同发布,避免线上推理与离线评测口径漂移。
- 监控看板:除 Dice/HD95 外,跟踪单例推理耗时与显存峰值——两者是放疗科工作站能否本地部署的硬约束。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 单中心偏倚 | 全部 150 例来自中国单一放疗中心 | 高 | 外部验证用 LiTS-20 与 RAOS;混入多中心数据微调 |
| 设备单一 | 全部为 SIEMENS 扫描仪 | 高 | 跨厂商评测;强度增强模拟厂商差异 |
| 期相单一 | 全部为放疗定位平扫、无增强 | 高 | 不可直接用于增强 CT 任务;以增强数据微调 |
| 癌种构成失衡 | 前列腺/宫颈/直肠癌为主,训练集男性 63 例 | 中 | 按癌种分层划分;报告分组指标 |
| 层间距偏厚 | 2.5-3.0 mm 厚于常见诊断协议 | 中 | 重采样对齐目标域 spacing |
| 标注者有限 | 单名医师初勾 + 单名专家审核 | 低-中 | 共识机制已降低个体偏倚;使用时注意小器官边界分歧 |
§7.2 标注质量
标注质量的核心保障是"从零勾画 + 双人共识 + RTOG 指南"三要素。论文 Table 3 显示资深医师与共识标签的差异在肝脏上约 1.73 个 Dice 点、专家与共识约 0.89 个 Dice 点,属于高水平一致;单例勾画 1.2-2.6 小时、审核 0.4-1.0 小时的投入强度也高于同类数据集。需要注意的残余风险是:共识由两名标注者形成,无第三标注者仲裁,极低对比度边界(如食管壁与邻近纵隔脂肪)仍可能存在系统性偏置(MedIA 2022 §3.2)。
与其他腹部分割数据集的标注质量对照可以更清楚地看到 WORD 的定位:AbdomenCT-1K 由预训练模型生成初始预测、再由医师修正,CT-ORG 使用 ITK-SNAP 半自动工具先行分割后人工修饰,两者都存在"初始结果锚定医师判断"的风险;WORD 全部从零勾画,规避了这一系统性偏倚,代价则是更高的标注时间成本。对使用者的实操含义有两点:其一,以 WORD 标签训练的模型在器官边界(尤其低对比度界面)上更接近放疗勾画规范的语义;其二,若将自己的数据标注与 WORD 标签混合训练,需评估自家标注流程的锚定偏倚是否与 WORD 一致,否则混合标签会引入边界语义冲突。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| WORD → BTCV/TCIA(不同协议与人群) | 高:2D 均值 Dice 跌至 49.10-63.06% | MedIA 2022 Table 6/7 |
| WORD → LiTS-20(外部标注同构任务) | 低:3D 均值 Dice 87.66%,与内部相当 | 同上 |
| 平扫 → 增强诊断 CT | 高:强度分布与器官对比度系统性改变 | 论文 Fig. 5 强度分布分析 |
| 大器官 → 小器官 | 高:食管/十二指肠/肾上腺 Dice < 70% | MedIA 2022 Table 4 |
| 模型 → 临床 junior 医师 | 小器官差距大,大器官接近可用 | MedIA 2022 用户研究 |
§7.4 伦理与合规
数据集已完成匿名化(删除全部临床治疗细节),项目通过隐私与伦理审查委员会批准,许可为 GPL-3.0 并限定学术研究用途,禁止商业、临床直接应用与二次开发;官方鼓励学术使用者公开代码与预训练模型(GitHub README 声明)。使用者还需遵守所在机构的数据合规流程;本页 DUO 标签(NPUNCU、IRB)为方便检索的近似映射,使用限制以官方协议为准。
§7.5 公平性
训练集男女比 63:37,源于前列腺癌入组占比高;年龄中位数 47-52 岁、范围 28-78 岁,覆盖中老年主力放疗人群,但缺乏年轻与高龄极端段样本。癌种构成集中于三大盆腔肿瘤,其他腹部恶性肿瘤(如肝胆胰原发肿瘤)未被覆盖。基于 WORD 的模型在女性盆腔、非三大癌种人群上的表现需要额外验证(MedIA 2022 Table 2)。
§7.6 数据漂移
放疗定位协议本身相对稳定,但扫描仪换代、层间距参数微调与放疗科收治结构变化都会引入慢漂移;部署后建议按季度监控三类小器官的 Dice 与前景缺失率,并抽样比对 HU 分布直方图与训练集的偏移幅度。官方后续发布的 RAOS 数据集可作为年度鲁棒性回归测试的外部锚点(RAOS 仓库)。
漂移监控的最小可行方案:为每个上线版本维护一份固定抽查集(从 WORD 测试集抽 5 例 + 当前真实场景抽样 5 例),每月以相同推理配置跑一遍,记录逐类 Dice 的版本间差值;当小器官类别连续两个月下滑超过 2 个 Dice 点时触发复核。由于 WORD 未逐例发布采集时间,无法做时间维度的真实漂移分析,上述方案属于以"内部锚点 + 外部抽样"替代时间戳的可执行近似。
§7.7 DAIMS 数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ❌ | 3D 影像体数据,无宽表形态(影像数据集预期内特征) |
| 2 | 唯一标识 | ✅ | 每例唯一文件名,图像与标签同名配对 |
| 3 | 特殊字符 | ✅ | 小写英文命名,无空格与特殊字符 |
| 4 | 重复行 | ✅ | 150 例来自 150 名患者,无重复病例 |
| 5 | 缺失编码 | ⚠️ | 无缺失值;背景 0 同时表示非器官与"该类不在此切片"双重语义 |
| 6 | 标签标识 | ✅ | 官方 0-16 类别表明确且随论文与仓库发布 |
| 7 | 罕见类分组 | ⚠️ | 肾上腺、食管等类别体素占比极低,无官方稀有类合并策略 |
| 8 | 偏倚评估 | ⚠️ | 单中心/单设备/单期相偏倚由论文自述,但无分设备量化分析 |
| 9 | 数据字典 | ✅ | 论文 Table 1/2 + GitHub 描述构成完整字典 |
| 10 | 信息性缺失解释 | ✅ | 无信息性缺失设计 |
| 11 | 设备记录 | ✅ | 设备厂商(SIEMENS)与扫描参数有明确记录 |
| 12 | 共线性 | ⚠️ | 影像模态无表格共线性概念;左右成对器官高度相关属解剖学事实 |
| 13 | 编码映射 | ✅ | 本页提供 ICD-11 与 SNOMED CT 映射 |
| 14 | 时间戳处理 | ⚠️ | 无逐例时间戳发布,仅知标注周期约 15 个月 |
| 15 | 划分建议 | ✅ | 官方 100/20/30 划分明确并被社区沿用 |
| 16 | 泄漏讨论 | ✅ | 每患者单例扫描,患者级泄漏在官方划分下不存在 |
| 17 | 标签分布 | ✅ | 论文 Fig. 2 与 Table 10 给出逐类体积与 scribble 占比 |
| 18 | 测量偏倚 | ⚠️ | 双标注者一致性有报告,但无第三标注者仲裁 |
| 19 | 外部验证建议 | ✅ | 官方提供 LiTS-20 外部标注与 RAOS 挑战集 |
| 20 | 版本记录 | ✅ | V0.1.0 版本命名与仓库提交历史可溯源 |
| 21 | 预处理脚本 | ⚠️ | 评测与 scribble 生成脚本开源,但预处理依赖 nnUNet 自身配置 |
| 22 | 合规要求 | ✅ | 伦理批准、学术限制、GPL-3.0 条款清晰 |
| 23 | 多模态对齐 | ❌ | 仅单模态 CT,无跨模态对齐问题 |
| 24 | 去标识化 | ✅ | 匿名化 + 删除临床治疗细节 + 伦理审查批准 |
DAIMS 评分:18.5 / 24
评分解读:WORD 在"标识、字典、划分、合规、去标识化"等数据治理基础项上表现优秀,官方划分、评测脚本与外部评测集的完备性在同类公开影像数据集中处于第一梯队。失分集中在影像数据集的固有项(宽格式、多模态不适用)与协议单一性带来的偏倚项(单中心、单设备、单期相、无逐例时间戳)。这一画像意味着:它是一块高质量但"窄而深"的基准,而非可直接代表真实临床多样性的数据源。
对你意味着什么:第一,可以放心把它作为全腹分割的官方基准与消融实验场,评测结果可直接与论文 Table 4 对齐;第二,任何面向真实临床的模型都必须叠加多中心/多期相数据,把 WORD 当作训练核心而非全部;第三,弱监督与蒸馏研究可直接复用其 scribble 标注与教师模型资产,节省数月构建成本;第四,向临床团队汇报时主动呈现逐类指标与域偏移风险,避免"均值 87%"造成的过度乐观。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| LiTS-20(官方新标注) | LiTS 选题 + WORD 团队标注 | 16 器官全腹分割 | 均值 Dice 87.66%(3D) | 与内部 87.41% 持平略升 | LiTS 强度分布与 WORD 接近,跨库迁移可行 |
| TCIA(43 例) | TCIA 公开数据 | 跨库直接推理 | 均值 Dice 75.39%(3D) | 下降约 12 点 | 协议差异导致明显域偏移 |
| BTCV(47 例) | BTCV 公开数据 | 跨库直接推理 | 均值 Dice 70.23%(3D)/ 49.10%(2D) | 下降约 17-38 点 | 域偏移最严重,2D 架构更脆弱 |
| 临床用户研究 | 三名不同医院初级肿瘤科医师 | 修订 20 例模型预测 | 大器官接近临床可用,小器官差距大 | — | 直接量化模型与医师差距 |
全部结果来自同行评审的 MedIA 2022 论文(DOI 10.1016/j.media.2022.102642)。
§8 基准性能与生态
§8.1 官方排行榜
以下为 MedIA 2022 论文在同一协议(nnUNet 框架、1000 epochs、CE+Dice 损失、无 TTA)下的统一评测结果,数字可直接比较:
| 排名 | 模型 | 均值 Dice(%) | 均值 HD95(mm) | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | nnUNet (3D) | 87.44±4.33 | 10.33±26.65 | 自配置 UNet、3D 全分辨率 | Luo et al., 2022, Medical Image Analysis. DOI: 10.1016/j.media.2022.102642 | nnUNet |
| 2 | nnUNetV2 (3D) | 87.41±4.57 | 8.84±22.63 | nnUNet 第二代框架 | 同上 | 同上 |
| 3 | ResUNet (2D) | 86.67±4.81 | 8.60±6.47 | 残差 UNet | 同上 | 官方仓库 |
| 4 | UNet++ (2D) | 86.28±3.96 | 12.35±15.87 | 嵌套稠密跳连 | 同上 | 同上 |
| 5 | AttUNet (3D) | 86.21±4.78 | 7.13±4.68 | 注意力门控 | 同上 | 同上 |
| 6 | nnUNetV2 (2D) | 85.80±5.27 | 9.88±9.16 | 2D 切片级 nnUNet | 同上 | 同上 |
| 7 | nnUNet (2D) | 84.92±5.39 | 10.79±10.29 | 2D 切片级 nnUNet | 同上 | 同上 |
| 8 | CoTr (3D) | 84.66±5.45 | 12.83±21.96 | CNN-Transformer 混合 | 同上 | 同上 |
| 9 | LCOVNet + KD (3D) | 85.82±4.89 | 9.11±13.87 | 轻量骨干 + 知识蒸馏 | 同上 | 同上 |
| 10 | UNETR (3D) | 79.77±4.92 | 17.34±28.80 | ViT 编码器 | 同上 | 同上 |
注意:本表数字全部来自同一论文的统一协议,方法间可比;但与其他论文使用不同划分、预处理或增强设置的数字不可直接比较(见坑点 8)。排名按均值 Dice,其中 LCOVNet+KD 为蒸馏设置单独列示。
§8.2 SOTA 总结与选型建议
结论一:在 150 例规模与放疗平扫协议下,卷积系方法(nnUNet 家族)仍优于 Transformer 系(UNETR 落后约 7.7 个 Dice 点),小数据量是 Transformer 的主要劣势。结论二:HD95 维度上 AttUNet(3D) 的 7.13 mm 最优,说明 Dice 与边界精度可分离选型。结论三:部署导向选型应看蒸馏系——LCOVNet+KD 以 0.82M 参数保住 85.82% Dice,推理 0.21 秒。实践建议:以 nnUNetV2(3D) 为强基线,以 LCOVNet+KD 为部署候选,逐类重点跟踪小器官。
§8.3 评测协议
官方协议要点:PyTorch 1.8、8×GTX1080TI;nnUNet 默认配置(3D batch=2、2D batch=12、1000 epochs、CE+Dice 组合损失);关闭测试时增强以保证方法间公平;指标为 Dice 与 95% Hausdorff 距离(medpy 实现);每模型训练超 6 GPU 天,单例全分辨率推理超 5 分钟(MedIA 2022 §4.1)。复现时务必保持"无 TTA + 官方划分 + 官方评测脚本"三要素。
弱监督协议与全监督协议存在两处关键差异,对比实验时需要显式对齐:其一,弱监督基线统一使用 ResUNet(2D) 骨干而非 nnUNet,因此 scribble 数字与全监督数字之间不构成严格的同骨干比较;其二,弱监督损失为 pCE + λ·EM + λ·IVM(λ=0.1),正则项的取舍会直接改变可比性——论文 Table 11 中 pCE 单独为 72.06%,加 EM 后 73.90%,再加 IVM 达 76.81%,正则贡献约 4.75 个 Dice 点。推理高效协议则固定教师为预训练 nnUNetV2(3D)、蒸馏输入 64×160×160、在 NVIDIA GTX1080TI 上计时,复现蒸馏结果时需同时锁定教师权重与输入分辨率。
跨库泛化协议同样有细节:官方将 WORD 预训练模型分别在 TCIA(43 例)、BTCV(47 例)与 LiTS 新标注 20 例上直接推理,不做任何微调;对 BTCV 只在部分器官上可比(BTCV 的 13 类与 WORD 的 16 类非同构),论文处理了标签映射关系。自行复现跨库实验时,标签映射策略必须显式写明,否则逐类数字没有意义。
§8.4 相关数据集
| 数据集 | 规模 | 与 WORD 关系 |
|---|---|---|
| BTCV | 50 例 CT / 13 器官 | 经典基准;WORD 泛化实验的目标域之一 |
| AbdomenCT-1K | 1,062 例 CT / 4 器官 | 大规模但类别窄,可作预训练源 |
| AMOS | 500 CT + 100 MR / 15 器官 | 多模态多中心对照 |
| FLARE 2022 | 约 2,300 例 CT / 13 器官 | 竞赛型多中心基准,含无标注数据 |
| LiTS-20(WORD 扩展) | 20 例 CT / 16 器官 | 官方为 WORD 新标注的外部评测集 |
| RAOS | 挑战性病例集 | WORD 团队 2024 年发布的鲁棒性评测扩展 |
§8.5 关键论文 Top 8
- Luo X, Liao W, Xiao J, Chen J, Song T, Zhang X, Li K, Metaxas DN, Wang G, Zhang S. WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image. Medical Image Analysis, 2022, 82: 102642. DOI: 10.1016/j.media.2022.102642 —— 数据集与全套基准的原始论文。
- Isensee F, Jaeger PF, Kohl SAA, Petersen J, Maier-Hein KH. nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation. Nature Methods, 2021, 18: 203-211. DOI: 10.1038/s41592-020-01008-z —— WORD 全部基准的统一框架。
- Ma J, et al. Fast and Low-GPU-memory abdomen CT organ segmentation: The FLARE challenge. Medical Image Analysis, 2022, 82: 102616. DOI: 10.1016/j.media.2022.102616 —— 同期腹部分割竞赛基准,与 WORD 互补。
- Ma J, et al. Unleashing the strengths of unlabelled data in deep learning-assisted pan-cancer abdominal organ quantification: the FLARE22 challenge. The Lancet Digital Health, 2024, 6(11): e815-e826. DOI: 10.1016/S2589-7500(24)00154-7 —— 半监督腹部分割的最新大规模评测。
- AbdomenAtlas Team. AbdomenAtlas: A large-scale, detailed-annotated, & multi-center dataset for efficient transfer learning and open algorithmic benchmarking. Medical Image Analysis, 2024, 97: 103285. DOI: 10.1016/j.media.2024.103285 —— 多中心扩展方向的最大对照。
- DMSPS 作者团队. DMSPS: Dynamically mixed soft pseudo-label supervision for scribble-supervised medical image segmentation. Medical Image Analysis, 2024, 97: 103274. DOI: 10.1016/j.media.2024.103274 —— scribble 弱监督的最新进展,常以 WORD 为基准。
- Luo X, et al. RAOS: 区域全腹器官分割挑战性病例集. MICCAI 2024. 代码与数据见 Luoxd1996/RAOS —— WORD 官方团队的鲁棒性扩展。
- Ma J, et al. AbdomenCT-1K: Is Abdominal Organ Segmentation a Solved Problem? arXiv:2106.09808, 2021 —— 提出并论证"全腹分割未解决"命题的先行工作,为 WORD 动机直接铺垫。
§8.6 社区活跃度
GitHub 仓库 HiLab-git/WORD 截至 2026-09 公开快照显示 159 stars、19 forks、3 个 open issues,代码语言为 Python,最后推送 2024-09-04(Ecosyste.ms 快照)。论文被引 270+(Google Scholar,截至 2026-09),引用分布在弱监督分割、蒸馏、多器官竞赛与临床应用论文中,是腹部分割领域事实上的标准基准之一。
§8.7 生态快照
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| HiLab-git/WORD | 官方代码+数据入口 | GitHub | 维护中(2024-09 最后推送) | 唯一官方来源 |
| word_metrics_computing.py | 评测脚本 | 官方仓库内 | 可用 | 统一 Dice/HD95 口径 |
| scribbles_generator.py | 稀疏标注生成 | 官方仓库内 | 可用 | 复现 scribble 实验 |
| WORD_V0.1.0_labelsTs.zip | 测试集标注 | 官方仓库内 | 可下载 | 无需申请即可校验评测 |
| RAOS | 鲁棒性扩展数据集 | GitHub | 可获取(MICCAI 2024) | 官方挑战性病例 |
| nnUNet | 训练框架 | GitHub | 活跃维护 | 官方基准同款框架 |
| arXiv:2111.02403 | 论文全文 | arXiv | v5(2023-02) | 表格数据最全版本 |
§9 相关资源与引用
§9.1 官方资源
- 官方仓库(数据申请、代码、评测脚本):GitHub - HiLab-git/WORD
- 论文全文(最新修正版):arXiv:2111.02403;ScienceDirect 正式版
- PubMed 索引:PMID 36223682
- 作者版 PDF(含论文全部表格):luoxd1996.github.io
- 鲁棒性扩展数据集:GitHub - Luoxd1996/RAOS
- 放疗勾画规范:RTOG 指南
社区与延伸资源:
- nnUNet 官方框架:GitHub - MIC-DKFZ/nnUNet(复现官方基准的第一入口)
- MONAI 医学影像框架:GitHub - Project-MONAI/MONAI(滑窗推理、NIfTI 变换与指标组件)
- ITK-SNAP 标注工具:itksnap.org(官方标注所用工具,修订模型预测时同样适用)
- 腹部 CT 数据集索引:CT Dataset Collection(横向查找 AMOS/FLARE/AbdomenCT-1K 等对照数据集的入口)
- scribble 弱监督跟进工作:DMSPS(MedIA 2024)等论文均以 WORD 为基准设置,检索 “scribble abdominal segmentation WORD” 可定位最新对比数字
§9.2 BibTeX 引用
@article{luo2022word,
title = {WORD: A large scale dataset, benchmark and clinical applicable study
for abdominal organ segmentation from CT image},
author = {Luo, Xiangde and Liao, Wenjun and Xiao, Jianghong and Chen, Jieneng
and Song, Tao and Zhang, Xiaofan and Li, Kang and Metaxas, Dimitris N.
and Wang, Guotai and Zhang, Shaoting},
journal = {Medical Image Analysis},
volume = {82},
pages = {102642},
year = {2022},
publisher = {Elsevier},
doi = {10.1016/j.media.2022.102642}
}
§9.3 引用指南
使用该数据集时请引用上述 BibTeX(论文官方 README 提供的同款条目);若同时使用 scribble 标注、蒸馏基准或 RAOS 扩展,建议在正文明确说明所用版本(V0.1.0)与划分(官方 100/20/30),并链接官方仓库以便复现。学术使用者按官方要求公开代码与预训练模型,是对数据集持续维护最直接的支持。
三种常见使用情形的引用组合建议:
- 仅用稠密标注做分割基准:引用 luo2022word 主条目,正文注明"官方 100/20/30 划分、无 TTA 协议"。
- 弱监督或蒸馏研究:除主条目外,在方法节注明骨干网络与损失配置(如 ResUNet(2D)、pCE+EM+IVM、λ=0.1),因为官方数字绑定这些设置;若引用蒸馏结果,注明教师为 nnUNetV2(3D)、输入 64×160×160。
- 跨库泛化或鲁棒性评测:同时引用主条目与 RAOS(MICCAI 2024),并显式说明标签映射策略——BTCV 的 13 类与 WORD 的 16 类并非同构,映射表的公开是结果可信的前提。
此外,因 WORD 采用 GPL-3.0 许可,基于其代码改造后分发的工具链需要遵守同源许可条款;这一点与"仅使用数据训练的模型权重是否受 GPL 约束"不同,后者以官方 README 的学术使用声明为准。
§10 AI 使用声明卡
§10.1 本页使用的 AI 模型列表
- 大语言模型(结构化写作与代码辅助,逐条人工校验后采纳)
- 检索增强工具(WebSearch/WebFetch,用于事实核验与来源收集)
§10.2 AI 参与范围
AI 参与了资料检索汇总、初稿撰写与代码示例生成;全部事实、数字、代码逻辑与医学表述经人工逐条核对后定稿。任何未经检索来源支撑的数字在定稿中一律删除。
具体分工如下:检索阶段由 AI 执行并汇总来源,种子档案中与检索结果冲突的四项信息(机构归属、发表会议、期相构成、器官清单)由人工比对原始来源后裁定;写作阶段各章节初稿由 AI 生成,人工负责结构取舍、口径统一与表述修正;代码块由 AI 起草,人工核对逻辑正确性(包括标签值域、插值阶数、指标跳过规则等关键细节),但未在真实 WORD 数据上逐行执行验证,使用前请以官方脚本为准;医学表述(癌种-器官勾画关系、放疗流程)经医学方向审核人复核。
§10.3 输入来源列表
- Luo X, et al. WORD: A large scale dataset, benchmark and clinical applicable study for abdominal organ segmentation from CT image. Medical Image Analysis, 2022, 82: 102642. DOI: 10.1016/j.media.2022.102642
- arXiv:2111.02403(v1 2021-11-03 至 v5 2023-02-13 全部修订记录)。https://arxiv.org/abs/2111.02403
- arXiv HTML 全文 v5(Table 4/5/6/7/8/10/14 数据)。https://arxiv.org/html/2111.02403v5
- HiLab-git/WORD 官方 GitHub README(获取方式、许可与声明)。https://github.com/HiLab-git/WORD
- PubMed PMID 36223682(正式发表记录)。https://www.pubmed.ncbi.nlm.nih.gov/36223682/
- 作者版论文 PDF WORD-MedIA2022.pdf(Table 2 临床特征、§3 标注流程)。https://luoxd1996.github.io/files/WORD-MedIA2022.pdf
- Google Scholar 引用页(被引 270+,截至 2026-09)。
- Ecosyste.ms 仓库元数据快照(stars/forks/最后推送时间)。https://awesome.ecosyste.ms/projects/github.com%2Fhilab-git%2Fword
- CT Dataset Collection 综合参考页(WORD 条目对比信息)。https://yx-yan.github.io/posts/CTdata
- Luoxd1996/RAOS 仓库(官方鲁棒性扩展,MICCAI 2024)。https://github.com/Luoxd1996/RAOS
- zefanyang/WORD 镜像仓库(labelsTs 2022-10 发布记录)。https://github.com/zefanyang/WORD
- 《计算机系统应用》论文(第三方对 WORD 规格与划分的引用描述)。https://www.c-s-a.org.cn/csa/article/html/10139
- RTOG 放疗勾画指南官网。https://www.rtog.org/
- nnUNet 官方仓库(官方基准统一框架)。https://github.com/MIC-DKFZ/nnUNet
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 全部字段 | 千方病案医学编辑部 | 逐字段比对 FACTS.md 与检索来源 | ✅ 已通过/已验证 |
| §1-§3 数据集事实与数字 | 千方病案医学编辑部 | 对照论文原文与官方 README 逐条核验 | ✅ 已通过/已验证 |
| §2 医学背景与编码映射 | 千方病案医学编辑部(医学方向) | ICD-11/SNOMED 概念核对与临床表述复核 | ✅ 已通过/已验证 |
| §4-§6 数据结构与全部代码 | 千方病案医学编辑部(数据工程方向) | 代码逻辑审查与口径一致性核对 | ✅ 已通过/已验证 |
| §7-§8 基准数字与评估 | 千方病案医学编辑部 | 逐数字比对论文 Table 4/5/6/7/8 | ✅ 已通过/已验证 |
| 种子信息纠错(机构/会议/期相/器官) | 千方病案医学编辑部 | 以检索来源为准逐项纠错并记录 FACTS.md | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页各章节初稿由 AI 辅助生成,经人工改写与事实校验后定稿;§6.5 坑点与 §7.7 DAIMS 评级为人工主导的判断性内容。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- nih-pancreas-ct — 共享标签:医学影像 / CT / 医学图像分割
- abdomenct-1k — 共享标签:医学影像 / CT / 医学图像分割
- totalsegmentator — 共享标签:医学影像 / CT / 医学图像分割
- han-seg — 共享标签:医学影像 / CT / 医学图像分割
- medical-decathlon — 共享标签:医学影像 / CT / 医学图像分割
- mosmeddata — 共享标签:医学影像 / CT / 医学图像分割
- ctspine1k — 共享标签:医学影像 / CT / 医学图像分割
- pddca — 共享标签:医学影像 / CT / 医学图像分割
- imagecas — 共享标签:医学影像 / CT / 医学图像分割
- ctooth — 共享标签:医学影像 / CT / 医学图像分割
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
