KiTS23 — 肾脏肿瘤分割挑战赛数据集(MICCAI 2023)AI-Ready Wikipedia

599 例双期相 CT 肾脏/肿瘤/囊肿三类分割,Sørensen-Dice + Surface Dice 双指标 rank-then-aggregate 官方排名,MICCAI 2023 挑战赛

来源 明尼苏达大学机器人研究所(MnRI)、Helmholtz Imaging(DKFZ)与克利夫兰诊所联合(M Health Fairview 2010-2022 回顾性队列;通讯作者 Nicholas Heller) url: https://kits23.kits-challenge.org/发布时间: 2026-09-27最后更新: 2026-09-27 阅读 20
KiTS23 — 肾脏肿瘤分割挑战赛数据集(MICCAI 2023)AI-Ready Wikipedia

信息速览

数据集名称KiTS23 — 肾脏肿瘤分割挑战赛数据集(MICCAI 2023)AI-Ready Wikipedia
数据类型599 例增强腹部 CT,489 训练/110 测试,kidney/tumor/cyst 三类体素标注,NIfTI .nii.gz 格式,期相异构(皮髓质期为主+肾实质期新增),临床元数据随仓库更新
规模599 例 CT 扫描(489 例训练公开标注 + 110 例测试官方持有标注)
接入方式明尼苏达大学机器人研究所(MnRI)、Helmholtz Imaging(DKFZ)与克利夫兰诊所联合(M Health Fairview 2010-2022 回顾性队列;通讯作者 Nicholas Heller) url: https://kits23.kits-challenge.org/
AI 就绪度

KiTS23 — 肾脏肿瘤分割挑战赛数据集(MICCAI 2023)AI-Ready Wikipedia


INFOBOX

数据集名称 KiTS23
英文全称 The 2023 Kidney and Kidney Tumor Segmentation Challenge(KiTS23 Challenge;官方仓库指定引用论文:The KiTS21 Challenge: Automatic segmentation of kidneys, renal tumors, and renal cysts in corticomedullary-phase CT,arXiv:2307.01984,引用口径详见 §9.4)
别名/简称 KiTS23、KiTS 2023、肾脏肿瘤分割挑战赛 2023、KiTS 系列第三届挑战赛
疾病分类 肾脏肿瘤病变谱(ICD-11:2C90 肾细胞癌为主任务对象;囊肿为良性囊性病变,非肿瘤编码,详见 §2.1)
SNOMED CT 64033007 Kidney structure(肾脏结构;肿瘤/囊肿标注无官方独立术语映射,详见 §2.1b)
数据模态 3D 增强腹部 CT(队列期相异构:corticomedullary 皮髓质期/晚动脉期病例为主,KiTS23 新增 nephrogenic 肾实质期病例;每例取单次增强扫描)
AI 任务类型 三类语义分割(kidney/tumor/cyst)+ 层次评估(HEC 三层聚合)+ 挑战赛排名(Sørensen-Dice 与 Surface Dice 双指标 rank-then-aggregate)
样本总数 599 例(489 例训练,含公开影像与标注;110 例测试,标注由官方持有,从未用于任何一届 KiTS 挑战)
数据大小 每例两个文件(imaging.nii.gz 增强 CT 影像 + segmentation.nii.gz 标注);整包为 599 例增强 CT NIfTI,体量远超单期相的 KiTS19,建议预留充足磁盘与带宽
数据格式 NIfTI(.nii.gz);语义标注 + 实例级标注(instance.nii.gz);临床元数据随仓库以 CSV/JSON 形式增量更新
许可证 数据 CC BY-NC-SA 4.0(附挑战赛使用豁免条款,商用需联系 helle246@umn.edu);评估与工具代码 MIT License
访问级别 开放获取:git clone 官方仓库 + pip install -e . + kits23_download_data 命令行拉取(2026-05 起影像托管于 Hugging Face)
DUO 标签 NCU(非商业使用,受 CC BY-NC-SA 4.0 约束);挑战赛参赛与研究使用获官方条款豁免
语言 英文(官方文档、标注协议、临床元数据字段);影像数据无语言属性
首发日期 2023-04-14(挑战赛发布,同为外部数据公开性认定截止日)
最后更新 影像托管层 2026-05-13(DigitalOcean 迁移至 Hugging Face);临床元数据层 2025-08-23(malignant 字段 null 值修复 commit)
发布机构 明尼苏达大学机器人研究所(MnRI)、Helmholtz Imaging(德国癌症研究中心 DKFZ)、克利夫兰诊所(Cleveland Clinic)联合组织
官方主页 https://kits23.kits-challenge.org/ 与 https://github.com/neheller/kits23
下载地址 git clone https://github.com/neheller/kits23 → kits23_download_data(影像源:Hugging Face neheller/KiTS-Challenge-Imaging)
DOI/论文 官方引用口径:heller2023kits21(The KiTS21 Challenge…,arXiv:2307.01984);KiTS23 方法短文 29 投 22 录,收录于 MICCAI 2023 挑战赛论文集(Springer LNCS 14540)
引用情况 KiTS 系列(19/21/23)论文为肾脏分割领域的基准引用;具体计数随时间变动,以 Google Scholar/Semantic Scholar 实时数据为准
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方评估代码可本地复现、pip 安装式获取链、nnU-Net/MONAI 官方基线齐全、评估指标(Surface Dice)对边界质量敏感;扣分项:影像不在代码仓库内需二次拉取、cyst 标注仅覆盖部分训练例、单中心来源、CC BY-NC-SA 限制商用
页面状态 published

§0 E-E-A-T 信任声明与免责声明

  • 医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(肾癌流行病学、ICD-11 与 SNOMED CT 映射、肾脏占位的临床处置链)、§7 质量评估(偏倚分析、标注质量)。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分与泄漏风险、§6 预处理 Pipeline 和 8 个坑点。
  • 审核日期:2026-09-27

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献与官方页面,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。KiTS23 影像与标注以 CC BY-NC-SA 4.0 分发(附挑战赛使用豁免条款),商业用途需另行联系组织方(helle246@umn.edu)。测试集(110 例)标注由官方持有且不公开;引用"测试集成绩"只能来自官方排行榜,任何自行计算的"测试成绩"均不成立。DUO 标签仅供参考,具体使用限制以官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? KiTS23 是 MICCAI 2023 肾脏与肾脏肿瘤分割挑战赛(The 2023 Kidney and Kidney Tumor Segmentation Challenge)的官方数据集:599 例腹部增强 CT,来自明尼苏达 M Health Fairview 医疗系统 2010-2022 年间的肾脏手术/消融患者,每例提供肾脏(kidney)、肿瘤(tumor)、囊肿(cyst)三类体素级标注,并且是 KiTS 系列第一个纳入 nephrogenic 肾实质期病例的版本——此前所有病例均为 late arterial(皮髓质期)单期相。

为什么重要? 它延续并升级了 KiTS19/KiTS21 两届挑战赛的评测基建:层次评估(HEC,三层聚合的评估粒度)+ 双指标(对重叠敏感的 Sørensen-Dice 与对边界敏感的 Surface Dice)+ rank-then-aggregate 排名(先在各子任务排名再聚合,抑制单指标过拟合)。冠军方案(NVIDIA 的 Myronenko,MONAI Auto3DSeg)达到 Dice 0.835 / Surface Dice 0.723,是当前肾脏肿瘤分割的公开最优参照点之一。

我能用它做什么? 训练肾脏三分类分割模型、在官方协议下做严格可比的验证(本地 kits23_compute_metrics 与官方完全同源)、研究排名机制与指标设计、做术前肾脏占位体积学分析,或者把它当作 nnU-Net/MONAI 3D 全自动流水线的标准试金石。注意:它不适合需要多中心多样性的泛化研究(单中心来源),也不适合任何商用产品(CC BY-NC-SA)。

§1.1 摘要

KiTS23 由明尼苏达大学机器人研究所(MnRI)、亥姆霍兹成像中心(Helmholtz Imaging,德国癌症研究中心 DKFZ)与克利夫兰诊所联合组织,核心组织者 7 人(Nicholas Heller 通讯、Bradley J. Wood、Fabian Isensee、Rafael Rädsch、Resha Tejpaul、Nikolaos Papanikolopoulos、Christopher Weight),于 2023-04-14 发布赛题与数据。数据在 KiTS21 的 489 例训练队列基础上扩充,并首次纳入 nephrogenic 肾实质期病例(此前所有病例均为 late arterial 晚动脉期),同时保持 110 例测试集完全隔离——这批测试影像从未出现在任何一届 KiTS 挑战中,是系列最严格的隐藏集。评估采用三层 HEC(Kidney and Masses / Kidney Mass / Tumor):参赛者先在全部病例与全部 HEC 上分别平均出 Sørensen-Dice 与 Surface Dice 两个总分,再按两个指标分别排名并以 rank-then-aggregate 方式聚合名次形成最终排名,平手时以 Tumor HEC 的平均 Dice 决出。挑战赛共 29 篇方法短文投稿、22 篇收入 MICCAI 2023 挑战赛论文集(Springer LNCS 14540),冠军方案为 NVIDIA Myronenko 的 MONAI Auto3DSeg 集成(Dice 0.835 / Surface Dice 0.723)。数据以 CC BY-NC-SA 4.0 开放,获取链为"git clone 代码仓库 → pip 安装 → kits23_download_data 拉取影像",2026-05 起影像托管层由 DigitalOcean 迁移至 Hugging Face。

§1.2 战略价值分析

关键数字速查卡(供快速引用,均经三源核验):

关键数字 值
队列总数 599 例(489 训练公开标注 + 110 测试官方持有)
标注类别 3 类(1=kidney,2=tumor,3=cyst)
评估粒度 3 个 HEC(Kidney and Masses / Kidney Mass / Tumor)
评估指标 2 个(Sørensen-Dice + Surface Dice)
排名机制 rank-then-aggregate(双指标名次平均),平手以 Tumor HEC Dice 决出
冠军成绩 Dice 0.835 / Surface Dice 0.723(Myronenko,NVIDIA,MONAI Auto3DSeg)
发布日 2023-04-14(同为外部数据公开性截止日)
方法短文 29 投 22 录(MICCAI 2023 挑战赛论文集,Springer LNCS 14540)
许可 数据 CC BY-NC-SA 4.0(含挑战赛豁免);代码 MIT
工具版本 v0.1.4;影像托管 Hugging Face(2026-05 起)

评测机制设计维度:KiTS23 对社区的最大贡献可能不是数据本身(相对前作增量有限),而是它把"挑战赛该怎样排名"这个问题做成了可复用的样板。单指标排行榜容易被单个指标的怪癖过拟合——比如 Dice 对小目标的波动、对边界偏移的迟钝。KiTS23 用三层 HEC 强制参赛者在"整体肾脏系统"“肾脏+肿物”"纯肿瘤"三个粒度上同时表现,用 Surface Dice 补上 Dice 对边界不敏感的盲区,然后按官方 README 载明的机制:先把全部病例、全部 HEC 上的成绩平均为平均 Dice 与平均 Surface Dice 两个总分,再在这两个指标上分别排名、以 rank-then-aggregate 聚合名次——名次而非数值的聚合抑制了"在某个子项上极端投机"的套利空间。这套机制连同官方开源的 ranking.py(generate_summary_csv + rank_participants),对任何打算组织医学分割挑战赛的团队,都是一份可直接复用的协议模板。

系列演进维度:KiTS19(2019)用 300 例单期相数据确立了"肾/肿/囊"三分类与隐藏测试集范式;KiTS21(2021)扩充训练队列并引入双指标评估;KiTS23(2023)首次纳入 nephrogenic 期病例并固化 rank-then-aggregate。三届赛事共用同一套病例 ID 体系与前缀命名,这既是资产(跨版本可追溯)也是陷阱(病例重叠导致跨版本划分极易泄漏,见坑点 6)。对研究者而言,KiTS 系列是少见的"同一临床问题、三代数据协议"的纵向实验场,适合研究数据协议演进对模型结论的影响。

临床任务纵深维度:与多数"器官分割"数据集不同,KiTS 系列的标注对象是病理实体(肿瘤与囊肿)而非纯解剖结构,且标注协议明确要求肿瘤按"术前疑似恶性"判定、囊肿按影像或病理判定。这使它天然连接到泌尿外科真实决策链:肿瘤大小与体积影响 T 分期与术式选择(肾部分切除 vs 根治切除),囊肿的 Bosniak 分类依赖囊壁形态与强化特征。KiTS23 引入 nephrogenic 肾实质期病例正是对临床现实的回应——皮髓质期适合观察动脉供血与肿瘤边界,肾实质期适合评估强化程度与囊壁细节;但每例仅含单一期相,队列层面的期相异构(phase heterogeneity)既是部署真实性的来源,也是分布混杂的来源(见坑点 3)。

生态位维度:KiTS23 与 Medical Segmentation Decathlon(MSD)的 Kidney 任务、AbdomenCT-1K 的肾脏子集共同构成肾脏分割研究的三大公共数据供给,但三者定位不同:MSD 提供小额标准基准,AbdomenCT-1K 把肾脏并入多器官框架(且左右肾合并为单一标签),只有 KiTS 系列提供"肾/肿/囊"病理实体级标注与官方排名基础设施。加上官方在仓库内维护的参考实现列表(MIC-DKFZ nnU-Net 等 8 个开源方案),KiTS23 是肾脏肿瘤分割方向事实上的主场数据集。

§1.3 同类数据集横向对比

数据集 规模 模态 标注 核心差异化
KiTS23 599 例 CT(489 训练 + 110 测试) 3D 增强CT(期相异构:皮髓质期为主,新增肾实质期) kidney/tumor/cyst 三类体素级 + 临床元数据 病理实体级标注 + 官方双指标排名机制 + 系列最严格隐藏测试集
KiTS19 300 例 CT(210 训练 + 90 测试) 3D 增强CT(单期相) kidney/tumor/cyst 三类体素级 系列起点;测试集已于 KiTS21 起转为训练用途,"刷分"价值下降
KiTS21 训练队列与 KiTS23 重叠(含 case_00000-00299 及其后继) 3D 增强CT(单期相为主) kidney/tumor/cyst 三类体素级 引入双指标与 HEC 聚合评估;与 KiTS23 病例重叠,勿跨版本混用划分
MSD Kidney(Task 06/Task 09) 148 / 163 例 CT 3D 增强CT kidney/tumor 二类或 kidney/tumor/cyst 小额通用基准,适合冒烟测试;无挑战赛排名基建
AbdomenCT-1K 肾脏子集 300 例(源自 KiTS) 3D CT kidney(左右合并为单一标签) 多器官框架的一环;无肿瘤/囊肿实体标注
LiTS 201 例 CT 3D CT 肝 ± 肿瘤 肝脏方向挑战赛遗产,与 KiTS 系列构成"腹腔实体瘤分割"对照
AMOS 数百例 CT+MRI 3D CT/MRI 15 器官(肾为结构标签) 跨模态多器官;不区分肾脏病理实体

KiTS23 的不可替代性有三点:其一,它是唯一提供"肾脏病理实体三分"(恶性倾向肿瘤、良性囊肿、正常肾组织)且标注协议与病理核验挂钩的大规模公开 CT 数据集;其二,它是唯一带官方双指标 + rank-then-aggregate 排名基建的肾脏数据集,本地评估代码与官方评测器同源;其三,它的 110 例测试集具备真正的"从未被使用"隔离史,排行榜结果的可信度高于那些测试集早已公开的前代挑战。

选择决策指南:如果你的任务是"肾脏占位分割本身"——选 KiTS23(标注最对口、评估最规范);如果是"多器官系统的肾脏组件"——选 AbdomenCT-1K 或 AMOS(多器官统一协议);如果是"快速方法验证、数据预算有限"——选 MSD Kidney(体量小、加载快);如果要"跨中心泛化叙事"——KiTS23 只能当训练源,验证需另配多中心集;如果做"CT 期相效应研究"——KiTS23 的期相异构队列是稀缺素材,但需自行补期相判别。

§1.4 版本演进时间轴

时间 事件
2019 KiTS19 挑战赛(MICCAI 2019):300 例单期相 CT(210 训练/90 测试),确立 kidney/tumor/cyst 三分类与 git 仓库分发范式
2021 KiTS21 挑战赛:训练队列扩充(与 KiTS23 共享前 300 例 ID),引入双指标(Dice + Surface Dice)与层次评估
2023-04-14 KiTS23 发布:首次纳入 nephrogenic 肾实质期病例、固化三层 HEC 与 rank-then-aggregate 排名;同日为外部数据公开性认定截止日
2023-07-14 参赛方法短文截稿
2023-07-21 至 07-28 测试集提交窗口(结果以官方评测为准)
2023-07-31 最终结果公布;NVIDIA Myronenko(MONAI Auto3DSeg)获冠军
2023-10-08 或 10-12 温哥华 MICCAI 2023 卫星研讨会(官方仓库 README 即并列两种口径"October 8 or 12",本页如实存照,未见官方进一步澄清)
2023-12 Springer LNCS 14540 论文集出版(MICCAI 2023 挑战赛联合论文集,29 投 22 录)
2024-02-07 临床元数据 commit:新增 sarcomatoid/rhabdoid 组织学与 AUA 风险字段
2025-08-23 临床元数据修复 commit:malignant 字段 null 值问题处理
2026-05-13 影像托管迁移 commit:下载后端由 DigitalOcean 切换至 Hugging Face(neheller/KiTS-Challenge-Imaging)

§1.5 典型应用场景

  1. 肾脏三分类分割算法研究:489 例训练数据 + 官方同源评估代码(kits23_compute_metrics),可以在本地完整复现 HEC × 双指标的六项成绩,是肾脏肿瘤分割论文的标准验证场。
  2. 排名机制与指标学研究:rank-then-aggregate、HEC 聚合、Surface Dice 的边界敏感性——这些都是指标设计研究的活标本,适合做"评估协议如何影响结论"的元研究。
  3. nnU-Net / MONAI 流水线基准:官方参考实现列表收录 8 个开源方案,nnU-Net 官方仓库与 MONAI Auto3DSeg 均以 KiTS 为展示任务,适合做训练策略、架构改进的对照实验。
  4. 术前体积学与肿瘤学量分析:体素级肿瘤标注 + 临床元数据(组织学亚型、AUA 风险分层、 malignant 标记)支持"影像组学特征 ↔ 病理结局"的关联研究,是放射组学(radiomics)论文的常见数据源。
  5. 半监督与模型压缩研究:冠军与前排方案普遍采用集成与多折训练,推理开销大;"如何用蒸馏/剪枝逼近集成性能"是 KiTS23 数据上现实且有发表价值的工程课题。

§1.6 对 AI 代理与自动化研究的使用指引

本条目为 AI 代理(Agent)消费做了针对性设计。若你正在代表用户检索与本数据集相关的事实,请优先使用以下机器友好结论:

  • 身份三元组:KiTS23 = The 2023 Kidney and Kidney Tumor Segmentation Challenge;数据 599 例(489 训练 + 110 测试);MICCAI 2023 挑战,官网 kits23.kits-challenge.org。
  • 任务语义:三类语义分割(label:1=kidney,2=tumor,3=cyst),评估在派生 HEC 三层上进行(Kidney and Masses / Kidney Mass / Tumor),指标为 Sørensen-Dice 与 Surface Dice。
  • 获取链:git clone → pip3 install -e . → kits23_download_data(影像自 Hugging Face neheller/KiTS-Challenge-Imaging)。
  • 成绩引用红线:测试集成绩只能引用官方评测(冠军 Dice 0.835 / Surface Dice 0.723),任何"自行计算的测试成绩"不可采信。
  • 本条目的结构化事实:frontmatter 的 schema_org @graph 节点(Dataset / cr:RecordSet / rai:* 五字段)可直接作为知识图谱三元组来源;文末 JSON-LD 镜像块供前端渲染。
  • 高频陷阱速判:影像不在 repo(坑点 1)、cyst 半数无标注(坑点 2)、期相异构(坑点 3)、自实现评估易错(坑点 4)、跨版本 ID 重叠(坑点 6)、层厚各向异性(坑点 7)。

§2 医学背景

§2.1 ICD-11 疾病与病变映射

KiTS23 的标注对象是"结构 + 病理实体"混合:kidney 为解剖结构,tumor 与 cyst 为影像判读实体。ICD-11 映射面向队列背后的病变谱——队列全部由"术前疑似肾恶性肿瘤"的手术/消融患者构成:

病变/标注对象 ICD-11 编码 ICD-11 中文名 数据集内角色
肾细胞癌(renal cell carcinoma,RCC) 2C90 肾细胞癌 tumor 标注的主要病理背景;队列纳入标准即"术前疑似肾恶性肿瘤"
其他肾恶性肿瘤谱 — 肾盂癌、肾母细胞瘤等(本队列未单独披露组织学分布全表) 潜在构成,具体以 clinical 元数据与病理报告为准
肾囊肿 — 良性囊性病变(非肿瘤,无 ICD-11 肿瘤编码) cyst 标注对象; Bosniak 分类的影像判读实体
肾脏(结构) — 解剖结构,无疾病属性 kidney 标注对象(含肾门非脂肪组织)

需要强调:数据集的 tumor 标签是"术前疑似恶性"的影像学判定而非病理确诊标签——官方三类定义原文即为 “Masses found on the kidney that were pre-operatively suspected of being malignant”。不能把 tumor 标签直接当作 ICD-11 恶性肿瘤的病例级标签使用;队列的真实恶性比例需结合临床元数据中的病理字段理解。

§2.1b SNOMED CT 术语映射

标注对象 SNOMED CT 编码 SNOMED 术语 说明
肾脏(结构) 64033007 Kidney structure label=1,含全部肾实质与肾门内非脂肪组织
肾肿瘤(实体) — 官方未提供独立术语映射(对应概念族含 renal cell carcinoma 等,按组织学细分) label=2,术前疑似恶性
肾囊肿(实体) — 官方未提供独立术语映射(对应 Bosniak 囊性病变谱) label=3,影像学(或病理,若可获得)判定

官方仓库未发布结构化术语映射表;上述映射中仅肾脏结构码为确定项,肿瘤/囊肿因属"影像判读实体"(其病理归属依赖后续组织学),映射应结合临床元数据的病理字段个案完成。

临床流行病学补充:从全球负担看,肾癌的发病率存在明显的地区梯度(发达经济体较高,与影像检查可及性和生活方式因素相关),男性发病率普遍高于女性;已确立的危险因素包括吸烟、肥胖与高血压。这些背景共同解释了 KiTS23 队列的形态学面貌:影像可及性高的医疗系统中,偶然发现的小占位占比高、手术与消融的适应证谱系宽——队列中既会有直径数厘米的大肿瘤,也会有大量"小而存疑"的偶发占位,后者正是分割任务里最难、也最有临床价值的一部分。

§2.2 医学简介与流行病学背景

肾细胞癌是全球最常见的泌尿系统恶性肿瘤之一。按 KiTS23 官方页面引用的口径,肾癌每年确诊超过 43 万人、造成约 18 万死亡;而影像学检出的肾脏肿瘤总数比肾癌更大——因为绝大多数肾脏占位是在因其他适应证进行的腹部影像检查中偶然发现的。这一"偶然发现潮"带来了泌尿外科近二十年的核心临床难题:在多数情况下,仅凭影像无法可靠判定一个肾脏占位是恶性还是良性。

官方页面进一步指出两个关键事实,构成了这个数据集的临床动机:

  1. 即使是术前拟诊恶性的肿瘤,许多也呈缓慢生长的惰性生物学行为——这催生了"主动监测(active surveillance)"作为小肾肿瘤(small renal masses)日益主流的处理策略;
  2. 进展为转移性疾病的风险是严肃的——因此临床上迫切需要能客观、可靠地表征肾脏肿瘤影像的系统,用于风险分层(risk stratification)与治疗结局预测(treatment outcome prediction)。

这正是 KiTS 系列选择"肾/肿/囊"三分作为任务的原因:分割是风险分层的几何基础。肿瘤体积、肿瘤位置(是否累及肾窦/集合系统)、肿物与囊肿的鉴别,都直接进入泌尿外科的术式决策(消融 vs 肾部分切除 vs 根治切除)与随访策略。三种标注类别在 CT 上的典型影像学特征:

标注类别 CT 典型表现 与周围结构的关系
Kidney(label=1) 正常肾实质强化模式;含肾门内非脂肪组织 覆盖左/右肾全部实质;不含肾周脂肪
Tumor(label=2) 增强后不均匀强化、假包膜征等;形态不规则 突出于肾轮廓或浸润性生长,与肾实质边界常模糊
Cyst(label=3) 水样密度、边缘锐利、无强化(良性特征) 边界清晰的占位,可单发或多发

注:官方页面示例图使用紫色表示肾脏、绿色表示肿瘤、蓝色表示囊肿;可视化自己的预测时建议沿用这套配色约定以便与官方材料对照。

§2.3 临床任务定义

KiTS23 支撑的临床任务链围绕"肾脏占位"的全程管理:

临床环节 分割的作用 与 KiTS23 的关系
偶发瘤检出与初判 自动勾勒肾脏占位,提示"是囊肿还是实性肿物" cyst 与 tumor 的分类标注直接对应这一鉴别任务
风险分层 瘤体三维测量(大小、体积、位置)替代一维直径,支持 nephrometry 类评分 体素级 tumor 标注 + 临床元数据(组织学亚型、风险字段)支持影像-病理关联研究
术式规划 肿瘤与肾实质的空间关系重建(保肾单位手术的可行性判断) 三类标注可重建"肾脏-肿物"复合模型
消融/手术随访 术后消融区与残留/复发病灶的体积对比 队列含冷冻消融患者,但标注为术前扫描,术后对比需自行扩展
治疗结局预测 影像组学特征提取的几何前提 官方明确以"预测治疗结局"为数据集的转化研究定位之一

一个重要的口径提醒:KiTS23 的标注是术前增强 CT,即"手术/消融前"的影像——它支撑的是术前评估,不是术后即刻病理对照;把 tumor 标签当成"该像素就是肾癌"的组织学真值使用,超出了标注协议的语义边界。

放射组学(radiomics)研究的工作流位置:官方明确把"肾肿瘤放射组学的公共资源"列为系列数据的双重角色之一(分割基准 + 转化研究资源)。在放射组学工作流中,KiTS23 处于"特征提取的几何源头"位置:三类分割提供 ROI(肿瘤/囊肿/肾实质),临床元数据提供结局变量(组织学、恶性标记、风险分层),两者拼出"特征 → 结局"关联研究的完整素材。但注意三点:ROI 质量直接决定特征稳定性(分割误差会传导为特征噪声);单中心来源限制结局模型的外推;两批 commit 的元数据差异(§3.4)会改变样本量与标签分布——放射组学论文尤其要把数据版本写死。

§2.4 患者人群构成

维度 构成情况 说明
纳入标准 2010-2022 年间在 M Health Fairview 医疗中心因疑似肾恶性肿瘤接受冷冻消融(cryoablation)、肾部分切除(partial nephrectomy)或根治性肾切除(radical nephrectomy)的患者 官方队列定义原文
影像纳入条件 最近一次增强前 CT 扫描,且完整覆盖双肾 entirety 不满足覆盖要求的病例被排除
期相构成 每例取单次扫描:corticomedullary(皮髓质期,即 late arterial 晚动脉期)或 nephrogenic(肾实质期);KiTS23 新增后者 队列期相异构,官方未公布两期相病例数的精确比例
疾病谱 全部为"术前疑似恶性"的手术/消融患者;肿瘤患病率近乎 100% 无健康对照、无主动监测人群、无保守处理患者
年龄/性别/种族分布 官方未公开统一人口学统计 临床元数据含病理与风险字段,但人口学维度披露有限
中心数量 M Health Fairview 医疗系统(明尼苏达州,多家医院组成的统一体系);官方历史口径亦称"multi-institutional cohort" 见 §7.1 偏倚讨论:地理与体系意义上的"多机构",但同属单一医疗系统

纳入标准的逐条技术含义:官方纳入 = “疑似肾恶性肿瘤手术/消融患者 + 最近一次增强前 CT + 覆盖双肾完整范围”。逐条拆开:术式限定意味着队列按"已决定干预"分层(选择偏倚的来源);"最近一次扫描"意味着有多次 CT 的患者只取其一(无纵向配对);"增强"意味着平扫不可用(增强缺失的检查被排除);"覆盖双肾完整"意味着上腹/下腹截断的扫描被排除——这四条合起来解释了为什么队列没有纵向数据、没有平扫对照、也没有部分肾脏截断的边缘病例。做"分布对齐"研究(如域自适应)时,这些排除条件就是你域差距的第一来源。

§2.5 临床价值

对算法侧而言,KiTS23 提供的是"肾脏占位分割"这一具体任务的最高规格公共基准:标注与病理判读协议挂钩、评估指标对边界敏感(Surface Dice)、排名机制抑制单指标过拟合。冠军方案 Dice 0.835 / Surface Dice 0.723 给出了当前技术水平下"肾脏三分类分割"的可达上限参照。

对临床侧而言,价值集中在三个场景:

临床场景 需求 KiTS23 提供的支撑 尚需补充的环节
小肾肿瘤主动监测 随访中体积/生长速度的可靠量化 体素级 tumor 标注支撑体积算法开发;但队列无纵向随访数据 纵向(同一患者多次扫描)数据集
保肾手术规划 肿瘤位置、深度与肾实质的关系 三类标注 + 临床元数据(术式字段)可训练术前预测模型 血管系统分割(需专门数据)
囊肿与肿物鉴别 影像学良恶性初判的自动化 cyst/tumor 双实体标注是罕见资源;但 cyst 标注仅覆盖部分训练例 Bosniak 分级标注(本数据集无)

务实的定位:KiTS23 回答的是"我的肾脏三分类分割模型在官方协议下还有多少提升空间",而不是"我的系统能否直接用于良恶性诊断"——后者需要前瞻性数据、病理金标对照与监管路径,其中影像判读本身的良恶性不确定性(§2.2)是方法学天花板,不是数据规模能解决的。

§2.7 囊肿判读与 Bosniak 分类的边界

KiTS23 的 cyst 标签与放射科日常使用的 Bosniak 分类(Bosniak classification)不是同一层级的概念,混用会造成系统性误读:

维度 KiTS23 cyst 标签 Bosniak 分类
语义 "影像学(或病理,若可获得)判定为囊肿"的肿物 基于强化、分隔、囊壁结节等特征的恶性风险分级(I 至 IV)
粒度 二元判定(是囊肿 / 不是囊肿) 五级风险分层
依赖信息 增强前单次扫描的形态学判读 严格依赖强化行为(需要期相内对比 + 期相间比较的判读纪律)
在本数据集中的角色 分割标签 未提供(无 Bosniak 分级字段)

两点实践含义:其一,若你的研究目标是 Bosniak 自动分级,KiTS23 的 cyst 标签可作为"囊肿检测"的弱监督信号,但分级标签需另行收集;其二,Bosniak 判读对强化极其敏感,而 KiTS23 每例仅单期相——用单期相数据模拟"期相间比较"的判读流程本身就是方法学假设,需在论文中明示。

§2.8 肾癌组织学亚型谱与本队列的关系

透明细胞肾细胞癌(clear cell RCC)是肾癌最常见亚型,也是富血供、典型"快进快出"强化模式的来源;乳头状(papillary)与嫌色细胞(chromophobe)亚型的强化与密度特征不同,是影像判读的主要混淆来源;sarcomatoid(肉瘤样)与 rhabdoid(横纹肌样)分化是侵袭性标志——KiTS23 临床元数据在 2024-02-07 commit 中专门新增了这两类分化字段,说明组织学维度被纳入了官方数据治理范围。注意:影像侧的 tumor 标签不区分亚型,亚型信息只存在于临床元数据中,两层的关联分析(影像表型 ↔ 组织学)正是这个数据集为放射组学研究预留的空间。

§2.6 金标准对照表

层面 金标准 KiTS23 的实现方式 局限
病理学诊断 手术切除/消融标本的组织病理学检查(最终金标准) 临床元数据携带病理衍生字段(组织学亚型、恶性标记等),随仓库增量修订 标签语义是"术前疑似恶性"而非病理确诊;消融患者可能无完整病理
影像判读 资深影像/泌尿判读 + 病理知情复核 tumor/cyst 按影像学(cyst 可用病理)判定;系列既往版本采用多级标注复核流程 判读者间一致性数据未随 KiTS23 批次独立披露
分割轮廓 无像素级"物理金标准",以标注协议+多人复核为操作金标准 segmentation.nii.gz 为体素级语义标注 囊肿标签仅覆盖部分训练例,cyst 相关评估需注意覆盖率
挑战赛成绩 官方评测器(/kits23/evaluation/)+ 官方持有测试集 本地 kits23_compute_metrics 与官方同源 测试集标注不公开,自行"复现测试成绩"不成立

§3 数据集规格

§3.1 数据集版本矩阵

KiTS 系列三代版本共用病例 ID 命名(case_XXXXX 五位编号),核心差异如下:

维度 KiTS19(2019) KiTS21(2021) KiTS23(2023)
队列规模 300 例(210 训练 + 90 测试) 训练队列扩充(与 KiTS23 共享 case_00000-00299) 599 例(489 训练 + 110 测试)
期相 单期相:corticomedullary(late arterial) 单期相:corticomedullary 期相异构:corticomedullary 为主,新增 nephrogenic 病例
标注类别 kidney/tumor/cyst kidney/tumor/cyst kidney/tumor/cyst
评估指标 Dice Dice + Surface Dice(HEC 聚合) Dice + Surface Dice(HEC 聚合 + rank-then-aggregate 排名)
测试集独立性 已于后续版本转为训练用途 case_00000-00299 已并入训练 110 例从未用于任何挑战(系列最严格隐藏集)
工具仓库 neheller/kits19 neheller/kits21(评估含 surface dice) neheller/kits23(v0.1.4,评估与排名脚本齐备)

跨版本使用警告:case_00000-00209 曾是 KiTS19 训练集、case_00210-00299 曾是 KiTS19 测试集、case_00000-00299 是 KiTS21 与 KNIGHT 的训练集、case_00400-00499 曾是 KNIGHT 测试集。任何跨版本混用划分都会把"某版本的测试病例"训练进模型(详见坑点 6)。

§3.2 模态与期相

  • 模态:腹部增强 CT(多排螺旋,多厂商设备)。
  • 期相语义:corticomedullary(皮髓质期)即官方所称 late arterial(晚动脉期),皮髓质对比强,适合观察肾脏轮廓与富血供肿物;nephrogenic(肾实质期)实质均匀强化,适合评估强化程度与囊壁细节。KiTS23 的关键变化是把 nephrogenic 期病例首次纳入队列。
  • 每例期相数:每例贡献单次扫描(官方定义:“Each case’s most recent contrast-enhanced preoperative scan (in either corticomedullary or nephrogenic phase) was segmented”),不存在同一病例的双期相配对数据——需要期相配对研究的读者请注意,这不是双期相配对数据集。
  • 覆盖范围:增强 CT 需完整包含双肾(纳入标准),上极下极截断的扫描不在队列内。

§3.3 数据子集与规模

子集 例数 影像 标注 用途
训练集 489 公开(kits23_download_data 拉取) 公开(segmentation.nii.gz) 训练与本地交叉验证
测试集 110 官方持有(参赛提交期使用) 官方持有,永不公开 官方评测与排行榜
合计 599 — — —

与前作病例重叠的官方原表(训练集内):

病例 ID 区间 KiTS19 KiTS21 KNIGHT
case_00000 - case_00209 训练集 训练集 训练集
case_00210 - case_00299 测试集 训练集 训练集
case_00400 - case_00499 — — 测试集

KiTS23 的 110 例测试集(case_00500 及其后续编号中分配的部分)从未用于任何一届挑战。

§3.4 文件格式与目录约定

官方仓库(github.com/neheller/kits23)承担双重角色:数据版本管理 + 官方评估工具分发。官方设计是"segmentation 直接存于 GitHub,影像从独立服务器按需拉取":

kits23/
├── setup.py                      # pip3 install -e . 安装入口
├── kits23/                       # Python 包:下载与评估工具
├── evaluation/                   # 官方指标实现(Dice / Surface Dice)
├── ranking.py                    # generate_summary_csv + rank_participants
└── dataset/
    ├── case_00000/
    │   ├── imaging.nii.gz        # 增强 CT 体数据(NIfTI)
    │   ├── segmentation.nii.gz   # 体素级语义标注(0/1/2/3)
    │   └── clinical/             # 临床元数据(随仓库 commit 增量修订)
    ├── case_00001/
    │   └── ...
    └── case_00598/
  • 标注取值:0 = 背景,1 = kidney,2 = tumor,3 = cyst。
  • 临床元数据:以文件形式随病例目录分发,内容随仓库 commit 演进(2024-02-07 新增 sarcomatoid/rhabdoid 组织学与 AUA 风险字段;2025-08-23 修复 malignant 字段 null 值)——复现研究时必须记录所用 commit。
  • 推荐运行环境:官方在 Ubuntu + Python 3.10.6 上测试;Python 2 不支持。

临床元数据的版本演进对照:

阶段 状态 对研究的影响
挑战赛期(2023-04 起) 基础病理与临床字段 早期论文的统计基于此版本
2024-02-07 commit 新增 sarcomatoid/rhabdoid 分化与 AUA 风险分层字段 影像-风险分层研究的可用性提升;跨版本统计需注意字段集差异
2025-08-23 commit 修复 malignant 字段 null 值 此前版本做恶性比例统计会引入偏差
使用原则 字段集以所用 commit 为准 任何统计写明 commit;不做"跨 commit 混合统计"

§3.5 数据大小与下载体量

  • 每例两个核心文件:imaging.nii.gz(CT 体数据)+ segmentation.nii.gz(标注)。
  • 官方未公布统一压缩包规格:影像按例从 Hugging Face(neheller/KiTS-Challenge-Imaging)增量拉取,全量体量为数百例增强 CT 体数据的聚合,显著大于 KiTS19 单期相版本。
  • 实操建议:预留 50 GB 以上磁盘空间并使用稳定网络(影像拉取是整个获取链中最慢的环节,见坑点 1)。

体量与获取成本的成分分解:体量 ≈ 病例数 × 每例体数据大小(受层厚、视野与压缩率影响)+ 标注与元数据(相对可忽略)。KiTS 系列的 CT 覆盖双肾、视野有限(非全身扫描),单例体数据小于全身 CT;但 599 例聚合 + 增强扫描的宽 HU 动态范围,使整包仍属"数十 GB 量级"的重资产。三个实操推论:拉取时间以小时计而非分钟计;团队内共享一份只读副本优于各自拉取;CI 环境不要试图缓存全量影像——用 10-20 例冒烟子集跑流水线测试即可。

§3.6 标注方式与标注者

  • 标注协议(官方三类定义原文的中译):
    1. Kidney:包含全部肾实质与肾门内的非脂肪组织(“Includes all parenchyma and the non-adipose tissue within the hilum”)——注意肾门血管等非脂肪结构计入肾脏,脂肪不计入;
    2. Tumor:位于肾脏的、术前疑似恶性的肿物(“Masses found on the kidney that were pre-operatively suspected of being malignant”);
    3. Cyst:影像学判定(如可获得则结合病理)为囊肿的肾脏肿物(“Kidney masses radiologically (or pathologically, if available) determined to be cysts”)。
  • 标注者:官方 KiTS23 材料未独立披露本批次标注者人数、资质与工时;KiTS 系列既往论文描述的流程为受训标注员执行 + 影像/泌尿专科医师复核的多级机制。本页不对 KiTS23 批次的标注人力细节做虚构填充。
  • ** cyst 覆盖率**:cyst 标签未覆盖全部训练例(社区文献口径约为 248/489 例携带囊肿标注)——依赖 cyst 类别的研究必须先做覆盖率盘点(见坑点 2)。

§3.7 标注与数据更新历史

时间 更新
2023-04-14 挑战赛发布,训练数据开放
2023-07-21 至 07-28 测试提交窗口(评估在官方持有的测试集上完成)
2023-07-31 最终结果公布
2024-02-07 临床元数据 commit:新增 sarcomatoid/rhabdoid 组织学亚型与 AUA 风险分层字段
2025-08-23 临床元数据修复 commit:malignant 字段 null 值问题处理
2026-05-13 影像托管迁移 commit:下载后端由 DigitalOcean 切换至 Hugging Face
当前 工具仓库版本 v0.1.4(0.1.3 → 0.1.4 仅更新依赖)

这条时间轴背后是一个值得注意的演进模式:数据本体(队列影像与标注)在挑战赛年(2023)冻结,其后数年演进的是"治理与基础设施层"——临床字段扩充(2024-02)、null 值修复(2025-08)、托管迁移(2026-05)。这让影像侧结果可以跨年比较,同时数据治理问题通过 commit 持续修缮——"本体稳定、治理持续"的分层维护,是长期数据集运营的可借鉴样板。

§3.8 地域与中心

  • 单一医疗系统来源:全部病例来自美国明尼苏达州的 M Health Fairview 医疗系统(2010-2022)。
  • “multi-institutional” 的口径辨析:官方页面在回顾 KiTS 系列时称其为"publicly-available, multi-institutional cohort"——这是对系列多年积累的历史性表述;就 KiTS23 队列而言,纳入标准限定于 M Health Fairview,属于"同一医疗系统内多机构"而非跨国家/跨区域多中心。做泛化性声明时必须以后者为准(见 §7.1)。

§3.9 采集设备与参数

  • 设备厂商:官方未公布逐例设备型号表;同一医疗系统的多院区扫描仪构成意味着多厂商混合(做多中心部署评估时需自行从 DICOM 元数据补齐——但 NIfTI 发布版不携带设备信息)。
  • 空间分辨率:病例间体素间距各向异性明显——面内分辨率普遍较高,而层厚可达 5 mm 量级;官方未做统一重采样,各向同性化预处理是使用者的责任(见坑点 7)。
  • 扫描协议:增强扫描(皮髓质期或肾实质期),覆盖双肾完整范围;窗宽窗位与重建核信息未随 NIfTI 发布。

§3.10 数据溯源链

患者(2010-2022,M Health Fairview,疑似肾恶性肿瘤手术/消融)
  → 回顾性筛选(增强前 CT 覆盖双肾 entirety)
  → 去标识化(影像 + 临床元数据)
  → 标注(三类语义分割,协议见 §3.6)
  → 组织方审查(MnRI / Helmholtz Imaging / Cleveland Clinic)
  → GitHub(segmentation + 元数据,直存) + Hugging Face(影像,2026-05 起)
  → 用户(git clone + pip install -e . + kits23_download_data)

可追溯性资产:病例 ID 跨三代版本稳定;临床元数据的每次修订都留在 git commit 历史中;影像托管迁移(DigitalOcean → Hugging Face)有明确 commit 记录。这套溯源链在公共数据集中属于第一梯队——它把"数据什么时候变过、为什么变"变成了可审计的对象。

§3.11 数据集快照(截至本页审核日)

快照项 值(2026-09-27 审核口径)
工具仓库版本 v0.1.4(neheller/kits23)
队列规模 599 例(489 训练公开标注 + 110 测试官方持有)
标签体系 0=背景,1=kidney,2=tumor,3=cyst
期相构成 corticomedullary(late arterial)为主 + nephrogenic 新增病例,每例单期相
影像托管 Hugging Face neheller/KiTS-Challenge-Imaging(2026-05-13 迁移后)
临床元数据 随仓库 commit 修订(最近实质修订:2025-08-23 malignant null 修复)
许可 数据 CC BY-NC-SA 4.0(含挑战赛豁免);代码 MIT
官方评估器 /kits23/evaluation/(Dice + Surface Dice)+ ranking.py

§4 数据结构

§4.1 单个病例的完整解剖

以 case_00000 为例,一个 KiTS23 训练病例的全部构成:

组成 文件/字段 说明
影像 imaging.nii.gz 增强 CT 体数据,NIfTI 格式;体素值通常为原始 CT 值域(Hounsfield 单位经存储格式封装);期相为 corticomedullary 或 nephrogenic 之一(每例单期相)
语义标注 segmentation.nii.gz 与影像同几何(同维度同仿射)的体数据;取值 0/1/2/3
临床元数据 clinical/(随 commit 修订) 病理与风险字段(组织学亚型、恶性标记、AUA 风险分层、肿瘤尺寸类字段等);字段名与取值以所用 commit 的实际文件为准
身份 目录名 case_XXXXX 五位编号,跨 KiTS19/21/23/KNIGHT 版本稳定可追溯

读取侧的关键不变量:segmentation.nii.gz 与 imaging.nii.gz 共享空间几何,直接叠加即可可视化,无需配准。官方示例图的配色约定为肾=紫、肿瘤=绿、囊肿=蓝。

§4.2 DAIMS 数据字典

从 DAIMS(Data Assessment for Medical Imaging Sets)字段完备性视角整理的核心字段字典:

字段/文件 类型 取值域 缺失情况 说明
case_id 文本 case_00000 - case_00598 无缺失 跨版本稳定 ID
imaging.nii.gz 3D NIfTI CT 值域 无缺失(训练/测试影像均可按协议获取) 每例单期相(corticomedullary 或 nephrogenic)
segmentation.nii.gz 3D NIfTI 训练集公开;测试集不公开 0=背景 1=kidney 2=tumor 3=cyst
contrast_phase 队列属性 corticomedullary / nephrogenic 官方未公布逐例期相清单的汇总表 可由影像强化模式间接判别;期相异构是偏倚源
clinical: 恶性标记 布尔类 malignant(含 null 历史) 2025-08-23 前存在 null 值,已修复 commit 修复前的历史分析需注明 commit
clinical: 组织学亚型 文本类 含 sarcomatoid/rhabdoid 等亚型字段 非每例必有(消融病例可能无病理) 2024-02-07 commit 新增
clinical: AUA 风险分层 枚举类 AUA 风险组 非每例必有 2024-02-07 commit 新增,支撑风险分层研究
clinical: 肿瘤尺寸类 数值类 病理/影像测量的肿瘤尺寸字段 部分缺失 与标注体积可交叉验证

字段字典的使用提示:KiTS23 的临床元数据是"活的"——它随仓库 commit 演进而非一次性冻结。任何写入论文的统计(如组织学分布、恶性比例)都必须绑定所用 commit,否则无法复现。

§4.3 标签分布与统计

统计维度 已知事实 数据缺口
三类标签体系 kidney/tumor/cyst 全队列统一取值定义 —
cyst 覆盖率 仅部分训练例携带囊肿标注(社区文献口径约 248/489 例);约半数病例 cyst 无标注 cyst 相关指标在无标注病例上不可评估
肿瘤尺寸分布 官方发布过全队列肿瘤最大轴向切片的可视化叠加图(官网 Fig. 3/4),展示肿物大小与边界的总体面貌 官方未公布逐例尺寸/体积统计表
期相比例 队列期相异构(corticomedullary 为主 + nephrogenic 新增) 官方未公布两期相病例数的精确比例
每例肿物数量 标注为语义分割(不区分肿物个体);多灶病例的所有肿瘤共用 label=2 无实例级肿瘤计数表随数据发布

标签的空间关系要点:三类的拓扑约定是"肿瘤与囊肿位于肾脏区域内或表面,与肾实质相邻但互不重叠";肾实质(label=1)包绕或贴邻肿物(label=2/3)。这带来两个处理惯例:其一,做"肾脏区域整体"分析时用 HEC 第一层(1∪2∪3)而非仅 label=1——后者会把肿物从肾脏里"挖掉",产生人造空洞;其二,做逐类损失训练时,注意边界像素的类别竞争(肿物与肾实质的过渡带是最难的窄带,也是 Surface Dice 主要扣分区)。

§4.4 数据层级与 HEC 派生关系

KiTS23 的语义标注虽是"平面三类",但评估在派生的层次结构上进行。官方 HEC(Hierarchical Evaluation Classes)定义原文:

HEC 层 组成 语义
Kidney and Masses Kidney + Tumor + Cyst(label 1∪2∪3) 整个"肾脏系统":能否把肾脏与所有占位作为一个整体正确圈出
Kidney Mass Tumor + Cyst(label 2∪3) “肾脏肿物”:所有占位(不分良恶)能否作为整体正确圈出
Tumor Tumor only(label 2) 纯肿瘤:恶性倾向病灶本身的分割精度

三层漏斗的评估哲学:从易到难逐层剥离——第一层考察整体解剖能力,第二层考察"占位 vs 正常实质"的判别,第三层才考察最难的"肿物内部良恶判别后的肿瘤勾画"。一个模型可能第一层 Dice 很高而在第三层崩塌;三层并列呈现使这种"结构性短板"无处遁形。

注意 cyst 覆盖率对 HEC 的影响:在无囊肿标注的病例上,Kidney and Masses 与 Kidney Mass 退化为 Kidney+Tumor 与 Tumor 的口径——官方评测器已内置处理,但自实现评估时必须对齐官方逻辑(见坑点 4)。

HEC 组合的实现要点(示意代码):

import numpy as np

def hec_masks(seg):
    # 官方定义:Kidney and Masses = 1∪2∪3; Kidney Mass = 2∪3; Tumor = 2
    return {
        "kidney_and_masses": np.isin(seg, [1, 2, 3]),
        "kidney_mass":       np.isin(seg, [2, 3]),
        "tumor":             seg == 2,
    }

def hec_dice(seg, pred, hec):
    s, p = hec_masks(seg)[hec], hec_masks(pred)[hec]
    denom = s.sum() + p.sum()
    if denom == 0:
        return np.nan  # 空对空:边界情形的处理必须与官方评测器一致
    return 2.0 * (s & p).sum() / denom

两个最容易做错的点:空预测/空真值的 Dice 约定(返回 0、1 还是 NaN 会改变平均分),以及 cyst 标注缺失病例在 Kidney Mass 层的口径——本页强烈建议直接使用官方实现而非此示意代码做最终评估,示意代码仅用于理解协议。

§4.5 缺失值与异常情况处理

情况 范围 建议处理
cyst 标注缺失 约半数训练例 cyst 类别评估仅在有标注子集上进行;训练时把"无囊肿标注"与"确认无囊肿"区分处理(前者不能当负样本硬学)
malignant 字段 null 历史 commit(2025-08-23 前已修复) 固定使用修复后 commit;引用历史文献的统计时核对数据版本
期相标签 官方未公布逐例期相表 以影像特征判别或联系组织方;期相敏感实验应做期相分层
消融病例的病理字段 部分缺失(消融可能无完整病理) 影像-病理关联研究按病理可得性分层
测试集标注 110 例全部不公开 不存在"自行算测试集成绩"的合法路径(见坑点 5)

§4.6 用 Python 盘点你的本地副本

拿到数据后第一步不是训练,而是盘点。以下脚本对本地副本做全量健康检查(体素分布、囊肿覆盖率、spacing 各向异性、标注-影像几何一致性),产出一张"数据现状表":

import nibabel as nib
import numpy as np
from pathlib import Path

ROOT = Path("kits23/dataset")
rows = []

for case_dir in sorted(ROOT.glob("case_*")):
    img_path = case_dir / "imaging.nii.gz"
    seg_path = case_dir / "segmentation.nii.gz"
    if not img_path.exists():          # 坑点 1 的直接体现:影像未拉取
        rows.append((case_dir.name, "NO_IMAGING", None, None, None, None))
        continue
    img_nii = nib.load(img_path)
    vox, aff = img_nii.get_fdata(), img_nii.affine
    spacing = aff[:3, :3].prod(axis=0) ** 0  # 仿射对角即三轴 spacing(绝对值)
    spacing = np.abs(np.diag(aff)[:3])
    aniso = spacing.max() / spacing.min()    # 各向异性比(坑点 7 的量化)
    n_kidney = int((vox == 1).sum()); n_tumor = int((vox == 2).sum())
    n_cyst = int((vox == 3).sum())
    has_cyst_label = n_cyst > 0              # 坑点 2 的量化:囊肿覆盖率盘点
    rows.append((case_dir.name, "OK", n_kidney, n_tumor, has_cyst_label,
                 round(aniso, 2)))

ok = [r for r in rows if r[1] == "OK"]
print(f"总例数: {len(rows)} | 影像缺失: {len(rows)-len(ok)}")
print(f"cyst 有标注比例: {sum(1 for r in ok if r[4])}/{len(ok)}")
print(f"各向异性比中位数: {np.median([r[5] for r in ok])}")
print(f"无 tumor 标注的异常例: {[r[0] for r in ok if r[3]==0]}")

盘点结果的三个判读要点:(1) cyst 覆盖率应接近社区口径的约半数——若差异巨大,检查你的数据版本;(2) 各向异性比显著大于 3 的病例是重采样策略的敏感区(坑点 7);(3) “无 tumor 标注"的例数不应超过个位数(队列以疑似恶性肿瘤为主),明显异常时先怀疑标注文件未拉全,而不是"发现新分布”。


§5 数据划分与泄漏防线

§5.1 官方划分

  • 训练集 489 例:影像 + 标注公开,是全部训练、验证与本地评估的合法范围。
  • 测试集 110 例:影像与标注由官方持有,仅在 2023-07-21 至 07-28 提交窗口用于官方评测;此后作为排行榜基础设施保留,从未且不再公开。
  • 官方设计意图:测试集隔离 + 容器验证(top-5 强制)+ 双指标排名,共同构成对"测试集隐性过拟合"与"人工干预预测"的双重防御。

挑战赛提交协议要点(了解协议有助于理解成绩的可信度结构):

环节 规则 防御目标
提交窗口 2023-07-21 至 07-28,预测提交 限时提交压缩多次调参空间
结果产出 官方评测,2023-07-31 公布 成绩唯一来源是官方
top-5 容器验证 强制提交容器化算法,官方独立复现其性能 排除人工干预与不可复现方案
知识产权 验证后容器销毁,团队保留方案 IP 降低工业化参与顾虑
奖金 $5,000,容器验证通过后发放 激励与可信度挂钩

这套协议的关键词是"验证后即焚"——组织方不保留冠军方案的可执行副本,成绩与方法的绑定靠挑战赛报告与短文,这是挑战赛诚信设计的较优实践。

§5.2 官方建议的验证协议

官方 README 明确要求参赛者以交叉验证(cross-validation)方式训练模型:“We strongly encourage using these implementations for model selection during development. In order to do this, we recommend training all your models as cross-validations, so that you have predictions for the entire training set with which you can meaningfully evaluate your approaches.”

可操作的协议:

  1. 把 489 例训练集切成 5 折(社区惯例为 nnU-Net 风格 5 折交叉验证);
  2. 训练 5 个模型,每个模型留出一折作为验证集,得到全训练集的 out-of-fold(OOF)预测;
  3. 对 OOF 预测运行 kits23_compute_metrics,得到与官方评测器完全同源的 Dice / Surface Dice(per case × per HEC);
  4. 用 ranking.py 的 generate_summary_csv + rank_participants 在本地模拟官方排名,用于模型选择与配置筛选;
  5. 最终提交用全部 489 例重训的模型(或 5 折集成)对测试集预测。

这套协议的价值在于:你的本地指标与官方指标零实现差异,模型选择不会因指标实现不同而失真。

§5.3 跨版本泄漏:KiTS 系列特有的陷阱

KiTS 系列的病例 ID 跨版本稳定,导致"泄漏"在本系列有一个特殊形态——不是同一版本内的训练/测试混淆,而是跨版本的训练/测试边界漂移:

场景 泄漏形态 后果
用 KiTS23 全部 489 训练例训练后,在 KiTS19 的"测试集"(case_00210-00299)上报成绩 KiTS19 测试例已全部包含在 KiTS23 训练集中 你报的"KiTS19 测试成绩"是背题成绩,数值虚高
用 KiTS19 时代训练好的权重直接在 KiTS23 训练集上做"零样本评估" 权重训练数据与 case_00000-00299 完全重叠 "零样本"不成立
论文混用"KiTS19/21/23 测试集成绩"且不说明版本边界 读者无法判断病例重叠 结论不可比,审稿风险
自建划分时不检查 ID 区间 case_00400-00499 是 KNIGHT 测试集 KNIGHT 分类任务的测试例混入你的训练

防线清单:任何以 KiTS 系列为对象或基准的实验,第一步画出"我的训练 ID × 各版本训练/测试区间"的交集表;第二步在论文中明确写出版本与 ID 区间;第三步不引用旧版本测试集成绩做对比(除非声明该成绩属于历史版本协议)。

§5.4 划分建议汇总

研究目的 推荐划分 理由
挑战赛复现/冲击榜单 官方 489 全量训练 + 5 折 OOF 选择模型 + 测试集官方提交 与官方协议完全对齐
方法论文(无提交) 官方 5 折交叉验证,报 OOF 均值±标准差(per HEC) 官方 README 推荐协议,社区可比
数据有限场景 官方 5 折的固定单折(如 fold0)做快速迭代,最终结果回到 5 折 快速性与可比性的折中
外部验证 KiTS23 训练 → 独立外部队列测试(注意外部数据在挑战赛语境下的合规规则,§5.5) 检验单中心来源的泛化边界
预训练研究 KiTS23(或其前作)作为下游微调源 避免把重叠病例同时用于预训练与下游测试

§5.5 外部数据与预训练权重的合规边界

KiTS23 对外部数据有明确的合规规则(官方原文口径):

  • 参赛队允许使用官方训练集以外的数据,但该数据必须在 2023-04-14 当日或之前已公开;
  • 预训练权重同理——必须在 2023-04-14(KiTS23 数据首发日)之前公开;
  • 所有外部数据的使用必须在参赛短文中详细描述;
  • 规则目的:防止拥有大规模私有数据的团队获得不公平优势。

对非参赛研究者的迁移意义:这条规则是"数据公平性快照"的范例——当你在论文中报告"基于 KiTS23 训练 + XX 数据预训练"时,同样的公开性快照逻辑值得沿用,让读者可以判断你的预训练语料是否可能包含评测数据。

§5.6 交叉验证划分的实施代码

官方建议的 5 折划分实施(可复现版本,把折分配固化到文件,供多人/多机对齐):

import numpy as np
from pathlib import Path

SEED = 20230414  # 以挑战赛发布日为种子,便于社区对齐
cases = sorted(Path("kits23/dataset").glob("case_*"))
cases = [c.name for c in cases if (c / "segmentation.nii.gz").exists()]
assert len(cases) == 489, f"预期 489 个带标注训练例,实际 {len(cases)}"

# 先做泄漏自查(坑点 6),再切折
KITS19_TEST = {f"case_{i:05d}" for i in range(210, 300)}
assert not (set(cases) & KITS19_TEST), "发现 KiTS19 历史测试例,检查数据版本!"

rng = np.random.default_rng(SEED)
rng.shuffle(cases)
folds = np.array_split(cases, 5)
for k, fold in enumerate(folds):
    Path(f"splits/fold{k}.txt").write_text("\n".join(fold))

# 训练循环:对每折 k,训练集 = 其余四折,验证集 = fold k

纪律要点:折分配文件(splits/*.txt)与种子一起进版本库;任何人在任何机器重跑实验都应从这些文件恢复划分,而不是重新随机——这是 OOF 成绩可复现的前提。


§6 AI 就绪指南

§6.1 获取链:从零到数据落盘

KiTS23 的获取链是"代码仓库 + 按需拉取影像"的两段式设计(2026-05 起影像托管于 Hugging Face)。完整命令:

# 1. 克隆官方工具仓库(含标注、临床元数据与评估代码)
git clone https://github.com/neheller/kits23
cd kits23

# 2. 安装为本地 Python 包(提供命令行入口)
pip3 install -e .

# 3. 拉取影像(从 Hugging Face neheller/KiTS-Challenge-Imaging 下载到 dataset/)
kits23_download_data

环境提示:官方在 Ubuntu + Python 3.10.6 上测试;Windows/macOS 官方"尽力支持"但响应能力有限,建议 Linux 环境或 WSL2。影像拉取是全链路最慢环节,建议夜间批量执行并监控磁盘余量。

§6.2 十分钟上手:读取与可视化

import nibabel as nib
import numpy as np

CASE = "kits23/dataset/case_00000"

img = nib.load(f"{CASE}/imaging.nii.gz").get_fdata()      # CT 体数据
seg = nib.load(f"{CASE}/segmentation.nii.gz").get_fdata() # 标注: 0/1/2/3

print("影像形状:", img.shape, "| 标注形状:", seg.shape)
print("标注取值:", np.unique(seg))   # 应为 [0. 1. 2. 3.] 或其子集
print("kidney 体素:", (seg == 1).sum())
print("tumor   体素:", (seg == 2).sum())
print("cyst    体素:", (seg == 3).sum())

# 快速轴向切片可视化(matplotlib)
import matplotlib.pyplot as plt
z = img.shape[2] // 2
fig, axes = plt.subplots(1, 2, figsize=(10, 5))
axes[0].imshow(img[:, :, z].T, cmap="gray")
axes[1].imshow(seg[:, :, z].T, cmap="nipy_spectral", vmin=0, vmax=3)
plt.savefig("case_00000_preview.png", dpi=120)

预期:肾脏大块连续区域、肿瘤或囊肿呈附加区块;若某例 (seg == 3).sum() == 0,不要急着报 bug——约半数训练例本来就没有囊肿标注(坑点 2)。

首次探索检查清单(逐条过完再动手训练):

  1. 抽查 10 例影像与标注叠加图,确认标注几何对齐(无错位/翻转);
  2. 记录每例 shape 与 spacing 分布(§4.6 脚本),确认各向异性的幅度(坑点 7);
  3. 统计 cyst 覆盖率并与社区口径(约 248/489)对照(坑点 2);
  4. 检查标注取值域是否严格为 {0,1,2,3}(异常值意味着损坏文件);
  5. 挑 2-3 例大肿瘤与 2-3 例小占位各看一眼——建立"任务难度"的直觉;
  6. 确认训练例数(489)与你的预期一致——少一个都是数据版本问题。

§6.3 预处理 Pipeline 建议

KiTS23 不做任何"开箱即用"的预处理统一——这是设计而非缺陷(保留原始采集多样性)。可用的标准路径:

路径 适用场景 关键步骤
nnU-Net 全自动 想直接跑通并逼近 SOTA 组织成 nnU-Net 格式后 nnUNetv2_plan_and_preprocess 自动完成重采样/归一化/spacing 分析
MONAI Auto3DSeg 想复现冠军路线 冠军方案即 MONAI Auto3DSeg 集成;输入 NIfTI + 数据组 JSON 即可自动建 pipeline
手工 pipeline 方法学研究 CT 值窗(如 [-1024, 2000])→ 各向同性重采样(典型 1.5-3 mm)→ 肾脏区域裁剪(用标注粗定位)→ 归一化

手工路径的重采样要点见坑点 7;裁剪要点:以 kidney 标注的包围盒外扩 10-20 mm 为输入 ROI,可显著降低显存与训练时间且不损精度——这是 KiTS 社区方案的通用做法(肾脏位置稳定,无需全身分割)。

§6.4 官方评估与排名工具

官方评估器与排名脚本(与官方评测同源,模型选择必用):

# 对 OOF 预测目录计算 Dice / Surface Dice(每例每 HEC)
kits23_compute_metrics FOLDER_WITH_PREDICTIONS -num_processes 16
# → 生成 FOLDER_WITH_PREDICTIONS/evaluation.csv

# 本地模拟官方排名(ranking.py)
python -m kits23.ranking.generate_summary_csv   # 生成 summary.csv
python -m kits23.ranking.rank_participants      # 读 summary.csv 输出最终排名

排名机制要点(详见坑点 5):先对每例每 HEC 计算两个指标 → 跨病例对每个 HEC 平均 → 聚合为平均 Dice 与平均 Surface Dice 两个总分 → 按两个总分分别排名 → 取两个名次的平均作为最终名次(rank-then-aggregate);平手以 Tumor HEC 的平均 Dice 决出。

§6.5 八个真实坑点

⚠️ 坑点 1:git clone 完成后"没有影像"(分类:数据获取)

问题:官方仓库直存的只有标注、临床元数据与代码;影像必须由 kits23_download_data 从独立服务器按需拉取。大量教程与旧博客把 git clone 写成"数据下载完成",误导新人。

症状:clone 结束后发现 dataset/case_00000/ 下没有 imaging.nii.gz;或运行训练脚本报 FileNotFoundError。

解决:完整执行获取链三步(§6.1)。进阶:kits23_download_data 支持按需拉取,可先拉前 10 例验证链路再全量。SOTA 实践:把下载做成可断点续传的批处理脚本并校验每例文件完整性;注意 2026-05-13 官方把影像托管从 DigitalOcean 迁移到 Hugging Face(neheller/KiTS-Challenge-Imaging)——旧教程里的直链/镜像脚本若报 404,先升级到当前版工具仓库再用官方入口下载。

参考:官方仓库 README(Usage / Data Download 节)。

⚠️ 坑点 2:cyst 标注只覆盖约半数训练例(分类:标签语义)

问题:三类任务听起来是全队列三类评估,但 cyst 标注仅存在于约 248/489 例(社区文献口径);无囊肿标注的病例上 cyst 指标不可计算。

症状:自实现评估在某批病例上 cyst Dice 全为 0 或 NaN;把"无囊肿标注"当"确认无囊肿"训练,模型在真囊肿上漏检。

解决:简单方法——cyst 相关评估仅在带囊肿标注的子集上做,并在论文中报明子集规模。进阶方法——训练时对无标注病例屏蔽 cyst 通道的损失(masked loss),避免把"没标"学成"没有"。SOTA 方法——参与官方 HEC 评测(坑点 4),官方评测器已内置 cyst 缺失的处理逻辑,直接对齐而不是自己发明。

参考:官方 HEC 定义;社区文献(MDPI 综述口径 248/489)。

⚠️ 坑点 3:期相异构——corticomedullary 与 nephrogenic 混训不区分(分类:分布偏倚)

问题:KiTS23 队列期相异构——老病例全部是 corticomedullary(late arterial),KiTS23 首次纳入 nephrogenic 病例,且每例只有单期相。两期相下肾实质与肿物的强化形态差异显著,混训不建模期相会引入系统分布偏倚。

症状:模型在两期相子集上的成绩差异远超随机波动;用期相 A 的先验(如皮髓质分界形态)去解释期相 B 的预测失败;跨期相的体积估计不可比。

解决:简单方法——至少在分析时按期相分层报成绩,承认混杂。进阶方法——把期相作为条件输入(期相 embedding/两套归一化统计),或在预处理中统一强化参考(如以肾实质强化为基准的相对强化归一化)。SOTA 方法——期相感知的域自适应或跨期相一致性训练;挑战赛前排方案普遍在数据层面做了期相相关的归一化与增强设计。

参考:官方页面期相定义(“either corticomedullary or nephrogenic phase”,每例单期相)。

⚠️ 坑点 4:HEC 评估自实现与官方不一致(分类:评估协议)

问题:HEC 三层(Kidney and Masses = 1∪2∪3;Kidney Mass = 2∪3;Tumor = 2)看着简单,自实现时极易在细节上偏离官方:cyst 缺失病例的 HEC 口径、空预测/空真值的边界情形、Surface Dice 的容差参数。

症状:自己算的 Dice 与官方评测差零点几个百分点;论文成绩被质疑"协议未对齐";模型选择时排名与官方模拟不符。

解决:简单方法——直接使用官方实现:评估器位于仓库 /kits23/evaluation/,kits23_compute_metrics 命令一键完成(§6.4)。进阶方法——通读官方评估源码,确认你对 HEC 组合、cyst 缺失处理与 Surface Dice 容差的理解与其一致,再考虑自实现。SOTA 方法——把官方评测器锁进 CI:每次提交代码自动对固定小样本重算指标并 diff,防止评估链路随依赖升级漂移。

参考:官方 HEC 定义原文(Kidney and Masses / Kidney Mass / Tumor)与 /kits23/evaluation/ 源码。

⚠️ 坑点 5:rank-then-aggregate 的两个误读与"测试集 SOTA"幻觉(分类:评估协议)

问题:误读一——以为最终排名是"六项成绩平均后的分数排序";实际是先聚合出平均 Dice 与平均 Surface Dice 两个总分、按两者分别排名、再平均名次。误读二——以为可以自算测试集成绩;110 例测试集标注官方持有且永不公开,任何"自行复现测试成绩"都是幻觉。

症状:本地"六项平均分"更高的方案在官方模拟排名中反而更低;论文写出"我们在 KiTS23 测试集上取得 Dice 0.84"却无官方提交记录——这在审稿中会被直接判定为不可信。

解决:简单方法——用官方 ranking.py(generate_summary_csv + rank_participants)做本地排名模拟,别手写聚合逻辑。进阶方法——理解机制的策略含义:两个指标的名次平均意味着"单指标极端优势无法弥补另一指标的明显短板",模型选择应同时优化边界质量(Surface Dice)。SOTA 方法——挑战赛语境下,测试集成绩唯一合法来源是官方排行榜;论文引用时写明"官方测试集成绩(KiTS23 Challenge 官方评测)"并链接榜单。

参考:官方 README(Using the Metrics / Ranking code 节)与官网 How to Win 节。

⚠️ 坑点 6:跨版本病例重叠导致的"隐性背题"(分类:数据划分)

问题:KiTS 系列病例 ID 跨版本稳定:case_00000-00209 曾是 KiTS19 训练集、case_00210-00299 曾是 KiTS19 测试集(后并入 KiTS21/23 训练集)、case_00400-00499 曾是 KNIGHT 测试集。用新版本训练再去旧版本"测试集"报成绩,等于背题。

症状:迁移学习/对比实验里"旧测试集成绩"高得反常;两个论文之间同一模型成绩矛盾;审稿人指出版本边界混乱。

解决:简单方法——实验前跑一遍 ID 区间交集检查(下方脚本)。进阶方法——在实验记录中固化"版本-区间-用途"表(§3.3 官方原表),任何外部对比前先对表。SOTA 方法——用工具化的数据版本管理(DVC/LakeFS 之类)把"训练集 ID 清单"作为提交物存档,论文可审。

# 泄漏检查脚本:确认你的训练集不含任何"旧版本测试例"
KITS19_TEST = set(f"case_{i:05d}" for i in range(210, 300))   # KiTS19 测试集
KNIGHT_TEST = set(f"case_{i:05d}" for i in range(400, 500))   # KNIGHT 测试集
my_train_ids = [...]  # 你的训练 ID 清单
assert not (set(my_train_ids) & (KITS19_TEST | KNIGHT_TEST)), "泄漏!"

参考:官网 The Data 节的跨版本重叠官方原表。

⚠️ 坑点 7:层厚各向异性——5 mm 层厚直接喂 2D 模型(分类:预处理)

问题:KiTS 队列病例间体素间距各向异性明显:面内分辨率较高,层厚可达 5 mm 量级,且官方不做统一重采样。不处理 spacing 的 pipeline 在层厚大的病例上系统性掉分。

症状:3D 卷积在粗层厚病例上过平滑(小肿瘤消失);2D 切片训练时 z 方向信息被浪费;Surface Dice 对这类边界误差尤其敏感(指标分数比 Dice 掉得更狠)。

解决:简单方法——按病例 spacing 各向同性重采样(典型 1.5-3 mm)后再训练,评估时把预测重采样回原 spacing 再提交官方评估。进阶方法——用 nnU-Net 的自动 spacing 策略(它对 KiTS 类各向异性 CT 的默认配置已被大量验证)。SOTA 方法——挑战赛前排方案普遍采用"粗层厚用 3D 网络多尺度 + 面内 2D 分支"的混合设计,或直接沿用 MONAI Auto3DSeg 的自动架构搜索输出。

参考:官方数据说明;nnU-Net 官方仓库(MIC-DKFZ/nnUNet,KiTS 系列为展示任务)。

⚠️ 坑点 8:CC BY-NC-SA 4.0 的商用边界与豁免条款(分类:许可合规)

问题:数据许可为 CC BY-NC-SA 4.0(署名-非商业-相同方式共享),但"商业使用"的边界容易被误读:竞赛参赛算不算商业使用?工业队内部研究算不算?

症状:工业团队因误读许可而放弃参赛或误发布商用产品;论文数据使用声明写错许可条目。

解决:官方 README 给出了明确口径——(1) 仅为参加本挑战赛训练模型不被视为商业使用,因此官方鼓励工业界参赛;(2) 学术研究者使用数据无需另行请求许可;(3) 商业用途需联系 Nicholas Heller(helle246@umn.edu)单独授权。代码部分为 MIT 许可,评估与排名工具可自由复用。进阶方法——产品化路径先发邮件确认书面授权范围;SOTA 方法——在项目 README 中固化数据许可清单(数据 CC BY-NC-SA / 代码 MIT / 引用口径 heller2023kits21),CI 检查发布物中数据来源声明。

参考:官方 README License and Attribution 节原文。

§6.6 数据增强建议

增强方式 建议 注意事项
空间类(旋转/缩放/弹性) 标准 nnU-Net 配置已足够 弹性形变幅度对肾门结构要保守
强度类(Gamma/噪声) 开启 注意两期相的强度分布差异(坑点 3),避免把期相差异当噪声抹掉
空间重排 轴向翻转(左右肾对称性)可开 前后/上下翻转破坏解剖合理性,勿用
期相模拟 跨期相增强(对比度重映射模拟另一期相) 进阶用法,需以肾实质强化为参考

§6.7 模型与训练建议

  • 基线首选:nnU-Net(MIC-DKFZ/nnUNet)。官方参考实现列表收录的开源方案之一,在 KiTS 系列上有完整的既有结果可对照;全自动配置基本免调参。
  • 复现冠军:NVIDIA Myronenko 的 MONAI Auto3DSeg 集成(官方成绩 Dice 0.835 / Surface Dice 0.723);MONAI 生态提供了从数据分组到集成的自动流水线。
    | 训练配方 |(社区共识路径):5 折交叉验证(官方建议)→ 每折 nnU-Net 3D 全分辨率 + 级联可选 → OOF 评估用官方评测器 → 提交用 5 折集成。
  • 推理效率:集成方案推理开销数倍于单模型;蒸馏/剪枝到单模型是现实的工程课题(§1.5 场景 5)。

时间预算参考(单卡 24 GB 级):

阶段 预算 说明
预处理(nnU-Net plan + preprocess) 1-3 小时 一次性成本,含 spacing 分析
单折训练(3d_fullres) 1-2 天 489 例 ÷ 5 ≈ 391 例/折训练集
5 折全量 约 1 周(串行)或 1-2 天(多卡) OOF 成绩的完整成本
官方评估(evaluation.csv) 分钟级 CPU 并行即可
集成推理(可选) 小时级 5 折推理全部测试/验证数据

预算的意义:在动手前知道"完整复现一轮"的代价,才能规划消融实验的数量——KiTS23 规模的研究,实验设计比跑实验更稀缺。

§6.8 硬件需求参考

环节 最低可用 舒适配置
数据下载与解包 50 GB 磁盘 + 普通带宽 100 GB SSD + 稳定带宽
nnU-Net 3D 训练(单折) 11 GB 显存(有裁剪 ROI 前提) 24-40 GB 显存(A100/RTX 4090 级)
5 折集成 分时训练折,磁盘换显存 多卡并行
官方评估 CPU 即可(-num_processes 并行) 多核加速 evaluation.csv 生成

多卡与分布式要点:nnU-Net v2 原生支持单节点多 GPU 的 DDP 训练(nnUNetv2_train ... -p ... 配置多设备),5 折训练最自然的并行方式是"一折一卡";MONAI Auto3DSeg 内置多 GPU 集成训练支持。跨节点分布式对 489 例规模收益有限——瓶颈通常在数据加载与预处理,把预处理产物放本地 NVMe 比跨节点通信优化更见效。

§6.9 MLOps 与版本管理建议

  1. 锁定工具仓库 commit:评估逻辑随仓库演进,论文必须记录所用 commit;
  2. 锁定临床元数据 commit:元数据两次修订(2024-02 / 2025-08)直接影响统计结果;
  3. OOF 预测作为产物存档:它们是模型选择与审稿答辩的证据链;
  4. 官方评测器进 CI:见坑点 4 的 SOTA 实践;
  5. ID 清单入版本库:见坑点 6 的泄漏防线。

从 KiTS23 目录到 nnU-Net 格式的转换脚本(骨架):

# 把 kits23/dataset/case_* 软链为 nnU-Net v2 Dataset 结构
from pathlib import Path
import json

SRC = Path("kits23/dataset")
DST = Path("nnUNet_raw/Dataset501_KiTS23")
(DST / "imagesTr").mkdir(parents=True, exist_ok=True)
(DST / "labelsTr").mkdir(parents=True, exist_ok=True)

for case in sorted(SRC.glob("case_*")):
    seg = case / "segmentation.nii.gz"
    if not seg.exists():
        continue
    cid = case.name.replace("case_", "")            # KiTS 的五位数 ID
    (DST / "imagesTr" / f"KiTS23_{cid}_0000.nii.gz").symlink_to(case / "imaging.nii.gz")
    (DST / "labelsTr" / f"KiTS23_{cid}.nii.gz").symlink_to(seg)

dataset_json = {
    "channel_names": {"0": "ct"},
    "labels": {"background": 0, "kidney": 1, "tumor": 2, "cyst": 3},
    "numTraining": len(list((DST / "labelsTr").glob("*.nii.gz"))),
    "file_ending": ".nii.gz",
}
(DST / "dataset.json").write_text(json.dumps(dataset_json, indent=2))
# 之后: nnUNetv2_plan_and_preprocess -d 501 && nnUNetv2_train 501 3d_fullres 0

注意:软链方式零拷贝省磁盘;nnU-Net 会自行完成 spacing 分析与重采样规划(坑点 7 的自动化解法)。

§6.11 获取链的环境差异与代理问题

  • 网络环境:影像托管在 Hugging Face;若你的运行环境无法直连 HF,配置代理或使用 HF 镜像端点后再运行 kits23_download_data,并验证下载完整性(文件大小与 NIfTI 可读性抽检)。
  • 磁盘规划:影像按例增量落盘,中断重跑不会重复已完成的病例——先小批量试拉再全量是低成本保险。
  • 权限:仓库内的标注与元数据直接随 git 分发;对团队共享盘部署,建议把拉取好的 dataset/ 目录做成只读共享、每人本地再建软链,避免多人并发写坏目录结构。

§6.10 常见报错速查表

报错/异常 最可能原因 对应处理
FileNotFoundError: imaging.nii.gz 只 clone 未拉取影像(坑点 1) 运行 kits23_download_data
kits23_download_data: command not found 未 pip3 install -e . 或 PATH 未含本地 bin 在仓库根目录重新安装;检查 venv 激活
下载 404 / 连接失败 旧教程直链已失效(托管层 2026-05 迁移 HF) 升级仓库到当前版本,用官方入口下载
cyst 指标全为 0/NaN 该例无囊肿标注(坑点 2) 仅在 cyst 有标注子集评估
自算 Dice 与官方差 >0.5% HEC 组合/Surface Dice 容差与官方不一致(坑点 4) 改用 kits23_compute_metrics
显存 OOM 于粗层厚病例 未按 spacing 重采样(坑点 7) 各向同性重采样或 ROI 裁剪
成绩"好得反常" 训练集混入旧版本测试例(坑点 6) 跑 §5.3 泄漏检查脚本
evaluation.csv 缺行 预测目录命名/数量与病例不齐 对齐 case_XXXXX 命名,逐例校验

§7 数据质量评估

§7.1 偏倚谱系分析

偏倚 机制 对研究的影响 缓解建议
选择偏倚(手术人群) 全部病例为手术/消融患者,无主动监测与保守处理人群 模型天然见过"都会做手术"的分布;对筛查场景的适用性未知 外部队列验证筛查样分布
患病率偏倚 "术前疑似恶性"纳排,肿瘤患病率近乎 100% 与人群筛查(低患病率)的 PPV 语义完全不同 报告指标时附患病率语境
中心偏倚 单一医疗系统(M Health Fairview,2010-2022);官方"multi-institutional"为系列历史口径,KiTS23 纳排限定该系统 跨中心泛化无内部证据 配合多中心数据集(本站 Medical Segmentation Decathlon 条目)做外测
期相偏倚 队列期相异构(corticomedullary 为主 + nephrogenic 新增),官方未公布精确比例 期相混杂污染消融实验 期相分层分析(坑点 3)
标注覆盖偏倚 cyst 标注约 248/489 例 cyst 指标只能在子集上评估 明示子集口径(坑点 2)
难度筛选偏倚 挑战赛队列经过难度策展 与"自然临床流"的难度分布不同 对外部署前重新审计难度构成

§7.2 标注质量评估

  • 协议完备性:高。三类定义以原文公布且语义清晰(肾门非脂肪组织归属、肿瘤的"术前疑似恶性"语义、囊肿的影像/病理双路径判定),这在公开数据集中属于少见的协议透明度。
  • 病理联动:中高。临床元数据携带组织学亚型(含 sarcomatoid/rhabdoid)与恶性标记,为"标注 vs 病理"的抽样审计提供了原材料;但消融病例可能无完整病理。
  • 一致性与人力披露:缺口。KiTS23 批次未独立披露标注者人数、资质与读者间一致性量化(KiTS 系列既往论文描述过多级复核流程,但本批次的对应数字缺失)。本页不虚构该数字;需要一致性证据的研究应自行抽样复标。

自行抽样复标的可操作协议:随机抽 20-30 例 → 由 1 名影像判读者按官方三类定义独立重标 → 计算 HEC 三层的 Dice(用官方评估器)→ 报告复标一致性与离群例清单。这套低成本审计既能补上论文里的标注质量证据,也常能顺手发现标注的系统性偏差(如肾门脂肪的边界口径)——两种结果对研究都是增益。

§7.3 泛化性证据

官方排行榜(隐藏测试集)证明的是同分布隔离集上的性能,不是跨中心泛化。要回答"我的模型换个医院还行吗",必须外测——可选方向:多中心公开集(本站 kits、medical-decathlon、abdomenct-1k 条目所述资源)、自院数据、以及期相分层自测。单中心来源是 KiTS23 与 AbdomenCT-1K 这类多中心聚合数据集最本质的定位差异。

§7.4 伦理与隐私

  • 全部影像与临床记录经去标识化处理后发布;不含姓名、病历号、检查日期等直接标识符。
  • 队列为回顾性审查构成,原始收集在 M Health Fairview 体系内完成相应伦理审批(官方口径),挑战赛发布以去标识化 + CC BY-NC-SA 许可控制再分发风险。
  • 仍需注意:肾脏 CT 的罕见解剖特征组合在极端情况下存在再识别风险;二次分发派生数据(如预测结果配原始影像)时保持同等级去标识纪律。

§7.5 公平性考量

人口学维度(年龄/性别/种族)官方未公布统一统计,公平性审计所需的分层信息在数据内不可得——这是使用时必须声明的限制。间接关联的公平性风险:单中心(北美单一医疗系统)意味着设备构成、扫描协议与人群谱系均带系统性特征,直接迁移到低资源环境或不同设备谱系的部署点时,性能预期应保守。

§7.6 漂移与维护状态

KiTS23 数据是"活的"资产:临床元数据两次实质修订(2024-02、2025-08)、影像托管层迁移(2026-05 DigitalOcean → Hugging Face)、工具仓库持续到 v0.1.4。这表明数据集处于活跃维护状态(好事),同时意味着不锁版本的研究不可复现——把仓库 commit 编号写进实验记录是最低纪律。

§7.7 DAIMS 数据集成熟度评估

对 KiTS23 执行 DAIMS(Data Assessment for Medical Imaging Sets)24 项检查:

# 检查项 状态 说明
1 官方名称与版本号 ✅ KiTS23 / 工具仓库 v0.1.4
2 正式出版物引用口径 ⚠️ 官方 bibtex 键为 heller2023kits21(KiTS21 论文标题),README 另链接 MedIA 论文——双口径并存,可引用但需注明
3 逐例唯一 ID ✅ case_XXXXX 跨版本稳定
4 公开获取链路 ✅ git clone + pip install -e . + kits23_download_data
5 开放数据格式 ✅ NIfTI(.nii.gz)
6 标注格式规范 ✅ segmentation.nii.gz 与影像同几何
7 标注类别定义文档 ✅ 三类定义原文公开,语义精确
8 标注者人数/资质披露 ❌ KiTS23 批次未独立披露
9 标注者间一致性量化 ❌ 未随本批次公布
10 人口学信息披露 ⚠️ 无统一统计表
11 临床元数据完备性 ✅ 组织学亚型、恶性标记、AUA 风险分层等——同类数据集罕见亮点
12 元数据版本管理 ✅ 全部修订留在 git commit 历史
13 官方数据划分定义 ✅ 489/110 界限清晰
14 测试集隔离性 ✅ 110 例从未用于任何挑战——系列最强隔离
15 官方评估代码 ✅ /kits23/evaluation/ 与官方评测同源
16 排名协议可复现 ✅ ranking.py 开源(generate_summary_csv + rank_participants)
17 许可证明确 ✅ 数据 CC BY-NC-SA 4.0 + 竞赛豁免条款;代码 MIT
18 商用路径说明 ✅ 官方明确商用联系邮箱与豁免范围
19 期相/设备元数据披露 ❌ 逐例期相表与设备型号未公布
20 类别分布统计公布 ⚠️ cyst 覆盖率无官方正式表(社区口径约 248/489)
21 缺失值文档化 ⚠️ malignant null 由 commit 修复但无正式变更日志
22 已知偏倚官方声明 ⚠️ 官方描述人群构成但无专门 limitations 陈述(网页口径)
23 去标识化声明 ✅ 官方明确去标识化发布
24 长期维护承诺 ⚠️ 迁移与修订表明活跃维护,但无正式生命周期政策

评分:18 / 24(✅×15 + ⚠️×6×0.5)。

评分解读:数据基础设施层(ID 体系、评估器、排名协议、版本管理、许可清晰度)接近满分,是挑战赛数据集的第一梯队水平;短板集中在标注人力披露、逐例设备/期相元数据与公平性审计所需的人口学信息。

对你意味着什么:把它当"评估协议标杆 + 训练主力数据"使用非常可靠;把它当"标注质量研究报告对象"或"跨中心泛化基准"使用则需要补齐外部证据——前者有官方工具链背书,后者是数据集设计边界。

§7.8 质量争议与已知问题记录

本节汇总本站核验过程中发现、且官方材料未正面回答的质量问题(供研究者引用时避坑,亦为官方后续修订提供参照):

  1. “multi-institutional” 表述与 KiTS23 纳入口径的张力:官方页面回顾系列时称数据为 multi-institutional cohort,但 KiTS23 队列纳入限定 M Health Fairview——两种表述并存易让读者高估人群多样性(§3.8)。
  2. 期相比例未披露:队列期相异构是本版本的核心变量,但官方未公布逐例期相表或比例统计,期相分层研究只能自行判别。
  3. cyst 覆盖率无官方正式表:约 248/489 为社区文献口径,官方统计表缺位导致每次引用都要附"非官方口径"脚注。
  4. 标注一致性数字缺口:本批次无读者间一致性量化披露,与协议透明度(三类定义)形成反差。
  5. malignant 字段 null 修复无变更日志:修复本身(2025-08-23 commit)是好的版本管理实践,但官方没有配套的"数据变更日志"文档,只能靠 git 历史考古。

§7.9 偏倚的量化审计建议

发表使用本数据集的研究时,建议在论文的"数据声明"部分附一张自产偏倚审计表(而不是只写一句"数据存在偏倚"):

审计项 建议量化方式 本数据集的预期发现
期相构成 按强化形态判别逐例期相并统计比例 皮髓质期为主,肾实质期为少数
肿瘤尺寸分布 从标注体积换算等效直径并分箱 覆盖小占位到大肿瘤的宽谱系
囊肿覆盖 有囊肿标注比例(§4.6 脚本直接产出) 约半数
期相 × 成绩交互 模型在两期相子集上的分别成绩 显著差异即期相混杂证据(坑点 3)
体积-病理一致性 标注体积 vs 元数据肿瘤尺寸字段的相关性 异常离群例提示标注或元数据问题

这张表的成本是一个下午的算力,但对审稿人"你如何排除偏倚解释"的质询几乎是必答题。


§8 基准与社区生态

§8.1 官方挑战赛成绩

KiTS23 挑战赛最终结果于 2023-07-31 公布。经本站多源核验的冠军成绩:

名次 方案 平均 Dice 平均 Surface Dice
冠军 Myronenko(NVIDIA,MONAI Auto3DSeg) 0.835 0.723

其余名次与完整榜单数据,本页仅指向官方发布渠道(kits23.kits-challenge.org 与挑战赛报告)而不自行转录——原因:官方页面未以可结构化核验的形式给出本页可直接确认的完整前五名单与逐队数字,本站纪律是不虚构排名细节。

对冠军数字的解读:Dice 0.835 是六项 HEC × 双指标体系下的平均成绩,拆到 Tumor HEC 会显著低于此(肿瘤是三类中最难的对象);Surface Dice 0.723 相对 Dice 的落差反映了边界层面的剩余误差——这两点合起来说明"肾脏肿瘤分割已解决"的说法不成立。

§8.2 排名协议对基准解读的影响

引用 KiTS23 成绩做对比时必须记住三点:(1) 成绩是测试集官方评测产出,不可自算复现;(2) 排名是双指标名次平均,“分数高一位"不等于"名次高一位”;(3) HEC 平均意味着单层(如 Tumor)的成绩不能与全层平均直接比。跨论文对比时优先对齐"同一 HEC + 同一指标 + 同一数据版本 commit"三要素。

§8.3 本地复现路径

合理的目标不是"复现测试集成绩",而是:本地 5 折 OOF → 官方评测器 → 与官方排行榜发布的方法短文中的本地验证成绩对照 → 判断自己的 pipeline 是否健康。OOF 成绩与测试集成绩存在协议性差异(分布与折间方差),两者不做数值直比。

条目 与 KiTS23 的关系 链接
KiTS(系列主条目) KiTS19/21/23 系列总览与本条目互为经纬 kits
Medical Segmentation Decathlon 含 Kidney 任务的通用多病种挑战基准;单中心偏倚的另一参照 medical-decathlon
LiTS 肝脏肿瘤分割挑战——腹腔实体瘤分割的姊妹赛道 lits
BTCV 多器官结构基准(肾为结构标签,无病理实体) btcv
AbdomenCT-1K 多器官框架中的肾脏子集(左右合并标签);多中心 vs 单中心的定位对照 abdomenct-1k
AutoImplant 颅底重建挑战——同属 MICCAI 挑战赛数据生态的任务对照 autoimplant

§8.5 关键文献

文献 内容 出处
The KiTS21 Challenge: Automatic segmentation of kidneys, renal tumors, and renal cysts in corticomedullary-phase CT 官方 README 指定的引用对象(系列论文,arXiv:2307.01984,year 2023) arXiv;bibtex 键 heller2023kits21
KiTS19 数据论文(Medical Image Analysis) 300 例皮髓质期队列的数据描述论文(README 引用链接所指) Medical Image Analysis;arXiv:1912.01054
MICCAI 2023 挑战赛论文集 KiTS23 方法短文 29 投 22 录;含挑战赛总结与前排方案 Springer LNCS 14540

§8.6 社区与开源生态

  • 官方参考实现列表:官网收录 8 个开源实现(含 MIC-DKFZ/nnUNet),覆盖从 nnU-Net 到 MONAI 集成的主流路线,适合作为 pipeline 健康度对照;
  • 工业参与惯例:竞赛豁免条款明确鼓励工业队参赛(坑点 8),历年前排均有企业方案;
  • 知识迁移链:KiTS 系列的评测设计(HEC、双指标、rank-then-aggregate)已被后续 MICCAI 挑战赛广泛借鉴——读 KiTS23 的机制设计对理解整个挑战赛生态都有溢出价值。

§8.7 论文中引用 KiTS23 成绩的推荐句式

为避免审稿人对协议的质疑,引用成绩时建议采用如下信息密度足够的句式(可按需裁剪):

“We report the official test-set result from the KiTS23 Challenge (The 2023 Kidney and Kidney Tumor Segmentation Challenge; 489 training / 110 held-out test cases; evaluation by Sørensen-Dice and Surface Dice averaged over three hierarchical evaluation classes, ranked by rank-then-aggregate). The winning solution (Myronenko, NVIDIA; MONAI Auto3DSeg) achieved an average Dice of 0.835 and an average Surface Dice of 0.723. Our local validation follows the official 5-fold cross-validation protocol on the training set, evaluated with the official metrics implementation (kits23_compute_metrics, repository commit <hash>).”

中文论文的对应要点:写明"官方测试集成绩(KiTS23 挑战赛官方评测)"、写明 HEC 平均口径、写明本地实验所用仓库 commit;不把本地 OOF 成绩与官方测试成绩并列成同一表格直比。

§8.8 本地基准报告表模板

以官方协议产出本地基准时的推荐表格结构(数值为占位格式示例,非真实成绩):

方法 Kidney and Masses Dice Kidney Mass Dice Tumor Dice Kidney and Masses SDice Kidney Mass SDice Tumor SDice
nnU-Net 3d_fullres(fold0) 0.9xx 0.9xx 0.8xx 0.8xx 0.8xx 0.7xx
nnU-Net 5 折 OOF 0.9xx 0.9xx 0.8xx 0.8xx 0.8xx 0.7xx
自建方法 … … … … … …

配套必须声明:仓库 commit、划分种子/折文件、评估器版本、cyst 评估子集口径。六列与官方 HEC × 双指标完全对齐,审稿人可直接与官方协议映射。


§9 资源与引用

资源 地址
挑战赛官网 https://kits23.kits-challenge.org/
工具与数据仓库 https://github.com/neheller/kits23
影像托管(Hugging Face) https://huggingface.co/datasets/neheller/KiTS-Challenge-Imaging
引用论文(arXiv) https://arxiv.org/abs/2307.01984
MICCAI 2023 挑战赛论文集 Springer LNCS 14540

复现所必须固定的版本要素清单(写入实验记录或论文复现附录):

  1. 工具仓库 commit hash(评估逻辑与元数据随仓库演进);
  2. 工具包版本(v0.1.4 或当时实际版本);
  3. 临床元数据 commit(至少区分"2024-02 字段扩充前/后"与"2025-08 null 修复前/后");
  4. 影像托管端点(Hugging Face neheller/KiTS-Challenge-Imaging)与拉取日期;
  5. 训练框架版本(如 nnU-Net v2.x / MONAI x.x)与随机种子;
  6. 划分文件(splits/*.txt,§5.6 的产物)。

这份清单的本质:把"数据 + 代码 + 协议"三层都锁到可指认的对象上,任何一层缺位都会让复现链条断掉。

§9.2 配套工具链

工具 用途 说明
nnU-Net(MIC-DKFZ/nnUNet) 训练与推理框架 官方参考实现之一;KiTS 系列为展示任务
MONAI / Auto3DSeg 冠军路线框架 NVIDIA 方案的复现入口
SimpleITK / nibabel NIfTI 读写 基础依赖
3D Slicer / ITK-SNAP 标注检查与可视化 人工核对标注质量

从 DICOM 还原完整元数据的注意点:NIfTI 发布版有意剥离了 DICOM 头中的设备与协议信息。若你的研究需要设备型号、重建核、曝光参数,NIfTI 版本无法提供——可行的路径是联系组织方申请更底层数据,或在自有院内数据上补充采集这些维度。社区常见的错误做法是从公开导出的 DICOM 化转换包(第三方重建)取元数据,其转换质量参差且与官方 NIfTI 不保证逐例对齐,不建议用于正式研究。

§9.3 BibTeX

官方 README 给出的引用条目(原文照录,作者列表完整):

@misc{heller2023kits21,
      title={The KiTS21 Challenge: Automatic segmentation of kidneys, renal tumors, and renal cysts in corticomedullary-phase CT},
      author={Nicholas Heller and Fabian Isensee and Dasha Trofimova and Resha Tejpaul and Zhongchen Zhao and Huai Chen and Lisheng Wang and Alex Golts and Daniel Khapun and Daniel Shats and Yoel Shoshan and Flora Gilboa-Solomon and Yasmeen George and Xi Yang and Jianpeng Zhang and Jing Zhang and Yong Xia and Mengran Wu and Zhiyang Liu and Ed Walczak and Sean McSweeney and Ranveer Vasdev and Chris Hornung and Rafat Solaiman and Jamee Schoephoester and Bailey Abernathy and David Wu and Safa Abdulkadir and Ben Byun and Justice Spriggs and Griffin Struyk and Alexandra Austin and Ben Simpson and Michael Hagstrom and Sierra Virnig and John French and Nitin Venkatesh and Sarah Chan and Keenan Moore and Anna Jacobsen and Susan Austin and Mark Austin and Subodh Regmi and Nikolaos Papanikolopoulos and Christopher Weight},
      year={2023},
      eprint={2307.01984},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

使用 KiTS19 数据本身时建议补充引用其数据论文(Medical Image Analysis,arXiv:1912.01054)。

§9.4 引用口径指南

官方 README 的引用指引存在双口径并存:正文文字链接指向 Medical Image Analysis 论文(KiTS19 数据论文),而 bibtex 块给出的是 heller2023kits21(KiTS21 论文标题、eprint 2307.01984、year 2023)。本站建议:主引 bibtex 块(这是官方提供的可直接复制的引用格式,键名虽含 kits21 但指向官方指定的"most recent KiTS challenge paper");做 KiTS19 数据本身的描述性引用时补引数据论文。在论文脚注中说明这一口径混乱可以避免审稿质疑。

§9.5 上手路径建议

阶段 动作 产出
第 1 天 获取链三步 + §6.2 可视化脚本 前几例的影像/标注预览
第 1 周 组织 nnU-Net 格式,跑通单折训练 + 官方评估器 本地 OOF 的六项成绩
第 1 月 5 折完整训练 + ranking.py 本地排名模拟 可写入论文的基准复现表
进阶 期相分层分析(坑点 3)、蒸馏到单模型(§1.5)、外部队列验证(§7.3) 研究增量点

§9.6 术语对照表

术语 中文对照 释义要点
corticomedullary phase 皮髓质期(晚动脉期,late arterial) 肾皮质与髓质强化差异最大的期相;KiTS19/21 全部病例所在期相
nephrogenic phase 肾实质期 肾实质均匀强化的期相;KiTS23 首次纳入的病例期相
partial nephrectomy 肾部分切除术 保留肾脏的切除术;队列纳入术式之一
radical nephrectomy 根治性肾切除术 全肾切除;队列纳入术式之一
cryoablation 冷冻消融 经皮/腔内消融治疗;队列纳入术式之一
small renal mass (SRM) 小肾肿瘤/小肾占位 通常指体积较小的偶发肾脏占位,主动监测的主要对象
active surveillance 主动监测 以定期影像随访替代即时手术的处理策略
HEC (Hierarchical Evaluation Classes) 层次评估类别 三层聚合的评估粒度:Kidney and Masses / Kidney Mass / Tumor
Sørensen-Dice 索伦森-戴斯系数 重叠型分割指标,即 Dice 系数
Surface Dice 表面 Dice 基于表面距离容差的边界敏感型指标
rank-then-aggregate 先排名后聚合 两个指标分别排名后以名次平均定最终排名的机制
out-of-fold (OOF) prediction 折外预测 交叉验证中每例由未见过它的折内模型产生的预测
nnU-Net —(框架名) 自配置医学分割框架;官方参考实现之一
Bosniak classification Bosniak 分类 肾囊性病变的恶性风险分级系统(本数据集未提供分级标签)

§10 AI 使用声明卡

§10.1 本页面如何生成

本条目由千方病案医数集的 AI 辅助生产管线生成:AI 代理执行检索、抓取与初稿撰写,所有关键事实经"三源互证"纪律核验(官方挑战赛页面全文、官方 GitHub 仓库 README 全文、Springer/arXiv 出版记录),并对照站内数据库完成查重与互链(rid=80 主互链)。核验脚本与事实清单存档于条目工作目录(FACTS.md)。

§10.2 事实来源层级

  1. 一手官方源:kits23.kits-challenge.org 官网页面(队列定义、三类定义、HEC、排名规则、奖金与容器规则、外部数据规则);github.com/neheller/kits23 README(获取链、评估命令、排名脚本、许可与引用口径、版本与托管迁移记录)。
  2. 出版记录:arXiv:2307.01984;Springer LNCS 14540(29 投 22 录);Medical Image Analysis(KiTS19 数据论文,arXiv:1912.01054)。
  3. 站内数据:千方病案医数集数据库只读查询(查重与互链 rid:77/80/81/377/402/472)。

三源互证的执行记录(本条目核验过程的可审计摘要):队列构成(599=489+110)、三类定义、HEC 定义、排名机制、奖金与容器规则、外部数据规则、时间线——官网页面与 GitHub README 双源一致;引用口径(heller2023kits21 / arXiv:2307.01984)以 README 原文为准;出版记录(LNCS 14540,29 投 22 录)来自 Springer 卷页信息;临床元数据 commit 史(2024-02-07 / 2025-08-23)与托管迁移(2026-05-13)来自仓库 git 记录;冠军数字(Dice 0.835 / Surface Dice 0.723)经 ACM DL 收录的挑战综述确证。凡双源冲突(如卫星事件日期),本页如实存照而不择一。

§10.3 已知不确定与存照

  • 卫星事件日期:官方仓库 README 原文即为"October 8 or 12"两种并列口径,本页如实存照,未采信任何一方为唯一事实。
  • 引用键名:heller2023kits21 键名与 KiTS21 论文标题绑定 arXiv:2307.01984,为官方 README 原文口径,非本站笔误。
  • cyst 覆盖率:约 248/489 为社区文献(MDPI 综述)口径,官方无正式统计表。
  • 前排完整名单:除冠军(Dice 0.835 / Surface Dice 0.723)外,其余名次与逐队数字未在本页三源核验范围内,故不转录。
  • 标注人力:KiTS23 批次标注者人数与一致性量化官方未披露,本页不虚构。

§10.4 内容边界

本页面不构成医疗建议;"测试集成绩"仅指官方评测产出;对数据集的许可解读不构成法律意见,商用前应联系 helle246@umn.edu 获得书面授权。

§10.5 更新计划

本条目跟踪两类上游变化并在必要时更新:(1) 工具仓库与临床元数据的新 commit;(2) 影像托管层的迁移或镜像变动。页面底部标注最后审核日期。

§10.6 反馈与勘误

发现事实错误或链接失效,请通过本站条目页的反馈入口提交,或对照官方源(§10.2 第一层级)先行核验——本站欢迎带原始出处的勘误。

§10.7 机器可读性与复用说明

  • 本条目 frontmatter 的 schema_org 字段为合法 Croissant 风格 @graph(含 MedicalWebPage、Dataset、cr:RecordSet、cr:Field 与 rai:* 五字段),机器消费者可将其映射为知识图谱或数据集卡片;
  • 文末 `

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • kits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • lits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • flare — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • autopet-v — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • hecktor2026 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • trials — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • autopet-iii — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • segthor — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • pddca — 共享标签:医学影像 / CT / 医学图像分割 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集