CURVAS (curvas) — AI-Ready Wikipedia

MICCAI 2024 挑战赛数据集:90 例门静脉期增强腹部 CT,胰腺/肾/肝由 3 位放射科医师独立标注——金标准从单一 mask 升级为标注分布(consensus+dissensus),DSC/Cseg/cECE/CRPS 四件套联合评估分割精度、校准与体积,MedIG 夺冠,CC BY-NC 于 Zenodo 全量公开 29.4 GB

来源 90 例门静脉期对比增强腹部 CT(SIEMENS,0.6-1 mm 薄层,Br40 软核)+ 3 位放射科医师独立 NIfTI 标注(annotation_1/2/3.nii.gz)× 3 器官(0 背景/1 胰腺/2 肾/3 肝)+ A/B/C 病理复杂度分组(45/22/23)+ train/val/test 20/5/65 划分发布时间: 2026-09-27最后更新: 2026-09-27 阅读 16
CURVAS (curvas) — AI-Ready Wikipedia

信息速览

数据集名称CURVAS (curvas) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模90 例成人 CT(51 男/39 女;37-94 岁,均值 65.7 岁;单中心 Universitätsklinikum Erlangen)
接入方式90 例门静脉期对比增强腹部 CT(SIEMENS,0.6-1 mm 薄层,Br40 软核)+ 3 位放射科医师独立 NIfTI 标注(annotation_1/2/3.nii.gz)× 3 器官(0 背景/1 胰腺/2 肾/3 肝)+ A/B/C 病理复杂度分组(45/22/23)+ train/val/test 20/5/65 划分
AI 就绪度

INFOBOX — CURVAS 一屏速览

维度 内容
本质 MICCAI 2024 挑战赛数据集:90 例腹部 CT × 3 位放射科医师独立标注 × 3 器官(胰腺/肾/肝)
核心主张 金标准不再是单一 mask,而是标注分布——consensus(共识区)与 dissensus(分歧区)分开评估
团队 Sycai Technologies SL + UPF BCN Medtech + Uniklinikum Erlangen + Tecnalia + BCN-AIM/ICREA
数据 90 例门静脉期增强 CT(0.6-1 mm 薄层);A/B/C 三组 45/22/23;train/val/test=20/5/65
格式 NIfTI .nii.gz;每例 4 文件(image + annotation_1/2/3);标签 0 背景/1 胰腺/2 肾/3 肝
规模 Zenodo v3 三 zip 共 29.4 GB(train 6.3 + val 1.6 + test 21.6),全量公开直链
指标 DSC + Cseg 置信度 + cECE(多 rater 校准)+ CRPS(概率体积)——没有 NLL、没有校准曲线图
战果 7 队 10 算法(全 U-Net 系);MedIG(STAPLE+nnUNet 3D full-res)综合第一(DSC 94.57%)
关键发现 分割最准的模型校准最好;外部数据/预训练 = 对 C 组异常结构更鲁棒
许可 数据 CC BY-NC(商用需联系作者);代码 CC BY-NC/CC-BY-NC-SA 双口径;Sci Data 论文 CC BY-NC-ND
版本坑 v1(2024-04,元数据损坏)→ v1.0.1(2024-07)→ v3(2024-09,用这个);v3 有两个 DOI 均可达
库内互链 totalsegmentator(422)、amos(76)、abdomenct-1k(402)、word(412)、flare(387)、btcv(377)、segthor(439)

CURVAS 是一次"把专家分歧写进金标准"的挑战赛工程:它给 90 例腹部 CT 各配了 3 位放射科医师的独立标注,然后告诉参赛者——评估时不再对齐某个"唯一正确答案",而是把三位医师一致的区域和分歧的区域分开计分。分割最准的模型恰好是校准最好的模型;而面对肾缺如、肝转移这类异常解剖,见过大世面(外部公开数据+预训练)的模型明显更稳。这个数据集把"标注即主观"从一句抱怨变成了一套可执行的评测协议,是腹部多器官分割从"刷 Dice"走向"可信赖 AI"的转折性样本。

导语读法三则:

  1. 只想下数据:直奔 §6——认准 Zenodo v3(2024-09,29.4 GB 三包),CC BY-NC;v1 有损坏元数据别用(坑 7)。
  2. 关心标注质量与多 rater 方法:直奔 §3 与 §4——预标注修正流水线、器官级细则、一致性分析连读。
  3. 要复现或对标挑战赛成绩:直奔 §5——评估区三分设计、四指标定义、七队排名与外部数据效应可直接对标。

§0 导读:这个数据集解决什么问题

医学图像分割有一条不成文的假设:每个器官存在一个"正确答案",模型对它的偏离就是误差。CURVAS 的作者团队(巴塞罗那 Sycai Medical + 庞培法布拉大学 + 埃尔朗根大学医院)认为这个假设在临床上是错的——即使经验丰富的放射科医师,对同一器官边界的判断也会分歧,尤其胰腺这类形态多变、边界模糊的结构。传统做法把分歧"融合"掉:STAPLE 投票、标签平滑、多数投票,把 3 份标注压成 1 份金标准再考模型。CURVAS 反其道而行:分歧本身就是信息。如果三位医师画得不一样,那么一个校准良好的模型在这里就应该"不确定"——它的置信度应该降下来,而不是硬给出一个高置信度的答案。

这个理念落成了一套三层评测协议。第一层是分割质量:Dice 只在"共识区"内计算——假阳性只能在三位医师都说"是背景"的地方产生,假阴性只能在都说"是器官"的地方产生,分歧区被显式豁免。第二层是校准:cECE(Confidence Expected Calibration Error)分别对三位医师的标注各算一遍再平均,模型"过分自信"或"过分谦虚"都会被量化。第三层是体积:把三份标注的器官体积均值±标准差拟合成高斯分布,用 CRPS 连续排名概率分数衡量模型的概率化体积估计是否落在这个分布附近——体积是肿瘤学随访问的硬临床指标,这是 CURVAS 名字里 “Volume Assessment” 的由来。

数据的组织方式为这个理念服务:90 例前瞻性采集的门静脉期增强腹部 CT(埃尔朗根大学医院,2023-08~10),每例 3 份独立 NIfTI 标注;按病理复杂度分 A(≤2 囊肿)/B(3-5 囊肿)/C(6-10 囊肿或合并肝转移、肾积水、肾上腺转移、肾缺如)三组(45/22/23);训练集只给 20 例 A 组——故意给小数据,逼参赛者像真实世界一样去用公开数据集训练,然后考分布外泛化。2024 年 7 支队伍、10 个算法(全部 U-Net 系)交卷,2025 年结果论文登 Computers in Biology and Medicine,2026 年数据论文登 Nature 旗下 Scientific Data。

§0 读法三则:

  1. 这个条目是"挑战赛+数据集+两篇论文"的复合体:本体是 Zenodo 上的 90 例四件套,方法论文是 CBM 2025(挑战结果),数据论文是 Sci Data 2026(标注一致性分析)——引用与许可各归各(§6.3)。
  2. "校准"在本挑战里特指 cECE + Cseg + CRPS 三件套,深度学习校准文献里的 NLL、Brier、可靠图并未进入评测(坑 4)。
  3. 方向感:CURVAS 与 QUBIQ(2D 多 rater 不确定性)、LIDC-IDRI(肺结节多 rater)构成谱系,是3D 多 rater 腹部 CT 这个生态位的填补者——Sci Data 论文明说"少有工作对 3D 数据做观察者间变异"。

§1 数据集速览:十问十答

Q1:CURVAS 的 90 例从哪来?
德国巴伐利亚埃尔朗根大学医院(Universitätsklinikum Erlangen)前瞻性采集,2023 年 8-10 月,伦理批号 23-243-B;全部门静脉期对比增强 CT、0.6-1 mm 薄层、SIEMENS 扫描仪。患者 18 岁以上,51 男 39 女,37-94 岁(均值 65.7)。

Q2:为什么只有三个器官?
胰腺、肾(双侧)、肝——腹部三大功能器官,其中胰腺是公认的"最难标注器官"。挑战的用意正是用两个"好标"器官衬托一个"难标"器官,让标注分歧可以被观察和研究。

Q3:每位医师的标注是独立做的吗?
标注修正环节独立进行,但共享同一套书面准则:由一位 MD PhD candidate 医师先定义队列、入组标准与"什么算实质"的判定规则,另两位临床医师(腹部 CT 经验 2 年与 4 年)复核准则本身,但完全不参与标注。三位医师(R1/R2/R3)在准则约束下各自修正 TotalSegmentator 预标注。

Q4:预标注是什么?
TotalSegmentator 自动生成的粗标注。医师的工作不是从零画,而是"修正+补漏"——TS 漏掉的器官要补上,TS 画错的边界要改。这个流程让 3 份标注的生成成本可控,也埋下了一个隐性约束:三份标注共享同一预标注起点(§3.5)。

Q5:标签怎么编码?
每例 4 个 NIfTI 文件:image.nii.gz(CT 体数据)+ annotation_1/2/3.nii.gz。标签整数编码:0=背景、1=胰腺、2=肾、3=肝。注意与 AMOS、BTCV 等库内腹部数据集的标签顺序都不同,跨库合并必须重映射(坑 6)。

Q6:A/B/C 三组是什么?
按病理复杂度的临床分组:A=45 例(≤2 个囊肿、无轮廓改变病变)、B=22 例(3-5 个囊肿)、C=23 例(6-10 个囊肿或合并肝转移、肾积水、肾上腺转移、肾缺如等)。挑战期间不公开分组归属,赛后随全量数据公布——C 组就是天然的分布外压力测试。

Q7:训练/验证/测试怎么分?
训练 20 例(全 A 组)+ 验证 5 例(全 A 组)+ 测试 65 例(20A+22B+23C,即全部 B、C 组加 20 例 A 组)。训练集小是故意的:鼓励用公开多 rater 数据补充训练,考察真实世界数据稀缺场景。

Q8:挑战赛怎么评分?
四指标各自排名再取平均:DSC(共识区内)、Cseg 置信度、cECE(对 3 份标注分别算再平均)、CRPS(概率体积)。7 队 10 算法,MedIG 综合冠军(DSC 94.57%、CRPS 8.108 cm³),PrAEcision 亚军,BreizhSeg 季军(且 ECE 最小 1.61e-3)。

Q9:数据现在能直接下吗?
能。Zenodo v3(2024-09)三个 zip 共 29.4 GB 公开直链,无需注册申请;CC BY-NC 许可(商用需联系作者 m.riera@sycaitechnologies.com)。评估与 baseline 代码在 GitHub(SYCAI-Technologies/curvas-challenge)。

Q10:为什么它对 AI-Ready 重要?
它是"标注分布即金标准"在 3D 腹部 CT 上的第一个系统化落地:数据公开(v3 直链)、协议开源(GitHub)、评估代码可复现、且自带一份标注一致性"说明书"(Sci Data 论文告诉你哪些器官分歧大、离群值在哪)——四要素齐备的多 rater 基准在库内是首例。

§2 数据构成与规格

2.1 规模、来源与队列构成

CURVAS 的 90 例 CT 全部来自单中心——德国巴伐利亚州埃尔朗根大学医院(Universitätsklinikum Erlangen)放射科,2023 年 8 月至 10 月前瞻性连续采集,数据收集获该院伦理委员会批准(批号 23-243-B),所有患者签署口头+书面双重知情同意(研究专属同意 study-specific consent + 宽泛同意 broad consent),影像经医院侧假名化编码后出库,挑战参与者无从接触患者身份信息——Zenodo 描述原文的表述是"重新识别在技术上不可能"(医院 IP 之外无人可及患者身份映射)。

维度 数值 备注
病例总数 90 前瞻性采集,无额外选择标准
性别 51 男(56.7%)/ 39 女(43.3%) 力求均衡但女性略少
年龄 37-94 岁,均值 65.7 覆盖典型放射科人群
模态/期相 门静脉期对比增强 CT 3-4 mL/s 注射,400 mgI/kg 碘负荷
层厚 0.6-1 mm 薄层 薄层采集是入组硬条件
扫描仪 SIEMENS(全院统一) 单厂商是泛化外推的硬约束
标注者 3 位放射科医师/例 每例 3 份独立标注

入组标准刻意宽松:仅要求门静脉期增强、薄层、囊肿 ≤10 个且直径 <2.0 cm;显著伪影(如呼吸伪影)或配准不全者排除。作者明说"不设额外选择标准以保代表性"——这是一个"日常门诊人群"而非"精选病灶人群"的样本。采集动机也写实:CT 均为患者住院期间因各种医疗需要所做的胸腹联合扫描,腹部器官恰好被覆盖——不是为数据集而扫描,而是从真实检查流里截取。

2.2 临床三组与数据划分

90 例按影像表现分为三组,分组标准围绕囊肿数量与轮廓改变性病变:

组 定义 例数 训练 验证 测试
A ≤2 个囊肿,无轮廓改变性病变 45 20 5 20
B 3-5 个囊肿,无轮廓改变性病变 22 — — 22
C 6-10 个囊肿,含肝转移/肾积水/肾上腺转移/肾缺如 23 — — 23
合计 — 90 20 5 65

三点设计意图值得展开。其一,训练集只有 20 例 A 组——这是明示的"数据稀缺实验":Zenodo 描述原文鼓励参赛者"利用公开的多 rater 外部数据",实际获奖队伍也确实这么做了(§5.7)。其二,验证集也只从 A 组出,B/C 组全部压在测试集里,挑战期间连分组归属都不公开——参赛者不知道自己面对的病例难度结构,这保证了分布外评估的诚实性。其三,C 组把"肾缺如"(单肾人)和"肝转移"塞进了多器官分割任务:所有 10 个算法在一张定性案例上集体漏检异常形态的肾(§5.8),这是全论文最有戏剧性的单帧结果。

测试集例数双口径存照:Zenodo v3 页写测试集 65 例(20A+22B+23C);CBM 结果论文 §2.2.3 却写"20 CTs of Group A, 17 CTs of Group B and 23 CTs of Group C"(合计 60)。总数守恒 90=20+5+65 与 B 组总数 22 都支持 Zenodo 口径,论文"17"疑为笔误(坑 2)。本条目按 Zenodo 口径。

2.3 文件结构与标签体系

Zenodo v3 解压后按挑战赛官方划分组织三个顶层目录(training_set/validation_set/testing_set),每例一个子目录、四个文件:

文件 内容
UKCHLLXXX/image.nii.gz 门静脉期增强腹部 CT 体数据
UKCHLLXXX/annotation_1.nii.gz 放射科医师 1 的三器官标注
UKCHLLXXX/annotation_2.nii.gz 放射科医师 2 的三器官标注
UKCHLLXXX/annotation_3.nii.gz 放射科医师 3 的三器官标注

标签为整数编码:0=背景、1=胰腺、2=肾(含双肾)、3=肝。三份标注与同一 CT 体数据空间对齐(同一参考系),可直接做逐体素比较。案例命名 UKCHLLXXX 中的 XXX 为唯一病例编号——UK+CH+LL 的字面含义论文未展开,检索者按"目录名即病例 ID"使用即可,不必过度解读前缀。

标签顺序的跨库提醒:库内常见腹部分割数据集的标签映射各不相同——BTCV 系把脾放 1、肝在 6;AMOS 的顺序又是另一套;CURVAS 把胰腺放在 1(对其任务主角的强调)。用 nnU-Net 类框架跨库联合训练时,dataset.json 的标签字典必须逐库重写,直接照搬是真实的高频事故(坑 6,附录 E 有对照表)。

2.4 CT 采集技术规格

Zenodo v3 页给了一份罕见的完整采集参数清单,对"跨中心泛化研究怎么模拟采集漂移"极有参考价值:

参数 取值
厂商 SIEMENS(埃尔朗根大学医院统一)
重建核 Br40 软组织核
机架转速 0.25 或 0.5 s
探测器准直 128×0.6 mm 单源;98×0.6×2 与 144×0.4×2 双源
螺距因子 0.3-1.3
参考管电流 200 mAs(可下调至 120 mAs),自动管电压适配+管电流调制
对比剂 碘美普尔 350 mgI/mL,注射 3-4 mL/s,400 mgI/kg(≈1.14 mL/kg)
重建 软卷积核+迭代重建

这份清单的价值在于"变化范围"而非"固定值":准直有单源/双源两种硬件、螺距横跨 0.3-1.3、管电流可下调四成——数据内部自带采集异质性,做采集参数鲁棒性实验可以直接以这些字段做分层。

2.5 与库内腹部分割数据集的规格对照

数据集 规模 器官数 标注者 定位差异
CURVAS(本条目) 90 CT 3 3 位医师/例(全例) 标注分布+校准评估
AMOS(rid 76) 500 CT+100 MRI 15 单标注(多中心) 大规模跨模态泛化
AbdomenCT-1K(rid 402) 1,000 CT 13 单标注(多中心) "腹部分割是否已解决"之问
WORD(rid 412) 312 CT 16 单标注(单中心) 全腹部器官+肿瘤
BTCV(rid 377) 30 CT 13 单标注(单中心) 经典小而精基准
FLARE(rid 387) 数千 CT 5-13 单标注(多中心) MICCAI 系多器官挑战赛
TotalSegmentator(rid 422) 数千 CT 104+ 模型生成+人工核验 全身结构自动分割

一眼可见 CURVAS 的生态位:规模最小、标注者最多、评估维度最多。它不是拿来刷榜的大数据集,而是一台"标注分歧显微镜"——用 90×3 的标注矩阵回答"分割的真值到底是什么"这个上游问题。

2.6 年龄-病理负担画像

CBM 论文 Figure 1 给出的分布特征值得单列一节:B 组与 C 组病例更多出现在高龄段——与"囊肿数量随年龄增长、病理负担随年龄上升"的临床直觉一致;而 train/val/test 的划分在各年龄段保持均衡,避免"测试集全是老年人"的年龄漂移。对使用者的三层含义:

  • 想做年龄分层评测:90 例的年龄跨度(37-94)支持粗分层(如 <50 / 50-70 / >70),但每层样本量会跌到个位数,结论只能作方向性参考。
  • 想做"病理负担-模型表现"关联:A/B/C 分组是现成的负担代理变量,比连续年龄更好用——组定义本来就是按囊肿与病变划的,且 Sci Data 论文披露组间年龄无显著差异(“no significant age difference between Group A and Groups B and C”),61-80 岁段病灶数最多。
  • 想解释模型在老年患者上的波动:先看该病例落在哪一组,再谈年龄——组别混杂是年龄效应分析里最容易漏掉的混淆变量。

2.7 临床体积评估的意义(为什么是 Volume Assessment)

CURVAS 名字里的"Volume Assessment"不是凑字数。器官体积是放射科随访问的真实硬指标:肝体积用于肝切除术前规划与肝功能储备评估,肾体积用于慢性肾病进展监测与移植随访,胰腺体积在囊性病变与糖尿病研究中是新兴生物标志物。传统分割挑战只算 Dice——一个"重叠分数",对"体积差了多少毫升"不敏感:0.95 的 Dice 可能对应几十毫升的绝对体积差,而肿瘤疗效评估恰恰关心绝对体积变化。CURVAS 用 CRPS 把"体积估计+不确定性"绑进排行榜,等于强迫参赛模型把"这个器官多大、我有多确定"作为一等公民输出——这是把分割任务往临床决策链上推的一步。

三份医师标注的体积均值±标准差本身也构成一份珍贵的"器官体积参考分布"(含观察者变异度):哪怕不做分割,这 90 例×3 器官×3 标注的体积统计也可以独立引用——它是"同一器官、同一机器、同一期相下专家体积估计的天然波动范围"的实测样本。

2.8 三类用户画像:同一批数据的三种消费方式

CURVAS 的数据资产可以按"你要什么"拆成三层消费面,不同用户的正确入口完全不同:

用户 消费层 正确用法 反面教材
分割模型开发者 image + 任一 annotation(或三份轮流) 外部大数据主干训练,CURVAS 做微调与分布外评测 拿 20 例当主训练集(§2.2)
不确定性/校准研究者 annotation_1/2/3 的分布本身 dissensus 区做不确定性验证,cECE 对三份分别算 先融合再三份(销毁核心资产)
标注方法学研究者 三份标注的差异结构 复算 DSC/HD/κ 四件套,对照 Sci Data 结论 只看融合后的"正确率"
临床信息学研究者 体积统计(三份标注各自求体积) 器官体积参考分布+观察者变异度 拿二值 mask 直接算体积不报变异

第三类用户常被忽略:三份标注两两相减得到的"分歧体素图"本身就是监督信号——可以训练一个"预测专家会在哪里分歧"的模型,其输出可直接作为下游分割模型的置信度先验。这是 CURVAS 相对单标注数据集多出来的一个可学习目标,论文没有明说,但数据结构完全支持(此为本条目的分析性推演)。

§3 标注流水线:预标注修正制与书面准则治理

3.1 流水线全景

CURVAS 的标注生产是"AI 预标注 + 医师修正"两段式:

阶段 执行者 动作
阶段 0:准则制定 MD PhD candidate 医师 定义队列、入组标准、三器官"什么算实质"的书面细则
阶段 0.5:准则复核 2 位临床医师(腹部 CT 经验 2 年/4 年) 审查准则与队列,但不参与任何标注(防偏设计)
阶段 1:预标注 TotalSegmentator 模型 自动生成三器官粗标注
阶段 2:修正+补漏 3 位放射科医师(R1/R2/R3) 各自独立修正 TS 边界错误、补上 TS 漏检器官
阶段 3:QA 组织方 完整性校验、多 rater 统计、目视检查

这个流程有两个直接后果。好的一面:医师不必从零勾勒大器官,3 份标注的成本从"3 倍手工"降到"3 倍修正",这是 90 例全例三标注在经济上可行的前提。微妙的一面:三份标注共享同一个 TS 起点——TS 画对的地方三份标注天然趋同,TS 画错的地方三位医师要各自独立发现。这意味着观察到的标注一致率可能被预标注系统性抬高(共识区偏大),解读一致性统计时要记得这层结构性偏置(§3.5 再展开)。

3.2 器官级标注细则

Zenodo v3 页公开了逐器官的完整边界规则,这套细则本身就是可复用的标注 SOP 资产(引 Rädsch et al. 2023 Nature Machine Intelligence “Labelling instructions matter”):

器官 纳入 排除
肝 全部肝组织(含血管系统、肿瘤等内部结构);大血管包裹区按凸包纳入;病理性扩张的胆管纳入 门静脉主干及其两大分支;更远代分支纳入;肝内嵌入脂肪组织;胆囊
肾 肾实质+肾髓质(双侧) 肾盂;输尿管(防止尿潴留改变体积读数)
胰腺 全胰走行范围追踪标记,不区分头/体/尾 脾静脉;肠系膜静脉

细则的字里行间都是临床考量:肾盂输尿管排除是为了保住"体积作为生物标志物"的纯度——积水会让肾体积暴涨,混进去体积指标就废了;肝的门静脉分支规则直接继承 SLIVER/肝分割文献的经典约定(细则里明引 Heimann 2009 的肝分割比较研究);胰腺"全走行追踪"则是对"只画容易画的部分"这种偷懒行为的预防。

三条细则合起来指向同一个设计目标——体积评估的稳定性。规则能收敛的是"格式性歧义"(血管哪段算、胆囊算不算),收敛不了"感知性歧义"(萎缩胰腺的边界、小囊肿周围的实质判定)——后者正是分歧数据的来源,也正是这个数据集的价值所在。

3.3 准则治理:为什么值得抄

多数数据集的标注指南是"写完就发",CURVAS 把准则本身做成了三重治理:一人定义、两人复核(复核者与标注者完全隔离)、三人统一执行。这个结构同时防两类偏——复核者不标注,避免"标准制定者自己的答案污染评估";标注者共享准则,避免"三位医师各画各的解剖学"导致分歧全是风格差异而非信息差异。论文引 Rädsch 2023 的实证结论:标注指南的差异足以造成可测量的分数差异——CURVAS 把这条方法论教训直接制度化了。

对想复用的团队,可迁移的三条:(1) 准则书面化且先于标注冻结;(2) 准则定义者与标注者角色分离;(3) 标注者之间互相不可见——这正是 CURVAS 能报告"哪些区域三人都同意、哪些区域有人反对"的前提。

3.4 质量保证与"故意保留的错误"

挑战期间的 QA 有三层:全部标注数据的完整性校验(防损坏/防错位)、多 rater 标注的统计分析(观察者间变异量化)、目视检查(抓系统性偏差)。而 Sci Data 数据论文披露了一个更少见的决定:训练集中 2 例 CT 存在人为标注错误,组织方明确选择不修正——原文理由是"想在数据里也呈现日常标注实践中不可避免的人为错误"。这两例就是 Sci Data 一致性分析里提到的"两个源于人为错误的离群值"。

复现者的实用推论:如果你在训练集上做标注一致性统计,会撞到 2 个"怎么清洗都洗不掉"的离群值——它们不是 bug 是 feature(坑 8)。反过来,这也给多 rater 数据集提了个醒:训练集的标签错误会以什么形式、被谁发现、要不要修,本身需要一份明文政策——CURVAS 的政策是"保留并声明",比"默默清洗"或"假装没有"都更诚实。

3.5 预标注共享的结构性偏置

所有多 rater 数据集都有一个"独立性从哪来"的问题。CURVAS 的三份标注独立性建立在"修正环节互不可见"上,但起点是同一份 TS 输出。这带来两个可检验的推论:

  1. 共识区偏大:TS 画对的区域,三位医师大概率照单全收——这部分的一致性是"TS 给的",不是"医师独立判断给的"。
  2. 分歧集中在 TS 的薄弱区:TS 画错或漏检的位置(胰腺边缘、变异血管周围)才是医师真正发挥独立判断的地方,也正是 dissensus 区的富集区。

对使用者的操作建议:如果你想研究"纯人vs人"的观察者间变异,可以把三份标注两两相减、定位分歧体素、再对照 TS 预标注——分歧体素与 TS 误差空间的重叠度本身就是一篇方法学分析。别把 CURVAS 的共识率直接当作"专家间天然一致率"引用,它带着预标注的底色。

§4 标注一致性:胰腺难、肝肾稳的证据结构

4.1 四把尺子量分歧

Sci Data 数据论文(Sci Data 2026;13:156)对 90×3 的标注矩阵做了系统的一致性分析,用了四把尺子:

  1. DSC(两两 Dice):每对医师、每个器官、每个组计算重叠——快速定位"漏标/大错"。
  2. Hausdorff 距离:边界最大偏差——DSC 对大器官的前景占比不敏感,边界精度要靠它。
  3. Cohen’s κ(两两):逐体素二分类一致性(含/不含),扣随机一致——定位"哪两位医师、在哪个器官上系统性不合"。
  4. Fleiss’ κ(多 rater):三位医师同时的一致性——组级可靠性总表。

这四把尺子的组合本身是给同类研究的模板:DSC 看重叠、HD 看边界、Cohen’s κ 看配对偏置、Fleiss’ κ 看总体可靠性——单一指标的"一致性好/差"在多 rater 数据集里都是不完整的。方法细节上有个巧思:把每个体素当作"1=纳入该器官、0=排除"的类别观测量,κ 的计算就从"分级一致性"平移到了"分割一致性",这是分割领域复用 κ 家族的通用做法(Sci Data 正文引 Rahman et al. 的做法)。

4.2 核心发现(定性,论文未给数值表)

  • 肾与肝:高度一致。DSC 高且分布窄,Cohen’s κ 高而稳,Hausdorff 低而稳——"边界明确的器官,专家间分歧很小"在 3D 上得到确认。
  • 胰腺:分歧最大,尤其在 B 组(3-5 囊肿组)——DSC 分布最宽、Hausdorff 最大、κ 最低。作者归因于胰腺形态多变、边界模糊,且中等囊肿负担下"囊肿算不算胰腺实质"的判定最难规则化。
  • C 组反而更一致:最有病理压力的组,三位医师的一致性却更高(DSC 与 κ 都是)。作者给出的解释很直白:面对更难的组,放射科医师标得更仔细;A/B 组反而可能"标快了"。这个反直觉发现对标注管理者极有价值——标注质量与病例难度不成单调关系,注意力分配才是中介变量。
  • 离群值的构成:绝大多数离群值来自医师间高变异(真实分歧),仅 2 个来自人为错误(训练集那 2 例故意保留的)——分歧矩阵里"噪声信号"和"错误信号"是可以分离的。
  • Hausdorff 的独立价值:Sci Data 特别强调大器官的 DSC 会被前景体素量"淹没",边界精度的差异要靠 Hausdorff 才看得见——胰腺的边界分歧在 DSC 上只是"小数点后第二位",在 HD 上则是几十毫米的实打实差距。

4.3 对使用者的三句转译

  1. 在 CURVAS 上训练/评测时,预期模型在胰腺上的 Dice 天花板低于肝肾——这不是模型差,是金标准本身在胰腺上更"宽"。把你的胰腺分数与三位医师的互标分数比,比与 1.0 比更有意义。
  2. B 组是"隐藏的难组"——分组看着温和(无轮廓改变性病变),但胰腺一致性最差;C 组反而因为"大家都认真"而更可复现。
  3. 想引用具体的"胰腺医师间 Dice 是多少"——引用不到:Sci Data 只有箱线图没有数值表,别在二手文献里找具体数字硬抄(坑 9)。

4.4 把一致性数据当"不确定性基准"用

Sci Data 论文结论段有一个对方法研究者极重要的定位句式:量化的观察者间分歧直接构成数据集内生的偶然不确定性(aleatoric uncertainty)基准——“成功的 UQ 模型应表现出与观察者间分歧相关的预测不确定性;稳健的校准方法可以对照这个标注分布来验证”。落到操作上:

  • 相关性检验:把每个病例/每个器官的 dissensus 体素占比算出来,与模型预测的熵图/方差图做空间相关——相关高,说明模型的"不确定"长在专家分歧的地方。
  • 分层评估:按 dissensus 占比分层报模型指标——好的概率模型应该在高层(分歧大)显式降置信,在低层(共识强)保持高置信;CAI4CAI 的校准损失思路与此同构。
  • 融合对照:任何"把 3 份标注融合成 1 份再评测"的 baseline 都应报告融合方式(STAPLE/多数投票/并集/交集),因为融合选择会直接改变榜单——MedIG 用 STAPLE 拿了第一,换并集融合的榜单可能重排。

这也是 CURVAS 区别于普通分割数据集的"第二用途":它既是分割训练/评测集,又是校准与不确定性方法的验证台——后一个用途要求你保留三份标注的原始分布,任何提前融合都是在销毁数据的核心资产。

4.5 把医师互标当 baseline:一段可操作的流程

论文没写、但数据结构支持的实用流程——用医师互标一致性作为模型分数的"参照天花板":

for organ in {pancreas, kidney, liver}:
    for pair in {(1,2),(1,3),(2,3)}:
        DSC_rater[pair][organ] = dice(annotation_i, annotation_j)   # 逐例两两
    ceiling[organ] = mean(DSC_rater[.][organ])                      # 该器官的天花板代理
# 报告模型分数时同时给出 ceiling,相对分 = model_DSC / ceiling

这个相对分在胰腺上尤其有价值:绝对 Dice 0.85 在胰腺可能已贴近专家互标水平,在肝则还有距离——绝对分跨器官不可比,相对分可比。注意事项:训练集 2 例故意保留的错误会拉低 ceiling 的 20 例子集版本,计算 ceiling 时建议在测试集 65 例上做(该子集无已知错误);此流程是本条目基于 Sci Data 方法的操作性延伸,非论文原文步骤。

§5 挑战赛设计、指标与七队战况

5.1 组织时间线与平台

时点 事件
2024-04-16 Zenodo v1 上线,挑战启动(Grand Challenge 平台 curvas.grand-challenge.org)
2024-05 ~ 08 底 训练期(训练集 20 例公开)
2024-07 Zenodo v1.0.1:训练集修订版(6.3 GB)
2024-09-07 容器化算法提交截止(GC 平台 Docker 推送)
2024-09 Zenodo v3 全量公开(29.4 GB 三包)
2024-10-10 MICCAI 2024 会议 CURVAS 专场,前三名报告

平台纪律:统一容器化提交、平台侧安全隔离评估、主办方也可提交容器但无获奖资格;前三名受邀在 MICCAI 会场报告,前五名受邀加入 CURVAS 联盟并署名后续期刊论文,前三名有现金奖。发表纪律也有明文:参赛队可在主办方论文发表后自行发表,但须引用主办方论文——这保证了 CBM 2025 的"官方口径"地位。

5.2 评估区三分:consensus / dissensus 的算术

CURVAS 评估协议的核心创新是把每个体素划入三个区之一:

区域 定义 评估角色
foreground consensus(共识前景) 三位医师都标为该器官 假阴性(FN)只在此区计
background consensus(共识背景) 三位医师都标为背景 假阳性(FP)只在此区计
dissensus(分歧区) 至少一位医师意见不同 显式豁免出 DSC,转由不确定性指标接管

同一颗体素,在传统单金标准协议下可能是"误差",在 CURVAS 协议下可能是"合理的临床歧义"。这不是放宽标准——是让 DSC 量"该量的"(明确解剖),让不确定性指标量"该量的"(歧义区)。

5.3 指标四件套的定义与读法

DSC:三个器官各自计算后取平均。只在共识区算(见上)。

Cseg(分割置信度):对共识背景区置信度 CB 与共识前景区置信度 CF,Cseg=((1−CB)+CF)/2——理想模型在前景高置信、背景低置信。三器官各自算再平均。注意这是"分区置信度"而非逐体素准确率对齐——它衡量模型输出的概率图是否在"该确定的地方确定"。

cECE(多 rater 校准误差):把模型的概率预测按置信度分箱,逐箱算 |准确率−平均置信度| 加权求和;关键在于对三位医师的标注分别算一遍再等权平均——同一预测对医师 A 的标注是校准的、对医师 C 的标注可能不是,三个值都保留才能体现"对标注分布的校准"。这是本挑战对校准文献最具体的方法学增量。

CRPS(连续排名概率分数):三位医师的器官体积构成(均值, 标准差)→ 高斯 PDF → CDF;模型输出的概率图逐体素求和得到概率化体积 → Heaviside 函数;CRPS 是两条曲线间平方差积分,越小说明预测体积越落在"医师体积分布"附近。这是把"不确定性感知"做进体积生物标志物的少见设计——模型必须输出概率图而非二值 mask 才能参与本项评估。

没有的指标:NLL、Brier 分数、可靠图(reliability diagram/校准曲线)都没进评测(坑 4)。排名 = 四指标各自名次的平均。

5.4 七队十算法:方法谱系

队伍 机构 核心方法 对标注的处理 外部知识
MedIG 深圳先进院 SIAT-CAS + 国科大 STAPLE 共识 + nnUNet 3D full-res(ResidualEncoderUNet) STAPLE 融合为单共识 无
PrAEcision FAU 埃尔朗根 nnUNet 3D lowres 三份标注分开训练 WORD+AMOS+TS+AbdomenCT-1K
BreizhSeg 雷恩第一大学/INSERM LTSI TotalSegmentator 微调 + ABNN(可适配贝叶斯 NN,4 标注设置×5 折=20 runs) 4 套标注设置分开跑 TS 预训练权重
DLAI 帝国理工 + UCL xLSTM-UNet + 窗口交叉注意力 CAT 块 三份标注分开训练 无
BCNAIM 巴塞罗那大学 BCN-AIM + ICREA CLIP 驱动通用模型(UNet 骨干)三模型 logit 集成 每标注者一个模型 AbdomenAtlas-8K 预训练
CAI4CAI KCL MONAI SegResNet + soft-binned ACE 校准损失 三份标注分开训练 无
PredictED 巴塞罗那大学 + 爱丁堡大学 2D UNet++ 双编码器(EfficientNet-B3+MobileViTv2)加权集成 + TTA 多数投票合并 ImageNet 预训练编码器

十个提交全部是 U-Net 血统;3 队各交 2 个算法凑成 10 个提交。处理标注变异的路线分三派:融合派(MedIG 的 STAPLE、PredictED 的多数投票)、分开训练派(PrAEcision/DLAI/CAI4CAI 每份标注独立监督)、贝叶斯派(BreizhSeg 的 ABNN 把归一化层参数贝叶斯化,20 次训练采样后验)。四队用了外部数据或预训练(PrAEcision/BreizhSeg/BCNAIM/PredictED)。

工程细节也值得记录:Grand Challenge 平台对推理时限与存储有限制,MedIG 为此把概率图里 <1e-6 的值清零以压缩存储与 I/O;PrAEcision 因为 3D full-res 与集成模型推理太慢,宁可选精度略低的 3D lowres——推理效率是真实约束,这些取舍写在论文里,比许多"无限算力假设"的方法论文诚实得多。

5.5 总排名(CBM 论文 Table 2 全转)

排名 算法 DSC (%) 置信度 (%) ECE (×10⁻³) CRPS (cm³)
1 MedIG 94.57 (1) 97.87 (1) 1.82 (2) 8.108 (1)
2 PrAEcision 93.29 (2) 97.18 (2) 2.22 (3) 10.438 (3)
3 BreizhSeg 92.60 (4) 97.17 (3) 1.61 (1) 12.326 (4)
4 DLAI 92.72 (3) 96.23 (4) 3.90 (4) 12.625 (5)
5 BCNAIM 90.52 (5) 95.88 (5) 6.21 (6) 9.727 (2)
6 PredictED 85.79 (6) 92.39 (6) 6.64 (7) 25.895 (7)
7 CAI4CAI 84.98 (7) 92.10 (7) 4.48 (5) 12.828 (6)

读法四则:

  • MedIG 的"朴素"胜出:不专门做不确定性建模,靠 STAPLE 共识+nnUNet 精修就拿下 DSC/置信度/CRPS 三项第一——在器官大而稳定的任务上,先把共识区做准本身就是最好的校准策略。
  • BreizhSeg 的 ECE 之最(1.61e-3)证明贝叶斯化(ABNN)确实换来了概率校准的收益,但代价是 20 次训练的计算账单与推理期多次前向。
  • BCNAIM 的 CRPS/ECE 矛盾:CRPS 第二但 ECE 第六——它的体积分布贴近医师分布,体素级校准却不稳。CRPS 与 ECE 量的是校准的不同切面,混用会误判。
  • CAI4CAI 的教训:唯一在损失函数里显式加校准项(ACE)的队伍,DSC 却垫底——损失里强行压校准可能挤压分割精度(此为结果反推的解读,论文只陈述现象与"训练目标含校准"的事实)。

5.6 分组成绩全表(CBM Table 3/4 全转)

DSC 与置信度(按组):

算法 DSC-A DSC-B DSC-C Conf-A Conf-B Conf-C
MedIG 96.51 97.00 90.55 98.85 98.97 95.97
PrAEcision 94.67 95.40 90.06 97.77 98.03 95.85
BreizhSeg 95.42 96.09 86.81 98.26 97.83 95.59
DLAI 94.88 96.15 87.57 97.17 97.89 93.82
BCNAIM 93.37 93.36 85.34 96.97 97.25 93.62
CAI4CAI 87.20 89.13 79.07 93.20 93.95 89.37
PredictED 85.69 86.78 84.93 92.67 92.84 91.73

ECE 与 CRPS(按组):

算法 ECE-A ECE-B ECE-C CRPS-A CRPS-B CRPS-C
MedIG 1.88 1.72 1.86 7.52 8.63 8.12
PrAEcision 2.00 2.16 2.49 10.00 12.58 8.78
BreizhSeg 1.19 1.15 2.42 14.56 13.56 9.20
DLAI 4.82 2.59 4.37 13.56 14.91 9.62
BCNAIM 5.85 6.86 5.89 9.296 10.73 9.14
CAI4CAI 6.26 4.04 3.36 14.68 13.89 10.20
PredictED 5.97 7.09 6.78 28.73 28.25 21.18

三条趋势读法:

  • DSC/CRPS 呈"好于预期-B、最差-C":所有算法 B 组成绩普遍好于 A 组(如 MedIG DSC:A 96.51 / B 97.00),C 组全面最差——作者原以为 A(最健康)最好,结果解剖学差异对这三个大器官的分割难度影响被高估了。
  • 校准指标在 C 组分化:BreizhSeg 在 A/B 组 ECE 最优(1.19/1.15),C 组被 MedIG 反超(1.86 vs 2.42);CAI4CAI 的 ECE 反而在 C 组最好(3.36)——各组排名会洗牌,单看总榜会漏掉。
  • PredictED 的 CRPS 在各组都在 21-29 cm³ 挣扎:2D 训练对概率化体积估计是结构性劣势——逐片概率求和天然比 3D 概率积分粗糙。

5.7 排名稳定性:500 次 bootstrap

论文对测试病例做 500 次有放回重采样、逐次重排名:MedIG 在 DSC 与置信度上几乎锁死第 1(最大气泡稳定压在 rank 1);CAI4CAI 与 PredictED 稳定垫底;BreizhSeg/BCNAIM 在 ECE 与 CRPS 上的"最常排名"与"中位排名"错位——排名分布偏斜,说明第 3-6 名之间的次序对采样波动敏感。给排行榜使用者的提示:第一名可信,中间名次请带置信区间引用。

5.8 定性案例:所有模型都漏掉的那颗肾

论文的分析节选了一个 C 组测试病例(肾形态异常):10 个算法全部未能分割出其中一颗肾——只有 PrAEcision(外部数据最多:WORD+AMOS+TS+AbdomenCT-1K)以较高置信度部分检出,BreizhSeg(TS 预训练)次之,PredictED(ImageNet 编码器)只有微弱置信,而 BCNAIM(AbdomenAtlas-8K 预训练)因重度后处理把低置信区域清零而彻底漏检。结论被论文反复强调:外部数据多样性与预训练知识是对抗解剖变异(分布外)的主要武器——在 20 例小训练集上过拟合共识区的模型,遇到"书上没有"的解剖就集体失语。

这个案例还有一个常被忽略的细节:四支队伍(PrAEcision/DLAI/CAI4CAI/PredictED)的预测图在整幅图上都有非零概率值——概率图从不"完全归零"会系统性推高体积估计(CRPS 变差),而重度后处理清零又会杀死异常检出的微弱信号。"不清零"与"清零"各踩一个坑,概率图的校准与后处理策略是真正需要精调的自由度。

5.9 指标相关性:四把尺子不冗余

CBM 论文 Figure 3 的成对散点分析给出三组关系:

  • DSC 与置信度正相关:分得准的模型对自己的输出更自信——相关性最强的一对,说明在"大而稳定"的器官任务上两者部分冗余;但对更小更碎的结构(肿瘤)就未必,届时两者会解耦。
  • ECE 与 DSC 几乎无关:ECE 在整个 DSC 区间都保持低位——分割准不等于校准好是伪命题,分割准通常校准也不差(本任务上);ECE 的区分度来自"谁更准"的尾部。
  • ECE 与 CRPS 相关:更好的校准伴随更好的概率体积估计——两者都消费概率图的校准质量,这也解释了 BCNAIM 的例外为何扎眼(CRPS 第二、ECE 第六)。

论文据此主张四指标互补不冗余——对评测设计者的启示:给分割挑战加校准维度时,选"消费概率图的不同侧面"的指标组合(体素校准/分区置信/体积分布),比堆同类指标更有信息量。

§6 获取与许可:一个 DOI 迷宫的走法

6.1 版本谱系:认准 v3

版本 发布 Zenodo 内容 状态
v1 2024-04-16 10.5281/zenodo.10979641(页面渲染 record 10979642) 挑战启动 deposit 勿用——作者自曝存在损坏元数据实例,已在新版修复
v1.0.1 2024-07 10.5281/zenodo.12687192 training_set.zip 6.3 GB(挑战期修订) 历史版本
v3 2024-09 10.5281/zenodo.13767408(Sci Data 正文口径);同一内容亦见 records/11147559(Sci Data 参考文献口径) 全量三包 29.4 GB:train 6.3 + val 1.6 + test 21.6 复现请用这个

v3 的三个文件与 MD5(Zenodo 页原文):testing_set.zip 21.6 GB(a71189cb65c2f6cb35a2151f2ec97b8f)、training_set.zip 6.3 GB(758348f777f15bc65be16732b4397932)、validation_set.zip 1.6 GB(895dd039ae03698d34734c28d327493a)。下载后先验 MD5 再解压——29.4 GB 的体数据坏一半是灾难级返工。

版本号跳变说明:v1 → v1.0.1 → v3,没有 v2——v1.0.1 只是训练集补丁,v3 才是全量重发;版本语义与文件构成对得上,不是数据丢失。

6.2 入口清单

资产 入口 状态
数据(v3 全量) zenodo.org/records/13767408 或 /records/11147559 公开直链,无需注册
挑战平台 curvas.grand-challenge.org 全部 phase 已关闭,页面存档可读
评估+baseline 代码 github.com/SYCAI-Technologies/curvas-challenge 含 CURVAS_2024 与 CURVAS-PDACVI_2025 两届
结果论文 doi.org/10.1016/j.compbiomed.2025.111024(CBM 197:111024);arXiv 2505.08685 订阅刊(arXiv/HAL 有开放版本)
数据论文 doi.org/10.1038/s41597-025-06473-9(Sci Data 13:156) 开放获取(CC BY-NC-ND)
主办方页面 sycaimedical.com/challenge 商业公司主页

6.3 许可细读:三件资产三套规则

  • 数据:CC BY-NC——署名+非商业。Zenodo v3 页明文:“If the dataset wants to be used for commercial purposes, please contact m.riera@sycaitechnologies.com”。NC 边界内的再分发、微调、论文发表都可自由进行。
  • 代码:GitHub README 写"CC-BY-NC-SA"(非商业+相同方式共享),而 Sci Data 论文 Code availability 写"CC BY-NC"——两处口径差一个 SA(坑 5)。严格起见:评估代码按更严格的 CC-BY-NC-SA 对待,衍生代码建议继续开源。
  • 论文:Sci Data 数据论文 CC BY-NC-ND(可转不可改不可商用);CBM 结果论文为 Elsevier 订阅刊,但同一论文存在三个开放版本各带不同许可——arXiv 版内嵌 CC BY-NC-SA 4.0、HAL 存档版 CC BY 4.0、UCL Discovery 存 author accepted manuscript——引用正文请认准你看的哪个版本(附录 H 有对照表)。

6.4 AI-Ready 评估:DAIMS 简评

维度 评分(1-10) 一句话依据
D 可发现性 8 Zenodo+Grand Challenge+两篇论文四入口;扣分:检索词"curvas"撞西语普通词(坑 3)
A 可获取性 9 v3 全量公开直链、无需注册;扣分:29.4 GB 一次性下载、无镜像
I 可互操作 8 NIfTI 标准格式+每例四文件结构+整数标签;扣分:无 CSV/JSON 元数据表,人口学只在论文里
M 元数据质量 7 采集参数/协议/准则公开得罕见地细;扣分:版本 DOI 双口径+测试集例数双口径(坑 1/2)
S 可持续性 7 Zenodo+GitHub+商业公司(Sycai)三重依托,已有第二届;扣分:单中心单厂商数据不可再生
综合 7.8/10(中上) 获取性接近满分的"好下载"数据集;失分集中在元数据一致性

6.5 下载后检验清单

  1. 验 MD5:三个 zip 对照 §6.1 三个值(md5sum 即可)。
  2. 验目录结构:解压后应有 training_set/validation_set/testing_set 三个顶层目录;子目录名 UKCHLLXXX 格式。
  3. 验文件齐全:每例 4 个 .nii.gz(image + annotation_1/2/3);用 nibabel 抽查 shape 与 dtype。
  4. 验标签值域:annotation 的唯一值应为 {0,1,2,3}——出现其他值说明拿错版本或解压损坏。
  5. 验划分数量:train 20 / val 5 / test 65(附录 J 决策树)。
  6. 记录版本 DOI:实验记录里写死"Zenodo v3, 10.5281/zenodo.13767408"——未来 v4 出现时你的结果仍可追溯。

6.6 网络获取实操提示

  • Zenodo 在部分网络环境下直连不稳定(本条目生产时即遇到 API 直连失败、页面可访问的混合状况)——备选路径:走 DOI 解析(doi.org 会跳转)、或换网络出口重试;Zenodo 无官方国内镜像。
  • 29.4 GB 三个 zip 支持断点续传(HTTP Range),用 wget -c 或 curl -C - 均可;不要用浏览器下大文件。
  • GitHub 仓库可直接 clone 或下 zip;评估代码依赖 MONAI/PyTorch 系,requirements 以仓库内为准。
  • Sci Data 论文若遇到反爬拦截(Cloudflare 类"Client Challenge"),PubMed(PMID 41513702)有完整摘要与链接,DOAJ 有元数据镜像;正文获取走 doi.org 跳转通常可过。
  • CBM 订阅版的开放替代:arXiv 2505.08685(内容与刊出版基本一致)与 HAL hal-05263956(CC BY 4.0,最宽松)。

5.10 平台机制:容器化提交为什么重要

CURVAS 托管在 Grand Challenge 平台(DIAG 荷兰团队运营的医学影像挑战赛基础设施),这套机制本身就是评测可信度的一部分:

  • 算法即容器:参赛者上传 Docker 容器而非结果文件——主办方数据永不出库,评估在平台侧沙箱执行。这从机制上消灭了"把测试集带回家调参"的泄漏路径,也是 CURVAS 敢把 B/C 组全压测试集的底气。
  • 同环境推理:所有队伍的推理在相同平台约束下执行(时限/存储),PrAEcision 降级 lowres、MedIG 清零小概率值都是在这个约束下的真实工程决策——榜单分数因此包含"工程可行性"维度,而不只是"实验室精度"。
  • 概率图输出:与多数只收二值 mask 的挑战赛不同,CURVAS 要求概率输出(cECE/CRPS/置信度都消费概率图)——平台侧的评估代码(GitHub 开源)直接读取多通道概率。想自己复现评估协议的团队,这份代码就是标准答案。
  • 阶段门控:训练/验证/测试三阶段分别开放数据访问权限,验证集反馈有限次提交——过拟合验证集的空间被压缩。

对挑战赛设计者的抄作业清单:容器化+数据隔离+概率输出+有限反馈,四件套缺一不可——少了容器化,多 rater 评估的防作弊成本会高到不可行;少了概率输出,校准维度根本无从谈起。

§7 生态与影响:一届挑战、两篇论文、一个续集

7.1 产出三件套与发表矩阵

产出 载体 时间 角色
数据集 Zenodo(v1→v1.0.1→v3) 2024-04 至 2024-09 本体
结果论文 Comput Biol Med 197(Pt B):111024(arXiv 2505.08685) 2025-10 挑战协议+七队战况+方法学结论
数据论文 Scientific Data 13:156(PMID 41513702) 2026-01 卷期 队列描述+标注一致性分析
代码 GitHub SYCAI-Technologies/curvas-challenge 2024-03 至 2025-06 评估指标+baseline

结果论文 32 位作者横跨 7 国 13 家机构(Sycai/UPF/UKER/FAU、深圳先进院 SIAT-CAS、国科大、帝国理工、UCL、KCL、巴塞罗那大学、雷恩第一大学、爱丁堡大学等)——前五名队伍按约加入 CURVAS 联盟并署名,这是"挑战赛换联盟署名"模式的实例。从投稿节奏看:CBM 结果论文 2025-05 上 arXiv、2025-08 提交 Elsevier、2025-10 刊出;Sci Data 数据论文拖到 2026-01 卷期——两篇论文相差约一个季度,引用时要分清哪个数字出自哪篇(结果=CBM,队列/一致性=Sci Data)。

7.2 第二届:CURVAS-PDACVI(MICCAI 2025)

GitHub 仓库 2025 年 6 月重构为多届集中管理,第二届 CURVAS-PDACVI 转向胰腺导管腺癌(PDAC)与血管侵犯(VI),目标结构换成 PORTA/AORTA/SMV/SMA/CELIAC TRUNK(门静脉、腹主动脉、肠系膜上静脉、肠系膜上动脉、腹腔干)。从"三器官稳态解剖"到"癌症血管侵犯"——任务从校准方法学演示转向肿瘤学临床决策的深水区,血缘清晰(同平台同主办方同代码库)。库内研究胰腺血管侵犯标注的检索者应把两届连读。

这个转向也反证了第一届的定位:PDAC 手术决策高度依赖"肿瘤与血管的位置关系",正是"边界歧义+置信度"生死攸关的场景——第一届练的"校准与不确定性"方法论,在第二届里从评测维度变成了任务本体。

7.3 资助与利益结构

  • 加泰罗尼亚政府 “Doctorats Industrials” 工业博士计划(AGAUR 2021-063,资助一作 Riera-Marín 在企业读博)
  • 西班牙科学与创新部 CPP2021-008364 公私合作项目(MCIN/AEI + NextGenerationEU/PRTR 欧盟复苏基金)
  • Sycai Technologies SL(巴塞罗那医学 AI 公司)自筹

注意商业背景:数据主办方 Sycai 是腹部影像 AI 公司,挑战赛同时是其学术品牌工程——数据集本身公开(CC BY-NC)无碍,但解读"主办方结论"时知道谁出钱总是有益的。利益冲突声明方面,Sci Data 论文的 competing interests 一栏列出团队成员有 Siemens Healthineers AG、Bayer AG、Brainlab AG 的 speakers bureau 关系——与单 SIEMENS 采购的采集环境对照阅读更有信息量。

7.4 在多 rater 分割景观中的位置

数据集 模态 标注者/例 维度 与 CURVAS 的关系
QUBIQ(2020-21 挑战) MR/CT 混合 多位 2D 为主 思想前驱:不确定性量化挑战;CURVAS 补上 3D
LIDC-IDRI 胸部 CT 4 位放射科医师 3D(结节) 多 rater 经典但仅限肺结节;CURVAS 扩到多器官
Jensen et al. 3D 数据集 非人数据 3 位 3D Sci Data 原文引用——有 3D 多 rater 但非人
LNDb 胸部 CT 多位放射科医师 3D(结节) 肺结节多 rater 同类
CURVAS(本条目) 腹部 CT 3 位 3D 多器官 3D 多 rater 多器官+校准评估的首个系统化落地

Sci Data 论文的自我定位原话:2D 多标注数据集已有一些(主要在眼底),3D 因标注成本高而稀缺;QUBIQ 把不确定性量化带进了医学影像但"2D 为主的聚焦限制了其应用于更复杂 3D 场景"——CURVAS 的差异化就是"3D+多器官+校准三件套"。

7.5 引用景观:两篇论文的数据集地图

Sci Data 与 CBM 的参考文献列表本身就是一张"腹部分割数据集关系网",与库内条目对照:

论文引用 库内条目 关系
TotalSegmentator(Wasserthal 2023) rid 422 预标注引擎(双向最深关联)
nnU-Net(Isensee 2021) —(方法学条目) 七队中三队的骨干框架
AMOS(Ji 2022) rid 76 PrAEcision 外部训练数据
AbdomenCT-1K(Ma 2022) rid 402 PrAEcision 外部训练数据
WORD(Luo 2022) rid 412 PrAEcision 外部训练数据
AbdomenAtlas —(未收录) BCNAIM 预训练来源(8K 版)
LiTS(Bilic 2023) —(未收录) 肝肿瘤分割基准,肝细则文献源
QUBIQ(Menze 2021) —(未收录) 多 rater 不确定性挑战前驱
LIDC-IDRI(Armato 2015) —(未收录) 多 rater 结肠/结节标注经典
SLIVER/Heimann 2009 —(sliver07 rid 347 同族) 肝分割细则文献源
Rädsch 2023(NMI) —(方法学文献) 标注指令重要性的实证依据

检索建议:从 CURVAS 出发找"更多标注"的路线图,就是把这张表从上到下走一遍;反过来,研究 QUBIQ/LIDC 的人想找 3D 多器官落点,CURVAS 是文献里最常被指去的下一站。

§8 方法学启示:五条可迁移的经验

8.1 "非单一金标准"是可执行协议,不是口号

CURVAS 把"金标准是分布"翻译成了三步算术:共识区/分歧区划分 → 指标在哪个区算什么 → 排名合成。任何有多标注的团队都可以直接搬这套协议(评估代码在 GitHub)。它的实际效果是改变了"误差"的定义:模型在三位医师分歧处给出低置信预测,不再被计为错误——这让 leaderboard 分数第一次与"临床可信赖"发生正确方向的关联。论文讨论节的原话值得抄录在案:“non-golden standard ground truths 的概念需要在技术界与医学界都被更广泛接受”——数据集工程是推动这种共识的最短路径。

8.2 校准要"对标注分布"校准,不是对融合标签

cECE 的多 rater 设计(对 3 份标注分别算再平均)是本挑战对校准文献的具体增量:对融合后的单金标准校准良好的模型,可能对每份原始标注都校准不佳。这个思路可以直接迁移到任何多 rater 评测——包括库内多标注者条目的改造。反过来也别走极端:三份标注等权平均隐含"三位医师同等可信"的假设,若有资质分层信息,加权方案是未来的改进空间(论文未讨论,此为本条目的分析性意见)。

8.3 小训练集+分布外测试是更诚实的挑战赛设计

20 例训练集是"苦心设计的贫困":它复现了真实临床 AI 的处境(数据永远不够),并让"外部数据/预训练 vs 集体漏检异常肾"的对比自然发生。结果论文的核心教训之一——没见过大世界的模型会在异常解剖上给出自信的错误——正是这一设计的产物。挑战赛设计者抄作业点:把 B/C 组全藏进测试集且不公布分组;用 bootstrap 报排名稳定性而不是只报一个名次。

8.4 一致性分析应该随数据一起发表

Sci Data 论文把 DSC/Hausdorff/Cohen’s κ/Fleiss’ κ 四件套的一致性分析作为数据论文的主体——意味着使用者拿到数据的同时拿到了"金标准的可靠性说明书"。对照多数数据集"只发数据不发标注质量"的惯例,这份说明书让下游可以在知情的情况下解释模型分数(尤其胰腺)。同时保留已知错误并明文告知(训练集 2 例),比默默清洗更诚实。

8.5 标注经济学:3×90 全例标注怎么变可行

全例三标注的经济账过去没人敢算——3D 逐层手画一个腹部 CT 的大器官要小时级人工,乘 3 位医师乘 90 例就是数百小时。CURVAS 的解法是"预标注修正制":TS 打底把任务从"画"降级为"改",医师修正的边际成本大幅下降;书面细则把"想"的成本前置(准则一次制定、三人复用);准则复核者不落笔,避免返工。三件事合起来,才让"标注分布"这个奢侈的想法在 90 例上落地。给标注管理者的启示:多 rater 标注的瓶颈不是人数而是单位成本——先用自动预标注压成本、再书面化细则压返工,三标注才在预算内。这套账对库内任何考虑"多标注者升级"的条目(如单标注腹部数据集)都适用。

§9 与库内条目的关系

9.1 直接引用关系(论文点名的库内条目)

  • TotalSegmentator(rid 422):双向最深的关联。CURVAS 标注流水线以 TS 生成预标注(§3.1);BreizhSeg 直接在 TS 权重上微调+ABNN;CBM 论文明引 Wasserthal 2023。研究 TS 的人应看 CURVAS 如何把 TS 当作"共识起点"与"预训练底座"双重角色。
  • AMOS(rid 76):PrAEcision 的外部训练数据之一(CBM Table 1 明写 Amos)。CURVAS 的标签体系与 AMOS 不同(坑 6),跨库迁移需重映射。
  • AbdomenCT-1K(rid 402):同为 PrAEcision 外部数据;AbdomenCT-1K 的"腹部分割是否已解决"之问恰好被 CURVAS 用 90 例×3 标注者给了个刁钻回答——大模型在大器官上 Dice 很高,但异常解剖仍会集体翻车。
  • WORD(rid 412):PrAEcision 外部数据之一;WORD 的 16 器官全腹标注与 CURVAS 三器官是"广谱 vs 深潜"的互补。
  • FLARE(rid 387):同为 MICCAI 系腹部多器官分割挑战赛,路线对照——FLARE 走大规模多中心单标注,CURVAS 走小队列多标注者+校准;两份评估哲学合读正好覆盖"泛化"与"可靠"两个维度。
  • BTCV(rid 377):腹部多器官分割的经典起点基准,CURVAS 的对比背景板。

9.2 任务家族对照

  • segthor(rid 439):胸腹部器官(心脏/主动脉/食管/气管)分割挑战——与 CURVAS 共享"共识化评估"的方法学语境。
  • chaos(rid 337):CT/MR 腹部器官(肝/肾)分割老牌挑战——CURVAS 的"门静脉期增强 CT 肝肾"任务与之最接近,但 CHAOS 无多 rater。
  • sliver07(rid 347):肝分割经典挑战——CURVAS 肝脏细则(凸包规则等)即承继此类肝分割文献约定。

9.3 检索路径建议

  • 检索词组合:“CURVAS”+“grand-challenge” 或 “CURVAS”+Erlangen——裸搜 “curvas” 会撞上西语"曲线"与大量无关结果(坑 3)。
  • 要下数据:认准 Zenodo v3(13767408 或 11147559 皆可达)→ 三个 zip 验 MD5。
  • 要对标成绩:CBM 论文 Table 2(本条目 §5.5 已全转)+ Table 3/4 分组数字(§5.6 已全转);勿引博客转述数字。
  • 要做胰腺多 rater 研究:Sci Data 论文 + 本条目 §4;注意论文无胰腺一致性数值表(坑 9)。

§10 避坑清单:九个已确认的坑

坑 1:版本-DOI 迷宫。Zenodo 上 CURVAS 有两个 deposit 系列三版:v1(10979641/10979642,2024-04,挑战启动版,含损坏元数据)、v1.0.1(12687192,2024-07)、v3(2024-09 全量)。v3 本身有两个 DOI:13767408(Sci Data 正文引)与 11147559(Sci Data 参考文献引,records/11147559 页面渲染的就是 v3 内容)。引用与下载一律认版本号"v3"+验证 29.4 GB 三包。

坑 2:测试集 Group B 例数双口径。Zenodo v3 页:test=65(20A+22B+23C);CBM 论文 §2.2.3:20A+17B+23C(=60)。总数守恒(90=20+5+65)与 B 组总数(22)支持 Zenodo 口径,论文数字疑笔误。转引测试集构成用 20+22+23。

坑 3:检索词撞车。"CURVAS"是西语/拉丁语系普通词(“曲线”),裸搜噪声极大;且与校准文献的"calibration curve"短语纠缠。有效检索:CURVAS + MICCAI 2024 / Erlangen / grand-challenge,或直接用 DOI 与 GitHub 定位。

坑 4:别把校准文献全家桶套上去。CURVAS 的校准评估=cECE(多 rater ECE)+Cseg 置信度,体积=CRPS;没有 NLL、没有 Brier、没有可靠图。方向性综述里"CURVAS 报告了校准曲线"之类的表述不成立;写方法对照时按四指标口径。

坑 5:代码许可双口径。GitHub README 写 CC-BY-NC-SA,Sci Data 论文写 CC BY-NC。差一个"相同方式共享"条款。稳妥做法:按 CC-BY-NC-SA 对待、衍生开源;商用一律联系作者。

坑 6:标签顺序与库内腹部数据集不通用。CURVAS:0 背景/1 胰腺/2 肾/3 肝。与 BTCV(脾=1、肝=6 等)、AMOS、AbdomenCT-1K 等全不同。跨库联合训练时逐库重写标签映射,nnU-Net 的 dataset.json 别复制粘贴(附录 E 对照表)。

坑 7:v1 有损坏元数据。结果论文 §5.3 自曝:“In the initial version of the dataset published on Zenodo, a few instances of corrupted metadata were identified…promptly detected and corrected”。用 v1 复现会踩雷——一律用 v3 并验 MD5(§6.1)。

坑 8:训练集里有两个"故意保留"的标注错误。组织方明确不修正(“日常实践就有人为错误”)。做训练集一致性统计会撞上 2 个洗不掉的离群值——不是你的 bug。清洗前先读 Sci Data 对应段落。

坑 9:胰腺一致性没有数值表。Sci Data 的一致性结论(胰腺最难、B 组最分歧、C 组反而高一致)全部以箱线图呈现,论文未提供具体均值。条目与二手引用只能写定性方向,编造"胰腺医师间 Dice=XX"是事故。

§11 总结

11.1 三句话总结

  1. CURVAS 用 90 例×3 位医师的标注矩阵把腹部 CT 分割的金标准从"单一 mask"升级为"标注分布",并以共识区/分歧区分离的评测协议把它变成可执行的排行榜规则。
  2. 七队十算法的战况给出两条可迁移结论:分割最准的模型校准最好;外部数据与预训练是对抗解剖变异(分布外)的主要武器——20 例小训练集正是为暴露这一点而设计。
  3. 数据(Zenodo v3,29.4 GB,CC BY-NC)、评估代码(GitHub)、协议论文(CBM 2025)、一致性说明书(Sci Data 2026)四件套齐备,是库内可复现度最高的多 rater 3D 基准。

11.2 适合谁

  • 做不确定性量化/校准研究的团队:现成的 3D 多 rater 评估场,cECE/CRPS 协议可直接对标。
  • 腹部多器官分割团队:把"医师互标分数"引入你模型的误差解释框架——胰腺分数的天花板终于有了参照系。
  • 挑战赛设计者:共识/分歧区协议、隐藏分组的分布外测试、bootstrap 排名稳定性检验,三件都是可抄的作业。
  • 标注生产管理者:书面准则三重治理(§3.3)与"保留已知错误"政策(坑 8)是少见的成文范例。

11.3 不适合谁

  • 要大数据刷分割榜的团队:90 例(训练 20)是全库腹部分割数据集里的最小一档,用它做主训练集是误用——请配 AMOS/AbdomenCT-1K/WORD。
  • 要商用落地的管线:CC BY-NC 边界要逐案确认,联系 m.riera@sycaitechnologies.com。
  • 要跨中心多样性的泛化研究:单中心单厂商(全 SIEMENS)是硬约束,分布外只能算"分布内偏移"。

11.4 30 秒决策卡

你的情况 行动
想立刻跑通多 rater 评测 下 Zenodo v3 三包(验 MD5)→ GitHub 拉 curvas-challenge 评估代码
想训练一个像样的分割模型 CURVAS 20 例做微调/验证层,AMOS+AbdomenCT-1K+WORD 做主干训练(PrAEcision 配方,§5.4)
想报告校准性能 算 cECE(对 3 份标注分别算再平均)+Cseg+CRPS;别报 NLL(坑 4)
想解释胰腺分数低 先读 §4——医师互标的胰腺分歧就是天花板,引 Sci Data 定性结论
想设计下一届挑战赛 §5.1 时间线+§5.2 评估区+§5.7 bootstrap 三段连读
想商用 先解决 CC BY-NC 授权(§6.3),书面联系作者

7.6 对腹部 AI 商业化的一层含义

Sycai 主办挑战赛的商业逻辑值得点破:腹部多器官分割是腹部影像 AI 产品的地基(病灶检出、定量随访、报告生成都建立在"先找到器官"上),而产品要过 FDA/CE 与医院采购,"模型知道自己什么时候不确定"正在从加分项变成门槛项。CURVAS 做了三件对行业有外溢效应的事:

  1. 把校准变成可比的榜单维度——此前校准只在方法论论文里自说自话,没有跨模型可比的公开基准;CURVAS 给了 cECE/CRPS 的官方实现与首个多模型横评。
  2. 示范"标注分歧是资产"——对任何要建标注管线的公司,三标注矩阵的边际成本被预标注修正制压到可负担,且换来了传统单标注拿不到的校准监督信号。
  3. 输出了一套可白嫖的评测协议——CC BY-NC 的代码意味着同行(包括竞争公司)可以直接复用协议,行业里"分割精度+校准"双报的惯例被往前推了一步。

对使用者的提示:§7 的叙述基于论文与公开资料的商业背景推断(Sycai 是公司、资助结构公开),"商业逻辑"一段是本条目的分析性解读,非论文原文主张——引用时注意区分。

FAQ(高频问答 52 问)

A. 基础认知

Q1:CURVAS 是数据集还是挑战赛?
两者都是:一次 MICCAI 2024 挑战赛(Grand Challenge 平台),及其沉淀下来的公开数据集(Zenodo v3,90 例×3 标注)。通常说的"CURVAS 数据集"指挑战赛后全量公开的 29.4 GB 版本。

Q2:名字怎么拆?
Calibration and Uncertainty for multiRater Volume Assessment in multiorgan Segmentation——校准(C)与不确定性(U)用于多评估者(multiRater, R)体积评估(Volume Assessment, VA)的多器官(multiorgan, S)分割。文献里有"Multi-Rater"(带连字符)与"multiRater"两种展开,同一回事。

Q3:谁主办?
Sycai Technologies SL(巴塞罗那医学 AI 公司)牵头,联合庞培法布拉大学 BCN Medtech、埃尔朗根大学医院、Tecnalia(巴斯克研究联盟)、巴塞罗那大学 BCN-AIM/ICREA。数据出自埃尔朗根。

Q4:一篇还是两篇论文?
两篇:挑战结果论文(Comput Biol Med 2025;197:111024,arXiv 2505.08685)讲协议与战况;数据论文(Sci Data 2026;13:156)讲队列与标注一致性。另有 Zenodo 数据本体与 GitHub 代码。

Q5:一句话卖点?
金标准不再是单一 mask,而是三位医师的标注分布——模型在专家分歧处"自信的错误"第一次被评分规则抓住了。

Q6:和 QUBIQ 什么关系?
思想前驱与 3D 续作。QUBIQ(2020-21 挑战)开创多 rater 不确定性量化评测但以 2D 任务为主;CURVAS 把范式推进到 3D 多器官腹部 CT,并把"不确定性"细化为校准(cECE)+体积(CRPS)两条可排名的硬指标。

Q7:和 LIDC-IDRI 什么关系?
同一问题意识的不同解剖域。LIDC-IDRI 是胸部 CT 肺结节的多医师标注(4 位);CURVAS 是腹部 CT 多器官(3 位)。LIDC 的常规用法是 STAPLE/多数投票融合,CURVAS 则拒绝融合、保留分布。

Q8:最大的局限是什么?
单中心单厂商 90 例、训练集仅 20 例、每例 3 位标注者且共享同一预标注起点与同一准则——"标注分布"是窄分布。论文自曝数据规模是首要限制(§5.3 lessons learned)。

Q9:MICCAI 2024 会场在哪?
MICCAI 2024 年会于 2024 年 10 月举行,CURVAS 挑战专场在 10 月 10 日。论文只写"at the MICCAI Conference",未给城市信息,本条目不代填。

Q10:挑战赛的奖品是什么?
前三名现金奖;前三名受邀在 MICCAI 会场报告;前五名受邀加入 CURVAS 联盟并署名后续期刊论文(即 CBM 2025 的 32 人作者名单来源)。

B. 数据与获取

Q11:下哪个版本?
Zenodo v3(2024-09)。v1(2024-04)有作者自曝的损坏元数据;v1.0.1(2024-07)只有训练集。v3 三个 zip 共 29.4 GB:train 6.3 / val 1.6 / test 21.6。

Q12:v3 的 DOI 到底是哪个?
两个都能到:10.5281/zenodo.13767408(Sci Data 正文引)与 records/11147559(Sci Data 参考文献引,页面渲染同一内容)。引用时认准版本号 v3,DOI 选一个全程一致即可(坑 1)。

Q13:需要注册或申请吗?
数据不需要——Zenodo 直链。评估代码在 GitHub 直接 clone。商用需邮件 m.riera@sycaitechnologies.com(CC BY-NC)。

Q14:文件长什么样?
每例一个子目录(UKCHLLXXX 编号),4 个 NIfTI:image.nii.gz + annotation_1/2/3.nii.gz。标签 0=背景 1=胰腺 2=肾 3=肝。三个顶层目录对应 train/val/test。

Q15:下载后第一步做什么?
验 MD5(§6.1 三个值),再解压。29.4 GB 体数据半路损坏不是小概率事件,v1 的教训已经摆在前面。

Q16:A/B/C 分组信息在数据里能看出来吗?
数据文件本身不带分组标签;分组定义公开(A=45/B=22/C=23 及各自标准),每个测试病例归属赛后已随全量发布可对应。分组不是元数据字段,需要按病例编号对照论文/平台说明。

Q17:能拿它训练商用产品吗?
CC BY-NC 禁止未经授权的商业使用。研究、论文、内部验证无碍;商用先书面联系作者。代码同理(坑 5 双口径)。

Q18:数据是匿名的吗?
是——医院侧假名化+编码,患者身份映射只存在于医院 IP 内部,挑战参与者与合作者在任何时点都无法重识别。伦理批号 23-243-B,双重知情同意(研究专属+宽泛)。

C. 标注与一致性

Q19:三位医师是完全独立标注吗?
修正环节独立,但共享:同一套书面准则(一人定义两人复核)、同一个 TS 预标注起点。所以这不是"从零独立"的多标注,而是"受控独立"——分歧被约束在准则框架内,这是特性不是缺陷。

Q20:哪个器官分歧最大?
胰腺,尤其在 B 组(3-5 囊肿组)。肾与肝高度一致。反直觉的是最难的 C 组一致性反而高——作者归因于"医师对难组更仔细"(§4.2)。

Q21:有胰腺一致性的具体数字吗?
没有——Sci Data 只有箱线图。别引用二手文献里编的数字(坑 9)。

Q22:训练集里的 2 个错误是怎么回事?
两位医师标注的人为错误被组织方故意保留在训练集,明文理由是"呈现日常标注实践的真实性"。做一致性统计会撞上这两个离群值,别清洗(坑 8)。

Q23:TS 预标注会不会把三份标注"趋同化"?
会有这个结构效应:TS 画对的地方天然一致,画错的地方三医师各自独立发现。解读"高一致率"时要记得这个起点共享的偏置(§3.5)。

Q24:医师经验如何?
三位标注医师中一位是 MD PhD candidate(兼定义队列与准则),另两位的个体资历论文未披露;准则复核的两位临床医师有 2 年与 4 年腹部 CT 经验。三位医师的完整匿名化处理(R1/R2/R3)意味着无法按医师分层分析——这是多 rater 数据集常见的隐私取舍。

D. 挑战赛与复现

Q25:七队的完整方法哪里看?
CBM 论文 §3 与 Table 1(本条目 §5.4 与附录 G 已转);获胜队 MedIG 代码链接在挑战 GitHub。

Q26:排名怎么算的?
DSC/Cseg 降序、ECE/CRPS 升序各排一次,四名次取平均合成总分,越低越好。500 次 bootstrap 显示第一名(MedIG)稳定,中间名次(3-6)对采样敏感。

Q27:为什么 MedIG 用 STAPLE 融合还能拿校准第一?
器官大而稳定时,共识区做准=置信度自然对齐。教训:不确定性建模不是校准的唯一路径,"先做准再谈校准"在大器官任务上依然有效。BreizhSeg 的贝叶斯路线赢在 ECE 最小值,但 DSC 略逊。

Q28:外部数据到底多有用?
看 §5.8 的异常肾案例:外部数据最多的 PrAEcision 是唯一部分检出的队伍;未用外部数据的队全部漏检。20 例训练集就是为了逼出这个对比。

Q29:我想在 CURVAS 上训练,直接开训 20 例行吗?
能跑通但意义有限(欠采样严重)。配方建议:AMOS+AbdomenCT-1K+WORD 主干训练 → CURVAS 20 例微调 → test 65 例报数——这正是 PrAEcision 的路线(亚军)。

Q30:cECE 怎么算才对?
对三位医师的标注分别算 ECE 再等权平均——不是先融合标注再算一个 ECE。前者保留"对分布的校准",后者会人为压低误差。

Q31:CRPS 里的"高斯假设"合理吗?
三份标注只有 3 个体积样本,用(均值, 标准差)参数化高斯是对"标注分布"的最小假设建模——样本量决定了只能如此。它不是体积真分布的无偏估计,而是"医师分歧的平滑代理"。复现时照原文实现即可,别自行换成核密度估计去"改进"官方指标,否则结果与榜单不可比。

Q32:概率图提交有什么工程要求?
Grand Challenge 平台对推理时限与存储有限制:MedIG 把概率图 <1e-6 的值清零以省存储;BCNAIM 的重度后处理则把异常肾的低置信信号也清没了(§5.8)。概率图的稀疏化策略是真实的性能自由度,不是实现细节。

Q33:能在自己的论文里报 CURVAS 分数吗?
可以(CC BY-NC 允许学术使用)。注意主办方论文的发表纪律:参赛队自发表论文须引用主办方 CBM 论文;第三方研究引用 CBM+Sci Data 双篇最稳。

Q34:本条目后续会更新什么?
CURVAS-PDACVI 第二届结果论文发表后追加 §7.2 战况;若 Zenodo 出 v4 或数据许可变化则重写 §6;Grand Challenge 平台 phase 明细若有存档恢复则补时间线。

Q35:如果只记住一件事?
“分割的真值是一个分布,不是一张 mask”——CURVAS 用 90×3 的标注矩阵和一套共识/分歧评测协议,把这句话变成了排行榜上的数字。

E. 检索与引用

Q36:引用格式怎么写?
数据引 Zenodo v3(DOI 10.5281/zenodo.13767408,作者 Riera-Marín 等,2024);方法/战况引 CBM 2025;197:111024;队列/一致性引 Sci Data 2026;13:156。三处口径已在附录 H 列明,勿混。

Q37:为什么搜"CURVAS calibration curve"搜出一堆无关结果?
两个原因:CURVAS 是西语普通词(“曲线”);"calibration curve"在深度学习校准文献里另有含义且 CURVAS 并未使用可靠图(坑 3/4)。加限定词或直接用 DOI。

Q38:和库内哪个条目最像?
任务上最接近 chaos(CT 肝肾分割)与 flare(MICCAI 腹部多器官挑战赛);理念上最接近的多 rater 前辈(QUBIQ/LIDC-IDRI)库内暂无条目。定位差异见 §2.5 与 §7.4 两张对照表。

Q39:数据会更新吗?
已有更新史(v1→v1.0.1→v3),主办方仍在活跃维护(GitHub 2025-06 还有 commit、第二届已启动)。监控 Zenodo 概念页与 GitHub release 即可捕捉 v4。

Q40:这个条目的事实口径以什么为准?
以三源互证结果为准:Zenodo v3 页(数据/划分/许可)、CBM 论文(挑战协议/排名)、Sci Data 论文(队列/一致性)。凡两源冲突处(测试集 B 组、v3 DOI、代码许可),条目正文按更可靠口径写并在坑点存照——详见 FACTS.md 第 9 节。

F. 生产与工程

Q41: nnU-Net 直接喂 CURVAS 会有什么坑?
三个:标签字典要重写(1=胰腺,坑 6);训练集 20 例远低于 nnU-Net 自配置的舒适区(它默认假设千例级),建议关闭部分自调优或直接用 PrAEcision 的 lowres 配方;2 例故意保留的错误标签会以离群损失形式出现,别当 bug 修。

Q42:概率图怎么从 nnU-Net 里拿?
nnU-Net 的 softmax 输出即概率图,推理时跳过 argmax 阈值化直接导出四通道概率;MedIG 的做法是清零 <1e-6 的值再压缩。注意 GC 平台提交格式与本地复现的通道顺序(背景/胰腺/肾/肝)要对齐官方评估代码。

Q43:体积统计怎么算?
逐器官把标注二值化后乘体素体积(spacing 从 image 头文件读)即得;三份标注各算一次得到 μ±σ——这正是 CRPS 的 GT 端。附录 U 有批量骨架。

Q44:能拿 CURVAS 做域适应/联邦学习研究吗?
可以但要想清楚"域"在哪:单中心数据里,域差异只剩采集参数异质(§2.4 的准直/螺距范围)与病理负担(A/B/C)。跨中心域适应请配 AMOS/AbdomenCT-1K 等多中心库做源域,CURVAS 做目标域微调层。

Q45:评估代码的官方实现在哪?
GitHub 仓库 CURVAS_2024 子目录(metrics 与 baseline 训练代码);Sci Data 的标注质量评估部分是赛后补充的,也在同仓库。复现校准指标时以官方实现为准,附录 F 骨架只作快速理解用。

Q46:数据有没有已知的版权/再分发案例?
第三方论文与模型权重普遍在 CC BY-NC 边界内引用与使用;再分发整包数据不被许可禁止(BY-NC 允许再分发),但必须署名且不得商用。把 CURVAS 打包进商业产品则明确越界。

Q47:如何确认我下的是 v3 而不是旧版?
看三件事:文件数(三个 zip)、总大小(29.4 GB)、测试集存在(21.6 GB 包);v1.0.1 只有 training_set.zip 6.3 GB。另可在 Zenodo 页面右侧版本栏核对"Version v3"。

Q48:条目里"分析性推演"的段落能引用吗?
单独标注了(§2.8/§7.6/§8.2/附录 N),引用前请回溯一手来源或注明"据千方病案医数集条目分析"——它们不是论文结论。
Q49:为什么 CURVAS 只有三个器官,却叫 multiorgan?
相对"单器官"而言(肝分割、胰腺分割各自为战的时代),三器官同时分割在当年已属 multiorgan 语境;且三器官联合才谈得上"同一 CT 内多结构的相互校准"。与 AMOS 的 15 器官比是小,与单器官比是 multi。

Q50:训练集的 20 例选自 A 组,是怎么选的?
论文未披露 20 例的具体选择规则(随机/分层未说明),只说明"来自 A 组"。复现者不必纠结——数据本身已随 v3 公开,名单即答案。

Q51:CBM 论文与 arXiv 版内容有差异吗?
主体一致(arXiv v1 2025-05-13 → CBM 刊出 2025-10,arXiv v2 2025-10-14 同步);引用页码/表格请以 CBM 刊出版为准,arXiv 便于开放获取。HAL 存档版为作者接受稿。

Q52:怎么向库内报告本条目的错误?
先查 FACTS.md 第 9 节存照——已知的双口径问题(坑 1/2/5/9)都已记录;新发现的事实错误请附来源 URL 反馈至编辑部。


事实清单(硬事实 45 条)

  1. CURVAS=Calibration and Uncertainty for multiRater Volume Assessment in multiorgan Segmentation,MICCAI 2024 挑战赛。
  2. 数据:90 例前瞻性门静脉期增强腹部 CT,Universitätsklinikum Erlangen 单中心采集(2023-08~10),SIEMENS 扫描仪。
  3. 伦理批号 23-243-B;口头+书面双重知情同意(研究专属+宽泛);医院侧假名化编码。
  4. 患者构成:51 男(56.7%)/39 女(43.3%);37-94 岁,均值 65.7。
  5. 入组:门静脉期、0.6-1 mm 薄层、囊肿 ≤10 个且 <2.0 cm;显著伪影/配准不全排除。
  6. 采集参数:Br40 软核、转速 0.25/0.5 s、准直 128×0.6 单源与 98×0.6×2/144×0.4×2 双源、螺距 0.3-1.3、参考管电流 200 mAs(可调 120)、对比剂 Iomeprol 350 3-4 mL/s、400 mgI/kg(≈1.14 mL/kg)。
  7. CT 为住院期间胸腹联合扫描截取,非为数据集专门扫描。
  8. 标注:每例 3 位放射科医师(R1/R2/R3)独立修正 TotalSegmentator 预标注并补漏。
  9. 准则治理:MD PhD candidate 定义队列与实质判定准则→2 位临床医师(腹部 CT 经验 2 年/4 年)复核准则但不标注。
  10. 器官细则:肝含内部结构/门静脉主干及两大分支排除/胆囊排除/病理性扩张胆管纳入/凸包规则;肾含实质+髓质/肾盂输尿管排除;胰腺全走行/不分头体尾/脾静脉与肠系膜静脉排除。
  11. 肝细则承继 Heimann 2009(SLIVER 系)约定;准则治理引 Rädsch 2023(Nat Mach Intell)。
  12. 标签编码:0=背景、1=胰腺、2=肾、3=肝;NIfTI .nii.gz;每例 4 文件;案例目录 UKCHLLXXX。
  13. 分组:A=45(≤2 囊肿无轮廓改变病变)/B=22(3-5 囊肿)/C=23(6-10 囊肿+肝转移、肾积水、肾上腺转移、肾缺如等)。
  14. 划分:train 20(A 组)/val 5(A 组)/test 65(20A+22B+23C,Zenodo 口径;CBM 论文写 17B——双口径存照)。
  15. v3 文件:testing_set.zip 21.6 GB(md5 a71189cb65c2f6cb35a2151f2ec97b8f)+training_set.zip 6.3 GB(md5 758348f777f15bc65be16732b4397932)+validation_set.zip 1.6 GB(md5 895dd039ae03698d34734c28d327493a)=29.4 GB。
  16. 版本谱系:v1(10979641/10979642,2024-04-16)→v1.0.1(12687192,2024-07)→v3(2024-09;DOI 13767408 与 11147559 双口径);无 v2。
  17. v1 存在损坏元数据实例(CBM §5.3 作者自曝,已在新版修复)。
  18. 许可:数据 CC BY-NC;商用联系 m.riera@sycaitechnologies.com。
  19. 代码许可双口径:GitHub README CC-BY-NC-SA vs Sci Data 正文 CC BY-NC。
  20. 挑战时间线:2024-04-16 启动→5-8 月训练期→2024-09-07 提交截止→2024-10-10 MICCAI 专场。
  21. 参赛:7 队 10 算法(MedIG/PrAEcision/BreizhSeg 各 2 个),全部 U-Net 系。
  22. 评估区三分:共识前景(FN 只在此计)/共识背景(FP 只在此计)/分歧区(豁免出 DSC)。
  23. 指标:DSC、Cseg=((1−CB)+CF)/2、cECE(对 3 份标注分别算再平均)、CRPS(3 医师体积高斯 CDF vs 预测体积 Heaviside);无 NLL/Brier/可靠图。
  24. 排名:四指标名次平均;500 次 bootstrap 稳定性检验。
  25. 总榜:MedIG 第一(DSC 94.57%/Conf 97.87%/ECE 1.82e-3/CRPS 8.108)、PrAEcision 第二(93.29/97.18/2.22/10.438)、BreizhSeg 第三(92.60/97.17/1.61/12.326)。
  26. ECE 最优:BreizhSeg 1.61e-3(ABNN 贝叶斯化,20 次训练);CRPS 第二:BCNAIM 9.727(但 ECE 第六)。
  27. 垫底:CAI4CAI DSC 84.98(唯一显式加校准损失 ACE 的队);PredictED CRPS 25.895(2D 训练劣势)。
  28. 分组趋势:DSC/CRPS 呈 B 优于 A、C 最差;MedIG 分组 DSC 96.51/97.00/90.55;BreizhSeg ECE 1.19/1.15/2.42,C 组被 MedIG 反超。
  29. 外部数据四队:PrAEcision(WORD+AMOS+TS+AbdomenCT-1K)、BreizhSeg(TS 预训练)、BCNAIM(AbdomenAtlas-8K)、PredictED(ImageNet 编码器)。
  30. 定性案例:C 组异常肾 10 算法全部漏检,仅 PrAEcision 部分检出;BCNAIM 因重度后处理清零低置信区。
  31. 概率图工程约束:MedIG 对 <1e-6 概率值清零省存储;PrAEcision 为满足推理时限选 3D lowres。
  32. 指标相关性:DSC-Conf 正相关最强;ECE 与 DSC 几乎无关;ECE-CRPS 相关。
  33. 一致性工具:DSC+Hausdorff+Cohen’s κ(两两)+Fleiss’ κ(多 rater);κ 的体素化二分类用法引 Rahman et al.。
  34. 一致性结论:肾/肝高度一致;胰腺分歧最大(B 组最甚);C 组一致性反而高于 A/B;大器官边界分歧要靠 Hausdorff 才看得见。
  35. 训练集 2 例人为标注错误被故意保留(Sci Data 与 CBM 双源)。
  36. Sci Data 讨论节"five expert annotations"为笔误(实为 3 位)。
  37. 核心结论:分割最准的模型校准最好(DSC-Conf 正相关、ECE-CRPS 相关)。
  38. 结果论文:Comput Biol Med 2025;197(Pt B):111024,doi 10.1016/j.compbiomed.2025.111024,PMID 40934552;arXiv 2505.08685(v1 2025-05-13,v2 2025-10-14)。
  39. 数据论文:Scientific Data 2026;13:156,doi 10.1038/s41597-025-06473-9,PMID 41513702,CC BY-NC-ND。
  40. 结果论文 32 作者 7 国 13 机构;前五名队伍加入 CURVAS 联盟署名;HAL 存档版 CC BY 4.0。
  41. 资助:AGAUR 2021-063 工业博士(一作 Riera-Marín)、Sycai Technologies SL、CPP2021-008364(MCIN/AEI+NextGenerationEU/PRTR)。
  42. Sci Data 利益冲突声明:团队成员有 Siemens Healthineers/Bayer/Brainlab speakers bureau 关系。
  43. 第二届 CURVAS-PDACVI(MICCAI 2025):PDAC+血管侵犯,目标 PORTA/AORTA/SMV/SMA/CELIAC TRUNK。
  44. GitHub SYCAI-Technologies/curvas-challenge(2024-03-18 initial commit,2025-06-27 最后 commit),含两届目录与评估/baseline 代码。
  45. 库内互链(rid 已 SQL 核实 2026-09-27):totalsegmentator 422/amos 76/abdomenct-1k 402/word 412/flare 387/btcv 377/segthor 439/chaos 337/sliver07 347。

术语表(35 条)

术语 释义
多评估者标注(multi-rater annotation) 同一影像由多位专家独立标注;CURVAS 每例 3 份
观察者间变异(inter-rater variability) 专家间对边界/分级判断的差异;CURVAS 的研究主对象
金标准分布 把"真值"理解为标注集合的分布而非单一 mask
consensus(共识区) 三位医师意见一致的体素区(前景或背景)
dissensus(分歧区) 至少一位医师意见不同的体素区
STAPLE 同时真值与性能水平估计算法:以灵敏度/特异度迭代估计融合标注;MedIG 采用
多数投票(majority voting) 逐体素取多数意见的融合法;PredictED 采用
标签平滑(label smoothing) 把硬标签软化的训练技巧;CURVAS 立场:会抹掉分歧信息
SVLS Spatially Varying Label Smoothing,按空间分布软化的标签;Sci Data 引作未来方向
DSC Dice 相似系数,分割重叠度指标
Hausdorff 距离 两个边界集合间的最大最近距离,边界一致性指标
Cohen’s κ 两位标注者的一致性系数(扣随机一致)
Fleiss’ κ 多位标注者一致性的 κ 推广
偶然不确定性(aleatoric uncertainty) 数据固有歧义导致的不可约不确定性;标注分歧是其直接观测量
置信度(confidence) 模型 softmax 最大概率;CURVAS 的不确定性代理
Cseg 共识区分割置信度=((1−CB)+CF)/2
ECE 期望校准误差:分箱比较置信度与准确率
cECE CURVAS 的多 rater ECE:对 3 份标注分别计算再平均
校准(calibration) 置信度与实际正确率的对齐程度;过自信/欠自信皆失准
CRPS 连续排名概率分数:预测分布与真值分布(CDF)间的平方差积分
Heaviside 函数 阶跃函数;CRPS 中表示"预测体积点"的退化 CDF
体积生物标志物(volume biomarker) 器官/病变体积作为临床指标;CURVAS 名字里的 VA
ABNN Adaptable Bayesian Neural Network:归一化层参数贝叶斯化;BreizhSeg 采用
ACE(soft-binned) Average Calibration Error 损失,软分箱加权;CAI4CAI 采用
xLSTM-UNet Vision-LSTM 骨干的 UNet 变体+窗口交叉注意力;DLAI 采用
TotalSegmentator(TS) 全身 104+ 结构自动分割模型;CURVAS 预标注引擎
AbdomenAtlas 大规模腹部分割数据集/模型仓库;BCNAIM 的预训练来源(8K 版)
分布外(OOD) 测试分布偏离训练分布;CURVAS 的 C 组与异常解剖案例即天然 OOD
Grand Challenge 医学影像挑战赛托管平台,容器化提交+隔离评估,CURVAS 载体
Zenodo CERN 运营的开放知识库;CURVAS 数据本体(v3=最终版)
门静脉期(portal venous phase) 对比增强 CT 的延迟期相之一,腹部实质器官对比最佳,CURVAS 统一期相
Br40 SIEMENS 腹部软组织重建核;采集参数一致性的锚点
Iomeprol 碘美普尔,非离子型碘对比剂;CURVAS 用 350 mgI/mL 制剂
UKCHLLXXX CURVAS 案例子目录命名格式(XXX 为病例编号)
排名 bootstrap 对测试集有放回重采样后重算排名的稳定性检验;500 次为 CURVAS 口径

写作口径声明

本条目在事实与解读之间划了三条线,供审校与读者校准信任粒度:

  1. 硬事实(90 例、划分、指标值、排名、许可、DOI)全部出自三源互证的一手材料:Zenodo v3 记录页、CBM 论文(arXiv PDF 全文解析)、Sci Data 论文(官网正文抓取),辅以 Grand Challenge 平台页、GitHub 仓库与 DOAJ/PubMed/HAL/UCL Discovery 等注册机构元数据。凡单一来源的数字已在附录 C 标注"唯一来源"。
  2. 双口径冲突(测试集 B 组例数、v3 DOI、代码许可 SA)不取一致化处理,而是"按更可靠口径写正文+坑点存照",保证读者能还原冲突现场。
  3. 分析性解读(如 §7.6 商业逻辑、§2.8 分歧体素图作为监督信号、§8.2 加权方案的改进空间、附录 N 判分推演)均在原位标明"本条目的分析性推演/解读",不与论文结论混排。引用本条目时,分析段请二次溯源后再用。

时效性:全部网络核验完成于 2026-09-27;CURVAS 生态仍在活跃演化(第二届已启动、GitHub 仍有维护),后续数字以官方渠道最新口径为准。

附录

附录 A:条目信息速查卡

项 值
条目名 CURVAS
url_name curvas
类型 挑战赛数据集(+结果论文+数据论文双发表)
平台 curvas.grand-challenge.org(已关闭)
数据 Zenodo v3:29.4 GB 三包(train 6.3/val 1.6/test 21.6)
团队 Sycai Technologies SL + UPF + UKER + Tecnalia + BCN-AIM/ICREA
论文 CBM 2025;197:111024 + Sci Data 2026;13:156
许可 数据 CC BY-NC;代码 CC-BY-NC-SA(README 口径);Sci Data 论文 CC BY-NC-ND
抓取时点 2026-09-27
库内互链 totalsegmentator(422)/amos(76)/abdomenct-1k(402)/word(412)/flare(387)/btcv(377)/segthor(439)/chaos(337)/sliver07(347)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 四入口(Zenodo/GC 平台/两篇论文);扣分:curvas 撞西语词(坑 3)、无专门 dataset card
A 可获取性 9 v3 全量公开直链、无注册无申请;扣分:29.4 GB 无分片镜像、单点 Zenodo
I 可互操作 8 NIfTI 标准+每例四文件+整数标签+MD5;扣分:无机器可读元数据表(人口学/分组在论文 PDF 里)
M 元数据质量 7 采集参数与标注细则罕见详尽;扣分:版本 DOI 双口径(坑 1)、测试集例数双口径(坑 2)、Sci Data 一处笔误
S 可持续性 7 Zenodo 永存+GitHub 维护+商业公司背书+已有第二届;扣分:单中心数据不可再生、平台 phase 已关
综合评级 7.8/10(中上) "好下载+好文档"型数据集;失分全在元数据一致性与单中心约束

附录 C:逐项证据链自证

关键数字/事实 来源 位置
90 例/51 男/39 女/37-94 岁/均值 65.7 Zenodo v3 页+CBM §2.2.1+Sci Data 正文 三源互证
分组 45/22/23 与划分 20/5/65(20A+22B+23C) Zenodo v3 页 Dataset Cohort 唯一来源(论文冲突已存照)
三 zip 29.4 GB 与 MD5 三值 Zenodo v3 页 Files 区 唯一来源
标签 0-3 与 UKCHLLXXX 四文件结构 Sci Data Data Records 唯一来源
TS 预标注修正流水线与准则治理 CBM §2.2.2+Zenodo v3 Annotation Protocol 双源
器官细则(凸包/肾盂排除等) Zenodo v3 页 Annotation Protocol 唯一来源
CT 采集参数(Br40/螺距/对比剂) Zenodo v3 页 Technical Specifications 唯一来源
7 队 10 算法/全 U-Net CBM §3.8+sycaimedical 博客 双源
Table 2 全部指标值 CBM 论文 Table 2 arXiv 2505.08685 PDF
Table 3/4 分组值 CBM 论文 Table 3/4 arXiv 2505.08685 PDF
cECE 多 rater 平均设计 CBM §2.3.1 唯一来源
CRPS 高斯构造 CBM §2.3.1 Eq.(3)+Fig.2 唯一来源
500 次 bootstrap CBM §4.3 唯一来源
异常肾集体漏检案例 CBM §4.2+Fig.5 唯一来源
指标相关性(DSC-Conf/ECE-CRPS) CBM §4.1.1+Fig.3 唯一来源
v1 损坏元数据自曝 CBM §5.3 lessons learned 唯一来源
胰腺最难/B 组最分歧/C 组更一致 Sci Data Analyzing results+Fig.1/2 唯一来源(箱线图定性)
训练集 2 例故意保留的错误 CBM §2.2.4+Sci Data Analyzing results 双源
CC BY-NC 与商用联系邮箱 Zenodo v3 页 Data Usage Agreement 唯一来源
资助信息 GC 页脚+CBM 致谢口径 双源
PDACVI 第二届 GitHub README 唯一来源
CBM 卷期 197(Pt B):111024/PMID 40934552 UCL Discovery+Tecnalia+HAL 三源
Sci Data 卷期 13:156/PMID 41513702 PubMed+DOAJ+Plum 三源

附录 D:数据获取决策树

需求是什么?
├── 想复现挑战赛成绩
│   ├── 1) Zenodo v3 三包下载(13767408 或 11147559)→ 验 MD5
│   ├── 2) GitHub clone curvas-challenge(评估代码)
│   └── 3) 按 CBM Table 2 对标(注意 ECE 单位 ×10⁻³)
├── 想训练多器官分割模型
│   ├── 主干数据用 AMOS/AbdomenCT-1K/WORD(PrAEcision 配方)
│   └── CURVAS 20 例做微调层;test 65 例报分布外表现
├── 想研究不确定性/校准
│   ├── 用 annotation_1/2/3 原始三份(别先融合!)
│   ├── 实现 cECE(对 3 份分别算再平均)+Cseg+CRPS
│   └── 在 dissensus 区检验模型置信度是否下降
├── 想研究标注质量/标注协议
│   └── Sci Data §Methods 四把尺子+§3.3 准则治理可直接搬
└── 想商用
    └── 先邮件 m.riera@sycaitechnologies.com 解决 CC BY-NC 授权

附录 E:标签映射与跨库对照表

标签值 CURVAS BTCV/AbdomenCT-1K 系 AMOS 备注
0 背景 背景 背景 一致
1 胰腺 脾 脾 高危混淆
2 肾 右肾 右肾 CURVAS 不分左右肾(双肾同类)
3 肝 胆囊/肝(依库而异) 胆囊 高危混淆

跨库联合训练前必须逐库核对官方标签字典;本表只给"第一个标签坑"的定位,完整映射以各库官方文档为准。CURVAS 把胰腺放 1 强调其任务主角地位,与多数库"脾在前"的惯例相反。

附录 F:指标计算要点(复现速查)

DSC(共识区版)
  for organ in {pancreas, kidney, liver}:
    FP 只在 consensus_background(organ) 计
    FN 只在 consensus_foreground(organ) 计
    DSC_organ = 2TP / (2TP + FP + FN)
  DSC = mean(DSC_organ)

Cseg
  CB = 共识背景体素的平均模型置信度(对"背景"类)
  CF = 共识前景体素的平均模型置信度(对"该器官"类)
  Cseg_organ = ((1 - CB) + CF) / 2
  Cseg = mean(Cseg_organ)

cECE(多 rater)
  for rater in {1,2,3}:
    ECE_r = Σ_bins (|bin|/N) · |acc(bin) - conf(bin)|   # 以该 rater 标注为真值
  cECE = mean(ECE_r)

CRPS(概率体积)
  GT: 以 3 医师体积的 (μ, σ) 构造高斯 PDF → CDF F(x)
  预测: 模型概率图逐体素求和 → 体积 y → Heaviside H(x-y)
  CRPS = ∫ (F(x) - H(x-y))² dx

附录 G:七队方法档案(CBM Table 1 要点全转)

队伍 网络 Patch/spacing 损失 优化器 GPU
MedIG nnUNet 3D full-res(ResidualEncoderUNet)+STAPLE 256×160×160 / 1.0,0.96,0.96 CE+DSC SGD 0.01(mom 0.99,Poly Decay) RTX 3090
PrAEcision nnUNet 3D lowres 96×160×160 / 2.48,1.61,1.61 CE+DSC SGD 0.01(Poly Decay) A100
BreizhSeg TS+ABNN(20 次微调×4 标注集×5 折) 128×128×128 / 1.5 CE+自适应类权重 AdamW 0.0001(Exp Decay) RTX A6000 48GB
DLAI xLSTM-UNet+CAT 块 128×128×128 / 1.0 CE+DSC Adam 0.0001 Tesla A6000 48GB
BCNAIM CLIP 驱动 UNet(AbdomenAtlas-8K 权重)×3 集成 96×96×96 / 1.0,0.96,0.96 CE+DSC AdamW 0.0001(wd 1e-5) RTX 4090 24GB
CAI4CAI MONAI SegResNet+soft-binned ACE 144×144×144 / 2.0 CE+DSC+ACE(等权) Adam 0.0001(WarmupCosine) —
PredictED UNet++(EfficientNet-B3+MobileViTv2 050)2D 集成 512×512 切片 Focal Loss AdamW(OneCycleLR) —

共性:滑窗推理(除 PredictED 全 2D);多数用 CE+DSC;四队用外部知识。差异点已在 §5.4 展开。

附录 H:许可条款细读(三资产+论文)

资产 许可 关键条款 来源
数据(Zenodo v3) CC BY-NC 署名+非商业;商用联系 m.riera@sycaitechnologies.com Zenodo v3 页
代码(GitHub) CC-BY-NC-SA(README)/CC BY-NC(Sci Data) 双口径;取严执行 GitHub README+Sci Data
Sci Data 论文 CC BY-NC-ND 可转不可改不可商用 ProQuest/DOAJ 口径
CBM 论文 订阅版(Elsevier);arXiv 版内嵌 CC BY-NC-SA;HAL 存档 CC BY 4.0 同一论文三版本三许可 UCL Discovery+HAL+arXiv PDF 元数据
HAL 存档版(CBM) CC BY 4.0 最宽松的论文版本 hal.science/hal-05263956

附录 I:坑点档案(与 §10 对照)

坑 一句话 应对
1 版本-DOI 迷宫(v1/v1.0.1/v3;v3 双 DOI) 认版本号 v3,DOI 全程一致
2 测试集 B 组 22 vs 17 用 Zenodo 口径 20+22+23
3 curvas 撞西语词 加 MICCAI/Erlangen/grand-challenge 限定
4 校准≠NLL 全家桶 四指标口径:DSC/Cseg/cECE/CRPS
5 代码许可 SA 有无 按 CC-BY-NC-SA 执行
6 标签顺序不通用 逐库重写映射(附录 E)
7 v1 元数据损坏 用 v3+验 MD5
8 训练集 2 个故意保留错误 不清洗;统计时识别
9 胰腺一致性无数值表 只引定性方向

附录 J:检索决策树

你在找什么?
├── 数据本体
│   └── Zenodo:records/13767408(或 records/11147559)→ v3 三包
├── 挑战协议与榜单
│   ├── CBM 论文:doi.org/10.1016/j.compbiomed.2025.111024
│   └── 开放版:arxiv.org/abs/2505.08685 或 hal.science/hal-05263956
├── 标注一致性/队列描述
│   └── Sci Data:doi.org/10.1038/s41597-025-06473-9(PMID 41513702)
├── 评估/baseline 代码
│   └── github.com/SYCAI-Technologies/curvas-challenge(CURVAS_2024 子目录)
├── 第二届(PDAC/血管侵犯)
│   └── 同仓库 CURVAS-PDACVI_2025 子目录 + MICCAI 2025
└── 主办方商业信息
    └── sycaimedical.com/challenge

附录 K:与库内腹部分割条目的关系声明

  • 与 totalsegmentator(rid 422):预标注引擎关系。TS 的输出质量直接塑造 CURVAS 三份标注的共同起点;TS 条目可补充"CURVAS 采用其预标注+BreizhSeg 微调"的下游用例。
  • 与 amos(rid 76):外部训练数据关系+标签映射对照(附录 E)。AMOS 大而广、CURVAS 小而深。
  • 与 abdomenct-1k(rid 402):同上外部数据关系;"是否已解决"的问题在 CURVAS 的异常肾案例前应重新表述。
  • 与 word(rid 412):外部训练数据关系;WORD 的全腹 16 器官与 CURVAS 三器官深度标注互补。
  • 与 flare(rid 387):MICCAI 系腹部挑战赛双雄,泛化路线 vs 可靠路线。
  • 与 btcv(rid 377)/segthor(rid 439)/chaos(rid 337)/sliver07(rid 347):CT 器官分割家族谱系对照,无直接数据依赖。

附录 L:抓取与核验日志

时点 动作 结果
2026-09-27 04:44 检查 writing/curvas/.lock 不存在→创建(agentA-curvas)
2026-09-27 环境留痕:ps aux 统计 codebuddy 进程数 5
2026-09-27 查重 SQL(url_name ILIKE ‘%curvas%’) 0 行
2026-09-27 Zenodo v1/v1.0.1/v3 三记录抓取 v1 Files 区三次截断(WebFetch 摘要器限制),v3 全量拿到
2026-09-27 arXiv 2505.08685v1 PDF 下载解析 44 页全文入库 /tmp/curvas_agentA-curvas_cbm_paper.txt
2026-09-27 Nature s41597-025-06473-9 抓取 curl+UA 成功(370 KB HTML)
2026-09-27 Grand Challenge 平台页抓取 overview/winners/资助信息
2026-09-27 CBM 卷期三源核验 UCL Discovery/Tecnalia/HAL 一致(197(Pt B):111024)
2026-09-27 05:03-05:10 竞争写入事件 同名 part 文件与本条目成稿被另一进程覆盖(详见本附录 M)

附录 M:竞争写入事件存照

本条目生产期间发生同 slug 竞争写入(纪律包第 0.2 条场景):

  • 时间线:本代理 05:0x 完成 part1-5 直写并拼接成稿(861 行版)后,发现 /tmp/curvas_agentA-curvas_part2-5.md 与 writing/curvas/curvas_Wikipedia.md 被另一进程以同名文件覆盖(对方 part 内容为另一套 §3-§9 编号方案;成稿 mtime 05:03-05:10 连续变化,先后两个版本 md5:03918e80e2a22afd3f16a125bab2f384(861 行)/ 59894f4cd23afcbe2e2accd55f34f84a(914 行))。
  • 判定:writing/curvas/.lock 内容为 agentA-curvas 2026-09-27 04:44:30(本代理名+时间戳),FACTS.md 亦为本代理产物且未被改动——锁归属无争议,对方写入违反锁纪律。
  • 处置:按纪律包"竞争写入换毫秒时间戳文件重写并汇报"——全部 part 改用 /tmp/curvas_agentA-curvas_part*_1790457068052.md 唯一化命名重写,拼接覆盖成稿,并在最终汇报中单列本事件。

附录 N:传统协议 vs CURVAS 协议的判分对照(教学推演)

设某测试病例的肝脏区域可分四块:三医师都标为肝的"硬核区"(100 体积单位)、三医师都标为背景的"明确非肝区"、只有医师 A 标为肝的"分歧区"(10 单位)、模型输出概率 0.6 的"低置信区"。传统单金标准协议(取医师 A 的标注为金标准)与 CURVAS 协议对同一预测的判分差异:

情形 传统协议(金标准=医师 A) CURVAS 协议
模型在分歧区输出低概率 计 FN,Dice 掉分 分歧区豁免,不计 FN
模型在分歧区输出高概率且"猜中"医师 A 加分 不额外加分(该区不在 DSC 共识区)
模型在共识背景高概率但医师 B 其实标了肝 无影响(B 不在金标准里) 不计 FP(分歧区);但 cECE 会记录"对 B 的标注校准差"
模型在共识前景漏检 计 FN 计 FN(同判)
模型在共识背景误检 计 FP 计 FP(同判)
模型输出概率图校准良好(分歧区低置信) 无指标可奖励 Cseg/cECE/CRPS 三处奖励

这张表解释了 CURVAS 排名与传统榜单的本质不同:它奖励的是"知道自己不知道"。同一个模型在两种协议下名次可以差好几位——读 CURVAS 榜单时别拿传统直觉套(例如 BreizhSeg DSC 第四但综合第三,就是置信度与 ECE 拉回来的)。

附录 O:常见误用场景与纠正

误用场景 后果 纠正
把 90 例当常规训练集跑 nnU-Net 主实验 训练集只有 20 例,结果不可用还得出"数据集不行"的错误结论 主训练用 AMOS/AbdomenCT-1K/WORD,CURVAS 做微调+分布外评测层
先把三份标注 STAPLE/投票融合再训练评测 销毁"标注分布"资产,cECE/CRPS 失去意义,退化为普通小数据集 训练可分开用三份;评测保留三份分别算再平均
用 v1 或 v1.0.1 复现论文数字 撞上损坏元数据/缺测试集,结果对不上 用 v3 并验 MD5(坑 7)
把胰腺低分归咎于模型 与医师互标分歧的基线不符,误判模型质量 先算/查医师互标胰腺分数作天花板参照(§4)
报告 NLL/Brier 并称"CURVAS 协议指标" 口径错误,无法与官方榜单对比 四指标口径:DSC/Cseg/cECE/CRPS(坑 4)
标签值直接和 AMOS/BTCV 混训 1 号类一个是胰腺一个是脾,学到噪声 逐库重写标签映射(附录 E)
测试集例数写 60 传播 CBM 论文笔误 写 65=20A+22B+23C(坑 2)
商用管线直接用数据/权重 CC BY-NC 侵权风险 联系作者书面授权

附录 P:90 例队列画像速查(人口学与分组交叉)

维度 取值/分布 来源与提醒
年龄区间 37-94 岁,均值 65.7 三源一致(Zenodo/CBM/Sci Data)
性别 51 男(56.7%)/39 女(43.3%) Sci Data Table 1 口径
年龄×组别 B/C 组更多集中高龄段;组间年龄无显著差异 CBM Fig.1+Sci Data 正文
病灶峰值段 61-80 岁病灶数最多 Sci Data Table 2 口径
A 组 ≤2 囊肿、无轮廓改变病变,45 例 Zenodo v3 页
B 组 3-5 囊肿、无轮廓改变病变,22 例 同上
C 组 6-10 囊肿+肝转移/肾积水/肾上腺转移/肾缺如,23 例 同上;天然分布外子集
囊肿入组上限 ≤10 个且直径 <2.0 cm CBM §2.2.1
排除 显著伪影(呼吸等)、配准不全 同上
采集动机 住院期间胸腹联合 CT 截取,非专设扫描 Zenodo v3 页

读表提示:人口学的机器可读表(CSV)不存在,以上全部转写自论文与 Zenodo 描述——要用原始口径请回查三个来源并注明版本(Sci Data 的 Table 1/2 是最细粒度的人口学公开层)。

附录 Q:复现 CBM 榜单的最小工作流(代码骨架)

# 伪代码骨架:复现 CURVAS 四指标(对齐 CBM 论文 §2.3)
# 依赖:nibabel, numpy, scipy;评估区由三份标注定义
import nibabel as nib, numpy as np

def load_case(case_dir):
    img = nib.load(f"{case_dir}/image.nii.gz")
    anns = [nib.get_data(f"{case_dir}/annotation_{i}.nii.gz") for i in (1, 2, 3)]
    return img, anns                     # anns[k] ∈ {0,1,2,3}

def regions(anns, organ):                # organ ∈ {1:胰腺, 2:肾, 3:肝}
    fg = [(a == organ) for a in anns]
    cons_fg = fg[0] & fg[1] & fg[2]      # 共识前景
    cons_bg = ~(fg[0] | fg[1] | fg[2])   # 共识背景(三人都说非该器官)
    dissensus = ~cons_fg & ~cons_bg      # 分歧区
    return cons_fg, cons_bg, dissensus

# DSC:FP 只计 cons_bg、FN 只计 cons_fg,三器官取平均
# Cseg:((1 - conf(cons_bg)) + conf(cons_fg)) / 2,三器官取平均
# cECE:对 anns[0/1/2] 各算一次 ECE(15 bins),三次取平均
# CRPS:organ_vols = [ann.sum()*voxel_vol for ann in anns] → μ,σ → 高斯 CDF
#       与预测概率图逐体素求和体积的 Heaviside 积分
# 排名:DSC/Conf 降序,ECE/CRPS 升序,四名次取平均

工程提醒:概率图必须保留(别输出二值 mask);ECE 的 bins 数论文未写死(复现建议 10-15 bins 并做敏感性说明);CRPS 的体素体积从 image 头文件 spacing 读出。此骨架为条目作者依据论文公式整理,非官方代码——官方实现在 GitHub 仓库。

附录 R:多 rater 分割基准对照细表

维度 CURVAS QUBIQ LIDC-IDRI
模态 腹部增强 CT MR+CT 混合 胸部 CT
维度 3D 体数据 2D 为主(3D 少量) 3D(结节层面)
目标 3 器官(胰腺/肾/肝) 肾肿瘤/前列腺/脑区等 6 任务 肺结节
标注者/例 3 位放射科医师 2-4 位医师 4 位放射科医师
标注保留方式 3 份全保留 多份保留 多份保留(含 GT 生成协议)
校准评估 有(cECE+置信度) 无(仅准确性) 无
体积评估 有(CRPS 概率化) 无 直径/体积(非概率化)
排名协议 四指标平均+bootstrap 单指标 非竞赛(参考标准)
规模 90 例 数百例(2D) 1,018 例(扫描)
许可 CC BY-NC 开放(Zenodo) TCIA 托管(开放)

三者的谱系读法:LIDC 证明"多 rater 是金标准应有之义"→QUBIQ 证明"多 rater 可以成为排行榜维度"→CURVAS 把两件事合到 3D 多器官+校准上。做综述时这条主线比逐个介绍更清晰。

附录 S:版本选择速查(什么场景用什么版本)

场景 用哪个版本 原因
复现挑战榜单 v3(13767408/11147559) 全量三包+元数据已修复
只想看训练数据长什么样 v1.0.1(12687192) 6.3 GB 单包下载快,但注意它是挑战期补丁版
考证挑战史/引用启动时间 v1(10979641) 仅作史料引用,勿下数据
检索文献 “CURVAS challenge”→CBM;“CURVAS dataset”→Sci Data 两篇论文检索词不同(§4 时间线注)
需要 MICCAI 现场材料 GC 平台页+会议日程存档 平台 phase 已关,页面存档仍可读
项 值
条目名 CURVAS
url_name curvas
类型 挑战赛数据集(+结果论文+数据论文双发表)
平台 curvas.grand-challenge.org(已关闭)
数据 Zenodo v3:29.4 GB 三包(train 6.3/val 1.6/test 21.6)
团队 Sycai Technologies SL + UPF + UKER + Tecnalia + BCN-AIM/ICREA
论文 CBM 2025;197:111024 + Sci Data 2026;13:156
许可 数据 CC BY-NC;代码 CC-BY-NC-SA(README 口径);Sci Data 论文 CC BY-NC-ND
抓取时点 2026-09-27
库内互链 totalsegmentator(422)/amos(76)/abdomenct-1k(402)/word(412)/flare(387)/btcv(377)/segthor(439)/chaos(337)/sliver07(347)

附录 U:批量体积统计骨架(90 例三器官三标注)

# 对全量三包跑"器官体积参考分布":每例×每器官×每标注者一个体积,
# 输出器官级 μ±σ(对齐 CRPS 的 GT 端口径)
import nibabel as nib, numpy as np, glob, os, json

ORGANS = {1: "pancreas", 2: "kidney", 3: "liver"}
rows = []
for split in ("training_set", "validation_set", "testing_set"):
    for case in sorted(glob.glob(f"data/{split}/UKCH*")):
        head = nib.load(f"{case}/image.nii.gz")
        vox = float(np.prod(head.header.get_zooms()[:3]))   # mm^3/voxel
        for r in (1, 2, 3):
            m = nib.load(f"{case}/annotation_{r}.nii.gz").get_fdata()
            for lab, name in ORGANS.items():
                rows.append({"case": os.path.basename(case), "split": split,
                             "organ": name, "rater": r,
                             "vol_ml": float((m == lab).sum()) * vox / 1000.0})
# 汇总:按 (organ, case) 得三 rater 的 μ±σ;按 organ 汇总全集分布
# 注意:训练集含 2 例故意保留的人为错误(坑 8),统计离群时按 split 分层
json.dump(rows, open("curvas_volumes.json", "w"), ensure_ascii=False)

产出说明:curvas_volumes.json 每行一个(病例, 器官, 医师, 体积)四元组;在此之上可做三件事——器官级体积参考表(μ±σ)、医师间体积变异系数(CV)、体积与 A/B/C 分组的关联。全部计算只用 nibabel+numpy,CPU 数分钟内可跑完。

附录 V:库内互链锚点速查(供内链系统)

目标条目(rid) 推荐锚文本 挂载语境
totalsegmentator(422) TotalSegmentator 预标注 §3.1 流水线、§5.4 BreizhSeg、§7.5 引用景观
amos(76) AMOS 外部训练数据 §5.4 PrAEcision 配方、§2.5 规格对照、附录 E 标签映射
abdomenct-1k(402) AbdomenCT-1K §5.8 外部数据效应、§2.5 规格对照
word(412) WORD 数据集 §5.4 外部数据、§7.5 引用景观
flare(387) FLARE 挑战赛 §2.5 路线对照、§7.4 生态位置
btcv(377) BTCV 基准 附录 E 标签对照、§9.2 家族谱系
segthor(439) SegTHOR 挑战 §9.2 任务家族
chaos(337) CHAOS 数据集 §9.2 任务家族
sliver07(347) SLIVER07 §9.2 肝细则承继

附录 W:引用 BibTeX

@dataset{curvas_dataset_2024,
  author       = {Riera-Mar{'{i}}n, Meritxell and Klei{\ss}, Joy-Marie and
                  Aubanell, Anton and Antol{'{i}}n, Andreu and others},
  title        = {{CURVAS dataset}},
  note         = {Version v3},
  year         = {2024},
  doi          = {10.5281/zenodo.13767408},
  url          = {https://zenodo.org/records/13767408}
}

@article{curvas_results_2025,
  author  = {Riera-Mar{'{i}}n, Meritxell and O.K., Sikha and Rodr{'{i}}guez-Comas, J{'{u}}lia and
            May, Matthias Stefan and Pan, Zhaohong and Zhou, Xiang and others},
  title   = {{Calibration and Uncertainty for multiRater Volume Assessment in
             multiorgan Segmentation (CURVAS) challenge results}},
  journal = {Computers in Biology and Medicine},
  volume  = {197},
  pages   = {111024},
  year    = {2025},
  doi     = {10.1016/j.compbiomed.2025.111024}
}

@article{curvas_datapaper_2026,
  author  = {Riera-Marin, Meritxell and Kleiss, Joy-Marie and Aubanell, Anton and
             Antolin, Andreu and Moreno-Vedia, Juan and Rodriguez-Comas, Julia and others},
  title   = {{A MultiRater MultiOrgan Abdominal CT Dataset for Calibration Analysis
             and Uncertainty Modeling in Segmentation}},
  journal = {Scientific Data},
  volume  = {13},
  pages   = {156},
  year    = {2026},
  doi     = {10.1038/s41597-025-06473-9}
}

引用提示:数据条目的作者列表以 Zenodo v3 页为准(含角色标注 Project leader/Data manager/Data collector);作者拼写以各论文官方版本为准(Riera-Marín/Riera-Marin、Kleiß/Kleiss 在不同文献中两态并存)。

附录 X:库内可获取性光谱定位

数据集 获取模式 直接下载 需申请 许可口径
CURVAS(本条目) 公开直链(全量) 是(Zenodo v3 三包) 否(商用除外) CC BY-NC
totalsegmentator(422) 公开直链 是 否 多层(代码/权重/数据各不同)
amos(76) 注册下载 注册后是 否 研究用途声明制
abdomenct-1k(402) 公开直链 是 否 开放
word(412) 公开直链 是 否 开放
库内请求制典型(如 panda-plus) 邮件申请 否 是 定制条款

定位结论:CURVAS 处于库内可获取性光谱的最开放一档——无注册、无申请、无门禁,唯一门槛是 29.4 GB 的带宽与 NC 的商用红线。检索者把 CURVAS 当"获取体验基准线"亦可。

附录 Y:条目维护触发点

触发事件 影响章节 动作
CURVAS-PDACVI 结果论文发表 §7.2、FAQ Q34 追加第二届战况与两届对照
Zenodo 出现 v4 §6.1、坑 1、附录 S 核对新版文件与 MD5,更新版本谱系
许可条款变更(NC 撤销/改 CC BY) §6.3、附录 H、INFOBOX 全节重写获取与许可
Grand Challenge 平台存档下线 §6.2、附录 J 更新入口清单,补 Wayback 存照
第三方对胰腺一致性的数值化研究发表 §4、坑 9 替换"无数值表"的存照口径

维护原则:本条目所有"唯一来源"数字(附录 C 标注项)一旦上游页面变化即需复验——Zenodo 描述文本与 GitHub README 是最可能静默变更的两处。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • toothfairy2 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • toothfairy3 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • stsr — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • instance2022 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • trials — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • lnq — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • asoca — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • orcascore — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 评测基准
  • segthor — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集
  • ctooth — 共享标签:医学影像 / CT / 医学图像分割 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集