AutoPET III (autopet-iii) — AI-Ready Wikipedia

autoPET 系列第三届 tracer frontier:FDG+PSMA 双示踪剂 1,611 studies 的多示踪剂多中心组合泛化挑战——4×50 交叉测试矩阵实证未见 tracer×center 组合仍是开放问题,混合效应模型揭示患者异质性 61% vs 算法差异仅 1.3%

来源 UKT Tübingen(FDG,Siemens Biograph mCT 单机单中心,501 阳性+513 阴性)+ LMU University Hospital Munich(PSMA,3 台扫描仪,[18F]PSMA-1007 + [68Ga]PSMA-11 双配体)——TCIA DICOM/FDAT NIfTI/HF 镜像三载体,核医学与放射科医师手工逐层勾画发布时间: 2026-09-27最后更新: 2026-09-27 阅读 16
AutoPET III (autopet-iii) — AI-Ready Wikipedia

信息速览

数据集名称AutoPET III (autopet-iii) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模训练 1,611 studies(FDG 1,014 scans/900 患者 + PSMA 597 scans/378 患者)+ held-out 测试 200 studies(4×50 交叉矩阵)
接入方式UKT Tübingen(FDG,Siemens Biograph mCT 单机单中心,501 阳性+513 阴性)+ LMU University Hospital Munich(PSMA,3 台扫描仪,[18F]PSMA-1007 + [68Ga]PSMA-11 双配体)——TCIA DICOM/FDAT NIfTI/HF 镜像三载体,核医学与放射科医师手工逐层勾画
AI 就绪度

INFOBOX:autopet-iii 速览

字段 值
数据集 AutoPET III Challenge Training Database(FDG-PET-CT-Lesions + PSMA-PET-CT-Lesions 合并 nnUNet 格式)
slug autopet-iii(GC 子域 autopet-iii.grand-challenge.org——带连字符;autopet3/autopetiii 均 404)
系列谱系 I segmentation(2022)→II generalization(2023)→III tracer(2024,本条)→IV human(2025)→V human-AI(2026)——五届 frontier 命名谱系第三棒
平台 Grand Challenge——autopet.org 官网系列主页;库内前作 rid 468(AutoPET I/II)
会议 MICCAI 2024 官方挑战(第 27 届,Marrakesh, Morocco 现场公布);ESHI(European Society for hybrid, molecular and translational imaging)支持
主办 LMU University Hospital Munich(Cyran/Ingrisch/Dexl/Jeblick/Schachtner/Mittermeier/Stüber——PSMA 数据方)+ UKT Tübingen MIDAS.lab(Gatidis/Küstner——FDG 数据方)
任务 全身 PET/CT 肿瘤病灶自动分割(CT+PET 双通道输入,二值病灶掩码输出)
数据 FDG 1,014 studies(UKT,900 患者,501 阳性+513 阴性)+ PSMA 597 studies(LMU,378 例前列腺癌男性,全男)= 1,611
病灶规模 FDG 8,781 病灶/TMTV 110,189 mL;PSMA 19,377 病灶/TMTV 132,853 mL——PSMA 病灶数是 FDG 的 2.2 倍
测试设计 final 200 studies = 4×50 交叉矩阵:FDG-UKT/PSMA-LMU 同域 + FDG-LMU/PSMA-UKT 未见 tracer×center 组合(compositional generalization)
双赛道 AC1 model-centric(自由方法)+ AC2 data-centric(固定 MONAI nnU-Net baseline,只许改数据管线——PET/CT 分割挑战史首个 data-centric 赛道)
评估 Dice(0.5)+ FPV(0.25)+ FNV(0.25)加权排名;4 子集均值→跨算法排名→平均
参与 563 人注册(截至 2024-11,亚洲 53%)→初赛 24 队 218 算法→决赛 17 队 27 算法
冠军 Team LesionTracer(DKFZ MIC+Heidelberg,Rokuss/Isensee——nnU-Net 核心作者):nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督+动态 TTA,mean Dice 0.66(内部对照 57.61→68.40)
AC2 冠军 Lennonlychan(CUHK):diffusion model 生成肿瘤样本扩充数据集,overall 第 7
规则亮点 Docker 标准化+5 min/例运行限制+每队 2 算法+强制开源代码权重+奖金因资金限制未发放(罕见披露)
时间线 2024-04-01 训练数据发布(CC-BY-NC 4.0)→09 final test→MICCAI 2024 现场公布
数据载体 TCIA DICOM(FDG 10.7937/gkr0-xv29 + PSMA 10.7937/r7ep-3x37)+ FDAT NIfTI(合并库 10.57754/FDAT.rdkqd-wdh87)+ HF 镜像 MedOtter/PSMA-PET-CT-Lesions;Zenodo 10990931 仅提案 PDF
库内联动 rid 468 autoPET(I/II 直接前作)、rid 634 autoPET-v(直接后作)、rid 475 lung-pet-ct-dx、rid 461 hecktor

§0 摘要卡:示踪剂前沿的组合泛化压力测试

§0.1 它是什么

AutoPET III 是 MICCAI 2024 官方挑战赛:全身 PET/CT 肿瘤病灶自动分割的多示踪剂多中心泛化 benchmark——autoPET 系列第三届(“The tracer frontier”,示踪剂前沿),也是系列数据规模的第一次大扩容:在 I/II 两届沿用的 UKT Tübingen FDG 库(1,014 studies,黑色素瘤/淋巴瘤/肺癌+健康对照)之上,LMU Munich 首次并入 597 例 PSMA-PET/CT(前列腺癌男性患者,[18F]PSMA-1007 与 [68Ga]PSMA-11 双配体),合计 1,611 studies。任务仍是 CT+PET 双通道输入的病灶二值分割,但挑战哲学升级为组合泛化(compositional generalization)压力测试:final 测试 200 例按 4×50 交叉矩阵分布,其中 FDG@LMU 与 PSMA@UKT 两个子集是训练中从未见过的 tracer×center 组合——模型不仅要认识新示踪剂,还要在新示踪剂与新中心的组合下不崩。同步开创的还有赛制:AC2 data-centric 赛道固定 nnU-Net baseline、只允许修改数据管线,把"改数据 vs 改模型"的世纪之争变成了可排名的对照实验。挑战总结论文(arXiv 2605.05775)用线性混合效应模型给出系列最著名的结论之一:患者异质性解释 61% 的 Dice 方差,算法间差异仅解释 1.3%。

§0.2 三个数字

  • 1,611 = 1,014+597:FDG 1,014 studies(UKT 单中心单台 Siemens Biograph mCT,900 患者,501 阳性+513 阴性,8,781 病灶)+ PSMA 597 studies(LMU 三台扫描仪,378 例全男性前列腺癌,19,377 病灶)——PSMA 病灶数是 FDG 的 2.2 倍,TMTV 132,853 mL vs 110,189 mL
  • 4×50:final 测试 200 例的交叉矩阵设计——FDG-UKT(Dice 0.6619)/PSMA-LMU(0.6433)同域 + FDG-LMU(0.7702)/PSMA-UKT(0.5711)跨组合——最好的算法在未见 tracer×center 组合上掉 10 个 Dice 点,组合泛化被定量钉死为开放问题
  • 61% vs 1.3%:线性混合效应模型方差分解——患者异质性 σ=0.171 贡献 61%,残差 38%,算法间差异仅 1.3%(σ=0.025);两个随机患者的期望 DSC 差约是两个随机算法差的 7 倍

§0.3 它怎么用

四大用途:①双示踪剂 PET/CT 分割训练——1,611 studies 全部带手工逐层勾画掩码+逐例临床元数据(剂量/摄取时间/扫描仪/体重),是 PET 病灶分割领域最大 openly available 手工标注库之一;②组合泛化/域移方法研究——4×50 交叉矩阵+官方 splits_final.json 参考 5 折,是"训练分布外性能"的标准试验床;③data-centric 方法对照——AC2 固定 baseline 的赛制设计+官方 nnunet-baseline/datacentric-baseline 代码,可直接复刻"只改数据管线"的对照实验;④PSMA 数据论文单独可用——PSMA-PET-CT-Lesions 在 TCIA(DOI 10.7937/r7ep-3x37)与 FDAT v3 独立成库,配合 Sci Data 2026 论文(DOI 10.1038/s41597-026-07821-z)独立引用。不适合:心脏/神经 PET 应用(任务限定肿瘤病灶)、临床诊断(研究定位)、需要 DICOM 原始私隐字段的场景(TCIA 版已 defaced 且 study dates 移位)。

使用边界补注:其一,掩码是病灶级二值——想做器官分割或病灶分类(原发/转移)需另找资源(TotalSegmentator 器官掩码可叠加为辅助监督,冠军方案即此用法);其二,无纵向数据——单时点横断面设计,治疗响应研究需转 IV/V 的纵向资产;其三,无临床结局——元数据止于成像协议,生存/病理分级等结局变量需外部 join(且去标识化后 join 不可行)。三边界的共同根源:这是为"分割任务"优化的资产,任务外用途需要自觉设计而非即拿即用。

§0.4 联动提示

本条是 autoPET 系列库内三连的中坚:rid 468 autoPET(I/II)的直接续作——I/II 用 FDG 库 1,014 studies(468 条目已详述),III 在其上并入 PSMA 597;rid 634 autoPET-v 的直接前作——V 的交互式分割以 III 冠军权重初始化(arXiv 2609.01554 自述 “initialised from the autoPET-III winning weights”),IV 冠军方案亦自述 “Building on the winning autoPET III nnU-Net pipeline”(arXiv 2508.21680)。跨系列联动:rid 475 lung-pet-ct-dx(FDG PET/CT 病灶分类+分割邻居)、rid 461 hecktor(PET/CT 咽喉病灶分割挑战)、ProstateX/PI-CAI(前列腺影像邻居——PSMA 队列的疾病域)。

§0.5 本条目信息地图

  • 急着下载数据 → §2.1 载体表(选 TCIA/FDAT/HF)→ 附录 B 命令
  • 急着训练模型 → 附录 C 五步 + §4.4 格式说明 + 坑点 4/8
  • 写论文要引用 → §2.4 BibTeX + §1.3 双数据论文 + 坑点 1(Zenodo 陷阱)
  • 做域移研究 → §3.2 测试矩阵 + §4.3 队列对照 + §6.3-§6.4 统计结论 + 附录 P
  • 参赛/复刻赛制 → §3.3-§3.5 双赛道与规则 + §7.2 冠军五件套 + 附录 K 代码表
  • 评估数据资产质量 → §5 标注 + §9 伦理许可 + 附录 F DAIMS + §10.1 十坑

§1 平台与系列谱系

§1.1 五届 frontier 命名谱系(autopet.org 官网原文)

autoPET 系列是医学影像挑战赛界罕见的每届一个 frontier(前沿)命名的品牌资产管理范式,五届演化路径自我讲述:

届 年份 frontier 命名 核心问题 数据 库内条目
autoPET I 2022 The segmentation frontier 全自动病灶分割能做多好 FDG 1,014(UKT 单中心) rid 468(I/II 合并条目)
autoPET II 2023 The generalization frontier 跨扫描环境(低剂量本底/不同重建)还能做多好 FDG 1,014(加入 II 期变体) rid 468
autoPET III 2024 The tracer frontier 换示踪剂(FDG→PSMA)+换中心(UKT→LMU)+两者组合还能做多好 FDG 1,014+PSMA 597=1,611 本条
autoPET/CT IV 2025 The human frontier 人类先验(交互式分割)如何进入循环 FDG+PSMA+纵向 CT 双库 (IV 无独立库内条目)
autoPET V 2026 The human-AI frontier 交互效率如何被指标化(AUC-Dice+AUC-DMM) 五库全家福(QIBA 对齐重发布) rid 634

三届主线的逻辑递进:I 问"能不能分割"→II 问"换环境还行不行"→III 问"换示踪剂、换中心、以及两者组合还行不行"。III 的 tracer frontier 不是简单加数据:FDG(葡萄糖代谢,广谱肿瘤显像)与 PSMA(前列腺特异性膜抗原配体,前列腺癌特异显像)在空间分辨率、摄取异质性、生理摄取分布上系统性不同——GC 主页图注原话:PSMA 分辨率更低、异质性更强。同一个"病灶分割"任务在两种示踪剂下是两个物理世界的问题。

谱系管理学的注脚:每届一个 frontier 命名使系列在检索与叙事上都自我延续——检索者记住"tracer frontier"即可定位 III,无需记年份;叙事上每届自动继承前届问题空间并声明新增维度。对照多数挑战赛"第 N 届"式的平淡命名,frontier 谱系是挑战赛品牌运营的教科书案例(autopet.org 官网首屏即五届卡片)。对库内条目的意义:rid 468/本条/rid 634 三条目构成"系列命名谱系"的完整样本,互链阅读时谱系表(附录 E)是总索引。

§1.2 组织矩阵:双数据方+双专业轴

角色 机构 人员 专业背景
PSMA 数据方+主办 LMU University Hospital Munich(慕尼黑大学医院) Clemens Cyran、Michael Ingrisch、Jakob Dexl、Katharina Jeblick、Balthasar Schachtner、Andreas Mittermeier、Anna Theresa Stüber 核医学+放射学(Ingrisch 为 LMU 定量影像组负责人)
FDG 数据方+主办 UKT Tübingen(图宾根大学医院)MIDAS.lab Sergios Gatidis、Thomas Küstner 医学影像 AI 实验室(FDG-PET-CT-Lesions 原作者)
学会支持 ESHI — European Society for hybrid, molecular and translational imaging

双数据方结构决定了 III 的数据拓扑:FDG 库(TCIA DOI 10.7937/gkr0-xv29,2022 年发布,I/II 已用)继续由 UKT 提供,PSMA 库(TCIA DOI 10.7937/r7ep-3x37)由 LMU 全新采集标注——两个库在采集协议、扫描仪型号、患者人群(FDG 混合性别三癌种 vs PSMA 全男前列腺癌)上完全异质,这种异质性正是组合泛化测试的原料。组织机构成员依规则回避排名(见 §3.4)。

人员注记:Isensee(nnU-Net 一作,DKFZ)与 Gatidis/Küstner(UKT MIDAS.lab)是系列的核心双极——前者代表方法学侧(其本人组队参赛并夺冠),后者代表数据与评估侧(主办);LMU 侧 Jeblick 既是 PSMA 数据论文一作又是挑战总结论文二作——数据产出与挑战运营在同批人手中闭环,这是小团队高质量治理的典型结构(对照大平台多机构协作的松散分工)。

§1.3 与两篇数据描述论文的关系

III 的数据本体有两篇独立的数据描述论文背书——这是系列条目中"一挑战两论文"的首例:

  • FDG 库论文:Gatidis S, Kuestner T. A whole-body FDG-PET/CT dataset with manually annotated tumor lesions. Scientific Data 9:601 (2022),DOI 10.1038/s41597-022-01718-3——autoPET I/II 沿用,被引 386+(2026-09 口径);
  • PSMA 库论文:Jeblick K, et al. A whole-body PSMA-PET/CT dataset with manually annotated tumor lesions. Scientific Data 13:1023 (2026),DOI 10.1038/s41597-026-07821-z(PMID 42432027 / PMC13354788)——注意该论文 2026 年才正式刊出,比数据发布(2024-04)晚两年:挑战赛先行、数据论文滞后的出版时序错位,使 2024-2025 年间的引用只能指向挑战赛与 Zenodo 提案。

坑 1:检索 PSMA 数据时若只认 Sci Data 论文,会误判数据"2026 年才存在"——实际 2024-04-01 已随挑战赛发布(FDAT v1 口径);反向亦然,只看挑战赛材料会漏掉 2026 年论文的 v3 口径修正(539/58 vs 537/60,见 §5.2 与附录 G)。

两篇论文的引用权重也需要分场景:FDG 库研究引 2022 论文即可自洽;PSMA 库研究必须同时引挑战赛材料(数据 2024 年即公开的事实层)与 2026 论文(标注协议与队列统计的正式披露层)——单引论文会缺失挑战赛期的设计语境(4×50 矩阵、AC2 赛道),单引挑战材料会缺失资历细节与版本修正记录。两篇 Sci Data 的卷期号(9:601 vs 13:1023)也提醒检索者:两者相隔近四年的出版周期,是"数据集论文"这一文体在挑战赛时代的时序错位样本。

§1.4 GC 子域与官网

§1.5 GC 平台页面结构与 autopet.org 官网导航

GC 挑战页的标准八板块在 III 上齐备,检索者按需直达:

页面板块 URL 路径 内容 本条目对应章节
Overview / 挑战一句话+奖金+关键日期 §0、§8
Task /task 任务定义:CT+PET 输入、二值病灶输出、无元数据 §3
Evaluation & Ranking /evaluation Dice/FPV/FNV 定义+加权公式+子集聚合 §6
Dataset /dataset 训练/测试两阶段数据说明+下载入口 §2、§4
Submission Rules /submission Docker/5 min/2 算法/开源强制 §3.4
Challenge Publication /publication 论文出口与引用指南 §2.2
Timeline /timeline 阶段日期 §8.1
Organization /organization 双机构人员名单 §1.2
Results /results final 榜单+Paper and Code 表 §7.3、附录 K
Leaderboards(Preliminary Test Set) /leaderboards 初赛动态榜单(JS 动态加载——静态抓取只见表头) §7.1

autopet.org 系列官网则为五届提供统一导航:首页五届卡片(每届一个 frontier 命名+一行定位)、各届详情页(III 页含协议参数全表与测试矩阵)。双站结构的方法学含义:GC 子域承载动态运营(榜单/提交),autopet.org 承载静态叙事(谱系/协议)——引用协议参数时查官网详情页比 GC 运营页更稳定(GC 页面可能随届次演进改版)。

§1.6 挑战提案 PDF 的内容与角色

Zenodo 10990932(concept 10990931)那份 0.1 MB 的提案 PDF 是 III 唯一的 Zenodo 实体,其角色值得单独说明:

  • 内容:挑战提案(challenge proposal)——任务定义、数据概述、评估设计、组织团队的正式文档,GC 平台官方挑战的登记材料
  • 为什么重要:它是 III 的官方 DOI 锚点——MICCAI 挑战赛要求提案经平台与学会审核(ESHI 支持),提案 DOI 是"官方挑战"身份的凭证;总结论文与官网均引此 DOI
  • 为什么不是数据:103,805 字节的物理体积(一份数页 PDF);数据本体 20 GB 量级分居 TCIA/FDAT——体积即证伪(坑 2 的快速核查法)
  • 引用建议:描述挑战赛本身引提案 DOI+GC 子域;描述数据引 TCIA/FDAT DOI+两篇 Sci Data——四组标识符各司其职

平台角色注记:GC 子域、autopet.org、Zenodo、TCIA/FDAT 四个入口的分工映射到四种用户动线——参赛者(GC:提交/榜单/规则)、综述作者(autopet.org:谱系与协议全表)、引用者(Zenodo:官方挑战身份 DOI)、数据工程师(TCIA/FDAT/HF:本体下载)。III 的入口分散不是混乱而是分层:每层的检索关键词不同(挑战名/届名/frontier 名/收藏名),这也解释了为何本条目 INFOBOX 与 §1.5 要把入口与关键词成对列出——跨入口检索是这条数据资产使用者最常迷路的地方。

§2 发布形态与学术出口

§2.1 发布物清单与 DOI 拓扑

AutoPET III 的发布物是一张需要小心分辨的拓扑图——Zenodo DOI 不是数据是本条目最重要的检索警示:

发布物 载体 标识符 内容 授权
挑战提案 Zenodo DOI 10.5281/zenodo.10990931(concept,重定向 10990932) 挑战提案 PDF,103,805 字节 ≈ 0.1 MB,2024-04-18 发布,下载 1803/浏览 2066(2026-09-27 抓取) CC BY-4.0
FDG 库(DICOM) TCIA DOI 10.7937/gkr0-xv29 1,014 studies,defaced 去标识 CC BY 4.0
PSMA 库(DICOM) TCIA DOI 10.7937/r7ep-3x37 597 studies,2024 收录 TCIA 数据使用许可(autopet.org 旧页口径 “TCIA Restricted license”)
FDG+PSMA 合并 NIfTI FDAT(Tübingen) DOI 10.57754/FDAT.rdkqd-wdh87 双库 nnUNet 合并(QIBA 对齐版) CC BY-NC 4.0
PSMA v3(NIfTI) FDAT DOI 10.57754/fdat.gabc0-3hv03 539/58 口径(v2 修正后) CC BY-NC 4.0
挑战 v1 原始字节 FDAT 记录页 fdat.uni-tuebingen.de/records/0zs4c-89f12 2024-04-01 挑战期原始训练包 CC-BY-NC 4.0(挑战官方口径)
HF 镜像 HuggingFace datasets/MedOtter/PSMA-PET-CT-Lesions 21 GB,597 行,逐例 shape/affine 校验 CC BY-NC 4.0 口径

坑 2:把 Zenodo 10990931 当数据集引用。concept DOI 重定向到的记录只有一份挑战提案 PDF——0.1 MB 的体积本身就是线索(1,611 例 PET/CT+掩码不可能小于 20 GB)。数据本体按用途选载体:要 DICOM 去 TCIA(两库 DOI 分开),要 nnUNet 格式 NIfTI 去 FDAT 合并库,要快速脚本化访问去 HF 镜像。另注意 TCIA 版 study dates 全体移位至 1997-2005(去标识化处理),与 FDAT 按日期不可 join,仅能以 patient hash 对齐。

体积核查法(30 秒证伪一条"数据链接"):拿到任何自称是本数据集的下载源,先看体积——FDG 库 DICOM ~14 GB 量级、PSMA 库 ~7-21 GB 量级(HF 镜像 21 GB 为含校验件的口径)、挑战合并 NIfTI 包 20 GB 上下。MB 级=文档/提案,GB 级=数据本体;体积、文件数(1,611 studies 对应 3,222 个 imagesTr 通道文件+1,611 掩码)、目录命名(nnUNet 六件套 vs TCIA 五件套)三项对上才可信。非官方源的"重组包"(如某些 Kaggle 转载)常见掩码缺失或通道错位——附录 M 的 30 分钟自检清单就是为这类情况准备的。

§2.2 学术出口

  • 挑战总结论文:Dexl J, Jeblick K, … Isensee F, Küstner T, Ingrisch M. The autoPET3 Challenge. arXiv:2605.05775(v1 2026-05-07 / v2 2026-05-11,Preprint submitted to Medical Image Analysis,论文 license CC BY-NC-ND 4.0)——143,873 字符全文(2026-09-27 抓取口径),Table 1 数据统计/混合效应模型/三大结论/参与度统计均出于此
  • 冠军方法论文:Rokuss M, Kovacs B, Kirchhoff Y, Xiao S, Ulrich C, Maier-Hein K H, Isensee F. From FDG to PSMA: A Hitchhiker’s Guide to PET/CT Tumor Lesion Segmentation with nnU-Net. arXiv:2409.09478(v1 2024-09-14,Comments 自述 “Winning method of the autoPET III challenge (model-centric) - Team LesionTracer”)
  • 参赛论文潮:2024-09 一周内 arXiv 至少 7 篇(2409.07144 / 09478 / 10120 / 12155 / 13006 / 13410 / 13779),检索窗口 2024-09 至 2026-09 内 III 衍生 arXiv 论文 13+ 篇——挑战赛结束即引发论文潮,是 PET 分割子领域的方法学普查窗口

论文潮的构成(附录 K 全表支持):决赛 21 个公开资产条目中 15 个附 arXiv 论文——覆盖率 71%;题材分布横跨方法论文(冠军 ResEncL 五件套)、data-centric 实验(synthPET/datadiet)、工程适配(2D 集成/动态 TTA)与区域团队的技术报告(台湾/联影/港大)——一个挑战赛打出一整个子领域两年的文献供给。对系统综述作者的提示:以 GC Results 页 Paper and Code 表为起点做 snowballing,比纯关键词检索的召回更完整(多条目论文标题不含 “autoPET”)。

  • 数据论文两篇:见 §1.3(FDG 2022 / PSMA 2026)

§2.3 代码出口

仓库 维护方 内容
github.com/ClinicalDataScience/autoPETIII 组织方 nnunet-baseline(AC1 起点)+ datacentric-baseline(AC2 固定 baseline,MONAI-based)
github.com/lab-midas/autoPET LMU(系列级) 系列评估脚本(I-V 通用)
github.com/MIC-DKFZ/autopet-3-submission 冠军队 LesionTracer 完整方案(规则强制开源)

强制开源是 III 规则的硬约束(见 §3.4):决赛队必须提交代码+权重+技术报告,这使 III 成为"榜单可审计"的挑战赛样本——冠军方案的每个组件(ResEncL、misalignment 增强、器官监督、TTA)都能在代码里逐行核对,而非只存在于论文叙事。

§2.4 引用指南(五组标识符各司其职)

% 挑战赛本体(提案 DOI——官方挑战身份凭证)
@misc{autopet3_proposal,
  doi = {10.5281/zenodo.10990931},
  title = {AutoPET III Challenge -- Automated Lesion Segmentation in
           Whole-Body PET/CT -- Multitracer Multicenter Generalization},
  year = {2024}, publisher = {Zenodo} }

% FDG 数据(TCIA + Sci Data 2022)
@article{gatidis2022fdg,
  doi = {10.1038/s41597-022-01718-3},
  journal = {Scientific Data}, volume = {9}, pages = {601},
  title = {A whole-body FDG-PET/CT dataset with manually annotated tumor lesions},
  year = {2022} }

% PSMA 数据(Sci Data 2026 + TCIA DOI 10.7937/r7ep-3x37)
@article{jeblick2026psma,
  doi = {10.1038/s41597-026-07821-z},
  journal = {Scientific Data}, volume = {13}, pages = {1023},
  title = {A whole-body PSMA-PET/CT dataset with manually annotated tumor lesions},
  year = {2026} }

% 冠军方法
@article{rokuss2024hitchhiker,
  eprint = {2409.09478}, archivePrefix = {arXiv},
  title = {From FDG to PSMA: A Hitchhiker's Guide to PET/CT Tumor
           Lesion Segmentation with nnU-Net}, year = {2024} }

% 挑战总结(preprint,投 Medical Image Analysis)
@article{dexl2026autopet3,
  eprint = {2605.05775}, archivePrefix = {arXiv},
  title = {The autoPET3 Challenge}, year = {2026} }

引用选择决策树:谈"这个挑战赛"→提案 DOI+GC 子域;谈 FDG 数据→Gatidis 2022+TCIA gkr0-xv29;谈 PSMA 数据→Jeblick 2026+TCIA r7ep-3x37(或 FDAT v3);谈结果与方法→总结论文 2605.05775+冠军论文 2409.09478。任何场景都不要把提案 DOI 当数据 DOI 用(§2.1 坑 2 的引用层收口)。

§3 任务定义深度解析:组合泛化的赛制几何

§3.1 临床动机:为什么换示踪剂是难题

FDG-PET([18F]氟脱氧葡萄糖)与 PSMA-PET(前列腺特异性膜-targeting 配体)的物理差异不是"换个染料"级别的:

维度 FDG(UKT 库) PSMA(LMU 库)
显像原理 葡萄糖代谢(广谱) PSMA 受体表达(前列腺癌特异)
适应症 黑色素瘤/淋巴瘤/肺癌等 前列腺癌(全部为男性患者)
空间分辨率 2.04²×3.00 mm(单台 mCT 一致) 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00 mm(三台混合)
摄取异质性 相对均匀 更强异质性(GC 主页图注原话)
病灶密度 8,781 病灶/1,014 studies ≈ 8.7 例/study 19,377 病灶/597 studies ≈ 32.5 例/study(3.7 倍密度)
生理假阳源 骨髓、纵隔、棕色脂肪、脑、膀胱 肝、脾、肾、颌下腺(PSMA 生理表达器官)
扫描仪 Siemens Biograph mCT 单机 Siemens Biograph 64-4R TruePoint + Biograph mCT Flow 20 + GE Discovery 690 三机

表内六个维度叠加出一个结构性判断:FDG 库是"控制变量"式的库(单机单协议,病灶差异=生物学差异),PSMA 库是"真实世界"式的库(三机双配体宽窗口,病灶差异=生物学+设备+协议的混合)。这决定了两库在方法学上的分工:FDG 侧适合做病灶生物学的定量研究,PSMA 侧适合做设备鲁棒性研究;而组合泛化测试(§3.2)恰好要求两者都有——单用任何一库都构造不出 4×50 矩阵。III 的数据扩容不是"加量"而是"加维度",这是理解 tracer frontier 的钥匙。

一个在 FDG 上调好的模型迁移到 PSMA 会遭遇三重叠加:分辨率下降、病灶更小更密、生理摄取图谱完全不同。而 III 的测试设计把这种"单域迁移"升级为"组合爆炸"(§3.2)。

§3.2 测试矩阵:4×50 交叉设计的组合泛化几何

final 测试 200 studies 的分布是 III 最具方法学野心的设计:

测试子集 例数 tracer center 训练中同组合是否存在 测试阳性例 病灶数 TMTV (mL)
FDG-UKT 50 FDG UKT 有(1,014 例同域) 31 516 7,127
PSMA-LMU 50 PSMA LMU 有(597 例同域) 33 1,309 6,052
FDG-LMU 50 FDG LMU 无(组合泛化) 50 410 5,701
PSMA-UKT 50 PSMA UKT 无(组合泛化) 42 624 882

四种组合中两种是训练分布内的"同域"组合、两种是训练中从未同时出现的 tracer×center 组合——compositional generalization 的严格定义:模型见过 FDG(在 UKT)、见过 PSMA(在 LMU)、也见过 UKT 和 LMU 各自的影像风格,但没见过"FDG 影像来自 LMU 设备"或"PSMA 影像来自 UKT 设备"。排名按 4 子集均值计算,跨组合成绩与同域成绩被强制等权。

组合泛化与普通 domain shift 的区别值得一段注脚:普通域移是"训练见过的因子取值之外"(如全新扫描仪),组合泛化是"每个因子都见过,但取值组合没见过"——它在认知科学与 NLP(组合式语法泛化)中早有系统研究,III 把这一范式引入医学影像评估。其严格性在于:模型无法靠"记住某个中心的整体风格"或"记住某种示踪剂的外观"作弊,必须把"示踪剂的病灶形态学"与"中心的设备指纹"作为可分离的因子学习——分离失败即组合崩溃。4×50 矩阵的设计使这种失败可被定位:跨组合子集掉分而同域不掉,即组合崩塌的证据。

冠军 LesionTracer 的子集 Dice 揭示了矩阵的难度梯度:FDG-LMU 0.7702 > FDG-UKT 0.6619 > PSMA-LMU 0.6433 > PSMA-UKT 0.5711。注意反直觉的一点:跨中心的 FDG-LMU(未见组合)反而是最高分——难点不在跨中心而在 PSMA 侧(分辨率低+病灶小密),PSMA-UKT 集齐"低分辨率示踪剂×未见设备"两重惩罚成为最差子集。总结论文结论 2 的原话:compositional generalization 仍是开放问题,主要由系统性体积高估驱动(跨域时模型倾向过分割以保险)。

坑 3:不要把 4 子集 Dice 均值当成"同域成绩"引用——0.66 的 mean Dice 里混着两个组合泛化子集;同域 FDG 成绩单独看是 0.77 量级(总结论文结论 1:“in-domain 多示踪剂分割已 sufficient and probably approaching reader agreement”)。引用时必须标注子集口径。

§3.3 双赛道:AC1 model-centric vs AC2 data-centric

III 的赛制创新是设双赛道——PET/CT 分割挑战史上首个 data-centric 赛道:

维度 AC1 Modelcentric AC2 Datacentrism
起点 自由方法 固定 MONAI-based nnU-Net baseline
允许修改 一切:架构/集成/训练策略/预训练 只许改数据管线:预处理/增强/样本选择/数据合成
外部数据 允许公开数据集+预训练模型 禁止外部数据
AI 辅助 无限制 AI 可用于数据管线但不得生成最终预测
方法论命题 “更好的模型能做到什么” “同样的模型,更好的数据能做到什么”

AC2 的设计把 deep learning 界"data-centric AI vs model-centric AI"的论战(Ng 2021 的口号)第一次搬进 PET/CT 分割挑战赛:所有 AC2 参赛者共享同一个 baseline 与训练配置,排名差异完全归因于数据侧操作。结果(§7.4)颇具戏剧性:AC2 冠军用 diffusion model 生成肿瘤样本扩充训练集,overall 排到第 7——data-centric baseline 显著优于原版 nnU-Net baseline(后者 overall 24.0 位),证明在固定模型下数据工程的上限远比想象高。

§3.4 规则矩阵

规则 内容 设计意图
Docker 标准化 提交 Docker 容器,官方统一环境推理 消除环境差异
运行时限制 5 min/例 临床可用性约束(全身体积扫描的推理预算)
提交数量 每队最多 2 算法 防枚举攻击
元数据隔离 无辅助元数据(不告知 tracer/中心/适应症) 强制模型从影像本身判读
利益回避 组织机构成员(LMU/UKT)回避排名 公信力
开源强制 决赛队交代码+权重+技术报告 可审计性
无 embargo 赛后无禁发期 加速论文潮(2024-09 一周 7 篇)
奖金 原已规划,因资金限制未能发放 MICCAI 挑战赛罕见的诚实披露

坑 4:5 min/例运行限制是隐形成本——大模型与集成方法在精度竞赛中最常用的手段被预算卡死。冠军论文专门讨论了推理预算与集成的取舍;总结论文报告至少一队因超时导致 FPV 爆表(max.sh 口径 FPV 924.31 mL 量级——超时的未完成推理被计为全图假阳体积)。参赛队普遍用动态测试时增强(TTA)在预算内换精度(§7.5)。

§3.5 无元数据输入的方法论含义

「无辅助元数据」(不告知 tracer/中心/适应症)这条规则的方法论后果比字面深:

  • 单模型硬吃双分布:推理时模型不知道面对的是 FDG 还是 PSMA——要么一个模型同时拟合两种强度分布与病灶形态学(nnU-Net 的多模态通道设计天然支持),要么在容器内部自行做推断路由。冠军方案选择前者(多通道统一训练)+器官监督兜底;也有队伍做显式 tracer 分类后分路由(I/II 时代的经验迁移)
  • 强度归一化的两难(§7.5 归一化分裂的规则根源):global 归一化(用训练集全队列统计)对未见 tracer×center 组合可能失配——测试时模型不知道该用 FDG 统计还是 PSMA 统计;per-image z-score 则对 SUV 的绝对量级信息(生理摄取水平)不敏感。两派都有上榜者,规则逼出了真实的工程权衡
  • 公平性的代价:无元数据同时意味着无法用临床先验做 shortcut(如"全男+前列腺显像=PSMA")——组织方主动切断了模型走捷径的通道,把泛化压力留给影像本身
  • 对部署的诚实:真实临床工作流里 tracer/协议信息永远可得(PACS 元数据)——挑战赛的"盲推"设定是比部署更难的设定,成绩是性能下界

§4 数据本体:1,611 studies 的双库拓扑

§4.1 FDG 队列(UKT,1,014 studies)

  • 来源:UKT Tübingen 单中心单台 Siemens Biograph mCT;900 患者(女 444/男 570;年龄 60±16 岁;体重 79±19 kg)
  • 构成:501 阳性(黑色素瘤/淋巴瘤/肺癌,阳性判定依据临床报告,恶性病灶含原发灶与全部转移灶)+ 513 阴性对照——阴性对照占 50.6%,为 FPV 指标提供假阳测试面
  • 病灶统计:8,781 个病灶;TMTV(总代谢肿瘤体积)110,189 mL
  • 协议:禁食 ≥6 h;注射 ~350 MBq ¹⁸F-FDG(官网口径)vs mean 314.7±22.1 MBq(range 150-432)(总结论文口径)——双口径存照;摄取 ~60 min;CT 120 kV/200 mAs;对比剂 Ultravist 370 90-120 mL;OSEM 3 iterations/21 subsets;2 mm Gaussian 滤波;层厚 2-3 mm
  • 分辨率:2.04²×3.00 mm³(PET 体素,全队列一致——单机优势)

§4.2 PSMA 队列(LMU,597 studies)

  • 来源:LMU Munich,378 例全男性前列腺癌患者,3 台扫描仪(Siemens Biograph 64-4R TruePoint / Biograph mCT Flow 20 / GE Discovery 690)
  • 构成:挑战期 v1 官网口径 537 例有病灶+60 例无病灶;FDAT v3/HF 镜像/Sci Data 论文口径 539/58——版本间对 3 名患者 5 例 mask 的修正所致(附录 G 详述)。本条目正文按论文/最新库口径叙述并注挑战期口径
  • 病灶统计:19,377 个病灶;TMTV 132,853 mL——病灶数是 FDG 库的 2.2 倍,密度 3.7 倍(32.5 vs 8.7 病灶/study)
  • 双配体:[18F]PSMA-1007 369 studies(246±27 MBq)+ [68Ga]PSMA-11 228 studies(214±45 MBq);摄取时间均值 74 min([18F]PSMA-1007 范围 6-181 min / [68Ga]PSMA-11 范围 7-195 min——摄取窗口的宽离散是 PSMA 协议的现实)
  • CT 协议:颅底至大腿中部;143 mAs(mean);100/120 kV(range 80-140);层厚 2.5-5.0 mm(mean 2.82);571 例增强/26 例对比剂禁忌
  • PET 协议:层厚 3.0-5.0 mm(mean 3.49);面内 2.73-4.07 mm
  • 年龄/体重:71±8 岁;83±14 kg

PSMA 队列的两个深层特征值得展开。其一,全男性+单癌种的纯净性是双刃剑:对前列腺癌 PSMA 分割研究是理想同质队列;对"泛示踪剂分割"则引入性别/癌种与示踪剂的完全混杂(PSMA=男+前列腺癌,无法分离)——混合效应模型只能控制体积/中心/示踪剂,性别与癌种被淹没在 tracer 因子里。其二,三台扫描仪的设备异质性是 LMU 库内的"微型域移":2.73-4.07 mm 的面内分辨率差意味着 PSMA 库内部已有一个分辨率轴——这正是 PSMA-UKT 子集(UKT 的 mCT 分辨率一致性 vs LMU 混合)成绩解读时要小心的混杂:PSMA-LMU 子集(0.6433)的对手库 UKT 是单机,子集间差异混合了设备组合效应。

队列混杂的延伸提醒:任何以"FDG vs PSMA"命名的对比实验(包括总结论文的 tracer 项检验)实际比较的是"UKT 混性别三癌种 vs LMU 全男前列腺癌"两个完整人群包——示踪剂只是人群包差异的一部分。这在实验设计上是嵌套混杂(tracer 嵌套于 center,center 嵌套于人群),III 的 4×50 矩阵缓解了 center 层的嵌套(两 center 都出了 FDG 与 PSMA 测试),但人群层的嵌套(癌种与示踪剂绑定)在本数据内不可解——把 III 的 tracer 结论外推为"示踪剂一般性结论"时要带上这个限定语。

§4.3 队列对照速查

统计量 FDG(UKT) PSMA(LMU)
studies 1,014 597
患者 900(女 444/男 570) 378(全男)
阳性/阴性 501/513 539/58(v3 口径)
病灶总数 8,781 19,377
TMTV (mL) 110,189 132,853
扫描仪 mCT 单机 三机混合
PET 体素 (mm³) 2.04²×3.00 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00
癌种 黑色素瘤/淋巴瘤/肺癌 前列腺癌
配体 [18F]FDG [18F]PSMA-1007 + [68Ga]PSMA-11

§4.4 交付格式与预处理

挑战合并包(nnUNet 格式):

imagesTr/
  CASE_ID_0000.nii.gz   # CT 通道(Hounsfield 单位)
  CASE_ID_0001.nii.gz   # PET-SUV 通道
labelsTr/
  CASE_ID.nii.gz        # 病灶二值掩码(0 背景/1 病灶)
dataset.json             # nnUNet 任务描述
dataset_fingerprint.json # 强度指纹(归一化用)
splits_final.json        # 官方参考 5 折划分
psma_metadata.csv        # PSMA 逐例临床元数据
fdg_metadata.csv         # FDG 逐例临床元数据
  • 预处理:CT 重采样至 PET 分辨率(PET 的各向异性体素是基准网格);PET 由 activity counts 转 SUV(SUV = C_tissue/(A_inj/W),体重归一化标准摄取值)——原始 PET.nii.gz 存 activity counts,直接当 SUV 用会错,须读 SUV 换算后通道(I/II 延续坑,见 §10 坑点 7)
  • TCIA 版目录结构:Patient/Study/{SUV, CTres, CT, SEG, PET}.nii.gz 五件套——SUV(换算后)/CTres(重采样)/CT(原始)/SEG(掩码)/PET(原始 counts)分文件存放
  • splits_final.json:官方参考 5 折——复现 baseline 的标准划分,但注意它是随机划分,不保证 fold 间无患者泄漏的结构性承诺(患者级划分,nnUNet 惯例)

§4.5 测试集与提交物

  • preliminary 阶段:5 studies 在线试提交(榜单校准)
  • final 阶段:200 studies(4×50 矩阵,§3.2)held-out 不发布,GC 平台在线评估
  • 提交物:Docker 容器(输入 CT+PET 双通道 NIfTI/MHA,输出二值掩码);无元数据输入(模型不知道自己在看哪个 tracer 哪个中心)
  • 测试阳性密度对照(§3.2 表):PSMA-LMU 子集 1,309 病灶/50 例 ≈ 26.2 例/例 vs FDG-LMU 410/50 = 8.2——测试集内部病灶密度差 3 倍,FPV/FNV 的绝对体积阈值在不同子集的难度含义不同

测试口径的两个补充说明:其一,final 与 preliminary 的子集构成不同——5 例 preliminary 只用于榜单校准与管线验证,其分数与 final 200 例不可比(样本量与分布双重差异),把 preliminary 分数当成绩引用是常见错误;其二,测试子集的 TMTV 悬殊(882-7,127 mL,相差 8 倍)意味着 PSMA-UKT 子集不仅病灶小且总量轻——该子集 FNV 的绝对体积天然小,跨子集比较 FNV 时要按体积归一化思维解读,不能直接比绝对值。

§4.6 元数据字段:两份 CSV 的成像协议闭环

逐例元数据 CSV(psma_metadata.csv/fdg_metadata.csv)使 III 成为 PET 分割数据集中协议字段最完整的之一——每个影响 SUV 定量与影像外观的采集变量都有落位:

字段族 FDG(UKT) PSMA(LMU) 建模用途
患者学 年龄(60±16)/性别(444F/570M)/体重(79±19 kg) 年龄(71±8)/全男/体重(83±14 kg) SUV 体重归一化的分母、人群偏移分析
注射 [18F]FDG 活度(论文口径 mean 314.7±22.1 MBq) [18F]PSMA-1007 246±27 / [68Ga]PSMA-11 214±45 MBq SUV 分子、剂量-质量对照
时序 摄取 ~60 min 摄取均值 74 min(范围 6-181 / 7-195) SUV 时间漂移协变量
设备 Siemens Biograph mCT(单机) TruePoint / mCT Flow 20 / Discovery 690 域移因子(center 效应的物理载体)
采集参数 CT 120 kV/200 mAs、OSEM 3i/21s、2 mm Gaussian 143 mAs、100/120 kV、层厚 2.5-5.0 mm 重建风格敏感性分析
病灶学 病灶数/TMTV(8,781/110,189 mL) 病灶数/TMTV(19,377/132,853 mL) 难例分层与混合效应协变量

方法学价值:混合效应模型(§6.3)的协变量(体积/中心/示踪剂)全部能从 CSV 重建——公开元数据使统计结论可独立复算,这是 AI-Ready 度的高阶指标(多数分割库只给影像+掩码,不给可复算统计的原料)。

CSV 的字段边界也要认清:只有成像协议族(年龄/性别/体重/活度/摄取时间/设备/重建参数),没有临床结局族(分期/Gleason 评分/治疗/生存)——后者在 PSMA 前列腺癌队列的临床研究中常被需要,但挑战元数据刻意最小化以降低再识别风险(378 例全男性前列腺癌的人群,[年龄×日期×结局] 组合的再识别风险不可忽视)。需要结局变量的研究者应回到原始研究协议框架(联系 LMU/UKT)而非试图从公开元数据反推——这条边界写在 §9.2 的元数据最小化条款里,是隐私设计的组成部分而非数据缺失。

§4.7 方法论底座:SUV 定量链与为何 counts 不是 SUV

PET 定量的物理链路决定了本条目反复出现的"counts vs SUV"坑(坑点 4):

  1. 发射计数:正电子湮灭产生双光子,探测器记录符合事件(counts)——原始重建的输出单位是每体素计数率,取决于注射活度、摄取时间、体重、扫描仪灵敏度
  2. SUV 归一化:SUV = C_tissue/(A_inj/W)——把计数换算为"组织浓度相对注射剂量按体重归一"的无量纲量;A_inj(注射活度)与 W(体重)都在元数据 CSV 里
  3. 为何不能跳过:同一患者同一病灶,注射 250 MBq 与 350 MBq 的 counts 可差 40%,SUV 却应一致——用 counts 训练的模型学到的"强度"混入了剂量噪声;跨库(FDG vs PSMA、UKT vs LMU)时 counts 完全不可比,SUV 才是共同语言
  4. 挑战交付的选择:合并包 PET 通道(_0001)已是 SUV;TCIA 载体 PET 与 SUV 分文件并存——两载体都给了正路,坑只坑不看文档的人
  5. 归一化分歧的根源(§3.5/§7.5):SUV 本身仍带绝对生理量纲(肝本底 SUV≈2-3、脑 SUV 高、膀胱因排泄极高)——global z-score 抹平个体间差异、per-image 保留相对结构,两派分歧本质是对"生理量纲是不是信号"的判断

§4.8 跨载体对齐实操:patient hash 与日期陷阱

需要同时使用 TCIA(DICOM)与 FDAT(NIfTI)的研究者会遇到对齐问题——三个事实决定解法:

  1. TCIA 日期已移位:study dates 全体移位至 1997-2005 窗口(去标识化的日期泛化)——与 FDAT 的真实(或 FDAT 侧泛化)日期不可 join
  2. patient hash 是唯一桥梁:两载体共享同一 patient hash 命名体系——按 PatientID hash 匹配后,study 级以序列内顺序或 spacing 指纹辅助对应
  3. 内容指纹兜底:当 hash 命名规则存疑时,用体素 spacing+shape+掩码体积三元组做内容级指纹匹配(HF 镜像的逐例 shape/affine 校验脚本即此思路)

实操建议:大多数研究不需要跨载体对齐——nnUNet 训练用 FDAT 合并包一站搞定;TCIA 载体的价值在 DICOM 原生字段(设备参数/序列细节)与 CC BY 4.0 授权场景。两载体当作"同一数据的两个视图"分别用,避免强行合并的工程成本。

§5 标注协议:两步法与资历披露

§5.1 协议两步法

两个库共享"联合判读→逐层勾画"的两步协议,PSMA 论文(2026)进一步细化了第二步:

  1. Step 1 联合视觉判读:reader 同时查看 PET(SUV 图)、CT 与临床报告,识别全部肿瘤病灶——临床报告参与判定(FDG 阳性判定依据临床报告;恶性病灶含原发灶与全部转移灶)。这一步是"检测",决定哪里有病灶
  2. Step 2 逐层手工勾画:轴位逐层 free-hand 描画病灶轮廓。PSMA 论文细化为:先在轴位层面画圆形 VOI 包住候选病灶,以 SUV 阈值预分割打底,再逐层手工修正——阈值仅用于加速描画,最终掩码完全由手工修正决定(阈值不作最终输出,避免阈值协议偏差进入金标)

工具:PSMA 标注使用 mint Medical Mint Lesion™(CE 认证的肿瘤测量软件,Heidelberg)——CE 认证医疗器械软件做研究标注,是 PSMA 库质量叙事的一部分。

协议的工程含义注脚:Step 1 的"临床报告参与判定"意味着金标的信息含量高于影像本身——reader 可以依据随访/病理确认的报告把影像上不典型的病灶纳入,或排除影像疑似但临床阴性的发现。这使得"算法 vs 金标"的差距不能全读作"算法失败":部分差距是信息不对称(算法只看影像,金标看过报告)。总结论文把这一现实写进了临床建议(§6.5 的"不能当二分类器"),也是 reader agreement 结论(“approaching reader agreement”)的分寸所在——接近的是"影像判读的 reader",而非"全信息诊断的 reader"。

§5.2 标注者资历:两套口径并存(存照)

资历披露是本条目的伦理/质量轴亮点,但官网(挑战期)与 Sci Data 论文(2026)两套口径数字不同,须并存存照:

口径 reader 资历 复核机制
官网挑战页口径 UKT FDG 训练+测试:10 年经验 Hybrid Imaging 放射科医生;LMU FDG 测试:8 年经验;PSMA(LMU 训练+测试、UKT 测试):单 reader 单 reader + 5 年经验复核
Sci Data 论文口径(PSMA) 单 reader 3 年经验 4 年与 >10 年两位 board-certified 专家独立验证

坑 5:引用资历时必须注明口径来源——“5 年复核”(官网)与"3 年标注+4/10+ 年双专家验证"(论文)不是矛盾而是时点与详细度不同:挑战页压缩叙事,论文按投稿要求全披露。AI-Ready 评估视角:不论取哪个口径,标注链(单人主标+多资历复核)都是可追溯的——这已优于绝大多数 PET 分割数据集(多数只有"expert annotated"一句话)。

§5.3 标注粒度与语义边界

  • 二值掩码:所有病灶统一标签 1,不区分原发/转移、不区分病灶类型——任务被刻意简化为"检测+勾画所有恶性病灶",多类语义(如 metastasis 分期)留作下游研究
  • FDG 阴性对照的语义:513 例无病灶 scans 不是"没有标注"而是确认无病灶(依据临床报告)——阴性对照是 FPV 指标的测试面,训练时可直接用于假阳抑制(autoPET-v 条目坑点 3 的延续提醒)
  • PSMA 阳性例数版本修正:v1(挑战期)537/60 → v3(论文口径)539/58——修正涉及 3 名患者 5 例 mask(增删与边界修正),v2 版本说明记录在案。使用 v1 原始字节的队伍(如挑战期参赛者)与 v3 使用者的训练分布有微小差异

§5.4 标注口径的系列内对照(I/II/III)

III 继承 I/II 的 FDG 标注体系并在 PSMA 侧扩展出新的披露细节,三条线并列:

维度 FDG(I/II/III 共用) PSMA(III 新增)
reader UKT 单中心 10 年经验 Hybrid Imaging 放射科医生(官网口径) LMU 单 reader(论文:3 年经验)
复核 (I/II 论文口径的专家链) 5 年经验复核(官网)vs 4 年+>10 年双专家独立验证(论文)
工具 free-hand 逐层勾画 Mint Lesion™(CE 认证)+SUV 阈值预分割+手工修正
判定输入 PET+CT+临床报告(阳性判定依临床报告) PET+CT+临床报告(前列腺癌全程管理报告)
粒度 二值病灶掩码(不分原发/转移) 同左
版本治理 (I/II 口径稳定) v1→v2→v3 三版,5 例 mask 修正有记录

方法学意义:同一挑战内两个标注体系并行(不同机构、不同资历、不同工具),而混合效应模型(§6.3)的 tracer 项不显著说明标注体系的差异没有传导为可测的分割难度差异——这是对"标注者效应"的一次自然实验。

§6 评估体系:Dice/FPV/FNV 与混合效应模型

§6.1 三个指标的定义

指标 定义 捕捉什么 何时计算
DSC(Dice) 2× pred∩GT /(
FPV 假阳体积:pred 中不与 GT 相交的 18-连通域体积之和(connectivity=18) 假阳(误报)总量 全部病例(含阴性)
FNV 假阴体积:GT 中未被 pred 覆盖的体积 假阴(漏报)总量 仅阳性病例

细节约定:FPV 按 18-连通域计算且不重叠体积求和——一个孤立误报器官算一次其全部体积,而不是逐体素累加后再除;健康病例(无 GT 病灶)的 Dice 无定义,只计 FPV——这使阴性对照在指标体系中有明确角色(惩罚过度分割)而不污染 Dice 均值。冠军 mean 成绩:DSC 0.66 / FNV 3.18 mL / FPV 2.78 mL。

§6.2 排名合成:四层聚合

Layer 1  每算法×每子集×每指标 → 原始值
Layer 2  4 子集均值(每算法每指标)
Layer 3  跨算法排名(每指标一个名次序列,tie break 用 Dice)
Layer 4  加权合成 = 0.5×rank(Dice) + 0.25×rank(FPV) + 0.25×rank(FNV)

一个数值示例让四层聚合可感:假设某算法 4 子集 Dice 均值排第 1、FPV 排第 5、FNV 排第 3,合成 = 0.5×1+0.25×5+0.25×3 = 2.5(越小越好);另一算法三项均排第 2,合成 = 0.5×2+0.25×2+0.25×2 = 2.0——全面第二的算法反超"单项第一但 FPV 偏差大"的算法。这正是加权名次合成的设计意图:防止单指标极化队伍登顶,也解释了为何第 2/3 名分差只有 0.03(IKIM 8.4062 vs HussainAlasmawi 8.4375,GC 名次分口径放大 10 倍显示)。

权重设计(Dice 0.5/FPV 0.25/FNV 0.25)隐含立场:分割精度与漏报比误报更重——临床语义上,漏掉一个转移灶(FNV)比多勾一块骨髓摄取(FPV)后果更重,但大量假阳会淹没阅片效率,故 FPV 以半权重入榜。名次合成而非数值合成,避免长尾极端值(如超时队伍 FPV 924 mL)扭曲聚合。

§6.3 混合效应模型:把"算法差异"放进方差分解

总结论文(arXiv 2605.05775)的方法论核心是线性混合效应模型(linear mixed-effects)对 DSC 的方差分解——这是挑战赛总结里罕见的统计深度:

方差成分 估计 占比
患者异质性(随机效应) σ=0.171 61%
残差(含算法×患者交互) σ=0.134 38%
算法间差异(随机效应) σ=0.025 1.3%

推论(论文原文口径):两个随机患者的期望 DSC 差约是两个随机算法差的 7 倍。临床翻译:病例难度 >> 算法优劣——同一个算法在容易病例和难病例上的差距,远大于好算法与差算法在同一病例上的差距。对挑战赛机制本身的启示:27 个决赛算法挤在 1.3% 的方差里内卷,而 61% 的方差在病例侧——优先级应从"选算法"转向"难例分诊+医师复核"(总结论文的临床建议)。

§6.4 固定效应发现

  • 病灶体积:参考病灶体积每翻倍 → DSC +0.039 [95%CI 0.030, 0.048]——大病灶好分割,小病灶是 Dice 的主要拖累(与 PSMA-UKT 最差子集互证:低分辨率下小病灶更小)
  • 中心效应:体积调整后 UKT +0.14 [0.063, 0.217]——UKT 影像(单机一致分辨率)系统性易分割
  • 示踪剂效应:tracer 主效应与 tracer×center 交互不显著——在体积与中心调整后,"PSMA 难"主要经由分辨率与病灶大小传导,而非示踪剂本身
  • PSMA 配体消融:PSMA-LMU 内 [68Ga]PSMA-11(n=16)vs [18F]PSMA-1007(n=17)无差异(β=−0.03 [−0.21, 0.16])——算法跨 PSMA 配体泛化,两种 PSMA 配体在算法眼里是一回事

§6.5 指标体系的临床警示

  • 几乎所有指标分布非正态、长尾:多数病例成绩优秀,少量难例拉低均值——总结论文原话 “majority of cases look excellent, yet aggregate metrics appear modest”(多数病例看起来极好,而聚合指标显得平平)
  • 当前模型不能当二分类器用:治疗后改变(炎症/术后变化)在 FDG 上高摄取,导致阴性病例误报——把 FPV 低解读为"可以无人值守"是危险的误读
  • 常见失败模式图谱:假阳=生理摄取(FDG 侧:骨髓、纵隔、棕色脂肪、脑、膀胱;PSMA 侧:肝、脾、肾、颌下腺);假阴=小病灶/低摄取病灶——失败模式是结构性的(生理学决定),不是随机噪声

§6.6 混合效应模型的形式与读法

为让 §6.3-§6.4 的数字可复算,把模型形式写清楚(总结论文口径的合理重构):

DSC_ij ~ β0 + β1·log2(volume_ij) + β2·center_j + β3·tracer_j
         + b_patient_j + b_algorithm_i + ε_ij

随机效应:b_patient ~ N(0, 0.171²)   # 患者异质性
          b_algorithm ~ N(0, 0.025²) # 算法差异
残差:ε ~ N(0, 0.134²)

读法要点:

  • 为什么患者是随机效应:27 个算法评同一批 200 例测试患者——患者抽样被视作从总体"病例难度分布"的随机抽取,其方差(61%)刻画的是病例难度谱宽,而非某个具体患者
  • 为什么算法也是随机效应:研究问题不是"这 27 个谁强"(那是排名的事),而是"算法整体能解释多少 DSC 变异"——1.3% 即答案;把算法当固定效应反而无法回答这个泛化问题
  • CI 的解读范例:β1=+0.039 [0.030, 0.048]——95% 置信区间不含 0,“体积每翻倍 DSC 提升"是稳健结论;tracer 项 CI 含 0(不显著)≠“tracer 无影响”,而是"体积与中心调整后无可测残差影响”(影响已由协变量传导,§6.4)
  • 与排名体系的关系:混合效应是科学分析层(解释变异来源),加权排名是竞赛机制层(选出名次)——两层用同一批数据回答不同问题,III 把两层都做齐了,这比多数挑战赛"只排名不解释"的总结方式高一个方法学层级

§6.7 评估体系的五届演化(III 的位置)

届 指标体系 演化含义
I Dice 单指标 重叠即一切——体素几何的原点
II Dice(环境分层) 数据分层但不改指标——泛化问题先于指标问题
III Dice 0.5+FPV 0.25+FNV 0.25(4 子集聚合) 多维+跨域聚合——"假阳/假阴分账+组合泛化加权"的指标自觉
IV Dice+交互量 人类介入进入评估对象
V AUC-Dice+AUC-DMM 50/50 实例级检测+交互效率曲线化——指标体系成熟态

III 在演化线上的位置:把"病灶分割"从单 Dice 语义拆成精度/误报/漏报三个正交账本并显式加权——V 的实例级 DMM 本质是 FPV/FNV 思想的实例化延伸;而 III 的 4 子集聚合则是 V 的"统一多中心队列"评估的矩阵化前奏。读 V 条目(rid 634)的评估章时回看本节,能看到指标演化的连续轨迹而非突变。

§7 参赛方法生态:从 563 注册到 LesionTracer

§7.1 参与漏斗

阶段 规模 备注
注册 563 人(截至 2024-11) 地域分布:亚洲 53%(其中中国 29%)/欧洲 28%(其中德国 8%)/北美 13%(其中美国 10%)/大洋洲 2%/南美 2%/非洲 <1%
初赛(preliminary) 24 队提交 218 算法 人均 9 次提交——GC 平台试错型迭代
决赛(final) 17 队 27 算法 +2 官方 baselines = 29 个评估对象
论文潮 一周 7 篇 arXiv(2024-09) 无 embargo 规则的即时效应

漏斗数字的两个横向对照:其一,初赛 218 算法/24 队的提交密度在 GC 挑战里偏高——每队平均 9 次提交意味着多数队伍把 preliminary 当调参回路使用(榜单校准式开发),这与 5 min/例的快推理约束互为因果(单次提交快→迭代成本低→提交频率高);其二,注册 563 vs 初赛 24 队的 4% 转化率提醒读者:GC 注册数与"有效参赛规模"差一个数量级——跨挑战赛比较参与度时应统一用提交数口径而非注册数口径,否则 III 的"563 人"会被系统性高估为与真实竞争规模同量级。

§7.2 冠军方案 LesionTracer:五件套拆解

Team LesionTracer(DKFZ MIC + Heidelberg:Maximilian Rokuss、Balint Kovacs、Yannick Kirchhoff、Shuhan Xiao、Constantin Ulrich、Klaus H. Maier-Hein、Fabian Isensee——nnU-Net 核心作者本人参赛;arXiv 2409.09478;代码 github.com/MIC-DKFZ/autopet-3-submission):

# 组件 内容 增益逻辑
1 nnU-Net ResEncL nnU-Net 框架的 residual encoder 大配置(大内核大容量) PET 体积数据的容量升级——default 配置欠拟合
2 misalignment 增强 模拟 PET-CT 配准错位的弹性形变增强 双模态输入的现实噪声:PET 与 CT 硬件配准误差
3 多模态预训练 CT/MR/PET 多数据集预训练(公开数据) 跨模态影像先验迁移
4 器官监督多任务 附 TotalSegmentator 器官掩码做辅助任务(含独家唾液腺标签) 生理摄取假阳抑制——唾液腺/颌下腺是 PSMA 生理摄取重灾区
5 动态测试时增强 推理时按 5 min 预算动态启停 TTA 预算内榨精度

内部消融阶梯(冠军论文口径):default nnU-Net Dice 57.61 → ResEncL 65.31 → 完整方案 68.40(FPvol 7.82 / FNvol 10.35)——ResEncL 一项贡献 7.7 个点,是最大单一增益;其余四件套合计再添 3.1 点。官方测试 4 子集:0.6619/0.6433/0.7702/0.5711,mean 0.66。

五件套的工程细节补注:ResEncL 的"大内核大容量"对 PET 的意义在于全身视野的大感受野——病灶可出现在从颅底到大腿的任意位置,单帧上下文需要覆盖整躯干;misalignment 增强的形变幅度标定来自 PET-CT 硬件配准的实测误差(呼吸运动+多床位拼接);预训练数据涵盖 CT(腹部/胸部公开集)与 MR——跨模态先验使 CT 通道的解剖特征更早可用;唾液腺标签是冠军队自标注的独家增量(TotalSegmentator 早期版本不含颌下腺细分割)——为 PSMA 侧的头号假阳源定制;动态 TTA 的"动态"指按剩余时间预算决定增广轮数——满预算多轮、超时风险截断,是时间约束下的在线调度问题。

§7.3 榜单分布

名次 队伍 分数 归属
1 LesionTracer 最优(mean Dice 0.66) DKFZ/Heidelberg(德国)
2 IKIM 8.4062(加权名次分) IKIM Essen(德国)
3 HussainAlasmawi 8.4375 MBZUAI(阿联酋)
24.0 nnunet baseline — 官方 AC1 起点(27 算法+2 中位偏后)
7 Lennonlychan(AC2 冠军) — CUHK(香港)
10 ZeroSugar(AC2 第 2) — 样本过滤策略
15.31 datacentric baseline — AC2 起点(overall 口径名次)

前三名差 0.03 个名次分(8.4062 vs 8.4375)——头部算法在名次合成下几乎并列,呼应 §6.3 的 1.3% 方差结论。nnunet baseline 排 24.0 位:官方 baseline 与冠军差 10.8 个 Dice 点,说明 AC1 赛道的模型侧空间仍然巨大;而 AC2 侧 datacentric baseline(15.31)显著优于原版 nnU-Net baseline(24.0)——只改数据管线就前进 8.7 个名次位。

§7.4 AC2 data-centric 结果:数据工程的上限实验

  • AC2 冠军 Lennonlychan(CUHK,Lap Yan Lennon Chan + Yixuan Yuan):用 diffusion model 生成肿瘤样本扩充训练集——在不改模型一行的约束下,合成数据把 baseline 推到 overall 第 7;生成模型在医疗分割挑战赛的高位完赛,是 2024 年 data-centric 叙事的标志性案例
  • AC2 第 2 ZeroSugar:样本过滤(数据清洗路线)
  • 方法论注脚:AC2 冠军overall 第 7 但未进 AC1 前三——合成数据的增益上限仍低于冠军的五件套模型工程;两条路线各有天花板

§7.5 方法论生态普查(总结论文口径)

  • 器官监督:6 队使用 TotalSegmentator 器官掩码做辅助任务——FPV 抑制的公共秘方(冠军、亚军皆用)
  • TTA 预算适配:LesionTracer/AiraMatrix/QuantIF/WukongRT 实现动态 TTA——5 min 限制下的共同工程响应
  • fold 组合:AiraMatrix 用 STAPLE 组合多 fold 输出
  • 归一化分裂:PET 归一化分裂为 global(nnU-Net 风格 z-score,用 dataset fingerprint 全局统计)vs per-image 两派——无共识,双派皆有上榜者
  • 共性:几乎所有决赛队都是 nnU-Net 变体——III 再次证明 nnU-Net 在医学分割的默认地位(Isensee 本人夺冠使这一点更具戏剧性:作者用自家框架证明框架的上限)

生态普查的两个长期效应:其一,器官监督与动态 TTA 的"公共秘方化"——这两项技术在 III 之前散见于各论文,III 之后成为 PET 分割的默认配置(V 届 baseline 直接内置),挑战赛作为"方法固化为社区默认"的加速器在此显形;其二,归一化两派的持续分裂——III 没有给出裁决,V 的统一队列设计也未裁决,归一化选择至今是 PET 分割的"风格分歧"而非"对错分歧",这提醒读者:挑战赛能裁决的问题(方法排序)与不能裁决的问题(设计选择的情境依赖性)需要分开对待。

§7.6 冠军代码仓库结构(可复现性解剖)

github.com/MIC-DKFZ/autopet-3-submission(规则强制开源+公开权重)的目录逻辑即"五件套"的代码化:

autopet-3-submission/
├── nnunet training configs    # ResEncL 训练配置(plans/trainer 定制)
├── preprocessing/             # 双通道(CT HU + PET SUV)预处理管线
├── augmentation/              # misalignment 增强(PET-CT 配准错位模拟)
├── pretraining/               # CT/MR/PET 多数据集预训练脚本
├── organ supervision/         # TotalSegmentator 掩码辅助任务(含唾液腺标签)
├── inference/                 # 动态 TTA(5 min 预算内启停)+ Docker 打包
└── README                     # 复现路径与权重下载

对照价值:官方 baseline 仓(ClinicalDataScience/autoPETIII)与冠军仓的 diff 就是"AC1 的模型侧上限空间"——nnunet-baseline 排 24.0 位 vs 冠军第 1,两者之间的每一个目录都对应 §7.2 表的一个组件。同样,DKFZ 自己的 data-centric 提交(LesionTracer2,github.com/MIC-DKFZ/miccai2024_autopet3_datacentric)展示了同一团队在"只许改数据"约束下的打法——AC1/AC2 双赛道在 DKFZ 内部形成了自我对照。

§7.7 常见失败模式的生理学图谱(FPV/FNV 的结构来源)

总结论文的失败模式分析可以组织成一张生理学地图——假阳不是随机错误,而是生理摄取的系统性撞车:

模态 假阳重灾区(生理高摄取器官) 为什么撞车
FDG 骨髓、纵隔(血池/炎症)、棕色脂肪、脑、膀胱(排泄) 葡萄糖代谢是广谱生理过程——炎症与 brown fat 的代谢激活与肿瘤摄取同谱段
PSMA 肝、脾、肾、颌下腺 PSMA 受体在正常组织有生理表达——唾液腺/肾/肝脾的表达图谱与转移灶同谱段

假阴侧:小病灶(体积效应——部分容积效应使小病灶 SUV 被稀释)与低摄取病灶(分化好/治疗后)。方法论推论:器官监督(冠军组件 4)本质是把"生理摄取地图"作为先验注入模型——6 队用 TotalSegmentator 的现象由此可解释;而 FNV 难题(小/弱病灶)无先验可借,是 PSMA-UKT 子集 0.5711 的主要构成。这也是 §6.5「不能当二分类器」结论的病灶级根源:治疗后炎症在 FDG 上的高摄取与肿瘤复发在影像特征上同谱,需要临床报告级别的信息才能分辨——而这恰是规则中排除的元数据。

§7.8 AC1 vs AC2 的名次解读:两条路线的分数几何

把双赛道的结果放回同一张榜单读,有三个不对称:

  • 模型侧天花板更高:AC1 冠军(68.40)比最好的 AC2 成绩(overall 第 7)名次高 6 位——模型工程(容量+预训练+多任务)仍压过数据工程;但这不是 data-centric 的失败,而是数据侧约束更紧(禁外部数据+固定 baseline)
  • 数据侧性价比更高:datacentric baseline(15.31)仅凭组织方预置的数据管线改进就甩开原版 nnU-Net baseline(24.0)8.7 位——AC2 的"入门红利"大于 AC2 的"夺冠上限",说明 baseline 默认数据管线远非最优
  • 两赛道的方法互窃:AC1 冠军的器官监督本质是"加数据"(辅助标签),AC2 冠军的合成样本本质是"造数据"——两条路线最终都在改训练分布,真正的分界是"改不改动模型代码",而非"改不改数据"

竞赛机制层的注脚:AC2 禁外部数据+禁改模型使排名完全归因于数据操作——这一设计的可解释性红利(冠军论文 2409.08068 的 synthPET 消融可以干净归因)是单赛道设计无法提供的。

§8 时间线与参与度

§8.1 时间线全景

时间 事件
2022-09 autoPET I(MICCAI 2022)——FDG 库首战,segmentation frontier
2022-10 FDG 库数据论文刊出(Sci Data 9:601,DOI 10.1038/s41597-022-01718-3)
2023 autoPET II(MICCAI 2023)——generalization frontier,跨环境鲁棒性暴露泛化缺口
2024-04-01 III 训练数据发布(挑战期口径,CC-BY-NC 4.0;FDAT 记录 0zs4c-89f12)——1,611 studies 合并包上线
2024-04-18 Zenodo 挑战提案发布(DOI 10.5281/zenodo.10990931,CC BY-4.0,PDF 0.1 MB)
2024 春-夏 Preliminary 阶段:24 队 218 算法提交(5 例试提交集)
2024-09 final test 阶段:17 队 27 算法,200 例 4×50 矩阵
2024-09-14 冠军论文 arXiv 2409.09478(LesionTracer);一周内参赛论文 7 篇
2024-10 MICCAI 2024 现场公布结果(第 27 届,Marrakesh, Morocco)
2024-11 注册统计口径点:563 人(亚洲 53%)
2026-05-07/11 挑战总结论文 arXiv 2605.05775(v1/v2,投 Medical Image Analysis)
2026 PSMA 数据论文刊出(Sci Data 13:1023,DOI 10.1038/s41597-026-07821-z);FDAT PSMA v3(539/58 口径)

时序要点:**数据先行(2024-04)→论文滞后(2026)**的双出口时序错位(§1.3 坑 1);总结论文在系列节奏中的位置——IV 已开赛(2025)后 III 的总结才挂 arXiv,挑战赛运营与学术出版的时间差是常态。时间线的另一个双口径注记:训练数据发布日期"2024-04-01"为总结论文口径(挑战官方叙事的开赛日),FDAT 记录 0zs4c-89f12 的平台时间戳与 Zenodo 提案的 04-18 发布日各有其位——引用"开赛时间"用 04-01,引用"提案登记"用 04-18,两者不矛盾(先发布数据后登记提案 DOI 的顺序反映 GC 挑战的运营节奏)。

§8.2 参与度结构

  • 地域:亚洲 53%(中国 29%)、欧洲 28%(德国 8%)、北美 13%(美国 10%)、大洋洲 2%、南美 2%、非洲 <1%——亚洲占半壁,与 GC 平台整体参与结构一致;冠亚军均欧洲队伍(DKFZ/Essen),第三名中东(MBZUAI)
  • 漏斗:563 注册 → 24 队 218 算法(初赛)→ 17 队 27 算法(决赛)——注册到决赛转化率 3%,初赛提交密度(218/24≈9 算法/队)显示 GC 平台的迭代型参赛文化
  • 产出:决赛 27 算法中 1 篇 preprint 未公开(nnunet baseline 无 preprint);2024-09 一周 7 篇、两年窗口 13+ 篇衍生 arXiv 论文

漏斗的另一面:注册 563 人中未进入初赛提交的超过 95%——GC 挑战赛注册即下载训练包的门槛极低,注册数更多度量"社区兴趣"而非"有效竞争";有效竞争的度量是初赛提交(24 队 218 算法,注册者的 4.3%)与决赛(17 队,初赛队的 71% 存活)。组织方以 5 例试提交集+preliminary 榜单为漏斗中部的校准器——这一"低门槛注册+高门槛决赛"的漏斗设计是 GC 平台的通用范式,III 的数字为其提供了又一次完整采样。

§8.3 与前后届的时间咬合

III 是系列承上启下的一届:其冠军权重成为 IV/V 的初始化起点(§0.4),其 4×50 组合泛化设计在 V 中演化为"新统一多中心测试队列+交叉标注矩阵";其 data-centric 赛道实验(AC2)为系列积累了"固定 baseline 对照"的方法学资产。系列条目对照阅读顺序建议:rid 468(I/II)→ 本条 → rid 634(V)。

§8.4 注册地域分布全表

大洲 占比 细分 观察
亚洲 53% 中国 29%(亚洲内过半) 全球最大参与极;决赛上榜者含 UIH_CRI_SIL(联影中央研究院)、HKURad、WukongRT 等亚洲队
欧洲 28% 德国 8% 冠亚军均德国(DKFZ/Essen)——主办国学术重镇(DKFZ/LMU/UKT/TUM)密度效应
北美 13% 美国 10% BAMF AI 等决赛队
大洋洲 2% — —
南美 2% — —
非洲 <1% — 主办地摩洛哥(MICCAI 2024 会址)本地参与未见披露

方法论观察:注册地分布与决赛上榜分布错位——亚洲贡献一半注册,决赛头部由欧洲队伍主导;挑战赛的参与漏斗在地缘上不均匀(注册门槛低、决赛门槛是算力+工程密度)。中国 29% 的注册占比与 2019 年以来 MICCAI 挑战赛的参与趋势一致。

§9 伦理、许可与可获取性

§9.1 三层异构可获取性(AI-Ready 光谱核心)

载体 格式 标识 授权 特别注意
TCIA DICOM FDG DOI 10.7937/gkr0-xv29;PSMA DOI 10.7937/r7ep-3x37 CC BY 4.0(defaced);autopet.org 旧页另写 “TCIA Restricted license”(双口径存照) study dates 移位至 1997-2005;defaced 去面部标识
FDAT NIfTI 合并库 10.57754/FDAT.rdkqd-wdh87;PSMA v3 10.57754/fdat.gabc0-3hv03;挑战 v1 0zs4c-89f12 CC BY-NC 4.0(商用需联系组织方) nnUNet 格式即拿即训;v1/v3 版本差异(§5.3)
HuggingFace NIfTI/Parquet MedOtter/PSMA-PET-CT-Lesions(21 GB,597 行) CC BY-NC 4.0 口径 逐例 shape/affine 校验脚本随库——社区质检样本
Zenodo PDF 10.5281/zenodo.10990931→10990932 CC BY-4.0 仅提案 PDF 0.1 MB,非数据(§2.1 坑 2)

组织方官网许可原话:“Everyone (also non-participants of the challenge) are free to use the training data set in their respective work, given attribution in the publication. If you plan to use the data in a commercial setting, please reach out to the organizers.”——学术自由用(注明出处)、商用要谈。全部开放获取、无注册门槛(TCIA/FDAT/HF 三载体皆公开直载);但授权口径三轨并存(CC BY 4.0 / CC BY-NC 4.0 / 旧页 Restricted 字样),引用与商用前必须核对载体级授权。NIfTI/挑战官方口径取 CC BY-NC 4.0。

§9.2 隐私与去标识

  • defaced:TCIA DICOM 已行面部去标识(头颈部体素替换)——FDAT NIfTI 版未 defaced(研究协议约束下发放),两载体隐私处理强度不同
  • study dates 移位:TCIA 版检查日期全体移位至 1997-2005 窗口(日期泛化),与 FDAT 版按日期不可 join——跨载体对齐仅能以 patient hash
  • 元数据最小化:挑战元数据 CSV 只含年龄/性别/体重/剂量/摄取时间/扫描仪等成像参数,无病理分期/治疗/生存等临床结局——病灶生物学结局变量缺席,限制下游预后建模
  • 伦理审批:两库采集均在各自机构伦理框架内(原数据论文披露 LMU/UKT 审批),挑战页未单列 IRB 编号——以 TCIA/FDAT 载体的审批链为信用背书

§9.3 维护与版本治理

  • FDAT 记录带版本历史(v1→v2→v3),PSMA 阳性例数修正有记录可查(§5.3)——版本治理透明度高于平均
  • HF 镜像(MedOtter)为社区行为,非官方出口——其 539/58 口径与 FDAT v3 一致,可作交叉校验源而非主源
  • 系列级代码资产(lab-midas/autoPET 评估脚本)跨届共用——V 届的 AUC 指标实现也在此仓,脚本连续性是系列复现的隐形基础设施

§9.4 商用与再分发的实操问答

  • 学术用途:三载体任选,注明出处即可(官网原话 “free to use … given attribution in the publication”);NIfTI 与 DICOM 的授权差异在学术场景不构成实际障碍
  • 商用场景:FDAT NIfTI 的 NC 条款禁止——需 “reach out to the organizers”(联系 LMU/UKT 组织方谈授权);TCIA DICOM 的 CC BY 4.0 理论上允许商用,但同一份数据的商用权利不应通过换载体绕过——保守做法是统一按组织方口径协商
  • 再分发:CC BY/CC BY-NC 均允许带署名再分发(NC 版不得商用)——HF 镜像(MedOtter)的存在即 CC BY-NC 再分发的合规实例;再分发时应保留版本标识(v1/v3 口径差异会传导到下游,见坑点 3)
  • 衍生模型权重:按 CC BY-NC 4.0 口径,NC 数据训练的权重是否受 NC 约束在法学上存争议——保守口径下商用部署前咨询组织方;这亦是本条目 DAIMS 伦理维度扣分的点之一
  • 混合训练:与 CC BY 数据混训后再商用,授权边界更模糊——建议按最严成分(NC)处理

§9.5 TCIA 生态位(与库内影像载体谱系的关系)

III 的两库在 TCIA 收藏谱系中的位置值得库内读者注意:FDG-PET-CT-Lesions 与 PSMA-PET-CT-Lesions 都是 TCIA 上少见的 PET/CT 双模态+病灶级手工掩码收藏(多数 TCIA 收藏是 CT/MR 单模态或放射学诊断影像)——库内同类仅 lung-pet-ct-dx(rid 475,FDG 单示踪剂)与 LCTSC(胸部器官 CT 掩码,非病灶)。TCIA 的分析结果(Analysis Results)结构使 SEG 掩码可被 Dice 类工具直接读取;DICOM-SEG 封装的掩码与 FDAT 的 NIfTI 掩码内容同源但封装异构——用 SimpleITK/dcmqi 转换时注意掩码几何原点对齐。

§10 总结:示踪剂前沿教会我们的事

AutoPET III 的核心贡献不在"更大的数据"(1,611 studies 在 2026 年视角不算巨型),而在把"组合泛化"从直觉变成可测量的实验设计:4×50 交叉矩阵用 200 例 held-out 数据把"未见 tracer×center 组合"钉死为开放问题,并用混合效应模型把病例异质性(61%)与算法差异(1.3%)的悬殊比例写成挑战赛文献里被引用最多的方差分解。系列意义:III 是权重基础(IV/V 冠军方案自述初始化自 III 冠军)、是数据基础(PSMA 库进入 V 的 QIBA 对齐合并库)、是方法论基础(AC2 data-centric 赛道的首次实验)。对 AI-Ready 数据集评估的启示:测试矩阵设计与方差分解报告,应作为挑战赛型数据资产的核心评分项——数据量相同,测什么、怎么测、测出什么结论,决定资产的科学价值。

§10.1 坑点表(10 坑汇总)

# 坑点 后果与规避
坑点 1 Zenodo 10990931 被当数据集引用——该记录仅含 0.1 MB 提案 PDF,数据本体在 TCIA+FDAT 按 DOI 引用前先查体积;数据引用用 TCIA DOI(10.7937/gkr0-xv29 与 10.7937/r7ep-3x37)
坑点 2 GC 子域拼写:autopet-iii(带连字符)才存在,autopet3/autopetiii/autopet-3 均 404 从 autopet.org 官网 href 反查;检索加 “grand-challenge” 限定词
坑点 3 PSMA 阳性例数双口径:537/60(挑战 v1 官网+总结论文 Table 1)vs 539/58(FDAT v3+HF+Sci Data 论文) 正文按最新库口径(539/58)并注挑战期口径;混用两版会得到对不上的病灶统计
坑点 4 原始 PET.nii.gz 是 activity counts 不是 SUV 直接当 SUV 用会错归一化;读 SUV 通道或按 SUV=C/(A_inj/W) 换算(TCIA 版有独立 SUV 文件)
坑点 5 Dice 的分母陷阱:无病灶病例 Dice 无定义(只计 FPV)——把 0.66 均值当"全体 Dice"是口径错误 引用时标注"阳性病例 Dice+阴性病例 FPV"的合成口径;同域成绩 0.77 量级与跨组合 0.57 分开引用
坑点 6 license 三轨:TCIA CC BY 4.0 vs FDAT NIfTI CC BY-NC 4.0 vs 官网旧页 “Restricted” 字样 商用前按载体核对;NIfTI/挑战口径取 CC BY-NC 4.0(NC 限制商用)
坑点 7 TCIA 与 FDAT 不可按日期 join:TCIA study dates 全体移位至 1997-2005,且 defaced 与否两库不同 跨载体对齐仅用 patient hash;隐私处理强度随载体变化需在论文里声明
坑点 8 5 min/例运行限制:超时提交 FPV 爆表(924 mL 量级),大模型/集成受预算约束 推理工程(动态 TTA/滑窗优化)是参赛必答题;本地复现注意计时口径
坑点 9 测试集同域泄漏风险:final 含 50 例 PSMA-LMU 与训练 597 例同机构同库源,论文未声明不相交 同域子集成绩或含泄漏红利;跨研究比较时勿把 PSMA-LMU 子集分数当独立验证
坑点 10 FDG 剂量双口径:官网 ~350 MBq vs 总结论文 mean 314.7±22.1 MBq(range 150-432) 协议复现取论文口径(含 range);官网数字为挑战期压缩叙事

十坑的使用法:坑点 1-2 是检索层(找资源时不踩空),坑点 3/10 是口径层(引用数字时分清版本),坑点 4/5 是使用层(训练/评测时的技术陷阱),坑点 6-7 是授权与对齐层(工程化前的合规检查),坑点 8-9 是解读层(读榜单时的公平性意识)。按工作流定位坑点:下载数据前看 1/2/6/7,开训前看 3/4,自建评测看 5/8,写论文比较成绩看 9/10——十条覆盖了从检索到发表的完整链路。

§10.2 五届视角下的 III:承上启下的枢纽届

把 III 放回五届谱系看,它同时是三条线的交汇点:

  • 数据线:I/II 的 FDG 单库(1,014)在 III 扩为双库(1,611),PSMA 库自此成为系列常驻资产——V 的 QIBA 对齐合并库(rid 634 条目 §4.3)以 III 的双库为骨架;纵向 CT(IV)与 DeepPSMA(V)都是后续叠加层
  • 方法线:III 冠军权重是 IV/V 两届冠军方案的显式初始化起点(arXiv 2508.21680/2609.01554 自述)——系列方法学的主干从 III 的 nnU-Net ResEncL 五件套上生长;III 的器官监督实践(TotalSegmentator 化)也延续至 V 的 baseline
  • 评估线:III 的 Dice+FPV+FNV 加权是系列评估从"单一 Dice"(I/II)走向"多维指标"(V 的 AUC-Dice+AUC-DMM)的中间态;混合效应方差分解则是一次性的方法学跃迁——V 的总结框架直接继承了它的统计范式

一句话定位:III 之于 autoPET 系列,如同 GPT-3 之于 GPT 谱系——不是最大的一届,而是让后续所有届次都站在其上的那一届。

§10.3 三句话记忆卡

  1. AutoPET III = FDG 1,014 + PSMA 597 = 1,611 studies,测"未见 tracer×center 组合",冠军 DKFZ LesionTracer mean Dice 0.66(同域 0.77,跨组合最低 0.5711)。
  2. 混合效应方差分解:患者 61% / 残差 38% / 算法 1.3%——病例难度碾压算法差异,难例分诊优先于选模型。
  3. 数据三载体(TCIA CC BY 4.0 / FDAT CC BY-NC 4.0 / HF 镜像),Zenodo 10990931 只是 0.1 MB 提案 PDF——别把它当数据引用。

FAQ:40 问直答

Q1 AutoPET III 是什么? MICCAI 2024 官方挑战赛:全身 PET/CT 肿瘤病灶自动分割,多示踪剂(FDG+PSMA)多中心泛化设计,“The tracer frontier”。

Q2 数据量多大? 训练 1,611 studies:FDG 1,014(UKT,900 患者)+PSMA 597(LMU,378 患者);held-out 测试 200 例(4×50 矩阵)+preliminary 5 例。

Q3 在哪里下载? TCIA(DICOM,FDG DOI 10.7937/gkr0-xv29;PSMA DOI 10.7937/r7ep-3x37)、FDAT(NIfTI 合并库 DOI 10.57754/FDAT.rdkqd-wdh87)、HuggingFace 镜像(MedOtter/PSMA-PET-CT-Lesions)。

Q4 Zenodo DOI 10.5281/zenodo.10990931 下的是什么? 挑战提案 PDF(0.1 MB),不是数据——数据本体在 TCIA+FDAT。

Q5 什么 license? 双轨:TCIA DICOM CC BY 4.0(defaced);FDAT NIfTI CC BY-NC 4.0(禁商用)。挑战训练包官方口径 CC-BY-NC 4.0。

Q6 任务形式? CT+PET 双通道输入(nnUNet 格式 _0000 CT/_0001 PET-SUV),输出二值病灶掩码;不告知 tracer 与中心。

Q7 什么是组合泛化测试? final 200 例含 FDG@LMU 与 PSMA@UKT 两个训练中未见的 tracer×center 组合(各 50 例)——测模型在新示踪剂×新中心组合下的表现。

Q8 测试集能下载吗? 不能。200 例 held-out,仅 GC 平台在线评估;preliminary 5 例可在线试提交。

Q9 排名怎么算? Dice 0.5+FPV 0.25+FNV 0.25 加权名次合成;先 4 子集均值、再跨算法排名;tie break 用 Dice。

Q10 FPV/FNV 是什么? FPV=假阳体积(18-连通域求和);FNV=假阴体积。健康病例只计 FPV(Dice 无定义)。

Q11 谁赢了? Team LesionTracer(DKFZ MIC+Heidelberg,Rokuss/Isensee 等)——nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督(含唾液腺标签)+动态 TTA,mean Dice 0.66。

Q12 冠军内部提升多少? default nnU-Net 57.61 → ResEncL 65.31 → 完整方案 68.40(内部消融口径)。

Q13 第二三名是谁? IKIM(Essen,8.4062)、HussainAlasmawi(MBZUAI,8.4375)——加权名次分。

Q14 AC2 data-centric 赛道是什么? 固定 MONAI nnU-Net baseline,只许改数据管线(预处理/增强/合成),禁外部数据——PET/CT 分割挑战史首个 data-centric 赛道。

Q15 AC2 谁赢了? Lennonlychan(CUHK):diffusion model 生成肿瘤样本扩充训练集,overall 第 7;第 2 ZeroSugar(样本过滤,overall 第 10)。

Q16 官方 baseline 排第几? nnunet baseline 24.0 位(27 算法+2 中)——与冠军差 10.8 Dice 点;datacentric baseline 15.31,显著优于原版。

Q17 多少人参加? 注册 563 人(截至 2024-11,亚洲 53% 其中中国 29%);初赛 24 队 218 算法;决赛 17 队 27 算法。

Q18 奖金发了多少? 零——原已规划奖金因资金限制未能发放(总结论文罕见披露)。

Q19 标注怎么做的? 两步法:PET+CT+临床报告联合判识别病灶 → 轴位逐层 free-hand 勾画(PSMA 用 Mint Lesion™,SUV 阈值仅预分割打底)。

Q20 标注者什么资历? 双口径:官网"10 年(UKT FDG)/8 年(LMU FDG)/单 reader+5 年复核(PSMA)“;论文"3 年标注+4 年与 >10 年双专家验证”。

Q21 病灶有多少个? FDG 8,781(TMTV 110,189 mL);PSMA 19,377(TMTV 132,853 mL)——PSMA 病灶数 2.2 倍。

Q22 PSMA 阳性到底多少例? 双口径:537/60(挑战 v1)vs 539/58(v3/论文)——3 名患者 5 例 mask 的版本修正。

Q23 PSMA 用了什么配体? [18F]PSMA-1007(369 studies,246±27 MBq)+[68Ga]PSMA-11(228 studies,214±45 MBq)——算法跨配体无显著差异(消融实证)。

Q24 最大的方法学结论是什么? 混合效应模型方差分解:患者异质性 61%、残差 38%、算法差异仅 1.3%——病例难度 >> 算法优劣,建议优先难例分诊+医师复核。

Q25 组合泛化做得好吗? 不好且被定量钉死:未见组合 PSMA-UKT Dice 0.5711(同域 FDG-LMU 反而最高 0.7702)——主要由系统性体积高估驱动,仍是开放问题。

Q26 in-domain 什么水平? 同域多示踪剂分割"sufficient and probably approaching reader agreement"(总结论文结论 1 原话),同域 FDG 0.77 量级。

Q27 能当二分类器用吗? 不能——治疗后改变致阴性病例误报(高摄取炎症/术后变化),FPV 低不等于无人值守可用。

Q28 有代码吗? 全链开源:组织方 baseline(github.com/ClinicalDataScience/autoPETIII)、评估脚本(github.com/lab-midas/autoPET)、冠军方案(github.com/MIC-DKFZ/autopet-3-submission)。

Q29 运行限制多严? 5 min/例(Docker 容器统一环境)——超时 FPV 爆表(924 mL 量级);参赛队用动态 TTA 在预算内换精度。

Q30 与 autoPET V 什么关系? 直接前作:V 的交互式分割以 III 冠军权重初始化(arXiv 2609.01554),数据进入 V 的 QIBA 对齐合并库;IV 冠军亦自述构建于 III 获奖管线(arXiv 2508.21680)。

Q31 怎么复现官方 baseline? ClinicalDataScience/autoPETIII 仓+附录 C 五步(预处理→按 splits_final 5 折训练→Docker 导出);ResEncL 配置用 nnUNetPlannerResEncL。

Q32 splits_final.json 是患者级划分吗? 是(nnUNet 惯例患者级)——同一患者的多个 studies 不会跨 fold 泄漏。

Q33 训练包里 PET 通道要不要再换算 SUV? 不用——_0001 已是 SUV;只有 TCIA 载体的 PET.nii.gz(counts)需要换算或改读 SUV.nii.gz。

Q34 测试 4 个子集哪两个最难? PSMA-LMU(病灶最密,1,309 个)与 PSMA-UKT(未见组合,Dice 0.5711)——PSMA 侧难度系统性高于 FDG 侧。

Q35 为什么 FDG-LMU 是最高分子集? 反直觉但合理:FDG 分辨率高+病灶大而少(8.2/例),即使换了中心(LMU 设备),FDG 的物理优势仍占上风——难点在示踪剂不在中心。

Q36 final 排名前列差多少? 第 2 名 IKIM 8.4062 vs 第 3 名 HussainAlasmawi 8.4375——名次分差 0.03;头部算法在名次合成下几乎并列(呼应算法方差 1.3%)。

Q37 哪些决赛队来自中国? UIH_CRI_SIL/UIH_CRI_SIL_2(联影中央研究院+北大,arXiv 2409.09784)、HKURad、WukongRT、Prof Ching-Wei Wang(台湾,2409.07144)等——亚洲注册 53% 的决赛端代表。

Q38 DKFZ 打了 data-centric 赛道吗? 打了——LesionTracer2(MIC-DKFZ/miccai2024_autopet3_datacentric,arXiv 2409.10120)是 DKFZ 的 AC2 提交;冠军队双赛道自我对照。

Q39 总结论文什么时候能正式引用? arXiv 2605.05775(2026-05)当前为 preprint(投 Medical Image Analysis);正式刊出后替换引用条目(附录 I 观察点)。

Q40 这份数据能用来做示踪剂分类/中心分类吗? 元数据 CSV 有 tracer 与扫描仪字段,可以做——但要记住挑战赛规则刻意屏蔽了这些信息给分割模型;分类研究是合规的衍生用途。

FAQ 溯源注记:40 问的答案全部可回溯到正文与 FACTS 的具体位置——Q1-Q10 对应 §0/§3/§4(任务与数据),Q11-Q18 对应 §7/§8(结果与参与),Q19-Q23 对应 §5/§4(标注与队列),Q24-Q27 对应 §6(统计与临床结论),Q28-Q30 对应 §2/§1.4/§0.4(代码与系列),Q31-Q40 为实操补充(复现/口径/检索)。FAQ 被设计为"反查入口"而非独立事实源——任何一处答案与正文冲突时以正文为准,并向条目维护者报差异。

事实清单:36 条硬事实 + 6 条口径注

硬事实(F1-F36)

  • F1 全称:AutoPET III Challenge——Automated Lesion Segmentation in Whole-Body PET/CT – Multitracer Multicenter Generalization(来源:Zenodo 提案 PDF + GC 子域)
  • F2 定位:autoPET 系列第三届,“The tracer frontier”(autopet.org 官网五届谱系)
  • F3 平台:autopet-iii.grand-challenge.org(带连字符子域;autopet3/autopetiii/autopet-3 均 404)
  • F4 会议:MICCAI 2024(第 27 届)官方挑战,Marrakesh, Morocco 现场公布;ESHI 支持
  • F5 主办:LMU University Hospital Munich(Cyran/Ingrisch/Dexl/Jeblick/Schachtner/Mittermeier/Stüber)+ UKT Tübingen MIDAS.lab(Gatidis/Küstner)
  • F6 Zenodo:concept DOI 10.5281/zenodo.10990931 → 10990932;挑战提案 PDF 103,805 字节,2024-04-18 发布,CC BY-4.0,下载 1803/浏览 2066(2026-09-27 抓取)——非数据本体
  • F7 训练:FDG 1,014 studies(UKT,900 患者,单台 Siemens Biograph mCT)+ PSMA 597 studies(LMU,378 男性前列腺癌,3 台扫描仪)= 1,611
  • F8 FDG 队列:501 阳性(黑色素瘤/淋巴瘤/肺癌)+513 阴性;女 444/男 570;60±16 岁;79±19 kg;8,781 病灶;TMTV 110,189 mL;2.04²×3.00 mm
  • F9 PSMA 队列:539 有病灶+58 无(v3/论文口径)vs 537/60(挑战 v1 口径);71±8 岁;83±14 kg;19,377 病灶;TMTV 132,853 mL
  • F10 PSMA 配体:[18F]PSMA-1007 369 studies(246±27 MBq)+[68Ga]PSMA-11 228 studies(214±45 MBq);摄取均值 74 min
  • F11 PSMA 扫描仪:Siemens Biograph 64-4R TruePoint / Biograph mCT Flow 20 / GE Discovery 690;分辨率 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00 mm
  • F12 FDG 协议:禁食 ≥6 h;~350 MBq(官网)vs 314.7±22.1 MBq range 150-432(论文);60 min 摄取;CT 120 kV/200 mAs;OSEM 3i/21s;2 mm Gaussian
  • F13 PSMA CT 协议:颅底至大腿中部;143 mAs mean;100/120 kV(80-140);层厚 2.5-5.0 mm;571 增强/26 禁忌
  • F14 测试:final 200 studies=4×50(FDG-UKT/PSMA-LMU 同域+FDG-LMU/PSMA-UKT 组合泛化);preliminary 5 studies
  • F15 测试子集统计(阳性例/病灶数/TMTV mL):31/516/7,127;33/1,309/6,052;50/410/5,701;42/624/882
  • F16 格式:nnUNet 合并包(imagesTr CT _0000/PET-SUV _0001;labelsTr;dataset.json;splits_final.json 参考 5 折;psma_metadata.csv/fdg_metadata.csv)
  • F17 TCIA 载体:FDG DOI 10.7937/gkr0-xv29(CC BY 4.0,defaced)+ PSMA DOI 10.7937/r7ep-3x37(2024 收录);目录 Patient/Study/{SUV,CTres,CT,SEG,PET}.nii.gz
  • F18 FDAT 载体:合并库 10.57754/FDAT.rdkqd-wdh87;PSMA v3 10.57754/fdat.gabc0-3hv03;挑战 v1 fdat.uni-tuebingen.de/records/0zs4c-89f12;CC BY-NC 4.0
  • F19 HF 镜像:MedOtter/PSMA-PET-CT-Lesions(21 GB,597 行,逐例 shape/affine 校验,CC BY-NC 4.0 口径)
  • F20 双赛道:AC1 model-centric(自由)+ AC2 data-centric(固定 MONAI nnU-Net baseline 只改数据管线;禁外部数据)——PET/CT 分割挑战史首个 data-centric 赛道
  • F21 规则:Docker;5 min/例;每队 2 算法;无元数据;组织机构回避;强制开源代码+权重+报告;无 embargo;奖金因资金限制未发放
  • F22 参与:563 人注册(截至 2024-11;亚洲 53% 中国 29%);初赛 24 队 218 算法;决赛 17 队 27 算法(+2 baselines)
  • F23 评估:DSC(仅阳性)+FPV(18 连通域)+FNV;4 子集均值→跨算法排名→Dice 0.5+FPV 0.25+FNV 0.25 加权;tie break Dice
  • F24 冠军:Team LesionTracer(DKFZ MIC+Heidelberg:Rokuss/Kovacs/Kirchhoff/Xiao/Ulrich/Maier-Hein/Isensee)——nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督(含唾液腺标签)+动态 TTA;arXiv 2409.09478;github.com/MIC-DKFZ/autopet-3-submission
  • F25 冠军消融:default nnU-Net Dice 57.61→ResEncL 65.31→完整 68.40(FPvol 7.82/FNvol 10.35);官方 4 子集 0.6619/0.6433/0.7702/0.5711 mean 0.66
  • F26 榜单:第 2 IKIM(Essen,8.4062)、第 3 HussainAlasmawi(MBZUAI,8.4375);nnunet baseline 24.0 位;冠军较 baseline DSC +8%/FNV −5 mL(mean DSC 0.66/FNV 3.18 mL/FPV 2.78 mL)
  • F27 AC2 结果:冠军 Lennonlychan(CUHK,Chan+Yuan)diffusion 生成样本 overall 第 7;第 2 ZeroSugar(样本过滤)overall 第 10;datacentric baseline 15.31(overall)
  • F28 方差分解:患者异质性 61%(σ=0.171)+残差 38%(σ=0.134)+算法 1.3%(σ=0.025);随机患者差 ≈ 7× 随机算法差
  • F29 固定效应:体积翻倍 → DSC +0.039 [0.030, 0.048];UKT 中心效应 +0.14 [0.063, 0.217];tracer 主效应与 tracer×center 交互不显著;[68Ga] vs [18F] PSMA 无差异(β=−0.03 [−0.21, 0.16])
  • F30 三大结论:同域已近读者一致性(FDG 0.77 量级);组合泛化开放问题(体积高估驱动);异质性 >> 算法(难例分诊优先)
  • F31 方法论生态:6 队 TotalSegmentator 器官掩码;AiraMatrix STAPLE 组合 fold;4 队动态 TTA;归一化 global vs per-image 两派
  • F32 标注:两步法(联合判读→轴位逐层 free-hand);PSMA 用 Mint Lesion™(CE 认证,Heidelberg)SUV 阈值预分割+手工修正
  • F33 数据论文:FDG Sci Data 9:601 (2022) DOI 10.1038/s41597-022-01718-3(被引 386+);PSMA Sci Data 13:1023 (2026) DOI 10.1038/s41597-026-07821-z(PMID 42432027)
  • F34 总结论文:Dexl J, Jeblick K, … Isensee F, Küstner T, Ingrisch M. The autoPET3 Challenge. arXiv:2605.05775(v1 2026-05-07,投 Medical Image Analysis,CC BY-NC-ND 4.0)
  • F35 论文潮:2024-09 一周 7 篇 arXiv(2409.07144/09478/10120/12155/13006/13410/13779);两年窗口 13+ 篇
  • F36 系列权重链:V 参赛方法自述 “initialised from the autoPET-III winning weights”(arXiv 2609.01554);IV 冠军 “Building on the winning autoPET III nnU-Net pipeline”(arXiv 2508.21680)
  • F37 决赛公开资产:GC Results 页 Paper and Code 表 21 条目全部公开权重(21/21),15 条附 arXiv 论文(附录 K)
  • F38 DKFZ 双赛道:冠军队同时提交 AC2(LesionTracer2,arXiv 2409.10120,github MIC-DKFZ/miccai2024_autopet3_datacentric)——AC1/AC2 自我对照
  • F39 亚洲决赛代表:UIH_CRI_SIL/_2(联影中央研究院+北大,arXiv 2409.09784)、HKURad(2409.13006)、WukongRT(2409.13410)、Prof Ching-Wei Wang Taiwan(2409.07144)
  • F40 超时惩罚实证:Max.sh 提交 FPV 爆表(924.31 mL 量级)——5 min 限制的执行案例(GC leaderboard/总结论文口径)

口径注(N1-N6)

  • N1 PSMA 阳性例数:537/60(挑战 v1 官网+总结论文 Table 1)vs 539/58(FDAT v3+HF+Sci Data 2026)——3 名患者 5 例 mask 修正;正文取 539/58 注挑战口径
  • N2 标注资历:官网 “10 年 UKT FDG / 8 年 LMU FDG / 单 reader+5 年复核 PSMA” vs 论文 “3 年标注+4 年与 >10 年双专家”——时点与详细度差异,非矛盾
  • N3 license:TCIA DICOM CC BY 4.0(defaced)vs FDAT NIfTI CC BY-NC 4.0 vs 官网旧页 “TCIA Restricted license” 字样——按载体核对,NIfTI/挑战口径 CC BY-NC 4.0
  • N4 FDG 剂量:官网 ~350 MBq vs 论文 mean 314.7±22.1 MBq(range 150-432)
  • N5 同域 vs 跨组合 Dice:mean 0.66 混含 4 子集;同域 FDG 0.77 量级 vs 跨组合 PSMA-UKT 0.5711——引用必须标子集口径
  • N6 测试集重叠:final 含 50 例 PSMA-LMU 与训练同机构同库源,论文未声明不相交——同域成绩或含泄漏红利(HF README 注 “unquantified overlap risk”)

术语表:32 条

术语 释义
PET(正电子发射断层) 注射正电子示踪剂后以符合探测成像代谢/受体分布的功能成像模态
CT(计算机断层) X 线解剖结构成像——PET/CT 的解剖配准与衰减校正通道
SUV 标准摄取值 = C_tissue/(A_inj/W)——注射剂量与体重归一化的 PET 定量单位
activity counts PET 原始重建输出的计数单位——转 SUV 前不可直接做强度归一化
FDG [18F]氟脱氧葡萄糖——葡萄糖代谢广谱肿瘤示踪剂
PSMA 前列腺特异性膜抗原——前列腺癌受体靶向示踪剂([18F]PSMA-1007/[68Ga]PSMA-11 两种配体)
TMTV 总代谢肿瘤体积——全部病灶体积之和的定量负荷指标
tracer frontier III 的届别命名——示踪剂维度的泛化前沿
compositional generalization 组合泛化:对训练中见过的要素(tracer、center)的未见组合的泛化能力
domain shift 域移:训练与测试分布差——此处按 tracer×center 因子分解
nnU-Net 自配置分割框架(Isensee 等)——医学分割默认基线,III 冠军与官方 baseline 的共同内核
ResEncL nnU-Net 残差编码器大配置——更大容量与内核,冠军最大单一增益来源
MONAI 医学开源深度学习框架(NVIDIA/King’s)——AC2 固定 baseline 的实现底座
Dice/DSC Dice 系数——体素重叠相似度;本挑战仅阳性病例计算
FPV 假阳体积——pred 中 18-连通域不与 GT 相交的体积和
FNV 假阴体积——GT 中未被覆盖的体积
connectivity=18 三维体素连通性判定:面+边相邻算连通(26 连通的子集)——FPV 连通域定义
held-out test 挑战 held-out 测试:不发布数据只开放在线评估
preliminary/final GC 挑战两阶段:5 例试提交校准→200 例正式排名
Docker 提交 算法打包为容器在官方环境推理——GC 标准化提交形式
TTA test-time augmentation 测试时增强——多增广推理取均值,预算约束下动态启停
misalignment 增强 模拟 PET-CT 配准错位的训练增广——双模态硬件噪声建模
器官监督 以器官掩码为辅助任务的多任务训练——抑制生理摄取假阳
TotalSegmentator 开源全身器官分割工具——6 支参赛队的器官掩码来源
STAPLE 多分割真值合成算法——AiraMatrix 用于组合多 fold 输出
混合效应模型 含固定+随机效应的回归——此处把算法/患者作为随机效应分解 DSC 方差
难例分诊 按病例难度路由复核资源——总结论文的临床落地建议
reader agreement 读者一致性——分割金标与人类阅片者间一致性的上限参照
defacing 面部去标识——PET/CT 头颈体素替换的隐私处理
TCIA The Cancer Imaging Archive——NCI 资助的开放癌症影像库(DICOM 载体)
FDAT Tübingen 数据仓库 fdat.uni-tuebingen.de——NIfTI 载体
Mint Lesion™ CE 认证肿瘤测量软件(mint Medical,Heidelberg)——PSMA 标注工具
partial volume effect 部分容积效应——小于分辨率极限的病灶 SUV 被稀释,假阴的结构性来源
OSEM 有序子集期望最大化——PET 迭代重建算法(FDG 协议 3 iterations/21 subsets)
brown fat 棕色脂肪——FDG 高摄取的生理假阳源(颈/纵隔区,冷暴露激活)
connected component 连通域——FPV 的计数单位(18-连通定义下不与 GT 相交的空间区域)
leave-one-combination-out 留一组合法——按 tracer×center 因子轮流做测试集的自定义划分(复刻 4×50 的扩展做法)
QIBA Quantitative Imaging Biomarkers Alliance——影像定量标准化联盟(V 届 SUV 对齐的基准框架)
weight initialization 权重初始化——系列权重链的机制(IV/V 从 III 冠军权重起步)

附录

附录 A:数据字典(挑战合并包 + TCIA 载体)

A.1 挑战合并包(nnUNet 格式)

字段/文件 类型 内容 备注
imagesTr/CASE_ID_0000.nii.gz NIfTI CT 通道(HU) 重采样至 PET 网格
imagesTr/CASE_ID_0001.nii.gz NIfTI PET-SUV 通道 counts→SUV 已换算
labelsTr/CASE_ID.nii.gz NIfTI 病灶二值掩码 0 背景/1 病灶,无多类
dataset.json JSON nnUNet 任务描述 模态名/标签/划分
dataset_fingerprint.json JSON 强度指纹 归一化统计(global)
splits_final.json JSON 参考 5 折划分 患者级划分惯例
psma_metadata.csv CSV PSMA 逐例元数据 年龄/体重/配体/剂量/摄取时间/扫描仪
fdg_metadata.csv CSV FDG 逐例元数据 同上(UKT 口径)

A.2 TCIA 载体五件套(Patient/Study/ 下)

文件 内容 用途
PET.nii.gz 原始 activity counts 重建 物理层研究(需自行转 SUV)
SUV.nii.gz SUV 换算后 强度归一化/直接训练
CT.nii.gz 原始 CT 解剖参照/HU 分析
CTres.nii.gz 重采样 CT 与 PET 网格对齐
SEG.nii.gz 病灶掩码 监督信号

A.3 TCIA DICOM 序列字段速查

DICOM 字段 TCIA 版状态 影响
StudyDate 移位至 1997-2005 日期不可用;跨载体 join 用 patient hash
PatientID hash 化 与 FDAT 一致——对齐主键
面部区域 defaced(头颈体素替换) 头颈区分析受限
PET 模态序列 PET 原始(counts)与 SUV 两序列并存 训练选 SUV 序列
掩码封装 DICOM-SEG(Analysis Results) dcmqi 转 NIfTI 后可入 nnUNet
设备字段 保留(厂商/型号/参数) 域移分析的元数据来源

A.4 两载体目录树对照

TCIA(DICOM 谱系)                     FDAT(NIfTI 谱系)
FDG-PET-CT-Lesions/                    挑战合并包/
  PatientUID_001/                        imagesTr/  labelsTr/
    StudyUID_01/                         dataset.json + fingerprint
      SUV.nii.gz CTres.nii.gz            splits_final.json
      CT.nii.gz  SEG.nii.gz              {fdg,psma}_metadata.csv
      PET.nii.gz                       PSMA-PET-CT-Lesions_v3/
  (study dates 移位 1997-2005)          (539/58 口径,含版本说明)

两棵树的互换成本集中在掩码封装(DICOM-SEG↔NIfTI)与日期字段——内容本体(影像+病灶体素)一致;选择哪棵树由「要 DICOM 元数据/CC BY 授权」(TCIA)还是「要 nnUNet 即训格式」(FDAT)决定。

附录 B:下载与复现命令

# TCIA DICOM(官方门户手动或 NBIA 下载)
# FDG:  https://doi.org/10.7937/gkr0-xv29    (CC BY 4.0,defaced)
# PSMA: https://doi.org/10.7937/r7ep-3x37    (TCIA 数据使用许可)

# FDAT NIfTI(DOI 落地页手动/脚本下载)
# 合并库:     https://doi.org/10.57754/FDAT.rdkqd-wdh87   (CC BY-NC 4.0)
# PSMA v3:    https://doi.org/10.57754/fdat.gabc0-3hv03
# 挑战 v1:    https://fdat.uni-tuebingen.de/records/0zs4c-89f12

# HuggingFace 镜像(快速脚本化访问)
python3.11 -c "from huggingface_hub import snapshot_download; snapshot_download('MedOtter/PSMA-PET-CT-Lesions', repo_type='dataset', local_dir='psma_hf')"

# 官方代码三仓
git clone https://github.com/ClinicalDataScience/autoPETIII   # nnunet-baseline + datacentric-baseline
git clone https://github.com/lab-midas/autoPET                # 系列评估脚本
git clone https://github.com/MIC-DKFZ/autopet-3-submission    # 冠军方案 LesionTracer

# 关键论文
# 挑战总结:  https://arxiv.org/abs/2605.05775  (Dexl et al., 2026)
# 冠军方法:  https://arxiv.org/abs/2409.09478  (Rokuss et al., 2024)
# FDG 数据:  https://doi.org/10.1038/s41597-022-01718-3  (Gatidis & Kuestner, 2022)
# PSMA 数据: https://doi.org/10.1038/s41597-026-07821-z  (Jeblick et al., 2026)

附录 C:nnU-Net 最小训练示例(baseline 复刻路径)

# 0. 环境(PyTorch + nnU-Net v2 + MONAI for AC2 baseline)
pip install nnunetv2 monai

# 1. 摆放挑战合并包为 nnUNet 原始目录
# nnUNet_raw/Dataset501_AutoPET3/
#   imagesTr/  labelsTr/  dataset.json   (官方包内已就绪)

# 2. 指纹与预处理(global 归一化来自 dataset_fingerprint.json)
nnUNetv2_plan_and_preprocess -d 501 --verify_dataset_integrity

# 3. 按官方参考 5 折训练(3d_fullres 配置;ResEncL 用 -pl nnUNetPlannerResEncL)
for FOLD in 0 1 2 3 4; do
  nnUNetv2_train 501 3d_fullres $FOLD -tr nnUNetTrainer --c
done

# 4. 推理与提交物导出(Docker:输入 CT+PET 双通道,输出二值掩码)
nnUNetv2_predict -d 501 -i INPUT_DIR -o OUTPUT_DIR -c 3d_fullres -f 0 1 2 3 4

# 5. 预算提醒:5 min/例 运行限制——集成与 TTA 需动态启停(冠军论文 §TTA)
# AC2 参赛者:不改上述任何模型代码,只改预处理/增强/采样(datacentric-baseline 仓库)

C.5 AC2 数据管线实验路径(不改模型的三条已验证路线)

  1. 样本过滤路线(zero_sugar,overall 第 10):对训练集做质量过滤/难例重加权——“数据节食”(仓库名 datadiet 即此意),成本最低先试
  2. 合成扩充路线(Lennonlychan,overall 第 7):diffusion 模型在病灶区生成合成样本——需控制生成质量与 SUV 分布保真(附录 M 第 10 项自检)
  3. 增强工程路线(未上榜但通用的基线动作):重排重采样网格/切换归一化两派/调整 misalignment 幅度——与冠军组件 2 同源但不动模型

三条路线的评测都要过附录 M 清单第 7 项(患者级泄漏自检)——合成与过滤最容易意外破坏患者级划分。

附录 D:评估指标计算逻辑(伪代码)

def evaluate(pred_mask, gt_mask):
    # DSC:仅 gt 阳性病例
    if gt_mask.sum() > 0:
        inter = (pred_mask & gt_mask).sum()
        dice = 2 * inter / (pred_mask.sum() + gt_mask.sum())
    else:
        dice = None            # 健康病例 Dice 无定义
    # FPV:pred 中 18-连通域,不与 GT 相交者体积求和
    fpv = sum(region.volume for region in label(pred_mask, structure=CONNECTIVITY_18)
              if not (region & gt_mask).any())
    # FNV:GT 中未被 pred 覆盖的体积(仅阳性病例)
    fnv = (gt_mask & ~pred_mask).sum() * voxel_volume if gt_mask.sum() > 0 else None
    return dice, fpv, fnv

def rank_teams(scores):  # scores[team][subset][metric]
    per_metric_mean = {t: mean over 4 subsets for each metric}
    ranks = {m: rank_teams_by(per_metric_mean[m]) for m in ('dice','fpv','fnv')}
    final = 0.5*ranks['dice'] + 0.25*ranks['fpv'] + 0.25*ranks['fnv']  # tie break: dice

附录 E:五届演化对照表(系列谱系总索引)

维度 I (2022) II (2023) III (2024) 本条 IV (2025) V (2026)
frontier segmentation generalization tracer human human-AI
任务 自动分割 自动分割 自动分割 交互分割 交互分割
数据 FDG 1,014 FDG 1,014 FDG 1,014+PSMA 597 +纵向 CT 双库 QIBA 对齐五库
中心 UKT 单中心 UKT(多环境变体) UKT+LMU 双中心 多中心 统一多中心队列
评估 Dice Dice(环境分层数据集) Dice+FPV+FNV 加权 Dice+交互 AUC-Dice+AUC-DMM
baseline nnU-Net nnU-Net nnU-Net + datacentric-baseline 双轨 nnU-Net nnUNet+涂擦模拟
库内 rid 468 rid 468 本条 —(无独立条目) rid 634

演化注记:从 I 到 V,数据侧每届叠加一个新维度(环境→示踪剂→纵向→交互协议),评估侧每届吸收前届的实践教训(II 的泛化缺口催生 III 的交叉矩阵,III 的组合泛化结论支撑 V 的统一队列设计);III 是数据维度与评估维度同时升级的唯一一届——这也是其"枢纽届"定位(§10.2)的数据注脚。

附录 F:DAIMS 评分卡(预估 7.6)

维度 分 依据
文档完备 9 挑战页全套(任务/协议参数/测试矩阵/leaderboard)+总结论文+两篇数据论文+冠军论文
标注质量 8 资历分级披露+双专家复核+CE 认证工具;二值掩码无多类语义
可复现 8 baseline/评估脚本/冠军代码/参考 5 折全公开;测试集 held-out 不可本地复现
可获取性 9 TCIA+FDAT+HF 三载体公开直载无注册门槛;测试隐藏
伦理合规 7 defaced+dates 移位+机构审批;IRB 编号未单列、FDAT 版未 defaced
加权 ≈7.6 系列内对照:autoPET V 7.7(交互协议公开度加成)、rid 468 口径 I/II 档

附录 G:口径速查卡(双口径一览)

事实 口径 A 口径 B 取舍
PSMA 阳性例数 537/60(挑战 v1 官网+总结论文 Table 1) 539/58(FDAT v3+HF+Sci Data 2026) 正文 539/58 注 A
标注资历 单 reader+5 年复核(官网) 3 年标注+4/10+ 年双专家(论文) 并存引用
FDG 剂量 ~350 MBq(官网) 314.7±22.1 MBq range 150-432(论文) 复现取 B
license TCIA CC BY 4.0(defaced) FDAT NIfTI CC BY-NC 4.0 按载体
mean Dice 0.66(4 子集混合) 0.77 量级(同域 FDG) 分开引用
Zenodo 10990931 “数据集 DOI”(常见误引) 提案 PDF 0.1 MB(实际) 数据引 TCIA

附录 H:跨条目联动矩阵

联动条目 rid 关系 联动读法
AutoPET I/II 468 直接前作(FDG 库同源) I/II 条目看 FDG 库细节与两届 baseline 演化;本条看加示踪剂后的新问题
autoPET V 634 直接后作(QIBA 对齐+交互范式) V 条目看 III 冠军权重的下游与 AUC 评估革新;本条看权重起点
hecktor 461 PET/CT 咽喉病灶分割挑战(跨模态同域) 对照"多模态挑战赛评估"的另一种指标设计
lung-pet-ct-dx 475 FDG PET/CT 肺病灶分类+分割 对照单癌种 FDG 数据的组织方式
ProstateX / PI-CAI 库内检索 PSMA 队列的疾病域邻居 前列腺多模态影像生态(MRI vs PET)

联动读法补充:

  • 468→本条:468 条目的 FDG 库描述(1,014 studies 结构/标注/协议)是本条 §4.1 的母本——两处数字一致性可互为校验(同一库两次入库的口径漂移检查点)
  • 本条→634:634 条目的 QIBA 对齐合并库章节列了 III 双库的合并路径(差异 1E-3)——III 读者若需要"对齐后"的数据应转到 634 描述的 FDAT rdkqd-wdh87 载体
  • 横向(461/475):三库构成"PET/CT 病灶任务"的三种任务切面——自动分割(本条)/分类+分割(475)/多模态治疗响应(461),联合阅读覆盖 PET 病灶任务的完整谱

附录 I:开放问题与观察点

  • [ ] 总结论文(arXiv 2605.05775)投 Medical Image Analysis 的正式刊出版本——刊出后引用格式替换
  • [ ] PSMA Sci Data 论文(2026)发表后的引用迁移:挑战期引用 Zenodo 提案的工作需要补引
  • [ ] final 测试 200 例是否随 V 届 QIBA 重发布而部分解禁——FDAT 合并库 rdkqd-wdh87 的更新记录值得跟踪
  • [ ] AC2 diffusion 生成样本(Lennonlychan)是否单独发布——若发布将成为"合成 PET 数据"子资产
  • [ ] 奖金未发放的后续处理(总结论文披露后未见补充公告)
  • [ ] HF 镜像(MedOtter/PSMA-PET-CT-Lesions)与 FDAT v3 的字节级一致性抽查——目前仅 shape/affine 级校验,强度级(体素值)一致性未验证
  • [ ] TCIA PSMA 收藏的授权页是否随 Sci Data 2026 论文刊出而更新为 CC BY 4.0 口径——若更新,license 三轨(N3)收敛为双轨,本条 §9.1 需同步修订

附录 J:本条目存证链(方法论要求)

事实组 存证信源 抓取时点
任务/协议参数/测试矩阵/双赛道/leaderboard autopet.org III 详情页(/tmp/autopetiii.html 全文留存) 2026-09-27
挑战平台结构/参与入口 autopet-iii.grand-challenge.org(/tmp/gc_autopet3.html、gc_lb.html、gc_res.html) 2026-09-27
数据统计/方差分解/三大结论/参与度/奖金披露 arXiv 2605.05775 全文(/tmp/arxiv_full.txt,143,873 字符) 2026-09-27
冠军方案/消融/子集 Dice arXiv 2409.09478(/tmp/arxiv_autopet3.xml) 2026-09-27
Zenodo 元数据(PDF 体积/日期/下载量/CC BY-4.0) zenodo.org/api/records/10990932(WebFetch 代理——直连 TLS 被拒) 2026-09-27
PSMA 数据论文/版本口径 WebSearch(Sci Data 13:1023、PMID 42432027、FDAT v3、HF MedOtter) 2026-09-27
系列谱系/前后届权重链 autopet.org + arXiv 2609.01554 + 2508.21680 + 库内 rid 468/634 FACTS 互证 2026-09-27

| 库内联动查证 | rid 468(autoPET)/rid 634(autopet-v)/rid 475(lung-pet-ct-dx)/rid 461(hecktor) | DB 只读查询 2026-09-27 |
| 查重结论 | 库内无 autopet-iii 条目(url_name ILIKE ‘%autopet%’ 仅 468/634/475 邻居) | 2026-09-27 |
| 环境留痕 | zenodo.org 直连 TLS 被拒(curl exit 35 / SSLZeroReturnError),API 经 WebFetch 代理——与 autopet-v 档案记录一致 | 2026-09-27 |

附录 K:决赛提交公开资产全表(GC Results 页 Paper and Code 表,2026-09-27 抓取)

决赛全部提交均满足"公开权重"规则(Public weights 列全 True)——这是 III 可审计性的直接证据。下表为 GC Results 页收录的 21 个公开资产条目(队伍/算法级;与"17 队 27 算法"的口径差:本表按公开了论文与代码的条目计):

Team / Algorithm 公开论文 代码仓库 备注
LesionTracer arXiv 2409.09478 MIC-DKFZ/autopet-3-submission AC1 冠军(nnU-Net ResEncL 五件套)
LesionTracer2 arXiv 2409.10120 MIC-DKFZ/miccai2024_autopet3_datacentric DKFZ 的 AC2 提交——冠军队双赛道自我对照
IKIM arXiv 2409.12155 hakal104/autoPETIII 第 2 名(Essen)
Lennonlychan arXiv 2409.08068 john-lennon-chan/synthPET_inference AC2 冠军(diffusion 生成样本,仓库名 synthPET 即方法)
Shadab arXiv 2409.10151 ahxmeds/autosegnet2024 AutoSegNet
Prof Ching-Wei Wang, Taiwan arXiv 2409.07144 cwwang1979/CW-nnU-Net-for-PET-CT 台北团队 nnU-Net 变体
Max.sh / Max.sh2 GC 页注 rxiv.org/abs/2409.0068 maxshatskiy/autopet3_inf 与 _inf2 双算法提交实例;超时 FPV 爆表案例(924 mL 量级)
StockholmTrio arXiv 2409.14475 Astarakee/AutoPET24 卡罗林斯卡/ KTH 系
UIH_CRI_SIL / UIH_CRI_SIL_2 arXiv 2409.09784 jiayiliu-pku/AP2024 与 DC2024 联影中央研究院+北大(AC1/AC2 各一)
WukongRT arXiv 2409.13410 BBQtime/… 动态 TTA 实现者之一
HKURad arXiv 2409.13006 Reza-Safdari/AutoPET_III 香港大学放射系
Airamatrix / Airamatrix2 arXiv 2409.13779 tanya-chutani-aira/autopetiii(ensemble-2d 分支) STAPLE 组合 fold+2D 集成
zero_sugar arXiv 2409.13548 alexanderjaus/autopet3_datadiet AC2 第 2(数据过滤;Jaus 为 LMU nnU-Net 系成员)
QuantIF arXiv 2410.02807 Zhack47/AutopetIII_CHB 动态 TTA 实现者之一
HussainAlasmawi (GC 页注 github) HussainAlasmawi/AutoPet_Final 第 3 名(MBZUAI)——无 arXiv preprint
BAMF AI (GC 页注 github) bamf-health/autopet2024 北美队
TUM_ibbm (GC 页注 github) hongweilibran/autopet_bran TUM IBBM 实验室
Shrajanbhandary (GC 页注 grandchallenge) Shrajan/fcn_pet_segmentation FCN 路线

资产盘点:21 条目全部公开权重、15 条目附 arXiv 论文、2 条目仅 GitHub、1 条目仅 GC 链接——"榜单可审计"在 III 不是口号而是 21/21 的执行率。仓库命名即方法学索引(synthPET=合成、datadiet=数据节食、ensemble-2d=2D 集成),检索者可按方法学关键词直接定位实现。

附录 L:分角色使用指南(AI-Ready 评估视角)

L.1 分割模型开发者:FDAT 合并库(nnUNet 格式即拿即训)+附录 C 路径;用 splits_final 5 折做内部验证;报告时区分同域与跨组合成绩(口径注 N5);阴性的 571 例(FDG 513+PSMA 58)用于假阳抑制训练与 FPV 自评。

L.2 域移/泛化研究者:以 tracer×center 为因子做 leave-one-combination-out 自定义划分(复刻 4×50 设计);元数据 CSV 提供域标签(扫描仪/协议);对照总结论文的混合效应框架(患者为随机效应)设计自己的方差分解——III 的最大遗产是"组合泛化可测"的实验范式而非某个具体分数。

L.3 数据中心(data-centric)工程团队:AC2 是天然实验场——固定 baseline(datacentric-baseline 仓)只改数据管线;参考 Lennonlychan(diffusion 合成)与 zero_sugar(数据节食)两条已验证路线;注意 5 min 预算约束对合成数据量与推理成本的传导。

L.4 临床 AI 评估者:用 §6.5 的分布非正态/长尾发现校准预期——聚合 Dice 是分诊视角的指标,不是单例视角;引用"61% vs 1.3%"论证病例难度分层工具的价值;把"不能当二分类器"写进部署文档。

L.5 数据集策展人/库建设者:III 提供"挑战赛型资产"的治理样板——三载体冗余(格式互补)、版本修正留痕(537/60→539/58)、失败模式生理学图谱、方差分解报告——这四项可直接进 AI-Ready 数据集评估 rubric。

L.6 教学者:一条完整的方法论教学线——物理(SUV 链)→标注(两步法+资历)→设计(组合泛化矩阵)→统计(混合效应)→工程(预算内 TTA)→伦理(license 三轨/双口径披露),每一步都有公开可复算的原始材料。

附录 M:数据完整性自检清单(下载后 30 分钟)

从任一载体拿到数据后,建议按序执行以下核查(脚本十行内可自动化):

  1. 体素规模对账:studies 数 = 1,611(训练包)或 597(纯 PSMA 载体)——数目不符即版本混装(v1/v3 或 TCIA/FDAT 交叉)
  2. PSMA 口径核对:阳性/阴性计数 = 539/58(v3)或 537/60(v1)——确定手里是哪一版并在实验记录中写明
  3. 双通道验证:每例 _0000(CT,HU 范围 -1024~3000+)与 _0001(PET,SUV 正值域)——把 _0001 的直方图峰值拉出来看(SUV 1-4 主峰为正常)
  4. counts 陷阱自检:若 PET 通道数值量级在 1e3-1e5(SUV 不会超过 100 量级),拿到的是 counts——换算或换 SUV 文件(坑点 4 的自动化防线)
  5. 掩码体积分布:逐例掩码体素数的中位数/极值——异常巨大掩码(全肝/全膀胱)多为标注或转换错误
  6. spacing 指纹:FDG 全队列应唯一(2.04×2.04×3.00);PSMA 应聚成三簇(三台扫描仪)——簇数不对即元数据错位
  7. 患者级泄漏自检:自定义划分时验证同一 patient hash 不跨 train/val——nnUNet splits 已保证,自制划分必须重验
  8. 日期字段隔离:TCIA 载体的日期确认在 1997-2005 移位窗内——误当真实日期写进论文是去标识违规的间接信号
  9. HF 镜像校验:用 MedOtter 随库的 shape/affine 校验脚本跑一遍——社区质检结果与自己的下载一致
  10. 版本存证:记录 DOI+版本号+下载日期于实验配置——III 的 v1/v3 口径差异足以让两组结果不可比

附录 N:DAIMS 逐项证据链(评分的可追溯性)

维度 分 关键证据(本条目位置) 扣分点
文档完备 9 GC 八板块齐(§1.5)+总结论文(F34)+两篇数据论文(F33)+冠军论文(F24) 测试集分布仅论文级描述
标注质量 8 两步法+资历双口径全披露(§5.2)+CE 工具(§5.1)+版本修正留痕(§5.3) 二值掩码无多类语义;FDG/PSMA 标注体系异质
可复现 8 baseline/冠军/评估脚本三仓(§2.3)+参考 5 折(§4.4)+附录 O 十实验可复算 held-out 200 例不可本地复现;5 min 限制的官方计时口径未细化
可获取性 9 三载体公开直载无注册(§9.1 表)+HF 逐例校验(F19) 测试隐藏;FDAT 下载需走落地页无直链 API
伦理合规 7 defaced+日期移位(§9.2)+机构审批链+奖金披露诚实(F21/F27 治理) IRB 编号未单列;FDAT 版未 defaced;NC 条款的权重衍生争议(§9.4)
加权 ≈7.6 证据链全部落在正文/FACTS 可查位置 对照:autoPET V 7.7(交互协议公开度加成)

附录 O:十个可复算实验建议(用 III 的公开资产就能做)

  1. 复刻 baseline 排名:官方 nnunet-baseline+参考 5 折本地训练→对照 24.0 位与 57.61 Dice 口径
  2. ResEncL 单项增益验证:同一数据换 ResEncL 计划器→验证 +7.7 Dice 点的容量效应
  3. 组合泛化自测:自定义 leave-one-combination-out 划分→在 FDG-LMU/PSMA-UKT 上复刻 0.7702/0.5711 的落差
  4. 器官监督消融:±TotalSegmentator 辅助任务→测 FPV 抑制幅度(冠军组件 4 的独立贡献)
  5. misalignment 增强消融:±配准错位模拟→测双模态鲁棒性
  6. 归一化两派对照:global fingerprint vs per-image z-score→在 4 子集分别评测
  7. 配体盲测:PSMA-LMU 内按 [18F]/[68Ga] 分层评测→复算 β=−0.03 的无差异结论
  8. 混合效应复算:用元数据 CSV 重建体积/中心/示踪剂协变量→复算 61%/38%/1.3% 方差分解
  9. TMTV 负荷-难度相关性:逐例 TMTV vs DSC 散点→验证"大病灶好分割"的 β=+0.039
  10. 合成数据路线复刻:datacentric-baseline 上叠加 diffusion 生成样本→对照 synthPET 的 overall 第 7

每项实验的原料(数据/代码/元数据/参考划分)都已公开——"十项全能可复算"是 III 区别于一般挑战赛数据集的 AI-Ready 度核心证据。

附录 P:FDG vs PSMA——双示踪剂方法学深对照

N.1 成像链对照

环节 FDG(UKT) PSMA(LMU) 差异的方法学后果
物理机制 葡萄糖转运/磷酸化滞留 PSMA 受体结合/内化 病灶对比度来源不同——PSMA 受体密度驱动 vs 代谢活性驱动
半衰期 ¹⁸F 109.8 min ¹⁸F 109.8 min / ⁶⁸Ga 68.1 min ⁶⁸Ga 的短半衰期促其就地生产模式与摄取窗口差异
摄取窗口 ~60 min 标准化 均值 74 min(6-181/7-195 宽离散) PSMA 的 SUV 绝对量级时变更大——per-image 归一化论据
分辨率 2.04²×3.00 mm 单机一致 2.73-4.07 面内混合 小病灶检出下限不同——PSMA 假阴更多
重建 OSEM 3i/21s+2mm Gaussian 三机各自协议 重建纹理差异叠加在示踪剂差异上
患者群 混合性别/三癌种/60±16 岁 全男/前列腺癌/71±8 岁 人口学协变量完全不同——回归模型需控制
病灶谱 大而少(8.7/例) 小而密(32.5/例) FPV/FNV 的体积量纲在不同库的含义不同
生理假阳 骨髓/纵隔/棕色脂肪/脑/膀胱 肝/脾/肾/颌下腺 器官监督的标签集选择随示踪剂变

P 表的读法提醒:这张表是"设计一张新示踪剂的分割数据集"的需求清单——分辨率一致性(FDG 的单机优势)、摄取窗口标准化(PSMA 的宽离散教训)、生理假阳图谱预调研(器官监督标签集的依据)三项都可直接迁移为采集协议的设计约束。双示踪剂并置的价值不在"多一倍数据",而在把示踪剂从常量变成变量——变量的存在才使方差分解(N.2 的吸收分析)成为可能。

N.2 算法侧的吸收方式

  • 已被消融证明不重要的:PSMA 配体([18F] vs [68Ga] 无差异,β=−0.03);tracer 主效应(体积/中心调整后)
  • 被证明重要的:病灶大小(β=+0.039/翻倍)与中心(UKT +0.14)——即分辨率与设备协议才是示踪剂差异的传导路径
  • 工程吸收:冠军的多模态通道统一训练+器官监督是"用数据容量换示踪剂差异"的路线;归一化两派是全球统计 vs 逐图统计对同一问题的两种回答
  • 开放残留:PSMA-UKT 0.5711 的残差差距说明上述吸收仍不完整——低分辨率示踪剂×未见设备的交互惩罚没有被任何参赛方案完全消化

附录 Q:挑战赛治理观察(III 的治理样本价值)

III 的运营决策在"挑战赛治理"维度上有若干值得记录的样本:

治理决策 III 的做法 样本价值
奖金透明 原规划→因资金限制未发放,总结论文明文披露 挑战赛文献普遍沉默于奖金兑现,III 的披露是反常的诚实
开源强制 决赛 21/21 公开权重、15 篇论文 可审计率 100% 的执行样本
利益回避 组织机构成员(LMU/UKT/DKFZ 生态)回避排名 小社区熟人赛的公信力设计
无 embargo 赛后一周 7 篇 arXiv 知识扩散速度优先于首发独占——与强制开源配套
双赛道并行 AC1/AC2 隔离排名+固定 baseline "模型 vs 数据"之争的制度化实验
版本治理 FDAT v1→v3 留痕修正、双口径并存披露 数据修正不静默——与多数数据集"静默更新"对照

治理样本的适用边界:III 的治理结构(两机构小团队、数据与运营同批人、学会背书)是小科学协作的范本,其可复制项是披露标准(奖金兑现、资历分级、版本留痕)而非组织形式——大平台多机构挑战赛受限于协调成本,未必能复制"数据组=运营组"的闭环,但披露标准的成本低到任何规模都可执行。这也是本条目把"治理观察"单列附录的原因:挑战赛型条目的 AI-Ready 评估应该把运营披露质量纳入评分(DAIMS 的文档完备维度在 III 的 9 分里有相当权重来自总结论文的坦诚度)。

附录 R:检索词策略(给下一位研究者)

  • 平台检索:autopet-iii grand-challenge(连字符必带)/AutoPET III lesion segmentation
  • 论文检索:autoPET3(连写——总结论文标题用词)/multitracer multicenter PET/CT/compositional generalization PET segmentation
  • 数据检索:PSMA-PET-CT-Lesions/FDG-PET-CT-Lesions(TCIA 收藏名连字符连写)/fdat uni-tuebingen PSMA
  • 方法检索:nnU-Net PET lesion/LesionTracer/synthPET diffusion(AC2 冠军仓库名即关键词)
  • 陷阱词:autopet3(GC 子域 404 但 arXiv 正确);Zenodo 10990931(提案非数据);autoPET III dataset(会同时召回提案 PDF 与 TCIA/FDAT——按体积与载体分辨)

(完)

本条目为千方病案医数集 GC 系列条目(autoPET 三部曲中坚)。数据以 autopet-iii.grand-challenge.org、autopet.org、arXiv 2605.05775/2409.09478、TCIA DOI 10.7937/gkr0-xv29 与 10.7937/r7ep-3x37、FDAT DOI 10.57754/FDAT.rdkqd-wdh87 为准,抓取时点 2026-09-27。库内前作 rid 468(AutoPET I/II)与本条、后作 rid 634(autoPET V)构成系列互链。Zenodo 10.5281/zenodo.10990931 为挑战提案记录(PDF),数据引用请用 TCIA/FDAT DOI。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • autopet-v — 共享标签:医学影像 / PET / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • hecktor2026 — 共享标签:医学影像 / PET / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • kits23 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • autopet — 共享标签:医学影像 / PET / CT / 肿瘤学
  • tcia — 共享标签:医学影像 / PET / CT / 肿瘤学
  • idc — 共享标签:医学影像 / PET / CT / 肿瘤学
  • kits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • lits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • flare — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集