信息速览
INFOBOX:autopet-iii 速览
| 字段 | 值 |
|---|---|
| 数据集 | AutoPET III Challenge Training Database(FDG-PET-CT-Lesions + PSMA-PET-CT-Lesions 合并 nnUNet 格式) |
| slug | autopet-iii(GC 子域 autopet-iii.grand-challenge.org——带连字符;autopet3/autopetiii 均 404) |
| 系列谱系 | I segmentation(2022)→II generalization(2023)→III tracer(2024,本条)→IV human(2025)→V human-AI(2026)——五届 frontier 命名谱系第三棒 |
| 平台 | Grand Challenge——autopet.org 官网系列主页;库内前作 rid 468(AutoPET I/II) |
| 会议 | MICCAI 2024 官方挑战(第 27 届,Marrakesh, Morocco 现场公布);ESHI(European Society for hybrid, molecular and translational imaging)支持 |
| 主办 | LMU University Hospital Munich(Cyran/Ingrisch/Dexl/Jeblick/Schachtner/Mittermeier/Stüber——PSMA 数据方)+ UKT Tübingen MIDAS.lab(Gatidis/Küstner——FDG 数据方) |
| 任务 | 全身 PET/CT 肿瘤病灶自动分割(CT+PET 双通道输入,二值病灶掩码输出) |
| 数据 | FDG 1,014 studies(UKT,900 患者,501 阳性+513 阴性)+ PSMA 597 studies(LMU,378 例前列腺癌男性,全男)= 1,611 |
| 病灶规模 | FDG 8,781 病灶/TMTV 110,189 mL;PSMA 19,377 病灶/TMTV 132,853 mL——PSMA 病灶数是 FDG 的 2.2 倍 |
| 测试设计 | final 200 studies = 4×50 交叉矩阵:FDG-UKT/PSMA-LMU 同域 + FDG-LMU/PSMA-UKT 未见 tracer×center 组合(compositional generalization) |
| 双赛道 | AC1 model-centric(自由方法)+ AC2 data-centric(固定 MONAI nnU-Net baseline,只许改数据管线——PET/CT 分割挑战史首个 data-centric 赛道) |
| 评估 | Dice(0.5)+ FPV(0.25)+ FNV(0.25)加权排名;4 子集均值→跨算法排名→平均 |
| 参与 | 563 人注册(截至 2024-11,亚洲 53%)→初赛 24 队 218 算法→决赛 17 队 27 算法 |
| 冠军 | Team LesionTracer(DKFZ MIC+Heidelberg,Rokuss/Isensee——nnU-Net 核心作者):nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督+动态 TTA,mean Dice 0.66(内部对照 57.61→68.40) |
| AC2 冠军 | Lennonlychan(CUHK):diffusion model 生成肿瘤样本扩充数据集,overall 第 7 |
| 规则亮点 | Docker 标准化+5 min/例运行限制+每队 2 算法+强制开源代码权重+奖金因资金限制未发放(罕见披露) |
| 时间线 | 2024-04-01 训练数据发布(CC-BY-NC 4.0)→09 final test→MICCAI 2024 现场公布 |
| 数据载体 | TCIA DICOM(FDG 10.7937/gkr0-xv29 + PSMA 10.7937/r7ep-3x37)+ FDAT NIfTI(合并库 10.57754/FDAT.rdkqd-wdh87)+ HF 镜像 MedOtter/PSMA-PET-CT-Lesions;Zenodo 10990931 仅提案 PDF |
| 库内联动 | rid 468 autoPET(I/II 直接前作)、rid 634 autoPET-v(直接后作)、rid 475 lung-pet-ct-dx、rid 461 hecktor |
§0 摘要卡:示踪剂前沿的组合泛化压力测试
§0.1 它是什么
AutoPET III 是 MICCAI 2024 官方挑战赛:全身 PET/CT 肿瘤病灶自动分割的多示踪剂多中心泛化 benchmark——autoPET 系列第三届(“The tracer frontier”,示踪剂前沿),也是系列数据规模的第一次大扩容:在 I/II 两届沿用的 UKT Tübingen FDG 库(1,014 studies,黑色素瘤/淋巴瘤/肺癌+健康对照)之上,LMU Munich 首次并入 597 例 PSMA-PET/CT(前列腺癌男性患者,[18F]PSMA-1007 与 [68Ga]PSMA-11 双配体),合计 1,611 studies。任务仍是 CT+PET 双通道输入的病灶二值分割,但挑战哲学升级为组合泛化(compositional generalization)压力测试:final 测试 200 例按 4×50 交叉矩阵分布,其中 FDG@LMU 与 PSMA@UKT 两个子集是训练中从未见过的 tracer×center 组合——模型不仅要认识新示踪剂,还要在新示踪剂与新中心的组合下不崩。同步开创的还有赛制:AC2 data-centric 赛道固定 nnU-Net baseline、只允许修改数据管线,把"改数据 vs 改模型"的世纪之争变成了可排名的对照实验。挑战总结论文(arXiv 2605.05775)用线性混合效应模型给出系列最著名的结论之一:患者异质性解释 61% 的 Dice 方差,算法间差异仅解释 1.3%。
§0.2 三个数字
- 1,611 = 1,014+597:FDG 1,014 studies(UKT 单中心单台 Siemens Biograph mCT,900 患者,501 阳性+513 阴性,8,781 病灶)+ PSMA 597 studies(LMU 三台扫描仪,378 例全男性前列腺癌,19,377 病灶)——PSMA 病灶数是 FDG 的 2.2 倍,TMTV 132,853 mL vs 110,189 mL
- 4×50:final 测试 200 例的交叉矩阵设计——FDG-UKT(Dice 0.6619)/PSMA-LMU(0.6433)同域 + FDG-LMU(0.7702)/PSMA-UKT(0.5711)跨组合——最好的算法在未见 tracer×center 组合上掉 10 个 Dice 点,组合泛化被定量钉死为开放问题
- 61% vs 1.3%:线性混合效应模型方差分解——患者异质性 σ=0.171 贡献 61%,残差 38%,算法间差异仅 1.3%(σ=0.025);两个随机患者的期望 DSC 差约是两个随机算法差的 7 倍
§0.3 它怎么用
四大用途:①双示踪剂 PET/CT 分割训练——1,611 studies 全部带手工逐层勾画掩码+逐例临床元数据(剂量/摄取时间/扫描仪/体重),是 PET 病灶分割领域最大 openly available 手工标注库之一;②组合泛化/域移方法研究——4×50 交叉矩阵+官方 splits_final.json 参考 5 折,是"训练分布外性能"的标准试验床;③data-centric 方法对照——AC2 固定 baseline 的赛制设计+官方 nnunet-baseline/datacentric-baseline 代码,可直接复刻"只改数据管线"的对照实验;④PSMA 数据论文单独可用——PSMA-PET-CT-Lesions 在 TCIA(DOI 10.7937/r7ep-3x37)与 FDAT v3 独立成库,配合 Sci Data 2026 论文(DOI 10.1038/s41597-026-07821-z)独立引用。不适合:心脏/神经 PET 应用(任务限定肿瘤病灶)、临床诊断(研究定位)、需要 DICOM 原始私隐字段的场景(TCIA 版已 defaced 且 study dates 移位)。
使用边界补注:其一,掩码是病灶级二值——想做器官分割或病灶分类(原发/转移)需另找资源(TotalSegmentator 器官掩码可叠加为辅助监督,冠军方案即此用法);其二,无纵向数据——单时点横断面设计,治疗响应研究需转 IV/V 的纵向资产;其三,无临床结局——元数据止于成像协议,生存/病理分级等结局变量需外部 join(且去标识化后 join 不可行)。三边界的共同根源:这是为"分割任务"优化的资产,任务外用途需要自觉设计而非即拿即用。
§0.4 联动提示
本条是 autoPET 系列库内三连的中坚:rid 468 autoPET(I/II)的直接续作——I/II 用 FDG 库 1,014 studies(468 条目已详述),III 在其上并入 PSMA 597;rid 634 autoPET-v 的直接前作——V 的交互式分割以 III 冠军权重初始化(arXiv 2609.01554 自述 “initialised from the autoPET-III winning weights”),IV 冠军方案亦自述 “Building on the winning autoPET III nnU-Net pipeline”(arXiv 2508.21680)。跨系列联动:rid 475 lung-pet-ct-dx(FDG PET/CT 病灶分类+分割邻居)、rid 461 hecktor(PET/CT 咽喉病灶分割挑战)、ProstateX/PI-CAI(前列腺影像邻居——PSMA 队列的疾病域)。
§0.5 本条目信息地图
- 急着下载数据 → §2.1 载体表(选 TCIA/FDAT/HF)→ 附录 B 命令
- 急着训练模型 → 附录 C 五步 + §4.4 格式说明 + 坑点 4/8
- 写论文要引用 → §2.4 BibTeX + §1.3 双数据论文 + 坑点 1(Zenodo 陷阱)
- 做域移研究 → §3.2 测试矩阵 + §4.3 队列对照 + §6.3-§6.4 统计结论 + 附录 P
- 参赛/复刻赛制 → §3.3-§3.5 双赛道与规则 + §7.2 冠军五件套 + 附录 K 代码表
- 评估数据资产质量 → §5 标注 + §9 伦理许可 + 附录 F DAIMS + §10.1 十坑
§1 平台与系列谱系
§1.1 五届 frontier 命名谱系(autopet.org 官网原文)
autoPET 系列是医学影像挑战赛界罕见的每届一个 frontier(前沿)命名的品牌资产管理范式,五届演化路径自我讲述:
| 届 | 年份 | frontier 命名 | 核心问题 | 数据 | 库内条目 |
|---|---|---|---|---|---|
| autoPET I | 2022 | The segmentation frontier | 全自动病灶分割能做多好 | FDG 1,014(UKT 单中心) | rid 468(I/II 合并条目) |
| autoPET II | 2023 | The generalization frontier | 跨扫描环境(低剂量本底/不同重建)还能做多好 | FDG 1,014(加入 II 期变体) | rid 468 |
| autoPET III | 2024 | The tracer frontier | 换示踪剂(FDG→PSMA)+换中心(UKT→LMU)+两者组合还能做多好 | FDG 1,014+PSMA 597=1,611 | 本条 |
| autoPET/CT IV | 2025 | The human frontier | 人类先验(交互式分割)如何进入循环 | FDG+PSMA+纵向 CT 双库 | (IV 无独立库内条目) |
| autoPET V | 2026 | The human-AI frontier | 交互效率如何被指标化(AUC-Dice+AUC-DMM) | 五库全家福(QIBA 对齐重发布) | rid 634 |
三届主线的逻辑递进:I 问"能不能分割"→II 问"换环境还行不行"→III 问"换示踪剂、换中心、以及两者组合还行不行"。III 的 tracer frontier 不是简单加数据:FDG(葡萄糖代谢,广谱肿瘤显像)与 PSMA(前列腺特异性膜抗原配体,前列腺癌特异显像)在空间分辨率、摄取异质性、生理摄取分布上系统性不同——GC 主页图注原话:PSMA 分辨率更低、异质性更强。同一个"病灶分割"任务在两种示踪剂下是两个物理世界的问题。
谱系管理学的注脚:每届一个 frontier 命名使系列在检索与叙事上都自我延续——检索者记住"tracer frontier"即可定位 III,无需记年份;叙事上每届自动继承前届问题空间并声明新增维度。对照多数挑战赛"第 N 届"式的平淡命名,frontier 谱系是挑战赛品牌运营的教科书案例(autopet.org 官网首屏即五届卡片)。对库内条目的意义:rid 468/本条/rid 634 三条目构成"系列命名谱系"的完整样本,互链阅读时谱系表(附录 E)是总索引。
§1.2 组织矩阵:双数据方+双专业轴
| 角色 | 机构 | 人员 | 专业背景 |
|---|---|---|---|
| PSMA 数据方+主办 | LMU University Hospital Munich(慕尼黑大学医院) | Clemens Cyran、Michael Ingrisch、Jakob Dexl、Katharina Jeblick、Balthasar Schachtner、Andreas Mittermeier、Anna Theresa Stüber | 核医学+放射学(Ingrisch 为 LMU 定量影像组负责人) |
| FDG 数据方+主办 | UKT Tübingen(图宾根大学医院)MIDAS.lab | Sergios Gatidis、Thomas Küstner | 医学影像 AI 实验室(FDG-PET-CT-Lesions 原作者) |
| 学会支持 | ESHI | — | European Society for hybrid, molecular and translational imaging |
双数据方结构决定了 III 的数据拓扑:FDG 库(TCIA DOI 10.7937/gkr0-xv29,2022 年发布,I/II 已用)继续由 UKT 提供,PSMA 库(TCIA DOI 10.7937/r7ep-3x37)由 LMU 全新采集标注——两个库在采集协议、扫描仪型号、患者人群(FDG 混合性别三癌种 vs PSMA 全男前列腺癌)上完全异质,这种异质性正是组合泛化测试的原料。组织机构成员依规则回避排名(见 §3.4)。
人员注记:Isensee(nnU-Net 一作,DKFZ)与 Gatidis/Küstner(UKT MIDAS.lab)是系列的核心双极——前者代表方法学侧(其本人组队参赛并夺冠),后者代表数据与评估侧(主办);LMU 侧 Jeblick 既是 PSMA 数据论文一作又是挑战总结论文二作——数据产出与挑战运营在同批人手中闭环,这是小团队高质量治理的典型结构(对照大平台多机构协作的松散分工)。
§1.3 与两篇数据描述论文的关系
III 的数据本体有两篇独立的数据描述论文背书——这是系列条目中"一挑战两论文"的首例:
- FDG 库论文:Gatidis S, Kuestner T. A whole-body FDG-PET/CT dataset with manually annotated tumor lesions. Scientific Data 9:601 (2022),DOI 10.1038/s41597-022-01718-3——autoPET I/II 沿用,被引 386+(2026-09 口径);
- PSMA 库论文:Jeblick K, et al. A whole-body PSMA-PET/CT dataset with manually annotated tumor lesions. Scientific Data 13:1023 (2026),DOI 10.1038/s41597-026-07821-z(PMID 42432027 / PMC13354788)——注意该论文 2026 年才正式刊出,比数据发布(2024-04)晚两年:挑战赛先行、数据论文滞后的出版时序错位,使 2024-2025 年间的引用只能指向挑战赛与 Zenodo 提案。
坑 1:检索 PSMA 数据时若只认 Sci Data 论文,会误判数据"2026 年才存在"——实际 2024-04-01 已随挑战赛发布(FDAT v1 口径);反向亦然,只看挑战赛材料会漏掉 2026 年论文的 v3 口径修正(539/58 vs 537/60,见 §5.2 与附录 G)。
两篇论文的引用权重也需要分场景:FDG 库研究引 2022 论文即可自洽;PSMA 库研究必须同时引挑战赛材料(数据 2024 年即公开的事实层)与 2026 论文(标注协议与队列统计的正式披露层)——单引论文会缺失挑战赛期的设计语境(4×50 矩阵、AC2 赛道),单引挑战材料会缺失资历细节与版本修正记录。两篇 Sci Data 的卷期号(9:601 vs 13:1023)也提醒检索者:两者相隔近四年的出版周期,是"数据集论文"这一文体在挑战赛时代的时序错位样本。
§1.4 GC 子域与官网
- 挑战平台:autopet-iii.grand-challenge.org(GC 子域带连字符——autopet3/autopetiii/autopet-3 均为 404,这是检索时的第一个坑)
- 系列官网:autopet.org(五届谱系+III 详情页:任务/协议参数/测试矩阵/双赛道/leaderboard 全表)
- 代码资产三仓:github.com/ClinicalDataScience/autoPETIII(nnunet-baseline+datacentric-baseline)、github.com/lab-midas/autoPET(系列评估脚本)、github.com/MIC-DKFZ/autopet-3-submission(冠军方案)
§1.5 GC 平台页面结构与 autopet.org 官网导航
GC 挑战页的标准八板块在 III 上齐备,检索者按需直达:
| 页面板块 | URL 路径 | 内容 | 本条目对应章节 |
|---|---|---|---|
| Overview | / | 挑战一句话+奖金+关键日期 | §0、§8 |
| Task | /task | 任务定义:CT+PET 输入、二值病灶输出、无元数据 | §3 |
| Evaluation & Ranking | /evaluation | Dice/FPV/FNV 定义+加权公式+子集聚合 | §6 |
| Dataset | /dataset | 训练/测试两阶段数据说明+下载入口 | §2、§4 |
| Submission Rules | /submission | Docker/5 min/2 算法/开源强制 | §3.4 |
| Challenge Publication | /publication | 论文出口与引用指南 | §2.2 |
| Timeline | /timeline | 阶段日期 | §8.1 |
| Organization | /organization | 双机构人员名单 | §1.2 |
| Results | /results | final 榜单+Paper and Code 表 | §7.3、附录 K |
| Leaderboards(Preliminary Test Set) | /leaderboards | 初赛动态榜单(JS 动态加载——静态抓取只见表头) | §7.1 |
autopet.org 系列官网则为五届提供统一导航:首页五届卡片(每届一个 frontier 命名+一行定位)、各届详情页(III 页含协议参数全表与测试矩阵)。双站结构的方法学含义:GC 子域承载动态运营(榜单/提交),autopet.org 承载静态叙事(谱系/协议)——引用协议参数时查官网详情页比 GC 运营页更稳定(GC 页面可能随届次演进改版)。
§1.6 挑战提案 PDF 的内容与角色
Zenodo 10990932(concept 10990931)那份 0.1 MB 的提案 PDF 是 III 唯一的 Zenodo 实体,其角色值得单独说明:
- 内容:挑战提案(challenge proposal)——任务定义、数据概述、评估设计、组织团队的正式文档,GC 平台官方挑战的登记材料
- 为什么重要:它是 III 的官方 DOI 锚点——MICCAI 挑战赛要求提案经平台与学会审核(ESHI 支持),提案 DOI 是"官方挑战"身份的凭证;总结论文与官网均引此 DOI
- 为什么不是数据:103,805 字节的物理体积(一份数页 PDF);数据本体 20 GB 量级分居 TCIA/FDAT——体积即证伪(坑 2 的快速核查法)
- 引用建议:描述挑战赛本身引提案 DOI+GC 子域;描述数据引 TCIA/FDAT DOI+两篇 Sci Data——四组标识符各司其职
平台角色注记:GC 子域、autopet.org、Zenodo、TCIA/FDAT 四个入口的分工映射到四种用户动线——参赛者(GC:提交/榜单/规则)、综述作者(autopet.org:谱系与协议全表)、引用者(Zenodo:官方挑战身份 DOI)、数据工程师(TCIA/FDAT/HF:本体下载)。III 的入口分散不是混乱而是分层:每层的检索关键词不同(挑战名/届名/frontier 名/收藏名),这也解释了为何本条目 INFOBOX 与 §1.5 要把入口与关键词成对列出——跨入口检索是这条数据资产使用者最常迷路的地方。
§2 发布形态与学术出口
§2.1 发布物清单与 DOI 拓扑
AutoPET III 的发布物是一张需要小心分辨的拓扑图——Zenodo DOI 不是数据是本条目最重要的检索警示:
| 发布物 | 载体 | 标识符 | 内容 | 授权 |
|---|---|---|---|---|
| 挑战提案 | Zenodo | DOI 10.5281/zenodo.10990931(concept,重定向 10990932) | 挑战提案 PDF,103,805 字节 ≈ 0.1 MB,2024-04-18 发布,下载 1803/浏览 2066(2026-09-27 抓取) | CC BY-4.0 |
| FDG 库(DICOM) | TCIA | DOI 10.7937/gkr0-xv29 | 1,014 studies,defaced 去标识 | CC BY 4.0 |
| PSMA 库(DICOM) | TCIA | DOI 10.7937/r7ep-3x37 | 597 studies,2024 收录 | TCIA 数据使用许可(autopet.org 旧页口径 “TCIA Restricted license”) |
| FDG+PSMA 合并 NIfTI | FDAT(Tübingen) | DOI 10.57754/FDAT.rdkqd-wdh87 | 双库 nnUNet 合并(QIBA 对齐版) | CC BY-NC 4.0 |
| PSMA v3(NIfTI) | FDAT | DOI 10.57754/fdat.gabc0-3hv03 | 539/58 口径(v2 修正后) | CC BY-NC 4.0 |
| 挑战 v1 原始字节 | FDAT 记录页 | fdat.uni-tuebingen.de/records/0zs4c-89f12 | 2024-04-01 挑战期原始训练包 | CC-BY-NC 4.0(挑战官方口径) |
| HF 镜像 | HuggingFace | datasets/MedOtter/PSMA-PET-CT-Lesions | 21 GB,597 行,逐例 shape/affine 校验 | CC BY-NC 4.0 口径 |
坑 2:把 Zenodo 10990931 当数据集引用。concept DOI 重定向到的记录只有一份挑战提案 PDF——0.1 MB 的体积本身就是线索(1,611 例 PET/CT+掩码不可能小于 20 GB)。数据本体按用途选载体:要 DICOM 去 TCIA(两库 DOI 分开),要 nnUNet 格式 NIfTI 去 FDAT 合并库,要快速脚本化访问去 HF 镜像。另注意 TCIA 版 study dates 全体移位至 1997-2005(去标识化处理),与 FDAT 按日期不可 join,仅能以 patient hash 对齐。
体积核查法(30 秒证伪一条"数据链接"):拿到任何自称是本数据集的下载源,先看体积——FDG 库 DICOM ~14 GB 量级、PSMA 库 ~7-21 GB 量级(HF 镜像 21 GB 为含校验件的口径)、挑战合并 NIfTI 包 20 GB 上下。MB 级=文档/提案,GB 级=数据本体;体积、文件数(1,611 studies 对应 3,222 个 imagesTr 通道文件+1,611 掩码)、目录命名(nnUNet 六件套 vs TCIA 五件套)三项对上才可信。非官方源的"重组包"(如某些 Kaggle 转载)常见掩码缺失或通道错位——附录 M 的 30 分钟自检清单就是为这类情况准备的。
§2.2 学术出口
- 挑战总结论文:Dexl J, Jeblick K, … Isensee F, Küstner T, Ingrisch M. The autoPET3 Challenge. arXiv:2605.05775(v1 2026-05-07 / v2 2026-05-11,Preprint submitted to Medical Image Analysis,论文 license CC BY-NC-ND 4.0)——143,873 字符全文(2026-09-27 抓取口径),Table 1 数据统计/混合效应模型/三大结论/参与度统计均出于此
- 冠军方法论文:Rokuss M, Kovacs B, Kirchhoff Y, Xiao S, Ulrich C, Maier-Hein K H, Isensee F. From FDG to PSMA: A Hitchhiker’s Guide to PET/CT Tumor Lesion Segmentation with nnU-Net. arXiv:2409.09478(v1 2024-09-14,Comments 自述 “Winning method of the autoPET III challenge (model-centric) - Team LesionTracer”)
- 参赛论文潮:2024-09 一周内 arXiv 至少 7 篇(2409.07144 / 09478 / 10120 / 12155 / 13006 / 13410 / 13779),检索窗口 2024-09 至 2026-09 内 III 衍生 arXiv 论文 13+ 篇——挑战赛结束即引发论文潮,是 PET 分割子领域的方法学普查窗口
论文潮的构成(附录 K 全表支持):决赛 21 个公开资产条目中 15 个附 arXiv 论文——覆盖率 71%;题材分布横跨方法论文(冠军 ResEncL 五件套)、data-centric 实验(synthPET/datadiet)、工程适配(2D 集成/动态 TTA)与区域团队的技术报告(台湾/联影/港大)——一个挑战赛打出一整个子领域两年的文献供给。对系统综述作者的提示:以 GC Results 页 Paper and Code 表为起点做 snowballing,比纯关键词检索的召回更完整(多条目论文标题不含 “autoPET”)。
- 数据论文两篇:见 §1.3(FDG 2022 / PSMA 2026)
§2.3 代码出口
| 仓库 | 维护方 | 内容 |
|---|---|---|
| github.com/ClinicalDataScience/autoPETIII | 组织方 | nnunet-baseline(AC1 起点)+ datacentric-baseline(AC2 固定 baseline,MONAI-based) |
| github.com/lab-midas/autoPET | LMU(系列级) | 系列评估脚本(I-V 通用) |
| github.com/MIC-DKFZ/autopet-3-submission | 冠军队 | LesionTracer 完整方案(规则强制开源) |
强制开源是 III 规则的硬约束(见 §3.4):决赛队必须提交代码+权重+技术报告,这使 III 成为"榜单可审计"的挑战赛样本——冠军方案的每个组件(ResEncL、misalignment 增强、器官监督、TTA)都能在代码里逐行核对,而非只存在于论文叙事。
§2.4 引用指南(五组标识符各司其职)
% 挑战赛本体(提案 DOI——官方挑战身份凭证)
@misc{autopet3_proposal,
doi = {10.5281/zenodo.10990931},
title = {AutoPET III Challenge -- Automated Lesion Segmentation in
Whole-Body PET/CT -- Multitracer Multicenter Generalization},
year = {2024}, publisher = {Zenodo} }
% FDG 数据(TCIA + Sci Data 2022)
@article{gatidis2022fdg,
doi = {10.1038/s41597-022-01718-3},
journal = {Scientific Data}, volume = {9}, pages = {601},
title = {A whole-body FDG-PET/CT dataset with manually annotated tumor lesions},
year = {2022} }
% PSMA 数据(Sci Data 2026 + TCIA DOI 10.7937/r7ep-3x37)
@article{jeblick2026psma,
doi = {10.1038/s41597-026-07821-z},
journal = {Scientific Data}, volume = {13}, pages = {1023},
title = {A whole-body PSMA-PET/CT dataset with manually annotated tumor lesions},
year = {2026} }
% 冠军方法
@article{rokuss2024hitchhiker,
eprint = {2409.09478}, archivePrefix = {arXiv},
title = {From FDG to PSMA: A Hitchhiker's Guide to PET/CT Tumor
Lesion Segmentation with nnU-Net}, year = {2024} }
% 挑战总结(preprint,投 Medical Image Analysis)
@article{dexl2026autopet3,
eprint = {2605.05775}, archivePrefix = {arXiv},
title = {The autoPET3 Challenge}, year = {2026} }
引用选择决策树:谈"这个挑战赛"→提案 DOI+GC 子域;谈 FDG 数据→Gatidis 2022+TCIA gkr0-xv29;谈 PSMA 数据→Jeblick 2026+TCIA r7ep-3x37(或 FDAT v3);谈结果与方法→总结论文 2605.05775+冠军论文 2409.09478。任何场景都不要把提案 DOI 当数据 DOI 用(§2.1 坑 2 的引用层收口)。
§3 任务定义深度解析:组合泛化的赛制几何
§3.1 临床动机:为什么换示踪剂是难题
FDG-PET([18F]氟脱氧葡萄糖)与 PSMA-PET(前列腺特异性膜-targeting 配体)的物理差异不是"换个染料"级别的:
| 维度 | FDG(UKT 库) | PSMA(LMU 库) |
|---|---|---|
| 显像原理 | 葡萄糖代谢(广谱) | PSMA 受体表达(前列腺癌特异) |
| 适应症 | 黑色素瘤/淋巴瘤/肺癌等 | 前列腺癌(全部为男性患者) |
| 空间分辨率 | 2.04²×3.00 mm(单台 mCT 一致) | 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00 mm(三台混合) |
| 摄取异质性 | 相对均匀 | 更强异质性(GC 主页图注原话) |
| 病灶密度 | 8,781 病灶/1,014 studies ≈ 8.7 例/study | 19,377 病灶/597 studies ≈ 32.5 例/study(3.7 倍密度) |
| 生理假阳源 | 骨髓、纵隔、棕色脂肪、脑、膀胱 | 肝、脾、肾、颌下腺(PSMA 生理表达器官) |
| 扫描仪 | Siemens Biograph mCT 单机 | Siemens Biograph 64-4R TruePoint + Biograph mCT Flow 20 + GE Discovery 690 三机 |
表内六个维度叠加出一个结构性判断:FDG 库是"控制变量"式的库(单机单协议,病灶差异=生物学差异),PSMA 库是"真实世界"式的库(三机双配体宽窗口,病灶差异=生物学+设备+协议的混合)。这决定了两库在方法学上的分工:FDG 侧适合做病灶生物学的定量研究,PSMA 侧适合做设备鲁棒性研究;而组合泛化测试(§3.2)恰好要求两者都有——单用任何一库都构造不出 4×50 矩阵。III 的数据扩容不是"加量"而是"加维度",这是理解 tracer frontier 的钥匙。
一个在 FDG 上调好的模型迁移到 PSMA 会遭遇三重叠加:分辨率下降、病灶更小更密、生理摄取图谱完全不同。而 III 的测试设计把这种"单域迁移"升级为"组合爆炸"(§3.2)。
§3.2 测试矩阵:4×50 交叉设计的组合泛化几何
final 测试 200 studies 的分布是 III 最具方法学野心的设计:
| 测试子集 | 例数 | tracer | center | 训练中同组合是否存在 | 测试阳性例 | 病灶数 | TMTV (mL) |
|---|---|---|---|---|---|---|---|
| FDG-UKT | 50 | FDG | UKT | 有(1,014 例同域) | 31 | 516 | 7,127 |
| PSMA-LMU | 50 | PSMA | LMU | 有(597 例同域) | 33 | 1,309 | 6,052 |
| FDG-LMU | 50 | FDG | LMU | 无(组合泛化) | 50 | 410 | 5,701 |
| PSMA-UKT | 50 | PSMA | UKT | 无(组合泛化) | 42 | 624 | 882 |
四种组合中两种是训练分布内的"同域"组合、两种是训练中从未同时出现的 tracer×center 组合——compositional generalization 的严格定义:模型见过 FDG(在 UKT)、见过 PSMA(在 LMU)、也见过 UKT 和 LMU 各自的影像风格,但没见过"FDG 影像来自 LMU 设备"或"PSMA 影像来自 UKT 设备"。排名按 4 子集均值计算,跨组合成绩与同域成绩被强制等权。
组合泛化与普通 domain shift 的区别值得一段注脚:普通域移是"训练见过的因子取值之外"(如全新扫描仪),组合泛化是"每个因子都见过,但取值组合没见过"——它在认知科学与 NLP(组合式语法泛化)中早有系统研究,III 把这一范式引入医学影像评估。其严格性在于:模型无法靠"记住某个中心的整体风格"或"记住某种示踪剂的外观"作弊,必须把"示踪剂的病灶形态学"与"中心的设备指纹"作为可分离的因子学习——分离失败即组合崩溃。4×50 矩阵的设计使这种失败可被定位:跨组合子集掉分而同域不掉,即组合崩塌的证据。
冠军 LesionTracer 的子集 Dice 揭示了矩阵的难度梯度:FDG-LMU 0.7702 > FDG-UKT 0.6619 > PSMA-LMU 0.6433 > PSMA-UKT 0.5711。注意反直觉的一点:跨中心的 FDG-LMU(未见组合)反而是最高分——难点不在跨中心而在 PSMA 侧(分辨率低+病灶小密),PSMA-UKT 集齐"低分辨率示踪剂×未见设备"两重惩罚成为最差子集。总结论文结论 2 的原话:compositional generalization 仍是开放问题,主要由系统性体积高估驱动(跨域时模型倾向过分割以保险)。
坑 3:不要把 4 子集 Dice 均值当成"同域成绩"引用——0.66 的 mean Dice 里混着两个组合泛化子集;同域 FDG 成绩单独看是 0.77 量级(总结论文结论 1:“in-domain 多示踪剂分割已 sufficient and probably approaching reader agreement”)。引用时必须标注子集口径。
§3.3 双赛道:AC1 model-centric vs AC2 data-centric
III 的赛制创新是设双赛道——PET/CT 分割挑战史上首个 data-centric 赛道:
| 维度 | AC1 Modelcentric | AC2 Datacentrism |
|---|---|---|
| 起点 | 自由方法 | 固定 MONAI-based nnU-Net baseline |
| 允许修改 | 一切:架构/集成/训练策略/预训练 | 只许改数据管线:预处理/增强/样本选择/数据合成 |
| 外部数据 | 允许公开数据集+预训练模型 | 禁止外部数据 |
| AI 辅助 | 无限制 | AI 可用于数据管线但不得生成最终预测 |
| 方法论命题 | “更好的模型能做到什么” | “同样的模型,更好的数据能做到什么” |
AC2 的设计把 deep learning 界"data-centric AI vs model-centric AI"的论战(Ng 2021 的口号)第一次搬进 PET/CT 分割挑战赛:所有 AC2 参赛者共享同一个 baseline 与训练配置,排名差异完全归因于数据侧操作。结果(§7.4)颇具戏剧性:AC2 冠军用 diffusion model 生成肿瘤样本扩充训练集,overall 排到第 7——data-centric baseline 显著优于原版 nnU-Net baseline(后者 overall 24.0 位),证明在固定模型下数据工程的上限远比想象高。
§3.4 规则矩阵
| 规则 | 内容 | 设计意图 |
|---|---|---|
| Docker 标准化 | 提交 Docker 容器,官方统一环境推理 | 消除环境差异 |
| 运行时限制 | 5 min/例 | 临床可用性约束(全身体积扫描的推理预算) |
| 提交数量 | 每队最多 2 算法 | 防枚举攻击 |
| 元数据隔离 | 无辅助元数据(不告知 tracer/中心/适应症) | 强制模型从影像本身判读 |
| 利益回避 | 组织机构成员(LMU/UKT)回避排名 | 公信力 |
| 开源强制 | 决赛队交代码+权重+技术报告 | 可审计性 |
| 无 embargo | 赛后无禁发期 | 加速论文潮(2024-09 一周 7 篇) |
| 奖金 | 原已规划,因资金限制未能发放 | MICCAI 挑战赛罕见的诚实披露 |
坑 4:5 min/例运行限制是隐形成本——大模型与集成方法在精度竞赛中最常用的手段被预算卡死。冠军论文专门讨论了推理预算与集成的取舍;总结论文报告至少一队因超时导致 FPV 爆表(max.sh 口径 FPV 924.31 mL 量级——超时的未完成推理被计为全图假阳体积)。参赛队普遍用动态测试时增强(TTA)在预算内换精度(§7.5)。
§3.5 无元数据输入的方法论含义
「无辅助元数据」(不告知 tracer/中心/适应症)这条规则的方法论后果比字面深:
- 单模型硬吃双分布:推理时模型不知道面对的是 FDG 还是 PSMA——要么一个模型同时拟合两种强度分布与病灶形态学(nnU-Net 的多模态通道设计天然支持),要么在容器内部自行做推断路由。冠军方案选择前者(多通道统一训练)+器官监督兜底;也有队伍做显式 tracer 分类后分路由(I/II 时代的经验迁移)
- 强度归一化的两难(§7.5 归一化分裂的规则根源):global 归一化(用训练集全队列统计)对未见 tracer×center 组合可能失配——测试时模型不知道该用 FDG 统计还是 PSMA 统计;per-image z-score 则对 SUV 的绝对量级信息(生理摄取水平)不敏感。两派都有上榜者,规则逼出了真实的工程权衡
- 公平性的代价:无元数据同时意味着无法用临床先验做 shortcut(如"全男+前列腺显像=PSMA")——组织方主动切断了模型走捷径的通道,把泛化压力留给影像本身
- 对部署的诚实:真实临床工作流里 tracer/协议信息永远可得(PACS 元数据)——挑战赛的"盲推"设定是比部署更难的设定,成绩是性能下界
§4 数据本体:1,611 studies 的双库拓扑
§4.1 FDG 队列(UKT,1,014 studies)
- 来源:UKT Tübingen 单中心单台 Siemens Biograph mCT;900 患者(女 444/男 570;年龄 60±16 岁;体重 79±19 kg)
- 构成:501 阳性(黑色素瘤/淋巴瘤/肺癌,阳性判定依据临床报告,恶性病灶含原发灶与全部转移灶)+ 513 阴性对照——阴性对照占 50.6%,为 FPV 指标提供假阳测试面
- 病灶统计:8,781 个病灶;TMTV(总代谢肿瘤体积)110,189 mL
- 协议:禁食 ≥6 h;注射 ~350 MBq ¹⁸F-FDG(官网口径)vs mean 314.7±22.1 MBq(range 150-432)(总结论文口径)——双口径存照;摄取 ~60 min;CT 120 kV/200 mAs;对比剂 Ultravist 370 90-120 mL;OSEM 3 iterations/21 subsets;2 mm Gaussian 滤波;层厚 2-3 mm
- 分辨率:2.04²×3.00 mm³(PET 体素,全队列一致——单机优势)
§4.2 PSMA 队列(LMU,597 studies)
- 来源:LMU Munich,378 例全男性前列腺癌患者,3 台扫描仪(Siemens Biograph 64-4R TruePoint / Biograph mCT Flow 20 / GE Discovery 690)
- 构成:挑战期 v1 官网口径 537 例有病灶+60 例无病灶;FDAT v3/HF 镜像/Sci Data 论文口径 539/58——版本间对 3 名患者 5 例 mask 的修正所致(附录 G 详述)。本条目正文按论文/最新库口径叙述并注挑战期口径
- 病灶统计:19,377 个病灶;TMTV 132,853 mL——病灶数是 FDG 库的 2.2 倍,密度 3.7 倍(32.5 vs 8.7 病灶/study)
- 双配体:[18F]PSMA-1007 369 studies(246±27 MBq)+ [68Ga]PSMA-11 228 studies(214±45 MBq);摄取时间均值 74 min([18F]PSMA-1007 范围 6-181 min / [68Ga]PSMA-11 范围 7-195 min——摄取窗口的宽离散是 PSMA 协议的现实)
- CT 协议:颅底至大腿中部;143 mAs(mean);100/120 kV(range 80-140);层厚 2.5-5.0 mm(mean 2.82);571 例增强/26 例对比剂禁忌
- PET 协议:层厚 3.0-5.0 mm(mean 3.49);面内 2.73-4.07 mm
- 年龄/体重:71±8 岁;83±14 kg
PSMA 队列的两个深层特征值得展开。其一,全男性+单癌种的纯净性是双刃剑:对前列腺癌 PSMA 分割研究是理想同质队列;对"泛示踪剂分割"则引入性别/癌种与示踪剂的完全混杂(PSMA=男+前列腺癌,无法分离)——混合效应模型只能控制体积/中心/示踪剂,性别与癌种被淹没在 tracer 因子里。其二,三台扫描仪的设备异质性是 LMU 库内的"微型域移":2.73-4.07 mm 的面内分辨率差意味着 PSMA 库内部已有一个分辨率轴——这正是 PSMA-UKT 子集(UKT 的 mCT 分辨率一致性 vs LMU 混合)成绩解读时要小心的混杂:PSMA-LMU 子集(0.6433)的对手库 UKT 是单机,子集间差异混合了设备组合效应。
队列混杂的延伸提醒:任何以"FDG vs PSMA"命名的对比实验(包括总结论文的 tracer 项检验)实际比较的是"UKT 混性别三癌种 vs LMU 全男前列腺癌"两个完整人群包——示踪剂只是人群包差异的一部分。这在实验设计上是嵌套混杂(tracer 嵌套于 center,center 嵌套于人群),III 的 4×50 矩阵缓解了 center 层的嵌套(两 center 都出了 FDG 与 PSMA 测试),但人群层的嵌套(癌种与示踪剂绑定)在本数据内不可解——把 III 的 tracer 结论外推为"示踪剂一般性结论"时要带上这个限定语。
§4.3 队列对照速查
| 统计量 | FDG(UKT) | PSMA(LMU) |
|---|---|---|
| studies | 1,014 | 597 |
| 患者 | 900(女 444/男 570) | 378(全男) |
| 阳性/阴性 | 501/513 | 539/58(v3 口径) |
| 病灶总数 | 8,781 | 19,377 |
| TMTV (mL) | 110,189 | 132,853 |
| 扫描仪 | mCT 单机 | 三机混合 |
| PET 体素 (mm³) | 2.04²×3.00 | 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00 |
| 癌种 | 黑色素瘤/淋巴瘤/肺癌 | 前列腺癌 |
| 配体 | [18F]FDG | [18F]PSMA-1007 + [68Ga]PSMA-11 |
§4.4 交付格式与预处理
挑战合并包(nnUNet 格式):
imagesTr/
CASE_ID_0000.nii.gz # CT 通道(Hounsfield 单位)
CASE_ID_0001.nii.gz # PET-SUV 通道
labelsTr/
CASE_ID.nii.gz # 病灶二值掩码(0 背景/1 病灶)
dataset.json # nnUNet 任务描述
dataset_fingerprint.json # 强度指纹(归一化用)
splits_final.json # 官方参考 5 折划分
psma_metadata.csv # PSMA 逐例临床元数据
fdg_metadata.csv # FDG 逐例临床元数据
- 预处理:CT 重采样至 PET 分辨率(PET 的各向异性体素是基准网格);PET 由 activity counts 转 SUV(SUV = C_tissue/(A_inj/W),体重归一化标准摄取值)——原始 PET.nii.gz 存 activity counts,直接当 SUV 用会错,须读 SUV 换算后通道(I/II 延续坑,见 §10 坑点 7)
- TCIA 版目录结构:Patient/Study/{SUV, CTres, CT, SEG, PET}.nii.gz 五件套——SUV(换算后)/CTres(重采样)/CT(原始)/SEG(掩码)/PET(原始 counts)分文件存放
- splits_final.json:官方参考 5 折——复现 baseline 的标准划分,但注意它是随机划分,不保证 fold 间无患者泄漏的结构性承诺(患者级划分,nnUNet 惯例)
§4.5 测试集与提交物
- preliminary 阶段:5 studies 在线试提交(榜单校准)
- final 阶段:200 studies(4×50 矩阵,§3.2)held-out 不发布,GC 平台在线评估
- 提交物:Docker 容器(输入 CT+PET 双通道 NIfTI/MHA,输出二值掩码);无元数据输入(模型不知道自己在看哪个 tracer 哪个中心)
- 测试阳性密度对照(§3.2 表):PSMA-LMU 子集 1,309 病灶/50 例 ≈ 26.2 例/例 vs FDG-LMU 410/50 = 8.2——测试集内部病灶密度差 3 倍,FPV/FNV 的绝对体积阈值在不同子集的难度含义不同
测试口径的两个补充说明:其一,final 与 preliminary 的子集构成不同——5 例 preliminary 只用于榜单校准与管线验证,其分数与 final 200 例不可比(样本量与分布双重差异),把 preliminary 分数当成绩引用是常见错误;其二,测试子集的 TMTV 悬殊(882-7,127 mL,相差 8 倍)意味着 PSMA-UKT 子集不仅病灶小且总量轻——该子集 FNV 的绝对体积天然小,跨子集比较 FNV 时要按体积归一化思维解读,不能直接比绝对值。
§4.6 元数据字段:两份 CSV 的成像协议闭环
逐例元数据 CSV(psma_metadata.csv/fdg_metadata.csv)使 III 成为 PET 分割数据集中协议字段最完整的之一——每个影响 SUV 定量与影像外观的采集变量都有落位:
| 字段族 | FDG(UKT) | PSMA(LMU) | 建模用途 |
|---|---|---|---|
| 患者学 | 年龄(60±16)/性别(444F/570M)/体重(79±19 kg) | 年龄(71±8)/全男/体重(83±14 kg) | SUV 体重归一化的分母、人群偏移分析 |
| 注射 | [18F]FDG 活度(论文口径 mean 314.7±22.1 MBq) | [18F]PSMA-1007 246±27 / [68Ga]PSMA-11 214±45 MBq | SUV 分子、剂量-质量对照 |
| 时序 | 摄取 ~60 min | 摄取均值 74 min(范围 6-181 / 7-195) | SUV 时间漂移协变量 |
| 设备 | Siemens Biograph mCT(单机) | TruePoint / mCT Flow 20 / Discovery 690 | 域移因子(center 效应的物理载体) |
| 采集参数 | CT 120 kV/200 mAs、OSEM 3i/21s、2 mm Gaussian | 143 mAs、100/120 kV、层厚 2.5-5.0 mm | 重建风格敏感性分析 |
| 病灶学 | 病灶数/TMTV(8,781/110,189 mL) | 病灶数/TMTV(19,377/132,853 mL) | 难例分层与混合效应协变量 |
方法学价值:混合效应模型(§6.3)的协变量(体积/中心/示踪剂)全部能从 CSV 重建——公开元数据使统计结论可独立复算,这是 AI-Ready 度的高阶指标(多数分割库只给影像+掩码,不给可复算统计的原料)。
CSV 的字段边界也要认清:只有成像协议族(年龄/性别/体重/活度/摄取时间/设备/重建参数),没有临床结局族(分期/Gleason 评分/治疗/生存)——后者在 PSMA 前列腺癌队列的临床研究中常被需要,但挑战元数据刻意最小化以降低再识别风险(378 例全男性前列腺癌的人群,[年龄×日期×结局] 组合的再识别风险不可忽视)。需要结局变量的研究者应回到原始研究协议框架(联系 LMU/UKT)而非试图从公开元数据反推——这条边界写在 §9.2 的元数据最小化条款里,是隐私设计的组成部分而非数据缺失。
§4.7 方法论底座:SUV 定量链与为何 counts 不是 SUV
PET 定量的物理链路决定了本条目反复出现的"counts vs SUV"坑(坑点 4):
- 发射计数:正电子湮灭产生双光子,探测器记录符合事件(counts)——原始重建的输出单位是每体素计数率,取决于注射活度、摄取时间、体重、扫描仪灵敏度
- SUV 归一化:SUV = C_tissue/(A_inj/W)——把计数换算为"组织浓度相对注射剂量按体重归一"的无量纲量;A_inj(注射活度)与 W(体重)都在元数据 CSV 里
- 为何不能跳过:同一患者同一病灶,注射 250 MBq 与 350 MBq 的 counts 可差 40%,SUV 却应一致——用 counts 训练的模型学到的"强度"混入了剂量噪声;跨库(FDG vs PSMA、UKT vs LMU)时 counts 完全不可比,SUV 才是共同语言
- 挑战交付的选择:合并包 PET 通道(_0001)已是 SUV;TCIA 载体 PET 与 SUV 分文件并存——两载体都给了正路,坑只坑不看文档的人
- 归一化分歧的根源(§3.5/§7.5):SUV 本身仍带绝对生理量纲(肝本底 SUV≈2-3、脑 SUV 高、膀胱因排泄极高)——global z-score 抹平个体间差异、per-image 保留相对结构,两派分歧本质是对"生理量纲是不是信号"的判断
§4.8 跨载体对齐实操:patient hash 与日期陷阱
需要同时使用 TCIA(DICOM)与 FDAT(NIfTI)的研究者会遇到对齐问题——三个事实决定解法:
- TCIA 日期已移位:study dates 全体移位至 1997-2005 窗口(去标识化的日期泛化)——与 FDAT 的真实(或 FDAT 侧泛化)日期不可 join
- patient hash 是唯一桥梁:两载体共享同一 patient hash 命名体系——按 PatientID hash 匹配后,study 级以序列内顺序或 spacing 指纹辅助对应
- 内容指纹兜底:当 hash 命名规则存疑时,用体素 spacing+shape+掩码体积三元组做内容级指纹匹配(HF 镜像的逐例 shape/affine 校验脚本即此思路)
实操建议:大多数研究不需要跨载体对齐——nnUNet 训练用 FDAT 合并包一站搞定;TCIA 载体的价值在 DICOM 原生字段(设备参数/序列细节)与 CC BY 4.0 授权场景。两载体当作"同一数据的两个视图"分别用,避免强行合并的工程成本。
§5 标注协议:两步法与资历披露
§5.1 协议两步法
两个库共享"联合判读→逐层勾画"的两步协议,PSMA 论文(2026)进一步细化了第二步:
- Step 1 联合视觉判读:reader 同时查看 PET(SUV 图)、CT 与临床报告,识别全部肿瘤病灶——临床报告参与判定(FDG 阳性判定依据临床报告;恶性病灶含原发灶与全部转移灶)。这一步是"检测",决定哪里有病灶
- Step 2 逐层手工勾画:轴位逐层 free-hand 描画病灶轮廓。PSMA 论文细化为:先在轴位层面画圆形 VOI 包住候选病灶,以 SUV 阈值预分割打底,再逐层手工修正——阈值仅用于加速描画,最终掩码完全由手工修正决定(阈值不作最终输出,避免阈值协议偏差进入金标)
工具:PSMA 标注使用 mint Medical Mint Lesion™(CE 认证的肿瘤测量软件,Heidelberg)——CE 认证医疗器械软件做研究标注,是 PSMA 库质量叙事的一部分。
协议的工程含义注脚:Step 1 的"临床报告参与判定"意味着金标的信息含量高于影像本身——reader 可以依据随访/病理确认的报告把影像上不典型的病灶纳入,或排除影像疑似但临床阴性的发现。这使得"算法 vs 金标"的差距不能全读作"算法失败":部分差距是信息不对称(算法只看影像,金标看过报告)。总结论文把这一现实写进了临床建议(§6.5 的"不能当二分类器"),也是 reader agreement 结论(“approaching reader agreement”)的分寸所在——接近的是"影像判读的 reader",而非"全信息诊断的 reader"。
§5.2 标注者资历:两套口径并存(存照)
资历披露是本条目的伦理/质量轴亮点,但官网(挑战期)与 Sci Data 论文(2026)两套口径数字不同,须并存存照:
| 口径 | reader 资历 | 复核机制 |
|---|---|---|
| 官网挑战页口径 | UKT FDG 训练+测试:10 年经验 Hybrid Imaging 放射科医生;LMU FDG 测试:8 年经验;PSMA(LMU 训练+测试、UKT 测试):单 reader | 单 reader + 5 年经验复核 |
| Sci Data 论文口径(PSMA) | 单 reader 3 年经验 | 4 年与 >10 年两位 board-certified 专家独立验证 |
坑 5:引用资历时必须注明口径来源——“5 年复核”(官网)与"3 年标注+4/10+ 年双专家验证"(论文)不是矛盾而是时点与详细度不同:挑战页压缩叙事,论文按投稿要求全披露。AI-Ready 评估视角:不论取哪个口径,标注链(单人主标+多资历复核)都是可追溯的——这已优于绝大多数 PET 分割数据集(多数只有"expert annotated"一句话)。
§5.3 标注粒度与语义边界
- 二值掩码:所有病灶统一标签 1,不区分原发/转移、不区分病灶类型——任务被刻意简化为"检测+勾画所有恶性病灶",多类语义(如 metastasis 分期)留作下游研究
- FDG 阴性对照的语义:513 例无病灶 scans 不是"没有标注"而是确认无病灶(依据临床报告)——阴性对照是 FPV 指标的测试面,训练时可直接用于假阳抑制(autoPET-v 条目坑点 3 的延续提醒)
- PSMA 阳性例数版本修正:v1(挑战期)537/60 → v3(论文口径)539/58——修正涉及 3 名患者 5 例 mask(增删与边界修正),v2 版本说明记录在案。使用 v1 原始字节的队伍(如挑战期参赛者)与 v3 使用者的训练分布有微小差异
§5.4 标注口径的系列内对照(I/II/III)
III 继承 I/II 的 FDG 标注体系并在 PSMA 侧扩展出新的披露细节,三条线并列:
| 维度 | FDG(I/II/III 共用) | PSMA(III 新增) |
|---|---|---|
| reader | UKT 单中心 10 年经验 Hybrid Imaging 放射科医生(官网口径) | LMU 单 reader(论文:3 年经验) |
| 复核 | (I/II 论文口径的专家链) | 5 年经验复核(官网)vs 4 年+>10 年双专家独立验证(论文) |
| 工具 | free-hand 逐层勾画 | Mint Lesion™(CE 认证)+SUV 阈值预分割+手工修正 |
| 判定输入 | PET+CT+临床报告(阳性判定依临床报告) | PET+CT+临床报告(前列腺癌全程管理报告) |
| 粒度 | 二值病灶掩码(不分原发/转移) | 同左 |
| 版本治理 | (I/II 口径稳定) | v1→v2→v3 三版,5 例 mask 修正有记录 |
方法学意义:同一挑战内两个标注体系并行(不同机构、不同资历、不同工具),而混合效应模型(§6.3)的 tracer 项不显著说明标注体系的差异没有传导为可测的分割难度差异——这是对"标注者效应"的一次自然实验。
§6 评估体系:Dice/FPV/FNV 与混合效应模型
§6.1 三个指标的定义
| 指标 | 定义 | 捕捉什么 | 何时计算 |
|---|---|---|---|
| DSC(Dice) | 2× | pred∩GT | /( |
| FPV | 假阳体积:pred 中不与 GT 相交的 18-连通域体积之和(connectivity=18) | 假阳(误报)总量 | 全部病例(含阴性) |
| FNV | 假阴体积:GT 中未被 pred 覆盖的体积 | 假阴(漏报)总量 | 仅阳性病例 |
细节约定:FPV 按 18-连通域计算且不重叠体积求和——一个孤立误报器官算一次其全部体积,而不是逐体素累加后再除;健康病例(无 GT 病灶)的 Dice 无定义,只计 FPV——这使阴性对照在指标体系中有明确角色(惩罚过度分割)而不污染 Dice 均值。冠军 mean 成绩:DSC 0.66 / FNV 3.18 mL / FPV 2.78 mL。
§6.2 排名合成:四层聚合
Layer 1 每算法×每子集×每指标 → 原始值
Layer 2 4 子集均值(每算法每指标)
Layer 3 跨算法排名(每指标一个名次序列,tie break 用 Dice)
Layer 4 加权合成 = 0.5×rank(Dice) + 0.25×rank(FPV) + 0.25×rank(FNV)
一个数值示例让四层聚合可感:假设某算法 4 子集 Dice 均值排第 1、FPV 排第 5、FNV 排第 3,合成 = 0.5×1+0.25×5+0.25×3 = 2.5(越小越好);另一算法三项均排第 2,合成 = 0.5×2+0.25×2+0.25×2 = 2.0——全面第二的算法反超"单项第一但 FPV 偏差大"的算法。这正是加权名次合成的设计意图:防止单指标极化队伍登顶,也解释了为何第 2/3 名分差只有 0.03(IKIM 8.4062 vs HussainAlasmawi 8.4375,GC 名次分口径放大 10 倍显示)。
权重设计(Dice 0.5/FPV 0.25/FNV 0.25)隐含立场:分割精度与漏报比误报更重——临床语义上,漏掉一个转移灶(FNV)比多勾一块骨髓摄取(FPV)后果更重,但大量假阳会淹没阅片效率,故 FPV 以半权重入榜。名次合成而非数值合成,避免长尾极端值(如超时队伍 FPV 924 mL)扭曲聚合。
§6.3 混合效应模型:把"算法差异"放进方差分解
总结论文(arXiv 2605.05775)的方法论核心是线性混合效应模型(linear mixed-effects)对 DSC 的方差分解——这是挑战赛总结里罕见的统计深度:
| 方差成分 | 估计 | 占比 |
|---|---|---|
| 患者异质性(随机效应) | σ=0.171 | 61% |
| 残差(含算法×患者交互) | σ=0.134 | 38% |
| 算法间差异(随机效应) | σ=0.025 | 1.3% |
推论(论文原文口径):两个随机患者的期望 DSC 差约是两个随机算法差的 7 倍。临床翻译:病例难度 >> 算法优劣——同一个算法在容易病例和难病例上的差距,远大于好算法与差算法在同一病例上的差距。对挑战赛机制本身的启示:27 个决赛算法挤在 1.3% 的方差里内卷,而 61% 的方差在病例侧——优先级应从"选算法"转向"难例分诊+医师复核"(总结论文的临床建议)。
§6.4 固定效应发现
- 病灶体积:参考病灶体积每翻倍 → DSC +0.039 [95%CI 0.030, 0.048]——大病灶好分割,小病灶是 Dice 的主要拖累(与 PSMA-UKT 最差子集互证:低分辨率下小病灶更小)
- 中心效应:体积调整后 UKT +0.14 [0.063, 0.217]——UKT 影像(单机一致分辨率)系统性易分割
- 示踪剂效应:tracer 主效应与 tracer×center 交互不显著——在体积与中心调整后,"PSMA 难"主要经由分辨率与病灶大小传导,而非示踪剂本身
- PSMA 配体消融:PSMA-LMU 内 [68Ga]PSMA-11(n=16)vs [18F]PSMA-1007(n=17)无差异(β=−0.03 [−0.21, 0.16])——算法跨 PSMA 配体泛化,两种 PSMA 配体在算法眼里是一回事
§6.5 指标体系的临床警示
- 几乎所有指标分布非正态、长尾:多数病例成绩优秀,少量难例拉低均值——总结论文原话 “majority of cases look excellent, yet aggregate metrics appear modest”(多数病例看起来极好,而聚合指标显得平平)
- 当前模型不能当二分类器用:治疗后改变(炎症/术后变化)在 FDG 上高摄取,导致阴性病例误报——把 FPV 低解读为"可以无人值守"是危险的误读
- 常见失败模式图谱:假阳=生理摄取(FDG 侧:骨髓、纵隔、棕色脂肪、脑、膀胱;PSMA 侧:肝、脾、肾、颌下腺);假阴=小病灶/低摄取病灶——失败模式是结构性的(生理学决定),不是随机噪声
§6.6 混合效应模型的形式与读法
为让 §6.3-§6.4 的数字可复算,把模型形式写清楚(总结论文口径的合理重构):
DSC_ij ~ β0 + β1·log2(volume_ij) + β2·center_j + β3·tracer_j
+ b_patient_j + b_algorithm_i + ε_ij
随机效应:b_patient ~ N(0, 0.171²) # 患者异质性
b_algorithm ~ N(0, 0.025²) # 算法差异
残差:ε ~ N(0, 0.134²)
读法要点:
- 为什么患者是随机效应:27 个算法评同一批 200 例测试患者——患者抽样被视作从总体"病例难度分布"的随机抽取,其方差(61%)刻画的是病例难度谱宽,而非某个具体患者
- 为什么算法也是随机效应:研究问题不是"这 27 个谁强"(那是排名的事),而是"算法整体能解释多少 DSC 变异"——1.3% 即答案;把算法当固定效应反而无法回答这个泛化问题
- CI 的解读范例:β1=+0.039 [0.030, 0.048]——95% 置信区间不含 0,“体积每翻倍 DSC 提升"是稳健结论;tracer 项 CI 含 0(不显著)≠“tracer 无影响”,而是"体积与中心调整后无可测残差影响”(影响已由协变量传导,§6.4)
- 与排名体系的关系:混合效应是科学分析层(解释变异来源),加权排名是竞赛机制层(选出名次)——两层用同一批数据回答不同问题,III 把两层都做齐了,这比多数挑战赛"只排名不解释"的总结方式高一个方法学层级
§6.7 评估体系的五届演化(III 的位置)
| 届 | 指标体系 | 演化含义 |
|---|---|---|
| I | Dice 单指标 | 重叠即一切——体素几何的原点 |
| II | Dice(环境分层) | 数据分层但不改指标——泛化问题先于指标问题 |
| III | Dice 0.5+FPV 0.25+FNV 0.25(4 子集聚合) | 多维+跨域聚合——"假阳/假阴分账+组合泛化加权"的指标自觉 |
| IV | Dice+交互量 | 人类介入进入评估对象 |
| V | AUC-Dice+AUC-DMM 50/50 | 实例级检测+交互效率曲线化——指标体系成熟态 |
III 在演化线上的位置:把"病灶分割"从单 Dice 语义拆成精度/误报/漏报三个正交账本并显式加权——V 的实例级 DMM 本质是 FPV/FNV 思想的实例化延伸;而 III 的 4 子集聚合则是 V 的"统一多中心队列"评估的矩阵化前奏。读 V 条目(rid 634)的评估章时回看本节,能看到指标演化的连续轨迹而非突变。
§7 参赛方法生态:从 563 注册到 LesionTracer
§7.1 参与漏斗
| 阶段 | 规模 | 备注 |
|---|---|---|
| 注册 | 563 人(截至 2024-11) | 地域分布:亚洲 53%(其中中国 29%)/欧洲 28%(其中德国 8%)/北美 13%(其中美国 10%)/大洋洲 2%/南美 2%/非洲 <1% |
| 初赛(preliminary) | 24 队提交 218 算法 | 人均 9 次提交——GC 平台试错型迭代 |
| 决赛(final) | 17 队 27 算法 | +2 官方 baselines = 29 个评估对象 |
| 论文潮 | 一周 7 篇 arXiv(2024-09) | 无 embargo 规则的即时效应 |
漏斗数字的两个横向对照:其一,初赛 218 算法/24 队的提交密度在 GC 挑战里偏高——每队平均 9 次提交意味着多数队伍把 preliminary 当调参回路使用(榜单校准式开发),这与 5 min/例的快推理约束互为因果(单次提交快→迭代成本低→提交频率高);其二,注册 563 vs 初赛 24 队的 4% 转化率提醒读者:GC 注册数与"有效参赛规模"差一个数量级——跨挑战赛比较参与度时应统一用提交数口径而非注册数口径,否则 III 的"563 人"会被系统性高估为与真实竞争规模同量级。
§7.2 冠军方案 LesionTracer:五件套拆解
Team LesionTracer(DKFZ MIC + Heidelberg:Maximilian Rokuss、Balint Kovacs、Yannick Kirchhoff、Shuhan Xiao、Constantin Ulrich、Klaus H. Maier-Hein、Fabian Isensee——nnU-Net 核心作者本人参赛;arXiv 2409.09478;代码 github.com/MIC-DKFZ/autopet-3-submission):
| # | 组件 | 内容 | 增益逻辑 |
|---|---|---|---|
| 1 | nnU-Net ResEncL | nnU-Net 框架的 residual encoder 大配置(大内核大容量) | PET 体积数据的容量升级——default 配置欠拟合 |
| 2 | misalignment 增强 | 模拟 PET-CT 配准错位的弹性形变增强 | 双模态输入的现实噪声:PET 与 CT 硬件配准误差 |
| 3 | 多模态预训练 | CT/MR/PET 多数据集预训练(公开数据) | 跨模态影像先验迁移 |
| 4 | 器官监督多任务 | 附 TotalSegmentator 器官掩码做辅助任务(含独家唾液腺标签) | 生理摄取假阳抑制——唾液腺/颌下腺是 PSMA 生理摄取重灾区 |
| 5 | 动态测试时增强 | 推理时按 5 min 预算动态启停 TTA | 预算内榨精度 |
内部消融阶梯(冠军论文口径):default nnU-Net Dice 57.61 → ResEncL 65.31 → 完整方案 68.40(FPvol 7.82 / FNvol 10.35)——ResEncL 一项贡献 7.7 个点,是最大单一增益;其余四件套合计再添 3.1 点。官方测试 4 子集:0.6619/0.6433/0.7702/0.5711,mean 0.66。
五件套的工程细节补注:ResEncL 的"大内核大容量"对 PET 的意义在于全身视野的大感受野——病灶可出现在从颅底到大腿的任意位置,单帧上下文需要覆盖整躯干;misalignment 增强的形变幅度标定来自 PET-CT 硬件配准的实测误差(呼吸运动+多床位拼接);预训练数据涵盖 CT(腹部/胸部公开集)与 MR——跨模态先验使 CT 通道的解剖特征更早可用;唾液腺标签是冠军队自标注的独家增量(TotalSegmentator 早期版本不含颌下腺细分割)——为 PSMA 侧的头号假阳源定制;动态 TTA 的"动态"指按剩余时间预算决定增广轮数——满预算多轮、超时风险截断,是时间约束下的在线调度问题。
§7.3 榜单分布
| 名次 | 队伍 | 分数 | 归属 |
|---|---|---|---|
| 1 | LesionTracer | 最优(mean Dice 0.66) | DKFZ/Heidelberg(德国) |
| 2 | IKIM | 8.4062(加权名次分) | IKIM Essen(德国) |
| 3 | HussainAlasmawi | 8.4375 | MBZUAI(阿联酋) |
| 24.0 | nnunet baseline | — | 官方 AC1 起点(27 算法+2 中位偏后) |
| 7 | Lennonlychan(AC2 冠军) | — | CUHK(香港) |
| 10 | ZeroSugar(AC2 第 2) | — | 样本过滤策略 |
| 15.31 | datacentric baseline | — | AC2 起点(overall 口径名次) |
前三名差 0.03 个名次分(8.4062 vs 8.4375)——头部算法在名次合成下几乎并列,呼应 §6.3 的 1.3% 方差结论。nnunet baseline 排 24.0 位:官方 baseline 与冠军差 10.8 个 Dice 点,说明 AC1 赛道的模型侧空间仍然巨大;而 AC2 侧 datacentric baseline(15.31)显著优于原版 nnU-Net baseline(24.0)——只改数据管线就前进 8.7 个名次位。
§7.4 AC2 data-centric 结果:数据工程的上限实验
- AC2 冠军 Lennonlychan(CUHK,Lap Yan Lennon Chan + Yixuan Yuan):用 diffusion model 生成肿瘤样本扩充训练集——在不改模型一行的约束下,合成数据把 baseline 推到 overall 第 7;生成模型在医疗分割挑战赛的高位完赛,是 2024 年 data-centric 叙事的标志性案例
- AC2 第 2 ZeroSugar:样本过滤(数据清洗路线)
- 方法论注脚:AC2 冠军overall 第 7 但未进 AC1 前三——合成数据的增益上限仍低于冠军的五件套模型工程;两条路线各有天花板
§7.5 方法论生态普查(总结论文口径)
- 器官监督:6 队使用 TotalSegmentator 器官掩码做辅助任务——FPV 抑制的公共秘方(冠军、亚军皆用)
- TTA 预算适配:LesionTracer/AiraMatrix/QuantIF/WukongRT 实现动态 TTA——5 min 限制下的共同工程响应
- fold 组合:AiraMatrix 用 STAPLE 组合多 fold 输出
- 归一化分裂:PET 归一化分裂为 global(nnU-Net 风格 z-score,用 dataset fingerprint 全局统计)vs per-image 两派——无共识,双派皆有上榜者
- 共性:几乎所有决赛队都是 nnU-Net 变体——III 再次证明 nnU-Net 在医学分割的默认地位(Isensee 本人夺冠使这一点更具戏剧性:作者用自家框架证明框架的上限)
生态普查的两个长期效应:其一,器官监督与动态 TTA 的"公共秘方化"——这两项技术在 III 之前散见于各论文,III 之后成为 PET 分割的默认配置(V 届 baseline 直接内置),挑战赛作为"方法固化为社区默认"的加速器在此显形;其二,归一化两派的持续分裂——III 没有给出裁决,V 的统一队列设计也未裁决,归一化选择至今是 PET 分割的"风格分歧"而非"对错分歧",这提醒读者:挑战赛能裁决的问题(方法排序)与不能裁决的问题(设计选择的情境依赖性)需要分开对待。
§7.6 冠军代码仓库结构(可复现性解剖)
github.com/MIC-DKFZ/autopet-3-submission(规则强制开源+公开权重)的目录逻辑即"五件套"的代码化:
autopet-3-submission/
├── nnunet training configs # ResEncL 训练配置(plans/trainer 定制)
├── preprocessing/ # 双通道(CT HU + PET SUV)预处理管线
├── augmentation/ # misalignment 增强(PET-CT 配准错位模拟)
├── pretraining/ # CT/MR/PET 多数据集预训练脚本
├── organ supervision/ # TotalSegmentator 掩码辅助任务(含唾液腺标签)
├── inference/ # 动态 TTA(5 min 预算内启停)+ Docker 打包
└── README # 复现路径与权重下载
对照价值:官方 baseline 仓(ClinicalDataScience/autoPETIII)与冠军仓的 diff 就是"AC1 的模型侧上限空间"——nnunet-baseline 排 24.0 位 vs 冠军第 1,两者之间的每一个目录都对应 §7.2 表的一个组件。同样,DKFZ 自己的 data-centric 提交(LesionTracer2,github.com/MIC-DKFZ/miccai2024_autopet3_datacentric)展示了同一团队在"只许改数据"约束下的打法——AC1/AC2 双赛道在 DKFZ 内部形成了自我对照。
§7.7 常见失败模式的生理学图谱(FPV/FNV 的结构来源)
总结论文的失败模式分析可以组织成一张生理学地图——假阳不是随机错误,而是生理摄取的系统性撞车:
| 模态 | 假阳重灾区(生理高摄取器官) | 为什么撞车 |
|---|---|---|
| FDG | 骨髓、纵隔(血池/炎症)、棕色脂肪、脑、膀胱(排泄) | 葡萄糖代谢是广谱生理过程——炎症与 brown fat 的代谢激活与肿瘤摄取同谱段 |
| PSMA | 肝、脾、肾、颌下腺 | PSMA 受体在正常组织有生理表达——唾液腺/肾/肝脾的表达图谱与转移灶同谱段 |
假阴侧:小病灶(体积效应——部分容积效应使小病灶 SUV 被稀释)与低摄取病灶(分化好/治疗后)。方法论推论:器官监督(冠军组件 4)本质是把"生理摄取地图"作为先验注入模型——6 队用 TotalSegmentator 的现象由此可解释;而 FNV 难题(小/弱病灶)无先验可借,是 PSMA-UKT 子集 0.5711 的主要构成。这也是 §6.5「不能当二分类器」结论的病灶级根源:治疗后炎症在 FDG 上的高摄取与肿瘤复发在影像特征上同谱,需要临床报告级别的信息才能分辨——而这恰是规则中排除的元数据。
§7.8 AC1 vs AC2 的名次解读:两条路线的分数几何
把双赛道的结果放回同一张榜单读,有三个不对称:
- 模型侧天花板更高:AC1 冠军(68.40)比最好的 AC2 成绩(overall 第 7)名次高 6 位——模型工程(容量+预训练+多任务)仍压过数据工程;但这不是 data-centric 的失败,而是数据侧约束更紧(禁外部数据+固定 baseline)
- 数据侧性价比更高:datacentric baseline(15.31)仅凭组织方预置的数据管线改进就甩开原版 nnU-Net baseline(24.0)8.7 位——AC2 的"入门红利"大于 AC2 的"夺冠上限",说明 baseline 默认数据管线远非最优
- 两赛道的方法互窃:AC1 冠军的器官监督本质是"加数据"(辅助标签),AC2 冠军的合成样本本质是"造数据"——两条路线最终都在改训练分布,真正的分界是"改不改动模型代码",而非"改不改数据"
竞赛机制层的注脚:AC2 禁外部数据+禁改模型使排名完全归因于数据操作——这一设计的可解释性红利(冠军论文 2409.08068 的 synthPET 消融可以干净归因)是单赛道设计无法提供的。
§8 时间线与参与度
§8.1 时间线全景
| 时间 | 事件 |
|---|---|
| 2022-09 | autoPET I(MICCAI 2022)——FDG 库首战,segmentation frontier |
| 2022-10 | FDG 库数据论文刊出(Sci Data 9:601,DOI 10.1038/s41597-022-01718-3) |
| 2023 | autoPET II(MICCAI 2023)——generalization frontier,跨环境鲁棒性暴露泛化缺口 |
| 2024-04-01 | III 训练数据发布(挑战期口径,CC-BY-NC 4.0;FDAT 记录 0zs4c-89f12)——1,611 studies 合并包上线 |
| 2024-04-18 | Zenodo 挑战提案发布(DOI 10.5281/zenodo.10990931,CC BY-4.0,PDF 0.1 MB) |
| 2024 春-夏 | Preliminary 阶段:24 队 218 算法提交(5 例试提交集) |
| 2024-09 | final test 阶段:17 队 27 算法,200 例 4×50 矩阵 |
| 2024-09-14 | 冠军论文 arXiv 2409.09478(LesionTracer);一周内参赛论文 7 篇 |
| 2024-10 | MICCAI 2024 现场公布结果(第 27 届,Marrakesh, Morocco) |
| 2024-11 | 注册统计口径点:563 人(亚洲 53%) |
| 2026-05-07/11 | 挑战总结论文 arXiv 2605.05775(v1/v2,投 Medical Image Analysis) |
| 2026 | PSMA 数据论文刊出(Sci Data 13:1023,DOI 10.1038/s41597-026-07821-z);FDAT PSMA v3(539/58 口径) |
时序要点:**数据先行(2024-04)→论文滞后(2026)**的双出口时序错位(§1.3 坑 1);总结论文在系列节奏中的位置——IV 已开赛(2025)后 III 的总结才挂 arXiv,挑战赛运营与学术出版的时间差是常态。时间线的另一个双口径注记:训练数据发布日期"2024-04-01"为总结论文口径(挑战官方叙事的开赛日),FDAT 记录 0zs4c-89f12 的平台时间戳与 Zenodo 提案的 04-18 发布日各有其位——引用"开赛时间"用 04-01,引用"提案登记"用 04-18,两者不矛盾(先发布数据后登记提案 DOI 的顺序反映 GC 挑战的运营节奏)。
§8.2 参与度结构
- 地域:亚洲 53%(中国 29%)、欧洲 28%(德国 8%)、北美 13%(美国 10%)、大洋洲 2%、南美 2%、非洲 <1%——亚洲占半壁,与 GC 平台整体参与结构一致;冠亚军均欧洲队伍(DKFZ/Essen),第三名中东(MBZUAI)
- 漏斗:563 注册 → 24 队 218 算法(初赛)→ 17 队 27 算法(决赛)——注册到决赛转化率 3%,初赛提交密度(218/24≈9 算法/队)显示 GC 平台的迭代型参赛文化
- 产出:决赛 27 算法中 1 篇 preprint 未公开(nnunet baseline 无 preprint);2024-09 一周 7 篇、两年窗口 13+ 篇衍生 arXiv 论文
漏斗的另一面:注册 563 人中未进入初赛提交的超过 95%——GC 挑战赛注册即下载训练包的门槛极低,注册数更多度量"社区兴趣"而非"有效竞争";有效竞争的度量是初赛提交(24 队 218 算法,注册者的 4.3%)与决赛(17 队,初赛队的 71% 存活)。组织方以 5 例试提交集+preliminary 榜单为漏斗中部的校准器——这一"低门槛注册+高门槛决赛"的漏斗设计是 GC 平台的通用范式,III 的数字为其提供了又一次完整采样。
§8.3 与前后届的时间咬合
III 是系列承上启下的一届:其冠军权重成为 IV/V 的初始化起点(§0.4),其 4×50 组合泛化设计在 V 中演化为"新统一多中心测试队列+交叉标注矩阵";其 data-centric 赛道实验(AC2)为系列积累了"固定 baseline 对照"的方法学资产。系列条目对照阅读顺序建议:rid 468(I/II)→ 本条 → rid 634(V)。
§8.4 注册地域分布全表
| 大洲 | 占比 | 细分 | 观察 |
|---|---|---|---|
| 亚洲 | 53% | 中国 29%(亚洲内过半) | 全球最大参与极;决赛上榜者含 UIH_CRI_SIL(联影中央研究院)、HKURad、WukongRT 等亚洲队 |
| 欧洲 | 28% | 德国 8% | 冠亚军均德国(DKFZ/Essen)——主办国学术重镇(DKFZ/LMU/UKT/TUM)密度效应 |
| 北美 | 13% | 美国 10% | BAMF AI 等决赛队 |
| 大洋洲 | 2% | — | — |
| 南美 | 2% | — | — |
| 非洲 | <1% | — | 主办地摩洛哥(MICCAI 2024 会址)本地参与未见披露 |
方法论观察:注册地分布与决赛上榜分布错位——亚洲贡献一半注册,决赛头部由欧洲队伍主导;挑战赛的参与漏斗在地缘上不均匀(注册门槛低、决赛门槛是算力+工程密度)。中国 29% 的注册占比与 2019 年以来 MICCAI 挑战赛的参与趋势一致。
§9 伦理、许可与可获取性
§9.1 三层异构可获取性(AI-Ready 光谱核心)
| 载体 | 格式 | 标识 | 授权 | 特别注意 |
|---|---|---|---|---|
| TCIA | DICOM | FDG DOI 10.7937/gkr0-xv29;PSMA DOI 10.7937/r7ep-3x37 | CC BY 4.0(defaced);autopet.org 旧页另写 “TCIA Restricted license”(双口径存照) | study dates 移位至 1997-2005;defaced 去面部标识 |
| FDAT | NIfTI | 合并库 10.57754/FDAT.rdkqd-wdh87;PSMA v3 10.57754/fdat.gabc0-3hv03;挑战 v1 0zs4c-89f12 | CC BY-NC 4.0(商用需联系组织方) | nnUNet 格式即拿即训;v1/v3 版本差异(§5.3) |
| HuggingFace | NIfTI/Parquet | MedOtter/PSMA-PET-CT-Lesions(21 GB,597 行) | CC BY-NC 4.0 口径 | 逐例 shape/affine 校验脚本随库——社区质检样本 |
| Zenodo | 10.5281/zenodo.10990931→10990932 | CC BY-4.0 | 仅提案 PDF 0.1 MB,非数据(§2.1 坑 2) |
组织方官网许可原话:“Everyone (also non-participants of the challenge) are free to use the training data set in their respective work, given attribution in the publication. If you plan to use the data in a commercial setting, please reach out to the organizers.”——学术自由用(注明出处)、商用要谈。全部开放获取、无注册门槛(TCIA/FDAT/HF 三载体皆公开直载);但授权口径三轨并存(CC BY 4.0 / CC BY-NC 4.0 / 旧页 Restricted 字样),引用与商用前必须核对载体级授权。NIfTI/挑战官方口径取 CC BY-NC 4.0。
§9.2 隐私与去标识
- defaced:TCIA DICOM 已行面部去标识(头颈部体素替换)——FDAT NIfTI 版未 defaced(研究协议约束下发放),两载体隐私处理强度不同
- study dates 移位:TCIA 版检查日期全体移位至 1997-2005 窗口(日期泛化),与 FDAT 版按日期不可 join——跨载体对齐仅能以 patient hash
- 元数据最小化:挑战元数据 CSV 只含年龄/性别/体重/剂量/摄取时间/扫描仪等成像参数,无病理分期/治疗/生存等临床结局——病灶生物学结局变量缺席,限制下游预后建模
- 伦理审批:两库采集均在各自机构伦理框架内(原数据论文披露 LMU/UKT 审批),挑战页未单列 IRB 编号——以 TCIA/FDAT 载体的审批链为信用背书
§9.3 维护与版本治理
- FDAT 记录带版本历史(v1→v2→v3),PSMA 阳性例数修正有记录可查(§5.3)——版本治理透明度高于平均
- HF 镜像(MedOtter)为社区行为,非官方出口——其 539/58 口径与 FDAT v3 一致,可作交叉校验源而非主源
- 系列级代码资产(lab-midas/autoPET 评估脚本)跨届共用——V 届的 AUC 指标实现也在此仓,脚本连续性是系列复现的隐形基础设施
§9.4 商用与再分发的实操问答
- 学术用途:三载体任选,注明出处即可(官网原话 “free to use … given attribution in the publication”);NIfTI 与 DICOM 的授权差异在学术场景不构成实际障碍
- 商用场景:FDAT NIfTI 的 NC 条款禁止——需 “reach out to the organizers”(联系 LMU/UKT 组织方谈授权);TCIA DICOM 的 CC BY 4.0 理论上允许商用,但同一份数据的商用权利不应通过换载体绕过——保守做法是统一按组织方口径协商
- 再分发:CC BY/CC BY-NC 均允许带署名再分发(NC 版不得商用)——HF 镜像(MedOtter)的存在即 CC BY-NC 再分发的合规实例;再分发时应保留版本标识(v1/v3 口径差异会传导到下游,见坑点 3)
- 衍生模型权重:按 CC BY-NC 4.0 口径,NC 数据训练的权重是否受 NC 约束在法学上存争议——保守口径下商用部署前咨询组织方;这亦是本条目 DAIMS 伦理维度扣分的点之一
- 混合训练:与 CC BY 数据混训后再商用,授权边界更模糊——建议按最严成分(NC)处理
§9.5 TCIA 生态位(与库内影像载体谱系的关系)
III 的两库在 TCIA 收藏谱系中的位置值得库内读者注意:FDG-PET-CT-Lesions 与 PSMA-PET-CT-Lesions 都是 TCIA 上少见的 PET/CT 双模态+病灶级手工掩码收藏(多数 TCIA 收藏是 CT/MR 单模态或放射学诊断影像)——库内同类仅 lung-pet-ct-dx(rid 475,FDG 单示踪剂)与 LCTSC(胸部器官 CT 掩码,非病灶)。TCIA 的分析结果(Analysis Results)结构使 SEG 掩码可被 Dice 类工具直接读取;DICOM-SEG 封装的掩码与 FDAT 的 NIfTI 掩码内容同源但封装异构——用 SimpleITK/dcmqi 转换时注意掩码几何原点对齐。
§10 总结:示踪剂前沿教会我们的事
AutoPET III 的核心贡献不在"更大的数据"(1,611 studies 在 2026 年视角不算巨型),而在把"组合泛化"从直觉变成可测量的实验设计:4×50 交叉矩阵用 200 例 held-out 数据把"未见 tracer×center 组合"钉死为开放问题,并用混合效应模型把病例异质性(61%)与算法差异(1.3%)的悬殊比例写成挑战赛文献里被引用最多的方差分解。系列意义:III 是权重基础(IV/V 冠军方案自述初始化自 III 冠军)、是数据基础(PSMA 库进入 V 的 QIBA 对齐合并库)、是方法论基础(AC2 data-centric 赛道的首次实验)。对 AI-Ready 数据集评估的启示:测试矩阵设计与方差分解报告,应作为挑战赛型数据资产的核心评分项——数据量相同,测什么、怎么测、测出什么结论,决定资产的科学价值。
§10.1 坑点表(10 坑汇总)
| # | 坑点 | 后果与规避 |
|---|---|---|
| 坑点 1 | Zenodo 10990931 被当数据集引用——该记录仅含 0.1 MB 提案 PDF,数据本体在 TCIA+FDAT | 按 DOI 引用前先查体积;数据引用用 TCIA DOI(10.7937/gkr0-xv29 与 10.7937/r7ep-3x37) |
| 坑点 2 | GC 子域拼写:autopet-iii(带连字符)才存在,autopet3/autopetiii/autopet-3 均 404 | 从 autopet.org 官网 href 反查;检索加 “grand-challenge” 限定词 |
| 坑点 3 | PSMA 阳性例数双口径:537/60(挑战 v1 官网+总结论文 Table 1)vs 539/58(FDAT v3+HF+Sci Data 论文) | 正文按最新库口径(539/58)并注挑战期口径;混用两版会得到对不上的病灶统计 |
| 坑点 4 | 原始 PET.nii.gz 是 activity counts 不是 SUV | 直接当 SUV 用会错归一化;读 SUV 通道或按 SUV=C/(A_inj/W) 换算(TCIA 版有独立 SUV 文件) |
| 坑点 5 | Dice 的分母陷阱:无病灶病例 Dice 无定义(只计 FPV)——把 0.66 均值当"全体 Dice"是口径错误 | 引用时标注"阳性病例 Dice+阴性病例 FPV"的合成口径;同域成绩 0.77 量级与跨组合 0.57 分开引用 |
| 坑点 6 | license 三轨:TCIA CC BY 4.0 vs FDAT NIfTI CC BY-NC 4.0 vs 官网旧页 “Restricted” 字样 | 商用前按载体核对;NIfTI/挑战口径取 CC BY-NC 4.0(NC 限制商用) |
| 坑点 7 | TCIA 与 FDAT 不可按日期 join:TCIA study dates 全体移位至 1997-2005,且 defaced 与否两库不同 | 跨载体对齐仅用 patient hash;隐私处理强度随载体变化需在论文里声明 |
| 坑点 8 | 5 min/例运行限制:超时提交 FPV 爆表(924 mL 量级),大模型/集成受预算约束 | 推理工程(动态 TTA/滑窗优化)是参赛必答题;本地复现注意计时口径 |
| 坑点 9 | 测试集同域泄漏风险:final 含 50 例 PSMA-LMU 与训练 597 例同机构同库源,论文未声明不相交 | 同域子集成绩或含泄漏红利;跨研究比较时勿把 PSMA-LMU 子集分数当独立验证 |
| 坑点 10 | FDG 剂量双口径:官网 ~350 MBq vs 总结论文 mean 314.7±22.1 MBq(range 150-432) | 协议复现取论文口径(含 range);官网数字为挑战期压缩叙事 |
十坑的使用法:坑点 1-2 是检索层(找资源时不踩空),坑点 3/10 是口径层(引用数字时分清版本),坑点 4/5 是使用层(训练/评测时的技术陷阱),坑点 6-7 是授权与对齐层(工程化前的合规检查),坑点 8-9 是解读层(读榜单时的公平性意识)。按工作流定位坑点:下载数据前看 1/2/6/7,开训前看 3/4,自建评测看 5/8,写论文比较成绩看 9/10——十条覆盖了从检索到发表的完整链路。
§10.2 五届视角下的 III:承上启下的枢纽届
把 III 放回五届谱系看,它同时是三条线的交汇点:
- 数据线:I/II 的 FDG 单库(1,014)在 III 扩为双库(1,611),PSMA 库自此成为系列常驻资产——V 的 QIBA 对齐合并库(rid 634 条目 §4.3)以 III 的双库为骨架;纵向 CT(IV)与 DeepPSMA(V)都是后续叠加层
- 方法线:III 冠军权重是 IV/V 两届冠军方案的显式初始化起点(arXiv 2508.21680/2609.01554 自述)——系列方法学的主干从 III 的 nnU-Net ResEncL 五件套上生长;III 的器官监督实践(TotalSegmentator 化)也延续至 V 的 baseline
- 评估线:III 的 Dice+FPV+FNV 加权是系列评估从"单一 Dice"(I/II)走向"多维指标"(V 的 AUC-Dice+AUC-DMM)的中间态;混合效应方差分解则是一次性的方法学跃迁——V 的总结框架直接继承了它的统计范式
一句话定位:III 之于 autoPET 系列,如同 GPT-3 之于 GPT 谱系——不是最大的一届,而是让后续所有届次都站在其上的那一届。
§10.3 三句话记忆卡
- AutoPET III = FDG 1,014 + PSMA 597 = 1,611 studies,测"未见 tracer×center 组合",冠军 DKFZ LesionTracer mean Dice 0.66(同域 0.77,跨组合最低 0.5711)。
- 混合效应方差分解:患者 61% / 残差 38% / 算法 1.3%——病例难度碾压算法差异,难例分诊优先于选模型。
- 数据三载体(TCIA CC BY 4.0 / FDAT CC BY-NC 4.0 / HF 镜像),Zenodo 10990931 只是 0.1 MB 提案 PDF——别把它当数据引用。
FAQ:40 问直答
Q1 AutoPET III 是什么? MICCAI 2024 官方挑战赛:全身 PET/CT 肿瘤病灶自动分割,多示踪剂(FDG+PSMA)多中心泛化设计,“The tracer frontier”。
Q2 数据量多大? 训练 1,611 studies:FDG 1,014(UKT,900 患者)+PSMA 597(LMU,378 患者);held-out 测试 200 例(4×50 矩阵)+preliminary 5 例。
Q3 在哪里下载? TCIA(DICOM,FDG DOI 10.7937/gkr0-xv29;PSMA DOI 10.7937/r7ep-3x37)、FDAT(NIfTI 合并库 DOI 10.57754/FDAT.rdkqd-wdh87)、HuggingFace 镜像(MedOtter/PSMA-PET-CT-Lesions)。
Q4 Zenodo DOI 10.5281/zenodo.10990931 下的是什么? 挑战提案 PDF(0.1 MB),不是数据——数据本体在 TCIA+FDAT。
Q5 什么 license? 双轨:TCIA DICOM CC BY 4.0(defaced);FDAT NIfTI CC BY-NC 4.0(禁商用)。挑战训练包官方口径 CC-BY-NC 4.0。
Q6 任务形式? CT+PET 双通道输入(nnUNet 格式 _0000 CT/_0001 PET-SUV),输出二值病灶掩码;不告知 tracer 与中心。
Q7 什么是组合泛化测试? final 200 例含 FDG@LMU 与 PSMA@UKT 两个训练中未见的 tracer×center 组合(各 50 例)——测模型在新示踪剂×新中心组合下的表现。
Q8 测试集能下载吗? 不能。200 例 held-out,仅 GC 平台在线评估;preliminary 5 例可在线试提交。
Q9 排名怎么算? Dice 0.5+FPV 0.25+FNV 0.25 加权名次合成;先 4 子集均值、再跨算法排名;tie break 用 Dice。
Q10 FPV/FNV 是什么? FPV=假阳体积(18-连通域求和);FNV=假阴体积。健康病例只计 FPV(Dice 无定义)。
Q11 谁赢了? Team LesionTracer(DKFZ MIC+Heidelberg,Rokuss/Isensee 等)——nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督(含唾液腺标签)+动态 TTA,mean Dice 0.66。
Q12 冠军内部提升多少? default nnU-Net 57.61 → ResEncL 65.31 → 完整方案 68.40(内部消融口径)。
Q13 第二三名是谁? IKIM(Essen,8.4062)、HussainAlasmawi(MBZUAI,8.4375)——加权名次分。
Q14 AC2 data-centric 赛道是什么? 固定 MONAI nnU-Net baseline,只许改数据管线(预处理/增强/合成),禁外部数据——PET/CT 分割挑战史首个 data-centric 赛道。
Q15 AC2 谁赢了? Lennonlychan(CUHK):diffusion model 生成肿瘤样本扩充训练集,overall 第 7;第 2 ZeroSugar(样本过滤,overall 第 10)。
Q16 官方 baseline 排第几? nnunet baseline 24.0 位(27 算法+2 中)——与冠军差 10.8 Dice 点;datacentric baseline 15.31,显著优于原版。
Q17 多少人参加? 注册 563 人(截至 2024-11,亚洲 53% 其中中国 29%);初赛 24 队 218 算法;决赛 17 队 27 算法。
Q18 奖金发了多少? 零——原已规划奖金因资金限制未能发放(总结论文罕见披露)。
Q19 标注怎么做的? 两步法:PET+CT+临床报告联合判识别病灶 → 轴位逐层 free-hand 勾画(PSMA 用 Mint Lesion™,SUV 阈值仅预分割打底)。
Q20 标注者什么资历? 双口径:官网"10 年(UKT FDG)/8 年(LMU FDG)/单 reader+5 年复核(PSMA)“;论文"3 年标注+4 年与 >10 年双专家验证”。
Q21 病灶有多少个? FDG 8,781(TMTV 110,189 mL);PSMA 19,377(TMTV 132,853 mL)——PSMA 病灶数 2.2 倍。
Q22 PSMA 阳性到底多少例? 双口径:537/60(挑战 v1)vs 539/58(v3/论文)——3 名患者 5 例 mask 的版本修正。
Q23 PSMA 用了什么配体? [18F]PSMA-1007(369 studies,246±27 MBq)+[68Ga]PSMA-11(228 studies,214±45 MBq)——算法跨配体无显著差异(消融实证)。
Q24 最大的方法学结论是什么? 混合效应模型方差分解:患者异质性 61%、残差 38%、算法差异仅 1.3%——病例难度 >> 算法优劣,建议优先难例分诊+医师复核。
Q25 组合泛化做得好吗? 不好且被定量钉死:未见组合 PSMA-UKT Dice 0.5711(同域 FDG-LMU 反而最高 0.7702)——主要由系统性体积高估驱动,仍是开放问题。
Q26 in-domain 什么水平? 同域多示踪剂分割"sufficient and probably approaching reader agreement"(总结论文结论 1 原话),同域 FDG 0.77 量级。
Q27 能当二分类器用吗? 不能——治疗后改变致阴性病例误报(高摄取炎症/术后变化),FPV 低不等于无人值守可用。
Q28 有代码吗? 全链开源:组织方 baseline(github.com/ClinicalDataScience/autoPETIII)、评估脚本(github.com/lab-midas/autoPET)、冠军方案(github.com/MIC-DKFZ/autopet-3-submission)。
Q29 运行限制多严? 5 min/例(Docker 容器统一环境)——超时 FPV 爆表(924 mL 量级);参赛队用动态 TTA 在预算内换精度。
Q30 与 autoPET V 什么关系? 直接前作:V 的交互式分割以 III 冠军权重初始化(arXiv 2609.01554),数据进入 V 的 QIBA 对齐合并库;IV 冠军亦自述构建于 III 获奖管线(arXiv 2508.21680)。
Q31 怎么复现官方 baseline? ClinicalDataScience/autoPETIII 仓+附录 C 五步(预处理→按 splits_final 5 折训练→Docker 导出);ResEncL 配置用 nnUNetPlannerResEncL。
Q32 splits_final.json 是患者级划分吗? 是(nnUNet 惯例患者级)——同一患者的多个 studies 不会跨 fold 泄漏。
Q33 训练包里 PET 通道要不要再换算 SUV? 不用——_0001 已是 SUV;只有 TCIA 载体的 PET.nii.gz(counts)需要换算或改读 SUV.nii.gz。
Q34 测试 4 个子集哪两个最难? PSMA-LMU(病灶最密,1,309 个)与 PSMA-UKT(未见组合,Dice 0.5711)——PSMA 侧难度系统性高于 FDG 侧。
Q35 为什么 FDG-LMU 是最高分子集? 反直觉但合理:FDG 分辨率高+病灶大而少(8.2/例),即使换了中心(LMU 设备),FDG 的物理优势仍占上风——难点在示踪剂不在中心。
Q36 final 排名前列差多少? 第 2 名 IKIM 8.4062 vs 第 3 名 HussainAlasmawi 8.4375——名次分差 0.03;头部算法在名次合成下几乎并列(呼应算法方差 1.3%)。
Q37 哪些决赛队来自中国? UIH_CRI_SIL/UIH_CRI_SIL_2(联影中央研究院+北大,arXiv 2409.09784)、HKURad、WukongRT、Prof Ching-Wei Wang(台湾,2409.07144)等——亚洲注册 53% 的决赛端代表。
Q38 DKFZ 打了 data-centric 赛道吗? 打了——LesionTracer2(MIC-DKFZ/miccai2024_autopet3_datacentric,arXiv 2409.10120)是 DKFZ 的 AC2 提交;冠军队双赛道自我对照。
Q39 总结论文什么时候能正式引用? arXiv 2605.05775(2026-05)当前为 preprint(投 Medical Image Analysis);正式刊出后替换引用条目(附录 I 观察点)。
Q40 这份数据能用来做示踪剂分类/中心分类吗? 元数据 CSV 有 tracer 与扫描仪字段,可以做——但要记住挑战赛规则刻意屏蔽了这些信息给分割模型;分类研究是合规的衍生用途。
FAQ 溯源注记:40 问的答案全部可回溯到正文与 FACTS 的具体位置——Q1-Q10 对应 §0/§3/§4(任务与数据),Q11-Q18 对应 §7/§8(结果与参与),Q19-Q23 对应 §5/§4(标注与队列),Q24-Q27 对应 §6(统计与临床结论),Q28-Q30 对应 §2/§1.4/§0.4(代码与系列),Q31-Q40 为实操补充(复现/口径/检索)。FAQ 被设计为"反查入口"而非独立事实源——任何一处答案与正文冲突时以正文为准,并向条目维护者报差异。
事实清单:36 条硬事实 + 6 条口径注
硬事实(F1-F36)
- F1 全称:AutoPET III Challenge——Automated Lesion Segmentation in Whole-Body PET/CT – Multitracer Multicenter Generalization(来源:Zenodo 提案 PDF + GC 子域)
- F2 定位:autoPET 系列第三届,“The tracer frontier”(autopet.org 官网五届谱系)
- F3 平台:autopet-iii.grand-challenge.org(带连字符子域;autopet3/autopetiii/autopet-3 均 404)
- F4 会议:MICCAI 2024(第 27 届)官方挑战,Marrakesh, Morocco 现场公布;ESHI 支持
- F5 主办:LMU University Hospital Munich(Cyran/Ingrisch/Dexl/Jeblick/Schachtner/Mittermeier/Stüber)+ UKT Tübingen MIDAS.lab(Gatidis/Küstner)
- F6 Zenodo:concept DOI 10.5281/zenodo.10990931 → 10990932;挑战提案 PDF 103,805 字节,2024-04-18 发布,CC BY-4.0,下载 1803/浏览 2066(2026-09-27 抓取)——非数据本体
- F7 训练:FDG 1,014 studies(UKT,900 患者,单台 Siemens Biograph mCT)+ PSMA 597 studies(LMU,378 男性前列腺癌,3 台扫描仪)= 1,611
- F8 FDG 队列:501 阳性(黑色素瘤/淋巴瘤/肺癌)+513 阴性;女 444/男 570;60±16 岁;79±19 kg;8,781 病灶;TMTV 110,189 mL;2.04²×3.00 mm
- F9 PSMA 队列:539 有病灶+58 无(v3/论文口径)vs 537/60(挑战 v1 口径);71±8 岁;83±14 kg;19,377 病灶;TMTV 132,853 mL
- F10 PSMA 配体:[18F]PSMA-1007 369 studies(246±27 MBq)+[68Ga]PSMA-11 228 studies(214±45 MBq);摄取均值 74 min
- F11 PSMA 扫描仪:Siemens Biograph 64-4R TruePoint / Biograph mCT Flow 20 / GE Discovery 690;分辨率 2.73²×3.27 / 4.07²×2.00 / 4.07²×5.00 mm
- F12 FDG 协议:禁食 ≥6 h;~350 MBq(官网)vs 314.7±22.1 MBq range 150-432(论文);60 min 摄取;CT 120 kV/200 mAs;OSEM 3i/21s;2 mm Gaussian
- F13 PSMA CT 协议:颅底至大腿中部;143 mAs mean;100/120 kV(80-140);层厚 2.5-5.0 mm;571 增强/26 禁忌
- F14 测试:final 200 studies=4×50(FDG-UKT/PSMA-LMU 同域+FDG-LMU/PSMA-UKT 组合泛化);preliminary 5 studies
- F15 测试子集统计(阳性例/病灶数/TMTV mL):31/516/7,127;33/1,309/6,052;50/410/5,701;42/624/882
- F16 格式:nnUNet 合并包(imagesTr CT _0000/PET-SUV _0001;labelsTr;dataset.json;splits_final.json 参考 5 折;psma_metadata.csv/fdg_metadata.csv)
- F17 TCIA 载体:FDG DOI 10.7937/gkr0-xv29(CC BY 4.0,defaced)+ PSMA DOI 10.7937/r7ep-3x37(2024 收录);目录 Patient/Study/{SUV,CTres,CT,SEG,PET}.nii.gz
- F18 FDAT 载体:合并库 10.57754/FDAT.rdkqd-wdh87;PSMA v3 10.57754/fdat.gabc0-3hv03;挑战 v1 fdat.uni-tuebingen.de/records/0zs4c-89f12;CC BY-NC 4.0
- F19 HF 镜像:MedOtter/PSMA-PET-CT-Lesions(21 GB,597 行,逐例 shape/affine 校验,CC BY-NC 4.0 口径)
- F20 双赛道:AC1 model-centric(自由)+ AC2 data-centric(固定 MONAI nnU-Net baseline 只改数据管线;禁外部数据)——PET/CT 分割挑战史首个 data-centric 赛道
- F21 规则:Docker;5 min/例;每队 2 算法;无元数据;组织机构回避;强制开源代码+权重+报告;无 embargo;奖金因资金限制未发放
- F22 参与:563 人注册(截至 2024-11;亚洲 53% 中国 29%);初赛 24 队 218 算法;决赛 17 队 27 算法(+2 baselines)
- F23 评估:DSC(仅阳性)+FPV(18 连通域)+FNV;4 子集均值→跨算法排名→Dice 0.5+FPV 0.25+FNV 0.25 加权;tie break Dice
- F24 冠军:Team LesionTracer(DKFZ MIC+Heidelberg:Rokuss/Kovacs/Kirchhoff/Xiao/Ulrich/Maier-Hein/Isensee)——nnU-Net ResEncL+misalignment 增强+多模态预训练+器官监督(含唾液腺标签)+动态 TTA;arXiv 2409.09478;github.com/MIC-DKFZ/autopet-3-submission
- F25 冠军消融:default nnU-Net Dice 57.61→ResEncL 65.31→完整 68.40(FPvol 7.82/FNvol 10.35);官方 4 子集 0.6619/0.6433/0.7702/0.5711 mean 0.66
- F26 榜单:第 2 IKIM(Essen,8.4062)、第 3 HussainAlasmawi(MBZUAI,8.4375);nnunet baseline 24.0 位;冠军较 baseline DSC +8%/FNV −5 mL(mean DSC 0.66/FNV 3.18 mL/FPV 2.78 mL)
- F27 AC2 结果:冠军 Lennonlychan(CUHK,Chan+Yuan)diffusion 生成样本 overall 第 7;第 2 ZeroSugar(样本过滤)overall 第 10;datacentric baseline 15.31(overall)
- F28 方差分解:患者异质性 61%(σ=0.171)+残差 38%(σ=0.134)+算法 1.3%(σ=0.025);随机患者差 ≈ 7× 随机算法差
- F29 固定效应:体积翻倍 → DSC +0.039 [0.030, 0.048];UKT 中心效应 +0.14 [0.063, 0.217];tracer 主效应与 tracer×center 交互不显著;[68Ga] vs [18F] PSMA 无差异(β=−0.03 [−0.21, 0.16])
- F30 三大结论:同域已近读者一致性(FDG 0.77 量级);组合泛化开放问题(体积高估驱动);异质性 >> 算法(难例分诊优先)
- F31 方法论生态:6 队 TotalSegmentator 器官掩码;AiraMatrix STAPLE 组合 fold;4 队动态 TTA;归一化 global vs per-image 两派
- F32 标注:两步法(联合判读→轴位逐层 free-hand);PSMA 用 Mint Lesion™(CE 认证,Heidelberg)SUV 阈值预分割+手工修正
- F33 数据论文:FDG Sci Data 9:601 (2022) DOI 10.1038/s41597-022-01718-3(被引 386+);PSMA Sci Data 13:1023 (2026) DOI 10.1038/s41597-026-07821-z(PMID 42432027)
- F34 总结论文:Dexl J, Jeblick K, … Isensee F, Küstner T, Ingrisch M. The autoPET3 Challenge. arXiv:2605.05775(v1 2026-05-07,投 Medical Image Analysis,CC BY-NC-ND 4.0)
- F35 论文潮:2024-09 一周 7 篇 arXiv(2409.07144/09478/10120/12155/13006/13410/13779);两年窗口 13+ 篇
- F36 系列权重链:V 参赛方法自述 “initialised from the autoPET-III winning weights”(arXiv 2609.01554);IV 冠军 “Building on the winning autoPET III nnU-Net pipeline”(arXiv 2508.21680)
- F37 决赛公开资产:GC Results 页 Paper and Code 表 21 条目全部公开权重(21/21),15 条附 arXiv 论文(附录 K)
- F38 DKFZ 双赛道:冠军队同时提交 AC2(LesionTracer2,arXiv 2409.10120,github MIC-DKFZ/miccai2024_autopet3_datacentric)——AC1/AC2 自我对照
- F39 亚洲决赛代表:UIH_CRI_SIL/_2(联影中央研究院+北大,arXiv 2409.09784)、HKURad(2409.13006)、WukongRT(2409.13410)、Prof Ching-Wei Wang Taiwan(2409.07144)
- F40 超时惩罚实证:Max.sh 提交 FPV 爆表(924.31 mL 量级)——5 min 限制的执行案例(GC leaderboard/总结论文口径)
口径注(N1-N6)
- N1 PSMA 阳性例数:537/60(挑战 v1 官网+总结论文 Table 1)vs 539/58(FDAT v3+HF+Sci Data 2026)——3 名患者 5 例 mask 修正;正文取 539/58 注挑战口径
- N2 标注资历:官网 “10 年 UKT FDG / 8 年 LMU FDG / 单 reader+5 年复核 PSMA” vs 论文 “3 年标注+4 年与 >10 年双专家”——时点与详细度差异,非矛盾
- N3 license:TCIA DICOM CC BY 4.0(defaced)vs FDAT NIfTI CC BY-NC 4.0 vs 官网旧页 “TCIA Restricted license” 字样——按载体核对,NIfTI/挑战口径 CC BY-NC 4.0
- N4 FDG 剂量:官网 ~350 MBq vs 论文 mean 314.7±22.1 MBq(range 150-432)
- N5 同域 vs 跨组合 Dice:mean 0.66 混含 4 子集;同域 FDG 0.77 量级 vs 跨组合 PSMA-UKT 0.5711——引用必须标子集口径
- N6 测试集重叠:final 含 50 例 PSMA-LMU 与训练同机构同库源,论文未声明不相交——同域成绩或含泄漏红利(HF README 注 “unquantified overlap risk”)
术语表:32 条
| 术语 | 释义 |
|---|---|
| PET(正电子发射断层) | 注射正电子示踪剂后以符合探测成像代谢/受体分布的功能成像模态 |
| CT(计算机断层) | X 线解剖结构成像——PET/CT 的解剖配准与衰减校正通道 |
| SUV | 标准摄取值 = C_tissue/(A_inj/W)——注射剂量与体重归一化的 PET 定量单位 |
| activity counts | PET 原始重建输出的计数单位——转 SUV 前不可直接做强度归一化 |
| FDG | [18F]氟脱氧葡萄糖——葡萄糖代谢广谱肿瘤示踪剂 |
| PSMA | 前列腺特异性膜抗原——前列腺癌受体靶向示踪剂([18F]PSMA-1007/[68Ga]PSMA-11 两种配体) |
| TMTV | 总代谢肿瘤体积——全部病灶体积之和的定量负荷指标 |
| tracer frontier | III 的届别命名——示踪剂维度的泛化前沿 |
| compositional generalization | 组合泛化:对训练中见过的要素(tracer、center)的未见组合的泛化能力 |
| domain shift | 域移:训练与测试分布差——此处按 tracer×center 因子分解 |
| nnU-Net | 自配置分割框架(Isensee 等)——医学分割默认基线,III 冠军与官方 baseline 的共同内核 |
| ResEncL | nnU-Net 残差编码器大配置——更大容量与内核,冠军最大单一增益来源 |
| MONAI | 医学开源深度学习框架(NVIDIA/King’s)——AC2 固定 baseline 的实现底座 |
| Dice/DSC | Dice 系数——体素重叠相似度;本挑战仅阳性病例计算 |
| FPV | 假阳体积——pred 中 18-连通域不与 GT 相交的体积和 |
| FNV | 假阴体积——GT 中未被覆盖的体积 |
| connectivity=18 | 三维体素连通性判定:面+边相邻算连通(26 连通的子集)——FPV 连通域定义 |
| held-out test | 挑战 held-out 测试:不发布数据只开放在线评估 |
| preliminary/final | GC 挑战两阶段:5 例试提交校准→200 例正式排名 |
| Docker 提交 | 算法打包为容器在官方环境推理——GC 标准化提交形式 |
| TTA | test-time augmentation 测试时增强——多增广推理取均值,预算约束下动态启停 |
| misalignment 增强 | 模拟 PET-CT 配准错位的训练增广——双模态硬件噪声建模 |
| 器官监督 | 以器官掩码为辅助任务的多任务训练——抑制生理摄取假阳 |
| TotalSegmentator | 开源全身器官分割工具——6 支参赛队的器官掩码来源 |
| STAPLE | 多分割真值合成算法——AiraMatrix 用于组合多 fold 输出 |
| 混合效应模型 | 含固定+随机效应的回归——此处把算法/患者作为随机效应分解 DSC 方差 |
| 难例分诊 | 按病例难度路由复核资源——总结论文的临床落地建议 |
| reader agreement | 读者一致性——分割金标与人类阅片者间一致性的上限参照 |
| defacing | 面部去标识——PET/CT 头颈体素替换的隐私处理 |
| TCIA | The Cancer Imaging Archive——NCI 资助的开放癌症影像库(DICOM 载体) |
| FDAT | Tübingen 数据仓库 fdat.uni-tuebingen.de——NIfTI 载体 |
| Mint Lesion™ | CE 认证肿瘤测量软件(mint Medical,Heidelberg)——PSMA 标注工具 |
| partial volume effect | 部分容积效应——小于分辨率极限的病灶 SUV 被稀释,假阴的结构性来源 |
| OSEM | 有序子集期望最大化——PET 迭代重建算法(FDG 协议 3 iterations/21 subsets) |
| brown fat | 棕色脂肪——FDG 高摄取的生理假阳源(颈/纵隔区,冷暴露激活) |
| connected component | 连通域——FPV 的计数单位(18-连通定义下不与 GT 相交的空间区域) |
| leave-one-combination-out | 留一组合法——按 tracer×center 因子轮流做测试集的自定义划分(复刻 4×50 的扩展做法) |
| QIBA | Quantitative Imaging Biomarkers Alliance——影像定量标准化联盟(V 届 SUV 对齐的基准框架) |
| weight initialization | 权重初始化——系列权重链的机制(IV/V 从 III 冠军权重起步) |
附录
附录 A:数据字典(挑战合并包 + TCIA 载体)
A.1 挑战合并包(nnUNet 格式)
| 字段/文件 | 类型 | 内容 | 备注 |
|---|---|---|---|
| imagesTr/CASE_ID_0000.nii.gz | NIfTI | CT 通道(HU) | 重采样至 PET 网格 |
| imagesTr/CASE_ID_0001.nii.gz | NIfTI | PET-SUV 通道 | counts→SUV 已换算 |
| labelsTr/CASE_ID.nii.gz | NIfTI | 病灶二值掩码 | 0 背景/1 病灶,无多类 |
| dataset.json | JSON | nnUNet 任务描述 | 模态名/标签/划分 |
| dataset_fingerprint.json | JSON | 强度指纹 | 归一化统计(global) |
| splits_final.json | JSON | 参考 5 折划分 | 患者级划分惯例 |
| psma_metadata.csv | CSV | PSMA 逐例元数据 | 年龄/体重/配体/剂量/摄取时间/扫描仪 |
| fdg_metadata.csv | CSV | FDG 逐例元数据 | 同上(UKT 口径) |
A.2 TCIA 载体五件套(Patient/Study/ 下)
| 文件 | 内容 | 用途 |
|---|---|---|
| PET.nii.gz | 原始 activity counts 重建 | 物理层研究(需自行转 SUV) |
| SUV.nii.gz | SUV 换算后 | 强度归一化/直接训练 |
| CT.nii.gz | 原始 CT | 解剖参照/HU 分析 |
| CTres.nii.gz | 重采样 CT | 与 PET 网格对齐 |
| SEG.nii.gz | 病灶掩码 | 监督信号 |
A.3 TCIA DICOM 序列字段速查
| DICOM 字段 | TCIA 版状态 | 影响 |
|---|---|---|
| StudyDate | 移位至 1997-2005 | 日期不可用;跨载体 join 用 patient hash |
| PatientID | hash 化 | 与 FDAT 一致——对齐主键 |
| 面部区域 | defaced(头颈体素替换) | 头颈区分析受限 |
| PET 模态序列 | PET 原始(counts)与 SUV 两序列并存 | 训练选 SUV 序列 |
| 掩码封装 | DICOM-SEG(Analysis Results) | dcmqi 转 NIfTI 后可入 nnUNet |
| 设备字段 | 保留(厂商/型号/参数) | 域移分析的元数据来源 |
A.4 两载体目录树对照
TCIA(DICOM 谱系) FDAT(NIfTI 谱系)
FDG-PET-CT-Lesions/ 挑战合并包/
PatientUID_001/ imagesTr/ labelsTr/
StudyUID_01/ dataset.json + fingerprint
SUV.nii.gz CTres.nii.gz splits_final.json
CT.nii.gz SEG.nii.gz {fdg,psma}_metadata.csv
PET.nii.gz PSMA-PET-CT-Lesions_v3/
(study dates 移位 1997-2005) (539/58 口径,含版本说明)
两棵树的互换成本集中在掩码封装(DICOM-SEG↔NIfTI)与日期字段——内容本体(影像+病灶体素)一致;选择哪棵树由「要 DICOM 元数据/CC BY 授权」(TCIA)还是「要 nnUNet 即训格式」(FDAT)决定。
附录 B:下载与复现命令
# TCIA DICOM(官方门户手动或 NBIA 下载)
# FDG: https://doi.org/10.7937/gkr0-xv29 (CC BY 4.0,defaced)
# PSMA: https://doi.org/10.7937/r7ep-3x37 (TCIA 数据使用许可)
# FDAT NIfTI(DOI 落地页手动/脚本下载)
# 合并库: https://doi.org/10.57754/FDAT.rdkqd-wdh87 (CC BY-NC 4.0)
# PSMA v3: https://doi.org/10.57754/fdat.gabc0-3hv03
# 挑战 v1: https://fdat.uni-tuebingen.de/records/0zs4c-89f12
# HuggingFace 镜像(快速脚本化访问)
python3.11 -c "from huggingface_hub import snapshot_download; snapshot_download('MedOtter/PSMA-PET-CT-Lesions', repo_type='dataset', local_dir='psma_hf')"
# 官方代码三仓
git clone https://github.com/ClinicalDataScience/autoPETIII # nnunet-baseline + datacentric-baseline
git clone https://github.com/lab-midas/autoPET # 系列评估脚本
git clone https://github.com/MIC-DKFZ/autopet-3-submission # 冠军方案 LesionTracer
# 关键论文
# 挑战总结: https://arxiv.org/abs/2605.05775 (Dexl et al., 2026)
# 冠军方法: https://arxiv.org/abs/2409.09478 (Rokuss et al., 2024)
# FDG 数据: https://doi.org/10.1038/s41597-022-01718-3 (Gatidis & Kuestner, 2022)
# PSMA 数据: https://doi.org/10.1038/s41597-026-07821-z (Jeblick et al., 2026)
附录 C:nnU-Net 最小训练示例(baseline 复刻路径)
# 0. 环境(PyTorch + nnU-Net v2 + MONAI for AC2 baseline)
pip install nnunetv2 monai
# 1. 摆放挑战合并包为 nnUNet 原始目录
# nnUNet_raw/Dataset501_AutoPET3/
# imagesTr/ labelsTr/ dataset.json (官方包内已就绪)
# 2. 指纹与预处理(global 归一化来自 dataset_fingerprint.json)
nnUNetv2_plan_and_preprocess -d 501 --verify_dataset_integrity
# 3. 按官方参考 5 折训练(3d_fullres 配置;ResEncL 用 -pl nnUNetPlannerResEncL)
for FOLD in 0 1 2 3 4; do
nnUNetv2_train 501 3d_fullres $FOLD -tr nnUNetTrainer --c
done
# 4. 推理与提交物导出(Docker:输入 CT+PET 双通道,输出二值掩码)
nnUNetv2_predict -d 501 -i INPUT_DIR -o OUTPUT_DIR -c 3d_fullres -f 0 1 2 3 4
# 5. 预算提醒:5 min/例 运行限制——集成与 TTA 需动态启停(冠军论文 §TTA)
# AC2 参赛者:不改上述任何模型代码,只改预处理/增强/采样(datacentric-baseline 仓库)
C.5 AC2 数据管线实验路径(不改模型的三条已验证路线)
- 样本过滤路线(zero_sugar,overall 第 10):对训练集做质量过滤/难例重加权——“数据节食”(仓库名 datadiet 即此意),成本最低先试
- 合成扩充路线(Lennonlychan,overall 第 7):diffusion 模型在病灶区生成合成样本——需控制生成质量与 SUV 分布保真(附录 M 第 10 项自检)
- 增强工程路线(未上榜但通用的基线动作):重排重采样网格/切换归一化两派/调整 misalignment 幅度——与冠军组件 2 同源但不动模型
三条路线的评测都要过附录 M 清单第 7 项(患者级泄漏自检)——合成与过滤最容易意外破坏患者级划分。
附录 D:评估指标计算逻辑(伪代码)
def evaluate(pred_mask, gt_mask):
# DSC:仅 gt 阳性病例
if gt_mask.sum() > 0:
inter = (pred_mask & gt_mask).sum()
dice = 2 * inter / (pred_mask.sum() + gt_mask.sum())
else:
dice = None # 健康病例 Dice 无定义
# FPV:pred 中 18-连通域,不与 GT 相交者体积求和
fpv = sum(region.volume for region in label(pred_mask, structure=CONNECTIVITY_18)
if not (region & gt_mask).any())
# FNV:GT 中未被 pred 覆盖的体积(仅阳性病例)
fnv = (gt_mask & ~pred_mask).sum() * voxel_volume if gt_mask.sum() > 0 else None
return dice, fpv, fnv
def rank_teams(scores): # scores[team][subset][metric]
per_metric_mean = {t: mean over 4 subsets for each metric}
ranks = {m: rank_teams_by(per_metric_mean[m]) for m in ('dice','fpv','fnv')}
final = 0.5*ranks['dice'] + 0.25*ranks['fpv'] + 0.25*ranks['fnv'] # tie break: dice
附录 E:五届演化对照表(系列谱系总索引)
| 维度 | I (2022) | II (2023) | III (2024) 本条 | IV (2025) | V (2026) |
|---|---|---|---|---|---|
| frontier | segmentation | generalization | tracer | human | human-AI |
| 任务 | 自动分割 | 自动分割 | 自动分割 | 交互分割 | 交互分割 |
| 数据 | FDG 1,014 | FDG 1,014 | FDG 1,014+PSMA 597 | +纵向 CT 双库 | QIBA 对齐五库 |
| 中心 | UKT 单中心 | UKT(多环境变体) | UKT+LMU 双中心 | 多中心 | 统一多中心队列 |
| 评估 | Dice | Dice(环境分层数据集) | Dice+FPV+FNV 加权 | Dice+交互 | AUC-Dice+AUC-DMM |
| baseline | nnU-Net | nnU-Net | nnU-Net + datacentric-baseline 双轨 | nnU-Net | nnUNet+涂擦模拟 |
| 库内 | rid 468 | rid 468 | 本条 | —(无独立条目) | rid 634 |
演化注记:从 I 到 V,数据侧每届叠加一个新维度(环境→示踪剂→纵向→交互协议),评估侧每届吸收前届的实践教训(II 的泛化缺口催生 III 的交叉矩阵,III 的组合泛化结论支撑 V 的统一队列设计);III 是数据维度与评估维度同时升级的唯一一届——这也是其"枢纽届"定位(§10.2)的数据注脚。
附录 F:DAIMS 评分卡(预估 7.6)
| 维度 | 分 | 依据 |
|---|---|---|
| 文档完备 | 9 | 挑战页全套(任务/协议参数/测试矩阵/leaderboard)+总结论文+两篇数据论文+冠军论文 |
| 标注质量 | 8 | 资历分级披露+双专家复核+CE 认证工具;二值掩码无多类语义 |
| 可复现 | 8 | baseline/评估脚本/冠军代码/参考 5 折全公开;测试集 held-out 不可本地复现 |
| 可获取性 | 9 | TCIA+FDAT+HF 三载体公开直载无注册门槛;测试隐藏 |
| 伦理合规 | 7 | defaced+dates 移位+机构审批;IRB 编号未单列、FDAT 版未 defaced |
| 加权 | ≈7.6 | 系列内对照:autoPET V 7.7(交互协议公开度加成)、rid 468 口径 I/II 档 |
附录 G:口径速查卡(双口径一览)
| 事实 | 口径 A | 口径 B | 取舍 |
|---|---|---|---|
| PSMA 阳性例数 | 537/60(挑战 v1 官网+总结论文 Table 1) | 539/58(FDAT v3+HF+Sci Data 2026) | 正文 539/58 注 A |
| 标注资历 | 单 reader+5 年复核(官网) | 3 年标注+4/10+ 年双专家(论文) | 并存引用 |
| FDG 剂量 | ~350 MBq(官网) | 314.7±22.1 MBq range 150-432(论文) | 复现取 B |
| license | TCIA CC BY 4.0(defaced) | FDAT NIfTI CC BY-NC 4.0 | 按载体 |
| mean Dice | 0.66(4 子集混合) | 0.77 量级(同域 FDG) | 分开引用 |
| Zenodo 10990931 | “数据集 DOI”(常见误引) | 提案 PDF 0.1 MB(实际) | 数据引 TCIA |
附录 H:跨条目联动矩阵
| 联动条目 | rid | 关系 | 联动读法 |
|---|---|---|---|
| AutoPET I/II | 468 | 直接前作(FDG 库同源) | I/II 条目看 FDG 库细节与两届 baseline 演化;本条看加示踪剂后的新问题 |
| autoPET V | 634 | 直接后作(QIBA 对齐+交互范式) | V 条目看 III 冠军权重的下游与 AUC 评估革新;本条看权重起点 |
| hecktor | 461 | PET/CT 咽喉病灶分割挑战(跨模态同域) | 对照"多模态挑战赛评估"的另一种指标设计 |
| lung-pet-ct-dx | 475 | FDG PET/CT 肺病灶分类+分割 | 对照单癌种 FDG 数据的组织方式 |
| ProstateX / PI-CAI | 库内检索 | PSMA 队列的疾病域邻居 | 前列腺多模态影像生态(MRI vs PET) |
联动读法补充:
- 468→本条:468 条目的 FDG 库描述(1,014 studies 结构/标注/协议)是本条 §4.1 的母本——两处数字一致性可互为校验(同一库两次入库的口径漂移检查点)
- 本条→634:634 条目的 QIBA 对齐合并库章节列了 III 双库的合并路径(差异 1E-3)——III 读者若需要"对齐后"的数据应转到 634 描述的 FDAT rdkqd-wdh87 载体
- 横向(461/475):三库构成"PET/CT 病灶任务"的三种任务切面——自动分割(本条)/分类+分割(475)/多模态治疗响应(461),联合阅读覆盖 PET 病灶任务的完整谱
附录 I:开放问题与观察点
- [ ] 总结论文(arXiv 2605.05775)投 Medical Image Analysis 的正式刊出版本——刊出后引用格式替换
- [ ] PSMA Sci Data 论文(2026)发表后的引用迁移:挑战期引用 Zenodo 提案的工作需要补引
- [ ] final 测试 200 例是否随 V 届 QIBA 重发布而部分解禁——FDAT 合并库 rdkqd-wdh87 的更新记录值得跟踪
- [ ] AC2 diffusion 生成样本(Lennonlychan)是否单独发布——若发布将成为"合成 PET 数据"子资产
- [ ] 奖金未发放的后续处理(总结论文披露后未见补充公告)
- [ ] HF 镜像(MedOtter/PSMA-PET-CT-Lesions)与 FDAT v3 的字节级一致性抽查——目前仅 shape/affine 级校验,强度级(体素值)一致性未验证
- [ ] TCIA PSMA 收藏的授权页是否随 Sci Data 2026 论文刊出而更新为 CC BY 4.0 口径——若更新,license 三轨(N3)收敛为双轨,本条 §9.1 需同步修订
附录 J:本条目存证链(方法论要求)
| 事实组 | 存证信源 | 抓取时点 |
|---|---|---|
| 任务/协议参数/测试矩阵/双赛道/leaderboard | autopet.org III 详情页(/tmp/autopetiii.html 全文留存) | 2026-09-27 |
| 挑战平台结构/参与入口 | autopet-iii.grand-challenge.org(/tmp/gc_autopet3.html、gc_lb.html、gc_res.html) | 2026-09-27 |
| 数据统计/方差分解/三大结论/参与度/奖金披露 | arXiv 2605.05775 全文(/tmp/arxiv_full.txt,143,873 字符) | 2026-09-27 |
| 冠军方案/消融/子集 Dice | arXiv 2409.09478(/tmp/arxiv_autopet3.xml) | 2026-09-27 |
| Zenodo 元数据(PDF 体积/日期/下载量/CC BY-4.0) | zenodo.org/api/records/10990932(WebFetch 代理——直连 TLS 被拒) | 2026-09-27 |
| PSMA 数据论文/版本口径 | WebSearch(Sci Data 13:1023、PMID 42432027、FDAT v3、HF MedOtter) | 2026-09-27 |
| 系列谱系/前后届权重链 | autopet.org + arXiv 2609.01554 + 2508.21680 + 库内 rid 468/634 FACTS 互证 | 2026-09-27 |
| 库内联动查证 | rid 468(autoPET)/rid 634(autopet-v)/rid 475(lung-pet-ct-dx)/rid 461(hecktor) | DB 只读查询 2026-09-27 |
| 查重结论 | 库内无 autopet-iii 条目(url_name ILIKE ‘%autopet%’ 仅 468/634/475 邻居) | 2026-09-27 |
| 环境留痕 | zenodo.org 直连 TLS 被拒(curl exit 35 / SSLZeroReturnError),API 经 WebFetch 代理——与 autopet-v 档案记录一致 | 2026-09-27 |
附录 K:决赛提交公开资产全表(GC Results 页 Paper and Code 表,2026-09-27 抓取)
决赛全部提交均满足"公开权重"规则(Public weights 列全 True)——这是 III 可审计性的直接证据。下表为 GC Results 页收录的 21 个公开资产条目(队伍/算法级;与"17 队 27 算法"的口径差:本表按公开了论文与代码的条目计):
| Team / Algorithm | 公开论文 | 代码仓库 | 备注 |
|---|---|---|---|
| LesionTracer | arXiv 2409.09478 | MIC-DKFZ/autopet-3-submission | AC1 冠军(nnU-Net ResEncL 五件套) |
| LesionTracer2 | arXiv 2409.10120 | MIC-DKFZ/miccai2024_autopet3_datacentric | DKFZ 的 AC2 提交——冠军队双赛道自我对照 |
| IKIM | arXiv 2409.12155 | hakal104/autoPETIII | 第 2 名(Essen) |
| Lennonlychan | arXiv 2409.08068 | john-lennon-chan/synthPET_inference | AC2 冠军(diffusion 生成样本,仓库名 synthPET 即方法) |
| Shadab | arXiv 2409.10151 | ahxmeds/autosegnet2024 | AutoSegNet |
| Prof Ching-Wei Wang, Taiwan | arXiv 2409.07144 | cwwang1979/CW-nnU-Net-for-PET-CT | 台北团队 nnU-Net 变体 |
| Max.sh / Max.sh2 | GC 页注 rxiv.org/abs/2409.0068 | maxshatskiy/autopet3_inf 与 _inf2 | 双算法提交实例;超时 FPV 爆表案例(924 mL 量级) |
| StockholmTrio | arXiv 2409.14475 | Astarakee/AutoPET24 | 卡罗林斯卡/ KTH 系 |
| UIH_CRI_SIL / UIH_CRI_SIL_2 | arXiv 2409.09784 | jiayiliu-pku/AP2024 与 DC2024 | 联影中央研究院+北大(AC1/AC2 各一) |
| WukongRT | arXiv 2409.13410 | BBQtime/… | 动态 TTA 实现者之一 |
| HKURad | arXiv 2409.13006 | Reza-Safdari/AutoPET_III | 香港大学放射系 |
| Airamatrix / Airamatrix2 | arXiv 2409.13779 | tanya-chutani-aira/autopetiii(ensemble-2d 分支) | STAPLE 组合 fold+2D 集成 |
| zero_sugar | arXiv 2409.13548 | alexanderjaus/autopet3_datadiet | AC2 第 2(数据过滤;Jaus 为 LMU nnU-Net 系成员) |
| QuantIF | arXiv 2410.02807 | Zhack47/AutopetIII_CHB | 动态 TTA 实现者之一 |
| HussainAlasmawi | (GC 页注 github) | HussainAlasmawi/AutoPet_Final | 第 3 名(MBZUAI)——无 arXiv preprint |
| BAMF AI | (GC 页注 github) | bamf-health/autopet2024 | 北美队 |
| TUM_ibbm | (GC 页注 github) | hongweilibran/autopet_bran | TUM IBBM 实验室 |
| Shrajanbhandary | (GC 页注 grandchallenge) | Shrajan/fcn_pet_segmentation | FCN 路线 |
资产盘点:21 条目全部公开权重、15 条目附 arXiv 论文、2 条目仅 GitHub、1 条目仅 GC 链接——"榜单可审计"在 III 不是口号而是 21/21 的执行率。仓库命名即方法学索引(synthPET=合成、datadiet=数据节食、ensemble-2d=2D 集成),检索者可按方法学关键词直接定位实现。
附录 L:分角色使用指南(AI-Ready 评估视角)
L.1 分割模型开发者:FDAT 合并库(nnUNet 格式即拿即训)+附录 C 路径;用 splits_final 5 折做内部验证;报告时区分同域与跨组合成绩(口径注 N5);阴性的 571 例(FDG 513+PSMA 58)用于假阳抑制训练与 FPV 自评。
L.2 域移/泛化研究者:以 tracer×center 为因子做 leave-one-combination-out 自定义划分(复刻 4×50 设计);元数据 CSV 提供域标签(扫描仪/协议);对照总结论文的混合效应框架(患者为随机效应)设计自己的方差分解——III 的最大遗产是"组合泛化可测"的实验范式而非某个具体分数。
L.3 数据中心(data-centric)工程团队:AC2 是天然实验场——固定 baseline(datacentric-baseline 仓)只改数据管线;参考 Lennonlychan(diffusion 合成)与 zero_sugar(数据节食)两条已验证路线;注意 5 min 预算约束对合成数据量与推理成本的传导。
L.4 临床 AI 评估者:用 §6.5 的分布非正态/长尾发现校准预期——聚合 Dice 是分诊视角的指标,不是单例视角;引用"61% vs 1.3%"论证病例难度分层工具的价值;把"不能当二分类器"写进部署文档。
L.5 数据集策展人/库建设者:III 提供"挑战赛型资产"的治理样板——三载体冗余(格式互补)、版本修正留痕(537/60→539/58)、失败模式生理学图谱、方差分解报告——这四项可直接进 AI-Ready 数据集评估 rubric。
L.6 教学者:一条完整的方法论教学线——物理(SUV 链)→标注(两步法+资历)→设计(组合泛化矩阵)→统计(混合效应)→工程(预算内 TTA)→伦理(license 三轨/双口径披露),每一步都有公开可复算的原始材料。
附录 M:数据完整性自检清单(下载后 30 分钟)
从任一载体拿到数据后,建议按序执行以下核查(脚本十行内可自动化):
- 体素规模对账:studies 数 = 1,611(训练包)或 597(纯 PSMA 载体)——数目不符即版本混装(v1/v3 或 TCIA/FDAT 交叉)
- PSMA 口径核对:阳性/阴性计数 = 539/58(v3)或 537/60(v1)——确定手里是哪一版并在实验记录中写明
- 双通道验证:每例 _0000(CT,HU 范围 -1024~3000+)与 _0001(PET,SUV 正值域)——把 _0001 的直方图峰值拉出来看(SUV 1-4 主峰为正常)
- counts 陷阱自检:若 PET 通道数值量级在 1e3-1e5(SUV 不会超过 100 量级),拿到的是 counts——换算或换 SUV 文件(坑点 4 的自动化防线)
- 掩码体积分布:逐例掩码体素数的中位数/极值——异常巨大掩码(全肝/全膀胱)多为标注或转换错误
- spacing 指纹:FDG 全队列应唯一(2.04×2.04×3.00);PSMA 应聚成三簇(三台扫描仪)——簇数不对即元数据错位
- 患者级泄漏自检:自定义划分时验证同一 patient hash 不跨 train/val——nnUNet splits 已保证,自制划分必须重验
- 日期字段隔离:TCIA 载体的日期确认在 1997-2005 移位窗内——误当真实日期写进论文是去标识违规的间接信号
- HF 镜像校验:用 MedOtter 随库的 shape/affine 校验脚本跑一遍——社区质检结果与自己的下载一致
- 版本存证:记录 DOI+版本号+下载日期于实验配置——III 的 v1/v3 口径差异足以让两组结果不可比
附录 N:DAIMS 逐项证据链(评分的可追溯性)
| 维度 | 分 | 关键证据(本条目位置) | 扣分点 |
|---|---|---|---|
| 文档完备 | 9 | GC 八板块齐(§1.5)+总结论文(F34)+两篇数据论文(F33)+冠军论文(F24) | 测试集分布仅论文级描述 |
| 标注质量 | 8 | 两步法+资历双口径全披露(§5.2)+CE 工具(§5.1)+版本修正留痕(§5.3) | 二值掩码无多类语义;FDG/PSMA 标注体系异质 |
| 可复现 | 8 | baseline/冠军/评估脚本三仓(§2.3)+参考 5 折(§4.4)+附录 O 十实验可复算 | held-out 200 例不可本地复现;5 min 限制的官方计时口径未细化 |
| 可获取性 | 9 | 三载体公开直载无注册(§9.1 表)+HF 逐例校验(F19) | 测试隐藏;FDAT 下载需走落地页无直链 API |
| 伦理合规 | 7 | defaced+日期移位(§9.2)+机构审批链+奖金披露诚实(F21/F27 治理) | IRB 编号未单列;FDAT 版未 defaced;NC 条款的权重衍生争议(§9.4) |
| 加权 ≈7.6 | 证据链全部落在正文/FACTS 可查位置 | 对照:autoPET V 7.7(交互协议公开度加成) |
附录 O:十个可复算实验建议(用 III 的公开资产就能做)
- 复刻 baseline 排名:官方 nnunet-baseline+参考 5 折本地训练→对照 24.0 位与 57.61 Dice 口径
- ResEncL 单项增益验证:同一数据换 ResEncL 计划器→验证 +7.7 Dice 点的容量效应
- 组合泛化自测:自定义 leave-one-combination-out 划分→在 FDG-LMU/PSMA-UKT 上复刻 0.7702/0.5711 的落差
- 器官监督消融:±TotalSegmentator 辅助任务→测 FPV 抑制幅度(冠军组件 4 的独立贡献)
- misalignment 增强消融:±配准错位模拟→测双模态鲁棒性
- 归一化两派对照:global fingerprint vs per-image z-score→在 4 子集分别评测
- 配体盲测:PSMA-LMU 内按 [18F]/[68Ga] 分层评测→复算 β=−0.03 的无差异结论
- 混合效应复算:用元数据 CSV 重建体积/中心/示踪剂协变量→复算 61%/38%/1.3% 方差分解
- TMTV 负荷-难度相关性:逐例 TMTV vs DSC 散点→验证"大病灶好分割"的 β=+0.039
- 合成数据路线复刻:datacentric-baseline 上叠加 diffusion 生成样本→对照 synthPET 的 overall 第 7
每项实验的原料(数据/代码/元数据/参考划分)都已公开——"十项全能可复算"是 III 区别于一般挑战赛数据集的 AI-Ready 度核心证据。
附录 P:FDG vs PSMA——双示踪剂方法学深对照
N.1 成像链对照
| 环节 | FDG(UKT) | PSMA(LMU) | 差异的方法学后果 |
|---|---|---|---|
| 物理机制 | 葡萄糖转运/磷酸化滞留 | PSMA 受体结合/内化 | 病灶对比度来源不同——PSMA 受体密度驱动 vs 代谢活性驱动 |
| 半衰期 | ¹⁸F 109.8 min | ¹⁸F 109.8 min / ⁶⁸Ga 68.1 min | ⁶⁸Ga 的短半衰期促其就地生产模式与摄取窗口差异 |
| 摄取窗口 | ~60 min 标准化 | 均值 74 min(6-181/7-195 宽离散) | PSMA 的 SUV 绝对量级时变更大——per-image 归一化论据 |
| 分辨率 | 2.04²×3.00 mm 单机一致 | 2.73-4.07 面内混合 | 小病灶检出下限不同——PSMA 假阴更多 |
| 重建 | OSEM 3i/21s+2mm Gaussian | 三机各自协议 | 重建纹理差异叠加在示踪剂差异上 |
| 患者群 | 混合性别/三癌种/60±16 岁 | 全男/前列腺癌/71±8 岁 | 人口学协变量完全不同——回归模型需控制 |
| 病灶谱 | 大而少(8.7/例) | 小而密(32.5/例) | FPV/FNV 的体积量纲在不同库的含义不同 |
| 生理假阳 | 骨髓/纵隔/棕色脂肪/脑/膀胱 | 肝/脾/肾/颌下腺 | 器官监督的标签集选择随示踪剂变 |
P 表的读法提醒:这张表是"设计一张新示踪剂的分割数据集"的需求清单——分辨率一致性(FDG 的单机优势)、摄取窗口标准化(PSMA 的宽离散教训)、生理假阳图谱预调研(器官监督标签集的依据)三项都可直接迁移为采集协议的设计约束。双示踪剂并置的价值不在"多一倍数据",而在把示踪剂从常量变成变量——变量的存在才使方差分解(N.2 的吸收分析)成为可能。
N.2 算法侧的吸收方式
- 已被消融证明不重要的:PSMA 配体([18F] vs [68Ga] 无差异,β=−0.03);tracer 主效应(体积/中心调整后)
- 被证明重要的:病灶大小(β=+0.039/翻倍)与中心(UKT +0.14)——即分辨率与设备协议才是示踪剂差异的传导路径
- 工程吸收:冠军的多模态通道统一训练+器官监督是"用数据容量换示踪剂差异"的路线;归一化两派是全球统计 vs 逐图统计对同一问题的两种回答
- 开放残留:PSMA-UKT 0.5711 的残差差距说明上述吸收仍不完整——低分辨率示踪剂×未见设备的交互惩罚没有被任何参赛方案完全消化
附录 Q:挑战赛治理观察(III 的治理样本价值)
III 的运营决策在"挑战赛治理"维度上有若干值得记录的样本:
| 治理决策 | III 的做法 | 样本价值 |
|---|---|---|
| 奖金透明 | 原规划→因资金限制未发放,总结论文明文披露 | 挑战赛文献普遍沉默于奖金兑现,III 的披露是反常的诚实 |
| 开源强制 | 决赛 21/21 公开权重、15 篇论文 | 可审计率 100% 的执行样本 |
| 利益回避 | 组织机构成员(LMU/UKT/DKFZ 生态)回避排名 | 小社区熟人赛的公信力设计 |
| 无 embargo | 赛后一周 7 篇 arXiv | 知识扩散速度优先于首发独占——与强制开源配套 |
| 双赛道并行 | AC1/AC2 隔离排名+固定 baseline | "模型 vs 数据"之争的制度化实验 |
| 版本治理 | FDAT v1→v3 留痕修正、双口径并存披露 | 数据修正不静默——与多数数据集"静默更新"对照 |
治理样本的适用边界:III 的治理结构(两机构小团队、数据与运营同批人、学会背书)是小科学协作的范本,其可复制项是披露标准(奖金兑现、资历分级、版本留痕)而非组织形式——大平台多机构挑战赛受限于协调成本,未必能复制"数据组=运营组"的闭环,但披露标准的成本低到任何规模都可执行。这也是本条目把"治理观察"单列附录的原因:挑战赛型条目的 AI-Ready 评估应该把运营披露质量纳入评分(DAIMS 的文档完备维度在 III 的 9 分里有相当权重来自总结论文的坦诚度)。
附录 R:检索词策略(给下一位研究者)
- 平台检索:
autopet-iii grand-challenge(连字符必带)/AutoPET III lesion segmentation - 论文检索:
autoPET3(连写——总结论文标题用词)/multitracer multicenter PET/CT/compositional generalization PET segmentation - 数据检索:
PSMA-PET-CT-Lesions/FDG-PET-CT-Lesions(TCIA 收藏名连字符连写)/fdat uni-tuebingen PSMA - 方法检索:
nnU-Net PET lesion/LesionTracer/synthPET diffusion(AC2 冠军仓库名即关键词) - 陷阱词:
autopet3(GC 子域 404 但 arXiv 正确);Zenodo 10990931(提案非数据);autoPET III dataset(会同时召回提案 PDF 与 TCIA/FDAT——按体积与载体分辨)
(完)
本条目为千方病案医数集 GC 系列条目(autoPET 三部曲中坚)。数据以 autopet-iii.grand-challenge.org、autopet.org、arXiv 2605.05775/2409.09478、TCIA DOI 10.7937/gkr0-xv29 与 10.7937/r7ep-3x37、FDAT DOI 10.57754/FDAT.rdkqd-wdh87 为准,抓取时点 2026-09-27。库内前作 rid 468(AutoPET I/II)与本条、后作 rid 634(autoPET V)构成系列互链。Zenodo 10.5281/zenodo.10990931 为挑战提案记录(PDF),数据引用请用 TCIA/FDAT DOI。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- autopet-v — 共享标签:医学影像 / PET / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- hecktor2026 — 共享标签:医学影像 / PET / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- segrap — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- kits23 — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- autopet — 共享标签:医学影像 / PET / CT / 肿瘤学
- tcia — 共享标签:医学影像 / PET / CT / 肿瘤学
- idc — 共享标签:医学影像 / PET / CT / 肿瘤学
- kits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- lits — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- flare — 共享标签:医学影像 / CT / 医学图像分割 / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

