CHIMERA — 泌尿肿瘤多模态预后挑战赛 AI-Ready Wikipedia

泌尿肿瘤多模态预后首个标准化 benchmark:前列腺 267 例+膀胱 368 例四模态融合——临床单模态屠榜与多模态鲁棒性悖论的方法学样本

来源 Radboud UMC+Canisius Wilhelmina(Task 1 两机构)与 Erasmus MC 系 STM 2023 队列(Task 2/3 Cohort A/B)——患者知情同意科研使用;v2 数据含 UNI 预提取特征发布时间: 2026-09-25最后更新: 2026-09-25 阅读 24
CHIMERA — 泌尿肿瘤多模态预后挑战赛 AI-Ready Wikipedia

信息速览

数据集名称CHIMERA — 泌尿肿瘤多模态预后挑战赛 AI-Ready Wikipedia
数据类型人工标注,原始数据,影像数据,基因组数据
规模267 例前列腺癌(Task 1)+368 例膀胱癌(Task 2/3 合并)
接入方式Radboud UMC+Canisius Wilhelmina(Task 1 两机构)与 Erasmus MC 系 STM 2023 队列(Task 2/3 Cohort A/B)——患者知情同意科研使用;v2 数据含 UNI 预提取特征
AI 就绪度

INFOBOX:chimera 速览

字段 值
数据集 CHIMERA Challenge Training Data v2(AWS Open Data Registry 收录)
slug chimera(GC 子域 chimera.grand-challenge.org 一致)
全名展开 Combining HIstology, Medical Imaging (Radiology), and molEcular Data for medical pRognosis and diAgnosis
平台 Grand Challenge——GC 五连第三发(多义名消歧条款首用)
会议 MICCAI 2025(2025-09 韩国大田,3,300+ 人史上最大)——结果 CHIMERA workshop 发布
主办 Radboud UMC Computational Pathology Group(Geert Litjens/Nadieh Khalili)+ Erasmus MC + CHIMERA Consortium
任务 三任务:T1 前列腺生化复发(生存)/T2 BCG 反应亚型(三分类)/T3 NMIBC 进展生存
模态 四模态异构融合:千兆像素 H&E WSI+mpMRI 三序列+bulk RNA-seq+结构化临床——本库模态维度之最
规模 Task 1:267 例(801 MRI 序列+942 WSI,train 95/val 23/test 149);Task 2 v2 182 例;Task 3 v2 176 例;膀胱侧合并 368=182+176 ✓
结果 159 submissions/13 顶级模型;T1 最佳 C 0.7402(临床单模态)/T2 F1 0.73/T3 C 0.68
冠军 TIA-Pegasus(Warwick TIA Centre)ModalSurv——C 0.7402(T1 第 1)/0.5740(T2/3 第 5),arXiv 2509.05037
方法论发现 临床单模态屠榜但随机化崩塌至 C≈0.50;多模态 withheld ΔC≤0.04 鲁棒——排行榜最高≠临床最实用
baseline UNI(病理)+nnU-Net v1(PI-CAI baseline 迁移,影像)+ABMIL(预测头)+minimal baseline template
可获取性 AWS Open Data:aws s3 sync --no-sign-request s3://chimera-challenge/ 无账户直下——挑战赛数据开放度最高档
许可 CC BY-NC-SA 4.0(NC+SA 双限制——对照 LMC1 的 CC BY 4.0)
学术出口 双 summary paper 已出(Task 1 arXiv 2608.21497 投 MedIA 38 页/Task 2+3 arXiv 2609.09510)+冠军论文——挑战赛最高档
续作 CHIMERA-agent(MICCAI 2026 Abu Dhabi):agentic 推理轨迹+幻觉惩罚——302 participants
伦理 知情同意科研使用明示;Radboud+Canisius Wilhelmina(T1)/Erasmus MC 系队列(T2/3);无 IRB 编号披露
一句话 泌尿肿瘤多模态预后的标准化起点——也是"多模态数据集组装有多难"的活教材

§0 摘要卡:四模态融合与屠榜悖论

§0.1 它是什么

CHIMERA 是 MICCAI 2025 挑战赛(Grand Challenge 平台):泌尿肿瘤多模态预后建模的三任务 benchmark,由 Radboud UMC 计算病理组(Geert Litjens 组)牵头、Erasmus MC 等 CHIMERA Consortium 联合主办。名字是缩写拼图——组织病理(HIstology)+医学影像(Medical Imaging)+分子数据(molEcular Data)→预后与诊断(pRognosis/diAgnosis),恰好拼成希腊神话喷火怪 CHIMERA。三个任务:Task 1 前列腺癌生化复发预测(mpMRI+H&E WSI+临床,267 例两机构,C-index);Task 2 高危非肌层浸润性膀胱癌(HR-NMIBC)的 BCG 反应亚型预测(H&E+临床→BRS1/2/3 三分类,weighted F1);Task 3 NMIBC 进展生存预测(Task 2+bulk RNA-seq,C-index)。训练集在 AWS Open Data Registry 无账户直下,验证/测试隐藏于 GC 注册墙——"训练全开放+评估黑盒"的挑战赛标准形态,也是本库首个生存分析/预后建模任务族与四模态异构融合之最。

§0.2 三个数字

  • 267+368:Task 1 前列腺 267 例(801 MRI 序列/942 WSI/95+23+149 三划分闭合)+Task 2/3 膀胱 368 例(182+176 v2 例数代数自洽)——两癌种三任务六百余例多模态配对数据
  • 0.7402 vs 0.50:Task 1 榜首 C-index(临床单模态)vs 临床变量随机化后的崩塌值——单模态屠榜的脆弱性;多模态模型同场景 ΔC≤0.04——**“排行榜最高≠临床最实用”**的官方定量注脚
  • 132→182/126→176:Task 2/3 数据从 v1 到 v2 的扩容(各 +50 例 Cohort B)——v1 的 8 张问题切片清单直接公示(corrupted/spacing/失焦三类),数据 QC 透明度罕见样本

§0.3 它怎么用

四大用途:①多模态融合方法研究——四模态配对+官方 UNI/nnU-Net/ABMIL 三级 baseline+UNI embeddings 预提取(v2 附带),是融合架构(early/late/hybrid fusion、missing-modality 处理)的标准试验床;②生存分析方法学——C-index 端点+删失配对规则全公开(评估管线代码公开承诺);③全切片病理+影像联合建模——0.5 µm/pixel 千兆像素 WSI 与 3T MRI 的跨尺度配对;④挑战赛方法复现——冠军 ModalSurv 论文+双 summary paper 完整披露。不适合:膀胱癌影像分割(Task 2/3 无 MRI——影像仅在 Task 1)、细胞级分割(无像素级病灶标注)、临床部署(CC BY-NC-SA 非商业限制+无监管评估)。

§0.4 联动提示

本条是 GC 五连第三发(多义名消歧条款首用——GC 上并存 CHIMERA 与 CHIMERA-agent 两个挑战,§1.4 消歧表)。任务谱系里程碑:本库首个生存分析/预后建模条目(分类/检测/文本/生成/分割之外的第六任务族),评估指标从 Dice/AUC 转向 C-index。与 531/532 构成 GC 平台三级可获取性光谱(LMC2 注册墙→TopBrain Zenodo 直下→CHIMERA AWS 无账户直下);与 PI-CAI(若库内已收录)构成 baseline 迁移链——官方影像特征提取器就是 PI-CAI 的 nnU-Net 五折 ensemble 原封迁移。

§1 平台与谱系定位

§1.1 Grand Challenge 上的生态位

CHIMERA 上线于 Grand Challenge 平台(DIAG Nijmegen 运营,137,000+ 用户/420+ challenges/8,042 algorithms)——本库 GC 五连的第三发。平台生态位:计算病理组主做的多模态预后赛道,与其自家(Radboud DIAG)的 PI-CAI/LEOPARD/PANDA 构成泌尿肿瘤挑战矩阵——CHIMERA 是该矩阵中唯一的多模态融合任务,也是唯一同时覆盖两癌种(前列腺+膀胱)与两任务类型(生存+分类)的条目。

GC 平台二级分型落位:CHIMERA 属"开放数据+注册墙评估"混合型——训练集经 AWS Open Data Registry 全公开(无需账户),验证/测试仍走 GC Phase 注册墙;与 531 LMC2(训练也注册墙)和 532 TopBrain(Zenodo 直下+隐藏测试)构成三档光谱的中间偏开放档。

§1.2 缩写命名的结构主义

CHIMERA 的缩写是反向工程的范例——先有"多模态融合预后"的概念,再从概念词里抠字母拼出神话生物名:

碎片 来源词 贡献字母
HI HIstology 组织病理 HI
M Medical Imaging (Radiology) M
E molEcular Data 分子数据 E
R pRognosis 预后 R
A diAgnosis 诊断 A

神话层:奇美拉(Chimera)是狮头+羊身+蛇尾的复合怪物——**“三种异质部件拼成一个生物”**正是多模态融合的隐喻。冠军团队 TIA-Pegasus 的命名接住了这个梗(飞马 Pegasus 在神话中击败奇美拉)——挑战赛文化里的命名互文样本。

§1.3 多义名消歧(模板 v1.5 条款首用)

GC 平台上并存两个 CHIMERA 条目,检索时必须区分:

判别锚三条:①GC 子域名;②数据载体(S3 桶 vs 报告 JSON);③评估形态(C-index/F1 vs 预测+推理轨迹双输出)。GC 首页的动态榜单数字(302/305)属于 agent 版——引用时不可混用。其他领域同名(神经科学 CHIMERA 小鼠模型/遗传学嵌合体)与本库无关但搜索时是强噪音源。

§1.4 与 MICCAI 挑战赛家族的关系

MICCAI 2025 挑战赛生态里,CHIMERA 的差异化:多数挑战赛做单任务单模态(分割/检测/分级),CHIMERA 做多任务多模态预后——task 设计本身就是消融实验(§3.4)。其"挑战赛+summary paper+冠军论文+AWS 归档"的四件套是 MICCAI 挑战赛生态的完整闭环样本——对照 LEOPARD(单模态病理、同端点)能看出多模态化的代价与收益。

§2 发布形态与学术出口

§2.1 发布形态五型落位

本库"完成发布形态"分类里,CHIMERA 属论文先行型的变体:双 summary paper 后置型——挑战赛 2025-04 开跑,summary paper 2026-08/09 才挂 arXiv(Task 1 38 页投 MedIA;Task 2+3 同期)——赛程与论文间隔 16 个月。对照:530 VinDr-SpineXR(论文先行)、529(悬空 4 年)、531 LMC2(在投)、532 TopBrain(NEJM AI 已发)。Radboud 系的发表纪录(Litjens 组)使"悬空"风险低——但 16 个月间隔提醒:挑战赛型数据的学术出口滞后是常态,引用时以 arXiv 版为准。

§2.2 学术出口清单

出口 状态 载体
Task 1 summary paper arXiv 2608.21497(2026-08-21)→ 投 MedIA 38 页/3 图/3 补图
Task 2+3 summary paper arXiv 2609.09510(2026-09-10) 挑战赛联盟署名(CHIMERA Challenge Consortium 集体作者)
ModalSurv 冠军论文 arXiv 2509.05037(2025-09-08,更新 12-18) 4 页 1 图 2 表
数据本体 AWS Open Data Registry+GC 双注册 ARN+Registry 元数据页
baseline 代码 GitHub DIAGNijmegen/CHIMERA UNI+nnU-Net+ABMIL 全链

§2.3 引用规范

AWS Registry 给出的引用格式:“CHIMERA was accessed on DATE from https://registry.opendata.aws/chimera”——数据引用走 Registry,方法引用走 summary paper,冠军方法引用走 ModalSurv。三引分流清晰——AI-Ready 评估中"引用规范性"的高分结构。


§3 三任务定义深度解析

§3.1 Task 1:前列腺癌生化复发(BCR)预测——从 PSA 争议到多模态证据链

临床背景:生化复发(biochemical recurrence)定义为前列腺切除术后任何可检出的 PSA 水平(≥0.1 µg/L)加确认性升高——是无病生存的经典替代终点。但 GC 主页直言 PSA 是"有争议的生物标志物,预测生化复发的可靠性有限"——当前临床评估依赖临床与病理变量(Gleason 评分/pT 分期/切缘状态),缺乏多模态标准。CHIMERA 的答案:把**术前 mpMRI(宏观)与术后 H&E 病理切片(微观)**放进同一个预测任务,用深度学习同时提取两个尺度的预后信号。

数据构成(Task 1 页面+summary paper 双信源):

  • 267 例患者,两机构(Radboud UMC + Canisius Wilhelmina Hospital,均为荷兰奈梅亨)
  • 801 个 MRI 序列:Siemens 3T 扫描仪,三序列 T2 加权(T2W)+高 b 值扩散(HBV)+ADC 图——每例约 3 个序列;前列腺分割 mask 附带
  • 942 张 WSI:3DHISTECH PANNORAMIC 1000 扫描,0.5 µm/pixel,每例多张(模拟真实前列腺切除标本的复杂性——“closely mimic the complexity of real-world prostatectomy specimens”);前景组织 mask 附带
  • 临床变量:论文口径 13 个/例;页面表格实际 15 行(§5.3 口径差存照)
  • 划分:train n=95 / validation n=23 / test n=149(95+23+149=267 ✓)——基线临床病理特征三划分间无显著差异(论文统计)

入组标准(四条全列):①mpMRI(T2W+ADC+高 b 值)可得且 2012 年后采集;②手术 2020 年前完成;③手术时+复发时 PSA 均可得;④患者知情同意科研使用。

任务形式:预测 time-to-BCR——BCR 患者输出手术到复发月数,非 BCR 患者输出手术到最近 PSA 测量的随访月数。Censored C-index 评估。

§3.2 Task 2:BCG 反应亚型(BRS)预测——全球稀缺药物的分层问题

临床背景:约 50% 的高危非肌层浸润性膀胱癌(HR-NMIBC)患者对卡介苗(BCG)膀胱灌注治疗无反应——而 BCG 是"全球稀缺资源"(GC 主页原文:“a globally scarce resource”)。 molecular RNA 分析已与高危治疗反应关联(STM 2023 论文的 BRS 分型)。早期决策需要不依赖测序的替代路径——CHIMERA 的 Task 2 问的是:H&E 形态学+常规临床变量能否预测 RNA-seq 定义的 BCG 反应亚型?

数据构成:

  • v2 182 例(v1 132 例→v2 +50 例 Cohort B,§5 详述)
  • H&E WSI:每例一张,最高分辨率 0.25 µm/pixel(注意:比 Task 1 的 0.5 µm/pixel 更细一档);组织 mask 附带
  • 临床变量:11 个结构化字段(age/sex/smoking/tumor primary-or-recurrent/stage/grade/reTUR/LVI/variant/EORTC/no_instillations——§4.3 全表)
  • 标签:BRS1/BRS2/BRS3——从 RNA-seq 导出的生物标志物定义 BCG 反应亚型(Reference Standard)
  • 评估:weighted F1(三分类不平衡加权)

注意:Task 2 没有 RNA-seq 输入(RNA 是标签来源)也没有 MRI——模态组合与 Task 3 恰好构成消融对照:Task 3 = Task 2 + RNA-seq 输入 + 生存端点。

§3.3 Task 3:NMIBC 进展生存预测——形态学与分子的赛跑

任务定义:Task 2 的扩展——整合组织病理+转录组学预测 HR-NMIBC 患者 time-to-progression。GC 页面明确 RNA-seq 的空间来源:“RNA-seq data is derived from a selected tumor region within the histopathology slide”——测序区域与切片有三种配对情形:①相邻切片(adjacent section);②同一张 H&E 切片打孔取样(punched cavity);③同一患者的另一肿瘤的 H&E。

数据构成:

  • v2 176 例(v1 126 例→+50 例 Cohort B;8 张问题切片与 Task 2 的编号平行——3A_024 corrupted/3A_017,031,042,050,141,143,157 spacing 错误/3A_025 失焦空白 mask 不可修复)
  • H&E WSI + 组织 mask + bulk RNA-seq(DESeq2 归一化)+ 临床变量(同 Task 2 全表 + BRS 字段)
  • 标签:progression 0/1 + time_to_prog_or_FUend(月)——进展或随访截止时间
  • v2 附赠:UNI 0.25mpp 224×224 patch embeddings(.pt)+patch 坐标(.npy),经 slide2vec 管线提取——官方预提取特征直接送训练
  • 评估:Censored C-index(删失配对规则 §6.1)

§3.4 三任务矩阵:一组设计精巧的消融实验

把三个任务并排看,会发现 CHIMERA 的任务设计本身就是一组受控对照:

维度 Task 1 Task 2 Task 3
癌种 前列腺癌 膀胱癌 HR-NMIBC 膀胱癌 HR-NMIBC
端点类型 生存(time-to-BCR) 分类(BRS1/2/3) 生存(time-to-progression)
WSI ✅ 每例多张 0.5mpp ✅ 单张 0.25mpp ✅ 单张 0.25mpp
MRI ✅ 三序列 ❌ ❌
RNA-seq ❌ ❌(作标签) ✅ DESeq2
临床变量 13-15 个 11 个 11+BRS
指标 C-index weighted F1 C-index
规模 267 例 182 例(v2) 176 例(v2)

Task 2 vs Task 3 隔离了 RNA-seq 输入的边际贡献;Task 1 vs Task 2/3 隔离了 影像模态+更大变量表 的作用。这种"挑战赛即消融"的设计在挑战赛文献中难得一见——大多数挑战赛只做一个任务(对照 PANDA/PI-CAI/LEOPARD 单任务形态)。

§4 数据本体:四模态的技术规格

§4.1 病理模态:千兆像素 WSI 的两种分辨率

  • Task 1:0.5 µm/pixel(20× 物镜等效),3DHISTECH PANNORAMIC 1000 扫描仪,每例多张切片——前列腺切除标本的完整取样
  • Task 2/3:0.25 µm/pixel(40× 等效)最高分辨率,单张/例——膀胱 TURB 标本
  • 两者均附带二值组织 mask(_HE_mask.tif)——前景/背景分割预处理,避免千兆像素的白背景算力浪费
  • v2 附带 UNI embeddings+patch 坐标——UNI 是 Mahmood Lab 的病理基础模型(HuggingFace MahmoodLab/UNI)
  • 格式:TIFF(_HE.tif),金字塔存储

§4.2 影像模态:Siemens 3T mpMRI 三序列

  • T2 加权(T2W)——解剖结构参考
  • 高 b 值扩散加权(HBV)——细胞密度信号
  • ADC 表观扩散系数图——扩散定量
  • 前列腺分割 mask 附带(zone-level)——与 PI-CAI 的标注传统一致
  • 801 序列/267 例 ≈ 3.0 序列/例——三序列齐备的标准配例
  • 所有扫描 2012 年后采集(设备/协议时代一致性控制)

§4.3 临床模态:结构化变量全表

Task 1 页面 15 行(论文口径 13 个):

特征 类型 说明
Age at prostatectomy Integer 手术时年龄
Primary Gleason Ordinal 1-5 最主要组织学模式
Secondary Gleason Ordinal 1-5 次主要模式
Tertiary Gleason Ordinal 1-5/NaN 第三模式(<5% 肿瘤,提示侵袭性)
ISUP grading Ordinal 1-5 由 Gleason 评分映射(EAU 指南)
PSA prior to surgery Float µg/L 术前 PSA;<0.10 记"<0.10"(非检出)
PSA at recurrence Float µg/L 复发时 PSA;同上
BCR status Binary 0/1 术后任一 PSA≥0.1 µg/L 定义
pT-staging String 病理 T 分期(EAU 指南)
Lymph node invasion 0/1/“x” 淋巴结侵犯(x=未切除淋巴结)
Capsular penetration 0/1/“x” 包膜穿透(x=病理未评估)
Positive surgical margins 0/1/2 切缘阳性(2=病理医师无法评估)
Seminal vesicle invasion 0/1/“x” 精囊侵犯(x=未切除)
Lymphovascular invasion Binary 0/1 淋巴血管侵犯
Earlier therapy String 既往前列腺癌治疗

Task 2/3 共用 11 变量(age/sex/smoking/tumor primary|recurrent/stage TaHG|T1HG|T2HG+T1m|T1e substage/grade G2|G3/reTUR/LVI/variant UCC|UCC+Variant/EORTC High|Highest risk/no_instillations(-1=缺失)),Task 3 另含 BRS 字段与 reference standard(progression 0/1+time_to_prog_or_FUend)。

三值编码 0/1/“x” 是本数据集的临床现实主义细节——"x"显式编码"未切除/未评估"信息缺失,区别于 0/1 的真实阴性/阳性;margin 的 “2” 同理。这类缺失编码在建模时是陷阱也是机会(§7.3 缺失感知建模)。

§4.4 分子模态:bulk RNA-seq 的队列结构

  • DESeq2 归一化的 bulk RNA-seq(_RNA.json)
  • 来源:WSI 上选定的肿瘤区域微切割测序
  • Cohort A(3A 前缀)vs Cohort B(3B 前缀):Cohort B 50 例来自 STM 2023 论文(de Jong FC et al., Sci Transl Med 15(697):eabn4118)队列,测序协议与 Cohort A 不同且未做批次效应校正——页面明示。这是数据集诚实披露的典范,也是使用者的必读警告(跨队列分析需自行处理)
  • BRS 标签即从此 RNA 数据导出(Biomarker-derived BCG Response Subtype)

§4.5 存储结构:S3 桶与文件命名

s3://chimera-challenge/(us-west-2,no-sign-request)
  v2/
    task1/ data/ {patient_id}/{patient_id}_*.tif|json + quality_control.csv
    task2/ data/ + features/coordinates/*.npy + features/*.pt
    task3/ data/ + features/coordinates/*.npy + features/*.pt

每例一个文件夹(_CD.json 临床+_HE.tif 切片+_HE_mask.tif 组织 mask[_RNA.json 转录组]);features/ 是 v2 新增的 UNI 预提取产物。AWS Open Data Registry 收录页给出 ARN arn:aws:s3:::chimera-challenge——注册页+文档页+引用格式齐备。

§5 数据版本演化与质量透明

§5.1 v1→v2 演化全记录

版本 Task 2 Task 3 变化
v1(2025-04-10 随赛发布) 132 例 126 例 首发;含 8 张问题切片
v2(挑战赛期间) 182 例 176 例 +50 例 Cohort B(3B);修复 7 张 spacing+1 张 corrupted;2A/3A_025 失焦不可修复保留;新增 UNI embeddings+patch 坐标;_CD.json 全量更新对齐 val/test 特征集
  • 2025-06-08 修复存照:v2 的 _CD.json 缺失 progression 参数——发现后修正重传 AWS(页面 UPDATE 记录)
  • v1 问题切片清单直接公示:Task 2 的 2A_024(corrupted)/2A_017, 031, 042, 050, 141, 143, 157(spacing 错误)/2A_025(失焦→空白 mask,不可修复);Task 3 的 3A_* 编号镜像同款——挑战赛页面主动列数据缺陷清单的做法在挑战赛实践中罕见(对照 530 VinDr-SpineXR 的页面拼写事故被动考古,CHIMERA 是主动透明)
  • task{n}_quality_control.csv 随数据发布——QC 结果结构化交付

§5.2 Cohort A/B 的批次陷阱

Cohort B 的加入让 Task 3 的 RNA 数据天然带双协议结构:3A(原队列)与 3B(STM 2023 队列)测序协议不同、未做批次调整。官方只提示"no batch effect adjustment was performed on these 2 cohorts"——对参赛者是噪音源,对方法研究者是现成的域移/批次效应测试床。后挑战分析发现"cohort-dependent performance degradation"(队列依赖性能退化)——模型在两队列上的表现差异是 Task 2+3 论文的核心发现之一。

§5.3 页面 vs 论文的口径差存照

  • 临床变量数:论文摘要 “13 clinical variables per case” vs Task 1 页面表格 15 行——差异或因 BCR status(标签)与 PSA at recurrence(与 BCR 定义耦合)的统计归类不同;引用时双口径并注
  • GitHub README 的 Task 3 描述截断:“clinical dat”——原文应为 clinical data(排版截断,非内容分歧)
  • 主页 NIBC/NMIBC 混用:GC 主页 “Why CHIMERA?” 写 “non-invasive bladder cancer (NIBC)”,Challenge Scope 写 “Non-Invasive Bladder Cancer (NMIBC)”——标准术语为 NMIBC(non-muscle-invasive,非肌层浸润);“non-invasive” 直译"非浸润"是不严谨缩写。同一页面两个缩写指同一人群——页面考古·术语漂移形态

§6 评估体系:C-index 的删失几何学

§6.1 Censored C-index 完整规则(GC 页面原文五条)

  1. 模型性能用删失一致性指数(censored concordance index)评估——所有可比患者对中预测顺序正确的比例
  2. 两患者可比当且仅当:①两人都发生事件但时间不同;②一人发生事件、另一人无事件但随访观察时间更长
  3. 两人在同一时间发生事件→不可比(排除)
  4. 预测风险分更高者实际生存时间更短→该对为 concordant(正确排序)
  5. C-index 范围:0.5=随机预测;1.0=完美一致

评估管线(含 C-index 计算代码)承诺公开——“to ensure transparency and reproducibility”。

§6.2 指标矩阵的方法学意义

  • Task 1/3 用生存指标、Task 2 用分类指标——同一数据集内双指标体系,评估代码需同时支持删失配对与加权 F1
  • 删失规则的第 2 条(无事件但随访更长者与事件者可比)是生存分析标准处理——但挑战赛场景下经常被参赛者误解(ModalSurv 论文详述其实现细节)
  • weighted F1 处理 BRS 三分类不平衡——STM 2023 的 BRS 分布天然不均

§6.3 提交机制与平台流程

  • 时间线四节点(含两处删除线修订):Announcement+Training Release 2025-04-10 → Validation Phase 06-01 06-13 → Test Deadline 08-01 08-22 AOE → 结果在 MICCAI 2025 CHIMERA workshop 公布
  • 验证阶段与测试阶段的 GC Phase 机制(注册墙+黑盒评估)——159 submissions(Task 2+3 论文口径)/13 个顶级模型入选最终 benchmark
  • minimal baseline template(github.com/nadieh/CHIMERA_minimal_baseline)——最低成本参赛路径

§7 结果与后挑战分析:屠榜悖论的三层证据

§7.1 榜面成绩

任务 最佳成绩 最佳模型类型
Task 1 C-index 0.7402 单模态临床变量模型
Task 2(BRS) weighted F1 0.73 多模态/病理模型
Task 3(进展) C-index 0.68 多模态模型
冠军 ModalSurv T1 C 0.7402(第 1)/T2-3 C 0.5740(第 5) 跨注意力融合多模态生存框架

Task 1 冠军是临床变量单模态模型——不是多模态。三任务横向结论(Warwick 新闻):“Across the three CHIMERA tasks, models based on clinical data still performed best.”

§7.2 ModalSurv:冠军方法与它的自我怀疑

TIA-Pegasus(Warwick TIA Centre,Noorul Wahab 领队;成员 Jiaqi Lv/Ethar Alzaid/Adam Shephard/Shan E Ahmed Raza)的 ModalSurv:模态专用投影+跨注意力融合的临床/MRI/病理/RNA 生存建模框架。论文(arXiv 2509.05037,4 页)标题即自我怀疑:“Investigating opportunities and limitations of multimodal deep survival learning”——核心结论三条:①外部测试集上临床单模态击败多模态(“clinical features alone outperformed multimodal models on external tests”);②局部验证多模态有增益但泛化受限(“Local validation showed multimodal gains but limited generalisation”);③病因诊断:多模态对齐不足+潜在过拟合。团队命名梗:Pegasus 是希腊神话中击败 Chimera 的有翼飞马——挑战赛名与队名构成神话互文。

§7.3 官方后挑战分析:把悖论变成设计原则

Task 1 summary paper(arXiv 2608.21497)的 post-challenge analyses 是本条目最具方法学价值的部分:

  • 随机化实验:把 clinician-derived 变量随机打乱→单模态临床模型崩塌至 C≈0.50(chance 水平)——榜首模型的信号完全来自结构化变量的完整性
  • ** withholding 实验**:完整删除临床变量→多模态模型仅 ΔC≤0.04——多模态模型能直接从影像恢复预后信号
  • 结论表述(论文摘要原文):“Although models using only patient characteristics and clinician-derived variables yielded the highest leaderboard performance, multimodal models demonstrated greater robustness in clinically realistic scenarios where complete expert annotation is not guaranteed.”
  • Task 2+3 论文的对应发现:任务依赖的模态贡献(BRS 中病理可部分补偿病理科医生衍生结构变量);progression 模型更依赖互补输入;T1 substage 与跨架构一致难例相关——患者级预测失败的系统分析(“patient-level prediction failure”)
  • 方法学启示:挑战赛榜单只回答"谁在完整数据上最高";CHIMERA 的后挑战分析回答"谁的信号更抗缺失"——缺失感知建模(missingness-aware modeling)与多机构独立验证被论文列为领域刚需。这套"随机化/删除"双重压力测试范式可直接移植到任何多模态 benchmark 的评估协议

§7.4 参与度存照

  • 159 submissions(Task 2+3)/13 个顶级模型入选——组织方逐模型 benchmark
  • CHIMERA-agent 续作(2026)首期数字:302 participants/305 submissions(Debug phase 至 2026-12-18)——续作热度约为原版膀胱任务的 2 倍量级(agent 范式+LLM 时代红利)
  • 原版挑战赛参与团队数 GC 主页未静态披露(动态渲染未获数——与 531 LMC2 同款页面行为,不混用 agent 版数字)

§8 baseline 技术链与复现路径

§8.1 三级特征-预测架构

WSI ──→ UNI(MahmoodLab/HF)──→ patch embeddings ─┐
                                                    ├─→ ABMIL ──→ 风险/类别
MRI ──→ nnU-Net v1(PI-CAI 五折迁移)──→ 影像特征 ──┤
                                                    │
clinical/RNA ──→ 结构化编码 ────────────────────────┘
  • UNI:病理基础模型(0.25mpp/224×224 patch),v2 数据直接附带提取产物(.pt+.npy)——不重复算力
  • nnU-Net v1:影像特征提取器就是 PI-CAI 挑战赛的 nnU-Net baseline ensemble 原封迁移(DIAGNijmegen/picai_nnunet_semi_supervised_gc_algorithm 的 Task2203_picai_baseline 五折 plans.pkl+model_best.model)——GC 生态内挑战赛资产复用的直接样本
  • ABMIL:attention-based multiple instance learning 预测头——三任务各一,不提供预训练权重,需自行训练(README 明示)
  • 另有 minimal baseline template(github.com/nadieh/CHIMERA_minimal_baseline)——参赛最小路径

§8.2 复现清单

  1. aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ (task2/task3 同式)——无需 AWS 账户
  2. 下载 UNI 权重(HuggingFace,需同意条款)+PI-CAI nnU-Net 权重(GitHub 直链)
  3. 按 task1_baseline/README 训练 ABMIL→放置 common/model/ 目录
  4. 评估:C-index 计算代码公开承诺(Task 1/3)+weighted F1(Task 2)
  5. 质量控制:task{n}_quality_control.csv 逐例核对

§8.3 公共数据推荐链(官方钦定)

Task 1 页面 Public Data 节点名四个预训练/增强数据源:

  • LEOPARD(GC 平台):“strongly recommend”——H&E WSI time-to-BCR 预测挑战,与 Task 1 端点同型,可训练可预训练
  • PI-CAI(GC 平台)——mpMRI 前列腺癌检测(同时也是 baseline 权重来源——双重角色)
  • PANDA(GC 平台)——前列腺 Gleason 分级(WSI)
  • TCGA-PRAD(TCIA)——前列腺腺癌组织病理+基因组

四个推荐全是泌尿肿瘤 GC/公开生态的核心资产——CHIMERA 在文档里把自己织进这张网(LEOPARD→PI-CAI→PANDA→TCGA-PRAD→CHIMERA 的数据谱系),这是挑战赛型条目"生态位自觉"的样本。

§9 伦理、许可与可获取性

§9.1 伦理轴:公开数据二次整合型

  • 知情同意明示:Task 1 入组标准第 4 条"Patients provided consent for the use of their data for scientific research"——患者级同意是入组硬条件
  • 机构轴:Task 1 两机构(Radboud UMC+Canisius Wilhelmina Hospital);Task 2/3 队列源自已发表 STM 2023 研究(Cohort A/B,Erasmus MC 系)
  • 无独立 IRB 编号披露:页面与两篇 summary paper 摘要均未见审批号——对照 528-530 的 IRB 明文型(H108+HMUH 双 IRB)与 532 的 UZH IRB,CHIMERA 属"同意明示+审批号缺席"档
  • 病例时间窗:MRI>2012/手术<2020(Task 1)——十年窗的时代一致性控制

§9.2 许可:CC BY-NC-SA 4.0 的双限制

  • NC(非商业)+SA(相同方式共享)——对照 LMC1 的 CC BY 4.0(仅署名)与 529 的 Restricted 签约墙,CHIMERA 位于中间档:学术使用自由,商业使用被排除,衍生数据集必须同许可共享
  • 对 LLM 训练语料化的含义:NC 条款下商用模型训练需单独授权——AI-Ready 评估中"许可开放度"维度的显著扣分项(但比 529 的签约墙仍高一档)

§9.3 可获取性:挑战赛数据开放度最高档

  • AWS Open Data Registry 收录——aws s3 ls --no-sign-request s3://chimera-challenge/ 无需 AWS 账户;官方 CLI 命令直接印在页面
  • Registry 页元数据完备:描述/更新频率(As required)/许可/文档链/管理方/联系人/引用格式/ARN/Region
  • 训练集全开放+validation/test 隐藏(GC 注册墙)——与 TopBrain 的 Zenodo 直下同型,但 CHIMERA 多了 AWS Open Data 这层官方注册(发现性+引用规范性加分)
  • GC 五连可获取性光谱落位:LMC2(注册墙+黑盒)→ TopBrain(Zenodo 直下)→ CHIMERA(AWS Open Data 无账户直下)——三档梯度是挑战赛型条目可获取性分级的现成标尺

FAQ:30 问直答

Q1:CHIMERA 是什么的缩写?
Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis——组织病理+影像+分子数据融合做预后与诊断,缩写恰好拼出希腊神话喷火怪。

Q2:谁主办的?
Radboud University Medical Center 计算病理组(Computational Pathology Group)牵头,Geert Litjens 与 Nadieh Khalili 领衔,联合 Erasmus MC、Canisius Wilhelmina Hospital 等 CHIMERA Consortium 成员。

Q3:哪一届会议?
MICCAI 2025(2025 年 9 月,韩国大田),结果在 CHIMERA workshop 公布。续作 CHIMERA-agent 对接 MICCAI 2026(Abu Dhabi)。

Q4:三个任务分别做什么?
Task 1:前列腺癌生化复发时间预测(mpMRI+H&E+临床,C-index);Task 2:高危 NMIBC 的 BCG 反应亚型三分类(H&E+临床→BRS1/2/3,weighted F1);Task 3:NMIBC 进展生存(Task 2+RNA-seq,C-index)。

Q5:数据规模多大?
Task 1 前列腺 267 例(801 MRI 序列+942 WSI,train 95/val 23/test 149);Task 2 v2 182 例;Task 3 v2 176 例;膀胱侧合并论文口径 368 例=182+176。

Q6:怎么下载?
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ <目标路径>——无需 AWS 账户(AWS Open Data Registry 收录,us-west-2)。训练集全开放,验证/测试隐藏。

Q7:什么许可?
CC BY-NC-SA 4.0——署名+非商业+相同方式共享。学术自由使用;商用被 NC 条款排除;衍生数据须同许可。

Q8:为什么临床单模态反而拿了第一?
Task 1 榜首 C-index 0.7402 来自只用了临床变量的模型——Gleason/分期/PSA 等结构化变量本身就是强预后因子,267 例的小样本下深度多模态融合难以兑现增益。

Q9:那多模态还有什么用?
官方后挑战分析:把临床变量随机化后,单模态崩塌至 C≈0.50;删除临床变量后多模态只掉 ΔC≤0.04——多模态模型能直接从影像恢复预后信号,在"专家标注不全"的现实场景里更鲁棒。

Q10:ModalSurv 是什么?
Task 1 冠军模型(Warwick TIA Centre 的 TIA-Pegasus 团队,Noorul Wahab 领队):模态专用投影+跨注意力融合的多模态生存框架,C 0.7402(第 1);其论文 arXiv 2509.05037 自证外部测试集上临床单模态更强。

Q11:BRS 是什么?
Biomarker-derived BCG Response Subtype——从 RNA-seq 数据导出的 BCG 治疗反应亚型(BRS1/2/3),源自 de Jong FC 等 STM 2023 论文(eabn4118)的分型体系。

Q12:Task 2 和 Task 3 数据是同一批患者吗?
基本是——两任务的问题切片编号平行(2A_024 vs 3A_024 同款损坏),Task 3 = Task 2 患者池+RNA-seq+生存端点。规模差(182 vs 176)来自 RNA 配对要求。

Q13:Cohort A/B 是什么?为什么重要?
v2 新增的 50 例来自 STM 2023 的队列(3B 前缀),测序协议与原队列(3A)不同且未做批次效应校正——跨队列建模需自行处理,也是现成的批次效应测试床。

Q14:v1 和 v2 有什么区别?
v2 修复了 v1 的 7 张 spacing 错误+1 张 corrupted 切片(2A/3A_025 失焦保留);新增 Cohort B 50 例;附送 UNI patch embeddings 与坐标;_CD.json 字段对齐验证/测试集(2025-06-08 还修过一次缺失 progression 参数)。

Q15:baseline 用了什么模型?
UNI(病理特征)+nnU-Net v1(影像特征——直接迁移 PI-CAI 挑战赛五折 ensemble 权重)+ABMIL(预测头,需自行训练)。另有 minimal baseline template。

Q16:CT 有吗?
没有——Task 1 影像只有 mpMRI 三序列(T2W/HBV/ADC)。

Q17:为什么 Task 2/3 没有 MRI?
膀胱癌(TURBT 标本)临床路径以病理+分子为核心,影像不是常规决策输入——模态组合反映真实临床信息结构,这正是"挑战赛即消融"设计的一部分。

Q18:临床变量有哪些?
Task 1 论文口径 13 个/例(页面表 15 行):年龄、三级 Gleason、ISUP、术前/复发 PSA、BCR 状态、pT 分期、淋巴结/包膜/精囊/淋巴血管侵犯、切缘、既往治疗。Task 2/3 共用 11 个(含 EORTC 风险、BCG 灌注次数等)。

Q19:缺失值怎么编码的?
三值编码 0/1/“x”(x=未切除/未评估);切缘 2=病理医师无法评估;no_instillations 用 -1 标记缺失;PSA<0.10 µg/L 记"<0.10"。建模时别把 “x” 当数值。

Q20:WSI 什么规格?
Task 1:0.5 µm/pixel,3DHISTECH PANNORAMIC 1000,每例多张;Task 2/3:0.25 µm/pixel 最高分辨率,单张/例。均附二值组织 mask。

Q21:RNA-seq 怎么和 WSI 配对的?
三种情形:相邻切片/同一张 H&E 打孔取样/同一患者另一肿瘤的 H&E——页面明示,做空间映射时需留意。

Q22:C-index 怎么算的?
删失一致性指数:两患者可比=都发生事件但时间不同,或一人发生事件另一人无事件但随访更长;预测风险高者实际时间短=concordant;0.5 随机、1.0 完美。计算代码公开承诺。

Q23:数据质量如何保证?
官方直接公示 v1 问题切片清单(corrupted/spacing/失焦三类逐例列出)+task{n}_quality_control.csv 随数据发布+修过的坑(_CD.json 缺参数)在页面留 UPDATE 记录——QC 透明度罕见。

Q24:官方论文发了没有?
两篇 summary paper 都在:Task 1(arXiv 2608.21497,38 页,投稿 Medical Image Analysis);Task 2+3(arXiv 2609.09510)。冠军论文 ModalSurv(arXiv 2509.05037)——挑战赛学术出口最高档。

Q25:CHIMERA-agent 是什么?和本条目什么关系?
2026 年续作(MICCAI 2026 Abu Dhabi):前列腺癌患者旅程三决策点的 agentic benchmark——要求提交结构化推理轨迹、幻觉推理被惩罚、编排预训练基础模型而非从头训练。数据与任务形态完全不同,是两条 GC 条目(首期 302 participants/305 submissions)。

Q26:能用于 LLM/基础模型训练吗?
文本与结构化数据可以(注意 CC BY-NC-SA 的 NC 条款限制商用);千兆像素 WSI 与 MRI 属重模态,更适合训练专用编码器;v2 附带的 UNI embeddings 是省算力的替代路径。

Q27:跟 PANDA/PI-CAI/LEOPARD 什么关系?
官方钦定的预训练数据链:LEOPARD(同为 H&E time-to-BCR,“strongly recommend”)→PI-CAI(MRI 检测,也是 baseline 权重来源)→PANDA(Gleason 分级)→TCGA-PRAD。CHIMERA 把自己定位为这条泌尿肿瘤生态链的多模态终点。

Q28:参与情况如何?
Task 2+3 共 159 submissions、13 个顶级模型入选官方 benchmark;agent 续作首期 302 participants——原版挑战赛团队数页面未静态披露。

Q29:最佳成绩是多少?
Task 1 C 0.7402(临床单模态)/Task 2 weighted F1 0.73/Task 3 C 0.68——三任务无一超过 0.75,泌尿肿瘤多模态预后的天花板还很远。

Q30:适合做什么、不适合做什么?
适合:多模态融合架构研究、生存分析方法学、缺失模态鲁棒性、批次效应测试、病理-影像跨尺度建模。不适合:膀胱癌影像分割(无 MRI)、细胞级分割(无像素标注)、临床部署(NC 许可+无监管评估)。


事实清单:36 条硬事实+8 条口径注

硬事实(F1-F36)

# 事实 信源
F1 全名展开 Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis GC 主页
F2 MICCAI 2025 挑战赛,结果 CHIMERA workshop 发布 论文摘要/LinkedIn
F3 主办 Radboud UMC Computational Pathology Group AWS Registry/GC
F4 组织牵头 Nadieh Khalili+Geert Litjens Warwick 新闻/论文
F5 Announcement+Training Release 2025-04-10 GC 主页
F6 Validation Phase 06-01 划改 06-13;Test Deadline 08-01 划改 08-22 AOE GC 主页删除线
F7 Task 1:267 patients/两机构 论文摘要
F8 Task 1:801 MRI sequences 论文摘要
F9 Task 1:942 WSIs 论文摘要
F10 Task 1:13 clinical variables per case(论文口径) 论文摘要
F11 Task 1 划分 95/23/149 论文摘要
F12 Task 1 划分间基线无显著差异 论文摘要
F13 Task 1 mpMRI=Siemens 3T,T2W+HBV+ADC 三序列 Task 1 页面
F14 Task 1 WSI=3DHISTECH PANNORAMIC 1000,0.5 µm/pixel Task 1 页面
F15 Task 1 入组四条:MRI>2012/手术<2020/双 PSA/知情同意 Task 1 页面
F16 Task 1 最佳 test C-index 0.7402(单模态临床) 论文摘要
F17 临床变量随机化→单模态崩塌 C≈0.50 论文摘要
F18 多模态 withheld→ΔC≤0.04 论文摘要
F19 “first public, standardized multimodal benchmark for prostate cancer prognosis” 论文摘要原文
F20 Task 2 v1 132→v2 182 例 Task 2 页面
F21 Task 3 v1 126→v2 176 例 Task 3 页面
F22 Task 2+3 合并 368 patients/159 submissions/13 models arXiv 2609.09510
F23 Task 2 最佳 weighted F1 0.73/Task 3 最佳 C 0.68 arXiv 2609.09510
F24 BRS1/2/3 标签源自 RNA-seq(STM 2023 eabn4118) Task 2/3 页面
F25 Cohort B 50 例测序协议不同、未做批次校正 Task 3 页面明示
F26 v1 问题切片清单逐例公示(2A/3A_024 等 8 张) Task 2/3 页面
F27 _CD.json progression 缺失修复 UPDATE 2025-06-08 Task 3 页面
F28 v2 附 UNI 0.25mpp 224×224 embeddings(slide2vec) Task 2/3 页面
F29 baseline=UNI+nnU-Net v1(PI-CAI 迁移)+ABMIL GitHub DIAGNijmegen/CHIMERA
F30 PI-CAI nnU-Net 权重五折 plans.pkl+model_best.model 迁移 GitHub README
F31 冠军 TIA-Pegasus(Warwick)ModalSurv:T1 第 1(C 0.7402)/T2-3 第 5(0.5740) Warwick 新闻/arXiv 2509.05037
F32 “clinical features alone outperformed multimodal models on external tests” ModalSurv 摘要原文
F33 S3:arn:aws:s3:::chimera-challenge(us-west-2,no-sign-request) AWS Registry
F34 许可 CC BY-NC-SA 4.0 AWS Registry
F35 Task 1 summary paper arXiv 2608.21497(38 页,投稿 MedIA,2026-08-21) arXiv
F36 CHIMERA-agent(MICCAI 2026 Abu Dhabi,10-01 半天 workshop):302 participants/305 submissions agent GC 主页/GC 首页

口径注(N1-N8)

# 注 处理
N1 临床变量数:论文 13 vs 页面表 15 行 双口径并注(归类差异或含标签项)
N2 NIBC(主页 Why 节)vs NMIBC(Scope 节)同页混用 以 NMIBC 为准,注明术语漂移
N3 时间线两处删除线修订(06-01→06-13/08-01→08-22) 以划改后为准
N4 GitHub README Task 3 描述 “clinical dat” 截断 依上下文补全 clinical data
N5 原版参与团队数页面未静态披露(302/305 是 agent 版) 不混用;存照
N6 Task 2 182 vs Task 3 176 差 6 例 RNA 配对要求所致(页面明示三种配对情形)
N7 队列归属:Task 2/3 机构链依 STM 2023 作者群(Erasmus MC 系)推定 论文正文可再核
N8 IRB 编号未见(同意明示) 伦理轴按"同意明示+审批号缺席"档记录

术语表:40 条

术语 释义
CHIMERA 本挑战赛缩写名;亦为希腊神话狮头羊身蛇尾喷火怪
CHIMERA-agent 2026 续作:agentic 多模态推理 benchmark(MICCAI 2026)
BCR Biochemical Recurrence 生化复发:术后 PSA≥0.1 µg/L 的确认性升高
BRS BCG Response Subtype:RNA-seq 导出的 BCG 反应亚型(BRS1/2/3)
NMIBC Non-Muscle-Invasive Bladder Cancer 非肌层浸润性膀胱癌
HR-NMIBC 高危 NMIBC——Task 2/3 的人群限定
BCG Bacillus Calmette-Guérin 卡介苗膀胱灌注:NMIBC 标准治疗,全球稀缺
C-index 一致性指数:可比患者对中风险排序正确比例;0.5 随机 1.0 完美
Censored 删失:随访截止未发生事件的观测——生存分析核心概念
weighted F1 类不平衡加权的 F1 分数(Task 2 指标)
WSI Whole Slide Image 全切片数字扫描图像(千兆像素级)
mpMRI multiparametric MRI 多参数磁共振:T2W+HBV+ADC 组合
HBV High b-Value diffusion 高 b 值扩散加权序列
ADC Apparent Diffusion Coefficient 表观扩散系数图
Gleason 评分 前列腺癌组织学分级(Primary+Secondary 模式相加)
Tertiary Gleason 第三模式:<5% 肿瘤量的第三种模式,提示侵袭性
ISUP 国际泌尿病理学会:Gleason→Grade Group 映射标准
pT-staging 病理 T 分期:肿瘤解剖侵犯范围
切缘阳性 手术墨染边缘见癌细胞——复发强预测因子
LVI Lymphovascular Invasion 淋巴血管侵犯
EORTC 欧洲癌症研究与治疗组织:NMIBC 风险分层表出处
reTUR 再次经尿道切除:BCG 前的二次 TURBT
UNI Mahmood Lab 病理基础模型(HuggingFace)——官方病理特征提取器
nnU-Net 自适应医学图像分割框架;v1 五折 ensemble 从 PI-CAI 迁移
ABMIL Attention-Based Multiple Instance Learning:弱监督聚合预测头
slide2vec WSI→向量表征管线(v2 embeddings 提取所用)
DESeq2 RNA-seq 归一化方法(负二项模型)
bulk RNA-seq 组织块级转录组测序(对照单细胞)
Cohort A/B Task 3 RNA 双队列:3A 原队列 vs 3B STM 2023 队列(协议不同)
微切割 从 WSI 选定肿瘤区域取材测序——RNA 的空间来源
LEOPARD GC 平台 H&E WSI time-to-BCR 挑战(Task 1 官方推荐预训练源)
PI-CAI GC 平台 mpMRI 前列腺癌检测挑战(baseline 权重来源)
PANDA GC 平台前列腺 Gleason 分级挑战(推荐预训练源)
TCGA-PRAD TCGA 前列腺腺癌队列(推荐预训练源)
PANNORAMIC 1000 3DHISTECH 数字病理扫描仪(Task 1 用)
Radboud UMC 拉德堡德大学医学中心(奈梅亨)——主办与 Task 1 主队
Erasmus MC 伊拉斯姆斯医学中心(鹿特丹)——膀胱队列与 Task 2/3 论文主力
Canisius Wilhelmina Hospital 奈梅亨坎西斯-威廉米娜医院——Task 1 第二机构
TIA Centre Warwick 大学组织图像分析中心——Task 1 冠军队所在
ModalSurv 冠军模型:模态投影+跨注意力融合生存框架(arXiv 2509.05037)

附录

附录 A:三任务数据字典(逐字段)

Task 1 患者文件夹(s3://chimera-challenge/v2/task1/data/{patient_id}/):

字段 类型 内容
{id}_HE*.tif WSI TIFF H&E 全切片(0.5mpp,每例多张)
{id}_HE*_mask.tif 二值 TIFF 组织前景 mask
{id}MR*.mha/nrrd MRI 体数据 T2W/HBV/ADC 三序列
{id}_MR_mask 分割 前列腺 zone mask
{id}_CD.json JSON 临床变量(13-15 字段)

Task 2(v2/task2/):{id}_HE.tif+{id}_HE_mask.tif+{id}_CD.json;features/coordinates/{id}_HE.npy+features/{id}_HE.pt(UNI 0.25mpp 224×224)

Task 3(v2/task3/):Task 2 全部+{id}_RNA.json(DESeq2 bulk RNA-seq);_CD.json 含 BRS+progression+time_to_prog_or_FUend

QC 交付:task{1,2,3}_quality_control.csv

附录 B:AWS 下载复现命令

# 无需 AWS 账户——no-sign-request
aws s3 ls --no-sign-request s3://chimera-challenge/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ ./chimera/task1/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task2/ ./chimera/task2/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task3/ ./chimera/task3/

# baseline 权重(两处外部下载)
# 1) UNI: huggingface.co/MahmoodLab/UNI → model.bin + config.json
# 2) PI-CAI nnU-Net 五折: github.com/DIAGNijmegen/picai_nnunet_semi_supervised_gc_algorithm
#    → Task2203_picai_baseline/nnUNetTrainerV2_Loss_FL_and_CE_checkpoints__nnUNetPlansv2.1
#    → plans.pkl + 各 fold_*/model_best.model

# ABMIL:不提供预训练——按 task{1,2,3}_baseline/README.md 自行训练
# 评估:C-index 计算代码公开承诺(GC 评估管线)

附录 C:最小 PyTorch 生存头示例(ABMIL 风格)

import torch, torch.nn as nn

class AttnMIL(nn.Module):
    # CHIMERA 官方 baseline 的 ABMIL 预测头风格实现
    def __init__(self, in_dim=1024, hid=256, p=0.25):
        super().__init__()
        self.feat = nn.Sequential(nn.Linear(in_dim, hid), nn.ReLU(), nn.Dropout(p))
        self.attn  = nn.Sequential(nn.Linear(hid, 1))          # patch 级注意力
        self.risk  = nn.Linear(hid, 1)                          # Cox 风险分(无激活)

    def forward(self, bags, mask):
        # bags: [B, N, D] 每例 N 个 patch embedding;mask: [B, N] 有效位
        h = self.feat(bags)                                     # [B, N, H]
        a = self.attn(h).squeeze(-1)                            # [B, N]
        a = a.masked_fill(~mask, float("-inf"))
        a = torch.softmax(a, dim=1)                             # 注意力归一化
        z = (a.unsqueeze(-1) * h).sum(1)                        # [B, H] 聚合
        return self.risk(z).squeeze(-1)                         # [B] 风险分

# 训练目标:Cox partial likelihood(配对 concordance 的可微代理)
def cox_loss(risk, event, time):
    # risk: [B] event: [B] 0/1 time: [B]
    order = torch.argsort(time, descending=True)                # 风险集排序
    risk = risk[order]; event = event[order]
    log_cum = torch.logcumsumexp(risk, dim=0)                   # 风险集 log 累积
    return -( (risk - log_cum) * event ).sum() / event.sum().clamp(min=1)

# 评估:删失 C-index 按 GC 规则——可比对=(双事件不同时)|(单事件+更长随访)

附录 D:挑战赛家族与泌尿生态对照表

挑战赛 平台 任务 模态 规模 指标 与 CHIMERA 关系
PANDA GC Gleason 分级 WSI ~1 万例 QWK 预训练推荐源
PI-CAI GC csPCa 检测 mpMRI+PSA 10K+ AUROC 预训练源+baseline 权重出处
LEOPARD GC time-to-BCR WSI 数千例 C-index 端点同型的单模态前作
CHIMERA GC 三任务预后 WSI+MRI+RNA+临床 635 例 C-index/F1 本条
CHIMERA-agent GC 三决策点 agentic 报告+变量 JSON 302 队 推理+预测 2026 续作
TopCoW/TopBrain GC 血管分割 CTA/MRA 90 volumes Dice GC 五连同批

635=267+182+176(三任务患者数合计;膀胱侧 368=182+176 与合并论文一致)

附录 E:GC 核查模板 v1.5 执行记录(4 轮)

轮 动作 收获
R1 WebSearch 定位+GC 主页+AWS Registry 双抓 消歧确立(CHIMERA vs CHIMERA-agent);缩写全展;S3/许可/联系人
R2 GC 主页重抓(Timeline 修订存照)+WebSearch 学术面 TIA-Pegasus 夺冠/ModalSurv/03,300 人 MICCAI;NIBC/NMIBC 漂移发现
R3 GitHub DIAGNijmegen/CHIMERA+WebSearch summary paper baseline 三件套;arXiv 2608.21497 全量数字(267/801/942/95-23-149/0.7402/0.50/ΔC≤0.04);Task 1 页面全变量
R4 Task 2/Task 3 页面+agent 主页+Task 1 补抓 v1→v2 演化/问题切片清单/Cohort A/B;368=182+176;F1 0.73/C 0.68;agent 三任务细节

前作锚强度分级适用:双 summary paper 已出(arXiv 2608.21497+2609.09510)+冠军论文+AWS Registry 自描述完备——v1.5 模板"最高档",4 轮收敛(对照 LMC2 六轮)。多义名消歧条款首用成立(同名 agent 续作并存 GC)。

附录 F:命名消歧表(条款首用记录)

名称 身份 判别特征
CHIMERA Challenge 本条:MICCAI 2025 三任务预后 chimera.grand-challenge.org;S3 chimera-challenge;267+368 例
CHIMERA-agent 2026 续作 agentic benchmark chimera-agent.grand-challenge.org;302 participants;推理轨迹
Chimera(神话) 缩写来源:狮/羊/蛇喷火怪 TIA-Pegasus 队名梗(Pegasus 击败 Chimera)
CHIMERA(神经科学) 小鼠海马光遗传模型(他域) 与本库无关
CHIMERA(嵌合体) 遗传学/生物信息术语(他域) 与本库无关

附录 G:伦理轴四型对照(本条落位)

型 条目 特征 CHIMERA 位置
前瞻采集+双 IRB 528/529/530(VinDr 家族 H108+HMUH) IRB 编号明文 —
国家基础设施/细胞系 531 LMC2(FBI/ANR) 细胞系合规轴 —
公开数据二次精标+IRB 532 TopBrain(UZH IRB) 审批号可见 —
公开数据二次整合+同意明示 533 CHIMERA 知情同意入组硬条件;IRB 编号未披露 ✅ 第四型扩展

附录 H:可获取性三档光谱(GC 五连实测)

档 条目 训练集 测试集 特殊设施
注册墙型 531 LMC2 注册+协议 黑盒 GC Algorithm+提交配额
直下型 532 TopBrain Zenodo 直下 隐藏 podium Docker
无账户直下型 533 CHIMERA AWS no-sign-request 隐藏 AWS Open Data Registry 官方收录

三档梯度=挑战赛型条目可获取性分级的现成标尺;CHIMERA 的 Registry 收录(ARN/Region/引用格式)是"发现性+引用规范性"的加分结构。

附录 I:DAIMS 评分卡(预估 7.6)

维度 分 依据
文档完备 9 四任务页+数据版本史+QC CSV+双 summary paper+AWS Registry 元数据
标注质量 8 BRS 标签 RNA-seq 定义可溯源(STM 2023);临床端点双盲隐藏 test;IAA 未披露
可复现 9 S3 开放+baseline 权重全链+评估代码公开承诺+UNI embeddings 附带
可获取性 9 无账户直下最高档(NC 许可小扣)
伦理合规 7 知情同意明示但 IRB 编号缺席;Cohort 双协议未校正的诚实披露是加分
加权 ≈7.6 挑战赛型高位(对照 LMC2 6.9/TopBrain ~7.8)

附录 J:时间线全景

日期 事件
2023-05-24 STM 2023 论文发表(eabn4118,BRS 分型+Cohort B 源)
2025-04-10 CHIMERA 公告+注册开放+训练数据 v1 发布(同日)
2025-06-08 v2 _CD.json progression 缺失修复 UPDATE
2025-06-01→13 Validation Phase 开始(划改)
2025-08-01→22 Test 提交截止(划改,AOE)
2025-09 MICCAI 2025 大田:CHIMERA workshop 结果发布;TIA-Pegasus Task 1 夺冠
2025-09-08 ModalSurv 冠军论文 arXiv 2509.05037
2026-01-27 GitHub 仓库最后提交
2026-08-21 Task 1 summary paper arXiv 2608.21497(投 MedIA)
2026-09-10 Task 2+3 summary paper arXiv 2609.09510
2026-10-01 CHIMERA-agent workshop(MICCAI 2026 Abu Dhabi 半天)
2026-12-18 agent Debug phase 截止

附录 K:坑点表(数据使用陷阱清单)

| 坑点 1 | 临床单模态屠榜的诱惑——C 0.7402 模型完全依赖结构化变量,随机化后 C≈0.50;复现榜单成绩前先确认变量完整性假设 |
| 坑点 2 | “x” 三值编码当数值用——淋巴结/包膜/精囊侵犯的 “x” 是"未切除/未评估",不是 0;margin 的 2 同理 |
| 坑点 3 | Cohort A/B 批次效应——3B 的 50 例测序协议不同且未校正;跨队列指标会被批次噪音污染 |
| 坑点 4 | v1 数据仍可从 S3 下载——旧版本含 8 张损坏切片;务必用 v2/ 路径 |
| 坑点 5 | PSA<0.10 记字符串 “<0.10”——直接 parse float 会崩;需预处理 |
| 坑点 6 | Task 2/3 患者池重叠但非全同(182 vs 176)——跨任务拼接训练前需按 patient_id 对齐 |
| 坑点 7 | WSI 分辨率两档(0.5mpp Task 1/0.25mpp Task 2-3)——统一下游管线时注意物镜等效差异 |
| 坑点 8 | UNI 权重需 HuggingFace 同意条款——直接 curl 拉不下来;agent 评测的 JSON 输出与原版不互通(两条目两协议) |
| 坑点 9 | RNA 与 WSI 三种配对情形(相邻/打孔/另一肿瘤)——空间映射不能假设同切片 |
| 坑点 10 | CC BY-NC-SA 的 SA 条款——衍生数据集发布必须同许可;商用训练需授权 |

附录 L:人名与机构全表

人名 角色 机构
Nadieh Khalili 挑战赛牵头/双论文作者/contact Radboud UMC
Geert Litjens 计算病理组 PI/组织者 Radboud UMC
Robert N. Spaans Task 1 论文通讯 Radboud 病理科+Canisius Wilhelmina
Catherine Chia Task 2+3 论文一作 Erasmus MC 病理
Tongjie Wang Task 1/2+3 论文作者 Erasmus MC
Tahlita Zuiverloon Task 2+3 通讯链(膀胱 PI) Erasmus MC 泌尿科
Marlies Wakkee/Sita Vermeulen Task 2+3 作者 Erasmus MC
Khrystyna Faryna GC 平台侧/双论文作者 Bydgoszcz(波兰)
Parandzem Khachatryan 论文作者 Yerevan State Medical University(亚美尼亚)
Domingos Oliveira 论文作者 IMP Diagnostics(葡萄牙)
Jean-Paul A. van Basten 论文作者(泌尿外科) Canisius Wilhelmina
Noorul Wahab Task 1 冠军队领队 Warwick TIA Centre
Jiaqi Lv/Ethar Alzaid/Adam Shephard/Shan E Ahmed Raza 冠军队成员 Warwick TIA Centre

附录 M:口径速查卡(引用即查)

口径 数字 备注
Task 1 患者 267 两机构
Task 1 MRI 序列 801 ≈3/例
Task 1 WSI 942 多张/例
Task 1 划分 95/23/149 和=267 ✓
Task 1 临床变量 13(论文)/15(页面表) 双口径
Task 2 v2 182 v1 132
Task 3 v2 176 v1 126
膀胱合并 368 =182+176 ✓
submissions 159 Task 2+3
顶级模型 13 官方 benchmark
T1 最佳 C 0.7402 临床单模态
T2 最佳 wF1 0.73 —
T3 最佳 C 0.68 —
随机化崩塌 C≈0.50 单模态临床
withheld 鲁棒 ΔC≤0.04 多模态
ModalSurv T1 C 0.7402 /T2-3 C 0.5740 第 1/第 5
agent 参与度 302 participants/305 submissions 续作首期
S3 s3://chimera-challenge us-west-2

附录 N:跨条目联动矩阵

联动条目 联动点 类型
PI-CAI(如已收录) baseline nnU-Net 五折权重直接迁移 资产复用链
LEOPARD(如已收录) Task 1 官方 “strongly recommend” 预训练源 官方推荐链
PANDA(如已收录) WSI 分级预训练推荐 官方推荐链
531 LMC2 GC 可获取性两极(注册墙 vs 无账户直下) 对照
532 TopBrain GC 五连同批;Zenodo vs AWS Open Data 两种直下形态 同批
TopCoW(如已收录) NEJM AI 出口 vs arXiv/MedIA 出口 学术出口对照
530 VinDr-SpineXR 页面 QC 形态对照(被动考古 vs 主动缺陷清单) 方法论对照

附录 O:开放问题与后续观察点

  • MedIA 落地:Task 1 summary paper 投稿 Medical Image Analysis(2026-08-21 v1)——落地后引用格式将变(对照 529 Sci Data 悬空 4 年的反面教材,Radboud 系发表纪录良好)
  • agent 版数据发布:CHIMERA-agent 的推理标注(泌尿科医生结构化评估界面收集)是否会公开训练集——agentic 数据形态对 AI-Ready 评估是新题型
  • 批次校正补丁:官方是否为 Cohort A/B 发布 combat/归一化补丁——现"未校正"状态是坑点 3 的时效性依据
  • 原版团队数:GC 动态渲染数据(脚本抓取可得)——存照不混用 agent 数字
  • 膀胱 MRI 扩展:Task 2/3 无影像模态——若 CHIMERA 后续并入膀胱 MRI(如 VIADULT 队列),三任务矩阵将闭合全模态
  • 许可演化:NC→CC BY 的可能性(对照 TopCoW 家族的 open data.swiss 商用需许可)——关注 AWS Registry Update Frequency: As required

附录 P:预后建模方法学底座(为什么 C-index 是这里的王者)

P.1 PSA 的争议史与替代终点选择

GC 主页直言 PSA 是"controversial biomarker with limited reliability"——这段争议的学术脉络:PSA 筛查降低转移率但带来大量过度诊断(过度治疗);术后 PSA 复发(BCR)作为终点客观、可量化、早于转移多年,但它本身不是死亡——BCR 患者中仅一部分会进展为转移/死亡(竞争风险)。CHIMERA 选择 time-to-BCR 而非 time-to-death,是泌尿肿瘤预后建模的标准但可争议的选择——条目使用者应意识到:C-index 0.74 的模型预测的是"复发时序"不是"死亡风险"。

P.2 Gleason 体系为何占临床变量的三分之一

Task 1 的 15 行变量表中 Gleason 占三行(Primary/Secondary/Tertiary)+ISUP 一行——因为 Gleason 是前列腺癌预后第一强因子:Primary(最主要模式 1-5)+Secondary(次主要)相加为评分(6-10);Tertiary 是<5% 肿瘤量的第三模式——2025 年 ISUP 共识建议记录但不并入总分。CHIMERA 直接把病理医师的读片结论作为结构化变量喂给模型——这意味着"临床+病理变量"模型实际上已经包含了专家级图像解读的压缩输出;多模态 WSI 分支要证明的是端到端原始像素能否重新发现这些压缩信号——这是理解屠榜悖论的钥匙(P.4)。

P.3 删失数据的现实几何

Task 1 的 time-to-BCR 里,非 BCR 患者的随访时长是删失观测——95 训练例的删失率直接影响 C-index 的有效样本量。删失三规则(§6.1)的可视化直觉:两位患者可比=他们的"事件时序有事实上的先后证据";同时事件不可比=无先后证据;删失更长=这位患者"撑过了对方的事件时点"——证据成立。C-index 0.5 是随机的含义:风险排序对可比对无信息。

P.4 结构化变量 vs 原始像素的信号论

后挑战分析揭示的信号层级:

  1. clinician-derived 变量=专家知识的压缩编码(Gleason/分期/切缘)——信息密度极高
  2. WSI/MRI 原始像素=未压缩信号——理论上⊇结构化变量,实际上需从有限样本(95/23/149)重新学习压缩器
  3. 小样本+高维像素→端到端学习的数据饥饿;结构化变量→信息即用
  4. 随机化实验证明榜首模型吃的是第 1 层;withholding 实验证明第 2 层存在可恢复的冗余信号(ΔC≤0.04)
    这套层级分析适用于任何"临床变量+影像"的预后建模数据集——CHIMERA 的普适贡献。

附录 Q:多模态融合架构分类学(CHIMERA 语境)

Q.1 融合阶段三型

型 时机 代表 在 CHIMERA 上的表现
Early fusion 像素/特征级拼接 简单 concat 小样本易过拟合
Late fusion 各模态独立预测后集成 投票/stacking 单模态强时退化为临床模型
Hybrid/attention 中间表征跨模态注意 ModalSurv(跨注意力投影) 局部验证有增益、外部泛化受限

Q.2 缺失模态处理的策略谱

CHIMERA 的现实约束(Task 2 无 MRI/Task 3 无 MRI/RNA 可缺失/Clinical 的 “x” 三值)催生四类策略:①模态丢弃训练(modality dropout)——训练时随机屏蔽;②代理填充(surrogate imputation)——用其他模态预测缺失模态表征;③模态专用编码器+共享融合核(官方 ABMIL 思路);④决策级编排(agent 思路——CHIMERA-agent 的"编排预训练工具")。后挑战分析的 missingness-aware 建模呼吁=策略①③的规范化。

Q.3 千兆像素 WSI 的聚合问题

一张 0.25mpp WSI 可切出数万 patch——ABMIL(注意力 MIL)是当前标准聚合器:patch 级 embedding→注意力加权求和→slide 级表征。官方 baseline 选 ABMIL 而非 Transformer 聚合(TransMIL/DSMIL 等)是算力保守选择;v2 附带 UNI embeddings 把 patch 编码成本转嫁给组织方——参赛者只需训 ABMIL 头。这也是挑战赛降低参与门槛的实用主义设计。

Q.4 MRI 分支为什么用 nnU-Net 而不是直接端到端

官方把 PI-CAI 的 nnU-Net 五折 ensemble 作为 MRI 特征提取器——即先用分割/检测模型把前列腺区域编码,再喂 ABMIL。理由:①267 例不足以端到端训练 MRI 骨干;②PI-CAI 的检测任务与 BCR 预测共享"临床显著前列腺癌"的信号子空间;③挑战赛资产复用是 GC 生态的制度优势。"迁移权重当特征提取器"是多模态小样本挑战赛的通用模式。

附录 R:膀胱癌临床背景扩展(Task 2/3 语境)

R.1 NMIBC 与 HR-NMIBC 的分层

膀胱癌按肌层侵犯分两界:NMIBC(Ta/T1/Tis——未达肌层)vs MIBC(≥T2)。NMIBC 占初诊 75%,经尿道切除(TURBT)+膀胱内灌注为标准路径;其中高危(HR)亚群(T1 高级别/高级别复发/大面积 Ta 等)进展风险最高——EORTC 风险表(Task 2/3 变量里的 High/Highest risk)是欧洲标准分层工具。Task 2/3 的 stage 变量(TaHG/T1HG/T2HG)+T1m/T1e substage(浸润深度 0.5mm 分界)正是这个分层体系的字段化——T1e(>0.5mm)是进展强预测因子,也是后挑战分析发现的"跨架构一致难例"标记(§7.3)。

R.2 BCG 短缺与反应亚型的医学经济学

BCG(卡介苗)膀胱灌注是 HR-NMIBC 的标准免疫治疗——但 2019 年起全球持续短缺(生产集中于少数厂商),“globally scarce resource”(GC 主页原文)是字面事实。50% 无反应率+全球稀缺="谁能从 BCG 获益"的预测问题直接对应药物配置经济学——BRS 预测的临床价值不在学术而在分诊:无反应者应早做根治决策(膀胱切除/免疫检查点),有反应者避免过度治疗。RNA-seq 定义的 BRS(STM 2023)是分子金标,但临床常规不做测序——Task 2 问的正是"H&E+常规变量能否替代测序"。

R.3 BRS 三亚型的生物学含义

BRS1/2/3(Biomarker-derived BCG Response Subtype)的推导:STM 2023 用两队列转录组做共识聚类得到的分子亚型,与 BCG 治疗后复发/进展风险差异相关。CHIMERA 把它作为分类端点——标签的生物学有效性继承自 STM 2023 的验证,本数据集不再独立验证(引用时注明标签来源)。

R.4 reTUR 与灌注计数的现实细节

变量表里的 reTUR(BCG 前二次 TURBT)与 no_instillations(灌注总次数,-1=缺失)是治疗强度变量——BCG 反应受完整疗程影响(灌注不足≠真无反应)。建模者需区分"生物学无反应"与"治疗不充分"——这也是 Task 2+3 论文 missingness 分析的现实基础。

附录 S:端到端复现工作流(从 S3 到 C-index)

S.1 环境与数据(≈120 GB 全量/Task 1 约 60 GB)

pip install awscli h5py openslide-python monai torch
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ ./data/task1/
# QC:task1_quality_control.csv 逐例核对损坏切片

S.2 WSI→UNI embeddings(若用 Task 2/3 附带产物可跳过)

import openslide, torch
from timm import create_model          # UNI 经 HF/timm 加载
uni = create_model('vit_large_patch16_224', num_classes=0, pretrained=True).eval()

def slide_to_embeddings(slide_path, mpp=0.25, size=224):
    # 千兆像素 WSI → patch 网格 → UNI 向量序列
    sl = openslide.OpenSlide(slide_path)
    W, H = sl.dimensions
    coords = [(x, y) for x in range(0, W, size) for y in range(0, H, size)]
    feats = []
    for x, y in coords:
        img = sl.read_region((x, y), 0, (size, size)).convert('RGB')
        # 组织 mask 过滤白背景后批量化(省略)
        feats.append(uni(preprocess(img)).squeeze(0))
    return torch.stack(feats)          # [N_patches, 1024]

S.3 生存头训练与删失评估

# 模型与损失见附录 C;训练循环要点:
# 1) event=0 的样本参与 loss 仅作为风险集成员(Cox 结构保证)
# 2) 验证集 C-index 按 GC 规则自实现或用 sksurv.metrics.concordance_index_censored
# 3) 早停以验证 C-index 为准(对齐挑战赛 Phase 机制)

S.4 后挑战分析复现(随机化/withholding 双实验)

# 随机化实验: Clinical 变量列内 shuffle(保持边缘分布破坏对应关系)→ 测 C-index 崩塌幅度
# withholding:直接置空临床分支(ABMIL 仅吃影像+RNA)→ 测 ΔC
# 官方结论锚点:随机化→C≈0.50;withheld→ΔC≤0.04

S.5 常见复现失败清单

  • 忘记 v2 路径下载到 v1(损坏切片复现"神秘"低分)
  • “<0.10” 字符串未预处理
  • “x”/2 缺失编码当数值
  • Task 2/3 患者池按行号对齐(应按 patient_id)
  • Cohort A/B 混训未标注批次(指标虚高或虚低无法归因)
  • UNI 权重未走 HF 同意流程(下载失败)

附录 T:挑战赛设计方法论(CHIMERA 可复用的组织学经验)

T.1 任务矩阵即消融(§3.4 的设计论价值)

三任务正交设计让每个模态的边际贡献可测——单任务挑战赛只能给出综合排名,多任务矩阵给的是信息结构图谱。组织侧成本:三套评估管线+三份 summary paper;收益:Task 1 的"单模态屠榜"结论有 Task 2/3 的横向对照佐证(三任务一致),结论可信度倍增。

T.2 数据版本治理的透明度样本

v1→v2 的治理动作清单:修复清单逐例公示/不可修复项明示保留/新增队列明示协议差异/字段对齐修复留 UPDATE 时间戳——缺陷公示不是弱点而是复现科学的基础设施。对照:多数数据集论文把 QC 结果埋在补充材料;CHIMERA 把它放在任务页正文。AI-Ready 评估视角:这是"文档完备"维度 9 分的核心理由。

T.3 评估管线的公开承诺

"C-index 计算代码将公开"承诺+隐藏 test 的黑盒评估——挑战赛可复现性的两难(公开评估代码 vs 防过拟合的隐藏性)的标准解:代码公开+数据不公开。参赛者可本地复算验证集指标,测试集由平台统一评估——159 submissions 的公平性建立在这个机制上。

T.4 与 GC 泌尿矩阵的接力设计

Public Data 节点名四个前作(LEOPARD/PI-CAI/PANDA/TCGA-PRAD)+baseline 权重直接来自 PI-CAI——CHIMERA 把生态接力写进了参赛指南。挑战赛的组织学启示:挑战赛不是孤立事件而是数据谱系的节点——预训练源清单+权重迁移让后来者站在前作肩上,这比单场奖金更持久。

T.5 时间线弹性与沟通

两处截止日期划改(06-01→06-13/08-01→08-22)以删除线保留修订史——改期不抹历史的页面治理风格;配合 UPDATE 时间戳(_CD.json 修复),组织方的沟通纪律与数据可信度互相加强。

附录 U:CHIMERA-agent 深度对照(续作的全息画像)

U.1 三决策点的临床流

任务 时点 输入 输出
Agent-T1 活检前 mpMRI 报告+基础临床变量 是否建议活检
Agent-T2 活检后 MRI+活检病理报告+临床 主动监测/继续监测/观察等待/积极治疗(EAU/NCCN 四选一)
Agent-T3 根治术后 切除+活检病理报告+术前 MRI+PSA time-dependent BCR 风险

U.2 与原版的五维差异

维度 CHIMERA(2025) CHIMERA-agent(2026)
数据形态 原始模态(WSI/MRI/RNA 文件) 结构化 JSON(报告+变量+纵向 PSA)
输出 风险值/类别 预测 JSON+推理轨迹 JSON(~5KB/例)
评估 C-index/wF1 预测+推理一致性(幻觉/无支撑/矛盾惩罚)+顶级提交泌尿科人工审查
参与范式 训练模型 编排预训练基础模型工具(前列腺分区分割/Gleason 分级/csPCa 检测三件套)
现实性注入 完整配对数据 缺失/延迟/冲突证据显式注入(“not edge cases but routine clinical practice”)

U.3 参考推理标注的新数据形态

Ground truth 推理由泌尿科医生经"结构化临床评估界面"审阅 EHR 式病历产出——医生决策轨迹本身成为标注——这是 AI-Ready 评估的新题型:推理标注的质量与一致性评估(医生间 IAA)将在 agent 数据条目中成为新维度。

U.4 参与热度信号

Debug phase 至 2026-12-18(302 participants/305 submissions)——agent 范式首期热度约为原版 Task 2+3 提交量(159)的 2 倍:LLM 时代 agentic 评估对社区的吸引力可见一斑;但也需注意 Debug 阶段参与门槛低(提交即计),最终有效团队数待 2027 年结果公布。

U.5 演化判断

原版回答"多模态数据能融合出什么";agent 版回答"不完美信息下如何决策"——从数据完整性假设到现实碎片性的范式迁移。若 agent 版的推理轨迹数据将来开放,"患者旅程级"AI-Ready 数据将首次入库——观察点记入附录 O。

附录 V:临床变量—预后语义映射详表(Task 1 建模指南)

变量 预后强度 建模处理建议
Primary/Secondary Gleason 极强(一级证据) 保序编码(ordinal embedding)勿 one-hot;与 ISUP 冗余——避免双重计数
Tertiary Gleason 强(缺失即信息) NaN≠0:缺失指示变量单列
ISUP grading 极强(Gleason 的确定映射) 与 Gleason 三列高度共线——特征选择或仅留一组
术前 PSA 强(连续+右偏) log 变换;“<0.10” 按检出限处理(substitution 或 Tobit 思路)
pT-staging 强 字符串多值——映射 AJCC/EAU 有序量表
切缘(+) 强 三值 0/1/2——2 作为缺失指示
淋巴结/包膜/精囊 “x” 中强 “x”=未切除——缺失机制与分期相关(MNAR 警示)
LVI 中 二值干净
年龄 弱-中 标准化;与合并症不可得性权衡
Earlier therapy 特殊 既往治疗改变基线——交互项候选
PSA at recurrence 端点耦合 勿作特征——与 BCR 定义循环(数据泄漏陷阱)
BCR status 标签 生存分析的 event 指示
time-to-BCR/FU 标签 duration 列

三处数据泄漏高危点:PSA at recurrence 入特征/用 test 分布做归一化/按 BCR 状态分层后混合划分——附录 S 的复现流程已按泄漏安全排序。

附录 W:CHIMERA Consortium 的治理网络

W.1 三层结构

层 成员 职能
核心组织 Radboud UMC 计算病理组(Litjens/Khalili/Spaans/Faryna) 平台运营/任务设计/评估
数据联盟 Erasmus MC(病理+泌尿+皮肤科)/Canisius Wilhelmina/IMP Diagnostics(葡) 队列供给/临床语义
地理扩展 Bydgoszcz(波兰)/Yerevan(亚美尼亚) 评估/联盟署名

W.2 集体署名制

两篇 summary paper 均出现 “CHIMERA Challenge Consortium”/“on behalf of the CHIMERA Consortium” 集体作者——**联盟署名(group authorship)**是大型挑战赛学术出口的规范形态(对照 531 LMC2 的 28 位共同作者模式);个体作者+联盟双列保证贡献可溯与规模可见。

W.3 学科交叉轴

病理(Radboud/Erasmus 病理科)+泌尿外科(Canisius/Erasmus)+皮肤科(Erasmus——Chia/Wang 的第三挂靠,荷兰病理多挂靠传统)+诊断产业(IMP Diagnostics)+学术界地理扩展(波兰/亚美尼亚)——五轴交叉是多模态挑战赛的必要社会结构:没有临床科室的变量语义背书,结构化变量就只是数字。

W.4 平台经济

GC 平台(DIAG Nijmegen)本身由 Radboud 运营——主办机构=平台运营方=数据主供方三位一体(对照 LMC2 的 FBI 主办+GC 托管分层)。这种垂直整合降低协调成本,但也意味着独立复核依赖 summary paper 的透明度承诺——DAIMS 伦理维度 7 分的治理面注脚。

附录 X:库内对照深度表(五维度)

维度 533 CHIMERA 531 LMC2 532 TopBrain 530 VinDr-SpineXR
任务族 生存+分类(第六族首发) image-to-image 生成 多类分割 分类+检测
模态数 4(WSI/MRI/RNA/临床) 2(透射光→荧光) 2(CTA/MRA) 1(X-ray)
数据载体 AWS Open Data(无账户) GC 注册墙 Zenodo 直下 GC 算法页面
学术出口 双 summary paper 已出(投 MedIA+arXiv) 数据库论文已发表/挑战在投 NEJM AI 已发表 MICCAI 正式接收
QC 透明度 缺陷清单逐例公示(主动) 登录墙缺口存照 版本三迭代留痕 页面拼写事故(被动)
伦理型 同意明示+审批号缺席 细胞系轴 UZH IRB 明文 双 IRB 明文
规模口径 368=182+176 ✓/95+23+149=267 ✓ 56,984/56,981 漂移 48=40∪42∩34 ✓ 10,466 vs 10,468 差 2
参与度 159 submissions(原版)/agent 302 队 未披露 11/15 团队口径差 —

对照结论:CHIMERA 在模态广度+QC 透明度+代数自洽三项居 GC 五连之首;参与度数字的原版/续作分离是本条目特有的口径纪律点。

附录 Y:四类读者的行动指南

Y.1 多模态融合研究者

路径:附录 S 复现基线→Task 1 为试验床做融合架构对照(附录 Q 三型)→复现随机化/withholding 双实验(S.4)→把"缺失感知指标"写进自己的评估协议。目标论文位:融合架构在 ΔC 意义下的改进(而非榜面 C-index)。

Y.2 计算病理工程师

路径:v2 附带 UNI embeddings 起步(免千兆像素算力)→ABMIL 头训练(附录 C)→0.25mpp 全分辨率管线(附录 S.2)→跨 Task 2/3 的批次效应实验(Cohort A/B 现成测试床)。注意附录 V 的泄漏清单。

Y.3 泌尿肿瘤临床研究者

路径:附录 P/R 的临床语义底座→变量表(§4.3)与 EAU 指南映射→Task 2 的 BRS 预测问题即"测序替代"经济学(R.2)→agent 版三决策点(附录 U)作为临床决策支持的原型场景。

Y.4 数据集管理者/AI-Ready 评估者

路径:AWS Registry 元数据页(发现性范本)→QC CSV+缺陷清单(治理范本)→许可三档对照(§9.2-9.3)→本条 DAIMS 评分卡(附录 I)作为挑战赛型条目评分的参照系。CHIMERA 是"数据开放度"与"结论可用性"分离评估的最佳教学案例。

附录 Z:Task 2/3 膀胱变量建模语义(对照附录 V)

变量 取值 建模语义
age/sex/smoking 整数/二值/二值 标准人口学三件套;smoking 是膀胱癌一级危险因素——勿当噪音变量剔除
tumor Primary/Recurrent 复发肿瘤的分子行为不同——分层候选变量
stage TaHG/T1HG/T2HG 三级有序(浸润深度递增);T2HG 出现在 NMIBC 队列属边缘入组——核对 QC CSV
T1m/T1e substage 0.5mm 分界 进展最强病理预测子之一;也是后挑战"一致难例"标记(§7.3)——模型分层报告的天然切面
grade G2/G3 两级有序(中/低分化)——HR 队列内 G3 占多数的类不平衡预期
reTUR Yes/No 治疗强度代理——与 BCG 反应混杂(R.4)
LVI Yes/No NMIBC 中 LVI 阳性即升级 HR 处理——强信号
variant UCC/UCC+Variant 组织学变异体(微乳头/肉瘤样等)行为更凶——二值粗编码丢失亚型信息(页面粒度上限)
EORTC High/Highest risk 队列入组过滤器本身——方差被截断(全员高危),区分度有限
no_instillations 整数/-1 完整疗程计数;-1 缺失指示单列
BRS(Task 3 特征/Task 2 标签) BRS1/2/3 Task 3 中作特征(分子先验)Task 2 中作标签——同字段双角色的跨任务数据泄漏警示:两任务模型不可共享该字段管道

附录 AA:RNA-seq 数据处理指南(_RNA.json 的正确打开方式)

AA.1 数据形态

  • DESeq2 归一化输出(尺寸因子校正后的标准化计数)——已归一化,无需再做 DESeq2 流程
  • 来源区域:WSI 选定肿瘤区微切割——空间稀疏(非全切片bulk)
  • Cohort A(3A)与 B(3B)协议不同——批次变量必须保留

AA.2 推荐处理链

import json, numpy as np, pandas as pd
rna = json.load(open(f"{pid}_RNA.json"))
# 1) 对数稳定:log1p(normalized_counts)
# 2) 高变基因筛选(HVVG top-k,k∈[1000,5000])或直接用 STM 2023 的 BRS 特征基因集
# 3) 批次变量 one-hot 进协变量或做 Combat(官方未做——使用者自行抉择并披露)
# 4) 降维:PCA/autoencoder 压至 64-256 维再进融合头(原始维度数万)

AA.3 三类常见错误

  • 把 DESeq2 输出再跑一次 DESeq2(重复归一化——分布扭曲)
  • 3A/3B 混训无批次标注(后挑战发现的"队列依赖退化"即此坑的模型级显形)
  • 假设 RNA 覆盖全切片(实际仅选定肿瘤区——与 WSI 注意力图对齐时空间语义错位)

AA.4 RNA 与 WSI 的对齐研究位

三种配对情形(相邻/打孔/另一肿瘤)=空间对齐噪声的自然分级——可设计"对齐强度"消融:相邻切片(最强对应)vs 打孔(同切片部分对应)vs 另一肿瘤(患者级对应)——这个分级本身就是论文可挖的方法学素材。

附录 AB:挑战赛时间管理与提交策略(Phase 机制复盘)

AB.1 时间线的行为学读法

阶段 日历 行为含义
注册+训练集 04-10 同日 “注册即拿数据”——零摩擦入口设计
验证期 06-13→08-22(划改后跨度 70 天) 唯一长窗口——迭代主力期;划改 +12 天=给数据 v2 修复让路(时间线治理的因果推断)
测试截止 08-22 AOE AOE(Anywhere on Earth)时区=最宽容截止惯例
Workshop 2025-09 大田 赛-会间隔 ~2 周——MICCAI 惯例

AB.2 提交经济学

159 submissions(Task 2+3)/约 13% 入选终评(13/约 100 队推算)——终评密度设计:不是所有提交都被 benchmark,组织方按榜面+多样性选 13 个做深度分析(含后挑战压力测试)。对参赛者策略:早期提交锁定验证集反馈、后期提交覆盖架构多样性(官方分析偏爱"有故事"的模型族)。

AB.3 黑盒下的过拟合防范

隐藏 test+限量提交的对称设计——提交次数少则探索不足、多则 test 过拟合;CHIMERA 未公开单队提交上限(页面未载)——对照 531 LMC2 的 ≤5/日配额公开。这是文档完备度 9 分里唯一的暗点,记入口径注 N5 的同族观察。

AB.4 对下一条目的模板沉淀

GC 核查模板 v1.5 的"可获取性三档"在 CHIMERA 得到第四个数据点:Registry 收录型(AWS Open Data+ARN+引用格式)> Zenodo 直下型 > 注册墙型。534 autoPET V 与 535 OWL 的数据载体核查将直接套用此四分。

附录 AC:引用声明模板与复现声明(直接可用的规范化文本)

AC.1 数据引用模板(论文/报告用)

数据来源:CHIMERA Challenge(Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis),Radboud University Medical Center 主办,MICCAI 2025 挑战赛。训练数据(v2)经 AWS Open Data Registry 获取(s3://chimera-challenge,us-west-2),许可 CC BY-NC-SA 4.0。方法描述:Spaans RN, et al. arXiv:2608.21497(Task 1);Chia C, et al. arXiv:2609.09510(Task 2+3)。

AC.2 结果复现声明模板

本研究使用 CHIMERA v2 训练集(Task 1 n=95/Task 2 n=182/Task 3 n=176)。验证与测试集由 Grand Challenge 平台托管未随训练集发布,故本报告的 C-index/weighted F1 为训练集内部交叉验证结果,与官方榜单(test C-index 0.7402 等)不可直接比较。Cohort A/B 批次变量已保留并披露处理方式。缺失编码(“x”/2/-1/“<0.10”)按附录 V/Z 语义处理。

AC.3 模型卡片(Model Card)关键字段建议

字段 建议值
训练数据 CHIMERA v2(哪个 task 哪些模态)
评估指标 C-index(删失规则)/weighted F1
已知偏差 Cohort A/B 协议差;HR-NMIBC 单中心群(Erasmus 系);T1e 一致难例
适用范围 泌尿肿瘤预后研究;非临床部署
不适用 肌层浸润/转移队列;非欧洲人群外推;BCG 个体化处方
许可继承 衍生模型发布需披露 CC BY-NC-SA 4.0 传染性(SA 条款对权重的适用性讨论)

AC.4 AI-Ready 评估的操作化定义(本条目贡献)

挑战赛型条目的 AI-Ready 评估在 CHIMERA 上形成五个可复用检查点:①训练集无账户直下可达(Registry/ARN 元数据完备);②评估管线代码公开承诺与隐藏 test 的对称设计;③数据版本治理(v1→v2 演化+缺陷清单公示);④baseline 全链可复现(权重/embeddings/损失函数三件);⑤学术出口可追溯(summary paper+冠军论文+集体署名规范)。五点齐备=挑战赛型 DAIMS 7.5+ 的操作化门槛——供 534/535 及后续挑战赛条目直接套用。

AC.5 本条目事实的存证链(本库方法论要求)

事实组 存证信源 抓取时点
规模/划分/指标 arXiv 2608.21497 摘要+Task 1-3 GC 页 2026-09-25
版本演化/QC 清单 Task 2/3 页面 Data versions 节 2026-09-25
baseline 链 GitHub DIAGNijmegen/CHIMERA README 2026-09-25
冠军/ModalSurv Warwick TIA 新闻+arXiv 2509.05037 2026-09-25
AWS 元数据 registry.opendata.aws/chimera 2026-09-25
agent 消歧 chimera-agent.grand-challenge.org+GC 首页 2026-09-25

§10 总结:多模态预后的标准起点与它的清醒剂

CHIMERA 的双重价值:建设性的——首个泌尿肿瘤多模态预后标准化 benchmark,四模态配对+三级 baseline+删失评估规范+QC 缺陷清单公示,把"怎么组织一场诚实的多模态挑战赛"做成了模板;清醒剂的——临床单模态屠榜(C 0.7402)且随机化即崩塌(0.50)、多模态仅微弱鲁棒(ΔC≤0.04)、冠军团队自证外部测试集上单模态更强——多模态融合的增益在 2025 年的泌尿肿瘤数据上仍未兑现,瓶颈不在架构而在"大规模、平衡、对齐的多模态数据集"本身(ModalSurv 原话)。这个悖论让 CHIMERA 超越了一个数据集:它是给整个多模态医学 AI 领域的压力测试协议——先问信号从哪来(随机化实验),再问缺失时谁还站着(withholding 实验),最后才看榜单。对 AI-Ready 数据集评估的含义:可获取性 9 分(AWS 无账户直下)与"单模态陷阱"警示并存——数据开放不等于结论好用,条目价值恰在这两层张力的完整记录。


本条目为千方病案医数集 GC 五连第三发。数据以 CHIMERA Challenge 官方页面(chimera.grand-challenge.org)、两篇 summary paper(arXiv 2608.21497/2609.09510)、冠军论文(arXiv 2509.05037)、GitHub DIAGNijmegen/CHIMERA 与 AWS Open Data Registry 为准,抓取时点 2026-09-25。CHIMERA-agent(MICCAI 2026)信息仅作消歧与对照,其数据本体另行成条。
(完)

附录 AD:本条目与 GC 五连的批次位置备忘

发次 条目 slug 状态
第一发 531 Light My Cells 2 lightmycells2 已上线(rid 631)
第二发 532 TopBrain 2026 topbrain2026 已上线(rid 632)
第三发 533 CHIMERA chimera 本条
第四发 534 autoPET V autopetv(待核) 计划中——系列第五届,前作锚最强
第五发 535 OWL owl(待核) 计划中——元研究型挑战,DAIMS 第三种评分结构待建

五连完成后将输出《GC 挑战赛型条目生产总结》:四档可获取性光谱(注册墙/Zenodo/AWS Registry/待补)、任务族覆盖(分割/生成/生存/检测待补)、命名消歧案例集(CHIMERA 首例)——作为挑战赛型数据生产的模板终版。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • hest-1k — 共享标签:医学影像 / 病理图像 / 转录组 / 肿瘤学
  • leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • atlas-liver-tumor — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
  • cptac-imaging — 共享标签:医学影像 / 病理图像 / MRI / 肿瘤学
  • prostatex — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
  • pi-cai — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
  • hlca — 共享标签:医学影像 / 病理图像 / 转录组
  • panda — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • paip — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • promise12 — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集