信息速览
INFOBOX:chimera 速览
| 字段 | 值 |
|---|---|
| 数据集 | CHIMERA Challenge Training Data v2(AWS Open Data Registry 收录) |
| slug | chimera(GC 子域 chimera.grand-challenge.org 一致) |
| 全名展开 | Combining HIstology, Medical Imaging (Radiology), and molEcular Data for medical pRognosis and diAgnosis |
| 平台 | Grand Challenge——GC 五连第三发(多义名消歧条款首用) |
| 会议 | MICCAI 2025(2025-09 韩国大田,3,300+ 人史上最大)——结果 CHIMERA workshop 发布 |
| 主办 | Radboud UMC Computational Pathology Group(Geert Litjens/Nadieh Khalili)+ Erasmus MC + CHIMERA Consortium |
| 任务 | 三任务:T1 前列腺生化复发(生存)/T2 BCG 反应亚型(三分类)/T3 NMIBC 进展生存 |
| 模态 | 四模态异构融合:千兆像素 H&E WSI+mpMRI 三序列+bulk RNA-seq+结构化临床——本库模态维度之最 |
| 规模 | Task 1:267 例(801 MRI 序列+942 WSI,train 95/val 23/test 149);Task 2 v2 182 例;Task 3 v2 176 例;膀胱侧合并 368=182+176 ✓ |
| 结果 | 159 submissions/13 顶级模型;T1 最佳 C 0.7402(临床单模态)/T2 F1 0.73/T3 C 0.68 |
| 冠军 | TIA-Pegasus(Warwick TIA Centre)ModalSurv——C 0.7402(T1 第 1)/0.5740(T2/3 第 5),arXiv 2509.05037 |
| 方法论发现 | 临床单模态屠榜但随机化崩塌至 C≈0.50;多模态 withheld ΔC≤0.04 鲁棒——排行榜最高≠临床最实用 |
| baseline | UNI(病理)+nnU-Net v1(PI-CAI baseline 迁移,影像)+ABMIL(预测头)+minimal baseline template |
| 可获取性 | AWS Open Data:aws s3 sync --no-sign-request s3://chimera-challenge/ 无账户直下——挑战赛数据开放度最高档 |
| 许可 | CC BY-NC-SA 4.0(NC+SA 双限制——对照 LMC1 的 CC BY 4.0) |
| 学术出口 | 双 summary paper 已出(Task 1 arXiv 2608.21497 投 MedIA 38 页/Task 2+3 arXiv 2609.09510)+冠军论文——挑战赛最高档 |
| 续作 | CHIMERA-agent(MICCAI 2026 Abu Dhabi):agentic 推理轨迹+幻觉惩罚——302 participants |
| 伦理 | 知情同意科研使用明示;Radboud+Canisius Wilhelmina(T1)/Erasmus MC 系队列(T2/3);无 IRB 编号披露 |
| 一句话 | 泌尿肿瘤多模态预后的标准化起点——也是"多模态数据集组装有多难"的活教材 |
§0 摘要卡:四模态融合与屠榜悖论
§0.1 它是什么
CHIMERA 是 MICCAI 2025 挑战赛(Grand Challenge 平台):泌尿肿瘤多模态预后建模的三任务 benchmark,由 Radboud UMC 计算病理组(Geert Litjens 组)牵头、Erasmus MC 等 CHIMERA Consortium 联合主办。名字是缩写拼图——组织病理(HIstology)+医学影像(Medical Imaging)+分子数据(molEcular Data)→预后与诊断(pRognosis/diAgnosis),恰好拼成希腊神话喷火怪 CHIMERA。三个任务:Task 1 前列腺癌生化复发预测(mpMRI+H&E WSI+临床,267 例两机构,C-index);Task 2 高危非肌层浸润性膀胱癌(HR-NMIBC)的 BCG 反应亚型预测(H&E+临床→BRS1/2/3 三分类,weighted F1);Task 3 NMIBC 进展生存预测(Task 2+bulk RNA-seq,C-index)。训练集在 AWS Open Data Registry 无账户直下,验证/测试隐藏于 GC 注册墙——"训练全开放+评估黑盒"的挑战赛标准形态,也是本库首个生存分析/预后建模任务族与四模态异构融合之最。
§0.2 三个数字
- 267+368:Task 1 前列腺 267 例(801 MRI 序列/942 WSI/95+23+149 三划分闭合)+Task 2/3 膀胱 368 例(182+176 v2 例数代数自洽)——两癌种三任务六百余例多模态配对数据
- 0.7402 vs 0.50:Task 1 榜首 C-index(临床单模态)vs 临床变量随机化后的崩塌值——单模态屠榜的脆弱性;多模态模型同场景 ΔC≤0.04——**“排行榜最高≠临床最实用”**的官方定量注脚
- 132→182/126→176:Task 2/3 数据从 v1 到 v2 的扩容(各 +50 例 Cohort B)——v1 的 8 张问题切片清单直接公示(corrupted/spacing/失焦三类),数据 QC 透明度罕见样本
§0.3 它怎么用
四大用途:①多模态融合方法研究——四模态配对+官方 UNI/nnU-Net/ABMIL 三级 baseline+UNI embeddings 预提取(v2 附带),是融合架构(early/late/hybrid fusion、missing-modality 处理)的标准试验床;②生存分析方法学——C-index 端点+删失配对规则全公开(评估管线代码公开承诺);③全切片病理+影像联合建模——0.5 µm/pixel 千兆像素 WSI 与 3T MRI 的跨尺度配对;④挑战赛方法复现——冠军 ModalSurv 论文+双 summary paper 完整披露。不适合:膀胱癌影像分割(Task 2/3 无 MRI——影像仅在 Task 1)、细胞级分割(无像素级病灶标注)、临床部署(CC BY-NC-SA 非商业限制+无监管评估)。
§0.4 联动提示
本条是 GC 五连第三发(多义名消歧条款首用——GC 上并存 CHIMERA 与 CHIMERA-agent 两个挑战,§1.4 消歧表)。任务谱系里程碑:本库首个生存分析/预后建模条目(分类/检测/文本/生成/分割之外的第六任务族),评估指标从 Dice/AUC 转向 C-index。与 531/532 构成 GC 平台三级可获取性光谱(LMC2 注册墙→TopBrain Zenodo 直下→CHIMERA AWS 无账户直下);与 PI-CAI(若库内已收录)构成 baseline 迁移链——官方影像特征提取器就是 PI-CAI 的 nnU-Net 五折 ensemble 原封迁移。
§1 平台与谱系定位
§1.1 Grand Challenge 上的生态位
CHIMERA 上线于 Grand Challenge 平台(DIAG Nijmegen 运营,137,000+ 用户/420+ challenges/8,042 algorithms)——本库 GC 五连的第三发。平台生态位:计算病理组主做的多模态预后赛道,与其自家(Radboud DIAG)的 PI-CAI/LEOPARD/PANDA 构成泌尿肿瘤挑战矩阵——CHIMERA 是该矩阵中唯一的多模态融合任务,也是唯一同时覆盖两癌种(前列腺+膀胱)与两任务类型(生存+分类)的条目。
GC 平台二级分型落位:CHIMERA 属"开放数据+注册墙评估"混合型——训练集经 AWS Open Data Registry 全公开(无需账户),验证/测试仍走 GC Phase 注册墙;与 531 LMC2(训练也注册墙)和 532 TopBrain(Zenodo 直下+隐藏测试)构成三档光谱的中间偏开放档。
§1.2 缩写命名的结构主义
CHIMERA 的缩写是反向工程的范例——先有"多模态融合预后"的概念,再从概念词里抠字母拼出神话生物名:
| 碎片 | 来源词 | 贡献字母 |
|---|---|---|
| HI | HIstology 组织病理 | HI |
| M | Medical Imaging (Radiology) | M |
| E | molEcular Data 分子数据 | E |
| R | pRognosis 预后 | R |
| A | diAgnosis 诊断 | A |
神话层:奇美拉(Chimera)是狮头+羊身+蛇尾的复合怪物——**“三种异质部件拼成一个生物”**正是多模态融合的隐喻。冠军团队 TIA-Pegasus 的命名接住了这个梗(飞马 Pegasus 在神话中击败奇美拉)——挑战赛文化里的命名互文样本。
§1.3 多义名消歧(模板 v1.5 条款首用)
GC 平台上并存两个 CHIMERA 条目,检索时必须区分:
- CHIMERA(chimera.grand-challenge.org)——MICCAI 2025,三任务预后,数据在 AWS S3——本条对象
- CHIMERA-agent(chimera-agent.grand-challenge.org)——MICCAI 2026 续作,agentic 决策 benchmark,302 participants
判别锚三条:①GC 子域名;②数据载体(S3 桶 vs 报告 JSON);③评估形态(C-index/F1 vs 预测+推理轨迹双输出)。GC 首页的动态榜单数字(302/305)属于 agent 版——引用时不可混用。其他领域同名(神经科学 CHIMERA 小鼠模型/遗传学嵌合体)与本库无关但搜索时是强噪音源。
§1.4 与 MICCAI 挑战赛家族的关系
MICCAI 2025 挑战赛生态里,CHIMERA 的差异化:多数挑战赛做单任务单模态(分割/检测/分级),CHIMERA 做多任务多模态预后——task 设计本身就是消融实验(§3.4)。其"挑战赛+summary paper+冠军论文+AWS 归档"的四件套是 MICCAI 挑战赛生态的完整闭环样本——对照 LEOPARD(单模态病理、同端点)能看出多模态化的代价与收益。
§2 发布形态与学术出口
§2.1 发布形态五型落位
本库"完成发布形态"分类里,CHIMERA 属论文先行型的变体:双 summary paper 后置型——挑战赛 2025-04 开跑,summary paper 2026-08/09 才挂 arXiv(Task 1 38 页投 MedIA;Task 2+3 同期)——赛程与论文间隔 16 个月。对照:530 VinDr-SpineXR(论文先行)、529(悬空 4 年)、531 LMC2(在投)、532 TopBrain(NEJM AI 已发)。Radboud 系的发表纪录(Litjens 组)使"悬空"风险低——但 16 个月间隔提醒:挑战赛型数据的学术出口滞后是常态,引用时以 arXiv 版为准。
§2.2 学术出口清单
| 出口 | 状态 | 载体 |
|---|---|---|
| Task 1 summary paper | arXiv 2608.21497(2026-08-21)→ 投 MedIA | 38 页/3 图/3 补图 |
| Task 2+3 summary paper | arXiv 2609.09510(2026-09-10) | 挑战赛联盟署名(CHIMERA Challenge Consortium 集体作者) |
| ModalSurv 冠军论文 | arXiv 2509.05037(2025-09-08,更新 12-18) | 4 页 1 图 2 表 |
| 数据本体 | AWS Open Data Registry+GC 双注册 | ARN+Registry 元数据页 |
| baseline 代码 | GitHub DIAGNijmegen/CHIMERA | UNI+nnU-Net+ABMIL 全链 |
§2.3 引用规范
AWS Registry 给出的引用格式:“CHIMERA was accessed on DATE from https://registry.opendata.aws/chimera”——数据引用走 Registry,方法引用走 summary paper,冠军方法引用走 ModalSurv。三引分流清晰——AI-Ready 评估中"引用规范性"的高分结构。
§3 三任务定义深度解析
§3.1 Task 1:前列腺癌生化复发(BCR)预测——从 PSA 争议到多模态证据链
临床背景:生化复发(biochemical recurrence)定义为前列腺切除术后任何可检出的 PSA 水平(≥0.1 µg/L)加确认性升高——是无病生存的经典替代终点。但 GC 主页直言 PSA 是"有争议的生物标志物,预测生化复发的可靠性有限"——当前临床评估依赖临床与病理变量(Gleason 评分/pT 分期/切缘状态),缺乏多模态标准。CHIMERA 的答案:把**术前 mpMRI(宏观)与术后 H&E 病理切片(微观)**放进同一个预测任务,用深度学习同时提取两个尺度的预后信号。
数据构成(Task 1 页面+summary paper 双信源):
- 267 例患者,两机构(Radboud UMC + Canisius Wilhelmina Hospital,均为荷兰奈梅亨)
- 801 个 MRI 序列:Siemens 3T 扫描仪,三序列 T2 加权(T2W)+高 b 值扩散(HBV)+ADC 图——每例约 3 个序列;前列腺分割 mask 附带
- 942 张 WSI:3DHISTECH PANNORAMIC 1000 扫描,0.5 µm/pixel,每例多张(模拟真实前列腺切除标本的复杂性——“closely mimic the complexity of real-world prostatectomy specimens”);前景组织 mask 附带
- 临床变量:论文口径 13 个/例;页面表格实际 15 行(§5.3 口径差存照)
- 划分:train n=95 / validation n=23 / test n=149(95+23+149=267 ✓)——基线临床病理特征三划分间无显著差异(论文统计)
入组标准(四条全列):①mpMRI(T2W+ADC+高 b 值)可得且 2012 年后采集;②手术 2020 年前完成;③手术时+复发时 PSA 均可得;④患者知情同意科研使用。
任务形式:预测 time-to-BCR——BCR 患者输出手术到复发月数,非 BCR 患者输出手术到最近 PSA 测量的随访月数。Censored C-index 评估。
§3.2 Task 2:BCG 反应亚型(BRS)预测——全球稀缺药物的分层问题
临床背景:约 50% 的高危非肌层浸润性膀胱癌(HR-NMIBC)患者对卡介苗(BCG)膀胱灌注治疗无反应——而 BCG 是"全球稀缺资源"(GC 主页原文:“a globally scarce resource”)。 molecular RNA 分析已与高危治疗反应关联(STM 2023 论文的 BRS 分型)。早期决策需要不依赖测序的替代路径——CHIMERA 的 Task 2 问的是:H&E 形态学+常规临床变量能否预测 RNA-seq 定义的 BCG 反应亚型?
数据构成:
- v2 182 例(v1 132 例→v2 +50 例 Cohort B,§5 详述)
- H&E WSI:每例一张,最高分辨率 0.25 µm/pixel(注意:比 Task 1 的 0.5 µm/pixel 更细一档);组织 mask 附带
- 临床变量:11 个结构化字段(age/sex/smoking/tumor primary-or-recurrent/stage/grade/reTUR/LVI/variant/EORTC/no_instillations——§4.3 全表)
- 标签:BRS1/BRS2/BRS3——从 RNA-seq 导出的生物标志物定义 BCG 反应亚型(Reference Standard)
- 评估:weighted F1(三分类不平衡加权)
注意:Task 2 没有 RNA-seq 输入(RNA 是标签来源)也没有 MRI——模态组合与 Task 3 恰好构成消融对照:Task 3 = Task 2 + RNA-seq 输入 + 生存端点。
§3.3 Task 3:NMIBC 进展生存预测——形态学与分子的赛跑
任务定义:Task 2 的扩展——整合组织病理+转录组学预测 HR-NMIBC 患者 time-to-progression。GC 页面明确 RNA-seq 的空间来源:“RNA-seq data is derived from a selected tumor region within the histopathology slide”——测序区域与切片有三种配对情形:①相邻切片(adjacent section);②同一张 H&E 切片打孔取样(punched cavity);③同一患者的另一肿瘤的 H&E。
数据构成:
- v2 176 例(v1 126 例→+50 例 Cohort B;8 张问题切片与 Task 2 的编号平行——3A_024 corrupted/3A_017,031,042,050,141,143,157 spacing 错误/3A_025 失焦空白 mask 不可修复)
- H&E WSI + 组织 mask + bulk RNA-seq(DESeq2 归一化)+ 临床变量(同 Task 2 全表 + BRS 字段)
- 标签:progression 0/1 + time_to_prog_or_FUend(月)——进展或随访截止时间
- v2 附赠:UNI 0.25mpp 224×224 patch embeddings(.pt)+patch 坐标(.npy),经 slide2vec 管线提取——官方预提取特征直接送训练
- 评估:Censored C-index(删失配对规则 §6.1)
§3.4 三任务矩阵:一组设计精巧的消融实验
把三个任务并排看,会发现 CHIMERA 的任务设计本身就是一组受控对照:
| 维度 | Task 1 | Task 2 | Task 3 |
|---|---|---|---|
| 癌种 | 前列腺癌 | 膀胱癌 HR-NMIBC | 膀胱癌 HR-NMIBC |
| 端点类型 | 生存(time-to-BCR) | 分类(BRS1/2/3) | 生存(time-to-progression) |
| WSI | ✅ 每例多张 0.5mpp | ✅ 单张 0.25mpp | ✅ 单张 0.25mpp |
| MRI | ✅ 三序列 | ❌ | ❌ |
| RNA-seq | ❌ | ❌(作标签) | ✅ DESeq2 |
| 临床变量 | 13-15 个 | 11 个 | 11+BRS |
| 指标 | C-index | weighted F1 | C-index |
| 规模 | 267 例 | 182 例(v2) | 176 例(v2) |
Task 2 vs Task 3 隔离了 RNA-seq 输入的边际贡献;Task 1 vs Task 2/3 隔离了 影像模态+更大变量表 的作用。这种"挑战赛即消融"的设计在挑战赛文献中难得一见——大多数挑战赛只做一个任务(对照 PANDA/PI-CAI/LEOPARD 单任务形态)。
§4 数据本体:四模态的技术规格
§4.1 病理模态:千兆像素 WSI 的两种分辨率
- Task 1:0.5 µm/pixel(20× 物镜等效),3DHISTECH PANNORAMIC 1000 扫描仪,每例多张切片——前列腺切除标本的完整取样
- Task 2/3:0.25 µm/pixel(40× 等效)最高分辨率,单张/例——膀胱 TURB 标本
- 两者均附带二值组织 mask(_HE_mask.tif)——前景/背景分割预处理,避免千兆像素的白背景算力浪费
- v2 附带 UNI embeddings+patch 坐标——UNI 是 Mahmood Lab 的病理基础模型(HuggingFace MahmoodLab/UNI)
- 格式:TIFF(_HE.tif),金字塔存储
§4.2 影像模态:Siemens 3T mpMRI 三序列
- T2 加权(T2W)——解剖结构参考
- 高 b 值扩散加权(HBV)——细胞密度信号
- ADC 表观扩散系数图——扩散定量
- 前列腺分割 mask 附带(zone-level)——与 PI-CAI 的标注传统一致
- 801 序列/267 例 ≈ 3.0 序列/例——三序列齐备的标准配例
- 所有扫描 2012 年后采集(设备/协议时代一致性控制)
§4.3 临床模态:结构化变量全表
Task 1 页面 15 行(论文口径 13 个):
| 特征 | 类型 | 说明 |
|---|---|---|
| Age at prostatectomy | Integer | 手术时年龄 |
| Primary Gleason | Ordinal 1-5 | 最主要组织学模式 |
| Secondary Gleason | Ordinal 1-5 | 次主要模式 |
| Tertiary Gleason | Ordinal 1-5/NaN | 第三模式(<5% 肿瘤,提示侵袭性) |
| ISUP grading | Ordinal 1-5 | 由 Gleason 评分映射(EAU 指南) |
| PSA prior to surgery | Float µg/L | 术前 PSA;<0.10 记"<0.10"(非检出) |
| PSA at recurrence | Float µg/L | 复发时 PSA;同上 |
| BCR status | Binary 0/1 | 术后任一 PSA≥0.1 µg/L 定义 |
| pT-staging | String | 病理 T 分期(EAU 指南) |
| Lymph node invasion | 0/1/“x” | 淋巴结侵犯(x=未切除淋巴结) |
| Capsular penetration | 0/1/“x” | 包膜穿透(x=病理未评估) |
| Positive surgical margins | 0/1/2 | 切缘阳性(2=病理医师无法评估) |
| Seminal vesicle invasion | 0/1/“x” | 精囊侵犯(x=未切除) |
| Lymphovascular invasion | Binary 0/1 | 淋巴血管侵犯 |
| Earlier therapy | String | 既往前列腺癌治疗 |
Task 2/3 共用 11 变量(age/sex/smoking/tumor primary|recurrent/stage TaHG|T1HG|T2HG+T1m|T1e substage/grade G2|G3/reTUR/LVI/variant UCC|UCC+Variant/EORTC High|Highest risk/no_instillations(-1=缺失)),Task 3 另含 BRS 字段与 reference standard(progression 0/1+time_to_prog_or_FUend)。
三值编码 0/1/“x” 是本数据集的临床现实主义细节——"x"显式编码"未切除/未评估"信息缺失,区别于 0/1 的真实阴性/阳性;margin 的 “2” 同理。这类缺失编码在建模时是陷阱也是机会(§7.3 缺失感知建模)。
§4.4 分子模态:bulk RNA-seq 的队列结构
- DESeq2 归一化的 bulk RNA-seq(_RNA.json)
- 来源:WSI 上选定的肿瘤区域微切割测序
- Cohort A(3A 前缀)vs Cohort B(3B 前缀):Cohort B 50 例来自 STM 2023 论文(de Jong FC et al., Sci Transl Med 15(697):eabn4118)队列,测序协议与 Cohort A 不同且未做批次效应校正——页面明示。这是数据集诚实披露的典范,也是使用者的必读警告(跨队列分析需自行处理)
- BRS 标签即从此 RNA 数据导出(Biomarker-derived BCG Response Subtype)
§4.5 存储结构:S3 桶与文件命名
s3://chimera-challenge/(us-west-2,no-sign-request)
v2/
task1/ data/ {patient_id}/{patient_id}_*.tif|json + quality_control.csv
task2/ data/ + features/coordinates/*.npy + features/*.pt
task3/ data/ + features/coordinates/*.npy + features/*.pt
每例一个文件夹(_CD.json 临床+_HE.tif 切片+_HE_mask.tif 组织 mask[_RNA.json 转录组]);features/ 是 v2 新增的 UNI 预提取产物。AWS Open Data Registry 收录页给出 ARN arn:aws:s3:::chimera-challenge——注册页+文档页+引用格式齐备。
§5 数据版本演化与质量透明
§5.1 v1→v2 演化全记录
| 版本 | Task 2 | Task 3 | 变化 |
|---|---|---|---|
| v1(2025-04-10 随赛发布) | 132 例 | 126 例 | 首发;含 8 张问题切片 |
| v2(挑战赛期间) | 182 例 | 176 例 | +50 例 Cohort B(3B);修复 7 张 spacing+1 张 corrupted;2A/3A_025 失焦不可修复保留;新增 UNI embeddings+patch 坐标;_CD.json 全量更新对齐 val/test 特征集 |
- 2025-06-08 修复存照:v2 的 _CD.json 缺失 progression 参数——发现后修正重传 AWS(页面 UPDATE 记录)
- v1 问题切片清单直接公示:Task 2 的 2A_024(corrupted)/2A_017, 031, 042, 050, 141, 143, 157(spacing 错误)/2A_025(失焦→空白 mask,不可修复);Task 3 的 3A_* 编号镜像同款——挑战赛页面主动列数据缺陷清单的做法在挑战赛实践中罕见(对照 530 VinDr-SpineXR 的页面拼写事故被动考古,CHIMERA 是主动透明)
- task{n}_quality_control.csv 随数据发布——QC 结果结构化交付
§5.2 Cohort A/B 的批次陷阱
Cohort B 的加入让 Task 3 的 RNA 数据天然带双协议结构:3A(原队列)与 3B(STM 2023 队列)测序协议不同、未做批次调整。官方只提示"no batch effect adjustment was performed on these 2 cohorts"——对参赛者是噪音源,对方法研究者是现成的域移/批次效应测试床。后挑战分析发现"cohort-dependent performance degradation"(队列依赖性能退化)——模型在两队列上的表现差异是 Task 2+3 论文的核心发现之一。
§5.3 页面 vs 论文的口径差存照
- 临床变量数:论文摘要 “13 clinical variables per case” vs Task 1 页面表格 15 行——差异或因 BCR status(标签)与 PSA at recurrence(与 BCR 定义耦合)的统计归类不同;引用时双口径并注
- GitHub README 的 Task 3 描述截断:“clinical dat”——原文应为 clinical data(排版截断,非内容分歧)
- 主页 NIBC/NMIBC 混用:GC 主页 “Why CHIMERA?” 写 “non-invasive bladder cancer (NIBC)”,Challenge Scope 写 “Non-Invasive Bladder Cancer (NMIBC)”——标准术语为 NMIBC(non-muscle-invasive,非肌层浸润);“non-invasive” 直译"非浸润"是不严谨缩写。同一页面两个缩写指同一人群——页面考古·术语漂移形态
§6 评估体系:C-index 的删失几何学
§6.1 Censored C-index 完整规则(GC 页面原文五条)
- 模型性能用删失一致性指数(censored concordance index)评估——所有可比患者对中预测顺序正确的比例
- 两患者可比当且仅当:①两人都发生事件但时间不同;②一人发生事件、另一人无事件但随访观察时间更长
- 两人在同一时间发生事件→不可比(排除)
- 预测风险分更高者实际生存时间更短→该对为 concordant(正确排序)
- C-index 范围:0.5=随机预测;1.0=完美一致
评估管线(含 C-index 计算代码)承诺公开——“to ensure transparency and reproducibility”。
§6.2 指标矩阵的方法学意义
- Task 1/3 用生存指标、Task 2 用分类指标——同一数据集内双指标体系,评估代码需同时支持删失配对与加权 F1
- 删失规则的第 2 条(无事件但随访更长者与事件者可比)是生存分析标准处理——但挑战赛场景下经常被参赛者误解(ModalSurv 论文详述其实现细节)
- weighted F1 处理 BRS 三分类不平衡——STM 2023 的 BRS 分布天然不均
§6.3 提交机制与平台流程
- 时间线四节点(含两处删除线修订):Announcement+Training Release 2025-04-10 → Validation Phase
06-0106-13 → Test Deadline08-0108-22 AOE → 结果在 MICCAI 2025 CHIMERA workshop 公布 - 验证阶段与测试阶段的 GC Phase 机制(注册墙+黑盒评估)——159 submissions(Task 2+3 论文口径)/13 个顶级模型入选最终 benchmark
- minimal baseline template(github.com/nadieh/CHIMERA_minimal_baseline)——最低成本参赛路径
§7 结果与后挑战分析:屠榜悖论的三层证据
§7.1 榜面成绩
| 任务 | 最佳成绩 | 最佳模型类型 |
|---|---|---|
| Task 1 | C-index 0.7402 | 单模态临床变量模型 |
| Task 2(BRS) | weighted F1 0.73 | 多模态/病理模型 |
| Task 3(进展) | C-index 0.68 | 多模态模型 |
| 冠军 ModalSurv | T1 C 0.7402(第 1)/T2-3 C 0.5740(第 5) | 跨注意力融合多模态生存框架 |
Task 1 冠军是临床变量单模态模型——不是多模态。三任务横向结论(Warwick 新闻):“Across the three CHIMERA tasks, models based on clinical data still performed best.”
§7.2 ModalSurv:冠军方法与它的自我怀疑
TIA-Pegasus(Warwick TIA Centre,Noorul Wahab 领队;成员 Jiaqi Lv/Ethar Alzaid/Adam Shephard/Shan E Ahmed Raza)的 ModalSurv:模态专用投影+跨注意力融合的临床/MRI/病理/RNA 生存建模框架。论文(arXiv 2509.05037,4 页)标题即自我怀疑:“Investigating opportunities and limitations of multimodal deep survival learning”——核心结论三条:①外部测试集上临床单模态击败多模态(“clinical features alone outperformed multimodal models on external tests”);②局部验证多模态有增益但泛化受限(“Local validation showed multimodal gains but limited generalisation”);③病因诊断:多模态对齐不足+潜在过拟合。团队命名梗:Pegasus 是希腊神话中击败 Chimera 的有翼飞马——挑战赛名与队名构成神话互文。
§7.3 官方后挑战分析:把悖论变成设计原则
Task 1 summary paper(arXiv 2608.21497)的 post-challenge analyses 是本条目最具方法学价值的部分:
- 随机化实验:把 clinician-derived 变量随机打乱→单模态临床模型崩塌至 C≈0.50(chance 水平)——榜首模型的信号完全来自结构化变量的完整性
- ** withholding 实验**:完整删除临床变量→多模态模型仅 ΔC≤0.04——多模态模型能直接从影像恢复预后信号
- 结论表述(论文摘要原文):“Although models using only patient characteristics and clinician-derived variables yielded the highest leaderboard performance, multimodal models demonstrated greater robustness in clinically realistic scenarios where complete expert annotation is not guaranteed.”
- Task 2+3 论文的对应发现:任务依赖的模态贡献(BRS 中病理可部分补偿病理科医生衍生结构变量);progression 模型更依赖互补输入;T1 substage 与跨架构一致难例相关——患者级预测失败的系统分析(“patient-level prediction failure”)
- 方法学启示:挑战赛榜单只回答"谁在完整数据上最高";CHIMERA 的后挑战分析回答"谁的信号更抗缺失"——缺失感知建模(missingness-aware modeling)与多机构独立验证被论文列为领域刚需。这套"随机化/删除"双重压力测试范式可直接移植到任何多模态 benchmark 的评估协议
§7.4 参与度存照
- 159 submissions(Task 2+3)/13 个顶级模型入选——组织方逐模型 benchmark
- CHIMERA-agent 续作(2026)首期数字:302 participants/305 submissions(Debug phase 至 2026-12-18)——续作热度约为原版膀胱任务的 2 倍量级(agent 范式+LLM 时代红利)
- 原版挑战赛参与团队数 GC 主页未静态披露(动态渲染未获数——与 531 LMC2 同款页面行为,不混用 agent 版数字)
§8 baseline 技术链与复现路径
§8.1 三级特征-预测架构
WSI ──→ UNI(MahmoodLab/HF)──→ patch embeddings ─┐
├─→ ABMIL ──→ 风险/类别
MRI ──→ nnU-Net v1(PI-CAI 五折迁移)──→ 影像特征 ──┤
│
clinical/RNA ──→ 结构化编码 ────────────────────────┘
- UNI:病理基础模型(0.25mpp/224×224 patch),v2 数据直接附带提取产物(.pt+.npy)——不重复算力
- nnU-Net v1:影像特征提取器就是 PI-CAI 挑战赛的 nnU-Net baseline ensemble 原封迁移(DIAGNijmegen/picai_nnunet_semi_supervised_gc_algorithm 的 Task2203_picai_baseline 五折 plans.pkl+model_best.model)——GC 生态内挑战赛资产复用的直接样本
- ABMIL:attention-based multiple instance learning 预测头——三任务各一,不提供预训练权重,需自行训练(README 明示)
- 另有 minimal baseline template(github.com/nadieh/CHIMERA_minimal_baseline)——参赛最小路径
§8.2 复现清单
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/(task2/task3 同式)——无需 AWS 账户- 下载 UNI 权重(HuggingFace,需同意条款)+PI-CAI nnU-Net 权重(GitHub 直链)
- 按 task1_baseline/README 训练 ABMIL→放置 common/model/ 目录
- 评估:C-index 计算代码公开承诺(Task 1/3)+weighted F1(Task 2)
- 质量控制:task{n}_quality_control.csv 逐例核对
§8.3 公共数据推荐链(官方钦定)
Task 1 页面 Public Data 节点名四个预训练/增强数据源:
- LEOPARD(GC 平台):“strongly recommend”——H&E WSI time-to-BCR 预测挑战,与 Task 1 端点同型,可训练可预训练
- PI-CAI(GC 平台)——mpMRI 前列腺癌检测(同时也是 baseline 权重来源——双重角色)
- PANDA(GC 平台)——前列腺 Gleason 分级(WSI)
- TCGA-PRAD(TCIA)——前列腺腺癌组织病理+基因组
四个推荐全是泌尿肿瘤 GC/公开生态的核心资产——CHIMERA 在文档里把自己织进这张网(LEOPARD→PI-CAI→PANDA→TCGA-PRAD→CHIMERA 的数据谱系),这是挑战赛型条目"生态位自觉"的样本。
§9 伦理、许可与可获取性
§9.1 伦理轴:公开数据二次整合型
- 知情同意明示:Task 1 入组标准第 4 条"Patients provided consent for the use of their data for scientific research"——患者级同意是入组硬条件
- 机构轴:Task 1 两机构(Radboud UMC+Canisius Wilhelmina Hospital);Task 2/3 队列源自已发表 STM 2023 研究(Cohort A/B,Erasmus MC 系)
- 无独立 IRB 编号披露:页面与两篇 summary paper 摘要均未见审批号——对照 528-530 的 IRB 明文型(H108+HMUH 双 IRB)与 532 的 UZH IRB,CHIMERA 属"同意明示+审批号缺席"档
- 病例时间窗:MRI>2012/手术<2020(Task 1)——十年窗的时代一致性控制
§9.2 许可:CC BY-NC-SA 4.0 的双限制
- NC(非商业)+SA(相同方式共享)——对照 LMC1 的 CC BY 4.0(仅署名)与 529 的 Restricted 签约墙,CHIMERA 位于中间档:学术使用自由,商业使用被排除,衍生数据集必须同许可共享
- 对 LLM 训练语料化的含义:NC 条款下商用模型训练需单独授权——AI-Ready 评估中"许可开放度"维度的显著扣分项(但比 529 的签约墙仍高一档)
§9.3 可获取性:挑战赛数据开放度最高档
- AWS Open Data Registry 收录——
aws s3 ls --no-sign-request s3://chimera-challenge/无需 AWS 账户;官方 CLI 命令直接印在页面 - Registry 页元数据完备:描述/更新频率(As required)/许可/文档链/管理方/联系人/引用格式/ARN/Region
- 训练集全开放+validation/test 隐藏(GC 注册墙)——与 TopBrain 的 Zenodo 直下同型,但 CHIMERA 多了 AWS Open Data 这层官方注册(发现性+引用规范性加分)
- GC 五连可获取性光谱落位:LMC2(注册墙+黑盒)→ TopBrain(Zenodo 直下)→ CHIMERA(AWS Open Data 无账户直下)——三档梯度是挑战赛型条目可获取性分级的现成标尺
FAQ:30 问直答
Q1:CHIMERA 是什么的缩写?
Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis——组织病理+影像+分子数据融合做预后与诊断,缩写恰好拼出希腊神话喷火怪。
Q2:谁主办的?
Radboud University Medical Center 计算病理组(Computational Pathology Group)牵头,Geert Litjens 与 Nadieh Khalili 领衔,联合 Erasmus MC、Canisius Wilhelmina Hospital 等 CHIMERA Consortium 成员。
Q3:哪一届会议?
MICCAI 2025(2025 年 9 月,韩国大田),结果在 CHIMERA workshop 公布。续作 CHIMERA-agent 对接 MICCAI 2026(Abu Dhabi)。
Q4:三个任务分别做什么?
Task 1:前列腺癌生化复发时间预测(mpMRI+H&E+临床,C-index);Task 2:高危 NMIBC 的 BCG 反应亚型三分类(H&E+临床→BRS1/2/3,weighted F1);Task 3:NMIBC 进展生存(Task 2+RNA-seq,C-index)。
Q5:数据规模多大?
Task 1 前列腺 267 例(801 MRI 序列+942 WSI,train 95/val 23/test 149);Task 2 v2 182 例;Task 3 v2 176 例;膀胱侧合并论文口径 368 例=182+176。
Q6:怎么下载?
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ <目标路径>——无需 AWS 账户(AWS Open Data Registry 收录,us-west-2)。训练集全开放,验证/测试隐藏。
Q7:什么许可?
CC BY-NC-SA 4.0——署名+非商业+相同方式共享。学术自由使用;商用被 NC 条款排除;衍生数据须同许可。
Q8:为什么临床单模态反而拿了第一?
Task 1 榜首 C-index 0.7402 来自只用了临床变量的模型——Gleason/分期/PSA 等结构化变量本身就是强预后因子,267 例的小样本下深度多模态融合难以兑现增益。
Q9:那多模态还有什么用?
官方后挑战分析:把临床变量随机化后,单模态崩塌至 C≈0.50;删除临床变量后多模态只掉 ΔC≤0.04——多模态模型能直接从影像恢复预后信号,在"专家标注不全"的现实场景里更鲁棒。
Q10:ModalSurv 是什么?
Task 1 冠军模型(Warwick TIA Centre 的 TIA-Pegasus 团队,Noorul Wahab 领队):模态专用投影+跨注意力融合的多模态生存框架,C 0.7402(第 1);其论文 arXiv 2509.05037 自证外部测试集上临床单模态更强。
Q11:BRS 是什么?
Biomarker-derived BCG Response Subtype——从 RNA-seq 数据导出的 BCG 治疗反应亚型(BRS1/2/3),源自 de Jong FC 等 STM 2023 论文(eabn4118)的分型体系。
Q12:Task 2 和 Task 3 数据是同一批患者吗?
基本是——两任务的问题切片编号平行(2A_024 vs 3A_024 同款损坏),Task 3 = Task 2 患者池+RNA-seq+生存端点。规模差(182 vs 176)来自 RNA 配对要求。
Q13:Cohort A/B 是什么?为什么重要?
v2 新增的 50 例来自 STM 2023 的队列(3B 前缀),测序协议与原队列(3A)不同且未做批次效应校正——跨队列建模需自行处理,也是现成的批次效应测试床。
Q14:v1 和 v2 有什么区别?
v2 修复了 v1 的 7 张 spacing 错误+1 张 corrupted 切片(2A/3A_025 失焦保留);新增 Cohort B 50 例;附送 UNI patch embeddings 与坐标;_CD.json 字段对齐验证/测试集(2025-06-08 还修过一次缺失 progression 参数)。
Q15:baseline 用了什么模型?
UNI(病理特征)+nnU-Net v1(影像特征——直接迁移 PI-CAI 挑战赛五折 ensemble 权重)+ABMIL(预测头,需自行训练)。另有 minimal baseline template。
Q16:CT 有吗?
没有——Task 1 影像只有 mpMRI 三序列(T2W/HBV/ADC)。
Q17:为什么 Task 2/3 没有 MRI?
膀胱癌(TURBT 标本)临床路径以病理+分子为核心,影像不是常规决策输入——模态组合反映真实临床信息结构,这正是"挑战赛即消融"设计的一部分。
Q18:临床变量有哪些?
Task 1 论文口径 13 个/例(页面表 15 行):年龄、三级 Gleason、ISUP、术前/复发 PSA、BCR 状态、pT 分期、淋巴结/包膜/精囊/淋巴血管侵犯、切缘、既往治疗。Task 2/3 共用 11 个(含 EORTC 风险、BCG 灌注次数等)。
Q19:缺失值怎么编码的?
三值编码 0/1/“x”(x=未切除/未评估);切缘 2=病理医师无法评估;no_instillations 用 -1 标记缺失;PSA<0.10 µg/L 记"<0.10"。建模时别把 “x” 当数值。
Q20:WSI 什么规格?
Task 1:0.5 µm/pixel,3DHISTECH PANNORAMIC 1000,每例多张;Task 2/3:0.25 µm/pixel 最高分辨率,单张/例。均附二值组织 mask。
Q21:RNA-seq 怎么和 WSI 配对的?
三种情形:相邻切片/同一张 H&E 打孔取样/同一患者另一肿瘤的 H&E——页面明示,做空间映射时需留意。
Q22:C-index 怎么算的?
删失一致性指数:两患者可比=都发生事件但时间不同,或一人发生事件另一人无事件但随访更长;预测风险高者实际时间短=concordant;0.5 随机、1.0 完美。计算代码公开承诺。
Q23:数据质量如何保证?
官方直接公示 v1 问题切片清单(corrupted/spacing/失焦三类逐例列出)+task{n}_quality_control.csv 随数据发布+修过的坑(_CD.json 缺参数)在页面留 UPDATE 记录——QC 透明度罕见。
Q24:官方论文发了没有?
两篇 summary paper 都在:Task 1(arXiv 2608.21497,38 页,投稿 Medical Image Analysis);Task 2+3(arXiv 2609.09510)。冠军论文 ModalSurv(arXiv 2509.05037)——挑战赛学术出口最高档。
Q25:CHIMERA-agent 是什么?和本条目什么关系?
2026 年续作(MICCAI 2026 Abu Dhabi):前列腺癌患者旅程三决策点的 agentic benchmark——要求提交结构化推理轨迹、幻觉推理被惩罚、编排预训练基础模型而非从头训练。数据与任务形态完全不同,是两条 GC 条目(首期 302 participants/305 submissions)。
Q26:能用于 LLM/基础模型训练吗?
文本与结构化数据可以(注意 CC BY-NC-SA 的 NC 条款限制商用);千兆像素 WSI 与 MRI 属重模态,更适合训练专用编码器;v2 附带的 UNI embeddings 是省算力的替代路径。
Q27:跟 PANDA/PI-CAI/LEOPARD 什么关系?
官方钦定的预训练数据链:LEOPARD(同为 H&E time-to-BCR,“strongly recommend”)→PI-CAI(MRI 检测,也是 baseline 权重来源)→PANDA(Gleason 分级)→TCGA-PRAD。CHIMERA 把自己定位为这条泌尿肿瘤生态链的多模态终点。
Q28:参与情况如何?
Task 2+3 共 159 submissions、13 个顶级模型入选官方 benchmark;agent 续作首期 302 participants——原版挑战赛团队数页面未静态披露。
Q29:最佳成绩是多少?
Task 1 C 0.7402(临床单模态)/Task 2 weighted F1 0.73/Task 3 C 0.68——三任务无一超过 0.75,泌尿肿瘤多模态预后的天花板还很远。
Q30:适合做什么、不适合做什么?
适合:多模态融合架构研究、生存分析方法学、缺失模态鲁棒性、批次效应测试、病理-影像跨尺度建模。不适合:膀胱癌影像分割(无 MRI)、细胞级分割(无像素标注)、临床部署(NC 许可+无监管评估)。
事实清单:36 条硬事实+8 条口径注
硬事实(F1-F36)
| # | 事实 | 信源 |
|---|---|---|
| F1 | 全名展开 Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis | GC 主页 |
| F2 | MICCAI 2025 挑战赛,结果 CHIMERA workshop 发布 | 论文摘要/LinkedIn |
| F3 | 主办 Radboud UMC Computational Pathology Group | AWS Registry/GC |
| F4 | 组织牵头 Nadieh Khalili+Geert Litjens | Warwick 新闻/论文 |
| F5 | Announcement+Training Release 2025-04-10 | GC 主页 |
| F6 | Validation Phase 06-01 划改 06-13;Test Deadline 08-01 划改 08-22 AOE | GC 主页删除线 |
| F7 | Task 1:267 patients/两机构 | 论文摘要 |
| F8 | Task 1:801 MRI sequences | 论文摘要 |
| F9 | Task 1:942 WSIs | 论文摘要 |
| F10 | Task 1:13 clinical variables per case(论文口径) | 论文摘要 |
| F11 | Task 1 划分 95/23/149 | 论文摘要 |
| F12 | Task 1 划分间基线无显著差异 | 论文摘要 |
| F13 | Task 1 mpMRI=Siemens 3T,T2W+HBV+ADC 三序列 | Task 1 页面 |
| F14 | Task 1 WSI=3DHISTECH PANNORAMIC 1000,0.5 µm/pixel | Task 1 页面 |
| F15 | Task 1 入组四条:MRI>2012/手术<2020/双 PSA/知情同意 | Task 1 页面 |
| F16 | Task 1 最佳 test C-index 0.7402(单模态临床) | 论文摘要 |
| F17 | 临床变量随机化→单模态崩塌 C≈0.50 | 论文摘要 |
| F18 | 多模态 withheld→ΔC≤0.04 | 论文摘要 |
| F19 | “first public, standardized multimodal benchmark for prostate cancer prognosis” | 论文摘要原文 |
| F20 | Task 2 v1 132→v2 182 例 | Task 2 页面 |
| F21 | Task 3 v1 126→v2 176 例 | Task 3 页面 |
| F22 | Task 2+3 合并 368 patients/159 submissions/13 models | arXiv 2609.09510 |
| F23 | Task 2 最佳 weighted F1 0.73/Task 3 最佳 C 0.68 | arXiv 2609.09510 |
| F24 | BRS1/2/3 标签源自 RNA-seq(STM 2023 eabn4118) | Task 2/3 页面 |
| F25 | Cohort B 50 例测序协议不同、未做批次校正 | Task 3 页面明示 |
| F26 | v1 问题切片清单逐例公示(2A/3A_024 等 8 张) | Task 2/3 页面 |
| F27 | _CD.json progression 缺失修复 UPDATE 2025-06-08 | Task 3 页面 |
| F28 | v2 附 UNI 0.25mpp 224×224 embeddings(slide2vec) | Task 2/3 页面 |
| F29 | baseline=UNI+nnU-Net v1(PI-CAI 迁移)+ABMIL | GitHub DIAGNijmegen/CHIMERA |
| F30 | PI-CAI nnU-Net 权重五折 plans.pkl+model_best.model 迁移 | GitHub README |
| F31 | 冠军 TIA-Pegasus(Warwick)ModalSurv:T1 第 1(C 0.7402)/T2-3 第 5(0.5740) | Warwick 新闻/arXiv 2509.05037 |
| F32 | “clinical features alone outperformed multimodal models on external tests” | ModalSurv 摘要原文 |
| F33 | S3:arn:aws:s3:::chimera-challenge(us-west-2,no-sign-request) | AWS Registry |
| F34 | 许可 CC BY-NC-SA 4.0 | AWS Registry |
| F35 | Task 1 summary paper arXiv 2608.21497(38 页,投稿 MedIA,2026-08-21) | arXiv |
| F36 | CHIMERA-agent(MICCAI 2026 Abu Dhabi,10-01 半天 workshop):302 participants/305 submissions | agent GC 主页/GC 首页 |
口径注(N1-N8)
| # | 注 | 处理 |
|---|---|---|
| N1 | 临床变量数:论文 13 vs 页面表 15 行 | 双口径并注(归类差异或含标签项) |
| N2 | NIBC(主页 Why 节)vs NMIBC(Scope 节)同页混用 | 以 NMIBC 为准,注明术语漂移 |
| N3 | 时间线两处删除线修订(06-01→06-13/08-01→08-22) | 以划改后为准 |
| N4 | GitHub README Task 3 描述 “clinical dat” 截断 | 依上下文补全 clinical data |
| N5 | 原版参与团队数页面未静态披露(302/305 是 agent 版) | 不混用;存照 |
| N6 | Task 2 182 vs Task 3 176 差 6 例 | RNA 配对要求所致(页面明示三种配对情形) |
| N7 | 队列归属:Task 2/3 机构链依 STM 2023 作者群(Erasmus MC 系)推定 | 论文正文可再核 |
| N8 | IRB 编号未见(同意明示) | 伦理轴按"同意明示+审批号缺席"档记录 |
术语表:40 条
| 术语 | 释义 |
|---|---|
| CHIMERA | 本挑战赛缩写名;亦为希腊神话狮头羊身蛇尾喷火怪 |
| CHIMERA-agent | 2026 续作:agentic 多模态推理 benchmark(MICCAI 2026) |
| BCR | Biochemical Recurrence 生化复发:术后 PSA≥0.1 µg/L 的确认性升高 |
| BRS | BCG Response Subtype:RNA-seq 导出的 BCG 反应亚型(BRS1/2/3) |
| NMIBC | Non-Muscle-Invasive Bladder Cancer 非肌层浸润性膀胱癌 |
| HR-NMIBC | 高危 NMIBC——Task 2/3 的人群限定 |
| BCG | Bacillus Calmette-Guérin 卡介苗膀胱灌注:NMIBC 标准治疗,全球稀缺 |
| C-index | 一致性指数:可比患者对中风险排序正确比例;0.5 随机 1.0 完美 |
| Censored | 删失:随访截止未发生事件的观测——生存分析核心概念 |
| weighted F1 | 类不平衡加权的 F1 分数(Task 2 指标) |
| WSI | Whole Slide Image 全切片数字扫描图像(千兆像素级) |
| mpMRI | multiparametric MRI 多参数磁共振:T2W+HBV+ADC 组合 |
| HBV | High b-Value diffusion 高 b 值扩散加权序列 |
| ADC | Apparent Diffusion Coefficient 表观扩散系数图 |
| Gleason 评分 | 前列腺癌组织学分级(Primary+Secondary 模式相加) |
| Tertiary Gleason | 第三模式:<5% 肿瘤量的第三种模式,提示侵袭性 |
| ISUP | 国际泌尿病理学会:Gleason→Grade Group 映射标准 |
| pT-staging | 病理 T 分期:肿瘤解剖侵犯范围 |
| 切缘阳性 | 手术墨染边缘见癌细胞——复发强预测因子 |
| LVI | Lymphovascular Invasion 淋巴血管侵犯 |
| EORTC | 欧洲癌症研究与治疗组织:NMIBC 风险分层表出处 |
| reTUR | 再次经尿道切除:BCG 前的二次 TURBT |
| UNI | Mahmood Lab 病理基础模型(HuggingFace)——官方病理特征提取器 |
| nnU-Net | 自适应医学图像分割框架;v1 五折 ensemble 从 PI-CAI 迁移 |
| ABMIL | Attention-Based Multiple Instance Learning:弱监督聚合预测头 |
| slide2vec | WSI→向量表征管线(v2 embeddings 提取所用) |
| DESeq2 | RNA-seq 归一化方法(负二项模型) |
| bulk RNA-seq | 组织块级转录组测序(对照单细胞) |
| Cohort A/B | Task 3 RNA 双队列:3A 原队列 vs 3B STM 2023 队列(协议不同) |
| 微切割 | 从 WSI 选定肿瘤区域取材测序——RNA 的空间来源 |
| LEOPARD | GC 平台 H&E WSI time-to-BCR 挑战(Task 1 官方推荐预训练源) |
| PI-CAI | GC 平台 mpMRI 前列腺癌检测挑战(baseline 权重来源) |
| PANDA | GC 平台前列腺 Gleason 分级挑战(推荐预训练源) |
| TCGA-PRAD | TCGA 前列腺腺癌队列(推荐预训练源) |
| PANNORAMIC 1000 | 3DHISTECH 数字病理扫描仪(Task 1 用) |
| Radboud UMC | 拉德堡德大学医学中心(奈梅亨)——主办与 Task 1 主队 |
| Erasmus MC | 伊拉斯姆斯医学中心(鹿特丹)——膀胱队列与 Task 2/3 论文主力 |
| Canisius Wilhelmina Hospital | 奈梅亨坎西斯-威廉米娜医院——Task 1 第二机构 |
| TIA Centre | Warwick 大学组织图像分析中心——Task 1 冠军队所在 |
| ModalSurv | 冠军模型:模态投影+跨注意力融合生存框架(arXiv 2509.05037) |
附录
附录 A:三任务数据字典(逐字段)
Task 1 患者文件夹(s3://chimera-challenge/v2/task1/data/{patient_id}/):
| 字段 | 类型 | 内容 |
|---|---|---|
| {id}_HE*.tif | WSI TIFF | H&E 全切片(0.5mpp,每例多张) |
| {id}_HE*_mask.tif | 二值 TIFF | 组织前景 mask |
| {id}MR*.mha/nrrd | MRI 体数据 | T2W/HBV/ADC 三序列 |
| {id}_MR_mask | 分割 | 前列腺 zone mask |
| {id}_CD.json | JSON | 临床变量(13-15 字段) |
Task 2(v2/task2/):{id}_HE.tif+{id}_HE_mask.tif+{id}_CD.json;features/coordinates/{id}_HE.npy+features/{id}_HE.pt(UNI 0.25mpp 224×224)
Task 3(v2/task3/):Task 2 全部+{id}_RNA.json(DESeq2 bulk RNA-seq);_CD.json 含 BRS+progression+time_to_prog_or_FUend
QC 交付:task{1,2,3}_quality_control.csv
附录 B:AWS 下载复现命令
# 无需 AWS 账户——no-sign-request
aws s3 ls --no-sign-request s3://chimera-challenge/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ ./chimera/task1/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task2/ ./chimera/task2/
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task3/ ./chimera/task3/
# baseline 权重(两处外部下载)
# 1) UNI: huggingface.co/MahmoodLab/UNI → model.bin + config.json
# 2) PI-CAI nnU-Net 五折: github.com/DIAGNijmegen/picai_nnunet_semi_supervised_gc_algorithm
# → Task2203_picai_baseline/nnUNetTrainerV2_Loss_FL_and_CE_checkpoints__nnUNetPlansv2.1
# → plans.pkl + 各 fold_*/model_best.model
# ABMIL:不提供预训练——按 task{1,2,3}_baseline/README.md 自行训练
# 评估:C-index 计算代码公开承诺(GC 评估管线)
附录 C:最小 PyTorch 生存头示例(ABMIL 风格)
import torch, torch.nn as nn
class AttnMIL(nn.Module):
# CHIMERA 官方 baseline 的 ABMIL 预测头风格实现
def __init__(self, in_dim=1024, hid=256, p=0.25):
super().__init__()
self.feat = nn.Sequential(nn.Linear(in_dim, hid), nn.ReLU(), nn.Dropout(p))
self.attn = nn.Sequential(nn.Linear(hid, 1)) # patch 级注意力
self.risk = nn.Linear(hid, 1) # Cox 风险分(无激活)
def forward(self, bags, mask):
# bags: [B, N, D] 每例 N 个 patch embedding;mask: [B, N] 有效位
h = self.feat(bags) # [B, N, H]
a = self.attn(h).squeeze(-1) # [B, N]
a = a.masked_fill(~mask, float("-inf"))
a = torch.softmax(a, dim=1) # 注意力归一化
z = (a.unsqueeze(-1) * h).sum(1) # [B, H] 聚合
return self.risk(z).squeeze(-1) # [B] 风险分
# 训练目标:Cox partial likelihood(配对 concordance 的可微代理)
def cox_loss(risk, event, time):
# risk: [B] event: [B] 0/1 time: [B]
order = torch.argsort(time, descending=True) # 风险集排序
risk = risk[order]; event = event[order]
log_cum = torch.logcumsumexp(risk, dim=0) # 风险集 log 累积
return -( (risk - log_cum) * event ).sum() / event.sum().clamp(min=1)
# 评估:删失 C-index 按 GC 规则——可比对=(双事件不同时)|(单事件+更长随访)
附录 D:挑战赛家族与泌尿生态对照表
| 挑战赛 | 平台 | 任务 | 模态 | 规模 | 指标 | 与 CHIMERA 关系 |
|---|---|---|---|---|---|---|
| PANDA | GC | Gleason 分级 | WSI | ~1 万例 | QWK | 预训练推荐源 |
| PI-CAI | GC | csPCa 检测 | mpMRI+PSA | 10K+ | AUROC | 预训练源+baseline 权重出处 |
| LEOPARD | GC | time-to-BCR | WSI | 数千例 | C-index | 端点同型的单模态前作 |
| CHIMERA | GC | 三任务预后 | WSI+MRI+RNA+临床 | 635 例 | C-index/F1 | 本条 |
| CHIMERA-agent | GC | 三决策点 agentic | 报告+变量 JSON | 302 队 | 推理+预测 | 2026 续作 |
| TopCoW/TopBrain | GC | 血管分割 | CTA/MRA | 90 volumes | Dice | GC 五连同批 |
635=267+182+176(三任务患者数合计;膀胱侧 368=182+176 与合并论文一致)
附录 E:GC 核查模板 v1.5 执行记录(4 轮)
| 轮 | 动作 | 收获 |
|---|---|---|
| R1 | WebSearch 定位+GC 主页+AWS Registry 双抓 | 消歧确立(CHIMERA vs CHIMERA-agent);缩写全展;S3/许可/联系人 |
| R2 | GC 主页重抓(Timeline 修订存照)+WebSearch 学术面 | TIA-Pegasus 夺冠/ModalSurv/03,300 人 MICCAI;NIBC/NMIBC 漂移发现 |
| R3 | GitHub DIAGNijmegen/CHIMERA+WebSearch summary paper | baseline 三件套;arXiv 2608.21497 全量数字(267/801/942/95-23-149/0.7402/0.50/ΔC≤0.04);Task 1 页面全变量 |
| R4 | Task 2/Task 3 页面+agent 主页+Task 1 补抓 | v1→v2 演化/问题切片清单/Cohort A/B;368=182+176;F1 0.73/C 0.68;agent 三任务细节 |
前作锚强度分级适用:双 summary paper 已出(arXiv 2608.21497+2609.09510)+冠军论文+AWS Registry 自描述完备——v1.5 模板"最高档",4 轮收敛(对照 LMC2 六轮)。多义名消歧条款首用成立(同名 agent 续作并存 GC)。
附录 F:命名消歧表(条款首用记录)
| 名称 | 身份 | 判别特征 |
|---|---|---|
| CHIMERA Challenge | 本条:MICCAI 2025 三任务预后 | chimera.grand-challenge.org;S3 chimera-challenge;267+368 例 |
| CHIMERA-agent | 2026 续作 agentic benchmark | chimera-agent.grand-challenge.org;302 participants;推理轨迹 |
| Chimera(神话) | 缩写来源:狮/羊/蛇喷火怪 | TIA-Pegasus 队名梗(Pegasus 击败 Chimera) |
| CHIMERA(神经科学) | 小鼠海马光遗传模型(他域) | 与本库无关 |
| CHIMERA(嵌合体) | 遗传学/生物信息术语(他域) | 与本库无关 |
附录 G:伦理轴四型对照(本条落位)
| 型 | 条目 | 特征 | CHIMERA 位置 |
|---|---|---|---|
| 前瞻采集+双 IRB | 528/529/530(VinDr 家族 H108+HMUH) | IRB 编号明文 | — |
| 国家基础设施/细胞系 | 531 LMC2(FBI/ANR) | 细胞系合规轴 | — |
| 公开数据二次精标+IRB | 532 TopBrain(UZH IRB) | 审批号可见 | — |
| 公开数据二次整合+同意明示 | 533 CHIMERA | 知情同意入组硬条件;IRB 编号未披露 | ✅ 第四型扩展 |
附录 H:可获取性三档光谱(GC 五连实测)
| 档 | 条目 | 训练集 | 测试集 | 特殊设施 |
|---|---|---|---|---|
| 注册墙型 | 531 LMC2 | 注册+协议 | 黑盒 | GC Algorithm+提交配额 |
| 直下型 | 532 TopBrain | Zenodo 直下 | 隐藏 | podium Docker |
| 无账户直下型 | 533 CHIMERA | AWS no-sign-request | 隐藏 | AWS Open Data Registry 官方收录 |
三档梯度=挑战赛型条目可获取性分级的现成标尺;CHIMERA 的 Registry 收录(ARN/Region/引用格式)是"发现性+引用规范性"的加分结构。
附录 I:DAIMS 评分卡(预估 7.6)
| 维度 | 分 | 依据 |
|---|---|---|
| 文档完备 | 9 | 四任务页+数据版本史+QC CSV+双 summary paper+AWS Registry 元数据 |
| 标注质量 | 8 | BRS 标签 RNA-seq 定义可溯源(STM 2023);临床端点双盲隐藏 test;IAA 未披露 |
| 可复现 | 9 | S3 开放+baseline 权重全链+评估代码公开承诺+UNI embeddings 附带 |
| 可获取性 | 9 | 无账户直下最高档(NC 许可小扣) |
| 伦理合规 | 7 | 知情同意明示但 IRB 编号缺席;Cohort 双协议未校正的诚实披露是加分 |
| 加权 | ≈7.6 | 挑战赛型高位(对照 LMC2 6.9/TopBrain ~7.8) |
附录 J:时间线全景
| 日期 | 事件 |
|---|---|
| 2023-05-24 | STM 2023 论文发表(eabn4118,BRS 分型+Cohort B 源) |
| 2025-04-10 | CHIMERA 公告+注册开放+训练数据 v1 发布(同日) |
| 2025-06-08 | v2 _CD.json progression 缺失修复 UPDATE |
| 2025-06-01→13 | Validation Phase 开始(划改) |
| 2025-08-01→22 | Test 提交截止(划改,AOE) |
| 2025-09 | MICCAI 2025 大田:CHIMERA workshop 结果发布;TIA-Pegasus Task 1 夺冠 |
| 2025-09-08 | ModalSurv 冠军论文 arXiv 2509.05037 |
| 2026-01-27 | GitHub 仓库最后提交 |
| 2026-08-21 | Task 1 summary paper arXiv 2608.21497(投 MedIA) |
| 2026-09-10 | Task 2+3 summary paper arXiv 2609.09510 |
| 2026-10-01 | CHIMERA-agent workshop(MICCAI 2026 Abu Dhabi 半天) |
| 2026-12-18 | agent Debug phase 截止 |
附录 K:坑点表(数据使用陷阱清单)
| 坑点 1 | 临床单模态屠榜的诱惑——C 0.7402 模型完全依赖结构化变量,随机化后 C≈0.50;复现榜单成绩前先确认变量完整性假设 |
| 坑点 2 | “x” 三值编码当数值用——淋巴结/包膜/精囊侵犯的 “x” 是"未切除/未评估",不是 0;margin 的 2 同理 |
| 坑点 3 | Cohort A/B 批次效应——3B 的 50 例测序协议不同且未校正;跨队列指标会被批次噪音污染 |
| 坑点 4 | v1 数据仍可从 S3 下载——旧版本含 8 张损坏切片;务必用 v2/ 路径 |
| 坑点 5 | PSA<0.10 记字符串 “<0.10”——直接 parse float 会崩;需预处理 |
| 坑点 6 | Task 2/3 患者池重叠但非全同(182 vs 176)——跨任务拼接训练前需按 patient_id 对齐 |
| 坑点 7 | WSI 分辨率两档(0.5mpp Task 1/0.25mpp Task 2-3)——统一下游管线时注意物镜等效差异 |
| 坑点 8 | UNI 权重需 HuggingFace 同意条款——直接 curl 拉不下来;agent 评测的 JSON 输出与原版不互通(两条目两协议) |
| 坑点 9 | RNA 与 WSI 三种配对情形(相邻/打孔/另一肿瘤)——空间映射不能假设同切片 |
| 坑点 10 | CC BY-NC-SA 的 SA 条款——衍生数据集发布必须同许可;商用训练需授权 |
附录 L:人名与机构全表
| 人名 | 角色 | 机构 |
|---|---|---|
| Nadieh Khalili | 挑战赛牵头/双论文作者/contact | Radboud UMC |
| Geert Litjens | 计算病理组 PI/组织者 | Radboud UMC |
| Robert N. Spaans | Task 1 论文通讯 | Radboud 病理科+Canisius Wilhelmina |
| Catherine Chia | Task 2+3 论文一作 | Erasmus MC 病理 |
| Tongjie Wang | Task 1/2+3 论文作者 | Erasmus MC |
| Tahlita Zuiverloon | Task 2+3 通讯链(膀胱 PI) | Erasmus MC 泌尿科 |
| Marlies Wakkee/Sita Vermeulen | Task 2+3 作者 | Erasmus MC |
| Khrystyna Faryna | GC 平台侧/双论文作者 | Bydgoszcz(波兰) |
| Parandzem Khachatryan | 论文作者 | Yerevan State Medical University(亚美尼亚) |
| Domingos Oliveira | 论文作者 | IMP Diagnostics(葡萄牙) |
| Jean-Paul A. van Basten | 论文作者(泌尿外科) | Canisius Wilhelmina |
| Noorul Wahab | Task 1 冠军队领队 | Warwick TIA Centre |
| Jiaqi Lv/Ethar Alzaid/Adam Shephard/Shan E Ahmed Raza | 冠军队成员 | Warwick TIA Centre |
附录 M:口径速查卡(引用即查)
| 口径 | 数字 | 备注 |
|---|---|---|
| Task 1 患者 | 267 | 两机构 |
| Task 1 MRI 序列 | 801 | ≈3/例 |
| Task 1 WSI | 942 | 多张/例 |
| Task 1 划分 | 95/23/149 | 和=267 ✓ |
| Task 1 临床变量 | 13(论文)/15(页面表) | 双口径 |
| Task 2 v2 | 182 | v1 132 |
| Task 3 v2 | 176 | v1 126 |
| 膀胱合并 | 368 | =182+176 ✓ |
| submissions | 159 | Task 2+3 |
| 顶级模型 | 13 | 官方 benchmark |
| T1 最佳 | C 0.7402 | 临床单模态 |
| T2 最佳 | wF1 0.73 | — |
| T3 最佳 | C 0.68 | — |
| 随机化崩塌 | C≈0.50 | 单模态临床 |
| withheld 鲁棒 | ΔC≤0.04 | 多模态 |
| ModalSurv | T1 C 0.7402 /T2-3 C 0.5740 | 第 1/第 5 |
| agent 参与度 | 302 participants/305 submissions | 续作首期 |
| S3 | s3://chimera-challenge | us-west-2 |
附录 N:跨条目联动矩阵
| 联动条目 | 联动点 | 类型 |
|---|---|---|
| PI-CAI(如已收录) | baseline nnU-Net 五折权重直接迁移 | 资产复用链 |
| LEOPARD(如已收录) | Task 1 官方 “strongly recommend” 预训练源 | 官方推荐链 |
| PANDA(如已收录) | WSI 分级预训练推荐 | 官方推荐链 |
| 531 LMC2 | GC 可获取性两极(注册墙 vs 无账户直下) | 对照 |
| 532 TopBrain | GC 五连同批;Zenodo vs AWS Open Data 两种直下形态 | 同批 |
| TopCoW(如已收录) | NEJM AI 出口 vs arXiv/MedIA 出口 | 学术出口对照 |
| 530 VinDr-SpineXR | 页面 QC 形态对照(被动考古 vs 主动缺陷清单) | 方法论对照 |
附录 O:开放问题与后续观察点
- MedIA 落地:Task 1 summary paper 投稿 Medical Image Analysis(2026-08-21 v1)——落地后引用格式将变(对照 529 Sci Data 悬空 4 年的反面教材,Radboud 系发表纪录良好)
- agent 版数据发布:CHIMERA-agent 的推理标注(泌尿科医生结构化评估界面收集)是否会公开训练集——agentic 数据形态对 AI-Ready 评估是新题型
- 批次校正补丁:官方是否为 Cohort A/B 发布 combat/归一化补丁——现"未校正"状态是坑点 3 的时效性依据
- 原版团队数:GC 动态渲染数据(脚本抓取可得)——存照不混用 agent 数字
- 膀胱 MRI 扩展:Task 2/3 无影像模态——若 CHIMERA 后续并入膀胱 MRI(如 VIADULT 队列),三任务矩阵将闭合全模态
- 许可演化:NC→CC BY 的可能性(对照 TopCoW 家族的 open data.swiss 商用需许可)——关注 AWS Registry Update Frequency: As required
附录 P:预后建模方法学底座(为什么 C-index 是这里的王者)
P.1 PSA 的争议史与替代终点选择
GC 主页直言 PSA 是"controversial biomarker with limited reliability"——这段争议的学术脉络:PSA 筛查降低转移率但带来大量过度诊断(过度治疗);术后 PSA 复发(BCR)作为终点客观、可量化、早于转移多年,但它本身不是死亡——BCR 患者中仅一部分会进展为转移/死亡(竞争风险)。CHIMERA 选择 time-to-BCR 而非 time-to-death,是泌尿肿瘤预后建模的标准但可争议的选择——条目使用者应意识到:C-index 0.74 的模型预测的是"复发时序"不是"死亡风险"。
P.2 Gleason 体系为何占临床变量的三分之一
Task 1 的 15 行变量表中 Gleason 占三行(Primary/Secondary/Tertiary)+ISUP 一行——因为 Gleason 是前列腺癌预后第一强因子:Primary(最主要模式 1-5)+Secondary(次主要)相加为评分(6-10);Tertiary 是<5% 肿瘤量的第三模式——2025 年 ISUP 共识建议记录但不并入总分。CHIMERA 直接把病理医师的读片结论作为结构化变量喂给模型——这意味着"临床+病理变量"模型实际上已经包含了专家级图像解读的压缩输出;多模态 WSI 分支要证明的是端到端原始像素能否重新发现这些压缩信号——这是理解屠榜悖论的钥匙(P.4)。
P.3 删失数据的现实几何
Task 1 的 time-to-BCR 里,非 BCR 患者的随访时长是删失观测——95 训练例的删失率直接影响 C-index 的有效样本量。删失三规则(§6.1)的可视化直觉:两位患者可比=他们的"事件时序有事实上的先后证据";同时事件不可比=无先后证据;删失更长=这位患者"撑过了对方的事件时点"——证据成立。C-index 0.5 是随机的含义:风险排序对可比对无信息。
P.4 结构化变量 vs 原始像素的信号论
后挑战分析揭示的信号层级:
- clinician-derived 变量=专家知识的压缩编码(Gleason/分期/切缘)——信息密度极高
- WSI/MRI 原始像素=未压缩信号——理论上⊇结构化变量,实际上需从有限样本(95/23/149)重新学习压缩器
- 小样本+高维像素→端到端学习的数据饥饿;结构化变量→信息即用
- 随机化实验证明榜首模型吃的是第 1 层;withholding 实验证明第 2 层存在可恢复的冗余信号(ΔC≤0.04)
这套层级分析适用于任何"临床变量+影像"的预后建模数据集——CHIMERA 的普适贡献。
附录 Q:多模态融合架构分类学(CHIMERA 语境)
Q.1 融合阶段三型
| 型 | 时机 | 代表 | 在 CHIMERA 上的表现 |
|---|---|---|---|
| Early fusion | 像素/特征级拼接 | 简单 concat | 小样本易过拟合 |
| Late fusion | 各模态独立预测后集成 | 投票/stacking | 单模态强时退化为临床模型 |
| Hybrid/attention | 中间表征跨模态注意 | ModalSurv(跨注意力投影) | 局部验证有增益、外部泛化受限 |
Q.2 缺失模态处理的策略谱
CHIMERA 的现实约束(Task 2 无 MRI/Task 3 无 MRI/RNA 可缺失/Clinical 的 “x” 三值)催生四类策略:①模态丢弃训练(modality dropout)——训练时随机屏蔽;②代理填充(surrogate imputation)——用其他模态预测缺失模态表征;③模态专用编码器+共享融合核(官方 ABMIL 思路);④决策级编排(agent 思路——CHIMERA-agent 的"编排预训练工具")。后挑战分析的 missingness-aware 建模呼吁=策略①③的规范化。
Q.3 千兆像素 WSI 的聚合问题
一张 0.25mpp WSI 可切出数万 patch——ABMIL(注意力 MIL)是当前标准聚合器:patch 级 embedding→注意力加权求和→slide 级表征。官方 baseline 选 ABMIL 而非 Transformer 聚合(TransMIL/DSMIL 等)是算力保守选择;v2 附带 UNI embeddings 把 patch 编码成本转嫁给组织方——参赛者只需训 ABMIL 头。这也是挑战赛降低参与门槛的实用主义设计。
Q.4 MRI 分支为什么用 nnU-Net 而不是直接端到端
官方把 PI-CAI 的 nnU-Net 五折 ensemble 作为 MRI 特征提取器——即先用分割/检测模型把前列腺区域编码,再喂 ABMIL。理由:①267 例不足以端到端训练 MRI 骨干;②PI-CAI 的检测任务与 BCR 预测共享"临床显著前列腺癌"的信号子空间;③挑战赛资产复用是 GC 生态的制度优势。"迁移权重当特征提取器"是多模态小样本挑战赛的通用模式。
附录 R:膀胱癌临床背景扩展(Task 2/3 语境)
R.1 NMIBC 与 HR-NMIBC 的分层
膀胱癌按肌层侵犯分两界:NMIBC(Ta/T1/Tis——未达肌层)vs MIBC(≥T2)。NMIBC 占初诊 75%,经尿道切除(TURBT)+膀胱内灌注为标准路径;其中高危(HR)亚群(T1 高级别/高级别复发/大面积 Ta 等)进展风险最高——EORTC 风险表(Task 2/3 变量里的 High/Highest risk)是欧洲标准分层工具。Task 2/3 的 stage 变量(TaHG/T1HG/T2HG)+T1m/T1e substage(浸润深度 0.5mm 分界)正是这个分层体系的字段化——T1e(>0.5mm)是进展强预测因子,也是后挑战分析发现的"跨架构一致难例"标记(§7.3)。
R.2 BCG 短缺与反应亚型的医学经济学
BCG(卡介苗)膀胱灌注是 HR-NMIBC 的标准免疫治疗——但 2019 年起全球持续短缺(生产集中于少数厂商),“globally scarce resource”(GC 主页原文)是字面事实。50% 无反应率+全球稀缺="谁能从 BCG 获益"的预测问题直接对应药物配置经济学——BRS 预测的临床价值不在学术而在分诊:无反应者应早做根治决策(膀胱切除/免疫检查点),有反应者避免过度治疗。RNA-seq 定义的 BRS(STM 2023)是分子金标,但临床常规不做测序——Task 2 问的正是"H&E+常规变量能否替代测序"。
R.3 BRS 三亚型的生物学含义
BRS1/2/3(Biomarker-derived BCG Response Subtype)的推导:STM 2023 用两队列转录组做共识聚类得到的分子亚型,与 BCG 治疗后复发/进展风险差异相关。CHIMERA 把它作为分类端点——标签的生物学有效性继承自 STM 2023 的验证,本数据集不再独立验证(引用时注明标签来源)。
R.4 reTUR 与灌注计数的现实细节
变量表里的 reTUR(BCG 前二次 TURBT)与 no_instillations(灌注总次数,-1=缺失)是治疗强度变量——BCG 反应受完整疗程影响(灌注不足≠真无反应)。建模者需区分"生物学无反应"与"治疗不充分"——这也是 Task 2+3 论文 missingness 分析的现实基础。
附录 S:端到端复现工作流(从 S3 到 C-index)
S.1 环境与数据(≈120 GB 全量/Task 1 约 60 GB)
pip install awscli h5py openslide-python monai torch
aws s3 sync --no-sign-request s3://chimera-challenge/v2/task1/ ./data/task1/
# QC:task1_quality_control.csv 逐例核对损坏切片
S.2 WSI→UNI embeddings(若用 Task 2/3 附带产物可跳过)
import openslide, torch
from timm import create_model # UNI 经 HF/timm 加载
uni = create_model('vit_large_patch16_224', num_classes=0, pretrained=True).eval()
def slide_to_embeddings(slide_path, mpp=0.25, size=224):
# 千兆像素 WSI → patch 网格 → UNI 向量序列
sl = openslide.OpenSlide(slide_path)
W, H = sl.dimensions
coords = [(x, y) for x in range(0, W, size) for y in range(0, H, size)]
feats = []
for x, y in coords:
img = sl.read_region((x, y), 0, (size, size)).convert('RGB')
# 组织 mask 过滤白背景后批量化(省略)
feats.append(uni(preprocess(img)).squeeze(0))
return torch.stack(feats) # [N_patches, 1024]
S.3 生存头训练与删失评估
# 模型与损失见附录 C;训练循环要点:
# 1) event=0 的样本参与 loss 仅作为风险集成员(Cox 结构保证)
# 2) 验证集 C-index 按 GC 规则自实现或用 sksurv.metrics.concordance_index_censored
# 3) 早停以验证 C-index 为准(对齐挑战赛 Phase 机制)
S.4 后挑战分析复现(随机化/withholding 双实验)
# 随机化实验: Clinical 变量列内 shuffle(保持边缘分布破坏对应关系)→ 测 C-index 崩塌幅度
# withholding:直接置空临床分支(ABMIL 仅吃影像+RNA)→ 测 ΔC
# 官方结论锚点:随机化→C≈0.50;withheld→ΔC≤0.04
S.5 常见复现失败清单
- 忘记 v2 路径下载到 v1(损坏切片复现"神秘"低分)
- “<0.10” 字符串未预处理
- “x”/2 缺失编码当数值
- Task 2/3 患者池按行号对齐(应按 patient_id)
- Cohort A/B 混训未标注批次(指标虚高或虚低无法归因)
- UNI 权重未走 HF 同意流程(下载失败)
附录 T:挑战赛设计方法论(CHIMERA 可复用的组织学经验)
T.1 任务矩阵即消融(§3.4 的设计论价值)
三任务正交设计让每个模态的边际贡献可测——单任务挑战赛只能给出综合排名,多任务矩阵给的是信息结构图谱。组织侧成本:三套评估管线+三份 summary paper;收益:Task 1 的"单模态屠榜"结论有 Task 2/3 的横向对照佐证(三任务一致),结论可信度倍增。
T.2 数据版本治理的透明度样本
v1→v2 的治理动作清单:修复清单逐例公示/不可修复项明示保留/新增队列明示协议差异/字段对齐修复留 UPDATE 时间戳——缺陷公示不是弱点而是复现科学的基础设施。对照:多数数据集论文把 QC 结果埋在补充材料;CHIMERA 把它放在任务页正文。AI-Ready 评估视角:这是"文档完备"维度 9 分的核心理由。
T.3 评估管线的公开承诺
"C-index 计算代码将公开"承诺+隐藏 test 的黑盒评估——挑战赛可复现性的两难(公开评估代码 vs 防过拟合的隐藏性)的标准解:代码公开+数据不公开。参赛者可本地复算验证集指标,测试集由平台统一评估——159 submissions 的公平性建立在这个机制上。
T.4 与 GC 泌尿矩阵的接力设计
Public Data 节点名四个前作(LEOPARD/PI-CAI/PANDA/TCGA-PRAD)+baseline 权重直接来自 PI-CAI——CHIMERA 把生态接力写进了参赛指南。挑战赛的组织学启示:挑战赛不是孤立事件而是数据谱系的节点——预训练源清单+权重迁移让后来者站在前作肩上,这比单场奖金更持久。
T.5 时间线弹性与沟通
两处截止日期划改(06-01→06-13/08-01→08-22)以删除线保留修订史——改期不抹历史的页面治理风格;配合 UPDATE 时间戳(_CD.json 修复),组织方的沟通纪律与数据可信度互相加强。
附录 U:CHIMERA-agent 深度对照(续作的全息画像)
U.1 三决策点的临床流
| 任务 | 时点 | 输入 | 输出 |
|---|---|---|---|
| Agent-T1 | 活检前 | mpMRI 报告+基础临床变量 | 是否建议活检 |
| Agent-T2 | 活检后 | MRI+活检病理报告+临床 | 主动监测/继续监测/观察等待/积极治疗(EAU/NCCN 四选一) |
| Agent-T3 | 根治术后 | 切除+活检病理报告+术前 MRI+PSA | time-dependent BCR 风险 |
U.2 与原版的五维差异
| 维度 | CHIMERA(2025) | CHIMERA-agent(2026) |
|---|---|---|
| 数据形态 | 原始模态(WSI/MRI/RNA 文件) | 结构化 JSON(报告+变量+纵向 PSA) |
| 输出 | 风险值/类别 | 预测 JSON+推理轨迹 JSON(~5KB/例) |
| 评估 | C-index/wF1 | 预测+推理一致性(幻觉/无支撑/矛盾惩罚)+顶级提交泌尿科人工审查 |
| 参与范式 | 训练模型 | 编排预训练基础模型工具(前列腺分区分割/Gleason 分级/csPCa 检测三件套) |
| 现实性注入 | 完整配对数据 | 缺失/延迟/冲突证据显式注入(“not edge cases but routine clinical practice”) |
U.3 参考推理标注的新数据形态
Ground truth 推理由泌尿科医生经"结构化临床评估界面"审阅 EHR 式病历产出——医生决策轨迹本身成为标注——这是 AI-Ready 评估的新题型:推理标注的质量与一致性评估(医生间 IAA)将在 agent 数据条目中成为新维度。
U.4 参与热度信号
Debug phase 至 2026-12-18(302 participants/305 submissions)——agent 范式首期热度约为原版 Task 2+3 提交量(159)的 2 倍:LLM 时代 agentic 评估对社区的吸引力可见一斑;但也需注意 Debug 阶段参与门槛低(提交即计),最终有效团队数待 2027 年结果公布。
U.5 演化判断
原版回答"多模态数据能融合出什么";agent 版回答"不完美信息下如何决策"——从数据完整性假设到现实碎片性的范式迁移。若 agent 版的推理轨迹数据将来开放,"患者旅程级"AI-Ready 数据将首次入库——观察点记入附录 O。
附录 V:临床变量—预后语义映射详表(Task 1 建模指南)
| 变量 | 预后强度 | 建模处理建议 |
|---|---|---|
| Primary/Secondary Gleason | 极强(一级证据) | 保序编码(ordinal embedding)勿 one-hot;与 ISUP 冗余——避免双重计数 |
| Tertiary Gleason | 强(缺失即信息) | NaN≠0:缺失指示变量单列 |
| ISUP grading | 极强(Gleason 的确定映射) | 与 Gleason 三列高度共线——特征选择或仅留一组 |
| 术前 PSA | 强(连续+右偏) | log 变换;“<0.10” 按检出限处理(substitution 或 Tobit 思路) |
| pT-staging | 强 | 字符串多值——映射 AJCC/EAU 有序量表 |
| 切缘(+) | 强 | 三值 0/1/2——2 作为缺失指示 |
| 淋巴结/包膜/精囊 “x” | 中强 | “x”=未切除——缺失机制与分期相关(MNAR 警示) |
| LVI | 中 | 二值干净 |
| 年龄 | 弱-中 | 标准化;与合并症不可得性权衡 |
| Earlier therapy | 特殊 | 既往治疗改变基线——交互项候选 |
| PSA at recurrence | 端点耦合 | 勿作特征——与 BCR 定义循环(数据泄漏陷阱) |
| BCR status | 标签 | 生存分析的 event 指示 |
| time-to-BCR/FU | 标签 | duration 列 |
三处数据泄漏高危点:PSA at recurrence 入特征/用 test 分布做归一化/按 BCR 状态分层后混合划分——附录 S 的复现流程已按泄漏安全排序。
附录 W:CHIMERA Consortium 的治理网络
W.1 三层结构
| 层 | 成员 | 职能 |
|---|---|---|
| 核心组织 | Radboud UMC 计算病理组(Litjens/Khalili/Spaans/Faryna) | 平台运营/任务设计/评估 |
| 数据联盟 | Erasmus MC(病理+泌尿+皮肤科)/Canisius Wilhelmina/IMP Diagnostics(葡) | 队列供给/临床语义 |
| 地理扩展 | Bydgoszcz(波兰)/Yerevan(亚美尼亚) | 评估/联盟署名 |
W.2 集体署名制
两篇 summary paper 均出现 “CHIMERA Challenge Consortium”/“on behalf of the CHIMERA Consortium” 集体作者——**联盟署名(group authorship)**是大型挑战赛学术出口的规范形态(对照 531 LMC2 的 28 位共同作者模式);个体作者+联盟双列保证贡献可溯与规模可见。
W.3 学科交叉轴
病理(Radboud/Erasmus 病理科)+泌尿外科(Canisius/Erasmus)+皮肤科(Erasmus——Chia/Wang 的第三挂靠,荷兰病理多挂靠传统)+诊断产业(IMP Diagnostics)+学术界地理扩展(波兰/亚美尼亚)——五轴交叉是多模态挑战赛的必要社会结构:没有临床科室的变量语义背书,结构化变量就只是数字。
W.4 平台经济
GC 平台(DIAG Nijmegen)本身由 Radboud 运营——主办机构=平台运营方=数据主供方三位一体(对照 LMC2 的 FBI 主办+GC 托管分层)。这种垂直整合降低协调成本,但也意味着独立复核依赖 summary paper 的透明度承诺——DAIMS 伦理维度 7 分的治理面注脚。
附录 X:库内对照深度表(五维度)
| 维度 | 533 CHIMERA | 531 LMC2 | 532 TopBrain | 530 VinDr-SpineXR |
|---|---|---|---|---|
| 任务族 | 生存+分类(第六族首发) | image-to-image 生成 | 多类分割 | 分类+检测 |
| 模态数 | 4(WSI/MRI/RNA/临床) | 2(透射光→荧光) | 2(CTA/MRA) | 1(X-ray) |
| 数据载体 | AWS Open Data(无账户) | GC 注册墙 | Zenodo 直下 | GC 算法页面 |
| 学术出口 | 双 summary paper 已出(投 MedIA+arXiv) | 数据库论文已发表/挑战在投 | NEJM AI 已发表 | MICCAI 正式接收 |
| QC 透明度 | 缺陷清单逐例公示(主动) | 登录墙缺口存照 | 版本三迭代留痕 | 页面拼写事故(被动) |
| 伦理型 | 同意明示+审批号缺席 | 细胞系轴 | UZH IRB 明文 | 双 IRB 明文 |
| 规模口径 | 368=182+176 ✓/95+23+149=267 ✓ | 56,984/56,981 漂移 | 48=40∪42∩34 ✓ | 10,466 vs 10,468 差 2 |
| 参与度 | 159 submissions(原版)/agent 302 队 | 未披露 | 11/15 团队口径差 | — |
对照结论:CHIMERA 在模态广度+QC 透明度+代数自洽三项居 GC 五连之首;参与度数字的原版/续作分离是本条目特有的口径纪律点。
附录 Y:四类读者的行动指南
Y.1 多模态融合研究者
路径:附录 S 复现基线→Task 1 为试验床做融合架构对照(附录 Q 三型)→复现随机化/withholding 双实验(S.4)→把"缺失感知指标"写进自己的评估协议。目标论文位:融合架构在 ΔC 意义下的改进(而非榜面 C-index)。
Y.2 计算病理工程师
路径:v2 附带 UNI embeddings 起步(免千兆像素算力)→ABMIL 头训练(附录 C)→0.25mpp 全分辨率管线(附录 S.2)→跨 Task 2/3 的批次效应实验(Cohort A/B 现成测试床)。注意附录 V 的泄漏清单。
Y.3 泌尿肿瘤临床研究者
路径:附录 P/R 的临床语义底座→变量表(§4.3)与 EAU 指南映射→Task 2 的 BRS 预测问题即"测序替代"经济学(R.2)→agent 版三决策点(附录 U)作为临床决策支持的原型场景。
Y.4 数据集管理者/AI-Ready 评估者
路径:AWS Registry 元数据页(发现性范本)→QC CSV+缺陷清单(治理范本)→许可三档对照(§9.2-9.3)→本条 DAIMS 评分卡(附录 I)作为挑战赛型条目评分的参照系。CHIMERA 是"数据开放度"与"结论可用性"分离评估的最佳教学案例。
附录 Z:Task 2/3 膀胱变量建模语义(对照附录 V)
| 变量 | 取值 | 建模语义 |
|---|---|---|
| age/sex/smoking | 整数/二值/二值 | 标准人口学三件套;smoking 是膀胱癌一级危险因素——勿当噪音变量剔除 |
| tumor | Primary/Recurrent | 复发肿瘤的分子行为不同——分层候选变量 |
| stage | TaHG/T1HG/T2HG | 三级有序(浸润深度递增);T2HG 出现在 NMIBC 队列属边缘入组——核对 QC CSV |
| T1m/T1e substage | 0.5mm 分界 | 进展最强病理预测子之一;也是后挑战"一致难例"标记(§7.3)——模型分层报告的天然切面 |
| grade | G2/G3 | 两级有序(中/低分化)——HR 队列内 G3 占多数的类不平衡预期 |
| reTUR | Yes/No | 治疗强度代理——与 BCG 反应混杂(R.4) |
| LVI | Yes/No | NMIBC 中 LVI 阳性即升级 HR 处理——强信号 |
| variant | UCC/UCC+Variant | 组织学变异体(微乳头/肉瘤样等)行为更凶——二值粗编码丢失亚型信息(页面粒度上限) |
| EORTC | High/Highest risk | 队列入组过滤器本身——方差被截断(全员高危),区分度有限 |
| no_instillations | 整数/-1 | 完整疗程计数;-1 缺失指示单列 |
| BRS(Task 3 特征/Task 2 标签) | BRS1/2/3 | Task 3 中作特征(分子先验)Task 2 中作标签——同字段双角色的跨任务数据泄漏警示:两任务模型不可共享该字段管道 |
附录 AA:RNA-seq 数据处理指南(_RNA.json 的正确打开方式)
AA.1 数据形态
- DESeq2 归一化输出(尺寸因子校正后的标准化计数)——已归一化,无需再做 DESeq2 流程
- 来源区域:WSI 选定肿瘤区微切割——空间稀疏(非全切片bulk)
- Cohort A(3A)与 B(3B)协议不同——批次变量必须保留
AA.2 推荐处理链
import json, numpy as np, pandas as pd
rna = json.load(open(f"{pid}_RNA.json"))
# 1) 对数稳定:log1p(normalized_counts)
# 2) 高变基因筛选(HVVG top-k,k∈[1000,5000])或直接用 STM 2023 的 BRS 特征基因集
# 3) 批次变量 one-hot 进协变量或做 Combat(官方未做——使用者自行抉择并披露)
# 4) 降维:PCA/autoencoder 压至 64-256 维再进融合头(原始维度数万)
AA.3 三类常见错误
- 把 DESeq2 输出再跑一次 DESeq2(重复归一化——分布扭曲)
- 3A/3B 混训无批次标注(后挑战发现的"队列依赖退化"即此坑的模型级显形)
- 假设 RNA 覆盖全切片(实际仅选定肿瘤区——与 WSI 注意力图对齐时空间语义错位)
AA.4 RNA 与 WSI 的对齐研究位
三种配对情形(相邻/打孔/另一肿瘤)=空间对齐噪声的自然分级——可设计"对齐强度"消融:相邻切片(最强对应)vs 打孔(同切片部分对应)vs 另一肿瘤(患者级对应)——这个分级本身就是论文可挖的方法学素材。
附录 AB:挑战赛时间管理与提交策略(Phase 机制复盘)
AB.1 时间线的行为学读法
| 阶段 | 日历 | 行为含义 |
|---|---|---|
| 注册+训练集 | 04-10 同日 | “注册即拿数据”——零摩擦入口设计 |
| 验证期 | 06-13→08-22(划改后跨度 70 天) | 唯一长窗口——迭代主力期;划改 +12 天=给数据 v2 修复让路(时间线治理的因果推断) |
| 测试截止 | 08-22 AOE | AOE(Anywhere on Earth)时区=最宽容截止惯例 |
| Workshop | 2025-09 大田 | 赛-会间隔 ~2 周——MICCAI 惯例 |
AB.2 提交经济学
159 submissions(Task 2+3)/约 13% 入选终评(13/约 100 队推算)——终评密度设计:不是所有提交都被 benchmark,组织方按榜面+多样性选 13 个做深度分析(含后挑战压力测试)。对参赛者策略:早期提交锁定验证集反馈、后期提交覆盖架构多样性(官方分析偏爱"有故事"的模型族)。
AB.3 黑盒下的过拟合防范
隐藏 test+限量提交的对称设计——提交次数少则探索不足、多则 test 过拟合;CHIMERA 未公开单队提交上限(页面未载)——对照 531 LMC2 的 ≤5/日配额公开。这是文档完备度 9 分里唯一的暗点,记入口径注 N5 的同族观察。
AB.4 对下一条目的模板沉淀
GC 核查模板 v1.5 的"可获取性三档"在 CHIMERA 得到第四个数据点:Registry 收录型(AWS Open Data+ARN+引用格式)> Zenodo 直下型 > 注册墙型。534 autoPET V 与 535 OWL 的数据载体核查将直接套用此四分。
附录 AC:引用声明模板与复现声明(直接可用的规范化文本)
AC.1 数据引用模板(论文/报告用)
数据来源:CHIMERA Challenge(Combining HIstology, Medical Imaging (Radiology), and molEcular Data for Medical pRognosis and diAgnosis),Radboud University Medical Center 主办,MICCAI 2025 挑战赛。训练数据(v2)经 AWS Open Data Registry 获取(s3://chimera-challenge,us-west-2),许可 CC BY-NC-SA 4.0。方法描述:Spaans RN, et al. arXiv:2608.21497(Task 1);Chia C, et al. arXiv:2609.09510(Task 2+3)。
AC.2 结果复现声明模板
本研究使用 CHIMERA v2 训练集(Task 1 n=95/Task 2 n=182/Task 3 n=176)。验证与测试集由 Grand Challenge 平台托管未随训练集发布,故本报告的 C-index/weighted F1 为训练集内部交叉验证结果,与官方榜单(test C-index 0.7402 等)不可直接比较。Cohort A/B 批次变量已保留并披露处理方式。缺失编码(“x”/2/-1/“<0.10”)按附录 V/Z 语义处理。
AC.3 模型卡片(Model Card)关键字段建议
| 字段 | 建议值 |
|---|---|
| 训练数据 | CHIMERA v2(哪个 task 哪些模态) |
| 评估指标 | C-index(删失规则)/weighted F1 |
| 已知偏差 | Cohort A/B 协议差;HR-NMIBC 单中心群(Erasmus 系);T1e 一致难例 |
| 适用范围 | 泌尿肿瘤预后研究;非临床部署 |
| 不适用 | 肌层浸润/转移队列;非欧洲人群外推;BCG 个体化处方 |
| 许可继承 | 衍生模型发布需披露 CC BY-NC-SA 4.0 传染性(SA 条款对权重的适用性讨论) |
AC.4 AI-Ready 评估的操作化定义(本条目贡献)
挑战赛型条目的 AI-Ready 评估在 CHIMERA 上形成五个可复用检查点:①训练集无账户直下可达(Registry/ARN 元数据完备);②评估管线代码公开承诺与隐藏 test 的对称设计;③数据版本治理(v1→v2 演化+缺陷清单公示);④baseline 全链可复现(权重/embeddings/损失函数三件);⑤学术出口可追溯(summary paper+冠军论文+集体署名规范)。五点齐备=挑战赛型 DAIMS 7.5+ 的操作化门槛——供 534/535 及后续挑战赛条目直接套用。
AC.5 本条目事实的存证链(本库方法论要求)
| 事实组 | 存证信源 | 抓取时点 |
|---|---|---|
| 规模/划分/指标 | arXiv 2608.21497 摘要+Task 1-3 GC 页 | 2026-09-25 |
| 版本演化/QC 清单 | Task 2/3 页面 Data versions 节 | 2026-09-25 |
| baseline 链 | GitHub DIAGNijmegen/CHIMERA README | 2026-09-25 |
| 冠军/ModalSurv | Warwick TIA 新闻+arXiv 2509.05037 | 2026-09-25 |
| AWS 元数据 | registry.opendata.aws/chimera | 2026-09-25 |
| agent 消歧 | chimera-agent.grand-challenge.org+GC 首页 | 2026-09-25 |
§10 总结:多模态预后的标准起点与它的清醒剂
CHIMERA 的双重价值:建设性的——首个泌尿肿瘤多模态预后标准化 benchmark,四模态配对+三级 baseline+删失评估规范+QC 缺陷清单公示,把"怎么组织一场诚实的多模态挑战赛"做成了模板;清醒剂的——临床单模态屠榜(C 0.7402)且随机化即崩塌(0.50)、多模态仅微弱鲁棒(ΔC≤0.04)、冠军团队自证外部测试集上单模态更强——多模态融合的增益在 2025 年的泌尿肿瘤数据上仍未兑现,瓶颈不在架构而在"大规模、平衡、对齐的多模态数据集"本身(ModalSurv 原话)。这个悖论让 CHIMERA 超越了一个数据集:它是给整个多模态医学 AI 领域的压力测试协议——先问信号从哪来(随机化实验),再问缺失时谁还站着(withholding 实验),最后才看榜单。对 AI-Ready 数据集评估的含义:可获取性 9 分(AWS 无账户直下)与"单模态陷阱"警示并存——数据开放不等于结论好用,条目价值恰在这两层张力的完整记录。
本条目为千方病案医数集 GC 五连第三发。数据以 CHIMERA Challenge 官方页面(chimera.grand-challenge.org)、两篇 summary paper(arXiv 2608.21497/2609.09510)、冠军论文(arXiv 2509.05037)、GitHub DIAGNijmegen/CHIMERA 与 AWS Open Data Registry 为准,抓取时点 2026-09-25。CHIMERA-agent(MICCAI 2026)信息仅作消歧与对照,其数据本体另行成条。
(完)
附录 AD:本条目与 GC 五连的批次位置备忘
| 发次 | 条目 | slug | 状态 |
|---|---|---|---|
| 第一发 | 531 Light My Cells 2 | lightmycells2 | 已上线(rid 631) |
| 第二发 | 532 TopBrain 2026 | topbrain2026 | 已上线(rid 632) |
| 第三发 | 533 CHIMERA | chimera | 本条 |
| 第四发 | 534 autoPET V | autopetv(待核) | 计划中——系列第五届,前作锚最强 |
| 第五发 | 535 OWL | owl(待核) | 计划中——元研究型挑战,DAIMS 第三种评分结构待建 |
五连完成后将输出《GC 挑战赛型条目生产总结》:四档可获取性光谱(注册墙/Zenodo/AWS Registry/待补)、任务族覆盖(分割/生成/生存/检测待补)、命名消歧案例集(CHIMERA 首例)——作为挑战赛型数据生产的模板终版。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- hest-1k — 共享标签:医学影像 / 病理图像 / 转录组 / 肿瘤学
- leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- atlas-liver-tumor — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
- cptac-imaging — 共享标签:医学影像 / 病理图像 / MRI / 肿瘤学
- prostatex — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
- pi-cai — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
- hlca — 共享标签:医学影像 / 病理图像 / 转录组
- panda — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- paip — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- promise12 — 共享标签:医学影像 / MRI / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

