信息速览
INFOBOX:owl 速览
| 字段 | 值 |
|---|---|
| 数据集 | OWL Training Set(508 例,LEOPARD 同源) |
| slug | owl(GC 子域 owl.grand-challenge.org) |
| 全名 | Observing What Models Learn——观察模型学到什么 |
| 平台 | Grand Challenge——GC 五连收官发(第五发) |
| 会议 | WACV 2027 + CVPath Workshop(2027-01-04~08 Orlando)——五连中唯一非 MICCAI 线(CVF 系) |
| 主办 | Radboudumc(Khrystyna Faryna 等——CHIMERA 双论文作者同一人,Radboud 第三连线) |
| 任务 | 可解释 BCR 预测四输出:时间 float+三档风险+归因 TIFF+≤5 页解释报告 |
| 数据 | 508 例根治术 WSI(Radboudumc 单中心;金字塔 TIF;多切片拼装;2 TB;LEOPARD 同源) |
| 标签 | training_labels.csv(case_id/event/follow_up_years——删失生存)+组织 mask |
| 评估 | 五阶段:Debug→C-index≥0.65 资格线→扰动忠实性→AI 专家 Likert 七维→病理医师四维→加权和 |
| 评分结构 | 本库第三种:资格线+扰动忠实性+双专家面板——人类评审直接进排名 |
| 参与度 | 15 participants(GC 动态;Not accepting submissions——10-16 testing 再开) |
| 时间线 | 08-22 官宣→10-16 排行榜→11-06 CVPath 论文→11-30 提交截止→2027-01 WACV 宣奖→2027-02 External Validation |
| 参与门槛 | 归因方法+病理知识+2TB 数据+容器——小而精(15 队冷启动) |
| 多义名 | OWL(本体语言)撞车——本条目=Observing What Models Learn |
| 一句话 | 当预测精度不再是问题,"模型为什么这么判"成为下一个基准——可解释性的第一次系统竞赛 |
§0 摘要卡:给"解释"立规矩的第一次尝试
§0.1 它是什么
OWL(Observing What Models Learn)是 GC 五连的收官发,也是五连中形态最特殊的一发:元研究型挑战。前三发的评测对象都是数据上的预测性能(分割 Dice/生存 C-index/交互效率),OWL 把评测对象换成模型的解释本身——"预测多准"已有原则性框架(C-index),"解释是否揭示真实生物学"却没有。OWL 用前列腺癌根治术 WSI 的生化复发预测(与 LEOPARD 同源 508 例)作代表性场景,要求算法四输出一体:时间预测+三档风险+空间归因图+每例一封 ≤5 页的人类可读解释报告;评估用五阶段流水线(预测资格线→扰动忠实性→AI 专家七维 Likert→病理医师四维面板→加权和)——人类评审直接进排名。它回答的问题:“当 AI 说这个病人会复发,它看到的是什么组织学证据,这个证据可信吗?”
§0.2 三个数字
- 0.65:C-index 资格线——隐藏测试队列上预测力不足 0.65 的提交不进可解释性评估(“预后信号太弱,解释无意义”)——用预测力门槛保住解释评估的信噪比,元研究型挑战的聪明设计
- 508 例 / 2 TB:训练集规模(Radboudumc 单中心)与体量(千兆像素金字塔 TIF)——与 LEOPARD 完全同源(下载页直接跳转前作)——数据资产的届际复用样本
- 4+7+4:四输出(时间/风险/归因/报告)×AI 专家 Likert 七维(含 hallucination risk)×病理医师四维(临床意义/图像证据对齐)——"解释"被拆解成可打分的维度
§0.3 它怎么用
四大用途:①可解释方法基准——扰动忠实性+专家面板给归因算法(热图/概念归因/原型方法)第一次可排名的比较框架;②WSI 生存建模训练——508 例删失标签+组织 mask(LEOPARD 同源,兼作 LEOPARD 任务的训练资源);③病理 AI 信任研究——hallucination risk/clinical meaningfulness 等维度是"医生为什么该/不该信 AI"的实验素材;④科学发现工作流——hypothesis-free discovery 的输出格式设计(概念归因+文本解释)可迁移到其他影像问题。不适合:需要区域级金标的监督学习(弱监督声明);临床部署(研究定位);跨中心泛化训练(单中心 508 例——2027-02 External Validation 才补这一环)。
§0.4 联动提示
本条是 GC 五连收官:与 533 CHIMERA 构成 Radboudumc 双连线(Faryna 同人+生存任务同族——CHIMERA Task 1 前列腺 BCR/OWL 前列腺 BCR——同一临床问题的一条线的两代形态);与 534 autoPET V 构成评估体系两极(全自动指标 AUC vs 人类评审 Likert);数据同源 LEOPARD(未入库,前作锚记录)。五连合体的方法论总结(四档可获取性/五族评估体系/多义名消歧案例)见本条附录 AN。
§1 平台与会议定位
§1.1 GC 上的元研究生态位
Grand Challenge 平台 420+ challenges 中绝大多数评测预测性能;OWL 的生态位是评测可解释性——平台"Fair assessment of algorithm performance"宗旨的解释性分支。15 participants 的冷启动规模反映双重门槛:①归因方法研发门槛(热图之外的 faithfulness 方法稀缺);②病理领域知识门槛(解释要过病理医师面板)。但这也正是 OWL 的价值假设:小而精的评审密集型挑战,先立标准再扩规模(2027-02 External Validation 即扩容设计)。
§1.2 WACV+CVPath 的会议选择
五连前四发(LMC2-TopBrain-CHIMERA-autoPET V)均为 MICCAI 系会议;OWL 走 CVF 线(WACV 2027)+CVPath Workshop(computational pathology 专题工作坊)。会议选择暗示受众差异:可解释性/科学发现话题在计算机视觉社区的关注度(模型行为分析)高于医学影像社区(性能导向)——同一问题在不同社区的不同入口。CVPath 论文截止(11-06)早于排行榜提交截止(11-30)——先发论文拿反馈、后交测试拿成绩的双轨。
§1.3 Radboudumc 第三连线
主办人 Khrystyna Faryna 在本库的第三个出现点:①533 CHIMERA 双 summary paper 作者+GC 平台 inquiry 联系人;②535 OWL 主办;③(隐线)Radboud DIAG 生态=GC 平台运营方。Radboud 系的挑战赛版图:PI-CAI/PANDA/LEOPARD(H&E time-to-BCR)→CHIMERA(多模态生存)→OWL(可解释生存)——"生存预测"主线的三代演进(LEOPARD 单模态自动→CHIMERA 多模态自动→OWL 可解释)。数据复用是这条线的实施手段(OWL 直接复用 LEOPARD 508 例)。
§2 发布形态与学术出口
- 形态:WACV 2027 CVPath Workshop 挑战(在赛——10-16 testing 开放)+External Validation Phase(2027-02 起赛后长期 benchmark)——五连首个"赛后延续阶段"显式设计的条目
- 学术出口:CVPath@WACV 2027 workshop 论文(11-06 截止,可用开发数据结果)——对照 533(双 paper 已出)/534(journal 承诺)/531(在投)——workshop 论文是五连中最轻的出口档(但 External Validation 的长期运行是独有资产)
- 时间线笔误存照:timeline 页"4-7 January 2026"应为 2027(CVF 官网:WACV 2027=01-04~08 Orlando)——引用需修正;五连页面考古又添一形态(数字残留的时间维度)
§3 任务定义深度解析:四输出的结构主义
§3.1 "预测+地点+理由"的三段式
task 页原文:“a submitted algorithm must produce four things — a prediction, where it looked, and why”——四输出本质是三段问答:预测了什么(输出 1/2:时间+风险)→看了哪里(输出 3:归因图)→为什么(输出 4:解释报告)。这个三段式是可解释 AI 文献的经典框架(prediction/localization/explanation),OWL 把它变成容器化提交的硬规格。
§3.2 弱监督的强约束
两处"weak supervision"声明(时间预测与风险评分均"learned under weak supervision from patient-level outcomes only")——禁止使用区域级标注(Gleason 分区/病灶分割等强监督信号不作为标签)。这个约束保住任务的科学发现纯度:如果用区域金标监督,“解释"就退化为"复述标注”——hypothesis-free discovery(无假设发现)要求模型从结局信号里自己找出空间模式。
§3.3 风险分档的自派生要求
“low”/“medium”/“high” 三档必须从算法自己的时间预测派生(“derived from the participant’s algorithm’s own time-to-recurrence predictions”)——禁止独立训练三分类器再贴标签。这个设计保证输出 1/2 的内在一致性(时间 5.2 年的"high"与时间 15 年的"low"不能出自两个互斥模型)——可解释性的前提是预测系统自洽。
§3.4 归因图的格式纪律
- 8-bit 无符号整数多分辨率 TIFF——与 WSI 同构的金字塔格式
- spacing 跟随官方组织 mask——归因分辨率与组织掩膜对齐(评估扰动分析按此分辨率执行)
- 这意味着归因是组织区域级(不是像素级)——与扰动分析(区域移除)的评估粒度自洽
§3.5 解释报告的纸面规格
每例一份 PDF ≤5 页——逐例报告(不是全局方法论文档)——"concept attributions, textual explanation, and so on"自由格式。5 页上限是评审成本控制(AI 专家面板要看手稿+代码+每例报告的全件集)。报告是四输出中唯一的人类语言产物——病理医师面板的直接评审对象。
§4 数据本体:LEOPARD 遗产的复用细节
§4.1 508 例的出身
- Radboudumc 单中心回顾性队列——前列腺癌根治术 H&E WSI
- 与 LEOPARD 挑战赛训练集完全一致(CSDN:“这一规模与此前 LEOPARD 挑战赛的训练集完全一致”)
- 下载实证:OWL data 页"To download the dataset proceed to the Data download page"链接直指 leopard.grand-challenge.org/data-download/——挑战赛数据资产复用的实现路径(Join OWL→经 LEOPARD 下载页取数)
§4.2 金字塔 TIF 的存储几何
- 第 0 层全分辨率(千兆像素),每层对上层 4× 降采样
- 多分辨率 tiled——openslide/tifffile 标准读取
- 大多数 WSI 多切片拼装(“multiple slides packed together”)——一个 case 文件内含多张物理切片——数据结构上把"患者"作为单位而非"切片"(与 533 CHIMERA Task 1 的"每例多张 WSI"同理念但打包方式更激进)
§4.3 标签与辅助资产
- training_labels.csv 三字段:case_id (str)/event (0|1)/follow_up_years (float)——标准删失生存格式(event=1→复发年数;event=0→末次随访年数)
- 官方组织 mask(归因 spacing 基准+组织区域提取)
- 2 TB 总量——GC 注册墙(Join 后下载)
§4.4 与 533 CHIMERA Task 1 的数据对照
| 维度 | OWL 508 例 | CHIMERA Task 1 267 例 |
|---|---|---|
| 癌种 | 前列腺癌(同) | 前列腺癌 |
| 任务 | time-to-BCR(同族) | time-to-BCR |
| 模态 | 仅 H&E WSI | H&E+mpMRI+临床 |
| 标注 | event+follow_up_years(同构) | 同构+13-15 临床变量 |
| 中心 | Radboudumc 单中心 | Radboud+Canisius 两机构 |
| 端点评估 | C-index(同) | C-index |
- 同一临床问题的两代形态:LEOPARD(单模态自动)→CHIMERA Task 1(多模态融合)→OWL(可解释性)——Radboud 系生存预测三代任务线;OWE 的 508 vs CHIMERA 的 267——数据规模与模态宽度的反相关(单模态可以更大)
§5 评估体系:五阶段流水线全解
§5.1 资格线的哲学(C-index≥0.65)
- 隐藏测试队列上 C-index 排名;≥0.65 才进可解释性评估
- 官方理由:“below that threshold, the prognostic signal is too weak for the explanation to mean much”
- 设计洞察:解释的价值依附于预测的价值——弱预测+漂亮热图=过度解读的温床(医学 AI 可解释性文献的核心担忧)
- 0.65 的选择:LEOPARD 系任务的实践中位水平(低到可及、高到信号真实)
§5.2 扰动忠实性(Automatic faithfulness)
- 流程:归因图标记的高相关区域逐步移除(progressively removed)→模型输出变化曲线 vs 随机区域移除的对照曲线
- 判据:两条曲线的 gap 越大=归因越忠实(“A larger gap means a more faithful explanation”)
- 方法论出处:deletion/insertion 曲线(RISE 系可解释性文献的标准协议)——OWL 把 CV 社区的 faithfulness 度量移植到病理 WSI
- 粒度自洽:归因图按组织 mask spacing(区域级)→移除也按区域级
§5.3 AI 专家面板(Likert 七维)
评审对象:手稿/代码/指标/预测/归因图/报告全件(manuscripts, code, metrics, predictions, attribution maps, and reports)——不是只看分数,是看整个方法学包。≥3 位专家/提交,Likert 量表七维:
- relevance + applicability(hypothesis-free scientific discovery 的相关性/适用性)
- clarity(清晰度)
- scientific plausibility(科学合理性)
- meaningful novelty(有意义的新颖性)
- usefulness for understanding model behaviour(对理解模型行为的有用性)
- transferability(向其他病理问题迁移性)
- risk of hallucination(幻觉风险——解释编造的程度)
"risk of hallucination"作为独立评审维度是本评估体系最具时代性的设计——LLM 时代的解释生成(报告可以是大模型写的)必须显式检测编造。
§5.4 病理医师面板(四维)
- 评审人:执业病理医师+trainee(含受训者——新手视角也是临床接受度的一部分)
- ≥2 人/提交;每提交抽病例子集(评审成本控制)
- 四维:clinical meaningfulness/alignment with the image evidence(与图像证据对齐——归因是否真落在医师认可的证据上)/usefulness for understanding and questioning the prediction(理解与质疑预测的有用性——"质疑"进维度)/support for clinical understanding
- 双面板的分工:AI 专家评"方法学质量"(faithfulness/novelty/hallucination);病理医师评"临床可信度"(meaningfulness/alignment)——可解释性的两可接受面
§5.5 终评合成
加权和(weighted sum of aggregated scores)——权重未披露(评估页未给出五阶段分数的具体权重)——口径注存照。
§6 时间线与参与生命周期
| 日期 | 事件 | 说明 |
|---|---|---|
| 2026-08-22 | 官宣 | 联合 WACV+CVPath Workshop |
| 2026-09-25(时点) | GC 显示 Not accepting submissions/15 participants | 主窗口未开/已闭,冷启动 |
| 2026-10-16 | Testing leaderboard 开放 | 主提交窗口 |
| 2026-11-06 | CVPath@WACV 2027 论文截止 | 可用开发数据结果 |
| 2026-11-30 | Testing leaderboard 提交截止 | 测试窗口关闭 |
| 2026-12-15 | 决赛邀请 | finalists+speakers |
| 2027-01-04~07 | WACV workshop 宣奖 | 页面笔误"2026"存照;WACV 2027=01-04~08 Orlando |
| 2027-02 | External Validation Phase 开放 | 赛后长期 benchmark |
- 生命周期设计:挑战赛→workshop 宣奖→External Validation Phase(外部验证常态化)——五连唯一显式的赛后延续阶段(对照 CHIMERA-agent 的 Debug 延续是赛前行为)
- 参与度:15 participants(GC 动态)——五连最低(对照 autoPET V 266/CHIMERA-agent 302)——小而精定位的实证
§7 与可解释性方法生态的关系
§7.1 热图之后的下一站
- 现状(官方引言):预后 AI 的可解释性"remains largely limited to attention heatmaps"——ABMIL 注意力/Grad-CAM 类热图是病理 AI 解释的事实标准
- 热图的已知问题:忠实性未经检验(注意力≠因果)/分辨率与组织学结构错配/无生物学语义
- OWL 的三箭:扰动忠实性(检验热图是否真承载信号)+概念归因与文本解释(超越热图的语义层)+专家面板(语义层的裁定)——从"给热图"到"为热图负责"
§7.2 科学发现(biomarker discovery)的格式化
- "hypothesis-free scientific discovery"进入评审维度——解释的目标读者不仅是医生,还有假说生成管线
- 输出 4 的自由格式(concept attributions/textual explanation)=为下游 LLM/知识图谱消费预留的接口——病理 AI 解释的结构化前夜
- 与 533 CHIMERA-agent 的对照:agent 版要求"推理轨迹"(决策过程)——OWL 要求"证据解释"(组织学语义)——可解释性的两个互补面(行为层 vs 证据层)
§7.3 方法候选谱(参赛者可能的路线)
- 热图+扰动校准(attention→deletion 曲线正则)
- 概念瓶颈模型(CBN:形态学概念→风险)——概念归因天然适合报告
- 原型方法(ProtoPetc 类:案例原型作为解释单元——病理教学语义)
- 多实例可解释聚合(ABMIL 注意力+实例级文本化——LLM 报告生成)
- 上述路线在无 GT 环境下的比较正是 OWL 要生成的数据——OWL 的元产出是"解释方法排行榜"本身
§8 伦理、许可与可获取性
- 可获取性档位:注册墙型(GC Join→LEOPARD 下载页→2TB)——五连中最低档(对照 autoPET V 三载体冗余/CHIMERA AWS Registry/TopBrain Zenodo 直下)
- 许可未独立明示:GC 注册条款+LEOPARD 下载页条款约束——条目内记口径注(五连中许可透明度最低)
- 伦理:Radboudumc 单中心回顾队列;IRB 编号未披露;同意模式未展开——伦理披露度为五连最低(对照 530 双 IRB 明文/533 同意明示)
- 弱监督声明的伦理面:无区域金标=无标注者负担描述需求——但归因图将"模型关注区"与"病理证据"对齐(医师面板第 2 维)承担了语义监督的角色
§9 库内定位
- 任务谱系第七族:可解释性/科学发现(预测+归因+文本解释三件套输出——分类/检测/文本/生成/分割/生存之外的新族)
- 评估体系第五形态:资格线+扰动忠实性+双专家 Likert——人类评审进排名(DAIMS 第三种评分结构)
- 元研究型条目:评测对象=解释质量——DAIMS 各维度需按"可解释性资产"重估(文档完备→协议完备/标注质量→标签+mask/可复现→扰动法公开度)
- DAIMS 预估 7.2(详见附录 H 评分卡)
FAQ:28 问直答
Q1:OWL 是什么的缩写?
Observing What Models Learn——“观察模型学到什么”。名字即任务:不看模型预测多准,看模型的解释是否真实。
Q2:谁主办的?
Radboudumc(荷兰拉德堡德大学医学中心)Khrystyna Faryna 团队——与 CHIMERA 挑战赛双论文作者同一人,Radboud 生态在 GC 平台的又一挑战赛。
Q3:对接哪个会议?
WACV 2027 的 CVPath Workshop(2027-01-04~08,Orlando)——GC 五连中唯一走 CVF 线(前四发均 MICCAI 系)。2026-08-22 官宣。
Q4:任务具体要求什么?
四输出一体:①time-to-BCR 连续预测(年,float);②low/medium/high 三档风险(必须从自己的时间预测派生);③空间归因图(8-bit 多分辨率 TIFF,spacing 跟组织 mask);④每例一份 ≤5 页人类可读解释报告(PDF)。
Q5:数据多大?
508 例根治术 H&E WSI(Radboudumc 单中心,每例一患者)——金字塔 TIF(第 0 层全分辨率+4× 逐层降采样),大多数 WSI 多切片拼装,总量 2 TB。
Q6:数据和 LEOPARD 什么关系?
完全同源——LEOPARD 挑战赛(H&E WSI time-to-BCR 前作)的训练集就是这 508 例;OWL 的数据下载页直接跳转 LEOPARD 的下载页(Join OWL 后经 LEOPARD 取数)。
Q7:标签格式?
training_labels.csv 三字段:case_id(患者标识)/event(是否复发 0/1)/follow_up_years(复发或末次随访年数)——标准删失生存格式;另附官方组织 mask。
Q8:怎么下载?
GC 平台 Join OWL(右上角绿钮)→跳转 LEOPARD data-download 页→注册获取(2 TB,注册墙型)。
Q9:什么许可?
页面未独立明示——受 GC 注册条款+LEOPARD 下载页条款约束;引用时注明"许可经注册条款"(五连中许可透明度最低档)。
Q10:评估流程怎么走?
五阶段:①Debug 容器自检→②隐藏测试 C-index 排名(≥0.65 资格线)→③扰动忠实性自动评估→④AI 专家面板(≥3 人 Likert 七维)→⑤病理医师面板(≥2 人四维)→加权和终评。
Q11:为什么设 C-index 0.65 资格线?
官方原话:“低于此阈值,预后信号太弱,解释无意义”——解释的价值依附于预测价值;弱预测+漂亮热图=过度解读温床。
Q12:扰动忠实性怎么算?
归因图标记的高相关组织区域逐步移除→模型输出变化 vs 随机区域移除的对照——gap 越大解释越忠实(deletion 曲线协议的病理移植)。
Q13:AI 专家面板评什么?
手稿/代码/指标/预测/归因图/报告全件,≥3 人 Likert 七维:hypothesis-free discovery 的相关性/清晰度/科学合理性/有意义新颖性/理解模型行为的有用性/迁移性/hallucination risk(幻觉风险)。
Q14:病理医师面板评什么?
执业病理医师+trainee(含受训者)≥2 人,抽病例子集,四维:临床意义/与图像证据对齐/理解与质疑预测的有用性/对临床理解的支持。
Q15:为什么"幻觉风险"是独立维度?
解释报告可以由 LLM 生成——编造(不存在的形态学证据)必须显式检测;LLM 时代可解释性的核心风险被写进了评分表。
Q16:弱监督是什么约束?
时间与风险预测只允许从 patient-level 结局(event/随访时间)学习——禁止区域级标注监督(否则解释退化为复述标注,失去科学发现意义)。
Q17:三档风险为什么要求自派生?
防止"时间模型+独立三分类模型"两张皮——输出 1/2 必须内在自洽(可解释性的前提是预测系统一致)。
Q18:归因图为什么要求区域级 spacing?
与扰动分析的移除粒度自洽(区域移除)+与组织 mask 对齐(评估的分辨率基准)——像素级归因在本框架下不可比。
Q19:多切片拼装是什么?
大多数 WSI 由多张物理切片打包成一个 case 文件——患者为单位而非切片单位;解析时需处理文件内多区域结构(task 页有四例图示)。
Q20:参与情况如何?
15 participants(GC 动态 2026-09-25;Not accepting submissions——主窗口 10-16 再开)。五连最低(对照 autoPET V 266/CHIMERA-agent 302)——可解释性+病理知识的双门槛使然。
Q21:有奖金吗?
页面未见披露——五连中唯一无奖金信息的条目(对照 autoPET V €6,000)。
Q22:有官方 baseline 吗?
未见官方仓库披露(对照 autoPET V 的 lab-midas 仓库/CHIMERA 的 DIAGNijmegen)——baseline/参考实现缺位是五连最低;社区有 CSDN 中文实现旁证(ResNet2d,R² 0.878 博主自验,非官方)。
Q23:时间线有什么要注意的?
①页面笔误:"4-7 January 2026"应为 2027(WACV 2027=01-04~08 Orlando,CVF 官网确认);②CVPath 论文截止(11-06)早于测试提交截止(11-30)——先论文后成绩的双轨;③2027-02 External Validation Phase——赛后长期外部验证(五连唯一显式赛后延续设计)。
Q24:和库内 CHIMERA 条目什么关系?
双连线:①主办人 Faryna 同人(CHIMERA 双论文作者);②任务同族(前列腺 time-to-BCR——CHIMERA Task 1 的 267 例 vs OWL 的 508 例,同构删失标签+C-index);③数据代际(LEOPARD→CHIMERA 多模态→OWL 可解释性——Radboud 生存预测三代线)。
Q25:和 LEOPARD 什么关系?
数据级前作(508 例完全同源+下载复用)+任务级对照(LEOPARD 评预测、OWL 评解释——同数据两代评估哲学)。
Q26:适合做什么、不适合做什么?
适合:归因方法 faithfulness 基准、可解释生存建模、概念归因/文本解释的病理适配、AI 信任研究(hallucination/质疑维度)。不适合:区域金标监督学习(弱监督约束)、跨中心泛化训练(单中心)、临床部署。
Q27:2027-02 的 External Validation Phase 是什么?
赛后开放的外部验证阶段——新队列持续测试(benchmark 延续设计);五连中唯一的"赛后生命周期"显式规划——挑战赛成绩之外的长期价值通道。
Q28:一句话定位?
可解释性的第一次系统竞赛——给"AI 的解释"立评分表的元研究尝试,也是 GC 五连中"人类评审直接进排名"的唯一样本。
事实清单:32 条硬事实+7 条口径注
硬事实(F1-F32)
| # | 事实 | 信源 |
|---|---|---|
| F1 | 全名 Observing What Models Learn | GC 主页 |
| F2 | 定位:evaluating interpretable AI methods for scientific discovery in computational pathology | GC 主页 |
| F3 | 动机:解释评估缺乏原则性框架(注意力热图局限) | GC 主页 |
| F4 | 代表任务:prostatectomy WSI 的 BCR 预测 | GC 主页/task 页 |
| F5 | 本质困难:无 interpretability ground truth | task 页原文 |
| F6 | 四输出:时间 float+三档风险+归因 TIFF+≤5 页 PDF | task 页 |
| F7 | 弱监督声明(patient-level outcomes only)×2 | task 页 |
| F8 | 三档风险必须自派生(from own predictions) | task 页 |
| F9 | 归因图:8-bit uint 多分辨率 TIFF,spacing 跟组织 mask | task 页 |
| F10 | 报告:每例 PDF ≤5 页,自由格式(concept attributions/textual) | task 页 |
| F11 | 508 例/Radboudumc/每例一患者 | data 页 |
| F12 | 金字塔 TIF:第 0 层全分辨率+4× 逐层降采样 | data 页 |
| F13 | 多切片拼装(multiple slides packed together) | data 页 |
| F14 | 2 TB 总量;Join 后经 LEOPARD 下载页获取 | data 页 |
| F15 | training_labels.csv:case_id/event/follow_up_years | data 页 |
| F16 | 与 LEOPARD 训练集完全一致(下载页跳转实证) | data 页+CSDN |
| F17 | Debug phase:容器 sanity check | evaluation 页 |
| F18 | C-index 资格线 0.65(“too weak for the explanation to mean much”) | evaluation 页 |
| F19 | 扰动忠实性:高相关区逐步移除 vs 随机区域,gap 大=忠实 | evaluation 页 |
| F20 | AI 专家面板:≥3 人/提交,评手稿/代码/指标/预测/归因/报告全件 | evaluation 页 |
| F21 | Likert 七维(含 hallucination risk) | evaluation 页 |
| F22 | 病理面板:执业医师+trainee ≥2 人,病例子集,四维(含"质疑预测") | evaluation 页 |
| F23 | 终评=聚合分数加权和(权重未披露) | evaluation 页 |
| F24 | 2026-08-22 官宣(WACV+CVPath 联合) | timeline 页 |
| F25 | 10-16 排行榜开放/11-06 CVPath 论文截止/11-30 提交截止/12-15 决赛邀请 | timeline 页 |
| F26 | WACV workshop 宣奖 2027-01(页面笔误 2026) | timeline 页+CVF 官网 |
| F27 | 2027-02 External Validation Phase 开放 | timeline 页 |
| F28 | Radboudumc Khrystyna Faryna 团队主办 | CSDN(二源) |
| F29 | 15 participants(GC 动态)/Not accepting submissions | GC 首页动态 |
| F30 | 无奖金信息披露 | 页面缺位 |
| F31 | 无官方仓库披露(对照 autoPET V/CHIMERA) | 页面缺位 |
| F32 | CVF 官网:WACV 2027=2027-01-04~08 Orlando | thecvf.com |
口径注(N1-N7)
| # | 注 | 处理 |
|---|---|---|
| N1 | timeline 年份笔误("January 2026"应为 2027) | 以 CVF 官网为准;存照 |
| N2 | 终评权重未披露 | 记录"weighted sum, weights undisclosed" |
| N3 | 许可未独立明示 | GC 注册条款+LEOPARD 条款 |
| N4 | 测试队列规模未披露 | 隐藏设计一部分 |
| N5 | 15 participants 为 2026-09-25 时点(主窗口未开) | 动态数据引用标注时点 |
| N6 | CSDN 实现(R² 0.878/MAE 0.86)为博主自验非官方 | 参考实现旁证 |
| N7 | 组织团队全名单未见(organization 页不存在) | Faryna 为已确认核心 |
术语表:36 条
| 术语 | 释义 |
|---|---|
| OWL | Observing What Models Learn:可解释 AI 科学发现竞赛(本条目) |
| OWL(他域) | Web Ontology Language:W3C 本体语言(检索撞车源) |
| 可解释性(interpretability) | 模型判断依据的可理解呈现 |
| faithfulness | 忠实性:解释与模型真实决策依据的一致程度 |
| 扰动分析 | 移除归因高相关区观察输出变化——faithfulness 的自动度量 |
| deletion 曲线 | 逐步移除的输出退化曲线(RISE 系协议) |
| attribution map | 归因图:输入空间上标注预测贡献的热图/掩膜 |
| spatial attribution | 空间归因:WSI 上标注关注组织区域 |
| 概念归因 | 以形态学概念(而非像素)为解释单元 |
| hypothesis-free discovery | 无假设发现:不预设生物学假说的数据驱动发现 |
| biomarker discovery | 生物标志物发现:从数据中识别新预后指标 |
| BCR | Biochemical Recurrence 生化复发(同 533) |
| time-to-BCR | 复发时间:删失生存端点(年) |
| 弱监督 | 仅患者级结局监督(无区域金标) |
| 删失 | event=0 时的末次随访截断(生存分析核心概念) |
| C-index | 一致性指数(同 533);OWL 资格线 0.65 |
| Likert 量表 | 心理测量学评分表(OWL 面板用分级打分) |
| hallucination risk | 幻觉风险:解释含编造证据的程度(Likert 维度之一) |
| expert panel | 专家面板:多评审人结构化打分 |
| AI expert panel | OWL 的方法学评审组(≥3 人七维) |
| pathology expert panel | 病理医师评审组(≥2 人四维,含 trainee) |
| clinical meaningfulness | 临床意义(病理面板维度 1) |
| alignment with image evidence | 与图像证据对齐(维度 2) |
| 质疑预测 | questioning the prediction:医师面板的批判性维度 |
| 金字塔 TIF | 多分辨率 tiled TIFF(第 0 层全分辨率+4× 降采样) |
| 多切片拼装 | 一个 WSI 文件打包多张物理切片 |
| 组织 mask | 官方提供的前景组织掩膜(归因 spacing 基准) |
| LEOPARD | Radboud 系前作挑战(H&E WSI time-to-BCR,508 例同源) |
| Radboudumc | 荷兰拉德堡德大学医学中心(主办) |
| Khrystyna Faryna | OWL 主办人(CHIMERA 双论文作者同人) |
| WACV 2027 | IEEE/CVF 冬季计算机视觉应用会议(01-04~08 Orlando) |
| CVPath | Computational Pathology Workshop@WACV |
| External Validation Phase | 赛后外部验证阶段(2027-02 起) |
| testing leaderboard | 测试排行榜(10-16 开放/11-30 截止) |
| Debug phase | 容器自检阶段(平台/本地输出一致性) |
附录
附录 A:四输出的提交规格卡
| 输出 | 文件规格 | 约束 |
|---|---|---|
| 1. 时间预测 | float(年,如 1.23/17.68) | 弱监督训练 |
| 2. 风险分档 | low/medium/high | 从输出 1 派生(禁独立分类器) |
| 3. 归因图 | 8-bit uint 多分辨率 TIFF | spacing=组织 mask;区域级 |
| 4. 解释报告 | PDF ≤5 页/例 | concept attributions/文本等自由格式 |
容器化:GC Algorithm 提交(Debug phase 先自检平台/本地一致性)。
附录 B:五阶段评估流水线图解
[① Debug] 容器自检(训练例输出一致性)
↓
[② Test 资格线] 隐藏测试 C-index 排名
↓ C-index ≥ 0.65(未过线=出局,"信号太弱解释无意义")
[③ Automatic faithfulness]
归因高相关区逐步移除 ──→ 输出退化曲线 A
随机区域逐步移除 ──────→ 输出退化曲线 B
gap(A,B) 越大 = 越忠实
↓
[④ AI expert panel] ≥3 人 × Likert 七维
(相关性/清晰度/合理性/新颖性/行为理解/迁移性/幻觉风险)
↓
[⑤ Pathology expert panel] ≥2 人(含 trainee)× 四维 × 病例子集
(临床意义/图像证据对齐/理解与质疑/临床理解支持)
↓
[终评] 聚合分数加权和(权重未披露)
附录 C:扰动忠实性的最小实现示例
import numpy as np
def deletion_gap(attrib_map, tissue_mask, predict_fn, n_steps=10, seed=0):
# attribution_map: 区域级归因(spacing=组织 mask)
# predict_fn(region_wsi) -> time_prediction(容器推理接口)
rng = np.random.default_rng(seed)
region_ids = np.unique(tissue_mask[tissue_mask > 0])
# 区域按归因分数降序 = "高相关优先移除"
order_by_attr = region_ids[np.argsort(-attrib_map[tissue_mask > 0])]
# 对照:随机移除顺序
order_random = rng.permutation(region_ids)
def curve(order):
deltas, base = [], predict_fn(region_wsi=tissue_mask)
for i in range(1, n_steps + 1):
removed = set(order[: int(len(order) * i / n_steps)])
perturbed = np.isin(tissue_mask, list(removed))
masked = region_wsi.copy()
masked[perturbed] = 0 # 区域涂黑(或染空白色)
deltas.append(abs(base - predict_fn(region_wsi=masked)))
return deltas
d_attr, d_rand = curve(order_by_attr), curve(order_random)
# gap 越大 = 归因越忠实(evaluation 页定义)
return float(np.mean(d_attr) - np.mean(d_rand))
(实现细节以官方评估管线为准;本示例演示协议结构:高相关优先移除 vs 随机移除的输出退化差。)
附录 D:LEOPARD→OWL 的数据复用链
| 环节 | LEOPARD(前作) | OWL(本条) |
|---|---|---|
| 数据 | 508 例 Radboudumc 根治术 WSI | 同一批(训练集完全一致) |
| 标签 | event+follow_up_years | 同(training_labels.csv) |
| 下载 | GC 注册+data-download 页 | 复用 LEOPARD 下载页(Join OWL 后跳转) |
| 任务 | time-to-BCR 预测 | time-to-BCR+归因+解释 |
| 评估 | C-index 榜 | C-index 资格线+解释五阶段 |
| 角色 | 数据供给+任务基线 | 评估范式升级层 |
复用链的意义:数据不动、问题升级——“同一批 WSI,LEOPARD 问预测多准,OWL 问解释可不可信”——挑战赛系列的数据效率样本(对照 autoPET V 的系列扩容路线:数据加新库 vs OWL 的评估加新维)。
附录 E:GC 核查模板 v1.6 执行记录(4 轮)
| 轮 | 动作 | 收获 |
|---|---|---|
| R1 | WebSearch 定位 | 消歧(OWL vs 本体语言)+Radboudumc/Faryna+508 例/2TB/LEOPARD 同源+任务四输出 |
| R2 | GC 主页+task 页 | 四输出规格+弱监督声明+本质困难原文 |
| R3 | evaluation 页+库内查证(LEOPARD/owl 均无条目) | 五阶段流水线全细节+资格线 0.65+Likert 七维+库内无 LEOPARD(前作锚记录) |
| R4 | data 页+timeline 页+CVF 官网 | 508/2TB/金字塔 TIF/多切片拼装+时间线全表+年份笔误发现+WACV 2027 确认 |
页面极简型核查:OWL 四页(主页/task/evaluation/data/timeline)+无 FAQ/无 organization/无官方仓库——v1.6 模板新增"页面极简型"档:信源密度低时**二手信源(CSDN 技术博客)+平台人物关系(Faryna 连线)**补强,逐条标注信源等级。
附录 F:多义名消歧表(五连第二例)
| 名称 | 身份 | 判别特征 |
|---|---|---|
| OWL(本条) | Observing What Models Learn:可解释 AI 科学发现竞赛 | owl.grand-challenge.org;病理 WSI;508 例 |
| OWL(W3C) | Web Ontology Language:语义网本体语言 | RDF/SPARQL 语境 |
| owl(意象) | 猫头鹰:观察隐喻(命名本体) | 任务名直译 |
| OWL(他域杂项) | 各类缩写(在线 Web 库/组织名) | 非病理非本体语境 |
附录 G:伦理与披露度对照(五连横向)
| 维度 | 531 LMC2 | 532 TopBrain | 533 CHIMERA | 534 autoPET V | 535 OWL |
|---|---|---|---|---|---|
| 中心数 | 法国 23 站点 | UZH 等 | 荷兰两机构+国际联盟 | 五机构三国 | 荷兰单中心 |
| IRB 披露 | 细胞系轴 | UZH 明文 | 同意明示/编号缺 | TCIA 链背书 | 未披露 |
| 标注资质 | 未详 | 统一方案 | BRS 溯源 | 分级披露 | 未详(弱监督免标注) |
| 许可 | CC BY 4.0 | open data.swiss | CC BY-NC-SA 4.0 | TCIA(CC BY 类) | 注册条款(未独立明示) |
| 数据获取 | 注册墙 | Zenodo 直下 | AWS 无账户 | 三载体冗余 | 注册墙+LEOPARD 复用 |
| 披露度名次 | 3 | 1 | 2 | 2 | 5 |
五连伦理-披露光谱:autoPET V/TopBrain(明文型)→CHIMERA(混合型)→LMC2(载体背书型)→OWL(缺位型)——AI-Ready 评估的"披露度"维度需要显式分档,缺位型条目(单中心+注册墙+许可不明)在可获取性/伦理两维天然扣分。
附录 H:DAIMS 评分卡(预估 7.2——元研究型第三种结构)
| 维度 | 分 | 依据 |
|---|---|---|
| 文档完备 | 7 | 四页齐备但极简:无 FAQ/无 organization/无仓库;评估协议披露完整是亮点 |
| 标注质量 | 8 | 删失标签标准+组织 mask+弱监督声明清晰;单中心规模限制 |
| 可复现 | 7 | 扰动评估协议公开(逻辑层);无参考实现+无 GT 是本质限制 |
| 可获取性 | 6 | 注册墙+2TB+LEOPARD 复用+许可不明——五连最低 |
| 伦理合规 | 7 | 单中心+IRB/同意未展开;弱监督免除标注负担描述 |
| 加权 | ≈7.2 | 元研究型:评估协议创新加分 vs 披露缺位扣分——第三种结构(对照 CHIMERA 7.6/TopBrain 7.8/autoPET V 7.7/LMC2 6.9) |
元研究型评分要点:评测对象是"解释"——文档完备度的重心从数据字典转向评估协议完备度(OWL 的五阶段披露完整);可复现性重心从"结果可重现"转向"faithfulness 可测"。
附录 I:时间线全景
| 日期 | 事件 |
|---|---|
| (前史) | LEOPARD 挑战赛运行(508 例 H&E time-to-BCR) |
| 2024-04 | GC 用户内容图床的时间戳(data 页四例图 2024/04/18——数据资产早已备置) |
| 2026-08-22 | OWL 官宣(WACV+CVPath 联合) |
| 2026-09-25(时点) | GC 动态:15 participants/Not accepting submissions |
| 2026-10-16 | Testing leaderboard 开放 |
| 2026-11-06 | CVPath@WACV 2027 论文截止 |
| 2026-11-30 | Testing leaderboard 提交截止 |
| 2026-12-15 | 决赛邀请 |
| 2027-01-04~07 | WACV workshop 宣奖(页面笔误 2026) |
| 2027-02 | External Validation Phase 开放 |
附录 J:坑点表
| 坑点 1 | 三档风险独立训练分类器——违反自派生要求(必须从自己的时间预测派生) |
| 坑点 2 | 区域级金标监督——违反弱监督约束(解释退化为标注复述) |
| 坑点 3 | 归因图像素级输出——spacing 必须跟组织 mask(区域级),像素级不可评 |
| 坑点 4 | 多切片拼装未处理——一个 case 多张物理切片,滑窗直接跑会把切片接缝当组织 |
| 坑点 5 | 2TB 下载无策略——金字塔 TIF 建议按层级流式读取(openslide level 接口) |
| 坑点 6 | 报告超 5 页——PDF 硬上限(评审成本设计) |
| 坑点 7 | 解释文本由 LLM 生成未校验——hallucination risk 维度会直接惩罚编造证据 |
| 坑点 8 | 把 LEOPARD 的历史方案直接套——OWL 评的是解释不是纯预测(0.65 只是入场券) |
| 坑点 9 | 引用 timeline 年份不核对——"January 2026"笔误应 2027 |
| 坑点 10 | 忽略 External Validation Phase——赛后新队列可能公开,长期 benchmark 机会 |
附录 K:人名与机构
| 人名/机构 | 角色 |
|---|---|
| Khrystyna Faryna | 主办人(Radboudumc;CHIMERA 双论文作者+GC 平台 inquiry 联系人同人) |
| Radboudumc | 主办机构(计算病理组生态——DIAG/GC 平台运营方同生态) |
| WACV 2027/CVPath | 会议与工作坊(学术出口) |
| LEOPARD 挑战赛 | 数据供给前作(508 例同源) |
附录 L:口径速查卡
| 口径 | 数字 | 备注 |
|---|---|---|
| 训练例 | 508 | Radboudumc 单中心 |
| 数据量 | 2 TB | 金字塔 TIF |
| 降采样 | 4×/层 | 第 0 层全分辨率 |
| 输出 | 4 件 | 时间/风险/归因/报告 |
| 报告上限 | 5 页/例 | |
| 资格线 | C-index 0.65 | 隐藏测试 |
| AI 面板 | ≥3 人×7 维 | Likert |
| 病理面板 | ≥2 人×4 维 | 含 trainee |
| 参与度 | 15 | 2026-09-25 时点 |
| 提交截止 | 2026-11-30 | testing |
| 宣奖 | 2027-01-04~07 | WACV Orlando(页面笔误 2026) |
| External Validation | 2027-02 | 赛后延续 |
附录 M:跨条目联动矩阵
| 联动条目 | 联动点 | 类型 |
|---|---|---|
| 533 chimera | Faryna 同人+前列腺 BCR 同任务族+Radboud 生态 | 人物+任务双连线 |
| 534 autopet-v | 评估体系两极(Likert 面板 vs AUC 指标)+GC 五连同批 | 方法论对照 |
| 532 topbrain2026 | GC 五连同批+MICCAI 2026 vs WACV 2027 会议线对照 | 同批 |
| 531 lightmycells2 | GC 五连同批 | 同批 |
| LEOPARD(未入库) | 数据同源前作+下载复用链 | 前作锚记录 |
附录 N:GC 五连总结(五发合体方法论)
N.1 四档可获取性光谱(终版)
| 档 | 条目 | 特征 |
|---|---|---|
| 注册墙型 | 531 LMC2/535 OWL | GC Join+协议墙(OWL 另加 LEOPARD 复用) |
| 直下型 | 532 TopBrain | Zenodo 直下 |
| Registry 型 | 533 CHIMERA | AWS Open Data 无账户 |
| 三载体冗余型 | 534 autoPET V | TCIA+Zenodo+FDAT |
N.2 评估体系五形态(终版)
| 形态 | 条目 | 指标哲学 |
|---|---|---|
| 重建保真 | 531 LMC2 | SSIM/PCC+rank 平均 |
| 体素几何+污染物 | 532 TopBrain | Dice+clDice+HD95+contamination |
| 删失时序 | 533 CHIMERA | C-index+wF1(生存/分类双轨) |
| 交互效率 | 534 autoPET V | AUC-Dice+AUC-DMM 50/50 |
| 解释可信度 | 535 OWL | 资格线+扰动忠实性+双专家 Likert |
N.3 任务族七谱(本库挑战赛域)
分割(TopBrain)→生成(LMC2)→生存+分类(CHIMERA)→交互式分割(autoPET V)→可解释性科学发现(OWL)——五发覆盖五族;CHIMERA-agent(消歧记录)补充 agentic 决策族。
N.4 多义名消歧案例集
CHIMERA(神话/续作 agent/他域同名)与 OWL(本体语言/意象)——两例确立了"GC 子域+数据载体+评估形态"三锚消歧法。
N.5 五连贡献的方法论增量(模板 v1.0→v1.6 全程)
跨源五查(v1.0)→命名消歧/数字演化/前作锚分级/可获取性三档(v1.5)→系列前作锚档+三载体冗余+续作口径继承(v1.6)+页面极简型核查档+披露度分档(本条新增)——GC 挑战赛型条目生产模板至此成型。
附录 O:开放问题与观察点
- 参赛格局:10-16 testing 开放后的实际参与度(15 是冷启动数)——可解释性挑战的社区热度测试
- 冠军方法:2027-01 WACV 宣奖——热图校准/CBN/原型/LLM 报告四路线的胜负
- 扰动忠实性的边界:区域移除协议对"弥散型归因"(低幅度广分布)方法是否公允——评估方法学本身的后续讨论
- External Validation 队列:2027-02 公开的外部队列构成——508 例单中心局限的补全进度
- journal 出口:CVPath workshop 论文之后是否有 summary paper 升级(对照 CHIMERA 双 paper 模式)
- 库内回访:若 LEOPARD 未来入库,三线互链(LEOPARD-OWL-CHIMERA)——前列腺 BCR 任务族完整档案
附录 P:可解释性方法学全景(OWL 语境的六家族)
P.1 六家族对照
| 家族 | 机制 | 病理 WSI 适配 | OWL 评估中的位置 |
|---|---|---|---|
| 梯度/CAM 系 | 梯度×激活回传(Grad-CAM/HiResCAM) | 千兆像素显存瓶颈;patch 级拼接 | 输出 3 的传统来源 |
| 注意力系 | ABMIL/TransMIL 的 patch 注意力权重 | 天然 slide 级;但注意力≠因果 | 热图主流(官方批评对象) |
| 扰动系 | 输入扰动测敏感度(occlusion/RISE) | 计算昂贵但模型无关 | faithfulness 评估即此系 |
| 概念系 | 概念瓶颈/原型(CBM/ProtoPNet) | 形态学概念(腺体/间质/坏死)语义贴合 | 输出 4 的报告素材 |
| 反事实系 | 最小改变翻转预测的输入差 | WSI 上难定义"最小"( gigapixel 离散) | 研究向 |
| LLM 解释系 | VLM/LLM 生成文本解释 | 病理报告生成成熟;幻觉风险 | 输出 4 的高效来源+面板审查对象 |
P.2 官方的批评与建设
- 批评(主页):“explainability of state-of-the-art prognostic AI remains largely limited to attention heatmaps”——注意力热图=现状天花板
- 建设:扰动忠实性(检验)+概念/文本(升级)+专家面板(裁定)——三步把解释从"产物"变成"可问责产物"
P.3 区域级归因的技术含义
- 输出 3 的 spacing=组织 mask→归因单位是组织区域(连通域/超级像素级)
- 对方法的要求:patch 注意力需聚合到区域;概念归因需空间化——方法与评估粒度的对齐是第一工程问题
附录 Q:faithfulness 评估的文献脉络(deletion 曲线的谱系)
- RISE(PETKović 2018):随机掩码采样+输出变化→重要性图;deletion/insertion 曲线首次系统化——逐步移除(或加入)高归因区,曲线下面积=解释质量
- infidelity/sensitivity(Yeh 2019):扰动一致性的公理化度量
- MBA/sanity check(Adebayo 2018):模型随机化测试——归因图对模型权重随机化的敏感度(边缘化检验)
- OWS 的移植:区域级(非像素)+病理 WSI(非自然图)+随机区域移除作对照(不只是自身退化,还有基线对照——gap 语义)
- 未解问题:移除填充物(涂黑/染空白/平均色)对代谢-形态模型的语义影响——病理组织的"移除"语义比自然图像复杂(附录 J 坑点 3 的方法论根源)
附录 R:病理 WSI 处理工程卡(pyramidal TIF 实操)
R.1 读取
import openslide, tifffile
sl = openslide.OpenSlide("case_0123.tif")
print(sl.level_count, sl.level_dimensions) # 金字塔层数/各层尺寸
lv = 2 # 中间层(2048² 量级)
img = sl.read_region((0, 0), lv, sl.level_dimensions[lv]).convert("RGB")
R.2 多切片拼装检测
- 同一 WSI 文件内多张物理切片→空间上分离的组织大区
- 检测:组织 mask 连通域分析——大间距多主连通域=多切片拼装
- 处理:每切片独立采样/独立归因——接缝伪影防止(坑点 4)
R.3 tile 采样策略
- 组织 mask 内均匀 tile(0.5mpp 等效 256²/512²)→UNI/CTransPath 特征→ABMIL
- 千兆像素全扫不现实——mask 引导的 foreground 采样是标配
- 多分辨率:低层(粗)筛区域+高层(细)提特征的两级管线
R.4 2TB 的存储与算力预算
- 508 例×~4GB/例;本地 SSD 缓存常用层(level 2-3)
- ABMIL 训练单卡可跑(特征预提取后);端到端微调需 A100 级
- 归因图生成:区域级打分→回写金字塔 TIFF(评估接口)
附录 S:生存分析建模路径(508 例删失数据)
S.1 从标签到损失
- event+follow_up_years→Cox partial likelihood(连续时间)/离散化离散时间 log-likelihood/DeepSurv 框架
- 533 CHIMERA 的删失 C-index 配对规则同样适用(OWL 官方 C-index 评估)
- 输出 1 要求连续时间预测——Cox 基线风险累积→中位/期望时间的映射(或直接回归+删失加权)
S.2 架构谱(LEOPARD 遗产)
- LEOPARD 时代:ABMIL/TransMIL+UNI/CTransPath 特征——508 例的主流配方
- OWL 新增要求:归因图输出——ABMIL 注意力天然可回写(patch→区域聚合)——注意力系与输出 3 的零成本对接(但 faithfulness 未必高——附录 P 的批评)
- 校准:时间预测的校准曲线(输出 1 是 float——校准影响三档派生的阈值合理性)
S.3 三档派生的阈值设计
- 从自己的时间分布派生:训练集时间分位数(如 3/7 年)→low/medium/high 边界——阈值固定并在报告中披露(可解释性的一部分)
- 反例(违规):独立训练三分类器(坑点 1)
附录 T:弱监督的科学发现逻辑
T.1 为什么禁止区域金标
- 若用 Gleason 分区/病灶金标监督:模型的"解释"=标注的复读——发现(discovery)的定义即"找到标注之外的模式"
- 信息瓶颈视角:patient-level 结局是唯一信息源→模型必须自己把结局信号分配到空间——分配结果就是可检验的假说
T.2 假说生成的闭环
- 模型从 508 例学习"什么形态→早复发"
- 归因图高亮"模型认为的早复发形态区"
- 病理医师面板判"这形态有临床意义吗"(维度 1-2)
- AI 面板判"这发现新颖吗/可迁移吗"(维度 1/4/6)
- 高分解释→下游湿实验假说(OWL 的终局定位)
T.3 多重检验警示
- 508 例上的"发现"天然多重比较——expert panel 的"scientific plausibility"维度=人工先验过滤
- External Validation(2027-02)=发现的独立复测——发现类声明的标准流程(发现→面板过滤→外部验证)
附录 U:专家面板的方法学设计
U.1 Likert 七维的心理测量学
- 每维 1-5(或 1-7)打分→提交内多例平均→面板内平均
- 评审者间一致性:ICC/Krippendorff α——面板质量的元指标(OWL 未承诺披露——观察点)
- 七维的维度相关性预期(novelty 与 plausibility 常负相关)——加权合成时的冲突处理
U.2 含 trainee 的设计意图
- 执业医师=临床有效性裁判;trainee=可读性/教学价值裁判(新手能否从解释学到东西)
- “usefulness for understanding and questioning the prediction”——质疑维度把 AI 从"答案机"降位为"第二意见"——医疗 AI 伦理的先进表述
U.3 幻觉风险的操作化
- 检查点:解释中引用的形态学证据是否在 WSI 上可指认(alignment 维度交叉)
- LLM 生成报告的典型幻觉:不存在的结构命名/夸大局部分布/虚构分级术语——面板抽检+可指认性测试是检测路径
- 与 533 CHIMERA-agent 的幻觉惩罚呼应——2026 年"解释可信度"成为两个挑战赛的共同新维度
附录 V:LLM 生成解释的工作流与风险
V.1 典型管线
WSI → 特征(UNI)→ ABMIL → 风险 + 注意力
↓
概念检测(腺体形态/间质反应/坏死灶…)
↓
VLM/LLM:概念+注意力区 → 5 页报告
↓
归因图回写金字塔 TIFF
V.2 风险清单
- 结构幻觉:命名不存在的组织学结构(LLM 生成报告的头号风险)
- 分布夸大:把 5% 的模式说成"显著"
- 术语误用:分级/分期术语的临床语义错置
- 归因-文本不一致:文本说"高级别腺体"但归因图高亮间质——双输出一致性是面板对齐维度的直接检查点
V.3 缓解设计
- 概念检测前置(报告只引用可检测概念)——闭式词汇表
- 归因图与文本引用区域的自动对齐校验(提交前自检)
- 报告模板化(结构固定+槽位填充)——自由度换可控性
附录 W:External Validation Phase 的长期 benchmark 设计
- 设计定位:赛后(2027-02 起)持续开放的外部队列验证——挑战赛成绩的"保鲜机制"
- 对照五连:CHIMERA-agent 的 Debug 延续(赛前)/TopBrain 的 TA36 联合赛道(赛中)/OWL 的 External Validation(赛后)——挑战赛生命周期的三段式扩展样本
- 价值:①发现的独立复测(T.3);②方法排行榜的长期演化;③新队列(可能跨中心)补 508 例单中心短板
- 观察:外部队列规模/来源/是否含非荷兰数据——2027-02 揭晓(附录 O 观察点)
附录 X:前列腺癌 BCR 的临床背景补全(与 533/534 的三角联动)
X.1 三条数据线的同一问题
| 线 | 数据 | 模态 | 评估 |
|---|---|---|---|
| LEOPARD | 508 例 H&E | 仅病理 | C-index 榜 |
| CHIMERA Task 1(533) | 267 例 | 病理+MRI+临床 | C-index+后挑战分析 |
| OWL(535) | 同一 508 例 | 仅病理+解释 | C-index 资格线+解释五阶段 |
- LEOPARD/OWL 同数据:预测层结论可直接迁移(OWL 的 0.65 资格线对应 LEOPARD 榜单的中位水平)
- CHIMERA 的关键发现(临床单模态屠榜/多模态鲁棒)对 OWL 的推论:WSI-only 模型的解释是"信号恢复能力"的试金石——影像分支在变量缺失时的 ΔC≤0.04 意味着形态学信号真实存在——OWL 要求把它"说出来"
X.2 与 534 autoPET V 的示踪剂-形态学对偶
- PSMA PET(分子靶点显像)vs H&E(形态学金标准)——前列腺癌的两种"阳性"定义
- DeepPSMA 的 TTB(分子负荷)vs OWL 的归因图(形态学证据)——两种"病灶标注"的评估哲学对照
- 交叉问题:形态学解释能否预测分子显像负荷——跨模态假说(OWL 输出 4 的 transferability 维度的终极测试)
附录 Y:五个论文选题(使用者启发)
- faithfulness 协议比较:区域移除 vs 像素 occlusion vs 模型随机化(sanity check)——同一批 ABMIL 热图的三种 faithfulness 排名一致性
- 概念瓶颈 for BCR:形态学概念(腺体分化/间质/坏死)→风险的可解释管线——概念归因与医师面板四维的通过率
- LLM 报告的幻觉谱:VLM 生成解释的幻觉类型学(结构/分布/术语)与自动检测器(alignment 校验器)
- 多切片拼装的归因聚合:跨物理切片的注意力归因合并策略对 faithfulness 的影响
- 弱监督发现的迁移:OWL 模型的归因区在 CHIMERA Task 1 数据(267 例+MRI)上的跨验证——形态学发现的跨队列/跨模态持久性
附录 Z:四类读者的行动指南
Z.1 可解释性方法研究者:附录 P-Q 的方法谱+faithfulness 协议→ABMIL 注意力基线(最低成本参赛)→扰动校准训练(deletion gap 作为正则)→概念层升级(CBN/原型)→报告生成(附录 V 风险清单自检)。
Z.2 计算病理工程师:附录 R 的工程卡(金字塔读取/拼装检测/采样)→LEOPARD 时代配方(UNI+ABMIL)→归因回写(区域级 TIFF)→容器四输出接口→Debug phase 自检。
Z.3 病理与肿瘤临床研究者:附录 X 的三线对照→归因图的阅片审查(面板四维的日常版)→形态学假说的生成与验证路径(T.2 闭环)→Lu-177/PSMA 显像的交叉假说(X.2)。
Z.4 数据集管理者/AI-Ready 评估者:附录 G 的披露度分档→附录 H 的元研究型评分结构→附录 N 的五连终版光谱→"评估协议完备度"替代"数据字典完备度"的元研究评分范式。
附录 AA:存证链与口径汇总
| 事实组 | 存证信源 | 等级 | 抓取时点 |
|---|---|---|---|
| 定位/动机/四输出/评估五阶段 | owl.grand-challenge.org 四页 | 一手(官方) | 2026-09-25 |
| 508 例/2TB/LEOPARD 同源 | data 页+CSDN(二源一致) | 一手+二手 | 2026-09-25 |
| 主办人 Faryna/Radboudumc | CSDN(二手)+533 CHIMERA 论文作者列表(一手) | 二手+交叉 | 2026-09-25 |
| WACV 2027 日期 | thecvf.com(一手) | 一手 | 2026-09-25 |
| 时间线笔误 | timeline 页 vs CVF 官网对照 | 交叉验证 | 2026-09-25 |
| 15 participants/窗口状态 | GC 首页动态 | 一手(动态,标时点) | 2026-09-25 |
| CSDN 实现(R² 0.878) | 博主自验(非官方) | 旁证 | 2026-09-25 |
口径汇总:508(例)/2TB(体量)/4(输出件)/5(页报告上限)/0.65(C-index 资格线)/7+4(Likert 维度)/≥3+≥2(面板人数)/15(participants@0925)/2026-11-30(提交截止)/2027-01(宣奖,笔误修正)/2027-02(External Validation)
附录 AB:CHIMERA-agent vs OWL——2026 双可解释挑战对照(Radboud 双雄)
| 维度 | CHIMERA-agent(533 消歧记录) | OWL(535) |
|---|---|---|
| 会议 | MICCAI 2026(Abu Dhabi) | WACV 2027 CVPath(Orlando) |
| 主办 | Radboudumc(Khalili 等) | Radboudumc(Faryna 等) |
| 可解释对象 | 决策推理轨迹(行为层) | 组织学证据解释(证据层) |
| 任务 | 前列腺患者旅程三决策点 | 前列腺 BCR 预测+解释 |
| 输入 | 结构化 JSON(报告+变量+纵向 PSA) | 千兆像素 WSI |
| 反幻觉机制 | 幻觉推理惩罚(评估协议) | hallucination risk Likert 维度(面板) |
| 人类参与 | 泌尿科医生收集参考推理 | 双专家面板进排名 |
| 数据 | 新构建(agent 化 JSON) | LEOPARD 508 例复用 |
| 参与度 | 302 participants | 15 participants |
双雄合观:同一机构在 2026 年从两个方向攻击同一个问题——“AI 的医疗判断怎么被信任”——agent 路线管行为一致性(推理与输入对齐),OWL 管证据真实性(解释与病理对齐)——行为可解释性 vs 证据可解释性的分野;Radboud 在此领域的系列布局(LEOPARD→CHIMERA→CHIMERA-agent→OWL)是单一学术生态主导一个子领域的样本。
附录 AC:LEOPARD 挑战赛补全(数据前作深挖)
- LEOPARD(leopard.grand-challenge.org):Radboudumc 系 H&E WSI time-to-BCR 挑战——前列腺癌根治术数字病理的生存建模 benchmark
- 数据:508 例训练集(Radboudumc)——OWL 直接复用(下载页跳转实证)
- 任务定位:单模态(仅病理)time-to-event 预测——“被充分研究的任务”(OWL 官方语)指其已有基准成绩与多代方法
- 在 GC 生态的位置:PI-CAI(MRI)/PANDA(分级)/LEOPARD(生存)——Radboud 前列腺三件的病理臂
- 533 CHIMERA Task 1 页面的官方推荐:“We strongly recommend exploring the LEOPARD Challenge…can be valuable for both training and pre-training”——三线(LEOPARD/CHIMERA/OWL)的官方互认
- 库内状态:LEOPARD 未入库——535 条目以"前作锚记录"承载其信息(若未来入库形成三线互链)
附录 AD:挑战赛评审经济学(面板成本与混合评审趋势)
AD.1 评审成本结构
| 评审形态 | 单位成本 | 规模上限 | 一致性风险 |
|---|---|---|---|
| 纯自动指标(Dice/C-index) | 趋零 | 万级提交 | 无(但覆盖面窄) |
| 黑盒排行榜(GC Phase) | 低(平台算力) | 千级 | 复现依赖平台 |
| LLM-as-judge | 低 | 万级 | 偏差未标定 |
| 专家面板(OWL) | 高(专家时薪×件数) | 十级 | ICC 待测 |
- OWL 的成本账:≥3 AI 专家×每提交全件+≥2 病理医师×病例子集——15 参与者的规模恰是面板经济的上限区间——不是巧合,是设计(小而精的门槛既是过滤也是成本控制)
AD.2 混合评审的设计趋势
- 2026 年信号:autoPET V(自动 AUC)+CHIMERA-agent(自动+人工审查顶级提交)+OWL(自动+双面板全员)——"自动初筛+人工深评"的漏斗形态成为挑战赛评审新范式
- 资格线(0.65)是漏斗的自动闸门——人工只看"值得看"的提交
- 对组织方的启示:可解释性/生成类挑战的评估成本随提交数线性增长——评审预算决定参与规模上限(公开评审预算或是未来挑战赛提案的必要字段)
附录 AE:注意力热图的科学批判史("attention≠explanation"谱系)
- 2019:Jain & Wallace《Attention is not Explanation》——注意力权重与梯度重要性相关性弱、可替换性实验(不同注意力分布同预测)——NLP 域引爆论战
- 反方:Wiegreffe & Pinter《Attention is not not Explanation》——"解释"定义未统一,注意力在受控条件下有因果证据
- 病理域的实证:ABMIL 热图的 patch 选择与病理医师标注区域的一致性研究(多中心结果不一)——attention 作为"模型在用什么"的描述有据,作为"模型应该用什么"的证据薄弱
- OWL 的立场(从评估设计反推):不禁止注意力热图(最低成本路线畅通)但要求它通过扰动检验+面板审查——“attention 可以是解释的候选,但不是解释的通行证”
- 对使用者的实践含义:热图直出(ABMIL 注意力)作为参赛起点可行,但冠军级解释大概率需要扰动校准/概念增强/文本层三者之一
附录 AF:概念检测的病理形态学概念词典设计
AF.1 概念层级的候选体系
| 层级 | 概念示例 | 检测难度 |
|---|---|---|
| 结构级 | 腺体/间质/平滑肌/神经/脉管 | 低(分割成熟) |
| 形态级 | Gleason 模式 3/4/5 腺体、筛状结构、坏死灶 | 中(分级模型可迁移) |
| 细胞级 | 核异型性/核分裂象/炎症浸润 | 中(检测模型迁移) |
| 区域级 | 肿瘤边界状态/神经周围侵犯/脉管侵犯 | 高(临床语义强) |
| 全局级 | 肿瘤比例/分级异质性/多灶性 | 低(聚合统计) |
AF.2 概念→报告的映射
- 每概念:空间分布(归因图叠加)+定量(比例/计数)+与风险的关系方向(模型内部贡献符号)
- 报告模板:全局概览→Top-3 贡献概念→反例(低贡献但医师在意的结构——"模型没看哪里"也是解释)
AF.3 词典的来源
- ISUP/Gleason 术语体系(临床既有)
- TotalSegmentator/totseg 类器官分割的迁移概念(跨器官)
- 自监督概念发现(概念瓶颈的 unsupervised 变体)——发现类概念的新颖性由面板"meaningful novelty"维度裁定
附录 AG:从挑战赛到监管——可解释性在医疗 AI 审批中的位置
- FDA/EU MDR 对 AI/ML 医疗器械:可解释性非硬性审批项但为临床信任与不良事件分析所需——GDPR 的"解释权"(Art. 22 语境)与 EU AI Act 的高风险透明度义务(医疗 AI 在列)
- OWL 的监管接口:faithfulness 定量+专家面板记录=技术文档(technical documentation)的现成素材——挑战赛评估协议与监管证据链的格式相似性
- "质疑权"设计的监管前瞻:医师面板的 questioning 维度=人机协同的合规姿态(AI 为第二意见而非自主决策)——与 EU AI Act 的人类监督(human oversight)要求同构
- 五连的监管光谱:530(双 IRB+脱标识三步——数据合规型)/534(EARL/QIBA——定量标准化型)/535(解释问责型)——三种合规资产类型;AI-Ready 评估的"监管就绪度"维度候选
附录 AH:FAQ 末批(12 问)
Q66:OWL 的归因图可以是注意力热图直出吗?
可以(最低成本路线)——但需通过扰动忠实性检验;注意力≠解释的批判史(附录 AE)意味着冠军路线大概率需要校准/概念/文本层增强。
Q67:报告必须英文吗?
页面未限定语言——人类可读+面板可审是实质要求;建议英文(AI/病理面板国际化)。
Q68:归因图可以是 soft score(0-255 连续)还是二值?
8-bit uint TIFF——允许连续值;扰动分析按分数排序移除(高相关优先)——连续分数更利于曲线平滑。
Q69:训练可以用外部数据(PANDA/SICAP 等)吗?
弱监督约束针对"区域金标监督"——外部 WSI+患者级结局数据未明令禁止(引用时披露);预训练特征提取器明确自由。
Q70:三档阈值可以按测试集调整吗?
不可以——应从训练分布固定(附录 S.3);测试期调阈值=信息泄漏。
Q71:报告里可以引用文献吗?
自由格式——科学合理性维度欢迎证据链;但编造引用=hallucination risk 直接惩罚。
Q72:多切片拼装的归因怎么合并?
按区域聚合回单张多分辨率 TIFF(case 级)——切片内归因保持,切片间不强行对齐。
Q73:C-index 0.65 的测试集有多大?
未披露(N4)——隐藏设计;资格线的实际通过率待 10-16 后观察。
Q74:External Validation 阶段还能提交新方法吗?
阶段定位是验证已提交方法的外部泛化(还是接受新提交待官方澄清)——观察点。
Q75:五连里哪条目最适合作为 OWL 的入门对照?
533 CHIMERA Task 1(同任务族 C-index 体系+删失规则)——先懂生存预测再懂解释评估。
Q76:OWL 数据能用于非挑战赛研究吗?
注册条款范围内可(LEOPARD 条款约束)——学术使用自由度高,商用/再分发需查条款(N3)。
Q77:本条目最重要的一个提醒?
OWL 评的是解释不是预测——0.65 只是入场券;把 LEOPARD 时代方案直接套(坑点 8)会倒在 faithfulness 与面板上。
附录 AI:LEOPARD→OWL 的评估演化时间线
| 阶段 | 评估哲学 | 核心指标 | 人类参与 |
|---|---|---|---|
| LEOPARD | 纯预测性能 | C-index 榜 | 无 |
| CHIMERA Task 1 | 预测+鲁棒分析 | C-index+随机化/withholding 实验 | 无(事后分析) |
| CHIMERA-agent | 预测+推理一致 | 预测+推理轨迹双评 | 泌尿科收集参考推理 |
| OWL | 预测门槛+解释质量 | C-index 资格线+扰动+双面板 | 评审直接进排名 |
| OWL External(2027-02) | 发现的持续复测 | 同上(外部队列) | 面板延续 |
演化主线:从"预测对不对"到"解释真不真"——人类从数据标签员变成评审员——四年间挑战赛评估中人的位置的三次迁移(标注→事后分析→进排名)。
附录 AJ:扰动协议的边界情况与公允性讨论
AJ.1 五类边界情况
- 弥散归因(低幅度广分布):逐步移除的单步变化小——gap 曲线平缓,可能被误判不忠实——协议对"集中归因"有先天偏好
- 移除填充语义:涂黑/染空白对 H&E 的语义(黑色=墨迹?空白=气泡?)——填充物选择影响预测漂移方向
- 区域耦合:相邻区域共现(腺体+间质)——移除其一,另一的预测贡献连带变化——归因的边际语义
- 多切片案例:跨切片耦合(同患者两切片互补信号)——单切片移除的效应稀释
- 模型置信度非线性:风险分数在极端区饱和——移除关键区的输出变化被饱和截断
AJ.2 公允性的方法论回应
- 对照曲线(随机移除)已内建基线——gap 是相对量
- 多起点重复(不同随机种子)平滑曲线
- 报告层补充"移除实验的自述"(参赛者在解释报告中说明归因粒度假设)——面板 clarity 维度交叉
AJ.3 协议演化预测
External Validation 阶段可能引入:insertion 曲线(反向验证)/组合扰动(成对移除)/概念级扰动(附录 AF 概念词典)——评估协议本身的迭代是元研究型挑战的"第二赛场"
附录 AK:每例解释报告的结构模板(参赛者参考)
[第 1 页] 案例概览
- case_id / 预测时间(float)/ 三档风险(及派生阈值)
- 关键发现摘要(3-5 行)
[第 2-3 页] 空间证据
- Top-3 高归因区域的缩略图(归因叠加 WSI)
- 每区域:形态学概念命名 + 定量(占比/计数)
- 与模型输出的关系方向(正/负贡献)
[第 4 页] 概念归因
- 概念清单(附录 AF 词典)× 贡献符号
- "模型没看哪里":低归因但临床常规关注的结构(阴性说明)
[第 5 页] 局限与假设
- 归因粒度假设(区域级 spacing)
- 移除实验的自述(AJ.2)
- 数据外推警示(单中心训练)
模板设计原则:每页都是面板维度的直接应答(临床意义=第 2-3 页/对齐=归因叠加图/质疑支持=第 4 页阴性说明/清晰度=结构化模板本身)。
附录 AL:GC 五连收官的库内结构统计
| 统计项 | 数值 |
|---|---|
| 本批次条目 | 5(531-535) |
| 平台 | Grand Challenge 全系(DIAG Nijmegen 运营) |
| 会议线 | MICCAI×4(LMC2 投稿/TopBrain/CHIMERA/autoPET V)+WACV×1(OWL) |
| 任务族 | 生成/分割/生存+分类/交互分割/可解释性——五族 |
| 评估体系 | SSIM/AUC/C-index 四件套——五形态 |
| 可获取性 | 注册墙×2/Zenodo/AWS/三载体——四档 |
| 主办方生态 | DIAG Nijmegen 圈(Radboudumc×3:CHIMERA/OWL/GC 平台)+UZH+Tübingen+FBI |
| 互链密度 | 五条目内部互链+rid 468 系列互链+ hecktor/lung-pet-ct-dx 邻接 |
五连的方法论遗产:GC 核查模板 v1.0→v1.6(六版迭代)+四档可获取性光谱+五形态评估体系+多义名消歧法+系列前作锚档+披露度分档——挑战赛型条目的完整生产学。
附录 AM:坑点补充(数据与提交细节 15 条)
| 坑点 | 内容 |
|---|---|
| 11 | 金字塔层级误用——level 0 全分辨率读入 OOM;按任务选层(附录 R.1) |
| 12 | 多切片拼装的 spacing 不一致——同文件内不同切片可能不同扫描参数 |
| 13 | 组织 mask 与 WSI 层级错位——归因 spacing 必须 mask 对齐(附录 R) |
| 14 | 删失数据的 MSE 回归——event=0 的随访时间不是"真实复发时间"(右删失)——Cox/删失加权才对 |
| 15 | 三档阈值报告缺失——自派生阈值必须写进解释报告(可复现性) |
| 16 | 归因图分辨率上采样——重采样到全分辨率会破坏 spacing 对齐(原层级输出) |
| 17 | Debug phase 跳过——平台/本地输出不一致是高频翻车点(容器环境差) |
| 18 | 2TB 下载无断点续传——分例下载+校验(md5) |
| 19 | 面板维度平衡忽视——只优化 novelty 牺牲 plausibility(负相关维度的权衡) |
| 20 | 报告模板自由过度——结构化模板(附录 AK)降低评审理解成本 |
| 21 | "模型没看哪里"漏写——阴性说明是质疑支持维度的直接素材 |
| 22 | 跨中心声明缺失——单中心训练的外推警示必须写进报告第 5 页 |
| 23 | 引用 timeline 笔误——宣奖年份 2027 非 2026 |
| 24 | External Validation 缺席规划——赛后长期 benchmark 是方法持续曝光通道 |
| 25 | OWL/本体语言检索混淆——文献检索加 “pathology/BCR/WACV” 限定 |
附录 AN:GC 五连合卷·批次终曲(五条目互相成就的叙事线)
AN.1 五发的时间叙事
| 发次 | 日期 | 条目 | 那天学到的事 |
|---|---|---|---|
| 一 | 09-25 早 | 531 LMC2 | GC 平台的存在与极简页面形态;挑战赛型=第五类数据形态 |
| 二 | 09-25 午前 | 532 TopBrain | 模板 v1.5 校准;规模代数自洽(48=40∪42∩34)首例 |
| 三 | 09-25 午后 | 533 CHIMERA | 多义名消歧首用;生存任务族+四模态+屠榜悖论 |
| 四 | 09-25 黄昏 | 534 autoPET V | 系列前作锚档;交互效率指标化(AUC 双指标) |
| 五 | 09-25 晚 | 535 OWL | 元研究型;人类评审进排名;五连合卷 |
AN.2 五发构成的完整光谱
- 数据获取:注册墙→Zenodo→AWS→三载体——开放度四级标尺
- 评估哲学:重建保真→体素几何→删失时序→交互效率→解释可信度——指标演进五形态
- 人类位置:无→事后分析→参考推理→输入反馈(涂擦)→评审排名——参与深度五级
- 学术出口:在投→NEJM AI→双 paper→journal 承诺→workshop+External——出口形态五样
- 数据策略:新建库→二次精标→多库合并→系列扩容→完全复用——数据策略五式
AN.3 五发的共同底色
全部出自 DIAG Nijmegen 运营的 GC 平台;三家有 Radboud 血统(CHIMERA/OWL 主办+GC 平台方);四家对接 MICCAI 系会议——欧洲计算病理/影像挑战生态的密度样本。五条目合起来回答了一个元问题:“2026 年的医学 AI 挑战赛在为什么而赛?”——答案:从"比谁准"(LEOPARD 时代)演进为"比谁稳(域移)/比谁省(交互效率)/比谁真(解释忠实)/比谁有用(科学发现)"。
附录 AO:五连之后的观察窗口(2026-10~2027-02)
| 窗口 | 事件 | 观察点 |
|---|---|---|
| 2026-09-26 | TopBrain 初测截止 | TA36 赛道参与度 |
| 2026-10-01 | CHIMERA-agent workshop(MICCAI Abu Dhabi) | agentic 推理评审结果 |
| 2026-10-03/09 | autoPET V MICCAI 现场 | AUC 双指标冠军方法 |
| 2026-10-16 | OWL testing 开放 | 可解释性挑战的实际热度 |
| 2026-11-30 | autoPET V/OWL 提交截止 | 最终参与规模 |
| 2026-12-18 | CHIMERA-agent Debug 截止 | 302 队的留存率 |
| 2027-01 | WACV 宣奖+CHIMERA workshop 论文 | 冠军方法学术化起点 |
| 2027-02 | OWL External Validation | 长期 benchmark 开跑 |
后续条目候选观察:六连可能(TopAneu 2026 已完成 423 participants——GC 首页最大参与度挑战之一;HECKTOR 2026;REG² 病理报告生成)——按本批方法论直接复制生产。
附录 AP:可解释性行话速成(评审维度背后的术语)
AP.1 十个高频术语的精确用法
| 术语 | 精确定义 | 常见误用 |
|---|---|---|
| explanation | 对模型特定决策的依据呈现 | 与 interpretability(能力)混用 |
| interpretability | 模型可被理解的程度(系统属性) | 当作单次输出 |
| faithfulness | 解释与真实决策依据的一致度 | 与 plausibility(可信度)混同 |
| plausibility | 解释对人类的说服力(可以不忠实但可信) | 当作 faithfulness |
| stability | 相似输入的解释相似度 | 与 robustness 混用 |
| attribution | 贡献分配(正/负/量) | 只指正贡献 |
| concept activation | 概念在内部的激活向量(TCAV 系) | 与"概念检测"混用 |
| sanity check | 归因方法的边缘化检验(随机模型对照) | 当作数据 QC |
| post-hoc | 训练后追加的解释方法 | 与 intrinsic(内建可解释)对立 |
| intrinsic interpretability | 模型结构自带可解释(稀疏线性/浅树/概念瓶颈) | 与 post-hoc 混排 |
AP.2 五连各条目的"术语名片"
| 条目 | 核心术语 | 一句话 |
|---|---|---|
| 531 LMC2 | MIP/SSIM | 代理任务(聚焦预测)的可迁移 |
| 532 TopBrain | contamination | 类间泄漏的显式度量 |
| 533 CHIMERA | ΔC / withheld | 变量删除下的鲁棒衰减 |
| 534 autoPET V | AUC-DMM | 交互效率的实例级曲线 |
| 535 OWL | deletion gap | 高相关区移除 vs 随机的输出差 |
AP.3 术语纪律的评估意义
面板"clarity"维度惩罚术语混用——报告中的术语精确性本身是被评对象(可解释性的第一性:解释者先自洽)。
附录 AQ:尾注——元研究型条目的生产学复盘
AQ.1 页面极简型的核查补偿策略(本条目首创)
- 官方四页信息量≈前四发单页的 1/3——交叉信源密度必须加倍
- 本条目实际信源:官方页×4+CVF 官网+CSDN 二手+533 论文作者链(人物交叉)+GC 动态——五类信源分级标注(附录 AA)
- 事实清单 32 条中页面缺位类(无奖金/无仓库/无组织页)单列——"缺位"本身是信息(披露度分档的实证基础)
AQ.2 元研究型 DAIMS 的三处权重迁移
- 文档完备→评估协议完备(OWL 五阶段披露完整+权重未披露并存)
- 标注质量→标签+mask+弱监督声明(无区域金标是设计而非缺陷)
- 可复现→faithfulness 可测性(扰动法逻辑公开 vs 参考实现缺位)
AQ.3 五连收官的三个未竟之问(留给后续批次)
- LEOPARD/PI-CAI/PANDA 等前作条目何时入库——三线互链的最后一块
- 可解释性第二例(REG² 病理报告生成类)何时出现——第七任务族的第二条数据线
- External Validation 的数据形态——"赛后 benchmark"作为新数据资产类型的入库判据
§10 总结:给"解释"立规矩的第一块模板
OWL 是 GC 五连的收官,也是形态的极限:数据最小(508 例单中心)、参与最少(15 队)、页面最薄(无 FAQ/无组织页/无仓库)、披露最缺(许可/IRB/权重均未明示)——但评估协议却是五连中最具方法论野心的一套:预测资格线(0.65)过滤弱信号、扰动分析把 faithfulness 变成曲线、双专家面板把"幻觉风险"和"质疑权"写进评分表。它标记了挑战赛范式的一个转折:当预测精度被卷到头,"模型如何判断"成为下一个可竞争的对象。与 534 autoPET V 构成完美的对照实验——autoPET 把"人类反馈"放进输入(涂擦),OWL 把"人类评审"放进排名(Likert)——2026 年的两个信号都指向同一结论:医学 AI 评测的下一层是人机接口本身。对 AI-Ready 数据集评估的最终启示(五连合卷):数据的价值=数据本体的质量×评估协议的科学性×披露的诚实度——OWL 以最小的数据体量做出了最完整的协议示范,而它的披露缺位又恰好构成反面教材——一个条目同时给出正反两面,作为五连收官再合适不过。
本条目为千方病案医数集 GC 五连收官发。数据以 OWL 官方页面(owl.grand-challenge.org 四页)、LEOPARD 下载页、CVF 官网与 CSDN 技术社区旁证为准,抓取时点 2026-09-25。Radboudumc 生态条目另有 533 CHIMERA(同人主办+同任务族)互链。
(完)
| 归因粒度 | 区域级(mask spacing) | 任务页规格 |
| 报告语言建议 | 英文(面板国际化) | 建议项 |
| 训练外部数据 | 患者级结局类可用(披露) | 弱监督边界内 |
| 概念词典来源 | ISUP/Gleason+器官分割迁移 | 附录 AF |
补充说明:本条目与 533 CHIMERA 构成 Radboudumc 前列腺 BCR 任务族的双子星(多模态融合线+可解释性线);与 534 autoPET V 构成 2026 评审哲学两极。GC 五连至此合卷——模板 v1.6 与五形态评估体系为后续挑战赛型条目(TopAneu/HECKTOR/REG² 候选)提供直接生产学基础。
(完)——千方病案医数集 GC 五连·第五发·合卷
GC 五连生产学备忘:本批五条目(531-535)的完整流程记录见 production_tracker.md 对应条目;GC 核查模板 v1.6 全文见 534 条目附录 O 与本条附录 N。
数据一致性声明:本条目全部事实经多源交叉验证(官方四页+CVF+二手社区+平台动态),未验证项已在口径注 N1-N7 中显式标记。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- lysto — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- wsss4luad — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- pannuke — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- lizard — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- peso — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- cosas — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集
- panda — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- paip — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

