OWL — 计算病理可解释性科学发现挑战 AI-Ready Wikipedia

可解释 AI 科学发现首基准:前列腺 WSI 生化复发预测+归因图+解释报告四输出——C-index 0.65 资格线+扰动忠实性+双专家 Likert 面板的第三种评分结构

来源 Radboudumc 回顾性队列——与 LEOPARD 挑战赛训练集同源(GC 注册后经 LEOPARD 下载页获取)发布时间: 2026-09-25最后更新: 2026-09-25 阅读 29
OWL — 计算病理可解释性科学发现挑战 AI-Ready Wikipedia

信息速览

数据集名称OWL — 计算病理可解释性科学发现挑战 AI-Ready Wikipedia
数据类型人工标注,原始数据,影像数据
规模508 例前列腺癌根治术 WSI(Radboudumc 单中心)
接入方式Radboudumc 回顾性队列——与 LEOPARD 挑战赛训练集同源(GC 注册后经 LEOPARD 下载页获取)
AI 就绪度

INFOBOX:owl 速览

字段 值
数据集 OWL Training Set(508 例,LEOPARD 同源)
slug owl(GC 子域 owl.grand-challenge.org)
全名 Observing What Models Learn——观察模型学到什么
平台 Grand Challenge——GC 五连收官发(第五发)
会议 WACV 2027 + CVPath Workshop(2027-01-04~08 Orlando)——五连中唯一非 MICCAI 线(CVF 系)
主办 Radboudumc(Khrystyna Faryna 等——CHIMERA 双论文作者同一人,Radboud 第三连线)
任务 可解释 BCR 预测四输出:时间 float+三档风险+归因 TIFF+≤5 页解释报告
数据 508 例根治术 WSI(Radboudumc 单中心;金字塔 TIF;多切片拼装;2 TB;LEOPARD 同源)
标签 training_labels.csv(case_id/event/follow_up_years——删失生存)+组织 mask
评估 五阶段:Debug→C-index≥0.65 资格线→扰动忠实性→AI 专家 Likert 七维→病理医师四维→加权和
评分结构 本库第三种:资格线+扰动忠实性+双专家面板——人类评审直接进排名
参与度 15 participants(GC 动态;Not accepting submissions——10-16 testing 再开)
时间线 08-22 官宣→10-16 排行榜→11-06 CVPath 论文→11-30 提交截止→2027-01 WACV 宣奖→2027-02 External Validation
参与门槛 归因方法+病理知识+2TB 数据+容器——小而精(15 队冷启动)
多义名 OWL(本体语言)撞车——本条目=Observing What Models Learn
一句话 当预测精度不再是问题,"模型为什么这么判"成为下一个基准——可解释性的第一次系统竞赛

§0 摘要卡:给"解释"立规矩的第一次尝试

§0.1 它是什么

OWL(Observing What Models Learn)是 GC 五连的收官发,也是五连中形态最特殊的一发:元研究型挑战。前三发的评测对象都是数据上的预测性能(分割 Dice/生存 C-index/交互效率),OWL 把评测对象换成模型的解释本身——"预测多准"已有原则性框架(C-index),"解释是否揭示真实生物学"却没有。OWL 用前列腺癌根治术 WSI 的生化复发预测(与 LEOPARD 同源 508 例)作代表性场景,要求算法四输出一体:时间预测+三档风险+空间归因图+每例一封 ≤5 页的人类可读解释报告;评估用五阶段流水线(预测资格线→扰动忠实性→AI 专家七维 Likert→病理医师四维面板→加权和)——人类评审直接进排名。它回答的问题:“当 AI 说这个病人会复发,它看到的是什么组织学证据,这个证据可信吗?”

§0.2 三个数字

  • 0.65:C-index 资格线——隐藏测试队列上预测力不足 0.65 的提交不进可解释性评估(“预后信号太弱,解释无意义”)——用预测力门槛保住解释评估的信噪比,元研究型挑战的聪明设计
  • 508 例 / 2 TB:训练集规模(Radboudumc 单中心)与体量(千兆像素金字塔 TIF)——与 LEOPARD 完全同源(下载页直接跳转前作)——数据资产的届际复用样本
  • 4+7+4:四输出(时间/风险/归因/报告)×AI 专家 Likert 七维(含 hallucination risk)×病理医师四维(临床意义/图像证据对齐)——"解释"被拆解成可打分的维度

§0.3 它怎么用

四大用途:①可解释方法基准——扰动忠实性+专家面板给归因算法(热图/概念归因/原型方法)第一次可排名的比较框架;②WSI 生存建模训练——508 例删失标签+组织 mask(LEOPARD 同源,兼作 LEOPARD 任务的训练资源);③病理 AI 信任研究——hallucination risk/clinical meaningfulness 等维度是"医生为什么该/不该信 AI"的实验素材;④科学发现工作流——hypothesis-free discovery 的输出格式设计(概念归因+文本解释)可迁移到其他影像问题。不适合:需要区域级金标的监督学习(弱监督声明);临床部署(研究定位);跨中心泛化训练(单中心 508 例——2027-02 External Validation 才补这一环)。

§0.4 联动提示

本条是 GC 五连收官:与 533 CHIMERA 构成 Radboudumc 双连线(Faryna 同人+生存任务同族——CHIMERA Task 1 前列腺 BCR/OWL 前列腺 BCR——同一临床问题的一条线的两代形态);与 534 autoPET V 构成评估体系两极(全自动指标 AUC vs 人类评审 Likert);数据同源 LEOPARD(未入库,前作锚记录)。五连合体的方法论总结(四档可获取性/五族评估体系/多义名消歧案例)见本条附录 AN。

§1 平台与会议定位

§1.1 GC 上的元研究生态位

Grand Challenge 平台 420+ challenges 中绝大多数评测预测性能;OWL 的生态位是评测可解释性——平台"Fair assessment of algorithm performance"宗旨的解释性分支。15 participants 的冷启动规模反映双重门槛:①归因方法研发门槛(热图之外的 faithfulness 方法稀缺);②病理领域知识门槛(解释要过病理医师面板)。但这也正是 OWL 的价值假设:小而精的评审密集型挑战,先立标准再扩规模(2027-02 External Validation 即扩容设计)。

§1.2 WACV+CVPath 的会议选择

五连前四发(LMC2-TopBrain-CHIMERA-autoPET V)均为 MICCAI 系会议;OWL 走 CVF 线(WACV 2027)+CVPath Workshop(computational pathology 专题工作坊)。会议选择暗示受众差异:可解释性/科学发现话题在计算机视觉社区的关注度(模型行为分析)高于医学影像社区(性能导向)——同一问题在不同社区的不同入口。CVPath 论文截止(11-06)早于排行榜提交截止(11-30)——先发论文拿反馈、后交测试拿成绩的双轨。

§1.3 Radboudumc 第三连线

主办人 Khrystyna Faryna 在本库的第三个出现点:①533 CHIMERA 双 summary paper 作者+GC 平台 inquiry 联系人;②535 OWL 主办;③(隐线)Radboud DIAG 生态=GC 平台运营方。Radboud 系的挑战赛版图:PI-CAI/PANDA/LEOPARD(H&E time-to-BCR)→CHIMERA(多模态生存)→OWL(可解释生存)——"生存预测"主线的三代演进(LEOPARD 单模态自动→CHIMERA 多模态自动→OWL 可解释)。数据复用是这条线的实施手段(OWL 直接复用 LEOPARD 508 例)。

§2 发布形态与学术出口

  • 形态:WACV 2027 CVPath Workshop 挑战(在赛——10-16 testing 开放)+External Validation Phase(2027-02 起赛后长期 benchmark)——五连首个"赛后延续阶段"显式设计的条目
  • 学术出口:CVPath@WACV 2027 workshop 论文(11-06 截止,可用开发数据结果)——对照 533(双 paper 已出)/534(journal 承诺)/531(在投)——workshop 论文是五连中最轻的出口档(但 External Validation 的长期运行是独有资产)
  • 时间线笔误存照:timeline 页"4-7 January 2026"应为 2027(CVF 官网:WACV 2027=01-04~08 Orlando)——引用需修正;五连页面考古又添一形态(数字残留的时间维度)

§3 任务定义深度解析:四输出的结构主义

§3.1 "预测+地点+理由"的三段式

task 页原文:“a submitted algorithm must produce four things — a prediction, where it looked, and why”——四输出本质是三段问答:预测了什么(输出 1/2:时间+风险)→看了哪里(输出 3:归因图)→为什么(输出 4:解释报告)。这个三段式是可解释 AI 文献的经典框架(prediction/localization/explanation),OWL 把它变成容器化提交的硬规格。

§3.2 弱监督的强约束

两处"weak supervision"声明(时间预测与风险评分均"learned under weak supervision from patient-level outcomes only")——禁止使用区域级标注(Gleason 分区/病灶分割等强监督信号不作为标签)。这个约束保住任务的科学发现纯度:如果用区域金标监督,“解释"就退化为"复述标注”——hypothesis-free discovery(无假设发现)要求模型从结局信号里自己找出空间模式。

§3.3 风险分档的自派生要求

“low”/“medium”/“high” 三档必须从算法自己的时间预测派生(“derived from the participant’s algorithm’s own time-to-recurrence predictions”)——禁止独立训练三分类器再贴标签。这个设计保证输出 1/2 的内在一致性(时间 5.2 年的"high"与时间 15 年的"low"不能出自两个互斥模型)——可解释性的前提是预测系统自洽。

§3.4 归因图的格式纪律

  • 8-bit 无符号整数多分辨率 TIFF——与 WSI 同构的金字塔格式
  • spacing 跟随官方组织 mask——归因分辨率与组织掩膜对齐(评估扰动分析按此分辨率执行)
  • 这意味着归因是组织区域级(不是像素级)——与扰动分析(区域移除)的评估粒度自洽

§3.5 解释报告的纸面规格

每例一份 PDF ≤5 页——逐例报告(不是全局方法论文档)——"concept attributions, textual explanation, and so on"自由格式。5 页上限是评审成本控制(AI 专家面板要看手稿+代码+每例报告的全件集)。报告是四输出中唯一的人类语言产物——病理医师面板的直接评审对象。

§4 数据本体:LEOPARD 遗产的复用细节

§4.1 508 例的出身

  • Radboudumc 单中心回顾性队列——前列腺癌根治术 H&E WSI
  • 与 LEOPARD 挑战赛训练集完全一致(CSDN:“这一规模与此前 LEOPARD 挑战赛的训练集完全一致”)
  • 下载实证:OWL data 页"To download the dataset proceed to the Data download page"链接直指 leopard.grand-challenge.org/data-download/——挑战赛数据资产复用的实现路径(Join OWL→经 LEOPARD 下载页取数)

§4.2 金字塔 TIF 的存储几何

  • 第 0 层全分辨率(千兆像素),每层对上层 4× 降采样
  • 多分辨率 tiled——openslide/tifffile 标准读取
  • 大多数 WSI 多切片拼装(“multiple slides packed together”)——一个 case 文件内含多张物理切片——数据结构上把"患者"作为单位而非"切片"(与 533 CHIMERA Task 1 的"每例多张 WSI"同理念但打包方式更激进)

§4.3 标签与辅助资产

  • training_labels.csv 三字段:case_id (str)/event (0|1)/follow_up_years (float)——标准删失生存格式(event=1→复发年数;event=0→末次随访年数)
  • 官方组织 mask(归因 spacing 基准+组织区域提取)
  • 2 TB 总量——GC 注册墙(Join 后下载)

§4.4 与 533 CHIMERA Task 1 的数据对照

维度 OWL 508 例 CHIMERA Task 1 267 例
癌种 前列腺癌(同) 前列腺癌
任务 time-to-BCR(同族) time-to-BCR
模态 仅 H&E WSI H&E+mpMRI+临床
标注 event+follow_up_years(同构) 同构+13-15 临床变量
中心 Radboudumc 单中心 Radboud+Canisius 两机构
端点评估 C-index(同) C-index
  • 同一临床问题的两代形态:LEOPARD(单模态自动)→CHIMERA Task 1(多模态融合)→OWL(可解释性)——Radboud 系生存预测三代任务线;OWE 的 508 vs CHIMERA 的 267——数据规模与模态宽度的反相关(单模态可以更大)

§5 评估体系:五阶段流水线全解

§5.1 资格线的哲学(C-index≥0.65)

  • 隐藏测试队列上 C-index 排名;≥0.65 才进可解释性评估
  • 官方理由:“below that threshold, the prognostic signal is too weak for the explanation to mean much”
  • 设计洞察:解释的价值依附于预测的价值——弱预测+漂亮热图=过度解读的温床(医学 AI 可解释性文献的核心担忧)
  • 0.65 的选择:LEOPARD 系任务的实践中位水平(低到可及、高到信号真实)

§5.2 扰动忠实性(Automatic faithfulness)

  • 流程:归因图标记的高相关区域逐步移除(progressively removed)→模型输出变化曲线 vs 随机区域移除的对照曲线
  • 判据:两条曲线的 gap 越大=归因越忠实(“A larger gap means a more faithful explanation”)
  • 方法论出处:deletion/insertion 曲线(RISE 系可解释性文献的标准协议)——OWL 把 CV 社区的 faithfulness 度量移植到病理 WSI
  • 粒度自洽:归因图按组织 mask spacing(区域级)→移除也按区域级

§5.3 AI 专家面板(Likert 七维)

评审对象:手稿/代码/指标/预测/归因图/报告全件(manuscripts, code, metrics, predictions, attribution maps, and reports)——不是只看分数,是看整个方法学包。≥3 位专家/提交,Likert 量表七维:

  1. relevance + applicability(hypothesis-free scientific discovery 的相关性/适用性)
  2. clarity(清晰度)
  3. scientific plausibility(科学合理性)
  4. meaningful novelty(有意义的新颖性)
  5. usefulness for understanding model behaviour(对理解模型行为的有用性)
  6. transferability(向其他病理问题迁移性)
  7. risk of hallucination(幻觉风险——解释编造的程度)

"risk of hallucination"作为独立评审维度是本评估体系最具时代性的设计——LLM 时代的解释生成(报告可以是大模型写的)必须显式检测编造。

§5.4 病理医师面板(四维)

  • 评审人:执业病理医师+trainee(含受训者——新手视角也是临床接受度的一部分)
  • ≥2 人/提交;每提交抽病例子集(评审成本控制)
  • 四维:clinical meaningfulness/alignment with the image evidence(与图像证据对齐——归因是否真落在医师认可的证据上)/usefulness for understanding and questioning the prediction(理解与质疑预测的有用性——"质疑"进维度)/support for clinical understanding
  • 双面板的分工:AI 专家评"方法学质量"(faithfulness/novelty/hallucination);病理医师评"临床可信度"(meaningfulness/alignment)——可解释性的两可接受面

§5.5 终评合成

加权和(weighted sum of aggregated scores)——权重未披露(评估页未给出五阶段分数的具体权重)——口径注存照。

§6 时间线与参与生命周期

日期 事件 说明
2026-08-22 官宣 联合 WACV+CVPath Workshop
2026-09-25(时点) GC 显示 Not accepting submissions/15 participants 主窗口未开/已闭,冷启动
2026-10-16 Testing leaderboard 开放 主提交窗口
2026-11-06 CVPath@WACV 2027 论文截止 可用开发数据结果
2026-11-30 Testing leaderboard 提交截止 测试窗口关闭
2026-12-15 决赛邀请 finalists+speakers
2027-01-04~07 WACV workshop 宣奖 页面笔误"2026"存照;WACV 2027=01-04~08 Orlando
2027-02 External Validation Phase 开放 赛后长期 benchmark
  • 生命周期设计:挑战赛→workshop 宣奖→External Validation Phase(外部验证常态化)——五连唯一显式的赛后延续阶段(对照 CHIMERA-agent 的 Debug 延续是赛前行为)
  • 参与度:15 participants(GC 动态)——五连最低(对照 autoPET V 266/CHIMERA-agent 302)——小而精定位的实证

§7 与可解释性方法生态的关系

§7.1 热图之后的下一站

  • 现状(官方引言):预后 AI 的可解释性"remains largely limited to attention heatmaps"——ABMIL 注意力/Grad-CAM 类热图是病理 AI 解释的事实标准
  • 热图的已知问题:忠实性未经检验(注意力≠因果)/分辨率与组织学结构错配/无生物学语义
  • OWL 的三箭:扰动忠实性(检验热图是否真承载信号)+概念归因与文本解释(超越热图的语义层)+专家面板(语义层的裁定)——从"给热图"到"为热图负责"

§7.2 科学发现(biomarker discovery)的格式化

  • "hypothesis-free scientific discovery"进入评审维度——解释的目标读者不仅是医生,还有假说生成管线
  • 输出 4 的自由格式(concept attributions/textual explanation)=为下游 LLM/知识图谱消费预留的接口——病理 AI 解释的结构化前夜
  • 与 533 CHIMERA-agent 的对照:agent 版要求"推理轨迹"(决策过程)——OWL 要求"证据解释"(组织学语义)——可解释性的两个互补面(行为层 vs 证据层)

§7.3 方法候选谱(参赛者可能的路线)

  • 热图+扰动校准(attention→deletion 曲线正则)
  • 概念瓶颈模型(CBN:形态学概念→风险)——概念归因天然适合报告
  • 原型方法(ProtoPetc 类:案例原型作为解释单元——病理教学语义)
  • 多实例可解释聚合(ABMIL 注意力+实例级文本化——LLM 报告生成)
  • 上述路线在无 GT 环境下的比较正是 OWL 要生成的数据——OWL 的元产出是"解释方法排行榜"本身

§8 伦理、许可与可获取性

  • 可获取性档位:注册墙型(GC Join→LEOPARD 下载页→2TB)——五连中最低档(对照 autoPET V 三载体冗余/CHIMERA AWS Registry/TopBrain Zenodo 直下)
  • 许可未独立明示:GC 注册条款+LEOPARD 下载页条款约束——条目内记口径注(五连中许可透明度最低)
  • 伦理:Radboudumc 单中心回顾队列;IRB 编号未披露;同意模式未展开——伦理披露度为五连最低(对照 530 双 IRB 明文/533 同意明示)
  • 弱监督声明的伦理面:无区域金标=无标注者负担描述需求——但归因图将"模型关注区"与"病理证据"对齐(医师面板第 2 维)承担了语义监督的角色

§9 库内定位

  • 任务谱系第七族:可解释性/科学发现(预测+归因+文本解释三件套输出——分类/检测/文本/生成/分割/生存之外的新族)
  • 评估体系第五形态:资格线+扰动忠实性+双专家 Likert——人类评审进排名(DAIMS 第三种评分结构)
  • 元研究型条目:评测对象=解释质量——DAIMS 各维度需按"可解释性资产"重估(文档完备→协议完备/标注质量→标签+mask/可复现→扰动法公开度)
  • DAIMS 预估 7.2(详见附录 H 评分卡)

FAQ:28 问直答

Q1:OWL 是什么的缩写?
Observing What Models Learn——“观察模型学到什么”。名字即任务:不看模型预测多准,看模型的解释是否真实。

Q2:谁主办的?
Radboudumc(荷兰拉德堡德大学医学中心)Khrystyna Faryna 团队——与 CHIMERA 挑战赛双论文作者同一人,Radboud 生态在 GC 平台的又一挑战赛。

Q3:对接哪个会议?
WACV 2027 的 CVPath Workshop(2027-01-04~08,Orlando)——GC 五连中唯一走 CVF 线(前四发均 MICCAI 系)。2026-08-22 官宣。

Q4:任务具体要求什么?
四输出一体:①time-to-BCR 连续预测(年,float);②low/medium/high 三档风险(必须从自己的时间预测派生);③空间归因图(8-bit 多分辨率 TIFF,spacing 跟组织 mask);④每例一份 ≤5 页人类可读解释报告(PDF)。

Q5:数据多大?
508 例根治术 H&E WSI(Radboudumc 单中心,每例一患者)——金字塔 TIF(第 0 层全分辨率+4× 逐层降采样),大多数 WSI 多切片拼装,总量 2 TB。

Q6:数据和 LEOPARD 什么关系?
完全同源——LEOPARD 挑战赛(H&E WSI time-to-BCR 前作)的训练集就是这 508 例;OWL 的数据下载页直接跳转 LEOPARD 的下载页(Join OWL 后经 LEOPARD 取数)。

Q7:标签格式?
training_labels.csv 三字段:case_id(患者标识)/event(是否复发 0/1)/follow_up_years(复发或末次随访年数)——标准删失生存格式;另附官方组织 mask。

Q8:怎么下载?
GC 平台 Join OWL(右上角绿钮)→跳转 LEOPARD data-download 页→注册获取(2 TB,注册墙型)。

Q9:什么许可?
页面未独立明示——受 GC 注册条款+LEOPARD 下载页条款约束;引用时注明"许可经注册条款"(五连中许可透明度最低档)。

Q10:评估流程怎么走?
五阶段:①Debug 容器自检→②隐藏测试 C-index 排名(≥0.65 资格线)→③扰动忠实性自动评估→④AI 专家面板(≥3 人 Likert 七维)→⑤病理医师面板(≥2 人四维)→加权和终评。

Q11:为什么设 C-index 0.65 资格线?
官方原话:“低于此阈值,预后信号太弱,解释无意义”——解释的价值依附于预测价值;弱预测+漂亮热图=过度解读温床。

Q12:扰动忠实性怎么算?
归因图标记的高相关组织区域逐步移除→模型输出变化 vs 随机区域移除的对照——gap 越大解释越忠实(deletion 曲线协议的病理移植)。

Q13:AI 专家面板评什么?
手稿/代码/指标/预测/归因图/报告全件,≥3 人 Likert 七维:hypothesis-free discovery 的相关性/清晰度/科学合理性/有意义新颖性/理解模型行为的有用性/迁移性/hallucination risk(幻觉风险)。

Q14:病理医师面板评什么?
执业病理医师+trainee(含受训者)≥2 人,抽病例子集,四维:临床意义/与图像证据对齐/理解与质疑预测的有用性/对临床理解的支持。

Q15:为什么"幻觉风险"是独立维度?
解释报告可以由 LLM 生成——编造(不存在的形态学证据)必须显式检测;LLM 时代可解释性的核心风险被写进了评分表。

Q16:弱监督是什么约束?
时间与风险预测只允许从 patient-level 结局(event/随访时间)学习——禁止区域级标注监督(否则解释退化为复述标注,失去科学发现意义)。

Q17:三档风险为什么要求自派生?
防止"时间模型+独立三分类模型"两张皮——输出 1/2 必须内在自洽(可解释性的前提是预测系统一致)。

Q18:归因图为什么要求区域级 spacing?
与扰动分析的移除粒度自洽(区域移除)+与组织 mask 对齐(评估的分辨率基准)——像素级归因在本框架下不可比。

Q19:多切片拼装是什么?
大多数 WSI 由多张物理切片打包成一个 case 文件——患者为单位而非切片单位;解析时需处理文件内多区域结构(task 页有四例图示)。

Q20:参与情况如何?
15 participants(GC 动态 2026-09-25;Not accepting submissions——主窗口 10-16 再开)。五连最低(对照 autoPET V 266/CHIMERA-agent 302)——可解释性+病理知识的双门槛使然。

Q21:有奖金吗?
页面未见披露——五连中唯一无奖金信息的条目(对照 autoPET V €6,000)。

Q22:有官方 baseline 吗?
未见官方仓库披露(对照 autoPET V 的 lab-midas 仓库/CHIMERA 的 DIAGNijmegen)——baseline/参考实现缺位是五连最低;社区有 CSDN 中文实现旁证(ResNet2d,R² 0.878 博主自验,非官方)。

Q23:时间线有什么要注意的?
①页面笔误:"4-7 January 2026"应为 2027(WACV 2027=01-04~08 Orlando,CVF 官网确认);②CVPath 论文截止(11-06)早于测试提交截止(11-30)——先论文后成绩的双轨;③2027-02 External Validation Phase——赛后长期外部验证(五连唯一显式赛后延续设计)。

Q24:和库内 CHIMERA 条目什么关系?
双连线:①主办人 Faryna 同人(CHIMERA 双论文作者);②任务同族(前列腺 time-to-BCR——CHIMERA Task 1 的 267 例 vs OWL 的 508 例,同构删失标签+C-index);③数据代际(LEOPARD→CHIMERA 多模态→OWL 可解释性——Radboud 生存预测三代线)。

Q25:和 LEOPARD 什么关系?
数据级前作(508 例完全同源+下载复用)+任务级对照(LEOPARD 评预测、OWL 评解释——同数据两代评估哲学)。

Q26:适合做什么、不适合做什么?
适合:归因方法 faithfulness 基准、可解释生存建模、概念归因/文本解释的病理适配、AI 信任研究(hallucination/质疑维度)。不适合:区域金标监督学习(弱监督约束)、跨中心泛化训练(单中心)、临床部署。

Q27:2027-02 的 External Validation Phase 是什么?
赛后开放的外部验证阶段——新队列持续测试(benchmark 延续设计);五连中唯一的"赛后生命周期"显式规划——挑战赛成绩之外的长期价值通道。

Q28:一句话定位?
可解释性的第一次系统竞赛——给"AI 的解释"立评分表的元研究尝试,也是 GC 五连中"人类评审直接进排名"的唯一样本。


事实清单:32 条硬事实+7 条口径注

硬事实(F1-F32)

# 事实 信源
F1 全名 Observing What Models Learn GC 主页
F2 定位:evaluating interpretable AI methods for scientific discovery in computational pathology GC 主页
F3 动机:解释评估缺乏原则性框架(注意力热图局限) GC 主页
F4 代表任务:prostatectomy WSI 的 BCR 预测 GC 主页/task 页
F5 本质困难:无 interpretability ground truth task 页原文
F6 四输出:时间 float+三档风险+归因 TIFF+≤5 页 PDF task 页
F7 弱监督声明(patient-level outcomes only)×2 task 页
F8 三档风险必须自派生(from own predictions) task 页
F9 归因图:8-bit uint 多分辨率 TIFF,spacing 跟组织 mask task 页
F10 报告:每例 PDF ≤5 页,自由格式(concept attributions/textual) task 页
F11 508 例/Radboudumc/每例一患者 data 页
F12 金字塔 TIF:第 0 层全分辨率+4× 逐层降采样 data 页
F13 多切片拼装(multiple slides packed together) data 页
F14 2 TB 总量;Join 后经 LEOPARD 下载页获取 data 页
F15 training_labels.csv:case_id/event/follow_up_years data 页
F16 与 LEOPARD 训练集完全一致(下载页跳转实证) data 页+CSDN
F17 Debug phase:容器 sanity check evaluation 页
F18 C-index 资格线 0.65(“too weak for the explanation to mean much”) evaluation 页
F19 扰动忠实性:高相关区逐步移除 vs 随机区域,gap 大=忠实 evaluation 页
F20 AI 专家面板:≥3 人/提交,评手稿/代码/指标/预测/归因/报告全件 evaluation 页
F21 Likert 七维(含 hallucination risk) evaluation 页
F22 病理面板:执业医师+trainee ≥2 人,病例子集,四维(含"质疑预测") evaluation 页
F23 终评=聚合分数加权和(权重未披露) evaluation 页
F24 2026-08-22 官宣(WACV+CVPath 联合) timeline 页
F25 10-16 排行榜开放/11-06 CVPath 论文截止/11-30 提交截止/12-15 决赛邀请 timeline 页
F26 WACV workshop 宣奖 2027-01(页面笔误 2026) timeline 页+CVF 官网
F27 2027-02 External Validation Phase 开放 timeline 页
F28 Radboudumc Khrystyna Faryna 团队主办 CSDN(二源)
F29 15 participants(GC 动态)/Not accepting submissions GC 首页动态
F30 无奖金信息披露 页面缺位
F31 无官方仓库披露(对照 autoPET V/CHIMERA) 页面缺位
F32 CVF 官网:WACV 2027=2027-01-04~08 Orlando thecvf.com

口径注(N1-N7)

# 注 处理
N1 timeline 年份笔误("January 2026"应为 2027) 以 CVF 官网为准;存照
N2 终评权重未披露 记录"weighted sum, weights undisclosed"
N3 许可未独立明示 GC 注册条款+LEOPARD 条款
N4 测试队列规模未披露 隐藏设计一部分
N5 15 participants 为 2026-09-25 时点(主窗口未开) 动态数据引用标注时点
N6 CSDN 实现(R² 0.878/MAE 0.86)为博主自验非官方 参考实现旁证
N7 组织团队全名单未见(organization 页不存在) Faryna 为已确认核心

术语表:36 条

术语 释义
OWL Observing What Models Learn:可解释 AI 科学发现竞赛(本条目)
OWL(他域) Web Ontology Language:W3C 本体语言(检索撞车源)
可解释性(interpretability) 模型判断依据的可理解呈现
faithfulness 忠实性:解释与模型真实决策依据的一致程度
扰动分析 移除归因高相关区观察输出变化——faithfulness 的自动度量
deletion 曲线 逐步移除的输出退化曲线(RISE 系协议)
attribution map 归因图:输入空间上标注预测贡献的热图/掩膜
spatial attribution 空间归因:WSI 上标注关注组织区域
概念归因 以形态学概念(而非像素)为解释单元
hypothesis-free discovery 无假设发现:不预设生物学假说的数据驱动发现
biomarker discovery 生物标志物发现:从数据中识别新预后指标
BCR Biochemical Recurrence 生化复发(同 533)
time-to-BCR 复发时间:删失生存端点(年)
弱监督 仅患者级结局监督(无区域金标)
删失 event=0 时的末次随访截断(生存分析核心概念)
C-index 一致性指数(同 533);OWL 资格线 0.65
Likert 量表 心理测量学评分表(OWL 面板用分级打分)
hallucination risk 幻觉风险:解释含编造证据的程度(Likert 维度之一)
expert panel 专家面板:多评审人结构化打分
AI expert panel OWL 的方法学评审组(≥3 人七维)
pathology expert panel 病理医师评审组(≥2 人四维,含 trainee)
clinical meaningfulness 临床意义(病理面板维度 1)
alignment with image evidence 与图像证据对齐(维度 2)
质疑预测 questioning the prediction:医师面板的批判性维度
金字塔 TIF 多分辨率 tiled TIFF(第 0 层全分辨率+4× 降采样)
多切片拼装 一个 WSI 文件打包多张物理切片
组织 mask 官方提供的前景组织掩膜(归因 spacing 基准)
LEOPARD Radboud 系前作挑战(H&E WSI time-to-BCR,508 例同源)
Radboudumc 荷兰拉德堡德大学医学中心(主办)
Khrystyna Faryna OWL 主办人(CHIMERA 双论文作者同人)
WACV 2027 IEEE/CVF 冬季计算机视觉应用会议(01-04~08 Orlando)
CVPath Computational Pathology Workshop@WACV
External Validation Phase 赛后外部验证阶段(2027-02 起)
testing leaderboard 测试排行榜(10-16 开放/11-30 截止)
Debug phase 容器自检阶段(平台/本地输出一致性)

附录

附录 A:四输出的提交规格卡

输出 文件规格 约束
1. 时间预测 float(年,如 1.23/17.68) 弱监督训练
2. 风险分档 low/medium/high 从输出 1 派生(禁独立分类器)
3. 归因图 8-bit uint 多分辨率 TIFF spacing=组织 mask;区域级
4. 解释报告 PDF ≤5 页/例 concept attributions/文本等自由格式

容器化:GC Algorithm 提交(Debug phase 先自检平台/本地一致性)。

附录 B:五阶段评估流水线图解

[① Debug] 容器自检(训练例输出一致性)
     ↓
[② Test 资格线] 隐藏测试 C-index 排名
     ↓ C-index ≥ 0.65(未过线=出局,"信号太弱解释无意义")
[③ Automatic faithfulness]
     归因高相关区逐步移除 ──→ 输出退化曲线 A
     随机区域逐步移除 ──────→ 输出退化曲线 B
     gap(A,B) 越大 = 越忠实
     ↓
[④ AI expert panel] ≥3 人 × Likert 七维
     (相关性/清晰度/合理性/新颖性/行为理解/迁移性/幻觉风险)
     ↓
[⑤ Pathology expert panel] ≥2 人(含 trainee)× 四维 × 病例子集
     (临床意义/图像证据对齐/理解与质疑/临床理解支持)
     ↓
[终评] 聚合分数加权和(权重未披露)

附录 C:扰动忠实性的最小实现示例

import numpy as np

def deletion_gap(attrib_map, tissue_mask, predict_fn, n_steps=10, seed=0):
    # attribution_map: 区域级归因(spacing=组织 mask)
    # predict_fn(region_wsi) -> time_prediction(容器推理接口)
    rng = np.random.default_rng(seed)
    region_ids = np.unique(tissue_mask[tissue_mask > 0])

    # 区域按归因分数降序 = "高相关优先移除"
    order_by_attr = region_ids[np.argsort(-attrib_map[tissue_mask > 0])]
    # 对照:随机移除顺序
    order_random = rng.permutation(region_ids)

    def curve(order):
        deltas, base = [], predict_fn(region_wsi=tissue_mask)
        for i in range(1, n_steps + 1):
            removed = set(order[: int(len(order) * i / n_steps)])
            perturbed = np.isin(tissue_mask, list(removed))
            masked = region_wsi.copy()
            masked[perturbed] = 0          # 区域涂黑(或染空白色)
            deltas.append(abs(base - predict_fn(region_wsi=masked)))
        return deltas

    d_attr, d_rand = curve(order_by_attr), curve(order_random)
    # gap 越大 = 归因越忠实(evaluation 页定义)
    return float(np.mean(d_attr) - np.mean(d_rand))

(实现细节以官方评估管线为准;本示例演示协议结构:高相关优先移除 vs 随机移除的输出退化差。)

附录 D:LEOPARD→OWL 的数据复用链

环节 LEOPARD(前作) OWL(本条)
数据 508 例 Radboudumc 根治术 WSI 同一批(训练集完全一致)
标签 event+follow_up_years 同(training_labels.csv)
下载 GC 注册+data-download 页 复用 LEOPARD 下载页(Join OWL 后跳转)
任务 time-to-BCR 预测 time-to-BCR+归因+解释
评估 C-index 榜 C-index 资格线+解释五阶段
角色 数据供给+任务基线 评估范式升级层

复用链的意义:数据不动、问题升级——“同一批 WSI,LEOPARD 问预测多准,OWL 问解释可不可信”——挑战赛系列的数据效率样本(对照 autoPET V 的系列扩容路线:数据加新库 vs OWL 的评估加新维)。

附录 E:GC 核查模板 v1.6 执行记录(4 轮)

轮 动作 收获
R1 WebSearch 定位 消歧(OWL vs 本体语言)+Radboudumc/Faryna+508 例/2TB/LEOPARD 同源+任务四输出
R2 GC 主页+task 页 四输出规格+弱监督声明+本质困难原文
R3 evaluation 页+库内查证(LEOPARD/owl 均无条目) 五阶段流水线全细节+资格线 0.65+Likert 七维+库内无 LEOPARD(前作锚记录)
R4 data 页+timeline 页+CVF 官网 508/2TB/金字塔 TIF/多切片拼装+时间线全表+年份笔误发现+WACV 2027 确认

页面极简型核查:OWL 四页(主页/task/evaluation/data/timeline)+无 FAQ/无 organization/无官方仓库——v1.6 模板新增"页面极简型"档:信源密度低时**二手信源(CSDN 技术博客)+平台人物关系(Faryna 连线)**补强,逐条标注信源等级。

附录 F:多义名消歧表(五连第二例)

名称 身份 判别特征
OWL(本条) Observing What Models Learn:可解释 AI 科学发现竞赛 owl.grand-challenge.org;病理 WSI;508 例
OWL(W3C) Web Ontology Language:语义网本体语言 RDF/SPARQL 语境
owl(意象) 猫头鹰:观察隐喻(命名本体) 任务名直译
OWL(他域杂项) 各类缩写(在线 Web 库/组织名) 非病理非本体语境

附录 G:伦理与披露度对照(五连横向)

维度 531 LMC2 532 TopBrain 533 CHIMERA 534 autoPET V 535 OWL
中心数 法国 23 站点 UZH 等 荷兰两机构+国际联盟 五机构三国 荷兰单中心
IRB 披露 细胞系轴 UZH 明文 同意明示/编号缺 TCIA 链背书 未披露
标注资质 未详 统一方案 BRS 溯源 分级披露 未详(弱监督免标注)
许可 CC BY 4.0 open data.swiss CC BY-NC-SA 4.0 TCIA(CC BY 类) 注册条款(未独立明示)
数据获取 注册墙 Zenodo 直下 AWS 无账户 三载体冗余 注册墙+LEOPARD 复用
披露度名次 3 1 2 2 5

五连伦理-披露光谱:autoPET V/TopBrain(明文型)→CHIMERA(混合型)→LMC2(载体背书型)→OWL(缺位型)——AI-Ready 评估的"披露度"维度需要显式分档,缺位型条目(单中心+注册墙+许可不明)在可获取性/伦理两维天然扣分。

附录 H:DAIMS 评分卡(预估 7.2——元研究型第三种结构)

维度 分 依据
文档完备 7 四页齐备但极简:无 FAQ/无 organization/无仓库;评估协议披露完整是亮点
标注质量 8 删失标签标准+组织 mask+弱监督声明清晰;单中心规模限制
可复现 7 扰动评估协议公开(逻辑层);无参考实现+无 GT 是本质限制
可获取性 6 注册墙+2TB+LEOPARD 复用+许可不明——五连最低
伦理合规 7 单中心+IRB/同意未展开;弱监督免除标注负担描述
加权 ≈7.2 元研究型:评估协议创新加分 vs 披露缺位扣分——第三种结构(对照 CHIMERA 7.6/TopBrain 7.8/autoPET V 7.7/LMC2 6.9)

元研究型评分要点:评测对象是"解释"——文档完备度的重心从数据字典转向评估协议完备度(OWL 的五阶段披露完整);可复现性重心从"结果可重现"转向"faithfulness 可测"。

附录 I:时间线全景

日期 事件
(前史) LEOPARD 挑战赛运行(508 例 H&E time-to-BCR)
2024-04 GC 用户内容图床的时间戳(data 页四例图 2024/04/18——数据资产早已备置)
2026-08-22 OWL 官宣(WACV+CVPath 联合)
2026-09-25(时点) GC 动态:15 participants/Not accepting submissions
2026-10-16 Testing leaderboard 开放
2026-11-06 CVPath@WACV 2027 论文截止
2026-11-30 Testing leaderboard 提交截止
2026-12-15 决赛邀请
2027-01-04~07 WACV workshop 宣奖(页面笔误 2026)
2027-02 External Validation Phase 开放

附录 J:坑点表

| 坑点 1 | 三档风险独立训练分类器——违反自派生要求(必须从自己的时间预测派生) |
| 坑点 2 | 区域级金标监督——违反弱监督约束(解释退化为标注复述) |
| 坑点 3 | 归因图像素级输出——spacing 必须跟组织 mask(区域级),像素级不可评 |
| 坑点 4 | 多切片拼装未处理——一个 case 多张物理切片,滑窗直接跑会把切片接缝当组织 |
| 坑点 5 | 2TB 下载无策略——金字塔 TIF 建议按层级流式读取(openslide level 接口) |
| 坑点 6 | 报告超 5 页——PDF 硬上限(评审成本设计) |
| 坑点 7 | 解释文本由 LLM 生成未校验——hallucination risk 维度会直接惩罚编造证据 |
| 坑点 8 | 把 LEOPARD 的历史方案直接套——OWL 评的是解释不是纯预测(0.65 只是入场券) |
| 坑点 9 | 引用 timeline 年份不核对——"January 2026"笔误应 2027 |
| 坑点 10 | 忽略 External Validation Phase——赛后新队列可能公开,长期 benchmark 机会 |

附录 K:人名与机构

人名/机构 角色
Khrystyna Faryna 主办人(Radboudumc;CHIMERA 双论文作者+GC 平台 inquiry 联系人同人)
Radboudumc 主办机构(计算病理组生态——DIAG/GC 平台运营方同生态)
WACV 2027/CVPath 会议与工作坊(学术出口)
LEOPARD 挑战赛 数据供给前作(508 例同源)

附录 L:口径速查卡

口径 数字 备注
训练例 508 Radboudumc 单中心
数据量 2 TB 金字塔 TIF
降采样 4×/层 第 0 层全分辨率
输出 4 件 时间/风险/归因/报告
报告上限 5 页/例 PDF
资格线 C-index 0.65 隐藏测试
AI 面板 ≥3 人×7 维 Likert
病理面板 ≥2 人×4 维 含 trainee
参与度 15 2026-09-25 时点
提交截止 2026-11-30 testing
宣奖 2027-01-04~07 WACV Orlando(页面笔误 2026)
External Validation 2027-02 赛后延续

附录 M:跨条目联动矩阵

联动条目 联动点 类型
533 chimera Faryna 同人+前列腺 BCR 同任务族+Radboud 生态 人物+任务双连线
534 autopet-v 评估体系两极(Likert 面板 vs AUC 指标)+GC 五连同批 方法论对照
532 topbrain2026 GC 五连同批+MICCAI 2026 vs WACV 2027 会议线对照 同批
531 lightmycells2 GC 五连同批 同批
LEOPARD(未入库) 数据同源前作+下载复用链 前作锚记录

附录 N:GC 五连总结(五发合体方法论)

N.1 四档可获取性光谱(终版)

档 条目 特征
注册墙型 531 LMC2/535 OWL GC Join+协议墙(OWL 另加 LEOPARD 复用)
直下型 532 TopBrain Zenodo 直下
Registry 型 533 CHIMERA AWS Open Data 无账户
三载体冗余型 534 autoPET V TCIA+Zenodo+FDAT

N.2 评估体系五形态(终版)

形态 条目 指标哲学
重建保真 531 LMC2 SSIM/PCC+rank 平均
体素几何+污染物 532 TopBrain Dice+clDice+HD95+contamination
删失时序 533 CHIMERA C-index+wF1(生存/分类双轨)
交互效率 534 autoPET V AUC-Dice+AUC-DMM 50/50
解释可信度 535 OWL 资格线+扰动忠实性+双专家 Likert

N.3 任务族七谱(本库挑战赛域)

分割(TopBrain)→生成(LMC2)→生存+分类(CHIMERA)→交互式分割(autoPET V)→可解释性科学发现(OWL)——五发覆盖五族;CHIMERA-agent(消歧记录)补充 agentic 决策族。

N.4 多义名消歧案例集

CHIMERA(神话/续作 agent/他域同名)与 OWL(本体语言/意象)——两例确立了"GC 子域+数据载体+评估形态"三锚消歧法。

N.5 五连贡献的方法论增量(模板 v1.0→v1.6 全程)

跨源五查(v1.0)→命名消歧/数字演化/前作锚分级/可获取性三档(v1.5)→系列前作锚档+三载体冗余+续作口径继承(v1.6)+页面极简型核查档+披露度分档(本条新增)——GC 挑战赛型条目生产模板至此成型。

附录 O:开放问题与观察点

  • 参赛格局:10-16 testing 开放后的实际参与度(15 是冷启动数)——可解释性挑战的社区热度测试
  • 冠军方法:2027-01 WACV 宣奖——热图校准/CBN/原型/LLM 报告四路线的胜负
  • 扰动忠实性的边界:区域移除协议对"弥散型归因"(低幅度广分布)方法是否公允——评估方法学本身的后续讨论
  • External Validation 队列:2027-02 公开的外部队列构成——508 例单中心局限的补全进度
  • journal 出口:CVPath workshop 论文之后是否有 summary paper 升级(对照 CHIMERA 双 paper 模式)
  • 库内回访:若 LEOPARD 未来入库,三线互链(LEOPARD-OWL-CHIMERA)——前列腺 BCR 任务族完整档案

附录 P:可解释性方法学全景(OWL 语境的六家族)

P.1 六家族对照

家族 机制 病理 WSI 适配 OWL 评估中的位置
梯度/CAM 系 梯度×激活回传(Grad-CAM/HiResCAM) 千兆像素显存瓶颈;patch 级拼接 输出 3 的传统来源
注意力系 ABMIL/TransMIL 的 patch 注意力权重 天然 slide 级;但注意力≠因果 热图主流(官方批评对象)
扰动系 输入扰动测敏感度(occlusion/RISE) 计算昂贵但模型无关 faithfulness 评估即此系
概念系 概念瓶颈/原型(CBM/ProtoPNet) 形态学概念(腺体/间质/坏死)语义贴合 输出 4 的报告素材
反事实系 最小改变翻转预测的输入差 WSI 上难定义"最小"( gigapixel 离散) 研究向
LLM 解释系 VLM/LLM 生成文本解释 病理报告生成成熟;幻觉风险 输出 4 的高效来源+面板审查对象

P.2 官方的批评与建设

  • 批评(主页):“explainability of state-of-the-art prognostic AI remains largely limited to attention heatmaps”——注意力热图=现状天花板
  • 建设:扰动忠实性(检验)+概念/文本(升级)+专家面板(裁定)——三步把解释从"产物"变成"可问责产物"

P.3 区域级归因的技术含义

  • 输出 3 的 spacing=组织 mask→归因单位是组织区域(连通域/超级像素级)
  • 对方法的要求:patch 注意力需聚合到区域;概念归因需空间化——方法与评估粒度的对齐是第一工程问题

附录 Q:faithfulness 评估的文献脉络(deletion 曲线的谱系)

  • RISE(PETKović 2018):随机掩码采样+输出变化→重要性图;deletion/insertion 曲线首次系统化——逐步移除(或加入)高归因区,曲线下面积=解释质量
  • infidelity/sensitivity(Yeh 2019):扰动一致性的公理化度量
  • MBA/sanity check(Adebayo 2018):模型随机化测试——归因图对模型权重随机化的敏感度(边缘化检验)
  • OWS 的移植:区域级(非像素)+病理 WSI(非自然图)+随机区域移除作对照(不只是自身退化,还有基线对照——gap 语义)
  • 未解问题:移除填充物(涂黑/染空白/平均色)对代谢-形态模型的语义影响——病理组织的"移除"语义比自然图像复杂(附录 J 坑点 3 的方法论根源)

附录 R:病理 WSI 处理工程卡(pyramidal TIF 实操)

R.1 读取

import openslide, tifffile
sl = openslide.OpenSlide("case_0123.tif")
print(sl.level_count, sl.level_dimensions)   # 金字塔层数/各层尺寸
lv = 2                                        # 中间层(2048² 量级)
img = sl.read_region((0, 0), lv, sl.level_dimensions[lv]).convert("RGB")

R.2 多切片拼装检测

  • 同一 WSI 文件内多张物理切片→空间上分离的组织大区
  • 检测:组织 mask 连通域分析——大间距多主连通域=多切片拼装
  • 处理:每切片独立采样/独立归因——接缝伪影防止(坑点 4)

R.3 tile 采样策略

  • 组织 mask 内均匀 tile(0.5mpp 等效 256²/512²)→UNI/CTransPath 特征→ABMIL
  • 千兆像素全扫不现实——mask 引导的 foreground 采样是标配
  • 多分辨率:低层(粗)筛区域+高层(细)提特征的两级管线

R.4 2TB 的存储与算力预算

  • 508 例×~4GB/例;本地 SSD 缓存常用层(level 2-3)
  • ABMIL 训练单卡可跑(特征预提取后);端到端微调需 A100 级
  • 归因图生成:区域级打分→回写金字塔 TIFF(评估接口)

附录 S:生存分析建模路径(508 例删失数据)

S.1 从标签到损失

  • event+follow_up_years→Cox partial likelihood(连续时间)/离散化离散时间 log-likelihood/DeepSurv 框架
  • 533 CHIMERA 的删失 C-index 配对规则同样适用(OWL 官方 C-index 评估)
  • 输出 1 要求连续时间预测——Cox 基线风险累积→中位/期望时间的映射(或直接回归+删失加权)

S.2 架构谱(LEOPARD 遗产)

  • LEOPARD 时代:ABMIL/TransMIL+UNI/CTransPath 特征——508 例的主流配方
  • OWL 新增要求:归因图输出——ABMIL 注意力天然可回写(patch→区域聚合)——注意力系与输出 3 的零成本对接(但 faithfulness 未必高——附录 P 的批评)
  • 校准:时间预测的校准曲线(输出 1 是 float——校准影响三档派生的阈值合理性)

S.3 三档派生的阈值设计

  • 从自己的时间分布派生:训练集时间分位数(如 3/7 年)→low/medium/high 边界——阈值固定并在报告中披露(可解释性的一部分)
  • 反例(违规):独立训练三分类器(坑点 1)

附录 T:弱监督的科学发现逻辑

T.1 为什么禁止区域金标

  • 若用 Gleason 分区/病灶金标监督:模型的"解释"=标注的复读——发现(discovery)的定义即"找到标注之外的模式"
  • 信息瓶颈视角:patient-level 结局是唯一信息源→模型必须自己把结局信号分配到空间——分配结果就是可检验的假说

T.2 假说生成的闭环

  1. 模型从 508 例学习"什么形态→早复发"
  2. 归因图高亮"模型认为的早复发形态区"
  3. 病理医师面板判"这形态有临床意义吗"(维度 1-2)
  4. AI 面板判"这发现新颖吗/可迁移吗"(维度 1/4/6)
  5. 高分解释→下游湿实验假说(OWL 的终局定位)

T.3 多重检验警示

  • 508 例上的"发现"天然多重比较——expert panel 的"scientific plausibility"维度=人工先验过滤
  • External Validation(2027-02)=发现的独立复测——发现类声明的标准流程(发现→面板过滤→外部验证)

附录 U:专家面板的方法学设计

U.1 Likert 七维的心理测量学

  • 每维 1-5(或 1-7)打分→提交内多例平均→面板内平均
  • 评审者间一致性:ICC/Krippendorff α——面板质量的元指标(OWL 未承诺披露——观察点)
  • 七维的维度相关性预期(novelty 与 plausibility 常负相关)——加权合成时的冲突处理

U.2 含 trainee 的设计意图

  • 执业医师=临床有效性裁判;trainee=可读性/教学价值裁判(新手能否从解释学到东西)
  • “usefulness for understanding and questioning the prediction”——质疑维度把 AI 从"答案机"降位为"第二意见"——医疗 AI 伦理的先进表述

U.3 幻觉风险的操作化

  • 检查点:解释中引用的形态学证据是否在 WSI 上可指认(alignment 维度交叉)
  • LLM 生成报告的典型幻觉:不存在的结构命名/夸大局部分布/虚构分级术语——面板抽检+可指认性测试是检测路径
  • 与 533 CHIMERA-agent 的幻觉惩罚呼应——2026 年"解释可信度"成为两个挑战赛的共同新维度

附录 V:LLM 生成解释的工作流与风险

V.1 典型管线

WSI → 特征(UNI)→ ABMIL → 风险 + 注意力
                              ↓
            概念检测(腺体形态/间质反应/坏死灶…)
                              ↓
            VLM/LLM:概念+注意力区 → 5 页报告
                              ↓
            归因图回写金字塔 TIFF

V.2 风险清单

  • 结构幻觉:命名不存在的组织学结构(LLM 生成报告的头号风险)
  • 分布夸大:把 5% 的模式说成"显著"
  • 术语误用:分级/分期术语的临床语义错置
  • 归因-文本不一致:文本说"高级别腺体"但归因图高亮间质——双输出一致性是面板对齐维度的直接检查点

V.3 缓解设计

  • 概念检测前置(报告只引用可检测概念)——闭式词汇表
  • 归因图与文本引用区域的自动对齐校验(提交前自检)
  • 报告模板化(结构固定+槽位填充)——自由度换可控性

附录 W:External Validation Phase 的长期 benchmark 设计

  • 设计定位:赛后(2027-02 起)持续开放的外部队列验证——挑战赛成绩的"保鲜机制"
  • 对照五连:CHIMERA-agent 的 Debug 延续(赛前)/TopBrain 的 TA36 联合赛道(赛中)/OWL 的 External Validation(赛后)——挑战赛生命周期的三段式扩展样本
  • 价值:①发现的独立复测(T.3);②方法排行榜的长期演化;③新队列(可能跨中心)补 508 例单中心短板
  • 观察:外部队列规模/来源/是否含非荷兰数据——2027-02 揭晓(附录 O 观察点)

附录 X:前列腺癌 BCR 的临床背景补全(与 533/534 的三角联动)

X.1 三条数据线的同一问题

线 数据 模态 评估
LEOPARD 508 例 H&E 仅病理 C-index 榜
CHIMERA Task 1(533) 267 例 病理+MRI+临床 C-index+后挑战分析
OWL(535) 同一 508 例 仅病理+解释 C-index 资格线+解释五阶段
  • LEOPARD/OWL 同数据:预测层结论可直接迁移(OWL 的 0.65 资格线对应 LEOPARD 榜单的中位水平)
  • CHIMERA 的关键发现(临床单模态屠榜/多模态鲁棒)对 OWL 的推论:WSI-only 模型的解释是"信号恢复能力"的试金石——影像分支在变量缺失时的 ΔC≤0.04 意味着形态学信号真实存在——OWL 要求把它"说出来"

X.2 与 534 autoPET V 的示踪剂-形态学对偶

  • PSMA PET(分子靶点显像)vs H&E(形态学金标准)——前列腺癌的两种"阳性"定义
  • DeepPSMA 的 TTB(分子负荷)vs OWL 的归因图(形态学证据)——两种"病灶标注"的评估哲学对照
  • 交叉问题:形态学解释能否预测分子显像负荷——跨模态假说(OWL 输出 4 的 transferability 维度的终极测试)

附录 Y:五个论文选题(使用者启发)

  1. faithfulness 协议比较:区域移除 vs 像素 occlusion vs 模型随机化(sanity check)——同一批 ABMIL 热图的三种 faithfulness 排名一致性
  2. 概念瓶颈 for BCR:形态学概念(腺体分化/间质/坏死)→风险的可解释管线——概念归因与医师面板四维的通过率
  3. LLM 报告的幻觉谱:VLM 生成解释的幻觉类型学(结构/分布/术语)与自动检测器(alignment 校验器)
  4. 多切片拼装的归因聚合:跨物理切片的注意力归因合并策略对 faithfulness 的影响
  5. 弱监督发现的迁移:OWL 模型的归因区在 CHIMERA Task 1 数据(267 例+MRI)上的跨验证——形态学发现的跨队列/跨模态持久性

附录 Z:四类读者的行动指南

Z.1 可解释性方法研究者:附录 P-Q 的方法谱+faithfulness 协议→ABMIL 注意力基线(最低成本参赛)→扰动校准训练(deletion gap 作为正则)→概念层升级(CBN/原型)→报告生成(附录 V 风险清单自检)。

Z.2 计算病理工程师:附录 R 的工程卡(金字塔读取/拼装检测/采样)→LEOPARD 时代配方(UNI+ABMIL)→归因回写(区域级 TIFF)→容器四输出接口→Debug phase 自检。

Z.3 病理与肿瘤临床研究者:附录 X 的三线对照→归因图的阅片审查(面板四维的日常版)→形态学假说的生成与验证路径(T.2 闭环)→Lu-177/PSMA 显像的交叉假说(X.2)。

Z.4 数据集管理者/AI-Ready 评估者:附录 G 的披露度分档→附录 H 的元研究型评分结构→附录 N 的五连终版光谱→"评估协议完备度"替代"数据字典完备度"的元研究评分范式。

附录 AA:存证链与口径汇总

事实组 存证信源 等级 抓取时点
定位/动机/四输出/评估五阶段 owl.grand-challenge.org 四页 一手(官方) 2026-09-25
508 例/2TB/LEOPARD 同源 data 页+CSDN(二源一致) 一手+二手 2026-09-25
主办人 Faryna/Radboudumc CSDN(二手)+533 CHIMERA 论文作者列表(一手) 二手+交叉 2026-09-25
WACV 2027 日期 thecvf.com(一手) 一手 2026-09-25
时间线笔误 timeline 页 vs CVF 官网对照 交叉验证 2026-09-25
15 participants/窗口状态 GC 首页动态 一手(动态,标时点) 2026-09-25
CSDN 实现(R² 0.878) 博主自验(非官方) 旁证 2026-09-25

口径汇总:508(例)/2TB(体量)/4(输出件)/5(页报告上限)/0.65(C-index 资格线)/7+4(Likert 维度)/≥3+≥2(面板人数)/15(participants@0925)/2026-11-30(提交截止)/2027-01(宣奖,笔误修正)/2027-02(External Validation)

附录 AB:CHIMERA-agent vs OWL——2026 双可解释挑战对照(Radboud 双雄)

维度 CHIMERA-agent(533 消歧记录) OWL(535)
会议 MICCAI 2026(Abu Dhabi) WACV 2027 CVPath(Orlando)
主办 Radboudumc(Khalili 等) Radboudumc(Faryna 等)
可解释对象 决策推理轨迹(行为层) 组织学证据解释(证据层)
任务 前列腺患者旅程三决策点 前列腺 BCR 预测+解释
输入 结构化 JSON(报告+变量+纵向 PSA) 千兆像素 WSI
反幻觉机制 幻觉推理惩罚(评估协议) hallucination risk Likert 维度(面板)
人类参与 泌尿科医生收集参考推理 双专家面板进排名
数据 新构建(agent 化 JSON) LEOPARD 508 例复用
参与度 302 participants 15 participants

双雄合观:同一机构在 2026 年从两个方向攻击同一个问题——“AI 的医疗判断怎么被信任”——agent 路线管行为一致性(推理与输入对齐),OWL 管证据真实性(解释与病理对齐)——行为可解释性 vs 证据可解释性的分野;Radboud 在此领域的系列布局(LEOPARD→CHIMERA→CHIMERA-agent→OWL)是单一学术生态主导一个子领域的样本。

附录 AC:LEOPARD 挑战赛补全(数据前作深挖)

  • LEOPARD(leopard.grand-challenge.org):Radboudumc 系 H&E WSI time-to-BCR 挑战——前列腺癌根治术数字病理的生存建模 benchmark
  • 数据:508 例训练集(Radboudumc)——OWL 直接复用(下载页跳转实证)
  • 任务定位:单模态(仅病理)time-to-event 预测——“被充分研究的任务”(OWL 官方语)指其已有基准成绩与多代方法
  • 在 GC 生态的位置:PI-CAI(MRI)/PANDA(分级)/LEOPARD(生存)——Radboud 前列腺三件的病理臂
  • 533 CHIMERA Task 1 页面的官方推荐:“We strongly recommend exploring the LEOPARD Challenge…can be valuable for both training and pre-training”——三线(LEOPARD/CHIMERA/OWL)的官方互认
  • 库内状态:LEOPARD 未入库——535 条目以"前作锚记录"承载其信息(若未来入库形成三线互链)

附录 AD:挑战赛评审经济学(面板成本与混合评审趋势)

AD.1 评审成本结构

评审形态 单位成本 规模上限 一致性风险
纯自动指标(Dice/C-index) 趋零 万级提交 无(但覆盖面窄)
黑盒排行榜(GC Phase) 低(平台算力) 千级 复现依赖平台
LLM-as-judge 低 万级 偏差未标定
专家面板(OWL) 高(专家时薪×件数) 十级 ICC 待测
  • OWL 的成本账:≥3 AI 专家×每提交全件+≥2 病理医师×病例子集——15 参与者的规模恰是面板经济的上限区间——不是巧合,是设计(小而精的门槛既是过滤也是成本控制)

AD.2 混合评审的设计趋势

  • 2026 年信号:autoPET V(自动 AUC)+CHIMERA-agent(自动+人工审查顶级提交)+OWL(自动+双面板全员)——"自动初筛+人工深评"的漏斗形态成为挑战赛评审新范式
  • 资格线(0.65)是漏斗的自动闸门——人工只看"值得看"的提交
  • 对组织方的启示:可解释性/生成类挑战的评估成本随提交数线性增长——评审预算决定参与规模上限(公开评审预算或是未来挑战赛提案的必要字段)

附录 AE:注意力热图的科学批判史("attention≠explanation"谱系)

  • 2019:Jain & Wallace《Attention is not Explanation》——注意力权重与梯度重要性相关性弱、可替换性实验(不同注意力分布同预测)——NLP 域引爆论战
  • 反方:Wiegreffe & Pinter《Attention is not not Explanation》——"解释"定义未统一,注意力在受控条件下有因果证据
  • 病理域的实证:ABMIL 热图的 patch 选择与病理医师标注区域的一致性研究(多中心结果不一)——attention 作为"模型在用什么"的描述有据,作为"模型应该用什么"的证据薄弱
  • OWL 的立场(从评估设计反推):不禁止注意力热图(最低成本路线畅通)但要求它通过扰动检验+面板审查——“attention 可以是解释的候选,但不是解释的通行证”
  • 对使用者的实践含义:热图直出(ABMIL 注意力)作为参赛起点可行,但冠军级解释大概率需要扰动校准/概念增强/文本层三者之一

附录 AF:概念检测的病理形态学概念词典设计

AF.1 概念层级的候选体系

层级 概念示例 检测难度
结构级 腺体/间质/平滑肌/神经/脉管 低(分割成熟)
形态级 Gleason 模式 3/4/5 腺体、筛状结构、坏死灶 中(分级模型可迁移)
细胞级 核异型性/核分裂象/炎症浸润 中(检测模型迁移)
区域级 肿瘤边界状态/神经周围侵犯/脉管侵犯 高(临床语义强)
全局级 肿瘤比例/分级异质性/多灶性 低(聚合统计)

AF.2 概念→报告的映射

  • 每概念:空间分布(归因图叠加)+定量(比例/计数)+与风险的关系方向(模型内部贡献符号)
  • 报告模板:全局概览→Top-3 贡献概念→反例(低贡献但医师在意的结构——"模型没看哪里"也是解释)

AF.3 词典的来源

  • ISUP/Gleason 术语体系(临床既有)
  • TotalSegmentator/totseg 类器官分割的迁移概念(跨器官)
  • 自监督概念发现(概念瓶颈的 unsupervised 变体)——发现类概念的新颖性由面板"meaningful novelty"维度裁定

附录 AG:从挑战赛到监管——可解释性在医疗 AI 审批中的位置

  • FDA/EU MDR 对 AI/ML 医疗器械:可解释性非硬性审批项但为临床信任与不良事件分析所需——GDPR 的"解释权"(Art. 22 语境)与 EU AI Act 的高风险透明度义务(医疗 AI 在列)
  • OWL 的监管接口:faithfulness 定量+专家面板记录=技术文档(technical documentation)的现成素材——挑战赛评估协议与监管证据链的格式相似性
  • "质疑权"设计的监管前瞻:医师面板的 questioning 维度=人机协同的合规姿态(AI 为第二意见而非自主决策)——与 EU AI Act 的人类监督(human oversight)要求同构
  • 五连的监管光谱:530(双 IRB+脱标识三步——数据合规型)/534(EARL/QIBA——定量标准化型)/535(解释问责型)——三种合规资产类型;AI-Ready 评估的"监管就绪度"维度候选

附录 AH:FAQ 末批(12 问)

Q66:OWL 的归因图可以是注意力热图直出吗?
可以(最低成本路线)——但需通过扰动忠实性检验;注意力≠解释的批判史(附录 AE)意味着冠军路线大概率需要校准/概念/文本层增强。

Q67:报告必须英文吗?
页面未限定语言——人类可读+面板可审是实质要求;建议英文(AI/病理面板国际化)。

Q68:归因图可以是 soft score(0-255 连续)还是二值?
8-bit uint TIFF——允许连续值;扰动分析按分数排序移除(高相关优先)——连续分数更利于曲线平滑。

Q69:训练可以用外部数据(PANDA/SICAP 等)吗?
弱监督约束针对"区域金标监督"——外部 WSI+患者级结局数据未明令禁止(引用时披露);预训练特征提取器明确自由。

Q70:三档阈值可以按测试集调整吗?
不可以——应从训练分布固定(附录 S.3);测试期调阈值=信息泄漏。

Q71:报告里可以引用文献吗?
自由格式——科学合理性维度欢迎证据链;但编造引用=hallucination risk 直接惩罚。

Q72:多切片拼装的归因怎么合并?
按区域聚合回单张多分辨率 TIFF(case 级)——切片内归因保持,切片间不强行对齐。

Q73:C-index 0.65 的测试集有多大?
未披露(N4)——隐藏设计;资格线的实际通过率待 10-16 后观察。

Q74:External Validation 阶段还能提交新方法吗?
阶段定位是验证已提交方法的外部泛化(还是接受新提交待官方澄清)——观察点。

Q75:五连里哪条目最适合作为 OWL 的入门对照?
533 CHIMERA Task 1(同任务族 C-index 体系+删失规则)——先懂生存预测再懂解释评估。

Q76:OWL 数据能用于非挑战赛研究吗?
注册条款范围内可(LEOPARD 条款约束)——学术使用自由度高,商用/再分发需查条款(N3)。

Q77:本条目最重要的一个提醒?
OWL 评的是解释不是预测——0.65 只是入场券;把 LEOPARD 时代方案直接套(坑点 8)会倒在 faithfulness 与面板上。

附录 AI:LEOPARD→OWL 的评估演化时间线

阶段 评估哲学 核心指标 人类参与
LEOPARD 纯预测性能 C-index 榜 无
CHIMERA Task 1 预测+鲁棒分析 C-index+随机化/withholding 实验 无(事后分析)
CHIMERA-agent 预测+推理一致 预测+推理轨迹双评 泌尿科收集参考推理
OWL 预测门槛+解释质量 C-index 资格线+扰动+双面板 评审直接进排名
OWL External(2027-02) 发现的持续复测 同上(外部队列) 面板延续

演化主线:从"预测对不对"到"解释真不真"——人类从数据标签员变成评审员——四年间挑战赛评估中人的位置的三次迁移(标注→事后分析→进排名)。

附录 AJ:扰动协议的边界情况与公允性讨论

AJ.1 五类边界情况

  1. 弥散归因(低幅度广分布):逐步移除的单步变化小——gap 曲线平缓,可能被误判不忠实——协议对"集中归因"有先天偏好
  2. 移除填充语义:涂黑/染空白对 H&E 的语义(黑色=墨迹?空白=气泡?)——填充物选择影响预测漂移方向
  3. 区域耦合:相邻区域共现(腺体+间质)——移除其一,另一的预测贡献连带变化——归因的边际语义
  4. 多切片案例:跨切片耦合(同患者两切片互补信号)——单切片移除的效应稀释
  5. 模型置信度非线性:风险分数在极端区饱和——移除关键区的输出变化被饱和截断

AJ.2 公允性的方法论回应

  • 对照曲线(随机移除)已内建基线——gap 是相对量
  • 多起点重复(不同随机种子)平滑曲线
  • 报告层补充"移除实验的自述"(参赛者在解释报告中说明归因粒度假设)——面板 clarity 维度交叉

AJ.3 协议演化预测

External Validation 阶段可能引入:insertion 曲线(反向验证)/组合扰动(成对移除)/概念级扰动(附录 AF 概念词典)——评估协议本身的迭代是元研究型挑战的"第二赛场"

附录 AK:每例解释报告的结构模板(参赛者参考)

[第 1 页] 案例概览
  - case_id / 预测时间(float)/ 三档风险(及派生阈值)
  - 关键发现摘要(3-5 行)

[第 2-3 页] 空间证据
  - Top-3 高归因区域的缩略图(归因叠加 WSI)
  - 每区域:形态学概念命名 + 定量(占比/计数)
  - 与模型输出的关系方向(正/负贡献)

[第 4 页] 概念归因
  - 概念清单(附录 AF 词典)× 贡献符号
  - "模型没看哪里":低归因但临床常规关注的结构(阴性说明)

[第 5 页] 局限与假设
  - 归因粒度假设(区域级 spacing)
  - 移除实验的自述(AJ.2)
  - 数据外推警示(单中心训练)

模板设计原则:每页都是面板维度的直接应答(临床意义=第 2-3 页/对齐=归因叠加图/质疑支持=第 4 页阴性说明/清晰度=结构化模板本身)。

附录 AL:GC 五连收官的库内结构统计

统计项 数值
本批次条目 5(531-535)
平台 Grand Challenge 全系(DIAG Nijmegen 运营)
会议线 MICCAI×4(LMC2 投稿/TopBrain/CHIMERA/autoPET V)+WACV×1(OWL)
任务族 生成/分割/生存+分类/交互分割/可解释性——五族
评估体系 SSIM/AUC/C-index 四件套——五形态
可获取性 注册墙×2/Zenodo/AWS/三载体——四档
主办方生态 DIAG Nijmegen 圈(Radboudumc×3:CHIMERA/OWL/GC 平台)+UZH+Tübingen+FBI
互链密度 五条目内部互链+rid 468 系列互链+ hecktor/lung-pet-ct-dx 邻接

五连的方法论遗产:GC 核查模板 v1.0→v1.6(六版迭代)+四档可获取性光谱+五形态评估体系+多义名消歧法+系列前作锚档+披露度分档——挑战赛型条目的完整生产学。

附录 AM:坑点补充(数据与提交细节 15 条)

坑点 内容
11 金字塔层级误用——level 0 全分辨率读入 OOM;按任务选层(附录 R.1)
12 多切片拼装的 spacing 不一致——同文件内不同切片可能不同扫描参数
13 组织 mask 与 WSI 层级错位——归因 spacing 必须 mask 对齐(附录 R)
14 删失数据的 MSE 回归——event=0 的随访时间不是"真实复发时间"(右删失)——Cox/删失加权才对
15 三档阈值报告缺失——自派生阈值必须写进解释报告(可复现性)
16 归因图分辨率上采样——重采样到全分辨率会破坏 spacing 对齐(原层级输出)
17 Debug phase 跳过——平台/本地输出不一致是高频翻车点(容器环境差)
18 2TB 下载无断点续传——分例下载+校验(md5)
19 面板维度平衡忽视——只优化 novelty 牺牲 plausibility(负相关维度的权衡)
20 报告模板自由过度——结构化模板(附录 AK)降低评审理解成本
21 "模型没看哪里"漏写——阴性说明是质疑支持维度的直接素材
22 跨中心声明缺失——单中心训练的外推警示必须写进报告第 5 页
23 引用 timeline 笔误——宣奖年份 2027 非 2026
24 External Validation 缺席规划——赛后长期 benchmark 是方法持续曝光通道
25 OWL/本体语言检索混淆——文献检索加 “pathology/BCR/WACV” 限定

附录 AN:GC 五连合卷·批次终曲(五条目互相成就的叙事线)

AN.1 五发的时间叙事

发次 日期 条目 那天学到的事
一 09-25 早 531 LMC2 GC 平台的存在与极简页面形态;挑战赛型=第五类数据形态
二 09-25 午前 532 TopBrain 模板 v1.5 校准;规模代数自洽(48=40∪42∩34)首例
三 09-25 午后 533 CHIMERA 多义名消歧首用;生存任务族+四模态+屠榜悖论
四 09-25 黄昏 534 autoPET V 系列前作锚档;交互效率指标化(AUC 双指标)
五 09-25 晚 535 OWL 元研究型;人类评审进排名;五连合卷

AN.2 五发构成的完整光谱

  • 数据获取:注册墙→Zenodo→AWS→三载体——开放度四级标尺
  • 评估哲学:重建保真→体素几何→删失时序→交互效率→解释可信度——指标演进五形态
  • 人类位置:无→事后分析→参考推理→输入反馈(涂擦)→评审排名——参与深度五级
  • 学术出口:在投→NEJM AI→双 paper→journal 承诺→workshop+External——出口形态五样
  • 数据策略:新建库→二次精标→多库合并→系列扩容→完全复用——数据策略五式

AN.3 五发的共同底色

全部出自 DIAG Nijmegen 运营的 GC 平台;三家有 Radboud 血统(CHIMERA/OWL 主办+GC 平台方);四家对接 MICCAI 系会议——欧洲计算病理/影像挑战生态的密度样本。五条目合起来回答了一个元问题:“2026 年的医学 AI 挑战赛在为什么而赛?”——答案:从"比谁准"(LEOPARD 时代)演进为"比谁稳(域移)/比谁省(交互效率)/比谁真(解释忠实)/比谁有用(科学发现)"。

附录 AO:五连之后的观察窗口(2026-10~2027-02)

窗口 事件 观察点
2026-09-26 TopBrain 初测截止 TA36 赛道参与度
2026-10-01 CHIMERA-agent workshop(MICCAI Abu Dhabi) agentic 推理评审结果
2026-10-03/09 autoPET V MICCAI 现场 AUC 双指标冠军方法
2026-10-16 OWL testing 开放 可解释性挑战的实际热度
2026-11-30 autoPET V/OWL 提交截止 最终参与规模
2026-12-18 CHIMERA-agent Debug 截止 302 队的留存率
2027-01 WACV 宣奖+CHIMERA workshop 论文 冠军方法学术化起点
2027-02 OWL External Validation 长期 benchmark 开跑

后续条目候选观察:六连可能(TopAneu 2026 已完成 423 participants——GC 首页最大参与度挑战之一;HECKTOR 2026;REG² 病理报告生成)——按本批方法论直接复制生产。

附录 AP:可解释性行话速成(评审维度背后的术语)

AP.1 十个高频术语的精确用法

术语 精确定义 常见误用
explanation 对模型特定决策的依据呈现 与 interpretability(能力)混用
interpretability 模型可被理解的程度(系统属性) 当作单次输出
faithfulness 解释与真实决策依据的一致度 与 plausibility(可信度)混同
plausibility 解释对人类的说服力(可以不忠实但可信) 当作 faithfulness
stability 相似输入的解释相似度 与 robustness 混用
attribution 贡献分配(正/负/量) 只指正贡献
concept activation 概念在内部的激活向量(TCAV 系) 与"概念检测"混用
sanity check 归因方法的边缘化检验(随机模型对照) 当作数据 QC
post-hoc 训练后追加的解释方法 与 intrinsic(内建可解释)对立
intrinsic interpretability 模型结构自带可解释(稀疏线性/浅树/概念瓶颈) 与 post-hoc 混排

AP.2 五连各条目的"术语名片"

条目 核心术语 一句话
531 LMC2 MIP/SSIM 代理任务(聚焦预测)的可迁移
532 TopBrain contamination 类间泄漏的显式度量
533 CHIMERA ΔC / withheld 变量删除下的鲁棒衰减
534 autoPET V AUC-DMM 交互效率的实例级曲线
535 OWL deletion gap 高相关区移除 vs 随机的输出差

AP.3 术语纪律的评估意义

面板"clarity"维度惩罚术语混用——报告中的术语精确性本身是被评对象(可解释性的第一性:解释者先自洽)。

附录 AQ:尾注——元研究型条目的生产学复盘

AQ.1 页面极简型的核查补偿策略(本条目首创)

  • 官方四页信息量≈前四发单页的 1/3——交叉信源密度必须加倍
  • 本条目实际信源:官方页×4+CVF 官网+CSDN 二手+533 论文作者链(人物交叉)+GC 动态——五类信源分级标注(附录 AA)
  • 事实清单 32 条中页面缺位类(无奖金/无仓库/无组织页)单列——"缺位"本身是信息(披露度分档的实证基础)

AQ.2 元研究型 DAIMS 的三处权重迁移

  1. 文档完备→评估协议完备(OWL 五阶段披露完整+权重未披露并存)
  2. 标注质量→标签+mask+弱监督声明(无区域金标是设计而非缺陷)
  3. 可复现→faithfulness 可测性(扰动法逻辑公开 vs 参考实现缺位)

AQ.3 五连收官的三个未竟之问(留给后续批次)

  1. LEOPARD/PI-CAI/PANDA 等前作条目何时入库——三线互链的最后一块
  2. 可解释性第二例(REG² 病理报告生成类)何时出现——第七任务族的第二条数据线
  3. External Validation 的数据形态——"赛后 benchmark"作为新数据资产类型的入库判据

§10 总结:给"解释"立规矩的第一块模板

OWL 是 GC 五连的收官,也是形态的极限:数据最小(508 例单中心)、参与最少(15 队)、页面最薄(无 FAQ/无组织页/无仓库)、披露最缺(许可/IRB/权重均未明示)——但评估协议却是五连中最具方法论野心的一套:预测资格线(0.65)过滤弱信号、扰动分析把 faithfulness 变成曲线、双专家面板把"幻觉风险"和"质疑权"写进评分表。它标记了挑战赛范式的一个转折:当预测精度被卷到头,"模型如何判断"成为下一个可竞争的对象。与 534 autoPET V 构成完美的对照实验——autoPET 把"人类反馈"放进输入(涂擦),OWL 把"人类评审"放进排名(Likert)——2026 年的两个信号都指向同一结论:医学 AI 评测的下一层是人机接口本身。对 AI-Ready 数据集评估的最终启示(五连合卷):数据的价值=数据本体的质量×评估协议的科学性×披露的诚实度——OWL 以最小的数据体量做出了最完整的协议示范,而它的披露缺位又恰好构成反面教材——一个条目同时给出正反两面,作为五连收官再合适不过。


本条目为千方病案医数集 GC 五连收官发。数据以 OWL 官方页面(owl.grand-challenge.org 四页)、LEOPARD 下载页、CVF 官网与 CSDN 技术社区旁证为准,抓取时点 2026-09-25。Radboudumc 生态条目另有 533 CHIMERA(同人主办+同任务族)互链。

(完)

| 归因粒度 | 区域级(mask spacing) | 任务页规格 |
| 报告语言建议 | 英文(面板国际化) | 建议项 |
| 训练外部数据 | 患者级结局类可用(披露) | 弱监督边界内 |
| 概念词典来源 | ISUP/Gleason+器官分割迁移 | 附录 AF |

补充说明:本条目与 533 CHIMERA 构成 Radboudumc 前列腺 BCR 任务族的双子星(多模态融合线+可解释性线);与 534 autoPET V 构成 2026 评审哲学两极。GC 五连至此合卷——模板 v1.6 与五形态评估体系为后续挑战赛型条目(TopAneu/HECKTOR/REG² 候选)提供直接生产学基础。

(完)——千方病案医数集 GC 五连·第五发·合卷

GC 五连生产学备忘:本批五条目(531-535)的完整流程记录见 production_tracker.md 对应条目;GC 核查模板 v1.6 全文见 534 条目附录 O 与本条附录 N。

数据一致性声明:本条目全部事实经多源交叉验证(官方四页+CVF+二手社区+平台动态),未验证项已在口径注 N1-N7 中显式标记。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • lysto — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • wsss4luad — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • pannuke — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
  • lizard — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
  • leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • peso — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
  • cosas — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集
  • panda — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • paip — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集