PANDA-PLUS (panda-plus) — AI-Ready Wikipedia

PANDA 挑战赛 546 张前列腺穿刺 WSI 的像素级 Gleason 重标注升级版——学生注释+高年级复核+30 年经验病理专家终审三层流水线,系统性暴露原 PANDA 高级别标签错误,衍生 CC BY-4.0 Bench 基准 HuggingFace 公开

来源 PANDA 挑战赛公开 H&E 前列腺穿刺活检 WSI(20×,0.4862 μm/px)+ 像素级 RGB 注释掩码(QuPath,Benign/GP3/GP4/GP5/Ignore 五类,与 WSI 像素对齐无降采样)+ GS/ISUP 逐张重算表 + Kaggle 原标签对照发布时间: 2026-09-26最后更新: 2026-09-26 阅读 24
PANDA-PLUS (panda-plus) — AI-Ready Wikipedia

信息速览

数据集名称PANDA-PLUS (panda-plus) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模546 张 WSI(Radboud 480 + Karolinska 66;患者级数量未披露);Bench 子集 9 张(9 唯一患者)
接入方式PANDA 挑战赛公开 H&E 前列腺穿刺活检 WSI(20×,0.4862 μm/px)+ 像素级 RGB 注释掩码(QuPath,Benign/GP3/GP4/GP5/Ignore 五类,与 WSI 像素对齐无降采样)+ GS/ISUP 逐张重算表 + Kaggle 原标签对照
AI 就绪度

INFOBOX — PANDA-PLUS 一屏速览

维度 内容
本质 PANDA 挑战赛 546 张前列腺穿刺 WSI 的像素级 Gleason 重标注升级版(非挑战赛、非新采集)
团队 Brigham Young University(BYU)物理与天文系,通讯 Dennis Della Corte;8 作者同机构
论文 J Pathol Inform. 2025 Dec 30;20:100540(doi:10.1016/j.jpi.2025.100540;2026 卷期双口径)
数据 546 WSI = Radboud 480 + Karolinska 66;20×,0.4862 μm/px;QuPath 注释 RGB 掩码
类别 Benign / GP3 / GP4 / GP5 / Ignore*(GP1/GP2 归 Benign)
流水线 pre-med 学生注释 → 高年级学生复核 → 30 年经验 board-certified 病理专家终审
核心发现 PANDA 高级别标签系统性偏高:20 张 GS10/ISUP5 专项中 11 张实为 GS0(无恶性组织),0 张维持高级别
统计 全集 agreement(GS)0.419;quadratic κ 0.848;线性加权下不一致呈"高级别大幅降级"模式
粒度实验 同一专家单张:slide 级 GS8 → patch/pixel 级 GS7;GP3 占比在 patch 级膨胀 2 倍
衍生基准 PANDA-PLUS-Bench:9 WSI / 8 增强条件 / 30,976 patch,CC BY-4.0 于 HuggingFace 公开直链
评估对象 Virchow/Virchow2/UNI/UNI2/Phikon/Phikon-v2/HistoEncoder 七个病理基础模型鲁棒性
获取 WSI 公开(Kaggle)|掩码请求制(邮件通讯作者)|Bench 公开直链(HF)
许可 三层异构:WSI CC BY-NC-SA|掩码 upon request|Bench CC BY-4.0|论文 CC BY-NC-ND
库内互链 PANDA(上游本体)、SICAPv2(像素级前纪录保持者)、LEOPARD(复发预测)、REG²(报告生成)

PANDA-PLUS 是一个"给最大前列腺病理数据集重新戴眼镜"的数据集工程:它不采集新数据,而是把 PANDA 挑战赛里 546 张穿刺活检全切片(WSI)从"切片级一个标签"升级为"每个腺体一个颜色"的像素级注释,并在重标注过程中发现原 PANDA 的高级别标签存在系统性偏高——20 张原判 GS10(最高级)的切片,重审后 11 张根本没有恶性组织。这个发现对一切在 PANDA 上训练或评测的模型都是一记警钟,也使 PANDA-PLUS 成为研究"标签质量如何决定模型上限"的教科书样本。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意掩码是请求制,Bench 才是公开直链,别混。
  2. 关心标签质量:直奔 §4 与 PANDA 的比较发现——统计表、20 张专项、粒度实验三段连读。
  3. 做基础模型评测:直奔 §5 PANDA-PLUS-Bench——CC BY-4.0 直链可用,七模型结果可直接对标。

§0 导读:这个数据集解决什么问题

前列腺癌的 Gleason 分级是"同一张切片、不同专家、不同答案"的高发区:文献报道病理医生间 Gleason 评分一致率约 57.9%,专家再阅 602 例会诊切片中 44% 被改级、约十分之一的治疗方案随之改变。PANDA 挑战赛(2020-2021,Kaggle)提供了史上最大的公开前列腺穿刺 WSI 集合(万余张),但绝大多数只有切片级标签——一整张 gigapixel 图像对应一个 Gleason score。切片级标签的代价是双重的:训练时模型只能拿到粗粒度监督;评测时一个错误标签会直接污染整张切片的分数。

PANDA-PLUS 的回答分三层。第一层是数据:546 张 WSI 全部重标为像素级 RGB 掩码(Benign/GP3/GP4/GP5/Ignore 五类),掩码与原图零降采样像素对齐,可直接训练腺体分割与像素级分级模型。第二层是方法:一套"医学生注释 → 高年级复核 → 资深病理专家终审"的三层流水线,把像素级注释的专家时间从每张 1-2 小时压到 10-15 分钟,且流水线本身可复制到其他 WSI 集合。第三层是批判:把重算的 GS/ISUP 与 PANDA 原标签逐张对照,用 agreement、kappa、PABAK 三套指标(各三档加权)量化分歧,发现分歧系统性偏向"PANDA 评高了",且高级别区最严重——由此衍生出对 PANDA 标签可靠性的正式质疑。

§0 读法三则:

  1. 这个条目是"数据集+方法论文+评测基准"三合一:本体是 546 张带掩码 WSI,衍生品是 Bench 基准,副产品是一套可复制的标注流水线——三者许可与获取方式各不相同(§6)。
  2. 全文统计数字均出自论文正文与表格;正文与表格唯一冲突处(unweighted κ 0.283 vs 0.263)已在坑 3 存照。
  3. 检索时若把"PANDA-SICAP"当作数据集名去搜会一无所获——这个组合词只是文献里"PANDA 训练+SICAP 测试"的惯用简称(坑 1)。

§1 数据集速览:十问十答

Q1:PANDA-PLUS 的"546 张"从哪来?
全部从公开 PANDA 数据集(Kaggle 2021 托管版)下载:其中 Radboud 大学医学中心(荷兰)480 张、Karolinska 学院(瑞典)66 张。原 PANDA 元数据(GS/ISUP)从竞赛页另行获取,对注释团队全程屏蔽。

Q2:图像规格是什么?
20× 放大、0.4862 μm/px 空间分辨率,H&E 染色穿刺活检 WSI。注释在 QuPath 平台完成,掩码导出时 RGB 值与 QuPath 分类一一对应、无任何降采样,因此掩码与 WSI 在像素级完全对齐。

Q3:掩码里有什么类别?
五类:Benign、GP3、GP4、GP5(腺体区域逐像素着色)与 Ignore*(背景空白区整块划定)。GP1/GP2 等早期 pattern 不单列、并入 Benign——这意味着掩码不能直接用于早期 pattern 识别研究。

Q4:谁注释的,可靠吗?
BYU 的 pre-med 本科生初注(每周受训),高年级学生复核(覆盖完整性/去重叠/剔除非组织),一位 30 年以上经验的 board-certified 病理专家逐腺体终审。专家每周投入 2-4 小时复核,全流程把专家时间从 1-2 小时/张压到 10-15 分钟/张。

Q5:重算的分级和 PANDA 原标签差多少?
全集 546 张的 GS 一致率仅 0.419(ISUP 0.396)。分歧不是随机分布:热图整体偏向"PANDA-PLUS 更低"一侧,高级别区最刺眼——6 张 PANDA 判 GS9/10 的切片被重审为 GS0(完全分歧)。

Q6:那个"20 张专项"是什么?
注释过程中发现高级别切片分歧异常严重,团队随即补做专项:从 PANDA 高级分子集(GS10/ISUP5)里选出疑似分级差 >4 分的 20 张,专家先盲评再像素级重标。结果 0 张维持 GS9/10,11 张被判定不含任何恶性组织。

Q7:粒度实验说明了什么?
同一位专家、同一张切片,slide 级目评估 GS8,patch 级(256²/512²)与像素级注释算出来都是 GS7。更关键的是 GP 占比失真:GP3 从像素级的 5.5% 膨胀到 512² patch 级的 12.0%(翻倍以上),Benign 膨胀近 3 倍——patch 越大、噪声越大。

Q8:Bench 基准是什么、和本体什么关系?
PANDA-PLUS-Bench 是从本体派生的鲁棒性基准:9 张 WSI(9 个患者)切 224×224 patch,8 种增强条件各 3,872 张共 30,976 张,CC BY-4.0 在 HuggingFace 公开直链。它测的是"基础模型学到的是生物信号还是切片特异伪影"。

Q9:我现在能拿到什么?
三层:WSI 本体走 Kaggle 公开(CC BY-NC-SA 口径);注释掩码要邮件通讯作者申请(学术用途+机构隶属);Bench 在 HF 直接 load_dataset(CC BY-4.0)。

Q10:为什么它对 AI-Ready 重要?
它是"请求制掩码+公开直链衍生基准"的组合样本:本体 AI-Ready 得分被请求制拖低,但团队用 CC BY-4.0 的 Bench 补上了可复现性入口——这种"本体保守、衍生开放"的双轨结构在库内是首例。

§2 数据构成与规格

2.1 规模、来源与机构构成

PANDA-PLUS 包含 546 张完整注释掩码 WSI,全部派生自 PANDA 挑战赛公开数据:

机构 WSI 数 占比 高级别代表
Radboud University Medical Center(荷兰奈梅亨) 480 87.9% 全部 20 张 ISUP5 与 5 张 GS9 均出自此
Karolinska Institute(瑞典斯德哥尔摩) 66 12.1% 仅 2 张超过 GS6/ISUP1
合计 546 100% —

机构偏斜不是设计而是事故:注释分配采用启发式顺序块策略,学生领到编号后"直接顺着往下标",造成大片连续编号被整体注释,而 PANDA 的编号恰好按机构分块,于是 Radboud 被系统性过量采样。论文在讨论节原文承认"sampling heuristic"存在 methodological flaws。对使用者的含义:不要把 546 张当作两机构的平衡样本,任何跨机构结论都要先对齐机构构成。

选取标准方面,论文没有声明随机抽样——546 张的 GS 分布(下表)与 PANDA 总体分布差异很大,重标注团队本身也不知道这批图的原标签(防偏设计),因此分布偏斜是"无监督选择+顺序分配"的自然结果而非标签驱动。

2.2 掩码规格与对齐保证

属性 规格
放大倍率 20×(原始扫描倍率,无下采样)
空间分辨率 0.4862 μm/px
注释平台 QuPath(内置对象分类工具)
掩码格式 RGB PNG,RGB 值与 QuPath 分类一一对应
对齐保证 掩码生成时零降采样,与 WSI 逐像素精确对齐
清洗阈值 <1600 像素的注释伪迹整体删除
背景处理 白色空白区用单个大注释划定,类名 Ignore*

清洗阈值 1600 px 的用意是消除"手滑注释":小片误划如果进入像素计数,会直接影响按面积计算的 GS 重算值。论文给出未清洗/清洗对照图,可看到孤立小色块被整体抹除。

2.3 类别体系与早期 pattern 的取舍

掩码五类:Benign / GP3 / GP4 / GP5 / Ignore*。

三处细节值得注意:

  1. GP1/GP2 归 Benign:早期 Gleason pattern(1、2)在穿刺活检中已极少报告且与良性腺体形态学边界模糊,团队选择不单列。这意味着掩码不支持"早期 pattern 识别"类研究,也意味着 Benign 类内实际混有低级别 pattern。
  2. 注释粒度自适应:腺体级为主——单个腺体或形态相似的腺体簇逐个圈注;在分化极差的 GP5 区域,腺体结构消失,整片连续恶性区作为整体标注。
  3. 非腺体结构不设类:慢性炎症、间质、筛状结构、神经周围侵犯等不作为独立类别,只按其主导 GP 归类。掩码回答的是"每个像素属于哪个 Gleason pattern",不是完整的组织学分割。

2.4 分级分布:一个重标注视角下的低级别主导样本

重算后的逐张 GS/ISUP 分布(Table 2/3 口径):

Gleason score Radboud Karolinska 合计(占比)
GS 0 144 41 185(33.9%)
GS 6 222 23 245(44.9%)
GS 7(3+4) 31 0 31(5.7%)
GS 7(4+3) 52 1 53(9.7%)
GS 8 11 1 12(2.2%)
GS 9 5 0 5(0.9%)
GS 10 15 0 15(2.7%)
合计 480 66 546

ISUP 口径:0-5 级分别为 185(33.9%)/245(44.9%)/31(5.7%)/53(9.7%)/12(2.2%)/20(3.6%)。

三个观察:

  1. 近八成为良性或低级别(GS0+GS6 = 78.8%)——这与 PANDA 总体分布方向一致(PANDA 本身也偏良性/低级别),但偏斜程度更甚。
  2. Karolinska 子集几乎无高级别:66 张里 64 张为 GS0/GS6,仅 2 张超过 GS6。这直接解释了后文 Karolinska 一致率显著偏高的统计假象。
  3. 高级别样本仍然稀缺但非零:GS10 有 15 张——正是这 15 张所在的高级别区,贡献了与 PANDA 原标签最激烈的分歧。

2.5 与 PANDA 本体的关系边界

PANDA-PLUS 不改 WSI、只改标签。546 张原图本身仍是 PANDA 资产(Kaggle 公开,CC BY-NC-SA 口径);PANDA-PLUS 的增量贡献是掩码+重算分级+原标签对照表三件套。因此引用规范上要同时引两者:图像来源引 PANDA(Bulten 等 2022 论文口径),注释与发现引 Hopson 等 2025(J Pathol Inform 20:100540)。

论文转述 PANDA 构成时写"12,625 WSI——10,616 模型开发 + 393 性能评估 + 545 内部验证,外加 Tampere University (United States) 1,071 张外部验证"。其中括号国名是笔误:Tampere University 在芬兰(坦佩雷),非美国——条目按事实记芬兰并在坑 6 存照。

2.6 像素级工艺对比:三种注释生产模式

把附录 N 里的像素级/注释密集型数据集按"谁在标、怎么核"重新切一刀,能看到三种生产模式的取舍:

模式 代表 注释者 质控核心 单张专家成本 规模上限
专家手标 SICAPv2 病理医生本人 专家间一致性 1-2 h+ 低(百张级)
分层流水线 PANDA-PLUS 受训学生+专家终审 全量终审 10-15 min 中(千张级可期)
众包聚合 CrowdGleason 非专家群体 每 patch 多人投票 近零 高(万 patch 级)

三种模式对应三种误差结构:专家手标的误差来自专家间分歧(57.9% 一致率背景);流水线的误差来自学生偏差被终审修正的残余量(3.4 节的 GP3-4 激进倾向);众包的误差来自非专家噪声被聚合稀释的程度(CrowdGleason 结论:人数越多越稳)。PANDA-PLUS 的位置在中间——用结构化流程把专家判断"复制"到学生产出上,是成本与保真度的折中设计。

对选型者的映射:需要最高保真标签做基准测试 → 专家手标(小而准);需要中等规模像素监督做训练 → 分层流水线(本条目);需要海量弱监督信号 → 众包聚合。三者不互斥,同一项目可按数据分层混用。

§3 注释流水线:三层级如何省下专家时间

3.1 三层人员结构

层级 人员 职责 投入
L1 注释 BYU pre-med 本科生(AI in Medicine Association 招募) 像素级逐腺体初注,每张单一注释者 每周例会受训
L2 复核 高年级学生注释员 腺体覆盖完整性/去重叠/剔除非组织/粗错纠正 每张全查
L3 终审 board-certified 病理专家(>30 年经验) 逐腺体确认或调整 GP,最终定级 每周 2-4 小时

培训体系由终审专家与高年级学生共同执行:前列腺组织学基础、Gleason 分级系统、腺体形态学、数字注释技术四模块,每周例会滚动强化,另配"腺体识别与分级判定"参考手册给注释员随时对照。

3.2 工作流与防偏设计

每张 WSI 的生命周期:下载→去标识(PANDA 侧已完成)→重新编号(内部 image number)→启发式分层分配给单一学生→L1 注释→L2 复核→L3 终审→掩码生成→伪迹清洗→按像素计数重算 GS/ISUP→与 PANDA 原标签对照。

两处防偏设计直接影响比较结果的可信度:

  1. 原标签全程屏蔽:PANDA 的 GS/ISUP 从 Kaggle 竞赛页单独获取,不进入注释流水线——学生与专家都不知道"这张原判几分"。因此重算分级是独立测量,不是对原标签的校准。
  2. 盲评优先:20 张专项里,专家先看不带注释的原图给出初判 GS,学生再做像素级注释,注释完成后专家二次确认——避免"先入为主的标签锚定"。

3.3 效率账:1-2 小时如何变成 10-15 分钟

纯专家手标像素级掩码的成本是每张 1-2 小时(访谈口径),546 张即 550-1100 小时专家时间——这是全球像素级注释稀缺的直接原因。三层流水线把专家角色压缩为"复核+终审":机械劳动由受训学生完成,专家只处理需要判断力的部分。UroToday 访谈给出每张 10-15 分钟的复核时间;论文口径为专家每周 2-4 小时复核当周产出。按 546 张摊算,与访谈口径相容。

这不是免费午餐:学生注释与专家终版存在系统性差异(3.4),流水线的质量上界由终审专家一人决定。作者自己强调流水线"可扩展、可迁移到其他 WSI 集合、可引入多专家",但本研究内它是单专家流水线。

3.4 学生偏差画像:GP3-4 区间的系统性激进

论文披露两类可复现的学生倾向:

  1. GP3-4 边界偏激进:形态模糊的腺体,学生更常判 GP4(更高级别)——这与临床"宁可报重不可漏报"的保守直觉一致,但会抬高 GP4 占比、间接抬高 GS。
  2. 异形即恶性误判:形状不规则的正常变异腺体有时被学生误标为癌性。

这些偏差正是 L2/L3 存在的理由:每张图的每个结构都被学生与专家双重过目,专家修订最终生效。对复用者的启示:若把"学生注释+专家抽检"当作低预算流水线模板,抽检密度直接决定标签上限——PANDA-PLUS 的是全量终审,不是抽检。

§4 与 PANDA 的比较发现:标签噪声的定量解剖

4.1 统计比较:三套指标 × 三档加权

以逐张重算 GS/ISUP vs PANDA 原标签做 546×2 的混淆矩阵,计算 agreement、κ(Cohen’s kappa)与 PABAK,各配未加权/线性/二次三档权重(二次权重对严重分歧惩罚最重):

指标(全数据集 n=546) Gleason score ISUP grade
Agreement 0.419 0.396
κ(未加权) 0.263(表)/0.283(正文) 0.251
PABAK(未加权) −0.162 −0.209
κ(线性) 0.624 0.364
PABAK(线性) 0.396 0.505
κ(二次) 0.848 0.466
PABAK( quadratic) 0.528 0.738

如何读这张表(初学者最容易误读的三处):

  1. 未加权与加权的巨大落差不是矛盾:未加权 κ 把所有分歧等权看待,得到 0.263 的"几乎不一致";二次加权考虑"差 1 级 vs 差 4 级"的严重度,κ 升到 0.848。合起来读:大多数分歧是小幅漂移,但存在少量大幅降级——大幅分歧正是高级别区的那些案例。
  2. PABAK 未加权为负:−0.162 意味着观察一致率低于"按类别先验随机猜"的水平——这不是说两套标签比随机还差,而是类别分布高度偏斜时 PABAK 的数学性质使然( prevalence-adjusted 的双刃剑)。
  3. GS 与 ISUP 的分离:二次加权 κ 上 GS 0.848 而 ISUP 只有 0.466。GS7 拆分(3+4 vs 4+3)使 ISUP 对主次 pattern 顺序更敏感——像素级重算恰好能精确重排主次 pattern,于是在 GS 收敛的地方 ISUP 仍可分歧。

分机构子集:Radboud(n=480)与总体趋势一致(agreement GS 0.384);Karolinska(n=66)一致率显著偏高(agreement 0.688,二次 PABAK 0.960)。原因已在 §2.4 指明:Karolinska 子集 97% 为良性/低级别,避开了最容易分歧的区间——Karolinska 的高一致率是分布效应,不是标签质量效应。

4.2 热图与完全分歧案例

混淆矩阵热图(GS 与 ISUP 各三张:Radboud/Karolinska/总体)呈现统一形态:分歧质量偏在对角线上方(PANDA 分高、PANDA-PLUS 分低),且偏离对角线的幅度在高分级区显著放大。GS0/ISUP0 对角处密实——良性判断两套标签高度一致。

最刺眼的一格:PANDA 判 ISUP5(GS 9-10)的切片中,有 6 张在 PANDA-PLUS 侧落到 GS0/ISUP0——“最高级恶性肿瘤"重审后"完全没有恶性组织”。这 6 例是"标签错误的下限案例":连癌与非癌的定性都翻转,遑论分级。

4.3 20 张专项:高级别标签的定向体检

正式专项(方法节预注册流程):从 PANDA 的 GS10/ISUP5 子集里,由高年级注释员选出"疑似分级差超过 4 分"的 20 张;专家先盲评初判 GS,学生再像素级注释,专家终审。结果:

重审结果 张数(共 20)
GS 0(无恶性组织) 11
GS 6 1
GS 7 2
GS 8 6
GS 9 或 GS 10 0

即:全部 20 张都被降级,过半数根本不是癌,没有一张维持最高级。论文的措辞克制但指向明确:“This high rate of misclassification suggests substantial labeling errors in the broader PANDA dataset…we caution against over-reliance on these slide-level labels.”——20 张是小样本,结论是提示性而非统计显著的(dataLimitations 已存照),但方向与 §4.2 的 6 张完全分歧案例互相印证。

对库内 PANDA 条目(rid 560)使用者的直接含义:在 PANDA 上报告的高分数可能部分来自标签本身的宽容;跨数据集评测(如训练 PANDA、测试 SICAPv2)中观察到 PANDA 侧分数系统性偏高时,标签质量是必须纳入的混杂因素。

4.4 粒度实验:同一人、同一张、三种注释粒度

实验设计:同一位终审专家,对同一张 WSI 分别以 slide 级(目视)、patch 级(256×256 与 512×512 两种常用训练切片)、像素级三种粒度定级。patch 级按"patch 内主导 pattern"归类(组织覆盖 >20% 才计入,否则 Ignore),像素级按像素计数定主次 pattern。

结果:

  • 定级漂移:slide 级 GS8 → patch 级 GS7 → 像素级 GS7。仅粒度变化即翻转 ISUP 对应关系(ISUP4 → ISUP2/3 一档)。
  • GP 占比失真(相对像素级基准):
类别 像素级 256×256 patch 512×512 patch
GP3 5.5% 10.9%(×2.0) 12.0%(×2.2)
Benign 0.6% — 1.7%(×2.8)
GP4 — — ×1.8
GP5 — — ×1.8

机制:patch 取主导 pattern 时,被选中 pattern 获得超额表征,其他 pattern 系统性缩水;patch 越大,混合越严重,计数噪声越大。实验虽然只有单张,但机制解释是普适的:凡是按 patch 主导类别产出的弱标签,都内嵌这个膨胀器。

这一实验是论文对"AI 训练标签工程"的方法学贡献核心:它把"切片级标签有噪声"这句常识拆解成了可测量的膨胀系数与可复现的实验范式。

4.5 统计卫生:读这组数字的四条守则

  1. 别把 agreement 当 kappa 用。agreement 0.419 是"完全一致比例",κ 才扣掉随机一致;类别偏斜(33.9% GS0)会让 agreement 显得"还行"而 κ 很难看——两者必须同报。论文给全了三档权重,引用时注明你用的是哪一档。
  2. 别用 Karolinska 子集的 0.688 反驳全集的 0.419。Karolinska 高一致是"没考到难题"(97% 良性/低级别),等价于用简单子集测出的指标,与全集不可直接比。
  3. 别把 PABAK 负值当"比随机差"传播。−0.162 是 prevalence 调整的数学产物(po<0.5 时 PABAK=2po−1 必为负),正确的表述是"一致率低于类别先验下的期望水平"。
  4. 二次 κ 0.848 不等于"两套标签几乎一致"。二次权重把"差 1 级"与"差 4 级"压到同一量纲的平方惩罚下,高分只说明"多数分歧不严重";而高级别区那 6 张完全分歧与 11/20 GS0 恰恰是"严重分歧存在且定向"的证据。所有指标合读的结论是:小幅漂移普遍+大幅降级定向于高级别——两头都要报,只报一头都是误读。

这四条守则同样适用于审稿与复现:若你在别处看到有人引用本数据集时只报单一指标(无论报哪个),都应视为选择性引用。

§5 PANDA-PLUS-Bench:从重标注到基础模型鲁棒性基准

5.1 动机与构成

如果说 PANDA-PLUS 本体回答"标签怎么画",Bench 回答的是"模型到底学到了什么"。病理基础模型在验证集上分数漂亮,但可能大量依赖切片特异伪影(扫描仪指纹、染色批次、切片编号可辨别的风格差异)——所谓 WSI-specific feature collapse(切片级特征坍塌)。Bench 用一个刻意构造的对照把这种坍塌量化出来。

属性 规格
来源 PANDA-PLUS 专家注释 WSI 中精选 9 张(9 个唯一患者,Gleason pattern 多样)
patch 224×224 @20×(另有 512×512 提取路径),非重叠组织 patch
增强条件 8 种 × 3,872 张 = 30,976 examples
标签 Benign(0) / GP3(1) / GP4(2) / GP5(3) + slide_id
体量 2.56 GB(Parquet,HF datasets 格式)
许可与入口 CC BY-4.0,HuggingFace dellacorte/PANDA-PLUS-Bench,gated=false 公开直链
论文 Ebbert JL, Della Corte D. AI Med. 2026;1(2):14(doi:10.3390/aimed1020014;2026-05-28 发表)

八种增强条件构成"扰动光谱":baseline(仅 ImageNet 归一化)、color_jitter(亮度/对比/饱和/色相)、grayscale(完全去色)、gaussian_noise(σ=0.05 加性噪声)、heavy_geometric(±180° 旋转+翻转)、combined_aggressive(全增强叠加)、macenko_normalization(Macenko 染色归一化)、hed_stain_augmentation(H/E 通道扰动)——前五种考验通用视觉鲁棒性,后三种直指数字病理特异的染色域漂移。

# Bench 官方推荐加载方式(HF datasets 库)
from datasets import load_dataset

ds = load_dataset("dellacorte/PANDA-PLUS-Bench", split="baseline")
sample = ds[0]
# sample["image"]    -> PIL Image(224x224)
# sample["label"]    -> 0=Benign, 1=GP3, 2=GP4, 3=GP5
# sample["slide_id"] -> 切片标识(9 个唯一值)

5.2 七个基础模型的坍塌画像

评估任务:让各基础模型在 8 种条件下做 patch 分类,分别统计 slide-ID 分类精度(能否凭 patch 认出"这是哪张切片"——越高说明伪影编码越强)与 cross-slide 精度(跨切片泛化精度——越高说明生物信号越强):

模型 slide-ID 精度 cross-slide 精度 解读
Virchow 80.7-81.0%(大规模组最低档) — 大规模组中伪影编码最弱
Virchow2 81.0% 47.2%(大型组次低) 伪影弱但泛化也弱
UNI / UNI2 — — 中间档
Phikon / Phikon-v2 — — within/cross gap 达 26.9 pp
HistoEncoder 90.3%(最强) 59.7%(最高) 前列腺特异训练:伪影最强但泛化也最强

三个结论(论文口径):

  1. 所有模型都有 within- vs cross-slide gap(19.9-26.9 个百分点)——切片伪影普遍存在,只是程度不一。
  2. 伪影编码与泛化能力不必然负相关:HistoEncoder 两个指标同时最高——前列腺组织特异训练可能同时增强了对生物特征和切片签名的捕获。这与"伪影越少越好"的朴素预期相反。
  3. Virchow2 的警示:slide-ID 最低(伪影最弱)但 cross-slide 也最低——弱伪影不自动等于好表征。

论文配套开源 Google Colab,可在标准化指标下把新模型跑进同一张对照表——这是 Bench 对外承诺的核心可复现性资产。

5.3 双口径与 repo 名坑(检索者必读)

  • 规模双口径:HF README 卡片写"~2,770 per augmentation condition",而 API splits 实测每条件 3,872(8×3,872=30,976,与 MDPI 论文摘要一致)。以 API/论文口径为准,README 数字疑为早期版本残留(坑 4)。
  • repo 名:真实可用的是 dellacorte/PANDA-PLUS-Bench;dellacortelab/PANDA-PLUS-Bench 不存在(API 返回 404 类错误)。“dellacortelab” 字样易与 BYU 学生组织 AI in Medicine Association、或实验室口头名混淆(坑 8)。
  • 下载热度:抓取时点 HF 累计 downloads 69、likes 1——发布约十个月,属低热度精确工具,不是社区爆款,检索时别期待大量第三方评测可引。

§6 获取与许可:三层异构的门怎么进

6.1 三层资产、三种门

资产 入口 许可 门槛
WSI 本体(546 张原图+全 PANDA) Kaggle 竞赛页 / panda.grand-challenge.org PANDA 口径 CC BY-NC-SA 注册即下
注释掩码+重算分级(PANDA-PLUS 本体) 邮件通讯作者 Dennis.DellaCorte@byu.edu 学术用途 upon qualified request 请求制:需附研究用途简述+机构隶属
PANDA-PLUS-Bench HuggingFace dellacorte/PANDA-PLUS-Bench CC BY-4.0 无(直接 load_dataset)
论文 doi:10.1016/j.jpi.2025.100540(J Pathol Inform,开放获取) CC BY-NC-ND 无

6.2 请求制实操要点

数据可用性声明原文要求两点:研究用途的简要描述与机构隶属。没有公开表单,唯一通道是邮件;论文未承诺响应时限、未列发放格式细节(按论文描述应为掩码文件+逐张分级表)。规划依赖此数据的工程时,把"等待发放"当作不确定周期处理,先用 Bench(公开)与 PANDA 原数据(公开)搭管线,掩码到位后再替换标签层。

6.3 AI-Ready 评估:双轨结构的得失

以库内 AI-Ready 检查单过一遍:

  • 机器可读元数据:论文开放获取全文+HF dataset card(含 features/splits/citation)——良好。
  • 公开直链:掩码本体缺失(请求制)——AI-Ready 最大失分项;Bench 补了一个可编程入口(HF API/Parquet 直接进管线)。
  • 许可明确性:三层许可各自明确,但拼起来需要使用者自行对齐"我训练的模型受哪层约束"——掩码请求制未附再分发条款,衍生模型许可属灰色地带。
  • 可复现性:Bench+Colab 提供"开箱即评"路径;本体复现(像素级训练)依赖申请成功。
  • 文档自洽:论文正文与表格一处数字漂移(坑 3)、README 与 API 一处规模漂移(坑 4)——都不影响主线结论,但自动化抓取需指定以表格/API 为准。

综合:AI-Ready 等级"中"——方法论与文档质量高于均值,可获取性被请求制拖低;Bench 的 CC BY-4.0 直链是重要的补偿设计,也是本条目与"纯注册墙"数据集的分界。

6.4 与库内可获取性光谱的对照

库内挑战赛/数据集条目已形成可获取性光谱(注册墙→请求制→Zenodo→AWS Registry→公开直链)。本条目在光谱上的位置:

档位 库内参照 本条目对应
注册墙(最严) LMC2(rid 531,注册+审批) —
请求制 少量老条目(upon request 型) 掩码本体
平台托管 Zenodo 型(TopBrain,rid 632) —
Registry 收录 AWS Registry 型(REG²,rid 639) —
公开直链 HF/Zenodo 直链型 Bench(CC BY-4.0)+ WSI(Kaggle)

特色在于"母-子双轨":母数据集(掩码)落请求制档、子基准(Bench)落公开直链档——同一团队同一项目内部横跨两档,这在库内是首例。对检索者的实际影响:按"能否立刻下载"过滤条目时,本条目会因 Bench 而命中;按"本体可直链"过滤时,本条目应标注请求制——两种过滤口径下它的归属不同,这正是三层异构结构的库内价值。

§7 生态与影响:一个实验室的三层产出

7.1 前作与谱系

BYU Della Corte 组在前列腺病理 AI 方向的三部曲:

  1. 2024 前作(arXiv:2406.06801):贝叶斯框架聚合多模型 Gleason 分布预测,强调"分布而非单值"的分级表征,配套一个腺体级手工精选小数据集——PANDA-PLUS 的方法论前身。
  2. PANDA-PLUS(本条目,2025-12 在线):546 张像素级重标注+三层流水线+对 PANDA 的批判性比较。
  3. PANDA-PLUS-Bench(2026-05):从本体派生的基础模型鲁棒性基准,CC BY-4.0 开放。

谱系逻辑是清晰的漏斗:先有"分布化分级"的方法主张,再造"像素级标签"的数据底座,最后收口"标签质量→模型行为"的评测工具。

7.2 商业化端口:pathtools.ai 的宣称口径

同一团队运营商业化网站 pathtools.ai(“Slide to Decide”,腺体级 AI 决策支持)。网站宣称两项非论文数据(组织方口径,无同行评审背书):

  • QWK 0.849(95% CI 0.782-0.903):在 147 张 PANDA-PLUS 切片评估集、8,808 个专家手绘腺体轮廓上测得,2026-09-14 复测于 patch-cascade 服务配置—— quadratic weighted kappa,专家-模型一致性。
  • 135,251 个专家注释训练语料:1,856 张切片、约 9,500 个穿刺芯(788 张多芯 @均值 10.7 芯 + 1,064 张单芯),2026-08-31 自注释数据库查询。

这两个数字属于"实验室商业化宣称":口径、版本、评测协议均以网站为准,不能与论文数据混引。条目仅作生态背景收录(坑 7)。

7.3 在前列腺 WSI 数据集景观中的位置

以论文 Table 1 的景观对照( Pixel-level 注释赛道):

数据集 年份 WSI 注释层级 特点
SICAPv2 2020 182 patch+slide 级 前纪录保持者,10,340 graded patches
RINGS 2021 1,500 像素级 腺体分割但无分级标签
PANDA 2022 口径 12,625 slide 级+稀疏 mask 规模之王
PCa_Bx_3D 2022 118 像素级 3D 多模态
CrowdGleason 2024 1,045 patch 级 众包实验,19,077 graded patches
DiagSet 2024 5,151 patch+slide 级 A/B/C 分层保真度
PANDA-PLUS 2025 546 像素级 RGB 掩码 前列腺穿刺 WSI 像素级注释规模之最

定位一句话:规模上 PANDA 不可撼动,注释粒度上 PANDA-PLUS 在"穿刺活检 WSI+像素级+带分级"的组合里目前最大(546 vs SICAPv2 的 182;RINGS 像素级但无分级标签,DiagSet 像素级子集为切除/扫描混合口径)。它同时是唯一"自带对原标签的批判性审计"的数据集。

7.4 对 PANDA 生态的反向冲击

PANDA 至今仍是前列腺分级模型的事实标准训练集(含大量 leaderboard 复现与基础模型评测)。PANDA-PLUS 的审计结果意味着:PANDA 上的一切分数都带有"标签上限"——模型不能可靠学出不存在的信号。短期内 PANDA 的地位不会被替代(请求制掩码无法支撑全量重训练),但"在 PANDA 上评测+在 PANDA-PLUS 子集上校准"的混合协议可能成为后续论文的常见设计。库内 LEOPARD(rid 636,复发预测)与 REG²(rid 639,报告生成)等下游任务的评估设计同样受此提醒。

§8 方法学启示:三条可迁移的经验

8.1 "专家终审+学生劳动"的流水线是可复制的

三层流水线的可迁移性论证:任务可分解(机械圈注 vs 判断修订)、质量可分层(L2 结构性检查 vs L3 判断性修订)、成本可压缩(专家 10-15 min/张)。适用于任何"注释标准清晰、形态学可培训"的病理子任务;不适用于判断边界本身有争议的任务(那时 L3 的单专家就成了单点偏差源)。

8.2 标签粒度是超参数,不是背景板

粒度实验给出的定量教训:patch 主导归类会系统性膨胀优势 pattern(GP3 ×2、Benign ×2.8)。这给弱监督/多实例学习社区一个直接的校准工具——在报告 patch 级训练结果时,同时报告像素级基准下的 pattern 占比,让读者看到"标签工艺"对结论的塑形。

8.3 分布化分级主张

论文结论段倡议:与其追求单一 ground truth,不如把 Gleason 分级表征为概率分布(与前作 arXiv:2406.06801 的贝叶斯主张一脉相承)。这与 2026 年 REG² 挑战赛用推理链显式化诊断过程的趋势同向——病理 AI 正在从"预测一个数"转向"暴露诊断的证据结构"。

8.4 标注生产视角:与多专家委员会模式的对照

病理标注的两种权威模式各有代价:多专家委员会(如 DiagSet C 的 9 人独立阅片)给出"分歧分布",成本极高、规模受限;单专家终审+学生劳动(本条目)给出"一致标签",成本低、规模可达数百张。PANDA-PLUS 的结论段实际上提出了第三条路:标签以概率分布存在——每个像素/每张切片承载"可能的主次 pattern 组合"而非单值,让下游模型显式面对不确定性。这与本库多条目记录的"金/银标准分离"(TopAneu 的金银双轨、REG² 的双指标结构)在思想上是同族的:承认真值的分布性,把分歧从缺陷变成信息。

工程落地时的取舍:单专家流水线的标签上限=该专家的水平与稳定性;概率化路线要求标注协议从"定值"改为"采样"(多次独立定级或多人聚合),成本介于两者之间。PANDA-PLUS 未走第三条路(它是单值掩码),但其审计结果(§4)恰是第三条路最有力的动机证据。

§9 与库内条目的关系

9.1 家族图谱

  • PANDA(rid 560):直接上游。本条目为其提供像素级升级路径+标签审计结论;两篇同读才能拼出"PANDA 数据集全貌"(本体+批判)。
  • SICAPv2(rid 328):像素级赛道前纪录保持者(182 张)。PANDA-PLUS 546 张接棒"最大像素级穿刺 WSI 注释";两者分别代表 Valencia(专家手标 patch)与 BYU(流水线像素)两种工艺。
  • LEOPARD(rid 636):前列腺病理下游任务(复发预测)。其标签同样依赖病理分级,PANDA-PLUS 的标签噪声发现是 LEOPARD 评测设计的背景风险提示。
  • REG²(rid 639):病理报告生成挑战赛(MICCAI 2026)。两者共享"像素/结构级真值比切片级标签更可信"的底层主张;REG² 的推理链评估与 PANDA-PLUS-Bench 的伪影敏感性测试是病理 AI 可信度的两个互补维度。
  • Lizard(rid 238)/NuCLS(rid 248):核级/腺体级实例分割的注释方法论对照组(多机构多专家 vs 本条目单专家流水线)。
  • OWL(rid 635):计算病理可解释性科学发现挑战——与 Bench 共享"模型学到的是信号还是伪影"的问题意识。

9.2 检索路径建议

  • 检索词组合:“PANDA-PLUS”(精确)+ “Gleason” + “pixel-level”;勿用"PANDA-SICAP"(坑 1)。
  • 若目标是直接可用数据:HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0)→ Kaggle PANDA(CC BY-NC-SA)→ 掩码邮件申请。
  • 若目标是引用标签噪声论点:引论文 §Results 的 Table 4(agreement 0.419/κ 二次 0.848)与 20 张专项(11/20 GS0),并注明正文-表格 κ 漂移(坑 3)。

§10 避坑清单:八个已踩过的坑

坑 1:"PANDA-SICAP"不是数据集名。文献里"PANDA-SICAP"只出现在"PANDA 训练+SICAP 测试"的跨库评估语境中,是惯用简称而非具名数据集;本库生产 tracker 曾误记为候选条目名,三轮精确搜索证伪后改立 PANDA-PLUS。检索时用精确短语并核对 DOI。

坑 2:论文年份双口径。NLM/PMC 记录为 J Pathol Inform. 2025 Dec 30;20:100540(doi 10.1016/j.jpi.2025.100540);pathtools.ai 与 ScienceDirect 列表页写 “2026;20:100540”(doi 后缀 2026)。同一论文、两套年份(2025-12-30 在线 / 2026 卷期),引用前先定口径并全篇一致。

坑 3:正文与表格数字漂移。未加权 κ(GS):正文写 0.283,Table 4 写 0.263(ISUP 一致 0.251)。本条目正文按表格引用并注漂移;自动化抽取建议以表格为准。

坑 4:Bench 规模双口径。HF README 卡片"~2,770 per augmentation condition" vs API splits 实测 3,872/条件(总 30,976 与论文摘要一致)。以 API/论文为准。

坑 5:许可三层异构,别一揽子引用。WSI(CC BY-NC-SA)、掩码(请求制、条款未公开细化)、Bench(CC BY-4.0)、论文(CC BY-NC-ND)四件资产四套规则;特别是"掩码请求制"没有公开再分发条款,衍生模型的许可边界需自行与作者确认。

坑 6:Tampere 不是美国大学。论文原文把外部验证集写作 “Tampere University (United States)”——Tampere University 在芬兰。论文笔误,转引时按事实写芬兰。

坑 7:QWK 0.849 与 135,251 注释不是论文数据。两者是 pathtools.ai 商业化网站的宣称口径(2026-09-14/2026-08-31 查询),无同行评审背书,仅作生态背景,不可与论文指标混引。

坑 8:HF repo 名与类别映射。真实 repo 是 dellacorte/PANDA-PLUS-Bench(dellacortelab 不存在);标签 0-3 = Benign/GP3/GP4/GP5,没有"GP1/GP2"类别(本体掩码把它们并入 Benign),用 Bench 做多类评估时别假设六类输出。

§11 总结

11.1 三句话总结

  1. PANDA-PLUS 用 546 张像素级重标注证明:PANDA 的切片级标签在高级别区存在实质性错误(20 张 GS10 专项 11 张无恶性组织),一切 PANDA 评测都应带此背景。
  2. 它的三层注释流水线把像素级注释的专家成本压掉约 85%,方法本身是可迁移的公共资产。
  3. 它的衍生 Bench(CC BY-4.0 公开直链)把"标签质量→基础模型鲁棒性"变成可复现实验,七模型结果已可对标。

11.2 适合谁

  • 前列腺病理分割/分级团队:找像素级监督与跨机构评测设计。
  • 基础模型评测者:需要一个"反伪影"压力测试集(Bench 开箱即用)。
  • 数据集工程研究者:三层流水线+请求制/直链双轨可获取性都是活的案例研究。
  • 使用 PANDA 出分数的任何人:先读 §4,再决定怎么解读你的 leaderboard 位置。

11.3 不适合谁

  • 需要 GP1/GP2 早期 pattern 监督的项目(掩码不单列)。
  • 需要大规模即插即用像素级训练集的团队(546 张+请求制,量与速度都不满足)。
  • 需要多机构平衡采样的跨机构泛化研究(480:66 的机构偏斜是硬约束)。

11.4 30 秒决策卡

你的情况 行动
要立刻下点东西跑通 HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0)+ 附录 H 骨架
要像素级训练数据 Kaggle 下 PANDA + 邮件申请掩码(附录 P 模板)等待发放
在 PANDA 上出了高分 先读 §4——你的分数带着标签上限,报告时引用 Table 4 与 20 张专项
要写数据集综述 附录 N 景观表 + §2.6 工艺对比可直接引用
要设计标注流水线 §3 + 附录 F SOP 骨架;注意单专家终审的偏差源(§8.4)
要引用本数据集 附录 W BibTeX;年份口径按 NLM(2025;20:100540)

FAQ(高频问答 32 问)

A. 基础认知

Q1:PANDA-PLUS 是挑战赛吗?
不是。它没有比赛、没有 leaderboard,是对 PANDA 挑战赛数据的重标注研究项目,成果为论文+数据集+衍生基准三件套。

Q2:名字里的 PANDA 指什么?
Prostate cANcer graDe Assessment——2020-2021 年在 Kaggle 举办的前列腺癌分级挑战赛,提供史上最大公开前列腺穿刺 WSI 集合。PANDA-PLUS 从其公开数据中取材 546 张重标注。

Q3:"PLUS"加在了哪里?
加在标签上:切片级 GS/ISUP → 像素级 RGB 掩码(Benign/GP3/GP4/GP5/Ignore),外加逐张重算分级与原标签对照。

Q4:谁做的?
美国杨百翰大学(BYU)物理与天文系 Della Corte 组,一作 Spencer Hopson,通讯 Dennis Della Corte,8 位作者全部同机构。

Q5:发表在哪里?
Journal of Pathology Informatics(J Pathol Inform),NLM 记录 2025 Dec 30;20:100540,doi:10.1016/j.jpi.2025.100540,开放获取(论文 CC BY-NC-ND)。注意 pathtools.ai/ScienceDirect 列表页写 2026 卷期——双口径(坑 2)。

Q6:它和 SICAPv2 什么关系?
同行竞争者。SICAPv2(182 张,2020)曾是像素级注释的前纪录;PANDA-PLUS(546 张,2025)在"穿刺 WSI+像素级+带分级"组合上超过它,两者工艺不同(专家 patch 手标 vs 学生流水线+专家终审)。

Q7:它和 CrowdGleason 什么关系?
方法论近亲。CrowdGleason(2024,1,045 张)验证众包注释的可行性;PANDA-PLUS 的"学生+专家"流水线是同一思路的分层强化版,论文结论段也引用了 CrowdGleason 式框架。

Q8:最大的卖点一句话?
20 张原判最高级(GS10)的切片重审后 11 张没有恶性组织——它把"大标签集≠好标签"从直觉变成了测量结果。

Q9:它自己有什么局限?
机构偏斜(480:66)、低级别偏斜(78.8% 为 GS0/6)、GP1/GP2 不单列、单专家终审、20 张专项样本小——论文讨论节全部自曝。

Q10:开源吗?
分层开源:掩码请求制(不公开直链)、Bench CC BY-4.0 公开、论文开放获取、Bench 评估 Colab 开源。

B. 数据与获取

Q11:546 张怎么选的?
启发式顺序块分配(学生顺着编号往下标),无随机抽样声明;作者自曝该启发式有方法缺陷导致机构偏斜。

Q12:掩码和原图对齐吗?
严格逐像素对齐——掩码导出零降采样,RGB 值与 QuPath 分类一一对应。

Q13:背景怎么处理?
白色空白区用单个大注释划定为 Ignore* 类,<1600 px 的注释伪迹整体删除。

Q14:掩码怎么申请?
邮件通讯作者(Dennis.DellaCorte@byu.edu),附研究用途简述+机构隶属;无公开表单,无承诺时限。

Q15:WSI 原图去哪下?
Kaggle 竞赛页或 panda.grand-challenge.org(PANDA 公开口径 CC BY-NC-SA),注册即可。

Q16:三层数据我都想要,建议什么顺序?
先 HF 下 Bench(CC BY-4.0,直链)搭管线 → Kaggle 下 PANDA 原图 → 掩码邮件申请并行等待,到位后替换标签层。

Q17:能用掩码训练商用模型吗?
不确定。请求制声明只说"academic research purposes",未公开再分发/商用条款——商用前需与作者书面确认(坑 5)。

Q18:Bench 怎么加载?
HF datasets 库:load_dataset("dellacorte/PANDA-PLUS-Bench", split="baseline"),八个 split 对应八种增强条件;注意 repo 名是 dellacorte 不是 dellacortelab(坑 8)。

C. 统计与发现

Q19:一致率 0.419 是什么概念?
546 张里只有约 41.9% 的切片重算 GS 与 PANDA 原标签完全一致——近六成切片的分数被重审改变。

Q20:未加权 κ 只有 0.263,二次加权却 0.848,矛盾吗?
不矛盾。未加权对所有分歧等权;二次加权只重罚"差好几级"的大分歧。两者合读:多数分歧是小幅漂移+少量大幅降级(集中在高级别区)。

Q21:PABAK 为什么会是负数?
类别分布极度偏斜(33.9% GS0)时,PABAK 的 prevalence 调整会放大偶发不一致——负值反映数学性质而非"比随机差"。

Q22:为什么 Karolinska 一致率反而高?
分布效应:其 66 张里 97% 是良性/低级别,避开了最容易分歧的区间。不能解读为 Karolinska 原标签更准。

Q23:6 张"GS9/10→GS0"和 20 张专项的 11 张什么关系?
前者是 546 张全量比较中的完全分歧案例(热图读出),后者是定向补做的 GS10 子集专项;两者独立采样、方向一致,互为印证。

Q24:粒度实验只做了 1 张,可信吗?
样本小,但机制清晰可推:patch 主导归类必然超额表征优势 pattern(GP3 ×2、Benign ×2.8)。单张实验的价值在于给出可复现的测量范式而非总体估计。

Q25:这些发现对在 PANDA 上训练的模型意味着什么?
存在标签上限:模型无法可靠学出被错误标注的信号;PANDA 侧高分可能部分来自标签宽容;跨库评测时 PANDA 分数偏高应把标签质量列为混杂因素。

D. Bench 基准

Q26:Bench 测的是什么失效模式?
WSI-specific feature collapse——模型用切片特异伪影(扫描仪/染色/批次指纹)而非生物特征做题,验证集高分在新切片上失效。

Q27:为什么 HistoEncoder 伪影编码最强却泛化最好?
论文解读:前列腺组织特异训练可能同时增强生物特征与切片签名的捕获——"伪影弱=模型好"的朴素预期不成立,需要双指标同看。

Q28:八种增强条件里哪些最"病理特异"?
macenko_normalization 与 hed_stain_augmentation 直指染色域漂移,是数字病理特异的;其余六种是通用视觉扰动。

Q29:能把我的模型加进对照表吗?
可以——论文提供开源 Google Colab,标准化指标下评测任意基础模型。

Q30:Bench 的规模为什么 README 和 API 不一样?
README 写"~2,770/条件"疑为早期版本残留;API splits 实测 3,872/条件、总 30,976 与论文摘要一致。以 API/论文为准(坑 4)。

E. 生产与库内

Q31:本条目为什么叫 panda-plus 而不是 panda-plus-bench?
本体是 546 张掩码数据集(论文主线),Bench 是其衍生品(独立论文+独立许可);库内以数据集本体立条、Bench 以专节收录,与其"母-子"结构对应。

Q32:本条目与库内 PANDA(rid 560)冲突吗?
不冲突、是互补:560 记挑战赛本体,本条目记像素级重标注与标签审计。两者互为上下游,检索任一条目都应提示另一条。

F. 复现与工程细节

Q33:掩码文件是什么格式?逐张对应关系怎么维护?
掩码为 RGB 图(与 WSI 同尺寸),类别经 RGB 值编码(对应 QuPath 分类色);逐张经重新编号的内部 image number 对应,原 Kaggle 文件名映射关系由作者侧维护——申请发放时应一并索要对照表。

Q34:学生注释与专家终版的差异有多大?
论文定性描述:差异"modest",最大分歧集中在病理界本身也有分歧的 GP;学生在 GP3-4 边界偏激进、偶把正常变异误判恶性。定量数值未披露——这是复现者无法获得但应知情的盲区。

Q35:20 张专项的选择有标签泄漏风险吗?
流程上是防泄漏的:先由高年级注释员按"PANDA 分级与视觉印象疑似差 >4 分"选出候选,专家盲评确认后再注释;全程不知 PANDA-PLUS 主集结果。但"疑似严重分歧"的入选标准本身意味着这 20 张不能代表全体 GS10——它测的是"错误率上界",不是"随机 GS10 的期望错误率"。

Q36:粒度实验的 patch 计数规则和主流训练管道一致吗?
一致。256²/512² 正是弱监督/MIL 管道最常用的两个 patch 尺寸,>20% 组织覆盖才计入的规则也常见;所以实验结论可以直接迁移到"你的训练管道会不会有同样的膨胀"这一自查。

Q37:Bench 的 9 张切片是怎么选的?
论文口径:从专家注释 WSI 中精选"含多样 Gleason pattern"的 9 张(9 个唯一患者)——目的是让每个类别与每张切片都有足够 patch 支撑 slide-ID/cross-slide 双指标;未披露随机化声明,应视为刻意构造(curated)而非随机样本。

Q38:为什么 Bench 用 224×224 而不是更大 patch?
224² 是 ViT 系基础模型的标准输入尺寸(Virchow/UNI/Phikon 均以 224 或其倍数预训练),224² 保证与七模型的原生管线零摩擦;512² 路径在论文里作为补充提取口径提及。

Q39:能拿 Bench 做模型选择吗?
能测鲁棒性维度,不能全量替代验证集:9 张切片/9 个患者、每条件 3,872 patch 的构造设计,适用于"伪影敏感性"诊断而非泛化性能排名;模型选择仍需常规多切片验证集。

Q40:本条目后续会更新什么?
维护触发点见附录 T:优先级最高的是"掩码公开化"(一旦团队上线直链,条目 AI-Ready 评级与获取节整体改写);其次是 Bench 第三方评测扩表与 PANDA 官方回应追记。

Q41:为什么条目里反复强调"坑点"?
因为这个数据集的价值一半在"教学意义":它的原始文档本身带着双口径(年份、规模)、正文-表格漂移、地理笔误与许可异构——这些坑正是 AI-Ready 质检要抓的典型缺陷样本,条目把它们全部存照并给出处理口径(附录 S)。

Q42:能用这 546 张掩码微调分割模型再商用吗?
风险未清零。许可只写"academic research purposes",未含商用授权;模型权重的衍生属性在请求制许可下属灰色地带。稳妥路径:商用管线先用 Bench(CC BY-4.0)或自行复标数据训练,或与作者签书面授权。

Q43:如果我只记住一件事?
PANDA 高级别区标签有实质性错误(20 张最高级里 11 张无癌),任何 PANDA 评测都应带上这个背景——而这件事的可见性,来自一次"把 546 张切片重新逐像素画一遍"的重标注工程。


事实清单(硬事实 36 条)

  1. PANDA-PLUS 含 546 张 WSI 像素级注释掩码,全部派生自公开 PANDA 挑战赛数据(Kaggle 2021 托管)。
  2. 机构构成:Radboud 480 张(87.9%)+ Karolinska 66 张(12.1%)。
  3. 图像规格:20× 放大,0.4862 μm/px,H&E 穿刺活检 WSI。
  4. 注释平台 QuPath;掩码 RGB 值与 QuPath 分类一一对应,导出零降采样、与 WSI 逐像素对齐。
  5. 掩码五类:Benign/GP3/GP4/GP5/Ignore*;GP1/GP2 不单列、并入 Benign。
  6. 掩码清洗阈值:<1600 像素注释删除。
  7. 三层流水线:BYU pre-med 本科生注释 → 高年级学生复核 → board-certified 病理专家(>30 年经验)终审。
  8. 注释者经 AI in Medicine Association 招募,每周例会培训(组织学/Gleason/腺体形态/QuPath)。
  9. 每张 WSI 由单一学生注释以最大化吞吐;分配用启发式分层防欠覆盖。
  10. 专家复核投入每周 2-4 小时;访谈口径每张复核 10-15 分钟(原手标需 1-2 小时/张)。
  11. PANDA 原 GS/ISUP 标签对注释流水线全程屏蔽(防偏设计)。
  12. 重算分布:GS0 185(33.9%)/GS6 245(44.9%)/GS7 84(15.4%)/GS8 12(2.2%)/GS9 5(0.9%)/GS10 15(2.7%)。
  13. ISUP 0-5 分布:185/245/31/53/12/20(GS7 3+4 为 31、4+3 为 53)。
  14. 全数据集 agreement:GS 0.419、ISUP 0.396。
  15. 未加权 κ:GS 0.263(Table 4)/0.283(正文)双口径;ISUP 0.251。
  16. 线性 κ:GS 0.624/ISUP 0.364;线性 PABAK 0.396/0.505。
  17. 二次加权 κ:GS 0.848/ISUP 0.466;二次 PABAK 0.528/0.738。
  18. 未加权 PABAK 为负:GS −0.162/ISUP −0.209。
  19. Radboud 子集 agreement GS 0.384;Karolinska 子集 0.688(分布效应所致)。
  20. 热图:6 张 PANDA 判 GS9/10 的切片被 PANDA-PLUS 判为 GS0(完全分歧)。
  21. 20 张 GS10/ISUP5 专项:0 张维持 GS9/10;6 张 GS8、2 张 GS7、1 张 GS6、11 张 GS0(无恶性组织)。
  22. 专项流程:先选疑似分级差>4 分的 20 张,专家盲评初判,学生像素级注释,专家终审。
  23. 粒度实验(同专家单张):slide 级 GS8 → patch/pixel 级 GS7。
  24. GP3 占比:像素级 5.5% → 256² patch 10.9% → 512² patch 12.0%。
  25. Benign 占比:0.6% → 1.7%(近 3 倍);GP4/GP5 各膨胀 1.8 倍。
  26. patch 级 GS 计算规则:主导 pattern 归类、组织覆盖 >20% 计入、不足为 Ignore。
  27. 学生系统性偏差:GP3-4 区间偏激进(模糊偏向 GP4)、异形腺体误标恶性。
  28. 论文:J Pathol Inform. 2025 Dec 30;20:100540,doi:10.1016/j.jpi.2025.100540,开放获取 CC BY-NC-ND。
  29. 卷期双口径:pathtools.ai/ScienceDirect 列表页写 2026;20:100540(NLM 在线 2025-12-30)。
  30. 作者 8 人同一机构(BYU 物理与天文系);通讯 Dennis Della Corte;无专项资助声明;写作过程用 ChatGPT/Claude/Grok 润色并声明人工审校。
  31. 掩码可获取性:学术用途 upon qualified request(邮件+用途描述+机构隶属),请求制无公开直链。
  32. PANDA-PLUS-Bench:9 WSI(9 患者)、224×224 @20×、8 增强条件 ×3,872=30,976 examples、2.56 GB Parquet、CC BY-4.0、HF dellacorte/PANDA-PLUS-Bench(gated=false,lastModified 2025-12-16)。
  33. Bench 规模双口径:HF README “~2,770/条件” vs API 实测 3,872/条件(与论文一致)。
  34. Bench 七模型:Virchow slide-ID 80.7-81.0%;Virchow2 cross-slide 47.2%;HistoEncoder cross-slide 59.7%+slide-ID 90.3%;全模型 within/cross gap 19.9-26.9 pp;开源 Colab。
  35. 论文转述 PANDA 外部验证集时写 “Tampere University (United States)”——Tampere University 实在芬兰,论文笔误。
  36. 组织方宣称(非论文数据):pathtools.ai QWK 0.849(147 张评估集/8,808 腺体轮廓/2026-09-14 复测)与 135,251 注释语料(1,856 slides/9,500 cores)。
  37. 掩码与 WSI 的逐张对应经重新编号的内部 image number 维护,原 Kaggle 文件名映射由作者侧掌握。
  38. 流水线每个结构都经学生与专家双重过目(全量终审),非抽检制。
  39. 20 张专项的入选标准是"PANDA 分级与视觉印象疑似差 >4 分"——结论性质为错误率上界而非随机样本期望。
  40. 粒度实验中 slide 级目评由专家先做、像素注释后做,学生注释时不知 slide 级初判(防锚定)。
  41. Bench 评估采用冻结编码器+线性探针范式;slide-ID 精度以 slide_id 为目标变量、cross-slide 以留一切片交叉验证。
  42. PANDA-PLUS 团队三件套时间线:前作 arXiv:2406.06801(2024)→ 本体论文(2025-12-30 在线)→ Bench 论文(2026-05-28 发表),漏斗式收窄:方法主张→数据底座→评测工具。

术语表(30 条)

术语 释义
Gleason pattern(GP) 前列腺腺体形态学分级,1-5 级,5 级分化最差;掩码中 GP3/GP4/GP5 单列,GP1/GP2 归 Benign
Gleason score(GS) 主+次 GP 相加(如 3+4=7);单一 pattern 时自相加(如 3+3=6)
ISUP Grade Group 2014 共识的 1-5 级简化分级(GS6→GG1;GS7 拆 GG2/GG3)
WSI Whole Slide Image,全切片数字扫描图像
像素级注释 每个像素携带类别标签(区别于切片级/patch 级)
RGB 掩码 用颜色编码类别的像素级标注图,RGB 值与 QuPath 分类一一对应
QuPath 开源数字病理注释平台,本数据集的注释工具
Ignore* 类 掩码中标记背景/非组织区域的排除类
染色归一化 Macenko 等方法消除 H&E 染色批次差异的预处理
HED 通道 苏木精-伊红-DAB 颜色空间分解,染色扰动增强的基础
观察者间变异 不同病理医生对同一切片给出不同分级的程度
Agreement 一致率:判定相同的样本占比(po)
Cohen’s κ 扣除随机一致后的一致性系数
PABAK 先验调整偏差调整 κ = 2·po−1,应对类别偏斜
线性/二次加权 对"差几级"按距离线性/平方加权的 κ 变体
QWK Quadratic weighted kappa,分级任务常用一致性指标
热图(混淆矩阵) 行=PANDA 原分级、列=重算分级的矩阵可视化;偏对角线位置揭示系统性偏移
完全分歧 两套标签在"癌与非癌"层面翻转(如 GS10↔GS0)
patch 主导归类 patch 内占多数的 pattern 作为该 patch 标签——粒度膨胀的机制根源
特征坍塌(feature collapse) 模型依赖切片特异伪影而非生物特征的失效模式
slide-ID 精度 模型凭 patch 认出"来自哪张切片"的能力,越高伪影编码越强
cross-slide 精度 跨切片泛化精度,越高生物信号越强
within-/cross-slide gap 两者之差,伪影依赖度的直接量度(19.9-26.9 pp)
基础模型 大规模自监督预训练的病理图像编码器(Virchow/UNI/Phikon/HistoEncoder 等)
HistoEncoder 前列腺组织特异训练的病理编码器,Bench 七模型中双指标最高
gated dataset 需登录/申请才能下载的 HF 数据集;Bench 为 gated=false(无门禁)
Parquet 列式存储格式,HF datasets 默认打包格式
请求制(upon qualified request) 数据不公开直链、需向作者邮件申请的发放模式
CC BY-NC-ND 署名-非商业-禁止演绎(论文本体许可)
CC BY-4.0 署名即可自由使用/修改/再分发(Bench 许可)
穿刺活检(needle-core biopsy) 细针管取条状前列腺组织的活检方式,PANDA/PANDA-PLUS 的标本类型
腺体(gland) 前列腺组织的基本形态学单元,Gleason 分级的判定对象
筛状结构(cribriform) 腺体融合成筛网状的形态,GP4 的主要形态之一;本掩码不单设类
神经周围侵犯(perineural invasion) 肿瘤沿神经周围生长的征象;本掩码不单独标注
盲评(blinded grading) 注释者对既有标签不可见的设计;PANDA-PLUS 全程对注释者屏蔽 PANDA 原标签
冻结编码器 评测中不更新预训练权重、只训练线性头的协议,Bench 采用
线性探针(linear probe) 在冻结特征上训练线性分类器以探测表征质量的评测法
留一交叉验证(LOCO) 按切片留出测试的交叉验证;Bench cross-slide 精度的计算基础

附录

附录 A:条目信息速查卡

项 值
条目名 PANDA-PLUS
url_name panda-plus
类型 数据集+方法论文+衍生基准(三合一)
论文 J Pathol Inform 2025;20:100540(NLM 口径)
团队 BYU 物理与天文系(Della Corte 组)
规模 546 WSI(Radboud 480 + Karolinska 66)
许可 三层异构(WSI CC BY-NC-SA / 掩码请求制 / Bench CC BY-4.0)
抓取时点 2026-09-26
库内互链 panda(560)/sicapv2(328)/leopard(636)/reg2026(639)/lizard(238)/nucls(248)/owl(635)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 论文开放获取+HF dataset card 可索引;但"PANDA-PLUS"名易与 PANDA 混淆,掩码本体无独立发布页
A 可获取性 5 三层中两层公开直链(WSI/Bench),核心掩码为请求制——最大失分项
I 可互操作 7 Parquet/HF datasets 标准+PNG 掩码+QuPath 兼容;无官方转换脚本到 DICOM/开放格式
M 元数据质量 8 论文表格完备(分布/统计/协议);正文-表格一处漂移(坑 3)与 README-API 规模漂移(坑 4)微降分
S 可持续性 6 依托 Kaggle(WSI)与 HF(Bench)平台稳定;掩码发放依赖个人邮箱,单点风险
综合评级 6.6/10(中上) 方法论与文档质量高于均值;可获取性被请求制拖低,Bench 直链部分补偿

附录 C:逐项证据链自证

关键数字 来源 位置
546 张 / Radboud 480 / Karolinska 66 论文 Table 2/3 PMC 全文
0.4862 μm/px / 20× 论文方法节(Annotations and classifications) PMC 全文
<1600 px 清洗阈值 论文方法节(Annotation mask collection and cleaning) PMC 全文
agreement 0.419/0.396 论文 Table 4 PMC 全文
二次 κ 0.848/0.466 论文 Table 4 PMC 全文
11/20 GS0 专项结果 论文结果节(Annotation granularity and high-grade errors) PMC 全文
GP3 5.5%→10.9%→12.0% 论文结果节+Fig 6 PMC 全文
请求制原文 论文 Data availability 节 PMC 全文
CC BY-NC-ND(论文) 论文版权声明 PMC 页脚
Bench 30,976/2.56GB/CC BY-4.0 HF API dataset_info 实测 hf-mirror API 2026-09-26
七模型结果 AI Med 2026;1(2):14 摘要 MDPI 页面
QWK 0.849/135,251 pathtools.ai 主页自述 网站抓取 2026-09-26

附录 D:数据获取决策树

需求是什么?
├── 只想做基础模型鲁棒性评测
│   └── HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0,直链,30,976 patch)
├── 想训练/评测像素级分割与分级
│   ├── 1) Kaggle 下载 PANDA WSI(公开)
│   ├── 2) 邮件申请掩码(用途+机构隶属)
│   └── 3) 等待期先用 Bench+原 slide 标签搭管线
├── 只想引用"标签噪声"论点
│   └── 引论文 Table 4 + 20 张专项(11/20 GS0),注明坑 3 漂移
└── 想复现三层标注流水线
    └── 读论文方法节+附录 F 骨架;无需掩码也可规划内部试点

附录 E:掩码类别映射与使用规范

掩码类别 语义 训练建议
Benign 良性腺体+GP1/GP2(不单列) 不要当"纯良性"用——内混早期 pattern
GP3 Gleason pattern 3 腺体 主导 pattern 计数的基准类
GP4 Gleason pattern 4 腺体(含融合/筛状形态) 学生偏差高发区(终审修订最多)
GP5 Gleason pattern 5(含整片连续恶性区) 粒度自适应区域,非逐腺体
Ignore* 背景空白/非组织 损失计算中应排除

附录 F:三层流水线复现骨架(SOP 模板)

阶段 0 资格与培训(周级)
  - 招募:pre-med/医学生通道;招募平台与课程记录留档
  - 培训:组织学基础/Gleason 系统/腺体形态/工具操作 四模块
  - 考核:试标 3-5 张,与专家标注重叠度达标后上岗
阶段 1 L1 初注(张级)
  - 单注释者/张;启发式分层分配(覆盖各分级段)
  - 原有标签全程屏蔽
阶段 2 L2 复核(张级)
  - 清单:腺体覆盖完整性/重叠消除/非组织剔除/粗错纠正
阶段 3 L3 终审(专家)
  - 逐腺体确认或改判;每周固定时段(论文口径 2-4 h/周)
阶段 4 出厂
  - 掩码导出(零降采样)→ 伪迹清洗(阈值可调)→ 像素计数重算 GS/ISUP
  - 与原标签对照表输出(供审计)

附录 G:GS/ISUP 重算算法骨架(代码)

from collections import Counter

def recompute_gs(mask_pixels, ignore_label, min_pattern_px=1600):
    """按像素计数重算 Gleason score(论文口径)。
    mask_pixels: 展平的掩码类别序列
    ignore_label: Ignore* 编码
    min_pattern_px: 清洗阈值(论文 1600 px)
    """
    counts = Counter(p for p in mask_pixels if p != ignore_label)
    counts = {k: v for k, v in counts.items() if v >= min_pattern_px}
    if not counts:
        return 0, "GS0/ISUP0"          # 无有效 pattern -> 良性/无恶性
    ranked = sorted(counts.items(), key=lambda kv: -kv[1])
    primary = ranked[0][0]              # 主 pattern
    secondary = ranked[0][0] if len(ranked) == 1 else ranked[1][0]
    gs = primary + secondary            # 单一 pattern 自相加(如 3+3=6)
    isup = isup_map(primary, secondary) # ISUP 1-5 映射(GS6->1, 3+4->2, 4+3->3, 8->4, 9-10->5)
    return gs, isup

附录 H:Bench 加载与评估骨架(代码)

from datasets import load_dataset
import torch

CONDITIONS = ["baseline", "color_jitter", "grayscale", "gaussian_noise",
              "heavy_geometric", "combined_aggressive",
              "macenko_normalization", "hed_stain_augmentation"]

def eval_model(encoder, head):
    """对 Bench 八条件全量评测,输出 slide-ID 与 cross-slide 精度。"""
    acc = {}
    for cond in CONDITIONS:
        ds = load_dataset("dellacorte/PANDA-PLUS-Bench", split=cond)
        feats, labels, slides = [], [], []
        for ex in ds:
            x = preprocess(ex["image"])              # ImageNet 归一化基线
            feats.append(encoder(x))                 # 冻结编码器取特征
            labels.append(ex["label"])               # 0-3
            slides.append(ex["slide_id"])            # 9 个唯一值
        acc[cond] = probe_accuracy(feats, labels)    # 线性探针
    # slide-ID:以 slide_id 为目标再训线性头(越高=伪影越强)
    # cross-slide:留一切片交叉验证(越高=生物信号越强)
    return acc, slide_id_accuracy(feats, slides), cross_slide_accuracy(feats, labels, slides)

附录 I:统计指标计算公式表

指标 公式 论文取值语境
po(观察一致率) 判定一致数 / N N=546
pe(期望一致率) Σ(nk1·nk2)/N² 按行列边际计算
κ (po−pe)/(1−pe) 未加权三档
PABAK 2·po−1 未加权为负的来源
线性权重 i−j
二次权重 (i−j)² 惩罚 严重分歧重罚(QWK 同型)

附录 J:20 张专项结果总表

重审 GS 张数 ISUP 对应 备注
0 11 0 无恶性组织(slide+pixel 双确认)
6 1 1 —
7 2 2-3 —
8 6 4 —
9-10 0 5 零张维持最高级
合计 20 — 全部降级

附录 K:粒度实验数据总表(单张)

项 slide 级 patch 256² patch 512² pixel 级
GS 8 7 7 7
GP3 占比 — 10.9% 12.0% 5.5%
Benign 占比 — — 1.7% 0.6%
GP4 膨胀 — — ×1.8 基准
GP5 膨胀 — — ×1.8 基准

附录 L:机构偏斜的校正建议

  1. 报告指标时按机构分层(Radboud/Karolinska 分列),避免全集均值掩盖分布效应。
  2. 跨机构实验:按机构加权重采样,或仅用 Radboud 子集(保证内部分布可解释)。
  3. 高级别研究:承认 GS9/10 仅 20 张,作定性案例而非训练主力。
  4. 若需平衡样本:回 PANDA 全量做机构分层抽样,用 PANDA-PLUS 只作标签层替换。

附录 M:与库内 PANDA 条目(rid 560)的关系声明

维度 PANDA(rid 560) PANDA-PLUS(本条目)
对象 挑战赛本体(12,625 WSI 口径) 546 张子集的像素级重标注
标签 slide 级 GS/ISUP(Kaggle 官方) 像素级掩码+独立重算分级
性质 挑战赛数据集 研究性重标注数据集+审计
获取 公开直链 掩码请求制(Bench 公开)
阅读顺序 先 560(背景)再本条目(批判视角) —

两篇结论不冲突:PANDA 的规模与工程价值不变;本条目补充的是"其切片级标签的可靠性边界"。

附录 N:前列腺 WSI 数据集景观总表(论文 Table 1 全转)

数据集 年 WSI 患者 倍率 注释层级 专家复核 来源
SICAPv2 2020 182 95 40×→10× patch+slide 是 Valencia 大学临床医院
RINGS 2021 1,500 150 100× 像素级(无分级) 是 都灵肿瘤科
PANDA 2022 口径 12,625 2,113 20×→10× slide+稀疏 mask 是 Radboud+Karolinska+Tampere
PCa_Bx_3D 2022 118 50 0.44 μm/px 像素级(3D) 是 华盛顿大学(TCIA)
CrowdGleason 2024 1,045 N/S 40× patch(众包) 混合 格拉纳达 San Cecilio 医院
DiagSet 2024 5,151 N/S 40×→多档 patch+slide 分层 是 Diagnostyka Consilio
PANDA-PLUS 2025 546 N/S 20×(0.4862 μm/px) 像素级 RGB 掩码 是(三层流水线) 派生自 PANDA

附录 O:许可条款细读(三层+论文)

  1. WSI 本体:PANDA 挑战赛口径 CC BY-NC-SA——署名+非商业+相同方式共享;向下兼容本条目使用。
  2. 掩码:论文 Data availability 原文 “available for academic research purposes upon qualified request…include a brief description of the intended research use and institutional affiliation”——学术用途+资格审查+邮件发放;未声明再分发与商用条款,衍生物许可需与作者确认。
  3. Bench:HF card 标注 CC BY-4.0,gated=false——最宽松一层,署名即可商用/修改/再分发。
  4. 论文:© 2025 The Authors,open access under CC BY-NC-ND——可自由阅读下载,不可商用/演绎。
  5. 引用优先级:用数据引数据许可(按层),引用观点引论文(CC BY-NC-ND 只约束论文文本本身)。

附录 P:掩码申请邮件模板(供参考)

Subject: Request for PANDA-PLUS pixel-level annotation masks

Dear Dr. Della Corte,

I am [name], [position] at [institution]. We are working on
[one-sentence research use, e.g., gland-level segmentation model
training and cross-dataset evaluation on public prostate WSIs].

We would like to request access to the PANDA-PLUS pixel-level
annotation masks (546 WSIs) for academic research purposes.
We will not redistribute the masks and will cite the dataset paper
(J Pathol Inform 2025;20:100540) in all outputs.

Thank you for your consideration.
[Institutional affiliation + contact]

附录 Q:坑点档案(与 §10 对照)

坑 一句话档案 触发场景
坑 1 "PANDA-SICAP"非具名数据集(三轮搜索证伪) 文献检索/选条
坑 2 论文 2025-12-30 vs 2026 卷期双口径 引用/著录
坑 3 未加权 κ 正文 0.283 vs 表 0.263 数字抽取
坑 4 Bench ~2,770 vs 3,872 每条件 管线搭建
坑 5 四资产四许可,掩码再分发条款缺失 商用/再分发
坑 6 Tampere 被论文误标 United States(实为芬兰) 转引事实
坑 7 QWK 0.849/135,251 为网站宣称非论文数据 生态引用
坑 8 repo 名 dellacorte(真)/dellacortelab(无);类别仅 0-3 复现评测

附录 R:检索决策树

你想找什么?
├── "PANDA-PLUS" 本体论文
│   └── doi:10.1016/j.jpi.2025.100540(PMC 全文开放)
├── Bench 数据
│   └── HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0)
├── PANDA 原挑战赛
│   └── 库内 rid 560 条目 + panda.grand-challenge.org
├── 像素级注释竞品
│   └── SICAPv2(rid 328)/CrowdGleason/DiagSet(附录 N)
└── "PANDA-SICAP"?
    └── 不存在该具名数据集(坑 1)——你要找的多半是上面四者之一

附录 S:双口径登记表

# 项 口径 A 口径 B 处理
1 论文年份 2025 Dec 30(NLM/doi 2025) 2026;20:100540(pathtools/SD 列表页) 双记,引用按 NLM
2 未加权 κ(GS) 0.263(Table 4) 0.283(正文) 按表引用,注漂移
3 Bench 每条件规模 ~2,770(HF README) 3,872(API/论文摘要) 按 API/论文
4 PANDA 规模 12,625(论文 Table 1 转述) 10,616("用于训练"口径常见于其他文献) 注明统计口径再引用

附录 T:维护计划与触发点

触发点 条件 动作 优先级
掩码公开化 团队上线公开直链/Zenodo 改写 §6、升 AI-Ready 评级、重跑互链 1
Bench 第三方评测 新论文用 Bench 评测新模型 §5.2 表扩行 2
PANDA 官方回应 PANDA 团队/GRAND 官方对审计结论表态 §7.4 追记 3
后续版本 PANDA-PLUS v2/Bench 扩容 更新规模与许可 4
商业化动态 pathtools.ai 平台正式发布/论文化 §7.2 升格 5

附录 U:Bench 八条件全表

split 名 扰动内容 考察目标
baseline 仅 ImageNet 归一化 参照系
color_jitter 亮度/对比/饱和/色相 通用色彩鲁棒性
grayscale 完全去色 颜色依赖度
gaussian_noise σ=0.05 加性噪声 传感器噪声
heavy_geometric ±180° 旋转+翻转 方向不变性
combined_aggressive 全增强叠加 极端压力
macenko_normalization Macenko 染色归一化 染色域漂移(病理特异)
hed_stain_augmentation H/E 通道扰动 染色特异性(病理特异)

每条件 3,872 examples,八条件共 30,976;features:image(224×224)/label(0-3)/slide_id(9 唯一值)。

附录 V:七模型结果登记表(论文口径)

模型 slide-ID 精度 cross-slide 精度 within/cross gap
Virchow 80.7% — —
Virchow2 81.0% 47.2% —
UNI — — —
UNI2 — — —
Phikon — — 26.9 pp(gap 最大档)
Phikon-v2 — — —
HistoEncoder 90.3% 59.7% 19.9 pp(gap 最小档)

注:论文摘要只披露上表可见数值,其余格以论文正文/图表为准;条目发布后如正文细读补齐,按附录 T 触发点 2 更新。

附录 W:引文规范

@article{hopson2025pandaplus,
  title   = {PANDA-PLUS: Improved dataset of prostate whole slide images
             from PANDA Challenge with pixel-level expert annotations},
  author  = {Hopson, Spencer and Mildon, Carson and Kubalek, Corbyn and
             Ebbert, Joshua and Vance, Ryan and Laverty, Lauren and
             Urie, Paul and Della Corte, Dennis},
  journal = {Journal of Pathology Informatics},
  volume  = {20},
  pages   = {100540},
  year    = {2025},
  doi     = {10.1016/j.jpi.2025.100540}
}

@article{ebbert2026pandaplusbench,
  title   = {PANDA-PLUS-Bench: A Clinical Benchmark for Evaluating the
             Robustness of AI Foundation Models in Prostate Cancer Diagnosis},
  author  = {Ebbert, Joshua L. and Della Corte, Dennis},
  journal = {AI in Medicine},
  volume  = {1},
  number  = {2},
  pages   = {14},
  year    = {2026},
  doi     = {10.3390/aimed1020014}
}

附录 X:本条目生产档案

  • 生产通道:教训 12 第五次执行("PANDA-SICAP"存在性证伪→改立 PANDA-PLUS)
  • 事实研究:WebSearch×6+WebFetch×4+PMC 全文抓取+HF API 实测(hf-mirror 镜像)共约 11 轮
  • FACTS.md:writing/panda-plus/FACTS.md 九节
  • 成稿方式:五块直写拼接(part1-5),吸取"附录标题吞噬"教训——全程不用 Edit 追加
  • 坑点:§10 八则(坑 1-8"坑 N:"编号制)
  • description:成稿时即 ≤170 字符(教训 13 常态化第二次执行)
  • 互链计划:新篇正文内链 5 处(PANDA/SICAPv2/LEOPARD/REG²/OWL)+发布后重建家族导航

附录 Y:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(论文)+HF repo(Bench)
F2 富元数据 ✅ HF card+论文表格
A1 可访问协议 ⚠️ 掩码请求制(邮件),WSI/Bench 为 HTTP 直链
A2 元数据可访问 ✅ 即便掩码未发放,元数据始终开放
I1 互操作格式 ✅ Parquet/PNG/QuPath
I2 词汇表引用 ✅ Gleason/ISUP 标准术语
R1 来源溯源 ✅ PANDA 派生关系明示
R3 可复现流程 ✅ Bench+Colab 开源
AI-Ready 综合 中 直链覆盖评估任务,训练任务依赖申请

附录 Z:缩写速查

缩写 全称
PANDA Prostate cANcer graDe Assessment
WSI Whole Slide Image
GP / GS Gleason pattern / Gleason score
ISUP International Society of Urological Pathology
PABAK Prevalence-Adjusted Bias-Adjusted Kappa
QWK Quadratic Weighted Kappa
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
BYU Brigham Young University
HF HuggingFace
L1/L2/L3 流水线三层(注释/复核/终审)

附录 AA:基于本数据集的研究检查清单(12 项)

  1. 许可核对:你的用途落在哪一层(WSI/Bench/掩码)?掩码用途若超出"academic research"先与作者书面确认。
  2. 口径声明:引用任何一致性数字时注明权重档(未加权/线性/二次)与来源(表 vs 正文,坑 3)。
  3. 机构分层:跨机构结论必须分层报告或校正(480:66 偏斜)。
  4. 类别映射:Benign ≠ 纯良性(内含 GP1/GP2);掩码无早期 pattern 监督。
  5. Ignore 处理:损失函数排除 Ignore*,且注意 <1600 px 伪迹已被清除(像素计数与你的统计口径一致性)。
  6. GS 重算复现:主次 pattern 按像素计数取序;单一 pattern 自相加;与附录 G 骨架对照。
  7. 高级别样本处置:GS9/10 共 20 张——作案例研究,不作训练主力;报告时写明绝对数。
  8. 与 PANDA 原标签的混用:两套标签不得在同一个监督信号里混贴;审计类研究才做对照。
  9. Bench 用途边界:只作伪影鲁棒性诊断,不作泛化排名;8 条件全报、别挑条件。
  10. Bench 规模口径:以 API 3,872/条件为准(坑 4);repo 名 dellacorte(坑 8)。
  11. 引用完整:数据引本体论文(hopson2025pandaplus),Bench 结论引 Bench 论文(ebbert2026pandaplusbench),图像来源同时引 PANDA。
  12. 时点存照:论文年份双口径(坑 2)与组织方宣称数字(坑 7)注明抓取/查询时点。

附录 AB:Bench 数据字典(HF Parquet)

字段 类型 取值域 语义
image Image 224×224 RGB 组织 patch(20×)
label int64 0=Benign,1=GP3,2=GP4,3=GP5
slide_id string 9 个唯一值 切片标识(=患者标识,1 人 1 张)

splits(8 个,各 3,872 行):baseline / color_jitter / grayscale / gaussian_noise / heavy_geometric / combined_aggressive / macenko_normalization / hed_stain_augmentation。体量:download 2,556,068,549 B ≈ 2.56 GB(dataset_size 2,556,229,215 B)。加载示例见 §5.1 与附录 H。

抽样自检建议:任一 split 的 label 分布应近似覆盖 0-3 全类;slide_id 集合应为 9 个;若 README 口径数字(~2,770)出现在你的自动校验脚本里,改为 API 硬数字(3,872)。

附录 AC:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
本体论文 “PANDA-PLUS” AND (“Gleason” OR “prostate”) AND “pixel-level” J Pathol Inform 20:100540(PMC/DOI)
Bench 数据 site:huggingface.co PANDA-PLUS-Bench / HF API datasets?search=PANDA-PLUS dellacorte/PANDA-PLUS-Bench
Bench 论文 “PANDA-PLUS-Bench” OR doi:10.3390/aimed1020014 MDPI AI Med 1(2):14
团队谱系 Della Corte BYU prostate pathology / pathtools.ai science 页 前作+商业化+三部曲
标签噪声论点 “slide-level labels” AND “Gleason” AND (agreement OR kappa) 本体论文 §Results 及引用者
像素级竞品 SICAPv2 / CrowdGleason / DiagSet / RINGS + prostate 附录 N 景观
反例(勿用) “PANDA-SICAP”(作为数据集名) 无具名数据集命中(坑 1)

检索卫生两条:一、凡命中"PANDA-SICAP"字样的论文,读的是跨库评估语境(PANDA 训练+SICAP 测试),不是单一数据集;二、pathtools.ai 页面的数字(QWK/语料规模)随时间滚动更新,引用时存照抓取日期。


尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-26,抓取与核验时点见附录 A。事实陈述以论文(J Pathol Inform 2025;20:100540)、HF API 实测与 pathtools.ai 官网为源;正文-表格数字漂移、卷期双口径、Tampere 国名笔误等原始文档缺陷已在坑点与附录 S 存照。条目与库内 PANDA(rid 560)、SICAPv2(rid 328)、LEOPARD(rid 636)、REG²(rid 639)等条目互链,构成前列腺病理与计算病理家族的完整检索面。后续维护触发点见附录 T。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
  • unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
  • wsss4luad — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 肿瘤学
  • monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 肿瘤学
  • ddti — 共享标签:医学影像 / 图像分类 / 医学图像分割 / 肿瘤学
  • acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • palm — 共享标签:医学影像 / 病理图像 / 图像分类 / 医学图像分割
  • hyperkvasir — 共享标签:医学影像 / 图像分类 / 医学图像分割 / 评测基准
  • ebhi-seg — 共享标签:病理图像 / 图像分类 / 医学图像分割 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集