信息速览
INFOBOX — PANDA-PLUS 一屏速览
维度 内容 本质 PANDA 挑战赛 546 张前列腺穿刺 WSI 的像素级 Gleason 重标注升级版(非挑战赛、非新采集) 团队 Brigham Young University(BYU)物理与天文系,通讯 Dennis Della Corte;8 作者同机构 论文 J Pathol Inform. 2025 Dec 30;20:100540(doi:10.1016/j.jpi.2025.100540;2026 卷期双口径) 数据 546 WSI = Radboud 480 + Karolinska 66;20×,0.4862 μm/px;QuPath 注释 RGB 掩码 类别 Benign / GP3 / GP4 / GP5 / Ignore*(GP1/GP2 归 Benign) 流水线 pre-med 学生注释 → 高年级学生复核 → 30 年经验 board-certified 病理专家终审 核心发现 PANDA 高级别标签系统性偏高:20 张 GS10/ISUP5 专项中 11 张实为 GS0(无恶性组织),0 张维持高级别 统计 全集 agreement(GS)0.419;quadratic κ 0.848;线性加权下不一致呈"高级别大幅降级"模式 粒度实验 同一专家单张:slide 级 GS8 → patch/pixel 级 GS7;GP3 占比在 patch 级膨胀 2 倍 衍生基准 PANDA-PLUS-Bench:9 WSI / 8 增强条件 / 30,976 patch,CC BY-4.0 于 HuggingFace 公开直链 评估对象 Virchow/Virchow2/UNI/UNI2/Phikon/Phikon-v2/HistoEncoder 七个病理基础模型鲁棒性 获取 WSI 公开(Kaggle)|掩码请求制(邮件通讯作者)|Bench 公开直链(HF) 许可 三层异构:WSI CC BY-NC-SA|掩码 upon request|Bench CC BY-4.0|论文 CC BY-NC-ND 库内互链 PANDA(上游本体)、SICAPv2(像素级前纪录保持者)、LEOPARD(复发预测)、REG²(报告生成)
PANDA-PLUS 是一个"给最大前列腺病理数据集重新戴眼镜"的数据集工程:它不采集新数据,而是把 PANDA 挑战赛里 546 张穿刺活检全切片(WSI)从"切片级一个标签"升级为"每个腺体一个颜色"的像素级注释,并在重标注过程中发现原 PANDA 的高级别标签存在系统性偏高——20 张原判 GS10(最高级)的切片,重审后 11 张根本没有恶性组织。这个发现对一切在 PANDA 上训练或评测的模型都是一记警钟,也使 PANDA-PLUS 成为研究"标签质量如何决定模型上限"的教科书样本。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——注意掩码是请求制,Bench 才是公开直链,别混。
- 关心标签质量:直奔 §4 与 PANDA 的比较发现——统计表、20 张专项、粒度实验三段连读。
- 做基础模型评测:直奔 §5 PANDA-PLUS-Bench——CC BY-4.0 直链可用,七模型结果可直接对标。
§0 导读:这个数据集解决什么问题
前列腺癌的 Gleason 分级是"同一张切片、不同专家、不同答案"的高发区:文献报道病理医生间 Gleason 评分一致率约 57.9%,专家再阅 602 例会诊切片中 44% 被改级、约十分之一的治疗方案随之改变。PANDA 挑战赛(2020-2021,Kaggle)提供了史上最大的公开前列腺穿刺 WSI 集合(万余张),但绝大多数只有切片级标签——一整张 gigapixel 图像对应一个 Gleason score。切片级标签的代价是双重的:训练时模型只能拿到粗粒度监督;评测时一个错误标签会直接污染整张切片的分数。
PANDA-PLUS 的回答分三层。第一层是数据:546 张 WSI 全部重标为像素级 RGB 掩码(Benign/GP3/GP4/GP5/Ignore 五类),掩码与原图零降采样像素对齐,可直接训练腺体分割与像素级分级模型。第二层是方法:一套"医学生注释 → 高年级复核 → 资深病理专家终审"的三层流水线,把像素级注释的专家时间从每张 1-2 小时压到 10-15 分钟,且流水线本身可复制到其他 WSI 集合。第三层是批判:把重算的 GS/ISUP 与 PANDA 原标签逐张对照,用 agreement、kappa、PABAK 三套指标(各三档加权)量化分歧,发现分歧系统性偏向"PANDA 评高了",且高级别区最严重——由此衍生出对 PANDA 标签可靠性的正式质疑。
§0 读法三则:
- 这个条目是"数据集+方法论文+评测基准"三合一:本体是 546 张带掩码 WSI,衍生品是 Bench 基准,副产品是一套可复制的标注流水线——三者许可与获取方式各不相同(§6)。
- 全文统计数字均出自论文正文与表格;正文与表格唯一冲突处(unweighted κ 0.283 vs 0.263)已在坑 3 存照。
- 检索时若把"PANDA-SICAP"当作数据集名去搜会一无所获——这个组合词只是文献里"PANDA 训练+SICAP 测试"的惯用简称(坑 1)。
§1 数据集速览:十问十答
Q1:PANDA-PLUS 的"546 张"从哪来?
全部从公开 PANDA 数据集(Kaggle 2021 托管版)下载:其中 Radboud 大学医学中心(荷兰)480 张、Karolinska 学院(瑞典)66 张。原 PANDA 元数据(GS/ISUP)从竞赛页另行获取,对注释团队全程屏蔽。
Q2:图像规格是什么?
20× 放大、0.4862 μm/px 空间分辨率,H&E 染色穿刺活检 WSI。注释在 QuPath 平台完成,掩码导出时 RGB 值与 QuPath 分类一一对应、无任何降采样,因此掩码与 WSI 在像素级完全对齐。
Q3:掩码里有什么类别?
五类:Benign、GP3、GP4、GP5(腺体区域逐像素着色)与 Ignore*(背景空白区整块划定)。GP1/GP2 等早期 pattern 不单列、并入 Benign——这意味着掩码不能直接用于早期 pattern 识别研究。
Q4:谁注释的,可靠吗?
BYU 的 pre-med 本科生初注(每周受训),高年级学生复核(覆盖完整性/去重叠/剔除非组织),一位 30 年以上经验的 board-certified 病理专家逐腺体终审。专家每周投入 2-4 小时复核,全流程把专家时间从 1-2 小时/张压到 10-15 分钟/张。
Q5:重算的分级和 PANDA 原标签差多少?
全集 546 张的 GS 一致率仅 0.419(ISUP 0.396)。分歧不是随机分布:热图整体偏向"PANDA-PLUS 更低"一侧,高级别区最刺眼——6 张 PANDA 判 GS9/10 的切片被重审为 GS0(完全分歧)。
Q6:那个"20 张专项"是什么?
注释过程中发现高级别切片分歧异常严重,团队随即补做专项:从 PANDA 高级分子集(GS10/ISUP5)里选出疑似分级差 >4 分的 20 张,专家先盲评再像素级重标。结果 0 张维持 GS9/10,11 张被判定不含任何恶性组织。
Q7:粒度实验说明了什么?
同一位专家、同一张切片,slide 级目评估 GS8,patch 级(256²/512²)与像素级注释算出来都是 GS7。更关键的是 GP 占比失真:GP3 从像素级的 5.5% 膨胀到 512² patch 级的 12.0%(翻倍以上),Benign 膨胀近 3 倍——patch 越大、噪声越大。
Q8:Bench 基准是什么、和本体什么关系?
PANDA-PLUS-Bench 是从本体派生的鲁棒性基准:9 张 WSI(9 个患者)切 224×224 patch,8 种增强条件各 3,872 张共 30,976 张,CC BY-4.0 在 HuggingFace 公开直链。它测的是"基础模型学到的是生物信号还是切片特异伪影"。
Q9:我现在能拿到什么?
三层:WSI 本体走 Kaggle 公开(CC BY-NC-SA 口径);注释掩码要邮件通讯作者申请(学术用途+机构隶属);Bench 在 HF 直接 load_dataset(CC BY-4.0)。
Q10:为什么它对 AI-Ready 重要?
它是"请求制掩码+公开直链衍生基准"的组合样本:本体 AI-Ready 得分被请求制拖低,但团队用 CC BY-4.0 的 Bench 补上了可复现性入口——这种"本体保守、衍生开放"的双轨结构在库内是首例。
§2 数据构成与规格
2.1 规模、来源与机构构成
PANDA-PLUS 包含 546 张完整注释掩码 WSI,全部派生自 PANDA 挑战赛公开数据:
| 机构 | WSI 数 | 占比 | 高级别代表 |
|---|---|---|---|
| Radboud University Medical Center(荷兰奈梅亨) | 480 | 87.9% | 全部 20 张 ISUP5 与 5 张 GS9 均出自此 |
| Karolinska Institute(瑞典斯德哥尔摩) | 66 | 12.1% | 仅 2 张超过 GS6/ISUP1 |
| 合计 | 546 | 100% | — |
机构偏斜不是设计而是事故:注释分配采用启发式顺序块策略,学生领到编号后"直接顺着往下标",造成大片连续编号被整体注释,而 PANDA 的编号恰好按机构分块,于是 Radboud 被系统性过量采样。论文在讨论节原文承认"sampling heuristic"存在 methodological flaws。对使用者的含义:不要把 546 张当作两机构的平衡样本,任何跨机构结论都要先对齐机构构成。
选取标准方面,论文没有声明随机抽样——546 张的 GS 分布(下表)与 PANDA 总体分布差异很大,重标注团队本身也不知道这批图的原标签(防偏设计),因此分布偏斜是"无监督选择+顺序分配"的自然结果而非标签驱动。
2.2 掩码规格与对齐保证
| 属性 | 规格 |
|---|---|
| 放大倍率 | 20×(原始扫描倍率,无下采样) |
| 空间分辨率 | 0.4862 μm/px |
| 注释平台 | QuPath(内置对象分类工具) |
| 掩码格式 | RGB PNG,RGB 值与 QuPath 分类一一对应 |
| 对齐保证 | 掩码生成时零降采样,与 WSI 逐像素精确对齐 |
| 清洗阈值 | <1600 像素的注释伪迹整体删除 |
| 背景处理 | 白色空白区用单个大注释划定,类名 Ignore* |
清洗阈值 1600 px 的用意是消除"手滑注释":小片误划如果进入像素计数,会直接影响按面积计算的 GS 重算值。论文给出未清洗/清洗对照图,可看到孤立小色块被整体抹除。
2.3 类别体系与早期 pattern 的取舍
掩码五类:Benign / GP3 / GP4 / GP5 / Ignore*。
三处细节值得注意:
- GP1/GP2 归 Benign:早期 Gleason pattern(1、2)在穿刺活检中已极少报告且与良性腺体形态学边界模糊,团队选择不单列。这意味着掩码不支持"早期 pattern 识别"类研究,也意味着 Benign 类内实际混有低级别 pattern。
- 注释粒度自适应:腺体级为主——单个腺体或形态相似的腺体簇逐个圈注;在分化极差的 GP5 区域,腺体结构消失,整片连续恶性区作为整体标注。
- 非腺体结构不设类:慢性炎症、间质、筛状结构、神经周围侵犯等不作为独立类别,只按其主导 GP 归类。掩码回答的是"每个像素属于哪个 Gleason pattern",不是完整的组织学分割。
2.4 分级分布:一个重标注视角下的低级别主导样本
重算后的逐张 GS/ISUP 分布(Table 2/3 口径):
| Gleason score | Radboud | Karolinska | 合计(占比) |
|---|---|---|---|
| GS 0 | 144 | 41 | 185(33.9%) |
| GS 6 | 222 | 23 | 245(44.9%) |
| GS 7(3+4) | 31 | 0 | 31(5.7%) |
| GS 7(4+3) | 52 | 1 | 53(9.7%) |
| GS 8 | 11 | 1 | 12(2.2%) |
| GS 9 | 5 | 0 | 5(0.9%) |
| GS 10 | 15 | 0 | 15(2.7%) |
| 合计 | 480 | 66 | 546 |
ISUP 口径:0-5 级分别为 185(33.9%)/245(44.9%)/31(5.7%)/53(9.7%)/12(2.2%)/20(3.6%)。
三个观察:
- 近八成为良性或低级别(GS0+GS6 = 78.8%)——这与 PANDA 总体分布方向一致(PANDA 本身也偏良性/低级别),但偏斜程度更甚。
- Karolinska 子集几乎无高级别:66 张里 64 张为 GS0/GS6,仅 2 张超过 GS6。这直接解释了后文 Karolinska 一致率显著偏高的统计假象。
- 高级别样本仍然稀缺但非零:GS10 有 15 张——正是这 15 张所在的高级别区,贡献了与 PANDA 原标签最激烈的分歧。
2.5 与 PANDA 本体的关系边界
PANDA-PLUS 不改 WSI、只改标签。546 张原图本身仍是 PANDA 资产(Kaggle 公开,CC BY-NC-SA 口径);PANDA-PLUS 的增量贡献是掩码+重算分级+原标签对照表三件套。因此引用规范上要同时引两者:图像来源引 PANDA(Bulten 等 2022 论文口径),注释与发现引 Hopson 等 2025(J Pathol Inform 20:100540)。
论文转述 PANDA 构成时写"12,625 WSI——10,616 模型开发 + 393 性能评估 + 545 内部验证,外加 Tampere University (United States) 1,071 张外部验证"。其中括号国名是笔误:Tampere University 在芬兰(坦佩雷),非美国——条目按事实记芬兰并在坑 6 存照。
2.6 像素级工艺对比:三种注释生产模式
把附录 N 里的像素级/注释密集型数据集按"谁在标、怎么核"重新切一刀,能看到三种生产模式的取舍:
| 模式 | 代表 | 注释者 | 质控核心 | 单张专家成本 | 规模上限 |
|---|---|---|---|---|---|
| 专家手标 | SICAPv2 | 病理医生本人 | 专家间一致性 | 1-2 h+ | 低(百张级) |
| 分层流水线 | PANDA-PLUS | 受训学生+专家终审 | 全量终审 | 10-15 min | 中(千张级可期) |
| 众包聚合 | CrowdGleason | 非专家群体 | 每 patch 多人投票 | 近零 | 高(万 patch 级) |
三种模式对应三种误差结构:专家手标的误差来自专家间分歧(57.9% 一致率背景);流水线的误差来自学生偏差被终审修正的残余量(3.4 节的 GP3-4 激进倾向);众包的误差来自非专家噪声被聚合稀释的程度(CrowdGleason 结论:人数越多越稳)。PANDA-PLUS 的位置在中间——用结构化流程把专家判断"复制"到学生产出上,是成本与保真度的折中设计。
对选型者的映射:需要最高保真标签做基准测试 → 专家手标(小而准);需要中等规模像素监督做训练 → 分层流水线(本条目);需要海量弱监督信号 → 众包聚合。三者不互斥,同一项目可按数据分层混用。
§3 注释流水线:三层级如何省下专家时间
3.1 三层人员结构
| 层级 | 人员 | 职责 | 投入 |
|---|---|---|---|
| L1 注释 | BYU pre-med 本科生(AI in Medicine Association 招募) | 像素级逐腺体初注,每张单一注释者 | 每周例会受训 |
| L2 复核 | 高年级学生注释员 | 腺体覆盖完整性/去重叠/剔除非组织/粗错纠正 | 每张全查 |
| L3 终审 | board-certified 病理专家(>30 年经验) | 逐腺体确认或调整 GP,最终定级 | 每周 2-4 小时 |
培训体系由终审专家与高年级学生共同执行:前列腺组织学基础、Gleason 分级系统、腺体形态学、数字注释技术四模块,每周例会滚动强化,另配"腺体识别与分级判定"参考手册给注释员随时对照。
3.2 工作流与防偏设计
每张 WSI 的生命周期:下载→去标识(PANDA 侧已完成)→重新编号(内部 image number)→启发式分层分配给单一学生→L1 注释→L2 复核→L3 终审→掩码生成→伪迹清洗→按像素计数重算 GS/ISUP→与 PANDA 原标签对照。
两处防偏设计直接影响比较结果的可信度:
- 原标签全程屏蔽:PANDA 的 GS/ISUP 从 Kaggle 竞赛页单独获取,不进入注释流水线——学生与专家都不知道"这张原判几分"。因此重算分级是独立测量,不是对原标签的校准。
- 盲评优先:20 张专项里,专家先看不带注释的原图给出初判 GS,学生再做像素级注释,注释完成后专家二次确认——避免"先入为主的标签锚定"。
3.3 效率账:1-2 小时如何变成 10-15 分钟
纯专家手标像素级掩码的成本是每张 1-2 小时(访谈口径),546 张即 550-1100 小时专家时间——这是全球像素级注释稀缺的直接原因。三层流水线把专家角色压缩为"复核+终审":机械劳动由受训学生完成,专家只处理需要判断力的部分。UroToday 访谈给出每张 10-15 分钟的复核时间;论文口径为专家每周 2-4 小时复核当周产出。按 546 张摊算,与访谈口径相容。
这不是免费午餐:学生注释与专家终版存在系统性差异(3.4),流水线的质量上界由终审专家一人决定。作者自己强调流水线"可扩展、可迁移到其他 WSI 集合、可引入多专家",但本研究内它是单专家流水线。
3.4 学生偏差画像:GP3-4 区间的系统性激进
论文披露两类可复现的学生倾向:
- GP3-4 边界偏激进:形态模糊的腺体,学生更常判 GP4(更高级别)——这与临床"宁可报重不可漏报"的保守直觉一致,但会抬高 GP4 占比、间接抬高 GS。
- 异形即恶性误判:形状不规则的正常变异腺体有时被学生误标为癌性。
这些偏差正是 L2/L3 存在的理由:每张图的每个结构都被学生与专家双重过目,专家修订最终生效。对复用者的启示:若把"学生注释+专家抽检"当作低预算流水线模板,抽检密度直接决定标签上限——PANDA-PLUS 的是全量终审,不是抽检。
§4 与 PANDA 的比较发现:标签噪声的定量解剖
4.1 统计比较:三套指标 × 三档加权
以逐张重算 GS/ISUP vs PANDA 原标签做 546×2 的混淆矩阵,计算 agreement、κ(Cohen’s kappa)与 PABAK,各配未加权/线性/二次三档权重(二次权重对严重分歧惩罚最重):
| 指标(全数据集 n=546) | Gleason score | ISUP grade |
|---|---|---|
| Agreement | 0.419 | 0.396 |
| κ(未加权) | 0.263(表)/0.283(正文) | 0.251 |
| PABAK(未加权) | −0.162 | −0.209 |
| κ(线性) | 0.624 | 0.364 |
| PABAK(线性) | 0.396 | 0.505 |
| κ(二次) | 0.848 | 0.466 |
| PABAK( quadratic) | 0.528 | 0.738 |
如何读这张表(初学者最容易误读的三处):
- 未加权与加权的巨大落差不是矛盾:未加权 κ 把所有分歧等权看待,得到 0.263 的"几乎不一致";二次加权考虑"差 1 级 vs 差 4 级"的严重度,κ 升到 0.848。合起来读:大多数分歧是小幅漂移,但存在少量大幅降级——大幅分歧正是高级别区的那些案例。
- PABAK 未加权为负:−0.162 意味着观察一致率低于"按类别先验随机猜"的水平——这不是说两套标签比随机还差,而是类别分布高度偏斜时 PABAK 的数学性质使然( prevalence-adjusted 的双刃剑)。
- GS 与 ISUP 的分离:二次加权 κ 上 GS 0.848 而 ISUP 只有 0.466。GS7 拆分(3+4 vs 4+3)使 ISUP 对主次 pattern 顺序更敏感——像素级重算恰好能精确重排主次 pattern,于是在 GS 收敛的地方 ISUP 仍可分歧。
分机构子集:Radboud(n=480)与总体趋势一致(agreement GS 0.384);Karolinska(n=66)一致率显著偏高(agreement 0.688,二次 PABAK 0.960)。原因已在 §2.4 指明:Karolinska 子集 97% 为良性/低级别,避开了最容易分歧的区间——Karolinska 的高一致率是分布效应,不是标签质量效应。
4.2 热图与完全分歧案例
混淆矩阵热图(GS 与 ISUP 各三张:Radboud/Karolinska/总体)呈现统一形态:分歧质量偏在对角线上方(PANDA 分高、PANDA-PLUS 分低),且偏离对角线的幅度在高分级区显著放大。GS0/ISUP0 对角处密实——良性判断两套标签高度一致。
最刺眼的一格:PANDA 判 ISUP5(GS 9-10)的切片中,有 6 张在 PANDA-PLUS 侧落到 GS0/ISUP0——“最高级恶性肿瘤"重审后"完全没有恶性组织”。这 6 例是"标签错误的下限案例":连癌与非癌的定性都翻转,遑论分级。
4.3 20 张专项:高级别标签的定向体检
正式专项(方法节预注册流程):从 PANDA 的 GS10/ISUP5 子集里,由高年级注释员选出"疑似分级差超过 4 分"的 20 张;专家先盲评初判 GS,学生再像素级注释,专家终审。结果:
| 重审结果 | 张数(共 20) |
|---|---|
| GS 0(无恶性组织) | 11 |
| GS 6 | 1 |
| GS 7 | 2 |
| GS 8 | 6 |
| GS 9 或 GS 10 | 0 |
即:全部 20 张都被降级,过半数根本不是癌,没有一张维持最高级。论文的措辞克制但指向明确:“This high rate of misclassification suggests substantial labeling errors in the broader PANDA dataset…we caution against over-reliance on these slide-level labels.”——20 张是小样本,结论是提示性而非统计显著的(dataLimitations 已存照),但方向与 §4.2 的 6 张完全分歧案例互相印证。
对库内 PANDA 条目(rid 560)使用者的直接含义:在 PANDA 上报告的高分数可能部分来自标签本身的宽容;跨数据集评测(如训练 PANDA、测试 SICAPv2)中观察到 PANDA 侧分数系统性偏高时,标签质量是必须纳入的混杂因素。
4.4 粒度实验:同一人、同一张、三种注释粒度
实验设计:同一位终审专家,对同一张 WSI 分别以 slide 级(目视)、patch 级(256×256 与 512×512 两种常用训练切片)、像素级三种粒度定级。patch 级按"patch 内主导 pattern"归类(组织覆盖 >20% 才计入,否则 Ignore),像素级按像素计数定主次 pattern。
结果:
- 定级漂移:slide 级 GS8 → patch 级 GS7 → 像素级 GS7。仅粒度变化即翻转 ISUP 对应关系(ISUP4 → ISUP2/3 一档)。
- GP 占比失真(相对像素级基准):
| 类别 | 像素级 | 256×256 patch | 512×512 patch |
|---|---|---|---|
| GP3 | 5.5% | 10.9%(×2.0) | 12.0%(×2.2) |
| Benign | 0.6% | — | 1.7%(×2.8) |
| GP4 | — | — | ×1.8 |
| GP5 | — | — | ×1.8 |
机制:patch 取主导 pattern 时,被选中 pattern 获得超额表征,其他 pattern 系统性缩水;patch 越大,混合越严重,计数噪声越大。实验虽然只有单张,但机制解释是普适的:凡是按 patch 主导类别产出的弱标签,都内嵌这个膨胀器。
这一实验是论文对"AI 训练标签工程"的方法学贡献核心:它把"切片级标签有噪声"这句常识拆解成了可测量的膨胀系数与可复现的实验范式。
4.5 统计卫生:读这组数字的四条守则
- 别把 agreement 当 kappa 用。agreement 0.419 是"完全一致比例",κ 才扣掉随机一致;类别偏斜(33.9% GS0)会让 agreement 显得"还行"而 κ 很难看——两者必须同报。论文给全了三档权重,引用时注明你用的是哪一档。
- 别用 Karolinska 子集的 0.688 反驳全集的 0.419。Karolinska 高一致是"没考到难题"(97% 良性/低级别),等价于用简单子集测出的指标,与全集不可直接比。
- 别把 PABAK 负值当"比随机差"传播。−0.162 是 prevalence 调整的数学产物(po<0.5 时 PABAK=2po−1 必为负),正确的表述是"一致率低于类别先验下的期望水平"。
- 二次 κ 0.848 不等于"两套标签几乎一致"。二次权重把"差 1 级"与"差 4 级"压到同一量纲的平方惩罚下,高分只说明"多数分歧不严重";而高级别区那 6 张完全分歧与 11/20 GS0 恰恰是"严重分歧存在且定向"的证据。所有指标合读的结论是:小幅漂移普遍+大幅降级定向于高级别——两头都要报,只报一头都是误读。
这四条守则同样适用于审稿与复现:若你在别处看到有人引用本数据集时只报单一指标(无论报哪个),都应视为选择性引用。
§5 PANDA-PLUS-Bench:从重标注到基础模型鲁棒性基准
5.1 动机与构成
如果说 PANDA-PLUS 本体回答"标签怎么画",Bench 回答的是"模型到底学到了什么"。病理基础模型在验证集上分数漂亮,但可能大量依赖切片特异伪影(扫描仪指纹、染色批次、切片编号可辨别的风格差异)——所谓 WSI-specific feature collapse(切片级特征坍塌)。Bench 用一个刻意构造的对照把这种坍塌量化出来。
| 属性 | 规格 |
|---|---|
| 来源 | PANDA-PLUS 专家注释 WSI 中精选 9 张(9 个唯一患者,Gleason pattern 多样) |
| patch | 224×224 @20×(另有 512×512 提取路径),非重叠组织 patch |
| 增强条件 | 8 种 × 3,872 张 = 30,976 examples |
| 标签 | Benign(0) / GP3(1) / GP4(2) / GP5(3) + slide_id |
| 体量 | 2.56 GB(Parquet,HF datasets 格式) |
| 许可与入口 | CC BY-4.0,HuggingFace dellacorte/PANDA-PLUS-Bench,gated=false 公开直链 |
| 论文 | Ebbert JL, Della Corte D. AI Med. 2026;1(2):14(doi:10.3390/aimed1020014;2026-05-28 发表) |
八种增强条件构成"扰动光谱":baseline(仅 ImageNet 归一化)、color_jitter(亮度/对比/饱和/色相)、grayscale(完全去色)、gaussian_noise(σ=0.05 加性噪声)、heavy_geometric(±180° 旋转+翻转)、combined_aggressive(全增强叠加)、macenko_normalization(Macenko 染色归一化)、hed_stain_augmentation(H/E 通道扰动)——前五种考验通用视觉鲁棒性,后三种直指数字病理特异的染色域漂移。
# Bench 官方推荐加载方式(HF datasets 库)
from datasets import load_dataset
ds = load_dataset("dellacorte/PANDA-PLUS-Bench", split="baseline")
sample = ds[0]
# sample["image"] -> PIL Image(224x224)
# sample["label"] -> 0=Benign, 1=GP3, 2=GP4, 3=GP5
# sample["slide_id"] -> 切片标识(9 个唯一值)
5.2 七个基础模型的坍塌画像
评估任务:让各基础模型在 8 种条件下做 patch 分类,分别统计 slide-ID 分类精度(能否凭 patch 认出"这是哪张切片"——越高说明伪影编码越强)与 cross-slide 精度(跨切片泛化精度——越高说明生物信号越强):
| 模型 | slide-ID 精度 | cross-slide 精度 | 解读 |
|---|---|---|---|
| Virchow | 80.7-81.0%(大规模组最低档) | — | 大规模组中伪影编码最弱 |
| Virchow2 | 81.0% | 47.2%(大型组次低) | 伪影弱但泛化也弱 |
| UNI / UNI2 | — | — | 中间档 |
| Phikon / Phikon-v2 | — | — | within/cross gap 达 26.9 pp |
| HistoEncoder | 90.3%(最强) | 59.7%(最高) | 前列腺特异训练:伪影最强但泛化也最强 |
三个结论(论文口径):
- 所有模型都有 within- vs cross-slide gap(19.9-26.9 个百分点)——切片伪影普遍存在,只是程度不一。
- 伪影编码与泛化能力不必然负相关:HistoEncoder 两个指标同时最高——前列腺组织特异训练可能同时增强了对生物特征和切片签名的捕获。这与"伪影越少越好"的朴素预期相反。
- Virchow2 的警示:slide-ID 最低(伪影最弱)但 cross-slide 也最低——弱伪影不自动等于好表征。
论文配套开源 Google Colab,可在标准化指标下把新模型跑进同一张对照表——这是 Bench 对外承诺的核心可复现性资产。
5.3 双口径与 repo 名坑(检索者必读)
- 规模双口径:HF README 卡片写"~2,770 per augmentation condition",而 API splits 实测每条件 3,872(8×3,872=30,976,与 MDPI 论文摘要一致)。以 API/论文口径为准,README 数字疑为早期版本残留(坑 4)。
- repo 名:真实可用的是
dellacorte/PANDA-PLUS-Bench;dellacortelab/PANDA-PLUS-Bench不存在(API 返回 404 类错误)。“dellacortelab” 字样易与 BYU 学生组织 AI in Medicine Association、或实验室口头名混淆(坑 8)。 - 下载热度:抓取时点 HF 累计 downloads 69、likes 1——发布约十个月,属低热度精确工具,不是社区爆款,检索时别期待大量第三方评测可引。
§6 获取与许可:三层异构的门怎么进
6.1 三层资产、三种门
| 资产 | 入口 | 许可 | 门槛 |
|---|---|---|---|
| WSI 本体(546 张原图+全 PANDA) | Kaggle 竞赛页 / panda.grand-challenge.org | PANDA 口径 CC BY-NC-SA | 注册即下 |
| 注释掩码+重算分级(PANDA-PLUS 本体) | 邮件通讯作者 Dennis.DellaCorte@byu.edu | 学术用途 upon qualified request | 请求制:需附研究用途简述+机构隶属 |
| PANDA-PLUS-Bench | HuggingFace dellacorte/PANDA-PLUS-Bench |
CC BY-4.0 | 无(直接 load_dataset) |
| 论文 | doi:10.1016/j.jpi.2025.100540(J Pathol Inform,开放获取) | CC BY-NC-ND | 无 |
6.2 请求制实操要点
数据可用性声明原文要求两点:研究用途的简要描述与机构隶属。没有公开表单,唯一通道是邮件;论文未承诺响应时限、未列发放格式细节(按论文描述应为掩码文件+逐张分级表)。规划依赖此数据的工程时,把"等待发放"当作不确定周期处理,先用 Bench(公开)与 PANDA 原数据(公开)搭管线,掩码到位后再替换标签层。
6.3 AI-Ready 评估:双轨结构的得失
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:论文开放获取全文+HF dataset card(含 features/splits/citation)——良好。
- 公开直链:掩码本体缺失(请求制)——AI-Ready 最大失分项;Bench 补了一个可编程入口(HF API/Parquet 直接进管线)。
- 许可明确性:三层许可各自明确,但拼起来需要使用者自行对齐"我训练的模型受哪层约束"——掩码请求制未附再分发条款,衍生模型许可属灰色地带。
- 可复现性:Bench+Colab 提供"开箱即评"路径;本体复现(像素级训练)依赖申请成功。
- 文档自洽:论文正文与表格一处数字漂移(坑 3)、README 与 API 一处规模漂移(坑 4)——都不影响主线结论,但自动化抓取需指定以表格/API 为准。
综合:AI-Ready 等级"中"——方法论与文档质量高于均值,可获取性被请求制拖低;Bench 的 CC BY-4.0 直链是重要的补偿设计,也是本条目与"纯注册墙"数据集的分界。
6.4 与库内可获取性光谱的对照
库内挑战赛/数据集条目已形成可获取性光谱(注册墙→请求制→Zenodo→AWS Registry→公开直链)。本条目在光谱上的位置:
| 档位 | 库内参照 | 本条目对应 |
|---|---|---|
| 注册墙(最严) | LMC2(rid 531,注册+审批) | — |
| 请求制 | 少量老条目(upon request 型) | 掩码本体 |
| 平台托管 | Zenodo 型(TopBrain,rid 632) | — |
| Registry 收录 | AWS Registry 型(REG²,rid 639) | — |
| 公开直链 | HF/Zenodo 直链型 | Bench(CC BY-4.0)+ WSI(Kaggle) |
特色在于"母-子双轨":母数据集(掩码)落请求制档、子基准(Bench)落公开直链档——同一团队同一项目内部横跨两档,这在库内是首例。对检索者的实际影响:按"能否立刻下载"过滤条目时,本条目会因 Bench 而命中;按"本体可直链"过滤时,本条目应标注请求制——两种过滤口径下它的归属不同,这正是三层异构结构的库内价值。
§7 生态与影响:一个实验室的三层产出
7.1 前作与谱系
BYU Della Corte 组在前列腺病理 AI 方向的三部曲:
- 2024 前作(arXiv:2406.06801):贝叶斯框架聚合多模型 Gleason 分布预测,强调"分布而非单值"的分级表征,配套一个腺体级手工精选小数据集——PANDA-PLUS 的方法论前身。
- PANDA-PLUS(本条目,2025-12 在线):546 张像素级重标注+三层流水线+对 PANDA 的批判性比较。
- PANDA-PLUS-Bench(2026-05):从本体派生的基础模型鲁棒性基准,CC BY-4.0 开放。
谱系逻辑是清晰的漏斗:先有"分布化分级"的方法主张,再造"像素级标签"的数据底座,最后收口"标签质量→模型行为"的评测工具。
7.2 商业化端口:pathtools.ai 的宣称口径
同一团队运营商业化网站 pathtools.ai(“Slide to Decide”,腺体级 AI 决策支持)。网站宣称两项非论文数据(组织方口径,无同行评审背书):
- QWK 0.849(95% CI 0.782-0.903):在 147 张 PANDA-PLUS 切片评估集、8,808 个专家手绘腺体轮廓上测得,2026-09-14 复测于 patch-cascade 服务配置—— quadratic weighted kappa,专家-模型一致性。
- 135,251 个专家注释训练语料:1,856 张切片、约 9,500 个穿刺芯(788 张多芯 @均值 10.7 芯 + 1,064 张单芯),2026-08-31 自注释数据库查询。
这两个数字属于"实验室商业化宣称":口径、版本、评测协议均以网站为准,不能与论文数据混引。条目仅作生态背景收录(坑 7)。
7.3 在前列腺 WSI 数据集景观中的位置
以论文 Table 1 的景观对照( Pixel-level 注释赛道):
| 数据集 | 年份 | WSI | 注释层级 | 特点 |
|---|---|---|---|---|
| SICAPv2 | 2020 | 182 | patch+slide 级 | 前纪录保持者,10,340 graded patches |
| RINGS | 2021 | 1,500 | 像素级 | 腺体分割但无分级标签 |
| PANDA | 2022 口径 | 12,625 | slide 级+稀疏 mask | 规模之王 |
| PCa_Bx_3D | 2022 | 118 | 像素级 | 3D 多模态 |
| CrowdGleason | 2024 | 1,045 | patch 级 | 众包实验,19,077 graded patches |
| DiagSet | 2024 | 5,151 | patch+slide 级 | A/B/C 分层保真度 |
| PANDA-PLUS | 2025 | 546 | 像素级 RGB 掩码 | 前列腺穿刺 WSI 像素级注释规模之最 |
定位一句话:规模上 PANDA 不可撼动,注释粒度上 PANDA-PLUS 在"穿刺活检 WSI+像素级+带分级"的组合里目前最大(546 vs SICAPv2 的 182;RINGS 像素级但无分级标签,DiagSet 像素级子集为切除/扫描混合口径)。它同时是唯一"自带对原标签的批判性审计"的数据集。
7.4 对 PANDA 生态的反向冲击
PANDA 至今仍是前列腺分级模型的事实标准训练集(含大量 leaderboard 复现与基础模型评测)。PANDA-PLUS 的审计结果意味着:PANDA 上的一切分数都带有"标签上限"——模型不能可靠学出不存在的信号。短期内 PANDA 的地位不会被替代(请求制掩码无法支撑全量重训练),但"在 PANDA 上评测+在 PANDA-PLUS 子集上校准"的混合协议可能成为后续论文的常见设计。库内 LEOPARD(rid 636,复发预测)与 REG²(rid 639,报告生成)等下游任务的评估设计同样受此提醒。
§8 方法学启示:三条可迁移的经验
8.1 "专家终审+学生劳动"的流水线是可复制的
三层流水线的可迁移性论证:任务可分解(机械圈注 vs 判断修订)、质量可分层(L2 结构性检查 vs L3 判断性修订)、成本可压缩(专家 10-15 min/张)。适用于任何"注释标准清晰、形态学可培训"的病理子任务;不适用于判断边界本身有争议的任务(那时 L3 的单专家就成了单点偏差源)。
8.2 标签粒度是超参数,不是背景板
粒度实验给出的定量教训:patch 主导归类会系统性膨胀优势 pattern(GP3 ×2、Benign ×2.8)。这给弱监督/多实例学习社区一个直接的校准工具——在报告 patch 级训练结果时,同时报告像素级基准下的 pattern 占比,让读者看到"标签工艺"对结论的塑形。
8.3 分布化分级主张
论文结论段倡议:与其追求单一 ground truth,不如把 Gleason 分级表征为概率分布(与前作 arXiv:2406.06801 的贝叶斯主张一脉相承)。这与 2026 年 REG² 挑战赛用推理链显式化诊断过程的趋势同向——病理 AI 正在从"预测一个数"转向"暴露诊断的证据结构"。
8.4 标注生产视角:与多专家委员会模式的对照
病理标注的两种权威模式各有代价:多专家委员会(如 DiagSet C 的 9 人独立阅片)给出"分歧分布",成本极高、规模受限;单专家终审+学生劳动(本条目)给出"一致标签",成本低、规模可达数百张。PANDA-PLUS 的结论段实际上提出了第三条路:标签以概率分布存在——每个像素/每张切片承载"可能的主次 pattern 组合"而非单值,让下游模型显式面对不确定性。这与本库多条目记录的"金/银标准分离"(TopAneu 的金银双轨、REG² 的双指标结构)在思想上是同族的:承认真值的分布性,把分歧从缺陷变成信息。
工程落地时的取舍:单专家流水线的标签上限=该专家的水平与稳定性;概率化路线要求标注协议从"定值"改为"采样"(多次独立定级或多人聚合),成本介于两者之间。PANDA-PLUS 未走第三条路(它是单值掩码),但其审计结果(§4)恰是第三条路最有力的动机证据。
§9 与库内条目的关系
9.1 家族图谱
- PANDA(rid 560):直接上游。本条目为其提供像素级升级路径+标签审计结论;两篇同读才能拼出"PANDA 数据集全貌"(本体+批判)。
- SICAPv2(rid 328):像素级赛道前纪录保持者(182 张)。PANDA-PLUS 546 张接棒"最大像素级穿刺 WSI 注释";两者分别代表 Valencia(专家手标 patch)与 BYU(流水线像素)两种工艺。
- LEOPARD(rid 636):前列腺病理下游任务(复发预测)。其标签同样依赖病理分级,PANDA-PLUS 的标签噪声发现是 LEOPARD 评测设计的背景风险提示。
- REG²(rid 639):病理报告生成挑战赛(MICCAI 2026)。两者共享"像素/结构级真值比切片级标签更可信"的底层主张;REG² 的推理链评估与 PANDA-PLUS-Bench 的伪影敏感性测试是病理 AI 可信度的两个互补维度。
- Lizard(rid 238)/NuCLS(rid 248):核级/腺体级实例分割的注释方法论对照组(多机构多专家 vs 本条目单专家流水线)。
- OWL(rid 635):计算病理可解释性科学发现挑战——与 Bench 共享"模型学到的是信号还是伪影"的问题意识。
9.2 检索路径建议
- 检索词组合:“PANDA-PLUS”(精确)+ “Gleason” + “pixel-level”;勿用"PANDA-SICAP"(坑 1)。
- 若目标是直接可用数据:HF
dellacorte/PANDA-PLUS-Bench(CC BY-4.0)→ Kaggle PANDA(CC BY-NC-SA)→ 掩码邮件申请。 - 若目标是引用标签噪声论点:引论文 §Results 的 Table 4(agreement 0.419/κ 二次 0.848)与 20 张专项(11/20 GS0),并注明正文-表格 κ 漂移(坑 3)。
§10 避坑清单:八个已踩过的坑
坑 1:"PANDA-SICAP"不是数据集名。文献里"PANDA-SICAP"只出现在"PANDA 训练+SICAP 测试"的跨库评估语境中,是惯用简称而非具名数据集;本库生产 tracker 曾误记为候选条目名,三轮精确搜索证伪后改立 PANDA-PLUS。检索时用精确短语并核对 DOI。
坑 2:论文年份双口径。NLM/PMC 记录为 J Pathol Inform. 2025 Dec 30;20:100540(doi 10.1016/j.jpi.2025.100540);pathtools.ai 与 ScienceDirect 列表页写 “2026;20:100540”(doi 后缀 2026)。同一论文、两套年份(2025-12-30 在线 / 2026 卷期),引用前先定口径并全篇一致。
坑 3:正文与表格数字漂移。未加权 κ(GS):正文写 0.283,Table 4 写 0.263(ISUP 一致 0.251)。本条目正文按表格引用并注漂移;自动化抽取建议以表格为准。
坑 4:Bench 规模双口径。HF README 卡片"~2,770 per augmentation condition" vs API splits 实测 3,872/条件(总 30,976 与论文摘要一致)。以 API/论文为准。
坑 5:许可三层异构,别一揽子引用。WSI(CC BY-NC-SA)、掩码(请求制、条款未公开细化)、Bench(CC BY-4.0)、论文(CC BY-NC-ND)四件资产四套规则;特别是"掩码请求制"没有公开再分发条款,衍生模型的许可边界需自行与作者确认。
坑 6:Tampere 不是美国大学。论文原文把外部验证集写作 “Tampere University (United States)”——Tampere University 在芬兰。论文笔误,转引时按事实写芬兰。
坑 7:QWK 0.849 与 135,251 注释不是论文数据。两者是 pathtools.ai 商业化网站的宣称口径(2026-09-14/2026-08-31 查询),无同行评审背书,仅作生态背景,不可与论文指标混引。
坑 8:HF repo 名与类别映射。真实 repo 是 dellacorte/PANDA-PLUS-Bench(dellacortelab 不存在);标签 0-3 = Benign/GP3/GP4/GP5,没有"GP1/GP2"类别(本体掩码把它们并入 Benign),用 Bench 做多类评估时别假设六类输出。
§11 总结
11.1 三句话总结
- PANDA-PLUS 用 546 张像素级重标注证明:PANDA 的切片级标签在高级别区存在实质性错误(20 张 GS10 专项 11 张无恶性组织),一切 PANDA 评测都应带此背景。
- 它的三层注释流水线把像素级注释的专家成本压掉约 85%,方法本身是可迁移的公共资产。
- 它的衍生 Bench(CC BY-4.0 公开直链)把"标签质量→基础模型鲁棒性"变成可复现实验,七模型结果已可对标。
11.2 适合谁
- 前列腺病理分割/分级团队:找像素级监督与跨机构评测设计。
- 基础模型评测者:需要一个"反伪影"压力测试集(Bench 开箱即用)。
- 数据集工程研究者:三层流水线+请求制/直链双轨可获取性都是活的案例研究。
- 使用 PANDA 出分数的任何人:先读 §4,再决定怎么解读你的 leaderboard 位置。
11.3 不适合谁
- 需要 GP1/GP2 早期 pattern 监督的项目(掩码不单列)。
- 需要大规模即插即用像素级训练集的团队(546 张+请求制,量与速度都不满足)。
- 需要多机构平衡采样的跨机构泛化研究(480:66 的机构偏斜是硬约束)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要立刻下点东西跑通 | HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0)+ 附录 H 骨架 |
| 要像素级训练数据 | Kaggle 下 PANDA + 邮件申请掩码(附录 P 模板)等待发放 |
| 在 PANDA 上出了高分 | 先读 §4——你的分数带着标签上限,报告时引用 Table 4 与 20 张专项 |
| 要写数据集综述 | 附录 N 景观表 + §2.6 工艺对比可直接引用 |
| 要设计标注流水线 | §3 + 附录 F SOP 骨架;注意单专家终审的偏差源(§8.4) |
| 要引用本数据集 | 附录 W BibTeX;年份口径按 NLM(2025;20:100540) |
FAQ(高频问答 32 问)
A. 基础认知
Q1:PANDA-PLUS 是挑战赛吗?
不是。它没有比赛、没有 leaderboard,是对 PANDA 挑战赛数据的重标注研究项目,成果为论文+数据集+衍生基准三件套。
Q2:名字里的 PANDA 指什么?
Prostate cANcer graDe Assessment——2020-2021 年在 Kaggle 举办的前列腺癌分级挑战赛,提供史上最大公开前列腺穿刺 WSI 集合。PANDA-PLUS 从其公开数据中取材 546 张重标注。
Q3:"PLUS"加在了哪里?
加在标签上:切片级 GS/ISUP → 像素级 RGB 掩码(Benign/GP3/GP4/GP5/Ignore),外加逐张重算分级与原标签对照。
Q4:谁做的?
美国杨百翰大学(BYU)物理与天文系 Della Corte 组,一作 Spencer Hopson,通讯 Dennis Della Corte,8 位作者全部同机构。
Q5:发表在哪里?
Journal of Pathology Informatics(J Pathol Inform),NLM 记录 2025 Dec 30;20:100540,doi:10.1016/j.jpi.2025.100540,开放获取(论文 CC BY-NC-ND)。注意 pathtools.ai/ScienceDirect 列表页写 2026 卷期——双口径(坑 2)。
Q6:它和 SICAPv2 什么关系?
同行竞争者。SICAPv2(182 张,2020)曾是像素级注释的前纪录;PANDA-PLUS(546 张,2025)在"穿刺 WSI+像素级+带分级"组合上超过它,两者工艺不同(专家 patch 手标 vs 学生流水线+专家终审)。
Q7:它和 CrowdGleason 什么关系?
方法论近亲。CrowdGleason(2024,1,045 张)验证众包注释的可行性;PANDA-PLUS 的"学生+专家"流水线是同一思路的分层强化版,论文结论段也引用了 CrowdGleason 式框架。
Q8:最大的卖点一句话?
20 张原判最高级(GS10)的切片重审后 11 张没有恶性组织——它把"大标签集≠好标签"从直觉变成了测量结果。
Q9:它自己有什么局限?
机构偏斜(480:66)、低级别偏斜(78.8% 为 GS0/6)、GP1/GP2 不单列、单专家终审、20 张专项样本小——论文讨论节全部自曝。
Q10:开源吗?
分层开源:掩码请求制(不公开直链)、Bench CC BY-4.0 公开、论文开放获取、Bench 评估 Colab 开源。
B. 数据与获取
Q11:546 张怎么选的?
启发式顺序块分配(学生顺着编号往下标),无随机抽样声明;作者自曝该启发式有方法缺陷导致机构偏斜。
Q12:掩码和原图对齐吗?
严格逐像素对齐——掩码导出零降采样,RGB 值与 QuPath 分类一一对应。
Q13:背景怎么处理?
白色空白区用单个大注释划定为 Ignore* 类,<1600 px 的注释伪迹整体删除。
Q14:掩码怎么申请?
邮件通讯作者(Dennis.DellaCorte@byu.edu),附研究用途简述+机构隶属;无公开表单,无承诺时限。
Q15:WSI 原图去哪下?
Kaggle 竞赛页或 panda.grand-challenge.org(PANDA 公开口径 CC BY-NC-SA),注册即可。
Q16:三层数据我都想要,建议什么顺序?
先 HF 下 Bench(CC BY-4.0,直链)搭管线 → Kaggle 下 PANDA 原图 → 掩码邮件申请并行等待,到位后替换标签层。
Q17:能用掩码训练商用模型吗?
不确定。请求制声明只说"academic research purposes",未公开再分发/商用条款——商用前需与作者书面确认(坑 5)。
Q18:Bench 怎么加载?
HF datasets 库:load_dataset("dellacorte/PANDA-PLUS-Bench", split="baseline"),八个 split 对应八种增强条件;注意 repo 名是 dellacorte 不是 dellacortelab(坑 8)。
C. 统计与发现
Q19:一致率 0.419 是什么概念?
546 张里只有约 41.9% 的切片重算 GS 与 PANDA 原标签完全一致——近六成切片的分数被重审改变。
Q20:未加权 κ 只有 0.263,二次加权却 0.848,矛盾吗?
不矛盾。未加权对所有分歧等权;二次加权只重罚"差好几级"的大分歧。两者合读:多数分歧是小幅漂移+少量大幅降级(集中在高级别区)。
Q21:PABAK 为什么会是负数?
类别分布极度偏斜(33.9% GS0)时,PABAK 的 prevalence 调整会放大偶发不一致——负值反映数学性质而非"比随机差"。
Q22:为什么 Karolinska 一致率反而高?
分布效应:其 66 张里 97% 是良性/低级别,避开了最容易分歧的区间。不能解读为 Karolinska 原标签更准。
Q23:6 张"GS9/10→GS0"和 20 张专项的 11 张什么关系?
前者是 546 张全量比较中的完全分歧案例(热图读出),后者是定向补做的 GS10 子集专项;两者独立采样、方向一致,互为印证。
Q24:粒度实验只做了 1 张,可信吗?
样本小,但机制清晰可推:patch 主导归类必然超额表征优势 pattern(GP3 ×2、Benign ×2.8)。单张实验的价值在于给出可复现的测量范式而非总体估计。
Q25:这些发现对在 PANDA 上训练的模型意味着什么?
存在标签上限:模型无法可靠学出被错误标注的信号;PANDA 侧高分可能部分来自标签宽容;跨库评测时 PANDA 分数偏高应把标签质量列为混杂因素。
D. Bench 基准
Q26:Bench 测的是什么失效模式?
WSI-specific feature collapse——模型用切片特异伪影(扫描仪/染色/批次指纹)而非生物特征做题,验证集高分在新切片上失效。
Q27:为什么 HistoEncoder 伪影编码最强却泛化最好?
论文解读:前列腺组织特异训练可能同时增强生物特征与切片签名的捕获——"伪影弱=模型好"的朴素预期不成立,需要双指标同看。
Q28:八种增强条件里哪些最"病理特异"?
macenko_normalization 与 hed_stain_augmentation 直指染色域漂移,是数字病理特异的;其余六种是通用视觉扰动。
Q29:能把我的模型加进对照表吗?
可以——论文提供开源 Google Colab,标准化指标下评测任意基础模型。
Q30:Bench 的规模为什么 README 和 API 不一样?
README 写"~2,770/条件"疑为早期版本残留;API splits 实测 3,872/条件、总 30,976 与论文摘要一致。以 API/论文为准(坑 4)。
E. 生产与库内
Q31:本条目为什么叫 panda-plus 而不是 panda-plus-bench?
本体是 546 张掩码数据集(论文主线),Bench 是其衍生品(独立论文+独立许可);库内以数据集本体立条、Bench 以专节收录,与其"母-子"结构对应。
Q32:本条目与库内 PANDA(rid 560)冲突吗?
不冲突、是互补:560 记挑战赛本体,本条目记像素级重标注与标签审计。两者互为上下游,检索任一条目都应提示另一条。
F. 复现与工程细节
Q33:掩码文件是什么格式?逐张对应关系怎么维护?
掩码为 RGB 图(与 WSI 同尺寸),类别经 RGB 值编码(对应 QuPath 分类色);逐张经重新编号的内部 image number 对应,原 Kaggle 文件名映射关系由作者侧维护——申请发放时应一并索要对照表。
Q34:学生注释与专家终版的差异有多大?
论文定性描述:差异"modest",最大分歧集中在病理界本身也有分歧的 GP;学生在 GP3-4 边界偏激进、偶把正常变异误判恶性。定量数值未披露——这是复现者无法获得但应知情的盲区。
Q35:20 张专项的选择有标签泄漏风险吗?
流程上是防泄漏的:先由高年级注释员按"PANDA 分级与视觉印象疑似差 >4 分"选出候选,专家盲评确认后再注释;全程不知 PANDA-PLUS 主集结果。但"疑似严重分歧"的入选标准本身意味着这 20 张不能代表全体 GS10——它测的是"错误率上界",不是"随机 GS10 的期望错误率"。
Q36:粒度实验的 patch 计数规则和主流训练管道一致吗?
一致。256²/512² 正是弱监督/MIL 管道最常用的两个 patch 尺寸,>20% 组织覆盖才计入的规则也常见;所以实验结论可以直接迁移到"你的训练管道会不会有同样的膨胀"这一自查。
Q37:Bench 的 9 张切片是怎么选的?
论文口径:从专家注释 WSI 中精选"含多样 Gleason pattern"的 9 张(9 个唯一患者)——目的是让每个类别与每张切片都有足够 patch 支撑 slide-ID/cross-slide 双指标;未披露随机化声明,应视为刻意构造(curated)而非随机样本。
Q38:为什么 Bench 用 224×224 而不是更大 patch?
224² 是 ViT 系基础模型的标准输入尺寸(Virchow/UNI/Phikon 均以 224 或其倍数预训练),224² 保证与七模型的原生管线零摩擦;512² 路径在论文里作为补充提取口径提及。
Q39:能拿 Bench 做模型选择吗?
能测鲁棒性维度,不能全量替代验证集:9 张切片/9 个患者、每条件 3,872 patch 的构造设计,适用于"伪影敏感性"诊断而非泛化性能排名;模型选择仍需常规多切片验证集。
Q40:本条目后续会更新什么?
维护触发点见附录 T:优先级最高的是"掩码公开化"(一旦团队上线直链,条目 AI-Ready 评级与获取节整体改写);其次是 Bench 第三方评测扩表与 PANDA 官方回应追记。
Q41:为什么条目里反复强调"坑点"?
因为这个数据集的价值一半在"教学意义":它的原始文档本身带着双口径(年份、规模)、正文-表格漂移、地理笔误与许可异构——这些坑正是 AI-Ready 质检要抓的典型缺陷样本,条目把它们全部存照并给出处理口径(附录 S)。
Q42:能用这 546 张掩码微调分割模型再商用吗?
风险未清零。许可只写"academic research purposes",未含商用授权;模型权重的衍生属性在请求制许可下属灰色地带。稳妥路径:商用管线先用 Bench(CC BY-4.0)或自行复标数据训练,或与作者签书面授权。
Q43:如果我只记住一件事?
PANDA 高级别区标签有实质性错误(20 张最高级里 11 张无癌),任何 PANDA 评测都应带上这个背景——而这件事的可见性,来自一次"把 546 张切片重新逐像素画一遍"的重标注工程。
事实清单(硬事实 36 条)
- PANDA-PLUS 含 546 张 WSI 像素级注释掩码,全部派生自公开 PANDA 挑战赛数据(Kaggle 2021 托管)。
- 机构构成:Radboud 480 张(87.9%)+ Karolinska 66 张(12.1%)。
- 图像规格:20× 放大,0.4862 μm/px,H&E 穿刺活检 WSI。
- 注释平台 QuPath;掩码 RGB 值与 QuPath 分类一一对应,导出零降采样、与 WSI 逐像素对齐。
- 掩码五类:Benign/GP3/GP4/GP5/Ignore*;GP1/GP2 不单列、并入 Benign。
- 掩码清洗阈值:<1600 像素注释删除。
- 三层流水线:BYU pre-med 本科生注释 → 高年级学生复核 → board-certified 病理专家(>30 年经验)终审。
- 注释者经 AI in Medicine Association 招募,每周例会培训(组织学/Gleason/腺体形态/QuPath)。
- 每张 WSI 由单一学生注释以最大化吞吐;分配用启发式分层防欠覆盖。
- 专家复核投入每周 2-4 小时;访谈口径每张复核 10-15 分钟(原手标需 1-2 小时/张)。
- PANDA 原 GS/ISUP 标签对注释流水线全程屏蔽(防偏设计)。
- 重算分布:GS0 185(33.9%)/GS6 245(44.9%)/GS7 84(15.4%)/GS8 12(2.2%)/GS9 5(0.9%)/GS10 15(2.7%)。
- ISUP 0-5 分布:185/245/31/53/12/20(GS7 3+4 为 31、4+3 为 53)。
- 全数据集 agreement:GS 0.419、ISUP 0.396。
- 未加权 κ:GS 0.263(Table 4)/0.283(正文)双口径;ISUP 0.251。
- 线性 κ:GS 0.624/ISUP 0.364;线性 PABAK 0.396/0.505。
- 二次加权 κ:GS 0.848/ISUP 0.466;二次 PABAK 0.528/0.738。
- 未加权 PABAK 为负:GS −0.162/ISUP −0.209。
- Radboud 子集 agreement GS 0.384;Karolinska 子集 0.688(分布效应所致)。
- 热图:6 张 PANDA 判 GS9/10 的切片被 PANDA-PLUS 判为 GS0(完全分歧)。
- 20 张 GS10/ISUP5 专项:0 张维持 GS9/10;6 张 GS8、2 张 GS7、1 张 GS6、11 张 GS0(无恶性组织)。
- 专项流程:先选疑似分级差>4 分的 20 张,专家盲评初判,学生像素级注释,专家终审。
- 粒度实验(同专家单张):slide 级 GS8 → patch/pixel 级 GS7。
- GP3 占比:像素级 5.5% → 256² patch 10.9% → 512² patch 12.0%。
- Benign 占比:0.6% → 1.7%(近 3 倍);GP4/GP5 各膨胀 1.8 倍。
- patch 级 GS 计算规则:主导 pattern 归类、组织覆盖 >20% 计入、不足为 Ignore。
- 学生系统性偏差:GP3-4 区间偏激进(模糊偏向 GP4)、异形腺体误标恶性。
- 论文:J Pathol Inform. 2025 Dec 30;20:100540,doi:10.1016/j.jpi.2025.100540,开放获取 CC BY-NC-ND。
- 卷期双口径:pathtools.ai/ScienceDirect 列表页写 2026;20:100540(NLM 在线 2025-12-30)。
- 作者 8 人同一机构(BYU 物理与天文系);通讯 Dennis Della Corte;无专项资助声明;写作过程用 ChatGPT/Claude/Grok 润色并声明人工审校。
- 掩码可获取性:学术用途 upon qualified request(邮件+用途描述+机构隶属),请求制无公开直链。
- PANDA-PLUS-Bench:9 WSI(9 患者)、224×224 @20×、8 增强条件 ×3,872=30,976 examples、2.56 GB Parquet、CC BY-4.0、HF
dellacorte/PANDA-PLUS-Bench(gated=false,lastModified 2025-12-16)。 - Bench 规模双口径:HF README “~2,770/条件” vs API 实测 3,872/条件(与论文一致)。
- Bench 七模型:Virchow slide-ID 80.7-81.0%;Virchow2 cross-slide 47.2%;HistoEncoder cross-slide 59.7%+slide-ID 90.3%;全模型 within/cross gap 19.9-26.9 pp;开源 Colab。
- 论文转述 PANDA 外部验证集时写 “Tampere University (United States)”——Tampere University 实在芬兰,论文笔误。
- 组织方宣称(非论文数据):pathtools.ai QWK 0.849(147 张评估集/8,808 腺体轮廓/2026-09-14 复测)与 135,251 注释语料(1,856 slides/9,500 cores)。
- 掩码与 WSI 的逐张对应经重新编号的内部 image number 维护,原 Kaggle 文件名映射由作者侧掌握。
- 流水线每个结构都经学生与专家双重过目(全量终审),非抽检制。
- 20 张专项的入选标准是"PANDA 分级与视觉印象疑似差 >4 分"——结论性质为错误率上界而非随机样本期望。
- 粒度实验中 slide 级目评由专家先做、像素注释后做,学生注释时不知 slide 级初判(防锚定)。
- Bench 评估采用冻结编码器+线性探针范式;slide-ID 精度以 slide_id 为目标变量、cross-slide 以留一切片交叉验证。
- PANDA-PLUS 团队三件套时间线:前作 arXiv:2406.06801(2024)→ 本体论文(2025-12-30 在线)→ Bench 论文(2026-05-28 发表),漏斗式收窄:方法主张→数据底座→评测工具。
术语表(30 条)
| 术语 | 释义 |
|---|---|
| Gleason pattern(GP) | 前列腺腺体形态学分级,1-5 级,5 级分化最差;掩码中 GP3/GP4/GP5 单列,GP1/GP2 归 Benign |
| Gleason score(GS) | 主+次 GP 相加(如 3+4=7);单一 pattern 时自相加(如 3+3=6) |
| ISUP Grade Group | 2014 共识的 1-5 级简化分级(GS6→GG1;GS7 拆 GG2/GG3) |
| WSI | Whole Slide Image,全切片数字扫描图像 |
| 像素级注释 | 每个像素携带类别标签(区别于切片级/patch 级) |
| RGB 掩码 | 用颜色编码类别的像素级标注图,RGB 值与 QuPath 分类一一对应 |
| QuPath | 开源数字病理注释平台,本数据集的注释工具 |
| Ignore* 类 | 掩码中标记背景/非组织区域的排除类 |
| 染色归一化 | Macenko 等方法消除 H&E 染色批次差异的预处理 |
| HED 通道 | 苏木精-伊红-DAB 颜色空间分解,染色扰动增强的基础 |
| 观察者间变异 | 不同病理医生对同一切片给出不同分级的程度 |
| Agreement | 一致率:判定相同的样本占比(po) |
| Cohen’s κ | 扣除随机一致后的一致性系数 |
| PABAK | 先验调整偏差调整 κ = 2·po−1,应对类别偏斜 |
| 线性/二次加权 | 对"差几级"按距离线性/平方加权的 κ 变体 |
| QWK | Quadratic weighted kappa,分级任务常用一致性指标 |
| 热图(混淆矩阵) | 行=PANDA 原分级、列=重算分级的矩阵可视化;偏对角线位置揭示系统性偏移 |
| 完全分歧 | 两套标签在"癌与非癌"层面翻转(如 GS10↔GS0) |
| patch 主导归类 | patch 内占多数的 pattern 作为该 patch 标签——粒度膨胀的机制根源 |
| 特征坍塌(feature collapse) | 模型依赖切片特异伪影而非生物特征的失效模式 |
| slide-ID 精度 | 模型凭 patch 认出"来自哪张切片"的能力,越高伪影编码越强 |
| cross-slide 精度 | 跨切片泛化精度,越高生物信号越强 |
| within-/cross-slide gap | 两者之差,伪影依赖度的直接量度(19.9-26.9 pp) |
| 基础模型 | 大规模自监督预训练的病理图像编码器(Virchow/UNI/Phikon/HistoEncoder 等) |
| HistoEncoder | 前列腺组织特异训练的病理编码器,Bench 七模型中双指标最高 |
| gated dataset | 需登录/申请才能下载的 HF 数据集;Bench 为 gated=false(无门禁) |
| Parquet | 列式存储格式,HF datasets 默认打包格式 |
| 请求制(upon qualified request) | 数据不公开直链、需向作者邮件申请的发放模式 |
| CC BY-NC-ND | 署名-非商业-禁止演绎(论文本体许可) |
| CC BY-4.0 | 署名即可自由使用/修改/再分发(Bench 许可) |
| 穿刺活检(needle-core biopsy) | 细针管取条状前列腺组织的活检方式,PANDA/PANDA-PLUS 的标本类型 |
| 腺体(gland) | 前列腺组织的基本形态学单元,Gleason 分级的判定对象 |
| 筛状结构(cribriform) | 腺体融合成筛网状的形态,GP4 的主要形态之一;本掩码不单设类 |
| 神经周围侵犯(perineural invasion) | 肿瘤沿神经周围生长的征象;本掩码不单独标注 |
| 盲评(blinded grading) | 注释者对既有标签不可见的设计;PANDA-PLUS 全程对注释者屏蔽 PANDA 原标签 |
| 冻结编码器 | 评测中不更新预训练权重、只训练线性头的协议,Bench 采用 |
| 线性探针(linear probe) | 在冻结特征上训练线性分类器以探测表征质量的评测法 |
| 留一交叉验证(LOCO) | 按切片留出测试的交叉验证;Bench cross-slide 精度的计算基础 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | PANDA-PLUS |
| url_name | panda-plus |
| 类型 | 数据集+方法论文+衍生基准(三合一) |
| 论文 | J Pathol Inform 2025;20:100540(NLM 口径) |
| 团队 | BYU 物理与天文系(Della Corte 组) |
| 规模 | 546 WSI(Radboud 480 + Karolinska 66) |
| 许可 | 三层异构(WSI CC BY-NC-SA / 掩码请求制 / Bench CC BY-4.0) |
| 抓取时点 | 2026-09-26 |
| 库内互链 | panda(560)/sicapv2(328)/leopard(636)/reg2026(639)/lizard(238)/nucls(248)/owl(635) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文开放获取+HF dataset card 可索引;但"PANDA-PLUS"名易与 PANDA 混淆,掩码本体无独立发布页 |
| A 可获取性 | 5 | 三层中两层公开直链(WSI/Bench),核心掩码为请求制——最大失分项 |
| I 可互操作 | 7 | Parquet/HF datasets 标准+PNG 掩码+QuPath 兼容;无官方转换脚本到 DICOM/开放格式 |
| M 元数据质量 | 8 | 论文表格完备(分布/统计/协议);正文-表格一处漂移(坑 3)与 README-API 规模漂移(坑 4)微降分 |
| S 可持续性 | 6 | 依托 Kaggle(WSI)与 HF(Bench)平台稳定;掩码发放依赖个人邮箱,单点风险 |
| 综合评级 | 6.6/10(中上) | 方法论与文档质量高于均值;可获取性被请求制拖低,Bench 直链部分补偿 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 546 张 / Radboud 480 / Karolinska 66 | 论文 Table 2/3 | PMC 全文 |
| 0.4862 μm/px / 20× | 论文方法节(Annotations and classifications) | PMC 全文 |
| <1600 px 清洗阈值 | 论文方法节(Annotation mask collection and cleaning) | PMC 全文 |
| agreement 0.419/0.396 | 论文 Table 4 | PMC 全文 |
| 二次 κ 0.848/0.466 | 论文 Table 4 | PMC 全文 |
| 11/20 GS0 专项结果 | 论文结果节(Annotation granularity and high-grade errors) | PMC 全文 |
| GP3 5.5%→10.9%→12.0% | 论文结果节+Fig 6 | PMC 全文 |
| 请求制原文 | 论文 Data availability 节 | PMC 全文 |
| CC BY-NC-ND(论文) | 论文版权声明 | PMC 页脚 |
| Bench 30,976/2.56GB/CC BY-4.0 | HF API dataset_info 实测 | hf-mirror API 2026-09-26 |
| 七模型结果 | AI Med 2026;1(2):14 摘要 | MDPI 页面 |
| QWK 0.849/135,251 | pathtools.ai 主页自述 | 网站抓取 2026-09-26 |
附录 D:数据获取决策树
需求是什么?
├── 只想做基础模型鲁棒性评测
│ └── HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0,直链,30,976 patch)
├── 想训练/评测像素级分割与分级
│ ├── 1) Kaggle 下载 PANDA WSI(公开)
│ ├── 2) 邮件申请掩码(用途+机构隶属)
│ └── 3) 等待期先用 Bench+原 slide 标签搭管线
├── 只想引用"标签噪声"论点
│ └── 引论文 Table 4 + 20 张专项(11/20 GS0),注明坑 3 漂移
└── 想复现三层标注流水线
└── 读论文方法节+附录 F 骨架;无需掩码也可规划内部试点
附录 E:掩码类别映射与使用规范
| 掩码类别 | 语义 | 训练建议 |
|---|---|---|
| Benign | 良性腺体+GP1/GP2(不单列) | 不要当"纯良性"用——内混早期 pattern |
| GP3 | Gleason pattern 3 腺体 | 主导 pattern 计数的基准类 |
| GP4 | Gleason pattern 4 腺体(含融合/筛状形态) | 学生偏差高发区(终审修订最多) |
| GP5 | Gleason pattern 5(含整片连续恶性区) | 粒度自适应区域,非逐腺体 |
| Ignore* | 背景空白/非组织 | 损失计算中应排除 |
附录 F:三层流水线复现骨架(SOP 模板)
阶段 0 资格与培训(周级)
- 招募:pre-med/医学生通道;招募平台与课程记录留档
- 培训:组织学基础/Gleason 系统/腺体形态/工具操作 四模块
- 考核:试标 3-5 张,与专家标注重叠度达标后上岗
阶段 1 L1 初注(张级)
- 单注释者/张;启发式分层分配(覆盖各分级段)
- 原有标签全程屏蔽
阶段 2 L2 复核(张级)
- 清单:腺体覆盖完整性/重叠消除/非组织剔除/粗错纠正
阶段 3 L3 终审(专家)
- 逐腺体确认或改判;每周固定时段(论文口径 2-4 h/周)
阶段 4 出厂
- 掩码导出(零降采样)→ 伪迹清洗(阈值可调)→ 像素计数重算 GS/ISUP
- 与原标签对照表输出(供审计)
附录 G:GS/ISUP 重算算法骨架(代码)
from collections import Counter
def recompute_gs(mask_pixels, ignore_label, min_pattern_px=1600):
"""按像素计数重算 Gleason score(论文口径)。
mask_pixels: 展平的掩码类别序列
ignore_label: Ignore* 编码
min_pattern_px: 清洗阈值(论文 1600 px)
"""
counts = Counter(p for p in mask_pixels if p != ignore_label)
counts = {k: v for k, v in counts.items() if v >= min_pattern_px}
if not counts:
return 0, "GS0/ISUP0" # 无有效 pattern -> 良性/无恶性
ranked = sorted(counts.items(), key=lambda kv: -kv[1])
primary = ranked[0][0] # 主 pattern
secondary = ranked[0][0] if len(ranked) == 1 else ranked[1][0]
gs = primary + secondary # 单一 pattern 自相加(如 3+3=6)
isup = isup_map(primary, secondary) # ISUP 1-5 映射(GS6->1, 3+4->2, 4+3->3, 8->4, 9-10->5)
return gs, isup
附录 H:Bench 加载与评估骨架(代码)
from datasets import load_dataset
import torch
CONDITIONS = ["baseline", "color_jitter", "grayscale", "gaussian_noise",
"heavy_geometric", "combined_aggressive",
"macenko_normalization", "hed_stain_augmentation"]
def eval_model(encoder, head):
"""对 Bench 八条件全量评测,输出 slide-ID 与 cross-slide 精度。"""
acc = {}
for cond in CONDITIONS:
ds = load_dataset("dellacorte/PANDA-PLUS-Bench", split=cond)
feats, labels, slides = [], [], []
for ex in ds:
x = preprocess(ex["image"]) # ImageNet 归一化基线
feats.append(encoder(x)) # 冻结编码器取特征
labels.append(ex["label"]) # 0-3
slides.append(ex["slide_id"]) # 9 个唯一值
acc[cond] = probe_accuracy(feats, labels) # 线性探针
# slide-ID:以 slide_id 为目标再训线性头(越高=伪影越强)
# cross-slide:留一切片交叉验证(越高=生物信号越强)
return acc, slide_id_accuracy(feats, slides), cross_slide_accuracy(feats, labels, slides)
附录 I:统计指标计算公式表
| 指标 | 公式 | 论文取值语境 |
|---|---|---|
| po(观察一致率) | 判定一致数 / N | N=546 |
| pe(期望一致率) | Σ(nk1·nk2)/N² | 按行列边际计算 |
| κ | (po−pe)/(1−pe) | 未加权三档 |
| PABAK | 2·po−1 | 未加权为负的来源 |
| 线性权重 | i−j | |
| 二次权重 | (i−j)² 惩罚 | 严重分歧重罚(QWK 同型) |
附录 J:20 张专项结果总表
| 重审 GS | 张数 | ISUP 对应 | 备注 |
|---|---|---|---|
| 0 | 11 | 0 | 无恶性组织(slide+pixel 双确认) |
| 6 | 1 | 1 | — |
| 7 | 2 | 2-3 | — |
| 8 | 6 | 4 | — |
| 9-10 | 0 | 5 | 零张维持最高级 |
| 合计 | 20 | — | 全部降级 |
附录 K:粒度实验数据总表(单张)
| 项 | slide 级 | patch 256² | patch 512² | pixel 级 |
|---|---|---|---|---|
| GS | 8 | 7 | 7 | 7 |
| GP3 占比 | — | 10.9% | 12.0% | 5.5% |
| Benign 占比 | — | — | 1.7% | 0.6% |
| GP4 膨胀 | — | — | ×1.8 | 基准 |
| GP5 膨胀 | — | — | ×1.8 | 基准 |
附录 L:机构偏斜的校正建议
- 报告指标时按机构分层(Radboud/Karolinska 分列),避免全集均值掩盖分布效应。
- 跨机构实验:按机构加权重采样,或仅用 Radboud 子集(保证内部分布可解释)。
- 高级别研究:承认 GS9/10 仅 20 张,作定性案例而非训练主力。
- 若需平衡样本:回 PANDA 全量做机构分层抽样,用 PANDA-PLUS 只作标签层替换。
附录 M:与库内 PANDA 条目(rid 560)的关系声明
| 维度 | PANDA(rid 560) | PANDA-PLUS(本条目) |
|---|---|---|
| 对象 | 挑战赛本体(12,625 WSI 口径) | 546 张子集的像素级重标注 |
| 标签 | slide 级 GS/ISUP(Kaggle 官方) | 像素级掩码+独立重算分级 |
| 性质 | 挑战赛数据集 | 研究性重标注数据集+审计 |
| 获取 | 公开直链 | 掩码请求制(Bench 公开) |
| 阅读顺序 | 先 560(背景)再本条目(批判视角) | — |
两篇结论不冲突:PANDA 的规模与工程价值不变;本条目补充的是"其切片级标签的可靠性边界"。
附录 N:前列腺 WSI 数据集景观总表(论文 Table 1 全转)
| 数据集 | 年 | WSI | 患者 | 倍率 | 注释层级 | 专家复核 | 来源 |
|---|---|---|---|---|---|---|---|
| SICAPv2 | 2020 | 182 | 95 | 40×→10× | patch+slide | 是 | Valencia 大学临床医院 |
| RINGS | 2021 | 1,500 | 150 | 100× | 像素级(无分级) | 是 | 都灵肿瘤科 |
| PANDA | 2022 口径 | 12,625 | 2,113 | 20×→10× | slide+稀疏 mask | 是 | Radboud+Karolinska+Tampere |
| PCa_Bx_3D | 2022 | 118 | 50 | 0.44 μm/px | 像素级(3D) | 是 | 华盛顿大学(TCIA) |
| CrowdGleason | 2024 | 1,045 | N/S | 40× | patch(众包) | 混合 | 格拉纳达 San Cecilio 医院 |
| DiagSet | 2024 | 5,151 | N/S | 40×→多档 | patch+slide 分层 | 是 | Diagnostyka Consilio |
| PANDA-PLUS | 2025 | 546 | N/S | 20×(0.4862 μm/px) | 像素级 RGB 掩码 | 是(三层流水线) | 派生自 PANDA |
附录 O:许可条款细读(三层+论文)
- WSI 本体:PANDA 挑战赛口径 CC BY-NC-SA——署名+非商业+相同方式共享;向下兼容本条目使用。
- 掩码:论文 Data availability 原文 “available for academic research purposes upon qualified request…include a brief description of the intended research use and institutional affiliation”——学术用途+资格审查+邮件发放;未声明再分发与商用条款,衍生物许可需与作者确认。
- Bench:HF card 标注 CC BY-4.0,gated=false——最宽松一层,署名即可商用/修改/再分发。
- 论文:© 2025 The Authors,open access under CC BY-NC-ND——可自由阅读下载,不可商用/演绎。
- 引用优先级:用数据引数据许可(按层),引用观点引论文(CC BY-NC-ND 只约束论文文本本身)。
附录 P:掩码申请邮件模板(供参考)
Subject: Request for PANDA-PLUS pixel-level annotation masks
Dear Dr. Della Corte,
I am [name], [position] at [institution]. We are working on
[one-sentence research use, e.g., gland-level segmentation model
training and cross-dataset evaluation on public prostate WSIs].
We would like to request access to the PANDA-PLUS pixel-level
annotation masks (546 WSIs) for academic research purposes.
We will not redistribute the masks and will cite the dataset paper
(J Pathol Inform 2025;20:100540) in all outputs.
Thank you for your consideration.
[Institutional affiliation + contact]
附录 Q:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | "PANDA-SICAP"非具名数据集(三轮搜索证伪) | 文献检索/选条 |
| 坑 2 | 论文 2025-12-30 vs 2026 卷期双口径 | 引用/著录 |
| 坑 3 | 未加权 κ 正文 0.283 vs 表 0.263 | 数字抽取 |
| 坑 4 | Bench ~2,770 vs 3,872 每条件 | 管线搭建 |
| 坑 5 | 四资产四许可,掩码再分发条款缺失 | 商用/再分发 |
| 坑 6 | Tampere 被论文误标 United States(实为芬兰) | 转引事实 |
| 坑 7 | QWK 0.849/135,251 为网站宣称非论文数据 | 生态引用 |
| 坑 8 | repo 名 dellacorte(真)/dellacortelab(无);类别仅 0-3 | 复现评测 |
附录 R:检索决策树
你想找什么?
├── "PANDA-PLUS" 本体论文
│ └── doi:10.1016/j.jpi.2025.100540(PMC 全文开放)
├── Bench 数据
│ └── HF dellacorte/PANDA-PLUS-Bench(CC BY-4.0)
├── PANDA 原挑战赛
│ └── 库内 rid 560 条目 + panda.grand-challenge.org
├── 像素级注释竞品
│ └── SICAPv2(rid 328)/CrowdGleason/DiagSet(附录 N)
└── "PANDA-SICAP"?
└── 不存在该具名数据集(坑 1)——你要找的多半是上面四者之一
附录 S:双口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 论文年份 | 2025 Dec 30(NLM/doi 2025) | 2026;20:100540(pathtools/SD 列表页) | 双记,引用按 NLM |
| 2 | 未加权 κ(GS) | 0.263(Table 4) | 0.283(正文) | 按表引用,注漂移 |
| 3 | Bench 每条件规模 | ~2,770(HF README) | 3,872(API/论文摘要) | 按 API/论文 |
| 4 | PANDA 规模 | 12,625(论文 Table 1 转述) | 10,616("用于训练"口径常见于其他文献) | 注明统计口径再引用 |
附录 T:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 掩码公开化 | 团队上线公开直链/Zenodo | 改写 §6、升 AI-Ready 评级、重跑互链 | 1 |
| Bench 第三方评测 | 新论文用 Bench 评测新模型 | §5.2 表扩行 | 2 |
| PANDA 官方回应 | PANDA 团队/GRAND 官方对审计结论表态 | §7.4 追记 | 3 |
| 后续版本 | PANDA-PLUS v2/Bench 扩容 | 更新规模与许可 | 4 |
| 商业化动态 | pathtools.ai 平台正式发布/论文化 | §7.2 升格 | 5 |
附录 U:Bench 八条件全表
| split 名 | 扰动内容 | 考察目标 |
|---|---|---|
| baseline | 仅 ImageNet 归一化 | 参照系 |
| color_jitter | 亮度/对比/饱和/色相 | 通用色彩鲁棒性 |
| grayscale | 完全去色 | 颜色依赖度 |
| gaussian_noise | σ=0.05 加性噪声 | 传感器噪声 |
| heavy_geometric | ±180° 旋转+翻转 | 方向不变性 |
| combined_aggressive | 全增强叠加 | 极端压力 |
| macenko_normalization | Macenko 染色归一化 | 染色域漂移(病理特异) |
| hed_stain_augmentation | H/E 通道扰动 | 染色特异性(病理特异) |
每条件 3,872 examples,八条件共 30,976;features:image(224×224)/label(0-3)/slide_id(9 唯一值)。
附录 V:七模型结果登记表(论文口径)
| 模型 | slide-ID 精度 | cross-slide 精度 | within/cross gap |
|---|---|---|---|
| Virchow | 80.7% | — | — |
| Virchow2 | 81.0% | 47.2% | — |
| UNI | — | — | — |
| UNI2 | — | — | — |
| Phikon | — | — | 26.9 pp(gap 最大档) |
| Phikon-v2 | — | — | — |
| HistoEncoder | 90.3% | 59.7% | 19.9 pp(gap 最小档) |
注:论文摘要只披露上表可见数值,其余格以论文正文/图表为准;条目发布后如正文细读补齐,按附录 T 触发点 2 更新。
附录 W:引文规范
@article{hopson2025pandaplus,
title = {PANDA-PLUS: Improved dataset of prostate whole slide images
from PANDA Challenge with pixel-level expert annotations},
author = {Hopson, Spencer and Mildon, Carson and Kubalek, Corbyn and
Ebbert, Joshua and Vance, Ryan and Laverty, Lauren and
Urie, Paul and Della Corte, Dennis},
journal = {Journal of Pathology Informatics},
volume = {20},
pages = {100540},
year = {2025},
doi = {10.1016/j.jpi.2025.100540}
}
@article{ebbert2026pandaplusbench,
title = {PANDA-PLUS-Bench: A Clinical Benchmark for Evaluating the
Robustness of AI Foundation Models in Prostate Cancer Diagnosis},
author = {Ebbert, Joshua L. and Della Corte, Dennis},
journal = {AI in Medicine},
volume = {1},
number = {2},
pages = {14},
year = {2026},
doi = {10.3390/aimed1020014}
}
附录 X:本条目生产档案
- 生产通道:教训 12 第五次执行("PANDA-SICAP"存在性证伪→改立 PANDA-PLUS)
- 事实研究:WebSearch×6+WebFetch×4+PMC 全文抓取+HF API 实测(hf-mirror 镜像)共约 11 轮
- FACTS.md:writing/panda-plus/FACTS.md 九节
- 成稿方式:五块直写拼接(part1-5),吸取"附录标题吞噬"教训——全程不用 Edit 追加
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- description:成稿时即 ≤170 字符(教训 13 常态化第二次执行)
- 互链计划:新篇正文内链 5 处(PANDA/SICAPv2/LEOPARD/REG²/OWL)+发布后重建家族导航
附录 Y:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI(论文)+HF repo(Bench) |
| F2 富元数据 | ✅ | HF card+论文表格 |
| A1 可访问协议 | ⚠️ | 掩码请求制(邮件),WSI/Bench 为 HTTP 直链 |
| A2 元数据可访问 | ✅ | 即便掩码未发放,元数据始终开放 |
| I1 互操作格式 | ✅ | Parquet/PNG/QuPath |
| I2 词汇表引用 | ✅ | Gleason/ISUP 标准术语 |
| R1 来源溯源 | ✅ | PANDA 派生关系明示 |
| R3 可复现流程 | ✅ | Bench+Colab 开源 |
| AI-Ready 综合 | 中 | 直链覆盖评估任务,训练任务依赖申请 |
附录 Z:缩写速查
| 缩写 | 全称 |
|---|---|
| PANDA | Prostate cANcer graDe Assessment |
| WSI | Whole Slide Image |
| GP / GS | Gleason pattern / Gleason score |
| ISUP | International Society of Urological Pathology |
| PABAK | Prevalence-Adjusted Bias-Adjusted Kappa |
| QWK | Quadratic Weighted Kappa |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| BYU | Brigham Young University |
| HF | HuggingFace |
| L1/L2/L3 | 流水线三层(注释/复核/终审) |
附录 AA:基于本数据集的研究检查清单(12 项)
- 许可核对:你的用途落在哪一层(WSI/Bench/掩码)?掩码用途若超出"academic research"先与作者书面确认。
- 口径声明:引用任何一致性数字时注明权重档(未加权/线性/二次)与来源(表 vs 正文,坑 3)。
- 机构分层:跨机构结论必须分层报告或校正(480:66 偏斜)。
- 类别映射:Benign ≠ 纯良性(内含 GP1/GP2);掩码无早期 pattern 监督。
- Ignore 处理:损失函数排除 Ignore*,且注意 <1600 px 伪迹已被清除(像素计数与你的统计口径一致性)。
- GS 重算复现:主次 pattern 按像素计数取序;单一 pattern 自相加;与附录 G 骨架对照。
- 高级别样本处置:GS9/10 共 20 张——作案例研究,不作训练主力;报告时写明绝对数。
- 与 PANDA 原标签的混用:两套标签不得在同一个监督信号里混贴;审计类研究才做对照。
- Bench 用途边界:只作伪影鲁棒性诊断,不作泛化排名;8 条件全报、别挑条件。
- Bench 规模口径:以 API 3,872/条件为准(坑 4);repo 名 dellacorte(坑 8)。
- 引用完整:数据引本体论文(hopson2025pandaplus),Bench 结论引 Bench 论文(ebbert2026pandaplusbench),图像来源同时引 PANDA。
- 时点存照:论文年份双口径(坑 2)与组织方宣称数字(坑 7)注明抓取/查询时点。
附录 AB:Bench 数据字典(HF Parquet)
| 字段 | 类型 | 取值域 | 语义 |
|---|---|---|---|
| image | Image | 224×224 RGB | 组织 patch(20×) |
| label | int64 | 0=Benign,1=GP3,2=GP4,3=GP5 | |
| slide_id | string | 9 个唯一值 | 切片标识(=患者标识,1 人 1 张) |
splits(8 个,各 3,872 行):baseline / color_jitter / grayscale / gaussian_noise / heavy_geometric / combined_aggressive / macenko_normalization / hed_stain_augmentation。体量:download 2,556,068,549 B ≈ 2.56 GB(dataset_size 2,556,229,215 B)。加载示例见 §5.1 与附录 H。
抽样自检建议:任一 split 的 label 分布应近似覆盖 0-3 全类;slide_id 集合应为 9 个;若 README 口径数字(~2,770)出现在你的自动校验脚本里,改为 API 硬数字(3,872)。
附录 AC:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本体论文 | “PANDA-PLUS” AND (“Gleason” OR “prostate”) AND “pixel-level” | J Pathol Inform 20:100540(PMC/DOI) |
| Bench 数据 | site:huggingface.co PANDA-PLUS-Bench / HF API datasets?search=PANDA-PLUS | dellacorte/PANDA-PLUS-Bench |
| Bench 论文 | “PANDA-PLUS-Bench” OR doi:10.3390/aimed1020014 | MDPI AI Med 1(2):14 |
| 团队谱系 | Della Corte BYU prostate pathology / pathtools.ai science 页 | 前作+商业化+三部曲 |
| 标签噪声论点 | “slide-level labels” AND “Gleason” AND (agreement OR kappa) | 本体论文 §Results 及引用者 |
| 像素级竞品 | SICAPv2 / CrowdGleason / DiagSet / RINGS + prostate | 附录 N 景观 |
| 反例(勿用) | “PANDA-SICAP”(作为数据集名) | 无具名数据集命中(坑 1) |
检索卫生两条:一、凡命中"PANDA-SICAP"字样的论文,读的是跨库评估语境(PANDA 训练+SICAP 测试),不是单一数据集;二、pathtools.ai 页面的数字(QWK/语料规模)随时间滚动更新,引用时存照抓取日期。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-26,抓取与核验时点见附录 A。事实陈述以论文(J Pathol Inform 2025;20:100540)、HF API 实测与 pathtools.ai 官网为源;正文-表格数字漂移、卷期双口径、Tampere 国名笔误等原始文档缺陷已在坑点与附录 S 存照。条目与库内 PANDA(rid 560)、SICAPv2(rid 328)、LEOPARD(rid 636)、REG²(rid 639)等条目互链,构成前列腺病理与计算病理家族的完整检索面。后续维护触发点见附录 T。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
- unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
- wsss4luad — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 肿瘤学
- monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 肿瘤学
- ddti — 共享标签:医学影像 / 图像分类 / 医学图像分割 / 肿瘤学
- acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- palm — 共享标签:医学影像 / 病理图像 / 图像分类 / 医学图像分割
- hyperkvasir — 共享标签:医学影像 / 图像分类 / 医学图像分割 / 评测基准
- ebhi-seg — 共享标签:病理图像 / 图像分类 / 医学图像分割 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

