信息速览

PAIP 2019–2023 — 韩国病理AI平台挑战赛数据集系列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PAIP 2019–2023(Pathology AI Platform Challenge Datasets) |
| 英文全称 | Pathology Artificial Intelligence Platform Grand Challenge Dataset Series (2019/2020/2021/2023) |
| 别名/简称 | PAIP、PAIP 2019、PAIP 2020、PAIP 2021、PAIP 2023、韩国病理AI平台挑战赛 |
| 疾病分类 | 2C12.0 肝细胞癌 / 2B90.Z 结肠恶性肿瘤 / 2C82.Z 前列腺恶性肿瘤 / 2C10.Z 胰恶性肿瘤(另含胆道与肾肿瘤的平台库) |
| SNOMED CT | 25370001 Hepatocellular carcinoma / 363406005 Malignant neoplasm of colon / 399068003 Malignant neoplasm of prostate / 363418001 Malignant neoplasm of pancreas(详见 §2.2) |
| 数据模态 | 全切片数字病理图像 WSI(H&E,SVS)+ 1024×1024 PNG patch(2023)+ XML 区域注释 + 二值/实例掩膜 + CSV 标签 |
| AI 任务类型 | 语义分割、图像分类(MSI-H/MSS)、复合结构检测(PNI)、实例分割(细胞核)、回归(肿瘤负荷/细胞性) |
| 样本总数 | 458 张 WSI(2019: 100 / 2020: 118 / 2021: 240)+ 103 张 1024² patch(2023),约 460 例患者(每例一张切片) |
| 数据大小 | 官方未公布总体积;按 SVS 典型单文件 0.5–3 GB 估算约 200–500 GB(估算值) |
| 数据格式 | SVS(Aperio)/ XML(注释)/ TIF 与 PNG(掩膜)/ CSV、XLSX(标签与 TC 值) |
| 许可证 | CC BY-NC 4.0(PAIP 2023 明确)+ 各届 Data Use and Confidentiality Agreement(DUA,非商业研究、保密、禁止再分发) |
| 访问级别 | 注册后开放(Grand Challenge 注册 + 在线签署 DUA,邮件发放下载链接;2023 需同时注册 wisepaip.org) |
| DUO 标签 | DS, NPUNCU |
| 语言 | 英文(文档与标签) |
| 首发日期 | 2019-04-15(PAIP 2019 首批训练数据) |
| 最后更新 | 2023-02-28(PAIP 2023 测试提交截止) |
| 发布机构 | 首尔大学医院(SNUH)牵头,联合 SNUBH 与 SMG-SNU Boramae 医学中心;韩国保健福祉部资助(KHIDI,grant HI18C0316) |
| 官方主页 | http://wisepaip.org(平台)/ https://paip2019.grand-challenge.org/ 等四届挑战页 |
| 下载地址 | 各届 Grand Challenge 页面签署 DUA 后邮件获取(见 §6.2) |
| DOI | 10.1016/j.media.2020.101854(PAIP 2019 论文)/ 10.1016/j.media.2023.102886(PAIP 2020 论文)/ 10.1186/s12911-021-01466-1(平台论文)/ 10.5281/zenodo.4575424(PAIP 2021 记录) |
| 引用次数 | PAIP 2019 论文 114+(OpenAlex,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 专家级标注 + 官方三划分 + 社区方案丰富;扣分项:测试集 GT 不公开、提交通道基本关闭、WSI 预处理门槛高、单国三中心小样本 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、肝细胞癌/结直肠癌/前列腺癌/胰腺癌的临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(四届文件清单与标注层级)、§5 数据划分策略、§6 预处理 Pipeline(OpenSlide 读取、patch 提取、掩膜解析)和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与首尔大学医院、PAIP 组委会、Grand Challenge 平台无任何商业利益关联。本页面不销售 PAIP 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 PAIP 相关机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PAIP 各届数据需在对应 Grand Challenge 页面签署 Data Use and Confidentiality Agreement(DUA);PAIP 2023 数据在 CC BY-NC 4.0 下发布,禁止商业用途并要求署名。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
PAIP 是韩国保健福祉部资助、首尔大学医院(SNUH)牵头三家机构建设的病理AI数据平台,以及它在 2019–2023 年间举办的四届公开挑战赛所发布的全部数据。四届共包含 458 张专家病理医师标注的 H&E 全切片图像(覆盖肝、结直肠、前列腺、胰腺/胆道四类肿瘤)和 103 张逐实例标注的细胞核 patch。
它的独特地位在于:这是亚洲第一个规模化的病理AI公开挑战赛系列,也是当时极少数由病理医师逐像素标注、并同步发布"区域分割 + 临床标签"双层标注的 WSI 数据集。PAIP 2019 论文发表于 Medical Image Analysis,OpenAlex 引用已超过 114 次(截至 2026-09),引用百分位 97.74。
你可以用它来:在标准 WSI 上复现和比较肿瘤分割算法(U-Net 系多尺度方案)、做弱监督的切片级分子分型(MSI-H)研究、训练多器官通用的神经侵犯检测模型、或者在小样本条件下评估细胞核实例分割与迁移学习方法。
§1.1 摘要
PAIP 项目始于 2018 年韩国保健福祉部"AI 学习数据集建设"专项(Korea Health Technology R&D Project,KHIDI,grant HI18C0316),目标是为病理AI研究者构建高质量、可自由获取的学习数据。切片来自首尔大学医院(SNUH)、首尔大学盆唐医院(SNUBH)与 SMG-SNU Boramae 医学中心 2005–2019 年间组织学确诊的肿瘤切除标本,H&E 染色后经 Leica Aperio AT2(20×/40×,2023 年部分 GT450)扫描为 SVS 全切片图像,全部区域标注由专家病理医师完成,并由大学AI团队提供AI辅助标注支持(Kang et al., BMC Med Inform Decis Mak 2021)。
平台在四届挑战赛中分批释放数据:PAIP 2019(MICCAI 2019)肝癌分割 + 存活肿瘤负荷估计(100 WSI);PAIP 2020(MICCAI 2020)结直肠癌 MSI-H 预测 + 肿瘤区分割(118 WSI,40×);PAIP 2021(MICCAI 2021)多器官神经侵犯检测(240 WSI,4 层标注);PAIP 2023(IEEE ISBI 2023)胰腺/结肠癌肿瘤细胞性评估(103 张 1024² patch,uint16 逐实例细胞核掩膜)。每届均采用 train/validation/test 官方三划分,ground truth 仅训练集公开。平台主体库(wisepaip.org)另含 3,100+ 张六器官标注切片。
§1.2 战略价值分析
数据建设范式维度:PAIP 证明了"国家专项资助 + 教学医院病理科 + 大学AI团队"三方协作可以在两年内建成 3,100+ 张专家标注 WSI 库。其关键工程创新是 AI 辅助标注——先用大学团队训练的模型预标注肿瘤区域、再由病理医师修正,把逐像素标注的成本降到可持续水平(Kang et al. 2021)。这套流程后来被多个国家级医学数据项目参考。
任务设计维度:四届任务精准踩中了计算病理学的四个关键科学问题——PAIP 2019 解决"肿瘤在哪里、活性比例多少"(分割 + 定量);PAIP 2020 是首个把形态学图像与分子基因标签(MSI)绑定发布的挑战赛,让"从 H&E 直接预测分子分型"这一 Kather et al. 2019 开创的方向第一次有了带肿瘤区标注的公开评测台;PAIP 2021 把难度推到"复合结构 + 跨器官泛化"(神经侵犯 = 神经 × 肿瘤的空间共现);PAIP 2023 则聚焦"逐实例计数 + 跨器官迁移"(Task 2 仅 3 张结肠训练图,模拟真实小样本迁移场景)。
生态影响维度:PAIP 系列为东亚病理AI社区提供了与 CAMELYON(荷兰)对标的区域基础设施。PAIP 2019 吸引 231 人下载、28 队提交;PAIP 2020 有 495 人报名、210 人下载、23 队提交,冠军 F1 达 0.9231;两届的 Medical Image Analysis 总结论文系统梳理了 U-Net 多尺度集成、EfficientNet、VGG+RNN 等方案谱系,至今仍是 WSI 方法学论文的标准引用对象。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 标注方式 | 核心差异化 |
|---|---|---|---|---|
| PAIP 2019–2023 | 458 WSI + 103 patch | H&E WSI(20×/40×) | 专家逐像素 + 实例级 + 分子标签 | 四届四任务体系;唯一带肿瘤区标注的 MSI 公开评测 |
| CAMELYON16/17 | 约 1,000 WSI | H&E WSI(40×) | 转移灶像素级标注 | 乳腺前哨淋巴结转移;规模最大、最经典的 WSI 挑战赛 |
| TCGA(病理影像部分) | 约 30,000 WSI | H&E WSI(多扫描仪) | 无区域标注;有分子/临床数据 | 多癌种多组学;MSI 预测研究的主要数据源(无分割 GT) |
| DigestPath 2019 | 约 1,000 张(含 patch) | H&E 结直肠 | 病变区域标注 | 结直肠专科;含筛查场景阴/阳性分类 |
| PanNuke | 约 8,000 patch | H&E 多器官 | 细胞核实例+分类 | 细胞核分割泛化基准,与 PAIP 2023 任务互补 |
PAIP 的不可替代性不在规模,而在三点:标注者资质天花板(全部专家病理医师逐区域标注,非众包)、双层标注设计(区域分割 + 切片级临床/分子标签同步发布,支持级联任务)、跨器官统一标注体系(2021 三器官 PNI、2023 双器官 TC,天然支持泛化研究)。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2018 | 韩国保健福祉部启动 AI 学习数据集专项,PAIP 项目立项(SNUH 牵头) |
| 2019-04-15 | PAIP 2019 首批训练数据发布(肝癌,MICCAI 2019 Grand Challenge) |
| 2019-10 | PAIP 2019 挑战赛收官:28 队提交 64 个结果,Hyun Jung(Frederick National Lab)双任务夺冠(0.7890 / 0.7528) |
| 2019 | wisepaip.org 平台上线,开放 3,100+ 张标注切片库 |
| 2020 | PAIP 2020 举办(结直肠癌 MSI-H 预测,MICCAI 2020):495 人报名、23 队提交 |
| 2021-03 | PAIP 2021 挑战赛描述存档 Zenodo(DOI: 10.5281/zenodo.4575424) |
| 2021-04 | 平台论文发表(Kang et al., BMC Medical Informatics and Decision Making 21:114) |
| 2021-04~10 | PAIP 2021 举办(多器官神经侵犯,MICCAI 2021 endorsed):240 WSI |
| 2021-01 | PAIP 2019 总结论文发表(Kim et al., Medical Image Analysis 67:101854) |
| 2022-12-19 | PAIP 2023 训练集发布(IEEE ISBI 2023 挑战赛) |
| 2023-02-28 | PAIP 2023 测试提交截止;四届系列完结 |
| 2023-10 | PAIP 2020 总结论文发表(Kim et al., Medical Image Analysis 89:102886) |
§1.5 典型 AI 应用场景
- WSI 肿瘤分割基准:PAIP 2019 的 50 张训练 WSI 是 U-Net 系、多尺度集成、结构感知网络(如 SAFS)的标准试验场,验证集 Jaccard 系指标可直接与排行榜历史成绩比较。
- 弱监督分子分型:PAIP 2020 提供了罕见的"肿瘤区标注 + MSI 标签"双标注组合,支持先分割肿瘤、再在肿瘤 patch 上做切片级分子预测的级联 MIL 研究。
- 复合结构与跨器官泛化:PAIP 2021 的三器官 PNI 数据要求模型同时理解神经与肿瘤两类形态,是检验跨器官形态学泛化能力的天然试验台。
- 细胞核实例分割与小样本迁移:PAIP 2023 的 uint16 实例掩膜支持精确的细胞计数管线(分割 + watershed 分离),Task 2(3 张结肠训练图)是迁移学习/域适应方法的极限评测场景。
- 教学与流程演练:四届数据覆盖了 WSI 处理的完整技能栈(OpenSlide 读取、金字塔层级、组织掩膜、patch 提取、掩膜对齐),适合作为计算病理学课程的实训数据。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
PAIP 系列覆盖四类(平台库为六类)实体肿瘤,核心病种到 ICD-11 的映射如下:
| 病种 | ICD-11 编码 | 对应届次 | 说明 |
|---|---|---|---|
| 肝细胞癌(HCC) | 2C12.0 | PAIP 2019 | 约占原发性肝癌 90%;韩国与全球发病率持续上升 |
| 结肠恶性肿瘤(腺癌) | 2B90.Z | PAIP 2020 / 2021 / 2023 | 三届共用器官;2020 聚焦 MSI 分子亚型 |
| 前列腺恶性肿瘤(腺癌) | 2C82.Z | PAIP 2021 | PNI 检测三器官之一 |
| 胰恶性肿瘤(导管腺癌) | 2C10.Z | PAIP 2021 / 2023 | 2021 含胰胆道,2023 聚焦胰腺 TC |
| 肾恶性肿瘤 | 2C90.Z | 平台库(非挑战赛) | wisepaip.org 平台第六类器官 |
为什么编码锚定对 PAIP 尤其重要:PAIP 只提供器官与组织学诊断(organ + histology),不提供任何其他临床病理变量(分期、分级、生存、治疗方案)。做文献对照或队列定义时,必须用 ICD-11/SNOMED CT 编码把"肝细胞癌""结直肠腺癌"等概念显式锚定,避免与 TCGA 等含 ICD-O-3 形态学编码的数据集对接时产生语义漂移(如 ICD-O-3 8170/3 = HCC)。
§2.2 SNOMED CT 映射
| 临床场景 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 肝细胞癌 | 2C12.0 | 25370001 | Hepatocellular carcinoma (disorder) |
| 结肠恶性肿瘤 | 2B90.Z | 363406005 | Malignant neoplasm of colon (disorder) |
| 前列腺恶性肿瘤 | 2C82.Z | 399068003 | Malignant neoplasm of prostate (disorder) |
| 胰恶性肿瘤 | 2C10.Z | 363418001 | Malignant neoplasm of pancreas (disorder) |
| 肿瘤负荷评估 | — | 386432004 | Neoplasm staging (procedure) 相关概念群 |
| 组织病理学检查 | — | 252416005 | Histopathology test (procedure) |
MSI(微卫星不稳定)是分子检测结论而非形态学诊断,无直接 ICD-11 编码;在数据模型中建议作为结肠恶性肿瘤(2B90.Z)的分子亚型属性挂载。
§2.3 疾病简介
PAIP 2019 面向肝细胞癌(HCC):HCC 约占原发性肝癌的 90%,是全球癌症死亡的主要原因之一;1990–2015 年间新诊断 HCC 病例增长约 75%,韩国发病率亦持续上升(PAIP 2019 官方背景)。存活肿瘤负荷(viable tumor burden)= 存活肿瘤面积 / 全肿瘤面积,是评估放化疗反应与基因检测取样代表性的关键指标,病理医师传统上只能用半定量分级估计。
PAIP 2020 面向结直肠癌微卫星不稳定(MSI):MSI 由 DNA 错配修复系统缺陷导致,约 15% 的结直肠癌为 MSI-H。MSI-H 是 II/III 期 CRC 的良好预后因子,预测 II 期患者对氟尿嘧啶辅助化疗无获益、IV 期患者对免疫检查点抑制剂有良好响应。临床指南推荐所有手术切除 CRC 常规检测 MSI,但检测需额外的基因或免疫组化实验,并非所有患者都能获得——这正是"从 H&E 直接预测 MSI"的临床价值锚点。
PAIP 2021 面向神经侵犯(Perineural Invasion, PNI):恶性肿瘤细胞沿神经周围间隙侵袭是多种癌症独立的不良预后因子,美国病理学家学会(CAP)推荐将 PNI 写入恶性肿瘤切除标本的病理报告。小神经的 PNI 在玻片上识别费时费力,且神经形态跨器官一致而肿瘤形态各异,构成独特的跨器官泛化问题。
PAIP 2023 面向肿瘤细胞性(Tumor Cellularity, TC):TC = 肿瘤细胞占全部细胞的比例,是乳腺癌新辅助治疗后残余肿瘤负荷(RCB)等评估体系的核心分量。人工计数不可行、病理医师间一致性差,是自动化定量最刚性的需求场景之一。
§2.4 临床任务定义
| 届次 | AI 任务 | 临床定义 | 官方操作化 |
|---|---|---|---|
| PAIP 2019 Task 1 | 肝癌分割 | 在全切片上勾画肿瘤范围 | 像素级二分类:whole tumor area(最外边界,含肿瘤巢+坏死+包膜) |
| PAIP 2019 Task 2 | 存活肿瘤负荷估计 | 评估治疗反应/取样代表性 | viable tumor area 面积和 ÷ whole tumor area 面积 |
| PAIP 2020 Task 1 | MSI-H 预测 | 分子分型指导化疗/免疫治疗决策 | 切片级二分类:MSI-H(≥2/5 微卫星标志物不稳定)vs MSS |
| PAIP 2020 Task 2 | 肿瘤区分割 | 为 Task 1 提供肿瘤区域 | 像素级分割(用于平分加赛与级联框架) |
| PAIP 2021 | PNI 检测 | CAP 推荐的病理报告要素 | 像素级检测神经-肿瘤侵犯交界(PNI junction) |
| PAIP 2023 Task 1 | 胰腺 TC 预测 | 残余肿瘤负荷定量 | 细胞核实例分割 + TC = 肿瘤细胞核数/总核数 ×100 |
| PAIP 2023 Task 2 | 结肠 TC 预测 | 跨器官迁移能力 | 同上,仅 3 张结肠训练 patch |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 三中心:首尔大学医院(SNUH)、首尔大学盆唐医院(SNUBH)、SMG-SNU Boramae 医学中心(BMC),韩国首尔 |
| 诊断时间 | 2005–2018.06(2019/2020 届);2005.01–2019.06(2021 届);2023 届未单独声明(沿用平台队列) |
| 样本类型 | 手术切除标本为主(2019 官方明确 resection samples);2020 测试集含结肠活检标本 |
| 入组标准 | 组织学确诊的肿瘤病例;病理医师亲自挑选切片,每张至少含约 30% 的肿瘤与正常组织(Kang et al. 2021) |
| 排除规则 | PAIP 2019 排除同一切片内多灶/卫星病灶(避免 whole tumor area 定义争议) |
| 患者数 | 每例患者一张切片(2019/2020/2021 官方说明),四届合计约 460 例 |
| 年龄/性别/分期 | 不公开——PAIP 不提供任何附加临床病理数据(官方数据集页明示) |
| 伦理 | 2013.02 后的人源材料均取得患者捐赠同意(韩国《生命伦理与安全法》);含已故患者(经 SNUH 医疗信息保护局第三方确认) |
人群代表性提示:全部病例来自韩国首尔三家教学医院,种族构成单一(东亚人群),且切片经病理医师"富肿瘤"筛选(≥30% 肿瘤/正常组织),肿瘤占比显著高于常规临床切片分布——这两个因素都会影响模型向常规场景与其他族裔人群的泛化(详见 §7.1/§7.3)。
§2.6 金标准/参考标准
| 届次 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| PAIP 2019 Train | XML 区域注释(whole tumor 黄线 / viable tumor 绿线 / negative pen)→ 算法生成二值 TIF 掩膜 | SNUH 系专家病理医师 | TIF 二值掩膜为 GT;XML 仅供参考;tumor burden 数值由掩膜计算 |
| PAIP 2019 Valid/Test | 同流程产生,但不公开 | 组委会保留 | 仅用于服务器端评测 |
| PAIP 2020 Train | XML 肿瘤区域注释 + CSV 切片级 MSI 分类 | 专家病理医师;MSI 由病理医师按 ≥2/5 标志物判定 | 区域标注 + 分子标签双 GT;弱监督设计(blank area 未剔除) |
| PAIP 2021 Train | XML 4 层注释(无肿瘤神经 / PNI junction / 无神经肿瘤 / 非肿瘤) | 专家病理医师 | PNI junction 为一像素宽线条标注 |
| PAIP 2023 Train | uint16 逐实例 PNG 掩膜(肿瘤/非肿瘤细胞核分开)+ Excel 提供 TC 值与 MPP | 专家病理医师 | 实例级 GT;TC 为 0–100 整数 |
标注一致性说明:PAIP 各届均由多名病理医师参与标注并由AI辅助流程支持,但官方未公布逐案例的多医师一致性指标(如双人标注 Dice)。平台论文(Kang et al. 2021)记录了"AI 预标注 + 医师修正"的混合流程——这意味着掩膜质量高,但严格意义上不是"纯人工独立双人金标准"。
§3 数据集规格
§3.0 版本抉择矩阵
PAIP 四届数据相互独立、任务互不重叠,"选哪届"取决于你的研究问题而非新旧:
| 你的需求 | 推荐届次 | 规模 | 理由 |
|---|---|---|---|
| WSI 肿瘤分割方法学对比(U-Net 系/多尺度) | PAIP 2019 | 100 WSI(50 train) | 双任务设计(分割 + 负荷定量),排行榜与 MedIA 总结论文最完整,可复现性最强 |
| 弱监督切片级分子分型(MSI)/ 级联 MIL | PAIP 2020 | 118 WSI(47 train) | 唯一带肿瘤区标注的 MSI 公开评测;40× 高分辨率;官方弱监督设计自带研究问题 |
| 跨器官形态泛化 / 复合结构检测 | PAIP 2021 | 240 WSI(150 train) | 三器官统一 4 层标注;测试集含无肿瘤阴性对照;规模最大的一届 |
| 细胞核实例分割 / 极限小样本迁移 | PAIP 2023 | 103 patch(53 train) | uint16 实例级掩膜;Task 2 仅 3 张目标域训练图,迁移学习极限场景;PNG patch 免 WSI 管线 |
| 大规模自监督预训练 | 均不适合,改用平台库 | wisepaip.org 3,100+ 张 | 挑战赛集规模小;平台主库提供六器官更大标注池(需单独申请) |
| 临床结局/预后建模 | 均不适合 | — | PAIP 不含任何生存、分期、治疗变量 |
一句话结论:按任务选届次,不按年份选;四届可以合并用于跨器官泛化研究,但必须先做分辨率归一(见 §6.5 坑点 4)。
§3.1 模态详细说明
PAIP 系列包含四种数据形态:
- 全切片图像(WSI):2019/2021 届为 Aperio AT2 ×20(约 0.5 μm/px),2020 届为 ×40(约 0.25 μm/px),2023 届源 WSI 为 AT2 或 GT450。格式为 Aperio SVS(金字塔 TIFF),2021 届原始分辨率约 60,000×60,000 像素。
- XML 区域注释:Aperio ImageScope 兼容格式,封闭多边形区域。2019 届区分 whole tumor / viable tumor / negative pen(NegativeROA=1);2021 届为 4 层结构。
- 掩膜文件:2019 届为 TIF 二值像素掩膜(whole tumor 与 viable tumor 分开,为 GT);2023 届为 uint16 PNG 逐实例掩膜(肿瘤/非肿瘤细胞核分开,每个细胞唯一编号)。
- 表格标签:2019 届 CSV 提供 whole/viable tumor 面积(mm²)与 burden 比值;2020 届 CSV 提供每例 MSI 分类;2023 届 Excel 提供每 patch 的 TC 值(0–100 整数)与 MPP。
§3.2 样本量拆分
| 届次 | 任务 | Train | Validation | Test | 合计 | 备注 |
|---|---|---|---|---|---|---|
| PAIP 2019 | 肝癌分割 + 负荷估计 | 50 WSI | 10 WSI | 40 WSI | 100 WSI | GT 仅 train |
| PAIP 2020 | MSI-H 分类 + 肿瘤分割 | 47 WSI | 31 WSI | 40 WSI | 118 WSI | 40×;MSI 标签仅 train |
| PAIP 2021 | 三器官 PNI 检测 | 150 WSI(50/50/50) | 30(10/10/10) | 60(20/20/20) | 240 WSI | 测试集含无肿瘤病例 |
| PAIP 2023 | 胰腺/结肠 TC 预测 | 53 patch(胰 50 + 结肠 3) | 10(胰) | 40(胰 20 + 结肠 20) | 103 patch | 1024×1024 PNG;结肠无 val |
合计:458 张 WSI + 103 张 patch;每例患者一张切片,约 460 例患者。
§3.3 数据格式详情
| 文件类型 | 格式 | 尺寸/内容 | 说明 |
|---|---|---|---|
| WSI | SVS(Aperio 金字塔 TIFF) | 约 0.5–3 GB/张(估算) | OpenSlide / libvips 读取;含多分辨率层级与宏图、标签图 |
| 区域注释 | XML(ImageScope 兼容) | KB 级 | 封闭多边形顶点坐标;2019 三层语义、2021 四层 |
| 二值掩膜 | TIF | 与 WSI 层级对齐 | 2019 届 GT;由 XML 经组织阈值算法生成 |
| 实例掩膜 | PNG(uint16) | 1024×1024 | 2023 届 GT;每个细胞唯一像素值;肿瘤/非肿瘤分开两张 |
| 标签表 | CSV / XLSX | 每例/每 patch 一行 | 面积、burden、MSI 分类、TC 值、MPP |
§3.4 存储大小
| 内容 | 估算大小 | 依据 |
|---|---|---|
| PAIP 2019(100 WSI,20×) | 约 50–150 GB | 20× SVS 典型 0.5–1.5 GB/张(估算,官方未公布) |
| PAIP 2020(118 WSI,40×) | 约 120–350 GB | 40× 数据量约为 20× 的 4 倍 |
| PAIP 2021(240 WSI,20×) | 约 120–360 GB | 同 2019 口径 |
| PAIP 2023(103 patch + 掩膜) | < 1 GB | 1024² PNG 每张数百 KB |
| 四届合计 | 约 200–500 GB(估算) | 下载前建议预留 1 TB 磁盘(含解压与 patch 中间产物) |
官方从未公布精确体积,上表为按 Aperio SVS 典型压缩率的估算值,请以实际下载为准。
§3.5 标注方式
PAIP 的标注体系为"专家病理医师主导 + AI 辅助"的混合流程(Kang et al. 2021):
- 切片筛选:病理医师亲自挑选切片,确保每张含至少约 30% 肿瘤与正常组织;2019 届额外排除多灶病灶。
- 区域标注:病理医师在 ImageScope 兼容工具中以封闭多边形勾画语义区域(whole tumor / viable tumor / nerve / PNI junction / tumor / non-tumor,各届层级不同)。
- AI 辅助加速:大学AI团队先用模型预标注肿瘤区域,医师修正,显著降低逐像素标注成本(平台论文核心工程贡献)。
- 掩膜生成:2019 届由 XML 经组织掩膜阈值算法(tissue mask 阈值 RGB(235,210,235))生成 TIF 二值掩膜作为 GT;2023 届直接产出 uint16 实例掩膜。
- 分子/定量标签:2020 届 MSI 由病理医师按微卫星标志物检测结果判定(≥2/5 不稳定 = MSI-H);2023 届 TC 值由实例计数导出。
§3.6 标注者资质
| 维度 | 说明 |
|---|---|
| 标注者 | SNUH/SNUBH/BMC 三家机构病理科的专家病理医师(board-certified 级,官方表述 “expert pathologists”) |
| 辅助方 | 韩国多所大学AI团队(UNIST、Korea University、SNU 等)提供预标注模型 |
| 一致性检验 | 官方未公布逐案例双人标注一致性指标;掩膜经"AI 预标注 + 医师修正"流程收敛 |
| 分子标签 | 2020 届 MSI 分类由病理医师依据标准微卫星标志物 panel(D2S123、D5S346、D17S250、BAT25、BAT26)判定 |
§3.7 数据采集时间范围
病理切片诊断时间:2005–2018.06(PAIP 2019/2020)、2005.01–2019.06(PAIP 2021)。数据数字化与标注集中于 2018–2021 年平台一期建设期。各届数据在对应挑战赛举办时一次性冻结发布,此后未做版本迭代。
§3.8 地理覆盖
单国三中心——韩国首尔:SNUH(本院)、SNUBH(盆唐)、SMG-SNU BMC(Boramae)。均为首尔大学医学体系附属教学医院,患者人群以韩国/东亚族裔为主。单国来源是 PAIP 系列最核心的泛化性限制因素(详见 §7.3)。
§3.9 采集设备规格
| 设备 | 型号 | 覆盖届次 | 说明 |
|---|---|---|---|
| 扫描仪 1 | Leica Aperio AT2 | 2019(×20)/ 2020(×40)/ 2021(×20)/ 2023(部分) | 全系列主力扫描仪;SVS 输出 |
| 扫描仪 2 | Leica Aperio GT450 | 2023(部分源 WSI) | 2023 届胰腺/结肠源切片混用 |
| 染色 | H&E(苏木精-伊红) | 全部 | 各机构独立染色流程,存在批次色差 |
| 注释工具 | ImageScope 兼容(XML) | 2019–2021 | 封闭多边形;NegativeROA 语义 |
| 掩膜导出 | 自定义算法 / uint16 PNG | 2019 / 2023 | 见 §3.5 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 临床产生 | 三机构病理科常规诊断流程 | 肿瘤切除/活检标本 → 石蜡包埋 → H&E 染色玻片 |
| 2. 队列筛选 | 病理医师人工挑选 | 组织学确诊肿瘤病例;每张切片 ≥30% 肿瘤/正常组织;2019 届排除多灶 |
| 3. 数字化 | Aperio AT2(20×/40×)/ GT450 | 玻片 → SVS 金字塔;去除全部个人标识 |
| 4. 标注 | 专家病理医师 + AI 辅助 | XML 区域注释 → 二值/实例掩膜;分子检测 → MSI 标签 |
| 5. 伦理与脱敏 | SNUH 医疗信息保护局 | 2013.02 后材料取得捐赠同意;病例号随机重编 |
| 6. 挑战赛发布 | Grand Challenge 平台 | train/val/test 三划分;GT 仅 train 公开;DUA 签署后邮件发放 |
| 7. 学术固化 | Medical Image Analysis / BMC / Zenodo | 2019/2020 届总结论文;2021 届 Zenodo 存档 |
§4 数据结构详解
§4.0 目录结构预览
paip_root/
├── PAIP2019/ # 肝癌(100 WSI,20×)
│ ├── training/
│ │ ├── wsi/ (50 × *.svs) # 原始全切片
│ │ ├── xml/ (50 × *.xml) # ImageScope 区域注释(参考用)
│ │ ├── mask/ (50 × 2 *.tif) # whole tumor / viable tumor 二值掩膜(GT)
│ │ └── tumor_burden.csv # 面积(mm²) 与 viable tumor burden 比值
│ ├── validation/ (10 × *.svs) # 无公开 GT
│ └── test/ (40 × *.svs) # 无公开 GT
├── PAIP2020/ # 结直肠癌 MSI(118 WSI,40×)
│ ├── training/
│ │ ├── wsi/ (47 × *.svs)
│ │ ├── xml/ (47 × *.xml) # 肿瘤区域注释
│ │ └── msi_labels.csv # 每例 MSI-H / MSS
│ ├── validation/ (31 × *.svs)
│ └── test/ (40 × *.svs)
├── PAIP2021/ # 多器官 PNI(240 WSI,20×)
│ ├── training/
│ │ ├── colon/ (50 × *.svs + *.xml)
│ │ ├── prostate/ (50 × *.svs + *.xml)
│ │ └── pancreas/ (50 × *.svs + *.xml) # 4 层 PNI 注释
│ ├── validation/ (30 × *.svs,三器官各 10)
│ └── test/ (60 × *.svs,三器官各 20,含无肿瘤病例)
└── PAIP2023/ # 肿瘤细胞性(103 patch)
├── train/
│ ├── images/ (53 × *.png,1024×1024) # 文件名含器官(p/colon 前缀)
│ ├── masks/ (53 × 2 *_tumor.png / *_nontumor.png,uint16 实例掩膜)
│ └── tc_values.xlsx # TC(0-100) + MPP
├── validation/ (10 × 胰腺 patch,无公开掩膜)
└── test/ (40 × patch:胰 20 + 结肠 20)
注:各届实际目录名以下载包为准,上图为官方数据描述归纳的逻辑结构。
§4.1 DAIMS 标准化字段描述表
PAIP 2019 — tumor_burden.csv 与掩膜语义
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| case_id | string | 脱敏病例号 | “01” | 主键/文件关联 | 无 | 不允许缺失 | 随机重编 |
| whole_tumor_area | float | 全肿瘤面积(mm²) | 245.3 | 分母 | 由掩膜像素×MPP 换算 | 不允许缺失 | >0 |
| viable_tumor_area | float | 存活肿瘤面积合计(mm²) | 180.6 | 分子 | 边界依赖医师勾画 | 不允许缺失 | 0–whole |
| viable_tumor_burden | float | 负荷比值 | 0.736 | Task 2 靶标 | 掩膜派生 | 不允许缺失 | 0–1 |
| mask_whole / mask_viable | TIF | 二值像素掩膜 | 0/1 | Task 1 GT | XML→掩膜算法转换损耗 | NegativeROA=1 区域已剔除 |
PAIP 2020 — msi_labels.csv
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| case_id | string | 脱敏病例号 | “05” | 主键 | 无 | 不允许缺失 | 随机重编 |
| msi_label | string | 切片级 MSI 分类 | “MSI-H” | Task 1 靶标 | 医师按标志物判定;肿瘤内异质性 | 不允许缺失 | MSI-H / MSS |
| xml_annotation | XML | 肿瘤区域多边形 | 封闭区域集 | Task 2 GT / 级联 crop | blank area 未剔除(官方明示) | 非 mask 区必为正常 | 多边形顶点 |
PAIP 2021 — 4 层 XML 注释语义
| 层 | 语义 | 标注形态 | AI 用途 |
|---|---|---|---|
| Layer 1 | 无肿瘤神经(全部神经) | 框内全部神经 | 神经定位监督 |
| Layer 2 | PNI junction | 一像素宽交界线 | 主任务靶标 |
| Layer 3 | 无神经肿瘤 | 区域 | 肿瘤监督 |
| Layer 4 | 非肿瘤无神经 | 区域 | 阴性对照 |
PAIP 2023 — tc_values.xlsx 与实例掩膜
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patch_id | string | patch 文件名(含器官) | “tr_p001” | 主键;器官解析 | 无 | 不允许缺失 | 文件名 |
| tc_value | int | 肿瘤细胞性 | 42 | 回归靶标 | 由实例计数导出 | 不允许缺失 | 0–100 整数 |
| mpp | float | 微米/像素 | 0.250 | 物理尺寸归一 | 0.250/0.500 等 | 不允许缺失 | 0.25–0.502 |
| mask_tumor / mask_nontumor | uint16 PNG | 逐实例核掩膜 | 实例编号 | 分割 GT | 医师逐核勾画 | 背景=0 | 0–65535 |
§4.2 标签分布统计
| 届次/任务 | 分布 | 说明 |
|---|---|---|
| PAIP 2019 viable tumor burden | 连续值 0–1,逐例差异大 | 官方论文指出部分切片负荷估计极具挑战性(坏死/出血干扰) |
| PAIP 2020 MSI-H 占比 | 官方未公布逐类数量 | 流行病学背景:MSI-H 约占 CRC 15%(Lorenzi et al. 2020,官方参考文献);47 例训练集为小样本 |
| PAIP 2021 PNI 阳性像素 | 极端不平衡 | PNI junction 为一像素宽线条,阳性像素占比远低于 1% |
| PAIP 2023 TC 值 | 0–100 整数 | 逐 patch 分布未公开;训练集含 38,000+ 肿瘤核与 37,000+ 非肿瘤核实例(第三方论文统计口径) |
§4.3 关键字段描述性统计
- PAIP 2019:50 张训练 WSI 均含单一肿瘤病灶;whole tumor area 定义含肿瘤巢 + 坏死 + 包膜的最外边界,viable tumor area 要求 ≥10 个相连肿瘤细胞成巢。
- PAIP 2020:47 张训练 WSI 全部带 XML 肿瘤注释与 MSI 标签,是首个"分割 + 分子标签"双标注公开集(MedIA 2023 总结论文)。
- PAIP 2021:150 张训练 WSI 覆盖结肠/前列腺/胰胆道各 50 张,4 层标注逐区域对应。
- PAIP 2023:53 张训练 patch 共 1024×1024 像素,uint16 掩膜逐细胞编号;第三方复现实验从 50 张胰腺图中裁出 626 张子 patch 含 38,502 个肿瘤核实例。
§4.4 数据层级关系
患者(每例 1 张切片,约 460 例)
└─ WSI(458 张,SVS 金字塔:40×/20× → 缩略图多级)
│ ├─ XML 区域注释(封闭多边形,语义分层:2019 三层 / 2021 四层)
│ ├─ 二值/实例掩膜(2019 TIF 区域级;2023 PNG 实例级)
│ └─ 表格标签(burden / MSI / TC + MPP)
└─ patch(2023:1024² PNG,源 WSI 派生,器官信息在文件名)
- 跨届关系:四届病例队列独立(同一器官如结肠在 2020/2021/2023 反复出现,但官方未提供跨届病例关联键,应视为独立样本)。
- WSI 金字塔陷阱:SVS 内含宏图(macro)与标签图(label)层,按 level 遍历时可能误读(见 §6.5 坑点 5)。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 位置 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| 结构性缺失 | 全部临床变量(年龄/性别/分期/生存) | 官方明确不提供 | 无法补全 | 禁止做预后/分层分析 |
| 标签缺失 | val/test 的 GT(全部届次) | 挑战赛评测设计 | GT 由组委会保留 | 自行评估只能用 train 内交叉验证 |
| 区域语义缺失 | PAIP 2020 mask 内 blank area | 官方弱监督设计(“更有挑战性”) | 空白 ≠ 肿瘤也非正常 | 直接全 patch 训练引入标签噪声 |
| 像素缺失 | 2019 negative pen 区域(NegativeROA=1) | 医师指定不分析区 | 已从 GT 掩膜剔除 | 推理时应同步掩蔽 |
| 类别缺失 | PAIP 2023 结肠 validation | 迁移学习设计 | 结肠仅 train 3 / test 20 | 无法做结肠本地调参 |
§5 数据划分与使用建议
§5.1 官方数据划分
四届均提供官方 train/validation/test 三划分(病例级随机、各机构病例混合),ground truth 仅训练集公开:
| 届次 | Train | Val | Test | GT 公开范围 |
|---|---|---|---|---|
| 2019 | 50 | 10 | 40 | 仅 train(掩膜 + burden) |
| 2020 | 47 | 31 | 40 | 仅 train(XML + MSI) |
| 2021 | 150 | 30 | 60 | 仅 train(XML 4 层) |
| 2023 | 53 | 10 | 40 | 仅 train(实例掩膜 + TC) |
挑战赛结束后,提交通道多数已关闭或仅间歇重开(各届页面曾多次公告 “submission re-opened”),无法依赖官方服务器做新评估——这是使用 PAIP 与使用活跃 benchmark 的最大实操差异。
§5.2 推荐划分策略
- 复现历史成绩:严格使用官方 train 训练、train 内再分验证;报告时注明"在官方 train 子集上的内部验证结果,非官方 test 服务器成绩"。
- 病例级交叉验证:47–150 例训练集规模下,推荐 5 折 GroupKFold(按 case_id 分组),每折同时报告分割与下游任务指标。
- 器官分层(2021/2023):按器官分层抽样,并额外做"留一器官"验证(train 两器官 → test 第三器官),直接检验跨器官泛化。
- 分辨率分层(2023):胰腺训练图混有 0.250 与 0.500 mpp 两种放大倍率,划分时按 mpp 分层,避免验证集与训练集分辨率分布不一致。
import pandas as pd
from sklearn.model_selection import GroupKFold
df = pd.read_csv("train_manifest.csv") # 列: case_id, file_path, organ, label
gkf = GroupKFold(n_splits=5)
for fold, (tr, va) in enumerate(gkf.split(df, groups=df["case_id"])):
assert set(df.iloc[tr].case_id) & set(df.iloc[va].case_id) == set()
print(f"fold {fold}: train={len(tr)}, val={len(va)}")
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 同一 WSI 裁出的 patch 分入训练/验证两侧 | 高 | 一切划分按 case_id(WSI 级)分组,patch 继承其父 WSI 的组标签 |
| 2 | 2023 同源 WSI 多 patch 混合(文件名未含 WSI 父级 ID 时) | 中高 | 按文件名前缀与 MPP/器官聚类核对,疑似同源强制同组 |
| 3 | 用 2020 的 XML 肿瘤区做分割监督后又把同一区域 MSI 标签"蒸馏"回 patch 级 | 中 | 明确切片级标签不得直接赋予 patch;用 MIL 聚合而非硬标签 |
| 4 | 染色归一化在划分前对全量数据拟合参数 | 中 | 归一化参考统计仅在训练折内计算 |
§5.4 交叉验证建议
- 标准:5 折病例级 GroupKFold;小样本届次(2020/2023)建议重复 3 次取均值±标准差。
- 跨器官稳健性:2021 三器官 / 2023 双器官做留一器官验证,这是 PAIP 特有的"准外部验证"。
- 跨届迁移:如 2019 肝 → 2021 胰腺的零样本分割测试,可作为域偏移研究设计(注意先统一 20× 分辨率)。
§5.5 外部验证
PAIP 训练的模型,经典外部验证路径:TCGA 对应癌种 WSI(肝 LIHC / 结直肠 COAD-READ / 胰腺 PAAD,注意无区域 GT,只能做切片级或定性评估)、CAMELYON(跨器官泛化的阴性对照)、DigestPath(结直肠跨机构)。MSI 任务可对照 Kather et al. 2019(Nature Medicine)与 Echle et al. 2022 的多队列结果(约 9,000 例、九队列)。
§6 AI 就绪指南
§6.0 云端快速启动
最小可行体验(无需下载 WSI):PAIP 2023 的数据是 1024×1024 PNG patch 而非整切片,全套 < 1 GB,是四届中唯一可以在 Colab 免费 GPU 上 30 分钟内跑通"实例分割 + TC 回归"全流程的一届。建议新手从 2023 届入手熟悉 PAIP 标注体系,再进入 WSI 届次。
WSI 届次云端注意:单张 40× SVS(2020 届)常达 1–3 GB,Colab 磁盘配额紧张——建议按需逐张下载、流式裁 patch、处理后即删;或在本机/服务器挂大磁盘。
# Colab 上安装 WSI 读取依赖(一次性) # !apt-get install -y openslide-tools # !pip install openslide-python import openslide slide = openslide.OpenSlide("train/wsi/case_01.svs") print(slide.level_count, slide.dimensions, slide.properties.get("aperio.MPP"))
§6.1 快速上手(PAIP 2019 分割示例)
# ========================================
# PAIP 2019 快速上手 — PyTorch + OpenSlide 版
# 环境要求: openslide-python, torch, numpy, Pillow, pandas
#
# ⚠️ 目录结构预期:
# 请将下载的数据解压至 ./data/PAIP2019/ 目录,确保以下结构:
# ./data/PAIP2019/
# ├── training/
# │ ├── wsi/ case_01.svs ...
# │ ├── mask/ case_01_whole.tif, case_01_viable.tif ...
# │ └── tumor_burden.csv
# └── validation/ (无 GT)
#
# WSI 与掩膜按 case_id 同名关联;掩膜与 WSI 的某一级金字塔
# 分辨率对齐(官方掩膜由组织阈值算法生成,读取后需与所选
# level 的 dimensions 核对并 resize 对齐,见 §6.5 坑点 5)。
# ========================================
import openslide, numpy as np
from PIL import Image
from torch.utils.data import Dataset
Image.MAX_IMAGE_PIXELS = None # 掩膜 TIF 为大图,需解除 PIL 像素限制
def read_region_pair(svs_path, mask_path, x, y, level, size):
"""按金字塔坐标读取一个 patch 及其掩膜"""
slide = openslide.OpenSlide(svs_path)
mask = Image.open(mask_path)
ds = slide.level_downsamples[level]
img = np.array(slide.read_region((x, y), level, (size, size)).convert("RGB"))
m = np.array(mask.resize((size, size), Image.NEAREST)) > 0
return img, m.astype(np.uint8)
class PaipPatchDataset(Dataset):
"""极简 patch 数据集:坐标列表预先由组织掩膜 + 网格采样生成"""
def __init__(self, pairs): # pairs: [(svs, mask, x, y, level)]
self.pairs = pairs
def __len__(self):
return len(self.pairs)
def __getitem__(self, i):
svs, mask, x, y, lv = self.pairs[i]
img, m = read_region_pair(svs, mask, x, y, lv, 512)
return torch.from_numpy(img).permute(2, 0, 1).float() / 255., \
torch.from_numpy(m)[None].float()
§6.2 数据获取流程
| 届次 | 入口 | 流程 | 备注 |
|---|---|---|---|
| PAIP 2019 | https://paip2019.grand-challenge.org/ | 注册 Grand Challenge → Join → 在线签署 Data Use and Confidentiality Agreement → 邮件发放下载链接 | 数据描述页含掩膜生成算法细节 |
| PAIP 2020 | https://paip2020.grand-challenge.org/ | 同上(DUA Consent 表单) | MSI 标签随训练集 CSV 提供 |
| PAIP 2021 | https://paip2021.grand-challenge.org/ | 同上 | 规则页明确禁止外部数据(ImageNet 预训练除外) |
| PAIP 2023 | https://2023paip.grand-challenge.org/ | 同上 + 需在 wisepaip.org/challenge2023 用同一邮箱注册 | 数据 CC BY-NC 4.0;账号需实名认证 |
| 平台主库 | http://wisepaip.org | 平台注册申请 | 3,100+ 张六器官标注切片,独立于挑战赛 |
DUA 核心义务:仅限声明的研究用途、保密、不得再分发、不得尝试重识别、发表时按要求致谢(2023 届致谢模板含 KHIDI grant HI18C0316)。各届 DUA 独立,换届需重新签署。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开 WSI → patch 的 5 步通用预处理代码(Python,适用于 2019-2021 届)</b></summary>
# 步骤 1:读取 WSI 元信息并选定工作层级
import openslide, numpy as np
from PIL import Image
slide = openslide.OpenSlide("case_01.svs")
mpp = float(slide.properties.get("aperio.MPP", 0.5)) # 20×≈0.5, 40×≈0.25
LEVEL = 2 # 在低分辨率层做组织检测,提速
thumb = np.array(slide.read_region((0, 0), LEVEL, slide.level_dimensions[LEVEL]).convert("RGB"))
# 步骤 2:组织掩膜(H&E 阈值法,与官方 RGB(235,210,235) 思路一致)
def tissue_mask(rgb):
r, g, b = rgb[..., 0], rgb[..., 1], rgb[..., 2]
return (r < 235) | (g < 210) | (b < 235) # 非近白区域视为组织
tmask = tissue_mask(thumb)
# 步骤 3:网格采样 patch 坐标(仅在组织比例 >50% 处)
PATCH, STRIDE = 512, 256
coords = []
ds = slide.level_downsamples[LEVEL]
H, W = tmask.shape
for y in range(0, H - PATCH // 4, STRIDE // 4):
for x in range(0, W - PATCH // 4, STRIDE // 4):
if tmask[y:y + PATCH // 4, x:x + PATCH // 4].mean() > 0.5:
coords.append((int(x * ds), int(y * ds))) # 还原到 level-0 坐标
# 步骤 4:按坐标抽取 patch 与 GT 掩膜(2019 届 TIF 掩膜需先对齐分辨率)
mask_img = Image.open("case_01_whole.tif")
sw, sh = slide.dimensions
mw, mh = mask_img.size
sx, sy = mw / sw, mh / sh # 掩膜与 level-0 的缩放比
def read_patch(x0, y0, size=512):
img = np.array(slide.read_region((x0, y0), 0, (size, size)).convert("RGB"))
m = mask_img.crop((x0 * sx, y0 * sy, (x0 + size) * sx, (y0 + size) * sy))
m = np.array(m.resize((size, size), Image.NEAREST)) > 0
return img, m.astype(np.uint8)
# 步骤 5:染色归一化(仅在训练折内拟合参考统计,防泄漏)
# 推荐 staintools / torchstain 的 Macenko 或 Reinhard 归一化;
# 参考切片从训练折随机选 1 张,统计量固化后应用到全部折。
</details>
2023 届特例:无需 WSI 管线,直接读 PNG;注意 uint16 实例掩膜不能用默认的 plt.imshow 视觉检查(值域 0–65535 显示为全黑),需 mask.astype(np.uint16) 并做实例编号 → 颜色的映射可视化;TC 与 MPP 在 xlsx 中,用 pandas 关联 patch 文件名。
§6.4 框架加载
import torch
from torch.utils.data import DataLoader
import segmentation_models_pytorch as smp
loader = DataLoader(PaipPatchDataset(train_coords), batch_size=8,
shuffle=True, num_workers=4, pin_memory=True)
model = smp.Unet(encoder_name="resnet34", encoder_weights="imagenet",
in_channels=3, classes=1) # 二值分割
loss_fn = smp.losses.JaccardLoss(mode="binary") + smp.losses.DiceLoss(mode="binary")
opt = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-4)
# PAIP 2020 级联 MIL 思路(切片级 MSI 标签)
# 1) 用 XML 肿瘤区 crop patch → 2) 每 patch 提特征 → 3) attention 池化 → 切片级预测
import torch.nn as nn
class AttentionMIL(nn.Module):
def __init__(self, feat_dim=512, n_classes=2):
super().__init__()
self.attn = nn.Sequential(nn.Linear(feat_dim, 128), nn.Tanh(), nn.Linear(128, 1))
self.cls = nn.Linear(feat_dim, n_classes)
def forward(self, feats): # feats: [N, feat_dim] 一张切片的 patch 特征
w = torch.softmax(self.attn(feats), dim=0)
return self.cls((w * feats).sum(0, keepdim=True))
§6.5 常见坑点
⚠️ 坑点 1:测试集 GT 不公开 + 提交通道关闭,"排行榜复现"可能根本做不了(分类:评估误用)
问题:四届全部 ground truth 仅训练集公开,val/test 标签由组委会保留;挑战赛结束后官方评测服务器多数关闭(各届页面曾公告维护或间歇重开)。你无法为今天训练的模型获得官方 test 成绩。
症状:写完论文才发现没有任何官方通道可报告 test 指标;与排行榜历史分数的"比较"实为不同评估口径。
解决:(1) 在官方 train 内做 5 折病例级交叉验证,论文中明确写"内部交叉验证成绩,非官方 test 服务器成绩";(2) 与历史成绩比较时引用 MedIA 总结论文报告的排行榜分数并注明口径差异;(3) 定期查看 grand-challenge 页面公告,验证通道曾多次 “re-opened”。
参考:https://paip2019.grand-challenge.org/Leaderboard ;Kim et al. 2021, MedIA 67:101854。
⚠️ 坑点 2:XML 注释 ≠ ground truth(2019 届)(分类:标签理解)
问题:PAIP 2019 官方明示"XML 文件仅供参考,不是 ground truth"——GT 是由 XML 经组织阈值算法生成的 TIF 二值掩膜;且 XML 中
NegativeROA="1"的 negative pen 区域是医师指定的"不分析区",已从掩膜剔除。症状:直接用 XML 光栅化训练,掩膜边界与官方 GT 系统性偏差;把 negative pen 区域当作正常组织监督,污染标签。
解决:训练与评估一律使用官方 TIF 掩膜;解析 XML 时过滤
NegativeROA="1"的 Annotation;若必须自定义光栅化,复现官方算法(tissue mask 阈值 RGB(235,210,235) + viable 巢 ≥10 相连细胞规则)。参考:https://paip2019.grand-challenge.org/Dataset (“Details of Ground-Truth for the Train Data” 一节)。
⚠️ 坑点 3:PAIP 2020 的弱监督设计——mask 内 blank area 未剔除(分类:标签理解)
问题:官方明确:非 mask 区域必为正常组织,但 mask 内的空白背景(blank area)未被移除——“参赛者需自行处理”。同时 MSI 是切片级标签,mask 内并非所有 patch 都携带 MSI 表型信号。
症状:直接把 mask 内全部 patch 打上切片级 MSI 标签训练,验证集 AUROC 与 F1 大幅波动且偏低;空白 patch(无组织)被当作肿瘤 patch 输入。
解决:(1) 先做组织含量过滤(组织占比 <60–80% 的 patch 丢弃,社区方案常用 60%/80% 双阈值);(2) 用 MIL/attention 池化消化"标签在切片级、信号在 patch 级"的粒度差;(3) 参考冠军思路:先分割肿瘤区,再只在高置信肿瘤 patch 上做 MSI 推理(chhan95/PAIP2020 用 N² 拼图 + 多数投票)。
参考:https://paip2020.grand-challenge.org/Dataset ;https://github.com/chhan95/PAIP2020 ;Kim et al. 2023, MedIA 89:102886。
⚠️ 坑点 4:放大倍率与 MPP 混用(跨届合并训练时必踩)(分类:工程陷阱)
问题:2019/2021 届为 20×(MPP≈0.5),2020 届为 40×(MPP≈0.25),2023 届胰腺 patch 混有 0.250 与 0.500 mpp 两档。跨届合并或跨届迁移时,同一像素尺寸的 patch 物理尺寸差 2 倍。
症状:2020 数据上训练的模型在 2019 数据上性能骤降;2023 届按 patch 文件名合并统计时发现两群特征分布分裂。
解决:(1) 训练前统一降采样到同一 MPP(常用 0.5 或 1.0 μm/px),用
slide.properties["aperio.MPP"]或 2023 届 xlsx 的 MPP 列计算缩放比;(2) 网络输入尺寸按物理尺寸定义(如 256 μm × 256 μm)而非像素数;(3) 2023 届建议先按 MPP 分桶再分别归一化。参考:2023 届官方数据描述(MPP 0.250–0.502,Excel 提供);第三方复现论文(JNTETI 2025)即只取 0.250 mpp 子集统一处理。
⚠️ 坑点 5:SVS 金字塔与掩膜分辨率不对齐(分类:预处理陷阱)
问题:Aperio SVS 内含多个金字塔层级外加宏图(macro)、标签图(label);OpenSlide 的
level_dimensions与 GT 掩膜(TIF/PNG)的分辨率通常都不等于 level-0。按 level 遍历可能把宏图当切片读,掩膜直接按像素坐标对齐会整体偏移。症状:读出的"切片"是带文字标签的小图;patch 与掩膜错位数个像素到数十倍;掩膜 resize 后边界锯齿。
解决:(1) 用
slide.associated_images显式区分宏图/标签图,只用slide.levels主金字塔;(2) 计算掩膜与 level-0 的缩放比sx = mask.width / slide.dimensions[0],坐标系全程用 level-0 并在读取时换算(§6.3 步骤 4 示范);(3) 掩膜 resize 一律Image.NEAREST。参考:OpenSlide Python 文档(associated_images);§6.3 代码。
⚠️ 坑点 6:小样本 + 小测试集 → 并列分数与排行榜过拟合(分类:评估误用)
问题:训练集 47–150 例、测试集 40–60 例。PAIP 2020 总结论文明确承认:小测试集上的二分类(MSI-H/MSS)导致多队分数并列,组委会不得不用 Task 2 分割成绩加赛;验证期允许多次提交,存在对验证集的隐性过拟合。
症状:同一模型两次训练在内部验证上相差 3–5 个百分点;验证集调参后 test 成绩反而下降;与官方榜单差 0.5 分却排名差 5 位。
解决:(1) 重复交叉验证(≥3 次随机种子)报告均值±标准差,不做单次划分结论;(2) 预留从未触碰的 train 内 hold-out 做最终确认;(3) 论文中报告置信区间(bootstrap 1000 次)而非点估计;(4) 对 2023 届这类 patch 级数据,按 WSI 父级做 bootstrap 单位。
参考:Kim et al. 2023, MedIA 89:102886(§5.5 Limitations 明确讨论并列分数问题)。
⚠️ 坑点 7:patch 级划分导致同病例/同切片泄漏(分类:数据泄漏)
问题:从同一 WSI 裁出的 patch 高度相似,按 patch 随机划分会把同源 patch 分入训练与验证两侧;2023 届 patch 文件名只含器官与序号,不显式携带父 WSI 标识。
症状:内部验证 Dice/F1 虚高 5–15%;换一家机构数据立刻崩塌。
解决:(1) 一切划分、交叉验证、bootstrap 都在 case_id(WSI)级进行,patch 继承父级组标签(§5.2 代码);(2) 2023 届按文件名前缀聚类核对疑似同源 patch,强制同组;(3) 验证时按 WSI 聚合指标(先 WSI 内平均再 WSI 间平均)。
参考:§5.3;第三方复现论文均按 patch 所属病例划分(如 Sensors 2024 胰腺癌 AI 综述的 PAIP 2023 章节)。
⚠️ 坑点 8:染色批次效应与颜色归一化的双刃剑(分类:偏倚陷阱)
问题:三家机构独立染色 + 单一扫描仪型号(AT2)+ 2023 届混入 GT450,存在机构级染色偏移;MSI 等分子表型与腺体形态相关,过度归一化可能抹掉与标签相关的真实颜色信息,不归一化又让模型学到"机构指纹"。
症状:模型对训练集内某机构来源切片表现显著更好;做机构分桶评估时 AUROC 差 5%+;归一化后小样本届次(2020)训练不收敛。
解决:(1) 基线实验做"归一化 vs 不归一化"对照组再决策(PAIP 2020 头部队伍两种路线都有);(2) 归一化参考统计只在训练折拟合(防泄漏);(3) 颜色增强(HED 通道 jitter)替代硬归一化,在小样本上通常更稳;(4) 报告机构分桶指标。
参考:Kim et al. 2023(头部方案用 Reinhard/Vahadane/Macenko 归一化 + 颜色 jitter 混合策略);chhan95/PAIP2020(未硬归一化而用 imgaug 颜色增强)。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 旋转 90/180/270° 与翻转(组织无方向先验) | 弹性形变过大(破坏腺体/神经结构拓扑,2021 PNI 任务尤其危险) |
| HED 通道颜色 jitter(模拟染色批次) | 对 MSI 标签 patch 做生成式重染色(可能改变表型相关颜色信息) |
| 小幅缩放/平移/剪切(0.9–1.1 倍) | 跨器官拼接合成(2021 跨器官语义会被破坏) |
| 随机掩蔽 patch 模拟组织缺失 | 对 uint16 实例掩膜做插值缩放(必须用 NEAREST,否则实例编号被污染) |
| Mixup/CutMix(仅切片级分类任务,分割任务慎用) | 对 negative pen / blank area 区域采样监督信号 |
§6.7 模型推荐
| 任务 | 推荐 backbone | 训练策略 | 预期性能参考 |
|---|---|---|---|
| PAIP 2019 分割 | U-Net(ResNet34/50 encoder)+ 多尺度 | patch 512²、Jaccard+Dice 损失、TTA | 验证集 Jaccard 系 score 0.75–0.85(官方排行榜 Top1 0.7890) |
| PAIP 2019 负荷估计 | 分割派生(面积比) | 先分割 viable/whole 再算比值 | 官方 Top1 0.7528 |
| PAIP 2020 MSI 分类 | EfficientNet-b0(patch)+ 注意力/投票聚合 | 级联:先肿瘤分割再高置信 patch 推理 | 官方 Top1 F1 0.9231 |
| PAIP 2021 PNI | 器官特异 CNN 分类 + U-Net 分割两步 | 分类权重迁移到分割 | 社区第 3 名方案(HUFS-AIMLAB)公开复现 |
| PAIP 2023 TC | U-Net + watershed 实例分离 + 计数回归 | 实例分割 → TC = 肿瘤核/总核 | 社区方案(U-Net+ResNet34)可复现 |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 500 GB(单届 WSI) | 2 TB(四届 + patch 中间产物) |
| 内存 | 32 GB | 64–128 GB(40× WSI 多进程裁 patch) |
| GPU | 1 × 12 GB(patch 512²、batch 8) | 1–2 × 24 GB(多尺度/集成/TTA) |
| 训练时间 | 2019 分割基线约 6–12 小时(单卡) | 2020 级联 MIL 约 1–2 天 |
| 入门路径 | PAIP 2023(<1 GB,Colab 免费 GPU 可跑) | 再迁移至 WSI 届次 |
§6.9 评估指标
import numpy as np
def jaccard_score(pred, gt, eps=1e-6):
"""PAIP 2019 分割主指标(Jaccard/IoU),排行榜 score 为其变体"""
inter = (pred & gt).sum()
return (inter + eps) / ((pred | gt).sum() + eps)
def f1_binary(y_true, y_pred):
"""PAIP 2020 MSI-H 分类主指标 F1"""
tp = ((y_pred == 1) & (y_true == 1)).sum()
fp = ((y_pred == 1) & (y_true == 0)).sum()
fn = ((y_pred == 0) & (y_true == 1)).sum()
return 2 * tp / (2 * tp + fp + fn)
def tc_error(tc_pred, tc_gt):
"""PAIP 2023:TC 整数回归,报告 MAE"""
return np.abs(np.asarray(tc_pred) - np.asarray(tc_gt)).mean()
社区共识:分割报 Jaccard/IoU 与 Dice(2019 排行榜 score 为 Jaccard 系变体);MSI 分类报 F1 + AUROC(官方主指标 F1);PNI 报像素级灵敏度与任务 score(官方评测页口径);TC 报 MAE/RMSE 与实例分割的 PQ/AJI(2023 官方以 TC 预测为准)。
§6.10 MLOps 笔记
- 版本锁定:论文方法部分注明届次与下载日期(如 “PAIP 2019, downloaded 2026-XX”);数据自挑战赛结束后冻结,无版本号演进。
- 引用要求:2019 届引 Kim et al. 2021(10.1016/j.media.2020.101854);2020 届引 Kim et al. 2023(10.1016/j.media.2023.102886);平台引 Kang et al. 2021(10.1186/s12911-021-01466-1);2021 届引 Zenodo 记录(10.5281/zenodo.4575424)。
- 致谢模板(2023 届硬性要求):“De-identified pathology images and annotations used in this research were prepared and provided by the Seoul National University Hospital by a grant of the Korea Health Technology R&D Project through the Korea Health Industry Development Institute (KHIDI), funded by the Ministry of Health & Welfare, Republic of Korea (grant number: HI18C0316).”
- 隐私红线:DUA 禁止尝试重识别与再分发;切片虽经脱敏,发表图像仍建议裁掉切片边缘可能的残余标记区。
- 产物管理:patch 中间产物体积常为原始 WSI 的 2–5 倍,建议管道式生成(读 → 裁 → 训练 → 删)而非全量落盘。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单国单族裔偏倚 | 全部病例来自韩国首尔三家 SNU 系教学医院,东亚人群为主 | 高 | 跨洲外部验证(TCGA/CAMELYON);声明适用范围 |
| 选择偏倚(富肿瘤) | 病理医师挑选切片,每张 ≥30% 肿瘤/正常组织 | 中高 | 评估时加入常规分布切片做外部验证;勿把切片级患病率当流行病学估计 |
| 切除标本偏倚 | 以手术切除为主,活检/晚期不可切除病例少(2020 test 含部分活检) | 中 | 与活检队列(如 DigestPath 筛查集)联合评估 |
| 设备/染色批次偏倚 | 单一扫描仪型号(AT2)为主,2023 混入 GT450;三机构独立染色 | 中 | 颜色增强/归一化对照实验;机构分桶报告 |
| 弱监督标签偏倚 | 2020 切片级 MSI 标签 + 肿瘤内异质性;2021 PNI 一像素线标注边界主观 | 中 | MIL 框架;报告校准曲线 |
| 无临床变量 | 年龄、性别、分期、生存全部不公开 | 高(对临床转化) | 仅做形态学研究;预后课题另选 TCGA 等 |
| 小样本统计偏倚 | 训练集 47–150 例,测试集 40–60 例,分数并列与波动显著 | 中高 | 重复交叉验证 + bootstrap 置信区间 |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 区域掩膜(2019/2020/2021) | 高(专家病理医师 + AI 辅助修正) | 官方未公布双人一致性数值 | 非独立双人金标准;边界主观性存在 |
| 实例掩膜(2023) | 高(逐细胞专家勾画) | 未公布 | 仅 53 张训练图,类别仅肿瘤/非肿瘤两级 |
| MSI 分子标签(2020) | 高(标准 5 标志物 panel 判定) | 医师按指南判定 | 切片级粒度;肿瘤内异质性不可见 |
| 面积/负荷数值(2019) | 掩膜派生,可复算 | 算法生成确定 | 依赖掩膜质量与 MPP 标定 |
| TC 值(2023) | 实例计数派生 | 整数 0–100 | 四舍五入损失精度;patch 级而非 WSI 级 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨机构(SNU 系 → 欧美医院) | 中高 | 染色/扫描仪/人群三重偏移;PAIP 2020 论文承认样本池受限于单队列 |
| 跨族裔(东亚 → 其他人群) | 中高 | 肝癌病因谱(HBV 相关比例高)与 CRC 分子谱存在人群差异 |
| 跨器官(2021 设计内) | 中 | 官方即以此为核心挑战:神经形态跨器官一致、肿瘤各异;头部方案采用器官特异模型 |
| 跨放大倍率(20× ↔ 40×) | 中 | 2023 届胰腺混两档 mpp,第三方复现选择单 mpp 子集规避 |
| 跨任务粒度(切片级标签 → patch 级推理) | 高 | 2020 弱监督设计;需 MIL 而非硬标签蒸馏 |
§7.4 伦理考量
- 数据来自真实肿瘤患者,相当部分为已故患者(经 SNUH 医疗信息保护局第三方确认死亡),研究者应保持对患者与家属的尊重。
- 2013.02 后的人源材料均按韩国《生命伦理与安全法》取得患者捐赠同意;全部切片在发布前移除个人标识,DUA 禁止任何重识别尝试。
- 单一东亚人群数据训练的模型直接部署于其他族裔人群前,必须进行独立的公平性与性能验证。
- CC BY-NC 4.0 与 DUA 均禁止商业用途;将模型商业化的机构需另行与 SNUH/PAIP 协商授权。
§7.5 公平性评估
PAIP 不提供年龄、性别等人口学变量,无法做常规人口学公平性分解。可执行的公平性检查是按机构/器官/放大倍率分桶:
import pandas as pd
from sklearn.metrics import roc_auc_score
df = pd.DataFrame({"y": y_true, "p": y_prob, "organ": organs, "mpp": mpps})
for key in ["organ", "mpp"]:
print(df.groupby(key).apply(
lambda g: roc_auc_score(g.y, g.p) if g.y.nunique() > 1 else float("nan")))
已知差异:2023 届不同 MPP 子集特征分布分裂(第三方复现选择单 MPP 子集);2021 届三器官间任务难度不等(PNI 检出难度器官间差异显著,头部方案采用器官特异模型)。
§7.6 数据漂移提示
- 切片诊断时间为 2005–2019 年,期间 H&E 染色、封片与扫描工艺稳定,但病理诊断标准(如 PNI 报告规范、MSI 检测 panel)已有演进;与 2026 年常规切片比对时注意判读标准漂移。
- 监控信号:染色向量分布(HED 通道均值/方差)PSI、patch 级纹理特征 PSI、不同扫描仪(AT2 vs GT450 vs 其他品牌)的分辨率与压缩伪影差异。
- 部署时的最大漂移源通常不是时间而是扫描仪品牌与染色流程——PAIP 全系列以 Aperio 为主,迁移到 Hamamatsu/Philips 切片时必须重校准。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ⚠️ | WSI + 掩膜 + CSV 三件套,需自行对齐为记录级 |
| 2 | 有唯一标识符列 | ✅ | case_id 脱敏病例号贯穿图像/注释/标签 |
| 3 | 无 Unicode 或特殊字符 | ✅ | 文件名与 CSV 为 ASCII |
| 4 | 无重复行 | ✅ | 每例一张切片,官方随机编排 |
| 5 | 缺失值已识别并编码 | ⚠️ | 结构性缺失(全部临床变量)已明示,但无缺失编码体系 |
| 6 | 标签列被明确标识 | ✅ | burden / MSI / PNI 层 / TC 均有明确语义文档 |
| 7 | 已对罕见类别(<3%)进行分组 | ❌ | 2021 PNI 阳性像素 <1% 未做重采样建议;2020 未公布 MSI-H 例数 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 七类偏倚(官方论文亦讨论样本池局限) |
| 9 | 有完整的数据字典 | ⚠️ | 各届 Dataset 页有标注语义说明;无统一机器可读字典 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | 2020 blank area、2019 negative pen 有说明,但分散在各届页面 |
| 11 | 数据采集设备和设置已记录 | ✅ | Aperio AT2 20×/40×、GT450、H&E 完整记录 |
| 12 | 已移除完全共线性变量 | ⚠️ | 未执行(burden 与其分子分母同发) |
| 13 | 对编码的映射标准已说明 | ❌ | 无 ICD/SNOMED 官方映射(本百科 §2 补齐) |
| 14 | 对时间戳的处理已明确说明 | ✅ | 诊断时间范围明确;无时间戳字段 |
| 15 | 训练/验证/测试划分建议已给出 | ✅ | 官方三划分为核心设计 |
| 16 | 数据泄漏风险已被讨论 | ⚠️ | 官方未讨论 patch 级泄漏;本百科 §5.3 补齐 |
| 17 | 标签分布已被分析 | ⚠️ | 官方未公布逐类例数;第三方有 patch 级统计 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 富肿瘤筛选(≥30%)官方明示 |
| 19 | 外部验证建议已给出 | ⚠️ | 官方未给出;本百科 §5.5 补齐 |
| 20 | 数据更新和版本信息已记录 | ⚠️ | 无版本号;冻结于各届挑战赛结束 |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 平台提供 5 个预处理算法(wisepaip.org);无官方训练基线 |
| 22 | 合规使用要求已明确 | ✅ | DUA + CC BY-NC 4.0 + 致谢模板 |
| 23 | 多模态对齐方法已说明 | ❌ | 单模态(仅 H&E 图像 + 派生标签) |
| 24 | 去标识化方法已被记录 | ✅ | 个人标签移除 + 病例号随机重编 + 第三方死亡确认 |
DAIMS 评分:15.5 / 24
评分解读:中等偏上——标注质量与合规文档一流,但规模小、测试 GT 封闭、机器可读字典缺失。
对你意味着什么:PAIP 的 ✅ 项集中在标注者资质(专家病理医师 + AI 辅助流程)、官方三划分、设备记录与合规文档——这在同年代挑战赛数据中属于第一梯队。扣分集中在四件事:(1) 测试集 GT 永久封闭(评估只能在 train 内交叉验证,见坑点 1);(2) 罕见类别未处理(2021 PNI 阳性像素 <1%,需自行设计重采样/损失加权);(3) 无统一数据字典与标准术语映射(本百科 §2/§4 已补齐 ICD-11/SNOMED CT 与 DAIMS 字典);(4) 无官方预处理基线(用 §6.3 管线或平台 5 个算法起步)。训练前建议执行:统一 MPP → 病例级交叉验证 → 颜色增强对照实验 → bootstrap 置信区间报告。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| TCGA + DACHS 等九队列(约 9,000 例) | 多中心(欧/美) | H&E → MSI 预测 | AUROC 约 0.77–0.88(不同队列) | 跨队列波动大 | Echle et al. 2022 大规模多队列证明 MSI 可预测但队列间漂移显著;PAIP 2020 论文以此论证带肿瘤区标注的价值 |
| Kather et al. 2019 胃/结直肠队列 | 德国多中心 | H&E → MSI | AUROC 约 0.77–0.84 | — | PAIP 2020 官方参考文献;奠定"形态 → 分子"范式,但无肿瘤区 GT,随机 patch 训练效率低 |
| PAIP 2019 内跨届迁移(肝 → 2020 结肠分割) | SNU 系 | 肿瘤区分割 | clipped Jaccard 84.22(结构感知网络) | 相对基线 +2–5% | 结构感知/尺度自适应模块跨癌种迁移有效(SAFS, IEEE TMI 2022) |
| 常规分布切片(非富肿瘤筛选) | 任意临床流程 | 肿瘤分割 | 预期灵敏度下降 | 未定量 | 训练分布肿瘤占比 ≥30%,常规切片更低,部署前需重校准阈值 |
约束:本矩阵仅收录有同行评审论文支撑的外部/跨队列评估;社区自报数字不收录。
§8 基准性能与生态
§8.1 排行榜
PAIP 排行榜已随各届挑战赛结束而冻结,以下为官方最终成绩(注意:官方 score 为 Jaccard 系变体与任务加权分,绝对值仅在同届同任务内可比)。
PAIP 2019 Task 1(肝癌分割,官方 Leaderboard,2019-10):
| 排名 | 队伍 | 机构 | Score | 关键技术 | 完整引用 |
|---|---|---|---|---|---|
| 1 | Hyun Jung | Frederick National Laboratory for Cancer Research | 0.788987 | 深度卷积分割 + 多尺度集成 | Kim YJ et al., Med Image Anal 67:101854 (2021). DOI: 10.1016/j.media.2020.101854 |
| 2 | Team Sen | 四川大学 | 0.777215 | U-Net 系多尺度 | 同上 |
| 3 | Team MIRL-IITM | 印度理工马德拉斯 | 0.750333 | 深度分割网络 | 同上 |
| 4 | Team Damo AIC | 阿里云 | 0.671778 | — | 同上 |
| 5 | Team QuIIL | 世宗大学 | 0.665227 | — | 同上 |
PAIP 2019 Task 2(存活肿瘤负荷估计):Hyun Jung 0.752826 夺冠;MIRL-IITM 0.633702、QuIIL 0.633029 分列二三。两任务成绩强相关(官方论文结论)。
PAIP 2020(MSI-H 分类,官方最终成绩):
| 排名 | 方法代表 | 主指标 | 关键技术 | 完整引用 |
|---|---|---|---|---|
| 1 | Nateghi et al. | F1 = 0.9231 | VGG + LSTM:肿瘤 patch 随机序列输入 RNN,置换不变聚合 | Kim K et al., Med Image Anal 89:102886 (2023). DOI: 10.1016/j.media.2023.102886 |
| Top 10 群体 | SUTECH / QuIIL / ETRI-DGRC / David Joon Ho 等 | 多队并列接近 | EfficientNet/UNet 级联分割 + patch 选择/八度卷积/高置信 patch 推理 | 同上 |
PAIP 2021 / 2023:未见联合总结论文与公开完整榜单;社区公开方案(如 HUFS-AIMLAB 第 3 名)经 GitHub 复现。
注意事项:四届 score 口径互不相同(Jaccard 系 / F1 / 任务 score / TC 误差),且测试集 GT 封闭,任何"新模型超过 PAIP 冠军"的声明若未走官方评测通道均不可核验——引用时请回到 MedIA 总结论文的原始表格。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现/对标 WSI 分割 | PAIP 2019 train + U-Net 多尺度 + §6.3 管线 | 排行榜与 MedIA 论文双锚点,可比性最强 |
| 做弱监督分子分型研究 | PAIP 2020 级联 MIL(先分割后分类) | 官方总结证明级联是头部范式;带肿瘤区 GT 是唯一性优势 |
| 研究跨器官泛化 | PAIP 2021 留一器官验证 | 官方即按三器官均衡设计,天然 LOO 轴 |
| 小样本/迁移学习方法验证 | PAIP 2023 Task 2 | 3 张目标域训练图的极限设定,免 WSI 管线 |
| 快速出基线 | PAIP 2023 + segmentation_models_pytorch | <1 GB 数据,Colab 当天出结果 |
§8.3 官方评测协议
各届协议要点(官方规则页):禁止外部训练数据(仅 ImageNet 预训练允许);每人一个账号;验证期多次提交、取最高分,测试期提交后榜单不更新(防过拟合);最终排名在 workshop 公布;top 10 获联合论文署名资格;奖金 1st $1,000 / 2nd $500(2021/2023)。评测指标:2019 为 Jaccard 系 score(两任务),2020 为 F1(MSI 主任务)+ 分割(加赛),2021 为任务 score(评测页口径),2023 为 TC 预测精度。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| wisepaip.org 平台主库 | 母库 | 3,100+ 张六器官标注 WSI,挑战赛数据为其子集 |
| CAMELYON16/17 | 同类 | 乳腺前哨淋巴结转移 WSI 挑战赛,WSI 分割的另一标准锚点 |
| TCGA | 互补 | 多癌种 WSI + 分子/临床数据;MSI 外部验证首选 |
| DigestPath 2019 | 同类 | 结直肠病理挑战赛,跨机构验证路径 |
| PanNuke / MoNuSeg / CoNSeP | 互补 | 细胞核实例分割基准,与 PAIP 2023 任务直接互补 |
| Kather MSI 系列(2019/2022) | 方法前史 | H&E → MSI 的开创与规模化工作,PAIP 2020 官方参考 |
§8.5 关键论文 Top 8
- Kim YJ, Jang H, Lee K, et al. (2021), Medical Image Analysis 67:101854. “PAIP 2019: Liver cancer segmentation challenge.” — PAIP 2019 官方总结,双任务排行榜与 Top 11 方案谱系。DOI: 10.1016/j.media.2020.101854
- Kim K, Lee K, Cho S, et al. (2023), Medical Image Analysis 89:102886. “PAIP 2020: Microsatellite instability prediction in colorectal cancer.” — PAIP 2020 官方总结,首个"分割 + 分子标签"挑战赛;F1 0.9231 冠军方案与并列分数讨论。DOI: 10.1016/j.media.2023.102886
- Kang Y, Kim YJ, Park S, et al. (2021), BMC Medical Informatics and Decision Making 21:114. “Development and operation of a digital platform for sharing pathology image data.” — PAIP 平台建设与 AI 辅助标注流程的权威记录。DOI: 10.1186/s12911-021-01466-1
- Choi J, Lee K, Jeong WK, Chun SY (2021), Zenodo. “PAIP2021: Perineural Invasion in Multiple Organ Cancer (Colon, Prostate, and Pancreatobiliary tract).” — PAIP 2021 挑战赛官方描述存档。DOI: 10.5281/zenodo.4575424
- Kather JN, Pearson AT, Halama N, et al. (2019), Nature Medicine 25:1054-1056. “Deep learning can predict microsatellite instability directly from histology in gastrointestinal cancer.” — 形态 → 分子预测范式开创,PAIP 2020 官方核心参考。
- Echle A, Grabsch HI, Quirke P, et al. (2022), 多队列 MSI 研究(PAIP 2020 论文引用). 约 9,000 例九队列证明大规模 MSI 预测可行——理解 PAIP 2020 科学定位的必读对照。
- Campanella G, Hanna MG, Geneslaw L, et al. (2019), Nature Medicine 25:1301-1309. 弱监督 WSI 临床级分类——PAIP 2020 头部方案的方法学土壤。
- Litjens G, Kooi T, Bejnordi BE, et al. (2017), Medical Image Analysis 42:60-88. “A survey on deep learning in medical image analysis.” — 计算病理深度学习综述基线,PAIP 2019 论文引言锚点。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| PAIP 2019 论文引用 | 114+(OpenAlex,截至 2026-09;FWCI 7.34,引用百分位 97.74) |
| PAIP 2020 论文引用 | 2023-10 发表,引用积累中(数十次量级,截至 2026-09) |
| 平台论文引用 | 11+(Kang et al. 2021,ResearchGate 快照,截至 2026-09) |
| PAIP 2019 参与 | 231 人下载、28 队提交 64 个结果(官方论文) |
| PAIP 2020 参与 | 495 人报名、210 人下载、23 队提交(官方论文) |
| 第三方复现 | Sensors 2024 胰腺影像 AI 综述(PMC11280964)、JNTETI 2025、多篇方法学论文以 PAIP 为基准 |
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| wisepaip.org | 官方平台 | http://wisepaip.org | 持续运营 | 3,100+ 张六器官标注库 + 5 个预处理算法 |
| chhan95/PAIP2020 | 冠军级复现 | https://github.com/chhan95/PAIP2020 | 53 commits | EfficientNet 拼图法 + 分割双任务完整管线,MIT |
| HUFS-AIMLAB/PAIP2021-Challenge | 季军方案 | https://github.com/HUFS-AIMLAB/PAIP2021-Challenge | Docker 可复现 | 器官特异分类 + 分割两步法,文档完整 |
| muqaddas-shafi/PAIP_2023 | 社区方案 | https://github.com/muqaddas-shafi/PAIP_2023 | 活跃 | U-Net+ResNet34 + watershed 计数的 TC 管线 |
| OpenSlide | 工具库 | https://openslide.org | 稳定维护 | SVS 读取事实标准 |
| segmentation_models_pytorch | 工具库 | https://github.com/qubvel-org/segmentation_models.pytorch | 8k+ stars | U-Net 系 + Jaccard/Dice 损失开箱即用,匹配 PAIP 指标 |
| Grand Challenge 平台 | 竞赛平台 | https://grand-challenge.org | 持续运营 | 四届数据入口与历史榜单存档 |
§9 相关资源与引用
官方资源
- 平台主页:http://wisepaip.org
- PAIP 2019:https://paip2019.grand-challenge.org/(数据描述 / 排行榜)
- PAIP 2020:https://paip2020.grand-challenge.org/
- PAIP 2021:https://paip2021.grand-challenge.org/
- PAIP 2023:https://2023paip.grand-challenge.org/
- PAIP 2021 Zenodo 存档:https://doi.org/10.5281/zenodo.4575424
- 许可证:各届 DUA(非商业研究、保密);PAIP 2023 为 CC BY-NC 4.0
BibTeX 引用
% 1) PAIP 2019 官方总结(使用 2019 数据必引)
@article{kim2021paip2019,
title={PAIP 2019: Liver cancer segmentation challenge},
author={Kim, Yoo Jung and Jang, Hyungjoon and Lee, Kyoungbun and Park, Seongkeun and Min, Sung-Gyu and Hong, Choyeon and others},
journal={Medical Image Analysis},
volume={67},
pages={101854},
year={2021},
doi={10.1016/j.media.2020.101854}
}
% 2) PAIP 2020 官方总结(使用 2020 数据必引)
@article{kim2023paip2020,
title={PAIP 2020: Microsatellite instability prediction in colorectal cancer},
author={Kim, Kyungmo and Lee, Kyoungbun and Cho, Sungduk and Kang, Dong Un and Park, Seongkeun and Kang, Yunsook and others},
journal={Medical Image Analysis},
volume={89},
pages={102886},
year={2023},
doi={10.1016/j.media.2023.102886}
}
% 3) PAIP 平台论文(引用平台与数据建设流程)
@article{kang2021paip,
title={Development and operation of a digital platform for sharing pathology image data},
author={Kang, Yunsook and Kim, Yoo Jung and Park, Seongkeun and others},
journal={BMC Medical Informatics and Decision Making},
volume={21},
pages={114},
year={2021},
doi={10.1186/s12911-021-01466-1}
}
% 4) PAIP 2021 挑战赛存档(使用 2021 数据时引用)
@misc{choi2021paip2021,
title={PAIP2021: Perineural Invasion in Multiple Organ Cancer (Colon, Prostate, and Pancreatobiliary tract)},
author={Choi, Jinwook and Lee, Kyoungbun and Jeong, Won-Ki and Chun, Se Young},
year={2021},
doi={10.5281/zenodo.4575424}
}
使用 PAIP 2023 数据时,除引用挑战赛页面外,必须附上官方致谢句(KHIDI grant HI18C0316,全文见 §6.10)。
教程与学习资源
- 各届 Dataset 页的数据描述(含掩膜生成算法、标注层级图):入门 PAIP 标注体系的第一手材料
- chhan95/PAIP2020 README:社区写得最好的级联 MIL 教程
- HUFS-AIMLAB/PAIP2021-Challenge:Docker 化的完整训练-推理复现
- OpenSlide 官方文档与 openslide-python 示例
- Sensors 2024 胰腺影像 AI 综述(PMC11280964)的 PAIP 2023 章节:第三方视角的数据说明
原始论文
- Kim YJ et al. (2021). “PAIP 2019: Liver cancer segmentation challenge.” Medical Image Analysis 67:101854. DOI: 10.1016/j.media.2020.101854. PMID: 33091742.
- Kim K et al. (2023). “PAIP 2020: Microsatellite instability prediction in colorectal cancer.” Medical Image Analysis 89:102886. DOI: 10.1016/j.media.2023.102886. PMID: 37494811.
- Kang Y et al. (2021). “Development and operation of a digital platform for sharing pathology image data.” BMC Medical Informatics and Decision Making 21:114. DOI: 10.1186/s12911-021-01466-1.
- Choi J, Lee K, Jeong WK, Chun SY (2021). “PAIP2021: Perineural Invasion in Multiple Organ Cancer.” Zenodo. DOI: 10.5281/zenodo.4575424.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:四届官方页面、两篇 MedIA 总结论文、平台论文、排行榜、引用快照、社区方案交叉验证 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从四届 Grand Challenge 官方页面、两篇 Medical Image Analysis 总结论文、BMC 平台论文与社区资源中整理结构化信息;(2) 生成 §6 的 OpenSlide/PyTorch 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- PAIP 2019 Grand Challenge 官方页(Home / Dataset / Leaderboard)
- PAIP 2020 Grand Challenge 官方页(Home / Dataset / Rules)
- PAIP 2021 Grand Challenge 官方页(Home / Rules)
- PAIP 2023 Grand Challenge 官方页(2023paip / rules)
- Kim YJ et al. (2021), Medical Image Analysis 67:101854(DOI: 10.1016/j.media.2020.101854)
- Kim K et al. (2023), Medical Image Analysis 89:102886(DOI: 10.1016/j.media.2023.102886,PMID: 37494811)
- Kang Y et al. (2021), BMC Medical Informatics and Decision Making 21:114(DOI: 10.1186/s12911-021-01466-1)
- Choi J et al. (2021), Zenodo 4575424(DOI: 10.5281/zenodo.4575424)
- OpenAlex W3092103057(PAIP 2019 论文引用快照,截至 2026-09)
- GitHub chhan95/PAIP2020(2020 届社区复现方案)
- GitHub HUFS-AIMLAB/PAIP2021-Challenge(2021 届第 3 名方案)
- GitHub muqaddas-shafi/PAIP_2023(2023 届社区方案)
- Sensors 2024 胰腺影像 AI 综述(PMC11280964,PAIP 2023 章节)
- Frederick National Laboratory 新闻稿(PAIP 2019 冠军报道)
- Kather JN et al. (2019), Nature Medicine 25:1054-1056(MSI 范式前史)
- JNTETI Vol.14 No.1 (2025)(PAIP 2023 第三方复现细节)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、四病种临床任务、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(四届规模、划分、设备) | 千方病案医学编辑部 | 与四届官方页面交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与官方数据描述交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与社区方案比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与官方榜单及 OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
