SICAPv2 — 前列腺癌病理图像分级数据集 AI-Ready Wikipedia

182 张 H&E 前列腺穿刺活检 WSI,活检级+像素级 Gleason 双标注

来源 瓦伦西亚理工大学(Universitat Politècnica de València)· Mendeley Data url: https://data.mendeley.com/datasets/9xxm58dvs3发布时间: 2026-09-13最后更新: 2026-09-25 阅读 48
SICAPv2 — 前列腺癌病理图像分级数据集 AI-Ready Wikipedia

信息速览

数据集名称SICAPv2 — 前列腺癌病理图像分级数据集 AI-Ready Wikipedia
数据类型182 张 H&E 活检 WSI,95 名患者,18,783 个 512×512 patch,10,340 个分级 patch,763 个筛状标注 patch,2.03 GB 免费下载
规模95 名患者(155 张穿刺活检)
接入方式瓦伦西亚理工大学(Universitat Politècnica de València)· Mendeley Data url: https://data.mendeley.com/datasets/9xxm58dvs3
AI 就绪度

数据集封面

SICAPv2 — 前列腺癌病理图像 Gleason 分级基准数据集 AI-Ready Wikipedia


INFOBOX

项目 内容
数据集名称 SICAPv2
英文全称 SICAPv2 - Prostate Whole Slide Images with Gleason Grades Annotations
别名/简称 SICAPv2(其前身为 SICAP 数据库,本数据集为其扩展版)
疾病分类(ICD-11) 2C82 前列腺恶性肿瘤
SNOMED CT 399068003(前列腺恶性肿瘤 Malignant tumor of prostate)
数据模态 病理全切片图像(H&E 染色穿刺活检)
AI 任务类型 图像分类(patch 级 Gleason 分级)、活检级 ISUP 评分预测(弱监督/MIL)、筛状结构检测、弱监督分割
样本总数 182 张 WSI(155 张活检,95 名患者);官方发布 18,783 个 512×512 patch,其中 10,340 个具分级标签
数据大小 SICAPv2.zip 2.03 GB(v1)/ 2.01 GB(v2)
数据格式 patch 图像(512×512,10x)+ 像素级标注掩码 + 患者级划分文件 + Excel 标签表
许可证 CC BY 4.0(Creative Commons Attribution 4.0 International)
访问级别 开放(Mendeley Data 直接下载,无需注册申请)
DUO 标签 NRES(无限制使用)、GRU(通用研究使用)
语言 英语(文档、标签表与论文)
首发日期 2020-07-21(Mendeley Data v1)
最后更新 v2 修订版(SICAPv2.zip 2.01 GB,具体日期未公布)
发布机构 瓦伦西亚理工大学(Universitat Politècnica de València);标注医院为瓦伦西亚临床医院(Hospital Clínico Universitario de Valencia)
官方主页 Mendeley Data 数据集页
下载地址 v1 归档(SICAPv2.zip,2.03 GB)
DOI 10.17632/9xxm58dvs3(数据集);10.1016/j.cmpb.2020.105637(论文)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 提供官方患者级 4 折交叉验证划分、独立测试集与 readme 文档,patch/标签/掩码一一对应;扣分项:无端到端预处理脚本,WSI 原图与掩码拼接需自行实现,两个 patch 口径(18,783 与 10,340)需要使用者自行区分
页面状态 published

§0 E-E-A-T 专家审核与免责声明

医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(Gleason 分级系统、前列腺癌病理与 ICD-11/SNOMED 映射)、§7 质量评估与偏倚分析。

数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SICAPv2 以 CC BY 4.0 许可发布,通过 Mendeley Data 平台直接开放下载,无需提交申请或签署数据使用协议,但任何分发或引用均须按 CC BY 4.0 要求注明原始创作者与出处。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? SICAPv2 是一个前列腺癌病理图像数据集,收录了来自 95 名患者的 155 条前列腺穿刺活检组织,经 H&E 染色、数字化扫描后得到 182 张全切片图像(WSI)。它的特别之处在于"双重标注":每张切片既有病理医生给出的整体 Gleason 评分(癌症 aggressiveness 分级,从 3+3 到 5+5),又有像素级的区域标注——哪块组织是良性、哪块是 Gleason 3/4/5 级癌变,甚至连更具侵袭性意义的"筛状结构"都被单独圈了出来。

为什么重要? 在 SICAPv2 出现之前,公开的前列腺病理数据要么只有切片级评分(如 TCGA 的 720 张活检),要么只有小面积组织芯(TMA core)的局部标注(如 Arvaniti 的 886 个 cores),缺少"既看全貌、又看细节"的临床级资源。SICAPv2 以约 2 GB 的体积提供了第一个公开的像素级 Gleason 注释 + 筛状结构标记组合,让分级模型、弱监督分割、多实例学习(MIL)研究都能在同一基准上公平比较。

我能用它做什么? 训练 patch 级 Gleason 四分类模型(非癌/GG3/GG4/GG5);把 patch 预测聚合成活检级 ISUP 五分级(结合 MIL 方法);做筛状结构检测(763 个 GG4 patch 含筛状标注);或研究"标签不精确 + 不完整"条件下的弱监督分割(SegGini 等 MICCAI 工作的标准实验床)。全部数据 CC BY 4.0 开放下载,无需申请。

§1.1 技术摘要

SICAPv2 由西班牙瓦伦西亚理工大学(UPV)与瓦伦西亚临床医院合作构建,是早期 SICAP 数据库的扩展版本,随 Silva-Rodríguez 等人 2020 年发表于 Computer Methods and Programs in Biomedicine 的端到端 Gleason 分级系统论文一同发布(论文 DOI: 10.1016/j.cmpb.2020.105637,arXiv:2105.10490)。穿刺活检样本以 Ventana iScan Coreo 扫描仪在 40x 放大下数字化,计算时统一降采样至 10x 并裁剪为 512×512、50% 重叠的 patch。95 名患者的 155 张活检对应 182 张 WSI,活检级主 Gleason 分级分布为 NC 36 / GG3 40 / GG4 64 / GG5 15(arXiv:2105.10490)。像素级注释由泌尿生殖专家病理医生组以基于 OpenSeadragon 的内部工具绘制,不确定病例经全体共识定标签。官方归档包含 18,783 个 patch、对应掩码、患者级 4 折交叉验证划分与独立测试集、以及 WSI 级评分表 wsi_labels.xlsx(用户整理的官方结构说明)。数据经 Otsu 组织掩码过滤、剔除组织占比低于 20% 与无注释区域后,得到 10,340 个分级 patch,其中 GG4 内 763 个 patch 含筛状区域(Emergent Mind 综述)。

§1.2 战略价值

维度一:标注粒度的稀缺性。 前列腺病理 AI 的核心难点在于 Gleason 分级本质上是"结构级"判断——腺体的形态、排列与融合方式决定了分级,而非单细胞特征。只有像素级(区域级)注释才能支持形态可解释的模型研究。SICAPv2 是首个同时提供像素级 Gleason 注释与筛状结构标记的公共活检 WSI 数据集(论文),直接催生了弱监督分割(SegGini,MICCAI 2021)、混合监督 MIL(Zaffar et al. 2022, arXiv:2206.12798)等一整类研究路线。对于需要"像素证据 + 切片结论"对齐训练的医疗 AI 团队,它至今仍是体积最小、获取成本最低的选择。

维度二:方法学试验床价值。 该数据集刻意保留了真实标注的两个"缺陷":WSI 级评分只记录最差与次差模式(inexact),像素注释覆盖不全(incomplete)。这使它成为研究"不完美监督"的标准试验床——如何在标注预算受限的真实病理科条件下训练可靠模型。同时其单中心、单扫描仪的"受控"属性(Ventana iScan Coreo 一致采集),又使其成为染色归一化与跨域泛化研究的理想源域。数据仅 2.03 GB,单卡环境数小时即可完成一次完整基线训练,非常适合算法迭代与教学。

§1.3 同类数据集横向对比

数据集 规模 模态/标本 标注粒度 筛状标注 获取方式
SICAPv2 182 张 WSI(155 活检/95 患者) H&E 穿刺活检 活检级评分 + 像素级分级掩码 ✅ 首次提供(763 个 GG4 patch) CC BY 4.0 直接下载
TCGA-PRAD 720 张活检切片 H&E 穿刺活检 仅切片级评分 ❌ 开放(GDC 门户)
Arvaniti et al. 886 个 TMA cores H&E 组织芯片 像素级 Gleason 模式 ❌ 学术获取
Gleason19(MICCAI 2019) 331 个 cores H&E 组织芯片 多病理医生标注 ❌ 挑战赛归档

对比数据来源:SICAPv2 论文 §2。TMA core 无法代表真实穿刺活检中异质性混合的形态结构,这是 SICAPv2 论文强调的核心差异化。

选型口径:若你的目标是"切片级评分预测的大规模预训练 + 微调",TCGA-PRAD/PANDA 的体量更合适;若你的目标是"像素级 Gleason 语义学习、筛状结构研究、弱监督方法比较",SICAPv2 是唯一同时满足"活检 WSI + 像素掩码 + 筛状标记"三条件的公开选项。两者互补而非互替——最常见的组合是把 SICAPv2 当作高密度监督源,把更大规模的评分数据当作泛化测试场。

§1.4 版本时间轴

版本 发布日期 归档大小 说明
v1 2020-07-21 SICAPv2.zip 2.03 GB 首发,配合 CMPB 2020 论文;DOI 10.17632/9xxm58dvs3.1
v2 日期未公布 SICAPv2.zip 2.01 GB 修订版;DOI 10.17632/9xxm58dvs3.2

来源:Mendeley Data 版本对比页。两版归档大小差异约 20 MB,社区绝大多数论文引用 v1;正式获取前建议核对 readme 内容是否变更。

§1.5 典型应用场景

  1. patch 级 Gleason 四分类基线:用 10,340 个分级 patch 训练 CNN/ViT 分类器(NC/GG3/GG4/GG5),作为新架构在病理领域的入门基准。
  2. 活检级 ISUP 评分预测(MIL):以 WSI 为"袋"、patch 为"实例",验证注意力 MIL、混合监督等方法,目标是五分类 Grade Group 预测。
  3. 筛状结构检测:利用 763 个含筛状标注的 GG4 patch 训练二分类/检测模型,筛查与不良预后相关的筛状模式。
  4. 弱监督/半监督分割研究:在"inexact + incomplete"标注条件下做像素级 Gleason 分割(SegGini 的标准设定)。
  5. 染色归一化与域泛化教学:单中心单扫描仪的受控采集使其适合作为源域,与 TCGA/PANDA 等多中心数据构造跨域实验。

§2 医学背景

§2.1 ICD-11 编码映射

SICAPv2 的标注对象是前列腺穿刺活检组织中的癌变分级。下表给出数据集标签与 ICD-11 编码的对应关系:

数据集标签 含义 ICD-11 编码 ICD-11 术语
NC 非癌(non-cancerous)组织 N40(良性情形参考) 前列腺增生等良性前列腺疾患
GG3 / GG4 / GG5 Gleason 3/4/5 级癌变 2C82 前列腺恶性肿瘤
G4C(cribriform) GG4 内筛状腺体结构 2C82 前列腺恶性肿瘤(组织学亚型提示)

说明:数据集本身不携带诊断编码,上表为标注语义与 ICD-11 的映射关系。ICD-11 中前列腺恶性肿瘤编码为 2C82;良性前列腺疾患参考 N40。编码信息供检索与分层统计使用,不构成诊断依据。

§2.1b SNOMED CT 映射

数据集标签 ICD-11 SNOMED CT 码 SNOMED 术语
GG3 / GG4 / GG5(癌变) 2C82 399068003 Malignant tumor of prostate(前列腺恶性肿瘤)
NC(非癌) N40(参考) —(良性谱系,未在数据集内细分) —
G4C(筛状结构) 2C82 —(形态学描述词,依附于恶性肿瘤编码) Cribriform pattern(形态学修饰)

说明:SNOMED CT 对前列腺恶性肿瘤的常用编码为 399068003。筛状(cribriform)在 SNOMED 形态学轴中属于腺体生长模式描述,通常不单独编码,而作为恶性肿瘤的形态学修饰。

§2.2 疾病简介与流行病学

前列腺癌是全球男性最常见的恶性肿瘤之一,也是男性癌症相关死亡的主要病因。其组织学诊断建立在 H&E 染色活检的形态学评估之上,核心工具是 Gleason 分级系统:由 Donald Gleason 于 1966 年提出,依据腺体结构分化程度将癌组织分为 1-5 级,并以"最常见级别 + 次常见级别"组合成 Gleason 评分(如 4+3=7)。2014 年国际泌尿病理学会(ISUP)共识引入五级分组(Grade Group 1-5)对评分进行聚合,其中 Grade Group 1 对应 3+3,Grade Group 5 对应 9-10 分,与患者预后单调相关。

对本数据集最关键的两个形态学概念:

  • Gleason 3 级:单个、边界清楚的腺体,分化相对良好;
  • Gleason 4 级:腺体融合、筛状(cribriform)或发育不良结构,其中筛状结构指癌腺体形成含多个腔隙的筛孔样实体,近年研究反复证实其与不良预后和升级风险相关,这也是 SICAPv2 首次将其显式标注的临床动机;
  • Gleason 5 级:几乎失去腺体分化(片状、单个细胞或粉刺样坏死),预后最差。

穿刺活检的分级决策直接影响治疗强度选择(主动监测 vs 根治性手术/放疗),因此自动化分级辅助具有直接的的临床价值。但观察者间变异(尤其 GG3/GG4 边界与筛状识别)是该任务公认的难点,也是算法辅助的切入点。

Gleason 评分与 ISUP Grade Group 的对应关系(SICAPv2 活检级五分级任务的标签语义基础):

ISUP Grade Group Gleason 评分 组织学含义 预后语义
GG1 3+3=6 边界良好的小腺体 主动监测候选
GG2 3+4=7 以 3 级为主、少量 4 级 低-中危
GG3 4+3=7 以 4 级为主(含融合/筛状) 中危,升级风险升高
GG4 4+4=8、3+5=8、5+3=8 广泛融合或少量 5 级 高危
GG5 9-10 大量 5 级成分 最高危

注:SICAPv2 的像素掩码以 NC/G3/G4/G5 四级区域为基础,活检级评分由"最差 + 次差"两个模式组合而成——这正是坑点 2所述 inexact 标签的病理学来源。GG3 与 GG4 的边界(尤其筛状结构的归类)是观察者间变异最集中的区域,也是本数据集将筛状显式标注的价值所在。

§2.3 临床任务定义

任务 临床场景 输入 输出 对应数据集资源
穿刺活检分级(诊断) 病理医师初筛与复核 活检 WSI ISUP Grade Group 1-5(Gleason 评分) wsi_labels.xlsx + patch 序列
区域分级标注(标注辅助) 病理医师勾画癌区 WSI 或 patch 像素级 NC/GG3/GG4/GG5 掩码 masks/
筛状结构筛查(预后提示) 灰区病例升级判断 patch/区域 是否含筛状结构(二分类) 763 个含筛状标注的 GG4 patch
质控与共识仲裁 多医师一致性提升 活检 WSI 共识标签 全体专家共识产出的标签体系

§2.4 患者人群

维度 内容
来源机构 Hospital Clínico Universitario de Valencia(西班牙瓦伦西亚临床医院)
标本类型 前列腺穿刺活检(needle biopsy)
患者数 95 名(均签署知情同意)
活检数 / WSI 数 155 张活检 / 182 张 WSI(部分患者贡献多张活检)
年龄/性别构成 未随数据集公开(均为前列腺穿刺活检患者)
种族/地域构成 未公开;采集于西班牙单一中心
就医类型 泌尿外科穿刺活检路径
标注团队 泌尿生殖(urogenital)专科专家病理医生组,不确定病例全体共识

来源:SICAPv2 论文 §2。人口统计学元数据未随影像分发,做公平性分析时需依赖外部队列。

§2.5 临床价值

SICAPv2 支撑的临床价值链有三层。第一层是分级自动化:活检级 ISUP 分级是治疗决策(主动监测、根治术、放疗)的核心依据,算法预筛可缩短报告周转并提示可疑区域。第二层是形态学可解释性:像素级注释使模型预测能落到"哪些腺体区域支持 GG4 判断"的粒度,配合筛状标注还能给出升级风险提示——筛状结构的存在在近年病理实践中被越来越多地单独报告。第三层是标注经济学:通过在 SICAPv2 上研究弱监督、多实例与半监督方法,可以反推真实病理科在标注预算受限时的最优标注策略(例如"标多少区域才够训出可靠模型"),这类结论可迁移回院内数据管线。

§2.6 金标准参考

划分维度 内容
标注对象 182 张 WSI:活检级组合 Gleason 评分;像素级 Gleason 分级区域
标注方式 人工勾画(基于 OpenSeadragon 的内部标注软件),逐区域绘制 + 筛状结构显式标记
标注者 Hospital Clínico de Valencia 泌尿生殖专科专家病理医生组
一致性机制 疑难/不确定病例不采取投票,而由全体专家讨论达成共识后定标签,以规避观察者间变异进入参考标准
标签性质 WSI 级评分 = Primary + Secondary(只记录最差与次差模式,属 inexact 标签);像素注释不覆盖全部组织(incomplete)
质量锚点 4 折患者级交叉验证划分 + 独立测试集由数据方预先固定,供跨论文公平比较

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
复现 2021-2024 年多数论文结果 v1(DOI …9xxm58dvs3.1) 2.03 GB 社区默认引用 v1,划分文件与论文一致
获取作者可能修正后的数据 v2(DOI …9xxm58dvs3.2) 2.01 GB 修订版;体积略小,建议先 diff readme
追踪数据集引用与许可信息 通用 DOI 10.17632/9xxm58dvs3 — 自动指向最新版

§3.1 模态详情

SICAPv2 为单模态病理影像数据集:H&E 染色的前列腺穿刺活检全切片图像。原始数字化在 Ventana iScan Coreo 扫描仪上以 40x 放大完成,计算处理统一降采样至 10x(像素分辨率约为每像素 1 µm 量级),随后以 50% 重叠滑窗裁剪为 512×512 的 patch。官方发布的 images/ 目录即以该 10x patch 形态分发(共 18,783 张),不包含原始 40x WSI 金字塔文件,这一点在使用时必须与 TCGA/PANDA 等以 20x 为主的数据集区分(论文 §2、官方结构整理)。

§3.2 按层级的样本数

层级 NC GG3 GG4 GG5 合计
活检级(主 Gleason 分级) 36 40 64 15 155
WSI 级 37 60 69 16 182
分级 patch 级 4,417 1,636 3,622 665 10,340

来源:活检级分布见论文;WSI 级与 patch 级分布见 Emergent Mind 对论文数据的整理(预印本 OCR 版本中 GG3 patch 数呈现 1,635,与期刊口径 1,636 相差 1,总数 10,340 为多来源一致口径)。另:GG4 中 763 个 patch 含筛状区域标注。

§3.3 文件格式

内容 格式 说明
patch 图像 常规图像格式(512×512) 10x 分辨率,RGB 三通道
像素级掩码 图像掩码文件 类别编码对应 NC/G3/G4/G5 与筛状标记,编码约定见归档内 readme.txt
WSI 级标签 wsi_labels.xlsx(Excel) 每行一张 WSI 的组合 Gleason 评分
划分文件 文本/列表文件 partition/Test/ 与 partition/Validation/(Val1-Val4 四折)
数据文档 readme.txt 官方目录结构与标签约定说明

注:官方归档以单个 SICAPv2.zip 分发,内部未再嵌套 40x 原始 SVS/TIFF 文件;需要原生 WSI 金字塔的研究需联系作者或改用 patch 拼接回 WSI 的社区做法(见 SegGini 的 create_sicap_data.py)。

§3.4 存储大小

项目 数值
v1 归档(SICAPv2.zip) 2.03 GB
v2 归档(SICAPv2.zip) 2.01 GB
解压后工作区 约 2-2.5 GB(含掩码与划分文件)
训练期建议预留 ≥10 GB(含增强缓存与中间产物)

来源:Mendeley Data v1 页面。

§3.5 标注方式

三层标注全部为人工标注:① 活检级组合 Gleason 评分由病理医生出具;② 像素级 Gleason 分级掩码由专家以内部工具逐区域勾画;③ 筛状结构在 GG4 区域内被单独标记。这是"人工绘制 + 专家共识仲裁"的组合,而非弱监督或自动生成。patch 级训练标签属于派生标签:由像素掩码按 patch 聚合得到,若一个 patch 含多个分级区域则取多数级(majority grade)作为 patch 标签(论文 §2)。

§3.6 标注者资质与一致性

标注由瓦伦西亚临床医院泌尿生殖病理专家完成(论文第一作者单位为 UPV,标注在医院完成)。与多数公开数据集"多标注者投票"不同,SICAPv2 的质量机制是共识优先:当级别判定不确定时,标签由全体专家病理医生共同商定,刻意避免把观察者间分歧引入参考标准。副作用是:数据集不提供逐标注者的一致性统计(如 Cohen’s kappa),使用者无法直接量化标签噪声,只能把标签视为"共识金标准"。

§3.7 采集周期

论文未公开活检的具体采集起止年份;数据集于 2020-07-21 在 Mendeley Data 首发(v1 页面)。temporalCoverage 因此无法精确给出,引用时建议以"2020 年前采集、2020 年发布"表述。

§3.8 地域覆盖

单一中心:西班牙瓦伦西亚 Hospital Clínico Universitario de Valencia。无多中心、多国家样本。

§3.9 设备规格

项目 规格
扫描仪 Ventana iScan Coreo
采集放大倍率 40x
计算用分辨率 10x(降采样)
patch 尺寸/重叠 512×512 / 50%
组织过滤 Otsu 阈值组织掩码;组织占比 <20% 的 patch 剔除

来源:论文 §2。

§3.10 深度溯源链

患者(95 名,知情同意)→ 穿刺活检标本(155 条)→ 组织切片 H&E 染色 → Ventana iScan Coreo 40x 数字化(182 张 WSI)→ 降采样至 10x → 专家病理医生标注(评分 + 像素掩码 + 筛状标记)→ Otsu 组织过滤 + 50% 重叠滑窗 → 官方 patch 集(18,783 张)与划分文件 → Mendeley Data 归档(2020-07-21,CC BY 4.0)→ 本条目(千方病案医数集,2026-09-05 审核)。


§4 数据结构

§4.0 目录树

官方归档 SICAPv2.zip 解压后的结构如下(依据社区整理的官方结构):

SICAPv2/
├── images/                 # 18,783 张 512×512 patch 图像(10x,50% 重叠滑窗裁剪)
│   ├── 16e01b71a267408aa0c8ec8eeaac4d9b-000.png   # 文件名模式示意:WSI_ID-patch 序号
│   ├── 16e01b71a267408aa0c8ec8eeaac4d9b-001.png
│   └── ...
├── masks/                  # 与 images/ 一一对应的像素级标注掩码
│   ├── 16e01b71a267408aa0c8ec8eeaac4d9b-000.png
│   └── ...
├── partition/
│   ├── Test/               # 独立测试集划分文件(patch 路径列表)
│   └── Validation/
│       ├── Val1.txt        # 4 折患者级交叉验证
│       ├── Val2.txt
│       ├── Val3.txt
│       └── Val4.txt
├── wsi_labels.xlsx         # 每张 WSI 的组合 Gleason 评分(Primary + Secondary)
└── readme.txt              # 官方目录、标签与类别编码说明

注:上表文件名为示意性命名模式,实际命名以归档内 readme.txt 为准;images/ 与 masks/ 按同名文件一一对应,partition/ 内的划分文件按 patch 路径逐行列出。

§4.1 DAIMS 字段字典

字段/文件 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
images/* 图像 512×512 RGB patch,10x 512×512 uint8 分类/分割输入 滑窗重叠导致的样本相关 — H&E 染色组织图
masks/* 图像 与 patch 同尺寸的像素级掩码 512×512 分割监督、patch 标签派生 未标注区≠良性(incomplete) 未着色区域=无注释 类别编码见 readme
掩码类别 NC 标签 非癌组织区域 — 四分类类别 0 共识标注 — 像素集
掩码类别 G3 标签 Gleason 3 级区域 — 四分类类别 1 GG3/GG4 边界存在医师分歧空间 — 像素集
掩码类别 G4 标签 Gleason 4 级区域 — 四分类类别 2 含筛状子结构 — 像素集
掩码类别 G5 标签 Gleason 5 级区域 — 四分类类别 3 样本最少 — 像素集
筛状标记(G4C) 标签 GG4 内筛状腺体区域 — 筛状检测/第 5 标签 仅在 GG4 上定义 — 像素集
wsi_labels.xlsx: WSI_ID 字符串 全切片标识 16e01b... 聚合键/分组键 — — 182 个唯一值
wsi_labels.xlsx: Gleason_Score 整数/字符串 组合评分(Primary+Secondary) 7(4+3) 活检级五分类回归目标 inexact(仅最差+次差模式) — 6-10 或 NC
partition/Test/* 文本 独立测试集 patch 路径列表 — 固定测试划分 — — patch 路径
partition/Validation/Val{1-4} 文本 4 折患者级交叉验证划分 — 防泄漏划分 — — patch 路径
readme.txt 文本 官方结构/编码说明 — 掩码解码依据 — — —

字段语义综合自官方结构整理、论文与 SegGini 对标签性质的刻画。

§4.2 标签分布

patch 级(分级训练集,共 10,340):NC 4,417(42.7%)/ GG3 1,636(15.8%)/ GG4 3,622(35.0%)/ GG5 665(6.4%);GG4 内含筛状标注 763 个(占 GG4 的 21.1%,占全部分级 patch 的 7.4%)。活检级(主分级,共 155):NC 36(23.2%)/ GG3 40(25.8%)/ GG4 64(41.3%)/ GG5 15(9.7%)。WSI 级(共 182):NC 37 / GG3 60 / GG4 69 / GG5 16。

来源:Emergent Mind 数据整理、论文。百分比为按上述计数换算。

分布的三个含义:① NC 与 GG4 合计占分级 patch 的近八成,“良性 vs 癌"的粗二分很容易取得高分,真正考验模型的是 GG3/GG4/GG5 细分级;② GG5 的稀缺(patch 6.4%、活检 15 条)决定了任何"按级报告灵敏度"的评估都必须在患者级划分下做,否则单折结果会被个别 GG5 活检的归属左右;③ 筛状标注只存在于 GG4 内(763 个 patch),因此筛状检测任务天然是"GG4 内部二分类”,不要把 NC/GG3 patch 混入筛状负样本。

§4.3 关键统计

统计项 数值
患者数 95
活检数 155
WSI 数 182(平均每患者约 1.63 张活检、每活检约 1.17 张 WSI)
官方 patch 总数 18,783(512×512,10x)
分级 patch 数 10,340
含筛状标注 patch 763
每张 WSI 平均 patch 数(MIL 研究口径) 约 129(256×256 重裁剪口径,见 arXiv:2206.12798)
归档大小 2.03 GB(v1)

§4.4 数据层级

患者(patient,n=95,ID 未随数据分发,仅隐含于 WSI 命名)
 └── 穿刺活检(biopsy,n=155)
      └── 全切片图像(WSI,n=182;活检级评分挂载于此层 wsi_labels.xlsx)
           └── patch(n=18,783;50% 重叠滑窗,掩码一一对应)
                └── 像素(NC/G3/G4/G5/G4C 区域标注)

注意:数据集不直接提供患者 ID 字段。患者级分组信息隐含在官方 partition/ 划分文件中(同一患者的 patch 不会跨折),自行重划分时若忽略此层级即造成泄漏(见坑点 1)。

§4.5 缺失值与信息性缺失

现象 位置 解释 处理建议
掩码未着色区域 masks/ 内任意 patch 病理医生未勾画的组织,不等于良性 分割训练视为背景或忽略标签,切勿当 NC 监督
无掩码 patch images/ 中存在 未被注释的 patch(癌性活检中无注释者已在论文口径中剔除,但 18,783 全集含无分级标签 patch) 分级任务用 partition/ 文件过滤;全集可用于自监督
人口学元数据缺失 整个数据集 年龄/性别/种族未随影像分发 公平性分析需外部数据支撑
患者显式 ID 缺失 整个数据集 未提供独立患者字段 以官方划分文件为准,勿自行拼组

§5 数据划分与使用建议

§5.1 官方划分

官方 partition/ 提供两类划分:独立测试集(Test/)与患者级 4 折交叉验证(Validation/Val1-Val4)。划分以 patch 路径列表形式给出,且保证患者级隔离——同一患者的 patch 不会同时出现在训练与验证/测试中。这是论文与其后续工作的标准比较协议(官方结构整理)。

§5.2 社区惯例划分

不同研究因任务不同形成了两种常见口径:① patch 四分类直接使用官方 4 折 + 独立测试集;② WSI 级 MIL/五分级研究多采用患者级训练:验证:测试 = 60:15:25 或 4 折 CV + 独立测试集(如 Zaffar et al. 2022 的混合监督 MIL 设定,155 张 WSI、10x、每 WSI 平均约 129 个 patch)。另有研究将 patch 重裁剪为 256×256(如 SegGini 拼接回 WSI 后重建)或按 80:20 重划分(Emergent Mind 综述)——各论文数值因此普遍不可直接比较。

§5.3 泄漏风险清单

  • 滑窗重叠泄漏(高危):50% 重叠意味着相邻 patch 共享一半组织。任何随机按 patch 划分都会让"几乎相同的图"分属训练与测试。必须使用官方患者级划分。
  • 患者级泄漏(高危):多张活检可能来自同一患者,按 WSI 划分同样泄漏。官方划分已按患者隔离,自建划分必须恢复患者分组。
  • 归一化统计泄漏(中危):对全数据集计算染色归一化参数或均值方差后再划分,会把测试分布信息带入训练。归一化参数只能在训练折内估计。
  • 阈值/预处理泄漏(中危):组织过滤阈值(如 20% 组织占比)若在全集上调参,同样引入测试信息。

§5.4 交叉验证建议

分级 patch 分类:固定官方 4 折划分,报告 4 折均值±标准差 + 独立测试集单次结果;不要在 4 折之上再做嵌套随机划分。活检级任务:以折为单位聚合 patch 预测后再算 WSI 级指标,避免把 patch 指标误当切片指标(见坑点 6)。

折间方差的心理预期:数据集规模有限(155 张活检),GG5 活检仅 15 条,单个 GG5 样本在折间的移动即可造成活检级指标百分之几的波动。因此折间标准差偏大是该数据集的正常现象,改进模型时应看多折趋势而非单折名次;如需更稳的估计,可在 4 折之上做多种子重复(同一划分、不同初始化与数据顺序),把方差来源拆分为"划分方差"与"训练方差"分别报告。

§5.5 外部验证建议

单中心单扫描仪是 SICAPv2 最大的泛化短板。建议在 SICAPv2 训练后,至少在一个异源队列(如 TCGA-PRAD 活检切片,注意分辨率差异)上做零样本评估并报告性能衰减幅度;跨域实验中扫描仪/染色协议差异应作为显式变量记录。


§6 AI 就绪指南

§6.0 云端快速启动

数据集仅 2.03 GB,Colab/Kaggle 免费环境即可完成下载与一次完整训练:

# Colab 快速验证(约 5 分钟内完成下载解压)
!wget -q --show-progress https://prod-dcd-datasets-cache-zipfiles.s3.eu-west-1.amazonaws.com/9xxm58dvs3-1.zip -O SICAPv2.zip
!unzip -q SICAPv2.zip -d /content/sicapv2 && ls /content/sicapv2

直链为 Mendeley Data 的 S3 缓存地址,收录于 Awesome-Medical-Dataset 仓库;若直链失效,回到数据集页手动下载。

§6.1 快速上手

环境依赖:Python 3.8+、torch(≥1.9)、torchvision、pandas、openpyxl(读取 xlsx)、Pillow、numpy;可选 torchstain(染色归一化)与 scikit-learn(指标)。CPU 也能完成数据探查,训练建议单张 8 GB+ 显存显卡。

下面的最小示例假设你已解压归档。目录结构预期:data_root 指向解压后的 SICAPv2/,其下是 images/、masks/、partition/、wsi_labels.xlsx、readme.txt。data_root 拼接关系:patch 图像路径 = data_root/images/<文件名>,掩码路径 = data_root/masks/<同名文件>,划分列表内记录的是相对 data_root 的 patch 路径。最小可用子集:任意一折(如 Val1 的训练列表)+ 独立测试集即可跑通端到端流程,无需加载全部 18,783 张 patch。

import pandas as pd
from pathlib import Path

DATA_ROOT = Path("/content/sicapv2/SICAPv2")   # 按实际解压路径调整
# 1) WSI 级标签:每行一张全切片的组合 Gleason 评分
wsi_labels = pd.read_excel(DATA_ROOT / "wsi_labels.xlsx")
print(wsi_labels.head())

# 2) patch 清单:从官方划分文件读取(每行一个 patch 路径)
def read_split(txt_path):
    return [l.strip() for l in open(txt_path) if l.strip()]

val1 = read_split(DATA_ROOT / "partition" / "Validation" / "Val1.txt")
test = read_split(DATA_ROOT / "partition" / "Test" / "test_list.txt")  # 文件名以归档内实际为准
print(f"Val1 patches: {len(val1)}, Test patches: {len(test)}")

# 3) 图像-掩码同名配对验证(读入前先跑一次,避免训练中途报错)
first = Path(val1[0]).name
assert (DATA_ROOT / "images" / first).exists(), f"缺图像: {first}"
assert (DATA_ROOT / "masks" / first).exists(), f"缺掩码: {first}"
print("配对 OK:", first)

提示:partition/Test/ 内的确切文件名以你下载的版本为准(结构参考)。首次使用建议先只读取 wsi_labels.xlsx 与一折列表,确认命名规则后再全量加载。

§6.2 数据获取

项目 内容
官方页面 Mendeley Data
v1 归档 SICAPv2.zip 2.03 GB(DOI 10.17632/9xxm58dvs3.1)
v2 归档 SICAPv2.zip 2.01 GB(DOI 10.17632/9xxm58dvs3.2)
S3 缓存直链 https://prod-dcd-datasets-cache-zipfiles.s3.eu-west-1.amazonaws.com/9xxm58dvs3-1.zip
申请流程 无需注册/申请,直接下载
许可证 CC BY 4.0(分发须署名)
# 服务器环境下载与校验
wget -c https://prod-dcd-datasets-cache-zipfiles.s3.eu-west-1.amazonaws.com/9xxm58dvs3-1.zip -O SICAPv2.zip
unzip -q SICAPv2.zip -d /data/sicapv2
du -sh /data/sicapv2   # 预期约 2 GB

版本确认三步(写入实验元数据,防止 v1/v2 混用):

# 1) 记录归档字节数(v1 约 2.03 GB,v2 约 2.01 GB,可据此区分)
stat -c %s SICAPv2.zip | tee data_version.txt
# 2) 记录 md5(Mendeley 页面如提供校验值则一并核对)
md5sum SICAPv2.zip >> data_version.txt
# 3) 展开 readme.txt 归档,标注使用的掩码编码约定
unzip -p SICAPv2.zip "*readme*" > readme_archived.txt
head -50 readme_archived.txt

获取流程要点:无注册、无 DUA、无审批等待——从打开页面到数据落盘通常不超过 10 分钟,这是它在同类病理数据集中工程成本最低的直接原因;唯一需遵守的义务是 CC BY 4.0 署名。若 S3 缓存直链失效,使用数据集页的网页下载按钮;国内网络环境可改用 OpenDataLab 镜像。

§6.3 预处理全流程

官方 patch 已经过"降采样 → 滑窗 → Otsu 组织过滤"流水线,下游预处理只需四步:读取与配对校验 → 掩码类别解码 → 染色归一化(可选但推荐跨域时使用)→ 张量化。

import numpy as np
import torch
from PIL import Image

# 类别编码需以归档内 readme.txt 为准;此处为常见约定示例(0=背景,1=NC,2=G3,3=G4,4=G5,5=G4C)
# !!写死前务必打开任意掩码核对像素取值集合
def load_pair(data_root: Path, name: str):
    img = np.array(Image.open(data_root / "images" / name).convert("RGB"))
    msk = np.array(Image.open(data_root / "masks" / name))
    return img, msk

img, msk = load_pair(Path("/data/sicapv2/SICAPv2"), "16e01b71a267408aa0c8ec8eeaac4d9b-000.png")
print("image:", img.shape, "mask uniques:", np.unique(msk))

# 标准化:ImageNet 均值方差(patch 分类常用起点)
MEAN, STD = (0.485, 0.456, 0.406), (0.229, 0.224, 0.225)
def normalize(img):
    x = torch.from_numpy(img).permute(2, 0, 1).float() / 255.0
    return (x - torch.tensor(MEAN).view(3, 1, 1)) / torch.tensor(STD).view(3, 1, 1)

染色归一化(跨域必配):单中心数据训练后迁移到 TCGA/PANDA 常因 H&E 色域差异显著掉点,Macenko/Reinhard 归一化是最低成本的缓解手段。核心思想是把 RGB 转到光密度(OD)空间估计染色向量:

def rgb2od(img, eps=1e-6):
    return -np.log((img.astype(np.float64) + eps) / 255.0)

# Macenko 流程示意:在训练折内估计 stain matrix,再应用到全部图像
# 推荐直接使用 staintools / torchstain 等成熟实现,并切记:参考图必须来自训练折

两个口径的对齐过滤(复现论文 18,783 → 10,340 的筛选逻辑):

import numpy as np
from pathlib import Path
from PIL import Image

def tissue_ratio(img: np.ndarray) -> float:
    """Otsu 思路的组织占比估计:灰度低于阈值视为组织。"""
    gray = img.mean(axis=2)
    thr = gray.mean() * 0.8          # 简化阈值;严格复现请用 cv2.threshold(..., THRESH_OTSU)
    return float((gray < thr).mean())

def build_graded_subset(data_root: Path, min_tissue=0.20):
    """复现论文口径:剔除组织占比 <20% 的 patch 与掩码全空的 patch。
    输出与官方 partition 文件同构的 patch 路径清单。
    """
    kept = []
    for img_path in sorted((data_root / "images").glob("*")):
        img = np.array(Image.open(img_path).convert("RGB"))
        if tissue_ratio(img) < min_tissue:
            continue                                   # 组织过少,剔除
        msk = np.array(Image.open(data_root / "masks" / img_path.name))
        if (msk > 0).sum() == 0:                       # 掩码全空:无注释区域
            continue                                   # 无分级信息,剔除
        kept.append(f"masks/{img_path.name}")
    return kept

# subset = build_graded_subset(Path("/data/sicapv2/SICAPv2"))
# print(len(subset))   # 论文口径约 10,340;差异大时优先检查阈值实现

说明:上述为对齐论文口径的工程复现(Otsu 实现做了简化),官方 partition/ 文件已内置该筛选结果——分级任务优先直接使用官方划分,本脚本用于口径审计与全集预训练时的筛选参考(见坑点 5)。

§6.4 PyTorch DataLoader 完整实现

import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
from PIL import Image
import numpy as np

class SICAPv2PatchDataset(Dataset):
    """patch 级 Gleason 四分类数据集。

    目录预期:
      data_root/
        images/<patch_name>   # 512×512 patch
        masks/<patch_name>    # 像素掩码(类别编码见 readme.txt)
        partition/<split>.txt # 官方患者级划分,每行一个 patch 相对路径
    标签由掩码多数级派生(与论文 patch 标签口径一致)。
    """
    CLASSES = {"NC": 0, "G3": 1, "G4": 2, "G5": 3}

    def __init__(self, data_root, split_file, class_map, transform=None):
        self.data_root = Path(data_root)
        self.items = [l.strip() for l in open(split_file) if l.strip()]
        self.class_map = class_map      # {patch 相对路径: 整数类别},由掩码预派生
        self.transform = transform

    def __len__(self):
        return len(self.items)

    def __getitem__(self, idx):
        rel = self.items[idx]
        name = Path(rel).name
        img = Image.open(self.data_root / "images" / name).convert("RGB")
        y = self.class_map[rel]
        if self.transform:
            img = self.transform(img)
        return img, y

def derive_patch_labels(data_root, mask_palette):
    """遍历掩码,按像素多数级派生 patch 标签。
    mask_palette: {像素值: 类别名},务必先核对 readme.txt 的编码约定。
    """
    from collections import Counter
    labels = {}
    for m in sorted((Path(data_root) / "masks").glob("*")):
        arr = np.array(Image.open(m))
        counts = Counter(arr.ravel().tolist())
        major = max((mask_palette.get(v, "skip"), c) for v, c in counts.items())
        if major[0] != "skip":
            labels[f"masks/{m.name}"] = SICAPv2PatchDataset.CLASSES[major[0]]
    return labels

def make_loaders(data_root, fold=1, batch_size=64, num_workers=4):
    data_root = Path(data_root)
    class_map = derive_patch_labels(data_root, mask_palette={
        0: "NC", 1: "G3", 2: "G4", 3: "G5"   # 示例编码,以 readme 为准
    })
    vr = data_root / "partition" / "Validation" / f"Val{fold}.txt"
    train_ds = SICAPv2PatchDataset(data_root, vr, class_map, transform=None)
    train_loader = DataLoader(train_ds, batch_size=batch_size, shuffle=True,
                              num_workers=num_workers, pin_memory=True, drop_last=True)
    return train_loader

if __name__ == "__main__":
    loader = make_loaders("/data/sicapv2/SICAPv2", fold=1)
    x, y = next(iter(loader))
    print(x.shape, y.dtype, y[:8])   # [B,3,512,512] int64

关键设计说明:① 标签派生与数据读取分离,便于一次性缓存 class_map;② shuffle=True 只在训练器使用,验证/测试务必 shuffle=False 以便按 WSI 聚合;③ 官方划分文件内的路径写法与归档版本相关,接入前先打印前 5 行核对。

带增强与均衡采样的完整训练装载器(生产推荐形态):

import torchvision.transforms as T
from torch.utils.data import WeightedRandomSampler
from collections import Counter

def build_transform(train: bool):
    """安全增强集合:翻转/旋转/小角度/轻色彩扰动(见 §6.6)。"""
    if train:
        return T.Compose([
            T.RandomHorizontalFlip(0.5),
            T.RandomVerticalFlip(0.5),
            T.RandomRotation(90),
            T.ColorJitter(brightness=0.15, contrast=0.15, saturation=0.15, hue=0.02),
            T.ToTensor(),
            T.Normalize(MEAN, STD),
        ])
    return T.Compose([T.ToTensor(), T.Normalize(MEAN, STD)])

def make_balanced_loader(dataset, batch_size=64, num_workers=4):
    """按类频率倒数加权采样,缓解 NC 4,417 vs GG5 665 的失衡(见坑点 7)。"""
    counts = Counter(dataset.class_map[i] for i in dataset.items)
    weights = [1.0 / counts[dataset.class_map[i]] for i in dataset.items]
    sampler = WeightedRandomSampler(weights, num_samples=len(weights), replacement=True)
    return DataLoader(dataset, batch_size=batch_size, sampler=sampler,
                      num_workers=num_workers, pin_memory=True, drop_last=True)

if __name__ == "__main__":
    import torch
    torch.manual_seed(42)
    loader = make_balanced_loader(
        SICAPv2PatchDataset("/data/sicapv2/SICAPv2",
                            "/data/sicapv2/SICAPv2/partition/Validation/Val1.txt",
                            class_map=...,           # derive_patch_labels 的缓存结果
                            transform=build_transform(train=True)),
        batch_size=32,
    )
    x, y = next(iter(loader))
    print(x.shape, y.bincount())   # 均衡采样后每 batch 各类数量趋近

§6.5 坑点清单

⚠️ 坑点 1:随机划分 patch 造成滑窗重叠泄漏(分类:数据泄漏)

问题:官方 patch 以 50% 重叠滑窗裁剪,相邻 patch 共享一半组织区域;若按 patch 随机划分训练/测试集,几乎相同的图像块会同时出现在两侧,指标虚高且完全失去泛化意义。
症状:patch 分类准确率轻松到 0.98+ 且不同论文间方差极小;换成患者级划分后性能骤降 10-30 个百分点;同一患者的 patch 在特征空间聚成紧簇。
解决:

  1. 简单方法:永远使用官方 partition/ 目录下的患者级 4 折 + 独立测试集,不要自行随机划分。
  2. 进阶方法:自建划分时,从 wsi_labels.xlsx 的 WSI_ID 提取患者分组键(同一活检前缀),用 GroupShuffleSplit/GroupKFold 以患者为 group 划分,并断言训练/测试组的 WSI_ID 交集为空。
  3. SOTA 方法:报告指标时同时给出"patch 级"与"患者级聚合"两套结果;审稿场景下患者级结果为最终结论,patch 级仅作诊断参考。
    参考:SICAPv2 论文 §2(50% 重叠滑窗)、Zaffar et al. 2022 的患者级划分实践

⚠️ 坑点 2:把 WSI 级 Gleason 评分当单标签或直接回归(分类:标签理解)

问题:wsi_labels.xlsx 中的评分是 Primary+Secondary 的组合(如 7=4+3 与 7=3+4 语义不同),且只记录最差与次差模式——是 inexact 标签,不是对全切片每个区域的完整描述。
症状:把评分当普通 5 分类标签后,同一 Grade Group 内样本的 patch 分布差异巨大;直接回归评分值时模型学到的更多是"最差区域面积"而非组合结构。
解决:

  1. 简单方法:活检级任务按 ISUP Grade Group 五分类处理(GG1-GG5),不要拆解 Primary/Secondary 做回归。
  2. 进阶方法:采用 MIL:以 patch 预测的 top-k 级别组合重构评分(先预测最差两个模式的分布,再组合),这与评分的生成语义一致;SegGini 论文将这种"只知最差与次差"的监督形式明确建模为 inexact label。
  3. SOTA 方法:概率化注意力 MIL(如高斯过程注意力),输出各模式存在的后验分布,用期望评分或分布匹配做损失,显式吸收标签不确定性。
    参考:SegGini(MICCAI 2021)对 inexact 标注的定义、Silva-Rodríguez et al. 2020

⚠️ 坑点 3:忽略掩码"未标注区域≠良性"(分类:标签理解)

问题:像素注释是 incomplete 的——病理医生只勾画了确认的区域,掩码中未着色的组织不等于 NC。把未标注像素全部当背景/良性监督,会向模型注入系统性假阴性。
症状:分割模型在未标注的癌区输出"良性"且置信度很高;训练损失收敛但人工抽查发现大量漏检;筛状检测召回率异常低。
解决:

  1. 简单方法:损失计算时对未标注像素置 ignore_index,只监督显式标注区域。
  2. 进阶方法:半监督式处理——未标注区域用一致性正则(mean-teacher/强弱增强一致性)替代硬标签监督。
  3. SOTA 方法:SegGini 式图神经网络框架,把 incomplete + inexact 两类不完美监督统一建模, tissue graph 上做标签传播。
    参考:SegGini(MICCAI 2021)、Emergent Mind 对 SICAPv2 标注性质的综述

⚠️ 坑点 4:分辨率先验错误——这是 10x 数据(分类:预处理陷阱)

问题:SICAPv2 的 patch 是 40x 采集后降采样到 10x 的产物。习惯 TCGA/PANDA(多在 20x/40x 提取 patch)的使用者若按 20x 粒度设计 patch 大小与核尺寸,有效感受野与形态学尺度将全部错位;与 20x 数据混训时形成隐性的分辨率域差。
症状:小腺体特征(GG3 的单个腺体轮廓)模糊难辨;在 SICAPv2 上调好的模型迁到 20x 外部队列掉点远超染色差异可解释的范围。
解决:

  1. 简单方法:明确以 10x 为基准设置一切尺度参数(512×512 patch、池化步幅),并在文档中记录。
  2. 进阶方法:跨域实验统一重采样到相同 µm/px(10x ≈ 1 µm/px),用空间重采样而非缩放倍率对齐。
  3. SOTA 方法:多分辨率训练(同一 WSI 提取多档分辨率 patch)+ 分辨率随机丢弃,让模型对采集协议不那么敏感。
    参考:论文 §2(40x 采集、10x 处理)、Zaffar et al. 2022(10x 口径)

⚠️ 坑点 5:两个 patch 口径(18,783 vs 10,340)混用(分类:工程陷阱)

问题:归档 images/ 含 18,783 个 patch(全集,含未标注区域),而分级任务的论文口径是过滤后的 10,340 个(剔除 <20% 组织与无注释 patch)。误用全集训练分级模型会把大量无标签/贫信息 patch 当作有效样本。
症状:类别分布对不上论文表;训练集里出现大量掩码全空的 patch;复现的基线比论文低好几个点且方差大。
解决:

  1. 简单方法:分级任务只使用官方 partition/ 列表覆盖的 patch(即过滤后口径),加载时断言 len(dataset) 与论文口径一致。
  2. 进阶方法:自行重做 Otsu 组织掩码 + 20% 阈值过滤,与论文流水线对齐,并输出被剔除清单供审查。
  3. SOTA 方法:把 18,783 全集用于自监督预训练(无标签也有效),再用 10,340 分级子集做有监督微调——两个口径各司其职。
    参考:官方结构整理(18,783 口径)、Emergent Mind(10,340 口径)

⚠️ 坑点 6:patch 级指标冒充活检级性能(分类:评估误用)

问题:临床决策单位是"一条活检",不是 patch。patch 准确率被多数类(NC 42.7%)与大面积肿瘤偏置——肿瘤越大,其 patch 越多,模型按 patch 统计自然好看,但小病灶活检可能全部漏诊。
症状:patch accuracy 0.95 但活检级 ISUP 分级 kappa/accuracy 明显更低;GG5 活检(仅 15 条)的漏检在聚合统计中被完全掩盖。
解决:

  1. 简单方法:在同一脚本内实现两级指标:patch 级 accuracy/macro-F1 + WSI 级聚合(多数投票或 top-k)后按活检统计。
  2. 进阶方法:活检级主报告 quadratic weighted kappa(与 ISUP 有序性一致)+ 每级召回率,并附混淆矩阵。
  3. SOTA 方法:MIL 聚合器(ABMIL/TransMIL)端到端训练,直接优化活检级目标;patch 级仅作可解释性副产物。
    参考:论文评估协议、Zaffar et al. 2022 的混合监督 MIL 设定

⚠️ 坑点 7:类别不平衡 + 面积偏置的双重误导(分类:偏倚陷阱)

问题:分级 patch 分布为 NC 4,417 / GG3 1,636 / GG4 3,622 / GG5 665,且 patch 数与肿瘤面积成正比——大肿瘤贡献更多 patch,模型训练被大样本活检主导;GG5(最需要检出的级别)样本最少。
症状:macro-F1 远低于 accuracy;GG5 召回率接近随机;按活检聚合后 GG5 灵敏度不稳定(每折只有个位数 GG5 活检)。
解决:

  1. 简单方法:加权交叉熵(权重取各类频率倒数)或对每张 WSI 做 patch 数上限采样。
  2. 进阶方法:按"活检"而非"patch"做均衡采样;训练损失加 Focal 项压低易样本贡献。
  3. SOTA 方法:类平衡 MIL 袋采样 + 患者级两阶段微调(先类平衡预训练,再按临床先验校准阈值),并报告按级别分层的灵敏度。
    参考:标签分布数据、论文活检级分布

⚠️ 坑点 8:掩码类别编码想当然,跳过 readme 核对(分类:工程陷阱)

问题:掩码的像素值→类别映射(NC/G3/G4/G5/G4C 各对应哪个像素值、筛状是否为独立通道)以归档内 readme.txt 为准。社区代码常各自硬编码一套映射,直接照抄他人 mask_palette 而不核对,会把 G4 区域标成 G3 之类的静默错误。
症状:训练能跑通、loss 正常下降,但混淆矩阵呈系统性错位(如 GG3 与 GG4 大量互混);可视化掩码叠色与论文图明显不符。
解决:

  1. 简单方法:接入前对随机 20 张掩码做 np.unique 统计,与 readme.txt 声明的取值集合逐一核对后再定映射表。
  2. 进阶方法:写断言测试固定进 CI:每个类别在抽样掩码中至少出现一次;掩码尺寸必须等于对应图像尺寸。
  3. SOTA 方法:把掩码解码抽象为独立模块并附单元测试,任何映射变更都要过测试再进训练。
    参考:官方结构说明(readme.txt)、SegGini 的数据构造脚本

§6.6 数据增强

类别 手段 说明
✅ 安全 水平/垂直翻转、90° 旋转 病理形态无方向先验
✅ 安全 小角度旋转(±15°)、随机缩放(0.9-1.1x) 模拟扫描/摆放差异
✅ 安全 HED/Jitter 色彩扰动(小幅) 模拟染色浓度差异
✅ 安全 高斯模糊/轻微噪声 模拟扫描伪影
❌ 危险 大幅颜色反转或灰度化 破坏 H&E 染色语义,Gleason 形态学依赖染色对比
❌ 危险 上采样放大到"伪 40x" 无中生有的细节,注入分辨率幻觉
❌ 危险 大比例 Cutout/Erase 于腺体密集区 可能直接抹掉分级判据(筛孔、融合腺体)
❌ 危险 强弹性形变 腺体结构是分级依据,形变会扭曲 G3/G4 边界

§6.7 模型推荐

任务 推荐模型 起点理由
patch 四分类 ResNet-50 / EfficientNet-B0-B2 10,340 张 patch 规模适中,小模型不易过拟合
patch 四分类(进阶) ViT-S/16(ImageNet 预训练) patch 内全局结构建模,需强增强配合
活检级 ISUP 预测 ABMIL / TransMIL / CLAM MIL 标准基线,直接对齐袋-实例结构
筛状检测 二分类头 + Grad-CAM 763 个正样本适合二分类 + 可解释校验
弱监督分割 SegGini(tissue graph + GNN) 针对 inexact/incomplete 标注设计(MICCAI 2021)
跨域泛化 Macenko 归一化 + DomainNet 风格对抗 缓解单中心染色偏移

选型原则:从上往下选——先用小 CNN 打通数据与划分管线(半天内),确认指标与论文同量级后,再按任务目标升级架构。ViT 系列在 10,340 张 patch 的量级上需要强增强 + 预训练权重支撑,否则容易不如 ResNet;MIL 路线的瓶颈通常不在聚合器,而在 patch 特征的分辨率与染色稳健性。

§6.8 硬件需求

场景 显存 建议
patch 分类基线(512×512, batch 32) 8-11 GB RTX 3060/3080、Colab T4 即可
patch 分类(batch 64 + 强增强) 16 GB RTX 4080/A4000
MIL/弱监督分割 16-24 GB 注意力聚合与图构建内存开销更高
全数据集自监督预训练 24 GB+ 18,783 patch 规模下建议混合精度

§6.9 评估指标实现

import numpy as np
from sklearn.metrics import (accuracy_score, f1_score, cohen_kappa_score,
                             confusion_matrix, roc_auc_score)

def patch_metrics(y_true, y_pred, n_classes=4):
    """patch 级:accuracy + macro-F1 + 混淆矩阵。"""
    return {
        "acc": accuracy_score(y_true, y_pred),
        "macro_f1": f1_score(y_true, y_pred, average="macro"),
        "cm": confusion_matrix(y_true, y_pred, labels=range(n_classes)),
    }

def biopsy_level_qwk(y_true_gg, y_pred_gg):
    """活检级:ISUP Grade Group 1-5 的 quadratic weighted kappa(有序性一致)。"""
    return cohen_kappa_score(y_true_gg, y_pred_gg, weights="quadratic")

def wsi_aggregate(patch_probs, patch_to_wsi, topk=3):
    """按 WSI 聚合 patch 概率:取按概率排序的 top-k patch 多数级。"""
    from collections import defaultdict
    agg = defaultdict(list)
    for p, w in zip(patch_probs, patch_to_wsi):
        agg[w].append(p)
    pred = {}
    for w, probs in agg.items():
        probs = np.stack(probs)              # [n_patches, n_classes]
        scores = probs.max(axis=0)           # 每类取最高置信度(存在性得分)
        pred[w] = int(np.argmax(scores))
    return pred

def cribriform_auc(y_true, y_score):
    """筛状检测:GG4 内二分类 AUC。"""
    return roc_auc_score(y_true, y_score)

报告规范:patch 级结果给 4 折均值±标准差 + 独立测试集单次结果;活检级结果以 QWK 为主指标并附每级召回。

4 折协议的标准报告函数:

import numpy as np

def report_folds(fold_results: dict, test_result: dict):
    """fold_results: {fold_id: {"acc": ..., "macro_f1": ..., "qwk": ...}}"""
    for key in ("acc", "macro_f1", "qwk"):
        vals = [fold_results[f][key] for f in sorted(fold_results)]
        mean, std = float(np.mean(vals)), float(np.std(vals))
        print(f"{key:>10}: {mean:.4f} ± {std:.4f} (4-fold)")
    print(f"{'test':>10}: " + ", ".join(f"{k}={v:.4f}" for k, v in test_result.items()))

# 输出示例:
#        acc: 0.9132 ± 0.0041 (4-fold)
#  macro_f1: 0.8467 ± 0.0063 (4-fold)
#       qwk: 0.8051 ± 0.0092 (4-fold)
#      test: acc=0.9098, macro_f1=0.8402, qwk=0.7987

评分标准差超过 0.02 时优先怀疑划分被扰动(混入了随机划分或自建划分),而不是模型不稳定。

§6.10 MLOps 笔记

  • 版本对账:实验配置中固定记录数据集 DOI(10.17632/9xxm58dvs3.1 或 .2)与 zip 的字节数,v1/v2 差异约 20 MB,可据此自动识别版本。
  • 标签缓存:derive_patch_labels 的结果存为 JSON 并记录掩码映射表版本,避免每次训练重复遍历 18,783 个掩码。
  • 划分不可变:把官方 partition/ 文件哈希(md5)写入实验元数据,任何"重划分"实验单独开名,防止和官方协议结果混池。
  • 数据卡联动:rai:dataLimitations 与 §7 的偏倚表内容应同步进模型卡,交付模型时一并评审。
  • 可复现门槛:单折训练 + 独立测试集评估控制在单卡 24 小时内完成,超过则优先检查是否误加载了全集口径。
  • 断言前置:把"掩码编码核对、图像-掩码配对、类别数校验"写进训练入口的前 50 行断言,宁可启动失败不要静默错误。
  • 抽样可视化:每个 epoch 从验证折固定 seed 抽 8 张 patch 保存"图像 + 预测掩码叠加图",人工巡检染色与分级边界是否合理。
  • 指标双轨:任何实验同时落盘 patch 级与活检级(聚合后)两套指标,缺一即视为实验记录不完整。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 全部样本来自瓦伦西亚一家医院 高 外部队列(TCGA 等)零样本验证;染色归一化
设备单一 仅 Ventana iScan Coreo 扫描 高 跨扫描仪增强;多域训练
类别不平衡 GG5 patch 仅 665(6.4%),GG5 活检仅 15 条 中-高 加权损失;按活检均衡采样;分层报告灵敏度
面积偏置 patch 数与肿瘤面积正相关,大肿瘤主导训练 中 每 WSI patch 上限采样;活检级聚合评估
标注不完整 像素注释未覆盖全部组织,未标注≠良性 中 ignore_index/半监督框架
共识金标准偏置 标签经全体共识,掩盖真实观察者间变异 低-中 不与"单一医师标签"数据混池评估

§7.2 标注质量

标签体系的最大特点是共识优先:疑难病例由全体专家病理医生共同定级,参考标准内部一致性在设计上得到保障;代价是没有公开的标注者间一致性统计(如 kappa)。像素掩码按 Gleason 分级绘制并在 GG4 内单独标记筛状结构,patch 标签按多数级派生——这一口径在论文 §2 中明确陈述,社区复现代码(如 Prostate-Cancer-Classification)与之一致。使用时应将标签视为"高置信共识参考",而非绝对真值。

对下游的三点实操影响:① 训练时以掩码显式区域为监督信号,隐式地把共识质量传导给了模型;② 与其他"单一医师标注"数据集联合训练时,应把数据来源作为协变量记录,防止共识标签与单人标签的系统性差异污染训练;③ 若你的应用要复刻"多医师复核"的临床流程,SICAPv2 缺少逐标注者记录意味着无法在本数据上模拟标注分歧的聚合算法。

§7.3 泛化性风险

部署场景 失效风险 证据/机理
迁移到其他医院队列 高 单中心 + 单扫描仪,染色与扫描域差未经验证
迁移到 20x/40x 数据 高 数据集计算口径为 10x,分辨率先验不同(见坑点 4)
切除标本(prostatectomy) 中-高 数据集全部为穿刺活检条,组织形态与切除标本差异大
筛状检测用于临床提示 中 763 个正 patch 支撑研究级结论,临床级灵敏度/特异度需前瞻验证
作为唯一预训练语料 高 体量 2 GB 级别,不适合单独支撑大规模预训练

§7.4 伦理与合规

所有患者签署了知情同意后方可入组(论文 §2)。数据以 CC BY 4.0 发布,允许商用与再分发,但必须署名。影像为脱敏切片,不含直接标识符与人口学信息;使用中不得尝试重识别。AI 训练用途在 CC BY 4.0 框架下被允许,建议在衍生作品的数据声明中注明原始 DOI 与论文引用。

§7.5 公平性

数据集不附带年龄、性别、种族元数据,且性别维度单一(前列腺疾病)。公平性分析无法在本数据集内完成;需要亚组评估时,应连接具备人口学信息的外部队列,并在协议中明确数据链接的伦理授权。

§7.6 数据漂移

单中心采集天然规避了部分漂移,但也意味着未观测的漂移风险被推迟到部署阶段:染色试剂批次、扫描仪固件更新、病理医师团队变化都可能成为未来新数据的漂移源。建议部署侧以染色 OD 分布统计做漂移监控(KS 检验或最大均值差异),一旦触发即回归测试。

监控指标的最小集合:① H&E 双染色 OD 直方图的 KL 散度(按月聚合新到片 vs 训练分布);② 组织占比分布(防御扫描/裁剪协议变更);③ 模型输出的分级边际分布(GG4+ 占比突变往往是上游漂移的最早信号,而非疾病谱真实变化)。三者都可在 10x patch 粒度上低成本计算,无需医生介入即可日常巡检。

§7.7 DAIMS 24 项检查

# 检查项 状态 说明
1 宽格式 ✅ patch 图像 + 表格式标签,结构扁平清晰
2 唯一标识 ✅ patch 文件名含 WSI 前缀 + 序号,全局唯一
3 特殊字符 ✅ 命名为十六进制哈希 + 连字符,无特殊字符
4 重复行 ⚠️ 50% 重叠滑窗导致 patch 内容空间重叠,需患者级划分隔离
5 缺失编码 ✅ 无标签 patch 不混入分级划分文件
6 标签标识 ✅ NC/G3/G4/G5/G4C 语义明确,readme 提供编码
7 罕见类分组 ⚠️ GG5 patch 仅 665、活检仅 15 条,分层评估时易小样本失真
8 偏倚评估 ✅ 论文明确陈述共识机制与过滤口径;单中心偏倚可由元数据推知
9 数据字典 ✅ readme.txt 说明目录与标签约定
10 信息性缺失解释 ⚠️ 未标注区域语义需使用者自行理解(incomplete),未显式编码
11 设备记录 ✅ 扫描仪(Ventana iScan Coreo)与放大倍率(40x→10x)明确
12 共线性 ✅ 单模态影像,无特征共线性问题
13 编码映射 ✅ 掩码像素值→类别映射在 readme 中约定(接入前需核对)
14 时间戳处理 ✅ 非时序数据;发布时间线由 Mendeley 版本记录承载
15 划分建议 ✅ 官方患者级 4 折 + 独立测试集直接可用
16 泄漏讨论 ✅ 患者级隔离内建于官方划分;社区随机划分风险见坑点 1
17 标签分布 ✅ 活检/WSI/patch 三级分布均有公开数字
18 测量偏倚 ⚠️ 单扫描仪单染色协议,无法在本数据内估计测量变异
19 外部验证建议 ✅ 单中心属性使外验必要性明确(§5.5、§7.3)
20 版本记录 ✅ Mendeley v1/v2 双版本可追溯,DOI 分离
21 预处理脚本 ⚠️ 官方未附端到端脚本;社区有拼接/复现实现(SegGini 等)
22 合规要求 ✅ CC BY 4.0 + 知情同意,授权链清晰
23 多模态对齐 ✅ 单模态;图像-掩码同名一一对应,标签表按 WSI_ID 对齐
24 去标识化 ✅ 无直接标识符;知情同意覆盖;不含人口学元数据

DAIMS 评分:21.5 / 24

评分解读:SICAPv2 在标识、划分、合规、版本管理上表现接近满分,属于"拿来即可训练"的影像数据集;扣分集中在三处——滑窗重叠带来的样本相关性(#4)、罕见级别小样本(#7)与不完整标注的隐式语义(#10),这三点都要求使用者在训练协议层做出正确决策,而不是数据层能自动规避的。⚠️ 项中预处理脚本缺失(#21)意味着第一天的工程成本略高,但社区已有成熟复现可参考。

对你意味着什么:① 直接使用官方 partition/,把"是否患者级隔离"作为代码审查项;② 分级实验预算内优先补 GG5 的分层评估,而不是全局 accuracy;③ 第一周完成掩码编码核对 + 标签缓存脚本(§6.4),这决定了后续所有实验的可信度;④ 如果目标是真实部署,把外部队列零样本验证排进第一个里程碑,不要在 SICAPv2 内部指标上过度打磨。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
(未检索到满足门槛的跨数据集定量结果) — — — — 社区主流用法为在 SICAPv2 内部协议(4 折 + 独立测试集)上比较;SegGini 等工作在同一数据内构造监督形式对比,跨数据集定量迁移结果需查各论文正文

说明:本条目仅收录有同行评审支撑的定量结果;截至 2026-09 检索,未在公开摘要层面获得"他处训练→SICAPv2 测试"或"SICAPv2 训练→他处测试"的可引用数字,故不填入虚构数值。建议使用者以 §5.5 的协议自行完成一次外验并留档。


§8 基准性能与生态

§8.1 代表性下游研究

社区未形成统一排行榜;下表收录经核实使用 SICAPv2 的代表性工作。注意:各研究的划分口径(patch 重裁剪尺寸、聚合方式、划分比例)不一致,性能数值不可直接横向比较,引用时请回溯各自论文的协议节。

研究 年份 任务 关键技术 完整引用 代码
端到端分级系统(数据集论文) 2020 patch 分类 + 筛状检测 + 活检级评分 CNN patch 分类器 + WSI 级聚合 Silva-Rodríguez, J., Colomer, A., Sales, M. A., Molina, R., & Naranjo, V. (2020). Going deeper through the Gleason scoring scale: An automatic end-to-end system for histology prostate grading and cribriform pattern detection. Computer Methods and Programs in Biomedicine, 195, 105637. DOI 10.1016/j.cmpb.2020.105637 未公开官方仓库
SegGini 2021 弱监督 Gleason 分割 tissue graph + GNN,inexact/incomplete 标签建模 Anklin, V., Pati, P., Jaume, G., Bozorgtabar, B., Foncubierta-Rodriguez, A., Thiran, J.-P., Sibony, M., Gabrani, M., & Goksel, O. (2021). Learning Whole-Slide Segmentation from Inexact and Incomplete Labels using Tissue Graphs. MICCAI 2021, 636-646. histocartography/seg-gini
混合监督 MIL 2022 活检级 ISUP 五分级 注意力 MIL + 混合监督(像素标签引导) Zaffar, M., et al. (2022). 混合监督多实例学习用于活检分级. arXiv:2206.12798 见论文
后续弱监督/形态学工作 2024 分割与分级 多种(含状态空间模型等新架构尝试) 另见 arXiv:2409.17122 等使用 SICAPv2 的工作 见各自论文
CrowdGleason(引用 SICAPv2 作对比基准) 2024 众包标注 Gleason 分级 众包 + 专家聚合 CrowdGleason dataset: Learning the Gleason grade from crowds and experts. Computer Methods and Programs in Biomedicine, 2024. DOI 10.1016/j.cmpb.2024.108472 见论文

§8.2 SOTA 总结与选型建议

任务难度阶梯:patch 四分类(成熟,ResNet 级模型即可获得强基线)→ 筛状检测(中等,正样本 763 个,需类平衡策略)→ 活检级五分级(难,inexact 标签 + 长尾 GG5)→ 弱监督分割(研究前沿,SegGini 为公认参照)。选型建议:以 patch 分类建立数据管线信心;随后切换 MIL 框架逼近临床目标;若关注标注经济学,直接进入 SegGini 设定。截至 2026-09 检索,未发现以 SICAPv2 为固定测试床的公开 leaderboard,"SOTA"应以同期论文在同一官方划分上的报告为准,并注明协议差异。

§8.3 评测协议

官方协议要点:① 使用 partition/ 的患者级 4 折 + 独立测试集;② patch 任务报 4 折均值±标准差,测试集单次结果单独列出;③ 活检级任务先聚合再评估,主指标建议 QWK;④ 不在全集(18,783)上报告分级指标;⑤ 任何重裁剪(如 256×256)需在论文中显式声明,因为其改变 patch 总数与统计口径(arXiv:2206.12798 口径)。

协议自查表(投稿/评审前逐项过):

协议项 合规做法 常见违规
划分 官方 Val1-4 + Test 按 patch 随机划分、按 WSI 划分(患者泄漏)
patch 口径 10,340 分级子集 混入 18,783 全集的无标签 patch
聚合 先 patch 后 WSI 两级分别报告 只报 patch 级指标冒充临床性能
指标 accuracy + macro-F1 + QWK 只报 accuracy 掩盖 GG5 短板
增强与归一化 仅在训练折内估计参数 全集统计后划分(隐性泄漏)
重裁剪声明 显式写出尺寸与数量变化 更换 256×256 后与论文直接比数字
数据集 关系 组合用法
TCGA-PRAD(720 张活检) 同模态更大规模,无局部注释 SICAPv2 训练像素能力 → TCGA 做切片级外验
PANDA 挑战数据(Radboud/Karolinska) 同任务不同中心(ISUP 分级) 跨域泛化基准;注意分辨率与评分协议差异
Arvaniti TMA cores(886) 像素级注释但标本类型不同 形态学对照研究
Gleason19(331 cores) 多标注者一致性研究 观察者变异分析

§8.5 关键论文 Top 6

  1. Silva-Rodríguez, J., Colomer, A., Sales, M. A., Molina, R., & Naranjo, V. (2020). Going deeper through the Gleason scoring scale: An automatic end-to-end system for histology prostate grading and cribriform pattern detection. Computer Methods and Programs in Biomedicine, 195, 105637. DOI 10.1016/j.cmpb.2020.105637 — 数据集原始论文,含完整构建协议与基线。
  2. Silva-Rodríguez, J., et al. (2021). 预印本版本 arXiv:2105.10490 — 免费可读的完整正文(含数据分布图表)。
  3. Anklin, V., Pati, P., Jaume, G., et al. (2021). Learning Whole-Slide Segmentation from Inexact and Incomplete Labels using Tissue Graphs. MICCAI 2021, 636-646 — 将 SICAPv2 标注的 inexact/incomplete 性质形式化的代表工作(代码)。
  4. Zaffar, M., et al. (2022). 混合监督 MIL 用于前列腺活检分级. arXiv:2206.12798 — 像素标签引导 MIL 的活检级五分级实践。
  5. Bulten, W., Kartasalo, K., Chen, P.-H. C., et al. (2022). Artificial intelligence for diagnosis and Gleason grading of prostate cancer: the PANDA challenge. Nature Medicine, 28(1), 154-163 — 同任务领域最大规模挑战赛,常与 SICAPv2 对照讨论。
  6. CrowdGleason 作者团队 (2024). The CrowdGleason dataset: Learning the Gleason grade from crowds and experts. Computer Methods and Programs in Biomedicine. DOI 10.1016/j.cmpb.2024.108472 — 众包标注视角的后续演进,引用 SICAPv2 作基准。

§8.6 社区活跃度

Mendeley Data v1 页面显示 Views 8,094 / Downloads 1,625(截至 2026-09 检索,v1 页面);PlumX 汇总口径记录 8,002 次浏览与 6,757 次下载(PlumX),说明数据获取活跃。第三方镜像(OpenDataLab、ModelScope 生态页)与多个复现代码库(SegGini、社区分类项目)构成基本的社区支持面。数据集无官方 GitHub issue 渠道,使用问题主要通过论文通讯作者与社区仓库反馈。

使用趋势判断:从引用其的后续工作分布看(MICCAI 2021 → arXiv 2022 → CMPB 2024 → CVPR 2025),SICAPv2 已从"分级系统配套数据"演化为"弱监督/不完美监督方法学的标准试验床",这一趋势对使用者的含义是:方法学对比实验要优先检索 2021-2025 年间在同一官方划分上的报告,而不是只看数据集论文的原始基线。

§8.7 生态快照

资源 类型 链接 推荐理由
Mendeley Data 数据集页 官方托管 data.mendeley.com/datasets/9xxm58dvs3 首选下载与版本管理入口
SICAPv2 论文(arXiv 版) 论文 arxiv.org/abs/2105.10490 免费、完整的数据构建与实验细节
SegGini 代码库 复现代码 github.com/histocartography/seg-gini patch 拼接回 WSI 的脚本 + 弱监督分割实现
Awesome-Medical-Dataset 条目 导航 SICAPv2 条目 直链与引文速查
Emergent Mind 主题页 综述 emergentmind.com/topics/sicapv2 各论文使用口径的差异速览
OpenDataLab 镜像 镜像 opendatalab.com/OpenDataLab/SICAPv2 国内加速下载备选

§9 相关资源与引用

§9.1 官方资源

§9.2 BibTeX 引用

@article{silva2020going,
  title   = {Going deeper through the Gleason scoring scale: An automatic
             end-to-end system for histology prostate grading and
             cribriform pattern detection},
  author  = {Silva-Rodr{\'i}guez, Julio and Colomer, Adri{\'a}n and
             Sales, Mar{\'i}a A and Molina, Rafael and Naranjo, Valery},
  journal = {Computer Methods and Programs in Biomedicine},
  volume  = {195},
  pages   = {105637},
  year    = {2020},
  publisher = {Elsevier},
  doi     = {10.1016/j.cmpb.2020.105637}
}

@data{silva2020sicapv2,
  author = {Silva-Rodr{\'i}guez, Julio},
  title  = {{SICAPv2} - Prostate Whole Slide Images with Gleason Grades
            Annotations},
  year   = {2020},
  publisher = {Mendeley Data},
  version = {V1},
  doi    = {10.17632/9xxm58dvs3.1}
}

@inproceedings{anklin2021seggini,
  title     = {Learning Whole-Slide Segmentation from Inexact and
               Incomplete Labels using Tissue Graphs},
  author    = {Anklin, Valentin and Pati, Pushpak and Jaume, Guillaume and
               Bozorgtabar, Behzad and Foncubierta-Rodriguez, Antonio and
               Thiran, Jean-Philippe and Sibony, Mathilde and
               Gabrani, Maria and Goksel, Orcun},
  booktitle = {Medical Image Computing and Computer-Assisted Intervention
               (MICCAI)},
  pages     = {636--646},
  year      = {2021}
}

§9.3 引用指南

使用数据集:引用数据集 DOI(10.17632/9xxm58dvs3)+ 原始论文(silva2020going)。使用 SegGini 式弱监督设定:加引 anklin2021seggini。引用本百科条目:注明"千方病案医数集,SICAPv2 条目,审核日期 2026-09-05"及页面 URL。所有再分发场景按 CC BY 4.0 保留署名与许可链接。

常见引用错误:① 只引论文不引数据集 DOI(或反之)——数据与论文分别有独立 DOI,规范做法是双引;② 把 arXiv:2203.04579 当作 SICAPv2 论文编号(正确为 arXiv:2105.10490,见 §10.3 来源 14 的证伪记录);③ 引用 v2 归档却使用 v1 的划分文件——版本与划分必须成对声明。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途 版本
千方病案写作助手(LLM) 条目初稿撰写、结构化与翻译润色 生产环境版本(2026-09)
联网检索工具 事实核查(6 次检索,2026-09-13 执行) 生产环境版本

§10.2 AI 参与范围

AI 负责初稿撰写、表格结构化、代码示例组织与格式统一;全部事实性内容(规模数字、协议、许可、引用)均来自 §10.3 所列来源,由人工编辑逐条核对;医学背景章节与偏倚评估经医学审核人复核;结论性判断(战略价值、选型建议)由人工编辑定稿。

§10.3 输入来源列表

  1. Silva-Rodríguez, J., Colomer, A., Sales, M. A., Molina, R., & Naranjo, V. (2020). Going deeper through the Gleason scoring scale: An automatic end-to-end system for histology prostate grading and cribriform pattern detection. Computer Methods and Programs in Biomedicine, 195, 105637. DOI 10.1016/j.cmpb.2020.105637
  2. Silva-Rodríguez, J., et al. (2021). 同题预印本. arXiv:2105.10490(检索于 2026-09)
  3. Mendeley Data. SICAPv2 - Prostate Whole Slide Images with Gleason Grades Annotations, V1. DOI 10.17632/9xxm58dvs3.1
  4. Mendeley Data. SICAPv2 版本对比页(v1/v2 归档大小与 DOI). data.mendeley.com/datasets/compare/9xxm58dvs3
  5. Emergent Mind. SICAPv2 Prostate Histopathology Benchmark(对 182 WSI 分布、10,340 patch、763 筛状 patch 等口径的整理). emergentmind.com/topics/sicapv2
  6. Capedbitmap. Prostate-Cancer-Classification(官方归档目录结构与 18,783 patch 口径说明). GitHub
  7. Anklin, V., et al. (2021). Learning Whole-Slide Segmentation from Inexact and Incomplete Labels using Tissue Graphs. MICCAI 2021, 636-646(代码库)
  8. Zaffar, M., et al. (2022). 混合监督 MIL. arXiv:2206.12798
  9. Bulten, W., et al. (2022). Artificial intelligence for diagnosis and Gleason grading of prostate cancer: the PANDA challenge. Nature Medicine, 28(1), 154-163.
  10. CrowdGleason 作者团队 (2024). The CrowdGleason dataset. Computer Methods and Programs in Biomedicine. DOI 10.1016/j.cmpb.2024.108472
  11. pomelo-song. Awesome-Medical-Dataset: SICAPv2(S3 直链与引文). GitHub
  12. PlumX Metrics. SICAPv2 数据集使用量汇总. plu.mx
  13. dblp. Silva-Rodríguez et al. 2020 书目记录(DOI 与期刊卷期核验). dblp.org
  14. arXiv. arXiv:2203.04579 内容核验(确认为无关论文,用于种子线索纠错). arxiv.org/abs/2203.04579
  15. 遇见数据集/SelectDataset. SICAPv2 条目(CC BY 4.0、机构与发布日期交叉核验). selectdataset.com

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字 千方病案医学编辑部 逐条比对 FACTS 清单与原始来源 ✅ 已通过/已验证
§2 医学背景与编码映射 千方病案医学编辑部(医学审核) ICD-11/SNOMED 编码与术语复核 ✅ 已通过/已验证
§3-§4 规格、结构与字段字典 千方病案医学编辑部(数据工程审核) 对照归档结构与论文协议 ✅ 已通过/已验证
§5 划分与泄漏分析 千方病案医学编辑部(数据工程审核) 协议溯源 + 代码逻辑审查 ✅ 已通过/已验证
§6 代码与坑点 千方病案医学编辑部(数据工程审核) 代码走查 + 来源核对 ✅ 已通过/已验证
§7 质量评估与 DAIMS 千方病案医学编辑部(联合) 偏倚项逐条溯源 ✅ 已通过/已验证
§8-§9 基准、生态与引用 千方病案医学编辑部 引用完整性核查 ✅ 已通过/已验证
种子线索纠错(212 WSI/巴塞罗那/arXiv 编号) 千方病案医学编辑部 官方来源逐项证伪 ✅ 已通过/已验证

§10.5 AI 生成章节标注

以下章节由 AI 起草并经人工定稿:§1.0/§1.1/§1.2(叙事与价值分析)、§2.2/§2.5(医学叙述)、§6 全部代码示例、§7.7 DAIMS 解读、§8.2 选型建议。全部事实性断言处均带来源链接,供读者回溯。

§10.6 最后人工审核

最后人工审核日期:2026-09-05(与 §0 审核声明一致)

页面状态:published(全部内容已完成审核并发布)


§C 结构化数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • msk-impact — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • munich-bmc — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • CIMA — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • CAMELYON16-17 — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • ICGC — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • osteosarcoma — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • pannuke — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • lizard — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • nucls — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集