UniToPatho (unitopatho) — AI-Ready Wikipedia

都灵大学 DeepHealth 项目产物:292 张全切片提取 9,536 个 H&E patch,NORM/HP/TA/TVA 六类分类与腺瘤异型增生分级双任务,两档分辨率揭示'不同病变需不同观察尺度',官方 ResNet-18 基线 BA 0.46 → 多分辨率级联集成 0.67,CC BY 4.0 于 IEEE DataPort 开放

来源 都灵大学结直肠息肉筛查病人 H&E 全切片(Hamamatsu Nanozoomer S210,20×,0.4415 μm/px)两档视野尺寸 patch(PNG)+ 6 类标签与 4 类 type 的 CSV 元数据(含 WSI 引用、ROI 与 patch 坐标)发布时间: 2026-09-27最后更新: 2026-09-27 阅读 20
UniToPatho (unitopatho) — AI-Ready Wikipedia

信息速览

数据集名称UniToPatho (unitopatho) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模292 名病人(292 张 WSI,论文原文 Each slide belongs to a different patient);9,536 个 H&E patch(8,669 档 σ=800 μm
接入方式都灵大学结直肠息肉筛查病人 H&E 全切片(Hamamatsu Nanozoomer S210,20×,0.4415 μm/px)两档视野尺寸 patch(PNG)+ 6 类标签与 4 类 type 的 CSV 元数据(含 WSI 引用、ROI 与 patch 坐标)
AI 就绪度

INFOBOX — UniToPatho 一屏速览

维度 内容
本质 结直肠息肉 H&E 组织病理学 patch 分类数据集(非挑战赛):9,536 patch / 292 WSI / 292 病人
团队 都灵大学(University of Turin)计算机科学系 EIDOSlab + 医学科学系跨学科;EU H2020 DeepHealth 项目(No 825111)Use Case 2
论文 ICIP 2021, pp. 76-80(doi:10.1109/ICIP42928.2021.9506198);arXiv:2101.09991(v1 2021-01-25);数据 DOI 10.21227/9fsv-tm25
数据 292 WSI(Hamamatsu Nanozoomer S210,20×,0.4415 μm/px)→ 两档 patch:σ=800 μm 档 8,669(1812² px)+ σ=7000 μm 档 867(15855² px)
类别 6 类:NORM / HP / TA.LG / TA.HG / TVA.LG / TVA.HG;另有 4 类 type 折叠(NORM/HP/HG/LG)
任务 ① 6 类组织类型分类;② 腺瘤异型增生分级(HG vs LG);指标 Balanced Accuracy
官方基准 ResNet-18 单尺度基线最佳 BA 0.46(σ=1500);多分辨率级联集成 BA 0.67(σ=7000 测试)
核心洞见 不同息肉类型在不同观察尺度下可分性不同(HP 最佳 0.92@σ=800,TVA 最佳 0.84@σ=7000)——单一尺度注定了局部最优
划分 官方按 slide(=病人)70/30:204 train / 88 test
许可 数据 CC BY 4.0|代码 MIT|ICIP 论文 IEEE 版权
获取 IEEE DataPort open access(免费注册下载)|dataloader:GitHub EIDOSlab/UNITOPATHO(PyTorch + ECVL)
引用 Semantic Scholar 48 次(2026-09 抓取);下游含 IEEE Access 2023 FFC-ResNet、Information Sciences 2024 半监督 GAN 等
库内互链 MHIST(同模态同器官二分类,rid 168)、NCT-CRC-HE-100K(CRC 组织学大规模,rid 148)、GlaS(结直肠腺体分割,rid 196)、HyperKvasir(内镜息肉,rid 693)

UniToPatho 是一个"把病理科的诊断逻辑装进数据集设计"的样本:它不只给每个图块一个标签,而是把同一个器官(结直肠息肉)切成两种观察视野(800 微米看局部细胞细节、7000 微米看组织结构全貌),然后用基线实验证明——任何单一尺度都会让某类病变变得难分。都灵大学的团队由此提出多分辨率级联分类器,把六类平衡准确率从 0.46 拉到 0.67。这个"尺度即信息"的洞见,使它在 patch 分类数据集里拥有独特的教学价值。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——CC BY 4.0、IEEE DataPort 免费注册下载,两种分辨率版本别下混。
  2. 关心分类协议:直奔 §4 与 §5——官方 split 是按病人划分的 204/88,六类与四类 type 两套标签怎么选用哪套,都有讲究。
  3. 做多分辨率研究:直奔 §4.3——论文的级联分类器设计与 per-type-最佳尺度表(Table 2)是现成的动机与对照。

§0 导读:这个数据集解决什么问题

结直肠息肉的组织学处理是一条"分级决定命运"的流水线:内镜下切下的息肉送病理科,病理医师在显微镜下判断它是增生性息肉(HP,基本相安无事)还是腺瘤(TA/TVA,癌前病变),再给腺瘤定异型增生级别(低级别 LG 随访、高级别 HG 近乎预警)。这条判断链直接决定病人的随访间隔与处理方案,而它的自动化一直卡在两个现实约束上:标注昂贵(每张全切片 gigapixel 级,需要专家逐区判读)与尺度敏感(增生性息肉看腺体结构即可辨认,而高级别异型增生的证据藏在细胞核细节里)。

UniToPatho 的回答是三件套。第一件是数据:292 张病人各一张的 H&E 全切片,经都灵大学病理专家按六类标注,裁出 9,536 个两档视野的 patch(8,669 个 800 微米档 + 867 个 7000 微米档),每条记录携带 WSI 引用与坐标,可溯源可重组。第二件是基准:官方按病人划分 204/88,提供 ResNet-18 单尺度基线(最佳 BA 0.46)与多分辨率级联集成(BA 0.67)两个锚点,后续工作有明确的对照线。第三件是洞见:论文用一张 per-type-最佳尺度表证明"不同息肉类型在不同尺度下可分性不同"——HP 在 800 微米档 BA 高达 0.92,TVA 在 7000 微米档才到 0.84,单一尺度流水线从设计上就放弃了部分类别的性能。

第四段写的是边界。UniToPatho 不是"什么都能做"的数据集:它没有像素掩码(分割需求请转 GlaS/CoNSeP),没有病人口学元数据(预后建模请另配队列),没有 WSI 本体(全片重分析需自行申请),没有跨中心变量(泛化宣称需外部验证)。把这四条边界读进脑子,剩下的部分——分级维度、双尺度协议、CC BY 4.0、官方 split 与基线——就是它在公开数据版图上不可替代的位置。条目余下章节的所有内容,都是围绕"这套资产怎么用对、哪里会用错"展开的。

§0 读法三则:

  1. 这个条目是"数据集 + 方法学论文"二合一:本体是 9,536 个带标签 patch,副产品是一套"尺度敏感性分析 → 多分辨率级联"的设计方法论——两者许可与获取方式见 §6。
  2. 全文统计数字均出自论文正文与表格(arXiv v2 / ICIP 2021 双源核对);唯一一处表格渲染漂移(8,669 vs 8,699)已在坑 2 存照。
  3. 检索时注意大小写变体:论文正文写 “UniToPatho”,IEEE DataPort 与 GitHub 写 “UNITOPATHO”(坑 1)。

§1 数据集速览:十问十答

Q1:UniToPatho 的"9,536 个 patch"从哪来?
292 张 H&E 染色全切片(WSI),每张来自一位不同的病人(结直肠息肉筛查/手术标本),由都灵大学专家病理医师逐张标注后在 WSI 上划定感兴趣区(ROI),再从 ROI 内按两档视野尺寸(σ=800 μm 与 σ=7000 μm)裁出 patch。

Q2:图像规格是什么?
原始扫描为 Hamamatsu Nanozoomer S210 扫描仪、20× 放大、0.4415 μm/px。两档 patch 对应的像素尺寸:σ=800 μm 档每 patch 1812×1812 像素;σ=7000 μm 档每 patch 15,855×15,855 像素。两档共用同一原始扫描分辨率,"800/7000"是视野边长(微米)而非像素密度。

Q3:类别体系是什么?
6 类:NORM(正常组织)、HP(增生性息肉)、TA.LG(管状腺瘤低级别异型增生)、TA.HG(管状腺瘤高级别异型增生)、TVA.LG(管状-绒毛状腺瘤低级别)、TVA.HG(管状-绒毛状腺瘤高级别)。CSV 同时提供 4 类 type 折叠版:NORM / HP / HG / LG——做分级研究直接用 type,做细分类用 label。

Q4:类分布均衡吗?
不均衡,且集中在低级别端。patch 级:TA.LG 4,029(42.3%)最多,NORM 1,024、TVA.LG 2,318、TVA.HG 1,009、HP 604,最少的 TA.HG 仅 552(5.8%)。slide 级同样 TA.LG 主导(146/292)。这正是论文采用 Balanced Accuracy 而非普通准确率的原因。

Q5:官方基准是什么水平?
单尺度 ResNet-18 基线(ImageNet 预训练、224×224 输入)在六个尺度上扫描,6 类 BA 最高 0.46(σ=1500)——这个"不及格"数字本身就是论文的核心论据之一。论文提出的多分辨率级联集成把 BA 提到 0.67(σ=7000 测试档),相对提升 50%。

Q6:为什么单尺度这么差?
Table 2 的 per-type 分解给出答案:HP 在 σ=800 时 BA 0.92(腺体结构在低倍就清晰),但到 σ=7000 掉到 0.60;TVA 相反,σ=7000 时 0.84、σ=800 时仅 0.67。高级别异型增生的证据依赖细胞核形态细节,下采样到 224×224 后丢失——混淆矩阵显示基线系统性偏向低级别类。

Q7:官方划分怎么切?
按 slide(等价于按病人)70%/30%:204 张 train、88 张 test。同一张 WSI 的 patch 只会出现在一侧——这避免了 patch 级随机划分导致的病人级信息泄漏。复现下游工作时强烈建议沿用此划分。

Q8:许可是什么?商用可以吗?
数据集 CC BY 4.0(IEEE DataPort 页面 JSON-LD 声明):商用允许、需署名。dataloader 代码 MIT。ICIP 2021 论文本体 IEEE 版权(引用描述时注意区分)。对比同期多数医学数据集的 CC BY-NC 系,UniToPatho 的许可宽松度属于第一梯队。

Q9:跟库内其他息肉数据集什么关系?
同器官两模态:内镜息肉数据集(HyperKvasir、Kvasir-SEG、PolypGen、ETIS-Larib)是摄像头下的"长相",UniToPatho 是显微镜下的"本质"——跨模态对照叙事的天然素材。同模态近邻:MHIST(也是 H&E 息肉 patch,但二分类)、NCT-CRC-HE-100K(9 类组织,规模大百倍但无分级)、GlaS(腺体分割而非分类)。详见 §7。

Q10:有什么已知坑?
四处:① 名称大小写两套(UniToPatho/UNITOPATHO);② ar5iv 渲染版 Table 1 有 “8699/8669” 一处数字漂移(正解 8,669);③ DataPort 页面 “800 and 7000 um/px” 的措辞易被误读为两种像素密度(实为视野边长);④ 高级别类(TA.HG/TVA.HG)敏感性低(0.50/0.52)是数据集固有难点,别拿高分截图打广告。详见 §8。

§2 数据构成与规格

2.1 从病人到 patch:一条三层漏斗

层级 数量 说明
病人 292 每位病人一张 WSI(论文原文 Each slide belongs to a different patient)
全切片 WSI 292 Hamamatsu Nanozoomer S210 扫描,20×,0.4415 μm/px,H&E 染色
标注 ROI 未披露总数 专家病理医师逐张划定,patch 仅从 ROI 内裁切
patch(σ=800 μm) 8,669 每块 1812×1812 px,局部细节档
patch(σ=7000 μm) 867 每块 15,855×15,855 px,组织结构档
patch 合计 9,536 与论文摘要口径一致

读这张表要注意三个"杠杆关系":WSI 到 patch 的膨胀倍数在两档之间差了一个数量级(8,669 vs 867)——7000 微米视野的边长是 800 微米的 8.75 倍,同样一块 ROI 能切出的 7000 档 patch 少得多;这决定了两档数据的角色不同——800 档是"训练主力"(量大、含局部细节),7000 档是"评估主战场"(模拟病理医师低倍镜下的完整视野,论文最终方法在其上报告)。而 292 这个数字在 slide 与病人之间是恒等号:按 slide 划分就是按病人划分,条目此后不再区分这两个词。

2.2 patch 规格:两种视野,一个原点

属性 σ=800 μm 档 σ=7000 μm 档
视野边长 800 μm 7000 μm
像素尺寸 1812×1812 15,855×15,855
像素密度 0.4415 μm/px(原始) 0.4415 μm/px(原始)
换算验证 800/0.4415≈1812 ✓ 7000/0.4415≈15,855 ✓
数量 8,669 867
角色 局部细节/训练主力 完整结构/评估主战场

关键澄清(对应坑 3):两档 patch 来自同一套原始扫描,像素密度(mpp=0.4415)完全相同,差异只在裁切窗口的物理边长。IEEE DataPort 页面 “We provide two different resolutions, 800 and 7000 um/px” 的措辞容易让人以为有两种像素密度——以论文的记号 σ(patch scale,单位 μm)为准。每条 patch 记录的 CSV 元数据携带 (x, y, w, h) 坐标与 WSI 引用,所以任何 patch 都可以溯源回它在全切片上的位置——这为"从 patch 分类回到 WSI 级聚合"(如 MIL 多实例学习)保留了完整通路。

2.3 类别体系:六类与四类的双层设计

label(6 类) 中文 type(4 类) 临床含义
NORM 正常组织 NORM 非病变黏膜
HP 增生性息肉 HP 良性,切除后基本无需随访
TA.LG 管状腺瘤·低级别异型增生 LG 癌前病变,随访_interval 拉长
TA.HG 管状腺瘤·高级别异型增生 HG 近癌病变,处理升级
TVA.LG 管-绒毛状腺瘤·低级别 LG 绒毛成分占比高者复发风险更高
TVA.HG 管-绒毛状腺瘤·高级别 HG 处理优先级最高的一档

这个双层设计的用意在于任务解耦:6 类 label 支持细粒度形态分类(组织学类型 × 异型增生级别的联合判断),4 类 type 把"组织学类型"与"异型增生级别"拆成两个正交维度——做分级研究(HG vs LG,仅在腺瘤上)用 type 即可,不必被 NORM/HP 的存在干扰类别权重。论文的级联分类器正是按这个逻辑设计的:先辨增生性/腺瘤性,再辨管状/管-绒毛状,最后在全分辨率上判级别。

2.4 分布画像:一个低级别主导的筛查队列

类别 slides slide 占比 patches(总) patch 占比
NORM 21 7.2% 1,024 10.7%
HP 41 14.0% 604 6.3%
TA.LG 146 50.0% 4,029 42.3%
TA.HG 26 8.9% 552 5.8%
TVA.LG 38 13.0% 2,318 24.3%
TVA.HG 20 6.8% 1,009 10.6%
合计 292 100% 9,536 100%

三个观察:其一,TA.LG 一家独大(slide 级恰好半壁江山),这是筛查队列的自然面貌——大多数被切下来的息肉本来就是低级别腺瘤;其二,两个 HG 类合计只占 slide 级 15.8%、patch 级 16.4%,而它们恰恰是临床最需要识别对的一档,类不平衡与任务难度在此叠加重合;其三,HP 在 slide 级占 14% 但 patch 级只占 6.3%——增生性息肉的 ROI 面积普遍偏小,单 slide 产出的 patch 数低于平均,做 slide 级聚合评估时要留意这个密度差。

2.5 官方划分与复现契约

论文按 slide 70/30 随机划分:204 张 train、88 张 test。这不是一个可以随意重切的选择:其一,同病人同 slide 的约束能防信息泄漏;其二,论文全部表格(Table 2/3/4)都在这个划分上产生,下游若自行重切,数字与论文及后续文献全部失去可比性。复现建议三条:直接使用官方 CSV 中的 WSI 引用字段区分 train/test;两档分辨率分别加载时保持同一 slide 划分;报告结果时注明用的是 6 类还是 4 类 type 协议(两者数字不可互比)。

划分自检代码(30 秒跑完):

import pandas as pd

df = pd.read_csv("unitopatho_800.csv")          # 或 7000 档,字段名以实际表头为准
slides = df["wsi_reference"].unique()
assert len(slides) == 292, f"slide 数 {len(slides)} ≠ 292"
# 每行只能属于一侧(官方 csv 已分 train/test 时检查不相交)
train_slides = set(pd.read_csv("train.csv")["wsi_reference"])
test_slides  = set(pd.read_csv("test.csv")["wsi_reference"])
assert not (train_slides & test_slides), "slide 跨集泄漏!"
print(f"train {len(train_slides)} slides, test {len(test_slides)} slides")
# 期望输出: train 204 slides, test 88 slides

若使用自行重切(不推荐),至少保证:按 slide 分组、比例 70/30、种子固定并在论文中报告重切理由——否则数字将无法与本文档任何表格对表。

2.6 与库内病理数据集的粒度对照

数据集 粒度 任务 标签类型
UniToPatho patch(两档视野) 分类+分级 6 类/4 类硬标签
MHIST(rid 168) patch(固定 224²) 二分类 HP vs SSA + 梅氏评分
NCT-CRC-HE-100K(rid 148) patch(224²) 组织类型分类 9 类
GlaS(rid 196) WSI 腺体实例分割 像素掩码
CoNSeP(rid 228) WSI 裁切 核实例分割 像素掩码
DigestPath(rid 338) WSI/patch 检测+分割 掩码+框

UniToPatho 的生态位是"分类粒度上唯一带异型增生分级的结直肠 H&E 公开集之一":MHIST 有分级思想(梅氏评分)但只有两类,NCT-CRC-HE-100K 规模大但没有"腺瘤级别"维度(它是正常组织-肿瘤组织的 9 类组织型),GlaS/CoNSeP 是分割粒度。要在公开数据上练"低级别 vs 高级别"的判断,UniToPatho 几乎是必经一站——这也解释了它 48 次引用里分级方法论文占主力(§7)。

2.7 数据质量与已知局限

把本数据集用对,先承认它的四条边界:

  1. 标注薄层化:发布物是 patch 级 6 类硬标签,没有像素掩码、没有腺体/核级结构标注、没有标注者间一致性检验(kappa)披露。标签的可信度完全绑定"都灵大学 expert pathologists"这一机构信用,无法做逐标注的质量审计。
  2. 单中心纯度:292 张 WSI 全部来自同一医学中心、同一台扫描仪、同一染色流程。好处是受控(研究分辨率/架构变量时噪声最小),代价是任何跨中心结论都需要外部数据(PolypGen 的多中心设计是反向参照)。
  3. 两档失衡:σ=800 档 8,669 vs σ=7000 档 867——10 倍量差。任何"跨档联合训练"都要重新设计采样,且论文本身的跨档数字(Table 2)是分档训练分档测试,不存在跨档迁移的官方证据。
  4. 筛查队列偏置:样本构成(TA.LG 半壁江山、HG 稀少)反映的是筛查/诊疗场景的自然分布,不是按类别均衡采样的研究设计。直接拿它做类别均衡的基准对比会失真——所有跨论文对比都应回到 BA 口径。

这四条边界同时也是使用说明书:把它当"受控单中心、patch 级、双尺度、带分级"的专用工具,每一项都物尽其用;把它当"大型多中心通用病理库"用,每一项都是坑。

2.8 CSV 数据字典(全字段)

字段 类型 含义 使用提示
image_id string patch 文件标识(主键) 文件路径拼接用
label string,6 值 HP/NORM/TA.HG/TA.LG/TVA.HG/TVA.LG 6 类协议的 y
type string,4 值 HP/NORM/HG/LG 4 类协议与分级任务的 y
wsi_reference string 源 WSI 标识 划分键:同值 patch 必须同侧
roi string 源 ROI 标识 同一 WSI 可能多个 ROI;MIL 分组粒度可选
mpp float 每像素微米数 应恒为 0.4415;异常行即为脏数据
x, y int patch 在 WSI/ROI 中的左上角坐标 空间聚合/邻接重建用
w, h int patch 宽高(像素) 两档分别 1812/15,855(含边缘余量时略小)

(字段名以实际 CSV 表头为准,上表为语义映射;官方 dataloader 的 target 参数即作用在 label/type 两个字段上。)

§3 临床语义:为什么是这六类

3.1 从内镜到病理:一条分级流水线

结直肠息肉的临床处理是一条标准流水线:内镜筛查发现息肉 → 切除送病理 → 病理医师在 H&E 切片上判读 → 组织学类型 + 异型增生级别 → 随访方案。UniToPatho 的六类恰好覆盖了这条流水线里病理判读的三个决策轴:病变 vs 非病变(NORM vs 其余五类)、增生性 vs 腺瘤性(HP vs TA/TVA,决定"是不是癌前")、管状 vs 管-绒毛状与低级别 vs 高级别(决定随访强度)。论文在讨论中明确指出:管状与管-绒毛状腺瘤的区分、以及异型增生分级,是"对病理医师最困难的任务"——数据集直接把最难的轴做成了标签。

3.2 高级别为什么难:临床与算法的双重瓶颈

高级别异型增生(HG)的诊断难点是双重的。临床侧:HG 与黏膜内癌的分界本身是病理学界长期争论的地带,不同医师判读一致率有限(论文引用的病理判读一致性文献 [19-22] 即为此背景)。算法侧:HG 的形态学证据(核异型、极性紊乱、核分裂象)集中在细胞核尺度,恰恰是低分辨率输入最先丢失的信息——论文基线实验的混淆矩阵显示模型系统性把 HG 判向 LG,与其说是模型弱,不如说是 224×224 的下采样从物理上抹掉了证据。这不是 UniToPatho 一家的问题:Table 3 里 TA.HG 敏感性 0.50、TVA.HG 敏感性 0.52,与后续下游论文反复报告的"高级别类难"完全一致(§7)。使用本数据集做分级研究的团队,应把 HG 类的低敏感性当作基线事实而非自己的失败。

3.3 类不平衡的处理建议

数据集自带的不平衡(TA.LG 42.3% vs TA.HG 5.8%)决定了三件事:评价必须用 Balanced Accuracy 或 macro 平均(论文口径),普通 accuracy 会被多数类淹没;训练侧的常规手段(加权采样、focal loss、类权重交叉熵)在这里都有明确的用武之地;slide 级聚合评估时,HG 类 slide 只有 46 张(26+20),任何 slide 级统计的置信区间都会很宽——报告时给出区间而非单点。论文没有发布官方的类别权重建议,以上是从其评价协议(BA)反推的工程守则。

3.4 病理判读一致性的背景刻度

为什么"算法 70% ≈ 病理医师水平"这种表述是成立的?背景在于病理判读本身的一致性天花板:同一张息肉切片,不同病理医师的分级判断存在可测量的分歧,学界对结直肠息肉乃至更广的病理分级任务反复报告过观察者间变异(论文引用的 [19-22] 正是这一传统)。这给出两条对算法工作者的实操含义:

其一,不要把病理标签当无限精度的金标准。UniToPatho 的 LG/HG 边界本身就处在人类判读的高分歧区——在 HG 类上追求接近 100% 的敏感性,可能实际是在过拟合标注者的个人风格而非学习病变本质。更稳的目标是"算法与标注者的一致度 ≈ 标注者彼此之间的一致度",Perlo et al.(MICAD 2021)的 70% 正是按这个逻辑解释的。

其二,分歧的分布比分歧的大小更有信息量。论文混淆矩阵显示错误集中在"高级别判成低级别"的单向漂移(下采样丢证据所致),而非随机散布——单向漂移指向可修复的架构缺陷(分辨率预算),随机散布才指向标签噪声。拿到任何在本数据集上的混淆矩阵,先看方向性再看幅度。

3.5 与梅氏评分(MHIST)的分级哲学对照

库内另一结直肠 H&E 数据集 MHIST 提供了"每张图一个 1-6 梅氏评分"的软标签设计——用连续分数承载分级的不确定性。UniToPatho 走的是另一条路:硬类别(LG/HG)+ 显式承认边界模糊(级联里的阈值 T_d 超参)。两种设计各有信奉者:软评分适合把不确定性传播进损失函数,硬类别+阈值适合对齐临床决策的实际动作(随访 vs 手术是离散决策)。库内两条路线并存,恰好构成"分级不确定性怎么表达"这一方法论问题的正反教材。

§4 官方基准实验:从"不及格"到 0.67

4.1 实验协议

要素 配置
骨干 ImageNet 预训练 ResNet-18,输出层改 6 类
输入 patch 下采样至 224×224
优化 SGD,50 epochs,初始 lr 0.01,每 20 epochs ×0.1
尺度扫描 σ ∈ {100, 800, 1500, 4000, 7000, 8000} μm
评价 Balanced Accuracy(应对类不平衡)
划分 官方 204/88(按 slide)

4.2 单尺度扫描:一张表看懂"尺度困境"

BA σ=100 σ=800 σ=1500 σ=4000 σ=7000 σ=8000
6 类总 BA 0.40 0.45 0.46 0.41 0.37 0.38
NORM 0.70 0.66 0.72 0.76 0.78 0.71
HP 0.81 0.92 0.85 0.70 0.60 0.69
TA(HG+LG) 0.65 0.66 0.65 0.71 0.76 0.70
TVA(HG+LG) 0.64 0.67 0.68 0.74 0.84 0.76

读法一(纵向):6 类总 BA 在所有尺度上都在 0.37-0.46 之间徘徊——单尺度方法在这个任务上没有出路。读法二(横向逐类):总 BA 的"平"掩盖了 per-type 的"陡"——HP 从 σ=800 的 0.92 单调滑落到 σ=7000 的 0.60(放大视野稀释了腺体结构特征),TVA/NORM/TA 则随视野增大持续走高(组织结构模式需要更大视野)。读法三(设计启示):如果把每类的最佳尺度挑出来(NORM 0.78@7000 / HP 0.92@800 / TA 0.76@7000 / TVA 0.84@7000),一个"分类器知道该看哪个尺度"的架构理论上能显著超越任何单一尺度——这正是论文方法的出发点。

4.3 多分辨率级联分类器:方法的正确打开方式

论文提出的方法是一个三级联 ResNet-18 集成,结构对齐 §3.1 的临床决策轴:

  1. Hyperplastic 分类器:判 HP vs 非 HP——224×224 下采样输入(腺体结构在低分辨率已可辨);
  2. Adenoma 分类器:在腺瘤内判管状 vs 管-绒毛状——224×224 下采样输入;
  3. Dysplasia 分类器:在腺瘤内判 HG vs LG——全分辨率输入(细胞核细节不丢弃),含判决阈值 T_d 可调。

在 σ=7000 测试档上,整个级联的 6 类 BA 达 0.67,对比单尺度基线最佳 0.46,相对提升 50%。混淆矩阵对比(论文 Figure 3)还揭示了一个方法论细节:基线的错误集中在"高级别判成低级别"(下采样丢证据),而级联中全分辨率的 Dysplasia 分类器显著缓解了这一单向偏差。给后续研究者的启示有两条:其一,分辨率预算应该按任务轴分配而不是一刀切——分类轴用低分辨率省算力,分级轴保全分辨率保证据;其二,级联结构与类别体系的临床决策树对齐时,每一级的错误传播是可以单独诊断的。

4.4 Per-class 锚点数字

类别 Sensitivity Specificity BA
NORM 0.86 0.93 0.89
HP 0.79 0.87 0.83
TA.LG 0.60 0.92 0.76
TA.HG 0.50 0.94 0.72
TVA.LG 0.78 0.96 0.87
TVA.HG 0.52 0.92 0.72

这张 Table 3 是后续论文最常引用的对照线。两个模式值得记住:特异性全线高(0.87-0.96)而敏感性分化——模型很少把别的类误判进 HG,但 HG 样本近半被漏掉,这正是类不平衡 + 难类的典型指纹;BA 的类间排序(NORM 0.89 > TVA.LG 0.87 > HP 0.83 > TA.LG 0.76 > TA.HG=TVA.HG 0.72)与视野需求排序基本一致——越依赖细胞核细节的类,BA 越低。

4.5 复现骨架:从 CSV 到可跑的分类器

以下骨架基于官方 dataloader 约定整理,目标是让新接手的工程侧 30 分钟内跑通第一次训练:

# 1) 数据组织约定(IEEE DataPort 下载后)
# unitopatho/
# ├── 800/                     # σ=800 μm 档 patch(8,669 张 PNG)
# │   └── <top_label>/<image_id>.png
# ├── 7000/                    # σ=7000 μm 档 patch(867 张 PNG)
# │   └── <top_label>/<image_id>.png
# └── csv/                     # 元数据(每档一套)
#     ├── train.csv / test.csv # 或统一 csv,含 slide 引用字段
# 每行字段:image_id, label(6类), type(4类), WSI 引用, roi, mpp, x, y, w, h

# 2) 标签视图切换(官方 dataloader 的 target 参数语义)
LABEL_MAP_6 = ["HP", "NORM", "TA.HG", "TA.LG", "TVA.HG", "TVA.LG"]
TYPE_MAP_4  = ["HP", "NORM", "HG", "LG"]   # HG=TA.HG+TVA.HG, LG=TA.LG+TVA.LG

# 3) 划分纪律:按 WSI 引用切,绝不在 patch 级随机切
def patient_level_split(df, seed=42):
    slides = df["wsi_reference"].unique()          # 292 个唯一 slide
    rng = np.random.default_rng(seed)
    train_slides = set(rng.choice(slides, size=204, replace=False))
    is_train = df["wsi_reference"].isin(train_slides)
    return df[is_train], df[~is_train]             # 204 slide / 88 slide

# 4) 指标:BA(与论文可比的唯一口径)
def balanced_accuracy(y_true, y_pred, n_classes=6):
    recalls = [recall_score(y_true == c, y_pred == c) for c in range(n_classes)]
    return float(np.mean(recalls))                 # 各类召回宏平均

# 5) 单尺度基线(论文 §3 协议)
#    ResNet-18(ImageNet) -> 输出层 6 类
#    SGD lr=0.01, momentum 默认, 50 epochs, 每 20 epochs lr ×0.1
#    patch 在线 resize 到 224×224
#    期望对照:σ=1500 档 6 类 BA ≈ 0.46(Table 2)

# 6) 类不平衡三件套(论文未强制,但 HG 类必需)
#    a) 加权采样:WeightedRandomSampler 按 1/sqrt(class_count)
#    b) 类权重交叉熵:weight ∝ 1/class_frequency
#    c) 报告口径:BA + per-class Sensitivity/Specificity(Table 3 口径)

# 7) 分辨率处理(两档不同策略)
#    σ=800 档:1812² → resize 224²(论文口径,结构特征保留)
#    σ=7000 档:15855² → 切勿整图 resize(15,855→224 压缩 70 倍,
#              细胞核证据全灭);论文 Dysplasia 分类器用"全分辨率",
#              工程实现可取中央裁切或多裁切集成,并在文中声明

三条纪律重申:划分按 slide(204/88 是复现一切的锚);指标用 BA(accuracy 与论文及下游文献不可比);7000 档慎用整图下采样(论文的 0.67 正是靠"分级轴保全分辨率"挣来的)。

§5 获取与许可:一扇门、一把钥匙、两种箱子

5.1 资产清单与许可矩阵

资产 位置 许可 获取方式
数据集本体(PNG+CSV,两档) IEEE DataPort,DOI 10.21227/9fsv-tm25 CC BY 4.0 open access,免费注册 IEEE DataPort 账号后下载
Dataloader 与基线代码 GitHub EIDOSlab/UNITOPATHO MIT 公开直链(PyTorch class、ECVL loader、Example.ipynb、Dockerfile、两套 YAML 配置)
论文正式版 IEEE Xplore(ICIP 2021, pp. 76-80) IEEE 版权 订阅/购买;预印本替代
论文预印本 arXiv:2101.09991(v2, 2021-02-10) arXiv 许可 公开直链
公告与论文 PDF 存档 Zenodo 记录 4643645 / 5568937 随记录标注 公开直链(注意:是文档不是数据本体)

UniToPatho 的获取结构在医学数据集里属于"最顺滑"的一档:唯一的门是 IEEE DataPort 的免费注册,没有申请审批、没有邮寄 DUA、没有冷却期。CC BY 4.0 意味着商用与再分发均允许(需署名)——对比库内大量 CC BY-NC 系数据集(商用被禁止),若你的项目含商业化路径,这是少数可以直接用的病理集之一。

5.2 下载实操要点

  1. 两种箱子别下混:DataPort 提供 σ=800 与 σ=7000 两档分别打包。800 档是主力训练集(8,669 patch),7000 档只有 867 patch 但体积可能更大(单张 15,855² px)——磁盘规划与加载管线要分开设计。GitHub 仓库的 unitopath-public-800.yml / unitopath-public-7000.yml 是官方加载配置,指路作用。
  2. CSV 是第一公民:先读 CSV(image_id、label、type、WSI 引用、roi、mpp、坐标 x/y/w/h)再动图像——官方 split 复现、类分布统计、MIL 式 slide 聚合全部依赖 CSV 字段。
  3. dataloader 的 target 参数:官方 PyTorch class 支持 target ∈ {type, grade, top_label} 三种标签视图——type 是 4 类、grade 聚焦 HG/LG、top_label 对应 6 类层次。选错 target 会导致数字与论文不可比。
  4. 版本唯一:数据自 2021-02-09 发布、2021-05-04 最后更新后无新版本,引用时 DOI 写 10.21227/9fsv-tm25 即可,无需版本号。

5.3 下载后完整性校验流程

拿到数据包后 10 分钟内做完四步校验,再开始任何训练:

# 1) 行数对表:CSV 行数应精确等于
#    800 档 = 8,669 行;7000 档 = 867 行(附录 F 总表)
wc -l unitopatho_800.csv unitopatho_7000.csv

# 2) 类分布对表:每类计数对齐附录 F
#    800 档: HP 545 / NORM 950 / TA.HG 454 / TA.LG 3618 / TVA.HG 916 / TVA.LG 2186
#    7000 档: HP 59 / NORM 74 / TA.HG 98 / TA.LG 411 / TVA.HG 93 / TVA.LG 132
# 用 pandas 一行: df.label.value_counts()

# 3) 唯一性检查
#    - image_id 无重复(主键)
#    - wsi_reference 唯一值数 = 292(全集)
#    - mpp 字段全为 0.4415(异常行 = 脏数据)

# 4) 图像抽查:随机抽 10 行
#    - 图像可打开、H&E 着色正常(紫红/粉白)
#    - 实际像素尺寸与 w/h 字段一致
#    - 图像目录层级与 CSV 的 label/top_label 目录对应

四步全过再开工;任何一步对不上,先到 GitHub 仓库 issue 区与 DataPort 反馈页核对是否已知问题,不要自行"修补"数据。

5.4 两档联合训练的合法姿势

如果研究确实需要同时吃进两档(例如多分辨率对比学习),三条合法路径:其一,双塔/双视图架构——两档各走各自的编码器,在特征层对齐(论文级联法的对称版);其二,同档化预处理——把两档都映射到统一有效视野(如都重采样到等效 800 μm 视野),声明这是有损变换并单独消融;其三,分档分阶段——800 档预训练、7000 档微调(或反过来),阶段间不做混批。唯一的错误姿势是不加声明的随机混批——那会让"两档"这个变量与其他超参完全纠缠。

5.5 AI-Ready 评估:五维快照

维度 评分 依据
可发现性 Discoverability ★★★★☆ 正式 DOI + ICIP 论文 + arXiv + Zenodo + GitHub 五路锚点;但名称大小写两套(坑 1)增加检索摩擦
可获取性 Accessibility ★★★★★ CC BY 4.0 + 免费注册即得 + 无 DUA,医学数据里的第一梯队
互操作性 Interoperability ★★★★☆ PNG/CSV 通用格式 + PyTorch/ECVL 官方 loader + YAML 配置;扣一星在无 NIfTI/WSI 本体发布(patch 裁切需自行按坐标复现)
元数据 Metadata ★★★☆☆ CSV 字段完备(坐标/ROI/mpp 齐全);但无病人人口学元数据、无标注者信息、无 stain 协议细节
可持续性 Sustainability ★★★☆☆ IEEE DataPort 托管稳定;但 GitHub 2023-05 后无维护、无常设 leaderboard、项目(DeepHealth)已结题

综合:AI-Ready 光谱上位于"开放友好、工程干净、但标注元数据薄"的象限。适合直接进训练管线;不适合需要人口学协变量或原 WSI 重分析的研究。

§6 下游使用生态:48 次引用里的四种玩法

6.1 引用画像

Semantic Scholar 收录 48 次引用(2026-09 抓取时点)。按玩法人种分四类:分级方法竞技(把 HG/LG 判别当主战场,占引用主力)、半监督/数据效率(利用 patch 量大而标注成本低的特点)、架构迁移(新骨干在 UniToPatho 上对齐基线)、综述与调查(作为结直肠病理 AI 的标准引用项)。引用的时间分布也值得一看:2021-2022 年以同组与方法跟进为主,2023 年起方法竞技类爆发(FFC-ResNet 一篇即贡献 19 次),2024-2025 年转向半监督、弱监督等范式类工作——一条典型的"数据集从基准变成基础设施"的引用演化曲线。代表性工作五篇:

工作 发表处 方法要点 报告数字
Perlo et al.(同组后续) MICAD 2021 WSI 级 CNN 分级 70% 准确,与病理医师间一致度相当
Paing & Pintavirooj IEEE Access 2023 FFC-ResNet(ResNet-50 + 傅里叶卷积融合局部/全局特征) 本数据集引用量最高的下游方法论文(19 引用)
Paing, Cho & Cho 2023 会议 RaAdam + label smoothing 7000 μm 档分类
Sasmal et al. Information Sciences 658, 2024(doi:10.1016/j.ins.2023.120033) 半监督 GAN(有限标注+大量未标注对抗学习) 87.50% / 76.25%(25% / 50% 多数投票方案)
Yengec-Tasdemir et al. Computers in Biology and Medicine 172, 2024(doi:10.1016/j.compbiomed.2024.108267) Supervised Contrastive + Big Transfer (BiT) UniToPatho 上 70.3%

6.2 数字横向对比的三条安全守则

下游数字(70%、87.5%、70.3%……)不可直接横比,原因有三:其一,任务口径不一——有的是 6 类全任务,有的是 4 类 type,有的是腺瘤子集上的 HG/LG 二分类,类别数不同 BA/accuracy 完全不可换算;其二,patch 档位不一——800 档与 7000 档的难度结构差异巨大(§4.2),混用会让"87.5%"与"70.3%"失去共同参照系;其三,划分复现不一——部分工作未严格沿用官方 204/88 按 slide 划分,可能存在 patch 级随机划分的泄漏红利。引用任何下游数字前,先核对三件事:类协议、patch 档位、划分方式。本条目正文引用的论文口径数字均按原文标注,不做跨论文归一。

6.3 空白地带:还没有人做的事

从下游文献的覆盖看,至少三块仍是空白:WSI 级弱监督(用 patch 标签训练 slide 级分级器的 MIL 路线,CSV 的 WSI 引用与坐标字段已为此备好数据结构);跨模态对齐(同一病人的内镜图像与病理图像配对学习——数据集本身不含内镜图,但与库内内镜家族联合可以构造);** stain 归一化鲁棒性**(单中心单扫描仪是 UniToPatho 的短板,反过来使它成为多中心 stain 归一化研究中理想的"源域")。这些空白与 §7 的库内互链组合,可直接产出新的实验设计。

6.4 下游工作档案:逐篇细读

Perlo et al., MICAD 2021(同组续作)。这是 UniToPatho 生态里承上启下的一篇:同一批作者(Perlo、Tartaglione、Bertero、Cassoni、Grangetto)把 patch 级数据集推进到 WSI 级分级任务——不再依赖预先裁好的 patch,而是让 CNN 直接在全切片上判 HG/LG。70% 的准确率单看不高,但论文将其与病理医师之间的一致度对表后意义翻转:算法已摸到"人类水平"的地板。对库内读者的价值在于它示范了"patch 数据集 → slide 级任务"的路线,CSV 的 WSI 引用字段正是这条路线的接口。

Paing & Pintavirooj, IEEE Access 2023(FFC-ResNet)。本数据集引用量最高的下游方法论文(19 引用)。方法核心是把快速傅里叶卷积(FFC)嵌入 ResNet-50:空间卷积抓局部纹理(细胞形态),傅里叶卷积抓全局频率结构(组织排列模式)——恰好对位 UniToPatho 揭示的"局部结构 vs 全局组织"双尺度需求。它在本数据集上的成功反过来印证了论文的核心论点:单一感受野不足,需要架构级的全局-局部融合。

Paing, Cho & Cho, 2023。同一第一作者的前置工作,走的是训练技巧路线:Radam(rectified Adam)优化器 + label smoothing,在 7000 μm 档上做分类。它的存在说明 7000 档虽然只有 867 个 patch,但配合预训练与正则技巧仍是可训练的——对算力有限的团队是个参考点。

Sasmal et al., Information Sciences 2024(半监督 GAN)。把 UniToPatho 放进"标注贵、未标注便宜"的半监督叙事:判别器在监督模式学分类、在对抗模式辨真假,25% 多数投票方案下报 87.50%。需要提醒的是该数字的任务口径与论文基线的 6 类 BA 不直接可比(§6.2 三守则),它真正的贡献是验证了"本数据集的 patch 量足够支撑半监督框架"。

Yengec-Tasdemir et al., Computers in Biology and Medicine 2024(Sup-Con + BiT)。监督对比学习 + Big Transfer 预训练的组合,在 UniToPatho 上 70.3%。有趣的是它与 Sasmal 的对照:一个走生成式半监督(87.5%),一个走对比式迁移(70.3%),数字差距背后是任务口径差异而非方法优劣——这正是 §6.2 警告的活例子。

Bhatt et al., 2024(Asia Pacific Conference on Innovation)。结直肠组织分类自动化方向的应用型工作,把 UniToPatho 列为验证集之一,代表"工业界把本数据集当标准石蕊试纸"的用法。

Fu et al., Frontiers in Pharmacology 2025(PAT-MIL)。多模态弱监督框架(病理注意力多实例学习),做五类 WSI 级结直肠病变分类。它引用 UniToPatho 是作为"patch 级标注的代表数据集"支撑其"像素级标注昂贵、需要弱监督"的动机——说明本数据集在文献里的另一个角色:弱监督方法论的动机来源。

§7 与库内条目的关系:家族图谱与检索路径

7.1 同器官两模态:病理家族

条目(rid) 模态/任务 与 UniToPatho 的关系
MHIST(168) H&E patch 二分类(HP vs SSA) 最近邻:同模态同器官;差异在类制(二分类 vs 六类)与有梅氏评分
NCT-CRC-HE-100K(148) H&E patch 9 类组织分类 同模态互补规模(大百倍);但无"腺瘤级别"维度
GlaS(196) H&E WSI 腺体实例分割 同器官分割粒度;UniToPatho 坐标字段可为其提供 patch 式切入
CoNSeP(228) H&E 核实例分割 同器官细胞核粒度;HG 难题的"证据级"视角
DigestPath(338) 消化道病理检测+分割 同系统不同病变谱;任务粒度互补
PANDA-PLUS(640) 前列腺 WSI 像素级重标注 数字病理方法论互链(标注流水线/标签质量视角)

7.2 同病变异模态:内镜家族

条目(rid) 模态/任务 对照叙事
HyperKvasir(693) 胃肠内镜息肉检测 “长相”(内镜下形态)vs"本质"(病理诊断)
Kvasir-SEG(112) 内镜息肉分割 同上,分割粒度
PolypGen(183) 多中心内镜息肉检测分割 多中心 vs UniToPatho 单中心的域偏移互补
ETIS-Larib(153) 内镜息肉分割困难基准 困难样本叙事互链
CVC-ClinicDB(133) 结肠镜息肉分割 内镜分割经典锚点

7.3 检索路径建议

三条可写进相关文章的路径:“息肉的两种真相”——HyperKvasir(693)/Kvasir-SEG(112)(内镜所见)→ UniToPatho(病理判读)→ MHIST(168)/NCT-CRC-HE-100K(148)(更大规模病理分类);“分级为什么难”——UniToPatho §4 尺度困境 → CoNSeP(228)/GlaS(196)(细胞/腺体级证据)→ DigestPath(338)(病变级检测);“从单中心到多中心”——UniToPatho(单中心 CC BY 4.0)→ PolypGen(183)(多中心设计)→ 域泛化讨论。做胃肠 AI 综述或基准横评时,UniToPatho 是病理侧不可跳过的六类锚点。

7.4 方法论互鉴:三条可迁移的经验

经验一:分辨率预算是设计变量,不是工程常数。几乎所有病理 AI 流水线默认"224×224 进网络",UniToPatho 的贡献是把这一默认变成了实验变量——σ 扫一张表(Table 2),证据立刻显形:有的类要低倍视野、有的类要细胞级细节。这套"尺度 × 类别"矩阵分析法可以原样搬到任何分级/分类任务:把"分辨率"换成"放大倍数"“patch 尺寸”“上下文窗口”,同样的表格都能画,都能暴露单一设定的盲区。

经验二:架构对齐临床决策树。论文的级联设计不是堆模型,而是把"良性 vs 腺瘤性 → 亚型 → 级别"的临床判读顺序翻译成计算图。收益有二:每个级联级的错误可单独诊断(哪一轴错了一目了然);每级可分配不同的输入预算(类型轴省算力、级别轴保细节)。这种"诊断轴即计算图"的翻译法,对任何有决策树结构的医学任务都适用。

经验三:把"做不到"写进数据集设计。两档视野的存在本身是在承认"没有哪个单一尺度是对的"——数据集结构承载了方法论立场。对比常见的做法(选一个尺度发布),两档设计让后续研究者免于重新采集就能复现尺度实验。发布数据集时多想一层"我的选择会把使用者锁进哪些假设",是这条经验的一般化。

§8 避坑清单:八个已踩过或必踩的坑

坑 1:名称大小写两套,检索要双打。论文正文与引用键用 “UniToPatho”(CamelCase),IEEE DataPort / GitHub / Zenodo 标题用 “UNITOPATHO”(全大写);Semantic Scholar 条目名用 “Unitopatho”。全文检索时三种写法都要试,否则会漏掉三分之一的文献。数据集 DOI(10.21227/9fsv-tm25)是最稳的检索锚点。

坑 2:Table 1 的 8,669 vs 8,699 数字漂移。ar5iv 渲染版论文中 σ=800 行 Total 显示 “8699”,但同一版正文写 “8669 of which extracted at σ=800”;分项和校验(545+950+454+3618+916+2186=8,669)与总量自洽(8,669+867=9,536,与摘要一致)都支持 8,669。自动化抽取若采到 8,699 请按校验和修正,并注漂移来源。

坑 3:“800 and 7000 um/px” 不是两种像素密度。DataPort Instructions 原文这句容易读成"两档 per-pixel 分辨率",实际两档 patch 共用同一原始扫描(mpp=0.4415),800/7000 是视野边长(μm)。论文记号 σ(patch scale)为准。误读后果:把两档当成分辨率增广混进训练管线,域设定就错了。

坑 4:高级别类敏感性低是基线事实,不是你的 bug。Table 3 中 TA.HG 敏感性 0.50、TVA.HG 敏感性 0.52——官方方法的 HG 类近半漏检。下游复现若得到类似数字属正常水平;宣称"HG 敏感性大幅超越"的工作要检查是否换了任务口径(如只做腺瘤子集二分类)或划分方式。

坑 5:6 类 / 4 类 / 二级三套协议不可互比。同一数据集存在 label(6 类)、type(4 类)、grade(腺瘤子集 HG/LG)三种标签视图,官方 dataloader 的 target 参数即可切换。下游文献的"准确率"分属不同协议,横比前先核对类数与子集(§6.2)。

坑 6:Zenodo 两个记录不是数据。Zenodo 4643645 是公告 PDF(930.8 kB)、5568937 是论文 PDF(1.5 MB)——有人把 Zenodo 记录当数据镜像引用,实际数据本体只在 IEEE DataPort(DOI 10.21227/9fsv-tm25)。引用"数据来自 Zenodo"是错误溯源。

坑 7:作者署名双口径。ICIP 论文 7 作者(Barbano, Perlo, Tartaglione, Fiandrotti, Bertero, Cassoni, Grangetto);IEEE DataPort 与 Zenodo 数据署名 9 人(另含 Alessandro Gambella、Luca Cavallo——医学侧数据采集/标注参与者)。论文引用与数据引用各按其口径,别混。

坑 8:单中心单扫描仪,别宣称泛化。全部 292 张来自都灵大学、全部经 Hamamatsu Nanozoomer S210 扫描,无跨中心、无跨扫描仪、无多染色协议变量。任何"在 UniToPatho 上训练的模型可泛化到 xx"的外推都要有独立外部验证支撑;反之,它的纯度使它适合当多中心研究中的受控源域(§6.3)。

坑点速查卡:

坑 一句话记忆 详见
1 三种拼写都搜,锚定 DOI §8 坑 1
2 8,669 对(8,699 是渲染错) §8 坑 2、附录 J
3 800/7000 是 μm 视野不是 mpp §8 坑 3、附录 U
4 HG 敏感性 0.50 是地板不是 bug §8 坑 4、§3.2
5 三套协议数字不可互比 §8 坑 5、§6.2
6 Zenodo 是文档不是数据 §8 坑 6、§5.1
7 论文 7 人 / 数据 9 人 §8 坑 7、附录 J
8 单中心禁泛化宣称 §8 坑 8、附录 M

§9 总结

9.1 三句话总结

  1. UniToPatho 用 292 张 WSI、9,536 个两档视野 patch、6 类/4 类双层标签,把结直肠息肉病理判读的完整决策轴(病变性/腺瘤性/级别)做成了公开可下载的 CC BY 4.0 数据集。
  2. 它的核心学术贡献不是规模而是洞见:per-type 尺度敏感性表证明单一分辨率从设计上就会牺牲部分类别,多分辨率级联架构把 BA 从 0.46 提到 0.67。
  3. 它的工程友好度在病理数据集里属第一梯队——正式 DOI、免费注册即得、MIT 代码、官方 dataloader 与 split——短板在标注元数据薄与单中心纯度。

9.2 适合谁

  • 做息肉分类/分级的团队:六类 + 官方 split + 基线锚点,开箱即用;
  • 研究多分辨率/多尺度学习的人:σ 扫描协议与级联设计是现成的方法论模板;
  • 需要 CC BY 4.0(可商用) 病理数据的产品线;
  • 做跨模态叙事(内镜↔病理)或域泛化受控实验(单中心源域)的研究者。

9.3 不适合谁

  • 需要像素级分割掩码或 WSI 本体的工作(→ GlaS、CoNSeP、DigestPath);
  • 需要病人口学元数据(年龄/性别/随访结局)的预后建模;
  • 追求大规模预训练的团队(9,536 patch 的量级远小于 NCT-CRC-HE-100K 的 10 万级);
  • 期待常设 leaderboard 持续刷榜的人(无常设评测,投稿需自行复现官方协议并明确声明)。

9.4 30 秒决策卡

你的场景 建议
六类分类基线复现 800 档 + 官方 split + BA 指标,对照 0.46(单尺度)/ 0.67(级联)
腺瘤分级研究 7000 档 + type 协议 + 全分辨率输入,对照 HG 敏感性 ~0.50-0.52 的基线事实
多分辨率架构论文 直接对标 Table 2 per-type 最佳尺度表,这是现成的 motivation
可商用病理数据 CC BY 4.0 直接用,署名 DOI 10.21227/9fsv-tm25
分割任务 换 GlaS(196)/CoNSeP(228),本数据集无掩码
跨模态内镜-病理 本集做病理侧,配 HyperKvasir(693)/PolypGen(183) 做内镜侧

9.5 五分钟上手清单

  1. 注册 IEEE DataPort(免费),下载 σ=800 档(训练主力)——若做分级再加 σ=7000 档。
  2. 克隆 GitHub EIDOSlab/UNITOPATHO,读 unitopatho.py 的 target 参数签名(三选一标签视图)。
  3. 跑 §5.4 的四步完整性校验(行数/类分布/唯一性/图像抽查)。
  4. 用 wsi_reference 字段复现 204/88 划分(附录 E),写死随机种子。
  5. 训练 ResNet-18 基线(§4.1 协议:SGD 50 epochs,lr 0.01,224²),目标对齐 BA ≈ 0.46。
  6. 评估输出三件套:BA + per-class Sens/Spec + 混淆矩阵(对照 Table 3)。
  7. 报告前过一遍附录 AE 六要素模板与附录 R 反例清单。

FAQ(高频问答 35 问)

A. 基础认知

Q1:UniToPatho 是什么?
都灵大学 2021 年发布的结直肠息肉 H&E 组织病理学数据集:292 张 WSI(每位病人一张)标注后裁出 9,536 个 patch,支持 6 类组织类型分类与腺瘤异型增生分级,ICIP 2021 论文发表,CC BY 4.0 于 IEEE DataPort 开放。

Q2:名字为什么有大写小写两种?
论文正文写 UniToPatho(UniTO=都灵大学缩写+Patho),数据托管平台与 GitHub 用全大写 UNITOPATHO。指同一数据集,检索时两种都试。

Q3:数据从哪来?
都灵大学结直肠息肉筛查/诊疗流程中的 H&E 染色标本,Hamamatsu Nanozoomer S210 扫描(20×,0.4415 μm/px),由都灵大学专家病理医师标注。是 EU Horizon 2020 DeepHealth 项目(No 825111)的 Use Case 2 产物。

Q4:论文发在哪?
ICIP 2021(IEEE International Conference on Image Processing),pp. 76-80,doi:10.1109/ICIP42928.2021.9506198;预印本 arXiv:2101.09991(v1 2021-01-25,v2 2021-02-10)。

B. 数据与获取

Q5:有多少数据?
292 张 WSI → 9,536 个 patch:σ=800 μm 档 8,669 个(1812² px)+ σ=7000 μm 档 867 个(15,855² px)。每位病人一张 slide,故 292 即病人数。

Q6:怎么下载?
IEEE DataPort(ieee-dataport.org/open-access/unitopatho,DOI 10.21227/9fsv-tm25)免费注册后下载;dataloader 在 GitHub EIDOSlab/UNITOPATHO(MIT)。注意 Zenodo 上的两个记录只是公告与论文 PDF,不是数据。

Q7:商用可以吗?
可以。数据 CC BY 4.0(署名即可),代码 MIT。这在医学病理数据集里属于最宽松档(多数同类是 CC BY-NC,禁商用)。

Q8:两档分辨率怎么选?
不是"分辨率"是"视野边长":800 μm 档看局部细胞细节(训练主力,8,669 个),7000 μm 档模拟病理医师低倍视野(论文最终评估主战场,867 个)。两档共用原始扫描像素密度。分级研究强烈建议 7000 档——HG 证据在细胞核细节里,但判定需要结构语境。

Q9:CSV 里有什么?
每条 patch 一行:image_id、label(6 类)、type(4 类)、reference WSI、roi(ROI 引用)、resolution(mpp)、patch 坐标 (x,y,w,h)。官方 split 的复现依赖 WSI 引用字段。

C. 协议与基准

Q10:官方基准是什么水平?
单尺度 ResNet-18(224² 输入)6 类 BA 最高 0.46(σ=1500);论文多分辨率级联集成达 0.67(σ=7000 测试档)。per-class 锚点:NORM BA 0.89 / HP 0.83 / TVA.LG 0.87 / TA.LG 0.76 / TA.HG=TVA.HG 0.72。

Q11:官方划分是什么?
按 slide(=病人)70/30:204 train / 88 test。复现时通过 CSV 的 WSI 字段保持划分,别做 patch 级随机切分(会泄漏)。

Q12:评价指标为什么是 Balanced Accuracy?
类不平衡:TA.LG 占 patch 级 42.3% 而 TA.HG 仅 5.8%,普通 accuracy 会被多数类淹没。BA(各类召回的宏平均)是论文与后续文献的通行口径。

Q13:为什么单尺度基线这么差?
尺度困境:HP 的证据在腺体结构(σ=800 时 BA 0.92),TVA/NORM 的证据在组织结构(σ=7000 时最佳),而 HG 的证据在细胞核细节(下采样即失)。任何单一尺度都会牺牲至少一类——这正是论文的核心论据。

Q14:HG 类为什么敏感性只有 0.50 左右?
三重叠加:类样本少(patch 5.8% / slide 15.8%)、证据尺度细(核异型/极性/核分裂)、临床边界本身模糊(HG 与黏膜内癌分界是病理学界长期争议带)。这是数据集固有难度,复现得到类似数字属正常。

D. 使用与工程

Q15:PyTorch 怎么加载?
GitHub EIDOSlab/UNITOPATHO 提供 unitopatho.py(PyTorch Dataset 类,target 参数切 type/grade/top_label 三种标签视图)与 unitopatho_ecvl.py(ECVL loader),配 unitopath-public-800.yml / unitopath-public-7000.yml 两套配置,另有 Example.ipynb 与 Dockerfile。

Q16:训练要注意什么?
类不平衡处理(加权采样/类权重/focal loss 均适用);评价用 BA 或 macro 平均;分档数据分开建管线(7000 档单图 15,855² px,直接全量加载会爆内存,建议在线裁切或预下采样);报告时声明协议(类数+档位+划分)。

Q17:能用来做分割吗?
不能直接做。数据集只发布 patch 级标签,无像素掩码、无 WSI 本体发布。分割需求请转 GlaS(腺体实例分割)或 CoNSeP(核实例分割);UniToPatho 的坐标字段理论上支持"回到 WSI 重裁"的 DIY 路线,但需自行申请 WSI 或接受 patch-only 边界。

E. 生态与对比

Q18:和 MHIST 什么区别?
同为结直肠 H&E patch 分类:MHIST 是二分类(HP vs SSA)带梅氏评分,UniToPatho 是六类(组织类型×级别)带官方多尺度协议。MHIST 任务更简单但带难度标注,UniToPatho 任务更完整且有尺度敏感性分析。

Q19:和 NCT-CRC-HE-100K 什么区别?
NCT-CRC-HE-100K 是 10 万级 9 类组织型 patch(正常组织-肿瘤组织类型),规模大百倍但无"腺瘤级别"标签;UniToPatho 小而深——唯一带 LG/HG 分级维度的公开结直肠 H&E patch 集之一。预训练选前者,分级研究绕不开后者。

Q20:和内镜息肉数据集(HyperKvasir 等)什么关系?
同一病变的两种模态:内镜看"长相"(表面形态),病理看"本质"(组织学)。UniToPatho 不含内镜图像,但与 HyperKvasir(693)/Kvasir-SEG(112)/PolypGen(183) 组合可构造跨模态对照或对齐实验——这是库内互链的主叙事线。

Q21:引用生态如何?
Semantic Scholar 48 次(2026-09 抓取)。代表作:FFC-ResNet(IEEE Access 2023,本集引用最高的下游方法)、半监督 GAN(Information Sciences 2024,87.50%)、SupCon+BiT(CBM 2024,70.3%)、同组 MICAD 2021 WSI 分级(70%,与病理医师一致度相当)。横比前先核对协议(坑 5)。

Q22:维护状态如何?
数据 2021-05-04 后无版本更新(原始粒度数据本就无需迭代);GitHub 仓库 2023-05-18 后无提交;无常设 leaderboard。DeepHealth 项目已结题。把它当"稳定的历史基准"使用是正确姿势。

F. 深水区与陷阱

Q23:为什么我的复现比论文 BA 低很多?
按顺序排查四件事:① 划分是否按 slide(patch 级随机切会虚高,不会低);② 指标是否为 BA(普通 accuracy 口径不同);③ 输入处理是否与论文一致(224² resize;7000 档整图 resize 会让分级轴崩掉);④ 类不平衡处理是否失效(batch 内 HG 样本过少会让 BA 拖尾)。论文基线本身只有 0.37-0.46,先对齐基线再谈超越。

Q24:能把 800 档和 7000 档混在一起训练吗?
可以但要当"多分辨率输入"明确设计(论文的级联法就是范式),不能当同一分布随机混批——两档的视野与信息结构不同,混批等价于引入未声明的域移。若只是数据增强式混用,须在消融中单独验证增益来源。

Q25:patch 坐标字段有什么用?
(x, y, w, h) + WSI 引用 + ROI 引用让你能:重建 patch 在 WSI 上的空间邻接关系(做空间聚合/上下文增强);按 ROI 分组做 slide 级 MIL;检查两档 patch 的嵌套关系。这是本数据集比"纯图+标签"集多出的工程价值。

Q26:能拿它做预训练吗?
不推荐作为主预训练集——9,536 张的量级太小(对比 NCT-CRC-HE-100K 的 10 万级)。合理用法:ImageNet 或病理基础模型预训练后,用 UniToPatho 做微调与评测;或作为跨数据集泛化的目标域。

Q27:类不平衡该用哪种策略?
论文未给官方建议,工程上三选一即可起步:加权采样(1/√n)、类权重 CE、focal loss。关键是不管用哪种,评价必须 BA;HG 类的敏感性要单列报告(附录 O 第 7 条)。

Q28:数据有几个人口学字段?
没有。数据集不含年龄、性别、随访结局等任何病人口学元数据——这是它 Metadata 维度 3/5 的主因(附录 B)。需要协变量的研究请另配队列或改用 TCGA 系。

Q29:OpenDataLab 的镜能用吗?
能用但引用请走官方 DOI。镜像的价值是网络可达性(国内下载快),风险是更新滞后与完整性无承诺。生产环境建议 DataPort 原包 + md5 校验。

Q30:为什么它没有 HyperKvasir 那样的知名度?
三个原因叠加:发布当年(2021)病理 patch 分类赛道已被 NCT-CRC-HE-100K(2020,10 万级)占住规模心智;它没有挂靠常设挑战赛(对比 KiTS/BraTS 系);组织方是 ML 实验室而非大型医学中心联盟。但"分级维度+双尺度协议"这两个差异化资产使其引用稳步积累(48 次/5 年)。

Q31:与 K19/K27 等病理基准怎么选?
若任务含"腺瘤级别"判断 → UniToPatho 几乎是公开数据里唯一带 LG/HG 双级腺瘤标签的 patch 集之一,没有替代;若只要组织型分类 → NCT-CRC-HE-100K 规模与多样性全面占优;若要分割 → GlaS/CoNSeP。三者是互补不是竞争。

Q32:快速验证数据完整性的方法?
三步:① CSV 行数 = 8,669(800 档)/ 867(7000 档);② 每类的 label 分布对齐附录 F 总表;③ 抽查任意 10 行,patch 坐标 (x,y,w,h) 与图像实际尺寸换算一致(w/h 应等于 1812 或 15,855 减去边缘裁切余量),mpp 字段应全为 0.4415。三步全过即可开工。

Q33:两档 patch 在空间上能配对吗?
坐标字段支持检查重叠,但不保证精确嵌套(两档独立裁切)。做跨档配对前先算真实重叠率(附录 AF 第 1 条);更稳的跨档利用是"重建虚拟低倍镜"或"结构上下文注入"两条路线。

Q34:可以拿它发方法论文吗?
可以且已被验证:本集 48 次引用里相当比例是方法论文(FFC-ResNet、SupCon+BiT、半监督 GAN 等)。方法 novelty 的富矿在:HG 分级(未解决)、多分辨率融合架构、半监督/弱监督、slide 级聚合。记得遵守附录 AE 的六要素报告模板。

Q35:如果我只想要"分级"子集怎么取?
按 type 字段过滤 LG/HG(即 TA.LG/TA.HG/TVA.LG/TVA.HG 四类 7,908 个 patch),或进一步只取腺瘤 slide。注意两点:NORM/HP 被排除后类分布重构(LG 5,347 vs HG 1,561,约 3.4:1);务必声明"腺瘤子集协议",否则数字无法与 6 类工作对表。

§10 事实清单:硬事实 32 条

# 事实 来源锚点
1 数据集名称 UniToPatho / UNITOPATHO ICIP 论文标题 / DataPort 页面标题
2 数据集 DOI 10.21227/9fsv-tm25 DataPort / doi.org
3 论文 ICIP 2021, pp. 76-80, doi:10.1109/ICIP42928.2021.9506198 GitHub README 引用块 / IEEE Xplore
4 arXiv:2101.09991,v1 2021-01-25,v2 2021-02-10 arXiv abs 页
5 数据发布 2021-02-09,最后更新 2021-05-04 DataPort 页面 <time> 字段 2021-05-04T12:53:37+00:00(美式 05/04/2021 = 5 月 4 日,勿误读)
6 9,536 个 H&E patch 论文摘要 / DataPort 摘要 / GitHub README 三源一致
7 292 张 WSI 论文摘要 / DataPort 摘要 / GitHub README 三源一致
8 每张 slide 来自不同病人(→292 病人) 论文原文 Each slide belongs to a different patient
9 Hamamatsu Nanozoomer S210 扫描仪 论文 / DataPort Description
10 20× 放大,0.4415 μm/px 论文 / DataPort Description
11 σ=800 μm 档 8,669 patch(1812² px) 论文正文(Table 1 分项和校验自洽)
12 σ=7000 μm 档 867 patch(15,855² px) 论文正文/Table 1
13 六类:NORM/HP/TA.LG/TA.HG/TVA.LG/TVA.HG 论文 / DataPort / GitHub 三源一致
14 四类 type:NORM/HP/HG/LG DataPort Instructions / CSV 字段说明
15 slide 分布:NORM 21/HP 41/TA.LG 146/TA.HG 26/TVA.LG 38/TVA.HG 20 论文 Table 1(和=292 ✓)
16 patch 总分布:NORM 1024/HP 604/TA.HG 552/TA.LG 4029/TVA.HG 1009/TVA.LG 2318 论文 Table 1(和=9,536 ✓)
17 官方划分 204 train / 88 test(按 slide 70/30) 论文正文
18 基线:ImageNet ResNet-18,SGD 50 epochs,lr 0.01(每 20 epochs ×0.1),224×224 论文 §3
19 单尺度扫描 σ ∈ {100, 800, 1500, 4000, 7000, 8000} μm 论文 Table 2
20 6 类 BA 按 σ:0.40/0.45/0.46/0.41/0.37/0.38(最佳 0.46@σ=1500) 论文 Table 2 首行
21 per-type 最佳:HP 0.92@σ=800;NORM 0.78@σ=7000;TA 0.76@σ=7000;TVA 0.84@σ=7000 论文 Table 2
22 多分辨率级联集成 BA 0.67(σ=7000 测试),相对 +50% 论文 §4-§5/Figure 3
23 级联结构:Hyperplastic/Adenoma 分类器用 224² 下采样,Dysplasia 分类器用全分辨率 论文 §4/Figure 2
24 per-class(Sens/Spec/BA):NORM 0.86/0.93/0.89;HP 0.79/0.87/0.83;TA.LG 0.60/0.92/0.76;TA.HG 0.50/0.94/0.72;TVA.LG 0.78/0.96/0.87;TVA.HG 0.52/0.92/0.72 论文 Table 3
25 数据集许可 CC BY 4.0 DataPort 页面 JSON-LD license 字段
26 代码许可 MIT(© 2021 EIDOSlab) GitHub LICENSE 文件
27 资助:EU Horizon 2020 grant No 825111(DeepHealth) DataPort/Zenodo/GitHub 三源一致
28 论文 7 作者;数据署名 9 人(+Gambella, Cavallo) ICIP 论文作者栏 / DataPort 作者栏
29 机构:University of Turin 计算机科学系(EIDOSlab)+ 医学科学系 论文署名
30 Semantic Scholar 48 次引用(2026-09-27 抓取) Semantic Scholar 页面
31 DataPort 统计:10,747 views / 461,880 downloads(2026-09-27 抓取) DataPort 页面
32 GitHub 仓库最后提交 2023-05-18;仓库含 PyTorch/ECVL dataloader + Example.ipynb + Dockerfile + 两套 YAML GitHub 仓库页

术语表(26 条)

术语 释义
WSI(whole-slide image) 全切片图像:病理玻片的千兆像素级数字化扫描
H&E 苏木精-伊红染色:组织学标准染色,核呈蓝紫、胞质呈粉红
patch 从 WSI/ROI 裁出的矩形图像块,本数据集的发布粒度
ROI(region of interest) 感兴趣区:标注者在 WSI 上划定的病变/组织区域
σ(patch scale) patch 视野边长(μm),本条目核心记号;σ=800 与 σ=7000 两档
mpp(micron per pixel) 每像素物理长度;本集统一 0.4415 μm/px
NORM Normal tissue,正常组织
HP(hyperplastic polyp) 增生性息肉:良性病变,无异型增生
TA(tubular adenoma) 管状腺瘤:癌前病变,腺体呈管状形态
TVA(tubulovillous adenoma) 管-绒毛状腺瘤:兼有管状与绒毛状结构的腺瘤
LG / HG(dysplasia grade) 异型增生低级别/高级别:腺瘤癌变风险的两级刻度
Balanced Accuracy(BA) 平衡准确率:各类召回率的宏平均,应对类不平衡
Sensitivity / Specificity 敏感性(阳性检出率)/特异性(阴性正确率)
Confusion matrix 混淆矩阵:逐类误判方向的方阵
Cascaded classifier 级联分类器:按决策轴串联的多个分类器,前级输出约束后级
Multi-resolution ensemble 多分辨率集成:对不同输入尺度各取所长的分类器组合
Baseline 基线:作为对照的标准方法,本条目指 ResNet-18 单尺度
MIS/类不平衡 类别样本量显著失衡;本集 TA.LG 42.3% vs TA.HG 5.8%
信息泄漏 训练/测试间存在同病人同源样本导致的性能虚高
CC BY 4.0 知识共享署名 4.0:允许商用与再分发,需署名
MIT License 宽松开源软件许可,允许商用,保留版权声明即可
IEEE DataPort IEEE 官方数据托管平台,本集官方发布地
EIDOSlab 都灵大学计算机科学系机器学习实验室,本集生产方
DeepHealth EU H2020 项目(No 825111),医学 AI + HPC,本集所属 Use Case 2
MIL(multiple instance learning) 多实例学习:patch 为实例、slide 为包的弱监督范式
Stain normalization 染色归一化:消除不同染色批次的颜色域差异
Interobserver variability 观察者间变异:不同判读者对同一样本的判断分歧
Curriculum learning 课程学习:由易到难的任务排序训练策略
Embedding / feature space 嵌入/特征空间:编码器输出的向量表示
Test-time augmentation 测试时增强:推理阶段多视图融合
Confidence interval 置信区间:小样本类报告的单点数字应带区间

附录 AB:与库内金标准数据集的工程参数对照

参数 UniToPatho MHIST(rid 168) NCT-CRC-HE-100K(rid 148) GlaS(rid 196)
模态 H&E patch(两档视野) H&E patch(224²) H&E patch(224²) H&E WSI
器官 结直肠息肉 结直肠息肉 结直肠(组织型) 结直肠腺体
规模 9,536 patch / 292 WSI 2,378 patch ~10 万级 patch 165 WSI
任务 6 类分类 + LG/HG 分级 二分类(HP/SSA) 9 类组织型 腺体实例分割
分级维度 有(LG/HG,唯一) 梅氏评分(软) 无 无
划分 官方 204/88 按 slide 官方 train/test 官方 train/test 官方 train/test
许可 CC BY 4.0 CC BY 4.0(DataPort) CC BY 4.0(GDC 派生口径见其条目) 挑战赛口径(见其条目)
元数据 坐标+ROI+mpp 梅氏评分+固定划分 组织型标签 掩码
发布年 2021 2021 2019/2020 2015/2017
选它的理由 分级维度+尺度协议 任务简单+难度分档 规模+多样性 分割粒度

(各库内条目的细节以各自条目为准;本表只做选型速查。)

附录 AC:数据集时间线(表格化年谱)

时间 事件 意义
2020 DeepHealth 项目(EU H2020 No 825111)立项运行 UniToPatho 所属 Use Case 2 启动背景
2021-01-25 arXiv:2101.09991 v1 提交 数据集学术存在首次公开
2021-02-09 IEEE DataPort 数据发布(DOI 10.21227/9fsv-tm25)+ Zenodo 公告 数据正式可获取
2021-02-10 arXiv v2(当前版本) 论文文本定稿
2021-05-04 DataPort 最后更新 数据版本定型(此后无变更)
2021-09 ICIP 2021 正式发表(pp. 76-80) 同行评审背书完成
2021 Perlo et al., MICAD 2021 同组续作:WSI 级分级 70%(≈医师一致度)
2022-12 IEEE Big Data 2022(Perlo et al. 肝 CT 基因突变) EIDOSlab 方法学外溢(非本数据集)
2023 Paing 系两篇(含 IEEE Access FFC-ResNet) 下游方法竞技高峰期开始
2023-05-18 GitHub 仓库最后提交 工程维护停止(数据本身不受影响)
2024 Information Sciences 658(半监督 GAN);CBM 172(SupCon+BiT) 下游用法从"刷分"转向"范式实验场"
2025 Frontiers in Pharmacology PAT-MIL 引用 进入弱监督方法动机链
2026-09 Semantic Scholar 48 引用;DataPort 461,880 downloads 本条目抓取时点快照

附录 AD:边缘情况与报错排查表

症状 可能原因 处置
CSV 行数对不上 8,669/867 下载不完整或混入了镜像版 重下官方包;查 DataPort 版本历史
mpp 字段 ≠ 0.4415 CSV 版本差异或脏行 按 image_id 对照 GitHub 仓库 data/ 目录样例;异常行剔除并记录
图像尺寸 ≠ 1812²/15,855² 边缘 ROI patch 被裁切属正常;若系统性偏小则版本错 抽查分布,中位数对上即可
dataloader 报 target 不合法 target 参数拼写超出 对齐官方 unitopatho.py 签名
HG 类指标剧烈波动 88 test 中 HG slide 仅 ~26+20,子采样方差大 多 seed + 置信区间;勿单点宣称
7000 档显存爆炸 整图 15,855² 直接进 batch 预裁切/在线裁切;禁整图 resize(附录 R)
复现 BA 远低于 0.46 划分/指标/输入三处口径漂移 按 FAQ Q23 四步排查
label 与 type 对不上 读取列错位 label 6 类、type 4 类,映射见附录 E

附录 AE:下游论文方法段模板(供引用本集的作者)

写论文时描述本数据集的"最低信息量"模板(六要素缺一不可):

We evaluate on UniToPatho [Barbano et al., ICIP 2021], comprising 9,536 H&E-stained patches (8,669 at σ=800 μm and 867 at σ=7,000 μm) extracted from 292 whole-slide images (one per patient), each annotated into six classes (NORM, HP, TA.LG, TA.HG, TVA.LG, TVA.HG). We follow the official patient-level split (204/88 slides) and report balanced accuracy, comparing against the official single-scale ResNet-18 baseline (BA 0.46) and the multi-resolution cascaded ensemble (BA 0.67). [Our task protocol: 6-class / 4-class type / adenoma-only grading — choose one and state it explicitly.]

六要素:patch 数与两档分布、WSI/病人数、类协议(三选一显式声明)、划分方式(patient-level 204/88)、指标(BA)、对照锚点(0.46/0.67)。缺任何一项都会让审稿人无法把你的数字放进 §6.1 的生态表里。

附录 AF:跨档 patch 的嵌套关系与空间利用

两档 patch 都携带 (x, y, w, h) 坐标,这打开了一个未被下游充分使用的玩法——跨档空间推理:

  1. 嵌套检查:理论上 7000 μm 视野在物理上可容纳约 76 个 800 μm 视野(7000/800 的平方≈76.6),但实际发布中两档是独立裁切的,嵌套关系不保证精确对齐——做跨档配对实验前必须先用坐标验证真实重叠率,不要假设嵌套。
  2. 空间聚合:同一 WSI/ROI 内的 800 档 patch 有邻接结构(网格裁切),可以重建"虚拟低倍镜"——把 patch 预测拼回 ROI 平面再下采样,得到一个"穷人版 7000 档"。这为 MIL 与全片级推理提供了不依赖 7000 档的替代路线。
  3. 上下文注入:用 7000 档的结构上下文作为 800 档局部预测的先验(croppose 到重叠区),是跨尺度特征融合的最小实现。
  4. 坐标的边界情况:ROI 边缘的 patch 可能小于标称尺寸(w/h 缩水),空间运算前按实际 w/h 处理,别按常数。

这四条共同指向一个判断:UniToPatho 的元数据设计(坐标+ROI+WSI 三级引用)让它在"patch 数据集"里保留了向"空间数据结构"升级的可能性——这是纯图+标签集做不到的。

附录 AG:教学场景使用建议

UniToPatho 的双尺度设计使其特别适合三类教学场景:

  1. 医学 AI 导论课的"尺度演示":用 Table 2 直接演示"同一模型、同一数据、只改视野,BA 从 0.40 到 0.46 再到 0.37"——比任何讲义都直观地展示预处理决策的重量。配套练习:让学生预测 HP 和 TVA 各自的最佳尺度,再用表格验证。
  2. 数字病理实训的"读片流程映射":§3.1 的流水线(病变性→腺瘤性→级别)与级联架构(Figure 2)一一对应,可作为"临床决策树如何变成计算图"的案例教学。
  3. 数据工程课的"元数据价值"案例:附录 AF 的坐标玩法 + §2.8 数据字典,演示"图+CSV"比"图+标签文件"多出的工程空间;对照一个纯图+标签的数据集做反例阅读。

课程作业三选一:① 复现单尺度基线并绘制自己的 σ-BA 曲线(对照 Table 2);② 实现一个两档融合的最小基线,报告相对单档的增益;③ 用坐标重建一张 WSI 的 patch 热图(分类概率空间投影),写一段"算法看到了什么"的读片报告。

附录

附录 A:条目信息速查卡

字段 值
slug / 库内 URL unitopatho / https://www.qianfanghub.com/ai-ready-dataset/unitopatho/701
官方名 UniToPatho(UNITOPATHO)
一句话 292 WSI → 9,536 H&E patch,6 类分类 + 腺瘤分级,CC BY 4.0
数据 DOI 10.21227/9fsv-tm25
论文 DOI 10.1109/ICIP42928.2021.9506198(arXiv:2101.09991)
年份 2021
机构 University of Turin
模态 H&E 组织病理学(patch)
任务 图像分类 + 异型增生分级
规模 9,536 patch / 292 WSI / 292 病人
许可 CC BY 4.0(数据)/ MIT(代码)
本库互链 mhist(168)、nct-crc-he-100k(148)、glas(196)、consep(228)、digestpath(338)、hyperkvasir(693)

附录 B:DAIMS 评估全表

维度 评级 正面 负面
Discoverability 4/5 DOI+论文+arXiv+Zenodo+GitHub 五路锚点 名称大小写两套、无统一 landing page
Accessibility 5/5 CC BY 4.0、免费注册即得、无 DUA、可商用 IEEE 账号注册墙(轻度)
Interoperability 4/5 PNG/CSV 通用格式、PyTorch/ECVL loader、坐标可溯源 无 WSI 本体/NIfTI 发布、两档需分开建管线
Metadata 3/5 CSV 字段完备(label/type/坐标/ROI/mpp) 无人口学元数据、无标注者信息、无染色协议细节
Sustainability 3/5 DataPort 托管稳定、格式简单不易腐 2023 后无维护、无常设评测、项目已结题

附录 C:逐项证据链自证

条目宣称 证据源 核验方式
9,536 patch / 292 WSI 论文摘要+DataPort+GitHub 三源逐字一致 ✓
8,669+867=9,536 论文正文+Table 1 分项和+总量双校验 ✓
800 μm→1812 px 800÷0.4415 计算自洽 ✓
7000 μm→15,855 px 7000÷0.4415 计算自洽 ✓(ar5iv “15true855” 为渲染残渣)
292=slides 和 Table 1 top 行 41+21+26+146+20+38 ✓
9,536=patches 和 Table 1 Total 行 604+1024+552+4029+1009+2318 ✓
204+88=292 论文正文 split 算术一致 ✓
CC BY 4.0 DataPort JSON-LD 原文 license 字段 ✓
MIT GitHub LICENSE 文件 原文抓取 ✓
0.46→0.67 论文 Figure 3 说明+§5 正文两处一致 ✓
BA 随 σ 全表 论文 Table 2 六尺度逐格抄录 ✓
48 引用 Semantic Scholar 2026-09-27 抓取 ✓

附录 D:数据获取决策树

需要 UniToPatho?
├─ 只要 patch 数据本体
│   → IEEE DataPort 注册下载(DOI 10.21227/9fsv-tm25)
│   ├─ 训练分类器 → 下 σ=800 档(8,669)
│   ├─ 分级/低倍视野实验 → 下 σ=7000 档(867)
│   └─ 完整复现论文 → 两档都要 + 保持同一 slide 划分
├─ 只要加载代码
│   → GitHub EIDOSlab/UNITOPATHO(MIT,直链)
│   └─ target 参数选 type(4 类)/ top_label(6 类)
├─ 只要论文
│   → arXiv:2101.09991(免费)或 IEEE Xplore(正式版)
└─ 找数据镜像?
    → OpenDataLab/UNITOPATHO(CC BY 4.0 转载)
    → 谨慎:非官方镜像无更新承诺,正式引用走 DataPort

附录 E:类别映射与使用规范

label type 训练视图 临床语义
NORM NORM 6 类任务的类 0;分级任务的排除类 正常黏膜
HP HP 6 类任务的类 1;"腺瘤性 vs 增生性"的阴性类 良性息肉
TA.LG LG 6 类任务的类 2;分级任务的负类 管状腺瘤低级别
TA.HG HG 6 类任务的类 3;分级任务的正类 管状腺瘤高级别
TVA.LG LG 6 类任务的类 4;分级任务的负类 管-绒毛状低级别
TVA.HG HG 6 类任务的类 5;分级任务的正类 管-绒毛状高级别

规范三条:分级任务(HG/LG)只在 TA/TVA 子集上做(NORM/HP 无级别属性);6 类与 4 类数字不可互比;论文级联分类器对应"HP 二分 → TA/TVA 二分 → HG/LG 二分"的决策树,复现时按此解耦。

附录 F:Table 1 全转(类别分布总表)

类别 slides σ=7000 patch σ=800 patch 总 patch
HP 41 59 545 604
NORM 21 74 950 1,024
TA.HG 26 98 454 552
TA.LG 146 411 3,618 4,029
TVA.HG 20 93 916 1,009
TVA.LG 38 132 2,186 2,318
合计 292 867 8,669 9,536

(σ=800 行合计按分项和与正文口径取 8,669;ar5iv 版 “8699” 漂移见坑 2。)

附录 G:Table 2/3 全转(基准数字)

Table 2(BA 随 σ):

类型 σ=100 σ=800 σ=1500 σ=4000 σ=7000 σ=8000
BA(6 类) 0.40 0.45 0.46 0.41 0.37 0.38
NORM 0.70 0.66 0.72 0.76 0.78 0.71
HP 0.81 0.92 0.85 0.70 0.60 0.69
TA(HG+LG) 0.65 0.66 0.65 0.71 0.76 0.70
TVA(HG+LG) 0.64 0.67 0.68 0.74 0.84 0.76

Table 3(per-class,多分辨率集成,σ=7000 测试):

类别 Sensitivity Specificity BA
NORM 0.86 0.93 0.89
HP 0.79 0.87 0.83
TA.LG 0.60 0.92 0.76
TA.HG 0.50 0.94 0.72
TVA.LG 0.78 0.96 0.87
TVA.HG 0.52 0.92 0.72

Table 4 要点(per-type,多分辨率 vs 单尺度基线):多分辨率集成对 NORM 0.89 / TA 0.83 / TVA 0.87,HP 无独立集成输出——对比单尺度基线最佳值(NORM 0.72@1500 / TA 0.76@7000 / TVA 0.84@7000),NORM 与 TA 两类提升最显著。

附录 H:下游论文登记表

工作 年/发表处 方法族 报告数字(原文口径) 协议备注
Perlo et al. MICAD 2021 CNN WSI 分级 70% 准确(与病理医师间一致度相当) slide 级,异型增生分级
Paing, Cho & Cho 2023 会议 RaAdam + label smoothing 未在抓取页给单一数字 7000 μm 档
Paing & Pintavirooj IEEE Access 2023 FFC-ResNet(ResNet-50+傅里叶卷积) 未在抓取页给单一数字(19 引用,最多) 分级任务
Sasmal et al. Information Sciences 658, 2024 半监督 GAN 87.50%/76.25%(25%/50% 多数投票) 协议详见原文
Yengec-Tasdemir et al. Comput Biol Med 172, 2024 Sup-Con + BiT 70.3% 多类分类

(登记以抓取页可见信息为限;引用前按原文核对协议与数字。)

附录 I:坑点档案(与 §8 对照)

坑 一句话 处置
1 大小写两套名 检索 UniToPatho/UNITOPATHO 双打;锚定 DOI
2 8,669 vs 8,699 按分项和取 8,669,注漂移
3 “800/7000 um/px” 歧义 是视野边长 μm,非像素密度
4 HG 敏感性 ~0.50 是基线事实 复现对照,勿当 bug
5 三套协议不可互比 6 类/4 类/分级,引用先核协议
6 Zenodo 记录不是数据 数据本体只在 DataPort
7 作者 7 vs 9 人 论文/数据各按其口径
8 单中心单扫描仪 禁无外部验证的泛化宣称

附录 J:双口径登记表

事项 口径 A 口径 B 处置
名称 UniToPatho(论文正文) UNITOPATHO(DataPort/GitHub/Zenodo) 正文用 UniToPatho,检索双打
作者数 7(ICIP 论文) 9(DataPort/Zenodo 数据署名) 各按其口径,附注差异
σ=800 patch 总数 8,669(正文+分项和) 8,699(ar5iv Table 1 渲染) 取 8,669
15,855 px 正文计算口径 ar5iv “15true855”(渲染残渣) 取 15,855
“800/7000” 含义 patch 视野边长 μm(论文 σ 记号) DataPort 措辞 “um/px”(易误读) 以论文 σ 为准,条目注歧义
数据版本 v1(2021-02-09) 更新 2021-05-04(同版本修订) DOI 无版本号,引 10.21227/9fsv-tm25

附录 K:维护计划与触发点

触发点 动作
DataPort 数据版本更新 核对新版本 changelog,更新 §5 版本链
下游引用突破 75(Semantic Scholar) 刷新 §6.1 引用画像与代表工作表
出现官方 leaderboard/复刻评测 新增常设评测小节
出现 WSI 本体或掩码级发布 重评 AI-Ready 元数据维度
DeepHealth 项目后继数据集发布 补 §8 生态谱系
许可条款变更(CC BY 4.0 → 其他) 立即重写 §5.1 许可矩阵

附录 L:引文规范

数据集引用(推荐格式):

Bertero, L., Barbano, C. A., Perlo, D., Tartaglione, E., Cassoni, P., Grangetto, M., Fiandrotti, A., Gambella, A., & Cavallo, L. (2021). UNITOPATHO [Data set]. IEEE DataPort. https://doi.org/10.21227/9fsv-tm25

论文引用(IEEE 格式):

C. A. Barbano, D. Perlo, E. Tartaglione, A. Fiandrotti, L. Bertero, P. Cassoni, and M. Grangetto, “Unitopatho, A Labeled Histopathological Dataset for Colorectal Polyps Classification and Adenoma Dysplasia Grading,” in 2021 IEEE International Conference on Image Processing (ICIP), 2021, pp. 76-80, doi: 10.1109/ICIP42928.2021.9506198.

(GitHub 官方 BibTeX 为 @INPROCEEDINGS{barbano2021unitopatho},键名 barbano2021unitopatho。)

附录 M:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 元数据有全局唯一标识 ✅ DOI 10.21227/9fsv-tm25
F2 数据有全局唯一标识 ✅ 同上(数据与 DOI 同体)
F3 元数据含创建者信息 ✅ 9 人署名 + ORCID
F4 可检索(标准索引) ⚠️ DataPort/GitHub/Zenodo 可检索;无通用数据索引(如 Google Dataset Search 覆盖一般)
A1 可获取(协议明确) ✅ open access + 免费注册
A2 协议机读 ⚠️ HTTP 可获取;JSON-LD 有 license 字段
I1 格式开放 ✅ PNG + CSV
I2 机器可读元数据 ✅ CSV 结构化字段
I3 领域标准词汇 ⚠️ 6 类标签自造词(NORM/HP/TA/TVA 为病理通行缩写但无 SNOMED 映射发布)
S1 许可明确 ✅ CC BY 4.0
S2 来源可溯 ✅ WSI 引用 + ROI + patch 坐标
S3 长期维护 ⚠️ DataPort 托管稳定;无活跃社区

附录 N:缩写速查

缩写 全称/释义
WSI Whole-Slide Image,全切片图像
H&E Hematoxylin and Eosin,苏木精-伊红染色
mpp Micron Per Pixel,每像素微米数
ROI Region of Interest,感兴趣区
NORM Normal tissue,正常组织
HP Hyperplastic Polyp,增生性息肉
TA Tubular Adenoma,管状腺瘤
TVA Tubulo-Villous Adenoma,管-绒毛状腺瘤
LG/HG Low-/High-Grade dysplasia,低/高级别异型增生
BA Balanced Accuracy,平衡准确率
ICIP IEEE International Conference on Image Processing
ECVL 扩展视觉计算库:DeepHealth 项目配套开发的图像处理库,官方 dataloader unitopatho_ecvl.py 的底层依赖
DeepHealth EU H2020 No 825111 项目:Deep-Learning and HPC to Boost Biomedical Applications for Health
FFC Fast Fourier Convolution,快速傅里叶卷积
BiT Big Transfer,大规模预训练迁移范式
Sup-Con Supervised Contrastive Learning,监督对比学习
DUA Data Use Agreement,数据使用协议
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability

附录 O:基于本数据集的研究检查清单(12 项)

  1. 声明使用的 patch 档位(800/7000/两档)与理由。
  2. 声明标签协议(6 类 label / 4 类 type / 腺瘤子集分级)。
  3. 使用官方 204/88 按 slide 划分;若重切,声明并附泄漏控制说明。
  4. 评价指标用 BA 或 macro 平均;普通 accuracy 仅作参考。
  5. 类不平衡处理手段显式写出(采样/损失权重)。
  6. 与论文基线(BA 0.46 单尺度 / 0.67 级联)与 Table 3 per-class 数字对表。
  7. HG 类结果附敏感性+特异性别只报 BA(漏检代价不对称)。
  8. 不做"可泛化至其他中心"的无验证宣称(单中心数据)。
  9. 引用数据 DOI 10.21227/9fsv-tm25 与 ICIP 论文双引。
  10. 遵守 CC BY 4.0 署名要求(产品/衍生数据集页附来源)。
  11. slide 级聚合评估给出 HG 类置信区间(slide 级 HG 仅 46 张)。
  12. 多分辨率实验复用 σ 扫描协议时,逐格引用 Table 2 并注明补测尺度。

附录 P:结直肠癌筛查临床背景(数字存照)

理解 UniToPatho 的临床价值需要一点背景刻度:

刻度 数字 与本数据集的关联
全球癌症发病 结直肠癌居前三(GLOBOCAN 2020 口径,下游论文通用引用) 息肉筛检是公认的一级预防杠杆
息肉-癌变时间窗 腺瘤→癌通常以年计(" adenoma-carcinoma sequence"经典模型) LG/HG 分级决定随访强度,算法辅助的本质是"时间窗管理"
病理判读难点 管状 vs 管-绒毛状区分与 HG 分级是病理医师最难任务(论文引 [19-22]) 数据集六类直接覆盖该难点
HG 的临床权重 HG 近癌,处理方案升级(随访→手术/扩大切除) HG 敏感性 0.50 的漏检代价因此不对称
筛查队列构成 低级别腺瘤占切除息肉的大头 解释 TA.LG 42.3% 的"自然分布"

(以上为背景性通识刻度,用于理解数据集设计逻辑;条目不将其作为数据集自身数据引用。)

附录 Q:多分辨率级联分类器伪代码

# 论文 §4 方法的结构化复述(伪代码级)
INPUT: patch P (σ=7000 μm 视野)

STAGE 1 — Hyperplastic 分类器(输入: P 下采样至 224²)
    p_hp = f1(downsample(P, 224))
    if p_hp == HP: 输出 "HP"; STOP
    # 依据: HP 的腺体结构特征在低分辨率即可辨(Table 2: BA 0.92@σ=800)

STAGE 2 — Adenoma 分类器(输入: P 下采样至 224²)
    p_sub = f2(downsample(P, 224))
    # 输出: 管状 TA vs 管-绒毛状 TVA(结构模式轴)
    # 依据: 腺体排列结构在中低分辨率可见(Table 2 per-type 曲线)

STAGE 3 — Dysplasia 分类器(输入: P 全分辨率或高分辨率裁切)
    p_grade = f3(P_fullres, threshold=T_d)
    # 输出: HG vs LG(细胞核细节轴)
    # 依据: HG 证据(核异型/极性/核分裂)在下采样中丢失
    #       ——这是基线把 HG 判向 LG 的根因(论文混淆矩阵分析)

OUTPUT: 6 类标签 = STAGE1/2 的类型轴 × STAGE3 的级别轴
评估: σ=7000 测试档上 6 类 BA = 0.67(基线最佳 0.46,+50% 相对)

设计要点三条:级联顺序对齐临床决策树(先良性/腺瘤性,再亚型,再级别);分辨率预算按决策轴分配(类型轴省、级别轴保);阈值 T_d 是显式超参(承认 HG/LG 边界的模糊性,可按临床代价函数调节)。

附录 R:常见错误用法反例

反例 为什么错 正确姿势
patch 级随机切 train/test 同 slide(=同病人)patch 同时进两侧,泄漏虚高 按 wsi_reference 字段切,204/88
7000 档整图 resize 到 224² 15,855→224 压缩 ~70 倍,细胞核证据物理性消失 高分辨率裁切/多裁切集成,并声明处理方式
报普通 accuracy 不报 BA TA.LG 42.3% 主导,accuracy 被多数类淹没 BA + per-class Sens/Spec(Table 3 口径)
把 800/7000 两档混批当增强 两档信息结构不同,等于未声明域移 分档训练分档测,或显式多分辨率架构
用 6 类数字对标 4 类论文 协议不同数字不可换算 对表前核协议(类数+档位+划分)
宣称"跨中心泛化"无外部验证 全部 292 张单中心单扫描仪 补外部集或改口"受控单中心结论"
引"数据来自 Zenodo" Zenodo 两记录只是公告/论文 PDF 引 DataPort DOI 10.21227/9fsv-tm25
拿 HG 高分宣称大幅超越 若换了任务口径(腺瘤子集二分类)则不可比 先核 §6.2 三守则再下结论

附录 S:库内条目关系声明(详表)

库内条目(rid) 关系类型 联合实验设想 差异锚点
MHIST(168) 同模态同器官近邻 两集联合做"二分类→六类"课程学习;梅氏评分 vs LG/HG 分级对齐 MHIST 二分类+难度评分;本集六类+双尺度
NCT-CRC-HE-100K(148) 同模态规模互补 用其预训练骨干 + 本集微调分级 其 9 类无级别维度;本集带 LG/HG
GlaS(196) 同器官任务互补 腺体分割特征作为本集分类的先验/中间监督 其为 WSI 级像素掩码
CoNSeP(228) 同器官粒度下探 核级特征解释本集 HG 漏检(可解释性桥) 其为核实例分割
DigestPath(338) 同系统任务互补 病变检测→分类流水线串联 其含检测任务
HyperKvasir(693) 跨模态同病变 "内镜所见→病理结果"对齐叙事的素材对 内镜 vs 病理模态
Kvasir-SEG(112) 跨模态同病变 同上,分割版本 同上
PolypGen(183) 跨模态+域设计参照 多中心 vs 单中心域泛化双向实验 其多中心内镜
ETIS-Larib(153) 跨模态困难样本 "困难在内镜还是病理"对照分析 困难基准定位
CVC-ClinicDB(133) 跨模态经典锚点 内镜分割经典 vs 病理分类经典的对话 历史地位
PANDA-PLUS(640) 方法论互链 标注流水线/标签质量方法论互引 前列腺 vs 结直肠

附录 T:检索查询式示范

场景 建议查询式
数据集本体 "UNITOPATHO" OR "UniToPatho" IEEE DataPort 10.21227/9fsv-tm25
原始论文 arXiv 2101.09991 或 ICIP 2021 UniToPatho 10.1109/ICIP42928.2021.9506198
下游分级方法 "UniToPatho" dysplasia grading HG LG(补 "UNITOPATHO" 双打)
半监督用法 "UniToPatho" semi-supervised GAN colorectal
多分辨率方法 "UniToPatho" multi-resolution OR "cascaded classifier"
跨论文基准 "UniToPatho" benchmark classification accuracy(读时启用 §6.2 三守则)
同组谱系 EIDOSlab Turin pathology OR colorectal(Perlo/Barbano/Tartaglione 合作网)
中文语境 结直肠息肉 组织病理 数据集 都灵 OR UniToPatho

附录 U:两档数据的角色对照(详表)

维度 σ=800 μm 档 σ=7000 μm 档
数量 8,669 867
像素尺寸 1812² 15,855²
视野当量 约 1 个腺体-隐窝单元群 约 60-80 个腺体单元(结构全景)
训练角色 主力(量大) 少量精训
评估角色 尺度扫描实验(Table 2) 最终主结果报告档(Table 3/4)
优势类 HP(0.92) NORM/TA/TVA(0.78/0.76/0.84)
失利类 TVA(0.67) HP(0.60)
工程注意 resize 224² 与论文一致 禁整图 resize;裁切策略须声明
临床类比 高倍镜视野(油镜细节) 低倍镜扫全片(结构判读)

一句话记忆:800 档回答"细胞在做什么",7000 档回答"组织在变成什么"——病理诊断两级证据,数据集各给一档。

附录 V:审稿人视角——三个卖点与三个质疑

卖点一:分级维度稀缺性。公开 H&E patch 集里带 LG/HG 腺瘤级标签的极少,本集是其中协议最完整(6 类+4 类双视图+官方 split)的。任何分级方法论文绕不开它。

卖点二:尺度敏感性分析的方法论价值。Table 2 的 per-type × σ 矩阵是"单一尺度不足"这一主张的最直接实验证据,比普遍的消融消融实验更有解释力——它给出了每类的最佳视野,可直接指导架构设计。

卖点三:许可与工程友好。CC BY 4.0 + 免费注册 + MIT dataloader + 坐标可溯源,在医学数据里属于"拿来即用"的第一梯队,复现摩擦极小。

质疑一:单中心单扫描仪,外推性存疑。回应方式:明确定位为受控源域研究,补外部验证时引用 PolypGen(多中心内镜)作反向设计参照。

质疑二:标注一致性未披露。无法量化标签噪声。回应方式:报告协议时引用机构信用(都灵大学病理科)+ 承认局限 + 在 HG 类结果上给置信区间(46 张 HG slide 的子采样方差)。

质疑三:规模小,结论是否稳? 9,536 patch 在深度学习时代是"小数据"。回应方式:按 slide 聚合的统计显著性检验 + 多 seed 报告 + 与下游五篇论文的数字带对照(70-87.5% 区间),稳定性可辩护。

附录 W:术语中英对照扩展

中文 英文 备注
异型增生 dysplasia 分级对象;LG/HG 两级
管状腺瘤 tubular adenoma (TA) 腺体呈管状
管-绒毛状腺瘤 tubulovillous adenoma (TVA) 混合结构
增生性息肉 hyperplastic polyp (HP) 良性
全切片图像 whole-slide image (WSI) 千兆像素级
图像块 patch 本集发布粒度
平衡准确率 balanced accuracy (BA) 各类召回宏平均
敏感性/特异性 sensitivity/specificity 漏检/误检两轴
级联分类器 cascaded classifier 按决策轴串联
多分辨率集成 multi-resolution ensemble 论文核心方法
类不平衡 class imbalance TA.LG 42.3% vs TA.HG 5.8%
信息泄漏 data leakage 同病人跨集
染色归一化 stain normalization 跨域研究常用
多实例学习 multiple instance learning (MIL) patch→slide 弱监督
腺瘤-癌序列 adenoma-carcinoma sequence 息肉癌变经典模型

附录 Y:全文关键数字索引

数字 出处章节 复核锚点
292 WSI / 292 病人 §1 Q1、§2.1、事实清单 7-8 论文摘要
9,536 patch(8,669+867) §2.1、§2.2、附录 F 论文摘要+正文
1812² / 15,855² px §2.2 800/0.4415、7000/0.4415
slides 分布 21/41/146/26/38/20 §2.4、附录 F Table 1 top
patches 分布 1024/604/552/4029/1009/2318 §2.4、附录 F Table 1 Total
204/88 划分 §1 Q7、§2.5、附录 E 论文正文
BA 0.46@σ=1500(单尺度最佳) §4.2、§1 Q5 Table 2
BA 0.67(级联,σ=7000) §4.3、INFOBOX Figure 3 说明
HP 0.92@σ=800 / TVA 0.84@σ=7000 §4.2、§3.2 Table 2
HG 敏感性 0.50/0.52 §4.4、坑 4、§3.2 Table 3
CC BY 4.0 / MIT §1 Q8、§5.1 DataPort JSON-LD / GitHub LICENSE
DOI 10.21227/9fsv-tm25 INFOBOX、附录 A、附录 L DataPort
10.1109/ICIP42928.2021.9506198 §2、附录 A、附录 L ICIP 论文
48 引用(2026-09) §6.1、INFOBOX Semantic Scholar
10,747 views / 461,880 downloads §6(事实清单 31) DataPort(时点敏感)
70% / 87.50% / 70.3% §6.4 下游论文原文

附录 Z:按场景的章节导航

你是… 先读 再读 引用时注意
数据工程师(先跑通) §5.2-5.4 → §2.8 附录 D 决策树、附录 R 反例 划分键 = wsi_reference
分类模型研究者 §4 全章 → §2.4 附录 G 数字全表、§3.3 BA 口径 + 协议声明
分级(HG/LG)方向 §3.2、§3.4 → §4.3 附录 Q 伪代码、坑 4 HG 敏感性单列报告
多分辨率方法研究者 §4.2-4.3 → §7.4 附录 Q、附录 U 对表 Table 2 逐格
综述/横评作者 §6 全章 → §7.1-7.2 附录 H 下游登记表、§6.2 三守则 协议不同禁横比
产品/商业化评估 §5.1 → §1 Q8 附录 M FAIR 检查单 CC BY 4.0 署名义务
临床信息学背景 §0、§3.1、§3.4 → 附录 P INFOBOX 标签机构信用边界

附录 AA:论文 Figure/Table 索引

论文元素 内容 本条目引用处
Table 1 slides/两档 patch 的类别分布 §2.1、§2.4、附录 F
Table 2 BA 随 σ 扫描(总+per-type) §4.2、附录 G
Table 3 per-class Sensitivity/Specificity/BA §4.4、附录 G
Table 4 per-type:三档基线 vs 多分辨率集成 §4.3、附录 G 要点
Figure 1 六类 800×800 μm patch 示例图 (§2.3 类别语义佐证)
Figure 2 多分辨率级联架构图 §4.3、附录 Q
Figure 3 基线 vs 级联混淆矩阵(BA 0.46 vs 0.67) §4.3、§3.4

附录 AH:引用卡片(BibTeX 全套)

数据集(必引):

@misc{bertero2021unitopatho_data,
  author       = {Bertero, Luca and Barbano, Carlo Alberto and Perlo, Daniele
                  and Tartaglione, Enzo and Cassoni, Paola and Grangetto, Marco
                  and Fiandrotti, Attilio and Gambella, Alessandro and Cavallo, Luca},
  title        = {{UNITOPATHO}},
  year         = {2021},
  howpublished = {IEEE DataPort},
  doi          = {10.21227/9fsv-tm25},
  url          = {https://ieee-dataport.org/open-access/unitopatho}
}

论文(必引):

@inproceedings{barbano2021unitopatho,
  author    = {Barbano, Carlo Alberto and Perlo, Daniele and Tartaglione, Enzo
               and Fiandrotti, Attilio and Bertero, Luca and Cassoni, Paola
               and Grangetto, Marco},
  booktitle = {2021 IEEE International Conference on Image Processing (ICIP)},
  title     = {Unitopatho, A Labeled Histopathological Dataset for Colorectal
               Polyps Classification and Adenoma Dysplasia Grading},
  year      = {2021},
  pages     = {76--80},
  doi       = {10.1109/ICIP42928.2021.9506198}
}

(论文 BibTeX 原样取自官方 GitHub README;数据 BibTeX 按 DataPort 署名口径整理——注意两者作者列表 7 人 vs 9 人的差异即坑 7。)

许可声明模板(衍生数据集/产品页使用):

This product/dataset uses UniToPatho (DOI: 10.21227/9fsv-tm25), © University of Turin, licensed under CC BY 4.0. Modifications and derived labels are our own and do not reflect the original authors.

附录 AI:limitation → 未来工作映射表

数据集局限(附录 M/§2.7) 直接可做的后续工作 所需外部资源
无像素掩码 弱监督分割(patch 标签作为图像级监督) 本集即可启动
标注一致性未披露 标签噪声建模/去噪方法验证场 本集 + 敏感性分析
单中心单扫描仪 跨中心域泛化(本集做源域) 任一外部息肉病理集
HG 样本稀少 少样本/长尾方法的主战场 本集 + 生成式增广
无人口学元数据 影像-only 建模(勿做预后) 预后需另配队列
无 slide 级标签发布 MIL 从 patch 标签聚合 slide 标签 本集即可启动
两档失衡(10:1) 跨尺度知识蒸馏实验 本集即可启动
染色协议未细化 stain 归一化的受控源域 多中心目标域(如 NCT-CRC-HE)

这张表是"从批评到课题"的转换器:每一行左边都是审稿人会提的 limitation,右边都是可以直接立项的后续工作——而且大部分只需要本集就能启动。

附录 AJ:双档选择决策树

你的任务是什么?
├── 六类分类(组织类型 × 级别,全谱)
│   ├── 训练 → σ=800 档(8,669,量大)
│   ├── 测试/报告 → σ=7000 档(867,论文主结果档)
│   └── 对照锚点 → BA 0.46(单尺度)/ 0.67(级联)
├── 腺瘤异型增生分级(HG vs LG)
│   ├── 数据 → 腺瘤子集(type ∈ {HG, LG},7,908 patch)
│   ├── 视野 → 7000 μm(结构语境)+ 全分辨率输入(核细节)
│   └── 警示 → HG 敏感性 ~0.50 是基线事实(§3.2)
├── 增生性 vs 腺瘤性二分
│   ├── 数据 → type ∈ {HP, NORM, HG, LG} 或按需重组
│   ├── 视野 → 800 μm 足矣(HP 的 BA 0.92 证明)
│   └── 备注 → 这条路线 MHIST 是更轻的替代
├── 多分辨率架构研究
│   ├── 数据 → 两档都要
│   ├── 协议 → 逐档训练逐档测(Table 2 口径)
│   └── 创新 → 参考 §7.4 三条经验与附录 AF 空间玩法
└── 预训练 / 大规模需求
    └── 本集不合适(量级太小)→ NCT-CRC-HE-100K(148)

(7,908 = 604 HP? 否——腺瘤子集 = TA.LG 4,029 + TA.HG 552 + TVA.LG 2,318 + TVA.HG 1,009 = 7,908 ✓)

附录 AK:库内 slug 与本文术语对照

本文术语 库内 slug(rid) 模态 任务关系
内镜所见家族 hyperkvasir(693)、kvasir-seg(112)、polypgen(183)、etis-larib(153)、cvc-clinicdb(133) 内镜 同病变异模态
病理分类家族 mhist(168)、nct-crc-he-100k(148)、unitopatho(本条) H&E patch 分类粒度互补
病理分割家族 glas(196)、consep(228)、digestpath(338) H&E WSI/patch 分割粒度互补
病理方法论 panda-plus(640) WSI+掩码 标注流水线互鉴
弱监督升级路线 PAT-MIL 等外部工作 — 附录 AI 的出口

这张对照表同时是相关条目互链的路由表:任何库内条目引用本条目时,按行取邻居即可构成合法的相关阅读链。

附录 AL:常见误解粉碎清单

# 误解 事实 出处
1 “UniToPatho 是挑战赛数据集” 不是。它是数据集论文(ICIP 2021)+ 数据发布(DataPort),无挑战赛、无 leaderboard §5、§6
2 “800/7000 是两种扫描分辨率” 两档共用 0.4415 μm/px 原始扫描,800/7000 是 patch 视野边长 §2.2、坑 3
3 “有 9,699 个 patch” 9,536(8,669+867);8,699 系 ar5iv 渲染漂移 坑 2、附录 J
4 “可以拿来做分割” 发布物是 patch 级标签,无掩码无 WSI 本体 §2.7、§9.3
5 “数据在 Zenodo 上” Zenodo 两记录是公告与论文 PDF;数据本体在 IEEE DataPort 坑 6
6 “准确率 87.5% 所以比基线 0.67 强” 87.5% 是另一协议(半监督+多数投票)的口径,不可横比 §6.2、坑 5
7 “标签是众包的” 标注者是都灵大学 expert pathologists,非众包;人数未披露 §3、§2.7
8 “CC BY 4.0 所以代码也是 CC BY” 代码是 MIT(GitHub LICENSE),数据才是 CC BY 4.0 §5.1
9 “它有官方 leaderboard 可以持续刷” 无常设评测;对比须自行复现官方协议 §9.3、§6
10 “每个病人有多张切片” 恰好相反:Each slide belongs to a different patient(292=292) §2.1

这张表的用法:审稿回复、技术评审、数据集选型会议遇到质疑时,按编号直接引用对应章节作答。

附录 X:本条目生产档案

项 值
生产代理 agentA-orcas(写手代理)
生产时点 2026-09-27(锁时间戳 2026-09-27T18:20:00+0800)
主题演进 orcas(ORCA 挑战,证伪)→ lsts(无法确证)→ unitopatho(三源核验通过)
核验源 GitHub EIDOSlab/UNITOPATHO;arXiv:2101.09991(abs+ar5iv 全文);IEEE DataPort 官方页(含 JSON-LD);Zenodo 4643645/5568937;Semantic Scholar;OpenDataLab;下游论文页(InfSci 2024 / CBM 2024 / QUB Pure)
查重 qf_psql:unitopatho/histopatho/colorectal 均 0 rows;writing/ 无同名目录
自检 check_md.py + preflight_check.py 双零(见最终汇报)
遗留待核 DataPort 下载体积;标注者人数与一致性检验;HF 无官方镜像确认

尾注

  1. 数据集本体获取:IEEE DataPort,https://ieee-dataport.org/open-access/unitopatho(DOI: 10.21227/9fsv-tm25)。
  2. 论文:C. A. Barbano et al., ICIP 2021, pp. 76-80, doi:10.1109/ICIP42928.2021.9506198;预印本 arXiv:2101.09991。
  3. 代码:https://github.com/EIDOSlab/UNITOPATHO(MIT License)。
  4. 本条目为千方病案医数集 AI-Ready Wikipedia 数据集条目,基于公开来源编写,抓取时点 2026-09-27;数字以来源原文为准,抓取时点敏感项(引用数/下载量)会随时间漂移。
  5. 库内互链条目 rid:mhist(168)、nct-crc-he-100k(148)、glas(196)、consep(228)、digestpath(338)、hyperkvasir(693)、kvasir-seg(112)、polypgen(183)、etis-larib(153)、cvc-clinicdb(133)、panda-plus(640)。
  6. 本条目主题演进:任务头候选 orcas(ORCA 挑战)三轮三源证伪 → 备选 lsts 无法确证 → 备选二 unitopatho 三源核验通过后成稿(详见 FACTS.md 卷首改道记录)。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
  • panda-plus — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
  • panda — 共享标签:医学影像 / 病理图像 / 图像分类 / 肿瘤学
  • acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • herlev-pap — 共享标签:医学影像 / 病理图像 / 评测基准 / 肿瘤学
  • sipakmed — 共享标签:医学影像 / 病理图像 / 评测基准 / 肿瘤学
  • nct-crc-he-100k — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
  • lc25000 — 共享标签:医学影像 / 病理图像 / 图像分类 / 肿瘤学
  • medmnist — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集