GlaS — 结直肠腺体实例分割基准 AI-Ready Wikipedia | 千方病案医数集

165 张 H&E 病理图像,1,530 个腺体实例的 MICCAI 2015 分割基准

来源 University of Warwick TIA Lab(Warwick-QU 数据集) url: https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/发布时间: 2026-09-08最后更新: 2026-09-08 阅读 3

信息速览

数据集名称GlaS — 结直肠腺体实例分割基准 AI-Ready Wikipedia | 千方病案医数集
数据类型165 张 H&E 病理图像,1,530 个腺体实例掩码,16 位患者 T3/T4 切片,约 181 MB BMP,注册后免费研究获取
规模16 位患者(165 张图像,患者级人口学信息未公开)
接入方式University of Warwick TIA Lab(Warwick-QU 数据集) url: https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/
AI 就绪度

数据集封面

GlaS(GlaS 腺体分割数据集)— 结直肠 H&E 腺体实例分割基准 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 GlaS 腺体分割数据集(Warwick-QU)
英文全称 Gland Segmentation in Colon Histology Images Challenge Contest (GlaS) Dataset
别名/简称 GlaS;Warwick-QU;GlaS@MICCAI 2015
疾病分类(ICD-11) 2B91 结肠恶性肿瘤;2B92 直肠恶性肿瘤(均为结直肠腺癌,T3/T4 期)
SNOMED CT 363406005(结肠恶性肿瘤);68168001(腺癌,形态学)
数据模态 结直肠 H&E 组织病理图像 + 腺体实例分割掩码
AI 任务类型 腺体实例分割(主任务)、语义分割、良恶性分类、组织学分级
样本总数 165 张图像(85 训练 / 60 Test A / 20 Test B),来自 16 位患者
数据大小 约 181 MB
数据格式 BMP(图像 + 实例掩码)、CSV/分级标签文件
许可证 研究用途许可(仅供研究,禁止商业使用,须引用挑战赛论文)
访问级别 注册后开放(官网注册获取;Kaggle/ModelScope 镜像可直接下载)
DUO 标签 NCU(非商业使用)
语言 英语(文档与标签)
首发日期 2015(MICCAI 2015 GlaS 挑战赛发布)
最后更新 2017-01(Medical Image Analysis 数据论文发表,数据内容此后未修订)
发布机构 University of Warwick TIA Lab 与 University Hospitals Coventry and Warwickshire(UHCW)
官方主页 https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/
下载地址 https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/download
DOI 10.1016/j.media.2016.08.008(数据论文);10.1109/TMI.2015.2433900(首次使用该数据的论文)
引用次数 1,197+(Google Scholar,MedIA 2017 挑战赛论文,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方三向划分、实例级掩码齐全、社区镜像与参考实现丰富;扣分项:官方未随包提供预处理与评测脚本,图像尺寸不一且 BMP 实例标签易被框架自动归一化破坏,需自行处理
页面状态 published

§0 E-E-A-T 审核与免责声明

  • 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、结直肠腺癌临床定义与分级)、§7 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GlaS 仅供研究用途、禁止商业使用,发表使用该数据集的研究成果时须引用其 Medical Image Analysis 2017 挑战赛论文与 IEEE TMI 2015 论文。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? GlaS(Gland Segmentation in Colon Histology Images Challenge Contest)是 MICCAI 2015 挑战赛发布的结直肠腺癌病理图像数据集,官方代号 Warwick-QU。它包含 165 张 H&E 染色图像,来自 16 位 T3/T4 期结直肠腺癌患者的 16 张组织切片(每人一张切片,取不同视野),每张图都由专家病理学家逐像素勾画出每个腺体的轮廓——共 1,530 个腺体实例,良恶性标签与组织学分级一并提供。

为什么重要? 腺体是结直肠癌分级的核心形态学依据:病理医生靠「腺体还成形吗、排布乱不乱」判断肿瘤的恶性程度。但人工评估的主观性(观察者间与观察者内重复性差)是病理领域的老大难,而腺体在癌变后形态高度多变、彼此粘连,自动分割长期没有统一基准。GlaS 第一次把「多种分级 + 实例级标注 + 双测试集 + 公开排行榜」组合在一起,让全世界的分割算法在同一把尺子下比拼,也正好赶上深度学习方法(U-Net、FCN)在病理分割上碾压传统方法的转折点。

我能用它做什么? 训练和评测腺体实例分割、语义分割模型;研究轮廓感知(contour-aware)边界学习、分水岭后处理、SAM 微调等实例分离技术;做良恶性分类与组织学分级建模;或把它当作病理分割方法论文的默认评测集——十年过去,「在 GlaS 上报一个数」仍然是这个方向最快的可比路径。

§1.1 摘要

GlaS 由英国华威大学 TIA Lab(N. Rajpoot 团队)联合 University Hospitals Coventry and Warwickshire(UHCW)病理团队、卡塔尔大学与埃因霍温理工大学等机构组织,为 MICCAI 2015 Gland Segmentation 挑战赛构建。数据由 UHCW 病理团队采集:16 位 T3/T4 期结直肠腺癌患者的 16 张 H&E 切片,Zeiss MIRAX MIDI 扫描仪以 0.465 μm/px 数字化后重采样至 0.62005 μm/px(等效 20 倍物镜),再裁切为 165 张视场图(train 85、testA 60、testB 20),以 BMP 发布。一位专家病理学家对全部 165 张图逐像素标注腺体实例(掩码像素值 0 为背景、1-32 为各腺体对象),并提供图像级良性/恶性二分类与 Sirinukunwattana 五级分级标签。挑战赛于 2015 年 10 月 MICCAI 大会现场收官,13 支队伍参赛,冠军 CUMedVision2(DCAN)以轮廓感知网络夺冠;结果论文 2017 年发表于 Medical Image Analysis(已获 1,197+ 引用,截至 2026-09)。数据仅限研究用途、禁止商用,官网注册下载,社区另有 Kaggle 与 ModelScope 镜像。

一段话看明白它的生态位:在数字病理的挑战赛谱系中,GlaS 与同期的细胞核检测(MITOS)、分类(PCam 前身)任务错开——它瞄准的是介于像素与整图之间、需要对象级推理的腺体实例分割,恰好卡在深度卷积网络从图像分类走向像素级建模的转折点上。正因为它规模小(165 张)而任务够硬(粘连实例分离 + 恶性形态鲁棒性),它成了方法论文验证「语义分割+实例后处理」与「端到端实例分割」两条技术路线的高性价比试验台。引用量随年份持续走高(见 §1.4 时间轴),说明它并未因数据旧而被淘汰,反而随着 SAM、Transformer 等新范式不断被重新用作基准——这在一个医疗数据集上并不多见。

§1.2 战略价值

维度一:腺体实例分割的奠基性基准。 在 GlaS 之前,腺体分割研究多集中于良性样本、各说各话;GlaS 把「恶性组织中的粘连腺体实例分离」定为标准任务,并提供对象级 F1、对象级 Dice 与对象级 Hausdorff 三重评测。它是深度学习病理分割的第一代主战场——U-Net 首战即季军、轮廓感知网络 DCAN 夺冠,都发生在这里。此后十年,几乎所有腺体分割新方法(多通道网络、注意力机制、Transformer、SAM 微调)都以 GlaS 为必测基准,纵向可比性极高。

维度二:小而精的实例级标注范式。 1,530 个逐像素腺体实例、覆盖良性到低分化癌的完整形态谱系,出自一位专家病理学家之手——这种「单标注者、全覆盖、实例级」的标注方式在病理公开数据中极为稀缺(同类数据集多以图像级标签或二值掩码为主)。它同时支撑语义分割、实例分割、分级建模与弱监督研究四类任务,是研究「分割如何服务分级」的理想载体。

维度三:方法论警示库。 GlaS 的官方划分存在同患者不同视野跨集、Test B 恶性占比 80%、图像尺寸不一等真实陷阱,使其成为教授「如何正确评测病理分割」的经典教材:挑战赛以 6 个排名之和决胜、后续研究揭示的 malignancy gap 与同患者乐观偏倚,都是数据评测课程的一手案例。对工程团队而言,绕开这些坑的最佳捷径就是通读本 Wiki §6.5 的 8 个坑点。

读完本节,你应该能一眼回答这几句

  • 它是什么:一个 165 张结直肠 H&E 视场图、带 1,530 个腺体实例掩码与良恶/分级标签的挑战赛基准。
  • 为什么硬:腺体在恶性期粘连、变形、腔面消失,实例分离 + 恶性鲁棒性是真正考点。
  • 用什么评测:官方对象级 F1 / Dice / Hausdorff,Test A 与 Test B 分开报。
  • 何时用它:方法论文的腺体分割基准、弱监督/分级与分割结合研究、病理教学实验。
  • 何时别用它:当作大规模预训练源、声称跨患者/跨中心泛化、或任何商业用途。

§1.3 同类数据集横向对比

数据集 规模 模态 标注层次 与 GlaS 的差异
GlaS(Warwick-QU) 165 张 / 16 患者 结直肠 H&E,20×(0.620 μm/px) 1,530 个腺体实例逐像素掩码 + 良恶性 + 五级分级 唯一带实例级腺体掩码与双测试集的挑战赛基准
CRAG 213 张裁剪图 / 38 患者 结直肠 H&E 腺体二值/实例掩码 + 分级 规模更大、来自多台扫描仪,常用作 GlaS 的外部验证集
MoNuSeg 30 张 WSI 图块 / 21 患者 多器官 H&E,40× 细胞核实例掩码(约 22,000 核) 对象是细胞核而非腺体,任务粒度更细
DigestPath 2019 690 张图块 结直肠 H&E 腺体分割 + 恶性检测 病灶区整体分割,无逐实例腺体轮廓
NCT-CRC-HE-100K 100,000 图块 结直肠 H&E 9 类组织图像级标签 规模大但仅图像级分类,无空间标注
PAIP 2019-2020 约 90 张 WSI 胃/肝 H&E 肿瘤区域像素级掩码 器官不同,标注为肿瘤区而非腺体实例

如何选:若目标是「研究腺体本身」(实例边界、粘连分离、腺体形态学量化),GlaS 与 CRAG 是同一任务尺度的两家,前者做官方基准、后者做外部验证的组合最常用;若关注对象粒度更细的细胞核,MoNuSeg/CoNSeP 更贴切;若目标是大规模弱监督图像分类预训练,则转向 NCT-CRC-HE-100K 这类分类大库。GlaS 的独特价值不是大,而是「腺体实例 + 良恶/分级 + 双测试集」三者齐备且标注规范——这在表内其余数据集里没有第二家。

§1.4 版本时间轴

时间 事件 说明
2015 挑战赛上线,训练数据发布 注册制下载,官网 warwick.ac.uk/fac/cross_fac/tia/data/glascontest
2015-10 MICCAI 2015(慕尼黑)现场赛 Test B 现场评测,13 支队伍参赛,CUMedVision2 夺冠
2016-03 arXiv 预印本 1603.00275 发布 挑战赛综述论文预印本
2017-01 数据论文发表于 Medical Image Analysis 第 35 卷 pp. 489-502,DOI 10.1016/j.media.2016.08.008
2015-2017 测试集(Test A/B 连同掩码)陆续开放 挑战赛结束后数据完全公开
2024-07 ModelScope 镜像更新(约 181 MB) 社区分发渠道,9,467 次下载(截至 2026-09)

版本治理说明:GlaS 自 2015 年发布以来数据内容未修订——165 张图像、掩码与官方划分十年来保持稳定,学术界的「衍生版本」均为格式转换镜像(Kaggle、ModelScope、Academic Torrents)或预处理仓库(PNG/NumPy 化),引用时以官方渠道与 MedIA 2017 论文为准。

§1.5 典型应用场景

  1. 腺体实例分割基准评测:在官方 85 张训练图上开发模型,Test A 与 Test B 分别报告对象级 F1、Dice、Hausdorff,与 2015 挑战赛及后续数千篇论文直接对比。这是 GlaS 至今最强的不可替代场景。
  2. 轮廓感知与实例分离方法研究:相邻腺体共享边界是该任务的核心难点,DCAN 的轮廓分支、分水岭后处理、SAM 提示微调等实例分离技术都在此数据上迭代验证。
  3. 良恶性分类与分级建模:图像级 benign/malignant 标签与五级分级(healthy / adenomatous / 中分化 / 中-低分化 / 低分化)支持分类、有序回归与多任务学习研究。
  4. 弱监督与半监督方法验证:165 张图的规模天然适合标签高效学习——仅用图像级标签做分割定位、或仅标注部分腺体的半监督设定,是近年高频用法。
  5. 教学与课程实验:数据小、格式朴素(BMP + 像素值即实例号)、任务清晰,是「医学图像实例分割」课程一天内可跑通全链路的标准教学集。

§2 医学背景

§2.1 ICD-11 编码映射

GlaS 全部图像来自结直肠腺癌(T3/T4 期)组织,涉及的 ICD-11(MMS 扩展码)映射如下:

标签/概念 ICD-11 编码 ICD-11 中文名 说明
结肠段原发腺癌 2B91 结肠恶性肿瘤 数据主体部位;组织学类型为腺癌
直肠段受累 2B92 直肠恶性肿瘤 结直肠范围含直肠;同属数据采集范围
良性对照组织 2E80 结肠良性肿瘤(参考章节) benign 组含正常与腺瘤性组织,编码落在消化系统良性肿瘤章节
组织学形态 ICD-O-3 8140/3(参考) 腺癌 ICD-11 形态学轴与 ICD-O-3 互认,8140/3 为腺癌 NOS

说明:GlaS 的标签体系是病理形态学(benign/malignant 二分类 + 分化程度分级),不是疾病分类学标签;上表用于把标签锚定到 ICD-11 疾病轴,便于跨库检索与知识图谱对齐。

§2.1b SNOMED CT 映射

标签/概念 SNOMED CT 码 类型 术语
恶性结肠肿瘤(疾病轴) 363406005 disorder Malignant tumor of colon(结肠恶性肿瘤)
腺癌(形态学轴) 68168001 morphology Adenocarcinoma(腺癌)
腺体(分割对象) 59820001 body structure Glandular structure(腺体结构)
结肠(解剖部位) 71854001 body structure Colon structure(结肠结构)
直肠(解剖部位) 34402009 body structure Rectum structure(直肠结构)

§2.2 疾病简介与流行病学

结直肠癌(colorectal cancer,CRC)是全球高发的恶性肿瘤:据 GLOBOCAN 数据,结直肠癌发病居全球癌症第三位、死亡居第二位,年新增数百万例量级。组织学上,绝大多数 CRC 为腺癌(起源于腺上皮的恶性肿瘤),腺体(gland)是其基本功能与结构单元。病理分级(grading)的核心正是腺体形态:高分化腺体仍成形、低分化腺体结构紊乱甚至消失,分级直接关联预后与治疗决策。临床上,病理医生在 H&E 切片上人工评估腺体的形成程度、排布与浸润方式,但这一过程主观性强——观察者间与同一医生不同时间的判定都可能不一致,这正是自动化腺体定量分析的立项动机,也是 GlaS 挑战赛开宗明义要解决的问题(见挑战赛官网引言)。

在 GlaS 数据中,任务难度跨度被刻意拉满:37 张良性图(腺体成形、边界清晰)与 48 张恶性训练图(中/低分化,腺体变形、粘连、腔面消失)共同构成训练集,测试集亦按良恶分层——这使它成为研究「形态学变异性对分割鲁棒性影响」的天然试验床。

分级为何依赖腺体形态:结直肠腺癌的分化程度本质上是「腺体保真度」的度量。高分化(well differentiated)腺癌保留清晰的管状腺体结构,管腔规整、单层上皮排列可辨;中分化(moderately)腺体仍可见但出现大小不一、扭曲与筛状结构;低分化(poorly differentiated)则腺体结构大量崩塌,以实性条索、小巢甚至单细胞浸润为主。由于分级与淋巴结转移风险、复发率强相关,它直接影响「术后是否化疗、随访频率多高」等管理决策——这就是病理医生在镜下逐视野评估腺体形态的现实意义,也是 GlaS 把「腺体分割」而非笼统的「肿瘤区分类」作为任务的原因:只有先拿到腺体的几何边界,才能进一步量化管腔面积、腺体密度与出芽这些分级相关的形态学特征。

从形态学到标签的落差:对自动化系统而言,最大的难点恰恰落在形态学过渡带——腺瘤性(adenomatous)与中分化癌在腺体外观上可能高度接近,中-低分化的分界更是依赖经验判断。GlaS 的五级标签把这层病理学主观性原封不动地保留进了数据(见坑点 8),它既是挑战也是机会:算法若能在这条连续谱上稳定地分割腺体并给出可解释的形态学度量,就比简单输出一个分级更能帮助病理医生定位「分歧出在哪张图上」。

§2.3 临床任务定义

GlaS 对应的临床场景是结直肠癌病理分级中的腺体形态定量,具体分解为三个 AI 任务:

  1. 腺体实例分割(主任务):在 H&E 视场中把每个腺体逐像素勾出并区分相邻个体。临床意义:腺体数量、大小、管腔面积与出芽等形态统计是分级与预后研究的输入。
  2. 语义分割/腺体检测:只区分「腺体 vs 间质」像素。临床意义:快速定位腺体密集区,辅助全切片扫描中的感兴趣区域提取。
  3. 良恶性分类与分级:图像级判断 benign/malignant,进而映射五级组织学分级。临床意义:分级一致性是病理质控指标,自动化分级有望降低观察者间变异。

按临床流程划分,这属于诊断辅助(诊断分级)而非筛查或预后建模任务;数据为离线切片图像,不涉及前瞻性临床决策。

§2.4 患者人群

维度 内容
来源机构 University Hospitals Coventry and Warwickshire(UHCW),英国考文垂
患者数 16 位结直肠腺癌患者,每人 1 张 H&E 切片(16 张切片)
疾病分期 全部为 T3/T4 期(原发肿瘤浸润超出肠壁肌层),无早期病例
良恶构成 训练 37 良性 / 48 恶性;Test A 33 良性 / 27 恶性;Test B 4 良性 / 16 恶性
年龄/性别/种族 官方未公开(切片级脱敏,无患者级元数据)
就医类型 手术切除标本的病理切片(T3/T4 分期提示为根治切除标本)
采集时间 官方未公开(2015 年挑战赛前采集;不同切片在不同时间处理,存在染色批次差异)

⚠️ 注意:每张切片来自不同患者、且「切片在不同时间处理」,这是挑战赛论文明确强调的设计——数据集在染色分布与组织结构上表现出高受试者间变异性,是特性而非缺陷,但直接意味着跨图域偏移显著。

病例构成的三个提醒:其一,16 位患者对应 16 张切片,意味着每个「患者」在数据上只贡献一张切片——模型实际见过的切片风格数量就是 16 种,任何声称「跨患者泛化」的说法都受限于这一很小的风格基数。其二,T3/T4 分期把样本集中在局部进展期肿瘤,Dukes 早期/息肉样早期癌缺失,因此任务难度偏「中晚期癌的腺体分割」,不是全部 CRC 形态的代表。其三,benign 组(37+33+4=74 张)并非健康人结肠,而是同一批 T3/T4 患者手术标本中取到的相对正常/腺瘤性区域切片——把它当「正常结肠基准」会在临床叙事上造成误导;准确说法是「同一患者群内的良性对照区」。

§2.5 临床价值

自动化腺体分割的临床价值沿三条线展开:其一,分级可重复性——把「腺体成形度」转化为可度量的几何统计(管腔面积、腺体圆度、间质比例),减少观察者间分歧;其二,分级通量——全切片层面的腺体普查人力成本极高,分割模型可在 WSI 上批量产出腺体级统计,支撑大样本预后研究;其三,科研标准化——GlaS 提供的统一评测使腺体定量方法之间第一次可以严格比较,加速了从实验室方法到病理工作流工具的转化。GlaS 论文明确指出,该挑战赛的动机即为量化腺体形态以辅助分级、改善分级一致性。

§2.6 金标准参考

划分 标注方式 标注者 性质
分割掩码(165 张全覆盖) 逐像素腺体轮廓勾画,每实例独立标签(像素值 1-32) 一位专家病理学家(UHCW) 参照标准(reference ground truth)
良恶性二分类 图像级标签(benign/malignant) 病理团队 参照标准
五级分级 图像级标签(healthy / adenomatous / moderately / moderately-to-poorly / poorly differentiated) 病理团队(Sirinukunwattana 分类法) 参照标准,随社区整理的 Grade 文件分发

标注性质提示:金标准出自单一标注者,无第二标注者重复勾画,故观察者间一致性无法在本数据集内部估计;使用时应把「标注者自身的一致性」视为隐含假设(见 §7.2)。


§3 数据集规格

§3.0 版本抉择矩阵

GlaS 数据内容单一稳定,但获取渠道有三类,差异在于格式与便利性:

你的需求 推荐版本 大小 理由
复现挑战赛口径、发表正式结果 官方注册下载(Warwick 官网) 约 181 MB 原始 BMP、可引用官方渠道,满足使用条款
快速上手/课程实验/原型验证 Kaggle 镜像 glasmiccai2015-gland-segmentation 约 181 MB 免注册审批,Kaggle Notebook 内可直接挂载
国内网络环境批量获取 ModelScope 镜像 OmniData/GlaS 180.91 MB 国内 CDN,git clone + LFS 即取
需要 PNG/NumPy 预处理版 社区仓库(如 SA2-Net 等参考实现自带转换脚本) 视仓库而定 自带 80/5 train-val 切分与标签列转换,但与官方划分口径需自行核对

合规提示:无论哪个渠道,数据使用条款一致——仅供研究、禁止商用、发表须引用 MedIA 2017 与 IEEE TMI 2015 两篇论文。Kaggle/ModelScope 镜像为社区上传,正式发表时建议同时在数据可用性声明中列出官方渠道。

§3.1 模态详情

  • 成像对象:结直肠腺癌手术切除标本的 H&E 染色切片(苏木精-伊红染色,石蜡包埋,常规病理制片流程)。
  • 数字化:Zeiss MIRAX MIDI 全切片扫描仪,原生分辨率 0.465 μm/px,随后重采样至 0.62005 μm/px——等效 20 倍物镜(20×)下的标准病理分辨率。注意这是 20× 而非许多细胞核数据集常用的 40×,腺体整体结构清晰、细胞核细节相对次要。
  • 视场裁切:从 16 张 WSI 上裁切出 165 张视场图(field of view),每图覆盖若干完整腺体与周边间质;训练与测试取自不同视野
  • 成像颜色特征:H&E 双染——细胞核蓝紫(苏木精)、细胞质与胶原红粉(伊红);不同切片间染色深浅存在可见的批次差异,这正是社区普遍在预处理中加入染色归一化/增广的原因。

20× 分辨率对任务的现实约束:0.620 μm/px 意味着一个典型腺体(直径 100-400 μm)在图上约占 160-640 px,落在十几到几十万像素的可操作区间——既不会小到难以分割,也不会大到单个视场放不下多个实例。相比之下,细胞核级任务所需的 40×(0.25 μm/px)在此数据上并未提供,因此基于 GlaS 训练的模型不适合直接去做核膜、染色质等亚细胞结构分析;反之,若在 40× 数据(MoNuSeg 等)上训练的核级模型直接迁移到 GlaS,会因尺度失配而把大腺体看成大片核团——这是坑点 7 的物理根源。理解这张「分辨率 ↔ 可解析对象」的对应关系,有助于一开始就把任务期望设对,避免拿腺体数据硬做核级精度。

§3.2 按子集样本数

子集 图像数 良性 恶性 腺体实例数 命名规则
train 85 37 48 769 train_1.bmp … train_85.bmp
testA(off-site) 60 33 27 761(两测试集合计) testA_1.bmp … testA_60.bmp
testB(on-site) 20 4 16 同上 testB_1.bmp … testB_20.bmp
合计 165 74 91 1,530 每图配对 <name>_anno.bmp

子集设计意图:Test A(60 张)供赛期远程评测、良恶近乎均衡;Test B(20 张)供 MICCAI 现场当天评测、恶性占 80% 且腺体形态更不规则——两个测试集的组织构成刻意不同,用于检验方法的鲁棒性跨度。

从这张子集表能直接读出三条工程结论:

  • 训练 85 / 测试 80 是「官方口径」,改任何比例都会让成绩无法与文献对比——除非你主动声明用了自建划分。
  • Test A 良恶近均衡(1.22:1)适合当「稳定基准」;Test B 恶性压倒(0.25:1)适合当「压力测试」——别把两者当同一难度水平。
  • 腺体实例 train 769 / test 761 总量接近,但分布到 testB 只有 20 张图,统计功效有限,结论要谨慎下。

§3.3 数据格式

文件类型 格式 说明
组织图像 BMP(24-bit RGB) 尺寸不一,主流 522×775,另有 6 种尺寸(见 §4.3)
实例掩码 BMP(索引像素值) 像素值 0 = 背景,1-32 = 各腺体实例;与图像同名加 _anno 后缀
图像级标签 CSV/文本(Grade 文件) 二分类(benign/malignant)与五级分级;官方包内为 Grade.csv 形态(社区整理口径)

§3.4 存储大小

官方发布包约 181 MB(ModelScope 镜像登记 180.91 MB;Kaggle 镜像同量级)。解压后含 165 对 BMP(图像 + 掩码)与标签文件,无 WSI 原文件——原始 MIRAX 格式 WSI 未随数据集发布。

§3.5 标注方式

  • 类型:纯人工逐像素标注(instance-level contours),非半自动、非弱监督。
  • 粒度:双重粒度——像素级实例掩码 + 图像级分类标签,两者独立提供。
  • 实例编码:BMP 掩码以索引值区分实例(0 背景,1-32 腺体),「一个标签一个对象」是官方明示的约定(原话:one ground truth object per label)。
  • 无掩码分离层:掩码中相邻腺体直接相邻(共享边界处像素归属其一),没有预留边界带;实例分离需要模型显式预测轮廓或后处理推断。

标注的解剖学视角:病理医生标注时,判断「这是一个腺体」依据的是其横断面特征——由单层或多层上皮围成的管腔(lumen)轮廓、与周围间质的相对关系。在良性区,管腔圆整、边界因完整基底膜而清晰;在低分化区,腺体上皮塌陷成实性团、管腔消失,勾画边界就需要依赖细胞极性与核排列等次级线索,边界的主观性随之上升。这一标注过程中隐含的「哪些算腺体」的约定,决定了 GlaS 的掩码不会包含疑似腺管出芽、个别浸润细胞的独立小对象——它刻画的是解剖学上可判定的腺体单位,而非一切上皮结构。理解这一点,有助于解释为何模型容易把良性图的过度分割(over-segmentation)和恶性图的欠分割(under-segmentation)做得不尽如人意:前者是把正常隐窝误拆成多段,后者是漏掉没有明确管腔的低分化腺体。

§3.6 标注者资质与一致性

标注由 UHCW 的一位专家病理学家完成(挑战赛官网表述:ground truth annotations by expert pathologists;各论文口径为 single pathologist)。官方未发布第二标注者重复标注,故无观察者间一致性数据;同时官方亦未公布观察者内一致性检验。这是使用该数据集时必须写进论文 limitations 的一条。

§3.7 采集周期

官方未公开切片采集的具体年份与区间;可确认的时间锚点是:数据在 2015 年 MICCAI 挑战赛前完成采集与标注,2015 年随挑战赛发布,2017 年 MedIA 论文固化其描述。动态指标请以「截至 2026-09」口径引用本 Wiki。

§3.8 地域覆盖

单中心:英国考文垂 University Hospitals Coventry and Warwickshire。无多中心、无多扫描仪设计;人群(年龄、性别、种族)官方未公开。地域与设备的单一性是 §7.1 偏倚讨论的主线之一。

§3.9 设备规格

项目 规格
扫描仪 Zeiss MIRAX MIDI
原生分辨率 0.465 μm/px
发布分辨率 0.62005 μm/px(重采样后,约等效 20× 物镜)
图像格式 BMP(24-bit RGB)
典型视场 522×775 px(约 0.32×0.48 mm 组织区域)
染色 H&E(苏木精-伊红)

为什么只发布视场图而不是完整 WSI:GlaS 的任务单元是「腺体实例分割」,评估需要逐实例、逐像素可对照的参照,而完整 WSI(MIRAX 原生格式通常数 GB、含多层金字塔)既不便于逐张上传下载,也超出当时 web 竞赛的带宽;组织者按挑战赛目标从 WSI 中裁取 165 个代表性视场,每个视场恰好覆盖数个完整腺体与足够间质,是评估实例分割的最合适粒度。理解这一取舍,就能明白三点推论:其一,本数据集不含 WSI,做「WSI 级端到端」需自行用多视场拼接;其二,视场裁切保证了图像之间基本不重叠、但同一切片的多个视场在染色上高度同源;其三,若未来需要 WSI 级任务,应转向 PAIP/DigestPath 这类提供完整扫描或病灶区掩码的数据集。

§3.10 深度溯源链

患者(16 位结直肠腺癌,T3/T4)
  └─ 手术切除标本 → 石蜡包埋 → H&E 染色切片(16 张,UHCW 病理实验室,不同批次处理)
      └─ Zeiss MIRAX MIDI 扫描 → WSI(0.465 μm/px,未随数据集发布)
          └─ 重采样至 0.62005 μm/px
              └─ 视场裁切 → 165 张视场图(train 85 / testA 60 / testB 20,与训练集取不同视野)
                  └─ 专家病理学家逐像素实例标注(BMP 掩码,1,530 个腺体)
                  └─ 图像级标签(benign/malignant + 五级分级)

溯源缺口:患者 → 切片的对应关系(哪个文件属于哪位患者)官方未公开,社区通过文件名与像素统计推断出部分分组(如 train 与 testB 共享部分患者),但不能作为权威依据;引用时以官方「16 切片/16 患者、训练与测试视野不同」口径为准。


§4 数据结构

§3.11 命名与文件约定

  • 图像前缀train_testA_testB_ 三段,各自从 1 连续编号到 85 / 60 / 20,前缀即官方划分的天然键——解析前缀即可确定 split,无需额外元数据表。
  • 掩码后缀:每张图像 <stem>.bmp 配一个 <stem>_anno.bmp_anno 是约定俗成的官方命名(部分镜像写作 _an_ano,加载前先 ls 核对一次即可)。
  • 标签文件:官方分发带 Grade 文件(社区整理为 Grade.csv),逐图列出良性/恶性二分类与五级分级;它与图像文件不同名,需按 image_id 关联(§4.1 表)。
  • 两种目录布局:官方注册包把三个子集放在 train/ testA/ testB/ 三个目录;Kaggle/社区包常平铺到单目录仅靠前缀区分。写通用加载器时应支持「前缀解析」优先,目录布局只作辅助,避免硬编码路径。
  • 兼容性提醒:文件名均为纯 ASCII、无空格,跨平台安全;但同一逻辑样本在不同镜像可能落在不同目录结构,版本登记时记录来源 URL 可避免混淆(见 §6.10)。

§4.0 目录树

数据解压后(官方注册包与 Kaggle 镜像同构,文件名以 Kaggle 镜像为准):

Warwick-QU/                       ← 数据根目录(data_root)
├── train/                        ← 训练集(85 对)
│   ├── train_1.bmp               ← H&E 图像(RGB)
│   ├── train_1_anno.bmp          ← 实例掩码(像素值 0=背景,1-32=腺体实例)
│   ├── ...
│   └── train_85_anno.bmp
├── testA/                        ← 测试集 A(60 对,赛期远程评测集)
│   ├── testA_1.bmp
│   ├── testA_1_anno.bmp
│   └── ...
├── testB/                        ← 测试集 B(20 对,现场评测集)
│   ├── testB_1.bmp
│   ├── testB_1_anno.bmp
│   └── ...
└── Grade.csv                     ← 图像级标签:二分类 + 五级分级(社区整理口径)

关键拼接关系:图像与掩码同名成对(train_1.bmptrain_1_anno.bmp),data_root + 子目录 + 文件名即可定位任意样本;部分镜像把三个子集平铺在同一目录、仅靠前缀区分(train_* / testA_* / testB_*),加载逻辑需兼容两种布局。

§4.1 DAIMS 字段字典

以「每行一张图像」的宽表口径整理(可在加载时从文件系统 + Grade.csv 自动构建):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
image_id string 图像唯一标识(文件名主干) train_12 主键、结果对齐 train_{1…85}, testA_{1…60}, testB_
split string 官方划分 testA 评测口径控制 train / testA / testB
grade_binary string 良恶性标签 malignant 分类任务标签 单标注者主观 benign / malignant
grade_5level string 五级组织学分级 poorly differentiated 分级建模 单标注者主观 healthy / adenomatous / moderately / moderately-to-poorly / poorly differentiated
image_file string 图像文件路径 train_12.bmp 加载 相对路径
mask_file string 实例掩码路径 train_12_anno.bmp 分割监督 相对路径
width int 图像宽度(像素) 775 尺寸感知处理 567-775
height int 图像高度(像素) 522 尺寸感知处理 430-522
instance_count int 掩码中腺体实例数(最大像素值) 32 实例统计、密集度分层 掩码整数即真值 1-32
resolution_um float 像素物理尺寸 0.62005 跨库重采样对齐 扫描仪标称 0.62005(全库恒定)

上面这张宽表并非随包文件,而是可在加载时自动构建的派生视图——只需扫描文件系统得到 image/mask 路径,再按文件名前缀解析 split、从 Grade 文件读入两套标签、读掩码最大值得到 instance_count。核心代码示意:

import numpy as np, pandas as pd
from pathlib import Path
from PIL import Image

def build_table(data_root):
    rows = []
    for split in ("train", "testA", "testB"):
        for m in sorted(Path(data_root, split).glob("*.bmp")):
            if m.name.endswith("_anno.bmp"):        # 只取掩码文件,image 由其同名衍生
                stem = m.name.replace("_anno.bmp", "")
                img = np.array(Image.open(Path(data_root, split, f"{stem}.bmp")))
                msk = np.array(Image.open(m))
                rows.append({"image_id": stem, "split": split,
                             "height": img.shape[0], "width": img.shape[1],
                             "instance_count": int(msk.max())})
    df = pd.DataFrame(rows)
    # 再与 Grade.csv 按 image_id 合并得到 grade_binary / grade_5level
    return df

print(build_table("Warwick-QU").shape)   # (165, ...):含 165 个 image_id 即数据完整

信息性缺失与编码约定:字段均为简单文本/数值,除 image_id 主键与路径外没有重复信息;instance_count 由掩码最大值直接读出,可作为「掩码是否完整」的轻量自检(每图应 ≥1)。表中没有任何字段需要用哨兵值(如 -1、NA)表示缺失——因为全库无缺失,见 §4.5。

§4.2 标签分布

图像级二分类分布

划分 benign malignant 良恶比
train(85) 37 48 0.77:1
testA(60) 33 27 1.22:1
testB(20) 4 16 0.25:1
合计(165) 74 91 0.81:1

分割标签分布:全库 1,530 个腺体实例,训练集 769 个、测试集合计 761 个;腺体像素约占图像总面积的一半(训练集约 50%、测试集约 51%)——前景/背景基本均衡,这与许多前景稀疏的医学分割任务不同,但也意味着「把间质误当腺体」的假阳性代价同样高。单图实例数 1-32 个不等,测试图平均约 9.5 个/图(761/80)。

五级分级的组织学构成:挑战赛把测试集图像按其组织学分级进一步细分,良性组覆盖正常(healthy)到腺瘤性(adenomatous),恶性组则横跨中分化、中-低分化到低分化腺癌。这种自良性高分化到恶性低分化的谱系式覆盖是 GlaS 的核心设计——它刻意避免只收录「好切」的样本,而是要求算法在分化良好的规则管腔与结构崩塌的实性癌巢之间保持稳健。因此五级标签不仅服务于分级任务本身,也是做「哪些形态学亚型导致分割失败」这类细粒度分析时的切分依据。

逐子集腺体分布:官方对两套测试集采取分层说明口径,testA 与 testB 的腺体合计 761 个;两个测试集的腺体形态差异是任务难度梯度的重要来源——testA 含较多成形腺体(良性占比高),testB 则是低分化腺体占压倒性多数,这直接解释了 §8.1 排行榜中几乎所有方法在 testB 上的对象级指标大幅回落(malignancy gap)的现象。

§4.3 关键统计

统计项 数值 说明
图像总数 / 实例总数 165 张 / 1,530 个腺体 掩码像素值范围 0-32
主流尺寸 522×775(151/165 张,91.5%) 尺寸感知加载的默认预期
非主流尺寸 14 张,6 种规格 430×567(1)、433×574(2)、433×578(1)、442×581(2)、453×589(8)等
宽度范围 / 高度范围 567-775 px / 430-522 px 全库无标准正方形图
单图最大实例数 32 掩码编码上限亦是实测上限
物理分辨率 0.62005 μm/px(恒定) 原生 0.465 μm/px 重采样而来

把统计转成可复现检查:加载管线里应内置三条断言,作为数据完整性的哨兵:

  • 图像总数等于 165(与官方三子集一致);
  • 掩码像素最大值不超过 32(实例编码未越界);
  • instance_count 全为 ≥1(无空掩码)。

任一断言失败都提示读库或镜像问题,而不是模型问题。

§4.4 数据层级

GlaS 的层级结构为「患者 → 切片 → 视场图 → 腺体实例」四级:

  • 患者层(16):每人一张切片;患者与文件的映射未公开。
  • 切片层(16):每张切片以不同批次处理,染色风格存在系统差异。
  • 视场图层(165):同一张切片上可裁出多个视场,分别归入训练与测试(不同视野),是同患者重叠的来源。
  • 实例层(1,530):掩码内的腺体对象,计数与形态统计的基本单位。

工程含义:任何「打乱重划分」都必须以患者/切片为组键(GroupShuffleSplit),仅按图像打散会把同一患者的相邻视野放进训练与验证两侧,制造乐观偏倚。

实操中的分组策略(推荐优先等级从高到低)

  • 方案 A(最严,纯患者级):把 16 张切片视为 16 组,按切片做 GroupKFold 或留一患者验证——只适合论证「跨患者泛化」,样本量受限、方差不小。
  • 方案 B(折中,官方口径内自建 val):在官方 train 85 张内随机留 val,但记录文件名清单并人工排除与 val 相邻的同切片图——能复现文献又降低同切片泄漏。
  • 方案 C(学术默认,最常用):直接沿用官方 train/testA/testB,testA/testB 不参与调参,只在方法定型后各评一次;论文里另报一个方案 A 的患者级数字作为稳健性佐证。

判断是否需要方案 A:若论文声称「泛化到新患者/新中心」,方案 A 或外部库(CRAG)几乎必需;若只在「官方基准上比方法」,方案 C + 明确措辞即可。多数投稿踩的坑是方案 C 成绩却写患者级措辞(坑点 4)。

§4.5 缺失值与信息性缺失编码

GlaS 为全标注数据集:165 张图像全部有配对掩码与图像级标签,无缺失值、无信息性缺失编码需求。两个「看似缺失」的常见误判提醒:掩码 BMP 读出的像素值 0 是真实背景而非缺失标记;若某图读出的掩码最大值异常(如全 0),应优先怀疑读库通道(BMP 通道序/压缩)而非数据缺失——社区未见该类记录,遇到时先以图像-掩码叠加可视化排查。


§5 划分与使用建议

§5.1 官方划分

官方三向划分固定且不可更改评测口径:train 85(开发用)、testA 60(赛期远程测试)、testB 20(现场测试)。全部 165 张均带标注,因此技术上任何自建划分都可执行,但与既有文献可比的口径只有官方这一个。

§5.2 社区惯例划分

  • 85 张训练集内部再划分:最常见做法是从 85 张中随机留出 5-20 张作验证集(如 80/5、80/20),其余训练;Transformer 系论文多用 80/5 或随机比例、重复实验取均值。
  • K 折交叉验证:在 85 张上做 5 折是方法论文的常规操作(注意按文件名分组无法保证患者级分离,见 §5.3)。
  • Test A 当验证集:不少工程实现直接在 testA 上调参——这会污染该测试集的成绩报告,只适合纯自用调通管线,论文中不应如此(见坑点 5)。

§5.3 泄漏风险与划分策略 ⭐

GlaS 的泄漏问题与多数数据集方向相反——官方划分本身自带同患者重叠:16 位患者分布在全部三个子集中,训练与测试取自同一批切片的不同视野。这意味着:

  1. 官方口径成绩衡量的是「同患者、新视野」的泛化,存在同患者乐观偏倚;论文中不应表述为患者级泛化能力。
  2. 自建划分时若不按患者分组,会把相邻视野同时放进训练与验证,进一步放大泄漏。
  3. 若要声称患者级泛化,需按 16 个患者做 GroupKFold(每人一张切片,等价于按切片分组),此时成绩会显著低于官方口径——这是预期行为而非模型退化,应同时报告两种口径。

§5.4 交叉验证建议

推荐协议:85 张训练图上按 5 折(或重复 5 折)随机划分做模型选型,定型后在 testA/testB 上各报一次,不参与任何调参;报告时同时给出 testA 与 testB(两者组织构成不同,不可合并平均)。以 0.620 μm/px 的物理分辨率说明重采样策略,避免跨库联合训练时分辨率漂移。

一个最小可运行的 5 折选型骨架(scikit-learn + 你的训练函数):

from sklearn.model_selection import KFold
import numpy as np

stems = [f"train_{i}" for i in range(1, 86)]          # 85 张训练图
folds = KFold(n_splits=5, shuffle=True, random_state=0).split(stems)

for fold, (tr_idx, va_idx) in enumerate(folds, 1):
    tr, va = [stems[i] for i in tr_idx], [stems[i] for i in va_idx]
    # train_fn(tr) 训练;report_fn(model, va) 在 val 上报对象级 F1/Dice
    print(f"fold {fold}: train {len(tr)} 张, val {len(va)} 张")
# 取 5 折 val 指标均值选超参;定型后再在 testA 与 testB 各评一次

提示:若把每个 fold 的 val 成绩画成直方图,你会发现 85 张规模下 fold 间方差可达数个百分点——这正是 §6.10 强调「重复实验 + 报方差」的原因;当超参在两个 fold 间翻转第一时,优先选更鲁棒的配置而非单折最高的配置。

§5.5 外部验证建议

推荐的外部验证集依次为:CRAG(结直肠腺癌腺体,同任务、规模互补,社区事实上的外部集)、DigestPath 2019(结直肠病灶分割)、MoNuSeg(细胞核实例,跨对象粒度)。跨库使用时优先校准两库的 μm/px 与染色风格(见坑点 7)。

为什么外部验证对 GlaS 尤其重要:§5.3 已指出官方划分自带同患者重叠,因此即便模型在 testA/testB 上成绩出色,也不能证明它对未见患者或新中心同样稳健。补齐这一证据链的成本极低——只需把训练好的模型在 CRAG 上做一次 zero-shot 推理并报告 Dice/F1。CRAG 同为结直肠 H&E 腺体分割,但采集自多中心、多台扫描仪,切片大小与染色风格均不同于 GlaS,是检验「单中心训练出来的模型换环境是否垮掉」的最直接探针。行业惯例是同时在两个库上报成绩(GlaS 官方口径 + CRAG 迁移),审稿人普遍接受这样的泛化论述;仅报官方口径则容易被指出划分偏倚问题。若目标是跨器官,再叠加 MoNuSeg/CoNSeP(细胞核粒度)验证对象尺度泛化,但那属于更高阶的迁移设定。


§6 AI 就绪指南

§6.0 云端快速启动

最快路径是 Kaggle Notebook:数据集 sani84/glasmiccai2015-gland-segmentation 可直接挂载(右侧 Add Input 搜索 GlaS),免下载、免注册审批,免费 GPU(T4/P100)足够本数据集训练。ModelScope 用户用 git lfs install && git clone https://www.modelscope.cn/datasets/OmniData/GlaS.git 一步拉取(约 181 MB)。以下所有代码在这两种环境下均可直接运行(调整 data_root 即可)。

§6.1 快速上手

下方代码的目录结构预期:data_root 指向包含 train/testA/testB/ 三个子目录的根目录(见 §4.0 目录树);data_root + split + f"{stem}.bmp" 即图像路径、data_root + split + f"{stem}_anno.bmp" 即掩码路径。最小可用子集是 train 的 85 对 BMP——不依赖任何 CSV 即可跑通分割训练;图像级标签仅在分类任务时需要。

# -*- coding: utf-8 -*-
"""GlaS 最小上手:加载一对 BMP 并检查实例掩码编码
目录预期:
    data_root/
        train/train_1.bmp ... train_85_anno.bmp
        testA/testA_1.bmp ...
        testB/testB_1.bmp ...
data_root 拼接关系:image = data_root/split/{stem}.bmp
                   mask  = data_root/split/{stem}_anno.bmp
"""
import numpy as np
from PIL import Image

data_root = "Warwick-QU"          # ← 改成你的解压目录
stem = "train_1"                  # 任意样本主干名
img = np.array(Image.open(f"{data_root}/train/{stem}.bmp"))        # (H, W, 3) uint8
msk = np.array(Image.open(f"{data_root}/train/{stem}_anno.bmp"))   # (H, W) uint8

print("image:", img.shape, img.dtype, img.min(), img.max())
print("mask :", msk.shape, msk.dtype, "实例标签:", np.unique(msk))
# 关键检查:掩码像素值必须保留 0..N 的原始整数(N=该图腺体数)
# 若这里出现 0/1 二值或 0/255,说明读库或保存环节已破坏实例标签(见坑点 1)

§6.2 数据获取

渠道 方式 前置条件 大小
官方(Warwick TIA) 官网 Download 页注册账号后下载 邮箱注册;同意研究用途条款 约 181 MB
Kaggle 镜像 kaggle datasets download sani84/glasmiccai2015-gland-segmentation Kaggle 账号 + API Token 约 181 MB
ModelScope 镜像 git clone https://www.modelscope.cn/datasets/OmniData/GlaS.git(需 git-lfs) 180.91 MB
Academic Torrents 种子下载 约 181 MB
# Kaggle 命令行获取(先 pip install kaggle 并配置 ~/.kaggle/kaggle.json)
kaggle datasets download -d sani84/glasmiccai2015-gland-segmentation
unzip glasmiccai2015-gland-segmentation.zip -d Warwick-QU

# 获取后自检:应为 85 + 60 + 20 = 165 对图像与掩码
python - <<'PY'
from pathlib import Path
root = Path("Warwick-QU")
for split in ["train", "testA", "testB"]:
    n = {"train": 85, "testA": 60, "testB": 20}[split]
    print(split, "文件数:", len(list(root.glob(f"{split}/*.bmp"))), "(期望", n * 2, ")")
PY

§6.3 预处理全流程

推荐流水线:BMP → NumPy(保留原始整型掩码)→ 尺寸统一(pad 到 528×784 或 resize 到 256×256)→ 像素归一化(仅图像)→ H&E 染色增广(可选)。核心原则:图像可以随便归一化,掩码绝对不许

import numpy as np
import torch
from PIL import Image

PAD_H, PAD_W = 528, 784  # 覆盖全库最大尺寸 522×775,pad 而非 resize,保住 μm/px 物理尺度

def load_pair(image_path, mask_path):
    """读一对图像/掩码;掩码用 NumPy 原值读取,禁止 ToTensor(见坑点 1)"""
    img = np.array(Image.open(image_path).convert("RGB"), dtype=np.float32) / 255.0
    msk = np.array(Image.open(mask_path))                # uint8 实例标签 0..N
    return img, msk

def pad_sample(img, msk, pad_h=PAD_H, pad_w=PAD_W):
    """右下补零对齐:图像补 0(黑),掩码补 0(背景语义恰好正确)"""
    h, w = img.shape[:2]
    img_p = np.zeros((pad_h, pad_w, 3), dtype=img.dtype); img_p[:h, :w] = img
    msk_p = np.zeros((pad_h, pad_w), dtype=msk.dtype);   msk_p[:h, :w] = msk
    return img_p, msk_p

def to_tensors(img, msk):
    x = torch.from_numpy(img.transpose(2, 0, 1).copy())           # (3, H, W) float32
    semantic = (msk > 0).astype(np.float32)                        # 腺体/背景二值
    return x, torch.from_numpy(semantic), torch.from_numpy(msk)    # 语义掩码 + 实例掩码双输出

img, msk = load_pair("Warwick-QU/train/train_1.bmp", "Warwick-QU/train/train_1_anno.bmp")
img, msk = pad_sample(img, msk)
x, sem, inst = to_tensors(img, msk)
print(x.shape, sem.shape, inst.unique())   # 期望 [3,528,784] [528,784] tensor([0,1,...,N])

若与 40× 数据集联合训练,则改为按物理分辨率重采样:GlaS 的 0.620 μm/px 重采样到 0.5 μm/px 等效视场需缩放 1.24 倍(见坑点 7)。

§6.4 PyTorch DataLoader

完整可运行的 Dataset 类:双输出(语义掩码 + 实例掩码)、尺寸对齐、train/test 两套增广。

<details>
<summary>点击展开完整 Dataset + DataLoader 代码(约 55 行)</summary>

import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
from PIL import Image

class GlaSDataset(Dataset):
    """GlaS 腺体分割数据集
    目录预期:data_root/{split}/{stem}.bmp 与 {stem}_anno.bmp 同名成对
    data_root 拼接关系:self.data_root / split / f"{stem}.bmp"
    返回:image(3,H,W) float、semantic_mask(H,W) float、instance_mask(H,W) long
    """
    def __init__(self, data_root, split="train", stems=None, size=(528, 784), augment=False):
        self.root = data_root
        self.split = split
        self.size = size                      # (H, W) pad 目标
        self.augment = augment                # 训练期几何增广开关
        counts = {"train": 85, "testA": 60, "testB": 20}
        self.stems = stems or [f"{split}_{i}" for i in range(1, counts[split] + 1)]

    def __len__(self):
        return len(self.stems)

    def _load(self, stem):
        img = np.array(Image.open(f"{self.root}/{self.split}/{stem}.bmp").convert("RGB"),
                       dtype=np.float32) / 255.0
        msk = np.array(Image.open(f"{self.root}/{self.split}/{stem}_anno.bmp"))  # uint8 实例
        return img, msk

    def __getitem__(self, idx):
        img, msk = self._load(self.stems[idx])
        if self.augment:                      # 同步几何变换:翻转对掩码同样生效
            if np.random.rand() < 0.5:
                img, msk = img[:, ::-1], msk[:, ::-1]
            if np.random.rand() < 0.5:
                img, msk = img[::-1], msk[::-1]
            k = int(np.random.randint(0, 4))  # 随机 90° 旋转
            img, msk = np.rot90(img, k).copy(), np.rot90(msk, k).copy()
        h, w = img.shape[:2]; ph, pw = self.size
        canvas = np.zeros((ph, pw, 3), dtype=np.float32); canvas[:min(h, ph), :min(w, pw)] = img[:ph, :pw]
        mcanvas = np.zeros((ph, pw), dtype=np.uint8); mcanvas[:min(h, ph), :min(w, pw)] = msk[:ph, :pw]
        x = torch.from_numpy(canvas.transpose(2, 0, 1))
        sem = torch.from_numpy((mcanvas > 0).astype(np.float32))
        return x, sem, torch.from_numpy(mcanvas.astype(np.int64))

if __name__ == "__main__":
    # 最小子集:train 85 对;val 从中随机留 5 张(见 §5.2,勿用 testA 调参)
    ds = GlaSDataset("Warwick-QU", split="train", augment=True)
    loader = DataLoader(ds, batch_size=4, shuffle=True, num_workers=2)
    x, sem, inst = next(iter(loader))
    print(x.shape, sem.shape, inst.shape, inst.max())   # [4,3,528,784] [4,528,784] [4,528,784] ≤32

</details>

§6.5 坑点 8 个 ⭐

以下 8 个坑点全部来自 GlaS 的真实特有失败模式(官方文档、挑战赛论文、社区复现代码与评测分析),按「踩中概率 × 损失大小」排序。

⚠️ 坑点 1:实例掩码被自动归一化悄悄毁掉(分类:预处理陷阱)

问题:GlaS 的掩码是 BMP 索引图(0 = 背景,1-32 = 腺体实例)。走 PIL→Tensor 的常规路径时,transforms.ToTensor() 会把 uint8 除以 255——标签 1 变成 0.0039、标签 32 变成 0.1255,实例信息被无声破坏;若再接 >0.5 二值化,所有腺体直接糊成一张全前景图。
症状:训练正常收敛但实例级 F1 低得离谱;可视化掩码全是一团白;np.unique(mask) 输出大量小数或只剩 0/1。更隐蔽的是中间产物用 PNG 重新保存并归一化后即被破坏。
解决

  1. 简单方法:掩码一律 np.array(Image.open(path)) 保持 uint8 原值,任何 ToTensor/除 255 只作用于图像通道;加载后立即断言 msk.dtype == np.uint8 and msk.max() <= 32
  2. 进阶方法:在 Dataset 里返回语义掩码与实例掩码双输出(见 §6.4),语义掩码 (msk > 0) 供分割损失,实例掩码原值供实例评测与后处理;对中间产物统一用 np.save 而非图像编码。
  3. SOTA 方法:单元测试固化——为每个 split 首图写一条 assert set(np.unique(msk)) <= set(range(33)) 的加载自检,进 CI;转换脚本(BMP→PNG/NumPy)用 np.array_equal 校验往返一致。
    参考:官方数据说明 one ground truth object per label(https://glas.grand-challenge.org/Dataset/);社区 EDA 对掩码 0-32 编码的逐像素统计(https://deepwiki.com/twpkevin06222/Gland-Segmentation/2.3-exploratory-data-analysis)

⚠️ 坑点 2:图像尺寸不一导致 DataLoader 崩溃或静默变形(分类:工程陷阱)

问题:165 张图有 7 种尺寸——151 张为 522×775,另 14 张在 430×567 到 453×589 之间。默认 DataLoader 的 collate 要求 batch 内同形,一旦 batch 抽中任意一张非主流尺寸图,stack 直接报错;而用 resize 到统一尺寸的偷懒做法会改变有效 μm/px,让大图小图腺体尺度不一致。
症状:训练若干个 epoch 后突然 RuntimeError: stack expects each tensor to be equal size;或 resize 方案下验证集指标随机波动、小尺寸图(567×430 一类)上预测系统性偏差。
解决

  1. 简单方法:全库 resize 到 256×256(社区最主流口径,U-Net/Transformer 论文普遍如此),训练验证一致即可与文献对齐;腺体级任务对轻度各向形变不敏感。
  2. 进阶方法:pad 到 528×784 覆盖最大尺寸(见 §6.3 代码),保持原始 μm/px,loss 时以原图有效区(非 padding)加权,推理时按原图裁回。
  3. SOTA 方法:尺寸分桶(bucketing)+ 按桶组 batch,或直接用支持可变形状的框架(nnU-Net 的 patch 采样);物理分辨率敏感的跨库研究统一按 0.620 μm/px 重采样后再对齐。
    参考:全库尺寸分布统计(https://deepwiki.com/twpkevin06222/Gland-Segmentation/2.3-exploratory-data-analysis);256×256 统一口径的近年用法(KM-UNet,PeerJ CS 2025,https://peerj.com/articles/cs-3727/)

⚠️ 坑点 3:拿语义分割输出去算官方实例指标(分类:评估误用)

问题:官方三指标(对象级 F1、对象级 Dice、对象级 Hausdorff)都以「实例」为单位,而语义分割网络输出的是前景概率图——没有实例分离环节,对象级指标根本无法计算;强行把连通域当实例,会把粘连成一团的多个腺体算成一个对象,实例数对不上,成绩失真。
症状:自己复现的 Dice 与论文差异巨大;连通域计数远小于掩码真值实例数(如一张 12 个腺体的图只检出 3 个连通域);对象级 Hausdorff 高达数百像素。
解决

  1. 简单方法:对预测概率图做形态学开运算 + 分水岭(以距离变换峰值为种子)分离粘连实例,再算对象级指标。
  2. 进阶方法:复刻冠军方案的双分支思路——语义分支 + 轮廓分支(把掩码腐蚀-膨胀差构造轮廓真值),推理时「先二值化前景、再用轮廓线切断、后连通域标号」;轮廓真值可由 dilate(mask,k) - erode(mask,k) 自动构造。
  3. SOTA 方法:实例感知头(HoVer-Net 式水平/垂直距离回归)或 SAM 提示微调(以腺体质点为提示),从表示层解决实例分离,GlaS 上实例 F1 已达 0.93 量级。
    参考:DCAN 轮廓感知网络(Chen et al., MedIA 2017,https://www.cse.cuhk.edu.hk/~qdou/papers/2017/);官方评测指标定义(Sirinukunwattana et al., MedIA 2017)

⚠️ 坑点 4:官方划分的同患者重叠被当成患者级泛化(分类:数据泄漏)

问题:GlaS 的 165 张图来自 16 位患者,官方把同一批切片的不同视野分进训练与测试(train 与 testA/testB 共享患者)。在官方口径上的成绩衡量的是「同患者新视野」泛化,隐含同患者乐观偏倚;若在论文中表述为「对 unseen patients 的泛化」即构成事实性错误。
症状:同一模型在 GlaS 官方口径上 Dice 0.9+,换到 CRAG 或新中心数据上骤降 10-20 个百分点;审稿人质疑泛化声明时无法自圆。
解决

  1. 简单方法:论文措辞严格区分——官方口径写 same-patient cross-field evaluation,不做患者级声明。
  2. 进阶方法:补做患者级 GroupKFold(按 16 张切片分组;每人一张切片即按切片分组)报告第二口径,两个数字并排呈现。
  3. SOTA 方法:联合 CRAG 做跨库验证(train GlaS → test CRAG,反向亦然),以「跨数据集」作为泛化的第三重证据,这也是近年高分论文的标准配置。
    参考:挑战赛论文对 16 切片/不同视野的描述(Sirinukunwattana et al., MedIA 2017);患者分组分析(https://deepwiki.com/twpkevin06222/Gland-Segmentation/2.1-dataset-structure)

⚠️ 坑点 5:把 Test A 当验证集反复调参(分类:评估误用)

问题:GlaS 训练集只有 85 张且官方不给 val 划分,很多实现图省事直接在 testA(60 张)上调超参、选 checkpoint——testA 实质变成训练集的一部分,再报 testA 成绩即为测试集污染;testB 仅 20 张,同样经不起反复评测带来的选择偏差。
症状:testA 成绩漂亮、testB 同期成绩明显偏低且换种子波动大(20 张图的置信区间本就很宽);跨论文比较时同模型成绩对不上。
解决

  1. 简单方法:从 85 张训练图内随机留 5-20 张做 val(80/5 或 80/20 均为主流口径),testA/testB 只在最终报告时各跑一次。
  2. 进阶方法:5 折交叉验证选超参(85 张内),每折的 val 成绩取均值报方差;固定随机种子并记录每折文件清单,保证可复现。
  3. SOTA 方法:嵌套协议——内层 CV 选模型、外层 testA/testB 仅终评一次;论文中公开划分清单与评测脚本链接,呼应挑战赛的评测透明度要求。
    参考:社区惯例口径(KM-UNet 等,https://peerj.com/articles/cs-3727/);挑战赛评测协议与两测试集用途(https://research.adfoucart.be/pub-html/FOUCART23-CMIG.html)

⚠️ 坑点 6:用 Test A 成绩外推 Test B(malignancy gap)(分类:偏倚陷阱)

问题:两个测试集组织构成刻意不同——Test A 良性 33/27 恶性、Test B 恶性占 80% 且腺体形态更不规则。冠军方案在 Test A 的对象级 F1 为 0.912,Test B 骤降至 0.717;把 Test A 成绩当「模型水平」宣传,会系统性高估在恶性病例上的表现。
症状:Test B 的 Dice/F1/Hausdorff 全面劣化(尤其是 Hausdorff,冠军方案 Test B 高达 160.4 像素 vs Test A 的 45.4);临床演示时低分化病例上分割失败。
解决

  1. 简单方法:Test A 与 Test B 分别报告,永远不合并平均;在结果表中标注两集的良恶构成。
  2. 进阶方法:按 grade_binary 分层报告(benign 子集 / malignant 子集各一列),量化 malignancy gap 的幅度;训练时对 malignant 样本过采样或加权损失。
  3. SOTA 方法:把「恶性形态鲁棒性」作为一等公民设计目标——轮廓分支强化、形态学硬样本挖掘、弹性形变增广(U-Net 原论文证明对组织形变有效);或在 CRAG 等恶性占比更高的数据上联合训练。
    参考:两测试集构成与成绩分解(https://research.adfoucart.be/pub-html/FOUCART23-CMIG.html);malignancy gap 现象(挑战赛综述,https://arxiv.org/abs/1603.00275)

⚠️ 坑点 7:跨库联合训练时忽略 0.620 μm/px 的非标分辨率(分类:预处理陷阱)

问题:GlaS 是 20×(0.62005 μm/px),而 MoNuSeg、CRAG 等常用病理数据多为 40×(0.25-0.252 μm/px)。直接把各自图像 resize 到同一像素尺寸,等于让两库的「一个像素」代表不同物理面积——同一卷积核在不同库上看到的腺体直径差一倍以上,联合训练性能互相拖累。
症状:联合训练后单库性能都低于单独训练;在 GlaS 上预测的腺体明显小于真值(或反向);染色风格相近但尺度不匹配的混淆尤其迷惑。
解决

  1. 简单方法:各库独立训练与评测,跨库只做 zero-shot 迁移实验,并在论文中明确各库 μm/px。
  2. 进阶方法:统一重采样到共同物理分辨率(如 0.5 μm/px)——GlaS 从 0.620 到 0.5 需上采样 1.24 倍线性尺寸;重采样后再统一裁 patch。
  3. SOTA 方法:多尺度训练(训练期随机缩放 0.75-1.5 倍)让网络对尺度漂移鲁棒;或采用尺度感知架构(如 SA2-Net 的尺度感知注意力,BMVC 2023 即在 GlaS+MoNuSeg 双库验证)。
    参考:扫描与重采样参数(0.465→0.620 μm/px,https://arxiv.org/html/1909.03354v3);尺度感知方法(https://github.com/mustansarfiaz/SA2-Net)

⚠️ 坑点 8:五级分级与二分类标签的映射想当然(分类:标签理解)

问题:GlaS 同时存在两套图像级标签:二分类 benign/malignant 与五级分级 healthy / adenomatous / moderately / moderately-to-poorly / poorly differentiated。社区整理的 Grade 文件未内附两套标签的官方映射文档,想当然地认为「五级前两类 = benign、后三类 = malignant」大体成立但边界样本(腺瘤性 vs 癌变)恰恰是分级研究最有价值的部分;直接用错映射会让分类实验的标签系统性错位。
症状:分类模型训练集与测试集的类分布对不上官方 37/48、33/27、4/16 的口径;复现他人分类基线时成绩差几个点。
解决

  1. 简单方法:使用社区已整理的双标签并表(Grade.csv 含 binary 与 5-level 两列),加载时先断言每图的 binary 标签与官方子集统计一致(train 37/48、testA 33/27、testB 4/16)。
  2. 进阶方法:以掩码实例数、腺体像素占比等无监督统计做标签合理性交叉检查(良性图腺体成形、实例边界清晰);对分类边界样本做人工抽检并留存清单。
  3. SOTA 方法:把五级标签当有序回归目标而非互斥多分类(有序性来自分化程度),损失用 CORAL/soft ordinal 编码,并在论文中报告混淆矩阵以暴露 adenomatous vs moderately 的边界误差。
    参考:双标签体系与患者表(https://deepwiki.com/twpkevin06222/Gland-Segmentation/2.1-dataset-structure);五级分类法出处(Sirinukunwattana et al., IEEE TMI 2015)

§6.6 数据增强

增广 安全性 说明
随机 90° 旋转 / 翻转 病理视场无固定方向;必须与掩码同步变换
小角度旋转(±15°)与缩放(0.75-1.5×) 模拟切片摆放与尺度漂移;注意掩码最近邻插值
弹性形变(elastic) U-Net 原论文证明对组织形变特别有效,恶性腺体形态增益明显
染色增广(H&E 通道幅值扰动 / Macenko 归一化) 直击切片批次染色差异;幅度需保守,避免破坏核浆对比
随机裁 patch(256-512 px) 小图全库可行;patch 与掩码同步裁
大角度透视/剪切 制造非生理性形变,腺体结构先验被破坏
灰度反转 / 通道置换 H&E 双染语义固定,反色后核浆关系颠倒
掩码单独旋转/翻转(不同步) 几何不一致是自毁式 bug;封装成同一变换函数杜绝
对掩码做高斯模糊/插值取整 实例标签是整数 ID,任何平滑都会造出非法标签值

§6.7 模型推荐

模型 类型 GlaS 参考表现 适用场景
U-Net + 分水岭后处理 语义分割 + 后处理 挑战赛 Freiburg 方案,objDice 0.786(testB) 快速基线;两小时可跑通
DCAN(轮廓感知网络) 双分支 FCN 挑战赛冠军,F1 0.912/0.717(A/B) 实例分离研究起点
nnU-Net 自配置分割框架 迁移即用 工程交付、免调参基线
TransUNet / DS-TransUNet Transformer 混合 DS-TransUNet mDC 0.942(test 口径) 追榜、消融研究
MedT / seUNet-Trans 轻量医学 Transformer seUNet-Trans-M mDC 0.899 资源受限环境
SAM(ViT-B/L/H)+ 提示微调 基础模型微调 Prompted SAM-H F1 0.929/0.841(A/B) 基础模型时代方法验证
HoVer-Net 类实例头 距离回归实例分割 同类任务 SOTA 架构迁移 严肃实例分割交付

§6.8 硬件需求

配置 能做什么
8 GB 显存(RTX 3060 级) 256×256 口径全量训练(batch 8-16);90% 的 GlaS 实验够用
16 GB 显存 528×784 原分辨率 pad 口径、Transformer 全家桶、SAM 微调
CPU only 数据检查、EDA、推理单图可行;训练不推荐
存储 约 181 MB 原始数据 + 预处理缓存小于 2 GB

评测的「对象级」到底指什么:医学分割评测通常混用两种口径——像素级(语义)与对象级。像素级 Dice 直接比较逐像素预测与真值,指标喜人但对「是否把一个腺体完整分出」无能为力(例如把两个粘连腺体合并预测成一个也能拿高像素 Dice)。GlaS 之所以把对象级作为官方口径,是因为它的下游用途是腺体计数与形态学统计,必须知道「分成几个、各多大」。对象级评测的核心是「匹配」:把每个预测对象与每个真值对象按重叠(IoU)配对,再在配对对象之间计算 F1(检测)、Dice(体积吻合)、Hausdorff(边界吻合)。三条指标各自捕捉一个失败模式——F1 抓漏检/误检,Dice 抓分割不准,Hausdorff 抓轮廓锯齿——因此官方要求同时报告三者,任何单指标都不足以刻画实例分割质量。理解这一逻辑后,就不会再犯坑点 3 的「拿语义输出算对象指标」。

§6.9 评估指标代码

官方三指标的简化可运行实现(对象级 F1 / 对象级 Dice / 对象级 Hausdorff,挑战赛加权定义见 Sirinukunwattana et al. 2017):

import numpy as np
from scipy.spatial.distance import directed_hausdorff

def object_metrics(pred_inst, gt_inst, iou_thr=0.5):
    """pred_inst/gt_inst: 实例标签图(0=背景)。返回对象级 F1、Dice、Hausdorff(简化口径)"""
    p_ids = np.unique(pred_inst)[1:]; g_ids = np.unique(gt_inst)[1:]
    inter = {}; n_g = {g: (gt_inst == g).sum() for g in g_ids}
    for p in p_ids:
        pm = pred_inst == p
        for g in g_ids:
            v = np.logical_and(pm, gt_inst == g).sum()
            if v:
                inter[(p, g)] = v
    matched = {}
    for (p, g), v in inter.items():
        union = (pred_inst == p).sum() + n_g[g] - v
        if union > 0 and v / union >= iou_thr:
            matched[(p, g)] = v
    tp = len(matched)
    f1 = 2 * tp / (len(p_ids) + len(g_ids) + 1e-9)
    dices = [2 * v / ((pred_inst == p).sum() + n_g[g]) for (p, g), v in matched.items()]
    hd = []
    for (p, g) in matched:
        a = np.argwhere(pred_inst == p); b = np.argwhere(gt_inst == g)
        hd.append(max(directed_hausdorff(a, b)[0], directed_hausdorff(b, a)[0]))
    return f1, float(np.mean(dices)) if dices else 0.0, float(np.mean(hd)) if hd else np.inf

# 评测流程:概率图 → 阈值化 → 分水岭/轮廓分离实例(坑点 3)→ 逐图调用本函数 → 按挑战赛口径汇总

提醒:本实现为工程可用的简化版(IoU 匹配阈值 0.5);发表对比挑战赛数字时,请改用官方加权对象级定义(Dice 与 Hausdorff 均按对象面积加权、F1 含双侧漏检惩罚),并固定预处理口径。

§6.10 MLOps 笔记

  • 数据版本固化:GlaS 内容十年未变,但渠道镜像多(官网/Kaggle/ModelScope);在数据卡片中记录来源 URL、下载日期与文件数自检结果(165 对),DVC 或 MLflow 登记数据指纹。
  • 评测口径显式化:把「官方三划分 + 对象级三指标 + IoU 匹配阈值 0.5」写进配置文件与 README,防止团队内出现第二口径。
  • 复现三要素:固定 torch/numpy 种子、固定 train-val 文件清单(80/5)、固定增广开关——GlaS 只有 85 张训练图,方差不小,论文实验至少 3 次重复取均值。
  • 模型卡要点:单中心、20×、T3/T4、无患者级元数据——把 §7.1 的四条偏倚搬进模型卡,明确禁止商业与临床直接部署的表述。

踩坑排障顺序(按概率排列):如果训练 Loss 正常但实例级指标异常,先检查坑点 1(掩码归一化)——这是最高频的静默破坏;如果 DataLoader 中途崩,检查坑点 2(尺寸不一);如果论文成绩与他人对不上,先核对评测口径(坑点 3、坑点 5)再怀疑模型本身;如果零样本迁移到 CRAG 暴跌,属预期(坑点 4、坑点 7)而非 bug。把这几条写成 checklist 放进 repo 的 CONTRIBUTING,能帮后续协作者省下大量排错时间。对已经训好的模型,若需要做可复现基线,建议把预测掩码与配置文件一并纳入版本管理——数据十年不变,但你的随机种子、增广开关与框架版本会漂移,这些才是未来追不回的因素。

§6.11 训练配方与经验

综合挑战赛论文、后续方法学与社区实践的通用训练配方(以 256×256、U-Net/FCN 尺度为例):

建议值/做法 依据
输入尺寸 256×256 resize,或 528×784 pad(原尺度) §6.3 两种口径,前者对齐主流文献
骨干 ImageNet 预训练迁移;小规模下预训练收益显著 通用医学分割经验
损失 Dice + BCE 联合(腺体前景占比约 50%,BCE 即可;实例分离靠后处理) 前景平衡,不需强加权
批大小 8-16(256×256) 8 GB 显存可跑
优化器 Adam,lr 1e-4,cosine/step 衰减 社区论文主流
轮数 100-300,早停于 val 小数据易过拟合,务必 monitor val
增广 随机旋转/翻转 + 弹性形变 + 可选染色增广 §6.6;弹性形变对恶性形态增益大
实例分离 语义输出 → 阈值化 → 分水岭(距离峰值种子)→ 连通域 坑点 3
评测 testA + testB 分开,对象级三指标 §6.9 / 官方协议
重复 3 次以上取均值,报告 std §6.10,小数据方差大

Patch 采样经验:GlaS 每图约 40 万像素,batch 由整图构成时 GPU 利用率足够;若做 512 以上大图,可每图随机裁 256-512 patch 增多样本量。裁剪必须保留完整腺体或被裁腺体的掩码片段——分水岭依赖完整前景,训练期直接对半图训练、推理期整图,容易产生边界截断效应(边缘腺体分不全),如需 patch 推理应采用重叠滑窗 + 拼缝融合。

关于分类子任务的小结:若把 GlaS 当良恶/分级分类用(而非分割),85 张训练图偏少,建议直接用预训练分类器微调并对五级用有序损失(见坑点 8);同时可利用已有的逐像素腺体掩码做「只裁腺体区域再分类」的消融,检验「腺体形态确实是分类的依据」这一假设——这往往是论文里最出彩的一张小表。


§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心/单设备 全部 165 张图来自 UHCW 一家机构、一台 Zeiss MIRAX MIDI 扫描仪 跨库验证(CRAG 等);训练期染色/尺度增广
同患者划分偏倚 训练与测试共享 16 位患者的不同视野,官方成绩带同患者乐观偏倚 患者级 GroupKFold 补充口径(坑点 4)
分期偏倚 全部为 T3/T4 期腺癌,无早期病例,任务难度分布偏恶性 明确适用范围声明;不用于早期病变任务
测试集构成失衡 Test B 恶性占 80%、仅 20 张,统计功效低且与训练分布不同 两测试集分开报告、分层分析(坑点 6)
染色批次差异 16 张切片在不同时间处理,染色深浅系统差异(官方明示的受试者间变异) Macenko 染色归一化;染色增广
标注单一来源 单病理学家标注,无观察者间一致性数据 敏感性抽检;引用时声明该局限

把偏倚表落实成使用时的动作清单

  • 训练/测试划分时记住「单中心 + 16 切片 + 同患者视野」,别把官方成绩当跨中心成绩引用(坑点 4)。
  • 报告中至少按 benign/malignant 分层给指标,避免 Test B 的恶性样本表现被平均掩盖(坑点 6)。
  • 预处理一律加染色归一化或染色增广,缓解 16 切片批次差异(坑点 7 同源逻辑)。
  • limitations 段落主动声明「单标注者、无观察者间一致性」与「全库 T3/T4、无早期病例」两条,审稿人见到主动披露比被动答辩好得多。
  • 对外部人群做任何临床前评估前,先在外部队列补测——这正是 §7.8 与 §5.5 外部验证的价值所在。

§7.2 标注质量

标注由 UHCW 的一位专家病理学家逐像素完成,覆盖全部 165 张图、1,530 个实例,无缺失、无占位标签,掩码编码规整(0-32 整数),整体质量在同类挑战赛数据中属上乘。两处需注意:其一,无第二标注者数据,观察者间一致性不可估计——尤其低分化腺体的边界本身在病理学上就存在解释空间;其二,掩码不保留腺体间的边界带,相邻实例像素直接相接,实例分离真值依赖「共享边界处像素归属其一」的约定,评估实现必须与该约定一致(见坑点 3)。

§7.3 泛化性

场景 失效风险 证据
恶性(低分化)腺体 高——腺体变形、腔面消失,轮廓先验失效 冠军方案 Test B F1 0.717 vs Test A 0.912(malignancy gap)
跨扫描仪/跨中心 高——单设备单中心训练 全库单扫描仪;社区跨库报告普遍显著掉点
早期病变(Tis/T1) 未知——训练分布外 全库 T3/T4,无早期样本
其他器官腺体(胃、前列腺) 高——形态学差异大 结直肠专用;跨器官需重训练
小腺体/腺体出芽 中——0.620 μm/px 下细节有限 20× 分辨率,核级细节相对弱
同中心新切片 低-中——染色批次差异仍在 16 切片分批处理的官方说明

把上面的风险翻译成「该测什么」

  • 如果你关心恶性鲁棒性(分级相关),务必单独看 Test B / 恶性子集成绩,别被 Test A 平均分麻痹(坑点 6)。
  • 如果你关心真实世界换中心后的表现,单靠 GlaS 无法回答,至少补一次 CRAG 迁移(§5.5)。
  • 如果你要发布给上游做分级/预后,需说明它没覆盖早期病变(全库 T3/T4),且不能在未补外部队列时宣称普适。
  • 如果你只是做方法对比,明确「在 GlaS 基准上比方法」的边界即可,不必把所有泛化包袱都背上。

§7.4 伦理

数据为脱敏病理切片:官方分发的视场图与掩码均不含患者身份信息,无患者级元数据(年龄、性别、日期),患者-文件映射未公开。数据由 UHCW 病理团队按研究用途提供,发布方明示仅供研究、禁止商业使用;将基于该数据的模型用于临床前,需独立的伦理审批与临床验证(见 §0 免责声明)。

§7.5 公平性

官方未公开患者人口学信息(年龄、性别、种族),无法进行亚组公平性审计;数据来自英国单一机构,人群构成代表性有限。若下游模型面向多族群部署,必须在外部队列上补做分层评估——在本数据集内部无法完成。

§7.6 数据漂移

GlaS 是静态快照数据集(2015 年发布后内容未变),不存在持续采集型漂移;风险在于跨库与跨批次漂移:染色批次差异(16 切片分批处理)是数据内生的协变量,跨库使用时叠加扫描仪与制片差异。工程上建议上线前用染色归一化 + 特征分布监控(前景占比、腺体计数分布)捕捉漂移。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 每图一行可构造(image_id + 标签 + 路径),§4.1 已给出
2 唯一标识 train_N / testA_N / testB_N 文件名全局唯一
3 特殊字符 文件名纯 ASCII 安全字符,无空格无 Unicode 陷阱
4 重复行 无重复图像;同名成对(图像/掩码)为设计约定
5 缺失编码 全 165 张均有配对掩码与标签,无缺失
6 标签标识 二分类 + 五级分级双体系齐备
7 罕见类分组 ⚠️ Test B 良性仅 4 张;训练集无此问题,评测口径需注意
8 偏倚评估 ⚠️ 官方描述了受试者间变异但无正式偏倚声明;本 Wiki §7.1 补齐
9 数据字典 字段少而清晰;§4.1 字段字典可直接采用
10 信息性缺失解释 无缺失数据,不存在信息性缺失编码需求
11 设备记录 扫描仪型号、原生/发布分辨率官方明确
12 共线性 表格化字段间无共线性风险(图像元数据独立)
13 编码映射 ⚠️ 五级 ↔ 二分类映射官方无文档,需按 §6.5 坑点 8 自行核对
14 时间戳处理 ⚠️ 无时间字段;采集年份官方未公开,静态快照可接受
15 划分建议 官方 85/60/20 固定口径清晰
16 泄漏讨论 ⚠️ 官方未讨论同患者视野重叠;本 Wiki 坑点 4/§5.3 补齐
17 标签分布 良恶比、实例数、面积占比官方与社区均有公布
18 测量偏倚 ⚠️ 单标注者、无观察者间一致性数据
19 外部验证建议 ⚠️ 官方未给出;社区事实标准为 CRAG(本 Wiki §5.5)
20 版本记录 ⚠️ 单版本无 changelog;渠道镜像多,需自记数据指纹
21 预处理脚本 官方不随包提供;可用本 Wiki §6.3-§6.4 代码补齐
22 合规要求 使用条款明确(研究用途、禁商用、引用要求)
23 多模态对齐 单模态数据集;图像-掩码同名成对即天然对齐
24 去标识化 切片脱敏、无患者级元数据、映射未公开

DAIMS 评分:19 / 24(15 项 ✅ + 8 项 ⚠️ 各计 0.5 + 1 项 ❌)

评分解读:GlaS 属于「内容干净、包装朴素」的挑战赛遗产数据——数据本体质量高(全标注、编码规整、设备与划分清晰),扣分集中在元数据服务缺位:无官方预处理/评测脚本、无编码映射文档、无偏倚与泄漏的正式讨论。这些缺口全部是社区可补齐的工程问题,而非数据质量硬伤;唯一无法在本数据集内部解决的是观察者间一致性(18)与人群代表性(§7.5)。

对你意味着什么:如果你只要一个可靠的腺体分割基准,GlaS 可以直接用——按 §6 的代码处理两个预处理陷阱(实例标签、尺寸不一)后,数据侧不存在其他拦路虎。如果你要发表,务必补三件事:患者级补充口径(否则泛化声明站不住)、Test A/B 分开报告(否则被审稿人抓住 malignancy gap)、外部分割 CRAG 验证(否则单中心结论偏弱)。如果你要把模型推向临床评估,这个数据集只能作为方法验证起点,不能作为泛化或合规证据——单中心、T3/T4、无人口学信息三条红线摆在那里。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
CRAG(结直肠腺癌腺体) 多中心(中国临床中心,多扫描仪) 腺体分割迁移 多篇方法报告 Dice 0.85-0.91 较 GlaS 官方口径下降数个点 染色与尺度校准后可跨库;已成为 GlaS 事实上的外部集
GlaS→CRAG→Nanfang(VENet) 南方医科大学南方医院(69 张 WSI) 腺体分割 + 胃癌分级 GlaS Test A objDice 0.9562 / Test B 0.9495;Nanfang 分类 κ 0.78 跨库保持高分但 WSI 级任务另需设计 变分能量模型在跨库、跨器官均稳健
SAM 微调(ViT-B/L/H) 基础模型范式 提示化腺体分割 F1 Test A 0.932 / Test B 0.841(SAM-H) 较 CNN 基线全面提升 组织病理是 SAM 微调收益明确的域

引用提示:上表只收录有同行评审支撑的结果;跨库数字受预处理口径影响(resize vs μm/px 重采样),不可直接横向比较。


§8 基准性能与生态

§8.1 排行榜:MICCAI 2015 挑战赛官方成绩

挑战赛以 2 个测试集 × 3 指标共 6 个排名之和(rank sum,越小越好)决胜。下表为官方成绩(数值摘自 MedIA 2017 论文与独立复录表):

排名 模型(团队) F1 Test A / B objDice Test A / B objHausdorff Test A / B 排名和 年份 关键技术 完整引用 代码
1 CUMedVision2(DCAN) 0.912 / 0.717 0.897 / 0.782 45.4 / 160.4 11 2015 轮廓感知双分支 FCN Chen et al., 2017, Medical Image Analysis 36:135-146. DOI 10.1016/j.media.2017.05.002 无官方开源
2 ExB1 0.892 / 0.704 0.883 / 0.786 57.4 / 145.6 10 2015 多路径 CNN + 后处理 Sirinukunwattana et al., 2017, Medical Image Analysis 35:489-502. DOI 10.1016/j.media.2016.08.008
3 Freiburg2(U-Net 变体) 0.871 / 0.696 0.877 / 0.787 57.1 / 148.5 12 2015 U-Net + 形态学孔洞填充 Ronneberger et al., 2015, MICCAI. DOI 10.1007/978-3-319-24574-4_28 官方 U-Net 开源
4 ExB3 0.896 / 0.720 0.887 / 0.766 57.4 / 159.9 12 2015 双路径网络 Sirinukunwattana et al., 2017, Medical Image Analysis 35:489-502. DOI 10.1016/j.media.2016.08.008
5 Freiburg1(U-Net) 0.834 / 0.605 0.876 / 0.784 57.2 / 146.6 14 2015 U-Net + 连通域标号 Ronneberger et al., 2015, MICCAI. DOI 10.1007/978-3-319-24574-4_28 官方 U-Net 开源
6 CUMedVision1 0.869 / 0.769 0.867 / 0.800 74.6 / 153.7 17 2015 多级特征 FCN Chen et al., 2017, Medical Image Analysis 36:135-146. DOI 10.1016/j.media.2017.05.002 无官方开源
7 LIB 0.777 / 0.306 0.781 / 0.617 112.7 / 190.5 27 2015 候选腺体 + 特征分类 Sirinukunwattana et al., 2017, Medical Image Analysis 35:489-502. DOI 10.1016/j.media.2016.08.008
8 CVML 0.652 / 0.541 0.644 / 0.654 155.4 / 176.2 30 2015 传统方法 Sirinukunwattana et al., 2017, Medical Image Analysis 35:489-502. DOI 10.1016/j.media.2016.08.008

⚠️ 数值不可直接比较的原因:Test A 与 Test B 组织构成不同(良性 33/27 vs 4/16),两列成绩衡量不同难度;挑战赛排名是 rank sum 产物而非单一指标排序;后续论文若自行合并两测试集或改用像素级指标(mDC/mIoU),与上表完全不可比。

从结果看方法学:前三名教会了我们什么

  • CUMedVision2(冠军,轮廓感知):其核心不是「分割更准」,而是显式学习腺体间的轮廓——网络同时输出语义图与轮廓图,推理时用轮廓把粘连的前景切开。这直接回应了 GlaS 的最大难点「粘连实例分离」,也让它在对边界敏感的 Hausdorff 指标上明显领先。启示:给模型「粘连点在哪」的监督信号,比纯调分割结构更有效。
  • ExB(亚军,多路径 CNN):用多条不同感受野的路径捕捉多尺度腺体上下文,本质是让网络「看得远一点」来理解单个腺体属于成形结构还是崩塌结构。启示:腺体的性质依赖周边形态(孤立成形 vs 密集浸润),尺度信息对分级相关分割很重要。
  • Freiburg(季军,U-Net):以标准 U-Net + 形态学后处理(孔洞填充)参赛即入前三,验证了编码器-解码器 + 跳连对医学分割的强大普适性;它随后成为全领域基线。启示:先跑通 U-Net 基线,再针对实例分离做增量,是最稳妥的起步策略。

这三点(轮廓监督、多尺度、后处理分离)构成后续十年腺体分割方法的主要骨架,也解释了为何本 Wiki 反复强调「别只盯着像素 Dice,实例分离才是 GlaS 的真考点」。

§8.2 SOTA 总结与选型建议

挑战赛之后十年,GlaS 上的公开成绩演进为:语义口径(mDC)从 U-Net 的 0.796 提升到 DS-TransUNet-L 的 0.942;对象级口径 Test A objDice 从 0.897(冠军)推进到 VENet 的 0.9562;实例 F1 Test A 上 SAM-H 提示微调达到 0.932。选型建议:快速基线选 U-Net/nnU-Net(加分水岭);发表追赶选轮廓感知或 Transformer 混合架构(DCAN/TransUNet 系);基础模型方向选 SAM/MedSAM 微调并报告 Test A/B 双口径。提醒:超过 0.93 的对象级成绩进入边际改进区,5 折方差可能大于模型差异,务必报告重复实验均值与方差。

后挑战赛代表性公开成绩(口径各异,仅供趋势参考)

方法 报告口径 数字 说明
U-Net(2015 基线) testB 对象级 objDice 0.786 挑战赛 Freiburg 方案,深绿基线
DCAN(2015 冠军) Test A/B 对象级 F1 0.912 / objDice A 0.897 轮廓感知双分支,官方口径标杆
DS-TransUNet(2022) 合并 test 语义口径 mDC 0.942 / mIoU 0.894 Transformer 混合架构追榜代表
seUNet-Trans-M(2023) 合并 test 语义口径 mDC 0.899 / mIoU 0.823 轻量医学 Transformer 的性价比平衡点
MILD-Net+(2019) Test A 对象级 F1 0.92 弱监督腺体分割代表
Prompted SAM-H(2025) Test A/B 对象级 F1 0.929 / 0.841 基础模型微调,Test B 提升显著
VENet(2025) Test A/B 对象级 objDice A 0.9562 / B 0.9495 变分能量模型,目前对象级最强

注意上表口径不统一(语义 vs 对象级、是否合并 testA/B),严禁直接横向比较;它展示的是「GlaS 上可验证的趋势」,具体到论文对比请锁定同一口径。两条观察值得记取:其一,Test A 语义级与对象级均已逼近 0.95 上下,余量在 Test B 的恶性形态与边界精度(Hausdorff)上;其二,自 2019 年起新增增益更多来自架构/范式升级(Transformer、SAM)而非纯训练技巧,说明 GlaS 的挑战重心已从「能不能分」转向「分得够不够稳」。

§8.3 评测协议

官方协议要点:训练仅可用 train 85 张;testA 赛期远程提交、testB 现场提交;三指标对象级定义(F1 含漏检惩罚、Dice 与 Hausdorff 按对象面积加权);六排名求和决胜。赛后复核:组织者另按良恶分层并引入 Adjusted Rand Index 交叉验证排名稳健性,结论为前三名稳定、个别名次对微小分差敏感。社区复现时最常用的简化协议是「testA 或 testB 单集 + mDC/mIoU」,引用他人数字前务必核对口径(见 §8.1 警告)。

数据集 关系 说明
CRAG 外部验证标配 同为结直肠腺体分割,规模互补(213 张/38 患者),跨库论文的事实标准外部集
MoNuSeg 任务升级 细胞核实例分割;GlaS→MoNuSeg 是「腺体→核」粒度迁移常用组合
DigestPath 2019 同器官延伸 结直肠病灶分割与恶性检测,无逐实例腺体标注
NCT-CRC-HE-100K 规模互补 10 万级图块分类;与 GlaS 形成「分类大库 + 分割精库」组合
PAIP 跨器官对照 胃/肝 WSI 肿瘤区分割,WSI 级工作流参照

组合使用建议:最常见的「GlaS+CRAG」组合用于覆盖单中心到多中心的泛化跨度;要补足腺体出芽、核级分析则叠 MoNuSeg/CoNSeP;若想在 WSI 全切片尺度验证(GlaS 只有视场图、无 WSI),PAIP 与 DigestPath 可补足端到端工作流;要做大规模图像级预训练再下探到分割,则用 NCT-CRC-HE-100K。一个稳妥的落地配方是:GlaS 做方法验证 → CRAG 做外部验证 → 任一 WSI 级库做端到端演示,三段互为补充、各取所长。

§8.5 关键论文 Top 8

  1. Sirinukunwattana K, Pluim JPW, Chen H, et al. Gland segmentation in colon histology images: The GlaS challenge contest. Medical Image Analysis, 35:489-502, 2017. DOI 10.1016/j.media.2016.08.008 — 挑战赛官方综述与数据论文,一切评测口径的出处。
  2. Sirinukunwattana K, Snead DRJ, Rajpoot NM. A stochastic polygons model for glandular structures in colon histology images. IEEE Transactions on Medical Imaging, 34(11):2366-2378, 2015. DOI 10.1109/TMI.2015.2433900 — 首次使用该数据的研究,随机多边形腺体模型,数据集由此随文发布。
  3. Chen H, Qi X, Yu L, Heng PA. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Medical Image Analysis, 36:135-146, 2017. DOI 10.1016/j.media.2017.05.002 — 挑战赛冠军方法,轮廓感知双分支成为实例分离的标准范式。
  4. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. MICCAI 2015. DOI 10.1007/978-3-319-24574-4_28 — 以 Freiburg 队名义首战 GlaS 获季军,随后成为全领域基线。
  5. Xu G, et al. MILD-Net: Multiple instance learning aided deep neural network for gland segmentation. MICCAI 2019 — 弱监督(多示例)腺体分割代表,Test A F1 0.92 量级。
  6. Lin A, et al. DS-TransUNet: Dual swin transformer U-Net. arXiv 2206.01780, 2022 — Transformer 系在 GlaS 语义口径的代表(mDC 0.942)。
  7. Valanarasu JMJ, Patel VM(UNeXt / 医学轻量架构研究线,含 seUNet-Trans,arXiv 2310.09998, 2023)— 轻量 Transformer 在 GlaS 的效率-精度权衡代表。
  8. Hu Z, et al. Gland segmentation using SAM with cancer grade as a prompt. arXiv 2501.14718, 2025 — 基础模型 + 分级提示,SAM 系在 GlaS 的最新代表。

§8.6 社区活跃度

GlaS 是病理分割领域引用最高的基准数据集之一:数据论文 Google Scholar 引用 1,197+(截至 2026-09),近五年保持每年百级新增引用;Kaggle 镜像长期作为教学与快速实验入口,ModelScope 镜像累计下载 9,467 次(截至 2026-09);GitHub 上以 GlaS 为评测集的参考实现(分割网络、评测脚本、预处理仓库)数以百计,新方法持续以之为必测基准。挑战赛官网(Warwick TIA)与 Grand Challenge 页面仍在线维护。

引用量为何不减反增:把 MedIA 2017 论文的年度引用曲线拉直看,峰值并未停留在挑战赛刚结束的 2016-2018,而是随每轮方法范式更新出现后浪——2022 后 Transformer 语义分割、2023-2024 弱监督与基础模型(SAM)论文普遍把 GlaS 纳入评测矩阵,使一个 2015 年的数据持续获得「新方法必测」的曝光。这说明 GlaS 的生命力不来自数据量(它很小),而来自任务定义清晰 + 评测口径稳定 + 与临床分级强相关三点——只要腺体形态仍是结直肠分级的重要依据,GlaS 就仍是验证分割-分级关系的最廉价标的。对读者意味着:引用增长是「仍在被广泛使用」的信号,但也意味着同题论文内卷,新投稿需要靠方法论增量或跨库迁移取胜,而非单在 GlaS 上刷高像素指标。

§8.7 生态快照

资源 类型 链接 Star/热度(截至 2026-09) 推荐理由
Warwick TIA 官网 官方主页 https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/ 挑战赛原始站点 权威数据入口与使用条款
Grand Challenge 页面 官方镜像站 https://glas.grand-challenge.org/ 数据说明与 BibTeX 集中地
Kaggle 镜像 社区数据 https://www.kaggle.com/datasets/sani84/glasmiccai2015-gland-segmentation 教学常用 免审批直下,Notebook 挂载
ModelScope 镜像 社区数据 https://www.modelscope.cn/datasets/OmniData/GlaS/summary 9,467 下载 国内网络友好
Dataset Ninja 页面 可视化工具 https://datasetninja.com/gland-segmentation 在线浏览标注与统计
Awesome-Medical-Dataset(openmedlab) 索引仓库 https://github.com/openmedlab/Awesome-Medical-Dataset 千级 Star 中文社区数据集索引含 GlaS 条目
SA2-Net 参考实现 https://github.com/mustansarfiaz/SA2-Net BMVC 2023 Oral 自带 GlaS/MoNuSeg 预处理与训练脚本

生态成熟度判断:一个数据集的「生态成熟」体现在三点——官方站点长年在线、镜像渠道稳定分发、参考实现随范式更新而持续出现。GlaS 三者兼备:Warwick 官方页与 Grand Challenge 页面自 2015 年起持续可访问;Kaggle/ModelScope/Academic Torrents 提供不同网络环境的稳定入口;更重要的是,每轮范式切换(U-Net→注意力→Transformer→SAM)都有团队把 GlaS 作为第一落点开源参考实现。这使它成为「随时可复现、随时可比」的可靠基准——对想快速上手的团队而言,最省力路径是直接基于现有参考实现改造,而不是从零搭数据管线。


§9 相关资源与引用

§9.1 官方资源

§9.2 BibTeX 引用块

发表使用 GlaS 的成果时,官方要求同时引用以下两篇论文(挑战赛综述 + 数据首次使用论文):

@article{sirinukunwattana2017gland,
  title   = {Gland segmentation in colon histology images: The GlaS challenge contest},
  author  = {Sirinukunwattana, Korsuk and Pluim, Josien P. W. and Chen, Hao and Qi, Xiaojuan and Heng, Pheng-Ann and Guo, Yun Bo and Wang, Li Yang and Matuszewski, Bogdan J. and Bruni, Elia and Sanchez, Urko and B{\"o}hm, Anton and Ronneberger, Olaf and Ben Cheikh, Bassem and Racoceanu, Daniel and Kainz, Philipp and Pfeiffer, Michael and Urschler, Martin and Snead, David R. J. and Rajpoot, Nasir M.},
  journal = {Medical Image Analysis},
  volume  = {35},
  pages   = {489--502},
  year    = {2017},
  doi     = {10.1016/j.media.2016.08.008}
}

@article{sirinukunwattana2015stochastic,
  title   = {A stochastic polygons model for glandular structures in colon histology images},
  author  = {Sirinukunwattana, Korsuk and Snead, David R. J. and Rajpoot, Nasir M.},
  journal = {IEEE Transactions on Medical Imaging},
  volume  = {34},
  number  = {11},
  pages   = {2366--2378},
  year    = {2015},
  doi     = {10.1109/TMI.2015.2433900}
}

@article{chen2017dcan,
  title   = {DCAN: Deep contour-aware networks for object instance segmentation from histology images},
  author  = {Chen, Hao and Qi, Xiaojuan and Yu, Lequan and Heng, Pheng-Ann},
  journal = {Medical Image Analysis},
  volume  = {36},
  pages   = {135--146},
  year    = {2017},
  doi     = {10.1016/j.media.2017.05.002}
}

@inproceedings{ronneberger2015unet,
  title     = {U-Net: Convolutional networks for biomedical image segmentation},
  author    = {Ronneberger, Olaf and Fischer, Philipp and Brox, Thomas},
  booktitle = {Medical Image Computing and Computer-Assisted Intervention (MICCAI 2015)},
  pages     = {234--241},
  year      = {2015},
  doi       = {10.1007/978-3-319-24574-4_28}
}

§9.3 引用指南

  • 数据本体引用:BibTeX 块前两条(官方要求一并引用)。
  • 评测口径引用:MedIA 2017 论文的指标定义章节(对象级 F1/Dice/Hausdorff 加权公式)。
  • 基线成绩引用:注明「挑战赛官方成绩(2015)」与「后续论文(注明其口径:testA/testB、语义/对象级)」,禁止混口径横向排序。
  • 涉及 16 患者/16 切片、重采样分辨率等硬事实,引用 MedIA 2017 原文而非二手转述。

§9.4 常见问题(FAQ)

Q:GlaS 需要申请审批吗?
官方渠道为注册制(官网申请账号后下载),非竞赛期间不设人工审批;Kaggle/ModelScope 镜像下载即可用。使用条款恒定——研究用途、禁止商用、发表引用两篇论文。

Q:为什么报告的 Dice 和我网上看到的差很多?
几乎总是口径问题:语义 Dice vs 对象级 Dice 不同,是否合并 testA/testB 不同,resize 尺寸与是否含 padding 不同。对照官方数字务必用同一口径,详见 §8.3。

Q:85 张训练图够训练一个深度学习模型吗?
作为基准够——U-Net 时代就靠它夺冠;但必须配合强数据增强(旋转/翻转/弹性形变)与预训练骨干迁移,且以 K 折评估均值报方差。规模是设计的边界而非缺陷,用它做方法验证而非大模型预训练。

Q:可以直接用 Test A 当验证集吗?
技术上可行但污染评测口径;正确做法是从 85 张训练图内部留出 val(§5.2、坑点 5)。testA/testB 只在最终阶段各评测一次。

Q:官方没有评测脚本,怎么算对象级指标?
官方脚本未随包分发。可按 MedIA 2017 指标公式自行实现(加权对象级 F1/Dice/Hausdorff),或参考本 Wiki §6.9 简化实现并对照公式校准后使用。

Q:为什么模型在良性图上一测很高、恶性图一测就掉?
良性与恶性腺体形态差异是 GlaS 的核心难度(malignancy gap,坑点 6)。恶性(尤其低分化)腺体变形、粘连、腔面消失,任何在良性区表现良好的模型都可能在此崩溃——请务必分开报告 Test B(或恶性子集)成绩。

Q:我能在商业产品里用它吗?
不能。官方使用条款明示仅供研究用途、禁止商业使用(NCU 类限制);商用请改用带宽松许可的同类数据或自行采集。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 内容起草:CodeBuddy Code(fast-model,检索增强写作),2026-09。
  • 事实核查辅助:WebSearch 检索(官方主页、Grand Challenge、Google Scholar、同行评审论文与社区仓库)。

§10.2 AI 参与范围

AI 负责文献检索、事实汇总、初稿撰写与代码示例编写;章节结构、医学映射(ICD-11/SNOMED CT)、DAIMS 评级、偏倚分析与最终发布均经千方病案医学编辑部人工审核(见 §10.4)。数据集本体未经 AI 修改;所有基准数字均转录自标注来源,未由 AI 生成或外推。

§10.3 输入来源列表

  1. Sirinukunwattana K, et al. Gland segmentation in colon histology images: The GlaS challenge contest. Medical Image Analysis, 35:489-502, 2017. DOI 10.1016/j.media.2016.08.008
  2. Sirinukunwattana K, Snead DRJ, Rajpoot NM. A stochastic polygons model for glandular structures in colon histology images. IEEE TMI, 34(11):2366-2378, 2015. DOI 10.1109/TMI.2015.2433900
  3. Chen H, Qi X, Yu L, Heng PA. DCAN: Deep contour-aware networks… Medical Image Analysis, 36:135-146, 2017. DOI 10.1016/j.media.2017.05.002
  4. Ronneberger O, Fischer P, Brox T. U-Net. MICCAI 2015. DOI 10.1007/978-3-319-24574-4_28
  5. GlaS Challenge 官方数据说明(Warwick TIA). https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/about
  6. GlaS Challenge Dataset(Grand Challenge 托管页). https://glas.grand-challenge.org/Dataset/
  7. GlaS Challenge 官方下载页(使用条款). https://warwick.ac.uk/fac/cross_fac/tia/data/glascontest/download
  8. Foucart A. Thesis 附录 A:GlaS 2015 数据集描述(16 患者、腺体计数 769/761). https://research.adfoucart.be/thesis/a-ds.html
  9. Foucart A, et al. Shortcomings and areas for improvement in digital pathology image segmentation challenges. Computerized Medical Imaging and Graphics, 2023. https://research.adfoucart.be/pub-html/FOUCART23-CMIG.html
  10. Google Scholar 引用记录(1,197 次,截至 2026-09). https://scholar.google.ae/citations?citation_for_view=OFdytjoAAAAJ%3AX0DADzN9RKwC
  11. Awesome-Medical-Dataset:GlaS 条目(openmedlab). https://github.com/openmedlab/Awesome-Medical-Dataset/blob/main/resources/GlaS.md
  12. GlaS@MICCAI 2015 Dataset Ninja 可视化与统计页. https://datasetninja.com/gland-segmentation
  13. Gland-Segmentation 社区仓库 EDA/数据结构(DeepWiki 镜像). https://deepwiki.com/twpkevin06222/Gland-Segmentation/2.1-dataset-structure
  14. KM-UNet(PeerJ Computer Science, 2025):GlaS 256×256 口径与 Kaggle 镜像. https://peerj.com/articles/cs-3727/
  15. seUNet-Trans(arXiv 2310.09998, 2023):GlaS 语义口径对比. https://ar5iv.arxiv.org/html/2310.09998
  16. Gland segmentation using SAM with cancer grade as a prompt(arXiv 2501.14718, 2025). https://arxiv.org/abs/2501.14718
  17. VENet(科研通转载摘要):GlaS/CRAG/Nanfang 跨库结果. https://www.ablesci.com/scholar/paper?id=3ZzRz9Wd3
  18. ModelScope OmniData/GlaS 数据页(181 MB、下载量). https://www.modelscope.cn/datasets/OmniData/GlaS/summary
  19. SOTA 榜单聚合(Gland Segmentation). https://www.sota2.com/research/task/gland-segmentation
  20. Deep Weakly-Supervised Learning Methods… Survey(arXiv 1909.03354):GlaS 扫描与重采样参数. https://arxiv.org/html/1909.03354v3

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与 §1.4 版本时间轴 千方病案医学编辑部 对照官方主页与 MedIA 2017 论文逐条核对 ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED CT 映射) 千方病案医学编辑部 WHO ICD-11 浏览器与 SNOMED CT 概念核对 ✅ 已通过/已验证
§3 数据集规格(165/85/60/20、分辨率、格式) 千方病案医学编辑部 官方 Dataset 页 + 独立复录表交叉核对 ✅ 已通过/已验证
§4 数据结构与 §4.0 目录树 千方病案医学编辑部 Kaggle 镜像文件清单与社区 EDA 核对 ✅ 已通过/已验证
§6.1-§6.4 代码示例 千方病案医学编辑部 数据工程师走查(加载逻辑、掩码编码断言) ✅ 已通过/已验证
§6.5 坑点 1-8 千方病案医学编辑部 逐条溯源至官方文档/论文/社区仓库 ✅ 已通过/已验证
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部 编辑部评级标准复核 ✅ 已通过/已验证
§8 排行榜与基准数字 千方病案医学编辑部 MedIA 2017 表格与独立复录表双向核对 ✅ 已通过/已验证
§9 BibTeX 与引用指南 千方病案医学编辑部 DOI 逐条解析核对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全部章节由 AI 起草(CodeBuddy Code,fast-model);§0 免责声明、§10 声明卡模板为编辑部固定文本;各节数字与结论以 §10.3 输入来源为限,未引入模型先验中无法溯源的数字。

§10.6 最后人工审核

最后人工审核日期:2026-09-05(与 §0.3 审核日期一致)。

页面状态:published(全部内容已完成审核并发布)


§C 结构化数据(JSON-LD)

返回 AI-Ready 数据集