WSSS4LUAD (wsss4luad) — AI-Ready Wikipedia

广东省人民医院主办的肺腺癌 H&E 病理全切片弱监督语义分割挑战赛数据集——87 张 WSI 切出 10,211 个 patch,仅凭图像级三类多标签训练出像素级三组织分割,1 专家+2 资深+8 初级病理医师的 AI 辅助标注流水线,冠军方案 mIoU 0.8413

来源 H&E 染色肺腺癌全切片图像(67 GDPH 扫描 + 20 TCGA 开放切片)切成的 10,211 个 PNG patch:训练 10,091 个(图像级三类多标签)+ 验证 40 个 + 测试 80 个(两者像素级掩膜,合计 >1.3 亿标注像素)+ 官方背景排除掩膜发布时间: 2026-09-26最后更新: 2026-09-26 阅读 18
WSSS4LUAD (wsss4luad) — AI-Ready Wikipedia

信息速览

数据集名称WSSS4LUAD (wsss4luad) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模87 张 WSI(67 张 GDPH 院内扫描 + 20 张 TCGA;每患者仅取 1 张,患者级总数未单列)
接入方式H&E 染色肺腺癌全切片图像(67 GDPH 扫描 + 20 TCGA 开放切片)切成的 10,211 个 PNG patch:训练 10,091 个(图像级三类多标签)+ 验证 40 个 + 测试 80 个(两者像素级掩膜,合计 >1.3 亿标注像素)+ 官方背景排除掩膜
AI 就绪度

INFOBOX — WSSS4LUAD 一屏速览

维度 内容
本质 肺腺癌 H&E 病理 WSI 弱监督组织语义分割挑战赛 + 数据集双重身份,托管于 grand-challenge.org
主办 广东省人民医院(GDPH)+ 广东省医学科学院 + 广东省医学影像 AI 重点实验室;总结论文 44 位作者
任务 仅用图像级三类多标签(tumor/stroma/normal)训练,输出像素级三组织分割(TUM/STR/NOM)
论文 挑战赛总结 arXiv:2204.06455(2022-04);方法论文 arXiv:2110.08048 → MedIA 2022:102487
数据 87 张 WSI = 67 GDPH + 20 TCGA,每患者 1 张;全部切成 PNG patch,共 10,211 个
训练集 63 WSI → 10,091 个 patch,图像级多标签:Tumor 6,579 / Stroma 7,076 / Normal 1,832
验证/测试 40 / 80 个 patch,像素级标注,合计 >1.3 亿标注像素
评估 mIoU,排除肺泡腔白色背景(官方提供 background mask 叠加计算)
标注流水线 约 500 patch 人工种子 → ResNet-38 伪标签 → 置信度分流复核 → WSSS-Tissue 伪掩膜 → Photoshop 精修 → label review board 终审;标注团队 1 专家 + 2 资深 + 8 初级病理医师
参赛规模 532 人注册(中国 299 人);28 队进入测试阶段、>1,000 次提交、14 队 mIoU > 0.7
冠军 Team ChunhuiLin(Lin et al.)mIoU 0.8413(tumor 0.8389 / stroma 0.7931 / normal 0.8919)
冠军方法 Siamese 多任务网络(CAM 伪掩膜 + 分割分支)+ CutMix 造像素真值 + Lovász/CE + OHEM + 多模型集成 + 邻域先验后处理
附属会议 第 5 届 ISICDM 2021(桂林,2021-12-17~20),Top 3 团队受邀现场报告
获取 Google Drive 公开文件夹(4 个 zip);测试集掩码 2022-02-10 起单独公开
许可 未声明正式数据许可(官网/arXiv/MedIA 均无条款)——使用前自行确认边界
库内互链 bcss(258)、tcga(566)、lc25000(178)、NCT-CRC-HE-100K(148)、panda(560)、panda-plus(640)、han-seg(447)

WSSS4LUAD 是一个"用分类的成本买分割的答案"的病理数据集工程:87 张肺腺癌 H&E 全切片(WSI, Whole Slide Image)被切成 10,211 个 patch,其中 10,091 个训练 patch 只携带"这张图里有没有肿瘤上皮/肿瘤相关基质/正常组织"的图像级三类多标签——却在挑战赛机制下把像素级三组织分割推到了 mIoU 0.8413。它的标注流水线让 1 名专家、2 名资深与 8 名初级病理医师在 AI 伪标签的辅助下完成 >1.3 亿像素的像素级验证与测试标注,是"病理医师在环(pathologist-in-the-loop)"工艺的教科书样本。

导语读法三则:

  1. 只想下数据:直奔 §5 获取与许可——Google Drive 公开可下,但数据许可条款未声明(坑 6),商用前务必确认边界。
  2. 关心弱监督方法:直奔 §4 挑战赛结果与基准——冠军方案解剖、CAM+CutMix 方法趋势与后续零样本基准连读。
  3. 关心标注工艺:直奔 §3 标注流水线——两段式 AI 辅助流水线与 11 人团队分工,可与库内 panda-plus 条目的三层流水线对照阅读。

§0 导读:这个数据集解决什么问题

数字病理的一切下游模型都卡在同一道工序上:像素级标注。一张千兆像素级的 H&E 全切片,让病理医师逐像素画出"哪里是肿瘤上皮、哪里是基质、哪里是正常组织",动辄数小时起步;而临床科室积累的切片数以万计。与此同时,病理信息系统的日常产出里天然存在大量"便宜"的标签——一张 patch 图像"有没有肿瘤"这种图像级判断,是病理医师阅片时的本能输出,成本只有像素级标注的几十分之一。弱监督语义分割(WSSS, Weakly-Supervised Semantic Segmentation)要回答的问题就是:能否用图像级标签训练出像素级分割模型。

WSSS4LUAD 把这个问题落到了肺癌场景的一个具体切面上。肺腺癌(Lung Adenocarcinoma, LUAD)病理阅片的核心是三类组织的空间关系:肿瘤上皮(tumor epithelial, TUM)、肿瘤相关基质(tumor-associated stroma, STR)与正常组织(normal, NOM)——肿瘤上皮与基质的占比、浸润前沿的形态都是预后判断的直接依据。主办方广东省人民医院(Guangdong Provincial People’s Hospital, GDPH)拿出 63 张院内扫描与 TCGA 切片组成训练集,只给 10,091 个 patch 发图像级三类多标签;再备 40 个验证 patch 与 80 个测试 patch 的像素级掩膜作为评测真值,并以 mIoU 排名、以 ISICDM 2021 会议为现场出口、以奖金和"领奖须交源码"的条款吸引全球团队。532 人注册、超过 1,000 次提交、14 支队伍 mIoU 破 0.7——这个数字链证明了图像级标签在病理组织分割任务上可以逼近像素级监督的可用性。

WSSS4LUAD 的回答分三层。第一层是数据:87 张 WSI 的三组织弱监督基准,训练/验证/测试三段齐备,官方连"肺泡腔白色背景不算组织"这种评估细节都提供了 background mask 直接叠加。第二层是工艺:一条"约 500 个人工种子 patch 训练 ResNet-38 → 推断全量伪标签 → 按置信度分流给资深/初级病理医师复核 → WSSS-Tissue 生成伪掩膜 → Photoshop 人工精修 → 标签评审委员会终审"的两段式流水线,让 11 人团队在可承受的成本内完成像素级验证与测试标注。第三层是基准:挑战赛排行榜(冠军 mIoU 0.8413)与后来持续生长的评测生态——病理图文零样本模型(T-MUSK 90.4%、CONCH 82.2%)、WSSS 方法论文(WSSS-CRAM、HisynSeg)、基础模型鲁棒性评测(PathCLIP 七类腐蚀实验)都把这套数据当作标尺。

§0 读法三则:

  1. 这个条目是"数据集 + 挑战赛 + 方法论文"三合一:本体是 10,211 个 patch 的弱监督基准,挑战赛是它的排行榜与时间线,方法论文(MedIA 2022:102487)是同团队标注工艺的技术底座——三者的引用方式各不相同(附录 K)。
  2. 全文统计数字均出自官网 Statistics/Update 栏与 arXiv:2204.06455 摘要及正文;已知口径冲突(patch 尺寸双口径、标签组合计数缺口)分别在坑 3 与坑 4 存照。
  3. 检索时若把"WSSS4LUAD"当成"肝细胞癌数据集"会查无实处——LUAD 是肺腺癌(Lung Adenocarcinoma),不是肝细胞癌(HCC),见坑 1。

§1 数据集速览:十问十答

Q1:WSSS4LUAD 是什么?
一个肺腺癌病理图像弱监督语义分割挑战赛及其配套数据集:主办方给出 10,091 个只带图像级三类多标签的训练 patch,参赛者要用它们训练出能对像素级画出肿瘤上皮/肿瘤相关基质/正常组织的模型,以验证集调参、测试集 mIoU 排名。挑战赛托管于 grand-challenge.org,2021 年收官,附属第 5 届 ISICDM 2021 会议。

Q2:数据有多少、从哪来?
87 张 H&E 染色 WSI:67 张来自广东省人民医院院内扫描,20 张来自 TCGA(癌症基因组图谱)公开切片;每位患者只取 1 张。训练 63 张(49 GDPH + 14 TCGA)、验证 12 张(9 + 3)、测试 12 张(9 + 3),全部切成 PNG patch。

Q3:patch 数量与标签形式?
共 10,211 个 patch:训练 10,091 个(图像级三类多标签,tumor/stroma/normal 可叠加,如"有肿瘤+有基质");验证 40 个、测试 80 个(均为像素级三组织掩膜),验证与测试合计超过 1.3 亿标注像素。

Q4:三类组织怎么定义?
肿瘤上皮(TUM):腺样/乳头状排列的恶性上皮细胞区;肿瘤相关基质(STR):肿瘤侵袭相关的成纤维细胞、炎细胞与细胞外基质;正常组织(NOM):肺泡、支气管等非肿瘤肺组织。肺泡腔内的白色空气区域不算任何一类,评估时用官方 background mask 排除。

Q5:谁来标注、可靠吗?
两段式"病理医师在环"流水线:图像级标签先由约 500 个人工标注 patch 训练 ResNet-38 后推断全量,低置信度 patch 交资深病理医师复核、高置信度交初级复核;像素级掩膜由 WSSS-Tissue 框架生成初始伪掩膜后 Photoshop 人工精修,最后由标签评审委员会(label review board)终审。标注团队共 11 人:1 名专家 + 2 名资深 + 8 名初级病理医师。

Q6:挑战赛结果如何?
532 人注册(中国 299 人、美国 36 人),28 支队伍进入测试阶段,累计超过 1,000 次提交,14 支队伍 mIoU 超过 0.7。冠军 Team ChunhuiLin(Lin et al.)mIoU 0.8413,其中 normal 类高达 0.8919;前三名受邀在第 5 届 ISICDM 2021(桂林)现场报告。

Q7:冠军方案的核心思路?
Siamese 多任务网络:分类分支出 CAM(类激活图)伪掩膜、分割分支并行训练,两分支交叉监督;用 CutMix 把带伪掩膜的 patch 拼接造出像素级真值;Lovász + 交叉熵联合损失加 OHEM;推理时集成 DeepLabv3 系(ResNet101/ResNeSt269)与 HRNetw48 多个模型,再用 BFS 填背景与 100×100 邻域类别分布先验做后处理。

Q8:方法论文和这个数据集什么关系?
同团队两条线:方法论文 arXiv:2110.08048(发表于 Medical Image Analysis 2022:102487)提出多层伪监督框架 WSSS-Tissue 并给出配套数据集 LUAD-HistoSeg(16,678/300/307 个 patch、四类组织);WSSS4LUAD 是其后续挑战赛版,三类组织、规模与划分都不同。两者共享"patch 级分类标签做组织分割"的思想与 WSSS-Tissue 代码库,但不是同一个数据集(坑 2)。

Q9:我现在能拿到什么?
官网挂 Google Drive 公开文件夹,含 1.training.zip、2.validation.zip、3.testing.zip 与 mask.zip 四个分册;测试集掩膜自 2022-02-10 起在 Google Drive 单独公开。注意:官网与论文均未声明正式数据许可条款(坑 6),引用与使用边界需自行确认。

Q10:为什么它对 AI-Ready 重要?
它是"弱监督标签经济学"的活案例:用约 500 个人工种子 patch 加 AI 伪标签撬动 10,091 个训练样本的监督信号,用 11 人团队完成 >1.3 亿像素的像素级验证/测试标注。对研究"标签成本—模型性能"权衡、设计标注流水线、评测病理基础模型的团队,它同时提供了数据、排行榜与方法论三重素材。

§2 数据构成与规格

2.1 规模、来源与机构构成

WSSS4LUAD 的图像本体是 87 张 H&E 染色全切片图像(WSI),来自两个互补的来源:

来源 WSI 数 训练 / 验证 / 测试 性质
广东省人民医院(GDPH)院内扫描 67 49 / 9 / 9 院内去标识化临床数据,扫描设备与染色协议统一
TCGA(癌症基因组图谱) 20 14 / 3 / 3 公开开放数据,可经 GDC portal 独立溯源
合计 87 63 / 12 / 12 每位患者仅取 1 张 WSI

三个设计选择值得注意:

  1. 每患者 1 张:避免同一患者的多张切片同时落入训练与测试两侧造成的患者级信息泄漏——这是病理数据集工程里最常被忽略、也最容易高估成绩的泄漏源。
  2. 院内数据 + 公开数据混编:GDPH 子集保证染色与扫描工艺的临床真实性,TCGA 子集让任何复现者都能独立获取部分母切片,数据可用性不单点依赖一家医院。
  3. 三段划分像素级标注只落在验证与测试:12 张验证 WSI 与 12 张测试 WSI 各切成少量像素级标注 patch(40 + 80),训练侧 63 张 WSI 切出 10,091 个 patch 却只有图像级标签——划分本身就在定义"弱监督"任务的边界。

2.2 三类组织类别体系

挑战赛的分割目标是肺腺癌组织学里的三个功能空间:

类别 英文/缩写 组织学内涵 在阅片中的意义
肿瘤上皮 tumor epithelial, TUM 腺样、乳头状或贴壁状排列的恶性上皮细胞巢,核异型明显 肿瘤本体;分级(贴壁/腺泡/乳头/微乳头/实性)看它的排列方式
肿瘤相关基质 tumor-associated stroma, STR 肿瘤侵袭前沿相关的成纤维细胞(癌相关成纤维细胞)、炎细胞浸润与胶原化细胞外基质 基质占比与纤维化模式与预后、治疗反应相关;TUM/STR 比例是肿瘤微环境研究的基础变量
正常组织 normal, NOM 肺泡壁、支气管、软骨、血管等非肿瘤肺结构 提供组织学参照系;分割出 NOM 才能量化肿瘤浸润范围

第四个"类"是背景:肺泡腔内的白色空气区域不属于任何组织类别。这不是标注疏漏而是评估协议的一部分——官方随验证与测试数据提供 background mask,计算 mIoU 时先叠加它把背景像素剔除,再在三类组织上算平均交并比。没有这一步,大片肺泡空气会被模型的"什么都没预测到"输出拖低分数,组织分割的真实能力反而看不清。

这套三分类是弱监督设定下的刻意收敛:不做腺体亚型、不做核级、不做免疫组化指标,只保留"阅片第一眼"就能给出的组织级三分法,才能让图像级标签的获取成本压到最低——这也正是整个数据集方法论的立足点。

2.3 patch 规格与数量总表

87 张 WSI 不直接参与训练,官方将其切成 PNG 格式的 patch 分册发放:

分册 母 WSI patch 数 标注形式 说明
1.training.zip 63(49 GDPH + 14 TCGA) 10,091 图像级三类多标签 任务的核心监督信号
2.validation.zip 12(9 + 3) 40 像素级三组织掩膜 9 张约 1500-5000² 大 patch + 31 张约 200-500² 小 patch
3.testing.zip 12(9 + 3) 80 像素级三组织掩膜 14 张大 patch + 66 张小 patch;测试阶段经在线提交评估
mask.zip(2022-02-10) — 80 测试集掩膜公开版 挑战赛收官后公开,供赛后复现与后续基准使用
合计 87 10,211 — "超过 1.3 亿标注像素"指验证+测试的像素级掩膜总量

几点工程细节:

  • 图像格式统一为 PNG,四分册 zip 结构即上文文件名顺序,下载后无需格式转换即可进 PyTorch/TensorFlow 管线。
  • 大/小 patch 双档设计:验证与测试各含约 1500-5000² 的大 patch(模拟局部全切片视野)与 200-500² 的小 patch(模拟定点裁剪),评测同时覆盖"看清结构"与"辨清局部"两种能力。
  • 训练 patch 尺寸约 200-500²(官方口径),比常见病理分割训练配置(1024²)小一档,符合"图像级标签容易标"的成本逻辑;尺寸上限存在双口径,见 2.5 与坑 3。
  • 10,091 = 多标签计数之和的上界来源:一个 patch 可同时属于 Tumor 与 Stroma 两类,因此类别计数之和(15,487)大于 patch 总数,引用时别把两者混为一谈(坑 4 的根源)。

2.4 训练集标签分布:多标签的三类计数

训练集 10,091 个 patch 的图像级多标签分布(官网 Statistics 节口径):

类别 patch 计数 占 10,091 比例 备注
Tumor 6,579 约 65.2% 多标签,可与 Stroma/Normal 叠加
Stroma 7,076 约 70.1% 三类中覆盖面最大——基质广泛存在于肿瘤与正常区之间
Normal 1,832 约 18.2% 显著稀少,构成类别不平衡的主要矛盾

第三方方法论文(WSSS-CRAM,PMC11484024)转述的标签组合分布提供了更细的视图:

标签组合 [tumor, stroma, normal] patch 数 语义
[1, 1, 0] 5,393 肿瘤+基质共存(浸润区典型构成)
[0, 0, 1] 1,832 纯正常组织
[0, 1, 0] 1,680 纯基质
[1, 0, 0] 1,181 纯肿瘤
合计 10,086 与官方 10,091 相差 5 个

两个口径的组合数存在 5 个 patch 的缺口,转述文献未说明去向,最合理的推断是存在少量 [1,1,1] 三类共存样本(坑 4)。引用建议:patch 总数与三类计数用官网口径,组合分布标注转述来源。

分布本身给出三条可操作的结论:

  1. Normal 类是短板:1,832/10,091 ≈ 18%,直接训练会低估正常组织;冠军方案对 normal 类做了上采样,后续方法普遍采用重采样或重加权。
  2. Stroma 计数最高但成绩最低:冠军的 stroma IoU 0.7931 是三类中最低——基质与肿瘤的边界模糊(促结缔组织增生区的归属),是弱监督标签天然含混的地带。
  3. 多标签叠加是常态而非例外:过半样本([1,1,0] 5,393)同时含肿瘤与基质,这意味着"图像级标签"并非退化的粗糙信息,而是携带组织共存关系的有效监督。

2.5 尺寸规格与双口径

口径 最小尺寸 最大尺寸 来源
官方 min (150, 150) max (5000, 5000) 官网/总结论文
第三方实测 (150, 156) (5606, 2850) camille-readbean/WSSS4LAUD-processing 处理日志(2024-07-29)

两口径在最小尺寸上基本一致,最大尺寸上官方写 (5000,5000) 而实测记录到 (5606,2850)——宽 5606 高 2850,均有一边超过官方所述 5000。可能的解释是官方给出的是"多数切片"的经验范围或早期版本的口径,个别切片未严格截断。另外,训练 patch 尺寸存在"约 200-500²(官方)"与"150×150 到 300×300(WSSS-CRAM 转述)"两套说法(坑 3)。本条目正文统一采用官方口径并注双口径存照;写复现代码时建议按实测动态读取尺寸而非硬编码假设。

2.6 TCGA 子集溯源

20 张来自 TCGA 的 WSI 是这个数据集里"任何人都能独立验证"的部分:

  • TCGA 的 LUAD 切片经 GDC portal(portal.gdc.cancer.gov) 以诊断切片(Diagnostic Slide)形式开放下载,WSI 格式为 SVS,标注协议为开放数据惯例(CC 口径随 TCGA 使用政策)。
  • 官方论文未附 20 张切片的具体病例 UUID 清单(截至核验时点未见公开清单),因此"哪 20 张"需要通过图像比对或联系作者确认——这是复现侧的一个已知缺口。
  • 对库内用户:本库 tcga 条目(rid 566)覆盖 TCGA 全景,其中 LUAD 项目切片与 WSSS4LUAD 的 TCGA 子集同源;需要更大规模肺癌病理图像时,可衔接 lc25000(rid 178,肺/结直肠 H&E patch 分类)与 NCT-CRC-HE-100K(rid 148,结直肠百万级 patch)。

2.7 与 LUAD-HistoSeg 的边界:同团队的两个数据集

检索 WSSS4LUAD 时几乎必然撞上 LUAD-HistoSeg——同团队(Han Chu 等,GDPH)方法论文 arXiv:2110.08048 / Medical Image Analysis 2022:102487 提出的配套数据集。两者共享思想与代码库(WSSS-Tissue),但规格完全不同:

维度 WSSS4LUAD(本条目) LUAD-HistoSeg
身份 挑战赛数据集 方法论文配套数据集
WSI 规模 87 张(67 GDPH + 20 TCGA) GDPH 肺腺癌切片(论文口径)
patch 规模 10,091 / 40 / 80(训练/验证/测试) 16,678 / 300 / 307
类别数 3 类(TUM/STR/NOM) 4 类(TE/NEC/LYM/TAS,多出淋巴结类)
patch 尺寸 约 200-500²(双口径,坑 3) 统一 224×224
评估 挑战赛 mIoU 排行榜 论文内 FwIoU/mIoU 基准表
首次公开 2021 年(挑战赛周期) 2021-10-14(arXiv:2110.08048 提交)

混用的典型事故是把 16,678 这个数写进 WSSS4LUAD 的规模栏,或把四类标签说成本条目的类别体系。本库的分类原则是数据集以挑战赛版为准、方法引用 MedIA 论文,两者在引用时各自成条(坑 2)。

2.8 小评估集的统计学:40 与 80 张意味着什么

评估集只有 40(验证)+ 80(测试)张,这个规模在统计上必须被认真对待:

  1. 单张大 patch 的权重:测试集 80 张里 14 张是大 patch(1500-5000px),单张像素量可达小 patch 的数百倍。若做逐像素宏平均,一张大 patch 的表现能整体拉动排行榜名次;官方采用 mIoU(类别平均交并比)而非逐像素平均,部分抵消了这种失衡,但 patch 间方差仍然存在。
  2. 类别分项的脆弱性:normal 类 IoU 基于数量有限的正常组织区域——不同方法在 normal 上的差距,可能不如同一方法换一次随机种子的波动大。跨论文比较 stroma/normal 分项时,±0.02 量级的差异不宜过度解读。
  3. 验证/测试的尺寸配比不同:验证集大 patch 占 22.5%(9/40),测试集大 patch 占 17.5%(14/80)——全局上下文能力在测试集的权重更高。复现者若发现验证/测试分数出现系统性落差,先查尺寸配比假设再怀疑实现。

对使用者的操作含义:在这份数据上报告实验时,mIoU 主指标之外应同时报告三个分项 IoU 与 patch 级分布;做消融实验时优先用验证集筛选、测试集只报一次——这与挑战赛"验证阶段自由迭代、测试阶段计次提交"的原设计一致(赛期 >1,000 次提交中大量为验证阶段的迭代,测试评估本就应当稀缺)。

§3 弱监督范式与标注流水线

3.1 任务定义:为什么是弱监督

一张临床 WSI 的像素级标注是什么量级?以 100,000×100,000 像素的全切片、40 倍目镜视野逐区勾画三类组织,一名熟练病理医师单张耗时以小时计;WSSS4LUAD 的验证+测试共 24 张 WSI 就产出了超过 1.3 亿标注像素。把它乘到 10,091 个训练 patch 上,纯人工像素级标注的成本将让任何单一科室却步。图像级标签则是另一个世界:病理医师看一眼 patch 报出"有肿瘤/有基质/是正常",秒级完成——这正是信息系统日常产生的数据形态。

WSSS4LUAD 的任务定义因此是严格的不对称结构:

输入监督:图像级三类多标签(每 patch 一个 3 位 0/1 向量 [tumor, stroma, normal])
        ↓
训练目标:像素级三组织语义分割(TUM / STR / NOM 三通道输出)
        ↓
评估真值:验证 40 + 测试 80 个 patch 的像素级掩膜(官方持有,
          测试集掩膜 2022-02-10 后公开)
        ↓
评估指标:mIoU(叠加官方 background mask 排除肺泡腔白色区域后计算)

这个设定对算法的全部压力在于:从"有没有"推出"在哪里"。主流解法是 CAM(Class Activation Map,类激活图):分类网络对每个类别生成粗粒度热图,热图高响应区近似该类组织的所在,再经区域生长、CutMix 拼接等手段细化成伪掩膜(pseudo mask)充当像素级监督。挑战赛排行榜的头部方案全部建立在这条技术路线上(§4.3)。

3.2 两段式标注流水线:AI 伪标签 + 分层人工复核

WSSS4LUAD 自己也要解决标注问题——它的验证/测试集像素级掩膜与训练集图像级标签,都出自同一条"病理医师在环"流水线。按官方论文与官网图注,流程分两段:

第一段:图像级标签的生产(面向 10,091 个训练 patch)

  1. 种子集人工标注:先由病理医师人工标注约 500 个 patch 的图像级标签,作为分类模型的种子训练集。
  2. ResNet-38 推断全量:用种子集训练 ResNet-38 分类网络,对剩余约 9,600 个 patch 推断三类多标签。
  3. 置信度分流复核:模型低置信度的 patch 交资深病理医师(senior)复核,高置信度的交初级病理医师(junior)复核——人的注意力花在机器最不确定的地方,这是整条流水线的成本控制枢纽。

第二段:像素级掩膜的生产(面向验证与测试 patch)

  1. WSSS-Tissue 生成初始伪掩膜:用团队自研的多层伪监督框架(方法论文 MedIA 2022:102487 的核心产出)在像素级掩膜上先跑出粗掩膜,人从零画变成人改机器画。
  2. Photoshop 人工精修:病理医师在 Photoshop 中对伪掩膜逐区修正边界与漏检——选择 Photoshop 而非专业标注平台,说明修正量被控制在"修图"而非"重画"量级。
  3. 标签评审委员会终审:label review board 对精修结果终审确认,形成最终真值。

流水线的三条设计逻辑:

  • 机器出初稿、人做编辑:两段式的共同骨架都是"AI 先生成、人工再修正",把专家时间从"生产"移到"裁决"。
  • 置信度分层对接人员分层:模型不确定的给资深、确定的给初级,人员层级(专家/资深/初级)与置信度分层一一咬合,复核预算不浪费。
  • 评审委员会兜底:终审不是走过场——弱监督数据的标签噪声会沿着"训练标签→伪掩膜→评测真值"链条传导,终审是链条上最后一道人工闸门。

3.3 标注团队:1 + 2 + 8 的结构

层级 人数 职责 对应环节
专家病理医师(expert) 1 评审委员会终审、争议裁决 第二段第 3 步
资深病理医师(senior) 2 复核模型低置信度图像级标签 第一段第 3 步
初级病理医师(junior) 8 高置信度标签复核、Photoshop 精修 第一段第 3 步、第二段第 2 步
合计 11 — —

这个 1+2+8 结构可与库内 panda-plus 条目(rid 640)的"学生注释 → 高年级复核 → 30 年经验专家终审"三层流水线对照阅读:两者共享"廉价劳动力处理高置信度样本、稀缺专家只兜底争议"的经济学;差异在于 WSSS4LUAD 的初级人力是受训病理医师(领域内人),panda-plus 用的是受训医学生(领域边缘人),前者复核质量上限更高、人力成本也更高——两种配置对应不同预算曲线。

3.4 成本账:标注经济学的一个参照点

方法论文(MedIA 2022:102487)给出的量化口径:其多层伪监督框架下,patch 级分类标签的标注耗时从像素级的小时级降到分钟级,而模型与全监督训练的性能差距约 2% mIoU/FwIoU(LUAD-HistoSeg/BCSS-WSSS 两套基准上的口径)。把这组数字放到 WSSS4LUAD 的语境里:

  • 若 10,091 个训练 patch 全部像素级标注,按每 patch 15-60 分钟的合理区间,总人力在 2,500-10,000 小时量级;
  • 图像级标签 + 置信度分流复核,把同样的监督信号压缩到百分之一量级的人力;
  • 代价是约 2 个点的分割精度与一条必须有人工终审的质量保证链。

这就是"弱监督标签经济学"的完整算式,也是本条目把它列为 AI-Ready 教科书样本的原因:它不是省掉了标注,而是把标注预算重新分配到了信息增益最大的位置(评测真值与低置信度样本)。

3.5 类别不平衡与评估协议的两个细节

不平衡:Normal 类 1,832/10,091(约 18%),Tumor 与 Stroma 各约 65%/70%。三类的 mIoU 表现与之呼应——冠军方案 normal 0.8919 最高(正常组织形态均质、CAM 响应干净)、stroma 0.7931 最低(与肿瘤边界含混)。下游使用建议:重采样/重加权 normal 类,评估时分类别 IoU 与 mIoU 并报,别只看均值。

背景排除:mIoU 计算前叠加官方 background mask 剔除肺泡腔白色区域。这一协议细节常被复现者忽略——直接在全体像素上算 IoU,会因"背景被预测为三类之一"的假阳性系统性虚低分数。复现排行榜数字的第一步就是把 background mask 叠加逻辑写对(坑 9 的主体)。

3.6 流水线复用 SOP:把 1+2+8 搬到自己的项目

WSSS4LUAD 的标注流水线可以抽象成一张与器官无关的 SOP 模板。复用时的七个决策点:

决策点 本数据集的取值 复用时的考虑
种子集规模 约 500 patch 人工标注 越复杂的类别体系需要越大种子集;三类组织级标签 500 够用,细胞级标签建议 1,000+
伪标签模型 ResNet-38 多标签分类器 换成当下骨干(ConvNeXt/ViT 系)预期更好;关键是输出校准过的置信度
分流阈值 模型置信度(论文未披露具体值) 用验证集校准"置信度-真实错误率"曲线,按复核预算反推阈值
人员分层 1 专家 + 2 资深 + 8 初级 层级数按预算定;关键是"不确定样本给高级别人"的调度方向不变
精修工具 Photoshop 选标注者已有肌肉记忆的工具;Zeni/QuPath/Labelme 均可替代
终审机制 label review board(委员会) 单人终审可行但上限低;争议样本应升级到委员会
质量审计 论文未披露量化指标 建议补做:抽样双人背对背标注算一致性(κ),公开报告

两条适用边界:其一,这套 SOP 假设"图像级标签可以通过模型批量推断"——类别定义必须让非专家也能稳定判断(组织级三类满足,分子表型不满足);其二,像素级段以"AI 初稿质量足够高、人工只修不画"为前提,若伪掩膜质量差(如小目标、弱对比类别),Photoshop 精修会退化成重画,成本优势消失——此时应先提高伪掩膜质量(更强骨干、更多种子)再谈流水线。

2.9 patch 命名规范与标签解析

训练集的标签不在单独的 CSV 里,而是内嵌在文件名中——这是这份工程上最值得注意的设计(也是最容易踩的读取坑)。命名模式(第三方处理日志实录):

{病例或切片序号}-{坐标或裁切序号}-{冗余序号}-[{tumor}, {stroma}, {normal}].png
         ↓ 示例
1217322-39328-15772-[1, 1, 0].png   # 含肿瘤、含基质、不含正常组织

解析与重算的参考实现:

import re
from pathlib import Path
from collections import Counter

PAT = re.compile(r"\[([01]),\s*([01]),\s*([01])\]\.png$")
counts, combo = Counter(), Counter()

for f in Path("1.training").glob("*.png"):
    m = PAT.search(f.name)
    t, s, n = map(int, m.groups())
    counts["tumor"] += t; counts["stroma"] += s; counts["normal"] += n
    combo[(t, s, n)] += 1

# 期望输出(与官网核对):counts = tumor 6,579 / stroma 7,076 / normal 1,832
# combo[(1,1,0)] 应约 5,393(转述口径,允许 ±缺口 5,坑 4)

三个工程提醒:其一,文件名含方括号与空格,跨平台脚本(尤其 shell)必须加引号或改用 pathlib——裸 glob 在某些 shell 下会被通配展开;其二,命名模式没有官方文档,第三方日志是唯一实录(事实清单第 31 条),若未来官方分册变更命名,本节的解析代码需同步失效检查;其三,验证/测试集文件名不含标签(标签即掩膜),与训练集的命名语义不同,写统一 Dataset 类时要分支处理。

3.7 标注质量的风险清单(复用流水线前先读)

WSSS4LUAD 的流水线成效有挑战赛背书,但复用它时要知道它的质量风险点在哪:

风险 机制 本数据集的现状 复用者的对策
伪标签偏差传导 ResNet-38 的系统性错误(如对正常组织过敏感)被复核环节部分继承 未量化披露——论文未给伪标签准确率与人工推翻率 复用前先在小样本上测"伪标签 vs 专家金标准"的一致率
置信度校准失真 深度模型的 softmax 置信度与真实错误率非线性,阈值漂移会错分复核流向 分流阈值未公开 用验证集校准置信度-错误率曲线,按复核预算反推阈值
标注者间方差 8 名初级病理医师的个体差异(宽严尺度)未被建模 未披露标注者一致性(κ)数据 复用时抽样双人背对背标注算 κ,公开报告
掩膜边界精度 CAM 系伪掩膜对边界系统性不敏感,精修者耐心决定边界质量 评审委员会终审兜底,但边界误差下限未知 评估边界敏感指标(如边界 F1)时慎用本数据集
类别定义漂移 三类定义在长期标注中可能发生尺度漂移(如"正常"是否含轻度炎症区) 官网定义简洁,操作细则未公开 复用时先写自己的标注手册并冻结版本

这张表的用途是双向的:引用本数据集的掩膜做"金标准"时,知道它是"AI 加持的准真值"(§3.4);设计自己的流水线时,把右列对策当升级清单——特别是标注者一致性报告,这是原版最值得补的缺口,也是后续条目(如 NuCLS 的多标注者设计)已经补上的方向。

§4 挑战赛结果与基准

4.1 挑战赛设计与时间线

项 内容
托管平台 grand-challenge.org(wsss4luad.grand-challenge.org)
附属会议 第 5 届 ISICDM 2021(International Symposium on Image Computing and Digital Medicine),2021-12-17~20,桂林;Top 3 团队受邀现场报告
奖金 Top 3 分别 500 / 400 / 300 美元
领奖条件 须提交源码与模型参数,由主办方复现验证(防止测试集过拟合与结果不可复现)
提交机制 在线提交测试集预测掩膜,服务器端以 mIoU(含背景排除)计分

官方 Update 栏留存的挑战赛时间线:

日期 事件
2021-09-30 挑战赛测试阶段截止(“after the deadline (30 Sept) of this challenge”)
2021-10-12 主办方复现 top 队伍模型
2021-10-24 宣布结果于 ISICDM 2021 现场展示
2021-11-18 数据集于 ISICDM 2021 后重新开放下载
2022-02-10 测试集掩码在 Google Drive 公开
2022-04-13/14 arXiv 总结论文挂出(v1/v2)

4.2 参赛规模与成绩分布

指标 数值 来源
注册人数 532 arXiv:2204.06455 Fig.5
注册者第一大国 中国 299(美国 36、印度 23、加拿大 15、韩国 14 次之) 同上
进入测试阶段队伍 28 arXiv 摘要
累计提交次数 >1,000 arXiv 摘要
mIoU > 0.7 的队伍 14 arXiv 摘要
冠军 mIoU 0.8413 arXiv 摘要(三源确认:官网、arXiv、第三方引用)

532 人注册而仅 28 队进入测试,典型的"注册漏斗"结构;但 14/28 的队伍破 0.7、冠军破 0.84,说明弱监督设定下这条任务的可解性相当好——图像级标签的信息量足够支撑接近可用的组织分割。

4.3 排行榜与冠军方案解剖

排行榜口径:冠军 Team ChunhuiLin(Lin et al.)mIoU 0.8413,分类别 tumor 0.8389 / stroma 0.7931 / normal 0.8919。该数字由官网、arXiv 摘要与第三方引用三源交叉确认;排行榜第二、第三名队伍的名称与分数在本次核验中未能从 arXiv PDF 表格中抓取成功(沙箱网络限制),引用时建议只引冠军数字并注明口径(坑 8)。

**冠军方法(arXiv:2204.06455 Top-tier Methods 节口径)**可拆成六件套:

  1. Siamese 多任务主干:分类分支与分割分支并行——分类分支负责从图像级标签里"榨"出 CAM 伪掩膜,分割分支用伪掩膜训练像素级预测;两分支交叉监督,互相校正。
  2. ASPP 空间金字塔:分割侧采用 ASPP 结构捕获多尺度上下文,应对 patch 尺寸跨度大(150-5000²)的挑战。
  3. CutMix 造像素级真值:把两个带 CAM 伪掩膜的 patch 按掩膜边界拼接(CutMix),合成出"单 patch 不存在"的像素级监督样本——这是把图像级标签的信息密度做二次放大的关键技巧。
  4. 损失组合:Lovász 损失(直接优化 IoU)+ 交叉熵,配 OHEM(在线难例挖掘)聚焦边界难样本。
  5. 模型集成:DeepLabv3 系(ResNet101 与 ResNeSt269 骨干)+ HRNetw48 多模型融合。
  6. 后处理两板斧:BFS(广度优先搜索)填充背景连通域;100×100 邻域的类别分布先验改写 tumor/stroma 孤立误判——利用"组织分布空间连续"这一病理先验。

这套方案的每一步都对应弱监督的一个经典痛点:CAM 不准用交叉监督缓解,像素真值不足用 CutMix 补,类别不平衡用 OHEM 与采样缓解,边界噪声用集成与后处理抹平。它因此也是 WSSS 方法设计的"最大公约数"参考实现。

4.4 方法趋势:CAM 与 CutMix 的双主流

总结论文对全部头部方案的横向结论:

  • CAM 仍是病理 WSSS 的最主流范式:top 队伍无一例外以 CAM 系伪掩膜为像素监督的起点,CAM 的"分类器注意力≈组织位置"假设在 H&E 组织场景成立得相当好;
  • CutMix 被广泛采用:拼接造真值从图像分类的增广技巧升级为 WSSS 的监督信号放大器,top 方案普遍使用;
  • 图像级标注可成为像素级标注的低成本补充:论文明确主张两者混合——图像级标签铺量、像素级标签保质,这正是 WSSS4LUAD 自身数据结构的镜像。

4.5 后续基准生态:数据集的第二生命

挑战赛收官后,WSSS4LUAD 被三类后续工作反复用作标尺,这是它"挑战赛数据集"身份之外持续增值的部分:

一、病理图文零样本/少样本分类基准(sota2.com 汇总口径,2025-06/2026-01 批次):

模型 任务口径 成绩
T-MUSK 零样本 top-1 90.4%
T-PLIP 零样本 top-1 85.0%
CONCH 零样本 top-1 82.2%
PLIP 零样本 top-1 73.1%
CLIP 零样本 top-1 64.9%

用训练集里 6,579 个含 tumor 与 1,832 个纯 normal 的图像级标签做分类评测,病理图文大模型的排序在此基准上与其在 PanCancer 级基准的表现大体一致。

二、WSSS 方法论文的迭代基准:WSSS-CRAM(PMC11484024)、HisynSeg(arXiv:2412.20924,将其列为三个分割数据集之一)等后续方法直接在 WSSS4LUAD 上报分,冠军 0.8413 成为事实上的"待超越线"。

三、基础模型与鲁棒性评测:AFLoc(Nature Biomedical Engineering 2025, s41551-025-01574-7)在数据可用性清单中引用;MUSK 复现清单(Luoxd1996/MUSK)收录;PathCLIP 基准(arXiv:2401.02651)取其训练集 6,574 个纯 tumor + 1,832 个纯 normal patch 做零样本分类,并设计 7 类图像腐蚀实验测鲁棒性。

一个数据集被四个社区(分割算法、图文多模态、基础模型、鲁棒性评测)同时引用,在库内条目里与 PANDA 系(panda/panda-plus)的引用广度同档——弱监督基准的小数据面反而成了它跨社区可用的优势:10,091 个图像级样本对任何评测管线都是即插即用的轻量载荷。

4.6 复现排行榜的四个常见失分点

想在 WSSS4LUAD 上做出与文献可比的分割分数,按挑战赛原协议检查四件事:

  1. 背景排除:mIoU 计算前叠加官方 background mask(验证/测试数据自带)。漏掉这一步的分数与排行榜不可比(坑 9)。
  2. 官方划分:train/val/test 必须按 63/12/12 WSI 的原始划分——尤其不能把验证/测试的像素级掩膜混进训练(弱监督设定会被无声地破坏,分数虚高且失去比较意义)。
  3. 评估集尺寸自适应:大 patch(1500-5000²)直接 resize 到小尺寸会抹掉判别信息,滑动窗口推理是标准做法;自测分数异常低时先查大 patch 的处理路径。
  4. 类别平均口径:官方 mIoU 是三类平均(背景不计入)。有些后续论文报四类(含背景)或逐像素加权(FwIoU)口径——引用与被引用时先对齐口径再比高低。

§5 获取与许可:一扇开着但没挂门牌的门

5.1 官方下载路径

官网(wsss4luad.grand-challenge.org)Download 节挂 Google Drive 公开文件夹(folder id 1qTTTaHAp8HOnvxnKi1RXp-bC7sito9DF),内含四个分册:

WSSS4LUAD/
├── 1.training.zip      # 10,091 个 patch + 图像级三类多标签
├── 2.validation.zip    # 40 个 patch + 像素级掩膜(含背景掩膜)
├── 3.testing.zip       # 80 个 patch(测试图像本体)
└── mask.zip            # 测试集掩膜(2022-02-10 起另行公开,
                        #  文件 id 1Y5KT9vqSDBg5ec0c1VU8kmzubxF5N2W7)

获取流程为全程自助:无需注册、无需邮件申请、无配额限制。2026-09-26 核验时官网在线、Drive 链接公开。大文件下载建议用 gdown 等工具按 folder id 拉取:

# 下载与加载骨架(示意)
# pip install gdown pandas torchvision
import gdown

# 整个公开文件夹
gdown.download_folder(
    id="1qTTTaHAp8HOnvxnKi1RXp-bC7sito9DF",
    output="wsss4luad", quiet=False,
)

# 解压后目录:1.training/ 2.validation/ 3.testing/ mask/
# 训练标签为图像级多标签文件;验证/测试掩膜为像素级 PNG

训练侧的标准读取姿势(弱监督任务):

from pathlib import Path
from PIL import Image
import torch

TRAIN_DIR = Path("wsss4luad/1.training")

def load_train_pair(img_path: Path, label_row: dict):
    img = Image.open(img_path).convert("RGB")
    # 图像级三类多标签 [tumor, stroma, normal]
    target = torch.tensor(
        [label_row["tumor"], label_row["stroma"], label_row["normal"]],
        dtype=torch.float,
    )
    return img, target

# 验证/测试评估时:先叠加官方背景掩膜排除肺泡腔白色区域,
# 再计算三类组织的 IoU 与 mIoU(坑 9)

5.2 获取状态的历史口径

数据可得性在挑战赛周期内有过一次波动,两条历史口径并存:

口径 内容 来源
官方 挑战赛期间下载一度关闭,2021-11-18 宣布"ISICDM 2021 后重新可用";测试集掩膜 2022-02-10 单独公开 官网 Update 栏
参赛队视角 "数据集 locked、需邮件申请"并留联系邮箱 参赛者 repo(Yorkbenno/WSSS4LUAD)的过时快照

两者的时间差解释了矛盾:参赛队口径是挑战赛进行中(下载关闭期)的快照,官方口径是赛后常态。以官网现状(Drive 公开)为准,历史波动记档即可(坑 5)。

5.3 许可现状:未声明 ≠ 无约束

截至核验时点(2026-09-26),三处应该写许可的地方都没有写:

  • 官网无数据许可条款页;
  • arXiv:2204.06455 总结论文无 data availability 许可声明;
  • Medical Image Analysis 方法论文未见数据许可附注。

事实背景是:GDPH 子集为院内 GDPR 去标识化数据,TCGA 子集按 TCGA 开放数据惯例流通。但这不构成数据集本身的正式授权。使用建议:

  1. 学术评测、方法复现:按学界惯例公开引用 + 使用,风险低;
  2. 商业用途、再分发、训练产品的对外服务:先联系主办方(官网/论文通讯渠道)书面确认边界;
  3. 转载进其他平台:不要替它戴 CC 帽子——引用时写"公开下载、许可条款未明示"(坑 6)。

5.4 镜像与二手源

OpenDataLab/OpenXLab 存在 OpenDataLab/WSSS4LUAD 镜像页,规模描述与官方一致,属二手搬运。注意其发布机构栏写作"北京邮电大学·华南理工大学·中国电子科技大学",与论文署名主体(广东省人民医院 + 华南理工等 44 位作者)不一致——镜像页元数据录入有误,发布机构以论文署名为准(坑 7)。

5.5 AI-Ready 评估:DAIMS 速览

按本库 DAIMS 五维框架的速览(全表见附录 B):可发现性 7(官网+arXiv+MedIA+四个社区的引用网络,但名字易与 LUAD-HistoSeg 混淆);可获取性 8(Google Drive 全程自助直链,测试掩膜公开,唯一失分是无正式许可条款与 Drive 长期有效性风险);可互操作 7(PNG+zip 标准格式开箱即用,无官方 PyTorch Dataset 类);元数据 7(官网统计表与论文摘要数字齐备,存在 patch 尺寸与组合计数两处口径漂移);可持续性 5(单点挂在 Google Drive 与官网,无机构库/DOI 版本化存档)。综合 6.8/10(中上)——"自助直链+许可空白"是它区别于请求制数据集(如 panda-plus 掩码)的最大特征。

5.6 下载后完整性校验清单

无官方 checksum 提供,自验只能靠结构性核对。下载解压后逐项过:

□ 目录结构:1.training / 2.validation(img+mask+background-mask)/ 3.testing / mask 四册齐
□ 文件计数:训练 10,091 / 验证 40(9 大 + 31 小)/ 测试 80(14 大 + 66 小)
□ 标签重算:解析训练文件名内嵌 [t,s,n],重算三类计数应得
    Tumor 6,579 / Stroma 7,076 / Normal 1,832
□ 尺寸扫描:min ≈ (150,150)、max 官方口径 (5000,5000)(实测可达 5606×2850,坑 3)
□ 掩膜对齐:验证/测试掩膜与图像逐张同名配对,尺寸一致
□ 背景掩码:验证与测试各含 background-mask 目录(评估必需,坑 9)

任何一项不齐,优先怀疑下载不完整或解压遗漏,其次再考虑官方分册变更(历史上发生过"赛期关闭—赛后重开—掩码补发"的节奏,见 5.2)。

§6 生态与影响:一个团队、一条主线、四个社区

6.1 Han Chu 团队的方法谱系

WSSS4LUAD 的主办团队(一作/通讯 Han Chu,GDPH 放射科与病理科合作,资深作者含 Zaiyi Liu、Qingling Zhang、Changhong Liang 与华南理工 Guoqiang Han)在"patch 级分类标签做组织分割"这条主线上有一个清晰的三部曲:

阶段 产出 数据 关键词
前奏 BCSS-WSSS 基于 BCSS 151 张乳腺 WSI 切出 23,422/3,418/4,986 patch,五类 乳腺,验证范式
方法 arXiv:2110.08048 → MedIA 2022:102487 + LUAD-HistoSeg 数据集 16,678/300/307 patch,四类 TE/NEC/LYM/TAS 多层伪监督框架 WSSS-Tissue
挑战赛 WSSS4LUAD(本条目) 87 WSI → 10,211 patch,三类 全球基准 + 排行榜

代码底座是同一个仓库:github.com/ChuHan89/WSSS-Tissue(方法论文摘要明示)。想要复现冠军级别 WSSS 基线,从 WSSS-Tissue 入手是官方指定路径; BCSS 侧的弱监督数据可在库内 bcss 条目(rid 258)找到母库 BCSS 的全监督版本对照。

6.2 机构与人物速写

  • 牵头:广东省人民医院(GDPH)+ 广东省医学科学院 + 广东省医学影像人工智能分析与应用重点实验室;
  • 科室协作:放射科(Chu Han、Xipeng Pan、Huan Lin、Zhenwei Shi 等)与病理科(Lixu Yan、Bingbing Li、Su Yao、Shanshan Lv 等)联合——影像 AI 团队搭方法与平台,病理科出标注与临床定义,这个配置本身就是"AI-Ready 数据集生产"的组织学样本;
  • 总结论文署名 44 位作者,覆盖主办、标注、平台与参赛支持单位;
  • 挑战赛总结论文的注册地理分析(Fig.5)显示中国 299 人注册居首,是全球南方之外病理 AI 竞赛参与度的罕见公开数据点。

6.3 引用圈全景

社区 代表工作 用法
弱监督分割 WSSS-CRAM(PMC11484024)、HisynSeg(arXiv:2412.20924) 方法迭代基准,冠军 0.8413 为对照线
病理图文多模态 T-MUSK/T-PLIP/CONCH/PLIP 零样本评测(sota2.com 汇总) 分类基准(tumor/normal patch 零样本 top-1)
基础模型评测 AFLoc(Nat Biomed Eng 2025)、MUSK 复现清单 数据可用性清单引用
鲁棒性评测 PathCLIP(arXiv:2401.02651) 6,574 纯 tumor + 1,832 纯 normal patch 零样本 + 7 类腐蚀实验

6.4 在病理图像数据集景观中的位置

把 WSSS4LUAD 放进库内病理条目网络,它的差异化坐标是"弱监督 × 三类组织 × 挑战赛排行":

  • 对比 NCT-CRC-HE-100K(rid 148)与 lc25000(rid 178):两者是百万/万级图像分类 patch 库,标签同样便宜(图像级),但不带像素级真值与排行榜——WSSS4LUAD 用 10,211 个 patch 换来了"分类标签→分割模型"的能力证明;
  • 对比 bcss(rid 258)与其衍生 BCSS-WSSS:同一团队把弱监督范式从乳腺癌搬到了肺腺癌,且加了挑战赛这个"社区验证引擎";
  • 对比 panda(rid 560)/ panda-plus(rid 640):PANDA 系是"大挑战赛 + 切片级分级标签",WSSS4LUAD 是"小挑战赛 + patch 级多标签 → 像素分割",两者合起来恰好覆盖了病理标签粒度谱系的两个端点;
  • han-seg(rid 447)同为 grand-challenge.org 托管的挑战赛条目,平台机制(在线提交、服务器端评估)可互为参照,但域不同(头颈 CT/MR 危及器官)。

6.5 库内互链点详表(供 rid 发布后回填)

互链条目 强度 关系 建议互链方向
bcss(rid 258) 强 同团队 BCSS-WSSS 的母数据集(151 张 TCGA 乳腺 WSI、22 类区域标注) 双向:本条 §6.1 谱系 ↔ bcss 的"衍生数据集"节
tcga(rid 566) 强 20 张 WSI 的母库,GDC 可独立溯源 双向:本条 §2.6 ↔ tcga 的 LUAD 项目说明
lc25000(rid 178) 中 同器官(肺)H&E patch 图像级单标签分类库 双向:本条 §6.4 ↔ lc25000 的"同域数据集"
NCT-CRC-HE-100K(rid 148) 中 十万级 patch 分类,常与本库同篇对比 双向
panda(rid 560)/ panda-plus(rid 640) 弱-中 病理标签粒度谱系两端(切片级分级 vs patch 级多标签→分割);标注流水线对照(学生三层 vs AI 在环) 双向:panda-plus §3.5 生产模式表可加一行
han-seg(rid 447) 弱 同为 grand-challenge 挑战赛条目(不同域) 单向:han-seg 的平台条目列表

检索路径建议:从"弱监督/图像级标注/病理分割"进入本条目;从"肺腺癌病理"进入本条目 + lc25000 + tcga;从"Han Chu / 广东省人民医院"进入本条目 + bcss;从"CAM / CutMix / WSSS 方法"进入本条目 §4.3。

6.6 引用网络的时间演化(2022-2026)

把附录 I 的引用登记表按时间轴重看,能看到一条清晰的消费重心迁移线:

  • 2022-2023(赛后即时消费):引用以挑战赛总结论文的"赛事转述"为主——排行榜数字、方法趋势结论(CAM/CutMix)被综述与方法论文转引,数据本体主要在 WSSS 方法社区内部流通;
  • 2024(基准化):WSSS-CRAM、HisynSeg 等方法论文把它升格为固定基准(与 LUAD-HistoSeg、BCSS-WSSS 并列的"病理 WSSS 三件套"),PathCLIP 等评测工作开发出"图像级标签→分类协议"的第二种用法;
  • 2025-2026(基础模型时代):AFLoc(Nature BME)、MUSK 系图文模型的引用占新增主体,引用重心从"分割 mIoU"滑向"零样本分类 top-1"——同一份数据,标签层被换着用。

对维护者的含义:本条目的"评估与基准"信息有一半生命周期只有 1-2 年(榜单数字会被刷新),维护触发点应盯"新 SOTA 论文"与"新评测社区"两类事件,而不是数据本身的变化(数据自 2022-02-10 后未再更新)。

6.7 可获取性光谱上的位置

库内挑战赛/数据集条目已形成可获取性光谱(注册墙 → 请求制 → 平台托管 → Registry 收录 → 公开直链),WSSS4LUAD 的位置:

档位 库内参照 WSSS4LUAD 对应
注册墙(最严) 注册+审批型条目 —
请求制 panda-plus 掩码(upon qualified request) —
平台托管 Zenodo 型(TopBrain 等) —
Registry 收录 AWS Registry 型 —
公开直链 HF/Zenodo 直链型 Google Drive 公开文件夹(无注册、无配额)

特色在于"直链但无许可"的组合:比注册墙/请求制条目更容易拿到(一键下载),比 CC 条目更不明确(拿到的边界是什么没有成文答案)。检索者按"能否立刻下载"过滤会命中它,按"许可明确"过滤会漏掉它——两种口径下的归属不同,这正是它在本库光谱里的独特价值。

§7 方法学启示:三条可迁移的经验

7.1 图像级标签是像素级标注的低成本补充,而非替代品的替代品

WSSS4LUAD 证明的不是"图像级标签能完全替代像素级标注"(冠军也只到 0.84,stroma 类仍有 0.79 的天花板),而是两者的混合经济学:10,091 个图像级训练样本 + 120 个像素级验证/测试样本 + 11 人团队 = 一个可复现、可排名、可持续生长的分割基准。对任何想建病理分割基准的团队,这个配比(约 84:1 的标签成本杠杆)是可直接借用的起点。

7.2 "AI 伪标签 + 置信度分流 + 分层复核 + 终审"是可复制的标注流水线

这条流水线的每个环节都有明确的对应物:种子集规模(约 500)、分类骨干(ResNet-38)、分流阈值(模型置信度)、人员分层(1+2+8)、精修工具(Photoshop)、终审机制(label review board)。它不依赖特定器官或染色协议——库内 panda-plus 的三层流水线、BCSS-WSSS 的复用都印证了这一点。可复制的不是工具,而是**“机器不确定度驱动人力分配”**这个调度原则。

7.3 评估协议的小设计决定基准的大可信度

两个常被忽视的细节:一是"每患者 1 张"切断患者级泄漏;二是 background mask 排除肺泡腔——前者防成绩虚高,后者防成绩虚低。一个基准的公信力往往不在于数据量,而在于这类协议细节是否被明确写进文档并强制执行(领奖须交源码复现是第三道保险)。设计新基准时,值得把这三条当作 checklist 逐项过。

7.4 把领域常识写进后处理

冠军方案的最后一步不是深度网络而是两条病理先验:肿瘤与基质常交织、但正常组织几乎不与两者重叠;据此在 100×100 邻域内统计类别分布,把被大量正常组织包围的 tumor/stroma 像素改判为 normal,另用 BFS 洪填修补背景孔洞。在"端到端"信仰盛行的年代,这步"不体面"的规则后处理贡献了可观的分数——它提醒:领域知识的注入点不必在损失函数或网络结构里,预测之后的规则层同样正当,而且更可解释、更易迭代。弱监督分割的误差模式(CAM 系统性漏检边界、小区域误判)恰好是规则先验最擅长收拾的形态,两者是互补而非竞争关系。

3.8 流水线经验的边界条件

§7 的三条经验都有适用边界,复用前先对照:

  1. 弱监督的经济性依赖类别可判性:三类组织的图像级判断是病理医师的"秒级本能",流水线的杠杆才成立。若类别定义本身需要高倍镜下判断(如核级、分子表型替代标记),图像级标签的成本优势消失,弱监督不再是最优解——先做成本结构分析再选范式。
  2. AI 在环的收益依赖伪掩膜质量底线:Photoshop 精修的成本与伪掩膜质量成反比。CAM 系伪掩膜在组织级三类上够用(密度-纹理信号强),在细胞级、分子级任务上会退化成"重画"——此时应回到全监督或半监督路线,不要硬套。
  3. 小评估集的可信度依赖协议强制性:40+80 的评估集之所以够用,是因为挑战赛机制强制了统一协议(背景排除、官方划分、计次提交)。脱离赛制自用时,评估集被"用熟"的风险(反复在测试集上调参导致隐性过拟合)比大数据集更高——纪律是 小评估集的利息。

§8 与自然图像 WSSS 的谱系:方法从哪来、到哪去

弱监督语义分割不是病理域的发明——它在自然图像社区(PASCAL VOC 2012、COCO)演化了近十年,WSSS4LUAD 是这条技术线"跨界落地"的标志性检验场。

8.1 方法迁移的三道坎

自然图像 WSSS 方法搬进病理域,需要过三道坎,WSSS4LUAD 的冠军方案恰好各给了一个解法:

  1. CAM 假设的成立条件不同:自然图像里"高响应≈物体位置"依赖物体与背景的外观断裂;病理图像里三类组织靠密度-纹理梯度区分(附录 R),CAM 的分类器注意力恰好对密度敏感——假设不仅成立还更稳,这是挑战赛头部方案全是 CAM 系的根本原因。
  2. 像素真值合成策略不同:自然图像的 CutMix 拼接的是"物体 vs 背景";病理训练集近三成是单类 patch,拼接合成的是"组织 vs 组织"——监督信号的化学成分不同,但放大机制相同。
  3. 评估协议不同:自然图像无"物理空白"问题,病理必须先剔除肺泡腔再算 IoU(坑 9)——协议细节不迁移,分数全部不可比。

8.2 双域验证成为方法论文标配

2020 年代中期起,自然图像 WSSS 的新方法(区域生长改良、原型学习、ViT 注意力蒸馏等谱系)要在病理域证明自己,标准姿势就是双域报分:VOC/COCO + WSSS4LUAD(或 LUAD-HistoSeg / BCSS-WSSS)。WSSS4LUAD 因此获得了"病理域入场券"的角色——这个身份比挑战赛本身更持久。反向流动同样存在:病理团队引入自然图像新方法时,优先检查其在"连续边界类别"(如 stroma,浸润前沿密度连续过渡)上的分项表现,而不是看 VOC 总 mIoU 的提升幅度——总分数掩盖的恰恰是病理域最在乎的误差模式(详见附录 T 对照表)。

§9 与库内条目的关系

9.1 家族图谱与检索入口

本条目在库内的位置由三层关系定义——谱系(同团队)、同域(同器官/同模态)、同平台(同挑战赛基础设施):

WSSS4LUAD(本条目:肺腺癌 × 弱监督分割 × 挑战赛)
├── 谱系层:Han Chu 团队三部曲
│   ├── bcss(rid 258)——BCSS-WSSS 的母数据集(151 TCGA 乳腺 WSI,22 类)
│   └── LUAD-HistoSeg / WSSS-Tissue(依附 MedIA 方法论文,未独立成条)
├── 同域层:肺病理图像
│   ├── tcga(rid 566)——20 张 WSI 的母库,GDC 可独立溯源
│   ├── lc25000(rid 178)——肺/结直肠 patch 分类(图像级单标签)
│   └── NCT-CRC-HE-100K(rid 148)——十万级 patch 分类大库
└── 平台层:grand-challenge.org 挑战赛
    ├── han-seg(rid 447)——头颈 CT/MR OAR 分割挑战赛(不同域同平台)
    └── panda(rid 560)/ panda-plus(rid 640)——病理标签粒度谱系的另一端

检索入口建议:从"弱监督 / 图像级标注 / 病理分割"进入本条目;从"肺腺癌病理"进入本条目 + lc25000 + tcga;从"Han Chu / 广东省人民医院"进入本条目 + bcss;从"CAM / CutMix / WSSS 方法"进入本条目 §4.3。

9.2 库内互链点详表(供 rid 发布后回填)

互链条目 强度 关系 建议互链方向
bcss(rid 258) 强 同团队 BCSS-WSSS 的母数据集(151 张 TCGA 乳腺 WSI、22 类区域标注) 双向:本条 §6.1 谱系 ↔ bcss 的"衍生数据集"节
tcga(rid 566) 强 20 张 WSI 的母库,GDC 可独立溯源 双向:本条 §2.6 ↔ tcga 的 LUAD 项目说明
lc25000(rid 178) 中 同器官(肺)H&E patch 图像级单标签分类库 双向:本条 §6.4 ↔ lc25000 的"同域数据集"
NCT-CRC-HE-100K(rid 148) 中 十万级 patch 分类,常与本库同篇对比 双向
panda(rid 560)/ panda-plus(rid 640) 弱-中 病理标签粒度谱系两端(切片级分级 vs patch 级多标签→分割);标注流水线对照(学生三层 vs AI 在环) 双向:panda-plus §3.5 生产模式表可加一行
han-seg(rid 447) 弱 同为 grand-challenge 挑战赛条目(不同域) 单向:han-seg 的平台条目列表

差异化坐标一句话:库内主流病理条目要么是全监督分割(bcss),要么是单标签分类(NCT-CRC-HE-100K、lc25000),"图像级多标签训练 + 像素级评估"的双级结构在库内独此一份——它恰好卡在两个主流范式之间,是研究"监督信号密度-模型性能"权衡的最小完备样本。

§10 避坑清单:九个已踩过的坑

坑 1:LUAD 是肺腺癌,不是肝细胞癌。
WSSS4LUAD 的 LUAD = Lung Adenocarcinoma(肺腺癌),87 张 WSI 全部是肺组织 H&E 切片(67 GDPH + 20 TCGA)。中文语境里"肝细胞癌(HCC)/肝癌"的表述一律是误读——"L"与肝无关。条目正文、互链与引用一律按肺腺癌写。

坑 2:WSSS4LUAD ≠ LUAD-HistoSeg。
同团队两个数据集:LUAD-HistoSeg(四类 TE/NEC/LYM/TAS,16,678/300/307,统一 224×224,MedIA 方法论文配套)与 WSSS4LUAD(三类 TUM/STR/NOM,10,091/40/80,异构尺寸,挑战赛配套)。类别体系、规模、尺寸全部不同,分数不可互相顶替。检索 “LUAD segmentation WSSS” 时两套论文经常混在结果里,先核对类别数再引数字。

坑 3:patch 尺寸双口径。
训练 patch 官方口径约 200-500px;二手转述有"150×150 到 300×300"(WSSS-CRAM)口径;全库尺寸官方 min (150,150) / max (5000,5000),第三方实测 max (5606,2850)(camille-readbean 处理日志)。管线设计按 150-5606px 全范围动态处理最稳妥,引用时标官方口径并注双口径存照。

坑 4:多标签计数之和 ≠ patch 数,组合计数是转述口径。
训练集三类标签计数 6,579 + 7,076 + 1,832 = 15,487 > 10,091(一张 patch 可含多类,别把 15,487 写成 patch 总数)。按标签组合的细分数字([1,1,0] 5,393 等)来自二手转述(WSSS-CRAM),合计 10,086 与官方总数差 5 张(最合理推断为少量 [1,1,1] 三类共存样本)——引用组合分布时注明转述来源,类别计数以官网为准。

坑 5:数据获取状态有三个历史口径。
“赛期关闭 → 2021-11-18 重开”(官网 Update 栏)、“locked 需邮件申请”(参赛者 repo 的赛期快照)、“Google Drive 公开”(现行状态)。看 2021-2022 年间的二手资料时先核时点;现行一律以官网 Drive 直链为准。

坑 6:没有正式 license,公开下载 ≠ 开放授权。
官网、arXiv 总结论文、MedIA 方法论文三处均无数据许可条款。学术引用是社区惯例;商用/再分发前应联系主办方确认,不要脑补 CC BY——也不要替它戴 CC 帽子转载数据。TCGA 子集(20 张)另受 TCGA 开放体系保护(可独立下载溯源),GDPH 子集(67 张)的再分发边界是真实灰区。

坑 7:第三方镜像的元数据不可信。
OpenXLab(OpenDataLab/WSSS4LUAD)镜像页把发布机构写成"北京邮电大学·华南理工大学·中国电子科技大学",与论文署名主体(广东省人民医院放射科/病理科为绝对主体)不符。镜像可当下载备份,规模元数据与署名一律以官网 + arXiv 为准。

坑 8:排行榜只有冠军数字是三源确认的。
冠军 Team ChunhuiLin 的 mIoU 0.8413 及分项由官网、arXiv 摘要、第三方引用三源交叉确认;但第二名、第三名的队伍名与分数在本次核验中未能从 arXiv PDF 表格(Table IV-B2)抓取成功——引用时只引冠军数字并注明口径,或自行核对 PDF 后补引。

坑 9:mIoU 必须排除肺泡白色背景,否则分数不可比。
官方协议要求把 background mask 叠加到预测结果上再计算 mIoU;排行榜数字全部在此协议下产生。自行复现时漏掉背景排除,分数会系统性虚低;跨论文比较时先核对双方是否都在此协议下。完整的背景排除 mIoU 实现见附录 S。

§11 总结

11.1 三句话总结

  1. WSSS4LUAD 用 87 张 WSI(67 GDPH + 20 TCGA)证明:只有图像级多标签时,弱监督分割在肺腺癌 H&E 病理上可达 mIoU 0.8413,CAM + CutMix 是被 532 人挑战赛验证的主流配方。
  2. 数据集的双级标注结构(训练 10,091 个图像级多标签 patch + 评估 120 张像素级掩膜、超 1.3 亿标注像素)与"1+2+8 病理医师在环"流水线,是"把贵标注花在刀刃上"的可复制模板。
  3. 获取零门槛(Google Drive 公开)但许可真空(三处均无条款),核心数字官网/arXiv 双源互证干净,二手口径漂移(patch 尺寸、组合计数、发布机构)已在九坑清单逐条存照。

11.2 适合谁

  • 弱监督语义分割(WSSS)方法研究者:排行榜 + 三基准生态(WSSS4LUAD / LUAD-HistoSeg / BCSS-WSSS)完整,对比实验即插即用,冠军 0.8413 是明确的"待超越线"。
  • 病理标注工程团队:§3 的两段式 AI 在环流水线与 §3.6 的 SOP 模板可直接套用;1+2+8 的人员配置是与 panda-plus 学生流水线对照的第二种预算曲线。
  • 病理基础模型评测者:训练集图像级标签天然适配零样本分类协议(T-MUSK 90.4% / CONCH 82.2% 榜单先例),10,091 个样本是轻量评测载荷。
  • 医学 AI 挑战赛设计者:双级标注 + 背景掩码协议 + 领奖须交源码复现,是一套值得抄的赛制设计。

11.3 不适合谁

  • 需要纯像素级训练集的全监督分割项目——训练集没有像素真值,请改道 bcss(全监督 22 类)或 LUAD-HistoSeg(四类、带像素级验证)。
  • 需要商用授权的场景——许可真空未解决前,这是法务灰区(坑 6)。
  • 追求统一尺寸张量、min-batch 简单化的快速实验——150-5606px 异构尺寸带来真实的数据工程成本(坑 3)。
  • 关注坏死、淋巴细胞浸润等细粒度类别的肿瘤微环境研究——三类体系不含这些类,四类版本是 LUAD-HistoSeg 而非本数据集(坑 2)。

11.4 30 秒决策卡

你的需求 走哪条路
对标挑战赛 mIoU 下载 4 zip → 官方划分 + mIoU + 背景掩码(附录 S 代码)→ 对标 0.8413
训练弱监督分割器 冠军配方:CAM + CutMix + Siamese 多任务 + Lovász/OHEM + 先验后处理(§4.3 六件套)
做零样本分类评测 训练文件名内嵌标签,PathCLIP 式单类子集协议(§4.5)
只想要像素级掩膜 本数据集只有 120 张评估掩膜——全监督需求转 bcss / LUAD-HistoSeg
复用标注流水线 §3.6 SOP 七决策点表,对照 panda-plus 三层流水线选预算曲线
商用 先停:联系广东省人民医院团队确认授权(§5.3、坑 6)

11.5 五年后的方法学遗产

2026 年回看这场 2021 年的挑战赛,数据之外的遗产有三条:其一,"图像级标签可支撑病理组织分割"从假说变成带排行榜背书的结论,为后来所有弱监督病理工作提供了合法性引用;其二,"AI 伪标签 + 置信度分流 + 委员会终审"的标注范式在病理标注工程中被反复复制,成为 2023 年后大批数据集的默认工艺;其三,它示范了小数据集(87 WSI)也可以通过协议设计(双级标注、背景排除、患者级隔离)获得跨社区基准地位——规模不是基准影响力的必要条件,协议清晰才是。

FAQ(高频问答 39 问)

A. 基础认知

Q1:WSSS4LUAD 四个字母怎么拆?
WSSS(Weakly Supervised Semantic Segmentation,弱监督语义分割)+ 4(for)+ LUAD(Lung Adenocarcinoma,肺腺癌)。读作"WSSS for LUAD"。

Q2:是肝细胞癌数据集吗?
不是。这是最常见的中文误读:LUAD 是肺腺癌,与肝脏无关(坑 1)。全部 87 张 WSI 均为肺组织 H&E 切片。

Q3:数据集和挑战赛是什么关系?
一体两面:2021 年挑战赛使用的数据集,赛后全量公开(含测试集掩膜,2022-02-10 起)。总结论文 arXiv:2204.06455 同时描述两者。

Q4:谁主办?
广东省人民医院(GDPH)放射科/病理科团队,第一作者 Chu Han,总结论文 44 位署名作者;学术出口为 ISICDM 2021(现场展示)+ Medical Image Analysis(方法论文)+ arXiv(总结论文)。

Q5:哪一年发布的?
挑战赛 2021 年举办,数据 2021 年发布、2022-02-10 补齐测试集掩码,总结论文 2022-04 挂 arXiv。

Q6:和 MICCAI 挑战赛什么关系?
没有挂靠关系。学术出口是 ISICDM 2021(桂林)+ MedIA/arXiv 论文,不是 MICCAI workshop——这是它检索存在感与规模错位的原因(§4.1)。

B. 数据与获取

Q7:数据在哪里下载?
官网 wsss4luad.grand-challenge.org 页面内的 Google Drive 公开文件夹:1.training.zip / 2.validation.zip / 3.testing.zip / mask.zip 四个分册(§5.1)。

Q8:需要注册或申请吗?
不需要。Google Drive 直链公开;历史上赛期曾关闭,2021-11-18 重开(坑 5)。

Q9:有 HuggingFace 或 Zenodo 镜像吗?
官方无。第三方镜像(OpenXLab)存在,属二手搬运,发布机构元数据有误,以官网为准(坑 7)。

Q10:可以商用吗?
存疑。三处均无正式 license 条款(坑 6),商用前必须联系主办方确认;TCGA 子集另受 TCGA 体系约束。

Q11:数据格式与文件组织?
PNG 图像;四个 zip 内含训练/验证/测试三个 split 与掩码目录;训练 patch 文件名内嵌 [t,s,n] 多标签,读文件名即得标签。

Q12:图像尺寸范围?
官方口径:小 patch 约 200-500px、大 patch 约 1500-5000px、min (150,150)、max (5000,5000);第三方实测 max (5606,2850)(坑 3)。全库异构,需动态 resize 或滑动窗口。

Q13:TCGA 子集可以独立下载吗?
可以。20 张 WSI 对应 20 个 GDC 病例,在 portal.gdc.cancer.gov 可按 TCGA-LUAD 项目溯源——但论文未附 UUID 清单,具体对应需自行比对(§2.6)。

Q14:下载后怎么验证数据完整?
过 §5.6 的六项清单:目录结构、文件计数(10,091/40/80)、标签重算(6,579/7,076/1,832)、尺寸扫描、掩膜对齐、背景掩码在位。

C. 标注与任务

Q15:三类组织分别是什么?
肿瘤上皮(TUM)、肿瘤相关基质(STR)、正常组织(NOM)——覆盖"癌在哪、间质反应在哪、正常肺在哪"三问;形态学定义见 §2.2 与附录 R。

Q16:训练集标签为什么只有三位二进制?
弱监督设计:图像级多标签是全部训练监督(每 patch 一行 [t,s,n]),像素级真值只用于验证/测试——逼模型自己学会空间定位(§3.1)。

Q17:掩膜是人工画的吗?
AI 初稿(WSSS-Tissue 伪掩膜)+ Photoshop 人工精修 + 评审委员会终审。是"AI 加持的准真值",边界精度受初稿系统性偏差约束(§3.2)。

Q18:标注团队什么构成?
1 名专家 + 2 名资深 + 8 名初级病理医师(共 11 人)+ 标签评审委员会。初级做量、资深纠错、专家仲裁(§3.3)。

Q19:为什么 normal 类标签只有 1,832 张?
数据分布反映真实取材:肿瘤标本的取材与裁切天然偏向病变区域。下游方案需自行做类别重平衡(冠军方案对 normal 上采样,§3.5)。

Q20:评估时为什么要排除白色背景?
肺泡腔在 H&E 染色下呈白色空白,不属于三类别之一;不排除会系统性扭曲 IoU。官方随数据提供 background mask,直接叠加(坑 9、附录 S)。

D. 方法与基准

Q21:冠军方案的核心思路?
Siamese 多任务网络:分类分支出 CAM 伪掩膜,分割分支学习;双模型交叉监督防误差累积;CutMix 用单类 patch 造像素级真值;Lovász+CE 损失、OHEM、多骨干集成;病理先验后处理收尾(§4.3 六件套)。

Q22:CAM 是什么?
Class Activation Map,类激活图:多标签分类网络的空间响应图,指示"哪些像素支撑了这个类的判断"——弱监督分割把它当伪掩膜用(§3.1)。

Q23:排行榜哪里查?
官网可看挑战赛页;详细名次与方法描述见 arXiv:2204.06455 第 IV 节。注意只有冠军数字是三源确认的(坑 8)。

Q24:后续论文怎么引用这个基准?
三种姿势:分割 mIoU(对标排行榜协议)、零样本分类 top-1(T-MUSK 90.4 等榜单)、鲁棒性/标注效率研究素材。引用前先核对对方用的是哪层标签(§4.5)。

Q25:官方方法代码在哪?
WSSS-Tissue:github.com/ChuHan89/WSSS-Tissue(MedIA 2022 方法论文配套,非冠军方案代码——冠军方案仅以技术报告形式存在于总结论文)。

E. 复现与工程

Q26:加载训练标签最省事的方式?
解析文件名:正则提取 [t, s, n] 即标签,无需额外标注文件。验证/测试掩膜按目录与图像同名对齐(§5.1)。

Q27:DataLoader 要注意什么?
尺寸异构(150-5606px):要么动态 resize,要么按大/小 patch 分组;大 patch 建议滑动窗口推理;mask 与 background mask 需同步变换(§4.6)。

Q28:怎么自验数据完整性?
文件数核对:训练 10,091 / 验证 40 / 测试 80;训练文件名标签重新计数应得 Tumor 6,579 / Stroma 7,076 / Normal 1,832(§5.6)。

Q29:mIoU 的参考实现哪里找?
附录 S 给出含背景排除的完整 mIoU 实现;官方协议原文见官网 Evaluation Metrics 节。

F. 库内关联

Q30:和 bcss 条目什么关系?
bcss 是 BCSS 母数据集(151 张 TCGA 乳腺癌 WSI、22 类);同团队在其上构造了 BCSS-WSSS 五类弱监督版(23,422/3,418/4,986 patch)——弱监督三部曲的乳腺癌篇(§6.1)。

Q31:和 LUAD-HistoSeg 是同一份数据吗?
不是(坑 2)。四类 vs 三类、224×224 vs 异构尺寸、16,678/300/307 vs 10,091/40/80,全部不同;引用时各自成条。

G. 身份与混淆(检索防雷)

Q32:为什么中文资料里会出现"肝细胞癌弱监督分割"的说法?
LUAD 四个字母被想当然展开的产物("L"被误联到 liver)。三个字母的权威展开见官网正文与 arXiv 标题:Lung Adenocarcinoma(坑 1)。见到此类表述按本条目口径纠正即可,不必纠缠原出处。

Q33:还有哪些名字相近的数据集容易混淆?
三个:LUAD-HistoSeg(同团队四类、224×224、16,678/300/307,坑 2);BCSS-WSSS(同团队五类、乳腺、基于 BCSS);BCSS 本体(埃默里大学 151 张 WSI、22 类,库内 bcss 条目)。检索 “LUAD WSSS” 与 “BCSS WSSS” 时注意区分数据集与方法论来源。

Q34:WSSS4LUAD 有 DOI 吗?
数据集本体无 DOI(未做 Zenodo/机构库存档);总结论文有 arXiv DOI(10.48550/arXiv.2204.06455)。引用数据时建议同时给官网 URL 与 arXiv DOI(附录 M 引文规范)。

Q35:这份数据还在更新吗?
不更新。数据自 2022-02-10(测试集掩码公开)后无官方版本变更;官网 Update 栏也停更于 2022 年。后续基准生态全部建立在同一版数据上——这反而是复现性利好:不存在"我下载的版本和你不同"的问题(附录 L 维护触发点仍需盯链接有效性)。

Q36:为什么挑战赛数据停在 grand-challenge.org 而不迁到 Zenodo/HuggingFace?
主办方未做迁移——2021 年 grand-challenge.org 是医学 AI 挑战赛的事实标准平台(在线提交、服务器端评估、排行榜一体),数据托管在平台属常规操作;赛后无人出资做规范化存档,Drive 直链就沿用了。这也是它可持续性维度失分(附录 O)的原因:平台习惯 ≠ 长期保存策略。

Q37:想同时对比"弱监督 vs 全监督"的上限差距,怎么设计实验?
两条路:其一,用方法论文口径——MedIA 论文在 LUAD-HistoSeg/BCSS-WSSS 上给了"弱监督 vs 全监督约 2% mIoU"的对照;其二,自建对照——在本数据集上用 120 张评估掩膜留出一部分做全监督训练、其余做弱监督训练、统一在官方测试协议下对比,注意小样本全监督训练的方差(附录 B 标注质量维度)。

Q38:能只用训练集做"图像级标签的自监督预训练"吗?
可以且常见:10,091 个带多标签的 patch 适合做多标签分类预训练或对比学习预训练,再迁移到其他病理任务。注意此时评测协议已脱离本条目的分割基准——引用时应说明任务已变为"以 WSSS4LUAD 训练集为预训练语料",不要与分割排行榜混排。

Q39:条目里说"测试掩码 2022-02-10 公开",那赛后还有人继续在官方榜上提交吗?
挑战赛服务器评估随赛事收官,赛后没有持续开放的官方榜——后续工作都是各自论文内的复现对比(协议见 §4.6)。"榜单"在赛后转化为论文数字的对照系,这是它与长期开放榜单平台(如 grand-challenge 新版持续挑战赛)的机制差异。

事实清单(硬事实 36 条)

  1. WSSS4LUAD 全称 Grand Challenge on Weakly-supervised Tissue Semantic Segmentation for Lung Adenocarcinoma;LUAD = 肺腺癌 — https://wsss4luad.grand-challenge.org/
  2. 总结论文 arXiv:2204.06455,v1 2022-04-13 / v2 2022-04-14,DOI 10.48550/arXiv.2204.06455 — https://arxiv.org/abs/2204.06455
  3. 总结论文署名 44 位作者,第一作者 Chu Han — https://arxiv.org/abs/2204.06455
  4. 方法论文 arXiv:2110.08048(2021-10-14 提交),发表于 Medical Image Analysis 2022: 102487 — https://arxiv.org/abs/2110.08048 + 官网 Citation 节
  5. 官方方法代码 github.com/ChuHan89/WSSS-Tissue — https://arxiv.org/abs/2110.08048 摘要
  6. 数据集 87 张 WSI:67 GDPH H&E + 20 TCGA,每患者 1 张 — https://wsss4luad.grand-challenge.org/
  7. 训练集 63 WSI(49 GDPH + 14 TCGA)→ 10,091 patch — 官网 Statistics 节 + arXiv 摘要
  8. 验证集 12 WSI(9+3)→ 40 patch(9 大 + 31 小)— 官网 Statistics 节
  9. 测试集 12 WSI(9+3)→ 80 patch(14 大 + 66 小)— 官网 Statistics 节
  10. 验证/测试像素级标注合计超 1.3 亿(over 130 million labeled pixels)— https://arxiv.org/abs/2204.06455 摘要
  11. patch 总计 10,211(10,091+40+80),格式 PNG — https://github.com/coendevente/Awesome-Medical-Dataset/blob/main/resources/WSSS4LUAD.md
  12. 训练集类别计数:Tumor 6,579 / Stroma 7,076 / Normal 1,832 — 官网 Statistics 节
  13. 训练标签为 3 位多标签 [tumor, stroma, normal] — 官网 + arXiv 摘要
  14. 标签组合分布转述口径:[1,1,0] 5,393 / [0,0,1] 1,832 / [0,1,0] 1,680 / [1,0,0] 1,181 — https://pmc.ncbi.nlm.nih.gov/articles/PMC11484024/(WSSS-CRAM)
  15. 大 patch 尺寸约 1500-5000px、小 patch 约 200-500px — 官网 Statistics 节
  16. 官方尺寸 min (150,150)、max (5000,5000) — Awesome-Medical-Dataset 转述;第三方实测 max (5606,2850) — https://github.com/camille-readbean/WSSS4LAUD-processing
  17. 任务:仅用图像级多标签预测三组织像素级分割 — 官网正文
  18. 评估指标 mIoU,肺泡白色背景排除,官方提供 background mask — 官网 Evaluation Metrics 节
  19. 标注团队 1 expert + 2 senior + 8 junior 病理学家(11 人)— HisynSeg 转述 https://arxiv.org/pdf/2412.20924 + 官网图注口径
  20. 图像级标签流水线:约 500 张人工种子 → ResNet-38 伪标签 → 低置信度资深复核/高置信度初级复核 → 评审委员会终审 — HisynSeg 转述
  21. 像素级掩膜流水线:WSSS-Tissue 伪掩膜 → Photoshop 精修 → 评审委员会终审 — HisynSeg 转述 + 方法论文
  22. 注册 532 人;中国 299、美国 36、印度 23、加拿大 15、韩国 14(unknown 20)— arXiv:2204.06455 Fig.5
  23. 28 队测试阶段提交,累计超 1,000 次提交,14 队 mIoU > 0.7 — arXiv 摘要 + IV-A 节
  24. 冠军 Team ChunhuiLin(Lin et al.)mIoU 0.8413(tumor 0.8389 / stroma 0.7931 / normal 0.8919)— arXiv 摘要
  25. 冠军方法:Siamese 多任务 + CAM 伪掩膜 + ASPP + 交叉监督 + CutMix + Lovász/CE + OHEM + 多骨干集成 + 病理先验后处理 — arXiv:2204.06455 Top-tier Methods 节
  26. 论文方法趋势结论:CAM 仍是最主流 WSSS 方法;CutMix 被广泛采用 — arXiv 摘要
  27. 奖金 Top 3 分别 500/400/300 美元,领奖须提交源码与模型参数 — 官网 Price 节
  28. 挑战赛于第 5 届 ISICDM 2021(2021-12-17~20,桂林)现场展示 — 官网 Update 栏
  29. 时间线:2021-09-30 测试截止;2021-11-18 数据重开;2022-02-10 测试集掩码公开 — 官网 Update 栏
  30. 文件结构:1.training.zip / 2.validation.zip / 3.testing.zip / mask.zip — Awesome-Medical-Dataset + 参赛者 repo 印证
  31. 训练 patch 文件名内嵌多标签(如 1217322-39328-15772-[1, 1, 0].png)— https://github.com/camille-readbean/WSSS4LAUD-processing
  32. 数据许可未声明(官网/论文均无条款)— 官网与 arXiv 全文核验(2026-09-26)
  33. LUAD-HistoSeg:16,678/300/307,224×224,四类 TE/NEC/LYM/TAS,来自 GDPH 肺腺癌 — https://arxiv.org/abs/2110.08048
  34. BCSS-WSSS:23,422/3,418/4,986,五类,基于 BCSS 151 WSI — https://arxiv.org/pdf/2412.20924(HisynSeg 转述)
  35. 方法论文宣称与全监督差距约 2% mIoU/FwIoU,标注时间小时级→分钟级 — https://arxiv.org/abs/2110.08048 摘要
  36. 下游基准使用:zero-shot 分类 T-MUSK 90.4% top-1(sota2.com);AFLoc(Nature BME 2025)与 MUSK 数据清单引用;PathCLIP benchmark 抽取 6,574 纯 tumor + 1,832 纯 normal patch — https://www.sota2.com/research/dataset/wsss4luad + https://nature.com/articles/s41551-025-01574-7 + https://ar5iv.labs.arxiv.org/html/2401.02651

术语表(30 条)

  1. WSSS(Weakly Supervised Semantic Segmentation):弱监督语义分割——仅用图像级标签训练像素级分割模型的范式。
  2. LUAD(Lung Adenocarcinoma):肺腺癌,肺癌最常见亚型;本数据集的目标癌种。
  3. WSI(Whole Slide Image):全切片图像,病理玻片的 gigapixel 级数字扫描。
  4. H&E(Hematoxylin and Eosin):苏木精-伊红染色,病理最常规染色。
  5. CAM(Class Activation Map):类激活图——分类网络的空间响应图,WSSS 用作伪掩膜来源。
  6. 图像级标签(image-level label):仅声明"图里有什么类"的标注,无空间信息;本数据集为 3 位多标签。
  7. 像素级标注(pixel-level annotation):逐像素类别掩膜;本数据集仅验证/测试集具备。
  8. 多标签(multi-label):一张图可同时含多个类别;与单标签分类相对。
  9. mIoU(mean Intersection over Union):平均交并比——分割任务标准指标;本挑战赛官方指标。
  10. IoU(Intersection over Union):交并比,预测与真值的重叠度度量。
  11. 背景掩码(background mask):官方提供的肺泡腔白色区域掩膜,评估时叠加以排除背景。
  12. 肿瘤上皮(tumor epithelial, TUM):癌细胞构成的上皮性区域。
  13. 肿瘤相关基质(tumor-associated stroma, STR):肿瘤微环境中癌细胞周围的间质组织。
  14. 正常组织(normal, NOM):非肿瘤非间质的正常肺组织。
  15. 肿瘤微环境(TME, Tumor Microenvironment):肿瘤细胞与基质/免疫/血管的局部生态系统,组织分割的上游动机。
  16. CutMix:把两张图剪切拼接的增广技术——为单类 patch 合成像素级真值。
  17. 伪标签(pseudo-label):模型推断的临时标签,交人工复核后转正。
  18. 伪掩膜(pseudo-mask):分割模型生成的临时像素掩膜(本流水线用 WSSS-Tissue 生成)。
  19. pathologist-in-the-loop:病理学家全程在环的标注范式——AI 产出、人复核、委员会终审。
  20. 标签评审委员会(label review board):对全部标签/掩膜做最终确认的质量机构。
  21. OHEM(Online Hard Example Mining):在线难例挖掘——训练时优先学习高损失样本。
  22. Lovász loss:IoU 的凸代理损失,直接优化分割评价指标。
  23. ASPP(Atrous Spatial Pyramid Pooling):空洞空间金字塔池化,DeepLab 系的多尺度感受野模块。
  24. Siamese 网络:孪生结构——两个同构模型互相监督(本挑战赛冠军的 cross-supervision)。
  25. GRAND challenge 平台:grand-challenge.org 医学影像挑战赛托管平台,本赛事的在线载体。
  26. ISICDM:International Symposium on Image Computing and Digital Medicine,本挑战赛的学术展示出口。
  27. TCGA(The Cancer Genome Atlas):美国癌症基因组图谱计划,本数据集 20 张 WSI 的来源。
  28. GDPH(Guangdong Provincial People’s Hospital):广东省人民医院,本数据集主体数据来源与主办方。
  29. LUAD-HistoSeg:同团队方法论文配套的四类肺腺癌弱监督分割数据集(16,678/300/307)——与本数据集不同(坑 2)。
  30. BCSS-WSSS:同团队基于 BCSS 构造的五类乳腺癌弱监督分割数据集(23,422/3,418/4,986)——弱监督三部曲之乳腺癌篇。

附录

附录 A:条目信息速查卡

项 值
条目 slug wsss4luad
预计 URL https://www.qianfanghub.com/ai-ready-dataset/wsss4luad/643
名称 WSSS4LUAD(挑战赛 + 数据集)
癌种 肺腺癌(LUAD)——非肝细胞癌(坑 1)
任务 三组织弱监督语义分割(训练用图像级多标签)
规模 87 WSI / 10,211 patch(10,091 图像级 + 120 像素级)/ >1.3 亿标注像素
年份 2021(赛)/ 2022(论文与全量公开)
获取 官网 Google Drive 公开直链
许可 未声明正式条款
建议引用 Han et al., arXiv:2204.06455 (2022) + Han et al., Med Image Anal 2022;102487

附录 B:DAIMS 评估全表

维度 评估 依据
Data Availability 4/5 Google Drive 公开直链、无注册墙;扣分:无 API 化分发、Drive 长期稳定性无承诺
Annotation Quality 4/5 11 人病理学家团队 + AI 人在环 + 评审委员会;扣分:掩膜初稿为 AI 伪掩膜(准真值)、标注者间一致性未量化
Interoperability 3/5 PNG 通用格式、文件名内嵌标签;扣分:尺寸异构(150-5606px)、无官方 data card/元数据 schema
Metadata Completeness 3/5 官网统计节 + arXiv 论文两源齐备;扣分:无正式数据字典、掩膜像素值编码未成文
Sustainability 2/5 2022 年后无官方维护痕迹、无版本管理、无许可承诺;第三方镜像不可依赖
综合 AI-Ready 中上 获取零门槛 + 数字干净 + 方法文献生态厚;许可真空与元数据欠规范是主要短板

附录 C:逐项证据链自证

关键断言 一手来源 二手印证
87 WSI(67+20)、10,091/40/80 官网 Statistics 节 arXiv 摘要、PMC11484024、Awesome-Medical-Dataset
冠军 mIoU 0.8413 及分项 arXiv:2204.06455 摘要 官网 Update(复现公告)、sota2 榜单生态
532 注册/28 队/>1,000 提交/14 队 >0.7 arXiv:2204.06455 IV-A —(单源,论文为唯一汇总口径)
11 人标注团队与两段流水线 官网图注(简述) HisynSeg arXiv:2412.20924 详细转述、方法论文
LUAD=肺腺癌 官网正文 arXiv 标题、Nature BME 引文
组合计数([1,1,0] 5,393 等) —(无官方表) WSSS-CRAM PMC11484024(转述,坑 3 存照)
时间线各节点 官网 Update 栏 —(单源,官方自述)

附录 D:数据获取决策树

需要 WSSS4LUAD 数据
├── 学术用途
│   ├── 要分割协议 → 官网 Drive 4 zip → 官方划分 + mIoU + 背景掩码(§5.1)
│   ├── 要分类协议 → 训练 zip 文件名解析标签 → 单类子集/多标签分类(§5.2)
│   └── 只要像素掩膜做全监督 → 只有 120 张评估掩膜 → 考虑转 bcss/LUAD-HistoSeg
├── 商用或再分发 → 停:许可真空(坑 6),联系广东省人民医院团队
└── 只需 TCGA WSI → GDC portal 独立溯源 20 例(免 GDPH 子集许可顾虑)

附录 E:训练集标签体系总表

视角 数字 口径
patch 总数 10,091 官方
含 Tumor 6,579 官方
含 Stroma 7,076 官方
含 Normal 1,832 官方
[1,1,0] 肿瘤+基质 5,393 转述(WSSS-CRAM)
[0,0,1] 仅正常 1,832 转述
[0,1,0] 仅基质 1,680 转述
[1,0,0] 仅肿瘤 1,181 转述
[1,1,1] 全三类 5(推断) 推算(差值,坑 3)
三类计数和 15,487 计算(多标签)

附录 F:挑战赛注册地域分布(arXiv Fig.5 转录)

中国 299 / 美国 36 / 印度 23 / 加拿大 15 / 韩国 14 / 德国 12 / 法国 11 / 香港 10 / 英国 9 / 台湾 8 / 荷兰 7 / 日本 7 / 伊朗 5 / 西班牙 5 / 新加坡 4 / 俄罗斯 3 / 罗马尼亚 3 / 意大利 3 / 巴基斯坦 3 / 土耳其 3 / 泰国 3 / 乌克兰 2 / 比利时 2 / 澳大利亚 2 / 奥地利 2 / 马来西亚 2 / 其余各国各 1(埃及、芬兰、瑞典、巴西、挪威、印尼、以色列、孟加拉、瑞士、塞内加尔、匈牙利、澳门、斯洛伐克、尼泊尔、越南、哈萨克斯坦、阿富汗、立陶宛)/ unknown 20。合计 532。

附录 G:时间线总表(官网 Update 栏 + arXiv + 方法论文)

日期 事件 来源
2021(年内) 数据发布、挑战赛开赛、532 人注册 官网/arXiv
2021-09-30 测试阶段截止;Top 3 交 docker 代码 官网 Update
2021-10-12 主办方复现 top 模型中 官网 Update
2021-10-14 方法论文提交 arXiv(2110.08048) arXiv
2021-10-24 宣布 ISICDM 2021 现场展示 官网 Update
2021-11-18 数据集宣布重新开放 官网 Update
2021-12-17~20 ISICDM 2021(桂林),Top 3 报告 官网 Update
2022-02-10 测试集掩码 Google Drive 公开 官网 Update
2022-04-13/14 总结论文 arXiv:2204.06455 v1/v2 arXiv
2022(年内) MedIA 方法论文刊出(102487) 官网 Citation

附录 H:弱监督三部曲对照总表

维度 WSSS4LUAD LUAD-HistoSeg BCSS-WSSS
癌种 肺腺癌 肺腺癌 乳腺癌(TCGA)
类别 TUM/STR/NOM 三类 TE/NEC/LYM/TAS 四类 TUM/STR/LYM/NEC/背景 五类
训练/验证/测试 10,091/40/80 16,678/300/307 23,422/3,418/4,986
尺寸 200-500px + 大张 1500-5000px 224×224 224×224
训练监督 图像级多标签 图像级+像素级(两段标注) 像素掩膜反推图像级
载体 挑战赛官网 arXiv:2110.08048 arXiv:2110.08048
库内条目 本条目 无(依附方法论文) bcss(母数据集)

附录 I:下游引用工作登记表(2022-2026,抽样核实)

工作 年份 用法 来源
WSSS-CRAM 2024 三基准之一,分割 mIoU 对标 PMC11484024
PathCLIP benchmark 2024 训练集抽 6,574+1,832 单类 patch 做 zero-shot + 7 类腐蚀鲁棒性 arXiv:2401.02651
HisynSeg 2024 三 WSSS 数据集之一 arXiv:2412.20924
MUSK 2024-2025 下游分类评测数据清单 github.com/Luoxd1996/MUSK
AFLoc 2025 数据可用性清单(Nature BME) s41551-025-01574-7
T-MUSK 等图文模型评测 2025-2026 zero-shot/transductive 分类榜(T-MUSK 90.4 top-1) sota2.com

附录 J:许可现状细读(2026-09-26)

核验范围:官网全部页面(含 Update/Statistics/Evaluation/Price/Citation 五节)、arXiv:2204.06455 摘要页与全文检索、arXiv:2110.08048 摘要页。核验结论:三处均无数据许可条款——无 Creative Commons 声明、无使用条款链接、无再分发条款。事实背景:TCGA 子集受 TCGA 数据使用框架保护(GDC 开放获取),GDPH 子集为院内去标识数据的主动公开。登记口径:“公开下载、许可未明示、学术惯例引用”;本条目不虚构任何协议(坑 6)。

附录 K:双口径登记表

编号 事项 口径 A 口径 B 条目处理
S1 癌种 任务书草稿"肝细胞癌" 官网/arXiv/Nature BME"肺腺癌" 按肺腺癌写;坑 1 存照
S2 发布机构 OpenXLab:“北邮·华南理工·电子科大” 论文署名:GDPH 为绝对主体 按论文署名;坑 7 存照
S3 训练 patch 尺寸 官方 200-500px WSSS-CRAM 150-300px;实测 min 150 官方口径 + 注(坑 3)
S4 大 patch 上限 官方 5000px 第三方实测 5606×2850 官方口径 + 注(坑 3)
S5 组合计数合计 官方 10,091 转述合计 10,086(差 5) 类别计数官方、组合转述标注(坑 4)
S6 获取状态 官网"2021-11-18 重开" 参赛者 repo"locked 需申请" 现行 Drive 公开为准(坑 5)
S8 第 2/3 名细节 — arXiv Table IV-B2 未抓取成功 冠军三源确认;2/3 名存疑待核
S9 数据许可 — 官网/arXiv/MedIA 均无条款 登记"许可未明示"(坑 6),不虚构协议

附录 L:维护计划与触发点

触发条件 动作
Google Drive 链接失效 更新 §5.1;寻找官方重新分发或 OpenXLab 镜像(标二手口径)
主办方发布正式 license/数据卡 更新 frontmatter license 字段与 §5.3/附录 J,重评 AI-Ready 等级
发现第 2/3 名队伍细节(S8) 补 §4.2 排行榜与附录 K,消除存照
MedIA 方法论文卷期页码正式化 更新事实清单第 4 条(现按官网引用口径 102487)
LUAD-HistoSeg 单独立条 更新附录 H 与 §2.4 的互链表述

附录 M:引文规范

数据引用(首选):

@article{han2022wsss4luad,
  author  = {Han, Chu and Pan, Xipeng and Yan, Lixu and Lin, Huan and others},
  title   = {WSSS4LUAD: Grand Challenge on Weakly-supervised Tissue Semantic Segmentation for Lung Adenocarcinoma},
  journal = {arXiv preprint arXiv:2204.06455},
  year    = {2022}
}

方法引用(标注流水线/WSSS-Tissue 相关):

@article{Han2022Multilayer,
  title   = {Multi-Layer Pseudo-Supervision for Histopathology Tissue Semantic Segmentation using Patch-level Classification Labels},
  journal = {Medical Image Analysis},
  pages   = {102487},
  year    = {2022},
  author  = {Chu Han and Jiatai Lin and Jinhai Mai and Yi Wang and Qingling Zhang and Bingchao Zhao and Xin Chen and Xipeng Pan and Zhenwei Shi and Zeyan Xu and Su Yao and Lixu Yan and Huan Lin and Xiaomei Huang and Changhong Liang and Guoqiang Han and Zaiyi Liu}
}

两个 BibTeX 均转录自官网 Citation 节。引用分数时必须注明协议(mIoU + 背景排除 + 官方划分)。

附录 N:本条目生产档案

  • 生产者:写手代理 A(病理/影像域),CodeBuddy 会话
  • 检索与核验时点:2026-09-26
  • 一手来源:官网 wsss4luad.grand-challenge.org(全文抓取)、arXiv:2204.06455 摘要页、arXiv:2110.08048 摘要页
  • 二手印证:PMC11484024(WSSS-CRAM)、arXiv:2412.20924(HisynSeg)、arXiv:2401.02651(PathCLIP)、Nature BME s41551-025-01574-7(AFLoc)、Awesome-Medical-Dataset、camille-readbean/WSSS4LAUD-processing、Yorkbenno/WSSS4LUAD、sota2.com、OpenXLab
  • slug 查重:数据库 0 行命中(ILIKE ‘%wsss%’)+ writing/ 无同名目录
  • 金标准参照:writing/panda-plus/(FACTS.md 九节结构 + 成稿章节骨架)
  • 存档:writing/wsss4luad/FACTS.md(九节)+ 本成稿(分 5 part 于 /tmp 拼接)

附录 O:FAIR/AI-Ready 检查单

检查项 状态 备注
F1 数据有全局唯一标识 部分 无 DOI;以 arXiv + 官网 URL 为事实标识
F2 元数据可机读 部分 官网 HTML 统计节可解析;无正式 schema
A1 可匿名获取 是 Drive 直链,无注册墙
A2 标准协议 是 HTTPS 下载;无 API
I1 通用格式 是 PNG + zip
I2 词表/编码文档 部分 三类别定义清楚;掩膜像素编码未成文
R1 来源可溯 是 GDPH/TCGA 双源、患者级 1:1
R2 许可明确 否 许可真空(坑 5)——最大失分项
R3 长期维护 弱 2022 年后无官方维护迹象

附录 P:缩写速查

缩写 全称 中文
WSSS Weakly Supervised Semantic Segmentation 弱监督语义分割
LUAD Lung Adenocarcinoma 肺腺癌
WSI Whole Slide Image 全切片图像
H&E Hematoxylin and Eosin 苏木精-伊红染色
CAM Class Activation Map 类激活图
mIoU mean Intersection over Union 平均交并比
TUM/STR/NOM Tumor/Stroma/Normal 肿瘤/基质/正常
GDPH Guangdong Provincial People’s Hospital 广东省人民医院
TCGA The Cancer Genome Atlas 癌症基因组图谱
ISICDM Int’l Symposium on Image Computing and Digital Medicine 国际图像计算与数字医学会议
OHEM Online Hard Example Mining 在线难例挖掘
ASPP Atrous Spatial Pyramid Pooling 空洞空间金字塔池化
TME Tumor Microenvironment 肿瘤微环境

附录 Q:基于本数据集的研究检查清单(10 项)

  1. 任务与监督级别对齐了吗?(图像级训练监督 vs 全监督协议不可混比)
  2. mIoU 计算叠加官方背景掩码了吗?(坑 9)
  3. train/val/test 用的是官方划分吗?自定义划分必须显式声明
  4. 引用的分数是分割协议还是分类协议?(两套榜不可互比)
  5. 用到标签组合计数了吗?注明转述来源(坑 4)
  6. 图像管线处理 150-5606px 异构尺寸了吗?(坑 3)
  7. 类别不平衡处理了吗?(Normal 18%,评估集仅 40/80 张,方差敏感)
  8. 引用规范齐了吗?(arXiv:2204.06455 + MedIA 2022 双引,附录 M)
  9. 商用/再分发场景确认许可了吗?(坑 6)
  10. 报告类别分项 IoU 了吗?(stroma 是瓶颈类,只报 mIoU 会掩盖方法差异)

附录 R:三类组织的形态学速查(给非病理背景的算法工程师)

在 H&E 染色下快速识别三类组织与背景的视觉特征:

类别 低倍视野 细胞形态 常见陷阱
肿瘤上皮 TUM 腺样/乳头状/贴壁状结构的巢片状区,染色深(核蓝紫密集) 恶性上皮细胞:核大深染、核浆比高、异型性、核分裂象可见 贴壁状生长(lepidic)与正常肺泡壁在低倍下相似,需看细胞异型性;实性型与基质难分
肿瘤相关基质 STR 肿瘤巢之间的浅染纤维区,细胞稀疏散布 癌相关成纤维细胞(梭形)、淋巴细胞/浆细胞浸润、胶原沉积 促结缔组织增生区与 TUM 边界天然模糊——这正是 stroma IoU 全场最低(0.7931)的形态学根源
正常组织 NOM 肺泡结构清晰、含气腔隙规则 肺泡壁衬覆扁平上皮,间质薄、炎症少 肺泡巨噬细胞聚集、出血灶易与肿瘤混淆;气肿区结构破坏后形态接近背景
背景(不标) 白色空腔 无细胞成分的空气(肺泡腔、支气管腔) 必须用官方 background mask 排除,否则 mIoU 失真(坑 9)

给深度学习团队的翻译:TUM 是"高密度蓝紫细胞核 + 结构性排列",STR 是"浅染稀疏 + 纤维纹理",NOM 是"规则气腔 + 极薄隔膜"。三类的纹理-密度梯度清晰,这是 CAM(本质是密度/纹理注意力)在此任务上好用的组织学基础;而 TUM/STR 的交界区(浸润前沿)是密度与纹理连续过渡的地带,正是弱监督误差的聚集地——设计边界增强策略(如边缘感知损失)时优先攻这里。

附录 S:含背景排除的 mIoU 参考实现

import numpy as np
import torch

# 类别编码(按官方掩膜 PNG 像素值约定;使用前用少量样本核对)
NUM_CLASSES = 3  # 0=tumor, 1=stroma, 2=normal(背景不入类别)

def compute_miou_with_background(
    pred: torch.Tensor,      # (H, W) int64,取值 {0,1,2}(+可含背景噪声值)
    gt: torch.Tensor,        # (H, W) int64,取值 {0,1,2}
    background_mask: torch.Tensor,  # (H, W) bool,True=肺泡腔白色区域(不计分)
) -> dict:
    """按 WSSS4LUAD 官方协议计算 mIoU:
    1) 叠加 background mask 剔除肺泡腔白色像素;
    2) 仅在三个组织类别上算 IoU 并取平均。"""
    valid = ~background_mask                      # 只在非背景像素上评估
    p, g = pred[valid], gt[valid]

    ious = {}
    for c, name in enumerate(["tumor", "stroma", "normal"]):
        inter = ((p == c) & (g == c)).sum().item()
        union = ((p == c) | (g == c)).sum().item()
        ious[name] = inter / union if union > 0 else float("nan")

    miou = np.nanmean(list(ious.values()))
    return {"mIoU": miou, **ious}

# 评估循环骨架(验证/测试通用;注意 patch 异构尺寸,逐张计算后聚合)
# for img, gt, bg in eval_loader:
#     pred = model(slide_window_inference(img))   # 大 patch 建议滑动窗口
#     scores = compute_miou_with_background(pred, gt, bg)
# 报告口径:mIoU(三类平均)+ 三个分项 IoU;不要把背景算进分母(坑 9)

实现要点:背景剔除在 IoU 之前(先筛 valid 像素再算交并),不是算完再扣;类别不出现的 patch(union=0)按 NaN 跳过而非记 0,与多数挑战赛实现一致;大 patch(1500-5000px)建议滑动窗口 + 重叠融合,resize 到网络输入尺寸会损失判别细节(§4.6)。

附录 T:与自然图像 WSSS 基准的对照

WSSS 方法多在自然图像基准(VOC 2012、COCO)上孵化,进入病理域时有几处系统性差异:

维度 自然图像 WSSS(VOC/COCO) 病理 WSSS(WSSS4LUAD)
类别语义 物体类(狗/飞机/椅子),类间外观差异大 组织类,密度-纹理连续过渡,类间边界天然模糊
类内一致性 高(同一物体外观稳定) 低(同一类组织跨染色、跨区域形态多变)
背景定义 "非物体像素"即可 必须显式区分"组织背景 vs 物理空白"(肺泡腔)
尺寸 统一网格(约 300-500px) 异构(150-5606px),大 patch 需滑动窗口
典型成绩 VOC mIoU 70-80+ 冠军 0.8413,stroma 类 0.79 即天花板
迁移要点 — CAM 假设(高响应≈目标)在密度型纹理上更成立;CutMix 增广对单类样本占比高的病理训练集增益更大

两条实用结论:自然图像 WSSS 的新方法(2020-2024 的 AFA、PPC、ToCo 等谱系)若要在病理域发表,标准姿势就是"VOC/COCO + WSSS4LUAD(或 LUAD-HistoSeg/BCSS-WSSS)双域验证"——WSSS4LUAD 因此成为方法论文的"病理域入场券";反过来,病理团队引入自然图像新方法时,优先检查其在"连续边界类别"(如 stroma)上的表现,而不是看 VOC 总 mIoU 提升幅度。

附录 U:检索路径示范(关键词组合与查询式)

面向不同目标的关键词组合(按命中质量排序):

目标 推荐查询式 预期命中
找数据本体 WSSS4LUAD grand-challenge / WSSS4LUAD download 官网 + Awesome-Medical-Dataset + 镜像
找方法论文 WSSS4LUAD arXiv 2204.06455 / Multi-Layer Pseudo-Supervision Medical Image Analysis 总结论文 + MedIA 方法论文
找后续方法对标 WSSS4LUAD mIoU benchmark / "WSSS4LUAD" segmentation 2024 WSSS-CRAM、HisynSeg 等
找零样本分类榜 WSSS4LUAD zero-shot classification MUSK CONCH sota2.com 汇总、MUSK repo
避免身份混淆 加 lung adenocarcinoma 限定;不要加 hepatocellular 或 HCC(会引向误读文献) —
找同团队系列 LUAD-HistoSeg BCSS-WSSS WSSS-Tissue Chu Han 方法论文 + WSSS-Tissue repo + BCSS

两条检索卫生守则:其一,凡命中"肝癌/肝细胞癌"字样的中文页面,先按坑 1 存疑;其二,凡规模数字出现 16,678 或四类标签,那是在说 LUAD-HistoSeg 而非本数据集(坑 2)——先分清再引用。

附录 V:已知复现资源登记(第三方,非官方维护)

资源 性质 状态 引用注意
github.com/camille-readbean/WSSS4LAUD-processing 数据预处理工程:annotations.csv(全量标签+尺寸)、npy 转换脚本、实测尺寸日志 2024-07 活跃 尺寸实测数字(5606×2850)与文件命名实录的出处;拼写 WSSS4LAUD 系笔误
github.com/Yorkbenno/WSSS4LUAD 参赛队工程:训练代码、crop 流水线、实测 mIoU 0.7411(第 10 名口径) 赛期快照+dev 分支续更 "数据集 locked 需邮件申请"为过时口径(坑 5);作者邮箱为 HKUST 学生账号
github.com/ChuHan89/WSSS-Tissue 官方方法代码(MedIA 论文配套) 官方仓库 仓库未标注开源 license——复用代码同样有许可灰区
OpenDataLab/WSSS4LUAD(OpenXLab) 国内镜像页 在线 发布机构元数据有误(坑 7);规模描述与官方一致
sota2.com/research/dataset/wsss4luad 基准汇总榜(分类向) 持续更新 汇总口径混杂 zero-shot/transductive 多协议,引用时逐条核对设置

登记原则:官方资产只有官网 Drive 与 WSSS-Tissue 仓库两项;其余均为社区快照,用其数据需回溯官方口径核验。此清单随维护更新(附录 L 触发点)。

附录 W:常见错误引用案例库(检索时对照排雷)

以下五种错误在本库条目评审与文献互查中出现过同型案例,引用 WSSS4LUAD 前逐条自查:

  1. 癌种张冠李戴:把 WSSS4LUAD 写成"肝细胞癌/肝癌弱监督分割数据集"——LUAD 是肺腺癌(坑 1)。同型错误:把 LUAD-HistoSeg 的 GDPH 肺切片说成肝切片。
  2. 数据集身份混写:规模写 16,678(那是 LUAD-HistoSeg 的训练集),类别写四类 TE/NEC/LYM/TAS(同上)——两套数据集的任何数字互换都是硬伤(坑 2)。
  3. 计数张冠李戴:把 15,487(三类标签计数之和)当 patch 总数——patch 总数是 10,091(坑 4)。
  4. 协议静默省略:报 mIoU 不说明是否叠加背景掩码、是否官方划分——排行榜与文献分数全部默认该协议,静默偏离即不可比(坑 9、§4.6)。
  5. 许可脑补:在数据引用页写 “CC BY 4.0” 或 “open source”——官方三处均无任何条款,正确写法是"公开下载、许可未明示"(坑 6)。

反例之外的正面引用示范:AFLoc(Nature BME 2025)的数据可用性声明只写 “WSSS4LUAD data are available at https://wsss4luad.grand-challenge.org/”——链接指向官网而非镜像,不添加任何许可表述,是标准的引用姿势。

附录 X:验证/测试掩膜使用规范

掩膜是本数据集最贵的资产(120 张像素级真值),使用前过这五条规范:

  1. 像素值语义先核对再写死:掩膜 PNG 的像素值按类别编码(预期 0/1/2 对应 TUM/STR/NOM,另有背景区),但官方未发布成文数据字典——拿到数据后先抽样可视化核对编码映射(可与图像并排染色检查),再写解析代码(附录 B 扣分项即此)。
  2. background mask 与组织掩膜是两个文件:验证/测试分册内 background-mask 目录单独存放肺泡腔白色区域。评估时叠加排除(附录 S);训练时若做半监督,也建议先剔除背景像素再算损失。
  3. 掩膜与图像逐像素对齐:同一文件名(去掉目录前缀)的图像与掩膜尺寸一致、坐标对齐——任何 resize/split 操作必须同步作用于两者,插值方式用最近邻(不用双线性,避免标签值被插成新类别)。
  4. 不要把测试掩膜泄入训练:包括用测试掩膜预训练分割头再"回弱监督"——这会让与排行榜的比较失去意义(§4.6 失分点 2 的强化版)。
  5. 小评估集复用纪律:测试集 80 张经全球社区多轮评测,事实上已是"半公开熟集";新方法论文建议以验证集为主战场调参,测试集只报最终一次——既是统计纪律也是与历史榜单可比的前提(§2.8)。

附录 Y:库内病理条目横向坐标总表

把本条目放进库内病理图像条目的坐标系(监督密度 × 任务类型),供选型与互链回填:

条目 器官/癌种 载体规模 监督级别 任务 与本条目关系
WSSS4LUAD(本条目) 肺腺癌 87 WSI / 10,211 patch 图像级多标签(训练)+ 像素级(评估) 三组织语义分割 —
bcss(rid 258) 乳腺癌 151 WSI / 20,000+ 区域 像素级(22 类) 区域分割 同团队 BCSS-WSSS 的母库
tcga(rid 566) 多癌种 万级 WSI 开放切片库 多任务原料 20 张 WSI 母库
lc25000(rid 178) 肺/结直肠 25,000 patch 图像级单标签 分类 同域分类对照
NCT-CRC-HE-100K(rid 148) 结直肠等 100,000 patch 图像级单标签 分类/预训练 规模对照
panda(rid 560) 前列腺 12,625 WSI 切片级 GS/ISUP 分级 挑战赛规模对照
panda-plus(rid 640) 前列腺 546 WSI 像素级 Gleason 分级/分割 标注流水线对照
han-seg(rid 447) 头颈 56 例 CT/MR 像素级(30 类 OAR) 分割 同平台挑战赛对照

读表方式:按"监督级别"列从上往下是"便宜→贵"的标签光谱,WSSS4LUAD 的差异化在于训练监督与评估监督的刻意不对称——全库唯一。按"任务"列看,它补齐了病理条目网中"多标签→分割"的空位。

附录 Z:掩膜可视化核对代码(拿到数据第一步)

"""核对掩膜编码映射:抽样 3 张验证 patch,并排显示图像/掩膜/叠加图。
确认像素值 0/1/2 与 TUM/STR/NOM 的对应关系后再写正式解析(附录 X 第 1 条)。"""
import numpy as np
from PIL import Image
import matplotlib
matplotlib.use("Agg")
import matplotlib.pyplot as plt

def overlay(img: np.ndarray, mask: np.ndarray, alpha: float = 0.45):
    color = np.array([[255,  99, 71],   # 0 -> 橙红(tumor)
                      [ 65, 105, 225],  # 1 -> 蓝(stroma)
                      [ 60, 179, 113]]) # 2 -> 绿(normal)
    out = img.copy().astype(float)
    for c in range(3):
        out[mask == c] = alpha * color[c] + (1 - alpha) * out[mask == c]
    return out.astype(np.uint8)

for i, name in enumerate(["9", "10", "11"]):  # 替换为验证集实际文件名
    img  = np.array(Image.open(f"2.validation/img/{name}.png"))
    mask = np.array(Image.open(f"2.validation/mask/{name}.png"))
    if mask.ndim == 3:
        mask = mask[..., 0]
    print(name, "掩膜唯一值:", np.unique(mask))   # 先看实际编码再定映射!

    fig, ax = plt.subplots(1, 3, figsize=(15, 5))
    ax[0].imshow(img); ax[1].imshow(mask, cmap="tab10")
    ax[2].imshow(overlay(img, mask))
    for a, t in zip(ax, ["image", "mask", "overlay"]):
        a.set_title(t); a.axis("off")
    plt.savefig(f"check_{name}.png", dpi=120, bbox_inches="tight")

三个打印出来的 np.unique 结果就是这套掩膜的事实数据字典——把它写进你自己的项目文档,并回填到本条目附录 B 的扣分项复核记录里。

尾注

本条目由千方病案医数集写手代理 A 于 2026-09-26 完成核验与撰写;存在性核验三源互证(官网 / arXiv:2204.06455 / Nature BME 2025 等第三方引用),slug 查重通过,硬数字以官网与 arXiv 双源为准,二手口径漂移(patch 尺寸、组合计数、发布机构)逐条存照于 FACTS.md 第 9 节与附录 K。数据许可真空为客观事实,条目如实登记不虚构。LUAD=肺腺癌(非肝细胞癌)为条目身份的第一修正项,见坑 1。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 挑战赛数据集 / 肿瘤学
  • owl — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • lysto — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
  • panda-plus — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 评测基准 / 肿瘤学
  • trackrad — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 挑战赛数据集 / 肿瘤学
  • leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
  • cosas — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集
  • puma — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集
  • trials — 共享标签:医学影像 / 医学图像分割 / 评测基准 / 挑战赛数据集 / 肿瘤学
  • tus-rec — 共享标签:医学影像 / 评测基准 / 挑战赛数据集

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集