信息速览
INFOBOX — LYSTO 一屏速览
维度 内容 本质 弱监督淋巴细胞计数 hackathon + 基准数据集(patch 级数数,非细胞实例分割赛) 团队 Radboud University Medical Center(Radboudumc)计算病理组;主导 Francesco Ciompi / Wenhua Jiao / Jeroen van der Laak;论文 21 位作者 论文 IEEE JBHI. 2024 Mar;28(3):1161-1172(doi:10.1109/JBHI.2023.3327489;预印本 arXiv:2301.06304) 名称 LySessmenT…全称 LYmphocyte aSsessmenT hackathOn——不是 “SubTYping”(常见错引) 数据 83 张 CD3/CD8 IHC WSI(breast 33 / colon 28 / prostate 22),荷兰 9 中心,0.24 μm/px 规模 train 20,000 / test 12,000 / pilot 4,000 patch(299×299 px,步长 200);标签=中心 267×267 px 淋巴细胞数 任务 patch 级七档 bins 计数(0/1~5/6~10/11~20/21~50/51~200/>200),分类/回归/检测框架皆可 主指标 QWK(quadratic weighted kappa),对三种框架兼容 现场赛果 GSK 0.9270 / HUST 0.9247 / TIA Warwick 0.9229 / TU/e 0.9224 / mi2rl 0.8241;baseline 0.6350 赛后开放 667 注册 / 399 有效提交 / 最高 QWK 0.9331(超现场冠军) 外验 肺癌 10 例 54 ROIs:TIA Warwick 0.9798 最佳;baseline ROI 聚合后 0.8579 反超其 patch 级 医生对照 LYON 上弱监督算法高计数档反超病理医生,0 bin 伪影档医生 0.87 vs 算法 0.04-0.36 获取 Zenodo DOI 10.5281/zenodo.3513571,8.6 GB HDF5,公开直链 许可 双口径:Zenodo 元数据 CC BY 4.0 vs 官网 CC BY-NC 4.0(商用前须核实) 抓取时点 2026-09-26(官网/Zenodo/GitHub 状态均以该日实核为准) 库内互链 monusac(651)、monuseg(30)、pannuke(218)、lizard(238)、nucls(248)、consep(228)、bcss(258)、puma(641)、camelyon16-17(33)
LYSTO 是一场把"数淋巴细胞"这件听起来平淡的事办成单日极限赛的比赛,也是赛后沉淀下来的可插拔基准数据集。它由 Radboudumc 计算病理组主办,挂靠 MICCAI 2019(深圳)的 COMPAY 现场研讨会:参赛队只拿到 20,000 个 CD3/CD8 免疫组化 patch 和每个 patch 中心区域的淋巴细胞总数标签,没有单细胞坐标——这是典型的弱监督设定。五个入围决赛的队伍在几个小时内现场打磨模型,最终四队 QWK 冲过 0.92;赛后对比显示,弱监督计数可以做到与全监督检测相当的灵敏度,且在高计数档反超病理医生,却在"强 DAB 背景伪影但没细胞"的 patch 上集体翻车。
与其把 LYSTO 归类为"又一个病理数据集",不如把它理解为一次关于监督信号性价比的公开实验:同样的任务目标(T 细胞定量),标注成本降到逐细胞标注的几十分之一后,性能天花板在哪里、失败模式是什么、跟人类专家差在哪——这三个问题的答案都以公开数字的形式钉在这份数据集和它的论文里。
导语读法三则:
- 只想下数据:直奔 §7 获取与许可——Zenodo 公开直链 8.6 GB,但许可双口径(CC BY 4.0 vs CC BY-NC 4.0)必须先看坑 2。
- 关心方法学:直奔 §5 五队方法谱系与 §6 医生对照——"弱监督计数≈全监督检测"与"0 bin 伪影翻车"两大结论都在那里。
- 想复刻一场挑战赛:直奔 §3 任务设计与 §4 时间线——pilot→正式→现场的发布节奏与单日赛制是可复制模板。
条目使用总则:本条目所有统计数字截至抓取时点(2026-09-26)以论文(IEEE JBHI 2024)与 Zenodo 记录为准;两处官方口径不一致处(许可、测试标签发布形式)按存照呈现、不做仲裁;库内互链 rid 均经数据库实核。条目正文的"自检动作"(如坑 7 三步)可直接抄进你的实验记录模板。
§0 导读:这个数据集解决什么问题
肿瘤浸润淋巴细胞(tumor-infiltrating lymphocytes,TIL)的密度是肿瘤免疫微环境最直接的定量指标之一,与免疫治疗响应、预后分层密切相关。但"数淋巴细胞"在病理工作流里是个又基础又尴尬的任务:临床价值明确,逐个标注却极其昂贵——一张 0.24 μm/pixel 的全切片上淋巴细胞数以万计,给每个细胞画一个轮廓的专家成本让绝大多数实验室望而却步。全监督检测/分割范式在此天然受限。
这个成本瓶颈恰好卡在技术转折点上:2019 年前后,弱监督与粗粒度监督方法(多实例学习、计数型标签、点级标注)在计算机视觉里已趋成熟,病理界缺的是一个"用最低成本监督信号能把淋巴细胞定量推到什么水平"的公开答案——没有这样的基准,"要不要为 TIL 定量投资实例级标注"这个预算问题就只能靠各实验室拍脑袋。LYSTO 的立项动机正是把这个答案变成可复算的公开数字。
LYSTO 的回答是:不标注细胞,只标 patch。把每张 CD3/CD8 IHC 切片切成一堆 299×299 px 的小块,让病理专家只数"每个 patch 中心区域里有几个淋巴细胞",得到一个整数标签。这个监督信号便宜得多,却足以训练模型做 patch 级计数——分类(预测落在哪一档)、回归(直接预测数值)、检测(先检测再聚合)三种框架都能用同一个指标(QWK)比较。围绕这个设计,LYSTO 回答三个问题:弱监督信号到底能把计数做到多准?不同技术路线在同一个数据上差距多大?机器和病理医生比,谁在什么档位更强?
这场赛事还有一个组织学上的特色:它是一次"现场赛"(on-site hackathon)。pilot 数据提前一个月放出练手,正式训练集只在赛前 3 天发布,测试集在现场经外置存储分发,参赛队只有几个小时完成建模与提交——这刻意模拟了"拿到新数据快速出可用模型"的真实场景,也因此成为观察"什么方法在极少调参时间里最稳"的天然实验场。
赛后的沉淀同样重要:数据以 HDF5 格式在 Zenodo 公开(8.6 GB),官网转型为 Educational Challenge 并保留自动评测平台,论文(IEEE JBHI 2024)把五队方法、肺癌外验与四医生 reader study 全部公开——LYSTO 由此从"一次性比赛"变成"长期基准"。
§0 读法三则:
- 这个条目是"比赛报告+基准数据集+机器 vs 医生对照实验"三合一:数据本体、现场赛果、外验与 reader study 三层各有独立价值,引用时注意区分你在引哪一层。
- 全文统计数字均出自论文正文与表格;论文里 patch 级排名与 ROI 聚合后的排名不一致(baseline 最典型),已在坑 5 存照。
- 检索时把 LYSTO 当作 “Lymphocyte Subtyping challenge” 去搜会漏掉全部关键文献——官方名称是 “Lymphocyte Assessment Hackathon”(坑 1)。
在库内生态中,LYSTO 的位置独特:它既是病理图像家族里唯一的免疫组化(IHC)特异性染色条目(库内其余成员多为 H&E),也是唯一的"计数即标签"弱监督条目(其余为实例/区域级标注)。与 MoNuSeg(30)、MoNuSAC(651)、Lizard(238) 等细胞核实例分割条目构成"监督粒度光谱"的两端,与 CAMELYON16-17(33) 共享同一组织方生态——完整图谱见 §9。
§1 数据集速览:十问十答
Q1:LYSTO 的数据到底长什么样?
83 张 CD3 或 CD8 免疫组化(IHC)染色的乳腺癌/结肠癌/前列腺癌全切片(WSI),来自荷兰 9 个医学中心,3DHistech Pannoramic 250 Flash II 扫描,空间分辨率 0.24 μm/pixel。每张切片标注约 11 个感兴趣区(ROI),以 299×299 px 窗口、200 px 步长切成 patch:训练集 20,000 个、测试集 12,000 个、赛前练手 pilot 4,000 个。注意"83 张 WSI"是切片数而非患者数——论文未披露患者级数量,两者不可混用。
Q2:标签是什么粒度?
patch 级整数计数:每个 patch 中心 267×267 px 区域内病理专家点数的淋巴细胞总数,边缘 4 μm(约半个 T 细胞直径)作为忽略带以避免邻 patch 计数歧义。没有单细胞坐标、没有轮廓——这就是"弱监督"的含义:知道这一小块里有几个细胞,但不知道每个细胞在哪。
Q3:七档 bins 是怎么回事?
连续计数被归入七档:0 / 1~5 / 6~10 / 11~20 / 21~50 / 51~200 / >200。生成数据集时按 bins 分层抽样使各档尽量平衡。实际分布:0 档训练集 21%、1~5 档 63%;最高计数训练集 70、测试集 77——>200 档两个集合都是 0 个样本,名义七档实际六档。
Q4:任务允许多种建模方式吗?
允许。官方规则对架构、外部数据、算力没有任何限制(open challenge),提交一个 CSV 即可。分类(预测 bins 档位)、回归(预测连续计数再归档)、检测(先检测细胞再聚合)三种框架在 QWK 指标下可直接比较——五支决赛队恰好三条路线都有人走。
Q5:现场赛结果如何?
五队 QWK:GSK 0.9270(冠军)、HUST 0.9247、TIA Warwick 0.9229、TU/e 0.9224、mi2rl 0.8241;传统图像处理 baseline 0.6350。前四名差距只有 0.0046——在极短调参时间里,主流 CNN 方案收敛到同一水平。赛后开放评测阶段最高分 0.9331,超越现场冠军。
Q6:弱监督真的能打平全监督吗?
论文的对照实验给出了肯定答案:在 LYON 数据(有逐细胞标注)上,LYSTO 的弱监督模型与全监督检测法的淋巴细胞评估灵敏度相当(GSK 0.55 vs 检测法 0.52),且在高计数档算法灵敏度反超病理医生。代价是 0 计数档:算法对"强 DAB 背景伪影但没细胞"的识别远逊于人眼(0.04-0.36 vs 医生 0.87)。
一句话版本:在"数得准"这件事上弱监督不吃亏,在"分辨棕色是不是细胞"这件事上全监督也没解决——伪影判别是任务本身的难点,不是监督粒度的锅,这正是把两组实验放在一起读才能看清的部分。
Q7:和病理医生比到底谁强?
分档看:0 bin(确认没有淋巴细胞)医生完胜——这是"辨别染色伪影"的活,人有整体组织学判断力;1~5 等低中档双方接近;高计数档算法明显更强——人眼精确数几十个重叠细胞的能力有硬上限。综合灵敏度:GSK 0.55 略高于最好的医生(P4 0.47)。
Q8:换个器官还灵吗?
肺癌外验(10 例、54 ROIs、CD8 染色、Pannoramic 1000 扫描、训练时完全未见):TIA Warwick 0.9798、GSK 0.9680、TU/e 0.9652——前三名几乎不掉分;HUST 0.8595、mi2rl 0.4678 明显下滑。值得注意的是 baseline 经 ROI 聚合后从 patch 级 0.6350 升到 0.8579,说明聚合口径能显著改变结论(坑 5)。
Q9:数据在哪下,什么格式?
Zenodo 记录 3513571(DOI 10.5281/zenodo.3513571):training.h5(5.4 GB)+ test.h5(3.2 GB)+ training_labels.csv(620.1 kB),合计 8.6 GB,公开直链。训练集另有单独记录 3473558(概念 DOI 10.5281/zenodo.3473557)。读取用 h5py/PyTables。下载与读取的常见故障对照见 §7.6 排查表。
Q10:能商用吗?
不确定,这正是 LYSTO 的坑 2:Zenodo 记录的许可字段写 CC BY 4.0,官网挑战页却声明 CC BY-NC 4.0(禁商用)。两个官方口径未对齐,任何商用计划都应先向 Radboudumc 书面核实,本条目按双口径呈现。
§2 数据构成:83 张 WSI 如何变成 36,000 个带计数标签的 patch
2.1 器官与切片构成
LYSTO 的 83 张全切片按器官三分:
| 器官 | 训练集 | 测试集 | 合计 |
|---|---|---|---|
| 乳腺癌 | 18 | 15 | 33 |
| 结肠癌 | 13 | 15 | 28 |
| 前列腺癌 | 12 | 10 | 22 |
| 合计 | 43 | 40 | 83 |
三个器官的选择有明确的方法学考量:乳腺癌是淋巴细胞定量研究最成熟的癌种(TIL 评分已有国际共识与临床证据);结肠癌与前列腺癌则代表截然不同的免疫浸润模式——结肠癌通常浸润丰富(hot tumor),前列腺癌通常浸润稀少(cold tumor)。三者混排使数据集天然覆盖从"密密麻麻"到"找不到几个"的淋巴细胞密度谱系,bins 的宽区间设计(如 21~50、51~200)正是为高浸润场景准备的。
从免疫学背景看,这条"hot-cold"谱系对应着临床上完全不同的评估难度:hot tumor(如部分结肠癌)的难点在"数不过来"——淋巴细胞密集重叠、边界粘连,考验高计数档的精确性;cold tumor(如多数前列腺癌)的难点在"确认没有"——大片基质里零星几个 T 细胞,甚至全是 DAB 背景噪声,考验 0 档与低档的判别力。数据集把两种难度同时塞进 bins 的两端,任何一个"单侧优化"的模型都会在另一侧丢分——这解释了为什么现场前四名的成绩会收敛得如此紧密:能同时吃下两端的方案,在主流 CNN 生态里就那么几种。
每张切片统一为 CD3(全 T 细胞)或 CD8(细胞毒性 T 细胞)免疫组化染色——注意是"或":每张切片只用其中一种标记,论文未提供逐张染色分配表,使用者在做染色类型相关分析时需自行从数据中核对。
2.2 多中心来源与"刻意偏斜"
83 张切片来自荷兰 9 个医学中心,但训练/测试的中心分配极不均匀:训练集只来自 2 个中心,测试集来自 8 个中心;有 1 个实验室同时出现在两侧(跨集),但两侧无任何患者重叠。
这个设计不是疏忽而是考题:中心间的染色协议、扫描批次、组织处理差异全部被压在"训练侧单一、测试侧多样"的落差里,模型被迫面对染色与域偏移。这意味着两件事——其一,LYSTO 成绩单上已经内含了域泛化的压力测试,现场前排四队 QWK 0.92+ 是顶着中心偏移拿到的;其二,使用者若拿 LYSTO 训练集训练、再用测试集评测,测到的就是"跨中心泛化能力",不能与"同中心 i.i.d. 评测"的结果混着比较。
还要注意这层设计对"事后添加训练数据"的隐含约束:如果使用者把测试集并入训练再在原测试集上评测,得到的是一个没有意义的数字——测试集的 8 个中心里有 6 个从未在训练侧出现过,这是成绩单里最值钱的部分,合并即毁。同理,自建 IHC 数据集想借用 LYSTO 做预训练时,应当在数据卡片里明确记录本方测试集与 LYSTO 全部三个中心集合(训练 2 + 测试 8,含 1 个跨集实验室)的机构重叠情况。
2.3 染色、扫描与 ROI 层
- 扫描仪:3DHistech Pannoramic 250 Flash II,20× 等效物镜下像素分辨率 0.24 μm/pixel——patch 是全分辨率切片,无降采样。
- ROI:每张 WSI 标注约 11 个 ROI,选择标准是覆盖多样淋巴细胞模式(从无浸润到密集浸润),而非全片均匀采样。这意味着 LYSTO 的 patch 池是"模式导向"的,密度分布由 ROI 策略与 bins 分层共同决定。
- 肺癌外验数据(§6)用的是另一台扫描仪 Pannoramic 1000(同为 0.24 μm/pixel),这是外验的轻微扫描域差异之一。
"约 11 个 ROI/切片"这个数字反推一下数据工程的效率:83 张切片 × 11 ROI ≈ 900 个 ROI,切成 32,000+ 个带标签 patch——平均每个 ROI 产出约 36 个 patch。专家的全部标注工作发生在 ROI 层的"逐 patch 点数"上,这正是弱监督设计的成本优势所在:同样是这 900 个 ROI,逐细胞实例标注的工作量会是点数的十几倍以上,而后者换来的实例信息在本任务的主指标(patch 级计数)下大部分是冗余的。
2.4 从 ROI 到 patch:切片流水线与标签几何
patch 的切法与标签的几何定义是 LYSTO 最容易被忽略又最容易出错的细节:
- 在 ROI 内以 299×299 px 窗口、200 px 步长滑动切片(299 px ≈ 75 μm 见方的组织区域)。
- 标签 = patch 中心 267×267 px 区域内病理专家点数的淋巴细胞总数。
- 中心框与 patch 边缘之间留下 16 px 的环带(≈4 μm),作为忽略带——设计意图是让忽略带宽度约等于半个 T 细胞的平均直径,使相邻 patch 的计数标签互不"串门":一个骑在边界上的细胞最多落入一侧的中心框。
这套几何设定的直接推论:标签的计数范围是"中心 267×267 px ≈ 64 μm × 64 μm ≈ 0.41 mm² 组织内的淋巴细胞数"。使用者在把 LYSTO 计数换算成"每 mm² 淋巴细胞密度"或与其他文献的密度口径对比时,必须以 0.41 mm² 这个有效面积为准,直接拿 299 px 全 patch 面积换算会系统性偏低约两成。
用一个数值例子体会忽略带的设计意图:假设一个淋巴细胞恰好处在 patch A 与相邻 patch B 的交界线上(两 patch 中心相距 200 px,窗口 299 px,重叠 99 px)。若标签直接统计整个 299×299 窗口,这个细胞会同时计入 A 与 B,两次计入使相邻标签相关、评测虚高;若不设重叠区规则,细胞又可能两个都算不进。267 px 中心框 + 16 px(4 μm)环带的组合把"归谁"这个问题一刀切开:细胞半径约 4 μm,边界细胞最多落入一侧中心框。对使用者,这个几何还意味着一个反直觉事实——相邻 patch 的标签在统计上近乎独立,patch 级随机划分的"数据泄漏"担忧比一般滑动窗口数据集小,但 WSI 级划分(TU/e 的做法)依然是更严谨的选择,因为染色与扫描批次的相关性仍在切片层。
2.5 bins 分布:七档的设计与六档的现实
训练/测试集按 bins 分层尽量平衡,实际分布(Table I):
| bins 档 | 训练集 n (%) | 测试集 n (%) |
|---|---|---|
| 0 | 4,208 (21%) | 2,915 (24%) |
| 1~5 | 12,586 (63%) | 6,663 (56%) |
| 6~10 | 2,008 (10%) | 1,260 (11%) |
| 11~20 | 900 (5%) | 790 (7%) |
| 21~50 | 290 (1%) | 323 (3%) |
| 51~200 | 8 (<1%) | 49 (<1%) |
| >200 | 0 (0%) | 0 (0%) |
| 合计 | 20,000 | 12,000 |
辅助统计:训练集计数均值 3.11、最大值 70;测试集均值 3.92、最大值 77。
三个必须记住的事实:
- 1~5 档是绝对主力(56-63%),"大多数 patch 里只有个位数淋巴细胞"是这份数据的底色,模型天然容易被这个先验拖向保守预测——mi2rl 的失误模式(§5)与此直接相关。
- 51~200 档是尾部稀缺区(训练集仅 8 个样本),任何按 bin 报告的性能在这一档都几乎没有统计效力。
- >200 档是空档:设计上保留了这一档(理论上极端密集浸润可能超过),生成时未能采到任何样本。名义七档、实际六档,坑 4 有专论。
bins 的档距设计也值得一看:它不是等宽的(0 / 5 / 5 / 10 / 30 / 150 / ∞),而是"低档细、高档粗"的对数式排布——0 与 1~5 分开(有无细胞的定性分界)、1~5 独占一档(主流密度)、往上档距逐步放大。这个排布与淋巴细胞在组织中的真实分布吻合:绝大多数区域是稀疏浸润,密集浸润是少数且其精确值意义不大。对使用者的推论是:如果想改 bins(比如做更细的高档划分),训练数据里的高档样本量(21~50 档仅 290+323 个、51~200 档仅 8+49 个)撑不起细划分,改 bins 的自由度实际只存在于低档侧。
2.6 y=0 patch 的选择性生成:故意埋进去的陷阱
0 计数 patch 的来源值得单独说明:部分 y=0 patch 是按 brown score(DAB 染色强度评分)选择性生成的——专门挑选那些 DAB 染色信号强、看起来"像有阳性细胞"但实际没有淋巴细胞的区域。这是论文明确记载的设计(引用其基线构建文献)。
换言之,LYSTO 不是无意中混入了伪影,而是有意把"强信号假象"作为考点埋进了 0 档:模型必须分辨"棕色是淋巴细胞"与"棕色是染色沉积/背景伪影"。后果在 §6 展开得更彻底——五支队伍在 0 bin 的灵敏度全部崩到 0.04-0.36,而病理医生是 0.87;赛后复盘发现 4.0% 的测试样本五队全错,其中强 DAB 背景染色伪影 patch 是重灾区,个别 patch 被误报多达 42 个细胞。
为什么要把伪影当考点?放到 IHC 定量的真实工作流里就通了:临床与科研场景中,DAB 非特异性沉积、边缘挤压伪影、色素沉淀在真实切片上并不罕见,而自动定量系统一旦把伪影读成阳性细胞,下游的 TIL 评分、免疫表型分析会整体失真。一个在"干净数据"上训练的计数模型上线后的第一类事故往往就是"到处报数"。LYSTO 用数据集构造把这个失败模式前置到了基准评测里——模型还没上线就先在 0 档挨一记闷棍,比上线后在真实切片上翻车便宜得多。这也是它作为 benchmark 区别于"训练集"的价值:基准的价值一半在于测出你会什么,另一半在于测出你不会什么。
2.7 元数据:有什么、没什么
- 有:癌症类型(乳腺癌/结肠癌/前列腺癌)作为可选元数据记录于训练集;patch 级计数标签;训练集独立 CSV(training_labels.csv)。
- 没有:患者人口统计(年龄/性别)、患者级去标识信息、逐张染色分配表(CD3 vs CD8)、单细胞坐标、test.h5 的字段文档(论文未细述,坑 7)。
对想清洗数据或做亚组分析的使用者:患者数未披露、患者级信息缺失是硬约束,任何"按患者划分"的自定义交叉验证都无法严格实现,只能退回到 patch/slide 级划分并在论文中如实声明。
2.8 与 LYON 的数据血缘:同一个图像池的两副面孔
理解 LYSTO 的数据不能绕开它的前作 LYON(lyon19.grand-challenge.org,441 个 ROI):LYSTO 测试集的图像完全派生自 LYON 官方测试集(论文 §III.C/§V.C)。两个数据集的关系可以概括为"同一批切片、两种监督形态":
| 维度 | LYON(前作) | LYSTO(正作) |
|---|---|---|
| 标注粒度 | ROI 级逐细胞标注(全监督) | patch 级整数计数(弱监督) |
| 图像 | 441 个 ROI | 83 张 WSI 切出的 36,000 patch |
| 任务 | 淋巴细胞检测/分割/计数 | patch 级计数评估 |
| 关系 | 测试图像被 LYSTO 测试集继承 | 图像侧的上游 |
这层血缘有两个实际影响。其一是对照实验成为可能:论文能在 LYON 上把弱监督模型(LYSTO 训练)与全监督检测法、病理医生放在同一评估框架下对比(§6.4),因为 LYON 有逐细胞标注可支撑检测类评估——没有这层血缘,"弱监督≈全监督"的核心结论就无从验证。其二是交叉使用的风险:如果研究者同时用 LYON 训练、LYSTO 测试(或反之),测试图像可能与训练图像同源,评测会失去独立性——两赛数据的使用者在设计 train/test 切分时必须显式检查图像血缘,把 LYON 测试 ROI 对应的 LYSTO 测试 patch 排除在训练之外。
§3 任务设计与指标:为什么"数数"能办成一场严肃大赛
3.1 任务形式化
输入:一张 299×299 px 的 CD3/CD8 IHC patch。输出:该 patch 中心 267×267 px 区域内的淋巴细胞数,评测时按七档 bins 比对。允许的建模路线(官方不设限):
- 分类:把七档 bins 当作 6 个实际类别直接预测档位;
- 回归:预测连续计数再归档(HUST 即此路线);
- 检测/分割:先把每个淋巴细胞检测或分割出来再计数(TIA Warwick 的 HoVer-Net 路线);
- 传统图像处理:颜色反卷积 + 统计特征 + 决策树(baseline 路线)。
形式化表述:给定 patch 图像 x∈R^(299×299×3),目标为标量 y(中心 267×267 px 区域淋巴细胞数),评测时以映射 b(y) 把 y 离散到六档有效 bins 并计算 QWK。三种建模路线的差异仅在 p(y|x) 的参数化方式(离散分布 / 连续值 / 检测集合的基数),而评测面 b∘predict 统一——这是"一个指标管三种模型"的形式化基础。
3.2 指标为什么选 QWK
主指标是 quadratic weighted kappa(QWK,二次加权 kappa):衡量预测档位与真值档位的一致性,并对"错得越远扣得越重"——把 0 档判成 1~5 档扣分很小,把 0 档判成 51~200 档扣分很大。选它有三重理由:
- 框架无关:分类输出档位、回归输出四舍五入归档、检测聚合后归档,都能算 QWK,赛道统一。
- 抗类别不平衡:直接 accuracy 会被 1~5 档(56-63%)主导;QWK 在 chance agreement 之上修正,逼模型把"每个档"都预测对。
- 临床语义:计数任务里"差一档"与"差四档"的后果确实不同,二次加权与实际风险梯度匹配。
代价是 QWK 对"相邻档位的小偏移"宽容——一个总把 6~10 判成 1~5 的模型丢分有限。这正是 mi2rl 赛后复盘指出的 binning 量化效应:细粒度错误在粗 bins 下部分被吸收(§5.5)。
给一个直觉例子:某模型把真值 0 的 patch 预测为 1~5 档(错一档、错得近),把另一个真值 0 的伪影 patch 预测为 21~50 档(错四档、错得远)。QWK 对前者的惩罚远小于后者——这个性质与"伪影误报"的实际危害梯度一致(轻微高估 vs 数十倍虚报),是它优于普通 accuracy 的地方。反过来,如果使用者的下游应用对"低档内的偏移"同样敏感(例如剂量学意义的密度阈值恰落在 1~5 与 6~10 之间),那么 QWK 就不是合适的业务指标——基准指标与业务指标分离是使用 LYSTO 做决策依据时必须写进方案的注意事项。
3.3 提交与规则
- 提交物是单个 CSV(patch id + 预测档位/计数),无架构限制、无外部数据禁令、无算力限制——open challenge 设定。官网当时提供自动评测平台;赛后平台保留,官网转型为 Educational Challenge(评估已关闭,2026-09-26 实核主页存续、/evaluation/ 子页 404,坑 3)。
"无外部数据禁令"这条规则在今天回看相当超前:它默认了"允许用任何预训练资源,最终在 LYSTO 测试集上见真章"的评测哲学——这与基础模型时代"预训练普遍可用、评测才是竞争面"的现实完全一致。2019 年的五队用 ImageNet 预训练,今天的使用者可以合理地用病理基础模型预训练——规则文本无需修改,这正是 open 设定的生命力所在。
3.4 三阶段发布时间线
| 阶段 | 时间 | 内容 | 设计意图 |
|---|---|---|---|
| Pilot | 2019-08-06(赛前约 1 个月) | 4,000 个 patch | 练手、对齐格式、搭建管线 |
| 正式训练集 | 2019-10-04(赛前 3 天) | 20,000 个 patch + 标签 | 逼出"快速数据适配"能力 |
| 现场赛 | 2019-10-13,COMPAY @ MICCAI 2019,深圳 | 12,000 个测试 patch(现场经外置存储分发) | 单日极限建模 |
这套节奏是 LYSTO 区别于常规"数月长跑"挑战赛的核心:pilot 让所有人把工程跑通,正式数据只给 3 天防止过度调参,现场单日赛把比较对象从"算力+调参预算"变成"方法本身的稳健性"。赛后在 Zenodo 公开全部数据(Version 1.0,2019-10-04 关联发布),并开放长期评测——数据集的公开身份由此确立。
三段节奏对参赛行为的塑造有明确证据:五队在现场都能"开箱即用"地提交有效结果(无一支因工程问题弃赛),而模型方差被压缩到方法差异本身——这正是 pilot 缓冲期存在的意义。若跳过 pilot 直接发正式集,现场大概率会出现提交格式错误与管线崩溃,榜单的"方法学纯净度"随之被工程噪音污染。
3.5 现场赛制的含义
单日赛制下的前排四队 QWK 差距仅 0.0046(0.9224-0.9270),这个"挤在一起"的前排本身就是结论:在极少调参时间与跨中心测试数据下,主流深度方案(ResNet 系、HoVer-Net、SE-ResNeXt 集成)的收敛水平几乎相同,胜负手落到工程细节(预训练权重选择、数据增广、集成策略),而非架构代差。唯一明显掉队的 mi2rl(0.8241)掉分原因也无关架构——是伪影与 binning 的失误模式(§5.5)。
3.6 赛后开放评测与长期定位
赛后开放阶段累计 667 个注册用户、399 次有效提交、最高 QWK 0.9331——超过现场冠军 GSK 的 0.9270,说明"时间预算充足+试错次数不受限"能再挤出约 0.006 的空间,但没能撼动"0.93 附近存在方法学天花板"的整体格局(前排四队现场已到 0.92+)。赛后新提交以 ResNet-18/ResNeXt/U-Net 为主,分类头配 cross-entropy、回归头配 MSE/Huber,与现场方法谱系高度重叠——进一步印证架构层面已无悬念。
LYSTO 的最终定位因此不是"冠军方法"而是"基准设施":数据公开、平台常驻、论文把全部方法与对照实验写透,让后来者可以随时把自己的弱监督计数模型放到同一个 12,000 patch 测试集上对齐比较。论文原话的定位是"a lightweight plug-and-play benchmark dataset"——一个轻量的即插即用基准。
3.7 评测协议细节:滑窗、聚合与口径
论文为外验与对照实验定义的评测协议有三处细节值得记录,它们决定了数字的可比性:
- 滑窗推理:外验(肺癌 ROI)上 patch 以 16 px overlap 滑窗推理——重叠推理比无重叠更稳(边界细胞不会因窗口切割而漏检),代价是计算量上升。复现外验数字时滑窗参数必须对齐,否则数字不可比。
- ROI 级聚合:把 ROI 内所有 patch 的预测聚合成 ROI 级计数后再评估。聚合方式(求和 vs 求平均)论文按"计数上报"处理,即求和语义;聚合口径是 baseline 反超现象(§6.3)的直接来源。
- 归组评估:LYON 对照实验按 bins 归组报告 sensitivity——先按真值档位分组,再看各组内"预测落在正确档"的比例。这使"0 档崩塌、高档反超"的分档结论有了统一的量化语言(§6.5-§6.6)。
对自建评测的启示:LYSTO 的协议示范了"同一模型、多口径报告"的标准姿势——patch 级(原始能力)与 ROI 级(聚合能力)分开报、按 bins 分档报(失败模式定位)、与 baseline 同表报(相对增量)。只报一个总 QWK 的评测在诊断价值上要打对折。
3.8 与同期挑战赛的任务设计对照
| 设计维度 | LYSTO | 同期典型(如 MoNuSAC 式) |
|---|---|---|
| 监督信号 | patch 级整数计数(弱监督) | 逐细胞实例掩码(全监督) |
| 输出空间 | 七档 bins(连续计数的离散化) | 逐像素类别 |
| 框架兼容 | 分类/回归/检测皆可参赛 | 事实上限定分割/检测框架 |
| 主指标 | QWK(框架无关) | Dice/AP(依赖实例输出) |
| 赛制 | pilot→3 天→现场单日 | 数月长跑 |
| 标注成本 | 每patch一个数 | 每细胞一个多边形 |
对照表的用途不是评判优劣,而是帮助"选赛道":想测形态识别能力上限,全监督实例分割赛道信息量更大;想测监督效率与部署可行性,LYSTO 式弱监督设计更贴近真实约束。两个赛道的数据与结论在库内并行存在(MoNuSAC(651) ↔ 本条目),按研究问题取用。
§4 现场赛果深度复盘:榜单之外的信息量
4.1 完整榜单
| 排名 | 队伍 | 现场 QWK | 与冠军差距 |
|---|---|---|---|
| 1 | GSK | 0.9270 | — |
| 2 | HUST | 0.9247 | −0.0023 |
| 3 | TIA Warwick | 0.9229 | −0.0041 |
| 4 | TU/e | 0.9224 | −0.0046 |
| 5 | mi2rl | 0.8241 | −0.1029 |
| 参考 | 官方 baseline | 0.6350 | −0.2920 |
榜单形状是"4+1+1":四个深度学习队挤在 0.922-0.927,一个深度学习队明显掉队(mi2rl 0.8241),传统方法 baseline 大幅落后(0.6350)。前排的密度说明方法收敛;mi2rl 与 baseline 的位置则各自贡献了独特的失败教训(本节与 §5)。
读这份榜单还要建立一个基本预期:这是单日极限赛 + 跨中心测试下的成绩,不是各队方法的"充分训练上限"。HUST 的 ResNet-101 回归在充分训练的设定下表现会更好(其外验表现部分印证了时间预算的作用);反过来,baseline 的 0.6350 是"无学习组件"的稳定下界。把榜单当"方法的相对座次"而非"方法的绝对潜力"来读,才不会过度解读 0.002 量级的差距。
4.2 68.5% 全对与 4.0% 全错:一致性的两端
论文对五队预测做了逐样本交叉一致性分析:
- 68.5% 的测试样本五队全部预测正确——集中在 0 档与 1~5 档,即"没细胞"与"个位数细胞"这两类最常见、最不依赖精细判别的情形。弱监督计数在主体分布上是已解决问题。
- 4.0% 的测试样本五队全部预测错误——论文归因主要是背景染色/伪影:DAB 信号强、肉眼易误判为阳性细胞,但实际没有或只有极少淋巴细胞;个别 patch 被模型误报多达 42 个淋巴细胞。
这个 4.0% 是 LYSTO 最有教学价值的部分:它不是长尾计数档(51~200 档)的稀缺问题,而是所有现代方法共享的系统性盲区——当"棕色"来自染色沉积而非细胞膜时,从 patch 像素推断计数的所有数据驱动方法一起失灵。数据集侧的根源就是 §2.6 说的"y=0 patch 按 brown score 选择性生成"的考点设计。
顺带修正一个常见误读:"68.5% 全对"指样本比例而非档位覆盖——前两档(0 与 1~5)占测试集 80%,其中绝大多数被五队拿分;换言之,"全对带"与"全错带"都主要发生在低计数区域,而统计样本最少的高档位(51~200 档 49 个样本)反而是分歧与正确混合的中间地带。样本量小的档位既不是最安全的也不是最危险的——危险度由伪影密度决定,而非样本量本身。
4.3 失败模式的三种典型
- 伪影误报(五队共有):强 DAB 背景被识别为细胞,0 档被判成中高计数档,QWK 二次加权下重罚。
- 保守偏置(mi2rl 突出):对无淋巴 patch 误报较大数值,叠加 binning 量化效应——模型内部预测的细粒度差异经过七档粗 bins 后部分丢失或错档,相邻档偏移在 QWK 下看似轻微,跨档偏移则致命。
- 聚合口径反转(baseline 独有):patch 级 0.6350 的 baseline 在 ROI 聚合后达到 0.8579(§6.3),提示"计数的噪声在聚合中被平均掉"——同一个模型在不同评测口径下排名可以完全不同。
4.4 赛后开放阶段的补充证据:0.9331 与 399 次提交说明了什么
赛后开放评测(667 注册 / 399 有效提交 / 最高 0.9331)常被当作附录数据,但它实际上补全了三个论证:
- 天花板高度:不限时、可反复试错的最优成绩(0.9331)只比现场单日最优(0.9270)高 0.0061。这在方法论上是个强信号——LYSTO 上的成绩差异主要由方法本身决定,而不是调参时间的函数;换个数据集这个结论不一定成立,但在这里,赛制的"极限"设计与方法的"饱和"表现互为印证。
- 方法分布的稳健性:赛后新提交以 ResNet-18/ResNeXt/U-Net 为主流骨干、CE/MSE·Huber 为主流损失(§3.6),与现场五队的配方高度重合——399 次提交相当于对这个技术路线空间做了一次更大样本的扫描,没有发现新的制高点。
- 基线的长期价值:0.93 附近的"历史线"由此成为后来者的固定参照——任何新方法(包括后来的基础模型与 Transformer 系)想主张"更强",先越过 0.9331 这条线再说。这也是数据集"plug-and-play"定位的具体体现:评测随时可复现,参照线永远在线。
§5 五队方法谱系:弱监督计数的技术路线全景
5.1 总览表
| 队伍 | 骨干 | 路线 | 关键设计 | 现场 QWK |
|---|---|---|---|---|
| GSK | ResNet-50 | 分类+回归多任务 | 两阶段迁移训练 | 0.9270 |
| HUST | ResNet-101 | 回归 | 10 折交叉验证集成 | 0.9247 |
| TIA Warwick | HoVer-Net | 分割预训练→计数 | 对小部分训练数据补做手工细胞注释;两阶段迁移 | 0.9229 |
| TU/e | SE-ResNeXt-50 | 分类 | WSI 级 32/5/6 划分;多架构独立模型集成取中位数 | 0.9224 |
| mi2rl | DenseNet121 | 分类(细粒度 bins) | 染色标准化;中位数距离损失 | 0.8241 |
| baseline | 无(手工特征) | 传统 ML | 颜色反卷积+DAB 统计+CART | 0.6350 |
读表指南:骨干预训练来源(ImageNet vs 病理库)论文未逐一记载,但五队均使用预训练权重起步——2019 年时间点上 ImageNet 预训练是默认选择。路线列的"分类/回归/分割"指最终监督形式,与骨干选择正交。现场 QWK 的四强区间(0.9224-0.9270)小于大多数数据集上同路线间的随机种子波动,比较时请看路线与纪律(§5.8),不要看名次本身。
5.2 GSK(冠军,0.9270):多任务与两阶段迁移
GSK 用 ResNet-50 同时挂分类头(bins)与回归头(连续计数),让两个监督信号互相正则;训练分两阶段——先在大规模预训练权重上适配 IHC 域,再针对 LYSTO 分布精调。其思路是"让模型同时知道这 patch 属于哪一档、具体大约多少个",档位边界处的模糊性由回归头兜底。这也是赛后开放评测中难以被显著超越的配方:赛后最高分 0.9331 与其差距仅 0.006。
为什么多任务在这里有效?bins 分类头学习的是"档位边界"这个离散结构,回归头学习的是"计数梯度"这个连续结构——两者在特征层共享,等价于让模型同时用两种归纳偏置拟合同一个分布。对处在档位边界附近的模糊样本,回归信号能提供比 one-hot 更细的梯度方向。这条经验对计数类任务的普遍启示:监督标签既可离散化又可连续化时,双头通常优于单头,代价可忽略——它是五队里唯一不需要额外数据(对比 TIA 的补标注)、不需要额外工程(对比 TU/e 的异构集成)就能实现的增强。
5.3 HUST(0.9247):回归路线与 10 折集成
HUST 直接走回归:ResNet-101 预测连续计数,10 折交叉训练后集成。回归路线省去了 bins 边界的人工设定,让数据自己决定计数梯度;10 折集成平滑了单模型的方差——在只有 3 天正式训练时间的赛制下,用集成换稳定性是性价比极高的选择。其肺癌外验掉分(0.8595,§6.2)提示回归模型对染色域变化比前三名更敏感。
掉分的一个合理解释藏在损失几何里:回归头通常以欧氏型损失(MSE/Huber)拟合绝对计数,而"绝对计数"本身是染色强度的函数——同一块组织,染色深一点、对比强一点,模型看到的"棕色面积"就不同,回归目标随之漂移。分类头(档位)对这类单调漂移的容忍度天然更高。HUST 的外验表现因此给后来者留下一条具体经验:回归路线的跨域部署前,先用小样本目标域数据做校准(calibration)再上线,这一步在现场赛里没有时间做,在真实部署里不能省。
5.4 TIA Warwick(0.9229):分割预训练的降维打击与外验冠军
TIA Warwick 的路线最有"曲线救国"意味:以 HoVer-Net(细胞实例分割网络)为骨干,但训练集只有一小部分被补做了逐细胞手工注释——他们把弱监督问题部分转化为小规模全监督预训练,再迁移到 LYSTO 计数任务。现场只拿第三,但肺癌外验跃居第一(0.9798,§6.2),说明"见过细胞长什么样"的归纳偏置带来了最强的跨器官/跨染色泛化。这是五队里对后续研究启发最大的一条路线:不需要全量标注,少量高质量实例注释做预训练即可同时提升域内与域外表现。
把他们的预算算一下更能看清性价比:为"一小部分"训练数据补做实例注释的专家成本,与全量标注相比可以忽略(几个数量级的差距),换来的却是外验第一名。对标注预算紧张、又要跨中心部署的团队,这是全条目性价比最高的一条经验——它把"弱监督 vs 全监督"的二选一问题改写成了"在哪个环节投放少量全监督"的分配问题。Lizard(238)/CoNSeP(228) 等公开实例分割数据也可以充当这种预训练底座(不必从零自标),进一步摊薄成本。
5.5 TU/e(0.9224):划分严谨性与集成纪律
TU/e 用 SE-ResNeXt-50,特别之处在数据划分纪律:按 WSI 级 32/5/6 划分训练/验证/测试,避免同一切片的相邻 patch 泄漏进不同集合(patch 级随机划分在切片流水线 200 px 步长下有严重信息泄漏风险——相邻 patch 中心区只有 32 px 间隔);再以多个不同架构的独立模型集成、预测取中位数。它的现场成绩与外验(0.9652,第三)都稳定,是"工程严谨性换稳健性"的代表。对自建数据集的使用者,TU/e 的 WSI 级划分是必须抄的作业。
补一句"为什么是中位数":多模型集成聚合时,均值对离群预测敏感(一个把伪影读成 42 个细胞的模型能把整组均值拉歪),中位数则天然抗离群——这与 §4.2 的失败模式直接对应。在"错误是重尾分布"的计数任务里,中位数集成几乎是免费的鲁棒性来源;若再配合异构骨干(不同架构犯的错不同),独立性假设更扎实。这条技巧零论文级创新、纯工程纪律,却是四强里泛化最稳的队的基本盘之一。
5.6 mi2rl(0.8241):最精细的设计与最重的摔跤
mi2rl 的技术配置在五队中最"精致":DenseNet121 + 染色标准化(试图从源头消除域偏移)+ 细粒度 bins 划分(训练用更细的档位)+ 自定义损失(惩罚预测 bins 与参考 bins 中位数的距离)。超参也有明确记载:AdamW,学习率 1e-5,权重衰减 0.05,10,200 次迭代,batch size 64。
结果是现场第五(0.8241),赛后复盘给出两个原因:其一,对无淋巴细胞的 patch 误报了较大的计数——染色标准化可能把部分真实伪影"标准化"成了看似组织的形态,恰好掉进 §2.6 的考点;其二,binning 量化效应——细粒度预测经粗 bins 归档后错位。mi2rl 案例的教训:精巧的组件堆叠不等于稳健,评测考点的先验分析(知道有强 DAB 伪影 patch)比任何单一模块都重要。
还有一个常被忽略的细节值得展开:mi2rl 是五队里唯一把"细粒度 bins"带进训练的——训练时用比七档更细的档位、推理时再归并到评测 bins。这个设计在其他任务里常是涨分项(细粒度监督提供更丰富的梯度),在这里却踩了 binning 量化效应的坑:细粒度预测在归并边界处的微小偏差,经粗 bins 放大成跨档错误,再被 QWK 的二次加权放大扣分。训练粒度与评测粒度的对齐因此成为弱监督计数的一个具体工程守则——要改粒度,评测侧必须同步重验。
5.7 baseline(0.6350):传统方法的参照系价值
官方 baseline 完全不用深度学习:颜色反卷积分离 DAB 通道 → 提取棕色统计特征 → CART 决策树回归(MATLAB 实现,剪枝参数 1800)。它把 0.6350 这条线画在所有队伍面前——深度学习增量约 0.29 QWK。但它的故事没有到此为止:肺癌外验 ROI 聚合后 baseline 达 0.8579(§6.3),反超其 patch 级成绩 0.22,成为论文里"评测口径改变结论"的最佳标本。
baseline 的存在还有一个常被低估的作用:它是数据和任务复杂度的探针。0.6350 这个数字告诉后来者——不训练任何神经网络、只靠颜色反卷积加统计特征加一棵决策树,就能在跨中心测试集上拿到显著高于随机猜测的水平(随机基线远低于此);这意味着任务的"易学成分"(染色强度统计)占了相当比重,深度模型 0.29 的增量全部来自"统计特征学不会的部分"(细胞形态、空间模式、伪影判别)。为新方法规划实验时,先跟 0.6350 比、再跟 0.93 比,两步比较各自回答"是否学到了非平凡的形态信息"与"是否推进了方法边界"两个不同问题。
5.8 谱系总论:三条路线的启示
把五队放回同一张地图:多任务(GSK)、纯回归+集成(HUST)、小样本实例分割预训练(TIA Warwick)、严格划分+异构集成(TU/e)、精细损失+染色标准化(mi2rl)。2024 年论文发表时的赛后统计显示新提交仍以 ResNet-18/ResNeXt/U-Net 为主——六年间路线没有代际更替。对实践者可提炼三句话:
- 计数任务的骨干网络已不是变量,监督信号的组织方式(多任务/回归/分割预训练)与划分纪律才是。
- 少量实例级注释的预训练(TIA Warwick 路线)是性价比最高的泛化投资。
- 任何染色归一化组件都必须用"强伪影 0 档"子集单独回归测试,否则可能复制 mi2rl 的失误模式。
把五队经验压成一张"方法选择决策表",供在不同约束下选路线的使用者快速定位:
| 你的约束/目标 | 推荐路线 | 依据 |
|---|---|---|
| 标注预算极低、想要最快可用 | 纯分类(bins 头)+ ImageNet 预训练骨干 | TU/e 路线,现场 0.9224 |
| 允许多花一倍训练成本换稳健 | 回归 + 多折集成 | HUST 路线,现场 0.9247 |
| 有少量预算能标注几百个细胞实例 | 实例分割预训练再迁移 | TIA Warwick 路线,外验第一 0.9798 |
| 想榨干最后 0.005 | 分类+回归多任务 | GSK 路线,0.9270-0.9331 |
| 测试域与训练域差异大(跨癌种/扫描仪) | 优先 TIA Warwick 式归纳偏置,慎用激进染色归一化 | §6.2 外验排名重排 |
| 无 GPU/嵌入式部署 | 传统特征管线(baseline)+ 明确告知上限 0.63-0.86 | §5.7/§6.3 |
这张表的隐含逻辑与 §5.8 三句话一致:路线选择的本质是"把标注预算花在哪"——花在 patch 级计数标签(本数据集自带的)、花在小样本实例注释(TIA 路线)、还是花在多次集成训练上(HUST/TU/e 路线),三个方向在现场赛都验证过,不存在唯一正解。
§6 外部验证与 reader study:机器 vs 医生的正面对比
6.1 肺癌外验:跨癌种、跨扫描仪的双盲测试
设计:10 例肺癌手术标本、54 个 ROI、CD8 染色、Pannoramic 1000 扫描(0.24 μm/pixel)——与训练数据(乳腺/结肠/前列腺、Pannoramic 250 Flash II)在癌种与扫描仪两个维度都有域差异,且全部五队模型与 baseline 均未在任何肺癌数据上训练或调参。评测协议:patch 以 16 px 重叠滑窗推理,ROI 级聚合计数后上报 QWK。
这组设计里有两个细节值得放大:其一,双域差异(癌种×扫描仪)同时引入,比常见的"只换癌种"外验更严格——现实部署里域偏移本来就是叠加出现的;其二,54 个 ROI、10 例的规模谈不上统计功效,论文也从未把外验当作显著性检验来写——它的价值在于方向性证据(谁掉谁稳、掉在什么档),而不是精确的排名本身。引用外验数字时保持同样的克制:0.9798 与 0.9652 之间的排序不承载统计结论,"前三名跨域稳健、后两名域依赖更重"这个粒度的解读才是数据实际支撑的。
6.2 肺癌外验结果
| 排名 | 队伍 | 肺癌外验 QWK | 对比现场 QWK |
|---|---|---|---|
| 1 | TIA Warwick | 0.9798 | 0.9229(↑) |
| 2 | GSK | 0.9680 | 0.9270(≈) |
| 3 | TU/e | 0.9652 | 0.9224(↑) |
| 4 | HUST | 0.8595 | 0.9247(↓) |
| 5 | mi2rl | 0.4678 | 0.8241(↓↓) |
| 参考 | baseline | 0.8579 | 0.6350(↑↑) |
三个看点:其一,前三名跨域几乎不掉分甚至上升——分割预训练(TIA)与多任务/集成(GSK、TU/e)学到的是对染色域稳健的特征;其二,HUST、mi2rl 的下滑幅度与其对 IHC 染色风格的特征依赖程度相符,mi2rl 的染色标准化组件在外验中未能复制现场收益;其三,这份榜单与现场榜单的顺序变化(TIA Warwick 反超登顶)本身就是数据——域内排名≠域外排名,引用 LYSTO 时必须注明口径。
给后来者的一条实操推论:如果你的模型在现场测试集上成绩不错但打算部署到新癌种,先做一次小规模目标域 sanity check(哪怕 10 例)再看上线——LYSTO 外验已经证明,现场 QWK 对目标域表现的相关性是不完全的,且相关性的强弱因方法路线而异(§5.8 的路线决策表把外验稳健性作为了一等指标)。
6.3 baseline 的 0.8579:聚合口径的陷阱标本
baseline 在外验中从 patch 级 0.6350 升到 ROI 聚合后 0.8579——超过第四名 HUST 的 0.8595 之外几乎追平(差距 0.0016),更是大幅超过其 patch 级成绩。机理:patch 级预测的随机误差在 ROI 级求和时部分相互抵消,而系统性的档位偏移被聚合稀释。坑 5 专论此事;此处只需记住一个原则:比较 LYSTO 数字时,第一句话先问"patch 级还是 ROI 级"。
6.4 LYON reader study:与四位病理医生同题竞赛
外验之外,论文做了第二个对照:在 LYON 数据(LYSTO 的前作挑战赛,441 个 ROI,带逐细胞标注,官网 lyon19.grand-challenge.org;LYSTO 测试集图像完全派生自 LYON 官方测试集)上,把 LYSTO 弱监督模型、四位病理医生(P1-P4)、一个全监督淋巴细胞检测方法(论文引文 [23])放在同一任务下比较。任务与 LYSTO 不同——这里是 ROI 级的淋巴细胞评估,按 bins 归组后报告 sensitivity(灵敏度)。
reader study 的编排本身有方法论示范意义:四位医生(P1-P4)提供"人类能力分布带"而不仅是单点参照;全监督检测法 [23] 提供"监督信号上界"参照;LYSTO 弱监督模型夹在两者之间——三方同台,才能同时回答"算法到了什么水平"与"离人类/离监督上界还有多远"两个问题。pandemic 之后大量"AI vs 医生"论文只有前一半设计,缺少 [23] 这个中间参照系,导致"打平医生"被过度解读——LYSTO 的三方对照是更诚实的模板。
6.5 Table III:全档位灵敏度
| 参评者 | All(全档位) |
|---|---|
| 病理医生 P1 | 0.41 |
| 病理医生 P2 | 0.44 |
| 病理医生 P3 | 0.37 |
| 病理医生 P4 | 0.47 |
| 医生平均 | 0.42 |
| 全监督检测法 [23] | 0.52 |
| GSK(LYSTO 冠军) | 0.55 |
| HUST | 0.53 |
| TIA Warwick | 0.48 |
| TU/e | 0.42 |
| mi2rl | 0.27 |
核心读数:LYSTO 弱监督冠军(0.55)超过全监督检测法(0.52)与全部四位医生(0.37-0.47)。这是论文标题级结论——"弱监督计数 ≈ 全监督检测"在此得到最直接的数值支撑:patch 级"数数"这一廉价监督信号,喂给 CNN 后在 ROI 级评估上不输给昂贵的逐细胞标注训练出的检测器。
读这列数字还有个容易错过的细节:医生内部的分布(0.37-0.47)比算法内部的分布(0.27-0.55)更窄——人与人的水平差小于模型与模型的水平差,且四位医生的平均(0.42)恰与 TU/e 打平。这提示在这个任务上,"达到医生水平"对不同质量的模型是宽谱而非单点:弱模型(mi2rl 0.27)远不及医生,强模型(GSK 0.55)显著超过医生,"AI≈医生"的笼统说法在这个数据上没有信息量,必须落到具体模型。
6.6 0 bin 现象:人机能力边界的精确刻画
按 bins 拆开后出现戏剧性反转:0 计数档(确认无淋巴细胞)医生平均 sensitivity 0.87,而算法只有 0.04-0.36——机器在这一个档位上被医生碾压。结合 §2.6/§4.2 的考点设计,图景完全清晰:
把 0 档的 0.87 vs 0.04-0.36 换个方式理解:医生看到"棕色一片但没有淋巴细胞形态"时,动用的是低倍视野下的组织结构知识(这是基质、是坏死、是沉积——不是细胞);而 patch 级模型的输入里根本没有"低倍视野"这个信息层级,它在高倍像素里做的判断天然缺乏语境锚点。这不是"模型不够大"能解决的,而是信息层级缺失——除非把 WSI 级上下文喂进来(多尺度输入),否则 0 档的天花板就钉在那里。这解释了为什么五队的 0 档表现与其架构先进性几乎无关。
- 0 档的难点不是"看不见细胞",而是"把 DAB 伪影识别为不是细胞"——这需要整体组织学语境判断,恰是 patch 级弱监督模型的输入粒度所缺的。
- 高计数档算法反超医生:人眼对几十个重叠小细胞核的精确计数有生理上限,而模型可以稳定地数到 50+。
- 医生与算法的互补性由此明确:低档信医生、高档信机器、0 档伪影问题是弱监督范式的未解难题。
对这组数字还应加一句方法学评注:医生组(n=4)与算法组的样本都小,0 档结论的置信区间宽,但其方向性与 §4.2 的"五队全错"证据完全一致——两处独立证据指向同一失败结构,结论的稳健性来自证据三角而非单点数字。
6.7 论文的两大结论
- 弱监督计数的性能可以达到全监督检测的水平——监督信号从"每个细胞一个掩码"降到"每个 patch 一个整数",性能未见显著损失,标注成本下降若干量级。
- 算法与病理医生的能力分布互补——算法在高计数灵敏度上高于医生,但在 0 档伪影识别上远逊于人;理想系统是"模型先数、医生复核 0 档与极端档"的人机分工。
6.8 对临床落地的三个推论
把 §6 的两组实验(肺癌外验 + LYON reader study)合起来看,可以推出三条对工程与临床都有操作意义的结论:
- 弱监督计数管线可以进入临床前置环节,但不能终审。 "模型数、医生看"的分工有了量化依据:模型承担高计数档(人眼不准)与批量筛查(成本低),医生把守 0 档与极端档(机器不灵)。这与病理 AI 其他任务上"AI 预筛+人终审"的行业惯例互相印证,且 LYSTO 给出了分档的、可核验的证据。
- 跨癌种部署前必须重测,且要按档位重测。 外验排名重排(TIA Warwick 登顶、mi2rl 崩盘)说明域内成绩对部署决策几乎没有预测力;而崩塌集中在特定档位(0 档)说明总体 QWK/灵敏度掩盖了失败模式的定位。部署前的验收协议应当直接借用 §3.7 的多口径报告框架。
- 伪影鲁棒性是 IHC 定量产品的差异化卖点。 五队集体在 0 档翻车意味着"全对"不稀奇,"伪影识别"才稀缺——这恰好是产品化时最值得投入的改进方向(多尺度上下文、WSI 级一致性校验、伪影检测前置模块),也是 LYSTO 留给后续研究最大的未解空间。
§7 获取与许可:直链、文件清单与双口径许可
7.1 Zenodo 主记录与文件清单
数据入口:**https://zenodo.org/records/3513571**(DOI 10.5281/zenodo.3513571,Version 1.0)。三个文件,合计 8.6 GB,全部公开直链下载:
| 文件 | 大小 | MD5 |
|---|---|---|
| training.h5 | 5.4 GB | 7273788230d17ba1a6b809f99c92c2ba |
| test.h5 | 3.2 GB | 1ca9057575e01486909dbc7a2a917448 |
| training_labels.csv | 620.1 kB | 24a9854eda8144c87d4293174a81a77d |
MD5 齐全(Zenodo 记录页提供),下载后务必校验——5.4 GB 级别的 HDF5 传输中断后常见静默损坏。另有训练集的单独 Zenodo 记录 3473558(概念 DOI 10.5281/zenodo.3473557),与主记录内容部分重叠,引用时以主记录 3513571 为准。
工程侧的两条实操建议:其一,Zenodo 对大文件支持断点续传,但部分网络环境下 wget -c 中途重启后仍需全量 MD5 复验,校验通过前不要开始任何下游处理;其二,8.6 GB 解压后即用即可(HDF5 原生随机读取),无需转换为中间格式——常见的"先转 PNG/npy 再训练"会引入编码损失与对齐错误的风险,收益为零,保持 HDF5 原样读取并用内存映射(h5py 默认行为)是最短路径。
7.2 官网现状
官网 https://lysto.grand-challenge.org/ 仍在线,已转型为 Educational Challenge(教学挑战),保留赛事介绍与方法说明;原自动评测平台已关闭(/evaluation/ 子页 404,2026-09-26 实核,坑 3)。也就是说:数据可用、排行榜不复可写——想对标 0.9331 的历史最高分只能自行复现评测(12,000 个测试 patch 的标签是否公开需以实际数据为准,论文未明确记载测试标签发布)。
“数据可用、排行榜关闭"的组合决定了 LYSTO 的现实使用模式:它是一个离线基准而非在线竞技场。使用者自己下载、自己评、自己报告,论文引用时对标的是历史数字。这个模式的好处是零门槛零等待,代价是失去了官方评测的口径统一性——这也让附录 F 的报告模板(对齐论文协议的自报规范)从"建议"升级为"必要”。
7.3 License 双口径:本条目最重要的合规提示
两个官方渠道给出的许可不一致:
| 渠道 | 许可声明 | 含义 |
|---|---|---|
| Zenodo 记录 3513571 元数据 | CC BY 4.0 | 可商用,需署名 |
| 官网挑战页声明 | CC BY-NC 4.0 | 禁止商用,需署名 |
本条目按双口径并存呈现(数据记录侧与挑战赛运营侧的口径未对齐,可能是发布流程不同步所致)。操作建议:
- 学术使用:按更严格的 CC BY-NC 4.0 自律即可覆盖两种口径,署名引用论文与数据集。
- 商业使用:必须先向 Radboudumc 计算病理组书面核实授权口径,取得书面许可前按 CC BY-NC 4.0 对待。
- 再分发:无论哪种口径,保留署名(Ciompi/Jiao/van der Laak 与 Radboudumc)与许可声明是共同义务。
给法务/合规同事的三分钟检查法:打开 Zenodo 记录页,截图许可字段(CC BY 4.0);打开官网挑战页,截图许可声明(CC BY-NC 4.0);两图并排存档,附一句"两官方口径不一致,按较严者执行,已向版权方发函确认,函件见附件"。这套动作五分钟完成,能把"我们以为可以商用"变成"我们有据可查的处理过程"——区别在审计时的责任归属。
7.4 格式与读取
HDF5 格式,Python 下用 h5py 或 PyTables 读取。文件内组织(patch 数组 + 标签数组)的基本读取骨架见附录 E。三个使用前的自检动作:f.keys() 看字段、f['x'].shape 对齐论文口径(train 20,000 / test 12,000)、抽 3 个 patch 目测 DAB 通道确认染色方向——test.h5 字段结构无官方文档(坑 7),一切以实际读取为准。
7.5 再分发与衍生数据集的许可建议
以 LYSTO 为底座做衍生数据集(重标注、子集筛选、与其他数据混合)时,许可链会进一步复杂化,建议遵循四条:
- 口径从严:在双口径未决(§7.3)的前提下,衍生品的对外许可不得宽于 CC BY-NC 4.0——即使你倾向于按 CC BY 4.0 理解原始授权。
- 署名链完整:衍生品说明中同时保留数据 DOI(10.5281/zenodo.3513571)、论文 DOI(10.1109/JBHI.2023.3327489)与"CC BY-NC 4.0(官网口径)/CC BY 4.0(Zenodo 口径),以版权方最终确认为准"的原文引用,不转述、不改写许可文本。
- 混合数据的传导:与 H&E 数据集(如库内 BCSS(258)、Lizard(238))混合构建多染色数据集时,整体许可按最严格成员收紧,且需在数据卡片中逐成分列明来源与许可。
- 商标与名称:衍生品命名避免直接占用 “LYSTO” 名称(如"LYSTO-Plus"),改用"基于 LYSTO(Zenodo 3513571)的衍生集"式描述,防止与官方渠道混淆。
7.6 常见下载与读取故障排查
| 症状 | 最可能原因 | 处置 |
|---|---|---|
| MD5 校验失败 | 传输中断/重试后文件损坏 | 删除重下;确认使用 Zenodo 直链而非第三方镜像(A7) |
OSError: Unable to open file |
HDF5 文件截断或版本问题 | 先做 MD5;h5py 升级到较新版本再试 |
KeyError 读取字段 |
按想象写字段名(坑 7) | f.keys() 先看实际结构,别照抄网上代码 |
| patch 数对不上 20,000/12,000 | 误把 pilot 记录当正式集 | 确认下载自 3513571 主记录而非 3473558 |
| 标签分布与 Table I 对不上 | 混用训练/测试标签文件 | training_labels.csv 只对应 training.h5 |
| 密度换算与文献对不齐 | 用了 299 px 全面积(§2.4) | 改用中心 267×267 px ≈ 0.41 mm² 有效面积 |
| DAB 方向反了(阳性显蓝) | 通道顺序假设错误 | 抽样目测核对染色方向,勿依赖固定通道约定 |
这张表覆盖的是"开工第一天"级别的故障;更深层的数据质量问题(如个别 ROI 边界伪影)属于正常研究范畴,不在此列。
§8 LYSTO 的生态位与影响
8.1 在病理 AI 挑战赛谱系中的位置
MICCAI 2019 前后是病理挑战赛的爆发期,但几乎全部赛道是分割/分类/检测的全监督任务。LYSTO 的差异化在于三点:任务上是弱监督计数(同一信号服务多种框架);赛制上是单日现场赛(模拟真实快速建模);数据上是 IHC 染色(绝大多数同期挑战赛用 H&E)。其前作 LYON(2019,441 ROIs,逐细胞标注)与它构成"全监督版→弱监督版"的镜像对照,测试集图像完全同源,这让两赛结果可以直接对话。
把 LYSTO 放进同期赛事的三维坐标系里看得更清楚:监督粒度维(全监督→弱监督)、染色维(H&E→IHC)、赛制维(数月长跑→单日现场)。同时期库内的对照条目在三个维度上几乎都是"标准侧"——MoNuSAC(651) 是全监督+H&E+长跑,CAMELYON16-17(33) 是全监督+H&E+长跑——LYSTO 在三个维度上全部选了非标准侧。三个非标准选择的组合不是标新立异:IHC 决定了它是"测 T 细胞"而非"测细胞核"的唯一直接数据源,弱监督决定了它的标注成本可控可公开,单日赛制决定了它能在 MICCAI 现场完成整个赛事闭环。约束驱动的差异化——这是 LYSTO 在赛事设计层面比其技术结果更值得记录的一课。
8.2 组织方与资助
主导团队是 Radboudumc 计算病理组(Francesco Ciompi / Wenhua Jiao / Jeroen van der Laak)——该组同时是 CAMELYON 系列、LYON、PANDA 等里程碑挑战赛/数据集的推手,LYSTO 是其"从全监督到弱监督"方法学叙事的一环。资助方:EU Horizon 2020 项目 #825292(ExaMode)与 Dutch Cancer Society(KUN 2014-7032);算力由 NVIDIA 赞助 DGX-1。参赛端五队来自工业界(GSK)与多国高校(HUST、Warwick、TU/e、mi2rl),论文 21 位作者横跨全部参与机构——挑战赛报告的"数据+方法+验证"三合一写法也是后续赛事论文的模板之一。
组织结构上有个值得注意的分工:Radboudumc 承担数据与赛事运营,五支参赛队独立建模,而论文作者表把双方全部纳入——这意味着每支队伍的方法描述都出自队员本人之手,方法细节(如 mi2rl 的超参、TIA 的补标注流程)的可信度高于赛后采访式的二手转述。这也是"挑战赛报告型论文"相对普通 benchmark 论文的结构优势:方法部分天然多作者共笔,数据与结论则由组织方统一把关。
8.3 论文与长期影响
论文 2023 年 1 月挂 arXiv(2301.06304),2023 年 10 月被 IEEE JBHI 接收,2024 年 3 月正式刊出(vol.28 no.3, pp.1161-1172, doi:10.1109/JBHI.2023.3327489)。摘要明确定位:“LYSTO has supported a number of research in lymphocyte assessment in oncology”——数据集作为肿瘤学淋巴细胞评估研究的公共基准持续被使用;官网按"long-lasting educational challenge"维护。对 2020 年代中后期兴起的 TIL 自动评分、免疫微环境基础模型评测,LYSTO 提供的是可复算的 patch 级计数基线:任何新方法都可以在 12,000 个测试 patch 上与 0.93 这条历史线对齐。
"赛毕三年半才见刊"的时间线也值得说一句:从 2019 深圳现场赛到 2024 年 3 月正式刊出,中间隔了预印本(2023-01)与近一年的 JBHI 审稿周期——但数据在赛后即已公开(Zenodo 2019-10-04),论文的延迟并没有延迟基准的可用性。这与"先挂 arXiv 圈地、数据遥遥无期"的常见模式相反,是数据集论文出版节奏的正面案例。
8.6 局限与批评视角
以本条目"存照"的立场,LYSTO 的局限至少有四条应当摆在明面上:
- 规模止步于基准而非语料:83 张 WSI、36,000 patch、单一国家(荷兰)单一扫描仪品牌——支撑方法对照绰绰有余,支撑大规模预训练或跨大洲泛化结论则不够。
- 患者级信息整体缺失:患者数未披露意味着所有"患者级泛化"的主张都只能间接推断,这在今天的数据规范下会被视为披露不完整(尽管以 2019 年标准并不罕见)。
- 评测平台的生命周期管理:许可证双口径未收口、评测页与 GitHub 双双失管(坑 2/坑 3),"long-lasting"的愿景部分依赖第三方复现热情。
- 任务形式的边界:patch 级计数对"空间分布模式"(如免疫浸润的空间异质性、三级淋巴结构识别)零覆盖——这些正是 2020 年代 TIL 研究的前沿方向,LYSTO 的标签形式天然无法承载。
四条局限里,前三条是"运营与披露"层面的,会随时间被公开讨论消化;第四条是任务设计的本质边界,使用者应在立项阶段就对照自己的研究问题确认 LYSTO 是否适配——不适配时的替代路径见 §9.3 谱系表。
8.7 数据合规与伦理要点
就条目使用者关心的合规问题汇总论文与数据记录的披露:数据为去标识化的病理切片衍生 patch,不携带患者身份信息;患者级人口统计未披露(§2.7),因此数据集本身不构成可识别个人健康信息的直接来源;原始切片的采集与使用应被视为已在荷兰多中心研究框架下完成伦理审批(组织方为 Radboudumc),但二次使用者的本机构伦理审查不能豁免——使用 LYSTO 发表论文时,数据来源与许可声明的写法按 §7.5 执行,涉及人类数据的使用声明(ethics statement)按目标期刊模板填写,引用数据 DOI 与论文 DOI 双源即可满足绝大多数期刊的数据可得性要求。
8.4 引用口径建议
- 引数据集:Zenodo DOI 10.5281/zenodo.3513571 + 论文 DOI 10.1109/JBHI.2023.3327489。
- 引赛果:注明"现场赛(MICCAI 2019 深圳)“或"赛后开放评测”,两者最高分不同(0.9270 vs 0.9331)。
- 引性能结论:注明 patch 级还是 ROI/外验口径(坑 5)。
- 引名称:官方全称 Lymphocyte Assessment Hackathon(坑 1)。
8.5 与 TIL 临床评分实践的关系
LYSTO 的 patch 级计数与临床上的 TIL 评分(如乳腺癌国际 TIL 工作组的 stromal TIL 百分比评分)不是同一口径,但存在清晰的互补链路:临床 TIL 评分以"基质区淋巴细胞面积占比"为对象、在 H&E 上由病理医生目测分级;LYSTO 以"IHC 特异性标记的 T 细胞绝对计数"为对象、由算法在 patch 级输出。两者的换算桥梁正是 §2.4 的有效面积(0.41 mm²)与密度换算——patch 计数 ÷ 0.41 mm² 得到密度,密度在 ROI 级聚合后可与面积占比类评分建立经验映射。
LYSTO 在这条链路上的独特贡献是把"算法计数的可靠性上限"用可复算的数字钉住了:跨癌种外验 0.97(最好的队)、0 档伪影灵敏度 0.04-0.36(所有队)——任何想把自动 TIL 定量推进临床工作流的团队,都应当先对照这两个数字设计自己的验收边界,而不是从零摸索。这也是挑战赛数据对临床方法学的标准贡献方式:不直接给出答案,而是把"什么可行、什么不可行"的边界用公开数字标出来。
§9 与库内条目的关系
9.1 同域图谱:LYSTO 在千方病案医数集病理图像家族中的位置
库内病理图像/细胞核条目构成一条"标注粒度谱系",LYSTO 处于最粗粒度端(patch 级整数计数),其余成员多为实例级或像素级。先给一句话总览:同一个淋巴细胞/细胞核对象,库内已有"逐实例画出来"(实例分割五条目)与"逐区域分类型"(BCSS 区域级)的标注,LYSTO 补上了"逐 patch 数出来"这一最廉价的形态——三种形态各对应一类下游任务与一类标注预算。
- MoNuSeg(rid 30):30 张 H&E 划窗图的细胞核实例分割基准——LYSTO 的"细粒度对照组":同一类对象(淋巴细胞/细胞核),一个逐实例掩码、一个 patch 级计数,监督成本与信息量相差一个数量级。
- MoNuSAC(rid 651):MoNuSeg 的多器官、四细胞类型升级版挑战赛——与 LYSTO 同为 Grand Challenge 生态的 MICCAI 挑战赛,但走实例分类分割路线;两者对照可回答"计数够用时是否还需要分型"。
- PanNuke(rid 218):半合成泛癌核实例数据集——同为"低成本监督"路线(半自动生成 vs 弱监督点数),PanNuke 用合成降成本,LYSTO 用粗粒度降成本,两条省标注的路径值得并读。
- Lizard(rid 238):多机构多染色细胞实例分割大集合(含 CoNSeP 等六子集)——实例级"大全景",其子集与 LYSTO 的结肠癌部分在癌种上重叠,可做跨粒度迁移实验。
- CoNSeP(rid 228):结肠 H&E 逐核实例经典集——LYSTO 结肠切片(CD3/CD8 IHC)的 H&E 对位数据,染色范式完全不同。
- NuCLS(rid 248):胸部淋巴结多机构多专家核标注——在"标注一致性"维度与 LYSTO 的 reader study 结论互证:专家间一致性有限时,粗粒度标签反而更稳。
- BCSS(rid 258):乳腺癌区域级+像素级分割——乳腺癌条线上的像素级参照;LYSTO 乳腺癌切片的 TIL 计数可与 BCSS 的肿瘤区分割组成"区域+浸润"两段式流水线。
- PuMA(rid 641):泌尿道/前列腺方向的数据集——与 LYSTO 的前列腺切片同癌种,可对照 IHC 计数与 H&E 形态分析在同一器官上的互补。
- CAMELYON16-17(rid 33):淋巴结转移检测里程碑(同出 Radboudumc/WASD 生态)——LYSTO 组织方的"前传",同样以荷兰多中心 WSI 为底座。
家族之外的文字互链:LYON(lyon19.grand-challenge.org,441 ROIs)是 LYSTO 的前作与测试集图像来源,库内暂无条目(psql 实核),正文以文字链接呈现、不做 rid 硬链。
9.2 检索路径建议
- 从"细胞核实例分割"进来(MoNuSeg/MoNuSAC/Lizard)→ 读 §1 Q2/Q3 看 LYSTO 的监督粒度差异 → 决定任务到底需要实例还是计数。
- 从"多器官泛化"进来(PanNuke/NuCLS)→ 直奔 §6 外验——LYSTO 是库内少数自带跨癌种外验结论的条目。
- 从"乳腺癌"进来(BCSS)→ §9.1 的两段式流水线组合;从"前列腺"进来(PuMA)→ 同理。
- 从"挑战赛方法论"进来(本条目 + MoNuSAC + PANDA 系)→ §3.4 三阶段时间线与 §3.5 现场赛制是可复制的赛事设计素材。
路径之外的通用建议:库内互链条目与本条目的数据形态差异较大(H&E 实例 vs IHC 计数),跨条目迁移实验(如用 Lizard(238) 实例预训练再在 LYSTO 上计数)是可行的,但要写清楚两边的染色、扫描与划分差异——这正是 LYSTO 外验方法论(§3.7 多口径报告)在库内生态的自然延伸。
9.3 库内标注粒度谱系表
把 §9.1 的互链成员按"监督粒度 × 染色范式"排成一张谱系表,LYSTO 的生态位一目了然:
| 条目(rid) | 监督粒度 | 染色 | 规模量级 | 与 LYSTO 的关系 |
|---|---|---|---|---|
| LYSTO(本条目) | patch 级计数 | CD3/CD8 IHC | 36,000 patch | — |
| MoNuSeg(30) | 核实例掩码 | H&E | 30 划窗 | 同对象、细粒度对照 |
| MoNuSAC(651) | 核实例+四型分类 | H&E | 多器官多中心 | 同平台挑战赛、实例分型路线 |
| PanNuke(218) | 核实例(半合成) | H&E | 泛癌 20 万+核 | 另一条低成本标注路径 |
| Lizard(238) | 核实例(六子集) | H&E | 50 万+核 | 实例级大全景、结肠重叠 |
| CoNSeP(228) | 核实例 | H&E | 结肠 38 张 | 结肠 H&E 对位 |
| NuCLS(248) | 核实例(多专家) | H&E | 淋巴结 200+张 | 标注一致性研究对位 |
| BCSS(258) | 区域+像素级 | H&E | 乳腺癌大集合 | 乳腺条线、区域级参照 |
| PuMA(641) | 组织学定量 | H&E | 泌尿道/前列腺 | 前列腺同癌种对位 |
| CAMELYON16-17(33) | 转移灶级 | H&E | 淋巴结 399 张 | 同组织方"前传"生态 |
读表要点:库内除 LYSTO 外全部是 H&E 与实例/区域级标注——LYSTO 是唯一的 IHC 特异性染色条目与唯一的"计数即标签"条目,两个"唯一"决定了它在家族里不可替代的位置:要学细胞形态去 H&E 系,要测 T 细胞丰度只能来这里。
§10 避坑清单:八个高发错误
坑 1:把 LYSTO 的名字写成 “Lymphocyte Subtyping challenge”。 这是传播中最常见的错引(任务描述库也有同样笔误)。官方全称是 LYmphocyte aSsessmenT hackathOn——“评估 hackathon”,不是"亚型挑战赛";论文标题为 “LYSTO: The Lymphocyte Assessment Hackathon and Benchmark Dataset”。按错误名检索会漏掉全部官方文献与数据记录;写论文、建数据卡片时以官网 + 论文标题为准。LYSTO 也不做淋巴细胞亚型分型(CD3/CD8 是染色标记物选择,不是任务输出)。
坑 2:忽略 License 双口径直接商用。 Zenodo 记录写 CC BY 4.0,官网挑战页写 CC BY-NC 4.0,两个官方口径并存未对齐(§7.3)。只看 Zenodo 元数据就授权商用是真实存在的合规风险;任何商业计划先向 Radboudumc 书面核实,再决定是否需要另行许可。学术使用按 NC 自律最稳。
坑 3:找官方 GitHub 仓库与已下线的评测页。 GitHub 组织 LystoChallenge 已 404(2026-09-26 实核),官网 /evaluation/ 子页同样 404,评测平台关闭。参赛代码没有公开 repo——追方法细节请走论文(arXiv 2301.06304 / IEEE JBHI)与各队原文;想跑评测请自行实现 QWK 脚本 + 测试集(若含标签)。不要在 README 里留指向已死链接的"官方代码"。
坑 4:把 >200 档当真实档位设计实验。 七档 bins 里 >200 档训练/测试集都是 0 样本,全集最高计数 77(§2.5)。任何"按 7 类做分类"的输出层会包含一个永远学不到的类;按 bin 分档报告性能时 >200 档无统计意义。正确做法:按 6 档建模或合并尾部档位,并在论文里说明与 LYSTO 原始 bins 的映射关系。
坑 5:混用 patch 级与 ROI 级口径引用成绩。 baseline 的现场 patch 级 QWK 是 0.6350,肺癌外验 ROI 聚合后是 0.8579——同一个"模型成绩"相差 0.22;TIA Warwick 现场 0.9229、外验 0.9798 登顶,反超现场冠军 GSK(§6.2-§6.3)。引用 LYSTO 数字时必须三件事说清:哪个集合(现场测试/肺癌外验/LYON)、哪个口径(patch/ROI)、哪个阶段(现场/赛后开放)。只写"LYSTO 上 0.93+"是不合格引用。
坑 6:把强 DAB 伪影 patch 当噪声清洗掉。 y=0 patch 是按 brown score 选择性生成的"考点"(§2.6),不是数据缺陷;五队全错的 4.0% 样本、算法 0 bin 灵敏度 0.04-0.36 的惨状(§6.6)都源于此。把它过滤掉再训练,模型成绩会虚高而在真实 IHC 数据上原形毕露;正确用法是保留并在误差分析中单独报告 0 档灵敏度。反过来,做数据清洗教程时它倒是绝佳的"域内伪影"教学样本。
坑 7:假设 HDF5 字段结构有官方文档。 论文没有细述 test.h5 内部字段(训练集的癌症类型也只是"可选元数据"级别描述,坑 7 与 §2.7)。直接按想象写字段名会 KeyError。开工三步:h5py.File(...).keys() 先看结构;shape 对齐 20,000/12,000 口径;抽样可视化确认 patch-标签对应。别把 299×299 全 patch 面积当计数有效面积——标签定义在中心 267×267 px(≈0.41 mm²),换算密度用错面积会系统性偏差约两成(§2.4)。
坑 8:把 LYON 和 LYSTO 当同一个比赛。 两者是同一团队的"前作/正作":LYON(2019,441 ROIs,逐细胞全监督检测/分割计数)在前,LYSTO(2019 现场赛,patch 级弱监督)在后,且 LYSTO 测试集图像完全派生自 LYON 官方测试集(§6.4)。混引的典型事故:把 LYON 的 sensitivity 数字标成"LYSTO 结果",或宣称"LYSTO 数据有逐细胞标注"(那是 LYON)。两赛任务不同、指标不同(LYSTO 主指标 QWK、LYON 对照用 sensitivity),引用前先问自己用的是哪个数据集。
十秒自检(写完引用/文档后过一遍):①名称是 Assessment 不是 Subtyping?②许可写了双口径?③没引已死的 GitHub/评测链接?④bins 只报六档?⑤成绩注明 patch/ROI 口径?⑥保留 0 档伪影样本?⑦H5 字段先 keys 后使用?⑧LYON/LYSTO 数字没对调?八问全过再交付。
常见误解速查
| 误解 | 事实 |
|---|---|
| “LYSTO 是淋巴细胞亚型分型挑战赛” | 名称与任务都不对:全称 Lymphocyte Assessment Hackathon,任务是计数评估,不做分型(坑 1) |
| “数据是 CC BY 4.0,可以随便商用” | Zenodo 口径如此,但官网口径 CC BY-NC 4.0,双口径未决,商用前须核实(坑 2) |
| “官方代码在 GitHub 上” | LystoChallenge 组织 404,参赛代码无公开仓库,方法细节看论文(坑 3) |
| “七档 bins 都是有效档位” | >200 档 0 样本,全集最高计数 77,实际六档(坑 4) |
| “LYSTO 冠军就是最强淋巴细胞模型” | 现场冠军是 patch 级域内冠军;外验口径 TIA Warwick 登顶,口径变了排名就变(坑 5) |
| “0 计数 patch 是数据噪声,应该清洗” | 恰是考点设计(brown score 选择性生成),清洗后成绩虚高、上线翻车(坑 6) |
| “LYSTO 数据里有逐细胞标注” | 没有——那是前作 LYON;LYSTO 只有 patch 级计数(坑 8) |
| “patch 计数就是整个 patch 里的细胞数” | 标签只覆盖中心 267×267 px(0.41 mm²),边缘 4 μm 是忽略带(§2.4) |
| “比赛比的是谁的算力强” | 单日现场赛 + 无算力/数据限制的 open 设定,比的是方法稳健性(§3.5) |
| “弱监督 = 精度必然打折” | 弱监督冠军灵敏度 0.55 超过全监督检测 0.52 与全部四位医生(§6.5) |
§11 总结
三句话总结:
- LYSTO 用"每个 patch 数个数"的廉价监督信号,把淋巴细胞计数做到了与全监督检测相当的水平(弱监督冠军 0.55 vs 全监督检测 0.52 vs 医生最好 0.47,全档位灵敏度)。
- 它同时是一份诚实的失败地图:算法在 0 计数档被医生碾压(0.04-0.36 vs 0.87),强 DAB 伪影让五队集体翻车——弱监督范式的能力边界被精确画了出来。
- 数据(8.6 GB HDF5)与论文全部公开可复算,但许可双口径未对齐、官方代码与评测页已下线——用之前先读 §7 与坑 2/坑 3。
适合谁:
- 要在 IHC 病理图像上做 TIL/淋巴细胞自动定量、且标注预算有限的团队——这是现成的弱监督基准与 0.93 基线。
- 研究弱监督/粗粒度监督信号设计的方法学者——"计数即标签"的任务形式与 bins+QWK 的评测框架可直接借用。
- 设计挑战赛的组织者——三阶段发布节奏、单日现场赛制、双外部验证(跨癌种+reader study)是完整的方法学模板。
- 教学场景——官网 Educational Challenge 定位明确,0 档伪影失败案例是极好的课堂素材。
- 基础模型评测者——把 LYSTO 当弱监督迁移测试台,验证病理预训练权重在 IHC 计数上的迁移成色(§3.6/§8.3)。
- 数据工程与合规教学者——License 双口径、平台生命周期、元数据披露三件套都是现成的反面与正面教材(§7/§8.6)。
不适合谁:
- 需要单细胞实例掩码(分割/形态学/分型)的任务——LYSTO 只有 patch 级整数,请转 MoNuSeg(30)/MoNuSAC(651)/Lizard(238)。
- 需要患者级信息、生存终点或人口统计的队列研究——患者数未披露,标签止步于 patch 计数。
- 任何未经许可核实的商业用途——CC BY 4.0 与 CC BY-NC 4.0 双口径未决(坑 2)。
- 追求 H&E 大规模预训练语料的工作——83 张 WSI、36,000 个 patch 的体量是基准不是语料库。
30 秒决策卡:
| 你的处境 | 建议 |
|---|---|
| 做 IHC 淋巴细胞计数模型 | 直接用:train 20,000 训练,test 12,000 对标 QWK 0.93 线,按 6 档建模(坑 4),保留 0 档伪影(坑 6) |
| 做跨域泛化研究 | 用外验协议复现:肺癌式跨癌种+跨扫描仪测试,报告 patch/ROI 两个口径(坑 5) |
| 做"机器 vs 医生"对照研究 | 复用 §6 框架:分档 sensitivity + 0 档专项,预期结论方向已明 |
| 需要实例级标注 | 换条目:MoNuSAC(651)/Lizard(238)/CoNSeP(228) |
| 需要商用授权 | 先核实许可(坑 2),书面确认前不动 |
| 快速验证管线 | pilot 4,000 patch 起步(记录 3473558),h5py 三步自检(坑 7) |
决策卡的用法说明:第一列是你的处境约束(不是研究目标),第二列是约束下的默认动作——如果你的处境同时命中两行(例如"跨域泛化研究+需实例级标注"),以更刚性的约束(许可/数据形态)优先,研究目标可迁移到更合适的条目(§9.1)。任何一行指向"换条目"的,都不建议在 LYSTO 上勉强变通:patch 级计数标签补不出实例信息,这是监督信号的本质边界,不是方法问题。
FAQ:高频问题分组解答
A 组:数据获取
A1:数据在哪里下载?需要注册吗?
Zenodo 记录 3513571(DOI 10.5281/zenodo.3513571)公开直链,无需注册即可下载三个文件(training.h5 / test.h5 / training_labels.csv,合计 8.6 GB)。训练集另有独立记录 3473558(概念 DOI 10.5281/zenodo.3473557)。
A2:官网还能提交模型拿官方评分吗?
不能。原自动评测平台已关闭(/evaluation/ 子页 404,2026-09-26 实核),官网转型为 Educational Challenge。历史最高分 0.9331(赛后开放阶段)可作对标线,但需要自行复现评测流程。
A3:下载后怎么确认文件完整?
对照 Zenodo 页面 MD5:training.h5 = 7273788230d17ba1a6b809f99c92c2ba,test.h5 = 1ca9057575e01486909dbc7a2a917448,training_labels.csv = 24a9854eda8144c87d4293174a81a77d(§7.1)。HDF5 大文件传输中断后的静默损坏不罕见,校验是必做动作。
A4:商用需要走什么流程?
先按坑 2 核实:Zenodo 口径 CC BY 4.0、官网口径 CC BY-NC 4.0 未对齐。向 Radboudumc 计算病理组书面询问授权口径,取得明确书面答复前按 CC BY-NC 4.0(禁商用)对待。
A5:数据集多久更新一次?有 Version 2 的计划吗?
截至本条目抓取时点(2026-09-26),Zenodo 主记录停在 Version 1.0(2019-10-04),无后续版本迭代的公开计划;官网的活跃形态是 Educational Challenge。按"静态基准"规划长期使用即可,不要假设会有官方补丁。
A6:引用时数据 DOI 和论文 DOI 用哪个?
都引:数据 DOI(10.5281/zenodo.3513571)支撑数据可用性声明,论文 DOI(10.1109/JBHI.2023.3327489)支撑方法与结论引用。只引其一在审稿中都可能被要求补充。
A7:数据集有官方的镜像或平台托管版本吗?
以 Zenodo 记录为唯一官方分发渠道;任何第三方平台的"LYSTO 镜像"(网盘、论坛附件)都不具备 MD5 可验性与许可文本完整性,不建议使用。grand-challenge.org 的挑战页是赛事信息的官方源,但不直接分发数据文件。
B8:元数据不完整(无患者信息、无逐张染色表)会不会让论文无法发表?
取决于期刊要求的数据披露粒度。LYSTO 自身论文(JBHI 2024)就是按现有披露水平发表的;使用者的论文里如需患者级信息,只能在 limitations 中如实声明"数据集不含患者级元数据"——把它写成数据集的已知边界,而不是自己研究的疏漏,审稿人对此类边界通常接受度良好(前提是你没有假装做过患者级划分)。
B 组:数据内容与格式
B1:数据是 H&E 染色吗?
不是。LYSTO 全部是免疫组化(IHC):每张切片用 CD3(全 T 细胞)或 CD8(细胞毒性 T 细胞)膜染色。这也是它区别于库内多数 H&E 条目(如 MoNuSeg(30)、Lizard(238))的核心特征。
B2:一个 patch 的"标签"到底覆盖多大区域?
patch 是 299×299 px,但计数标签只统计中心 267×267 px(≈64 μm × 64 μm ≈ 0.41 mm²)区域,边缘 4 μm 是忽略带(§2.4)。换算细胞密度(个/mm²)时用 0.41 mm²,不是 patch 全面积。
B3:每张切片用哪种染色、哪个患者?
逐张的 CD3/CD8 分配表论文未提供;患者级信息(人口统计、编号映射)未披露。训练集提供癌症类型作为可选元数据。做染色或患者相关亚组分析前先确认数据里实际有什么字段(坑 7)。
B4:测试集有标签吗?
论文记载测试集生成时按 bins 平衡(Table I 给出了 12,000 个测试 patch 的标签分布),说明标签存在;但测试标签是否随 test.h5 公开、以何种形式公开,论文未细述——以实际文件读取为准(坑 7)。
B5:数据能拼回全切片吗?
不能。公开的是 patch 级 HDF5,不含全切片金字塔文件;patch 派生层级(slide→ROI→patch)的完整映射元数据也未随数据发布。做 WSI 级空间分析的需求应换用提供原 WSI 的条目(如 CAMELYON16-17(33))。
B6:pilot 数据和正式训练集是什么关系?
pilot 4,000 patch(2019-08-06 发布)与正式训练集 20,000 patch(2019-10-04 发布)同源同格式,正式集是 pilot 的超集式扩充(论文以"pilot→正式"描述发布序列)。今天从 Zenodo 拿到的 training.h5 已是完整正式集,pilot 只在复现赛事时间线实验时才有独立意义。
B7:训练集和测试集的分布差异大吗?
有系统性差异且是设计使然:测试集 0 档占比更高(24% vs 21%)、高计数档占比更高(21~50 档 3% vs 1%、均值 3.92 vs 3.11),加上 8 中心 vs 2 中心的采集差异——测试在分布上整体比训练更"难"。对比其他数据集的数字时记住这层不对称。
C 组:任务与指标
C1:为什么用 QWK 而不是 MAE 或 accuracy?
QWK 是档位一致性指标:框架无关(分类/回归/检测都能算)、对跨档大错重罚、修正 chance agreement 后不被 1~5 档(56-63%)的主流分布带偏(§3.2)。MAE 对"差几档"一视同仁,accuracy 会被多数类淹没。
C2:分类、回归、检测三条路线真的可以同台比较吗?
可以——这正是 bins+QWK 设计的目的:任何路线最终输出"归档后的计数",在同一个 12,000 patch 测试集上算 QWK。现场五队恰好三条路线都有代表(§5.1),成绩可比。
C3:>200 档要不要建模?
不要。该档训练/测试集均为 0 样本、全集最高计数 77(§2.5)。输出层按 6 档建(0/1~5/6~10/11~20/21~50/51~200),论文引用时说明与原始七档的映射(坑 4)。
C4:什么叫"弱监督"?这里的监督信号有多弱?
相对逐细胞实例掩码(全监督)而言:LYSTO 只有 patch 中心区域的整数计数,没有单细胞位置/轮廓。监督信号从"每细胞一个多边形"降到"每 patch 一个整数",标注成本下降若干量级,而性能未见显著损失(§6.7)——这正是该数据集的核心论点。
C5:我想报告自己的模型成绩,协议怎么定才和论文可比?
四件事对齐:①测试集用 12,000 patch 全量;②输出归档到六档有效 bins(坑 4);③主指标 QWK(patch 级);④如做外验,滑窗 16 px overlap + ROI 聚合(§3.7)。只报 ROI 口径或自选子集的成绩无法与论文数字对表。
C6:可以做 patch 级随机划分做交叉验证吗?
技术上可行(相邻 patch 标签近乎独立,§2.4),但不严谨:同一切片的染色批次相关性仍在。至少做 slide 级划分(TU/e 的 32/5/6 是标准答案),跨中心实验则应在中心维度留一。
C7:输出连续计数还是档位,对最终成绩影响大吗?
在 QWK 评测下两者最终都要归档比较,理论差距不大——现场前四名里分类(TU/e)与回归(HUST)路线的差距仅 0.0023。真正拉开差距的是归档前的错误结构(伪影误报、binning 量化),而不是输出形式本身(§5.8)。
C8:QWK 分数在学术评审中被质疑"任务太简单"怎么回应?
用论文自己的三组数字反驳:①传统 baseline 仅 0.6350,距深度学习最优 0.29——任务不是"白送分";②0 档伪影上算法 0.04-0.36 vs 医生 0.87——任务有明确的未解决成分;③跨癌种外验重排(0.4678-0.9798)——通用性并非已解决。三组数字分别封住"容易/饱和/通用"三个质疑口。
D 组:赛果与方法
D1:现场冠军是哪个队?用的什么方法?
GSK(0.9270):ResNet-50 分类+回归多任务,两阶段迁移训练(§5.2)。但注意现场前四名差距仅 0.0046,架构层面没有代差(§3.5)。
D2:哪个队的方法最值得借鉴?
看目的:追域内成绩看 GSK 多任务;追跨域泛化看 TIA Warwick 的 HoVer-Net 小样本实例分割预训练(现场第三、外验第一 0.9798);追工程纪律看 TU/e 的 WSI 级 32/5/6 划分与异构集成(§5.4-5.5)。
D3:mi2rl 为什么掉到 0.8241?
两个已公开的失误模式:对无淋巴 patch 误报较大数值;binning 量化效应(细粒度预测经粗 bins 归档错位)。其染色标准化组件可能把部分真实伪影"标准化"成了看似组织的形态(§5.6)。
D4:传统方法(baseline)差多少?
现场 patch 级 QWK 0.6350,与深度学习前排差约 0.29(§5.7)。但它在肺癌外验 ROI 聚合后达 0.8579——引用时务必分口径(坑 5)。
D5:现在(2024 论文之后)还有必要在 LYSTO 上刷分吗?
作为"证明方法有效"的主战场意义不大(0.93 线六年来未被显著突破);作为"证明方法在弱监督计数上不退化"的回归测试仍然高效——8.6 GB、12,000 patch、QWK 单指标,一小时出结果的验证成本在病理基准里几乎最低。基础模型时代的合理用法是把它当 sanity check 与弱监督迁移测试台。
D6:五队的代码哪里找?
没有官方公开仓库(坑 3)。TIA Warwick 的 HoVer-Net 有独立开源实现可做替代起点;其余队伍按论文 §V.A 的超参记载(附录 C)自行复现。赛后部分队伍在各自主页/arXiv 后续论文中披露过相关方法细节,可顺藤摸瓜。
D7:68.5% 五队全对和 4.0% 五队全错,中间的 27.5% 是什么?
五队预测不一致但未必全错的样本——通常是档位边界附近(如真值 5 或 6、10 或 11 两侧)的摇摆,或不同队犯不同错的伪影样本。这 27.5% 正是集成学习与排名差距的来源:四强之间的 0.0046 差距几乎全部由这部分"分歧带"决定,而它们也是临床部署里最值得引入人工复核的灰色地带。
D8:赛后 399 次提交里有没有值得一提的"黑马"方法?
论文对赛后提交只给了骨干/损失的统计画像(ResNet-18/ResNeXt/U-Net + CE/MSE·Huber,§3.6),未逐一介绍黑马——最高 0.9331 与现场冠军的配方同属一个技术空间。换言之,赛后阶段的价值在"把天花板钉实"而非"涌现新方法",引用赛后数字时不要把它描述成新突破。
E 组:外验与临床含义
E1:换个癌种还准吗?
肺癌外验(10 例、54 ROIs、CD8、不同扫描仪):前三名 0.9652-0.9798 几乎不掉分,HUST 0.8595、mi2rl 0.4678 明显下滑(§6.2)。方法对染色域的依赖程度决定外验表现;排名顺序与现场不同。
E2:能替代病理医生数 TIL 吗?
互补而非替代:高计数档算法超过医生(人眼精确计数有上限);0 计数档医生完胜(0.87 vs 0.04-0.36,识别 DAB 伪影需要整体组织学语境)(§6.6)。现实方案是"模型先数、医生复核 0 档与极端档"。
E3:弱监督计数达到全监督水平这个结论可靠吗?
论文的证据链:同一评估任务上,弱监督冠军 GSK 全档位灵敏度 0.55 > 全监督检测法 0.52 > 最好医生 0.47(Table III,§6.5)。这是单数据集、特定任务下的对照结论,外推到其他形态学任务需重新验证,但在淋巴细胞计数域内证据充分。
E4:0 档翻车有补救办法吗?
论文没有给出解法,但失败结构提示三个方向:①给模型加 WSI 级/ROI 级上下文(伪影往往成片出现,patch 级输入看不到语境);②伪影检测前置模块(颜色/纹理异常先分类再计数);③0 档预测触发人工复核的工作流设计。三者都没有在 LYSTO 原论文里验证,是留给后续研究的明确空位(§6.8)。
E5:这份数据能用于免疫治疗响应预测的建模吗?
不能直接用——LYSTO 没有任何治疗响应、随访或生存终点数据,它测的是"数细胞"这个中间环节。合理的用法是把它作为响应预测模型的前端组件验收工具:先用 LYSTO 确认你的 TIL 定量模块在 0 档与高计数档的可靠性边界,再接入下游临床数据;跳过前端验收直接端到端建模的,出了问题无法定位是数错了细胞还是预后信号本身弱。
F 组:库内与生态
F1:库内和它最互补的条目是哪个?
分需求:要实例掩码 → MoNuSAC(651)/Lizard(238);要同癌种像素级 → BCSS(258)(乳腺)/PuMA(641)(前列腺);要 H&E 对照 → CoNSeP(228);要低成本监督的另一种解法 → PanNuke(218) 半合成路线(§9.1)。
F2:LYON 在库内有条目吗?
没有(psql 实核)。LYON(441 ROIs,逐细胞标注)是 LYSTO 前作、测试集图像来源,正文以文字链接 lyon19.grand-challenge.org 呈现(坑 8)。
F3:想复刻一场类似的挑战赛,这份材料能提供什么?
三段式模板:三阶段发布节奏(pilot 提前 1 个月 / 正式集赛前 3 天 / 现场单日赛,§3.4)+ 框架无关指标设计(bins+QWK,§3.2)+ 双外部验证(跨癌种外验 + 医生 reader study,§6)。
F4:LYSTO 在挑战赛设计上有哪些"不要学"的地方?
三条:①License 双口径在赛事启动时未收口,遗患至今(§7.3)——办赛先定许可文本;②官方代码仓库与评测页在赛后失管(坑 3),基准的可复算性随平台衰减;③test 标签的公开形式未在论文中写明(B4),削弱了长期可复现性。赛事设计的可学处(§3.4-3.5)与不可学处一样有教育价值。
F5:pilot、正式集、测试集三者的许可状态一致吗?
三者同在 Zenodo 生态(pilot/训练集记录 3473558、全量记录 3513571),元数据口径同为 CC BY 4.0;官网口径 CC BY-NC 4.0 针对的是"挑战赛数据"整体。换言之,双口径问题不因取用哪部分数据而规避——按 §7.3 从严处理即可,无需逐记录区分。
F6:能不能只下载标签 CSV 不下载 H5?
可以——training_labels.csv 只有 620.1 kB,适合先看清标签分布再决定是否下 8.6 GB 的图像;但注意 CSV 只有训练标签,测试 patch 图像在 test.h5 内、其标签公开形式见 B4。只凭 CSV 无法完成任何模型评测,它只是个"先看后下"的预览件。
事实清单:编号硬事实
- LYSTO 官方全称:LYmphocyte aSsessmenT hackathOn(官网与论文一致)。
- 任务性质:patch 级弱监督淋巴细胞计数,非细胞实例分割。
- 组织方:Radboud University Medical Center(Radboudumc)计算病理组,主导者 Francesco Ciompi / Wenhua Jiao / Jeroen van der Laak。
- 现场赛:COMPAY @ MICCAI 2019,深圳,2019-10-13,单日。
- 官网:https://lysto.grand-challenge.org/(现为 Educational Challenge)。
- 前作 LYON:441 ROIs,官网 lyon19.grand-challenge.org;LYSTO 测试集图像完全派生自 LYON 官方测试集。
- 论文:IEEE JBHI 2024;28(3):1161-1172,doi:10.1109/JBHI.2023.3327489。
- 预印本:arXiv:2301.06304(v1 2023-01-16 / v2 2023-04-13)。
- 论文 21 位作者,覆盖 Radboudumc 与五支参赛队。
- 数据:83 张 IHC WSI = 乳腺癌 33 + 结肠癌 28 + 前列腺癌 22。
- 划分:train 43 / test 40(按张)。
- 中心:荷兰 9 个医学中心;训练 2 中心 / 测试 8 中心;1 实验室跨集但无患者重叠。
- 染色:每张切片 CD3 或 CD8 IHC。
- 扫描:3DHistech Pannoramic 250 Flash II,0.24 μm/pixel。
- ROI:每张 WSI 约 11 个,覆盖多样淋巴细胞模式。
- patch:299×299 px,步长 200 px,全分辨率。
- 标签:patch 中心 267×267 px 内淋巴细胞点数(≈0.41 mm²)。
- 忽略带:边缘 4 μm,约半个 T 细胞平均直径。
- 规模:train 20,000 / test 12,000 / pilot 4,000。
- 分布:0 档 4,208(21%)/2,915(24%);1~5 档 12,586(63%)/6,663(56%)(训练/测试)。
- 分布(续):6~10 档 2,008/1,260;11~20 档 900/790;21~50 档 290/323。
- 尾部:51~200 档仅 8/49;>200 档两集均 0。
- 极值与均值:max 70/77;mean 3.11/3.92。
- y=0 patch 按 brown score 选择性生成(伪影考点设计)。
- bins:0/1~5/6~10/11~20/21~50/51~200/>200 七档。
- 主指标:QWK(quadratic weighted kappa),框架无关。
- 规则:open challenge,提交 CSV,无架构/数据/算力限制。
- 时间线:pilot 2019-08-06;正式训练集 2019-10-04(赛前 3 天);测试集现场外置存储分发。
- 现场赛果 QWK:GSK 0.9270 / HUST 0.9247 / TIA Warwick 0.9229 / TU/e 0.9224 / mi2rl 0.8241;baseline 0.6350。
- 赛后开放:667 注册 / 399 有效提交 / 最高 0.9331。
- 一致性:68.5% 样本五队全对;4.0% 五队全错;个别 patch 误报 42 细胞。
- mi2rl 失败归因:无淋巴 patch 误报大数值 + binning 量化效应。
- 五队方法:GSK ResNet-50 多任务两阶段;HUST ResNet-101 回归 10 折;TIA Warwick HoVer-Net 预训练+小部分补标注;TU/e SE-ResNeXt-50 WSI 级 32/5/6 划分多架构集成;mi2rl DenseNet121+染色标准化+中位数距离损失。
- mi2rl 超参:AdamW lr 1e-5、wd 0.05、10,200 iter、batch 64。
- baseline:颜色反卷积+DAB 统计+CART(MATLAB,pruning 1800)。
- 肺癌外验:10 例、54 ROIs、CD8、Pannoramic 1000、0.24 μm/pixel;滑窗 16 px overlap、ROI 级聚合。
- 外验 QWK:TIA Warwick 0.9798 / GSK 0.9680 / TU/e 0.9652 / HUST 0.8595 / mi2rl 0.4678 / baseline 0.8579。
- LYON reader study(Table III,All 列):P1 0.41 / P2 0.44 / P3 0.37 / P4 0.47 / 医生平均 0.42;全监督检测法 0.52;GSK 0.55 / HUST 0.53 / TIA Warwick 0.48 / TU/e 0.42 / mi2rl 0.27。
- 0 档:医生平均 0.87 vs 算法 0.04-0.36。
- 赛后新提交主流:ResNet-18 / ResNeXt / U-Net;CE 分类头 / MSE·Huber 回归头。
- Zenodo 主记录 3513571(DOI 10.5281/zenodo.3513571,Version 1.0):training.h5 5.4 GB(md5 7273788230d17ba1a6b809f99c92c2ba)+ test.h5 3.2 GB(md5 1ca9057575e01486909dbc7a2a917448)+ training_labels.csv 620.1 kB(md5 24a9854eda8144c87d4293174a81a77d),合计 8.6 GB。
- 训练集单独记录 3473558,概念 DOI 10.5281/zenodo.3473557。
- 许可双口径:Zenodo 元数据 CC BY 4.0 vs 官网挑战页 CC BY-NC 4.0。
- GitHub 组织 LystoChallenge 404(2026-09-26 实核);官网 /evaluation/ 子页 404。
- 资助:EU Horizon 2020 #825292(ExaMode)+ Dutch Cancer Society KUN 2014-7032;NVIDIA 赞助 DGX-1。
- 创作者标识:Ciompi ORCID 0000-0001-8327-9606;van der Laak ORCID 0000-0001-7982-0754;机构 ROR 05wg1m734。
术语表
| 术语 | 释义 |
|---|---|
| WSI(whole slide image) | 全切片图像:病理玻璃切片经扫描仪数字化的高分辨率图像,可达十万像素级 |
| IHC(immunohistochemistry) | 免疫组化:用抗体标记特定抗原的染色技术,本数据集用 CD3/CD8 标记 T 细胞 |
| CD3 / CD8 | T 细胞谱系标记物(全 T 细胞膜抗原)/ 细胞毒性 T 细胞标记物 |
| DAB | 3,3’-二氨基联苯胺:IHC 常用显色底物,阳性信号呈棕色;非特异性沉积是本数据集的核心伪影来源 |
| TIL(tumor-infiltrating lymphocyte) | 肿瘤浸润淋巴细胞:肿瘤组织中浸润的免疫细胞,密度与免疫治疗响应和预后相关 |
| ROI(region of interest) | 感兴趣区:在 WSI 上先行圈定的分析区域,本数据集每张约 11 个 |
| patch | 从 ROI 切出的小图像块,本数据集 299×299 px、步长 200 px |
| 弱监督(weak supervision) | 监督信号弱于任务最终形态的标注范式;此处指 patch 级整数计数而非单细胞实例掩码 |
| bins | 计数档位:把连续计数归入 0/1~5/6~10/11~20/21~50/51~200/>200 七档 |
| QWK(quadratic weighted kappa) | 二次加权 kappa:衡量档位一致性、跨档大错重罚、修正随机一致,本赛主指标 |
| 灵敏度(sensitivity) | 真阳性率;reader study 中按 bins 归组报告 |
| reader study | 阅片者研究:让多名医生与算法在同一任务上对照的实验设计 |
| 颜色反卷积(color deconvolution) | 把 RGB 染色图像分解为染料浓度通道(如 H/DAB)的经典图像处理方法,baseline 第一环节 |
| CART | 分类与回归树:决策树算法,baseline 的最终模型(MATLAB,pruning 1800) |
| HoVer-Net | 核实例分割网络(基于水平核方向预测),TIA Warwick 的预训练骨干 |
| SE-ResNeXt-50 | 带 squeeze-excitation 通道注意力的 ResNeXt 骨干,TU/e 队采用 |
| DenseNet121 | 密集连接卷积网络,mi2rl 队骨干 |
| 多任务学习 | 一个网络同时挂多个损失头(如分类+回归),GSK 队配方 |
| 迁移学习 / 两阶段训练 | 先在预训练权重上适配目标域,再精调;GSK 与 TIA Warwick 均采用 |
| 染色标准化(stain normalization) | 把不同批次的染色风格映射到统一模板;mi2rl 队组件,外验中未复制现场收益 |
| 域偏移(domain shift) | 训练与测试数据的采集条件差异导致性能下降;本数据集训练 2 中心/测试 8 中心的内生挑战 |
| binning 量化效应 | 细粒度预测被粗档位归并后信息丢失或错档的现象,mi2rl 失败归因之一 |
| HDF5 | 层次化数据格式:本数据集的分发格式(training.h5 / test.h5),Python 下用 h5py 读取 |
| h5py | Python 的 HDF5 接口库,读取 LYSTO 数据的默认工具 |
| Zenodo | CERN 运营的开放科研仓储:LYSTO 数据的长期分发渠道(DOI 10.5281/zenodo.3513571) |
| DOI | 数字对象唯一标识符;数据集与论文分别有 Zenodo DOI 与 IEEE DOI |
| Grand Challenge | 病理/医学影像挑战赛托管平台(grand-challenge.org),LYSTO 与 LYON 官网所在地 |
| Educational Challenge | grand-challenge 平台的挑战赛存续形态:保留教学用途、关闭正式评测 |
| μm/pixel | 微米每像素:空间分辨率单位;本数据集 0.24 μm/pixel 为全分辨率 |
| brown score | DAB 染色强度评分:数据集据此选择性生成 y=0 伪影考点的依据指标 |
| hot tumor / cold tumor | 免疫浸润丰富/稀少的肿瘤表型;对应本数据集结肠(hot)与前列腺(cold)的难度两极 |
| Pannoramic 250 Flash II / Pannoramic 1000 | 3DHistech 公司的两代扫描仪型号;分别为 LYSTO 主数据与肺癌外验所用 |
| open challenge | 开放式挑战赛设定:不限架构、不限外部数据、不限算力,仅以评测分数论 |
| huber loss | 结合 MSE 与 MAE 优点的回归损失;赛后提交中回归头的主流选择之一 |
| stromal TIL | 基质区 TIL:国际工作组推荐的乳腺癌 TIL 评分口径,以面积占比目测评估(H&E) |
| concept DOI | 概念型 DOI:指向 Zenodo 记录所有版本的持久标识;LYSTO 训练集概念 DOI 10.5281/zenodo.3473557 |
| Educational Challenge | grand-challenge 平台上评测关闭、仅保留教学展示的挑战赛存续形态 |
| hot-cold 谱系 | 按免疫浸润丰度对肿瘤的二分描述;决定计数任务中"数不过来"与"确认没有"两类难度 |
| 归一化(染色/风格)前校准 | 跨域部署前用目标域小样本校准输出的工程步骤;回归路线(HUST 式)尤其需要 |
| plug-and-play benchmark | 即插即用基准:论文对 LYSTO 赛后形态的定位——离线可得、协议公开、随时对表 |
| sanity check | 上线前的小规模目标域抽检:跨域部署的第一道闸门(§6.2 实操推论) |
附录 A:DAIMS 评估
DAIMS(Data 数据、Annotation 标注、Interoperability 互操作、Maintenance 维护、Sustainability 可持续)五维评估:
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 数据 | 7 | 优:荷兰 9 中心多癌种(乳腺/结肠/前列腺)CD3/CD8 IHC 全分辨率(0.24 μm/px)数据,bins 分层平衡设计,测试集内生域偏移考题;劣:>200 档 0 样本、51~200 档训练集仅 8 例、患者级信息未披露、逐张染色分配表缺失 |
| A 标注 | 7 | 优:patch 级点数标签定义几何清晰(中心 267×267 px + 4 μm 忽略带),y=0 档 brown score 选择性生成是有意的伪影考点,标签经病理专家完成;劣:无单细胞实例信息,计数标签无法回溯细胞形态,test 标签公开形式论文未细述 |
| I 互操作 | 8 | 优:HDF5 通用格式 + CSV 标签、Zenodo 公开直链、三文件 MD5 齐全、训练集独立记录可引用;劣:test.h5 字段结构无官方文档,patch→slide→ROI 派生映射元数据不完整 |
| M 维护 | 6 | 优:Zenodo 概念 DOI 稳定、官网持续在线(Educational Challenge 定位);劣:评测平台已关闭(/evaluation/ 404)、GitHub 组织 404、License 双口径(CC BY 4.0 vs CC BY-NC 4.0)未裁决、无已知版本迭代计划 |
| S 可持续 | 7 | 优:IEEE JBHI 正式发表 + arXiv 预印本双轨可引,论文披露充分(方法、超参、失败模式全公开),数据体量小(8.6 GB)易于长期镜像;劣:社区活跃度依赖论文引用而非平台运营,赛后方法演进缓慢(仍以 ResNet 系为主) |
DAIMS 综合评级:7.0/10——一份"论文侧披露近乎满分、平台侧维护逐年衰减"的基准数据集:数据与结论本身扎实可复算,但使用者需要自行承担评测复现(平台已关)与许可核实(双口径未决)两件本应由发布方收口的事。
附录 B:证据链与来源清单
| # | 来源 | 内容支撑 | 可核验性 |
|---|---|---|---|
| 1 | 官网 https://lysto.grand-challenge.org/ | 名称全称、赛事性质、Educational Challenge 现状、CC BY-NC 4.0 声明、pilot/训练集发布时间(2019-08-06 / 2019-10-04) | 2026-09-26 实核在线;/evaluation/ 子页 404 |
| 2 | 论文 IEEE JBHI 2024;28(3):1161-1172(arXiv:2301.06304) | 全部数据规格、Table I/II/III、方法谱系、外验与 reader study、资助号 | doi:10.1109/JBHI.2023.3327489 |
| 2b | arXiv 页 https://arxiv.org/abs/2301.06304 | 预印本全文(含 v1/v2 时间线)、方法细节的开放获取版本 | 公开可读 |
| 3 | Zenodo 记录 3513571(DOI 10.5281/zenodo.3513571) | 三文件清单、大小、MD5、CC BY 4.0 元数据、Version 1.0;关联记录 3473558 | 公开直链可下载 |
| 4 | GitHub github.com/LystoChallenge | 404(不存在官方代码仓库) | 2026-09-26 实核 |
| 5 | LYON 官网 https://lyon19.grand-challenge.org/ | 441 ROIs、前作关系 | 论文 §III.C/§V.C 交叉印证 |
| 6 | 库内数据库(psql 实核) | 互链 rid:monuseg 30 / camelyon16-17 33 / pannuke 218 / consep 228 / lizard 238 / nucls 248 / bcss 258 / puma 641 / monusac 651;lysto slug 空闲、LYON 无条目 | 2026-09-26 查询 |
存照六条(名称纠偏、License 双口径、GitHub 404、评测页 404、test.h5 字段待核、LYON 无库内条目)见 §10 坑 1/2/3/7/8 与 §9.1。
附录 C:五队复现要点速查
| 队伍 | 复现关键点 | 论文出处提示 |
|---|---|---|
| GSK | ResNet-50 双头(bins 分类 + 计数回归);两阶段:域适配→精调 | §V.A 方法小节 |
| HUST | ResNet-101 回归头;10 折 CV 后集成;MSE/Huber 类回归损失 | §V.A |
| TIA Warwick | HoVer-Net 权重起步;对训练集小部分补做手工核标注做分割预训练;两阶段迁移 | §V.A |
| TU/e | SE-ResNeXt-50;WSI 级 32/5/6 划分(防 patch 泄漏);多架构独立模型取中位数集成 | §V.A |
| mi2rl | DenseNet121;染色标准化;训练细粒度 bins;预测/参考 bins 中位数距离损失;AdamW lr 1e-5、wd 0.05、10,200 iter、batch 64 | §V.A |
| baseline | 颜色反卷积 → DAB 通道统计特征 → CART 回归树(MATLAB fitrttree,prune 1800) | §IV.A |
| 对照协议 | 所有队共用:测试集 12,000 patch / QWK /(外验时)16 px overlap 滑窗 + ROI 聚合 | §III.F/§V.C |
复现注意:所有队伍在"正式训练集仅发布 3 天"的窗口内完成调参;复现者不应期望用同样的时间预算拿到同样成绩,但前四名 0.92+ 的收敛区间是合理的达标线。另注:论文记载到超参粒度的只有 mi2rl(AdamW/1e-5/0.05/10,200 iter/batch 64)与 baseline(prune 1800),其余队伍为路线级描述——按附录 F 模板报告自己的成绩、与原队数字做区间对照(而非逐位复现)才是这套材料正确的打开方式。
附录 D:HDF5 读取骨架
import h5py
# 下载自 https://zenodo.org/records/3513571
# md5 校验通过后再打开(§7.1)
with h5py.File("training.h5", "r") as f:
print("字段:", list(f.keys())) # 第一步:看实际字段名(坑 7)
for k in f.keys():
print(k, f[k].shape, f[k].dtype) # 第二步:shape 对齐 20,000 口径
# 第三步:抽样可视化确认 patch-标签对应与染色方向
# patch = f["x"][0] # 字段名以实际 keys() 为准
# label = f["y"][0] # 中心 267×267 px 淋巴细胞数(§2.4)
import csv
with open("training_labels.csv") as fh: # 独立 CSV 标签(620.1 kB)
rows = list(csv.reader(fh))
print(len(rows) - 1) # 应为 20,000 行量级
三个自检动作(keys / shape / 抽样目测)对应坑 7 的完整清单;计数换算密度时有效面积取中心区 0.41 mm²(§2.4)。
附录 E:BibTeX
@article{lysto2024,
author = {Jiao, Yiping and van der Laak, Jeroen and Albarqouni, Shadi and Li, Zhang
and Tan, Tao and Bhalerao, Abhir and Ma, Jiabo and Sun, Jiamei
and Pocock, Johnathan and Pluim, Josien P. W. and Koohbanani, Navid Alemi
and Bashir, Raja Muhammad Saad and Raza, Shan E. Ahmed and Liu, Sibo
and Graham, Simon and Wetstein, Suzanne and Khurram, Syed Ali
and Watson, Thomas and Rajpoot, Nasir and Veta, Mitko and Ciompi, Francesco},
title = {LYSTO: The Lymphocyte Assessment Hackathon and Benchmark Dataset},
journal = {IEEE Journal of Biomedical and Health Informatics},
volume = {28},
number = {3},
pages = {1161--1172},
year = {2024},
doi = {10.1109/JBHI.2023.3327489}
}
@dataset{lysto_data,
author = {Ciompi, Francesco and Jiao, Wenhua and van der Laak, Jeroen},
title = {LYSTO challenge data},
doi = {10.5281/zenodo.3513571},
url = {https://zenodo.org/records/3513571},
year = {2019}
}
数据引用建议同时给出论文 DOI(10.1109/JBHI.2023.3327489)与数据 DOI(10.5281/zenodo.3513571);许可声明按 CC BY-NC 4.0 自律口径附注(坑 2)。
附录 F:逐 bins 性能报告模板(自评测用)
在 LYSTO 上评测自己的模型时,建议按下列模板报告——它的结构继承自论文的多口径协议(§3.7),能同时暴露总体水平与失败模式定位:
模型名称/版本:
训练数据口径:LYSTO training.h5(20,000 patch),slide 级划分方式:____
输出形式:分类(6 档)/ 回归(四舍五入归档)/ 检测聚合
[表 1] patch 级总指标(test 12,000 全量)
QWK = ____ accuracy = ____ MAE(bins) = ____
[表 2] 按真值 bins 分组的 per-bin 表现
bins n(test) 预测正确率 主要误判去向
0 2,915 ____ ____(重点报告:伪影 patch 命中情况)
1~5 6,663 ____ ____
6~10 1,260 ____ ____
11~20 790 ____ ____
21~50 323 ____ ____
51~200 49 ____ ____(样本少,注明统计效力有限)
>200 0 —— ——(空档,坑 4)
[表 3] 0 档专项
真值 0 且被预测非 0 的样本数:____
抽样 20 例目测归类:强 DAB 伪影 ____ / 边缘切割 ____ / 其他 ____
[表 4](可选)ROI 聚合口径:16 px overlap 滑窗 → ROI 求和 → QWK = ____
模板的三条使用纪律:0 档专项(表 3)不可省略——它是与论文"0.04-0.36 vs 0.87"结论对话的最小接口;51~200 档样本仅 49 个,其上任何结论都须注明脆弱性;ROI 口径(表 4)若报告,必须同时保留 patch 口径(表 1),防止坑 5 的口径混淆。
附录 G:双口径成绩总表(现场 vs 外验)
把论文 Table II 与外验结果并排,方便一次看清"口径如何重排成绩单":
| 队伍 | 现场 patch 级 QWK | 肺癌外验 ROI 级 QWK | 变化 | 排名变化 |
|---|---|---|---|---|
| GSK | 0.9270(1) | 0.9680(2) | +0.0410 | 1→2 |
| HUST | 0.9247(2) | 0.8595(4) | −0.0652 | 2→4 |
| TIA Warwick | 0.9229(3) | 0.9798(1) | +0.0569 | 3→1 |
| TU/e | 0.9224(4) | 0.9652(3) | +0.0428 | 4→3 |
| mi2rl | 0.8241(5) | 0.4678(5) | −0.3563 | 5→5 |
| baseline | 0.6350(参考) | 0.8579(≈4) | +0.2229 | 大幅跃升 |
读表三则:①前四名域内挤在 0.0046 区间、外验拉开到 0.12 区间——泛化能力才是真差距;②唯一两个外验下滑的队(HUST、mi2rl)都是单域特征依赖更重的路线(纯回归、激进染色归一化);③baseline 的 +0.2229 是全表最大增幅,聚合口径的"托底效应"显著——这也是所有引用 LYSTO 数字的人必须先问口径的原因(坑 5)。
附录 H:上手十步清单
从零开始使用 LYSTO 的最短路径,每步附对应章节:
- 读 §1 十问十答确认任务形态符合需求(2 分钟)。
- 核对许可约束:学术按 CC BY-NC 4.0 自律;商用先走坑 2 流程。
- 从 Zenodo 3513571 下载三文件并 MD5 校验(§7.1)。
- 按 §2.7 清点元数据可得项:训练集癌症类型、patch 计数标签;确认患者级信息不存在。
- 按坑 7 三步自检 H5:keys → shape → 抽样目测。
- 决定输出 bins:六档有效档(坑 4),在实验记录里写明与原七档的映射。
- 按 TU/e 纪律划分:slide 级划分(§5.5),跨中心问题按中心留一。
- 选路线:按 §5.8 决策表对号入座(预算/目标两个轴)。
- 训练后按附录 F 模板四表报告:总指标 + 分档 + 0 档专项 + 可选 ROI 口径。
- 对标两条线:baseline 0.6350(形态信息非平凡性)与 0.9331(历史最高,§4.4);引用成绩注明口径(坑 5)。
十步里第 2、6、9、10 步是最常被跳过而事后返工的——尤其第 9 步的 0 档专项:跳过它,你的评测就测不出 LYSTO 最独特的考点。
附录 I:关键数字速查卡
数据组
| 项 | 值 |
|---|---|
| WSI 总数 | 83(breast 33 / colon 28 / prostate 22) |
| 训练/测试划分 | 43 / 40(张) |
| patch 规模 | train 20,000 / test 12,000 / pilot 4,000 |
| patch 规格 | 299×299 px,步长 200,0.24 μm/px |
| 标签区域 | 中心 267×267 px ≈ 0.41 mm² |
| 中心数 | 荷兰 9 中心(train 2 / test 8) |
| 计数极值 | max 70(train)/ 77(test);mean 3.11 / 3.92 |
任务组
| 项 | 值 |
|---|---|
| bins | 七档(0/1~5/6~10/11~20/21~50/51~200/>200),实际六档 |
| 主指标 | QWK |
| 提交形式 | CSV,open challenge |
赛果组
| 项 | 值 |
|---|---|
| 现场 QWK | GSK 0.9270 / HUST 0.9247 / TIA Warwick 0.9229 / TU/e 0.9224 / mi2rl 0.8241 / baseline 0.6350 |
| 赛后开放 | 667 注册 / 399 有效提交 / 最高 0.9331 |
| 一致性 | 68.5% 五队全对 / 4.0% 五队全错 / 个别误报 42 细胞 |
外验与对照组
| 项 | 值 |
|---|---|
| 肺癌外验 | 10 例 / 54 ROIs / CD8 / Pannoramic 1000 |
| 外验 QWK | TIA Warwick 0.9798 / GSK 0.9680 / TU/e 0.9652 / HUST 0.8595 / mi2rl 0.4678 / baseline 0.8579 |
| LYON 对照(All 列) | GSK 0.55 / 检测法 0.52 / HUST 0.53 / TIA 0.48 / TU·e 0.42 / 医生平均 0.42(P4 0.47 最高) |
| 0 档 sensitivity | 医生 0.87 vs 算法 0.04-0.36 |
速查卡用途说明:五组数字覆盖论文摘要级引用的全部需求——写综述、填数据表、审稿回复时直接取用;但凡是进入正式论文的数字,请回到 §2/§4/§6/§7 对应章节核对上下文限定语(口径、集合、阶段),速查卡省略了这些限定语本身。
获取组
| 项 | 值 |
|---|---|
| 主记录 | Zenodo 3513571(DOI 10.5281/zenodo.3513571),8.6 GB |
| 文件 | training.h5 5.4 GB / test.h5 3.2 GB / training_labels.csv 620.1 kB(MD5 见 §7.1) |
| 许可 | Zenodo CC BY 4.0 vs 官网 CC BY-NC 4.0(双口径) |
| 论文 | IEEE JBHI 2024;28(3):1161-1172,doi:10.1109/JBHI.2023.3327489 |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- owl — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- wsss4luad — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- monusac — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集 / 肿瘤学
- pannuke — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- lizard — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- leopard — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- peso — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 肿瘤学
- cosas — 共享标签:医学影像 / 病理图像 / 医学图像分割 / 挑战赛数据集
- panda — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
- paip — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

