CAMELYON16 (camelyon16) — AI-Ready Wikipedia

首个病理全切片图像 Grand Challenge(ISBI 2016):荷兰两中心的 400 张 H&E 前哨淋巴结 WSI,slide 级分类 + lesion 级定位双任务,FROC 评价;Harvard/MIT 冠军算法在限时诊断模拟中显著优于 11 名病理医生、与不限时专家相当;CC0 公开

来源 两荷兰中心病理科 H&E 前哨淋巴结切片(3DHistech Pannoramic Flash II 250 / Hamamatsu NanoZoomer-XR 扫描,ASAP 转通用 TIFF 金字塔);slide 级标签(正常/含转移)+ 209 张含转移 WSI 的 XML 转移轮廓与二值 mask;测试集金标准经免疫组化验证发布时间: 2026-09-27最后更新: 2026-09-27 阅读 19
CAMELYON16 (camelyon16) — AI-Ready Wikipedia

信息速览

数据集名称CAMELYON16 (camelyon16) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模400 张 WSI(训练 270:160 正常 + 110 含转移;测试 130 官方发布口径 / 129 评价口径;RUMC + UMCU 两中心)
接入方式两荷兰中心病理科 H&E 前哨淋巴结切片(3DHistech Pannoramic Flash II 250 / Hamamatsu NanoZoomer-XR 扫描,ASAP 转通用 TIFF 金字塔);slide 级标签(正常/含转移)+ 209 张含转移 WSI 的 XML 转移轮廓与二值 mask;测试集金标准经免疫组化验证
AI 就绪度

INFOBOX — CAMELYON16 一屏速览

维度 内容
本质 首个病理全切片图像(WSI)Grand Challenge(workshop 于 IEEE ISBI 2016):乳腺癌前哨淋巴结转移自动检测
主办 Radboud University Medical Center(Nijmegen)+ University Medical Center Utrecht(荷兰)
结果论文 JAMA 2017;318(22):2199-2210(doi:10.1001/jama.2017.14585);数据论文 GigaScience 2018;7(6):giy065
数据 400 WSI(H&E 前哨淋巴结):训练 270(160 正常 + 110 含转移)+ 测试 130(评价 129)
规格 通用 TIFF 多层金字塔;~100k-250k px 每边;level 0 约 0.25 μm/px(40×);总量 ~700-900 GB
标注 slide 级标签 + 209 张含转移 WSI 的 XML 轮廓与二值 mask;测试集金标准经免疫组化(IHC)验证
双任务 ① slide 级分类(AUC)② lesion 级定位(FROC:6 个预设假阳率的平均敏感度)
冠军 Harvard/MIT:挑战期 AUC 0.9234 / FROC 0.6933;赛后更新 AUC 0.9935 / FROC 0.8074
人类对比 11 名限时病理医生 mean AUC 0.810 vs 最佳算法 0.994(P<.001);top5 算法 ≈ 不限时专家(0.960 vs 0.966)
参赛规模 32 份提交 / 23 支队伍;媒体报道进入白宫《国家 AI 研发战略计划》报告
许可 CC0 1.0 Universal(公有领域贡献,无使用限制)
获取 官方下载页(camelyon16.grand-challenge.org/download/)+ Google Drive 镜像 + GigaDB 100439;评估代码 GitHub 开源
衍生 CAMELYON17(pN 分期)→ GigaScience 1399 WSI 合并发布 → PCam(327,680 patches)→ CAMELYON17-WILDS
库内互链 camelyon16-17(33)、pcam(158)、lysto(653)、bracs(138)、breakhis(126)、panda(560)、panda-plus(640)

CAMELYON16 是数字病理学的"ImageNet 时刻":2015-2016 年,荷兰 Radboud 大学医学中心与乌得勒支大学医学中心把乳腺癌前哨淋巴结转移检测——一项耗时的日常病理任务——做成了历史上第一个使用病理全切片图像(WSI)的挑战赛。400 张 gigapixel 级 H&E 染色切片、两个互补任务(切片有没有转移、转移病灶在哪里)、一套以 FROC 为核心的严格评价协议,以及一次"算法 vs 病理医生"的盲测对比,共同把"深度学习能否达到病理专家水平"从思辨变成了可测量的数字:限时诊断模拟中算法显著优于 11 名病理医生,与不限时阅片的专家病理医生相当。结果发表于 JAMA,并进入白宫 AI 战略报告。

导语读法三则:

  1. 只想下数据:直奔 §5 获取与许可——CC0 无任何限制,注意 400/399 双口径与 ~700-900 GB 体量预期。
  2. 关心"AI 比医生强吗":直奔 §4——两个 leaderboard 与 JAMA 人类对比实验的完整数字都在那里。
  3. 要复现 FROC 评价:直奔 §3 评价协议与附录 R 评测骨架——六个假阳率工作点、lesion 判定规则一处不漏。

§0 导读:这个数据集解决什么问题

前哨淋巴结状态是乳腺癌分期与治疗决策的最重要预后因子之一。标准流程是把活检的前哨淋巴结切片染色、由病理医生在显微镜下逐区排查转移灶——一处微转移可能藏在数厘米宽的切片里,漏检并不罕见,且阅片高度耗时、观察者间存在主观差异。2015 年,Radboud UMC 与 UMC Utrecht 的团队决定用公开挑战赛的方式系统回答一个问题:自动算法能否在这一任务上接近甚至达到病理专家水平?

CAMELYON16 的回答分三层。第一层是数据:400 张 WSI(270 训练 + 130 测试)来自两家中心的常规病理工作流,H&E 染色、不同扫描设备(3DHistech 与 Hamamatsu),含转移切片附带病理医生手绘的转移区轮廓(XML 顶点)与二值 mask——这在当时是史无前例的大规模 WSI 级标注投入。第二层是任务设计:slide 级分类(有无转移,AUC 评价)与 lesion 级定位(病灶概率 + 坐标,FROC 评价)双任务并行,前者模拟"这张片子要不要报",后者模拟"转移在哪里"——两层缺一不可,只做对一层不算解决临床问题。第三层是评价哲学:挑战赛结束后,组织方让 11 名病理医生在 2 小时内限时阅读全部 129 张测试切片(模拟日常工作流),另请一名专家不限时精读,与算法同台盲测——这场对比实验的 JAMA 论文成为"AI vs 病理医生"叙事的标志性原始文献。

§0 读法三则:

  1. 这个条目是"挑战赛+数据集+人类对比实验"三合一:本体是 400 张 WSI 与双任务评价协议,副产品是一场改变了病理 AI 认知的人类对照实验,长线遗产是 CAMELYON→PCam→WILDS 的整个数据家族(§6)。
  2. 全文统计数字均出自官网 Results 页(curl 实抓)、JAMA 摘要(Europe PMC API 实抓)与 GigaScience 全文(PMC 全文 XML 实抓);训练集 normal/tumor 口径冲突(官网/JAMA vs MathWorks)已在坑 2 存照。
  3. 检索时注意区分 CAMELYON16(本条目,400 WSI 检测挑战)与 CAMELYON17(pN 分期挑战)以及库内合并条目 camelyon16-17(rid 33)——三个名字指三件相关但不同的事(坑 1)。

§1 数据集速览:十问十答

先把六个最容易用错的数字钉在这里(详证见附录 C/H):

# 数字 一句话锚定
1 400 WSI 总量(270 训练 + 130 测试,发布口径)
2 399 / 129 评价口径(1 张测试重复剔除后)
3 160 / 110 训练集正常 / 含转移
4 49 / 80 测试集(评价口径)含转移 / 正常
5 0.994 / 0.8074 赛后最佳 AUC / FROC(2016-11-06,非挑战期成绩)
6 0.810 vs 0.994 11 名限时医生 mean AUC vs 最佳算法(JAMA)

Q1:CAMELYON16 的 400 张切片从哪来?
全部来自荷兰两家中心的常规病理档案:Radboud University Medical Center(Nijmegen)与 University Medical Center Utrecht。这些是乳腺癌患者前哨淋巴结活检的 H&E 染色切片,经两家医院病理科数字化。3DHistech Pannoramic Flash II 250 扫描 RUMC 侧切片,Hamamatsu NanoZoomer-XR 扫描 UMCU 侧切片,随后统一转换为通用 TIFF 格式(经 ASAP 开源转换器)。

Q2:训练集和测试集怎么分?
训练 270 张,测试 130 张(官网发布口径)。训练集分两批发布:第一批 170 张(100 正常 + 70 含转移,2015-11-25)、第二批 100 张(60 正常 + 40 含转移,2015-12-30)。测试集不公开标签,2016-03-01 发布。注意评价实际用 129 张——官方确认 1 张测试切片为重复并剔除(坑 3)。

Q3:标注长什么样?
两级。slide 级:每张训练切片有"正常 / 含转移"标签;含转移切片还提供转移病灶的像素级 ground truth——病理医生手绘的轮廓顶点存为 XML 文件,同时提供对应的二值 mask 图像。测试集标签不公开,其金标准状态经免疫组化(IHC)染色验证(JAMA 口径)。

Q4:图像多大?
WSI 是多层金字塔 TIFF,原始层每边约 100,000-250,000 像素(MathWorks 示例称 200,000×100,000 量级),level 0 对应 40× 物镜、约 0.25 μm/px,单图可达约 10 gigapixels。全量数据约 700-900 GB(各来源口径 700 GB-900 GB 不等,见坑 5)。下载与读取需要 OpenSlide 或 ASAP 这类 WSI 专用库,普通图像库无法直接打开。

Q5:两个任务分别怎么算分?
任务一 slide 级分类:为每张测试切片提交"含转移概率",按 AUC 排名。任务二 lesion 级定位:为每个预测病灶提交概率 + (x,y) 坐标,画 FROC 曲线,最终得分是 6 个预设假阳率工作点(1/4、1/2、1、2、4、8 FP/WSI)上敏感度的平均值。两个任务独立排名。

Q6:谁赢了?
两个榜单冠军都是 Harvard Medical School + MIT 团队(Wang、Khosla 等):挑战截止时 AUC 0.9234、FROC 0.6933;赛后更新版(Method 2,2016-11-06)把成绩推到 AUC 0.9935、FROC 0.8074。其方法是基于 GoogLeNet 的 patch 级 CNN,训练于数百万个带标注 patch,再把 patch 概率聚合成热图做后处理出两个任务的输出。

Q7:"AI vs 病理医生"实验是什么?
挑战结束后,组织方请 11 名荷兰病理医生在 2 小时内(WTC,with time constraint)阅读全部 129 张测试切片并给出五档诊断置信度(模拟日常工作流),另有一名专家病理医生不限时精读(WOTC,without time constraint)。结果:最佳算法 AUC 0.994,显著高于 WTC 医生组均值 0.810(P<.001);top5 算法均值 0.960 与 WOTC 专家 0.966 统计相当。

Q8:数据许可是什么?要注册吗?
CC0 1.0 Universal——作者把数据贡献给公有领域,署名虽非强制但学术礼仪上应引用 JAMA 2017 与 GigaScience 2018 论文。下载通过官方下载页的多镜像(Google Drive 主力、GigaDB 100439 等),无需注册挑战赛账号。

Q9:它和 CAMELYON17、PCam 什么关系?
CAMELYON17 是续作挑战(2016-11 开放注册),扩展到 5 家中心、100 名患者×5 枚淋巴结,任务改为 pN 分期。GigaScience 2018 论文把两代挑战的 1,399 张 WSI 合并发布(含 209 张手绘轮廓)。PCam/PatchCamelyon 则是从 CAMELYON16 提取的 327,680 张 96×96 小图分类集。库内另有合并视角条目 camelyon16-17(rid 33)。

Q10:我现在能拿到什么?
三层:① 400 张 WSI 原图 + 训练集标注(CC0,官方下载页);② 官方评估代码与测试集 reference.csv(GitHub: computationalpathologygroup/CAMELYON16);③ 可视化工具链(OpenSlide + ASAP)。测试集图像本身公开但无标签——想拿测试分数要么用官方评估器自测,要么对比 GigaScience/JAMA 已发表结果。

§2 数据构成与规格

2.1 目录结构与命名

CAMELYON16 的标准目录树(官网与 kaiko-ai eva 文档一致口径):

CAMELYON16
├── training
│   ├── normal
│   │   ├── normal_001.tif
│   │   └── ...                (160 张)
│   ├── tumor
│   │   ├── tumor_001.tif
│   │   └── ...                (110 张)
│   └── lesion_annotations.zip (tumor WSI 的 XML 轮廓 + mask)
└── testing
    ├── images
    │   ├── test_001.tif
    │   └── ...                (130 张)
    ├── evaluation
    ├── reference.csv          (测试目标,官方评估用)
    └── lesion_annotations.zip (测试集病灶标注,官方评估用)

命名规则自解释:normal_* 为阴性训练片、tumor_* 为阳性训练片、test_* 为测试片(无文件名提示)。文件编号从 001 起,各目录内连续编号。

2.2 训练集:两批发布的 270 张

训练集分两批上线,构成官网口径的完整分层:

批次 发布日期 张数 正常 含转移
第一批 2015-11-25 170 100 70
第二批 2015-12-30 100 60 40
合计 — 270 160 110

两批发布是挑战赛运营决策(注册开放当天首批数据即可下载),对下游使用者没有差别——GigaScience 与所有衍生工作都按 270/160/110 的合计口径引用。

2.3 测试集:130 与 129 的双口径

官网发布测试集 130 张,来自两家中心混合。但 JAMA 论文与后续全部生态按 129 张评价:官方确认其中 1 张为重复切片并剔除。129 张中 49 张含转移、80 张正常(JAMA 摘要口径)。这是本条目最重要的双口径(坑 3):引用"测试集规模"时必须写明所用口径,否则复现分数时样本数对不上。

两中心在评价集与训练集中的分布(FLamby 按训练文件名顺序与聚类恢复的口径):RUMC 训练 169-170 张 + 测试 74-80 张,UMCU 训练 101 张 + 测试 50-55 张——RUMC 占比略高(243:156,399 总量口径)。

逐中心明细:JAMA Table 1 的完整数字

JAMA 论文 Table 1 给出了按中心 × 转移等级的完整拆分(评价口径 399),是本条目最细一层的规模数字:

集合 中心 张数 浸润性导管癌(IDC) 其他类型 normal micro macro 每片病灶数中位数(范围)
训练 RUMC 170 54 16 100 35 35 2(1–20)
训练 UMCU 100 30 10 60 26 14 3(1–27)
测试 RUMC 79 — — 50 15 14 2(1–14)
测试 UMCU 50 — — 30 12 8 3(1–25)

闭环校验:训练阳性 70+40=110 ✓;测试 49 阳性+80 阴性=129 ✓;中心合计 170+100=270(训练)、79+50=129(测试)✓。

这张表补足了三个正文别处没有的信息:①组织学类型——阳性训练片以浸润性导管癌(IDC,84/110)为主、非 IDC 26 张,做组织学亚型分析时需要知道队列构成;②转移等级分布——训练侧 micro 61 / macro 61 恰好配平,测试侧 micro 27 / macro 22,micro 与 macro 大体均衡(分层随机选片的结果,见 §2.5 流水线);③每片病灶数——阳性片通常只含 1–3 处转移灶,但长尾可到 20–27 处,做 lesion 级统计时用中位数而非均值。

2.4 图像规格

属性 值 来源
染色 H&E(苏木精-伊红) 官网
文件格式 通用 TIFF(厂商格式经 ASAP 转换器统一) GigaScience
金字塔层数 多层(MathWorks 示例称 11 层 stripped TIFF) MathWorks
原始层尺寸 ~100,000-250,000 px 每边;MathWorks 口径 200,000×100,000 量级 kaiko-ai / MathWorks
物镜倍率 40×(level 0 约 0.25 μm/px;扫描最细可至 240 nm/px) kaiko-ai / GigaScience
像素总量 单张可达约 10 gigapixels GigaScience
体量 全量 ~700-900 GB(MathWorks 仅训练部分口径 451 GB) kaiko-ai / FLamby / MathWorks

切片扫描设备:RUMC 侧(含 CAMELYON17 时代 CWZ/RST 中心切片)用 3DHistech Pannoramic Flash II 250;UMCU 侧用 Hamamatsu NanoZoomer-XR C12000-01。两家设备、两家染色流程的组合是数据多样性的主要来源——GigaScience 论文明确指出这使跨中心变异性与 H&E 染色变异性同时被捕获。

发布格式的存储细节(GigaScience Table 6)

GigaScience 数据论文给出了发布格式的完整技术参数,对搭建读取管线直接有用:

参数 值 实践含义
容器 Tiled TIFF(bigTIFF 变体) 单文件超过 4 GB 必须用 bigTIFF 寻址;不支持的读取器会直接失败
瓦片尺寸 512 × 512 px 随机区域读取的最小 I/O 单位;与 §2.7 DeepZoomGenerator 的 tile 512 约定一致
分辨率 0.23–0.25 μm/px(level 0) 两中心设备差异导致的 spacing 微差——物理尺寸换算不可写死 0.25
色彩 RGB,每通道 8 bit 无透明通道;OpenSlide 返回的 RGBA 里 A 恒为不透明(§2.7 要点)
压缩 JPEG(瓦片内) 有损压缩,像素级复现研究需注意压缩伪影;无公开无损原始版
金字塔 逐级降采样多层 MathWorks 示例为 11 层 stripped TIFF;层数因片而异,代码勿写死

厂商私有格式(CAMELYON17 时代 LPON 中心的 Philips iSyntax)经专有转换器统一转成上述 TIFF——OpenSlide 与 ASAP 均可直接读取发布版,无需接触原厂格式。这也是"发布通用 TIFF"成为 CAMELYON 家族互操作标杆的原因(附录 B 的 I 维度 8 分主要来自这里)。

一个已知的单张缺陷:normal_144.tif 缺少推导物理尺寸所需的重要 metadata(MathWorks 文档单独提示剔除该文件)——使用像素-物理单位映射的管线应校验每张的 spacing。

2.5 标注体系

slide 级标签:每张训练 WSI 有二元标签(正常/含转移)。CAMELYON 家族的完整标签语义是四分类(GigaScience 发布口径):

标签 语义 TNM 尺寸标准
normal(无转移) 切片不含任何转移灶 —
ITC(isolated tumor cells,孤立肿瘤细胞) 单个或微小簇肿瘤细胞 ≤0.2 mm 或 ≤200 个细胞
micro-metastases(微转移) 转移灶直径 0.2-2 mm >0.2 mm 且 ≤2 mm
macro-metastases(宏转移) 转移灶直径 >2 mm >2 mm

四分类对应病理 pN 分期逻辑(N0/is(itc)/N1mi/N1a…)。CAMELYON16 挑战评价按二元口径(有无转移);GigaScience 数据包对全部 1,399 张 WSI 发布四分类标签——两套口径在生态文献中长期并存(坑 4)。

lesion 级标注:含转移的训练 WSI 附病理医生手绘的转移区轮廓:

  1. XML 文件:轮廓顶点坐标(每处病灶一组顶点序列);
  2. 二值 mask:与 WSI 对齐的转移区掩膜图像。

测试集的病灶标注与 slide 标签不随数据包公开(存于官方评估侧),金标准状态经免疫组化(IHC)染色验证——即对不确定病例用细胞角蛋白染色复核肿瘤细胞,这是 JAMA 论文强调的标签质量保障。

标注质量的三重保障值得记录为方法论样本:① 人工手绘轮廓由病理专家完成(而非算法预标注+人工修正,当时工具所限反而保证了独立性);② IHC 复核兜底 H&E 判断的不确定区;③ 双中心交叉——两院病理科互为参照,系统性偏倚在合并时被稀释。三者在今天的大规模数据集里未必都做得到,尤其 IHC 复核这一层。

标注流水线:谁在什么条件下画的轮廓

GigaScience 全文披露了标注团队与流程,标签的可信度要从这条流水线理解:

  1. 初筛与手绘:资深实验员(缩写 M.H.,Meyke Hermsen)与临床博士生(Q.M.,Quirine F. Manson)逐张检查切片,在 WSI 上手绘转移区轮廓(CAMELYON16 部分);
  2. 专家复核:全部轮廓由两名乳腺病理专科医生复核修订(CAMELYON17 部分由病理医生 M.v.D. 复核);
  3. 疑难仲裁:slide 级标签(阴性/阳性)存疑时,取连续切片做细胞角蛋白 IHC 染色确认——避免 H&E 上把 ITC 或人工假象看漏/看错;C16 队列中没有 ITC-only 切片(ITC 标签仅出现在 C17,见 FAQ Q6);
  4. 算法交叉复查:1,399 张家族全量发布前,组织方用挑战赛最优算法与金标准比对,分歧切片全部回头人工复查,最终修正 3 张——机器与人互为质检的闭环在 2018 年已完成一轮。

选片策略上,含转移切片按原始病理报告的 macro/micro/ITC 分层随机抽取——在"阴性片占绝对多数"的临床先验下刻意配平阳性子类分布(附录 F 的分层即配平结果)。使用者据此可以放心:阳性子类不是机会样本;但也不能当作人群患病率——约 1:0.69 的阳阴比是设计出来的,不是流行病学事实。

2.6 与派生集的规模对照

数据集 与 CAMELYON16 的关系 规模
CAMELYON16(本条目) 本体 400 WSI(399 评价口径)
CAMELYON17 续作:5 中心、100 患者×5 枚淋巴结 500 WSI(pN 分期)
CAMELYON 合并(GigaScience giy065) 两代合并发布 1,399 WSI + 209 张手绘轮廓
PCam / PatchCamelyon 从 16 的切片上提取 96×96 patch 327,680 patches
CAMELYON17-WILDS 17 的分布外基准封装 450,000 patch / 148 患者

2.7 WSI 读取骨架(OpenSlide)

普通图像库无法直接打开金字塔 TIFF;标准做法是 OpenSlide 按需读取区域:

import openslide

slide = openslide.OpenSlide("tumor_001.tif")
print(slide.level_count)                       # 金字塔层数(该家族常见 10-11 层)
print(slide.level_dimensions)                  # 各层 (宽, 高),层 0 为原始分辨率
print(slide.properties[openslide.PROPERTY_NAME_MPP_X])  # μm/px(normal_144 需特判)

# 读一个 4096×4096 的区域:在第 2 层、位置 (10000, 8000)
region = slide.read_region(location=(10000, 8000), level=2, size=(4096, 4096))

# 均匀切片训练 patch:DeepZoomGenerator
from openslide.deepzoom import DeepZoomGenerator
dz = DeepZoomGenerator(slide, tile_size=512, overlap=0)

要点:read_region 返回 RGBA(使用前转 RGB);坐标单位是"指定 level 的像素"(location 是 level-0 坐标,size 是目标 level 尺寸——以官方文档为准逐项核对);训练管线先做组织区掩膜再采样(附录 U)。

2.8 金字塔与体量的实践含义

影响 说明
内存 单张 level 0 约 10 gigapixels,绝不可整图解码;一律按 region 读
显存 模型输入永远是 patch(典型 256²-512²),slide 级结果靠聚合
磁盘 全量 ~700-900 GB + 转换/缓存翻倍;训练集约一半
下载 Google Drive 大文件分卷;断点续传与校验(字节数/MD5)必须做
稀疏性 组织区仅占切片 ~18%(冠军论文实测 82% 为背景),背景剔除是第一道预处理

§3 任务与评价协议

3.1 双任务定义

CAMELYON16 的任务结构刻意对应临床的两步决策:

  • 任务 1:slide 级分类(whole-slide-image classification)——“这张片子要不要报?”。参赛者为每张测试 WSI 提交一个含转移概率。排名按 ROC 曲线下面积(AUC)。
  • 任务 2:lesion 级定位(tumor localization)——“转移在哪里?”。参赛者为每处预测病灶提交概率 + 像素坐标 (x,y)。排名按 FROC(free-response ROC)。

只做 slide 级的算法可以只用弱标签(一个图一个标签);要做定位则必须利用病灶级标注——这个梯度设计让弱监督与全监督方法同场可比。

3.2 FROC 协议细节

FROC 是检出类任务(乳腺钼靶、肺结节)的标准评价,CAMELYON16 把它引入 WSI 病理并成为后续病理检测挑战的模板:

  1. 每个预测 = 概率 + 坐标;预测与真值病灶按坐标匹配(落入真值轮廓内/距离阈值内计命中);
  2. 在概率阈值扫描下,对每个阈值计算:敏感度(检出的真值病灶比例)与每张正常 WSI 的假阳数(FP/WSI);
  3. 得到 FROC 曲线后,在 6 个预设假阳率工作点取敏感度平均:1/4、1/2、1、2、4、8 FP/WSI;
  4. 该平均值即最终得分(挑战期 Harvard/MIT 冠军 0.6933)。

设计意图:低假阳端(1/4、1/2 FP)考察临床可用性(医生不会接受满屏假警),高假阳端(4、8 FP)考察算法的检出上限。

数值小例(示意算法如何得到一个 FROC 分):设评价集 80 张阴性、49 张阳性共含 100 处真值病灶。某算法在阈值扫描下累计检出-误报对如下(示意):每张阴性片平均 0.25 FP 时检出 45 处(敏感度 0.45);0.5 FP 时 55 处(0.55);1 FP 时 63 处(0.63);2 FP 时 70 处(0.70);4 FP 时 76 处(0.76);8 FP 时 80 处(0.80)。六点平均 = (0.45+0.55+0.63+0.70+0.76+0.80)/6 = 0.648——这就是该算法的 FROC 分。注意:若算法把大量假阳集中在一两张阴性片上(热图整体漂移),同平均 FP 下病灶检出反而可能更差,六点平均会暴露这类缺陷。

两个容易忽略的实现细节:其一,工作点取值是插值不是就近取整——在 FROC 曲线上对 6 个预设 FP 值做插值读敏感度,阈值扫描步长影响插值精度,官方评估代码的做法是复现精度的下界;其二,FP 分母是"每张正常 WSI"(129 张中的 80 张阴性片),不是按全部切片均摊——同样的假阳总数,两种口径分数差约 1.6 倍。JAMA 报告的临床参照点"TPF 72.4% @ 0.0125 FP/正常片"另选了比六工作点更严的点:80 张阴性片 × 0.0125 ≈ 全测试集仅约 1 个假阳——"每 80 张片才错报 1 次"时算法仍能检出 72.4% 的病灶,这才是其与人类可比性的证据点(§4.4)。

3.3 官方评估资源

  • 评估代码:github.com/computationalpathologygroup/CAMELYON16(Python/Matlab,JAMA 论文 Reproducible Research Statement 指定);
  • reference.csv:testing/evaluation 目录下的目标参考文件;
  • ASAP:Radboud 开源 WSI 平台(可视化、标注、分析),组织方推荐用于查看切片与标注;
  • OpenSlide:读取金字塔 TIFF 的标准 C 库(Python 绑定 openslide-python)。

3.4 为什么这个协议成了行业模板

CAMELYON16 之前,病理图像评测多是"准确率一张表";之后,"slide 级 + lesion 级双任务、AUC + FROC 双指标、六工作点平均"成为 WSI 检测任务的默认范式——后续的 TUPAC16、CAMELYON17、lysto(TIL 评估,库内 rid 653)等挑战赛都沿用或扩展了这套结构。对今天的使用者,这意味着:在 CAMELYON16 上训练的模型可以无缝对标十年间积累的公开方法分数;而 FROC 六点平均的分数定义也使跨论文比较有一条硬标尺(前提是 Lesion 判定与匹配规则一致)。

3.5 FROC 与 AUC 的概念对照

维度 AUC(任务 1) FROC(任务 2)
评价单位 一张 WSI 一个概率 一处病灶一个预测(概率+坐标)
横轴 假阳率(FPR,按阴性切片数) FP/WSI(每张全切面假阳病灶数)
纵轴 敏感度(含转移切片被报出比例) 病灶级敏感度(TPF)
汇总 曲线下面积(一个数) 6 个工作点敏感度平均(一个数)
失败模式 聚合后"碰巧"得分(大片假阳抬热图) 无法用聚合掩盖——坐标错了就匹配不上
临床语义 “这张要不要复筛” “病灶在哪、漏了多少”

两指标不可互相推导:挑战期 EXB 在 AUC 榜第 2 而在 FROC 榜第 3,Radboud DIAG 在 AUC 榜无名次却居 FROC 榜第 2——算法完全可能在"报片"上强、在"找病灶"上弱,或反之。报告任何一侧都不构成对另一侧的断言。

3.6 与同期评价实践的比较

CAMELYON16 之前,病理检测论文多自定义阈值与"准确率/召回率"单点数字,跨论文不可比;其引入的"六工作点 FROC + 公开评估代码 + reference 文件"组合,把病理检出任务推进到检测学界(PASCAL VOC/COCO 式)的协议化水平。今天病理 WSI 挑战(lysto、TUPAC、PANDA 等)的评估页几乎都可视为这一模板的直接后代——评价协议本身是 CAMELYON16 最常被低估的贡献。

§4 挑战赛结果与人类对比实验

4.1 挑战期 Leaderboard 1:slide 级分类(AUC)

截止 2016-04-01 的前五名(官网 Results 页原样):

排名 队伍 AUC 提交日期
1 Harvard Medical School and MIT, Method 1 0.9234 2016-04-01
2 EXB Research and Development co., Germany 0.9156 2016-04-01
3 Independent participant, Germany 0.8654 —
4 Middle East Technical University (EEE/NSNT/HS), Turkey 0.8642 —
5 NLP LOGIX co., USA 0.8298 —

赛后公开榜(含全部后续提交,官网口径;* 号 = AUC 超过本研究病理医生):

排名 队伍 AUC 提交日期
1 * Harvard/MIT, Method 2 (updated) 0.9935 2016-11-06
2 * Harvard Medical School, Gordon Center for Medical Imaging, MGH, Method 3 0.9763 2016-10-24
3 Harvard/MGH, Method 1 0.9650 2016-09-07
4 The Chinese University of Hong Kong (CU lab), Method 3 0.9415 2016-08-29
5 Harvard/MIT, Method 1 0.9234 2016-04-01
6 EXB Research and Development co., Germany 0.9156 —
7 CUHK, Method 1 0.9086 2016-06-08

4.2 挑战期 Leaderboard 2:lesion 级定位(FROC)

截止 2016-04-01 的前五名:

排名 队伍 FROC 分 提交日期
1 Harvard Medical School and MIT, Method 1 0.6933 2016-04-01
2 Radboud University Medical Center (DIAG), Netherlands 0.5748 2016-04-01
3 EXB Research and Development co., Germany 0.5111 2016-04-01
4 Middle East Technical University, Turkey 0.3889 —
5 NLP LOGIX co., USA 0.3859 —

赛后公开榜前二:Harvard/MIT Method 2 (updated) 0.8074(2016-11-06)、Harvard/MGH Method 3 0.7600(2016-10-24)。

注意挑战期与赛后的分差:三个月的赛后迭代把 FROC 从 0.6933 推到 0.8074、AUC 从 0.9234 推到 0.9935——挑战赛 deadline 与方法成熟之间存在系统性时滞,这是引用"挑战赛成绩"时最常见的时代错位(坑 6)。

读榜三则:① AUC 榜前二(Harvard/MIT、EXB)与 FROC 榜前二(Harvard/MIT、Radboud DIAG)名次并不同构——聚合指标与定位指标各说各话;② 赛后榜头名(AUC 0.9935)恰好也是 JAMA 报告的"最佳算法",引用 JAMA 数字即引用赛后口径;③ 榜单分数保留四位小数是官网原样——有效数字末位受 129 张样本的方差影响,跨方法比较应关注 0.01 量级以上的差距,别把第四位小数当真。

4.3 冠军方法:完整管线拆解

Harvard/MIT 团队(Wang, Khosla, Gargeya, Irshad, Beck;arXiv:1606.05716)的技术报告是理解"2016 年最优 WSI 检测长什么样"的标准样本,也是后来弱监督 WSI 分类(MIL 范式)的雏形。四步管线:

第一步:背景剔除。在 HSV 色彩空间做 Otsu 自动阈值分割,区分组织区与空白背景——训练 WSI 约 82% 面积是背景,剔除后 patch 采样量与训练成本都降一个量级。这步今天仍是几乎所有 WSI 管线的标配开场(骨架代码见附录 U)。

第二步:patch 级监督训练。在组织区内抽取 256×256 像素 patch(40× 倍率),用病灶级 XML/mask 标注判定每个 patch 含转移与否,以数百万个 patch 训练 GoogLeNet(27 层、逾 600 万参数)。两个有记录的设计决策:①倍率消融——40×/20×/10× 三档对比中 40× 最优,因为微转移与 ITC 的判别特征(单个异型细胞、小细胞簇)只在最高倍率可辨;②架构消融——GoogLeNet patch 分类准确率 98.4%,高于 VGG-16 的 97.9% 与 AlexNet 的 92.1%,且参数量远小于 VGG-16,2016 年的算力条件下两者兼得。

第三步:hard negative mining。第一版模型会混淆"组织学模拟物"(histologic mimics)——形态上酷似转移的良性结构:反应性改变的淋巴细胞、巨噬细胞、内皮细胞簇与组织挤压人工假象。团队把这些高置信误报 patch 回收进训练集重训,迭代数轮。这一步对 FROC(而非 AUC)影响显著:slide 级聚合可以稀释少量误报,病灶级定位不行。

第四步:热图后处理双轨输出。patch 概率铺回 WSI 形成热图,此后分两路:

  • slide 级:从热图提取 28 个几何/形态特征(最高 patch 概率、高概率区面积/周长/长宽比、空间分布统计等),喂给随机森林输出最终 slide 概率——这个"CNN + 手工特征 + 浅层分类器"的组合在今天看是过渡形态,但在端到端聚合(attention-MIL)出现前是最优解;
  • lesion 级:热图按 0.90 阈值二值化 → 连通域分析 → 取连通域中心点为病灶坐标,病灶概率取连通域内 patch 概率聚合;最终提交版用 D-I / D-II 两个模型的概率平均稳定输出。

成绩口径(三者并存,见坑 6):自报 AUC 0.925 / FROC 0.7051(论文口径,称 FROC 比第二名 0.5761 高约 22%);官网挑战期榜 0.9234 / 0.6933(2016-04-01 截止);赛后更新版 0.9935 / 0.8074(2016-11-06,JAMA 采用)。Wang 报告另载:AI 与病理医生判读结合 AUC 达 0.995,人类错误率约降 85%。

该团队的谱系值得记录:核心成员此后进入 Google,发展为 Google Health 乳腺癌 AI(Liu et al., JAMA 2018 转移检测验证研究)——CAMELYON16 因此是"挑战赛→工业级临床 AI"路径的最完整案例之一。

4.4 JAMA 人类对比实验:完整数字

JAMA 2017 论文(Ehteshami Bejnordi 等,the CAMELYON16 Consortium)的设计与结果(摘要原样数字,Europe PMC 实抓):

设计:11 名荷兰病理医生在限时(WTC,约 2 小时读 129 张,模拟常规工作流)下对测试集给出五档置信度(definitely normal / probably normal / equivocal / probably tumor / definitely tumor);另 1 名专家病理医生不限时(WOTC)精读同一集合。测试集金标准经 IHC 验证。

结果:

指标 数值 口径
算法 AUC 全距 0.556–0.994 全部提交
最佳算法 AUC 0.994(95% CI 0.983–0.999) Harvard/MIT Method 2
WTC 医生组 mean AUC 0.810(range 0.738–0.884) 11 人
显著性 最佳算法 vs WTC:P<.001 —
top5 算法 mean AUC 0.960(range 0.923–0.994) 挑战期 top5
WOTC 专家 AUC 0.966(95% CI 0.927–0.998) 1 人
lesion 级 最佳算法在 0.0125 FP/正常片 下 TPF 72.4%(95% CI 64.3–80.4),与 WOTC 专家相当 —

结论原话(JAMA):“some deep learning algorithms achieved better diagnostic performance than a panel of 11 pathologists participating in a simulation exercise designed to mimic routine pathology workflow; algorithm performance was comparable with an expert pathologist interpreting whole-slide images without time constraints.”(部分算法优于限时模拟中的 11 人医生组;与不限时阅片的专家相当。)论文同时强调:临床效用仍需临床环境验证。

解读的三条边界(JAMA 与后续文献共识):

  1. WTC 是模拟,不是真实读片工作流;2 小时读 129 张远快于临床常规;
  2. WOTC 专家只有 1 名——"专家水平"的方差未覆盖;
  3. 任务限于二元转移检测;实际诊断还需更多临床信息。

4.5 影响与传播

官网存档的传播事实:32 份提交 / 23 支队伍;结果被 Google Research Blog、NVIDIA blog、Engadget、Daily Mail 等报道,并进入白宫《国家 AI 研发战略计划》报告;"深度学习阅读病理切片不输医生"自此成为可引用的同行评审结论。组织方负责人 Babak Ehteshami Bejnordi 对媒体的回忆:“We were shocked to see that the algorithms could do so well so quickly.”

全体 32 份提交的生态画像(JAMA Table 2)

JAMA 论文 Table 2 用统一评估代码重跑了全部 32 份提交。除冠军外,榜单骨架里还有几类值得记录的参与者:

  • 第二名 Radboudumc Method I(FROC 0.575):主办方自家队伍,VGG-Net + 大规模数据增强 + 两段式 CNN——"内部人"与外部冠军的差距(0.575 vs 0.807)恰好度量了 2016 年方法学的传播速度;
  • SegNet 一族(Quincy Wong,AUC 0.865):语义分割架构直接用于 patch 判别——证明"分割网络做分类"在该任务可行但非最优;
  • 浅层 CNN(METU,4 层,AUC 0.864):4 层网络与深网络在 slide 级差距很小——聚合效应放大了 patch 级的边际改进;
  • AlexNet + 随机森林(NLP LOGIX,AUC 0.830):与冠军"patch CNN + RF 后处理"同构但缺 hard negative mining,分数差距即是该技巧的价值刻度;
  • 非深度学习对照组(如 Tampere,随机森林 + 强度/纹理特征):传统特征工程方法整体落在深度方法之后,JAMA 将此视为深度学习价值的正面证据;
  • 长尾(Minsk、CAMP-TUM 等):AUC 0.556 的下界同样有信息量——同一数据、同一协议下,预处理、patch 采样与聚合策略的实现细节足以造成 0.44 的分差。

对使用者的启示:方法谱系比名次更有复用价值——冠军管线的每一步(背景剔除、patch 大小/倍率、难例挖掘、聚合方式)此后都被单独拆出来做消融,构成 WSI 方法学教科书的标准章节(附录 R)。

4.6 人类对比实验的方法学解剖

JAMA 实验的设计细节值得逐条拆开看,因为它是后续无数"AI vs 医生"研究的方法模板:

  1. 双条件设计:WTC(11 名医生、约 2 小时、129 张)模拟"日常忙碌状态";WOTC(1 名专家、不限时)给出"人类可达上限"。单一条件会高估或低估算法相对地位,双条件才能钉住区间。
  2. 五档置信度:医生对每张片给 definitely normal / probably normal / equivocal / probably tumor / definitely tumor——这使得 AUC 可从有序评分直接估计,而非二值"对错"。
  3. 金标准前移:测试集转移状态经 IHC 验证,避免"以 H&E 复核 H&E"的循环论证。
  4. 把"输赢"翻译成工作点:报告不止 AUC,还包括 lesion 级"在医生可接受的假阳率下算法能检出多少"(72.4% TPF @ 0.0125 FP/正常片)——比一句"更准"更有临床操作意义。
  5. 限制条款写足:模拟非真实工作流、专家样本 n=1、任务限于二元检测、临床效用待验证——这些限定在转引时经常被删掉(坑点之一)。

4.7 算法-医生结合的提示

Wang 论文与 JAMA 报告均指向同一方向:把算法输出与医生判读结合可显著降低错误率——医生不是被替代,而是获得了一个"不会疲劳的第二读片人"。这一结论后来成为数字病理 CAD(computer-aided diagnosis)产品的标准论证结构。

4.8 挑战运营事实(官网时间线复述)

从运营视角看时间线,有三个设计选择值得注意:

  1. 分批放数据:注册开放(2015-11-25)当天即给出 170 张训练集,5 周后补第二批 100 张——让早入场者先搭管线,同时保持"数据在持续放出"的社区热度;
  2. 测试集晚放、截止早定:测试集 2016-03-01 发布、4-01 截止,只给一个月窗口,压缩了在测试集上过拟合的空间;
  3. 赛后窗口:提交页面在 4-14 重开并保留至 11 月,产生"赛后更新榜"——这解释了挑战期/赛后分数的系统性差异(坑 6),也给了方法迭代与论文写作的时间。

workshop 于 2016-04-13 在 IEEE ISBI 2016(布拉格)举行,挑战赛结果与方法在那里首次集中发布——"ISBI 2016"因此常被写作挑战赛的时间标签,但论文载体始终是 JAMA(坑 2)。

4.9 结果的可靠边界(复述 JAMA 结论条款)

为防转引失真,把 JAMA 结论的完整限定抄录如下:“In the setting of a challenge competition, some deep learning algorithms achieved better diagnostic performance than a panel of 11 pathologists participating in a simulation exercise designed to mimic routine pathology workflow; algorithm performance was comparable with an expert pathologist interpreting whole-slide images without time constraints. Whether this approach has clinical utility will require evaluation in a clinical setting.”

四个限定词一个都不能丢:challenge competition(挑战赛设定)/ simulation exercise(模拟)/ some algorithms(部分算法)/ require evaluation in a clinical setting(临床效用未证)。

§5 获取与许可:CC0 意味着什么

5.1 下载渠道总表

渠道 地址/方式 说明
官方下载页 https://camelyon16.grand-challenge.org/download/ JAMA 论文指定;含训练/测试各镜像
Google Drive 经官方下载页跳转 主力镜像(FLamby 提供自动化脚本)
GigaDB gigadb.org/dataset/100439 GigaScience giy065 论文的官方数据记录
camelyon17 官网 camelyon17.grand-challenge.org/Data/ 挑战结束后官网迁移的承载页
百度网盘 第三方转存镜像 中文用户渠道;FLamby 记载其为官方镜像之一(坑 7)
评估代码 github.com/computationalpathologygroup/CAMELYON16 Python/Matlab 评估器 + reference
工具 openslide.org / github.com/GeertLitjens/ASAP WSI 读取与可视化标准件

5.2 许可条款

数据集本体:CC0 1.0 Universal。三个独立生态源(FLamby、owkin HistoSSLscaling、HistoSSLscaling 数据许可表)一致记录;CC0 的含义:

  • 无署名强制、无商用限制、无衍生限制——你可以直接拿去训练、再分发、商业化而无需请求授权;
  • 学术礼仪仍建议引用 JAMA 2017(结果论文)与 GigaScience 2018(数据论文);
  • 唯一注意:论文文本(JAMA)版权归 AMA,CC0 只覆盖数据;引用观点引论文,使用数据走 CC0。

伦理背景(GigaScience/FLamby 口径):数据采集经 Commissie Mensgebonden Onderzoek regio Arnhem-Nijmegen 伦理委员会批准(编号 2016-2761),知情同意豁免——这也是 CC0 公开的合规基础。

"知情同意豁免 + CC0"的组合值得单独说明:病理切片属于临床剩余组织,逐患者重新联系授权在操作上不可行;荷兰伦理体系允许在"不可识别个人 + 伦理委员会批准"前提下豁免同意——400 张 WSI 因此以去除直接标识符的形式发布。使用者仍有残余义务:不得尝试重识别;衍生数据集再发布时继承 CC0 并保留溯源信息(引用 GigaDB 100439)。

与同家族及同期数据集的许可对照(规模与年代详见附录 T):

许可模式 代表数据集 对使用者的实际门槛
CC0 1.0(公有领域贡献) CAMELYON16/17、PCam 零:训练、再分发、商用均无需授权
CC BY-NC-SA(署名-非商业-同许可) PANDA(rid 560) 署名 + 禁商用 + 许可传染
注册/申请制 BACH、BRACS(rid 138)、BreakHis(rid 126) 提交身份说明、等待批准、部分禁商用
受控访问 TCGA 受控层等(本家族不涉及) 逐项目审批

CAMELYON16 是同期 WSI 检测数据集中罕见的"零门槛"组合——这不是运气而是组织方的明确决策(GigaScience 论文设专节讨论数据可用性),也是其生态位(教程/基准/基础模型语料)的直接成因。

5.3 下载决策树

你要做什么?
├── 只想快速入门 WSI 病理 AI
│   └── 先用库内 PCam(rid 158,327,680 张 96×96 小图,单 GPU 可训)
├── 要做 slide 级弱监督分类研究
│   ├── 1) 官方下载页拉训练集(270 张,约一半体量)
│   ├── 2) OpenSlide/ASAP 读图,XML/mask 做 patch 监督
│   └── 3) 测试集自评需官方评估代码(reference.csv 在 evaluation 目录)
├── 要做 lesion 级定位/FROC 研究
│   ├── 训练标注在 lesion_annotations.zip(XML + mask)
│   └── 严格按 §3.2 六工作点协议出分,勿自造指标口径
├── 要做联邦学习/多中心实验
│   └── FLamby Fed-Camelyon16(按中心分客户端的现成封装)
└── 要做大规模预训练
    └── 全量 399 张仅 ~700-900 GB,可与其他 WSI 语料合流;注意体量与存储预算

5.4 实操注意

  1. 磁盘预算:全量 ~700-900 GB,解压/转换再翻倍;训练集约一半。
  2. 读取库:普通 PIL/OpenCV 读不了金字塔 TIFF;用 OpenSlide(Python:openslide-python)或 ASAP;大图切片用 DeepZoomGenerator。
  3. normal_144.tif 缺 spacing metadata(MathWorks 提示):涉及 μm/px 的管线逐张校验。
  4. 体量口径分歧:700 GB(kaiko)与 900 GB(FLamby)都是实测口径,取决于是否含测试标注包(坑 5)。
  5. 测试集无标签:任何"在测试集上调参"都是污染;自评用官方评估器,对外报告注明分数来源(自评 vs 官方榜)。

5.5 环境搭建速查

# WSI 读取
pip install openslide-python          # 系统层需先装 openslide(apt install openslide-tools / brew install openslide)
# 可视化与标注查看
# ASAP:github.com/GeertLitjens/ASAP 提供桌面版与转换器
# 官方评估
git clone https://github.com/computationalpathologygroup/CAMELYON16.git
# 常见配套
pip install scikit-image pandas       # 组织掩膜、XML 解析后处理

排错三则:① openslide-python 装上却报找不到 libopenslide——先装系统库再装 Python 包;② Google Drive 大文件用脚本下载时注意配额耗尽报错,换镜像重试;③ 解压后先 ls 校验目录树(§2.1 结构),缺 evaluation 目录的转存包不要用(坑 7)。

5.6 引用与署名礼仪

CC0 不强制署名,但学术规范建议:使用数据引 GigaScience 2018(数据论文);引用挑战结果/人类对比引 JAMA 2017;使用 PCam 派生数据引 Veeling et al. 2018;使用评估代码引其 GitHub 仓库与 JAMA。产品化场景在文档中声明数据来源与版本(下载时点)是稳妥实践。

§6 版本链与生态:从挑战赛到数据家族

6.1 CAMELYON 家族时间线

时点 事件
2015-10-15 挑战赛网站上线
2015-11-25 注册开放;第一批训练集(170 张)发布
2015-12-30 第二批训练集(100 张)发布
2016-03-01 测试集发布
2016-04-01 提交截止
2016-04-13 挑战 workshop(IEEE ISBI 2016,布拉格)
2016-06 冠军技术报告上 arXiv(Wang et al. 1606.05716)
2016-11 挑战结束;赛后更新榜(AUC 0.9935 / FROC 0.8074);CAMELYON17 开放注册(11-20)
2017-12-12 JAMA 论文刊出(318(22):2199-2210)
2018-05-31 GigaScience 数据论文(giy065):两代 1,399 WSI 合并发布
2018 PCam 论文(Veeling et al., MICCAI 2018);Stanford 发布 CAMELYON17-WILDS

6.2 直系派生与谱系

  • CAMELYON17(2016-2017):5 家荷兰中心(RUMC、UMCU、CWZ、RST、LPON)、100 名患者×5 枚淋巴结、任务改为 pN 分期(patient-level);同年挑战,2018 年与 16 合并发布。
  • GigaScience 合并数据集(giy065):1,399 WSI、3 TB、每张带四分类 slide 标签、209 张含手绘转移轮廓;附开源可视化工具。库内条目 **camelyon16-17(rid 33)**即此合并视角。
  • PCam / PatchCamelyon(Veeling et al., MICCAI 2018):从 CAMELYON16 切片提取 327,680 张 96×96 patch 的二分类集,“比 CIFAR10 大、比 ImageNet 小、单 GPU 可训”,是无数教程与弱监督方法的入门基准。库内条目 pcam(rid 158)。
  • CAMELYON17-WILDS(Stanford WILDS):把 17 封装为分布外(distribution shift)基准:450,000 patch / 148 患者,考察跨医院泛化——WILDS 论文的标准数据集之一。

6.3 对行业的影响

  1. 范式确立:首个 WSI 挑战确立"slide 级 + lesion 级、AUC + FROC"评价范式,后续病理挑战(TUPAC16、lysto、PANDA 等)全部继承。
  2. 方法学谱系:冠军的 patch-CNN + 聚合管线是 MIL(多实例学习)在病理落地的先声;如今 attention-MIL、聚类聚合(DeepMIL/CLAM 一族)都在 CAMELYON16 上有标准基准位。
  3. 产业路径:冠军团队→Google Health(Liu et al. JAMA 2018)→后代病理基础模型的预训练语料常客(CAMELYON 家族出现在 owkin Phikon、PLIP 等模型的训练/评测组合中)。
  4. 叙事拐点:JAMA 论文把"AI vs 病理医生"变成有数字的命题,其双条件结论(优于限时、堪比不限时)至今仍是这类研究的表述模板。

6.4 使用今天的视角回看的局限

  • 仅 2 家中心、2 种扫描设备——跨中心泛化要等 CAMELYON17 的 5 中心设置;
  • 二元标签为主,四分类(normal/ITC/micro/macro)细分标签是后来 GigaScience 才系统发布;
  • 测试集 129 张、单机构金标准复核,样本规模以今天标准偏小;
  • patch 级监督来自手绘轮廓,轮廓质量受当年标注工具限制(ASAP 已是当时最佳)。

6.5 家族之外的"远亲"影响

  • 挑战赛生态:CAMELYON16 之后,医学影像 Grand Challenge 成为方法学发布的主流载体之一;grand-challenge.org 平台本身也在此后承载了包括 lysto(TIL 评估)、PANDA 等数百场挑战。
  • "病理 ImageNet"叙事:其成功直接刺激了后续大规模病理语料(TCGA 泛癌、NCT-CRC-HE-100K、PLIP 等)与病理基础模型(Phikon、UNI、Virchow 一族)的路线图——这些模型几乎都在 CAMELYON 家族数据上做过预训练或评测。
  • 监管与方法学讨论:JAMA 论文成为 FDA/学术圈讨论"AI 辅助诊断评价(-reader study、FROC、多中心验证)"时的常用引用点;其"挑战赛成绩 ≠ 临床有效性"的限定语也被监管文献反复重申。
  • 中文社区:百度网盘镜像、CSDN/博客教程、FLamby 中文文档使该数据集成为国内病理 AI 入门事实标准之一——镜像可靠性因此成为实用问题(坑 7)。

6.6 引用谱系:三条论文线

以本数据集为原点,公开文献形成三条清晰的引用线:

  1. 结果与方法线:JAMA 2017(组织方总报告)← Wang et al. 2016(冠军方法)→ Liu et al. 2018(Google Health 谱系的临床验证研究,JAMA)——从挑战赛到产业验证的完整链条。
  2. 数据资源线:GigaScience 2018(giy065,家族合并发布)← CAMELYON17 结果论文(Bandi et al., 2018,pN 分期任务)→ WILDS 2021(分布外基准封装)——数据侧的三级放大。
  3. 派生基准线:PCam(Veeling et al., MICCAI 2018)→ 海量弱监督/MIL 论文的入门实验 → 病理基础模型时代(Phikon、UNI、Virchow 等)把家族数据纳入预训练/评测语料。

检索建议:沿"引用 JAMA 2017 + 关键词 weakly supervised/MIL/FROC"可高效定位十年间的公开方法及其分数;沿"引用 giy065"可定位数据使用与扩展研究。

§7 方法学启示:六条可迁移的经验

  1. 双任务设计揭示"分类对≠定位对"。挑战期 FROC 榜与 AUC 榜的名次并不同构(如 Radboud DIAG 分类未进前五但 FROC 第二)——slide 级聚合可以掩盖定位缺陷。任何检出类任务都应分层报告,别让聚合指标遮蔽病灶级失败。
  2. 评价协议先于算法。CAMELYON16 的 FROC 六工作点、IHC 验证金标准、限时/不限时双条件人类对照,全部在比赛前定死——结果因此经得起十年引用。做数据集/挑战赛,协议设计是本体,不是附属。
  3. CC0 是数据集影响力的放大器。无注册、无审批、无许可歧义,使 CAMELYON16 成为教程、基准、基础模型语料的默认选择;对比同期"申请制"数据集,其引用与复用断层领先。许可自由度直接转化为生态位。
  4. 赛后窗口是协议的一部分。4 月截止、11 月结束、JAMA 年底刊出——把"赛后迭代"合法化并纳入报告体系(挑战期/赛后双榜并存),避免了"一次考试定终身"的过拟合与运气冠军。设计长周期评测时,这是比"永不公开测试集"更务实的折中。
  5. 难例要专门治理。冠军方法的 hard negative mining 揭示:WSI 检测的最大噪声不是背景而是"组织学模拟物"——形态上酷似转移的良性结构(§4.3)。通用数据增强解决不了这类错误,必须把模型的高置信误报回收进训练集。"挖掘高置信假阳再训练"由此成为检测类任务的通用处方。
  6. 过渡形态也有档案价值。冠军的"28 个手工特征 + 随机森林"后处理在两年内被端到端聚合全面取代——但正是这层组合让方法在 2016 年的算力上跑完全程并留下可复现基线。读老方法别急着否定过渡形态:每一层"当时的最优妥协"都标注了后来范式革命的成本线。

§8 与库内条目的关系

库内条目(rid) 关系 互链建议
camelyon16-17(33) 同一来源合并视角(1,399 WSI,GigaScience 口径) 本条目管 16 代挑战与人类对比;33 管全家族数据体量与四分类标签
pcam(158) 直接派生(327,680 张 96×96 patch) 入门→原版递进阅读
lysto(653) 同谱系 WSI 挑战(TIL 评估,Radboud 参与) FROC/评价协议互文
bracs(138) 乳腺癌病理图像(VIA/IHC 7 类) 乳腺癌图像分类家族
breakhis(126) 乳腺癌显微镜图像(良性/恶性 8 类) 显微镜级 vs WSI 级对照
panda(560)/ panda-plus(640) 前列腺 WSI 挑战与其重标注 跨癌种 WSI 挑战范式互文(Gleason vs 转移检测)

检索词组合:“CAMELYON16”(精确)+ “lymph node” + “metastasis”;区分 CAMELYON17 与 PCam(坑 1);引用人类对比结论时必须带 WTC/WOTC 条件限定。

检索卫生两条:一、命中"CAMELYON dataset"字样的论文先核对 DOI 分流(JAMA=16 代结果,GigaScience=合并资源,MICCAI=PCam);二、二手文献中的"冠军分数"先问是 4 月榜还是 11 月榜(坑 6),再决定是否可比。

§9 避坑清单:八个已踩过的坑

坑 1:CAMELYON16 ≠ CAMELYON17 ≠ PCam ≠ camelyon16-17。四个名字指四件相关但不同的事:16 是 400 WSI 检测挑战(本条目);17 是 5 中心 pN 分期挑战;PCam 是 16 派生的 patch 分类集;库内 rid 33 是 16+17 合并发布(1,399 WSI)的条目。文献常混用"CAMELYON dataset"一词,引用前先核对 DOI(JAMA 2017 = 16;GigaScience 2018 = 合并;MICCAI 2018 = PCam)。

坑 2:"IEEE T-MI 2017"不是发表载体。常见误记(本条目生产时的候选 brief 亦如此写)把 CAMELYON16 论文安在 IEEE Transactions on Medical Imaging 上;正式结果论文是 JAMA 2017;318(22):2199-2210(官网 Publication 栏只列 JAMA)。IEEE 系期刊上确有大量使用 CAMELYON16 的论文,易被误当出处。

坑 3:测试集 130 vs 129 双口径。官网发布 130 张;官方确认 1 张为重复并剔除,JAMA 评价与全部后续生态(GigaScience、FLamby、kaiko-ai)按 129 张/总量 399 口径。报告"测试集规模"必须注明口径;复现 AUC/FROC 时样本数对不上多半源于此。

坑 4:二元标签 vs 四分类标签。挑战评价用二元(正常/含转移);GigaScience 发布四分类(normal/ITC/micro/macro)。把 ITC/micro 切片当"正常"或把四分类直接当二元用都会造成标签语义漂移——尤其 ITC 尺寸极小(≤0.2 mm),对弱监督训练是噪声敏感区。

坑 5:体量口径 700 GB vs 900 GB vs 451 GB。全量口径 700 GB(kaiko-ai)与 900 GB(FLamby)均为实测(是否含标注包/金字塔层差异);MathWorks 的 451 GB 只算训练部分。规划存储时取 ~1 TB 上限,训练集减半。

坑 6:挑战期分数 vs 赛后分数。AUC 0.9234/FROC 0.6933 是 2016-04-01 截止成绩;AUC 0.9935/FROC 0.8074 是 2016-11-06 赛后更新版(同队 Method 2)。引用"冠军成绩"不注日期会产生 0.07-0.30 的分数漂移;JAMA 使用的最优算法即赛后版本。

坑 7:中文渠道的镜像可靠性。百度网盘等第三方转存是社区自发镜像,存在转存不全/版本混杂风险(如缺 lesion_annotations 或 evaluation 目录);生产环境以官方下载页 + GigaDB 100439 为准,第三方镜像仅作应急。

坑 8:209 张手绘轮廓是家族口径。209 = CAMELYON16 的 159 张含转移 WSI(训练 110 + 测试 49)+ CAMELYON17 的 50 张阳性 node WSI(GigaScience 家族总量)。只研究 16 代时应写"训练 110 张带轮廓"——把 209 安在 16 头上,会误以为测试侧 49 张的轮廓随数据包公开可得(实际在官方评估侧)。

§10 总结

CAMELYON16 用一场挑战赛完成了三件事:发布了第一个大规模 WSI 公开数据集(400 张,CC0),确立了一套沿用至今的检测任务评价范式(双任务 + AUC + FROC 六点),并给出了"深度学习 vs 病理医生"的第一个严格盲测答案(优于限时医生组、与不限时专家相当)。它的直系后代(CAMELYON17、PCam、WILDS)构成了病理 AI 的基础设施层,而它的人类对比实验仍是方法论教科书:条件明确的比较、IHC 验证的金标准、以及把"算法赢了"的表述钉在具体限制上。十年后回看,CAMELYON16 最大的遗产不是某个分数,而是它示范的这种把临床问题、数据工程与评价科学捆在一起做的方式。

三段话给三类读者:

  • 给数据工程师:这是一个"获取零摩擦、使用高门槛"的数据集——CC0 与多镜像让下载不是问题,真正的成本在 WSI 工程化(内存、金字塔、spacing、patch 采样、染色漂移)。把它当作进入数字病理数据工程的"全装备训练营":做完一遍,后续任何病理数据集都是简化版。
  • 给算法研究者:这里有十年积累的公开分数、被反复复现的 FROC 协议、以及一个"弱监督能走多远"的天然实验场(slide 标签 vs 病灶轮廓的监督梯度)。发新方法前先在 129 张上对官方评估器自评——它是病理检测领域最便宜的"预审"。
  • 给临床与院方读者:JAMA 实验的正确读法不是"AI 取代病理医生",而是"限时工作流下的漏检风险有了一个不知疲倦的补救工具"。算法-医生结合显著降错的结论,才是这段历史对临床管理最有行动价值的部分。

FAQ:三十二问

Q1:CAMELYON16 数据集现在还能下载吗?
能。CC0 发布永久有效,官方下载页(camelyon16.grand-challenge.org/download/)与 GigaDB 100439 都在。挑战结束后部分入口迁移到 camelyon17 官网 Data 页,但链路完整。

Q2:需要注册账号吗?
下载不需要。当年挑战赛注册(2015-11 开放)只服务于提交分数;如今直接下载无需任何账号。

Q3:训练集的 XML 标注长什么样?
每个含转移训练 WSI 对应一个 XML 文件,内含若干 <Annotation> 节点,每处转移病灶一组轮廓顶点坐标(X/Y 像素值)。配套的二值 mask 是这些轮廓的栅格化结果,两者语义等价。

Q4:测试集为什么没有标签?
测试集标签由组织方持有,用于防作弊的公正排名。配套的评估代码与 reference.csv(在 testing/evaluation 目录结构内)允许使用者自评——但对外宣称分数时应注明是官方评测还是自评。

Q5:IHC 验证是什么意思?
免疫组化(细胞角蛋白染色)对疑难病例复核肿瘤细胞,是转移判定的辅助金标准。JAMA 论文用"verified by immunohistochemical staining"描述测试集标签质量——这使 slide 级标签比纯 H&E 复核更硬。

Q6:ITC、微转移、宏转移对模型训练有什么实际影响?
四分类口径下 ITC(≤0.2 mm)极小,patch 级监督信号稀疏;二元口径下它们都是"阳性"。若用四分类标签做二元训练,注意 ITC 切片可能整片只有几十个肿瘤细胞——是难例挖掘与漏检分析的最佳素材,也是弱监督方法最容易翻车的地方。

Q7:训练集正常:阳性 = 160:110,需要重采样吗?
比例接近 3:2,不算严重失衡。但 patch 级采样后阴性 patch 占比会远高于此(正常组织占切片面积绝大多数),真正的失衡在 patch 层——冠军方法就先剔除了 82% 的空白背景。

Q8:PCam 和原版 CAMELYON16 该用哪个?
入门/快速实验用 PCam(96×96 patch,单 GPU);研究 slide 级聚合、定位、多实例学习用原版。PCam 的 patch 标签与原版病灶轮廓不完全可逆映射,分数不可跨集比较。

Q9:AUC 0.994 是"解决了"这个任务吗?
不是。0.994 是赛后更新版在二元 slide 级任务上的成绩;lesion 级 FROC 0.8074 仍有明确提升空间,且 AUC 高分只在"二元 + IHC 验证金标准 + 129 张"这一特定设置内成立。四分类、跨中心泛化(CAMELYON17-WILDS 的主题)都远未解决。

Q10:为什么 MathWorks 说训练集是 159 normal + 111 tumor?
MathWorks 文档笔误(其自身教程中还提示剔除缺 metadata 的 normal_144)。官网与 JAMA 的 160/110 是权威口径(坑 2/坑 5 参照)。

Q11:Wang et al. 论文和 JAMA 论文什么关系?
Wang et al.(arXiv:1606.05716)是冠军队伍自己的技术报告,含方法细节;JAMA 2017 是组织方视角的正式结果论文,含全部队伍成绩与人类对比。方法细节引 Wang,总体结论与榜单引 JAMA。

Q12:FROC 六个工作点为什么选 1/4 到 8 FP/WSI?
跨两个数量级的假阳率区间,下端(1/4)对应"几乎零误报"的临床可用区,上端(8)考察检出上限。六点平均比单点 AUC 类指标更能惩罚"只在某个阈值附近好"的算法。

Q13:挑战期 0.6933 与赛后 0.8074 的 FROC 分数哪个该引用?
都要注日期。讲"挑战赛成绩"用 0.6933(2016-04-01);讲"该方法的最终水平"用 0.8074(2016-11-06 更新版,JAMA 亦采用赛后最优)。混用不注日期是二手文献最常见的数字漂移。

Q14:可以用 CAMELYON16 训练商业产品吗?
CC0 无任何法律障碍(数据层面)。但注意:临床落地另有医疗器械法规路径;论文观点引用受 JAMA 版权约束;若与其他数据混合训练,遵守各自许可。

Q15:联邦学习怎么用这个数据集?
FLamby(fed_camelyon16)把两中心当两个客户端做了现成封装(RUMC 243 / UMCU 156,399 口径),含 DeepMIL 基线与 AUC 评估,是跨机构联邦实验的即插即用起点。

Q16:normal_144.tif 有什么问题?
该文件缺少推导物理尺寸(μm/px)所需的关键 metadata。任何把像素坐标转物理尺寸(如按 TNM 毫米标准分级)的管线都要逐张校验 spacing,不能假设一致。

Q17:209 张手绘轮廓怎么算出来的?
CAMELYON 家族口径:16 代的 159 张含转移 WSI(训练 110 + 测试 49)+ 17 代的 50 张阳性 node WSI = 209(GigaScience)。仅 16 代范围时:训练 110 张全带轮廓(XML+mask 随数据包发布),测试 49 张的轮廓在官方评估侧。引用 209 时注明是 16+17 家族总量(坑 8)。

Q18:能自己划分 train/val 吗?
可以且常见(kaiko-ai 等按 PCam 划分把 270 训练切成 216/54)。但对外报分数必须用官方 129 张测试集;内部 val 划分要注明策略。

Q19:测试集那 1 张重复切片是哪张?
官方公告确认存在 1 张重复并从评价中剔除,但切片编号未在我们抓取的三源中明示。复现时以官方评估代码与 reference.csv 的实际计数为准(129)。

Q20:下一步读什么?
想深入评价方法:读 JAMA 论文 Methods 与 FROC 定义原文。想深入方法谱系:读 Wang et al.(冠军)、Courtiol et al.(CLAM 系聚类聚合)、FLamby(联邦基线)。想横向扩展:库内 camelyon16-17(rid 33)看家族全貌,pcam(rid 158)看派生基准,lysto(rid 653)看同谱系 TIL 评价。

Q21:可以只用训练集的一部分吗?
可以。常见做法:只下 normal/tumor 各一半先跑通管线;或按 PCam 划分取 216 张子集。任何子集实验写清抽样规则即可,不影响他人复现官方分数。

Q22: lesion 标注的 XML 能转成 COCO/YOLO 格式吗?
能,社区有现成转换脚本(XML 顶点 → 多边形/包围盒)。但注意 WSI 尺寸下坐标是原始分辨率像素值,转格式时统一坐标系与降采样倍率;检测模型通常在低倍率层训练,记得缩放。

Q23:这张测试切片是阳性还是阴性能从文件名看出来吗?
不能——测试集命名 test_001…无标签信息,这是防止人工"看名识癌"的协议设计。训练集 normal_/tumor_ 前缀才是公开标签。

Q24:训练时 mask 直接当分割标签用有什么坑?
mask 由手绘轮廓栅格化而来,边界有一定标注误差(尤其弥漫性病灶边界);多病灶小目标(ITC)在 mask 里可能只有几十像素。分割训练建议配合低倍率上下文通道,评估用病灶级 FROC 而非逐像素 Dice——像素级完美并不等于临床正确。

Q25:为什么 2016 年的挑战赛现在还值得做基准?
三个理由:分数天花板明确(0.994/0.8074 已知)、协议被最广泛复现(对比零成本)、CC0 无法律摩擦。作为"方法改进是否真实"的对照组,它比任何新数据集都便宜可靠。

Q26:库内还有哪些乳腺癌条目可以连读?
bracs(rid 138,VIA/IHC 7 类 WSI)、breakhis(rid 126,显微镜 8 类);跨癌种读 panda(560)/panda-plus(640)看 WSI 挑战范式在 Gleason 分级的复刻。本条目 §8 有完整互链表。

Q27:挑战赛成绩能直接写进产品宣传"AI 达到病理医生水平"吗?
不能。JAMA 结论的条件限定(模拟工作流、单一专家、二元任务、129 张)在转述中全部要保留;监管口径下"临床有效性需临床验证"是硬要求。宣传性简化既不学术也不合规。

Q28:如果发现官网链接失效怎么办?
按 §5.1 顺序降级:camelyon17 官网 Data 页 → GigaDB 100439 → FLamby 提供的镜像清单。若全部失效,库内 camelyon16-17(rid 33)条目页也会随家族维护更新渠道(附录 I 触发点 1)。

Q29:训练时应该用哪个放大倍率?
常见选择是 20× 等效(0.5 μm/px)做 patch 主战场、40× 等效(0.25 μm/px)做高分辨确认——家族生态(FLamby/owkin)多在 0.5 μm/px 提特征。关键是全管线固定一个倍率并写明 level 换算,勿混。

Q30:这个数据集还能用来做自监督预训练吗?
能且常见。399 张 gigapixel 切片换算成 patch 是数百万到千万级,家族数据是病理 SSL 论文的标准语料之一(配合更大泛癌语料)。CC0 无预训练用途限制。

Q31:模型输出的概率图怎么变成"病灶位置"?
主流做法:热图(滑窗概率)→ 二值化 → 连通域 → 每个连通域取峰值/质心作为 (x,y) 与置信度。冠军方法即此结构;评估时连通域参数与匹配阈值会影响 FROC,需固定并报告。

Q32:想复现 JAMA 医生实验的设计做我自己的对照研究,要点是什么?
四件套:限时/不限时双条件、有序置信度评分(可直接算 AUC)、IHC 级别的金标准确认、把"模拟"性质写进结论限定。样本量上 JAMA 用了 11+1 名医生与 129 张切片——同类研究可参照其功效讨论。

术语表

术语 释义
WSI(whole-slide image) 病理全切片图像:玻璃切片整片扫描的 gigapixel 数字图像,多层金字塔存储
前哨淋巴结(sentinel lymph node) 肿瘤淋巴引流第一站淋巴结,乳腺癌分期的关键活检对象
转移(metastasis) 肿瘤细胞离开原发灶在淋巴结等远处的定植
ITC(isolated tumor cells) 孤立肿瘤细胞:≤0.2 mm 或 ≤200 个细胞的微小病灶
微转移(micro-metastasis) 直径 0.2-2 mm 的转移灶
宏转移(macro-metastasis) 直径 >2 mm 的转移灶
pN 分期 基于淋巴结病理状态的 TNM 分期项(N0/N1mi/N1a…)
H&E 苏木精-伊红染色:病理常规染色方案
IHC(immunohistochemistry) 免疫组化:抗体染色(如细胞角蛋白)辅助确认肿瘤细胞
AUC ROC 曲线下面积:slide 级分类评价指标
FROC Free-response ROC:检出类任务评价曲线,横轴 FP/图、纵轴敏感度
FP/WSI 每张全切片的假阳性病灶数:FROC 横轴单位
弱监督(weakly supervised) 仅有 slide 级标签(无像素级病灶标注)的训练范式
MIL(multiple instance learning) 多实例学习:把 WSI 当"袋"、patch 当"实例"的弱监督框架
金字塔(pyramid) WSI 多分辨率层级存储结构(原始层 + 逐级降采样层)
OpenSlide 读取金字塔 WSI 的开源 C 库(含 Python 绑定)
ASAP Radboud 开源 WSI 查看与分析平台(全称 Automated Slide Analysis Platform)
Grand Challenge grand-challenge.org 平台上的医学影像算法挑战赛
ISBI IEEE International Symposium on Biomedical Imaging(2016 届在布拉格)
GigaDB GigaScience 期刊的官方数据存储库(本家族记录 100439)
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 评估维度
CC0 1.0 公有领域贡献许可:无保留权利声明
TPF(true positive fraction) FROC 纵轴:病灶级真阳率(=敏感度)
组织掩膜(tissue mask) 区分切片中组织与背景空白区域的前景掩膜
DeepZoomGenerator OpenSlide 内的均匀切片器:按固定 tile 尺寸遍历金字塔
spacing / MPP 每像素物理尺寸(μm/px):像素坐标与毫米尺寸换算依据
Macenko 归一化 基于 SVD 的 H&E 染色色域归一化方法,跨扫描仪训练常用
染色域漂移(stain shift) 不同中心/设备染色深浅差异导致的分布偏移,病理 AI 主要噪声源之一
CAD(computer-aided diagnosis) 计算机辅助诊断:算法作"第二读片人"的产品形态
reference.csv 测试集官方参考文件:评估器比对的基准
pN0 / N1mi / N1a 淋巴结分期记号:无转移 / 微转移 / 宏转移(≤3 枚)等
连通域(connected component) 二值图中相邻像素集合:热图转病灶候选的常用步骤
热图(heatmap) 滑窗概率铺在 WSI 上的概率图:定位任务中间产物
断点续传 大文件下载中断后从已传输位置继续的机制:GB 级文件必备
分布外(OOD / distribution shift) 训练与部署数据分布不同的情形:WILDS 基准的主题
金标准(ground truth) 作为正确答案的参照标注:本数据集经 IHC 验证
弱标签噪声 slide 级标签与像素级真值之间的不精确性:弱监督主要误差源
预审(预注册式自评) 投稿前用官方评估器在测试集自测并报告口径的做法

附录

附录 A:条目信息速查卡

项 值
条目名 CAMELYON16
url_name camelyon16
类型 挑战赛数据集 + 人类对比实验(评价协议自带)
结果论文 JAMA 2017;318(22):2199-2210(doi:10.1001/jama.2017.14585)
数据论文 GigaScience 2018;7(6):giy065(合并 16+17 家族口径)
主办 Radboud UMC + UMC Utrecht(荷兰)
规模 400 WSI(270 训练 + 130 测试发布口径/129 评价口径)
训练分层 160 正常 + 110 含转移(两批 170+100)
评价分层 129 = 49 含转移 + 80 正常
许可 CC0 1.0 Universal
抓取时点 2026-09-27
库内互链 camelyon16-17(33)/pcam(158)/lysto(653)/bracs(138)/breakhis(126)/panda(560)/panda-plus(640)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 官网/论文/数据论文/库内条目四路可索引;"CAMELYON"家族名易混淆(坑 1)微降分
A 可获取性 9 CC0 + 多镜像公开直链,无注册门槛;测试标签不公开(协议设计使然)不算失分
I 可互操作 8 通用 TIFF + OpenSlide/ASAP 标准工具链 + 官方评估代码;XML/mask 双格式标注
M 元数据质量 8 双论文完备;但 130/129、159/111、700/900GB 等口径漂移需读者自行分辨(坑 3/5/6)
S 可持续性 9 双机构维护十年+,GigaDB 正式存档,家族生态活跃;挑战官网已转静态微降分
综合评级 8.6/10(优秀) AI-Ready 光谱顶端的经典样本;主要"缺陷"是历史口径漂移而非获取障碍

附录 C:逐项证据链自证

关键数字 来源 位置/方式
400 WSI = 270 训练 + 130 测试 官网 Data 页 WebFetch 实抓
训练 170(100+70)+ 100(60+40) 官网 Data 页 WebFetch 实抓
测试 129 = 49+80;train 110 with + 160 without JAMA 2017 摘要 Europe PMC API 实抓
算法 AUC 0.556-0.994;最佳 0.994(CI 0.983-0.999) JAMA 2017 摘要 Europe PMC API 实抓
WTC mean AUC 0.810(0.738-0.884);P<.001 JAMA 2017 摘要 Europe PMC API 实抓
top5 mean 0.960 vs WOTC 0.966(CI 0.927-0.998) JAMA 2017 摘要 Europe PMC API 实抓
lesion TPF 72.4% @ 0.0125 FP/正常片 JAMA 2017 摘要 Europe PMC API 实抓
挑战期 AUC top5(0.9234…0.8298) 官网 Results 页 curl 实抓
挑战期 FROC top5(0.6933…0.3859) 官网 Results 页 curl 实抓
赛后 AUC 0.9935 / FROC 0.8074(2016-11-06) 官网 Results 页 curl 实抓
32 提交 / 23 队;首个 WSI 挑战 官网 Home 页 WebSearch 快照
时间线十个节点 官网 Home 页 Important dates WebSearch 快照
扫描仪(Pannoramic Flash II 250 / NanoZoomer-XR) GigaScience giy065 全文 PMC 全文 XML 实抓(PMC6007545)
四分类标签与 TNM 尺寸标准 GigaScience giy065 全文 PMC 全文 XML 实抓
209 张手绘轮廓;1,399 WSI 家族口径 GigaScience 摘要(UMC Utrecht repository) WebSearch 快照
CC0 1.0 FLamby README + arXiv:2210.04620 + owkin HistoSSLscaling 三源互证
伦理批准 2016-2761 FLamby 文档(引 GigaScience) WebSearch 快照
GigaDB 100439 owkin HistoSSLscaling README WebSearch 快照
399 总量口径与重复剔除 kaiko-ai eva + FLamby(RUMC 243/UMCU 156) 双源
评估代码 GitHub JAMA Reproducible Research Statement tandfonline 引文页快照
冠军方法(GoogLeNet patch 管线;82% 背景剔除) Wang et al. arXiv:1606.05716(MIT CSAIL PDF) WebSearch 快照
normal_144.tif 缺 metadata;11 层金字塔;451 GB 训练口径 MathWorks 官方文档 WebSearch 快照

附录 D:获取决策树

你的目的?
├── 教学/入门 WSI
│   └── PCam(rid 158)→ 本条目原版递进
├── slide 级弱监督分类研究
│   ├── 官方下载页拉训练集(~400-500 GB 部分)
│   ├── OpenSlide/ASAP 读图;XML/mask 出 patch 监督
│   └── 对外报分:官方评估器 + 注明 129 口径
├── lesion 级定位 / FROC 研究
│   ├── lesion_annotations.zip(XML + mask)
│   └── 严格六工作点协议(§3.2),勿自造口径
├── 跨中心/联邦学习
│   └── FLamby Fed-Camelyon16(RUMC/UMCU 双客户端封装)
├── 分布外泛化研究
│   └── CAMELYON17-WILDS(5 中心 148 患者封装)
└── 家族全量(1,399 WSI / 四分类标签)
    └── GigaScience giy065 + GigaDB 100439(库内 rid 33 条目)

附录 E:两个 leaderboard 合并总表(挑战期)

排名 队伍 AUC(任务 1) FROC(任务 2)
1 Harvard Medical School and MIT, Method 1 0.9234 0.6933
2 EXB Research and Development co. (DE) 0.9156 0.5111
3 Independent participant (DE) 0.8654 —
4 Middle East Technical University (TR) 0.8642 0.3889
5 NLP LOGIX co. (US) 0.8298 0.3859
2(FROC 榜) Radboud UMC (DIAG) (NL) — 0.5748

注:FROC 榜第 3-5 名即 AUC 榜第 2/4/5 名;两榜名次不同构是"分类对≠定位对"的直接证据(§7 经验 1)。

附录 F:批次与中心分布表

维度 拆分 数值
训练批次 1(2015-11-25) 正常 / 含转移 100 / 70(共 170)
训练批次 2(2015-12-30) 正常 / 含转移 60 / 40(共 100)
训练合计 正常 / 含转移 160 / 110(270)
评价集(129 口径) 正常 / 含转移 80 / 49
中心(399 口径,FLamby) RUMC train+test 169 + 74 = 243
中心(399 口径,FLamby) UMCU train+test 101 + 55 = 156

附录 G:CAMELYON 家族谱系表

世代 年份 中心数 规模 任务 评价 永久记录
CAMELYON16 2015-2016 2 400 WSI slide 分类 + lesion 定位 AUC + FROC 六点 JAMA 2017
CAMELYON17 2016-2017 5 100 患者×5 结节 pN 分期(patient 级) C-指数/四象限矩阵 GigaScience 2018
CAMELYON 合并 2018 5 1,399 WSI + 209 轮廓 全家族资源 四分类标签 giy065 / GigaDB 100439
PCam 2018 —(派生) 327,680 patches 96×96 二分类 accuracy MICCAI 2018
CAMELYON17-WILDS 2021 5 450k patch / 148 患者 二分类(分布外) 跨医院泛化 WILDS 基准

附录 H:双口径登记表

# 项 口径 A 口径 B 条目处理
1 测试集规模 130(官网发布) 129(JAMA 评价/生态通用) 双记;评价分数按 129
2 数据总量 400 399(剔除 1 张重复后) 主体按 400,评价按 399
3 训练分层 160 正常 + 110 阳性(官网/JAMA) 159/111(MathWorks 笔误) 采信官网/JAMA,笔误存照
4 体量 ~700 GB(kaiko) ~900 GB(FLamby)/451 GB(MathWorks 仅训练) 写"700-900 GB"区间
5 冠军成绩 挑战期 0.9234/0.6933(2016-04-01) 赛后 0.9935/0.8074(2016-11-06) 引用必注日期
6 slide 标签 二元(正常/含转移,挑战口径) 四分类(normal/ITC/micro/macro,GigaScience) 按任务场景选用并注明
7 209 轮廓 家族口径(16+17 含轮廓 WSI 总数) 16 代训练侧 110 张全带轮廓 按范围引用(坑 8)

附录 I:维护计划与触发点

触发点 条件 动作 优先级
官网下线 grand-challenge.org 域调整 更新 §5 渠道表,改指 GigaDB/存档站 1
新 SOTA 报告 高引论文刷新 129 张测试集公开分数 §4.3 后追记一行 2
家族条目变动 rid 33/158 条目改版 §8 互链表同步 3
WILDS/PCam 大版本 派生集封装变更 附录 G 谱系表更新 4
获得官方重复切片编号 任意官方渠道披露 Q19 编号 FAQ Q19 补注 5

附录 J:引文规范(BibTeX)

@article{ehteshamibejnordi2017camelyon16,
  title   = {Diagnostic Assessment of Deep Learning Algorithms for
             Detection of Lymph Node Metastases in Women With Breast Cancer},
  author  = {Ehteshami Bejnordi, Babak and Veta, Mitko and
             Johannes van Diest, Paul and van Ginneken, Bram and
             Karssemeijer, Nico and Litjens, Geert and
             van der Laak, Jeroen A. W. M. and the CAMELYON16 Consortium},
  journal = {JAMA},
  volume  = {318},
  number  = {22},
  pages   = {2199--2210},
  year    = {2017},
  doi     = {10.1001/jama.2017.14585}
}

@article{litjens2018camelyon,
  title   = {1399 H\&E-stained sentinel lymph node sections of breast
             cancer patients: the CAMELYON dataset},
  author  = {Litjens, Geert and Bandi, Peter and Ehteshami Bejnordi, Babak and
             Geessink, Oscar and Balkenhol, Maschenka and Bult, Peter and
             Halilovic, Altuna and Hermsen, Meyke and van de Loo, Rob and
             Vogels, Rob and Manson, Quirine F. and Stathonikos, Nikolas and
             Baidoshvili, Alexi and van Diest, Paul and Wauters, Carla and
             van Dijk, Marcory and van der Laak, Jeroen},
  journal = {GigaScience},
  volume  = {7},
  number  = {6},
  pages   = {giy065},
  year    = {2018},
  doi     = {10.1093/gigascience/giy065}
}

@article{wang2016deep,
  title   = {Deep Learning for Identifying Metastatic Breast Cancer},
  author  = {Wang, Dayong and Khosla, Aditya and Gargeya, Rishab and
             Irshad, Humayun and Beck, Andrew H.},
  journal = {arXiv preprint arXiv:1606.05716},
  year    = {2016}
}

附录 K:本条目生产档案

  • 生产通道:写手代理 agentA-camelyon16(slug camelyon16,候选 brief 三源核验后确认成立,未改道)
  • 事实研究:WebSearch×5 + WebFetch×3 + curl 实抓(官网 Results 页×2)+ Europe PMC API×2(JAMA 摘要 + GigaScience 全文 XML)+ qf_psql 查重×2,共约 12 轮
  • FACTS.md:writing/camelyon16/FACTS.md 九节
  • 成稿方式:五块直写拼接(part1-5),全程不用 Edit 追加
  • 坑点:§9 八则(坑 1-8"坑 N:"编号制)
  • 查重:库内 camelyon16-17(rid 33)共存不冲突;SQL url_name ILIKE '%camelyon%' 仅 1 行
  • 开工三查:锁文件 agentA-camelyon16 2026-09-27 12:02:06;ps 指纹 4
  • 环境坑记录:zenodo.org 直连被沙箱封锁(API 返回 000),Zenodo record 号未取得,改以 GigaDB 100439 为正式数据记录(FACTS §9 存照)

附录 L:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(两论文)+ GigaDB 100439 + 官网挑战页
F2 富元数据 ✅ 双论文 + 官网 Data/Results 页 + 四分类标签体系
A1 可访问协议 ✅ CC0 公开直链,多镜像,无注册
A2 元数据可访问 ✅ 标签与评价协议全部公开(测试金标准除外,协议设计使然)
I1 互操作格式 ✅ 通用 TIFF + OpenSlide/ASAP + XML/mask 双标注格式
I2 词汇表引用 ✅ TNM/ITC/micro/macro 国际标准术语
R1 来源溯源 ✅ 两医院病理档案 + 伦理编号 2016-2761
R3 可复现流程 ✅ 官方评估代码开源(Python/Matlab)
AI-Ready 综合 高 获取零门槛 + 工具链标准 + 协议可复现;历史口径漂移是唯一使用摩擦

附录 M:缩写速查

缩写 全称
CAMELYON Cancer Metastases in Lymph Nodes
WSI Whole Slide Image
RUMC Radboud University Medical Center
UMCU University Medical Center Utrecht
ITC Isolated Tumor Cells
FROC Free-Response Operating Characteristic
AUC Area Under the ROC Curve
WTC / WOTC With Time Constraint / Without Time Constraint
IHC Immunohistochemistry
MIL Multiple Instance Learning
PCam PatchCamelyon
GigaDB GigaScience Database
ISBI IEEE Int’l Symposium on Biomedical Imaging
CWZ / RST / LPON CAMELYON17 新增三中心(Canisius-Wilhelmina / Rijnstate / Lab. Pathology East-Netherlands)

附录 N:基于本数据集的研究检查清单(12 项)

  1. 口径声明:写明 400 还是 399、130 还是 129、挑战期还是赛后分数(附录 H 全表对照)。
  2. 标签语义:二元 vs 四分类不混贴;ITC 切片按需求显式处理。
  3. 测试卫生:测试集仅评不调;自评分注明"官方评估器自评"。
  4. FROC 匹配规则:病灶判定与坐标匹配阈值写进方法节,别只报一个总分。
  5. spacing 校验:物理尺寸相关实验逐张读 metadata(normal_144 缺失)。
  6. patch 采样:先背景剔除再采样(组织占比仅 ~18%),失衡在 patch 层不在 slide 层。
  7. 中心分层:跨中心实验按 RUMC/UMCU 分层报告;更严的分布漂移去 CAMELYON17-WILDS。
  8. 许可与引用:数据 CC0,但引用礼仪双论文(JAMA + GigaScience);观点引用遵守 JAMA 版权。
  9. 对比公平:与公开方法比分数时核对测试集口径与评估器版本。
  10. 存储预算:全量 ~1 TB 上限规划;金字塔读取用 OpenSlide,勿整图载入内存。
  11. 人类对比引用:转引"AI vs 医生"结论必须带 WTC/WOTC 条件限定与"模拟"性质。
  12. 家族检索:跨 16/17/PCam/WILDS 的引用分别锚定 DOI(坑 1)。

附录 O:检索路径示范

目标 推荐查询式 预期命中
结果论文 “CAMELYON16” AND “lymph node” / doi:10.1001/jama.2017.14585 JAMA 2017
数据论文 “CAMELYON dataset” / doi:10.1093/gigascience/giy065 GigaScience 2018(开放获取)
数据本体 site:grand-challenge.org camelyon16 download / GigaDB 100439 官方下载页/GigaDB
冠军方法 arXiv:1606.05716 / Wang Khosla metastatic MIT CSAIL PDF
人类对比二手分析 “CAMELYON16” AND (“pathologist” AND “time constraint”) JAMA 及引用者
派生基准 PatchCamelyon / CAMELYON17-WILDS PCam GitHub / WILDS 站
反例(勿用) “CAMELYON16 IEEE TMI”(作为出处) 误记组合(坑 2)

附录 P:与库内家族条目的关系声明

维度 camelyon16(本条目) camelyon16-17(rid 33) pcam(rid 158)
对象 16 代挑战赛:任务/评价/人类对比 16+17 合并数据资源(1,399 WSI) 16 派生 patch 分类基准
核心标签 二元 + 病灶轮廓 四分类(GigaScience 口径) patch 二元
使用场景 复现挑战、检测研究、方法学史 家族全量资源与标签体系 快速入门与原型
阅读顺序 本条目(挑战视角)→ 33(资源视角)→ 158(派生基准) — —

三篇互补不冲突:rid 33 是"数据家族全景",本条目是"一场挑战赛及其科学结论",pcam 是"从难到易的派生产品"。

附录 Q:FROC 评测复现骨架(示意代码)

import numpy as np

FPR_WORKPOINTS = [0.25, 0.5, 1, 2, 4, 8]   # FP per WSI(协议六点)

def lesion_matching(preds, groundtruths, tol_px):
    """preds: [(prob, x, y)];groundtruths: [(x, y)]
    预测按概率降序贪婪匹配最近未命中真值(距离 <= tol_px)。
    tol_px 取真值轮廓内判定/官方阈值,勿自造。"""
    preds = sorted(preds, key=lambda p: -p[0])
    hit = [False] * len(groundtruths)
    for _, x, y in preds:
        for gi, (gx, gy) in enumerate(groundtruths):
            if not hit[gi] and (x - gx) ** 2 + (y - gy) ** 2 <= tol_px ** 2:
                hit[gi] = True
                break
    return hit

def froc_score(all_preds, all_gt, tol_px):
    """all_preds/all_gt: 按测试 WSI 分组的列表(仅含阳性/全部切片)。
    逐阈值累计 TPs 与正常片 FPs,在 6 个工作点线性插值取敏感度均值。"""
    sens_at = {fp: [] for fp in FPR_WORKPOINTS}
    for threshold in np.arange(0.0, 1.0, 0.01):
        tps, n_gt, fps_normal = 0, 0, 0
        for preds, gts in zip(all_preds, all_gt):
            kept = [p for p in preds if p[0] >= threshold]
            hits = lesion_matching(kept, gts, tol_px)
            n_gt += len(gts)
            tps += sum(hits)
        # fps_normal:阴性 WSI 上阈值以上的预测数(此处示意省略分组)
        for fp in FPR_WORKPOINTS:
            sens = tps / max(n_gt, 1) if n_gt else 0.0
            sens_at[fp].append((fps_normal / max(1, n_normal_slides), sens))
    # 每个工作点在 FROC 曲线上插值取敏感度,六点取平均即官方分数
    return float(np.mean([interp_sens(sens_at[fp], fp) for fp in FPR_WORKPOINTS]))

要点:匹配规则与工作点插值务必对齐官方评估代码(github.com/computationalpathologygroup/CAMELYON16),本骨架仅示意流程,不做分数基准。

附录 R:弱监督方法在 CAMELYON16 上的演进小史

阶段 代表 一句话
2016 Wang et al.(Harvard/MIT,冠军) patch-CNN(GoogLeNet)+ 热图聚合,确立 MIL 前身范式
2016 Liu et al.(Google 系) 端到端 Inception 变体 + 更大 patch 训练
2017-2018 官方评估代码普及 FROC 成为病理检测标准指标
2018-2019 attention-MIL 一族 显式注意力聚合 patch 特征,弱监督可解释化
2019-2021 CLAM 等聚类聚合 逐切片可变实例数聚合,成为 slide 级分类默认基线
2022- 联邦与基础模型 FLamby 把双中心当客户端;家族进入病理基础模型预训练/评测语料

演进主线:监督信号从"手绘轮廓做 patch 监督"逐步松动到"slide 级标签 + 注意力归因",CAMELYON16 始终是每一代方法的公共考场。

附录 S:常见误区澄清(15 条)

  1. 误区:“CAMELYON16 论文发在 IEEE T-MI”——是 JAMA(坑 2)。
  2. 误区:“400 张都有像素级标注”——只有含转移切片有(110 张训练侧 + 测试侧在官方评估处)。
  3. 误区:“测试集 130 张全评价”——129 张(1 张重复剔除)。
  4. 误区:“CAMELYON16 是 1,399 张”——那是 16+17 合并家族口径(rid 33)。
  5. 误区:“PCam 分数可直接对标 CAMELYON16 分数”——数据划分与粒度不同,不可跨比。
  6. 误区:“AUC 0.994 说明任务解决”——仅二元 slide 级;FROC 与跨中心仍是开放题。
  7. 误区:“算法比病理医生强”——严格说是"优于限时模拟组、与不限时专家相当"。
  8. 误区:“数据需要申请”——CC0 公开直链。
  9. 误区:“训练集 111 张阳性”——110(MathWorks 笔误)。
  10. 误区:“FROC 分数就是 AUC 的别名”——完全不同的指标族。
  11. 误区:“209 张轮廓都在 CAMELYON16 里”——209 是家族口径(含 17 代)。
  12. 误区:“必须是挑战赛注册用户才能下载”——注册只用于当年提交。
  13. 误区:“所有切片同一扫描仪”——两中心两设备(3DHistech/Hamamatsu)。
  14. 误区:“挑战赛官网还活跃”——已转静态存档(2016-11 结束),渠道以 GigaDB/镜像为准。
  15. 误区:“CAMELYON16 用于 pN 分期”——那是 CAMELYON17 的任务。

附录 T:同时代病理数据集对照

数据集 年 图像类型 规模 任务 许可口径
CAMELYON16 2015-16 WSI(淋巴结) 400 分类+定位 CC0
BreakHis(rid 126) 2015 显微镜图像 7,902 8 类分类 学术申请
CAMELYON17 2016-17 WSI(淋巴结) 500 pN 分期 CC0
PCam 2018 patch 327,680 二分类 MIT/开源
BACH 2018 显微镜+WSI 400+10 4 类分类 注册制
BRACS(rid 138) 2020 WSI(乳腺) 547 7 类 注册制
PANDA(rid 560) 2020-21 WSI(前列腺) ~万级 Gleason CC BY-NC-SA

对照结论:CAMELYON16 在"体量×许可自由度×任务复杂度"三角上是十年内最开放组合,这也是其成为默认基准的结构性原因。

附录 U:patch 采样与训练集构建骨架(代码)

import numpy as np
import openslide
from PIL import Image

def tissue_mask(slide, level=6, thresh=0.82):
    """组织掩膜:低倍率层灰度化+Otsu 类阈值,剔除背景白区(约 82%)。"""
    img = np.asarray(slide.read_region((0, 0), level, slide.level_dimensions[level]).convert("L"))
    mask = img < thresh * 255          # 暗于阈值为组织(示意;生产用 Otsu/HSV 组合)
    return mask, level

def sample_patches(slide_path, ann_mask=None, n=1000, size=512, level=0, seed=0):
    """在组织区内随机采 patch;ann_mask 提供时只采阳性区(病灶监督)。"""
    rng = np.random.default_rng(seed)
    slide = openslide.OpenSlide(slide_path)
    mask, mlevel = tissue_mask(slide)
    ys, xs = np.nonzero(mask)
    patches = []
    for i in rng.choice(len(xs), size=min(n, len(xs)), replace=False):
        # 低倍率坐标映射回 level 0
        x0 = int(xs[i] * slide.level_downsamples[mlevel]) - size // 2
        y0 = int(ys[i] * slide.level_downsamples[mlevel]) - size // 2
        patch = slide.read_region((max(x0, 0), max(y0, 0)), level, (size, size)).convert("RGB")
        label = 1 if (ann_mask is not None and ann_mask[y0:y0+size, x0:x0+size].any()) else 0
        patches.append((np.asarray(patch), label))
    return patches

说明:病灶监督的严格实现应以 XML 顶点栅格化生成 ann_mask(附录 V),并用"patch 中心/主要区域落入轮廓"定义阳性;随机采样只用于负例挖掘与演示。

附录 V:XML 标注格式与解析骨架(代码)

CAMELYON16 的病灶标注 XML 为 ASAP 导出格式:根元素 ASAP_Annotations,每处病灶一个 annotation 节点(PartOfGroup="Tumor",Type 多为 Spline),坐标按顶点顺序列出。

<ASAP_Annotations>
  <ASAP_AnnotationAnnotations>
    <ASAP_AnnotationAnnotation Name="Annotation 0" Type="Spline" PartOfGroup="Tumor">
      <Coordinates>
        <Coordinate Order="0" X="12345" Y="6789" />
        <Coordinate Order="1" X="12400" Y="6810" />
        ...
      </Coordinates>
    </ASAP_AnnotationAnnotation>
  </ASAP_AnnotationAnnotations>
</ASAP_Annotations>
import xml.etree.ElementTree as ET
import numpy as np
from PIL import Image, ImageDraw

def xml_to_mask(xml_path, slide, level=0):
    """把 XML 顶点栅格化为二值 mask(顶点闭合成多边形)。"""
    w, h = slide.level_dimensions[level]
    img = Image.new("L", (w, h), 0)
    draw = ImageDraw.Draw(img)
    root = ET.parse(xml_path).getroot()
    for ann in root.iter():
        coords = [(int(c.get("X")), int(c.get("Y"))) for c in ann.iter("Coordinate")]
        if coords:
            draw.polygon(coords, outline=1, fill=1)
    return np.asarray(img)          # 与 slide 同 level 对齐的二值掩膜

提醒:顶点坐标是(就近)原始分辨率像素;栅格化在哪个 level 做,就在哪个 level 与图像对齐;生产环境请以官方 mask 文件为准交叉校验自栅格化结果。

附录 W:双中心域漂移与预处理建议

差异源 RUMC 侧 UMCU 侧 对策
扫描仪 3DHistech Pannoramic Flash II 250 Hamamatsu NanoZoomer-XR 跨中心评估按设备分层报告;谨慎混批训练后的"中心泄漏"
染色流程 中心内部 H&E 流程 中心内部 H&E 流程 Macenko/Reinhard 归一化或染色增广(HED 抖动)提升泛化
前景占比 组织区 ~18%(全集实测均值) 同左 采样前统一背景剔除阈值并人工抽查若干张
分辨率 level 0 ~0.25 μm/px 同左(240 nm/px 扫描) 训练倍率固定(20× 或 40× 等效),勿混用 level

建议的最小域鲁棒性自查:用单中心训练→另一中心测试的 AUC 差值估计域代价;差值过大优先做染色归一化而非加模型容量。

附录 X:公开基准分数登记表(截至抓取时点)

方法 场景 AUC FROC 日期 来源
Harvard/MIT Method 1 挑战期(截止 2016-04-01) 0.9234 0.6933 官网榜 curl 实抓
EXB (DE) 挑战期 0.9156 0.5111 官网榜 curl 实抓
Radboud UMC (DIAG) 挑战期 — 0.5748 官网榜 curl 实抓
Harvard/MIT Method 2 (updated) 赛后 0.9935 0.8074 2016-11-06 curl 实抓
Harvard/MGH Method 3 赛后 0.9763 0.7600 2016-10-24 curl 实抓
全部提交区间 赛后 0.556–0.994 — JAMA Europe PMC
WOTC 专家(人类) 诊断对照 0.966 TPF 72.4% @0.0125FP JAMA Europe PMC
WTC 医生组(11 人,人类) 诊断对照 mean 0.810(0.738-0.884) — JAMA Europe PMC

复现提示:非官方复现分数受 patch 策略/匹配阈值影响波动,登记自研分数时写明评估器版本与口径(129 张、官方代码)。

附录 Y:文件与字段字典

文件/字段 类型 语义
training/normal/normal_*.tif 金字塔 TIFF 阴性训练 WSI(160 张)
training/tumor/tumor_*.tif 金字塔 TIFF 阳性训练 WSI(110 张)
training/lesion_annotations.zip XML+mask 逐张转移轮廓(顶点)与二值掩膜
testing/images/test_*.tif 金字塔 TIFF 测试 WSI(130 张发布/129 张评价)
testing/evaluation/reference.csv CSV 测试目标(官方评估器比对基准)
testing/lesion_annotations.zip XML+mask 测试侧病灶标注(评估用)
XML Coordinate X/Y 整数像素 原始分辨率(level 0)坐标系
PartOfGroup=“Tumor” XML 属性 病灶分组标签(ASAP 格式)

附录 Z:多中心/跨数据集实验建议

  1. 先分层后合并:任何全集指标同时给出 RUMC/UMCU 分层值,中心差值即免费的域漂移报告。
  2. 与 PCam 的桥接:在 PCam 上训练的 patch 模型可零成本迁移到 CAMELYON16 patch 上做交叉验证;但 slide 级聚合策略需重新开发。
  3. 向 CAMELYON17 递进:16 上验证的管线可直接接到 17 的四分类/pN 任务(5 中心),WILDS 封装用于分布外设定。
  4. 跨癌种外推:向 BRACS/BreakHis(乳腺癌其他成像模态)或 PANDA(前列腺)外推时,仅迁移管线不迁移分数——任务语义不同(转移检测 vs 亚型分级)。
  5. 数据版本记账:记录下载渠道与日期(GigaDB 版本/官网转存),家族数据曾有 130→129 剔除史,版本错位是复现失败的常见根因。

附录 AA:教学场景的课程映射

课程单元 用 CAMELYON16 教什么 建议配套
数字病理导论 WSI 金字塔/ gigapixel 存储/OpenSlide 读取 §2.4、附录 U
弱监督与 MIL slide 级标签如何支撑定位任务 §3.1、附录 R 演进表
评价方法学 AUC vs FROC、六工作点、跨论文可比性 §3.2-3.5、附录 X
"AI vs 医生"方法学 双条件对照、金标准验证、结论限定词 §4.4、§4.9
数据工程 CC0 发布、镜像、体量预算、版本口径 §5、附录 H
域漂移与泛化 双中心双设备差异、染色归一化 附录 W、CAMELYON17-WILDS
研究伦理 伦理批准/知情同意豁免与公开的合规链 附录 AE

一个学期的课程可按"读条目 → 复现 PCam → 原版子集训练 → 官方评估器自评 → 写一份带限定词的对照报告"推进。

附录 AB:测试集自评工作流(步骤)

  1. 从官方下载页取得 testing/ 目录(含 images 与 evaluation 结构);
  2. 安装官方评估代码仓库(computationalpathologygroup/CAMELYON16),阅读其输入格式说明(每张片的预测文件:slide 级概率文件 + lesion 级坐标文件);
  3. 模型对 129 张(或 130 张,评估器按 reference.csv 实际计数)测试片输出两种预测;
  4. 运行官方脚本得到 slide AUC 与 FROC 六点分;
  5. 报告时注明:官方评估器自评、数据下载时点、口径(129);
  6. 若要与官网榜分数对比,先确认对方是挑战期榜还是赛后榜(坑 6)。

附录 AC:JAMA 论文结构导读

论文节 内容 与本条目对应
Importance/Objective 为什么做(阅片负担+漏检)与目标 §0
Design, setting, participants 挑战赛设计、270 训练/129 测试、医生双条件 §2.3、§4.4
Exposures 算法 vs 医生判读 §4.4
Main outcomes and measures AUC/FROC 定义、五档置信度 §3.2、§4.6
Results 0.556-0.994 全距、WTC/WOTC 对比、72.4% TPF §4.4 表
Conclusions 四个限定词的结论 §4.9(全文抄录)
Reproducible Research Statement 数据与代码公开声明 §5.1

读原文时建议先读 Abstract 与 Conclusions,再回 Methods 核对口径——它的每个数字在本条目附录 C 都有证据链登记。

附录 AD:下载与校验脚本骨架(示意)

# 示意:Google Drive 大文件下载(官方下载页给出的公开链接经 gdown 处理)
pip install gdown
gdown --fuzzy "https://drive.google.com/uc?id=<官方下载页提供的文件ID>" -O CAMELYON16_training.zip

# 校验:解压前后都记账
unzip -t CAMELYON16_training.zip            # 先测完整性
unzip CAMELYON16_training.zip -d CAMELYON16/
find CAMELYON16/training -name "*.tif" | wc -l   # 应为 270
find CAMELYON16/testing -name "*.tif" | wc -l    # 应为 130(发布口径)

# 空间预算:解压前确认 ≥2TB 余量(zip + 解压 + 后续 patch 缓存)
df -h .

注意:<文件ID> 以官方下载页当前展示为准(链接随运营调整,本条目不硬编码第三方 ID);百度网盘等镜像下载后务必执行同样的计数校验(坑 7)。

附录 AE:伦理与隐私合规说明

  • 数据采集经 Commissie Mensgebonden Onderzoek regio Arnhem-Nijmegen(荷兰当地伦理委员会)批准,批准号 2016-2761;知情同意豁免(waived)——这是 GigaScience/FLamby 记载、可追溯的合规链。
  • 公开形态为去标识化数字化切片;CC0 发布由数据控制机构(两大学医学中心)作出。
  • 使用者注意:CC0 解决"数据可用"问题,不自动解决"你的下游用途合规"问题——临床决策产品、二次标识化尝试、与其他可识别数据链接等场景需自行做伦理/法务评估;学术研究引用双论文即为通行做法。

附录 AF:WSI 挑战协议对照(CAMELYON16 vs lysto vs PANDA)

维度 CAMELYON16 lysto(rid 653) PANDA(rid 560)
癌种/对象 乳腺癌淋巴结转移 TIL(肿瘤浸润淋巴细胞)空间评估 前列腺穿刺 Gleason
任务数 2(分类+定位) 单任务(空间评分) 单任务(分级)
指标 AUC + FROC 六点 FROC/Pearson 相关(按任务) QWK
训练规模 270 WSI 数百张(标注密集) 万级 WSI
标注强度 病灶轮廓(弱+强混合) 像素级 TIL 区域 slide 级+参考 mask
许可 CC0 平台条款(挑战导向) CC BY-NC-SA

三场挑战共同贡献了"病理挑战赛协议工具箱":检出用 FROC、分级用加权 κ、空间评估用相关系数——选任务类型即选指标族。

附录 AG:从零到首个 baseline 的七天路线

Day 1 环境与数据
  - 装 openslide-tools + openslide-python,克隆官方评估仓库
  - 下载训练集(正常/阳性各先下一半验证流程),校验文件计数
Day 2 数据体检
  - 随机抽 10 张:打印 level_dimensions/MPP;确认 normal_144 特例
  - 组织掩膜跑通(附录 U),统计每张组织占比分布
Day 3 监督信号
  - XML → mask 栅格化(附录 V),与官方 mask 抽样比对
  - patch 采样:阳性片病灶区 / 阴性片组织区各采样,固定 0.5 μm/px
Day 4 基线模型
  - ImageNet 预训练 ResNet/小型 ViT 微调 patch 二分类
  - 阴性 patch 过采或 focal loss 处理 patch 级失衡
Day 5 slide 聚合
  - top-k/平均/注意力三种聚合出 slide 概率;热图连通域出病灶坐标
Day 6 自评
  - 官方评估器跑 129 张:得到 AUC 与 FROC 六点分
  - 记录口径(129、0.5 μm/px、聚合策略)写进实验日志
Day 7 域漂移体检
  - 按 RUMC/UMCU 分层复算 AUC(附录 W);写一页"已知限制"存档

产出的不只是分数,还有一份可审计的口径清单——这是 CAMELYON16 作为"预审场"的正确用法。


尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点见附录 A。事实陈述以挑战赛官网(grand-challenge.org,curl 实抓)、JAMA 2017;318(22):2199-2210(Europe PMC API 实抓摘要)、GigaScience 2018;7(6):giy065(PMC 全文 XML 实抓,PMC6007545)与冠军技术报告 arXiv:1606.05716 为源;测试集 130/129、训练 160/110 vs 159/111、体量 700/900 GB、挑战期 vs 赛后分数等口径漂移已在坑点(§9)与附录 H 存照。条目与库内 camelyon16-17(rid 33)、pcam(rid 158)、lysto(rid 653)、bracs(rid 138)、breakhis(rid 126)、panda(rid 560)、panda-plus(rid 640)互链,构成乳腺癌病理与 WSI 挑战赛家族的完整检索面。后续维护触发点见附录 I。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • breastpathq — 共享标签:医学影像 / 病理图像 / 图像分类 / 挑战赛数据集 / 乳腺癌
  • odelia — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 乳腺癌
  • dfuc-2024 — 共享标签:医学影像 / 图像分类 / 目标检测 / 挑战赛数据集
  • heichole — 共享标签:医学影像 / 图像分类 / 目标检测 / 挑战赛数据集
  • breakhis — 共享标签:医学影像 / 病理图像 / 图像分类 / 乳腺癌
  • bracs — 共享标签:医学影像 / 病理图像 / 图像分类 / 乳腺癌
  • tiger — 共享标签:医学影像 / 病理图像 / 挑战赛数据集 / 乳腺癌
  • bcnb — 共享标签:医学影像 / 病理图像 / 乳腺癌
  • bach — 共享标签:医学影像 / 病理图像 / 图像分类 / 乳腺癌
  • acrobat — 共享标签:医学影像 / 病理图像 / 乳腺癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集