RARE25 (rare25) — 内镜 Barrett 食管肿瘤低流行率检测数据集 — AI-Ready Wikipedia

MICCAI 2025 EndoVis 挑战赛基准:3,095 张公开训练内镜图 + 26,408 张私有测试图,以 PPV@90Recall 强迫模型面对真实 1% 流行率下的假阳性负担(CC BY-NC-SA 4.0)

来源 Olympus Exera III 内镜系统采集的 Barrett 食管内镜图像:公开训练集 2,937 NDBE + 158 NEO(imagefolder,center_1/ndbe、center_1/neo 等目录,PNG);隐藏测试集 23,176 NDBE + 3,232 NEO;图像级二分类标签(0=NDBE,1=Neoplasia);官方 GitHub 提供 5-fold CV 与跨中心切分脚本发布时间: 2026-09-30最后更新: 2026-09-30 阅读 16
RARE25 (rare25) — 内镜 Barrett 食管肿瘤低流行率检测数据集 — AI-Ready Wikipedia

信息速览

数据集名称RARE25 (rare25) — 内镜 Barrett 食管肿瘤低流行率检测数据集 — AI-Ready Wikipedia
数据类型影像数据,人工标注,原始数据
规模训练集 3,095 张内镜图像(2 家荷兰医疗中心);测试集 26,408 张(12 家中心,私有);患者级数量未披露
接入方式Olympus Exera III 内镜系统采集的 Barrett 食管内镜图像:公开训练集 2,937 NDBE + 158 NEO(imagefolder,center_1/ndbe、center_1/neo 等目录,PNG);隐藏测试集 23,176 NDBE + 3,232 NEO;图像级二分类标签(0=NDBE,1=Neoplasia);官方 GitHub 提供 5-fold CV 与跨中心切分脚本
AI 就绪度

RARE25 — 内镜 Barrett 食管肿瘤低流行率检测数据集

一句话定位:RARE25 是 MICCAI 2025 EndoVis workshop 下的挑战赛数据集,用 3,095 张公开训练内镜图 + 26,408 张私有测试图,把 Barrett 食管早期肿瘤的计算机辅助检测(CADe)逼进"真实 1% 流行率"的考场——它评测的不是模型能不能分开两类图,而是模型能在多高的假阳性代价下维持 90% 召回。


§0 导读:这个数据集解决什么问题

0.1 一个被数据"美化"过的临床问题

Barrett 食管(Barrett’s esophagus, BE)是慢性胃食管反流引起的食管远端黏膜化生改变,是食管腺癌(esophageal adenocarcinoma)的癌前病变。临床上对 BE 患者做定期内镜监测(surveillance),目的是在可见早期肿瘤(neoplasia,包括异型增生 dysplasia 与早期癌)还处于可内镜根治阶段时发现它。

问题在于:这个病变在监测图像里极其罕见。论文引用数据显示,非异型增生 BE 向腺癌的年进展风险显著低于 1% 每年。这意味着一位内镜医生一年看几千张图像,真正该报警的可能只有个位数。人眼在这种"低流行率(low prevalence)"场景下会疲劳、会被前一帧的正常黏膜锚定、会把罕见异常当作伪影略过——文献称之为人眼在低流行率下的漏检效应。

CADe 系统被寄望充当"第二读者(second reader)"或分诊助手。但论文尖锐地指出:大量 CADe 研究是在平衡数据集或富集数据集上报告的,这些数据集把肿瘤样本比例人为抬高,于是模型在"1 个真阳性对 1 个假阳性"的实验室里看起来很强,一旦放进"1 个真阳性对 100 个假阳性"的真实门诊,报警几乎全错,医生几分钟内就会关掉告警。

0.2 RARE25 的三个反直觉设计

RARE25 的出现位置(niche)不是"又一个 BE 图像分类数据集",而是针对流行率漂移(prevalence shift)的评测框架。它有三个设计决定值得单独拎出来:

  1. 主场指标换成 PPV@90Recall,而不是 AUROC。AUROC 衡量的是全局排序能力,对"在高召回点上的精确率"几乎不敏感。RARE25 直接锁定"必须达到 90% 召回"这个临床底线,然后问:在 90% 召回时,你的正预测值(Positive Predictive Value, PPV)是多少? PPV 低意味着假阳性洪流。
  2. 测试集不公开,且按 100:1 采样。这不是数据保密洁癖,而是刻意让检索者无法"猜题"——每次评测保留全部非异型增生图像,肿瘤图像有放回采样,重复 1,000 次取中位数,从而给出"在真实流行率下你大概率会看到的成绩分布",而不是单次幸运切分。
  3. 训练集是公开的、规模最大的 BE 内镜图像集合。论文宣称 3,095 张是"to our knowledge, the largest publicly available dataset of endoscopic images focusing on Barrett’s esophagus to date"——它把"训练时少数类稀缺"与"部署时流行率漂移"两重难题同时压到参赛者身上。

0.3 本条目要回答什么

这份百科条目面向的读者包括:消化道早癌 AI 研究者、CADe 产品团队、内镜影像分类工程师、以及关心"数据集评测方法论"的机器学习研究者。它会交代清楚:

  • RARE25 到底有多少张图、什么设备、哪来的、怎么切分(§2);
  • 公开/私有两套资产的门怎么进、许可怎么分层(§6);
  • 挑战赛 11 支队伍的方法与成绩单,冠军 0.035 的中位 PPV@90Recall 意味着什么(§5);
  • 为什么这个数据集只该用于"评测"而不是"刷分",以及它与 EndoVis 2015、EDD2020、GastroVision 的位置差异(§7)。

§1 数据集速览:十问十答

Q1:RARE25 是什么?
MICCAI 2025 EndoVis workshop 下的挑战赛(challenge),提供内镜图像 + 图像级二分类任务(是否含早期肿瘤),配套隐藏测试集与 prevalence-aware 评测协议。论文 arXiv:2604.11171。

Q2:谁做的?
ARIA lab(Eindhoven University of Technology, TU/e)与 Amsterdam University Medical Centers 联合主办,隶属 BONSAI consortium。通讯方向 Fons van der Sommen;临床侧 Jacques J. Bergman、Albert J. de Groof 等。

Q3:有多少数据?
公开训练集 3,095 张(2,937 NDBE + 158 NEO);隐藏测试集 26,408 张(23,176 NDBE + 3,232 NEO,论文精确口径,摘要口语口径为 “>25,000”)。

Q4:图像从哪来?
全部 Olympus Exera III 内镜系统采集。训练集来自 2 家荷兰医疗中心(EndoBase 归档回顾性检索);验证/测试集来自 BONSAI 联盟 12 家中心。

Q5:任务是什么?
图像级二分类:target 0 = NDBE(非异型增生 Barrett 食管),1 = Neoplasia(肿瘤)。无像素级标注。

Q6:主指标是什么?
PPV@90Recall——在 90% 召回点上衡量正预测值。次指标 AUROC、AUPRC 仅参考、不影响排名。

Q7:怎么防止刷榜?
测试集私有;模拟 100:1 低流行率采样,重复 1,000 次 bootstrap,取中位数与 95% CI;Open 阶段每日每队限 1 次提交。

Q8:许可是什么?
训练集 CC BY-NC-SA 4.0(非商业),HuggingFace TimJaspersTue/RARE25-train,gated=manual 需申请;测试集私有。

Q9:谁赢了?
Team IMSY(ResNet-50/GastroNet + DINOv3 ViT-L LoRA 40 模型集成 + 校准)。bootstrap 中位 PPV@90Recall = 0.035;全测试集 PPV@90Recall = 0.320,AUROC = 0.920。

Q10:最该记住的一句话?
即便冠军方法,在真实低流行率下 90% 召回时每 ~30 次报警才有 1 次是真肿瘤——这正是 RARE25 想让人看到的"临床可用性鸿沟"。


§2 数据构成与规格

2.1 规模、来源与机构构成

RARE25 的数据分两块,性质截然不同,检索者必须分清:

资产 图像数 类别构成 来源 公开性 许可
公开训练集 3,095 2,937 NDBE + 158 NEO 2 家荷兰医疗中心 HuggingFace 公开(gated) CC BY-NC-SA 4.0
隐藏测试集 26,408 23,176 NDBE + 3,232 NEO 12 家 BONSAI 中心 私有,不发布 组织方保留
验证集(Closed Validation) 未披露 未披露 12 家中心 私有 组织方保留

训练集 NEO 占比仅 158/3,095 ≈ 5.1%;测试集原始 NEO 占比约 3,232/26,408 ≈ 12.2%,但评测时会进一步按 100:1 重采样(保留全部 NDBE,NEO 有放回抽样),以模拟真实监测场景的极端不平衡。这一"两道不平衡"是理解 RARE25 全部成绩数字的前提。

训练集的组织结构在 HuggingFace 上实证为 imagefolder 格式:center_1/ndbe/002a53d53d85477486d121f792f38dd2.png 这类路径——即按"中心 / 类别 / 哈希文件名"三层目录组织。center_1 的存在暗示至少存在 center_2 目录(论文明确训练集来自 2 家中心),而官方 GitHub 的切分脚本也提供 center1_train_center2_test.csv 与 center2_train_center1_test.csv,印证跨中心泛化评测的设计。

2.2 采集设备与采集流程

  • 设备:全部图像来自 Olympus Exera III 内镜系统(Olympus Corp., Tokyo, Japan)。论文强调训练集与验证/测试集均为 Exera III,并将"设备单一是本数据集泛化性主要限制"写入 Limitations。
  • 采集方式:训练集经 EndoBase 归档的自动化查询回顾性检索,从检索池中人工识别并提取 BE 相关图像。这意味着它不是前瞻性采集,而是归档挖掘。
  • 采集背景:标准监测流程中的真实临床图像。照明、变焦、白平衡、成像模式等参数"反映常规临床实践,随本地工作流与操作者偏好而变化"——即图像本身携带大量设备/操作者噪声,论文将此列为训练集特征而非缺陷。
  • 去标识化:所有图像在发布前完成去标识化;由于采集嵌入标准诊疗,操作者经验的详细记录并非每例都有。
  • 图像格式:PNG(HF 仓库实证),单通道 RGB 彩色内镜视图。

2.3 类别体系与定位取舍

RARE25 的类别体系极简——只有两类:

  • NDBE(non-dysplastic Barrett’s esophagus):非异型增生 Barrett 食管,即"正常对照";
  • NEO(neoplasia):确诊肿瘤,涵盖异型增生与早期癌。

这一"二分类而非多分级"的取舍是刻意为之:临床决策点是"要不要进一步活检/切除",而不是"分级到几度"。把异型增生各亚型、黏膜内癌、浸润癌合并为 NEO,最大化类内样本量(在总共只有 158 个正样本的约束下这很关键),代价是丧失了肿瘤分级信息。检索者若需要分级标签,RARE25 不适用。

另一关键取舍:只有图像级标签,没有病灶级框或像素级掩码。对比 EDD2020(提供标注的肿瘤病灶位置)和 EndoVis 2015 BE 子挑战(100 NDBE + 100 NEO 的定向集合),RARE25 选择"大而粗"而非"小而精"——它押注的是"规模 + 真实流行率"比"精细定位"更能暴露部署真实性能。

2.4 数据切分方案

官方 GitHub(IMSY-DKFZ/rare2025-challenge,代表冠军队伍,同时给出赛事标准切分)提供 data_splitting/create_splits.py,生成四套 CSV:

  1. 5fold_cv.csv——分层 5 折交叉验证;
  2. center1_train_center2_test.csv——中心 1 训练、中心 2 测试;
  3. center2_train_center1_test.csv——中心 2 训练、中心 1 测试;
  4. holdout_cv.csv——5 折 CV + 独立保留测试集。

每行含 image_path、sample_id、center、class_name(ndbe/neo)、target(0/1)、split 六列。这套切分把"跨中心泛化"正式纳入训练流程:参赛者可以在本地就模拟中心漂移,而不只是依赖官方验证榜。

注意:这套 CSV 只针对公开训练集 3,095 张做切分。隐藏测试集不接受本地切分——它是组织方保留的终评资产。


§3 挑战赛设计与评测协议

3.1 三阶段结构

RARE25 的执行被切成三个连续阶段,每阶段的约束直接塑造了参赛者的策略:

阶段 时间 关键规则 检索者需知
Open Development Phase 与训练数据公开同步启动,历时 3 个月 每日每队限 1 次验证榜提交 限次是为防过拟合排行榜;196 次提交即由此上限"挤"出
Closed Testing Phase Open 结束后 每队 1 次终提交,结果保密 终评成绩直到 MICCAI 2025 现场才公布
Post-MICCAI Phase 会议结束后 重新开放,但终测集无新增提交 结果页由 RARE26 站点承载

阶段设计的核心意图是**“防止把测试集当训练集”**:Open 阶段给足迭代空间但有每日限次,Closed 阶段一次定生死且结果延迟公布,从而逼出真正泛化的方法而非排行榜过拟合解。论文明确记录 Post-MICCAI 阶段"没有对终测集做出额外提交",说明终评成绩是稳定的、未被后期刷分污染。

3.2 主指标 PPV@90Recall 的精确含义

这是整份条目最需要讲清的技术点。PPV@90Recall = 在模型阈值被调到"召回率达到 90%"时,该操作点上的正预测值(Positive Predictive Value, PPV,即精确率 precision)。

  • 直觉:临床底线是"不能漏(召回 90%)",那么在这个约束下,报警里有多少是真肿瘤?
  • 在 100:1 流行率下,PPV 的数学上限本身就很低。设 100 个 NDBE + 1 个 NEO,90% 召回须命中该 1 个真阳性(近似 0.9 个),若假阳性率为 f(相对 100 个 NDBE),则 PPV ≈ 0.9/(0.9 + 100f)。哪怕 f = 1%(极低假阳性率),PPV 也仅约 0.47。
  • 因此PPV@90Recall 对假阳性率的放大倍数约为 100 倍——这正是它比 AUROC 严酷的地方:AUROC 会掩盖高召回点上的精确率崩塌。

论文引用 Metrics Reloaded 报告框架,明确采用三指标互补:AUROC(全局判别)、AUPRC(检索性能)、PPV@90Recall(临床操作点)。只有 PPV@90Recall 决定最终排名,另两个仅作参考,防止参赛者用"漂亮的 AUROC"掩盖"临床不可用"。

3.3 Bootstrap 评测协议

组织方的评测流程被论文反复强调为"prevalence-aware":

  1. 每次评测保留全部非异型增生图像(不采样,NEO 采样);
  2. 肿瘤图像有放回采样,目标是构造 100:1 的 NDBE:NEO 比例;
  3. 每次迭代计算 PPV@90Recall;
  4. 重复 1,000 次,最终成绩取 1,000 次的中位数,并给出 95% 置信区间。

有放回采样 + 1,000 次重复的用意是:在正样本极少(测试集 3,232 NEO 虽不算少,但采样到 1% 后每轮有效正样本数有限)时,单次评测方差巨大,中位数+CI 才是稳健估计。这也解释了成绩单里"bootstrap 中位 PPV@90Recall"与"全测试集 PPV@90Recall"两列必须分开看——前者才是排名依据。

3.4 参与与公平性规则

  • 仅允许全自动方法(fully automated):现场交互式或人工参与的选择被禁,保证可复现与可部署。
  • 开放注册:226 人注册,来自全球多个研究组;Open 阶段 20 队 / 10 国活跃;Closed 阶段 11 队 / 7 国提交有效结果。
  • 提交次数硬约束:Open 阶段每日每队上限 1 次——这是抑制"刷验证榜"的经典手段。

§4 数据集的定位:与既有 BE / 内镜基准的比较

4.1 为什么需要 RARE25:三处空白

论文用一节专门的 Related Work 论证 RARE25 的必要性,实质是列出前任数据集的三个不足:

空白一:既有 BE 公开集太小。

  • EndoVis 2015 BE 子挑战:仅 100 NDBE + 100 NEO,共 200 张;
  • EDD2020:含 BE 标注病灶,但整个数据集仅 384 张;
  • GastroVision:覆盖全消化道,其 BE 子集仅 95 张,且不提供"是否含肿瘤"的标注。

在三者任一之上训练 CADe,正样本稀缺到无法支撑现代深度模型。

空白二:评测脱离真实流行率。
既有基准多在平衡或富集数据上报告性能,导致"实验室很强、临床报警全错"。RARE25 用 100:1 采样 + PPV@90Recall 把这一乐观偏差显式打掉。

空白三:缺少"锁定测试床 + 可复现评测框架"的组合。
论文贡献可概括为三条:(1) 提供比既往大得多的公开 BE 图像集;(2) 提供按临床流行率采样的锁定测试床,暴露真实假阳性负担;(3) 提供强调临床操作点的可复现评测。

4.2 与库内相关数据集的横向位置

数据集 库内 rid 模态 规模口径 与 RARE25 的关系
GastroVision 203 全消化道内镜 大型 RARE25 论文点名其 BE 子集仅 95 图且无肿瘤标注
HyperKvasir 693 消化道内镜/视频 大型 同域内镜图像库,任务不同(多类解剖/病理)
Kvasir-SEG 112 息肉分割 中 同为内镜,但任务是分割息肉
Kvasir-Capsule 123 胶囊内镜 大型 设备模态不同(胶囊 vs 标准内镜)
EndoVis Challenges 79 手术/内镜挑战赛集合 多子集 同属 EndoVis 挑战赛谱系,RARE25 为其 2025 BE 分支
CAD-CAP 193 结肠镜 大型 消化内镜 CADe 同类基准,部位不同
CADEC 464 内镜(不同收藏) — 名称相近但非 BE 检测任务,勿混
BONSAI-相关 — — — RARE25 隶属 BONSAI 联盟,但 BONSAI 本身非库内独立条目

互链提示:RARE25 与 EndoVis Challenges(rid 79)构成"EndoVis 系列"直接亲缘;与 GastroVision(203)构成"论文点名的对照物"关系。检索者若研究内镜 CADe 基准谱系,建议沿这两条链展开。

4.3 定位的一句总结

若用一句话把 RARE25 放进坐标系:它是把"低流行率"当成一等公民的 BE 内镜检测基准——其他数据集问"你能分开这两类图吗",RARE25 问"当两类图以 1:100 出现时,你的报警还值得医生相信吗"。


§5 挑战赛结果与方法图谱

5.1 参与概况与总览

  • 注册:226 人;
  • Open Development Phase:196 次提交,20 队,10 国;
  • Closed Testing Phase:11 队,7 国 完成有效提交;
  • Post-MICCAI:无新增终测提交。

5.2 冠军 Team IMSY

方法:以 GastroNet 预训练的 ResNet-50 为强 CNN 主干,叠加 LoRA 微调的 DINOv3 ViT-Large,组成 40 模型集成(20 个 ResNet-50 + 20 个 ViT-Large),并进行 post-hoc 校准(affine 重校准聚合 logits)。训练用带类权重的交叉熵 + 平衡采样器(ViT-L),ResNet-50 侧用直接瞄准 PPV@90Recall 的代理损失(surrogate loss)。

成绩:

  • bootstrap 中位 PPV@90Recall = 0.035;
  • 全测试集(不重采样)PPV@90Recall = 0.320;
  • 全测试集 AUROC = 0.920;
  • 全测试集 AUPRC = 0.822;
  • 在约 60% 的重采样中排名第一。

IMSY 的策略核心是稳健而非单点最强:跨折一致性优于单一模型峰值,用大规模集成 + 校准压低在高召回点上的方差。官方结果页(RARE26 站)将其概括为"强调跨折鲁棒性与一致性,而非依赖单一模型"。

5.3 亚军 Team UT 与其他队伍

  • Team UT:MaxViT-Tiny 纯 Transformer,仅用挑战赛数据训练(无大规模外部预训练)。其 bootstrap 中位 AUPRC = 0.532(全队最高),证明"精心组织训练/验证下,无大规模预训练也能有竞争力"。
  • Team Jmees-inc:把图像级分类重构为分割驱动流程,采用分阶段预训练(息肉 → BE → 癌症)+ compact 集成;交叉验证得 AUROC 0.9896、AUPRC 0.7408、PPV 0.235。
  • Team sk:ConvNeXt-Base (V1) + ImageNet-22k 预训练 + 加权 Focal Loss + 10 模型集成 + 4 视角旋转 TTA;50/50 切分下 Open 阶段 AUPRC 0.310 / AUROC 0.832 / PPV@90Recall 0.015,全数据集提升至 AUPRC 0.527 / AUROC 0.820 / PPV@90Recall 0.163。
  • Team agaldran:25 个 ResNet-50 集成,logit-adjusted 二元交叉熵应对极端不平衡。
  • Team MEDAI:ResNet50 + GastroNet-5M 域内预训练 + Balanced MixUp + Platt scaling 校准。
  • Team CINDIE(论文方法节提及):Open 阶段 AUROC 0.78,但在 1% 极端流行率下 PPV@90Recall 降至 0.01,是"判别强但精确率崩塌"的典型样本。

5.4 排名与结果的可迁移结论

  • 方法趋势:top 队伍普遍依赖大规模预训练 + 集成 + 校准三件套;单模型方案在榜首已无竞争力。
  • 排名对指标敏感:按 PPV@90Recall 排,IMSY 第一;按 bootstrap 中位 AUPRC 排,UT 第一。同一批模型换指标即换榜首——论文据此强调"报告 PPV at 临床要求召回 + 不确定性估计应是方法评测的必要元素"。
  • 绝对水平很低:IMSY 全测试集 PPV@90Recall = 0.32 已是最好,意味着在高召回操作点下,大部分报警仍是假阳性。论文直言这会造成"substantial false-positive burden, could strain clinical workflows"。
  • 方法同质化:所有提交均为全监督分类,无一采用异常检测或单类学习(one-class learning)——尽管临床数据压倒性地是"正常"。论文将此点名为"prevalence-agnostic approaches 的缺失",是留给后续研究的明确缺口。
  • 技术断层:top 方法相对第五名在 PPV@90Recall 上有 52% 提升,第五名相对第十名又有 50% 提升——说明该任务上方法间差距巨大,尚未收敛。

5.5 成绩单精读(双口径)

口径 Team IMSY 说明
bootstrap 中位 PPV@90Recall(排名依据) 0.035 100:1 采样 + 1,000 次重复的中位数
全测试集 PPV@90Recall 0.320 不重采样、保留原始类分布
全测试集 AUROC 0.920 全局判别能力,与操作点无关
全测试集 AUPRC 0.822 检索性能
bootstrap 中位 AUPRC 最高者 Team UT = 0.532 换指标换冠军的实证

读这组数字的守则:0.035 与 0.320 不矛盾,是"真实流行率下"与"原始分布下"两个不同考场的成绩。前者低得惊人,恰恰是 RARE25 想要的效果——它让"临床可用性鸿沟"变得可量化。任何引用 RARE25 成绩的场合,必须写明是哪个口径。


§6 获取与许可:两套资产、两种门

6.1 资产与门的对照

RARE25 的可获取性是清晰的二层结构(比 PANDA-PLUS 的三层简单,但同样存在许可陷阱):

资产 获取方式 许可 门
公开训练集(3,095 张) HuggingFace TimJaspersTue/RARE25-train CC BY-NC-SA 4.0 gated=manual,需申请授权
隐藏测试集(26,408 张) 无 组织方保留 不发布,任何途径均无公开入口
切分脚本 GitHub IMSY-DKFZ/rare2025-challenge 见仓库 LICENSE 公开
论文 arXiv:2604.11171 arXiv 默认(论文文本) 公开
结果页 rare26.grand-challenge.org/rare25-results — 公开

6.2 HuggingFace 下载实操

训练集在 HuggingFace 上以 gated=manual 方式发布——即需先接受条款/申请授权,通过后方可下载。镜像走 hf-mirror.com(沙箱内 HuggingFace 主站受限时的标准做法)。命令行方式:

# 需先完成 HF 登录与 repo 授权(gated=manual)
pip install huggingface_hub[cli]
huggingface-cli login
huggingface-cli download TimJaspersTue/RARE25-train --repo-type dataset --local_dir ./data/train

HF 元数据(抓取时点 2026-09-30):lastModified = 2025-05-28,downloads = 9,likes = 5,format = imagefolder,task_categories = image-classification,size_categories = 1K<n<10K。下载量仅 9 说明该仓库相对小众(挑战赛结束后热度回落),但数据本体完整可用。

6.3 许可分层与双口径存照

这是本条目必须存档的核心许可陷阱:

  • 数据集实体:论文第 4.1 节原文写训练集为 “released under a non-commercial CC-BY-NC-SA license”;HuggingFace 仓库 tags 实证 license:cc-by-nc-sa-4.0。→ 数据许可 = CC BY-NC-SA 4.0。
  • 论文文本:arXiv HTML 页面 boilerplate 显示 “License: CC BY 4.0”,这是 arXiv 对论文文本的默认许可口径,不等于数据许可。

二者经常被混引。正确表述是:用 RARE25 数据做商业 CADe 产品开发,受 CC BY-NC-SA 的"NC(非商业)"限制;而引用/转载论文文本则按 CC BY 4.0。检索者与产品团队务必区分。

此外,CC BY-NC-SA 的 **SA(ShareAlike,相同方式共享)**条款意味着衍生数据集也须以相同许可发布——若在 RARE25 上做再标注并公开,需遵守传递性要求。

6.4 AI-Ready 评估:这份数据集"就绪"在哪、卡在哪

就绪面:

  • 训练集有稳定直链(HF),格式规范(imagefolder + PNG),标签明确(0/1);
  • 官方提供可复现的切分脚本与评估协议描述;
  • 有完整的挑战赛结果与参赛方法公开(GitHub + 论文 + 结果页)。

卡点:

  • 测试集不可获取——任何声称"在 RARE25 测试集上复现 XX 成绩"的说法都无法独立验证,只能依赖组织方的 bootstrap 结果;
  • 许可非商业——限制工业界直接用于产品训练;
  • 只有图像级标签——无法用于检测/分割任务的监督;
  • 标签分布极端不平衡——若直接当普通二分类数据集用,会重现论文批评的"流行率被忽视"问题。

6.5 与库内可获取性光谱的对照

在库内内镜数据集中,RARE25 的获取难度属于中上:比 HyperKvasir(693)、Kvasir 系列(全开放)更受限(gated + 非商业),但比纯请求制数据集(如某些仅靠邮件申请的数据)更友好。其"训练集可下、测试集锁定"的结构在挑战赛数据集里是常态,检索者应把它当作评测基准而非训练语料库来规划用途。


§7 生态与影响

7.1 挑战赛谱系:EndoVis 与 BONSAI

  • EndoVis workshop:MICCAI 长期附属的内镜视觉挑战赛工作坊,历届产出多个内镜数据集/基准。RARE25 是其 2025 年的 BE 检测分支;库内 endovis-challenges(rid 79) 是该系列的主锚条目。
  • BONSAI consortium:RARE25 的临床数据来源与组织背景。联盟内 12 家中心贡献了验证/测试集的图像,这一"多方中心"结构是 RARE25 泛化评测的物质基础。
  • ARIA lab(TU/e):主办实验室,长期从事消化道内镜 AI 与视频分析。其学术产出是理解 RARE25 方法倾向(域内预训练、集成、校准)的背景。

7.2 后继:RARE26

挑战赛在 MICCAI 2025 后重新开放为 RARE26(rare26.grand-challenge.org)。RARE25 的结果页挂在 RARE26 站点下(路径 /rare25-results)。这一"赛事延续"模式意味着:RARE25 的训练集可能被 RARE26 复用或扩展,检索者需确认所用版本对应的赛事年份。RARE26 的出现本身是 RARE25 影响力的直接证据——一个只有 3,095 张公开图的基准,因切中"低流行率"痛点而获得续办。

7.3 在前沿的位置:为什么"低流行率"是 2025-2026 的热点

RARE25 的时机踩在医学影像 AI 的一个转向点上:从"在平衡数据集上刷 SOTA"转向"在部署真实分布上证明有用"。同期趋势包括:

  • Metrics Reloaded(论文引用的评估框架):推动按临床决策点选指标,反对单一 AUROC 叙事;
  • 异常检测 / 单类学习在内镜早癌方向的升温——RARE25 论文点名"所有参赛方法都是全监督分类",把这一空白公开标记为待解问题;
  • 基础模型 + 参数高效微调成为内镜任务主流(IMSY 的 DINOv3+LoRA 即代表)。

7.4 库内互链点(附 rid)

条目 rid 互链理由
endovis-challenges 79 EndoVis 系列直接亲缘,同会议/同工作坊谱系
gastrovision 203 论文点名的对照数据集(BE 子集仅 95 图)
hyperkvasir 693 消化道内镜图像库,同域
kvasir-hyperkvasir 75 HyperKvasir 衍生,内镜图像分类
kvasir-seg 112 内镜分割(息肉),同域不同任务
kvasir-capsule 123 胶囊内镜,设备模态对照
kvasir-instrument 213 内镜器械检测,同域
cadec 464 内镜 CADe 类基准(注意与 BE 检测任务区分)
cad-cap 193 结肠镜 CADe,部位对照
cadis 243 CAD 相关内镜条目
slam-3d-endoscopic 82 3D 内镜重建,模态对照
polypgen 183 息肉检测基准,内镜检测任务对照
bkai-igh-neopolyp 84 消化道息肉检测
ldpolypvideo 163 息肉视频检测

建议优先建立的三条互链:RARE25 ↔ endovis-challenges(79)(谱系)、RARE25 ↔ gastrovision(203)(论文对照)、RARE25 ↔ hyperkvasir(693)(同域基准)。

7.5 生态影响小结

RARE25 的最大生态价值或许不在"又一个数据集",而在它把评测口径本身变成了可讨论的对象。它示范了如何用一个刻意不公开的测试集 + 一个对假阳性极度敏感的指标,迫使社区直面"模型在真实流行率下到底能不能用"。这一方法论影响,可能比其 3,095 张训练图本身更持久。


§8 方法学启示:五条可迁移的经验

8.1 评测指标应锚定临床操作点,而非全局判别

AUROC 高不等于可用。RARE25 用 PPV@90Recall 证明:同一批模型 AUROC 都"不错",但在 90% 召回点上精确率崩塌到 0.035。任何面向筛查/监测的 AI 评测,都应至少报告一个临床相关召回点上的精确率。

8.2 流行率是评测的一等参数,不是数据的偶然属性

RARE25 把 100:1 采样写进评测协议、重复 1,000 次。这提示:**合成低流行率场景(保留全部阴性 + 有放回采样阳性)**是把"实验室性能"翻译成"部署性能"的廉价而有效的手段。任何正样本稀缺的检测任务都可借鉴。

8.3 训练时不平衡 ≠ 部署时不平衡,两者要分开处理

RARE25 同时存在"训练集 5% 正样本"和"部署 1% 流行率"两道不平衡。论文的教训是:训练时用类权重/均衡采样解决第一道,评测时用流行率采样暴露第二道,绝不能混为一谈或只解决一道。

8.4 集成 + 校准是低流行率下的稳健解,但治标不治本

冠军 IMSY 靠 40 模型集成 + 校准拿到第一,但绝对 PPV 仍仅 0.32。说明在极端不平衡下,规模与校准能压低方差、提升稳健性,却无法根本解决"正常图像压倒性地多"带来的假阳性问题。论文据此呼吁异常检测/单类学习范式。

8.5 测试集私有是挑战赛公平性的双刃剑

私有测试集防止了刷分与过拟合,但也牺牲了独立可复现性——外部无法验证组织方报告的数字。RARE25 的取舍是把"可复现"让位给"防污染",检索者引用其成绩时须明确这一限制。

8.6 给数据集建设者的清单

  1. 明确区分训练集/测试集的公开性与许可;
  2. 评测协议写死流行率与重复次数;
  3. 报告至少一个临床操作点指标 + 不确定性;
  4. 提供跨中心/跨设备的切分脚本;
  5. 把设备/中心单一样式写入 Limitations 而非隐瞒。

§9 与库内条目的关系

9.1 家族图谱

RARE25 在库内属于消化道内镜影像族,向上归 EndoVis 挑战赛谱系:

EndoVis workshop (MICCAI)
├── endovis-challenges (rid 79)  ← 系列主锚
│   └── RARE25 (rare25)          ← 本条目,2025 BE 检测分支
└── 消化道内镜数据集族
    ├── gastrovision (rid 203)   ← 论文点名对照(BE 子集仅 95 图)
    ├── hyperkvasir (rid 693)    ← 同域大库
    ├── kvasir-hyperkvasir (rid 75)
    ├── kvasir-seg (rid 112)
    ├── kvasir-capsule (rid 123)
    ├── kvasir-instrument (rid 213)
    ├── cadec (rid 464) / cad-cap (rid 193) / cadis (rid 243)  ← CADe 类
    ├── polypgen (rid 183) / bkai-igh-neopolyp (rid 84) / ldpolypvideo (rid 163)  ← 息肉检测
    └── slam-3d-endoscopic (rid 82)

9.2 检索路径建议

  • 想做 BE/食管早癌 AI:RARE25 是当前最大公开 BE 内镜集,但注意它只有图像级标签、非商业许可、测试集不可得——适合做方法原型 + 低流行率评测,不适合直接训练商用产品。
  • 想研究"流行率漂移"评测方法:RARE25 的 100:1 bootstrap 协议是可迁移模板,配合库内其他检测类数据集(polypgen、cad-cap)做横向。
  • 想复现内镜基础模型:RARE25 官方 GitHub(IMSY-DKFZ/rare2025-challenge)提供 GastroNet + DINOv3 + LoRA 完整管线,是内镜域 PEFT 的现成参考。

9.3 关系声明

RARE25 与库内无同名/别名条目(rare 关键词查重 0 命中)。它与 RARE26 是同一挑战赛的前后届关系,非同一数据集;若后续 RARE26 被收录,应作为独立条目并双向互链,而非合并。


§10 避坑清单:九个已踩过的坑

坑 1:把 arXiv 论文的 CC BY 4.0 当成数据许可。
arXiv 页面 boilerplate 的 “License: CC BY 4.0” 是论文文本许可;RARE25 数据是 CC BY-NC-SA 4.0。混用会导致商业使用越界。

坑 2:以为测试集也能下载。
26,408 张测试图永不公开。任何"RARE25 完整版下载"的说法都不可信;能拿到的只有 3,095 张训练图。

坑 3:把"中位 PPV@90Recall = 0.035"和"全测试集 = 0.320"当成矛盾。
两者是不同口径:前者是 100:1 流行率 + 1,000 次 bootstrap 的中位数(排名依据),后者是原始分布下不重采样的成绩。引用时必须写明口径。

坑 4:用 AUROC 排序 RARE25 成绩。
AUROC 排序会把 UT 排上来、把 IMSY 的领先抹平。RARE25 的官方排序只看 PPV@90Recall。换指标换冠军是这篇论文的核心发现之一。

坑 5:把训练集 3,095 与"over 3,000"当成两个数。
"over 3,000"是论文摘要口语口径;精确值是 2,937 NDBE + 158 NEO = 3,095。引用精确数。

坑 6:把训练集 NEO 占比 5.1% 当成部署流行率。
训练集 5.1% 是训练时的富集比例;部署流行率被模拟为 1%(100:1)。二者相差约 5 倍,是 RARE25 刻意制造的两道不平衡。

坑 7:忽略 single-device 限制。
全部图像来自 Olympus Exera III。论文自曝这是泛化性主要限制。用 RARE25 训练的模型迁移到其他内镜品牌需谨慎。

坑 8:把 RARE25 当成"分级"数据集。
它只有 NDBE/NEO 二分类,没有异型增生分级、没有病灶框、没有像素掩码。需要定位/分级请勿选它。

坑 9:混淆 RARE25 与 RARE26。
RARE25 结果页挂在 rare26.grand-challenge.org 下,容易误以为两者是同一赛事。它们是前后届,数据与结果应分别标注年份。


§11 总结

11.1 三句话总结

  1. RARE25 是 MICCAI 2025 EndoVis 下的 BE 早癌检测挑战赛数据集:3,095 张公开训练图(2,937 NDBE + 158 NEO)+ 26,408 张私有测试图,全部 Olympus Exera III 采集。
  2. 它的杀手锏是评测口径:用 PPV@90Recall 在 100:1 低流行率 + 1,000 次 bootstrap 下暴露假阳性负担,冠军 IMSY 的 bootstrap 中位 PPV@90Recall 仅 0.035,量化了"临床可用性鸿沟"。
  3. 它是基准而非语料库:训练集 CC BY-NC-SA 4.0(gated)、测试集永恒私有、只有图像级标签——用途应锚定"方法原型 + 低流行率评测",而非商用训练或定位任务。

11.2 适合谁

  • 消化道早癌 AI / CADe 研究者:需要一个"最大公开 BE 内镜集 + 严格低流行率评测";
  • 低流行率机器学习研究者:RARE25 的 bootstrap 协议是可迁移的评测范式样本;
  • 内镜基础模型 / PEFT 实践者:官方 GitHub 提供 GastroNet + DINOv3 + LoRA 完整管线;
  • 评测方法论研究者:论文是"指标选错会误导"的教科书案例。

11.3 不适合谁

  • 需要病灶定位/分割的人:无框、无掩码;
  • 需要肿瘤分级的人:只有二分类;
  • 想商用训练模型的人:CC BY-NC-SA 的 NC 条款限制;
  • 想复现榜首成绩的人:测试集不可得,只能引用组织方数字;
  • 需要多设备泛化的人:单一 Exera III 设备。

11.4 30 秒决策卡

你的需求 RARE25 是否合适 理由
BE 早癌图像分类训练 ✅ 是 最大公开 BE 内镜集
低流行率评测 ✅✅ 非常适合 PPV@90Recall + 1% 采样
病灶检测/定位 ❌ 否 仅图像级标签
肿瘤分级 ❌ 否 仅 NDBE/NEO
商业产品训练 ❌ 否 CC BY-NC-SA(非商业)
复现挑战赛排名 ⚠️ 部分 测试集私有,不可独立复现
多设备泛化验证 ❌ 否 仅 Exera III

FAQ(高频问答 20 问)

A. 基础认知

1. RARE25 是什么的缩写?
官方题名为 “Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge”。“RARE” 指低流行率(rare)场景,25 指 2025 年赛事年份。

2. RARE25 是数据集还是挑战赛?
两者都是——它是一场比赛,比赛提供了数据集(公开训练集 + 私有测试集)。本条目描述的是这套数据资产与评测协议。

3. 谁主办的?
ARIA lab(Eindhoven University of Technology)+ Amsterdam University Medical Centers,隶属 BONSAI consortium,作为 MICCAI 2025 EndoVis workshop 的一部分。

4. 论文在哪里?
arXiv:2604.11171(cs.CV),2026-04-13 提交;DOI 10.48550/arXiv.2604.11171。

5. 结果公布在哪?
rare26.grand-challenge.org/rare25-results(RARE26 站点的 RARE25 结果页)。

B. 数据与获取

6. 训练集多少张?
3,095 张 = 2,937 NDBE + 158 NEO。

7. 测试集多少张?
26,408 张 = 23,176 NDBE + 3,232 NEO(论文精确口径;摘要写 “>25,000”)。

8. 测试集能下载吗?
不能。组织方私有保留,任何途径均无公开入口。

9. 训练集在哪下?
HuggingFace TimJaspersTue/RARE25-train,gated=manual(需申请授权)。镜像 hf-mirror.com。

10. 许可是什么?
训练集 CC BY-NC-SA 4.0(非商业);测试集私有;论文文本 CC BY 4.0。注意三者的区别。

11. 图像什么设备拍的?
Olympus Exera III 内镜系统。

12. 数据来自哪些医院?
训练集 2 家荷兰中心;验证/测试集 BONSAI 联盟 12 家中心。

C. 评测与方法

13. 主指标是什么?
PPV@90Recall(在 90% 召回点上的正预测值)。

14. 次指标是什么?
AUROC、AUPRC,仅参考,不影响排名。

15. 为什么用 PPV@90Recall 而不是 AUROC?
AUROC 掩盖高召回点上的精确率崩塌;PPV@90Recall 直接量化临床操作点的假阳性负担。

16. 评测怎么做的?
100:1(NDBE:NEO)有放回采样,重复 1,000 次,取 PPV@90Recall 中位数 + 95% CI。

17. 谁赢了?成绩多少?
Team IMSY;bootstrap 中位 PPV@90Recall = 0.035,全测试集 PPV@90Recall = 0.320,AUROC = 0.920。

18. 冠军用的什么方法?
GastroNet(ResNet-50) + DINOv3 ViT-L(LoRA) 40 模型集成 + post-hoc 校准。

18b. 为什么冠军用了 40 个模型?
正样本极少时单模型方差大,集成是"压方差"而非"求更强",配合 affine 校准把聚合分数映射回可信概率尺度,使 90% 召回阈值可复现。

D. 定位与库内

19. RARE25 和 EDD2020 / EndoVis 2015 什么关系?
同属 BE 检测基准,但 RARE25 规模更大(3,095 vs 384 vs 200)且增加低流行率评测;EDD2020 有病灶标注而 RARE25 没有。

20. 库内有哪些相关条目?
endovis-challenges(79)、gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、cad-cap(193)、polypgen(183) 等,详见 §7.4。

E. 进阶与工程

21. RARE25 的训练集能不能直接当普通二分类数据集跑?
技术上可以,但会重现论文批评的"流行率被忽视"问题——普通训练+离线 AUROC 评估会严重高估临床性能。正确做法是把评测口径切换到 PPV@90Recall + 100:1 采样。

22. 训练集 5.1% 正样本,测试集 12.2% 正样本,为什么说部署是 1%?
12.2% 是测试集的原始正样本率;评测时再对 NEO 有放回采样至 100:1(约 1%),以模拟真实监测流行率。这两个数是"原始收集比例"与"评测模拟比例"的区别。

23. 能不能只用公开训练集自建一个接近官方的测试集?
可以,但只能得到"自建分布"下的成绩,无法与官方 bootstrap 排名直接比较。建议用 center2 子集做留出,模拟跨中心泛化。

24. RARE25 的图像分辨率是多少?
论文未在正文明示原图分辨率;224×224 是参赛模型的输入尺寸,不是原图尺寸。检索者若需原图规格应从 HF 数据实体实测。

25. 为什么说它"不适合复现排名"?
测试集私有意味着外部无法在相同数据上重跑评测,只能引用组织方报告的 bootstrap 数字。这牺牲了独立可复现性以换取防刷分的公平性。

26. 如果我要做 BE 病灶定位,应该选什么?
选有病灶级/像素级标注的数据集(如 EDD2020 提供标注病灶),RARE25 只有图像级标签,无法监督定位任务。

27. RARE26 和 RARE25 的数据一样吗?
官方未明确说明完全复用;RARE26 是续办赛事,RARE25 的结果页挂在其站点下。检索者使用时应以所用仓库版本对应的赛事年份为准。

28. 论文作者名单为什么可能变化?
arXiv v1 的 Comments 明确写"final author list is currently being finalized and will be updated in subsequent versions"——引用时建议核对最新版本。

29. 这个数据集有患者级信息吗?
没有公开患者级字段。训练集仅提供图像 + 类别 + 中心归属 + 切分标识,患者级数量未披露。

30. 为什么 top 方法都用大规模预训练?
BE 正样本太少,从零训练不可行;域内预训练(GastroNet)或通用基础模型(DINOv3/ImageNet)提供强先验,是低数据场景的必要条件。

31. “prevalence-agnostic” 是什么意思?
指不依赖训练流行率假设的方法——如异常检测、单类学习。论文点名所有参赛方法都是全监督分类,缺失这一范式的探索。

32. RARE25 的评测能否用于其他部位的内镜任务?
其 100:1 bootstrap + PPV@操作点方法论是通用的,可迁移到结肠息肉、食管鳞癌等任何正样本稀缺的检测任务,只需替换数据与临床召回要求。


事实清单(硬事实 32 条)

  1. RARE25 = MICCAI 2025 EndoVis workshop 挑战赛(arXiv:2604.11171)。
  2. 主办:ARIA lab (TU/e) + Amsterdam UMC,隶属 BONSAI consortium。
  3. 赛事地点:MICCAI 2025, Daejeon, South Korea。
  4. 论文提交日:2026-04-13(v1)。
  5. 公开训练集:3,095 张。
  6. 训练集构成:2,937 NDBE + 158 NEO。
  7. 隐藏测试集:26,408 张(23,176 NDBE + 3,232 NEO)。
  8. 测试集摘要口径:“>25,000 images”。
  9. 设备:Olympus Exera III(全部图像)。
  10. 训练集来源:2 家荷兰医疗中心。
  11. 测试集来源:BONSAI 联盟 12 家中心。
  12. 采集方式:EndoBase 归档回顾性检索 + 人工筛选。
  13. 任务:图像级二分类(0=NDBE,1=Neoplasia)。
  14. 无像素级/病灶级标注。
  15. 主指标:PPV@90Recall。
  16. 次指标:AUROC、AUPRC(仅参考)。
  17. 评测协议:100:1 采样 + 1,000 次 bootstrap + 中位数。
  18. 注册人数:226。
  19. Open 阶段:196 次提交,20 队,10 国。
  20. Closed 阶段:11 队,7 国。
  21. 冠军:Team IMSY。
  22. IMSY bootstrap 中位 PPV@90Recall = 0.035。
  23. IMSY 全测试集 PPV@90Recall = 0.320。
  24. IMSY 全测试集 AUROC = 0.920。
  25. IMSY 全测试集 AUPRC = 0.822。
  26. UT bootstrap 中位 AUPRC = 0.532(最高)。
  27. 数据许可:CC BY-NC-SA 4.0。
  28. HF 仓库:TimJaspersTue/RARE25-train(gated=manual)。
  29. HF lastModified:2025-05-28。
  30. EndoVis 2015 BE:100 NDBE + 100 NEO。
  31. EDD2020:384 图。
  32. GastroVision BE 子集:95 图,无肿瘤标注。

术语表(22 条)

术语 英文 释义
Barrett 食管 Barrett’s esophagus (BE) 胃食管反流引起的食管远端黏膜化生,食管腺癌癌前病变
非异型增生 non-dysplastic BE (NDBE) BE 中无细胞异型的"正常"状态,RARE25 的阴性类
肿瘤 neoplasia (NEO) 含异型增生与早期癌,RARE25 的阳性类
食管腺癌 esophageal adenocarcinoma BE 进展的终末恶性病变
CADe computer-aided detection 计算机辅助检测,本挑战赛的目标系统
低流行率 low prevalence 阳性样本占比极低(此处模拟 1%)
流行率漂移 prevalence shift 训练分布与部署分布的阳性率差异
正预测值 positive predictive value (PPV) 精确率 precision,报警中真阳性的比例
召回 recall 灵敏度 sensitivity,真阳性被检出的比例
PPV@90Recall — 在召回=90% 操作点上的 PPV,RARE25 主指标
AUROC area under ROC curve 全局判别能力指标
AUPRC area under PR curve 检索性能指标
Bootstrap — 有放回重采样估计统计量分布的方法
类不平衡 class imbalance 正负样本比例悬殊
异常检测 anomaly detection 只学"正常"分布、异常即报警的范式
单类学习 one-class learning 仅用单类样本训练的学习范式
集成 ensemble 多模型投票/平均提升稳健性
校准 calibration 使预测概率与实际频率一致的后处理
LoRA low-rank adaptation 低秩参数高效微调方法
参数高效微调 PEFT 只微调少量参数的迁移学习范式
域内预训练 domain-specific pretraining 在目标域大数据(如 GastroNet-5M)上预训练
测试时增强 test-time augmentation (TTA) 推理时对输入做多变换再聚合预测

§12 深入解读:为什么低流行率检测如此困难

12.1 数学根源:贝叶斯视角下的 PPV

要理解 RARE25 为何把 PPV@90Recall 定为主指标,需要回到贝叶斯公式。设流行率为 π(阳性先验),灵敏度为 Se,特异度为 Sp,则:

PPV = (Se · π) / (Se · π + (1 - Sp) · (1 - π))

当 π = 1%(RARE25 的部署模拟流行率)、Se = 0.90 时:

  • 若 Sp = 0.99(假阳性率 1%):PPV = 0.9·0.01 / (0.9·0.01 + 0.01·0.99) = 0.009 / (0.009 + 0.0099) ≈ 0.476
  • 若 Sp = 0.95(假阳性率 5%):PPV = 0.009 / (0.009 + 0.0495) ≈ 0.154
  • 若 Sp = 0.90(假阳性率 10%):PPV = 0.009 / (0.009 + 0.099) ≈ 0.083

冠军 IMSY 在全测试集上的 PPV@90Recall = 0.320,反推其在此操作点上的等效特异度约为 0.985 上下——已经相当高,但在 1% 流行率下,PPV 依然只有三成。这正是 RARE25 想传达的核心:在低流行率场景中,哪怕特异度做到 99%,每 3 次报警仍有约 2 次是假的。

12.2 "低流行率效应"的心理与统计双重机制

临床上把这一现象拆成两层:

统计层:如上式,PPV 对流行率极度敏感。同一模型在 50% 流行率下 PPV 可能高达 0.95,在 1% 流行率下骤降到 0.3 以下,而模型的 Se/Sp 完全没变。所有"在平衡数据上很强"的报告,若不做流行率校正,都是对临床性能的高估。

心理层:内镜医生在长期监测中极少遇到阳性,视觉搜索会被前一帧的正常黏膜锚定,形成"预期偏差"——大脑倾向于把罕见异常归类为伪影、反光或炎症。文献称之为 low-prevalence effect。CADe 的价值在于提供不带偏见的"第二双眼睛",但若 CADe 自己报警泛滥,医生很快会产生"报警疲劳(alert fatigue)"并忽略它——这就是 RARE25 把假阳性负担当作核心指标的动机。

12.3 为什么不能简单"多收阳性样本"

一个自然的对策是:既然阳性少,就去收集更多阳性图像扩充训练集。RARE25 的实践揭示了这一路径的边界:

  • 数据可得性硬约束:BE 早期肿瘤在真实监测中本就罕见,公开可用的临床图像中阳性是稀缺资源。3,158 张阳性(158 训练 + 3,000 有效测试阳性)已是多中心多年积累。
  • 采样式扩充不等于分布扩充:有放回采样能改变评测分布,却不会增加信息的多样性——它无法创造新的病灶形态。
  • 合成与增广的局限:论文提到部分队伍用了 MixUp、FGSM 等技巧,但这些都是"在有限阳性样本上做文章",不能替代真实多样性。

结论:低流行率问题的根治不在"堆阳性",而在改变学习范式——异常检测、单类学习、以及能对流行率漂移鲁棒的方法。

12.4 RARE25 论文点名的范式缺口

论文最尖锐的一句批评是:所有 11 支队伍都用了全监督分类,尽管临床数据的压倒性多数是"正常"。这意味着:

  • 模型被迫学习"什么是肿瘤",而不是"什么不是正常";
  • 正常样本的海量信息(本该用于刻画正常流形)被浪费在当负类;
  • 一旦流行率漂移,分类边界不变,PPV 崩塌。

论文据此呼吁 prevalence-agnostic 方法(如 anomaly detection、one-class learning),并指出这是 RARE25 暴露的、尚未被社区填补的空白。这一呼吁对本库研究异常检测/自监督的检索者有直接价值。


§13 方法论深潜:冠军方案的工程解剖

13.1 IMSY 管线的三个阶段

Team IMSY 的方案(GitHub: IMSY-DKFZ/rare2025-challenge)是理解"如何在内镜低流行率任务上做到最好"的活教材,其管线分为:

阶段一:双主干构建

  • 主干 A:ResNet-50,用 GastroNet(消化道内镜域预训练权重)初始化——吸入内镜域视觉先验;
  • 主干 B:DINOv3 ViT-Large(self-supervised foundation model),用 LoRA 低秩适配微调——以极小参数量适配内镜任务,保留大模型的通用表征。

阶段二:损失与采样

  • ViT-L 侧:带类权重的交叉熵 + 平衡采样器(balanced sampler),对抗 5% 正样本的类不平衡;
  • ResNet-50 侧:直接瞄准 PPV@90Recall 的代理损失(surrogate loss)——不优化分类准确率,而优化"高召回点上的精确率"。这是本方案最"贴题"的设计:把评测指标写进损失函数。

阶段三:集成与校准

  • 训练出 20 个 ResNet-50 + 20 个 ViT-L 共 40 个模型;
  • 对 logits 做 affine 重校准(re-calibration) 后聚合;
  • 推理时输入 224×224,按 ImageNet 标准归一化。

13.2 为什么是"40 模型 + 校准"而不是更大的单模型

在正样本极少的任务上,单个模型的方差极大(不同随机种子的性能可能相差几十个百分点)。集成的作用不是"更强",而是压方差:40 个模型平均后,预测分布更集中,高召回点上的阈值选择更稳定。校准的作用则是把"聚合后的分数"映射回"接近真实概率"的尺度,使固定召回阈值(90%)对应的操作点可复现。论文与结果页都强调 IMSY 的胜出逻辑是"跨折鲁棒与一致性,而非依赖单一模型"。

13.3 一个反直觉的教训:训练指标 ≠ 部署指标

多数队伍优化的是 AUC 或交叉熵,只在训练后被动检查 PPV。IMSY 的差异化在于把 PPV@90Recall 作为代理损失的一部分主动优化。这印证了一条通用工程原则:如果评测指标是操作点特定的,就应该让训练目标与之对齐,而不是寄望"优化 AUC 后 PPV 自然好"。论文中 team CINDIE 的对照尤其醒目:AUROC 0.78 看起来不错,但 1% 流行率下 PPV@90Recall 掉到 0.01——判别力与操作点精确率的脱节被赤裸暴露。

13.4 复现路径与工程细节

官方仓库给出的复现骨架包括:

  • 训练脚本 training/train.py(参数在 training/config.py);
  • 复现脚本 reproduce_runs.sh(需替换 DINOv3 ViT-L 权重路径,版本须为 dinov3_vitl16_pretrain_lvd1689m);
  • 重校准 training/recalibrate_files.py;
  • LoRA 权重抽取 extract_lora_weights.py(分离冻结的 DINO 基座与 LoRA 增量,降低推理时延与内存);
  • 依赖 wandb 记录实验。

注意:复现需同时申请 HF 数据集授权与 GastroNet/DINOv3 权重授权——这是三个独立的门,缺一不可。


§14 数据合规与伦理要点

14.1 患者隐私

所有图像在发布前完成去标识化(de-identified)。论文明确图像来自标准诊疗流程的回顾性数据,未额外采集。设备级的元数据(照明、变焦、白平衡、成像模式等)被保留,因为它们"反映常规临床实践"且对模型有信息价值——但这些是设备参数而非患者信息。

14.2 伦理审查与数据来源

  • 训练数据来自 2 家荷兰中心的常规监测流程,采集嵌入标准诊疗;
  • 验证/测试数据来自 BONSAI 联盟 12 家中心;
  • 论文声明训练集的匿名化先于发布完成;
  • 由于是回顾性归档挖掘(EndoBase),操作者经验的详细记录并非每例齐备——这是真实世界回顾性数据集的常见局限,论文如实披露。

14.3 使用方需自担的合规责任

对检索者与产品团队,使用 RARE25 需注意:

  1. 非商业限制:CC BY-NC-SA 的 NC 条款禁止直接用于商业产品训练;
  2. 相同方式共享:SA 条款要求衍生数据集以相同许可发布;
  3. 署名要求:CC BY 的 BY 条款要求标注来源与作者;
  4. 不得反推个体:尽管已去标识化,多模态重识别风险在理论上仍应被使用者评估;
  5. 临床声明边界:本数据集用于研究,任何基于它训练的模型在临床使用前须另行验证与注册。

14.4 与 GDPR / 医疗器械法规的关系

数据源自荷兰(EU),受 GDPR 约束;论文的"去标识化 + 回顾性 + 标准诊疗"框架是欧盟境内医学影像研究发布的常见合规路径。对拟将模型推向市场的团队,还需满足 EU MDR 等医疗器械法规——RARE25 论文本身不涉及器械审批,检索者不应把"论文在大规模测试集上验证"误读为"已满足监管要求"。


§15 复现与实验设计建议

15.1 若你要在 RARE25 上做研究

基线搭建建议:

  1. 用官方 create_splits.py 生成 5-fold CV,先在本地 CV 上对齐论文的队伍成绩数量级;
  2. 严格区分"训练时类不平衡处理"与"评测时流行率采样",勿混用;
  3. 评测时按 100:1 采样 + 1,000 次 bootstrap + 中位数报告,与官方口径一致才有可比性;
  4. 同时报告 AUROC、AUPRC、PPV@90Recall,说明各自口径。

方法探索建议:

  • 尝试 anomaly detection / one-class 范式,填补论文点名的空白;
  • 探索对流行率漂移鲁棒的重加权/重校准方法;
  • 用中心切分(center1↔center2)做域泛化实验。

15.2 常见实验陷阱

  • 用测试集调参:测试集私有,若通过任何渠道获得,用于调参即违反挑战赛精神;
  • 只报告单一指标:论文反复强调多指标互补;
  • 忽视 CI:正样本稀少时点估计无意义,必须报不确定性;
  • 把 open 阶段验证榜当泛化证明:验证榜可被迭代过拟合,终评才是真相。

15.3 数据切分的正确用法

四套切分各有用途:

切分 用途
5fold_cv 通用模型选择,最大化数据利用
center1→center2 跨中心泛化,模拟"在 A 院训练、部署到 B 院"
center2→center1 反向跨中心验证,避免方向性偏差
holdout_cv 5 折 + 独立保留集,最接近官方评测结构的本地模拟

§16 产业视角:低流行率检测的商业含义

16.1 假阳性负担的直接成本

在 1% 流行率、PPV@90Recall = 0.32 的配置下,每检出 1 例真肿瘤伴随约 2 例假阳性。对一个年做 1 万例监测的内镜中心,意味着每年约 2 万次假警报——每次警报可能触发额外活检、延长检查时间、增加病理成本与患者焦虑。这是"临床可用性鸿沟"的经济账。

16.2 为什么大厂仍愿意投入

尽管绝对 PPV 低,CADe 的商业价值在于:

  • 降低漏检:即便 PPV 不高,只要召回高,就能减少"医生肉眼错过"的最坏情形;
  • 分诊:作为"第二读者"标记可疑帧供医生重点复核,而非自动诊断;
  • 质控:用 CADe 的分析结果做内镜医师培训与质量评估。

RARE25 的价值恰在于把商业宣传中常被回避的假阳性率摆上台面,为负责任的产品定位提供依据。

16.3 非商业许可对产业的影响

CC BY-NC-SA 意味着:企业不能用 RARE25 训练商业模型。这可能促使产业界:

  • 自行采集/购买商业授权的 BE 数据;
  • 仅用 RARE25 做学术基准对标,商业模型另训;
  • 推动更多 BE 数据的开放或商业授权供给。

这一许可设计本身是数据治理意图的体现——在开放科研与保护商业价值之间划界。


§17 与库内数据集的可迁移性对照

迁移方向 从 RARE25 可借鉴 库内类似场景
低流行率评测协议 100:1 采样 + 1000 bootstrap + PPV@操作点 可用到 polypgen(183)、cad-cap(193) 等检测任务
域内预训练 + PEFT GastroNet + DINOv3 + LoRA 可迁移到 hyperkvasir(693)、kvasir 系列
跨中心切分设计 center-based split 脚本化 可迁移到多中心内镜库
集成 + 校准压方差 40 模型集成 + affine 校准 适用所有正样本稀缺任务
私有测试床 + 结果页 锁定测试集 + 延迟公布 挑战赛类数据集的标准做法

17.1 与 GastroVision 的对照再展开

GastroVision(rid 203) 覆盖全消化道、规模远大于 RARE25,但其 BE 子集仅 95 张且无肿瘤标签。二者恰构成互补:GastroVision 提供广度与解剖多样性,RARE25 提供 BE 深度与流行率真实性。研究者若同时使用,可用 GastroVision 做预训练/预筛选,用 RARE25 做 BE 专精与低流行率评测。

17.2 与 EndoVis 系列的谱系关系

EndoVis 挑战赛历年覆盖息肉分割、器械检测、场景理解等多个子任务。RARE25 是其在"病变检测 + 流行率现实"方向的最新分支。库内 endovis-challenges(79) 是系列主锚,若后续补充 EndoVis 其他年份数据集,应统一挂在该谱系下。


§18 版本沿革与检索提示

18.1 时间轴

时间 事件
2025 年(赛事期) RARE25 于 MICCAI 2025 EndoVis workshop 举办,训练数据公开
2025-05-28 HF 训练集仓库 lastModified
2025 年内 Open 阶段 196 次提交;Closed 阶段 11 队 7 国提交
MICCAI 2025 会期 结果在 EndoVis 现场公布
2025 年后 RARE26 续办,RARE25 结果页迁至 rare26 站点
2026-04-13 论文 arXiv:2604.11171 v1 发布

18.2 检索提示

  • 搜 “RARE25” 可能命中 RARE26 站点——注意年份;
  • 搜 “Barrett’s neoplasia dataset” 会同时命中 EDD2020、EndoVis 2015——注意区分;
  • HF 仓库作者是个人账号 TimJaspersTue,搜组织号可能找不到;
  • 论文的 cs.CV 分类意味着它可能不出现在医学影像专题索引中。

18.3 引用建议格式

Jaspers T.J.M., Caetano F., Claessens C.H.B., et al. Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge for early detection of Barrett’s neoplasia. arXiv:2604.11171 [cs.CV], 2026.

数据集引用另行标注 HF 仓库:TimJaspersTue/RARE25-train,许可 CC BY-NC-SA 4.0。


附录

附录 A:条目信息速查卡

字段 值
官方名 RARE25(RARE25 Challenge, MICCAI 2025 EndoVis)
slug rare25
论文 arXiv:2604.11171
主办 ARIA lab (TU/e) + Amsterdam UMC(BONSAI consortium)
任务 内镜图像级二分类(NDBE vs NEO)
训练集 3,095(2,937 NDBE + 158 NEO)
测试集 26,408(23,176 NDBE + 3,232 NEO,私有)
设备 Olympus Exera III
主指标 PPV@90Recall
许可 CC BY-NC-SA 4.0(训练集);测试集私有
获取 HuggingFace TimJaspersTue/RARE25-train(gated=manual)
冠军 Team IMSY(bootstrap 中位 PPV@90Recall = 0.035)
平台 rare25.grand-challenge.org

附录 B:DAIMS 评估全表

DAIMS(Data and AI Management/Maturity Score)逐维评估:

维度 评分 说明
数据可获得性(Availability) 中 训练集 gated 公开;测试集完全私有
许可清晰度(Licensing) 中高 CC BY-NC-SA 明确,但论文文本 CC BY 4.0 易混淆
文档完备性(Documentation) 高 论文 + 官网 + GitHub + 结果页四源齐备
标注质量(Annotation Quality) 中 仅图像级标签,无定位/分割;标签来源为临床确诊
规模(Scale) 中 训练 3,095 张,在 BE 领域属最大,但绝对量不大
平衡性(Balance) 低 训练 5.1% 正样本,部署 1%,极端不平衡
多样性(Diversity) 中低 单一设备(Exera III);训练 2 中心 / 测试 12 中心
可复现性(Reproducibility) 中 训练与切分可复现;终测不可独立复现
伦理合规(Ethics) 高 全去标识化,回顾性标准诊疗数据
新颖性(Novelty) 高 首个大规模 prevalence-aware BE 检测基准
维护活跃度(Maintenance) 中 RARE26 续办,原仓库 lastModified 2025-05
AI-Ready 综合 中高 训练即用,评测受限于私有测试集与非商业许可

附录 C:逐项证据链自证

事实 证据源
3,095 = 2,937 + 158 arXiv:2604.11171 §4.1 原文
26,408 = 23,176 + 3,232 arXiv:2604.11171 正文
CC BY-NC-SA 4.0 arXiv 正文 + HF tags license:cc-by-nc-sa-4.0
gated=manual HF API /api/datasets/TimJaspersTue/RARE25-train
226 / 196 / 20队10国 / 11队7国 arXiv:2604.11171 §3
IMSY 0.035 / 0.320 / 0.920 arXiv:2604.11171 §6 结果节
UT AUPRC 0.532 arXiv:2604.11171 §6 结果节
Exera III arXiv:2604.11171 §4.1
12 家中心 arXiv:2604.11171 §4(“12 medical centres participating in the BONSAI consortium”)

附录 D:数据获取决策树

想用 RARE25?
├── 需要测试集?
│   └── 不可能——组织方私有保留,无任何公开入口 → 改用训练集自建本地测试
├── 需要商用训练?
│   └── 受限——CC BY-NC-SA 的 NC 条款禁止 → 考虑 CC BY 的替代集
├── 需要病灶定位/分割标签?
│   └── 不满足——仅图像级标签 → 考虑 EDD2020(有病灶标注)
└── 需要图像级二分类 + 低流行率评测?
    ├── 申请 HF repo 授权(gated=manual)
    ├── huggingface-cli download TimJaspersTue/RARE25-train
    ├── 跑官方 data_splitting/create_splits.py 生成切分
    └── 采用 PPV@90Recall + 100:1 bootstrap 评测

附录 E:评测指标计算公式表

指标 公式 说明
Recall(召回) TP / (TP + FN) 固定为 0.90 作为操作点
Precision/PPV(正预测值) TP / (TP + FP) 报警中真阳性比例
PPV@90Recall 阈值取至 Recall=0.90 时的 PPV RARE25 主指标
AUROC ROC 曲线下面积 全局判别
AUPRC PR 曲线下面积 检索/不平衡敏感
中位 PPV@90Recall median over 1,000 bootstraps 排名依据
95% CI bootstrap 分布 2.5%-97.5% 分位 不确定性

附录 F:官方切分脚本使用骨架

# 1. 环境
conda create -n rare python=3.12.0 && conda activate rare
git clone https://github.com/IMSY-DKFZ/rare2025-challenge
cd rare2025-challenge && pip install -r requirements.txt

# 2. 数据(需 HF 授权)
huggingface-cli login
huggingface-cli download TimJaspersTue/RARE25-train --repo-type dataset --local_dir data/train

# 3. 切分
python data_splitting/create_splits.py
# 产出:data/splits/{5fold_cv, center1_train_center2_test,
#                    center2_train_center1_test, holdout_cv}.csv

附录 G:PPV@90Recall 计算骨架(Python)

import numpy as np
from sklearn.metrics import roc_curve

def ppv_at_recall(y_true, y_score, target_recall=0.90):
    """在达到 target_recall 的最低阈值处计算 PPV。"""
    fpr, tpr, thr = roc_curve(y_true, y_score)
    # 找到 tpr >= target_recall 的第一个点
    idx = np.searchsorted(tpr, target_recall)
    if idx >= len(thr):
        idx = len(thr) - 1
    thr_sel = thr[idx]
    y_pred = (y_score >= thr_sel).astype(int)
    tp = np.sum((y_pred == 1) & (y_true == 1))
    fp = np.sum((y_pred == 1) & (y_true == 0))
    return tp / (tp + fp) if (tp + fp) > 0 else 0.0

def bootstrap_ppv(y_ndbe, y_neo, y_score_ndbe, y_score_neo,
                  ratio=100, n_iter=1000, seed=0):
    """保留全部 NDBE,NEO 有放回采样至 ratio:1,取中位数。"""
    rng = np.random.default_rng(seed)
    n_neo_sample = max(1, len(y_ndbe) // ratio)
    scores = []
    for _ in range(n_iter):
        idx = rng.choice(len(y_neo), size=n_neo_sample, replace=True)
        yt = np.concatenate([np.zeros(len(y_ndbe)), np.ones(n_neo_sample)])
        ys = np.concatenate([y_score_ndbe, y_score_neo[idx]])
        scores.append(ppv_at_recall(yt, ys))
    return float(np.median(scores)), (
        float(np.percentile(scores, 2.5)), float(np.percentile(scores, 97.5)))

上述骨架为按论文协议复现的示意实现,非官方代码;实际评测以组织方协议为准。

附录 H:参赛方法总表(11 队要点)

队伍 主干 预训练 集成 关键策略
IMSY(冠军) ResNet-50 + DINOv3 ViT-L GastroNet + DINOv3 40 模型 LoRA + PPV 代理损失 + affine 校准
UT(亚军) MaxViT-Tiny 仅挑战数据 单模型 BCE + 精心训练/验证
Jmees-inc 分割驱动 分阶段(息肉/BE/癌) compact 定位感知
MEDAI ResNet50 GastroNet-5M 单模型 Balanced MixUp + Platt scaling
sk ConvNeXt-Base ImageNet-22k 10 模型 加权 Focal Loss + 旋转 TTA
agaldran ResNet50 GastroNet 25 模型 logit-adjusted BCE
AJLG_ETRI ViT-B 类 ImageNet 单模型 自适应 Focal Loss
iRARE — GastroNet 单模型 加权 CE + Focal + 过采样
MIRC — ImageNet 单模型 Asymmetric Loss
SAINTS — ImageNet 单模型 WeightedRandomSampling
ReMIC — ImageNet/CLIP 异构集成 SMOTE-like + FGSM + CLIP 聚类防泄漏

附录 I:双口径冲突存照表

冲突项 口径 A 口径 B 本条目取舍
数据集许可 论文文本 CC BY 4.0 数据集实体 CC BY-NC-SA 4.0(HF tags) 取 B 为数据许可,A 记为论文文本口径
测试集规模 摘要 “>25,000” 正文 26,408 正文精确数为准,摘要口语口径并存
训练集规模 摘要 “over 3,000” 正文 3,095 正文精确数为准
赛事年份 MICCAI 2025 论文 2026-04 赛事 2025,论文 2026,分别标注
冠军成绩 bootstrap 中位 0.035 全测试集 0.320 两口径并存,注明排名依据为前者

附录 J:RARE25 vs 既往 BE 基准对照表

数据集 规模 病灶标注 低流行率评测 公开性
RARE25 3,095 训练 + 26,408 测试 无 有(PPV@90 + 100:1) 训练 gated / 测试私有
EndoVis 2015 BE 200(100+100) 有 无 公开
EDD2020 384 有(病灶) 无 公开
GastroVision(BE 子集) 95 无肿瘤标注 无 公开

附录 K:本文引用来源清单

  1. arXiv:2604.11171 — Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge(主论文,2026-04-13)
  2. rare25.grand-challenge.org/task-evaluation — 官方任务与评测页
  3. rare26.grand-challenge.org/rare25-results — 官方结果页
  4. github.com/IMSY-DKFZ/rare2025-challenge — 冠军队伍复现仓库
  5. huggingface.co/datasets/TimJaspersTue/RARE25-train — 训练集(gated=manual,CC BY-NC-SA 4.0)

附录 L:坑点档案(与 §10 对照)

坑号 一句话 速查
1 论文 CC BY 4.0 ≠ 数据 CC BY-NC-SA 查 HF tags
2 测试集不公开 别找"完整版"
3 0.035 vs 0.320 是两口径 看是否注明"bootstrap/全测试集"
4 别用 AUROC 排 RARE25 官方只认 PPV@90Recall
5 3,095 是精确值 别写"约 3000+"
6 训练 5.1% ≠ 部署 1% 两道不平衡
7 单一 Exera III 设备 跨设备需谨慎
8 非分级数据集 仅 NDBE/NEO
9 RARE25 ≠ RARE26 前后届,分别标注

附录 M:给数据集建设者的复用清单

  1. 写死流行率:在评测协议里显式声明采样比例与重复次数;
  2. 分离许可:训练/测试集许可分开写,避免与论文许可混淆;
  3. 提供切分脚本:把跨中心/跨设备切分做成可运行代码;
  4. 报告操作点指标:至少一个临床相关召回点上的精确率 + CI;
  5. 公开 Limitations:把单设备、单中心、标签粒度如实写入;
  6. 保留私有测试床:用锁定测试集防污染,但要接受可复现性代价。

附录 N:与库内条目互链建议清单(供 link_builder 参考)

优先级 目标条目 rid 链接理由
高 endovis-challenges 79 EndoVis 挑战赛谱系直接亲缘
高 gastrovision 203 论文点名的 BE 子集对照物
高 hyperkvasir 693 同域消化道内镜图像库
中 kvasir-seg 112 内镜分割任务对照
中 kvasir-capsule 123 设备模态对照(胶囊内镜)
中 cad-cap 193 结肠镜 CADe 基准对照
中 polypgen 183 内镜检测任务对照
低 kvasir-hyperkvasir 75 HyperKvasir 衍生分类
低 kvasir-instrument 213 内镜器械检测
低 bkai-igh-neopolyp 84 消化道息肉检测
低 ldpolypvideo 163 息肉视频检测
低 slam-3d-endoscopic 82 3D 内镜重建
低 cadec 464 内镜 CADe 类(注意任务区分)
低 cadis 243 CAD 相关内镜

附录 O:常见误引清单(发布前校对用)

  • ❌ “RARE25 数据集有 26,408 张可下载图像” → 只有 3,095 张训练图可获取,其余私有;
  • ❌ “RARE25 采用 CC BY 4.0 许可” → 数据是 CC BY-NC-SA 4.0(CC BY 4.0 是论文文本);
  • ❌ “RARE25 冠军 PPV@90Recall 为 0.32(或 0.035)” → 必须写明是"全测试集"还是"bootstrap 中位";
  • ❌ “RARE25 提供病灶位置标注” → 只有图像级二分类标签;
  • ❌ “RARE25 由某公司发布” → 学术界主办(TU/e + Amsterdam UMC);
  • ❌ “RARE25 的测试集可以申请” → 私有,无任何公开/申请入口。

本条目由「千方病案医数集」编辑部撰写。所有硬数字均来自 arXiv:2604.11171 与官方平台实证,双口径冲突已逐条存照(见附录 I)。条目最终以数据库记录为准。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • prostatex — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 肿瘤学
  • gastroendonet — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 肿瘤学
  • oasbud — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
  • hyperkvasir — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
  • camelyon17 — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
  • unitopatho — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
  • slam-laparoscopic-motions — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
  • gastrovision — 共享标签:医学影像 / 内窥镜影像 / 图像分类
  • panda-plus — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
  • wsss4luad — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集