信息速览
RARE25 — 内镜 Barrett 食管肿瘤低流行率检测数据集
一句话定位:RARE25 是 MICCAI 2025 EndoVis workshop 下的挑战赛数据集,用 3,095 张公开训练内镜图 + 26,408 张私有测试图,把 Barrett 食管早期肿瘤的计算机辅助检测(CADe)逼进"真实 1% 流行率"的考场——它评测的不是模型能不能分开两类图,而是模型能在多高的假阳性代价下维持 90% 召回。
§0 导读:这个数据集解决什么问题
0.1 一个被数据"美化"过的临床问题
Barrett 食管(Barrett’s esophagus, BE)是慢性胃食管反流引起的食管远端黏膜化生改变,是食管腺癌(esophageal adenocarcinoma)的癌前病变。临床上对 BE 患者做定期内镜监测(surveillance),目的是在可见早期肿瘤(neoplasia,包括异型增生 dysplasia 与早期癌)还处于可内镜根治阶段时发现它。
问题在于:这个病变在监测图像里极其罕见。论文引用数据显示,非异型增生 BE 向腺癌的年进展风险显著低于 1% 每年。这意味着一位内镜医生一年看几千张图像,真正该报警的可能只有个位数。人眼在这种"低流行率(low prevalence)"场景下会疲劳、会被前一帧的正常黏膜锚定、会把罕见异常当作伪影略过——文献称之为人眼在低流行率下的漏检效应。
CADe 系统被寄望充当"第二读者(second reader)"或分诊助手。但论文尖锐地指出:大量 CADe 研究是在平衡数据集或富集数据集上报告的,这些数据集把肿瘤样本比例人为抬高,于是模型在"1 个真阳性对 1 个假阳性"的实验室里看起来很强,一旦放进"1 个真阳性对 100 个假阳性"的真实门诊,报警几乎全错,医生几分钟内就会关掉告警。
0.2 RARE25 的三个反直觉设计
RARE25 的出现位置(niche)不是"又一个 BE 图像分类数据集",而是针对流行率漂移(prevalence shift)的评测框架。它有三个设计决定值得单独拎出来:
- 主场指标换成 PPV@90Recall,而不是 AUROC。AUROC 衡量的是全局排序能力,对"在高召回点上的精确率"几乎不敏感。RARE25 直接锁定"必须达到 90% 召回"这个临床底线,然后问:在 90% 召回时,你的正预测值(Positive Predictive Value, PPV)是多少? PPV 低意味着假阳性洪流。
- 测试集不公开,且按 100:1 采样。这不是数据保密洁癖,而是刻意让检索者无法"猜题"——每次评测保留全部非异型增生图像,肿瘤图像有放回采样,重复 1,000 次取中位数,从而给出"在真实流行率下你大概率会看到的成绩分布",而不是单次幸运切分。
- 训练集是公开的、规模最大的 BE 内镜图像集合。论文宣称 3,095 张是"to our knowledge, the largest publicly available dataset of endoscopic images focusing on Barrett’s esophagus to date"——它把"训练时少数类稀缺"与"部署时流行率漂移"两重难题同时压到参赛者身上。
0.3 本条目要回答什么
这份百科条目面向的读者包括:消化道早癌 AI 研究者、CADe 产品团队、内镜影像分类工程师、以及关心"数据集评测方法论"的机器学习研究者。它会交代清楚:
- RARE25 到底有多少张图、什么设备、哪来的、怎么切分(§2);
- 公开/私有两套资产的门怎么进、许可怎么分层(§6);
- 挑战赛 11 支队伍的方法与成绩单,冠军 0.035 的中位 PPV@90Recall 意味着什么(§5);
- 为什么这个数据集只该用于"评测"而不是"刷分",以及它与 EndoVis 2015、EDD2020、GastroVision 的位置差异(§7)。
§1 数据集速览:十问十答
Q1:RARE25 是什么?
MICCAI 2025 EndoVis workshop 下的挑战赛(challenge),提供内镜图像 + 图像级二分类任务(是否含早期肿瘤),配套隐藏测试集与 prevalence-aware 评测协议。论文 arXiv:2604.11171。
Q2:谁做的?
ARIA lab(Eindhoven University of Technology, TU/e)与 Amsterdam University Medical Centers 联合主办,隶属 BONSAI consortium。通讯方向 Fons van der Sommen;临床侧 Jacques J. Bergman、Albert J. de Groof 等。
Q3:有多少数据?
公开训练集 3,095 张(2,937 NDBE + 158 NEO);隐藏测试集 26,408 张(23,176 NDBE + 3,232 NEO,论文精确口径,摘要口语口径为 “>25,000”)。
Q4:图像从哪来?
全部 Olympus Exera III 内镜系统采集。训练集来自 2 家荷兰医疗中心(EndoBase 归档回顾性检索);验证/测试集来自 BONSAI 联盟 12 家中心。
Q5:任务是什么?
图像级二分类:target 0 = NDBE(非异型增生 Barrett 食管),1 = Neoplasia(肿瘤)。无像素级标注。
Q6:主指标是什么?
PPV@90Recall——在 90% 召回点上衡量正预测值。次指标 AUROC、AUPRC 仅参考、不影响排名。
Q7:怎么防止刷榜?
测试集私有;模拟 100:1 低流行率采样,重复 1,000 次 bootstrap,取中位数与 95% CI;Open 阶段每日每队限 1 次提交。
Q8:许可是什么?
训练集 CC BY-NC-SA 4.0(非商业),HuggingFace TimJaspersTue/RARE25-train,gated=manual 需申请;测试集私有。
Q9:谁赢了?
Team IMSY(ResNet-50/GastroNet + DINOv3 ViT-L LoRA 40 模型集成 + 校准)。bootstrap 中位 PPV@90Recall = 0.035;全测试集 PPV@90Recall = 0.320,AUROC = 0.920。
Q10:最该记住的一句话?
即便冠军方法,在真实低流行率下 90% 召回时每 ~30 次报警才有 1 次是真肿瘤——这正是 RARE25 想让人看到的"临床可用性鸿沟"。
§2 数据构成与规格
2.1 规模、来源与机构构成
RARE25 的数据分两块,性质截然不同,检索者必须分清:
| 资产 | 图像数 | 类别构成 | 来源 | 公开性 | 许可 |
|---|---|---|---|---|---|
| 公开训练集 | 3,095 | 2,937 NDBE + 158 NEO | 2 家荷兰医疗中心 | HuggingFace 公开(gated) | CC BY-NC-SA 4.0 |
| 隐藏测试集 | 26,408 | 23,176 NDBE + 3,232 NEO | 12 家 BONSAI 中心 | 私有,不发布 | 组织方保留 |
| 验证集(Closed Validation) | 未披露 | 未披露 | 12 家中心 | 私有 | 组织方保留 |
训练集 NEO 占比仅 158/3,095 ≈ 5.1%;测试集原始 NEO 占比约 3,232/26,408 ≈ 12.2%,但评测时会进一步按 100:1 重采样(保留全部 NDBE,NEO 有放回抽样),以模拟真实监测场景的极端不平衡。这一"两道不平衡"是理解 RARE25 全部成绩数字的前提。
训练集的组织结构在 HuggingFace 上实证为 imagefolder 格式:center_1/ndbe/002a53d53d85477486d121f792f38dd2.png 这类路径——即按"中心 / 类别 / 哈希文件名"三层目录组织。center_1 的存在暗示至少存在 center_2 目录(论文明确训练集来自 2 家中心),而官方 GitHub 的切分脚本也提供 center1_train_center2_test.csv 与 center2_train_center1_test.csv,印证跨中心泛化评测的设计。
2.2 采集设备与采集流程
- 设备:全部图像来自 Olympus Exera III 内镜系统(Olympus Corp., Tokyo, Japan)。论文强调训练集与验证/测试集均为 Exera III,并将"设备单一是本数据集泛化性主要限制"写入 Limitations。
- 采集方式:训练集经 EndoBase 归档的自动化查询回顾性检索,从检索池中人工识别并提取 BE 相关图像。这意味着它不是前瞻性采集,而是归档挖掘。
- 采集背景:标准监测流程中的真实临床图像。照明、变焦、白平衡、成像模式等参数"反映常规临床实践,随本地工作流与操作者偏好而变化"——即图像本身携带大量设备/操作者噪声,论文将此列为训练集特征而非缺陷。
- 去标识化:所有图像在发布前完成去标识化;由于采集嵌入标准诊疗,操作者经验的详细记录并非每例都有。
- 图像格式:PNG(HF 仓库实证),单通道 RGB 彩色内镜视图。
2.3 类别体系与定位取舍
RARE25 的类别体系极简——只有两类:
- NDBE(non-dysplastic Barrett’s esophagus):非异型增生 Barrett 食管,即"正常对照";
- NEO(neoplasia):确诊肿瘤,涵盖异型增生与早期癌。
这一"二分类而非多分级"的取舍是刻意为之:临床决策点是"要不要进一步活检/切除",而不是"分级到几度"。把异型增生各亚型、黏膜内癌、浸润癌合并为 NEO,最大化类内样本量(在总共只有 158 个正样本的约束下这很关键),代价是丧失了肿瘤分级信息。检索者若需要分级标签,RARE25 不适用。
另一关键取舍:只有图像级标签,没有病灶级框或像素级掩码。对比 EDD2020(提供标注的肿瘤病灶位置)和 EndoVis 2015 BE 子挑战(100 NDBE + 100 NEO 的定向集合),RARE25 选择"大而粗"而非"小而精"——它押注的是"规模 + 真实流行率"比"精细定位"更能暴露部署真实性能。
2.4 数据切分方案
官方 GitHub(IMSY-DKFZ/rare2025-challenge,代表冠军队伍,同时给出赛事标准切分)提供 data_splitting/create_splits.py,生成四套 CSV:
5fold_cv.csv——分层 5 折交叉验证;center1_train_center2_test.csv——中心 1 训练、中心 2 测试;center2_train_center1_test.csv——中心 2 训练、中心 1 测试;holdout_cv.csv——5 折 CV + 独立保留测试集。
每行含 image_path、sample_id、center、class_name(ndbe/neo)、target(0/1)、split 六列。这套切分把"跨中心泛化"正式纳入训练流程:参赛者可以在本地就模拟中心漂移,而不只是依赖官方验证榜。
注意:这套 CSV 只针对公开训练集 3,095 张做切分。隐藏测试集不接受本地切分——它是组织方保留的终评资产。
§3 挑战赛设计与评测协议
3.1 三阶段结构
RARE25 的执行被切成三个连续阶段,每阶段的约束直接塑造了参赛者的策略:
| 阶段 | 时间 | 关键规则 | 检索者需知 |
|---|---|---|---|
| Open Development Phase | 与训练数据公开同步启动,历时 3 个月 | 每日每队限 1 次验证榜提交 | 限次是为防过拟合排行榜;196 次提交即由此上限"挤"出 |
| Closed Testing Phase | Open 结束后 | 每队 1 次终提交,结果保密 | 终评成绩直到 MICCAI 2025 现场才公布 |
| Post-MICCAI Phase | 会议结束后 | 重新开放,但终测集无新增提交 | 结果页由 RARE26 站点承载 |
阶段设计的核心意图是**“防止把测试集当训练集”**:Open 阶段给足迭代空间但有每日限次,Closed 阶段一次定生死且结果延迟公布,从而逼出真正泛化的方法而非排行榜过拟合解。论文明确记录 Post-MICCAI 阶段"没有对终测集做出额外提交",说明终评成绩是稳定的、未被后期刷分污染。
3.2 主指标 PPV@90Recall 的精确含义
这是整份条目最需要讲清的技术点。PPV@90Recall = 在模型阈值被调到"召回率达到 90%"时,该操作点上的正预测值(Positive Predictive Value, PPV,即精确率 precision)。
- 直觉:临床底线是"不能漏(召回 90%)",那么在这个约束下,报警里有多少是真肿瘤?
- 在 100:1 流行率下,PPV 的数学上限本身就很低。设 100 个 NDBE + 1 个 NEO,90% 召回须命中该 1 个真阳性(近似 0.9 个),若假阳性率为 f(相对 100 个 NDBE),则 PPV ≈ 0.9/(0.9 + 100f)。哪怕 f = 1%(极低假阳性率),PPV 也仅约 0.47。
- 因此PPV@90Recall 对假阳性率的放大倍数约为 100 倍——这正是它比 AUROC 严酷的地方:AUROC 会掩盖高召回点上的精确率崩塌。
论文引用 Metrics Reloaded 报告框架,明确采用三指标互补:AUROC(全局判别)、AUPRC(检索性能)、PPV@90Recall(临床操作点)。只有 PPV@90Recall 决定最终排名,另两个仅作参考,防止参赛者用"漂亮的 AUROC"掩盖"临床不可用"。
3.3 Bootstrap 评测协议
组织方的评测流程被论文反复强调为"prevalence-aware":
- 每次评测保留全部非异型增生图像(不采样,NEO 采样);
- 肿瘤图像有放回采样,目标是构造 100:1 的 NDBE:NEO 比例;
- 每次迭代计算 PPV@90Recall;
- 重复 1,000 次,最终成绩取 1,000 次的中位数,并给出 95% 置信区间。
有放回采样 + 1,000 次重复的用意是:在正样本极少(测试集 3,232 NEO 虽不算少,但采样到 1% 后每轮有效正样本数有限)时,单次评测方差巨大,中位数+CI 才是稳健估计。这也解释了成绩单里"bootstrap 中位 PPV@90Recall"与"全测试集 PPV@90Recall"两列必须分开看——前者才是排名依据。
3.4 参与与公平性规则
- 仅允许全自动方法(fully automated):现场交互式或人工参与的选择被禁,保证可复现与可部署。
- 开放注册:226 人注册,来自全球多个研究组;Open 阶段 20 队 / 10 国活跃;Closed 阶段 11 队 / 7 国提交有效结果。
- 提交次数硬约束:Open 阶段每日每队上限 1 次——这是抑制"刷验证榜"的经典手段。
§4 数据集的定位:与既有 BE / 内镜基准的比较
4.1 为什么需要 RARE25:三处空白
论文用一节专门的 Related Work 论证 RARE25 的必要性,实质是列出前任数据集的三个不足:
空白一:既有 BE 公开集太小。
- EndoVis 2015 BE 子挑战:仅 100 NDBE + 100 NEO,共 200 张;
- EDD2020:含 BE 标注病灶,但整个数据集仅 384 张;
- GastroVision:覆盖全消化道,其 BE 子集仅 95 张,且不提供"是否含肿瘤"的标注。
在三者任一之上训练 CADe,正样本稀缺到无法支撑现代深度模型。
空白二:评测脱离真实流行率。
既有基准多在平衡或富集数据上报告性能,导致"实验室很强、临床报警全错"。RARE25 用 100:1 采样 + PPV@90Recall 把这一乐观偏差显式打掉。
空白三:缺少"锁定测试床 + 可复现评测框架"的组合。
论文贡献可概括为三条:(1) 提供比既往大得多的公开 BE 图像集;(2) 提供按临床流行率采样的锁定测试床,暴露真实假阳性负担;(3) 提供强调临床操作点的可复现评测。
4.2 与库内相关数据集的横向位置
| 数据集 | 库内 rid | 模态 | 规模口径 | 与 RARE25 的关系 |
|---|---|---|---|---|
| GastroVision | 203 | 全消化道内镜 | 大型 | RARE25 论文点名其 BE 子集仅 95 图且无肿瘤标注 |
| HyperKvasir | 693 | 消化道内镜/视频 | 大型 | 同域内镜图像库,任务不同(多类解剖/病理) |
| Kvasir-SEG | 112 | 息肉分割 | 中 | 同为内镜,但任务是分割息肉 |
| Kvasir-Capsule | 123 | 胶囊内镜 | 大型 | 设备模态不同(胶囊 vs 标准内镜) |
| EndoVis Challenges | 79 | 手术/内镜挑战赛集合 | 多子集 | 同属 EndoVis 挑战赛谱系,RARE25 为其 2025 BE 分支 |
| CAD-CAP | 193 | 结肠镜 | 大型 | 消化内镜 CADe 同类基准,部位不同 |
| CADEC | 464 | 内镜(不同收藏) | — | 名称相近但非 BE 检测任务,勿混 |
| BONSAI-相关 | — | — | — | RARE25 隶属 BONSAI 联盟,但 BONSAI 本身非库内独立条目 |
互链提示:RARE25 与 EndoVis Challenges(rid 79)构成"EndoVis 系列"直接亲缘;与 GastroVision(203)构成"论文点名的对照物"关系。检索者若研究内镜 CADe 基准谱系,建议沿这两条链展开。
4.3 定位的一句总结
若用一句话把 RARE25 放进坐标系:它是把"低流行率"当成一等公民的 BE 内镜检测基准——其他数据集问"你能分开这两类图吗",RARE25 问"当两类图以 1:100 出现时,你的报警还值得医生相信吗"。
§5 挑战赛结果与方法图谱
5.1 参与概况与总览
- 注册:226 人;
- Open Development Phase:196 次提交,20 队,10 国;
- Closed Testing Phase:11 队,7 国 完成有效提交;
- Post-MICCAI:无新增终测提交。
5.2 冠军 Team IMSY
方法:以 GastroNet 预训练的 ResNet-50 为强 CNN 主干,叠加 LoRA 微调的 DINOv3 ViT-Large,组成 40 模型集成(20 个 ResNet-50 + 20 个 ViT-Large),并进行 post-hoc 校准(affine 重校准聚合 logits)。训练用带类权重的交叉熵 + 平衡采样器(ViT-L),ResNet-50 侧用直接瞄准 PPV@90Recall 的代理损失(surrogate loss)。
成绩:
- bootstrap 中位 PPV@90Recall = 0.035;
- 全测试集(不重采样)PPV@90Recall = 0.320;
- 全测试集 AUROC = 0.920;
- 全测试集 AUPRC = 0.822;
- 在约 60% 的重采样中排名第一。
IMSY 的策略核心是稳健而非单点最强:跨折一致性优于单一模型峰值,用大规模集成 + 校准压低在高召回点上的方差。官方结果页(RARE26 站)将其概括为"强调跨折鲁棒性与一致性,而非依赖单一模型"。
5.3 亚军 Team UT 与其他队伍
- Team UT:MaxViT-Tiny 纯 Transformer,仅用挑战赛数据训练(无大规模外部预训练)。其 bootstrap 中位 AUPRC = 0.532(全队最高),证明"精心组织训练/验证下,无大规模预训练也能有竞争力"。
- Team Jmees-inc:把图像级分类重构为分割驱动流程,采用分阶段预训练(息肉 → BE → 癌症)+ compact 集成;交叉验证得 AUROC 0.9896、AUPRC 0.7408、PPV 0.235。
- Team sk:ConvNeXt-Base (V1) + ImageNet-22k 预训练 + 加权 Focal Loss + 10 模型集成 + 4 视角旋转 TTA;50/50 切分下 Open 阶段 AUPRC 0.310 / AUROC 0.832 / PPV@90Recall 0.015,全数据集提升至 AUPRC 0.527 / AUROC 0.820 / PPV@90Recall 0.163。
- Team agaldran:25 个 ResNet-50 集成,logit-adjusted 二元交叉熵应对极端不平衡。
- Team MEDAI:ResNet50 + GastroNet-5M 域内预训练 + Balanced MixUp + Platt scaling 校准。
- Team CINDIE(论文方法节提及):Open 阶段 AUROC 0.78,但在 1% 极端流行率下 PPV@90Recall 降至 0.01,是"判别强但精确率崩塌"的典型样本。
5.4 排名与结果的可迁移结论
- 方法趋势:top 队伍普遍依赖大规模预训练 + 集成 + 校准三件套;单模型方案在榜首已无竞争力。
- 排名对指标敏感:按 PPV@90Recall 排,IMSY 第一;按 bootstrap 中位 AUPRC 排,UT 第一。同一批模型换指标即换榜首——论文据此强调"报告 PPV at 临床要求召回 + 不确定性估计应是方法评测的必要元素"。
- 绝对水平很低:IMSY 全测试集 PPV@90Recall = 0.32 已是最好,意味着在高召回操作点下,大部分报警仍是假阳性。论文直言这会造成"substantial false-positive burden, could strain clinical workflows"。
- 方法同质化:所有提交均为全监督分类,无一采用异常检测或单类学习(one-class learning)——尽管临床数据压倒性地是"正常"。论文将此点名为"prevalence-agnostic approaches 的缺失",是留给后续研究的明确缺口。
- 技术断层:top 方法相对第五名在 PPV@90Recall 上有 52% 提升,第五名相对第十名又有 50% 提升——说明该任务上方法间差距巨大,尚未收敛。
5.5 成绩单精读(双口径)
| 口径 | Team IMSY | 说明 |
|---|---|---|
| bootstrap 中位 PPV@90Recall(排名依据) | 0.035 | 100:1 采样 + 1,000 次重复的中位数 |
| 全测试集 PPV@90Recall | 0.320 | 不重采样、保留原始类分布 |
| 全测试集 AUROC | 0.920 | 全局判别能力,与操作点无关 |
| 全测试集 AUPRC | 0.822 | 检索性能 |
| bootstrap 中位 AUPRC 最高者 | Team UT = 0.532 | 换指标换冠军的实证 |
读这组数字的守则:0.035 与 0.320 不矛盾,是"真实流行率下"与"原始分布下"两个不同考场的成绩。前者低得惊人,恰恰是 RARE25 想要的效果——它让"临床可用性鸿沟"变得可量化。任何引用 RARE25 成绩的场合,必须写明是哪个口径。
§6 获取与许可:两套资产、两种门
6.1 资产与门的对照
RARE25 的可获取性是清晰的二层结构(比 PANDA-PLUS 的三层简单,但同样存在许可陷阱):
| 资产 | 获取方式 | 许可 | 门 |
|---|---|---|---|
| 公开训练集(3,095 张) | HuggingFace TimJaspersTue/RARE25-train |
CC BY-NC-SA 4.0 | gated=manual,需申请授权 |
| 隐藏测试集(26,408 张) | 无 | 组织方保留 | 不发布,任何途径均无公开入口 |
| 切分脚本 | GitHub IMSY-DKFZ/rare2025-challenge | 见仓库 LICENSE | 公开 |
| 论文 | arXiv:2604.11171 | arXiv 默认(论文文本) | 公开 |
| 结果页 | rare26.grand-challenge.org/rare25-results | — | 公开 |
6.2 HuggingFace 下载实操
训练集在 HuggingFace 上以 gated=manual 方式发布——即需先接受条款/申请授权,通过后方可下载。镜像走 hf-mirror.com(沙箱内 HuggingFace 主站受限时的标准做法)。命令行方式:
# 需先完成 HF 登录与 repo 授权(gated=manual)
pip install huggingface_hub[cli]
huggingface-cli login
huggingface-cli download TimJaspersTue/RARE25-train --repo-type dataset --local_dir ./data/train
HF 元数据(抓取时点 2026-09-30):lastModified = 2025-05-28,downloads = 9,likes = 5,format = imagefolder,task_categories = image-classification,size_categories = 1K<n<10K。下载量仅 9 说明该仓库相对小众(挑战赛结束后热度回落),但数据本体完整可用。
6.3 许可分层与双口径存照
这是本条目必须存档的核心许可陷阱:
- 数据集实体:论文第 4.1 节原文写训练集为 “released under a non-commercial CC-BY-NC-SA license”;HuggingFace 仓库 tags 实证
license:cc-by-nc-sa-4.0。→ 数据许可 = CC BY-NC-SA 4.0。 - 论文文本:arXiv HTML 页面 boilerplate 显示 “License: CC BY 4.0”,这是 arXiv 对论文文本的默认许可口径,不等于数据许可。
二者经常被混引。正确表述是:用 RARE25 数据做商业 CADe 产品开发,受 CC BY-NC-SA 的"NC(非商业)"限制;而引用/转载论文文本则按 CC BY 4.0。检索者与产品团队务必区分。
此外,CC BY-NC-SA 的 **SA(ShareAlike,相同方式共享)**条款意味着衍生数据集也须以相同许可发布——若在 RARE25 上做再标注并公开,需遵守传递性要求。
6.4 AI-Ready 评估:这份数据集"就绪"在哪、卡在哪
就绪面:
- 训练集有稳定直链(HF),格式规范(imagefolder + PNG),标签明确(0/1);
- 官方提供可复现的切分脚本与评估协议描述;
- 有完整的挑战赛结果与参赛方法公开(GitHub + 论文 + 结果页)。
卡点:
- 测试集不可获取——任何声称"在 RARE25 测试集上复现 XX 成绩"的说法都无法独立验证,只能依赖组织方的 bootstrap 结果;
- 许可非商业——限制工业界直接用于产品训练;
- 只有图像级标签——无法用于检测/分割任务的监督;
- 标签分布极端不平衡——若直接当普通二分类数据集用,会重现论文批评的"流行率被忽视"问题。
6.5 与库内可获取性光谱的对照
在库内内镜数据集中,RARE25 的获取难度属于中上:比 HyperKvasir(693)、Kvasir 系列(全开放)更受限(gated + 非商业),但比纯请求制数据集(如某些仅靠邮件申请的数据)更友好。其"训练集可下、测试集锁定"的结构在挑战赛数据集里是常态,检索者应把它当作评测基准而非训练语料库来规划用途。
§7 生态与影响
7.1 挑战赛谱系:EndoVis 与 BONSAI
- EndoVis workshop:MICCAI 长期附属的内镜视觉挑战赛工作坊,历届产出多个内镜数据集/基准。RARE25 是其 2025 年的 BE 检测分支;库内
endovis-challenges(rid 79) 是该系列的主锚条目。 - BONSAI consortium:RARE25 的临床数据来源与组织背景。联盟内 12 家中心贡献了验证/测试集的图像,这一"多方中心"结构是 RARE25 泛化评测的物质基础。
- ARIA lab(TU/e):主办实验室,长期从事消化道内镜 AI 与视频分析。其学术产出是理解 RARE25 方法倾向(域内预训练、集成、校准)的背景。
7.2 后继:RARE26
挑战赛在 MICCAI 2025 后重新开放为 RARE26(rare26.grand-challenge.org)。RARE25 的结果页挂在 RARE26 站点下(路径 /rare25-results)。这一"赛事延续"模式意味着:RARE25 的训练集可能被 RARE26 复用或扩展,检索者需确认所用版本对应的赛事年份。RARE26 的出现本身是 RARE25 影响力的直接证据——一个只有 3,095 张公开图的基准,因切中"低流行率"痛点而获得续办。
7.3 在前沿的位置:为什么"低流行率"是 2025-2026 的热点
RARE25 的时机踩在医学影像 AI 的一个转向点上:从"在平衡数据集上刷 SOTA"转向"在部署真实分布上证明有用"。同期趋势包括:
- Metrics Reloaded(论文引用的评估框架):推动按临床决策点选指标,反对单一 AUROC 叙事;
- 异常检测 / 单类学习在内镜早癌方向的升温——RARE25 论文点名"所有参赛方法都是全监督分类",把这一空白公开标记为待解问题;
- 基础模型 + 参数高效微调成为内镜任务主流(IMSY 的 DINOv3+LoRA 即代表)。
7.4 库内互链点(附 rid)
| 条目 | rid | 互链理由 |
|---|---|---|
| endovis-challenges | 79 | EndoVis 系列直接亲缘,同会议/同工作坊谱系 |
| gastrovision | 203 | 论文点名的对照数据集(BE 子集仅 95 图) |
| hyperkvasir | 693 | 消化道内镜图像库,同域 |
| kvasir-hyperkvasir | 75 | HyperKvasir 衍生,内镜图像分类 |
| kvasir-seg | 112 | 内镜分割(息肉),同域不同任务 |
| kvasir-capsule | 123 | 胶囊内镜,设备模态对照 |
| kvasir-instrument | 213 | 内镜器械检测,同域 |
| cadec | 464 | 内镜 CADe 类基准(注意与 BE 检测任务区分) |
| cad-cap | 193 | 结肠镜 CADe,部位对照 |
| cadis | 243 | CAD 相关内镜条目 |
| slam-3d-endoscopic | 82 | 3D 内镜重建,模态对照 |
| polypgen | 183 | 息肉检测基准,内镜检测任务对照 |
| bkai-igh-neopolyp | 84 | 消化道息肉检测 |
| ldpolypvideo | 163 | 息肉视频检测 |
建议优先建立的三条互链:RARE25 ↔ endovis-challenges(79)(谱系)、RARE25 ↔ gastrovision(203)(论文对照)、RARE25 ↔ hyperkvasir(693)(同域基准)。
7.5 生态影响小结
RARE25 的最大生态价值或许不在"又一个数据集",而在它把评测口径本身变成了可讨论的对象。它示范了如何用一个刻意不公开的测试集 + 一个对假阳性极度敏感的指标,迫使社区直面"模型在真实流行率下到底能不能用"。这一方法论影响,可能比其 3,095 张训练图本身更持久。
§8 方法学启示:五条可迁移的经验
8.1 评测指标应锚定临床操作点,而非全局判别
AUROC 高不等于可用。RARE25 用 PPV@90Recall 证明:同一批模型 AUROC 都"不错",但在 90% 召回点上精确率崩塌到 0.035。任何面向筛查/监测的 AI 评测,都应至少报告一个临床相关召回点上的精确率。
8.2 流行率是评测的一等参数,不是数据的偶然属性
RARE25 把 100:1 采样写进评测协议、重复 1,000 次。这提示:**合成低流行率场景(保留全部阴性 + 有放回采样阳性)**是把"实验室性能"翻译成"部署性能"的廉价而有效的手段。任何正样本稀缺的检测任务都可借鉴。
8.3 训练时不平衡 ≠ 部署时不平衡,两者要分开处理
RARE25 同时存在"训练集 5% 正样本"和"部署 1% 流行率"两道不平衡。论文的教训是:训练时用类权重/均衡采样解决第一道,评测时用流行率采样暴露第二道,绝不能混为一谈或只解决一道。
8.4 集成 + 校准是低流行率下的稳健解,但治标不治本
冠军 IMSY 靠 40 模型集成 + 校准拿到第一,但绝对 PPV 仍仅 0.32。说明在极端不平衡下,规模与校准能压低方差、提升稳健性,却无法根本解决"正常图像压倒性地多"带来的假阳性问题。论文据此呼吁异常检测/单类学习范式。
8.5 测试集私有是挑战赛公平性的双刃剑
私有测试集防止了刷分与过拟合,但也牺牲了独立可复现性——外部无法验证组织方报告的数字。RARE25 的取舍是把"可复现"让位给"防污染",检索者引用其成绩时须明确这一限制。
8.6 给数据集建设者的清单
- 明确区分训练集/测试集的公开性与许可;
- 评测协议写死流行率与重复次数;
- 报告至少一个临床操作点指标 + 不确定性;
- 提供跨中心/跨设备的切分脚本;
- 把设备/中心单一样式写入 Limitations 而非隐瞒。
§9 与库内条目的关系
9.1 家族图谱
RARE25 在库内属于消化道内镜影像族,向上归 EndoVis 挑战赛谱系:
EndoVis workshop (MICCAI)
├── endovis-challenges (rid 79) ← 系列主锚
│ └── RARE25 (rare25) ← 本条目,2025 BE 检测分支
└── 消化道内镜数据集族
├── gastrovision (rid 203) ← 论文点名对照(BE 子集仅 95 图)
├── hyperkvasir (rid 693) ← 同域大库
├── kvasir-hyperkvasir (rid 75)
├── kvasir-seg (rid 112)
├── kvasir-capsule (rid 123)
├── kvasir-instrument (rid 213)
├── cadec (rid 464) / cad-cap (rid 193) / cadis (rid 243) ← CADe 类
├── polypgen (rid 183) / bkai-igh-neopolyp (rid 84) / ldpolypvideo (rid 163) ← 息肉检测
└── slam-3d-endoscopic (rid 82)
9.2 检索路径建议
- 想做 BE/食管早癌 AI:RARE25 是当前最大公开 BE 内镜集,但注意它只有图像级标签、非商业许可、测试集不可得——适合做方法原型 + 低流行率评测,不适合直接训练商用产品。
- 想研究"流行率漂移"评测方法:RARE25 的 100:1 bootstrap 协议是可迁移模板,配合库内其他检测类数据集(polypgen、cad-cap)做横向。
- 想复现内镜基础模型:RARE25 官方 GitHub(IMSY-DKFZ/rare2025-challenge)提供 GastroNet + DINOv3 + LoRA 完整管线,是内镜域 PEFT 的现成参考。
9.3 关系声明
RARE25 与库内无同名/别名条目(rare 关键词查重 0 命中)。它与 RARE26 是同一挑战赛的前后届关系,非同一数据集;若后续 RARE26 被收录,应作为独立条目并双向互链,而非合并。
§10 避坑清单:九个已踩过的坑
坑 1:把 arXiv 论文的 CC BY 4.0 当成数据许可。
arXiv 页面 boilerplate 的 “License: CC BY 4.0” 是论文文本许可;RARE25 数据是 CC BY-NC-SA 4.0。混用会导致商业使用越界。
坑 2:以为测试集也能下载。
26,408 张测试图永不公开。任何"RARE25 完整版下载"的说法都不可信;能拿到的只有 3,095 张训练图。
坑 3:把"中位 PPV@90Recall = 0.035"和"全测试集 = 0.320"当成矛盾。
两者是不同口径:前者是 100:1 流行率 + 1,000 次 bootstrap 的中位数(排名依据),后者是原始分布下不重采样的成绩。引用时必须写明口径。
坑 4:用 AUROC 排序 RARE25 成绩。
AUROC 排序会把 UT 排上来、把 IMSY 的领先抹平。RARE25 的官方排序只看 PPV@90Recall。换指标换冠军是这篇论文的核心发现之一。
坑 5:把训练集 3,095 与"over 3,000"当成两个数。
"over 3,000"是论文摘要口语口径;精确值是 2,937 NDBE + 158 NEO = 3,095。引用精确数。
坑 6:把训练集 NEO 占比 5.1% 当成部署流行率。
训练集 5.1% 是训练时的富集比例;部署流行率被模拟为 1%(100:1)。二者相差约 5 倍,是 RARE25 刻意制造的两道不平衡。
坑 7:忽略 single-device 限制。
全部图像来自 Olympus Exera III。论文自曝这是泛化性主要限制。用 RARE25 训练的模型迁移到其他内镜品牌需谨慎。
坑 8:把 RARE25 当成"分级"数据集。
它只有 NDBE/NEO 二分类,没有异型增生分级、没有病灶框、没有像素掩码。需要定位/分级请勿选它。
坑 9:混淆 RARE25 与 RARE26。
RARE25 结果页挂在 rare26.grand-challenge.org 下,容易误以为两者是同一赛事。它们是前后届,数据与结果应分别标注年份。
§11 总结
11.1 三句话总结
- RARE25 是 MICCAI 2025 EndoVis 下的 BE 早癌检测挑战赛数据集:3,095 张公开训练图(2,937 NDBE + 158 NEO)+ 26,408 张私有测试图,全部 Olympus Exera III 采集。
- 它的杀手锏是评测口径:用 PPV@90Recall 在 100:1 低流行率 + 1,000 次 bootstrap 下暴露假阳性负担,冠军 IMSY 的 bootstrap 中位 PPV@90Recall 仅 0.035,量化了"临床可用性鸿沟"。
- 它是基准而非语料库:训练集 CC BY-NC-SA 4.0(gated)、测试集永恒私有、只有图像级标签——用途应锚定"方法原型 + 低流行率评测",而非商用训练或定位任务。
11.2 适合谁
- 消化道早癌 AI / CADe 研究者:需要一个"最大公开 BE 内镜集 + 严格低流行率评测";
- 低流行率机器学习研究者:RARE25 的 bootstrap 协议是可迁移的评测范式样本;
- 内镜基础模型 / PEFT 实践者:官方 GitHub 提供 GastroNet + DINOv3 + LoRA 完整管线;
- 评测方法论研究者:论文是"指标选错会误导"的教科书案例。
11.3 不适合谁
- 需要病灶定位/分割的人:无框、无掩码;
- 需要肿瘤分级的人:只有二分类;
- 想商用训练模型的人:CC BY-NC-SA 的 NC 条款限制;
- 想复现榜首成绩的人:测试集不可得,只能引用组织方数字;
- 需要多设备泛化的人:单一 Exera III 设备。
11.4 30 秒决策卡
| 你的需求 | RARE25 是否合适 | 理由 |
|---|---|---|
| BE 早癌图像分类训练 | ✅ 是 | 最大公开 BE 内镜集 |
| 低流行率评测 | ✅✅ 非常适合 | PPV@90Recall + 1% 采样 |
| 病灶检测/定位 | ❌ 否 | 仅图像级标签 |
| 肿瘤分级 | ❌ 否 | 仅 NDBE/NEO |
| 商业产品训练 | ❌ 否 | CC BY-NC-SA(非商业) |
| 复现挑战赛排名 | ⚠️ 部分 | 测试集私有,不可独立复现 |
| 多设备泛化验证 | ❌ 否 | 仅 Exera III |
FAQ(高频问答 20 问)
A. 基础认知
1. RARE25 是什么的缩写?
官方题名为 “Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge”。“RARE” 指低流行率(rare)场景,25 指 2025 年赛事年份。
2. RARE25 是数据集还是挑战赛?
两者都是——它是一场比赛,比赛提供了数据集(公开训练集 + 私有测试集)。本条目描述的是这套数据资产与评测协议。
3. 谁主办的?
ARIA lab(Eindhoven University of Technology)+ Amsterdam University Medical Centers,隶属 BONSAI consortium,作为 MICCAI 2025 EndoVis workshop 的一部分。
4. 论文在哪里?
arXiv:2604.11171(cs.CV),2026-04-13 提交;DOI 10.48550/arXiv.2604.11171。
5. 结果公布在哪?
rare26.grand-challenge.org/rare25-results(RARE26 站点的 RARE25 结果页)。
B. 数据与获取
6. 训练集多少张?
3,095 张 = 2,937 NDBE + 158 NEO。
7. 测试集多少张?
26,408 张 = 23,176 NDBE + 3,232 NEO(论文精确口径;摘要写 “>25,000”)。
8. 测试集能下载吗?
不能。组织方私有保留,任何途径均无公开入口。
9. 训练集在哪下?
HuggingFace TimJaspersTue/RARE25-train,gated=manual(需申请授权)。镜像 hf-mirror.com。
10. 许可是什么?
训练集 CC BY-NC-SA 4.0(非商业);测试集私有;论文文本 CC BY 4.0。注意三者的区别。
11. 图像什么设备拍的?
Olympus Exera III 内镜系统。
12. 数据来自哪些医院?
训练集 2 家荷兰中心;验证/测试集 BONSAI 联盟 12 家中心。
C. 评测与方法
13. 主指标是什么?
PPV@90Recall(在 90% 召回点上的正预测值)。
14. 次指标是什么?
AUROC、AUPRC,仅参考,不影响排名。
15. 为什么用 PPV@90Recall 而不是 AUROC?
AUROC 掩盖高召回点上的精确率崩塌;PPV@90Recall 直接量化临床操作点的假阳性负担。
16. 评测怎么做的?
100:1(NDBE:NEO)有放回采样,重复 1,000 次,取 PPV@90Recall 中位数 + 95% CI。
17. 谁赢了?成绩多少?
Team IMSY;bootstrap 中位 PPV@90Recall = 0.035,全测试集 PPV@90Recall = 0.320,AUROC = 0.920。
18. 冠军用的什么方法?
GastroNet(ResNet-50) + DINOv3 ViT-L(LoRA) 40 模型集成 + post-hoc 校准。
18b. 为什么冠军用了 40 个模型?
正样本极少时单模型方差大,集成是"压方差"而非"求更强",配合 affine 校准把聚合分数映射回可信概率尺度,使 90% 召回阈值可复现。
D. 定位与库内
19. RARE25 和 EDD2020 / EndoVis 2015 什么关系?
同属 BE 检测基准,但 RARE25 规模更大(3,095 vs 384 vs 200)且增加低流行率评测;EDD2020 有病灶标注而 RARE25 没有。
20. 库内有哪些相关条目?
endovis-challenges(79)、gastrovision(203)、hyperkvasir(693)、kvasir-seg(112)、cad-cap(193)、polypgen(183) 等,详见 §7.4。
E. 进阶与工程
21. RARE25 的训练集能不能直接当普通二分类数据集跑?
技术上可以,但会重现论文批评的"流行率被忽视"问题——普通训练+离线 AUROC 评估会严重高估临床性能。正确做法是把评测口径切换到 PPV@90Recall + 100:1 采样。
22. 训练集 5.1% 正样本,测试集 12.2% 正样本,为什么说部署是 1%?
12.2% 是测试集的原始正样本率;评测时再对 NEO 有放回采样至 100:1(约 1%),以模拟真实监测流行率。这两个数是"原始收集比例"与"评测模拟比例"的区别。
23. 能不能只用公开训练集自建一个接近官方的测试集?
可以,但只能得到"自建分布"下的成绩,无法与官方 bootstrap 排名直接比较。建议用 center2 子集做留出,模拟跨中心泛化。
24. RARE25 的图像分辨率是多少?
论文未在正文明示原图分辨率;224×224 是参赛模型的输入尺寸,不是原图尺寸。检索者若需原图规格应从 HF 数据实体实测。
25. 为什么说它"不适合复现排名"?
测试集私有意味着外部无法在相同数据上重跑评测,只能引用组织方报告的 bootstrap 数字。这牺牲了独立可复现性以换取防刷分的公平性。
26. 如果我要做 BE 病灶定位,应该选什么?
选有病灶级/像素级标注的数据集(如 EDD2020 提供标注病灶),RARE25 只有图像级标签,无法监督定位任务。
27. RARE26 和 RARE25 的数据一样吗?
官方未明确说明完全复用;RARE26 是续办赛事,RARE25 的结果页挂在其站点下。检索者使用时应以所用仓库版本对应的赛事年份为准。
28. 论文作者名单为什么可能变化?
arXiv v1 的 Comments 明确写"final author list is currently being finalized and will be updated in subsequent versions"——引用时建议核对最新版本。
29. 这个数据集有患者级信息吗?
没有公开患者级字段。训练集仅提供图像 + 类别 + 中心归属 + 切分标识,患者级数量未披露。
30. 为什么 top 方法都用大规模预训练?
BE 正样本太少,从零训练不可行;域内预训练(GastroNet)或通用基础模型(DINOv3/ImageNet)提供强先验,是低数据场景的必要条件。
31. “prevalence-agnostic” 是什么意思?
指不依赖训练流行率假设的方法——如异常检测、单类学习。论文点名所有参赛方法都是全监督分类,缺失这一范式的探索。
32. RARE25 的评测能否用于其他部位的内镜任务?
其 100:1 bootstrap + PPV@操作点方法论是通用的,可迁移到结肠息肉、食管鳞癌等任何正样本稀缺的检测任务,只需替换数据与临床召回要求。
事实清单(硬事实 32 条)
- RARE25 = MICCAI 2025 EndoVis workshop 挑战赛(arXiv:2604.11171)。
- 主办:ARIA lab (TU/e) + Amsterdam UMC,隶属 BONSAI consortium。
- 赛事地点:MICCAI 2025, Daejeon, South Korea。
- 论文提交日:2026-04-13(v1)。
- 公开训练集:3,095 张。
- 训练集构成:2,937 NDBE + 158 NEO。
- 隐藏测试集:26,408 张(23,176 NDBE + 3,232 NEO)。
- 测试集摘要口径:“>25,000 images”。
- 设备:Olympus Exera III(全部图像)。
- 训练集来源:2 家荷兰医疗中心。
- 测试集来源:BONSAI 联盟 12 家中心。
- 采集方式:EndoBase 归档回顾性检索 + 人工筛选。
- 任务:图像级二分类(0=NDBE,1=Neoplasia)。
- 无像素级/病灶级标注。
- 主指标:PPV@90Recall。
- 次指标:AUROC、AUPRC(仅参考)。
- 评测协议:100:1 采样 + 1,000 次 bootstrap + 中位数。
- 注册人数:226。
- Open 阶段:196 次提交,20 队,10 国。
- Closed 阶段:11 队,7 国。
- 冠军:Team IMSY。
- IMSY bootstrap 中位 PPV@90Recall = 0.035。
- IMSY 全测试集 PPV@90Recall = 0.320。
- IMSY 全测试集 AUROC = 0.920。
- IMSY 全测试集 AUPRC = 0.822。
- UT bootstrap 中位 AUPRC = 0.532(最高)。
- 数据许可:CC BY-NC-SA 4.0。
- HF 仓库:TimJaspersTue/RARE25-train(gated=manual)。
- HF lastModified:2025-05-28。
- EndoVis 2015 BE:100 NDBE + 100 NEO。
- EDD2020:384 图。
- GastroVision BE 子集:95 图,无肿瘤标注。
术语表(22 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| Barrett 食管 | Barrett’s esophagus (BE) | 胃食管反流引起的食管远端黏膜化生,食管腺癌癌前病变 |
| 非异型增生 | non-dysplastic BE (NDBE) | BE 中无细胞异型的"正常"状态,RARE25 的阴性类 |
| 肿瘤 | neoplasia (NEO) | 含异型增生与早期癌,RARE25 的阳性类 |
| 食管腺癌 | esophageal adenocarcinoma | BE 进展的终末恶性病变 |
| CADe | computer-aided detection | 计算机辅助检测,本挑战赛的目标系统 |
| 低流行率 | low prevalence | 阳性样本占比极低(此处模拟 1%) |
| 流行率漂移 | prevalence shift | 训练分布与部署分布的阳性率差异 |
| 正预测值 | positive predictive value (PPV) | 精确率 precision,报警中真阳性的比例 |
| 召回 | recall | 灵敏度 sensitivity,真阳性被检出的比例 |
| PPV@90Recall | — | 在召回=90% 操作点上的 PPV,RARE25 主指标 |
| AUROC | area under ROC curve | 全局判别能力指标 |
| AUPRC | area under PR curve | 检索性能指标 |
| Bootstrap | — | 有放回重采样估计统计量分布的方法 |
| 类不平衡 | class imbalance | 正负样本比例悬殊 |
| 异常检测 | anomaly detection | 只学"正常"分布、异常即报警的范式 |
| 单类学习 | one-class learning | 仅用单类样本训练的学习范式 |
| 集成 | ensemble | 多模型投票/平均提升稳健性 |
| 校准 | calibration | 使预测概率与实际频率一致的后处理 |
| LoRA | low-rank adaptation | 低秩参数高效微调方法 |
| 参数高效微调 | PEFT | 只微调少量参数的迁移学习范式 |
| 域内预训练 | domain-specific pretraining | 在目标域大数据(如 GastroNet-5M)上预训练 |
| 测试时增强 | test-time augmentation (TTA) | 推理时对输入做多变换再聚合预测 |
§12 深入解读:为什么低流行率检测如此困难
12.1 数学根源:贝叶斯视角下的 PPV
要理解 RARE25 为何把 PPV@90Recall 定为主指标,需要回到贝叶斯公式。设流行率为 π(阳性先验),灵敏度为 Se,特异度为 Sp,则:
PPV = (Se · π) / (Se · π + (1 - Sp) · (1 - π))
当 π = 1%(RARE25 的部署模拟流行率)、Se = 0.90 时:
- 若 Sp = 0.99(假阳性率 1%):PPV = 0.9·0.01 / (0.9·0.01 + 0.01·0.99) = 0.009 / (0.009 + 0.0099) ≈ 0.476
- 若 Sp = 0.95(假阳性率 5%):PPV = 0.009 / (0.009 + 0.0495) ≈ 0.154
- 若 Sp = 0.90(假阳性率 10%):PPV = 0.009 / (0.009 + 0.099) ≈ 0.083
冠军 IMSY 在全测试集上的 PPV@90Recall = 0.320,反推其在此操作点上的等效特异度约为 0.985 上下——已经相当高,但在 1% 流行率下,PPV 依然只有三成。这正是 RARE25 想传达的核心:在低流行率场景中,哪怕特异度做到 99%,每 3 次报警仍有约 2 次是假的。
12.2 "低流行率效应"的心理与统计双重机制
临床上把这一现象拆成两层:
统计层:如上式,PPV 对流行率极度敏感。同一模型在 50% 流行率下 PPV 可能高达 0.95,在 1% 流行率下骤降到 0.3 以下,而模型的 Se/Sp 完全没变。所有"在平衡数据上很强"的报告,若不做流行率校正,都是对临床性能的高估。
心理层:内镜医生在长期监测中极少遇到阳性,视觉搜索会被前一帧的正常黏膜锚定,形成"预期偏差"——大脑倾向于把罕见异常归类为伪影、反光或炎症。文献称之为 low-prevalence effect。CADe 的价值在于提供不带偏见的"第二双眼睛",但若 CADe 自己报警泛滥,医生很快会产生"报警疲劳(alert fatigue)"并忽略它——这就是 RARE25 把假阳性负担当作核心指标的动机。
12.3 为什么不能简单"多收阳性样本"
一个自然的对策是:既然阳性少,就去收集更多阳性图像扩充训练集。RARE25 的实践揭示了这一路径的边界:
- 数据可得性硬约束:BE 早期肿瘤在真实监测中本就罕见,公开可用的临床图像中阳性是稀缺资源。3,158 张阳性(158 训练 + 3,000 有效测试阳性)已是多中心多年积累。
- 采样式扩充不等于分布扩充:有放回采样能改变评测分布,却不会增加信息的多样性——它无法创造新的病灶形态。
- 合成与增广的局限:论文提到部分队伍用了 MixUp、FGSM 等技巧,但这些都是"在有限阳性样本上做文章",不能替代真实多样性。
结论:低流行率问题的根治不在"堆阳性",而在改变学习范式——异常检测、单类学习、以及能对流行率漂移鲁棒的方法。
12.4 RARE25 论文点名的范式缺口
论文最尖锐的一句批评是:所有 11 支队伍都用了全监督分类,尽管临床数据的压倒性多数是"正常"。这意味着:
- 模型被迫学习"什么是肿瘤",而不是"什么不是正常";
- 正常样本的海量信息(本该用于刻画正常流形)被浪费在当负类;
- 一旦流行率漂移,分类边界不变,PPV 崩塌。
论文据此呼吁 prevalence-agnostic 方法(如 anomaly detection、one-class learning),并指出这是 RARE25 暴露的、尚未被社区填补的空白。这一呼吁对本库研究异常检测/自监督的检索者有直接价值。
§13 方法论深潜:冠军方案的工程解剖
13.1 IMSY 管线的三个阶段
Team IMSY 的方案(GitHub: IMSY-DKFZ/rare2025-challenge)是理解"如何在内镜低流行率任务上做到最好"的活教材,其管线分为:
阶段一:双主干构建
- 主干 A:ResNet-50,用 GastroNet(消化道内镜域预训练权重)初始化——吸入内镜域视觉先验;
- 主干 B:DINOv3 ViT-Large(self-supervised foundation model),用 LoRA 低秩适配微调——以极小参数量适配内镜任务,保留大模型的通用表征。
阶段二:损失与采样
- ViT-L 侧:带类权重的交叉熵 + 平衡采样器(balanced sampler),对抗 5% 正样本的类不平衡;
- ResNet-50 侧:直接瞄准 PPV@90Recall 的代理损失(surrogate loss)——不优化分类准确率,而优化"高召回点上的精确率"。这是本方案最"贴题"的设计:把评测指标写进损失函数。
阶段三:集成与校准
- 训练出 20 个 ResNet-50 + 20 个 ViT-L 共 40 个模型;
- 对 logits 做 affine 重校准(re-calibration) 后聚合;
- 推理时输入 224×224,按 ImageNet 标准归一化。
13.2 为什么是"40 模型 + 校准"而不是更大的单模型
在正样本极少的任务上,单个模型的方差极大(不同随机种子的性能可能相差几十个百分点)。集成的作用不是"更强",而是压方差:40 个模型平均后,预测分布更集中,高召回点上的阈值选择更稳定。校准的作用则是把"聚合后的分数"映射回"接近真实概率"的尺度,使固定召回阈值(90%)对应的操作点可复现。论文与结果页都强调 IMSY 的胜出逻辑是"跨折鲁棒与一致性,而非依赖单一模型"。
13.3 一个反直觉的教训:训练指标 ≠ 部署指标
多数队伍优化的是 AUC 或交叉熵,只在训练后被动检查 PPV。IMSY 的差异化在于把 PPV@90Recall 作为代理损失的一部分主动优化。这印证了一条通用工程原则:如果评测指标是操作点特定的,就应该让训练目标与之对齐,而不是寄望"优化 AUC 后 PPV 自然好"。论文中 team CINDIE 的对照尤其醒目:AUROC 0.78 看起来不错,但 1% 流行率下 PPV@90Recall 掉到 0.01——判别力与操作点精确率的脱节被赤裸暴露。
13.4 复现路径与工程细节
官方仓库给出的复现骨架包括:
- 训练脚本
training/train.py(参数在training/config.py); - 复现脚本
reproduce_runs.sh(需替换 DINOv3 ViT-L 权重路径,版本须为dinov3_vitl16_pretrain_lvd1689m); - 重校准
training/recalibrate_files.py; - LoRA 权重抽取
extract_lora_weights.py(分离冻结的 DINO 基座与 LoRA 增量,降低推理时延与内存); - 依赖 wandb 记录实验。
注意:复现需同时申请 HF 数据集授权与 GastroNet/DINOv3 权重授权——这是三个独立的门,缺一不可。
§14 数据合规与伦理要点
14.1 患者隐私
所有图像在发布前完成去标识化(de-identified)。论文明确图像来自标准诊疗流程的回顾性数据,未额外采集。设备级的元数据(照明、变焦、白平衡、成像模式等)被保留,因为它们"反映常规临床实践"且对模型有信息价值——但这些是设备参数而非患者信息。
14.2 伦理审查与数据来源
- 训练数据来自 2 家荷兰中心的常规监测流程,采集嵌入标准诊疗;
- 验证/测试数据来自 BONSAI 联盟 12 家中心;
- 论文声明训练集的匿名化先于发布完成;
- 由于是回顾性归档挖掘(EndoBase),操作者经验的详细记录并非每例齐备——这是真实世界回顾性数据集的常见局限,论文如实披露。
14.3 使用方需自担的合规责任
对检索者与产品团队,使用 RARE25 需注意:
- 非商业限制:CC BY-NC-SA 的 NC 条款禁止直接用于商业产品训练;
- 相同方式共享:SA 条款要求衍生数据集以相同许可发布;
- 署名要求:CC BY 的 BY 条款要求标注来源与作者;
- 不得反推个体:尽管已去标识化,多模态重识别风险在理论上仍应被使用者评估;
- 临床声明边界:本数据集用于研究,任何基于它训练的模型在临床使用前须另行验证与注册。
14.4 与 GDPR / 医疗器械法规的关系
数据源自荷兰(EU),受 GDPR 约束;论文的"去标识化 + 回顾性 + 标准诊疗"框架是欧盟境内医学影像研究发布的常见合规路径。对拟将模型推向市场的团队,还需满足 EU MDR 等医疗器械法规——RARE25 论文本身不涉及器械审批,检索者不应把"论文在大规模测试集上验证"误读为"已满足监管要求"。
§15 复现与实验设计建议
15.1 若你要在 RARE25 上做研究
基线搭建建议:
- 用官方
create_splits.py生成 5-fold CV,先在本地 CV 上对齐论文的队伍成绩数量级; - 严格区分"训练时类不平衡处理"与"评测时流行率采样",勿混用;
- 评测时按 100:1 采样 + 1,000 次 bootstrap + 中位数报告,与官方口径一致才有可比性;
- 同时报告 AUROC、AUPRC、PPV@90Recall,说明各自口径。
方法探索建议:
- 尝试 anomaly detection / one-class 范式,填补论文点名的空白;
- 探索对流行率漂移鲁棒的重加权/重校准方法;
- 用中心切分(center1↔center2)做域泛化实验。
15.2 常见实验陷阱
- 用测试集调参:测试集私有,若通过任何渠道获得,用于调参即违反挑战赛精神;
- 只报告单一指标:论文反复强调多指标互补;
- 忽视 CI:正样本稀少时点估计无意义,必须报不确定性;
- 把 open 阶段验证榜当泛化证明:验证榜可被迭代过拟合,终评才是真相。
15.3 数据切分的正确用法
四套切分各有用途:
| 切分 | 用途 |
|---|---|
| 5fold_cv | 通用模型选择,最大化数据利用 |
| center1→center2 | 跨中心泛化,模拟"在 A 院训练、部署到 B 院" |
| center2→center1 | 反向跨中心验证,避免方向性偏差 |
| holdout_cv | 5 折 + 独立保留集,最接近官方评测结构的本地模拟 |
§16 产业视角:低流行率检测的商业含义
16.1 假阳性负担的直接成本
在 1% 流行率、PPV@90Recall = 0.32 的配置下,每检出 1 例真肿瘤伴随约 2 例假阳性。对一个年做 1 万例监测的内镜中心,意味着每年约 2 万次假警报——每次警报可能触发额外活检、延长检查时间、增加病理成本与患者焦虑。这是"临床可用性鸿沟"的经济账。
16.2 为什么大厂仍愿意投入
尽管绝对 PPV 低,CADe 的商业价值在于:
- 降低漏检:即便 PPV 不高,只要召回高,就能减少"医生肉眼错过"的最坏情形;
- 分诊:作为"第二读者"标记可疑帧供医生重点复核,而非自动诊断;
- 质控:用 CADe 的分析结果做内镜医师培训与质量评估。
RARE25 的价值恰在于把商业宣传中常被回避的假阳性率摆上台面,为负责任的产品定位提供依据。
16.3 非商业许可对产业的影响
CC BY-NC-SA 意味着:企业不能用 RARE25 训练商业模型。这可能促使产业界:
- 自行采集/购买商业授权的 BE 数据;
- 仅用 RARE25 做学术基准对标,商业模型另训;
- 推动更多 BE 数据的开放或商业授权供给。
这一许可设计本身是数据治理意图的体现——在开放科研与保护商业价值之间划界。
§17 与库内数据集的可迁移性对照
| 迁移方向 | 从 RARE25 可借鉴 | 库内类似场景 |
|---|---|---|
| 低流行率评测协议 | 100:1 采样 + 1000 bootstrap + PPV@操作点 | 可用到 polypgen(183)、cad-cap(193) 等检测任务 |
| 域内预训练 + PEFT | GastroNet + DINOv3 + LoRA | 可迁移到 hyperkvasir(693)、kvasir 系列 |
| 跨中心切分设计 | center-based split 脚本化 | 可迁移到多中心内镜库 |
| 集成 + 校准压方差 | 40 模型集成 + affine 校准 | 适用所有正样本稀缺任务 |
| 私有测试床 + 结果页 | 锁定测试集 + 延迟公布 | 挑战赛类数据集的标准做法 |
17.1 与 GastroVision 的对照再展开
GastroVision(rid 203) 覆盖全消化道、规模远大于 RARE25,但其 BE 子集仅 95 张且无肿瘤标签。二者恰构成互补:GastroVision 提供广度与解剖多样性,RARE25 提供 BE 深度与流行率真实性。研究者若同时使用,可用 GastroVision 做预训练/预筛选,用 RARE25 做 BE 专精与低流行率评测。
17.2 与 EndoVis 系列的谱系关系
EndoVis 挑战赛历年覆盖息肉分割、器械检测、场景理解等多个子任务。RARE25 是其在"病变检测 + 流行率现实"方向的最新分支。库内 endovis-challenges(79) 是系列主锚,若后续补充 EndoVis 其他年份数据集,应统一挂在该谱系下。
§18 版本沿革与检索提示
18.1 时间轴
| 时间 | 事件 |
|---|---|
| 2025 年(赛事期) | RARE25 于 MICCAI 2025 EndoVis workshop 举办,训练数据公开 |
| 2025-05-28 | HF 训练集仓库 lastModified |
| 2025 年内 | Open 阶段 196 次提交;Closed 阶段 11 队 7 国提交 |
| MICCAI 2025 会期 | 结果在 EndoVis 现场公布 |
| 2025 年后 | RARE26 续办,RARE25 结果页迁至 rare26 站点 |
| 2026-04-13 | 论文 arXiv:2604.11171 v1 发布 |
18.2 检索提示
- 搜 “RARE25” 可能命中 RARE26 站点——注意年份;
- 搜 “Barrett’s neoplasia dataset” 会同时命中 EDD2020、EndoVis 2015——注意区分;
- HF 仓库作者是个人账号
TimJaspersTue,搜组织号可能找不到; - 论文的 cs.CV 分类意味着它可能不出现在医学影像专题索引中。
18.3 引用建议格式
Jaspers T.J.M., Caetano F., Claessens C.H.B., et al. Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge for early detection of Barrett’s neoplasia. arXiv:2604.11171 [cs.CV], 2026.
数据集引用另行标注 HF 仓库:TimJaspersTue/RARE25-train,许可 CC BY-NC-SA 4.0。
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| 官方名 | RARE25(RARE25 Challenge, MICCAI 2025 EndoVis) |
| slug | rare25 |
| 论文 | arXiv:2604.11171 |
| 主办 | ARIA lab (TU/e) + Amsterdam UMC(BONSAI consortium) |
| 任务 | 内镜图像级二分类(NDBE vs NEO) |
| 训练集 | 3,095(2,937 NDBE + 158 NEO) |
| 测试集 | 26,408(23,176 NDBE + 3,232 NEO,私有) |
| 设备 | Olympus Exera III |
| 主指标 | PPV@90Recall |
| 许可 | CC BY-NC-SA 4.0(训练集);测试集私有 |
| 获取 | HuggingFace TimJaspersTue/RARE25-train(gated=manual) |
| 冠军 | Team IMSY(bootstrap 中位 PPV@90Recall = 0.035) |
| 平台 | rare25.grand-challenge.org |
附录 B:DAIMS 评估全表
DAIMS(Data and AI Management/Maturity Score)逐维评估:
| 维度 | 评分 | 说明 |
|---|---|---|
| 数据可获得性(Availability) | 中 | 训练集 gated 公开;测试集完全私有 |
| 许可清晰度(Licensing) | 中高 | CC BY-NC-SA 明确,但论文文本 CC BY 4.0 易混淆 |
| 文档完备性(Documentation) | 高 | 论文 + 官网 + GitHub + 结果页四源齐备 |
| 标注质量(Annotation Quality) | 中 | 仅图像级标签,无定位/分割;标签来源为临床确诊 |
| 规模(Scale) | 中 | 训练 3,095 张,在 BE 领域属最大,但绝对量不大 |
| 平衡性(Balance) | 低 | 训练 5.1% 正样本,部署 1%,极端不平衡 |
| 多样性(Diversity) | 中低 | 单一设备(Exera III);训练 2 中心 / 测试 12 中心 |
| 可复现性(Reproducibility) | 中 | 训练与切分可复现;终测不可独立复现 |
| 伦理合规(Ethics) | 高 | 全去标识化,回顾性标准诊疗数据 |
| 新颖性(Novelty) | 高 | 首个大规模 prevalence-aware BE 检测基准 |
| 维护活跃度(Maintenance) | 中 | RARE26 续办,原仓库 lastModified 2025-05 |
| AI-Ready 综合 | 中高 | 训练即用,评测受限于私有测试集与非商业许可 |
附录 C:逐项证据链自证
| 事实 | 证据源 |
|---|---|
| 3,095 = 2,937 + 158 | arXiv:2604.11171 §4.1 原文 |
| 26,408 = 23,176 + 3,232 | arXiv:2604.11171 正文 |
| CC BY-NC-SA 4.0 | arXiv 正文 + HF tags license:cc-by-nc-sa-4.0 |
| gated=manual | HF API /api/datasets/TimJaspersTue/RARE25-train |
| 226 / 196 / 20队10国 / 11队7国 | arXiv:2604.11171 §3 |
| IMSY 0.035 / 0.320 / 0.920 | arXiv:2604.11171 §6 结果节 |
| UT AUPRC 0.532 | arXiv:2604.11171 §6 结果节 |
| Exera III | arXiv:2604.11171 §4.1 |
| 12 家中心 | arXiv:2604.11171 §4(“12 medical centres participating in the BONSAI consortium”) |
附录 D:数据获取决策树
想用 RARE25?
├── 需要测试集?
│ └── 不可能——组织方私有保留,无任何公开入口 → 改用训练集自建本地测试
├── 需要商用训练?
│ └── 受限——CC BY-NC-SA 的 NC 条款禁止 → 考虑 CC BY 的替代集
├── 需要病灶定位/分割标签?
│ └── 不满足——仅图像级标签 → 考虑 EDD2020(有病灶标注)
└── 需要图像级二分类 + 低流行率评测?
├── 申请 HF repo 授权(gated=manual)
├── huggingface-cli download TimJaspersTue/RARE25-train
├── 跑官方 data_splitting/create_splits.py 生成切分
└── 采用 PPV@90Recall + 100:1 bootstrap 评测
附录 E:评测指标计算公式表
| 指标 | 公式 | 说明 |
|---|---|---|
| Recall(召回) | TP / (TP + FN) | 固定为 0.90 作为操作点 |
| Precision/PPV(正预测值) | TP / (TP + FP) | 报警中真阳性比例 |
| PPV@90Recall | 阈值取至 Recall=0.90 时的 PPV | RARE25 主指标 |
| AUROC | ROC 曲线下面积 | 全局判别 |
| AUPRC | PR 曲线下面积 | 检索/不平衡敏感 |
| 中位 PPV@90Recall | median over 1,000 bootstraps | 排名依据 |
| 95% CI | bootstrap 分布 2.5%-97.5% 分位 | 不确定性 |
附录 F:官方切分脚本使用骨架
# 1. 环境
conda create -n rare python=3.12.0 && conda activate rare
git clone https://github.com/IMSY-DKFZ/rare2025-challenge
cd rare2025-challenge && pip install -r requirements.txt
# 2. 数据(需 HF 授权)
huggingface-cli login
huggingface-cli download TimJaspersTue/RARE25-train --repo-type dataset --local_dir data/train
# 3. 切分
python data_splitting/create_splits.py
# 产出:data/splits/{5fold_cv, center1_train_center2_test,
# center2_train_center1_test, holdout_cv}.csv
附录 G:PPV@90Recall 计算骨架(Python)
import numpy as np
from sklearn.metrics import roc_curve
def ppv_at_recall(y_true, y_score, target_recall=0.90):
"""在达到 target_recall 的最低阈值处计算 PPV。"""
fpr, tpr, thr = roc_curve(y_true, y_score)
# 找到 tpr >= target_recall 的第一个点
idx = np.searchsorted(tpr, target_recall)
if idx >= len(thr):
idx = len(thr) - 1
thr_sel = thr[idx]
y_pred = (y_score >= thr_sel).astype(int)
tp = np.sum((y_pred == 1) & (y_true == 1))
fp = np.sum((y_pred == 1) & (y_true == 0))
return tp / (tp + fp) if (tp + fp) > 0 else 0.0
def bootstrap_ppv(y_ndbe, y_neo, y_score_ndbe, y_score_neo,
ratio=100, n_iter=1000, seed=0):
"""保留全部 NDBE,NEO 有放回采样至 ratio:1,取中位数。"""
rng = np.random.default_rng(seed)
n_neo_sample = max(1, len(y_ndbe) // ratio)
scores = []
for _ in range(n_iter):
idx = rng.choice(len(y_neo), size=n_neo_sample, replace=True)
yt = np.concatenate([np.zeros(len(y_ndbe)), np.ones(n_neo_sample)])
ys = np.concatenate([y_score_ndbe, y_score_neo[idx]])
scores.append(ppv_at_recall(yt, ys))
return float(np.median(scores)), (
float(np.percentile(scores, 2.5)), float(np.percentile(scores, 97.5)))
上述骨架为按论文协议复现的示意实现,非官方代码;实际评测以组织方协议为准。
附录 H:参赛方法总表(11 队要点)
| 队伍 | 主干 | 预训练 | 集成 | 关键策略 |
|---|---|---|---|---|
| IMSY(冠军) | ResNet-50 + DINOv3 ViT-L | GastroNet + DINOv3 | 40 模型 | LoRA + PPV 代理损失 + affine 校准 |
| UT(亚军) | MaxViT-Tiny | 仅挑战数据 | 单模型 | BCE + 精心训练/验证 |
| Jmees-inc | 分割驱动 | 分阶段(息肉/BE/癌) | compact | 定位感知 |
| MEDAI | ResNet50 | GastroNet-5M | 单模型 | Balanced MixUp + Platt scaling |
| sk | ConvNeXt-Base | ImageNet-22k | 10 模型 | 加权 Focal Loss + 旋转 TTA |
| agaldran | ResNet50 | GastroNet | 25 模型 | logit-adjusted BCE |
| AJLG_ETRI | ViT-B 类 | ImageNet | 单模型 | 自适应 Focal Loss |
| iRARE | — | GastroNet | 单模型 | 加权 CE + Focal + 过采样 |
| MIRC | — | ImageNet | 单模型 | Asymmetric Loss |
| SAINTS | — | ImageNet | 单模型 | WeightedRandomSampling |
| ReMIC | — | ImageNet/CLIP | 异构集成 | SMOTE-like + FGSM + CLIP 聚类防泄漏 |
附录 I:双口径冲突存照表
| 冲突项 | 口径 A | 口径 B | 本条目取舍 |
|---|---|---|---|
| 数据集许可 | 论文文本 CC BY 4.0 | 数据集实体 CC BY-NC-SA 4.0(HF tags) | 取 B 为数据许可,A 记为论文文本口径 |
| 测试集规模 | 摘要 “>25,000” | 正文 26,408 | 正文精确数为准,摘要口语口径并存 |
| 训练集规模 | 摘要 “over 3,000” | 正文 3,095 | 正文精确数为准 |
| 赛事年份 | MICCAI 2025 | 论文 2026-04 | 赛事 2025,论文 2026,分别标注 |
| 冠军成绩 | bootstrap 中位 0.035 | 全测试集 0.320 | 两口径并存,注明排名依据为前者 |
附录 J:RARE25 vs 既往 BE 基准对照表
| 数据集 | 规模 | 病灶标注 | 低流行率评测 | 公开性 |
|---|---|---|---|---|
| RARE25 | 3,095 训练 + 26,408 测试 | 无 | 有(PPV@90 + 100:1) | 训练 gated / 测试私有 |
| EndoVis 2015 BE | 200(100+100) | 有 | 无 | 公开 |
| EDD2020 | 384 | 有(病灶) | 无 | 公开 |
| GastroVision(BE 子集) | 95 | 无肿瘤标注 | 无 | 公开 |
附录 K:本文引用来源清单
- arXiv:2604.11171 — Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge(主论文,2026-04-13)
- rare25.grand-challenge.org/task-evaluation — 官方任务与评测页
- rare26.grand-challenge.org/rare25-results — 官方结果页
- github.com/IMSY-DKFZ/rare2025-challenge — 冠军队伍复现仓库
- huggingface.co/datasets/TimJaspersTue/RARE25-train — 训练集(gated=manual,CC BY-NC-SA 4.0)
附录 L:坑点档案(与 §10 对照)
| 坑号 | 一句话 | 速查 |
|---|---|---|
| 1 | 论文 CC BY 4.0 ≠ 数据 CC BY-NC-SA | 查 HF tags |
| 2 | 测试集不公开 | 别找"完整版" |
| 3 | 0.035 vs 0.320 是两口径 | 看是否注明"bootstrap/全测试集" |
| 4 | 别用 AUROC 排 RARE25 | 官方只认 PPV@90Recall |
| 5 | 3,095 是精确值 | 别写"约 3000+" |
| 6 | 训练 5.1% ≠ 部署 1% | 两道不平衡 |
| 7 | 单一 Exera III 设备 | 跨设备需谨慎 |
| 8 | 非分级数据集 | 仅 NDBE/NEO |
| 9 | RARE25 ≠ RARE26 | 前后届,分别标注 |
附录 M:给数据集建设者的复用清单
- 写死流行率:在评测协议里显式声明采样比例与重复次数;
- 分离许可:训练/测试集许可分开写,避免与论文许可混淆;
- 提供切分脚本:把跨中心/跨设备切分做成可运行代码;
- 报告操作点指标:至少一个临床相关召回点上的精确率 + CI;
- 公开 Limitations:把单设备、单中心、标签粒度如实写入;
- 保留私有测试床:用锁定测试集防污染,但要接受可复现性代价。
附录 N:与库内条目互链建议清单(供 link_builder 参考)
| 优先级 | 目标条目 | rid | 链接理由 |
|---|---|---|---|
| 高 | endovis-challenges | 79 | EndoVis 挑战赛谱系直接亲缘 |
| 高 | gastrovision | 203 | 论文点名的 BE 子集对照物 |
| 高 | hyperkvasir | 693 | 同域消化道内镜图像库 |
| 中 | kvasir-seg | 112 | 内镜分割任务对照 |
| 中 | kvasir-capsule | 123 | 设备模态对照(胶囊内镜) |
| 中 | cad-cap | 193 | 结肠镜 CADe 基准对照 |
| 中 | polypgen | 183 | 内镜检测任务对照 |
| 低 | kvasir-hyperkvasir | 75 | HyperKvasir 衍生分类 |
| 低 | kvasir-instrument | 213 | 内镜器械检测 |
| 低 | bkai-igh-neopolyp | 84 | 消化道息肉检测 |
| 低 | ldpolypvideo | 163 | 息肉视频检测 |
| 低 | slam-3d-endoscopic | 82 | 3D 内镜重建 |
| 低 | cadec | 464 | 内镜 CADe 类(注意任务区分) |
| 低 | cadis | 243 | CAD 相关内镜 |
附录 O:常见误引清单(发布前校对用)
- ❌ “RARE25 数据集有 26,408 张可下载图像” → 只有 3,095 张训练图可获取,其余私有;
- ❌ “RARE25 采用 CC BY 4.0 许可” → 数据是 CC BY-NC-SA 4.0(CC BY 4.0 是论文文本);
- ❌ “RARE25 冠军 PPV@90Recall 为 0.32(或 0.035)” → 必须写明是"全测试集"还是"bootstrap 中位";
- ❌ “RARE25 提供病灶位置标注” → 只有图像级二分类标签;
- ❌ “RARE25 由某公司发布” → 学术界主办(TU/e + Amsterdam UMC);
- ❌ “RARE25 的测试集可以申请” → 私有,无任何公开/申请入口。
本条目由「千方病案医数集」编辑部撰写。所有硬数字均来自 arXiv:2604.11171 与官方平台实证,双口径冲突已逐条存照(见附录 I)。条目最终以数据库记录为准。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- prostatex — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 肿瘤学
- gastroendonet — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 肿瘤学
- oasbud — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
- hyperkvasir — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
- camelyon17 — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
- unitopatho — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
- slam-laparoscopic-motions — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
- gastrovision — 共享标签:医学影像 / 内窥镜影像 / 图像分类
- panda-plus — 共享标签:医学影像 / 图像分类 / 评测基准 / 肿瘤学
- wsss4luad — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 肿瘤学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

