REFUGE2 (refuge2) — MICCAI 2020 四相机青光眼眼底挑战赛 2000 张多域数据集 — AI-Ready Wikipedia

REFUGE1 全部 1200 张复用为训练集 + 新增 800 张 KOWA/TOPCON 图,2 相机扩为 4 相机、新增黄斑中心凹定位任务——首个多设备多任务彩色眼底青光眼基准,CC BY-NC-ND

来源 中山大学中山眼科中心暗室采集的四相机彩色眼底照片(Zeiss Visucam 500 / Canon CR-2 / KOWA / TOPCON TRC-NW400),含青光眼分类标签、视盘/视杯逐像素掩码与黄斑中心凹坐标;7 名眼科医师初标 + 1 名资深专家复核发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
REFUGE2 (refuge2) — MICCAI 2020 四相机青光眼眼底挑战赛 2000 张多域数据集 — AI-Ready Wikipedia

信息速览

数据集名称REFUGE2 (refuge2) — MICCAI 2020 四相机青光眼眼底挑战赛 2000 张多域数据集 — AI-Ready Wikipedia
数据类型影像数据,人工标注,原始数据
规模2000 张彩色眼底照片(Training 1200:Zeiss 400 + Canon 800|Online 400:KOWA|Onsite 400:TOPCON);患者级数量未披露,左右眼均可纳入
接入方式中山大学中山眼科中心暗室采集的四相机彩色眼底照片(Zeiss Visucam 500 / Canon CR-2 / KOWA / TOPCON TRC-NW400),含青光眼分类标签、视盘/视杯逐像素掩码与黄斑中心凹坐标;7 名眼科医师初标 + 1 名资深专家复核
AI 就绪度

INFOBOX — REFUGE2 一屏速览

维度 内容
本质 MICCAI 2020 青光眼眼底挑战赛续作,REFUGE1 超集后继(非别名、非镜像)
全称 2nd Retinal Fundus Glaucoma Challenge(REFUGE2)
数据 2000 张彩照 = REFUGE1 全部 1200 张(转训练集)+ 新增 800 张
相机 四台:Zeiss Visucam 500 / Canon CR-2 / KOWA / TOPCON TRC-NW400
子集 Training 1200|Online 400(KOWA)|Onsite 400(TOPCON,盲测)
标签 青光眼 280 / 非青光眼 1720
任务 ①青光眼分类 ②视盘/视杯分割 ③黄斑中心凹定位(本版新增)
标注 7 名眼科医师初标(平均经验 8 年)+ 1 名资深专家复核(>10 年)
冠军 VUNO EYE TEAM(韩国 VUNO 公司);决赛 22 队,40% 来自企业
规模 1300+ 参赛者|134 队|3000+ 初赛提交
指标 分类 AUC|分割 Dice + vCDR MAE|中心凹 AED
许可 CC BY-NC-ND(禁商用禁衍生)——与 REFUGE1 的 CC BY 4.0 不同
论文 arXiv:2202.08994(v1 2022-02-18 / v3 2022-12-29,预印本)
库内互链 REFUGE(直系前作)、DRISHTI-GS、RIM-ONE、JustRAIGS、FairSeg、ADAM

REFUGE2 是一场"把眼底 AI 的相机偏见摆上手术台"的挑战赛:它不满足于 REFUGE1 用两台相机(Zeiss/Canon)制造的域偏移,而是把相机扩到四台——再加入 KOWA 与 TOPCON 各 400 张,并且把新扩充的 800 张专门拆成"初赛用的在线集"与"决赛才亮出来的盲测集"。更关键的是它设了一个 REFUGE1 没有的任务:黄斑中心凹定位(fovea localization)——要求算法在一张眼底图上同时回答"这只眼睛有没有青光眼"“视盘和视杯的边界在哪”"视网膜正中心的黄斑凹点在哪"三件事。最终的结果教科书式地残酷:在允许反复调参的在线集上,分类 AUC 轻松上 0.98;换成现场盲测集,同一个冠军模型掉到 0.883;而中心凹定位任务上,所有队伍的平均误差从在线集的 8–10 像素暴增到现场集的 20–170 像素——算法在医院里换个相机就"水土不服"的真相,被这一个数据集完整地量了出来。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——注意许可从 REFUGE1 的 CC BY 4.0 收紧为 CC BY-NC-ND,商用/衍生前务必核对,别沿旧证踩坑。
  2. 关心"它和库里的 REFUGE 是不是一回事":直奔 §3 的版本划界与 §9 的互链——REFUGE2 是 REFUGE1 的严格超集(2000 ⊃ 1200),新数据、新任务、新许可,是独立条目。
  3. 做域适应或多设备泛化:直奔 §5 与 §7——TTT/UDA 的成败对比、在线 vs 现场的成绩落差、人机对照三节连读。

§0 导读:这个数据集解决什么问题

青光眼是全球不可逆失明的首要原因。它的早期筛查高度依赖彩色眼底照片(Color Fundus Photography, CFP)上的视盘(Optic Disc, OD)与视杯(Optic Cup, OC)形态:视杯相对视盘越大,即垂直杯盘比(vertical Cup-to-Disc Ratio, vCDR)越高,越提示青光眼性视神经损害。把这件事交给 AI,看起来是图像分类加图像分割的常规组合——但真实世界有一个绕不过去的麻烦:不同品牌的眼底相机拍出来的图不一样。分辨率、视野、色调、照明、伪影各不相同,模型在一台相机上训练好,换一台就可能大幅掉分。这个现象叫域偏移(domain shift),而它正是眼底 AI 从论文走进诊室时最容易翻车的地方。

REFUGE1(2018)第一次把这件事变成了一等的评测目标:它用 Zeiss 和 Canon 两台相机分别承载训练与验证/测试,刻意制造跨设备测试。REFUGE2(2020)把这个思路推到极致——相机从两台扩到四台,而且不是简单地把图堆在一起:

  • 时间上分层:REFUGE1 的全部 1200 张(Zeiss 400 + Canon 800)被整体划入 REFUGE2 的训练集,属于"旧数据";新采集的 800 张分成 Online 集(KOWA 400,初赛在线评测、带公开标签)与 Onsite 集(TOPCON 400,决赛现场盲测、无公开标签)。
  • 任务上扩容:REFUGE1 是分类 + 分割两件事,REFUGE2 新增黄斑中心凹定位,凑成三任务——分类对应"诊断",分割对应"结构量化",定位对应"眼底解剖坐标的完整性"。
  • 评测上分权:最终排名 = 0.3×在线榜 + 0.7×现场榜,现场权重更高,因为在线集在初赛期间被反复提交调参、已经"泄漏"进了模型选择,而现场集是真正的盲测。

这三个设计让 REFUGE2 成为研究"多域学习/域适应"的宝贵样本:不只是又一个青光眼数据集,而是一套**能定量分离"模型能力"与"域适应能力"**的实验装置。其结论也足够反直觉——最会做域适应的队伍(MAI 的 Test-Time Training)在在线榜上常年第一,却在禁止更新权重的现场盲测中掉队;反而靠"多台相机数据混着训"的队伍在现场更稳。

§0 读法三则:

  1. 本条目是"挑战赛数据集 + 综述论文 + 多域评测协议"三合一:数据本体 2000 张,方法论贡献是四相机分层设计与三任务评测框架,副产品是一份人机对照(算法 vs 7 名医师)的实测账本。
  2. 全文硬数字以 arXiv:2202.08994 v3 为准,全部出自论文正文与 Table 1–9;题名跨版本改题(v2 与 v1/v3 不同)、引用数三源不一、任务头 brief 的"1200 张"错误,均已在 §10 坑点与附录存照。
  3. 检索时务必区分 REFUGE1(1200 张 / MedIA 2020 / CC BY 4.0) 与 REFUGE2(2000 张 / arXiv 2022 / CC BY-NC-ND)——两者是版本链关系,混用会同时踩到"规模错"和"许可错"两个坑。

0.4 本条目结构导航

为方便不同背景的读者,给出章节导览:

你关心什么 直接看
一句话是什么、多少张、能不能用 INFOBOX + §1(十问十答)
数据的构成、四相机、质量分层 §2(数据构成与规格)
它和库里的 REFUGE 是不是一回事 §3(版本划界)+ §9(与库内条目关系)
三个任务怎么做、谁标的 §4(任务与标注工艺)
挑战赛怎么评、排名怎么算 §5(挑战赛设计与评测协议)
许可与下载 §6(获取与许可)
谁跑得好、域适应管不管用、人机谁强 §7(基准结果与关键发现)
生态与家族谱系 §8(生态谱系与库内互链)
容易踩的坑 §10(十二个坑)
证据链、审计、复现 附录 A–V

阅读时长建议:速览 5 分钟(INFOBOX + §1);工程评估 20 分钟(§2 + §4 + §6 + §7);深度研究 40 分钟(全文 + 附录)。

§1 数据集速览:十问十答

Q1:REFUGE2 到底有多少张图?

2000 张彩色眼底照片。这不是 REFUGE1 的 1200 张,也不是 1200 加一点——而是 REFUGE1 的全部 1200 张(Zeiss 400 + Canon 800,原样复用、转为训练集)加上全新采集的 800 张(KOWA 400 + TOPCON 400)。任务头 brief 里写的"1200 张"是把 REFUGE1 的规模误当成了 REFUGE2 的规模,§10 坑 1 有完整存照。

Q2:为什么说它是"四相机"数据集?

因为四个子集分别由四台不同相机拍摄,且论文把设备型号与分辨率都写明了:

子集 相机 分辨率 张数
Training Zeiss Visucam 500 2124×2056 400
Training Canon CR-2 1634×1634 800
Online KOWA 1940×1940 400
Onsite TOPCON TRC-NW400 1848×1848 400

四台相机、四种分辨率、四种成像风格,构成天然的"多域"实验材料。

Q3:三个任务分别是什么?

①临床青光眼分类(二分类:青光眼/非青光眼);②视盘与视杯分割(输出 OD/OC 逐像素掩码,据此算 vCDR);③黄斑中心凹定位(输出黄斑中心在世界坐标 (x, y) 的像素位置)。前两项 REFUGE1 已有,第三项是 REFUGE2 新加的——论文解释加它的动机是"想看看眼底各结构之间的关系能不能帮助单一结构分析"。

Q4:标签是谁标的,可信吗?

青光眼分类标签来自临床诊断结果(不是人工看图猜的);OD/OC 掩码与中心凹坐标由 7 名独立眼科医师初标(领域平均经验 8 年,区间 5–10 年),再由 1 名经验超过 10 年的资深专家融合复核。流程沿用 REFUGE1 与 ADAM 挑战——这是 iChallenge 系列的标准做法,可参照性较强。

Q5:280 比 1720 是什么比例?

是青光眼与非青光眼的样本数。2000 张里青光眼 280 张、非青光眼 1720 张,比例约 1:6.1,高度不平衡。分到各子集:训练集 Zeiss 40/360、Canon 80/720;在线集 80/320;现场集 80/320。做分类时要特别注意类别不平衡带来的指标虚高问题。

Q6:为什么在线集和现场集的成绩差那么多?

两个原因叠加。第一,在线集在为期一个月(7 月 20 日–8 月 20 日)的初赛里被各队反复提交(每天限 5 次),队伍实际上"看着榜单调模型",在线成绩含有对测试集的过拟合;现场集是决赛当天限时 6 小时、只交一次、且禁止更新权重的纯盲测。第二,现场集用的是全新的 TOPCON 相机,与训练集(Zeiss/Canon)的域差异更大。于是分类冠军 AUC 从在线的 0.983 掉到现场的 0.883,中心凹定位误差更是成倍放大。

Q7:有没有"人机对比"?谁更准?

有,而且是本论文很有价值的一段。分割上,7 名医师人工初标的最佳成绩是 Dice_OC 0.865 / Dice_OD 0.952 / vCDR MAE 0.049,最差是 0.742 / 0.817 / 0.084——自动化的前三名全部优于最差的人工,冠军 cheeron 已接近最佳人工。中心凹定位上,人工标注的 AED 在 22.94–27.41 像素之间(均值 24.96),现场集里只有 MAI 一队(21.841 像素)击败了所有人工标注,其余队伍只是接近最差人工。结论:分割任务上算法已可比肩医师,定位任务上算法仍普遍不如医师。

Q8:论文说的"域适应"到底指什么?

主要指两类技术。一类是 Test-Time Training(TTT,测试时训练):在推理阶段用测试数据做自监督微调(MAI 队用旋转角度预测作辅助任务)。另一类是 无监督域适应(Unsupervised Domain Adaptation, UDA):让来自不同域的特征分布对齐(MAI 用对抗训练,EyeStar 用私有 SEED 数据集做分布对齐)。论文的核心发现是:域适应在"允许在线调参"时很有效,但在"权重冻结的盲测"下不如直接用多域混合数据训练来得稳。

Q9:我现在能拿到什么、怎么拿?

通过挑战赛官网 https://refuge.grand-challenge.org/Home2020/ 的下载页获取,需注册(不许匿名,联系人信息须真实完整)。许可为 CC BY-NC-ND——署名、非商业、禁止衍生。注意 Online 子集带公开标签、Onsite 子集是盲测集(公开标签标为 ×),数据集与评测框架在挑战结束后仍开放。

Q10:为什么它对 AI-Ready 重要?

它是"多域泛化"这一 AI 落地核心难题的标准化试验台:四相机、三任务、在线/现场双轨评测,把"模型换个设备还灵不灵"变成可复现、可排名、可人机对照的定量问题。对做眼科筛查、域适应、基础模型鲁棒性的人来说,它是 REFUGE1 之外更全面的一级台阶——但要记得它与 REFUGE1 有 1200 张重叠,联合训练时别重复计数。

1.11 一眼看清:REFUGE1 与 REFUGE2 的十条差异

把两版的差异一次性列全,方便对照记忆:

# 维度 REFUGE1 REFUGE2 变化性质
1 赛事 MICCAI 2018(格拉纳达) MICCAI 2020(虚拟) 换代
2 总张数 1200 2000 +800
3 相机数 2(Zeiss, Canon) 4(+KOWA, +TOPCON) +2
4 子集划分 训练/验证/测试各 400 训练 1200 / 在线 400 / 现场 400 重组
5 任务数 2(分类、分割) 3(+中心凹定位) +1
6 青光眼标签来源 临床诊断 临床诊断 一致
7 标注者 7 医师 + 1 专家 7 医师 + 1 专家 一致(沿用)
8 许可 CC BY 4.0 CC BY-NC-ND 收紧
9 论文 MedIA 2020(期刊) arXiv:2202.08994(预印本) 载体不同
10 下载 Bitbucket 镜像 官网 /Home2020/ 入口不同

这张表也回答了一个常见疑问:“既然标注者和任务有重叠,是不是一回事?”——不是。第 2、4、5、8、10 项都是实质性差异,尤其许可(第 8 项)从可商用收紧为禁商用,单这一条就足以要求独立成条、分别提示。

1.12 名词速查(初读跳转用)

简称 全称(英) 中文 首次详解处
CFP Color Fundus Photography 彩色眼底照片 §0
OD Optic Disc 视盘 §0
OC Optic Cup 视杯 §0
vCDR vertical Cup-to-Disc Ratio 垂直杯盘比 §0
AUC Area Under the Curve ROC 曲线下面积 §5.2
Dice Dice Coefficient Dice 重合系数 §5.2
MAE Mean Absolute Error 平均绝对误差 §5.2
AED Average Euclidean Distance 平均欧氏距离 §5.2
TTT Test-Time Training 测试时训练 §7.4
UDA Unsupervised Domain Adaptation 无监督域适应 §7.4
iChallenge Intelligent Challenge 智能挑战系列 §8.1

1.13 本条目的事实纪律说明

本条目所有硬数字以三源互证为准:① arXiv:2202.08994 v3 论文正文与表格;② Zenodo 挑战设计文档(DOI 10.5281/zenodo.3714947);③ IEEE DataPort 页面(DOI 10.21227/7d23-j419)。凡三源冲突或单源存疑处(如题名跨版本、17.5 GB 口径、引用数),一律在 §10 坑点与附录存照而不取单值。任务头 brief 的"1200 张"属已核实的描述错误,按实核结果(2000 张)成稿。

§2 数据构成与规格

2.1 总量与四子集结构

REFUGE2 的 2000 张彩色眼底照片不是一个大池子,而是被清晰地切成四个角色与设备各不相同的子集。理解这张表是理解后续一切评测数字的前提:

子集 采集相机 分辨率(像素) 张数 青光眼/非青光眼 公开标签 在挑战赛中的角色
Training Zeiss Visucam 500 2124×2056 400 40/360 ✓ 模型开发
Training Canon CR-2 1634×1634 800 80/720 ✓ 模型开发
Online KOWA 1940×1940 400 80/320 ✓ 初赛在线评测
Onsite TOPCON TRC-NW400 1848×1848 400 80/320 × 决赛现场盲测
合计 四台 — 2000 280/1720 — —

四点务必注意:

  1. 训练集是两种相机的混合体:400 张 Zeiss + 800 张 Canon。这 1200 张全部来自 REFUGE1——即 REFUGE1 的原始训练、验证、测试三个子集被合并后,作为 REFUGE2 的训练集整体复用(论文原文:“As these scans were previously used, we included all these scans as a training set for REFUGE2”)。因此训练集内本身就跨两台相机,天然带域偏移。
  2. 在线集与现场集各由一台新相机独占:KOWA 全部进在线集,TOPCON 全部进现场集。这是刻意设计——新相机不混入训练集,从而保证"新设备"是真正未曾见过的域。
  3. 公开标签只在 Training 与 Online:Onsite 集(400 张 TOPCON)在论文 Table 2 里公开标签标为 “×”,是纯盲测集,其标签只在决赛评测时由主办方持有。
  4. 四台相机的分辨率各不相同(2124×2056 / 1634×1634 / 1940×1940 / 1848×1848),没有统一到同一尺寸;这意味着任何直接拼接多子集的做法都要先自己统一分辨率或做尺度归一。

2.2 与 REFUGE1 的数量关系(超集证明)

把两版摊开对照,REFUGE2 的构成一目了然:

版本 相机数 总张数 青光眼/非青光眼 子集划分 任务数
REFUGE1(2018) 2(Zeiss, Canon) 1200 120/1080 训练 400 + 验证 400 + 测试 400 2(分类、分割)
REFUGE2(2020) 4(+KOWA, +TOPCON) 2000 280/1720 训练 1200 + 在线 400 + 现场 400 3(+中心凹定位)

论文 Table 1 的行对行对照印证了这一点:REFUGE1 行写 “Zeiss, Canon / 120 青光眼 / 1080 非 / 1200 总”,REFUGE2 行写 “Canon, Zeiss, TOPCON, KOWA / 280 / 1720 / 2000”。注意两版的设备列顺序不同(REFUGE1 是 Zeiss,Canon;REFUGE2 是 Canon,Zeiss,TOPCON,KOWA),仅是列表习惯,不影响实质。

用集合语言说:REFUGE2 的图像集合 = REFUGE1 的 1200 张 ∪ 新采 800 张,且两者不交(复用的是"原图"而非"重新拍摄")。所以 REFUGE2 是 REFUGE1 的严格超集:2000 ⊃ 1200。这正是判定它是"版本后继"而非"别名/镜像"的核心依据——别名意味着两名字指向同一集合,镜像指子集,而这里是反过来的包含关系,且新增部分有独立价值(新相机、新任务)。

2.3 图像规格与采集规范

  • 格式:JPG,每颜色通道 8 bit(论文原文 “stored in JPG format, 8 bits per color channel”)。
  • 采集环境:标准化暗室,由具备至少 5 年采集经验的眼科医师与技术员完成。
  • 拍摄中心:三种取景方式并存——以视盘区为中心、以黄斑区为中心、或以视盘与黄斑的中点(两者同时可见)为中心。论文强调这三种"高度贴近临床实际拍摄场景",因为真实门诊不会为算法统一取景。
  • 样本来源:从青光眼与近视研究队列中随机抽取;若图像质量合格,同一患者的左右眼均可纳入(因此存在同患者双眼同时出现在数据集中的情况)。
  • 隐私:每张图像的个人身份信息(personal information)已被移除。

2.4 图像质量分层(onsite 集实测)

论文对现场集(400 张 TOPCON)按 Fu et al. 2019 的眼底质量评估方法做了分层,该方法考察四个质量指标:模糊(blurring)、光照不均(uneven illumination)、低对比(low-contrast)、伪迹(artifacts):

质量档 张数 占比
good(良好) 267 66.75%
usable(可用) 57 14.25%
reject(废弃) 76 19.00%
合计 400 100%

关键细节:在该方法里,只要视盘或黄斑区质量低就算 reject,所以被判 reject 的图上,问题往往出在黄斑区(模糊、看不清、有伪迹),而视盘区可能仍然清晰。论文正是因此把这些图保留在数据集里——因为临床筛查中这类图确实会出现。这一分层设计也让论文能做一个额外实验:观察各任务成绩随图像质量变化(详见 §7)。

2.5 标签与任务输出形态

每张图对应的监督信号按任务分三种:

任务 输出形态 来源
青光眼分类 二值标签(青光眼/非青光眼) 临床诊断结果
视盘/视杯分割 OD、OC 逐像素掩码(binary mask) 7 名眼科医师初标 + 1 名资深专家复核
黄斑中心凹定位 中心凹坐标 (x, y) 同上

论文对分类标签的来源特别说明:“The reference standard for glaucoma classification was obtained from clinical diagnosis results”——即分类金标准不是"看图判定",而是临床确诊结论,这类标签的可信度高于纯图片判读。

2.6 数据规模的一个待核疑点

检索中,Zenodo 记录页(DOI 10.5281/zenodo.3714947,即 REFUGE2 挑战设计文档页)展示了一个 “Data volume 17.5 GB” 的字段。需要谨慎:该字段出现在 Zenodo 记录页的统计展示语境里,无法确证它就是 REFUGE2 数据集本体的体积(Zenodo 页面的 “Data volume” 常被用作记录/下载浏览的展示统计而非数据包大小)。论文本身并未给出统一的 GB 数。因此本条目不把 17.5 GB 写作数据大小,仅在 §10 坑点与附录存照,待有权威口径再补。这也是"三源互证"纪律发挥作用的一处:单看一个数字会误报,交叉比对才看出它口径不明。

2.7 域偏移的量化证据:t-SNE 与像素统计

论文用两种方式可视化并量化了四台相机的域差异,这是 REFUGE2 科学价值的直接支撑:

  1. t-SNE 降维可视化:论文对 2000 张图像做了 t-分布随机邻域嵌入(t-SNE,用 scikit-learn 实现)。在嵌入图上,四台相机的图像各自聚成四个明显分离的簇(Zeiss 红、Canon 蓝、KOWA 绿、TOPCON 紫),尤其 800 张 Canon 训练图与 KOWA/TOPCON 的在线/现场图落在明显不同的区域。这直观说明:不同设备采集的图像在特征空间里"长得不一样",模型若只在训练域上学,到了新域就会失效。

  2. RGB 像素统计:论文还统计了 Zeiss、Canon、KOWA、TOPCON 四个子集在 RGB 三通道上的均值与标准差(论文 Table 4),发现不同设备采集的数据存在明显色偏(color deviation)。这为"域偏移不仅有几何/分辨率来源,还有色彩来源"提供了定量证据——也解释了为什么很多队伍要做颜色归一化或染色归一化之类的预处理。

  3. OD/OC 面积占比:同一张表还给出各子集中视盘、视杯占视场(field-of-view)面积的百分比,以及 OD、OC、中心凹区域的像素值——这些是理解"同一解剖结构在不同设备上占多大、多亮"的量化基线。

这三类证据合起来回答了"为什么 REFUGE2 称为多域数据集":不是简单把四台相机的图放到一起,而是用可视化与统计证明它们确实构成了分布不同的四个域。

2.8 采集场景的临床真实性

REFUGE2 的取景设计刻意贴近真实门诊,这在多域研究里很重要:

  • 三种取景并存(视盘居中 / 黄斑居中 / 两者中点)意味着中心凹不一定在图中央、甚至可能靠近边缘——这直接提高了中心凹定位任务的难度,也更真实。
  • 左右眼均纳入(质量合格时),意味着图像里有左眼和右眼两种解剖朝向,模型不能假设"视盘总在同一侧"。
  • 暗室标准化采集降低了照明变量,但四台相机的光学系统差异仍然存在,构成了"控制了一部分变量、仅保留设备变量"的相对干净的域偏移实验。
  • 从青光眼与近视研究队列随机抽取意味着样本带有队列特征(例如近视人群的眼底形态),不是纯筛查人群——使用时应把这一点纳入对分布的代表性判断。

2.9 数据集的"多标注、多画质、多设备"三重定位

论文用三个"多"来概括 REFUGE2 的卖点,逐个拆解其对使用者的含义:

“多” 含义 对使用者的价值 注意事项
多标注(multi-annotation) 同批图同时具备分类、OD/OC 分割、中心凹三类标注 一张图可同时训练/评测三任务,支持多任务学习 非"多人重复标注",标注人数为 7 医师 + 1 专家
多画质(multi-quality) 保留 good/usable/reject 各质量档 可做质量分层鲁棒性研究 各质量档分布不均(267/57/76),分层结论提示性
多设备(multi-device) 四台相机、训练测试不重叠 天然的域泛化/域适应试验台 设备与子集一一对应,评测增益可能部分来自设备差异

这一定位是 REFUGE2 区别于其他眼底集的核心:多数集只满足其中一到两个"多",而 REFUGE2 三者兼备。

2.10 与 REFUGE1 在"标注工艺"上的连续性

值得强调:REFUGE2 的训练集(即 REFUGE1 的 1200 张)其标注是REFUGE1 时代完成的,而新增 800 张的标注沿用同一流程(7 医师 + 1 专家)。这意味着:

  • 好处:全 2000 张的标注标准一致,可当同一数据集使用,不会出现"旧图新图标注风格割裂"。
  • 注意:训练集的标注质量受 REFUGE1 时代工艺约束;若对标签精度有极高要求,需了解 REFUGE1 的原始标注细节(见库内 refuge(62) 条目)。

这种"新旧数据、同一标注流程"的连续性,是 REFUGE2 能作为完整数据集而非"拼接集"的前提。

2.11 数据字典(DAIMS 视角的字段清单)

按 DAIMS(Data & Analytics Interoperability Maturity)关注的字段视角,把 REFUGE2 每例(图像级)可用的字段整理如下:

字段 类型 取值/范围 是否公开 说明
image_id / 文件名 字符串 — 公开 图像唯一标识
image 图像 JPG,8 bit/通道 公开 彩色眼底照片
resolution 元组 2124×2056 / 1634×1634 / 1940×1940 / 1848×1848 公开 随子集固定
device 枚举 Zeiss / Canon / KOWA / TOPCON 公开 采集机型
subset 枚举 Training / Online / Onsite 公开 所属子集
glaucoma_label 二值 0=非青光眼 / 1=青光眼 Training+Online 公开 临床诊断
OD_mask 二值掩码 0/1 Training+Online 公开 视盘逐像素
OC_mask 二值掩码 0/1 Training+Online 公开 视杯逐像素
fovea_coord 坐标 (x, y) 像素 Training+Online 公开 黄斑中心凹
vCDR 派生 由 OD/OC 掩码计算 可由公开掩码派生 垂直杯盘比
quality 枚举 good / usable / reject 论文仅给 onsite 统计 图像质量档
patient_id — 未披露 不公开 论文未提供患者级信息

关键提示:patient_id 一行是空的——论文明确缺失患者级人口学信息(§9 遗留疑点)。若你的研究需要患者级分析(如按年龄/性别分层),REFUGE2 不满足;它更适合"图像级"的任务与评测。

2.12 从 REFUGE1 到 REFUGE2 的数据增量解剖

把"新增了什么"算清楚,是理解 REFUGE2 科学贡献的关键。增量不是"2000 − 1200 = 800 张图"这么简单,而是数据 + 设备 + 任务 + 协议的四重增量:

增量维度 REFUGE1 REFUGE2 新增 增量性质
图像 1200 +800(KOWA 400 + TOPCON 400) 数量 +67%
设备 2 台 +2 台(KOWA、TOPCON) 设备数翻倍
任务 2 个 +1 个(中心凹定位) 任务 +50%
评测协议 单轨(测试集) +在线/现场双轨 + 权重冻结规则 协议升级
标注流程 7+1 沿用 7+1 无变化(连续性)
许可 CC BY 4.0 CC BY-NC-ND 收紧

四个维度里,设备增量与协议增量是最有价值的:单看图像数量(+800)只是规模增长,但把这 800 张分散到"两台新相机 + 在线/现场双轨",就把它变成了一个能分离"域偏移"与"泛化能力"的实验装置。这也是为什么 REFUGE2 值得独立成条——它的增量不是量的,而是质的。

§3 与 REFUGE1 的版本划界(为什么这是独立条目)

3.1 库内已有条目是什么

千方病案医数集库内已有 refuge(record_id 62),标题《REFUGE 青光眼眼底影像数据集》。从该条目已发布内容看,它的主体是 REFUGE1:

  • 样本总数栏:既写 “1,200 张彩色眼底照片(REFUGE1)”,也顺带写明 “2,000 张(REFUGE2)”——这意味着旧条目知道 REFUGE2 存在,但并未为它单独展开。
  • 别名栏:REFUGE1、REFUGE Challenge、iChallenge-REFUGE。
  • 首发日期:2018-09(MICCAI 2018,西班牙格拉纳达)。
  • 论文:Orlando et al., Medical Image Analysis 2020, doi:10.1016/j.media.2019.101570。
  • 许可:CC BY 4.0。
  • 下载:Bitbucket 公开镜像。

换句话说,库内那条是"REFUGE(v1) 为主体、附带预告了 v2"的条目,而不是 REFUGE2 的条目。

3.2 REFUGE2 的独立身份四要件

判定一个数据集是否值得单独成条,本库的标准是看它是否有独立发布 + 独立身份 + 净新增内容。REFUGE2 四项全中:

  1. 独立事件:REFUGE2 是 MICCAI 2020 的独立挑战赛(与第 8 届 OMIA 研讨会联办的半天赛事),与 REFUGE1 的 MICCAI 2018(格拉纳达)是两场不同的比赛。
  2. 独立数据发布:2000 张数据经挑战赛官网 Home2020/ 页面独立发布,与 REFUGE1 的下载页(Bitbucket 镜像)分离。
  3. 独立论文:arXiv:2202.08994,28 位作者,综述 10 支队伍方法 + 三任务评测框架 + 多域分析——内容远超 REFUGE1 的论文范畴。
  4. 净新增内容:800 张新采集图像(KOWA 400 + TOPCON 400)+ 黄斑中心凹定位新任务 + 四相机多域设计,以及与之配套的在线/现场双轨评测——这些在 REFUGE1 中完全不存在。

3.3 与库内同类"版本后继"先例的一致性

本库已接受多个"版本后继"型独立条目,例如 mimic-cxr-jpg-2.0(617)、chestx-det10(137) 这类在旧版基础上推出新版本的条目。REFUGE2 与该模式完全同构:旧版数据整体复用 + 新增数据/任务/协议 + 独立论文与许可。因此 REFUGE2 独立成条符合库内既有惯例。

3.4 划界结论与使用提醒

结论:REFUGE2 是 REFUGE1 的合法版本后继,独立成条,不与 refuge(62) 撞库。 但正因为是父子关系,使用时有三个必须记住的边界:

  • 数量边界:REFUGE2 的 2000 张里含 REFUGE1 的 1200 张。若把两版数据合并训练,务必去重,否则 1200 张会被计两遍(训练集内重复 60%)。
  • 许可边界:REFUGE1 = CC BY 4.0(可商用、可衍生);REFUGE2 = CC BY-NC-ND(禁商用、禁衍生)。两者不通用,以 REFUGE2 为主体做产品时必须遵守更严的 NC-ND。
  • 身份边界:引用规范上,若用到那 1200 张原图,图像来源应同时引 REFUGE1(Orlando et al. 2020);用到 800 张新图、三任务评测框架、多域结论时引 REFUGE2(Fang et al. 2022)。混引会掩盖数据的真实血统。

3.5 查重的可复核证据

本条目的 slug 查重与撞库判定过程可复核:

查询 1(slug 查重):
  SELECT record_id,url_name FROM ai_ready_dataset
  WHERE status=1 AND url_name ILIKE '%refuge%';
  结果 → refuge(62),无 refuge2

查询 2(目录查重):
  ls writing/  → 无 refuge2 目录(开工前)

查询 3(房内已有眼底条目):
  refuge(62)、messidor(59)、ddr(201)、idrid(191)、rfmid(271)、odir(63)、
  eyepacs(58)、deepdrid(211)、justraigs(746)、drishti-gs(301)、
  rim-one(291)、drive(241)、hrf(261)、palm(281)、fairseg(371) 等
  → 均与本条 slug 不冲突

3.6 边界判定决策表

把"是否独立成条"的判断依据逐条打分,便于复核:

判据 别名? 子集/镜像? 独立版本后继? REFUGE2 实际
名字是否指向同一集合 是 否 否 否(2000 张≠1200 张)
是否含旧版全部数据 — 子集(少) 超集(多) 超集(含 1200)
是否有独立发布入口 否 否 是 是(/Home2020/)
是否有独立论文 否 否 是 是(arXiv:2202.08994)
是否有净新增数据 否 否 是 是(800 张新相机)
是否有独立许可 否 否 视情况 是(CC BY-NC-ND)
结论 改道 合并/改道 独立成条 独立成条

据此,REFUGE2 与库内 refuge(62) 的关系判定为"独立版本后继",不属于任务头提醒的"同一物 / 子集 / 镜像"三种需改道的情形。

§4 三大任务与标注工艺

4.1 任务全景:从"两个问题"到"三个问题"

REFUGE1 让算法回答两个问题(有没有青光眼、视盘视杯在哪);REFUGE2 加了第三个问题(黄斑中心凹在哪),并把三者打包成一场统一的挑战赛。三个任务在计算机视觉上恰好覆盖三类经典问题,在临床上又恰好覆盖青光眼诊断的主要环节:

任务 计算机视觉任务类型 临床对应 输出 评测指标
Task 1 青光眼分类 图像二分类 诊断:是否青光眼 概率/标签 AUC
Task 2 视盘/视杯分割 语义分割 结构量化:算 vCDR OD/OC 掩码 Dice(OD、OC 各一)+ vCDR MAE
Task 3 黄斑中心凹定位 关键点定位/回归 眼底解剖坐标完整性 (x, y) 坐标 AED

论文对这个"三任务"设计的解释是:分割任务延续 REFUGE1(因为青光眼对视盘区影响显著),分类任务延续 REFUGE1,而中心凹定位是新增的——动机是"想探索眼底各结构之间的关系是否能帮助单一结构的分析"(例如中心凹与视盘的空间关系可作为定位先验)。

4.2 标注流水线:7 名医师 + 1 名资深专家

REFUGE2 的金标准生成沿用了 REFUGE1 和 ADAM 挑战的两阶段人标注流程:

  1. 初标(7 名独立眼科医师):OD/OC 的逐像素掩码与黄斑中心凹定位由 7 名眼科医师分别独立勾画。这 7 人的平均领域经验为 8 年,区间 5–10 年。
  2. 融合与复核(1 名资深专家):7 份初标由 1 名经验超过 10 年的资深专家融合(fuse)并复核(check),形成最终金标准。

其中青光眼分类标签另有来源:来自临床诊断结果,而非人工看图判定。这一点在解读分类任务的 AUC 时很重要——它意味着分类金标准绑定的是真实临床结论,因此对"模型是否学到了与临床一致的判据"有更强的参考意义。

4.3 标注为多任务、多医师的融合产物意味着什么

  • 多医师初标的方差是可利用的信息:论文在后文用"人工初标之间的差异"做了人机对照(§7.3)。7 名医师各自独立勾画,天然给出了"人工性能的上下界",这让 REFUGE2 不仅能回答"算法准不准",还能回答"算法比起医师如何"。
  • 融合步骤降低了单人偏差:单一医师的勾画风格(偏大/偏小、对模糊边界的处理)会被融合与复核环节部分抹平,最终掩码更接近"共识"而非"某人风格"。
  • 分类标签与分割标签的独立性:分类来自临床、分割来自医师勾画,两者不完全耦合——临床上诊断青光眼不完全等同于 vCDR 超阈值(见 §7.2 的 vCDR 基线讨论),所以分类任务并非"从分割结果直接推标签"的简化题。

4.4 三任务的标准做法(论文观察到的队伍模式)

论文综述了各队在三个任务上的主流技术路线,可作为"这个数据集上什么方法管用"的快速参考:

Task 1 分类:7 支被综述队伍里,2 队用整图(VUNO、EyeStar)、5 队用视盘局部裁剪块,还有 1 队(MIG)两者并用。骨干网络集中在 EfficientNet、ResNet 及其变体、VGGNet、DenseNet。之所以多数队伍盯视盘局部,是因为青光眼的形态学征象(vCDR 扩大、视盘出血、视神经缘切迹等)集中在视盘区。

Task 2 分割:分两大类——直接分割(VUNO 一队直接出 OD/OC)与由粗到细分割(其余 5 队先粗定位视盘区、再细分割 OD/OC,因为 OD/OC 在全图中占比很小)。基础模型多为 U-Net,也有 Deeplabv3、PSPNet;编码器多换 ResNet 或 EfficientNet。

Task 3 中心凹定位:除 cheeron 一队用 YOLOv5 目标检测外,其余队伍都把定位当作回归来做——用 U-Net 或 HRNet 预测距离图/热图/偏移图。这是把通用 CV 方法迁移到医学场景的典型案例。

4.5 先验知识的价值

论文特别指出"临床先验知识"在本挑战中带来的增益:VUNO 在分割和定位任务中利用了视盘-血管、中心凹-血管的解剖关系;MIG 在定位任务中利用中心凹与视盘的关系(设计 Bi-Distance map);VUNO 在分类任务中还用了带病灶标签的私有数据集来强化特征(如视盘出血、视网膜神经纤维层缺损、青光眼性视盘改变等)。论文的结论是:临床先验知识对计算机辅助诊断有重要意义——这是数据集之外的一条方法论收获。

4.6 为什么"中心凹定位"比"分割"更难

论文的人机对照数据(见 §7.3)直接暴露了任务难度的差异,值得单列分析:

  • 结构可见性不同:视盘和视杯是有明确边界的圆盘状结构(视杯是视盘内更亮的凹陷区),边界可辨、面积较大,分割模型容易学;而中心凹只是一个点(视网膜最敏锐处的最暗点),周围没有锐利边界,且在低质量图上极易丢失。
  • 空间先验的强度不同:视盘位置相对固定(约在图像某个方位),模型容易借位置的先验;中心凹位置随取景变化(可能居边),先验更弱——所以论文里聪明的队伍(VUNO、MIG、EyeStar)都强行引入"中心凹-视盘/血管"的解剖关系来补强。
  • 指标敏感性不同:分割用 Dice(对边界小幅误差有平滑),定位用 AED(直接是距离,一个小偏差就线性放大)——所以定位的成绩看起来"更脆"。

工程含义:中心凹定位需要更大规模的多样化数据与更强的先验设计——这也是为什么现场集里只有 MAI 一队跑赢人工。对应用落地的提示:若目标是辅助定位黄斑(例如评估黄斑水肿、指导激光治疗),不要把 REFUGE2 的定位成绩简单外推到你的相机上。

4.7 分类任务为什么不能"绕道 vCDR"

很多人会想:既然分割能算 vCDR,而 vCDR 是青光眼关键指标,那能不能"先分割、再按 vCDR 阈值分类"来省掉分类模型?REFUGE2 的数据给了否定答案(§7.8):金标准 vCDR 直接分类的 AUC 低于所有深度学习分类队。原因是青光眼与 vCDR 之间存在双向不一致——有"视杯不扩大的青光眼",也有"生理性大视杯的正常眼"。因此分类任务必须作为独立任务存在,学习比 vCDR 阈值更丰富的征象(视盘出血、神经纤维层缺损、视神经缘切迹等)。这是 REFUGE2 把分类与分割并列的意义所在。

§5 挑战赛设计与评测协议

5.1 两阶段赛制:在线初赛 + 现场决赛

REFUGE2 采用初赛(preliminary round,在线)与决赛(final round,原定现场)两阶段:

  • 初赛(2020-07-20 至 08-20):主办方发布训练集与在线集,各队对在线集提交预测结果,由在线评测平台打分。每天限提交 5 次,榜单每日 19:00(太平洋时间)更新,且只保留最新一次提交的成绩(旧成绩被覆盖)。这一机制意味着在线集实质上参与了模型选择。
  • 决赛:原定 MICCAI 2020 现场进行,因疫情改为线上——主办方通过互联网把 onsite 集发给各决赛队,队伍有 6 小时完成预测,只有一次提交机会,主办方离线评测。现场集是纯盲测集,最能反映泛化能力。

5.2 评测指标

三个任务各有主指标:

任务 主指标 辅助指标 说明
Task 1 AUC 95% CI(DeLong 法) 分类判别力,与阈值无关
Task 2 OD Dice、OC Dice vCDR MAE Dice 衡量掩码重合度;vCDR MAE 衡量"用分割结果算出的 vCDR 与金标准 vCDR 的误差"
Task 3 AED(像素) 95% CI 平均欧氏距离,越小越好

Task 2 特意加入 vCDR MAE,是因为分割视盘/视杯的临床目的之一就是计算 vCDR——论文原文点明"vCDR 的计算正是 OD/OC 分割的目的之一",所以直接在 vCDR 层面评价分割效果比只看 Dice 更贴近临床。

5.3 排名规则(三层加权)

REFUGE2 的排名不是简单加总,而是一套分层加权:

第一层(Task 2 内部):每队在分割任务上得到三个单独排名——R_disc(视盘 Dice 排名)、R_cup(视杯 Dice 排名)、R_vCDR(vCDR MAE 排名),三者相加得 R_total = R_disc + R_cup + R_vCDR,R_total 越小排名越高。

第二层(三任务综合):

R = 0.45 × R_cls + 0.45 × R_seg + 0.1 × R_loc

分类与分割各占 45%,定位仅占 10%——论文解释是因为分类与分割对青光眼评估临床相关性更高。出现平局时,以分类任务排名优先。

第三层(在线×现场合成):

R_final = 0.3 × R_online + 0.7 × R_onsite

现场权重更高(0.7),因为在线集参与了各队的方法调优,而现场集是纯盲测,更能体现泛化能力——这也是其他 iChallenge 系列(ADAM、PALM、AGE)的通行做法。

5.4 参赛规模与冠军

  • 1300+ 国际参赛者;
  • 134 支队伍提交了 3000+ 份有效初赛结果;
  • 22 支队伍晋级决赛,其中 40% 来自企业;
  • 最终冠军为韩国公司 VUNO 的 VUNO EYE TEAM,亚军与季军由深圳大学与腾讯的联合队伍(论文正文提及"深圳大学与腾讯联合获第二、第三名")等取得。

5.5 为什么这套协议值得研究

REFUGE2 的协议设计把"域泛化"从口号变成了可测的量:

  1. 新设备即新域:Online(KOWA)与 Onsite(TOPCON)两台相机都未进入训练集,因此它们对模型而言是"没见过的医院/设备"。
  2. 在线与现场分离:在线集成绩含调参红利,现场集成绩是盲测——两者的落差本身就是"过拟合到测试域"的度量。
  3. 允许在线的域适应 vs 禁止现场的权重更新:决赛规则约束了权重冻结,于是"测试时训练"这类方法在现场会失效——论文正是借此揭示 TTT 的边界(见 §7.4)。

5.6 评测协议与其他 iChallenge 的异同

REFUGE2 的评测协议与同系列其他挑战共享一套骨架,但有自己的取舍:

协议要素 REFUGE1 REFUGE2 ADAM/PALM/AGE
在线评测 有 有 有
现场/盲测 有(测试集 400) 有(onsite 400) 视挑战而定
分类指标 AUC AUC 多为 AUC
分割指标 Dice Dice + vCDR MAE Dice(可能加 MAE)
定位指标 中心凹(辅助) AED(正式任务) 视任务
多设备设计 2 机刻意分离 4 机、训练测试不重叠 —
综合权重 — 0.45/0.45/0.1 —
在线×现场权重 — 0.3/0.7 同类做法

论文明确 REFUGE2"三任务的评测方式与其在 REFUGE1 和 ADAM 中的对应任务一致"——这种指标对齐让不同挑战的结果可以横向比较,是 iChallenge 系列的一大优点。

5.7 为什么"每天限 5 次提交"和"只留最新成绩"重要

这两个规则看似琐碎,实则改变了方法的性质:

  • 限 5 次/天:抑制"暴力搜索测试集"(无限制提交下,队伍可以反复试探直到过拟合测试集)。但仍然给了足够次数做正常调参。
  • 只留最新成绩:意味着队伍不能"保留历史最优提交",必须接受最新一次的结果——这进一步抑制了"广撒网碰运气",迫使队伍对提交负责。
  • 现场仅 1 次提交:彻底切断试错,逼出真实泛化能力。

三者叠加,使在线榜"含调参红利"、现场榜"纯盲测"的区分成立,也让 R_final = 0.3×在线 + 0.7×现场 的加权有了依据。对研究者的启示:若要引用 REFUGE2 的分数,必须先问清是在线还是现场——两者不可互换。

5.8 挑战赛设计对"可复现性"的贡献

REFUGE2 的赛制还有一个常被忽视的价值——它把评测做成了可复现的公开流程:

  • 在线平台常驻:挑战结束后网站仍开放,任何后来的研究者都能提交结果、拿到与当年队伍可比的分数,不必自建评测。
  • 盲测集受控:onsite 集标签不公开,避免了"看到答案再调参"的污染;后来的评测者拿到的分数与当年决赛同标准。
  • 指标与规则文档化:三任务指标、三层排名公式(0.45/0.45/0.1 与 0.3/0.7)都写在论文里,任何人可复算榜单。
  • 数据版本清晰:2000 张、四子集、固定分辨率,下载即可复现,不像某些挑战赛的数据随批次漂移。

对 AI-Ready 的意义:一个数据集能否被反复、公平地用于评测,取决于它的评测是否"可复现"。REFUGE2 在这方面做得较好——这也是它虽为预印本却仍被域适应研究反复使用的原因之一。

§6 获取与许可

6.1 许可:CC BY-NC-ND(重点警示)

REFUGE2 数据的许可为 CC BY-NC-ND,即 Attribution–NonCommercial–NoDerivatives(署名—非商业性使用—禁止演绎)。论文原文明确:“The dataset is publicly available through the download page of the challenge website and is permitted to be used under the CC BY-NC-ND license.”

三条约束逐字拆解:

  • BY(署名):使用时须标注来源(REFUGE2 挑战赛 / Zhongshan Ophthalmic Center / 论文)。
  • NC(非商业):不得用于商业目的。任何把基于本数据训练/微调的模型商品化的行为都需另行取得授权。
  • ND(禁止演绎):不得分发改编版本。若要发布"本数据的再标注版/子集/衍生集",在 ND 下是不允许的——这与 REFUGE1 的 CC BY 4.0(允许衍生)形成关键区别。

再次强调跨版差异:库内 refuge(62) 记录的 REFUGE1 许可是 CC BY 4.0(可商用、可衍生)。REFUGE2 收紧为 CC BY-NC-ND。若有人凭 REFUGE1 的印象去用 REFUGE2,会同时违反 NC 与 ND 两条——这是本条目反复提醒的核心坑点(§10 坑 4)。

6.2 获取方式

  • 官方入口:挑战赛官网 https://refuge.grand-challenge.org/,REFUGE2 专属路径为 /Home2020/。论文明确数据与评测框架在挑战结束后仍公开可获取,未来参与者仍可下载数据、在官网提交结果做基准。
  • 注册要求:需注册且不许匿名——注册时联系人真实姓名、单位全称(含院系/机构/公司全称与国家)、邮箱必须完整正确,不允许缩写;信息不全或重复注册会被直接移除。REFUGE2 与 REFUGE 共用同一注册。
  • 编码文档:挑战设计文档存于 Zenodo,DOI 10.5281/zenodo.3714947(2020-03-18 发布,PDF 6.9 MB,许可 CC BY-ND 4.0)。
  • 论文副本:arXiv:2202.08994(预印本);另有 IEEE DataPort 题录副本 DOI 10.21227/7d23-j419。

6.3 数据获取决策树

你要做什么?
├── 训练/评测青光眼分类、视盘视杯分割、中心凹定位
│   └── 官网 /Home2020/ 注册下载(CC BY-NC-ND,非商用,勿再分发衍生版)
├── 研究域适应 / 多设备泛化
│   ├── 用训练集(Zeiss+Canon)当源域
│   ├── 用 Online(KOWA)当验证域(有公开标签)
│   └── 用 Onsite(TOPCON)当盲测域(需按挑战赛流程评测,无公开标签)
├── 只想引用"人机对照"或"域适应有效性"结论
│   └── 引论文 Table 6-9 + §5 Discussion,注明 arXiv 预印本
├── 想与 REFUGE1 联合训练
│   └── 先去掉 1200 张重叠(Zeiss 400 + Canon 800),避免重复计数
└── 想商用/做产品
    └── CC BY-NC-ND 不允许——需另行联系主办方取得授权

6.4 相关数据源的对照坐标

论文 Table 1 把 REFUGE2 放在同期眼底数据集谱系里做了横向对照,其中几个关键同类(供选址参考):

数据集 相机 青光眼/非青光眼 总量 分类 分割 中心凹
REFUGE1 Zeiss, Canon 120/1080 1200 ✓ ✓ ✓
REFUGE2 四台 280/1720 2000 ✓ ✓ ✓
DRISHTI-GS — 70/31 101 ✓ ✓ ×
ORIGA Canon 168/482 650 ✓ ✓ ×
RIM-ONE Canon 74/85 169 ✓ ✓ ×
IDRiD KOWA 0/516 516 × ✓ ✓
MESSIDOR TOPCON — 1200 ✓ × ×
SCES Canon 46/1630 1676 ✓ × ×

论文据此指出既有数据集三大不足:样本少、设备信息缺失或单一、三任务标注不能同时具备——而 REFUGE2 的定位正是"首个四设备、且同时提供分类+分割+中心凹三任务标注的公开 CFP 数据集"。

6.5 挑战赛完整时间线

把 IEEE DataPort 会议页与论文的赛程记录合并,REFUGE2 的生命周期如下:

时间 事件
2020-03-15 REFUGE2 开放(挑战赛公告)
2020-03-18 挑战设计文档发布至 Zenodo(DOI 10.5281/zenodo.3714947)
2020-06-10 注册开启(REFUGE 老注册可复用)
2020-07-01 CMT 队伍注册开启
2020-07-20 验证/在线集发布;提交与在线评测开放
2020-07-20 至 08-20 初赛(preliminary round,每日限 5 次提交,榜单 19:00 PST 更新)
2020-08-07 决赛重要通知(要求决赛队员注册 MICCAI 卫星活动)
2020-08-20 初赛截止;22 队晋级决赛
2020-10-08 决赛(原定 MICCAI 2020 现场,因疫情改线上;限时 6 小时、单次提交)
2022-02-18 论文 v1 上传 arXiv(arXiv:2202.08994)
2022-12-29 论文 v3 定稿(现行版本)

这张时间线说明:数据发布(2020)早于论文发表(2022)近两年——数据先经挑战赛流通,论文后来才系统复盘。因此"引用数据"与"引用论文"是两个时点的动作,引用年份口径要分清。

6.6 参赛队伍一览(论文综述范围)

论文明确综述了每任务排名前 10 中的若干队伍,并对进入半决赛表现较好的三支队伍一并总结。被点名队伍及其在论文中的角色:

队伍 论文提及的任务 备注
VUNO EYE TEAM 分类 1 / 分割 3 / 定位 3 韩国 VUNO 公司;分类与总体冠军
MAI 分类 3 / 分割 1(在线)/ 定位 1 用 TTT + UDA,在线榜三任务常居首
cheeron 分类 4 / 分割 1(现场)/ 定位 3 现场分割反超居首
MIG 分类 2 / 分割 / 定位 用多域额外数据(含 Topcon 样本)
EyeStar 分类 7 / 分割 / 定位 用私有 SEED 数据集做域适应
MIAG ULL 分类 5 / 分割 / 定位 用 PSPNet,考虑 OD-中心凹关系
ALISR 分类 6 / 定位 用 CSPNet 降算力
Pami-G / CBMIBrand / TeamTiger 半决赛表现较好 论文附录有方法描述

需要注意:论文自己说明,每任务前 10 中剩余队伍放弃了参与本文综述,故这不是完整榜单,只是论文作者选择复盘的队伍集。

§7 基准结果与关键发现

本章复述论文 Table 6–9 与 §5 Discussion 的核心数字。所有成绩均分"在线(Online, KOWA)"与"现场(Onsite, TOPCON)"两栏——请牢记:在线成绩含调参红利,现场成绩才是盲测。

7.1 Task 1 青光眼分类:AUC 的在线—现场落差

论文 Table 6 给出 7 支被综述队伍的分类 AUC:

队伍 在线 AUC(95% CI) 现场 AUC(95% CI) 现场排名
VUNO EYE TEAM 0.983(0.972–0.991) 0.883(0.844–0.919) 1
MIG 0.943(0.916–0.963) 0.876(0.832–0.916) 2
MAI 0.984(0.974–0.993) 0.861(0.816–0.904) 3
cheeron 0.980(0.970–0.988) 0.856(0.811–0.900) 4
MIAG ULL 0.939(0.912–0.960) 0.847(0.798–0.893) 5
ALISR 0.947(0.924–0.966) 0.844(0.796–0.882) 6
EyeStar 0.944(0.915–0.969) 0.820(0.766–0.868) 7
vCDR 基线 0.8817(0.840–0.917) 0.7571(0.693–0.815) —

四个观察:

  1. 在线集体虚高:在线集上 7 队 AUC 全部超过 0.93,前三队(MAI 0.984、VUNO 0.983、cheeron 0.980)用 DeLong 检验两两差异不显著(MAI vs VUNO p=0.974;MAI vs cheeron p=0.850)——即在线榜的名次有相当大的偶然性。
  2. 现场集体跳水:现场集最高的是 VUNO 的 0.883,比其在线成绩低约 0.10。论文给出两条原因:在线集被反复调参、现场集青光眼样本特征偏离在线集。
  3. vCDR 基线被深度学习全面超越:直接用金标准 vCDR 值做青光眼判别,在线 0.8817、现场 0.7571,低于所有深度学习队伍,且统计显著(在线 p=1.478×10⁻⁵,现场 p=1.438×10⁻⁵)。论文据此提出:vCDR 单独不足以为青光眼自动判别提供依据——因为存在"视杯不扩大的青光眼"与"生理性大视杯的正常眼"。
  4. 现场名次重排:在线榜第 3 的 VUNO 到现场升到第 1,个中原因与"多域训练数据/更多先验"有关(见 §7.4)。

7.2 Task 2 视盘/视杯分割:Dice 与 vCDR MAE

在线集(Table 7),按 OD Dice 看:

队伍 OC Dice OD Dice vCDR MAE
MAI 0.880(0.873–0.888) 0.966(0.965–0.968) 0.037(0.033–0.040)
cheeron 0.874(0.866–0.882) 0.965(0.963–0.967) 0.038(0.035–0.042)
VUNO EYE TEAM 0.870(0.862–0.877) 0.966(0.964–0.968) 0.040(0.036–0.043)
EyeStar 0.873(0.865–0.880) 0.961(0.958–0.963) 0.039(0.036–0.042)
MIAG ULL 0.854(0.845–0.863) 0.934(0.932–0.937) 0.044(0.041–0.048)
MIG 0.825(0.834–0.853) 0.959(0.956–0.961) 0.060(0.044–0.052)

现场集(Table 8),名次重排、cheeron 反超居首:

队伍 OC Dice OD Dice vCDR MAE 现场排名
cheeron 0.865(0.854–0.875) 0.961(0.958–0.964) 0.055(0.050–0.060) 1
MAI 0.854(0.843–0.865) 0.960(0.957–0.963) 0.060(0.055–0.066) 2
VUNO EYE TEAM 0.845(0.836–0.854) 0.960(0.956–0.964) 0.058(0.053–0.063) 2
MIG 0.846(0.834–0.858) 0.949(0.944–0.953) 0.055(0.050–0.060) 4
EyeStar 0.831(0.822–0.840) 0.939(0.935–0.942) 0.054(0.050–0.058) 5
MIAG ULL 0.851(0.838–0.865) 0.918(0.905–0.931) 0.064(0.056–0.071) 6

三点观察:

  1. 分割比分类稳:在线与现场的 Dice 相当接近(例如 OD Dice 多数队在 0.94–0.96),说明分割任务受域偏移影响小于分类——因为视盘/视杯是解剖学上稳定的圆盘结构,比"是否青光眼"这种依赖细微征象的判断更抗域干扰。
  2. OD 易、OC 难:所有队伍的 OD Dice(0.9+)都高于 OC Dice(0.8+)。原因是视杯更小、边界更模糊,分割更难。
  3. 在线排名不可靠:MAI 在线三项指标全面领先,现场跌到第 2;cheeron 现场三项反超。仅凭在线榜选方法会误判。

7.3 人机对照:算法 vs 7 名医师

论文做了一次很有意义的对照——把 7 名眼科医师初始标注之间的差异,与算法结果放在一起比:

分割任务(onsite 集):

  • 人工初标最佳:Dice_OC 0.865 / Dice_OD 0.952 / MAE_vCDR 0.049;
  • 人工初标最差:Dice_OC 0.742 / Dice_OD 0.817 / MAE_vCDR 0.084。

对照结论:自动化方法的结果全部优于最差的人工标注,冠军 cheeron(OC 0.865 / OD 0.961 / MAE 0.055)最接近最佳人工。论文据此认为自动分割已能达到"接近甚至优于人工"的水平,可用于辅助临床 OD/OC 分析。

中心凹定位任务:人工标注 AED 区间 22.94–27.41 像素(跨标注者均值 24.96 像素)。现场集里只有 MAI 一队(21.841 像素)优于所有人工标注,成为"跑赢最好人工"的算法;VUNO(27.456)与 cheeron(28.344)仅接近最差人工。论文解释:定位任务比分割更难,所以算法在人机对比上的优势不明显。

这一节是 REFUGE2 相对一般分割基准的增值:它不只报告"算法得分多少",还给出"同一任务上人类专家之间的分歧有多大",让算法性能有了人的参照系。

7.4 域适应方法的成败(本论文最有价值的结论)

REFUGE2 论文 §5 系统分析了"处理多域数据"的两条路线,并给出反直觉的结论:

路线 A:域适应技术(MAI、EyeStar)

  • MAI 用 Test-Time Training(TTT):在推理阶段用测试数据做自监督微调(辅助任务为预测旋转角度 0°/90°/180°/270°),并配经典无监督域适应(对抗训练)。效果:MAI 在在线榜三个任务上常居第一。
  • 但:决赛禁止更新权重——MAI 的特征提取模块无法在现场集上自适应,域适应失效,于是现场排名下滑。

路线 B:多域训练数据(VUNO、MIG)

  • VUNO 和 MIG 在分类任务上现场表现更好,关键原因是用了额外的多域训练数据:例如 MIG 使用的 ACRIMA 数据集部分样本由 Topcon 相机采集,恰好与现场集设备一致。
  • EyeStar 的教训:它虽然也用了额外数据(私有 SEED 数据集)做域适应,但它是把"REFUGE2 训练集"当作目标域去对齐的——而真正要测的在线/现场域与训练域都不同,于是对齐没对准靶子,分类任务表现不佳。

核心结论:在"允许在线调参"的场景,TTT 这类测试时适应很有效;但在"权重冻结、纯盲测"的场景,用尽可能多样的设备数据训练(多域数据)比事后域适应更稳。论文由此判断,UDA 与多域学习将是深度学习在真实临床落地的关键方向。

7.5 集成与相关性发现

论文还做了模型集成实验:

  • 分类:7 队预测概率相加平均后,AUC 比最强单队最多提升约 0.007(6 队集成时最高)。排名第 6 的 ALISR 与其他队相关性较低(Spearman ρ≈0.58–0.71),提供了正互补。但冠军单队已经很稳,集成增益有限。
  • 分割:多数投票集成时,偶数队集成反而容易掉分——因为某像素的 OD/OC 票数相同时会被判为背景,导致精度下降。建议用奇数个基模型。
  • 定位:MAI 结果最好;与第 2 队集成反而偏,与第 3 队集成因相关性强而回稳。

结论:集成要选性能好且互补的基模型,多数投票时优先用奇数个模型。

7.6 图像质量与疾病状态的影响

论文进一步把成绩按图像质量(good/usable/reject)与疾病状态(青光眼/非青光眼)分层:

  • 分类:各队在 reject 质量图上反而表现最好——因为 reject 多因黄斑区模糊/伪迹所致,而视盘区仍清晰,且高对比反而利于以视盘为主的模型。论文坦言 onsite 集各质量档分布不均(267/57/76),结论是提示性的。
  • 分割 vs 定位抗质量干扰能力不同:OD/OC 分割受图像质量影响较小(视盘区对模糊/曝光不敏感),而中心凹定位随质量变差显著恶化,reject 图上误差激增。这说明中心凹定位是三者中最脆弱的任务。
  • 疾病状态:模型在青光眼样本上的结构分析误差略小于非青光眼样本,论文推测主要原因是青光眼样本数(80)远少于非青光眼(320),并判断"青光眼本身不干扰眼底结构分析"。

7.7 各任务的方法明细(论文 Table 3/4/5 口径)

论文对三任务分别做了方法概览表,摘录如下,便于复现与对比:

Task 1 分类方法概览(Table 3):

队伍 输入 架构 额外数据 亮点
VUNO EYE TEAM 整图 EfficientNet 私有数据集 预训练模型带 15 类病灶标签
MIG 整图 + 视盘块 ResNet50 变体 ORIGA, Drishti-GS1, RIM-ONE_r3, ACRIMA 整图 1 模型 + 视盘 4 模型集成
MAI 视盘块 ResNet50 — 加自监督任务,测试阶段更新特征模块参数
cheeron 视盘块 ResNeXt / Res2Net — 通道+空间注意力
MIAG ULL 视盘块 VGG19 — —
ALISR 视盘块 CSPResNext50 — 跨阶段部分网络降算力
EyeStar 整图 DenseNet121 SEED 数据集 在共享特征空间对齐两域分布

Task 2 分割方法概览(Table 4):

队伍 策略 架构 额外数据 亮点
cheeron 由粗到细 U-Net(ResNet 编码器) 粗分 + ResUNet 细分 — 深监督 + ASPP + 测试时增强
MAI 由粗到细 U-Net 粗分 + DeeplabV3+ 细分 — 经典无监督域适应
VUNO EYE TEAM 直接分割 U-Net(EfficientNet-B0 编码器) RIGA, IDRiD, PALM 用 OD-血管位置先验
MIG 由粗到细 CENet(ResNet34 编码器) ORIGA, Drishti-GS1, RIMONE_r3 纹理编码模块
EyeStar 由粗到细 Vision Transformer Drishti-GS, RIM-ONE-r3 Transformer 医学分割
MIAG ULL 由粗到细 PSPNet(ResNet50) — 三模型分别分段粗 OD、细 OD、细 OC

Task 3 中心凹定位方法概览(Table 5):

队伍 策略 架构 额外数据 亮点
MAI 距离图回归 U-Net(EfficientNet-B5 编码器) — 测试时训练(自监督更新参数)
VUNO EYE TEAM 分割 + 偏移图回归 U-Net(EfficientNet-B0/B4) 私有数据集 预测置信图 + x/y 偏移图,用中心凹-血管先验
cheeron 目标检测 YOLOv5 — 按中心凹坐标 + 视盘直径做检测框
EyeStar 高斯热图回归 HRNet — 融合全图全局特征与局部特征
MIG 距离图回归 U-Net — Bi-Distance map 预测到 OD/中心凹的最小距离
ALISR 距离图回归 U-Net MESSIDOR —

这三张表本身就是一份"眼底三任务的技术选型参考":分类偏爱 EfficientNet/ResNet + 视盘局部;分割偏爱 U-Net 家族 + 由粗到细;定位偏爱回归(距离图/热图)+ 近年出现 YOLOv5 与 Transformer。对想做眼科 AI 工程的人,这是难得的横向对照。

7.8 vCDR 为什么既是"金指标"又不可单独依赖

论文有一个耐人寻味的发现值得单列:用金标准 vCDR 直接做青光眼分类,反而输给深度学习模型(在线 0.8817 vs 队伍 ≥0.939;现场 0.7571 vs 队伍 ≥0.820)。原因论文讲得清楚——青光眼与 vCDR 的关系不是一一对应:

  • 存在"视杯不扩大的青光眼":部分青光眼患者视杯并不明显扩大,vCDR 可能在正常范围,于是单纯看 vCDR 会漏诊;
  • 存在"生理性大视杯的正常眼":有人天生视杯偏大(生理性大视杯),vCDR 可能超过阈值却并非青光眼,于是单纯看 vCDR 会误诊。

这解释了为什么 REFUGE2 要把分类作为独立任务(而非"分割完算 vCDR 再阈值"),也解释了为什么论文强调"vCDR 单独不足以为青光眼自动判别提供依据"。对使用者的启示:不要用"分割→vCDR→阈值"这条捷径替代真正的分类建模,尤其在对漏诊容忍度低的筛查场景。

7.9 图像质量分层的完整账本

把 §7.6 提到的质量实验展开成人能看懂的形式(onsite 400 张的 267/57/76 分层),三个任务的表现模式:

任务 good 质量 usable 质量 reject 质量 总体趋势
分类 与总榜趋势一致 cheeron/MIAG ULL/ALISR 较好(都用视盘块) 各队反而最好 抗质量干扰,甚至"越差越好"(视盘区清晰 + 高对比)
OD/OC 分割 稳定 稳定 轻微下降 三者中受质量影响最小
中心凹定位 好 明显下降 显著恶化 三者中受质量影响最大、最脆弱

这张表给工程实践的直接建议:如果应用场景的图像质量不可控(基层筛查、手机眼底相机),中心凹定位最需要警惕;相对而言 OD/OC 分割对质量最宽容。论文也因此建议"针对不同质量图设计不同模型"作为一种可落地的临床策略。

7.10 统计显著性:名次差距有多少是真差距

论文对前几名之间的差异做了统计检验,这一点常被忽略但很重要:

  • 分类(在线):第 1 名 MAI(0.984)与第 2 名 VUNO(0.983)、第 3 名 cheeron(0.980)的 AUC 差异 统计不显著(DeLong 检验 p=0.974 / p=0.850)。也就是说,在线分类榜的前三名实际上难分伯仲,名次更多是采样波动。
  • 分类(现场):第 1 名 VUNO(0.883)与第 2 名 MIG(0.876)、第 3 名 MAI(0.861)差异同样不显著(p=0.614 / p=0.134)。
  • 分割(在线):MAI 与 cheeron、VUNO 的 OD Dice 差异不显著(p=0.8037 / p=0.3715);OC Dice 差异也不显著(p=0.1821 / p=0.0889);vCDR MAE 差异同样不显著(p=0.2521 / p=0.1814)。
  • 分割(现场):cheeron 与 MAI、VUNO 的 OD Dice 差异不显著(p=0.5879 / p=0.5075);但 cheeron 与 VUNO 的 OC Dice 差异显著(p=1.0047×10⁻⁶)。
  • 定位(在线):MAI 与 VUNO 差异不显著(p=0.6356),但 MAI 与 cheeron 差异显著(p=0.0003)。

启示:引用 REFUGE2 的排行榜时,不要只看名次,要看显著性。头部队伍之间往往 “statistically indistinguishable”,把第 1 名和第 3 名当作有实质差距会导致过度解读。

7.11 vCDR 基线的完整对照

论文用金标准 vCDR 值构造了一个"非深度学习的基线",与各队对比:

方法 在线 AUC 现场 AUC
金标准 vCDR 基线 0.8817(0.840–0.917) 0.7571(0.693–0.815)
最强深度队伍 0.984(MAI,在线) 0.883(VUNO,现场)

两条结论:

  1. 深度学习全面超越 vCDR 基线:在线、现场两栏,最强队伍的 AUC 都高于 vCDR 基线,且差异统计显著(在线 p=1.478×10⁻⁵,现场 p=1.438×10⁻⁵)。
  2. vCDR 基线的现场跌落更大:从在线 0.8817 掉到现场 0.7571(降 0.125),比深度队伍的降幅(约 0.10)还大——说明 vCDR 与青光眼的关联在现场集上更弱,进一步佐证"vCDR 不可单独依赖"。

7.12 交叉引用:域适应结论与库内条目的呼应

REFUGE2 的"多域数据优于事后域适应"结论,与库内几个同类条目的议题相互呼应:

  • 与 JustRAIGS(rid 746):后者以十万级多设备数据做转诊筛查,规模上的"多域覆盖"正是 REFUGE2 结论(多域数据更稳)的放大实践。
  • 与 FairSeg(rid 371):后者的公平性议题(不同人群/设备下的性能差异)与 REFUGE2 的域泛化议题同源——都是"模型在分布外是否可靠"。
  • 与 IDRiD(rid 191)/MESSIDOR(rid 59):用同相机(KOWA/TOPCON)的数据做跨库验证,可直接检验 REFUGE2 上训好的模型能否迁移到同设备的其他数据集。

这些交叉点让 REFUGE2 不孤立——它是库内"跨域鲁棒性"这条暗线的一个关键节点。

§8 生态谱系与库内互链

8.1 iChallenge 系列谱系

REFUGE2 属于眼科挑战赛 iChallenge 系列。论文明确把自己放在这条线上:REFUGE1(2018)→ REFUGE2(2020),并与同系列的 ADAM(眼底血管/视盘异常检测,Fang et al. 2022)、PALM(病理性近视眼底多任务分割,Fu et al. 2019)、AGE(年龄相关眼底异常,Fu et al. 2020)共享评测范式。REFUGE2 的标注流程与评测指标(AUC/Dice/AED)均与 REFUGE1 和 ADAM 对齐,形成可比的技术传承。

8.2 上游数据谱系与横向对照

  • 直系前作:REFUGE1(Orlando et al., MedIA 2020;库内 refuge, rid 62)——REFUGE2 的 1200 张训练图即源自它。
  • 横向对照集(论文 Table 1):AIROGS(de Vente et al. 2021,最大公开青光眼筛查集,>11 万张)、ORIGA、DRISHTI-GS、RIM-ONE、IDRiD、MESSIDOR、HRF、DRIVE 等。
  • 被引用情况:论文自述 REFUGE2 已被多篇域适应研究使用(Li et al. 2021;Guo et al. 2021 等)。

8.3 库内可互链条目(含 rid)

按家族分组,标注库内 record_id:

同类青光眼 / 视盘视杯(核心互链):

条目 rid 与本条关系
REFUGE 62 直系前作(REFUGE1 主体;本条目为其超集后继)
DRISHTI-GS 301 视盘/视杯分割经典基准,论文 Table 1 横向对照对象
RIM-ONE 291 青光眼视神经评估眼底图,Table 1 对照对象
JustRAIGS 746 青光眼转诊双任务筛查挑战,同类青光眼大集
FairSeg 371 公平性医学图像分割(含视盘视杯类任务)
ADAM 735 同 iChallenge 系列、同一标注流程与评测范式

眼底影像 / 糖尿病视网膜病变家族:

条目 rid 关联点
MESSIDOR 59 论文 Table 1 对照(TOPCON 采集口径可对照 onsite)
DDR 201 眼底 DR 分级与分割
IDRiD 191 眼底病灶像素级标注,Table 1 对照(含中心凹标注)
RFMiD 271 视网膜多病种眼底图
ODIR-5K 63 眼科多疾病智能识别
EyePACS 58 最大眼底 DR 筛查来源之一
DeepDRiD 211 眼底质量评估与 DR 分级挑战
DRIVE 241 视网膜血管分割金标准(血管先验相关)
HRF 261 高分辨率眼底血管分割基准
PALM 281 病理性近视眼底多任务分割(同 iChallenge 系列)

OCT / 黄斑相关:

条目 rid 关联点
OIMHS 745 黄斑裂孔 OCT 结构分割(黄斑解剖关联)

8.4 本轮同批条目

同批派发的 g1020、papila、origa-light 三个眼底/视盘条目与本条同属 AI-Ready 眼底家族,构成同批检索面;因同批进行中,库内尚无可反查的稳定 rid,故此处仅按名称列示,不硬编 rid(避免记账错位)。

8.5 为什么这对检索生态有价值

REFUGE2 在库内承担三个独特的连接作用:

  1. 承上启下:把 REFUGE1(rid 62)与更新一代青光眼/视盘条目(JustRAIGS、FairSeg)连成一条"青光眼眼底 AI"时间线。
  2. 域泛化的枢纽:其四相机设计与域适应结论,是库内讨论"多设备/跨域泛化"时的核心参照,可与 IDRiD(KOWA 采集)、MESSIDOR(TOPCON 采集)做设备维度交叉。
  3. 人机对照的样板:其"算法 vs 7 名医师"的实测账本,为其他标注密集条目提供了"如何量化人工上下界"的范式参照。

8.6 域偏移研究的三层价值

REFUGE2 之所以在多域研究里被频繁引用(论文自述 Li et al. 2021、Guo et al. 2021 等已使用),是因为它同时提供了三层价值:

  1. 数据层:四个真实相机域、训练/测试不重叠,是天然的域泛化数据集,且规模(2000)适中、任务(3)全面。
  2. 协议层:在线/现场双轨 + 权重冻结的现场规则,把"测试时适应"与"多域训练"两条技术路线放进同一个公平的评测框架对比。
  3. 结论层:论文给出的"多域数据优于事后域适应""分割抗域、定位脆弱"等结论,是可被后续研究证伪或扩展的明确命题——一个数据集能提出可证伪命题,比只提供排行榜更有科学价值。

8.7 与库内 OCT/黄斑条目的黄斑维度关联

中心凹是黄斑的中心。REFUGE2 的第三个任务(中心凹定位)与库内 OCT/黄斑条目(如 OIMHS,rid 745)在解剖学上共享"黄斑"这一结构维度,但模态不同(CFP vs OCT):REFUGE2 在眼底彩照上定位中心凹坐标,OIMHS 在 OCT 上分割黄斑裂孔等结构。二者构成"同结构、异模态"的检索对,对做多模态黄斑分析的人有互补价值。

8.8 生态小结:REFUGE2 在库内的"一个枢纽、两条线"

  • 一个枢纽:它是青光眼家族(REFUGE → REFUGE2 → JustRAIGS)与眼底家族(IDRiD/MESSIDOR/DRIVE/HRF)之间的交叉枢纽。
  • 两条线:纵向是版本线(REFUGE1 的迭代升级),横向是设备线(与 IDRiD 的 KOWA、MESSIDOR 的 TOPCON 跨库对齐)。

这种"枢纽 + 双线"的位置,使 REFUGE2 成为青光眼/眼底检索时几乎必然命中的条目。

§9 与库内条目的关系

9.1 与 REFUGE(rid 62)的关系:父子而非重叠

本条与库内 refuge(rid 62) 的关系最容易引发误判,故单列说明:

维度 REFUGE(rid 62,库内) REFUGE2(本条)
全称 Retinal Fundus Glaucoma Challenge(REFUGE1) 2nd Retinal Fundus Glaucoma Challenge
时间 MICCAI 2018 MICCAI 2020
规模 1200 张 2000 张(含 REFUGE1 的 1200)
相机 2(Zeiss, Canon) 4(+KOWA, +TOPCON)
任务 2(分类、分割)+中心凹辅助 3(分类、分割、中心凹定位)
许可 CC BY 4.0 CC BY-NC-ND
论文 Orlando et al., MedIA 2020 Fang et al., arXiv:2202.08994
下载 Bitbucket 镜像 官网 /Home2020/

结论重申:REFUGE2 是 REFUGE1 的严格超集后继,两者是版本链上的父子,不是同一物、也不是子集/镜像。库内保留两条是正确的——因为它们的许可、规模、任务、下载入口都不同,合并会导致使用者同时踩"规模错"与"许可错"。

9.2 与其它青光眼/视盘条目的关系

  • DRISHTI-GS(rid 301)、RIM-ONE(rid 291):规模更小(101/169 张)的视盘视杯/青光眼基准,适合作为 REFUGE2 之外的小样本对照;论文 Table 1 已把三者并列。
  • JustRAIGS(rid 746):青光眼转诊的大型筛查挑战,规模远超 REFUGE2(十万级),可视为"青光眼筛查"谱系上 REFUGE2 之后的规模化延伸。
  • ADAM(rid 735):同属 iChallenge 系列,标注流程与评测范式同源,是本条最"技术近亲"的条目。
  • FairSeg(rid 371):关注医学图像分割的公平性,与 REFUGE2 的"跨设备/跨人群泛化"议题互补。

9.3 与眼底 DR 家族的交叉点

  • IDRiD(rid 191):由 KOWA 相机采集——与 REFUGE2 的 Online 集同设备,是研究"同设备跨数据集"的有趣对照。
  • MESSIDOR(rid 59):由 TOPCON 采集——与 REFUGE2 的 Onsite 集同设备,可做"同设备不同病种"的迁移研究。
  • DRIVE(rid 241)、HRF(rid 261):视网膜血管分割基准——REFUGE2 中 VUNO 等队用到"血管-视盘/中心凹解剖先验",这两者是血管标注的上游资源。

9.4 检索建议

在本站检索时,建议同时使用以下关键词以覆盖完整家族:REFUGE、REFUGE2、青光眼、glaucoma、视盘、视杯、OD/OC、中心凹、fovea、vCDR、域适应、domain adaptation。注意不要把 REFUGE 与 REFUGE2 的规模数字混用(1200 vs 2000),也不要混用许可(CC BY 4.0 vs CC BY-NC-ND)。

9.5 与库内条目的关系总表

库内条目 rid 关系类型 一句话关联
REFUGE 62 直系前作 / 超集来源 REFUGE2 的 1200 张训练图即来自它
ADAM 735 同系列 iChallenge 同族,标注流程与指标同源
DRISHTI-GS 301 同类小基准 视盘视杯分割对照(101 张)
RIM-ONE 291 同类小基准 青光眼视神经评估对照(169 张)
JustRAIGS 746 同类大集 青光眼转诊筛查规模化延伸
FairSeg 371 议题互补 公平性 vs 域泛化
IDRiD 191 设备交叉 同为 KOWA 采集,可跨库验证
MESSIDOR 59 设备交叉 同为 TOPCON 采集,可跨库验证
DRIVE 241 上游资源 血管分割,视觉-视盘/中心凹先验相关
HRF 261 上游资源 高分辨率血管分割基准
PALM 281 同系列 病理性近视多任务分割
OIMHS 745 同结构异模态 黄斑(OCT)对比

9.6 与 REFUGE(62) 的"合并会怎样"假设推演

有人可能主张"两条目合并,避免重复"。这里推演一下合并的后果,以说明为何不合并更合理:

  • 规模张力:合并后标题若写"REFUGE 系列",会把 1200 与 2000 两个数字混在一起,使用者极易误读 REFUGE2 的规模(正是坑 1 的根源)。
  • 许可冲突:一条记录只能写一个主许可。CC BY 4.0 与 CC BY-NC-ND 无法共存,合并必然牺牲其中一个的准确提示,造成合规风险。
  • 任务差异被抹平:REFUGE1 无正式中心凹任务、REFUGE2 有——合并会让"中心凹定位是新任务"这一关键事实消失。
  • 下载入口混乱:Bitbucket(REFUGE1)与官网 /Home2020/(REFUGE2)是两个入口,合并后指引不清。

因此保持两条独立、互链是信息架构上更优的选择。本条目与 refuge(62) 通过正文交叉引用与检索关键词形成互补,而非竞争。

§10 避坑清单:十二个已踩过的坑

坑 1:把 REFUGE2 的规模记成 1200 张(任务头 brief 错误)

本条目派发时,任务头 brief 写 REFUGE2 是"1,200 张跨厂商眼底图"。经三源互证(arXiv 论文 §2.2 + Zenodo 挑战设计文档 + IEEE DataPort 会议页),REFUGE2 实为 2000 张——1200 张是 REFUGE1 的规模,被 brief 误植到了 REFUGE2 头上。成稿按 2000 张为准。教训:brief 描述仅供参考,必须三源核验(教训 12 的又一实例)。

坑 2:把 REFUGE2 当成 REFUGE1 的别名或子集

这是本条目最需要防的坑。REFUGE2 名字里带"REFUGE",且与 REFUGE1 有 1200 张重叠,极易被当成"同一物"或"子集"。事实相反:REFUGE2 是 REFUGE1 的严格超集(2000 ⊃ 1200),且有独立挑战赛、独立论文、独立许可、净新增 800 张新相机图与中心凹新任务。若误判为别名/镜像,会错误地改道或合并条目,丢掉一条独立资产。

坑 3:arXiv 同一编号跨版本改题

arXiv:2202.08994 的题名在版本间不统一:v1 与 v3 题为 “REFUGE2 Challenge: A Treasure Trove for Multi-Dimension Analysis and Evaluation in Glaucoma Screening”,而 v2 题为 “REFUGE2 Challenge: Treasure for Multi-Domain Learning in Glaucoma Assessment”。检索时若只抓到 v2 题名,可能误以为存在两篇不同论文。本条目以现行 v3 题名为准,并存照 v2。

坑 4:沿用 REFUGE1 的 CC BY 4.0 去用 REFUGE2(许可陷阱)

REFUGE1 是 CC BY 4.0(可商用可衍生),REFUGE2 收紧为 CC BY-NC-ND(禁商用、禁衍生)。论文原文明确许可为 CC BY-NC-ND。凭 REFUGE1 印象使用 REFUGE2 会同时违反 NC 与 ND 两条。任何"基于 REFUGE2 的训练数据做商用模型""发布 REFUGE2 的再标注衍生集"都需另行授权。

坑 5:把 Online 集成绩当成真实泛化能力

在线集在 2020-07-20 至 08-20 的初赛里被各队反复提交(每日限 5 次、只保留最新成绩),队伍实际"看着榜单调模型"。因此在线成绩含测试集过拟合,不能代表临床泛化。例如分类冠军在线 0.983、现场仅 0.883,落差约 0.10。研究引用时务必明确区分 Online 与 Onsite 两栏。

坑 6:忽略 REFUGE1 与 REFUGE2 的 1200 张重叠

REFUGE2 的训练集 1200 张 = REFUGE1 的全部(训练+验证+测试)。若把两版数据合并训练而不去重,这 1200 张会被计两遍(训练集内重复 60%),导致评测虚高。合并前务必去重(按 Zeiss 400 + Canon 800 剔除)。

坑 7:把 “17.5 GB” 当作数据集体积

Zenodo 记录页(DOI 10.5281/zenodo.3714947)显示 “Data volume 17.5 GB”,但该字段出现在记录的统计展示语境,无法确证为数据集本体大小;论文本身未给统一 GB 数。本条目不把它当数据大小引用,仅存照待核。

坑 8:只看 Dice 不看 vCDR MAE,或忽略定位任务的脆弱性

评分割时,Dice 高不代表临床可用——OC Dice 0.88 看似高,但对应的 vCDR MAE 仍可能在 0.04–0.06 之间(vCDR 的临床阈值通常取 0.5–0.7,0.05 的误差不容忽视)。另外,中心凹定位任务对图像质量极其敏感:reject 质量图上误差激增,且现场集里只有一队跑赢人工。评估时不要只报告"平均 Dice 很高"就下结论。

坑 9:把比赛用的"现场规则"套到自己的实验里

赛场规则规定"决赛禁止更新模型权重",这是为了测纯泛化。但你在自己的实验里若也照搬"权重冻结",就会误判 TTT/UDA 的价值——因为在实际部署中,模型往往可以做推理时适应。反过来,若你不冻结权重,又无法与论文的现场榜对比。正确做法是:同时报告"权重冻结"与"允许适应"两种设定,并说明与论文哪一栏可比。

坑 10:忽视青光眼/非青光眼 1:6.1 的类别不平衡

2000 张里青光眼仅 280 张(14%)。若用准确率(Accuracy)评价分类,一个"全判非青光眼"的模型就能得 86% 的准确率——但毫无临床价值。因此论文用 AUC(对类别不平衡相对稳健)。你做实验时也应报 AUC/敏感性/特异性,而非单纯准确率;若做重采样或加权,需说明与论文口径的差异。

坑 11:把四相机子集当成可随意混合的训练池

四个子集的名字(Training/Online/Onsite)暗示了它们的角色,但它们不是可自由混合的同质数据:Online/Onsite 是评测域,混入训练会造成数据泄漏;且四机分辨率不一,直接拼接需先统一。研究域泛化时,必须保持"训练域与评测域分离"。

坑 12:把 arXiv 预印本当成正式期刊文献引用

REFUGE2 论文目前为 arXiv 预印本(截至抓取时点未查到正式收录)。引用时应标注 “arXiv preprint arXiv:2202.08994”,不要误写为某期刊/会议 proceedings 的正式论文——这与 REFUGE1 已有 MedIA 期刊的情况不同(坑 3 的相关项)。

§11 总结

REFUGE2 是青光眼眼底 AI 领域一座承前启后的里程碑。它的价值不在于"又多了一个眼底数据集",而在于它用一个精心设计的多域实验装置,把"AI 换个相机就掉分"这件临床落地的老大难问题,变成了可复现、可排名、可对照的科学问题:

  • 数据上,它把 REFUGE1 的 1200 张整体收编为训练集,再补 800 张来自 KOWA/TOPCON 两台新相机的图,凑成 2000 张四相机、三任务、带质量分层的公开基准;
  • 评测上,它用"在线初赛 + 现场盲测"的双轨制,以及 0.3/0.7 的加权,把"过拟合到测试域"的泡沫挤了出来;
  • 结论上,它揭示了反直觉的真相——最花哨的测试时域适应(TTT)在权重冻结的盲测下不如下苦功的多域训练数据;同时给出了珍贵的人机对照:分割任务上算法已可比肩医师,中心凹定位上算法仍普遍不如医师;
  • 生态上,它是 iChallenge 系列里 REFUGE1 与 ADAM/PALM/AGE 之间的连接点,也是本站青光眼与眼底家族(REFUGE、DRISHTI-GS、RIM-ONE、JustRAIGS、FairSeg、IDRiD、MESSIDOR 等)的枢纽。

对使用者的最后三句话:① 记住它是 2000 张不是 1200 张;② 记住它是 CC BY-NC-ND 不是 CC BY 4.0;③ 记住用它的在线成绩做对比时要注明"这是可调参的在线集,不是盲测"。把这三点记牢,REFUGE2 就是研究多域眼底 AI 的一件利器;记错任何一点,都会在不知不觉中踩中规模、许可或过拟合的坑。

附录 A:来源、抓取方式与存照

项 来源 抓取方式/时点
论文全文(题名/作者/子集/指标/结果) arXiv:2202.08994 v3 arxiv.org/html/2202.08994v3,2026-09-30
挑战设计文档(组织方/许可/规模) Zenodo 10.5281/zenodo.3714947 zenodo.org/records/3714947,2026-09-30
挑战赛页面副本(任务/赛程/注册) IEEE DataPort 10.21227/7d23-j419 ieee-dataport.org,2026-09-30
REFUGE1 规模/许可对照 Nature s41746-025-01473-w 转述 + 库内 refuge(62) 检索 + DB 查询,2026-09-30
库内查重(slug/rid) ai_ready_dataset 表 qf_psql.sh 只读查询,2026-09-30
引用数(三源) Google Scholar / ScholarFeed 检索,2026-09-30(第三方,非官方)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 arXiv 开放预印本 + 挑战赛官网 + Zenodo/IEEE DataPort 多入口;但"REFUGE2"名易与 REFUGE1 混淆,且无正式期刊收录
A 可获取性 7 官网注册即可下载(数据与评测框架挑战后仍开放);扣分项:需注册、不许匿名、Onsite 子集无公开标签
I 可互操作 7 标准 JPG 图像 + 二值掩码 + 坐标标签,通用性好;但四相机分辨率不一,需自建统一预处理;无官方 DICOM 转换
M 元数据质量 7 论文表格完备(四子集设备/分辨率/分布、质量分层、人机对照);扣分项:无患者人口学信息(论文自陈缺失)、GB 数口径不明
S 可持续性 7 grand-challenge 平台长期托管,挑战后仍开放;许可 NC-ND 限制了衍生,可能抑制社区二次开发
综合评级 7.2/10(中上) 多域设计与评测协议是其突出优点;可获取性受注册制与许可限制、元数据受人口学缺失拖累

附录 C:逐项证据链自证

关键数字 来源 位置
2000 张 / 四相机 论文 §2.2 + Table 2 arXiv:2202.08994 v3
Training 1200 = 400 Zeiss + 800 Canon 论文 §2.2 同上
Online 400(KOWA 1940×1940)/ Onsite 400(TOPCON 1848×1848) 论文 Table 2 同上
青光眼 280 / 非 1720 论文 Table 1/2 同上
7 医师(均 8 年)+ 1 资深专家(>10 年) 论文 §2.2 同上
CC BY-NC-ND 论文 §2.2 原文 同上
质量分层 267/57/76 论文 §5.2 同上
分类 AUC 0.983→0.883 等 论文 Table 6 同上
分割 Dice / vCDR MAE 论文 Table 7/8 同上
中心凹 AED(含人工 22.94–27.41) 论文 Table 9 + §5.1 同上
排名公式 0.45/0.45/0.1 与 0.3/0.7 论文 §2.3 公式 (1)(2) 同上
组织方五机构 / 许可 Zenodo 10.5281/zenodo.3714947 zenodo.org
1300+ 参赛 / 134 队 / 3000+ 提交 / 22 队决赛 论文 §2.1 + IEEE DataPort 同上

附录 D:数据获取决策树

目标 → 路径
├── 复现三任务基准 ──→ 官网 /Home2020/ 注册下载(CC BY-NC-ND)
├── 做域适应研究 ────→ 源域=训练集(Zeiss+Canon)
│                      验证域=Online(KOWA,有标签)
│                      盲测域=Onsite(TOPCON,按赛制评测)
├── 与 REFUGE1 联合训练 ─→ 先去重 1200 张(Zeiss400+Canon800)
├── 商用/产品化 ──────→ CC BY-NC-ND 不允许,需授权
└── 与研究对比 ───────→ 对齐设备:IDRiD(KOWA)/MESSIDOR(TOPCON)

附录 E:三任务速查表

任务 输入 输出 指标 现场最优(论文口径)
青光眼分类 CFP(整图或视盘块) 青光眼概率 AUC VUNO 0.883
视盘/视杯分割 CFP OD/OC 掩码 Dice + vCDR MAE cheeron OC 0.865/OD 0.961/MAE 0.055
中心凹定位 CFP (x, y) 坐标 AED MAI 21.841 px

附录 F:四相机规格速查

相机 分辨率 归属子集 公开标签 与库内同设备条目
Zeiss Visucam 500 2124×2056 Training(400) ✓ —
Canon CR-2 1634×1634 Training(800) ✓ HRF、RIM-ONE(Canon 口径)
KOWA 1940×1940 Online(400) ✓ IDRiD(KOWA)
TOPCON TRC-NW400 1848×1848 Onsite(400) × MESSIDOR、STARE(TOPCON)

附录 G:坑点档案(与 §10 对照)

编号 坑点 后果 规避
坑 1 REFUGE2 被 brief 记成 1200 张 规模错报 三源互证,按 2000 张
坑 2 误判 REFUGE2 为 REFUGE1 别名/子集 错误改道/合并 认清超集关系(2000 ⊃ 1200)
坑 3 arXiv 跨版本改题 误认两篇论文 以 v3 题名为主,存照 v2
坑 4 沿用 CC BY 4.0 违反 NC/ND 认清 REFUGE2 为 CC BY-NC-ND
坑 5 把 Online 当泛化能力 结论虚高 区分 Online/Onsite
坑 6 忽略 1200 张重叠 训练重复计数 联合训练先去重
坑 7 把 17.5 GB 当数据体积 体积错报 标注待核,不引用
坑 8 只看 Dice 忽略 vCDR/定位脆弱性 误判临床可用性 Dice 与 vCDR MAE 并看
坑 9 把赛场"权重冻结"规则照搬自家实验 误判 TTT/UDA 价值 同时报冻结/可适应两设定
坑 10 忽视分类 1:6.1 类别不平衡 准确率虚高 报 AUC/敏感性/特异性
坑 11 把四子集当同质训练池 数据泄漏 保持训练/评测域分离
坑 12 把预印本当正式期刊文献 引用失准 标 arXiv preprint

附录 H:术语对照(中英)

中文 英文 简释
彩色眼底照片 Color Fundus Photography, CFP 眼底筛查的基础影像模态
视盘 Optic Disc, OD 视神经头,眼底上圆形亮区
视杯 Optic Cup, OC 视盘中央的凹陷区
垂直杯盘比 vertical Cup-to-Disc Ratio, vCDR 视杯与视盘垂直直径之比,青光眼关键指标
黄斑中心凹 fovea / macular center 视网膜正中央的最敏锐视觉区
域偏移 domain shift 不同采集设备/人群导致的分布差异
测试时训练 Test-Time Training, TTT 推理阶段用测试数据自监督微调
无监督域适应 Unsupervised Domain Adaptation, UDA 无目标域标签下的域对齐
平均欧氏距离 Average Euclidean Distance, AED 中心凹定位误差指标(像素)
视场角 Field of View, FOV 眼底相机的拍摄范围
杯盘比 Cup-to-Disc Ratio, CDR 视杯与视盘面积/直径之比

附录 I:关键数字一致性核对

数字 论文口径 本条目 一致性
总张数 2000 2000 ✓
REFUGE1 复用 1200 1200 ✓
新采 800 800 ✓
青光眼/非 280/1720 280/1720 ✓
四相机分辨率 2124×2056 / 1634×1634 / 1940×1940 / 1848×1848 同 ✓
标注者 7 医师 + 1 专家 7+1 ✓
许可 CC BY-NC-ND CC BY-NC-ND ✓
分类现场最优 AUC 0.883 0.883 ✓

附录 J:维护触发点

以下情况出现时,本条目应复核更新:

  1. REFUGE2 论文被正式期刊收录:arXiv:2202.08994 目前为预印本,若被会议 proceedings 或期刊正式收录,题名/DOI/年份需更新,并去掉"预印本"标注。
  2. 官方数据入口变更:/Home2020/ 下载页或 grand-challenge 域名若有调整,§6 获取路径需同步。
  3. 许可变更:若主办方升级/放宽许可(例如改为 CC BY 4.0),§6 与坑 4 必须重写。
  4. 引用数固化:当前引用数三源不一(74 / 25.563 等),若出现权威统计(如正式收录后的 Scopus/WoS)可补充。
  5. 17.5 GB 口径澄清:若确认该值为数据集体积或明确排除,附录 A/坑 7 需更新。

附录 K:生产事故附记(并发实例私有区互覆写)

本条目生产过程中发生一起并发实例私有区互覆写事故,按纪律包 §0 第 2 条与 apollocorpus 五步处置流程记录如下:

  • 现象:本代理(原代理名 agent-d-refuge2)按派发约定创建带时间戳的私有区 .parts_agent-d-refuge2_1790774704/,先做 10 秒 md5 稳定采样(通过),随后撰写 5 个 part。但在拼接前复核发现:part1.md 内容已被另一同名实例的成稿完全覆盖(其标题为"MICCAI 2020 多厂商眼底青光眼挑战赛续作",与本代理"四相机青光眼眼底挑战赛"措辞不同,且所有本代理特征串命中数为 0);part2.md、part3.md、part5.md 亦属该另一实例;仅 part4.md 幸存为本代理原文。
  • 原因判定:另一同名/同 slug 实例计算出同一个私有区路径(时间戳相同),导致两实例写入同一目录互相覆写——即纪律包所记"同名代理双实例互写"事故的再现。时间戳后缀本应防此,但两实例时间戳撞车使其失效。
  • 五步处置:①弃用被污染的私有区,改锁保护的全新私有区 .parts_agent-d2-refuge2_1790774950/(更换代理名为 agent-d2-refuge2 并更新 .lock);②对被污染目录逐文件做特征串归属鉴别(结果见上);③在新私有区全量重写5 个 part(单一作者、一致措辞);④重拼并按章节序核对(§0–§11 + 附录 A–P);⑤本次事故写入本附记。
  • 证据保全:被污染的原始私有区已备份至 /tmp/refuge2_incident/contaminated_parts_<ts>/。
  • 教训:同批派发应避免同名代理前缀重复;私有区名的时间戳后缀需进一步引入随机/进程唯一标识,以防同名实例时间戳撞车。本附记建议后续派发侧将同 slug 绝不双实例列为硬约束。

附录 L:REFUGE2 与主要眼底数据集的横向坐标

把 REFUGE2 放到青光眼/眼底数据集谱系里(部分口径见论文 Table 1,库内 rid 见 §8):

数据集 总量 相机/设备 青光眼标签 OD/OC 分割 中心凹 库内 rid
REFUGE1 1200 Zeiss, Canon ✓ ✓ ✓ 62
REFUGE2 2000 四台 ✓ ✓ ✓ 本条
DRISHTI-GS 101 单设备 ✓ ✓ × 301
RIM-ONE 169 Canon ✓ ✓ × 291
ORIGA 650 Canon ✓ ✓ × —
IDRiD 516 KOWA × ✓(含病灶) ✓ 191
MESSIDOR 1200 TOPCON — × × 59
JustRAIGS 十万级 多设备 ✓(转诊) × × 746
AIROGS >11 万 多设备 ✓(筛查) × × 未收录

REFUGE2 的差异化在于同时具备"四设备 + 三任务 + 人机对照"——这一点在表内无出其右。

附录 M:复现建议与实操清单

打算在 REFUGE2 上做实验,建议按此清单推进:

  1. 注册与下载:官网 /Home2020/ 注册(真名、单位全称、邮箱),下载训练集(1200)+ 在线集(400);现场集(400)需按挑战赛流程获取盲测结果。
  2. 统一预处理:四相机分辨率不一(2124×2056 / 1634×1634 / 1940×1940 / 1848×1848),需统一缩放或裁剪;考虑颜色/染色归一化以缓解论文所述色偏。
  3. 划分:若只做离线研究,可用训练集内部再划分交叉验证;若要复现"域泛化"结论,则以 Zeiss/Canon 为源域、KOWA/TOPCON 为目标域。
  4. 三任务基线:分类用 EfficientNet/ResNet,分割用 U-Net 家族(建议"由粗到细"),定位用距离图/热图回归——对齐论文强队的选型。
  5. 指标:分类报 AUC(95% CI,DeLong);分割报 OD/OC Dice + vCDR MAE;定位报 AED(像素)。
  6. 域适应对比:至少对比"仅源域训练"“多域数据训练”"测试时适应(TTT)"三种策略,并对齐论文"权重冻结"的盲测设定,否则结论会偏乐观。
  7. 人机参照:引用论文的人工上下界(分割最佳/最差、定位 AED 22.94–27.41)作为对照线。
  8. 合规检查:确认用途为非商业,不再分发衍生数据集;若商用需另行授权。

附录 N:常见问题补遗(接 §1 十问)

Q11:REFUGE2 的"多标注(multi-annotation)"到底指什么?

论文标题与摘要用 “multi-annotation” 强调同一批图像同时具备三类标注——青光眼分类标签、OD/OC 分割掩码、中心凹坐标。注意它不等于"每张图被多人重复标注";标注人数为 7 名医师初标 + 1 名专家复核(论文口径),未逐张披露每张被标注几次。

Q12:为什么说它的"多画质(multi-quality)"也是卖点?

论文主张 REFUGE2 是"多标注、多画质、多设备"三者兼备。多画质体现在它刻意保留了不同质量档的图(onsite 集 good/usable/reject = 267/57/76),并据此做了质量分层评测——这比只留"干净图"更贴近真实筛查。

Q13:训练集能单独当数据集用吗?

能,但它就是 REFUGE1 的 1200 张。若你的研究只关心 Zeiss/Canon 两机,直接用 REFUGE1(库内 rid 62)更规范,避免把它们误当作 REFUGE2 的"新数据"。

Q14:现场集(onsite)真的拿不到标签吗?

论文 Table 2 明确其公开标签为 “×”。要评测,须走挑战赛官网的提交-评测流程;直接拿到带标签的 onsite 集不在公开范围内。

Q15:论文的结论对今天的模型还成立吗?

论文发表于 2022(v3)。其"多域数据训练优于事后域适应""分割可比肩医师、定位仍不如医师"等结论,为当下研究提供了基线;但方法(如 Vision Transformer 只是少数队尝试)已过去数年,复现时应以最新方法重跑,把 REFUGE2 当作固定的多域评测集而非 SOTA 排行榜。

附录 O:术语的英文首现对照(全文索引)

正文术语首现处均已标英文,此处汇总便于检索:

序号 术语(中 → 英) 首现节
1 彩色眼底照片 → Color Fundus Photography (CFP) §0
2 视盘 → Optic Disc (OD) §0
3 视杯 → Optic Cup (OC) §0
4 垂直杯盘比 → vertical Cup-to-Disc Ratio (vCDR) §0
5 域偏移 → domain shift §0
6 黄斑中心凹定位 → fovea localization §0
7 测试时训练 → Test-Time Training (TTT) §1 Q8
8 无监督域适应 → Unsupervised Domain Adaptation (UDA) §1 Q8
9 由粗到细 → coarse to fine §4.4
10 平均绝对误差 → Mean Absolute Error (MAE) §5.2
11 平均欧氏距离 → Average Euclidean Distance (AED) §5.2
12 初赛 → preliminary round §5.1
13 决赛 → final round §5.1
14 距离图 → distance map §7.7
15 高斯热图 → Gaussian heatmap §7.7

附录 P:数字——来源——存照一一对应(审计表)

陈述 数值 来源 存照位置
总量 2000 张 论文 §2.2/Table 2;Zenodo;IEEE DataPort §2.1
复用 REFUGE1 1200 张 论文 §2.2 原文 §2.2
新增 800 张 论文 §2.2 原文 §2.2
四相机分辨率 2124×2056 / 1634×1634 / 1940×1940 / 1848×1848 论文 Table 2 §2.1
青光眼/非 280/1720 论文 Table 1/2 §2.1
质量分层 267/57/76 论文 §5.2 §2.4
标注者 7 医师 + 1 专家 论文 §2.2 §4.2
许可 CC BY-NC-ND 论文 §2.2 §6.1 / 坑 4
分类现场最优 AUC 0.883(VUNO) 论文 Table 6 §7.1
分割现场最优 OD 0.961/OC 0.865/MAE 0.055(cheeron) 论文 Table 8 §7.2
定位现场最优 AED 21.841(MAI) 论文 Table 9 §7.3
人工分割最佳/最差 0.865-0.952-0.049 / 0.742-0.817-0.084 论文 §5.1 §7.3
人工定位 AED 22.94–27.41(均值 24.96) 论文 §5.1 §7.3
参赛规模 1300+/134/3000+/22 论文 §2.1;IEEE DataPort §5.4
排名公式 0.45/0.45/0.1;0.3/0.7 论文 §2.3 式(1)(2) §5.3
数据体积 17.5 GB(口径存疑) Zenodo 记录页 §2.6 / 坑 7
引用数 74 / 25.563(三源不一) Google Scholar / ScholarFeed §10 存照

附录 Q:四子集逐项规格卡

把四个子集的关键规格逐项列出,便于工程建模时快速查阅:

项 Training-Zeiss Training-Canon Online-KOWA Onsite-TOPCON
相机 Zeiss Visucam 500 Canon CR-2 KOWA TOPCON TRC-NW400
分辨率 2124×2056 1634×1634 1940×1940 1848×1848
张数 400 800 400 400
青光眼/非 40/360 80/720 80/320 80/320
公开标签 ✓ ✓ ✓ ×
角色 训练 训练 初赛在线评测 决赛现场盲测
是否新数据 复用 REFUGE1 复用 REFUGE1 全新 全新
与其他子集域关系 源域之一 源域之一 目标域(在线) 目标域(盲测)

建模要点:训练时若只用一个源域(如仅 Zeiss),跨域落差会更大;论文的强队多用两个源域混合训练,甚至引入额外多域数据(如 ACRIMA 含 Topcon 样本)。

附录 R:三任务评测指标的计算口径

指标 定义 取值范围 方向 计算细节
AUC ROC 曲线下面积 0–1 越大越好 用 DeLong 法算 95% CI
Dice 2· A∩B / ( A
vCDR MAE 平均绝对误差 ≥0 越小越好 比较"分割派生的 vCDR"与"金标准 vCDR"
AED 平均欧氏距离(像素) ≥0 越小越好 中心凹预测坐标与真值的距离均值

排名规则回顾:Task2 内 R_total = R_disc + R_cup + R_vCDR;三任务 R = 0.45·R_cls + 0.45·R_seg + 0.1·R_loc;总榜 R_final = 0.3·R_online + 0.7·R_onsite。

附录 S:论文中的人机对照原始数字(审计用)

对照项 数值 说明
人工分割最佳 Dice_OC 0.865 / Dice_OD 0.952 / MAE 0.049 7 名医师初标中的最好者
人工分割最差 Dice_OC 0.742 / Dice_OD 0.817 / MAE 0.084 7 名医师初标中的最差者
算法分割(现场第 1) Dice_OC 0.865 / Dice_OD 0.961 / MAE 0.055 cheeron,接近最佳人工
人工定位 AED 区间 22.94–27.41 像素 7 名医师各自标注
人工定位 AED 均值 24.96 像素 跨标注者平均
算法定位(现场第 1) 21.841 像素 MAI,唯一优于所有人工者

结论:分割上自动化已"达标"(优于最差人工、接近最佳人工);定位上自动化仍"欠火候"(仅一队跑赢人工)。

附录 T:本条目撰写过程的三查与留痕

按纪律包 §0 要求,本条目的开工与生产留痕如下:

检查项 结果
租约锁 .lock 开工前不存在 → 创建;事故后换为 agent-d2-refuge2 2026-09-30T21:29
环境残留 `ps aux \ grep -c codebuddy`
私有区 10 秒 md5 采样(首区) 通过(空区稳定)
私有区 10 秒 md5 采样(次区) 通过(空区稳定)
拼接前复核 发现互覆写事故(见附录 K)
拼接后章节序核对 §0–§11 + 附录 A–T,顺序正确
slug 查重 仅命中 refuge(62),无 refuge2
目录查重 writing/ 无 refuge2(开工前)

附录 U:引用与致谢格式建议

若在论文中引用 REFUGE2,建议按下述信息齐备地标引:

  • 数据集:REFUGE2 – 2nd Retinal Fundus Glaucoma Challenge Dataset,Zhongshan Ophthalmic Center, Sun Yat-sen University;经 https://refuge.grand-challenge.org/Home2020/ 获取;许可 CC BY-NC-ND。
  • 论文:Fang H, Li F, Wu J, Fu H, et al. REFUGE2 Challenge: A Treasure Trove for Multi-Dimension Analysis and Evaluation in Glaucoma Screening. arXiv:2202.08994, 2022.
  • 前作(若用到 1200 张重叠图):Orlando JI, Fu H, Breda JB, et al. REFUGE Challenge: A unified framework for evaluating automated methods for glaucoma assessment from fundus photographs. Medical Image Analysis, 2020, 59:101570.
  • 设计文档:2nd Retinal Fundus Glaucoma Challenge 2020. Zenodo. doi:10.5281/zenodo.3714947.

提示:若同时使用 REFUGE1 的 1200 张与 REFUGE2 的新 800 张,必须分别标注两者来源,并说明重叠部分的去重/归属。

附录 V:本条目未采纳/已排除的说法

为透明起见,列出撰写中考察但未采纳的说法及理由:

说法 处置 理由
“REFUGE2 = 1,200 张” 排除 任务头 brief 错误,三源均证为 2000 张(凡 1200 皆 REFUGE1)
“REFUGE2 是 REFUGE1 的别名” 排除 名字不对应同一集合,实为超集后继
“REFUGE2 许可同为 CC BY 4.0” 排除 论文原文为 CC BY-NC-ND,许可收紧
“数据集体积 17.5 GB” 存疑未采纳 Zenodo 字段口径不明,论文未给 GB 数
“REFUGE2 已被某期刊正式收录” 未证实 检索未见正式收录记录,按预印本处理
“每张图被多人重复标注” 未采纳 论文口径为 7 医师初标 + 1 专家复核,multi-annotation 指多任务标注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(arXiv:2202.08994 v3)、Zenodo 挑战设计文档(10.5281/zenodo.3714947)、IEEE DataPort 页面(10.21227/7d23-j419)与库内 refuge(62) 记录为源;任务头 brief 规模错误、arXiv 题名跨版本差异、许可版本差异、引用数三源不一等原始缺陷均已在 §10 坑点与附录存照。条目与库内 REFUGE(rid 62)、DRISHTI-GS(rid 301)、RIM-ONE(rid 291)、JustRAIGS(rid 746)、FairSeg(rid 371)、ADAM(rid 735)等条目互链,构成眼科青光眼与眼底影像家族的完整检索面。后续维护触发点见附录 J。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • justraigs — 共享标签:医学影像 / 眼科影像 / 图像分类 / 挑战赛数据集 / 青光眼
  • origa-light — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • riga — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • refuge — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼
  • papila — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • sics-155 — 共享标签:医学影像 / 眼科影像 / 图像分类 / 挑战赛数据集
  • g1020 — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • oimhs — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类
  • gamma — 共享标签:医学影像 / 眼科影像 / 青光眼
  • palm — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集