信息速览
INFOBOX — JustRAIGS 一屏速览
维度 内容 本质 ISBI 2024 挑战赛 + 配套公开训练集(青光眼转诊筛查,双任务:二分类 + 多标签解释) 团队 影像方 EyePACS LLC(美国)|标注方 Rotterdam Eye Hospital / Rotterdam Ophthalmic Institute(荷兰) 论文 数据论文:Ophthalmology Science 2023;3(3):100300|挑战赛总结:IEEE TMI 2025(PMID 40773411) 数据(训练) 101,442 张眼底图 / 55,736 患者;RG 3,270 / NRG 98,172 数据(全库) 111,178 张 CFPs / 61,919 患者(TMI 口径,另有多口径存照) 传感器 JPEG 彩色眼底照相(CFP),10 种相机型号,约 500 个筛查点 Task 1 RG vs NRG 二分类,指标 Sensitivity at 95% Specificity Task 2 RG 图 10 项青光眼体征多标签,指标 Hamming loss 标注 2 名 grader 双评 → 分歧由专家 G3 终审;grader 经 EODAT 考核;实测 20 名合格 最佳成绩 sens@spec95% 最高 85%;平均 Hamming loss 最低 0.13;冠军 VUNO(韩国) 测试集 闭集不公开(9,736 张 / 6,183 患者,TMI 口径;官网 9,741) 获取 Zenodo 10035093(CC BY-NC-SA,需接受条款;6 分卷 + labels,54.2 GB) 前作 AIROGS(同团队,113,893 眼青光眼筛查)——库内暂无条目 库内互链 refuge(rid 62,青光眼视盘分割)、eyepacs(rid 58,同源数据)、fives/rfmid/odir 等眼底条目
JustRAIGS 是一个把青光眼筛查的"要不要转诊"和"为什么该转诊"两件事一次性摆到台面上的挑战赛(ISBI 2024)。它不满足于让模型输出一个二分类概率,而是要求模型在判出"需转诊"(RG)之后,进一步指出支撑判断的 10 个具体青光眼体征(如神经视网膜边缘上部/下部异常、视网膜神经纤维层缺损、视盘出血、大视杯等)——这正是临床上眼科医生写转诊单时要说明的理由。数据集来自 EyePACS 在美国约 500 个筛查点采集的十万余张彩色眼底图,由荷兰 Rotterdam Eye Hospital 的专家按严格的双评+终审流程标注,训练集约 10 万张以 CC BY-NC-SA 在 Zenodo 公开,闭集测试集则永不公开。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——训练集在 Zenodo(CC BY-NC-SA),测试集闭集,别指望复现 leaderboard。
- 关心任务设计:直奔 §5 任务定义与 §3 注释流水线——Task 1/Task 2 的双层目标与"分歧即忽略"的标签规则是全篇最有迁移价值的部分。
- 做青光眼或眼底 AI:直奔 §9 库内关系——refuge(同为青光眼)与 eyepacs(同源数据)是最强互链点,JustRAIGS 补上了"转诊决策+可解释性"这一格。
§0 导读:这个数据集解决什么问题
青光眼是全球不可逆致盲的首要原因,而它的可怕之处在于早期几乎没有症状——视野损害往往在不知不觉中已过半。因此青光眼筛查的关键产品不是"诊断",而是一个转诊决策:眼前这张眼底图的主人,到底该不该被转去眼科专科做进一步检查?这里有一个临床上的微妙之处:并非所有眼底异常都需要立刻转诊,极早期的病变(尚无预期视野损害)临床上可以观察随访而非转诊,而一旦眼底体征提示"预期存在视野损害",就必须转诊。JustRAIGS 把这一临床逻辑直接编码成任务:正类 RG(Referable Glaucoma,需转诊青光眼)对应的正是后者。
传统青光眼 AI 筛查研究大多止步于"给一个是不是青光眼的分数"。这带来两个问题:一是低患病率场景(本数据集 RG 仅约 4.38%)下模型倾向保守,且单纯的 AUC/准确率无法反映临床上真正关心的"在高特异度下还能抓到多少病例";二是黑箱式的分数无法被临床医生信任,医生需要知道模型"看到了什么"才敢采纳它的转诊建议。JustRAIGS 的回答分为两层:Task 1 用 Sensitivity at 95% Specificity 这一贴近临床的指标评估转诊判别力(在 95% 特异度门限下测灵敏度,即"在保证极少误报的前提下能抓到多少真阳性");Task 2 则要求模型对每个 RG 图像给出 10 项青光眼体征的多标签判断,用 Hamming loss 评估解释质量——这就把"可解释性"从附加说明变成了可量化、可排行榜的任务。
§0 读法三则:
- 这个条目是"挑战赛 + 数据集 + 基准"三合一:本体是公开训练集,任务与指标是一套评测基准,测试集闭集,三者获取方式不同(§6)。
- 全文涉及多套规模口径(总量、测试集、参评队伍数、许可),凡有冲突处均在 §9 与坑点中存照,引用请标明来源。
- 检索时注意区分三个同源名:JustRAIGS(本挑战赛)、AIROGS(同团队前作)、EODAT(grader 选拔用的视神经阅片考核,非数据集)——它们常在同一文献群里出现。
§1 数据集速览:十问十答
Q1:JustRAIGS 是什么的缩写?
Justified Referral in AI Glaucoma Screening——“可解释转诊的 AI 青光眼筛查”。另一展开式为 “Justify your AI prediction for Referable or Not Referable Glaucoma Screening”,强调模型必须为"可转诊/不可转诊"的判断给出证据。两种展开均见于官方与 EyeDataHub 记录。
Q2:它是数据集还是挑战赛?
两者都是。它是一个 ISBI 2024 官方挑战赛,同时也是配套发布的公开训练集。挑战赛本体提供训练集与闭集测试集,训练集在 Zenodo 公开,测试集永不公开。
Q3:数据从哪来、多少张?
影像由 EyePACS LLC(美国加州圣克鲁斯)从其糖网筛查项目提供,覆盖美国约 500 个筛查点;标注由荷兰 Rotterdam Eye Hospital / Rotterdam Ophthalmic Institute 完成。公开训练集为 101,442 张可评估眼底图 / 55,736 患者;全库(含闭集测试集)TMI 论文口径为 111,178 张 CFPs / 61,919 患者。
Q4:RG 和 NRG 分别是什么?
RG = Referable Glaucoma(需转诊青光眼):眼底图显示青光眼体征、预期存在视野损害,应转专科。NRG = No Referable Glaucoma:无显著需转诊指征,极早期病变(尚无预期视野损害)也归 NRG。训练集中 RG 3,270 张、NRG 98,172 张。
Q5:两个任务分别做什么?
Task 1 是 RG/NRG 二分类,评的是转诊判别力(Sensitivity at 95% Specificity)。Task 2 只针对 RG 图像,做 10 项青光眼体征的多标签分类,评的是解释质量(Hamming loss)。Task 2 的十项体征见 §5。
Q6:指标为什么这么设计?
青光眼筛查是低患病率场景(RG 约 4.38%),误报的代价是大量健康人被转诊、浪费专科资源;漏报的代价是失访致盲。因此用 Sensitivity at 95% Specificity——固定一个很高的特异度门限(95%),看模型还能捞回多少真阳性,比单纯 AUC 更贴近临床决策点。Task 2 用 Hamming loss(多标签平均错分比例,越低越好)。
Q7:标注可靠吗?
流程严格:每图由 2 名 grader(经 EODAT 视神经阅片考核筛选)从合格池随机抽取独立判 RG/NRG;一致即终判,分歧由第 3 名青光眼专家终审。选 RG 的 grader 须勾选转诊理由(10 项体征)。附加体征标签若仍分歧,则该标签在算法评估中对该图忽略。数据论文实测 grader 平均灵敏度 85.6%(SD 5.7)/ 特异度 96.1%(SD 2.8),两名 grader 一致率 92.45%。
Q8:最好成绩是什么水平?
TMI 挑战赛总结论文:sens@spec95% 最高 85%,平均 Hamming loss 最低 0.13。冠军队伍 VUNO(韩国) Task 1 recall 0.9090 @ 95% 特异度、Task 2 Hamming loss 0.1240。可见"高特异度下高灵敏"与"多标签解释"都远未饱和。
Q9:我现在能拿到什么?
训练集走 Zenodo 10035093(CC BY-NC-SA,需在页面接受条款;6 个分卷 zip + 1 个 labels CSV,合计 54.2 GB)。测试集闭集、不公开。评估脚本与部分参赛方案在 GitHub 公开。
Q10:它对 AI-Ready 重要在哪?
它是库内少见的"低患病率 + 可解释性"双约束筛查基准:Sensitivity at 95% Specificity 与 Task 2 多标签把筛查 AI 的评估从"准不准"推进到"临床可用不可用、可不可信"。同时它与库内 refuge(青光眼)、eyepacs(同源数据)形成强互链,补齐眼底筛查家族的转诊决策一格。
§2 数据构成与规格
本节把 JustRAIGS 的"数据实体"讲清楚:总量有多少、分几层、每层多少、图像从哪来、拍成什么样、类别怎么分布。凡遇多来源数字不一致处,一律双列并标注来源(对应 FACTS §4、§9 的存照表),不取单一口径。
2.1 规模、来源与机构构成
JustRAIGS 的"数据集"其实是一个三层结构:全库(含闭集测试)→ 公开训练子集 → 挑战赛专用测试子集。
| 层级 | 眼底图数 | 患者数 | 公开性 | 来源口径 |
|---|---|---|---|---|
| 全库(all CFPs) | 111,178 | 61,919 | 部分(仅训练子集公开) | TMI 2025 论文表 |
| 全库(另口径) | 113,893 眼 | 60,357 人 | — | Ophthalmology Science 2023(与 AIROGS 全库同口径) |
| 公开训练子集 | 101,442 | 55,736 | 公开于 Zenodo | 官网 /dataset/ + Zenodo + TMI 三处一致 |
| 挑战赛测试子集 | 9,741(官网)/ 9,736 / 6,183 患者(TMI) | 6,183 | 永不公开 | 双口径存照 |
全库宣传语在官网写作 “over 110k images from about 60,000 screenees, taken at about 500 sites”——这是面向读者的约数,与论文的精确表数字并存,不是矛盾而是精度差异。
影像提供方与标注提供方是两家不同的机构,这一点在引用时必须分清:
- 影像来源:EyePACS LLC(Santa Cruz, CA, USA),眼底图取自其糖网筛查项目(diabetic retinopathy screening)的常规拍摄。这意味着图像本身并非"为青光眼专门采集",而是筛查场景下的既有眼底照相(CFP)——人群构成、拍摄设备、图像质量都带着糖网筛查项目的现实痕迹。
- 标注来源:Rotterdam Ophthalmic Institute / Rotterdam Eye Hospital(荷兰鹿特丹眼科医院与眼科研究所)。标注者由该机构的青光眼专家体系组织与质控。
为什么"影像来自 A、标注来自 B"很重要:这决定了 JustRAIGS 的标签是"跨机构、事后判读"而非"本院临床金标准"。判读者看不到患者的视野报告、眼压、随访史,只能从单张(或数张)眼底图推断"是否预期存在视野损害"——RG 的定义本质是一个基于影像的转诊判断,而非基于确诊的诊断。理解这一点,才能正确解读 Task 1 的指标设计(见 §5)。
覆盖范围方面,全库取自美国境内约 500 个筛查点,族裔与人群高度异质。这不是一个"单一医院单一人群"的干净实验集,而是一个真实世界筛查场景的横切样本——优势是泛化外部效度好,代价是混杂因素多。
2.2 图像规格与设备构成
格式与分辨率:图像为 JPEG 格式。与 JustRAIGS 同源的 AIROGS 全库报告的分辨率中位数为 2354 × 3296 × 3,范围从 212 × 320 × 3 到 6000 × 6000 × 3——跨度极大。这意味着预处理(缩放、裁剪、去黑边)不是可选项而是必需项,各参赛方案的输入分辨率从 224×224 到 800×800 不等(见 §5.3)。
设备构成是这张表里最容易被忽略、却最影响复现的一件事。训练集 101,442 张图的相机分布(TMI 2025 论文表):
| 相机型号 | 数量 | 占比 |
|---|---|---|
| Optovue iCam100 | 26,480 | 26.1% |
| Topcon NW400 | 20,557 | 20.3% |
| 未知(unknown) | 20,826 | 20.5% |
| Canon CR1 | 10,274 | 10.1% |
| Canon DGI | 9,581 | 9.4% |
| Canon CR2 | 9,179 | 9.0% |
| Topcon NW200 | 2,888 | 2.8% |
| Centervue DRS | 1,598 | 1.6% |
| Nidek AFC300 | 153 | 0.1% |
| Crystalvue NFC-700 | 6 | 0.0% |
读这张表的三条要点:
- 没有任何单一设备占绝对主导:最高的 Optovue iCam100 也只占 26.1%,Topcon NW400 与"未知"各约 20%。好处是模型被迫学习设备无关的青光眼形态学特征;坏处是域偏移(domain shift)风险分散在多个方向,一次"换设备"的部署就可能同时跨越多条域鸿沟。
- "未知"占 20.5%:超过五分之一的图没有记录设备型号。任何声称"按设备分层评估"的二次研究,都必须先声明这 20.5% 如何处理——直接丢弃会损失数据,归为"其他"又引入异质桶。
- 长尾极长:Nidek AFC300(153 张)与 Crystalvue NFC-700(6 张)几乎可以忽略,但存在——数据卡片里应当保留"支持该设备"的事实,但不能据此声称模型对该设备鲁棒。
这一设备谱系正是 JustRAIGS 与库内同源条目 eyepacs(rid 58)的血缘连接点:两者都源自 EyePACS LLC 的糖网筛查项目影像,只是任务目标不同(eyepacs 是糖网分级,JustRAIGS 是青光眼转诊 + 可解释特征)。见 §9。
2.3 任务相关的标签体系
JustRAIGS 的标签不是"一张图一个病名"的简单分类,而是两层标签:主分类(1 个)+ 附加特征(10 个,仅对 RG 图)。
主分类(Task 1):
- RG(Referable Glaucoma,需转诊青光眼):眼底图显示青光眼体征,且预期存在视野损害(visual field damage expected),应转诊至专科。
- NRG(No Referable Glaucoma,无需转诊):无显著青光眼指征,无需立即转诊。关键细节:极早期病变、尚不预期存在视野损害者,也归入 NRG。
这里有一个极易误读的设计:RG 的门槛是"可转诊 / 预期已有视野损害",而不是"有青光眼"。一个视盘已有可疑改变、但按判读者经验尚不足以预期功能损害的眼睛,会被标成 NRG。所以 JustRAIGS 的 NRG 不等于"健康眼",它包含大量"早早期/可疑"样本。用这个数据集训练"青光眼 vs 健康"的模型会系统性错配——这是 §10 避坑清单里的第一条。
附加特征(Task 2,10 个,仅 RG 图评估):这些特征是判读者被要求"勾选的转诊理由",共 10 项,可多选:
| 缩写 | 英文全称 | 中文含义 | 方位 |
|---|---|---|---|
| ANRS | Appearance neuroretinal rim superiorly | 神经视网膜边缘上部外观异常 | 上 |
| ANRI | Appearance neuroretinal rim inferiorly | 神经视网膜边缘下部外观异常 | 下 |
| RNFLDS | Retinal nerve fiber layer defect superiorly | 视网膜神经纤维层缺损(上) | 上 |
| RNFLDI | Retinal nerve fiber layer defect inferiorly | 视网膜神经纤维层缺损(下) | 下 |
| BCLVS | Baring circumlinear vessel superiorly | 环线血管裸露(上) | 上 |
| BCLVI | Baring circumlinear vessel inferiorly | 环线血管裸露(下) | 下 |
| NVT | Nasalisation of vessel trunk | 血管干鼻侧移位 | — |
| DH | Disc hemorrhages | 视盘出血 | — |
| LD | Laminar dots | 筛板点(可见筛板孔) | — |
| LC | Large cup | 大视杯 | — |
为什么是这 10 项:它们对应青光眼视神经病变的形态学依据链——神经视网膜边缘变薄(ANRS/ANRI)、神经纤维层缺损(RNFLDS/RNFLDI)、血管形态改变(BCLVS/BCLVI/NVT)、出血(DH)、筛板显露(LD)、视杯扩大(LC)。这正好覆盖了青光眼判读的经典教科书要素,也解释了为什么任务叫"Justification"(正当化/给出理由):模型不仅要说"该转诊",还要说出凭哪几条形态学证据。
频率提示(数据论文结论):最常出现的 RG 特征是神经视网膜边缘(NRR)下部与上部外观异常(ANRI/ANRS)——因为边缘变薄是青光眼最普遍、最早可判读的征象;而视盘出血(DH)是最罕见的特征。这一"高频 vs 罕见"的极端不均是 Task 2 的核心难点:罕见标签的样本数极小,Hamming loss 会被高频标签主导(见 §5.2 与 §10 坑 4)。
2.4 类别分布:一个 1:22 的极端不平衡场景
训练子集的类别分布(官网与 Zenodo 一致):
| 类别 | 图像数 | 患者数 | 占比 |
|---|---|---|---|
| RG(需转诊) | 3,270 | 2,336 | ≈ 3.2% |
| NRG(无需转诊) | 98,172 | 53,400 | ≈ 96.8% |
| 合计 | 101,442 | 55,736 | 100% |
测试子集(TMI 论文表口径):
| 类别 | 图像数 | 患者数 |
|---|---|---|
| RG | 1,602 | 1,195 |
| NRG | 8,134 | 4,988 |
| 合计 | 9,736 | 6,183 |
数据论文给出的全体可评估眼中 RG 患病率为 4.38%(基线 111,183 眼)。注意这个 4.38% 与训练子集的 3.2% 口径不同(前者是"全库/可评估眼",后者是"公开训练子集的图"),引用时不要混用。
1:22 左右的极端不平衡意味着什么:
- 准确率(accuracy)是废指标。一个永远输出 NRG 的"模型"在训练集上准确率约 96.8%,却没有任何临床价值。这就是 Task 1 采用 Sensitivity at 95% Specificity 而非 accuracy/AUC 的根本原因(§5.1)。
- 代价不对称:漏掉一个真正需转诊的病人(假阴性)后果远大于把一个不需要转诊者送去复查(假阳性)。指标设计把特异度钉死在 95%,再看在这个高特异度门限下能保住多少灵敏度。
- 训练策略必须处理不平衡:过采样 RG、类别加权、两阶段训练、阈值调优——这些不是"技巧"而是在这张表面前的必需品。
2.5 患者级 vs 图像级的计数边界
JustRAIGS 的所有关键计数都同时给出图像级与患者级两套数字(如训练集 101,442 图 / 55,736 人)。这带来三个必须注意的边界:
- 同一患者可能贡献多张图:55,736 名患者对应 101,442 张图,人均约 1.82 张。若按图随机划分训练/验证,同一患者可能同时出现在两侧,导致验证集乐观偏倚(患者泄漏)。二次研究务必做患者级划分。
- RG/NRG 的患者数与图数不成比例:RG 2,336 人对应 3,270 图(人均 1.40),NRG 53,400 人对应 98,172 图(人均 1.84)——NRG 患者贡献的图更多。按图重采样会进一步扭曲患者分布。
- "图"与"眼"不是一回事:数据论文用"eyes"(眼),TMI/官网用"CFPs"(眼底图)。一只眼可能被拍多张(不同视野、不同时点)。这正是 §9 存照中"113,893 眼 vs 111,178 图"差异的部分来源。
结论:引用 JustRAIGS 的任何数字时,必须同时带两个限定词——是图还是眼?是训练子集还是全库? 缺一个限定词,数字就可能被误读。
2.6 与库内眼底数据集的规格对照
把 JustRAIGS 放进库内既有的眼底条目里横向看,它的定位立即清晰:
| 条目 | rid | 核心任务 | 规模 | 与 JustRAIGS 的关系 |
|---|---|---|---|---|
| refuge | 62 | 青光眼视盘/视杯分割 | 1,200 图 | 同为青光眼域,最强互链:refuge 给像素级分割,JustRAIGS 给图像级转诊+特征标签 |
| eyepacs | 58 | 糖网筛查(分级) | ~88k | 同源 EyePACS LLC,数据血缘互链 |
| messidor | 59 | 糖网分级 | 1,744 | 同为眼底分级任务,域不同(糖网 vs 青光眼) |
| ddr | 201 | 糖网分类 | 13,673 | 同上 |
| idrid | 191 | 印度糖网图像 | 1,613 | 同上,人群域差异 |
| deepdrid | 211 | 糖网分级智能诊断 | 13,673 | 同上 |
| fgadr | 221 | 细粒度糖网 | 1,000+ | 同上 |
| rfmid | 271 | 眼底多疾病分类 | 13,000+ | 多标签任务近似点(但 JustRAIGS 多标签仅限 RG 图) |
| odir | 63 | 眼科多疾病标签 | 7,000 | 多标签,但为"多病种"而非"单病多征象" |
| fives | 741 | 眼底多疾病分割 | 800 | 分割视角,与 JustRAIGS 分类视角互补 |
JustRAIGS 的差异化价值:库内眼底条目几乎全是糖网(DR),青光眼域只有 refuge(且是分割任务)。JustRAIGS 补上了青光眼"图像级转诊判断 + 可解释特征"这一格,并且引入了库内罕见的三个新要素——(a) 双任务设计(二分类 + 多标签)、(b) 低患病率(1:22)下的指标工程(sens@spec95%)、© "标注分歧不消解则忽略"的标签卫生机制。这三条是 §8 方法学启示的来源。
为什么这不是撞库:JustRAIGS 与 refuge 同属青光眼,但任务层级不同(图像级转诊 vs 像素级分割)、标签体系不同(10 个形态学特征 vs 视盘/视杯二类掩码)、规模不同(10 万级 vs 千级)。二者是互补而非重复;条目间应互链而非互斥(查重结论见 FACTS §10)。
§3 注释流水线:两个人投票、专家打破平局、分歧允许被忽略
JustRAIGS 的标签质量是它被高频引用的核心原因之一。本节拆解:谁在标、怎么标、如何质控、以及那个反直觉的"分歧不消解"规则。全部依据官网 /dataset/ 与数据论文(Ophthalmology Science 2023)。
3.1 人从哪来:EODAT 考核的 grader 池
标注者(下文称 grader)不是随便找的医学生,而是经过标准化考试筛选的判读者:
- 候选人须通过 European Optic Disc Assessment Trial(EODAT,欧洲视盘评估试验) 的考核——该试验包含 110 张立体视神经图像,用于校准判读者对青光眼性视盘改变的识别能力。
- 数据论文口径:90 名候选人中 30 名通过(标准:准确率 ≥ 85% 且 特异度 ≥ 92%)。
- AIROGS 论文口径:89 人报名、32 人通过。
- 最终用于训练 JustRAIGS 的合格 grader 为 20 名(数据论文 Results 口径)。
存照(FACTS §9 第 6 条):这三组数字(90→30→20 与 89→32)来自不同文献、不同统计时点,不是矛盾而是口径差异。条目引用时以数据论文口径为主,并注明 AIROGS 的差异,避免读者以为其中一处是笔误。
这个池子的意义:它把"判读青光眼"从"专家个人技艺"变成了"通过统一考核的合格判读者群体的一致判断"。这是可复现的标注质量基线——你可以质疑判读者是否为"顶级专家",但不能指责它"来源不明"。
3.2 工作流:2 人独立判读 → 专家打破平局
官网 /dataset/ 给出的流程如下(逐步):
- 每张图由 2 名 grader(G1/G2)从合格池中随机抽取,各自独立标注主分类(RG / NRG)。
- 若 G1 与 G2 一致 → 该判定即为终判。
- 若 G1 与 G2 分歧 → 交由 grader 3(G3,青光眼专家) 判定,G3 的判定为终判。
- 当某名 grader 判定为 RG 时,其须勾选转诊理由——即 10 项附加特征(可多选)。
- 附加标签的分歧不消解(见 3.3)。
- 任一附加标签若仍有分歧 → 该标签在算法评估中对该图被忽略。
这套流程的三个设计意图:
- 两人独立 + 随机配对:避免固定搭配带来的系统性共谋(两名判读者长期合作会形成"默契偏差")。
- 专家只处理分歧:把有限的专家时间集中投放在最难的案例上——这是成本效益最优的分工。粗略估计,若两人一致率 92.45%(见 3.4),则专家只需介入约 7.55% 的图。
- 主分类与附加标签分离处理:主分类追求"一个确定答案"(可用专家打破平局),附加标签则是"证据的多选清单",允许部分未知。
3.3 反直觉的规则:附加标签分歧"不消解",而是"忽略"
这是 JustRAIGS 最值得学的一条**标签卫生(label hygiene)**设计,也是最容易被误读的一条:
附加标签(10 项特征)的分歧不通过"再找一个人投票"来消解;若终判后某个附加标签仍存分歧,则该标签对该图在评估中被直接忽略。
具体地,某张 RG 图的某个附加标签,其终值按主分类的一致性情形取值:
- 若 G1、G2 主分类一致 → 附加标签取两名初评者一致的部分(即两者都勾选的项为确定阳性;两者都未勾为阴性)。
- 若两人主分类分歧、由 G3 终判 → 附加标签取一名 grader 与专家一致者,或仅专家的勾选。
- 无论如何,任何仍存在分歧的附加标签项,在该图的评估中置为"不计分"。
为什么这是好设计:
- 它区分了"数据缺失"与"标签为负"。传统做法是"有分歧就取多数或取专家",把不确定强行压成确定,污染标签。JustRAIGS 的做法是承认不确定,把它标为"该图在此标签上不可用"。
- 它是"宁可少算,不可算错"的体现。评估时忽略疑难样本,虽然减少了有效样本量,但保证了进入评估的标签是高置信的——这与 Task 2 使用 Hamming loss(对每个标签独立计分)天然契合:某些标签在某些图上被 mask 掉,不影响其他标签。
- 它对复现者提出了要求:二次使用者必须实现标签级别的 mask,而不能简单地把"忽略"当成"负样本"。把忽略当负样本,会系统性低估罕见特征(如 DH)的阳性率——这正是 §10 坑 5。
3.4 质控账:性能监控与"跌线即退"
除了两人投票 + 专家破平局,数据论文还披露了一层动态质控:
- 每名 grader 的表现被持续监控。以最终判定为参考,若某 grader 的灵敏度跌至 < 80% 或特异度跌至 < 95%,则退出,其已标注的图由他人重做。
- 经过这层筛选,最终 20 名 grader 合格上岗。
grader 群体的整体表现(数据论文):
- 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)。
- 两名 grader 之间的一致率为 92.45%,Gwet’s AC2 = 0.917。
怎么读这组数字:
- 特异度(96.1%)明显高于灵敏度(85.6%)——判读者在"排除不需要转诊者"上更自信,在"揪出需要转诊者"上更谨慎(也更易漏)。这与临床筛查"宁可放过、不敢错抓"的直觉相反吗?恰恰相反——筛查者面对的是海量正常样本,他们在"确认异常"上天然保守,这正是 RG 患病率被压到 4.38% 的判读侧原因之一。
- Gwet’s AC2 = 0.917 是"良好到优秀"的一致性(AC2 相比 Cohen’s kappa 更不受患病率极端不平衡影响,是低患病率场景的正确选择)。92.45% 的表观一致率看起来高,但在 3.2% 阳性率下,随机一致率本身就很低——所以 AC2 这个校正指标才是真正有说服力的数字。
- SD 的存在说明 grader 之间有差异:灵敏度 SD 5.7、特异度 SD 2.8。这意味着**“JustRAIGS 标签"不是单一权威的产物,而是一个群体的中心趋势**——原论文也正因此把标签描述为"graders 的判定”,而非"金标准"。
3.5 这套流水线的可迁移性
把 §3 抽象成可复用的 SOP:
- 建合格池:用标准化考卷(此处为 EODAT)筛选判读者,设定双门限(准确率 + 特异度),而非单一准确率。
- 两人独立 + 随机配对:消除固定搭配偏差。
- 专家只处理分歧:把昂贵人力投向边际信息量最大的地方。
- 动态淘汰:用滚动性能监控剔除劣化判读者,已标数据重做(保证全库质量同质)。
- 不确定允许存在:分歧标签标记为"忽略",而非强判。
- 报告一致性的正确指标:不平衡场景用 Gwet’s AC2,别只报 Cohen’s kappa。
这六条不依赖青光眼领域知识,可迁移到任何"专家稀缺 + 类别不平衡 + 需要多标签理由"的医学影像标注项目。这是 §8 的第一条方法学启示。
§4 挑战赛本体:ISBI 2024 的双任务、指标与赛场实况
JustRAIGS 不只是数据集,更是一场正式的学术竞赛。忽略"挑战赛"这一层,就会误读它的指标设计、测试集闭源策略、以及那个让很多人困惑的"46 还是 20 支队伍"。本节把赛事规则与结果讲全。
4.1 赛事身份与时间线
- 赛事:ISBI 2024(IEEE International Symposium on Biomedical Imaging,IEEE 国际生物医学成像研讨会)官方挑战赛。
- 参赛门槛(硬性):参评队伍须线下出席 ISBI 2024 并全额注册会议;提交按 ISBI 主会议**正常论文(4 页限制)**处理。这意味着 JustRAIGS 是一个"带论文产出的精英赛",而非纯线上打榜——这也解释了为何最终进入正式评估的队伍数量有限。
- 训练集发布:Zenodo 首版发布于 2024-01-08(与开发阶段起始日一致,Zenodo 版本史仅此一版)。
- 时间线(TMI 2025 论文口径):
| 阶段 | 起 | 止 | 说明 |
|---|---|---|---|
| 开发阶段(development) | 2024-01-08 | 2024-04-20 | 约三个月,训练集于此期间公开于 Zenodo,参赛者可在公开训练集 + 本地验证上迭代 |
| 测试阶段(test) | 2024-03-01 | 2024-04-20 | 用闭集测试集评估,参赛者无法看到测试标签 |
注意两个阶段是重叠的(测试阶段在开发阶段后段开启)——这是挑战赛常见设计:让参赛者在最后一个月用真实测试集盲测提交,压缩过拟合窗口。
4.2 参与规模:一个必须双列的"46 vs 20"
这是本条目最典型的双口径冲突(FACTS §9 第 2 条):
- TMI 2025 论文口径:开发阶段 322 名参与者、来自 37 个国家;进入测试阶段 20 支队伍。
- 新闻口径:VUNO 官方新闻稿与 Asia Business Daily 均称"46 支队伍、自 2024 年 1 月起约四个月"。
如何解读这个差异:
- 两者并非同一统计对象:论文的"322 参与者 / 37 国"是开发阶段的注册/参与规模,而"20 支队伍"是通过筛选进入测试阶段正式评估的队伍数;新闻的"46"更可能对应某个中间时点的报名/提交队伍数。
- 但数字差异显著(46 vs 20),不能简单一句"口径不同"带过。本条目按论文口径成稿(322 / 37 国 / 20 队),并在此处显式登记新闻口径,供读者按需取用。
- 实践建议:写论文引用时用 TMI 论文的 20 队/322 参与者;写科普或产业稿引用时可用"公开报道曾称 46 支队伍",但需注明来源与口径。
为什么这件事值得单列一节:它示范了 AI-Ready 条目处理"同一事实多来源" 的标准动作——不隐藏、不独断、双列、标出处、给取舍建议。这正是 FACTS §9 存照机制在成稿中的落地。
4.3 两个任务与两把尺子
Task 1 — Referral performance(转诊性能):二分类 RG vs NRG。
- 指标:Sensitivity at 95% Specificity(sens@spec95%)——在特异度固定 ≥ 95% 的操作点上测量灵敏度。
- 为什么这样设计:低患病率(4.38%)筛查场景下,若同时优化敏感度与特异度,模型会倾向"多报阳性"以刷高灵敏,导致海量假阳性转诊,临床上不可接受。把特异度钉死在 95%,等于规定"最多只能有 5% 的不必要转诊",然后问"在这个前提下你能救回多少真病人"。这是临床可部署性优先的指标工程。
Task 2 — Justification performance(正当化/可解释性能):对 RG 图像做 10 个附加特征的多标签分类。
- 指标:Hamming loss(多标签平均汉明损失,越低越好)——对每个样本的每个标签独立判断对错,取错误比例平均。
- 注意:Task 2 只在 RG 图像上评估。这与标注流程一致(只有判为 RG 的 grader 才被要求勾选理由)。不要把 NRG 图也算进 Task 2 的评估,那会引入大量"全负"样本,把 Hamming loss 人为压低。
- "忽略"规则的落地:§3.3 中"分歧标签被忽略"直接体现在 Hamming loss 的实现里——被忽略的标签不计入分母。二次复现者若忽略此规则,得到的 Hamming loss 不可与前人结果比较。
两把尺子的关系:Task 1 回答"该不该转",Task 2 回答"为什么该转"。二者耦合——一个 Task 1 表现差(漏检多)的模型,其 Task 2 只在少量检出的 RG 上评估,样本更少、方差更大。因此两任务的成绩必须一起看,单看 Task 2 的 Hamming loss 高分可能建立在"只敢判极少数 RG"的保守策略上(§10 坑 6)。
4.4 赛场实况:谁赢了、赢了什么
冠军:VUNO(韩国,医疗 AI 公司)
- Task 1:recall 0.9090 @ 95% specificity。
- Task 2:Hamming loss 0.1240。
- 代码:
github.com/seunghoonlee-fundus/JustRAIGS-vuno;论文:ISBI 2024,doi 10.1109/ISBI56570.2024.10635758。
挑战赛整体最好成绩(TMI 2025 论文摘要口径):sens@spec95% 最高约 85%;平均 Hamming loss 最低约 0.13。
代表性参赛方案(用于建立"合理水平"的参照带):
| 队伍 | Task 1 结果 | Task 2 结果 | 方案要点 |
|---|---|---|---|
| VUNO | recall 0.9090 @ spec95% | Hamming 0.1240 | 冠军 |
| LaTIM(Brest, 法国) | ResNet50 Ensemble @800×800,sens@spec95% = 0.870 | Eva + DeiT3 + ResNet50 ensemble,Hamming = 0.239 | 代码 github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution |
| ndoladimeji | sens@spec95% = 0.3242,AUC 0.72 | 平均修正 Hamming = 0.1327 | ResNet34,单模型 |
读这张表的三个警示:
- sens@spec95% 的队间差距极大(0.9090 → 0.870 → 0.3242)。裸 ResNet34 单模型在低患病率下的 sens@spec95% 会塌到 0.32——这不是"差一点",是差一个量级。数据集"公开可下载"不等于"容易做好"。
- Task 2 的 Hamming loss 存在"高分低敏"陷阱:ndoladimeji 的 Hamming 0.1327 数值上接近 VUNO 的 0.1240,但其 Task 1 灵敏度只有 0.3242——它可能只在极少数最有把握的 RG 上评估 Task 2,因此 Task 2 数字好看。必须联读两任务。
- 集成 + 高分辨率是主流打法:LaTIM 用 800×800 输入 + 三骨干集成;VUNO 亦为集成方案。这提示分辨率与集成的收益在本任务上显著(低压患病率下的决策边界极难学)。
4.5 外部验证:泛化的真相
TMI 2025 论文对前三名算法在外部数据集上做了泛化验证——这是区分"榜单分数"与"真实可用性"的关键一步。
外部数据集线索:OHTS(Ocular Hypertension Treatment Study)子集——5,000 张 CFP(4,000 正常眼 + 1,000 青光眼眼),用于 Task 2 的外部评估。标签经映射对齐到 JustRAIGS 体系,例如 ThinningDiscRim_RT/LT(颞上/颞下边缘变薄)、NotchRim_RN/LN(切迹)、DiscHemorrhage-DH(视盘出血)、LargeCup_LC(大视杯)等。
为什么外部验证是这节的落点:低患病率 + 多设备 + 跨机构的模型,最容易在"换一个数据集"时崩掉。榜单分数是"在 JustRAIGS 测试集上的分数",不等于临床泛化能力。读者若要把 JustRAIGS 冠军方案直接搬到自有数据上,务必先复现外部验证流程。
待核(FACTS §9):OHTS 子集的公开性未确认——论文用于评估但未声明是否随文公开。二次研究若需该外部集,须自寻 OHTS 申请渠道。
4.6 赛场之外:赛事的"赛后生命"
ISBI 2024 已结束、TMI 2025 总结论文已发表,但 Zenodo 描述仍写 “still ongoing challenge”(FACTS §9 待核项)。时效提醒:
- 作为数据集:JustRAIGS 训练集仍公开可下载(CC BY-NC-SA),这一点不因赛事结束而改变。
- 作为赛事:排名与排行榜已冻结,不会再有新提交计入官方名次。
- 作为社区:各队方案代码散落 GitHub,形成事实上的方法库(VUNO / LaTIM / ASU / ndoladimeji 等),比排行榜更有长期价值。
结论:把 JustRAIGS 理解为"一场已闭幕、但数据集与方案库仍在服役的挑战赛"最准确。Zenodo 的 “ongoing” 措辞是陈旧元数据,不应据以声称赛事仍在进行。
§5 评估与基准:两把尺子、一个榜单,以及"高分低敏"的陷阱
5.1 为什么不能只看准确率
JustRAIGS 首要的评估对象是 Task 1,即"这张眼底图该不该转诊"。如果把它当成一个普通的二分类问题,最直觉的度量是准确率(accuracy)。但在 JustRAIGS 的数据分布下,准确率会给出严重误导的结论:训练子集中 NRG 占 98,172 / 101,442 ≈ 96.8%,RG 仅 3,270 / 101,442 ≈ 3.2%(全体可评估眼口径的 RG 患病率为 4.38%,约 1:22 的类别不平衡)。这意味着:一个"无脑全部预测 NRG"的模型,什么都不学,准确率就能达到约 96.8%,但它对真正需要转诊的 RG 眼,灵敏度是 0。
在筛查场景里,这恰恰是最坏的失败模式。筛查的临床意图是"不放过该转诊的人"(高灵敏度),而不是"少打扰健康人"(高准确率)。因此 JustRAIGS 官方放弃了准确率,改用医学筛查领域更贴切的指标:Sensitivity at 95% Specificity。
5.2 Task 1 的尺子:Sensitivity at 95% Specificity
定义拆解:
- 先把模型的输出(RG 概率/分数)视为一个连续评分,而不是先固定一个 0.5 的阈值。
- 用闭集测试集(9,741 / 9,736 张,见 §2 与 §4 的双口径)上的真标签,遍历所有可能的判定阈值。
- 找到使特异度(Specificity)= 95% 的那个阈值 $t^*$。特异度定义为"真正 NRG 中,被正确判为 NRG 的比例":
$$\text{Specificity}(t) = \frac{\text{TN}(t)}{\text{TN}(t) + \text{FP}(t)}$$
- 在这个锁定的阈值 $t^*$ 上,读取灵敏度(Sensitivity)——即"真正 RG 中,被正确判为 RG 的比例":
$$\text{Sensitivity}(t^) = \frac{\text{TP}(t^)}{\text{TP}(t^) + \text{FN}(t^)}$$
为什么这样设计:
- 固定特异度、比较敏感度,等价于把"误报预算"固定住:所有队伍都在"假阳性率不超过 5%“的同一约束下比拼"抓住了多少真病例”。这让不同队伍的输出分数可比,不受各自阈值选择偏好影响。
- 它在临床上有直接解释:在真实人群中,95% 的特异度意味着大约每 20 个健康眼中会有 1 个被误判为需要转诊(假阳性),而灵敏度则给出"该转诊的真正青光眼眼被抓住的比例"。
- 它天然抗类别不平衡:所有分母都落回各自的真实类别内部,不受 RG/NRG 比例影响。
任务还设置了独立的辅助指标与阈值选择空间:官方评估脚本(见 §5.6)会在完整测试集上为每支队伍重新计算曲线并固定特度点,保证"每队一次、同尺子"。
5.3 Task 2 的尺子:Hamming loss
Task 2 是多标签分类:每张 RG 图上有 10 个二进制特征(ANRS、ANRI、RNFLDS、RNFLDI、BCLVS、BCLVI、NVT、DH、LD、LC),模型需要为每个特征输出"有/无"。典型的损失函数(如逐标签交叉熵或 F1)都有各种取舍,JustRAIGS 选了最朴素也最直白的汉明损失:
$$\text{Hamming loss} = \frac{1}{N \times L} \sum_{i=1}^{N} \sum_{\ell=1}^{L} \mathbb{1}!\left[\hat{y}{i,\ell} \neq y{i,\ell}\right]$$
其中 $N$ 是被评估的 RG 图像数,$L = 10$ 是特征数,$\hat{y}$ 是预测,$y$ 是参考真值。它等于"平均每个特征预测错的比例"——0 表示全对,1 表示全错。
汉明损失的几个性质正好适配 JustRAIGS 的标注现实:
- 它对每个特征平等计权,不因某个特征稀有(如 DH 罕见)而放大其权重,也不因常见特征(如 LC 大视杯)多而稀释。
- 它是可分解的:可以逐特征报告汉明损失,看清究竟错在哪个特征上。
- 它天然对应官方给出的"忽略机制"(见 §3.3 与下文 5.4 的"参考真值构造"),只要参考值本身被置为"忽略"(不计入分母),它就能保持一致。
关键提醒:汉明损失不看"召回"。一个模型如果把所有 10 个特征都预测为"无",在 DH(极罕见)这类特征上可能反而"低损失",但临床上毫无信息量。因此 TMI 论文强调 Task 1 与 Task 2 是两把独立的尺子,不能互相替代,榜首也由"两个方向的成绩共同刻画"。
5.4 Task 2 的"参考真值构造"与忽略机制
Task 2 的参考值不是简单的"两个 grader 投票取多数",而是由 §3 描述的流水线逐步构造:
- 主分类一致的图:终值取"两名初评者一致"的那些附加标签;两人不一致的附加标签 → 该标签进入"忽略"集合。
- 主分类分歧的图:由专家 G3 判定主分类,其判为 RG 的同时勾选转诊理由;终值取"专家 + 其中一名与专家主分类一致的初评者"的交集;仍不一致的附加标签 → 忽略。
- 仅专家可判的图:终值取"仅专家"的附加标签。
被列入"忽略"的标签,在该图对该特征的汉明损失计算中不计入——既不惩罚预测"有",也不惩罚预测"无"。这是一个非常克制而诚实的处理:不强行把有争议的人为共识当成"金标准",而是承认"这张图这个特征上专家之间都没有定论",把它从评分里拿掉。
这也是 JustRAIGS 在方法学上最值得学习的点之一:它对标签噪声不是"消解",而是"标注不可知"。详见 §8 方法学启示。
5.5 榜单基准带:从 0.13 到 0.32 的实况
TMI 论文摘要给出的两个"天花板"数字是:最高 sens@spec95% = 85%,最佳平均 Hamming loss = 0.13。但这两个数字来自不同队伍、不同子任务,不能简单相加。把可核实的代表方案并排放,能看到一个清晰的基准带:
| 方案 | 队伍/机构 | 骨干 | Task 1 sens@spec95% | Task 2 Hamming loss | 来源 |
|---|---|---|---|---|---|
| VUNO(冠军方向) | VUNO Inc.(韩国) | 集成模型 | recall 0.9090 @ 95% spec | 0.1240 | ISBI 2024 论文 doi:10.1109/ISBI56570.2024.10635758 |
| LaTIM | LaTIM/IMT Atlantique, Brest(法国) | ResNet50 Ensemble(800×800) | 0.870 | 0.239(Eva + Deit3 + ResNet50 集成) | GitHub Mostafa-EHD/JustRAIGS_LaTIM_Solution |
| ndoladimeji | 个人/开源参赛者 | ResNet34 | 0.3242(AUC 0.72) | 0.1327(平均修正) | GitHub 公开方案 |
| TMI 论文全局 | 全体参评 | 混合 | ≤ 0.85 | ≥ 0.13 | IEEE TMI 2025 摘要 |
三条读表警示:
警示一:Task 1 与 Task 2 是"错位"的。 VUNO 在两个任务上都领先,但 LaTIM 的 Task 1(0.870)明显高于 ndoladimeji(0.3242),而 ndoladimeji 的 Task 2(0.1327)反而接近榜首(0.1240)。这提示:擅长"判断要不要转诊"与擅长"解释为什么转诊"可以是两种不同的能力,需要不同的架构与训练策略(Task 2 只在 RG 图上训练,样本量小得多——3,270 张 vs 101,442 张——所以极易过拟合)。
警示二:汉明损失"低"不等于"有用"。 ndoladimeji 的 0.1327 看起来逼近 VUNO 的 0.1240,但结合其 Task 1 仅 0.3242 的灵敏度,说明它在"绝大多数图"上可能倾向于预测特征为"无",从而在汉明损失上占便宜。这是 §5.3 末尾强调的"高分低敏陷阱"的实例化——必须两把尺子一起读。
警示三:这是"低灵敏度陷阱"最真实的市场。 因为 RG 只有 3.2%,一个模型只要学会"几乎不喊 RG",就能在特异度维度上舒服地待着;0.3242 的灵敏度意味着约 2/3 该转诊的 RG 眼被漏掉。这种模型在临床上几乎不可用,但在只看汉明损失或只看准确率时可能"看起来还行"。JustRAIGS 用 sens@spec95% 正是要暴露这种模型。
5.6 官方评估代码与复现路径
挑战赛官方在 GitHub 提供了评估与容器模板(HinaRaja65/JustRAIGS_Challange),核心脚本包括:
evaluate.py:主评估入口,读取预测与参考真值,按 §5.4 的忽略机制构造参考标签,输出 sens@spec95% 与汉明损失。sensy_at_specy.py:负责扫描阈值、定位 95% 特异度点、回报对应灵敏度——即 §5.2 的机械化实现。hamming_loss.py:逐图逐特征比对,按忽略集合置零分母,输出 §5.3 的汉明损失。
参赛者需要在 grand-challenge 平台上以容器形式提交,平台在闭集测试集上运行;这意味着评估不可被本地方案"调参过拟合"——你提交的是可执行推理,而不是分数。这与许多"打榜式"评测(选手自己跑测试集、上传分数)形成对比,是 JustRAIGS 榜单可信度较高的重要原因。
5.7 外部验证:OHTS 子集
TMI 论文对前三名算法做了外部数据集验证,用的是 OHTS(Ocular Hypertension Treatment Study)子集:约 5,000 张 CFP(约 4,000 正常眼 + 1,000 青光眼眼),并给出了与 JustRAIGS 特征体系的映射,例如:
- ThinningDiscRim_RT / ThinningDiscRim_LT(上/下视盘边缘变薄)
- NotchRim_RN / NotchRim_LN(上/下视盘边缘切迹)
- DiscHemorrhage(对应 DH)
- LargeCup(对应 LC)
外部验证的意义:在闭集测试集上拿下高分,可能只是"贴合了 EyePACS 的相机谱系与人群分布";换一个来源的人群(OHTS 是纵向随访研究人群,与筛查人群不同),性能会如何变化,才是泛化能力的真实检验。
必须提醒的边界:截至本条目抓取时点(2026-09-30),OHTS 外部数据集是否公开发布尚未确认(FACTS §9 待核项)。因此本条目只把它作为"论文报告的验证事实"引用,不建议复现者依赖其可下载性。
5.8 复现者最可能踩的三个坑
坑一:目标准确率。 见 §5.1,本任务的准确率基线虚高(96.8%),任何以准确率为优化目标的方案都会走向"全判 NRG"的死路。
坑二:把两把尺子合成一个分数。 官方从未给出 Task 1 与 Task 2 的加权总分;榜单是"两条曲线"而非"一个排名数"。复现时如果自己合成一个加权分,会掩盖 §5.5 警示一的错位现象。
坑三:忽略机制实现错误。 若把"忽略"的标签当成"负例(无)"处理,会人为压低汉明损失,得到看似更好但不可比的结果。正确做法是严格按 §5.4 构造参考并置零分母。TMI 论文和官方脚本对此有明确定义,不要自行发明规则。
§6 获取与许可:54.2 GB 的训练集、永不公开的测试集与一个被记错的 License
6.1 一句话说清"能拿到什么、拿不到什么"
JustRAIGS 的公开部分只有训练集——101,442 张眼底图 + 标签 CSV,打包在 Zenodo。测试集永不公开——挑战赛结束后仍然保密,这是官网与 TMI 论文都反复强调的设计。训练集是"官方公开发布"的,下载需要接受许可条款(clickthrough,不是无门槛裸下载)。
6.2 官方获取入口(三层)
| 层级 | 入口 | 内容 | 用途 |
|---|---|---|---|
| 挑战赛主页 | https://justraigs.grand-challenge.org/ |
挑战概览、时间线、榜单、规则 | 了解赛事、看榜 |
| 数据页 | https://justraigs.grand-challenge.org/dataset/ |
数据描述、标注流程、许可说明 | 核对口径、确认许可 |
| 训练集下载 | https://zenodo.org/records/10035093(DOI 10.5281/zenodo.10035093) |
6 个分卷 zip + 1 个标签 CSV | 实际下载训练数据 |
另有概念 DOI 10.5281/zenodo.10035092,用于在引用中指向"这个数据集(不论版本)";具体版本记录用 10035093。
6.3 Zenodo 记录 10035093 的完整文件清单
实抓确认:Zenodo 记录 10035093 共 7 个文件,合计 54.2 GB:
| 文件 | 大小 | md5 |
|---|---|---|
| JustRAIGS_Train_0.zip | 9.3 GB | b77f8679cc02a2fafe9953abff89fafb |
| JustRAIGS_Train_1.zip | 9.3 GB | fd21d85eafb54bd1d3f6190c739246d0 |
| JustRAIGS_Train_2.zip | 9.3 GB | aff8fb52e068fc1050e6a8f32238a638 |
| JustRAIGS_Train_3.zip | 9.3 GB | a411fd5cd1cebdaeedb5727204abdfba |
| JustRAIGS_Train_4.zip | 9.3 GB | 0fb8cd04c0d39a93ce97f05ec4b109e4 |
| JustRAIGS_Train_5.zip | 7.7 GB | 76fa9a9f131a866054206392f7f1bfc6 |
| JustRAIGS_Train_labels.csv | 9.2 MB | 0d01181f067f57ece1e7e1f07167a78e |
三条读表要点:
- 分卷是"体积切分",不是"类别切分"。 6 个 zip 是同一训练集的等体积分片(前 5 个各 9.3 GB,最后一个 7.7 GB),把 101,442 张图切成 6 块以便下载。不要假设 Train_0 是 RG、Train_5 是 NRG——类别信息全部在
JustRAIGS_Train_labels.csv里。 - 标签 CSV 是唯一权威来源。 9.2 MB 的 CSV 承载每张图的文件名、RFG(主分类)与 10 个特征标签,并含"分歧被忽略"的标记逻辑。落地后应以 CSV 为准建索引,而不是从文件名猜标签。
- md5 可用于校验完整性。 6 个 zip 与 1 个 CSV 的 md5 均记录如上,下载后应逐一核验——54.2 GB 的下载在弱网环境下中断是常态。
6.4 许可:三处官方一致写 CC BY-NC-SA,一处第三方写错了
官方三处口径(一致):
- 官网数据页原文:“publicly available under a CC BY-NC-SA license at the Zenodo”
- Zenodo 记录 10035093 的许可字段:CC BY-NC-SA
- TMI 论文明确:“accessible for download on Zenodo under the CC BY-NC-SA license”
第三方冲突口径:
- EyeDataHub(khosravipooya.com)的目录记录写 CC BY-NC-ND 4.0。
判定与处理: 三处一手来源(官网 + Zenodo + TMI 论文)与一处第三方目录冲突。按"一手源优先、多源互证"的原则,判 EyeDataHub 为记录错误。本条目按 CC BY-NC-SA(署名—非商业性使用—相同方式共享) 成稿,并在此存照该冲突(同 §9 存照清单第 1 条)。
CC BY-NC-SA 的实际含义(复现者须知):
- BY(署名):使用时须注明来源(JustRAIGS / Rotterdam Eye Hospital / EyePACS LLC 及论文)。
- NC(非商业性使用):不得用于商业目的。这一条对本数据集的"AI 训练"用途尤其敏感——商业公司的内部模型训练、商业产品的开发都受此限制。
- SA(相同方式共享):若你对数据做了改编并再分发,衍生数据集须以相同许可(CC BY-NC-SA)发布。这意味着你不能把 JustRAIGS 训练出的衍生数据集改成更宽松的许可。
这与"数据可用于 AI 训练但限非商业"的常见争议直接相关:JustRAIGS 的许可是明确的 NC,任何以商业为目的的使用都需要另行获得授权,而不是"公开即可随便用"。
6.5 测试集:为什么"永不公开"是必要的
官网与 TMI 论文都明确:测试集在挑战赛结束后仍保持闭集,“confidential and inaccessible for download”。
这不是小气,而是方法学必需: 一旦测试集公开,后续的模型就可以对它做针对性优化,榜单的基准比较就失效了;更严重的是,闭集测试集是"防过拟合的最后一道墙"。JustRAIGS 让参赛者提交可执行容器(见 §5.6),在官方可控的闭集上运行——测试集本身就是评估基础设施的一部分,公开即作废。
因此: 任何声称"拿到了 JustRAIGS 测试集"的第三方,基本可以判定为不可信(要么是伪造,要么是把训练集分片误标为测试集)。复现者应只在训练集上复现,并在自建的训练集内部划分(patient-level split,见 §5.7 的边界提醒与 §8)上做验证。
6.6 官方开源代码与容器模板
- 评估与模板:GitHub HinaRaja65/JustRAIGS_Challange,含
evaluate.py、hamming_loss.py、sensy_at_specy.py(见 §5.6)。 - 参赛队伍方案(可复现参考):
- VUNO:
github.com/seunghoonlee-fundus/JustRAIGS-vuno - LaTIM:
github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution - 其他开源参赛者的 Notebook/Repo 在 GitHub 与 Kaggle 上可检索到。
- VUNO:
- 建议复现顺序:先跑官方
evaluate.py在训练集的一个 patient-level holdout 上建立本土基线,再对齐 VUNO/LaTIM 的骨干与预处理,最后才谈"提升"。
6.7 体量与使用成本:54.2 GB 是"压缩态"
Zenodo 官方记录合计 54.2 GB(6 分卷 + labels),但这是压缩后的体积。解压后(JPEG 原图 + CSV)会明显更大——第三方目录 EyeDataHub 记 “约 100 GB”,分歧即源于压缩态 vs 解压态的口径差(存照,见 §9 第 7 条)。
复现者的存储/算力规划:
- 至少预留 150–200 GB 可用磁盘(下载 54.2 GB + 解压 ~100 GB + 中间缓存)。
- 训练时若做高分辨率(如 800×800 或更大)输入,显存需求会显著上升;LaTIM 用 800×800 的 ResNet50 集成,是较有代表性的配置。
- 建议先只解压 1 个分卷做流程跑通,再全量落地,避免一开始就卡在 I/O 上。
§7 生态与影响:从 AIROGS 到 JustRAIGS 的谱系,以及它在眼底 AI 版图里的位置
7.1 血脉:AIROGS 是直系前作
JustRAIGS 不是凭空出现的。同一批研究者(Rotterdam Eye Hospital 的 Lemij / Vermeer / de Vente / Sánchez 等)在更早的时候做了一个规模相近、目标更单纯的挑战赛:AIROGS(Artificial Intelligence for RObust Glaucoma Screening),并使用同一来源的眼底图库(EyePACS,约 113,893 眼 / 60,357 人 / ~500 个筛查点)。
AIROGS 与 JustRAIGS 的关系,可以概括为一句话:把"能不能筛"推进到"能不能说清楚为什么筛"。
| 维度 | AIROGS(前作) | JustRAIGS(本条目) |
|---|---|---|
| 任务形态 | 单任务二分类(RG/NRG) | 双任务:二分类(Task 1)+ 10 特征多标签(Task 2) |
| 核心诉求 | 稳健筛查 | 可解释的转诊(justified referral) |
| 数据规模 | ~113,893 眼 / 60,357 人 | 全库 111,178 CFP / 61,919 患者;公开训练 101,442 图 |
| 指标 | 分类指标 | sens@spec95%(Task 1)+ Hamming loss(Task 2) |
| 会议 | ISBI 2024 前身之一 | ISBI 2024 官方挑战赛 |
| 论文 | IEEE TMI 2024;43(1):542-557 | IEEE TMI 2025(PMID 40773411) |
库内缺口提示:截至本条目撰写时,千方病案医数集尚无独立的 AIROGS 条目(查重未见)。JustRAIGS 条目因此成为指向这条血脉的唯一锚点——一旦 AIROGS 条目上线,二者应互链。这是一条明确的待补链接(见 §9 与附录)。
7.2 数据血缘:EyePACS × Rotterdam 的"影像 + 标注"双机构结构
JustRAIGS 的数据血缘是一个清晰的双机构结构:
- 影像来源:EyePACS LLC(Santa Cruz, CA, USA)——其糖网筛查项目产出了海量眼底照片,是 JustRAIGS 全部图像的来源。
- 标注来源:Rotterdam Ophthalmic Institute, Rotterdam Eye Hospital(荷兰鹿特丹)——由青光眼专家设计标注协议、招募并质控 grader、执行判读。
为什么这个结构值得单独一讲: 在眼底 AI 数据集里,“图像来自一个机构、标注来自另一个机构"是把图像采集设备/人群与临床判读标准解耦的常见做法。它降低了"标注者与拍摄者共享同一台设备偏差"的风险,也让 JustRAIGS 的标签更接近"标准的青光眼判读协议"而非"某台机器的输出”。这个血缘也解释了为什么 JustRAIGS 的相机谱系如此庞杂(10 类设备,含 20.5% 未知,见 §2.2)——因为 EyePACS 是多站点筛查网络,而非单一医院。
7.3 与库内条目(含 rid)的互链网络
JustRAIGS 在千方病案医数集里有若干天然的邻居,按"链接强度"排序如下(rid 为库内数据库实查值):
| 关联条目 | rid | 关联性质 | 链接强度 |
|---|---|---|---|
| refuge | 62 | 同为青光眼域:视盘/视杯分割任务 | 最强(同疾病、不同任务范式) |
| eyepacs | 58 | 同数据源:均源自 EyePACS LLC | 强(数据血缘) |
| rfmid | 271 | 眼底多疾病分类 | 中 |
| odir | 63 | 眼科多疾病标签 | 中 |
| deepdrid | 211 | 糖网分级 | 弱中 |
| fives | 741 | 眼底多疾病分割 | 弱中 |
| messidor | 59 | 糖网分级 | 弱 |
| ddr | 201 | 糖网分类 | 弱 |
| idrid | 191 | 印度糖网图像 | 弱 |
| fgadr | 221 | 细粒度糖网 | 弱 |
| meddra | 579 | 不良事件术语(与眼病编码弱关联) | 很弱,慎用 |
最强的一条是 refuge(rid 62):它同样是青光眼、同样围绕视盘展开,但任务是像素级分割(视盘/视杯边界),而 JustRAIGS 是图像级分类 + 多标签解释。二者构成"分割派 vs 判读派"的互补对照,是青光眼 AI 里两条主要技术路线的代表。eyepacs(rid 58) 则是血缘上的兄弟:同源影像、不同标注目标(糖网 vs 青光眼)。
互链写法建议:在条目的"相关数据集"段落按 rid 排序引用,并显式写出"同源/同域/异任务"的关系性质,避免把弱关联条目硬凑成"相关"。
7.4 为什么它不与库内任何眼底条目撞库
用户任务特别要求查重。JustRAIGS 的独特性可以从四个正交维度同时成立:
- 疾病维度:库内眼底条目绝大多数是糖网(DR)(messidor、ddr、idrid、deepdrid、eyepacs、fgadr 等),JustRAIGS 是青光眼。唯一同域的是 refuge,但 refuge 是分割任务。
- 任务维度:库内糖网条目基本是单标签分级(0–4 级)或多疾病分类;JustRAIGS 是二分类 + 10 特征多标签的"双任务",且 Task 2 只在正类上评估,这在库内是独有的。
- 标注协议维度:JustRAIGS 有两名 grader 独立判读 + 专家破平局 + 分歧可忽略的完整流水线与 EODAT 资格考核(见 §3),这种"带质控档案的标注协议"在库内眼底条目中罕见。
- 赛事维度:JustRAIGS 是 ISBI 2024 官方挑战赛,有闭集测试集、容器化提交、双指标榜单——库内其他眼底条目多为静态数据集或 Kaggle 风格竞赛,评估基础设施不同。
结论:JustRAIGS 与库内已有的 messidor(59)、ddr(201)、idrid(191)、refuge(62)、rfmid(271)、odir(63)、eyepacs(58)、deepdrid(211)、fgadr(221)、fives(741) 均不撞库;它是库内**第一个"青光眼 + 可解释转诊 + 双任务挑战赛"**的口径。
7.5 生态:参赛队伍、方案与下游
参赛生态(可核实部分):
- VUNO Inc.(韩国):Task 1 recall 0.9090 @ 95% spec,Task 2 Hamming 0.1240,是赛场最强音。
- LaTIM / IMT Atlantique(法国 Brest):ResNet50 集成,Task 1 0.870,Task 2 0.239。
- ASU(Appalachian State University):TMI 总结论文的作者团队之一(Yousefi 组)。
- ndoladimeji:个人开源参赛者,ResNet34,Task 2 0.1327 但 Task 1 仅 0.3242,是"高分低敏陷阱"的注脚(见 §5.5)。
下游与影响:
- 方法学影响:JustRAIGS 把"可解释性"从"事后 CAM 热图"抬升为任务级定义的特征标签(10 个具体、有临床含义的转诊理由)。这为"可解释 AI"提供了一个比"注意力图好看"更硬的评价标准——模型必须预测出与临床判读一致的具体体征。
- 患者级划分的示范:101,442 图 / 55,736 患者意味着平均每患者约 1.8 张图,若不按患者划分,同一患者的双眼会跨训练/验证泄漏。JustRAIGS 的文档与复现惯例强调 patient-level split,成为后续眼底 AI 的标准操作。
- 低患病率评测的模板:4.38% / 3.2% 的正类占比 + sens@spec95% 的指标设计,为其他罕见病筛查任务提供了"如何不被不平衡骗到"的范本。
- 引用与延续:TMI 2025 论文(PMID 40773411)是当前的权威引用;数据论文(Ophthalmology Science 2023,doi 10.1016/j.xops.2023.100300)是数据本身的权威引用。二者必须区分引用(见 §9 存照第 9 条)。
7.6 值得追踪的开放线索(供后续版本更新)
- AIROGS 条目:库内缺口,JustRAIGS 的血脉前作,上架后应双向互链。
- OHTS 外部集的公开性:若未来公开,JustRAIGS 的外部验证复现将成为可能(见 §5.7)。
- 46 vs 20 队伍的权威口径:建议以 TMI 论文的"开发阶段 322 参与者 / 37 国、测试阶段 20 队"为准(见 §9 存照第 2 条)。
- 挑战赛的"进行中"表述:Zenodo 描述与官网旧文案曾写 “still ongoing”,但 TMI 论文已发表、ISBI 2024 已落幕——本条目按"已完结赛事"处理,并保留此存疑(见 §9 待核)。
§8 方法学启示:一个低患病率、多标签、多相机数据集给后来者的六条经验
JustRAIGS 的价值不止于它自己能训出多好的模型,更在于它把一个真实筛查场景的全部麻烦——患病率低、标签分歧、多相机域偏移、可解释性要求——都摆在了明面上,并各自给了一套工程化的应对。以下六条经验,任何做医学影像、尤其是做"筛查/转诊"类任务的人都能直接搬走。
8.1 低患病率下,"准确率"是一个会骗人的指标
JustRAIGS 训练子集里 RG 只占 3,270/101,442 ≈ 3.2%,全体可评估眼底图的 RG 患病率为 4.38%(数据论文口径)。这意味着一个"永远输出 NRG"的傻子模型,在训练子集上的准确率就有约 96.8%。
这正是这类任务最经典的陷阱:指标越高,越要警惕它是不是在奖励"什么都不做"。在筛查语境里,"什么都不做"的代价是把 3~4% 的真病人全部漏诊——这在临床上比假阳性严重得多(假阳性只是多转诊一次,假阴性是漏掉一个将失明的病人)。
应对是换尺子:Task 1 用 Sensitivity at 95% Specificity(详见 §5.2)。把特异度锁死在 95%,在此约束下比谁的灵敏度高。这样"躺平模型"的灵敏度是 0,分数立刻露馅。经验一句话:凡是正类占比低于 10% 的分类任务,先问一句"全判负类的基线是多少",再决定用不用准确率。
8.2 标签有分歧时,"忽略"比"消解"更诚实
多标签任务里,两个标注者对某个附加特征(比如"视盘出血 DH 是否存在")意见不合是常态。行业内有两种处理:
- 消解(reconcile):找个更权威的人定一个终值,强行给这张图一个"标准答案"。
- 忽略(ignore):承认这里没有可靠真值,评估时把该标签在该图上的贡献从分母里拿掉。
JustRAIGS 选了后者。官网 /dataset/ 的原始描述写得很直白:主分类(RG/NRG)由两名 grader 独立判、平局由专家 G3 打破;但附加标签的分歧不消解——若某附加标签仍有分歧,则"该标签在算法评估中对该图忽略"(见 §5.4 的三步构造)。
这个设计的深刻之处在于:它不假装标签是干净的。消解的代价是,你以为自己在和"真值"比,其实是在和一个可能被专家拍脑袋定下的、带着个人偏见的伪真值比;而忽略的代价只是少算几个样本——在 10 万量级的数据上完全可以承受。经验一句话:当分歧率高到一定程度,"制造一个假答案"比"承认不知道"对模型的毒害更大。 这也是 JustRAIGS 能在很嘈杂的多标签任务上依然给出可解释基准的原因之一。
8.3 标注者要考资格证,而不是"拉个眼科医生就上"
JustRAIGS 的标注者不是随便找的眼科医生。他们是从通过了 **European Optic Disc Assessment Trial(EODAT,含 110 张立体视神经图像)**考核的候选人里选的。数据论文口径:90 名候选人中只有 30 名通过(门槛是 ≥85% 准确率 + ≥92% 特异度),最终训练 JustRAIGS 时合格上岗的是 20 名 grader。
更关键的是动态质控:每名 grader 的表现被持续监控,一旦灵敏度/特异度跌到 <80% / <95%(以终判为参考),就退出、由他人重做。最终留下的 grader 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8),两人之间的表观一致率 92.45%(Gwet’s AC2 = 0.917)。
这套"考前筛选 + 考中监控 + 跌线即退"的组合,把"标注质量"从一句口号变成了可审计的流程。经验一句话:如果你在做高价值标注任务,先设计一张资格考核卷,再设计一条质量红线。 这比事后清洗省力得多。
8.4 患者级划分:防止泄漏的最低成本保险
JustRAIGS 的划分不是"按图分",而是按患者分——同一患者的左右眼、随访图不会同时出现在训练和测试里。数据论文给出的患者数与图像数之比(如训练集 101,442 图 / 55,736 患者)说明大量患者贡献了多张图。
如果按图随机划分,同一个人的两眼很可能一左一右分到训练和测试两边,模型学到的是"这个人的视盘长什么样",而不是"青光眼长什么样",测试指标会虚高。经验一句话:只要一个患者可能贡献多张影像,划分就必须在患者层切。 这是性价比最高的防泄漏措施——几乎零成本,却能避免整篇论文的结论被高估击穿。
8.5 双任务设计:把"可解释"从口号变成可评测的量
绝大多数医学 AI 论文的"可解释性"停留在热力图截图,无法量化、无法比较。JustRAIGS 的 Task 2 做了一件少见的事:要求算法显式输出 10 个临床可命名特征的存在与否(ANRS、ANRI、RNFLDS、RNFLDI、BCLVS、BCLVI、NVT、DH、LD、LC),然后用 Hamming loss 打分。
这就把"你的结论有没有依据"变成了一个可算的数。更妙的是它给出了一个"诚实性检验":一个模型可能 Task 1 得分很高(很会转诊)但 Task 2 很差(说不出为什么),也可能反过来。§5.5 表格里的 ndoladimeji 就是典型——Task 2 Hamming 0.1327 看起来不错,但 Task 1 的 sens@spec95% 只有 0.3242(详见 §5.5 的"高分低敏陷阱")。
经验一句话:如果你真的关心可解释性,就为它设计一个独立的、会惩罚胡说的指标。 只画热力图不算。
8.6 多相机谱系:域泛化不是加分项,是入场券
TMI 论文的设备构成表显示,训练集 101,442 张图来自 10 类不同的眼底相机:Optovue iCam100 占 26.1%、Topcon NW400 占 20.3%、未知 20.5%、Canon CR1/CR2/DGI 各约 9~10%、Topcon NW200 2.8%、Centervue DRS 1.6%、Nidek AFC300 0.1%、Crystalvue NFC-700 仅 6 张(数据论文/TMI 口径)。
这是一把双刃剑。好的一面:模型天然要面对跨设备差异,泛化压力大、学到了更本质的体征。坏的一面:20.5% 的设备型号未知,意味着将近五分之一的样本连"来自哪台相机"都不知道,任何"按设备分层"的分析都做不全;而 Nidek 153 张、Crystalvue 6 张这种极小样本,又可能在分层评估时给出极不稳定的数字。
经验一句话:多相机数据是域泛化的天然训练场,但要小心"未知来源"和"极小样本类"在分层统计里制造幻觉。 报告结果时,要么说明分层样本量,要么干脆别分层。(另需注意:§1 的导语提醒过 NRG ≠ 健康眼,设备差异叠加疾病异质性时更要谨慎解读。)
8.7 小结:六条经验一张表
| 经验 | JustRAIGS 的做法 | 可迁移动作 |
|---|---|---|
| 低患病率换尺子 | RG 3.2%~4.38%,"全判 NRG"基线 96.8% | 先算负类基线,再用 sens@fixed-spec |
| 分歧"忽略"而非"消解" | 附加标签分歧不计入评估分母 | 承认无真值,减小分母而非造假答案 |
| 标注者要考资格 | EODAT 考核 + <80%/<95% 跌线即退 | 设计资格卷 + 质量红线 |
| 患者级划分 | 训练/测试按患者切分 | 一人多图时必须在患者层切 |
| 可解释性要可评测 | Task 2 的 10 特征 + Hamming loss | 给可解释性设计独立指标 |
| 多相机域泛化 | 10 类相机,20.5% 型号未知 | 关注未知来源与极小样本类 |
§9 与库内条目的关系:一张互链网络与一次明确的查重
JustRAIGS 在千方病案医数集里不是孤岛。它和库内已有的眼底条目有真实的血缘、同域或同任务关系,也有明确的不撞库证据。本节把这张网画清楚,并给出互链写法建议。
9.1 按 rid 排序的互链网络
| 库内条目 | rid | 与 JustRAIGS 的关系性质 | 链接强度 |
|---|---|---|---|
| ruffuge / refuge(青光眼视盘/视杯分割) | 62 | 同为青光眼域:都做青光眼相关视神经结构任务,但 refuge 是分割、JustRAIGS 是转诊分类 + 多标签 | ★★★ 最强 |
| eyepacs(糖网筛查) | 58 | 数据血缘:两者图像均来自 EyePACS LLC(Santa Cruz, CA) | ★★★ 血缘强链 |
| rfmid(眼底多疾病分类) | 271 | 同为眼底多疾病/多标签分类范式 | ★★ |
| odir(眼科多疾病标签) | 63 | 同为多标签眼科数据集 | ★★ |
| deepdrid(糖网分级智能诊断) | 211 | 同域(眼底照相)异病(糖网),分级 vs 转诊 | ★★ |
| fives(眼底多疾病分割) | 741 | 同域,分割 vs 分类 | ★ |
| ddr(糖网分类) | 201 | 同域异病 | ★ |
| idrid(印度糖网图像) | 191 | 同域异病、异人群 | ★ |
| fgadr(细粒度糖网) | 221 | 同域异病 | ★ |
| messidor(糖网分级) | 59 | 同域异病,经典老数据集 | ★ |
| meddra(MedDRA 不良事件术语) | 579 | 仅术语编码层面弱关联,慎用 | ○ 不建议强链 |
9.2 两条最强的链:refuge(同域)与 eyepacs(血缘)
refuge(rid 62)是"同域最强互链"。 两者都在青光眼视神经评估这个域里,都聚焦视盘/视杯/神经视网膜边缘结构。差别在任务形态:refuge 做的是像素级分割(视盘、视杯边界),JustRAIGS 做的是患者级的转诊二分类 + 10 特征多标签。一个回答"结构在哪",一个回答"要不要转诊、依据是什么"。互链写法可以点出这条"分割 → 转诊决策"的链条:从几何量(杯盘比、边缘宽度)到临床决策,是同一域里任务粒度的跃迁。
eyepacs(rid 58)是"血缘强链"。 JustRAIGS 的全部眼底图像来自 EyePACS LLC 的糖网筛查项目(见 §2.1 与 §3 的机构血缘:EyePACS 供图 + Rotterdam Eye Hospital 供标注)。库内 eyepacs 条目同源。互链时应说明:同源图像的不同标注视角——eyepacs 侧是糖网标签,JustRAIGS 侧是青光眼转诊与 10 特征标签。这层血缘对复现者很实用:两套数据可以对照理解 EyePACS 采集流程的图像特性(分辨率、相机谱系、人群分布)。
9.3 库内缺口:AIROGS 没有条目
JustRAIGS 的直系前作是 AIROGS(Artificial Intelligence for RObust Glaucoma Screening),同一团队(Rotterdam + EyePACS),全库 113,893 眼 / 60,357 人 / ~500 个筛查点。JustRAIGS 是它"把临床范围扩张到双任务(二分类 + 多标签解释)"的后继。
但库内暂无 AIROGS 条目(DB url_name ILIKE '%airogs%' 查重未见)。这是一个明确的库内缺口:AIROGS 与 JustRAIGS 是同一谱系的一前一后,若未来补入 AIROGS,两者应视为强互链对。当前 JustRAIGS 条目可把 AIROGS 作为"外部谱系"提及,不强行内链。
9.4 查重结论:为什么不与任何库内眼底条目撞库
任务头要求"必须查重确认不撞库,重点是 JustRAIGS 的青光眼转诊标注任务"。核验结果——不撞库,理由有四个正交维度:
- 疾病域不同:库内 10 个眼底条目的主体是糖网(DR)(messidor、ddr、idrid、deepdrid、fgadr 等)或眼底多疾病(rfmid、odir、fives);JustRAIGS 专注青光眼(glaucoma)。唯一同为青光眼域的是 refuge,但见下条。
- 任务形态不同:refuge 是视盘/视杯分割;JustRAIGS 是转诊二分类 + 10 特征多标签分类。业务目标(是否需转诊)与输出形态(类别标签)均不同。
- 图像血缘不同来源标注:JustRAIGS 是 EyePACS 图 + Rotterdam 标注的双机构组合;库内其它眼底条目各有独立来源(refuge 为中国多中心、idrid 为印度、messidor 为法国等)。
- 数据规模量级不同:JustRAIGS 训练子集 101,442 张 / 55,736 患者,且附带 54.2 GB 的公开训练集与一个永不公开的 9,741 张闭集测试集——这个体量与闭集测试设计在库内眼底条目里没有对应者。
另外,DB 层查重也确认:url_name ILIKE '%justraigs%' 与 %raigs% 均 0 行,ls writing/ 无同名目录。结论:JustRAIGS 与库内任何条目均非重复条目。
9.5 建议的互链写法
- 在 JustRAIGS 条目正文(§2.6、§7.3 已落笔)与 INFOBOX 中,对 refuge(62)、eyepacs(58) 做强链;
- 对 rfmid(271)、odir(63)、deepdrid(211) 做中链(同域/同范式);
- 对 fives(741)、ddr(201)、idrid(191)、fgadr(221)、messidor(59) 做弱链(仅同域);
- meddra(579) 不建链(仅术语层面弱关联,避免噪声);
- AIROGS 标注为库内缺口,描述谱系但不内链。
§10 避坑清单:九个已踩过的坑与四个待核疑点
本节把 FACTS §9 的全部存照(双口径冲突)与待核疑点整理成一份"后来者清单"。凡本条目出现两个数字的地方,都不是笔误,而是有意双列——请勿擅自"统一"成单一数字。
10.1 九个已踩过的坑(存照)
| # | 坑点 | 冲突双方 | 本条目取法 |
|---|---|---|---|
| 坑点 1 | License 被第三方记错 | 官网 /dataset/ + Zenodo + TMI 论文三处均写 CC BY-NC-SA;EyeDataHub(khosravipooya.com)写 CC BY-NC-ND 4.0 | 判 EyeDataHub 误,按 CC BY-NC-SA 成稿(§6.4) |
| 坑点 2 | 参评队伍数 | TMI 论文:开发阶段 322 参与者 / 37 国、测试阶段 20 队;VUNO 新闻稿与 Asia Business Daily:46 支队伍 | 非同一口径(报名 vs 入围),双列,建议引 TMI(§4.2) |
| 坑点 3 | 测试集规模 | 官网 9,741 张;TMI 论文表 9,736 张 / 6,183 患者 | 双列,差 5 张(§2.1) |
| 坑点 4 | 全库总量/患者数三口径 | 数据论文(xops)113,893 眼 / 60,357 人;TMI 111,178 CFPs / 61,919 患者;官网宣传语 “over 110k images from about 60,000 screenees” | 三列存照,疑因含/不含 ungradable、眼 vs 图、患者口径不同(§2.1) |
| 坑点 5 | 可评估眼数 | 数据论文 111,183 眼(97.62%);TMI 111,178 | 双列(§2.1) |
| 坑点 6 | grader 候选/合格数 | 数据论文 90 候选 → 30 通过 → 20 上岗;AIROGS 论文 89 报名 → 32 通过;官网未给数 | 引数据论文口径,注 AIROGS 差异(§3.1) |
| 坑点 7 | Zenodo 体量 | Zenodo 官方 54.2 GB(6 分卷 + labels);EyeDataHub 记 ~100 GB | 双列,疑为解压态/未压缩口径(§6.3、§6.7) |
| 坑点 8 | 患病率单源 | RG 4.38% 仅数据论文(可评估眼底图口径),官网未给 | 标来源,不当作唯一权威(§2.4) |
| 坑点 9 | 两篇论文勿混引 | 数据论文 xops 2023(Ophthalmology Science, doi:10.1016/j.xops.2023.100300);挑战赛总结论文 TMI 2025(doi:10.1109/TMI.2025.3596874,PMID 40773411) | 分属两篇,引用时各自标注(§2、§4) |
10.2 四个待核疑点(尚未定论)
- Zenodo 是否有官方 dataset card 明示 License 细目:沙箱内 Zenodo API 被阻断,仅经官网 /dataset/ + TMI 论文 + 搜索镜像三源确认 CC BY-NC-SA。若能直连 Zenodo 记录页,应核对是否另有许可细目说明。
- OHTS 外部数据集的公开性:TMI 论文用 OHTS(Ocular Hypertension Treatment Study)子集约 **5,000 CFP(4,000 正常 + 1,000 青光眼)**对前三名算法做外部验证,并做了标签映射(ThinningDiscRim_RT/LT、NotchRim_RN/LN、DiscHemorrhage-DH、LargeCup_LC)。该子集是否公开下载,尚未确认。
- 46 vs 20 队伍的权威口径:新闻稿 46、论文 20,建议以 TMI 论文为准,但在本条目中保留双口径。
- “still ongoing challenge” 的时效:Zenodo 记录描述曾写该挑战"still ongoing",但 ISBI 2024 已结束、TMI 论文 2025 已发表——该表述时效存疑,读者不应据此认为挑战赛仍在接收提交。
10.3 使用本条目的一条总原则
遇到任何单一数字,先看它有没有并列的第二口径。 本条目对全部多来源冲突数字都做了双列或三列存照,并在取法上给出倾向(如 License 取 CC BY-NC-SA、队伍数建议引 TMI)。若你从别处看到一个"干净的单一数字",先怀疑它是否被某一来源单方面覆盖了其它来源。
§11 DAIMS 评估:AI-Ready 五维打分
DAIMS(Discoverability / Accessibility / Interoperability / Metadata / Sustainability)是千方病案医数集衡量一个数据集"AI-Ready 程度"的五维框架。以下逐维给出 JustRAIGS 的评分与依据。评分采用 1–5 分制(5 = 优秀)。
11.1 Discoverability(可发现性)— 5 / 5
- 官方挑战页(justraigs.grand-challenge.org)与数据页(/dataset/)结构清晰;
- Zenodo 记录 10035093(概念 DOI 10035092)带完整 DOI,搜索引擎可直达;
- 两篇核心论文(xops 2023、TMI 2025)均开放获取、可被引;
- ISBI 2024 官方挑战赛身份带来高曝光;
- 千方病案医数集条目本身提供中文发现入口。
- 扣分点:无。多口径冲突数字(§10)不影响可发现性。
11.2 Accessibility(可获取性)— 4 / 5
- 训练集在 Zenodo 公开可下,需接受 CC BY-NC-SA 条款(self-service clickthrough);
- 7 文件 54.2 GB,体量对普通用户偏大(§6.7 建议预留 150–200 GB);
- 官方评估代码开源(GitHub 容器模板 + 评估脚本)。
- 扣分点:测试集永不公开(闭集),无法复现官方榜单;Zenodo 下载需 clickthrough 且体量大;权限为 NC(非商用),限制部分使用场景。
11.3 Interoperability(互操作性)— 4 / 5
- 图像为标准 JPEG 眼底照相,工具链通用;
- 标签为结构化 CSV(
JustRAIGS_Train_labels.csv),含主分类 RG/NRG 与 10 个二值附加特征,可直接映射到多标签训练框架; - 官方提供评估脚本(sens@spec95%、Hamming loss),指标定义明确可复现。
- 扣分点:无标准化的影像元数据 schema(如 DICOM);相机型号 20.5% 未知,妨碍按设备分层;标签列命名需对照论文/官网文档理解(10 特征缩写无机器可读字典随包)。
11.4 Metadata(元数据)— 4 / 5
- Zenodo 记录含版本、DOI、文件 md5 校验、发布日期(2024-01-08);
- TMI 论文表提供了详尽的规模、患者数、年龄、设备构成等统计;
- 官网 /dataset/ 给出了完整的标注流程与 adjudication 规则(含"忽略"机制)。
- 扣分点:多口径冲突未在单一权威处澄清(总量/患者/测试集规模有三套口径,§10.1 #4);Zenodo 是否有官方 dataset card 未确认(§10.2 #1);年龄/患病率部分为单源(§10.1 #8)。
11.5 Sustainability(可持续性)— 4 / 5
- Zenodo(CERN 运营)为长期归档平台,DOI 持久,可持续性高;
- 论文开放获取,方法可长期追溯;
- 官方代码托管 GitHub,社区可维护。
- 扣分点:Zenodo 仅单版本(10035093),无 v2/后继版本记录;测试集闭集意味着基准"冻结"但仍需官方维护榜单说明;"still ongoing"表述时效存疑(§10.2 #4)可能误导长期读者。
11.6 DAIMS 汇总
| 维度 | 评分 | 一句话依据 |
|---|---|---|
| Discoverability | 5/5 | 官方页 + Zenodo DOI + 两篇开放论文 + 挑战赛曝光 |
| Accessibility | 4/5 | 公开可下但体量大、测试集闭、NC 限制 |
| Interoperability | 4/5 | JPEG + 结构化 CSV + 官方评估脚本;缺 schema、20.5% 相机未知 |
| Metadata | 4/5 | md5/日期/统计齐全;多口径未澄清、部分单源 |
| Sustainability | 4/5 | Zenodo + 开放论文 + GitHub;单版本、时效表述存疑 |
| 合计 | 21 / 25 | 高 AI-Ready,扣分集中在"闭集测试 + 多口径冲突 + 体量" |
评语:JustRAIGS 是一个高度 AI-Ready 但不"顺手"的数据集——它的可发现性与元数据质量在同类中属上乘,真正需要使用者花心思的地方在体量(54.2 GB)、闭集测试集(无法本地复现榜单)与多口径数字(必须先读 §10 再引用)。对研究者而言,它更适合作为"低患病率 + 多标签可解释 + 多相机域泛化"的方法学研究底座,而非一个即插即用的 benchmark。
FAQ(高频问答 34 问)
本节刻意写成"能用一句话说清就不写第二句"的形态。凡是需要 双口径 的地方,都在括号里标出冲突来源;凡是必须回查 FACTS.md 的地方,都指向 §9 的存照编号。
一、命名与身份(Q1-Q6)
Q1:JustRAIGS 这七个字母到底拆成什么?
两种展开并存,都是官方口径:
- Justified Referral in AI Glaucoma Screening——“可解释转诊的 AI 青光眼筛查”(官网首页与 /dataset/ 页原话);
- Justify your AI prediction for Referable or Not Referable Glaucoma Screening(EyeDataHub 引 Thakoor et al. MICCAI 2023 的展开式)。
两种展开的落点一致:转诊决策(referral)+ 可解释性(justification)。第一个词 “Justified” 是双关——既是"正当/可辩护的",也暗示"给出理由"。
Q2:它是一个数据集,还是一个挑战赛?
两个都是,但它首先是挑战赛。 ISBI 2024 官方挑战赛是本体,Zenodo 训练集是它公开出去的那部分。所以严格说法是"JustRAIGS 挑战赛 + 配套训练集"。仅说"JustRAIGS 数据集"会丢掉两件事:评测闸门(闭集测试集)与双任务设计(Task 1 + Task 2)。
Q3:slug 为什么是小写连写 justraigs?
因为官方数据集的命名本身就是小写连写的 justraigs(官网 URL 路径、Zenodo 记录里的标识符都是它)。本站沿用官方拼写,不做驼峰化。
Q4:它跟 AIROGS 是什么关系?
前后作关系,同一团队。 AIROGS(Artificial Intelligence for RObust Glaucoma Screening)是 2023 年的前作,同样来自 Rotterdam + EyePACS 的血缘;JustRAIGS 把临床范围从"单二分类"扩张到"二分类 + 10 特征多标签解释"。一句话:AIROGS 教机器"该不该转诊",JustRAIGS 还要机器说出"凭什么转诊"。
Q5:JustRAIGS 的正式论文有几篇?别把两篇混成一篇。
两篇,分属不同阶段,年份不同(存照 #9):
- 数据论文:Lemij HG, de Vente C, Sánchez CI, Vermeer KA. Characteristics of a Large, Labeled Data Set for the Training of Artificial Intelligence for Glaucoma Screening with Fundus Photographs. Ophthalmology Science 2023;3(3):100300. doi:10.1016/j.xops.2023.100300。(描述训练集怎么来的)
- 挑战赛总结论文:Madadi Y, Raja H, Vermeer KA, Lemij HG, … Yousefi S. JustRAIGS: Justified Referral in AI Glaucoma Screening Challenge. IEEE TMI 2025. PMID 40773411;doi:10.1109/TMI.2025.3596874。(描述比赛怎么跑的、怎么评的)
引用时务必分清:xops 2023 ≠ TMI 2025。最常见的错误是把 TMI 的榜单数字安到 xops 头上。
Q6:官网、Zenodo、论文三个入口分别给什么?
- 官网 justraigs.grand-challenge.org:挑战概览、规则、任务定义、/dataset/ 页给标注流程与 license 声明;
- Zenodo records/10035093:唯一可下载的训练集(6 分卷 + 1 个 labels CSV);
- TMI 论文:权威的规模表、指标定义、榜单结果、外部验证。
三源互证是使用本数据集的底线——单看任何一源都会踩到 §10 里的坑。
二、任务与标签(Q7-Q15)
Q7:Task 1 到底在分什么?
二分类 RG vs NRG(Referable Glaucoma / No Referable Glaucoma)。注意落点是**“是否需要转诊”**,不是"有没有青光眼"。
Q8:RG 和 NRG 的官方定义是什么?
- RG:眼底图显示青光眼体征、预期存在视野损害(visual field damage expected)、需要转诊专科;
- NRG:无显著青光眼指征、无需立即转诊。关键一句:极早期病变(尚无预期视野损害)也归 NRG。
Q9:那"NRG"是不是等于"健康眼"?
不等于。 NRG 里混着"看不太清但够不上转诊"的眼,也混着"极早期、还不至于预计有视野损害"的眼。把它当"健康"来训练会带偏模型——这正是本数据集最反直觉的一点。NRG = 不需要转诊,不是"没病"。
Q10:Task 2 又是什么?为什么要单独设一个任务?
Task 2 = 对 RG 图像做 10 个附加特征的"正当化"多标签分类。它不是附加彩蛋,而是把"可解释性"从一个形容词变成了可评测的量:模型不仅要说"该转诊",还要说得出"哪个体征支持转诊"。这是 JustRAIGS 相对前作 AIROGS 的核心增量。
Q11:那 10 个特征是什么?分别什么意思?
| 缩写 | 中文 | 说明 |
|---|---|---|
| ANRS | 神经视网膜边缘外观——上部 | Appearance of Neuroretinal Rim, Superior |
| ANRI | 神经视网膜边缘外观——下部 | Appearance of Neuroretinal Rim, Inferior |
| RNFLDS | 视网膜神经纤维层缺损——上部 | Retinal Nerve Fiber Layer Defect, Superior |
| RNFLDI | 视网膜神经纤维层缺损——下部 | Retinal Nerve Fiber Layer Defect, Inferior |
| BCLVS | 环线血管裸露——上部 | Baring Circumlinear Vessel, Superior |
| BCLVI | 环线血管裸露——下部 | Baring Circumlinear Vessel, Inferior |
| NVT | 血管干鼻侧移位 | Nasalisation of the Vessel Trunk |
| DH | 视盘出血 | Disc Hemorrhages |
| LD | 筛板点 | Laminar Dots |
| LC | 大视杯 | Large Cup |
规律:四个"上/下"配对(ANRS/ANRI、RNFLDS/RNFLDI、BCLVS/BCLVI),六个独立体征(NVT、DH、LD、LC)。上下配对是因为青光眼损害在视盘上下极最典型。
Q12:Task 2 是在所有图上做的吗?
不是。Task 2 只在 RG 图像上评估。 NRG 图上没有"转诊理由"可言。所以 Task 2 的有效样本量远小于 Task 1。
Q13:数据论文说最常见的 RG 特征是什么?
神经视网膜边缘(NRR)的下部与上部外观(即 ANRI / ANRS 类)最常见;视盘出血(DH)是罕见特征。这个分布直接决定了 Task 2 的难点:常见标签大家都会,罕见标签才是拉低 Hamming loss 的主因。
Q14:一个图可以有多个附加标签吗?
可以,可多选。 这正是 Task 2 是"多标签分类"而不是"多分类"的原因——一张 RG 图可能同时具备 LC + DH + RNFLDI 等多个体征。
Q15:为什么说"正当化(justification)"比"可解释(explainable)"更准确?
因为这不是事后热力图式的"解释",而是标注时就必须勾选的转诊理由——理由是被临床专家认可的、有明确定义的 10 类体征。它把"模型说得对不对"变成了可对照标注的评测题。用"正当化"避免与"可解释 AI(XAI)"的宽泛用法混淆。
三、标注流程与质量控制(Q16-Q21)
Q16:每张图的标注要经过几个人?
最少 2 个,最多 3 个:
- 每图由 2 名 grader(G1、G2)从合格池中随机抽取并独立标注主分类(RG/NRG);
- 两人一致 → 即为终判;
- 两人分歧 → 交由 grader 3(青光眼专家,G3),G3 的判定即为终判。
Q17:附加标签(10 特征)有分歧怎么办?
不消解,而是"忽略"。 这是 JustRAIGS 标注设计里最容易被误解的一点:
- 附加标签的终值取"两名初评者一致者";若主分类一致则取两人一致项;若主分类分歧则取"一名 grader + 专家"一致项,或"仅专家"判定项;
- 任一附加标签仍有分歧 → 该标签在算法评估中对该图"忽略"(不计入汉明损失的分母)。
也就是说,分歧不是被强行抹平,而是被诚实地排除出评分。
Q18:为什么"忽略"比"消解"更诚实?
因为强行投票会把"其实标注者也不确定"的信息伪装成"确定标签"。忽略它,等于承认"这个格子我们没把握",从而避免模型被灌入似是而非的监督信号。§8.2 有专门展开。
Q19:grader 是怎么选出来的?有资格考试吗?
有。 从通过 European Optic Disc Assessment Trial(EODAT) 考核的候选者中筛选——EODAT 含 110 张立体视神经图像。数据论文口径:90 名候选 → 30 名通过(门槛 ≥85% 准确率 + ≥92% 特异度)→ 最终训练 JustRAIGS 时 20 名合格上岗(存照 #6;AIROGS 论文另记"89 报名 → 32 通过",属前作口径,勿混)。
Q20:上岗之后就一劳永逸了吗?
不。有动态质控。 每名 grader 的表现被持续监控,若灵敏度/特异度跌到 <80% / <95%(以最终判为参考),即退出并由他人重做。最终留下 20 名合格者(数据论文 Results)。这是"标注质量是流程问题不是一次性考试"的范例。
Q21:grader 的水平和一致性有多高?
- 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)(数据论文);
- 两名 grader 的表观一致率 92.45%,Gwet’s AC2 = 0.917。
注意"表观一致率"会因类别极不平衡而虚高(随机猜都容易一致),Gwet’s AC2 才是那个更可信的数——它在不平衡场景下比 Cohen’s kappa 更稳健。这一点 §8.1 与术语表都有对应。
四、规模与不平衡(Q22-Q27)
Q22:这个数据集到底有多大?(一句话答案 + 警告)
训练子集 101,442 张可评估眼底图 / 55,736 名患者(官网与 Zenodo 一致)。但总量口径有四套,引用前必须先看存照 #4——直接说"11 万张"容易被审稿人抓。
Q23:那四套总量口径分别是什么?
| 口径 | 数字 | 来源 |
|---|---|---|
| 全库(TMI 论文表) | 111,178 CFPs / 61,919 患者 | TMI 2025 |
| 全库(数据论文) | 113,893 eyes / 60,357 individuals | xops 2023(与 AIROGS 口径一致) |
| 官网宣传语 | “over 110k images from about 60,000 screenees” | 官网首页 |
| 可评估眼数 | 111,183(97.62%)(xops) vs 111,178(TMI) | 两论文 |
差异疑因"含/不含 ungradable、眼 vs 图、患者计数口径"不同。内容发布时按来源逐列标注,不做四舍五入统一。
Q24:训练集内部的 RG / NRG 各多少?
- RG:3,270 张 / 2,336 名患者
- NRG:98,172 张 / 53,400 名患者
(训练子集口径,官网与 Zenodo 一致。)
Q25:不平衡有多严重?
约 1:22。 RG 在全部可评估眼底图中占 4.38%(数据论文口径,存照 #8 单源)。这意味着——"全判 NRG"的模型准确率约 96.8%,却一个 RG 都抓不到。这就是 §8.1 讲的"高分低敏陷阱"。
Q26:既然这么不平衡,为什么不用准确率当指标?
因为准确率在这种情况下几乎不携带信息。所以 Task 1 用 Sensitivity at 95% Specificity——把特异度钉死在 95%,只看灵敏度。理由见 Q28。
Q27:测试集多大?为什么老说"两个数"?
官网:9,741 张;TMI 论文表:9,736 张 / 6,183 名患者(存照 #3,差 5 张)。分项(TMI 表):RG 1,602 张 / 1,195 人,NRG 8,134 张 / 4,988 人。测试集永不公开,所以这 5 张差异无法通过下载核对——只能双列。
五、指标与榜单(Q28-Q32)
Q28:Sensitivity at 95% Specificity 到底是什么?为什么这么设?
把特异度固定在 95%(即假阳性率上限 5%),在此门限下取灵敏度。 为什么:
- 青光眼筛查要尽量减少无谓转诊(假阳性会挤兑专科资源、制造焦虑),所以特异度优先;
- 但也不能漏(假阴性代价高),所以在满足了特异度约束后,尽量把灵敏度做高;
- 在低患病率下,这个指标比 AUC/准确率更能反映"临床可用性"。
Q29:Task 2 的 Hamming loss 怎么算?
对多标签问题,逐标签比较预测与真值是否一致,不一致的比例即 Hamming loss,越低越好。关键细节:有分歧而被"忽略"的标签不计入分母(见 Q17)。所以 Hamming loss 的分母是"有效可评标签数",不是"图数 × 10"。
Q30:挑战赛的最佳成绩是多少?
TMI 论文摘要口径:Task 1 最高 sens@spec95% = 85%;Task 2 最佳平均 Hamming loss = 0.13。(9 队参评,见 Q31 的规模存照。)
Q31:冠军是谁?具体数字呢?
冠军队伍 VUNO(韩国):
- Task 1:recall 0.9090 @ 95% specificity
- Task 2:Hamming loss 0.1240
出处:ISBI 2024 论文 doi:10.1109/ISBI56570.2024.10635758;代码 github.com/seunghoonlee-fundus/JustRAIGS-vuno。
Q32:其他队伍呢?为什么总提 ndoladimeji?
两个对照样本:
- LaTIM(法国 Brest):Task 1 ResNet50 Ensemble @ 800×800 → sens@spec95% = 0.870;Task 2 Eva + Deit3 + ResNet50 ensemble → Hamming loss = 0.239。
- ndoladimeji:ResNet34,修正后平均 Hamming loss 0.1327、sens@spec95% 0.3242、AUC 0.72。
ndoladimeji 之所以值得单拎,是因为它演示了"高分低敏陷阱":Hamming loss 0.1327 看着不错,但 sens@spec95% 只有 0.3242——Task 2 分数漂亮,Task 1 临床上却不堪用。两个指标必须一起看。
六、许可、获取与复现(Q33-Q34)
Q33:License 是什么?为什么老有个"被记错"的说法?
官方三处(官网 /dataset/ + Zenodo 记录 + TMI 论文)一致写 CC BY-NC-SA。第三方目录 EyeDataHub(khosravipooya.com)写成了 CC BY-NC-ND 4.0——判为第三方错误(存照 #1)。
区别很实际:SA(ShareAlike)要求衍生作品同许可;ND(NoDerivatives)则不允许衍生。按官方 CC BY-NC-SA 执行,不要按 ND 那样自我设限。
Q34:怎么拿到数据?下载要接受什么?体量多大?
- 入口:Zenodo 记录 10035093(概念 DOI 10035092);
- 动作:页面公开,但下载需在 Zenodo 页面接受 CC BY-NC-SA 条款(self-service clickthrough);
- 体量:7 个文件、合计 54.2 GB——6 个分卷(Train_0…Train_5,各 9.3 GB,最后一卷 7.7 GB)+ 1 个 labels CSV(9.2 MB);
- 注意双口径:EyeDataHub 记 “~100 GB”(疑为解压后口径,存照 #7);
- 测试集:永不公开。所以你无法在本地复现榜单——只能按官方评估脚本(GitHub: HinaRaja65/JustRAIGS_Challange 的 evaluate.py / hamming_loss.py / sensy_at_specy.py)在训练集上做内部划分自评。
事实清单(硬事实 40 条)
以下每条均可在 FACTS.md 找到对应出处;带【存照 #n】的表示存在多口径冲突,正文 §10.1 有逐条说明。
命名与身份
- 全称:Justified Referral in AI Glaucoma Screening(可解释转诊的 AI 青光眼筛查挑战赛)。
- slug:
justraigs(官方小写连写)。 - 本质:ISBI 2024 官方挑战赛 + 配套训练集,非单纯静态数据集。
- 官网:https://justraigs.grand-challenge.org/ (含 /dataset/ 页)。
- 本站网址链:https://www.qianfanghub.com/ai-ready-dataset/justraigs/746 。
论文与时间线
- 数据论文:Lemij HG 等,Ophthalmology Science 2023;3(3):100300,doi:10.1016/j.xops.2023.100300。
- 挑战赛总结论文:Madadi Y 等,IEEE TMI 2025,PMID 40773411,doi:10.1109/TMI.2025.3596874。
- 前作论文:AIROGS,IEEE TMI 2024;43(1):542-557,doi:10.1109/TMI.2023.3313786,PMID 37682655。
- 挑战赛开发阶段:2024-01-08 → 2024-04-20;测试阶段:2024-03-01 → 2024-04-20(TMI 论文口径)。
- Zenodo 首版发布日:2024-01-08,仅此一版。
- 参评规模:【存照 #2】TMI 论文记开发阶段 322 名参与者 / 37 国、测试阶段 20 支队伍;VUNO 新闻稿与 Asia Business Daily 记"46 支队伍、约四个月"。
- 参评队伍须线下出席 ISBI 2024 并全额注册会议。
机构与人物
- 影像数据提供方:EyePACS LLC(美国加州圣克鲁斯)。
- 标注提供方:Rotterdam Ophthalmic Institute / Rotterdam Eye Hospital(荷兰鹿特丹)。
- 关键人物:Hans G. Lemij、Coen de Vente、Clara I. Sánchez、Koenraad A. Vermeer、Yeganeh Madadi、Siamak Yousefi、Hina Raja。
- grader 资格考试:EODAT(含 110 张立体视神经图像)。
- grader 候选/合格数:【存照 #6】xops 记 90 候选 → 30 通过 → 20 上岗;AIROGS 论文记 89 报名 → 32 通过。
- grader 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)。
- 两名 grader 表观一致率 92.45%,Gwet’s AC2 = 0.917。
数据规模
- 全库总量:【存照 #4】TMI 记 111,178 CFPs / 61,919 患者;xops 记 113,893 eyes / 60,357 individuals;官网宣传语记 “over 110k images from about 60,000 screenees”。
- 训练子集(公开):101,442 张可评估眼底图 / 55,736 名患者。
- 训练集 RG:3,270 张 / 2,336 名患者。
- 训练集 NRG:98,172 张 / 53,400 名患者。
- 测试集:【存照 #3】官网 9,741 张;TMI 表 9,736 张 / 6,183 患者。
- 测试集分项(TMI 表):RG 1,602 张 / 1,195 人;NRG 8,134 张 / 4,988 人。
- 可评估眼数:【存照 #5】xops 记 111,183(97.62%)vs TMI 记 111,178。
- RG 患病率:全部可评估眼底图中 4.38%(xops 口径,存照 #8 单源),约 1:22 不平衡。
- 覆盖约 500 个美国筛查点,人群族裔异质。
- 年龄(TMI 表,训练集):RG 63.0±10.5 岁;NRG 56.5±10.1 岁。
- 图像格式 JPEG;分辨率中位数 (2354, 3296, 3),范围 (212,320,3)–(6000,6000,3)。
- 相机十类构成(训练集 101,442 口径):Optovue iCam100 26,480(26.1%)、Topcon NW400 20,557(20.3%)、未知 20,826(20.5%)、Canon CR1 10,274(10.1%)、Canon DGI 9,581(9.4%)、Canon CR2 9,179(9.0%)、Topcon NW200 2,888(2.8%)、Centervue DRS 1,598(1.6%)、Nidek AFC300 153(0.1%)、Crystalvue NFC-700 6(0.0%)。
任务与标注
- Task 1 = RG/NRG 二分类;Task 2 = 对 RG 图像的 10 特征多标签分类(仅 RG)。
- RG 定义要点:有青光眼体征、预期存在视野损害、需转诊;极早期尚无预期视野损害者归 NRG。
- 标注流程:2 名 grader 独立标主分类 → 分歧交 G3 专家终判;附加标签分歧不消解而忽略(不计入汉明损失分母)。
- 动态质控:grader 灵敏度/特异度跌至 <80% / <95% 即退出重做。
- 最常见 RG 特征:神经视网膜边缘(NRR)上/下外观;DH(视盘出血)罕见。
指标、榜单与许可
- Task 1 指标 = Sensitivity at 95% Specificity;Task 2 指标 = Hamming loss。
- 官方最佳(TMI 摘要):Task 1 最高 sens@spec95% = 85%;Task 2 最佳平均 Hamming loss = 0.13。
- 冠军 VUNO:Task 1 recall 0.9090 @ 95% spec;Task 2 Hamming loss 0.1240(doi:10.1109/ISBI56570.2024.10635758)。
- 训练集 License = CC BY-NC-SA(官网 + Zenodo + TMI 三源一致;【存照 #1】EyeDataHub 误记 CC BY-NC-ND 4.0);测试集永不公开;Zenodo 训练集 7 文件合计 54.2 GB(【存照 #7】EyeDataHub 记 ~100 GB)。
术语表(34 条)
| 术语 | 中文 | 释义 |
|---|---|---|
| JustRAIGS | 可解释转诊的 AI 青光眼筛查挑战赛 | ISBI 2024 挑战赛 + 配套训练集 |
| RG | 需转诊青光眼 | Referable Glaucoma;有体征、预期有视野损害、需转诊 |
| NRG | 无需转诊青光眼 | No Referable Glaucoma;≠健康眼,含极早期病变 |
| CFP | 彩色眼底照相 | Color Fundus Photograph |
| Task 1 | 转诊性能任务 | RG/NRG 二分类 |
| Task 2 | 正当化性能任务 | 对 RG 图的 10 特征多标签分类 |
| ANRS / ANRI | 神经视网膜边缘外观(上/下) | Appearance of Neuroretinal Rim, Superior/Inferior |
| RNFLDS / RNFLDI | 视网膜神经纤维层缺损(上/下) | Retinal Nerve Fiber Layer Defect, Superior/Inferior |
| BCLVS / BCLVI | 环线血管裸露(上/下) | Baring Circumlinear Vessel, Superior/Inferior |
| NVT | 血管干鼻侧移位 | Nasalisation of the Vessel Trunk |
| DH | 视盘出血 | Disc Hemorrhages(罕见特征) |
| LD | 筛板点 | Laminar Dots |
| LC | 大视杯 | Large Cup |
| NRR | 神经视网膜边缘 | Neuroretinal Rim;最常见 RG 特征所在 |
| EODAT | 欧洲视盘评估试验 | European Optic Disc Assessment Trial,含 110 张立体视神经图,grader 资格考核 |
| grader | 标注者 | 经资质考核的眼科读片者;本数据集最终 20 名合格 |
| G3 | 专家判定者 | 打破 G1/G2 主分类分歧的第三名(青光眼专家) |
| adjudication | 裁决/终判 | 分歧时由 G3 给出的最终判定 |
| gradable / ungradable | 可评估/不可评估 | 图像质量是否足以判读;不可评估者不计入训练子集 |
| Sensitivity at 95% Specificity | 95% 特异度下的灵敏度 | Task 1 指标;特异度钉死 95%,取灵敏度 |
| sens@spec95% | 同上(缩写) | 见上 |
| Hamming loss | 汉明损失 | Task 2 指标;多标签逐项不一致率,越低越好 |
| Gwet’s AC2 | Gwet 的 AC2 一致性系数 | 类别不平衡下比 Cohen’s kappa 更稳健;本数据集 0.917 |
| 类别不平衡 | class imbalance | 本数据集 RG:NRG ≈ 1:22 |
| 患病率 | prevalence | RG 占可评估眼 4.38% |
| 域泛化 | domain generalisation | 跨相机/机构仍稳健;因多相机谱系而关键 |
| AIROGS | 稳健青光眼筛查 AI 挑战赛 | JustRAIGS 前作,同团队 |
| OHTS | 高眼压治疗研究 | Ocular Hypertension Treatment Study;外部验证子集约 5,000 CFP |
| ISBI | IEEE 国际生物医学成像研讨会 | 挑战赛主办会议(2024) |
| TMI | IEEE 医学成像汇刊 | 挑战赛总结论文发表期刊 |
| xops | Ophthalmology Science | 数据论文发表期刊(2023) |
| Zenodo | Zenodo 开放存储库 | 训练集唯一官方下载处(records/10035093) |
| CC BY-NC-SA | 署名-非商业-相同方式共享 | 训练集官方许可 |
| DAIMS | 数据资产可发现性评估模型 | 用于本条目的 AI-Ready 五维打分(§11) |
附录
附录 A:标注流水线示意
┌─────────────────────────────┐
│ 待标眼底图(随机抽取分配) │
└──────────────┬──────────────┘
│
┌────────────────┴────────────────┐
│ │
┌─────▼─────┐ ┌─────▼─────┐
│ G1 独立 │ │ G2 独立 │
│ 标主分类 │ │ 标主分类 │
│ (RG/NRG) │ │ (RG/NRG) │
└─────┬─────┘ └─────┬─────┘
│ │
└────────────────┬────────────────┘
│
┌──────────▼──────────┐
│ 主分类是否一致? │
└────┬─────────┬──────┘
一致 │ │ 分歧
│ │
│ ┌────▼─────┐
│ │ G3 专家 │
│ │ 终判 │
│ └────┬─────┘
│ │
┌────▼─────────▼─────┐
│ 终判 = RG 或 NRG │
└──────────┬─────────┘
│
┌──────────▼──────────┐
│ 若 RG:勾选 10 特征 │
│ (可多选,正当化理由)│
└──────────┬──────────┘
│
┌──────────▼──────────┐
│ 附加标签仍有分歧? │
└────┬─────────┬──────┘
一致 │ │ 分歧
│ │
┌────▼───┐ ┌───▼──────────┐
│ 采信 │ │ 该标签"忽略" │
│ │ │(不入汉明损失 │
│ │ │ 分母) │
└────────┘ └───────────────┘
一句话读法:主分类分歧有人拍板,附加标签分歧直接出局——前者保任务可做,后者保监督诚实。
附录 B:10 特征中英对照速查
| # | 缩写 | 英文全称 | 中文 |
|---|---|---|---|
| 1 | ANRS | Appearance of Neuroretinal Rim, Superior | 神经视网膜边缘外观——上部 |
| 2 | ANRI | Appearance of Neuroretinal Rim, Inferior | 神经视网膜边缘外观——下部 |
| 3 | RNFLDS | Retinal Nerve Fiber Layer Defect, Superior | 视网膜神经纤维层缺损——上部 |
| 4 | RNFLDI | Retinal Nerve Fiber Layer Defect, Inferior | 视网膜神经纤维层缺损——下部 |
| 5 | BCLVS | Baring Circumlinear Vessel, Superior | 环线血管裸露——上部 |
| 6 | BCLVI | Baring Circumlinear Vessel, Inferior | 环线血管裸露——下部 |
| 7 | NVT | Nasalisation of the Vessel Trunk | 血管干鼻侧移位 |
| 8 | DH | Disc Hemorrhages | 视盘出血(罕见) |
| 9 | LD | Laminar Dots | 筛板点 |
| 10 | LC | Large Cup | 大视杯 |
附录 C:训练集相机构成表(101,442 张口径)
| 相机 | 数量 | 占比 |
|---|---|---|
| Optovue iCam100 | 26,480 | 26.1% |
| Topcon NW400 | 20,557 | 20.3% |
| 未知 | 20,826 | 20.5% |
| Canon CR1 | 10,274 | 10.1% |
| Canon DGI | 9,581 | 9.4% |
| Canon CR2 | 9,179 | 9.0% |
| Topcon NW200 | 2,888 | 2.8% |
| Centervue DRS | 1,598 | 1.6% |
| Nidek AFC300 | 153 | 0.1% |
| Crystalvue NFC-700 | 6 | 0.0% |
| 合计 | 101,442 | 100% |
读法:前十类里有两类 Topcon、三类 Canon、一类 Optovue,加 20.5% 未知来源——任何单一相机的性能都不代表整体性能。这是"多相机谱系"在数据层面的直接证据(§8.6)。
附录 D:Zenodo 训练集文件清单(records/10035093,共 7 文件 / 54.2 GB)
| 文件 | 大小 | md5 |
|---|---|---|
| JustRAIGS_Train_0.zip | 9.3 GB | b77f8679cc02a2fafe9953abff89fafb |
| JustRAIGS_Train_1.zip | 9.3 GB | fd21d85eafb54bd1d3f6190c739246d0 |
| JustRAIGS_Train_2.zip | 9.3 GB | aff8fb52e068fc1050e6a8f32238a638 |
| JustRAIGS_Train_3.zip | 9.3 GB | a411fd5cd1cebdaeedb5727204abdfba |
| JustRAIGS_Train_4.zip | 9.3 GB | 0fb8cd04c0d39a93ce97f05ec4b109e4 |
| JustRAIGS_Train_5.zip | 7.7 GB | 76fa9a9f131a866054206392f7f1bfc6 |
| JustRAIGS_Train_labels.csv | 9.2 MB | 0d01181f067f57ece1e7e1f07167a78e |
注意:Zenodo 单版本记录;概念 DOI 为 10035092。下载前需接受 CC BY-NC-SA 条款。
附录 E:互链索引(按库内 rid 排序)
| rid | 条目 | 链接强度 | 理由 |
|---|---|---|---|
| 58 | eyepacs | ★★★ 强 | 同源于 EyePACS LLC,数据血缘 |
| 59 | messidor | ★ 弱 | 眼底 DR 分级,不同疾病 |
| 62 | refuge | ★★★ 强 | 同为青光眼域(视盘/视杯分割) |
| 63 | odir | ★★ 中 | 眼科多疾病标签 |
| 191 | idrid | ★ 弱 | 眼底 DR,不同疾病 |
| 201 | ddr | ★ 弱 | 眼底 DR 分类 |
| 211 | deepdrid | ★ 弱 | 糖网分级 |
| 221 | fgadr | ★ 弱 | 细粒度糖网 |
| 271 | rfmid | ★★ 中 | 眼底多疾病分类 |
| 579 | meddra | ○ 不建议 | 不良事件术语,仅概念级弱关联 |
| 741 | fives | ★★ 中 | 眼底多疾病分割 |
库内缺口:AIROGS 无条目——JustRAIGS 的直接前作,建议作为新增条目并建立双向链(§9.3)。
附录 F:DAIMS 评估卡片
| 维度 | 得分 | 要点 |
|---|---|---|
| Discoverability(可发现性) | 5/5 | Zenodo + 官网 + 两篇论文 + DOI,入口齐全 |
| Accessibility(可获取性) | 4/5 | 公开但需接受条款;54.2 GB 体量与闭集测试集是门槛 |
| Interoperability(互操作性) | 4/5 | JPEG + CSV 标签,通用;中文生态需自建映射 |
| Metadata(元数据) | 4/5 | 文档完善,但总量数字多口径需先读 §10 |
| Sustainability(可持续性) | 4/5 | Zenodo + CC 许可 + DOI 稳定;单一版本无后继需留意 |
| 合计 | 21/25 | 高度 AI-Ready,但"不顺手" |
附录 G:最小复现步骤(本地自评)
- 到 Zenodo records/10035093 接受 CC BY-NC-SA 条款,下载 6 个分卷 + labels CSV(约 54.2 GB);
- 校验 md5(见附录 D);
- 解压合并,按
patient字段做患者级划分(切勿按图随机划分,§8.4); - 拉取官方评估脚本
github.com/HinaRaja65/JustRAIGS_Challange(evaluate.py/hamming_loss.py/sensy_at_specy.py); - Task 1 按 sens@spec95% 评估;Task 2 仅对 RG 图、剔除被忽略标签后算 Hamming loss;
- 注意:无法本地复现官方榜单——测试集永不公开。
附录 H:存照冲突一览(引用前必读)
| # | 冲突项 | 口径 A | 口径 B | 采信建议 |
|---|---|---|---|---|
| 1 | License | CC BY-NC-SA(官网+Zenodo+TMI) | CC BY-NC-ND 4.0(EyeDataHub) | 采 A,B 判误 |
| 2 | 参评队伍 | 20 队(TMI) | 46 队(新闻稿) | 引 TMI,新闻口径另注 |
| 3 | 测试集规模 | 9,741 张(官网) | 9,736 张 / 6,183 人(TMI) | 双列 |
| 4 | 全库总量 | 111,178(TMI)/113,893(xops) | “over 110k”(官网) | 按来源逐列 |
| 5 | 可评估眼数 | 111,183(xops) | 111,178(TMI) | 双列 |
| 6 | grader 数 | 90→30→20(xops) | 89→32(AIROGS) | 引 xops 并注差异 |
| 7 | Zenodo 体量 | 54.2 GB(官方) | ~100 GB(EyeDataHub) | 采官方 |
| 8 | RG 患病率 | 4.38%(xops 单源) | — | 标注单源 |
| 9 | 论文年份 | xops 2023 | TMI 2025 | 勿混引 |
尾注
来源清单(按抓取与核验顺序)
- JustRAIGS 挑战赛官网:https://justraigs.grand-challenge.org/ (挑战概览、任务定义)与 /dataset/ 页(标注流程、license 声明、训练/测试规模)——实抓,2026-09-30。
- Zenodo 训练集记录:https://zenodo.org/records/10035093 (文件清单、md5、CC BY-NC-SA 声明;概念 DOI 10035092)——经搜索镜像核验(沙箱直连 Zenodo API 被阻断),2026-09-30。
- 数据论文:Lemij HG, de Vente C, Sánchez CI, Vermeer KA. Characteristics of a Large, Labeled Data Set for the Training of Artificial Intelligence for Glaucoma Screening with Fundus Photographs. Ophthalmology Science 2023;3(3):100300. doi:10.1016/j.xops.2023.100300.
- 挑战赛总结论文:Madadi Y, Raja H, Vermeer KA, Lemij HG, et al., Yousefi S. JustRAIGS: Justified Referral in AI Glaucoma Screening Challenge. IEEE Transactions on Medical Imaging, 2025. doi:10.1109/TMI.2025.3596874;PMID 40773411.
- 前作挑战赛论文:de Vente C, Vermeer KA, et al., Sánchez CI. AIROGS: Artificial Intelligence for Robust Glaucoma Screening Challenge. IEEE TMI 2024;43(1):542-557. doi:10.1109/TMI.2023.3313786;PMID 37682655.
- 冠军方案论文(VUNO):doi:10.1109/ISBI56570.2024.10635758;代码 github.com/seunghoonlee-fundus/JustRAIGS-vuno。
- 官方评估代码:github.com/HinaRaja65/JustRAIGS_Challange(evaluate.py / hamming_loss.py / sensy_at_specy.py)。
- 参赛方案代码:LaTIM github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution;ndoladimeji 方案(GitHub)。
- 第三方目录(仅作冲突存照来源):EyeDataHub(khosravipooya.com)。
- 新闻口径(存照 #2):VUNO 官方新闻稿;Asia Business Daily。
核验声明
- 抓取时点:2026-09-30。
- 存在性核验:依教训 12 体系,三轮精确 WebSearch(×6)+ 官网 /dataset/ 与首页实抓 + Zenodo 记录(搜索镜像)三源互证。
- 查重:数据库
url_name ILIKE '%justraigs%'与%raigs%均返回 0 行;writing/下无同名目录——不撞库。 - 双口径纪律:凡多来源冲突,本条目不取平均值、不四舍五入统一,一律双列并在 §10.1 与附录 H 留档,供后续修订可追溯。
- 待核疑点(4 条):① Zenodo 是否有官方 dataset card 明示许可细目;② OHTS 外部数据集公开性;③ 46 vs 20 队伍的权威口径;④ 挑战赛 “still ongoing”(Zenodo 描述)与 ISBI 2024 已结束的时效矛盾。
修订记录
| 版本 | 日期 | 说明 |
|---|---|---|
| v1.0 | 2026-09-30 | 初稿;基于三源互证;存照 9 条 + 待核 4 条 |
本条目为千方病案医数集(qianfanghub.com)AI-Ready Wikipedia 产出,遵循双口径存照纪律;任何数字引用前请先读 §10.1 与附录 H。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- origa-light — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
- refuge2 — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 挑战赛数据集
- riga — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
- acrima — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
- sics-155 — 共享标签:医学影像 / 眼科影像 / 图像分类 / 挑战赛数据集
- g1020 — 共享标签:眼科影像 / 图像分类 / 青光眼 / 评测基准
- gamma — 共享标签:医学影像 / 眼科影像 / 青光眼
- drions-db — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准
- rfmid — 共享标签:医学影像 / 眼科影像 / 图像分类
- oct2017 — 共享标签:医学影像 / 眼科影像 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

