JustRAIGS (justraigs) — 青光眼转诊的双任务可解释筛查挑战赛与 10 万张眼底图训练集 — AI-Ready Wikipedia

ISBI 2024 挑战赛:101,442 张眼底照相既要判「该不该转诊青光眼专科」(RG/NRG 二分类)又要说清「凭什么转」(10 个青光眼体征多标签),421 条标注规则由 20 名通过 EODAT 考核的 grader 双评+专家终审产出

来源 EyePACS LLC(美国加州圣克鲁斯)糖网筛查项目眼底彩色照相(CFP,JPEG),经 Rotterdam Eye Hospital 眼科专家按 RG/NRG 二分类 + 10 项青光眼体征多标签标注;约 500 个筛查点、10 种相机型号,族裔异质人群发布时间: 2026-09-30最后更新: 2026-09-30 阅读 8
JustRAIGS (justraigs) — 青光眼转诊的双任务可解释筛查挑战赛与 10 万张眼底图训练集 — AI-Ready Wikipedia

信息速览

数据集名称JustRAIGS (justraigs) — 青光眼转诊的双任务可解释筛查挑战赛与 10 万张眼底图训练集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,公开数据集
规模全库 61,919 患者 / 111,178 张眼底图(TMI 论文口径);公开训练集 101,442 张 / 55,736 患者;闭集测试集 9,736 张 / 6,183 患者
接入方式EyePACS LLC(美国加州圣克鲁斯)糖网筛查项目眼底彩色照相(CFP,JPEG),经 Rotterdam Eye Hospital 眼科专家按 RG/NRG 二分类 + 10 项青光眼体征多标签标注;约 500 个筛查点、10 种相机型号,族裔异质人群
AI 就绪度

INFOBOX — JustRAIGS 一屏速览

维度 内容
本质 ISBI 2024 挑战赛 + 配套公开训练集(青光眼转诊筛查,双任务:二分类 + 多标签解释)
团队 影像方 EyePACS LLC(美国)|标注方 Rotterdam Eye Hospital / Rotterdam Ophthalmic Institute(荷兰)
论文 数据论文:Ophthalmology Science 2023;3(3):100300|挑战赛总结:IEEE TMI 2025(PMID 40773411)
数据(训练) 101,442 张眼底图 / 55,736 患者;RG 3,270 / NRG 98,172
数据(全库) 111,178 张 CFPs / 61,919 患者(TMI 口径,另有多口径存照)
传感器 JPEG 彩色眼底照相(CFP),10 种相机型号,约 500 个筛查点
Task 1 RG vs NRG 二分类,指标 Sensitivity at 95% Specificity
Task 2 RG 图 10 项青光眼体征多标签,指标 Hamming loss
标注 2 名 grader 双评 → 分歧由专家 G3 终审;grader 经 EODAT 考核;实测 20 名合格
最佳成绩 sens@spec95% 最高 85%;平均 Hamming loss 最低 0.13;冠军 VUNO(韩国)
测试集 闭集不公开(9,736 张 / 6,183 患者,TMI 口径;官网 9,741)
获取 Zenodo 10035093(CC BY-NC-SA,需接受条款;6 分卷 + labels,54.2 GB)
前作 AIROGS(同团队,113,893 眼青光眼筛查)——库内暂无条目
库内互链 refuge(rid 62,青光眼视盘分割)、eyepacs(rid 58,同源数据)、fives/rfmid/odir 等眼底条目

JustRAIGS 是一个把青光眼筛查的"要不要转诊"和"为什么该转诊"两件事一次性摆到台面上的挑战赛(ISBI 2024)。它不满足于让模型输出一个二分类概率,而是要求模型在判出"需转诊"(RG)之后,进一步指出支撑判断的 10 个具体青光眼体征(如神经视网膜边缘上部/下部异常、视网膜神经纤维层缺损、视盘出血、大视杯等)——这正是临床上眼科医生写转诊单时要说明的理由。数据集来自 EyePACS 在美国约 500 个筛查点采集的十万余张彩色眼底图,由荷兰 Rotterdam Eye Hospital 的专家按严格的双评+终审流程标注,训练集约 10 万张以 CC BY-NC-SA 在 Zenodo 公开,闭集测试集则永不公开。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——训练集在 Zenodo(CC BY-NC-SA),测试集闭集,别指望复现 leaderboard。
  2. 关心任务设计:直奔 §5 任务定义与 §3 注释流水线——Task 1/Task 2 的双层目标与"分歧即忽略"的标签规则是全篇最有迁移价值的部分。
  3. 做青光眼或眼底 AI:直奔 §9 库内关系——refuge(同为青光眼)与 eyepacs(同源数据)是最强互链点,JustRAIGS 补上了"转诊决策+可解释性"这一格。

§0 导读:这个数据集解决什么问题

青光眼是全球不可逆致盲的首要原因,而它的可怕之处在于早期几乎没有症状——视野损害往往在不知不觉中已过半。因此青光眼筛查的关键产品不是"诊断",而是一个转诊决策:眼前这张眼底图的主人,到底该不该被转去眼科专科做进一步检查?这里有一个临床上的微妙之处:并非所有眼底异常都需要立刻转诊,极早期的病变(尚无预期视野损害)临床上可以观察随访而非转诊,而一旦眼底体征提示"预期存在视野损害",就必须转诊。JustRAIGS 把这一临床逻辑直接编码成任务:正类 RG(Referable Glaucoma,需转诊青光眼)对应的正是后者。

传统青光眼 AI 筛查研究大多止步于"给一个是不是青光眼的分数"。这带来两个问题:一是低患病率场景(本数据集 RG 仅约 4.38%)下模型倾向保守,且单纯的 AUC/准确率无法反映临床上真正关心的"在高特异度下还能抓到多少病例";二是黑箱式的分数无法被临床医生信任,医生需要知道模型"看到了什么"才敢采纳它的转诊建议。JustRAIGS 的回答分为两层:Task 1 用 Sensitivity at 95% Specificity 这一贴近临床的指标评估转诊判别力(在 95% 特异度门限下测灵敏度,即"在保证极少误报的前提下能抓到多少真阳性");Task 2 则要求模型对每个 RG 图像给出 10 项青光眼体征的多标签判断,用 Hamming loss 评估解释质量——这就把"可解释性"从附加说明变成了可量化、可排行榜的任务。

§0 读法三则:

  1. 这个条目是"挑战赛 + 数据集 + 基准"三合一:本体是公开训练集,任务与指标是一套评测基准,测试集闭集,三者获取方式不同(§6)。
  2. 全文涉及多套规模口径(总量、测试集、参评队伍数、许可),凡有冲突处均在 §9 与坑点中存照,引用请标明来源。
  3. 检索时注意区分三个同源名:JustRAIGS(本挑战赛)、AIROGS(同团队前作)、EODAT(grader 选拔用的视神经阅片考核,非数据集)——它们常在同一文献群里出现。

§1 数据集速览:十问十答

Q1:JustRAIGS 是什么的缩写?
Justified Referral in AI Glaucoma Screening——“可解释转诊的 AI 青光眼筛查”。另一展开式为 “Justify your AI prediction for Referable or Not Referable Glaucoma Screening”,强调模型必须为"可转诊/不可转诊"的判断给出证据。两种展开均见于官方与 EyeDataHub 记录。

Q2:它是数据集还是挑战赛?
两者都是。它是一个 ISBI 2024 官方挑战赛,同时也是配套发布的公开训练集。挑战赛本体提供训练集与闭集测试集,训练集在 Zenodo 公开,测试集永不公开。

Q3:数据从哪来、多少张?
影像由 EyePACS LLC(美国加州圣克鲁斯)从其糖网筛查项目提供,覆盖美国约 500 个筛查点;标注由荷兰 Rotterdam Eye Hospital / Rotterdam Ophthalmic Institute 完成。公开训练集为 101,442 张可评估眼底图 / 55,736 患者;全库(含闭集测试集)TMI 论文口径为 111,178 张 CFPs / 61,919 患者。

Q4:RG 和 NRG 分别是什么?
RG = Referable Glaucoma(需转诊青光眼):眼底图显示青光眼体征、预期存在视野损害,应转专科。NRG = No Referable Glaucoma:无显著需转诊指征,极早期病变(尚无预期视野损害)也归 NRG。训练集中 RG 3,270 张、NRG 98,172 张。

Q5:两个任务分别做什么?
Task 1 是 RG/NRG 二分类,评的是转诊判别力(Sensitivity at 95% Specificity)。Task 2 只针对 RG 图像,做 10 项青光眼体征的多标签分类,评的是解释质量(Hamming loss)。Task 2 的十项体征见 §5。

Q6:指标为什么这么设计?
青光眼筛查是低患病率场景(RG 约 4.38%),误报的代价是大量健康人被转诊、浪费专科资源;漏报的代价是失访致盲。因此用 Sensitivity at 95% Specificity——固定一个很高的特异度门限(95%),看模型还能捞回多少真阳性,比单纯 AUC 更贴近临床决策点。Task 2 用 Hamming loss(多标签平均错分比例,越低越好)。

Q7:标注可靠吗?
流程严格:每图由 2 名 grader(经 EODAT 视神经阅片考核筛选)从合格池随机抽取独立判 RG/NRG;一致即终判,分歧由第 3 名青光眼专家终审。选 RG 的 grader 须勾选转诊理由(10 项体征)。附加体征标签若仍分歧,则该标签在算法评估中对该图忽略。数据论文实测 grader 平均灵敏度 85.6%(SD 5.7)/ 特异度 96.1%(SD 2.8),两名 grader 一致率 92.45%。

Q8:最好成绩是什么水平?
TMI 挑战赛总结论文:sens@spec95% 最高 85%,平均 Hamming loss 最低 0.13。冠军队伍 VUNO(韩国) Task 1 recall 0.9090 @ 95% 特异度、Task 2 Hamming loss 0.1240。可见"高特异度下高灵敏"与"多标签解释"都远未饱和。

Q9:我现在能拿到什么?
训练集走 Zenodo 10035093(CC BY-NC-SA,需在页面接受条款;6 个分卷 zip + 1 个 labels CSV,合计 54.2 GB)。测试集闭集、不公开。评估脚本与部分参赛方案在 GitHub 公开。

Q10:它对 AI-Ready 重要在哪?
它是库内少见的"低患病率 + 可解释性"双约束筛查基准:Sensitivity at 95% Specificity 与 Task 2 多标签把筛查 AI 的评估从"准不准"推进到"临床可用不可用、可不可信"。同时它与库内 refuge(青光眼)、eyepacs(同源数据)形成强互链,补齐眼底筛查家族的转诊决策一格。

§2 数据构成与规格

本节把 JustRAIGS 的"数据实体"讲清楚:总量有多少、分几层、每层多少、图像从哪来、拍成什么样、类别怎么分布。凡遇多来源数字不一致处,一律双列并标注来源(对应 FACTS §4、§9 的存照表),不取单一口径。

2.1 规模、来源与机构构成

JustRAIGS 的"数据集"其实是一个三层结构:全库(含闭集测试)→ 公开训练子集 → 挑战赛专用测试子集。

层级 眼底图数 患者数 公开性 来源口径
全库(all CFPs) 111,178 61,919 部分(仅训练子集公开) TMI 2025 论文表
全库(另口径) 113,893 眼 60,357 人 — Ophthalmology Science 2023(与 AIROGS 全库同口径)
公开训练子集 101,442 55,736 公开于 Zenodo 官网 /dataset/ + Zenodo + TMI 三处一致
挑战赛测试子集 9,741(官网)/ 9,736 / 6,183 患者(TMI) 6,183 永不公开 双口径存照

全库宣传语在官网写作 “over 110k images from about 60,000 screenees, taken at about 500 sites”——这是面向读者的约数,与论文的精确表数字并存,不是矛盾而是精度差异。

影像提供方与标注提供方是两家不同的机构,这一点在引用时必须分清:

  • 影像来源:EyePACS LLC(Santa Cruz, CA, USA),眼底图取自其糖网筛查项目(diabetic retinopathy screening)的常规拍摄。这意味着图像本身并非"为青光眼专门采集",而是筛查场景下的既有眼底照相(CFP)——人群构成、拍摄设备、图像质量都带着糖网筛查项目的现实痕迹。
  • 标注来源:Rotterdam Ophthalmic Institute / Rotterdam Eye Hospital(荷兰鹿特丹眼科医院与眼科研究所)。标注者由该机构的青光眼专家体系组织与质控。

为什么"影像来自 A、标注来自 B"很重要:这决定了 JustRAIGS 的标签是"跨机构、事后判读"而非"本院临床金标准"。判读者看不到患者的视野报告、眼压、随访史,只能从单张(或数张)眼底图推断"是否预期存在视野损害"——RG 的定义本质是一个基于影像的转诊判断,而非基于确诊的诊断。理解这一点,才能正确解读 Task 1 的指标设计(见 §5)。

覆盖范围方面,全库取自美国境内约 500 个筛查点,族裔与人群高度异质。这不是一个"单一医院单一人群"的干净实验集,而是一个真实世界筛查场景的横切样本——优势是泛化外部效度好,代价是混杂因素多。

2.2 图像规格与设备构成

格式与分辨率:图像为 JPEG 格式。与 JustRAIGS 同源的 AIROGS 全库报告的分辨率中位数为 2354 × 3296 × 3,范围从 212 × 320 × 3 到 6000 × 6000 × 3——跨度极大。这意味着预处理(缩放、裁剪、去黑边)不是可选项而是必需项,各参赛方案的输入分辨率从 224×224 到 800×800 不等(见 §5.3)。

设备构成是这张表里最容易被忽略、却最影响复现的一件事。训练集 101,442 张图的相机分布(TMI 2025 论文表):

相机型号 数量 占比
Optovue iCam100 26,480 26.1%
Topcon NW400 20,557 20.3%
未知(unknown) 20,826 20.5%
Canon CR1 10,274 10.1%
Canon DGI 9,581 9.4%
Canon CR2 9,179 9.0%
Topcon NW200 2,888 2.8%
Centervue DRS 1,598 1.6%
Nidek AFC300 153 0.1%
Crystalvue NFC-700 6 0.0%

读这张表的三条要点:

  1. 没有任何单一设备占绝对主导:最高的 Optovue iCam100 也只占 26.1%,Topcon NW400 与"未知"各约 20%。好处是模型被迫学习设备无关的青光眼形态学特征;坏处是域偏移(domain shift)风险分散在多个方向,一次"换设备"的部署就可能同时跨越多条域鸿沟。
  2. "未知"占 20.5%:超过五分之一的图没有记录设备型号。任何声称"按设备分层评估"的二次研究,都必须先声明这 20.5% 如何处理——直接丢弃会损失数据,归为"其他"又引入异质桶。
  3. 长尾极长:Nidek AFC300(153 张)与 Crystalvue NFC-700(6 张)几乎可以忽略,但存在——数据卡片里应当保留"支持该设备"的事实,但不能据此声称模型对该设备鲁棒。

这一设备谱系正是 JustRAIGS 与库内同源条目 eyepacs(rid 58)的血缘连接点:两者都源自 EyePACS LLC 的糖网筛查项目影像,只是任务目标不同(eyepacs 是糖网分级,JustRAIGS 是青光眼转诊 + 可解释特征)。见 §9。

2.3 任务相关的标签体系

JustRAIGS 的标签不是"一张图一个病名"的简单分类,而是两层标签:主分类(1 个)+ 附加特征(10 个,仅对 RG 图)。

主分类(Task 1):

  • RG(Referable Glaucoma,需转诊青光眼):眼底图显示青光眼体征,且预期存在视野损害(visual field damage expected),应转诊至专科。
  • NRG(No Referable Glaucoma,无需转诊):无显著青光眼指征,无需立即转诊。关键细节:极早期病变、尚不预期存在视野损害者,也归入 NRG。

这里有一个极易误读的设计:RG 的门槛是"可转诊 / 预期已有视野损害",而不是"有青光眼"。一个视盘已有可疑改变、但按判读者经验尚不足以预期功能损害的眼睛,会被标成 NRG。所以 JustRAIGS 的 NRG 不等于"健康眼",它包含大量"早早期/可疑"样本。用这个数据集训练"青光眼 vs 健康"的模型会系统性错配——这是 §10 避坑清单里的第一条。

附加特征(Task 2,10 个,仅 RG 图评估):这些特征是判读者被要求"勾选的转诊理由",共 10 项,可多选:

缩写 英文全称 中文含义 方位
ANRS Appearance neuroretinal rim superiorly 神经视网膜边缘上部外观异常 上
ANRI Appearance neuroretinal rim inferiorly 神经视网膜边缘下部外观异常 下
RNFLDS Retinal nerve fiber layer defect superiorly 视网膜神经纤维层缺损(上) 上
RNFLDI Retinal nerve fiber layer defect inferiorly 视网膜神经纤维层缺损(下) 下
BCLVS Baring circumlinear vessel superiorly 环线血管裸露(上) 上
BCLVI Baring circumlinear vessel inferiorly 环线血管裸露(下) 下
NVT Nasalisation of vessel trunk 血管干鼻侧移位 —
DH Disc hemorrhages 视盘出血 —
LD Laminar dots 筛板点(可见筛板孔) —
LC Large cup 大视杯 —

为什么是这 10 项:它们对应青光眼视神经病变的形态学依据链——神经视网膜边缘变薄(ANRS/ANRI)、神经纤维层缺损(RNFLDS/RNFLDI)、血管形态改变(BCLVS/BCLVI/NVT)、出血(DH)、筛板显露(LD)、视杯扩大(LC)。这正好覆盖了青光眼判读的经典教科书要素,也解释了为什么任务叫"Justification"(正当化/给出理由):模型不仅要说"该转诊",还要说出凭哪几条形态学证据。

频率提示(数据论文结论):最常出现的 RG 特征是神经视网膜边缘(NRR)下部与上部外观异常(ANRI/ANRS)——因为边缘变薄是青光眼最普遍、最早可判读的征象;而视盘出血(DH)是最罕见的特征。这一"高频 vs 罕见"的极端不均是 Task 2 的核心难点:罕见标签的样本数极小,Hamming loss 会被高频标签主导(见 §5.2 与 §10 坑 4)。

2.4 类别分布:一个 1:22 的极端不平衡场景

训练子集的类别分布(官网与 Zenodo 一致):

类别 图像数 患者数 占比
RG(需转诊) 3,270 2,336 ≈ 3.2%
NRG(无需转诊) 98,172 53,400 ≈ 96.8%
合计 101,442 55,736 100%

测试子集(TMI 论文表口径):

类别 图像数 患者数
RG 1,602 1,195
NRG 8,134 4,988
合计 9,736 6,183

数据论文给出的全体可评估眼中 RG 患病率为 4.38%(基线 111,183 眼)。注意这个 4.38% 与训练子集的 3.2% 口径不同(前者是"全库/可评估眼",后者是"公开训练子集的图"),引用时不要混用。

1:22 左右的极端不平衡意味着什么:

  • 准确率(accuracy)是废指标。一个永远输出 NRG 的"模型"在训练集上准确率约 96.8%,却没有任何临床价值。这就是 Task 1 采用 Sensitivity at 95% Specificity 而非 accuracy/AUC 的根本原因(§5.1)。
  • 代价不对称:漏掉一个真正需转诊的病人(假阴性)后果远大于把一个不需要转诊者送去复查(假阳性)。指标设计把特异度钉死在 95%,再看在这个高特异度门限下能保住多少灵敏度。
  • 训练策略必须处理不平衡:过采样 RG、类别加权、两阶段训练、阈值调优——这些不是"技巧"而是在这张表面前的必需品。

2.5 患者级 vs 图像级的计数边界

JustRAIGS 的所有关键计数都同时给出图像级与患者级两套数字(如训练集 101,442 图 / 55,736 人)。这带来三个必须注意的边界:

  1. 同一患者可能贡献多张图:55,736 名患者对应 101,442 张图,人均约 1.82 张。若按图随机划分训练/验证,同一患者可能同时出现在两侧,导致验证集乐观偏倚(患者泄漏)。二次研究务必做患者级划分。
  2. RG/NRG 的患者数与图数不成比例:RG 2,336 人对应 3,270 图(人均 1.40),NRG 53,400 人对应 98,172 图(人均 1.84)——NRG 患者贡献的图更多。按图重采样会进一步扭曲患者分布。
  3. "图"与"眼"不是一回事:数据论文用"eyes"(眼),TMI/官网用"CFPs"(眼底图)。一只眼可能被拍多张(不同视野、不同时点)。这正是 §9 存照中"113,893 眼 vs 111,178 图"差异的部分来源。

结论:引用 JustRAIGS 的任何数字时,必须同时带两个限定词——是图还是眼?是训练子集还是全库? 缺一个限定词,数字就可能被误读。

2.6 与库内眼底数据集的规格对照

把 JustRAIGS 放进库内既有的眼底条目里横向看,它的定位立即清晰:

条目 rid 核心任务 规模 与 JustRAIGS 的关系
refuge 62 青光眼视盘/视杯分割 1,200 图 同为青光眼域,最强互链:refuge 给像素级分割,JustRAIGS 给图像级转诊+特征标签
eyepacs 58 糖网筛查(分级) ~88k 同源 EyePACS LLC,数据血缘互链
messidor 59 糖网分级 1,744 同为眼底分级任务,域不同(糖网 vs 青光眼)
ddr 201 糖网分类 13,673 同上
idrid 191 印度糖网图像 1,613 同上,人群域差异
deepdrid 211 糖网分级智能诊断 13,673 同上
fgadr 221 细粒度糖网 1,000+ 同上
rfmid 271 眼底多疾病分类 13,000+ 多标签任务近似点(但 JustRAIGS 多标签仅限 RG 图)
odir 63 眼科多疾病标签 7,000 多标签,但为"多病种"而非"单病多征象"
fives 741 眼底多疾病分割 800 分割视角,与 JustRAIGS 分类视角互补

JustRAIGS 的差异化价值:库内眼底条目几乎全是糖网(DR),青光眼域只有 refuge(且是分割任务)。JustRAIGS 补上了青光眼"图像级转诊判断 + 可解释特征"这一格,并且引入了库内罕见的三个新要素——(a) 双任务设计(二分类 + 多标签)、(b) 低患病率(1:22)下的指标工程(sens@spec95%)、© "标注分歧不消解则忽略"的标签卫生机制。这三条是 §8 方法学启示的来源。

为什么这不是撞库:JustRAIGS 与 refuge 同属青光眼,但任务层级不同(图像级转诊 vs 像素级分割)、标签体系不同(10 个形态学特征 vs 视盘/视杯二类掩码)、规模不同(10 万级 vs 千级)。二者是互补而非重复;条目间应互链而非互斥(查重结论见 FACTS §10)。


§3 注释流水线:两个人投票、专家打破平局、分歧允许被忽略

JustRAIGS 的标签质量是它被高频引用的核心原因之一。本节拆解:谁在标、怎么标、如何质控、以及那个反直觉的"分歧不消解"规则。全部依据官网 /dataset/ 与数据论文(Ophthalmology Science 2023)。

3.1 人从哪来:EODAT 考核的 grader 池

标注者(下文称 grader)不是随便找的医学生,而是经过标准化考试筛选的判读者:

  • 候选人须通过 European Optic Disc Assessment Trial(EODAT,欧洲视盘评估试验) 的考核——该试验包含 110 张立体视神经图像,用于校准判读者对青光眼性视盘改变的识别能力。
  • 数据论文口径:90 名候选人中 30 名通过(标准:准确率 ≥ 85% 且 特异度 ≥ 92%)。
  • AIROGS 论文口径:89 人报名、32 人通过。
  • 最终用于训练 JustRAIGS 的合格 grader 为 20 名(数据论文 Results 口径)。

存照(FACTS §9 第 6 条):这三组数字(90→30→20 与 89→32)来自不同文献、不同统计时点,不是矛盾而是口径差异。条目引用时以数据论文口径为主,并注明 AIROGS 的差异,避免读者以为其中一处是笔误。

这个池子的意义:它把"判读青光眼"从"专家个人技艺"变成了"通过统一考核的合格判读者群体的一致判断"。这是可复现的标注质量基线——你可以质疑判读者是否为"顶级专家",但不能指责它"来源不明"。

3.2 工作流:2 人独立判读 → 专家打破平局

官网 /dataset/ 给出的流程如下(逐步):

  1. 每张图由 2 名 grader(G1/G2)从合格池中随机抽取,各自独立标注主分类(RG / NRG)。
  2. 若 G1 与 G2 一致 → 该判定即为终判。
  3. 若 G1 与 G2 分歧 → 交由 grader 3(G3,青光眼专家) 判定,G3 的判定为终判。
  4. 当某名 grader 判定为 RG 时,其须勾选转诊理由——即 10 项附加特征(可多选)。
  5. 附加标签的分歧不消解(见 3.3)。
  6. 任一附加标签若仍有分歧 → 该标签在算法评估中对该图被忽略。

这套流程的三个设计意图:

  • 两人独立 + 随机配对:避免固定搭配带来的系统性共谋(两名判读者长期合作会形成"默契偏差")。
  • 专家只处理分歧:把有限的专家时间集中投放在最难的案例上——这是成本效益最优的分工。粗略估计,若两人一致率 92.45%(见 3.4),则专家只需介入约 7.55% 的图。
  • 主分类与附加标签分离处理:主分类追求"一个确定答案"(可用专家打破平局),附加标签则是"证据的多选清单",允许部分未知。

3.3 反直觉的规则:附加标签分歧"不消解",而是"忽略"

这是 JustRAIGS 最值得学的一条**标签卫生(label hygiene)**设计,也是最容易被误读的一条:

附加标签(10 项特征)的分歧不通过"再找一个人投票"来消解;若终判后某个附加标签仍存分歧,则该标签对该图在评估中被直接忽略。

具体地,某张 RG 图的某个附加标签,其终值按主分类的一致性情形取值:

  • 若 G1、G2 主分类一致 → 附加标签取两名初评者一致的部分(即两者都勾选的项为确定阳性;两者都未勾为阴性)。
  • 若两人主分类分歧、由 G3 终判 → 附加标签取一名 grader 与专家一致者,或仅专家的勾选。
  • 无论如何,任何仍存在分歧的附加标签项,在该图的评估中置为"不计分"。

为什么这是好设计:

  • 它区分了"数据缺失"与"标签为负"。传统做法是"有分歧就取多数或取专家",把不确定强行压成确定,污染标签。JustRAIGS 的做法是承认不确定,把它标为"该图在此标签上不可用"。
  • 它是"宁可少算,不可算错"的体现。评估时忽略疑难样本,虽然减少了有效样本量,但保证了进入评估的标签是高置信的——这与 Task 2 使用 Hamming loss(对每个标签独立计分)天然契合:某些标签在某些图上被 mask 掉,不影响其他标签。
  • 它对复现者提出了要求:二次使用者必须实现标签级别的 mask,而不能简单地把"忽略"当成"负样本"。把忽略当负样本,会系统性低估罕见特征(如 DH)的阳性率——这正是 §10 坑 5。

3.4 质控账:性能监控与"跌线即退"

除了两人投票 + 专家破平局,数据论文还披露了一层动态质控:

  • 每名 grader 的表现被持续监控。以最终判定为参考,若某 grader 的灵敏度跌至 < 80% 或特异度跌至 < 95%,则退出,其已标注的图由他人重做。
  • 经过这层筛选,最终 20 名 grader 合格上岗。

grader 群体的整体表现(数据论文):

  • 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)。
  • 两名 grader 之间的一致率为 92.45%,Gwet’s AC2 = 0.917。

怎么读这组数字:

  • 特异度(96.1%)明显高于灵敏度(85.6%)——判读者在"排除不需要转诊者"上更自信,在"揪出需要转诊者"上更谨慎(也更易漏)。这与临床筛查"宁可放过、不敢错抓"的直觉相反吗?恰恰相反——筛查者面对的是海量正常样本,他们在"确认异常"上天然保守,这正是 RG 患病率被压到 4.38% 的判读侧原因之一。
  • Gwet’s AC2 = 0.917 是"良好到优秀"的一致性(AC2 相比 Cohen’s kappa 更不受患病率极端不平衡影响,是低患病率场景的正确选择)。92.45% 的表观一致率看起来高,但在 3.2% 阳性率下,随机一致率本身就很低——所以 AC2 这个校正指标才是真正有说服力的数字。
  • SD 的存在说明 grader 之间有差异:灵敏度 SD 5.7、特异度 SD 2.8。这意味着**“JustRAIGS 标签"不是单一权威的产物,而是一个群体的中心趋势**——原论文也正因此把标签描述为"graders 的判定”,而非"金标准"。

3.5 这套流水线的可迁移性

把 §3 抽象成可复用的 SOP:

  1. 建合格池:用标准化考卷(此处为 EODAT)筛选判读者,设定双门限(准确率 + 特异度),而非单一准确率。
  2. 两人独立 + 随机配对:消除固定搭配偏差。
  3. 专家只处理分歧:把昂贵人力投向边际信息量最大的地方。
  4. 动态淘汰:用滚动性能监控剔除劣化判读者,已标数据重做(保证全库质量同质)。
  5. 不确定允许存在:分歧标签标记为"忽略",而非强判。
  6. 报告一致性的正确指标:不平衡场景用 Gwet’s AC2,别只报 Cohen’s kappa。

这六条不依赖青光眼领域知识,可迁移到任何"专家稀缺 + 类别不平衡 + 需要多标签理由"的医学影像标注项目。这是 §8 的第一条方法学启示。


§4 挑战赛本体:ISBI 2024 的双任务、指标与赛场实况

JustRAIGS 不只是数据集,更是一场正式的学术竞赛。忽略"挑战赛"这一层,就会误读它的指标设计、测试集闭源策略、以及那个让很多人困惑的"46 还是 20 支队伍"。本节把赛事规则与结果讲全。

4.1 赛事身份与时间线

  • 赛事:ISBI 2024(IEEE International Symposium on Biomedical Imaging,IEEE 国际生物医学成像研讨会)官方挑战赛。
  • 参赛门槛(硬性):参评队伍须线下出席 ISBI 2024 并全额注册会议;提交按 ISBI 主会议**正常论文(4 页限制)**处理。这意味着 JustRAIGS 是一个"带论文产出的精英赛",而非纯线上打榜——这也解释了为何最终进入正式评估的队伍数量有限。
  • 训练集发布:Zenodo 首版发布于 2024-01-08(与开发阶段起始日一致,Zenodo 版本史仅此一版)。
  • 时间线(TMI 2025 论文口径):
阶段 起 止 说明
开发阶段(development) 2024-01-08 2024-04-20 约三个月,训练集于此期间公开于 Zenodo,参赛者可在公开训练集 + 本地验证上迭代
测试阶段(test) 2024-03-01 2024-04-20 用闭集测试集评估,参赛者无法看到测试标签

注意两个阶段是重叠的(测试阶段在开发阶段后段开启)——这是挑战赛常见设计:让参赛者在最后一个月用真实测试集盲测提交,压缩过拟合窗口。

4.2 参与规模:一个必须双列的"46 vs 20"

这是本条目最典型的双口径冲突(FACTS §9 第 2 条):

  • TMI 2025 论文口径:开发阶段 322 名参与者、来自 37 个国家;进入测试阶段 20 支队伍。
  • 新闻口径:VUNO 官方新闻稿与 Asia Business Daily 均称"46 支队伍、自 2024 年 1 月起约四个月"。

如何解读这个差异:

  • 两者并非同一统计对象:论文的"322 参与者 / 37 国"是开发阶段的注册/参与规模,而"20 支队伍"是通过筛选进入测试阶段正式评估的队伍数;新闻的"46"更可能对应某个中间时点的报名/提交队伍数。
  • 但数字差异显著(46 vs 20),不能简单一句"口径不同"带过。本条目按论文口径成稿(322 / 37 国 / 20 队),并在此处显式登记新闻口径,供读者按需取用。
  • 实践建议:写论文引用时用 TMI 论文的 20 队/322 参与者;写科普或产业稿引用时可用"公开报道曾称 46 支队伍",但需注明来源与口径。

为什么这件事值得单列一节:它示范了 AI-Ready 条目处理"同一事实多来源" 的标准动作——不隐藏、不独断、双列、标出处、给取舍建议。这正是 FACTS §9 存照机制在成稿中的落地。

4.3 两个任务与两把尺子

Task 1 — Referral performance(转诊性能):二分类 RG vs NRG。

  • 指标:Sensitivity at 95% Specificity(sens@spec95%)——在特异度固定 ≥ 95% 的操作点上测量灵敏度。
  • 为什么这样设计:低患病率(4.38%)筛查场景下,若同时优化敏感度与特异度,模型会倾向"多报阳性"以刷高灵敏,导致海量假阳性转诊,临床上不可接受。把特异度钉死在 95%,等于规定"最多只能有 5% 的不必要转诊",然后问"在这个前提下你能救回多少真病人"。这是临床可部署性优先的指标工程。

Task 2 — Justification performance(正当化/可解释性能):对 RG 图像做 10 个附加特征的多标签分类。

  • 指标:Hamming loss(多标签平均汉明损失,越低越好)——对每个样本的每个标签独立判断对错,取错误比例平均。
  • 注意:Task 2 只在 RG 图像上评估。这与标注流程一致(只有判为 RG 的 grader 才被要求勾选理由)。不要把 NRG 图也算进 Task 2 的评估,那会引入大量"全负"样本,把 Hamming loss 人为压低。
  • "忽略"规则的落地:§3.3 中"分歧标签被忽略"直接体现在 Hamming loss 的实现里——被忽略的标签不计入分母。二次复现者若忽略此规则,得到的 Hamming loss 不可与前人结果比较。

两把尺子的关系:Task 1 回答"该不该转",Task 2 回答"为什么该转"。二者耦合——一个 Task 1 表现差(漏检多)的模型,其 Task 2 只在少量检出的 RG 上评估,样本更少、方差更大。因此两任务的成绩必须一起看,单看 Task 2 的 Hamming loss 高分可能建立在"只敢判极少数 RG"的保守策略上(§10 坑 6)。

4.4 赛场实况:谁赢了、赢了什么

冠军:VUNO(韩国,医疗 AI 公司)

  • Task 1:recall 0.9090 @ 95% specificity。
  • Task 2:Hamming loss 0.1240。
  • 代码:github.com/seunghoonlee-fundus/JustRAIGS-vuno;论文:ISBI 2024,doi 10.1109/ISBI56570.2024.10635758。

挑战赛整体最好成绩(TMI 2025 论文摘要口径):sens@spec95% 最高约 85%;平均 Hamming loss 最低约 0.13。

代表性参赛方案(用于建立"合理水平"的参照带):

队伍 Task 1 结果 Task 2 结果 方案要点
VUNO recall 0.9090 @ spec95% Hamming 0.1240 冠军
LaTIM(Brest, 法国) ResNet50 Ensemble @800×800,sens@spec95% = 0.870 Eva + DeiT3 + ResNet50 ensemble,Hamming = 0.239 代码 github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution
ndoladimeji sens@spec95% = 0.3242,AUC 0.72 平均修正 Hamming = 0.1327 ResNet34,单模型

读这张表的三个警示:

  1. sens@spec95% 的队间差距极大(0.9090 → 0.870 → 0.3242)。裸 ResNet34 单模型在低患病率下的 sens@spec95% 会塌到 0.32——这不是"差一点",是差一个量级。数据集"公开可下载"不等于"容易做好"。
  2. Task 2 的 Hamming loss 存在"高分低敏"陷阱:ndoladimeji 的 Hamming 0.1327 数值上接近 VUNO 的 0.1240,但其 Task 1 灵敏度只有 0.3242——它可能只在极少数最有把握的 RG 上评估 Task 2,因此 Task 2 数字好看。必须联读两任务。
  3. 集成 + 高分辨率是主流打法:LaTIM 用 800×800 输入 + 三骨干集成;VUNO 亦为集成方案。这提示分辨率与集成的收益在本任务上显著(低压患病率下的决策边界极难学)。

4.5 外部验证:泛化的真相

TMI 2025 论文对前三名算法在外部数据集上做了泛化验证——这是区分"榜单分数"与"真实可用性"的关键一步。

外部数据集线索:OHTS(Ocular Hypertension Treatment Study)子集——5,000 张 CFP(4,000 正常眼 + 1,000 青光眼眼),用于 Task 2 的外部评估。标签经映射对齐到 JustRAIGS 体系,例如 ThinningDiscRim_RT/LT(颞上/颞下边缘变薄)、NotchRim_RN/LN(切迹)、DiscHemorrhage-DH(视盘出血)、LargeCup_LC(大视杯)等。

为什么外部验证是这节的落点:低患病率 + 多设备 + 跨机构的模型,最容易在"换一个数据集"时崩掉。榜单分数是"在 JustRAIGS 测试集上的分数",不等于临床泛化能力。读者若要把 JustRAIGS 冠军方案直接搬到自有数据上,务必先复现外部验证流程。

待核(FACTS §9):OHTS 子集的公开性未确认——论文用于评估但未声明是否随文公开。二次研究若需该外部集,须自寻 OHTS 申请渠道。

4.6 赛场之外:赛事的"赛后生命"

ISBI 2024 已结束、TMI 2025 总结论文已发表,但 Zenodo 描述仍写 “still ongoing challenge”(FACTS §9 待核项)。时效提醒:

  • 作为数据集:JustRAIGS 训练集仍公开可下载(CC BY-NC-SA),这一点不因赛事结束而改变。
  • 作为赛事:排名与排行榜已冻结,不会再有新提交计入官方名次。
  • 作为社区:各队方案代码散落 GitHub,形成事实上的方法库(VUNO / LaTIM / ASU / ndoladimeji 等),比排行榜更有长期价值。

结论:把 JustRAIGS 理解为"一场已闭幕、但数据集与方案库仍在服役的挑战赛"最准确。Zenodo 的 “ongoing” 措辞是陈旧元数据,不应据以声称赛事仍在进行。


§5 评估与基准:两把尺子、一个榜单,以及"高分低敏"的陷阱

5.1 为什么不能只看准确率

JustRAIGS 首要的评估对象是 Task 1,即"这张眼底图该不该转诊"。如果把它当成一个普通的二分类问题,最直觉的度量是准确率(accuracy)。但在 JustRAIGS 的数据分布下,准确率会给出严重误导的结论:训练子集中 NRG 占 98,172 / 101,442 ≈ 96.8%,RG 仅 3,270 / 101,442 ≈ 3.2%(全体可评估眼口径的 RG 患病率为 4.38%,约 1:22 的类别不平衡)。这意味着:一个"无脑全部预测 NRG"的模型,什么都不学,准确率就能达到约 96.8%,但它对真正需要转诊的 RG 眼,灵敏度是 0。

在筛查场景里,这恰恰是最坏的失败模式。筛查的临床意图是"不放过该转诊的人"(高灵敏度),而不是"少打扰健康人"(高准确率)。因此 JustRAIGS 官方放弃了准确率,改用医学筛查领域更贴切的指标:Sensitivity at 95% Specificity。

5.2 Task 1 的尺子:Sensitivity at 95% Specificity

定义拆解:

  1. 先把模型的输出(RG 概率/分数)视为一个连续评分,而不是先固定一个 0.5 的阈值。
  2. 用闭集测试集(9,741 / 9,736 张,见 §2 与 §4 的双口径)上的真标签,遍历所有可能的判定阈值。
  3. 找到使特异度(Specificity)= 95% 的那个阈值 $t^*$。特异度定义为"真正 NRG 中,被正确判为 NRG 的比例":

$$\text{Specificity}(t) = \frac{\text{TN}(t)}{\text{TN}(t) + \text{FP}(t)}$$

  1. 在这个锁定的阈值 $t^*$ 上,读取灵敏度(Sensitivity)——即"真正 RG 中,被正确判为 RG 的比例":

$$\text{Sensitivity}(t^) = \frac{\text{TP}(t^)}{\text{TP}(t^) + \text{FN}(t^)}$$

为什么这样设计:

  • 固定特异度、比较敏感度,等价于把"误报预算"固定住:所有队伍都在"假阳性率不超过 5%“的同一约束下比拼"抓住了多少真病例”。这让不同队伍的输出分数可比,不受各自阈值选择偏好影响。
  • 它在临床上有直接解释:在真实人群中,95% 的特异度意味着大约每 20 个健康眼中会有 1 个被误判为需要转诊(假阳性),而灵敏度则给出"该转诊的真正青光眼眼被抓住的比例"。
  • 它天然抗类别不平衡:所有分母都落回各自的真实类别内部,不受 RG/NRG 比例影响。

任务还设置了独立的辅助指标与阈值选择空间:官方评估脚本(见 §5.6)会在完整测试集上为每支队伍重新计算曲线并固定特度点,保证"每队一次、同尺子"。

5.3 Task 2 的尺子:Hamming loss

Task 2 是多标签分类:每张 RG 图上有 10 个二进制特征(ANRS、ANRI、RNFLDS、RNFLDI、BCLVS、BCLVI、NVT、DH、LD、LC),模型需要为每个特征输出"有/无"。典型的损失函数(如逐标签交叉熵或 F1)都有各种取舍,JustRAIGS 选了最朴素也最直白的汉明损失:

$$\text{Hamming loss} = \frac{1}{N \times L} \sum_{i=1}^{N} \sum_{\ell=1}^{L} \mathbb{1}!\left[\hat{y}{i,\ell} \neq y{i,\ell}\right]$$

其中 $N$ 是被评估的 RG 图像数,$L = 10$ 是特征数,$\hat{y}$ 是预测,$y$ 是参考真值。它等于"平均每个特征预测错的比例"——0 表示全对,1 表示全错。

汉明损失的几个性质正好适配 JustRAIGS 的标注现实:

  • 它对每个特征平等计权,不因某个特征稀有(如 DH 罕见)而放大其权重,也不因常见特征(如 LC 大视杯)多而稀释。
  • 它是可分解的:可以逐特征报告汉明损失,看清究竟错在哪个特征上。
  • 它天然对应官方给出的"忽略机制"(见 §3.3 与下文 5.4 的"参考真值构造"),只要参考值本身被置为"忽略"(不计入分母),它就能保持一致。

关键提醒:汉明损失不看"召回"。一个模型如果把所有 10 个特征都预测为"无",在 DH(极罕见)这类特征上可能反而"低损失",但临床上毫无信息量。因此 TMI 论文强调 Task 1 与 Task 2 是两把独立的尺子,不能互相替代,榜首也由"两个方向的成绩共同刻画"。

5.4 Task 2 的"参考真值构造"与忽略机制

Task 2 的参考值不是简单的"两个 grader 投票取多数",而是由 §3 描述的流水线逐步构造:

  1. 主分类一致的图:终值取"两名初评者一致"的那些附加标签;两人不一致的附加标签 → 该标签进入"忽略"集合。
  2. 主分类分歧的图:由专家 G3 判定主分类,其判为 RG 的同时勾选转诊理由;终值取"专家 + 其中一名与专家主分类一致的初评者"的交集;仍不一致的附加标签 → 忽略。
  3. 仅专家可判的图:终值取"仅专家"的附加标签。

被列入"忽略"的标签,在该图对该特征的汉明损失计算中不计入——既不惩罚预测"有",也不惩罚预测"无"。这是一个非常克制而诚实的处理:不强行把有争议的人为共识当成"金标准",而是承认"这张图这个特征上专家之间都没有定论",把它从评分里拿掉。

这也是 JustRAIGS 在方法学上最值得学习的点之一:它对标签噪声不是"消解",而是"标注不可知"。详见 §8 方法学启示。

5.5 榜单基准带:从 0.13 到 0.32 的实况

TMI 论文摘要给出的两个"天花板"数字是:最高 sens@spec95% = 85%,最佳平均 Hamming loss = 0.13。但这两个数字来自不同队伍、不同子任务,不能简单相加。把可核实的代表方案并排放,能看到一个清晰的基准带:

方案 队伍/机构 骨干 Task 1 sens@spec95% Task 2 Hamming loss 来源
VUNO(冠军方向) VUNO Inc.(韩国) 集成模型 recall 0.9090 @ 95% spec 0.1240 ISBI 2024 论文 doi:10.1109/ISBI56570.2024.10635758
LaTIM LaTIM/IMT Atlantique, Brest(法国) ResNet50 Ensemble(800×800) 0.870 0.239(Eva + Deit3 + ResNet50 集成) GitHub Mostafa-EHD/JustRAIGS_LaTIM_Solution
ndoladimeji 个人/开源参赛者 ResNet34 0.3242(AUC 0.72) 0.1327(平均修正) GitHub 公开方案
TMI 论文全局 全体参评 混合 ≤ 0.85 ≥ 0.13 IEEE TMI 2025 摘要

三条读表警示:

警示一:Task 1 与 Task 2 是"错位"的。 VUNO 在两个任务上都领先,但 LaTIM 的 Task 1(0.870)明显高于 ndoladimeji(0.3242),而 ndoladimeji 的 Task 2(0.1327)反而接近榜首(0.1240)。这提示:擅长"判断要不要转诊"与擅长"解释为什么转诊"可以是两种不同的能力,需要不同的架构与训练策略(Task 2 只在 RG 图上训练,样本量小得多——3,270 张 vs 101,442 张——所以极易过拟合)。

警示二:汉明损失"低"不等于"有用"。 ndoladimeji 的 0.1327 看起来逼近 VUNO 的 0.1240,但结合其 Task 1 仅 0.3242 的灵敏度,说明它在"绝大多数图"上可能倾向于预测特征为"无",从而在汉明损失上占便宜。这是 §5.3 末尾强调的"高分低敏陷阱"的实例化——必须两把尺子一起读。

警示三:这是"低灵敏度陷阱"最真实的市场。 因为 RG 只有 3.2%,一个模型只要学会"几乎不喊 RG",就能在特异度维度上舒服地待着;0.3242 的灵敏度意味着约 2/3 该转诊的 RG 眼被漏掉。这种模型在临床上几乎不可用,但在只看汉明损失或只看准确率时可能"看起来还行"。JustRAIGS 用 sens@spec95% 正是要暴露这种模型。

5.6 官方评估代码与复现路径

挑战赛官方在 GitHub 提供了评估与容器模板(HinaRaja65/JustRAIGS_Challange),核心脚本包括:

  • evaluate.py:主评估入口,读取预测与参考真值,按 §5.4 的忽略机制构造参考标签,输出 sens@spec95% 与汉明损失。
  • sensy_at_specy.py:负责扫描阈值、定位 95% 特异度点、回报对应灵敏度——即 §5.2 的机械化实现。
  • hamming_loss.py:逐图逐特征比对,按忽略集合置零分母,输出 §5.3 的汉明损失。

参赛者需要在 grand-challenge 平台上以容器形式提交,平台在闭集测试集上运行;这意味着评估不可被本地方案"调参过拟合"——你提交的是可执行推理,而不是分数。这与许多"打榜式"评测(选手自己跑测试集、上传分数)形成对比,是 JustRAIGS 榜单可信度较高的重要原因。

5.7 外部验证:OHTS 子集

TMI 论文对前三名算法做了外部数据集验证,用的是 OHTS(Ocular Hypertension Treatment Study)子集:约 5,000 张 CFP(约 4,000 正常眼 + 1,000 青光眼眼),并给出了与 JustRAIGS 特征体系的映射,例如:

  • ThinningDiscRim_RT / ThinningDiscRim_LT(上/下视盘边缘变薄)
  • NotchRim_RN / NotchRim_LN(上/下视盘边缘切迹)
  • DiscHemorrhage(对应 DH)
  • LargeCup(对应 LC)

外部验证的意义:在闭集测试集上拿下高分,可能只是"贴合了 EyePACS 的相机谱系与人群分布";换一个来源的人群(OHTS 是纵向随访研究人群,与筛查人群不同),性能会如何变化,才是泛化能力的真实检验。

必须提醒的边界:截至本条目抓取时点(2026-09-30),OHTS 外部数据集是否公开发布尚未确认(FACTS §9 待核项)。因此本条目只把它作为"论文报告的验证事实"引用,不建议复现者依赖其可下载性。

5.8 复现者最可能踩的三个坑

坑一:目标准确率。 见 §5.1,本任务的准确率基线虚高(96.8%),任何以准确率为优化目标的方案都会走向"全判 NRG"的死路。

坑二:把两把尺子合成一个分数。 官方从未给出 Task 1 与 Task 2 的加权总分;榜单是"两条曲线"而非"一个排名数"。复现时如果自己合成一个加权分,会掩盖 §5.5 警示一的错位现象。

坑三:忽略机制实现错误。 若把"忽略"的标签当成"负例(无)"处理,会人为压低汉明损失,得到看似更好但不可比的结果。正确做法是严格按 §5.4 构造参考并置零分母。TMI 论文和官方脚本对此有明确定义,不要自行发明规则。


§6 获取与许可:54.2 GB 的训练集、永不公开的测试集与一个被记错的 License

6.1 一句话说清"能拿到什么、拿不到什么"

JustRAIGS 的公开部分只有训练集——101,442 张眼底图 + 标签 CSV,打包在 Zenodo。测试集永不公开——挑战赛结束后仍然保密,这是官网与 TMI 论文都反复强调的设计。训练集是"官方公开发布"的,下载需要接受许可条款(clickthrough,不是无门槛裸下载)。

6.2 官方获取入口(三层)

层级 入口 内容 用途
挑战赛主页 https://justraigs.grand-challenge.org/ 挑战概览、时间线、榜单、规则 了解赛事、看榜
数据页 https://justraigs.grand-challenge.org/dataset/ 数据描述、标注流程、许可说明 核对口径、确认许可
训练集下载 https://zenodo.org/records/10035093(DOI 10.5281/zenodo.10035093) 6 个分卷 zip + 1 个标签 CSV 实际下载训练数据

另有概念 DOI 10.5281/zenodo.10035092,用于在引用中指向"这个数据集(不论版本)";具体版本记录用 10035093。

6.3 Zenodo 记录 10035093 的完整文件清单

实抓确认:Zenodo 记录 10035093 共 7 个文件,合计 54.2 GB:

文件 大小 md5
JustRAIGS_Train_0.zip 9.3 GB b77f8679cc02a2fafe9953abff89fafb
JustRAIGS_Train_1.zip 9.3 GB fd21d85eafb54bd1d3f6190c739246d0
JustRAIGS_Train_2.zip 9.3 GB aff8fb52e068fc1050e6a8f32238a638
JustRAIGS_Train_3.zip 9.3 GB a411fd5cd1cebdaeedb5727204abdfba
JustRAIGS_Train_4.zip 9.3 GB 0fb8cd04c0d39a93ce97f05ec4b109e4
JustRAIGS_Train_5.zip 7.7 GB 76fa9a9f131a866054206392f7f1bfc6
JustRAIGS_Train_labels.csv 9.2 MB 0d01181f067f57ece1e7e1f07167a78e

三条读表要点:

  1. 分卷是"体积切分",不是"类别切分"。 6 个 zip 是同一训练集的等体积分片(前 5 个各 9.3 GB,最后一个 7.7 GB),把 101,442 张图切成 6 块以便下载。不要假设 Train_0 是 RG、Train_5 是 NRG——类别信息全部在 JustRAIGS_Train_labels.csv 里。
  2. 标签 CSV 是唯一权威来源。 9.2 MB 的 CSV 承载每张图的文件名、RFG(主分类)与 10 个特征标签,并含"分歧被忽略"的标记逻辑。落地后应以 CSV 为准建索引,而不是从文件名猜标签。
  3. md5 可用于校验完整性。 6 个 zip 与 1 个 CSV 的 md5 均记录如上,下载后应逐一核验——54.2 GB 的下载在弱网环境下中断是常态。

6.4 许可:三处官方一致写 CC BY-NC-SA,一处第三方写错了

官方三处口径(一致):

  • 官网数据页原文:“publicly available under a CC BY-NC-SA license at the Zenodo”
  • Zenodo 记录 10035093 的许可字段:CC BY-NC-SA
  • TMI 论文明确:“accessible for download on Zenodo under the CC BY-NC-SA license”

第三方冲突口径:

判定与处理: 三处一手来源(官网 + Zenodo + TMI 论文)与一处第三方目录冲突。按"一手源优先、多源互证"的原则,判 EyeDataHub 为记录错误。本条目按 CC BY-NC-SA(署名—非商业性使用—相同方式共享) 成稿,并在此存照该冲突(同 §9 存照清单第 1 条)。

CC BY-NC-SA 的实际含义(复现者须知):

  • BY(署名):使用时须注明来源(JustRAIGS / Rotterdam Eye Hospital / EyePACS LLC 及论文)。
  • NC(非商业性使用):不得用于商业目的。这一条对本数据集的"AI 训练"用途尤其敏感——商业公司的内部模型训练、商业产品的开发都受此限制。
  • SA(相同方式共享):若你对数据做了改编并再分发,衍生数据集须以相同许可(CC BY-NC-SA)发布。这意味着你不能把 JustRAIGS 训练出的衍生数据集改成更宽松的许可。

这与"数据可用于 AI 训练但限非商业"的常见争议直接相关:JustRAIGS 的许可是明确的 NC,任何以商业为目的的使用都需要另行获得授权,而不是"公开即可随便用"。

6.5 测试集:为什么"永不公开"是必要的

官网与 TMI 论文都明确:测试集在挑战赛结束后仍保持闭集,“confidential and inaccessible for download”。

这不是小气,而是方法学必需: 一旦测试集公开,后续的模型就可以对它做针对性优化,榜单的基准比较就失效了;更严重的是,闭集测试集是"防过拟合的最后一道墙"。JustRAIGS 让参赛者提交可执行容器(见 §5.6),在官方可控的闭集上运行——测试集本身就是评估基础设施的一部分,公开即作废。

因此: 任何声称"拿到了 JustRAIGS 测试集"的第三方,基本可以判定为不可信(要么是伪造,要么是把训练集分片误标为测试集)。复现者应只在训练集上复现,并在自建的训练集内部划分(patient-level split,见 §5.7 的边界提醒与 §8)上做验证。

6.6 官方开源代码与容器模板

  • 评估与模板:GitHub HinaRaja65/JustRAIGS_Challange,含 evaluate.py、hamming_loss.py、sensy_at_specy.py(见 §5.6)。
  • 参赛队伍方案(可复现参考):
    • VUNO:github.com/seunghoonlee-fundus/JustRAIGS-vuno
    • LaTIM:github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution
    • 其他开源参赛者的 Notebook/Repo 在 GitHub 与 Kaggle 上可检索到。
  • 建议复现顺序:先跑官方 evaluate.py 在训练集的一个 patient-level holdout 上建立本土基线,再对齐 VUNO/LaTIM 的骨干与预处理,最后才谈"提升"。

6.7 体量与使用成本:54.2 GB 是"压缩态"

Zenodo 官方记录合计 54.2 GB(6 分卷 + labels),但这是压缩后的体积。解压后(JPEG 原图 + CSV)会明显更大——第三方目录 EyeDataHub 记 “约 100 GB”,分歧即源于压缩态 vs 解压态的口径差(存照,见 §9 第 7 条)。

复现者的存储/算力规划:

  • 至少预留 150–200 GB 可用磁盘(下载 54.2 GB + 解压 ~100 GB + 中间缓存)。
  • 训练时若做高分辨率(如 800×800 或更大)输入,显存需求会显著上升;LaTIM 用 800×800 的 ResNet50 集成,是较有代表性的配置。
  • 建议先只解压 1 个分卷做流程跑通,再全量落地,避免一开始就卡在 I/O 上。

§7 生态与影响:从 AIROGS 到 JustRAIGS 的谱系,以及它在眼底 AI 版图里的位置

7.1 血脉:AIROGS 是直系前作

JustRAIGS 不是凭空出现的。同一批研究者(Rotterdam Eye Hospital 的 Lemij / Vermeer / de Vente / Sánchez 等)在更早的时候做了一个规模相近、目标更单纯的挑战赛:AIROGS(Artificial Intelligence for RObust Glaucoma Screening),并使用同一来源的眼底图库(EyePACS,约 113,893 眼 / 60,357 人 / ~500 个筛查点)。

AIROGS 与 JustRAIGS 的关系,可以概括为一句话:把"能不能筛"推进到"能不能说清楚为什么筛"。

维度 AIROGS(前作) JustRAIGS(本条目)
任务形态 单任务二分类(RG/NRG) 双任务:二分类(Task 1)+ 10 特征多标签(Task 2)
核心诉求 稳健筛查 可解释的转诊(justified referral)
数据规模 ~113,893 眼 / 60,357 人 全库 111,178 CFP / 61,919 患者;公开训练 101,442 图
指标 分类指标 sens@spec95%(Task 1)+ Hamming loss(Task 2)
会议 ISBI 2024 前身之一 ISBI 2024 官方挑战赛
论文 IEEE TMI 2024;43(1):542-557 IEEE TMI 2025(PMID 40773411)

库内缺口提示:截至本条目撰写时,千方病案医数集尚无独立的 AIROGS 条目(查重未见)。JustRAIGS 条目因此成为指向这条血脉的唯一锚点——一旦 AIROGS 条目上线,二者应互链。这是一条明确的待补链接(见 §9 与附录)。

7.2 数据血缘:EyePACS × Rotterdam 的"影像 + 标注"双机构结构

JustRAIGS 的数据血缘是一个清晰的双机构结构:

  • 影像来源:EyePACS LLC(Santa Cruz, CA, USA)——其糖网筛查项目产出了海量眼底照片,是 JustRAIGS 全部图像的来源。
  • 标注来源:Rotterdam Ophthalmic Institute, Rotterdam Eye Hospital(荷兰鹿特丹)——由青光眼专家设计标注协议、招募并质控 grader、执行判读。

为什么这个结构值得单独一讲: 在眼底 AI 数据集里,“图像来自一个机构、标注来自另一个机构"是把图像采集设备/人群与临床判读标准解耦的常见做法。它降低了"标注者与拍摄者共享同一台设备偏差"的风险,也让 JustRAIGS 的标签更接近"标准的青光眼判读协议"而非"某台机器的输出”。这个血缘也解释了为什么 JustRAIGS 的相机谱系如此庞杂(10 类设备,含 20.5% 未知,见 §2.2)——因为 EyePACS 是多站点筛查网络,而非单一医院。

7.3 与库内条目(含 rid)的互链网络

JustRAIGS 在千方病案医数集里有若干天然的邻居,按"链接强度"排序如下(rid 为库内数据库实查值):

关联条目 rid 关联性质 链接强度
refuge 62 同为青光眼域:视盘/视杯分割任务 最强(同疾病、不同任务范式)
eyepacs 58 同数据源:均源自 EyePACS LLC 强(数据血缘)
rfmid 271 眼底多疾病分类 中
odir 63 眼科多疾病标签 中
deepdrid 211 糖网分级 弱中
fives 741 眼底多疾病分割 弱中
messidor 59 糖网分级 弱
ddr 201 糖网分类 弱
idrid 191 印度糖网图像 弱
fgadr 221 细粒度糖网 弱
meddra 579 不良事件术语(与眼病编码弱关联) 很弱,慎用

最强的一条是 refuge(rid 62):它同样是青光眼、同样围绕视盘展开,但任务是像素级分割(视盘/视杯边界),而 JustRAIGS 是图像级分类 + 多标签解释。二者构成"分割派 vs 判读派"的互补对照,是青光眼 AI 里两条主要技术路线的代表。eyepacs(rid 58) 则是血缘上的兄弟:同源影像、不同标注目标(糖网 vs 青光眼)。

互链写法建议:在条目的"相关数据集"段落按 rid 排序引用,并显式写出"同源/同域/异任务"的关系性质,避免把弱关联条目硬凑成"相关"。

7.4 为什么它不与库内任何眼底条目撞库

用户任务特别要求查重。JustRAIGS 的独特性可以从四个正交维度同时成立:

  1. 疾病维度:库内眼底条目绝大多数是糖网(DR)(messidor、ddr、idrid、deepdrid、eyepacs、fgadr 等),JustRAIGS 是青光眼。唯一同域的是 refuge,但 refuge 是分割任务。
  2. 任务维度:库内糖网条目基本是单标签分级(0–4 级)或多疾病分类;JustRAIGS 是二分类 + 10 特征多标签的"双任务",且 Task 2 只在正类上评估,这在库内是独有的。
  3. 标注协议维度:JustRAIGS 有两名 grader 独立判读 + 专家破平局 + 分歧可忽略的完整流水线与 EODAT 资格考核(见 §3),这种"带质控档案的标注协议"在库内眼底条目中罕见。
  4. 赛事维度:JustRAIGS 是 ISBI 2024 官方挑战赛,有闭集测试集、容器化提交、双指标榜单——库内其他眼底条目多为静态数据集或 Kaggle 风格竞赛,评估基础设施不同。

结论:JustRAIGS 与库内已有的 messidor(59)、ddr(201)、idrid(191)、refuge(62)、rfmid(271)、odir(63)、eyepacs(58)、deepdrid(211)、fgadr(221)、fives(741) 均不撞库;它是库内**第一个"青光眼 + 可解释转诊 + 双任务挑战赛"**的口径。

7.5 生态:参赛队伍、方案与下游

参赛生态(可核实部分):

  • VUNO Inc.(韩国):Task 1 recall 0.9090 @ 95% spec,Task 2 Hamming 0.1240,是赛场最强音。
  • LaTIM / IMT Atlantique(法国 Brest):ResNet50 集成,Task 1 0.870,Task 2 0.239。
  • ASU(Appalachian State University):TMI 总结论文的作者团队之一(Yousefi 组)。
  • ndoladimeji:个人开源参赛者,ResNet34,Task 2 0.1327 但 Task 1 仅 0.3242,是"高分低敏陷阱"的注脚(见 §5.5)。

下游与影响:

  • 方法学影响:JustRAIGS 把"可解释性"从"事后 CAM 热图"抬升为任务级定义的特征标签(10 个具体、有临床含义的转诊理由)。这为"可解释 AI"提供了一个比"注意力图好看"更硬的评价标准——模型必须预测出与临床判读一致的具体体征。
  • 患者级划分的示范:101,442 图 / 55,736 患者意味着平均每患者约 1.8 张图,若不按患者划分,同一患者的双眼会跨训练/验证泄漏。JustRAIGS 的文档与复现惯例强调 patient-level split,成为后续眼底 AI 的标准操作。
  • 低患病率评测的模板:4.38% / 3.2% 的正类占比 + sens@spec95% 的指标设计,为其他罕见病筛查任务提供了"如何不被不平衡骗到"的范本。
  • 引用与延续:TMI 2025 论文(PMID 40773411)是当前的权威引用;数据论文(Ophthalmology Science 2023,doi 10.1016/j.xops.2023.100300)是数据本身的权威引用。二者必须区分引用(见 §9 存照第 9 条)。

7.6 值得追踪的开放线索(供后续版本更新)

  • AIROGS 条目:库内缺口,JustRAIGS 的血脉前作,上架后应双向互链。
  • OHTS 外部集的公开性:若未来公开,JustRAIGS 的外部验证复现将成为可能(见 §5.7)。
  • 46 vs 20 队伍的权威口径:建议以 TMI 论文的"开发阶段 322 参与者 / 37 国、测试阶段 20 队"为准(见 §9 存照第 2 条)。
  • 挑战赛的"进行中"表述:Zenodo 描述与官网旧文案曾写 “still ongoing”,但 TMI 论文已发表、ISBI 2024 已落幕——本条目按"已完结赛事"处理,并保留此存疑(见 §9 待核)。

§8 方法学启示:一个低患病率、多标签、多相机数据集给后来者的六条经验

JustRAIGS 的价值不止于它自己能训出多好的模型,更在于它把一个真实筛查场景的全部麻烦——患病率低、标签分歧、多相机域偏移、可解释性要求——都摆在了明面上,并各自给了一套工程化的应对。以下六条经验,任何做医学影像、尤其是做"筛查/转诊"类任务的人都能直接搬走。

8.1 低患病率下,"准确率"是一个会骗人的指标

JustRAIGS 训练子集里 RG 只占 3,270/101,442 ≈ 3.2%,全体可评估眼底图的 RG 患病率为 4.38%(数据论文口径)。这意味着一个"永远输出 NRG"的傻子模型,在训练子集上的准确率就有约 96.8%。

这正是这类任务最经典的陷阱:指标越高,越要警惕它是不是在奖励"什么都不做"。在筛查语境里,"什么都不做"的代价是把 3~4% 的真病人全部漏诊——这在临床上比假阳性严重得多(假阳性只是多转诊一次,假阴性是漏掉一个将失明的病人)。

应对是换尺子:Task 1 用 Sensitivity at 95% Specificity(详见 §5.2)。把特异度锁死在 95%,在此约束下比谁的灵敏度高。这样"躺平模型"的灵敏度是 0,分数立刻露馅。经验一句话:凡是正类占比低于 10% 的分类任务,先问一句"全判负类的基线是多少",再决定用不用准确率。

8.2 标签有分歧时,"忽略"比"消解"更诚实

多标签任务里,两个标注者对某个附加特征(比如"视盘出血 DH 是否存在")意见不合是常态。行业内有两种处理:

  • 消解(reconcile):找个更权威的人定一个终值,强行给这张图一个"标准答案"。
  • 忽略(ignore):承认这里没有可靠真值,评估时把该标签在该图上的贡献从分母里拿掉。

JustRAIGS 选了后者。官网 /dataset/ 的原始描述写得很直白:主分类(RG/NRG)由两名 grader 独立判、平局由专家 G3 打破;但附加标签的分歧不消解——若某附加标签仍有分歧,则"该标签在算法评估中对该图忽略"(见 §5.4 的三步构造)。

这个设计的深刻之处在于:它不假装标签是干净的。消解的代价是,你以为自己在和"真值"比,其实是在和一个可能被专家拍脑袋定下的、带着个人偏见的伪真值比;而忽略的代价只是少算几个样本——在 10 万量级的数据上完全可以承受。经验一句话:当分歧率高到一定程度,"制造一个假答案"比"承认不知道"对模型的毒害更大。 这也是 JustRAIGS 能在很嘈杂的多标签任务上依然给出可解释基准的原因之一。

8.3 标注者要考资格证,而不是"拉个眼科医生就上"

JustRAIGS 的标注者不是随便找的眼科医生。他们是从通过了 **European Optic Disc Assessment Trial(EODAT,含 110 张立体视神经图像)**考核的候选人里选的。数据论文口径:90 名候选人中只有 30 名通过(门槛是 ≥85% 准确率 + ≥92% 特异度),最终训练 JustRAIGS 时合格上岗的是 20 名 grader。

更关键的是动态质控:每名 grader 的表现被持续监控,一旦灵敏度/特异度跌到 <80% / <95%(以终判为参考),就退出、由他人重做。最终留下的 grader 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8),两人之间的表观一致率 92.45%(Gwet’s AC2 = 0.917)。

这套"考前筛选 + 考中监控 + 跌线即退"的组合,把"标注质量"从一句口号变成了可审计的流程。经验一句话:如果你在做高价值标注任务,先设计一张资格考核卷,再设计一条质量红线。 这比事后清洗省力得多。

8.4 患者级划分:防止泄漏的最低成本保险

JustRAIGS 的划分不是"按图分",而是按患者分——同一患者的左右眼、随访图不会同时出现在训练和测试里。数据论文给出的患者数与图像数之比(如训练集 101,442 图 / 55,736 患者)说明大量患者贡献了多张图。

如果按图随机划分,同一个人的两眼很可能一左一右分到训练和测试两边,模型学到的是"这个人的视盘长什么样",而不是"青光眼长什么样",测试指标会虚高。经验一句话:只要一个患者可能贡献多张影像,划分就必须在患者层切。 这是性价比最高的防泄漏措施——几乎零成本,却能避免整篇论文的结论被高估击穿。

8.5 双任务设计:把"可解释"从口号变成可评测的量

绝大多数医学 AI 论文的"可解释性"停留在热力图截图,无法量化、无法比较。JustRAIGS 的 Task 2 做了一件少见的事:要求算法显式输出 10 个临床可命名特征的存在与否(ANRS、ANRI、RNFLDS、RNFLDI、BCLVS、BCLVI、NVT、DH、LD、LC),然后用 Hamming loss 打分。

这就把"你的结论有没有依据"变成了一个可算的数。更妙的是它给出了一个"诚实性检验":一个模型可能 Task 1 得分很高(很会转诊)但 Task 2 很差(说不出为什么),也可能反过来。§5.5 表格里的 ndoladimeji 就是典型——Task 2 Hamming 0.1327 看起来不错,但 Task 1 的 sens@spec95% 只有 0.3242(详见 §5.5 的"高分低敏陷阱")。

经验一句话:如果你真的关心可解释性,就为它设计一个独立的、会惩罚胡说的指标。 只画热力图不算。

8.6 多相机谱系:域泛化不是加分项,是入场券

TMI 论文的设备构成表显示,训练集 101,442 张图来自 10 类不同的眼底相机:Optovue iCam100 占 26.1%、Topcon NW400 占 20.3%、未知 20.5%、Canon CR1/CR2/DGI 各约 9~10%、Topcon NW200 2.8%、Centervue DRS 1.6%、Nidek AFC300 0.1%、Crystalvue NFC-700 仅 6 张(数据论文/TMI 口径)。

这是一把双刃剑。好的一面:模型天然要面对跨设备差异,泛化压力大、学到了更本质的体征。坏的一面:20.5% 的设备型号未知,意味着将近五分之一的样本连"来自哪台相机"都不知道,任何"按设备分层"的分析都做不全;而 Nidek 153 张、Crystalvue 6 张这种极小样本,又可能在分层评估时给出极不稳定的数字。

经验一句话:多相机数据是域泛化的天然训练场,但要小心"未知来源"和"极小样本类"在分层统计里制造幻觉。 报告结果时,要么说明分层样本量,要么干脆别分层。(另需注意:§1 的导语提醒过 NRG ≠ 健康眼,设备差异叠加疾病异质性时更要谨慎解读。)

8.7 小结:六条经验一张表

经验 JustRAIGS 的做法 可迁移动作
低患病率换尺子 RG 3.2%~4.38%,"全判 NRG"基线 96.8% 先算负类基线,再用 sens@fixed-spec
分歧"忽略"而非"消解" 附加标签分歧不计入评估分母 承认无真值,减小分母而非造假答案
标注者要考资格 EODAT 考核 + <80%/<95% 跌线即退 设计资格卷 + 质量红线
患者级划分 训练/测试按患者切分 一人多图时必须在患者层切
可解释性要可评测 Task 2 的 10 特征 + Hamming loss 给可解释性设计独立指标
多相机域泛化 10 类相机,20.5% 型号未知 关注未知来源与极小样本类

§9 与库内条目的关系:一张互链网络与一次明确的查重

JustRAIGS 在千方病案医数集里不是孤岛。它和库内已有的眼底条目有真实的血缘、同域或同任务关系,也有明确的不撞库证据。本节把这张网画清楚,并给出互链写法建议。

9.1 按 rid 排序的互链网络

库内条目 rid 与 JustRAIGS 的关系性质 链接强度
ruffuge / refuge(青光眼视盘/视杯分割) 62 同为青光眼域:都做青光眼相关视神经结构任务,但 refuge 是分割、JustRAIGS 是转诊分类 + 多标签 ★★★ 最强
eyepacs(糖网筛查) 58 数据血缘:两者图像均来自 EyePACS LLC(Santa Cruz, CA) ★★★ 血缘强链
rfmid(眼底多疾病分类) 271 同为眼底多疾病/多标签分类范式 ★★
odir(眼科多疾病标签) 63 同为多标签眼科数据集 ★★
deepdrid(糖网分级智能诊断) 211 同域(眼底照相)异病(糖网),分级 vs 转诊 ★★
fives(眼底多疾病分割) 741 同域,分割 vs 分类 ★
ddr(糖网分类) 201 同域异病 ★
idrid(印度糖网图像) 191 同域异病、异人群 ★
fgadr(细粒度糖网) 221 同域异病 ★
messidor(糖网分级) 59 同域异病,经典老数据集 ★
meddra(MedDRA 不良事件术语) 579 仅术语编码层面弱关联,慎用 ○ 不建议强链

9.2 两条最强的链:refuge(同域)与 eyepacs(血缘)

refuge(rid 62)是"同域最强互链"。 两者都在青光眼视神经评估这个域里,都聚焦视盘/视杯/神经视网膜边缘结构。差别在任务形态:refuge 做的是像素级分割(视盘、视杯边界),JustRAIGS 做的是患者级的转诊二分类 + 10 特征多标签。一个回答"结构在哪",一个回答"要不要转诊、依据是什么"。互链写法可以点出这条"分割 → 转诊决策"的链条:从几何量(杯盘比、边缘宽度)到临床决策,是同一域里任务粒度的跃迁。

eyepacs(rid 58)是"血缘强链"。 JustRAIGS 的全部眼底图像来自 EyePACS LLC 的糖网筛查项目(见 §2.1 与 §3 的机构血缘:EyePACS 供图 + Rotterdam Eye Hospital 供标注)。库内 eyepacs 条目同源。互链时应说明:同源图像的不同标注视角——eyepacs 侧是糖网标签,JustRAIGS 侧是青光眼转诊与 10 特征标签。这层血缘对复现者很实用:两套数据可以对照理解 EyePACS 采集流程的图像特性(分辨率、相机谱系、人群分布)。

9.3 库内缺口:AIROGS 没有条目

JustRAIGS 的直系前作是 AIROGS(Artificial Intelligence for RObust Glaucoma Screening),同一团队(Rotterdam + EyePACS),全库 113,893 眼 / 60,357 人 / ~500 个筛查点。JustRAIGS 是它"把临床范围扩张到双任务(二分类 + 多标签解释)"的后继。

但库内暂无 AIROGS 条目(DB url_name ILIKE '%airogs%' 查重未见)。这是一个明确的库内缺口:AIROGS 与 JustRAIGS 是同一谱系的一前一后,若未来补入 AIROGS,两者应视为强互链对。当前 JustRAIGS 条目可把 AIROGS 作为"外部谱系"提及,不强行内链。

9.4 查重结论:为什么不与任何库内眼底条目撞库

任务头要求"必须查重确认不撞库,重点是 JustRAIGS 的青光眼转诊标注任务"。核验结果——不撞库,理由有四个正交维度:

  1. 疾病域不同:库内 10 个眼底条目的主体是糖网(DR)(messidor、ddr、idrid、deepdrid、fgadr 等)或眼底多疾病(rfmid、odir、fives);JustRAIGS 专注青光眼(glaucoma)。唯一同为青光眼域的是 refuge,但见下条。
  2. 任务形态不同:refuge 是视盘/视杯分割;JustRAIGS 是转诊二分类 + 10 特征多标签分类。业务目标(是否需转诊)与输出形态(类别标签)均不同。
  3. 图像血缘不同来源标注:JustRAIGS 是 EyePACS 图 + Rotterdam 标注的双机构组合;库内其它眼底条目各有独立来源(refuge 为中国多中心、idrid 为印度、messidor 为法国等)。
  4. 数据规模量级不同:JustRAIGS 训练子集 101,442 张 / 55,736 患者,且附带 54.2 GB 的公开训练集与一个永不公开的 9,741 张闭集测试集——这个体量与闭集测试设计在库内眼底条目里没有对应者。

另外,DB 层查重也确认:url_name ILIKE '%justraigs%' 与 %raigs% 均 0 行,ls writing/ 无同名目录。结论:JustRAIGS 与库内任何条目均非重复条目。

9.5 建议的互链写法

  • 在 JustRAIGS 条目正文(§2.6、§7.3 已落笔)与 INFOBOX 中,对 refuge(62)、eyepacs(58) 做强链;
  • 对 rfmid(271)、odir(63)、deepdrid(211) 做中链(同域/同范式);
  • 对 fives(741)、ddr(201)、idrid(191)、fgadr(221)、messidor(59) 做弱链(仅同域);
  • meddra(579) 不建链(仅术语层面弱关联,避免噪声);
  • AIROGS 标注为库内缺口,描述谱系但不内链。

§10 避坑清单:九个已踩过的坑与四个待核疑点

本节把 FACTS §9 的全部存照(双口径冲突)与待核疑点整理成一份"后来者清单"。凡本条目出现两个数字的地方,都不是笔误,而是有意双列——请勿擅自"统一"成单一数字。

10.1 九个已踩过的坑(存照)

# 坑点 冲突双方 本条目取法
坑点 1 License 被第三方记错 官网 /dataset/ + Zenodo + TMI 论文三处均写 CC BY-NC-SA;EyeDataHub(khosravipooya.com)写 CC BY-NC-ND 4.0 判 EyeDataHub 误,按 CC BY-NC-SA 成稿(§6.4)
坑点 2 参评队伍数 TMI 论文:开发阶段 322 参与者 / 37 国、测试阶段 20 队;VUNO 新闻稿与 Asia Business Daily:46 支队伍 非同一口径(报名 vs 入围),双列,建议引 TMI(§4.2)
坑点 3 测试集规模 官网 9,741 张;TMI 论文表 9,736 张 / 6,183 患者 双列,差 5 张(§2.1)
坑点 4 全库总量/患者数三口径 数据论文(xops)113,893 眼 / 60,357 人;TMI 111,178 CFPs / 61,919 患者;官网宣传语 “over 110k images from about 60,000 screenees” 三列存照,疑因含/不含 ungradable、眼 vs 图、患者口径不同(§2.1)
坑点 5 可评估眼数 数据论文 111,183 眼(97.62%);TMI 111,178 双列(§2.1)
坑点 6 grader 候选/合格数 数据论文 90 候选 → 30 通过 → 20 上岗;AIROGS 论文 89 报名 → 32 通过;官网未给数 引数据论文口径,注 AIROGS 差异(§3.1)
坑点 7 Zenodo 体量 Zenodo 官方 54.2 GB(6 分卷 + labels);EyeDataHub 记 ~100 GB 双列,疑为解压态/未压缩口径(§6.3、§6.7)
坑点 8 患病率单源 RG 4.38% 仅数据论文(可评估眼底图口径),官网未给 标来源,不当作唯一权威(§2.4)
坑点 9 两篇论文勿混引 数据论文 xops 2023(Ophthalmology Science, doi:10.1016/j.xops.2023.100300);挑战赛总结论文 TMI 2025(doi:10.1109/TMI.2025.3596874,PMID 40773411) 分属两篇,引用时各自标注(§2、§4)

10.2 四个待核疑点(尚未定论)

  1. Zenodo 是否有官方 dataset card 明示 License 细目:沙箱内 Zenodo API 被阻断,仅经官网 /dataset/ + TMI 论文 + 搜索镜像三源确认 CC BY-NC-SA。若能直连 Zenodo 记录页,应核对是否另有许可细目说明。
  2. OHTS 外部数据集的公开性:TMI 论文用 OHTS(Ocular Hypertension Treatment Study)子集约 **5,000 CFP(4,000 正常 + 1,000 青光眼)**对前三名算法做外部验证,并做了标签映射(ThinningDiscRim_RT/LT、NotchRim_RN/LN、DiscHemorrhage-DH、LargeCup_LC)。该子集是否公开下载,尚未确认。
  3. 46 vs 20 队伍的权威口径:新闻稿 46、论文 20,建议以 TMI 论文为准,但在本条目中保留双口径。
  4. “still ongoing challenge” 的时效:Zenodo 记录描述曾写该挑战"still ongoing",但 ISBI 2024 已结束、TMI 论文 2025 已发表——该表述时效存疑,读者不应据此认为挑战赛仍在接收提交。

10.3 使用本条目的一条总原则

遇到任何单一数字,先看它有没有并列的第二口径。 本条目对全部多来源冲突数字都做了双列或三列存照,并在取法上给出倾向(如 License 取 CC BY-NC-SA、队伍数建议引 TMI)。若你从别处看到一个"干净的单一数字",先怀疑它是否被某一来源单方面覆盖了其它来源。


§11 DAIMS 评估:AI-Ready 五维打分

DAIMS(Discoverability / Accessibility / Interoperability / Metadata / Sustainability)是千方病案医数集衡量一个数据集"AI-Ready 程度"的五维框架。以下逐维给出 JustRAIGS 的评分与依据。评分采用 1–5 分制(5 = 优秀)。

11.1 Discoverability(可发现性)— 5 / 5

  • 官方挑战页(justraigs.grand-challenge.org)与数据页(/dataset/)结构清晰;
  • Zenodo 记录 10035093(概念 DOI 10035092)带完整 DOI,搜索引擎可直达;
  • 两篇核心论文(xops 2023、TMI 2025)均开放获取、可被引;
  • ISBI 2024 官方挑战赛身份带来高曝光;
  • 千方病案医数集条目本身提供中文发现入口。
  • 扣分点:无。多口径冲突数字(§10)不影响可发现性。

11.2 Accessibility(可获取性)— 4 / 5

  • 训练集在 Zenodo 公开可下,需接受 CC BY-NC-SA 条款(self-service clickthrough);
  • 7 文件 54.2 GB,体量对普通用户偏大(§6.7 建议预留 150–200 GB);
  • 官方评估代码开源(GitHub 容器模板 + 评估脚本)。
  • 扣分点:测试集永不公开(闭集),无法复现官方榜单;Zenodo 下载需 clickthrough 且体量大;权限为 NC(非商用),限制部分使用场景。

11.3 Interoperability(互操作性)— 4 / 5

  • 图像为标准 JPEG 眼底照相,工具链通用;
  • 标签为结构化 CSV(JustRAIGS_Train_labels.csv),含主分类 RG/NRG 与 10 个二值附加特征,可直接映射到多标签训练框架;
  • 官方提供评估脚本(sens@spec95%、Hamming loss),指标定义明确可复现。
  • 扣分点:无标准化的影像元数据 schema(如 DICOM);相机型号 20.5% 未知,妨碍按设备分层;标签列命名需对照论文/官网文档理解(10 特征缩写无机器可读字典随包)。

11.4 Metadata(元数据)— 4 / 5

  • Zenodo 记录含版本、DOI、文件 md5 校验、发布日期(2024-01-08);
  • TMI 论文表提供了详尽的规模、患者数、年龄、设备构成等统计;
  • 官网 /dataset/ 给出了完整的标注流程与 adjudication 规则(含"忽略"机制)。
  • 扣分点:多口径冲突未在单一权威处澄清(总量/患者/测试集规模有三套口径,§10.1 #4);Zenodo 是否有官方 dataset card 未确认(§10.2 #1);年龄/患病率部分为单源(§10.1 #8)。

11.5 Sustainability(可持续性)— 4 / 5

  • Zenodo(CERN 运营)为长期归档平台,DOI 持久,可持续性高;
  • 论文开放获取,方法可长期追溯;
  • 官方代码托管 GitHub,社区可维护。
  • 扣分点:Zenodo 仅单版本(10035093),无 v2/后继版本记录;测试集闭集意味着基准"冻结"但仍需官方维护榜单说明;"still ongoing"表述时效存疑(§10.2 #4)可能误导长期读者。

11.6 DAIMS 汇总

维度 评分 一句话依据
Discoverability 5/5 官方页 + Zenodo DOI + 两篇开放论文 + 挑战赛曝光
Accessibility 4/5 公开可下但体量大、测试集闭、NC 限制
Interoperability 4/5 JPEG + 结构化 CSV + 官方评估脚本;缺 schema、20.5% 相机未知
Metadata 4/5 md5/日期/统计齐全;多口径未澄清、部分单源
Sustainability 4/5 Zenodo + 开放论文 + GitHub;单版本、时效表述存疑
合计 21 / 25 高 AI-Ready,扣分集中在"闭集测试 + 多口径冲突 + 体量"

评语:JustRAIGS 是一个高度 AI-Ready 但不"顺手"的数据集——它的可发现性与元数据质量在同类中属上乘,真正需要使用者花心思的地方在体量(54.2 GB)、闭集测试集(无法本地复现榜单)与多口径数字(必须先读 §10 再引用)。对研究者而言,它更适合作为"低患病率 + 多标签可解释 + 多相机域泛化"的方法学研究底座,而非一个即插即用的 benchmark。


FAQ(高频问答 34 问)

本节刻意写成"能用一句话说清就不写第二句"的形态。凡是需要 双口径 的地方,都在括号里标出冲突来源;凡是必须回查 FACTS.md 的地方,都指向 §9 的存照编号。

一、命名与身份(Q1-Q6)

Q1:JustRAIGS 这七个字母到底拆成什么?

两种展开并存,都是官方口径:

  • Justified Referral in AI Glaucoma Screening——“可解释转诊的 AI 青光眼筛查”(官网首页与 /dataset/ 页原话);
  • Justify your AI prediction for Referable or Not Referable Glaucoma Screening(EyeDataHub 引 Thakoor et al. MICCAI 2023 的展开式)。

两种展开的落点一致:转诊决策(referral)+ 可解释性(justification)。第一个词 “Justified” 是双关——既是"正当/可辩护的",也暗示"给出理由"。

Q2:它是一个数据集,还是一个挑战赛?

两个都是,但它首先是挑战赛。 ISBI 2024 官方挑战赛是本体,Zenodo 训练集是它公开出去的那部分。所以严格说法是"JustRAIGS 挑战赛 + 配套训练集"。仅说"JustRAIGS 数据集"会丢掉两件事:评测闸门(闭集测试集)与双任务设计(Task 1 + Task 2)。

Q3:slug 为什么是小写连写 justraigs?

因为官方数据集的命名本身就是小写连写的 justraigs(官网 URL 路径、Zenodo 记录里的标识符都是它)。本站沿用官方拼写,不做驼峰化。

Q4:它跟 AIROGS 是什么关系?

前后作关系,同一团队。 AIROGS(Artificial Intelligence for RObust Glaucoma Screening)是 2023 年的前作,同样来自 Rotterdam + EyePACS 的血缘;JustRAIGS 把临床范围从"单二分类"扩张到"二分类 + 10 特征多标签解释"。一句话:AIROGS 教机器"该不该转诊",JustRAIGS 还要机器说出"凭什么转诊"。

Q5:JustRAIGS 的正式论文有几篇?别把两篇混成一篇。

两篇,分属不同阶段,年份不同(存照 #9):

  • 数据论文:Lemij HG, de Vente C, Sánchez CI, Vermeer KA. Characteristics of a Large, Labeled Data Set for the Training of Artificial Intelligence for Glaucoma Screening with Fundus Photographs. Ophthalmology Science 2023;3(3):100300. doi:10.1016/j.xops.2023.100300。(描述训练集怎么来的)
  • 挑战赛总结论文:Madadi Y, Raja H, Vermeer KA, Lemij HG, … Yousefi S. JustRAIGS: Justified Referral in AI Glaucoma Screening Challenge. IEEE TMI 2025. PMID 40773411;doi:10.1109/TMI.2025.3596874。(描述比赛怎么跑的、怎么评的)

引用时务必分清:xops 2023 ≠ TMI 2025。最常见的错误是把 TMI 的榜单数字安到 xops 头上。

Q6:官网、Zenodo、论文三个入口分别给什么?

  • 官网 justraigs.grand-challenge.org:挑战概览、规则、任务定义、/dataset/ 页给标注流程与 license 声明;
  • Zenodo records/10035093:唯一可下载的训练集(6 分卷 + 1 个 labels CSV);
  • TMI 论文:权威的规模表、指标定义、榜单结果、外部验证。

三源互证是使用本数据集的底线——单看任何一源都会踩到 §10 里的坑。


二、任务与标签(Q7-Q15)

Q7:Task 1 到底在分什么?

二分类 RG vs NRG(Referable Glaucoma / No Referable Glaucoma)。注意落点是**“是否需要转诊”**,不是"有没有青光眼"。

Q8:RG 和 NRG 的官方定义是什么?

  • RG:眼底图显示青光眼体征、预期存在视野损害(visual field damage expected)、需要转诊专科;
  • NRG:无显著青光眼指征、无需立即转诊。关键一句:极早期病变(尚无预期视野损害)也归 NRG。

Q9:那"NRG"是不是等于"健康眼"?

不等于。 NRG 里混着"看不太清但够不上转诊"的眼,也混着"极早期、还不至于预计有视野损害"的眼。把它当"健康"来训练会带偏模型——这正是本数据集最反直觉的一点。NRG = 不需要转诊,不是"没病"。

Q10:Task 2 又是什么?为什么要单独设一个任务?

Task 2 = 对 RG 图像做 10 个附加特征的"正当化"多标签分类。它不是附加彩蛋,而是把"可解释性"从一个形容词变成了可评测的量:模型不仅要说"该转诊",还要说得出"哪个体征支持转诊"。这是 JustRAIGS 相对前作 AIROGS 的核心增量。

Q11:那 10 个特征是什么?分别什么意思?

缩写 中文 说明
ANRS 神经视网膜边缘外观——上部 Appearance of Neuroretinal Rim, Superior
ANRI 神经视网膜边缘外观——下部 Appearance of Neuroretinal Rim, Inferior
RNFLDS 视网膜神经纤维层缺损——上部 Retinal Nerve Fiber Layer Defect, Superior
RNFLDI 视网膜神经纤维层缺损——下部 Retinal Nerve Fiber Layer Defect, Inferior
BCLVS 环线血管裸露——上部 Baring Circumlinear Vessel, Superior
BCLVI 环线血管裸露——下部 Baring Circumlinear Vessel, Inferior
NVT 血管干鼻侧移位 Nasalisation of the Vessel Trunk
DH 视盘出血 Disc Hemorrhages
LD 筛板点 Laminar Dots
LC 大视杯 Large Cup

规律:四个"上/下"配对(ANRS/ANRI、RNFLDS/RNFLDI、BCLVS/BCLVI),六个独立体征(NVT、DH、LD、LC)。上下配对是因为青光眼损害在视盘上下极最典型。

Q12:Task 2 是在所有图上做的吗?

不是。Task 2 只在 RG 图像上评估。 NRG 图上没有"转诊理由"可言。所以 Task 2 的有效样本量远小于 Task 1。

Q13:数据论文说最常见的 RG 特征是什么?

神经视网膜边缘(NRR)的下部与上部外观(即 ANRI / ANRS 类)最常见;视盘出血(DH)是罕见特征。这个分布直接决定了 Task 2 的难点:常见标签大家都会,罕见标签才是拉低 Hamming loss 的主因。

Q14:一个图可以有多个附加标签吗?

可以,可多选。 这正是 Task 2 是"多标签分类"而不是"多分类"的原因——一张 RG 图可能同时具备 LC + DH + RNFLDI 等多个体征。

Q15:为什么说"正当化(justification)"比"可解释(explainable)"更准确?

因为这不是事后热力图式的"解释",而是标注时就必须勾选的转诊理由——理由是被临床专家认可的、有明确定义的 10 类体征。它把"模型说得对不对"变成了可对照标注的评测题。用"正当化"避免与"可解释 AI(XAI)"的宽泛用法混淆。


三、标注流程与质量控制(Q16-Q21)

Q16:每张图的标注要经过几个人?

最少 2 个,最多 3 个:

  1. 每图由 2 名 grader(G1、G2)从合格池中随机抽取并独立标注主分类(RG/NRG);
  2. 两人一致 → 即为终判;
  3. 两人分歧 → 交由 grader 3(青光眼专家,G3),G3 的判定即为终判。

Q17:附加标签(10 特征)有分歧怎么办?

不消解,而是"忽略"。 这是 JustRAIGS 标注设计里最容易被误解的一点:

  • 附加标签的终值取"两名初评者一致者";若主分类一致则取两人一致项;若主分类分歧则取"一名 grader + 专家"一致项,或"仅专家"判定项;
  • 任一附加标签仍有分歧 → 该标签在算法评估中对该图"忽略"(不计入汉明损失的分母)。

也就是说,分歧不是被强行抹平,而是被诚实地排除出评分。

Q18:为什么"忽略"比"消解"更诚实?

因为强行投票会把"其实标注者也不确定"的信息伪装成"确定标签"。忽略它,等于承认"这个格子我们没把握",从而避免模型被灌入似是而非的监督信号。§8.2 有专门展开。

Q19:grader 是怎么选出来的?有资格考试吗?

有。 从通过 European Optic Disc Assessment Trial(EODAT) 考核的候选者中筛选——EODAT 含 110 张立体视神经图像。数据论文口径:90 名候选 → 30 名通过(门槛 ≥85% 准确率 + ≥92% 特异度)→ 最终训练 JustRAIGS 时 20 名合格上岗(存照 #6;AIROGS 论文另记"89 报名 → 32 通过",属前作口径,勿混)。

Q20:上岗之后就一劳永逸了吗?

不。有动态质控。 每名 grader 的表现被持续监控,若灵敏度/特异度跌到 <80% / <95%(以最终判为参考),即退出并由他人重做。最终留下 20 名合格者(数据论文 Results)。这是"标注质量是流程问题不是一次性考试"的范例。

Q21:grader 的水平和一致性有多高?

  • 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)(数据论文);
  • 两名 grader 的表观一致率 92.45%,Gwet’s AC2 = 0.917。

注意"表观一致率"会因类别极不平衡而虚高(随机猜都容易一致),Gwet’s AC2 才是那个更可信的数——它在不平衡场景下比 Cohen’s kappa 更稳健。这一点 §8.1 与术语表都有对应。


四、规模与不平衡(Q22-Q27)

Q22:这个数据集到底有多大?(一句话答案 + 警告)

训练子集 101,442 张可评估眼底图 / 55,736 名患者(官网与 Zenodo 一致)。但总量口径有四套,引用前必须先看存照 #4——直接说"11 万张"容易被审稿人抓。

Q23:那四套总量口径分别是什么?

口径 数字 来源
全库(TMI 论文表) 111,178 CFPs / 61,919 患者 TMI 2025
全库(数据论文) 113,893 eyes / 60,357 individuals xops 2023(与 AIROGS 口径一致)
官网宣传语 “over 110k images from about 60,000 screenees” 官网首页
可评估眼数 111,183(97.62%)(xops) vs 111,178(TMI) 两论文

差异疑因"含/不含 ungradable、眼 vs 图、患者计数口径"不同。内容发布时按来源逐列标注,不做四舍五入统一。

Q24:训练集内部的 RG / NRG 各多少?

  • RG:3,270 张 / 2,336 名患者
  • NRG:98,172 张 / 53,400 名患者

(训练子集口径,官网与 Zenodo 一致。)

Q25:不平衡有多严重?

约 1:22。 RG 在全部可评估眼底图中占 4.38%(数据论文口径,存照 #8 单源)。这意味着——"全判 NRG"的模型准确率约 96.8%,却一个 RG 都抓不到。这就是 §8.1 讲的"高分低敏陷阱"。

Q26:既然这么不平衡,为什么不用准确率当指标?

因为准确率在这种情况下几乎不携带信息。所以 Task 1 用 Sensitivity at 95% Specificity——把特异度钉死在 95%,只看灵敏度。理由见 Q28。

Q27:测试集多大?为什么老说"两个数"?

官网:9,741 张;TMI 论文表:9,736 张 / 6,183 名患者(存照 #3,差 5 张)。分项(TMI 表):RG 1,602 张 / 1,195 人,NRG 8,134 张 / 4,988 人。测试集永不公开,所以这 5 张差异无法通过下载核对——只能双列。


五、指标与榜单(Q28-Q32)

Q28:Sensitivity at 95% Specificity 到底是什么?为什么这么设?

把特异度固定在 95%(即假阳性率上限 5%),在此门限下取灵敏度。 为什么:

  • 青光眼筛查要尽量减少无谓转诊(假阳性会挤兑专科资源、制造焦虑),所以特异度优先;
  • 但也不能漏(假阴性代价高),所以在满足了特异度约束后,尽量把灵敏度做高;
  • 在低患病率下,这个指标比 AUC/准确率更能反映"临床可用性"。

Q29:Task 2 的 Hamming loss 怎么算?

对多标签问题,逐标签比较预测与真值是否一致,不一致的比例即 Hamming loss,越低越好。关键细节:有分歧而被"忽略"的标签不计入分母(见 Q17)。所以 Hamming loss 的分母是"有效可评标签数",不是"图数 × 10"。

Q30:挑战赛的最佳成绩是多少?

TMI 论文摘要口径:Task 1 最高 sens@spec95% = 85%;Task 2 最佳平均 Hamming loss = 0.13。(9 队参评,见 Q31 的规模存照。)

Q31:冠军是谁?具体数字呢?

冠军队伍 VUNO(韩国):

  • Task 1:recall 0.9090 @ 95% specificity
  • Task 2:Hamming loss 0.1240

出处:ISBI 2024 论文 doi:10.1109/ISBI56570.2024.10635758;代码 github.com/seunghoonlee-fundus/JustRAIGS-vuno。

Q32:其他队伍呢?为什么总提 ndoladimeji?

两个对照样本:

  • LaTIM(法国 Brest):Task 1 ResNet50 Ensemble @ 800×800 → sens@spec95% = 0.870;Task 2 Eva + Deit3 + ResNet50 ensemble → Hamming loss = 0.239。
  • ndoladimeji:ResNet34,修正后平均 Hamming loss 0.1327、sens@spec95% 0.3242、AUC 0.72。

ndoladimeji 之所以值得单拎,是因为它演示了"高分低敏陷阱":Hamming loss 0.1327 看着不错,但 sens@spec95% 只有 0.3242——Task 2 分数漂亮,Task 1 临床上却不堪用。两个指标必须一起看。


六、许可、获取与复现(Q33-Q34)

Q33:License 是什么?为什么老有个"被记错"的说法?

官方三处(官网 /dataset/ + Zenodo 记录 + TMI 论文)一致写 CC BY-NC-SA。第三方目录 EyeDataHub(khosravipooya.com)写成了 CC BY-NC-ND 4.0——判为第三方错误(存照 #1)。

区别很实际:SA(ShareAlike)要求衍生作品同许可;ND(NoDerivatives)则不允许衍生。按官方 CC BY-NC-SA 执行,不要按 ND 那样自我设限。

Q34:怎么拿到数据?下载要接受什么?体量多大?

  • 入口:Zenodo 记录 10035093(概念 DOI 10035092);
  • 动作:页面公开,但下载需在 Zenodo 页面接受 CC BY-NC-SA 条款(self-service clickthrough);
  • 体量:7 个文件、合计 54.2 GB——6 个分卷(Train_0…Train_5,各 9.3 GB,最后一卷 7.7 GB)+ 1 个 labels CSV(9.2 MB);
  • 注意双口径:EyeDataHub 记 “~100 GB”(疑为解压后口径,存照 #7);
  • 测试集:永不公开。所以你无法在本地复现榜单——只能按官方评估脚本(GitHub: HinaRaja65/JustRAIGS_Challange 的 evaluate.py / hamming_loss.py / sensy_at_specy.py)在训练集上做内部划分自评。

事实清单(硬事实 40 条)

以下每条均可在 FACTS.md 找到对应出处;带【存照 #n】的表示存在多口径冲突,正文 §10.1 有逐条说明。

命名与身份

  1. 全称:Justified Referral in AI Glaucoma Screening(可解释转诊的 AI 青光眼筛查挑战赛)。
  2. slug:justraigs(官方小写连写)。
  3. 本质:ISBI 2024 官方挑战赛 + 配套训练集,非单纯静态数据集。
  4. 官网:https://justraigs.grand-challenge.org/ (含 /dataset/ 页)。
  5. 本站网址链:https://www.qianfanghub.com/ai-ready-dataset/justraigs/746 。

论文与时间线

  1. 数据论文:Lemij HG 等,Ophthalmology Science 2023;3(3):100300,doi:10.1016/j.xops.2023.100300。
  2. 挑战赛总结论文:Madadi Y 等,IEEE TMI 2025,PMID 40773411,doi:10.1109/TMI.2025.3596874。
  3. 前作论文:AIROGS,IEEE TMI 2024;43(1):542-557,doi:10.1109/TMI.2023.3313786,PMID 37682655。
  4. 挑战赛开发阶段:2024-01-08 → 2024-04-20;测试阶段:2024-03-01 → 2024-04-20(TMI 论文口径)。
  5. Zenodo 首版发布日:2024-01-08,仅此一版。
  6. 参评规模:【存照 #2】TMI 论文记开发阶段 322 名参与者 / 37 国、测试阶段 20 支队伍;VUNO 新闻稿与 Asia Business Daily 记"46 支队伍、约四个月"。
  7. 参评队伍须线下出席 ISBI 2024 并全额注册会议。

机构与人物

  1. 影像数据提供方:EyePACS LLC(美国加州圣克鲁斯)。
  2. 标注提供方:Rotterdam Ophthalmic Institute / Rotterdam Eye Hospital(荷兰鹿特丹)。
  3. 关键人物:Hans G. Lemij、Coen de Vente、Clara I. Sánchez、Koenraad A. Vermeer、Yeganeh Madadi、Siamak Yousefi、Hina Raja。
  4. grader 资格考试:EODAT(含 110 张立体视神经图像)。
  5. grader 候选/合格数:【存照 #6】xops 记 90 候选 → 30 通过 → 20 上岗;AIROGS 论文记 89 报名 → 32 通过。
  6. grader 平均灵敏度 85.6%(SD 5.7)、平均特异度 96.1%(SD 2.8)。
  7. 两名 grader 表观一致率 92.45%,Gwet’s AC2 = 0.917。

数据规模

  1. 全库总量:【存照 #4】TMI 记 111,178 CFPs / 61,919 患者;xops 记 113,893 eyes / 60,357 individuals;官网宣传语记 “over 110k images from about 60,000 screenees”。
  2. 训练子集(公开):101,442 张可评估眼底图 / 55,736 名患者。
  3. 训练集 RG:3,270 张 / 2,336 名患者。
  4. 训练集 NRG:98,172 张 / 53,400 名患者。
  5. 测试集:【存照 #3】官网 9,741 张;TMI 表 9,736 张 / 6,183 患者。
  6. 测试集分项(TMI 表):RG 1,602 张 / 1,195 人;NRG 8,134 张 / 4,988 人。
  7. 可评估眼数:【存照 #5】xops 记 111,183(97.62%)vs TMI 记 111,178。
  8. RG 患病率:全部可评估眼底图中 4.38%(xops 口径,存照 #8 单源),约 1:22 不平衡。
  9. 覆盖约 500 个美国筛查点,人群族裔异质。
  10. 年龄(TMI 表,训练集):RG 63.0±10.5 岁;NRG 56.5±10.1 岁。
  11. 图像格式 JPEG;分辨率中位数 (2354, 3296, 3),范围 (212,320,3)–(6000,6000,3)。
  12. 相机十类构成(训练集 101,442 口径):Optovue iCam100 26,480(26.1%)、Topcon NW400 20,557(20.3%)、未知 20,826(20.5%)、Canon CR1 10,274(10.1%)、Canon DGI 9,581(9.4%)、Canon CR2 9,179(9.0%)、Topcon NW200 2,888(2.8%)、Centervue DRS 1,598(1.6%)、Nidek AFC300 153(0.1%)、Crystalvue NFC-700 6(0.0%)。

任务与标注

  1. Task 1 = RG/NRG 二分类;Task 2 = 对 RG 图像的 10 特征多标签分类(仅 RG)。
  2. RG 定义要点:有青光眼体征、预期存在视野损害、需转诊;极早期尚无预期视野损害者归 NRG。
  3. 标注流程:2 名 grader 独立标主分类 → 分歧交 G3 专家终判;附加标签分歧不消解而忽略(不计入汉明损失分母)。
  4. 动态质控:grader 灵敏度/特异度跌至 <80% / <95% 即退出重做。
  5. 最常见 RG 特征:神经视网膜边缘(NRR)上/下外观;DH(视盘出血)罕见。

指标、榜单与许可

  1. Task 1 指标 = Sensitivity at 95% Specificity;Task 2 指标 = Hamming loss。
  2. 官方最佳(TMI 摘要):Task 1 最高 sens@spec95% = 85%;Task 2 最佳平均 Hamming loss = 0.13。
  3. 冠军 VUNO:Task 1 recall 0.9090 @ 95% spec;Task 2 Hamming loss 0.1240(doi:10.1109/ISBI56570.2024.10635758)。
  4. 训练集 License = CC BY-NC-SA(官网 + Zenodo + TMI 三源一致;【存照 #1】EyeDataHub 误记 CC BY-NC-ND 4.0);测试集永不公开;Zenodo 训练集 7 文件合计 54.2 GB(【存照 #7】EyeDataHub 记 ~100 GB)。

术语表(34 条)

术语 中文 释义
JustRAIGS 可解释转诊的 AI 青光眼筛查挑战赛 ISBI 2024 挑战赛 + 配套训练集
RG 需转诊青光眼 Referable Glaucoma;有体征、预期有视野损害、需转诊
NRG 无需转诊青光眼 No Referable Glaucoma;≠健康眼,含极早期病变
CFP 彩色眼底照相 Color Fundus Photograph
Task 1 转诊性能任务 RG/NRG 二分类
Task 2 正当化性能任务 对 RG 图的 10 特征多标签分类
ANRS / ANRI 神经视网膜边缘外观(上/下) Appearance of Neuroretinal Rim, Superior/Inferior
RNFLDS / RNFLDI 视网膜神经纤维层缺损(上/下) Retinal Nerve Fiber Layer Defect, Superior/Inferior
BCLVS / BCLVI 环线血管裸露(上/下) Baring Circumlinear Vessel, Superior/Inferior
NVT 血管干鼻侧移位 Nasalisation of the Vessel Trunk
DH 视盘出血 Disc Hemorrhages(罕见特征)
LD 筛板点 Laminar Dots
LC 大视杯 Large Cup
NRR 神经视网膜边缘 Neuroretinal Rim;最常见 RG 特征所在
EODAT 欧洲视盘评估试验 European Optic Disc Assessment Trial,含 110 张立体视神经图,grader 资格考核
grader 标注者 经资质考核的眼科读片者;本数据集最终 20 名合格
G3 专家判定者 打破 G1/G2 主分类分歧的第三名(青光眼专家)
adjudication 裁决/终判 分歧时由 G3 给出的最终判定
gradable / ungradable 可评估/不可评估 图像质量是否足以判读;不可评估者不计入训练子集
Sensitivity at 95% Specificity 95% 特异度下的灵敏度 Task 1 指标;特异度钉死 95%,取灵敏度
sens@spec95% 同上(缩写) 见上
Hamming loss 汉明损失 Task 2 指标;多标签逐项不一致率,越低越好
Gwet’s AC2 Gwet 的 AC2 一致性系数 类别不平衡下比 Cohen’s kappa 更稳健;本数据集 0.917
类别不平衡 class imbalance 本数据集 RG:NRG ≈ 1:22
患病率 prevalence RG 占可评估眼 4.38%
域泛化 domain generalisation 跨相机/机构仍稳健;因多相机谱系而关键
AIROGS 稳健青光眼筛查 AI 挑战赛 JustRAIGS 前作,同团队
OHTS 高眼压治疗研究 Ocular Hypertension Treatment Study;外部验证子集约 5,000 CFP
ISBI IEEE 国际生物医学成像研讨会 挑战赛主办会议(2024)
TMI IEEE 医学成像汇刊 挑战赛总结论文发表期刊
xops Ophthalmology Science 数据论文发表期刊(2023)
Zenodo Zenodo 开放存储库 训练集唯一官方下载处(records/10035093)
CC BY-NC-SA 署名-非商业-相同方式共享 训练集官方许可
DAIMS 数据资产可发现性评估模型 用于本条目的 AI-Ready 五维打分(§11)

附录

附录 A:标注流水线示意

                ┌─────────────────────────────┐
                │  待标眼底图(随机抽取分配)  │
                └──────────────┬──────────────┘
                               │
              ┌────────────────┴────────────────┐
              │                                 │
        ┌─────▼─────┐                     ┌─────▼─────┐
        │  G1 独立   │                     │  G2 独立   │
        │  标主分类  │                     │  标主分类  │
        │  (RG/NRG)  │                     │  (RG/NRG)  │
        └─────┬─────┘                     └─────┬─────┘
              │                                 │
              └────────────────┬────────────────┘
                               │
                    ┌──────────▼──────────┐
                    │   主分类是否一致?   │
                    └────┬─────────┬──────┘
                     一致 │         │ 分歧
                         │         │
                         │    ┌────▼─────┐
                         │    │ G3 专家   │
                         │    │ 终判      │
                         │    └────┬─────┘
                         │         │
                    ┌────▼─────────▼─────┐
                    │  终判 = RG 或 NRG   │
                    └──────────┬─────────┘
                               │
                    ┌──────────▼──────────┐
                    │ 若 RG:勾选 10 特征  │
                    │ (可多选,正当化理由)│
                    └──────────┬──────────┘
                               │
                    ┌──────────▼──────────┐
                    │ 附加标签仍有分歧?   │
                    └────┬─────────┬──────┘
                     一致 │         │ 分歧
                         │         │
                    ┌────▼───┐ ┌───▼──────────┐
                    │ 采信    │ │ 该标签"忽略"  │
                    │        │ │(不入汉明损失  │
                    │        │ │  分母)        │
                    └────────┘ └───────────────┘

一句话读法:主分类分歧有人拍板,附加标签分歧直接出局——前者保任务可做,后者保监督诚实。

附录 B:10 特征中英对照速查

# 缩写 英文全称 中文
1 ANRS Appearance of Neuroretinal Rim, Superior 神经视网膜边缘外观——上部
2 ANRI Appearance of Neuroretinal Rim, Inferior 神经视网膜边缘外观——下部
3 RNFLDS Retinal Nerve Fiber Layer Defect, Superior 视网膜神经纤维层缺损——上部
4 RNFLDI Retinal Nerve Fiber Layer Defect, Inferior 视网膜神经纤维层缺损——下部
5 BCLVS Baring Circumlinear Vessel, Superior 环线血管裸露——上部
6 BCLVI Baring Circumlinear Vessel, Inferior 环线血管裸露——下部
7 NVT Nasalisation of the Vessel Trunk 血管干鼻侧移位
8 DH Disc Hemorrhages 视盘出血(罕见)
9 LD Laminar Dots 筛板点
10 LC Large Cup 大视杯

附录 C:训练集相机构成表(101,442 张口径)

相机 数量 占比
Optovue iCam100 26,480 26.1%
Topcon NW400 20,557 20.3%
未知 20,826 20.5%
Canon CR1 10,274 10.1%
Canon DGI 9,581 9.4%
Canon CR2 9,179 9.0%
Topcon NW200 2,888 2.8%
Centervue DRS 1,598 1.6%
Nidek AFC300 153 0.1%
Crystalvue NFC-700 6 0.0%
合计 101,442 100%

读法:前十类里有两类 Topcon、三类 Canon、一类 Optovue,加 20.5% 未知来源——任何单一相机的性能都不代表整体性能。这是"多相机谱系"在数据层面的直接证据(§8.6)。

附录 D:Zenodo 训练集文件清单(records/10035093,共 7 文件 / 54.2 GB)

文件 大小 md5
JustRAIGS_Train_0.zip 9.3 GB b77f8679cc02a2fafe9953abff89fafb
JustRAIGS_Train_1.zip 9.3 GB fd21d85eafb54bd1d3f6190c739246d0
JustRAIGS_Train_2.zip 9.3 GB aff8fb52e068fc1050e6a8f32238a638
JustRAIGS_Train_3.zip 9.3 GB a411fd5cd1cebdaeedb5727204abdfba
JustRAIGS_Train_4.zip 9.3 GB 0fb8cd04c0d39a93ce97f05ec4b109e4
JustRAIGS_Train_5.zip 7.7 GB 76fa9a9f131a866054206392f7f1bfc6
JustRAIGS_Train_labels.csv 9.2 MB 0d01181f067f57ece1e7e1f07167a78e

注意:Zenodo 单版本记录;概念 DOI 为 10035092。下载前需接受 CC BY-NC-SA 条款。

附录 E:互链索引(按库内 rid 排序)

rid 条目 链接强度 理由
58 eyepacs ★★★ 强 同源于 EyePACS LLC,数据血缘
59 messidor ★ 弱 眼底 DR 分级,不同疾病
62 refuge ★★★ 强 同为青光眼域(视盘/视杯分割)
63 odir ★★ 中 眼科多疾病标签
191 idrid ★ 弱 眼底 DR,不同疾病
201 ddr ★ 弱 眼底 DR 分类
211 deepdrid ★ 弱 糖网分级
221 fgadr ★ 弱 细粒度糖网
271 rfmid ★★ 中 眼底多疾病分类
579 meddra ○ 不建议 不良事件术语,仅概念级弱关联
741 fives ★★ 中 眼底多疾病分割

库内缺口:AIROGS 无条目——JustRAIGS 的直接前作,建议作为新增条目并建立双向链(§9.3)。

附录 F:DAIMS 评估卡片

维度 得分 要点
Discoverability(可发现性) 5/5 Zenodo + 官网 + 两篇论文 + DOI,入口齐全
Accessibility(可获取性) 4/5 公开但需接受条款;54.2 GB 体量与闭集测试集是门槛
Interoperability(互操作性) 4/5 JPEG + CSV 标签,通用;中文生态需自建映射
Metadata(元数据) 4/5 文档完善,但总量数字多口径需先读 §10
Sustainability(可持续性) 4/5 Zenodo + CC 许可 + DOI 稳定;单一版本无后继需留意
合计 21/25 高度 AI-Ready,但"不顺手"

附录 G:最小复现步骤(本地自评)

  1. 到 Zenodo records/10035093 接受 CC BY-NC-SA 条款,下载 6 个分卷 + labels CSV(约 54.2 GB);
  2. 校验 md5(见附录 D);
  3. 解压合并,按 patient 字段做患者级划分(切勿按图随机划分,§8.4);
  4. 拉取官方评估脚本 github.com/HinaRaja65/JustRAIGS_Challange(evaluate.py / hamming_loss.py / sensy_at_specy.py);
  5. Task 1 按 sens@spec95% 评估;Task 2 仅对 RG 图、剔除被忽略标签后算 Hamming loss;
  6. 注意:无法本地复现官方榜单——测试集永不公开。

附录 H:存照冲突一览(引用前必读)

# 冲突项 口径 A 口径 B 采信建议
1 License CC BY-NC-SA(官网+Zenodo+TMI) CC BY-NC-ND 4.0(EyeDataHub) 采 A,B 判误
2 参评队伍 20 队(TMI) 46 队(新闻稿) 引 TMI,新闻口径另注
3 测试集规模 9,741 张(官网) 9,736 张 / 6,183 人(TMI) 双列
4 全库总量 111,178(TMI)/113,893(xops) “over 110k”(官网) 按来源逐列
5 可评估眼数 111,183(xops) 111,178(TMI) 双列
6 grader 数 90→30→20(xops) 89→32(AIROGS) 引 xops 并注差异
7 Zenodo 体量 54.2 GB(官方) ~100 GB(EyeDataHub) 采官方
8 RG 患病率 4.38%(xops 单源) — 标注单源
9 论文年份 xops 2023 TMI 2025 勿混引

尾注

来源清单(按抓取与核验顺序)

  1. JustRAIGS 挑战赛官网:https://justraigs.grand-challenge.org/ (挑战概览、任务定义)与 /dataset/ 页(标注流程、license 声明、训练/测试规模)——实抓,2026-09-30。
  2. Zenodo 训练集记录:https://zenodo.org/records/10035093 (文件清单、md5、CC BY-NC-SA 声明;概念 DOI 10035092)——经搜索镜像核验(沙箱直连 Zenodo API 被阻断),2026-09-30。
  3. 数据论文:Lemij HG, de Vente C, Sánchez CI, Vermeer KA. Characteristics of a Large, Labeled Data Set for the Training of Artificial Intelligence for Glaucoma Screening with Fundus Photographs. Ophthalmology Science 2023;3(3):100300. doi:10.1016/j.xops.2023.100300.
  4. 挑战赛总结论文:Madadi Y, Raja H, Vermeer KA, Lemij HG, et al., Yousefi S. JustRAIGS: Justified Referral in AI Glaucoma Screening Challenge. IEEE Transactions on Medical Imaging, 2025. doi:10.1109/TMI.2025.3596874;PMID 40773411.
  5. 前作挑战赛论文:de Vente C, Vermeer KA, et al., Sánchez CI. AIROGS: Artificial Intelligence for Robust Glaucoma Screening Challenge. IEEE TMI 2024;43(1):542-557. doi:10.1109/TMI.2023.3313786;PMID 37682655.
  6. 冠军方案论文(VUNO):doi:10.1109/ISBI56570.2024.10635758;代码 github.com/seunghoonlee-fundus/JustRAIGS-vuno。
  7. 官方评估代码:github.com/HinaRaja65/JustRAIGS_Challange(evaluate.py / hamming_loss.py / sensy_at_specy.py)。
  8. 参赛方案代码:LaTIM github.com/Mostafa-EHD/JustRAIGS_LaTIM_Solution;ndoladimeji 方案(GitHub)。
  9. 第三方目录(仅作冲突存照来源):EyeDataHub(khosravipooya.com)。
  10. 新闻口径(存照 #2):VUNO 官方新闻稿;Asia Business Daily。

核验声明

  • 抓取时点:2026-09-30。
  • 存在性核验:依教训 12 体系,三轮精确 WebSearch(×6)+ 官网 /dataset/ 与首页实抓 + Zenodo 记录(搜索镜像)三源互证。
  • 查重:数据库 url_name ILIKE '%justraigs%' 与 %raigs% 均返回 0 行;writing/ 下无同名目录——不撞库。
  • 双口径纪律:凡多来源冲突,本条目不取平均值、不四舍五入统一,一律双列并在 §10.1 与附录 H 留档,供后续修订可追溯。
  • 待核疑点(4 条):① Zenodo 是否有官方 dataset card 明示许可细目;② OHTS 外部数据集公开性;③ 46 vs 20 队伍的权威口径;④ 挑战赛 “still ongoing”(Zenodo 描述)与 ISBI 2024 已结束的时效矛盾。

修订记录

版本 日期 说明
v1.0 2026-09-30 初稿;基于三源互证;存照 9 条 + 待核 4 条

本条目为千方病案医数集(qianfanghub.com)AI-Ready Wikipedia 产出,遵循双口径存照纪律;任何数字引用前请先读 §10.1 与附录 H。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • origa-light — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
  • refuge2 — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 挑战赛数据集
  • riga — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
  • acrima — 共享标签:医学影像 / 眼科影像 / 图像分类 / 青光眼 / 评测基准
  • sics-155 — 共享标签:医学影像 / 眼科影像 / 图像分类 / 挑战赛数据集
  • g1020 — 共享标签:眼科影像 / 图像分类 / 青光眼 / 评测基准
  • gamma — 共享标签:医学影像 / 眼科影像 / 青光眼
  • drions-db — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准
  • rfmid — 共享标签:医学影像 / 眼科影像 / 图像分类
  • oct2017 — 共享标签:医学影像 / 眼科影像 / 图像分类

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集