信息速览
INFOBOX — ORIGA-light 一屏速览
维度 内容 本质 史上最早规模化公开的眼底视盘/视杯逐像素分割 + 青光眼结构判读数据集 全称 ORIGA(-light) = An Online Retinal Fundus Image Database for Glaucoma Analysis and Research 团队 新加坡 A*STAR I2R(主研)+ SERI/SNEC + NUS;核心作者 Jiang Liu、Tien Yin Wong 论文 EMBC 2010;2010:3065-3068(doi:10.1109/IEMBS.2010.5626137;PMID 21096798) 数据 650 张非散瞳彩色眼底图,3072×2048 RGB,视场约 45° 标签 168 青光眼 + 482 正常(正类 ≈25.8%);眼别 336 左 + 314 右 队列 新加坡 SiMES(Malay Eye Study)队列,2004-2007,40-80 岁,3,280 名受试者 标注 13 项结构字段(CDR/ISNT/RNFL/Notch/DH/PPA 等),CERA 协议 + ORIGA-GT 工具 任务 视盘/视杯分割、CDR 定量、青光眼二分类、ISNT 规则判读 性能 分类准确率约 93.5%(单源);分割 Dice/准确率 88.5%-98.9%(多源,口径不可对齐) 获取 原官网已失效;现 Zenodo 10.5281/zenodo.10674885(ORIGA.rar ≈475 MB) 许可 原始 academic-use 声明|Zenodo 镜像 CC BY 4.0(双口径,见坑 5) 库内互链 refuge(62) 首要、justraigs(746) 次之,及 messidor(59)/ddr(201)/idrid(191) 等 DR 系列
ORIGA-light 是眼科影像 AI 的一块"地层标本":它早在 2010 年就把 650 张眼底图从"医生看一眼给个诊断"推进到"逐像素勾勒视盘与视杯边界、逐项登记 13 个结构判读字段",是视盘/视杯分割任务沿用至今的公开评测集之一。它的 650 张图不是从零采集,而是从新加坡马来裔眼病研究(SiMES)队列的 3,280 名受试者中筛选而来——一半以上的青光眼诊断价值,藏在那些描述杯盘比、ISNT 规则、神经纤维层缺损的字段里,而不是藏在文件名中。
导语读法三则:
- 只想下数据:直奔 §6——原官网已失效,唯一可公开下载的入口是 Zenodo 镜像(ORIGA.rar),先读坑 5 弄懂许可双口径。
- 关心标签能做什么:直奔 §4 与 §5——13 项结构字段是它区别于普通"青光眼/非青光眼"二分类集的核心资产。
- 做视盘/视杯分割基准:直奔 §7——注意它没有官方固定划分,任何横向比较前先对齐 train/val/test 口径(坑 4)。
§0 导读:这个数据集解决什么问题
青光眼的诊断在结构层面高度依赖对视盘(optic disc, OD)与视杯(optic cup, OC)形态的判读:杯盘比(cup-to-disc ratio, CDR)增大、ISNT 规则被破坏、神经纤维层(RNFL)出现缺损、视盘出血、视盘周围萎缩(PPA)等,都是青光眼性视神经损害的经典征象。但在 2010 年前后,阻碍自动化研究落地的并不是算法,而是数据:公开可用的眼底图要么只给一个粗标签,要么视盘/视杯边界不可得,要么缺乏可供定量验证的结构字段。
ORIGA-light 的回答是把"临床判读表"整体数字化。它提供 650 张来自真实人群队列的非散瞳彩色眼底图,并为每张图配上:(1) 视盘与视杯的边界标注,可直接用于分割任务;(2) 由眼科专家按 CERA 分级协议、经 ORIGA-GT 工具登记的 13 项诊断相关结构字段,覆盖 CDR、ISNT 合规、RNFL、切迹、视盘出血、Alpha/Beta 区 PPA 等。这意味着同一套数据可以同时支撑两类研究:分割(像素级边界)与判读(结构字段级分类/回归)。
§0 读法三则:
- 这个条目是"数据集 + 队列论文 + 评测基准"三合一:本体是 650 张带边界与判读标签的眼底图,来源是 SiMES 队列论文,衍生用法是视盘/视杯分割与青光眼判读的公开基准——三者口径不同(§2、§4、§7)。
- 全文所有硬数字均出自主论文与 SiMES 队列论文;凡有双口径冲突处(名称、许可、字段计数、性能、划分)均在坑点或存照节逐条标注。
- 检索时若只写"ORIGA"会与"ORIGA-light"混用,若写"ORIGA dataset"可能命中非眼底数据集——用精确短语并核对 DOI(坑 1)。
§1 数据集速览:十问十答
Q1:ORIGA-light 是什么、名字怎么理解?
它是一套面向青光眼分析的眼底图公开数据库。官方标题写作 “ORIGA(-light)”,正文名 “ORIGA-light”,社区文献常简称 “ORIGA”。括号里的 light 通常被理解为"公开的精选子集口径"(去除了部分样本),但具体去除了哪些样本,论文未明示(见 §9 遗留疑点)。
Q2:多少张图、怎么分类?
共 650 张非散瞳(non-mydriatic)彩色眼底图,标签为 168 张青光眼 + 482 张正常,青光眼占比约 25.8%。眼别分布为 336 张左眼 + 314 张右眼,基本均衡。
Q3:图像规格如何?
3072 × 2048 像素 RGB 彩色,视场约 45°,由非散瞳眼底相机采集(SiMES 队列标准设备口径)。图像均为去标识化的真实临床眼底照相,而非合成或增强图像。
Q4:数据来自哪里?
来自新加坡 SiMES(Singapore Malay Eye Study) 人群队列——2004-2007 年对 40-80 岁新加坡马来裔人群的眼病流行病学研究,队列共 3,280 名受试者(响应率 78.7%)。ORIGA-light 是其中可分级、结论明确的子集。
Q5:每张图带哪些标注?
两类:一是视盘与视杯的边界标注(可导出为分割掩码);二是按 CERA「Assessment of Glaucomatous Optic Disk Signs」协议采集的 13 项诊断相关结构字段——眼别、图像质量、可分级性、Field、视盘大小、视盘倾斜比、CDR、ISNT 规则合规、RNFL 缺损、切迹、视盘出血、Alpha PPA、Beta PPA(另有备注栏)。
Q6:标注用的什么工具?
随数据集一同发布的 ORIGA-GT(ORIGA Ground Truth)标注/查看工具,其字段设计依据 CERA 的分级协议。
Q7:能拿来做什么任务?
至少四类:① 视盘/视杯逐像素分割;② 杯盘比(CDR)回归或分类;③ 青光眼 vs 正常的二分类;④ ISNT 规则合规性判读。这也是它比单一标签眼底集更"AI-Ready"的地方。
Q8:性能基准是多少?
多源口径不一:有研究报告青光眼分类准确率约 93.5%;也有方法论文报告 ORIGA-light 分割 Dice/准确率落在 88.5%-98.9% 区间,另有技术对比表给分割 sensitivity 77.5%-95%。这些数字来自不同论文、不同划分,不可横向对齐(坑 4)。
Q9:现在在哪里能下到?
原始发布官网(I2R/NTU 项目页)已下线、2026-09 实抓不可达。现行可公开下载的入口是 Zenodo record 10.5281/zenodo.10674885(v1,2024-02-18 发布),其中 ORIGA.rar 约 475 MB,与 REFUGE、ACRIMA 同包发布,页面标注 CC BY 4.0。
Q10:为什么它对 AI-Ready 重要?
它是青光眼结构判读方向的奠基性公开集:最早的规模化视盘/视杯分割标注来源之一,且附带 13 项结构字段而非单一标签。它与库内 REFUGE(62)、JustRAIGS(746) 共同构成"青光眼结构判读"的纵向谱系,与 DR 分级系列(messidor/ddr/idrid 等)横向互补。它的最大缺项是官方渠道失效、依赖社区镜像——这既是 AI-Ready 的减分项,也是条目必须存照的核心事实。
§2 数据构成与规格
2.1 规模、来源与基本构成
ORIGA-light 的 650 张图全部来自新加坡 SiMES 队列,构成如下:
| 维度 | 数值 | 占比 / 说明 |
|---|---|---|
| 总量 | 650 张 | 100% |
| 青光眼(glaucoma) | 168 张 | 25.8% |
| 正常(normal) | 482 张 | 74.2% |
| 左眼(left) | 336 张 | 51.7% |
| 右眼(right) | 314 张 | 48.3% |
| 分辨率 | 3072 × 2048 px | RGB 彩色 |
| 采集方式 | 非散瞳(non-mydriatic) | 视场约 45° |
眼别基本均衡(336:314 ≈ 1.07:1),这一点的意义在于:使用者在做左右眼对称性分析或需要区分眼别建模时,不必担心某一侧样本被系统性欠采样。相比之下,类别分布并不均衡——青光眼与正常约为 1:2.87,正类占比约四分之一。对分类任务而言这是一个中等程度的类别不平衡:直接用 accuracy 作为主指标会产生误导(多数类基线就有 74.2%),应改用 AUC、sensitivity/specificity 或 F1。
2.2 图像规格与采集条件
| 属性 | 规格 |
|---|---|
| 模态 | 彩色眼底照相(color fundus photography, CFP) |
| 分辨率 | 3072 × 2048 像素 |
| 色彩 | RGB(三通道) |
| 视场(FOV) | 约 45° |
| 散瞳状态 | 非散瞳(non-mydriatic) |
| 相机 | SiMES 队列标准非散瞳眼底相机口径(Canon CR-DGi 类) |
| 去标识 | 已去标识化(de-identified) |
"非散瞳"这一点值得单列:非散瞳眼底照相在人群筛查场景中更接近真实部署条件(无需滴散瞳药、可快速拍摄),但图像质量方差通常大于散瞳图。ORIGA-light 保留了"图像质量"与"可分级性"作为独立标注字段(§4),正是对非散瞳图质量波动的显式处理——使用者在建立质量过滤策略时可直接用这两个字段,而不必自己造一个质量打分器。
2.3 队列来源:SiMES 的三层数字
ORIGA-light 的数字链要从 SiMES 队列说起,因为"650"只是"3,280"的子集:
| 层级 | 数字 | 口径 |
|---|---|---|
| 合格人群 | 4,168 人 | SiMES 队列设计的合格受试者基数 |
| 实际参与 | 3,280 人 | 参与检查的受试者(响应率 78.7%) |
| 青光眼患病率 | 粗率 4.79% / 年龄标化率 3.6% | 队列论文口径 |
| 公开子集 | 650 张图 | ORIGA-light 图像级计数 |
需要强调的是:650 是图像数,3,280 是受试者数,两者不同量纲。SiMES 队列采集的眼底图总数远大于 650;ORIGA-light 是从中筛选出"可分级 + 结论明确"的部分公开。公开子集与完整队列的精确关系(去除了多少张、按什么规则去除)论文未给逐条说明,这是本条目明确标注的遗留疑点(§9)。
2.4 类别不平衡的实际影响
168:482 的分布对三类使用场景的含义各不相同:
- 分类任务:正类约 25.8%,属于中等不平衡,建议使用加权损失或在指标上以 AUC 为主;若做阈值敏感的青光眼筛查(高 sensitivity 优先),需明确报告 operating point。
- 分割任务:类别不平衡对分割影响较小(分割关注视盘/视杯区域本身),但需注意青光眼图的视杯相对视盘更大(CDR 更高),分割模型若对视杯边界不敏感会在正类上系统性偏差。
- CDR 回归:正常图 CDR 集中在小值区、青光眼图 CDR 分布更宽,回归目标本身存在分布右偏,评估时应按 CDR 分箱报告而非只报总体 MAE。
2.5 与同类眼底数据集的构成对照
| 数据集 | 库内 rid | 主定位 | 规模 | 与 ORIGA-light 的关系 |
|---|---|---|---|---|
| ORIGA-light | 本条 | 视盘/视杯分割 + 青光眼结构判读 | 650 图 | 本体 |
| REFUGE | 62 | 青光眼视盘/视杯分割 + CDR | 1,200 图 | 任务高度重叠,首要互链 |
| JustRAIGS | 746 | 青光眼转诊 AI(视杯/视盘) | 逾 10 万图 | 青光眼域,规模量级不同 |
| messidor | 59 | 糖网分级 | 1,200 图 | DR 域,与青光眼互补 |
| ddr | 201 | 糖网分级 | 逾 1.3 万图 | DR 域 |
| idrid | 191 | 糖网分级 | 516 图 | DR 域 |
| deepdrid | 211 | 糖网分级 | 3,662 图 | DR 域 |
| eyepacs | 58 | 糖网分级 | 逾 8.8 万图 | DR 域 |
| fgadr | 221 | 细粒度糖网 | 2,000 图 | DR 域 |
| rfmid | 271 | 多病种眼底分类 | 3,200 图 | 含青光眼标签 |
| odir | 63 | 多病种眼底分类 | 8,000 图 | 含青光眼标签 |
| fives | 741 | 眼底多任务(含血管) | 800 图 | 结构分割方向部分重叠 |
这张对照表的结论是:库内眼底条目绝大多数是糖尿病视网膜病变(DR)分级/病变检测方向,ORIGA-light 与 REFUGE(62) 是仅有的两个以青光眼视盘/视杯结构为核心定位的条目。ORIGA-light 的独特价值因此在于它是这一方向的最早公开来源,而 REFUGE 是其多年后的"接棒者"。
2.6 数据文件的组织与形态
ORIGA-light 的原始发布形态为:每张眼底图配一份边界标注与一份结构字段记录。Zenodo 镜像将这些内容打包为 ORIGA.rar(约 475 MB)。使用者下载后通常得到:
- 图像文件(眼底图本体,命名通常含编号);
- 视盘/视杯边界数据(坐标系与该图对齐,可渲染为轮廓或多边形);
- 结构判读字段表(13 项字段 + 备注)。
边界数据的具体格式(点集/多边形/掩码坐标)因发布形态而略有差异,本条目按文献与工具描述记为"可由 ORIGA-GT 查看/编辑的边界标注",实际格式以下载包为准(§9 遗留疑点)。
§3 机构与人物
3.1 开发机构
| 机构 | 角色 |
|---|---|
| A*STAR Institute for Infocomm Research (I2R),新加坡 | 主要研发机构(数据集构建与算法方向) |
| Singapore Eye Research Institute (SERI) / Singapore National Eye Centre (SNEC) | 临床分级与队列来源 |
| National University of Singapore (NUS) | 合作单位 |
| SiMES 队列方(Singapore Ministry of Health / NMRC 资助) | 数据来源人群队列 |
A*STAR(Agency for Science, Technology and Research)是新加坡国家级科研机构,I2R 是其中的资讯通信研究院。ORIGA-light 由 I2R 主导构建,并由 SERI 提供临床分级支持——这种"工程机构 + 眼科临床机构"的组合,是新加坡后续一系列眼科 AI 数据集的模板(ORIGA→REFUGE→后续 SiMES 衍生工作)。
3.2 作者与分工
主论文作者列表(EMBC 2010):Zhuo Zhang、Feng Shou Yin、Jiang Liu、Wing Kee Wong、Ngan Meng Tan、Beng Hai Lee、Jun Cheng(均属 I2R 方向)、Tien Yin Wong(SERI/NUS,临床眼科方向)。
| 人物 | 方向 | 备注 |
|---|---|---|
| Jiang Liu | I2R 眼科图像分析组负责人 | ORIGA 及后续新加坡眼科 AI 系列论文核心作者 |
| Tien Yin Wong | 临床眼科 / 流行病学 | SiMES 队列 PI 之一,眼病流行病学权威 |
| Zhuo Zhang、Feng Shou Yin 等 | I2R 算法与工程 | 数据集构建与标注流程实现 |
3.3 标注协议的来源
ORIGA-light 结构字段的标注依据是 Center for Eye Research Australia (CERA) 的 “Assessment of Glaucomatous Optic Disk Signs” 分级协议。这意味着数据集的判读字段不是团队自创的简化标签,而是沿用了临床青光眼视盘评估的既有术语体系(CDR、ISNT、RNFL、Notch、DH、PPA 等)。
这一点的实际意义:使用 ORIGA-light 的结构字段做研究时,字段语义与临床青光眼判读文献是对齐的,跨研究比较的语义成本较低;代价是字段体系本身带有临床判读的观察者间变异,标签并非绝对客观真值。
§4 标注体系:13 项结构字段
4.1 字段清单
ORIGA-light 为每张图提供 13 项诊断相关的结构判读字段(另有备注栏),按 ORIGA-GT 界面字段实列如下:
| 序号 | 字段 | 中文 | 类型 | 临床意义 |
|---|---|---|---|---|
| 1 | Laterality | 眼别 | 分类(L/R) | 左右眼 |
| 2 | Image Quality | 图像质量 | 等级 | 成像质量评估 |
| 3 | Gradability | 可分级性 | 分类 | 是否可判读 |
| 4 | Field | 视野/视场 | 分类 | 图像视场信息 |
| 5 | Disc Size | 视盘大小 | 连续/等级 | 视盘绝对尺寸 |
| 6 | Disc Tilting Ratio | 视盘倾斜比 | 连续 | 视盘倾斜程度 |
| 7 | CDR | 杯盘比 | 连续(垂直/水平) | 青光眼结构定量核心 |
| 8 | ISNT rule | ISNT 规则合规 | 分类 | 神经视网膜边缘宽度顺序 |
| 9 | RNFL | 神经纤维层缺损 | 分类/等级 | 神经纤维层完整性 |
| 10 | Notch | 切迹 | 分类 | 视盘边缘局灶性缺损 |
| 11 | Disc Haemorrhage | 视盘出血 | 分类 | 青光眼进展征象 |
| 12 | Alpha PPA | Alpha 区视盘周围萎缩 | 分类 | 视盘周围萎缩(外区) |
| 13 | Beta PPA | Beta 区视盘周围萎缩 | 分类 | 视盘周围萎缩(内区) |
| — | Comments | 备注 | 文本 | 附加说明 |
字段计数口径说明:文献中对"13 项"是否包含"眼别/图像质量/可分级性"存在不同理解——若这三项被视为元数据而非诊断字段,则诊断相关字段会少于 13。本条目按 ORIGA-GT 界面字段实列,称其为"13 项诊断相关字段(另有备注栏)",并在坑 3 存照这一计数分歧。
4.2 核心字段详解
CDR(杯盘比):视杯直径与视盘直径之比,青光眼诊断中最常被量化的结构指标。CDR 增大提示视杯扩大、神经视网膜边缘变窄,是青光眼性损害的直接表征。ORIGA-light 提供 CDR 字段,使该数据集可直接用于 CDR 回归/分类任务,而不必由使用者自行从分割掩码反推。
ISNT 规则:健康视盘的神经视网膜边缘宽度通常满足 Inferior(下)> Superior(上)> Nasal(鼻)> Temporal(颞)的顺序。ISNT 规则被破坏(尤其是下方边缘变窄为最窄)提示青光眼可能。它是一条"顺序性"判读规则,与 CDR 的"数值性"判读互补。
RNFL 缺损:视网膜神经纤维层缺损是青光眼的结构标志之一,常先于视野缺损出现。字段记录是否存在 RNFL 缺损。
Notch(切迹):视盘边缘局灶性的神经视网膜边缘缺损,常见于青光眼进展期。
Disc Haemorrhage(视盘出血):视盘表面或边缘的出血,是青光眼进展的已知危险因素之一。
Alpha / Beta PPA(视盘周围萎缩):视盘周围萎缩分为 Alpha 区(外侧、色素紊乱带)与 Beta 区(内侧、脉络膜视网膜萎缩带),Beta 区 PPA 与青光眼关联更密切。
4.3 分割标注:视盘与视杯边界
除结构字段外,ORIGA-light 的另一半资产是视盘(OD)与视杯(OC)的边界标注。这两类边界是视盘/视杯分割任务的监督信号,也是计算 CDR 的几何基础(CDR = OC 直径 / OD 直径)。
视盘/视杯分割是眼科图像分析中最基础、也最经典的结构分割任务之一。它的输出——OD/OC 掩码——可直接用于:CDR 计算、视杯面积占比、神经视网膜边缘宽度分布、ISNT 规则自动判读。ORIGA-light 因此既是一个分类数据集,也是一个分割数据集:同一张图的两种用法在文献中长期并存(§9 存照)。
4.4 ORIGA-GT 工具
ORIGA-GT 是随数据集发布的 ground truth 标注/查看工具,其字段设计依据 CERA 协议。使用者的实践含义:ORIGA-GT 既是查看已有标注的入口,也是理解字段语义的参照——在不确定某个字段取值范围时,工具界面本身就是最权威的口径来源。
4.5 标注质量的边界
ORIGA-light 的标注来自眼科专家判读,而非多专家委员会共识,因此带有临床判读固有的观察者间变异。具体表现为:CDR 这类连续量的专家间一致性通常中等,ISNT/Notch 这类规则性判读的一致性也受判读者经验影响。使用者在把结构字段当作"金标准"训练模型时,应把标签噪声纳入考量——这既是 ORIGA-light 的局限,也是整个青光眼视盘判读领域的共性局限。
4.6 结构字段的临床判读逻辑
理解 13 项字段,最好按青光眼临床判读的实际推理链来组织,而不是当作一张平铺的清单。临床上从眼底图判断青光眼,大致走"结构测量 → 规则核对 → 异常征象搜寻"三步:
第一步,结构测量(数值层):
- CDR 是首要定量指标。视杯/视盘直径比越大,神经视网膜边缘越薄,青光眼可能性越高。临床上 CDR > 0.6 或双眼不对称 > 0.2 常被提示为可疑。ORIGA-light 以连续值记录 CDR,可直接用于回归。
- Disc Size(视盘大小) 是 CDR 的解释前提:大视盘生理性 CDR 偏大,小视盘青光眼时 CDR 可能仍"正常"。只报 CDR 不报视盘大小,判读会失真——ORIGA-light 同时记录两者,这一点比只给 CDR 的数据集更临床友好。
- Disc Tilting Ratio(视盘倾斜比) 描述视盘倾斜,倾斜视盘会影响 CDR 与边缘宽度的度量可靠性。
第二步,规则核对(顺序层):
- ISNT 规则把神经视网膜边缘宽度按 Inferior > Superior > Nasal > Temporal 排序。合规 → 倾向正常;违规(尤其下方边缘变窄)→ 倾向青光眼。它是"顺序性"判读,与 CDR 的"数值性"判读互补:一个视盘可以 CDR 不大但 ISNT 已违规,也可以 CDR 偏大但 ISNT 尚合规。
第三步,异常征象搜寻(定性层):
- RNFL 缺损——神经纤维层缺失,常先于视野缺损出现,是早期征象。
- Notch(切迹)——视盘边缘局灶性边缘缺损,常见于进展期。
- Disc Haemorrhage(视盘出血)——进展危险因素。
- Alpha / Beta PPA——视盘周围萎缩,Beta 区与青光眼关联更密切。
此外 Image Quality / Gradability 是判读前置条件:非散瞳图质量波动大,质量差或不可分级的图在训练中应被识别或过滤;Laterality / Field 是元数据,保证判读与图像来源对齐。
4.7 为什么"结构字段"比"单一标签"重要
一个只给"青光眼/正常"二值标签的眼底集,只能训练一个二分类模型;模型学到的判别边界不可解释,也难以迁移到需要定量输出的场景。ORIGA-light 的 13 项字段把判读过程拆解为可解释的子任务:
| 子任务 | 对应字段 | 模型能力要求 |
|---|---|---|
| 数值回归 | CDR | 输出连续量,需处理类间分布差异 |
| 顺序判读 | ISNT rule | 学习空间顺序关系 |
| 二/多分类 | RNFL / Notch / DH / Alpha PPA / Beta PPA | 局部区域判别 |
| 质量评估 | Image Quality / Gradability | 图像质量打分 |
| 元数据对齐 | Laterality / Field | 与来源对齐 |
这种"多任务可分解"的结构,使 ORIGA-light 在不新增图像的前提下,把一个 650 图的数据集扩展成数倍于二分类的研究任务面。它也是"AI-Ready"的一个具体体现:数据不只是"能喂给模型",而是"能支撑有意义的、可解释的监督信号"。
4.8 与 DR 标注体系的口径差异(勿混用)
需要特别提醒:库内多数眼底条目(messidor/ddr/idrid 等)的标注体系是糖尿病视网膜病变分级(如 ICDR 0-4 级、微动脉瘤/出血/渗出等病灶),与 ORIGA-light 的青光眼视盘结构字段在语义上完全不重叠。二者虽同为"眼底图标注",但:
- DR 标注基于病变(lesion)与分级(grade);
- ORIGA-light 标注基于视盘结构(disc morphology)与青光眼征象。
因此跨条目引用标注时,不能把 DR 的"分级"与 ORIGA-light 的"CDR/ISNT"混为一谈。这是库内眼底条目互链时最易犯的语义错误。
§5 论文与时间线
5.1 主论文
| 项 | 内容 |
|---|---|
| 标题 | ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research |
| 作者 | Zhang Z, Yin FS, Liu J, Wong WK, Tan NM, Lee BH, Cheng J, Wong TY |
| 会议 | 32nd Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2010) |
| 地点/时间 | Buenos Aires, Argentina,2010-08-31 至 2010-09-04 |
| 出处 | Annu Int Conf IEEE Eng Med Biol Soc. 2010;2010:3065-3068 |
| DOI | 10.1109/IEMBS.2010.5626137 |
| PMID | 21096798 |
EMBC 是 IEEE 工程与医学交叉领域的年度旗舰会议,无卷号(年度会议)。论文的定位是"数据库介绍 + 基线算法":既发布数据集,也给出视盘/视杯定位与分割的基线方法,供后续研究对标。
5.2 时间线
| 时段 | 事件 |
|---|---|
| 2004-2007 | SiMES 队列采集期(3,280 名受试者接受检查) |
| 2010-08/09 | EMBC 2010 论文发表,ORIGA-light 公开发布 |
| 2010-约2020 | 原始官网(I2R/NTU 项目页)作为主要获取渠道 |
| 约2020 后 | 原始官网失效、直链不可达 |
| 2020 | 视觉领域依托该数据集的 REFUGE 挑战赛(MICCAI 2020)推动青光眼分割研究 |
| 2024-02-18 | Zenodo 社区镜像 record 10674885(v1)发布,ORIGA/REFUGE/ACRIMA 打包,标注 CC BY 4.0 |
| 2026-09 | 本条条目抓取时点,确认官网仍不可达、镜像为现行公开入口 |
5.3 双口径存照
页码口径:IEEE Xplore 与 PubMed 均记 3065-3068,无冲突。引用时按此页码。
年份口径:EMBC 为年度会议,无卷号跨年问题,会议年份即 2010,PubMed 收录亦归 2010。无跨年卷期歧义——这一点比许多期刊论文省心。
名称口径:官方标题写 “ORIGA(-light)”(用括号表示 light 为可选后缀),官方页面/正文多写 “ORIGA-light”,社区文献大量简写为 “ORIGA”。三者指同一数据集,但 “ORIGA” 作为搜索词会引入歧义(§10 坑 1)。
5.4 论文说了什么、没说什么
论文明确给出的:数据集规模(650 张)、类别(青光眼/正常)、来源队列(SiMES)、图像规格(3072×2048)、标注字段体系(13 项结构字段 + OD/OC 边界)、以及基线分割/定位结果。
论文没有明确给出的(本条目据实存照):“light” 相对完整 ORIGA 去除了哪些样本的筛选规则;650 张图上 OD/OC 掩码的完整度(是否全部含掩码);无官方固定 train/val/test 划分;原始发布的具体再分发授权条款措辞。这些空白在使用者做严谨复现时都可能成为障碍,故在 §9 逐条列为遗留疑点。
§6 获取与许可
6.1 版本链:从官网到 Zenodo 镜像
ORIGA-light 的获取方式经历了三段变迁,这是本条目最需要使用者留意的部分:
| 阶段 | 渠道 | 状态 |
|---|---|---|
| 第一段(2010-约2020) | 原始官网(I2R/NTU 项目页)直链 | 已失效 |
| 第二段(约2020 后) | 官网不可达,分散的历史镜像 | 不可靠 |
| 第三段(2024-02-18 起) | Zenodo record 10.5281/zenodo.10674885 | 现行可公开下载 |
原始官网失效是硬事实:2026-09 实抓显示官方项目页不可达(404/无响应)。这意味着任何"去 ORIGA 官网下载"的指引都已过时。现行唯一被本条目确认可公开下载的入口是 Zenodo 社区镜像。
6.2 Zenodo 镜像详情
| 项 | 内容 |
|---|---|
| Record DOI | 10.5281/zenodo.10674885 |
| 标题 | Diabetic Glaucoma(ORIGA,REFUGE,ACRIMA) |
| 版本 | v1 |
| 发布日期 | 2024-02-18 |
| 发布者 | 社区镜像上传者(非官方原始发布方) |
| License(页面标注) | CC BY 4.0 |
| 内容 | ORIGA(即 ORIGA-light)+ REFUGE + ACRIMA 三数据集打包 |
| 关键文件 | ORIGA.rar 约 475 MB |
| MD5 | 308b66f83325a18da09504a3b6c1c5cd(页面提供) |
| 全 record 总大小 | 约 3.7 GB(含三数据集) |
镜像把 ORIGA-light 与 REFUGE、ACRIMA 打包在一起,这三者都是眼底/青光眼相关的公开数据集,天然形成互链关系(§8)。
6.3 许可:双口径必须存照
ORIGA-light 的许可存在双口径,这是使用前必须理解的关键点:
| 口径 | 内容 | 来源 |
|---|---|---|
| 原始发布 | academic research(学术研究用途),要求引用原论文 | EMBC 2010 官方发布声明 |
| 现行镜像 | CC BY 4.0 | Zenodo record 10674885 页面 |
本条目按 Zenodo 镜像实核口径记 CC BY 4.0,并注明原始发布为 academic-use 声明。 需要提醒的是:CC BY 4.0 的标注来自社区镜像方,镜像方是否有权将原发布方的 academic-use 资产重新以 CC BY 4.0 授权,未见公开说明。这属于存照事项——使用者在涉及商业用途或再分发时,应自行评估这一授权链的合法性风险,而不能仅凭 Zenodo 页面的 CC BY 标识断言"完全自由可用"。
6.4 获取难度与无 gated
与库内许多需要申请、签协议的数据集不同,ORIGA-light 的 Zenodo 镜像无 gated、无申请制,开放直链下载。这一点的实际好处是:可复现性入口清晰,任何人有 DOI 即可获取,不需要机构隶属或用途说明。代价是:由于它不是官方托管,长期可用性依赖 Zenodo 平台与上传者,存在"未来可能消失"的可持续性风险。
6.5 获取决策建议
- 要立刻下数据:访问 Zenodo 10.5281/zenodo.10674885,下载
ORIGA.rar(约 475 MB),校验 MD5 308b66f83325a18da09504a3b6c1c5cd。 - 要引用:以主论文 EMBC 2010(doi:10.1109/IEMBS.2010.5626137)为正式引用(§附录 W)。
- 要商用:先厘清许可双口径——Zenodo 的 CC BY 4.0 与原始 academic-use 声明的冲突需自行评估。
- 要长期托管:建议自行镜像一份并记录 MD5,因为官方原站已失效,社区镜像亦非永久保证。
§7 评估与基准
7.1 它是一个被广泛使用的公开评测集
ORIGA-light 的价值不仅在于"提供数据",还在于它被大量视盘/视杯分割与青光眼判读方法论文用作训练集或验证集。它和 REFUGE、DRISHTI-GS 等一起,构成了视盘/视杯分割任务的常用公开基准集合。研究者提出新分割方法时,在 ORIGA-light 上报结果几乎是标准做法之一。
7.2 性能数字的多源存照
| 任务 | 指标口径 | 数值区间 | 来源类型 |
|---|---|---|---|
| 青光眼分类 | 准确率 | ≈ 93.5% | 某 XAI 相关研究报告(单源) |
| 视盘/视杯分割 | Dice / 准确率 | 88.5% - 98.9% | DB-SegNet / Nature 系列论文 2025 汇总表 |
| 分割 | sensitivity | 77.5% - 95% | 专利/技术对比表 |
| 外部验证 | 使用完整 650 张(168+482) | — | J Glaucoma 2024 等临床迁移研究 |
这些数字不可横向对齐。 原因有三:不同论文使用不同的 train/val/test 划分(ORIGA-light 无官方固定 split);分割指标(Dice/IoU/准确率)定义与视盘/视杯合并方式不同;分类任务的 operating point(阈值)与类别处理方式不同。任何"ORIGA-light 的 SOTA 是 X%"的断言都应附上具体论文与划分口径。
7.3 常用评测指标
| 任务 | 常用指标 |
|---|---|
| 视盘/视杯分割 | Dice、IoU、准确率、边界距离(ASSD/HD) |
| 青光眼分类 | AUC、accuracy、sensitivity、specificity、F1 |
| CDR 回归 | MAE、RMSE、相关系数 |
| ISNT 判读 | 分类准确率、一致性(κ) |
7.4 划分习惯(无官方 split)
ORIGA-light 没有官方固定的 train/val/test 划分,文献常见 8:2 或 7:3 的随机划分。这带来一个可复现性问题:同一方法在不同论文中报告的 ORIGA-light 分数,可能因为划分不同而无法直接比较。建议使用者在复现对比时,明确声明自己的划分方式与随机种子;若要跨论文比较,优先选择那些声明了划分细节的工作,或自行在同一划分下重跑基线。
7.5 基线方法与任务演化
ORIGA-light 论文本身即提供了视盘/视杯定位与分割的基线。此后视盘/视杯分割方法大致经历了:传统图像处理/主动轮廓(早期)→ 卷积神经网络全监督分割(中期)→ 结合注意力/多尺度/边界感知的网络(近期)→ 基础模型/自监督预训练适配(前沿)。ORIGA-light 作为一个小规模(650 张)、高质量标注的老数据集,在深度学习时代的角色也发生了转变:从"主要训练集"更多转向"外部验证集/泛化测试集"——研究者常在大型数据集上训练,再用 ORIGA-light 检验跨数据集泛化。这解释了为什么近年论文中 ORIGA-light 常以"external validation"或"cross-dataset test"的身份出现(§7.2 表中"外部验证"一栏即属此类)。
7.6 视盘/视杯分割的评测细节
视盘/视杯分割看似简单(两个嵌套的近似椭圆区域),实则在评测上有若干常被忽视的细节,直接影响 ORIGA-light 分数的可比性:
- OD/OC 是否分开报:有的论文只报"视盘"整体 Dice,有的分报 OD Dice 与 OC Dice。OC 边界通常比 OD 模糊(视杯边界在眼底图上无明确解剖边界),OC Dice 一般低于 OD Dice。只报一个"平均 Dice"会掩盖这一差异。
- 边界像素容差:部分评测用"边界距离容差"(如预测边界落在真值边界 ±N 像素内即算对),部分用严格 IoU/Dice。同一方法在两种口径下分数可差数个百分点。
- 视杯为空的处理:极少数正常眼视杯几乎不可见,若模型预测出空掩码,Dice 定义(0/0)需要特殊约定。不同论文处理不一致。
- 图像预处理:是否裁剪到视盘 ROI、是否做光照归一化/颜色校正、是否下采样,都会影响分数。非散瞳图光照不均,预处理的影响尤其显著。
- 测试集来源:在 ORIGA-light 内部划分测试,与用 ORIGA-light 作外部测试集(模型在他集训练),是两种完全不同的难度。§7.2 表中数字未区分这两类,故更不可横向对齐。
7.7 青光眼分类的评测细节
分类任务的坑集中在"operating point"与"类别处理":
- 阈值:AUC 衡量全阈值排序能力,而准确率/sensitivity/specificity 依赖具体阈值。报告后者时必须同时给出阈值。
- 类别不平衡:正类约 25.8%,若不做加权,模型倾向预测多数类(正常),accuracy 虚高而 sensitivity 低。筛查场景更看重 sensitivity,需明确取舍。
- 单眼 vs 双眼:临床判读是双眼综合,而数据集是图像级标签。若按受试者聚合预测(如两眼取最大风险),指标会变;文献多数按图像级报告。
- 与 CDR 的耦合:若分类模型隐式学 CDR,则"分类准确率"与"CDR 回归精度"高度相关,独立报告二者会高估方法多样性。
7.8 如何合理使用 §7.2 的性能数字
给使用者的三条操作建议:
- 只做同源对比:把同一篇论文内的多个方法分数放在一起比较(它们共享划分与预处理),不要把跨论文的数字拼成一张"排行榜"。
- 绑定口径再引用:引用任何 ORIGA-light 分数时,附"论文 + 任务 + 指标 + 划分"四要素,缺一不可。
- 自跑基线:若要做方法对比,最稳妥是在自己声明并公开的划分下重跑基线,而不是拼接文献数字。
§7bis 一个"老数据集"的复现工作流建议
由于 ORIGA-light 官方渠道失效、无官方 split、格式细节需实核,复现该数据集上的实验有一条推荐的稳健工作流:
- 获取:从 Zenodo 镜像下载
ORIGA.rar,核 MD5。 - 格式实核:确认图像格式、边界标注格式(点集/多边形/掩码坐标),必要时写解析脚本。
- 数据划分:固定随机种子,做 8:2 或 7:3 分层划分(按青光眼/正常分层),公开划分清单。
- 任务定义:明确做分割还是分类还是多任务,指标一次定清(§7.6/§7.7)。
- 基线复现:先跑一个简单基线(如 U-Net 分割、ResNet 分类),作为内部对标锚点。
- 报告口径:按 §7.8 四要素报告,并把许可双口径与获取路径写入方法节。
这条工作流的核心是"把不确定性显式化":ORIGA-light 的许多细节论文未明示,与其假装它们是确定的,不如在方法节里公开声明自己的选择。
§8 生态与影响
8.1 在青光眼影像 AI 谱系中的位置
ORIGA-light 是"青光眼视盘/视杯结构分析"方向的早期奠基数据之一。把它放进时间轴:
| 阶段 | 代表数据集/事件 | ORIGA-light 的关系 |
|---|---|---|
| 2000s 末 | ORIGA-light(2010) | 起点——最早规模化的公开 OD/OC 标注 |
| 2010s | DRISHTI-GS 等 | 同期/后续视盘分割集 |
| 2020 | REFUGE 挑战赛(MICCAI) | 接棒者——更大规模、标准化挑战赛 |
| 2020s | JustRAIGS 等 | 青光眼转诊 AI 的大规模数据 |
它的历史角色是"开先河":在深度学习尚未主导眼科影像的年代,就提供了带 OD/OC 边界与结构字段的公开集,使后续方法有了可对标的起点。
8.2 SiMES 队列的后续衍生
SiMES 队列本身产出多篇眼病流行病学与影像 AI 论文。ORIGA-light 是其中影像数据集分支的代表。队列数据还支撑了新加坡后续的眼科 AI 研究(如 REFUGE 的部分来源与新加坡其他眼底数据集)。因此 ORIGA-light 与"新加坡眼科 AI"这一研究传统紧密绑定,这也解释了为什么它与 REFUGE 在任务与来源上都有亲缘关系。
8.3 与 REFUGE、ACRIMA 的打包关系
Zenodo record 10674885 把 ORIGA、REFUGE、ACRIMA 三者打包。这三者:
| 数据集 | 定位 |
|---|---|
| ORIGA(ORIGA-light) | 青光眼视盘/视杯分割 + 结构判读 |
| REFUGE | 青光眼视盘/视杯分割 + CDR(挑战赛规格) |
| ACRIMA | 青光眼分类(眼底图) |
三者同属青光眼域,虽任务侧重不同,但常被同一批研究者共同使用。打包发布使它们成为"事实上的互链组"。
8.4 使用者的常见用法谱
| 用法 | 说明 |
|---|---|
| 视盘/视杯分割训练/验证 | 最主流用法,用 OD/OC 边界监督分割 |
| CDR 定量研究 | 用 CDR 字段做回归/与分割反推的 CDR 对照 |
| 青光眼分类 | 168/482 二分类 |
| ISNT/结构字段判读 | 用 13 项字段做多任务或规则学习 |
| 跨数据集泛化验证 | 在大型集训练、ORIGA-light 测试外部泛化 |
| 标注质量/一致性研究 | 用结构字段研究专家判读变异 |
§9 与库内条目的关系
9.1 家族图谱
青光眼结构域(最相关):
- REFUGE(62)——青光眼视盘/视杯分割 + CDR,任务与 ORIGA-light 高度重叠,是首要互链。REFUGE 可视为 ORIGA-light 方向在挑战赛时代的延续。
- JustRAIGS(746)——青光眼转诊 AI(视杯/视盘相关),同属青光眼域,次相关互链,规模量级更大。
糖尿病视网膜病变域(横向互补):
- messidor(59)、ddr(201)、idrid(191)、deepdrid(211)、eyepacs(58)——DR 分级系列。
- fgadr(221)——细粒度糖网。
- rfmid(271)、odir(63)——多病种眼底分类(含青光眼标签)。
- fives(741)——眼底多任务(含血管分割)。
关系判定:库内眼底条目中,只有 ORIGA-light 与 REFUGE(62) 以青光眼视盘/视杯结构为核心;其余绝大多数为 DR 域。因此 ORIGA-light 与它们的互链是"互补"而非"重复"——两者常在同一研究的数据集综述中并列出现。
9.2 检索路径建议
| 检索意图 | 建议关键词 |
|---|---|
| 找本体 | ORIGA-light、ORIGA(-light)、ORIGA dataset fundus |
| 找青光眼分割同类 | REFUGE challenge glaucoma segmentation、JustRAIGS |
| 找 DR 互补集 | messidor、IDRiD、DDR、EyePACS |
| 找来源队列 | Singapore Malay Eye Study、SiMES cohort |
| 找论文 | 10.1109/IEMBS.2010.5626137、PMID 21096798 |
§10 避坑清单:八个已踩过的坑
坑 1:ORIGA-light、ORIGA(-light)、ORIGA 是同一个数据集。官方标题用括号写 “ORIGA(-light)”,正文/页面多写 “ORIGA-light”,社区文献大量简写 “ORIGA”。检索时只写 “ORIGA” 会引入歧义(可能与厂商名、其他项目混淆),建议用精确短语 “ORIGA-light” 或直接核 DOI。
坑 2:原始官网已经失效。任何"从 ORIGA 官网/I2R 项目页下载"的旧指引都已过时——2026-09 实抓不可达。现行公开入口只有 Zenodo 社区镜像(10.5281/zenodo.10674885)。把这当作获取路径的第一步常识。
坑 3:"13 项字段"的计数口径有出入。文献对 13 项是否包含"眼别/图像质量/可分级性"存在不同理解。本条目按 ORIGA-GT 界面字段实列并注明"13 项诊断相关字段(另有备注栏)";引用时应说明计数口径,避免与其他文献的"N 项"直接冲突。
坑 4:性能数字不可横向对齐。93.5%(分类准确率)、88.5%-98.9%(分割 Dice/准确率)、77.5%-95%(sensitivity)来自不同论文、不同划分、不同指标定义。ORIGA-light 无官方固定 split,任何"SOTA 是 X%"都需附具体论文与划分。
坑 5:许可双口径。原始发布为 academic research 用途声明,Zenodo 镜像标 CC BY 4.0。本条目按镜像实核记 CC BY 4.0 并注明溯源自镜像方;镜像再授权的合法性未见公开说明,商用/再分发前需自行评估。
坑 6:“light” 的筛选规则未明示。ORIGA-light 相对完整 ORIGA 去除了哪些样本、按什么规则去除,论文未给逐条说明;650 张与 SiMES 完整队列图像数的关系也未明示。不要假设 650 是队列的全部可分级图。
坑 7:650 是图像数不是受试者数。SiMES 队列 3,280 是受试者数,ORIGA-light 650 是图像数,两者不同量纲。引用"3,280"时务必说明它是队列规模而非图片数,避免把两个数字直接绑定。
坑 8:掩码完整度需实核。650 张图中 OD/OC 掩码是否全部齐备、边界数据的精确格式(点集/多边形/掩码坐标),论文未逐条明示,需下载 ORIGA.rar 实核。本条目按文献与工具口径记为"可由 ORIGA-GT 查看/编辑的边界标注"。
§11 总结
11.1 三句话总结
- ORIGA-light 是 2010 年发布的、源自新加坡 SiMES 队列的 650 张眼底图视盘/视杯分割与青光眼结构判读数据集(168 青光眼 + 482 正常),是这一方向最早的规模化公开来源之一。
- 它的核心资产是"OD/OC 边界 + 13 项结构字段"的双重标注,使它同时可做分割、CDR 回归、青光眼分类与 ISNT 判读,而不只是一个二分类集。
- 它的现状是"原官网失效、Zenodo 社区镜像承接(CC BY 4.0)",使用前必须理解许可双口径与获取路径变迁(§6、坑 2、坑 5)。
11.2 适合谁
- 视盘/视杯分割团队:找早期经典监督信号与跨数据集泛化测试集。
- 青光眼结构判读研究者:13 项字段(CDR/ISNT/RNFL/PPA)可直接支撑多任务学习。
- 眼科数据集综述作者:ORIGA-light 是青光眼结构方向的必列起点。
- 研究"老数据集在深度学习时代的角色转变"者:它从主训练集转向外部验证集是活的案例。
11.3 不适合谁
- 需要大规模即插即用训练集的团队(650 张偏小,且无官方 split)。
- 需要最新大规模青光眼数据的项目(应看 JustRAIGS(746))。
- 需要明确商用授权链的项目(许可双口径未澄清)。
- 需要跨族群泛化的研究(源队列为新加坡马来裔单一族群)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要立刻下数据 | Zenodo 10.5281/zenodo.10674885 下 ORIGA.rar(475 MB,核 MD5) |
| 要做视盘/视杯分割基准 | 明确声明自己的 train/test 划分(无官方 split,坑 4) |
| 要做青光眼结构多任务 | 用 13 项字段(§4),先理解字段语义源自 CERA 协议 |
| 要商用 | 先厘清许可双口径(原始 academic-use vs 镜像 CC BY 4.0,坑 5) |
| 要找同类数据集 | REFUGE(62) 首要互链、JustRAIGS(746) 次之(§9) |
| 要引用 | 用 EMBC 2010 主论文 BibTeX(附录 W) |
11.5 一句话定位
ORIGA-light = “青光眼结构判读方向最早的规模化公开坐标”:它的价值不在数据量(650 偏小),而在它把 CDR/ISNT/RNFL 这套临床判读语言第一次系统地数字化并公开;它的风险不在数据质量,而在"原渠道已失效、现行依赖社区镜像"的可持续性。
11.6 与库内"青光眼双子"的关系总结
在千方病案医数集的眼底条目矩阵中,ORIGA-light 与 REFUGE(62) 构成"青光眼结构双子":ORIGA-light 是 2010 年的公开起点、规模小、字段细;REFUGE 是 2020 年挑战赛时代的接棒者、规模大、标准化。两者的关系不是替代而是"前驱—后继",互链价值最高。JustRAIGS(746) 则代表青光眼 AI 向"转诊/大规模"演进的新一代,规模量级再上一个台阶。三者共同勾勒出青光眼影像 AI 从"小样本结构标注"到"大规模转诊筛查"的演进轨迹。
FAQ(高频问答 28 问)
A. 基础认知
Q1:ORIGA-light 是挑战赛吗?
不是。它没有比赛、没有 leaderboard,是 2010 年公开发布的眼底图数据库(论文+数据+工具三件套)。后来的 REFUGE 才是挑战赛形式。
Q2:名字里的 light 是什么意思?
官方写作 “ORIGA(-light)”,light 通常被理解为公开的精简子集口径(相对完整 ORIGA 去除了部分样本)。但去除哪些样本论文未明示(坑 6)。
Q3:它是谁做的?
新加坡 A*STAR I2R 主导,SERI/SNEC 提供临床分级,NUS 合作。核心作者含 Jiang Liu、Tien Yin Wong。
Q4:论文发在哪里、怎么引用?
EMBC 2010;2010:3065-3068,doi:10.1109/IEMBS.2010.5626137,PMID 21096798。引用见附录 W。
Q5:和 REFUGE 什么关系?
同属青光眼视盘/视杯分割方向,REFUGE 是 2020 年挑战赛形式、规模更大的接棒者。ORIGA-light 是更早的公开起点,二者高度互补(§9)。
Q6:为什么老数据集还值得收录?
因为它是青光眼结构判读方向最早的规模化公开来源之一,且带 13 项结构字段(非单一标签),至今仍被大量方法论文用作基准与外部验证集(§7.5)。
B. 数据与规格
Q7:多少张图?怎么分类?
650 张,168 青光眼 + 482 正常,青光眼占约 25.8%。
Q8:图像分辨率?
3072 × 2048 RGB 彩色,非散瞳,视场约 45°。
Q9:左右眼分布?
336 左 + 314 右,基本均衡。
Q10:数据来自什么队列?
新加坡 SiMES(Singapore Malay Eye Study),2004-2007,40-80 岁,3,280 名受试者。注意 3,280 是人数不是图片数(坑 7)。
Q11:有哪些标注?
两类:OD/OC 边界标注 + 13 项结构字段(眼别/质量/可分级性/Field/视盘大小/倾斜比/CDR/ISNT/RNFL/Notch/DH/Alpha PPA/Beta PPA + 备注)。
Q12:标注工具是什么?
ORIGA-GT(随数据集发布),字段依据 CERA 分级协议。
Q13:类别不平衡严重吗?
中等,1:2.87。分类任务建议用 AUC/F1 而非 accuracy;分割与 CDR 回归受不平衡影响较小。
C. 任务与使用
Q14:能做哪些任务?
OD/OC 分割、CDR 回归、青光眼二分类、ISNT 判读,以及跨数据集泛化验证与标注一致性研究。
Q15:CDR 字段直接可用吗?
可用。ORIGA-light 直接提供 CDR,避免使用者自造 CDR 标签;但字段带有临床判读变异,训练时需考虑标签噪声。
Q16:ISNT 规则是什么?
Inferior > Superior > Nasal > Temporal,健康视盘神经视网膜边缘宽度的典型顺序;被破坏提示青光眼。
Q17:有官方 train/test 划分吗?
没有。文献各用各的(8:2/7:3),跨论文比较前须对齐划分(坑 4)。
Q18:适合训练还是验证?
两者皆可;在深度学习时代更常作外部验证/泛化测试集(§7.5)。
Q19:650 张够用吗?
作为小规模高质量集,独立训练偏小;常见做法是与更大数据集联合训练或用于微调/验证。
Q20:正类太少怎么办?
用加权损失、重采样,或改以 AUC 为主指标;筛查场景下关注 high-sensitivity operating point。
D. 获取与许可
Q21:现在在哪里下?
Zenodo 10.5281/zenodo.10674885,ORIGA.rar 约 475 MB,MD5 308b66f83325a18da09504a3b6c1c5cd。
Q22:原官网还能用吗?
不能。2026-09 实抓不可达(坑 2)。
Q23:许可是什么?
双口径:原始 academic research 声明 vs Zenodo 镜像 CC BY 4.0。本条目按镜像实核记 CC BY 4.0 并注明溯源自镜像方(坑 5)。
Q24:能商用吗?
需自行评估许可双口径的合法性风险——Zenodo 的 CC BY 4.0 由社区镜像方标注,再授权依据未见公开说明。
Q25:Zenodo 包里还有什么?
REFUGE 与 ACRIMA 也在同包(总约 3.7 GB),三者同属青光眼域(§8.3)。
Q26:有 gated/申请制吗?
没有,开放直链下载。
Q27:点云/掩码格式?
文献与工具口径记为"可由 ORIGA-GT 查看/编辑的边界标注";精确格式以下载包为准(坑 8)。
Q28:如何保证长期可用?
原官网已失效,建议自行镜像并记录 MD5;不要假设社区镜像永久存在。
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | ORIGA-light |
| url_name | origa-light |
| 类型 | 数据集(视盘/视杯分割 + 青光眼结构判读) |
| 全称 | ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research |
| 论文 | EMBC 2010;2010:3065-3068(doi:10.1109/IEMBS.2010.5626137) |
| 团队 | A*STAR I2R + SERI/SNEC + NUS |
| 规模 | 650 张(168 青光眼 + 482 正常) |
| 队列 | 新加坡 SiMES(3,280 受试者) |
| 规格 | 3072×2048 RGB,非散瞳,FOV≈45° |
| 标注 | OD/OC 边界 + 13 项结构字段(ORIGA-GT / CERA 协议) |
| 获取 | Zenodo 10.5281/zenodo.10674885(ORIGA.rar≈475 MB) |
| 许可 | 原始 academic-use|镜像 CC BY 4.0(双口径) |
| 抓取时点 | 2026-09-30 |
| 库内互链 | refuge(62)/justraigs(746)/messidor(59)/ddr(201)/idrid(191)/deepdrid(211)/eyepacs(58)/fgadr(221)/rfmid(271)/odir(63)/fives(741) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文被 IEEE/PubMed 收录、Zenodo DOI 可索引;但名称三写法(ORIGA-light/ORIGA(-light)/ORIGA)易混淆,官方原站失效 |
| A 可获取性 | 7 | Zenodo 开放直链、无 gated,475 MB 单包可下;减分项是官方原始渠道失效、依赖社区镜像的长期风险 |
| I 可互操作 | 7 | 标准图像格式 + 边界标注 + 字段表;无官方转换脚本到统一分割掩码/DICOM 格式,格式细节需实核 |
| M 元数据质量 | 7 | 论文+队列论文提供规模/来源/字段体系;但"light"筛选规则、掩码完整度、许可条款措辞未明示,扣分 |
| S 可持续性 | 5 | 原始官网已失效(重大扣分),现行依赖 Zenodo 社区镜像与单个上传者,可持续性存在单点风险 |
| 综合评级 | 6.6/10(中上) | 数据与方法价值高、许可相对开放;可持续性被"官方渠道失效 + 社区镜像依赖"显著拖低 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 650 张 / 168 青光眼 / 482 正常 | 主论文 + 多源二手引用 | EMBC 2010 正文 |
| 336 左 / 314 右 | 主论文/数据集说明 | EMBC 2010 正文 |
| 3072 × 2048,FOV≈45° | 主论文规格描述 | EMBC 2010 正文 |
| 3,280 受试者 / 响应率 78.7% | SiMES 队列论文 | 队列论文正文 |
| 青光眼患病率 4.79% / 3.6% | SiMES 队列论文 | 队列论文结果 |
| 13 项结构字段 | ORIGA-GT / CERA 协议 | 主论文 + 工具界面 |
| DOI 10.1109/IEMBS.2010.5626137 | IEEE Xplore | 论文页 |
| PMID 21096798 | PubMed | 论文记录 |
| Zenodo 10.5281/zenodo.10674885 / v1 / 2024-02-18 | Zenodo | record 页面 |
| ORIGA.rar ≈475 MB / MD5 308b66f8… | Zenodo | 文件列表 |
| CC BY 4.0(镜像) | Zenodo | record 许可栏 |
| 分类准确率 ≈93.5% | XAI 相关研究报告 | 二手引用 |
| 分割 88.5%-98.9% | Nature 系列/DB-SegNet 汇总表 | 论文表格 |
| sensitivity 77.5%-95% | 专利/技术对比表 | 对比表 |
附录 D:数据获取决策树
需求是什么?
├── 只想快速拿到数据跑通
│ └── Zenodo 10.5281/zenodo.10674885 → ORIGA.rar(475 MB,核 MD5)
├── 想做视盘/视杯分割
│ ├── 下载 ORIGA.rar 解出图 + OD/OC 边界
│ └── 自定义 train/val/test(无官方 split,须声明划分)
├── 想做青光眼分类
│ ├── 用 168/482 标签
│ └── 处理类别不平衡(加权/重采样,AUC 为主指标)
├── 想做青光眼结构多任务
│ └── 用 13 项结构字段(CDR/ISNT/RNFL/PPA 等)
├── 要做跨数据集泛化
│ └── 大集训练 + ORIGA-light 外部验证
└── 要商用/再分发
└── 先厘清许可双口径(原始 academic-use vs 镜像 CC BY 4.0)
附录 E:13 项结构字段数据字典
| 字段 | 类型 | 取值口径(按临床判读惯例) |
|---|---|---|
| Laterality | 分类 | left / right |
| Image Quality | 等级 | 成像质量分级(优/中/差类) |
| Gradability | 分类 | 可分级 / 不可分级 |
| Field | 分类 | 图像视场(如 disc-centered 等) |
| Disc Size | 连续/等级 | 视盘绝对尺寸描述 |
| Disc Tilting Ratio | 连续 | 视盘倾斜比 |
| CDR | 连续 | 垂直/水平杯盘比 |
| ISNT rule | 分类 | 合规 / 不合规 |
| RNFL | 分类/等级 | 无缺损 / 有缺损(可分级) |
| Notch | 分类 | 有 / 无 |
| Disc Haemorrhage | 分类 | 有 / 无 |
| Alpha PPA | 分类 | 有 / 无 |
| Beta PPA | 分类 | 有 / 无 |
| Comments | 文本 | 自由备注 |
附录 F:任务—指标—输出对照
| 任务 | 输入 | 输出 | 推荐指标 |
|---|---|---|---|
| OD/OC 分割 | 眼底图 | OD/OC 掩码 | Dice、IoU、ASSD、HD |
| CDR 回归 | 眼底图 或 OD/OC 掩码 | CDR 数值 | MAE、RMSE、r |
| 青光眼分类 | 眼底图 | 青光眼/正常 | AUC、sensitivity、specificity、F1 |
| ISNT 判读 | OD/OC 掩码 或 眼底图 | 合规/不合规 | 准确率、κ |
| 结构多任务 | 眼底图 | 多字段联合输出 | 各字段分项指标 |
附录 G:与库内条目的检索兼容提示
| 库内条目 | rid | 与本条检索重叠点 | 区分要点 |
|---|---|---|---|
| REFUGE | 62 | 青光眼视盘/视杯分割、CDR | REFUGE 为挑战赛、1,200 图 |
| JustRAIGS | 746 | 青光眼转诊、视杯/视盘 | 规模逾 10 万图 |
| rfmid | 271 | 含青光眼标签的多病种分类 | 多病种非专用结构分割 |
| odir | 63 | 含青光眼的多病种分类 | 同上 |
| fives | 741 | 眼底结构分割(含血管) | 任务是血管/多任务 |
| messidor 等 DR 系列 | 59/201/191/211/58/221 | 都是眼底图 | 任务是糖网分级,非青光眼结构 |
附录 H:许可条款细读(双口径)
| 口径 | 措辞 | 要求 | 来源 |
|---|---|---|---|
| 原始发布 | academic research use | 学术研究用途、引用原论文 | EMBC 2010 官方声明 |
| 现行镜像 | CC BY 4.0 | 署名、可再分发(按 CC BY 条款) | Zenodo record 10674885 |
使用建议:以主论文引用作为学术礼貌与合规基础;商用/再分发前,因镜像再授权依据未见公开说明,建议联系相关方确认或采取保守策略。
附录 I:双口径登记表
| 事项 | 口径 A | 口径 B | 本条目处理 |
|---|---|---|---|
| 名称 | ORIGA-light | ORIGA(-light) / ORIGA | 以 ORIGA-light 为主,等价注明 |
| 许可 | 原始 academic-use | 镜像 CC BY 4.0 | 按镜像实核记 CC BY 4.0 并注明溯源(坑 5) |
| 字段计数 | 13 项 | 含/不含元数据字段 | 按 ORIGA-GT 界面实列并注(坑 3) |
| 性能 | 93.5%(分类) | 88.5%-98.9%(分割) | 多源并列、不可对齐(坑 4) |
| 划分 | 8:2 | 7:3 | 无官方 split,均存照 |
| 获取 | 原官网 | Zenodo 镜像 | 官网失效,镜像为现行入口(坑 2) |
附录 J:引文规范(BibTeX)
@inproceedings{zhang2010origa,
title = {ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research},
author = {Zhang, Zhuo and Yin, Feng Shou and Liu, Jiang and Wong, Wing Kee and Tan, Ngan Meng and Lee, Beng Hai and Cheng, Jun and Wong, Tien Yin},
booktitle = {2010 Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC)},
pages = {3065--3068},
year = {2010},
doi = {10.1109/IEMBS.2010.5626137},
pmid = {21096798}
}
附录 K:缩写速查
| 缩写 | 全称 | 中文 |
|---|---|---|
| OD | Optic Disc | 视盘 |
| OC | Optic Cup | 视杯 |
| CDR | Cup-to-Disc Ratio | 杯盘比 |
| ISNT | Inferior > Superior > Nasal > Temporal | ISNT 规则 |
| RNFL | Retinal Nerve Fiber Layer | 视网膜神经纤维层 |
| PPA | Peripapillary Atrophy | 视盘周围萎缩 |
| DH | Disc Haemorrhage | 视盘出血 |
| CFP | Color Fundus Photography | 彩色眼底照相 |
| FOV | Field of View | 视场 |
| SiMES | Singapore Malay Eye Study | 新加坡马来裔眼病研究 |
| CERA | Center for Eye Research Australia | 澳大利亚眼科研究中心 |
| GT | Ground Truth | 金标准/真值 |
附录 L:本条目生产档案
| 项 | 值 |
|---|---|
| 代理名 | agent-a-origalight |
| 正选 slug | origa-light(备选:无) |
| 锁文件 | writing/origa-light/.lock(agent-a-origalight 2026-09-30T21:20) |
| 私有区 | .parts_agent-a-origalight_1790774428/ |
| slug 查重 | %origa% → 0 行(不撞库) |
| 抓取时点 | 2026-09-30 |
| 证据档 | writing/origa-light/FACTS.md |
附录 M:基于本数据集的研究检查清单(10 项)
- 声明使用的图数(650)与类别构成(168/482)。
- 声明 train/val/test 划分方式与随机种子(无官方 split)。
- 说明是否使用 OD/OC 掩码、边界格式如何解析。
- 分类任务声明 operating point 与所用指标(非仅 accuracy)。
- 若用结构字段,说明字段计数口径(13 项是否含元数据)。
- 报告类别不平衡处理方式。
- 若做跨数据集,说明 ORIGA-light 的角色(训练/验证/外部测试)。
- 引用主论文(EMBC 2010)与数据来源。
- 说明获取渠道(Zenodo 镜像)并核 MD5。
- 商用/再分发前注明许可双口径的评估结论。
附录 N:DAIMS 与 AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| 可发现(DOI/论文/平台) | ✔ | IEEE + PubMed + Zenodo DOI |
| 可获取(直链/无 gated) | ✔ | Zenodo 开放直链 |
| 可互操作(标准格式) | ◐ | 标准图像+标注,格式细节需实核 |
| 元数据充分 | ◐ | 规模/来源/字段齐,筛选规则等缺 |
| 可持续托管 | ✘ | 官方渠道失效,依赖社区镜像 |
| 许可明确 | ◐ | 双口径未完全澄清 |
条目维护提示:ORIGA-light 的核心风险点是"官方渠道失效 + 社区镜像依赖",若未来出现官方重新托管或镜像变更,§6 版本链与附录 I 双口径表需同步更新。数据规模(650=168+482)与队列数字(3,280)为稳定硬数字,可作为交叉核验锚点。
附录 O:CDR 计算几何说明
视盘/视杯分割的最直接下游产物是 CDR。其几何定义有多种口径,理解它们能避免"同一掩码算出不同 CDR"的困惑:
| CDR 口径 | 定义 | 特点 |
|---|---|---|
| 垂直 CDR | 视杯垂直径 / 视盘垂直径 | 临床上最常用,对青光眼更敏感 |
| 水平 CDR | 视杯水平径 / 视盘水平径 | 用于对照 |
| 面积 CDR | 视杯面积 / 视盘面积 | 由分割掩码直接可得,但对边界噪声敏感 |
| 等效径 CDR | 按面积换算等效圆直径之比 | 面积法的稳定化变体 |
ORIGA-light 的结构字段中 CDR 通常以垂直/水平口径记录。若使用者自行从 OD/OC 掩码反推 CDR,务必声明用的是哪一种口径——否则即使掩码一致,CDR 数值也可能不同。这也是"用分割反推 CDR"与"直接用 CDR 字段"两种路径可能给出不一致结果的原因。
附录 P:ISNT 规则判读的可计算化说明
ISNT 规则虽为定性顺序,但可被形式化为可计算判据,便于做自动判读:
- 由 OD/OC 掩码得到神经视网膜边缘区域(视盘减去视杯)。
- 以视盘中心为原点,把边缘区域按角度分区(下/上/鼻/颞四个象限,通常各以约 90° 扇区、避开血管进出区)。
- 计算各象限的边缘宽度代表值(如平均宽度或最小宽度)。
- 检查是否满足 Inferior > Superior > Nasal > Temporal。
形式化时的关键选择:分区角度边界、代表值取法(均值/中位/最小)、是否排除血管遮挡区。这些选择在不同实现中不同,会导致同一图分类结果不同。因此 ORIGA-light 的 ISNT 字段(专家判读)与程序化 ISNT 判读之间可能出现不一致,这属于方法差异而非标签错误。
附录 Q:图像质量与可分级性的使用建议
非散瞳眼底图质量波动大,ORIGA-light 为此提供了 Image Quality 与 Gradability 两个字段。建议用法:
| 场景 | 建议 |
|---|---|
| 训练分割/分类模型 | 优先使用高质/可分级图训练,低质图可作鲁棒性测试 |
| 质量感知建模 | 把质量字段作为辅助输出,训练质量预测分支 |
| 数据清洗 | 用 Gradability 过滤不可判读图,避免噪声监督 |
| 真实部署评估 | 保留低质图评估模型在退化条件下的表现 |
把质量字段用起来,是把"非散瞳图"这一潜在劣势转化为"鲁棒性评测资源"的关键。
附录 R:待核清单(下载实核后应更新的条目)
| 待核项 | 现状 | 实核方法 |
|---|---|---|
| 掩码完整度(650 张是否全含 OD/OC) | 未明示 | 解压 ORIGA.rar 统计 |
| 边界标注的精确格式 | 记为"ORIGA-GT 可查看/编辑" | 解压查看文件类型 |
| “light” 的筛选规则 | 未明示 | 查论文与历史文档 |
| 650 与队列完整图像数的关系 | 未明示 | 查 SiMES 队列论文 |
| 镜像上传者的再授权依据 | 未公开 | 查 Zenodo 元数据/联系上传者 |
| 字段取值的确切枚举 | 按临床惯例推 | 用 ORIGA-GT 查看 |
附录 S:常见误用模式(反例集)
| 误用 | 后果 | 正确做法 |
|---|---|---|
| 只报 accuracy | 多数类基线 74.2%,虚高 | 报 AUC + sensitivity/specificity |
| 把 3,280 当图片数 | 数字口径错误 | 3,280 是受试者数 |
| 直接拼跨论文分数 | 划分不同不可比 | 同源对比或自跑基线 |
| 把 DR 分级与 CDR 混用 | 语义错误 | 区分病变分级 vs 视盘结构 |
| 假设有官方 split | 复现不可比 | 自定划分并公开 |
| 断言"CC BY 4.0 即可商用" | 忽略双口径 | 评估镜像再授权合法性 |
附录 T:检索路径示范(关键词组合与查询式)
| 目标 | 查询式示例 |
|---|---|
| 本体论文 | "ORIGA(-light)" glaucoma retinal fundus database |
| 精确数据集名 | "ORIGA-light" optic disc cup segmentation |
| 镜像 | zenodo ORIGA REFUGE ACRIMA 10674885 |
| 队列来源 | "Singapore Malay Eye Study" SiMES glaucoma prevalence |
| 同类青光眼集 | REFUGE challenge optic disc cup CDR |
| 方法基线 | optic disc cup segmentation ORIGA-light U-Net |
| 结构字段 | ISNT rule CDR RNFL optic disc assessment |
附录 U:条目自评与维护触发点
| 触发点 | 应更新内容 |
|---|---|
| 官方重新托管 ORIGA-light | §6 版本链、附录 B 可持续性评分 |
| Zenodo 镜像变更/下架 | §6、坑 2、附录 I |
| 出现官方明确许可条款 | 坑 5、附录 H |
| 新的权威基准汇总 | §7.2、附录 C |
| 库内新增青光眼条目 | §8/§9 互链 |
| 下载实核完成 | 附录 R 各项 |
附录 V:给数据集综述作者的引用模板
撰写综述引用 ORIGA-light 时,建议采用如下结构化表述(避免笼统):
ORIGA-light(Zhang et al., EMBC 2010)是源自新加坡 SiMES 队列的 650 张非散瞳眼底图数据集(168 青光眼 + 482 正常),提供视盘/视杯边界标注与 13 项青光眼结构判读字段(CDR/ISNT/RNFL/PPA 等)。其原始发布渠道已失效,现行公开获取依赖 Zenodo 社区镜像(doi:10.5281/zenodo.10674885,CC BY 4.0)。该数据集无官方固定划分,跨研究报告的性能数字需绑定划分口径方能比较。
这段模板把"身份、规模、来源、标注、获取现状、划分警告"六要素一次说清,是最小充分引用。
附录 W:引文规范(BibTeX 与引用要点)
@inproceedings{zhang2010origa,
title = {ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research},
author = {Zhang, Zhuo and Yin, Feng Shou and Liu, Jiang and Wong, Wing Kee and Tan, Ngan Meng and Lee, Beng Hai and Cheng, Jun and Wong, Tien Yin},
booktitle = {2010 Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC)},
pages = {3065--3068},
year = {2010},
doi = {10.1109/IEMBS.2010.5626137},
pmid = {21096798}
}
引用要点:① 作者排序按原论文;② 页码 3065-3068;③ 会议名全称或规范缩写均可;④ 若引用镜像,另附 Zenodo DOI 10.5281/zenodo.10674885。
附录 X:本条目抓取时的核验快照(2026-09-30)
| 核验项 | 方法 | 结论 |
|---|---|---|
| slug 查重 | url_name ILIKE '%origa%' → 0 行 |
不撞库 |
| 官方原站 | 实抓 | 不可达(失效) |
| Zenodo 镜像 | 实抓 record 10674885 | 存在、CC BY 4.0、ORIGA.rar |
| 主论文 | IEEE/PubMed 记录 | DOI + PMID 确认 |
| 库内眼底条目 | 查 rid | refuge(62)/justraigs(746) 等,无同名 |
| 环境残留 | `ps aux \ | grep -c codebuddy` |
附录 Y:缩写与术语中英对照(补充)
| 术语 | 英文 | 说明 |
|---|---|---|
| 非散瞳 | non-mydriatic | 不滴散瞳药的眼底照相 |
| 杯盘比 | cup-to-disc ratio (CDR) | 视杯/视盘直径比 |
| 神经视网膜边缘 | neuroretinal rim | 视盘内视杯外的组织环 |
| 视盘周围萎缩 | peripapillary atrophy (PPA) | 视盘周围的视网膜/脉络膜萎缩 |
| 观察者间变异 | interobserver variability | 不同判读者结论差异 |
| 外部验证 | external validation | 用他源数据测试模型 |
| 泛化 | generalization | 跨数据分布的表现 |
| 分层划分 | stratified split | 保持类别比例的数据划分 |
附录 Z:结语
ORIGA-light 是一个"小而重要"的数据集。它不靠数据量取胜,而靠"最早把青光眼结构判读语言数字化并公开"确立了自己的坐标。对今天的开发者,它的三重价值依次是:结构字段支撑可解释的多任务研究、OD/OC 边界支撑分割基准、作为老数据集承载"渠道失效—社区镜像承接"的可获取性研究样本。理解它的双口径(名称、许可、字段计数、性能、划分)与遗留疑点,比记住任何单一数字都更重要。
附录 AA:ORIGA-light 与视盘/视杯分割方法演进细表
| 时期 | 代表方法族 | 对 ORIGA-light 的用法 | 关注指标 |
|---|---|---|---|
| 2010-2014 | 主动轮廓、水平集、图割 | 直接训练与评测 | 定位准确率、边界误差 |
| 2015-2018 | 全卷积网络(FCN/U-Net) | 训练分割 + 验证 | Dice、IoU |
| 2018-2021 | 注意力/多尺度/边界感知网络 | 验证集/外部测试 | Dice、ASSD |
| 2021-2024 | 自监督/半监督/多任务学习 | 小样本微调 + 泛化测试 | Dice、跨集泛化 |
| 2024- | 基础模型适配(SAM 类、眼科基础模型) | 零样本/少样本评测 | 跨集 Dice、鲁棒性 |
这张表的意义不在于穷举方法,而在于说明 ORIGA-light 的"角色漂移":同一数据集在十余年间从"训练主场"变为"泛化考场",其 650 张标注的价值因此历久弥新。
附录 AB:数据规模与队列数字的口径速查
| 数字 | 含义 | 常见误用 |
|---|---|---|
| 650 | ORIGA-light 图像数 | 误当受试者数 |
| 168 | 青光眼图像数 | — |
| 482 | 正常图像数 | — |
| 336 / 314 | 左眼 / 右眼图像数 | — |
| 3,280 | SiMES 参与受试者数 | 误当图像数 |
| 4,168 | SiMES 合格受试者基数 | — |
| 78.7% | 响应率 | — |
| 4.79% / 3.6% | 青光眼患病率(粗率/标化率) | 误当 ORIGA-light 正类比例 |
| 25.8% | ORIGA-light 正类占比(168/650) | 与患病率混淆 |
最关键的一条区分:ORIGA-light 的正类占比 25.8% ≠ SiMES 队列患病率 4.79%。前者是"筛选后的数据集构成",后者是"人群流行病学率"。数据集为了研究需要刻意富集了青光眼样本,因此正类比例远高于自然患病率。交叉引用这两个数字会造成严重误解。
附录 AC:为什么数据集正类会被富集
在人群筛查型队列中,青光眼患病率只有约 4-5%,若直接按自然比例抽样,650 张图里只有约 30 张青光眼——对训练分类器严重不足。因此 ORIGA-light 的构建逻辑极可能是"在保留部分正常对照的同时,纳入尽可能多的青光眼阳性样本",从而把正类比例提升到约 25.8%。
这一逻辑的推论:
- 数据集不是队列的无偏随机样本——不能直接用它估计人群患病率。
- 数据集是为算法研究设计的富集样本——适合训练/评测分类器,不适合流行病学推断。
- 使用者在做"模型在真实人群中的预期阳性率"外推时,必须做患病率校正(prevalence adjustment),否则会高估模型的阳性预测值。
这是 ORIGA-light 与所有"病例对照式富集"医学数据集共有的性质,也是从数据到临床部署之间最容易被忽略的一步。
附录 AD:跨数据集泛化的常见陷阱
用 ORIGA-light 做外部验证时,常见陷阱:
| 陷阱 | 说明 |
|---|---|
| 相机/成像差异 | ORIGA-light 来自特定非散瞳相机,他集可能是不同设备 |
| 人群差异 | 新加坡马来裔裔群,跨种族泛化未验证 |
| 标注体系差异 | 他集的 OD/OC 边界定义可能与 ORIGA-light 不同 |
| 预处理差异 | 裁剪、归一化、分辨率缩放不一致 |
| 标签定义差异 | "青光眼"的诊断标准(结构/功能/综合)可能不同 |
| 类别比例差异 | 他集正类比例不同,直接影响阈值选择 |
做外部验证时,建议报告"跨集 Dice 下降幅度"而非单一跨集分数,并把上述差异逐条讨论。
附录 AE:条目写作的口径纪律(自我约束)
本条目为保持与千方病案医数集其他条目一致的口径纪律,做了如下约束:
- 所有硬数字可溯源:650/168/482/336/314/3072×2048/3,280 等均有来源(附录 C)。
- 双口径必存照:名称、许可、字段计数、性能、划分、获取渠道六项(附录 I)。
- 不确定项不臆断:格式细节、筛选规则、掩码完整度等写成遗留疑点(附录 R),不编造。
- 不做单一 SOTA 断言:性能数字并列多源并声明不可对齐(§7.2)。
- 不越界使用库内其他条目:仅互链,不修改他条目。
附录 AF:与任务头纪律包的对应关系
| 任务头要求 | 本条目落实位置 |
|---|---|
| 开工三查(锁/临时文件唯一化/环境残留) | 附录 L + 汇报 |
| 存在性核验(三源互证) | §2/§5/§6 + 附录 C |
| slug 查重(只读) | 附录 X |
| 九节 FACTS | writing/origa-light/FACTS.md |
| 成稿 1200-1900 行 | 本文件 |
| 坑点 ≥5(目标 8) | §10(共 8 坑) |
| DAIMS 表 | 附录 B |
| cr:RecordSet 节点式 | frontmatter schema_org |
| title 带站点后缀 | frontmatter title |
附录 AG:常见问答补遗
ORIGA-light 与 ORIGA 能否互作为训练/测试集?
理论上可以(同为青光眼视盘结构域),但由于"light"筛选规则未明示,若两集合存在样本重叠,会造成数据泄漏。在未确认二者样本关系前,不建议把 ORIGA 训练 + ORIGA-light 测试当作严格的跨集验证。
能否用 ORIGA-light 训练、在 REFUGE 上测试?
可以,这是常见的跨集泛化设置。但需注意 REFUGE 的分辨率、相机、标注定义与 ORIGA-light 不同,且 REFUGE 含 CDR 标签口径需对齐。
ORIGA-light 的 CDR 字段是否可直接当回归目标?
可以,但需理解其口径(垂直/水平)与数值分布,并按 CDR 分箱报告误差,而非只报总体 MAE。
数据集的"正常"是否包含其他眼病?
标注体系以青光眼为核心,"正常"通常指无青光眼性视神经损害;是否排除了糖尿病视网膜病变等其他眼病,论文未逐条明示,使用者应留意(属遗留疑点)。
能否用于儿童/青少年?
源队列为 40-80 岁成人,不适用于儿童青光眼研究。
附录 AH:数据集卡(Dataset Card 式摘要)
名称: ORIGA-light (ORIGA(-light))
类型: 眼底图数据集(视盘/视杯分割 + 青光眼结构判读)
规模: 650 张(168 青光眼 / 482 正常);336 左 / 314 右
规格: 3072×2048 RGB,非散瞳,FOV≈45°
来源: 新加坡 SiMES 队列(3,280 受试者,2004-2007,40-80 岁)
标注: OD/OC 边界 + 13 项结构字段(CDR/ISNT/RNFL/Notch/DH/PPA 等)
工具: ORIGA-GT(CERA 协议)
任务: 分割 / CDR 回归 / 青光眼分类 / ISNT 判读 / 结构多任务
划分: 无官方固定划分(文献 8:2 或 7:3)
获取: Zenodo 10.5281/zenodo.10674885(ORIGA.rar ≈475 MB)
许可: 原始 academic-use 声明;镜像 CC BY 4.0(双口径)
论文: EMBC 2010;2010:3065-3068, doi:10.1109/IEMBS.2010.5626137, PMID 21096798
互链: REFUGE(62) 首要 / JustRAIGS(746) 次之 / DR 系列互补
附录 AI:维护与版本记录
| 版本 | 日期 | 变更 |
|---|---|---|
| v1.0 | 2026-09-30 | 首版建档(agent-a-origalight) |
维护责任:千方病案医数集医学编辑部;触发更新条件见附录 U。
附录 AJ:写给使用者的一句话
如果你只从本条记住一件事,请记住这个:ORIGA-light 的"650"是富集后的图像数,不是人群比例;它的"CC BY 4.0"来自社区镜像,不是原始发布;它没有官方 test split——引用它之前,先把这三件事说清楚。
附录 AK:术语判读示例(CDR 与 ISNT 的组合逻辑)
为帮助使用者理解 13 项字段如何协同,举三个典型组合:
| 组合画像 | CDR | ISNT | RNFL | 判读倾向 |
|---|---|---|---|---|
| 典型正常 | 小 | 合规 | 无缺损 | 正常 |
| 数值型可疑 | 大 | 合规 | 无缺损 | 需结合视盘大小判断(大视盘生理性 CDR 大) |
| 规则破坏型 | 不大 | 违规(下方最窄) | 可能缺损 | 倾向青光眼 |
| 多征象型 | 大 | 违规 | 有缺损 + Notch | 高度提示青光眼 |
这个示例说明:单一字段不足以判读,字段组合才有诊断意义。这也是 ORIGA-light 提供多字段而非单一标签的价值所在——它允许研究者构建"多字段联合"的判读模型,而不是把复杂的临床推理压缩成一个二值标签。
附录 AL:数据使用的最小合规声明模板
使用 ORIGA-light 发表研究时,建议在方法或数据可用性节包含如下声明:
本研究使用 ORIGA-light 数据集(Zhang et al., EMBC 2010;doi:10.1109/IEMBS.2010.5626137),经 Zenodo 镜像(doi:10.5281/zenodo.10674885)获取,镜像标注许可为 CC BY 4.0。原始发布渠道已失效,本研究按镜像口径使用并引用原论文。数据集无官方固定训练/测试划分,本研究采用 [X:Y] 分层划分(随机种子 [seed]),划分清单见 [补充材料]。数据源自新加坡 SiMES 队列,人群为 40-80 岁马来裔成人,跨人群泛化性未经验证。
这段模板把引用、获取、许可、划分、人群局限五项一次说清,可直接复用。
附录 AM:结语补遗与致谢
ORIGA-light 作为千方病案医数集"青光眼结构判读"条目之一,其建档目标不是复述一篇 2010 年的会议论文,而是把这份数据集的可用性事实(规模、标注、获取、许可、局限)结构化地呈现给今天的使用者。十余年过去,数据集的原始渠道已经消失,但它承载的结构判读语言(CDR/ISNT/RNFL/PPA)仍是青光眼 AI 的基础词汇。本条目力求让这份"地层标本"在新一代研究中继续可被准确引用与合法使用。
附录 AN:ORIGA-light 相关研究主题图谱(12 类常见选题)
为帮助研究者快速定位"用 ORIGA-light 能做什么",把常见选题归纳为 12 类:
| # | 选题 | 输入 | 输出 | 典型指标 |
|---|---|---|---|---|
| 1 | 视盘分割 | 眼底图 | OD 掩码 | Dice/IoU |
| 2 | 视杯分割 | 眼底图 | OC 掩码 | Dice/IoU |
| 3 | 联合 OD/OC 分割 | 眼底图 | 双掩码 | 平均 Dice |
| 4 | CDR 回归 | 眼底图/掩码 | CDR 值 | MAE/RMSE |
| 5 | CDR 分类 | 眼底图/掩码 | CDR 分箱 | 准确率/κ |
| 6 | 青光眼二分类 | 眼底图 | 青/正 | AUC/F1 |
| 7 | ISNT 判读 | 掩码/图 | 合规/违规 | 准确率 |
| 8 | RNFL 缺损检测 | 眼底图 | 有/无 | AUC |
| 9 | 视盘出血检测 | 眼底图 | 有/无 | AUC |
| 10 | PPA 检测 | 眼底图 | 有/无 | AUC |
| 11 | 多任务联合 | 眼底图 | 多字段 | 分项指标 |
| 12 | 跨集泛化 | 他集训练 | ORIGA-light 测试 | 跨集差值 |
这 12 类选题的共同点是:它们都直接映射到 ORIGA-light 的某个标注维度,无需自造标签。这正是"标注充分"的数据集给研究带来的效率红利。
附录 AO:视盘/视杯分割的失败模式清单
在 ORIGA-light 上训练分割模型时,常见失败模式(供调试参考):
| 失败模式 | 表现 | 成因 | 缓解 |
|---|---|---|---|
| 视杯边界糊 | OC Dice 明显低于 OD | 视杯无明确解剖边界 | 边界感知损失、多尺度 |
| 血管干扰 | 视盘内血管被误分为视杯 | 血管遮挡 | 血管掩码辅助、注意力 |
| 光照不均 | 暗区漏检 | 非散瞳光照梯度 | 光照归一化、颜色校正 |
| 视盘 ROI 偏移 | 整体偏移 | 未裁剪 ROI | 先定位后分割 |
| 大视盘过分割 | 大视盘溢出 | 尺度变化 | 多尺度训练 |
| 青光眼视杯欠分割 | 大 CDR 被低估 | 训练集正类少 | 加权损失 |
这份清单说明:ORIGA-light 虽是"经典易用"的数据集,但非散瞳图的成像特性决定了它有具体的技术挑战,而非"随便跑跑就 SOTA"。
附录 AP:与库内数据集的组合使用矩阵
研究者常把多个眼底数据集组合使用,下表给出 ORIGA-light 与库内条目的组合建议:
| 组合 | 用途 | 注意 |
|---|---|---|
| ORIGA-light + REFUGE(62) | 青光眼分割跨集训练/验证 | 分辨率与标注定义需对齐 |
| ORIGA-light + DRISHTI-GS 类 | 扩大 OD/OC 训练样本 | 同任务、不同来源 |
| ORIGA-light + JustRAIGS(746) | 小样本微调 + 大规模预训练 | 量级差异大 |
| ORIGA-light + messidor(59)/idrid(191) | 青光眼+糖网多病种 | 标注体系不同,勿混用标签 |
| ORIGA-light + rfmid(271)/odir(63) | 多病种分类中的青光眼子任务 | 标签粒度不同 |
组合使用的核心原则是:任务相同才联合训练,任务不同只做多任务输出。把 ORIGA-light 的 CDR 标签与 DR 的病变分级硬拼成单一目标,是常见的错误。
附录 AQ:ORIGA-light 在"数据集金字塔"中的位置
眼科公开数据集可以粗略分为三层金字塔:
| 层级 | 特征 | 代表 | ORIGA-light 位置 |
|---|---|---|---|
| 大规模预训练层 | 十万级图像、粗标签 | EyePACS(58)、JustRAIGS(746) | 不属于 |
| 中等规模训练层 | 千级图像、中等标签 | messidor(59)、REFUGE(62)、DDR(201) | 边缘(650 偏小) |
| 小规模精标层 | 百级图像、精细标签 | ORIGA-light(650)、IDRiD(191) | 属于 |
ORIGA-light 位于"小规模精标层":其优势是标注精细(OD/OC 边界 + 13 字段),劣势是规模小。在"预训练 + 微调"范式下,它最适合作为精标微调集或外部验证集,而非从零训练集。这是它在数据集金字塔中最合理的使用定位。
附录 AR:一句话回应"为什么不用更新的数据集"
常见质疑:“既然有了 REFUGE、JustRAIGS,为什么还收录 ORIGA-light?”
三点回应:
- 历史引用的必要性:大量 2010-2020 年的青光眼影像论文以 ORIGA-light 为主基准,引用链不能断,新条目无法替代旧引用的索引功能。
- 结构字段的稀缺性:REFUGE 侧重分割+CDR,JustRAIGS 侧重转诊标签;ORIGA-light 的 13 项结构字段(ISNT/Notch/DH/PPA)覆盖面在库内仍属独特。
- 可获取性研究的样本价值:ORIGA-light 是"官方渠道失效—社区镜像承接"的典型案例,对研究数据集可持续性问题有独立价值。
收录老数据集不等于推荐只用老数据集,而是保证引用体系的完整性与可追溯性。
附录 AS:条目质量自检对照(check_md 与 preflight 项)
| 检查项 | 要求 | 本条目 |
|---|---|---|
| 行数 | 1200-1900(目标 1400-1700) | 见汇报指纹 |
| frontmatter 字段 | title/subtitle/description/schema_org/category_tags/data_tags/patient_count/data_source | ✔ |
| schema_org 节点 | MedicalWebPage/Dataset/cr:RecordSet/rai:dataLimitations | ✔ |
| 章节 §0-§10 | 齐备 | ✔ |
| 坑点 | ≥6(目标 8) | 8 |
| DAIMS | 存在 | ✔(附录 B) |
| category_tags | 词表内、2-6 个、≤100 字符 | ✔(6 个) |
| G3 纯净度 | 无注释/占位/TODO/未定稿字样 | ✔ |
| 代码块配对 | 偶数围栏 | ✔ |
| 锚点唯一/重复标题 | 无冲突 | ✔(preflight 0/0) |
附录 AT:ORIGA-light 标注流程复原(据协议与工具推断)
论文未逐步公开标注流程,但据 CERA 协议与 ORIGA-GT 工具可复原出合理的操作序列,供使用者理解标签来源:
- 图像分级:眼科判读者先判断图像是否可分级(Gradability)。不可分级图不入库或不参与判读。
- 质量评级:对可分级图给出 Image Quality 等级。
- 视盘/视杯勾画:在 ORIGA-GT 中勾画 OD/OC 边界,形成边界标注。
- CDR 计算/记录:依勾画边界记录(或计算)垂直/水平 CDR。
- 结构征象判读:逐项判断 ISNT 合规、RNFL 缺损、Notch、DH、Alpha/Beta PPA。
- 元数据登记:记录 Laterality、Field、Disc Size、Disc Tilting Ratio。
- 备注:Comments 栏记录特殊情况。
这一序列的关键含义是:OD/OC 边界与结构字段出自同一次判读会话,因此二者在语义上自洽(比如 CDR 与勾画边界一致)。使用者若只用掩码而不用字段(或反之),相当于丢掉了同一判读的另一半信息。
附录 AU:为什么"非散瞳"是数据集的重要属性
眼底照相有散瞳(mydriatic)与非散瞳(non-mydriatic)两种。ORIGA-light 采用非散瞳,这一点影响深远:
| 维度 | 非散瞳 | 散瞳 |
|---|---|---|
| 使用场景 | 筛查、基层、快速 | 专科、精细诊断 |
| 成像质量 | 波动大、易受瞳孔小/介质混浊影响 | 稳定、视场大 |
| 患者体验 | 无药物、即拍即走 | 需滴药、有禁忌 |
| 对算法要求 | 需鲁棒于质量波动 | 相对稳定 |
ORIGA-light 选择非散瞳,使它与筛查部署场景更贴近:真实筛查里不可能人人散瞳。因此在该数据集上训练/评测的模型,天然更接近筛查落地条件。这也是它虽有质量波动、却比散瞳数据集更具部署参考价值的原因。相应地,图像质量与可分级性字段的存在,正是为应对非散瞳的质量方差。
附录 AV:SiMES 队列背景补充
Singapore Malay Eye Study(SiMES)是新加坡三大族群眼病研究之一(另为华裔 SiNES 类、印度裔 SINDI 类),聚焦马来裔人群的眼病流行病学。其意义:
- 人群代表性:东南亚马来裔人群在眼病流行病学中的代表性此前较弱,SiMES 补齐了这一块。
- 标准化检查:队列采用标准化检查流程,眼底照相、视力、屈光、眼压等系统采集,为影像数据集提供了可靠来源。
- 多病种数据:队列不仅用于青光眼,也用于糖网、白内障等研究,因此 ORIGA-light 只是其影像分支之一。
对 ORIGA-light 使用者的含义:数据集的人群层面信息(族群、年龄、地域)来自 SiMES 设计,跨人群泛化时必须回到这些背景来讨论。
附录 AW:数据集命名与检索的进一步说明
"ORIGA"一词的来源未在论文中详细解释,社区通常将其理解为与"ORIGA"项目名相关。围绕命名,检索时需注意:
- 大小写:官方多写 ORIGA(全大写),检索时注意平台大小写敏感性(多数不敏感)。
- 连字符:ORIGA-light 含连字符,去掉连字符会命中其他内容。
- 括号:标题中的 “(-light)” 在多数检索系统中需处理为 “ORIGA” 或 “ORIGA-light”。
- 中文检索:中文文献多译"ORIGA 数据集"或"ORIGA-light 数据集",检索中文时结合"青光眼 视盘 分割"。
- 易混:与"ORIGA"同名的非医学项目(如某些厂商/软件)可能在通用检索中干扰,需用 “fundus” 或 “glaucoma” 限定。
附录 AX:与 REFUGE 的详细对照
REFUGE 与 ORIGA-light 是库内最相关的两个青光眼数据集,详细对照如下:
| 维度 | ORIGA-light | REFUGE |
|---|---|---|
| 发布年份 | 2010 | 2020(MICCAI 挑战赛) |
| 规模 | 650 图 | 1,200 图(训练 400/验证 400/测试 400) |
| 来源 | 新加坡 SiMES | 多中心(含中国、波兰等) |
| 任务 | OD/OC 分割 + 青光眼分类 + CDR | OD/OC 分割 + 青光眼分类 + CDR |
| 官方划分 | 无 | 有(挑战赛固定划分) |
| 结构字段 | 13 项(含 ISNT/RNFL/PPA) | 以分割+CDR+分类为主 |
| 获取 | Zenodo 镜像 | 官方挑战赛页面/镜像 |
| 库内 rid | 本条 | 62 |
对照结论:REFUGE 在"标准化划分、规模、多中心"上全面升级,ORIGA-light 在"结构字段丰富度、历史地位"上独特。二者互补,非替代关系。
附录 AY:青光眼 AI 的临床落地背景
ORIGA-light 服务的青光眼 AI,其临床落地背景值得一提(帮助理解数据集为何重要):
- 青光眼是不可逆致盲主因之一:早期无症状,晚期不可逆,因此早筛是核心。
- 筛查瓶颈在眼科医生:人群基数大、专科医生少,自动化筛查价值高。
- 结构判读是关键环节:眼底照相是最易获取的筛查手段,视盘判读是核心。
- 数据是瓶颈:高质量、带结构判读的公开眼底数据稀缺——ORIGA-light 正是在这一背景下产生。
因此 ORIGA-light 的意义不止于"一个数据集",而在于它是"用 AI 缓解青光眼筛查人力瓶颈"这一目标的早期数据基础设施。
附录 AZ:条目索引与交叉引用表
| 本条目位置 | 主题 | 相关库内条目 |
|---|---|---|
| §2.5 / §9 | 眼底数据集景观 | refuge(62)/justraigs(746)/DR 系列 |
| §3 | 新加坡眼科 AI 传统 | refuge(62) |
| §4 | 青光眼结构字段 | refuge(62) |
| §6 | 获取与许可 | 各条目获取方式对照 |
| §7 | 评测基准 | refuge(62) |
| 附录 AX | REFUGE 详细对照 | refuge(62) |
附录 BA:FAQ 补充(10 问)
Q29:ORIGA-light 的图像是否含患者隐私信息?
数据集为去标识化(de-identified)图像,不含直接身份信息。
Q30:能否用于非青光眼研究?
图像本身可做通用眼底研究(如血管、亮度分析),但标注仅覆盖青光眼结构。
Q31:CDR 字段是连续值还是分级?
以连续/半连续记录为主,可按需分箱。
Q32:ISNT 是二值还是四类?
通常为合规/不合规的二值判读,但其推导依赖四象限宽度。
Q33:数据集是否含双眼配对?
含左右眼图像,但论文未明示是否保留同一个体的双眼配对关系,使用前需确认(遗留疑点)。
Q34:是否支持多标签?
结构字段天然构成多标签空间,可做多标签学习。
Q35:图像是否统一裁剪到视盘?
未明示,通常为整幅眼底图,使用者可自行裁剪 ROI。
Q36:能否用 SAM 之类基础模型直接分割?
可作为零样本基线,但仍建议在 ORIGA-light 上微调以对齐 OD/OC 定义。
Q37:如何报告跨集结果?
报告"在 ORIGA-light 上的 Dice 相较训练集下降 X",并讨论成像/人群差异。
Q38:Zenodo 下载慢怎么办?
可尝试镜像加速或分块下载,务必核 MD5 确认完整性。
附录 BB:数据完整性校验建议
下载 ORIGA.rar 后建议进行的校验:
| 校验项 | 方法 |
|---|---|
| 文件完整性 | 核 MD5 = 308b66f83325a18da09504a3b6c1c5cd |
| 解压成功 | 用 rar 兼容工具解压 |
| 图像计数 | 统计图像文件数是否与文献 650 一致 |
| 标注配对 | 检查每图是否有对应边界/字段 |
| 标签分布 | 统计青光眼/正常比例是否接近 168/482 |
若实际计数与文献不符,属"下载实核后应更新的条目"(附录 R),应在使用前澄清。
附录 BC:结语(二)
数据集的生命周期往往长于其发布渠道。ORIGA-light 的原始官网已经消失,但它的 650 张图、13 项结构字段与 OD/OC 边界仍在 Zenodo 镜像中流通,仍在被新一代青光眼 AI 论文引用。这提醒我们:数据的价值在于内容,而内容的存续依赖托管。本条目的建档,既是对一份经典数据集的记录,也是对"数据可持续性"这一 AI-Ready 核心命题的一次具体呈现。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- riga — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 评测基准 / 图像分类
- g1020 — 共享标签:眼科影像 / 医学图像分割 / 青光眼 / 评测基准 / 图像分类
- drions-db — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 评测基准
- justraigs — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准 / 图像分类
- refuge2 — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 图像分类
- acrima — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准 / 图像分类
- refuge — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼
- oimhs — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类
- papila — 共享标签:眼科影像 / 医学图像分割 / 青光眼 / 图像分类
- gamma — 共享标签:医学影像 / 眼科影像 / 青光眼
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

