ORIGA-light (origa-light) — 新加坡 SiMES 队列 650 张眼底图的视盘/视杯分割与青光眼判读基准 — AI-Ready Wikipedia

史上最早规模化公开的眼底视盘/视杯逐像素分割集:650 张非散瞳彩色眼底图(168 青光眼 + 482 正常),源自新加坡马来裔人群队列 SiMES,附 CDR/ISNT/RNFL 等 13 项专家结构判读标签,现由 Zenodo 社区镜像以 CC BY 4.0 承接发布

来源 新加坡 SiMES(Singapore Malay Eye Study)队列非散瞳彩色眼底照相(Canon CR-DGi,视场约 45°,3072×2048 RGB),附眼科专家按 CERA 协议经 ORIGA-GT 工具标注的视盘/视杯边界与 13 项结构判读字段;现行打包于 Zenodo 10.5281/zenodo.10674885(ORIGA.rar 约 475 MB)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 7
ORIGA-light (origa-light) — 新加坡 SiMES 队列 650 张眼底图的视盘/视杯分割与青光眼判读基准 — AI-Ready Wikipedia

信息速览

数据集名称ORIGA-light (origa-light) — 新加坡 SiMES 队列 650 张眼底图的视盘/视杯分割与青光眼判读基准 — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模650 张眼底图(168 青光眼 + 482 正常),源自 SiMES 队列 3,280 名受试者;公开子集为去标识化图像级计数,无逐受试者明细
接入方式新加坡 SiMES(Singapore Malay Eye Study)队列非散瞳彩色眼底照相(Canon CR-DGi,视场约 45°,3072×2048 RGB),附眼科专家按 CERA 协议经 ORIGA-GT 工具标注的视盘/视杯边界与 13 项结构判读字段;现行打包于 Zenodo 10.5281/zenodo.10674885(ORIGA.rar 约 475 MB)
AI 就绪度

INFOBOX — ORIGA-light 一屏速览

维度 内容
本质 史上最早规模化公开的眼底视盘/视杯逐像素分割 + 青光眼结构判读数据集
全称 ORIGA(-light) = An Online Retinal Fundus Image Database for Glaucoma Analysis and Research
团队 新加坡 A*STAR I2R(主研)+ SERI/SNEC + NUS;核心作者 Jiang Liu、Tien Yin Wong
论文 EMBC 2010;2010:3065-3068(doi:10.1109/IEMBS.2010.5626137;PMID 21096798)
数据 650 张非散瞳彩色眼底图,3072×2048 RGB,视场约 45°
标签 168 青光眼 + 482 正常(正类 ≈25.8%);眼别 336 左 + 314 右
队列 新加坡 SiMES(Malay Eye Study)队列,2004-2007,40-80 岁,3,280 名受试者
标注 13 项结构字段(CDR/ISNT/RNFL/Notch/DH/PPA 等),CERA 协议 + ORIGA-GT 工具
任务 视盘/视杯分割、CDR 定量、青光眼二分类、ISNT 规则判读
性能 分类准确率约 93.5%(单源);分割 Dice/准确率 88.5%-98.9%(多源,口径不可对齐)
获取 原官网已失效;现 Zenodo 10.5281/zenodo.10674885(ORIGA.rar ≈475 MB)
许可 原始 academic-use 声明|Zenodo 镜像 CC BY 4.0(双口径,见坑 5)
库内互链 refuge(62) 首要、justraigs(746) 次之,及 messidor(59)/ddr(201)/idrid(191) 等 DR 系列

ORIGA-light 是眼科影像 AI 的一块"地层标本":它早在 2010 年就把 650 张眼底图从"医生看一眼给个诊断"推进到"逐像素勾勒视盘与视杯边界、逐项登记 13 个结构判读字段",是视盘/视杯分割任务沿用至今的公开评测集之一。它的 650 张图不是从零采集,而是从新加坡马来裔眼病研究(SiMES)队列的 3,280 名受试者中筛选而来——一半以上的青光眼诊断价值,藏在那些描述杯盘比、ISNT 规则、神经纤维层缺损的字段里,而不是藏在文件名中。

导语读法三则:

  1. 只想下数据:直奔 §6——原官网已失效,唯一可公开下载的入口是 Zenodo 镜像(ORIGA.rar),先读坑 5 弄懂许可双口径。
  2. 关心标签能做什么:直奔 §4 与 §5——13 项结构字段是它区别于普通"青光眼/非青光眼"二分类集的核心资产。
  3. 做视盘/视杯分割基准:直奔 §7——注意它没有官方固定划分,任何横向比较前先对齐 train/val/test 口径(坑 4)。

§0 导读:这个数据集解决什么问题

青光眼的诊断在结构层面高度依赖对视盘(optic disc, OD)与视杯(optic cup, OC)形态的判读:杯盘比(cup-to-disc ratio, CDR)增大、ISNT 规则被破坏、神经纤维层(RNFL)出现缺损、视盘出血、视盘周围萎缩(PPA)等,都是青光眼性视神经损害的经典征象。但在 2010 年前后,阻碍自动化研究落地的并不是算法,而是数据:公开可用的眼底图要么只给一个粗标签,要么视盘/视杯边界不可得,要么缺乏可供定量验证的结构字段。

ORIGA-light 的回答是把"临床判读表"整体数字化。它提供 650 张来自真实人群队列的非散瞳彩色眼底图,并为每张图配上:(1) 视盘与视杯的边界标注,可直接用于分割任务;(2) 由眼科专家按 CERA 分级协议、经 ORIGA-GT 工具登记的 13 项诊断相关结构字段,覆盖 CDR、ISNT 合规、RNFL、切迹、视盘出血、Alpha/Beta 区 PPA 等。这意味着同一套数据可以同时支撑两类研究:分割(像素级边界)与判读(结构字段级分类/回归)。

§0 读法三则:

  1. 这个条目是"数据集 + 队列论文 + 评测基准"三合一:本体是 650 张带边界与判读标签的眼底图,来源是 SiMES 队列论文,衍生用法是视盘/视杯分割与青光眼判读的公开基准——三者口径不同(§2、§4、§7)。
  2. 全文所有硬数字均出自主论文与 SiMES 队列论文;凡有双口径冲突处(名称、许可、字段计数、性能、划分)均在坑点或存照节逐条标注。
  3. 检索时若只写"ORIGA"会与"ORIGA-light"混用,若写"ORIGA dataset"可能命中非眼底数据集——用精确短语并核对 DOI(坑 1)。

§1 数据集速览:十问十答

Q1:ORIGA-light 是什么、名字怎么理解?
它是一套面向青光眼分析的眼底图公开数据库。官方标题写作 “ORIGA(-light)”,正文名 “ORIGA-light”,社区文献常简称 “ORIGA”。括号里的 light 通常被理解为"公开的精选子集口径"(去除了部分样本),但具体去除了哪些样本,论文未明示(见 §9 遗留疑点)。

Q2:多少张图、怎么分类?
共 650 张非散瞳(non-mydriatic)彩色眼底图,标签为 168 张青光眼 + 482 张正常,青光眼占比约 25.8%。眼别分布为 336 张左眼 + 314 张右眼,基本均衡。

Q3:图像规格如何?
3072 × 2048 像素 RGB 彩色,视场约 45°,由非散瞳眼底相机采集(SiMES 队列标准设备口径)。图像均为去标识化的真实临床眼底照相,而非合成或增强图像。

Q4:数据来自哪里?
来自新加坡 SiMES(Singapore Malay Eye Study) 人群队列——2004-2007 年对 40-80 岁新加坡马来裔人群的眼病流行病学研究,队列共 3,280 名受试者(响应率 78.7%)。ORIGA-light 是其中可分级、结论明确的子集。

Q5:每张图带哪些标注?
两类:一是视盘与视杯的边界标注(可导出为分割掩码);二是按 CERA「Assessment of Glaucomatous Optic Disk Signs」协议采集的 13 项诊断相关结构字段——眼别、图像质量、可分级性、Field、视盘大小、视盘倾斜比、CDR、ISNT 规则合规、RNFL 缺损、切迹、视盘出血、Alpha PPA、Beta PPA(另有备注栏)。

Q6:标注用的什么工具?
随数据集一同发布的 ORIGA-GT(ORIGA Ground Truth)标注/查看工具,其字段设计依据 CERA 的分级协议。

Q7:能拿来做什么任务?
至少四类:① 视盘/视杯逐像素分割;② 杯盘比(CDR)回归或分类;③ 青光眼 vs 正常的二分类;④ ISNT 规则合规性判读。这也是它比单一标签眼底集更"AI-Ready"的地方。

Q8:性能基准是多少?
多源口径不一:有研究报告青光眼分类准确率约 93.5%;也有方法论文报告 ORIGA-light 分割 Dice/准确率落在 88.5%-98.9% 区间,另有技术对比表给分割 sensitivity 77.5%-95%。这些数字来自不同论文、不同划分,不可横向对齐(坑 4)。

Q9:现在在哪里能下到?
原始发布官网(I2R/NTU 项目页)已下线、2026-09 实抓不可达。现行可公开下载的入口是 Zenodo record 10.5281/zenodo.10674885(v1,2024-02-18 发布),其中 ORIGA.rar 约 475 MB,与 REFUGE、ACRIMA 同包发布,页面标注 CC BY 4.0。

Q10:为什么它对 AI-Ready 重要?
它是青光眼结构判读方向的奠基性公开集:最早的规模化视盘/视杯分割标注来源之一,且附带 13 项结构字段而非单一标签。它与库内 REFUGE(62)、JustRAIGS(746) 共同构成"青光眼结构判读"的纵向谱系,与 DR 分级系列(messidor/ddr/idrid 等)横向互补。它的最大缺项是官方渠道失效、依赖社区镜像——这既是 AI-Ready 的减分项,也是条目必须存照的核心事实。

§2 数据构成与规格

2.1 规模、来源与基本构成

ORIGA-light 的 650 张图全部来自新加坡 SiMES 队列,构成如下:

维度 数值 占比 / 说明
总量 650 张 100%
青光眼(glaucoma) 168 张 25.8%
正常(normal) 482 张 74.2%
左眼(left) 336 张 51.7%
右眼(right) 314 张 48.3%
分辨率 3072 × 2048 px RGB 彩色
采集方式 非散瞳(non-mydriatic) 视场约 45°

眼别基本均衡(336:314 ≈ 1.07:1),这一点的意义在于:使用者在做左右眼对称性分析或需要区分眼别建模时,不必担心某一侧样本被系统性欠采样。相比之下,类别分布并不均衡——青光眼与正常约为 1:2.87,正类占比约四分之一。对分类任务而言这是一个中等程度的类别不平衡:直接用 accuracy 作为主指标会产生误导(多数类基线就有 74.2%),应改用 AUC、sensitivity/specificity 或 F1。

2.2 图像规格与采集条件

属性 规格
模态 彩色眼底照相(color fundus photography, CFP)
分辨率 3072 × 2048 像素
色彩 RGB(三通道)
视场(FOV) 约 45°
散瞳状态 非散瞳(non-mydriatic)
相机 SiMES 队列标准非散瞳眼底相机口径(Canon CR-DGi 类)
去标识 已去标识化(de-identified)

"非散瞳"这一点值得单列:非散瞳眼底照相在人群筛查场景中更接近真实部署条件(无需滴散瞳药、可快速拍摄),但图像质量方差通常大于散瞳图。ORIGA-light 保留了"图像质量"与"可分级性"作为独立标注字段(§4),正是对非散瞳图质量波动的显式处理——使用者在建立质量过滤策略时可直接用这两个字段,而不必自己造一个质量打分器。

2.3 队列来源:SiMES 的三层数字

ORIGA-light 的数字链要从 SiMES 队列说起,因为"650"只是"3,280"的子集:

层级 数字 口径
合格人群 4,168 人 SiMES 队列设计的合格受试者基数
实际参与 3,280 人 参与检查的受试者(响应率 78.7%)
青光眼患病率 粗率 4.79% / 年龄标化率 3.6% 队列论文口径
公开子集 650 张图 ORIGA-light 图像级计数

需要强调的是:650 是图像数,3,280 是受试者数,两者不同量纲。SiMES 队列采集的眼底图总数远大于 650;ORIGA-light 是从中筛选出"可分级 + 结论明确"的部分公开。公开子集与完整队列的精确关系(去除了多少张、按什么规则去除)论文未给逐条说明,这是本条目明确标注的遗留疑点(§9)。

2.4 类别不平衡的实际影响

168:482 的分布对三类使用场景的含义各不相同:

  1. 分类任务:正类约 25.8%,属于中等不平衡,建议使用加权损失或在指标上以 AUC 为主;若做阈值敏感的青光眼筛查(高 sensitivity 优先),需明确报告 operating point。
  2. 分割任务:类别不平衡对分割影响较小(分割关注视盘/视杯区域本身),但需注意青光眼图的视杯相对视盘更大(CDR 更高),分割模型若对视杯边界不敏感会在正类上系统性偏差。
  3. CDR 回归:正常图 CDR 集中在小值区、青光眼图 CDR 分布更宽,回归目标本身存在分布右偏,评估时应按 CDR 分箱报告而非只报总体 MAE。

2.5 与同类眼底数据集的构成对照

数据集 库内 rid 主定位 规模 与 ORIGA-light 的关系
ORIGA-light 本条 视盘/视杯分割 + 青光眼结构判读 650 图 本体
REFUGE 62 青光眼视盘/视杯分割 + CDR 1,200 图 任务高度重叠,首要互链
JustRAIGS 746 青光眼转诊 AI(视杯/视盘) 逾 10 万图 青光眼域,规模量级不同
messidor 59 糖网分级 1,200 图 DR 域,与青光眼互补
ddr 201 糖网分级 逾 1.3 万图 DR 域
idrid 191 糖网分级 516 图 DR 域
deepdrid 211 糖网分级 3,662 图 DR 域
eyepacs 58 糖网分级 逾 8.8 万图 DR 域
fgadr 221 细粒度糖网 2,000 图 DR 域
rfmid 271 多病种眼底分类 3,200 图 含青光眼标签
odir 63 多病种眼底分类 8,000 图 含青光眼标签
fives 741 眼底多任务(含血管) 800 图 结构分割方向部分重叠

这张对照表的结论是:库内眼底条目绝大多数是糖尿病视网膜病变(DR)分级/病变检测方向,ORIGA-light 与 REFUGE(62) 是仅有的两个以青光眼视盘/视杯结构为核心定位的条目。ORIGA-light 的独特价值因此在于它是这一方向的最早公开来源,而 REFUGE 是其多年后的"接棒者"。

2.6 数据文件的组织与形态

ORIGA-light 的原始发布形态为:每张眼底图配一份边界标注与一份结构字段记录。Zenodo 镜像将这些内容打包为 ORIGA.rar(约 475 MB)。使用者下载后通常得到:

  1. 图像文件(眼底图本体,命名通常含编号);
  2. 视盘/视杯边界数据(坐标系与该图对齐,可渲染为轮廓或多边形);
  3. 结构判读字段表(13 项字段 + 备注)。

边界数据的具体格式(点集/多边形/掩码坐标)因发布形态而略有差异,本条目按文献与工具描述记为"可由 ORIGA-GT 查看/编辑的边界标注",实际格式以下载包为准(§9 遗留疑点)。

§3 机构与人物

3.1 开发机构

机构 角色
A*STAR Institute for Infocomm Research (I2R),新加坡 主要研发机构(数据集构建与算法方向)
Singapore Eye Research Institute (SERI) / Singapore National Eye Centre (SNEC) 临床分级与队列来源
National University of Singapore (NUS) 合作单位
SiMES 队列方(Singapore Ministry of Health / NMRC 资助) 数据来源人群队列

A*STAR(Agency for Science, Technology and Research)是新加坡国家级科研机构,I2R 是其中的资讯通信研究院。ORIGA-light 由 I2R 主导构建,并由 SERI 提供临床分级支持——这种"工程机构 + 眼科临床机构"的组合,是新加坡后续一系列眼科 AI 数据集的模板(ORIGA→REFUGE→后续 SiMES 衍生工作)。

3.2 作者与分工

主论文作者列表(EMBC 2010):Zhuo Zhang、Feng Shou Yin、Jiang Liu、Wing Kee Wong、Ngan Meng Tan、Beng Hai Lee、Jun Cheng(均属 I2R 方向)、Tien Yin Wong(SERI/NUS,临床眼科方向)。

人物 方向 备注
Jiang Liu I2R 眼科图像分析组负责人 ORIGA 及后续新加坡眼科 AI 系列论文核心作者
Tien Yin Wong 临床眼科 / 流行病学 SiMES 队列 PI 之一,眼病流行病学权威
Zhuo Zhang、Feng Shou Yin 等 I2R 算法与工程 数据集构建与标注流程实现

3.3 标注协议的来源

ORIGA-light 结构字段的标注依据是 Center for Eye Research Australia (CERA) 的 “Assessment of Glaucomatous Optic Disk Signs” 分级协议。这意味着数据集的判读字段不是团队自创的简化标签,而是沿用了临床青光眼视盘评估的既有术语体系(CDR、ISNT、RNFL、Notch、DH、PPA 等)。

这一点的实际意义:使用 ORIGA-light 的结构字段做研究时,字段语义与临床青光眼判读文献是对齐的,跨研究比较的语义成本较低;代价是字段体系本身带有临床判读的观察者间变异,标签并非绝对客观真值。

§4 标注体系:13 项结构字段

4.1 字段清单

ORIGA-light 为每张图提供 13 项诊断相关的结构判读字段(另有备注栏),按 ORIGA-GT 界面字段实列如下:

序号 字段 中文 类型 临床意义
1 Laterality 眼别 分类(L/R) 左右眼
2 Image Quality 图像质量 等级 成像质量评估
3 Gradability 可分级性 分类 是否可判读
4 Field 视野/视场 分类 图像视场信息
5 Disc Size 视盘大小 连续/等级 视盘绝对尺寸
6 Disc Tilting Ratio 视盘倾斜比 连续 视盘倾斜程度
7 CDR 杯盘比 连续(垂直/水平) 青光眼结构定量核心
8 ISNT rule ISNT 规则合规 分类 神经视网膜边缘宽度顺序
9 RNFL 神经纤维层缺损 分类/等级 神经纤维层完整性
10 Notch 切迹 分类 视盘边缘局灶性缺损
11 Disc Haemorrhage 视盘出血 分类 青光眼进展征象
12 Alpha PPA Alpha 区视盘周围萎缩 分类 视盘周围萎缩(外区)
13 Beta PPA Beta 区视盘周围萎缩 分类 视盘周围萎缩(内区)
— Comments 备注 文本 附加说明

字段计数口径说明:文献中对"13 项"是否包含"眼别/图像质量/可分级性"存在不同理解——若这三项被视为元数据而非诊断字段,则诊断相关字段会少于 13。本条目按 ORIGA-GT 界面字段实列,称其为"13 项诊断相关字段(另有备注栏)",并在坑 3 存照这一计数分歧。

4.2 核心字段详解

CDR(杯盘比):视杯直径与视盘直径之比,青光眼诊断中最常被量化的结构指标。CDR 增大提示视杯扩大、神经视网膜边缘变窄,是青光眼性损害的直接表征。ORIGA-light 提供 CDR 字段,使该数据集可直接用于 CDR 回归/分类任务,而不必由使用者自行从分割掩码反推。

ISNT 规则:健康视盘的神经视网膜边缘宽度通常满足 Inferior(下)> Superior(上)> Nasal(鼻)> Temporal(颞)的顺序。ISNT 规则被破坏(尤其是下方边缘变窄为最窄)提示青光眼可能。它是一条"顺序性"判读规则,与 CDR 的"数值性"判读互补。

RNFL 缺损:视网膜神经纤维层缺损是青光眼的结构标志之一,常先于视野缺损出现。字段记录是否存在 RNFL 缺损。

Notch(切迹):视盘边缘局灶性的神经视网膜边缘缺损,常见于青光眼进展期。

Disc Haemorrhage(视盘出血):视盘表面或边缘的出血,是青光眼进展的已知危险因素之一。

Alpha / Beta PPA(视盘周围萎缩):视盘周围萎缩分为 Alpha 区(外侧、色素紊乱带)与 Beta 区(内侧、脉络膜视网膜萎缩带),Beta 区 PPA 与青光眼关联更密切。

4.3 分割标注:视盘与视杯边界

除结构字段外,ORIGA-light 的另一半资产是视盘(OD)与视杯(OC)的边界标注。这两类边界是视盘/视杯分割任务的监督信号,也是计算 CDR 的几何基础(CDR = OC 直径 / OD 直径)。

视盘/视杯分割是眼科图像分析中最基础、也最经典的结构分割任务之一。它的输出——OD/OC 掩码——可直接用于:CDR 计算、视杯面积占比、神经视网膜边缘宽度分布、ISNT 规则自动判读。ORIGA-light 因此既是一个分类数据集,也是一个分割数据集:同一张图的两种用法在文献中长期并存(§9 存照)。

4.4 ORIGA-GT 工具

ORIGA-GT 是随数据集发布的 ground truth 标注/查看工具,其字段设计依据 CERA 协议。使用者的实践含义:ORIGA-GT 既是查看已有标注的入口,也是理解字段语义的参照——在不确定某个字段取值范围时,工具界面本身就是最权威的口径来源。

4.5 标注质量的边界

ORIGA-light 的标注来自眼科专家判读,而非多专家委员会共识,因此带有临床判读固有的观察者间变异。具体表现为:CDR 这类连续量的专家间一致性通常中等,ISNT/Notch 这类规则性判读的一致性也受判读者经验影响。使用者在把结构字段当作"金标准"训练模型时,应把标签噪声纳入考量——这既是 ORIGA-light 的局限,也是整个青光眼视盘判读领域的共性局限。

4.6 结构字段的临床判读逻辑

理解 13 项字段,最好按青光眼临床判读的实际推理链来组织,而不是当作一张平铺的清单。临床上从眼底图判断青光眼,大致走"结构测量 → 规则核对 → 异常征象搜寻"三步:

第一步,结构测量(数值层):

  • CDR 是首要定量指标。视杯/视盘直径比越大,神经视网膜边缘越薄,青光眼可能性越高。临床上 CDR > 0.6 或双眼不对称 > 0.2 常被提示为可疑。ORIGA-light 以连续值记录 CDR,可直接用于回归。
  • Disc Size(视盘大小) 是 CDR 的解释前提:大视盘生理性 CDR 偏大,小视盘青光眼时 CDR 可能仍"正常"。只报 CDR 不报视盘大小,判读会失真——ORIGA-light 同时记录两者,这一点比只给 CDR 的数据集更临床友好。
  • Disc Tilting Ratio(视盘倾斜比) 描述视盘倾斜,倾斜视盘会影响 CDR 与边缘宽度的度量可靠性。

第二步,规则核对(顺序层):

  • ISNT 规则把神经视网膜边缘宽度按 Inferior > Superior > Nasal > Temporal 排序。合规 → 倾向正常;违规(尤其下方边缘变窄)→ 倾向青光眼。它是"顺序性"判读,与 CDR 的"数值性"判读互补:一个视盘可以 CDR 不大但 ISNT 已违规,也可以 CDR 偏大但 ISNT 尚合规。

第三步,异常征象搜寻(定性层):

  • RNFL 缺损——神经纤维层缺失,常先于视野缺损出现,是早期征象。
  • Notch(切迹)——视盘边缘局灶性边缘缺损,常见于进展期。
  • Disc Haemorrhage(视盘出血)——进展危险因素。
  • Alpha / Beta PPA——视盘周围萎缩,Beta 区与青光眼关联更密切。

此外 Image Quality / Gradability 是判读前置条件:非散瞳图质量波动大,质量差或不可分级的图在训练中应被识别或过滤;Laterality / Field 是元数据,保证判读与图像来源对齐。

4.7 为什么"结构字段"比"单一标签"重要

一个只给"青光眼/正常"二值标签的眼底集,只能训练一个二分类模型;模型学到的判别边界不可解释,也难以迁移到需要定量输出的场景。ORIGA-light 的 13 项字段把判读过程拆解为可解释的子任务:

子任务 对应字段 模型能力要求
数值回归 CDR 输出连续量,需处理类间分布差异
顺序判读 ISNT rule 学习空间顺序关系
二/多分类 RNFL / Notch / DH / Alpha PPA / Beta PPA 局部区域判别
质量评估 Image Quality / Gradability 图像质量打分
元数据对齐 Laterality / Field 与来源对齐

这种"多任务可分解"的结构,使 ORIGA-light 在不新增图像的前提下,把一个 650 图的数据集扩展成数倍于二分类的研究任务面。它也是"AI-Ready"的一个具体体现:数据不只是"能喂给模型",而是"能支撑有意义的、可解释的监督信号"。

4.8 与 DR 标注体系的口径差异(勿混用)

需要特别提醒:库内多数眼底条目(messidor/ddr/idrid 等)的标注体系是糖尿病视网膜病变分级(如 ICDR 0-4 级、微动脉瘤/出血/渗出等病灶),与 ORIGA-light 的青光眼视盘结构字段在语义上完全不重叠。二者虽同为"眼底图标注",但:

  • DR 标注基于病变(lesion)与分级(grade);
  • ORIGA-light 标注基于视盘结构(disc morphology)与青光眼征象。

因此跨条目引用标注时,不能把 DR 的"分级"与 ORIGA-light 的"CDR/ISNT"混为一谈。这是库内眼底条目互链时最易犯的语义错误。

§5 论文与时间线

5.1 主论文

项 内容
标题 ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research
作者 Zhang Z, Yin FS, Liu J, Wong WK, Tan NM, Lee BH, Cheng J, Wong TY
会议 32nd Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2010)
地点/时间 Buenos Aires, Argentina,2010-08-31 至 2010-09-04
出处 Annu Int Conf IEEE Eng Med Biol Soc. 2010;2010:3065-3068
DOI 10.1109/IEMBS.2010.5626137
PMID 21096798

EMBC 是 IEEE 工程与医学交叉领域的年度旗舰会议,无卷号(年度会议)。论文的定位是"数据库介绍 + 基线算法":既发布数据集,也给出视盘/视杯定位与分割的基线方法,供后续研究对标。

5.2 时间线

时段 事件
2004-2007 SiMES 队列采集期(3,280 名受试者接受检查)
2010-08/09 EMBC 2010 论文发表,ORIGA-light 公开发布
2010-约2020 原始官网(I2R/NTU 项目页)作为主要获取渠道
约2020 后 原始官网失效、直链不可达
2020 视觉领域依托该数据集的 REFUGE 挑战赛(MICCAI 2020)推动青光眼分割研究
2024-02-18 Zenodo 社区镜像 record 10674885(v1)发布,ORIGA/REFUGE/ACRIMA 打包,标注 CC BY 4.0
2026-09 本条条目抓取时点,确认官网仍不可达、镜像为现行公开入口

5.3 双口径存照

页码口径:IEEE Xplore 与 PubMed 均记 3065-3068,无冲突。引用时按此页码。

年份口径:EMBC 为年度会议,无卷号跨年问题,会议年份即 2010,PubMed 收录亦归 2010。无跨年卷期歧义——这一点比许多期刊论文省心。

名称口径:官方标题写 “ORIGA(-light)”(用括号表示 light 为可选后缀),官方页面/正文多写 “ORIGA-light”,社区文献大量简写为 “ORIGA”。三者指同一数据集,但 “ORIGA” 作为搜索词会引入歧义(§10 坑 1)。

5.4 论文说了什么、没说什么

论文明确给出的:数据集规模(650 张)、类别(青光眼/正常)、来源队列(SiMES)、图像规格(3072×2048)、标注字段体系(13 项结构字段 + OD/OC 边界)、以及基线分割/定位结果。

论文没有明确给出的(本条目据实存照):“light” 相对完整 ORIGA 去除了哪些样本的筛选规则;650 张图上 OD/OC 掩码的完整度(是否全部含掩码);无官方固定 train/val/test 划分;原始发布的具体再分发授权条款措辞。这些空白在使用者做严谨复现时都可能成为障碍,故在 §9 逐条列为遗留疑点。

§6 获取与许可

6.1 版本链:从官网到 Zenodo 镜像

ORIGA-light 的获取方式经历了三段变迁,这是本条目最需要使用者留意的部分:

阶段 渠道 状态
第一段(2010-约2020) 原始官网(I2R/NTU 项目页)直链 已失效
第二段(约2020 后) 官网不可达,分散的历史镜像 不可靠
第三段(2024-02-18 起) Zenodo record 10.5281/zenodo.10674885 现行可公开下载

原始官网失效是硬事实:2026-09 实抓显示官方项目页不可达(404/无响应)。这意味着任何"去 ORIGA 官网下载"的指引都已过时。现行唯一被本条目确认可公开下载的入口是 Zenodo 社区镜像。

6.2 Zenodo 镜像详情

项 内容
Record DOI 10.5281/zenodo.10674885
标题 Diabetic Glaucoma(ORIGA,REFUGE,ACRIMA)
版本 v1
发布日期 2024-02-18
发布者 社区镜像上传者(非官方原始发布方)
License(页面标注) CC BY 4.0
内容 ORIGA(即 ORIGA-light)+ REFUGE + ACRIMA 三数据集打包
关键文件 ORIGA.rar 约 475 MB
MD5 308b66f83325a18da09504a3b6c1c5cd(页面提供)
全 record 总大小 约 3.7 GB(含三数据集)

镜像把 ORIGA-light 与 REFUGE、ACRIMA 打包在一起,这三者都是眼底/青光眼相关的公开数据集,天然形成互链关系(§8)。

6.3 许可:双口径必须存照

ORIGA-light 的许可存在双口径,这是使用前必须理解的关键点:

口径 内容 来源
原始发布 academic research(学术研究用途),要求引用原论文 EMBC 2010 官方发布声明
现行镜像 CC BY 4.0 Zenodo record 10674885 页面

本条目按 Zenodo 镜像实核口径记 CC BY 4.0,并注明原始发布为 academic-use 声明。 需要提醒的是:CC BY 4.0 的标注来自社区镜像方,镜像方是否有权将原发布方的 academic-use 资产重新以 CC BY 4.0 授权,未见公开说明。这属于存照事项——使用者在涉及商业用途或再分发时,应自行评估这一授权链的合法性风险,而不能仅凭 Zenodo 页面的 CC BY 标识断言"完全自由可用"。

6.4 获取难度与无 gated

与库内许多需要申请、签协议的数据集不同,ORIGA-light 的 Zenodo 镜像无 gated、无申请制,开放直链下载。这一点的实际好处是:可复现性入口清晰,任何人有 DOI 即可获取,不需要机构隶属或用途说明。代价是:由于它不是官方托管,长期可用性依赖 Zenodo 平台与上传者,存在"未来可能消失"的可持续性风险。

6.5 获取决策建议

  1. 要立刻下数据:访问 Zenodo 10.5281/zenodo.10674885,下载 ORIGA.rar(约 475 MB),校验 MD5 308b66f83325a18da09504a3b6c1c5cd。
  2. 要引用:以主论文 EMBC 2010(doi:10.1109/IEMBS.2010.5626137)为正式引用(§附录 W)。
  3. 要商用:先厘清许可双口径——Zenodo 的 CC BY 4.0 与原始 academic-use 声明的冲突需自行评估。
  4. 要长期托管:建议自行镜像一份并记录 MD5,因为官方原站已失效,社区镜像亦非永久保证。

§7 评估与基准

7.1 它是一个被广泛使用的公开评测集

ORIGA-light 的价值不仅在于"提供数据",还在于它被大量视盘/视杯分割与青光眼判读方法论文用作训练集或验证集。它和 REFUGE、DRISHTI-GS 等一起,构成了视盘/视杯分割任务的常用公开基准集合。研究者提出新分割方法时,在 ORIGA-light 上报结果几乎是标准做法之一。

7.2 性能数字的多源存照

任务 指标口径 数值区间 来源类型
青光眼分类 准确率 ≈ 93.5% 某 XAI 相关研究报告(单源)
视盘/视杯分割 Dice / 准确率 88.5% - 98.9% DB-SegNet / Nature 系列论文 2025 汇总表
分割 sensitivity 77.5% - 95% 专利/技术对比表
外部验证 使用完整 650 张(168+482) — J Glaucoma 2024 等临床迁移研究

这些数字不可横向对齐。 原因有三:不同论文使用不同的 train/val/test 划分(ORIGA-light 无官方固定 split);分割指标(Dice/IoU/准确率)定义与视盘/视杯合并方式不同;分类任务的 operating point(阈值)与类别处理方式不同。任何"ORIGA-light 的 SOTA 是 X%"的断言都应附上具体论文与划分口径。

7.3 常用评测指标

任务 常用指标
视盘/视杯分割 Dice、IoU、准确率、边界距离(ASSD/HD)
青光眼分类 AUC、accuracy、sensitivity、specificity、F1
CDR 回归 MAE、RMSE、相关系数
ISNT 判读 分类准确率、一致性(κ)

7.4 划分习惯(无官方 split)

ORIGA-light 没有官方固定的 train/val/test 划分,文献常见 8:2 或 7:3 的随机划分。这带来一个可复现性问题:同一方法在不同论文中报告的 ORIGA-light 分数,可能因为划分不同而无法直接比较。建议使用者在复现对比时,明确声明自己的划分方式与随机种子;若要跨论文比较,优先选择那些声明了划分细节的工作,或自行在同一划分下重跑基线。

7.5 基线方法与任务演化

ORIGA-light 论文本身即提供了视盘/视杯定位与分割的基线。此后视盘/视杯分割方法大致经历了:传统图像处理/主动轮廓(早期)→ 卷积神经网络全监督分割(中期)→ 结合注意力/多尺度/边界感知的网络(近期)→ 基础模型/自监督预训练适配(前沿)。ORIGA-light 作为一个小规模(650 张)、高质量标注的老数据集,在深度学习时代的角色也发生了转变:从"主要训练集"更多转向"外部验证集/泛化测试集"——研究者常在大型数据集上训练,再用 ORIGA-light 检验跨数据集泛化。这解释了为什么近年论文中 ORIGA-light 常以"external validation"或"cross-dataset test"的身份出现(§7.2 表中"外部验证"一栏即属此类)。

7.6 视盘/视杯分割的评测细节

视盘/视杯分割看似简单(两个嵌套的近似椭圆区域),实则在评测上有若干常被忽视的细节,直接影响 ORIGA-light 分数的可比性:

  1. OD/OC 是否分开报:有的论文只报"视盘"整体 Dice,有的分报 OD Dice 与 OC Dice。OC 边界通常比 OD 模糊(视杯边界在眼底图上无明确解剖边界),OC Dice 一般低于 OD Dice。只报一个"平均 Dice"会掩盖这一差异。
  2. 边界像素容差:部分评测用"边界距离容差"(如预测边界落在真值边界 ±N 像素内即算对),部分用严格 IoU/Dice。同一方法在两种口径下分数可差数个百分点。
  3. 视杯为空的处理:极少数正常眼视杯几乎不可见,若模型预测出空掩码,Dice 定义(0/0)需要特殊约定。不同论文处理不一致。
  4. 图像预处理:是否裁剪到视盘 ROI、是否做光照归一化/颜色校正、是否下采样,都会影响分数。非散瞳图光照不均,预处理的影响尤其显著。
  5. 测试集来源:在 ORIGA-light 内部划分测试,与用 ORIGA-light 作外部测试集(模型在他集训练),是两种完全不同的难度。§7.2 表中数字未区分这两类,故更不可横向对齐。

7.7 青光眼分类的评测细节

分类任务的坑集中在"operating point"与"类别处理":

  1. 阈值:AUC 衡量全阈值排序能力,而准确率/sensitivity/specificity 依赖具体阈值。报告后者时必须同时给出阈值。
  2. 类别不平衡:正类约 25.8%,若不做加权,模型倾向预测多数类(正常),accuracy 虚高而 sensitivity 低。筛查场景更看重 sensitivity,需明确取舍。
  3. 单眼 vs 双眼:临床判读是双眼综合,而数据集是图像级标签。若按受试者聚合预测(如两眼取最大风险),指标会变;文献多数按图像级报告。
  4. 与 CDR 的耦合:若分类模型隐式学 CDR,则"分类准确率"与"CDR 回归精度"高度相关,独立报告二者会高估方法多样性。

7.8 如何合理使用 §7.2 的性能数字

给使用者的三条操作建议:

  • 只做同源对比:把同一篇论文内的多个方法分数放在一起比较(它们共享划分与预处理),不要把跨论文的数字拼成一张"排行榜"。
  • 绑定口径再引用:引用任何 ORIGA-light 分数时,附"论文 + 任务 + 指标 + 划分"四要素,缺一不可。
  • 自跑基线:若要做方法对比,最稳妥是在自己声明并公开的划分下重跑基线,而不是拼接文献数字。

§7bis 一个"老数据集"的复现工作流建议

由于 ORIGA-light 官方渠道失效、无官方 split、格式细节需实核,复现该数据集上的实验有一条推荐的稳健工作流:

  1. 获取:从 Zenodo 镜像下载 ORIGA.rar,核 MD5。
  2. 格式实核:确认图像格式、边界标注格式(点集/多边形/掩码坐标),必要时写解析脚本。
  3. 数据划分:固定随机种子,做 8:2 或 7:3 分层划分(按青光眼/正常分层),公开划分清单。
  4. 任务定义:明确做分割还是分类还是多任务,指标一次定清(§7.6/§7.7)。
  5. 基线复现:先跑一个简单基线(如 U-Net 分割、ResNet 分类),作为内部对标锚点。
  6. 报告口径:按 §7.8 四要素报告,并把许可双口径与获取路径写入方法节。

这条工作流的核心是"把不确定性显式化":ORIGA-light 的许多细节论文未明示,与其假装它们是确定的,不如在方法节里公开声明自己的选择。

§8 生态与影响

8.1 在青光眼影像 AI 谱系中的位置

ORIGA-light 是"青光眼视盘/视杯结构分析"方向的早期奠基数据之一。把它放进时间轴:

阶段 代表数据集/事件 ORIGA-light 的关系
2000s 末 ORIGA-light(2010) 起点——最早规模化的公开 OD/OC 标注
2010s DRISHTI-GS 等 同期/后续视盘分割集
2020 REFUGE 挑战赛(MICCAI) 接棒者——更大规模、标准化挑战赛
2020s JustRAIGS 等 青光眼转诊 AI 的大规模数据

它的历史角色是"开先河":在深度学习尚未主导眼科影像的年代,就提供了带 OD/OC 边界与结构字段的公开集,使后续方法有了可对标的起点。

8.2 SiMES 队列的后续衍生

SiMES 队列本身产出多篇眼病流行病学与影像 AI 论文。ORIGA-light 是其中影像数据集分支的代表。队列数据还支撑了新加坡后续的眼科 AI 研究(如 REFUGE 的部分来源与新加坡其他眼底数据集)。因此 ORIGA-light 与"新加坡眼科 AI"这一研究传统紧密绑定,这也解释了为什么它与 REFUGE 在任务与来源上都有亲缘关系。

8.3 与 REFUGE、ACRIMA 的打包关系

Zenodo record 10674885 把 ORIGA、REFUGE、ACRIMA 三者打包。这三者:

数据集 定位
ORIGA(ORIGA-light) 青光眼视盘/视杯分割 + 结构判读
REFUGE 青光眼视盘/视杯分割 + CDR(挑战赛规格)
ACRIMA 青光眼分类(眼底图)

三者同属青光眼域,虽任务侧重不同,但常被同一批研究者共同使用。打包发布使它们成为"事实上的互链组"。

8.4 使用者的常见用法谱

用法 说明
视盘/视杯分割训练/验证 最主流用法,用 OD/OC 边界监督分割
CDR 定量研究 用 CDR 字段做回归/与分割反推的 CDR 对照
青光眼分类 168/482 二分类
ISNT/结构字段判读 用 13 项字段做多任务或规则学习
跨数据集泛化验证 在大型集训练、ORIGA-light 测试外部泛化
标注质量/一致性研究 用结构字段研究专家判读变异

§9 与库内条目的关系

9.1 家族图谱

青光眼结构域(最相关):

  • REFUGE(62)——青光眼视盘/视杯分割 + CDR,任务与 ORIGA-light 高度重叠,是首要互链。REFUGE 可视为 ORIGA-light 方向在挑战赛时代的延续。
  • JustRAIGS(746)——青光眼转诊 AI(视杯/视盘相关),同属青光眼域,次相关互链,规模量级更大。

糖尿病视网膜病变域(横向互补):

  • messidor(59)、ddr(201)、idrid(191)、deepdrid(211)、eyepacs(58)——DR 分级系列。
  • fgadr(221)——细粒度糖网。
  • rfmid(271)、odir(63)——多病种眼底分类(含青光眼标签)。
  • fives(741)——眼底多任务(含血管分割)。

关系判定:库内眼底条目中,只有 ORIGA-light 与 REFUGE(62) 以青光眼视盘/视杯结构为核心;其余绝大多数为 DR 域。因此 ORIGA-light 与它们的互链是"互补"而非"重复"——两者常在同一研究的数据集综述中并列出现。

9.2 检索路径建议

检索意图 建议关键词
找本体 ORIGA-light、ORIGA(-light)、ORIGA dataset fundus
找青光眼分割同类 REFUGE challenge glaucoma segmentation、JustRAIGS
找 DR 互补集 messidor、IDRiD、DDR、EyePACS
找来源队列 Singapore Malay Eye Study、SiMES cohort
找论文 10.1109/IEMBS.2010.5626137、PMID 21096798

§10 避坑清单:八个已踩过的坑

坑 1:ORIGA-light、ORIGA(-light)、ORIGA 是同一个数据集。官方标题用括号写 “ORIGA(-light)”,正文/页面多写 “ORIGA-light”,社区文献大量简写 “ORIGA”。检索时只写 “ORIGA” 会引入歧义(可能与厂商名、其他项目混淆),建议用精确短语 “ORIGA-light” 或直接核 DOI。

坑 2:原始官网已经失效。任何"从 ORIGA 官网/I2R 项目页下载"的旧指引都已过时——2026-09 实抓不可达。现行公开入口只有 Zenodo 社区镜像(10.5281/zenodo.10674885)。把这当作获取路径的第一步常识。

坑 3:"13 项字段"的计数口径有出入。文献对 13 项是否包含"眼别/图像质量/可分级性"存在不同理解。本条目按 ORIGA-GT 界面字段实列并注明"13 项诊断相关字段(另有备注栏)";引用时应说明计数口径,避免与其他文献的"N 项"直接冲突。

坑 4:性能数字不可横向对齐。93.5%(分类准确率)、88.5%-98.9%(分割 Dice/准确率)、77.5%-95%(sensitivity)来自不同论文、不同划分、不同指标定义。ORIGA-light 无官方固定 split,任何"SOTA 是 X%"都需附具体论文与划分。

坑 5:许可双口径。原始发布为 academic research 用途声明,Zenodo 镜像标 CC BY 4.0。本条目按镜像实核记 CC BY 4.0 并注明溯源自镜像方;镜像再授权的合法性未见公开说明,商用/再分发前需自行评估。

坑 6:“light” 的筛选规则未明示。ORIGA-light 相对完整 ORIGA 去除了哪些样本、按什么规则去除,论文未给逐条说明;650 张与 SiMES 完整队列图像数的关系也未明示。不要假设 650 是队列的全部可分级图。

坑 7:650 是图像数不是受试者数。SiMES 队列 3,280 是受试者数,ORIGA-light 650 是图像数,两者不同量纲。引用"3,280"时务必说明它是队列规模而非图片数,避免把两个数字直接绑定。

坑 8:掩码完整度需实核。650 张图中 OD/OC 掩码是否全部齐备、边界数据的精确格式(点集/多边形/掩码坐标),论文未逐条明示,需下载 ORIGA.rar 实核。本条目按文献与工具口径记为"可由 ORIGA-GT 查看/编辑的边界标注"。

§11 总结

11.1 三句话总结

  1. ORIGA-light 是 2010 年发布的、源自新加坡 SiMES 队列的 650 张眼底图视盘/视杯分割与青光眼结构判读数据集(168 青光眼 + 482 正常),是这一方向最早的规模化公开来源之一。
  2. 它的核心资产是"OD/OC 边界 + 13 项结构字段"的双重标注,使它同时可做分割、CDR 回归、青光眼分类与 ISNT 判读,而不只是一个二分类集。
  3. 它的现状是"原官网失效、Zenodo 社区镜像承接(CC BY 4.0)",使用前必须理解许可双口径与获取路径变迁(§6、坑 2、坑 5)。

11.2 适合谁

  • 视盘/视杯分割团队:找早期经典监督信号与跨数据集泛化测试集。
  • 青光眼结构判读研究者:13 项字段(CDR/ISNT/RNFL/PPA)可直接支撑多任务学习。
  • 眼科数据集综述作者:ORIGA-light 是青光眼结构方向的必列起点。
  • 研究"老数据集在深度学习时代的角色转变"者:它从主训练集转向外部验证集是活的案例。

11.3 不适合谁

  • 需要大规模即插即用训练集的团队(650 张偏小,且无官方 split)。
  • 需要最新大规模青光眼数据的项目(应看 JustRAIGS(746))。
  • 需要明确商用授权链的项目(许可双口径未澄清)。
  • 需要跨族群泛化的研究(源队列为新加坡马来裔单一族群)。

11.4 30 秒决策卡

你的情况 行动
要立刻下数据 Zenodo 10.5281/zenodo.10674885 下 ORIGA.rar(475 MB,核 MD5)
要做视盘/视杯分割基准 明确声明自己的 train/test 划分(无官方 split,坑 4)
要做青光眼结构多任务 用 13 项字段(§4),先理解字段语义源自 CERA 协议
要商用 先厘清许可双口径(原始 academic-use vs 镜像 CC BY 4.0,坑 5)
要找同类数据集 REFUGE(62) 首要互链、JustRAIGS(746) 次之(§9)
要引用 用 EMBC 2010 主论文 BibTeX(附录 W)

11.5 一句话定位

ORIGA-light = “青光眼结构判读方向最早的规模化公开坐标”:它的价值不在数据量(650 偏小),而在它把 CDR/ISNT/RNFL 这套临床判读语言第一次系统地数字化并公开;它的风险不在数据质量,而在"原渠道已失效、现行依赖社区镜像"的可持续性。

11.6 与库内"青光眼双子"的关系总结

在千方病案医数集的眼底条目矩阵中,ORIGA-light 与 REFUGE(62) 构成"青光眼结构双子":ORIGA-light 是 2010 年的公开起点、规模小、字段细;REFUGE 是 2020 年挑战赛时代的接棒者、规模大、标准化。两者的关系不是替代而是"前驱—后继",互链价值最高。JustRAIGS(746) 则代表青光眼 AI 向"转诊/大规模"演进的新一代,规模量级再上一个台阶。三者共同勾勒出青光眼影像 AI 从"小样本结构标注"到"大规模转诊筛查"的演进轨迹。

FAQ(高频问答 28 问)

A. 基础认知

Q1:ORIGA-light 是挑战赛吗?
不是。它没有比赛、没有 leaderboard,是 2010 年公开发布的眼底图数据库(论文+数据+工具三件套)。后来的 REFUGE 才是挑战赛形式。

Q2:名字里的 light 是什么意思?
官方写作 “ORIGA(-light)”,light 通常被理解为公开的精简子集口径(相对完整 ORIGA 去除了部分样本)。但去除哪些样本论文未明示(坑 6)。

Q3:它是谁做的?
新加坡 A*STAR I2R 主导,SERI/SNEC 提供临床分级,NUS 合作。核心作者含 Jiang Liu、Tien Yin Wong。

Q4:论文发在哪里、怎么引用?
EMBC 2010;2010:3065-3068,doi:10.1109/IEMBS.2010.5626137,PMID 21096798。引用见附录 W。

Q5:和 REFUGE 什么关系?
同属青光眼视盘/视杯分割方向,REFUGE 是 2020 年挑战赛形式、规模更大的接棒者。ORIGA-light 是更早的公开起点,二者高度互补(§9)。

Q6:为什么老数据集还值得收录?
因为它是青光眼结构判读方向最早的规模化公开来源之一,且带 13 项结构字段(非单一标签),至今仍被大量方法论文用作基准与外部验证集(§7.5)。

B. 数据与规格

Q7:多少张图?怎么分类?
650 张,168 青光眼 + 482 正常,青光眼占约 25.8%。

Q8:图像分辨率?
3072 × 2048 RGB 彩色,非散瞳,视场约 45°。

Q9:左右眼分布?
336 左 + 314 右,基本均衡。

Q10:数据来自什么队列?
新加坡 SiMES(Singapore Malay Eye Study),2004-2007,40-80 岁,3,280 名受试者。注意 3,280 是人数不是图片数(坑 7)。

Q11:有哪些标注?
两类:OD/OC 边界标注 + 13 项结构字段(眼别/质量/可分级性/Field/视盘大小/倾斜比/CDR/ISNT/RNFL/Notch/DH/Alpha PPA/Beta PPA + 备注)。

Q12:标注工具是什么?
ORIGA-GT(随数据集发布),字段依据 CERA 分级协议。

Q13:类别不平衡严重吗?
中等,1:2.87。分类任务建议用 AUC/F1 而非 accuracy;分割与 CDR 回归受不平衡影响较小。

C. 任务与使用

Q14:能做哪些任务?
OD/OC 分割、CDR 回归、青光眼二分类、ISNT 判读,以及跨数据集泛化验证与标注一致性研究。

Q15:CDR 字段直接可用吗?
可用。ORIGA-light 直接提供 CDR,避免使用者自造 CDR 标签;但字段带有临床判读变异,训练时需考虑标签噪声。

Q16:ISNT 规则是什么?
Inferior > Superior > Nasal > Temporal,健康视盘神经视网膜边缘宽度的典型顺序;被破坏提示青光眼。

Q17:有官方 train/test 划分吗?
没有。文献各用各的(8:2/7:3),跨论文比较前须对齐划分(坑 4)。

Q18:适合训练还是验证?
两者皆可;在深度学习时代更常作外部验证/泛化测试集(§7.5)。

Q19:650 张够用吗?
作为小规模高质量集,独立训练偏小;常见做法是与更大数据集联合训练或用于微调/验证。

Q20:正类太少怎么办?
用加权损失、重采样,或改以 AUC 为主指标;筛查场景下关注 high-sensitivity operating point。

D. 获取与许可

Q21:现在在哪里下?
Zenodo 10.5281/zenodo.10674885,ORIGA.rar 约 475 MB,MD5 308b66f83325a18da09504a3b6c1c5cd。

Q22:原官网还能用吗?
不能。2026-09 实抓不可达(坑 2)。

Q23:许可是什么?
双口径:原始 academic research 声明 vs Zenodo 镜像 CC BY 4.0。本条目按镜像实核记 CC BY 4.0 并注明溯源自镜像方(坑 5)。

Q24:能商用吗?
需自行评估许可双口径的合法性风险——Zenodo 的 CC BY 4.0 由社区镜像方标注,再授权依据未见公开说明。

Q25:Zenodo 包里还有什么?
REFUGE 与 ACRIMA 也在同包(总约 3.7 GB),三者同属青光眼域(§8.3)。

Q26:有 gated/申请制吗?
没有,开放直链下载。

Q27:点云/掩码格式?
文献与工具口径记为"可由 ORIGA-GT 查看/编辑的边界标注";精确格式以下载包为准(坑 8)。

Q28:如何保证长期可用?
原官网已失效,建议自行镜像并记录 MD5;不要假设社区镜像永久存在。

附录 A:条目信息速查卡

项 值
条目名 ORIGA-light
url_name origa-light
类型 数据集(视盘/视杯分割 + 青光眼结构判读)
全称 ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research
论文 EMBC 2010;2010:3065-3068(doi:10.1109/IEMBS.2010.5626137)
团队 A*STAR I2R + SERI/SNEC + NUS
规模 650 张(168 青光眼 + 482 正常)
队列 新加坡 SiMES(3,280 受试者)
规格 3072×2048 RGB,非散瞳,FOV≈45°
标注 OD/OC 边界 + 13 项结构字段(ORIGA-GT / CERA 协议)
获取 Zenodo 10.5281/zenodo.10674885(ORIGA.rar≈475 MB)
许可 原始 academic-use|镜像 CC BY 4.0(双口径)
抓取时点 2026-09-30
库内互链 refuge(62)/justraigs(746)/messidor(59)/ddr(201)/idrid(191)/deepdrid(211)/eyepacs(58)/fgadr(221)/rfmid(271)/odir(63)/fives(741)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 论文被 IEEE/PubMed 收录、Zenodo DOI 可索引;但名称三写法(ORIGA-light/ORIGA(-light)/ORIGA)易混淆,官方原站失效
A 可获取性 7 Zenodo 开放直链、无 gated,475 MB 单包可下;减分项是官方原始渠道失效、依赖社区镜像的长期风险
I 可互操作 7 标准图像格式 + 边界标注 + 字段表;无官方转换脚本到统一分割掩码/DICOM 格式,格式细节需实核
M 元数据质量 7 论文+队列论文提供规模/来源/字段体系;但"light"筛选规则、掩码完整度、许可条款措辞未明示,扣分
S 可持续性 5 原始官网已失效(重大扣分),现行依赖 Zenodo 社区镜像与单个上传者,可持续性存在单点风险
综合评级 6.6/10(中上) 数据与方法价值高、许可相对开放;可持续性被"官方渠道失效 + 社区镜像依赖"显著拖低

附录 C:逐项证据链自证

关键数字 来源 位置
650 张 / 168 青光眼 / 482 正常 主论文 + 多源二手引用 EMBC 2010 正文
336 左 / 314 右 主论文/数据集说明 EMBC 2010 正文
3072 × 2048,FOV≈45° 主论文规格描述 EMBC 2010 正文
3,280 受试者 / 响应率 78.7% SiMES 队列论文 队列论文正文
青光眼患病率 4.79% / 3.6% SiMES 队列论文 队列论文结果
13 项结构字段 ORIGA-GT / CERA 协议 主论文 + 工具界面
DOI 10.1109/IEMBS.2010.5626137 IEEE Xplore 论文页
PMID 21096798 PubMed 论文记录
Zenodo 10.5281/zenodo.10674885 / v1 / 2024-02-18 Zenodo record 页面
ORIGA.rar ≈475 MB / MD5 308b66f8… Zenodo 文件列表
CC BY 4.0(镜像) Zenodo record 许可栏
分类准确率 ≈93.5% XAI 相关研究报告 二手引用
分割 88.5%-98.9% Nature 系列/DB-SegNet 汇总表 论文表格
sensitivity 77.5%-95% 专利/技术对比表 对比表

附录 D:数据获取决策树

需求是什么?
├── 只想快速拿到数据跑通
│   └── Zenodo 10.5281/zenodo.10674885 → ORIGA.rar(475 MB,核 MD5)
├── 想做视盘/视杯分割
│   ├── 下载 ORIGA.rar 解出图 + OD/OC 边界
│   └── 自定义 train/val/test(无官方 split,须声明划分)
├── 想做青光眼分类
│   ├── 用 168/482 标签
│   └── 处理类别不平衡(加权/重采样,AUC 为主指标)
├── 想做青光眼结构多任务
│   └── 用 13 项结构字段(CDR/ISNT/RNFL/PPA 等)
├── 要做跨数据集泛化
│   └── 大集训练 + ORIGA-light 外部验证
└── 要商用/再分发
    └── 先厘清许可双口径(原始 academic-use vs 镜像 CC BY 4.0)

附录 E:13 项结构字段数据字典

字段 类型 取值口径(按临床判读惯例)
Laterality 分类 left / right
Image Quality 等级 成像质量分级(优/中/差类)
Gradability 分类 可分级 / 不可分级
Field 分类 图像视场(如 disc-centered 等)
Disc Size 连续/等级 视盘绝对尺寸描述
Disc Tilting Ratio 连续 视盘倾斜比
CDR 连续 垂直/水平杯盘比
ISNT rule 分类 合规 / 不合规
RNFL 分类/等级 无缺损 / 有缺损(可分级)
Notch 分类 有 / 无
Disc Haemorrhage 分类 有 / 无
Alpha PPA 分类 有 / 无
Beta PPA 分类 有 / 无
Comments 文本 自由备注

附录 F:任务—指标—输出对照

任务 输入 输出 推荐指标
OD/OC 分割 眼底图 OD/OC 掩码 Dice、IoU、ASSD、HD
CDR 回归 眼底图 或 OD/OC 掩码 CDR 数值 MAE、RMSE、r
青光眼分类 眼底图 青光眼/正常 AUC、sensitivity、specificity、F1
ISNT 判读 OD/OC 掩码 或 眼底图 合规/不合规 准确率、κ
结构多任务 眼底图 多字段联合输出 各字段分项指标

附录 G:与库内条目的检索兼容提示

库内条目 rid 与本条检索重叠点 区分要点
REFUGE 62 青光眼视盘/视杯分割、CDR REFUGE 为挑战赛、1,200 图
JustRAIGS 746 青光眼转诊、视杯/视盘 规模逾 10 万图
rfmid 271 含青光眼标签的多病种分类 多病种非专用结构分割
odir 63 含青光眼的多病种分类 同上
fives 741 眼底结构分割(含血管) 任务是血管/多任务
messidor 等 DR 系列 59/201/191/211/58/221 都是眼底图 任务是糖网分级,非青光眼结构

附录 H:许可条款细读(双口径)

口径 措辞 要求 来源
原始发布 academic research use 学术研究用途、引用原论文 EMBC 2010 官方声明
现行镜像 CC BY 4.0 署名、可再分发(按 CC BY 条款) Zenodo record 10674885

使用建议:以主论文引用作为学术礼貌与合规基础;商用/再分发前,因镜像再授权依据未见公开说明,建议联系相关方确认或采取保守策略。

附录 I:双口径登记表

事项 口径 A 口径 B 本条目处理
名称 ORIGA-light ORIGA(-light) / ORIGA 以 ORIGA-light 为主,等价注明
许可 原始 academic-use 镜像 CC BY 4.0 按镜像实核记 CC BY 4.0 并注明溯源(坑 5)
字段计数 13 项 含/不含元数据字段 按 ORIGA-GT 界面实列并注(坑 3)
性能 93.5%(分类) 88.5%-98.9%(分割) 多源并列、不可对齐(坑 4)
划分 8:2 7:3 无官方 split,均存照
获取 原官网 Zenodo 镜像 官网失效,镜像为现行入口(坑 2)

附录 J:引文规范(BibTeX)

@inproceedings{zhang2010origa,
  title     = {ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research},
  author    = {Zhang, Zhuo and Yin, Feng Shou and Liu, Jiang and Wong, Wing Kee and Tan, Ngan Meng and Lee, Beng Hai and Cheng, Jun and Wong, Tien Yin},
  booktitle = {2010 Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC)},
  pages     = {3065--3068},
  year      = {2010},
  doi       = {10.1109/IEMBS.2010.5626137},
  pmid      = {21096798}
}

附录 K:缩写速查

缩写 全称 中文
OD Optic Disc 视盘
OC Optic Cup 视杯
CDR Cup-to-Disc Ratio 杯盘比
ISNT Inferior > Superior > Nasal > Temporal ISNT 规则
RNFL Retinal Nerve Fiber Layer 视网膜神经纤维层
PPA Peripapillary Atrophy 视盘周围萎缩
DH Disc Haemorrhage 视盘出血
CFP Color Fundus Photography 彩色眼底照相
FOV Field of View 视场
SiMES Singapore Malay Eye Study 新加坡马来裔眼病研究
CERA Center for Eye Research Australia 澳大利亚眼科研究中心
GT Ground Truth 金标准/真值

附录 L:本条目生产档案

项 值
代理名 agent-a-origalight
正选 slug origa-light(备选:无)
锁文件 writing/origa-light/.lock(agent-a-origalight 2026-09-30T21:20)
私有区 .parts_agent-a-origalight_1790774428/
slug 查重 %origa% → 0 行(不撞库)
抓取时点 2026-09-30
证据档 writing/origa-light/FACTS.md

附录 M:基于本数据集的研究检查清单(10 项)

  1. 声明使用的图数(650)与类别构成(168/482)。
  2. 声明 train/val/test 划分方式与随机种子(无官方 split)。
  3. 说明是否使用 OD/OC 掩码、边界格式如何解析。
  4. 分类任务声明 operating point 与所用指标(非仅 accuracy)。
  5. 若用结构字段,说明字段计数口径(13 项是否含元数据)。
  6. 报告类别不平衡处理方式。
  7. 若做跨数据集,说明 ORIGA-light 的角色(训练/验证/外部测试)。
  8. 引用主论文(EMBC 2010)与数据来源。
  9. 说明获取渠道(Zenodo 镜像)并核 MD5。
  10. 商用/再分发前注明许可双口径的评估结论。

附录 N:DAIMS 与 AI-Ready 检查单

检查项 状态 说明
可发现(DOI/论文/平台) ✔ IEEE + PubMed + Zenodo DOI
可获取(直链/无 gated) ✔ Zenodo 开放直链
可互操作(标准格式) ◐ 标准图像+标注,格式细节需实核
元数据充分 ◐ 规模/来源/字段齐,筛选规则等缺
可持续托管 ✘ 官方渠道失效,依赖社区镜像
许可明确 ◐ 双口径未完全澄清

条目维护提示:ORIGA-light 的核心风险点是"官方渠道失效 + 社区镜像依赖",若未来出现官方重新托管或镜像变更,§6 版本链与附录 I 双口径表需同步更新。数据规模(650=168+482)与队列数字(3,280)为稳定硬数字,可作为交叉核验锚点。

附录 O:CDR 计算几何说明

视盘/视杯分割的最直接下游产物是 CDR。其几何定义有多种口径,理解它们能避免"同一掩码算出不同 CDR"的困惑:

CDR 口径 定义 特点
垂直 CDR 视杯垂直径 / 视盘垂直径 临床上最常用,对青光眼更敏感
水平 CDR 视杯水平径 / 视盘水平径 用于对照
面积 CDR 视杯面积 / 视盘面积 由分割掩码直接可得,但对边界噪声敏感
等效径 CDR 按面积换算等效圆直径之比 面积法的稳定化变体

ORIGA-light 的结构字段中 CDR 通常以垂直/水平口径记录。若使用者自行从 OD/OC 掩码反推 CDR,务必声明用的是哪一种口径——否则即使掩码一致,CDR 数值也可能不同。这也是"用分割反推 CDR"与"直接用 CDR 字段"两种路径可能给出不一致结果的原因。

附录 P:ISNT 规则判读的可计算化说明

ISNT 规则虽为定性顺序,但可被形式化为可计算判据,便于做自动判读:

  1. 由 OD/OC 掩码得到神经视网膜边缘区域(视盘减去视杯)。
  2. 以视盘中心为原点,把边缘区域按角度分区(下/上/鼻/颞四个象限,通常各以约 90° 扇区、避开血管进出区)。
  3. 计算各象限的边缘宽度代表值(如平均宽度或最小宽度)。
  4. 检查是否满足 Inferior > Superior > Nasal > Temporal。

形式化时的关键选择:分区角度边界、代表值取法(均值/中位/最小)、是否排除血管遮挡区。这些选择在不同实现中不同,会导致同一图分类结果不同。因此 ORIGA-light 的 ISNT 字段(专家判读)与程序化 ISNT 判读之间可能出现不一致,这属于方法差异而非标签错误。

附录 Q:图像质量与可分级性的使用建议

非散瞳眼底图质量波动大,ORIGA-light 为此提供了 Image Quality 与 Gradability 两个字段。建议用法:

场景 建议
训练分割/分类模型 优先使用高质/可分级图训练,低质图可作鲁棒性测试
质量感知建模 把质量字段作为辅助输出,训练质量预测分支
数据清洗 用 Gradability 过滤不可判读图,避免噪声监督
真实部署评估 保留低质图评估模型在退化条件下的表现

把质量字段用起来,是把"非散瞳图"这一潜在劣势转化为"鲁棒性评测资源"的关键。

附录 R:待核清单(下载实核后应更新的条目)

待核项 现状 实核方法
掩码完整度(650 张是否全含 OD/OC) 未明示 解压 ORIGA.rar 统计
边界标注的精确格式 记为"ORIGA-GT 可查看/编辑" 解压查看文件类型
“light” 的筛选规则 未明示 查论文与历史文档
650 与队列完整图像数的关系 未明示 查 SiMES 队列论文
镜像上传者的再授权依据 未公开 查 Zenodo 元数据/联系上传者
字段取值的确切枚举 按临床惯例推 用 ORIGA-GT 查看

附录 S:常见误用模式(反例集)

误用 后果 正确做法
只报 accuracy 多数类基线 74.2%,虚高 报 AUC + sensitivity/specificity
把 3,280 当图片数 数字口径错误 3,280 是受试者数
直接拼跨论文分数 划分不同不可比 同源对比或自跑基线
把 DR 分级与 CDR 混用 语义错误 区分病变分级 vs 视盘结构
假设有官方 split 复现不可比 自定划分并公开
断言"CC BY 4.0 即可商用" 忽略双口径 评估镜像再授权合法性

附录 T:检索路径示范(关键词组合与查询式)

目标 查询式示例
本体论文 "ORIGA(-light)" glaucoma retinal fundus database
精确数据集名 "ORIGA-light" optic disc cup segmentation
镜像 zenodo ORIGA REFUGE ACRIMA 10674885
队列来源 "Singapore Malay Eye Study" SiMES glaucoma prevalence
同类青光眼集 REFUGE challenge optic disc cup CDR
方法基线 optic disc cup segmentation ORIGA-light U-Net
结构字段 ISNT rule CDR RNFL optic disc assessment

附录 U:条目自评与维护触发点

触发点 应更新内容
官方重新托管 ORIGA-light §6 版本链、附录 B 可持续性评分
Zenodo 镜像变更/下架 §6、坑 2、附录 I
出现官方明确许可条款 坑 5、附录 H
新的权威基准汇总 §7.2、附录 C
库内新增青光眼条目 §8/§9 互链
下载实核完成 附录 R 各项

附录 V:给数据集综述作者的引用模板

撰写综述引用 ORIGA-light 时,建议采用如下结构化表述(避免笼统):

ORIGA-light(Zhang et al., EMBC 2010)是源自新加坡 SiMES 队列的 650 张非散瞳眼底图数据集(168 青光眼 + 482 正常),提供视盘/视杯边界标注与 13 项青光眼结构判读字段(CDR/ISNT/RNFL/PPA 等)。其原始发布渠道已失效,现行公开获取依赖 Zenodo 社区镜像(doi:10.5281/zenodo.10674885,CC BY 4.0)。该数据集无官方固定划分,跨研究报告的性能数字需绑定划分口径方能比较。

这段模板把"身份、规模、来源、标注、获取现状、划分警告"六要素一次说清,是最小充分引用。

附录 W:引文规范(BibTeX 与引用要点)

@inproceedings{zhang2010origa,
  title     = {ORIGA(-light): An Online Retinal Fundus Image Database for Glaucoma Analysis and Research},
  author    = {Zhang, Zhuo and Yin, Feng Shou and Liu, Jiang and Wong, Wing Kee and Tan, Ngan Meng and Lee, Beng Hai and Cheng, Jun and Wong, Tien Yin},
  booktitle = {2010 Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC)},
  pages     = {3065--3068},
  year      = {2010},
  doi       = {10.1109/IEMBS.2010.5626137},
  pmid      = {21096798}
}

引用要点:① 作者排序按原论文;② 页码 3065-3068;③ 会议名全称或规范缩写均可;④ 若引用镜像,另附 Zenodo DOI 10.5281/zenodo.10674885。

附录 X:本条目抓取时的核验快照(2026-09-30)

核验项 方法 结论
slug 查重 url_name ILIKE '%origa%' → 0 行 不撞库
官方原站 实抓 不可达(失效)
Zenodo 镜像 实抓 record 10674885 存在、CC BY 4.0、ORIGA.rar
主论文 IEEE/PubMed 记录 DOI + PMID 确认
库内眼底条目 查 rid refuge(62)/justraigs(746) 等,无同名
环境残留 `ps aux \ grep -c codebuddy`

附录 Y:缩写与术语中英对照(补充)

术语 英文 说明
非散瞳 non-mydriatic 不滴散瞳药的眼底照相
杯盘比 cup-to-disc ratio (CDR) 视杯/视盘直径比
神经视网膜边缘 neuroretinal rim 视盘内视杯外的组织环
视盘周围萎缩 peripapillary atrophy (PPA) 视盘周围的视网膜/脉络膜萎缩
观察者间变异 interobserver variability 不同判读者结论差异
外部验证 external validation 用他源数据测试模型
泛化 generalization 跨数据分布的表现
分层划分 stratified split 保持类别比例的数据划分

附录 Z:结语

ORIGA-light 是一个"小而重要"的数据集。它不靠数据量取胜,而靠"最早把青光眼结构判读语言数字化并公开"确立了自己的坐标。对今天的开发者,它的三重价值依次是:结构字段支撑可解释的多任务研究、OD/OC 边界支撑分割基准、作为老数据集承载"渠道失效—社区镜像承接"的可获取性研究样本。理解它的双口径(名称、许可、字段计数、性能、划分)与遗留疑点,比记住任何单一数字都更重要。

附录 AA:ORIGA-light 与视盘/视杯分割方法演进细表

时期 代表方法族 对 ORIGA-light 的用法 关注指标
2010-2014 主动轮廓、水平集、图割 直接训练与评测 定位准确率、边界误差
2015-2018 全卷积网络(FCN/U-Net) 训练分割 + 验证 Dice、IoU
2018-2021 注意力/多尺度/边界感知网络 验证集/外部测试 Dice、ASSD
2021-2024 自监督/半监督/多任务学习 小样本微调 + 泛化测试 Dice、跨集泛化
2024- 基础模型适配(SAM 类、眼科基础模型) 零样本/少样本评测 跨集 Dice、鲁棒性

这张表的意义不在于穷举方法,而在于说明 ORIGA-light 的"角色漂移":同一数据集在十余年间从"训练主场"变为"泛化考场",其 650 张标注的价值因此历久弥新。

附录 AB:数据规模与队列数字的口径速查

数字 含义 常见误用
650 ORIGA-light 图像数 误当受试者数
168 青光眼图像数 —
482 正常图像数 —
336 / 314 左眼 / 右眼图像数 —
3,280 SiMES 参与受试者数 误当图像数
4,168 SiMES 合格受试者基数 —
78.7% 响应率 —
4.79% / 3.6% 青光眼患病率(粗率/标化率) 误当 ORIGA-light 正类比例
25.8% ORIGA-light 正类占比(168/650) 与患病率混淆

最关键的一条区分:ORIGA-light 的正类占比 25.8% ≠ SiMES 队列患病率 4.79%。前者是"筛选后的数据集构成",后者是"人群流行病学率"。数据集为了研究需要刻意富集了青光眼样本,因此正类比例远高于自然患病率。交叉引用这两个数字会造成严重误解。

附录 AC:为什么数据集正类会被富集

在人群筛查型队列中,青光眼患病率只有约 4-5%,若直接按自然比例抽样,650 张图里只有约 30 张青光眼——对训练分类器严重不足。因此 ORIGA-light 的构建逻辑极可能是"在保留部分正常对照的同时,纳入尽可能多的青光眼阳性样本",从而把正类比例提升到约 25.8%。

这一逻辑的推论:

  1. 数据集不是队列的无偏随机样本——不能直接用它估计人群患病率。
  2. 数据集是为算法研究设计的富集样本——适合训练/评测分类器,不适合流行病学推断。
  3. 使用者在做"模型在真实人群中的预期阳性率"外推时,必须做患病率校正(prevalence adjustment),否则会高估模型的阳性预测值。

这是 ORIGA-light 与所有"病例对照式富集"医学数据集共有的性质,也是从数据到临床部署之间最容易被忽略的一步。

附录 AD:跨数据集泛化的常见陷阱

用 ORIGA-light 做外部验证时,常见陷阱:

陷阱 说明
相机/成像差异 ORIGA-light 来自特定非散瞳相机,他集可能是不同设备
人群差异 新加坡马来裔裔群,跨种族泛化未验证
标注体系差异 他集的 OD/OC 边界定义可能与 ORIGA-light 不同
预处理差异 裁剪、归一化、分辨率缩放不一致
标签定义差异 "青光眼"的诊断标准(结构/功能/综合)可能不同
类别比例差异 他集正类比例不同,直接影响阈值选择

做外部验证时,建议报告"跨集 Dice 下降幅度"而非单一跨集分数,并把上述差异逐条讨论。

附录 AE:条目写作的口径纪律(自我约束)

本条目为保持与千方病案医数集其他条目一致的口径纪律,做了如下约束:

  1. 所有硬数字可溯源:650/168/482/336/314/3072×2048/3,280 等均有来源(附录 C)。
  2. 双口径必存照:名称、许可、字段计数、性能、划分、获取渠道六项(附录 I)。
  3. 不确定项不臆断:格式细节、筛选规则、掩码完整度等写成遗留疑点(附录 R),不编造。
  4. 不做单一 SOTA 断言:性能数字并列多源并声明不可对齐(§7.2)。
  5. 不越界使用库内其他条目:仅互链,不修改他条目。

附录 AF:与任务头纪律包的对应关系

任务头要求 本条目落实位置
开工三查(锁/临时文件唯一化/环境残留) 附录 L + 汇报
存在性核验(三源互证) §2/§5/§6 + 附录 C
slug 查重(只读) 附录 X
九节 FACTS writing/origa-light/FACTS.md
成稿 1200-1900 行 本文件
坑点 ≥5(目标 8) §10(共 8 坑)
DAIMS 表 附录 B
cr:RecordSet 节点式 frontmatter schema_org
title 带站点后缀 frontmatter title

附录 AG:常见问答补遗

ORIGA-light 与 ORIGA 能否互作为训练/测试集?
理论上可以(同为青光眼视盘结构域),但由于"light"筛选规则未明示,若两集合存在样本重叠,会造成数据泄漏。在未确认二者样本关系前,不建议把 ORIGA 训练 + ORIGA-light 测试当作严格的跨集验证。

能否用 ORIGA-light 训练、在 REFUGE 上测试?
可以,这是常见的跨集泛化设置。但需注意 REFUGE 的分辨率、相机、标注定义与 ORIGA-light 不同,且 REFUGE 含 CDR 标签口径需对齐。

ORIGA-light 的 CDR 字段是否可直接当回归目标?
可以,但需理解其口径(垂直/水平)与数值分布,并按 CDR 分箱报告误差,而非只报总体 MAE。

数据集的"正常"是否包含其他眼病?
标注体系以青光眼为核心,"正常"通常指无青光眼性视神经损害;是否排除了糖尿病视网膜病变等其他眼病,论文未逐条明示,使用者应留意(属遗留疑点)。

能否用于儿童/青少年?
源队列为 40-80 岁成人,不适用于儿童青光眼研究。

附录 AH:数据集卡(Dataset Card 式摘要)

名称: ORIGA-light (ORIGA(-light))
类型: 眼底图数据集(视盘/视杯分割 + 青光眼结构判读)
规模: 650 张(168 青光眼 / 482 正常);336 左 / 314 右
规格: 3072×2048 RGB,非散瞳,FOV≈45°
来源: 新加坡 SiMES 队列(3,280 受试者,2004-2007,40-80 岁)
标注: OD/OC 边界 + 13 项结构字段(CDR/ISNT/RNFL/Notch/DH/PPA 等)
工具: ORIGA-GT(CERA 协议)
任务: 分割 / CDR 回归 / 青光眼分类 / ISNT 判读 / 结构多任务
划分: 无官方固定划分(文献 8:2 或 7:3)
获取: Zenodo 10.5281/zenodo.10674885(ORIGA.rar ≈475 MB)
许可: 原始 academic-use 声明;镜像 CC BY 4.0(双口径)
论文: EMBC 2010;2010:3065-3068, doi:10.1109/IEMBS.2010.5626137, PMID 21096798
互链: REFUGE(62) 首要 / JustRAIGS(746) 次之 / DR 系列互补

附录 AI:维护与版本记录

版本 日期 变更
v1.0 2026-09-30 首版建档(agent-a-origalight)

维护责任:千方病案医数集医学编辑部;触发更新条件见附录 U。

附录 AJ:写给使用者的一句话

如果你只从本条记住一件事,请记住这个:ORIGA-light 的"650"是富集后的图像数,不是人群比例;它的"CC BY 4.0"来自社区镜像,不是原始发布;它没有官方 test split——引用它之前,先把这三件事说清楚。

附录 AK:术语判读示例(CDR 与 ISNT 的组合逻辑)

为帮助使用者理解 13 项字段如何协同,举三个典型组合:

组合画像 CDR ISNT RNFL 判读倾向
典型正常 小 合规 无缺损 正常
数值型可疑 大 合规 无缺损 需结合视盘大小判断(大视盘生理性 CDR 大)
规则破坏型 不大 违规(下方最窄) 可能缺损 倾向青光眼
多征象型 大 违规 有缺损 + Notch 高度提示青光眼

这个示例说明:单一字段不足以判读,字段组合才有诊断意义。这也是 ORIGA-light 提供多字段而非单一标签的价值所在——它允许研究者构建"多字段联合"的判读模型,而不是把复杂的临床推理压缩成一个二值标签。

附录 AL:数据使用的最小合规声明模板

使用 ORIGA-light 发表研究时,建议在方法或数据可用性节包含如下声明:

本研究使用 ORIGA-light 数据集(Zhang et al., EMBC 2010;doi:10.1109/IEMBS.2010.5626137),经 Zenodo 镜像(doi:10.5281/zenodo.10674885)获取,镜像标注许可为 CC BY 4.0。原始发布渠道已失效,本研究按镜像口径使用并引用原论文。数据集无官方固定训练/测试划分,本研究采用 [X:Y] 分层划分(随机种子 [seed]),划分清单见 [补充材料]。数据源自新加坡 SiMES 队列,人群为 40-80 岁马来裔成人,跨人群泛化性未经验证。

这段模板把引用、获取、许可、划分、人群局限五项一次说清,可直接复用。

附录 AM:结语补遗与致谢

ORIGA-light 作为千方病案医数集"青光眼结构判读"条目之一,其建档目标不是复述一篇 2010 年的会议论文,而是把这份数据集的可用性事实(规模、标注、获取、许可、局限)结构化地呈现给今天的使用者。十余年过去,数据集的原始渠道已经消失,但它承载的结构判读语言(CDR/ISNT/RNFL/PPA)仍是青光眼 AI 的基础词汇。本条目力求让这份"地层标本"在新一代研究中继续可被准确引用与合法使用。

附录 AN:ORIGA-light 相关研究主题图谱(12 类常见选题)

为帮助研究者快速定位"用 ORIGA-light 能做什么",把常见选题归纳为 12 类:

# 选题 输入 输出 典型指标
1 视盘分割 眼底图 OD 掩码 Dice/IoU
2 视杯分割 眼底图 OC 掩码 Dice/IoU
3 联合 OD/OC 分割 眼底图 双掩码 平均 Dice
4 CDR 回归 眼底图/掩码 CDR 值 MAE/RMSE
5 CDR 分类 眼底图/掩码 CDR 分箱 准确率/κ
6 青光眼二分类 眼底图 青/正 AUC/F1
7 ISNT 判读 掩码/图 合规/违规 准确率
8 RNFL 缺损检测 眼底图 有/无 AUC
9 视盘出血检测 眼底图 有/无 AUC
10 PPA 检测 眼底图 有/无 AUC
11 多任务联合 眼底图 多字段 分项指标
12 跨集泛化 他集训练 ORIGA-light 测试 跨集差值

这 12 类选题的共同点是:它们都直接映射到 ORIGA-light 的某个标注维度,无需自造标签。这正是"标注充分"的数据集给研究带来的效率红利。

附录 AO:视盘/视杯分割的失败模式清单

在 ORIGA-light 上训练分割模型时,常见失败模式(供调试参考):

失败模式 表现 成因 缓解
视杯边界糊 OC Dice 明显低于 OD 视杯无明确解剖边界 边界感知损失、多尺度
血管干扰 视盘内血管被误分为视杯 血管遮挡 血管掩码辅助、注意力
光照不均 暗区漏检 非散瞳光照梯度 光照归一化、颜色校正
视盘 ROI 偏移 整体偏移 未裁剪 ROI 先定位后分割
大视盘过分割 大视盘溢出 尺度变化 多尺度训练
青光眼视杯欠分割 大 CDR 被低估 训练集正类少 加权损失

这份清单说明:ORIGA-light 虽是"经典易用"的数据集,但非散瞳图的成像特性决定了它有具体的技术挑战,而非"随便跑跑就 SOTA"。

附录 AP:与库内数据集的组合使用矩阵

研究者常把多个眼底数据集组合使用,下表给出 ORIGA-light 与库内条目的组合建议:

组合 用途 注意
ORIGA-light + REFUGE(62) 青光眼分割跨集训练/验证 分辨率与标注定义需对齐
ORIGA-light + DRISHTI-GS 类 扩大 OD/OC 训练样本 同任务、不同来源
ORIGA-light + JustRAIGS(746) 小样本微调 + 大规模预训练 量级差异大
ORIGA-light + messidor(59)/idrid(191) 青光眼+糖网多病种 标注体系不同,勿混用标签
ORIGA-light + rfmid(271)/odir(63) 多病种分类中的青光眼子任务 标签粒度不同

组合使用的核心原则是:任务相同才联合训练,任务不同只做多任务输出。把 ORIGA-light 的 CDR 标签与 DR 的病变分级硬拼成单一目标,是常见的错误。

附录 AQ:ORIGA-light 在"数据集金字塔"中的位置

眼科公开数据集可以粗略分为三层金字塔:

层级 特征 代表 ORIGA-light 位置
大规模预训练层 十万级图像、粗标签 EyePACS(58)、JustRAIGS(746) 不属于
中等规模训练层 千级图像、中等标签 messidor(59)、REFUGE(62)、DDR(201) 边缘(650 偏小)
小规模精标层 百级图像、精细标签 ORIGA-light(650)、IDRiD(191) 属于

ORIGA-light 位于"小规模精标层":其优势是标注精细(OD/OC 边界 + 13 字段),劣势是规模小。在"预训练 + 微调"范式下,它最适合作为精标微调集或外部验证集,而非从零训练集。这是它在数据集金字塔中最合理的使用定位。

附录 AR:一句话回应"为什么不用更新的数据集"

常见质疑:“既然有了 REFUGE、JustRAIGS,为什么还收录 ORIGA-light?”

三点回应:

  1. 历史引用的必要性:大量 2010-2020 年的青光眼影像论文以 ORIGA-light 为主基准,引用链不能断,新条目无法替代旧引用的索引功能。
  2. 结构字段的稀缺性:REFUGE 侧重分割+CDR,JustRAIGS 侧重转诊标签;ORIGA-light 的 13 项结构字段(ISNT/Notch/DH/PPA)覆盖面在库内仍属独特。
  3. 可获取性研究的样本价值:ORIGA-light 是"官方渠道失效—社区镜像承接"的典型案例,对研究数据集可持续性问题有独立价值。

收录老数据集不等于推荐只用老数据集,而是保证引用体系的完整性与可追溯性。

附录 AS:条目质量自检对照(check_md 与 preflight 项)

检查项 要求 本条目
行数 1200-1900(目标 1400-1700) 见汇报指纹
frontmatter 字段 title/subtitle/description/schema_org/category_tags/data_tags/patient_count/data_source ✔
schema_org 节点 MedicalWebPage/Dataset/cr:RecordSet/rai:dataLimitations ✔
章节 §0-§10 齐备 ✔
坑点 ≥6(目标 8) 8
DAIMS 存在 ✔(附录 B)
category_tags 词表内、2-6 个、≤100 字符 ✔(6 个)
G3 纯净度 无注释/占位/TODO/未定稿字样 ✔
代码块配对 偶数围栏 ✔
锚点唯一/重复标题 无冲突 ✔(preflight 0/0)

附录 AT:ORIGA-light 标注流程复原(据协议与工具推断)

论文未逐步公开标注流程,但据 CERA 协议与 ORIGA-GT 工具可复原出合理的操作序列,供使用者理解标签来源:

  1. 图像分级:眼科判读者先判断图像是否可分级(Gradability)。不可分级图不入库或不参与判读。
  2. 质量评级:对可分级图给出 Image Quality 等级。
  3. 视盘/视杯勾画:在 ORIGA-GT 中勾画 OD/OC 边界,形成边界标注。
  4. CDR 计算/记录:依勾画边界记录(或计算)垂直/水平 CDR。
  5. 结构征象判读:逐项判断 ISNT 合规、RNFL 缺损、Notch、DH、Alpha/Beta PPA。
  6. 元数据登记:记录 Laterality、Field、Disc Size、Disc Tilting Ratio。
  7. 备注:Comments 栏记录特殊情况。

这一序列的关键含义是:OD/OC 边界与结构字段出自同一次判读会话,因此二者在语义上自洽(比如 CDR 与勾画边界一致)。使用者若只用掩码而不用字段(或反之),相当于丢掉了同一判读的另一半信息。

附录 AU:为什么"非散瞳"是数据集的重要属性

眼底照相有散瞳(mydriatic)与非散瞳(non-mydriatic)两种。ORIGA-light 采用非散瞳,这一点影响深远:

维度 非散瞳 散瞳
使用场景 筛查、基层、快速 专科、精细诊断
成像质量 波动大、易受瞳孔小/介质混浊影响 稳定、视场大
患者体验 无药物、即拍即走 需滴药、有禁忌
对算法要求 需鲁棒于质量波动 相对稳定

ORIGA-light 选择非散瞳,使它与筛查部署场景更贴近:真实筛查里不可能人人散瞳。因此在该数据集上训练/评测的模型,天然更接近筛查落地条件。这也是它虽有质量波动、却比散瞳数据集更具部署参考价值的原因。相应地,图像质量与可分级性字段的存在,正是为应对非散瞳的质量方差。

附录 AV:SiMES 队列背景补充

Singapore Malay Eye Study(SiMES)是新加坡三大族群眼病研究之一(另为华裔 SiNES 类、印度裔 SINDI 类),聚焦马来裔人群的眼病流行病学。其意义:

  • 人群代表性:东南亚马来裔人群在眼病流行病学中的代表性此前较弱,SiMES 补齐了这一块。
  • 标准化检查:队列采用标准化检查流程,眼底照相、视力、屈光、眼压等系统采集,为影像数据集提供了可靠来源。
  • 多病种数据:队列不仅用于青光眼,也用于糖网、白内障等研究,因此 ORIGA-light 只是其影像分支之一。

对 ORIGA-light 使用者的含义:数据集的人群层面信息(族群、年龄、地域)来自 SiMES 设计,跨人群泛化时必须回到这些背景来讨论。

附录 AW:数据集命名与检索的进一步说明

"ORIGA"一词的来源未在论文中详细解释,社区通常将其理解为与"ORIGA"项目名相关。围绕命名,检索时需注意:

  1. 大小写:官方多写 ORIGA(全大写),检索时注意平台大小写敏感性(多数不敏感)。
  2. 连字符:ORIGA-light 含连字符,去掉连字符会命中其他内容。
  3. 括号:标题中的 “(-light)” 在多数检索系统中需处理为 “ORIGA” 或 “ORIGA-light”。
  4. 中文检索:中文文献多译"ORIGA 数据集"或"ORIGA-light 数据集",检索中文时结合"青光眼 视盘 分割"。
  5. 易混:与"ORIGA"同名的非医学项目(如某些厂商/软件)可能在通用检索中干扰,需用 “fundus” 或 “glaucoma” 限定。

附录 AX:与 REFUGE 的详细对照

REFUGE 与 ORIGA-light 是库内最相关的两个青光眼数据集,详细对照如下:

维度 ORIGA-light REFUGE
发布年份 2010 2020(MICCAI 挑战赛)
规模 650 图 1,200 图(训练 400/验证 400/测试 400)
来源 新加坡 SiMES 多中心(含中国、波兰等)
任务 OD/OC 分割 + 青光眼分类 + CDR OD/OC 分割 + 青光眼分类 + CDR
官方划分 无 有(挑战赛固定划分)
结构字段 13 项(含 ISNT/RNFL/PPA) 以分割+CDR+分类为主
获取 Zenodo 镜像 官方挑战赛页面/镜像
库内 rid 本条 62

对照结论:REFUGE 在"标准化划分、规模、多中心"上全面升级,ORIGA-light 在"结构字段丰富度、历史地位"上独特。二者互补,非替代关系。

附录 AY:青光眼 AI 的临床落地背景

ORIGA-light 服务的青光眼 AI,其临床落地背景值得一提(帮助理解数据集为何重要):

  • 青光眼是不可逆致盲主因之一:早期无症状,晚期不可逆,因此早筛是核心。
  • 筛查瓶颈在眼科医生:人群基数大、专科医生少,自动化筛查价值高。
  • 结构判读是关键环节:眼底照相是最易获取的筛查手段,视盘判读是核心。
  • 数据是瓶颈:高质量、带结构判读的公开眼底数据稀缺——ORIGA-light 正是在这一背景下产生。

因此 ORIGA-light 的意义不止于"一个数据集",而在于它是"用 AI 缓解青光眼筛查人力瓶颈"这一目标的早期数据基础设施。

附录 AZ:条目索引与交叉引用表

本条目位置 主题 相关库内条目
§2.5 / §9 眼底数据集景观 refuge(62)/justraigs(746)/DR 系列
§3 新加坡眼科 AI 传统 refuge(62)
§4 青光眼结构字段 refuge(62)
§6 获取与许可 各条目获取方式对照
§7 评测基准 refuge(62)
附录 AX REFUGE 详细对照 refuge(62)

附录 BA:FAQ 补充(10 问)

Q29:ORIGA-light 的图像是否含患者隐私信息?
数据集为去标识化(de-identified)图像,不含直接身份信息。

Q30:能否用于非青光眼研究?
图像本身可做通用眼底研究(如血管、亮度分析),但标注仅覆盖青光眼结构。

Q31:CDR 字段是连续值还是分级?
以连续/半连续记录为主,可按需分箱。

Q32:ISNT 是二值还是四类?
通常为合规/不合规的二值判读,但其推导依赖四象限宽度。

Q33:数据集是否含双眼配对?
含左右眼图像,但论文未明示是否保留同一个体的双眼配对关系,使用前需确认(遗留疑点)。

Q34:是否支持多标签?
结构字段天然构成多标签空间,可做多标签学习。

Q35:图像是否统一裁剪到视盘?
未明示,通常为整幅眼底图,使用者可自行裁剪 ROI。

Q36:能否用 SAM 之类基础模型直接分割?
可作为零样本基线,但仍建议在 ORIGA-light 上微调以对齐 OD/OC 定义。

Q37:如何报告跨集结果?
报告"在 ORIGA-light 上的 Dice 相较训练集下降 X",并讨论成像/人群差异。

Q38:Zenodo 下载慢怎么办?
可尝试镜像加速或分块下载,务必核 MD5 确认完整性。

附录 BB:数据完整性校验建议

下载 ORIGA.rar 后建议进行的校验:

校验项 方法
文件完整性 核 MD5 = 308b66f83325a18da09504a3b6c1c5cd
解压成功 用 rar 兼容工具解压
图像计数 统计图像文件数是否与文献 650 一致
标注配对 检查每图是否有对应边界/字段
标签分布 统计青光眼/正常比例是否接近 168/482

若实际计数与文献不符,属"下载实核后应更新的条目"(附录 R),应在使用前澄清。

附录 BC:结语(二)

数据集的生命周期往往长于其发布渠道。ORIGA-light 的原始官网已经消失,但它的 650 张图、13 项结构字段与 OD/OC 边界仍在 Zenodo 镜像中流通,仍在被新一代青光眼 AI 论文引用。这提醒我们:数据的价值在于内容,而内容的存续依赖托管。本条目的建档,既是对一份经典数据集的记录,也是对"数据可持续性"这一 AI-Ready 核心命题的一次具体呈现。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • riga — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 评测基准 / 图像分类
  • g1020 — 共享标签:眼科影像 / 医学图像分割 / 青光眼 / 评测基准 / 图像分类
  • drions-db — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 评测基准
  • justraigs — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准 / 图像分类
  • refuge2 — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼 / 图像分类
  • acrima — 共享标签:医学影像 / 眼科影像 / 青光眼 / 评测基准 / 图像分类
  • refuge — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 青光眼
  • oimhs — 共享标签:医学影像 / 眼科影像 / 医学图像分割 / 图像分类
  • papila — 共享标签:眼科影像 / 医学图像分割 / 青光眼 / 图像分类
  • gamma — 共享标签:医学影像 / 眼科影像 / 青光眼

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集