PAPILA (papila) — 同一患者双眼配对眼底图与临床数据的青光眼评估数据集 — AI-Ready Wikipedia

244 患者 / 488 眼配对彩色眼底图 + 结构化临床指标 + 双专家逐像素视杯/视盘分割,西班牙 UPCT 与 Reina Sofía 医院联合出品:首份把「配对双眼、临床表格、双标分割」三合一的青光眼评估数据集,观察者间 Dice 视盘 0.935 / 视杯 0.823,且 suspect 类被证明不是 healthy 与 glaucoma 之间的中间态

来源 西班牙 Hospital General Universitario Reina Sofía 采集:Topcon TRC-NW400 非散瞳眼底相机拍摄的 2576×1934 JPEG 眼底图(30° 孔径、以视乳头为中心)× 488 眼 + 结构化临床表格(年龄/性别/诊断/IOP/角膜厚度/眼轴长/MD 等)+ 两位眼科专家逐像素勾画的视杯与视盘轮廓坐标(2 专家 × 2 眼 × 2 结构 × 244 患者 = 1952 文件)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 8
PAPILA (papila) — 同一患者双眼配对眼底图与临床数据的青光眼评估数据集 — AI-Ready Wikipedia

信息速览

数据集名称PAPILA (papila) — 同一患者双眼配对眼底图与临床数据的青光眼评估数据集 — AI-Ready Wikipedia
数据类型人工标注,影像数据,临床数据,原始数据
规模244 患者 / 488 眼(每位患者左右眼各 1 张眼底图,共 488 张)
接入方式西班牙 Hospital General Universitario Reina Sofía 采集:Topcon TRC-NW400 非散瞳眼底相机拍摄的 2576×1934 JPEG 眼底图(30° 孔径、以视乳头为中心)× 488 眼 + 结构化临床表格(年龄/性别/诊断/IOP/角膜厚度/眼轴长/MD 等)+ 两位眼科专家逐像素勾画的视杯与视盘轮廓坐标(2 专家 × 2 眼 × 2 结构 × 244 患者 = 1952 文件)
AI 就绪度

INFOBOX — PAPILA 一屏速览

维度 内容
本质 同一患者双眼配对的彩色眼底图 + 临床数据 + 双专家视杯/视盘分割,用于青光眼评估
全称 PAPILA: Dataset with fundus images and clinical data of both eyes of the same patient for glaucoma assessment
团队 西班牙卡塔赫纳理工大学(UPCT)+ 穆尔西亚 Reina Sofía 大学总医院(HGURS),6 作者
论文 Sci Data 2022 Jun 9;9(1):291(doi:10.1038/s41597-022-01388-1;PMID 35680965;PMCID PMC9184612)
勘误 Author Correction,Sci Data 2024;11(1):391(doi:10.1038/s41597-024-03175-6),仅资助文字更正
规模 244 患者 / 488 眼(双眼配对)/ 488 张眼底图
图像 2576×1934 像素,JPEG,30° 孔径,以视乳头(papilla)为中心,Topcon TRC-NW400
类别 healthy 333 / glaucoma 87 / suspect 68(眼级,论文 Table 4)
分割 2 专家 × 2 眼 × 2 结构 × 244 患者 = 1952 个轮廓坐标文件
一致性 观察者间 Dice:视盘 0.935 ± 0.036,视杯 0.823 ± 0.089(视盘优于视杯)
临床字段 年龄/性别/诊断/IOP/角膜厚度/眼轴长/MD/屈光不正/phakic 状态
获取 figshare 匿名直接下载(DOI 10.6084/m9.figshare.14798004,当前 v2)
许可 数据集 figshare 页 GPL 3.0+(权威);论文本体 CC BY 4.0
库内互链 refuge(62) > justraigs(746) > rim-one(291) > drishti-gs(301) > g1020* > origa-light* > messidor(59) > ddr(201) > idrid(191)

PAPILA 是青光眼 AI 领域一份"结构最讲究"的小数据集:它只有 244 位患者、488 只眼睛、488 张眼底图,规模远不及 EyePACS 那类十万级集合;但它做到了别的眼底数据集几乎都没做到的一件事——把同一位患者的左右眼配成对、附上结构化临床指标、再请两位眼科专家把视杯和视盘逐像素描出来。论文和第三方综述都把它称作第一份"提供同一受试者双眼彩色眼底图与临床数据"的青光眼评估数据集。这正是它的价值所在:青光眼常双眼不对称进展,配对双眼能让模型学"同一人两只眼的差异",而不是把每只眼当成互不相关的样本。

PAPILA 还有一记"反直觉"的发现常被引用:可疑青光眼(suspect)这一标签并不是健康与青光眼之间的过渡态——在特征空间里它并不落在两者中间,而更像一个"未解决的第三类",会扰乱 healthy/glaucoma 的判别边界。这一结论直接影响了后续用 PAPILA 做二分类还是三分类的取舍。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——figshare 匿名直链,注意"数据集 GPL 3.0+、论文 CC BY 4.0"的双口径,以及"引论文而非数据仓"的引用要求。
  2. 关心标签与质控:直奔 §4 规模与 §5 任务标注——类别分布、缺失数据表、双专家 Dice 与 CDR 一致性是理解这份数据集可信度的钥匙。
  3. 担心小数据集能不能用:直奔 §7 评估基准与 §10 避坑清单——论文自设基线的诚实结论(图像三分类很难、suspect 类捣乱)和七条双口径存照都在那里。

§0 导读:这个数据集解决什么问题

青光眼是全球不可逆致盲的首要病因,而它最狡猾的地方在于早期几乎无症状,等患者自己察觉视野缺损时,视神经往往已经损伤大半。因此青光眼筛查的核心任务,是在视盘形态还只是"可疑"的阶段把它识别出来。临床上最常用的量化线索是杯盘比(cup-to-disc ratio, CDR):视杯相对视盘的比值越大,越提示青光眼性视神经损害。而要从眼底图上自动算 CDR,就必须先把视杯(optic cup, OC)和视盘(optic disc, OD)这两种解剖结构从图像里精确分割出来——这就把问题拆成了两件事:分割(描出视杯/视盘边界)与分类(判定健康/青光眼/可疑)。

PAPILA 正是冲着这两件事设计的。它同时提供了:

  • 488 张以视乳头为中心的彩色眼底图(244 患者双眼配对);
  • 每位患者双眼的结构化临床指标(眼压、角膜厚度、眼轴长、视野平均缺损等);
  • 两位眼科专家独立勾画的视杯/视盘轮廓,可用于评估分割算法的上限与观察者间变异。

它想解决的具体痛点有三个。第一,配对双眼的缺失:绝大多数眼底数据集把每只眼当独立样本,丢失了"同一患者"这一强约束,而青光眼恰恰是双眼不对称进展的疾病。第二,临床指标的缺失:很多眼底数据集只有图和一个诊断标签,没有眼压、角膜厚度这些可以佐证诊断的数值,模型只能"看图说话"。第三,分割标注可信度的缺失:视杯边界本身主观性高,单专家标注无法暴露这一主观性,PAPILA 用双专家 + 双时点(间隔 2 年重标)把这个不确定性量化了出来。

§0 读法三则:

  1. 这个条目是"小数据集 + 强结构 + 诚实基线"的组合:规模只有 488 眼,但配对双眼、临床表格、双专家分割三件套齐全——读它的价值不在数量,在结构与质控方法(§4、§5)。
  2. 全文数字均出自论文正文与表格;论文与第三方目录之间的冲突(license、版本、类别计数、FOV)已逐条在坑 1–坑 7 存照,转引前务必回查原始 Table 4。
  3. 如果你在找"大规模青光眼筛查数据",PAPILA 不是答案(488 眼太小);如果你在找"能研究双眼配对的临床-影像多模态数据",它是目前最干净的选择之一。

§1 数据集速览:十问十答

Q1:PAPILA 这名字什么意思,"488 张"是怎么来的?
“PAPILA"取自西班牙语里视盘/视乳头的别称 papila(对应英文 papilla,即视神经乳头),因为所有眼底图都以视乳头为中心拍摄。488 张 = 244 位患者 × 每位患者左右眼各 1 张。这是"双眼配对"的题眼:数据集不是 488 个独立样本,而是 244 对"同一人的左右眼”。

Q2:图像规格是什么?
分辨率 2576 × 1934 像素、JPEG 格式、8 bit/通道,用 30° 孔径、以视乳头为中心拍摄。采集设备是 Topcon TRC-NW400 非散瞳眼底相机(non-mydriatic)。文件名形如 RET047OD.jpg——RET + 三位患者号 + OD(右眼)/OS(左眼)。

Q3:类别怎么分布?
论文 Table 4 按眼级给出三分类(这里必须记牢,第三方常把它写反):

  • Healthy(健康):右眼 170 + 左眼 163 = 333 眼
  • Glaucoma(青光眼):右眼 40 + 左眼 47 = 87 眼
  • Suspect(可疑):右眼 34 + 左眼 34 = 68 眼

合计 488 眼。注意 87 + 68 = 155 是"青光眼或可疑"的合并数(论文 Table 1 对比表就是这么合并的),别把 155 当成青光眼单类。

Q4:谁标注的,可靠吗?
视杯/视盘轮廓由两位 Reina Sofía 医院眼科专家独立手工勾画:Expert #1 从业 2 年、Expert #2 从业 27 年——经验差 25 年,这是刻意保留的观察者间变异来源。用 Sørensen-Dice 系数衡量一致性:观察者间(全 488 眼)视盘 0.935 ± 0.036、视杯 0.823 ± 0.089。结论是:视盘边界清晰、标注一致性好;视杯边界主观性高、一致性明显更低——这本身就是研究分割算法不确定性的一手材料。

Q5:临床数据都有哪些字段?
每位患者有左右眼两列记录:患者唯一 ID、年龄、性别(0=男/1=女)、诊断(0=healthy/1=glaucoma/2=suspect)、屈光不正、phakic/pseudophakic(晶状体状态)、眼压(IOP)、角膜厚度(pachymetry)、眼轴长(axial length)、视野平均缺损(mean defect, MD)。其中 MD 仅对青光眼组(Group 1)采集,healthy 患者普遍缺失。

Q6:数据有缺失吗?
有,且作者刻意保留,供研究缺失值处理的方法使用。论文 Table 5:角膜厚度缺 6 例(ID 19/20/46/57/114/116)、眼轴长缺 4 例(19/48/64/79)、眼压缺 2 例(213/218)、屈光不正缺 1 例(213)。患者 213 一人就缺眼压和屈光不正两项。

Q7:诊断标签是怎么定的?图像判读还是临床诊断?
基于临床数据综合判定,必要时回顾病史,由眼科医生给出三分类诊断。也就是说标签的可信度锚定在临床诊断上,而不是"看图猜"。这一点很关键——它意味着 PAPILA 的分类标签比纯图像印象标签更硬。

Q8:患者是怎么招募分组的?
两组来源。Group 1 是单纯慢性青光眼患者(从 HGURS 青光眼门诊招募)。Group 2 是初级保健来源、眼科检查未显示可影响视神经形态的眼病理者,又细分 2.a(无青光眼相关病变且 IOP ≤ 22 mmHg)与 2.b(高眼压 IOP 22–28 mmHg 但无视野损害)。Group 2 的样本量按穆尔西亚 VII 区人口、40 岁以上单纯慢性青光眼患病率 3.5%、置信水平 95%、误差 3% 估算。

Q9:我现在怎么拿到它?
figshare 匿名直接下载(DOI 10.6084/m9.figshare.14798004),无需注册、无需申请——这对 AI-Ready 很友好。当前最新版本是 v2(2022-05-06 发布,PAPILA.zip 约 563.49 MB),而论文正文写的是引用 v1。figshare 页明确要求"引用论文而非数据仓"。

Q10:为什么它对 AI-Ready 重要?
它是一份"小规模但结构完备"的样本:配对双眼允许多模态/双眼联合建模,临床表格连接影像与结构化数据,双专家分割量化了标注不确定性,而且获取门槛极低(匿名直链)。它的短板也清晰——规模小、单中心、类不平衡、含"未解决类" suspect——正适合作为"小数据 + 强结构"这条路线的教学样本。

§2 数据构成与规格

2.1 规模、来源与机构构成

PAPILA 由两家西班牙机构联合产出:

  • Universidad Politécnica de Cartagena(UPCT,卡塔赫纳理工大学)——技术研发主体,负责图像/信号处理与机器学习方法;
  • Hospital General Universitario Reina Sofía(HGURS,穆尔西亚 Reina Sofía 大学总医院)——临床数据采集、患者招募、眼科专家标注。
维度 数值
患者数 244
眼数 488(双眼配对,每患者左右眼各 1)
眼底图数 488
分割轮廓文件 1952(2 专家 × 2 眼 × 2 结构 × 244 患者)
图像分辨率 2576 × 1934 px
图像格式 JPEG,8 bit/通道
拍摄孔径 30°(以视乳头为中心)
采集设备 Topcon TRC-NW400(非散瞳)
数据包体量 约 563.49 MB(figshare v2)

6 位作者中,4 位来自 UPCT(一作 Oleksandr Kovalyk、Juan Morales-Sánchez、Rafael Verdú-Monedero、José-Luis Sancho-Gómez),2 位来自 HGURS 眼科(Inmaculada Sellés-Navarro、Ana Palazón-Cabanes)。伦理方面走的是医院伦理委员会批准 + 患者签署知情同意的常规路径。

2.2 图像规格与目录结构

数据包解压后目录结构清晰:

PAPILA_DBv1/
├── ClinicalData/          # 左右眼两列结构化临床表格
├── ExpertsSegmentations/  # 两位专家的视杯/视盘轮廓坐标(纯文本)
├── FundusImages/          # 488 张 JPEG 眼底图
└── HelpCode/              # Python 示例脚本 + Jupyter Notebook

图像文件命名规则 RET<三位患者号><OD|OS>.jpg,例如 RET047OD.jpg 是第 47 位患者的右眼(OD = Oculus Dexter),RET047OS.jpg 是同一患者的左眼(OS = Oculus Sinister)。分割文件在同一套前缀后追加结构与专家标记:RET047OD_cup_exp1.txt(第 47 号患者右眼、视杯、1 号专家)——共 _cup/_disc × _exp1/_exp2 四种组合,纯文本存 X/Y 节点坐标,人工逐点连线成多边形轮廓。

HelpCode 目录随包提供 Python 示例脚本和 Jupyter Notebook,是官方给出的读取/可视化入口。需要注意的是,论文没有独立的 Code availability 章节,也没有独立的 GitHub 代码仓——这些示例代码是随 figshare 数据包一起发的。

2.3 类别体系与眼级分布

PAPILA 的分类标签是三分类(眼级):

类别 编码 右眼 左眼 合计 占比
Healthy(健康) 0 170 163 333 68.2%
Glaucoma(青光眼) 1 40 47 87 17.8%
Suspect(可疑) 2 34 34 68 13.9%
合计 — 244 244 488 100%

这是一处高频坑:FusionFM(arXiv:2508.11721)与 VOxSeg(Sci Rep 2025)等第三方文献的部分段落把 glaucoma 与 suspect 的计数写反(“suspected 87 / confirmed glaucoma 68”),与原始 Table 4 相反。以论文 Table 4 眼级计数为准:glaucoma = 87、suspect = 68。

除三分类外,论文的对比表(Table 1)把 glaucoma 与 suspect 合并成"Glaucoma (or suspect) = 155"来和别的数据集比规模——这是合并口径,不是 glaucoma 单类数量,读的时候要分清。

2.4 临床数据结构与缺失

ClinicalData 目录中每位患者有左右眼两列记录,字段包括:

  • 患者唯一 ID
  • 年龄、性别(0=男 / 1=女)
  • 诊断(0=healthy / 1=glaucoma / 2=suspect)
  • 屈光不正(refractive error)
  • phakic/pseudophakic(1=晶状体已摘除 / 0=保留)
  • 眼压 IOP
  • 角膜厚度 pachymetry
  • 眼轴长 axial length
  • 视野平均缺损 mean defect(MD)

缺失情况(论文 Table 5)如下,作者明确保留这些不完整记录,目的是让研究者可以测试缺失数据处理方法:

字段 缺失患者 ID 缺失数
角膜厚度 pachymetry 19, 20, 46, 57, 114, 116 6
眼轴长 axial length 19, 48, 64, 79 4
眼压 IOP 213, 218 2
屈光不正 213 1

其中 MD 仅对青光眼组(Group 1)采集,healthy 患者普遍没有 MD 值——这意味着 MD 不能当作全数据集的监督信号,只能用于青光眼亚组的视野损害分级。

2.5 采集设备与配套检查

主采集设备是 Topcon TRC-NW400 非散瞳眼底相机。为支撑临床诊断,配套使用的检查设备(论文 Table 2)包括:

设备 用途
Nidek ARK-710 A 验光 / 角膜曲率
Nidek NT-2000 非接触眼压计(IOP)
Rodenstock REM 3000 镜面显微镜角膜测厚(pachymetry)
Zeiss IOL Master 500 光学生物测量(眼轴长)
Zeiss Humphrey 750i 视野分析 30-2 程序(MD)

这套设备清单说明 PAPILA 的临床字段不是"顺手记的",而是按标准眼科检查流程采集的结构化数据——这也是它临床字段可信度较高的原因。

2.6 与库内其他眼底数据集的构成差异

PAPILA 的结构在库内眼底家族中很特殊,差异集中在这一张对照上:

数据集 主任务 双眼配对 临床指标 专家分割 规模
PAPILA 青光眼分类 + OD/OC 分割 是 是(结构化) 双专家 488 眼
refuge(62) 青光眼 OD/OC 分割 + CDR 否 有限 单人/挑战赛 1200 图
justraigs(746) 青光眼转诊分类 否 有限 否 更大
messidor/ddr/idrid/eyepacs 糖尿病视网膜病变分级 否 部分 否 中大
rim-one(291)/drishti-gs(301) 单眼 OD/OC 分割 否 否 单专家 小

PAPILA 的独特性一句话概括:它是库内唯一同时满足"配对双眼 + 结构化临床 + 双专家分割"三条件的眼底数据集。规模上它不占优势,结构上它几乎是最讲究的。

§3 团队、机构与合作谱系

3.1 出品方:一所理工大学 + 一家大学总医院的组合

PAPILA 的署名机构只有两家,但这两家覆盖了这类数据集最需要的两端能力:

  • Universidad Politécnica de Cartagena(UPCT,西班牙卡塔赫纳理工大学)——技术研发主体。负责图像与信号处理、机器学习建模、标注工具的编写、数据集的组织与发布。一作与两位通信作者都在这里。
  • Hospital General Universitario Reina Sofía(HGURS,西班牙穆尔西亚雷纳索菲亚大学总医院)——临床侧主体。负责患者招募、眼科检查、临床数据的采集与整理、以及两位眼科专家的视杯/视盘分割标注。

这种"理工大学 + 大学医院"的双机构结构,是 PAPILA 能同时把"结构化临床表格"和"专家逐像素分割"做扎实的组织前提。很多单纯由成像实验室发布的数据集,临床字段要么缺失、要么是回顾性拼凑;PAPILA 的临床字段是从门诊检查流程中成套采集的(设备清单见 §2.5)。

两家机构都在穆尔西亚(Murcia)大区:UPCT 在卡塔赫纳(Cartagena),HGURS 在穆尔西亚市,同属一区,这也是"患者样本来自穆尔西亚第七区人口"(见 §4.6)这一抽样来源能成立的地理基础。

3.2 六位作者与分工

论文共 6 位作者,署名顺序与角色如下:

位次 作者 机构 角色/方向
1(一作/通信) Oleksandr Kovalyk UPCT 主要实现者;通信邮箱 oleksandr.kovalyk@edu.upct.es
2 Juan Morales-Sánchez UPCT 图像/信号处理
3 Rafael Verdú-Monedero UPCT 图像/信号处理
4 Inmaculada Sellés-Navarro HGURS 眼科 临床与标注;inmasell@um.es
5 Ana Palazón-Cabanes HGURS 眼科 临床与标注
6(通信) José-Luis Sancho-Gómez UPCT 通信方向负责人

作者队伍是"4 技术 + 2 临床"的配比——正好对应数据集的两半:图像/分割/模型侧由 UPCT 承担,诊断与临床数据侧由 HGURS 的两位眼科医生承担。

各作者 ORCID(Europe PMC 链接口径):Kovalyk 0000-0003-4815-8248;Morales-Sánchez 0000-0002-2894-3292;Verdú-Monedero 0000-0001-9227-7397;Sellés-Navarro 0000-0002-8757-2559;Sancho-Gómez 0000-0001-8009-1616。

3.3 两位标注专家:一场刻意的"经验差"设计

PAPILA 分割标注最有意思的一点,是它把标注员本身也当成数据集的一部分来交代清楚:

  • Expert #1:从业 2 年
  • Expert #2:从业 27 年

两人经验差 25 年。这不是疏漏,而是刻意保留的观察者间变异来源——正因为把"一个新手和一个资深专家"的分割都收进来,数据集才能用来量化"视杯边界到底有多主观"这个问题(结果见 §5.5:视盘一致性高、视杯一致性明显偏低)。换句话说,经验差不是噪声,是被设计进去的"实验条件"。

两位专家都属于 HGURS 眼科,与作者第 4、5 位同机构。标注使用团队自研的轮廓编辑工具(具备图像查看、缩放、轮廓编辑能力),以手工逐像素打点、再用线段连接的方式勾画视盘与视杯轮廓(标注协议细节见 §5.4)。

3.4 临床分组:Group 1 / 2 / 2.a / 2.b

患者并非随机抓取,而是按来源与眼健康状态分成两组,这决定了标签的人群分布:

分组 来源 定义
Group 1 HGURS 青光眼门诊 单纯慢性青光眼患者(已知青光眼)
Group 2 初级保健来源 眼科检查未显示可影响视神经形态的眼病理者
Group 2.a Group 2 细分 无青光眼相关病变,且 IOP ≤ 22 mmHg(正常眼压)
Group 2.b Group 2 细分 高眼压 IOP 22–28 mmHg,但无视野损害(高眼压症/可疑)

这个分组设计直接对应三分类标签:Group 1 基本落在 glaucoma 类,Group 2.a 主要落在 healthy 类,Group 2.b 则构成 suspect 类的主要来源。理解这个映射,才能理解为什么 PAPILA 的三类不平衡是"结构性"的、而非采样偶然(类别计数与不平衡的量化见 §4.3)。

3.5 伦理与合规

数据集经医院伦理委员会批准,所有参与者签署知情同意(informed consent)。这两条在医学数据集条目里看似套话,但对 PAPILA 尤其关键——因为它公开的是同一患者双眼图像 + 年龄/性别/诊断/IOP 等临床字段的组合,属于需要"配对身份但不泄露身份"的敏感结构(患者仅以三位数字 ID 标识,命名如 RET047OD,不含姓名等直接标识)。

3.6 与库内同类数据集的组织模式对照

数据集 出品方类型 标注组织 临床数据
PAPILA 理工大学 + 大学医院 两位专家(经验差 25 年) 成套结构化
refuge(62) 挑战赛联盟 挑战赛标注团 有限
justraigs(746) 医院/研究组 转诊标签 有限
messidor(59) 研究联盟 单套分级 部分

PAPILA 在"双专家 + 经验差"上的组织设计,是它在库内青光眼家族中相对独特的方法学卖点——refuge(62) 虽有分割任务,但采用的不是"同一批图像双专家独立标注"这种可直接量化观察者变异的组织方式。

§4 数据规模、类别分布与质量硬数字

这一节集中给出 PAPILA 的"硬数字":规模、分辨率、类别计数、缺失数据、分割质控指标。凡存在跨来源冲突的,均按"双口径存照"处理(冲突清单见 §9)。

4.1 总规模与层级结构

PAPILA 的规模可以用三个数字锁死:

  • 244 位患者
  • 488 只眼(每位患者左右眼各 1 只)
  • 488 张眼底图(每只眼对应 1 张,无重复、无多角度)

层级很清晰:患者 → 双眼 → 每眼 1 图 + 每眼 2 套专家分割轮廓。正因为"每位患者两只眼都在",PAPILA 才能支撑"同一患者双眼配对"这类别的眼底数据集难以支持的研究(例如双眼间不对称性、患者级聚合建模)。

4.2 图像规格与目录

属性 值
分辨率 2576 × 1934 像素
格式 JPEG
位深 8 bit/通道
视场(FOV) 论文口径 30° 孔径,以视乳头(papilla)为中心(第三方 45° 口径见 §9 存照 4)
命名 `RET<三位患者号><OD

数据包内目录结构为:

PAPILA_DBv1/
├── ClinicalData/            # 结构化临床表格(左右眼分列)
├── ExpertsSegmentations/    # 双专家视杯/视盘轮廓坐标
├── FundusImages/            # 488 张 JPEG 眼底图
└── HelpCode/                # 脚本 + Jupyter Notebook 示例(PythonExample_Notebook)

约定 OD = 右眼、OS = 左眼——这个左右眼编码在后续所有分割文件和临床表中保持一致,是跨目录对齐的主键基础。

4.3 类别分布(眼级计数,论文 Table 4)

这是全文最容易被转述者弄错的数字,务必按论文 Table 4 的眼级计数为准:

类别 右眼 左眼 合计(眼)
Healthy(健康) 170 163 333
Glaucoma(青光眼) 40 47 87
Suspect(可疑) 34 34 68
合计 244 244 488

三点必须并存理解:

  1. 眼级计数:333 / 87 / 68,合计 488。healthy 占 68.2%,glaucoma 仅 17.8%,suspect 13.9%——结构性类不平衡(这直接解释 §7 里"三分类很难、suspect 捣乱"的基线结论)。
  2. 左右眼小计均为 244,与患者数一致,佐证"每位患者双眼齐备"。
  3. 论文 Table 1 的对比表把 glaucoma 与 suspect 合并记为 155(标注为 “Glaucoma (or suspect)”,即 87 + 68 = 155)。Table 1 是横向对比表、Table 4 是分布明细表,读数时不要把 155 当成某一类的计数。

口径提示:部分第三方文献把这三类写反,例如写作"suspected 87 / confirmed glaucoma 68"——这与原始 Table 4 恰好相反。凡遇到这类转述,一律回查论文 Table 4(详见 §9 存照 3)。

4.4 分割文件数与命名

分割目录的文件总数可以精确推出:

2 位专家 × 2 只眼 × 2 个结构(cup/disc) × 244 位患者 = 1,952 个轮廓文件

命名规则为 RET<患者号><OD|OS>_<cup|disc>_exp<1|2>.txt,例如 RET047OD_cup_exp1.txt。文件内容是纯文本的 X/Y 节点坐标序列(逐点打点连成的多边形轮廓),不是二值掩膜图像——使用者需自行按坐标栅格化为掩膜,或直接做多边形比对。

4.5 临床字段与缺失数据(论文 Table 5)

临床表格按右眼、左眼两个子表分列,包含以下字段:

字段 含义 取值说明
患者唯一 ID 患者标识 三位数字
年龄 年龄 数值
性别 性别 0 = 男 / 1 = 女
诊断 三分类标签 0 = healthy / 1 = glaucoma / 2 = suspect
屈光不正 屈光不正 数值
phakic 晶状体状态 1 = 晶状体已摘除 / 0 = 保留
IOP 眼压 mmHg
pachymetry 角膜厚度 µm
axial length 眼轴长 mm
MD 视野平均缺损 dB(仅青光眼 Group 1 及部分 suspect 采集,healthy 缺失)

缺失数据(论文 Table 5 逐条存照):

缺失字段 缺失例数 缺失患者 ID
pachymetry(角膜厚度) 6 19, 20, 46, 57, 114, 116
axial length(眼轴长) 4 19, 48, 64, 79
IOP(眼压) 2 213, 218
屈光不正 1 213
MD(视野平均缺损) healthy 患者整体缺失 结构性缺失

患者 213 同时缺 IOP 与屈光不正两项。作者的态度很明确:这些不完整记录被刻意保留,目的是让数据集可以用于"缺失数据插补/鲁棒建模"方法的研究——不是忘了补,而是留作实验条件。使用者若做全字段建模,需自行决定"整行剔除"还是"插补"(见 §10 避坑)。

4.6 样本量推导与数据包体量

样本量推导:Group 2 的规模依据"穆尔西亚第七区人口 + 40 岁以上单纯慢性青光眼患病率 3.5% + 置信水平 95% + 误差 3%“估算而来。这个推导写出来,是为了说明 244 患者不是"能收多少收多少”,而是有统计设计的。

数据包体量:figshare 上的 PAPILA.zip 约 563.49 MB(v2;v1 为 563.48 MB,7 天内的微小差异,存照)。其中绝大部分体积来自 488 张 2576 × 1934 的 JPEG;分割坐标与临床表都是纯文本,体积可忽略。

4.7 分割标注质控:Sørensen-Dice 与 CDR 一致性(论文 Table 6)

这是 PAPILA 质量硬数字里最有分量的一节——它同时给出观察者间和观察者内两套一致性。

Sørensen-Dice 系数(分割重叠度,越高越一致):

一致性类型 样本 视杯(cup) 视盘(disc)
观察者间(interobserver) 全 244 患者 × 2 眼 = 488 眼 0.823 ± 0.089 0.935 ± 0.036
观察者内(intraobserver)Expert #1 随机 15 患者 = 30 眼,间隔 2 年重标 0.827 ± 0.093 0.958 ± 0.037
观察者内(intraobserver)Expert #2 同上 0.834 ± 0.099 0.955 ± 0.033

质量阈值:视盘 Dice ≥ 0.8、视杯 Dice ≥ 0.7(对很小的视杯另作放宽)。

CDR 差异(area-based,基于分割面积算出的杯盘比之差):

  • 观察者间:−0.002 ± 0.045(p = 0.231,CI [−0.006, 0.001])
  • 观察者内 Expert #1:0.002 ± 0.055(p = 0.803)
  • 观察者内 Expert #2:0.008 ± 0.060(p = 0.465)

怎么读这组数:

  1. 视盘比视杯好标得多:观察者间视盘 Dice 0.935 已属优秀,而视杯只有 0.823——差别直接源于"视盘边界清晰、视杯边界主观"。这正是"视杯标注是青光眼分割里最难环节"的定量证据。
  2. 观察者内略优于观察者间:同一人两年后重标的一致性(0.827/0.958 等)略高于两个人之间的一致性,符合直觉,也说明标注流程稳定。
  3. CDR 差异均值极小且不显著:观察者间 CDR 差异均值 −0.002、p = 0.231(不显著),说明两人算出的杯盘比在系统上几乎无偏——即使视杯轮廓有分歧,落到 CDR 这个聚合指标上差异被抹平了。这是 PAPILA 敢把 CDR 当质控/KPI 用的底气。

4.8 规模与质量的一句话小结

PAPILA 的规模(488 眼)在眼底数据集里属于小号;但它把有限规模换成了结构深度——配对双眼、成套临床字段、双专家逐像素分割、且把标注一致性量化到 Dice 与 CDR 两个层面。读它时应把注意力放在"质量硬数字"而非"规模硬数字"上。

§5 任务定义与标注协议

5.1 核心任务清单

PAPILA 支持的任务可以分成三族:

任务族 具体任务 标签/产物
分类 青光眼三分类(healthy / glaucoma / suspect) 眼级标签 0/1/2
分类 青光眼二分类(healthy vs glaucoma,去 suspect) 眼级标签 0/1
分割 视盘(OD/disc)分割 双专家轮廓坐标
分割 视杯(OC/cup)分割 双专家轮廓坐标
回归/计算 杯盘比(CDR) 由分割面积导出,或作回归目标

论文自设基线只覆盖了分类这一族(图像侧与临床侧各一组实验,见 §7);分割族主要作为数据资产提供给下游(分割模型、CDR 计算研究)。

5.2 标签来源:临床诊断而非图像印象

PAPILA 的三分类标签有一个关键性质——它由眼科医生基于临床数据综合评估给出,而非仅凭眼底图判读。

"基于临床数据"意味着:医生参考了 IOP、角膜厚度、眼轴长、视野 MD、既往病史,有时还回顾病史,才落下一个 healthy / glaucoma / suspect。这一点决定了标签的可信度锚定在临床诊断上,而不是"看图说话"的图像主观印象。

这带来一个研究者必须清楚的推论:眼底图像本身可能并不包含足够区分三类的全部信息。suspect(可疑)这一类的存在就是明证——它的诊断依据大量来自临床指标与随访观察,图像上的形态可能并没有明显异常。这直接解释了论文的一个核心论断(§5.6):suspect 类不表现为 healthy 与 glaucoma 之间的中间态,而更像一个"未解决类",从而干扰图像模型的决策边界。

5.3 三分类 vs 二分类:两种任务口径

PAPILA 原生支持两种分类口径,两者的难度与结论完全不同:

  • 三分类(含 suspect):healthy / glaucoma / suspect。论文图像实验(Test #1)显示 AUC 较低,且 suspect 样本在 PCA/t-SNE 上与另外两类混在一起、不成独立簇——模型无法把 suspect 学成一个有序的中间类。
  • 二分类(去 suspect):只留 healthy vs glaucoma。论文实验(Test #2)显示 AUC 明显提升(正文定性表述为"clearly improved when the suspect class is not present")。

因此使用 PAPILA 做分类时,第一件事就是决定要不要保留 suspect。保留 → 任务更贴近真实筛查场景,但难度陡增;去掉 → 二分类干净,但丢弃了 68 眼、且回避了真实门诊中"可疑"这个高频类。这个取舍没有标准答案,取决于研究目标(见 §10 避坑)。

5.4 分割标注协议

分割标注的流程可以概括为"人工逐像素手工打点":

  1. 标注者在自研轮廓编辑工具中打开眼底图(支持图像查看与缩放);
  2. 沿视盘/视杯边界逐个像素点地打点;
  3. 用线段把相邻点连接成闭合多边形轮廓;
  4. 每位专家独立完成同一张图的 cup 与 disc 两套轮廓;
  5. 结果是坐标点序列(文本),而非已栅格化的掩膜图。

由于是"手工逐点 + 双人独立",PAPILA 的分割数据才能同时提供 §4.7 那组观察者间/观察者内一致性指标。使用坐标文本做训练时,需要先按坐标栅格化(cv2.fillPoly / matplotlib.Path 等);做 CDR 计算时,则可直接用多边形面积比 CDR = Area(cup) / Area(disc)。

5.5 质控如何约束使用方式

论文给出了两条明确的质量阈值,使用者应按此过滤或加权:

  • 视盘 Dice ≥ 0.8
  • 视杯 Dice ≥ 0.7(极小视杯例外)

实际操作建议:当把两位专家的轮廓当"金标准"时,可以只保留两人的 Dice 达到阈值的样本(或取两人轮廓的交/并做共识);若研究本身关注"标注不确定性",则应保留全部分歧样本并显式建模(例如把两人轮廓作为两个"标注者维度"输入)。PAPILA 的"双专家"设计正是为后一种研究准备的(§5.6)。

5.6 关键论断:suspect 不是中间态

论文最值得记住的一条论断是:suspect 类不表现为 healthy / glaucoma 之间的中间态。

证据来自两处:

  • 图像侧:Test #1 多分类下,suspect 样本在 PCA / t-SNE 降维图上与 healthy、glaucoma 混合分布,不落在两者之间的有序区域——说明它在图像特征空间里不是一条界线上的过渡点,而是散布开的"未解决类"。
  • 临床侧:Test #3 多分类的 AUC 只在 0.66–0.68(见 §7),说明仅临床指标也不足以把三类干净分开。

这条论断的实践含义:不要指望模型"顺带"学会 suspect。要么把它当独立难类专门处理、要么在二分类里剔除、要么用临床+图像多模态联合建模——想让它自然退化成一个序数中间类,在 PAPILA 上不成立。

5.7 视野(VF)分级标准

视野检查只在 Group 1 青光眼患者上采集(30-2 程序,中央 30°、76 点网格)。MD(mean defect,平均缺损)的判读分级为:

分级 MD 范围
正常 约 0 ~ −2 dB
轻度(mild) −3 ~ −6 dB
中度(moderate) −6 ~ −12 dB
重度(severe) > −12 dB(即比 −12 更负)

注意 MD 是负值,越负表示视野损害越重。

青光眼性视野损害的判据:同一半视野内至少 3 个点低于正常值(低于 5% 分位),且排除盲点周围与外周行,并且重复测试结果一致,方判定为青光眼性损害。这个判据把"单次偶发异常"排除在外,是视野判读的临床常规口径。

5.8 任务与协议的衔接小结

把 §5 收成一句:PAPILA 的分类标签来自临床诊断(不是图像印象)、分割标签来自两位经验悬殊的专家的手工逐点标注、质控被量化为 Dice 与 CDR 两个指标。使用者的首要决策是"要不要 suspect"(分类)与"把双专家当金标准还是当不确定性来源"(分割)——这两个决策定下来,后面的建模路径就清楚了。

§6 许可、获取与版本谱系

6.1 一句话结论

PAPILA 通过 figshare 公开发布,匿名直接下载、无注册墙、无申请审批,采用 figshare 数据页标注的 “GPL 3.0+” 作为数据集许可;而其关联论文(Scientific Data)正文按 CC BY 4.0 开放获取。两者指向不同对象——数据集的许可见 figshare 页,文章本体的许可见期刊页——这是本条目必须并列存照的第一处口径分叉。

6.2 数据入口与 DOI

项目 内容
数据仓库 figshare(Figshare LLP / Digital Science 旗下通用数据仓)
数据 DOI(概念) 10.6084/m9.figshare.14798004
版本 DOI(v1) 10.6084/m9.figshare.14798004.v1
版本 DOI(v2,当前最新) 10.6084/m9.figshare.14798004.v2
首版发布时间 2022-04-29
次版发布时间 2022-05-06(与首版仅隔 7 天)
当前文件 PAPILA.zip,563.49 MB
文件 ID(v2) 35013982
关联论文 DOI 10.1038/s41597-022-01388-1(Sci Data 2022;9(1):291)
勘误 DOI 10.1038/s41597-024-03175-6(Sci Data 2024;11(1):391)

DOI 采用 .v1 / .v2 后缀式的版本化 DOI方案,是 figshare 的标准做法:概念 DOI(不带 .vN)永远解析到最新版,版本 DOI 则锚定具体快照。对可复现性研究而言,这一设计意味着引用时应明确写出版本后缀,否则同一 DOI 在不同时间可能取到不同文件。

6.3 版本链(时间轴)

2022-04-29  ──  v1 发布(10.6084/m9.figshare.14798004.v1)
                    │  文件:PAPILA.zip ≈ 563.48 MB
                    │
2022-05-06  ──  v2 发布(10.6084/m9.figshare.14798004.v2)★ 当前最新
                    │  文件 ID 35013982,PAPILA.zip = 563.49 MB
                    │
2022-06-09  ──  论文正式见刊(Sci Data 9:291)
                    │
2024-04    ──  勘误发布(Sci Data 11:391,仅资助信息文字更正)

三点需要注意:

  1. 论文与数据的时序:v1(4 月 29 日)早于论文见刊(6 月 9 日)约 6 周,v2(5 月 6 日)早于论文约 5 周。这是"先存数据、后发论文"的典型流程,数据 = 论文的证据基座。
  2. 论文写的是 .v1,而不带后缀的 DOI 现在解析到 .v2。论文 Data Records 节在引用数据时写的是 v1;而 figshare 当前裸页、以及多数第三方加载器(例如 torch_em 系列的 PAPILA 载入脚本)实际取到的是 v2 文件。这是第二处口径分叉。
  3. v1 与 v2 的差异极小:体积仅差约 0.01 MB(563.48 MB → 563.49 MB),两版相隔仅 7 天,且 figshare 变更说明未列出明细改动。合理推断为元数据或个别文件的微调,而非内容级重发布——但由于未获官方逐项变更说明,本条目将其列为遗留待核点,不臆断具体改动。

6.4 license 三口径并列(重点存照)

PAPILA 的许可标注在网络上有三种口径流传,必须区分对象与权威性:

口径来源 标注 指向对象 权威性 处理
figshare 数据页 GPL 3.0+ 数据集本身 权威(原始发布方) 数据集许可以此为准
UPCT 科研门户(portalinvestigacion.upct.es) GPL 3.0+ 数据集本身 佐证(同源机构) 印证 figshare 口径
Scientific Data 论文页/文章本体 CC BY 4.0 论文文章 权威(期刊) 文章许可,不覆盖数据
部分聚合目录(如 khosravipooya.com/EyeDataHub 等) CC BY 4.0 数据集(转述) 非权威(二次转述) 仅作存照,不采信

关键辨析:

  • GPL 3.0+ 是"传染性"(copyleft)许可,与常见的 CC 系列(BY/SA/NC)在法律机理上差异显著:GPL 要求衍生作品以同许可分发,对"模型权重是否算衍生作品"存在法律灰区;CC BY 4.0 则是宽松署名许可。这一区别对下游商用与闭源模型训练的合规判断影响很大,使用者不应想当然按 CC BY 处理。
  • 论文页显示 CC BY 4.0,指的是论文文本与图表的再利用许可(Sci Data 全部内容开放获取),并不自动适用于 figshare 上的数据包。把文章的 CC BY 4.0 直接套到数据集上,是第三方目录常见的转述错误。
  • 因此本条目给出推荐引用与合规表述:数据——按 figshare 页 GPL 3.0+;文章——按 CC BY 4.0。若下游用途对许可敏感,应回溯 figshare 页面当时状态为最终依据。

6.5 获取方式与 AI-Ready 友好度

  • 匿名直接下载:figshare 页面对 PAPILA.zip 提供直链,无需注册、无需登录、无需向作者发送请求,也不存在"申请—审批—签署 DUA"的闸门。
  • 单包交付:数据以单个 PAPILA.zip 打包发布,一次下载即得全部内容(图像 + 分割掩膜 + 临床表格 + HelpCode),无需逐文件抓取。
  • 镜像友好:figshare 的直链结构稳定,便于国内镜像(如 hf-mirror.com 类中转)或机构内网缓存复现,降低跨境取数成本。
  • 对 AI-Ready 的意义:三点——① 可发现(DOI 唯一标识,Crossref/DataCite 可解析);② 可获取(零摩擦直下,无身份门槛);③ 可复用(明示许可 + 明示引用要求)。相较于需要邮件申请或签署协议的临床数据集(如部分院内数据),PAPILA 的获取摩擦处于最友好一档。

6.6 引用要求(图情细节)

figshare 页面明确写有一句关键提示:

“Please cite the article and not the figshare repository.”

即官方要求引用关联论文,而非数据仓条目本身。这一要求对下游有两层影响:

  1. 学术引用:论文(Kovalyk et al., Sci Data 2022;9(1):291)是首选引用对象;引用数据仓 DOI 属补充(GB/T 7714、APA、BibTeX 等格式均应优先落论文条目)。
  2. 机器可读溯源:在数据集卡片(datasheet / dataset card)中,建议同时登记论文 DOI 与 figshare 版本 DOI,兼顾"官方引用意愿"与"版本可追溯性"。

本条目在 INFOBOX 与 §6.2 表格中同时登记论文 DOI + figshare 版本 DOI,即遵循这一双重登记原则。

6.7 资助与致谢(含编号口径存照)

PAPILA 的采集与发布由以下资助支持:

资助机构 编号 口径备注
Instituto de Salud Carlos III(西班牙卡洛斯三世健康研究所,AES 2017 计划) AES2017-PI17/00771 论文致谢列示
Instituto de Salud Carlos III(AES 2017 计划) AES2017-PI17/00821 论文致谢列示
Fundación Séneca(穆尔西亚地区科学基金,PI/18 计划) 2090/PI/18 或 20901/PI/18 双口径:figshare/UPCT 页面写 2090/PI/18,2024 勘误文写 20901/PI/18(见下)

资助编号口径分叉(7 条双口径之五):Fundación Séneca 的项目编号在勘误文(Sci Data 2024;11:391)中记为 20901/PI/18,而在 figshare / UPCT 科研门户中记为 2090/PI/18。两串数字相差一位。这正是 2024 年勘误的存在意义之一——勘误仅更正资助信息文字,不涉及数据或结论。因此:

  • 引用资助编号时,以勘误文(最新、已更正)为准;
  • 数据仓页面的旧编号属未同步的历史标注,存照即可。

6.8 与库内同类条目的许可对照

条目 rid 数据集许可口径 获取摩擦
PAPILA(本条) 待定 GPL 3.0+(figshare) 匿名直下
refuge 62 以原始页为准(多为研究用) 下载
justraigs 746 以原始页为准 下载
messidor 59 研究用(需登记) 中
eyepacs 58 研究用(协议/DUA) 高(申请制)
ddr 201 以原始页为准 下载

要点:PAPILA 采用 copyleft 型 GPL 3.0+,在库内眼科条目中属于许可条款较"重"的一档(对比 CC BY 类宽松许可)。下游若计划闭源商用或封装进专有产品,须先做合规确认;若仅用于学术评测与开源模型训练,则 GPL 约束通常不构成障碍。该差异是本条目相对库内其他青光眼/眼底条目的独立定位点之一。

6.9 §6 小结:五条要点

  1. 单仓单包:figshare DOI 10.6084/m9.figshare.14798004,当前最新 .v2,单文件 PAPILA.zip = 563.49 MB。
  2. 版本小分叉:论文写 .v1,figshare 现状为 .v2,两版仅隔 7 天、体量近乎一致,改动明细未公开。
  3. 许可三口径:figshare GPL 3.0+(数据,权威)/ 论文 CC BY 4.0(文章)/ 第三方目录 CC BY 4.0(转述,非权威)——以 figshare 页为数据集许可依据。
  4. 零摩擦获取:匿名直下、无注册墙、单包交付,AI-Ready 友好度高。
  5. 引用官方要求:引论文而非数据仓;资助编号以 2024 勘误文的 20901/PI/18 为准。

§7 评估协议、基线结果与生态复现

7.1 论文自设基线的完整配置

PAPILA 论文不只是"发布数据集",还自带一套完整的分类基线,用于验证"该数据集能否支撑青光眼自动判别"。其配置逐项如下:

配置项 设定
骨干网络(图像分支) DenseNet121、VGG16、MobileNet、Inception、ResNet50、Xception 六种
分类头(自研) flatten → 全连接 → Softmax
预训练 ImageNet 预训练权重
ROI 裁剪 以 Expert #1 的视盘分割框裁剪,再 resize 至 200×200×3
批大小 16
优化器 Adam
学习率 1e-4
损失函数 交叉熵
类别加权 N / (N_c · C)(N = 总样本,N_c = 该类样本,C = 类数)——缓解类别不平衡
评估方式 5 折交叉验证,指标 ROC/AUC,报 5 折均值 ± 标准差

两个工程细节值得特别指出:

  • ROI 的裁剪依据来自分割标注:即便做的是"分类"任务,作者也先用 Expert #1 的视盘框做 ROI 定位。这意味着分割标注既是任务本身,也是分类任务的前处理基础设施——体现了 PAPILA "分割 + 分类双任务合一"的设计取向(这也是本数据集区别于纯分类数据集的核心特征,见 §1)。
  • 类别加权 N/(N_c·C) 直接针对 §4.3 所述的三分类严重不平衡(healthy 333 / glaucoma 87 / suspect 68)。若不做加权,模型会退化到"全预测 healthy"的高虚高准确率陷阱。

7.2 防数据泄漏:同一患者双眼同折

5 折交叉验证的关键设计:由于 PAPILA 是双眼配对数据集(同一患者贡献 OD + OS 两张图),若随机按"图"划分折,同一患者的左右眼可能落入不同折,导致模型在测试折"见过"同一患者的另一只眼。这种**患者级泄漏(patient-level leakage)**会系统性高估模型泛化能力。

论文的处理是:同一患者的双眼必须进入同一折。这是双眼/配对数据集评估的最低正确姿势,也是 PAPILA 作为"配对数据集"必须在评估协议上做的特殊约束。对本条目读者而言,这条是使用 PAPILA 做基准时必须复刻的纪律——否则所报 AUC 不可信、也不可与论文基线比较。

7.3 图像实验(Test #1 / #2)

论文的图像分类实验分两个场景:

实验 任务 类别构成 结果特征
Test #1 眼级多分类(3 类) healthy + glaucoma + suspect AUC 较低;suspect 类分类困难
Test #2 眼级二分类(2 类) healthy + glaucoma(剔除 suspect) AUC 明显提升

论文正文对二者的定性表述为:当 suspect 类不存在时,性能"clearly improved"(显著提升)。

关于精确 AUC 数值的重要说明(7 条双口径之七):Test #1 / Test #2 各骨干网络的精确 AUC 数值,论文仅在 Figure 6 中以 ROC 曲线图形呈现,正文与表格均未给出数字。因此:

  • 本条目只作定性描述(“Test #1 较低、Test #2 明显提升”),不臆造任何具体 AUC 数字;
  • 如需精确值,须读图取点或获取作者开源代码(HelpCode)复现;
  • 这一"数值缺失"本身也是一种方法学特征的存照——图形化呈现削弱了数值级可比性,下游若要横向对比不同方法,须自建基线而非直接引论文数字。

7.4 suspect 类的"未解决"性质(核心论断)

论文最重要的方法学论断之一,是关于 suspect(疑似青光眼)类不等于中间态:

  • 在 PCA / t-SNE 低维投影中,suspect 类并未落在 healthy 与 glaucoma 之间的连续过渡带上,而是与两类均有交叠、自身不构成独立簇;
  • 因此 suspect 不是"青光眼进展的中间阶段分类学标签",而更像一个**"当前诊断未定"的未解决类(unresolved class)**;
  • 其存在会干扰 healthy / glaucoma 之间的决策边界学习——这解释了为何"剔除 suspect"(Test #2)能显著提升二分类性能。

对下游模型的启示:suspect 类不是可线性分离的第三类,强行三分类会拖累整体指标;实践中常见做法是——① 先做 healthy vs glaucoma 二分类(对应 Test #2);② 或将 suspect 作为"转诊复核"兜底类单独处理,而非硬塞进分类器输出层。

7.5 数据增强的架构依赖性

论文测试了数据增强(旋转/翻转/缩放等常规手段)的效果,得到一条架构相关的结论:

骨干 数据增强效果
VGG16 显著正向
MobileNet 显著正向
Inception 显著正向
DenseNet121 无正向提升
ResNet50 无正向提升
Xception 无正向提升

即增强效果因架构而异,并非"增强越多越好"的普适结论。这与 DenseNet/ResNet/Xception 本身更强的特征不变性与正则化设计有关——增强带来的额外不变性对这些架构已边际。该结论对基准复现者选择骨干与增强策略有直接指导意义。

7.6 临床数据实验(Test #3 / #4)

除了图像分支,论文还测试了仅用临床指标的分类能力,使用 4 种经典机器学习方法:逻辑回归(LR)、k 近邻(k-NN)、随机森林(RF)、支持向量机(SVM)。

实验 任务 AUC 范围 方法间离散度
Test #3 眼级多分类(3 类) 0.66 – 0.68 标准差 < 0.07(高度趋同)
Test #4 眼级二分类(2 类) 0.64 – 0.75(均值约 0.71) 明显拉开

解读:

  • Test #3 性能弱且方法间趋同(0.66–0.68,离散度 <0.07):在含 suspect 的三分类任务下,四种经典方法都接近随机水平之上不多——再次印证 suspect 类的存在严重削弱可分性。
  • Test #4 二分类略有抬升(0.64–0.75,均值 0.71):去掉 suspect 后性能上升,但仍低于"图像 + 去 suspect"场景,说明临床指标单独使用时判别力有限,图像信息才是主要信号源。
  • 方法间差异:随机森林/SVM 通常在二分类下表现更好(Range 上限 0.75 由较强方法贡献),但总体没有一种经典方法能凭临床数据达到临床可用门槛——这从反面论证了眼底图像自动分析的必要性,也是 PAPILA 这类"图像为主、临床为辅"数据集的价值论据。

7.7 第三方复现与生态扩展(非论文数据)

PAPILA 发布后进入多个第三方研究与综述视野,构成其"生态佐证":

第三方工作 出处 与 PAPILA 的关系
青光眼 AI 筛查综述 Jian et al., npj Digital Medicine 2023;6:67(doi:10.1038/s41746-023-00857-0) 将 PAPILA 列为青光眼眼底筛查可泛化模型评测数据集之一(记 488 图 / 244 人、30° FOV、三分类、含 OD/OC 专家分割)
FusionFM arXiv:2508.11721 用 PAPILA 做青光眼检测,记数据收集 2018–2020、488 图
血管-视盘交叉分割工作 Sci Rep 2025;15(doi:10.1038/s41598-025-89666-x,VOxSeg 系) 使用 PAPILA 视杯/视盘掩膜;记图像 2576×1934、45° 开角(与论文 30° 冲突,见 §6/§9 双口径)
torch_em 数据加载器 开源工具链 提供 PAPILA 载入封装,指向 v2 文件

第三方生态的三点观察:

  1. 综述层面已被收录(npj Digit Med 2023),说明 PAPILA 已进入青光眼眼底筛查"标准评测集"名单,学术可见度确立。
  2. 复现层面有工具链支持(torch_em 等),降低了重新解析数据格式的门槛。
  3. 转述层面已出现小规模口径漂移:如前述的 45° vs 30° FOV、suspect/glaucoma 计数颠倒——见 §9 双口径清单第 3、4 条。这提示下游引用时须回查论文原始 Table 4 与正文,而非采信二次转述。

7.8 §7 小结

  1. 基线完备:6 骨干 CNN + 临床 4 方法,配置(ROI 200×200、类别加权、5 折)逐项可复现。
  2. 评估纪律:同一患者双眼同折,防患者级泄漏——使用 PAPILA 必须复刻。
  3. suspect 非中间态:它是未解决类,剔除后性能显著提升(Test #1 → Test #2)。
  4. 临床单用不足:Test #3 AUC 0.66–0.68、Test #4 0.64–0.75,反证图像价值。
  5. 数值留白:Fig 6 精确 AUC 仅存于图中,条目只作定性描述,不臆造数字。

§8 生态定位与库内互链点

8.1 定位坐标:PAPILA 在眼科数据集谱系中的位置

PAPILA 的独特坐标可归纳为一句话:"双眼配对 + 双专家分割 + 临床指标三合一"的青光眼眼底数据集。将它放入库内既有的眼科数据集谱系,可沿三条轴定位:

  • 疾病轴:青光眼(glaucoma)域,与糖尿病视网膜病变(DR)域、黄斑/多病域并列;
  • 任务轴:视杯/视盘分割 + 青光眼分类双任务;
  • 模态轴:彩色眼底照相(CFP),区别于 OCT 断层模态。

8.2 青光眼域(最相关互链域)

库内条目 rid 与 PAPILA 的关系 互链理由
refuge 62 青光眼视盘/视杯分割 + CDR 挑战赛 首要互链:任务高度重叠(分割 + CDR),PAPILA 是 REFUGE 之外的双眼配对补充
justraigs 746 青光眼转诊 AI 数据集 同为青光眼"转诊/筛查"取向,人群与标注体系互补
rim-one 291 单眼视盘/视杯分割 与 PAPILA 的双眼配对形成方法论对照(单眼 vs 配对)
drishti-gs 301 单眼视盘/视杯分割 同 rim-one,单眼分割经典基准,与 PAPILA 配对设计形成互补
g1020 待定(同批) 青光眼眼底筛查 同批入池,发布后建家族导航
origa-light 待定(同批) 青光眼视盘/视杯 CDR 同批入池,任务域最接近(CDR 相关)

青光眼域互链要点:refuge(62) 是第一互链位——两者都做视盘/视杯分割并涉及 CDR,是天然对照。差异在于:REFUGE 以挑战赛形式组织、含验证/测试隐藏集;PAPILA 以双眼配对 + 双标注专家 + 临床指标为特色。二者并置可让读者看到"青光眼分割评测"的两种数据组织范式。

8.3 DR / 多病域(互补互链域)

库内条目 rid 关系
messidor 59 眼底 DR 分级经典集,同为眼底 CFP 模态
ddr 201 大规模 DR 分级
idrid 191 DR 分级
deepdrid 211 DR 分级(深度)
eyepacs 58 大规模 DR 筛查(申请制)
odir 63 多眼病(含青光眼)
rfmid 271 视网膜多病
fives* 741 眼底多任务(origa-light FACTS 提及)

互补逻辑:这些条目以 DR/多病为主,与 PAPILA 的青光眼单一疾病深度形成"广度 vs 深度"互补。其中 odir(63) 因含青光眼类标签,与 PAPILA 有疾病标签层面的直接交集,互链优先级高于其他 DR 条目。

8.4 OCT 域(同眼科、不同模态)

库内条目 rid 关系
octa-500 341 OCTA 血管成像
oct2017 311 OCT 分类
octdl 690 OCT 深度学习
octid 697 OCT 识别

跨模态互链逻辑:OCT 域条目与 PAPILA 同属眼科影像但模态不同(断层 vs 眼底照相)。互链价值在于呈现**"青光眼诊断"的互补模态证据链**——眼底 CFP 看视盘形态、OCT 看视网膜神经纤维层厚度,二者共同支撑青光眼评估。这是"同疾病、不同模态"的互链范式。

8.5 同批入池条目(本轮家族)

本轮同批有两条青光眼相关条目,与 PAPILA 构成同批家族:

  • g1020(青光眼眼底筛查数据集)
  • origa-light(青光眼视盘/视杯 CDR 相关)

处理约定:这两条与 PAPILA 同为青光眼域、同批入池,rid 在发布后由流水线回填。因此:

  • 本条目互链表中将它们标注为"待定(同批)";
  • 发布后应优先建立"青光眼眼底 AI-Ready 家族导航",把 refuge(62) / justraigs(746) / g1020 / origa-light / rim-one(291) / drishti-gs(301) 与 PAPILA 串成主题簇。

8.6 建议互链优先级(rid 升序)

综合"任务重叠度 + 疾病相关度 + 模态关系",本条目建议的互链优先级如下:

青光眼分割/筛查(首要)
  refuge(62)  >  justraigs(746)  >  rim-one(291)  >  drishti-gs(301)
同批家族(发布后回填 rid)
  g1020*  >  origa-light*
眼底 DR / 多病(广度互补)
  messidor(59)  >  ddr(201)  >  idrid(191)  >  deepdrid(211)  >  eyepacs(58)
  >  odir(63)  >  rfmid(271)
OCT 跨模态
  octa-500(341)
(* 同批,发布后 rid 回填)

排序依据:青光眼分割域(62/746/291/301)任务重叠最直接,位次最前;同批家族紧随(发布后补齐 rid);DR/多病域属"广度互补",位次居中;OCT 跨模态因模态差异最大,列于末位但仍具互链价值。

8.7 §8 小结

  1. 坐标:双眼配对 + 双专家分割 + 临床指标三合一的青光眼 CFP 数据集。
  2. 首要互链:refuge(62)(青光眼分割/CDR 天然对照);次为 justraigs(746)、rim-one(291)、drishti-gs(301)。
  3. 同批家族:g1020、origa-light 发布后建青光眼家族导航。
  4. 互补域:DR/多病域提供广度对照,OCT 域提供跨模态证据链。

§9 局限、风险与合规提示

任何数据集条目若只讲"能做什么",就是半张地图。PAPILA 的价值恰在于它诚实地暴露了自己的边界:小样本、单中心、单人群、双眼配对、类别不平衡、部分字段缺失、许可为 copyleft。本节逐条拆解使用前必须知情的事项,并在每条后给出可操作的应对建议,而非停留在"注意"二字。

9.1 单病覆盖:只回答"青光眼"一个问题

PAPILA 的标签体系只有三档——healthy / glaucoma / suspect——全部围绕青光眼。它不含糖尿病视网膜病变(DR)分级、不含黄斑病变、不含白内障分级、不含视网膜血管疾病标签。这意味着:

  • 不能把 PAPILA 直接当作"眼底多病筛查"数据集使用;
  • 不能用 PAPILA 训练"广谱眼底病变"模型——它的阴性类(healthy)只表示"无青光眼相关视神经病变",不排除其他眼病;
  • 若要做多病模型,PAPILA 只能作为"青光眼子任务"的组件,需与 messidor(59) / ddr(201) / idrid(191) / eyepacs(58) / odir(63) 等 DR/多病域条目联合使用(见 §8.3)。

应对:把 PAPILA 定位为青光眼专项数据集,在模型卡/数据卡中显式声明"阳性=青光眼性视神经病变,阴性≠全眼健康"。

9.2 样本规模:244 患者是小样本

数据集是 244 患者 / 488 眼。对深度学习而言,这是典型的小样本:

视角 计数 说明
图像数 488 每患者左右眼各 1 张
患者数 244 有效独立样本量(见 §9.3)
最小类(suspect) 68 眼 折内可能只剩十余例
5 折交叉验证后每折训练图像 ≈390 244 患者按折切分,非按图像切分

后果:

  • 置信区间宽:87 例青光眼眼级样本下,AUC 的标准误偏大,折间标准差可观(论文以"均值±标准差"报告正因如此);
  • 过拟合风险高:参数量百万级的预训练 CNN 在 488 张图上微调,必须依赖强正则、迁移学习或冻结主干;
  • 对测试集划分敏感:小样本下"随机种子换一次、指标跳几个点"是常态。

应对:报告均值±标准差而非单点;使用嵌套交叉验证;避免在小样本上做大量超参搜索(易过拟合验证集);把跨数据集外部验证(如 refuge(62))作为泛化能力的真正检验。

9.3 双眼配对:有效独立样本数减半

这是 PAPILA 最容易被忽视、也最关键的结构性限制。244 名患者各提供双眼,同一患者左右眼的视神经形态、屈光状态、病程高度相关。因此:

  • 统计上,独立样本数不是 488,而是约 244;
  • 任何按图像随机划分 train/test 的做法都会造成患者级数据泄漏(patient-level leakage)——同一患者的左眼进训练集、右眼进测试集,模型可能"记住"该患者而非学到疾病特征,导致测试指标虚高;
  • 论文自身对此做了正确示范:5 折交叉验证明确要求"同一患者的双眼必入同一折"(见 §7.2)。

应对铁律:

  1. 一切划分以患者为单位(grouped split / GroupKFold),绝不按图像划分;
  2. 若下游要做患者级结论,注意模型输出是"眼级"标签,需自行聚合到患者级(如双眼取最重者);
  3. 引用 PAPILA 时若做基准对比,务必说明是否遵守患者级划分——否则与论文结果不可比。

9.4 单中心、单人群:外部效度受限

数据采集自西班牙穆尔西亚的两家机构(UPCT 技术 + HGURS 临床),患者为单一地理/族群来源:

  • 人群偏倚:地中海西班牙人群的屈光分布、眼轴长、青光眼亚型构成,未必迁移到东亚(闭角型青光眼比例更高)、非洲裔(视盘生理性较大、CDR 基线偏高)等人群;
  • 设备单一:全部图像来自同一台 Topcon TRC-NW400 非散瞳相机(§9.5),未覆盖多厂商、多型号的成像差异;
  • 机构单一:单一医院的诊断标准、转诊路径、患者构成。

应对:PAPILA 上训出的模型不能直接声称"可泛化到全球眼底筛查";任何部署前的声明必须包含外部多中心验证。第三方工作(Jian et al. 2023 综述、FusionFM)用 PAPILA 做的是受控基准评测,而非部署验证。

9.5 成像条件:单相机、30°、非散瞳

维度 PAPILA 口径 备注
相机 Topcon TRC-NW400(非散瞳) 单设备
视野(FOV) 30° 孔径(论文口径) 第三方写 45°,见 §9.9
分辨率 2576 × 1934 像素 高分辨率
格式 JPEG,8 bit/通道 有损压缩
居中 以视乳头(papilla)为中心 非以黄斑为中心

后果:

  • 非散瞳成像是筛查友好场景,但瞳孔小、介质混浊时图像质量会下降;PAPILA 未提供逐图质量评分字段;
  • 30° / 视盘居中的构图,与以黄斑为中心的 DR 筛查图(如 messidor(59))构图不同,跨数据集迁移时需注意 ROI 差异;
  • JPEG 有损:做像素级分割精评时,压缩伪影可能影响 Dice 的绝对值(对相对比较影响小)。

应对:跨数据集迁移时统一 ROI 策略(PAPILA 论文以 Expert #1 视盘框裁剪后 resize 200×200,见 §7.1);若做分割,注意 JPEG 伪影。

9.6 类别不平衡:333 : 87 : 68

眼级分布为 healthy 333 / glaucoma 87 / suspect 68(论文 Table 4):

healthy  ██████████████████████████████████  333  (68.2%)
glaucoma █████████                              87  (17.8%)
suspect  ███████                                68  (13.9%)
  • 最大类是最小类的约 4.9 倍(333/68);
  • 论文自设基线用类别加权 N/(N_c·C) 缓解(§7.1),但加权不能凭空创造样本;
  • suspect 类不仅少,且性质特殊(§9.7),进一步加剧难度。

应对:使用类别加权、重采样或 focal loss;报告逐类指标(per-class AUC / 敏感度 / 特异度),而非只看宏平均;对最小类(suspect)单独做置信区间。

9.7 suspect 类的"未解决"性质

论文的关键论断是:suspect 不是 healthy 与 glaucoma 之间的"中间态",而是一个未解决的类——

  • 在 PCA / t-SNE 可视化中,suspect 样本与 healthy、glaucoma 混合,未形成独立簇;
  • 三分类(含 suspect)时,所有 CNN 与临床方法性能都明显偏低(Test #1 / Test #3);
  • 去掉 suspect 的二分类(healthy vs glaucoma)性能显著提升(Test #2 / Test #4)。

这说明 suspect 标签本身可能包含异质性(有的实际是早期青光眼、有的是高眼压无损害、有的是诊断不确定)。不要把 suspect 当作有序标签的中间刻度(如当作 0.5 做回归),也不要期望模型能稳定分出它。

应对:

  • 若目标是筛查,优先做二分类(healthy vs glaucoma)并单独处理 suspect(如归入"需复查"通道);
  • 若必须三分类,明确报告 suspect 类的低性能,不做过度承诺;
  • 不要把 suspect 用作有序回归/序数分类的目标。

9.8 缺失临床字段(Table 5 逐条存照)

临床表格并非全字段完备,论文 Table 5 明确列出缺失:

字段 缺失例数 缺失 ID 说明
pachymetry(角膜厚度) 6 19, 20, 46, 57, 114, 116
axial length(眼轴长) 4 19, 48, 64, 79
IOP(眼压) 2 213, 218
屈光不正 1 213 患者 213 同时缺 IOP
MD(mean defect) —(结构性缺失) healthy 全部 MD 仅对青光眼(Group 1)与部分 suspect 采集

关键点:这些缺失是作者刻意保留的(见 §10.2),供"处理缺失数据"的方法研究使用——它们是方法学实验条件,不是疏忽。

应对:

  • 建模前按 Table 5 逐条核对,设计缺失指示变量(missing indicator)或做完整案例子集分析;
  • 不要把缺失值静默填 0 或均值后当作完整数据——那会引入偏差且掩盖问题;
  • 用 MD 做视野分析时,只限 Group 1 青光眼患者,不可外推到 healthy。

9.9 存照口径:使用前需回查原始来源的五个点

以下五处存在"论文 vs 第三方"或"版本间"的口径分歧(详见 §6.4、§9.10),引用前务必回查权威源:

口径点 权威口径 对照口径 建议
glaucoma / suspect 计数 Table 4:glaucoma 87 / suspect 68 部分第三方(FusionFM、VOxSeg)写作怀疑 87 / 确诊 68(颠倒) 以论文 Table 4 为准
视野 FOV 论文 30° Sci Rep 2025 写 45° 以论文 30° 为准
资助编号 勘误文 20901/PI/18 figshare/UPCT 写 2090/PI/18 并列存照
figshare 版本 论文写 .v1 当前为 .v2 用 v2,注明论文写 v1
license 数据页 GPL 3.0+ 论文文章 CC BY 4.0 区分"数据"与"文章"对象

第三方的类计数颠倒尤其危险:若直接照抄 FusionFM 的表述,会把青光眼写成 68、suspect 写成 87,与原始 Table 4 相反。回查原始表是硬纪律。

9.10 无官方 train/test split

PAPILA 不提供预划分的训练/验证/测试集——它只提供全量数据 + 一篇用 5 折交叉验证做基准的论文。

  • 好处:使用自由度高,可按需设计划分;
  • 风险:基准可比性受限——不同研究各自划分,指标不可直接横比;且若划分不当(见 §9.3)会虚高;
  • 叠加 Fig 6 图像实验 AUC 精确值仅以图呈现、正文未给数(§7.3),进一步削弱了精确复现的锚点。

应对:

  • 若做基准评测,显式声明划分方案(折数、是否患者级、随机种子);
  • 优先复现论文的 5 折患者级交叉验证设置以保持可比;
  • 社区若需要硬基准,应自建并公开患者级 test split(PAPILA 本身不阻止,但需自行承担可比性声明)。

9.11 GPL 3.0+ 的 copyleft 合规提示

数据许可为 GPL 3.0+(figshare 数据页权威口径,§6.4),这对下游使用有实质约束:

  • GPL 是 copyleft 许可:若你分发(distribute)基于 PAPILA 派生的作品,通常需以同等兼容许可开放源代码/数据;
  • "模型权重"是否属于派生作品存在法律讨论(学界尚无定论),但保守做法是:若训练数据受 GPL 约束且你分发模型,应评估合规风险,必要时咨询法律意见;
  • "使用"与"分发"不同:内部研究、不对外分发,通常不触发 copyleft 义务;一旦对外发布(模型、衍生数据集、产品),则需谨慎。
  • 注意区分对象:数据受 GPL 3.0+ 约束;论文文章是 CC BY 4.0(署名即可)——引用论文时按 CC BY 处理,使用数据时按 GPL 处理。

应对:

  • 在模型卡/数据卡中明确标注数据来源的 GPL 3.0+ 属性;
  • 商业闭源部署前务必做法务评估;
  • 不要因为"论文写 CC BY 4.0"就误以为数据也是 CC BY——这是最常见的合规误读。

9.12 其它使用注意

  • 伦理与隐私:数据经医院伦理委员会批准并签署知情同意(§3),但使用者仍应遵守不尝试重识别、不滥用医学数据的通行伦理;
  • 临床不可直接用于诊断:任何在 PAPILA 上训练的模型都不是医疗器械,不得未经监管审批用于临床诊断;
  • 标注质量有上限:视杯 Dice 观察者间仅 0.823±0.089(§5),视杯边界本身主观——做 CDR 相关任务时,注意标签噪声会传导到模型;
  • 不提供逐图元数据:无采集日期、无图像质量评分、无相机参数逐图记录——做域自适应/质量分级研究时信息不足。

9.13 §9 小结

  1. 单病:仅青光眼三分类,阴性≠全眼健康。
  2. 小样本:244 患者,置信区间宽、过拟合风险高。
  3. 双眼配对:有效独立样本 ≈244,必须患者级划分,否则泄漏。
  4. 单中心单人群单相机:外部效度受限,需多中心验证。
  5. 类别不平衡:333:87:68,suspect 类既少又"未解决"。
  6. 缺失字段:Table 5 逐条存照,属刻意保留的实验条件。
  7. 口径分歧:计数、FOV、资助号、版本、license 五处需回查原始源。
  8. 无官方 split:基准可比性受限,需自行声明划分。
  9. GPL copyleft:分发衍生作品需评估合规,勿与文章 CC BY 混淆。

§10 方法论评注与 AI-Ready 启示

PAPILA 不只是一个数据包,它的采集与发布流程本身就是一套可复用的方法学范本。本节从六个角度评注它对"如何做 AI-Ready 医学数据集"的启示。

10.1 双专家标注 + Dice 质控:把"标注不确定性"变成一等公民

PAPILA 的分割标注由两位 HGURS 眼科专家独立完成,且两人从业年限相差 25 年(Expert #1 两年 / Expert #2 二十七年,§3)。用两位经验差异极大的专家而非两位同质专家,是刻意的设计——它把"标注的主观性"放大到可测量的程度:

  • 观察者间 Dice:视盘 0.935±0.036(高一致)、视杯 0.823±0.089(较低,视杯边界主观);
  • 观察者内 Dice(间隔 2 年重标):略优于观察者间——说明时间稳定性好,专家间差异才是主要噪声源;
  • CDR 差异:观察者间 −0.002±0.045(p=0.231,无统计学显著差异)——说明尽管视杯边界主观,聚合到 CDR 这一临床指标后,两专家结论一致。

启示:数据集发布应报告标注一致性指标,而非只给"金标准"。PAPILA 让使用者知道"视杯标签有 ±0.089 的 Dice 噪声",从而合理评估 CDR 任务的性能天花板。这比"黑箱金标准"更有方法论价值。

10.2 缺失数据"刻意保留":把不完美当作实验条件

论文 Table 5 列出缺失字段(§9.8),并明确说明保留这些不完整记录,目的是"供处理缺失数据的方法使用"。

这是一个反直觉但正确的决定:多数数据集会清洗掉缺失记录或填补,PAPILA 选择原样保留,使数据集可以充当"缺失数据方法"的真实世界测试床。

启示:AI-Ready 不等于"无缺失"。真实临床数据必有缺失,保留并按条目记录缺失,比制造"假完美"更能支持下游的鲁棒性研究。关键纪律是:缺失必须可发现(有 Table 5 这样的清单),否则就是数据缺陷而非实验条件。

10.3 "先存数据、后发论文"的流程范式

时间线(§2 / §6.3):

v1 数据发布  2022-04-29
v2 数据发布  2022-05-06
论文在线      2022-06-09
勘误          2024-04

数据比论文早约 6 周发布。这一顺序有三重价值:

  1. 可复现性前置:论文发表时,数据已经公开可下载,审稿人与读者可立即验证;
  2. DOI 可引用性:figshare 提供独立 DOI(10.6084/m9.figshare.14798004),数据有终身可追溯标识;
  3. 版本化:v1→v2 的迭代被记录,使用者可追溯"我用的是哪一版"。

启示:AI-Ready 数据集的发布顺序应是 “先发数据(带 DOI + 版本)→ 再发描述论文”,而非"论文附录里给个网盘链接"。同时应遵循 figshare 页的引用要求:引用论文,而非数据仓(§6.6)。

10.4 双眼配对设计倒逼患者级划分

PAPILA 的双眼配对(244 患者 × 2 眼)不是缺陷,而是一个强制纪律:它使"按图像随机划分"的错误立刻暴露——因为同一患者的双眼高度相关,泄漏会立竿见影地虚高指标。论文因此显式规定双眼同折(§7.2)。

启示:数据集的结构特性(配对、纵向、多病灶)应在设计时就明确划分约束。PAPILA 把"防止患者级泄漏"从"使用者自律"提升为"数据集文档明确要求",这是可复制的做法。对所有含重复测量的医学数据集,都应在文档中显式写明划分单位。

10.5 图像 + 临床双信号:互补而非替代

PAPILA 同时提供图像(眼底 CFP)与结构化临床指标(IOP、pachymetry、axial length、MD 等,§4),并分别做了图像实验(§7.3)与临床实验(§7.6):

  • 图像二分类(去 suspect)性能较好;
  • 临床方法无论三分类(AUC 0.66–0.68)还是二分类(AUC 0.64–0.75,均值 0.71)都明显偏弱且方法间趋同。

这说明:单靠结构化临床指标的判别力有限,视神经形态(图像)才是青光眼评估的核心信号;但临床指标的互补价值在于——它们提供图像之外的风险因素(眼压、角膜厚度、眼轴),可用于多模态融合。

启示:AI-Ready 数据集应尽量并列模态(图像 + 表格 + 视野),给下游留出融合空间。PAPILA 的"图像为主、临床为辅"结构,为多模态青光眼模型提供了现成素材。

10.6 GPL copyleft 对下游的启示

数据用 GPL 3.0+(§9.11)而非 CC BY,是一个有意的许可选择——它倾向于保障下游衍生作品继续开放。

启示:

  • 数据集作者在选许可时,**copyleft(GPL)vs 宽松(CC BY / MIT)**是战略选择:copyleft 保障开放生态,宽松许可促进商业采用;
  • 使用者必须区分"数据许可"与"文章许可"——PAPILA 恰是一个"数据 GPL / 文章 CC BY"的典型教学案例;
  • AI-Ready 的"可获取性"不止是"能下载",还包括许可条款是否清晰、下游义务是否明确。PAPILA 在这点上清晰(GPL 3.0+ 数据页权威),但因"论文写 CC BY"造成常见误读,提示许可证必须在数据页显著位置单一口径声明。

10.7 对照 AI-Ready 五要素

把 PAPILA 对照 AI-Ready 数据集的五个核心要素:

要素 PAPILA 表现 评级
可发现性(Findable) 独立 DOI、Sci Data 论文、被多篇综述收录 强
可获取性(Accessible) figshare 匿名直下、无注册墙 强
可互操作性(Interoperable) 图像 JPEG + 分割坐标文本 + 临床 CSV,格式通用;但缺标准化元数据 schema 中
元数据质量(Metadata) 论文详述字段与缺失(Table 5);但无机器可读的 data card / schema.org 描述 中
可持续性(Sustainable) figshare + DOI 长期存档;版本化(v1/v2);但依赖单一平台 中偏强

总评:PAPILA 是**"可发现 + 可获取"很强、但"元数据机器可读性"偏弱的典型。它把人类可读文档**(论文)做得极好,但机器可读元数据(schema、字段字典的标准化发布)尚有提升空间——这正是"AI-Ready"下一阶段要补的课。

10.8 §10 小结

  1. 双专家 + Dice 质控:标注不确定性可测量,比黑箱金标准更有价值。
  2. 缺失刻意保留:不完美可成为方法学实验条件,前提是缺失可发现。
  3. 先数据后论文:DOI + 版本化前置,保障可复现。
  4. 配对结构倒逼患者级划分:把防泄漏写进数据集文档。
  5. 图像 + 临床双信号:主信号在图像,临床指标供融合。
  6. GPL copyleft 战略:数据与文章许可须区分对待。
  7. AI-Ready 五要素:可发现/可获取强,元数据机器可读性待补。

§11 全篇总结

PAPILA 是目前少有的"同一患者双眼配对 + 双专家视盘/视杯分割 + 结构化临床指标"三合一的青光眼眼底数据集。它用 244 患者 / 488 眼,回答了青光眼 AI 的一个核心问题:能否仅凭眼底彩色照相(辅以临床数据)判读青光眼——答案是可以到达可用水平(二分类),但suspect 类仍是未解决的开放问题。

它的核心优势:

  • 配对设计天然支持患者级统计;
  • 双专家分割 + Dice 质控(视杯 0.823 / 视盘 0.935)提供带不确定性的标注;
  • 图像 + 临床双模态支撑多模态融合研究;
  • 可发现、可获取(DOI + 匿名直下)达到 AI-Ready 高标准;
  • 诚实暴露局限(小样本、不平衡、缺失、单中心),方法论透明。

它的核心限制:

  • 小样本单中心单人群单相机,外部效度有限;
  • 类别不平衡且 suspect 未解决,三分类难;
  • 临床字段部分缺失(Table 5),需专门处理;
  • GPL 3.0+ copyleft,下游分发需合规评估;
  • 无官方 split、Fig 6 数值缺失,基准可比性受限。

给使用者的三句话:

  1. 做青光眼二分类筛查——PAPILA 是很合适的起点,记得患者级划分;
  2. 做多病筛查——PAPILA 只能当青光眼子任务,需与 DR/多病域联合;
  3. 做基准对比——务必回查论文 Table 4 计数与许可口径,第三方转述有颠倒。

在千方病案医数集体系内,PAPILA 与 refuge(62) 构成青光眼分割/分类的双核对照(配对临床 vs 挑战赛),与 justraigs(746)、rim-one(291)、drishti-gs(301) 及同批的 g1020、origa-light 共同组成青光眼眼底 AI-Ready 家族。


FAQ 常见问题

A. PAPILA 和 REFUGE 有什么区别?该怎么选?

REFUGE(库内 refuge(62)):青光眼分割挑战赛数据集,1,200 张眼底图(含独立 train/val/test),任务是视盘/视杯分割 + CDR 分类,有隐藏测试集,但无配对双眼、无结构化临床表格,人群以中国为主。

PAPILA:244 患者 / 488 眼配对双眼,任务为青光眼三分类 + 分割,带结构化临床指标(IOP/pachymetry/axial length 等),但无官方 split,西班牙单中心。

选择建议:

  • 要标准分割基准/挑战赛对比 → 用 REFUGE;
  • 要配对双眼 + 临床多模态 + 患者级分析 → 用 PAPILA;
  • 要泛化性评测 → 两者互为外部验证集(PAPILA 训练、REFUGE 测试,反之亦然),这正是二者首要互链(§8.6)的原因。

B. 能直接用 PAPILA 做三分类(healthy/glaucoma/suspect)吗?

技术上可以,但不建议期望高精度。 论文自身的图像三分类(Test #1)与临床三分类(Test #3,AUC 0.66–0.68)性能都偏低。原因是 suspect 类是"未解决类"而非中间态(§9.7)——它在特征空间与两类混合,缺乏可分性。

推荐做法:

  • 主任务做 healthy vs glaucoma 二分类(去 suspect),性能显著提升;
  • suspect 单独作为"需复查"通道处理,而非强行三分类;
  • 若必须三分类,务必逐类报告性能并说明 suspect 类的低指标,不做过度承诺。

C. 数据集是 GPL 3.0+,论文是 CC BY 4.0,我该怎么用?

分开对待两个对象(§6.4 / §9.11):

  • 使用数据(训练模型、做衍生数据集)→ 遵循 figshare 数据页的 GPL 3.0+(权威口径)。GPL 是 copyleft:对外分发衍生作品时,通常需以兼容许可开放。
  • 引用论文(文字、图表、结论)→ 遵循 CC BY 4.0,署名即可,无需 copyleft。

常见误读:看到"论文 CC BY 4.0"就以为数据也宽松——不对。数据集许可以 figshare 原始数据页为准。商业闭源部署前,务必做 GPL 合规评估(模型权重是否属派生作品,学界仍有讨论,保守为宜)。

D. 怎么做患者级划分,避免数据泄漏?

核心原则:以患者为单位划分,同一患者双眼必须同折。

具体做法:

  1. 用患者 ID 分组,做 GroupKFold(n=5) 或留出法 GroupShuffleSplit;
  2. 绝不用 train_test_split 按图像随机划分——那会把同一患者的左右眼拆到不同集合,造成患者级泄漏(§9.3);
  3. 论文的示范是 5 折、双眼同折(§7.2),复现基准时请沿用;
  4. 报告结果时显式声明划分单位,否则与论文结果不可比。

为什么重要:同一患者双眼高度相关,按图像划分会让模型"记住患者"而非学到疾病特征,测试指标虚高。

E. 临床字段有缺失(Table 5),建模时怎么处理?

先按 Table 5 逐条核对再决定(§9.8):

字段 缺失 处理建议
pachymetry 6 例 缺失指示变量 or 完整案例子集
axial length 4 例 同上
IOP 2 例 同上
屈光不正 1 例(ID 213) 同上
MD healthy 全缺 仅用 Group 1 青光眼做视野分析,不外推

纪律:

  • 不要静默填 0/均值——会引入偏差、掩盖问题;
  • 缺失是作者刻意保留的实验条件(§10.2),可用来研究缺失数据方法;
  • 若做子集分析,显式声明剔除了哪些 ID。

F. figshare 有 v1 和 v2,我该用哪个?论文为什么写 v1?

用 v2。 时间线(§6.3):v1 发布于 2022-04-29,v2 于 2022-05-06,v2 是当前最新版本(文件 35013982,包体 563.49 MB)。

为什么论文写 v1:论文正文 Data Records 节撰写时引用的是 .v1 的 DOI,而 figshare 页面后来更新为 v2——这是一个版本口径小分叉(§9.9),存照即可。

选择建议:

  • 新项目用 v2(当前可用版本,第三方加载器如 torch_em 也指向 v2);
  • 若要精确复现论文的某一步,确认论文引用的具体版本;
  • 引用时写明你用的是哪个版本,保障可复现性;
  • 注意 figshare 的引用要求:引用论文而非数据仓(§6.6)。

附录

附录 A:条目信息速查卡

项 值
条目名 PAPILA
url_name papila
全称 PAPILA: Dataset with fundus images and clinical data of both eyes of the same patient for glaucoma assessment
类型 数据集 + 数据描述论文(Sci Data)
论文 Scientific Data 2022 Jun 9;9(1):291(DOI 10.1038/s41597-022-01388-1;PMID 35680965;PMCID PMC9184612)
勘误 Sci Data 2024 Apr 17;11(1):391(DOI 10.1038/s41597-024-03175-6)
团队 UPCT(卡塔赫纳理工大学)+ HGURS(穆尔西亚 Reina Sofía 大学总医院),6 作者
规模 244 患者 / 488 眼 / 488 图;1,952 个分割文件
类别(眼级) healthy 333 / glaucoma 87 / suspect 68
图像 2576×1934 JPEG,30° 孔径,视盘居中,Topcon TRC-NW400 非散瞳
分割质控(Dice) 视杯 0.823±0.089;视盘 0.935±0.036(观察者间)
许可 数据 GPL 3.0+(figshare 权威)/ 文章 CC BY 4.0
数据入口 figshare DOI 10.6084/m9.figshare.14798004(当前 v2)
抓取时点 2026-09-30
库内互链 refuge(62) / justraigs(746) / rim-one(291) / drishti-gs(301) / messidor(59) / ddr(201) / idrid(191) / deepdrid(211) / eyepacs(58) / odir(63) / rfmid(271) / octa-500(341)(+ 同批 g1020 / origa-light)

附录 B:DAIMS 评估全表

DAIMS(Data Asset Interoperability Maturity Score)从五个维度对数据集作为 AI 资产的成熟度打分(1-10),综合加权给出评级。

维度 评分(1-10) 依据
D 可发现性 8 独立 DOI(10.6084/m9.figshare.14798004)+ 开放获取论文(Sci Data)+ 被多篇 2023–2025 综述收录(Jian et al. npj Digit Med 2023、FusionFM);名称"PAPILA"唯一不易混淆。扣分:无独立数据集官网,发现依赖 figshare/论文双入口
A 可获取性 9 figshare 匿名直接下载,无注册墙、无请求制——AI-Ready 友好度最高档;包体 563.49 MB 单文件(PAPILA.zip)可直取。扣分:单一平台托管;GPL 3.0+ 对下游分发有约束(合规成本非"获取"本身)
I 可互操作 6 图像 JPEG + 分割坐标为纯文本 X/Y 节点 + 临床 CSV,格式通用、无专有封装;但无标准化元数据 schema(无 schema.org / 无数据字典文件),分割坐标非 DICOM/COCO 等标准格式,需自行解析
M 元数据质量 7 论文详述字段、缺失(Table 5)、标注协议、质控指标(Table 6)——人类可读文档质量高;扣分:缺机器可读 data card,临床字段无独立字段字典,缺失原因未逐条说明
S 可持续性 7 figshare + DOI 长期存档、版本化(v1/v2)、勘误机制正常(2024 更正资助文字);扣分:依赖单一平台(figshare)、依赖机构(UPCT)持续维护,无镜像仓
综合评级 7.4/10(中上) 可获取性(9)与可发现性(8)突出,是典型"下载即用"型 AI-Ready 数据集;可互操作与元数据机器可读性(6/7)是主要提升空间

评级说明:PAPILA 的"可发现 + 可获取"达到优秀水准,与其"匿名直下 + DOI + 开放论文"的设计直接相关;短板集中在机器可读元数据与标准格式——这是从"人类可读"迈向"AI-Ready"的下一阶段课题。

附录 C:逐项证据链自证

本条目核心数字均经三源互证,逐项列出:

事实 论文(JATS/PMC9184612) figshare(14798004) 第三方 结论
244 患者 / 488 眼 ✓(摘要/Data Records) ✓(描述) ✓(Jian 2023、FusionFM) 一致
healthy 333 ✓(Table 4) — 间接 以论文为准
glaucoma 87 ✓(Table 4) — ✗(部分写 68,颠倒) 以论文 Table 4 为准
suspect 68 ✓(Table 4) — ✗(部分写 87,颠倒) 以论文 Table 4 为准
2576×1934 ✓ — ✓(Sci Rep 2025) 一致
30° FOV ✓(“aperture of 30°”) — ✗(Sci Rep 2025 写 45°) 以论文 30° 为准
视杯 Dice 0.823±0.089 ✓(Table 6) — — 以论文为准
视盘 Dice 0.935±0.036 ✓(Table 6) — — 以论文为准
GPL 3.0+(数据) — ✓(字段) — figshare 为数据许可权威
CC BY 4.0(文章) ✓(期刊声明) — — 文章本体
v2 当前版本 写 v1 ✓(v2) ✓(torch_em 用 v2) v2 当前可用

附录 D:数据获取决策树

你拿到 PAPILA 想做什么?
├── 青光眼二分类筛查模型
│   ├── 直接下载 figshare PAPILA.zip(v2),匿名直下
│   ├── 患者级 GroupKFold 划分(双眼同折,硬纪律)
│   └── 报告逐类指标 + 均值±标准差
├── 视盘/视杯分割 / CDR 计算
│   ├── 用 ExpertsSegmentations(1,952 个坐标文件)
│   ├── 注意视杯标签噪声(Dice 0.823),CDR 天花板有限
│   └── 若做基准,与 refuge(62) 对照
├── 多模态融合(图像 + 临床)
│   ├── 合并 ClinicalData 字段(注意 Table 5 缺失,逐条核对)
│   ├── 缺失指示变量 or 完整案例子集
│   └── MD 仅限 Group 1 青光眼
├── 缺失数据方法研究
│   └── 正是 PAPILA 的设计用途(刻意保留缺失)
└── 想商用/闭源部署
    └── 先做 GPL 3.0+ 合规评估(copyleft 义务)→ 谨慎

附录 E:临床字段速查与缺失登记

字段 含义 取值 缺失(Table 5)
患者 ID 唯一标识 — 无
年龄 患者年龄 岁 无
性别 性别 0=男 / 1=女 无
诊断 青光眼标签 0=healthy / 1=glaucoma / 2=suspect 无
屈光不正 球镜/柱镜 度 1 例(ID 213)
phakic/pseudophakic 晶状体状态 1=已摘除 / 0=保留 无
IOP 眼压 mmHg 2 例(213, 218)
pachymetry 角膜厚度 μm 6 例(19,20,46,57,114,116)
axial length 眼轴长 mm 4 例(19,48,64,79)
MD 平均缺损 dB healthy 全缺(仅青光眼/部分 suspect)

使用纪律:右眼/左眼为两个分列表格,合并时注意按患者 ID + 眼别对齐;缺失按上表逐条核对,勿静默填补。

附录 F:患者级划分代码骨架(防泄漏)

import pandas as pd
from sklearn.model_selection import GroupKFold

# 读入眼级元数据,至少含 patient_id 与 eye(OD/OS)
df = pd.read_csv("clinical_eyes.csv")

# 硬纪律:以 patient_id 分组,同一患者双眼必入同一折
gkf = GroupKFold(n_splits=5)
for fold, (tr_idx, te_idx) in enumerate(gkf.split(df, groups=df["patient_id"])):
    train = df.iloc[tr_idx]
    test  = df.iloc[te_idx]
    # 断言:训练/测试患者的交集必须为空
    assert set(train["patient_id"]).isdisjoint(set(test["patient_id"])), "患者级泄漏!"
    print(f"Fold {fold}: train patients={train['patient_id'].nunique()}, "
          f"test patients={test['patient_id'].nunique()}")

# 反例(禁止):sklearn.model_selection.train_test_split(df, test_size=0.2)
#   —— 按图像随机划分,同一患者左右眼会被拆开,造成患者级泄漏

附录 G:许可证与引用注意事项

许可证(三口径并存,须区分对象):

对象 许可 权威口径 下游义务
数据(PAPILA.zip) GPL 3.0+ figshare 数据页 / UPCT 门户 copyleft:分发衍生作品需兼容许可
论文文章 CC BY 4.0 Sci Data 期刊声明 署名即可
部分第三方目录 CC BY 4.0(对其转述) 非权威 勿采信

引用要求:figshare 页明确 “Please cite the article and not the figshare repository”——即引用时优先引论文(Kovalyk et al., Sci Data 2022),而非数据仓。

BibTeX(论文):

@article{kovalyk2022papila,
  title   = {PAPILA: Dataset with fundus images and clinical data of both eyes
             of the same patient for glaucoma assessment},
  author  = {Kovalyk, Oleksandr and Morales-S{\'a}nchez, Juan and
             Verd{\'u}-Monedero, Rafael and Sell{\'e}s-Navarro, Inmaculada and
             Palaz{\'o}n-Cabanes, Ana and Sancho-G{\'o}mez, Jos{\'e}-Luis},
  journal = {Scientific Data},
  volume  = {9},
  number  = {1},
  pages   = {291},
  year    = {2022},
  doi     = {10.1038/s41597-022-01388-1}
}

附录 H:坑点档案(坑 N 编号制)

以下是本条目在核实过程中遇到的真实陷阱,每条给出"一句话档案"与"触发场景",供转引者避坑。

坑 一句话档案 触发场景
坑 1 数据集许可 GPL 3.0+(figshare 权威)vs 论文 CC BY 4.0(文章本体)vs 第三方目录 CC BY 4.0(对数据的转述,非权威)——三口径并存,混用会导致合规误判 商用/再分发/许可声明
坑 2 glaucoma / suspect 眼级计数易被第三方颠倒:论文 Table 4 为 glaucoma 87 / suspect 68,但 FusionFM、VOxSeg 部分段落写作 suspect 87 / glaucoma 68 数字抽取/文献转引
坑 3 figshare 版本口径分叉:论文 Data Records 写 .v1,当前最新为 .v2(第三方加载器用 v2) 复现/下载版本选择
坑 4 视野 FOV 度数冲突:论文写 30° 孔径,Sci Rep 2025 VOxSeg 写 45° 开角(可能混淆相机物理 FOV 与图像裁剪) 预训练/构图对齐
坑 5 资助编号两套写法:勘误文 20901/PI/18 vs figshare/UPCT 2090/PI/18 引注/基金编号著录
坑 6 类别合并口径:论文 Table 1 对比表把 glaucoma+suspect 合并计 155(“Glaucoma (or suspect)”),而 Table 4 分列 87/68——须并列理解,勿只取其一 规模陈述/指标解读
坑 7 无官方 train/test split + Fig 6 图像分类 AUC 精确值仅以图呈现、正文未给数——基准可比性受限,不同研究各自划分不可直接横比 基准评测/结果对比
坑 8 双眼配对导致有效独立样本数 ≈244 而非 488——若按图像随机划分会造成患者级泄漏,测试指标虚高 数据划分/性能报告
坑 9 临床字段缺失(Table 5):pachymetry 6 例、axial length 4 例、IOP 2 例、屈光不正 1 例(ID 213);MD 仅青光眼采集。缺失为刻意保留,非数据缺陷 建模/缺失处理
坑 10 单中心单人群单相机(西班牙穆尔西亚 / Topcon TRC-NW400 / 非散瞳)——外部效度受限,不可径称"可泛化" 泛化性声明/部署

编号说明:坑 1–坑 10 均为本条目核实过程中实际记录的陷阱,其中坑 1、坑 2、坑 4、坑 6 曾在第三方转述中造成事实偏差,转引时务必回查论文原始表。


尾注与核验声明

  • 核验时点:2026-09-30。
  • 核验三源:① Scientific Data 论文(EuropePMC JATS 全文 PMC9184612 + PMC 表格页)② figshare 数据仓(DOI 10.6084/m9.figshare.14798004 v1/v2)③ 第三方综述与复现工作(Jian et al. npj Digit Med 2023;6:67;Sci Rep 2025 VOxSeg;FusionFM arXiv:2508.11721;torch_em 加载器)。
  • 核心数字(244/488/333/87/68)经三源互证;口径分歧点(license、版本、计数、FOV、资助号)已在 §6.4、§9.9 与附录 C、附录 H 逐条存照。
  • 本条目不作临床建议:PAPILA 及其衍生的任何模型均非医疗器械,不得未经监管审批用于临床诊断。
  • 维护触发点:① figshare 若发布 v3 或更新许可声明 → 修订 §6 与附录 B/G;② 若官方提供 train/test split → 修订 §9.10 与附录 F;③ 若 figshare 页面指标(views/downloads)显著变动 → 更新 §2 引用热度;④ 若 g1020 / origa-light 发布 → 回填 §8 同批家族 rid 并建立青光眼家族导航。
  • 条目责任:本条目为千方病案医数集(qianfanghub.com)AI-Ready Wikipedia 条目,代理 agent-c-papila,slug papila。所有事实以论文原始表格与 figshare 数据页为权威口径,第三方仅作生态佐证。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • g1020 — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • origa-light — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • refuge2 — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • riga — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
  • refuge — 共享标签:眼科影像 / 医学图像分割 / 青光眼
  • oimhs — 共享标签:眼科影像 / 医学图像分割 / 图像分类
  • palm — 共享标签:眼科影像 / 医学图像分割 / 图像分类
  • octid — 共享标签:眼科影像 / 医学图像分割 / 图像分类
  • fives — 共享标签:眼科影像 / 医学图像分割 / 青光眼
  • drions-db — 共享标签:眼科影像 / 医学图像分割 / 青光眼

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集