信息速览
INFOBOX — PAPILA 一屏速览
维度 内容 本质 同一患者双眼配对的彩色眼底图 + 临床数据 + 双专家视杯/视盘分割,用于青光眼评估 全称 PAPILA: Dataset with fundus images and clinical data of both eyes of the same patient for glaucoma assessment 团队 西班牙卡塔赫纳理工大学(UPCT)+ 穆尔西亚 Reina Sofía 大学总医院(HGURS),6 作者 论文 Sci Data 2022 Jun 9;9(1):291(doi:10.1038/s41597-022-01388-1;PMID 35680965;PMCID PMC9184612) 勘误 Author Correction,Sci Data 2024;11(1):391(doi:10.1038/s41597-024-03175-6),仅资助文字更正 规模 244 患者 / 488 眼(双眼配对)/ 488 张眼底图 图像 2576×1934 像素,JPEG,30° 孔径,以视乳头(papilla)为中心,Topcon TRC-NW400 类别 healthy 333 / glaucoma 87 / suspect 68(眼级,论文 Table 4) 分割 2 专家 × 2 眼 × 2 结构 × 244 患者 = 1952 个轮廓坐标文件 一致性 观察者间 Dice:视盘 0.935 ± 0.036,视杯 0.823 ± 0.089(视盘优于视杯) 临床字段 年龄/性别/诊断/IOP/角膜厚度/眼轴长/MD/屈光不正/phakic 状态 获取 figshare 匿名直接下载(DOI 10.6084/m9.figshare.14798004,当前 v2) 许可 数据集 figshare 页 GPL 3.0+(权威);论文本体 CC BY 4.0 库内互链 refuge(62) > justraigs(746) > rim-one(291) > drishti-gs(301) > g1020* > origa-light* > messidor(59) > ddr(201) > idrid(191)
PAPILA 是青光眼 AI 领域一份"结构最讲究"的小数据集:它只有 244 位患者、488 只眼睛、488 张眼底图,规模远不及 EyePACS 那类十万级集合;但它做到了别的眼底数据集几乎都没做到的一件事——把同一位患者的左右眼配成对、附上结构化临床指标、再请两位眼科专家把视杯和视盘逐像素描出来。论文和第三方综述都把它称作第一份"提供同一受试者双眼彩色眼底图与临床数据"的青光眼评估数据集。这正是它的价值所在:青光眼常双眼不对称进展,配对双眼能让模型学"同一人两只眼的差异",而不是把每只眼当成互不相关的样本。
PAPILA 还有一记"反直觉"的发现常被引用:可疑青光眼(suspect)这一标签并不是健康与青光眼之间的过渡态——在特征空间里它并不落在两者中间,而更像一个"未解决的第三类",会扰乱 healthy/glaucoma 的判别边界。这一结论直接影响了后续用 PAPILA 做二分类还是三分类的取舍。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——figshare 匿名直链,注意"数据集 GPL 3.0+、论文 CC BY 4.0"的双口径,以及"引论文而非数据仓"的引用要求。
- 关心标签与质控:直奔 §4 规模与 §5 任务标注——类别分布、缺失数据表、双专家 Dice 与 CDR 一致性是理解这份数据集可信度的钥匙。
- 担心小数据集能不能用:直奔 §7 评估基准与 §10 避坑清单——论文自设基线的诚实结论(图像三分类很难、suspect 类捣乱)和七条双口径存照都在那里。
§0 导读:这个数据集解决什么问题
青光眼是全球不可逆致盲的首要病因,而它最狡猾的地方在于早期几乎无症状,等患者自己察觉视野缺损时,视神经往往已经损伤大半。因此青光眼筛查的核心任务,是在视盘形态还只是"可疑"的阶段把它识别出来。临床上最常用的量化线索是杯盘比(cup-to-disc ratio, CDR):视杯相对视盘的比值越大,越提示青光眼性视神经损害。而要从眼底图上自动算 CDR,就必须先把视杯(optic cup, OC)和视盘(optic disc, OD)这两种解剖结构从图像里精确分割出来——这就把问题拆成了两件事:分割(描出视杯/视盘边界)与分类(判定健康/青光眼/可疑)。
PAPILA 正是冲着这两件事设计的。它同时提供了:
- 488 张以视乳头为中心的彩色眼底图(244 患者双眼配对);
- 每位患者双眼的结构化临床指标(眼压、角膜厚度、眼轴长、视野平均缺损等);
- 两位眼科专家独立勾画的视杯/视盘轮廓,可用于评估分割算法的上限与观察者间变异。
它想解决的具体痛点有三个。第一,配对双眼的缺失:绝大多数眼底数据集把每只眼当独立样本,丢失了"同一患者"这一强约束,而青光眼恰恰是双眼不对称进展的疾病。第二,临床指标的缺失:很多眼底数据集只有图和一个诊断标签,没有眼压、角膜厚度这些可以佐证诊断的数值,模型只能"看图说话"。第三,分割标注可信度的缺失:视杯边界本身主观性高,单专家标注无法暴露这一主观性,PAPILA 用双专家 + 双时点(间隔 2 年重标)把这个不确定性量化了出来。
§0 读法三则:
- 这个条目是"小数据集 + 强结构 + 诚实基线"的组合:规模只有 488 眼,但配对双眼、临床表格、双专家分割三件套齐全——读它的价值不在数量,在结构与质控方法(§4、§5)。
- 全文数字均出自论文正文与表格;论文与第三方目录之间的冲突(license、版本、类别计数、FOV)已逐条在坑 1–坑 7 存照,转引前务必回查原始 Table 4。
- 如果你在找"大规模青光眼筛查数据",PAPILA 不是答案(488 眼太小);如果你在找"能研究双眼配对的临床-影像多模态数据",它是目前最干净的选择之一。
§1 数据集速览:十问十答
Q1:PAPILA 这名字什么意思,"488 张"是怎么来的?
“PAPILA"取自西班牙语里视盘/视乳头的别称 papila(对应英文 papilla,即视神经乳头),因为所有眼底图都以视乳头为中心拍摄。488 张 = 244 位患者 × 每位患者左右眼各 1 张。这是"双眼配对"的题眼:数据集不是 488 个独立样本,而是 244 对"同一人的左右眼”。
Q2:图像规格是什么?
分辨率 2576 × 1934 像素、JPEG 格式、8 bit/通道,用 30° 孔径、以视乳头为中心拍摄。采集设备是 Topcon TRC-NW400 非散瞳眼底相机(non-mydriatic)。文件名形如 RET047OD.jpg——RET + 三位患者号 + OD(右眼)/OS(左眼)。
Q3:类别怎么分布?
论文 Table 4 按眼级给出三分类(这里必须记牢,第三方常把它写反):
- Healthy(健康):右眼 170 + 左眼 163 = 333 眼
- Glaucoma(青光眼):右眼 40 + 左眼 47 = 87 眼
- Suspect(可疑):右眼 34 + 左眼 34 = 68 眼
合计 488 眼。注意 87 + 68 = 155 是"青光眼或可疑"的合并数(论文 Table 1 对比表就是这么合并的),别把 155 当成青光眼单类。
Q4:谁标注的,可靠吗?
视杯/视盘轮廓由两位 Reina Sofía 医院眼科专家独立手工勾画:Expert #1 从业 2 年、Expert #2 从业 27 年——经验差 25 年,这是刻意保留的观察者间变异来源。用 Sørensen-Dice 系数衡量一致性:观察者间(全 488 眼)视盘 0.935 ± 0.036、视杯 0.823 ± 0.089。结论是:视盘边界清晰、标注一致性好;视杯边界主观性高、一致性明显更低——这本身就是研究分割算法不确定性的一手材料。
Q5:临床数据都有哪些字段?
每位患者有左右眼两列记录:患者唯一 ID、年龄、性别(0=男/1=女)、诊断(0=healthy/1=glaucoma/2=suspect)、屈光不正、phakic/pseudophakic(晶状体状态)、眼压(IOP)、角膜厚度(pachymetry)、眼轴长(axial length)、视野平均缺损(mean defect, MD)。其中 MD 仅对青光眼组(Group 1)采集,healthy 患者普遍缺失。
Q6:数据有缺失吗?
有,且作者刻意保留,供研究缺失值处理的方法使用。论文 Table 5:角膜厚度缺 6 例(ID 19/20/46/57/114/116)、眼轴长缺 4 例(19/48/64/79)、眼压缺 2 例(213/218)、屈光不正缺 1 例(213)。患者 213 一人就缺眼压和屈光不正两项。
Q7:诊断标签是怎么定的?图像判读还是临床诊断?
基于临床数据综合判定,必要时回顾病史,由眼科医生给出三分类诊断。也就是说标签的可信度锚定在临床诊断上,而不是"看图猜"。这一点很关键——它意味着 PAPILA 的分类标签比纯图像印象标签更硬。
Q8:患者是怎么招募分组的?
两组来源。Group 1 是单纯慢性青光眼患者(从 HGURS 青光眼门诊招募)。Group 2 是初级保健来源、眼科检查未显示可影响视神经形态的眼病理者,又细分 2.a(无青光眼相关病变且 IOP ≤ 22 mmHg)与 2.b(高眼压 IOP 22–28 mmHg 但无视野损害)。Group 2 的样本量按穆尔西亚 VII 区人口、40 岁以上单纯慢性青光眼患病率 3.5%、置信水平 95%、误差 3% 估算。
Q9:我现在怎么拿到它?
figshare 匿名直接下载(DOI 10.6084/m9.figshare.14798004),无需注册、无需申请——这对 AI-Ready 很友好。当前最新版本是 v2(2022-05-06 发布,PAPILA.zip 约 563.49 MB),而论文正文写的是引用 v1。figshare 页明确要求"引用论文而非数据仓"。
Q10:为什么它对 AI-Ready 重要?
它是一份"小规模但结构完备"的样本:配对双眼允许多模态/双眼联合建模,临床表格连接影像与结构化数据,双专家分割量化了标注不确定性,而且获取门槛极低(匿名直链)。它的短板也清晰——规模小、单中心、类不平衡、含"未解决类" suspect——正适合作为"小数据 + 强结构"这条路线的教学样本。
§2 数据构成与规格
2.1 规模、来源与机构构成
PAPILA 由两家西班牙机构联合产出:
- Universidad Politécnica de Cartagena(UPCT,卡塔赫纳理工大学)——技术研发主体,负责图像/信号处理与机器学习方法;
- Hospital General Universitario Reina Sofía(HGURS,穆尔西亚 Reina Sofía 大学总医院)——临床数据采集、患者招募、眼科专家标注。
| 维度 | 数值 |
|---|---|
| 患者数 | 244 |
| 眼数 | 488(双眼配对,每患者左右眼各 1) |
| 眼底图数 | 488 |
| 分割轮廓文件 | 1952(2 专家 × 2 眼 × 2 结构 × 244 患者) |
| 图像分辨率 | 2576 × 1934 px |
| 图像格式 | JPEG,8 bit/通道 |
| 拍摄孔径 | 30°(以视乳头为中心) |
| 采集设备 | Topcon TRC-NW400(非散瞳) |
| 数据包体量 | 约 563.49 MB(figshare v2) |
6 位作者中,4 位来自 UPCT(一作 Oleksandr Kovalyk、Juan Morales-Sánchez、Rafael Verdú-Monedero、José-Luis Sancho-Gómez),2 位来自 HGURS 眼科(Inmaculada Sellés-Navarro、Ana Palazón-Cabanes)。伦理方面走的是医院伦理委员会批准 + 患者签署知情同意的常规路径。
2.2 图像规格与目录结构
数据包解压后目录结构清晰:
PAPILA_DBv1/
├── ClinicalData/ # 左右眼两列结构化临床表格
├── ExpertsSegmentations/ # 两位专家的视杯/视盘轮廓坐标(纯文本)
├── FundusImages/ # 488 张 JPEG 眼底图
└── HelpCode/ # Python 示例脚本 + Jupyter Notebook
图像文件命名规则 RET<三位患者号><OD|OS>.jpg,例如 RET047OD.jpg 是第 47 位患者的右眼(OD = Oculus Dexter),RET047OS.jpg 是同一患者的左眼(OS = Oculus Sinister)。分割文件在同一套前缀后追加结构与专家标记:RET047OD_cup_exp1.txt(第 47 号患者右眼、视杯、1 号专家)——共 _cup/_disc × _exp1/_exp2 四种组合,纯文本存 X/Y 节点坐标,人工逐点连线成多边形轮廓。
HelpCode 目录随包提供 Python 示例脚本和 Jupyter Notebook,是官方给出的读取/可视化入口。需要注意的是,论文没有独立的 Code availability 章节,也没有独立的 GitHub 代码仓——这些示例代码是随 figshare 数据包一起发的。
2.3 类别体系与眼级分布
PAPILA 的分类标签是三分类(眼级):
| 类别 | 编码 | 右眼 | 左眼 | 合计 | 占比 |
|---|---|---|---|---|---|
| Healthy(健康) | 0 | 170 | 163 | 333 | 68.2% |
| Glaucoma(青光眼) | 1 | 40 | 47 | 87 | 17.8% |
| Suspect(可疑) | 2 | 34 | 34 | 68 | 13.9% |
| 合计 | — | 244 | 244 | 488 | 100% |
这是一处高频坑:FusionFM(arXiv:2508.11721)与 VOxSeg(Sci Rep 2025)等第三方文献的部分段落把 glaucoma 与 suspect 的计数写反(“suspected 87 / confirmed glaucoma 68”),与原始 Table 4 相反。以论文 Table 4 眼级计数为准:glaucoma = 87、suspect = 68。
除三分类外,论文的对比表(Table 1)把 glaucoma 与 suspect 合并成"Glaucoma (or suspect) = 155"来和别的数据集比规模——这是合并口径,不是 glaucoma 单类数量,读的时候要分清。
2.4 临床数据结构与缺失
ClinicalData 目录中每位患者有左右眼两列记录,字段包括:
- 患者唯一 ID
- 年龄、性别(0=男 / 1=女)
- 诊断(0=healthy / 1=glaucoma / 2=suspect)
- 屈光不正(refractive error)
- phakic/pseudophakic(1=晶状体已摘除 / 0=保留)
- 眼压 IOP
- 角膜厚度 pachymetry
- 眼轴长 axial length
- 视野平均缺损 mean defect(MD)
缺失情况(论文 Table 5)如下,作者明确保留这些不完整记录,目的是让研究者可以测试缺失数据处理方法:
| 字段 | 缺失患者 ID | 缺失数 |
|---|---|---|
| 角膜厚度 pachymetry | 19, 20, 46, 57, 114, 116 | 6 |
| 眼轴长 axial length | 19, 48, 64, 79 | 4 |
| 眼压 IOP | 213, 218 | 2 |
| 屈光不正 | 213 | 1 |
其中 MD 仅对青光眼组(Group 1)采集,healthy 患者普遍没有 MD 值——这意味着 MD 不能当作全数据集的监督信号,只能用于青光眼亚组的视野损害分级。
2.5 采集设备与配套检查
主采集设备是 Topcon TRC-NW400 非散瞳眼底相机。为支撑临床诊断,配套使用的检查设备(论文 Table 2)包括:
| 设备 | 用途 |
|---|---|
| Nidek ARK-710 A | 验光 / 角膜曲率 |
| Nidek NT-2000 | 非接触眼压计(IOP) |
| Rodenstock REM 3000 | 镜面显微镜角膜测厚(pachymetry) |
| Zeiss IOL Master 500 | 光学生物测量(眼轴长) |
| Zeiss Humphrey 750i | 视野分析 30-2 程序(MD) |
这套设备清单说明 PAPILA 的临床字段不是"顺手记的",而是按标准眼科检查流程采集的结构化数据——这也是它临床字段可信度较高的原因。
2.6 与库内其他眼底数据集的构成差异
PAPILA 的结构在库内眼底家族中很特殊,差异集中在这一张对照上:
| 数据集 | 主任务 | 双眼配对 | 临床指标 | 专家分割 | 规模 |
|---|---|---|---|---|---|
| PAPILA | 青光眼分类 + OD/OC 分割 | 是 | 是(结构化) | 双专家 | 488 眼 |
| refuge(62) | 青光眼 OD/OC 分割 + CDR | 否 | 有限 | 单人/挑战赛 | 1200 图 |
| justraigs(746) | 青光眼转诊分类 | 否 | 有限 | 否 | 更大 |
| messidor/ddr/idrid/eyepacs | 糖尿病视网膜病变分级 | 否 | 部分 | 否 | 中大 |
| rim-one(291)/drishti-gs(301) | 单眼 OD/OC 分割 | 否 | 否 | 单专家 | 小 |
PAPILA 的独特性一句话概括:它是库内唯一同时满足"配对双眼 + 结构化临床 + 双专家分割"三条件的眼底数据集。规模上它不占优势,结构上它几乎是最讲究的。
§3 团队、机构与合作谱系
3.1 出品方:一所理工大学 + 一家大学总医院的组合
PAPILA 的署名机构只有两家,但这两家覆盖了这类数据集最需要的两端能力:
- Universidad Politécnica de Cartagena(UPCT,西班牙卡塔赫纳理工大学)——技术研发主体。负责图像与信号处理、机器学习建模、标注工具的编写、数据集的组织与发布。一作与两位通信作者都在这里。
- Hospital General Universitario Reina Sofía(HGURS,西班牙穆尔西亚雷纳索菲亚大学总医院)——临床侧主体。负责患者招募、眼科检查、临床数据的采集与整理、以及两位眼科专家的视杯/视盘分割标注。
这种"理工大学 + 大学医院"的双机构结构,是 PAPILA 能同时把"结构化临床表格"和"专家逐像素分割"做扎实的组织前提。很多单纯由成像实验室发布的数据集,临床字段要么缺失、要么是回顾性拼凑;PAPILA 的临床字段是从门诊检查流程中成套采集的(设备清单见 §2.5)。
两家机构都在穆尔西亚(Murcia)大区:UPCT 在卡塔赫纳(Cartagena),HGURS 在穆尔西亚市,同属一区,这也是"患者样本来自穆尔西亚第七区人口"(见 §4.6)这一抽样来源能成立的地理基础。
3.2 六位作者与分工
论文共 6 位作者,署名顺序与角色如下:
| 位次 | 作者 | 机构 | 角色/方向 |
|---|---|---|---|
| 1(一作/通信) | Oleksandr Kovalyk | UPCT | 主要实现者;通信邮箱 oleksandr.kovalyk@edu.upct.es |
| 2 | Juan Morales-Sánchez | UPCT | 图像/信号处理 |
| 3 | Rafael Verdú-Monedero | UPCT | 图像/信号处理 |
| 4 | Inmaculada Sellés-Navarro | HGURS 眼科 | 临床与标注;inmasell@um.es |
| 5 | Ana Palazón-Cabanes | HGURS 眼科 | 临床与标注 |
| 6(通信) | José-Luis Sancho-Gómez | UPCT | 通信方向负责人 |
作者队伍是"4 技术 + 2 临床"的配比——正好对应数据集的两半:图像/分割/模型侧由 UPCT 承担,诊断与临床数据侧由 HGURS 的两位眼科医生承担。
各作者 ORCID(Europe PMC 链接口径):Kovalyk 0000-0003-4815-8248;Morales-Sánchez 0000-0002-2894-3292;Verdú-Monedero 0000-0001-9227-7397;Sellés-Navarro 0000-0002-8757-2559;Sancho-Gómez 0000-0001-8009-1616。
3.3 两位标注专家:一场刻意的"经验差"设计
PAPILA 分割标注最有意思的一点,是它把标注员本身也当成数据集的一部分来交代清楚:
- Expert #1:从业 2 年
- Expert #2:从业 27 年
两人经验差 25 年。这不是疏漏,而是刻意保留的观察者间变异来源——正因为把"一个新手和一个资深专家"的分割都收进来,数据集才能用来量化"视杯边界到底有多主观"这个问题(结果见 §5.5:视盘一致性高、视杯一致性明显偏低)。换句话说,经验差不是噪声,是被设计进去的"实验条件"。
两位专家都属于 HGURS 眼科,与作者第 4、5 位同机构。标注使用团队自研的轮廓编辑工具(具备图像查看、缩放、轮廓编辑能力),以手工逐像素打点、再用线段连接的方式勾画视盘与视杯轮廓(标注协议细节见 §5.4)。
3.4 临床分组:Group 1 / 2 / 2.a / 2.b
患者并非随机抓取,而是按来源与眼健康状态分成两组,这决定了标签的人群分布:
| 分组 | 来源 | 定义 |
|---|---|---|
| Group 1 | HGURS 青光眼门诊 | 单纯慢性青光眼患者(已知青光眼) |
| Group 2 | 初级保健来源 | 眼科检查未显示可影响视神经形态的眼病理者 |
| Group 2.a | Group 2 细分 | 无青光眼相关病变,且 IOP ≤ 22 mmHg(正常眼压) |
| Group 2.b | Group 2 细分 | 高眼压 IOP 22–28 mmHg,但无视野损害(高眼压症/可疑) |
这个分组设计直接对应三分类标签:Group 1 基本落在 glaucoma 类,Group 2.a 主要落在 healthy 类,Group 2.b 则构成 suspect 类的主要来源。理解这个映射,才能理解为什么 PAPILA 的三类不平衡是"结构性"的、而非采样偶然(类别计数与不平衡的量化见 §4.3)。
3.5 伦理与合规
数据集经医院伦理委员会批准,所有参与者签署知情同意(informed consent)。这两条在医学数据集条目里看似套话,但对 PAPILA 尤其关键——因为它公开的是同一患者双眼图像 + 年龄/性别/诊断/IOP 等临床字段的组合,属于需要"配对身份但不泄露身份"的敏感结构(患者仅以三位数字 ID 标识,命名如 RET047OD,不含姓名等直接标识)。
3.6 与库内同类数据集的组织模式对照
| 数据集 | 出品方类型 | 标注组织 | 临床数据 |
|---|---|---|---|
| PAPILA | 理工大学 + 大学医院 | 两位专家(经验差 25 年) | 成套结构化 |
| refuge(62) | 挑战赛联盟 | 挑战赛标注团 | 有限 |
| justraigs(746) | 医院/研究组 | 转诊标签 | 有限 |
| messidor(59) | 研究联盟 | 单套分级 | 部分 |
PAPILA 在"双专家 + 经验差"上的组织设计,是它在库内青光眼家族中相对独特的方法学卖点——refuge(62) 虽有分割任务,但采用的不是"同一批图像双专家独立标注"这种可直接量化观察者变异的组织方式。
§4 数据规模、类别分布与质量硬数字
这一节集中给出 PAPILA 的"硬数字":规模、分辨率、类别计数、缺失数据、分割质控指标。凡存在跨来源冲突的,均按"双口径存照"处理(冲突清单见 §9)。
4.1 总规模与层级结构
PAPILA 的规模可以用三个数字锁死:
- 244 位患者
- 488 只眼(每位患者左右眼各 1 只)
- 488 张眼底图(每只眼对应 1 张,无重复、无多角度)
层级很清晰:患者 → 双眼 → 每眼 1 图 + 每眼 2 套专家分割轮廓。正因为"每位患者两只眼都在",PAPILA 才能支撑"同一患者双眼配对"这类别的眼底数据集难以支持的研究(例如双眼间不对称性、患者级聚合建模)。
4.2 图像规格与目录
| 属性 | 值 |
|---|---|
| 分辨率 | 2576 × 1934 像素 |
| 格式 | JPEG |
| 位深 | 8 bit/通道 |
| 视场(FOV) | 论文口径 30° 孔径,以视乳头(papilla)为中心(第三方 45° 口径见 §9 存照 4) |
| 命名 | `RET<三位患者号><OD |
数据包内目录结构为:
PAPILA_DBv1/
├── ClinicalData/ # 结构化临床表格(左右眼分列)
├── ExpertsSegmentations/ # 双专家视杯/视盘轮廓坐标
├── FundusImages/ # 488 张 JPEG 眼底图
└── HelpCode/ # 脚本 + Jupyter Notebook 示例(PythonExample_Notebook)
约定 OD = 右眼、OS = 左眼——这个左右眼编码在后续所有分割文件和临床表中保持一致,是跨目录对齐的主键基础。
4.3 类别分布(眼级计数,论文 Table 4)
这是全文最容易被转述者弄错的数字,务必按论文 Table 4 的眼级计数为准:
| 类别 | 右眼 | 左眼 | 合计(眼) |
|---|---|---|---|
| Healthy(健康) | 170 | 163 | 333 |
| Glaucoma(青光眼) | 40 | 47 | 87 |
| Suspect(可疑) | 34 | 34 | 68 |
| 合计 | 244 | 244 | 488 |
三点必须并存理解:
- 眼级计数:333 / 87 / 68,合计 488。healthy 占 68.2%,glaucoma 仅 17.8%,suspect 13.9%——结构性类不平衡(这直接解释 §7 里"三分类很难、suspect 捣乱"的基线结论)。
- 左右眼小计均为 244,与患者数一致,佐证"每位患者双眼齐备"。
- 论文 Table 1 的对比表把 glaucoma 与 suspect 合并记为 155(标注为 “Glaucoma (or suspect)”,即 87 + 68 = 155)。Table 1 是横向对比表、Table 4 是分布明细表,读数时不要把 155 当成某一类的计数。
口径提示:部分第三方文献把这三类写反,例如写作"suspected 87 / confirmed glaucoma 68"——这与原始 Table 4 恰好相反。凡遇到这类转述,一律回查论文 Table 4(详见 §9 存照 3)。
4.4 分割文件数与命名
分割目录的文件总数可以精确推出:
2 位专家 × 2 只眼 × 2 个结构(cup/disc) × 244 位患者 = 1,952 个轮廓文件
命名规则为 RET<患者号><OD|OS>_<cup|disc>_exp<1|2>.txt,例如 RET047OD_cup_exp1.txt。文件内容是纯文本的 X/Y 节点坐标序列(逐点打点连成的多边形轮廓),不是二值掩膜图像——使用者需自行按坐标栅格化为掩膜,或直接做多边形比对。
4.5 临床字段与缺失数据(论文 Table 5)
临床表格按右眼、左眼两个子表分列,包含以下字段:
| 字段 | 含义 | 取值说明 |
|---|---|---|
| 患者唯一 ID | 患者标识 | 三位数字 |
| 年龄 | 年龄 | 数值 |
| 性别 | 性别 | 0 = 男 / 1 = 女 |
| 诊断 | 三分类标签 | 0 = healthy / 1 = glaucoma / 2 = suspect |
| 屈光不正 | 屈光不正 | 数值 |
| phakic | 晶状体状态 | 1 = 晶状体已摘除 / 0 = 保留 |
| IOP | 眼压 | mmHg |
| pachymetry | 角膜厚度 | µm |
| axial length | 眼轴长 | mm |
| MD | 视野平均缺损 | dB(仅青光眼 Group 1 及部分 suspect 采集,healthy 缺失) |
缺失数据(论文 Table 5 逐条存照):
| 缺失字段 | 缺失例数 | 缺失患者 ID |
|---|---|---|
| pachymetry(角膜厚度) | 6 | 19, 20, 46, 57, 114, 116 |
| axial length(眼轴长) | 4 | 19, 48, 64, 79 |
| IOP(眼压) | 2 | 213, 218 |
| 屈光不正 | 1 | 213 |
| MD(视野平均缺损) | healthy 患者整体缺失 | 结构性缺失 |
患者 213 同时缺 IOP 与屈光不正两项。作者的态度很明确:这些不完整记录被刻意保留,目的是让数据集可以用于"缺失数据插补/鲁棒建模"方法的研究——不是忘了补,而是留作实验条件。使用者若做全字段建模,需自行决定"整行剔除"还是"插补"(见 §10 避坑)。
4.6 样本量推导与数据包体量
样本量推导:Group 2 的规模依据"穆尔西亚第七区人口 + 40 岁以上单纯慢性青光眼患病率 3.5% + 置信水平 95% + 误差 3%“估算而来。这个推导写出来,是为了说明 244 患者不是"能收多少收多少”,而是有统计设计的。
数据包体量:figshare 上的 PAPILA.zip 约 563.49 MB(v2;v1 为 563.48 MB,7 天内的微小差异,存照)。其中绝大部分体积来自 488 张 2576 × 1934 的 JPEG;分割坐标与临床表都是纯文本,体积可忽略。
4.7 分割标注质控:Sørensen-Dice 与 CDR 一致性(论文 Table 6)
这是 PAPILA 质量硬数字里最有分量的一节——它同时给出观察者间和观察者内两套一致性。
Sørensen-Dice 系数(分割重叠度,越高越一致):
| 一致性类型 | 样本 | 视杯(cup) | 视盘(disc) |
|---|---|---|---|
| 观察者间(interobserver) | 全 244 患者 × 2 眼 = 488 眼 | 0.823 ± 0.089 | 0.935 ± 0.036 |
| 观察者内(intraobserver)Expert #1 | 随机 15 患者 = 30 眼,间隔 2 年重标 | 0.827 ± 0.093 | 0.958 ± 0.037 |
| 观察者内(intraobserver)Expert #2 | 同上 | 0.834 ± 0.099 | 0.955 ± 0.033 |
质量阈值:视盘 Dice ≥ 0.8、视杯 Dice ≥ 0.7(对很小的视杯另作放宽)。
CDR 差异(area-based,基于分割面积算出的杯盘比之差):
- 观察者间:−0.002 ± 0.045(p = 0.231,CI [−0.006, 0.001])
- 观察者内 Expert #1:0.002 ± 0.055(p = 0.803)
- 观察者内 Expert #2:0.008 ± 0.060(p = 0.465)
怎么读这组数:
- 视盘比视杯好标得多:观察者间视盘 Dice 0.935 已属优秀,而视杯只有 0.823——差别直接源于"视盘边界清晰、视杯边界主观"。这正是"视杯标注是青光眼分割里最难环节"的定量证据。
- 观察者内略优于观察者间:同一人两年后重标的一致性(0.827/0.958 等)略高于两个人之间的一致性,符合直觉,也说明标注流程稳定。
- CDR 差异均值极小且不显著:观察者间 CDR 差异均值 −0.002、p = 0.231(不显著),说明两人算出的杯盘比在系统上几乎无偏——即使视杯轮廓有分歧,落到 CDR 这个聚合指标上差异被抹平了。这是 PAPILA 敢把 CDR 当质控/KPI 用的底气。
4.8 规模与质量的一句话小结
PAPILA 的规模(488 眼)在眼底数据集里属于小号;但它把有限规模换成了结构深度——配对双眼、成套临床字段、双专家逐像素分割、且把标注一致性量化到 Dice 与 CDR 两个层面。读它时应把注意力放在"质量硬数字"而非"规模硬数字"上。
§5 任务定义与标注协议
5.1 核心任务清单
PAPILA 支持的任务可以分成三族:
| 任务族 | 具体任务 | 标签/产物 |
|---|---|---|
| 分类 | 青光眼三分类(healthy / glaucoma / suspect) | 眼级标签 0/1/2 |
| 分类 | 青光眼二分类(healthy vs glaucoma,去 suspect) | 眼级标签 0/1 |
| 分割 | 视盘(OD/disc)分割 | 双专家轮廓坐标 |
| 分割 | 视杯(OC/cup)分割 | 双专家轮廓坐标 |
| 回归/计算 | 杯盘比(CDR) | 由分割面积导出,或作回归目标 |
论文自设基线只覆盖了分类这一族(图像侧与临床侧各一组实验,见 §7);分割族主要作为数据资产提供给下游(分割模型、CDR 计算研究)。
5.2 标签来源:临床诊断而非图像印象
PAPILA 的三分类标签有一个关键性质——它由眼科医生基于临床数据综合评估给出,而非仅凭眼底图判读。
"基于临床数据"意味着:医生参考了 IOP、角膜厚度、眼轴长、视野 MD、既往病史,有时还回顾病史,才落下一个 healthy / glaucoma / suspect。这一点决定了标签的可信度锚定在临床诊断上,而不是"看图说话"的图像主观印象。
这带来一个研究者必须清楚的推论:眼底图像本身可能并不包含足够区分三类的全部信息。suspect(可疑)这一类的存在就是明证——它的诊断依据大量来自临床指标与随访观察,图像上的形态可能并没有明显异常。这直接解释了论文的一个核心论断(§5.6):suspect 类不表现为 healthy 与 glaucoma 之间的中间态,而更像一个"未解决类",从而干扰图像模型的决策边界。
5.3 三分类 vs 二分类:两种任务口径
PAPILA 原生支持两种分类口径,两者的难度与结论完全不同:
- 三分类(含 suspect):healthy / glaucoma / suspect。论文图像实验(Test #1)显示 AUC 较低,且 suspect 样本在 PCA/t-SNE 上与另外两类混在一起、不成独立簇——模型无法把 suspect 学成一个有序的中间类。
- 二分类(去 suspect):只留 healthy vs glaucoma。论文实验(Test #2)显示 AUC 明显提升(正文定性表述为"clearly improved when the suspect class is not present")。
因此使用 PAPILA 做分类时,第一件事就是决定要不要保留 suspect。保留 → 任务更贴近真实筛查场景,但难度陡增;去掉 → 二分类干净,但丢弃了 68 眼、且回避了真实门诊中"可疑"这个高频类。这个取舍没有标准答案,取决于研究目标(见 §10 避坑)。
5.4 分割标注协议
分割标注的流程可以概括为"人工逐像素手工打点":
- 标注者在自研轮廓编辑工具中打开眼底图(支持图像查看与缩放);
- 沿视盘/视杯边界逐个像素点地打点;
- 用线段把相邻点连接成闭合多边形轮廓;
- 每位专家独立完成同一张图的 cup 与 disc 两套轮廓;
- 结果是坐标点序列(文本),而非已栅格化的掩膜图。
由于是"手工逐点 + 双人独立",PAPILA 的分割数据才能同时提供 §4.7 那组观察者间/观察者内一致性指标。使用坐标文本做训练时,需要先按坐标栅格化(cv2.fillPoly / matplotlib.Path 等);做 CDR 计算时,则可直接用多边形面积比 CDR = Area(cup) / Area(disc)。
5.5 质控如何约束使用方式
论文给出了两条明确的质量阈值,使用者应按此过滤或加权:
- 视盘 Dice ≥ 0.8
- 视杯 Dice ≥ 0.7(极小视杯例外)
实际操作建议:当把两位专家的轮廓当"金标准"时,可以只保留两人的 Dice 达到阈值的样本(或取两人轮廓的交/并做共识);若研究本身关注"标注不确定性",则应保留全部分歧样本并显式建模(例如把两人轮廓作为两个"标注者维度"输入)。PAPILA 的"双专家"设计正是为后一种研究准备的(§5.6)。
5.6 关键论断:suspect 不是中间态
论文最值得记住的一条论断是:suspect 类不表现为 healthy / glaucoma 之间的中间态。
证据来自两处:
- 图像侧:Test #1 多分类下,suspect 样本在 PCA / t-SNE 降维图上与 healthy、glaucoma 混合分布,不落在两者之间的有序区域——说明它在图像特征空间里不是一条界线上的过渡点,而是散布开的"未解决类"。
- 临床侧:Test #3 多分类的 AUC 只在 0.66–0.68(见 §7),说明仅临床指标也不足以把三类干净分开。
这条论断的实践含义:不要指望模型"顺带"学会 suspect。要么把它当独立难类专门处理、要么在二分类里剔除、要么用临床+图像多模态联合建模——想让它自然退化成一个序数中间类,在 PAPILA 上不成立。
5.7 视野(VF)分级标准
视野检查只在 Group 1 青光眼患者上采集(30-2 程序,中央 30°、76 点网格)。MD(mean defect,平均缺损)的判读分级为:
| 分级 | MD 范围 |
|---|---|
| 正常 | 约 0 ~ −2 dB |
| 轻度(mild) | −3 ~ −6 dB |
| 中度(moderate) | −6 ~ −12 dB |
| 重度(severe) | > −12 dB(即比 −12 更负) |
注意 MD 是负值,越负表示视野损害越重。
青光眼性视野损害的判据:同一半视野内至少 3 个点低于正常值(低于 5% 分位),且排除盲点周围与外周行,并且重复测试结果一致,方判定为青光眼性损害。这个判据把"单次偶发异常"排除在外,是视野判读的临床常规口径。
5.8 任务与协议的衔接小结
把 §5 收成一句:PAPILA 的分类标签来自临床诊断(不是图像印象)、分割标签来自两位经验悬殊的专家的手工逐点标注、质控被量化为 Dice 与 CDR 两个指标。使用者的首要决策是"要不要 suspect"(分类)与"把双专家当金标准还是当不确定性来源"(分割)——这两个决策定下来,后面的建模路径就清楚了。
§6 许可、获取与版本谱系
6.1 一句话结论
PAPILA 通过 figshare 公开发布,匿名直接下载、无注册墙、无申请审批,采用 figshare 数据页标注的 “GPL 3.0+” 作为数据集许可;而其关联论文(Scientific Data)正文按 CC BY 4.0 开放获取。两者指向不同对象——数据集的许可见 figshare 页,文章本体的许可见期刊页——这是本条目必须并列存照的第一处口径分叉。
6.2 数据入口与 DOI
| 项目 | 内容 |
|---|---|
| 数据仓库 | figshare(Figshare LLP / Digital Science 旗下通用数据仓) |
| 数据 DOI(概念) | 10.6084/m9.figshare.14798004 |
| 版本 DOI(v1) | 10.6084/m9.figshare.14798004.v1 |
| 版本 DOI(v2,当前最新) | 10.6084/m9.figshare.14798004.v2 |
| 首版发布时间 | 2022-04-29 |
| 次版发布时间 | 2022-05-06(与首版仅隔 7 天) |
| 当前文件 | PAPILA.zip,563.49 MB |
| 文件 ID(v2) | 35013982 |
| 关联论文 DOI | 10.1038/s41597-022-01388-1(Sci Data 2022;9(1):291) |
| 勘误 DOI | 10.1038/s41597-024-03175-6(Sci Data 2024;11(1):391) |
DOI 采用 .v1 / .v2 后缀式的版本化 DOI方案,是 figshare 的标准做法:概念 DOI(不带 .vN)永远解析到最新版,版本 DOI 则锚定具体快照。对可复现性研究而言,这一设计意味着引用时应明确写出版本后缀,否则同一 DOI 在不同时间可能取到不同文件。
6.3 版本链(时间轴)
2022-04-29 ── v1 发布(10.6084/m9.figshare.14798004.v1)
│ 文件:PAPILA.zip ≈ 563.48 MB
│
2022-05-06 ── v2 发布(10.6084/m9.figshare.14798004.v2)★ 当前最新
│ 文件 ID 35013982,PAPILA.zip = 563.49 MB
│
2022-06-09 ── 论文正式见刊(Sci Data 9:291)
│
2024-04 ── 勘误发布(Sci Data 11:391,仅资助信息文字更正)
三点需要注意:
- 论文与数据的时序:v1(4 月 29 日)早于论文见刊(6 月 9 日)约 6 周,v2(5 月 6 日)早于论文约 5 周。这是"先存数据、后发论文"的典型流程,数据 = 论文的证据基座。
- 论文写的是
.v1,而不带后缀的 DOI 现在解析到.v2。论文 Data Records 节在引用数据时写的是 v1;而 figshare 当前裸页、以及多数第三方加载器(例如 torch_em 系列的 PAPILA 载入脚本)实际取到的是 v2 文件。这是第二处口径分叉。 - v1 与 v2 的差异极小:体积仅差约 0.01 MB(563.48 MB → 563.49 MB),两版相隔仅 7 天,且 figshare 变更说明未列出明细改动。合理推断为元数据或个别文件的微调,而非内容级重发布——但由于未获官方逐项变更说明,本条目将其列为遗留待核点,不臆断具体改动。
6.4 license 三口径并列(重点存照)
PAPILA 的许可标注在网络上有三种口径流传,必须区分对象与权威性:
| 口径来源 | 标注 | 指向对象 | 权威性 | 处理 |
|---|---|---|---|---|
| figshare 数据页 | GPL 3.0+ | 数据集本身 | 权威(原始发布方) | 数据集许可以此为准 |
| UPCT 科研门户(portalinvestigacion.upct.es) | GPL 3.0+ | 数据集本身 | 佐证(同源机构) | 印证 figshare 口径 |
| Scientific Data 论文页/文章本体 | CC BY 4.0 | 论文文章 | 权威(期刊) | 文章许可,不覆盖数据 |
| 部分聚合目录(如 khosravipooya.com/EyeDataHub 等) | CC BY 4.0 | 数据集(转述) | 非权威(二次转述) | 仅作存照,不采信 |
关键辨析:
- GPL 3.0+ 是"传染性"(copyleft)许可,与常见的 CC 系列(BY/SA/NC)在法律机理上差异显著:GPL 要求衍生作品以同许可分发,对"模型权重是否算衍生作品"存在法律灰区;CC BY 4.0 则是宽松署名许可。这一区别对下游商用与闭源模型训练的合规判断影响很大,使用者不应想当然按 CC BY 处理。
- 论文页显示 CC BY 4.0,指的是论文文本与图表的再利用许可(Sci Data 全部内容开放获取),并不自动适用于 figshare 上的数据包。把文章的 CC BY 4.0 直接套到数据集上,是第三方目录常见的转述错误。
- 因此本条目给出推荐引用与合规表述:数据——按 figshare 页 GPL 3.0+;文章——按 CC BY 4.0。若下游用途对许可敏感,应回溯 figshare 页面当时状态为最终依据。
6.5 获取方式与 AI-Ready 友好度
- 匿名直接下载:figshare 页面对 PAPILA.zip 提供直链,无需注册、无需登录、无需向作者发送请求,也不存在"申请—审批—签署 DUA"的闸门。
- 单包交付:数据以单个
PAPILA.zip打包发布,一次下载即得全部内容(图像 + 分割掩膜 + 临床表格 + HelpCode),无需逐文件抓取。 - 镜像友好:figshare 的直链结构稳定,便于国内镜像(如 hf-mirror.com 类中转)或机构内网缓存复现,降低跨境取数成本。
- 对 AI-Ready 的意义:三点——① 可发现(DOI 唯一标识,Crossref/DataCite 可解析);② 可获取(零摩擦直下,无身份门槛);③ 可复用(明示许可 + 明示引用要求)。相较于需要邮件申请或签署协议的临床数据集(如部分院内数据),PAPILA 的获取摩擦处于最友好一档。
6.6 引用要求(图情细节)
figshare 页面明确写有一句关键提示:
“Please cite the article and not the figshare repository.”
即官方要求引用关联论文,而非数据仓条目本身。这一要求对下游有两层影响:
- 学术引用:论文(Kovalyk et al., Sci Data 2022;9(1):291)是首选引用对象;引用数据仓 DOI 属补充(GB/T 7714、APA、BibTeX 等格式均应优先落论文条目)。
- 机器可读溯源:在数据集卡片(datasheet / dataset card)中,建议同时登记论文 DOI 与 figshare 版本 DOI,兼顾"官方引用意愿"与"版本可追溯性"。
本条目在 INFOBOX 与 §6.2 表格中同时登记论文 DOI + figshare 版本 DOI,即遵循这一双重登记原则。
6.7 资助与致谢(含编号口径存照)
PAPILA 的采集与发布由以下资助支持:
| 资助机构 | 编号 | 口径备注 |
|---|---|---|
| Instituto de Salud Carlos III(西班牙卡洛斯三世健康研究所,AES 2017 计划) | AES2017-PI17/00771 | 论文致谢列示 |
| Instituto de Salud Carlos III(AES 2017 计划) | AES2017-PI17/00821 | 论文致谢列示 |
| Fundación Séneca(穆尔西亚地区科学基金,PI/18 计划) | 2090/PI/18 或 20901/PI/18 | 双口径:figshare/UPCT 页面写 2090/PI/18,2024 勘误文写 20901/PI/18(见下) |
资助编号口径分叉(7 条双口径之五):Fundación Séneca 的项目编号在勘误文(Sci Data 2024;11:391)中记为 20901/PI/18,而在 figshare / UPCT 科研门户中记为 2090/PI/18。两串数字相差一位。这正是 2024 年勘误的存在意义之一——勘误仅更正资助信息文字,不涉及数据或结论。因此:
- 引用资助编号时,以勘误文(最新、已更正)为准;
- 数据仓页面的旧编号属未同步的历史标注,存照即可。
6.8 与库内同类条目的许可对照
| 条目 | rid | 数据集许可口径 | 获取摩擦 |
|---|---|---|---|
| PAPILA(本条) | 待定 | GPL 3.0+(figshare) | 匿名直下 |
| refuge | 62 | 以原始页为准(多为研究用) | 下载 |
| justraigs | 746 | 以原始页为准 | 下载 |
| messidor | 59 | 研究用(需登记) | 中 |
| eyepacs | 58 | 研究用(协议/DUA) | 高(申请制) |
| ddr | 201 | 以原始页为准 | 下载 |
要点:PAPILA 采用 copyleft 型 GPL 3.0+,在库内眼科条目中属于许可条款较"重"的一档(对比 CC BY 类宽松许可)。下游若计划闭源商用或封装进专有产品,须先做合规确认;若仅用于学术评测与开源模型训练,则 GPL 约束通常不构成障碍。该差异是本条目相对库内其他青光眼/眼底条目的独立定位点之一。
6.9 §6 小结:五条要点
- 单仓单包:figshare DOI
10.6084/m9.figshare.14798004,当前最新.v2,单文件PAPILA.zip= 563.49 MB。 - 版本小分叉:论文写
.v1,figshare 现状为.v2,两版仅隔 7 天、体量近乎一致,改动明细未公开。 - 许可三口径:figshare GPL 3.0+(数据,权威)/ 论文 CC BY 4.0(文章)/ 第三方目录 CC BY 4.0(转述,非权威)——以 figshare 页为数据集许可依据。
- 零摩擦获取:匿名直下、无注册墙、单包交付,AI-Ready 友好度高。
- 引用官方要求:引论文而非数据仓;资助编号以 2024 勘误文的
20901/PI/18为准。
§7 评估协议、基线结果与生态复现
7.1 论文自设基线的完整配置
PAPILA 论文不只是"发布数据集",还自带一套完整的分类基线,用于验证"该数据集能否支撑青光眼自动判别"。其配置逐项如下:
| 配置项 | 设定 |
|---|---|
| 骨干网络(图像分支) | DenseNet121、VGG16、MobileNet、Inception、ResNet50、Xception 六种 |
| 分类头(自研) | flatten → 全连接 → Softmax |
| 预训练 | ImageNet 预训练权重 |
| ROI 裁剪 | 以 Expert #1 的视盘分割框裁剪,再 resize 至 200×200×3 |
| 批大小 | 16 |
| 优化器 | Adam |
| 学习率 | 1e-4 |
| 损失函数 | 交叉熵 |
| 类别加权 | N / (N_c · C)(N = 总样本,N_c = 该类样本,C = 类数)——缓解类别不平衡 |
| 评估方式 | 5 折交叉验证,指标 ROC/AUC,报 5 折均值 ± 标准差 |
两个工程细节值得特别指出:
- ROI 的裁剪依据来自分割标注:即便做的是"分类"任务,作者也先用 Expert #1 的视盘框做 ROI 定位。这意味着分割标注既是任务本身,也是分类任务的前处理基础设施——体现了 PAPILA "分割 + 分类双任务合一"的设计取向(这也是本数据集区别于纯分类数据集的核心特征,见 §1)。
- 类别加权 N/(N_c·C) 直接针对 §4.3 所述的三分类严重不平衡(healthy 333 / glaucoma 87 / suspect 68)。若不做加权,模型会退化到"全预测 healthy"的高虚高准确率陷阱。
7.2 防数据泄漏:同一患者双眼同折
5 折交叉验证的关键设计:由于 PAPILA 是双眼配对数据集(同一患者贡献 OD + OS 两张图),若随机按"图"划分折,同一患者的左右眼可能落入不同折,导致模型在测试折"见过"同一患者的另一只眼。这种**患者级泄漏(patient-level leakage)**会系统性高估模型泛化能力。
论文的处理是:同一患者的双眼必须进入同一折。这是双眼/配对数据集评估的最低正确姿势,也是 PAPILA 作为"配对数据集"必须在评估协议上做的特殊约束。对本条目读者而言,这条是使用 PAPILA 做基准时必须复刻的纪律——否则所报 AUC 不可信、也不可与论文基线比较。
7.3 图像实验(Test #1 / #2)
论文的图像分类实验分两个场景:
| 实验 | 任务 | 类别构成 | 结果特征 |
|---|---|---|---|
| Test #1 | 眼级多分类(3 类) | healthy + glaucoma + suspect | AUC 较低;suspect 类分类困难 |
| Test #2 | 眼级二分类(2 类) | healthy + glaucoma(剔除 suspect) | AUC 明显提升 |
论文正文对二者的定性表述为:当 suspect 类不存在时,性能"clearly improved"(显著提升)。
关于精确 AUC 数值的重要说明(7 条双口径之七):Test #1 / Test #2 各骨干网络的精确 AUC 数值,论文仅在 Figure 6 中以 ROC 曲线图形呈现,正文与表格均未给出数字。因此:
- 本条目只作定性描述(“Test #1 较低、Test #2 明显提升”),不臆造任何具体 AUC 数字;
- 如需精确值,须读图取点或获取作者开源代码(HelpCode)复现;
- 这一"数值缺失"本身也是一种方法学特征的存照——图形化呈现削弱了数值级可比性,下游若要横向对比不同方法,须自建基线而非直接引论文数字。
7.4 suspect 类的"未解决"性质(核心论断)
论文最重要的方法学论断之一,是关于 suspect(疑似青光眼)类不等于中间态:
- 在 PCA / t-SNE 低维投影中,suspect 类并未落在 healthy 与 glaucoma 之间的连续过渡带上,而是与两类均有交叠、自身不构成独立簇;
- 因此 suspect 不是"青光眼进展的中间阶段分类学标签",而更像一个**"当前诊断未定"的未解决类(unresolved class)**;
- 其存在会干扰 healthy / glaucoma 之间的决策边界学习——这解释了为何"剔除 suspect"(Test #2)能显著提升二分类性能。
对下游模型的启示:suspect 类不是可线性分离的第三类,强行三分类会拖累整体指标;实践中常见做法是——① 先做 healthy vs glaucoma 二分类(对应 Test #2);② 或将 suspect 作为"转诊复核"兜底类单独处理,而非硬塞进分类器输出层。
7.5 数据增强的架构依赖性
论文测试了数据增强(旋转/翻转/缩放等常规手段)的效果,得到一条架构相关的结论:
| 骨干 | 数据增强效果 |
|---|---|
| VGG16 | 显著正向 |
| MobileNet | 显著正向 |
| Inception | 显著正向 |
| DenseNet121 | 无正向提升 |
| ResNet50 | 无正向提升 |
| Xception | 无正向提升 |
即增强效果因架构而异,并非"增强越多越好"的普适结论。这与 DenseNet/ResNet/Xception 本身更强的特征不变性与正则化设计有关——增强带来的额外不变性对这些架构已边际。该结论对基准复现者选择骨干与增强策略有直接指导意义。
7.6 临床数据实验(Test #3 / #4)
除了图像分支,论文还测试了仅用临床指标的分类能力,使用 4 种经典机器学习方法:逻辑回归(LR)、k 近邻(k-NN)、随机森林(RF)、支持向量机(SVM)。
| 实验 | 任务 | AUC 范围 | 方法间离散度 |
|---|---|---|---|
| Test #3 | 眼级多分类(3 类) | 0.66 – 0.68 | 标准差 < 0.07(高度趋同) |
| Test #4 | 眼级二分类(2 类) | 0.64 – 0.75(均值约 0.71) | 明显拉开 |
解读:
- Test #3 性能弱且方法间趋同(0.66–0.68,离散度 <0.07):在含 suspect 的三分类任务下,四种经典方法都接近随机水平之上不多——再次印证 suspect 类的存在严重削弱可分性。
- Test #4 二分类略有抬升(0.64–0.75,均值 0.71):去掉 suspect 后性能上升,但仍低于"图像 + 去 suspect"场景,说明临床指标单独使用时判别力有限,图像信息才是主要信号源。
- 方法间差异:随机森林/SVM 通常在二分类下表现更好(Range 上限 0.75 由较强方法贡献),但总体没有一种经典方法能凭临床数据达到临床可用门槛——这从反面论证了眼底图像自动分析的必要性,也是 PAPILA 这类"图像为主、临床为辅"数据集的价值论据。
7.7 第三方复现与生态扩展(非论文数据)
PAPILA 发布后进入多个第三方研究与综述视野,构成其"生态佐证":
| 第三方工作 | 出处 | 与 PAPILA 的关系 |
|---|---|---|
| 青光眼 AI 筛查综述 | Jian et al., npj Digital Medicine 2023;6:67(doi:10.1038/s41746-023-00857-0) | 将 PAPILA 列为青光眼眼底筛查可泛化模型评测数据集之一(记 488 图 / 244 人、30° FOV、三分类、含 OD/OC 专家分割) |
| FusionFM | arXiv:2508.11721 | 用 PAPILA 做青光眼检测,记数据收集 2018–2020、488 图 |
| 血管-视盘交叉分割工作 | Sci Rep 2025;15(doi:10.1038/s41598-025-89666-x,VOxSeg 系) | 使用 PAPILA 视杯/视盘掩膜;记图像 2576×1934、45° 开角(与论文 30° 冲突,见 §6/§9 双口径) |
| torch_em 数据加载器 | 开源工具链 | 提供 PAPILA 载入封装,指向 v2 文件 |
第三方生态的三点观察:
- 综述层面已被收录(npj Digit Med 2023),说明 PAPILA 已进入青光眼眼底筛查"标准评测集"名单,学术可见度确立。
- 复现层面有工具链支持(torch_em 等),降低了重新解析数据格式的门槛。
- 转述层面已出现小规模口径漂移:如前述的 45° vs 30° FOV、suspect/glaucoma 计数颠倒——见 §9 双口径清单第 3、4 条。这提示下游引用时须回查论文原始 Table 4 与正文,而非采信二次转述。
7.8 §7 小结
- 基线完备:6 骨干 CNN + 临床 4 方法,配置(ROI 200×200、类别加权、5 折)逐项可复现。
- 评估纪律:同一患者双眼同折,防患者级泄漏——使用 PAPILA 必须复刻。
- suspect 非中间态:它是未解决类,剔除后性能显著提升(Test #1 → Test #2)。
- 临床单用不足:Test #3 AUC 0.66–0.68、Test #4 0.64–0.75,反证图像价值。
- 数值留白:Fig 6 精确 AUC 仅存于图中,条目只作定性描述,不臆造数字。
§8 生态定位与库内互链点
8.1 定位坐标:PAPILA 在眼科数据集谱系中的位置
PAPILA 的独特坐标可归纳为一句话:"双眼配对 + 双专家分割 + 临床指标三合一"的青光眼眼底数据集。将它放入库内既有的眼科数据集谱系,可沿三条轴定位:
- 疾病轴:青光眼(glaucoma)域,与糖尿病视网膜病变(DR)域、黄斑/多病域并列;
- 任务轴:视杯/视盘分割 + 青光眼分类双任务;
- 模态轴:彩色眼底照相(CFP),区别于 OCT 断层模态。
8.2 青光眼域(最相关互链域)
| 库内条目 | rid | 与 PAPILA 的关系 | 互链理由 |
|---|---|---|---|
| refuge | 62 | 青光眼视盘/视杯分割 + CDR 挑战赛 | 首要互链:任务高度重叠(分割 + CDR),PAPILA 是 REFUGE 之外的双眼配对补充 |
| justraigs | 746 | 青光眼转诊 AI 数据集 | 同为青光眼"转诊/筛查"取向,人群与标注体系互补 |
| rim-one | 291 | 单眼视盘/视杯分割 | 与 PAPILA 的双眼配对形成方法论对照(单眼 vs 配对) |
| drishti-gs | 301 | 单眼视盘/视杯分割 | 同 rim-one,单眼分割经典基准,与 PAPILA 配对设计形成互补 |
| g1020 | 待定(同批) | 青光眼眼底筛查 | 同批入池,发布后建家族导航 |
| origa-light | 待定(同批) | 青光眼视盘/视杯 CDR | 同批入池,任务域最接近(CDR 相关) |
青光眼域互链要点:refuge(62) 是第一互链位——两者都做视盘/视杯分割并涉及 CDR,是天然对照。差异在于:REFUGE 以挑战赛形式组织、含验证/测试隐藏集;PAPILA 以双眼配对 + 双标注专家 + 临床指标为特色。二者并置可让读者看到"青光眼分割评测"的两种数据组织范式。
8.3 DR / 多病域(互补互链域)
| 库内条目 | rid | 关系 |
|---|---|---|
| messidor | 59 | 眼底 DR 分级经典集,同为眼底 CFP 模态 |
| ddr | 201 | 大规模 DR 分级 |
| idrid | 191 | DR 分级 |
| deepdrid | 211 | DR 分级(深度) |
| eyepacs | 58 | 大规模 DR 筛查(申请制) |
| odir | 63 | 多眼病(含青光眼) |
| rfmid | 271 | 视网膜多病 |
| fives* | 741 | 眼底多任务(origa-light FACTS 提及) |
互补逻辑:这些条目以 DR/多病为主,与 PAPILA 的青光眼单一疾病深度形成"广度 vs 深度"互补。其中 odir(63) 因含青光眼类标签,与 PAPILA 有疾病标签层面的直接交集,互链优先级高于其他 DR 条目。
8.4 OCT 域(同眼科、不同模态)
| 库内条目 | rid | 关系 |
|---|---|---|
| octa-500 | 341 | OCTA 血管成像 |
| oct2017 | 311 | OCT 分类 |
| octdl | 690 | OCT 深度学习 |
| octid | 697 | OCT 识别 |
跨模态互链逻辑:OCT 域条目与 PAPILA 同属眼科影像但模态不同(断层 vs 眼底照相)。互链价值在于呈现**"青光眼诊断"的互补模态证据链**——眼底 CFP 看视盘形态、OCT 看视网膜神经纤维层厚度,二者共同支撑青光眼评估。这是"同疾病、不同模态"的互链范式。
8.5 同批入池条目(本轮家族)
本轮同批有两条青光眼相关条目,与 PAPILA 构成同批家族:
- g1020(青光眼眼底筛查数据集)
- origa-light(青光眼视盘/视杯 CDR 相关)
处理约定:这两条与 PAPILA 同为青光眼域、同批入池,rid 在发布后由流水线回填。因此:
- 本条目互链表中将它们标注为"待定(同批)";
- 发布后应优先建立"青光眼眼底 AI-Ready 家族导航",把 refuge(62) / justraigs(746) / g1020 / origa-light / rim-one(291) / drishti-gs(301) 与 PAPILA 串成主题簇。
8.6 建议互链优先级(rid 升序)
综合"任务重叠度 + 疾病相关度 + 模态关系",本条目建议的互链优先级如下:
青光眼分割/筛查(首要)
refuge(62) > justraigs(746) > rim-one(291) > drishti-gs(301)
同批家族(发布后回填 rid)
g1020* > origa-light*
眼底 DR / 多病(广度互补)
messidor(59) > ddr(201) > idrid(191) > deepdrid(211) > eyepacs(58)
> odir(63) > rfmid(271)
OCT 跨模态
octa-500(341)
(* 同批,发布后 rid 回填)
排序依据:青光眼分割域(62/746/291/301)任务重叠最直接,位次最前;同批家族紧随(发布后补齐 rid);DR/多病域属"广度互补",位次居中;OCT 跨模态因模态差异最大,列于末位但仍具互链价值。
8.7 §8 小结
- 坐标:双眼配对 + 双专家分割 + 临床指标三合一的青光眼 CFP 数据集。
- 首要互链:refuge(62)(青光眼分割/CDR 天然对照);次为 justraigs(746)、rim-one(291)、drishti-gs(301)。
- 同批家族:g1020、origa-light 发布后建青光眼家族导航。
- 互补域:DR/多病域提供广度对照,OCT 域提供跨模态证据链。
§9 局限、风险与合规提示
任何数据集条目若只讲"能做什么",就是半张地图。PAPILA 的价值恰在于它诚实地暴露了自己的边界:小样本、单中心、单人群、双眼配对、类别不平衡、部分字段缺失、许可为 copyleft。本节逐条拆解使用前必须知情的事项,并在每条后给出可操作的应对建议,而非停留在"注意"二字。
9.1 单病覆盖:只回答"青光眼"一个问题
PAPILA 的标签体系只有三档——healthy / glaucoma / suspect——全部围绕青光眼。它不含糖尿病视网膜病变(DR)分级、不含黄斑病变、不含白内障分级、不含视网膜血管疾病标签。这意味着:
- 不能把 PAPILA 直接当作"眼底多病筛查"数据集使用;
- 不能用 PAPILA 训练"广谱眼底病变"模型——它的阴性类(healthy)只表示"无青光眼相关视神经病变",不排除其他眼病;
- 若要做多病模型,PAPILA 只能作为"青光眼子任务"的组件,需与 messidor(59) / ddr(201) / idrid(191) / eyepacs(58) / odir(63) 等 DR/多病域条目联合使用(见 §8.3)。
应对:把 PAPILA 定位为青光眼专项数据集,在模型卡/数据卡中显式声明"阳性=青光眼性视神经病变,阴性≠全眼健康"。
9.2 样本规模:244 患者是小样本
数据集是 244 患者 / 488 眼。对深度学习而言,这是典型的小样本:
| 视角 | 计数 | 说明 |
|---|---|---|
| 图像数 | 488 | 每患者左右眼各 1 张 |
| 患者数 | 244 | 有效独立样本量(见 §9.3) |
| 最小类(suspect) | 68 眼 | 折内可能只剩十余例 |
| 5 折交叉验证后每折训练图像 | ≈390 | 244 患者按折切分,非按图像切分 |
后果:
- 置信区间宽:87 例青光眼眼级样本下,AUC 的标准误偏大,折间标准差可观(论文以"均值±标准差"报告正因如此);
- 过拟合风险高:参数量百万级的预训练 CNN 在 488 张图上微调,必须依赖强正则、迁移学习或冻结主干;
- 对测试集划分敏感:小样本下"随机种子换一次、指标跳几个点"是常态。
应对:报告均值±标准差而非单点;使用嵌套交叉验证;避免在小样本上做大量超参搜索(易过拟合验证集);把跨数据集外部验证(如 refuge(62))作为泛化能力的真正检验。
9.3 双眼配对:有效独立样本数减半
这是 PAPILA 最容易被忽视、也最关键的结构性限制。244 名患者各提供双眼,同一患者左右眼的视神经形态、屈光状态、病程高度相关。因此:
- 统计上,独立样本数不是 488,而是约 244;
- 任何按图像随机划分 train/test 的做法都会造成患者级数据泄漏(patient-level leakage)——同一患者的左眼进训练集、右眼进测试集,模型可能"记住"该患者而非学到疾病特征,导致测试指标虚高;
- 论文自身对此做了正确示范:5 折交叉验证明确要求"同一患者的双眼必入同一折"(见 §7.2)。
应对铁律:
- 一切划分以患者为单位(grouped split / GroupKFold),绝不按图像划分;
- 若下游要做患者级结论,注意模型输出是"眼级"标签,需自行聚合到患者级(如双眼取最重者);
- 引用 PAPILA 时若做基准对比,务必说明是否遵守患者级划分——否则与论文结果不可比。
9.4 单中心、单人群:外部效度受限
数据采集自西班牙穆尔西亚的两家机构(UPCT 技术 + HGURS 临床),患者为单一地理/族群来源:
- 人群偏倚:地中海西班牙人群的屈光分布、眼轴长、青光眼亚型构成,未必迁移到东亚(闭角型青光眼比例更高)、非洲裔(视盘生理性较大、CDR 基线偏高)等人群;
- 设备单一:全部图像来自同一台 Topcon TRC-NW400 非散瞳相机(§9.5),未覆盖多厂商、多型号的成像差异;
- 机构单一:单一医院的诊断标准、转诊路径、患者构成。
应对:PAPILA 上训出的模型不能直接声称"可泛化到全球眼底筛查";任何部署前的声明必须包含外部多中心验证。第三方工作(Jian et al. 2023 综述、FusionFM)用 PAPILA 做的是受控基准评测,而非部署验证。
9.5 成像条件:单相机、30°、非散瞳
| 维度 | PAPILA 口径 | 备注 |
|---|---|---|
| 相机 | Topcon TRC-NW400(非散瞳) | 单设备 |
| 视野(FOV) | 30° 孔径(论文口径) | 第三方写 45°,见 §9.9 |
| 分辨率 | 2576 × 1934 像素 | 高分辨率 |
| 格式 | JPEG,8 bit/通道 | 有损压缩 |
| 居中 | 以视乳头(papilla)为中心 | 非以黄斑为中心 |
后果:
- 非散瞳成像是筛查友好场景,但瞳孔小、介质混浊时图像质量会下降;PAPILA 未提供逐图质量评分字段;
- 30° / 视盘居中的构图,与以黄斑为中心的 DR 筛查图(如 messidor(59))构图不同,跨数据集迁移时需注意 ROI 差异;
- JPEG 有损:做像素级分割精评时,压缩伪影可能影响 Dice 的绝对值(对相对比较影响小)。
应对:跨数据集迁移时统一 ROI 策略(PAPILA 论文以 Expert #1 视盘框裁剪后 resize 200×200,见 §7.1);若做分割,注意 JPEG 伪影。
9.6 类别不平衡:333 : 87 : 68
眼级分布为 healthy 333 / glaucoma 87 / suspect 68(论文 Table 4):
healthy ██████████████████████████████████ 333 (68.2%)
glaucoma █████████ 87 (17.8%)
suspect ███████ 68 (13.9%)
- 最大类是最小类的约 4.9 倍(333/68);
- 论文自设基线用类别加权 N/(N_c·C) 缓解(§7.1),但加权不能凭空创造样本;
- suspect 类不仅少,且性质特殊(§9.7),进一步加剧难度。
应对:使用类别加权、重采样或 focal loss;报告逐类指标(per-class AUC / 敏感度 / 特异度),而非只看宏平均;对最小类(suspect)单独做置信区间。
9.7 suspect 类的"未解决"性质
论文的关键论断是:suspect 不是 healthy 与 glaucoma 之间的"中间态",而是一个未解决的类——
- 在 PCA / t-SNE 可视化中,suspect 样本与 healthy、glaucoma 混合,未形成独立簇;
- 三分类(含 suspect)时,所有 CNN 与临床方法性能都明显偏低(Test #1 / Test #3);
- 去掉 suspect 的二分类(healthy vs glaucoma)性能显著提升(Test #2 / Test #4)。
这说明 suspect 标签本身可能包含异质性(有的实际是早期青光眼、有的是高眼压无损害、有的是诊断不确定)。不要把 suspect 当作有序标签的中间刻度(如当作 0.5 做回归),也不要期望模型能稳定分出它。
应对:
- 若目标是筛查,优先做二分类(healthy vs glaucoma)并单独处理 suspect(如归入"需复查"通道);
- 若必须三分类,明确报告 suspect 类的低性能,不做过度承诺;
- 不要把 suspect 用作有序回归/序数分类的目标。
9.8 缺失临床字段(Table 5 逐条存照)
临床表格并非全字段完备,论文 Table 5 明确列出缺失:
| 字段 | 缺失例数 | 缺失 ID | 说明 |
|---|---|---|---|
| pachymetry(角膜厚度) | 6 | 19, 20, 46, 57, 114, 116 | |
| axial length(眼轴长) | 4 | 19, 48, 64, 79 | |
| IOP(眼压) | 2 | 213, 218 | |
| 屈光不正 | 1 | 213 | 患者 213 同时缺 IOP |
| MD(mean defect) | —(结构性缺失) | healthy 全部 | MD 仅对青光眼(Group 1)与部分 suspect 采集 |
关键点:这些缺失是作者刻意保留的(见 §10.2),供"处理缺失数据"的方法研究使用——它们是方法学实验条件,不是疏忽。
应对:
- 建模前按 Table 5 逐条核对,设计缺失指示变量(missing indicator)或做完整案例子集分析;
- 不要把缺失值静默填 0 或均值后当作完整数据——那会引入偏差且掩盖问题;
- 用 MD 做视野分析时,只限 Group 1 青光眼患者,不可外推到 healthy。
9.9 存照口径:使用前需回查原始来源的五个点
以下五处存在"论文 vs 第三方"或"版本间"的口径分歧(详见 §6.4、§9.10),引用前务必回查权威源:
| 口径点 | 权威口径 | 对照口径 | 建议 |
|---|---|---|---|
| glaucoma / suspect 计数 | Table 4:glaucoma 87 / suspect 68 | 部分第三方(FusionFM、VOxSeg)写作怀疑 87 / 确诊 68(颠倒) | 以论文 Table 4 为准 |
| 视野 FOV | 论文 30° | Sci Rep 2025 写 45° | 以论文 30° 为准 |
| 资助编号 | 勘误文 20901/PI/18 | figshare/UPCT 写 2090/PI/18 | 并列存照 |
| figshare 版本 | 论文写 .v1 | 当前为 .v2 | 用 v2,注明论文写 v1 |
| license | 数据页 GPL 3.0+ | 论文文章 CC BY 4.0 | 区分"数据"与"文章"对象 |
第三方的类计数颠倒尤其危险:若直接照抄 FusionFM 的表述,会把青光眼写成 68、suspect 写成 87,与原始 Table 4 相反。回查原始表是硬纪律。
9.10 无官方 train/test split
PAPILA 不提供预划分的训练/验证/测试集——它只提供全量数据 + 一篇用 5 折交叉验证做基准的论文。
- 好处:使用自由度高,可按需设计划分;
- 风险:基准可比性受限——不同研究各自划分,指标不可直接横比;且若划分不当(见 §9.3)会虚高;
- 叠加 Fig 6 图像实验 AUC 精确值仅以图呈现、正文未给数(§7.3),进一步削弱了精确复现的锚点。
应对:
- 若做基准评测,显式声明划分方案(折数、是否患者级、随机种子);
- 优先复现论文的 5 折患者级交叉验证设置以保持可比;
- 社区若需要硬基准,应自建并公开患者级 test split(PAPILA 本身不阻止,但需自行承担可比性声明)。
9.11 GPL 3.0+ 的 copyleft 合规提示
数据许可为 GPL 3.0+(figshare 数据页权威口径,§6.4),这对下游使用有实质约束:
- GPL 是 copyleft 许可:若你分发(distribute)基于 PAPILA 派生的作品,通常需以同等兼容许可开放源代码/数据;
- "模型权重"是否属于派生作品存在法律讨论(学界尚无定论),但保守做法是:若训练数据受 GPL 约束且你分发模型,应评估合规风险,必要时咨询法律意见;
- "使用"与"分发"不同:内部研究、不对外分发,通常不触发 copyleft 义务;一旦对外发布(模型、衍生数据集、产品),则需谨慎。
- 注意区分对象:数据受 GPL 3.0+ 约束;论文文章是 CC BY 4.0(署名即可)——引用论文时按 CC BY 处理,使用数据时按 GPL 处理。
应对:
- 在模型卡/数据卡中明确标注数据来源的 GPL 3.0+ 属性;
- 商业闭源部署前务必做法务评估;
- 不要因为"论文写 CC BY 4.0"就误以为数据也是 CC BY——这是最常见的合规误读。
9.12 其它使用注意
- 伦理与隐私:数据经医院伦理委员会批准并签署知情同意(§3),但使用者仍应遵守不尝试重识别、不滥用医学数据的通行伦理;
- 临床不可直接用于诊断:任何在 PAPILA 上训练的模型都不是医疗器械,不得未经监管审批用于临床诊断;
- 标注质量有上限:视杯 Dice 观察者间仅 0.823±0.089(§5),视杯边界本身主观——做 CDR 相关任务时,注意标签噪声会传导到模型;
- 不提供逐图元数据:无采集日期、无图像质量评分、无相机参数逐图记录——做域自适应/质量分级研究时信息不足。
9.13 §9 小结
- 单病:仅青光眼三分类,阴性≠全眼健康。
- 小样本:244 患者,置信区间宽、过拟合风险高。
- 双眼配对:有效独立样本 ≈244,必须患者级划分,否则泄漏。
- 单中心单人群单相机:外部效度受限,需多中心验证。
- 类别不平衡:333:87:68,suspect 类既少又"未解决"。
- 缺失字段:Table 5 逐条存照,属刻意保留的实验条件。
- 口径分歧:计数、FOV、资助号、版本、license 五处需回查原始源。
- 无官方 split:基准可比性受限,需自行声明划分。
- GPL copyleft:分发衍生作品需评估合规,勿与文章 CC BY 混淆。
§10 方法论评注与 AI-Ready 启示
PAPILA 不只是一个数据包,它的采集与发布流程本身就是一套可复用的方法学范本。本节从六个角度评注它对"如何做 AI-Ready 医学数据集"的启示。
10.1 双专家标注 + Dice 质控:把"标注不确定性"变成一等公民
PAPILA 的分割标注由两位 HGURS 眼科专家独立完成,且两人从业年限相差 25 年(Expert #1 两年 / Expert #2 二十七年,§3)。用两位经验差异极大的专家而非两位同质专家,是刻意的设计——它把"标注的主观性"放大到可测量的程度:
- 观察者间 Dice:视盘 0.935±0.036(高一致)、视杯 0.823±0.089(较低,视杯边界主观);
- 观察者内 Dice(间隔 2 年重标):略优于观察者间——说明时间稳定性好,专家间差异才是主要噪声源;
- CDR 差异:观察者间 −0.002±0.045(p=0.231,无统计学显著差异)——说明尽管视杯边界主观,聚合到 CDR 这一临床指标后,两专家结论一致。
启示:数据集发布应报告标注一致性指标,而非只给"金标准"。PAPILA 让使用者知道"视杯标签有 ±0.089 的 Dice 噪声",从而合理评估 CDR 任务的性能天花板。这比"黑箱金标准"更有方法论价值。
10.2 缺失数据"刻意保留":把不完美当作实验条件
论文 Table 5 列出缺失字段(§9.8),并明确说明保留这些不完整记录,目的是"供处理缺失数据的方法使用"。
这是一个反直觉但正确的决定:多数数据集会清洗掉缺失记录或填补,PAPILA 选择原样保留,使数据集可以充当"缺失数据方法"的真实世界测试床。
启示:AI-Ready 不等于"无缺失"。真实临床数据必有缺失,保留并按条目记录缺失,比制造"假完美"更能支持下游的鲁棒性研究。关键纪律是:缺失必须可发现(有 Table 5 这样的清单),否则就是数据缺陷而非实验条件。
10.3 "先存数据、后发论文"的流程范式
时间线(§2 / §6.3):
v1 数据发布 2022-04-29
v2 数据发布 2022-05-06
论文在线 2022-06-09
勘误 2024-04
数据比论文早约 6 周发布。这一顺序有三重价值:
- 可复现性前置:论文发表时,数据已经公开可下载,审稿人与读者可立即验证;
- DOI 可引用性:figshare 提供独立 DOI(10.6084/m9.figshare.14798004),数据有终身可追溯标识;
- 版本化:v1→v2 的迭代被记录,使用者可追溯"我用的是哪一版"。
启示:AI-Ready 数据集的发布顺序应是 “先发数据(带 DOI + 版本)→ 再发描述论文”,而非"论文附录里给个网盘链接"。同时应遵循 figshare 页的引用要求:引用论文,而非数据仓(§6.6)。
10.4 双眼配对设计倒逼患者级划分
PAPILA 的双眼配对(244 患者 × 2 眼)不是缺陷,而是一个强制纪律:它使"按图像随机划分"的错误立刻暴露——因为同一患者的双眼高度相关,泄漏会立竿见影地虚高指标。论文因此显式规定双眼同折(§7.2)。
启示:数据集的结构特性(配对、纵向、多病灶)应在设计时就明确划分约束。PAPILA 把"防止患者级泄漏"从"使用者自律"提升为"数据集文档明确要求",这是可复制的做法。对所有含重复测量的医学数据集,都应在文档中显式写明划分单位。
10.5 图像 + 临床双信号:互补而非替代
PAPILA 同时提供图像(眼底 CFP)与结构化临床指标(IOP、pachymetry、axial length、MD 等,§4),并分别做了图像实验(§7.3)与临床实验(§7.6):
- 图像二分类(去 suspect)性能较好;
- 临床方法无论三分类(AUC 0.66–0.68)还是二分类(AUC 0.64–0.75,均值 0.71)都明显偏弱且方法间趋同。
这说明:单靠结构化临床指标的判别力有限,视神经形态(图像)才是青光眼评估的核心信号;但临床指标的互补价值在于——它们提供图像之外的风险因素(眼压、角膜厚度、眼轴),可用于多模态融合。
启示:AI-Ready 数据集应尽量并列模态(图像 + 表格 + 视野),给下游留出融合空间。PAPILA 的"图像为主、临床为辅"结构,为多模态青光眼模型提供了现成素材。
10.6 GPL copyleft 对下游的启示
数据用 GPL 3.0+(§9.11)而非 CC BY,是一个有意的许可选择——它倾向于保障下游衍生作品继续开放。
启示:
- 数据集作者在选许可时,**copyleft(GPL)vs 宽松(CC BY / MIT)**是战略选择:copyleft 保障开放生态,宽松许可促进商业采用;
- 使用者必须区分"数据许可"与"文章许可"——PAPILA 恰是一个"数据 GPL / 文章 CC BY"的典型教学案例;
- AI-Ready 的"可获取性"不止是"能下载",还包括许可条款是否清晰、下游义务是否明确。PAPILA 在这点上清晰(GPL 3.0+ 数据页权威),但因"论文写 CC BY"造成常见误读,提示许可证必须在数据页显著位置单一口径声明。
10.7 对照 AI-Ready 五要素
把 PAPILA 对照 AI-Ready 数据集的五个核心要素:
| 要素 | PAPILA 表现 | 评级 |
|---|---|---|
| 可发现性(Findable) | 独立 DOI、Sci Data 论文、被多篇综述收录 | 强 |
| 可获取性(Accessible) | figshare 匿名直下、无注册墙 | 强 |
| 可互操作性(Interoperable) | 图像 JPEG + 分割坐标文本 + 临床 CSV,格式通用;但缺标准化元数据 schema | 中 |
| 元数据质量(Metadata) | 论文详述字段与缺失(Table 5);但无机器可读的 data card / schema.org 描述 | 中 |
| 可持续性(Sustainable) | figshare + DOI 长期存档;版本化(v1/v2);但依赖单一平台 | 中偏强 |
总评:PAPILA 是**"可发现 + 可获取"很强、但"元数据机器可读性"偏弱的典型。它把人类可读文档**(论文)做得极好,但机器可读元数据(schema、字段字典的标准化发布)尚有提升空间——这正是"AI-Ready"下一阶段要补的课。
10.8 §10 小结
- 双专家 + Dice 质控:标注不确定性可测量,比黑箱金标准更有价值。
- 缺失刻意保留:不完美可成为方法学实验条件,前提是缺失可发现。
- 先数据后论文:DOI + 版本化前置,保障可复现。
- 配对结构倒逼患者级划分:把防泄漏写进数据集文档。
- 图像 + 临床双信号:主信号在图像,临床指标供融合。
- GPL copyleft 战略:数据与文章许可须区分对待。
- AI-Ready 五要素:可发现/可获取强,元数据机器可读性待补。
§11 全篇总结
PAPILA 是目前少有的"同一患者双眼配对 + 双专家视盘/视杯分割 + 结构化临床指标"三合一的青光眼眼底数据集。它用 244 患者 / 488 眼,回答了青光眼 AI 的一个核心问题:能否仅凭眼底彩色照相(辅以临床数据)判读青光眼——答案是可以到达可用水平(二分类),但suspect 类仍是未解决的开放问题。
它的核心优势:
- 配对设计天然支持患者级统计;
- 双专家分割 + Dice 质控(视杯 0.823 / 视盘 0.935)提供带不确定性的标注;
- 图像 + 临床双模态支撑多模态融合研究;
- 可发现、可获取(DOI + 匿名直下)达到 AI-Ready 高标准;
- 诚实暴露局限(小样本、不平衡、缺失、单中心),方法论透明。
它的核心限制:
- 小样本单中心单人群单相机,外部效度有限;
- 类别不平衡且 suspect 未解决,三分类难;
- 临床字段部分缺失(Table 5),需专门处理;
- GPL 3.0+ copyleft,下游分发需合规评估;
- 无官方 split、Fig 6 数值缺失,基准可比性受限。
给使用者的三句话:
- 做青光眼二分类筛查——PAPILA 是很合适的起点,记得患者级划分;
- 做多病筛查——PAPILA 只能当青光眼子任务,需与 DR/多病域联合;
- 做基准对比——务必回查论文 Table 4 计数与许可口径,第三方转述有颠倒。
在千方病案医数集体系内,PAPILA 与 refuge(62) 构成青光眼分割/分类的双核对照(配对临床 vs 挑战赛),与 justraigs(746)、rim-one(291)、drishti-gs(301) 及同批的 g1020、origa-light 共同组成青光眼眼底 AI-Ready 家族。
FAQ 常见问题
A. PAPILA 和 REFUGE 有什么区别?该怎么选?
REFUGE(库内 refuge(62)):青光眼分割挑战赛数据集,1,200 张眼底图(含独立 train/val/test),任务是视盘/视杯分割 + CDR 分类,有隐藏测试集,但无配对双眼、无结构化临床表格,人群以中国为主。
PAPILA:244 患者 / 488 眼配对双眼,任务为青光眼三分类 + 分割,带结构化临床指标(IOP/pachymetry/axial length 等),但无官方 split,西班牙单中心。
选择建议:
- 要标准分割基准/挑战赛对比 → 用 REFUGE;
- 要配对双眼 + 临床多模态 + 患者级分析 → 用 PAPILA;
- 要泛化性评测 → 两者互为外部验证集(PAPILA 训练、REFUGE 测试,反之亦然),这正是二者首要互链(§8.6)的原因。
B. 能直接用 PAPILA 做三分类(healthy/glaucoma/suspect)吗?
技术上可以,但不建议期望高精度。 论文自身的图像三分类(Test #1)与临床三分类(Test #3,AUC 0.66–0.68)性能都偏低。原因是 suspect 类是"未解决类"而非中间态(§9.7)——它在特征空间与两类混合,缺乏可分性。
推荐做法:
- 主任务做 healthy vs glaucoma 二分类(去 suspect),性能显著提升;
- suspect 单独作为"需复查"通道处理,而非强行三分类;
- 若必须三分类,务必逐类报告性能并说明 suspect 类的低指标,不做过度承诺。
C. 数据集是 GPL 3.0+,论文是 CC BY 4.0,我该怎么用?
分开对待两个对象(§6.4 / §9.11):
- 使用数据(训练模型、做衍生数据集)→ 遵循 figshare 数据页的 GPL 3.0+(权威口径)。GPL 是 copyleft:对外分发衍生作品时,通常需以兼容许可开放。
- 引用论文(文字、图表、结论)→ 遵循 CC BY 4.0,署名即可,无需 copyleft。
常见误读:看到"论文 CC BY 4.0"就以为数据也宽松——不对。数据集许可以 figshare 原始数据页为准。商业闭源部署前,务必做 GPL 合规评估(模型权重是否属派生作品,学界仍有讨论,保守为宜)。
D. 怎么做患者级划分,避免数据泄漏?
核心原则:以患者为单位划分,同一患者双眼必须同折。
具体做法:
- 用患者 ID 分组,做 GroupKFold(n=5) 或留出法 GroupShuffleSplit;
- 绝不用
train_test_split按图像随机划分——那会把同一患者的左右眼拆到不同集合,造成患者级泄漏(§9.3); - 论文的示范是 5 折、双眼同折(§7.2),复现基准时请沿用;
- 报告结果时显式声明划分单位,否则与论文结果不可比。
为什么重要:同一患者双眼高度相关,按图像划分会让模型"记住患者"而非学到疾病特征,测试指标虚高。
E. 临床字段有缺失(Table 5),建模时怎么处理?
先按 Table 5 逐条核对再决定(§9.8):
| 字段 | 缺失 | 处理建议 |
|---|---|---|
| pachymetry | 6 例 | 缺失指示变量 or 完整案例子集 |
| axial length | 4 例 | 同上 |
| IOP | 2 例 | 同上 |
| 屈光不正 | 1 例(ID 213) | 同上 |
| MD | healthy 全缺 | 仅用 Group 1 青光眼做视野分析,不外推 |
纪律:
- 不要静默填 0/均值——会引入偏差、掩盖问题;
- 缺失是作者刻意保留的实验条件(§10.2),可用来研究缺失数据方法;
- 若做子集分析,显式声明剔除了哪些 ID。
F. figshare 有 v1 和 v2,我该用哪个?论文为什么写 v1?
用 v2。 时间线(§6.3):v1 发布于 2022-04-29,v2 于 2022-05-06,v2 是当前最新版本(文件 35013982,包体 563.49 MB)。
为什么论文写 v1:论文正文 Data Records 节撰写时引用的是 .v1 的 DOI,而 figshare 页面后来更新为 v2——这是一个版本口径小分叉(§9.9),存照即可。
选择建议:
- 新项目用 v2(当前可用版本,第三方加载器如 torch_em 也指向 v2);
- 若要精确复现论文的某一步,确认论文引用的具体版本;
- 引用时写明你用的是哪个版本,保障可复现性;
- 注意 figshare 的引用要求:引用论文而非数据仓(§6.6)。
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | PAPILA |
| url_name | papila |
| 全称 | PAPILA: Dataset with fundus images and clinical data of both eyes of the same patient for glaucoma assessment |
| 类型 | 数据集 + 数据描述论文(Sci Data) |
| 论文 | Scientific Data 2022 Jun 9;9(1):291(DOI 10.1038/s41597-022-01388-1;PMID 35680965;PMCID PMC9184612) |
| 勘误 | Sci Data 2024 Apr 17;11(1):391(DOI 10.1038/s41597-024-03175-6) |
| 团队 | UPCT(卡塔赫纳理工大学)+ HGURS(穆尔西亚 Reina Sofía 大学总医院),6 作者 |
| 规模 | 244 患者 / 488 眼 / 488 图;1,952 个分割文件 |
| 类别(眼级) | healthy 333 / glaucoma 87 / suspect 68 |
| 图像 | 2576×1934 JPEG,30° 孔径,视盘居中,Topcon TRC-NW400 非散瞳 |
| 分割质控(Dice) | 视杯 0.823±0.089;视盘 0.935±0.036(观察者间) |
| 许可 | 数据 GPL 3.0+(figshare 权威)/ 文章 CC BY 4.0 |
| 数据入口 | figshare DOI 10.6084/m9.figshare.14798004(当前 v2) |
| 抓取时点 | 2026-09-30 |
| 库内互链 | refuge(62) / justraigs(746) / rim-one(291) / drishti-gs(301) / messidor(59) / ddr(201) / idrid(191) / deepdrid(211) / eyepacs(58) / odir(63) / rfmid(271) / octa-500(341)(+ 同批 g1020 / origa-light) |
附录 B:DAIMS 评估全表
DAIMS(Data Asset Interoperability Maturity Score)从五个维度对数据集作为 AI 资产的成熟度打分(1-10),综合加权给出评级。
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 独立 DOI(10.6084/m9.figshare.14798004)+ 开放获取论文(Sci Data)+ 被多篇 2023–2025 综述收录(Jian et al. npj Digit Med 2023、FusionFM);名称"PAPILA"唯一不易混淆。扣分:无独立数据集官网,发现依赖 figshare/论文双入口 |
| A 可获取性 | 9 | figshare 匿名直接下载,无注册墙、无请求制——AI-Ready 友好度最高档;包体 563.49 MB 单文件(PAPILA.zip)可直取。扣分:单一平台托管;GPL 3.0+ 对下游分发有约束(合规成本非"获取"本身) |
| I 可互操作 | 6 | 图像 JPEG + 分割坐标为纯文本 X/Y 节点 + 临床 CSV,格式通用、无专有封装;但无标准化元数据 schema(无 schema.org / 无数据字典文件),分割坐标非 DICOM/COCO 等标准格式,需自行解析 |
| M 元数据质量 | 7 | 论文详述字段、缺失(Table 5)、标注协议、质控指标(Table 6)——人类可读文档质量高;扣分:缺机器可读 data card,临床字段无独立字段字典,缺失原因未逐条说明 |
| S 可持续性 | 7 | figshare + DOI 长期存档、版本化(v1/v2)、勘误机制正常(2024 更正资助文字);扣分:依赖单一平台(figshare)、依赖机构(UPCT)持续维护,无镜像仓 |
| 综合评级 | 7.4/10(中上) | 可获取性(9)与可发现性(8)突出,是典型"下载即用"型 AI-Ready 数据集;可互操作与元数据机器可读性(6/7)是主要提升空间 |
评级说明:PAPILA 的"可发现 + 可获取"达到优秀水准,与其"匿名直下 + DOI + 开放论文"的设计直接相关;短板集中在机器可读元数据与标准格式——这是从"人类可读"迈向"AI-Ready"的下一阶段课题。
附录 C:逐项证据链自证
本条目核心数字均经三源互证,逐项列出:
| 事实 | 论文(JATS/PMC9184612) | figshare(14798004) | 第三方 | 结论 |
|---|---|---|---|---|
| 244 患者 / 488 眼 | ✓(摘要/Data Records) | ✓(描述) | ✓(Jian 2023、FusionFM) | 一致 |
| healthy 333 | ✓(Table 4) | — | 间接 | 以论文为准 |
| glaucoma 87 | ✓(Table 4) | — | ✗(部分写 68,颠倒) | 以论文 Table 4 为准 |
| suspect 68 | ✓(Table 4) | — | ✗(部分写 87,颠倒) | 以论文 Table 4 为准 |
| 2576×1934 | ✓ | — | ✓(Sci Rep 2025) | 一致 |
| 30° FOV | ✓(“aperture of 30°”) | — | ✗(Sci Rep 2025 写 45°) | 以论文 30° 为准 |
| 视杯 Dice 0.823±0.089 | ✓(Table 6) | — | — | 以论文为准 |
| 视盘 Dice 0.935±0.036 | ✓(Table 6) | — | — | 以论文为准 |
| GPL 3.0+(数据) | — | ✓(字段) | — | figshare 为数据许可权威 |
| CC BY 4.0(文章) | ✓(期刊声明) | — | — | 文章本体 |
| v2 当前版本 | 写 v1 | ✓(v2) | ✓(torch_em 用 v2) | v2 当前可用 |
附录 D:数据获取决策树
你拿到 PAPILA 想做什么?
├── 青光眼二分类筛查模型
│ ├── 直接下载 figshare PAPILA.zip(v2),匿名直下
│ ├── 患者级 GroupKFold 划分(双眼同折,硬纪律)
│ └── 报告逐类指标 + 均值±标准差
├── 视盘/视杯分割 / CDR 计算
│ ├── 用 ExpertsSegmentations(1,952 个坐标文件)
│ ├── 注意视杯标签噪声(Dice 0.823),CDR 天花板有限
│ └── 若做基准,与 refuge(62) 对照
├── 多模态融合(图像 + 临床)
│ ├── 合并 ClinicalData 字段(注意 Table 5 缺失,逐条核对)
│ ├── 缺失指示变量 or 完整案例子集
│ └── MD 仅限 Group 1 青光眼
├── 缺失数据方法研究
│ └── 正是 PAPILA 的设计用途(刻意保留缺失)
└── 想商用/闭源部署
└── 先做 GPL 3.0+ 合规评估(copyleft 义务)→ 谨慎
附录 E:临床字段速查与缺失登记
| 字段 | 含义 | 取值 | 缺失(Table 5) |
|---|---|---|---|
| 患者 ID | 唯一标识 | — | 无 |
| 年龄 | 患者年龄 | 岁 | 无 |
| 性别 | 性别 | 0=男 / 1=女 | 无 |
| 诊断 | 青光眼标签 | 0=healthy / 1=glaucoma / 2=suspect | 无 |
| 屈光不正 | 球镜/柱镜 | 度 | 1 例(ID 213) |
| phakic/pseudophakic | 晶状体状态 | 1=已摘除 / 0=保留 | 无 |
| IOP | 眼压 | mmHg | 2 例(213, 218) |
| pachymetry | 角膜厚度 | μm | 6 例(19,20,46,57,114,116) |
| axial length | 眼轴长 | mm | 4 例(19,48,64,79) |
| MD | 平均缺损 | dB | healthy 全缺(仅青光眼/部分 suspect) |
使用纪律:右眼/左眼为两个分列表格,合并时注意按患者 ID + 眼别对齐;缺失按上表逐条核对,勿静默填补。
附录 F:患者级划分代码骨架(防泄漏)
import pandas as pd
from sklearn.model_selection import GroupKFold
# 读入眼级元数据,至少含 patient_id 与 eye(OD/OS)
df = pd.read_csv("clinical_eyes.csv")
# 硬纪律:以 patient_id 分组,同一患者双眼必入同一折
gkf = GroupKFold(n_splits=5)
for fold, (tr_idx, te_idx) in enumerate(gkf.split(df, groups=df["patient_id"])):
train = df.iloc[tr_idx]
test = df.iloc[te_idx]
# 断言:训练/测试患者的交集必须为空
assert set(train["patient_id"]).isdisjoint(set(test["patient_id"])), "患者级泄漏!"
print(f"Fold {fold}: train patients={train['patient_id'].nunique()}, "
f"test patients={test['patient_id'].nunique()}")
# 反例(禁止):sklearn.model_selection.train_test_split(df, test_size=0.2)
# —— 按图像随机划分,同一患者左右眼会被拆开,造成患者级泄漏
附录 G:许可证与引用注意事项
许可证(三口径并存,须区分对象):
| 对象 | 许可 | 权威口径 | 下游义务 |
|---|---|---|---|
| 数据(PAPILA.zip) | GPL 3.0+ | figshare 数据页 / UPCT 门户 | copyleft:分发衍生作品需兼容许可 |
| 论文文章 | CC BY 4.0 | Sci Data 期刊声明 | 署名即可 |
| 部分第三方目录 | CC BY 4.0(对其转述) | 非权威 | 勿采信 |
引用要求:figshare 页明确 “Please cite the article and not the figshare repository”——即引用时优先引论文(Kovalyk et al., Sci Data 2022),而非数据仓。
BibTeX(论文):
@article{kovalyk2022papila,
title = {PAPILA: Dataset with fundus images and clinical data of both eyes
of the same patient for glaucoma assessment},
author = {Kovalyk, Oleksandr and Morales-S{\'a}nchez, Juan and
Verd{\'u}-Monedero, Rafael and Sell{\'e}s-Navarro, Inmaculada and
Palaz{\'o}n-Cabanes, Ana and Sancho-G{\'o}mez, Jos{\'e}-Luis},
journal = {Scientific Data},
volume = {9},
number = {1},
pages = {291},
year = {2022},
doi = {10.1038/s41597-022-01388-1}
}
附录 H:坑点档案(坑 N 编号制)
以下是本条目在核实过程中遇到的真实陷阱,每条给出"一句话档案"与"触发场景",供转引者避坑。
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | 数据集许可 GPL 3.0+(figshare 权威)vs 论文 CC BY 4.0(文章本体)vs 第三方目录 CC BY 4.0(对数据的转述,非权威)——三口径并存,混用会导致合规误判 | 商用/再分发/许可声明 |
| 坑 2 | glaucoma / suspect 眼级计数易被第三方颠倒:论文 Table 4 为 glaucoma 87 / suspect 68,但 FusionFM、VOxSeg 部分段落写作 suspect 87 / glaucoma 68 | 数字抽取/文献转引 |
| 坑 3 | figshare 版本口径分叉:论文 Data Records 写 .v1,当前最新为 .v2(第三方加载器用 v2) | 复现/下载版本选择 |
| 坑 4 | 视野 FOV 度数冲突:论文写 30° 孔径,Sci Rep 2025 VOxSeg 写 45° 开角(可能混淆相机物理 FOV 与图像裁剪) | 预训练/构图对齐 |
| 坑 5 | 资助编号两套写法:勘误文 20901/PI/18 vs figshare/UPCT 2090/PI/18 | 引注/基金编号著录 |
| 坑 6 | 类别合并口径:论文 Table 1 对比表把 glaucoma+suspect 合并计 155(“Glaucoma (or suspect)”),而 Table 4 分列 87/68——须并列理解,勿只取其一 | 规模陈述/指标解读 |
| 坑 7 | 无官方 train/test split + Fig 6 图像分类 AUC 精确值仅以图呈现、正文未给数——基准可比性受限,不同研究各自划分不可直接横比 | 基准评测/结果对比 |
| 坑 8 | 双眼配对导致有效独立样本数 ≈244 而非 488——若按图像随机划分会造成患者级泄漏,测试指标虚高 | 数据划分/性能报告 |
| 坑 9 | 临床字段缺失(Table 5):pachymetry 6 例、axial length 4 例、IOP 2 例、屈光不正 1 例(ID 213);MD 仅青光眼采集。缺失为刻意保留,非数据缺陷 | 建模/缺失处理 |
| 坑 10 | 单中心单人群单相机(西班牙穆尔西亚 / Topcon TRC-NW400 / 非散瞳)——外部效度受限,不可径称"可泛化" | 泛化性声明/部署 |
编号说明:坑 1–坑 10 均为本条目核实过程中实际记录的陷阱,其中坑 1、坑 2、坑 4、坑 6 曾在第三方转述中造成事实偏差,转引时务必回查论文原始表。
尾注与核验声明
- 核验时点:2026-09-30。
- 核验三源:① Scientific Data 论文(EuropePMC JATS 全文 PMC9184612 + PMC 表格页)② figshare 数据仓(DOI 10.6084/m9.figshare.14798004 v1/v2)③ 第三方综述与复现工作(Jian et al. npj Digit Med 2023;6:67;Sci Rep 2025 VOxSeg;FusionFM arXiv:2508.11721;torch_em 加载器)。
- 核心数字(244/488/333/87/68)经三源互证;口径分歧点(license、版本、计数、FOV、资助号)已在 §6.4、§9.9 与附录 C、附录 H 逐条存照。
- 本条目不作临床建议:PAPILA 及其衍生的任何模型均非医疗器械,不得未经监管审批用于临床诊断。
- 维护触发点:① figshare 若发布 v3 或更新许可声明 → 修订 §6 与附录 B/G;② 若官方提供 train/test split → 修订 §9.10 与附录 F;③ 若 figshare 页面指标(views/downloads)显著变动 → 更新 §2 引用热度;④ 若 g1020 / origa-light 发布 → 回填 §8 同批家族 rid 并建立青光眼家族导航。
- 条目责任:本条目为千方病案医数集(qianfanghub.com)AI-Ready Wikipedia 条目,代理
agent-c-papila,slugpapila。所有事实以论文原始表格与 figshare 数据页为权威口径,第三方仅作生态佐证。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- g1020 — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
- origa-light — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
- refuge2 — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
- riga — 共享标签:眼科影像 / 医学图像分割 / 图像分类 / 青光眼
- refuge — 共享标签:眼科影像 / 医学图像分割 / 青光眼
- oimhs — 共享标签:眼科影像 / 医学图像分割 / 图像分类
- palm — 共享标签:眼科影像 / 医学图像分割 / 图像分类
- octid — 共享标签:眼科影像 / 医学图像分割 / 图像分类
- fives — 共享标签:眼科影像 / 医学图像分割 / 青光眼
- drions-db — 共享标签:眼科影像 / 医学图像分割 / 青光眼
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

