CaDIS — 白内障手术语义分割基准数据集 AI-Ready Wikipedia | 千方病案医数集

4,670 帧像素级标注白内障显微手术图像,36 类手术场景分割

来源 Digital Surgery Ltd(现 Medtronic Digital Surgery) url: https://cataracts.grand-challenge.org/CaDIS/发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称CaDIS — 白内障手术语义分割基准数据集 AI-Ready Wikipedia | 千方病案医数集
数据类型4,670 帧手术图像,36 类像素级标注,960×540 RGB 图像,3,550/534/586 官方划分,开放获取
规模50 名白内障手术患者(母数据集 CATARACTS,2015 年)
接入方式Digital Surgery Ltd(现 Medtronic Digital Surgery) url: https://cataracts.grand-challenge.org/CaDIS/
AI 就绪度

数据集封面

CaDIS — 白内障手术语义分割基准数据集 AI-Ready Wikipedia


INFOBOX

数据集名称 CaDIS
英文全称 Cataract Dataset for Image Segmentation
别名/简称 CADIS、CaDIS dataset、CaDIS 语义分割数据集
疾病分类(ICD-11) 9B10(白内障 Cataract)
SNOMED CT 193570009(白内障 Cataract)
数据模态 手术显微镜视频帧(RGB 图像 + 像素级分割掩码)
AI 任务类型 语义分割(手术器械 / 眼部解剖结构 / 场景物体)
样本总数 4,670 帧(train 3,550 / val 534 / test 586)
数据格式 RGB 图像帧 + 同尺寸像素级掩码(逐帧逐像素标注)
许可证 官方未单独声明;配套论文以 CC BY-NC-ND 4.0 开放获取
访问级别 开放获取(官方页面下载;底层 CATARACTS 视频需 IEEE DataPort 注册)
DUO 标签 官方未发布 DUO 标签;发布意图为学术研究
语言 英语(文档与标注)
首发日期 2019-06-27(arXiv v1)
最后更新 2022-02-22(arXiv v7)
发布机构 Digital Surgery Ltd(2020 年起为 Medtronic 旗下)
官方主页 grand-challenge.org/CaDIS
下载地址 cataracts-semantic-segmentation2020
DOI 10.1016/j.media.2021.102053
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方划分与基线齐全,预处理与类别映射需手动实现
页面状态 published

§0 E-E-A-T 审核声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、白内障手术流程与临床任务定义、患者人群与金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(36 类标签体系、三任务映射)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Digital Surgery Ltd、Medtronic、Inserm 及 grand-challenge 平台无任何商业利益关联。本页面不销售 CaDIS 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CaDIS 官方发布页未单独声明数据集许可条款,使用前请确认官方渠道的最新要求;底层 CATARACTS 视频需通过 IEEE DataPort 注册获取,并遵循 CATARACTS 挑战赛的使用条款。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? CaDIS(Cataract Dataset for Image Segmentation)是一个白内障手术图像的语义分割数据集:从公开的 CATARACTS 挑战赛 25 段手术显微镜视频中,按手术阶段均匀采样出 4,670 帧,每一帧的每一个像素都被人工标注为 36 个类别之一——包括 29 种手术器械(如超乳手柄、注入/抽吸手柄、撕囊镊)、4 种眼部解剖结构(瞳孔、虹膜、角膜、皮肤)和 3 种其他场景物体(手术胶带、手、开睑器)。

为什么重要? 手术视频是外科医生最主要的感官反馈,但像素级标注的手术数据极为稀缺——此前的公开手术数据集(Cholec80、RMIT 等)大多只提供帧级器械存在或手术阶段标签。CaDIS 论文团队在发布时称其为"迄今外科数据中标注质量最高的数据集",它让器械分割、解剖结构定位、手术场景理解这类需要像素级监督的研究第一次有了白内障领域的公开基准。

我能用它做什么? 训练和评测手术器械/解剖结构分割模型(官方提供 8 类、17 类、25 类三档任务与 UNet、DeepLabV3+、UPerNet、HRNetV2 基线);研究极端类别不平衡下的分割策略;构建手术阶段识别、器械使用统计等下游应用的原型。注意它不能替代临床验证,也不应直接用于任何临床决策。

§1.1 摘要

CaDIS 由 Digital Surgery Ltd(伦敦,2020 年 2 月起为 Medtronic 旗下 Medtronic Digital Surgery)构建于法国布雷斯特大学医院采集的 CATARACTS 挑战赛数据之上:从 25 段训练集显微手术视频(1920×1080、约 30 fps、合计超过 9 小时)中,按 14 个手术阶段分层采样、每阶段最多 20 帧、帧间隔至少 3 秒,得到 4,670 帧并降采样至 960×540 供标注。由可随时咨询临床专业人员的内部标注团队逐像素标注,类别体系沿用 CATARACTS 挑战赛的器械分类并扩展解剖与其他物体类,共 36 类。划分严格按视频进行:训练集 3,550 帧(19 段视频,保证涵盖全部类别),验证集 534 帧(视频 5、7、16),测试集 586 帧(视频 2、12、22)。论文进一步定义了 8 类(解剖为主)、17 类(器械按相似性归并)、25 类(细粒度器械及手柄)三个基准任务,并以统一设置(270×480 输入、交叉熵损失)评测了 UNet、DeepLabV3+、UPerNet、HRNetV2,测试集 mIoU 依次为 84.91、76.11、66.76(各任务最佳模型,MedIA 2021)。后续 Pissas 等(MICCAI 2021)以 Lovász-Softmax 损失加重复因子采样,将三任务测试 mIoU 提升至 86.40、79.40、71.94,并证明损失函数与采样策略的影响大于骨干网络选择。使用本数据集的第一纪律是口径对齐:任务档位、黑名单启用与否、输入分辨率三项中任何一项不同,数字即不可比(详见 §8.3)。

§1.2 战略价值

维度一:像素级手术场景理解的稀缺基准。 在手术数据集中,像素级标注的成本远高于帧级标签,公开可得的细粒度分割数据长期集中在腹腔镜领域(如 CholecSeg8k、EndoVis 器械分割子任务)。CaDIS 是白内障显微手术方向少有的全帧逐像素标注数据集,且解剖结构(瞳孔、虹膜、角膜)与器械同图标注,使"器械-组织交互"这一计算机辅助介入(CAI)的核心问题可以在同一坐标系下研究。对于从事手术导航、术中风险提示、手术技能评估的团队,它是构建原型到发表论文之间的关键桥梁。这一优势在 2019 年发布时几乎没有同类,即便到 2026 年,白内障方向公开的像素级基准仍然屈指可数。

维度二:极端长尾与多粒度任务的方法试验场。 36 类中稀有器械的帧级出现率与高频器械相差三个数量级(母数据集帧级占比 0.017% 的 biomarker 对 17.6% 的 micromanipulator,arXiv 1710.01559),官方又提供 8/17/25 三档类别粒度,天然构成"粗到细"的消融实验框架。MICCAI 2021 的 SOTA 工作正是以此平台证明:在此类数据上,损失函数与重采样策略的设计收益显著大于更换骨干网络。对方法论研究者,这是一个可控变量清晰、社区可复现的试验场;对工程团队,它提供的三档任务定义可直接映射为产品分阶段的标注与模型策略。

维度三:弱监督方法向像素级任务迁移的验证桥梁。 母数据集 CATARACTS 提供帧级器械使用与手术阶段标注,CaDIS 提供像素掩码,两者天然构成"弱标签 + 强标签"配对,使多任务学习、伪标签、自训练等标注高效方法可以直接验证。预印本工作 SURGIVID 即在此设置下报告:以无监督掩码发现加自训练,仅用约 1% 的像素标注即可在解剖结构上逼近全监督性能(arXiv 2409.07801,结论尚待同行评审)。对标注预算有限的工程团队,这一维度意味着 CaDIS 不仅可以训练模型,还可以回答"再买多少标注最划算"的问题。

§1.3 同类数据集横向对比

数据集 模态 规模 标注类型 与 CaDIS 的差异化
CaDIS 白内障显微手术视频帧 4,670 帧 / 36 类 像素级语义分割 解剖+器械同图逐像素标注;三档任务定义
CATARACTS 白内障显微手术视频 50 段视频(9+ 小时) 帧级 21 类器械使用 CaDIS 的母数据集;视频级工具标注与阶段标注
CholecSeg8k 腹腔镜视频帧 8,080 帧 / 13 类 像素级语义分割 腹腔镜方向的对应物;类数更少、术式不同
Cholec80 腹腔镜手术视频 80 段视频 帧级器械存在 + 7 阶段 弱标签(帧级),适合阶段识别而非像素分割
101-Cataract 白内障手术视频 101 段(14 小时 2 分) 手术阶段标注 720×540 分辨率、4 位术者、阶段标签为主(IOVS 综述
EndoVis 器械分割子挑战 腹腔镜视频帧 每届数千帧 / 多类 像素级(二值/多类不一) MICCAI 系列挑战赛数据;规模小、按届发布

对比解读:横向看,CaDIS 的规模(4,670 帧)小于腹腔镜像素级数据(CholecSeg8k 8,080 帧),但类别粒度(36 类对 13 类)与解剖覆盖是其不可替代的优势;纵向看,它与 CATARACTS 是"同一批手术的两种标注粒度",这是表中其他数据集都不具备的联动关系——需要弱监督对照实验时,这对组合几乎是白内障领域唯一的选择。

§1.4 版本时间轴

时间 版本 / 事件 说明
2019-06-27 arXiv v1 首发 arXiv 1906.11586,初版基准与数据说明
2020-04 arXiv v5 数据通过 grand-challenge 公开;官方基准更新
2021 Medical Image Analysis 正式发表 DOI 10.1016/j.media.2021.102053,MedIA 第 71 卷,文章号 102053
2021-09 MICCAI 2021 SOTA 刷新 Pissas 等三任务 mIoU 提升至 86.40/79.40/71.94,公开黑名单与重标注
2022-02-22 arXiv v7(当前版本) 与正式发表版对齐

时间轴读法:2019 年的 arXiv 预印本让社区先拿到数据与基准,2021 年的 MedIA 正式版固化了划分与任务定义,同年 MICCAI 的 SOTA 工作补上了"方法学怎么调"的答案并暴露了标注噪声问题——引用与复现时应把这三份文献视为一组,而不是只引最后一篇。

§1.5 典型应用场景

  1. 手术器械与解剖结构分割基线研究:用官方三档任务与划分直接对齐社区报告口径,评测新分割架构或训练策略。
  2. 极端类别不平衡方法验证:稀有器械的长尾分布使其成为重采样、损失设计、少样本类分割算法的天然测试床。
  3. 手术场景理解与阶段感知原型:像素级器械/解剖信号可聚合为器械使用曲线,支撑手术阶段识别与工作流分析的原型系统。
  4. 手术教学与安全研究:器械-解剖交互的自动量化可用于术后复盘与教学素材生成(须另行临床验证,不可直接临床使用)。
  5. 半监督/自监督预训练评估:配合母数据集 CATARACTS 的 25 段无像素标注视频,评估自监督表征向像素级任务迁移的效果(Pissas 等已示范 MoCov2 初始化的收益)。

每个场景的实施要点:(1) 基线研究——先固定 §8.3 协议再谈新方法,否则没有可比性;(2) 不平衡方法——在 Task 2/3 上做,Task 1 长尾不明显;(3) 阶段感知——把分割输出按时序聚合前先确认帧的采样不是连续的(间隔 ≥3 秒);(4) 教学应用——输出掩码叠加视频即可,但对外展示需注意患者隐私再脱敏;(5) 自监督——预训练用母视频帧,微调只用 CaDIS 训练集,切勿让 val/test 视频混入预训练。

§2 医学背景

§2.1 ICD-11 与 SNOMED CT 映射

CaDIS 本身不携带疾病标签,其临床主题为白内障及其手术治疗。与数据集内容相关的标准术语映射如下:

标签 / 概念 ICD-11 编码 SNOMED CT 术语说明
白内障(数据集核心疾病) 9B10 193570009 Cataract (disorder)
年龄相关性白内障(母数据集主要手术原因) 9B10(归入白内障类目) 385093006 Age-related cataract (disorder)
眼前段结构(瞳孔/虹膜/角膜标注对象) 81745001(眼 Eye 结构类目下) 标注对象为眼前节解剖

编码说明:ICD-11 中白内障类目(9B10)下按病因与临床形态细分;CATARACTS 队列的手术原因包括年龄相关性白内障、外伤性白内障与屈光矫正目的(官方数据页)。数据集 36 类中的 4 类解剖结构(瞳孔、虹膜、角膜、皮肤)与 29 类手术器械用于场景分割,不构成疾病诊断标签;将 CaDIS 用于疾病分级任务时需另行引入临床标注。SNOMED CT 映射采用概念码(SNOMED International 编码体系),接入院内术语服务(如 FHIR Terminology)时建议同时记录显示名与版本,避免跨版本漂移。

工程提示:把分割输出接入临床数据系统时,不要直接暴露 CaDIS 类 ID——先在配置层维护一份"CaDIS 类 → SNOMED CT 概念 → 展示名"的三级映射(器械类多数可映射到 SNOMED 的器械/操作概念),展示层只用三级映射产物。这样类体系升级或换数据集时只需改配置,不污染下游接口。

§2.2 疾病简介与流行病学

白内障指晶状体混浊导致的视力下降,是全球最主要的可逆性致盲原因;其主流治疗方式为超声乳化白内障吸除术(phacoemulsification)联合人工晶状体植入,是全球实施量最大的外科手术之一。白内障的患病率随年龄快速上升,人口老龄化使手术量持续增长——这也是手术自动化、术中辅助与术后分析类研究长期活跃的临床动因。CaDIS 采集自法国布雷斯特大学医院 2015 年 1 月 22 日至 9 月 10 日的 50 台白内障手术:患者平均年龄 61 岁(23-83 岁,标准差 10),女性 38 例、男性 12 例;手术原因包括年龄相关性白内障、外伤性白内障与屈光不正;全部患者均签署知情同意(CATARACTS 官方数据页)。50 台手术中 48 台由一位资深专家完成,1 台由一年经验医生完成,1 台由实习生完成——这意味着数据反映的是高年资术者的标准术式,术式个体差异与并发症场景覆盖有限(见 §7.1)。

§2.3 临床任务定义

CaDIS 支撑的临床任务属于计算机辅助介入(CAI)的场景理解层,位于诊断与治疗决策之间:

任务层 定义 CaDIS 支持方式
术中场景分割 对显微视野逐像素识别器械与解剖结构 36 类像素级掩码,直接监督
器械使用分析 统计各器械的出现与使用时段 像素分割结果可聚合为使用曲线(母数据集另有帧级使用标注可对照)
手术阶段感知 将视频流映射到手术步骤 帧采样按 14 个阶段分层,可复用 CATARACTS 阶段标注做弱监督
术中风险/质量提示 识别器械与角膜、晶状体囊膜的接近与接触 解剖与器械同图标注,可计算空间关系(须临床验证后使用)

手术流程与数据覆盖的对应关系:超声乳化白内障手术的标准流程为——制作角膜缘切口、连续环形撕囊(CCC)、水分离、超声乳化晶状体核、注入/抽吸清除皮质、人工晶状体植入、水密闭合切口。CaDIS 的器械类别几乎逐一对应这些步骤:撕囊阶段使用 capsulorhexis forceps / cystotome,超乳阶段使用 phacoemulsifier handpiece,皮质清除使用 I/A handpiece,植入阶段使用 lens injector。这意味着按器械出现推断手术阶段在白内障术式中是高可靠的先验,也是官方帧采样按 14 个阶段分层的原因——数据覆盖被设计为与手术流程对齐,而非均匀铺满整段视频。

任务选型的提醒:上表四个任务层对标注粒度的要求依次降低(像素级→帧级聚合→弱监督→空间关系),而 CaDIS 只在第一层提供直接监督;越往下的任务层,越需要叠加母数据集标注或自采标注,选题时先核对这一映射关系再设计实验。

§2.4 患者人群构成

维度 取值 来源
来源中心 法国布雷斯特大学医院(单中心) CATARACTS 数据页
采集时间 2015-01-22 至 2015-09-10 同上
手术量 50 台(CaDIS 采样自其中 25 段训练集视频) 同上
平均年龄 61 岁(最小 23,最大 83,标准差 10) 同上
性别 女 38 / 男 12 同上
术者 专家 48 台 / 一年经验 1 台 / 实习生 1 台 同上
手术原因 年龄相关性白内障、外伤性白内障、屈光不正 同上
采集时间 2015-01-22 至 2015-09-10 CATARACTS 数据页
手术量 50 台(CaDIS 采样自其中 25 段训练集视频) 同上
平均年龄 61 岁(最小 23,最大 83,标准差 10) 同上
性别 女 38 / 男 12 同上
术者 专家 48 台 / 一年经验 1 台 / 实习生 1 台 同上
手术原因 年龄相关性白内障、外伤性白内障、屈光不正 同上
知情同意 全部患者签署 同上

使用人群数据的注意点:CaDIS 分发包内不含上表任何个体级字段——人口学信息只存在于 CATARACTS 的队列级描述中。因此:不要在基于 CaDIS 的论文里做"患者级"统计推断(数据粒度不支持);引用 61 岁、38/12 等数字时注明是母数据集队列描述;需要个体级协变量的研究(如年龄与器械轨迹的关系)在本数据上不可行,这是选题阶段就应排除的方向。

§2.5 临床价值

像素级器械分割是"看得清手术刀在哪、离角膜多远"的技术底座。它的直接下游包括:术中实时风险提示(器械接近角膜内皮或后囊膜时预警)、术后器械使用自动统计与手术报告生成、以器械操作轨迹为特征的手术技能评分。对教学而言,分割掩码可以将术者注意力引导到具体器械与解剖交互区域,为年轻医生提供结构化复盘素材。需要强调的是:上述价值的实现都要求模型在目标医院设备与人群中重新验证——CaDIS 的单中心、单设备特性(详见 §7.3)决定了它训练出的模型不能未经验证直接跨院部署。

从研究到产品的路径上,CaDIS 填补的正是"论文验证 → 工程原型"之间缺数据的那一段:器械使用统计与阶段识别可以在帧级标注时代(CATARACTS 挑战赛)完成原型,但涉及器械-组织空间关系的功能(如避免超乳手柄触及角膜内皮的告警)必须有像素级监督。这也是 2021 年前后手术分割论文普遍以 CaDIS 为基准的方法学背景。

§2.6 金标准与参考标注

CaDIS 的"金标准"是研究用像素级参考标注,理解其构成与边界直接影响下游实验的可信度:

维度 说明
标注对象 4,670 帧 960×540 显微手术图像(源自 1920×1080 降采样)
标注类型 每帧每像素的语义类别(36 类分类体系)
标注方式 人工逐像素标注;内部专职标注团队,可直接咨询临床专业人员
标注者 Digital Surgery 内部标注团队(论文致谢 4 名标注者:Ellie Jaram、Nunzia Lombardo、Fanni Demeter、Hannah Bradd)
类别体系来源 沿用 CATARACTS 挑战赛的器械分类并扩展解剖与其他物体类
标注性质 研究用参考标准(research reference standard),非临床诊断金标准
质量佐证 发布团队称其为发布时外科数据中标注质量最高者;后续独立工作(Pissas 等)仍发现个别显著错标帧并公开黑名单(见坑点 2)
标注分辨率 960×540(源自 1920×1080 降采样)
掩码属性 与图像同尺寸的逐像素类别索引;每像素必属一类
公开属性 随论文公开发布;类别体系与母数据集挑战赛兼容,便于跨数据集对齐

§3 数据集规格

§3.0 版本抉择矩阵

CaDIS 的像素级标注只有一版,但实际可获取的数据包有三种口径,按需求选择:

你的需求 推荐获取项 大小 理由
只做语义分割(最常见) CaDIS 分割包(官方 grand-challenge 页) 官方未公布(4,670 帧图像+掩码,远小于母视频) 自带官方划分与 36 类掩码,开箱即用
需要完整视频/帧级工具标注对照 CATARACTS 母数据集(IEEE DataPort) 视频压缩包 117.8 GB 50 段 1920×1080 视频 + 21 类帧级使用标注 + 评估脚本
想直接复现 MICCAI 2021 SOTA Pissas 等官方仓库 + 其黑名单/重标注 代码 + 40 张重标注掩码 提供三任务配置、预训练权重与错标帧清单
需要正式许可背书的采购/合规评审 先联系发布方确认条款,暂以官方页面与论文为准 数据集许可未单独声明,合规流程前置

选型原则:先明确实验的"对照锚点"再选数据口径——与官方论文比用第一种,与 SOTA 比用第三种并声明过滤;两种对照混在一个表里是审稿意见的高发区。

§3.1 模态详情

数据为手术显微镜采集的 RGB 视频帧。母视频由 Carl Zeiss OPMI Lumera T 显微镜(配 Toshiba 180I 相机与 MediCap USB200 录制器)以 1920×1080、约 30 fps 录制(CATARACTS 数据页);CaDIS 将选中帧降采样至 960×540 进行标注。视野内容为白内障超声乳化手术的前节显微画面:角膜、瞳孔、虹膜占据画面主体,超乳手柄、注入/抽吸手柄等器械经角膜缘切口进入眼内,开睑器、手术胶带、术者手套等物体出现在视野边缘。与腹腔镜画面相比,显微视野光照更强、反光更重,透明器械(晶状体注入器、I/A 手柄)在图像中边界极弱,是该模态最显著的视觉挑战。

视觉外观要点(建模前应了解):(1) 显微照明在角膜与晶状体表面形成大面积高光斑点,反光会吞掉器械的部分轮廓;(2) 器械通常从画面上方进入视野,与切口位置强相关——这是垂直翻转被视为危险增强的原因;(3) 随手术阶段推进,画面整体色调变化明显(红光反射期的暖色调、灌注期的亮视野),颜色增强的幅度需要克制;(4) 部分帧含瞳孔收缩/扩张的快速过渡,解剖类边界在这些帧上天然更模糊。

§3.2 按子集样本数

子集 帧数 源视频 说明
训练集 3,550 其余 19 段视频 选取时保证训练集视频涵盖全部 36 类样本
验证集 534 视频 5、7、16 各类器械具有足够实例数
测试集 586 视频 2、12、22 与验证集同原则选取
合计 4,670 25 段 即 CATARACTS 训练集全部视频

来源:官方 CaDIS 页面。划分按整段视频进行,同一视频的帧不会跨子集出现(见 §5.3 泄漏讨论)。划分与官方任务定义相互独立:无论你在 8/17/25 哪一档任务上实验,划分保持同一套——这保证了三档任务之间的结果可以横向对照,也是复现官方论文时最容易忽视的对齐点(论文的四个基线模型在三档任务上用的是同一划分)。

§3.3 数据格式

CaDIS 的分发物极简:图像、掩码与类表三者构成全部内容,没有额外的元数据文件需要理解。

内容 格式 说明
图像帧 RGB 位图(与掩码一一对应命名) 标注分辨率 960×540
语义掩码 与图像同尺寸的类别索引/调色板图 每像素取值对应 36 类 ID,官方页面发布类 ID → 类名映射表
类别清单 官方页面表格 29 器械 + 4 解剖 + 3 其他
母数据集视频 MP4(CATARACTS,IEEE DataPort 分发) 1920×1080、约 30 fps
错标帧黑名单 data.csv(社区仓库提供) 帧 ID 清单,训练前过滤用
修正掩码 relabelled/(社区仓库提供,40 张) 替换原掩码使用
官方划分 目录级(train/val/test) 见 §3.2

不同镜像分发包的目录命名略有差异,解压后请以包内实际清单为准;核心不变量是图像与掩码成对出现且官方三分目录齐全。社区仓库额外提供的 relabelled/ 修正掩码与 data.csv 错标帧黑名单不属于官方原始包,是否启用会改变与论文数字的可比性(见 §5.2 与坑点 2、7)。

§3.4 存储大小

官方未公布 CaDIS 分割包的压缩体积(官方页面下载入口未标注大小)。按 4,670 帧 960×540 RGB 图像加同尺寸掩码估算为数百 MB 至数 GB 量级,实际以下载为准。母数据集 CATARACTS 视频压缩包为 117.8 GB(IEEE DataPort)。

§3.5 标注方式

人工逐像素标注(fully supervised semantic annotation)。帧选择按 14 个手术阶段分层、每阶段最多 20 帧、相邻帧至少间隔 3 秒,从 1920×1080 降采样至 960×540 后标注(arXiv 1906.11586)。类别定义遵循 CATARACTS 挑战赛体系并扩展:每个像素归入 36 类之一,不存在无标签像素。

工作流要点:标注由专职团队执行,而非请临床医生兼职标注——临床专业知识通过"标注员可随时咨询临床专业人员"的咨询机制注入。这一组织方式是外科像素级标注的常见最佳实践:医生定义类别边界与疑难判定规则,标注员执行批量标注,效率与一致性均优于医生直接标注。使用者在复刻自家标注管线时可直接借鉴该分工。

§3.6 标注者资质与一致性

标注由 Digital Surgery 的内部数据标注团队完成,该团队"可直接接触临床专业人员"进行疑难判定(论文 III 节);论文致谢列出 4 名标注者。CaDIS 论文未公布像素级标注者间一致性(inter-rater agreement)数字;母数据集 CATARACTS 的帧级器械使用标注在裁定后 kappa 为 0.630-0.998(needle holder 最低、vitrectomy handpiece 最高,CATARACTS 数据页),可作为标注难度侧写。后续独立团队在训练前对 CaDIS 做了错标帧筛查(见 §7.2 与坑点 2),使用时建议直接复用其黑名单。

§3.7 采集周期

源视频采集于 2015-01-22 至 2015-09-10(约 8 个月窗口);数据集构建与发布为 2019 年(arXiv v1,2019-06-27),标注于发布前完成。采集窗口的跨度(8 个月)意味着同一季节、同一设备团队、同一耗材批次的数据集中度较高——季节性因素(如夏季结膜炎高发对手术安排的影响)在数据中难以体现,这类时间维度的覆盖缺口在单中心数据中是常态,记录于此供研究设计时参考。

§3.8 地域覆盖

单中心:法国布雷斯特大学医院(Brest University Hospital)。无多地域覆盖;这一特性是 §7.1 偏倚与 §7.3 泛化性讨论的核心事实。对单中心数据的正确预期是:它能支撑"方法学成立"的证据(架构、损失、训练策略的比较),不能支撑"临床可推广"的证据(人群、设备、术式的覆盖)——两类结论在论文中应明确分开表述。

§3.9 设备规格

部件 型号 厂商
手术显微镜 OPMI Lumera T Carl Zeiss Meditec(德国耶拿)
相机 180I Toshiba(日本东京)
录制器 MediCap USB200 MediCapture(美国)
输出 1920×1080,约 30 fps 显微镜视频;另有 50 fps 器械台视频(CaDIS 未使用)

设备注释:CATARACTS 的每台手术实际录制了两个机位——显微镜视频与手术器械台视频(约 50 fps),CaDIS 只使用显微镜机位;这意味着同一台手术存在"另一视角"的配套视频,但两者之间没有官方逐帧对齐文件,跨机位研究需自行做时间对齐。设备链(Zeiss 显微镜 + Toshiba 相机 + MediCap 录制器)决定了图像的色彩风格与压缩特性,跨设备迁移时这些环节都要重新评估。

§3.10 深度溯源链

患者(布雷斯特大学医院,2015)→ 手术显微视频(OPMI Lumera T,1920×1080/30 fps)→ CATARACTS 挑战赛整理与帧级工具标注(Inserm 团队,Al Hajj 等,MedIA 2019)→ CaDIS 帧采样(Digital Surgery,14 阶段分层、每阶段 ≤20 帧、间隔 ≥3 秒)→ 降采样至 960×540 → 内部团队逐像素标注(36 类)→ 官方划分与三任务定义发布(arXiv 2019 / MedIA 2021)。每一环节的来源见 §9 引用。了解这条链的意义在于:任何质量结论都继承自上游——显微镜色彩科学、CATARACTS 的类别体系决策、以及帧采样策略共同塑造了 CaDIS 的分布形态。

溯源审计要点:如果你要把 CaDIS 纳入自家数据资产,沿这条链逐环登记"上游凭证"——CATARACTS 的下载记录(IEEE DataPort 账号与 DOI)、CaDIS 分发包的下载日期与来源页面、社区黑名单文件的 commit 哈希。三个凭证齐备后,你的数据血缘可以从任一 checkpoint 一路回溯到原始手术视频,这是发表与审计时最省时间的前置工作。


§4 数据结构

§4.0 目录树

按官方分发与社区通行布局,解压后的结构如下(目录名在不同镜像中略有差异,以实际下载包为准):

CADIS/
├── segmentation/                 # CaDIS 官方分割包根目录
│   ├── train/                    # 训练集:3,550 帧图像
│   ├── train_labels/             # 训练集掩码:3,550 张,与图像同名对应
│   ├── val/                      # 验证集:534 帧(源视频 5、7、16)
│   ├── val_labels/               # 验证集掩码
│   ├── test/                     # 测试集:586 帧(源视频 2、12、22)
│   ├── test_labels/              # 测试集掩码
│   └── class_mapping             # 类 ID → 类名映射(36 类;以官方页面表格为准)
├── relabelled/                   # (可选)Pissas 等 MICCAI 2021 提供的 40 张修正掩码
└── data.csv                      # (可选)Pissas 仓库提供的错标帧黑名单 ID 清单
CATARACTS/                        # 母数据集(另行从 IEEE DataPort 获取)
├── training_set/                 # 25 段显微手术视频(MP4)+ 工具使用标注
└── test_set/                     # 25 段显微手术视频(MP4)+ 工具使用标注

阅读目录树的三个注意点:第一,官方包的核心是 segmentation/ 下的图像-掩码成对目录;第二,relabelled/data.csv 需要从社区仓库手动放入,官方包不含;第三,CATARACTS/ 是独立的 117.8 GB 下载项,只在做视频级任务或弱监督实验时才需要。

§4.1 DAIMS 字段字典

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
frame_id 文本 帧唯一标识(文件名主干) video05_frame0042 主键;对齐图像与掩码 全集唯一
split 枚举 官方划分归属 train 实验可比性 train / val / test
source_video 整数 源视频编号(CATARACTS 训练集) 5 按视频聚合、防泄漏分组 1-25(训练集视频)
image 图像 960×540 RGB 帧 train/xxx.png 模型输入 降采样损失(1920×1080→960×540) 960×540×3
mask 图像 同尺寸像素级标签图 train_labels/xxx.png 分割监督 个别错标帧(见坑点 2) 类 ID 0-35+背景
class_id 整数 像素类别索引 12 掩码解码 官方映射表为准确绳 官方 36 类 ID 表
category 枚举 类别大类 instrument 分组评估(解剖/器械/其他) anatomy / instrument / other
phase 整数 采样时所属手术阶段(依采样协议) 7 阶段分层分析、弱监督 依 CATARACTS 阶段标注 14 阶段之一

字典说明source_videophase 并非总在包内以独立文件提供,可通过文件名与官方采样协议还原;category 为本页按官方 29+4+3 结构归纳的管理字段,便于分组统计。掩码像素值到类名的映射以官方页面发布的类 ID 表为准,禁止凭颜色目测硬编码。把这份字典落地为仓库中的 DATASET_SCHEMA.md(或 YAML),与代码同版本管理——这是把"论文里的数据描述"转化为"工程里的契约"最便宜的做法。

§4.2 标签分布

类别体系构成:36 类 = 29 器械 + 4 解剖 + 3 其他。器械类覆盖 CATARACTS 挑战赛定义的全部 21 种器械(biomarker、Charleux cannula、hydrodissection cannula、Rycroft cannula、viscoelastic cannula、cotton、capsulorhexis cystotome、Bonn forceps、capsulorhexis forceps、Troutman forceps、needle holder、I/A handpiece、phacoemulsifier handpiece、vitrectomy handpiece、implant injector、primary incision knife、secondary incision knife、micromanipulator、suture needle、Mendez ring、Vannas scissors,CATARACTS 数据页),并为部分器械增加手柄(handle)细分(如 Task 3 类清单中的 I/A Handpiece Handle、Ph. Handpiece Handle、Cap. Cystotome Handle 等);解剖类为 pupil、iris、cornea、skin;其他类为 surgical tape、hand、eye retractors。

分布形态:CaDIS 官方未公布逐类像素占比;其长尾形态可由两条证据链刻画。其一,母数据集 CATARACTS 的帧级器械出现率(21 类,两位专家裁定后)从 0.017%(biomarker)到 17.6%(micromanipulator),跨越三个数量级(arXiv 1710.01559);其二,官方三任务设计本身就是对长尾的响应——Task 2 将外观相似的套管合并为 Cannula 类、Task 3 忽略"出现少于 5 段视频"的类别(见 §3.10 与官方论文)。实际使用中建议先对训练集做逐类像素直方图再决定采样策略(代码如下)。官方类 ID → 类名映射表以 grand-challenge 官方页面的类别清单表格为准,写代码前先把它导出为配置文件(CSV/JSON),后续所有映射逻辑只读这份配置。

# 逐类像素占比直方图:任何训练/采样策略设计前的第一步
import numpy as np
from PIL import Image
from pathlib import Path
from collections import Counter

LABEL_DIR = Path("./data/CADIS/segmentation/train_labels")  # ← 按实际路径修改
N_CLASSES = 36                                              # 官方 36 类
hist = Counter()
n_files = 0
for f in sorted(LABEL_DIR.iterdir()):
    m = np.asarray(Image.open(f))                           # class-id 掩码
    ids, counts = np.unique(m, return_counts=True)
    hist.update({int(i): int(c) for i, c in zip(ids, counts)})
    n_files += 1

total = sum(hist.values())
print(f"files: {n_files}, labeled pixels: {total:,}")
for cid in range(N_CLASSES):
    share = hist.get(cid, 0) / total * 100
    flag = "  ← 稀有类" if 0 < share < 0.1 else ""
    print(f"class {cid:02d}: {share:8.4f}%{flag}")
# 经验判读:占比 <0.1% 的类在 CE 损失下基本学不到,需重采样或合并(见坑点 3、6)

§4.3 关键统计

统计项 数值 来源
帧总数 4,670 官方页面
类别总数 36(29 器械 + 4 解剖 + 3 其他) 同上
标注分辨率 960×540(源自 1920×1080) arXiv 1906.11586
官方基准输入分辨率 270×480 同上
母视频总时长 超过 9 小时(平均 10 分 56 秒/段) CATARACTS 数据页
帧采样协议 14 阶段分层,每阶段 ≤20 帧,间隔 ≥3 秒 arXiv 1906.11586
官方任务档位 Task 1 = 8 类 / Task 2 = 17 类 / Task 3 = 25 类 arXiv 1906.11586
官方基线最佳(test mIoU) Task1 84.91(HRNetV2)/ Task2 76.11(HRNetV2)/ Task3 66.76(UPerNet) 同上

读表要点:官方基线与采样协议、任务档位三个条目是复现实验的三要素;社区 SOTA 数字(§8.1)不在本表内,因其口径含损失函数与过滤差异。

§4.4 数据层级

患者(50 例,脱敏,CaDIS 包内不含患者级元数据)
└── 手术(50 台;CaDIS 使用其中 25 台的训练集视频)
    └── 视频(1920×1080、约 30 fps、平均 10 分 56 秒)
        └── 帧(按 14 阶段分层采样,4,670 帧)
            └── 像素(36 类语义标注,960×540)

统计与建模时必须保留"帧 → 视频"的从属关系:所有跨帧比较(划分、交叉验证、Bootstrap 置信区间)都应以视频为独立单元。

层级对实践的具体含义:数据包内没有患者级或手术级元数据文件,"帧属于哪台手术"由文件名/目录约定与 CATARACTS 视频编号还原。建议在入库时为每帧生成包含 source_video 的元数据表(§4.1 的字段字典),否则后续任何"按视频聚合"的正确实验都做不了。

§4.5 缺失值与信息性缺失

语义分割掩码无传统意义的缺失值——每个像素必有 36 类之一(或背景),不存在 NaN。需要管理的是三类"信息性缺失":

情形 表现 处理建议
类仅出现在部分视频 suture needle、needle holder、vitrectomy handpiece、marker、cotton、iris hooks、Mendez ring 在验证/测试集中缺失 官方任务 2/3 训练时忽略此类;自定任务须先统计类-视频共现矩阵
透明器械像素占比极低 Lens Injector Handle 在 Task 3 所有官方模型 mIoU 为 0 不要因个类别崩溃而误判训练流程错误;报告时单独说明
视频级元数据缺失 包内无患者级人口学字段 人口学分析需回溯 CATARACTS 官方描述,不得在包内"考古"

处理原则:语义分割数据的"缺失管理"本质是类别可见性管理——官方用三档任务把"哪些类在该任务里存在"写清楚了,自定任务时应当产出同等明确的类别清单文件,而不是在代码里散落硬编码。

§5 划分与使用建议

§5.1 官方划分

官方按整段视频三分(官方页面):训练集 3,550 帧、来自涵盖全部 36 类的 19 段视频;验证集 534 帧(视频 5、7、16);测试集 586 帧(视频 2、12、22)。验证/测试视频的选择原则是保证各类器械有足够实例数以支持公平评估(arXiv 1906.11586)。划分把"类别覆盖"与"视频隔离"两个目标同时满足:训练侧保证见过所有类,评估侧保证评估对象是没见过的手术。

§5.2 社区惯例划分

社区复现(如 Pissas 等 MICCAI 2021 仓库)全部沿用官方划分,并叠加两种可选数据过滤:blacklisting(按其公开的 data.csv 剔除显著错标帧)与 relabelled(用其发布的 40 张修正掩码替换)。对比论文数字时务必声明是否启用这两项——官方论文与 Pissas 的无过滤口径(86.40/79.40/71.94)才是社区通用对照线。需要强调:过滤与重标注是"更干净的数据版本"而非"另一份数据集",混用两种版本训练出的模型互相不可比,实验管理中应作为两个独立数据版本登记。

§5.3 划分策略与泄漏风险

最重要的一条纪律:任何自行重划分都必须按视频聚合,禁止按帧随机划分。 白内障手术中视野变化缓慢,帧间隔 ≥3 秒的相邻帧依然高度相似;按帧随机划分会让近重复帧分居训练与测试两侧,mIoU 虚高且不可复现。官方论文明确说明其划分"刻意避免将同一视频的帧分配到不同数据集"。同理:

  • 按手术划分(官方做法):泄漏最小,报告的指标可解释为对新手术的泛化能力。
  • 按术者划分(留一术者交叉验证):衡量术者泛化,但本数据 48/50 台由同一专家完成,此协议在 CaDIS 上统计功效不足,仅建议在多术者数据集(如 101-Cataract)上做。
  • 按阶段分层重划分:若研究目标是"跨手术阶段泛化",可按 14 阶段分层在视频内做分组抽样——但必须保持"同视频帧不同时出现在两侧"的底线,实现复杂度高,非必要不用。
  • Bootstrap 置信区间:以视频为重采样单元,而非帧。

§5.4 交叉验证建议

若训练数据有限,推荐"留视频交叉验证"(leave-videos-out):在 19 段训练集视频内做 k 折(每折 2-3 段视频),验证集沿用官方 val 或折内构建;切勿将 val/test 视频卷入训练。三任务(8/17/25 类)各自独立做交叉验证,不可混折。实现上用 sklearn.model_selection.GroupKFold,以 source_video 为 group 键即可保证视频级隔离;报告交叉验证结果时给 k 折的均值与标准差,并保留每折的逐类 IoU 以便诊断稀有类在哪些折上崩溃。

§5.5 外部验证建议

CaDIS 是单中心数据,发表前强烈建议做外部验证。可行路径对照:

验证路径 数据来源 任务对齐方式 成本 证据强度
CATARACTS 测试集视频 25 段未见于 CaDIS 采样的母数据集视频 帧级工具存在(分割结果聚合后对照) 中(标签粒度不同)
腹腔镜基准零样本迁移 CholecSeg8k / EndoVis 共享类(hand、器械大类) 中低(域差距大)
自采跨设备显微数据 合作中心其他品牌显微镜 完整像素任务复刻 高(最接近真实部署)

§5.6 常见误用自查清单

# 误用行为 后果 正确做法
1 按帧随机划分训练/测试集 近重复帧泄漏,指标虚高 按视频聚合划分(官方划分)
2 用测试集调参或做早停 测试集过拟合,结果不可复现 只用 val 调参,test 只跑一次
3 36 类全量直训后与官方 25 类口径比 mIoU 类集合不同,数字不可比 对齐官方任务定义(8/17/25)
4 忽略黑名单直接对比 Pissas 数字 数据口径不一致 声明是否启用 blacklist/relabelled
5 把"可见"当"使用中"评估工具使用 与 CATARACTS 语义错位 区分两套标签体系(坑点 8)
6 掩码用双线性插值 resize 产生非法中间类别 掩码一律最近邻插值(坑点 5)

这份清单可以直接抄进项目的 code review checklist——六条误用中的每一条都在真实复现工作里出现过,对照检查的成本远低于事后返工。


§6 AI 就绪指南

§6.0 云端快速启动

官方未提供 Colab/Kaggle Notebook,但数据体积小(分割包数百 MB 量级),任意云端 GPU 环境均可按以下顺序就绪:

# 1) 在 Kaggle/Colab 中上传或挂载已下载的 CaDIS 分割包,解压
#    Kaggle:把分割包作为 Dataset 挂载到 /kaggle/input/
#    Colab:from google.colab import drive; drive.mount('/content/drive')
unzip -q cadis_segmentation.zip -d /content/data/
# 解压后应得到 /content/data/CADIS/segmentation/{train,val,test} 等目录

# 2) 克隆 SOTA 仓库(获得黑名单 data.csv、relabelled 与评测参考实现)
git clone https://github.com/RViMLab/MICCAI2021_Cataract_semantic_segmentation.git /content/sota

# 3) 环境建议:PyTorch >= 1.7(复现 SOTA 用 1.7 + CUDA 10.0;新环境用当前稳定版亦可)
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
pip install pillow numpy

# 4) 先跑 §4.2 的直方图脚本确认数据完整,再进 §6.1 训练

云端注意事项:(1) 免费档 GPU(T4 16 GB)足够 270×480 输入的训练;(2) /kaggle/input 挂载为只读,训练输出与 checkpoint 要写到 /kaggle/working;(3) Colab 断连会丢本地盘数据,掩码与 checkpoint 建议同步到 Drive;(4) 复现 SOTA 数字时再切回 PyTorch 1.7 专用环境,避免版本差异引入的数值漂移。

§6.1 快速上手

目录结构预期:以下代码假设数据解压为 §4.0 的布局,data_root 指向 CADIS/segmentation/ 的上一级目录,代码内通过 data_root / "CADIS" / "segmentation" / split 拼接路径。

最小可用子集:Task 1(8 类)——4 个解剖类 + 1 个器械合并类 + 3 个其他类,最接近"能快速跑通并看到合理 mIoU"的路径;36 类全量直训会因长尾崩溃(见坑点 6)。Task 2/3 的映射要点:Task 2 需要把多款套管/镊子合并(官方论文给出合并规则),Task 3 保留手柄细分但要忽略低频类——两档的映射表都建议从官方论文表格逐行誊抄成配置文件,不要凭记忆手写。

# 环境:PyTorch >= 1.7,torchvision,Pillow,NumPy
# 依赖文件:CADIS/segmentation/{train,val,test} 与对应 *_labels 目录
import torch, numpy as np
from PIL import Image
from pathlib import Path

DATA_ROOT = Path("./data/CADIS/segmentation")   # ← 按实际解压路径修改

# Task 1 的 8 类定义(官方论文 Experiment I)
TASK1_CLASSES = ["background", "pupil", "iris", "cornea", "skin",
                 "instrument", "surgical_tape", "hand", "eye_retractors"]

# 查看一张图与掩码是否对齐(首次下载后务必先做这一步)
img = Image.open(DATA_ROOT / "train" / sorted(
    (DATA_ROOT / "train").iterdir())[0])
print("image size:", img.size)   # 预期 (960, 540)

§6.2 数据获取

获取 CaDIS 涉及官方页面、母数据集与社区仓库三个来源,先看汇总表再走获取流程:

途径 内容 大小 访问方式
官方 CaDIS 页面 分割包说明、类 ID 表、论文链接 公开网页;下载入口见页面
cataracts-semantic-segmentation2020 论文中公布的公开地址 公开网页
CATARACTS @ IEEE DataPort 50 段母视频 + 帧级标注(DOI 10.21227/ac97-8m18) 117.8 GB 注册后免费获取
UCL Discovery 存档 MedIA 正式版论文 PDF(CC BY-NC-ND) 公开存取
RViMLab 仓库 SOTA 代码、预训练权重、黑名单 data.csv、40 张重标注 开源(GPL-3.0 代码)

许可注意:CaDIS 官方发布页未单独声明数据集许可条款;配套论文以 CC BY-NC-ND 4.0 开放获取。学术使用一般以引用 + 官方渠道获取为惯例,但商业产品集成、数据再分发、对外提供 SaaS 等场景应先与发布方(现 Medtronic Digital Surgery)确认书面授权;底层 CATARACTS 视频另受 IEEE DataPort 注册条款约束。

# 获取流程(三步)
# 1) 从官方 grand-challenge 页面进入 CaDIS 下载入口,获取分割包并解压到 ./data/CADIS/
# 2)(可选)克隆 SOTA 仓库,把 relabelled/ 与 data.csv 复制到 ./data/CADIS/segmentation/
#    git clone https://github.com/RViMLab/MICCAI2021_Cataract_semantic_segmentation
# 3)(可选)如需母视频,注册 IEEE DataPort 后下载 CATARACTS(117.8 GB),解压到 ./data/CATARACTS/
# 注意:官方页面下载入口曾长期标注上传维护状态,若入口失效,
#       优先以论文页(arXiv 1906.11586 最新版摘要中的链接)与官方页面公告为准。

下载完成后的核对清单(5 分钟内可完成,避免后面数小时的无效排查):

  1. 三个划分目录的文件数分别是 3,550 / 534 / 586(图像)且掩码数量一致;
  2. 任取一对图像-掩码:尺寸同为 960×540、文件主干名相同;
  3. 掩码值域 np.unique 落在官方类 ID 表范围内(出现意外值先怀疑调色板/索引读法);
  4. 用官方类 ID 表把 Task 1 的 8 类映射写完后,检查 val/test 中 8 类是否都出现;
  5. 若启用黑名单:确认 data.csv 中的帧 ID 格式与你的文件名主干一致。

核对全部通过后再开始写训练代码——清单中任何一项不过都意味着数据版本与预期不符,先解决再动手。

§6.3 预处理全流程

流程:读取对齐 → 类映射构建(36 类 → 目标任务)→ 尺寸标准化(960×540 → 270×480,掩码用最近邻插值)→ 归一化 →(可选)黑名单过滤。

import numpy as np
import torch
from PIL import Image
from pathlib import Path

# —— 第 1 步:构建 36 类 → 目标任务类索引的映射 ——
# 官方 36 类 ID 表见 grand-challenge 页面;下面以 Task 1 为例演示映射机制。
# raw_id -> task1_id;未列入的原始 ID 统一映射为 ignore(训练与评估均跳过)
TASK1_MAP = {0: 0}                      # 背景 → 背景(以官方 ID 表为准核校)
for rid in range(1, 36):
    TASK1_MAP[rid] = 0                  # ← 示例占位映射,请按官方类名表逐条填写
# 正确做法:从官方页面抄录 29 个器械类 → 1(instrument),
# pupil/iris/cornea/skin → 2/3/4/5,surgical_tape/hand/eye_retractors → 6/7/8
IGNORE_INDEX = 255

def remap(mask: np.ndarray, mapping: dict) -> np.ndarray:
    out = np.full_like(mask, IGNORE_INDEX)
    for raw, tgt in mapping.items():
        out[mask == raw] = tgt
    return out

# —— 第 2 步:标准化(图像双线性、掩码最近邻——插值方式错误是经典坑,见坑点 5)——
def load_pair(img_path: Path, mask_path: Path, size=(270, 480)):
    img = Image.open(img_path).convert("RGB").resize(size, Image.BILINEAR)
    msk = Image.open(mask_path).resize(size, Image.NEAREST)
    img = torch.from_numpy(np.asarray(img, np.float32) / 255.0).permute(2, 0, 1)
    msk = remap(np.asarray(msk), TASK1_MAP)
    return img, torch.from_numpy(msk.astype(np.int64))

# —— 第 3 步(可选但推荐):黑名单过滤 ——
# Pissas 等在其仓库 data/data.csv 公布显著错标帧 ID;训练前过滤可避免学习系统性标注噪声。
BLACKLIST = set()                       # ← 从 data.csv 读取后填入
def is_blacklisted(frame_id: str) -> bool:
    return frame_id in BLACKLIST

§6.4 PyTorch DataLoader 完整示例

离线预处理 vs 在线增强的取舍:类映射与黑名单过滤建议离线做一次并缓存(映射后的掩码体积不变、可复用),resize 到训练分辨率既可离线也可在线;颜色/模糊/翻转类增强必须在线做以保证随机性。全量离线预 resize 的好处是训练吞吐稳定,缺点是丢失了多分辨率实验的灵活性——若计划对比 270×480 与 540×960 两种口径,保留原始 960×540、训练时在线 resize 是更省事的方案。

import torch
import numpy as np
from PIL import Image
from pathlib import Path
from torch.utils.data import Dataset, DataLoader

class CaDISDataset(Dataset):
    """CaDIS 语义分割数据集(Task 1/2/3 通用,类别映射在构造时传入)。

    预期目录:data_root/{split}/ 与 data_root/{split}_labels/ 同名成对。
    data_root 拼接关系:Path(data_root) / split / filename ↔
                        Path(data_root) / f"{split}_labels" / filename
    """
    def __init__(self, data_root: str, split: str = "train",
                 mapping: dict | None = None, ignore_index: int = 255,
                 size: tuple = (270, 480), augment: bool = False,
                 blacklist: set | None = None):
        self.root = Path(data_root)
        self.split = split
        self.mapping = mapping or {}
        self.ignore_index = ignore_index
        self.size = size
        self.augment = augment and split == "train"
        self.blacklist = blacklist or set()
        img_dir = self.root / split
        self.ids = sorted(p.stem for p in img_dir.iterdir()
                          if p.stem not in self.blacklist)

    def __len__(self):
        return len(self.ids)

    def __getitem__(self, idx: int):
        stem = self.ids[idx]
        img = Image.open(self.root / self.split / f"{stem}.png").convert("RGB")
        msk = Image.open(self.root / f"{self.split}_labels" / f"{stem}.png")
        if self.augment:
            if torch.rand(1).item() < 0.5:            # 水平翻转(见 §6.6 安全性讨论)
                img, msk = img.transpose(Image.FLIP_LEFT_RIGHT), \
                           msk.transpose(Image.FLIP_LEFT_RIGHT)
        img = img.resize(self.size, Image.BILINEAR)
        msk = msk.resize(self.size, Image.NEAREST)
        img = torch.from_numpy(np.asarray(img, np.float32) / 255.0).permute(2, 0, 1)
        msk = np.asarray(msk).copy()
        out = np.full_like(msk, self.ignore_index)
        for raw, tgt in self.mapping.items():
            out[msk == raw] = tgt
        return img, torch.from_numpy(out.astype(np.int64))

train_ds = CaDISDataset("./data/CADIS/segmentation", "train", mapping=TASK1_MAP)
val_ds   = CaDISDataset("./data/CADIS/segmentation", "val",   mapping=TASK1_MAP)
train_dl = DataLoader(train_ds, batch_size=8, shuffle=True,
                      num_workers=4, pin_memory=True, drop_last=True)
val_dl   = DataLoader(val_ds, batch_size=8, shuffle=False, num_workers=4)

x, y = next(iter(train_dl))
assert x.shape == (8, 3, 270, 480) and y.shape == (8, 270, 480)
print("batch OK, mask classes:", torch.unique(y).tolist())

使用提示:(1) 示例按官方 8/17/25 三档任务设计,mapping 必须来自官方类 ID 表,禁止手工目测调色板;(2) num_workers 在 Windows 下需放在 if __name__ == "__main__": 保护内;(3) 若显存吃紧,先把 batch 降到 4、保持输入 270×480,不要用降输入分辨率来省显存——那会破坏与官方口径的可比性;(4) 训练前用 val_ds 跑一遍完整性检查(可迭代一次、逐类统计非零),比训练半天后发现问题划算得多。

§6.5 坑点清单

以下 8 个坑点全部来自该数据集的真实特有失败模式(官方论文结果表、Pissas 等的独立复现发现、以及两套标注体系的结构差异),索引如下,详见各条:

# 坑点 分类 一句话提示
1 按帧随机重划分泄漏 数据泄漏 必须按视频聚合划分
2 错标帧未过滤 标签理解 先接黑名单再训练
3 类不平衡直训 偏倚陷阱 Lovász + 重采样是标配
4 透明器械手柄不可分 标签理解 0 mIoU 是物理极限不是 bug
5 三级分辨率掩码错位 预处理陷阱 掩码只许最近邻插值
6 36 类全量混淆任务定义 标签理解 部分类仅训练集出现
7 mIoU 口径不一 评估误用 固定 ignore 与类集合口径
8 两套标注体系混用 工程陷阱 CATARACTS 与 CaDIS 粒度不同

以上坑点的证据来源分布:坑点 1、4、6 来自官方论文的划分与任务设计;坑点 2、3 来自 Pissas 等的独立复现与方法学研究;坑点 5、7、8 是两套标注体系与三级分辨率链在工程实践中必然触发的问题。每条都给出了从简单到 SOTA 的三级处理方案,按项目周期与工程预算自选。

⚠️ 坑点 1:按帧随机重划分导致近重复帧泄漏(分类:数据泄漏)

问题:白内障手术视野变化缓慢,帧间隔 ≥3 秒的相邻帧在像素层面依然高度相似;若把 4,670 帧当独立样本随机重划分,近重复帧会同时出现在训练与测试集。
症状:自行划分后的 mIoU 显著高于官方划分下的可比模型(常见虚高 5-15 个点);模型在新手术视频上表现骤降。
解决

  1. 简单方法:固定使用官方划分(train 3,550 / val 534 / test 586),不做任何重划分。
  2. 进阶方法:若必须重划分(如交叉验证),按 source_video 分组切分(GroupKFold/留视频法),保证同视频帧只出现在一侧。
  3. SOTA 方法:按"手术 → 视频 → 帧"层级做 Bootstrap 置信区间,并在论文中明确声明划分单元。
    参考:官方划分说明(arXiv 1906.11586);泄漏原理通见于手术视频学习文献。

⚠️ 坑点 2:显著错标帧未经过滤就参与训练(分类:标签理解)

问题:后续独立团队(Pissas 等,KCL)在复现时发现 CaDIS 存在"significantly mislabelled"的帧——大面积像素被标为错误类别;未过滤会注入系统性标签噪声。
症状:个别帧的损失异常高且难以收敛;训练集上某些类 IoU 波动剧烈;可视化时看到整块器械被标成解剖类。
解决

  1. 简单方法:下载 RViMLab 仓库data/data.csv 黑名单,训练前剔除对应帧 ID。
  2. 进阶方法:同时启用其 40 张重标注掩码(relabelled 目录覆盖原掩码),并对全训练集做一次 IoU 一致性粗筛(用强基线模型先跑一遍,找 IoU 极低的帧人工复核)。
  3. SOTA 方法:噪声标签训练框架(co-teaching / 自蒸馏),但对比官方口径时仍需报告无过滤版本。
    参考Pissas et al., MICCAI 2021 及其官方仓库 README 的 blacklisting 说明。

⚠️ 坑点 3:极端类别不平衡下直接交叉熵训练(分类:偏倚陷阱)

问题:36 类呈三数量级长尾(母数据集帧级占比 0.017%-17.6%),普通交叉熵会被高频类主导,稀有器械类 mIoU 接近 0。
症状:整体 mIoU 尚可但逐类报告里大量稀有类为 0 或个位数;模型预测图几乎不出现稀有器械。
解决

  1. 简单方法:按类频率加权交叉熵(inverse-frequency 或有效样本数加权)。
  2. 进阶方法:Lovász-Softmax 损失(直接优化 IoU 的可微代理)+ repeat factor sampling(按类出现频率对含稀有类图像过采样,Pissas 用重复因子 t=0.15-0.2)。
  3. SOTA 方法:Pissas 等证明 loss + oversampling 的收益大于更换骨干:OCRNet(ResNet-50) + Lovász + RF sampling 三任务 86.40/79.40/71.94;backbone 从 ResNet34 换到 ResNet50/WideResNet101 几乎无增益。
    参考Pissas et al., MICCAI 2021, LNCS 12903, pp. 509-518CATARACTS 工具占比

⚠️ 坑点 4:透明器械与手柄类别的不可分性被当作训练 bug(分类:标签理解)

问题:晶状体注入器、I/A 手柄等器械在显微图像中高度透明,与其手柄的视觉边界几乎不存在;官方 Task 3 中 Lens Injector Handle 在所有模型上 mIoU = 0。
症状:某个 handle 类无论怎么调参都是 0 mIoU,误以为是 DataLoader 或映射错误,浪费大量排查时间。
解决

  1. 简单方法:接受物理极限——在细粒度任务(Task 3)中把不可分的 handle 类并入器械主体类或直接忽略,对齐官方忽略规则。
  2. 进阶方法:只在中粒度任务(Task 2 的 Cannula 等合并类)上报告器械指标;逐类报告时对透明类单独说明。
  3. SOTA 方法:引入相位先验或上下文信息辅助(如 SURGIVID 预印本用阶段分割作多任务监督提升器械定位),但需注明透明类边界本身不可靠。
    参考:官方论文 Task 3 结果表(arXiv 1906.11586)。

⚠️ 坑点 5:三级分辨率链上的掩码错位(分类:预处理陷阱)

问题:数据存在 1920×1080(源视频)→ 960×540(标注分辨率)→ 270×480(官方基准输入)三级分辨率;对掩码使用双线性等平滑插值会产生非整数的"中间类别",训练静默劣化。
症状:训练损失不收敛或 mIoU 无故偏低;掩码可视化出现窄条混合色带;按 RGB 调色板读掩码时类 ID 偏移。
解决

  1. 简单方法:图像用 Image.BILINEAR、掩码一律 Image.NEAREST;先 np.unique 检查掩码值域是否落在官方 ID 表内。
  2. 进阶方法:把对齐校验写进 Dataset(assert mask.shape == img.size[::-1];首帧抽样可视化叠加图);掩码值域不在映射表内时报错而非静默忽略。
  3. SOTA 方法:训练管线固定随机种子做 resize 复现测试,并把插值方式写入实验配置,保证多卡训练与离线评估一致。
    参考:官方基准设置(270×480,arXiv 1906.11586)。

⚠️ 坑点 6:拿 36 类全量直接训练,混淆"标注体系"与"官方任务"(分类:标签理解)

问题:36 类是完整标注体系,但官方基准任务是 8/17/25 三档;部分类(suture needle、needle holder、vitrectomy handpiece、marker、cotton、iris hooks、Mendez ring)仅出现在训练集视频,Task 2/3 训练时官方明确忽略。
症状:全量 36 类直训时稀有类/仅训练集类拖垮 mIoU 与评估矩阵形状;与论文数字对不上却找不到原因。
解决

  1. 简单方法:按官方任务定义构建映射表(8/17/25 类),其余原始 ID 设为 ignore_index。
  2. 进阶方法:先统计类 × 视频共现矩阵,自行定义任务时排除非全集出现的类;评估矩阵列数与映射表严格一致。
  3. SOTA 方法:多任务头共享骨干(8/17/25 类三头并行),一次训练服务三档口径。
    参考:官方论文 Experiment I-III 与忽略规则(arXiv 1906.11586)。

⚠️ 坑点 7:mIoU 计算对 ignore 类与缺席类处理不一致(分类:评估误用)

问题:mIoU 有两种口径——对所有 36 类求均值(缺席类记 0)与只对测试集中实际出现的类求均值;ignore_index 像素是否计入分母也各库不同。口径不一致时数字不可比。
症状:同一模型复现值与论文差数个点;两篇论文"都报 mIoU"却差出 10 个点,无法判断谁更好。
解决

  1. 简单方法:固定采用官方口径——在官方任务定义的类别集合上求均值,ignore 像素从交集与并集中同时剔除;报告时写明。
  2. 进阶方法:同时报告 mIoU、逐类 IoU 与像素精度(官方论文同时给 PA),并注明类别集合(8/17/25)与是否启用黑名单。
  3. SOTA 方法:发布评测脚本(如 Pissas 仓库的评估代码)作为唯一口径,避免各人手写。
    参考:官方论文评估协议;Pissas et al., MICCAI 2021

⚠️ 坑点 8:CATARACTS 帧级工具标注与 CaDIS 像素标注两套体系混用(分类:工程陷阱)

问题:母数据集 CATARACTS 提供 21 类"帧级器械使用"标注(工具接触眼球才算使用),CaDIS 提供 36 类像素掩码;两者类别数、粒度、语义(使用中 vs 可见)都不同。
症状:把 CATARACTS 的 CSV 时间戳当像素标签用(或反之),训练/评估脚本报维度或类别不匹配;把"可见"当"使用中"评估阶段识别任务导致虚低指标。
解决

  1. 简单方法:两条数据通路物理隔离——CaDIS 只喂分割模型,CATARACTS 帧级标注只用于阶段/使用分析;对应关系在配置文件中显式声明。
  2. 进阶方法:构建"CATARACTS 工具名 → CaDIS 类"的对齐表(注意 CATARACTS 21 类无手柄细分),用 CaDIS 分割输出聚合的帧级出现率去预测 CATARACTS 使用标注做任务对齐验证。
  3. SOTA 方法:多任务学习框架同时消费两种监督(分割 + 帧级存在),利用弱标注扩大训练信号。
    参考CATARACTS 挑战赛说明(使用定义:工具接触眼球);CaDIS 论文类别体系章节。

§6.6 数据增强

增强 安全性 说明
水平翻转 ✅ 安全 显微视野左右基本对称(注意:若任务含左右手器械语义需保留镜像合理性)
颜色抖动 / 亮度对比度 ✅ 安全 模拟显微镜光照与白平衡漂移;SOTA 配置即含 ColorJitter
高斯模糊 / 轻微噪声 ✅ 安全 模拟离焦与录像压缩;SOTA 配置即含 GaussianBlur
小角度旋转(≤10°)+ 平移 ✅ 安全 需图像与掩码同参数插值(掩码最近邻)
垂直翻转 / 大角度旋转 ❌ 危险 破坏眼位与切口位置的先验(切口通常位于视野上方),方向先验被抹掉
大幅色调映射(如反色、通道交换) ❌ 危险 组织/器械的颜色语义(虹膜色泽、反光特征)被破坏
随机擦除 / CutOut 大面积 ⚠️ 谨慎 可能抹掉唯一的稀有器械像素,加剧长尾;如用需限制面积与频次

SOTA 参考:Pissas 等的原始增强为 Pad、Flip、GaussianBlur、ColorJitter 顺序组合;有课程项目用 TrivialAugment 替换并报告可比或更优结果(congyoua/Cataract-surgery-segmentation)。

# 复现 SOTA 增强组合(图像/掩码同步;掩码只做几何类增强且用最近邻)
import random
from torchvision import transforms as T

img_tf = T.Compose([
    T.Pad(padding=16, padding_mode="reflect"),
    T.RandomHorizontalFlip(p=0.5),
    T.GaussianBlur(kernel_size=3, sigma=(0.1, 1.5)),
    T.ColorJitter(brightness=0.2, contrast=0.2, saturation=0.2, hue=0.02),
])
# 同步翻转示例(生产建议改用 albumentations 一次调度、双端同步):
def flip_pair(img, msk, p=0.5):
    if random.random() < p:
        img, msk = img.transpose(Image.FLIP_LEFT_RIGHT), \
                   msk.transpose(Image.FLIP_LEFT_RIGHT)
    return img, msk
# 禁用清单(见上表):垂直翻转、通道交换、大面积随机擦除

§6.7 模型推荐

下表汇总官方四模型与社区 SOTA 的三任务表现;选型时先读表后注释中的口径提醒,再读表后的决策路径。

模型 三任务表现 特点 适用建议
UNet Task1 测试 mIoU 83.65;解剖类 >85,器械差 快、省显存 快速原型与解剖分割
DeepLabV3+ Task1 82.62 / Task2 72.26 / Task3 63.23(官方口径) 经典 ASPP 结构 基线对照
HRNetV2 Task1 84.91 / Task2 76.11(官方最佳之一) 多分辨率特征,边界准 官方口径首选基线
UPerNet Task3 66.76(官方口径最佳) 细粒度分类好 Task 3 粗基线
OCRNet (ResNet-50) + Lovász + RF Task1 86.40 / Task2 79.40 / Task3 71.94(社区 SOTA 口径) 注意力上下文 + 不平衡应对 刷榜与论文对比
Mask2Former(Swin 骨干) Task2 约 80.5(预印本口径) Transformer 查询式分割 探索性研究;注意口径差异

数字来源:官方四模型为 Grammatikopoulou et al., MedIA 2021(270×480 输入、CE 损失);OCRNet 与 Mask2Former 见 §8.1。各口径分辨率/损失/过滤不同,禁止直接横比(见坑点 7)。

选型决策路径:以"复现 SOTA 发论文"为目标 → OCRNet(ResNet-50) + Lovász + RF,直接跑 Pissas 仓库配置;以"工程落地"为目标 → HRNetV2 起步(官方口径最强且结构成熟),用 §6.3 预处理管线自行实现;以"方法创新"为目标 → Mask2Former/SegFormer 探索 + 自建统一评测,注意与历史口径的换算说明;以"解剖结构分析"为主(不重器械细分类)→ Task 1 配 UNet 即可拿到 >83 mIoU 的可用模型。

§6.8 硬件需求

场景 配置 依据
官方基线训练 2 × GTX 1080 Ti(11 GB),270×480 输入,100 epochs 官方论文实验设置
SOTA(OCRNet + RF)训练 单张 24 GB 级 GPU 足够(batch 适度下调) PyTorch 1.7 + CUDA 10.0 环境(Pissas 仓库)
Transformer 探索 单张 RTX 3090 24 GB(预印本 SURGIVID 实验) arXiv 2409.07801
推理 8 GB 级消费 GPU 或 CPU(慢) 270×480 输入量级

配置建议:数据加载通常是瓶颈而非算力——960×540 的 PNG 在线解码会拖慢小 GPU 的吞吐, DataLoader 的 num_workers 开到 4-8 并启用 pin_memory;若仍不满载,考虑把掩码映射后的结果缓存为 .npy。多年期项目建议把"数据准备"与"训练"拆成两个容器镜像,避免环境耦合。

§6.9 评估指标代码

指标实现的核心是把 mIoU 的口径(类集合、ignore 处理)固化成代码而非口头约定,以下实现同时输出官方口径与 present-only 口径:

import numpy as np
import torch

def confusion_matrix(pred: torch.Tensor, target: torch.Tensor,
                     num_classes: int, ignore_index: int = 255) -> np.ndarray:
    """逐批累计混淆矩阵;ignore 像素同时从预测与真值侧剔除(坑点 7 的统一口径)。"""
    valid = target != ignore_index
    p, t = pred[valid], target[valid]
    cm = np.bincount((t * num_classes + p).cpu().numpy(),
                     minlength=num_classes ** 2)
    return cm.reshape(num_classes, num_classes).astype(np.int64)

def miou_from_cm(cm: np.ndarray, present_only: bool = False):
    tp = np.diag(cm).astype(np.float64)
    fp, fn = cm.sum(0) - tp, cm.sum(1) - tp
    denom = tp + fp + fn
    iou = np.where(denom > 0, tp / np.maximum(denom, 1), np.nan)
    if present_only:                       # 只对测试集实际出现的类求均值
        return np.nanmean(iou[denom > 0])
    return np.nanmean(iou)                 # 官方口径:定义内类全参与(缺席为 0)
    # 同时报告 pixel accuracy:
    # pa = tp.sum() / cm.sum()

# 用法(Task 1,8 类 + ignore):
# cm = np.zeros((8, 8), np.int64)
# for x, y in val_dl:
#     logits = model(x.cuda()); pred = logits.argmax(1).cpu()
#     cm += confusion_matrix(pred, y, num_classes=8)
# print("mIoU:", miou_from_cm(cm), "| mIoU(present):", miou_from_cm(cm, True))

def per_class_report(cm: np.ndarray, class_names: list):
    """逐类 IoU 报告:稀有类单独列出的习惯能救你一命(见坑点 3、7)。"""
    tp = np.diag(cm).astype(np.float64)
    denom = tp + (cm.sum(0) - tp) + (cm.sum(1) - tp)
    iou = np.where(denom > 0, tp / np.maximum(denom, 1), np.nan)
    rows = [(n, None if np.isnan(v) else round(v * 100, 2))
            for n, v in zip(class_names, iou)]
    print(f"{'class':<20} IoU")
    for n, v in rows:
        print(f"{n:<20} {v if v is not None else 'absent'}")
    print(f"mIoU(all): {np.nanmean(iou)*100:.2f} | "
          f"mIoU(present): {np.nanmean(iou[denom > 0])*100:.2f}")
    return rows

§6.10 MLOps 笔记

  1. 配置即契约:任务定义(类映射表)、分辨率、插值方式、黑名单开关全部写入实验配置文件,杜绝"代码里硬编码 36 类、论文里写 25 类"式错位。
  2. 黑名单版本化data.csv 黑名单与 relabelled 掩码作为独立数据版本入库(如 DVC),对比实验必须声明是否启用。
  3. 数据单元意识:所有评估聚合以视频为单元;监控指标(逐类 IoU 时间序列)按任务类别集合固定形状,稀有类单独告警。
  4. 口径不可漂移:线上/评测脚本与论文口径共用一个评估模块;mIoU 计算口径变更需走版本评审。
  5. 复现锚点:记录 PyTorch/CUDA 版本(SOTA 参考环境 PyTorch 1.7 + CUDA 10.0)、随机种子、GPU 型号;官方基线可作回归测试的对照值(Task1 HRNetV2 84.91)。
  6. 稀有类监控:训练看板上对像素占比 <0.1% 的类单独画 IoU 曲线;它们崩溃时总 mIoU 几乎不动,不做单独监控就发现不了。
  7. 数据血缘记录:每个 checkpoint 记录训练数据的版本指纹(黑名单是否启用、类映射表哈希、分辨率配置),保证三个月后还能回答"这个模型是用什么训的"。
  8. 许可留痕:数据获取日期、来源页面快照、官方条款文本一并归档,商业转化评审时这些材料是必需品。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解建议
单中心偏倚 全部视频来自法国布雷斯特大学医院一家机构 部署前必须外部验证(§5.5)
设备单一偏倚 仅 OPMI Lumera T 显微镜 + Toshiba 180I 相机一种成像链 跨设备数据增强;新设备上微调
术者集中偏倚 48/50 台由同一位专家完成 技能泛化类任务慎用;与其他术者数据联合训练
性别不平衡 女 38 / 男 12 报告分层指标;公平性分析(§7.5)
阶段分层采样偏倚 每阶段最多 20 帧的采样使罕见阶段被过采样、高频阶段欠采样 用作分类先验时重新加权至自然时长分布
类别长尾偏倚 帧级器械占比跨三个数量级 Lovász + 重采样(坑点 3)
标注噪声 后续独立工作发现显著错标帧 启用黑名单与重标注(坑点 2)
术式单一偏倚 全部为超声乳化术式,不含 MSICS 等其他术式 不宜外推至其他白内障术式
病例谱偏倚 以常规病例为主,并发症场景覆盖有限 风险预警类应用需补充并发症数据

偏倚的交互效应:上表各项并非独立——术者集中放大了病例谱偏倚(单一专家的常规病例),设备单一与单中心叠加使"表面轻微"的分布差异在实际部署中被放大。做风险评级时建议按最不利组合(新医院 + 新设备 + 新术者)估计,而不是逐项相加。

§7.2 标注质量

正面证据:专职内部团队标注、可随时咨询临床专业人员、类别体系沿用经挑战赛检验的 CATARACTS 分类、发布团队自称"发布时外科数据中标注质量最高"(arXiv 1906.11586)。风险证据:像素级标注者间一致性(IAA)未公布;独立复现团队发现显著错标帧并公开黑名单(data.csv)与 40 张重标注掩码(Pissas et al., MICCAI 2021 仓库)。母数据集的帧级标注裁定后 kappa 0.630-0.998 提示:器械可见性差的类(needle holder、Troutman forceps)标注难度天然更高,像素级任务可类比推断。结论:CaDIS 质量在同代外科数据集中属第一梯队,但不是零噪声基准;对比实验务必声明黑名单口径。

给使用者的标注质量尽调流程(在自己项目立项时执行一次):抽 50 帧做人工目检(重点看透明器械与手柄边界);跑一次 Pissas 强基线模型,收集 IoU 最低的 20 帧复核是模型弱还是标注错;把复核结论写成 1 页备忘录随项目存档。这套流程成本半天,能避免把标注噪声当成模型缺陷反复调参。

§7.3 泛化性

目标场景 失效风险 证据
其他医院、同型号设备 中-高:术式细节与耗材组合可能不同 单中心、单术者集中(§7.1)
其他品牌显微镜/相机 高:色彩科学、光照、分辨率不同 官方仅 Zeiss 链路数据;无跨设备样本
其他白内障术式(如 MSICS) 高:器械组合完全不同 数据全部为超声乳化术式(IOVS 综述同口径)
术中并发症场景 高:50 台手术以常规病例为主 术者构成(专家 48 台)与并发症覆盖不足的推断
跨术式迁移(腹腔镜等) 高:解剖与器械域差距大 Cholec80/EndoVis 域差距为公认事实
特殊人群(儿童白内障等) 高:队列全部为成人(23-83 岁) 队列描述无儿童病例
复杂/并发症病例 高:术者构成提示以常规病例为主 48/50 台由同一专家完成的推断

泛化性的总体判断:CaDIS 训练的模型在其内部基准上的数字(mIoU 80+ 量级)代表"分布内能力天花板",不代表跨机构临床可用性。两类证据的混淆是手术 AI 论文最常见的过度声明,审稿与立项评审时建议把本表当作核对清单使用。

§7.4 伦理

全部患者签署知情同意(CATARACTS 数据页);影像为眼部手术视野,面部不进入画面;CaDIS 分发包仅含图像与掩码,不含患者标识、日期或自由文本。数据的二次发布与衍生研究应遵守发布机构条款并注明来源许可限制(论文 CC BY-NC-ND 4.0 适用于论文文本;数据集条款以官方渠道为准)。

再分发的合规边界建议:像素掩码属于衍生数据,基于其训练的模型权重、开源的预处理脚本一般不落入 ND 条款约束(条款本身针对论文文本),但直接整包转发数据文件给第三方时,应引导对方从官方渠道获取而非自行转传——这既是许可礼节,也保证对方拿到的是带完整说明的最新版本。涉及医学影像的机构落地时,还需叠加所在司法辖区对患者数据的本地法规评估(如欧盟场景下的 GDPR 评估),此类评估超出数据集自身条款范围,应由机构合规部门执行。

§7.5 公平性

队列性别(38 女/12 男)与年龄(23-83 岁)分布不平衡,且无种族信息可查——无法开展亚组性能审计。对公平性敏感的应用(不同人群的手术质量监测),建议:报告模型在性别亚组上的分割指标差异;并在文档中明确"该模型未见证据支持跨人群等性能"。用合成或迁移数据扩充人群覆盖时,须防止合成偏倚叠加。

实操层面:CaDIS 不提供个体级性别/年龄字段(见 §2.4),因此数据集内部的公平性分析只能到"队列描述"粒度。若你的产品必须做亚组审计,可行的路径是在自有临床数据上复刻 CaDIS 的类别体系做评测集,把 CaDIS 的角色限定为"预训练与管线验证"。这一定位在项目立项时就写进文档,可以避免后期被质询"为什么公开数据集上没有公平性数字"。

§7.6 数据漂移

从部署视角看,CaDIS 的数据距离今天已有十年:这十年间显微手术平台经历了高清化(1080p→4K)、数字化(CCD→CMOS 传感器)与部分飞秒激光辅助的术式变化,图像分布的漂移是确定的,不确定的只是幅度。

数据采集于 2015 年。此后手术设备(显微镜、超乳平台)与耗材持续迭代,4K 显微镜与数字目镜逐渐普及,色彩与清晰度分布已发生变化;白内障手术本身的技术(如飞秒激光辅助)也在改变器械组合。用 2015 年分布训练的模型部署到 2020 年代手术室前,应做渐进式漂移监控(输入图像统计监控 + 逐类 IoU 定期回测),漂移触发阈值后再训练需重新过审标注管线。

漂移信号 监控指标 触发建议
输入分布漂移 亮度/直方图统计与训练集分布的偏移量 偏移超训练集分布 95% 分位即预警
色彩风格漂移 通道均值-协方差距离(新设备/新白平衡) 更换成像设备后必须重测
类别先验漂移 逐类预测频率 vs 训练集先验 稀有类预测频率翻倍/归零即告警
性能漂移 定期小规模人工标注集上的逐类 IoU mIoU 下降超 3 个点触发再训练评审

§7.7 DAIMS 数据集质量评估

# 检查项 状态 说明
1 宽格式/结构自描述 图像+掩码一一对应,目录即划分,结构直观
2 唯一标识 帧文件名全局唯一,可回溯源视频
3 特殊字符处理 命名为常规 ASCII,跨平台无编码风险
4 重复行/重复帧 ⚠️ 帧间无声明去重;间隔 ≥3 秒降低但不消除视觉近重复
5 缺失值编码 逐像素全覆盖,无缺失概念
6 标签标识清晰 官方发布 36 类 ID→类名映射表
7 罕见类分组 官方 8/17/25 三档任务即官方提供的稀有类归并方案
8 偏倚评估 ⚠️ 数据集自身无偏倚声明;本页 §7.1 独立补全
9 数据字典 ⚠️ 官方提供类表但无正式字段级数据字典;见本页 §4.1
10 信息性缺失解释 仅训练集出现的类别在官方任务中被显式忽略并说明
11 设备记录 显微镜/相机/录制器型号完整公开
12 共线性检查 无表格型特征,不适用;图像数据无共线性问题
13 编码映射 类 ID 映射表公开;需注意调色板读取(坑点 5)
14 时间戳处理 ⚠️ 帧采样时刻未随包发布;可由采样协议近似还原
15 划分建议 官方三分 + 防泄漏说明明确
16 泄漏讨论 官方论文明确按视频划分避免同视频帧跨集合
17 标签分布 ⚠️ 官方未公布逐类像素统计;长尾由任务设计侧写
18 测量偏倚 成像链参数公开,测量条件可复述
19 外部验证建议 官方未提供,本页 §5.5 给出三条可行路径
20 版本记录 ⚠️ arXiv 七个版本可查,但数据包本身无正式版本号/更新日志
21 预处理脚本 ⚠️ 官方未发布预处理代码;社区(RViMLab、本页 §6.3)补全
22 合规要求 ⚠️ 知情同意与来源公开,但数据集许可条款未单独声明
23 多模态对齐 图像-掩码-(可选)母视频三层对齐关系清晰
24 去标识化 画面为手术视野,无面部/身份信息;包内无患者元数据

DAIMS 评分:17.5 / 24

评分解读:CaDIS 在"结构自描述、防泄漏设计、设备溯源、去标识化"等数据本体维度表现优秀,这正是其作为顶刊发布数据集的基本盘;扣分集中在"官方未提供"的项目——逐类统计、正式数据字典、预处理脚本、版本号与许可条款。这些缺口不损害数据本身的价值,但把工程化成本转嫁给了使用者。

对你意味着什么:(1) 可以放心把它当分割基准用,但请在实验配置中固化类映射与黑名单口径;(2) 预算一个"补官方缺"的工程日——跑逐类直方图、核对调色板映射、接入 Pissas 黑名单,工作量约一天;(3) 论文对比时只与"同任务、同划分、同过滤口径"的数字比;(4) 如果你的项目要求正式 DUA/许可背书,先联系发布方确认条款再立项;(5) 把 §7.8 的外部验证空白写入项目风险登记册,避免在结题/发表阶段被动。

§7.8 外部验证矩阵

截至 2026-09,未检索到以 CaDIS 为训练数据、在外部中心数据上完成的同行评审验证研究。已发表的 CaDIS 相关性能数字均在数据集内部划分上取得(见 §8.1)。这意味着:

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
(暂无已发表的 CaDIS 外部验证研究——此空白本身是立项时的关键风险项) 建议首个验证场景:跨显微镜品牌的器械分割(见 §5.5)

使用建议:任何宣称"可跨院部署"的 CaDIS 模型都必须补做 §5.5 列出的三类外部验证之一;引用本数据集论文的结论时,应表述为"在 CaDIS 内部基准上"而非泛化的临床性能。


§8 基准性能与生态

§8.1 排行榜

CaDIS 没有官方维护的排行榜,下表收录官方基线与同行评审 SOTA 的可考数字;社区预印本结果仅在 §8.2 提及。

排名 模型 任务与性能(测试集 mIoU) 年份 关键技术 完整引用 代码
1 OCRNet (ResNet-50) Task1 86.40 / Task2 79.40 / Task3 71.94 2021 Lovász-Softmax + repeat factor sampling Pissas T, Ravasio CS, Da Cruz L, Bergeles C. Effective Semantic Segmentation in Cataract Surgery: What Matters Most? MICCAI 2021, LNCS 12903, pp. 509-518. DOI 10.1007/978-3-030-87202-1_49 RViMLab 仓库
2 HRNetV2 Task1 84.91(Task2 76.11) 2021 多分辨率表征,官方基线最佳 Grammatikopoulou M, Flouty E, Kadkhodamohammadi A, Quellec G, Chow A, Nehme J, Luengo I, Stoyanov D. CaDIS: Cataract dataset for surgical RGB-image segmentation. Medical Image Analysis 71:102053, 2021. DOI 10.1016/j.media.2021.102053 官方论文报告
3 UPerNet Task3 66.76(官方口径最佳) 2021 金字塔池化多尺度聚合 同上(MedIA 2021) 官方论文报告
4 DeepLabV3+ / UNet Task1 82.62 / 83.65 2021 官方基线 同上(MedIA 2021) 官方论文报告

数值不可直接比较声明:上表混合了两种口径——官方基线(270×480 输入、交叉熵损失、无黑名单)与 Pissas 口径(Lovász + 重采样;论文部分结果在黑名单过滤版数据上报告)。两口径在输入分辨率、损失函数、数据过滤上均不同,任何跨行比较都需回到原文设置;这也是本页评估代码(§6.9)固定口径的原因。

补充参考点(同口径内部对照,Pissas 论文表 3,Task 2):DeepLabV3+(CE)约 85.3、UPerNet(CE)约 87.9、HRNetv2(CE)约 88.1,而换用 Lovász + RF 后的 OCRNet 达 88.9(验证/测试集,原文表 3)——同一研究内部的受控对比,清晰呈现了"损失与采样带来的增益超过换架构"这一结论。

§8.2 SOTA 总结与选型建议

CaDIS 上的方法学结论已经比较收敛:损失与采样策略 > 架构选择。Pissas 等的系统消融显示 ResNet34→ResNet50→WideResNet101 的骨干升级几乎无收益,而 Lovász-Softmax 加 repeat factor sampling 带来决定性提升,尤其体现在最稀有类。选型建议:追求复现与对比公平性用 OCRNet+Lovász+RF 配置(有公开权重);追求工程简洁从 HRNetV2 或 DeepLabV3+ 起步;探索性研究可尝试 Mask2Former/SegFormer(预印本已示 Task2 约 80.5 的潜力),但需自建口径。

与同类基准的方法学差异:CaDIS 的长尾比腹腔镜分割基准(如 CholecSeg8k 的 13 类)更极端,因为白内障器械之间的视觉相似度更高(多款套管/镊子仅尖端形状不同),跨基准迁移方法结论时要重新验证;其次,CaDIS 的官方三档任务设计让"粗粒度到细粒度"的对比实验不需要重新标注,这在其他数据集上通常做不到——充分利用这一点可以做成本很低的粒度消融研究。

§8.3 评测协议

标准协议:官方 train/val/test 三分(§3.2);任务定义取官方 8/17/25 三档之一;输入 270×480(社区亦用 540×960,需声明);指标 mIoU(附逐类 IoU 与像素精度);ignore 像素同时从分子分母剔除;黑名单/重标注作为独立声明项。测试集仅在最终报告时使用一次,模型选择与超参搜索只允许在 val 上进行。

报告自查清单(投稿/内部评审前逐项勾选):

  1. 任务口径:8/17/25 哪一档,类映射表是否随论文公开;
  2. 数据口径:是否启用 blacklist / relabelled;
  3. 输入分辨率与插值方式(图像双线性、掩码最近邻);
  4. 损失函数与采样策略(CE / Lovász / RF 参数 t 值);
  5. mIoU 口径:缺席类是否计 0、ignore 处理方式;
  6. 随机种子与运行次数(建议 3 次取均值±标准差)。
数据集 术式/模态 标注 适用互补场景
CATARACTS 白内障显微视频 50 段 帧级 21 类工具使用、阶段 视频级弱监督、阶段识别
Cholec80 腹腔镜 80 段 帧级器械 + 7 阶段 阶段识别跨术式迁移
Cholec120 腹腔镜手术视频 帧级器械/阶段(同门系列数据集) CaDIS 官方论文引述的同类资源
CholecSeg8k 腹腔镜 8,080 帧 像素级 13 类 分割方法跨术式对照
EndoVis 器械分割子挑战 腹腔镜帧 像素级(按届) 小样本分割对照
101-Cataract 白内障 101 段(奥地利) 阶段标注 多术者阶段泛化(IOVS 综述收录)

互补使用提示:与 CATARACTS 联用时按"像素级训练 + 帧级验证"分工;与 CholecSeg8k 联用时重点考察同一模型在两种术式间的零样本迁移差距,该差距本身就是有发表价值的域泛化证据。

§8.5 关键论文 Top 7

  1. Grammatikopoulou M, Flouty E, Kadkhodamohammadi A, Quellec G, Chow A, Nehme J, Luengo I, Stoyanov D. CaDIS: Cataract dataset for surgical RGB-image segmentation. Medical Image Analysis 71:102053, 2021. DOI 10.1016/j.media.2021.102053 — 数据集正式论文:划分、三任务与四模型基线。
  2. Grammatikopoulou M, et al. CaDIS: Cataract Dataset for Image Segmentation. arXiv:1906.11586(v1 2019-06-27,v7 2022-02-22)— 预印本与版本历史。
  3. Al Hajj H, Lamard M, Conze P-H, Cochener B, Quellec G. CATARACTS: Challenge on automatic tool annotation for cataRACT surgery. Medical Image Analysis 52:24-41, 2019 — 母数据集与 21 类帧级标注体系。
  4. Pissas T, Ravasio CS, Da Cruz L, Bergeles C. Effective Semantic Segmentation in Cataract Surgery: What Matters Most? MICCAI 2021, LNCS 12903, pp. 509-518. DOI 10.1007/978-3-030-87202-1_49 — SOTA 与不平衡方法学结论;黑名单与重标注来源。
  5. Quellec G, Al Hajj H, Lamard M, et al. Monitoring Tool Usage in Surgery Videos using Boosted Convolutional and Recurrent Neural Networks. Medical Image Analysis, 2018(arXiv 1710.01559)— CATARACTS 工具占比与标注 kappa 的权威数字。
  6. Artificial Intelligence in Cataract Surgery: A Systematic Review. Investigative Ophthalmology & Visual Science(作者与卷期见原文)— CaDIS 在白内障 AI 全景中的定位与数据集对比。
  7. Koksal C, Ghazaei G, Navab N. SURGIVID: Annotation-Efficient Surgical Video Object Discovery. arXiv:2409.07801, 2024 — 以 CaDIS Task2 为基准的弱监督/无监督探索(预印本,结论尚待同行评审)。
  8. CATARACTS 数据集 IEEE DataPort 条目(DOI 10.21227/ac97-8m18,条目页)— 母数据集的正式引用入口与分发记录。

阅读建议:第 1、4、5 条构成"数据—母数据集—方法学"的铁三角,任何基于 CaDIS 的新工作至少应同时引用这三篇;第 7 条仅在对标弱监督方法时引用,并在文中明确标注其预印本身份。

§8.6 社区活跃度

CaDIS 无官方维护的排行榜与论坛,生态以论文复现仓库为主:RViMLab 的 MICCAI 2021 仓库(14 次提交,提供权重与黑名单,最后更新 2021 年);多伦多大学 CSC490 课程项目仓库(2022 年 12 月最后提交,提供 SegFormer 复现);grand-challenge 平台托管官方页面与论文链接。社区问题主要通过 GitHub issue 与论文邮件联系解决。选型时请把"无官方社区支持"纳入工程风险评估。

两点生态观察:其一,CaDIS 的引用与讨论多作为"分割基准之一"出现在手术场景理解论文中,围绕它形成的方法学记忆(Lovász + RF 配方)主要由 Pissas 等的仓库承载,因此该仓库事实上是生态的第二中枢;其二,官方页面的下载入口经历过长期维护状态,社区对"哪里能下到数据"的问答散落在 GitHub issue 与论坛中,新用户应预留数据获取的沟通时间。

§8.7 生态快照

资源 类型 链接 更新情况(截至 2026-09) 推荐理由
官方 CaDIS 页面 数据/文档 cataracts.grand-challenge.org/CaDIS 长期在线;下载入口曾有维护标注 类 ID 表与官方数字的第一来源
MICCAI2021 仓库(RViMLab) 代码+权重 github.com/RViMLab/MICCAI2021_Cataract_semantic_segmentation 14 commits,2021 年 SOTA 复现、黑名单、重标注掩码
CSC490 课程项目(congyoua) 代码 github.com/congyoua/Cataract-surgery-segmentation 最后提交 2022-12-08 SegFormer/TrivialAugment 复现参考
CATARACTS @ IEEE DataPort 母数据集 ieee-dataport.org(DOI 10.21227/ac97-8m18) 注册可下载,117.8 GB 完整视频与帧级标注
arXiv 1906.11586 论文 arxiv.org/abs/1906.11586 v7,2022-02-22 数据集论文版本历史
HAL 论文存档 论文 hal.archives-ouvertes.fr/hal-05288100 2025-09 入库 MedIA 正式版的开放获取镜像

使用顺序建议:新用户按"官方页面(了解数据与类表)→ 下载核对(§6.2 清单)→ RViMLab 仓库(跑通基线)→ MedIA/Pissas 论文(对齐口径)"的顺序介入,可以避开生态中最常见的两个弯路——下载链接时效问题与口径对不齐问题。


§9 相关资源与引用

§9.1 官方资源清单

下表按"先看什么"排序:官方页面与下载入口解决"从哪拿",论文与存档解决"怎么引",仓库解决"怎么跑"。

资源 链接 说明
官方数据集页面 cataracts.grand-challenge.org/CaDIS/ 规模、36 类 ID 表、划分与论文链接
官方公开下载页 cataracts-semantic-segmentation2020.grand-challenge.org 论文中公布的公开地址
CATARACTS 母数据集 cataracts.grand-challenge.org/Data/ 队列描述、设备、标注协议
CATARACTS @ IEEE DataPort DOI 10.21227/ac97-8m18 视频与帧级标注注册下载
SOTA 复现仓库 RViMLab/MICCAI2021_Cataract_semantic_segmentation 代码、权重、黑名单、重标注
数据集论文预印本 arXiv 1906.11586 七个版本完整历史
正式发表论文 doi.org/10.1016/j.media.2021.102053 MedIA 71:102053,CC BY-NC-ND 4.0

§9.2 BibTeX 引用

@article{grammatikopoulou2021cadis,
  title   = {CaDIS: Cataract dataset for surgical RGB-image segmentation},
  author  = {Grammatikopoulou, Maria and Flouty, Evangello and
             Kadkhodamohammadi, Abdolrahim and Quellec, Gwenol{\'e} and
             Chow, Andre and Nehme, Jean and Luengo, Imanol and
             Stoyanov, Danail},
  journal = {Medical Image Analysis},
  volume  = {71},
  pages   = {102053},
  year    = {2021},
  doi     = {10.1016/j.media.2021.102053}
}

@article{alhajj2019cataracts,
  title   = {CATARACTS: Challenge on automatic tool annotation for cataRACT surgery},
  author  = {Al Hajj, Hassan and Lamard, Mathieu and Conze, Pierre-Henri and
             Cochener, B{\'e}atrice and Quellec, Gwenol{\'e}},
  journal = {Medical Image Analysis},
  volume  = {52},
  pages   = {24--41},
  year    = {2019}
}

@inproceedings{pissas2021effective,
  title     = {Effective Semantic Segmentation in Cataract Surgery: What Matters Most?},
  author    = {Pissas, Theodoros and Ravasio, Claudio S. and
               Da Cruz, Lyndon and Bergeles, Christos},
  booktitle = {Medical Image Computing and Computer Assisted Intervention -- MICCAI 2021},
  series    = {Lecture Notes in Computer Science},
  volume    = {12903},
  pages     = {509--518},
  year      = {2021},
  doi       = {10.1007/978-3-030-87202-1_49}
}

@misc{grammatikopoulou2019cadis_arxiv,
  title  = {CaDIS: Cataract Dataset for Image Segmentation},
  author = {Grammatikopoulou, Maria and Flouty, Evangello and
            Kadkhodamohammadi, Abdolrahim and Quellec, Gwenol{\'e} and
            Chow, Andre and Nehme, Jean and Luengo, Imanol and Stoyanov, Danail},
  year   = {2019},
  howpublished = {arXiv:1906.11586},
  note   = {v1 2019-06-27, v7 2022-02-22}
}

@misc{koksal2024surgivid,
  title  = {SURGIVID: Annotation-Efficient Surgical Video Object Discovery},
  author = {Koksal, Ceren and Ghazaei, Ghazaleh and Navab, Nassir},
  year   = {2024},
  howpublished = {arXiv:2409.07801},
  note   = {preprint}
}

格式核对提示:投稿系统对作者名中的变音符号(é、ó)处理不一,提交前确认目标系统的 BibTeX 编码;MedIA 正式版的作者顺序与 arXiv 版一致,但页码/卷号以出版社记录(71:102053)为准。

§9.3 引用指南

使用 CaDIS 数据时:正文引用 MedIA 2021 正式版(第一条 BibTeX);如涉及母视频或帧级工具标注,另引 CATARACTS(第二条);如对比 SOTA 或使用黑名单/重标注,必须引 Pissas 等(第三条)并在实验设置中声明过滤口径。请在发布成果时注明数据来源机构(Digital Surgery Ltd / CATARACTS 挑战赛)并遵守官方渠道的使用条款。

三种典型场景的引用组合:(1) 训练新分割模型 → 引 MedIA 2021 + Pissas 2021(对比线);(2) 做阶段识别/工具使用分析(用到 CATARACTS 标注)→ 引 Al Hajj 2019 + MedIA 2021;(3) 弱监督/无监督方法研究(对标 SURGIVID)→ 引 MedIA 2021 + 所对标论文。审稿人最常质疑的是口径声明缺失,引用之外务必在实验节写明任务档位、黑名单与分辨率三项。


§10 AI 使用声明卡

§10.1 AI 模型列表

环节 模型/工具 版本 用途
初稿生成 fast-model(CodeBuddy 内置模型) fast-model 文章结构组织、正文撰写、代码示例生成
事实检索 WebSearch / WebFetch 平台内置 官方页面、论文摘要、仓库 README 的事实核验

§10.2 AI 参与范围

AI 完成了资料检索汇总、初稿撰写、代码示例起草与格式排版。所有关键数字(规模、划分、基准 mIoU、队列人口学、设备型号、许可信息)均回溯至检索来源并由人工复核;医学背景、偏倚评估结论与使用建议由编辑部分析定稿。AI 不对任何未在来源中出现的信息负责,本页遵循"查不到即省略"纪律。

生成过程中执行的两条硬纪律供读者监督:其一,检索中与既有说法冲突的信息一律以证据为准(例如发布机构所在地以论文署名地址伦敦为准);其二,无法核实的信息直接省略相关字段(如数据包体积、Google Scholar 引用数、官方标注工具名称),不采用估算值冒充事实。若读者发现任何数字与本页来源列表中的原文不符,欢迎通过页面信息反馈。

§10.3 输入来源列表

  1. Grammatikopoulou M, et al. CaDIS: Cataract dataset for surgical RGB-image segmentation. Medical Image Analysis 71:102053, 2021. DOI 10.1016/j.media.2021.102053(PubMed 33864969
  2. Grammatikopoulou M, et al. CaDIS: Cataract Dataset for Image Segmentation. arXiv:1906.11586(v1-v7,v5 全文
  3. CaDIS 官方数据集页面(grand-challenge.org/CaDIS
  4. CATARACTS 官方数据页(grand-challenge.org/Data
  5. CATARACTS @ IEEE DataPort(DOI 10.21227/ac97-8m18,条目页
  6. Al Hajj H, et al. CATARACTS: Challenge on automatic tool annotation for cataRACT surgery. Medical Image Analysis 52:24-41, 2019
  7. Pissas T, et al. Effective Semantic Segmentation in Cataract Surgery: What Matters Most? MICCAI 2021, LNCS 12903:509-518. DOI 10.1007/978-3-030-87202-1_49(arXiv 2108.06119
  8. RViMLab/MICCAI2021_Cataract_semantic_segmentation 官方仓库 README(GitHub
  9. congyoua/Cataract-surgery-segmentation 课程项目仓库 README(GitHub
  10. Quellec G, et al. Monitoring Tool Usage in Surgery Videos. Medical Image Analysis, 2018(arXiv 1710.01559
  11. Artificial Intelligence in Cataract Surgery: A Systematic Review. IOVS(原文
  12. Medtronic 收购 Digital Surgery 报道(HIT Consultant, 2020-02
  13. Koksal C, Ghazaei G, Navab N. SURGIVID. arXiv:2409.07801, 2024(预印本)
  14. UCL Discovery 论文存档页(许可信息,discovery.ucl.ac.uk

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
frontmatter 与 schema_org 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过
§1 概览与对比表 千方病案医学编辑部 与官方页面及 MedIA 论文交叉比对 ✅ 已验证
§2 医学背景(ICD-11/SNOMED 映射、人群) 千方病案医学编辑部 与 CATARACTS 官方数据页交叉比对 ✅ 已验证
§3 数据集规格(规模、格式、设备、溯源) 千方病案医学编辑部 与官方页面、arXiv 论文交叉比对 ✅ 已验证
§4 数据结构与 DAIMS 字段字典 千方病案医学编辑部 逻辑审查 + 官方类表核对 ✅ 已通过
§5 划分与泄漏策略 千方病案医学编辑部 与官方划分说明交叉比对 ✅ 已通过
§5.6 常见误用清单与 §6 代码示例、8 个坑点 千方病案医学编辑部 逻辑审查 + Pissas 仓库说明比对 ✅ 已通过
§7 质量评估与 DAIMS 24 项 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用表述 千方病案医学编辑部 与原文数字逐项比对 ✅ 已验证
§9 BibTeX 与官方资源 千方病案医学编辑部 与 PubMed/DOI 记录核对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0-§1.5 概览、§3.0 版本抉择矩阵、§4.0-§4.5 数据结构、§6.1-§6.4 代码示例、§6.5 八个坑点、§6.6-§6.10 增强与模型建议、§7.7 DAIMS 评估、§8.1-§8.2 基准与选型、§9.2 BibTeX、§C JSON-LD。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核声明一致)

本页所有动态信息(基准数字、下载入口状态、社区仓库活跃度)的核实截止日期同为 2026-09-05;引用本页时请注明核实日期,超过半年的生态类信息建议重新核对后再使用。

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集