信息速览

Hamlyn Datasets — 腹腔镜/内窥镜手术视觉数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Hamlyn Datasets(官方页集合) |
| 英文全称 | Hamlyn Centre Laparoscopic / Endoscopic Video Datasets |
| 别名/简称 | Hamlyn Dataset、Hamlyn Centre Laparoscopic Video Dataset、Hamlyn stereo dataset |
| 疾病分类 | 肾恶性肿瘤相关手术(ICD-11:2C90)/ 缺血性心脏病相关手术(ICD-11:BA41)/ 腹腔探查(详见 §2.1) |
| SNOMED CT | 37214000 Malignant neoplasm of kidney / 414545008 Ischaemic heart disease / 15393008 Laparoscopy(详见 §2.1b) |
| 数据模态 | 单目与立体腹腔镜视频、立体标定参数、部分序列深度参考图(Libelas 自动生成) |
| AI 任务类型 | 单目/立体深度估计、内窥镜 SLAM 与定位、3D 重建、软组织跟踪、跨域评测 |
| 样本总数 | 约 21 段体内手术视频序列(第三方评测描述)+ phantom/验证序列与标定数据 |
| 数据大小 | 官方页未公布总体积;社区衍生 3D 点云版 48.61 GB |
| 数据格式 | 整流版:JPEG 帧对 + PNG 深度图;官方原始版:网页托管的视频压缩包 |
| 许可证 | 官方页声明许可(允许使用与发表,须引用对应论文);社区整流再分发版为 GPL-3.0 |
| 访问级别 | 开放(官方页直接下载,无需注册申请) |
| DUO 标签 | GRU, PUB |
| 语言 | 英文 |
| 首发日期 | 2012(规范引用年份;序列贡献横跨 2005-2017) |
| 最后更新 | 官方页未公布;已知最后一批新序列贡献为 Ye et al. 2017 |
| 发布机构 | 帝国理工学院 Hamlyn Centre(Imperial College London) |
| 官方主页 | http://hamlyn.doc.ic.ac.uk/vision/ |
| 下载地址 | http://hamlyn.doc.ic.ac.uk/vision/(社区整流镜像:https://huggingface.co/datasets/vslamlab/Hamlyn_Rectified_Dataset) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 免费直接获取、整流版结构规整、社区生态成熟;扣分项:无官方划分与评测协议、深度 GT 仅覆盖部分序列且为算法自动生成、无结构化数据字典 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、腹腔镜术式与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(整流版目录结构与深度参考生成机制)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Hamlyn 数据集官方页声明允许使用与发表全部数据(须引用对应论文);社区整流再分发版本另受 GPL-3.0 许可约束。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? Hamlyn Datasets 是英国帝国理工学院 Hamlyn Centre 在网上公开托管的一组腹腔镜/内窥镜手术视频数据集,规范引用为 Giannarou et al., 2012。它汇集了 Stoyanov、Mountney、Lerotic、Pratt、Giannarou、Ye 等团队自 2005 年至 2017 年贡献的体内手术视频序列,涵盖部分肾切除、全内窥镜冠状动脉旁路移植(TECAB)、腹腔探查等术式,同时提供单目与立体(双目)两种成像形态,并附带立体标定参数。
为什么重要? 在内窥镜视觉领域,既真实(人体体内)、又有参考深度、又免费开放的公开数据极其稀缺。Hamlyn Datasets 是这一"三要素"组合里最早、被引用最广泛的系列之一:Stoyanov 与 Pratt 贡献的立体序列带有由 Libelas 立体匹配自动生成的深度参考,使其成为单目/立体深度估计、内窥镜 SLAM、3D 重建与软组织跟踪研究十余年来的经典评测集,Endo-Depth-and-Motion、EndoDAC 等代表性工作都以它作为标准试验场或跨域验证场。
我能用它做什么? 你可以下载整流后的立体帧对训练/评测自监督深度估计模型(如 Endo-Depth、Monodepth2 风格),用它测试你的 SLAM 系统在弱纹理、镜面反射、组织形变场景下的鲁棒性,或者把在其他数据集(如 SCARED)上训练的模型拿到 Hamlyn 上做跨域泛化验证——这正是 EndoDAC(MICCAI 2024)等近期工作给出的标准用法。注意:它没有官方划分与评测平台,深度参考仅覆盖部分序列,用作评测前请先读 §5 与 §6.5 的坑点。
§1.1 摘要
Hamlyn Datasets 的本质是一个"论文序列 + 网页聚合"形态的研究数据集合集:每个序列由一篇同行评审论文定义并随论文一同发布,官方网页将它们集中索引、托管并统一声明使用许可(允许使用与发表,须引用对应论文)。数据形态以体内手术视频为核心——双目立体序列可经立体匹配(官方流程使用 Libelas)生成像素级深度参考,单目序列则服务于跟踪与定位类任务;部分序列附带相机内参/外参与立体标定,供几何方法使用。社区在其之上发展出两个重要再分发形态:Endo-Depth-and-Motion 项目随之发布的整流立体版(rectified01–14,JPEG 帧对 + PNG 深度图,Hugging Face 镜像,GPL-3.0),以及从原始视频重建的 5 类内窥镜 3D 点云数据集(48.61 GB,Xi et al. 2021)。评测生态方面,它没有官方排行榜,但形成了两个稳定惯例:一是"SCARED/其他数据集训练 → Hamlyn 跨域评测"(EndoDAC 路线,覆盖 rectified01–14 共 20 个场景评测,深度按 300 mm 饱和处理);二是"Hamlyn 自训练 → 自评测"(Endo-Depth 路线)。本条目 §6.5 归纳的 8 个坑点(深度 GT 质量上限、长序列裁剪、帧级泄漏、单位与饱和约定等)全部来自公开文献与社区代码的真实记录。
§1.2 战略价值
维度一:历史稀缺性与事实标准地位。 手术视频数据集大多因隐私与伦理限制止步于"申请审核"甚至"竞赛专用",而 Hamlyn Datasets 从建立之初就选择"网页直接开放 + 引用即用"的模式,成为 2010 年代内窥镜视觉研究几乎唯一稳定可得的人体体内立体视频来源。它沉淀出的评测惯例(Libelas 深度参考、rectified 序列编号、深度饱和约定)被后续 SCARED、EndoSlam、SERV-CT 等数据集继承或对照,理解 Hamlyn 的结构与局限,是读懂这一领域所有论文实验设置的先修课。
维度二:跨域评测的"试金石"角色。 由于采集环境、设备与术式与现代机器人手术数据集(如 SCARED)差异显著,Hamlyn 成为检验深度估计模型泛化能力的第一道压力测试:EndoDAC(MICCAI 2024)以 rectified01–14 为跨域评测集,报告 Abs Rel 0.2601、δ 93.64%(截至 2026-09 检索到的公开结果);Depth Anything V2 零样本迁移在该集上 Abs Rel 为 0.4130,显著劣于域内方法——这一"域间隙"本身就是可发表的研究信号。对工程团队而言,在 Hamlyn 上过不了关的深度模型,几乎不可能在真实手术场景中直接可用。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注/参考 | 差异化定位 |
|---|---|---|---|---|
| Hamlyn Datasets | 约 21 段体内视频 + phantom/验证序列 | 单目 + 立体腹腔镜视频 | 立体匹配自动深度参考(部分序列)+ 标定 | 最早开放的人体体内立体手术视频集合,网页直接下载,跨域评测经典 |
| SCARED(EndoVis 子挑战) | 立体内窥镜手术数据 | 立体视频 | 官方子挑战与评测协议 | 有官方评测框架,适合直接对标排名 |
| EndoSlam(Ozyoruk et al., 2020) | 42,700 帧 | 多种内窥镜相机(猪器官离体) | 商业 3D 扫描仪生成的高精度 GT | 面向 6-DoF 位姿估计与稠密 3D 图重建 |
| EndoAbs(Penza et al., 2018) | 120 对立体图像(640×480) | 立体内窥镜(3D 打印 phantom) | 激光扫描参考点云 | 受控 phantom 环境,含烟雾与光照变化 |
| SERV-CT | 公开评测集 | 内窥镜视频 | CT 衍生参考 | 供内窥镜视频与 CT 表面配准评测 |
§1.4 版本与形态时间轴
| 时间 | 形态/事件 | 说明 |
|---|---|---|
| 2005 | Stoyanov et al. 首批序列贡献 | 体内软组织立体深度恢复早期工作(来源) |
| 2008 | Lerotic et al. 序列贡献 | 官方页收录的贡献系列之一 |
| 2010 | Mountney et al. / Pratt et al. / Stoyanov et al. 序列贡献 | Pratt 序列后续成为带深度参考的核心评测子集 |
| 2012 | 规范引用发布 | Giannarou, Stoyanov, Noonan, Mylonas, Clark, Visentini-Scarzanella, Mountney, Yang, “Hamlyn centre laparoscopic / endoscopic video datasets”(引用格式) |
| 2013 / 2017 | Giannarou et al. / Ye et al. 序列贡献 | 官方页收录的最后两批贡献系列 |
| 2021 | 整流立体版 + 3D 点云衍生版 | Endo-Depth-and-Motion 整流版(GPL-3.0,HF 镜像);Xi et al. 5 类点云 48.61 GB(GitHub) |
| 2024 | 跨域评测规范化 | EndoDAC(MICCAI 2024)确立 rectified01–14 跨域评测用法(代码结构) |
§1.5 典型应用场景
- 自监督单目深度估计
- 路线:整流立体对做立体监督(Endo-Depth 式),或时序帧对做光度自监督(Monodepth2 式)。
- 产出:可与 §8.1 统一协议数字(EndoDAC Abs Rel 0.2601 等,截至 2026-09 检索)横向对齐的评测报告。
- 入口:§6.1 快速上手 + §6.4 DataLoader。
- 跨域泛化评测
- 路线:在 SCARED 等数据集上训练,rectified01–14 仅作测试(EndoDAC 路线)。
- 产出:域间隙量化表,作为论文泛化性章节的标准证据。
- 注意:统一 300 mm 饱和与四件套过滤协议,否则数字不可比(坑点 4/7)。
- 内窥镜 SLAM / 视觉里程计
- 路线:利用立体标定做尺度恢复;在形变、反光序列上测试跟踪鲁棒性。
- 产出:轨迹误差与重建完整性分析(参照 Endo-Depth-and-Motion 的光度跟踪设计动机——组织弱纹理使特征点法失效)。
- 3D 表面重建与点云学习
- 路线:直接使用 48.61 GB 社区点云衍生版(5 类场景、每片平均约 100,000 点)做单图点云重建的训练/评测。
- 产出:与 Xi et al. 2021 基线可比的点云质量指标(GitHub)。
- 软组织跟踪与形变建模
- 路线:在 Mountney、Giannarou 等面向组织跟踪算法验证设计的 validation 序列上评测长期跟踪。
- 产出:形变条件下的特征存活率、漂移曲线与运动补偿效果。
§2 医学背景
§2.1 ICD-11 编码映射
Hamlyn Datasets 的序列按术式可分为三大家族。下表给出各术式家族对应的 ICD-11 编码,用于资源归类与检索;临床研究中的表型定义仍应以原始论文的队列协议为准。
| 标签/术式家族 | 典型场景序列 | ICD-11 编码 | ICD-11 中文名称 |
|---|---|---|---|
| 肾部分切除术(partial nephrectomy) | nephrectomy scene 1/2、肾脏场景(来源) | 2C90 | 肾恶性肿瘤(除外肾盂) |
| 全内窥镜冠状动脉旁路移植(TECAB) | Mountney 系列心脏表面场景 | BA41 | 急性透壁性心肌梗死(缺血性心脏病相关编码示例) |
| 腹腔探查(intra-abdominal exploration) | 腹壁(abdomen wall)、肝脏(liver)、子宫角(uterine horn)等场景 | — | 诊断性操作,无单一疾病编码 |
说明:TECAB 的手术适应证为冠脉血运重建,此处以缺血性心脏病代表性编码示意;腹腔探查与 phantom/验证序列不对应特定疾病诊断。
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 肾恶性肿瘤 | 2C90 | 37214000 | Malignant neoplasm of kidney(肾恶性肿瘤) |
| 缺血性心脏病 | BA41 | 414545008 | Ischaemic heart disease(缺血性心脏病) |
| 腹腔镜(操作背景) | — | 15393008 | Laparoscopy(腹腔镜检查) |
| 肾切除术(操作) | — | 81723002 | Nephrectomy(肾切除术) |
§2.2 涉及术式与器官简介
部分肾切除术(partial nephrectomy)
- 临床背景:针对肾脏局灶性肿瘤(临床多为肾细胞癌)的保留肾单位手术,需在有限视野内游离并部分切除肾脏,同时控制出血与热缺血时间。
- 视觉挑战:肾脏及周围脂肪的镜面反射、器械遮挡与 smoke 干扰交替出现,是重建与分割算法的天然压力场景。
- 对应序列:nephrectomy scene 1/2 与肾脏场景(社区点云工作正是从这些序列提取 3D 参考,来源)。
全内窥镜冠状动脉旁路移植(TECAB)
- 临床背景:在跳动心脏表面完成血管吻合的全内窥镜术式,避免开胸,但对术者的视觉反馈要求极高。
- 视觉挑战:心外膜组织随心跳持续大位移形变,表面脂肪与光源运动造成亮度波动,特征点难以长期存活。
- 对应序列:Mountney 系列的心脏表面场景,本身就是为组织跟踪与运动补偿验证设计(综述收录)。
腹腔探查与其他场景
- 临床背景:诊断性腹腔探查与相关操作,视野覆盖腹壁内面、肝脏表面、盆腔器官等。
- 视觉挑战:abdomen wall 的缝合区纹理、uterine horn 与 liver 的光滑浆膜面代表弱纹理表面,检验匹配类算法的下限。
- 对应序列:社区点云工作从 abdomen wall、uterine horn、liver 等场景提取稠密 3D 参考,用于检验准静态条件下的单图重建表现。
§2.3 临床任务定义
| 任务 | 定义 | 在本数据集中的对应 |
|---|---|---|
| 术中深度感知 | 从内窥镜图像恢复术野像素级/区域级深度,用于尺度化场景理解 | 立体序列 + Libelas 深度参考;单目深度估计的评测目标 |
| 软组织跟踪 | 在形变、反光、器械遮挡下长期跟踪组织表面特征 | Mountney/Giannarou 等 validation 序列的设计目标 |
| 3D 重建与 SLAM | 恢复相机 6-DoF 轨迹并融合稠密表面(TSDF/点云/网格) | Endo-Depth-and-Motion 在约 21 段体内视频上验证(来源) |
| 器械-组织关系理解 | 识别器械与组织的空间交互,服务于术中预警 | 原始视频含天然器械遮挡(多篇论文描述的挑战因素) |
| 手术导航 | 将重建表面与术前影像/规划对齐,提供视野外信息 | 需结合标定参数与外部验证集(如 SERV-CT) |
§2.4 患者人群
| 属性 | 情况 |
|---|---|
| 来源 | 人体体内(in vivo)腹腔镜/内窥镜手术视频 + phantom/验证序列(官方定位) |
| 采集/发布机构 | 帝国理工学院 Hamlyn Centre 及其合作团队 |
| 采集时间跨度 | 序列贡献横跨 2005-2017(按贡献论文年份,来源) |
| 年龄/性别分布 | 官方未公布 |
| 种族分布 | 官方未公布 |
| 术式分布 | 部分肾切除、TECAB、腹腔探查等(见 §2.1) |
| 就医类型 | 住院手术(腹腔镜微创术式);phantom 序列无患者 |
§2.5 临床价值
对临床 AI 而言,Hamlyn Datasets 的价值在于提供"真实人体腔内成像"这一不可替代的先验分布。立体标定使像素深度可以换算为毫米级物理量纲(社区常用 300 mm 饱和约定,示例),从而支持术中安全距离判断、器械-组织接近度监测等几何推理任务——这些任务在只有相对深度的数据集上无法闭环。
其软组织形变与镜面反射特性构成手术视觉算法的天然压力测试。模型若仅在合成或离体数据上训练,迁移到 Hamlyn 序列通常出现显著退化(Depth Anything V2 零样本 Abs Rel 0.4130 对比域内 EndoDAC 0.2601,截至 2026-09 检索);这一"域间隙"直接对应临床部署风险——在实验室数据上表现良好的算法,进入真实术野后可能首先在反光与形变处失效。
此外,十余年的评测惯例意味着新方法可以与 Endo-Depth、EndoDAC 等历史基准进行时间轴上的对话:同一个数据集、同一批整流序列、同一套指标定义贯穿 2021 至 2026 年的文献,使技术进步可以被量化描述,而非各说各话。对教学场景,它也是讲解"立体几何 → 深度参考 → 自监督闭环"完整概念链的最佳实例之一。
§2.6 参考标准(金标准)描述
| 维度 | 内容 |
|---|---|
| 划分 | 无官方划分;社区以整流序列编号(rectified01–14)为评测单元(来源) |
| 参考值生成方式 | 立体匹配软件 Libelas 对整流立体对自动生成深度图(来源) |
| 参考值覆盖范围 | 仅 Stoyanov 与 Pratt 贡献的视频附带深度参考(截至上述 2024 综述写作时点) |
| 标注者性质 | 算法自动生成(非人工逐帧标注);贡献论文层面由各研究团队定义协议 |
| 参考值性质 | 研究用参考(reference),非临床级金标准;后续研究明言其为 “unideal ground truth maps”(来源) |
§3 数据集规格
§3.0 版本抉择矩阵
Hamlyn Datasets 没有传统意义的 v1/v2 版本号,而存在"官方原始版 + 三个社区再分发/衍生形态"。按下表选择你的起点:
| 你的需求 | 推荐形态 | 大小 | 理由 |
|---|---|---|---|
| 快速跑单目/立体深度估计 baseline | 整流立体版(Endo-Depth-and-Motion) | 官方页未公布(HF 镜像分片下载) | 已整流、帧对齐、含标定与深度图,目录规整(来源) |
| 立体几何/标定/原始视频研究 | 官方原始版 | 官方页未公布 | 唯一第一手来源,保留原始托管形态与官方引用要求 |
| 跨域评测(模型训练于 SCARED 等) | EndoDAC 评测用法(rectified01–14) | 同整流版 | 已成为社区事实标准,数字可与公开结果对比(结构) |
| 点云网络训练/评测 | 3D 点云衍生版(Xi et al. 2021) | 48.61 GB | 5 类场景稠密点云(平均约 100,000 点/片),免去自建重建流水线(GitHub) |
§3.1 模态详情
| 模态 | 内容 | 覆盖范围 | 说明 |
|---|---|---|---|
| 单目腹腔镜视频 | 体内手术彩色视频序列 | 贡献系列中的单目部分 | 供跟踪、单目深度估计(评测时需外部深度参考) |
| 立体腹腔镜视频 | 左右目成对视频/帧对 | Stoyanov、Pratt 等立体贡献系列 | 官方与社区均提供整流形态(来源) |
| 深度参考图 | 与左/右目帧对应的深度图(PNG) | 仅 Stoyanov 与 Pratt 贡献序列 | 由 Libelas 立体匹配生成,非人工标注(来源) |
| 相机标定 | 内参、外参与立体标定 | 整流版随包提供(HF 卡片) | 支持毫米级物理量纲换算与三角化 |
| 3D 点云(衍生) | 5 类场景稠密点云 | abdomen wall、uterine horn、nephrectomy×2、liver | 约 100,000 点/片,48.61 GB(GitHub) |
§3.2 序列构成表(按贡献系列)
| 贡献系列(年份) | 场景/术式 | 深度参考 | 主要用途 |
|---|---|---|---|
| Stoyanov et al.(2005、2010) | 腹腔内手术视野 | ✅(Libelas) | 立体深度恢复、稠密重建 |
| Lerotic et al.(2008) | 腹腔场景 | — | 组织分类/跟踪类验证 |
| Mountney et al.(2010) | TECAB 心脏表面 | — | 软组织跟踪、运动补偿 |
| Pratt et al.(2010) | 体内手术视野 | ✅(Libelas) | 立体深度评测 |
| Giannarou et al.(2013) | 腹腔场景 | — | 跟踪与标定验证 |
| Ye et al.(2017) | 腹腔场景 | — | 后期补充序列 |
贡献系列与年份依据 2024 内窥镜重建综述 与 手术数据集综述表;"✅"表示该系列视频附带深度参考。第三方评测描述将数据集概括为约 21 段挑战性体内视频(Endo-Depth-and-Motion)。
§3.3 数据格式表
| 形态 | 文件/格式 | 说明 |
|---|---|---|
| 整流版图像 | JPEG 帧(image01/、image02/) | 左右目整流帧,6 位数字编号命名(来源) |
| 整流版深度 | PNG 深度图(depth01/、depth02/) | 与图像同帧号对齐,读取后转数值数组 |
| 整流版标定 | 结构化标定数据 | 相机内参/外参与立体标定随包发布(HF 卡片) |
| 官方原始版 | 网页托管的视频压缩包 | 官方页逐序列下载;具体容器格式以官方页为准(2026-09-13 抓取失败,本条目不代填) |
| 点云衍生版 | 分片压缩包 | 5 个数据集分片(816.1 MB 至约 20 GB 不等,GitHub) |
格式选择建议:算法研发用整流版(省去整流与配对工程);论文中声明"官方原始数据"时回到官方页下载并保留原始包校验信息;点云学习直接用衍生版但注意其许可链(坑点 8)。
§3.4 存储大小
官方原始版总体积未见官方公布(官方站于 2026-09-13 抓取失败,此字段省略数值)。可核实的体量锚点:
- 社区 3D 点云衍生版共 48.61 GB、分 5 个数据集分片发布(来源)。
- 点云数据集 4/5 号各含约 10 个分卷、单卷约 2.15 GB;1/2/3 号为单文件(816.1 MB / 2.48 GB / 2.39 GB)。
- 整流版为图像帧形态,体积显著小于点云衍生版;实际以 Hugging Face 镜像分片清单为准。
磁盘规划建议:评测复现预留整流版体积的 3 倍(解压 + 中间产物 + 深度缓存);点云工作流预留 150 GB 以上。
§3.5 标注方式
本数据集没有人工像素级标注。其"标注"由三层构成:
| 层级 | 内容 | 生成方 | 性质 |
|---|---|---|---|
| 第 1 层 | 深度参考图 | Libelas 立体匹配算法对整流立体对自动计算(来源) | 全自动弱参考 |
| 第 2 层 | 序列实验协议与适用任务 | 各贡献论文作者团队定义 | 人工撰写、文档形态 |
| 第 3 层 | 衍生几何参考 | 社区自动重建(如 5 类 3D 点云) | 全自动、独立许可 |
使用任何一层前都应阅读对应论文的生成协议;三层不可互相"顶替"(例如不能把衍生点云当作官方标注引用)。
§3.6 标注者资质与一致性
深度参考的"标注者"是立体匹配算法,其质量受限于立体基线、整流质量与表面反射特性;后续研究明确指出该参考为 “unideal ground truth maps” 并影响结论解读(来源)。不存在多标注者一致性(如 Kappa)之类的指标记录;各贡献论文的作者团队为帝国理工学院及合作机构研究人员(规范引用名单)。若你的研究需要人工精标子集,惯例做法是在 Libelas 参考之上做抽样人工复核,并把复核协议写入论文。
§3.7 采集周期
序列贡献横跨 2005-2017 年(Stoyanov 2005 → Ye 2017,来源);2012 年规范引用发布后,官方页作为持续托管的聚合入口存在。此后无已知新增序列贡献,数据集实质处于静态维护状态——这对使用策略的含义是:不要期待官方更新修复已知问题(如长序列无效区域),所有修补都在消费侧(社区整流版、预处理脚本)完成。
§3.8 地域覆盖
采集环境为英国伦敦帝国理工学院 Hamlyn Centre 相关的临床与实验环境(HF 卡片表述);官方未公布逐序列医院明细。phantom/验证序列在实验室环境采集。地域单一性是 §7.1 机构偏倚的来源之一,做跨人群/跨地域结论时必须声明。
§3.9 设备规格
官方未以结构化形式公布逐序列设备参数。可核实的定性事实:
- 数据集同时包含双目(binocular)与单目(monocular)两种成像形态(2024 综述)。
- 整流版附带标定数据(内参/外参/立体基线,HF 卡片),从标定可恢复有效焦距与基线等几何量。
- 逐序列分辨率、帧率与镜头型号未结构化公布,本条目不代填数值;需要精确参数的研究请回溯各贡献论文或从标定文件推算。
| 参数 | 获取途径 | 可信度 |
|---|---|---|
| 成像形态(单目/立体) | 官方页 + 综述 | 高(多源一致) |
| 立体几何量(焦距/基线) | 整流版标定文件 | 高(随包数据) |
| 分辨率/帧率 | 各贡献论文 | 中(论文级描述) |
| 镜头型号/设备序列号 | 无公开结构化记录 | 缺失 |
§3.10 深度溯源链
贡献论文(2005-2017,同行评审)
└─ 定义序列与实验协议
└─ 官方网页聚合托管(hamlyn.doc.ic.ac.uk/vision,规范引用 Giannarou et al. 2012)
├─ 直接下载:官方原始视频/序列包(许可:允许使用与发表,须引用对应论文)
├─ 社区整流:Endo-Depth-and-Motion(RA-L 2021)→ 整流立体版(GPL-3.0 再分发)
│ └─ EndoDAC(MICCAI 2024)沿用为 rectified01–14 跨域评测集
└─ 社区衍生:Xi et al.(CMPB 2021)5 类 3D 点云(48.61 GB)
§4 数据结构
§4.0 目录树(整流立体版,社区事实标准形态)
以下为 Endo-Depth-and-Motion 整流版 / EndoDAC 评测用法的目录结构(来源)。官方原始版为网页托管的逐序列压缩包,解压后同样以序列为单位组织。
hamlyn/
├── rectified01/ # 序列 01(整流后)
│ ├── image01/ # 左目图像帧
│ │ ├── 000000.jpg
│ │ ├── 000001.jpg
│ │ └── ...
│ ├── image02/ # 右目图像帧(与左目同帧号配对)
│ │ ├── 000000.jpg
│ │ └── ...
│ ├── depth01/ # 左目深度参考图(PNG)
│ │ ├── 000000.png
│ │ └── ...
│ └── depth02/ # 右目深度参考图(PNG)
│ ├── 000000.png
│ └── ...
├── rectified02/ # 同上结构
├── ...
├── rectified13/ # 序列 13(含深度参考的评测子集)
└── rectified14/ # 序列 14 起为长序列:需按 (180, 0, 590, 288) 裁剪
加载校验规则:EndoDAC 实现要求每帧必须同时存在 image01/image02/depth01/depth02 四件套才纳入评测集(来源)。序列号大于 13 的序列存在无效图像区域,需按裁剪框 (180, 0, 590, 288)(x1, y1, x2, y2)同时裁剪 RGB 与深度图(详见坑点 2)。
§4.1 DAIMS 字段字典(整流版)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差/注意 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| sequence_id | Integer | 整流序列编号(rectifiedNN 的 NN) | 1 |
划分单元、分组评测 | 编号 ≠ 采集顺序 | 无 | 1–14(EndoDAC 评测范围) |
| frame_id | Text | 帧文件编号(6 位零填充) | 000000 |
帧级索引与对齐 | 从 0 起计 | 无 | 序列内连续 |
| image01 | ImageObject | 左目整流帧(JPEG) | rectified01/image01/000000.jpg |
深度估计输入 | 长序列含无效区域 | 无 | — |
| image02 | ImageObject | 右目整流帧(JPEG) | rectified01/image02/000000.jpg |
立体监督信号 | 与 image01 同帧号配对 | 无 | — |
| depth01 | ImageObject | 左目深度参考(PNG) | rectified01/depth01/000000.png |
深度评测参考 | Libelas 自动生成,存在系统误差 | 文件缺失=该帧无参考 | 部分序列提供 |
| depth02 | ImageObject | 右目深度参考(PNG) | rectified01/depth02/000000.png |
立体监督/评测 | 同上 | 文件缺失=该帧无参考 | 部分序列提供 |
| calibration | 结构化参数 | 相机内参/外参/立体标定 | 随整流版发布 | 毫米量纲换算、三角化 | 按序列独立 | 无 | 随序列 |
| contributor_paper | Text | 序列对应的贡献论文 | Stoyanov et al. 2010 |
溯源与引用 | 引用时必须带上 | 无 | 见 §8.5 |
| has_ground_truth | Boolean | 是否附深度参考 | true |
评测子集筛选 | 仅部分序列为 true | 无 | true/false |
| invalid_region | 派生属性 | 序列号 >13 的无效图像区域 | (180, 0, 590, 288) |
预处理裁剪 | 未裁剪会污染指标 | 无 | 已知常量 |
| stereo_pair | 派生关系 | image01 与 image02 同帧号配对 | 000000 |
立体监督/视差计算 | 整流后行对齐(epipolar 对齐) | 无 | 帧级成立 |
| depth_saturation | 派生约定 | 评测协议的深度饱和上限 | 300 mm |
统一指标口径 | 论文间约定可能不同(坑点 4) | 无 | 社区惯例值 |
| frame_rate | 派生属性 | 序列帧率 | 未结构化公布 | 时序建模 | 需回溯贡献论文确认 | 无公开记录 | 序列相关 |
§4.2 标签分布
本数据集无类别标签体系(不是分类/分割数据集),"标签"即深度参考图的可用性。按可用参考分层的构成如下:
| 层级 | 覆盖 | 可执行的任务 |
|---|---|---|
| 视频层(全部序列) | 约 21 段体内视频 + phantom/验证序列 | 自监督预训练、跟踪、SLAM、定性验证 |
| 立体层(立体贡献系列) | Stoyanov、Pratt 等立体序列 | 立体监督训练、视差估计、尺度恢复 |
| 深度参考层 | 仅 Stoyanov 与 Pratt 贡献系列(截至 2024 综述时点,来源) | 有参考评测(Abs Rel/RMSE/δ) |
| 几何衍生层 | 5 类场景点云(社区重建,48.61 GB) | 点云重建训练/评测(独立许可链) |
若你的任务需要监督信号,可用样本集由 Stoyanov 与 Pratt 两个系列构成;纯视频序列则只能用于自监督、跟踪或定性验证。社区评测惯例以整流序列为单元筛选含参考子集(rectified01–14 中每帧要求四件套齐备,来源)。
§4.3 关键统计
- 约 21 段挑战性体内视频(弱纹理、形变、器械遮挡,第三方评测描述)。
- 整流评测覆盖 rectified01–14 共 14 个序列;EndoDAC 路线的跨域评测在其 20 个场景上平均(深度按 300 mm 饱和,来源)。
- 已知评测序列编号至少到 19、20(对比研究),提示整流/编号形态存在超出 14 的社区扩展用法。
- 社区点云衍生:5 类场景、48.61 GB、每片平均约 100,000 点(来源)。
- 深度参考覆盖:仅 Stoyanov 与 Pratt 两个贡献系列(2024 综述)。
- 贡献系列:6 个(Stoyanov、Lerotic、Mountney、Pratt、Giannarou、Ye),年份跨度 2005-2017。
统计口径提示:上述数字来自不同论文的表述口径("视频段数"与"评测场景数"不必相等)。撰写论文引用任何一项时,请连同其出处协议一起声明。
§4.4 数据层级
数据集合集(官方页,Giannarou et al. 2012 规范引用)
└── 贡献系列(Stoyanov / Lerotic / Mountney / Pratt / Giannarou / Ye,2005-2017)
└── 序列(rectified01–14 等整流评测单元)
└── 帧(左/右目成对 JPEG + 对齐 PNG 深度图)
└── 像素(RGB 三通道 / 深度值)
§4.5 缺失值与信息性缺失
| 缺失情形 | 表现 | 处理建议 |
|---|---|---|
| 深度图缺失 | depth01/depth02 无对应帧文件 | 该帧不参与有参考评测;不要用插值伪造深度 |
| 四件套不齐 | image02 或 depth02 缺一 | 按 EndoDAC 规则整帧剔除,保证配对完整性 |
| 长序列无效区域 | 序列号 >13 画面含无效区域 | 统一按 (180, 0, 590, 288) 裁剪 RGB 与深度 |
| 设备参数缺失 | 逐序列分辨率/帧率未结构化公布 | 回溯贡献论文;勿凭经验假设 |
本数据集不存在"用哨兵值表示缺失"的约定(如 -1、9999),缺失一律表现为文件不存在,加载器应显式校验。
§5 数据划分与使用建议
§5.1 官方划分
不存在。官方页按贡献系列组织数据,未提供 train/val/test 划分,也未提供评测指南或提交平台(2024 综述明确指出)。
§5.2 社区惯例划分
| 惯例 | 划分方式 | 使用者 | 适用场景 |
|---|---|---|---|
| 跨域评测 | 在 SCARED 等数据集训练,Hamlyn rectified01–14 全部仅作测试 | EndoDAC(MICCAI 2024,代码) | 泛化能力评估,结果可与公开数字对比 |
| 域内自评测 | 在 Hamlyn 立体序列上自监督训练,同域序列上评测(含 Mono/Stereo/M+S 变体) | Endo-Depth(RA-L 2021,来源) | 深度估计上限研究 |
| 序列留出 | 以序列号为单元留出部分序列做测试(社区常见做法) | 多篇后续论文 | 消融与稳健性分析 |
§5.3 划分策略建议
- 以序列为最小划分单元:rectifiedNN 编号天然构成无重叠分组,直接按编号奇偶或哈希切分即可保证组间零帧重叠。
- 域内训练 + 域内评测要显式声明:BodySLAM 对比实验专门指出 EndoDepth 曾在 Hamlyn 上训练、再在 Hamlyn 上评测的对比存在潜在偏倚(来源);论文表格中应区分 in-domain 与 zero-shot 两栏。
- 跨域评测统一预处理:EndoDAC 路线约定 300 mm 深度饱和与四件套校验;换协议后数字不可与公开结果直接比较(详见坑点 4)。
- 引用要落到序列层面:报告结果时写明使用的 rectified 序列编号与帧数,避免"整体数据集上测试"的模糊表述。
§5.4 泄漏风险(重点)
| 泄漏路径 | 机理 | 防线 |
|---|---|---|
| 帧级随机划分 | 相邻帧几乎相同,测试信息在训练中"见底" | 一律按序列划分(坑点 3) |
| 增强泄漏 | 对测试帧做了与训练集同分布的"记忆性"增强 | 增强只在训练子集内拟合参数 |
| 归一化泄漏 | 用全集统计量(均值/方差)归一化测试序列 | 统计量只从训练子集计算 |
| 版本混用 | 整流版与官方原始版序列存在对应关系,跨版本重复计入测试 | 数据 manifest 记录形态与序列映射(坑点 8) |
| 域内偏倚伪装成泛化 | in-domain 方法与零样本方法混排 | 表格分栏 + 训练背景列(坑点 5) |
§5.5 交叉验证建议
视频数据不适合标准 K 折交叉验证(帧重叠必然泄漏)。推荐两种替代:其一,按贡献系列做留一法(leave-one-contribution-out),检验对新术式场景的泛化;其二,按序列做两折交替(偶数序列训练、奇数序列测试后互换),保持组间零帧重叠。折间指标波动大是正常现象——序列间术式与场景差异显著,建议同时报告均值与逐折数值。
§5.6 外部验证建议
在 Hamlyn 上训练的模型,外部验证优先级:SCARED(机器人立体手术,域最近的现代数据集)→ EndoSlam(离体器官 + 高精度 GT)→ C3VD/SERV-CT(结肠镜与 CT 配准场景,域差最大)。反向亦然:SCARED 训练的模型在 Hamlyn 的表现已是社区通行的泛化指标(EndoDAC:Abs Rel 0.2601 / δ 93.64%,截至 2026-09 检索)。外部验证报告应包含:目标域数据规模、预处理差异清单、指标定义差异,三者缺一都会让"泛化"结论不可审计。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
数据集体积适中(整流版为图像帧形态)、无特殊依赖,主流免费 GPU 环境(Colab T4 / Kaggle P100)即可完成深度估计训练与评测。无需数据库或对象存储,直接挂载磁盘即可;点云衍生版(48.61 GB)建议在持久磁盘环境处理。
- Colab 路线:
!pip install huggingface_hub torch torchvision→snapshot_download拉取整流镜像 → 按 §6.4 加载。全程约 10 分钟可跑到第一个 batch。 - Kaggle 路线:把 HF 镜像作为 Dataset 挂载,工作目录直接指向
data_root;注意 Kaggle 单会话磁盘配额,点云衍生版不适用。 - 本地/服务器路线:建议预留 150 GB 磁盘(整流版 + 解压缓存 + 深度缓存),Python 3.10+ 与 CUDA 11+ 环境。
§6.1 快速上手
以下代码假定数据根目录
data_root/下直接是rectified01/ … rectified14/序列文件夹(Hugging Face 整流镜像解压后的布局);每个序列内要求 image01/image02/depth01/depth02 四个子目录。最小可用子集:任选一个含深度图的序列(如 rectified01)即可跑通训练循环。
# 环境准备:Python 3.10+,pip install torch torchvision numpy pillow
import numpy as np
from PIL import Image
from pathlib import Path
data_root = Path("data_root") # rectified01..rectified14 的父目录
seq_dir = data_root / "rectified01" # 最小可用子集:单序列即可启动
# 四件套校验:EndoDAC 规则——四文件齐备才算有效评测帧
def frame_quadruplet_complete(seq_dir: Path, fid: str) -> bool:
return all((seq_dir / sub / f"{fid}.png" if sub.startswith("depth")
else seq_dir / sub / f"{fid}.jpg").exists()
for sub in ("image01", "image02", "depth01", "depth02"))
left = np.asarray(Image.open(seq_dir / "image01" / "000000.jpg")) # H×W×3, uint8
depth = np.asarray(Image.open(seq_dir / "depth01" / "000000.png")) # H×W, 深度参考
print(left.shape, depth.shape, depth.dtype)
§6.2 数据获取
| 渠道 | 地址 | 形态 | 许可 |
|---|---|---|---|
| 官方原始版 | hamlyn.doc.ic.ac.uk/vision | 网页托管视频包,直接下载 | 官方页声明:允许使用与发表,须引用对应论文 |
| 整流立体版(推荐) | Hugging Face: vslamlab/Hamlyn_Rectified_Dataset | rectified 立体帧对 + 标定 + 深度图 | GPL-3.0(再分发许可,引用原始论文仍需遵守) |
| 3D 点云衍生版 | GitHub: LONG-XI/Endoscopic-3D-Point-Clouds-Datasets | 5 类场景点云,48.61 GB | 引用 Xi et al. 2021 与 Hamlyn 官方页 |
# 方式一:Hugging Face 整流版(推荐,免注册)
# pip install huggingface_hub
from huggingface_hub import snapshot_download
snapshot_download(
repo_id="vslamlab/Hamlyn_Rectified_Dataset",
repo_type="dataset",
local_dir="data_root", # 解压后即 data_root/rectifiedNN 布局
)
# 方式二:官方原始版(第一手来源,须遵守官方引用要求)
# 浏览器访问 http://hamlyn.doc.ic.ac.uk/vision/ 逐序列下载;
# 若用于论文,请同时引用官方页与所使用序列对应的贡献论文(见 §8.5)。
获取环节常见问题:
| 问题 | 处理 |
|---|---|
| 官方页访问不稳定(如 2026-09-13 抓取异常) | 先用 HF 整流镜像推进工作,稍后重试官方页;引用时以官方页为准 |
| 整流版分片下载中断 | snapshot_download 支持断点续传;重新执行同命令即可补齐 |
| 需要确认所用序列出自哪篇贡献论文 | 对照 §3.2 贡献系列表;官方页每条序列亦标注引用论文 |
| 想要点云而非视频 | 直接用 48.61 GB 衍生版(分片下载,4/5 号各含约 10 个分卷) |
| 商业闭源项目合规疑虑 | GPL-3.0 只约束整流再分发版;改用官方原始版并自行整流(坑点 8) |
§6.3 预处理全流程
从原始整流帧到训练就绪张量共四步:长序列裁剪 → 深度单位换算与饱和 → 无效帧过滤 → 归一化。社区评测惯例(EndoDAC 路线)将深度按 300 mm 饱和处理;注意各论文的深度单位约定存在差异,接入自己的流水线前务必核对(详见坑点 4)。
import numpy as np
from PIL import Image
from pathlib import Path
CROP_FOR_LONG_SEQ = (180, 0, 590, 288) # (x1, y1, x2, y2),序列号 >13 必须裁剪
DEPTH_SATURATION_MM = 300.0 # 社区评测惯例(EndoDAC 路线)
def load_left_rgb(seq_dir: Path, fid: str, seq_id: int) -> np.ndarray:
"""读取左目帧;长序列先裁掉无效区域。返回 float32 RGB (0-1)。"""
img = np.asarray(Image.open(seq_dir / "image01" / f"{fid}.jpg").convert("RGB"))
if seq_id > 13:
x1, y1, x2, y2 = CROP_FOR_LONG_SEQ
img = img[y1:y2, x1:x2]
return img.astype(np.float32) / 255.0
def load_depth_m(seq_dir: Path, fid: str, seq_id: int) -> np.ndarray:
"""读取左目深度参考并换算为米。
注意:社区惯例按毫米存储并饱和至 300 mm;接入前请用个别帧核对量纲。"""
d = np.asarray(Image.open(seq_dir / "depth01" / f"{fid}.png")).astype(np.float32)
if seq_id > 13:
x1, y1, x2, y2 = CROP_FOR_LONG_SEQ
d = d[y1:y2, x1:x2]
d = np.clip(d, 0.0, DEPTH_SATURATION_MM) # 毫米 → 饱和
return d / 1000.0 # → 米
def photometric_confidence_mask(left: np.ndarray, right: np.ndarray) -> np.ndarray:
"""左右目整流帧应行对齐,可用逐行视差搜索的光度一致性构造 GT 置信掩码,
缓解坑点 1(Libelas GT 在反射区的系统误差)。此处给出最简实现,
视差范围按标定基线与有效深度区间换算。"""
H, W, _ = left.shape
gray_l, gray_r = left.mean(-1), right.mean(-1)
best = np.full((H, W), np.inf) # 最小匹配代价
for d in range(4, 96, 4): # 视差候选(像素),按需加密
shifted = np.full_like(gray_r, np.nan)
shifted[:, :W-d] = gray_r[:, d:]
cost = np.abs(gray_l - shifted)
best = np.minimum(best, np.nan_to_num(cost, nan=np.inf))
return best < np.percentile(best[np.isfinite(best)], 70) # 代价最低 70% 视为可信
§6.4 PyTorch DataLoader 完整代码
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
class HamlynDepthDataset(Dataset):
"""Hamlyn 整流版深度估计评测集。
目录预期:
data_root/rectifiedNN/image01/000000.jpg 左目帧
data_root/rectifiedNN/image02/000000.jpg 右目帧
data_root/rectifiedNN/depth01/000000.png 左目深度参考
data_root/rectifiedNN/depth02/000000.png 右目深度参考
data_root 为镜像解压根目录;四件套不齐的帧整帧剔除(EndoDAC 规则)。
"""
CROP = (180, 0, 590, 288) # 序列号 >13 的无效区域裁剪框
SAT_MM = 300.0 # 社区深度饱和约定(毫米)
def __init__(self, data_root: str, height: int = 256, width: int = 320):
self.root = Path(data_root)
self.h, self.w = height, width
self.samples = []
for seq_dir in sorted(self.root.glob("rectified*")):
seq_id = int(seq_dir.name.replace("rectified", ""))
img_dir = seq_dir / "image01"
for img_path in sorted(img_dir.glob("*.jpg")):
fid = img_path.stem
quad = [(seq_dir / "image02" / f"{fid}.jpg"),
(seq_dir / "depth01" / f"{fid}.png"),
(seq_dir / "depth02" / f"{fid}.png")]
if all(p.exists() for p in quad): # 四件套校验
self.samples.append((seq_dir, seq_id, fid))
def _crop(self, arr: np.ndarray, seq_id: int) -> np.ndarray:
if seq_id > 13:
x1, y1, x2, y2 = self.CROP
arr = arr[y1:y2, x1:x2]
return arr
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
seq_dir, seq_id, fid = self.samples[idx]
img = np.asarray(Image.open(seq_dir / "image01" / f"{fid}.jpg").convert("RGB"))
disp = np.asarray(Image.open(seq_dir / "image02" / f"{fid}.jpg").convert("RGB"))
depth = np.asarray(Image.open(seq_dir / "depth01" / f"{fid}.png")).astype(np.float32)
img, disp, depth = (self._crop(a, seq_id) for a in (img, disp, depth))
depth = np.clip(depth, 0.0, self.SAT_MM) / 1000.0 # 毫米 → 米
img = torch.from_numpy(img.astype(np.float32) / 255.0).permute(2, 0, 1)
disp = torch.from_numpy(disp.astype(np.float32) / 255.0).permute(2, 0, 1)
depth = torch.from_numpy(depth)[None] # (1, H, W)
img = torch.nn.functional.interpolate(img[None], size=(self.h, self.w),
mode="bilinear", align_corners=False)[0]
disp = torch.nn.functional.interpolate(disp[None], size=(self.h, self.w),
mode="bilinear", align_corners=False)[0]
depth = torch.nn.functional.interpolate(depth[None], size=(self.h, self.w),
mode="nearest")[0]
return {"image": img, "stereo_pair": disp, "depth": depth,
"sequence_id": seq_id, "frame_id": fid}
loader = DataLoader(HamlynDepthDataset("data_root"), batch_size=8,
shuffle=False, num_workers=4) # 评测集:不打乱
batch = next(iter(loader))
print(batch["image"].shape, batch["depth"].shape)
§6.5 坑点清单(8 个)
⚠️ 坑点 1:深度参考是 Libelas 自动生成的,不是人工精密标注(分类:评估误用)
问题:深度 GT 由立体匹配软件 Libelas 对整流立体对自动计算(来源),在弱纹理、镜面反射区域存在系统误差;后续论文明言其为 “unideal ground truth maps”(来源)。把 RMSE 当作绝对几何精度汇报,会系统性高估或低估方法差异。
症状:在强反光区域评测误差骤增且不同方法排序翻转;自己复现的"金标准"与论文数字对不上。
解决:
- 简单方法:评测前可视化 GT 深度图与误差热图,剔除反射暴块后同时报告有效区域指标。
- 进阶方法:对 GT 做置信掩码(如局部左右目光度一致性检验),在掩码内计算 Abs Rel/RMSE,并在论文中说明掩码协议。
- SOTA 方法:交叉验证式评测——同时报告对 Libelas GT 与对高精度参考集(EndoSlam 的 3D 扫描 GT)的表现,证明结论不依赖单一参考。
参考:https://pmc.ncbi.nlm.nih.gov/articles/PMC11122342/ ;https://arxiv.org/pdf/2401.16600.pdf
⚠️ 坑点 2:序列号大于 13 的序列必须裁剪,否则评测被无效区域污染(分类:预处理陷阱)
问题:整流版中编号大于 13 的序列画面存在无效图像区域,EndoDAC 实现要求按 (180, 0, 590, 288) 裁剪 RGB 与深度图(来源)。
症状:Loss 不收敛或在黑边/伪影上震荡;δ 准确率出现反直觉的"高分歧";与公开结果差距无法解释。
解决:
- 简单方法:加载器内对 seq_id > 13 统一应用上述裁剪框(见 §6.4 代码)。
- 进阶方法:先逐帧统计左右目光度残差定位无效区,再自适应裁剪,避免硬编码框在更长序列上失效。
- SOTA 方法:构建时即做无效像素掩码并持久化,训练与评测共享同一掩码文件,杜绝 train/test 掩码不一致。
参考:https://deepwiki.com/gkw0010/EndoARSS/4.3-hamlyn-dataset
⚠️ 坑点 3:按帧随机划分 = 结构性数据泄漏(分类:数据泄漏)
问题:手术视频相邻帧几乎相同,若按帧打散 train/test,模型只需记忆相邻帧即可"答对"测试集。此外无官方划分,任何"在 Hamlyn 上训练又在 Hamlyn 上评测"的对比都需声明(BodySLAM 明确提示 EndoDepth 的 in-domain 偏倚,来源)。
症状:测试 Abs Rel 好得离谱(如 <0.05);换一段没见过的序列指标瞬间崩塌。
解决:
- 简单方法:按序列划分(如 rectified01–08 训练、09–14 测试),保证组间零帧重叠。
- 进阶方法:按贡献系列留出(leave-one-contribution-out),测试对未见术式场景的泛化,并报告跨折方差。
- SOTA 方法:双轨报告——in-domain(Hamlyn 训练)与 cross-domain(SCARED 训练 → Hamlyn 测试)分栏呈现,与 EndoDAC(0.2601)等公开数字对齐口径。
参考:https://ar5iv.arxiv.org/html/2408.03078 ;https://deepwiki.com/gkw0010/EndoARSS/4.3-hamlyn-dataset
⚠️ 坑点 4:深度单位与饱和约定不统一,数字不可直接比较(分类:工程陷阱)
问题:社区评测深度按毫米存储、300 mm 饱和(EndoDAC 路线,来源);但不同论文在单位(mm/m)、饱和值、有效距离阈值上的约定各异,混用后指标系统性错位。
症状:自己的 RMSE 与论文差一个数量级;δ 准确率异常偏低或偏高。
解决:
- 简单方法:接入数据前抽 3-5 帧打印深度直方图,确认量纲后再进入流水线(§6.3 代码已留核对点)。
- 进阶方法:在配置文件中显式声明
depth_unit/saturation_mm,评测器统一换算后再算指标。- SOTA 方法:复现论文时同时报告"原文协议"与"统一协议(300 mm 饱和、四件套过滤)"两套数字,说明可比性边界。
参考:https://www.sciencedirect.com/science/article/pii/S0143816626001909
⚠️ 坑点 5:in-domain 训练史造成对比偏倚(分类:偏倚陷阱)
问题:多篇知名方法(如 Endo-Depth 的 Mono/Stereo/M+S 变体)直接在 Hamlyn 上训练;将它们与零样本大模型(Depth Anything V2、Marigold、Metric3D v2)同表比较而不注明训练背景,会误导读者(BodySLAM 明确讨论此点,来源)。
症状:评审质疑"零样本模型为什么这么差";消融结论在不同基线下方向相反。
解决:
- 简单方法:表格增加"训练数据"列,in-domain 与 zero-shot 分组排序。
- 进阶方法:为 in-domain 方法补做 leave-one-out 域内划分,量化其对评测序列的记忆成分。
- SOTA 方法:引用 2026 年统一协议对比(EndoDAC 0.2601 / AF-SFMlearning 0.3666 / Depth Anything V2 0.4130,截至 2026-09 检索)作为公平基线锚点。
参考:https://ar5iv.arxiv.org/html/2408.03078 ;https://www.sciencedirect.com/science/article/pii/S0143816626001909
⚠️ 坑点 6:镜面反射与光照变化会让光度自监督失效(分类:预处理陷阱)
问题:腹腔内非朗伯反射、 mutual reflection 与光照波动造成亮度剧烈变化(2026 论文归纳),基于逐像素光度一致性的自监督损失(Monodepth2/Endo-Depth 类)在这些区域产生矛盾梯度。
症状:高光区域深度估计出现"空洞"或翻转;训练早期 Loss 剧烈震荡。
解决:
- 简单方法:训练时做光度增广(亮度/对比度扰动),迫使模型依赖几何而非亮度线索;评测时报告有效像素率。
- 进阶方法:引入 auto-masking(静态像素掩码)与最小重投影损失,弱化遮挡/高光帧的贡献。
- SOTA 方法:采用 AF-SFMlearning(MedIA 2022)或 EndoDAC(MICCAI 2024)的域适配设计——后者以 Depth Anything V2 为骨干,在 Hamlyn 跨域评测达 Abs Rel 0.2601(截至 2026-09 检索)。
参考:https://www.sciencedirect.com/science/article/pii/S0143816626001909
⚠️ 坑点 7:只有部分序列带深度参考,选错子集则数字不可比(分类:标签理解)
问题:官方仅 Stoyanov 与 Pratt 贡献的视频附带深度参考(来源);EndoDAC 用四件套规则筛出 rectified01–14,而其他论文使用的序列集合(如含序列 19、20 的对比,来源)与之不同。
症状:同一"Hamlyn 数据集"上各家数字差距悬殊,复现无从下手。
解决:
- 简单方法:报告结果时列出所用序列编号与帧数清单。
- 进阶方法:优先对齐 EndoDAC 四件套协议,使数字可与公开结果横向比较。
- SOTA 方法:在附录同时提供两种子集协议的结果,并开源评测清单文件。
参考:https://pmc.ncbi.nlm.nih.gov/articles/PMC11122342/ ;https://arxiv.org/pdf/2401.16600.pdf
⚠️ 坑点 8:官方原始版 / 整流版 / 点云衍生版混用,许可与引用错位(分类:工程陷阱)
问题:三个形态的许可不同——官方原始版为网页声明许可(允许使用与发表、须引用对应论文),整流再分发版为 GPL-3.0(来源),点云衍生版要求同时引用 Xi et al. 2021(来源)。混用后发布作品可能出现许可冲突或引用缺失。
症状:论文被要求补充数据许可声明;开源仓库收到 GPL 合规质询;审稿人发现引用的不是实际使用的数据版本。
解决:
- 简单方法:明确记录每个实验用的数据形态与对应许可,引用时三件套齐全(官方页 + 贡献论文 + 再分发版)。
- 进阶方法:构建数据准备脚本时输出 data manifest(形态、来源、许可、校验和),随代码入库。
- SOTA 方法:商业闭源产品规避 GPL-3.0 整流版,改用官方原始版并自行整流,同时保留引用链条。
参考:https://huggingface.co/datasets/vslamlab/Hamlyn_Rectified_Dataset ;https://github.com/LONG-XI/Endoscopic-3D-Point-Clouds-Datasets
§6.6 数据增强
| 增强 | 安全性 | 说明 |
|---|---|---|
| 亮度/对比度/色彩抖动 | ✅ 安全 | 模拟内窥镜光照波动,缓解坑点 6 |
| 水平/垂直平移与裁剪 | ✅ 安全 | 需同步裁剪深度图并更新裁剪框 |
| 高斯模糊 / 轻微噪声 | ✅ 安全 | 模拟镜头雾气与组织运动模糊 |
| 左右目互换 | ✅ 安全(立体监督) | 仅作为立体损失的数据侧变体,勿破坏评测输入 |
| 立体基线缩放 | ❌ 危险 | 改变几何约束,深度量纲随之失真 |
| 深度值随机缩放 | ❌ 危险 | 破坏毫米级量纲与 300 mm 饱和协议 |
安全增强的可运行示例(仅作用于图像分支,深度分支只做同步几何变换):
import torch
class SafePhotometricAug:
"""内窥镜光照模拟增广:只改光度,不动几何与深度量纲。"""
def __call__(self, img: torch.Tensor) -> torch.Tensor:
# img: (3, H, W),取值 0-1
brightness = 1.0 + (torch.rand(1) * 0.4 - 0.2) # ±20% 亮度
contrast = 1.0 + (torch.rand(1) * 0.3 - 0.15) # ±15% 对比度
gamma = 1.0 + (torch.rand(1) * 0.4 - 0.2) # ±0.2 gamma
img = img * brightness
mean = img.mean(dim=(-2, -1), keepdim=True)
img = (img - mean) * contrast + mean
img = img.clamp(1e-6, 1.0) ** gamma
return img.clamp(0.0, 1.0)
# 用法:训练循环中 batch["image"] = SafePhotometricAug()(batch["image"]),
# stereo_pair 分支同步应用相同参数(用固定种子)以保持光度一致性假设。
§6.7 模型推荐
| 模型 | 类型 | 与本数据集的关系 | 推荐度 |
|---|---|---|---|
| EndoDAC(MICCAI 2024) | 自监督单目深度估计(Depth Anything V2 骨干) | 跨域评测 rectified01–14 的当前公开最优锚点(Abs Rel 0.2601,截至 2026-09 检索) | ⭐⭐⭐⭐⭐ |
| Endo-Depth-and-Motion(RA-L 2021) | 自监督深度 + 光度跟踪 + TSDF 融合 | 整流版发布者,域内训练路线(RMSE 约 9.3 mm,代表性序列) | ⭐⭐⭐⭐⭐ |
| Monodepth2 | 自监督单目深度 | 结构简洁,适合教学与消融(域内训练 Abs Rel 0.4349) | ⭐⭐⭐⭐ |
| AF-SFMlearning(MedIA 2022) | 自监督深度 | 域适配设计,Hamlyn 上 0.3666(截至 2026-09 检索) | ⭐⭐⭐⭐ |
| Depth Anything V2 | 零样本基础模型 | 免训练基线(零样本 0.4130),建议作为对照栏 | ⭐⭐⭐ |
| ZoeDepth | 度量深度估计 | 在序列 19/20 对比中表现稳健(对比研究) | ⭐⭐⭐ |
§6.8 硬件需求
| 任务 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 数据探索 / 评测 | CPU + 8 GB 内存 | 任意 GPU | 逐帧推理即可 |
| 自监督深度训练 | 单卡 8 GB(T4/P100) | 单卡 24 GB(3090/4090) | 256×320 输入,batch 8 可行 |
| SLAM / TSDF 融合 | CPU 16 GB | GPU + 32 GB 内存 | Endo-Depth-and-Motion 报告 1200 帧融合约 7 秒(桌面 CPU) |
| 点云衍生版处理 | 64 GB 磁盘余量 | GPU + 64 GB 内存 | 48.61 GB 分片加载 |
§6.9 评估指标代码
import numpy as np
def depth_metrics(pred_m: np.ndarray, gt_m: np.ndarray, max_depth: float = 300.0/1000.0):
"""按社区惯例(深度以米计、300 mm 饱和)计算单目深度评测指标。
pred_m / gt_m:同形状 float 数组,单位米;无效参考请先置 NaN。"""
mask = np.isfinite(gt_m) & np.isfinite(pred_m) & (gt_m > 0) & (gt_m < max_depth)
p, g = pred_m[mask], gt_m[mask]
thresh = np.maximum(p / g, g / p)
return {
"abs_rel": float(np.mean(np.abs(p - g) / g)),
"sq_rel": float(np.mean((p - g) ** 2 / g)),
"rmse": float(np.sqrt(np.mean((p - g) ** 2))),
"rmse_log": float(np.sqrt(np.mean((np.log(p) - np.log(g)) ** 2))),
"delta1": float(np.mean(thresh < 1.25)),
"delta2": float(np.mean(thresh < 1.25 ** 2)),
"delta3": float(np.mean(thresh < 1.25 ** 3)),
}
# 锚点数字(EndoDAC 路线,20 场景平均,截至 2026-09 检索):
# abs_rel 0.2601 / rmse 0.0294 m / delta1 93.64%
端到端评测循环(把 §6.4 的 DataLoader 与本节指标接起来):
import torch
from tqdm import tqdm
@torch.no_grad()
def evaluate(model, loader, device="cuda"):
"""对整流版评测集逐批推理并聚合指标。
协议固定项:300 mm 饱和(DepthDataset 内已裁剪)、四件套过滤(初始化时完成)。"""
model.eval()
agg = {}
for batch in tqdm(loader):
img = batch["image"].to(device)
pred = model(img) # 模型输出米制深度 (B,1,H,W)
pred = pred.clamp(max=300.0/1000.0) # 与 GT 同口径饱和
pred = torch.nn.functional.interpolate(
pred, size=batch["depth"].shape[-2:], mode="bilinear",
align_corners=False)[:, 0].cpu().numpy()
gt = batch["depth"][:, 0].numpy()
for p, g in zip(pred, gt):
for k, v in depth_metrics(p, g).items():
agg.setdefault(k, []).append(v)
return {k: float(torch.tensor(v).mean()) for k, v in agg.items()}
# 结果应与 §8.1 统一协议表同口径呈现:Abs Rel / Sq Rel / RMSE / RMSE log / δ1-δ3。
# 若你的模型输出相对深度,请先按序列做中位数对齐(scale/shift),
# 并在论文中注明对齐协议——这也是各家数字差异的主要来源之一。
§6.10 MLOps 笔记
- 数据版本化:整流版以 Hugging Face 仓库 revision 固定;官方原始版无版本号,记录下载日期与文件清单即可追溯。
- 评测协议入库:把序列清单、300 mm 饱和、四件套过滤写成配置文件(YAML)随仓库提交,避免口头协议。
- 可复现锚点:以 EndoDAC 公开数字(Abs Rel 0.2601 / δ 93.64%,截至 2026-09 检索)做回归基线,任何预处理变更后先复跑锚点。
- 许可合规:训练产物如对外发布,按坑点 8 的 manifest 记录数据形态与许可链。
- 漂移监控:若模型将部署到新术式/新设备,用 Hamlyn(2005-2017 采集)与新设备数据的指标差量化时间-设备双重漂移,§7.6 的结论可直接引用。
- 数据卡片联动:将本条目 §7.7 DAIMS 表纳入内部数据治理看板,❌/⚠️ 项即工程补齐清单。
- 失败样本管理:把 GT 置信掩码(§6.3)与误差热图一起持久化,按序列聚合失败模式,反哺数据扩充决策。
# 评测协议配置示例(随仓库提交)
protocol:
data_root: data_root
sequences: rectified01..rectified14
frame_filter: quadruplet # image01/image02/depth01/depth02 齐备
crop_long_seqs: [180, 0, 590, 288]
depth_unit: mm
depth_saturation_mm: 300
metrics: [abs_rel, sq_rel, rmse, rmse_log, delta1, delta2, delta3]
anchor: {abs_rel: 0.2601, rmse_m: 0.0294, delta1: 0.9364, as_of: 2026-09}
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 机构单一性 | 全部序列来自单一学术环境(帝国理工 Hamlyn Centre 相关),设备与视角受限(RAI 声明) | 高 | 跨域评测(SCARED→Hamlyn)+ 多机构数据集组合训练 |
| 术式集中度 | 以肾部分切除、TECAB、腹腔探查为主,不覆盖现代机器人手术全谱 | 中 | 结合 SCARED/C3VD 等补充术式多样性 |
| 时代偏倚 | 序列采集于 2005-2017,成像设备早于当代 4K/荧光内窥镜 | 高 | 作为"历史域"压力测试而非部署域训练集 |
| 深度参考系统性误差 | Libelas 自动生成的 GT 在反射/弱纹理区失真(“unideal”,来源) | 高 | 置信掩码评测(坑点 1) |
| 对比协议偏倚 | in-domain 训练方法与零样本方法混排比较(来源) | 中 | 分栏报告训练背景(坑点 5) |
§7.2 标注质量
深度参考的技术上限由立体匹配决定:官方与社区文献均未给出 GT 的亚毫米级验证;2024 综述明确只有 Stoyanov 与 Pratt 序列附带 GT 且生成方式为 Libelas(来源)。没有标注者间一致性指标;贡献论文层面对各自序列的适用任务有定性说明。
分区域看,GT 的可靠性并不均匀:纹理丰富、反射温和的区域匹配置信度高;高光、烟雾与运动模糊区域的匹配代价大,误差呈块状聚集(这正是 §6.3 光度掩码的动机)。实践建议:把 GT 当作"一致的评测参考"(用于方法间比较)而非"物理真值"(用于绝对精度声明),并在论文中报告掩码内/掩码外两套误差。
§7.3 泛化性
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 现代机器人手术(4K、荧光导航) | 高——时代与设备域差大 | 数据集序列止于 2017;SCARED 训练模型迁移 Hamlyn 出现明显域间隙(EndoDAC 论文路线) |
| 荧光/近红外成像 | 极高——模态外推 | 数据集为可见光视频 |
| 新术式(胸外、妇科肿瘤) | 中——器官外观差异 | 场景集中于腹腔/心脏表面(§3.2) |
| 强烟雾/出血场景 | 中——光度方法退化 | 反射与光照变化被多篇论文列为挑战(来源) |
| 弱纹理光滑浆膜面 | 中——匹配点稀疏 | Endo-Depth-and-Motion 以光度跟踪替代特征点法的动机(来源) |
§7.4 伦理
数据为人体体内手术视频,官方页声明允许使用与发表全部数据(转录);内窥镜术野影像通常不含面部等直接标识特征,但官方未公布正式去标识化协议文档。使用者应:
- 遵守原始许可与引用要求(官方页声明 + 贡献论文 + 再分发版许可,三层链路见坑点 8)。
- 在本地伦理/IRB 框架下评估二次使用,尤其是模型输出的临床暗示性结论。
- 不得尝试从视频中重识个人身份;不得将序列与外部患者信息库做链接匹配。
- 衍生发布(再标注、裁剪、合成)需同时满足原始许可与衍生许可(整流版为 GPL-3.0)。
§7.5 公平性
患者人口学信息(年龄/性别/种族)官方未公布,无法评估人群代表性;这对"临床部署公平性"结论是实质限制——模型在该数据集上的表现不能外推为跨人群有效性声明。此外,术式集合集中于三类腹腔镜场景,对罕见术式人群的覆盖为零;若产品管线服务人群包含这些术式,应在其各自的真实数据上补测,而非引用本数据集的指标。
§7.6 数据漂移
数据集本身静态(无新增序列),不存在内部漂移;真正需要监控的是外部漂移:2005-2017 的成像域与当代手术(4K 内窥镜、荧光成像、机器人平台)之间存在时间-设备双重漂移。建议将 Hamlyn 定位为泛化压力测试集:若模型在 Hamlyn 与新采集数据上的指标差显著扩大,应触发域适配流程(如 EndoDAC 式基础模型微调)。
§7.7 DAIMS 数据质量检查(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 视频目录形态而非宽表;整流版目录结构规整可程序化遍历 |
| 2 | 唯一标识 | ✅ | rectifiedNN 序列号 + 6 位帧号构成唯一帧标识 |
| 3 | 特殊字符 | ✅ | 全数字命名,无特殊字符/编码问题 |
| 4 | 重复行 | ✅ | 帧序列无已知重复记录 |
| 5 | 缺失编码 | ⚠️ | 缺失表现为文件不存在,无哨兵值约定 |
| 6 | 标签标识 | ⚠️ | GT 归属仅靠目录命名(depth01/depth02)与四件套校验 |
| 7 | 罕见类分组 | ⚠️ | 无类别标签体系;场景分组仅由贡献论文定义 |
| 8 | 偏倚评估 | ⚠️ | 文献层有记录(机构单一/时代偏倚),官方无正式评估 |
| 9 | 数据字典 | ❌ | 无官方结构化数据字典 |
| 10 | 信息性缺失解释 | ❌ | GT 缺失原因(哪些序列无参考)无官方文档统一说明 |
| 11 | 设备记录 | ⚠️ | 设备参数仅散见于贡献论文,非结构化记录 |
| 12 | 共线性 | ✅ | 像素/深度数据不适用共线性风险 |
| 13 | 编码映射 | ❌ | 无标签编码映射表(无分类标签体系) |
| 14 | 时间戳处理 | ⚠️ | 仅有帧序号;逐序列帧率信息未结构化公布 |
| 15 | 划分建议 | ❌ | 官方无划分;社区惯例需自行对齐(§5.2) |
| 16 | 泄漏讨论 | ⚠️ | 社区有明确讨论(BodySLAM 偏倚提示),官方无文档 |
| 17 | 标签分布 | ❌ | 无标签统计(深度参考覆盖范围需自行扫描统计) |
| 18 | 测量偏倚 | ⚠️ | GT 为算法生成,存在与立体匹配相关的系统性测量偏倚 |
| 19 | 外部验证建议 | ✅ | 社区已形成 SCARED↔Hamlyn 双向跨域评测惯例 |
| 20 | 版本记录 | ⚠️ | 官方无版本号;变更史需经贡献论文年份重构 |
| 21 | 预处理脚本 | ⚠️ | 官方无脚本;社区提供整流/评测实现(Endo-Depth-and-Motion、EndoDAC) |
| 22 | 合规要求 | ✅ | 许可声明明确(允许使用与发表 + 引用要求) |
| 23 | 多模态对齐 | ⚠️ | 左右目与深度图靠同帧号对齐,整体可靠;长序列需裁剪对齐 |
| 24 | 去标识化 | ⚠️ | 术野影像直接标识风险低,但官方未公布去标识化协议 |
DAIMS 评分:12.5 / 24
评分解读:6 项全过(✅)、13 项部分满足(⚠️)、5 项不满足(❌)。该数据集在"结构可遍历性、标识唯一性、许可清晰度、外部验证惯例"上表现良好,是典型的"研究友好但工程文档缺失"的学术数据集;短板集中在官方治理层——无数据字典、无划分协议、无版本管理,这些缺口均由社区实践(整流版、四件套规则、300 mm 协议)填补。
对你意味着什么:如果你的任务是以 Hamlyn 为评测基准(深度估计/SLAM),本数据集可直接使用,但必须自带三件套协议文件(序列清单、裁剪规则、深度饱和约定)并引用 EndoDAC 公开数字做锚点;如果目标是训练可部署的临床模型,❌ 的 5 项(划分、字典、标签分布、编码映射、缺失解释)意味着你需要自行建立完整的治理层,并把 §7.1 的机构单一性与时代偏倚写入模型的预期使用声明。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Hamlyn rectified01–14(SCARED 模型迁移) | 香港中文大学(EndoDAC,MICCAI 2024) | 跨域单目深度估计 | Abs Rel 0.2601 / RMSE 0.0294 m / δ1 93.64%(截至 2026-09 检索) | 相对 SCARED 域内显著退化 | 域间隙可量化,基础模型骨干 + 域适配有效 |
| Hamlyn(SCARED 训练的 AF-SFMlearning 迁移) | 北京航空航天大学(MedIA 2022) | 跨域单目深度估计 | Abs Rel 0.3666 / RMSE 0.0463 m / δ1 83.70%(截至 2026-09 检索) | 同上协议可比 | 自监督域适配设计优于通用零样本模型 |
| Depth Anything V2 零样本 → Hamlyn | 学术对比(2026 论文统一协议) | 零样本单目深度估计 | Abs Rel 0.4130 / δ1 82.52%(截至 2026-09 检索) | 零样本基线 | 通用基础模型直接迁移内窥镜域性能受限 |
| Hamlyn 域内(Endo-Depth,RA-L 2021) | 萨拉戈萨大学等 | 立体监督自训练单目深度 | 代表性序列 RMSE 约 9.3 mm(相对基线 LapDepth 约 20.7 mm) | 域内上限参考 | 立体损失锚定尺度显著提升度量深度 |
§8 基准性能与生态
§8.1 排行榜(社区统一协议数字)
本数据集没有官方排行榜;下表为 2026 年发表的统一协议对比(Hamlyn 20 场景平均、深度饱和 300 mm、四件套过滤,来源),是当前唯一可直接横向比较的公开数字集。注意:其他论文因序列子集、饱和值、掩码协议不同,数字与下表不可直接比较(见坑点 4/7)。
| 排名 | 模型 | Abs Rel ↓ | RMSE (m) ↓ | δ1 ↑ | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|---|---|
| 1 | EndoDAC | 0.2601 | 0.0294 | 93.64% | 2024 | Depth Anything V2 骨干 + 域适配自监督 | EndoDAC authors et al., 2024, MICCAI.(作者名单见论文) | 有(项目开源) |
| 2 | AF-SFMlearning | 0.3666 | 0.0463 | 83.70% | 2022 | 自监督频域适配 | AF-SFMlearning authors et al., 2022, Medical Image Analysis | 有 |
| 3 | Depth Anything V2(零样本) | 0.4130 | 0.0550 | 82.52% | 2024 | 大规模相对深度基础模型 | Depth Anything V2 authors et al., 2024 | 有 |
| 4 | Monodepth2(域内训练) | 0.4349 | 0.0553 | 91.50% | 2019 | 单目自监督(Min reproj + auto-masking) | Godard et al., 2019, ICCV | 有 |
| 5 | Marigold(零样本) | 0.4987 | 0.0649 | 83.82% | 2024 | 潜在扩散深度模型 | Marigold authors et al., 2024, CVPR | 有 |
| 6 | Metric3D v2(零样本) | 0.6495 | 0.0661 | 76.10% | 2024 | 几何基础模型 | Metric3D v2 authors et al., 2024, TPAMI | 有 |
| 7 | Monodepth2(零样本) | 0.6885 | 0.0881 | 61.89% | 2019 | 同上,未域适配 | Godard et al., 2019, ICCV | 有 |
以上数值截至 2026-09 检索。域内训练模型(EndoDAC、AF-SFMlearning 若在其训练域评测)与零样本模型不可混为一谈,请结合"关键技术与训练背景"列解读。
§8.2 SOTA 总结与选型建议
截至 2026-09 检索:跨域评测选 EndoDAC 路线(基础模型骨干 + 域适配自监督是该协议下公开最优);零样本对照选 Depth Anything V2(通用模型中最好);教学/消融选 Monodepth2(结构清晰、域内数字齐备);做 SLAM 而非纯深度选 Endo-Depth-and-Motion(深度 + 跟踪 + 融合一体)。历史数字(Endo-Depth 单目 RMSE 约 9.3 mm,代表性序列)反映了域内训练上限,但其协议与统一协议表不可比。
选型时的三条判断规则:
- 先问"训练域是什么"——同一模型在 in-domain 与 zero-shot 两栏的数字可能相差一倍以上(Monodepth2:0.4349 对 0.6885,截至 2026-09 检索)。
- 再问"对齐协议是什么"——中位数对齐/量纲换算/饱和值任一不同,Abs Rel 即失去可比性。
- 最后问"参考质量边界"——反射区域的误差波动可能由 GT 系统误差主导,需用置信掩码复核(坑点 1)。
§8.3 评测协议
可复现的社区标准协议由 EndoDAC 实现固化(来源):① 评测单元为 rectified01–14;② 帧级四件套校验(image01/image02/depth01/depth02 齐备);③ 序列号 >13 按 (180, 0, 590, 288) 裁剪;④ 深度按 300 mm 饱和;⑤ 指标为 Abs Rel / Sq Rel / RMSE / RMSE log / δ<1.25^k(见 §6.9 代码)。偏离任何一条都应显式声明。
§8.4 相关数据集
| 数据集 | 关系 | 一句话差异 |
|---|---|---|
| SCARED | 最常用配对评测域 | 现代机器人立体手术 + 官方子挑战协议 |
| EndoSlam | 高精度 GT 参照 | 离体猪器官 + 商业 3D 扫描 GT,42,700 帧(来源) |
| EndoAbs | 受控 phantom 对照 | 3D 打印腹腔 + 激光扫描点云,120 对立体图像(来源) |
| SERV-CT | 配准任务互补 | 内窥镜-CT 表面配准评测 |
| C3VD | 结肠镜域对照 | 志愿捐赠器官仿真结肠镜评测 |
| JIGSAWS | 任务形态互补 | 手术技能/分割子任务标注,非深度评测主流 |
§8.5 关键论文 Top 8
- Giannarou S, Stoyanov D, Noonan D, Mylonas G, Clark J, Visentini-Scarzanella M, Mountney P, Yang G-Z. “Hamlyn centre laparoscopic / endoscopic video datasets.” 2012. — 数据集规范引用,所有使用必须引用(引用格式来源)。
- Recasens D, Lamarca J, Fácil JM, Montiel JMM, Civera J. “Endo-Depth-and-Motion: Reconstruction and Tracking in Endoscopic Videos Using Depth Networks and Photometric Constraints.” IEEE Robotics and Automation Letters, 6(4): 7225-7232, 2021. — 发布整流版并确立深度+跟踪+重建一体流水线(HF 卡片)。
- Xi L, Zhao Y, Chen L, Gao QH, Tang W, Wan TR, Xue T. “Recovering dense 3D point clouds from single endoscopic image.” Computer Methods and Programs in Biomedicine, 205: 106077, 2021. DOI: 10.1016/j.cmpb.2021.106077 — 从 Hamlyn 视频构建 5 类 3D 点云衍生数据集。
- “Advances in Real-Time 3D Reconstruction for Medical Endoscopy.” Journal of Imaging, 10(5): 120, 2024. DOI: 10.3390/jimaging10050120 — 权威梳理 Hamlyn 在内窥镜重建数据集生态中的位置(GT 覆盖与 Libelas 事实的主要来源)。
- EndoDAC(香港中文大学,MICCAI 2024) — 确立 rectified01–14 跨域评测协议与当前公开最优数字。
- AF-SFMlearning(北京航空航天大学,Medical Image Analysis 2022) — 面向内窥镜光照挑战的自监督域适配设计。
- “A monocular high-quality 3D reconstruction combined SuperVessel with SLAM in endoscopic environment.”(ScienceDirect,PII S0143816626001909) — 提供统一协议下的 7 模型对比表(本条目 §8.1 数字来源)。
- BodySLAM: A Generalized Monocular Visual SLAM Framework for Surgical Applications. arXiv:2408.03078(预印本) — 在 Hamlyn 上对比多方法并讨论 in-domain 偏倚。
- Stoyanov D. et al., 2010(立体深度恢复系列工作) — 附带深度参考的核心评测序列的贡献来源之一(综述表收录)。
- Ozyoruk et al., 2020, EndoSlam(MICCAI) — 后续世代高精度 GT 数据集的代表,常与 Hamlyn 构成"弱参考 + 强参考"互补评测对(2024 综述)。
§8.6 社区活跃度
作为 2012 年即定型的经典数据集,其活跃度体现在"下游论文"而非"官方更新":官方页多年保持静态托管;社区层面持续有整流镜像(Hugging Face)、衍生点云(GitHub,2023 年仍在更新 README)、评测实现(EndoDAC 等开源代码)产出。遇到下载问题可通过官方页联系方式或衍生项目邮箱咨询(点云项目联系方式)。
三个观察维度:其一,引用惯性——凡讨论内窥镜深度估计的论文几乎都会在相关工作或评测集中提及 Hamlyn,属于"事实标准"型资产;其二,形态迁移——消费重心已从官方原始版转向整流版与统一协议评测;其三,维护主体转移——数据本身静态,但协议演进(四件套、300 mm、rectified01–14)全部由社区代码库承载,跟踪这些代码库比跟踪官方页更有信息量。
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度锚点 | 推荐理由 |
|---|---|---|---|---|
| 官方数据页 | 原始数据 | http://hamlyn.doc.ic.ac.uk/vision/ | 长期静态托管(2026-09-13 抓取异常,属网络层面) | 第一手来源与官方引用要求 |
| Hamlyn_Rectified_Dataset | 整流镜像 | https://huggingface.co/datasets/vslamlab/Hamlyn_Rectified_Dataset | GPL-3.0,随 VSLAM-LAB 生态维护 | 即下即用,结构规整 |
| Endoscopic-3D-Point-Clouds-Datasets | 衍生点云 | https://github.com/LONG-XI/Endoscopic-3D-Point-Clouds-Datasets | README 更新至 2023-06 | 48.61 GB 点云,免自建重建 |
| Endo-Depth-and-Motion | 方法 + 整流版出处 | 论文/代码(RA-L 2021) | 被后续工作持续沿用 | 整流版与光度跟踪权威实现 |
| EndoDAC 代码 | 评测实现 | 见论文(MICCAI 2024) | 统一协议事实标准 | 数字可对齐公开锚点 |
§9 相关资源与引用
§9.1 官方与社区资源
- 官方数据页(下载 + 引用要求):Hamlyn Centre Laparoscopic / Endoscopic Video Datasets
- 整流立体版镜像(GPL-3.0):Hugging Face: vslamlab/Hamlyn_Rectified_Dataset
- 3D 点云衍生版(48.61 GB):GitHub: LONG-XI/Endoscopic-3D-Point-Clouds-Datasets
- 领域综述(数据集生态定位):Advances in Real-Time 3D Reconstruction for Medical Endoscopy, J. Imaging 2024
- 统一协议对比数字来源:ScienceDirect: PII S0143816626001909
- 跨域评测结构参考:EndoDAC 的 Hamlyn 数据集实现说明
§9.2 BibTeX 引用块
@misc{giannarou2012hamlyn,
title = {Hamlyn Centre Laparoscopic / Endoscopic Video Datasets},
author = {Giannarou, Stamatia and Stoyanov, Danail and Noonan, David and
Mylonas, George and Clark, James and Visentini-Scarzanella, Marco and
Mountney, Peter and Yang, Guang-Zhong},
year = {2012},
url = {http://hamlyn.doc.ic.ac.uk/vision/}
}
@article{recasens2021endo,
title = {Endo-Depth-and-Motion: Reconstruction and Tracking in Endoscopic
Videos Using Depth Networks and Photometric Constraints},
author = {Recasens, David and Lamarca, Jos{\'e} and F{\'a}cil, Jos{\'e} M and
Montiel, J. M. M. and Civera, Javier},
journal = {IEEE Robotics and Automation Letters},
volume = {6},
number = {4},
pages = {7225--7232},
year = {2021},
publisher = {IEEE}
}
@article{xi2021recovering,
title = {Recovering dense 3D point clouds from single endoscopic image},
author = {Xi, Long and Zhao, Yan and Chen, Long and Gao, Qing Hong and
Tang, Wen and Wan, Tao Ruan and Xue, Tao},
journal = {Computer Methods and Programs in Biomedicine},
volume = {205},
pages = {106077},
year = {2021},
doi = {10.1016/j.cmpb.2021.106077}
}
@article{advances2024reconstruction,
title = {Advances in Real-Time 3D Reconstruction for Medical Endoscopy},
journal = {Journal of Imaging},
volume = {10},
number = {5},
pages = {120},
year = {2024},
doi = {10.3390/jimaging10050120}
}
§9.3 引用指南
最低合规引用 = @misc{giannarou2012hamlyn}(官方页 + 规范引用)+ 你实际使用的贡献论文(Stoyanov/Mountney/Pratt/Giannarou/Ye 等,见 §3.2)。若使用整流版,追加 Recasens 2021 并遵守 GPL-3.0;若使用点云衍生版,追加 Xi 2021。方法对比请引用对应基准论文;数字引用处标注检索时点(本条目统一为截至 2026-09)。
三种典型场景的引用组合:
| 场景 | 必引 | 建议加引 |
|---|---|---|
| 用整流版做深度估计评测 | giannarou2012hamlyn + recasens2021endo + 所用序列贡献论文 | 统一协议对比来源(2026 论文)与 EndoDAC |
| 用点云衍生版 | giannarou2012hamlyn + xi2021recovering | Endo-Depth-and-Motion(若与整流版混用) |
| 综述/教程性提及 | giannarou2012hamlyn + 官方页 URL | 2024 内窥镜重建综述(生态定位) |
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 |
|---|---|
| 大语言模型(条目写作助手) | 事实整理、正文起草、代码示例编写、表格构建 |
§10.2 AI 参与范围
AI 参与:检索结果的事实抽取与汇总、章节起草、代码示例与表格组织、DAIMS 检查项的初评。人工负责:事实核对(每条硬事实回溯来源 URL)、医学与工程判断、许可与伦理结论审定、最终发布决定。
§10.3 输入来源列表
- S. Giannarou et al., “Hamlyn centre laparoscopic / endoscopic video datasets,” 2012 — http://hamlyn.doc.ic.ac.uk/vision/
- LONG-XI/Endoscopic-3D-Point-Clouds-Datasets(GitHub,含规范引用与场景清单) — https://github.com/LONG-XI/Endoscopic-3D-Point-Clouds-Datasets
- Advances in Real-Time 3D Reconstruction for Medical Endoscopy, J. Imaging 10(5):120, 2024 — https://pmc.ncbi.nlm.nih.gov/articles/PMC11122342/
- 同上 DOI 页 — https://doi.org/10.3390/JIMAGING10050120
- vslamlab/Hamlyn_Rectified_Dataset(Hugging Face 数据卡) — https://huggingface.co/datasets/vslamlab/Hamlyn_Rectified_Dataset
- EndoARSS 项目 Hamlyn Dataset 实现说明(DeepWiki) — https://deepwiki.com/gkw0010/EndoARSS/4.3-hamlyn-dataset
- freescar/paperNotes MedDatasets.md(官方页声明转录) — https://github.com/freescar/paperNotes/blob/master/MedDatasets.md
- 手术数据集综述表(腾讯 ima 知识库文档) — https://ima.qq.com/wiki/?shareId=406d5ceee8c26b41b3c8383a3114869f012006c60bd8c69acb73f971b0abf6d9
- A monocular high-quality 3D reconstruction combined SuperVessel with SLAM in endoscopic environment(ScienceDirect,2026) — https://www.sciencedirect.com/science/article/pii/S0143816626001909
- BodySLAM: A Generalized Monocular Visual SLAM Framework for Surgical Applications(arXiv:2408.03078) — https://ar5iv.arxiv.org/html/2408.03078
- A Comparative Study(arXiv:2401.16600,Hamlyn 序列对比) — https://arxiv.org/pdf/2401.16600.pdf
- Endo-Depth-and-Motion 论文解析页(Lacuna) — https://lacuna.tiptreesystems.com/paper/endo-depth-and-motion-localization-and-reconstruction-in-endoscopic-videos-using/art_312de0f4e87841d688c7364f8fdecf40
- 软组织跟踪方法论文(CMES v145n3,Hamlyn 官方页使用实例) — https://www.techscience.com/CMES/v145n3/64966/xml
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 schema_org | 千方病案医学编辑部 | 逐字段与宪法 §3 模板比对 | ✅ 已通过/已验证 |
| §1-§2 医学与数据集事实 | 千方病案医学编辑部 | 硬事实逐条回溯 §10.3 来源 | ✅ 已通过/已验证 |
| §3-§5 规格与划分 | 千方病案医学编辑部 | 与 FACTS.md 及原始 URL 交叉核对 | ✅ 已通过/已验证 |
| §6 代码与坑点 | 千方病案医学编辑部 | 代码逻辑走查 + 坑点来源核验 | ✅ 已通过/已验证 |
| §7-§8 数字与矩阵 | 千方病案医学编辑部 | 全部数字对齐来源 URL,标注截至日期 | ✅ 已通过/已验证 |
| §9-§10 引用与声明 | 千方病案医学编辑部 | BibTeX 字段与来源一致性检查 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
全部章节由 AI 辅助起草,经 §10.4 所列人工校验流程通过后发布。无"纯 AI 未审"章节。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- SLAM-3D-Endoscopic — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- jigsaws — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- m2cai16-tool — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- multibypass140 — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- scared — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- c3vd — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- endoslam — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- endomapper — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- misaw — 共享标签:医学影像 / 内窥镜影像 / 手术视频
- cad-cap — 共享标签:医学影像 / 内窥镜影像 / 手术视频
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
