信息速览

AutoLaparo — 腹腔镜子宫切除术三任务手术自动化数据集 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | AutoLaparo(腹腔镜子宫切除术多任务数据集) |
| 英文全称 | AutoLaparo: A New Dataset of Integrated Multi-tasks for Image-guided Surgical Automation in Laparoscopic Hysterectomy |
| 别名/简称 | AutoLaparo dataset;MICCAI 2022 子宫切除术阶段识别基准 |
| 疾病分类(ICD-11) | 2E86.0 子宫平滑肌瘤(主要适应证;另涉 2C77、GA10、2B64,见 §2.1) |
| SNOMED CT | 236888001(Laparoscopic total hysterectomy,腹腔镜全子宫切除术) |
| 数据模态 | 腹腔镜手术视频(1920×1080@25fps)+ 逐帧阶段标签 + clip 级运动标签 + 像素级分割 mask |
| AI 任务类型 | 手术阶段识别(时序分类)、腹腔镜运动预测(视频分类)、器械与解剖分割(实例分割) |
| 样本总数 | 21 台手术视频 / 83,243 帧阶段标注 / 300 个运动 clip / 1,800 帧分割标注(5,936 个 mask) |
| 数据大小 | 官方未公开压缩包总大小;视频总量 1,388 分钟(23:08:00),建议预留 100 GB 以上磁盘 |
| 数据格式 | MP4 视频 + 帧图像(PNG/JPG)+ TXT 标签 + 像素级 mask |
| 许可证 | CC-BY-NC-SA 4.0 |
| 访问级别 | 开放下载(仅限学术研究,禁止商用) |
| DUO 标签 | NRES(无限制研究使用)+ NCU(非商业)+ PUB(使用须公开发表并引用) |
| 语言 | 标注与文档为英文;视频为手术画面,无语音内容 |
| 首发日期 | 2022-08-03(arXiv v1 提交,MICCAI 2022 接收) |
| 最后更新 | 2022-08(数据集未见官方版本更新记录,截至 2026-09) |
| 发布机构 | The Chinese University of Hong Kong(香港中文大学)+ 威尔斯亲王医院 |
| 官方主页 | http://autolaparo.github.io/ |
| 下载地址 | http://autolaparo.github.io/(官网提供三个子数据集下载) |
| DOI | 10.1007/978-3-031-16449-1_46(arXiv: 10.48550/arXiv.2208.02049) |
| 引用次数 | 86+(Semantic Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方划分与官方预处理脚本齐全、三任务标注同源关联;扣分项:无现成 PyTorch Dataset,标签文件需自行与帧序列对齐,且必须复现官方 1 fps/250×250 预处理才能对齐基准 |
| 页面状态 | published |
§0 E-E-A-T 审核与可信度声明
- 医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11/SNOMED CT 编码映射、子宫切除术适应证与流行病学)、§7 偏倚分析(单中心手术视频数据的临床解读边界)。
- 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。AutoLaparo 采用 CC-BY-NC-SA 4.0 许可证,仅限学术研究使用、禁止任何商业用途,数据发布经 Joint CUHK-NTEC Clinical Research Ethics Committee 批准。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? AutoLaparo 是香港中文大学团队在 MICCAI 2022 发布的腹腔镜全子宫切除术公开视频数据集。它收录了 21 台从开台到关台的完整手术录像(共 1,388 分钟),并由一位拥有 30 余年经验的资深妇科医生团队逐帧标注了 7 个手术阶段,同时配套了腹腔镜镜头运动标签和器械/解剖像素级分割标注,是妇科微创手术领域第一个"三任务一体"的多任务数据集(官网)。
为什么重要? 在 AutoLaparo 出现之前,手术流程识别研究几乎完全建立在胆囊切除术(Cholec80)之上,妇科经阴道/腹腔镜手术的公开数据长期空白。AutoLaparo 首次让"子宫切除术阶段识别"成为一个可复现、可横向比较的标准化基准,并被 MICCAI 2022 接收(论文);截至 2026-09,其 Semantic Scholar 引用已超过 86 次,涵盖手术阶段识别、自监督预训练、视频-语言模型评测等方向。
我能用它做什么? 训练术中阶段识别模型(给手术视频逐帧打"现在进行到哪一步"的标签)、训练腹腔镜镜头运动预测模型(为自主持镜机器人提供 FoV 控制能力)、训练器械与子宫的实时分割模型,或把三个任务的标注联合起来做多模态手术场景理解。所有数据 CC-BY-NC-SA 4.0 许可、免费下载,但仅限学术研究(获取)。
核心事实卡:
| 项 | 值 |
|---|---|
| 发布 | MICCAI 2022(LNCS 13437, pp. 486-496) |
| 机构 | 香港中文大学 + 威尔斯亲王医院(中国香港,单中心) |
| 规模 | 21 台手术 / 1,388 分钟 / 83,243 帧阶段标注 |
| 任务 | 阶段识别(7 类)+ 运动预测(7 类)+ 分割(9 类) |
| 划分 | 官方 10 训练 / 4 验证 / 7 测试(视频级) |
| 许可 | CC-BY-NC-SA 4.0(学术专用、禁商用) |
| 获取 | 官网免费下载,无需注册申请 |
| 引用 | 86+(Semantic Scholar,截至 2026-09) |
§1.1 技术摘要
AutoLaparo 的原始数据为 21 台腹腔镜全子宫切除术的完整视频,2018 年 10-12 月采集于香港威尔斯亲王医院,25 fps、1920×1080,单台时长 27-112 分钟(平均 66 分 07 秒),经预处理后总时长 1,388 分钟(官网)。数据集通过"三层标注流程"把三个任务组织在同一批视频上:第一层在视频级为每帧标注 7 个手术阶段之一(Task 1,共 83,243 帧,官方划分 10 台训练/4 台验证/7 台测试);第二层从 P2-P4 阶段精选 300 个 10 秒 clip,标注 7 种腹腔镜运动模式(Task 2,划分 170/57/73);第三层在每个 clip 内采样 6 帧、共 1,800 帧,用 LabelMe 标注 9 类像素级 mask(Task 3,子宫 + 4 类器械各分 shaft/manipulator 两部件,共 5,936 个标注)。论文为三个任务分别提供了 SV-RCNet、TMRNet、TeCNO、Trans-SVNet(Task 1)与 Mask R-CNN、YOLACT、YolactEdge(Task 3)的参考基准:Task 1 测试集最高准确率 78.29%(Trans-SVNet),Task 2 最高 27.40%(ResNet-50+LSTM),Task 3 最高 mask AP 54.09%(YOLACT),说明三个任务均远未饱和(论文 Table 3-5)。
§1.2 战略价值
维度一:填补妇科手术 AI 的基准空白。 手术数据科学(Surgical Data Science)的公开基准长期集中于胆囊切除术:Cholec80(80 台胆囊切除)、M2CAI16 挑战赛数据等,模型在这些数据上已接近饱和,且术式解剖结构完全不同。子宫切除术是全球最常见的妇科大手术之一,其关键步骤(韧带离断、子宫血管处理、阴道横断、标本取出、缝合冲洗)与胆囊手术差异极大。AutoLaparo 提供了该术式首个全流程逐帧标注,使"跨术式泛化"研究成为可能——近年多项工作(如 LoViT、自监督视频基础模型)都把 Cholec80→AutoLaparo 的跨数据集迁移作为标准实验(LoViT)。
维度二:多任务同源标注的独特研究价值。 三个任务的标注同源于同一批 21 台手术:阶段标签告诉你"现在在做什么",运动标签告诉你"镜头在怎么动",分割 mask 告诉你"画面里有什么"。这种对齐结构天然支持多模态融合研究——例如用分割信息辅助阶段识别、用阶段先验辅助镜头控制。论文明确指出,分割子数据集可为 Task 1 与 Task 2 提供额外的数据模态,便于探索单模态与多模态融合对手术感知的价值(论文)。此外,Task 2 的"镜头运动预测"设定直接面向自主持镜机器人(FoV 自动控制)这一产业方向,是同类数据集中少见的任务形态。
§1.3 同类数据集横向对比
| 数据集 | 术式 | 规模 | 标注 | 差异化 |
|---|---|---|---|---|
| AutoLaparo | 腹腔镜全子宫切除术 | 21 台 / 1,388 分钟 / 83,243 帧标注 | 7 阶段逐帧 + 300 clip 运动标签 + 1,800 帧 9 类分割 | 三任务一体、妇科领域首个基准、含器械部件级分割 |
| Cholec80 | 腹腔镜胆囊切除术 | 80 台 / 平均 39 分钟 | 7 阶段逐帧 + 7 器械存在性(1 fps) | 样本量最大、社区最深;但无像素级分割、无运动标签 |
| PmLR50 | 腹腔镜肝切除术 | 50 台 / 23,037 帧 | 5 类工作流逐帧 | 第二个妇科外腹腔镜术式基准,规模中等 |
| RAMIE | 机器人辅助食管切除术 | 27 台 / 105,387 训练帧 | 8 胸段阶段逐帧(25 fps 标注) | 机器人术式、阶段序列更复杂,用于跨术式泛化压力测试 |
数据来源:Cholec80 与 PmLR50/RAMIE 数字分别取自 LoViT 论文与 npj Digital Medicine 基础模型论文的官方划分描述(PMC11876726、npj Dig Med、RAMIE 论文)。
§1.4 版本时间轴
| 时间 | 事件 | 说明 |
|---|---|---|
| 2022-06-13 | GitHub 代码仓库创建 | ziyiwangx/AutoLaparo,含官方预处理脚本与基准代码 |
| 2022-08-03 | arXiv v1 提交 + MICCAI 2022 接收 | 论文 arXiv:2208.02049,正式版 LNCS 13437, pp. 486-496 |
| 2022-08 | 官方数据集网站上线 | autolaparo.github.io 提供三个子数据集下载 |
| 2025-03-21 | 仓库最近一次代码推送 | 截至 2026-09 未见数据集本体版本更新(GitHub API,截至 2026-09) |
§1.5 典型应用场景
- 术中阶段识别与进度感知:训练"当前处于 7 个阶段中的哪一个"的实时模型,用于手术进度看板、OR 调度与教学复盘;官方基准 AC 78.29%,后继 SOTA 已突破 80%(见 §8)。
- 自主持镜/镜头控制机器人:Task 2 的 7 种运动模式(上/下/左/右/放大/缩小/静止)预测直接服务 FoV 自动控制研究(论文)。
- 器械与解剖结构分割:9 类部件级 mask(含子宫与 LigaSure 等 4 类器械的 shaft/manipulator)支持实时分割算法开发与器械踪迹分析。
- 跨术式泛化与基础模型评测:作为与 Cholec80 对齐的"第二术式"基准,被自监督预训练与视频-语言模型工作用作分布外测试集(SOTA 榜单)。
- 多模态手术场景理解:三任务同源标注支持"分割+时序+运动"联合建模研究。
§2 医学背景
§2.1 ICD-11 编码映射
AutoLaparo 标注对象是手术过程而非疾病诊断。子宫切除术本身属手术操作,ICD-11 MMS 章节不含操作编码(操作分类由 WHO-ICHI 承担);下表给出与该数据集手术人群对应的主要临床适应证编码。
| ICD-11 编码 | 中文名称 | 英文名称 | 与数据集的关系 |
|---|---|---|---|
| 2E86.0 | 子宫平滑肌瘤 | Leiomyoma of uterus | 全子宫切除术最常见适应证(ICD-11 MMS) |
| 2C77 | 子宫体恶性肿瘤 | Carcinoma of corpus uteri | 恶性肿瘤适应证(完整术式可能扩展为根治性切除) |
| GA10 | 子宫内膜异位症 | Endometriosis | 药物治疗无效时的常见手术适应证 |
| 2B64 | 子宫内膜增生 | Endometrial hyperplasia | 异常子宫出血相关适应证 |
§2.1b SNOMED CT 编码映射
| 标签 | ICD-11 参考 | SNOMED CT 码 | 术语(Fully Specified Name) |
|---|---|---|---|
| 本数据集术式 | — | 236888001 | Laparoscopic total hysterectomy (procedure)(BioPortal) |
| 对照术式:经腹路径 | — | 116143008 | Total abdominal hysterectomy (procedure) |
| 对照术式:腹腔镜+双附件切除 | — | 414575003 | Laparoscopic total abdominal hysterectomy and bilateral salpingo-oophorectomy (procedure) |
| 对照术式:机器人辅助 | — | 708877008 | Laparoscopic total hysterectomy using robotic assistance (procedure) |
| 对照术式:阴道式 | — | 265056007 | Vaginal hysterectomy (procedure) |
SNOMED 编码经 NHS OpenCodelists 子宫颈完整切除码表交叉核对(opencodelists)。AutoLaparo 的 7 阶段定义与 236888001(腹腔镜全子宫切除)的术式范围一致:不含附件切除的专属阶段,缝合与冲洗阶段覆盖阴道断端缝合与盆腔清洗。
§2.2 疾病与术式简介
全子宫切除术(total hysterectomy)指切除子宫体与子宫颈的手术,是全球最常见的妇科大手术之一,适应证以子宫平滑肌瘤为首——它是育龄女性最常见的良性肿瘤,其次为子宫内膜异位症、子宫内膜增生、异常子宫出血与子宫内膜癌等(Apollo 临床综述)。与经腹路径相比,腹腔镜路径出血更少、恢复更快,已成为良性适应证的首选路径之一,但术者需要处理离断韧带与腹膜、封闭子宫血管、横断阴道、经阴道取出标本并缝合断端等精细步骤——这正是 AutoLaparo 7 阶段划分的临床骨架(P1 准备 → P2 离断韧带与腹膜 → P3 离断子宫血管与韧带 → P4 横断阴道 → P5 标本取出 → P6 缝合 → P7 冲洗)。流行病学层面,子宫肌瘤在 50 岁前女性中累积发生率极高,由此产生的子宫切除术量使该术式成为手术流程研究的理想载体:术式标准化程度高、阶段边界清晰、临床风险点集中(血管处理与阴道横断)。
§2.3 临床任务定义
| 任务类型 | 定义 | 在本数据集中的形态 |
|---|---|---|
| 手术阶段识别(workflow recognition) | 对手术视频逐帧/逐片段预测当前所处的标准化手术阶段 | 7 阶段、逐帧(1 fps)、21 台全流程覆盖 |
| 腹腔镜运动预测(motion prediction) | 在镜头运动发生前预测其方向/缩放模式,支撑自动持镜 | 7 类运动模式、300 个 10 秒 clip、运动时刻 T=第 5 秒 |
| 器械与解剖分割(segmentation) | 在手术画面中像素级定位器械部件与关键解剖结构 | 9 类、1,800 帧、5,936 个实例 mask |
临床语境下,阶段识别服务术中上下文感知(context-awareness):进度提示、风险阶段预警(如 P3 子宫血管处理)、术后质控与教学;运动预测服务下一代智能手术系统中的镜头自主跟随;分割则为器械交互分析、出血风险评估与术野理解提供像素级底座。
7 阶段的临床内涵与风险画像(基于阶段定义与标准腹腔镜全子宫切除术流程整理):
| 阶段 | 术者核心动作 | 主要器械 | 临床风险点 | 时序占比 |
|---|---|---|---|---|
| P1 Preparation | 建立气腹、探查盆腔、摆放体位 | 抓取钳、吸引器 | 穿刺损伤(低频高险) | 3.2% |
| P2 Dividing Ligament and Peritoneum | 离断圆韧带、阔韧带与盆腔腹膜 | LigaSure、电钩 | 输尿管走行辨认 | 34.2% |
| P3 Dividing Uterine Vessels and Ligament | 封闭离断子宫动脉/静脉与主韧带 | LigaSure | 出血与输尿管热损伤 | 21.7% |
| P4 Transecting the Vagina | 环切阴道穹窿、离断子宫 | 电钩、剪刀 | 阴道残端处理 | 12.7% |
| P5 Specimen Removal | 经阴道取出子宫标本 | 抓取钳 | 标本袋破损 | 1.9% |
| P6 Suturing | 缝合阴道断端与腹膜化 | 持针器 | 缝合不牢致残端出血 | 17.0% |
| P7 Washing | 冲洗盆腔、检查止血、排气关腹 | 吸引冲洗器 | 隐匿性出血漏检 | 9.3% |
该表解释了数据集的两条结构性规律:其一,P2+P3 合计约 56% 的时序占比对应"能量器械密集操作区",Task 2 的 300 个运动 clip 全部取自该区间;其二,P1/P5 均为低占比"事件型"阶段,构成类不平衡的根源(详见 §6.5 坑点 3)。
§2.4 患者人群
| 维度 | 内容 |
|---|---|
| 来源机构 | 香港威尔斯亲王医院(Prince of Wales Hospital, Hong Kong) |
| 采集时间 | 2018 年 10 月 - 2018 年 12 月 |
| 性别 | 女性(全子宫切除术适应证人群) |
| 年龄 | 未公开(数据集不含患者人口学元数据) |
| 种族/地域 | 中国香港单中心,未公开人口学分布 |
| 就医类型 | 择期妇科腹腔镜手术 |
| 伦理批准 | Joint CUHK-NTEC Clinical Research Ethics Committee |
注意:数据集为匿名手术视频,不含任何患者标识与临床结局数据,因此不支持"阶段识别→结局预测"的下游临床建模,这是与 MIMIC 类 EHR 数据集的本质差异。
§2.5 临床价值
对临床而言,AutoLaparo 训练的模型有四个可落地方向:其一,手术进度自动记录与结构化手术报告生成,减轻文书负担;其二,关键阶段(P3 血管处理、P4 阴道横断)的实时预警与术中教练(coaching)反馈;其三,自主持镜系统——Task 2 的运动预测模式即为该场景设计,可减少扶镜助手负担并稳定术野;其四,术后复盘与技能评估,阶段占比与阶段转换序列可作为手术效率的客观量化指标。需强调:所有模型在进入临床前必须经过前瞻性、跨中心验证,本数据集单中心来源决定了其模型只能作为研究原型(见 §7.3)。
§2.6 金标准对照
| 维度 | 本数据集做法 | 说明 |
|---|---|---|
| 参考划分 | 官方 10 台训练 / 4 台验证 / 7 台测试(视频级) | 论文与官网一致,社区沿用(LoViT) |
| 标注方式 | 人工逐帧标注(1 fps)+ 校对与交叉检查 | 视频级→clip 级→帧级三层流程 |
| 标注者 | 30 余年临床经验资深妇科医生 + 3 年子宫切除经验专科医生 | 经 proofread 与 cross-check 后入库(论文) |
| 标注工具 | LabelMe(开源) | 分割 mask 由在线标注工具绘制 |
| 性质 | 单中心观察性手术视频、回顾性标注 | 无患者结局随访 |
§3 数据集规格
§3.0 获取渠道抉择矩阵
AutoLaparo 为单一版本发布,无多版本选择问题;真正的"抉择"发生在获取渠道与下载组合上:
| 你的需求 | 推荐渠道 | 需下载 | 理由 |
|---|---|---|---|
| 快速跑通阶段识别基线 | 官网 + GitHub 代码 | Task 1 + 官方仓库 | 官方 t1_video2frame.py 直接产出基准口径帧 |
| 复现运动预测(Task 2) | 官网 | Task 2(含 Task 1 以理解 clip 来源) | clip 全部取自 P2-P4,需阶段上下文 |
| 训练实例分割 | 官网 | Task 3 + Task 2 | 1,800 帧与 300 个 clip 一一对应,帧序号由 clip 索引解释 |
| 三任务多模态研究 | 官网全部 | Task 1/2/3 | 三层标注同源嵌套(§4.4),全部下载才能对齐 |
| 仅做综述/引用 | 论文 + 官网 | 不下载 | 论文 Table 1-5 含全部规格数字 |
§3.1 模态详情
| 模态 | 规格 | 说明 |
|---|---|---|
| 腹腔镜手术视频 | 21 台全流程、25 fps、1920×1080、Olympus 成像平台 | 单台 27-112 分钟,平均 01:06:07,总计 23:08:00 |
| Task 1 阶段标签 | 7 类、逐帧(1 fps 对齐)、共 83,243 帧 | 每帧恰属一个阶段;占比见 §4.2 |
| Task 2 运动 clip | 300 个 10 秒 clip(取自 P2-P4)、7 类运动模式 | 运动时刻 T=第 5 秒;官方基准下采样至 3 fps(16 帧输入) |
| Task 3 分割标注 | 1,800 帧、9 类、5,936 个像素级 mask | 每 clip 采样 6 帧;mask 由 LabelMe 绘制 |
§3.2 子集与样本数
| 子集 | 内容 | 训练 | 验证 | 测试 | 合计 |
|---|---|---|---|---|---|
| Task 1 | 手术视频(台)/ 阶段标注帧 | 10 台 / 40,211 帧 | 4 台 / 14,972 帧 | 7 台 / 28,060 帧 | 21 台 / 83,243 帧 |
| Task 2 | 运动 clip(个) | 170 | 57 | 73 | 300 |
| Task 3 | 像素级标注(个 mask) | 3,501 | 1,127 | 1,258 | 5,936 |
来源:官方划分经 npj Digital Medicine 基础模型论文(帧数数据)与 SurgBench(划分索引)交叉核实;Task 2/3 划分来自官网 Table 2与论文。
Task 3 按类别 × 划分的标注分布(合计 5,936 个标注):
| 类别 | 训练 | 验证 | 测试 | 合计 |
|---|---|---|---|---|
| Uterus(子宫) | 663 | 214 | 139 | 1,016 |
| 1-m(抓取钳·操作头) | 371 | 107 | 99 | 577 |
| 1-s(抓取钳·杆身) | 291 | 89 | 62 | 442 |
| 2-m(LigaSure·操作头) | 842 | 283 | 356 | 1,481 |
| 2-s(LigaSure·杆身) | 630 | 206 | 238 | 1,074 |
| 3-m(解剖抓取钳·操作头) | 287 | 92 | 159 | 538 |
| 3-s(解剖抓取钳·杆身) | 189 | 81 | 103 | 373 |
| 4-m(电钩·操作头) | 104 | 50 | 48 | 202 |
| 4-s(电钩·杆身) | 124 | 55 | 54 | 233 |
| 合计 | 3,501 | 1,127 | 1,258 | 5,936 |
来源:论文 Table 2。注意电钩(4-m/4-s)合计仅 435 个标注、平均每帧约 7,042-17,990 像素,是全数据集最难学的小目标类。
§3.3 数据格式
| 数据 | 格式 | 说明 |
|---|---|---|
| 手术视频 | MP4(H.264) | 1920×1080@25fps,含原始黑边 |
| Task 1 帧序列 | PNG/JPG(官方脚本转换) | 1 fps 抽帧 + 250×250 缩放 + 裁黑边 |
| Task 1 标签 | TXT | 逐帧阶段索引(1-7) |
| Task 2 clip | MP4/帧序列 | 官方基准 3 fps、250×250 |
| Task 2 标签 | TXT(laparoscope_motion_label.txt) | clip 级运动模式 |
| Task 3 图像与 mask | PNG/JPG + 像素级 mask | 9 类实例轮廓 |
§3.4 存储规模
官方未公开三个子数据集压缩包的总字节数;可参考的硬指标是视频总量 1,388 分钟 1080p25 与 83,243 张处理帧。工程上建议为"原始视频 + 官方脚本产出的帧序列"预留 100 GB 以上磁盘空间(1080p 视频解压与帧序列缓存为主要占用项)。下载入口见 §6.2。
§3.5 标注方式
全部标注为人工标注,无自动预标注或弱监督环节。三层标注流程为:视频级 workflow 标注(21 台 × 7 阶段逐帧)→ clip 级运动标注(300 clip × 7 模式)→ 帧级分割标注(1,800 帧 × 9 类,LabelMe)。标注完成后经校对(proofread)与交叉检查(cross-check)再入库(论文)。
§3.6 标注者资质与一致性
标注由一位 30 余年临床经验的资深妇科医生与一位具 3 年子宫切除术经验的专科医生完成。数据集未公开标注者间一致性系数(如 Cohen’s κ);由于标注团队单一且临床经验深厚,标签的术式学一致性可信度高,但缺少量化指标意味着使用者无法评估边界帧(阶段过渡处)的标注方差——这是复现时噪声的主要潜在来源之一。
§3.7 采集周期
2018 年 10 月至 2018 年 12 月,共 3 个月窗口,21 台手术全部来自该窗口。采集窗口短而密集,手术设备、团队与流程高度一致——这对模型学习是"低噪声"利好,对泛化是"高偏置"风险(见 §7.1)。
§3.8 地域覆盖
单中心:香港威尔斯亲王医院(中国香港新界沙田)。单中心来源是该数据集最核心的泛化性限制因素。
§3.9 设备规格
| 项目 | 规格 |
|---|---|
| 成像平台 | Olympus 腹腔镜成像系统 |
| 分辨率/帧率 | 1920×1080 @ 25 fps |
| 视野特征 | 标准腹腔镜白光视野,画面四周存在采集黑边(官方预处理要求裁除) |
§3.10 深度溯源链
原始视频(威尔斯亲王医院 Olympus 平台采集,2018 Q4)→ 伦理批准(Joint CUHK-NTEC CREC)→ 三层人工标注(资深妇科医生团队,LabelMe)→ 论文发布(MICCAI 2022, arXiv:2208.02049)→ 官网/GitHub 分发(autolaparo.github.io / ziyiwangx/AutoLaparo)。每一环均可在官网与论文中交叉验证,无第三方转手发布。
§4 数据结构
§4.0 目录树
官方发布包按三个任务组织。以下树为官网描述与 SurgBench 报告(arXiv:2506.07603)综合的结构预览,具体文件命名以实际下载解压结果为准:
AutoLaparo/
├── task1/
│ ├── videos/ # 21 段完整手术视频(MP4)
│ ├── labels/ # 逐帧阶段标签(1 fps,阶段 1-7)
│ └── frames/ # 官方 t1_video2frame.py 产出(可选)
│ └── <video_id>/*.png # 1 fps、250×250、已裁黑边
├── task2/
│ ├── clips/ # 300 个 10 秒运动 clip
│ └── laparoscope_motion_label.txt # clip 级运动模式标签(7 类)
└── task3/
├── images/ # 1,800 帧分割图像
└── masks/ # 5,936 个像素级实例 mask
§4.1 DAIMS 数据字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| video_id | 文本 | 手术视频唯一标识(编号 01-21) | 01 |
样本分组键、划分依据 | 无 | 不适用 | 01-21 |
| frame_index | 整数 | 1 fps 对齐后的帧序号 | 420 |
时序建模的时间轴 | 无 | 不适用 | 0 至该视频总帧数-1 |
| phase_id | 整数 | 手术阶段标签 | 3 |
Task 1 分类目标 | 阶段边界帧存在标注者主观性 | 无缺失 | 1-7 |
| phase_name | 文本 | 阶段英文名称(对照 phase_id) | Dividing Uterine Vessels and Ligament |
可读化、报表 | 无 | 不适用 | 7 个固定枚举 |
| clip_id | 文本 | 运动 clip 标识(001-300) | 128 |
Task 2 样本键 | 无 | 不适用 | 001-300 |
| motion_label | 文本 | 腹腔镜运动模式 | Zoom-in |
Task 2 分类目标 | 运动类型由标注者判定 | 无缺失 | Up/Down/Left/Right/Zoom-in/Zoom-out/Static |
| image_id | 文本 | Task 3 分割帧标识 | clip128_frame5 |
Task 3 样本键 | 无 | 不适用 | 1,800 个 |
| class_id | 整数 | 分割类别(9 类,器械分部件) | 2-m |
Task 3 分割目标 | 遮挡/烟雾边界存在像素级不确定性 | 无缺失 | Uterus、1-m/1-s、2-m/2-s、3-m/3-s、4-m/4-s |
| mask_polygon | 多边形 | LabelMe 像素级轮廓顶点 | [[x1,y1],...] |
实例分割监督信号 | 器械 shaft/manipulator 交界处主观性最高 | 无缺失 | 像素坐标 |
命名约定:N-m 表示第 N 号器械的 manipulator(操作头),N-s 表示其 shaft(杆身);N ∈ {1: Grasping forceps 抓取钳, 2: LigaSure, 3: Dissecting and grasping forceps 解剖抓取钳, 4: Electric hook 电钩}(论文)。
§4.2 标签分布
Task 1 阶段占比(21 台平均):
| 阶段 | 名称 | 占比 |
|---|---|---|
| P1 | Preparation(准备) | 3.2% |
| P2 | Dividing Ligament and Peritoneum(离断韧带与腹膜) | 34.2% |
| P3 | Dividing Uterine Vessels and Ligament(离断子宫血管与韧带) | 21.7% |
| P4 | Transecting the Vagina(横断阴道) | 12.7% |
| P5 | Specimen Removal(标本取出) | 1.9% |
| P6 | Suturing(缝合) | 17.0% |
| P7 | Washing(冲洗) | 9.3% |
Task 2 运动模式计数(train/val/test,合计):Up 14/3/5(22)、Down 25/4/26(45)、Left 18/10/9(20)、Right 30/15/9(54)、Zoom-in 17/12/15(44)、Zoom-out 17/12/15(44)、Static 54/10/14(78)(官网 Table 2)。
Task 3 类别计数(合计 5,936):Uterus 1,016;2-m(LigaSure 操作头)1,481;2-s 1,074;1-m 577;1-s 442;3-m 538;3-s 373;4-s 233;4-m 202。Uterus 出现于 941/1,800 帧、平均每帧约 253,968 像素,是画面占比最大的类;LigaSure 是出现最频繁的器械(论文 Table 2)。
§4.3 关键统计
- 视频总时长 1,388 分钟;83,243 个标注帧 ≈ 1 fps × 1,388 分钟,逐帧覆盖无空洞。
- 单台手术平均 66 分 07 秒;最长 112 分钟、最短 27 分钟,难度差异显著。
- Task 2 的 300 个 clip 全部来自 P2-P4(占时序 68.6% 的"器械操作密集区")。
- Task 3 的 1,800 帧与 Task 2 的 300 个 clip 一一对应(每 clip 采样 6 帧)。
- Task 2 运动模式中 Static 占 26%(78/300),非静态 6 类共 222 个——类别分布不均衡程度低于 Task 1 的阶段分布。
- Task 3 中子宫与 LigaSure 合计贡献 3,571/5,936(60.2%)的标注,其余 6 类合计仅 2,365 个——小类学习信号稀缺是分割基准的主要结构性约束。
§4.4 数据层级
患者/手术(21 例)
└── 手术视频(21 段,全流程)
├── 帧序列(83,243 @ 1 fps)── Task 1 阶段标签
└── P2-P4 精选片段
└── 10 秒 clip(300 个)── Task 2 运动标签
└── 采样帧(1,800 张 @ 6 帧/clip)── Task 3 像素级 mask
三个任务自上而下同源嵌套:一台手术同时贡献阶段帧、运动 clip 与分割帧,这正是"三层标注流程"的结构含义(论文)。
§4.5 缺失值与信息性缺失
数据集无缺失值问题:阶段标注逐帧全覆盖,运动标签与分割 mask 按设计给出。不存在"缺失即有含义"的信息性缺失编码(区别于 EHR 数据集)。唯一需要使用者注意的是:Task 1 的帧级标注密度为 1 fps,而原始视频为 25 fps——25 fps 层面没有标注,任何"逐 25 fps 帧"的模型都要自行处理标签对齐(见 §6.5 坑点 1)。
§5 数据划分与使用建议
§5.1 官方划分
| 任务 | 训练 | 验证 | 测试 | 粒度 |
|---|---|---|---|---|
| Task 1 | 视频 01-10(40,211 帧) | 视频 11-14(14,972 帧) | 视频 15-21(28,060 帧) | 视频级 |
| Task 2 | clip 001-170 | clip 171-227 | clip 228-300 | clip 级 |
| Task 3 | mask 3,501 | mask 1,127 | mask 1,258 | 标注级(与 Task 2 clip 同源) |
官方划分以视频/clip 为单位,且三个任务的划分索引相互独立发布(Task 2/3 划分见官网,Task 1 划分见官网与 SurgBench)。
§5.2 社区惯例
阶段识别文献(Trans-SVNet、TeCNO、TMRNet 的 AutoLaparo 复现与 LoViT 等)一律沿用官方 10/4/7 划分与 1 fps/250×250 预处理(LoViT 论文明确声明);自监督与视频-语言预训练工作同样按官方划分评测(npj Dig Med)。想让自己的结果进入对比表,遵循官方划分是唯一正解。
| 社区工作 | 划分遵循情况 | 备注 |
|---|---|---|
| LoViT(Sci Rep 2025) | 严格遵循官方 10/4/7 | 论文显式声明 “following Wang et al. (2022)” |
| npj Dig Med 基础模型(2026) | 严格遵循官方划分 | 报告 40,211/14,972/28,060 帧口径 |
| SurgBench(arXiv 2025) | 沿用官方划分索引 | 并将 video 01-10/11-14/15-21 写入统一框架 |
| RAMIE 论文(arXiv 2024) | 使用官方划分,但转述有误 | 误写测试集 9 台——引用他人转述需回源核对(坑点 8) |
§5.3 泄漏风险(重点)
- 帧级随机划分 = 灾难性泄漏:同一台手术相邻帧近乎相同,任何跨训练/测试混帧的划分都会使测试 AC 虚高至接近 100%。一切划分必须以视频为单位。
- 三任务共享源视频:Task 2/3 的 clip 与帧全部抽自 21 台手术。若你在 Task 1 上自定义划分,必须同步检查 Task 2/3 的样本是否与测试台手术同源,否则预训练特征会把测试视频信息"蒸馏"进训练。
- 验证集调参污染:官方验证集仅 4 台(14,972 帧),在其上做大规模超参搜索后再报测试成绩会引入选择性偏差;建议固定一次调参预算并公开验证集使用次数。
§5.4 交叉验证建议
21 台的样本量不支持 k=10 的稳定交叉验证(每折仅约 2 台测试)。若必须做 CV,建议 5 折 GroupKFold(按视频分组,约 4 台/折),并将折叠结果与官方划分结果并列报告、不互相替代。
§5.5 外部验证建议
优先顺序:Cholec80(跨术式,7 阶段对齐最难但文献最厚)→ RAMIE(跨术式+跨机器人平台,阶段结构更复杂)→ 自采院内数据(跨中心)。已有工作表明跨中心/跨平台迁移存在显著性能衰减(见 §7.3 与 §8),论文与官网均未提供官方外部测试集。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
AutoLaparo 无官方 Colab/Kaggle 镜像。推荐路径:任意带 GPU 的云实例(≥16 GB 显存)→ 下载三个子数据集(官网直链)→ 挂载 ≥100 GB 数据盘 → 按 §6.3 完成官方对齐预处理 → 用 §6.4 的 DataLoader 起跑。Task 1 单张 RTX 3090 即可复现官方基线量级;LoViT 类长序列 Transformer 建议使用 V100/A100(LoViT 实验配置:Tesla V100 单卡)。
§6.1 快速上手
# ── 目录结构预期(官方发布包解压后)──────────────────────────────
# data_root/
# task1/videos/*.mp4 21 段原始视频
# task1/labels/... 逐帧阶段标签(1 fps,值 1-7)
# task2/clips/*.mp4 300 个 10 秒 clip
# task2/laparoscope_motion_label.txt
# task3/images/*.png 1,800 张分割帧
# task3/masks/... 5,936 个像素级 mask
# ── data_root 拼接关系:所有路径由 DATA_ROOT + 子目录拼接,勿混用绝对路径
# ── 最小可用子集:1 台训练视频 + 对应标签即可跑通"抽帧→读标签→训练循环"
import subprocess, pathlib
DATA_ROOT = pathlib.Path("data_root") # 改为你的解压目录
VIDEO = sorted((DATA_ROOT / "task1" / "videos").glob("*.mp4"))[0]
OUT = DATA_ROOT / "task1" / "frames" / VIDEO.stem
OUT.mkdir(parents=True, exist_ok=True)
# 以 1 fps 抽帧(对齐官方基准),后续按 §6.3 统一缩放裁边
subprocess.run(["ffmpeg", "-i", str(VIDEO), "-vf", "fps=1",
str(OUT / "%06d.png")], check=True)
print(f"已抽帧至 {OUT}")
§6.2 数据获取
| 步骤 | 操作 | 说明 |
|---|---|---|
| 1 | 访问 autolaparo.github.io | 官网提供 Task 1/2/3 三个子数据集的下载入口 |
| 2 | 选择所需子集 | 可单独下载;Task 3 依赖 Task 2 的 clip 索引理解帧来源 |
| 3 | 解压并核对目录 | 对照 §4.0 目录树;文件命名以实际解压为准 |
| 4 | 阅读许可 | CC-BY-NC-SA 4.0:可自由用于学术研究,禁止商用,使用须引用(BibTeX 见 §9) |
| 5 | 问题联系 | 官方邮箱 ziyiwangx@gmail.com(GitHub README) |
无需注册、申请或签署协议;相比 PhysioNet 类凭证化数据集,获取门槛极低。代码仓库单独克隆:
git clone https://github.com/ziyiwangx/AutoLaparo.git # 官方预处理与基准代码
# 下载完成后建议做最小完整性检查:三个子目录均非空、Task 1 视频 21 段
python3 - <<'EOF'
from pathlib import Path
root = Path("data_root")
t1 = list((root / "task1" / "videos").glob("*.mp4"))
t2 = list((root / "task2" / "clips").glob("*.mp4")) or list((root / "task2" / "clips").iterdir())
t3 = list((root / "task3" / "images").iterdir())
assert len(t1) == 21, f"Task 1 视频数应为 21,实际 {len(t1)}"
assert len(t2) == 300, f"Task 2 clip 数应为 300,实际 {len(t2)}"
assert len(t3) == 1800, f"Task 3 图像数应为 1800,实际 {len(t3)}"
print("完整性检查通过:21 台手术 / 300 clips / 1,800 帧")
EOF
若官网下载链接失效或需要批量授权说明,联系官方邮箱 ziyiwangx@gmail.com(GitHub README)。
§6.3 预处理全流程
官方基准的预处理口径(GitHub README):视频→帧、25 fps→1 fps、1920×1080→250×250、裁除画面黑边。Task 2 clip 额外降采样至 3 fps(10 秒 → 16 帧输入,含首尾帧)。以下脚本复现该口径:
# 复现官方 t1_video2frame.py 的关键口径:1 fps 抽帧 → 缩放 250×250 → 裁黑边
# 注意:裁边与缩放的先后顺序以官方脚本源码为准;此处演示完整链路
import subprocess, pathlib
from PIL import Image
DATA_ROOT = pathlib.Path("data_root")
FRAMES = DATA_ROOT / "task1" / "frames"
def extract_1fps(video_path: pathlib.Path, out_dir: pathlib.Path):
out_dir.mkdir(parents=True, exist_ok=True)
subprocess.run(
["ffmpeg", "-i", str(video_path), "-vf", "fps=1", str(out_dir / "%06d.png")],
check=True,
)
def align_to_benchmark(frame_dir: pathlib.Path, size: int = 250):
"""逐帧缩放并裁黑边。黑边位于画面四周,可按列/行亮度阈值检测。"""
import numpy as np
for p in sorted(frame_dir.glob("*.png")):
im = Image.open(p).convert("RGB")
arr = np.asarray(im.convert("L"))
col_mask, row_mask = arr.mean(axis=0) > 20, arr.mean(axis=1) > 20 # 黑边≈纯黑
if col_mask.any() and row_mask.any():
x0, x1 = np.argmax(col_mask), len(col_mask) - np.argmax(col_mask[::-1])
y0, y1 = np.argmax(row_mask), len(row_mask) - np.argmax(row_mask[::-1])
im = im.crop((x0, y0, x1, y1))
im = im.resize((size, size))
im.save(p)
for video in sorted((DATA_ROOT / "task1" / "videos").glob("*.mp4")):
out_dir = FRAMES / video.stem
if not out_dir.exists():
extract_1fps(video, out_dir)
align_to_benchmark(out_dir)
print(f"{video.stem} done")
Task 2 无需自行抽帧对齐——直接使用官方 t2_datapre.py(仓库提供)按 170/57/73 切分并产出 3 fps 帧序列。
Task 3 mask 读取片段(LabelMe 多边形 → 训练用二值 mask):
# Task 3:读取 LabelMe JSON 多边形并栅格化为 9 类实例 mask
# 目录预期:data_root/task3/images/*.png + data_root/task3/labels/*.json
# 类别映射:Uterus=0,1-m/1-s=1/2,2-m/2-s=3/4,3-m/3-s=5/6,4-m/4-s=7/8
import json, numpy as np, cv2, pathlib
CLASS_MAP = {"uterus": 0, "1-m": 1, "1-s": 2, "2-m": 3, "2-s": 4,
"3-m": 5, "3-s": 6, "4-m": 7, "4-s": 8}
def rasterize(json_path: pathlib.Path, size=(250, 250)):
data = json.loads(json_path.read_text())
mask = np.full(size, 255, dtype=np.uint8) # 255 = 背景
for shape in data.get("shapes", []):
cid = CLASS_MAP.get(shape["label"].lower())
if cid is None:
continue # 未知标签跳过并记录
pts = np.asarray(shape["points"], dtype=np.int32)
cv2.fillPoly(mask, [pts], color=cid)
return mask # 逐像素类别图,供逐类 BCE/Dice 使用
if __name__ == "__main__":
sample = next(pathlib.Path("data_root/task3/labels").glob("*.json"))
m = rasterize(sample)
print(m.shape, np.unique(m))
注:Task 3 的标签文件格式(JSON/逐帧 PNG)以官方发布包实际内容为准;上述代码假定 LabelMe 原生导出格式(标注工具即 LabelMe),若发布包为已栅格化 mask 图像,则跳过本步直接读取。
§6.4 PyTorch DataLoader(Task 1 完整可运行)
<details>
<summary><b>展开完整 Dataset/DataLoader 代码(滑窗采样,官方划分)</b></summary>
# 目录结构预期:data_root/task1/frames/<video_id>/*.png(§6.3 产出)
# data_root/task1/labels/<video_id>.txt(逐帧阶段 1-7,1 fps 对齐)
# data_root 拼接关系:所有路径 = DATA_ROOT / task1 / {frames,labels} / <video_id>
# 最小可用子集:任意 1 台视频 + 标签即可实例化
# 注意:标签文件命名以官方发布包为准;若不一致,仅需调整 _read_labels 的匹配逻辑
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
from PIL import Image
TRAIN_IDS = [f"{i:02d}" for i in range(1, 11)] # 官方划分:01-10
VAL_IDS = [f"{i:02d}" for i in range(11, 15)] # 11-14
TEST_IDS = [f"{i:02d}" for i in range(15, 22)] # 15-21
NUM_PHASES = 7
class AutoLaparoPhaseDataset(Dataset):
"""手术阶段识别:返回 (seq_len, 3, 250, 250) 帧窗 + 中心帧标签。
窗口内所有帧必然来自同一台手术(视频级防泄漏)。"""
def __init__(self, data_root, video_ids, seq_len=16, stride=1, transform=None):
self.transform = transform
self.seq_len = seq_len
self.index = [] # (frame_files, labels, end_pos)
frames_root = Path(data_root) / "task1" / "frames"
labels_root = Path(data_root) / "task1" / "labels"
for vid in video_ids:
files = sorted((frames_root / vid).glob("*.png"))
labels = self._read_labels(labels_root / f"{vid}.txt", len(files))
for end in range(seq_len - 1, len(files), stride):
self.index.append((vid, end, files, labels))
@staticmethod
def _read_labels(path, n_frames):
vals = [int(x) for x in path.read_text().split()] if path.exists() else []
assert len(vals) >= n_frames, f"标签帧数不足: {path}"
return torch.tensor(vals[:n_frames], dtype=torch.long) - 1 # 1-7 → 0-6
def __len__(self):
return len(self.index)
def __getitem__(self, i):
vid, end, files, labels = self.index[i]
imgs = [Image.open(files[k]).convert("RGB")
for k in range(end - self.seq_len + 1, end + 1)]
if self.transform:
imgs = [self.transform(im) for im in imgs]
return torch.stack(imgs), labels[end]
def make_loader(data_root, ids, batch_size, shuffle, seq_len=16):
from torchvision import transforms as T
tfm = T.Compose([T.ToTensor(), T.Normalize([0.485, 0.456, 0.406],
[0.229, 0.224, 0.225])])
ds = AutoLaparoPhaseDataset(data_root, ids, seq_len=seq_len, transform=tfm)
return DataLoader(ds, batch_size=batch_size, shuffle=shuffle,
num_workers=4, pin_memory=True)
if __name__ == "__main__":
train_loader = make_loader("data_root", TRAIN_IDS, batch_size=8, shuffle=True)
x, y = next(iter(train_loader))
print(x.shape, y.shape) # torch.Size([8, 16, 3, 250, 250]) torch.Size([8])
</details>
Task 2 的 DataLoader 要点:输入仅取运动时刻 T=第 5 秒之前的子片段(16 帧 @ 3 fps),标签为 7 类运动模式;严禁把 T 之后的帧放进输入窗口(见 §6.5 坑点 5)。Task 3 推荐 COCO 格式转换后接入 mmdetection/detectron2 的实例分割管线,按 9 类(含部件)配置类别数。
§6.5 八大坑点
⚠️ 坑点 1:预处理口径不统一——1 fps、250×250 与黑边三件套(分类:预处理陷阱)
问题:官方所有基准数字建立在"25 fps→1 fps 抽帧、1920×1080→250×250、裁除黑边"的统一口径上;原始视频四周存在采集黑边,直接缩放会把黑边一并压入训练分布。
症状:训练曲线正常但测试 AC 比官方基线低 5-15 个百分点;或单卡显存被 1080p 帧瞬间打爆;复现表里永远对不上别人论文的数字。
解决:
- 简单方法:直接运行官方
t1_video2frame.py(仓库提供),不自己重写抽帧逻辑。- 进阶方法:自研管线时用 ffmpeg
fps=1抽帧 + 亮度阈值检测黑边裁剪 + 250×250 缩放,与官方逐帧 diff 抽查 50 帧确认对齐(代码见 §6.3)。- SOTA 方法:高分辨率研究(如 ViT 类骨干)可另建 480×480 管线,但必须在论文中单独声明口径,并与 250×250 官方口径双轨报告。
参考:官方 GitHub README;论文 §3.1。
⚠️ 坑点 2:帧级/clip 级随机划分造成时间泄漏(分类:数据泄漏)
问题:同一台手术相邻帧几乎相同(1 fps 下仍高度相关)。若用 sklearn
train_test_split对 83,243 帧直接随机划分,测试帧的"邻居"就躺在训练集里。
症状:验证 AC 轻松 95%+,测试集"成绩极好",论文送审被质疑;模型在真正的新手术上完全失效。
解决:
- 简单方法:永远使用官方 10/4/7 台视频级划分(§5.1),把 video_id 作为不可跨界分组键。
- 进阶方法:自定义划分时用
GroupShuffleSplit/GroupKFold(groups=video_id),并在代码中 assert 训练/测试 video_id 交集为空。- SOTA 方法:三任务联合实验时,额外检查 Task 2/3 样本来源视频是否渗入 Task 1 测试台,建立"全任务 × 全划分"的溯源矩阵(§5.3)。
参考:LoViT 论文遵循官方划分声明;Fox & Schoeffmann, ICMR 2022(划分对医疗视频分类性能的影响)。
⚠️ 坑点 3:阶段占比极端不均衡 + P2/P3 顺序可互换(分类:标签理解)
问题:P2 占 34.2% 而 P5 仅 1.9%(约 18 倍差距),朴素交叉熵会让模型偏向大类;同时 P2 与 P3 的先后顺序因术者习惯而异,并非固定时序。
症状:整体 AC 虚高(P2 一类就贡献三分之一),P5 召回接近 0;假设"阶段严格按 1→7 递进"的 CRF/状态机后处理反而掉点。
解决:
- 简单方法:报告分阶段 Precision/Recall 而非只报总体 AC;对 P1/P5 使用加权损失或过采样。
- 进阶方法:按帧数平方根倒数设置类别权重(
weight ∝ 1/sqrt(n_c)),并检查分阶段 F1 是否全面提升。- SOTA 方法:引入阶段先验时只建模"阶段对"的转移可能性而非全序约束,允许 P2/P3 互换;参考 RAMIE 论文对非固定阶段序列的分析(arXiv:2412.04039)。
参考:官网逐阶段占比表;RAMIE 论文 §3.1.2。
⚠️ 坑点 4:过分割——高帧级精度掩盖时序碎片化(分类:评估误用)
问题:过渡动作(器械进出、视角切换)常被模型切成大量 1-2 秒的碎片段,帧级 AC 依然可观,但阶段序列支离破碎, clinically 无用。
症状:AC 78% 但把一次连续的 P2 切成十几段;edit score 与 F1@k 远低于 AC;视频可视化里预测"闪跳"。
解决:
- 简单方法:除 AC 外必报 edit score 与 F1@k(10 秒宽松边界),LoViT 等工作已给出该口径的 AutoLaparo 参考值。
- 进阶方法:训练加平滑约束(如最小段长后处理/平滑损失),压制过度切换;RAMIE 论文证实平滑项显著缓解过分割。
- SOTA 方法:采用时序分割框架(ASformer 类 encoder-decoder)直接优化分段质量而非逐帧分类(RAMIE 论文)。
参考:RAMIE 论文 Discussion(over-segmentation 归因于过渡动作);SOTA2 榜单的 relaxed boundary 口径。
⚠️ 坑点 5:Task 2 时间泄漏——输入只能取运动时刻 T 之前(分类:数据泄漏)
问题:Task 2 的定义是"预测即将发生的镜头运动":每个 10 秒 clip 的运动时刻 T=第 5 秒,合法输入只有 T 前 5 秒(3 fps 下 16 帧)。把 T 后的帧放进输入窗口等于用答案预测答案。
症状:Task 2 accuracy 从 ~27% 飙到 90%+,兴冲冲写进论文后被审稿人一击致命;或 Static 类准确率异常完美。
解决:
- 简单方法:构建样本时硬编码窗口终点 ≤ T,对 clip 做单元测试验证第 16 帧时间戳 < 5 秒。
- 进阶方法:数据管线中把 clip 元数据(起点/终点/T)随样本落盘,训练日志抽样可视化窗口边界人工复核。
- SOTA 方法:探索多模态输入(视觉+器械分割 mask)提升合法窗口内的预测上限——官方基准 27.40% 说明该任务远未解决。
参考:论文 §3.2(运动时刻 T=第 5 秒的定义);官网 Task 2 说明。
⚠️ 坑点 6:Task 3 九类部件化命名——shaft 与 manipulator 必须分开(分类:标签理解)
问题:分割类别不是"4 种器械+1 个解剖"的 5 类,而是 9 类:每件器械拆分 shaft(杆身)与 manipulator(操作头)两个部件。误按 5 类配置输出通道会直接报 shape 错误,误按 4 类合并部件则指标无法与基准比较。
症状:训练报类别数不匹配错误;或"跑通了"但 mask AP 与 YOLACT 基准 54.09% 完全不可比。
解决:
- 简单方法:按
1-m/1-s/2-m/2-s/3-m/3-s/4-m/4-s/Uterus九元组配置模型输出与混淆矩阵。- 进阶方法:评估时既报 9 类部件 AP,也额外汇总"器械级"AP(shaft+manipulator 合并 IoU),服务于器械踪迹类应用。
- SOTA 方法:利用部件标注的层级结构做部件感知损失(part-aware loss),小目标类(4-m 仅 202 个标注、均 7,042 像素/帧)需重点过采样。
参考:论文 Table 2 及命名注释(‘1-m’/‘1-s’);SurgBench 的 Task 3 目录描述。
⚠️ 坑点 7:单中心单团队偏倚——跨中心泛化必然衰减(分类:偏倚陷阱)
问题:21 台手术全部来自同一医院、同一术者团队、同一套 Olympus 设备、3 个月窗口;阶段节奏、止血习惯、镜头操作风格都带有强烈团队印记。
症状:在 AutoLaparo 测试集 80%+ 的模型,接入其他医院数据流后阶段边界大面积漂移;LoViT 类模型在 Cholec80 与 AutoLaparo 上指标体系换算后差距明显。
解决:
- 简单方法:把数据集明确定位为"in-distribution 基准",任何对外部署声明都必须配跨中心验证。
- 进阶方法:做 leave-one-video-out 的稳定性分析,观察性能对单台手术的敏感度(21 台的方差极大:27-112 分钟)。
- SOTA 方法:用 Cholec80 预训练 + AutoLaparo 微调的跨术式迁移设置,量化"团队风格"可迁移成分;参考自监督基础模型在两套数据上的平行评测(npj Dig Med)。
参考:官网数据来源声明;RAI 元数据 rai:dataBiases。
⚠️ 坑点 8:跨论文引用成绩时划分与实现口径不一致(分类:评估误用)
问题:第三方论文对 AutoLaparo 划分的转述存在错误(如某篇将测试集误写为 9 台),且不同论文的指标组合(AC/PR/RE/JA vs F1 vs relaxed boundary)不统一。
症状:对比表里同一个"Trans-SVNet"出现 78.29% 与 82% 两个"正确"数字(一个测试集一个验证集);复现对比无从谈起。
解决:
- 简单方法:引用任何 AutoLaparo 成绩前,回溯到原始论文 Table 3-5 核对划分与指标(本页 §8.1 已给出核对后的表格)。
- 进阶方法:自己复现四个官方基线(SV-RCNet/TMRNet/TeCNO/Trans-SVNet 均有开源代码),用统一管线重跑后再进对比表。
- SOTA 方法:为对比实验发布配置文件与随机种子,采用 10 秒 relaxed boundary 等社区新口径时与官方口径双轨报告。
参考:论文官方基准表;RAMIE 论文中的划分转述勘误案例。
§6.6 数据增强
| 策略 | 是否安全 | 说明 |
|---|---|---|
| 水平翻转 | ❌ 危险 | 左右器械/镜头运动语义反转(Left/Right 标签失效) |
| 时间窗抖动(±2 帧内) | ✅ 安全 | 提升对阶段边界标注噪声的鲁棒性 |
| 色彩抖动/亮度对比度 | ✅ 安全 | 模拟白平衡与光源差异,注意保持出血红色调自然 |
| 高斯噪声/轻微模糊 | ✅ 安全 | 模拟烟雾与镜头污渍 |
| 随机裁剪(放大视野) | ⚠️ 谨慎 | 可能裁掉关键解剖(子宫),Task 3 分割任务慎用 |
| 时间方向反转 | ❌ 危险 | 手术不可逆,阶段序列被破坏 |
| 跨手术 MixUp/帧拼接 | ❌ 危险 | 产生临床上不存在的画面拼接,阶段与运动标签同时失真 |
§6.7 模型推荐
| 任务 | 推荐起点 | 进阶 | 适用说明 |
|---|---|---|---|
| Task 1 阶段识别 | TeCNO(多阶段时序卷积) | Trans-SVNet、LoViT | TeCNO 训练稳定、显存友好;Trans-SVNet 为官方最强基线(AC 78.29%) |
| Task 1 长视频建模 | TMRNet(记忆关系网络) | 长序列 Transformer | 需要跨分钟级上下文时选用 |
| Task 2 运动预测 | ResNet-50+LSTM(官方) | 视频 Transformer + 多模态融合 | 官方上限 27.40%,融合分割 mask 是明确的提升方向 |
| Task 3 分割 | YOLACT(官方最优 mask AP 54.09%) | Mask2Former 类 | 实时需求选 YOLACT 系列,离线精度选 Transformer 分割头 |
| 通用预训练 | 手术视频自监督模型 | EndoFM/手术基础模型 | 零样本 F1 低(<24),必须微调后使用(§8.1) |
§6.8 硬件需求
| 配置 | 适用实验 | 估算 |
|---|---|---|
| RTX 3090 / 4090(24 GB) | Task 1 基线复现(1 fps、250×250、batch 8×16 帧)、Task 3 YOLACT | 单卡数小时-数天 |
| V100 / A100(32-40 GB) | Task 1 长序列 Transformer、Task 2 视频分类 | LoViT 原实验配置(论文) |
| 存储 | 原始视频 + 帧缓存 + mask | ≥100 GB |
| CPU/内存 | ffmpeg 并行抽帧 | 16 核 / 64 GB 可大幅加速预处理 |
§6.9 评估指标代码
import numpy as np
def frame_accuracy(y_true, y_pred):
"""官方 Task 1/2 主指标:帧级(clip 级)准确率。"""
return float((np.asarray(y_true) == np.asarray(y_pred)).mean())
def edit_score(y_true, y_pred):
"""归一化编辑分数:衡量分段序列质量,压制过分割虚高(坑点 4)。"""
y_true, y_pred = list(y_true), list(y_pred)
n, m = len(y_true), len(y_pred)
dp = np.zeros((n + 1, m + 1), dtype=np.int32)
dp[:, 0] = np.arange(n + 1)
dp[0, :] = np.arange(m + 1)
for i in range(1, n + 1):
for j in range(1, m + 1):
sub = 0 if y_true[i - 1] == y_pred[j - 1] else 1
dp[i, j] = min(dp[i - 1][j] + 1, dp[i][j - 1] + 1, dp[i - 1][j - 1] + sub)
return 1.0 - dp[n, m] / max(n, m)
def per_phase_recall(y_true, y_pred, n_phases=7):
"""分阶段召回:暴露 P1/P5 等罕见类的失效(坑点 3)。"""
out = {}
for c in range(n_phases):
mask = np.asarray(y_true) == c
out[c] = float((np.asarray(y_pred)[mask] == c).mean()) if mask.any() else np.nan
return out
def f1_at_k(y_true, y_pred, k=10):
"""F1@k:预测段与真值段重叠 ≥k 帧记为 TP(10 秒宽松边界口径,
与 SOTA2/wizwand 榜单一致;k=10 即 10 秒 @ 1 fps)。"""
def to_segments(seq):
segs, start = [], 0
for i in range(1, len(seq) + 1):
if i == len(seq) or seq[i] != seq[start]:
segs.append((seq[start], start, i)) # (label, s, e)
start = i
return segs
def overlap(a_s, a_e, b_s, b_e, k):
inter = min(a_e, b_e) - max(a_s, b_s)
return inter >= k and inter > 0
gt, pr = to_segments(y_true), to_segments(y_pred)
tp = sum(1 for g in gt if any(g[0] == p[0] and overlap(g[1], g[2], p[1], p[2], k)
for p in pr))
tp_pr = sum(1 for p in pr if any(p[0] == g[0] and overlap(p[1], p[2], g[1], g[2], k)
for g in gt))
precision = tp_pr / len(pr) if pr else 0.0
recall = tp / len(gt) if gt else 0.0
return 2 * precision * recall / (precision + recall) if (precision + recall) else 0.0
官方 Task 1 指标组为 AC/PR/RE/JA(Jaccard);Task 3 使用 COCO 的 box AP 与 mask AP(IoU 0.5:0.05:0.95 平均)。社区新口径(10 秒宽松边界 F1/edit)见 §8.3。
§6.10 MLOps 笔记
- 版本对齐:数据集无版本号,建议以"下载日期 + 子数据集校验和"作为内部版本标记,写进实验跟踪系统。
- 预处理缓存:1 fps 抽帧结果按 video_id 目录缓存并计算哈希,避免多实验重复转码;缓存命中要在日志中显式打印。
- 数据卡:把 §2.4(无人口学元数据)与 §7.1(单中心)写进团队内部数据卡,任何对外报告模板自动引用。
- 许可合规:CI 中加入许可检查——CC-BY-NC-SA 4.0 禁止商用,衍生模型权重的服务化部署需另行获得作者授权(联系 ziyiwangx@gmail.com)。
- 监控漂移:上线后跟踪阶段先验分布(P2 占比、P1/P5 出现率)与预测分布的 KL 散度,分布偏移是跨中心失效的最早信号(§7.6)。
- 复现存档:每个实验冻结"数据下载日期 + 预处理脚本 commit + 随机种子"三元组,AutoLaparo 无版本号,该三元组是唯一可追溯锚点。
- 评测纪律:验证集(仅 4 台)只用于早停与一次超参选择;测试集(7 台)在项目周期内只允许提交一次最终结果,杜绝选择性报告。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单中心偏倚 | 21 台手术全部来自香港威尔斯亲王医院单一团队 | 高 | 跨中心验证、跨术式迁移训练(§6.5 坑点 7) |
| 时间窗口偏倚 | 全部采集于 2018 年 10-12 月,3 个月窗口 | 中 | 与新术式规范(如 ERAS 流程变化)对照解读 |
| 类不平衡 | P5 仅 1.9%、P1 仅 3.2%,P2 占 34.2% | 高 | 加权损失、分阶段指标、过采样(§6.5 坑点 3) |
| 器械分布偏倚 | LigaSure 标注 2,555 个(2-m+2-s),电钩仅 435 个 | 中 | 分层采样、部件级评估 |
| 设备单一 | Olympus 平台、固定分辨率/帧率 | 中 | 色彩/模糊增强,跨平台数据接入验证 |
| 标注者单一 | 无标注者间一致性系数量化 | 中 | 边界帧二次校验、报告标注方差敏感性分析 |
§7.2 标注质量
标注由 30 余年经验资深妇科医生 + 3 年经验专科医生完成,并经 proofread 与 cross-check 后发布(论文),在同类数据集中属于"资深临床团队+双重校验"的较高保障水平。未公开项:标注者间一致性(κ)、阶段边界的帧级容差定义、mask 轮廓的像素级复核比例。使用建议:对阶段过渡带(±5 秒)的预测保持容差,以 10 秒宽松边界指标补充严格帧级指标。
标注质量的三层保障与对应使用策略:
| 标注层 | 质量保障 | 使用者应对 |
|---|---|---|
| 视频级 workflow(7 阶段逐帧) | 资深术者标注 + 双重校验;逐帧覆盖无空洞 | 边界帧容差评估;勿假设 25 fps 粒度 |
| clip 级 motion(7 类) | 运动时刻 T 显式定义(第 5 秒),边界清晰 | 严格按 T 前窗口取输入(坑点 5) |
| 帧级 segmentation(9 类) | LabelMe 多边形 + 交叉检查;部件化命名系统化 | 遮挡/烟雾区边界带噪声,Dice/BCE 联训更稳 |
§7.3 泛化性
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 其他医院/术者(同术式) | 高 | 单中心 21 台、3 个月窗口;无第二中心数据可对照(官网/论文) |
| 跨术式(胆囊/肝/食管) | 高 | LoViT 等工作显示跨数据集指标显著变化(PMC11876726) |
| 跨平台(机器人手术) | 高 | RAMIE(机器人食管切除)阶段结构更复杂、动态更强(arXiv:2412.04039) |
| 分辨率迁移(250×250 → 1080p) | 中 | 官方全部基准在 250×250 口径下报告,高分辨率行为未验证 |
| 零样本视频-语言模型 | 极高 | 预训练 VLM 零样本 F1 最高仅 23.6(SOTA 榜单) |
§7.4 伦理
数据发布经 Joint CUHK-NTEC Clinical Research Ethics Committee 批准,视频为手术视野画面、不含任何患者个人信息(官网)。许可证 CC-BY-NC-SA 4.0:署名—非商业—相同方式共享;商用(包括将衍生模型服务化)需另行联系作者(ziyiwangx@gmail.com)。使用中不得尝试身份重识别,不得将模型用于未经前瞻验证的临床决策。
§7.5 公平性
数据集不包含人口学属性(年龄、种族、经济状态),无法做分亚群公平性审计——这本身是局限:模型在不同人群上的差异化表现无从在本数据上预警。手术团队为单一香港医学中心团队,术式风格的地域代表性有限。建议下游研究在接入多中心数据时补建人口学标注再做公平性分析。
对下游工程的三点具体提示:其一,模型输出的置信度校准不可跨中心外推,部署前必须在新中心重做温度缩放;其二,器械分布偏倚(LigaSure 主导)意味着"器械出现即判 P2/P3"的捷径特征可能形成,需在消融中显式检查;其三,若用于教学复盘产品,罕见阶段(P1/P5)的低召回应作为已知限制写入用户文档。
§7.6 数据漂移
采集窗口固定于 2018 年:此后子宫切除术的器械演进(如新型能量平台)、流程规范变化与术者代际差异都会造成时间维度的分布漂移。监控建议:跟踪 P2/P3 占比与阶段转换矩阵的变化;对 2020 年后采集数据先做先验分布比对再评估模型。
漂移监测的最小实现:上线系统每周聚合三个量——各阶段预测占比(对照官网先验:P2 34.2%、P5 1.9%)、平均阶段切换频率(过分割恶化的早期信号)、Task 3 类别频率(新器械引入会表现为电钩/抓取钳占比异常)。三者任一相对基线的偏移超过预设阈值即触发人工抽检。
§7.7 DAIMS 质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 每行一条帧级记录,结构扁平无嵌套 |
| 2 | 唯一标识 | ✅ | video_id + frame_index 组合唯一,clip/image 均有独立编号 |
| 3 | 特殊字符 | ⚠️ | 阶段/器械英文名含空格与连字符,CSV 解析需引号包裹 |
| 4 | 重复行 | ✅ | 逐帧顺序标注,无重复记录 |
| 5 | 缺失编码 | ✅ | 83,243 帧逐帧全覆盖,无缺失 |
| 6 | 标签标识 | ✅ | 阶段 1-7、运动 7 类、分割 9 类均有官方编码与名称对照 |
| 7 | 罕见类分组 | ⚠️ | P5 占 1.9%、电钩部件仅 202-435 个标注,需合并或重加权评估 |
| 8 | 偏倚评估 | ⚠️ | 单中心/单团队/3 个月窗口,官网与论文已自述(§7.1) |
| 9 | 数据字典 | ✅ | 官网 Table 与论文提供完整字段定义 |
| 10 | 信息性缺失解释 | ⚠️ | 无缺失字段,该项对本数据集不适用 |
| 11 | 设备记录 | ⚠️ | 记录 Olympus 平台与分辨率/帧率,未给出具体设备型号 |
| 12 | 共线性 | ✅ | 视频模态无特征共线性问题(不适用) |
| 13 | 编码映射 | ✅ | 7 阶段/9 分割类均有英文学术命名,可映射 SNOMED 术式语境 |
| 14 | 时间戳处理 | ⚠️ | 以 1 fps 帧索引表达时间,无绝对时钟时间戳 |
| 15 | 划分建议 | ✅ | 官方 10/4/7 视频级划分,社区标准做法一致 |
| 16 | 泄漏讨论 | ⚠️ | 官方未单独展开讨论;本页 §5.3 已给出三任务同源泄漏分析 |
| 17 | 标签分布 | ✅ | 官网逐阶段占比、逐类计数完整公开 |
| 18 | 测量偏倚 | ⚠️ | 标注依赖单一资深团队,无标注者间一致性系数 |
| 19 | 外部验证建议 | ✅ | 可对接 Cholec80/PmLR50/RAMIE 做跨术式验证(§5.5) |
| 20 | 版本记录 | ⚠️ | 未见官方版本号与更新日志(截至 2026-09) |
| 21 | 预处理脚本 | ✅ | 官方 t1_video2frame.py / t2_datapre.py 开源可复现 |
| 22 | 合规要求 | ✅ | CC-BY-NC-SA 4.0 + 伦理批准,条款清晰且获取即同意 |
| 23 | 多模态对齐 | ✅ | 三任务三层标注同源嵌套,层级关系明确(§4.4) |
| 24 | 去标识化 | ✅ | 手术视野视频、无个人信息,经伦理委员会批准发布 |
DAIMS 评分:19.5 / 24
评分解读:数据本身的结构完备度在手术视频数据集中属于第一梯队——唯一标识、全覆盖标注、官方划分、官方预处理脚本、多任务对齐五项核心能力齐备;失分集中在"外部可核查性":无版本号、无标注者一致性系数、无设备型号与患者元数据。这类失分不影响学术复现(官方口径完备),但限制临床级审计。
对你意味着什么:如果你做算法研究(阶段识别/分割/运动预测),可以放心按官方口径直接起跑,把精力放在时序建模与多任务融合上;如果你做工程落地,必须自行补三件事——内部版本标记(下载日期+校验和)、跨中心验证数据、以及"阶段过渡带容差"的产品级评估口径;如果你做注册/合规,本数据集只能支撑研究性叙述,临床验证需要另行设计前瞻性采集。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| AutoLaparo ← 自监督基础模型 | 香港中文大学等(npj Dig Med 2026) | 阶段识别 | 按官方划分微调 | 基础模型微调后超越官方基线 | 官方 83,243 帧划分被社区完整沿用(论文) |
| AutoLaparo ← RAMIE 迁移模型 | 荷兰 UMC 团队(arXiv 2024) | 阶段识别 | AC 83.18±9.75 vs Trans-SVNet 78.29 | 跨术式模型反超官方基线 | 层级注意力时序建模可跨术式迁移(arXiv:2412.04039) |
| AutoLaparo ← LoViT | Sci Rep(2025) | 阶段识别 | Precision 0.851 / Jaccard 0.559 | Cholec80+AutoLaparo 双数据评测 | 长视频 Transformer 在双术式上均有效(论文) |
| AutoLaparo ← 零样本 VLM | 多家(2024) | 阶段识别 | F1 最高 23.6 | 相对监督基线暴跌 45+ 分 | 手术视频-语言零样本仍不可用(榜单) |
§8 基准性能与生态
§8.1 排行榜(Task 1 手术阶段识别,官方测试集)
| 排名 | 模型 | 性能(AC/PR/RE/JA %) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Causal Hierarchical Attention(RAMIE 论文) | 83.18 / 80.17 / 77.05 / 65.84 | 2024 | ASformer 式 encoder-decoder + 平滑损失 | Benchmarking and Enhancing Surgical Phase Recognition Models for Robotic-Assisted Esophagectomy, arXiv:2412.04039, 2024 | 未开源 |
| 2 | LoViT | Precision 0.851 / Recall 0.659 / Jaccard 0.559(指标体系不同) | 2023/2025 | 长视频 Transformer + 相位转换图损失 | LoViT: Long Video Transformer for Surgical Phase Recognition, Scientific Reports(PMC11876726) | 论文未附 |
| 3 | Trans-SVNet | 78.29 / 64.21 / 62.11 / 50.65 | 2021 | 混合嵌入聚合 Transformer | Gao X, Jin Y, Long Y, Dou Q, Heng P-A. MICCAI 2021, LNCS, pp. 593-603. DOI 10.1007/978-3-030-87202-1_57 | 官方 |
| 4 | TMRNet | 78.20 / 66.02 / 61.47 / 49.59 | 2021 | 多尺度时序记忆关系网络 | Temporal Memory Relation Network for Workflow Recognition From Surgical Video, IEEE TMI, 2021 | 官方 |
| 5 | TeCNO | 77.27 / 66.92 / 64.60 / 50.67 | 2020 | 多阶段时序卷积(因果) | TeCNO: Surgical Phase Recognition with Multi-stage Temporal Convolutional Networks, MICCAI 2020 | 官方 |
| 6 | SV-RCNet | 75.62 / 64.02 / 59.70 / 47.15 | 2018 | ResNet + LSTM 端到端 | Jin Y, Dou Q, Chen H, Yu L, Qin J, Fu C-W, Heng P-A. IEEE TMI 37(5):1114-1126, 2018. DOI 10.1109/TMI.2017.2787657 | 官方 |
数值不可直接比较的原因:第 1-2 行来自不同团队的自选指标组合(RAMIE 论文报 ±std 的单次运行;LoViT 未报 AC 而以 Precision/Jaccard 为主指标),第 3-6 行为官方论文 Table 3 的统一口径(1 fps、250×250、官方划分)。跨行比较时请回读原始论文确认实现细节。
Task 2 / Task 3 官方基准(同口径,来自论文 Table 4-5):Task 2 最高 accuracy 27.40%(ResNet-50+LSTM,测试集);Task 3 最高 mask AP 54.09%(YOLACT,ResNet-50 骨干),Mask R-CNN box AP 52.10 / mask AP 51.70,YolactEdge 47.04 / 52.58。
§8.2 SOTA 总结与选型建议
阶段识别在 AutoLaparo 上已从 75.6%(2018 架构)演进到 83%+(2024 时序分割框架),但提升主要来自时序建模而非视觉骨干;P1/P5 罕见类与过分割仍是公开痛点。选型建议:追求复现与部署效率选 TeCNO/Trans-SVNet;追求精度上限选 encoder-decoder 时序分割框架并自建长序列管线;Task 2 与 Task 3 均未饱和,适合作为研究增量发表点而非工程基线。
三条演进线索的量化证据:
| 线索 | 起点 | 现状 | 解读 |
|---|---|---|---|
| 监督时序建模 | SV-RCNet AC 75.62(2018) | RAMIE 论文模型 AC 83.18(2024) | 约 +7.6 分,主要来自分段级时序架构 |
| 预训练表示 | ImageNet 监督初始化 | AutoLaparo SSL F1 70.7 / EndoFM 68.9(2023.12) | 手术域自监督预训练稳定超越 ImageNet 初始化 |
| 零样本视频-语言 | — | 最好 F1 23.6(PeskaVLP,2024.09) | 零样本路线在该任务尚不可用,必须微调 |
榜单口径详见 wizwand AutoLaparo 页(截至 2026-09);跨榜单比较需回到 §8.3 的协议说明。
§8.3 评测协议
官方协议:Task 1 以 1 fps/250×250 输入、官方 10/4/7 划分,报 AC/PR/RE/JA 四指标;Task 2 以 3 fps 16 帧窗口(T=第 5 秒前)报 accuracy;Task 3 以 ResNet-50 骨干报 COCO box/mask AP。社区扩展协议:10 秒宽松边界指标与 edit score(SOTA2 榜单口径)。任何自定义协议必须与官方口径双轨报告(§6.5 坑点 8)。
§8.4 相关数据集
| 数据集 | 术式 | 规模 | 与 AutoLaparo 的关系 |
|---|---|---|---|
| Cholec80 | 腹腔镜胆囊切除 | 80 台、平均 39 分钟、7 阶段 | 最常用跨术式对照,文献最深(LoViT 描述) |
| PmLR50 | 腹腔镜肝切除 | 50 台、23,037 帧、5 类 | 第二腹腔镜术式基准(npj Dig Med) |
| RAMIE | 机器人食管切除 | 27 台、105,387 训练帧 | 跨平台(机器人)压力测试集(arXiv:2412.04039) |
| SurgBench | 统一手术视频基准 | 汇集含 AutoLaparo 在内的多任务数据 | 上游统一评测框架(arXiv:2506.07603) |
§8.5 关键论文 Top 10
- Wang Z, Lu B, Long Y, Zhong F, Cheung T-H, Dou Q, Liu Y-H. AutoLaparo: A New Dataset of Integrated Multi-tasks for Image-guided Surgical Automation in Laparoscopic Hysterectomy. MICCAI 2022, LNCS 13437: 486-496. DOI 10.1007/978-3-031-16449-1_46——数据集本体论文,定义三任务与全部基准。
- Jin Y, Dou Q, Chen H, Yu L, Qin J, Fu C-W, Heng P-A. SV-RCNet: Workflow Recognition from Surgical Videos Using Recurrent Convolutional Network. IEEE TMI 37(5):1114-1126, 2018. DOI 10.1109/TMI.2017.2787657——CNN+RNN 阶段识别开山之作,AutoLaparo 官方基线。
- Gao X, Jin Y, Long Y, Dou Q, Heng P-A. Trans-SVNet: Accurate Phase Recognition from Surgical Videos via Hybrid Embedding Aggregation Transformer. MICCAI 2021, LNCS, pp. 593-603. DOI 10.1007/978-3-030-87202-1_57——官方最强基线(AC 78.29%)。
- TeCNO: Surgical Phase Recognition with Multi-stage Temporal Convolutional Networks. MICCAI 2020——多阶段时序卷积,工程首选基线(作者列表见原论文)。
- Temporal Memory Relation Network for Workflow Recognition From Surgical Video. IEEE TMI, 2021——长程时序记忆建模基线(作者列表见原论文)。
- He K, Gkioxari G, Dollár P, Girshick R. Mask R-CNN. ICCV 2017——两阶段实例分割参照系,Task 3 官方基线。
- Bolya D, Zhou C, Xiao F, Lee Y-J. YOLACT: Real-time Instance Segmentation. ICCV 2019——实时分割,Task 3 官方最优(mask AP 54.09%)。
- Benchmarking and Enhancing Surgical Phase Recognition Models for Robotic-Assisted Esophagectomy. arXiv:2412.04039, 2024——当前测试集 AC 最高的已公开模型(83.18%)。
- LoViT: Long Video Transformer for Surgical Phase Recognition. Scientific Reports(PMC11876726)——长视频 Transformer 在 Cholec80+AutoLaparo 双基准验证。
- Large-scale Self-supervised Video Foundation Model for Intelligent Surgery. npj Digital Medicine(s41746-026-02403-0)——手术视频自监督基础模型,采用 AutoLaparo 官方划分作为核心评测之一。
§8.6 社区活跃度
| 维度 | 数据(截至 2026-09) |
|---|---|
| GitHub Star / Fork / Open Issues | 21 / 1 / 3(GitHub API) |
| 仓库创建 / 最近推送 | 2022-06-13 / 2025-03-21 |
| 引用轨迹 | Semantic Scholar 86+(截至 2026-09),MICCAI 2022 起持续被阶段识别、自监督、VLM 评测三条线引用 |
| 支持渠道 | 官方邮箱 ziyiwangx@gmail.com;无官方 Discord/论坛 |
社区规模属于"专业小众基准"档位:Star 不高但引用增长稳定,且榜单与综述(SOTA2/wizwand、Frontiers 系统综述、npj 基础模型)持续收录,数据可用性风险低。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| 官方数据集网站 | 数据入口 | autolaparo.github.io | — | 三个子数据集唯一官方下载源 |
| 官方代码仓库 | 预处理+基准 | ziyiwangx/AutoLaparo | 21 | t1_video2frame.py/t2_datapre.py 与四个基线链接 |
| 原始论文(arXiv) | 论文 | arXiv:2208.02049 | — | 全部规格数字的权威出处 |
| SOTA 榜单 | 排行榜 | SOTA2/wizwand AutoLaparo 页 | — | 追踪阶段识别新成绩 |
| LoViT 论文 | 后续 SOTA | PMC11876726 | — | 长视频 Transformer 双基准参考 |
| RAMIE 论文 | 后续 SOTA | arXiv:2412.04039 | — | 时序分割框架与跨术式分析 |
§9 相关资源与引用
§9.1 官方资源
- 数据集官网(下载):autolaparo.github.io
- 官方代码与基准:github.com/ziyiwangx/AutoLaparo(含 t1_video2frame.py、t2_datapre.py)
- 论文预印本:arXiv:2208.02049
- 论文正式版:Springer LNCS 13437, pp. 486-496, DOI 10.1007/978-3-031-16449-1_46
- 联系与授权:ziyiwangx@gmail.com(学术问题、商用授权)
衍生资源索引(非官方、经同行评审或公开榜单收录):
| 资源 | 类型 | 入口 |
|---|---|---|
| SurgBench 统一评测框架 | 上游基准整合(含 AutoLaparo) | arXiv:2506.07603 |
| 手术视频自监督基础模型 | 基础模型 + 官方划分评测 | npj Digital Medicine |
| SOTA2/wizwand 榜单 | 阶段识别排行追踪 | 榜单页 |
| LoViT | 长视频 Transformer SOTA | PMC11876726 |
| RAMIE 迁移研究 | 时序分割框架 + 跨术式分析 | arXiv:2412.04039 |
§9.2 BibTeX 引用块
@article{wang2022autolaparo,
title = {AutoLaparo: A New Dataset of Integrated Multi-tasks for Image-guided
Surgical Automation in Laparoscopic Hysterectomy},
author = {Wang, Ziyi and Lu, Bo and Long, Yonghao and Zhong, Fangxun and
Cheung, Tak-Hong and Dou, Qi and Liu, Yunhui},
journal = {arXiv preprint arXiv:2208.02049},
year = {2022}
}
@inproceedings{jin2018svrcnet,
title = {SV-RCNet: Workflow Recognition from Surgical Videos Using Recurrent
Convolutional Network},
author = {Jin, Yueming and Dou, Qi and Chen, Hao and Yu, Lequan and Qin, Jing
and Fu, Chi-Wing and Heng, Pheng-Ann},
booktitle = {IEEE Transactions on Medical Imaging},
volume = {37},
number = {5},
pages = {1114--1126},
year = {2018},
doi = {10.1109/TMI.2017.2787657}
}
@inproceedings{gao2021transsvnet,
title = {Trans-SVNet: Accurate Phase Recognition from Surgical Videos via
Hybrid Embedding Aggregation Transformer},
author = {Gao, Xin and Jin, Yueming and Long, Yonghao and Dou, Qi and
Heng, Pheng-Ann},
booktitle = {Medical Image Computing and Computer Assisted Intervention (MICCAI)},
pages = {593--603},
year = {2021},
doi = {10.1007/978-3-030-87202-1_57}
}
@inproceedings{he2017maskrcnn,
title = {Mask R-CNN},
author = {He, Kaiming and Gkioxari, Georgia and Doll{\'a}r, Piotr and
Girshick, Ross},
booktitle = {Proceedings of the IEEE International Conference on Computer Vision (ICCV)},
year = {2017}
}
@inproceedings{bolya2019yolact,
title = {YOLACT: Real-time Instance Segmentation},
author = {Bolya, Daniel and Zhou, Chong and Xiao, Fanyi and Lee, Yong Jae},
booktitle = {Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
year = {2019}
}
§9.3 引用指南
使用数据集、官方代码或基准结果时必须引用 wang2022autolaparo(官方要求,GitHub README);使用或复现基线模型结果时请同时引用对应模型论文(§8.5);跨论文比较成绩前回读 §8.1 的口径说明。此外,本百科页面亦持续追踪后续 SOTA(LoViT、RAMIE 迁移研究、自监督基础模型),如需引用最新排名请以 §8.1 榜单与原始论文为准。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 |
|---|---|
| fast-model(CodeBuddy Code 内置模型) | 检索结果综合、事实抽取、初稿撰写 |
§10.2 AI 参与范围
AI 完成多轮网络检索的事实汇总(8 次检索 + 3 次定点抓取)、FACTS 事实清单整理、全文初稿撰写与格式排版;全部数字均标注来源链接,无 AI 自行推算的规模数字。章节结构、医学编码映射取舍、坑点筛选与最终发布判断由人工完成。
§10.3 输入来源列表
- Wang Z, et al. AutoLaparo. MICCAI 2022, LNCS 13437: 486-496. DOI 10.1007/978-3-031-16449-1_46
- AutoLaparo 官方数据集网站. http://autolaparo.github.io/
- AutoLaparo 官方 GitHub 仓库. https://github.com/ziyiwangx/AutoLaparo
- arXiv:2208.02049 摘要页. https://arxiv.org/abs/2208.02049
- ar5iv 论文全文渲染. https://ar5iv.arxiv.org/html/2208.02049
- PlumX 引用计量(DOI 10.1007/978-3-031-16449-1_46). https://plu.mx/plum/a/?doi=10.1007%2F978-3-031-16449-1_46
- Semantic Scholar 作者页(Ziyi Wang). https://www.semanticscholar.org/author/Ziyi-Wang/2117966978
- LoViT: Long Video Transformer for Surgical Phase Recognition. PMC11876726
- Benchmarking and Enhancing Surgical Phase Recognition Models for Robotic-Assisted Esophagectomy. arXiv:2412.04039
- Large-scale Self-supervised Video Foundation Model for Intelligent Surgery. npj Digital Medicine, s41746-026-02403-0
- SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis. arXiv:2506.07603
- SOTA2/wizwand AutoLaparo 阶段识别榜单. https://www.wizwand.com/sota/phase-recognition-on-autolaparo-test 及 https://www.sota2.com/research/sota/surgical-phase-recognition-on-autolaparo-test
- ICD-11 MMS 2E86.0(Leiomyoma of uterus). https://www.findacode.com/icd-11/code-455734276.html
- BioPortal SNOMED CT 236888001(Laparoscopic total hysterectomy). https://bioportal.bioontology.org/ontologies/SNOMEDCT?conceptid=http%3A%2F%2Fpurl.bioontology.org%2Fontology%2FSNOMEDCT%2F236888001&p=classes
- NHS OpenCodelists 子宫颈完整切除码表(SNOMED 交叉核对). https://www.opencodelists.org/codelist/nhsd-primary-care-domain-refsets/nocx_cod
- GitHub Repository API(ziyiwangx/AutoLaparo,截至 2026-09). https://api.github.com/repos/ziyiwangx/AutoLaparo
- Jin Y, et al. SV-RCNet. IEEE TMI 2018(经 OUCI 与 arXiv-vanity 引文核对). DOI 10.1109/TMI.2017.2787657
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 schema_org(URL 占位、字段完整性) | 千方病案医学编辑部 | 对照宪法模板逐字段核对 | ✅ 已通过/已验证 |
| §2 医学背景(ICD-11/SNOMED 编码、术式描述) | 千方病案医学编辑部(医学审核) | 编码回源核对(findacode/BioPortal/OpenCodelists) | ✅ 已通过/已验证 |
| §4 数据结构与 DAIMS 字段字典 | 千方病案医学编辑部(数据工程审核) | 与官网 Table、论文 Table 逐项比对 | ✅ 已通过/已验证 |
| §5-§6 划分、预处理与 8 个坑点 | 千方病案医学编辑部(数据工程审核) | 官方脚本口径复现核对 + 论文 limitations 提取 | ✅ 已通过/已验证 |
| §8 基准数字与引用 | 千方病案医学编辑部 | 论文 Table 3-5 与原始文献逐值核对 | ✅ 已通过/已验证 |
| 全局排版(G1/G2/G3)与纯净度 | 千方病案医学编辑部 | check_md.py 全绿 + 人工抽查 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
全文各章节初稿均由 AI 生成;§0 审核声明、§2.1/§2.1b 编码映射的最终取舍、§6.5 坑点的真实性与可操作性、§7.7 DAIMS 评分与解读、§10 本声明卡经人工修订与确认。
其中以下内容为纯人工撰写结论,未使用 AI 推理:官方划分的第三方转述勘误结论(§5.2 表)、Task 3 统计口径修正(§4.3)、以及跨论文成绩不可比性的判定(§8.1 注)。
§10.6 最后人工审核日期
2026-09-05(与 §0.3 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- EndoVis-Challenges — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
- cholecseg8k — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
- endoscapes — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
- Kvasir-HyperKvasir — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
- heico — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
- ETIS-Larib — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割
- kvasir-instrument — 共享标签:医学影像 / 手术视频 / 医学图像分割
- cadis — 共享标签:医学影像 / 手术视频 / 医学图像分割
- fetreg — 共享标签:医学影像 / 手术视频 / 医学图像分割
- autoimplant — 共享标签:医学影像 / 手术视频 / 医学图像分割
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

