信息速览

HeiCo — 结直肠腹腔镜手术器械分割 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | HeiCo(Heidelberg Colorectal,海德堡结直肠数据集) |
| 英文全称 | Heidelberg Colorectal Data Set for Surgical Data Science in the Sensor Operating Room |
| 别名/简称 | HeiCo;海德堡结直肠腹腔镜手术分割数据集 |
| 疾病分类(ICD-11 编码+中文名) | 结直肠外科手术视频(所涉基础病变含结直肠肿瘤,见 §2.1 映射说明) |
| SNOMED CT | 见 §2.1b 映射说明 |
| 数据模态 | 腹腔镜手术视频 + 手术室器械传感器信号流(14 路) |
| AI 任务类型 | 手术器械检测 / 二值分割 / 多实例分割 / 手术相位识别 |
| 样本总数 | 30 段手术视频;10,040 帧器械分割标注帧 |
| 数据大小 | 官方未公开总量(视频含降采样后 mp4 + CSV 传感器/相位标注) |
| 数据格式 | 视频(960×540 降采样)+ CSV + PNG 掩码 |
| 许可证 | CC BY-NC-SA(署名—非商业—相同方式共享) |
| 访问级别 | 注册后开放(Synapse 平台申请) |
| DUO 标签 | NCU(非商业) |
| 语言 | 标注语义为英文;接口无语言依赖 |
| 首发日期 | 2020(Synapse DOI syn21898456);数据论文 2021-04-12 |
| 最后更新 | 2021-04-12(数据论文发表) |
| 发布机构 | 德国癌症研究中心(DKFZ)+ 海德堡大学医院 |
| 官方主页 | https://link.springer.com/article/10.1038/s41597-021-00882-2 |
| 下载地址 | https://www.synapse.org/#!Synapse:syn21898456 |
| DOI | 10.1038/s41597-021-00882-2 |
| 引用次数 | 约 40–90(多来源快照不一,含 Nature 文章页快照 39 与聚合站更高值,未见统一 Google Scholar 实时数) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有官方挑战赛划分与评测脚本,但需 Synapse 注册申请、掩码/相位需自行组装,且相位为单标注者 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、手术相位与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HeiCo 采用 CC BY-NC-SA 许可,数据托管于 Synapse 平台(DOI 10.7303/syn21898456),获取通常需在 Synapse 注册并同意使用条款;非商业用途方可使用,衍生作品须以相同许可发布并引用原始论文。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? HeiCo 是一套记录了 30 台真实结直肠腹腔镜手术的带标注视频数据,由德国海德堡的 DKFZ(德国癌症研究中心)与海德堡大学医院联合发布。数据远不只是"手术录像":每一帧都被标记了手术进行到哪一步(共 14 类手术相位,如"游离乙状结肠与降结肠"“游离脾曲”"游离横结肠"等),并且有超过 10,000 帧被进一步做了精细标注——画面里的每一把手术器械(钳、剪、电凝钩、超声刀等)都被逐像素勾勒出轮廓掩码,甚至可以区分同一帧里同时出现的多把不同器械(即"实例"级的语义)。除此之外,每帧还附带了 14 路来自手术室设备的传感器读数(气腹压力、气体流量、灯光强度、相机参数等),构成一个少有的"传感器手术室"多模态数据集。
为什么重要? 腹腔镜手术机器人、术中辅助导航要"看见"器械在哪里,必须先学会在出血、冒烟、运动抖动、器械互相遮挡这些真实手术的恶劣画面里把器械稳定认出来。过去公开的腹腔镜数据大多集中在相对简单的胆囊切除术,而且往往只来自一家医院的一台内镜——模型很容易"记住"环境而非学会泛化。HeiCo 的设计初衷正是攻克"换一种手术、换一家医院就认不出来"这个老大难问题:它同时覆盖三类复杂度更高的结直肠手术,并配套多实例器械分割掩码与多模态传感器流。正因为这份针对鲁棒性与泛化能力的刻意设计,它被用作 EndoVis 2017 与 ROBUST-MIS 2019 两届国际挑战赛的官方数据,其中 ROBUST-MIS 用三阶段递增"域间隙"的评测设计,第一次在腹腔镜器械感知领域把"泛化衰减"量化成了可复现的结论——算法在训练域上表现好,不代表到了陌生的术式或器材下依然稳定。
我能用它做什么? 你可以训练一个语义/实例分割网络,把手术画面中的器械像素精确抠出(二值分割),或更进一步区分画面里到底是哪一把器械(多实例分割);也可以基于逐帧的 14 相位标注训练一个手术相位/工作流识别模型,判断手术当前处于哪个操作步骤;还能把视频与 14 路传感器流做多模态融合建模,研究"传感器手术室"下的上下文理解。拿到 Synapse 账号并按 CC BY-NC-SA 条款申请后即可下载。用官方 ROBUST-MIS 三阶段划分评测你的算法,能直接回答"我的模型在跨术式、跨域的陌生数据上还稳不稳"这一关键问题——这正是本数据集区别于一般单任务分割集的核心价值所在。
15 秒名词速查:阅读下文前先建立几个术语锚点,避免概念混淆——
| 术语 | 含义 |
|---|---|
| 术式(surgery type) | 手术类型:全结直肠切除术 / 直肠切除术 / 乙状结肠切除术,各 10 例 |
| 相位(phase) | 手术进行的步骤标签,共 14 类,逐帧给出 |
| 实例掩码(instance mask) | 把每把器械分别编号(1、2…)的逐像素掩码 |
| 二值分割 vs 多实例分割 | 前者只问"是不是器械",后者还问"是哪一把" |
| 域间隙(domain gap) | 训练与测试数据在术式/器材/中心上的差异,ROBUST-MIS 用它分三阶段评测 |
| 传感器流(sensor stream) | 气腹机、灯、相机等设备读数,每帧 14 路,作为上下文信号 |
§1.1 摘要
HeiCo(Heidelberg Colorectal)是首个以**鲁棒性(robustness)与泛化性(generalization)**为核心目标、用于手术器械检测与分割公开基准的腹腔镜数据集[^1]。论文摘要开门见山:此前算法"在受控环境表现尚可,但在存在血液、烟雾或运动伪影的挑战性图像上仍易失效,且难以泛化到未经训练的其他术式或医院"[^1][^2]。为填补这一空白,海德堡团队在德国海德堡大学医院的集成手术室 KARL STORZ OR1 FUSION® 中,于常规手术流程里录制了 30 台手术,覆盖三类结直肠手术各 10 段——全结直肠切除术(proctocolectomy)、直肠切除术(rectal resection)与乙状结肠切除术(sigmoid resection)[^2]。
数据层面,原始视频以 1920×1080 采集,发布版降采样为 960×540 以控制体积[^3]。每段视频全程配有手术相位标注(共 14 类),并在超过 10,000 帧上标注了器械存在性与逐实例(instance-wise)分割掩码,官方图注给出的提取帧数为 10,040[^2][^4]。每帧还关联 14 路手术室设备传感器信号(气腹机、手术灯、内镜灯、相机白平衡/增益/曝光等),构成"视频 + 传感器"双模态[^5]。为满足伦理与欧盟 GDPR,腹部以外的体外片段被人工识别并以蓝色帧替换完成去标识化[^2]。
在发布与生态上,HeiCo 以 CC BY-NC-SA 许可托管于 Synapse(DOI 10.7303/syn21898456),数据论文于 2021-04-12 发表于 Scientific Data 8:101[^1][^9]。它先后支撑了 MICCAI EndoVis “Surgical workflow analysis in the sensor operating room 2017” 挑战(提供相位与设备上下文)与 “ROBUST-MIS 2019” 挑战(二值/多实例检测/多实例分割三任务)[^1][^2][^6]。ROBUST-MIS 基于该数据设计的三阶段"域间隙递增"评测,直接量化了算法性能随训练/测试数据域差距增大而下降的现象,是该领域公认的关键实证结论[^6]。
摘要层面的一句话定位:HeiCo = 面向"器械感知"与"手术工作流"的、带多模态传感器上下文的结直肠腹腔镜鲁棒性基准。它的三层标注(像素级分割 / 帧级相位 / 帧级传感器与存在性)决定了它既不是"纯分割集"也不是"纯相位集",而是少数能把"感知—上下文—多模态"串起来研究的综合数据资源。
§1.2 战略价值
鲁棒性与泛化性基准空白填补。 论文引言明确指出:此前公开的腹腔镜数据多来自较简单手术(如胆囊切除术)或体外训练环境,且通常来自单一中心与单一内镜,导致方法在出血、烟雾、运动伪影等挑战画面上失准,也难以迁移到其他医院或术式[^1][^2]。HeiCo 用三类复杂度更高的结直肠手术、单帧最多 0–7 把器械并存、>70% 帧仅含 1–2 把器械的真实手术画面,为"在真实复杂手术中认器械"提供了更贴近临床也更难的公共基准[^2][^10]。ROBUST-MIS 基于该数据的三阶段域间隙评测,将"性能随域间隙增大而下降"这一泛化痛点变成可量化、可复现的公开结论,为后续域自适应与泛化研究提供了统一的试验场[^6]。
多模态"传感器手术室"价值。 HeiCo 并不止步于纯视觉:它为每一帧同步提供 14 路手术室设备传感器信号(气腹压、气腹流量、手术灯强度、内镜灯光强、相机白平衡/增益/曝光等),连同逐帧手术相位作为上下文[^2][^5]。这种"视频 + 设备信号 + 相位上下文"的三重结构,使它成为"传感器手术室(sensor operating room)"研究——即利用术中多模态数据做情境感知辅助——少有的公开训练场。在泛化维度上,结合同机构海德堡团队后续产出的 HeiChole(33 段胆囊手术、7 相位、21 器械)等数据集,可以构建"跨术式 + 跨数据源"的迁移评测链,进一步检验算法在脱离采集环境后的真实鲁棒性[^7]。
对公平评测方法论的贡献。 依托 HeiCo 展开的 ROBUST-MIS 不只发布了数据,更把"准确度 + 鲁棒度双排名、5% 分位最差样本聚合、bootstrap 置信区间、challengeR 统计工具"这套严谨评测协议引入手术数据科学[^2][^6]。对任何想拿 HeiCo 做基准的研究者,这既是一份评测规范的蓝本,也提醒我们:单一指标(如均值 DSC)会掩盖在最困难帧上的失败,只有结合困难帧分层与鲁棒度排名的多维度评测,才能得到可信的算法对比[^6]。
面向外科 AI 落地的一线价值。 对把"术中实时辅助"当目标的团队,HeiCo 的意义不只是"又一个分割数据集",而是提供了检验"感知层在真实、复杂、跨域手术中稳不稳"的公开标尺:先在 HeiCo 三阶段评测上证明你的感知模块跨域不失稳,再谈接入导航、技能或并发症系统——这比拿一套自采集单中心数据自证有力得多,也更容易被监管与临床审阅者采信[^1][^6]。
§1.3 同类数据集横向对比
在腹腔镜手术数据科学领域,器械分割与手术工作流分析常共享或交替使用若干公开集。下表把 HeiCo 与最常被并列讨论的数据集做一横向对比,重点放在规模、模态、标注粒度和差异化定位上[^7]。
| 数据集 | 术式 | 规模 | 模态 | 标注 | 差异化定位 |
|---|---|---|---|---|---|
| HeiCo | 三类结直肠手术(全结直肠、直肠、乙状结肠) | 30 视频,10,040 帧掩码 | 视频 + 14 路传感器 | 14 相位 + 器械实例分割 | 多术式 + 多实例分割 + 传感器流;跨域鲁棒性基准 |
| Cholec80 / CholecT50 | 胆囊切除(cholecystectomy) | 80 / 50 视频 | 视频 | 手术相位 / 器械+动作+目标三元组 | 单术式、规模更大;工具使用识别 |
| HeiChole | 胆囊切除 | 33 视频(22 h) | 视频 + 设备数据 | 7 相位 + 4 动作 + 21 器械 | 海德堡体系,聚焦工作流与技能分析 |
| ROBUST-MIS 挑战子集 | 三类结直肠手术 | 10,040 帧 | 视频 | 二值/多实例分割 | HeiCo 的官方基准切分,含三阶段域间隙评测 |
几点区分提醒:Cholec 系列以胆囊这种较简单的腹腔镜术式、更大视频量为卖点;HeiChole 与 HeiCo 同出海德堡,但 HeiChole 聚焦胆囊工作流与技能、相位体系更精简(7 相位),两者术式不同,不可混用相位标签体系;ROBUST-MIS 子集可视为 HeiCo 的"评测专用"切分——它取了 10,040 帧并给定三阶段训练/测试划分与评测脚本,是做器械分割基准的首选,而完整 HeiCo 才带全视频、传感器流与相位上下文[^6][^7]。HeiCo 的独特组合在于"多术式 + 逐实例分割 + 传感器多模态"三者兼得,且从设计之初就把跨术式/跨机构泛化评测作为一等公民。
§1.4 版本时间轴
HeiCo 没有多版本迭代,但有几个关键的时间锚点构成其"数据—挑战—论文"主线:
| 时间 | 事件 |
|---|---|
| 2017 | HeiCo 数据支撑 MICCAI EndoVis “Surgical workflow analysis in the sensor operating room 2017” 挑战赛(提供相位与设备上下文标注)[^2] |
| 2019 | 数据用于 ROBUST-MIS 2019 挑战(二值/多实例检测/多实例分割,三阶段域间隙评测)[^1][^6] |
| 2020-05 | 数据论文预印本 arXiv:2005.03501 发布[^8] |
| 2020 | Synapse 托管版本登记发布(DOI 10.7303/syn21898456,由 Bodenstedt 登记)[^9] |
| 2021-04-12 | 正式数据论文发表于 Scientific Data 8:101[^1] |
理解这个时间轴的意义在于:完整 HeiCo 与 ROBUST-MIS 子集在 Synapse 上分别可用,引用时请按所使用数据形态选择对应的论文/DOI(完整数据引 Sci Data 论文,ROBUST-MIS 切分另引 ROBUST-MIS 论文)[^1][^6]。
引用口径提醒:这条时间轴也揭示了 HeiCo 的"论文——数据"双重标识体系。数据论文 DOI(10.1038/s41597-021-00882-2)描述数据集与标注规范,Synapse 数据 DOI(10.7303/syn21898456)标识实际托管文件[^9]。做研究登记或数据引用时二者宜并列给出,确保审稿人既能读到规范又能找到文件。
§1.5 典型应用场景
- 手术器械分割基准评测:训练 U-Net、Mask R-CNN 等做二值分割与多实例分割,用官方 ROBUST-MIS 评测脚本(含 DSC/NSD 与下载)对比公开榜成绩[^2][^6]。
- 跨域鲁棒性研究:利用三阶段(Stage 1→3)训练/测试划分研究"域间隙增大对性能的衰减曲线",复现或改进域自适应方法[^6]。
- 手术工作流/相位识别:基于逐帧 14 相位标注训练时序相位识别;注意按术式支持的相位子集评估[^3][^5]。
- 多模态手术数据分析:联合视频 + 14 路传感器流(气腹压、灯强、相机参数)建模"传感器手术室"上下文,做情境感知辅助的前置研究[^5]。
- 器械存在性检测(presence):判断画面是否含器械及其数量(0–7),可作为实时辅助或技能分析的前置门控模块,空帧(负样本)可在此被显式利用[^2][^6]。
§2 医学背景
⚠️ 说明:HeiCo 是手术过程视频数据集,不提供患者诊断标签或结局。下述 ICD-11/SNOMED CT 映射描述的是这些切除术式所针对的结直肠病变与解剖部位,用于帮助理解标注语义的临床语境,而非数据集内已编码的诊断字段。
§2.1 ICD-11 编码映射
映射本质:HeiCo 是三术式的手术过程视频集,不以诊断为单位组织。下表把"术式名称 → 主要解剖部位/常见适应证"映射到 ICD-11 的疾病语境编码,仅供理解标注语义参考;数据集本身不含任何患者诊断编码。
| 术式/部位 | ICD-11 相关编码(疾病语境) | 中文 |
|---|---|---|
| 结肠切除术(全结直肠切除术中的结肠部分) | 2B90(结肠恶性肿瘤语境) | 结肠 |
| 直肠切除/切除术 | 2B91(直肠恶性肿瘤语境) | 直肠 |
| 乙状结肠切除术 | 乙状结肠病变相关编码 | 乙状结肠 |
| 全结直肠切除术(proctocolectomy) | 涉及结肠+直肠的根治性切除 | 全结直肠切除 |
临床注意:三类术式既用于恶性肿瘤也用于良性病变(如炎症性肠病、家族性腺瘤性息肉病)及溃疡性结肠炎相关全结肠切除,确切适应证无法从视频标注还原。需要 ICD-11 精确诊断代码构建患者队列时,应回到手术中心的电子病历系统,切勿从 HeiCo 推导诊断。上表中 2B90/2B91 为 WHO ICD-11 结直肠恶性肿瘤主类编码的语境引用,供理解"切除术针对的病变类型"使用。
§2.1b SNOMED CT 映射
SNOMED CT 是临床术语标准,常用于把标注语义映射到结构化术语。下列概念码为语义参考(不同 SNOMED 版本概念标识符有差异),用于帮助工程侧理解"这类术式到底在切哪里、用哪些解剖概念":
| 标签 | ICD-11(语境) | SNOMED CT 概念码(参考) | 术语 |
|---|---|---|---|
| proctocolectomy | 结肠+直肠切除 | 全结直肠切除术(含回肠储袋相关) | Proctocolectomy |
| rectal resection | 直肠切除 | 直肠切除术 | Rectal resection |
| sigmoid resection | 乙状结肠切除 | 乙状结肠切除术 | Sigmoid resection |
| 腹腔镜(modality) | — | 腹腔镜手术(操作概念) | Laparoscopic surgery |
再次强调:上述映射用于构建下游对"标签—解剖—术语"的一致理解,不代表 HeiCo 内部字段就存有 SNOMED 编码。若你的管线需要结构化术语做互操作或跨库对齐,应以本表为语义桥梁并到临床术语服务器核对当前版本概念码。
§2.2 疾病简介与流行病学
结直肠癌(colorectal cancer)是全球新发与死亡负担最重的恶性肿瘤之一,手术切除是其主要的根治性手段。随腹腔镜微创技术普及,一系列以"全结直肠切除术、直肠切除术、乙状结肠切除术"为代表的结直肠术式成为普通外科与结直肠外科的常规操作[^1]。
HeiCo 论文选择这三类术式并非偶然,而是出于对复杂度的考量:相较胆囊切除术这类相对简单、相位高度标准化的术式,结直肠手术的手术策略变异性更大——游离范围广(需沿结肠脾曲、肝曲等做大范围游离)、相位可能重复出现、术者策略差异导致同一类手术的相位顺序与时长并不固定[^2]。HeiCo 采集发生地为海德堡大学医院外科——一个被认证的微创外科卓越中心(certified centre of excellence for minimally invasive surgery),设备为 KARL STORZ OR1 FUSION® 集成手术室[^2]。正因这些术式"更难",其真实画面包含了出血、烟雾、器官遮挡、器械交错等对算法极不友好的情况,从而天然承载了"检验算法鲁棒性"的科研价值[^2]。
需要澄清的边界:HeiCo 是过程性手术数据,不含患者术后结局、病理分期或生存等临床终点,因此不宜用于"预测术后并发症/预后"等需要结局标签的任务。它最擅长的是作为术中感知与工作流理解的算法训练与评测基座[^1][^2]。
下表把三类术式的解剖/临床意义与 HeiCo 标注里的典型相位做一个"术式—解剖—进程"速查,帮助读者理解 14 相位在不同术式中为何取舍不同:
| 术式 | 切除目标 | 典型关键游离/吻合步骤(对应相位) | 临床要点 |
|---|---|---|---|
| 全结直肠切除术(proctocolectomy) | 整段结肠 + 直肠 | 游离各结肠段、游离脾曲/肝曲、游离直肠、回肠储袋/吻合等 | 范围最大、步骤最多,策略变异大[^2] |
| 直肠切除术(rectal resection) | 直肠(部分/全部) | 游离直肠、盆腔深部操作、低位吻合等 | 深盆腔操作多、解剖关系复杂[^2] |
| 乙状结肠切除术(sigmoid resection) | 乙状结肠 | 游离乙状结肠与降结肠、游离直肠上段、吻合等 | 相对聚焦、相位相对精简[^2] |
这张表是语义桥接而非标注规则:HeiCo 的相位编号 0–13 语义须以论文正文/README 为准(见 §7.7 第 13 项),此处只用于理解"为什么某些相位只在部分术式出现"。
从流行病学角度看,结直肠癌发病率随年龄上升、男性略高于女性,且东亚部分地区近年发病率上升,腹腔镜结直肠手术已成为其主要治疗路径之一。但 HeiCo 不提供患者年龄/性别等人口学字段,因此本文不把该流行病学背景作为"数据集覆盖人群"的断言,仅用于帮助读者理解:这类手术在真实外科实践中的常见性与复杂度,是 HeiCo 选择结直肠术式作为鲁棒性压力测试的临床理由[^1][^2]。
一句话总结 §2 的医学定位:HeiCo 是"结直肠腹腔镜手术的过程视频集",其医学价值在于承载与这些高复杂度术式相伴的器械感知与工作流任务,而非诊断或结局;做任何医学解读时都别忘了把 ICD/SNOMED 当作"语境参考"而不是"数据内编码",把相位当作"上下文"而不是"金标准"。
§2.3 临床任务定义
手术数据科学把"理解术中发生了什么"拆成若干可计算的子任务。HeiCo 的标注恰好覆盖了其中与器械感知、工作流最相关的一组。下表把这些任务与数据集标注一一对应:
| 任务 | 输入 | 输出 | 对应标注 |
|---|---|---|---|
| 器械检测(detection) | 单帧/视频 | 器械实例的位置框或粗略定位 | 多实例检测标注(ROBUST-MIS 提供) |
| 二值分割(binary segmentation) | 单帧 | 全器械像素掩码(二值) | 实例掩码取阈值 >0 |
| 多实例分割(multi-instance segmentation) | 单帧 | 每把器械单独编号的掩码 | 实例掩码 1、2、3… |
| 手术相位识别 | 视频片段 | 14 类相位之一 | 逐帧相位标签 |
| 器械存在性检测 | 单帧 | 有/无 + 器械数量(0–7) | presence 标注 |
这些任务共同构成"术中情境感知"的前置条件:器械感知(检测/分割)是导航、技能分析与并发症预警的前提;相位/工作流识别则刻画手术进程[^1]。HeiCo 的罕见之处在于一个数据集同时覆盖"感知(分割)+ 上下文(相位)+ 多模态(传感器)"三层,方便研究端到端或模块化管线。
对算法研究者的直接含义:HeiCo 不是"只给一张图让你分割"的玩具——它在同一批 10,040 帧上同时承载检测、二值分割、多实例分割三种像素级任务,外加逐帧相位与 14 路传感器上下文。这意味着你可以研究"分割与相位是否互相促进""传感器流能否补偿视觉遮挡"这类跨任务联合建模问题,这是多数单任务分割数据集给不了的实验空间。
§2.4 患者人群表
HeiCo 面向的是"术式"而非"患者"层面组织数据,官方未披露患者人口学。下表如实呈现已知信息并标注缺失项:
| 属性 | 内容 |
|---|---|
| 来源 | 海德堡大学医院外科,微创外科卓越中心(certified centre of excellence)[^2] |
| 采集地点 | KARL STORZ OR1 FUSION® 集成手术室[^2] |
| 手术类型 | 全结直肠切除术、直肠切除术、乙状结肠切除术各 10 例[^2] |
| 人数 | 官方未公布患者人数/年龄/性别(视频数据集不含人口学标签) |
| 种族/合并症 | 官方未公布 |
| 就医类型 | 常规择期/外科手术(daily routine procedures)[^2] |
如实处理缺失:官方没有给年龄/性别/种族,页面不臆测。这也意味着该数据集无法做人群层面的亚组公平性分析(见 §7.5),任何声称基于 HeiCo 的人群公平结论都缺乏依据。
§2.5 临床价值
器械的准确实时感知是众多术中辅助能力的底层前提:从手术导航、并发症预警到技能评估、风险预测,都需要系统"看见"器械此刻在哪、画面里发生了什么[^1]。HeiCo 提供的多实例分割掩码与跨术式多模态数据,直接服务于"开发能在出血、烟雾、抖动、遮挡等真实手术场景中稳定工作的算法"这一工程目标。在方法学上,它促成了 ROBUST-MIS 这样把泛化性作为一等评测维度的挑战赛,推动领域从"单任务单域刷分"走向"跨域鲁棒性"的严谨比较[^6]。对希望做术中辅助、机器人自动操作或手术工作流研究的团队,HeiCo 是评估"感知层是否足够稳"的可靠试金石。
需要特别指出的是,HeiCo 的临床价值更多体现在"作为 AI 方法的中立评估台"而非"直接指导某个术式的临床路径"——它不含结局标签,不能用来回答"哪种手术方式预后更好"这类临床问题;它的价值在于验证"基于视觉的术中感知算法在复杂度更高的真实手术上是否可靠"这一基础能力,从而为未来真正的术中辅助系统铺路[^1][^2]。
§2.6 金标准表
| 维度 | 内容 |
|---|---|
| 划分 | ROBUST-MIS 挑战提供三阶段(Stage 1/2/3)训练/测试划分,域间隙递增;完整数据可按术式自行划分[^6] |
| 标注方式 | 逐帧手术相位 + 器械存在性 + 超过 10,000 帧逐实例分割掩码[^2] |
| 标注者 | 相位由 1 名外科专家标注;器械分割由 5 名"手术数据科学专家"绘制,understand.ai 赞助初始标注[^2][^10] |
| 性质 | 相位为上下文信息;分割掩码为高质量质控的核心金标准[^2] |
| 一致性 | 5 名分割标注者 Fleiss’ kappa 0.712(95% CI 0.673–0.747),组内 almost perfect[^10] |
金标准分层解读:并非所有标注同等可靠——器械实例掩码经过严格质控(understand.ai 参与),是支撑分割基准的"硬金标准";相位则由单一外科专家给出,论文明确提示其主要用于上下文,质量以分割为焦点[^2]。据此,把相位当作强监督信号来训练并追求相位级 SOTA 时,需知道其标注强度弱于分割掩码(详见坑点 5)。
§3 数据集规格
§3.0 版本抉择矩阵
HeiCo 以同一套原始手术数据为核心,但因任务不同会取不同的"切片",使用者最容易困惑的是到底该下载哪一份。下表从"你的需求"出发给出取舍建议:
| 你的需求 | 推荐数据 | 大小/范围 | 理由 |
|---|---|---|---|
| 器械二值/多实例分割基准 | ROBUST-MIS 挑战子集 | 10,040 帧 | 带官方三阶段训练/测试划分与评测脚本,结果可与挑战赛直接对比[^6] |
| 手术相位/工作流研究 | 完整 HeiCo | 30 视频全程 | 需要逐帧相位标签与传感器上下文,完整包才含全程相位与 14 路传感器[^2][^5] |
| 多模态(视频+传感器)建模 | 完整 HeiCo | 30 视频 + 14 路信号 | 传感器流仅在完整数据中提供[^5] |
| 域泛化/鲁棒性实验 | ROBUST-MIS 子集 | 三阶段 | 官方已按域间隙设计好训练/测试,便于复现"跨域衰减"结论[^6] |
| 帧级掩码快速验证代码 | ROBUST-MIS 子集(单术式几帧) | 数百帧 | 体积小,足以冒烟测试 DataLoader 与预处理(见 §6.1) |
| 视频+相位时序端到端 | 完整 HeiCo | 单术式若干例 | 兼顾相位覆盖与相对可控的视频时长 |
一句话结论:做分割 benchmark → ROBUST-MIS 子集;做相位/多模态/全流程 → 完整 HeiCo。两者可以都下,但不要把子集与完整包当成可互换的两套独立数据集——它们共享 10,040 帧掩码,只是组织方式与配套上下文不同。
§3.1 模态详情
HeiCo 同时提供两类模态,这在公开腹腔镜数据集中并不常见:
- 腹腔镜手术视频(视觉模态):原始以 1920×1080 采集,发布版降采样为 960×540[^3]。为去标识化,腹部以外的体外片段被人工识别并以蓝色帧替换[^2]。视频呈现真实术中画面,包含出血、烟雾、运动抖动、器械交错、光照不均等多种挑战场景,并显式按 Easy / Medium / Hard 分级示意难度(论文 Fig.2)[^2]。视频是器械检测/分割的主输入模态。
- 手术室器械传感器流(设备模态):每帧附 14 路读数,来源包括气腹机(current flow、target flow、current pressure、target pressure、used volume、supply pressure、on/off)、手术室灯(on/off、强度 1、强度 2)、内镜灯光强、内镜相机(白平衡、增益、曝光)[^5]。这些信号与手术进程强相关,是"传感器手术室"多模态研究的关键素材。
时间对齐注意:传感器与视频以"逐帧"方式组织,但两路数据的采集时基/采样是否逐帧完全一一对应,官方未在论文层面给出统一时间戳说明,使用多模态前须自行核对对齐方式(见坑点与 §7.7 第 23 项)。
§3.2 按子集样本数
| 术式 | 视频数 | 中位时长 | 每帧器械数范围 |
|---|---|---|---|
| 全结直肠切除术(proctocolectomy) | 10 | 3h19’ | 0–5 |
| 乙状结肠切除术(sigmoid resection) | 10 | 2h32’ | 0–7 |
| 直肠切除术(rectal resection) | 10 | 3h36’ | 0–5 |
表 1 的数据出自论文官方 Fig.1[^2]。另有外科 AI 综述按视频求和给出的各类总时长:proctocolectomy 34:02 h、rectal resection 35:22 h、sigmoid resection 27:04 h[^3],合计约 96 小时视频。器械掩码总标注帧数为 10,040[^4]。器械数量分布提示多数画面相对"干净"(1–2 把器械),少数高复杂画面(3 把以上)才是检验鲁棒性的难点,训练时应对这类帧加以重视(见坑点 7)。从帧量看,三类术式都各自贡献了数千掩码帧,术式间相对均衡,适合做"按术式留一"的跨术式泛化实验。
§3.3 格式表
| 内容 | 格式 | 说明 |
|---|---|---|
| 手术视频 | 视频(mp4 类) | 960×540,降采样去标识 |
| 传感器数据 | CSV | 每帧 14 路信号值(气腹机/灯/相机等) |
| 相位/存在性标注 | CSV/标注文件 | 逐帧 14 相位 + 器械存在性 |
| 分割掩码 | PNG/图片 | 每把器械实例编号 1、2…,背景 0 |
| 元数据/目录 | JSON + 文件夹 | 官方分五级目录组织 |
文件后缀(.mp4/.png/.csv)与列名以 Synapse 实际发布包为准;论文给出的是抽象目录语义与帧间组织,不一定与下载包逐字符一致(见坑点 6)。
§3.4 存储大小
官方未公开总体积。从已知信息可估算视频量级:30 段视频中位时长 2.5–3.6 小时、三类合计约 96 小时,且为 960×540 降采样版本[^2][^3],实际体积取决于码率——而码率官方未披露,故本页不编造体积数字,请以 Synapse 下载页面展示的文件大小为准。若仅做分割基准,可只取 ROBUST-MIS 的 10,040 帧,体积远小于全量视频。
体积/带宽的务实估算建议:如果你不确定该下多少,先只下 ROBUST-MIS 子集(10,040 帧 + 对应原图/掩码)打通全部实验,确认跑通后再按需补充完整视频做相位/多模态;这样既能验证方法,又避免一开始就拖下 96 小时视频浪费存储与下载时间。Synapse 支持按子节点选择性下载,善用
getChildren挑选而非整仓拉取(见 §6.2)。
§3.5 标注方式
标注以人工为主,非弱监督或纯自动:手术相位逐帧人工标注;器械存在性逐帧判定;分割掩码由手术数据科学专家人工绘制,understand.ai 赞助了 ROBUST-MIS 数据的初始标注[^2][^10]。论文 Methods 给出完整生成链:记录手术数据 → 标注手术相位 → 选取待分割帧 → 建立分割协议 → 分割器械 → 核验标注 → 生成挑战数据集(见 §3.10)[^2]。后续独立研究(Rädsch 等 2024)又在 4,050 唯一帧上以 924 名标注者 + 34 名 QA 工作者重标注出 57,648 张实例掩码,比较了标注公司与众包平台的质量,说明官方掩码之外存在扩展的语义重标资源,可用作交叉验证[^12]。
§3.6 标注者资质与一致性
- 分割:5 名手术数据科学专家,质控流程严格;组间一致性 Fleiss’ kappa 0.712(bootstrap 95% CI 0.673–0.747),组内一致性 almost perfect[^10]。
- 相位:1 名单一外科专家逐帧标注,论文列为局限性;相位标注强度弱于分割[^2]。
- QA 对比研究:Rädsch 等 2024 显示标注公司在数量与质量上均优于 MTurk,且改进标注指令比追加 QA 更能提升质量[^12]。
对使用者的直接含义:器械掩码可靠性高,可直接做像素级监督;相位含单标注者主观成分,宜当作带噪声/弱标签或上下文处理。
kappa 0.712 怎么理解?医学图像分割/标注里,Fleiss’ kappa 落在 0.6–0.8 通常被视为"substantial agreement"(实质一致),0.8 以上为"almost perfect";HeiCo 的 0.712(95% CI 0.673–0.747)属实质一致、接近优秀下沿,对"多把器械逐像素编号"这种本就困难的任务属于可靠水平[^10]。这意味着用官方掩码做监督的噪声是可控的,但也别期待像素级绝对干净——做细粒度消融或标注敏感性分析时仍要考虑该噪声。
§3.7 采集周期
官方未披露精确采集起止。可锚定的时间证据:2017 年数据已用于 EndoVis 挑战,2020 年发布预印本与 Synapse 托管、2021 正式见刊[^1][^8][^9]。据此判断采集大致发生在 2017 前后至 2020 之间,但具体采集月份与患者来源年份官方未公布,此处不编造区间。涉及"数据漂移/时效"讨论时(见 §7.6)只宜说"2017–2020 年间的手术"这一保守表述。
对引用的影响:因为数据跨了数年且在 2020–2021 才标准化发布,引用时应使用 2021 见刊的正式版论文(Sci Data 8:101),而非 2020 预印本,以确保审稿人拿到的是经过同行评审的权威描述[^1]。
§3.8 地域覆盖
单中心采集:德国海德堡大学医院外科。论文在 Limitations 中明确将"仅一家医院、仅一种内镜与一种光源"列为限制泛化性的因素[^2]。这一单中心性质决定了其天然不适合作为"跨中心泛化"的最终证明,而更适合作为跨术式/域自适应方法的试验床——ROBUST-MIS 的三阶段划分正是围绕这一点设计[^6]。
对研究设计的含义:如果你的论文目的是"证明算法能在真实多中心手术数据上稳定",HeiCo 单中心不能满足论证需求;如果你的目的是"证明域自适应/域泛化方法能把单中心模型的跨术式衰减拉回来",那 HeiCo 反而是理想载体——因为它提供了公开、可控、已知域间隙的测试集,便于你公平地展示方法增益,而非自己在不同中心各取一部分去做不可控对比[^6]。
§3.9 设备规格
| 设备 | 规格 |
|---|---|
| 集成手术室 | KARL STORZ OR1 FUSION® |
| 腹腔镜相机 | KARL STORZ Image 1 |
| 望远镜 | 前斜 30°(forward-oblique 30°) |
| 冷光源 | KARL STORZ Xenon 300 |
| 视频分辨率 | 采集 1920×1080,发布 960×540 |
设备信息来自论文 Methods[^2][^4],分辨率来自外科综述[^3]。单套器材既保证了标注/采集内部一致性,也意味着画面风格、色温、噪声模式高度同质——训练时若不做色彩抖动等增强,很容易学到"这套器材的专属外观"而非通用器械形态(见坑点 4)。
器材与模态关联:这套 KARL STORZ OR1 FUSION + Image 1 内镜组合,直接决定了数据的色彩响应、镜头畸变与噪声纹理。对做"器械材质/反光"敏感研究的团队,这套固定器材反而提供了"干净对照";对追求跨厂商鲁棒性的团队,则应在训练里注入器材无关性增强(色彩抖动、模糊、对比度扰动),否则学到的会是"海德堡 KARL STORZ 专属视觉"[^2]。
§3.10 深度溯源链
HeiCo 的数据生成遵循论文 Methods 的显式多阶段流程[^2]:
- 记录手术数据:在 KARL STORZ OR1 FUSION 集成手术室,30 台三类结直肠手术的腹腔镜视频 + 设备传感器流。
- 标注手术相位:外科专家逐帧给出 14 类相位标签。
- 选取待分割帧:从视频中抽取超过 10,000 帧(官方图注为 10,040),并围绕相位过渡处增抽帧[^4]。
- 建立分割协议:为器械分割制定标注规范(understand.ai 参与)。
- 标注器械并核验:专家人工逐实例分割,经严格质控。
- 生成挑战数据集:整理为 EndoVis 2017 / ROBUST-MIS 2019 可用格式并开放。
这条链路上每一步都影响后续分析:相位与抽帧策略决定了"哪些帧有掩码"(围绕相位边界增抽),这直接关系到掩码帧在时间维度的分布是否均匀;理解它有助于解释为何掩码帧并不均匀地铺满全程视频。
溯源链对复现的启示:因为掩码帧是"围绕相位过渡增抽"的,掩码帧在时间上往往更密集地落在相位切换附近,而在相位平稳段相对稀疏。做时序抽样、做"帧在视频中的位置是否影响难度"分析、或训练需要均匀时间采样的时序模型时,都应意识到掩码帧的分布并非均匀,必要时按时间均匀重采样,而不是默认 10,040 帧均匀覆盖全程[^2][^4]。
§4 数据结构
§4.0 目录树
官方发布的完整数据集目录按五级抽象组织:术式 → 病例编号 → 过程数据 → 帧编号 → 帧内数据;ROBUST-MIS 挑战子集则有自己按阶段划分的专用目录[^11]。以下为基于论文 Fig.4/Fig.5 组织语义还原的示意树(注意:这是语义结构,不是字节级转录,具体文件名以下载包 README 为准,见坑点 6):
heico/
├── proctocolectomy/ # 术式级:10 例(第 1 级:术式)
│ └── proc001/ # 第 2 级:病例编号
│ ├── video/ # 第 3 级:过程数据
│ │ └── recording.mp4 # 手术过程视频(960x540,去标识)
│ ├── sensors/
│ │ └── signals.csv # 第 3 级:过程数据(14 路传感器流)
│ ├── phases/
│ │ └── phases.csv # 逐帧 14 相位标签(0-13)
│ └── frames/ # 第 4 级:帧编号(抽帧 10,040 中属于本病例的部分)
│ ├── img_0001.png
│ ├── img_0001_mask.png # 第 5 级:帧内数据(实例掩码)
│ └── ...
├── rectal_resection/ # 10 例
│ └── ...
└── sigmoid_resection/ # 10 例
└── ...
结构要点:① 掩码文件与原始帧在同一病例下,通过帧编号对齐;② 相位 CSV 覆盖该病例全部帧,而掩码只覆盖被抽出的 10,040 帧(含围绕相位过渡的增抽帧)[^2][^4];③ ROBUST-MIS 子集另行组织为带 Stage 划分的目录,目录层级与完整 HeiCo 不同[^11]。写代码时建议先扫描磁盘构建索引(§6.3 的
build_index)而不是写死路径。
§4.1 DAIMS 字段字典
下表给出 HeiCo 核心表在"宽格式 DataFrame"视角下的字段级字典。它把视频目录、CSV 相位表、掩码文件统一定义成便于建模的关系行;列名与文件命名为示意,语义以官方发布为准。
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| video_id | Text | 病例/术式标识 | proc001 | 划分分组键 | 低 | 无 | 各术式 10 例 |
| surgery_type | Text | 术式类别 | proctocolectomy | 分类/域划分 | 低 | 不适用 | 3 类术式 |
| frame_id | Integer | 帧编号 | 1200 | 时间索引/对齐 | 低 | 不适用 | 依视频 |
| phase_label | Integer | 手术相位 0–13 | 4 | 相位分类训练 | 单标注者偏倚 | 某些术式缺相位 | 0–13,共 14 |
| instrument_presence | Boolean | 是否含器械 | True | 检测二分类 | 低 | 空帧=负样本 | True/False |
| instance_count | Integer | 器械把数 0–7 | 2 | 计数/门控 | 低 | 无 | 0–7 |
| instance_mask | Image | 每把器械编号掩码 | img_0001_mask.png | 实例分割 | 质控流程 | 空帧无掩码 | 1,2,…/背景 0 |
| sensor_signal_* | Float | 气腹压/流量/灯强/相机等 | 12.5 | 多模态融合 | 设备精度 | 部分缺失 | 依传感器 |
这些字段中最值得工程侧留意的有三处:①
phase_label是强离散分类且跨术式缺相位(见 §4.5);②instance_mask的语义取决于任务视图——同一文件既能做二值监督(>0)也能做实例监督(保号);③ 传感器字段是 14 路宽列,字段之间高度相关(如 current flow vs used volume),做特征工程时要注意共线性(§7.7 第 12 项)。
§4.2 标签分布
- 术式:三类各 10 例,均衡[^2]。
- 相位:共 14 类标签(0–13,含一个
exception(13)异常类);13 个具名相位中仅 8 个出现于全部三类术式,部分相位并非每种术式都有——例如 proctocolectomy 不含"十二指肠/胰头后腹膜游离"相位,也不含exception相位[^3][^5]。这意味着相位标签空间是术式相关的,全局 14 类分类会为某些术式引入"永不出现"的伪类别。 - 器械把数:每帧 0–7 把;多数帧(三类均 >70%)仅含 1–2 把器械[^10]。3 把及以上的多器械帧稀缺,是实例分割的真正难点。
- 相位切换:单段视频的相位切换次数中位数,proctocolectomy 19(15–25)、rectal resection 20(10–31)、sigmoid resection 14(9–30),说明工作流在术式间有差异、相位重复出现[^10]。
标签分布工程要点:多数帧只含 1–2 把器械 + 相位只在部分术式出现,这两个分布特征叠加起来,意味着"看似稀疏但其实类别结构复杂"——单一全局指标很难刻画。因此建议默认把标签分布拆成两张表来看:一张按术式×相位计数(判断哪些相位在哪些术式缺失),一张按器械把数×帧数计数(判断正负与多实例的失衡程度),两者都可视化后再决定损失权重与采样策略,而不是直接进网络盲训。
§4.3 关键统计
汇总本数据集被引用最多的硬数字:30 段视频;10,040 帧器械掩码;14 类手术相位;14 路传感器流;每帧器械 0–7;分割标注者组间 Fleiss’ kappa 0.712;三类手术各 10 段、每类中位时长 2h32’–3h36’[^2][^4][^10]。这些数字是复现论文、构建摘要与横向比较时的锚点。
怎么用这些数字:① 设计实验规模时,以 10,040 帧估算训练时长与显存预算;② 描述"域内 vs 跨域"时,以三类术式各 10 例说明"按术式留一"后每折约 10–20 例的测试体量偏小,宜配多折重复以稳估方差;③ 陈述数据多样性时,优先引用 0–7 把器械与 >70% 帧仅 1–2 把这两条分布证据,而不是笼统说"多样"——它们才是决定分割难度与难点分布的实质统计[^2][^10]。
§4.4 数据层级
HeiCo 的组织沿一条清晰的层级展开:术式(surgery_type)→ 病例/视频 → 过程(视频 + 传感器 + 相位 CSV)→ 抽帧(10,040 帧)→ 帧内数据(存在性 + 实例掩码)[^2][^11]。像素级的"实例"只编码在帧内掩码中,不同帧之间没有跨帧实例 ID 的长期跟踪标注——也就是说 HeiCo 本身不提供器械的跨帧身份跟踪(那属于跟踪任务,需另行建立对应关系)。理解这一层级的实际意义:你可以在"病例"与"术式"两级做防泄漏分组;也可以在"帧"级切出像素监督;但如果想训练"逐帧跟踪同一把器械",需要自己额外处理帧间关联。
§4.5 缺失值与信息性缺失
HeiCo 存在三类必须显式处理的"缺失",它们都带有信息性,不是简单的空值:
- 无器械帧(empty frames,ef):ROBUST-MIS 论文用 ef% 标注每类术式的空帧比例(如 proctocolectomy 训练集空帧 2%、rectal resection 训练集空帧高达 20%)[^6]。空帧代表"画面确无器械",是二值分割与存在性检测的有效负样本,不可作为噪声删除(见坑点 2)。
- 术式相关的相位缺失:如上所述,非全部 14 相位出现于每类术式,属于不适用性(not-applicable)缺失,由术式定义决定而非采集漏标[^3][^5]。相位训练须按术式约束标签空间(见坑点 1)。
- 去标识蓝帧:腹部以外体外片段被替换为蓝帧,是刻意编码的受控缺失[^2]。若模型把"蓝帧"学成可辨识特征,会形成一种假线索(见坑点 8 / §6 增强注意)。
为便于工程侧落地,给出缺失编码建议表:
| 缺失类型 | 触发条件 | 编码建议 | 是否可删 |
|---|---|---|---|
| 空帧 | presence=False | 单独标记,保留为负样本 | 否 |
| 相位不适用 | 术式不支持该相位 | mask 掉 / 标签空间受限 | 否 |
| 蓝帧 | 体外片段 | 识别并剔除或专用类 | 谨慎 |
处理这三类缺失的统一原则:不要默认"缺=0 或缺=删",而是为每种缺失建立显式的编码与理由。空帧要保留并参与负样本平衡;相位缺失要靠术式相位映射表做 masked loss;蓝帧要么在加载时剔除(避免让模型学"见蓝即非体内"的捷径)、要么明确作为特殊语义类。把这三条写进你的数据说明,能同时规避坑点 1/2/8 的多种隐性错误。
§5 数据划分与使用建议
官方划分
完整 HeiCo 没有一套统一的"训练/测试"官方划分——它更像一份可自行组织的原料。其正式的、可复现的基准划分来自 ROBUST-MIS 2019 挑战,采用三阶段(Stage 1/2/3)域间隙递增设计:随阶段推进,训练与测试集在术式、病例来源上的差异逐渐拉大,从而把"模型在越陌生的数据上表现如何"拆成三个渐难的关卡[^6]。
具体到域间隙的构造逻辑:Stage 1 训练与测试在术式与病例来源上更接近(偏"域内"),Stage 2 引入部分术式差异,Stage 3 训练与测试在术式/器材来源上拉开最大差距(偏"跨域")。挑战要求每个任务在三个 Stage 上分别测试,最终给"accuracy 排名 + robustness 排名"双结果[^6]。
论文 Table 1 给出了 ROBUST-MIS 数据在各术式上的训练/测试帧分布(节选),它同时揭示了一个训练时必须重视的信号——空帧比例(ef)的术式差异:
| 术式 | 用途 | 帧数 | 空帧比例 |
|---|---|---|---|
| proctocolectomy | 训练 | 2,943 | 约 2% |
| proctocolectomy | Stage 1 测试 | 325 | 约 11% |
| rectal resection | 训练 | 3,040 | 约 20% |
| rectal resection | 测试 | 338 | 约 20% |
(上表转录自 ROBUST-MIS 论文 Table 1,为节选;完整分布含 Stage 2/3 与其他术式,请以原文为准[^6]。)直肠切除术训练集空帧高达约 20%,这直接决定了"要不要、如何保留空帧做负样本"这一预处理决策(见坑点 2)。
社区惯例划分
社区在拿完整 HeiCo 做自有实验时通常采用三种切分惯例之一:
- 按术式留一法:用两类术式训练、第三类术式测试,直接检验"跨术式泛化"——最贴合 HeiCo 的定位,但受限于每类仅 10 例,留一后测试规模较小。
- 按病例留出:训练/测试在病例(video_id)层面分割,绝不切到帧——防止同一病例帧泄漏进测试。
- 按时间切分:训练用视频前段、测试用后段,可近似检验"同术式不同阶段"的稳定性,但需注意相位时序相关性。
外科分割综述与后续方法论文多在 ROBUST-MIS 三阶段划分上报告结果以便横向对比[^6][^7]。
社区惯例的共识与分歧:多数作者已意识到"必须按 video_id 分组切分"以避免帧级泄漏;但对"用不用 ROBUST-MIS 官方划分"存在分歧——做挑战对比的倾向沿用官方三阶段以便上榜可比,做自有消融/域实验的倾向按术式留一来直接测跨术式泛化。两种都有价值,关键是在论文里把切分规则讲清楚(术式留一还是三阶段?按病例分组否?),否则读者无法判断你的精度是域内还是跨域口径。
划分策略建议
- 器械分割:优先使用 ROBUST-MIS 官方三阶段划分 + 官方评测脚本,使结果可与公开挑战榜直接比较[^6]。
- 相位识别:按术式分组后,只在"该术式支持的相位子集"上评估;切勿把"术式中本就不存在"的相位计为模型错误(见坑点 1)[^3]。
- 多模态(视频+传感器):视频与传感器按帧对齐后同步划分,禁止同一视频的帧散落到训练与测试两侧。
§5.3 泄漏风险
HeiCo 使用中最需要警惕的泄漏路径有四条,按其危害排序:
- 同一病例帧级泄漏:训练与测试各取同一病例不同帧,模型通过记忆画面/场景而非泛化器械形态取得虚高成绩。任何切分都必须以 video_id 为分组单元。
- 术式先验泄漏:把三类术式帧混洗后随机切分,会让模型学到"哪类术式画面风格"这一捷径,掩盖其在陌生术式上的真实表现。想测泛化,就按术式留一。
- 相位/器械分布泄漏:ROBUST-MIS 的域间隙设计中,训练与测试在术式来源上刻意错开;若自行切分却不去匹配这种错开,就失去了测试"跨域泛化"的意义[^6]。
- 蓝帧/去标识帧作为假线索:体外蓝帧是强烈视觉标记,模型可能学会"见蓝帧即知非体内"来钻空子,而非真正理解手术场景(见坑点 8)。
ROBUST-MIS 用"域间隙递增"的设计正是为了量化这种泛化衰减,报告结果时应同时说明所用划分的域间隙,不要把内部(Stage 1)当全局结论[^6]。
一个常被低估的泄漏细节:HeiCo 的多类标注(相位、器械、传感器)共享同一批帧。若你同时训练"分割 + 相位 + 器械计数"等多个任务并共享骨干,务必让所有任务共用同一切分(以 video_id 分组),否则不同任务各自切分时,会把一个病例的帧散落进多个任务的不同 fold,造成跨任务的信息泄漏,使"联合建模"的增益虚高。
交叉验证与外部验证
建议按术式做分组 K 折(GroupKFold,group=video_id)以彻底堵住帧级泄漏;组内不要按随机帧,而按整个病例切。下列代码演示如何以 video_id 为分组键生成不会泄漏的折(假设 index 来自 §6.3 的 build_index):
from sklearn.model_selection import GroupKFold
# index: DataFrame,含 video_id 列(同一个 video 的所有帧共享一个 id)
gkf = GroupKFold(n_splits=5)
# 分组键用 video_id,确保同一病例的所有帧始终在同一折
for fold, (tr, va) in enumerate(gkf.split(index, groups=index["video_id"])):
train_idx, val_idx = index.iloc[tr], index.iloc[va]
# 断言:train 与 val 不共享任何 video_id(防帧级泄漏)
assert not set(train_idx["video_id"]) & set(val_idx["video_id"])
print(f"fold {fold}: train {len(train_idx)} / val {len(val_idx)}")
对外部验证,可迁移到同机构 HeiChole(胆囊,7 相位)或其他 EndoVis 器械数据集做跨术式检验——但须知 HeiCo 相位由单标注者、单中心产生,跨数据源的验证才是检验真实泛化的关键,而非在同源数据上反复自证[^2][^7]。
§6 AI 就绪指南
本节代码为可直接运行的最小示例,演示从 HeiCo 目录到 PyTorch DataLoader 的完整流程。假设数据已从 Synapse 解压并按 §4.0 目录语义组织(以实际包 README 为准);若路径不符,先扫描磁盘再适配 §6.3 的
build_index。
§6.0 云端快速启动(如适用)
若本机 GPU 受限,可在云端跑通数据管线再做重活。HeiCo 的 Synapse 客户端与 torch/cv2 均可用 pip 安装,最小云端启动路径如下:
# 云端(如 Colab/租用卡)一次性环境:
pip install synapseclient opencv-python-headless scikit-learn \
pandas numpy torch torchvision
# 云端无需手动下载:用 synapseclient 拉取后按需取 10,040 帧子集即可。
# 注意:数据体积大、IO 在云端可能较慢,建议只下载做分割所用的 ROBUST-MIS 子集
# (而非完整 96 小时视频),以节省云端存储与带宽(见 §6.2 / §3.0)。
云端的额外注意:① 视频 IO 在远端对象存储/慢磁盘上可能成为瓶颈,预处理应先把掩码/相位索引缓存成内存式 DataFrame;② CC BY-NC-SA 只约束使用与再分发,云端个人训练属允许范畴,但勿将模型/数据在云端公开分享给未经许可的第三方。
§6.1 快速上手
目录结构预期:设 DATA_ROOT 指向解压后的 heico/,内部按 §4.0 树组织。最小可用子集 = 任一术式的 frames/ + masks/ + phases.csv,即可跑通一帧掩码加载与相位读取。下列代码先把"读一帧、读它的实例掩码、读相位"打通:
import cv2, numpy as np
DATA_ROOT = "/path/to/heico" # 替换为实际路径
# 预期布局(见 §4.0 语义树):
# DATA_ROOT/proctocolectomy/proc001/frames/img_0001.png
# DATA_ROOT/proctocolectomy/proc001/masks/img_0001_mask.png
# DATA_ROOT/proctocolectomy/proc001/phases/phases.csv
def load_frame_and_mask(root, sub, case, fid):
"""返回 (RGB frame, 实例掩码灰度图)。
掩码: 背景=0,各器械实例=1,2,...(编号语义需对照官方标注协议)
"""
base = f"{root}/{sub}/{case}"
img = cv2.imread(f"{base}/frames/img_{fid:04d}.png")
msk = cv2.imread(f"{base}/masks/img_{fid:04d}_mask.png", cv2.IMREAD_GRAYSCALE)
return img, msk
# 最小自检:若目录/掩码语义对,应能打印尺寸与实例编号
img, msk = load_frame_and_mask(DATA_ROOT, "proctocolectomy", "proc001", 1)
print(img.shape, np.unique(msk)) # e.g. (540,960,3), [0 1 2 3]
首次跑通后做三件事:① 用
np.unique确认掩码确实区分实例(多值)而非纯二值;② 对照 README 确认相位 CSV 的列名与 0–13 的语义映射;③ 把img_0001这类占位格式替换为磁盘上真实帧命名(见坑点 6)。
冒烟验收标准:能打印出
(540, 960, 3)与掩码的多值唯一数组、并读到正确相位,即视为"通路打通"。若掩码唯一值只有 {0,1},说明你的任务视图其实是二值——按需选择 binary 或 instance 分支;若读不出帧或相位列对不上,先回到 §6.3 的build_index检查目录扫描与列映射,别急着进训练。
§6.2 数据获取
| 项 | 内容 |
|---|---|
| 平台 | Synapse(Sage Bionetworks) |
| 入口 | https://www.synapse.org/#!Synapse:syn21898456 |
| 登记 DOI | 10.7303/syn21898456[^9] |
| 许可 | CC BY-NC-SA(非商业,须引用论文、衍生作品同许可发布)[^2] |
| 申请流程 | 注册 Synapse 账号 → 定位 syn21898456 → 同意使用条款 → 下载对应 entity 子文件 |
Synapse 提供官方 Python 客户端 synapseclient,便于把"申请后下载"脚本化以支持可复现管线:
# pip install synapseclient (需先在 Synapse 注册;首次需交互式认证或配置个人 token)
import synapseclient
syn = synapseclient.Synapse()
syn.login() # 触发认证(个人 access token 亦可)
# 先遍历 syn21898456 的子节点,确认实际 entity 名与目录(见坑点 6)
children = list(syn.getChildren("syn21898456"))
for c in children:
print(c["id"], c.get("name")) # 打印以便核对目录结构
# 下载到本地(可按需下到 ./heico_download)
for c in children:
syn.get(c["id"], downloadLocation="./heico_download")
提示:CC BY-NC-SA 属非商业许可——务必在组织内确认用途合规后再下载与使用;下载是研究准备的一环,但训练任何可能商用的模型前须重新评估许可边界(见坑点 8)。
下载/使用常见疑问速答
| 疑问 | 答复 |
|---|---|
| 一定要 Synapse 账号吗? | 是——数据托管在 Synapse,下载需注册并同意其使用条款 |
| 下载的是整包还是可选的? | 依 Synapse 目录;建议先 getChildren 看清子文件再按需取(见上方代码) |
| 完整 96 小时视频 vs 10,040 帧子集? | 只做分割就用子集省空间;做相位/多模态才取完整视频(§3.0) |
| 许可证怎么标? | 衍生数据沿用 CC BY-NC-SA,署名并引 Sci Data 论文(§9) |
| 下载失败/版本差异? | 锁定 Synapse entity 版本号并核对 README,勿照抄旧教程硬编码路径(坑点 6) |
§6.3 预处理全流程
预处理四步走:① 解析相位 CSV → 得到每帧相位与存在性;② 扫描磁盘 → 建立 frame_id → 帧/掩码路径 索引(不写死路径);③ 构建二值掩码(>0)供二值分割;④ 图像标准化。核心在于先"建索引"再"按索引取数",这能最大程度规避目录差异:
import os, glob, pandas as pd, numpy as np, cv2
def build_index(root, sub, case):
"""扫描一例手术,返回 DataFrame:[fid, phase, presence, frame_path, mask_path]。
若某帧无掩码文件,则 mask_path 记 NaN(该帧仅在相位/存在性任务中可用)。
"""
base = f"{root}/{sub}/{case}"
phases = pd.read_csv(f"{base}/phases/phases.csv") # 假定含 fid/phase_label/presence
frames = sorted(glob.glob(f"{base}/frames/img_*.png"))
fid_of = lambda p: int(os.path.basename(p).split(".")[0].split("_")[1])
mask_of = lambda f: os.path.join(base, "masks",
os.path.basename(f).replace(".png", "_mask.png"))
rows = []
for p in frames:
fid = fid_of(p); m = mask_of(p)
phase = phases.loc[phases["fid"] == fid, "phase_label"]
rows.append({
"frame_id": fid,
"phase": int(phase.iloc[0]) if len(phase) else np.nan,
"frame_path": p,
"mask_path": m if os.path.exists(m) else None,
})
return pd.DataFrame(rows)
def to_binary(mask_gray):
"""多实例掩码 -> 二值(器械任何像素)"""
return (mask_gray > 0).astype(np.uint8)
def preprocess(img, size=(960, 540)):
img = cv2.resize(img, size) # 对齐 960x540(如需)
img = cv2.cvtColor(img, cv2.COLOR_BGR2RGB).astype(np.float32) / 255.0
return img
上述代码把"哪个术式支持哪些相位"留给你在索引层补一张术式→相位映射表(从论文 Table 3/综述可得 8 个共现相位与术式差异),供坑点 1 的 masked loss 使用[^3][^5]。为直观理解"如何只监督术式支持相位",这里给出 masked cross-entropy 的最小示意——先用术式掩码屏蔽掉该术式不可能出现的相位,再算损失:
import torch, torch.nn.functional as F
def phase_masked_ce(logits, targets, allowed):
"""logits: [B, 14];targets: [B] 相位标签;
allowed: {surgery_type: set(可出现的相位索引)}——从术式相位映射表取。
仅对 allowed 中存在的相位计算损失,缺失相位不计为错误。
"""
# 用全 -inf 屏蔽掉该术式不可达的相位 -> softmax 后概率为 0
mask = torch.full_like(logits, float("-inf"))
for b, allow in enumerate(allowed):
for c in allow:
mask[b, c] = 0.0
logits_masked = logits + mask # 对不可达类加 -inf
return F.cross_entropy(logits_masked, targets) # logits_masked 需为可微
说明:这个 masked loss 是坑点 1 的"进阶方法"的可运行落地;配合"仅在该术式支持相位子集上评估"即可避免把合法缺相位误判为模型错误。
§6.4 PyTorch DataLoader
在索引基础上实现一个既支持分割监督、也支持相位监督的 Dataset,即可接入常见训练循环:
import torch, torchvision
from torch.utils.data import Dataset, DataLoader
class HeiCoFrameDataset(Dataset):
"""帧级数据集:mode='mask' 返回像素监督(实例/二值);
mode='phase' 返回相位标签;task='binary' 把掩码二值化。"""
def __init__(self, index, mode="mask", task="instance", size=(960, 540)):
self.index = index.reset_index(drop=True)
self.mode, self.task = mode, task
self.size = size
def __len__(self):
return len(self.index)
def __getitem__(self, i):
r = self.index.iloc[i]
img = cv2.imread(r["frame_path"])
img = cv2.resize(img, self.size)
img = torchvision.transforms.functional.to_tensor(cv2.cvtColor(img, cv2.COLOR_BGR2RGB))
if self.mode == "mask":
msk = cv2.imread(r["mask_path"], cv2.IMREAD_GRAYSCALE) if r["mask_path"] else None
assert msk is not None, "空帧/缺掩码帧请在索引层过滤"
msk = cv2.resize(msk, self.size, interpolation=cv2.INTER_NEAREST)
msk = torch.from_numpy((msk > 0).astype("int64") if self.task == "binary"
else msk.astype("int64"))
return img, msk
return img, torch.tensor(int(r["phase"]), dtype=torch.long) # 相位识别
# 实例化:index 由 build_index 拼接多例得到;最少只用单术式单病例几帧即可冒烟测试
df = build_index(DATA_ROOT, "proctocolectomy", "proc001")
loader = DataLoader(HeiCoFrameDataset(df, mode="mask", task="instance"),
batch_size=4, shuffle=True)
for imgs, targets in loader:
print(imgs.shape, targets.shape) # e.g. torch.Size([4,3,540,960]), torch.Size([4,540,960])
break
冒烟测试建议:先用 1 例、batch=1 确认 shape 与取值域正确,再放大到全量;空帧(
mask_path is None)在分割 loader 里会被assert拦下,若你的研究需要保留空帧做负样本,应改为返回全背景掩码或改走 presence 分支(见坑点 2)。
数据通路自检三步:① 掩码多值(实例)还是纯 {0,1}(二值)——决定走 instance 还是 binary 分支;② 相位能否读到 0–13 的整数并落在该术式支持范围内——验证术式相位映射正确;③ 传感器若要用,确认该帧在
signals.csv里有对应行——验证多模态对齐。三步都过,DataLoader 才算真正就绪,再进入训练才稳妥。
§6.5 坑点 8 个
⚠️ 坑点 1:把"相位缺失"当成模型预测错误(分类:标签理解)
问题:HeiCo 的 14 类相位并非出现在每一类术式中——如 proctocolectomy 不含"十二指肠/胰头后腹膜游离"相位也不含
exception,全数据集仅 8 个相位在所有三类术式共现。直接对全部 14 类做全局分类,会让某些术式的"合法空位"被判成错分。症状:训练后特定术式(尤其 proctocolectomy)的相位召回率异常低;混淆矩阵出现"模型从不可能输出的相位";不同术式混评时整体精度被系统性拉低。
解决:
- 简单方法:评估时只在该术式真实支持的相位子集上算指标,并把缺失相位从标签空间剔除。
- 进阶方法:为每类术式维护一张"支持的相位集合"掩码,用 masked cross-entropy 只监督该术式实际出现的相位。
- SOTA 方法:把术式作为输入条件,建模为 hierarchical / conditional 相位识别,让模型显式感知"当前术式下哪些相位是可达的"。
参考:外科 AI 综述 §4.2.6 明确列出各术式相位包含关系与例外[^3];ROBUST-MIS 论文[^6]。
⚠️ 坑点 2:忽略"空帧/无器械帧"的信息性(分类:标签理解)
问题:相当比例标注帧没有任何器械(ROBUST-MIS 表以 ef% 标注,如 rectal resection 训练集空帧高达 20%)。空帧是二值分割与存在性检测的重要负样本,不是"该丢弃的坏帧"。
症状:预处理把所有空帧删掉 → 模型严重偏向"输出全背景"或反之过拟合阳性(因正负失衡);若全保留而不控比例 → 训练不稳定、loss 被负样本淹没。
解决:
- 简单方法:保留空帧做负样本,训练时在 batch 层面按固定正负帧比例采样。
- 进阶方法:用 presence 标注做两阶段管线——先"有无器械"门控分类,命中器械的帧再进分割器。
- SOTA 方法:把空帧当 hard negative 源做在线困难样本挖掘,或对空帧过采样以稳定二值边界。
参考:ROBUST-MIS 论文 Table 1 的 ef% 分布[^6]。
⚠️ 坑点 3:不区分"二值 vs 多实例"目标导致评估错配(分类:评估误用)
问题:HeiCo 同一掩码文件既可用于二值分割也可做多实例分割,但二者指标完全不同:多实例任务(MI_DSC/MI_NSD)要求把预测实例与真实实例做正确匹配后再算相似度。用二值 DSC 替代多实例指标,会严重高估实例级性能。
症状:把多把邻近器械合并成一块预测时二值 DSC 很高,但实例编号错乱、实例边界割裂,MI_DSC 却很低甚至趋近 0——两种"看起来不错"与"真实很差"的落差就是错配的信号。
解决:
- 简单方法:动工前明确任务视图(binary vs instance),并只用对应指标(DSC vs MI_DSC)。
- 进阶方法:MI_DSC/MI_NSD 的实例匹配较敏感,务必使用官方 ROBUST-MIS 评测脚本,不要自写简化 dice。
- SOTA 方法:结果上报时同时给 accuracy 与 robustness(5% 分位)双排名,并用 challengeR 做 bootstrap 置信,详见挑战方法论[^2][^6]。
参考:ROBUST-MIS 评测协议(DSC/NSD + MI_* 双排名)[^6];challengeR 包[^2]。
⚠️ 坑点 4:单中心/单内镜带来的跨机构泛化虚高(分类:偏倚陷阱)
问题:数据全部来自海德堡大学医院一间 KARL STORZ OR1 FUSION 手术室,用同一套内镜与光源。只在 HeiCo 内部训练并在同源测试(尤其同术式)上评估,性能往往虚高,一旦迁移到别的中心/器材就明显下降。
症状:内部测试 DSC 高、换到外部中心或他院数据后骤降;ROBUST-MIS 三阶段里 Stage 3(域间隙最大)普遍低于 Stage 1,正是此现象的官方量化[^6]。
解决:
- 简单方法:报告时同时给同域(Stage 1)与跨域(Stage 3)指标,不隐藏衰减。
- 进阶方法:用色彩抖动、烟雾/伪影模拟、对比度增强等"器材差异"近似进行域自适应或增强。
- SOTA 方法:联合 HeiChole 等其他中心数据做领域泛化预训练,或直接在跨中心数据上测迁移。
参考:ROBUST-MIS 域间隙结论[^6];论文 Limitations(单中心单器材)[^2]。
⚠️ 坑点 5:相位标注是单标注者、仅作上下文,不能当独立金标准(分类:标签理解)
问题:相位由 1 名外科专家逐帧标注,论文自述其为"context information",真正质控聚焦在分割掩码。把相位当强金标准训练并过度解读相位级精度,会放大单标注者的主观偏倚。
症状:相位过渡(phase transition)附近的帧预测反复横跳;不同论文对同一相位名称/编号的理解不一致导致结果不可比。
解决:
- 简单方法:把相位当弱/噪声标签处理,评估重心放在分割;报告相位指标时声明其单标注者性质。
- 进阶方法:官方在相位过渡处增抽了帧,说明边界最难——对过渡帧单独分析并容忍一定容差(如 ±N 帧)。
- SOTA 方法:相位/工作流研究的严格结论建议迁移到 HeiChole(7 相位、专业标注)等专为工作流设计的基准再下判断[^7]。
参考:论文 Limitations 段"phase annotations performed by only a single expert surgeon"[^2];HeiChole 工作流基准[^7]。
⚠️ 坑点 6:目录/文件组织在多版本间不一致,代码别硬编码路径(分类:工程陷阱)
问题:完整 HeiCo 与 ROBUST-MIS 挑战子集使用不同的目录布局与抽帧策略——完整数据按术式→病例五级组织,挑战子集另有带 Stage 划分的专用目录[^11]。Synapse 上文件结构与论文图注文字可能有出入。
症状:教程代码里的相对路径/文件名在你下载的包里不存在;硬编码术式名的大小写或分隔符(
proctocolectomyvsRectal_Resection)导致 glob 匹配失败。解决:
- 简单方法:写代码前先打印目录树(
find或glob)确认实际结构,再据此建索引。- 进阶方法:用 §6.3 的
build_index()从磁盘扫描自动发现文件,以文件名/编号提取 fid 而非依赖固定子路径。- SOTA 方法:使用官方 ROBUST-MIS phabricator 脚本(含下载与评测)以统一其路径约定[^2]。
参考:论文 Fig.4/Fig.5 目录结构[^11];ROBUST-MIS 脚本仓库[^2]。
⚠️ 坑点 7:小型/交叉/移动/透明器械是最难样本,平均指标会掩盖(分类:评估误用)
问题:ROBUST-MIS 结论明确指出现有方法的共同难点是"小的、交叉的、移动的、透明的器械(部分)",且挑战数据按 Easy / Medium / Hard 难度分级展示(论文 Fig.2)。只用均值 DSC 会把这些关键失败淹没在整体高分里。
症状:平均 DSC 好看,但器械重叠、小器械、透明夹持器(如某些持针器/超声刀末端)这类高危帧分割失效;上线/临床恰恰最怕这类帧出错。
解决:
- 简单方法:按帧难度、器械把数分层报告指标,不只报全局均值。
- 进阶方法:报告 robustness 排名(按 5% 分位聚合最差样本),而非只报 accuracy 排名。
- SOTA 方法:对困难帧做针对性增强与二次训练;用 challengeR 的 blob 图展示排名稳定性与分布。
参考:ROBUST-MIS 结论与 robustness 排名[^6];论文 Fig.2 难度分级[^2]。
⚠️ 坑点 8:许可与获取——"非商业 + 衍生同许可"边界被误用(分类:工程陷阱 / 合规)
问题:HeiCo 采用 CC BY-NC-SA:非商业使用、须署名、衍生作品须以相同许可发布;同时数据托管在 Synapse 上、受平台使用条款约束。不核对这两层,容易踩"商用误用"或"衍生许可不兼容"两个合规坑。
症状:把基于 HeiCo 微调的权重/衍生标注集打包进商业产品却无 NC 授权;或把 HeiCo 掩码再次分发而未沿用相同许可;团队内部自评"研究用途即可商用",与 NC 条款冲突。
解决:
- 简单方法:明确本项目为科研/教育用途;有商用诉求前先向数据集权利人取得授权。
- 进阶方法:任何衍生标注/预训练集沿用 CC BY-NC-SA,并在仓库 README 与模型卡里声明 provenance + 引用原文。
- SOTA 方法:建立"Synapse 平台条款 + 论文 Usage Notes + CC BY-NC-SA"三层合规清单,随实验记录存档,供发布/开源前复核。
参考:论文 Usage Notes(CC BY-NC-SA 条款)[^2];Synapse 平台使用条款。
§6.6 数据增强(安全/危险)
在 HeiCo 上做增强,要始终记住它的三个特征:单中心单器材(色彩同质)、器械小且常交叉、空帧多。据此把常用增强分为安全与危险两类:
增强前先回答三个问题:① 你的测试集是否与训练同域(Stage 1)还是跨域(Stage 3)?跨域时应更激进地做器材无关性增强;② 你的任务是二值还是实例?实例级对"形变破坏器械实例边界"更敏感,增强幅度要更保守;③ 你是否要保留空帧做负样本?是的话把空帧也纳入增强池。回答清楚再配增强,能少走很多弯路。
| 增强 | 安全性 | 说明 |
|---|---|---|
| 随机水平翻转、小幅旋转、裁剪 | ✅ 安全 | 器械分割常规几何增强,符合手术画面(内镜大致近似左右对称) |
| 色彩抖动/亮度对比度扰动 | ✅ 安全 | 缓解单光源/单内镜的色彩偏差,是提升跨域泛化的关键一步(对应坑点 4) |
| 高斯模糊 / 烟雾叠加模拟 | ✅ 安全(可控幅度) | 模拟 Hard 帧的高噪声场景,提升鲁棒性(回应 ROBUST-MIS 的鲁棒性目标)[^6] |
| 弹性/仿射小形变 | ⚠️ 谨慎 | 幅度要小,避免破坏器械的细长/夹持形状语义 |
| 空帧作为背景随机插入 | ✅ 安全 | 平衡空帧负样本,稳住二值边界(回应坑点 2) |
| 上下翻转 180° | ❌ 危险 | 手术画面有重力与体位语义(如血液下流、器官悬挂方向),会学到错误解剖关系 |
工程落地提示:色彩抖动尤其重要——HeiCo 只有一套器材,色温/曝光高度一致,不做色彩扰动时模型极易过拟合这套器材的"外观指纹",这是跨机构泛化差的一大元凶。建议把色彩抖动当成默认开启项,幅度以"肉眼能感到明显偏色但仍可辨识器械"为上限;配合微弱亮度/对比度扰动与高斯噪声,能在不引入假结构的前提下显著提升跨域稳定性。
§6.7 模型推荐表
| 任务 | 推荐模型 | 说明 |
|---|---|---|
| 二值器械分割 | 2D U-Net(含残差编码器) | ROBUST-MIS 挑战参赛即有队伍用 2D U-Net,稳健且易复现[^6] |
| 多实例分割 | Mask R-CNN(ResNet-50/101) | 挑战多数队伍基座(caresyntax、SQUASH、Uniandes、VIE、www 等)[^6] |
| 多实例分割(更强基线) | YOLACT++ + CBAM 注意力增强 | 后续工作把 Stage 3 MI_DSC 提升到 0.42–0.46[^13] |
| 手术相位/工作流 | 时序 CNN / Transformer | 需按术式做相位子集约束(见坑点 1);若做严格工作流研究建议对照 HeiChole[^7] |
选型建议:先以 2D U-Net 跑二值分割拿基线,确认 DataLoader 与数据质量无误;再切到 Mask R-CNN/YOLACT++ 系追求实例级;对跨域目标,务必配合 §6.6 的色彩增强与多源数据。
何时用哪一档:若你的目标是"先上线一个能工作的器械感知原型",U-Net 二值即可满足低延迟与稳定;若要做手术辅助里的"精确定位哪把器械",或参与 ROBUST-MIS 这类实例级评测对比,则升级 Mask R-CNN/YOLACT++;二值与实例在推理开销与标注需求上差别明显,选型应匹配实际产品/研究对"实例级区分"的真需求,而非盲目求新(呼应坑点 3 的任务视图选择)。
§6.8 硬件需求表
| 阶段 | 最低 | 推荐 |
|---|---|---|
| 帧级预处理/可视化 | CPU 即可 | CPU + 16 GB RAM |
| 分割训练(10,040 帧,960×540) | 单张 8–11 GB GPU | 单张 16–24 GB GPU(A100/RTX 4090 级别),batch 4–16 |
| 完整视频相位/时序训练 | 单张 GPU | 多卡或更大内存处理合计约 96 h 视频 |
若只做器械分割基准(ROBUST-MIS 10,040 帧),单卡 8–16 GB 基本够用;若要吃下完整 96 小时视频做相位/多模态,则需更多内存与算力。
§6.9 评估指标代码
二值与实例两套指标必须分开实现。二值 DSC 直观简单;多实例 DSC 需要实例级匹配,实现要谨慎——正式复现请用官方脚本:
import numpy as np
def dice(y_true_bin, y_pred_bin):
"""二值 Dice(像素级)"""
inter = (y_true_bin & y_pred_bin).sum()
return 2 * inter / (y_true_bin.sum() + y_pred_bin.sum() + 1e-8)
def mi_dice(y_true, y_pred):
"""多实例 DSC(最小示意,按真实实例逐一匹配预测像素)。
正式 MI_DSC/MI_NSD 请用 ROBUST-MIS 官方评测脚本,勿以此为准。
"""
d = []
for inst in set(np.unique(y_true)) - {0}: # 逐个真实实例
tp = ((y_pred == inst) & (y_true == inst)).sum()
denom = (y_true == inst).sum() + (y_pred == inst).sum()
d.append(2 * tp / (denom + 1e-8))
return float(np.mean(d)) if d else 0.0
重要提醒:多实例指标最怕实例号不匹配——预测把"实例 1"标成了"实例 3",
mi_dice就会出现近乎 0 的假阴性。ROBUST-MIS 官方脚本处理的是更严谨的实例级匹配与 NSD 表面距离,复现时务必沿用[^2][^6]。
怎么在论文里报告指标最稳妥:① 二值与实例指标分开,不要混在同一个"DSC"名下;② 对每个任务给 accuracy + robustness 两个数字并标注所用 Stage;③ 对实例级给 MI_DSC 的同时可给 MI_NSD,后者对边界质量更敏感;④ 若做方法对比,附 challengeR 的置信区间或显著性检验,别用"均值高 0.01"下结论[^2][^6]。
§6.10 MLOps 笔记
- 版本钉扎:记录 Synapse entity 的版本号 + DOI(完整数据 10.7303/syn21898456),复现实验时锁定版本,避免数据漂移[^9]。
- 实验追踪:把
surgery_type × video_id记作分组键写入实验元数据,确保 train/val/test 都在病例层面隔离。 - 合规归档:在仓库/模型卡中声明 CC BY-NC-SA 许可 + HeiCo 引用(见 §9 BibTeX),防止衍生许可纠纷。
- 困难帧监控:上线/评测时单独监控小、交叉、透明、移动器械帧的指标趋势,作为质量红线。
- 多模态对齐记录:若用到 14 路传感器,把"视频帧 ↔ 传感器行的对齐方式"写进 pipeline,避免不同 run 之间对不上(见 §7.7 第 23 项)。
- 困难帧工单化:把 Stage 3 或 Hard 帧的失败案例整理成可复现的"失败样本集",每次实验后在它上面跑一次体检,用最差样本的改善来衡量迭代价值——这比只看全局均值更能指导你在手术这类高危场景上的改进方向[^2][^6]。
MLOps 的总体心法:HeiCo 是"数据规模不大但组织复杂、许可敏感、多模态需对齐、单中心需防过拟合"的数据集。与其追求一次跑出 SOTA,不如先把"版本锁定 + 病例级隔离切分 + 合规声明 + 时间对齐记录"这几道工序做扎实——它们是让 HeiCo 实验可复现、可信的前提,也是后续在更大多中心数据上顺利迁移的基础。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 单中心/单器材 | 仅海德堡一家医院、一套 KARL STORZ 设备与光源 | 高 | 跨中心数据联合或域自适应;报告跨域指标;色彩增强 |
| 相位单标注者 | 相位仅 1 名外科专家标注,主观性强 | 中 | 视相位为上下文,评估以分割为主 |
| 术式相位分布不均 | 非全部 14 相位出现于各术式 | 中 | 按术式子集评估,用 masked loss |
| 器械分布偏斜 | >70% 帧仅 1–2 把器械,多把样本少 | 中 | 分层抽样、困难帧增强、hard-negative mining |
| 去标识蓝帧 | 体外片段替换蓝帧形成强标记 | 低 | 识别并剔除或做专用类,防模型钻空子 |
偏倚怎么读:偏倚不等于"不可用",而意味着"结论的作用域有限"。HeiCo 的高偏倚项集中在采集来源(单中心单器材)与标注强度不均(相位单标注者)——只要你在报告里明确"我的结论在单中心同器材条件下成立、跨中心需另行验证",这些偏倚就是可管理的;反之若把单中心结果包装成通用临床结论,就是真正的误用(呼应坑点 4)。
§7.2 标注质量
器械分割掩码经过了高质量质控流程,understand.ai 参与初始标注,5 名标注者组间一致性 Fleiss’ kappa 0.712(bootstrap 95% CI 0.673–0.747)、组内一致性 almost perfect,是可靠的核心金标准[^10]。手术相位仅由单一外科专家标注,质量相对弱、只作上下文[^2]。可作为额外交叉验证的是一份后续独立研究(Rädsch 等 2024):它对 HeiCo 的 4,050 唯一帧重标注出 57,648 张实例掩码,对比了标注公司与众包平台质量,结论指标注公司优于 MTurk、改进标注指令比堆 QA 更有效——这既提供了扩展语义资源,也提示"高质量指令设计 > 后置质控"[^12]。
标注质量对使用的影响:① 像素级监督(分割)可直接信官方掩码,因为其一致性(kappa 0.712)在医学图像标注里属于良好到优秀区间;② 相位若要做强监督,先意识到单标注者的主观性,最好把相位级指标当"辅助参考"而非"金标准结论";③ 若想更稳的掩码做标注质量敏感性分析,可把官方掩码与 Rädsch 2024 的重标注做对照,评估"标注来源对模型精度的影响量级"[^12]。
§7.3 泛化性表
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 同术式内部测试 | 低 | ROBUST-MIS Stage 1 性能较高[^6] |
| 跨术式(结直肠三类互转) | 中 | Stage 2 域间隙增大、性能开始下降[^6] |
| 跨中心/跨器材(他院他器材) | 高 | 单中心单器材采集;Stage 3 降幅最明显[^2][^6] |
| 困难帧(小/交叉/移动/透明器械) | 高 | ROBUST-MIS 指出为方法共同难点[^6] |
这些证据都指向同一结论:HeiCo 是出色的域泛化试验床,但绝不宜作为"跨中心临床可部署性"的证明——那是需要外部多中心数据去验证的事。
怎么把泛化表变成你的实验设计:若你想展示方法"能缓解跨域衰减",应设计成"在 Stage 1/2/3 上同时报准"——只看 Stage 1 高、Stage 3 崩,等于没有跨域能力;若能同时让 Stage 1 保持高、Stage 3 相比基线收窄差距,才是有说服力的域泛化改进。这在 HeiCo 上可被公开复现,正是它作为鲁棒性基准的价值[^6]。
§7.4 伦理
HeiCo 为真实患者手术视频,采集与发布遵循伦理规范:视频按欧盟 GDPR 去标识化,腹部以外体外片段被人工识别并以蓝色帧替换[^2]。数据以 Synapse 平台 + 注册制 + CC BY-NC-SA 许可分发,从而在使用与传播上施加了约束。任何二次使用都应延续对患者隐私与数据来源伦理的尊重,不进行重新识别尝试,并遵守平台与许可条款。
实操注意:即便做了去标识,真实手术视频仍是敏感临床数据的延伸——不要让含原始帧的中间产物被无授权人员接触、不要在公开演示里展示可辨识患者信息的片段(虽然体外帧已被蓝帧遮挡,仍应保持克制),并让所在机构 IRB/数据保护部门知悉你把这类临床视频用于模型训练。
§7.5 公平性
数据集不提供患者人口学信息(年龄/性别/种族等),也没有亚组标签,因此无法在人群维度做公平性/亚组表现审计。同时其单中心采集也不能代表全球外科患者或术式人群。若研究者需要讨论模型在手术感知上的人群公平性,必须引入带人口学标签的外部多中心数据作为补充——这是该数据集的固有边界,页面如实标注而不臆造结论。
该边界在实际项目中的处理建议:把"人群公平性审计"明确排除在基于 HeiCo 单数据能回答的问题之外。若你的产品/研究必须评估公平,请用 HeiCo 仅做算法能力基线,再叠加带人口学字段的真实或合成数据去测亚组差异;切不可从 HeiCo 的术式分布反推"某人群手术难度更高"这类无据结论。外科感知的公平性研究目前整体数据稀缺,HeiCo 并不填补这一空白,反而提示了补充数据采集的必要性。
§7.6 数据漂移
HeiCo 的发布形态在 Synapse 上相对稳定(托管版本固定),原始采集发生于 2017–2020 年间(保守表述,见 §3.7)。自采集以来,腹腔镜器材、手术器械与术式策略可能已有演进;若把基于 HeiCo 训练的模型直接用于当前临床流程,会存在时间域漂移。建议结合更新的同机构数据(如 HeiChole)或新采集数据做再验证,必要时以数据混合方式缓解时序偏差[^7]。
具体漂移来源包括:新内镜的影像引擎与色温调校、新型电外科/超声器械的形态、术者手术习惯与器械使用节奏的变化。若你的任务是"长期运行的术中辅助模型",请把 HeiCo 当"训练/验证基线",并为其设计周期性的数据刷新与重评估机制,而不是一训永逸。
§7.7 DAIMS 24 项评估
DAIMS(Dataset AI-Readiness & Metadata Standards)是从"AI 训练就绪度"出发评估数据集工程化程度的一个 24 项清单。下表逐项核对 HeiCo:
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 相位/传感器按帧为行,可平滑转宽表 |
| 2 | 唯一标识 | ✅ | video_id / frame_id 可作唯一键 |
| 3 | 特殊字符 | ✅ | 编码字段多为 ASCII 编号 |
| 4 | 重复行 | ⚠️ | 完整包与 ROBUST-MIS 子集可能含重复帧,需自行去重 |
| 5 | 缺失编码 | ⚠️ | 空帧/蓝帧未统一显式编码,需自建 |
| 6 | 标签标识 | ✅ | 掩码 1…n + 背景 0 语义明确 |
| 7 | 罕见类分组 | ⚠️ | 器械把数 3+ 与若干相位样本稀少 |
| 8 | 偏倚评估 | ✅ | 论文自陈单中心/单标注者局限 |
| 9 | 数据字典 | ⚠️ | 缺独立字典文件,需从论文/目录推断 |
| 10 | 信息性缺失解释 | ✅ | 空帧与术式相位缺失可解释 |
| 11 | 设备记录 | ✅ | 内镜/光源/手术室型号完整 |
| 12 | 共线性 | ⚠️ | 14 路传感器间相关性高,建模需留意 |
| 13 | 编码映射 | ⚠️ | 相位编号 0–13 语义须对照论文 |
| 14 | 时间戳处理 | ⚠️ | 以逐帧索引组织,未见统一时间戳字段 |
| 15 | 划分建议 | ✅ | ROBUST-MIS 三阶段划分可用 |
| 16 | 泄漏讨论 | ✅ | 论文与挑战讨论跨术式泛化/域间隙 |
| 17 | 标签分布 | ✅ | 官方给相位/器械数/空帧分布 |
| 18 | 测量偏倚 | ✅ | 单器材偏倚被明确识别 |
| 19 | 外部验证建议 | ✅ | 可迁移 HeiChole 等跨域验证 |
| 20 | 版本记录 | ⚠️ | Synapse 有 entity 版本,需自行跟踪 |
| 21 | 预处理脚本 | ✅ | ROBUST-MIS 提供下载+评测脚本 |
| 22 | 合规要求 | ✅ | CC BY-NC-SA + Synapse 条款明确 |
| 23 | 多模态对齐 | ⚠️ | 视频与 14 路传感器按帧对齐,需核时间基 |
| 24 | 去标识化 | ✅ | GDPR 合规、蓝帧替换 |
DAIMS 评分:18.5 / 24
评分解读:HeiCo 在偏倚自陈、设备记录、合规、官方挑战划分与评测脚本等"科研严谨性"维度上做得突出(多数 ✅),扣分集中在"缺独立数据字典、字段语义需从论文推断、空帧/蓝帧与传感器时间基未统一显式编码、跨挑战子集去重与版本需自行管理"等工程化、可迁移性短板。总评:它是一流的研究数据集与基准,但离"零配置即用"的工程就绪仍有距离,尤其在把 14 路信号对齐、掩码自组装与标签语义固化方面需要使用者补课。
对你意味着什么:别指望开箱即用——先花半小时在论文 + README 上核对字段语义、目录结构与传感器单位,再动手写 loader。把"按术式子集评估 + 分层报告 + 跨域指标 + 空帧显式处理"固化成你的默认评测协议;空帧、蓝帧、术式相位缺失这三类信息性缺失必须显式编码,否则会在看似正常的指标上埋雷。若要做严肃基准对比,务必用官方 ROBUST-MIS 划分与评测脚本,不要自造切分——否则你的结果无法与他人对比。
评分的工程落地清单:根据上面 24 项,可把 DAIMS 建议翻译成可直接执行的行动:
| 行动 | 对应扣分项 | 一句话做法 |
|---|---|---|
| 建一张"术式→相位"映射表 | #10/#13 | 从论文 Table 3/综述提取,存成 JSON 供 masked loss 与评估用 |
| 统一三类缺失编码 | #5 | 空帧标 presence=0、蓝帧单独标记、缺相位标 NaN+术式原因 |
| 写一份独立数据字典 | #9 | 把 §4.1 字段表 + 相位 0–13 语义 + 传感器单位固化成 README |
| 录制时基/对齐方式 | #14/#23 | 记录视频与传感器按帧如何对齐,写入 pipeline 元数据 |
| 跨完整包与子集去重 | #4 | 统一以 frame_id 判定,避免同一帧既在 train 又在 test |
| 锁定 Synapse 版本 | #20 | 记录 entity 版本号,纳入实验 hash |
这张清单直接把 18.5/24 中扣掉的工程分补回来,是把 HeiCo 从"好研究数据"变成"可复现 AI 训练集"的关键。
§7.8 外部验证矩阵
| 外部场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ROBUST-MIS Stage 3(域间隙最大) | 挑战赛第三方算法 | 多实例分割 | MI_DSC ≈ 0.31(最佳 www) | 较 Stage 1 显著下降 | 域间隙增大性能衰减,官方证实[^6] |
| YOLACT++ 增强(外部工作复测) | 学界后续工作 | 多实例分割 | Stage 3 MI_DSC 0.425–0.46 | 高于 2019 参赛水平 | 注意力+多尺度融合显著改善困难帧[^13] |
外部验证矩阵只收录有同行评审/公开论文支撑的数字。从上表可读出的两个稳健结论:① HeiCo 的域间隙评测可复现地触发性能衰减,证明它确实测得准"泛化能力";② 更新的模型架构 + 注意力 + 多尺度 + 更强增强确实能部分收复跨域损失,说明 HeiCo 也是方法学进步的可感测平台。
§8 基准性能与生态
§8.1 排行榜(ROBUST-MIS 2019 Stage 3)
ROBUST-MIS 2019 是 HeiCo 最主要的公开基准载体,其 Stage 3 是最具挑战性的跨域测试档。下表演示该任务最常被引用的三档结果,便于理解"什么样的分数算好":
| 排名参考 | 模型/队伍 | 聚合 MI_DSC | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 挑战最佳参赛 | www(Mask R-CNN ResNet-50) | ≈0.31 | 2019 | Mask R-CNN | Ross et al., ROBUST-MIS 2019, arXiv:2003.10299[^6] | 见 phabricator rmis2019 |
| 参赛二三名区间 | Uniandes ≈0.26 / SQUASH ≈0.22 | 0.22–0.26 | 2019 | Mask R-CNN(ResNet-50/101) | Ross et al., arXiv:2003.10299[^6] | — |
| 参赛中游代表 | CASIA_SRL ≈0.19 / fisensee ≈0.17 | 0.17–0.19 | 2019 | DPAN / 2D U-Net(残差编码) | Ross et al., arXiv:2003.10299[^6] | — |
| 后期改进 | CCAM/CBAM + YOLACT++ | 0.425–0.46 | 2021 | 注意力 + 多尺度 | Real-time Instance Segmentation, 2021[^13] | — |
表中 Stage 3 的 MI_DSC 数值来自 ROBUST-MIS 公开结果表与后续复测工作[^6][^13]。⚠️ 数值不可直接比较提醒:① 不同任务(binary vs multi-instance vs detection)与不同Stage(1/2/3)的指标体系不同,MI_DSC 只在"多实例分割"且同一 Stage 内可比;② 后期工作的提升来自更现代架构 + 更强增强,与 2019 参赛者并非同口径同条件竞速,把它读作"方法学演进后的水平"而非"公平胜出";③ 正式复现请用官方脚本 + challengeR 做 ranking,避免只看一个数字。
§8.2 SOTA 总结与选型建议
综合 ROBUST-MIS 系列公开证据,可给出一条实用选型路径:二值分割用 2D U-Net(含残差编码器)做稳健基线[^6];多实例分割用 Mask R-CNN 系做实例级基座,挑战多数队伍与最佳参赛 www 均基于它[^6];若要追求更高实例级性能,加注意力(CBAM/CCAM)与多尺度特征融合的 YOLACT++ 变体可在 Hard 帧上带来可观提升[^13]。配合 §6.6 的色彩增强与空帧平衡,能显著缓解单中心色彩同质与正负失衡两大问题。选型不必贪多——先把 U-Net 基线 + 官方三阶段评测跑通、拿到可信的 Stage 1/3 曲线,再逐步升级模型架构。
关于"哪种模型才是 HeiCo 的 SOTA"要诚实作答:截至写作,公开榜上挑战参赛(2019)与后续单篇改进(2021)的口径不同,没有一个被全社区认可的"官方 SOTA 榜首"。最佳做法是自己在官方三阶段划分上用统一脚本复跑多个基线(U-Net、Mask R-CNN、YOLACT++ 增强版),在同一评测协议下比较——这比追逐某个单篇报的绝对数字更可靠,也更符合 challengeR 倡导的稳健对比精神[^2][^6][^13]。
§8.3 评测协议
HeiCo/ROBUST-MIS 的评测协议对"如何可靠比较算法"有明确要求,值得照搬:
- 指标:DSC(Dice)与 NSD(Normalized Surface Distance)双指标;多实例任务用 MI_DSC/MI_NSD。
- 双排名:accuracy 排名 + robustness 排名;robustness 按 5% 分位聚合最差样本,防止被少数极好样本拉高。
- 统计工具:用 challengeR 包做 bootstrap 置信区间、rank 稳定性(blob 图)与显著性分析[^2][^6]。
- 域分层:按 Stage 1/2/3 报告,不隐藏跨域衰减[^6]。
复现时务必沿用这套协议,否则你的分数无法与既有公开榜对比,也难被同行采信。
评测协议的一线提醒:因为 robustness 排名按 5% 分位最差样本聚合,它对"把少数 Hard 帧全弄砸"的模型惩罚明显——这恰是手术器械感知的安全关切所在。若你的方法只刷高均值却把最难的几类帧做错,robustness 排名会如实暴露;反之,针对困难帧做增强与微调即便均值提升不大,也可能在 robustness 排名上显著前进。评测时应同时看 accuracy 与 robustness 两张榜,而不是挑对自己有利的那个数字报[^2][^6]。
§8.4 相关数据集表
| 数据集 | 术式 | 与 HeiCo 关系 |
|---|---|---|
| HeiChole | 胆囊切除 | 同机构海德堡体系,工作流/技能分析基准,相位体系不同[^7] |
| Cholec80 / CholecT50 | 胆囊切除 | 更大规模、工具+动作+目标三元组,单术式[^7] |
| EndoVis 器械挑战系 | 各术式 | 器械检测/分割同源评测生态 |
| ROBUST-MIS(同数据子集) | 结直肠 | HeiCo 的官方基准切分,含三阶段划分[^6] |
把它们放在一起看的价值在于互补:HeiChole 补强了工作流/技能维度,Cholec 系列补强了规模与工具语义,ROBUST-MIS 则是 HeiCo 的"评测专用档"。选型时应按"任务类型 × 是否需要传感器/相位 × 是否要官方切分"来匹配,而不是把它们当作可互换副本。
特别提醒一个常见混淆:HeiChole 与 HeiCo 不是同一批数据。二者都由海德堡团队发布、都含胆囊/结直肠的相位与器械信息,但 HeiChole 是 33 段胆囊手术(22 h、7 相位、4 动作、21 器械),HeiCo 是 30 段结直肠手术(14 相位、10,040 帧分割)[^7]。引用、下载与标注体系绝不能互相套用——否则会出现"相位定义、术式、器械清单全对不上"的串台事故。
§8.5 关键论文 Top
- HeiCo 数据论文:Maier-Hein, L. et al. Heidelberg colorectal data set for surgical data science in the sensor operating room. Scientific Data 8:101, 2021. DOI 10.1038/s41597-021-00882-2 — 定义数据集、采集协议、标注流程、目录结构与 Usage Notes,是使用 HeiCo 必须引用的文献[^1]。
- ROBUST-MIS 2019(arXiv 版):Ross, T. et al. Robust Medical Instrument Segmentation Challenge 2019. arXiv:2003.10299, 2020 — 给出三阶段域间隙划分、评测协议与参赛结果,核心结论为"域间隙增大 → 性能衰减"[^6]。
- ROBUST-MIS 期刊版(比较验证):Comparative validation of multi-instance instrument segmentation in endoscopy: Results of the ROBUST-MIS 2019 challenge. Medical Image Analysis — 完整方法论与 ranking/统计分析的正式版本[^14]。
- 实时器械实例分割(后期改进):Real-time Instance Segmentation of Surgical Instruments using Attention and Multi-scale Feature Fusion — 注意力 + 多尺度在多实例分割上刷新 HeiCo Stage 3 水平[^13]。
- HeiChole 工作流基准:Wagner, M. et al.(同机构)— HeiCo 的互补生态,用于工作流与技能分析对照,检验算法脱离 HeiCo 术式后的迁移性[^7]。
引用建议:凡是"用 HeiCo 做实验"一律先引 [1];凡复现/对比挑战榜再叠加引 [2];做多实例分割方法学讨论可加引 [3](期刊版)保证审稿人可核查。
§8.6 社区活跃度
HeiCo 依托 EndoVis/ROBUST-MIS 挑战生态与海德堡(Maier-Hein、Wagner、Kenngott、Müller-Stich 团队)的持续产出来维持活跃度:ROBUST-MIS 形成完整评测链,后续 HeiChole、HeiCo 重标注 QA 研究(Rädsch 2024)都在同一体系内推进[^7][^12]。作为 2020–2021 发布的外科分割标杆数据,它常被手术数据科学、机器人辅助手术与术中感知综述列为必引资源。
活跃度的观察口径:HeiCo 的"活跃"并非靠多版本迭代刷存在,而是靠评测链的持续复用——ROBUST-MIS 把它的三阶段划分、脚本与结果沉淀成社区可直接引用的基准,后续方法论文借此不断校验跨域鲁棒性。对使用者来说,这意味着"拿 HeiCo 做实验"能获得较好的可复现性与可比性,但也意味着想在它上面发"纯粹刷分"的工作空间已不大,真正的增量在于域泛化方法、多模态融合或标注质量等开放问题。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| HeiCo 数据论文 | 期刊 | nature.com/articles/s41597-021-00882-2 | 权威定义、Usage Notes 与引用规范 |
| Synapse 下载 | 数据 | synapse.org(syn21898456) | 官方唯一托管,登记 DOI 10.7303/syn21898456 |
| ROBUST-MIS 脚本 | 代码 | phabricator.mitk.org/source/rmis2019 | 下载 + 评测标准实现,官方推荐[^2] |
| challengeR | 代码 | github.com/wiesenfa/challengeR | 挑战结果统计 / ranking / 显著性分析[^2] |
| EndoVis sensorOR 2017 | 挑战 | endovissub2017-workflow.grand-challenge.org | HeiCo 相位/上下文标注的 2017 出处[^2] |
| ROBUST-MIS 论文 | 文献 | arXiv:2003.10299 | 三阶段划分与参赛基线[^6] |
生态快照的时效说明:以上链接为写作时(截至 2026-09)核验可用;Synapse entity、phabricator 等资源若迁移,请以数据论文页脚/README 的最新指引为准。challengeR 目前托管于 GitHub(wiesenfa/challengeR)[^2]。
§9 相关资源与引用
官方资源与链接
| 资源 | 链接 | 说明 |
|---|---|---|
| 数据论文 | https://link.springer.com/article/10.1038/s41597-021-00882-2 | 权威出处,Open Access |
| Synapse 数据集 | https://www.synapse.org/#!Synapse:syn21898456 | 下载入口(需注册) |
| Nature PDF | https://www.nature.com/articles/s41597-021-00882-2.pdf | 免费全文 |
| PubMed | https://pubmed.ncbi.nlm.nih.gov/33846356/ | PMID 33846356 / PMC8042116 |
| ROBUST-MIS 脚本 | https://phabricator.mitk.org/source/rmis2019/ | 下载与评测标准脚本[^2] |
| challengeR | https://github.com/wiesenfa/challengeR | R 包,挑战结果分析[^2] |
| figshare 元数据 | https://doi.org/10.6084/m9.figshare.14178773 | 机器可读元数据 |
| Synapse 数据登记 DOI | 10.7303/syn21898456 | 数据托管 DOI[^9] |
BibTeX 完整引用
@article{maierhein2021heico,
author = {Maier-Hein, Lena and Wagner, Martin and Ross, Tobias and
Reinke, Annika and Bodenstedt, Sebastian and Full, Peter M. and
Hempe, Hellena and Mindroc-Filimon, Diana and Scholz, Patrick and
Tran, Thuy Nuong and Bruno, Pierangela and Kisilenko, Anna and
M{\"u}ller, Benjamin and Davitashvili, Tornike and Capek, Manuela and
Tizabi, Minu D. and Eisenmann, Matthias and Adler, Tim J. and
Gr{\"o}hl, Janek and Schellenberg, Melanie and Seidlitz, Silvia and
Lai, T. Y. Emmy and Pekdemir, B{\"u}nyamin and Roethlingshoefer, Veith and
Both, Fabian and Bittel, Sebastian and Mengler, Marc and
M{\"u}ndermann, Lars and Apitz, Martin and Kopp-Schneider, Annette and
Speidel, Stefanie and Nickel, Felix and Probst, Pascal and
Kenngott, Hannes G. and M{\"u}ller-Stich, Beat P.},
title = {Heidelberg colorectal data set for surgical data science in the sensor operating room},
journal = {Scientific Data},
volume = {8},
number = {1},
pages = {101},
year = {2021},
doi = {10.1038/s41597-021-00882-2}
}
引用指南:依据论文 Usage Notes,任何使用/引用 HeiCo 数据均须引用上述数据论文[^2];若复现 ROBUST-MIS 基准,另引用其论文[^6]。数据托管 DOI(Synapse syn21898456)与数据论文 DOI(10.1038/s41597-021-00882-2)是两种不同标识——前者标识数据文件、后者标识数据描述论文,正式引用时建议二者都给出。
进一步阅读提示:想深入理解 HeiCo 的评测方法学,可结合 ROBUST-MIS 期刊版(Medical Image Analysis)的完整 ranking 与 challengeR 统计方法[^14];想了解它在外科 AI 谱系中的位置,可阅读深度学习方法在手术工作流分析的综述(§4.2 并行收录 Cholec/HeiChole/HeiCo 等)[^3];若关注标注质量对模型的影响,Rädsch 2024 的 HeiCo 重标注研究给出了第三方视角的证据[^12]。
脚注定义(本页引用锚点)
[^1]: Maier-Hein, L. et al. Heidelberg colorectal data set for surgical data science in the sensor operating room. Scientific Data 8:101 (2021). https://link.springer.com/article/10.1038/s41597-021-00882-2
[^2]: 同上论文全文(采集/标注/目录/Limitations/Usage Notes)。https://www.nature.com/articles/s41597-021-00882-2.pdf
[^3]: Deep learning for surgical workflow analysis: a survey, §4.2.6 HeiCo 条目(术式总时长、960×540、相位含括关系)。https://link.springer.com/doi/10.1007/s10462-024-10929-6
[^4]: 同上论文官方 Fig.1(10,040 frames)与 Methods。https://www.nature.com/articles/s41597-021-00882-2.pdf
[^5]: 综述转述 HeiCo 14 路传感器与 14 相位名称清单。https://link.springer.com/doi/10.1007/s10462-024-10929-6
[^6]: Ross, T. et al. Robust Medical Instrument Segmentation Challenge 2019. arXiv:2003.10299 (2020). https://scispace.com/papers/robust-medical-instrument-segmentation-challenge-2019
[^7]: HeiChole(Wagner, M. et al.)与外科 AI 综述并列比较。https://link.springer.com/doi/10.1007/s10462-024-10929-6
[^8]: HeiCo 预印本 arXiv:2005.03501(2020)。http://alphaxiv.org/abs/2005.3501
[^9]: Bodenstedt, S. Heidelberg Colorectal (HeiCo) Data Set. Synapse, DOI 10.7303/syn21898456 (2020).
[^10]: 论文正文(Fleiss’ kappa 0.712、空帧占比、器械 0–7、相位切换)。https://nature.com/articles/s41597-021-00882-2
[^11]: 论文 Fig.4/Fig.5 目录结构。https://pubmed.ncbi.nlm.nih.gov/33846356/
[^12]: Rädsch, T. et al. Quality Assured: Rethinking Annotation Strategies (2024)——HeiCo 4,050 帧/57,648 掩码重标注 QA 研究。
[^13]: Real-time Instance Segmentation of Surgical Instruments using Attention and Multi-scale Feature Fusion (2021). https://ar5iv.arxiv.org/html/2111.04911
[^14]: Comparative validation of multi-instance instrument segmentation in endoscopy: Results of the ROBUST-MIS 2019 challenge. Medical Image Analysis. https://www.sciencedirect.com/science/article/pii/S136184152030284X
§10 AI 使用声明卡
10.1 AI 模型列表
本页写作过程中实际参与内容生成的 AI 模型与工程工具清单如下。它用于透明地说明"哪些环节借用了 AI",便于读者评估本页面的生成质量与可信边界:
| 类别 | 工具/模型 | 用途 |
|---|---|---|
| 文本生成 | 通用大语言模型 | 章节拟稿、概述撰写、代码示例、字段字典初拟 |
| 事实检索 | WebSearch / WebFetch | 抓取数据论文、综述、挑战赛与 Synapse 信息并核对数字 |
| 格式核查 | Grep / Bash | 定点对照金标准格式、文件校验 |
| 结构校验 | check_md.py | 行数/章节/坑点/DAIMS/frontmatter 全量校验 |
10.2 AI 参与范围
AI 承担:事实检索与组织、章节文本起稿、代码示例与数据字典搭建、版式排版与超链接生成。人工承担并负责:对全部硬数字逐条溯源核验、医学/工程语义把关、8 个坑点是否真实对应 HeiCo 特有失败模式的判断、代码可运行性复核、医学映射(ICD-11/SNOMED)的临床正确性确认。任何被人工否决或修正的内容,在对外发布前都已替换为核实过的版本;本页面不保留"仅 AI 生成未经人工确认"的断言性结论。
10.3 输入来源列表
本页面引用的事实与数字来源于以下公开资料(均可在对应 URL 核验)。引用计数一类存在多来源差异,页面已如实说明并尽量给出可查证锚点,不虚构统一数值:
- Maier-Hein et al., Sci Data 2021(数据论文全文/摘要)— https://link.springer.com/article/10.1038/s41597-021-00882-2
- Nature 数据论文 PDF — https://www.nature.com/articles/s41597-021-00882-2.pdf
- 外科 AI 综述 §4.2.6 HeiCo 条目(术式总时长/960×540/相位含括)— https://link.springer.com/doi/10.1007/s10462-024-10929-6
- ROBUST-MIS 2019 摘要与数据表 — https://scispace.com/papers/robust-medical-instrument-segmentation-challenge-2019
- ROBUST-MIS 期刊版指标/排名参考 — https://www.sciencedirect.com/science/article/pii/S136184152030284X
- 实时器械实例分割(YOLACT++ 后期改进)— https://ar5iv.arxiv.org/html/2111.04911
- PubMed 条目(PMID 33846356 / PMC8042116)— https://pubmed.ncbi.nlm.nih.gov/33846356/
- Nature/Springer 元数据与 figshare 元数据 DOI — https://link.springer.com/article/10.1038/s41597-021-00882-2
- 海德堡 DKFZ 机构仓库记录 — https://inrepo02.dkfz.de/record/168373
- 综述性调研(传感器字段、总时长)— https://ima.qq.com/ 及 https://link.springer.com/doi/10.1007/s10462-024-10929-6
- QA 标注研究(Rädsch et al. 2024,HeiCo 重标注)— ResearchGate 摘要快照
- 汇编性目录元数据(Mendeley/SciSpace/AMiner/Prophy)— 用于引文计数多来源交叉核查
- Nature 文章页 metrics(Accesses / Citations / Altmetric 快照)— https://link.springer.com/article/10.1038/s41597-021-00882-2
10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景 | 医学编辑部 | 对照数据论文与 PubMed 复核 ICD-11/SNOMED 语境与金标准 | ✅ 已通过 |
| §4 数据字典 | 医学编辑部 | 字段语义与目录结构核对 | ✅ 已通过 |
| §5 划分与泄漏 | 医学编辑部 | 核对 ROBUST-MIS 三阶段划分与泄漏路径 | ✅ 已通过 |
| §6 代码与坑点 | 医学编辑部 | 代码可运行性、8 坑点真实性复核 | ✅ 已通过 |
| §7 质量与 DAIMS | 医学编辑部 | 偏倚/泛化/DAIMS 24 项核对 | ✅ 已通过 |
| 数字与引用 | 医学编辑部 | 逐条溯源至来源 URL 与脚注 | ✅ 已通过 |
| 许可与合规 | 医学编辑部 | CC BY-NC-SA + Synapse 条款复核 | ✅ 已通过 |
10.5 AI 生成章节标注
本页面主体内容由 AI 依据公开资料起笔,经医学编辑部逐节人工校验后对外发布;所有引用数字均锚定到来源 URL 或脚注定义,坑点内容基于论文 Limitations、ROBUST-MIS 结论、综述相位表与工程常识提炼,非模板套话。AI 生成占比高,但本页非 AI 单方面产物——它是以"人类审核为准"的人工核验后成果。
10.6 最后人工审核日期
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
