信息速览
INFOBOX — HeiChole 一屏速览
维度 内容 本质 多中心腹腔镜胆囊切除手术视频的工作流+技能分析基准(数据集+EndoVis 挑战赛+在线排行榜三合一) 团队 Heidelberg 大学医院/NCT Heidelberg(通讯 Martin Wagner),联合 DKFZ、ICube Strasbourg、caresyntax、Konica Minolta 等;48 位署名作者 论文 MedIA 2023 May;86:102770(doi:10.1016/j.media.2023.102770;PMID 36889206;arXiv:2109.14956) 数据 33 视频=Heidelberg 15+Salem 15+GRN-Sinsheim 3;共 22 小时;3 家德国中心 划分 训练 24(Heidelberg 12+Salem 12)/测试 9(三中心各 3);分层随机 四任务 相位(7)+ 动作(4)+ 器械存在(21 器械/7 类别)+ 技能评估(5 维度) 标注量 250 相位转换/5514 动作/6980 器械出现/495 技能评级;Anvil 逐帧标注 技能体系 改良 GOALS(S1 深度感知/S2 双手灵活/S3 效率/S4 组织处理/S5 难度),省略 autonomy 核心结果 相位 F1 最高 67.7%(HIKVision+CUHK 并列冠军)/器械 63.8%(Konica Minolta)/动作仅 23.3%(Wintegral)/技能 MAE 0.78(CareSyntax 独队) 获取 训练集 24 公开(CC BY-NC-SA, Synapse)/测试集 9 私有(提交 Docker 容器评测+排行榜) 许可 数据集 CC BY-NC-SA;论文 © 2023 The Authors(Elsevier);使用须引用论文 库内互链 cholec80(78)、cholect50(223)、cholecseg8k(233)、endoscapes(353)、autolaparo(313)、miccai-surgt(83)、cataracts(253)、jigsaws(283)
HeiChole 是手术数据科学(surgical data science)领域一个"三重身份"的基准:它既是一个多中心腹腔镜胆囊切除视频数据集,又是2019 年 EndoVis 挑战赛" Surgical Workflow and Skill Analysis"子挑战的评测载体,还是一个持续更新的在线排行榜。它最独特的贡献不在于数据规模(33 段视频在同类里算小),而在于把外科医生**“做得怎么样”(手术技能评估)第一次和"做到哪一步"(手术相位识别)、“在做什么”(手术动作识别)、“用什么做”(器械存在检测)放进了同一个评测框架**——并用 12 支国际队伍的结果证明:前三个任务尚可,第四个(技能)几乎无人能做。
对 AI-Ready 检索者而言,HeiChole 是库内首个把"术者技能分级"作为一等评测任务的腹腔镜视频基准(对比 cholec80/cholect50 聚焦相位与动作三元组、endoscapes 聚焦安全视野、jigsaws 是机器人缝合技能)。但它有一个必须提前说清的"门":测试集 9 段视频不公开,你只能提交算法让组织方替你跑——这既是它防作弊的设计,也是它在可获取性上的最大折扣。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——训练集 24 段公开可下,测试集 9 段永远拿不到,别指望本地复现官方分数。
- 关心技能评估:直奔 §5 与 §4——GOALS 五维度、为何省略 autonomy、技能评级为何只有 3-5 分,三段连读。
- 做工作流识别算法:直奔 §4 任务体系与 §7 基准结果——四任务定义、指标公式、12 队成绩单可直接对标。
§0 导读:这个数据集解决什么问题
0.1 一个被"单中心高精度"掩盖的泛化问题
论文开篇点出一个尴尬的现状:在手术相位识别这个任务上,单中心公开数据集的平均精度(AP)已经报到 91%(指 Cholec80,Twinanda et al. 2017)。92% 的数字看起来很美好,但它是在一家医院、一套设备、一群术者上测出来的。一旦换医院、换器械、换术者习惯,还能剩多少?
HeiChole 的核心动机就是回答"泛化性"这个问号。为此它做了两件事:
- 多中心:把数据从单中心扩到3 家德国外科中心(Heidelberg 大学医院、Salem 医院、GRN-Sinsheim 医院),并且刻意在测试集里让三中心均匀分布(各 3 段)——这样测出来的分数才代表"跨中心泛化"。
- 加难度任务:不满足于相位识别,把手术动作(更难、更细粒度)和手术技能(更主观、更高层)也纳入评测。
0.2 三个身份:数据集 / 挑战赛 / 排行榜
HeiChole 不是"发完论文就归档"的静态数据集,而是一个活的 benchmark:
| 身份 | 载体 | 作用 |
|---|---|---|
| 数据集 | Synapse 项目 syn18824884 |
提供 24 段训练视频+全部注释,供训练 |
| 挑战赛 | EndoVis 2019 子挑战 | 2019 年 12 支队伍提交算法,产出对比验证结果 |
| 排行榜 | www.synapse.org/Heichole |
基于未公开测试集,持续接受新算法提交与排名 |
这三者共同构成论文所说的"validated reference benchmark"(经验证的参考基准)。新方法可以持续与 12 队的历史成绩对标,这是它区别于一次性数据集的关键价值。
0.3 为什么它在库内有独特定位
本库已收录多个腹腔镜胆囊切除相关条目,但各有侧重:
- cholec80(rid 78):80 段视频,相位+器械(单中心),HeiChole 的相位协议直接仿照它;
- cholect50(rid 223):动作三元组(instrument-verb-target);
- cholecseg8k(rid 233):手术场景语义分割;
- endoscapes(rid 353):安全视野(CVS)评估基准;
- jigsaws(rid 283):机器人(da Vinci)缝合手势与技能。
HeiChole 的差异点是**“外科技能评估(surgical skill assessment)”——用改良 GOALS 对术者做 1-5 分评级,这在本库是独一份**。因此查重结论:不撞库,且填补库内技能评测维度的空白。
0.4 一个必须提前知道的门槛
HeiChole 的测试集不公开。论文原话是"we decided not to publish the test data set to avoid fraud"(为避免作弊,我们决定不公开测试集)。要拿到官方测试分数,只能提交 Docker 容器让组织方运行。这意味着:
- 你可以下载并训练(24 段训练集公开);
- 你无法在本地复现官方排行榜上的分数;
- 一切官方对比结果以论文表格与在线排行榜为准。
这个设计在防作弊上是合理的,但在可获取性上打了折扣——详见 §6 与附录 B(DAIMS 表)的 A 项评分。
0.5 谁应该读这份条目
- 手术视频理解研究者:四任务定义、指标公式、12 队成绩单(§4、§7);
- 外科技能评估研究者:GOALS 五维度、标注流程、为何省略 autonomy(§3、§5);
- 认知手术辅助系统开发者:多中心泛化性结果与难点分析(§7、§8);
- 数据集方法论研究者:防作弊设计、BIAS 合规、挑战赛统计方法(§3、§7);
- 只想要数据的人:§6 与附录 D 决策树,5 分钟搞定。
§1 数据集速览:十问十答
Q1:HeiChole 是什么?
一个多中心腹腔镜胆囊切除手术视频的工作流与技能分析基准,33 段视频、3 家德国中心、共 22 小时,用于评测手术相位识别、动作识别、器械存在检测和技能评估四类算法。
Q2:数据从哪来?
德国 3 家医院:Heidelberg 大学医院(15 段)、Salem 医院(15 段)、GRN-hospital Sinsheim(3 段)。均为常规临床采集、匿名化后使用。
Q3:多少数据?
33 段视频,总时长 22 小时,平均每段 40.04 ± 18.06 分钟。注释包括 250 次相位转换、5514 次动作出现、6980 次器械出现、495 条技能评级。
Q4:有哪几个任务?
四个:(1)7 相位识别;(2)4 动作识别;(3)21 器械(7 类别)存在检测;(4)5 维度技能评估。
Q5:训练/测试怎么分?
训练 24 段、测试 9 段。训练集中 Heidelberg 与 Salem 各 12;测试集三中心各 3。分层随机分配。
Q6:测试集能下载吗?
不能。 测试集从未公开。要拿官方分数只能提交 Docker 算法,由组织方评测并(应请求)发布到在线排行榜。
Q7:什么许可?
数据集 CC BY-NC-SA(署名-非商业性使用-相同方式共享),Synapse 托管。使用必须引用论文。
Q8:挑战赛什么时候办的?
EndoVis 2019 子挑战" Surgical Workflow and Skill Analysis",与 MICCAI 2019 同期;12 支国际队伍参赛。
Q9:结果怎么样?
相位识别最好(F1 最高 67.7%,HIKVision+CUHK 并列冠军);器械其次(63.8%,Konica Minolta);动作最差(仅 23.3%,Wintegral);技能只有 1 队参赛(MAE 0.78,CareSyntax)。
Q10:为什么值得关注?
因为它是小样本但高标注密度的典型,是多中心泛化性的测试床,也是技能评估这一"最难任务"的起点。论文的结论直白:手术工作流与技能分析"尚未解决(not solved yet)"。
§2 数据构成与规格
2.1 规模、来源与机构构成
HeiChole 的数据规模在手术视频数据集里属于**“小而精”:总量仅 33 段视频,但每一帧都被赋予了四类标注。它的价值不在体量,在于标注密度和多中心代表性**。
三中心构成:
| 中心 | 视频数 | 录制设备 | 分辨率 / 帧率 |
|---|---|---|---|
| Heidelberg University Hospital | 15 | Karl Storz 腹腔镜 2D 相机(30° 光学) | 960×540 px,25 fps |
| Salem Hospital | 15 | Richard Wolf ENDOCAM Logic HD(30° 光学) | 1920×1080 px,大部分 50 fps(3 台为 720×576 px, 25 fps) |
| GRN-hospital Sinsheim | 3 | Richard Wolf ENDOCAM Logic HD(30° 光学) | 1920×1080 px,大部分 50 fps |
| 合计 | 33 | 两类厂商设备 | 混合分辨率/帧率 |
设备异质性是刻意的:论文特别指出"不同外科中心使用了不同厂商的器械,这提高了本数据集(对器械识别任务的)代表性"。换句话说,混合设备是为了测泛化性而保留的——这正是它与单中心数据集(如 cholec80 仅一家中心一套设备)的根本差异。
时间规格:总时长 22 小时,平均每段 40.04 ± 18.06 分钟。
视频边界定义(复现时的关键约定):每段视频起于腹腔镜镜头首次插入患者腹腔,止于镜头最后一次取出。这个边界排除了手术室准备、麻醉、镜头清洁等腔外片段(这些片段被白帧替换,见 §2.5)。
2.2 训练/测试划分
划分是 HeiChole 的评测公平性基石,也是它与多数数据集不同的地方——测试集刻意做了中心均衡。
| 集合 | 总数 | 中心分布 | 是否公开 |
|---|---|---|---|
| 训练集 | 24 | Heidelberg 12 + Salem 12 | ✅ 公开(CC BY-NC-SA) |
| 测试集 | 9 | Heidelberg 3 + Salem 3 + GRN-Sinsheim 3 | ❌ 不公开 |
设计动机(论文原文):
- 训练集让 Heidelberg 与 Salem 均等(各 12)——保证训练时两大中心的表观均衡;
- 测试集让三中心各 3——保证评测时能测出跨中心泛化,而不是偏向某一中心;
- 分配方式为分层随机分配(stratified random assignment);
- 测试集大小(9)是"在保留足够训练集的前提下,最大化泛化评估能力"的折中结果。
这是一个**典型的"小测试集+强均衡"**策略。9 段测试视频在统计上很小,因此论文用了 bootstrap(1,000 次重采样)和 Wilcoxon 检验来量化排名不确定性——见 §7.4。
2.3 四任务标注总账
33 段视频上叠加了四套逐帧/逐对象标注:
| 标注类型 | 粒度 | 单位 | 总量 | 类别数 |
|---|---|---|---|---|
| 手术相位 | 每帧一个值 | 帧 | 250 次相位转换 | 7 相位(P0-P6) |
| 手术动作 | 每帧 4D 二值向量 | 帧 | 5514 次出现 | 4 动作(A0-A3) |
| 器械存在 | 每帧多维多值向量 | 帧 | 6980 次出现 | 21 器械 / 7 类别(IC0-IC6) |
| 技能评级 | 每对象一个整数 | 视频×对象 | 495 条 | 5 维度(S1-S5) |
"495 条"的构成:33 段视频 × 3 个评分对象(完整手术 + P1 相位 + P3 相位)× 5 个技能维度 = 495。这个数字自洽,可作为验证数据集完整性的一个锚点。
2.4 视频命名与匿名化
- 匿名化后统一命名为 HeiChole-1, HeiChole-2, …, HeiChole-33;
- 论文图中出现过 HeiChole-25(作为测试视频示例,见 Figure 7 动作识别的 hold 分析);
- 原始文件名、患者信息全部去除,符合 EU GDPR(欧盟通用数据保护条例)。
2.5 伦理合规与腔外片段处理
论文对伦理合规有明确交代,这对手握临床数据的研究者是可复制的模板:
- 法理依据:使用**常规采集的临床数据(routinely collected data)**并匿名化,以符合伦理标准与 GDPR;
- 腔外场景审查:镜头拉出腹腔(如清洁镜头)时的腔外画面被人工审查并替换为白帧(manually censored, frames replaced with white frames);
- 匿名重命名:文件重命名为 HeiChole-N 序列。
为什么这个处理重要:手术视频的"隐私泄漏点"往往不在腹腔内画面(那是解剖结构),而在腔外片段——可能拍到手术室环境、人员、器械台上的标签等。白帧替换是最小化隐私暴露的标准做法,也是许多公开手术数据集被拒稿的常见卡点。HeiChole 把它写进了方法节,值得作为数据发布合规的参考。
2.6 数据规格速查表(复现必读)
| 属性 | 值 |
|---|---|
| 视频总数 | 33 |
| 总时长 | 22 小时 |
| 单视频均长 | 40.04 ± 18.06 分钟 |
| 中心数 | 3(Heidelberg / Salem / GRN-Sinsheim) |
| 训练 / 测试 | 24 / 9 |
| 训练中心分布 | Heidelberg 12 + Salem 12 |
| 测试中心分布 | 各 3 |
| 分辨率 | 960×540 / 1920×1080 / 720×576(混合) |
| 帧率 | 25 / 50 fps(混合) |
| 光学 | 30° 腹腔镜 |
| 视频边界 | 镜头首次插入 → 最后取出 |
| 匿名化 | HeiChole-1 … HeiChole-33 |
| 腔外片段 | 替换为白帧 |
| 标注工具 | Anvil |
| 标注视角 | 功能/组织/操作/行为(无空间) |
复现提醒:由于分辨率与帧率混合,训练前必须统一预处理(如统一缩放至 250×250 或 224×224、统一采样帧率)。论文未提供官方预处理脚本——这是复现的第一个工程门槛。
2.7 与"大规模手术视频数据集"的口径对照
常有检索者问:“HeiChole 只有 33 段,是不是太小了?” 答案取决于看什么口径:
| 口径 | HeiChole | 典型单中心集 |
|---|---|---|
| 视频段数 | 33(小) | 80-1000+(大) |
| 标注密度 | 四任务逐帧 | 通常单/双任务 |
| 中心数 | 3 | 1 |
| 技能标注 | 有 | 无 |
| 总时长 | 22 h | 常达数百 h |
结论:HeiChole 是**“小样本、高标注密度、多中心"的典型。它的价值不在体量,在于标注质量与多任务结构**。若研究目标是"大规模预训练”,它不合适;若研究目标是"多中心泛化+技能+多任务",它是稀缺资源。
§3 注释流水线:谁标的、怎么标、如何保证可信
3.1 标注工具与理论框架
- 工具:Anvil 视频标注研究工具(Kipp, 2014)——一个学术界常用的开源视频标注平台,支持逐帧多轨标注。
- 理论框架:依据 Neumuth et al. (2009),一次外科活动包含五个视角:
| 视角 | 英文 | 含义 | HeiChole 是否标注 |
|---|---|---|---|
| 功能 | functional | 做什么(如"抓取") | ✅ 动作 |
| 组织 | organizational | 谁做的(如"术者左手") | ✅(标注但未发布) |
| 操作 | operational | 用什么(如"无创抓钳") | ✅ 器械 |
| 空间 | spatial | 在哪里(空间位置) | ❌ 未标注 |
| 行为 | behavioral | 何时(逐帧时间) | ✅ 时间轴 |
论文特别说明:“本研究标注了除空间(spatial)视角外的所有视角。” 即 HeiChole 不含空间定位标注(无器械位置框、无解剖区域分割)——这是它与 cholecseg8k(语义分割)、miccai-surgt(器械追踪)的关键区别。
3.2 标注人员配置与可靠性设计
这是 HeiChole 标注质量的核心保障,也是它值得细读的部分:
| 标注对象 | 标注人数 | 人员类型 | 分歧处理 |
|---|---|---|---|
| 手术相位 | 3 人 | 专门培训的医学生 | 共识解决(consensus) |
| 手术技能 | 2 人 | 专门培训的医学生 | 共识解决(consensus) |
| 动作 / 器械 | 标注流程同相位 | 依附录规则 | 依附录规则 |
三条质量设计:
- 明确定义:为相位、动作、器械标注分别制定了显式规则(explicit rules),规则收录在论文附录中;
- 训练/测试一致:训练集与测试集采用完全相同的标注流程(identical procedure);
- 独立标注+共识:相位由 3 人独立标注,技能由 2 人独立标注;出现分歧(相位起止、技能等级)时由同一批学生讨论并共识解决。
双口径提示:论文承认潜在误差来源是"相位起始/结束边界或技能等级上的分歧",处理方式是"共识"。这是"共识法"而非"多数投票法"或"专家仲裁法"——虽然效率高、一致性可控,但缺少独立的第三方仲裁,与方法论上更严格的"多专家+仲裁"模式(如 PANDA-PLUS 的三层终审)有区别。检索者若关注标注可靠性方法学,应注意到这一差异。
3.3 标注规则的价值:一份可复用的"手术活动字典"
论文把标注规则放进附录,并给出一个完整的标注示例,翻译如下:
“在手术开始后 10 分 15 秒,术者用左手持无创抓钳执行抓取并保持(grasping and holding)动作。”
这个句子同时编码了四视角:功能(grasp/hold)、组织(术者左手)、操作(无创抓钳)、行为(10:15)。这种"一句话四要素"的标注设计,使 HeiChole 的标签天然可跨任务拼接(相位→动作→器械→技能),为多任务学习提供了理想结构。
3.4 与 Cholec80 的协议继承关系
HeiChole 的相位体系直接继承自 Cholec80——论文原文:“one of seven surgical phases was assigned to each individual frame, analogous to the Cholec80 data set”(仿照 Cholec80 数据集)。
这意味着:
- 用 cholec80 预训练、再用 HeiChole 微调,是自然的技术路线;
- 但两者的相位并非完全相同:Cholec80 有固定相位顺序,而 HeiChole 明确"相位不必按固定顺序出现"(“did not necessarily occur in a fixed order”)——这使 HeiChole 的相位识别更难,也是论文解释为何其相位 F1 低于单中心报告值的原因之一(见 §7.2 讨论)。
3.5 BIAS 合规:一份"挑战赛报告模板"
论文明确说明其结构遵循 BIAS statement(Biomedical Image Analysis ChallengeS,Maier-Hein et al. 2020b)——这是生物医学影像分析挑战赛的透明报告规范。它包括:
- 结构化的挑战设计描述(数据集生成 → 挑战设计 → 参赛算法 → 结果分析);
- **审稿清单(reviewer checklist)**放在附录;
- 对排名不确定性做统计分析(bootstrap + Kendall’s τ + Wilcoxon)。
这是 HeiChole 的方法论加分项:它不只是一个数据集,更是一份"如何规范地报告一场 AI 挑战赛"的范本。对计划举办挑战赛的团队,其结构可直接借鉴。
§4 任务体系:四个任务、四套标签、四种难点
HeiChole 的核心是四任务体系。每一任务对应一种标注、一种指标、一种难点。
4.1 任务一:手术相位识别(Phase Recognition)
- 定义:为每一帧分配 7 个相位之一。
- 标注粒度:每帧一个值(单标签)。
- 七个相位:
| 编号 | 英文 | 中文 |
|---|---|---|
| P0 | preparation | 准备 |
| P1 | calot triangle dissection | Calot 三角解剖 |
| P2 | clipping and cutting | 夹闭与切断 |
| P3 | gallbladder dissection | 胆囊解剖 |
| P4 | gallbladder packaging | 胆囊装袋 |
| P5 | cleaning and coagulation | 清洗与电凝 |
| P6 | gallbladder retraction | 胆囊牵出 |
-
难点:
- 顺序不固定——相位可乱序出现,不能靠"规则状态机"简单推断;
- P5 可能缺失——5 段视频(15.1%)无 P5;
- 起止边界模糊——如 P1/P2 的分界在临床上有主观性。
-
分布特征(关键硬数字):
- 7 相位全出现于 28 段视频(84.8%);
- 每段始于 P0,止于 P6(84.8%)或 P5(15.2%);
- 平均每段 7.6 ± 1.8 次相位转换;
- 相位均长范围:1.4 ± 1.2 min(P6)至 17.2 ± 9.6 min(P1,论文此处误标 P3)。
⚠️ 论文笔误存照:4.1.1 节写 “17.2 min ± 9.6 min (calot triangle dissection, P3)”,但 2.2.1 节明确定义 calot triangle dissection = P1、gallbladder dissection = P3。本条目按 P1=calot(最长相位)书写,并保留该处矛盾供检索者核对。
4.2 任务二:手术动作识别(Action Recognition)
- 定义:为每一帧判断 4 个动作是否正在发生。
- 标注粒度:每帧 4D 二值向量(1=发生,0=不发生)。
- 四个动作:
| 编号 | 英文 | 中文 |
|---|---|---|
| A0 | grasp | 抓取 |
| A1 | hold | 保持 |
| A2 | cut | 切割 |
| A3 | clip | 夹闭 |
- 分布特征:
- 总 5514 次,平均 167.1 ± 93.6 次/台;
- grasp(A0):n=2830,最高频(28.6 ± 34.6/台),但单次均长仅 9.9 ± 11.3 s(短促重复);
- hold(A1):n=2124,频率次之但时间最长(21.5 ± 25.9/台,单次均长 974.2 ± 879.0 s ≈ 16 分钟);
- cut(A2):n=315(9.6 ± 9.1/台,均长 7.7 ± 10.6 s);
- clip(A3):n=245(7.4 ± 3.3/台,均长 9.6 ± 5.4 s)。
- 执行者(performer)标注——标注了但未发布:
| 动作 | 左手 | 右手 | 助手手 |
|---|---|---|---|
| grasp / hold | ✅ | ✅ | ✅ |
| cut / clip | ❌ | ✅ | ❌ |
hold(A1) 时长:左手 1497.8 ± 620.6 s、右手 68.6 ± 56.6 s、助手手 1356.3 ± 830.1 s。切割与夹闭仅术者右手完成——这是动作识别的一个强烈先验,但因执行者未发布,挑战赛任务不含执行者识别。
- 难点:动作时长极不均衡(hold 占 73.3% 时长,cut/clip 各仅 0.4%),导致类别极度不平衡,这是动作任务 F1 极低的直接原因(见 §7.3)。
4.3 任务三:器械存在检测(Instrument Presence Detection)
- 定义:为每一帧判断各器械是否可见。
- 标注粒度:每帧多维二值向量(存在=1/不存在=0)。
- 21 种器械 → 7 个类别:
| 编号 | 英文类别 | 中文 | 平均出现时长/台 |
|---|---|---|---|
| IC0 | grasper | 抓钳 | 25.1 ± 12.3 min |
| IC1 | clipper | 施夹器 | 1.5 ± 0.9 min |
| IC2 | coagulation instruments | 电凝器械 | 18.1 ± 8.4 min |
| IC3 | scissors | 剪刀 | 1.1 ± 1.4 min |
| IC4 | suction-irrigation | 吸引-冲洗 | 3.8 ± 6.7 min |
| IC5 | specimen bag | 标本袋 | 4.2 ± 3.4 min |
| IC6 | stapler | 吻合器 | 0.03 ± 0.16 min |
-
总计:6980 次器械出现,平均 211.5 ± 134.0 次/台。
-
可见性定义(复现关键):器械一旦其特征尖端(tip)出现在画面即标注为可见;尖端后续消失、仅剩杆部可见时继续标注;若杆部进入视野但尖端从未出现,则不标注。
-
stapler(IC6) 不在测试集——7 类别中有 6 类进入测试评测。
-
中心差异(器械代表性证据):
- argon beamer(I11)(29.83 ± 61.05 s/台)仅 Heidelberg 使用;
- crocodile forceps(I17)(29.72 ± 43.85 s/台)仅 Salem/GRN-Sinsheim 使用。
这种"某器械只在某中心出现"的分布,既是多中心优势(覆盖更多器械类型),也是跨中心泛化的挑战(测试集可能遇到训练集没见过的器械)。
-
向量维度口径(存照):正文提到"器械类别用 7 维度向量(7 类别+1 undefined shaft+14 保留)"与"器械用 31 维度向量(21 器械+1 undefined shaft+9 保留)"两处表述,数字口径不完全自洽。对外主口径为"21 器械 / 7 类别",向量维度细节以论文原文为准。
4.4 任务四:外科技能评估(Skill Assessment)——独创维度
这是 HeiChole 区别于库内其他腹腔镜数据集的核心任务。
- 评分体系:改良 GOALS(Global Operative Assessment of Laparoscopic Skills,Vassiliou et al. 2005)——一个已被验证的腹腔镜技能视频评估工具。
- 五个评分维度(每项 1-5 整数):
| 编号 | 英文 | 中文 | 来源 |
|---|---|---|---|
| S1 | depth perception | 深度感知 | GOALS |
| S2 | bimanual dexterity | 双手灵活性 | GOALS |
| S3 | efficiency | 效率 | GOALS |
| S4 | tissue handling | 组织处理 | GOALS |
| S5 | difficulty | 手术难度 | Chang 对 GOALS 的改编(Chang et al. 2007) |
- 评分对象:每段视频的三个对象——完整手术(full operation)+ P1 相位 + P3 相位。
- 标注总量:33 × 3 × 5 = 495 条。
- 为何省略 “autonomy”(自主性)——论文原文解释:“仅凭腹腔内视频无法做有效的自主性评估,因为缺少术中对话信息与资深医师辅助程度的信息。” 这是一个诚实且重要的方法学声明:GOALS 原本的第 5 项是 autonomy,本研究将其替换为 difficulty(S5),因此它不是完整的 GOALS,而是"去掉自主性、加入难度"的改良版。
- 技能分布(关键发现):
- 评级介于 3(中)到 5(最佳)之间;
- 从未出现 1 或 2 分——即数据集中没有低技能术者样本;
- 数据集含各难度等级的手术。
- 中心难度差异(重要偏倚):
| 中心 | 难度 1 | 难度 4 | 难度 5 |
|---|---|---|---|
| Heidelberg(15 例) | 3 例 | 2 例 | 2 例 |
| Salem(15 例) | 8 例 | 1 例 | 0 例 |
| Sinsheim(3 例) | 3 例 | 0 例 | 0 例 |
Heidelberg 的病例显著更难(有 5 分难度病例),小医院则以简单病例为主。这是跨中心评测时的隐性偏倚——测试集三中心各 3 段,如果不做难度分层,测出的分数会受病例难度分布影响。
- 难点:
- 主观性强——技能评分本质是主观判断,观察者间变异大;
- 样本稀缺——仅 2 名医学生标注;
- 类别覆盖偏——无低技能样本;
- 任务难解——挑战赛仅 1 队参赛(见 §7.5)。
4.5 四任务横向对照表
| 任务 | 标签类型 | 类别数 | 总量 | 指标 | 最佳成绩 | 难度评价 |
|---|---|---|---|---|---|---|
| 相位识别 | 每帧单值 | 7 | 250 转换 | F1 | 67.7% | 中 |
| 动作识别 | 每帧 4D 二值 | 4 | 5514 次 | F1 | 23.3% | 极高 |
| 器械存在 | 每帧多维二值 | 21/7 类 | 6980 次 | F1 | 63.8% | 中高 |
| 技能评估 | 每对象整数 | 5 维度 | 495 条 | MAE | 0.78 | 高(样本少) |
4.6 为什么"四任务"设计本身是一项贡献
在 HeiChole 之前,手术视频数据集通常是单任务的——要么做相位,要么做器械,要么做分割。HeiChole 的第一个方法学贡献,是把四个不同抽象层级的任务放进同一个数据集、同一套视频、同一次挑战赛。这带来三重价值:
- 可比较性升级:过去不同论文在各自数据集上报告相位/动作结果,数字不可比。HeiChole 让同一批视频上测四个任务,排名可直接对照。
- 多任务学习的试验台:论文中 NCT、VIE-PKU、Wintegral 三队同时提交了相位+动作+器械三个任务——这为"多任务模型能否共享表征"提供了第一手数据。
- 难度梯度:四个任务从易到难形成梯度(相位>器械>技能>动作),研究者可据此判断"我的方法在哪一层"。
对检索者的启示:评估一个手术视频方法时,不应只看它在单一任务上的分数,而应看它在 HeiChole 四任务上的综合表现——这才是"手术视频理解能力"的完整画像。
4.7 任务间的内在关联
四个任务并非孤立,而是存在因果/相关结构:
相位(宏观阶段)
├── 决定可能的动作分布(如 clip/cut 集中在 P2)
├── 决定可能的器械分布(如 IC5 集中在 P4)
└── 反映解剖场景(影响技能评分的语境)
动作(功能操作)── 由器械执行(operational 视角)
技能(术者水平)── 体现在所有任务上的流畅度/经济性
论文在器械分析中明确指出了这种关联:“grasper(IC0) 几乎全程存在,clipper(IC1)/scissors(IC3) 集中在中间 1/3(对应 P2),specimen bag(IC5) 在最后 1/3 高存在(对应 P4),手术开始无器械(对应 P0 仅套管插入与可视化)。” 这种任务间的一致性,是设计多任务模型时的天然先验,也是评估模型是否"学到了手术结构"的检验标准。
§5 技能评估专题:把"外科医生做得好不好"变成可评测对象
技能评估是 HeiChole 最独特、也最困难的部分。它值得单独一章,因为它触及一个根本问题:外科操作的"好坏"能被机器客观测量吗?
5.1 为什么技能评估是手术数据科学的"圣杯"
手术工作流分析(“做到哪一步”)本质上是分类问题——相位有明确的解剖学标志。但技能评估(“做得好不好”)本质上是评价问题——它依赖对操作流畅度、组织损伤风险、动作经济性的综合判断,这些在临床上往往由资深外科医生通过观察得出。
HeiChole 试图回答的是:这些主观评价能否被标准化、被量化、进而被算法学习? 论文的答案是:数据上做得到,算法上还差得远。
5.2 改良 GOALS:五个维度拆解
GOALS 原本用于腹腔镜技能的视频评估,HeiChole 对其做了两处改造:
| 维度 | GOALS 原项 | HeiChole 处理 |
|---|---|---|
| S1 深度感知 | ✅ | 保留 |
| S2 双手灵活性 | ✅ | 保留 |
| S3 效率 | ✅ | 保留 |
| S4 组织处理 | ✅ | 保留 |
| autonomy 自主性 | ✅ | 省略 |
| S5 难度 | ❌(Change 2007 加入) | 新增 |
为何省略 autonomy:论文的理由极为务实——“仅凭腹腔内视频无法有效评估自主性,因为没有术中对话信息,也没有资深医师辅助程度的信息。” 一个术者是否需要上级指导,往往体现在对话和助手动作中,而这些信息在纯手术视野视频里是缺失的。这是一个诚实的能力边界声明。
为何新增难度(S5):困难的手术天然更难做好。若不控制难度,技能评分会被病例难度混杂(confounding)。HeiChole 用 Chang 对 GOALS 的改编(Chang et al. 2007),基于炎症迹象、粘连、解剖条件等参数对难度分级,使技能评分"可比较"。
5.3 评分对象:为什么是"完整+两个相位"
技能标注并非只标"整段手术"一个分,而是标三个对象:
- 完整手术(full operation)——整体印象;
- P1 calot triangle dissection——解剖难度最高、风险最集中的关键步骤;
- P3 gallbladder dissection——分离操作的代表步骤。
设计逻辑:技能在不同步骤上的表现可能不同。一个术者可能在 Calot 三角解剖时谨慎(S4 组织处理好),但在胆囊分离时效率低。分步骤评分能捕捉这种差异。这也是 495 条标注的来源(33 × 3 × 5)。
5.4 技能分布的偏倚:为什么没有"差生"
论文诚实报告:技能评级只有 3-5 分,从未出现 1 或 2 分。
这意味着什么:
- 数据集中没有低技能操作者——可能是 3 家中心的手术均由有经验的外科医生完成,也可能是评分者对"最低分"的保守倾向(评分者偏差);
- 对技能预测算法而言,这造成样本范围受限——算法难以学会区分"差"与"中";
- 对评测而言,MAE 0.78 是在一个窄分布上取得的,不能外推为"算法能识别任何技能水平"。
这是一个典型的"数据集反映的是采集环境,而非真实分布"问题。检索者若用 HeiChole 训练技能评估模型,必须意识到它只覆盖中高技能区间。
5.5 技能评估的方法学开放性
论文在讨论中坦承技能评估的固有困难,并引用了早期工作(Doyle et al. 2007)指出"技能评分的观察者间变异"。这一段值得完整理解:
- 主观性难消除:即使 GOALS 已是被验证的工具,不同评分者对同一视频仍可能给不同分;
- 样本与标注者少:仅 2 名医学生标注,无法评估标注者间一致性(inter-rater reliability)的统计量;
- 任务难解:挑战赛中仅 1 支队伍(CareSyntax)提交了技能评估结果,说明社区对这个任务的参与度极低——可能因为难度高、也可能因为缺乏激励。
结论:技能评估是 HeiChole 提出的"新问题",而非"已解决的问题"。它的价值在于开辟方向,不在于提供成熟基准。
5.6 技能评估的技术路线参考(本条目综合)
虽然没有大量参赛方案可参考,但从任务定义可提炼几条技术要点:
- 输入可用整段视频——与相位/动作任务的"online analysis only"不同,技能评估允许使用整段视频(因为技能是全局属性);
- 多实例学习(MIL)思路——视频级标签(一个分数)对应帧级特征,适合 MIL;
- 回归 vs 序数分类——技能是序数量表(1-5),用序数回归(ordinal regression) 或按 MAE 训练的回归头比普通分类更合适;
- 分步骤建模——可对 full/P1/P3 分别建模再融合;
- 难度作为协变量——S5 难度应作为特征或分层因子,避免混杂。
§6 获取与许可:一道"半开半闭"的门
这是 HeiChole 最需要检索者看清的部分。它的获取方式是分层的:训练集公开,测试集永远拿不到。
6.1 三种资产、三道门
| 资产 | 内容 | 获取方式 | 许可 |
|---|---|---|---|
| 训练集 | 24 段视频 + 全部注释 | 公开下载(Synapse syn18824884) |
CC BY-NC-SA |
| 测试集 | 9 段视频 + 注释 | 不公开——仅通过提交算法评测 | CC BY-NC-SA(但不可下载) |
| 排行榜 | 未公开测试集上的排名 | 公开可查(www.synapse.org/Heichole) |
— |
| 论文 | 全文 | Elsevier(付费)/ arXiv 预印本(免费) | © 2023 The Authors |
6.2 数据集许可:CC BY-NC-SA 逐条解读
论文 User Notes 原文:
“The data set was published under a Creative Commons Attribution-NonCommercial-ShareAlike (CC BY-NC-SA) license on Synapse, which means that it will be publicly available for non-commercial usage. Should you wish to use or refer to this data set, you must cite this paper. The licensing of new creations must use the exact same terms as in the current version of the data set.”
逐条:
- BY(署名):必须署名原作者;
- NC(非商业):禁止商业用途——用 HeiChole 训练商业产品需另行授权;
- SA(相同方式共享):衍生作品必须沿用相同的 CC BY-NC-SA 条款(copyleft);
- 强制引用:使用必须引用论文(Wagner et al., MedIA 2023;86:102770);
- 版本细化缺失:论文未标注 CC BY-NC-SA 的具体版本号(4.0 还是更早)——这是待核细节(见 §9)。
⚠️ 与库内条目对照:CC BY-NC-SA 属于较严格的开放许可(限制商业使用+强制同许可扩散),比 CC BY-4.0(如 PANDA-PLUS-Bench)严格,比"请求制"(如 PANDA-PLUS 掩码)宽松。商业应用需谨慎。
6.3 测试集的不公开设计:反作弊的代价
论文明确:
“The training data set will be published together with this publication. However, we decided not to publish the test data set to avoid fraud (Maier-Hein et al., 2018).”
“avoid fraud”(避免欺诈)指什么:论文引用指出——若测试数据公开,后续参赛队伍可能针对测试集过拟合甚至作弊(如暗中调参),使排名失真。这是 AI 挑战赛的经典难题(Maier-Hein et al. 2018 专门讨论过)。
HeiChole 的解决方案——提交算法而非结果:
- 在 Synapse 注册(
syn18824884); - 访问训练数据;
- 用训练集训练算法;
- 提交已训练算法(Docker 容器);
- 组织方用未公开的测试集评测,报告结果,并(应队伍请求)发布到在线排行榜。
提交技术细节(复现关键):
- 提交物是 Docker 容器,须实现接口:输入视频 → 计算挑战结果 → 输出 CSV;
- 仅接受完整提交(各任务无缺失);
- Docker 镜像由组织方保管、不分享;
- 团队可选提供源码(非强制);
- 仅接受自动方法(不含人工干预);
- 提交为 “online analysis only”——不得使用未来帧信息(因果约束);
- 例外:技能评估任务可用整段视频作输入(因技能是全局属性);
- 允许用第三方公开数据增强训练。
这一设计的双向影响:
| 优点 | 缺点 |
|---|---|
| 防作弊,排名可信 | 本地无法复现官方分数 |
| 统一评测环境(Docker) | 依赖组织方持续运行评测 |
| 支持持续打榜 | 反馈周期长(须等组织方运行) |
| 保护测试集患者隐私 | 检索者无法"拿到全部数据" |
6.4 ★ 地域封锁实录(重要获取坑)
2026-09-30 本环境实抓 https://www.synapse.org/Synapse:syn18824884/wiki/591922 返回:
{"errorCode": "GEO_RESTRICTION",
"reason": "Requests originating from this region are blocked. For more information see: https://grants.nih.gov/grants/guide/notice-files/NOT-OD-25-083.html"}
含义:Synapse 从本沙箱所在区域被地理封锁(引 NIH NOT-OD-25-083 政策)。因此:
- 本条目无法通过实抓 Synapse 页面核验训练集当前下载状态与排行榜活跃度;
- 一切规模/许可/获取细节均以 arXiv 全文 PDF + PubMed + DKFZ/Heidelberg 书目记录三源互证;
- 检索者若在受限区域,需另行安排合规网络路径(如机构 VPN 或镜像),否则可能连训练集都无法下载。
这是本条目最重要的实操提醒之一——HeiChole 的可获取性不仅受"测试集私有"限制,还受"平台地域封锁"限制,是双重门槛。
6.5 论文本身的获取
- 正式版:Elsevier(Medical Image Analysis),DOI
10.1016/j.media.2023.102770——需订阅(isAccessibleForFree: false;PubMed 标注 “Free article” 指摘要,全文视机构订阅); - 预印本:arXiv:2109.14956(免费全文,52 页含附录)——推荐检索者从这份入手,它包含全部标注规则与表格;
- PubMed:PMID 36889206(摘要 + 元数据);
- 机构库:DKFZ、Heidelberg 大学库均有记录(含摘要)。
6.6 获取决策树(文字版)
我想用 HeiChole
├─ 只想训练/研究 → 训练集 24 段(Synapse syn18824884,CC BY-NC-SA)→ 注意地域封锁
├─ 想拿官方分数 → 提交 Docker 容器 → 组织方评测 → 排行榜
├─ 想看排名 → www.synapse.org/Heichole(未公开测试集)
└─ 想要全部 33 段原始数据 → ❌ 不可能(测试集 9 段永久不公开)
6.7 引用规范
使用 HeiChole 必须引用:
Wagner, M., Müller-Stich, B.P., Kisilenko, A., Tran, D., Heger, P., Mündermann, L., … Speidel, S., Bodenstedt, S. (2023). Comparative validation of machine learning algorithms for surgical workflow and skill analysis with the HeiChole benchmark. Medical Image Analysis, 86, 102770. doi:10.1016/j.media.2023.102770
§7 基准结果:12 支队伍的成绩单与它揭示的问题
7.1 评测方法
HeiChole 的评测设计体现了 BIAS 规范的严谨性:
指标:
- 相位 / 动作 / 器械:F1-score
$$F1 = 2 \cdot \frac{precision \cdot recall}{precision + recall}$$
计算方式:各类别 F1 平均 → 对每视频 F1 取平均(等权,不按出现率/时长加权); - 技能:MAE(平均绝对误差)
$$MAE = \frac{1}{n}\sum_{i=1}^{n}|\hat{Y}_i - Y_i|$$
为什么选 F1 和 MAE:F1 同时考虑假阳性与假阴性;MAE 对技能评分给出了"平均偏离多少分"的直观印象。
排名稳定性分析:
- Bootstrap:1,000 次从测试集重采样,重算排名,评估排名对扰动的稳定性;
- Kendall’s τ:量化原始排名与 bootstrap 排名的一致性(1=完全一致,-1=完全反转);
- Wilcoxon 符号秩检验:5% alpha,Holm 多重检验校正,做算法两两显著性比较;
- 工具:challengeR toolkit v1.0.1(Wiesenfarth et al. 2021)。
获奖政策:四任务各设一奖,前提是该任务至少 3 队提交;组织方成员可参赛但无获奖资格。
7.2 相位识别:HIKVision 与 CUHK 并列冠军
| 项 | 结果 |
|---|---|
| F1 区间(n=9 队) | 23.9% – 67.7% |
| 冠军 | HIKVision(65.4%) 与 CUHK(65.0%)并列 |
| 最高识别相位 | P1 calot triangle dissection 82.8%、P0 preparation 79.4% |
| 最低识别相位 | P4 gallbladder packaging 50.2%、P5 cleaning and coagulation 54.8% |
为何并列冠军:两者差距极小,且 CUHK 在多数视频上检测结果更优,故组织方判定二者共同夺冠——这是对"小测试集下微小差距不显著"的务实处理。
含逾期提交的分析:CAMMA 1 与 CAMMA 2 在截止后提交,不计入奖项。加入后,CAMMA 1 最佳、HIKVision 次之,二者显著优于 rank 5-10,但与 CUHK(rank 3)、CAMMA 2(rank 4)无显著差异。相位 Kendall’s τ 均值 0.93(中位 0.91,IQR 0.91-0.96)——排名较稳定。
为何比单中心 91% 低很多(论文讨论):
- 无固定相位顺序——HeiChole 相位可乱序,比 cholec80 的规则序列更难;
- 多中心异质性——三中心设备、习惯、病例难度不同;
- P2/P4 等短相位难识别(clipping and cutting 只针对特定血管与胆囊管,样本少)。
7.3 动作识别:全任务最低,几乎未解决
| 项 | 结果 |
|---|---|
| F1 区间(n=5 队) | 21.8% – 23.3% |
| 冠军 | Wintegral(23.3%) |
| 参赛队数 | 仅 5 队(四任务中最少) |
动作占比 vs 识别占比(揭示失败模式):
| 动作 | 真实占比 | 算法识别占比 | 偏差 |
|---|---|---|---|
| grasp(A0) | 1.2% | 1.1% | 略低估 |
| hold(A1) | 73.3% | 83.2% | 高估 |
| cut(A2) | 0.4% | 1.0% | 高估 |
| clip(A3) | 0.4% | 0.3% | 略低估 |
诊断:所有算法倾向高估 hold(最长动作)、低估 cut/clip(最短、最少)——典型的类别不平衡失效。hold 占 73.3% 时长,算法"猜 hold"就能拿高召回,但短动作 cut/clip 几乎无法捕捉,导致 F1 极低。图 7 仍以测试视频 HeiChole-25 为例,对比了所有算法对 hold(A1) 的识别曲线。
结论:动作识别是 HeiChole 四任务中最未解决的——F1 仅 20+%,远低于实用门槛。
7.4 器械存在检测:Konica Minolta 领先
| 项 | 结果 |
|---|---|
| F1 区间(n=8 队) | 38.5% – 63.8% |
| 冠军 | Konica Minolta(63.8%) |
| 冠军检测量 | 51872 次器械出现(5763.56 ± 4310.01/台) |
偏差分析:
- 在手术进度 10-35% 区间,剪刀(IC3)与标本袋(IC5)被检测不足;
- 标本袋(IC5)在参考中应集中出现在最后 1/3(对应 P4 胆囊装袋),但算法持续检测(时间定位错误);
- 剪刀(IC3)整体检测频率低于参考。
排名稳定性:器械 Kendall’s τ 均值 0.93(中位 0.93,IQR 0.93-1.00)——非常稳定。冠军(Konica Minolta)与亚军(CUHK)显著优于其他所有算法。
7.5 技能评估:仅 1 队参赛,MAE 0.78
| 项 | 结果 |
|---|---|
| 参赛队数 | 仅 1 队(CareSyntax) |
| MAE | 0.78 |
| 预测策略 | 每视频给恒定分:S1/S2/S3 = 4,S4 = 3,S5 = 2 |
如何理解 0.78:CareSyntax 对每段视频给出固定分数(不随视频变化),却取得了 0.78 的 MAE。这说明:
- 技能分数分布集中(3-5 分,见 §5.4),常数预测就已不错;
- 真正的"技能预测"尚无有说服力的方案;
- 该任务参赛度极低,是公认的开放难题。
这一结果本身就是一个重要发现:它说明 HeiChole 的技能评估任务尚未被严肃挑战——0.78 的 MAE 是"地板值"而非"天花板"。
7.6 结果汇总表
| 任务 | 参赛队数 | 冠军 | 最佳指标 | 任务成熟度 |
|---|---|---|---|---|
| 相位识别 | 9 | HIKVision + CUHK(并列) | F1 65.4% | 中等 |
| 器械存在检测 | 8 | Konica Minolta | F1 63.8% | 中高 |
| 动作识别 | 5 | Wintegral | F1 23.3% | 低(未解决) |
| 技能评估 | 1 | CareSyntax | MAE 0.78 | 极低(起步) |
7.7 论文的核心结论
论文结论直言:
“Surgical workflow and skill analysis are promising technologies to support the surgical team, but there is still room for improvement, as shown by our comparison of machine learning algorithms. … it is of utmost importance to create more open, high-quality datasets in order to allow the development of artificial intelligence and cognitive robotics in surgery.”
即:方向正确,但远未成熟;社区亟需更多开放、高质量的手术数据集。HeiChole 的贡献正是提供了一个可对比的起点——它的价值不在于"最高分",而在于"统一的、可复现的、防作弊的评测基准"。
7.8 讨论中的其他要点
论文讨论还提出几个对未来研究有指导意义的观察:
- 相位识别泛化的中心差异:最优方法在 Salem 与 GRN-Sinsheim 数据上表现最好——可能因为 Heidelberg 病例更难;
- 标注规则的局限:P2 相位仅针对一根特定动脉与胆囊管标注,未覆盖小静脉等额外血管,因此 HeiChole 不反映血管解剖的多样性——这是为限制标注复杂度做的取舍;
- 器械任务与相位任务的难度相当:论文指出器械存在检测"可以像相位识别一样困难",因为单帧可能同时出现多种器械;
- 数据增强的作用:动作任务 top 5 方法全部使用了某种数据增强。
7.9 从结果能读出什么:五条对研究者的启示
HeiChole 的 12 队成绩单不只是"排名",更是一份关于手术视频理解难点的诊断报告。以下五条启示可直接迁移到后续研究:
启示一:类别不平衡是动作识别的头号敌人。hold 占 73.3% 时长,cut/clip 各仅 0.4%。所有算法都"猜 hold"(识别占比 83.2%),导致短动作几乎无法识别。解决方向:重采样、类别加权损失、时序上下文建模(利用"clip 通常紧跟 cut"的先验)。
启示二:多中心泛化不是"免费"的。论文发现"最优方法在 Salem 与 Sinsheim 数据上表现最好",即在较简单的中心上分数更高——若不控制病例难度,跨中心比较会失真。解决方向:难度分层评测、中心作为域标签做域适应。
启示三:小测试集需要统计严谨性。9 段测试视频很小,因此论文用 bootstrap+Kendall’s τ+Wilcoxon 三重统计。启示:报告"排名"时必须报告不确定性——仅凭 F1 高低判断优劣在小测试集上不可靠(如相位冠军差距 0.4pp 被判并列)。
启示四:主观任务需要"标准化量表"起步。技能评估用 GOALS 这一已有验证的量表,而非临时定义——这使不同研究可比较。启示:做主观任务评测时,优先复用已被验证的临床量表。
启示五:防作弊设计与可复现性存在张力。测试集不公开保护了排行榜公平性,却牺牲了本地可复现性。启示:设计基准时应在"公平"与"开放"间权衡,并考虑"公开一部分测试数据+隐藏另一部分"的折中。
7.10 与后续工作的对标建议
若你要用 HeiChole 评估自己的方法,建议对标以下基线:
| 任务 | 对标基线 | 目标 |
|---|---|---|
| 相位 | HIKVision/CUHK(F1 65.4%/65.0%) | 超过 67.7% 才算显著进步 |
| 器械 | Konica Minolta(F1 63.8%) | 超过 63.8% |
| 动作 | Wintegral(F1 23.3%) | 该任务门槛低,任何 >30% 都是突破 |
| 技能 | CareSyntax(MAE 0.78,常数预测) | 显著低于 0.78 才算学到东西 |
特别提醒技能任务:CareSyntax 用常数预测拿到 0.78,说明任何真正的技能预测方法必须显著低于 0.78 才有意义——否则不如直接给常数。这是评估技能方法时的"地板基线"。
7.11 排名不确定性报告的示范价值
论文用 Figure 5 的 “blob plots”(气泡图)可视化排名不确定性——气泡半径代表某算法在 1,000 次 bootstrap 中取得某名次的频率。这是一种比"单纯排名表"更诚实的报告方式,值得借鉴:
- 若两算法气泡高度重叠 → 排名差异不显著;
- 若气泡分离 → 排名差异稳健;
- 相位任务中"第二、三名非常接近"(Kendall’s τ 0.93),器械任务中"第一、二名接近"。
方法论意义:在小测试集上,"谁第一"往往不如"谁在第一梯队"重要。检索者读 HeiChole 结果时,应关注"梯队"而非"名次"。
§8 生态与影响:一场由工业界深度参与的学术挑战赛
8.1 学术谱系与工业参与
HeiChole 的一个显著特征是工业界的深度参与——这在手术数据科学领域并不常见:
| 机构 | 类型 | 参与方式 |
|---|---|---|
| KARL STORZ SE & Co. KG | 器械厂商 | 提供设备;资助 InnOPlan/Surgomics;作者 Lars Mündermann 员工 |
| Richard Wolf GmbH / Wintegral | 器械厂商 | 作者 Wolfgang Reiter 员工 |
| Konica Minolta, Inc. | 影像/光学 | 作者 Satoshi Kondo(完成工作时员工);器械任务冠军 |
| caresyntax GmbH | 手术 AI 公司 | 6 位作者(Twick/Kirtac/Hosgor/Bolmgren/Stenzel/von Siemens);技能任务唯一参赛队 |
| Intuitive Surgical | 手术机器人 | Felix Nickel 接受器械支持 |
| Medtronic | 医疗器械 | Felix Nickel 接受器械支持 |
双刃剑:工业参与带来了设备、数据、算法团队,也带来了利益冲突(论文如实披露)。对检索者而言,理解 HeiChole 的工业背景有助于判断其技术路线的偏向(如器械类别体系可能反映厂商视角)。
8.2 学术网络:横跨欧洲与亚洲
作者群横跨多国顶尖机构:
- 德国:Heidelberg 大学医院、NCT、DKFZ、KIT、Fraunhofer MEVIS、TU Dresden CeTI;
- 法国:ICube / Strasbourg 大学、IHU Strasbourg(Nicolas Padoy 团队,CAMMA);
- 中国:中科院深圳先进技术研究院(Fucang Jia);
- 中国香港:香港中文大学(Qi Dou、Pheng Ann Heng);
- 日本:Konica Minolta / Muroran Institute of Technology(Satoshi Kondo);
- 美国:Children’s National Hospital、University of Maryland;
- 英国:Carissa Reid 等。
意义:这是一个真正的国际协作基准,其对比验证结果的代表性远超单实验室工作。
8.3 与 Cholec80 生态的关系
HeiChole 与 Cholec80 是互补而非竞争关系:
| 维度 | Cholec80 | HeiChole |
|---|---|---|
| 中心数 | 1 | 3 |
| 视频数 | 80 | 33 |
| 相位顺序 | 固定 | 不固定 |
| 任务 | 相位 + 器械 | 相位 + 动作 + 器械 + 技能 |
| 设备 | 单一 | 多厂商 |
技术路线:Cholec80 适合预训练(数据量大、规律性强),HeiChole 适合泛化性测试与技能研究(多中心、任务多样)。两者在库内可形成"预训练→评测"的互链闭环。
8.4 对后续研究的影响
HeiChole 作为基准的价值体现在几个方面:
- 可对比的起点:12 队成绩单成为后续方法的"基线";
- 持续排行榜:新方法可随时打榜(
www.synapse.org/Heichole); - 任务定义模板:四任务定义被后续手术视频工作广泛引用;
- 技能评估方向:开启了"手术技能自动评估"这一研究分支;
- BIAS 报告范本:其挑战赛报告结构成为规范参考。
8.5 局限性(论文自述 + 本条目补充)
论文自述局限:
- 数据量小(33 段),测试集仅 9 段;
- 只有 3 家德国中心,地理与人群代表性有限;
- 仅腹腔镜胆囊切除单一术式;
- 技能评估样本少、无低技能样本;
- P2 相位只覆盖特定血管,不反映解剖多样性。
本条目补充:
- 测试集不公开 + Synapse 地域封锁 = 获取双重门槛;
- 技能标注仅 2 人、无标注者间一致性统计;
- 商业使用受 CC BY-NC-SA 限制;
- 论文存在多处内部口径不一致(见 §10)。
§9 与库内条目的关系
9.1 家族图谱:腹腔镜手术视频数据集
HeiChole 属于本库的"腹腔镜手术视频"家族,与该家族其他成员的定位如下:
| 库内条目 | rid | 定位 | 与 HeiChole 的关系 |
|---|---|---|---|
| cholec80 | 78 | 80 段胆囊切除,相位+器械(单中心) | 上游协议来源(HeiChole 相位仿照之);预训练互补 |
| cholect50 | 223 | 动作三元组(instrument-verb-target) | 动作维度互补(HeiChole 是 4 动作二值,cholect50 是三元组) |
| cholecseg8k | 233 | 胆囊切除场景语义分割 | 同术式不同任务(分割 vs 识别) |
| endoscapes | 353 | 腹腔镜安全视野(CVS)评估 | 同属"安全性/质量评估"主题 |
| autolaparo | 313 | 腹腔镜子宫切除三任务 | 同属"手术工作流"家族(不同术式) |
| miccai-surgt | 83 | 立体内窥镜器械追踪 | 器械维度互补(追踪 vs 存在检测) |
| cataracts | 253 | 白内障手术视频基准 | 另一术式的工作流分析对照 |
| jigsaws | 283 | 机器人缝合手势与技能 | 技能评估的机器人对照(da Vinci vs 腹腔镜) |
9.2 检索路径建议
- 想研究手术相位识别:cholec80(预训练)→ HeiChole(多中心泛化评测);
- 想研究手术动作识别:cholect50(三元组)+ HeiChole(4 动作);
- 想研究器械检测:miccai-surgt(追踪)+ HeiChole(存在检测);
- 想研究技能评估:jigsaws(机器人)+ HeiChole(腹腔镜)——两个数据集合起来才是相对完整的技能评估图景;
- 想研究手术安全评估:endoscapes(CVS)+ HeiChole(工作流+技能)。
9.3 关键区分(避免混淆)
- HeiChole 不是 Cholec80 的"扩大版"——它更小但更多中心、更多任务;
- HeiChole 不是分割数据集——无空间标注(与 cholecseg8k 本质不同);
- HeiChole 不是机器人数据集——全部为腹腔镜(与 jigsaws 不同);
- HeiChole 的技能评估是库内唯一——这是检索时的最强差异化关键词。
§10 避坑清单:八个已踩过的坑
坑 1:测试集永远拿不到,别指望本地复现。HeiChole 的测试集 9 段视频从未公开(为避免作弊)。要拿官方分数必须提交 Docker 算法由组织方评测。任何号称"HeiChole 完整 33 段下载"的资源都可疑。
坑 2:Synapse 有地域封锁。2026-09-30 本环境实抓 syn18824884 返回 GEO_RESTRICTION(引 NIH NOT-OD-25-083)。在受限区域,连训练集都下不了——需合规网络路径。
坑 3:论文时点三口径。arXiv 预印本 2021-09-30;PubMed “Epub 2023 Feb 21”;Heidelberg 库 “Published 7 March 2023”;卷期 “2023 May;86”。引用前定口径。
坑 4:正文相位标签自相矛盾。4.1.1 写 calot triangle dissection 为 P3,2.2.1 定义为 P1。本条目按 P1=calot 书写。自动化抽取需警惕。
坑 5:标题大小写有别。arXiv 版 “Comparative Validation”,正式版 “Comparative validation”。按正式版小写。
坑 6:器械标注向量维度口径不自洽。正文出现"21D 类别"、“31D 器械”、“7 类别+1 shaft+14 保留”、"21+1+9 保留"等多处表述。对外主口径用"21 器械/7 类别"。
坑 7:技能评估不是完整 GOALS。HeiChole 省略了 autonomy 项,用 difficulty 替代——称"改良 GOALS"。别当作标准 GOALS 分数使用。且评级只有 3-5 分(无 1-2 分)。
坑 8:许可含 NC + SA 双重限制。CC BY-NC-SA:禁商业且衍生必须同许可。用 HeiChole 训练商业产品需另授权;衍生数据集必须沿用 CC BY-NC-SA。且必须引用论文。
补充坑 9(疑点):“HeiChole” 命名展开(Heidelberg+Cholecystectomy?)论文未明写,勿当作事实引用。
§11 总结
11.1 三句话总结
- HeiChole 是多中心腹腔镜胆囊切除手术视频的"工作流+技能"四任务基准:33 段视频 / 3 家德国中心 / 22 小时,7 相位 + 4 动作 + 21 器械 + 5 技能维度。
- 它的独特价值是"技能评估"与"多中心泛化性"——库内首个把术者技能分级作为一等任务的数据集,也是 cholec80 单中心范式的多中心升级。
- 它的门槛是"半开半闭":训练集 24 段公开(CC BY-NC-SA),测试集 9 段永久私有(Docker 提交评测),且 Synapse 存在地域封锁。
11.2 适合谁
- 手术工作流识别算法研究者(相位/动作/器械);
- 外科技能评估研究者(GOALS 方向);
- 认知手术辅助系统开发者(多中心泛化测试);
- 手术数据科学方法学研究者(BIAS 挑战赛报告范本);
- 需要"小而精、高标注密度"数据集的团队。
11.3 不适合谁
- 需要大规模数据训练的团队(33 段太小);
- 需要空间标注(分割/检测框)的研究(HeiChole 无空间标注);
- 需要商业使用权的研究(CC BY-NC-SA 禁商用);
- 无法访问 Synapse 的受限区域用户(除非安排合规网络);
- 需要本地复现官方测试分数的团队(测试集私有)。
11.4 30 秒决策卡
| 你的需求 | 是否适用 | 行动 |
|---|---|---|
| 训练手术相位/动作/器械模型 | ✅ | 下训练集 24 段(注意地域封锁) |
| 提交算法拿官方分数 | ✅ | Synapse 注册 → Docker 提交 |
| 研究外科技能评估 | ✅✅ | 库内唯一,强推 |
| 多中心泛化性研究 | ✅✅ | 测试集三中心均衡设计 |
| 需要分割/检测框标注 | ❌ | 转 cholecseg8k / miccai-surgt |
| 商业应用 | ❌ | CC BY-NC-SA 禁商用 |
FAQ(高频问答 32 问)
A. 基础认知
A1:HeiChole 是什么的缩写?
论文未明写。行业惯例推测为 Heidelberg + Cholecystectomy(海德堡中心+胆囊切除),但未经论文证实,勿作事实引用。
A2:HeiChole 和 Cholec80 什么关系?
HeiChole 的相位协议仿照 Cholec80(“analogous to the Cholec80 data set”),且 Cholec80 在正文作为 91% AP 的对照基准。但 HeiChole 更小(33 vs 80)、更多中心(3 vs 1)、更多任务(+动作+技能)。
A3:为什么叫"benchmark"而不是"dataset"?
因为它不只是数据集,还包括挑战赛评测结果和持续排行榜,是三者合一的"经验证的参考基准"。
A4:HeiChole 什么时候发布的?
数据 2019 年(训练集 5-31 与 8-15 分两批发布);挑战赛 2019 EndoVis;论文预印本 2021-09-30;正式发表 2023(MedIA vol 86)。
A5:谁做的?
Heidelberg 大学医院/NCT Heidelberg 主导(通讯 Martin Wagner),联合 DKFZ、ICube Strasbourg、caresyntax、Konica Minolta 等,48 位作者。
B. 数据与获取
B1:在哪下载?
训练集在 Synapse 项目 syn18824884。⚠️ 注意地域封锁(见 §6.4)。
B2:测试集能下载吗?
不能,永久不公开。为避免作弊设计(“not to publish the test data set to avoid fraud”)。
B3:怎么拿官方分数?
Synapse 注册 → 用训练集训练 → 提交 Docker 容器(输入视频输出 CSV)→ 组织方用测试集评测 → 排行榜。
B4:什么许可?
数据集 CC BY-NC-SA(署名-非商业-相同方式共享);论文 © 2023 The Authors(Elsevier)。使用必须引用论文。
B5:能商用吗?
不能(NC 条款)。商业应用需另行授权。
B6:衍生数据集要什么许可?
必须沿用相同条款(SA 条款)——即衍生作品也须是 CC BY-NC-SA。
B7:多少视频?
33 段(训练 24 + 测试 9)。
B8:哪些医院?
Heidelberg 大学医院(15)、Salem 医院(15)、GRN-hospital Sinsheim(3),均在德国。
C. 任务与标注
C1:有几个任务?
四个:相位识别、动作识别、器械存在检测、技能评估。
C2:七个相位是什么?
P0 preparation、P1 calot triangle dissection、P2 clipping and cutting、P3 gallbladder dissection、P4 gallbladder packaging、P5 cleaning and coagulation、P6 gallbladder retraction。
C3:四个动作是什么?
A0 grasp、A1 hold、A2 cut、A3 clip。
C4:器械怎么分类?
21 种器械归为 7 类:grasper(IC0)、clipper(IC1)、coagulation instruments(IC2)、scissors(IC3)、suction-irrigation(IC4)、specimen bag(IC5)、stapler(IC6)。
C5:技能评估用什么量表?
改良 GOALS——S1 深度感知、S2 双手灵活性、S3 效率、S4 组织处理、S5 难度。
C6:为什么技能评估没有 autonomy 项?
因仅凭腹腔内视频无法有效评估自主性(缺对话与辅助信息)。
C7:技能分为什么只有 3-5 分?
数据集中无低技能术者样本,或评分者保守——论文如实报告从未出现 1 或 2 分。
C8:标注是谁做的?
相位由 3 名、技能由 2 名 受训医学生独立标注,分歧共识解决。
C9:用什么工具标的?
Anvil 视频标注工具。
C10:有空间标注吗?
没有。 HeiChole 未标注 spatial(空间)视角——无位置框、无分割。
D. 基准结果
D1:相位识别最好多少?
F1 最高 67.7%,HIKVision 与 CUHK 并列冠军(65.4%/65.0%)。
D2:动作识别最好多少?
F1 仅 23.3%(Wintegral)——四任务中最差。
D3:器械检测最好多少?
F1 63.8%(Konica Minolta)。
D4:技能评估最好多少?
MAE 0.78(CareSyntax,唯一参赛队)。
D5:为什么动作识别这么差?
类别极度不平衡——hold 占 73.3% 时长,cut/clip 各仅 0.4%,算法倾向高估 hold、漏掉短动作。
D6:为什么相位识别比单中心 91% 低很多?
无固定相位顺序 + 多中心异质性 + 短相位难识别。
D7:多少队参赛?
共 12 队。相位 9 队、器械 8 队、动作 5 队、技能 1 队。
E. 生产与库内
E1:库内哪些条目可互链?
cholec80(78)、cholect50(223)、cholecseg8k(233)、endoscapes(353)、autolaparo(313)、miccai-surgt(83)、cataracts(253)、jigsaws(283)。
E2:HeiChole 在库内的独特定位?
唯一含外科技能评估维度的腹腔镜数据集。
E3:会和其他条目撞库吗?
不会。查重确认无 heichole 记录,与既有 cholec/laparo/surg 条目均不重复。
E4:为什么测试集不公开?
为避免参赛者针对测试集过拟合或作弊(引 Maier-Hein et al. 2018)。
E5:Synapse 打不开怎么办?
可能遭遇地域封锁(GEO_RESTRICTION)。需安排合规网络路径(如机构 VPN)。
F. 复现与工程细节
F1:视频边界怎么定义?
起于腹腔镜镜头首次插入腹腔,止于最后一次取出。
F2:腔外片段怎么处理?
人工审查并替换为白帧(去隐私)。
F3:视频怎么命名?
匿名化为 HeiChole-1 … HeiChole-33。
F4:提交有什么约束?
Docker 容器(视频→CSV);完整提交;“online analysis only”(不用未来帧);技能评估可用整段视频。
F5:能用第三方数据增强吗?
可以(“Participants were free to use third party public data to augment”)。
事实清单(硬事实 36 条)
- 视频总数:33 段腹腔镜胆囊切除视频。
- 中心数:3 家德国外科中心。
- 总时长:22 小时。
- 每视频平均:40.04 ± 18.06 分钟。
- 中心构成:Heidelberg 15 + Salem 15 + GRN-Sinsheim 3。
- 训练集:n=24。
- 测试集:n=9。
- 训练集中心分布:Heidelberg 12 + Salem 12。
- 测试集中心分布:三中心各 3。
- 划分方式:分层随机分配。
- 手术相位:7 个(P0-P6)。
- 相位转换:250 次。
- 手术动作:4 个(A0-A3)。
- 动作出现:5514 次。
- 手术器械:21 种。
- 器械类别:7 类(IC0-IC6)。
- 器械出现:6980 次。
- 技能维度:5 个(S1-S5)。
- 技能评级:495 条。
- 技能体系:改良 GOALS(省略 autonomy)。
- 标注工具:Anvil。
- 标注人员:相位 3 人、技能 2 人(医学生)。
- 相位全出现视频:28 段(84.8%)。
- 平均相位转换:7.6 ± 1.8 次/视频。
- 最长相位:calot triangle dissection(P1),17.2 ± 9.6 min(论文误标 P3)。
- 最短相位:gallbladder retraction(P6),1.4 ± 1.2 min。
- 最频繁动作:grasp(A0) n=2830。
- 最长动作:hold(A1) 均长 974.2 ± 879.0 s。
- 器械平均出现:211.5 ± 134.0 次/台。
- 最高频器械类:grasper(IC0) 25.1 ± 12.3 min/台。
- 挑战赛:EndoVis 2019 子挑战(MICCAI 2019)。
- 参赛队:12 支国际队伍。
- 相位冠军:HIKVision + CUHK(F1 65.4%/65.0%,并列)。
- 器械冠军:Konica Minolta(F1 63.8%)。
- 动作冠军:Wintegral(F1 23.3%)。
- 技能唯一参赛:CareSyntax(MAE 0.78)。
术语表(30 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| 手术工作流分析 | surgical workflow analysis | 识别手术进行到哪个步骤/相位 |
| 外科技能分析 | surgical skill analysis | 评估术者操作水平 |
| 手术相位 | surgical phase | 手术的宏观阶段(HeiChole 7 个) |
| 手术动作 | surgical action | 手术的功能性操作(HeiChole 4 个) |
| 器械存在检测 | instrument presence detection | 判断器械是否在视野中 |
| 腹腔镜胆囊切除 | laparoscopic cholecystectomy | 微创切除胆囊的手术 |
| GOALS | Global Operative Assessment of Laparoscopic Skills | 腹腔镜技能评估量表 |
| 深度感知 | depth perception | GOALS 维度 S1 |
| 双手灵活性 | bimanual dexterity | GOALS 维度 S2 |
| 效率 | efficiency | GOALS 维度 S3 |
| 组织处理 | tissue handling | GOALS 维度 S4 |
| 难度 | difficulty | HeiChole 新增维度 S5 |
| 自主性 | autonomy | GOALS 原项,HeiChole 省略 |
| 相位转换 | phase transition | 从一个相位切换到另一个 |
| 逐帧标注 | framewise annotation | 每一帧都赋标签 |
| 二值向量 | binary vector | 每维 0/1 表示是否发生 |
| EndoVis | Endoscopic Vision challenge | 内窥镜视觉挑战赛 |
| MICCAI | Medical Image Computing and Computer Assisted Intervention | 医学影像计算顶会 |
| BIAS | Biomedical Image Analysis ChallengeS | 挑战赛报告规范 |
| Anvil | — | 视频标注工具 |
| Calot 三角 | calot triangle | 胆囊三角,解剖关键区 |
| 胆囊管 | cystic duct | 胆囊出口管道 |
| F1-score | — | 精确率与召回率的调和平均 |
| MAE | mean absolute error | 平均绝对误差 |
| Bootstrap | — | 重采样估计不确定性 |
| Kendall’s τ | Kendall’s tau | 排名一致性相关系数 |
| Wilcoxon 检验 | Wilcoxon signed-rank test | 非参数两两比较检验 |
| challengeR | — | 挑战赛统计分析工具 |
| CC BY-NC-SA | — | 署名-非商业-相同方式共享许可 |
| GDPR | General Data Protection Regulation | 欧盟通用数据保护条例 |
附录
附录 A:条目信息速查卡
| 字段 | 值 |
|---|---|
| 官方名 | HeiChole — Surgical Workflow and Skill Analysis Benchmark |
| slug | heichole |
| 论文 | MedIA 2023 May;86:102770, doi:10.1016/j.media.2023.102770 |
| PMID | 36889206 |
| 预印本 | arXiv:2109.14956(2021-09-30,免费全文) |
| 托管 | Synapse 项目 syn18824884 / 排行榜 www.synapse.org/Heichole |
| 规模 | 33 视频 = 训练 24 + 测试 9;3 家德国中心;22 小时 |
| 任务 | 相位(7) + 动作(4) + 器械(21/7类) + 技能(5维度) |
| 许可 | CC BY-NC-SA(训练集公开,测试集不公开) |
| 挑战赛 | EndoVis 2019 子挑战;12 队参赛 |
| 库内互链 | cholec80(78)、cholect50(223)、cholecseg8k(233)、endoscapes(353)、autolaparo(313)、miccai-surgt(83)、cataracts(253)、jigsaws(283) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 顶刊 MedIA 开放记录 + arXiv 免费全文 + Synapse 项目 + 持续排行榜;"HeiChole"名明确,检索友好 |
| A 可获取性 | 4 | 训练集公开但测试集永久私有(Docker 提交评测),且 Synapse 存在地域封锁——三大失分项 |
| I 可互操作 | 7 | 视频 + CSV/逐帧标签标准,Anvil 通用工具;无官方 Parquet/HF 打包,无标准加载脚本 |
| M 元数据质量 | 8 | BIAS 合规、标注规则入附录、四任务定义完整;但正文存在相位标签(P1/P3)自相矛盾与器械向量维度口径不一 |
| S 可持续性 | 7 | Synapse(Sage Bionetworks)平台稳定,排行榜持续;但评测依赖组织方持续运行,且地域封锁影响可达性 |
| 综合评级 | 6.8/10(中上) | 方法与文档质量高、可发现性好;可获取性被"测试集私有+地域封锁"双重拖低 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 33 视频 / 3 中心 / 22h | 论文摘要 + 2.1 + 4.1 | arXiv PDF p.8/20 |
| 24 训练 / 9 测试;训练各 12;测试各 3 | 论文 2.1 节 | arXiv PDF p.8 |
| Heidelberg 15 / Salem 15 / Sinsheim 3 | 论文 2.1 节 | arXiv PDF p.8 |
| 7 相位 / 250 转换 / 5514 动作 / 6980 器械 / 495 技能 | 论文摘要 + 4.1 | arXiv PDF p.20 |
| 21 器械 / 7 类别 / 4 动作 / 5 技能维度 | 论文 2.2.1-2.2.4 | arXiv PDF p.11-12 |
| F1 相位 23.9-67.7% / 器械 38.5-63.8% / 动作 21.8-23.3% / 技能 MAE 0.78 | 论文摘要 + 4.2 | arXiv PDF p.24-28 |
| CC BY-NC-SA | 论文 User Notes | arXiv PDF 页尾 |
| 测试集不公开、Docker 提交 | 论文 3.1 + 4.3 | arXiv PDF p.12/28 |
| DOI / PMID | PubMed 记录 | pubmed.ncbi.nlm.nih.gov/36889206 |
| Synapse syn18824884 / 排行榜 | 论文正文 + Scholar highlights | 论文 3.1 + Data availability |
| GEO_RESTRICTION | 本环境实抓 | syn18824884 抓取 2026-09-30 |
附录 D:数据获取决策树
HeiChole 获取决策树
│
├─ 目的:训练模型 / 研究算法
│ ├─ 能访问 Synapse?(注意地域封锁)
│ │ ├─ 是 → 下载训练集 24 段(CC BY-NC-SA)
│ │ └─ 否 → 安排合规网络路径(机构 VPN / 镜像)
│ └─ 遵守:非商业 + 相同方式共享 + 引用论文
│
├─ 目的:拿官方测试分数
│ ├─ Synapse 注册(syn18824884)
│ ├─ Docker 容器(视频→CSV)
│ ├─ 提交(online analysis only)
│ └─ 组织方评测 → 排行榜
│
├─ 目的:看排行榜 / 对比 SOTA
│ └─ www.synapse.org/Heichole
│
└─ 目的:拿全部 33 段原始数据
└─ ❌ 不可能(测试集 9 段永久不公开)
附录 E:四任务标签结构规范
| 任务 | 标签格式 | 值域 | 每帧维度 |
|---|---|---|---|
| 相位 | 单值 | P0-P6(7 类) | 1 |
| 动作 | 二值向量 | 4 | |
| 器械类别 | 二值向量 | 7(+shaft+保留) | |
| 器械明细 | 二值向量 | 21(+shaft+保留) | |
| 技能 | 整数 | 1-5 | 5(3 对象各 5 维) |
附录 F:标注协议要点(复现参考)
- 工具:Anvil 视频标注工具;
- 理论框架:Neumuth 五视角(功能/组织/操作/空间/行为),HeiChole 标注除空间外四项;
- 相位:三人独立 → 共识;仿 Cholec80 七相位;
- 动作:4 动作逐帧二值;执行者标注但未发布;
- 器械:21 器械 7 类别;尖端出现即标可见,尖端消失后继续标;
- 技能:两人独立 → 共识;改良 GOALS 五维;对象为完整/P1/P3;
- 训练测试同流程:训练与测试采用相同规则。
附录 G:技能评估建模骨架(代码)
# 技能评估:序数回归参考骨架(示意,非官方)
import torch
import torch.nn as nn
class SkillRegressor(nn.Module):
"""输入:视频特征(整段可用);输出:5 维技能分数(1-5)。"""
def __init__(self, feat_dim=2048, hidden=256, n_dims=5):
super().__init__()
self.backbone = nn.Sequential(
nn.Linear(feat_dim, hidden), nn.ReLU(), nn.Dropout(0.3))
# 5 个独立回归头(共享 backbone)
self.heads = nn.ModuleList([nn.Linear(hidden, 1) for _ in range(n_dims)])
def forward(self, x):
h = self.backbone(x)
return torch.cat([head(h) for head in self.heads], dim=-1) # (B, 5)
# 训练目标:MAE(与论文评测指标一致)
# loss = torch.nn.functional.l1_loss(pred, target)
# 注意:S5(难度) 应作为协变量/分层因子,避免与技能混杂
附录 H:数据分析骨架(代码)
# 四任务标签统计参考(示意)
import pandas as pd
# 相位分布(每段视频的相位时长)
phases = ["P0","P1","P2","P3","P4","P5","P6"]
# 已知:7 相位全出现于 28/33 段;P5 缺失于 5 段
# 平均相位转换 7.6 ± 1.8
# 动作计数(已知总量)
actions = {"A0 grasp": 2830, "A1 hold": 2124, "A2 cut": 315, "A3 clip": 245}
# 合计 5514
# 器械类别平均出现时长(min/台)
instr = {"IC0 grasper": 25.1, "IC1 clipper": 1.5, "IC2 coag": 18.1,
"IC3 scissors": 1.1, "IC4 suction": 3.8, "IC5 bag": 4.2, "IC6 stapler": 0.03}
# 合计器械出现 6980 次(211.5 ± 134.0 次/台)
附录 I:统计指标计算公式表
| 指标 | 公式 | 用途 |
|---|---|---|
| F1 | 2·(P·R)/(P+R) | 相位/动作/器械(类别平均→视频平均) |
| MAE | (1/n)Σ\ | Ŷᵢ-Yᵢ\ |
| Kendall’s τ | (一致对-不一致对)/总对数 | 排名一致性 |
| Bootstrap | 1,000 次重采样 | 排名不确定性 |
| Wilcoxon | 符号秩检验 + Holm 校正 | 算法两两显著性 |
附录 J:12 队参赛任务分布
| 队伍 | 相位 | 动作 | 器械 | 技能 | 备注 |
|---|---|---|---|---|---|
| CAMI-SIAT | ✅ | ||||
| CAMMA | ✅ | ✅ | 含逾期 CAMMA1/2 | ||
| CareSyntax | ✅ | ✅ | 技能唯一参赛 | ||
| CUHK | ✅ | ✅ | 相位并列冠军 | ||
| HIKVision | ✅ | ✅ | 相位并列冠军 | ||
| IGITech | ✅ | ✅ | |||
| Konica Minolta | ✅ | ✅ | 器械冠军 | ||
| MEVIS | ✅ | ||||
| NCT | ✅ | ✅ | ✅ | 组织方机构 | |
| VIE-PKU | ✅ | ✅ | ✅ | ||
| Wintegral | ✅ | ✅ | ✅ | 动作冠军 |
附录 K:任务难度排序(本条目综合)
| 难度序 | 任务 | 最佳 F1/MAE | 参赛队 | 判断 |
|---|---|---|---|---|
| 1(最易) | 相位识别 | F1 67.7% | 9 | 有解剖标志,相对成熟 |
| 2 | 器械存在检测 | F1 63.8% | 8 | 视觉特征明确 |
| 3 | 技能评估 | MAE 0.78 | 1 | 主观、样本少、参赛极少 |
| 4(最难) | 动作识别 | F1 23.3% | 5 | 类别极不平衡,公认未解决 |
附录 L:中心异质性影响清单
| 维度 | Heidelberg | Salem | GRN-Sinsheim | 影响 |
|---|---|---|---|---|
| 视频数 | 15 | 15 | 3 | 小中心样本少 |
| 设备 | Karl Storz | Richard Wolf | Richard Wolf | 设备异质 |
| 分辨率 | 960×540 | 1920×1080* | 1920×1080 | 视觉差异 |
| 病例难度 | 高(有 5 分) | 低(无 5 分) | 低 | 评测偏倚 |
| 特有器械 | argon beamer(I11) | crocodile forceps(I17) | 同 Salem | 器械分布偏 |
* Salem 有 3 台为 720×576 px。
附录 M:与库内 cholec80(rid 78)的关系声明
- 协议继承:HeiChole 相位体系仿照 cholec80(论文原文 “analogous to the Cholec80 data set”);
- 关键差异:cholec80 单中心、固定相位顺序、80 段;HeiChole 多中心、无固定顺序、33 段;
- 互补用法:cholec80 预训练 → HeiChole 多中心泛化评测;
- 引用:HeiChole 正文将 cholec80 的 91% AP 作为单中心表现对照。
附录 N:手术工作流数据集景观总表
| 数据集 | 中心数 | 视频数 | 任务 | 空间标注 | 技能评估 |
|---|---|---|---|---|---|
| HeiChole | 3 | 33 | 相位+动作+器械+技能 | ❌ | ✅ |
| Cholec80 | 1 | 80 | 相位+器械 | ❌ | ❌ |
| CholecT50 | 1 | 50 | 动作三元组 | ❌ | ❌ |
| CholecSeg8k | 1 | 17(8080帧) | 语义分割 | ✅ | ❌ |
| AutoLaparo | 1 | 21 | 相位+动作+分割 | ✅ | ❌ |
| Endoscapes | — | 201/110 | 安全视野+分割 | ✅ | ❌ |
| JIGSAWS | — | 103 | 手势+技能(机器人) | ❌ | ✅ |
| Bar et al. 2020 | 多 | 1243 | 相位 | ❌ | ❌(不公开) |
注:本表为横向对照,各数据集口径以各自官方为准;cholecseg8k/autolaparo/endoscapes 的具体数字以库内对应条目为准。
附录 O:许可条款细读
| 资产 | 许可 | 要点 |
|---|---|---|
| 数据集 | CC BY-NC-SA | 署名 + 非商业 + 相同方式共享;版本号未标注 |
| 论文(正式) | © 2023 The Authors / Elsevier | 需订阅;摘要免费 |
| 论文(预印本) | arXiv(通常 CC 或 arXiv 许可) | 免费全文 |
| 强制要求 | 引用 | 使用数据集必须引用 Wagner et al. 2023 |
附录 P:使用合规清单
- [ ] 已确认用途为非商业(否则需另行授权);
- [ ] 衍生作品沿用了 CC BY-NC-SA 条款;
- [ ] 已引用论文(Wagner et al., MedIA 2023;86:102770);
- [ ] 已确认数据获取路径(Synapse 可达性 / 地域封锁);
- [ ] 若打榜,提交物为完整提交且符合 “online analysis only”;
- [ ] 若用技能评估任务,理解其为改良 GOALS(非标准)。
附录 Q:坑点档案(与 §10 对照)
| 坑号 | 摘要 | 类型 |
|---|---|---|
| 坑 1 | 测试集永久私有 | 获取 |
| 坑 2 | Synapse 地域封锁 | 获取 |
| 坑 3 | 论文时点三口径 | 引用 |
| 坑 4 | 相位标签 P1/P3 矛盾 | 数据 |
| 坑 5 | 标题大小写 | 引用 |
| 坑 6 | 器械向量维度口径不一 | 数据 |
| 坑 7 | 技能评估非完整 GOALS | 方法 |
| 坑 8 | 许可 NC+SA 双限制 | 法务 |
| 坑 9 | 命名展开未证实 | 疑点 |
附录 R:检索决策树
我要找"手术视频 + 技能评估"数据集
├─ 腹腔镜 + 技能评估 → HeiChole(本条目)✅ 库内唯一
├─ 机器人 + 技能评估 → jigsaws (283)
└─ 只要手术相位/动作 → cholec80 (78) / cholect50 (223)
├─ 要语义分割 → cholecseg8k (233) / autolaparo (313)
├─ 要安全视野 CVS → endoscapes (353)
└─ 要器械追踪 → miccai-surgt (83)
本条目依据 arXiv:2109.14956 全文 PDF、PubMed(PMID 36889206)、DKFZ/Heidelberg 书目记录三源互证撰写。 数据集规模、license、获取方式均按实核结果成稿;Synapse 页面因地域封锁(GEO_RESTRICTION)无法实抓,相关细节以三源互证为准。论文内部存在相位标签(P1/P3)与器械向量维度的口径不一致,已逐条存照(见 §10 与 FACTS.md §9)。命名展开" HeiChole = Heidelberg + Cholecystectomy"为行业惯例推测,未经论文证实,勿作事实引用。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- 3dteethland — 共享标签:医学影像 / 评测基准 / 挑战赛数据集 / 目标检测
- sics-155 — 共享标签:医学影像 / 手术视频 / 挑战赛数据集 / 图像分类
- rsna-pneumonia — 共享标签:医学影像 / 评测基准 / 挑战赛数据集 / 目标检测
- slam-laparoscopic-motions — 共享标签:医学影像 / 手术视频 / 评测基准 / 图像分类
- dental-opg-xray — 共享标签:医学影像 / 评测基准 / 图像分类 / 目标检测
- cxr-lt — 共享标签:医学影像 / 评测基准 / 挑战赛数据集 / 图像分类
- tus-rec — 共享标签:医学影像 / 评测基准 / 挑战赛数据集
- dfuc-2024 — 共享标签:医学影像 / 挑战赛数据集 / 图像分类 / 目标检测
- acouslic-ai — 共享标签:医学影像 / 挑战赛数据集 / 图像分类
- camelyon16 — 共享标签:医学影像 / 挑战赛数据集 / 图像分类 / 目标检测
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

