信息速览
INFOBOX — SLAM 一屏速览
维度 内容 全称 SLAM — Surgical LAparoscopic Motions(缩写撞名内窥镜 SLAM,须划界) 本质 腹腔镜手术基础动作视频片段分类数据集(clip 级 7 分类),非定位建图、非相位识别 团队 瑞金医院卢湾分院普外科(主)+ 中科院软件所 / 国科大杭高院 / 中科大 / 广州智能软件研究院 论文 Sci Data 12, 862 (2025);doi:10.1038/s41597-025-05093-7;PMID 40413211;2025-05-24 发表 数据 4,097 个片段 = 34 台手术 / 34 例患者 / 9 类术式;每片段 30 帧;1920×1080 / 25fps 类别 7 类基础动作:Abdominal Entry / Suction / Use Clip / Hook Cut / Suturing / Panoramic / Local Panoramic View 设备 26003BA HOPKINS 30° 内窥镜(10 mm 径 / 31 cm 长 / 超广角) 划分 train / val / test = 70% / 15% / 15% 标注 2 名副主任医师各标一半 + 1 名主任医师复核随机 10% 子集(该子集约 1% 被修正) 基准 ViViT 最高分类精度 85.90%(16 帧 / 768px / 80 epochs / batch 4) 迁移 腹腔镜模型 → 胸腔镜测试集 43.75%;混合模型 → 胸科 65.62%(胸科数据增强有效) 获取 figshare 公开、无需注册,CC BY 4.0;版本链 v1/v2/v3(现行 v3) 许可 数据集 CC BY 4.0|论文 CC BY-NC-ND 4.0|代码 GitHub(无显式 license) 伦理 瑞金医院卢湾分院伦理批号 LWEC2024022,豁免个体知情同意 库内互链 Cholec80(78)、CholecT50(223)、AutoLaparo(313)、Endoscapes(353)、HeiChole(756)、PhaKIR(755) ⚠ 禁止误链 EndoSLAM(408)、SLAM-3D-Endoscopic(82) 是内窥镜 SLAM 定位建图,与本条目风马牛不相及
SLAM(Surgical LAparoscopic Motions)是一个"把手术录像切成可训练的碎片"的数据集工程:它把瑞金医院卢湾分院 2021–2023 年间 34 台腹腔镜手术的完整录像,切成 4,097 个统一的 30 帧片段,每个片段打上七类基础动作之一的标签(如"电钩切割"“缝合”“吸引”)。它要解决的不是"识别手术处于哪个阶段",也不是"定位器械在哪",而是最底层的一步——认出画面里正在做哪个动作。这一层的价值在于:无论智能导航、术中辅助还是术后技能评估,第一步都得先看懂"钳子在夹什么、切割钩在切哪里"。
导语读法三则:
- 只想要数据:直奔 §6 获取与许可——它比多数手术数据集都好拿:figshare 公开、CC BY 4.0、无需注册、无需申请表单。
- 要复现或对比模型:直奔 §4 与 §5——Table 4 六组配置的逐类精度全表已转,GitHub 训练/推理脚本可直接跑。
- 怕和别的数据集搞混:先读 §1 与 §9——"SLAM"这个缩写在本库内撞了两条内窥镜定位数据集(rid 408 / 82),它们和本条目毫无关系,划界写在明面上。
§0 导读:这个数据集解决什么问题
腹腔镜手术对术者的技术要求极高:操作空间狭小、视觉反馈受限、动作精度要求苛刻。计算机视觉与深度学习在手术动作识别上的进展,本可支撑实时辅助、工作流优化、自动手术报告与技能评估;但这些技术的有效性被公开数据集的三个痼疾卡住——规模小(如 LapGyn4 仅 3 万余张图像)、同质性高(如 HeiChole 仅聚焦胆囊切除)、标注质量不一(如 CholecT50 未公开测试集)。
SLAM 的回答是:与其在一台术式上堆量,不如跨多术式采集"基础动作"。它选择七个在多数腹腔镜手术中都会出现的基础动作——腹腔进入(Abdominal Entry)、吸引(Suction)、上夹(Use Clip)、电钩切割(Hook Cut)、缝合(Suturing)、全景视野(Panoramic View)、局部全景视野(Local Panoramic View)——作为统一切片与标注的单位。这样做的逻辑是:“上夹”"缝合"这些动作是跨术式通用的,模型学到的是动作本身而非某个术式的特异流程,泛化性更好。
数据集的技术答案是"切片化":34 台完整手术录像 → 统一切成 30 帧片段 → 每个片段一个动作标签。相较于逐帧标注整个视频流,片段化在存储与训练上都更高效,也便于用标准视频分类模型(论文选了 ViViT)直接消费。作为初步验证,ViViT 在 4,097 个片段上取得最高 85.90% 的分类精度。
§0 读法三则:
- 这个数据集的定位是"地基"而非"顶层":它识别的是原子级基础动作,不直接给你相位或三元组——需要那类任务请转 Cholec80/CholecT50(§9)。
- 全文数字均出自论文五张表;唯一需要读者自己当心的是中文媒体报道的"标注一致性 99%"——论文里没有这个数字,是误读(坑 2)。
- 若你是搜"SLAM"进来的,请先确认你要的是动作识别(本条目)还是内窥镜同步定位与建图(本库 rid 408 / 82)——两者只是三个字母碰巧一样(坑 1)。
0.1 为什么要专门做"基础动作"这一层
把手术视频理解做成产品,通常要回答四层问题,从下往上依次是:
| 层级 | 问题 | 典型数据集 |
|---|---|---|
| L1 视觉感知 | 画面里有哪些器械、哪些解剖结构? | Endoscapes、CholecSeg8k |
| L2 动作识别 | 此刻在做哪一类操作(上夹/切割/缝合)? | SLAM(本条目) |
| L3 关系描述 | 哪个器械对哪个组织做了什么动作? | CholecT50 |
| L4 工作流/相位 | 整台手术进行到了哪个阶段? | Cholec80、AutoLaparo、HeiChole |
L2 是承上启下的一层:没有 L2,"上夹"这类原子语义就只能靠 L3 的三元组标注间接获得,而三元组标注的成本高得多(CholecT50 只有 50 段视频)。SLAM 的赌注是——多数下游任务需要的是动作语义,而不是完整的三元组关系;先把"做的是哪类动作"这层做扎实,再往上叠关系或相位,成本曲线更友好。这就是论文把 SLAM 定位为"分解术式的关键初始步骤(crucial initial step)"的完整含义。
0.2 三个"不变量"与一个"变量"
读这份数据集前,先抓住它的设计不变量:
- 不变量之一——片段长度固定 30 帧:无论原片段多长,统一切到 30 帧,短的用循环补齐。这让模型输入尺寸一致,代价是引入少量人工循环帧(附
looped_clips.csv可剔除)。 - 不变量之二——标签体系固定 7 类:跨全部 9 类术式共用一套 7 类动作词表,这是"跨术式泛化"的前提。
- 不变量之三——单中心采集:全部来自一家医院、一套设备、一致流程,降低机构间噪声,代价是机构多样性为零。
- 变量——术式分布极不均衡:胆囊切除 22 例 vs 多数术式仅 1–2 例,读"9 类术式"时应意识到这实际上是"1 类主术式 + 8 类补充术式"。
抓住"三不变量 + 一变量",后面所有关于类别不均衡、跨科迁移、泛化边界的讨论都能顺下来。
§0 读法三则:
- 这个数据集的定位是"地基"而非"顶层":它识别的是原子级基础动作,不直接给你相位或三元组——需要那类任务请转 Cholec80/CholecT50(§9)。
- 全文数字均出自论文五张表;唯一需要读者自己当心的是中文媒体报道的"标注一致性 99%"——论文里没有这个数字,是误读(坑 2)。
- 若你是搜"SLAM"进来的,请先确认你要的是动作识别(本条目)还是内窥镜同步定位与建图(本库 rid 408 / 82)——两者只是三个字母碰巧一样(坑 1)。
§1 数据集速览:十问十答
Q1:SLAM 的全称到底是什么,为什么容易混?
全称 Surgical LAparoscopic Motions(论文正文亦写作 “Surgical LAparo Motion”)。缩写成 SLAM 纯属巧合——"SLAM"在机器人/计算机视觉领域几乎默认指 Simultaneous Localization And Mapping(同步定位与建图),内窥镜领域也有多个 SLAM 数据集(本库的 EndoSLAM、SLAM-3D-Endoscopic)。本条目与定位建图没有任何关系,是手术动作识别。
Q2:数据到底有多少?
4,097 个视频片段,来自 34 台完整腹腔镜手术录像、34 例患者。每例患者一个匿名哈希 ID 目录,各含 15–38 个片段,每个片段统一 30 帧。
Q3:覆盖哪些术式?
9 类,以胆囊切除为主:胆囊切除 22、阑尾切除 6、胃间质瘤切除 2、腹壁疝修补 1、乙状结肠切除 1、直肠癌根治 1、乙状结肠癌根治 1、脾切除 1,外加 1 例跨科的胸腔镜肺手术(VATS)——后者不是腹腔镜术式,是团队特意加进来验证"动作识别能否跨科迁移"的。
Q4:七个动作类别分别是什么?
Abdominal Entry(腹腔进入)、Suction(吸引)、Use Clip(上夹/夹闭)、Hook Cut(电钩切割)、Suturing(缝合)、Panoramic View(全景视野)、Local Panoramic View(局部全景视野)。前五个是器械-组织操作,后两个是辅助导航动作(提供整体/局部视野用于定位与规划)。
Q5:视频规格如何?
1920×1080 分辨率、25 fps;采集设备为 26003BA HOPKINS 30° 内窥镜(超广角视野、10 mm 直径、31 cm 长、耐高温高压消毒、光纤传输)。每个片段统一切为 30 帧。
Q6:谁标的,可靠吗?
三级医疗专家体系:2 名副主任医师独立初标、各标一半;1 名主任医师对随机抽取的 10% 子集二次复核,歧义处修正(该子集内约 1% 被修正)。注意:论文未做正式标注者间一致性分析,作者明确将此列为局限。
Q7:模型验证做了什么?
用 ViViT(Video Vision Transformer) 做 7 分类:训练 80 epochs、batch 4、输入 8/16 帧、分辨率 224/448/768。最高总精度 85.90%(16 帧 / 768px),对应 test loss 0.4554;单类最高是 Hook Cut 的 96.69%。
Q8:哪些类别最难?
Panoramic View 最难(32.14%–71.43%,全表最低),论文归因于其频繁视角切换;Suction 与 Suturing 之间存在混淆。这说明"视角类"动作比"器械类"动作更依赖上下文理解。
Q9:我怎么拿到它?
figshare 公开、无需注册,DOI 10.6084/m9.figshare.28104782.v3,许可 CC BY 4.0——是本库手术视频条目里获取门槛最低的一档(对比 PhaKIR/HeiChole 的申请制与私测集)。
Q10:它和库里的 Cholec80/CholecT50/Endoscapes 怎么分工?
Cholec80/AutoLaparo 偏相位识别,CholecT50 偏动作三元组检测,Endoscapes 偏解剖分割与 CVS 安全视野评估,HeiChole 是多任务多中心基准;SLAM 的独特点是跨多术式的纯基础动作分类,且获取最开放。四者可组成"相位→动作→三元组→安全评估"的完整光谱(§9)。
1.1 一张表看懂 SLAM 的"独一份"
把 SLAM 的关键属性与库内最容易混淆的邻居并列,一眼看清差异:
| 属性 | SLAM | Cholec80(78) | CholecT50(223) | EndoSLAM(408) |
|---|---|---|---|---|
| 任务 | 基础动作分类 | 相位识别 | 动作三元组 | 内镜定位建图 |
| 标注粒度 | 片段级单标签 | 帧级 | 帧级 | 帧级位姿(6 DoF) |
| 类别数 | 7 类动作 | 7 相位+7 工具 | 100 类三元组 | 6 自由度位姿 |
| 术式范围 | 9 类(跨术式) | 胆囊切除 | 胆囊切除 | 消化道内镜 |
| 获取 | CC BY 4.0 免注册 | 公开 | 测试私有 | 公开 |
| "SLAM"含义 | Surgical LAparoscopic Motions | — | — | Simultaneous Localization And Mapping |
一句话:同库三个"SLAM"里,只有本条目在做动作识别;其余两个在做"相机在哪、场景长什么样"的几何问题。
1.2 十个最容易记错的数
为便于复核,把全文最容易张冠李戴的十个数字单列:
| 数字 | 含义 | 常见误记 |
|---|---|---|
| 4,097 | 视频片段总数 | 误记为"4,097 小时"或"4,097 例患者" |
| 34 | 手术台数 = 患者数 | 误记为 41 或 36(36 是 Table 2 术式行相加) |
| 9 | 术式类别数(含 1 例胸腔镜) | 误记为"9 种腹腔镜术式"(实为 8+1) |
| 7 | 动作类别数 | — |
| 30 | 每片段帧数 | 误记为"30 秒" |
| 15–38 | 每患者片段数区间 | 误记为"每患者 30 个" |
| 85.90% | ViViT 最高总精度(16 帧/768px) | 误记为"无配置的 SOTA" |
| 96.69% | 单类最高精度(Hook Cut, 16/224) | 误记为"总精度" |
| 10% / 1% | 抽查覆盖率 / 抽查内修正率 | 误记为"一致性 99%" |
| 43.75% / 65.62% | 跨科迁移(仅腹腔镜 / 混合模型) | 误记为"腹腔镜测试精度" |
§2 数据构成与规格
2.1 规模、来源与术式构成
SLAM 的全部数据来自单中心:上海交通大学医学院附属瑞金医院卢湾分院,采集窗口 2021–2023 年,共 34 台完整腹腔镜手术。核心口径如下:
| 维度 | 数值 |
|---|---|
| 视频片段总数 | 4,097 clip |
| 完整手术视频 | 34 段 |
| 患者数 | 34 例(匿名化哈希 ID) |
| 每患者片段数 | 15–38 |
| 片段长度 | 统一 30 帧 |
| 术式类别 | 9 类(含 1 例跨科胸腔镜) |
| 动作类别 | 7 类基础动作 |
| 分辨率 / 帧率 | 1920×1080 / 25 fps |
术式分布(论文 Table 2 “Types of Surgery”):
| 术式 | 例数 |
|---|---|
| 胆囊切除(Cholecystectomy) | 22 |
| 阑尾切除(Appendectomy) | 6 |
| 胃间质瘤切除(Resection of Gastric Stromal Tumor) | 2 |
| 腹壁疝修补(Abdominal Wall Hernia Repair) | 1 |
| 乙状结肠切除(Sigmoid Colectomy) | 1 |
| 直肠癌根治(Radical Resection of Rectal Cancer) | 1 |
| 乙状结肠癌根治(Radical Resection of Sigmoid Colon Cancer) | 1 |
| 脾切除(Splenectomy) | 1 |
| 胸腔镜肺手术(VATS for Lung Surgery) | 1 |
| 表内合计 | 36(⚠ 见下) |
⚠ 口径提醒:Table 2 术式计数相加为 36,而患者总数为 34(Single 32 + Combined 2)。差异来自 2 例联合手术(Cholecystectomy with Appendectomy,Table 3 的 index 10 与 26)——它们在术式计数的两行里被各计一次,在患者计数里则归为 1 例。论文 Table 2 内部计数不自洽,读者按"34 例患者 / 9 类术式条目"理解即可(存照见附录 Q 坑 4)。
患者画像(Table 2):年龄 53 ± 32(范围 21–78)岁;BMI 23.6 ± 6.0;性别 女 17 (50%) / 男 17 (50%);单术式 32 例、联合术式 2 例。
“单中心"是这份数据集的结构化特征,而非缺陷遮掩:学术教学医院的术者经验与设备标准化程度高,视频流程一致;代价是机构多样性为零,跨院泛化能力无法从数据本身评估。论文对此态度坦诚——它把"跨术式多样性”(而非跨机构多样性)当作主要卖点。
2.2 视频采集与设备规格
论文给出了细致的采集协议,是本条目质量判断的依据:
| 属性 | 规格 |
|---|---|
| 分辨率 | 1920 × 1080 |
| 帧率 | 25 fps |
| 内窥镜 | 26003BA HOPKINS 30°(超广角视野、10 mm 直径、31 cm 长、耐高温高压消毒、光纤传输抗干扰) |
| 安装方式 | 相机固定于手术台旁、连接腹腔镜设备,实时传输与高清录制 |
| 校准 | 每台手术前由专业技师校准测试设备 |
| 已知瑕疵 | 部分视频存在垂直条纹伪影(源自原始录制而非后处理),附辅助元数据文件列出受影响片段 |
设备描述里"光纤传输,在复杂手术环境保持抗干扰与稳定性"的表述,指向的是术中视频信号的稳定性——这对需要连续高清记录的模型训练很关键。采集协议还强调固定安装"最小化移动带来的视觉干扰或遮挡,确保每台手术完整不中断",这是片段化切分能覆盖到"手术全程各阶段动作"的前提。
论文没有回避质量问题:它明确承认光照条件、相机设置、录制压缩会带来画质波动,也承认垂直条纹伪影的存在;但它把这种"不完美"定性为对模型鲁棒性的正向训练信号——“在带瑕疵、可变的数据上训练,能让模型在真实世界的多变条件下表现更好”。这个态度的对错留给使用者判断,但至少数据集没有隐藏瑕疵,还给了受影响片段清单。
2.3 七个动作类别的体系与临床含义
SLAM 选的七类动作,全部是基础动作(foundational actions),即跨术式通用的原子操作。论文为每一类给出了临床理由:
| 动作(英文) | 动作(中文) | 临床含义 |
|---|---|---|
| Abdominal Entry | 腹腔进入 | 手术第一步,器械进入腹腔;通用步骤,技术好坏直接关系到周围脏器损伤风险 |
| Suction | 吸引 | 清除积血/积液,保持术野清晰,为后续步骤创造最佳条件 |
| Use Clip | 上夹/夹闭 | 用夹钳固定组织或血管,通常用于止血或隔离血管结构 |
| Hook Cut | 电钩切割 | 用电钩精准切割分离组织,钩形结构降低对周围结构的损伤 |
| Suturing | 缝合 | 进针/出针完成组织缝合,要求极高的腹腔镜技术 |
| Panoramic View | 全景视野 | 提供整体视野,帮助术者导航与定向、定位初始目标 |
| Local Panoramic View | 局部全景视野 | 聚焦特定细节(如血管结构),用于细致检查目标组织 |
三个体系性观察:
- "进入"与"视野"类的特殊性:Abdominal Entry 在每次手术中基本只发生一次,而 Panoramic/Local Panoramic View 是辅助导航动作而非器械-组织交互——这直接解释了后文类别不均衡与 Panoramic View 识别困难(§2.4、§4.4)。
- 首个 trocar 的盲区:论文特别说明,由于第一个 trocar 在镜头置入之前放置,其过程无法被视频捕获;因此 Abdominal Entry 类只覆盖后续 trocar 在镜头已工作状态下的可视化置入。这是数据集边界的诚实交代。
- 补全思路:团队明确表示未来计划持续扩样、提升覆盖,或"考虑扩展到动作三元组(Action Triplets)"——即向 CholecT50 那类"器械-动词-目标"方向演进。
2.4 类别分布:一个显著不均衡的样本
Table 3 给出逐患者、逐动作的片段计数,全表合计如下:
| 动作类别 | 片段数 | 占比 | 备注 |
|---|---|---|---|
| Suction | 1,033 | 25.2% | 最多 |
| Use Clipper | 968 | 23.6% | 次多 |
| Hook Cut | 798 | 19.5% | — |
| Suturing | 471 | 11.5% | — |
| Local Panoramic View | 396 | 9.7% | — |
| Abdominal Entry | 251 | 6.1% | 每次手术仅一次 |
| Panoramic View | 180 | 4.4% | 最少 |
| 合计 | 4,097 | 100% | — |
这个分布在数据集设计与模型评测上各有含义:
- 头部两类(Suction + Use Clip)合计占近半(48.8%),是被反复执行的高频动作,样本充足。
- 尾部两类(Panoramic View 180 + Abdominal Entry 251)合计仅一成,论文自己点明原因:Abdominal Entry 每台手术只发生一次导致样本天然受限,Panoramic View 本身就不常被需要。
- 长尾不是采集失误,而是动作固有频次的映射:正因为如此,评测时必须看逐类精度而非只看总精度——总精度会被头部大类"拉高",掩盖尾类的低表现。这正是 §4.4 要展开的关键点(Panoramic View 的低精度)。
- Table 3 还暴露了极强的患者间方差:单例片段数从 9(index 15)到 943(index 19)不等,index 19 一例就贡献了近四分之一的标签(直肠癌根治,含 Suction 407 / Use Clipper 323 等),说明数据集的类别平衡在很大程度上依赖少数几台"高产"手术。
2.5 逐患者片段计数(Table 3 结构说明)
论文 Table 3 是全条目最细的原始数据来源,逐患者给出 7 类动作各自的片段数。虽然单例数字众多,其结构与极端值值得单列说明:
| 观察项 | 数值 / 事实 | 含义 |
|---|---|---|
| 患者条目数 | 34 行(index 1–34) | 与 34 例患者一一对应 |
| 单例片段数最小值 | 9(index 15) | 极少片段的患者 |
| 单例片段数最大值 | 943(index 19,直肠癌根治) | 单例即贡献 4,097 的约 23% |
| 跨科样本 | index 34(VATS for Lung Surgery)合计 175 片段 | 供跨科迁移测试 |
| 联合手术条目 | index 10、index 26(胆囊切除+阑尾切除) | 解释 Table 2 计数差异 |
| 末行合计 | 251 / 968 / 798 / 471 / 180 / 396 / 1033 = 4,097 | 与 Table 1 的 4,097 一致 |
如何读这张极不均衡的表:其一是**"高产患者"效应**——index 19 一台手术就产出近四分之一片段,意味着若做患者级交叉验证(leave-one-patient-out),把 index 19 划入测试集会极大改变评测分布;其二是**"零片段"现象**——并非所有术式都执行全部 7 类动作(Table 3 中大量单元格为 0),例如 VATS 行不含 Use Clipper、Hook Cut、Suturing 之外的多数类别(0/21/0/0/16/44/94),说明"7 类 × 9 术式"是一个稀疏矩阵,而非每格都有样本。
论文对这种稀疏性有正面解释:它指出所选动作是"各类常见腹腔镜术式中最常执行的动作",并援引 LapGyn6-Actions 的先例说明"并非每个术式都包含全部标注动作"——因此稀疏性被视为真实场景的如实反映,而非设计缺陷。
2.6 数据结构与文件组织
论文 Data Records 节给出了明确的目录结构:
LaparoMotion/
├── clip/
│ ├── <patient_hash_id_01>/
│ │ ├── <clip_0001>.mp4 # 30 帧
│ │ ├── ...
│ │ └── ... # 每患者 15-38 个
│ ├── <patient_hash_id_02>/
│ └── ...
├── train.csv
├── val.csv
└── test.csv
- 三个 CSV 各含三列:patient(患者 ID)、file_path(视频文件路径)、label(动作类别)。论文原文此处把 patient 误拼为 “patinet”(照录留痕)。
- 患者目录用哈希方法生成匿名 ID,保护隐私;论文明确数据集"不含姓名、出生日期等可识别信息"。
- 片段统一 30 帧,用 “patching approach” 切分以保证输入尺寸一致;短片段用循环策略补齐(从头循环帧填满 30 帧)。
- 另附
looped_clips.csv(见 GitHub 说明)记录采用循环补齐的片段:列含loop_path、phase(数据集划分)、part_id、loop_start_frame(循环起始帧),循环区间为[loop_start_frame, 30];使用者可自行决定是否采用这些补循环片段。 - 论文还提供辅助元数据文件列出受垂直条纹伪影影响的片段(随 Figshare 仓库提供)。
- 划分:train / val / test = 70% / 15% / 15%,论文称"确保评估的均衡分布"(但未披露逐类逐划分的精确片段数,见 §9 待核)。
这套组织的工程价值在于"开箱即训":CSV 直接给出 (路径, 标签) 对,clip/ 下是标准 mp4,不需要用户自己解析标注格式——这也是它 AI-Ready 程度较高的具体体现(§6)。
2.7 时长与体量的换算估计
论文以"片段数"而非"小时数"报告规模,横向对比时需自行换算。按已知口径做粗算(估计值,非论文原值):
| 换算项 | 计算 | 结果(约) |
|---|---|---|
| 单片段时长 | 30 帧 ÷ 25 fps | 1.2 秒 |
| 全部片段原始时长 | 4,097 × 1.2 秒 | 约 1.37 小时 |
| 单台手术可用片段时长 | 平均 4,097 ÷ 34 ≈ 120.5 片段 × 1.2 秒 | 约 2.4 分钟 |
| 循环补齐帧占比 | 未知精确值(见 §9 待核) | 未披露 |
⚠ 这张表是"量纲换算提醒"而非数据集事实:SLAM 报告的 4,097 个 30 帧片段,合计原始时长仅约 1.4 小时——这是因为片段是从完整录像中裁剪出的动作片段,而非连续录像的全部。论文没有披露 34 台手术的总录像时长,也没有披露每台手术被裁掉了多少。因此切勿把 4,097 片段理解成"4,097 段连续视频"或"数千小时手术数据";它与其他数据集的"小时数"不在同一量纲(坑 5)。
进一步地,这也解释了为什么 Table 1 里 SLAM 标"4,097 videos"而 ESAD 标"16 hours"——两者的计数单位根本不同:SLAM 计的是裁剪片段数,ESAD 计的是连续录像时长。真要比较"数据体量",得回到"总时长 × 分辨率 × 帧率"的统一口径,而 SLAM 未披露总录像时长,故无法严格横向比较。这是本条目的一个显式空白,应在引用时声明。
§3 标注体系:三级医师与一个未做的检验
3.1 三级人员结构
SLAM 的标注采用"两名初标 + 一名复核"的紧凑结构,人员全部来自临床一线:
| 层级 | 角色 | 职责 |
|---|---|---|
| 初标层 | 2 名副主任医师(专攻腹腔镜) | 各自独立标注数据集的一半 |
| 复核层 | 1 名主任医师(外科经验丰富) | 对随机抽取的 10% 子集做二次复核,歧义处修正 |
| 协调层 | 标注(R.Z./X.J.)、采集与预处理(Z.D./D.W.) | 按 Author contributions 分工 |
与 PANDA-PLUS 那种"学生初标 + 专家终审"的分层劳动模式不同,SLAM 走的是同级专家分工路线:两名副主任医师平级、各标一半,再由更高年资的主任医师抽查。这种设计的优点是不引入非专家的系统性偏差;代价是没有进行交叉标注——两名初标者各标各的一半,从未标注同一批片段。
3.2 三级结构的人员映射
把论文 Author contributions 与标注角色对应起来,可以看到人员分工的清晰边界(注:论文未逐一声明哪两位是"副主任医师"、哪一位是"主任医师",以下映射依据原文分工描述,属合理推断而非论文原话):
| 论文署名 | 论文分工原文 | 对应角色(推断) |
|---|---|---|
| Zi Ye(Z.Y.) | 构思实验、起草文稿 | 主导研究者 |
| Ru Zhou(R.Z.) | 执行数据标注 | 初标者之一 |
| Xiaoli Jin(X.J.) | 执行数据标注 | 初标者之一 |
| Zili Deng(Z.D.) | 数据采集与预处理;验证实验 | 采集/工程 |
| Dan Wang(D.W.) | 数据采集与预处理 | 采集/工程 |
| Ying Zhu(Y.Z.) | 验证实验 | 实验验证 |
| Tianxiang Chen(T.C.) | 验证实验 | 实验验证 |
| Lijun Zhang(L.Z.) | 组织与督导 | 督导 |
| Hanwei Zhang(H.Z.) | 组织与督导、通讯作者 | 督导/通讯 |
| Mingliang Wang(M.W.) | 组织与督导 | 督导 |
这张表最有信息量的一点:论文只说"2 名副主任医师执行标注",但 Author contributions 里执行标注的恰是 R.Z. 与 X.J. 两人。若进一步看团队同期发表的另一篇综述(Frontiers in Surgery 2025,PMID 40292408),R.Z. 与 Z.Y. 的署名单位都是"瑞金医院卢湾分院普外科"——即这两位标注者本身就是做手术的临床医师,而非外部众包标注员。这从侧面支撑了"标注由高年资临床能手完成"的说法。
3.3 复核流程与修正量
复核是"抽查制"而非"全量复审":
- 主任医师从全数据集中随机抽取 10% 子集;
- 对该子集逐一审阅,发现歧义即修改;
- 结果:该 10% 子集内约 1% 的标注被修正。
把这个数字读清楚很重要:约 1% 是"10% 抽查子集内的修正率",不是全数据集的修正率,也不是"一致性 99%"。若按抽查代表全体的朴素外推,全数据集被修正的标注约在 0.1% 量级——但论文没有给出这个外推,条目也不替它外推(坑 2 存照)。
3.4 未做的检验:标注者间一致性
论文用一整段承认了一个关键缺口:
“A limitation of inter-rater agreement analysis is acknowledged.”(标注者间一致性分析的局限已被承认。)
团队给出的原因是:随着数据集扩大,将增加更多标注者与二次复核流程来交叉核对标注、系统性地减少不一致。也就是说——本版本(v3)没有 Cohen’s κ / Fleiss’ κ 之类的正式一致性指标。
这个缺口的意义需要分两面看:
- 对使用者:没有一致性数字,就无法量化"同一片段不同专家是否会给相同标签";对标注噪声敏感的研究(如评测模型鲁棒性)需要把这一不确定性纳入考虑。
- 对数据集本身:由于两名初标者各标一半、无重叠,即便事后想算一致性也无从算起(没有重叠样本)——这不是"算了没报",而是设计上就没有留出重叠。这一点比"未披露"更值得注意。
3.5 标注产物的结构化管线
论文的"Dataset workflow"(Fig 3)把标注到成品的流程描述为四阶段:
- Data Preparation(数据准备):医学专家与团队协作,专家定义动作类别,技术团队负责采集并协助设计标注协议。
- Data Annotation and Structuring(标注与结构化):先产生初始文本标注,再转换为结构化格式,并通过标准化命名、路径修正、隐私保护措施精修。
- Dataset Generation(数据集生成):把标注数据切分为统一长度的时间块(30 帧),划分 70/15/15,用循环策略处理长度不足的片段。
- Model Validation and Application(模型验证与应用):用处理后的数据训练并验证机器学习模型。
这套流程里有两点值得留意:其一,“文本标注→结构化"的中转环节是质控的关键点(命名规范与路径修正在此完成);其二,隐私保护在结构化阶段才实施——意味着原始视频里的隐私信息处理是采集后的动作,论文声称"删除或遮盖所有 PII”。
3.6 四阶段管线的输入输出契约
把四阶段抽象成"输入 → 处理 → 输出"的契约视图,更能看清每步交付物(下表依据论文 workflow 描述归纳):
| 阶段 | 输入 | 核心处理 | 输出交付物 |
|---|---|---|---|
| 1 数据准备 | 34 台原始手术录像 | 专家定义 7 类动作、设计标注协议 | 未切分录像 + 动作类别定义 |
| 2 标注与结构化 | 录像 | 文本标注 → 结构化;命名规范、路径修正、隐私保护 | 结构化标注记录(含匿名 ID) |
| 3 数据集生成 | 结构化标注 | 切 30 帧块、划分 70/15/15、循环补齐 | clip/ + train/val/test.csv + looped_clips.csv |
| 4 模型验证 | 数据集成品 | 训练/测试 ViViT | 精度报告(Table 4/5 与混淆矩阵) |
值得注意的契约细节:第 2 阶段把"隐私保护"放在结构化环节而非采集环节——即原始录像先采集、后去标识;第 3 阶段才发生"切片",这意味着标签是在切片之前(按时间区间)确定的,切片只是把已标注的时间段切成 30 帧块。这解释了为什么 Abdominal Entry 这类"只发生一次"的动作能被准确切出少量片段——标注员是先看完整录像、定好时间区间,再机械切片的。
3.7 与库内标注模式的横向对照
把 SLAM 的标注模式放进库内手术数据集的坐标系:
| 数据集 | 标注主体 | 质检机制 | 一致性检验 | 标注粒度 |
|---|---|---|---|---|
| SLAM(本条目) | 2 名副主任医师(各半) | 主任医师抽查 10% | 未做 | 片段级 7 分类 |
| Cholec80(78) | 专家标注 | — | 报告过一致性 | 帧级相位 + 工具 |
| CholecT50(223) | 专家标注 | 多轮 | 报告过 | 三元组(器械-动词-目标) |
| HeiChole(756) | 多中心专家 | 挑战赛仲裁 | 挑战赛对比 | 相位+动作+器械+技能 |
| AutoLaparo(313) | 专家标注 | — | — | 阶段+动作+分割 |
SLAM 的位置是"标注者精、抽查轻、无一致性数字"。它用专家资质保证了单点标注质量,但没有用统计手段量化标注的不确定性——这在"基础动作分类"这种主观性相对低的任务上或许可以接受,但不应被误读为"质量经过严格验证"。
3.8 为什么"基础动作"的主观性较低
上节提到"基础动作分类的主观性相对低",这个判断需要一点论证——它直接关系到"未做一致性分析是否可接受":
| 判断维度 | 基础动作(SLAM) | 相位(Cholec80) | 技能评分(HeiChole) |
|---|---|---|---|
| 判据 | 画面里器械在做什么(可观察) | 手术进行到哪一步(需流程知识) | 操作好不好(主观评价) |
| 边界清晰度 | 较高(夹 vs 切 vs 缝差异明显) | 中(相邻相位边界常重叠) | 低(评分者差异大) |
| 对一致性检验的需求 | 中 | 高 | 极高 |
| SLAM 是否适用 | ✅ 主任务 | ❌ 不含 | ❌ 不含 |
结论:基础动作识别的主任务客观上比相位/技能任务更适合"专家标注 + 抽查"的轻质检——因为它的标签主要取决于可见的器械动作,不依赖术者的隐性流程判断。但这不等于标注毫无歧义:Panoramic View 与 Local Panoramic View 的边界(§4.4)就是典型的主观模糊区,恰恰也是 ViViT 表现最差的类别。"主观性低"是就整体而言,"视角类"仍是例外。
§4 模型验证与结果:六组配置的逐类解剖
4.1 为什么选 ViViT
SLAM 的验证模型是 ViViT(Video Vision Transformer),出自 2021 年 ICCV 论文。选它的理由论文讲得很直接:ViViT 用自注意力机制建模视频中的长程依赖,能有效学习复杂的时空模式;其层次化 Transformer 架构特别适合捕捉细粒度的时序视觉变化,是动作识别与事件检测的理想选择——相较传统卷积网络,ViViT 不受局部感受野限制。
4.2 训练配置
| 配置项 | 取值 |
|---|---|
| 模型 | ViViT(Video Vision Transformer) |
| 训练轮数 | 80 epochs |
| 输入帧数 | 8 帧(部分实验 16 帧) |
| 输入分辨率 | 224 / 448 / 768 px(片段 resize) |
| 批大小 | 4 |
| 选择机制 | 以验证集指标最高的权重用于独立测试集 |
| 学习率(GitHub 默认) | 7e-5 |
论文措辞为"在代表这些动作的数据子集上训练 80 epochs",并以验证集最优权重做测试。GitHub 仓 SLAM-Vivit_Cls 的 README 给出默认配置:lr=7e-5、time_size=16、分辨率 768×768——与论文最高分的配置一致。
4.3 Table 4 全表:六组配置 × 七个类别
这是本条目最核心的硬数字表,原样转录:
| 帧数 | 分辨率 | UseClipper | HookCut | PanoView | Suction | AbdominalEntry | Suturing | LocPanoView | 总精度 |
|---|---|---|---|---|---|---|---|---|---|
| 8 | 224 | 89.04% | 89.26% | 32.14% | 76.28% | 82.05% | 84.72% | 71.67% | 80.77% |
| 8 | 448 | 91.10% | 95.04% | 42.86% | 80.13% | 76.92% | 84.72% | 60.00% | 82.37% |
| 8 | 768 | 92.47% | 95.04% | 39.29% | 83.97% | 84.62% | 91.67% | 58.33% | 84.62% |
| 16 | 224 | 91.10% | 96.69% | 42.86% | 72.44% | 87.18% | 87.50% | 70.00% | 82.69% |
| 16 | 448 | 90.41% | 95.04% | 60.71% | 78.85% | 82.05% | 83.33% | 75.00% | 84.29% |
| 16 | 768 | 92.47% | 94.21% | 71.43% | 79.49% | 66.67% | 88.89% | 85.00% | 85.90% |
读这张表有五个要点:
- 最高总精度 85.90% 出现在 16 帧 / 768px 配置,对应 test loss 0.4554。
- 帧数越长,动作类越受益:论文指出 16 帧显著提升 HookCut(96.69%)与 Suturing(87.50%)——延长时序让模型捕捉更完整的时间特征。
- 但短动作会被"过度延长"伤害:UseClipper 这类动作,过长的时序窗口会引入冗余与噪声,反而降低精度(16 帧配置下其为 92.47%,与 8 帧持平或略降)。这就解释了为何最高分配置里 AbdominalEntry 反而掉到 66.67%。
- 分辨率提升对纹理型动作有效:UseClipper 在 768px 达 92.47%,比 224px 高约 3%——高分辨率让细粒度特征更易捕捉。
- 对频繁场景切换的动作,高分收益有限:LocPanoView 与 Suturing 这类动作在高分辨率下提升幅度小,论文归因于"快速时序转变使高分辨率难带来实质提升"。
4.4 逐类精度趋势的量化解读
把 Table 4 的每一类横向拉出来看其随配置的波动幅度,能更清楚哪些类"稳"、哪些类"飘":
| 动作类别 | 最小值 | 最大值 | 极差 | 波动特征 |
|---|---|---|---|---|
| Use Clipper | 89.04% | 92.47% | 3.43% | 最稳(六组配置都在 89%–92%) |
| Hook Cut | 89.26% | 96.69% | 7.43% | 稳(多数 ≥95%) |
| Suction | 72.44% | 83.97% | 11.53% | 中(16 帧反而更低) |
| Suturing | 83.33% | 91.67% | 8.34% | 中 |
| Abdominal Entry | 66.67% | 87.18% | 20.51% | 高波动(配置敏感) |
| LocPanoView | 58.33% | 85.00% | 26.67% | 高波动 |
| Panoramic View | 32.14% | 71.43% | 39.29% | 最飘(极差最大) |
三条规律由此浮现:
- 器械-组织操作类稳,视角类飘:Use Clipper / Hook Cut 极差 <8%,Panoramic View 极差近 40%——差异根源在于视觉线索的稳定性。
- 配置对尾类的影响被放大:尾类样本少,配置一变(帧数/分辨率)样本的"有效信息密度"就剧烈变化,导致精度大幅摆动。这提示尾类结果对超参敏感,引用时必须写明配置。
- "更长的时序"不是万灵药:Suction 在 16 帧配置下反而从 83.97%(8/768)降到 79.49%(16/768)——与论文关于 UseClipper 的"过度延长引入噪声"论述同源。
4.5 难在哪:Panoramic View 的系统性低分
全表最刺眼的是 Panoramic View:32.14%(8/224)、42.86%(8/448)、39.29%(8/768)、42.86%(16/224)、60.71%(16/448)、71.43%(16/768)——是所有类别里最低的。
论文对此的解释是:类别间的精度差异"凸显了 ViViT 处理频繁视角变化动作的困难";这类动作即便在长时序与高分辨率下,精度也只在 32.14%–71.43% 之间。“未来研究可聚焦于通过额外预处理技术或增强模型捕捉时序上下文的能力来改善此类动作识别”。
为什么 Panoramic View 这么难?把它的定义放回来理解——它是"提供整体视野、帮助导航定向"的辅助动作,特征不是某个器械的连续操作,而是相机的大范围移动。它和 Local Panoramic View(局部视野)在视觉上高度相似,边界模糊。混淆矩阵(§4.6)正是印证了这一点。
4.6 混淆矩阵:PanoView ↔ LocPanoView 的纠缠
论文 Fig 4 给出 16 帧 / 768px 配置下的混淆矩阵,点出了两类典型误分:
- PanoView:20 个正确分类,但有 3 个被误分为 LocPanoView(占总数的比例不小,因为 PanoView 测试样本本就稀少)。
- Suction 与 Suturing 之间存在混淆,论文推测是因视觉或上下文歧义所致。
论文的结论诚挚:这些结果"强调了准确识别特定腹腔镜动作的内在挑战,尤其是那些需要细微上下文理解才能正确区分的动作";并指出扩大数据集样本量或增强模型的上下文线索捕捉能力可降低误分率。这段话对使用者是明确的行动指引:想提升这类动作的表现,光调模型架构不够,得从数据侧补样本或改标注边界。
4.7 跨科迁移实验:腹腔镜知识能否用于胸腔镜
这是本数据集较有特色的一组实验(Table 5)。团队额外放了 1 例支气管/肺相关胸腔镜手术(VATS,Table 3 的 index 34)作为"跨科测试集",训练两个模型对比:
| 模型 | Mixed 测试精度 | 腹腔镜测试精度 | 胸腔镜测试精度 |
|---|---|---|---|
| 仅腹腔镜模型(Laparoscopic-Only) | 79.97% | 81.59% | 43.75% |
| 混合模型(Mixed,腹腔镜+胸腔镜) | 85.90% | 86.66% | 65.62% |
两点结论:
- 仅腹腔镜训练的模型在胸腔镜测试集上得 43.75%——论文认为这"验证了腹腔镜手术动作识别的可迁移性",即学到的动作概念(上夹、缝合等)部分可跨科复用。
- 加入胸腔镜数据后,模型在所有测试集上都提升(mixed 85.90%、腹腔镜 86.66%、胸腔镜 65.62%)——论文据此主张"胸腔镜数据作为增强数据提升了模型性能,多样性起到了有益作用"。
需要提醒的是,跨科测试集仅 1 例手术(index 34,175 个片段),样本量极小,43.75% / 65.62% 这类数字的置信区间会很宽,宜作趋势证据而非精确基准。论文自己也用"validating the transferability"这类定性措辞,而非给出统计显著性。
4.8 结果解读的四条守则
| 守则 | 说明 |
|---|---|
| 看逐类,别看总精度 | 头部两类(Suction+UseClipper)占近半,总精度会被它们"抬"高,掩盖 Panoramic View 的低表现 |
| 配置必须写明 | 85.90% 只在 16 帧 / 768px 成立;换配置会掉到 80.77%——引用必须带配置 |
| 跨科数字慎用 | 胸腔镜结果基于 1 例手术,置信区间宽,宜作趋势证据 |
| 无权重无复现 | GitHub 只给训练/推理脚本,best_model.pkl 需自训,85.90% 无法独立复现(§9 待核) |
4.9 ViViT 为何适配手术视频:一个架构视角
要理解"为什么论文选 ViViT 且为什么它有用",需要一点架构层面的直观(下表为对 ViViT 通用原理的说明,非 SLAM 论文原文):
| 特性 | 卷积网络(如 3D-CNN) | ViViT(Transformer) | 对手术视频的意义 |
|---|---|---|---|
| 感受野 | 局部,逐层扩大 | 全局自注意力,一步建模远距离依赖 | 一帧里的"钳子"与另一帧里的"组织"能被直接关联 |
| 时序建模 | 3D 卷积核固定窗口 | 时空注意力,窗口可长可短 | 适应"缝合"这类长动作与"上夹"这类短动作的差异 |
| 参数效率 | 较省 | 较耗(需更多数据/正则) | 4,097 片段规模下仍能收敛,说明数据"够用" |
| 可解释性 | 中 | 注意力图可视化 | 可观察模型"看哪里"做判断(论文未展开) |
为什么 SLAM 的结论与这个架构特性吻合:论文强调 16 帧 > 8 帧对 HookCut/Suturing 的提升,正是"更长时序 + 全局注意力"的组合优势——这些动作需要跨多个时间点的上下文;而 UseClipper 这类"短促动作"被长窗口引入噪声,则说明全局注意力在冗余时序上会被无关帧干扰。这两条正好是 Transformer 视频模型的典型"甜点区与陷阱"。
一个必须声明的边界:论文只做了 ViViT 一种模型的验证,没有横向对比 CNN、I3D、SlowFast 等其他架构。因此"85.90%“是"ViViT 在本数据集上的结果”,而非"本数据集上的 SOTA"——把它当作架构对比结论是错误的(坑 6)。
§5 在手术动作识别基准中的位置
5.1 论文 Table 1 的景观对照:SLAM 的差异化定位
论文用 Table 1 把 SLAM 与七个公开数据集并置,这是理解其"差在哪、强在哪"的最佳框架。原表转录:
| 数据集 | 年份 | 规模 | 手术类型 | 动作类别 | 文献 |
|---|---|---|---|---|---|
| LapGyn4 | 2018 | 30,000+ 图像 | 腹腔镜妇科手术 | 8 | — |
| ESAD | 2021 | 16 小时 | 前列腺癌根治术(RARP) | 21 | — |
| PSI-AVA | 2022 | 20.45 小时 | 机器人辅助 RARP | 16 | — |
| HeiChole | 2022 | 22 小时 | 腹腔镜胆囊切除 | 4 | — |
| CholecT50 | 2023 | 50 视频 | 腹腔镜胆囊切除 | 10 | — |
| LapGyn6-Actions | 2023 | 18 视频 | 妇科腹腔镜 | 6 | — |
| GraSP | 2024 | 32 小时 | 机器人辅助 RARP | 14 | — |
| SLAM(本条目) | 2024 | 4,097 视频 | 多种腹腔镜手术 | 7 | — |
论文对既有数据集的批评集中在四点:规模小、同质性高(多数只聚焦一种术式)、公开受限(部分测试集不公开)、标注质量不一。SLAM 的应对策略是从这四个痛点反向设计:
- 规模:4,097 个片段,在"片段级"口径上远超 LapGyn6-Actions(18 视频)等 —— 但需注意,SLAM 的"4,097"是片段数,与 LapGyn4 的图像数、ESAD 的小时数不是同一量纲,横向比较要换算成"总时长"才公平。
- 多样性:覆盖 9 类术式(含跨科胸腔镜),而 HeiChole/CholecT50 仅限胆囊切除。
- 公开性:测试集公开——这是对 CholecT50"测试集不公开"的直接回应,也是它作为基准的核心价值。
- 标注:由高年资医师标注而非众包/学生,用资质回应"标注质量"批评。
5.2 景观表的细读:对手们到底有多大
上表若只记数字不记语境,容易误判 SLAM 的"性价比"。逐条补上论文与外部来源的细读:
| 数据集 | 细读(来自论文 Table 1 及引用文献) | 与 SLAM 的对照 |
|---|---|---|
| LapGyn4 | 111 台妇科腹腔镜、30,000+ 图像、8 类动作 | 图像单位,非视频;量纲不同 |
| ESAD | 16 小时 RARP、46,325 个动作实例、21 类 | 单术式、时长口径 |
| PSI-AVA | 11 相位 / 20 步骤 / 7 器械 / 16 原子动作 | 任务更细,但单术式 |
| HeiChole | 33 段胆囊切除、22 小时、7 相位 / 4 动作 / 7 器械 / 5 技能维 | 多中心、四任务,但单术式 |
| CholecT50 | 50 段、约 100,900 帧、100 类三元组;测试集不公开 | 关系级,但开放度低 |
| LapGyn6-Actions | 18 段妇科腹腔镜、6 类动作 | 规模小 |
| GraSP | 32 小时 RARP、14 类原子动作、9,031+ 实例 | 机器人术式、时长口径 |
| SLAM | 34 台 / 4,097 片段 / 9 术式 / 7 动作;全公开 | 跨术式 + 全开放是差异点 |
一个容易被忽略的观察:在"动作类别数"这一列上,SLAM 的 7 类其实偏少(ESAD 21 类、PSI-AVA 16 类、GraSP 14 类都更多)。SLAM 的真实优势不在"类别多",而在"跨术式覆盖 + 全公开 + 标准化片段格式"三点。把 7 类理解成"精简、通用、易上手"比理解成"类别完备"更准确。
5.3 与其他手术数据集的维度对照
把对比维度从"规模"扩展到"任务类型",SLAM 的位置更清楚:
| 数据集 | 主任务 | 标注粒度 | 术语体系 | 公开程度 |
|---|---|---|---|---|
| SLAM | 基础动作分类 | 片段级单标签 | 7 类动作 | 全公开 CC BY 4.0 |
| Cholec80(78) | 相位识别 + 工具检测 | 帧级 | 7 相位 + 7 工具 | 公开 |
| CholecT50(223) | 动作三元组检测 | 帧级 | 100 类三元组 | 训练公开/测试私有 |
| AutoLaparo(313) | 阶段识别+动作预测+分割 | 帧级 | 3 任务 | 公开 |
| Endoscapes(353) | 场景分割 + CVS 评估 | 帧级 | 解剖结构 + 安全标准 | 公开 |
| HeiChole(756) | 四任务基准 | 帧级 | 相位+动作+器械+技能 | 训练公开/测试私有 |
| PhaKIR(755) | 相位+关键点+器械 | 帧级 | 8 相位+19 器械+关键点 | 受控申请 |
一句概括 SLAM 的生态位:它是这组数据集中"任务最基础(分类)、术语最简单(7 类)、获取最开放(CC BY 4.0 无门槛)"的一个。它不替代任何上层数据集,而是提供最低门槛的入门级动作识别基准。
5.4 与 CholecT50 的关系:地基 vs 上层
SLAM 和 CholecT50 常被一并提及,因为都把"胆囊切除"作为主体术式。但二者任务层次不同:
- CholecT50:约 10.1 万帧、100 类动作三元组(器械-动词-目标,如"抓钳-牵拉-胆囊"),回答"什么器械对什么组织做了什么"。
- SLAM:4,097 个片段、7 类基础动作(如"上夹"“缝合”),回答"画面里正在做哪类操作"。
论文自己把 SLAM 定位为"分解术式为详细步骤的关键初始步骤(crucial initial step)“——即先认得原子动作,才有条件往上组合成三元组或相位。团队也明确规划未来"考虑扩展到动作三元组”。因此二者的正确关系是:SLAM 提供动作级地基,CholecT50 提供关系级上层,互补而非竞争。
5.5 基准价值的三点评估
| 评估维度 | 评价 |
|---|---|
| 作为"入门基准" | 强:7 类、4,097 片段、公开测试集,适合快速验证新架构 |
| 作为"高难度基准" | 中:Panoramic View 类(最低 32.14%)保留了足够的挑战性 |
| 作为"跨科迁移基准" | 弱-中:仅 1 例胸腔镜,样本太小,只能做趋势验证 |
| 作为"绝对性能榜" | 受限于单一训练配置:论文只报 ViViT 一种模型,无多模型对比,SOTA 定位偏弱 |
第三、四点尤其要诚实:SLAM 论文的验证是"证明数据集可用",而非"建立多模型排行榜"。它没有像 HeiChole 那样组织挑战赛、也没有像 CholecT50 那样给出多队伍对比。所以把它当作"已确立的 SOTA 榜单"会失望;把它当作"现成的、开放的、可上手的动作分类数据集"则恰如其分。
5.6 引用外部数据的开放性对照
"公开程度"是 SLAM 最突出的标签,值得用一张对照表把它量化:
| 数据集 | 是否需注册 | 是否需申请 | 测试集公开 | 许可类型 | 获取门槛 |
|---|---|---|---|---|---|
| SLAM | 否 | 否 | 是 | CC BY 4.0 | 最低 |
| Cholec80(78) | 是 | 视版本 | 是 | 自定义研究许可 | 中 |
| CholecT50(223) | 是 | 是 | 否 | 自定义 | 高 |
| HeiChole(756) | 是 | 是 | 否 | 挑战赛协议 | 高 |
| PhaKIR(755) | 是 | 是 | — | 受控申请 | 高 |
| EndoSLAM(408) | 否 | 否 | 是 | 公开 | 低(但任务不同) |
在"开放度"这一维度上,SLAM 在本库手术视频条目中几乎没有对手:它把"免注册 + 全公开测试集 + 宽松许可"三件事同时做到了。这也是它 AI-Ready 综合评分(§6.4)偏高的主要原因。
§6 获取与许可:本库手术视频里最开放的一档
6.1 获取方式与版本链
SLAM 的获取门槛在本库手术视频条目中属于最低档:
| 项目 | 内容 |
|---|---|
| 平台 | figshare(Figshare 官方托管) |
| DOI | 10.6084/m9.figshare.28104782.v3(现行 v3) |
| 获取门槛 | 公开,无需注册(论文原文:publicly available on Figshare without registration) |
| 许可 | CC BY 4.0(figshare 数据集页标注 “Licence CC BY 4.0”) |
| 版本链 | v1 2025-04-10 12:31 → v2 2025-04-10 14:24 → v3 2025-04-14 14:33 |
| 署名 | figshare 作者页仅署 Zi Ye(论文有 10 位作者) |
| 代码 | GitHub yezizi1022/SLAM-Vivit_Cls(train.py / inference.py / cnn_model.py / README.md / looped_clips.csv) |
"无需注册"这四个字在本库里有分量:同域的 PhaKIR(755) 需受控申请、HeiChole(756) 与 CholecT50(223) 的测试集私有,而 SLAM 是"点开就能下"。CC BY 4.0 也是最宽松的开放许可之一(署名即可,允许商用与改编),与论文本身的 CC BY-NC-ND(非商用、禁改编)形成对照。
6.2 CC BY 4.0 给了你什么
CC BY 4.0 的授权范围(对照数据集页声明):
- ✅ 可商用:用于商业产品开发不受 NC 限制(这点比论文许可宽松得多)。
- ✅ 可改编:允许修改、二次加工(对比论文许可 NC-ND 明确禁止改编衍生)。
- ✅ 可再分发:可复制、分发、以任何媒介传播。
- ⚠️ 须署名:必须给出适当署名、提供许可链接、标明是否修改。
- ⚠️ 须引用原论文:学术使用仍应引用 Sci Data 论文与 figshare DOI。
一条容易踩的坑:论文文本本身是 CC BY-NC-ND,不能据此对论文图表做改编再发布;但数据集文件是 CC BY 4.0,可以。混用两个许可会出问题,务必分清"论文许可"与"数据集许可"。
6.3 与论文许可的分野
| 资产 | 许可 | 含义 |
|---|---|---|
| 数据集(figshare 视频/CSV/元数据) | CC BY 4.0 | 最宽松,署名即可,可商用可改编 |
| 论文(Sci Data 正文) | CC BY-NC-ND 4.0 | 非商用、禁改编衍生 |
| 代码(GitHub) | 无显式 license | 默认"保留所有权利",使用需谨慎(建议联系作者) |
代码仓无 license 文件是一个实际的合规缺口:严格讲,没有 license 的仓库使用者无权复制/分发代码。实践上这类学术代码库通常默许研究使用,但商业项目引前应先联系作者获取授权。这是本条目 AI-Ready 光谱上的一个扣分点。
6.4 AI-Ready 双轨评估:DAIMS 全表
DAIMS 是评估数据集 AI 就绪度的五维框架(D 可发现性 / A 可获取性 / I 可互操作 / M 元数据质量 / S 可持续性)。对 SLAM 逐维打分:
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 论文开放获取(PMC12103523)+ figshare 独立数据集页 + GitHub 代码仓,三处可索引;缩写"SLAM"与内窥镜 SLAM 撞名,轻微降低检索精度 |
| A 可获取性 | 9 | figshare 公开、无需注册、CC BY 4.0——本库手术视频条目最高档;扣分因 figshare 站点在部分网络环境下载较慢 |
| I 可互操作 | 7 | 视频为 mp4 + CSV 索引,通用性好;但无 DICOM 转换、无 HuggingFace datasets 集成、无官方 dataloader |
| M 元数据质量 | 7 | 论文表格完备(患者画像/逐患者片段计数/模型结果全表);但未披露逐类逐划分精确片段数、无标注者间一致性指标、Table 2 计数不自洽 |
| S 可持续性 | 7 | 依托 figshare(长期托管平台)+ GitHub;但 figshare 署名仅 1 人、GitHub 无 license、无机构级长期保存承诺 |
| 综合评级 | 7.6 / 10(良好) | 可获取性突出(最开放的一档),互操作与元数据中等,可持续性受个人托管拖累 |
评级解读:SLAM 的 AI-Ready 得分在库内手术视频条目里属于偏高——核心拉动项是 A(可获取性 9 分),因为"公开+免注册+CC BY 4.0"三件套全齐。拖累项是 I(无 HF/DICOM 集成)与 M(一致性指标缺失、Table 2 自洽性问题)。换句话说:它容易拿到、但拿到后需要自己写数据加载与格式转换。
6.5 figshare 平台特性与下载实务
SLAM 选择 figshare 而非 Zenodo/PhysioNet/HuggingFace,有其取舍(下表为对 figshare 平台的通用特性说明):
| 维度 | figshare | 对使用者的影响 |
|---|---|---|
| 注册门槛 | 浏览无需注册 | 点开 DOI 即可看文件列表 |
| version DOI | 支持 v1/v2/v3 版本链 | 引用必须带 .v3 才能锚定版本 |
| 大文件支持 | 支持 GB 级 | 视频数据集可托管 |
| 许可标注 | 页面上直接显示 License | “CC BY 4.0” 可页内确认 |
| 缺点 | 部分网络环境下载较慢;无内置 dataloader | 需自行下载 + 写加载脚本 |
实务提示:
- 引用要带版本号:
10.6084/m9.figshare.28104782.v3而非裸 DOI——后者会指向最新版,版本漂移后引用不可复现。 - 下载前先看文件清单:页面上有 History(版本)与文件列表,确认 v3 是你要的版本。
- 注意国内网络的可得性:figshare 在国内部分网络环境访问较慢,建议换网络或使用镜像/代理(本条目实测抓取时 figshare API 存在 IP 拦截,仅页面可访问——见 §9 待核 1)。
6.6 逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 4,097 片段 | 论文 Table 1 / Table 3 合计行 | 论文全文(Europe PMC XML) |
| 34 段手术 / 34 例患者 | 论文 “Video recording” 节 | 论文全文 |
| 7 类动作 / 9 类术式 | 论文 Methods(Table 2/3) | 论文全文 |
| 1920×1080 / 25fps / HOPKINS 30° | 论文 “Video recording” 节 | 论文全文 |
| 30 帧 / 15-38 片段每例 | 论文 “Data Records” 节 | 论文全文 |
| 70/15/15 划分 | 论文 “Dataset workflow” 节 | 论文全文 |
| 逐类片段数(1033/968/798…) | 论文 Table 3 | 论文全文 |
| 85.90% / 0.4554 | 论文 Table 4 / 正文 | 论文全文 |
| 跨科 43.75% / 65.62% | 论文 Table 5 | 论文全文 |
| 10% 子集约 1% 修正 | 论文 “Dataset Reliability” 节 | 论文全文 |
| 伦理批号 LWEC2024022 | 论文 Methods 首段 | 论文全文 |
| CC BY 4.0 / 无需注册 | figshare 数据集页 + 论文 Data Records | figshare / 论文 |
| 版本链 v1/v2/v3 日期 | figshare 数据集页 | figshare |
| GitHub 文件清单 | GitHub 仓 README | github.com/yezizi1022/SLAM-Vivit_Cls |
6.7 抓取与核验留痕(本次续写)
本条目本次扩稿对以下来源进行了实抓核验(2026-09-30):
| 来源 | URL | 核验结论 |
|---|---|---|
| Europe PMC 全文 XML | https://www.ebi.ac.uk/europepmc/webservices/rest/PMC12103523/fullTextXML |
87,763 字节,含 Table 1–5 与正文,全部硬数字复核对齐 |
| PubMed 摘要页 | https://pubmed.ncbi.nlm.nih.gov/40413211/ |
确认 PMID/PMCID/DOI 与摘要口径 |
| figshare 数据集页 | https://doi.org/10.6084/m9.figshare.28104782.v3 |
确认标题、版本链 v1/v2/v3 日期、License CC BY 4.0、署名 Zi Ye |
| GitHub 代码仓 | https://github.com/yezizi1022/SLAM-Vivit_Cls |
确认文件清单、默认配置 lr=7e-5 / time_size=16 / 768×768、无 LICENSE 文件 |
| OpenAlex 条目 | http://openalex.org/W4410702253 |
确认引用数 Cited by 7、FWCI 11.69、机构名列表 |
| 中文产业报道(梵晨/搜狐) | https://m.sohu.com/a/911516290_122014422 |
确认"双盲标注 + 一致性 99% + 多中心"为报道口径,与论文冲突,存照 |
| 中文产业报道(生物通) | https://ebiotrade.com/newsf/2025-5/20250525070643922.htm |
确认"多中心手术视频采集"报道口径与论文单中心冲突,存照 |
§7 生态与影响
7.1 数据集的出身:一个医工交叉的临床生产
SLAM 的团队构成本身就是它的方法论注脚:临床端(瑞金医院卢湾分院普外科)贡献数据与标注,工程端(中科院软件所、国科大杭高院、中科大网安学院、广州智能软件研究院)贡献采集、结构化与建模。这种"医院出手术+实验室出流水线"的组合,与 PANDA-PLUS(纯学术机构重标注)或 HeiChole(多中心临床挑战赛)都不同——它是以一家医院的临床实践为单点数据源的医工合作样本。
论文的 Author contributions 明确了分工:Z.Y. 构思实验起草文稿;H.Z./M.W./L.Z. 组织督导;Z.D./D.W. 采集预处理;R.Z./X.J. 标注;Y.Z./Z.D./T.C. 验证实验。标注者是临床医师(R.Z./X.J. 对应两名副主任医师的角色),这解释了为什么标注工作能由"高年资能手"完成——数据就是他们自己医院做的手术。
7.2 中文报道与产业关注
数据集发表后获得中文产业媒体的报道(如"中科院软件所与瑞金医院联合成果荣登《Nature》子刊"),报道方之一的产业实体(广西华医人工智能医疗科技有限公司研发中心)宣称参与了数据集构建。需注意:论文的五个署名单位中未列该产业实体,产业报道的参与口径与论文署名存在出入,属"报道口径 vs 论文口径"的差异,条目以论文为准并存照(§9)。
产业关注本身是正面信号:它表明腹腔镜动作识别技术已有明确的落地需求(智能手术机器人、手术自动化、术者技能评估)。SLAM 的团队也在论文展望中承诺"持续扩样、提升多样性、引入更多客观评价指标,为腹腔镜领域大模型发展做贡献"。
7.3 与库内条目的关系图谱
SLAM 在千方病案医数集内的位置可以用"任务层次"来组织:
任务层次 库内代表条目
───────── ──────────────
上层:相位/工作流 ← Cholec80(78)、AutoLaparo(313)、HeiChole(756)、PhaKIR(755)
中层:动作三元组 ← CholecT50(223)
底层:基础动作分类 ← SLAM(本条目)
横向:安全/分割评估 ← Endoscapes(353)
⚠ 命名撞车但不相关:EndoSLAM(408)、SLAM-3D-Endoscopic(82)(内窥镜定位建图)
互链建议(供检索者跳转):
| 相关条目 | rid | 关系性质 | 建议链接语境 |
|---|---|---|---|
| Cholec80 | 78 | 同域上层(相位识别) | "从基础动作到手术相位"的进阶阅读 |
| CholecT50 | 223 | 同域上层(三元组) | "动作分类 vs 动作三元组"的层次对照 |
| AutoLaparo | 313 | 同域平行(多任务) | 腹腔镜子宫切除的多任务数据集对照 |
| Endoscapes | 353 | 同域横向(安全评估) | CVS 安全视野评估的分割路线 |
| HeiChole | 756 | 同域上层(多中心四任务) | 多中心 vs 单中心、挑战赛 vs 单模型 |
| PhaKIR | 755 | 同域上层(三任务联合) | 受控申请制 vs 公开直链的获取对照 |
| Miccai-surgt | 83 | 同域(手术动作相关) | 手术动作相关的挑战/数据集入口 |
⚠ 明确不互链为同族:
| 条目 | rid | 为什么不互链 |
|---|---|---|
| EndoSLAM | 408 | 消化道内镜 SLAM(定位与建图),76,837 帧 + 6 DoF 位姿,与本条目仅"SLAM"三字母相同 |
| SLAM-3D-Endoscopic | 82 | 内窥镜三维重建与定位,同为定位建图类,与动作识别无关 |
这两条必须在本条目的显著位置说明——否则读者搜"SLAM dataset"时极易点错,把"定位建图"当"动作识别"。
7.4 对后续研究的三点影响
- 提供"跨术式基础动作"的现成切分范式:把手术切成 30 帧片段、按基础动作打标签的做法,可以被任何想要构建自己动作分类数据集团队直接复用(含循环补齐策略与 CSV 索引格式)。
- 一段公开的跨科迁移数据点:即便胸腔镜样本只有 1 例,"仅腹腔镜模型→胸腔镜 43.75%、混合模型→65.62%"这对数字,为"手术动作知识能否跨科迁移"提供了一个可引用的初步证据。
- "最开放获取"的示范:在本库同域条目多为申请制或测试集私有的背景下,SLAM 用 CC BY 4.0 + 免注册 + 公开测试集证明"开放"与"高质量标注"可以并存——这可能推动同域数据集在获取门槛上向更开放的方向走。
7.5 引用与影响力现状
截至本次抓取(2026-09-30),OpenAlex 记录该论文的引用数据如下:
| 指标 | 数值 | 来源 |
|---|---|---|
| Cited by(被引数) | 7 | OpenAlex W4410702253 |
| FWCI(领域加权引用影响) | 11.69 | OpenAlex |
| 引用百分位(同年同学科) | 98.8% | OpenAlex |
| 主题分类 | Surgical Simulation and Training / Surgery / Medicine | OpenAlex |
| 开放获取状态 | gold(金色 OA,APC 约 $1,990,由瑞金医院资助) | OpenAlex |
如何解读:FWCI 11.69 意味着该论文的引用影响约为同领域同期平均值的 11.7 倍——放在 2025 年发表的数据描述符里属于相当高的关注度。98.8% 的引用百分位进一步说明它处于"被大量引用"的头部。但要冷静看待三点:其一,被引数 7 是低基数上的比值,一个数据集论文早期被引可能来自同一团队的自引或综述引用;其二,FWCI 对数据描述符类文章的口径与原创研究不完全可比;其三,引用数会随时间增长,此处仅为 2026-09-30 的快照。
§8 方法学启示:四条可迁移的经验
8.1 "基础动作切片"是跨术式泛化的低成本路径
SLAM 最值得学的不是某个技术点,而是一个数据设计决策:不从"某台手术的完整流程"出发标注,而是从"跨术式通用的原子动作"出发切片。这样做的收益是双重的——
- 样本效率:34 台手术就能产出 4,097 个带标签片段,因为每台手术都被"动作维度"重新切片,一个手术贡献多类动作的多个样本。
- 泛化性:模型学的是"上夹"“缝合"这些动作模式,而非"胆囊切除第三步该做什么”,天然更容易迁移到其他术式(论文的跨科实验正是验证这一点)。
代价则是:你无法从这类标注直接得到相位或工作流信息,需要在其上再叠一层(如 Cholec80 的相位标签)。这条路径适合"想要一个通用动作识别底座"的团队,不适合"想要端到端工作流分析"的团队。
8.2 类别不均衡是"动作固有频次"的映射,不是采集缺陷
SLAM 的类别分布(Suction 1,033 → Panoramic View 180)看着很不平衡,但论文讲清了原因:Abdominal Entry 每台手术只发生一次、Panoramic View 本身就不常需要。这不是采集时偷懒,而是真实手术里动作频次的如实投影。对使用者的启示:
- 不要用"重采样到均衡"的方式处理它——那会扭曲真实频次分布,让模型对稀有动作过采样。
- 评测时必须报告逐类指标,尤其是尾类(Panoramic View)。只报总精度会掩盖尾类的真实困难。
- 想改进尾类表现,正确方向是补样本或改模型架构(论文的建议),而非在现有数据上做统计把戏。
8.3 标注抽查的"覆盖率"决定了你能声称什么
SLAM 的标注质控是"主任医师复核随机 10% 子集、该子集约 1% 被修正"。这个设计的信息量有限:
- 它能声称:“经过高年资医师对 10% 样本的抽查复核。”
- 它不能声称:“标注一致性达 99%”(那是误读)、也不能声称"全数据集标注错误率 1%"。
可迁移的经验:描述标注质量时,抽查覆盖率(10%)与抽查内修正率(1%)必须分开写清楚,任何"外推到全体"的说法都要注明是外推。SLAM 论文本身做得规范(它没外推),是报道环节出了问题——这提醒写作者:质量声明的口径要在源头就锁定,否则下游报道必然走样。
8.4 "单中心 + 单模型验证"是清晰的定位,不是隐藏的短板
SLAM 对自身局限相当坦诚:单中心、单模型(ViViT)、无一致性分析、跨科样本仅 1 例。这些不是它隐瞒的,而是它明写的(甚至有专门段落承认一致性局限)。这种坦诚带来一个方法学启示:一份数据集的"贡献"与其"局限"应当同时被声明——读者据此判断适用边界。相较之下,把单中心数据包装成"多中心"、把单模型结果包装成"SOTA"才是真正的风险。
SLAM 的定位由此反而清晰:它不是"最强"的手术数据集,而是"最容易拿到、最基础、最能做入门基准"的那一个。 对多数想快速验证新视频分类架构的团队,这种"定位清晰"比"指标漂亮"更有用。
8.5 一条元经验:数据集论文的"可复现性清单"
从 SLAM 这份数据描述符可以提炼一份"数据集论文可复现性清单",供读者评估其他数据集时套用:
| 检查项 | SLAM 是否满足 | 说明 |
|---|---|---|
| 明确的数据来源与采集协议 | ✅ | 单中心、术式、设备、时间窗都写明 |
| 明确的数据规模与单位 | ✅ | 4,097 片段、34 台、30 帧 |
| 明确的标注主体与质检流程 | ✅ | 三级医师、抽查 10% |
| 明确的标注一致性指标 | ❌ | 未做,且无重叠样本 |
| 明确的划分比例与划分方式 | ✅(比例)/❌(逐类明细) | 70/15/15,但无逐类逐划分数字 |
| 明确的许可与获取方式 | ✅ | CC BY 4.0、免注册 |
| 可下载的训练权重 | ❌ | 仅脚本,best_model.pkl 需自训 |
| 可复现的完整基准 | ⚠ | 单模型、单配置,非排行榜 |
| 已知缺陷的披露 | ✅ | 垂直条纹伪影、Table 2 计数问题 |
用法:拿这份清单去套你要用的任何手术数据集,能满足越多项,越说明它"AI-Ready"。SLAM 在 9 项里满足 6 项、部分满足 1 项、不满足 2 项——这就是它 DAIMS 7.6 分的具体来源。
§9 与库内条目的关系
9.1 家族图谱:SLAM 在手术视频谱系中的坐标
千方病案医数集的手术视频/内窥镜条目可粗分为四簇,SLAM 属于"基础动作分类"簇:
| 簇 | 任务 | 库内条目(rid) |
|---|---|---|
| 相位/工作流识别 | 判断手术处于哪个阶段 | Cholec80(78)、AutoLaparo(313)、HeiChole(756)、PhaKIR(755) |
| 动作三元组 | 器械-动词-目标关系 | CholecT50(223) |
| 基础动作分类 | 画面里做的是哪类操作 | SLAM(本条目) |
| 安全/分割评估 | 解剖分割 + 安全视野判定 | Endoscapes(353) |
| 内窥镜定位建图 | SLAM 定位与三维重建 | ⚠ EndoSLAM(408)、SLAM-3D-Endoscopic(82)(非同族) |
9.2 检索路径建议
- 想要最低门槛的动作识别数据 → 本条目(SLAM),figshare 直下。
- 想从动作进阶到相位 → 转 Cholec80(78) 或 HeiChole(756)。
- 想做器械-组织关系检测 → 转 CholecT50(223)。
- 想评估手术安全视野(CVS) → 转 Endoscapes(353)。
- 想做内窥镜定位/三维重建 → 转 EndoSLAM(408) 或 SLAM-3D-Endoscopic(82)(注意这是完全不同的任务)。
9.3 与 Cholec80 的互补实例
Cholec80(78) 与 SLAM 都包含大量胆囊切除,但任务维度正交:Cholec80 给的是帧级相位 + 工具存在(如"Calot 三角解剖"“胆囊剥离”),SLAM 给的是片段级基础动作(如"电钩切割"“上夹”)。理论上一个团队可以同时使用两者:用 SLAM 的动作标签预训练动作识别骨干,再用 Cholec80 的相位标签微调工作流模型——这是一种合理的组合用法,也体现了本库"多条目互补"的价值。
9.4 划界声明:SLAM 三种同名,务必分清
这是本条目必须写在明面上的一条。库内三个含"SLAM"的条目,含义完全不同:
| 条目 | rid | SLAM 含义 | 任务 | 输入 |
|---|---|---|---|---|
| SLAM(本条目) | — | Surgical LAparoscopic Motions | 手术动作识别 | 腹腔镜手术视频 |
| EndoSLAM | 408 | Simultaneous Localization And Mapping | 消化道内镜定位与建图 | 内镜影像 + 6 DoF 位姿 |
| SLAM-3D-Endoscopic | 82 | Simultaneous Localization And Mapping | 内窥镜三维重建与定位 | 内窥镜影像 |
二者的区别不是程度差异,而是领域差异:前者做"画面里在做什么动作"(视频理解),后两者做"相机在哪、场景长什么样"(几何/定位)。任何把它们当作"同族数据集"的检索、引用或推荐都是错误的。唯一共同点是三个字母——这是文献命名不加区分的典型后果(坑 1)。
§10 避坑清单:十二个已踩过的坑
坑 1:SLAM 缩写撞名内窥镜定位数据集。
"SLAM"在机器人/视觉领域默认指 Simultaneous Localization And Mapping。库内 EndoSLAM(408)、SLAM-3D-Endoscopic(82) 都是内窥镜定位建图,与本条目(Surgical LAparoscopic Motions,动作识别)毫无关系。搜"SLAM dataset"极易点错。(对照 §9.4)
坑 2:中文报道的"标注一致性 99%"是误读。
论文原文是"主任医师复核随机 10% 子集,该子集内约 1% 标注被修正"。1% 是抽查子集内的修正率,不是"一致性 99%",也不能外推为全体错误率。(对照 §3.2)
坑 3:"9 类术式"里混了 1 例跨科胸腔镜。
Table 2 的 9 类术式含 VATS for Lung Surgery(胸腔镜肺手术)——它不是腹腔镜术式,是团队特意加入用于验证跨科迁移的样本。统计"腹腔镜术式数量"时应剔除它(实为 8 类腹腔镜 + 1 类胸腔镜)。
坑 4:Table 2 术式计数相加为 36,与 34 例患者不符。
22+6+2+1+1+1+1+1+1 = 36,而患者数为 34(Single 32 + Combined 2)。差异源于 2 例联合手术(Cholecystectomy with Appendectomy)在术式行里被各计一次。Table 2 内部计数不自洽,勿直接用 36 做分母。
坑 5:把"4,097 片段"与"数据集小时数"横向比较。
论文 Table 1 里 LapGyn4 是图像数、ESAD 是小时数、SLAM 是片段数——量纲不同。"4,097 视频"看着大,但换算成时长未必超过 ESAD 的 16 小时。跨数据集比规模前先统一量纲。
坑 6:把 85.90% 当作"无配置的 SOTA"。
85.90% 只在16 帧 / 768px 配置成立;同一数据集在 8 帧 / 224px 下只有 80.77%。引用必须带配置,否则不可比。此外论文只报了 ViViT 一种模型,不是多模型排行榜。
坑 7:论文许可 ≠ 数据集许可。
论文是 CC BY-NC-ND 4.0(非商用、禁改编),数据集是 CC BY 4.0(可商用、可改编)。拿论文许可去限制数据集使用,或用数据集许可去改编论文图表,都是错的。(对照 §6.1、§6.3)
坑 8:GitHub 代码仓无 license 文件。
代码仓 yezizi1022/SLAM-Vivit_Cls 未声明 license,默认"保留所有权利"。研究使用通常无碍,但商用项目引用前应联系作者获取授权。同时该仓只给训练/推理脚本,不含预训练权重,85.90% 无法直接复现。
坑 9:把中文报道的"多中心"当作论文口径。
部分中文产业报道(生物通等)称 SLAM 采用"多中心手术视频采集"。论文原文明确是单中心——全部 34 台手术录制于"RuiJin Hospital LuWan Branch"一家医院,论文 Methods 无任何 multi-center 表述,"单中心"实为其被广泛引用的局限之一。报道的"多中心"与论文的"单中心"直接冲突,引用时以论文为准(存照见 §9 与本次核验留痕)。
坑 10:把中文报道的"双盲标注"当作论文口径。
中文产业报道(梵晨/搜狐)称标注"由资深外科医师双盲标注及高年资医师复核"。论文原文并非双盲——是"2 名副主任医师各自独立标注数据集的一半"(各标各的一半、无重叠),再由主任医师复核 10% 子集。"独立(independent)“不等于"双盲(double-blind)”,且两位初标者之间没有交叉复核,无法构成双盲设计。这是英文"independent annotation"被中文报道转写为"双盲"的典型失真。(对照 §3.1)
坑 11:把"片段数"当"患者数"或"手术数"。
4,097 是片段数,不是病例数。数据集实为 34 例患者 / 34 台手术。摘要里"it includes 4,097 video clips"易被略读成"4,097 例"或"4,097 台手术"。
坑 12:把 VATS 样本当作"腹腔镜跨科扩展已充分验证"。
跨科(胸腔镜)测试集仅 1 例手术、175 个片段。论文用"validating the transferability"这种定性措辞,并未给出统计显著性;43.75% / 65.62% 的置信区间宽。把它当作"跨科泛化已被证实"是过度解读(对照 §4.7)。
§11 总结
11.1 三句话总结
- SLAM 是瑞金医院卢湾分院等构建的腹腔镜手术基础动作分类数据集:34 台手术 → 4,097 个 30 帧片段 → 9 类术式 → 7 类基础动作,配 70/15/15 划分。
- 它的核心价值是"最开放 + 最基础":figshare 公开、免注册、CC BY 4.0、测试集公开,是本库手术视频条目里获取门槛最低的一档,适合作为动作识别的入门基准。
- 它的边界同样清晰:单中心、单模型(ViViT,最高 85.90%)、无标注者间一致性分析、跨科样本仅 1 例、Panoramic View 类识别困难——适合做"现成可上手的动作分类底座",不适合当"已确立的 SOTA 榜单"。
11.2 适合谁
- 手术视频动作识别模型开发者:现成的 4,097 片段 + CSV 索引,开箱即训。
- 想验证新视频分类架构的团队:7 类、公开测试集,可作为快速基准。
- 研究跨术式/跨科泛化的研究者:9 类术式 + 1 例胸腔镜提供了多样性样本。
- 手术机器人/自动化方向:基础动作识别是智能器械感知的底层能力。
11.3 不适合谁
- 做完整手术工作流/相位分析的:SLAM 只给基础动作,不含相位 → 用 Cholec80/HeiChole。
- 做器械-组织关系(三元组)检测的:本数据集无三元组标注 → 用 CholecT50。
- 需要多中心、跨机构泛化证据的:SLAM 是单中心数据,无法支撑跨机构结论。
- 想做内窥镜定位/三维重建的:那是完全不同的任务 → 用 EndoSLAM(408)。
11.4 30 秒决策卡
| 如果你…… | 结论 |
|---|---|
| 想马上开始做手术动作分类 | ✅ 用 SLAM,figshare 直下,CC BY 4.0 |
| 需要相位/工作流标签 | ❌ 转 Cholec80(78) / HeiChole(756) |
| 需要三元组标注 | ❌ 转 CholecT50(223) |
| 需要多中心泛化证据 | ❌ SLAM 单中心,不够 |
| 想做内窥镜定位建图 | ❌ 转 EndoSLAM(408),与本条目无关 |
| 要引用"SOTA 精度" | ⚠ 只报 ViViT 85.90%,须带"16 帧/768px"配置,且非多模型榜 |
11.5 三源互证结论
本条目核心事实由三源互证,最终结论如下:
| 事实类别 | 论文(Europe PMC XML) | figshare 数据集页 | GitHub / 其他 | 一致性 |
|---|---|---|---|---|
| 数据集名称 | Surgical LAparo Motion (SLAM) | SLAM - Surgical LAparoscopic Motions | SLAM: A Comprehensive Video Dataset… | ✅ 一致(名称写法略有出入) |
| 规模 4,097 | ✅ Table 1/3 | 描述未列数字 | README 未列数字 | ✅ 以论文为准 |
| 7 类动作 | ✅ | ✅ 列出 7 类 | ✅ | ✅ 完全一致 |
| 许可 | 论文 CC BY-NC-ND | 数据集 CC BY 4.0 | 无 license | ⚠ 分属不同资产 |
| 获取 | without registration | 页面公开可浏览 | DOI 指向 figshare | ✅ 一致 |
| 版本 | v3 引用 | v1/v2/v3 版本链 | DOI 指 v3 | ✅ 一致 |
§12 腹腔镜手术动作识别的临床、教学与产业意义
本节为扩充新增章节,回答"识别出动作之后,能拿来做什么"。这是 SLAM 这类数据的下游价值所在(本节为对腹腔镜动作识别应用的通用归纳,明确标注其中哪些属论文原文、哪些属通用背景)。
12.1 术中:实时辅助与安全预警
| 应用场景 | 动作识别的角色 | 依赖的 SLAM 动作类 |
|---|---|---|
| 手术导航 | 识别当前操作意图,提示下一步所需器械/视野 | 全景视野、腹腔进入 |
| 安全预警 | 识别"接近关键结构"的切割/夹闭动作,触发提醒 | 电钩切割、上夹 |
| 术野质量管理 | 识别吸引频率与时长,提示积血/视野不良 | 吸引 |
| 器械自动化 | 智能器械识别动作阶段,辅助或替代重复操作 | 上夹、缝合、切割 |
关键点:动作识别是"意图理解"的前置。系统要先知道"术者现在在夹血管",才能进一步判断"这一步是否安全、是否该提醒"。没有动作层,安全预警就只能是基于解剖结构的静态规则。
12.2 术后:技能评估与教学
| 应用 | 说明 | 与动作识别的关系 |
|---|---|---|
| 客观技能评分 | 用动作分布(如缝合次数、切割路径)替代主观打分 | 动作标签是评分输入 |
| 手术报告自动化 | 自动生成"本次手术执行了哪些操作、各多少次" | 片段标签可直接汇总为报告 |
| 教学复盘 | 对比学员与专家的动作序列差异,定位短板 | 动作序列对齐 |
| 标准化培训 | 用动作频次分布建立"标准术式画像" | SLAM 的 7 类动作词表可作为统一坐标 |
论文在引言中明确把 “improving surgical navigation, training, and postoperative evaluation”(改善手术导航、训练与术后评估)列为手术动作识别的三大支持方向——SLAM 正是为这三者提供动作层的训练语料。这也解释了为什么它选"基础动作"而非"相位":基础动作更原子、更跨术式,更适合做技能评估的通用坐标。
12.3 与智能手术机器人
智能手术机器人(如腹腔镜/胸腔镜辅助系统)要实现半自动或全自动操作,需要完整的感知链条:看到什么(感知)→ 在做什么(动作)→ 为什么这么做(意图)→ 怎么做(规划)→ 做得怎样(反馈)。SLAM 对应的是链条第二步"在做什么"。
论文的野心表述是 “supporting intelligent surgical robots and surgical automation”——即把 SLAM 作为手术自动化感知层的公开训练底座。这与库内 AutoLaparo(阶段+动作+分割)方向一致,但 SLAM 的跨术式动作词表使其更适合做"通用动作感知"的预训练。
12.4 边界声明:SLAM 不提供什么
同样重要地声明它的临床边界:
- 不做诊断:它是动作识别数据,不含病理、影像诊断信息。
- 不做术中决策:它只给"在做什么",不给"该怎么做"。
- 不做安全判定:CVS 等安全标准由 Endoscapes 这类数据承担,SLAM 不含解剖安全性标注。
- 单中心偏倚:34 台单一医院数据,用于临床部署前须在目标医院数据上再验证。
一句话总结临床定位:SLAM 是手术机器人/教学系统感知层的公开语料,不是临床决策系统;它让"看懂动作"这件事有了可训练、可评测、可复现的公开基准。
§13 与 Cholec80 / CholecT50 等库内条目的任务-标注对照
本节为扩充新增章节,系统对比 SLAM 与库内同域头部条目在"任务定义"与"标注体系"上的差异,帮助检索者精准选型。
13.1 四维对照总表
| 对照维度 | SLAM | Cholec80(78) | CholecT50(223) | HeiChole(756) |
|---|---|---|---|---|
| 单位粒度 | 片段(30 帧) | 帧 | 帧 | 片段/帧 |
| 主任务 | 基础动作分类 | 相位识别 + 工具检测 | 动作三元组检测 | 四任务基准 |
| 标签体系 | 7 类动作 | 7 相位 + 7 工具 | 100 类三元组 | 7 相位/4 动作/7 器械/5 技能 |
| 术式范围 | 9 类(跨术式) | 胆囊切除 | 胆囊切除 | 胆囊切除 |
| 测试集 | 公开 | 公开 | 私有 | 私有 |
| 获取 | 免注册 CC BY 4.0 | 需注册 | 需申请 | 需申请 |
13.2 任务层次:谁是谁的上游
如果把手术视频理解建成一条流水线,四者的上下游关系是明确的:
(SLAM) 基础动作分类 ──▶ (CholecT50) 动作三元组 ──▶ (Cholec80) 相位/工作流
7 类原子动作 器械-动词-目标关系 手术宏观阶段
│ │ │
└──────── 横向:Endoscapes 安全视野(353) ──────────┘
- SLAM 在上游:它把画面切成"哪类动作",是后续关系识别与相位推断的输入。
- CholecT50 居中:在动作之上补"器械-目标"关系,粒度更细但需更多标注。
- Cholec80 在下游:把动作序列聚合为手术阶段,回答"进行到哪一步"。
13.3 标注体系对照:从"谁标"到"怎么质检"
| 数据集 | 标注主体 | 质检机制 | 一致性检验 | 标注成本 |
|---|---|---|---|---|
| SLAM | 2 名副主任医师(各半) | 主任医师抽查 10% | 未做 | 片段级,成本低 |
| Cholec80 | 专家(帧级) | — | 报告过 | 帧级,成本高 |
| CholecT50 | 专家(多轮) | 多轮交叉 | 报告过 | 三元组,成本最高 |
| HeiChole | 多中心专家 | 挑战赛仲裁 | 挑战赛对比 | 四任务,成本高 |
为什么 SLAM 标注成本最低:片段级单标签 + 7 类词表 + 无需标注边界行/器械/目标,使其单位标注耗时显著低于帧级相位或三元组。这是"入门基准"定位在标注工程上的体现。
13.4 选型决策:什么时候选 SLAM,什么时候不选
| 你的需求 | 选 SLAM? | 替代方案 |
|---|---|---|
| 快速验证新的视频分类架构 | ✅ 首选 | — |
| 跨术式通用动作感知预训练 | ✅ 首选 | — |
| 需要手术相位/工作流标签 | ❌ | Cholec80(78) / HeiChole(756) |
| 需要器械-动词-目标三元组 | ❌ | CholecT50(223) |
| 需要解剖分割 + 安全视野评估 | ❌ | Endoscapes(353) |
| 需要多中心泛化证据 | ❌ | HeiChole(756) |
| 需要内窥镜定位/三维重建 | ❌(同名异物) | EndoSLAM(408) / SLAM-3D-Endoscopic(82) |
| 需要受控申请的多任务联合标注 | ❌ | PhaKIR(755) |
13.5 组合用法建议:SLAM 当预训练底座
SLAM 最适合被"当作底座"而非"当作终点"。两条推荐的组合路径:
| 组合路径 | 步骤 | 预期收益 |
|---|---|---|
| SLAM → Cholec80 | 用 SLAM 动作标签预训练骨干 → 用 Cholec80 相位标签微调 | 先在大量动作片段上学通用表征,再适配相位任务 |
| SLAM → CholecT50 | 用 SLAM 预训练特征 → 加三元组检测头微调 | 降低三元组检测对海量关系标注的依赖 |
这种"动作级预训练 + 上层任务微调"的思路,与自然语言处理里"通用预训练 + 任务微调"的范式同构——也是本条目的核心生态价值:它提供的是可迁移的动作表征底座,而非某一个具体任务的天花板。
FAQ(高频问答 28 问)
A. 基础认知
Q1:SLAM 全称?为什么容易和内窥镜 SLAM 混?
Surgical LAparoscopic Motions(腹腔镜手术动作)。缩写与 Simultaneous Localization And Mapping 字面撞车,纯属巧合。本条目是动作识别,不是定位建图。
Q2:SLAM 和 EndoSLAM(rid 408)是一回事吗?
不是。EndoSLAM 是消化道内镜同步定位与建图(76,837 帧 + 6 DoF 位姿),SLAM 是腹腔镜动作识别。任务、数据、目标全不同,只是名字里都有 SLAM。
Q3:它和 CholecT50 什么关系?
层次互补。SLAM 是底层基础动作分类(7 类),CholecT50 是上层动作三元组检测(器械-动词-目标)。SLAM 论文自称是"分解术式的关键初始步骤"。
Q4:为什么选"基础动作"而不是"相位"?
基础动作(如上夹、缝合)跨术式通用,泛化性更好,也更接近"模型能直接看懂的原子操作"。相位依赖具体术式流程,换术式就失效。
Q5:它是哪一年发表的?数据集构建是哪一年?
论文 2025-05-24 发表(Sci Data 12, 862);数据集构建/采集于 2021–2023 年;论文 Table 1 把 SLAM 记为 2024(构建年口径)。三者不矛盾,是不同时点(坑:别把 2024 当发表年)。
Q6:它的"seven key actions"具体是哪七个?
Abdominal Entry、Use Clip、Hook Cut、Suturing、Panoramic View、Local Panoramic View、Suction(注意摘要里的列举顺序与 Table 3 表头顺序略有不同,指向同一组七类)。
B. 数据与获取
Q7:数据量到底多少?
4,097 个视频片段,来自 34 台手术 / 34 例患者,每例 15–38 个片段,每片段 30 帧。
Q8:怎么下载?要注册吗?
figshare 公开、无需注册。DOI 10.6084/m9.figshare.28104782.v3,现行 v3 版。许可 CC BY 4.0。
Q9:许可是什么?能商用吗?
数据集 CC BY 4.0——可以商用、可以改编,只需署名。注意论文本身是 CC BY-NC-ND(不可商用/改编),别混。
Q10:视频清晰度和设备?
1920×1080、25 fps,用 26003BA HOPKINS 30° 内窥镜(超广角、10 mm、31 cm、耐高温高压、光纤传输)录制。
Q11:有哪些已知瑕疵?
部分视频有垂直条纹伪影(原始录制阶段产生,非后处理);附有受影响片段清单。团队把这种"不完美"当作模型鲁棒性的正向训练信号。
Q12:目录结构是什么样的?
顶层 LaparoMotion/ 含 clip/ 子目录(34 个匿名患者文件夹)+ train.csv / val.csv / test.csv(列:patient / file_path / label)。
Q13:为什么要单独给一个 looped_clips.csv?
因为短片段用"循环补齐"填到 30 帧,引入了人工重复帧。该 CSV 记录哪些片段被循环补齐、循环从哪一帧开始([loop_start_frame, 30]),使用者可据此决定是否剔除这些片段以保证"无人工帧"。
Q14:有 HuggingFace 或官方 dataloader 吗?
没有。数据集托管于 figshare(非 HF),GitHub 仅给 train.py / inference.py,需自行编写下载与加载逻辑。这是它 I(可互操作)只给 7 分的原因之一。
C. 标注与质量
Q15:谁标注的?
2 名副主任医师独立初标(各标一半)+ 1 名主任医师复核随机 10% 子集(该子集约 1% 被修正)。
Q16:有标注一致性指标吗?
没有。论文明确承认这是局限,且因两名初标者无重叠样本,事后也无法补算一致性。
Q17:"一致性 99%"的说法对吗?
不对。那是中文报道对"10% 子集内约 1% 修正"的误读。论文无此数字。
Q18:是"双盲标注"吗?
不是。“independent annotation”(独立标注)被中文报道转写为"双盲"。两位初标者各标一半、互不重叠,也不互相复核,不构成双盲设计(坑 10)。
Q19:Abdominal Entry 为什么只有 251 个片段?
因为每次腹腔镜手术只发生一次(器械进入腹腔)。且首个 trocar 在镜头置入前放置无法录制,故该类只覆盖后续 trocar 的可视化置入。
Q20:为什么各类别片段数差这么多?
因为动作固有频次不同:吸引/上夹/切割是高频操作,腹腔进入只一次、全景视野不常需要。这是真实频次的映射,不是采集缺陷(坑:别当失衡数据去重采样)。
D. 模型与结果
Q21:用什么模型验证的?精度多少?
ViViT(Video Vision Transformer),最高总精度 85.90%(16 帧 / 768px / 80 epochs / batch 4),test loss 0.4554。
Q22:哪些类别最难识别?
Panoramic View 最难(32.14%–71.43%,全表最低),与 Local Panoramic View 混淆严重;Suction 与 Suturing 也易混。
Q23:跨科迁移结果如何?
仅腹腔镜模型 → 胸腔镜测试集 43.75%;混合模型 → 胸腔镜 65.62%。但跨科测试集只有 1 例手术,样本小,宜作趋势证据。
Q24:85.90% 能复现吗?
不能直接复现。GitHub 只提供训练/推理脚本,未提供预训练权重(best_model.pkl 需自训)。
Q25:为什么分辨率越高越好?有没有例外?
总体趋势是高分辨率(768px)提升纹理型动作(如 UseClipper 92.47%),但对频繁视角切换的动作(LocPanoView/Suturing)提升有限。配置与类别存在交互,引用须带配置。
E. 生产与库内
Q26:SLAM 在库内和哪些条目互链?
Cholec80(78)、CholecT50(223)、AutoLaparo(313)、Endoscapes(353)、HeiChole(756)、PhaKIR(755)。不与 EndoSLAM(408)、SLAM-3D-Endoscopic(82) 互链为同族。
Q27:论文署名单位和产业报道一致吗?
不一致。论文 5 个单位未列产业实体(广西华医……),部分中文报道称其参与构建。条目以论文署名为准,报道口径存照。
Q28:这个数据集的引用现状如何?
截至 2026-09-30,OpenAlex 记录被引 7 次、FWCI 11.69、引用百分位 98.8%,属该领域高关注度数据描述符;但被引基数低,需随时间长观察(见 §7.5)。
事实清单(硬事实 44 条)
- 全称:SLAM — Surgical LAparoscopic Motions(论文正文亦作 “Surgical LAparo Motion”)。
- 论文:A Comprehensive Video Dataset for Surgical Laparoscopic Action Analysis。
- 期刊:Scientific Data 12, 862 (2025)。
- DOI:10.1038/s41597-025-05093-7。
- PMID:40413211;PMCID:PMC12103523。
- 发表日:2025-05-24。
- 论文许可:CC BY-NC-ND 4.0。
- 通讯作者:Hanwei Zhang;共同一作:Zi Ye、Ru Zhou。
- 作者共 10 人:Zi Ye, Ru Zhou, Zili Deng, Dan Wang, Ying Zhu, Xiaoli Jin, Lijun Zhang, Tianxiang Chen, Hanwei Zhang, Mingliang Wang。
- 主单位:瑞金医院卢湾分院普外科(上海交大医学院)。
- 合作单位:中科院软件所、国科大杭高院、中科大网安学院、广州智能软件研究院。
- 伦理批号:LWEC2024022(豁免个体知情同意)。
- 采集窗口:2021–2023 年。
- 视频片段总数:4,097。
- 完整手术视频:34 段。
- 患者数:34 例(匿名哈希 ID)。
- 术式类别:9 类(含 1 例跨科胸腔镜)。纯腹腔镜术式为 8 类。
- 动作类别:7 类基础动作。
- 分辨率 / 帧率:1920×1080 / 25 fps。
- 内窥镜:26003BA HOPKINS 30°(10 mm / 31 cm)。
- 片段长度:统一 30 帧;每患者 15–38 个片段。
- 划分:train / val / test = 70% / 15% / 15%。
- 逐类片段数:Suction 1,033 / Use Clipper 968 / Hook Cut 798 / Suturing 471 / LocPanoView 396 / Abdominal Entry 251 / Panoramic View 180(合计 4,097)。
- 患者画像:年龄 53±32(21–78)岁;BMI 23.6±6.0;性别 17 女 / 17 男。
- 单术式 32 例 / 联合术式 2 例。
- 标注:2 名副主任医师各半 + 1 名主任医师复核随机 10% 子集。
- 抽查子集内约 1% 标注被修正。
- 未做标注者间一致性分析(论文承认局限)。
- 验证模型:ViViT,80 epochs,batch 4,输入 8/16 帧,分辨率 224/448/768。
- 最高总精度:85.90%(16 帧 / 768px),test loss 0.4554。
- 单类最高:Hook Cut 96.69%(16/224)。
- 跨科:仅腹腔镜模型 → 胸腔镜 43.75%;混合模型 → 胸腔镜 65.62%。
- 数据集许可:CC BY 4.0;figshare 公开无需注册。
- figshare 版本:v1 2025-04-10、v2 2025-04-10、v3 2025-04-14(现行 v3)。
- 单例最大片段数:943(index 19,直肠癌根治);最小 9(index 15)。
- 跨科测试样本:index 34(VATS),合计 175 片段。
- 联合手术条目:index 10、index 26(胆囊切除+阑尾切除)。
- 数据托管平台:figshare,version DOI 10.6084/m9.figshare.28104782.v3。
- 代码仓:github.com/yezizi1022/SLAM-Vivit_Cls(无 license 文件)。
- 代码默认配置:lr=7e-5、time_size=16、分辨率 768×768。
- 引文计量(2026-09-30 快照):Cited by 7、FWCI 11.69、百分位 98.8%。
- 中文报道"一致性 99%":论文无此表述(误读,存照)。
- 中文报道"多中心":论文实为单中心(报道口径冲突,存照)。
- 中文报道"双盲标注":论文为"独立标注、各标一半"(报道口径失真,存照)。
术语表(40 条)
| 术语 | 英文 | 含义 |
|---|---|---|
| 腹腔镜手术 | Laparoscopic Surgery | 通过小切口置入细长器械与摄像头的微创手术 |
| 动作识别 | Action Recognition | 识别视频中正在执行的(手术)动作 |
| 基础动作 | Foundational Action | 跨术式通用的原子操作(如上夹、缝合) |
| 腹腔进入 | Abdominal Entry | 器械首次进入腹腔的步骤 |
| 吸引 | Suction | 清除积血积液以保持术野清晰 |
| 上夹 | Use Clip | 用夹钳固定组织/血管以止血或隔离 |
| 电钩切割 | Hook Cut | 用电钩精准切割分离组织 |
| 缝合 | Suturing | 进针出针完成组织缝合 |
| 全景视野 | Panoramic View | 提供整体视野用于导航定向 |
| 局部全景视野 | Local Panoramic View | 聚焦特定细节的局部视野 |
| 片段 | Clip | 数据集的最小单位,统一切为 30 帧 |
| 循环补齐 | Looping Strategy | 短片段用从头循环帧填满 30 帧 |
| 划分 | Data Split | train/val/test 三分(70/15/15) |
| 相位 | Phase | 手术的宏观阶段(本数据集不标注) |
| 三元组 | Action Triplet | 器械-动词-目标关系(CholecT50 标注粒度) |
| ViViT | Video Vision Transformer | 用 Transformer+自注意力做视频分类的模型 |
| 自注意力 | Self-Attention | Transformer 建模长程依赖的机制 |
| 时序 | Temporal | 时间维度的动态特征 |
| 混淆矩阵 | Confusion Matrix | 分类错误类型的可视化矩阵 |
| 类间相似 | Interclass Similarity | 不同动作类视觉相似导致的误分 |
| 迁移学习 | Transfer Learning | 把一种术式学的知识迁移到另一种 |
| 跨科迁移 | Cross-Specialty Transfer | 腹腔镜 → 胸腔镜的知识迁移 |
| 胸腔镜手术 | VATS | 电视辅助胸腔镜手术(Video-Assisted Thoracic Surgery) |
| HOPKINS 内窥镜 | HOPKINS Endoscope | 26003BA HOPKINS 30° 超广角内窥镜 |
| 垂直条纹伪影 | Vertical Line Artifacts | 原始录制阶段产生的条纹瑕疵 |
| 去标识化 | Anonymization | 移除患者可识别信息(PII) |
| CVS | Critical View of Safety | 胆囊切除安全视野(Endoscapes 的核心概念) |
| DAIMS | — | 数据集 AI 就绪度五维评估框架 |
| 标准手术 | Laparoscopic Cholecystectomy | 腹腔镜胆囊切除(本数据集主体术式) |
| 术野 | Surgical Field | 内窥镜视野内的手术操作区域 |
| 补片/夹钳 | Clipper / Clip Applier | 施放钛夹或聚合物夹的器械 |
| 电钩 | Hook Electrode | 单极电刀钩形电极,用于精确切割 |
| 气腹 | Pneumoperitoneum | 向腹腔注气以创造操作空间 |
| trocar | Trocar / Port | 穿刺器,器械与内窥镜进出腹腔的通道 |
| 帧 | Frame | 视频的单幅静止图像;25 fps 即每秒 25 帧 |
| 批大小 | Batch Size | 单次前向/反向传播的样本数(本条目为 4) |
| 轮数 | Epoch | 完整遍历训练集一次(本条目 80 轮) |
| 数据描述符 | Data Descriptor | Scientific Data 的一种文章类型,专述数据集 |
| 患者级交叉验证 | Leave-One-Patient-Out | 以整位患者为划分单位的评测协议 |
| 类别不均衡 | Class Imbalance | 各类样本数差异大(本数据集 180 vs 1,033) |
附录
附录 A:条目信息速查卡
| 项目 | 内容 |
|---|---|
| 条目 slug | slam-laparoscopic-motions |
| 官方名 | SLAM — Surgical LAparoscopic Motions |
| 库内互链 | Cholec80(78)、CholecT50(223)、AutoLaparo(313)、Endoscapes(353)、HeiChole(756)、PhaKIR(755)、Miccai-surgt(83) |
| 禁止同族链接 | EndoSLAM(408)、SLAM-3D-Endoscopic(82) |
| 核心规模 | 4,097 clip / 34 手术 / 9 术式 / 7 动作 |
| 获取 | figshare 公开,CC BY 4.0,无需注册 |
| 论文 | Sci Data 12, 862 (2025),DOI 10.1038/s41597-025-05093-7 |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | PMC12103523 + figshare 页面 + GitHub 三处可索引;缩写撞名轻微降低检索精度 |
| A 可获取性 | 9 | figshare 公开、免注册、CC BY 4.0——本库手术视频最高档 |
| I 可互操作 | 7 | mp4 + CSV 通用性好;无 DICOM/HF datasets 集成与官方 dataloader |
| M 元数据质量 | 7 | 表格完备;但未披露逐类逐划分精确片段数、无一致性指标、Table 2 计数不自洽 |
| S 可持续性 | 7 | 依托 figshare + GitHub;署名仅 1 人、GitHub 无 license、无机构长期保存承诺 |
| 综合评级 | 7.6/10(良好) | 可获取性突出,互操作与元数据中等 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 4,097 片段 | Table 1 / Table 3 合计 | Europe PMC XML |
| 34 手术 / 34 患者 | “Video recording” 节 | Europe PMC XML |
| 7 动作 / 9 术式 | Methods(Table 2/3) | Europe PMC XML |
| 1920×1080 / 25fps / HOPKINS 30° | “Video recording” 节 | Europe PMC XML |
| 30 帧 / 15-38 片段 | “Data Records” 节 | Europe PMC XML |
| 70/15/15 划分 | “Dataset workflow” 节 | Europe PMC XML |
| 逐类片段数 | Table 3 | Europe PMC XML |
| 85.90% / 0.4554 | Table 4 / 正文 | Europe PMC XML |
| 跨科 43.75% / 65.62% | Table 5 | Europe PMC XML |
| 10% 子集 / 1% 修正 | “Dataset Reliability” 节 | Europe PMC XML |
| 伦理批号 LWEC2024022 | Methods 首段 | Europe PMC XML |
| CC BY 4.0 / 免注册 | figshare 数据集页 + Data Records | figshare |
| 版本链 v1/v2/v3 | figshare 数据集页 | figshare(抓取 2026-09-30) |
| GitHub 文件清单 | GitHub README | github.com/yezizi1022/SLAM-Vivit_Cls |
附录 D:数据获取决策树
你需要手术视频数据?
├── 做动作识别(画面里在做什么)?
│ ├── 要开放、免注册 → SLAM(本条目)
│ └── 要更多相位/器械标注 → Cholec80(78) / HeiChole(756)
├── 做器械-组织关系(三元组)→ CholecT50(223)
├── 做解剖分割 + 安全视野(CVS)→ Endoscapes(353)
├── 做手术阶段 + 器械分割(妇科)→ AutoLaparo(313)
├── 做内窥镜定位/三维重建 → EndoSLAM(408) / SLAM-3D-Endoscopic(82)
└── 要受控申请的多任务联合标注 → PhaKIR(755)
附录 E:七类动作的定义与使用规范
| 动作 | 类型 | 使用注意 |
|---|---|---|
| Abdominal Entry | 器械-组织操作 | 仅覆盖后续 trocar(首个 trocar 不可视) |
| Suction | 器械-组织操作 | 与 Suturing 易混,评测注意 |
| Use Clip | 器械-组织操作 | 高频大类,样本充足 |
| Hook Cut | 器械-组织操作 | 高精度类,16 帧配置下最佳 |
| Suturing | 器械-组织操作 | 与 Suction 易混 |
| Panoramic View | 辅助导航 | 最难类(最低 32.14%),与 LocPanoView 易混 |
| Local Panoramic View | 辅助导航 | 与 Panoramic View 边界模糊 |
附录 F:ViViT 训练骨架(GitHub 配置)
# 依 GitHub yezizi1022/SLAM-Vivit_Cls README
# 关键配置
lr = 7e-5 # 默认学习率
time_size = 16 # 输入帧数
height = width = 768 # 图像分辨率
# 数据集准备
# 1. 从 https://doi.org/10.6084/m9.figshare.28104782.v3 下载
# 2. 使用 train.csv / val.csv / test.csv 索引
# 训练: python train.py
# 推理: python inference.py(需指定 model_path)
附录 G:循环补齐说明(looped_clips.csv)
GitHub 附 looped_clips.csv,记录哪些片段采用了循环补齐策略:
| 列 | 含义 |
|---|---|
loop_path |
片段路径 |
phase |
数据集划分(train/val/test) |
part_id |
患者 ID |
loop_start_frame |
循环起始帧 |
循环区间为 [loop_start_frame, 30],即从该帧起循环至片段末尾(30 帧)。使用者可自行决定是否采用这些补齐片段——若不采用,需按此表剔除。
附录 H:与库内手术条目互链矩阵
| 条目 | rid | 任务 | 与本条目关系 |
|---|---|---|---|
| Cholec80 | 78 | 相位+工具 | 上层互补(相位) |
| CholecT50 | 223 | 动作三元组 | 上层互补(关系) |
| AutoLaparo | 313 | 阶段+动作+分割 | 平行(妇科术式) |
| Endoscapes | 353 | 分割+CVS | 横向(安全评估) |
| HeiChole | 756 | 多中心四任务 | 上层对比(多中心) |
| PhaKIR | 755 | 相位+关键点+器械 | 上层对比(受控申请) |
| Miccai-surgt | 83 | 手术动作相关 | 同域入口 |
| EndoSLAM | 408 | 内镜定位建图 | 禁止同族链接 |
| SLAM-3D-Endoscopic | 82 | 内镜三维定位 | 禁止同族链接 |
附录 I:Table 5 跨科迁移结果总表
| 模型 | Mixed 测试 | 腹腔镜测试 | 胸腔镜测试 |
|---|---|---|---|
| 仅腹腔镜模型 | 79.97% | 81.59% | 43.75% |
| 混合模型 | 85.90% | 86.66% | 65.62% |
说明:胸腔镜测试集仅 1 例手术(Table 3 index 34,175 片段),样本量小,结果宜作趋势证据。
附录 J:Table 4 逐类最佳配置索引
| 动作类别 | 最佳精度 | 出现配置 |
|---|---|---|
| Use Clipper | 92.47% | 8/768 与 16/768 并列 |
| Hook Cut | 96.69% | 16/224 |
| PanoView | 71.43% | 16/768 |
| Suction | 83.97% | 8/768 |
| Abdominal Entry | 87.18% | 16/224 |
| Suturing | 91.67% | 8/768 |
| LocPanoView | 85.00% | 16/768 |
| 总精度 | 85.90% | 16/768 |
附录 K:常用引用格式
- 数据集:Ye, Z. Surgical LAparoscopic Motions. figshare https://doi.org/10.6084/m9.figshare.28104782.v3 (2025).
- 论文:Ye, Z. et al. A Comprehensive Video Dataset for Surgical Laparoscopic Action Analysis. Sci Data 12, 862 (2025). https://doi.org/10.1038/s41597-025-05093-7
- 代码:https://github.com/yezizi1022/SLAM-Vivit_Cls
附录 L:与库内 Cholec80(rid 78)的组合用法
| 阶段 | 用哪个数据集 | 目的 |
|---|---|---|
| 预训练 | SLAM | 学习通用基础动作表征 |
| 微调 | Cholec80 | 学习胆囊切除的相位/工作流 |
| 评测 | 各自测试集 | 达标验证 |
这种"SLAM 预训练 + Cholec80 微调"的组合,是把动作级知识迁移到相位级任务的一种合理路径,也是本库多条目互补价值的体现。
附录 M:Table 2 术式计数与患者计数的差异说明
| 计数方式 | 数值 | 说明 |
|---|---|---|
| Table 2 术式行相加 | 36 | 2 例联合手术被拆分计入两行 |
| 患者总数 | 34 | Single 32 + Combined 2 |
| 纯腹腔镜术式 | 8 类 | 剔除跨科胸腔镜后 |
| 含跨科术式 | 9 类 | 论文口径 |
附录 N:手术动作数据集景观总表(论文 Table 1 全转)
| 数据集 | 年份 | 规模 | 手术类型 | 动作类别 |
|---|---|---|---|---|
| LapGyn4 | 2018 | 30,000+ 图像 | 腹腔镜妇科 | 8 |
| ESAD | 2021 | 16 小时 | 前列腺癌根治(RARP) | 21 |
| PSI-AVA | 2022 | 20.45 小时 | 机器人辅助 RARP | 16 |
| HeiChole | 2022 | 22 小时 | 腹腔镜胆囊切除 | 4 |
| CholecT50 | 2023 | 50 视频 | 腹腔镜胆囊切除 | 10 |
| LapGyn6-Actions | 2023 | 18 视频 | 妇科腹腔镜 | 6 |
| GraSP | 2024 | 32 小时 | 机器人辅助 RARP | 14 |
| SLAM | 2024 | 4,097 视频 | 多种腹腔镜手术 | 7 |
附录 O:许可条款细读
| 资产 | 许可 | 可商用 | 可改编 | 须署名 |
|---|---|---|---|---|
| 数据集(figshare) | CC BY 4.0 | ✅ | ✅ | ✅ |
| 论文(Sci Data) | CC BY-NC-ND 4.0 | ❌ | ❌ | ✅ |
| 代码(GitHub) | 无显式 license | ⚠ 需联系作者 | ⚠ | — |
附录 P:坑点档案(与 §10 对照)
| 坑号 | 一句话 | 回查章节 |
|---|---|---|
| 坑 1 | SLAM 缩写撞内窥镜定位数据集 | §9.4 |
| 坑 2 | "一致性 99%"系误读 | §3.2 |
| 坑 3 | 9 术式含 1 例跨科胸腔镜 | §2.1 |
| 坑 4 | Table 2 术式计数 36 ≠ 患者 34 | §2.1 / 附录 M |
| 坑 5 | 片段数 vs 小时数量纲不同 | §5.1 |
| 坑 6 | 85.90% 有配置前提,非多模型榜 | §4.3 |
| 坑 7 | 论文许可 ≠ 数据集许可 | §6.1 / §6.3 |
| 坑 8 | GitHub 无 license 且无权重 | §6.3 / §4.8 |
| 坑 9 | 报道"多中心"≠ 论文"单中心" | §7.2 / §10 |
| 坑 10 | 报道"双盲"≠ 论文"独立标注" | §3.1 / §10 |
| 坑 11 | 4,097 是片段数,非病例数 | §1.2 / §2.1 |
| 坑 12 | VATS 仅 1 例,跨科未充分验证 | §4.7 |
附录 Q:检索决策树
搜 "SLAM dataset"
├── 你要动作识别? → 本条目(slam-laparoscopic-motions)
│ └── figshare DOI 10.6084/m9.figshare.28104782.v3
├── 你要内镜定位/三维重建? → EndoSLAM(408) / SLAM-3D-Endoscopic(82)
└── 你要手术相位/三元组? → Cholec80(78) / CholecT50(223)
附录 R:双口径冲突存照全表
本条目涉及的所有"论文口径 vs 报道/衍生口径"冲突,集中存照如下:
| 事项 | 论文/官方口径 | 报道/衍生口径 | 本条目取舍 |
|---|---|---|---|
| 中心数 | 单中心(瑞金医院卢湾分院一家) | “多中心”(生物通等) | 以论文为准(单中心) |
| 标注方式 | 2 名副主任医师独立各标一半 | “双盲标注”(梵晨/搜狐) | 以论文为准(独立,非双盲) |
| 标注一致性 | 未做一致性分析;10% 子集内约 1% 修正 | “一致性达 99%” | 以论文为准;99% 为误读 |
| 术式计数 | 患者 34(Single 32 + Combined 2) | Table 2 术式行相加 36 | 标注不一致,均存照 |
| 数据集许可 | figshare 页 CC BY 4.0 | 易与论文 CC BY-NC-ND 混 | 分列两许可,勿混 |
| 年份 | 采集 2021–2023;发表 2025 | Table 1 记 2024(构建年) | 三口径并记,说明差异 |
| 参与单位 | 论文 5 单位(无产业实体) | 报道称"广西华医…"参与 | 以论文署名为准 |
| 版本 | v3 现行 | 裸 DOI 指向最新版 | 引用须带 .v3 |
附录 S:与库内 Cholec80/CholecT50 任务-标注速查
| 维度 | SLAM | Cholec80(78) | CholecT50(223) |
|---|---|---|---|
| 任务 | 基础动作分类 | 相位识别 | 动作三元组 |
| 单位 | 片段(30 帧) | 帧 | 帧 |
| 类别 | 7 | 7 相位+7 工具 | 100 三元组 |
| 术式 | 9 类 | 胆囊切除 | 胆囊切除 |
| 测试集 | 公开 | 公开 | 私有 |
| 获取 | 免注册 CC BY 4.0 | 需注册 | 需申请 |
| 标注主体 | 2 副主任+1 主任抽查 | 专家 | 专家多轮 |
| 一致性检验 | 未做 | 报告过 | 报告过 |
| 与 SLAM 关系 | — | 下游(相位) | 上层(关系) |
附录 T:临床/教学应用速查(对应 §12)
| 应用 | 输入(动作识别输出) | 输出 | 依赖数据集 |
|---|---|---|---|
| 术中导航 | 当前动作类别 | 下一步器械/视野提示 | SLAM |
| 安全预警 | 切割/夹闭动作 | 风险提醒 | SLAM + Endoscapes |
| 技能评估 | 动作分布统计 | 客观技能分 | SLAM |
| 报告自动化 | 片段标签序列 | 手术操作清单 | SLAM |
| 教学复盘 | 学员 vs 专家动作序列 | 短板定位 | SLAM |
| 机器人感知 | 动作类别 | 自动化控制信号 | SLAM + AutoLaparo |
附录 U:患者级分布极值说明(Table 3)
| 项 | 值 | 说明 |
|---|---|---|
| 患者条目数 | 34 | index 1–34 |
| 最小单例片段数 | 9(index 15) | 数据量最少的患者 |
| 最大单例片段数 | 943(index 19,直肠癌根治) | 约占全数据集 23% |
| 跨科样本 | index 34(VATS)175 片段 | 跨科迁移测试集 |
| 联合手术 | index 10、index 26 | 胆囊切除+阑尾切除 |
| 全表合计 | 4,097 | 与 Table 1 一致 |
条目声明:本条目由千方病案医数集编辑部依据 Scientific Data 论文(DOI 10.1038/s41597-025-05093-7)全文、figshare 数据集页与 GitHub 代码仓三源互证撰写,本次续写扩稿核验时点 2026-09-30。所有硬数字均标注来源;双口径冲突与内部不一致已逐条存照(见 §10、附录 P 与附录 R)。本条目为百科性技术资料,不构成临床或手术操作建议。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- kvasir-hyperkvasir — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 图像分类
- hyperkvasir — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
- gastrovision — 共享标签:医学影像 / 内窥镜影像 / 图像分类
- heichole — 共享标签:医学影像 / 手术视频 / 图像分类 / 评测基准
- rare25 — 共享标签:医学影像 / 内窥镜影像 / 图像分类 / 评测基准
- real-colon — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 评测基准
- slam-3d-endoscopic — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- jigsaws — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- m2cai16-tool — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- multibypass140 — 共享标签:医学影像 / 手术视频 / 内窥镜影像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

