信息速览

JIGSAWS — 手术手势与技能评估 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | JIGSAWS |
| 英文全称 | JHU-ISI Gesture and Skill Assessment Working Set |
| 别名/简称 | JIGSAWS;JHU-ISI 手势与技能评估工作集 |
| 疾病分类(ICD-11 编码+中文名) | 不适用 — 非疾病特异性数据集(主题为机器人辅助外科手术技能评估,ICD-11 MMS 仅编码诊断、不含操作分类) |
| SNOMED CT | 387713003(Surgical procedure,手术操作根概念);详见 §2.1b |
| 数据模态 | 76 维机械臂运动学时序(30 Hz) + 立体内窥镜视频(640×480,30 Hz) + 手势逐帧标注 + 技能评分 |
| AI 任务类型 | 手势分割/识别(时序动作分割)、手术技能评估(回归/分类)、多模态融合、手术运动建模 |
| 样本总数 | 103 段试验(Suturing 39 / Knot-Tying 36 / Needle-Passing 28);8 名受试者 × 3 任务 × 5 次重复 |
| 数据大小 | 分任务 ZIP 分发(官方未公布总量);103 段试验总视频时长约 9,488 秒,平均 92.1 秒 |
| 数据格式 | 制表符分隔 TXT(运动学、手势转写)+ 视频文件(立体)+ META 文件(技能评分)+ 交叉验证划分文件 |
| 许可证 | 学术研究专用(免费注册获取;仅限学术研究,禁止商业使用) |
| 访问级别 | 注册后开放(官网表单申请) |
| DUO 标签 | NPUNCU(非商业非营利);GRU(通用研究使用) |
| 语言 | 英语(文档与标注);数据本体为无声视频与数值时序 |
| 首发日期 | 2014(M2CAI–MICCAI Workshop 论文同年在官网发布) |
| 最后更新 | 2017-01(TBME 基准论文发布;此前 2015-03 更新完整 GRS 包) |
| 发布机构 | Johns Hopkins University CIRL Laboratory × Intuitive Surgical, Inc.(IRB 批准采集与发布) |
| 官方主页 | cirl.lcsr.jhu.edu/research/hmm/datasets/jigsaws_release |
| 下载地址 | 官网表单注册后获取(分任务 ZIP;问题反馈邮箱 jigsaws.cirl@gmail.com) |
| DOI | 10.1109/TBME.2016.2647680(基准论文 Ahmidi et al. 2017;数据集描述论文 Gao et al. 2014 为 Workshop 论文,无正式 DOI) |
| 引用次数 | 356+(Ahmidi et al. 2017,Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方提供标准化 LOSO/LOUO 划分与 C++/Matlab 工具包,但数据为原始 TXT/视频格式,无 Python 预处理脚本,视频-运动学对齐需自行验证(扣分项) |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(机器人手术技能评估临床语境、OSATS 量表体系)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。JIGSAWS 要求用户在官网完成免费注册表单获取数据,且明确限定仅限学术研究用途、禁止商业使用。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? JIGSAWS(JHU-ISI Gesture and Skill Assessment Working Set)是约翰霍普金斯大学 CIRL 实验室与手术机器人巨头 Intuitive Surgical 在 IRB 批准的研究中合作采集的公开数据集:8 名技能水平各异的外科医生(自报新手/中间/专家三档)在台式模型上完成缝合、打结、穿针 3 项基础手术任务,每项任务重复 5 次,共 103 段试验。每段试验同时记录了达芬奇手术系统机械臂的 76 维运动学数据(30 Hz)、内窥镜立体视频(640×480,30 Hz)以及外科专家给出的逐帧手势标注和技能评分。
为什么重要? 手术技能评估传统上依赖有经验的外科医生观看手术录像打分(OSATS 量表),主观、昂贵、无法规模化。JIGSAWS 首次把"医生做了什么"(手势序列)与"医生做得好不好"(技能评分)在同一套数据中配齐,并提供了统一的交叉验证协议,让"自动手术技能评估"和"手术手势识别"成为可复现、可比较的 AI 基准问题——它自 2014 年发布以来一直是该领域引用最广的标准数据集。
我能用它做什么? 典型用途包括:训练时序模型自动把手术视频/运动学切分并识别为 15 类原子手势(手势分割);预测每段试验的技能等级或 OSATS 分数(技能评估);融合视频与运动学做多模态学习;用语法约束 HMM 等方法建模手术动作的时序规律;以及开发针对特定手势段的训练反馈系统。
§1.1 技术摘要
JIGSAWS 的每段试验是一个多模态、逐帧对齐的时间序列:76 维运动学来自达芬奇系统 Research API 的 4 个控制器(左/右主手 Left/Right Master 与左/右从手 PSM),每个控制器记录位置(3 维)、旋转矩阵(9 维)、线速度(3 维)、角速度(3 维)与夹爪角度(1 维)共 19 个参数,采样率 30 Hz;视频来自内窥镜立体相机(640×480 @ 30 Hz)。人工标注含两层:一是 15 类原子手势(G1-G15)的逐帧转写,三个任务各使用其子集(Suturing 10 类、Needle-Passing 8 类、Knot-Tying 6 类);二是技能标签,包括自报水平(Novice/Intermediate/Expert,按机器人使用小时数划分)与修正版 OSATS 全局评分(GRS,6 个条目各 1-5 分)。官方随数据发布标准化交叉验证协议(LOSO 5 折与 LOUO 8 折)及 C++/Matlab 工具包(语法约束 HMM、稀疏 HMM、多核学习视频分析)。数据通过官网表单免费注册获取,仅限学术用途(官方页)。
§1.2 战略价值
维度一:手术技能评估自动化(AQA)的奠基基准。 外科培训中技能评价的"金标准"是 OSATS 等结构化量表,但人工评分瓶颈明显。JIGSAWS 把评分与原始多模态数据配对,使得"AI 当考官"成为可量化研究问题:从早期 HMM 运动学建模(Ahmidi et al. 2017, IEEE TBME)到基于手势段的技能归因分析(Fard et al. 2018, ICRA 的 impact score 可指出"哪一段手势拖累了得分"),再到近年视频-语言基础模型评测,均以 JIGSAWS 为标准试验场。这一方向直接对应手术培训耗材与考官工时的真实成本。
维度二:手术行为时序建模的公共参照系。 在 JIGSAWS 之前,手术活动识别研究各自使用私有数据与自定义指标,论文间不可比。JIGSAWS 提供统一手势词汇表(G1-G15)、统一划分(LOSO/LOUO)与统一指标(Accuracy/Edit Score/F1@IoU),促成了 TCN(Lea et al. 2017, ICCV)、RNN(DiPietro et al. 2016, MICCAI)、图神经网络(Yi et al. 2021, ICRA)等方法谱系的横向对比,其"共享数据集 + 共享协议"的组织模式后来被 M2CAI 挑战赛与 Cholec80 等后续基准继承。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 JIGSAWS 的差异 |
|---|---|---|---|---|
| JIGSAWS | 103 段试验、8 名受试者、3 任务(台式模型) | 76 维运动学 @ 30 Hz + 立体视频 640×480 @ 30 Hz | 15 类手势逐帧标注;SP + 修正 OSATS 评分 | 唯一同时具备高维机器人运动学 + 手术视频 + 技能评分三件套的公开数据集 |
| RARP-45 | 36 段标注视频(60 FPS) | 手术室真实机器人前列腺切除术视频 | 7 类手势;总时长 10,526 秒 | 真实手术环境但无运动学、无技能评分;任务更长(平均 292.4 秒)(Zhang et al. 2024 Table 8) |
| Cholec80 | 80 台腹腔镜胆囊切除术视频 | 2D 腹腔镜视频 @ 25 FPS | 7 个手术阶段(P1-P7)逐帧阶段标注 | 面向手术阶段(phase)识别而非细粒度手势;无运动学数据(Sarikaya et al. 2026) |
| 50 Salads | 50 段烹饪活动(多传感器) | RGB-D + IMU(双臂) | 细粒度/粗粒度双层活动标注 | 非手术域,但同为细粒度时序动作分割基准,常用于方法泛化对照(Lea et al. 2017) |
§1.4 版本时间轴
| 时间 | 事件 | 来源 |
|---|---|---|
| 2014 | 数据集随 Gao et al. 论文在 M2CAI–MICCAI Workshop 发布,官网开放注册下载 | 官方页 |
| 2015-03-24 | 下载包更新,加入完整 GRS 评分 | 官方页公告 |
| 2016-02-06 | 官网公告下载脚本故障,提供邮件索取替代链接渠道 | 官方页公告 |
| 2016-03-25 | 三个任务的示例视频开放下载 | 官方页公告 |
| 2017-01-04 | TBME 基准论文(Ahmidi et al.)预印本发布,确立标准评测协议 | 官方页公告 |
| 2017-09 | Ahmidi et al. 正式刊出于 IEEE TBME 64(9):2025-2041 | PubMed 28060703 |
§1.5 典型应用场景
- 手术手势分割与识别:输入视频或运动学序列,输出逐帧手势标签与段边界(核心基准任务,官方协议 + Edit Score 评测)。
- 自动手术技能评估:预测试验的自报水平(三分类)或 GRS/OSATS 分数(回归),用于模拟训练中心的自动化考核。
- 可解释技能反馈:基于手势段的 impact score 分析定位"拉低得分"的动作片段,指导针对性训练(Fard et al. 2018)。
- 多模态融合研究:视频外观 + 机器人运动学的互补建模(如 MRG-Net 的图学习融合,Yi et al. 2021)。
- 手术动作语法与运动建模:利用各任务手势子集与转移规律(官方工具包内置语法约束 HMM)研究手术动作的层级结构。
§2 医学背景
§2.1 ICD-11 映射
JIGSAWS 是技能训练类数据集而非疾病数据集:所有试验在台式模型(bench-top model)上完成,无患者、无病灶、无诊断标签。因此本页 ICD-11 映射为"不适用",并给出技术性说明:
| 维度 | ICD-11 映射 | 说明 |
|---|---|---|
| 疾病诊断编码 | 不适用 | 数据集不含患者与诊断信息;ICD-11 MMS 章节按疾病与损伤组织,无对应条目 |
| 手术操作编码 | 不适用(ICD-11 MMS 不含操作分类) | ICD-11 与 ICD-10-CM 不同,MMS 仅编码诊断;手术操作需各国自有分类(如中国 ICD-9-CM-3)或扩展编码体系承载 |
| 相关临床场景 | 机器人辅助微创手术培训(da Vinci 系统模拟训练课程的标准组成任务) | 缝合、打结、穿针是"大多数外科技能培训课程的标准组成部分"(官方页) |
§2.1b SNOMED CT 映射
| 标签/概念 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 数据主题(手术操作) | 不适用 | 387713003 | Surgical procedure (procedure),手术操作 |
| 数据场景(手术技能训练评估) | 不适用 | 建议经 SNOMED CT 浏览器检索 “assessment of procedure / surgical skill” 概念族获取适用编码 | 数据集粒度过细,官方未提供 SNOMED 映射 |
§2.2 临床与培训背景
机器人辅助微创手术(RMIS)以达芬奇系统为代表,自 2000 年代起快速普及,但其操作手感与腹腔镜及开放手术显著不同,操作者需要专门的技能习得曲线。手术技能评估长期依赖结构化量表:OSATS(Objective Structured Assessment of Technical Skill,客观结构化技术技能评估)由 Martin 等于 1997 年提出,要求考官按多个条目对操作录像打分(Ahmidi et al. 2017 引文)。JIGSAWS 采用其修正版:6 个条目(组织尊重、缝针操作、时间与动作、手术流畅性、总体表现、最终产品质量)各 1-5 分(1=Very poor,3=Competent,5=Clearly Superior),构成全局评分量表 GRS(官方数据说明 PDF)。自动化技能评估(Automated Surgical Skill Assessment, AQA)的目标是用机器学习替代或辅助这一人工评分过程,其意义在于:评分标准化、反馈即时化、以及可对动作片段级归因(哪一段手势做得不好)。
§2.3 临床任务定义
| 任务类型 | 定义 | 在 JIGSAWS 中的形式 |
|---|---|---|
| 手势分割与识别(识别型) | 将连续手术流切分为原子动作段并赋予类别标签;手势是"完成手术中一个可清晰辨识的小步骤"的最小有意图动作单元 | 15 类手势 G1-G15 的逐帧标注;三任务分别使用 10/8/6 类子集(Ahmidi et al. 2017) |
| 技能评估(分级型) | 预测操作者技能等级或量表得分 | 三分类(Novice/Intermediate/Expert,自报水平)或 6 项 GRS 分数(回归/序数分类) |
| 动作归因(解释型) | 定位影响技能得分的动作片段 | 以手势段为单位的 impact score 分析(Fard et al. 2018) |
§2.3b 手势词汇表(G1-G15)
官方 15 类手势词汇表(由 JHU 外科教师团队定义,各任务使用其子集,Ahmidi et al. 2017):
| 编号 | 英文描述 | 中文释义 | 出现任务 |
|---|---|---|---|
| G1 | Reaching for the needle with right hand | 右手取针 | 三任务均有 |
| G2 | Positioning the tip of the needle | 摆放针尖位置 | Suturing / Needle-Passing |
| G3 | Pushing needle through tissue | 推针过组织 | Suturing / Needle-Passing |
| G4 | Transferring needle from left to right | 针从左手交到右手 | Suturing / Needle-Passing |
| G5 | Moving to center of workspace with needle in grip | 持针移向工作区中心 | Suturing / Needle-Passing |
| G6 | Pulling suture with left hand | 左手拉线 | Suturing / Needle-Passing |
| G7 | Pulling suture with right hand | 右手拉线 | 仅 Needle-Passing(Suturing 子集明确排除 G7) |
| G8 | Orienting needle | 调整针的姿态 | Suturing / Needle-Passing |
| G9 | Using right hand to help tighten suture | 右手辅助收紧缝线 | Suturing / Needle-Passing |
| G10 | Loosening more suture | 继续放松缝线 | Suturing / Needle-Passing |
| G11 | Dropping suture and moving to end points | 放线并移至端点 | 三任务均有 |
| G12 | Reaching for needle with left hand | 左手取针 | 仅 Knot-Tying |
| G13 | Making C loop around right hand | 绕右手成 C 环 | 仅 Knot-Tying |
| G14 | Reaching for suture with right hand | 右手取线 | 仅 Knot-Tying |
| G15 | Pulling suture with both hands | 双手拉线 | 仅 Knot-Tying |
各任务子集为:Suturing = G1-G11(除 G7,10 类);Needle-Passing = G1-G6 + G8 + G11(8 类);Knot-Tying = G1 + G11-G15(6 类)。个别手势文本在不同文献中存在措辞差异(如 G14),建模时应以官方转写文件中的编号为准(见坑点 7)。
§2.4 受试者人群
| 维度 | 描述 |
|---|---|
| 受试者构成 | 8 名外科医生(受试者编号 B-I),非患者;操作对象为台式模型 |
| 技能分组(自报) | Novice(机器人使用 <10 小时):B, G, H, I;Intermediate(10-100 小时):C, F;Expert(>100 小时):D, E(Ahmidi et al. 2017、Fotouhi et al. 2019) |
| 采集场景 | 实验室环境,台式模型上的模拟手术任务;IRB 批准的研究 |
| 地域与机构 | 美国马里兰州巴尔的摩,约翰霍普金斯大学;数据由 JHU 与 Intuitive Surgical, Inc.(Sunnyvale, CA)合作采集 |
| 患者数据 | 无。视频为内窥镜台式模型画面,不含患者组织与受试者面部 |
§2.5 临床价值
对培训体系而言,JIGSAWS 支撑的研究指向三个可落地的价值点:其一,考核规模化——自动评分可覆盖模拟训练中心的高频低风险考核场景,缓解考官瓶颈;其二,反馈精细化——手势段级归因把"总分 18/30"变成"第 3 针推针动作(G3)影响组织尊重分",学员可针对性练习(Fard et al. 2018 的任务高亮可视化);其三,动作质量研究——76 维运动学提供了器械层面的客观运动学描述(位置、速度、夹爪角),可用于研究专家与新手的运动差异及学习曲线。需要注意,JIGSAWS 的台式模拟任务与真实手术室存在差距,上述结论迁移到真实手术前需外部验证(见 §7.3)。
§2.6 金标准对照
| 评估对象 | 划分方式 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| 手势段(G1-G15) | 逐帧标注(每个时间点一个手势) | 人工转写(原子手术活动段标签) | JHU 外科教师团队定义词汇表并标注 | 时序分段金标准 |
| 技能等级(SP) | 每受试者一档 | 自报机器人使用小时数三档划分(<10 / 10-100 / >100 小时) | 受试者本人 | 弱金标准(自报,见 §7.1) |
| 技能得分(GRS) | 每试验一组分数 | 修正版 OSATS 6 条目 × 1-5 分(1=Very poor / 3=Competent / 5=Clearly Superior) | 评分者依 GRS 量表评定 | 量表金标准(参考 OSATS 体系效度) |
§3 数据集规格
§3.0 版本与获取途径抉择矩阵
JIGSAWS 无"多版本"概念(单一版本,2014 首发后更新过完整 GRS 包),但存在多条获取途径,按下表选择:
| 你的需求 | 推荐途径 | 大小 | 理由 |
|---|---|---|---|
| 正式研究、发表论文 | 官方表单注册下载 | 分任务 ZIP(官方未公布总量) | 唯一合规来源;可获知数据勘误;引用要求明确 |
| 快速原型验证(仅运动学/标注) | 官方分数据类型 ZIP(仅勾选 kinematics + transcriptions) | 较小(分区下载机制) | 免下载全量视频即可跑通运动学基准 |
| 教学演示、探索性实验 | Kaggle 社区镜像(约 136.23 MB,Version 1,16.3k 文件) | 约 136.23 MB | 即开即用;注意其 CC0 标注为上传者所加,正式研究仍以官方许可为准(Kaggle 镜像) |
| 国内网络环境 | OpenDataLab 镜像 | 以镜像站为准 | 访问便利;许可与学术用途限制仍以官方协议为准(OpenDataLab) |
§3.1 模态详情
运动学(kinematics):来自达芬奇手术系统 Research API(v4.1)的全量 192 值的子集,共 76 维 = 4 个控制器 × 19 参数,30 Hz 采样。4 个控制器为 Right Master、Left Master(外科医生手部主手)与 Right PSM1、Left PSM2(患者侧机械臂),每个控制器的 19 参数依次为:笛卡尔位置 3 维、旋转矩阵 9 维、线速度 3 维、角速度 3 维、夹爪角度 1 维(运动学字段布局综述、Fotouhi et al. 2019 Table 2)。PSM 字段中工具尖位置、旋转矩阵、线/角速度与夹爪角度的列序有官方布局表可查(见 §4.1)。
视频(video):内窥镜立体视频,640×480 @ 30 Hz,三个任务的示例视频在官网开放下载(官方页、视频规格)。
人工标注(annotations):两类——(1) 手势转写(transcription):15 类手势的逐帧段标签;(2) 技能(skill):自报水平 + 修正 OSATS/GRS 全局评分(官方页)。
实验设置(experimental setup):标准化交叉验证划分文件(LOSO/LOUO)与 C++/Matlab 工具包(语法约束 HMM、稀疏 HMM、多核学习 LDS+BoF 视频分析)(官方 PDF §2)。
§3.2 子集与样本数
| 子集 | 试验数 | 使用手势 | 说明 |
|---|---|---|---|
| Suturing(缝合) | 39 | G1-G11 除 G7(10 类) | 样本最多、社区最常报告的任务 |
| Knot-Tying(打结) | 36 | G1 + G11-G15(6 类) | 平均时长较长 |
| Needle-Passing(穿针) | 28 | G1-G6 + G8 + G11(8 类) | 样本最少;社区报告存在个别无标注组合 |
| 合计 | 103 | 15 类词汇表 | 平均时长 92.1 秒;总时长 9,488 秒 |
试验数 39/36/28(AQA 综述),说明 8×5=40 的满额配置在个别任务中存在缺试;各任务手势子集划分以 TBME 官方论文为准(Ahmidi et al. 2017)。
§3.3 数据格式
| 组件 | 格式 | 说明 |
|---|---|---|
| 运动学 | TXT(制表符分隔,无表头) | 每行一个 30 Hz 采样点,76 列浮点值 |
| 手势转写 | TXT(制表符分隔) | 每行一个手势段:起始帧、结束帧、手势编号(及描述性字段,依版本而定) |
| 技能评分 | META 文件 | 每任务一份:受试者自报水平 + 6 项 GRS 评分 |
| 视频 | 视频文件(立体,左右眼) | 640×480 @ 30 Hz;分任务 ZIP 提供 |
| 实验设置 | 划分文件 + C++/Matlab 代码 | LOSO 5 折与 LOUO 8 折的 Train/Test 划分;官方建模工具包 |
| 分发 | ZIP(分区下载) | 按任务与数据类型自由组合下载(官方 PDF §4.2) |
§3.4 存储与规模
官方未公布全库总字节数,可用的客观规模度量:103 段试验、总视频时长 9,488 秒、平均时长 92.1 秒(Zhang et al. 2024 Table 8);Kaggle 社区镜像(16,300 文件)约 136.23 MB,可作为"运动学 + 标注"量级的近似参考(不含全量原始视频,Kaggle)。规划磁盘时建议按"运动学 + 标注百 MB 级、含全量视频数 GB 级"预留,以下载时官方 ZIP 页显示为准。
§3.5 标注方式
| 标注类型 | 方式 | 说明 |
|---|---|---|
| 手势转写 | 人工逐帧标注 | 每个时间数据点(视频与运动学)被赋予单一手势标签;手势定义由 JHU 外科教师团队制定(Ahmidi et al. 2017) |
| 技能(SP) | 自报 | 按机器人操作经验小时数分三档;与表现可能不一致(见 §7.1 偏倚表) |
| 技能(GRS) | 人工量表评分 | 修正 OSATS 6 条目 × 1-5 分;2015-03 起随下载包提供完整 GRS(官方页公告) |
§3.6 标注者资质与一致性
手势词汇表与标注由约翰霍普金斯大学的外科教师(faculty surgeons)团队完成,技能评分依 OSATS 体系由量表评定产生(Ahmidi et al. 2017)。官方文档未公布标注者间一致性系数(如 Cohen’s kappa),这是复现时需要知悉的标注质量信息缺口。
§3.7 采集周期
数据集于 2014 年随官网发布(官网资源路径含 2014-09 时间戳),采集在发布前于 JHU 完成的 IRB 批准研究中进行;官方未公布逐试验采集日期(官方页)。
§3.8 地域覆盖
单一中心:美国马里兰州巴尔的摩,约翰霍普金斯大学(JHU CIRL 实验室),与 Intuitive Surgical, Inc.(Sunnyvale, CA)合作(官方页)。
§3.9 设备规格
| 项目 | 规格 |
|---|---|
| 手术平台 | da Vinci Surgical System(dVSS,Intuitive Surgical) |
| 运动学来源 | Research API(v4.1)输出 192 值,JIGSAWS 采用其 76 维子集 |
| 运动学控制器 | Right Master / Left Master(主手)+ Right PSM1 / Left PSM2(从手) |
| 运动学采样率 | 30 Hz |
| 视频源 | 内窥镜立体相机,640×480 @ 30 Hz |
| 采集对象 | 台式模型(bench-top model)上的模拟缝合/打结/穿针 |
§3.10 深度溯源链
| 层级 | 内容 | 依据 |
|---|---|---|
| 原始信号 | 达芬奇系统操作日志(主手/从手笛卡尔运动) | Research API 采集 |
| 数据加工 | API 192 值 → 76 维子集;内窥镜立体视频录制 | 数据集论文与字段布局表 |
| 人工标注 | 外科教师定义 15 类手势 → 逐帧转写;GRS 量表评分 | TBME 论文 |
| 发布分发 | 官网表单注册 → 分任务 ZIP → 学术使用 | 官方页 |
| 基准确立 | 2017 TBME 论文固化 LOSO/LOUO 协议与 6 方法基准 | TBME 64(9):2025-2041 |
§4 数据结构
§4.0 目录树
按任务下载并解压后的典型目录结构(以官方 zip 布局与 Kaggle 镜像目录为准):
JIGSAWS/
├── Suturing/
│ ├── kinematics/
│ │ └── AllGestures/
│ │ ├── Suturing_B001.txt # 76 列运动学,tab 分隔,30 Hz
│ │ ├── Suturing_C001.txt
│ │ └── ... # 命名规则:任务_受试者字母+试验号
│ ├── video/
│ │ └── Suturing_B001*.avi # 立体内窥镜视频(左右眼文件,命名以 zip 内为准)
│ ├── transcriptions/
│ │ └── Suturing_B001.txt # 逐帧手势转写
│ └── meta_file_Suturing # 自报水平 + 6 项 GRS
├── Knot_Tying/ # 结构同上(36 段)
├── Needle_Passing/ # 结构同上(28 段)
└── Experimental_setup/ # 官方 LOSO/LOUO 划分文件与工具包
试验命名规则:[任务]_[受试者字母][0][重复序号],如 Suturing_B001 为受试者 B 的第 1 次重复;受试者字母 B-I 对应 8 名外科医生。
转写文件(transcriptions)内容为制表符分隔的段表,每行一个手势段(起始帧、结束帧、手势编号;部分版本含描述列):
# Suturing_B001 转写示例(帧号基于 30 Hz 帧序)
155 423 1 Reaching for needle with right hand
424 476 2 Positioning needle
477 553 3 Pushing needle through tissue
...
§4.1 DAIMS 字段字典
核心字段(运动学 76 列按 4 控制器块依次排列,块内 19 参数 = 位置 3 + 旋转矩阵 9 + 线速度 3 + 角速度 3 + 夹爪角 1):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 列 0-18 | float×19 | Right Master(右主手)块 | 0.0421, -0.58, … | 主手运动建模 | API 量化误差 | 无缺失 | 连续 |
| 列 19-37 | float×19 | Left Master(左主手)块 | -0.11, 0.33, … | 双手协同分析 | API 量化误差 | 无缺失 | 连续 |
| 列 38-56 | float×19 | Right PSM1(右从手)块;含右工具尖位置/旋转/速度/夹爪角 | 59.4, 50.1, -3.2 | 手势识别主特征 | 器械形变/标定误差 | 无缺失 | 连续 |
| 列 57-75 | float×19 | Left PSM2(左从手)块 | 68.2, 47.7, … | 双器械交互 | 同上 | 无缺失 | 连续 |
| 转写 start/end | int | 手势段起止帧号(30 Hz 帧序) | 155 / 312 | 分割标签边界 | 标注边界模糊 ±数帧 | — | 0-视频帧数 |
| 转写 gesture | int | 手势编号(G1-G15) | 3(Pushing needle through tissue) | 分类标签 | 类别不平衡 | — | 1-15(按任务子集) |
| meta SP | str | 自报技能档 | Expert | 技能分类标签 | 自报偏倚 | — | Novice/Intermediate/Expert |
| meta GRS | int×6 | 修正 OSATS 6 条目评分 | 4,3,5,4,4,3 | 技能回归标签 | 评分者间差异未公布 | — | 1-5(合计 6-30) |
| meta GRS 合计 | int | 6 条目求和;社区分级阈值 Novice 0-9 / Intermediate 10-19 / Expert 20-30 | 23 | 三分类标签 | 同上 | — | 6-30 |
字段布局与 PSM 列序详见 Fotouhi et al. 2019 Table 2 与官方数据说明(JIGSAWS PDF);GRS 分级阈值见 AQA 综述。
§4.2 标签分布
手势标签呈长尾不平衡:高频手势(如 G1 伸手取针、G3 推针过组织)几乎出现在每段试验中,而低频手势(如 G10 松线)仅在少数任务/试验中出现;Suturing 使用 10 类、Needle-Passing 8 类、Knot-Tying 6 类,全库统一 15 类建模时部分类在任务内不可见。技能标签分布为 Novice 4 人 / Intermediate 2 人 / Expert 2 人(受试者 B,G,H,I / C,F / D,E),GRS 合计分跨度 6-30。社区实践中常见两种处理:按任务分别建模(类数小、分布相对均衡),或全库 15 类并配合类别加权损失(见坑点 3)。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 试验总数 | 103 | AQA 综述 |
| 视频总时长 | 9,488 秒 | Zhang et al. 2024 Table 8 |
| 平均试验时长 | 92.1 秒 | 同上 |
| 运动学维度 × 采样率 | 76 维 @ 30 Hz | Fotouhi et al. 2019 |
| 手势词汇 | 15 类(各任务 10/8/6 子集) | Ahmidi et al. 2017 |
| 受试者技能构成 | Novice 4 / Intermediate 2 / Expert 2 | 同 §2.4 |
| 基准参考精度(Suturing, LOUO) | 早期方法约 80%;MRG-Net 87.9±4.2% | PubMed、Yi et al. 2021 |
§4.4 数据层级
数据层级为四级树:受试者(B-I,8 名外科医生)→ 任务(Suturing / Knot-Tying / Needle-Passing)→ 重复试验(每任务 5 次,trial id 唯一)→ 帧(30 Hz 对齐的运动学行 / 视频帧 / 手势标签)。试验是分析的最小分发单元;帧是标注与建模的最小单元;技能标签挂载在受试者(SP)与试验(GRS)两级。
§4.5 缺失值与信息性缺失
运动学矩阵本身无缺失值(Research API 连续记录)。两类"类缺失"现象需要警惕:其一,标注覆盖不均——社区研究报告个别受试者在个别任务无手势标注(如 subject 6 在 Needle-Passing 无标注,UCL CRAS018 报告),跨任务合并建模时应对齐可用标注再入模;其二,短段疑似误标注——官方手势转写中存在时长不足 15 帧(约 0.5 秒)的段,研究者认为部分属于"动作循环未完成"的误标注,常见做法是剔除(Gammulle et al. 2019)。数据集未定义信息性缺失编码,上述规则均来自社区共识而非官方约定。
§5 划分与使用建议
§5.1 官方划分
官方随数据发布两套标准化交叉验证设置(Experimental_setup 目录):
| 协议 | 折数 | 留出对象 | 考察目标 |
|---|---|---|---|
| LOSO(Leave-One-Supertrial-Out,留一超级试验) | 5 折 | 所有受试者的第 i 次重复试验 | 对"已知医生的新一次操作"的泛化 |
| LOUO(Leave-One-User-Out,留一用户) | 8 折 | 单个受试者的全部试验 | 对"全新医生"的泛化 |
两协议定义与评测细节见 TBME 官方论文(Ahmidi et al. 2017);LOUO 8 折用法示例见 Liu et al. 2018。注意:官方每折仅提供 Train/Test 文件,不含独立 Validation split(见坑点 2)。
§5.2 社区惯例
社区论文绝大多数以 Suturing + LOUO 作为主报告设置(样本最多、手势最多、竞争最充分),Knot-Tying 次之,Needle-Passing 较少被单独报告;全库 15 类联合建模与分任务子集建模两种口径并存,引用他人数字时务必核对任务与协议口径(见 §8.1 不可比性说明)。
§5.3 泄漏风险与划分策略建议
- LOSO 的用户级泄漏:LOSO 每折都包含全部 8 名受试者的 4 次重复,模型可学到个人运动风格;因此 LOSO 分数系统性高于 LOUO,两者不可混报。若目标是"新医生可用",必须以 LOUO 为主指标。
- 同受试者重复试验相似性:同一医生的 5 次重复在轨迹上高度相似,任何把同一受试者同任务试验分入训练与测试的自定义划分都会高估性能;自定义划分至少保证受试者级隔离(GroupShuffleSplit 按试验编号的受试者字母分组)。
- 归一化统计量泄漏:对运动学做 z-score 时,均值/方差必须只在训练折上估计;跨折复用全局统计量是隐形泄漏。
- 技能评估任务的受试者级标签:SP 是受试者级常量标签,LOUO 下测试折的标签分布与训练折重叠有限,报告宏平均与逐折结果(±std)是惯例(Yi et al. 2021 报告 mean±std)。
§5.4 交叉验证建议
推荐主流程:LOUO 8 折逐折训练 + 每折从 Train 内再切一个随机 trial 做 Validation(保证无 trial 跨集合重叠,该做法见 Gammulle et al. 2019)→ 报告 8 折 mean±std 的帧级 Accuracy、Edit Score 与 F1@IoU;LOSO 作为补充协议报告,并显式标注协议名。复现历史基线时优先使用官方 Experimental_setup 的划分文件而非自行重切,避免折间差异。
§5.5 外部验证建议
JIGSAWS 为实验室台式模拟场景,向真实手术泛化是公认缺口(见 §7.3、§7.8)。建议路径:以 JIGSAWS 预训练手势分割模型 → 在 RARP-45(手术室真实机器人前列腺切除术视频,60 FPS、7 类手势)上微调评估(结构对比见 Zhang et al. 2024 Table 8);技能评估方向可对照 Cholec80 的手术阶段标签做跨任务迁移研究。任何"跨平台/跨中心可用"的结论均需此类外部数据支撑。
§6 AI 就绪指南
§6.0 云端快速启动
JIGSAWS 无官方托管 Notebook。云端快速路径:Kaggle Datasets 已有社区镜像(aditya9790/jigsaws-skill-assessment-working-set,约 136.23 MB,含运动学与标注目录),可在 Kaggle Notebook 中零下载验证数据管线;正式实验仍应回官方表单申请全量数据(含立体视频)。Google Colab 用户可将官方 ZIP 上传 Drive 后按 §6.1 结构解压。
§6.1 快速上手
代码前的结构约定:
# 目录结构预期(data_root = JIGSAWS 解压根目录):
# data_root/
# ├── Suturing/
# │ ├── kinematics/AllGestures/Suturing_B001.txt # 76 列运动学,tab 分隔,30 Hz,无表头
# │ └── transcriptions/Suturing_B001.txt # 手势段转写(起始帧 结束帧 手势号)
# data_root 拼接关系:f"{data_root}/{task}/kinematics/AllGestures/{task}_{trial}.txt"
# 最小可用子集:单任务 kinematics + transcriptions 即可跑通运动学手势分割管线
import pandas as pd
DATA_ROOT = "JIGSAWS" # 解压根目录
task, trial = "Suturing", "B001"
# 1) 读运动学:76 列、制表符分隔、无表头、30 Hz
kin = pd.read_csv(
f"{DATA_ROOT}/{task}/kinematics/AllGestures/{task}_{trial}.txt",
sep=r"\s+", header=None,
)
assert kin.shape[1] == 76, f"期望 76 列,实际 {kin.shape[1]}"
# 2) 读手势转写:每行 = 起始帧 结束帧 手势编号(部分版本含描述列)
tr = pd.read_csv(
f"{DATA_ROOT}/{task}/transcriptions/{task}_{trial}.txt",
sep=r"\s+", header=None,
)
tr.columns = ["start", "end", "gesture", "desc"][: tr.shape[1]]
# 3) 展开为逐帧标签(与运动学逐帧对齐)
frame_label = pd.Series(-1, index=range(len(kin)), dtype=int)
for _, row in tr.iterrows():
frame_label.loc[row["start"]: row["end"] - 1] = int(row["gesture"])
print(kin.shape, tr["gesture"].nunique(), "类手势",
(frame_label == -1).mean().round(4), "未标注帧占比")
§6.2 数据获取
获取流程(申请制,免费):
| 步骤 | 操作 | 说明 |
|---|---|---|
| 1 | 打开官方发布页 | 含数据介绍、公告与示例视频 |
| 2 | 填写下载表单(提供有效邮箱) | 注册目的:便于官方在数据勘误时通知研究者(官方 PDF §4.1) |
| 3 | 按任务/数据类型勾选 ZIP 下载 | 支持分区下载(Partitioned downloads) |
| 4 | 学术发表时引用两篇论文 | Gao et al. 2014(数据集描述)+ Ahmidi et al. 2017(基准结果) |
| 反馈渠道 | jigsaws.cirl@gmail.com | 官方曾出现下载脚本故障并以邮件渠道发放替代链接 |
许可要点:仅限学术研究用途,禁止商业使用(官方页明确声明);无标准开源许可证文本,引用与传播以官方协议为准。
# 表单审批通过后(或收到官方邮件链接),下载并解压示例:
unzip "Suturing.zip" -d JIGSAWS/
unzip "Knot_Tying.zip" -d JIGSAWS/
unzip "Needle_Passing.zip" -d JIGSAWS/
unzip "Experimental_Setup.zip" -d JIGSAWS/
§6.3 预处理全流程
import numpy as np
import pandas as pd
# ============================================================
# 步骤 1:读取 + 运动学子集选择(76 维全量包含强共线的旋转矩阵 9 列,
# 与可能损害性能的夹爪角通道;社区常用子集见 §6.5 坑点 4)
# ============================================================
KIN_COLS = {
"position": 3, "rotation": 9, "linvel": 3, "angvel": 3, "gripper": 1,
} # 每控制器块内 19 参数布局
CONTROLLERS = ["RMaster", "LMaster", "RPSM1", "LPSM2"] # 块顺序以官方 README 为准
def load_kinematics(data_root: str, task: str, trial: str) -> np.ndarray:
path = f"{data_root}/{task}/kinematics/AllGestures/{task}_{trial}.txt"
return pd.read_csv(path, sep=r"\s+", header=None).to_numpy(np.float32) # (T, 76)
def select_cols(kin: np.ndarray, controller: str = "RPSM1",
features: tuple = ("position", "linvel", "gripper")) -> np.ndarray:
"""抽取某控制器块的指定特征列:块内偏移 = 前序特征列数累加。"""
offsets, cur = {}, 0
for name, width in KIN_COLS.items():
offsets[name] = cur
cur += width
idx = np.concatenate([
np.arange(offsets[f], offsets[f] + KIN_COLS[f]) for f in features
])
base = CONTROLLERS.index(controller) * 19
return kin[:, base + idx]
# ============================================================
# 步骤 2:逐帧标签展开 + 短段清洗(<15 帧疑似误标注,见坑点 3)
# ============================================================
def load_frame_labels(data_root: str, task: str, trial: str,
min_frames: int = 15) -> np.ndarray:
path = f"{data_root}/{task}/transcriptions/{task}_{trial}.txt"
tr = pd.read_csv(path, sep=r"\s+", header=None)
tr.columns = ["start", "end", "gesture", "desc"][: tr.shape[1]]
tr = tr[(tr["end"] - tr["start"]) >= min_frames] # 清洗短段
T = len(load_kinematics(data_root, task, trial))
y = np.full(T, -1, dtype=np.int64)
for _, r in tr.iterrows():
y[r["start"]: r["end"]] = int(r["gesture"])
return y
# ============================================================
# 步骤 3:标准化(关键:统计量只在训练折估计,防泄漏,见 §5.3)
# ============================================================
class FoldScaler:
def fit(self, X: np.ndarray):
self.mu = X.mean(axis=0, keepdims=True)
self.sd = X.std(axis=0, keepdims=True) + 1e-8
return self
def transform(self, X: np.ndarray) -> np.ndarray:
return (X - self.mu) / self.sd
# ============================================================
# 步骤 4:滑窗样本化(用于片段分类;端到端分割可直接整段输入 TCN)
# ============================================================
def sliding_window(X: np.ndarray, y: np.ndarray, win: int = 64, stride: int = 16):
Xs, ys = [], []
for i in range(0, len(X) - win + 1, stride):
Xs.append(X[i:i + win])
seg = y[i:i + win]
ys.append(np.bincount(seg[seg >= 0]).argmax()
if (seg >= 0).any() else -1)
return np.stack(Xs), np.array(ys)
清洗与增强要点:短段剔除阈值 15 帧来自社区对误标注段的观察(Gammulle et al. 2019);标准化前先做列筛选可显著降噪(见坑点 4)。
§6.4 PyTorch DataLoader
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
class JIGSAWSTrialDataset(Dataset):
"""逐试验读取的运动学手势分割数据集。
目录预期:data_root/{task}/kinematics/AllGestures/{task}_{trial}.txt
data_root/{task}/transcriptions/{task}_{trial}.txt
"""
def __init__(self, data_root: str, task: str, trials,
feature_cols=None, scaler=None, min_frames: int = 15):
self.samples = []
for trial in trials:
kin = load_kinematics(data_root, task, trial)
y = load_frame_labels(data_root, task, trial, min_frames)
if feature_cols is not None: # 列子集(见坑点 4)
kin = kin[:, feature_cols]
if scaler is not None: # 折内 scaler,防泄漏
kin = scaler.transform(kin)
self.samples.append(
(torch.from_numpy(kin).float(),
torch.from_numpy(y).long()))
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
return self.samples[idx] # 返回 (X[T,F], y[T])
def collate_keep_varlen(batch):
"""变长序列打包:帧级分割模型通常逐序列训练或经 bucketing 后训练。"""
xs, ys = zip(*batch)
return list(xs), list(ys)
# 示例:LOUO 第 1 折(留出受试者 B 的全部试验做测试)
trials = [f"{s}{r:03d}" for s in "BCDEFGHI" for r in range(1, 6)]
train_trials = [t for t in trials if not t.startswith("B")]
test_trials = [t for t in trials if t.startswith("B")]
scaler = FoldScaler().fit(
np.concatenate([load_kinematics("JIGSAWS", "Suturing", t) for t in train_trials]))
train_set = JIGSAWSTrialDataset("JIGSAWS", "Suturing", train_trials,
feature_cols=list(range(76)), scaler=scaler)
test_set = JIGSAWSTrialDataset("JIGSAWS", "Suturing", test_trials,
feature_cols=list(range(76)), scaler=scaler)
train_loader = DataLoader(train_set, batch_size=1, shuffle=True,
collate_fn=collate_keep_varlen)
test_loader = DataLoader(test_set, batch_size=1, shuffle=False,
collate_fn=collate_keep_varlen)
§6.5 坑点清单(8 个真实失败模式)
⚠️ 坑点 1:LOSO 与 LOUO 两种官方协议混用,论文数字不可直接比较(分类:评估误用)
问题:官方提供 LOSO(5 折,留出第 i 次重复)与 LOUO(8 折,留出单个受试者)两套划分;LOSO 测试折包含训练折出现过的医生,分数系统性偏高。不同论文采用不同协议(甚至只写 “cross-validation”),跨论文对比会得出错误结论。
症状:自己复现的数字比论文低 5-15 个百分点却查不出代码 bug;或综述引用时把 LOSO 80% 与 LOUO 70% 当同一口径排序。
解决:
- 简单方法:每处引用数字前核对原文协议名;在实验记录与论文表格中显式写出协议列。
- 进阶方法:两套协议都跑,主表用 LOUO(考察新医生泛化)、附表用 LOSO,并说明差异来自用户级泄漏。
- SOTA 方法:按 Ahmidi et al. 2017, IEEE TBME 的方式同时报告 Micro/Macro/Precision 与跨折方差,用 Beta 分布拟合刻画泛化稳定性。
⚠️ 坑点 2:官方 Experimental_setup 只有 Train/Test,没有 Validation split(分类:数据泄漏)
问题:官方划分文件每折仅含训练与测试清单。直接在 Test 折上反复调参/选 checkpoint,等于用测试集做模型选择,产生乐观偏差。
症状:报告分数很好但换随机种子或换实现即大幅波动;审稿人质疑"如何在训练中早停"。
解决:
- 简单方法:从每折 Train 中随机留出一个 trial 作 Validation(保证同一 trial 不跨集合),用其做早停与超参选择。
- 进阶方法:在 Train 内做 K 折内部交叉验证选超参,再以选定超参在官方 Train/Test 划分上训练一次报告 Test。
- SOTA 方法:固定超参只调一次并公开配置与种子;报告 8 折 mean±std 而非最佳折,Gammulle et al. 2019 给出了从 Train 再切 Validation 的标准做法。
⚠️ 坑点 3:手势类别长尾不平衡 + 短段疑似误标注(分类:标签理解)
问题:15 类手势分布长尾(部分手势在任务内极少出现);转写中存在不足 15 帧(约 0.5 秒)的段,研究者认为部分属于动作循环未完成的误标注。直接训练会让高频类主导损失、并让边界错误学习噪声。
症状:总体 Accuracy 虚高(被高频类抬升)但低频类召回接近 0;训练损失在个别超短段上反复震荡。
解决:
- 简单方法:剔除不足 15 帧的段;按类频率给损失加权(weighted cross-entropy,Liu et al. 2018 即因"数据高度不平衡"采用该损失)。
- 进阶方法:除 Accuracy 外强制报告 Macro 指标与逐类混淆矩阵;对 <15 帧段做剔除敏感性分析(剔除 vs 保留各跑一遍)。
- SOTA 方法:分段级评测(Edit Score/F1@IoU)替代纯帧级指标;用类平衡采样或 focal 类损失;采用 Ahmidi et al. 2017 的 Micro/Macro 双口径。
⚠️ 坑点 4:76 维运动学并非全都有用——旋转矩阵共线与夹爪角陷阱(分类:预处理陷阱)
问题:76 列中每控制器含 9 列旋转矩阵(正交约束导致强共线)与夹爪角;有研究报告加入夹爪角反而降低手势分类性能(改用去掉主/从手夹爪角后的 72 变量),另有大量工作只选位置/速度子集。
症状:全 76 维输入训练收敛慢、过拟合重;特征重要性分析中旋转矩阵列呈近似冗余组。
解决:
- 简单方法:默认子集 = 每控制器 {位置 3 + 线速度 3 + 夹爪角 1}(TCN 论文口径)或去掉夹爪角的位置+速度组合。
- 进阶方法:把旋转矩阵转为更紧凑的姿态表示(如四元数或对数映射)后再入模;做逐块消融确定有效列。
- SOTA 方法:多模态模型(如 MRG-Net)用图结构显式建模 4 控制器间关系,让模型自己学列间耦合(Yi et al. 2021)。
⚠️ 坑点 5:申请制下载的现实摩擦——表单等待、故障公告与镜像许可(分类:工程陷阱)
问题:数据不提供公开直链,必须经官网表单注册获取;官网曾公告下载脚本故障(2016-02-06),需邮件向 jigsaws.cirl@gmail.com 索取替代链接;Kaggle/OpenDataLab 镜像存在但其许可标注(如 Kaggle 页面 CC0)为上传者所加,不代表官方授权。
症状:CI 里突然拉不到数据;论文用镜像数据被质疑许可合规;镜像缺视频或目录结构与官方不一致导致脚本报错。
解决:
- 简单方法:尽早提交表单并把下载与校验脚本化;出现故障时发邮件索取替代链接。
- 进阶方法:正式实验只用官方 ZIP;镜像仅用于原型,代码中显式声明数据来源与许可依据。
- SOTA 方法:内部建立数据包校验清单(文件数、列数 76、试验数 39/36/28 三重断言),入库前自动核对。
参考:官方页公告与许可声明;Kaggle 镜像。
⚠️ 坑点 6:视频与运动学的逐帧对齐需要自行验证(分类:工程陷阱)
问题:视频与运动学同为 30 Hz,但两者帧序的零点与总长在个别试验上可能存在错位;端到端视频-运动学融合模型若默认第 1 帧严格对齐,融合特征会系统性漂移。数据集未提供官方对齐文件。
症状:融合模型不如单模态;可视化对照时手势边界在视频与标签间偏移数帧;消融显示"多模态增益为负"。
解决:
- 简单方法:以转写的段边界在视频上的可见动作(如 G3 推针)做抽查,确认偏移量并统一裁剪。
- 进阶方法:对每段试验以运动学速度峰(进针时刻)与视频光流峰做互相关,估计并校正全局帧偏移。
- SOTA 方法:训练时对视频分支做小幅时间抖动增强以吸收残余偏移;先在运动学上预训练再冻结对齐(Yi et al. 2021 的双流融合可作为融合基线)。
参考:Gammulle et al. 2019(视频 30 Hz 预处理口径);Zhang et al. 2024(帧率对比)。
⚠️ 坑点 7:手势词汇是任务相关的子集,跨任务合并建模要小心标签空间(分类:标签理解)
问题:15 类词汇表是全集,但 Suturing 只用 G1-G11(除 G7)10 类、Needle-Passing 用 8 类、Knot-Tying 用 6 类;部分手势描述高度相近(如 G6/G7 仅差左右手),且个别手势文本在不同文献中存在版本差异(如 G14 的描述)。全库统一 15 类建模会让"任务内不可见的类"成为永久空类,直接套用多任务输出头会引入无意义的约束。
症状:混淆矩阵出现整行/整列恒 0 的类;把 G14 的另一种描述当成新类导致标签数对不上;多任务模型在任务子类上训练不收敛。
解决:
- 简单方法:按任务分别建模,标签空间取该任务官方子集(以 TBME 论文为准)。
- 进阶方法:全库建模时用掩码把每任务不可见类从损失与解码中排除;手势 ID 一律以官方转写文件数值为准、文本描述仅作展示。
- SOTA 方法:共享底层编码器 + 任务专用输出头,配合语法约束(官方工具包的 grammar-constrained HMM 思路)禁止非法转移。
⚠️ 坑点 8:8 人小样本 → LOUO 折间方差极大,单次跑分不可信(分类:评估误用)
问题:只有 8 名受试者,LOUO 每折测试集风格各异(4 个 novice / 2 个 intermediate / 2 个 expert),社区 SOTA 的标准差达 ±4-6 个百分点;跑单折或单种子就下结论,结论大概率不可复现。
症状:两次相同配置实验分数差 5+ 个百分点;调参"收益"其实是折间噪声;论文 A/B 对比方向在不同种子下翻转。
解决:
- 简单方法:完整跑满 8 折并报告 mean±std;关键结论用多随机种子重复(≥3 次)取均值。
- 进阶方法:对折级分数做配对检验或按技能组分层分析(novice/expert 折的分化常远大于均值差异)。
- SOTA 方法:报告逐折明细与 Beta 分布泛化拟合(Ahmidi et al. 2017 的评测方法论),与社区 mean±std 口径(Yi et al. 2021)对齐。
§6.6 数据增强
| 策略 | 是否安全 | 说明 |
|---|---|---|
| 时间伸缩/时间抖动(小幅) | ✅ | 手段时长天然可变;注意与标签边界同步变换 |
| 运动学高斯抖动(小幅 σ) | ✅ | 模拟 API 噪声;σ 建议小于传感精度量级 |
| 空间随机小旋转/平移(刚体变换) | ✅ | 手术操作姿态天然多样;同步变换位置/旋转/速度列 |
| 时间倒置 | ❌ | 破坏手术动作语法(手势转移有方向性),物理不成立 |
| 大幅时间加速/减速 | ❌ | 技能本身部分体现在时间结构上,会破坏技能标签语义 |
| 跨受试者轨迹拼接 | ❌ | 制造不存在的双手/双器械交互序列,污染交互建模 |
| 帧级视频色彩强抖动 | ⚠️ | 内窥镜色调具有组织状态线索,强色彩扰动可能改变语义 |
§6.7 模型推荐
| 模型族 | 代表 | 输入 | 适用任务 | 备注 |
|---|---|---|---|---|
| 语法约束 HMM | 官方工具包 | 运动学 | 手势分割 | 经典基线;利用任务语法约束解码 |
| TCN | Lea et al. 2017, ICCV | 视频/运动学 | 分割+分类 | 社区最常用骨架之一 |
| RNN/LSTM/GRU | DiPietro et al. 2016, MICCAI | 运动学/视频 | 分割+分类 | 双向变体是强基线 |
| 强化学习策略 | Liu et al. 2018 | 视频特征+运动学 | 分割 | 改善段级 Edit Score |
| 图学习多模态 | Yi et al. 2021, ICRA | 视频+运动学 | 分割 | 视觉-运动学关系建模,当前高精度代表之一 |
| 技能评估框架 | Fard et al. 2018, ICRA | 运动学特征 | 技能回归+归因 | 手势段 impact score 可解释反馈 |
§6.8 硬件需求
| 配置 | 适用范围 | 说明 |
|---|---|---|
| CPU / 16 GB 内存 | 运动学全流程(HMM、LSTM 小模型) | 运动学管线数据量小(百 MB 级) |
| 1 × 8 GB GPU(如 T4) | 运动学深度模型、视频特征输入的 TCN | 单折训练分钟级-小时级 |
| 1 × 16-24 GB GPU(如 4090/A10) | 端到端视频模型、多模态融合 | 视频解码为显存瓶颈,建议离线抽帧/预提特征 |
| 磁盘 | ≥ 20 GB | 全量数据 + 预提特征缓存 |
社区经验参考:Gammulle et al. 2019 在单卡 Titan X 上完成视频管线训练(300 epoch 约数小时量级)。
§6.9 评估指标代码
import numpy as np
def frame_accuracy(y_true: np.ndarray, y_pred: np.ndarray) -> float:
"""帧级 Accuracy(仅统计有标注帧)。"""
mask = y_true >= 0
return float((y_true[mask] == y_pred[mask]).mean())
def edit_score(y_true: np.ndarray, y_pred: np.ndarray) -> float:
"""Edit Score:预测段序列与真值段序列的归一化 Levenshtein 距离 ×100。"""
def segments(y):
segs, prev = [], None
for v in y:
if v != prev:
segs.append(v)
prev = v
return segs
a, b = segments(y_true), segments(y_pred)
dp = np.zeros((len(a) + 1, len(b) + 1), dtype=int)
for i in range(len(a) + 1):
dp[i][0] = i
for j in range(len(b) + 1):
dp[0][j] = j
for i in range(1, len(a) + 1):
for j in range(1, len(b) + 1):
dp[i][j] = min(dp[i - 1][j] + 1, dp[i][j - 1] + 1,
dp[i - 1][j - 1] + (a[i - 1] != b[j - 1]))
return 100.0 * (1 - dp[-1][-1] / max(len(a), len(b)))
指标定义依据:Edit Score 为归一化 Levenshtein 距离(0-100,越高越好),F1@IoU 按段级 IoU 阈值判定真/伪段后取调和平均(Liu et al. 2018、Yi et al. 2021)。
§6.10 MLOps 笔记
- 数据版本化:数据无官方版本号,内部以"下载日期 + ZIP 校验和"建立版本标签;勘误依赖官方邮件通知,注册邮箱应长期有效。
- 协议即配置:把 LOSO/LOUO、任务、手势子集(10/8/6 类)写进实验配置而非代码,杜绝口径漂移(坑点 1/7)。
- 评测工件:每次评测落盘逐折分数、混淆矩阵与段级预测(供 Edit Score 复算),审稿复现一致性靠它。
- 基线锚定:新模型先对齐官方 HMM 工具包与 TCN 基线(约 80% 量级)再谈增益;偏离社区 mean±std 口径的结果先自查协议。
- 许可合规流水线:发表物出稿前检查数据引用(Gao 2014 + Ahmidi 2017)与学术用途声明。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 样本量偏倚 | 仅 8 名受试者、103 段试验,模型方差大(LOUO ±4-6%) | 高 | 报告 mean±std 与逐折明细;避免单折结论(Yi et al. 2021) |
| 自报技能偏倚 | SP 依赖受试者自报使用小时数,可能与实际表现不一致 | 中 | 优先使用 GRS 量表分数做监督;分析 SP 与 GRS 分歧样本 |
| 类别不平衡偏倚 | 手势长尾分布,高频类主导总体指标 | 中 | Macro 指标 + 类加权损失(坑点 3) |
| 模拟-真实差距 | 台式模型、实验室环境、无真实组织与患者风险 | 高 | 向 RARP-45 等真实手术数据集迁移验证(§7.8) |
| 单中心/单平台偏倚 | 单一 JHU 中心、单一 da Vinci 平台 | 中 | 结论限定适用范围;跨平台研究需新数据 |
| 标注一致性未知 | 官方未公布标注者间一致性系数 | 低-中 | 敏感性分析:对边界做 ±数帧扰动评估指标稳定性 |
§7.2 标注质量
手势词汇由 JHU 外科教师团队定义并逐帧标注,规范清晰(每时间点唯一标签、每任务官方子集明确);技能标注双轨(SP 自报 + GRS 量表),其中 GRS 属 OSATS 效度体系支撑的量表型金标准。已知的标注质量瑕疵集中在两处:个别超短段疑似误标注(坑点 3)与个别受试者-任务组合缺标注(§4.5);官方未提供标注者间一致性数字(§3.6)。
§7.3 泛化性评估
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 新医生(未在训练集)的手势识别 | 中-高:个人运动风格差异 | LOUO 分数普遍低于 LOSO;TBME 结论"跨不同外科医生的一致预测仍有显著进步空间"(Ahmidi et al. 2017) |
| 真实手术室环境 | 高:光照、出血、器械遮挡、组织变形 | JIGSAWS 为台式模型场景;RARP-45 等真实数据集的 60 FPS/手术室背景差异(Zhang et al. 2024 Table 8) |
| 新手术类型/新术式 | 高:手势词汇与语法任务相关 | 各任务手势子集不同;RARP-45 手势集与 JIGSAWS 仅部分对应 |
| 跨机器人平台 | 高:运动学字段布局与坐标系随平台变化 | 76 维布局绑定 da Vinci Research API 字段(Fotouhi et al. 2019) |
§7.4 伦理
数据采集与发布均经约翰霍普金斯大学 IRB 批准;受试者为外科医生(成年人),录制内容为台式模型操作,不含患者组织、患者信息与受试者面部,受试者以字母(B-I)匿名。使用时仍应遵守官方学术用途限制(官方页)。衍生研究若将技能评估推向对医生个人的绩效评价,需另行考虑劳动评价伦理与隐私影响。
§7.5 公平性
官方未公布受试者人口统计学信息(性别、年资背景、左右利手等),8 人样本也无法支撑亚群分析;技能三档人数为 4/2/2,档间样本严重不均衡。面向公平性的结论(如"模型对不同背景医生同样准确")在该数据集上不可检验,论文中应避免此类外推。
§7.6 数据漂移
数据集为静态快照(2014 首发后无数据层更新),不存在在线漂移问题,但存在基准时代漂移:da Vinci 平台迭代、术式演进与视频/语言基础模型兴起使"在 JIGSAWS 上得分"与"可部署到今日手术流"的距离扩大;RARP-45(60 FPS、手术室环境)等新基准在帧率与环境上更接近现代手术流(Zhang et al. 2024 Table 8)。JIGSAWS 的当代定位是方法学与协议参照系,而非部署验证场。
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 每试验一个 76 列 × T 行的时间序列矩阵 |
| 2 | 唯一标识 | ✅ | trial id(任务_受试者字母+序号)全局唯一 |
| 3 | 特殊字符 | ⚠️ | 制表符分隔且无表头,读入需显式指定分隔符与列名 |
| 4 | 重复行 | ✅ | 无重复试验/重复帧记录 |
| 5 | 缺失编码 | ✅ | 运动学与转写无缺失值 |
| 6 | 标签标识 | ✅ | 手势编号与官方 G1-G15 词汇表一一对应 |
| 7 | 罕见类分组 | ⚠️ | 长尾手势类别需加权/宏平均处理 |
| 8 | 偏倚评估 | ✅ | §7.1 给出 6 项偏倚及缓解 |
| 9 | 数据字典 | ⚠️ | 官方文档简略,76 列布局需结合论文还原(§4.1) |
| 10 | 信息性缺失解释 | ❌ | 缺标注组合(如个别受试者 NP 无标注)无官方编码说明 |
| 11 | 设备记录 | ✅ | 平台/控制器/采样率/分辨率完整(§3.9) |
| 12 | 共线性 | ❌ | 旋转矩阵 9 列强共线,需特征变换或子集选择(坑点 4) |
| 13 | 编码映射 | ✅ | 手势子集与技能档位均有官方定义可映射 |
| 14 | 时间戳处理 | ⚠️ | 以 30 Hz 帧号计时,无绝对时间戳;跨试验时间分析需自行换算 |
| 15 | 划分建议 | ✅ | 官方 LOSO/LOUO 划分文件直接可用(§5.1) |
| 16 | 泄漏讨论 | ✅ | §5.3 给出用户级泄漏与归一化泄漏清单 |
| 17 | 标签分布 | ✅ | §4.2 说明类别与技能标签分布 |
| 18 | 测量偏倚 | ⚠️ | SP 为自报测量,存在报告偏倚 |
| 19 | 外部验证建议 | ✅ | §5.5/§7.8 给出迁移路径 |
| 20 | 版本记录 | ⚠️ | 无官方版本号;仅公告时间轴可考(§1.4) |
| 21 | 预处理脚本 | ⚠️ | 官方工具包为 C++/Matlab,无现代 Python 脚本;本页 §6.3 提供可运行管线 |
| 22 | 合规要求 | ✅ | 表单注册 + 学术用途限制明确(§6.2) |
| 23 | 多模态对齐 | ⚠️ | 视频-运动学无官方对齐文件,需自行验证(坑点 6) |
| 24 | 去标识化 | ✅ | 受试者字母化匿名,无患者数据与 PHI |
DAIMS 评分:18.0 / 24
评分解读:14 项 ✅、8 项 ⚠️、2 项 ❌。JIGSAWS 在标识唯一性、官方划分、设备记录与去标识化上表现优秀——这是其能成为领域基准的结构性原因。⚠️ 集中在"文档代差"(无表头、无版本号、无现代脚本)与"标注体系缺口"(自报偏倚、一致性未知);两项 ❌(信息性缺失编码、旋转矩阵共线性)都是使用者需要主动管理的分析层问题,而非数据不可用。
对你意味着什么:如果你要 (1) 做手势分割/技能评估方法研究——数据可直接开工,但必须走官方划分并在论文中写明协议(LOSO/LOUO)与 mean±std 口径;(2) 做工程化系统——先按 §6.3 建立 76 列布局断言与列子集流程,绕开旋转矩阵共线与夹爪角陷阱;(3) 做跨环境部署——把 JIGSAWS 当预训练/方法验证集,用 RARP-45 等真实场景数据完成外部验证再谈临床可用;(4) 做数据治理审查——本页 DAIMS 表与坑点清单可作为尽调材料,注意许可为学术专用、无标准开源协议文本。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| RARP-45(真实机器人前列腺切除术视频) | 与 JIGSAWS 不同中心 | 手势/步骤识别迁移 | 帧级准确率(按手势) | 未报告统一口径;两库结构差异显著(30 vs 60 FPS,实验室 vs 手术室) | JIGSAWS 30 FPS/103 段 vs RARP-45 60 FPS/36 段、7 类手势、平均时长 292.4 秒;跨库迁移需处理帧率与标签空间差异(Zhang et al. 2024 Table 8) |
| Cholec80(腹腔镜胆囊切除术阶段) | Strasbourg 大学医院 | 手术阶段识别(不同任务) | 阶段级指标 | 任务不同,不构成直接对比 | JIGSAWS 手势与 Cholec80 阶段属不同粒度;有工作将 JIGSAWS 手势描述纳入文本 grounding 以泛化(Sarikaya et al. 2026) |
§8 基准性能与生态
§8.1 排行榜(手势分割,Suturing,LOUO)
| 排名 | 模型 | Accuracy (%) | Edit Score | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|---|
| 1 | MRG-Net | 87.9 ± 4.2 | 89.3 ± 5.2 | 2021 | 视频+运动学图关系学习 | Yi, L., Wang, G., Liu, X., He, J., Liu, H., Ye, X., Yang, F., 2021, IEEE ICRA. arXiv:2011.01619 | 未公开仓库 |
| 2 | APc(多任务 RNN) | 85.5 | 85.3 | 2016 | 多任务 RNN 联合分割分类 | DiPietro, R., Lea, C., Malpani, A., Ahmidi, N., Vidal, R., Hager, G.D., 2016, MICCAI | — |
| 3 | Bidir LSTM | 83.3 ± 5.7 | 81.1 | 2016 | 双向 LSTM | DiPietro, R. et al., 2016, MICCAI(同上论文的双向变体) | — |
| 4 | TCN(视频) | 81.4 | 83.1 | 2017 | 时序卷积网络 | Lea, C., Flynn, M.D., Vidal, R., Reiter, A., Hager, G.D., 2017, ICCV. arXiv:1611.05267 | — |
| 5 | TCN(运动学) | 79.6 | 85.8 | 2017 | 时序卷积网络 | 同上 | — |
不可比性说明:上表为同协议(Suturing + LOUO)下可直接对比的节选(指标引自 Yi et al. 2021 Table I);文献中还存在更宽口径的结果——官方 TBME 基准 6 类技术(HMM、稀疏 HMM、MSM-CRF、skip-chain CRF、BoF、LDS)在 LOSO 与 LOUO 下总体约 80% 精度(Ahmidi et al. 2017);后续工作(如校准 MS-TCN)在 Suturing 上报告 89.8% Accuracy / 91.5 Edit Score,但训练细节与协议微调使跨论文严格可比性下降(CMS-TCN)。强化学习策略分割(Liu et al. 2018)以少量精度换取更高的段级 Edit/F1 分数。引用任何数字前先核对:任务 × 协议 × 指标三要素。
Knot-Tying 参考成绩(LOUO,选摘自 Yi et al. 2021 Table II):
| 模型 | 输入 | Accuracy (%) | Edit Score |
|---|---|---|---|
| SC-CRF | 运动学 | 78.9 | 未报告 |
| BoF | 视频 | 86.5 | 未报告 |
| MsM-CRF | 视频+运动学 | 77.3 | 未报告 |
| MRG-Net | 视频+运动学 | 88.1 ± 3.8 | 87.0 ± 6.8 |
Knot-Tying 任务上传统多模态方法(MsM-CRF)若无充分的视觉-运动学信息融合,甚至可能低于单模态方法;这正是 MRG-Net 显式关系建模的价值所在(Yi et al. 2021)。
§8.2 SOTA 总结与选型建议
当前高精度区间:运动学或视频单模态约 80-85%,多模态融合 87-89%(Suturing, LOUO)。选型建议:追求稳定可复现 → TCN/双向 LSTM 骨架 + 官方划分;追求上限 → 多模态关系建模(MRG-Net 思路);重视段级质量(机器人现场可用性)→ 优化 Edit Score/F1 而非纯帧级 Accuracy;技能评估任务 → 先分手势再段级归因的解释性路线(Fard et al. 2018)。
§8.3 评测协议
| 协议要素 | 约定 |
|---|---|
| 划分 | 官方 LOSO(5 折)/ LOUO(8 折)划分文件 |
| 指标 | 帧级 Accuracy(Micro/Macro)、Edit Score(归一化 Levenshtein ×100)、F1@IoU;技能任务用分类准确率或分数相关系数 |
| 报告口径 | 8 折 mean±std;附逐折明细 |
| 语义边界 | 仅统计有标注帧;短段处理需声明(剔除与否) |
| 公平比较 | 声明输入模态(运动学/视频/多模态)与特征是否预提取 |
§8.4 相关数据集
| 数据集 | 域 | 模态 | 标注 | 适用 |
|---|---|---|---|---|
| JIGSAWS | 机器人手术(台式) | 运动学 + 立体视频 | 手势 + 技能 | 手势分割、技能评估、多模态 |
| RARP-45 | 机器人手术(手术室) | 视频 60 FPS | 7 类手势 | 真实环境泛化 |
| Cholec80 | 腹腔镜手术 | 2D 视频 25 FPS | 7 阶段 | 手术阶段识别 |
| 50 Salads | 烹饪活动 | RGB-D + IMU | 双粒度活动 | 方法泛化对照 |
§8.5 关键论文 Top 7
- Gao, Y. et al., 2014, M2CAI–MICCAI Workshop. 数据集定义论文:任务设计、三组件构成、手势词汇与技能评分体系。
- Ahmidi, N. et al., 2017, IEEE Transactions on Biomedical Engineering 64(9):2025-2041. DOI 10.1109/TBME.2016.2647680. 基准论文:固化 LOSO/LOUO 协议,6 类技术系统对比(总体约 80% 精度),指出跨医生一致预测仍是开放问题。
- Lea, C. et al., 2017, ICCV. arXiv:1611.05267. TCN:时序卷积网络成为手术/日常活动分割的标准骨架之一。
- DiPietro, R. et al., 2016, MICCAI. arXiv:1606.06329. RNN 系手术活动识别:双向 LSTM/GRU 与多任务联合学习基线。
- Liu, Y. et al., 2018. arXiv:1806.08089. 强化学习驱动的手势分割:以段级 Edit/F1 为导向的策略优化。
- Yi, L. et al., 2021, IEEE ICRA. arXiv:2011.01619. MRG-Net:视频-运动学嵌入的图关系学习,多模态高精度代表。
- Fard, M.J. et al., 2018, IEEE ICRA. arXiv:1712.08604. 自动技能评估与段级归因:impact score 给出可解释训练反馈。
§8.6 社区活跃度
- 引用体量:基准论文 Ahmidi et al. 2017 Google Scholar 引用 356+(截至 2026-09),Scopus 收录 230(PlumX);数据集论文 Gao et al. 2014 为领域通行引用。
- 官方维护:官网持续挂出出版物列表(Google Scholar 链接)与示例视频;数据层 2014 后无内容更新,维护以勘误通知为主(官方页)。
- 镜像生态:Kaggle 镜像约 128 次下载、1,379 次浏览(截至 2026-09,Kaggle);OpenDataLab 提供国内访问镜像。
- 挑战赛谱系:JIGSAWS 的协议设计直接影响了后续 M2CAI 系列挑战与手术视频基准的组织方式。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| 官方发布页 | 官网 | cirl.lcsr.jhu.edu/…jigsaws_release | — | 唯一合规获取渠道,含公告与示例视频 |
| 官方数据说明 PDF | 文档 | JIGSAWS.pdf | — | 字段、评分体系、工具包与获取流程的一手描述 |
| TBME 基准论文(PMC 全文) | 论文 | PMC5559351 | — | 协议与各任务手势子集的权威出处 |
| Kaggle 社区镜像 | 镜像 | Kaggle | — | 零下载快速验证管线(许可以官方为准) |
| OpenDataLab 镜像 | 镜像 | OpenDataLab/JIGSAWS | — | 国内网络便利访问 |
| MRG-Net 论文 | 论文 | arXiv:2011.01619 | — | 当前多模态高精度方法与完整对比表 |
§9 相关资源与引用
§9.1 官方资源
- 官方发布页(数据介绍、公告、示例视频、表单入口):cirl.lcsr.jhu.edu/research/hmm/datasets/jigsaws_release
- 官方数据说明文档:JIGSAWS.pdf
- 官方工具包:C++/Matlab(语法约束 HMM、稀疏 HMM、多核学习 LDS+BoF),随 Experimental_setup 包分发
- 问题反馈与替代链接索取:jigsaws.cirl@gmail.com
- 相关项目:JHU 语言手术项目(The Language of Surgery)与 CIRL 实验室主页(见官方页链接区)
§9.2 社区资源
- TBME 基准论文全文(PMC):PMC5559351
- 论文方法实现参考:TCN(arXiv:1611.05267)、MRG-Net(arXiv:2011.01619)
- 社区镜像:Kaggle、OpenDataLab(原型验证用;正式研究以官方数据为准)
§9.3 BibTeX 引用
@inproceedings{gao2014jigsaws,
title = {The JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS):
A Surgical Activity Dataset for Human Motion Modeling},
author = {Gao, Yixin and Vedula, S. Swaroop and Reiley, Carol E. and
Ahmidi, Narges and Varadarajan, Balakrishnan and Lin, Henry C. and
Tao, Lingling and Zappella, Luca and B{\'e}jar, Benjam{\'i}n and
Yuh, David D. and Chen, Chi Chiung Grace and Vidal, Ren{\'e} and
Khudanpur, Sanjeev and Hager, Gregory D.},
booktitle = {Modeling and Monitoring of Computer Assisted Interventions
(M2CAI) - MICCAI Workshop},
year = {2014}
}
@article{ahmidi2017dataset,
title = {A Dataset and Benchmarks for Segmentation and Recognition of
Gestures in Robotic Surgery},
author = {Ahmidi, Narges and Tao, Lingling and Sefati, Shahin and
Gao, Yixin and Lea, Colin and Haro, Benjamin B{\'e}jar and
Zappella, Luca and Khudanpur, Sanjeev and Vidal, Ren{\'e} and
Hager, Gregory D.},
journal = {IEEE Transactions on Biomedical Engineering},
volume = {64},
number = {9},
pages = {2025--2041},
year = {2017},
doi = {10.1109/TBME.2016.2647680}
}
@inproceedings{lea2017tcn,
title = {Temporal Convolutional Networks for Action Segmentation and Detection},
author = {Lea, Colin and Flynn, Michael D. and Vidal, Ren{\'e} and
Reiter, Austin and Hager, Gregory D.},
booktitle = {Proceedings of the IEEE International Conference on Computer Vision (ICCV)},
year = {2017},
note = {arXiv:1611.05267}
}
@inproceedings{dipietro2016recognizing,
title = {Recognizing Surgical Activities with Recurrent Neural Networks},
author = {DiPietro, Robert and Lea, Colin and Malpani, Anand and
Ahmidi, Narges and Vidal, Ren{\'e} and Hager, Gregory D.},
booktitle = {Medical Image Computing and Computer-Assisted Intervention (MICCAI)},
year = {2016},
note = {arXiv:1606.06329}
}
@article{liu2018deep,
title = {Deep Reinforcement Learning for Surgical Gesture Segmentation
and Classification},
author = {Liu, Yao and others},
journal = {arXiv preprint arXiv:1806.08089},
year = {2018}
}
@inproceedings{yi2021relational,
title = {Relational Graph Learning on Visual and Kinematics Embeddings
for Accurate Gesture Recognition in Robotic Surgery},
author = {Yi, Lin and Wang, Guodong and Liu, Xin and He, Jungong and
Liu, Hongbin and Ye, Xi and Yang, Fangde},
booktitle = {IEEE International Conference on Robotics and Automation (ICRA)},
year = {2021},
note = {arXiv:2011.01619}
}
§9.4 引用指南
使用 JIGSAWS 发表分析时,官方要求引用两篇核心论文:Gao et al. 2014(数据集描述)与 Ahmidi et al. 2017(对比结果基准);在此基础上按所用方法补引相应方法论文(TCN/RNN/MRG-Net 等)。报告结果时必须标注:任务(Suturing/Knot-Tying/Needle-Passing)、协议(LOSO/LOUO)、指标(Accuracy/Edit Score/F1@IoU)与模态(运动学/视频/多模态)四要素。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 提供方 |
|---|---|---|
| 大语言模型(CodeBuddy Code 集成模型) | 本页面的资料整理、结构化撰写与代码示例生成 | 腾讯云 |
§10.2 AI 参与范围
AI 负责检索证据汇总、章节起草、表格组织与代码示例编写;本页全部数字均回链至公开来源(FACTS 事实清单留档),医学语境、协议解读与免责声明结构由编辑部规范约束。终稿经编辑部人工审核流程后发布(见 §10.4)。
§10.3 输入来源列表
- JIGSAWS 官方发布页(JHU CIRL). https://cirl.lcsr.jhu.edu/research/hmm/datasets/jigsaws_release/
- JIGSAWS 官方数据说明 PDF. https://cirl.lcsr.jhu.edu/wp-content/uploads/dlm_uploads/2014/09/JIGSAWS.pdf
- Gao, Y. et al., 2014, M2CAI–MICCAI Workshop(数据集描述论文,经官方页引用)
- Ahmidi, N. et al., 2017, IEEE TBME 64(9):2025-2041. DOI 10.1109/TBME.2016.2647680. https://pubmed.ncbi.nlm.nih.gov/28060703/
- Ahmidi, N. et al., 2017(PMC 全文,手势词汇与协议出处). https://pmc.ncbi.nlm.nih.gov/articles/PMC5559351/pdf/nihms889842.pdf
- Lea, C. et al., 2017, ICCV(TCN). https://arxiv.org/abs/1611.05267
- DiPietro, R. et al., 2016, MICCAI(RNN). https://arxiv.org/abs/1606.06329
- Liu, Y. et al., 2018(强化学习分割). https://arxiv-vanity.com/papers/1806.08089
- Yi, L. et al., 2021, ICRA(MRG-Net,对比表). https://arxiv.org/abs/2011.01619
- Gammulle, H. et al., 2019(光流手势识别,视频规格与 Validation 处理). https://ar5iv.arxiv.org/html/1904.01143
- Fotouhi, M. et al., 2019(错误分析,运动学字段布局). https://arxiv.org/abs/2106.11962
- Zhang, W. et al., 2024(JIGSAWS 与 RARP-45 结构对比). https://arxiv.org/pdf/2403.19786.pdf
- 自动技能评估综述(试验数 39/36/28). https://ar5iv.arxiv.org/html/2502.02817
- Fard, M.J. et al., 2018, ICRA(技能归因). https://ar5iv.arxiv.org/html/1712.08604
- Sarikaya, D. et al., 2026(JIGSAWS/Cholec80 文本 grounding). https://ar5iv.labs.arxiv.org/html/2603.05732
- UCL CRAS018 报告(夹爪角消融与缺标注观察). https://discovery.ucl.ac.uk/10056615/1/CRAS018Extended_Abs_ebm.pdf
- 运动学字段布局综述(PMC7671974). https://pmc.ncbi.nlm.nih.gov/articles/PMC7671974/
- Kaggle 社区镜像页. https://www.kaggle.com/datasets/aditya9790/jigsaws-skill-assessment-working-set
- CMS-TCN 结果页. https://stage.prophy.ai/article/158917029-Temporal-Surgical-Gesture-Segmentation-and-Classification-in/
- PlumX 指标页(Ahmidi 2017 Scopus 引用). https://plu.mx/plum/a/MASygrd6HWizjINDZajQEg3m8AjrbKd-FU_kqxGM2_0
- OpenDataLab 镜像页. https://opendatalab.org.cn/OpenDataLab/JIGSAWS
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 字段 | 千方病案医学编辑部 | 逐字段核对官方页与 TBME 论文 | ✅ 已通过 |
| §2 医学背景与量表体系 | 千方病案医学编辑部 | 对照 OSATS/GRS 官方定义复核 | ✅ 已通过 |
| §3/§4 数据规格与字段字典 | 千方病案医学编辑部 | 对照官方 PDF 与字段布局论文复核 | ✅ 已通过 |
| §5 划分与泄漏分析 | 千方病案医学编辑部 | 对照 TBME 协议定义复核 | ✅ 已通过 |
| §6 代码与坑点 | 千方病案医学编辑部 | 代码走查 + 坑点证据溯源 | ✅ 已通过 |
| §7 DAIMS 与质量评估 | 千方病案医学编辑部 | 24 项逐条核对 | ✅ 已通过 |
| §8 基准数字 | 千方病案医学编辑部 | 逐项回链原始论文表格 | ✅ 已通过 |
| §9/§10 引用与声明 | 千方病案医学编辑部 | BibTeX 与来源列表核对 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页 §1-§10 正文与 §C JSON-LD 均由 AI 辅助起草,其中所有定量陈述(试验数、维度、协议定义、基准分数、引用数)均标注来源链接;坑点清单的失败模式取自官方公告、论文 limitations 与社区报告,非模板化生成。
§10.6 最后人工审核日期
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
§C JSON-LD 结构化数据
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- slam-3d-endoscopic — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- m2cai16-tool — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- multibypass140 — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- scared — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- hamlyn-datasets — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- c3vd — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- endoslam — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- cholec80 — 共享标签:手术视频 / 内窥镜影像
- misaw — 共享标签:医学影像 / 手术视频 / 内窥镜影像
- endovis-challenges — 共享标签:医学影像 / 手术视频 / 内窥镜影像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
