SAR-RARP50 — 机器人手术分割与动作识别基准 AI-Ready Wikipedia

50 段达芬奇 RARP 视频 · 16,250 帧分割与手势双模态标注

来源 University College London(UCL)· EndoVis 2022 SAR-RARP50 挑战组织委员会 url: https://rdr.ucl.ac.uk/projects/SAR-RARP50_Segmentation_of_surgical_instrumentation_and_Action_Recognition_on_Robot-Assisted_Radical_Prostatectomy_Challenge/191091发布时间: 2026-09-12最后更新: 2026-09-25 阅读 24
SAR-RARP50 — 机器人手术分割与动作识别基准 AI-Ready Wikipedia

信息速览

数据集名称SAR-RARP50 — 机器人手术分割与动作识别基准 AI-Ready Wikipedia
数据类型50 段达芬奇手术视频,16,250 帧分割标注 @1Hz,10Hz 八类手势序列标签,9 类器械部件 + 8 类手势,约 33.6 GB AVI/PNG/TXT,CC BY-NC-SA 开放下载
规模50 例 RARP 手术(每段视频来自独立患者)
接入方式University College London(UCL)· EndoVis 2022 SAR-RARP50 挑战组织委员会 url: https://rdr.ucl.ac.uk/projects/SAR-RARP50_Segmentation_of_surgical_instrumentation_and_Action_Recognition_on_Robot-Assisted_Radical_Prostatectomy_Challenge/191091
AI 就绪度

数据集封面

SAR-RARP50 — 机器人手术器械分割与动作识别双模态基准 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 SAR-RARP50
英文全称 SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge
别名/简称 EndoVis 2022 SAR-RARP50 Challenge;RARP50;SAR-RARP50 dataset
疾病分类(ICD-11) 2C82 — 前列腺恶性肿瘤(RARP 手术主要适应证)
SNOMED CT 399068003 — 前列腺恶性肿瘤(Malignant tumor of prostate)
数据模态 达芬奇 Si 体内内镜视频(左目 AVI)+ 9 类器械部件像素级分割掩码 + 8 类手势序列标签
AI 任务类型 语义分割、动作(手势)识别、多任务学习
样本总数 50 段手术视频(训练 40 / 测试 10);分割标注帧 12,998(训练)+ 3,252(测试)
数据大小 训练集约 26.9 GB + 测试集约 6.6 GB(压缩包合计约 33.6 GB)
数据格式 AVI 视频(逐段 zip)+ PNG 语义掩码(1920×1080)+ TXT 动作标签
许可证 CC BY-NC-SA 4.0(署名-非商业性使用-相同方式共享)
访问级别 开放(UCL 仓库直接下载,无需注册或申请审核)
DUO 标签 NCU(非商业使用)
语言 英语(文档与标注体系);视频无语音
首发日期 2022(EndoVis @ MICCAI 2022 挑战发布);2024-01-23(UCL Research Data Repository 公开存档)
最后更新 2024-01-23(train/test set v1)
发布机构 伦敦大学学院(UCL)与 EndoVis 2022 挑战组织委员会
官方主页 UCL RDR 项目页
下载地址 训练集 · 测试集
DOI 10.5522/04/24932529(训练集)· 10.5522/04/24932499(测试集)
引用次数 68+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方划分、官方预处理与评测工具包(rarptk)齐备;扣分:需自行解包抽帧完成 1Hz/10Hz 双采样对齐,测试集标注不公开
页面状态 published

§0 E-E-A-T 审核与可信声明

  • 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(前列腺癌与 RARP 临床语境)、§7 偏倚分析(单中心与术者资历结构)。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05
  • 事实来源边界:本页全部规模数字、许可信息与基准成绩均出自 §10.3 所列官方来源(挑战报告论文、UCL RDR/DataCite 元数据、官方 GitHub);检索日期 2026-09-12。官方未公布的信息(如逐例采集日期、术者-视频映射、标注者间一致性数值)在本页明确标注为"未公布"而非推测填充。
  • 更新约定:本页随官方数据集修订、工具包重大更新或引用数显著变化而更新;引用数等动态数据标注"截至"日期,读者引用时应回溯官方原始来源确认最新值。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SAR-RARP50 采用 CC BY-NC-SA 4.0 许可,从 UCL Research Data Repository 直接下载即可获取,无需提交申请;任何衍生数据集或模型产出须以相同许可共享且不得用于商业目的。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? SAR-RARP50 是由伦敦大学学院(UCL)团队为 MICCAI 2022 内镜视觉挑战(EndoVis)组织发布的体内手术视频数据集:50 段达芬奇机器人辅助前列腺癌根治术(RARP)中"背血管复合体(DVC)缝合"阶段的真实手术录像,每段视频同时带有两类人工标注——手术器械部件的像素级分割掩码(1Hz)和双手机械手势的动作序列标签(10Hz),全部免费公开下载。

为什么重要? 在它之前,手术动作识别研究长期依赖模拟训练场景的小数据集,器械分割则多在受控条件下采集,模型一接触真实手术视频(血液、烟雾、镜头污染、剧烈视野移动)性能就明显下降。SAR-RARP50 是首个同时公开"体内真实手术 + 双模态逐帧标注"的大规模数据集,让分割与动作识别两条研究线第一次能在同一批真实数据上训练、对比、融合。

我能用它做什么? 训练器械分割模型(9 类部件,如轴杆/腕部/夹钳/缝合针)、训练手术手势识别模型(拾针、进针、打结等 8 类)、做多任务学习(官方挑战的核心命题:两种标注互相促进还是互相拖累)、研究多采样率标注的时间对齐,以及为手术技能评估、术中导航等下游系统打基础。

§1.1 技术摘要

数据集由 UCL 转化外科与干预科学团队(Wellcome 资助的 WEISS 中心参与)组织,50 段视频全部使用达芬奇 Si 系统采集,来自伦敦大学学院医院(Westmoreland Street 院区)8 位不同资历外科医生(顾问、高年资与低年资住院医)的操作。原始 dVLogger 双目流以 60fps 1080i 分别录制,经去隔行与固定帧率重写后发布左目通道 AVI 视频。标注由专业标注服务 Humans In The Loop 按统一协议完成:帧以 1Hz 采样上传 Supervise.ly 平台逐像素标注 9 类器械部件,再由 2 名机器学习研究者全片复核修正;手势标签以 10Hz 帧列表 + 标签列表形式提供(arXiv:2401.00496)。

数据演进上,SAR-RARP50 是同团队 RARP45 数据集的超集:在 45 段视频基础上新增 5 段手术,并为全部 50 段视频新增 1Hz 器械分割掩码(动作标注继承自 RARP45 体系)。官方挑战设三个赛道——分割、动作识别、多任务——12 支队伍提交了 20 个方法;冠军 Uniandes 的多任务模型综合得分 0.824,其单任务分割得分 0.847、动作识别得分 0.804,与多任务版本几乎持平,这一"多任务无明显增益"的结论本身就是该基准最有价值的发现之一。

§1.2 战略价值

维度一:真实体内数据的稀缺性。 公开手术视频数据集大多来自体模、尸体或猪组织实验(如经典 EndoVis 2015/2017 器械分割序列),场景光照均匀、出血少、镜头干净。SAR-RARP50 的 50 段视频全部来自真实人体手术,官方论文明确指出其中包含"复杂解剖、动态镜头移动、多样且苛刻的光照条件、血液与遮挡"(arXiv:2401.00496)。这使它成为检验模型"真实手术鲁棒性"的高门槛基准:在体模数据上刷到 0.9+ mIoU 的模型,到 SAR-RARP50 上往往需要重新设计增广与训练策略。

维度二:双模态标注的科研杠杆。 同一视频同时具备"空间维"(每个像素属于哪种器械部件)与"时间维"(每一时刻双手在执行哪种手势)两类标注,天然支持三线研究:单任务各自刷高、多任务互相迁移、以及研究 1Hz/10Hz 双采样率标注的对齐与传播策略。官方挑战论文专门总结了参赛者处理双采样率的三种方案(复制传播、下采样、双速率并行训练),是后续多任务手术视频研究的标准引用点。

维度三:许可友好、获取零门槛。 数据以 CC BY-NC-SA 4.0 在 UCL 仓库直接开放下载(无需注册、无需签署协议、无需证明机构身份),对比同类手术数据集常见的"申请-审批-数周等待"流程,SAR-RARP50 是"当天拿到数据、当天跑通第一版训练"的少数选项之一;代价是非商业限制与相同方式共享条款,衍生数据集必须沿用同许可。

维度四:官方挑战资产的长期可复用性。 数据集不是孤立发布的:官方评测工具包(MIT 许可)、挑战报告论文(含全部参赛方法的逐视频成绩)与双 DOI 存档构成完整闭环。这意味着研究者在方法迭代中可以随时把新模型与 2022 年 12 支队伍的逐段成绩对表,而不必依赖"二手转述"的均值——在手术视频领域,这种长周期可回溯的公开基准并不常见。

§1.3 同类数据集横向对比

数据集 规模 模态/场景 标注类型 与 SAR-RARP50 的差异化
SAR-RARP50(本文) 50 段视频,12,998+3,252 分割帧 体内真实 RARP,达芬奇 Si,1920×1080 9 类器械部件分割(1Hz)+ 8 类手势(10Hz) 唯一"体内 + 双模态 + 双采样率"公开基准
RARP45(前身) 45 段视频 同一中心、同一术式 仅 10Hz 手势标签 SAR-RARP50 为其超集,新增 5 段与全量 1Hz 分割掩码
EndoVis 2017 器械分割子挑战 8 训练 + 2 测试短序列(225 训练帧) 体内前列腺切除但受控短序列 10 类部件分割 规模小一个数量级;SAR-RARP50 提供量级更大的训练帧
Cholec80 80 例胆囊切除术完整视频 体内腹腔镜(非机器人) 7 类手术阶段(1Hz 相位标注) 面向手术阶段/工作流分析;无像素级分割与手势标注
CholecSeg8k 8,080 帧 胆囊切除术抽帧 13 类全场景分割(器械+解剖) 分割类别含解剖结构,但为静态帧集合、无动作时序标注
AutoLaparo 21 例手术视频 体内腹腔镜子宫切除术 4 类手术阶段 同为"视频级时序"任务,无像素级器械标注

读表要点:SAR-RARP50 不是同类中"最大"的数据集(Cholec80 视频更多、CholecSeg8k 类别更多),而是唯一把"体内真实 + 双任务标注 + 多采样率"三个条件同时凑齐的公开集;如果你的研究只需要阶段识别,Cholec80 仍是更大的选择,只有当任务需要像素级器械理解或跨任务协同建模时,SAR-RARP50 才是不可替代的。

§1.4 版本时间轴

时间 版本/事件 说明
2022 EndoVis @ MICCAI 2022 挑战发布 SAR-RARP50 挑战赛道上线,训练集与测试视频发布给参赛者
2022-08 至 2022-10 官方评测工具包迭代 SAR_RARP50-evaluation 仓库(MIT 许可)持续修复评测脚本
2023-12-31 挑战报告论文 v1 arXiv:2401.00496 提交
2024-01-23 数据集正式公开存档 UCL RDR 发布 训练集 v1 与 测试集 v1,CC BY-NC-SA 4.0
2024-01-23 挑战报告论文 v2 论文更新(期刊标记:Medical Image Analysis)
2024-2026 社区复用持续 冠军团队开源 MATIS 等后续方法;SAR-RARP50 被手术技能评估、错误检测等下游工作再标注复用(如 SEDMamba 派生数据集)

版本提示:UCL RDR 存档为 v1(2024-01-23)且无后续修订记录;挑战期间(2022)发放给参赛队的数据与 2024 存档版的一致性由发布方保证,但无逐字节比对依据——引用数据规模时统一以 2024 存档版为准。

§1.5 典型应用场景

  1. 器械部件分割基线研究:9 类部件中"轴杆/腕部/夹钳"构成器械三分结构,适合评估部件级细粒度分割能力(如 UNet++、DeepLabV3+、Transformer 分割头)。落地提示:先在 480×640 输入上跑通,再评估全分辨率的必要性——挑战队经验显示中分辨率 + 强增广的性价比更高。
  2. 手术手势识别与技能评估:8 类缝合手势(拾针、进针、打结、剪线等)是技能评估系统的原子事件,可用于训练时序分类/检测模型(LSTM、TimeSformer、多尺度时序卷积)。落地提示:务必使用时间上下文,单帧方案在官方口径下几乎不可用(F1@10 仅 0.145 的对照教训)。
  3. 多任务与跨任务学习:官方核心命题——分割先验能否提升动作识别?冠军团队用"分割预测喂入动作分支"的级联方案拿到多任务第二名的实践经验可直接复用。落地提示:把"不降分"作为多任务方案的验收线,而非假设必然加分。
  4. 多采样率标注对齐方法论:1Hz mask + 10Hz 标签的双速率结构,是研究弱时序监督、标签传播、多速率学习率调度的天然试验场。落地提示:三种官方参赛策略(传播/下采样/双速率并行)都是可复用的起点。
  5. 真实场景鲁棒性测试:血液遮挡、镜头液体污染、光照骤变、烟雾——把在其他数据集训练好的模型拿来压力测试,量化域差距。落地提示:按"逐视频"分组报告失效案例,避免用均值掩盖个别视频的灾难性失败。

§2 医学背景

§2.1 ICD-11 编码映射

概念 ICD-11 编码 中文名称
RARP 主要适应证疾病 2C82 前列腺恶性肿瘤(Malignant neoplasms of prostate)

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语
前列腺癌(手术适应证) 2C82 399068003 Malignant tumor of prostate(前列腺恶性肿瘤)
机器人辅助前列腺根治切除术 2C82(适应证) —(手术概念归于 Procedure 层级,见下文术语) Robot-assisted radical prostatectomy(机器人辅助根治性前列腺切除术)

映射说明:本数据集的标签体系(器械部件、缝合手势)属手术过程概念而非疾病概念,ICD-11/SNOMED 映射针对的是数据集的临床语境(前列腺癌及其外科治疗),不试图对 9 类器械或 8 类手势做疾病编码映射——后者应使用 SNOMED CT Procedure/Object 层级或专项本体(如手术器械本体),本页不展开。

§2.2 疾病与术式简介

前列腺癌流行病学速览:

指标 数值 来源与口径
全球年新发病例 约 147 万例(1,466,680) GLOBOCAN 2022
全球年死亡病例 约 39.7 万例 GLOBOCAN 2022
男性高发排名 发病率居男性恶性肿瘤前列(发达国家常列首位) GLOBOCAN 2022
主流根治手段 机器人辅助根治性前列腺切除术(RARP)已成为多数医疗中心的标准术式 领域共识,见 §2.2 正文

前列腺癌是全球男性最常见的恶性肿瘤之一:据 GLOBOCAN 2022 估计,全球每年新发前列腺癌约 147 万例、死亡约 39.7 万例,发病率居男性恶性肿瘤前列(来源:GLOBOCAN 2022)。在西方发达国家,前列腺癌长期占据男性新发癌症首位。对于局限性前列腺癌,根治性前列腺切除术(Radical Prostatectomy,切除整个前列腺、精囊并重建膀胱颈-尿道连续性)是治愈性治疗的主要选项之一。自 2000 年代起,达芬奇机器人手术系统(Intuitive Surgical)凭借三维高清视野与腕式器械的灵巧性,逐渐取代传统腹腔镜成为前列腺根治术的主流平台——RARP 因此成为全球机器人手术量最大的术式之一,也是机器人手术 AI 研究(术野理解、器械追踪、技能评估)最理想的切入点:术式标准化程度高、机器人平台日志与视频天然可记录、手术量大且集中于成熟医疗中心。

背血管复合体缝合(DVC suturing) 是 RARP 中的关键步骤:当前列腺与膀胱、尿道之间的连接离断后,背血管复合体(Dorsal Vascular Complex,包裹背静脉的血管束)需要连续缝合以控制出血。这一步骤以双手持针、连续缝合为主,动作模式高度标准化(拾针-定位-进针-拔针-打结-剪线-回针),却又真实包含出血干扰、组织形变与镜头切换——这正是 SAR-RARP50 选择 DVC 缝合阶段作为标注窗口的原因:动作类别封闭、任务边界清晰、临床价值高。

从研究生态看,RARP 视频的采集高度依赖机器人平台的日志基础设施(dVLogger 一类设备),这使机器人术式的数据集建设天然领先于传统腹腔镜;同时也意味着公开数据的机构门槛较高——目前大规模公开的 RARP 视频数据集基本出自少数拥有 Intuitive Surgical 合作或数据治理成熟度的学术中心,SAR-RARP50 是其中唯一同时带像素级分割与手势双标注的开放数据集。

§2.3 临床任务定义

任务 定义 数据集支撑 临床落地方向
器械部件分割 对每帧中 9 类器械部件(轴杆/腕部/夹钳/缝线/夹子/缝合针/吸引器/导尿管/持针器)做像素级定位 1Hz 语义掩码,1920×1080 术中导航可视化、器械与危险解剖结构距离预警
手势(动作)识别 对每帧(10Hz)标注双手机械手势类别(G0-G7),构成缝合动作流 逐帧序列标签 术野录像自动结构化、缝合质量与效率量化
时序动作检测(衍生任务) 以手势流为底本检测动作起止与顺序异常 10Hz 序列标签 手术步骤合规检查、错误检测(如 SEDMamba 方向)
多任务联合建模 分割与动作识别共享表征、互相促进 双模态同步标注 上下文感知的术中决策支持(如"正在打结时提示助手牵拉角度")

三个任务共享同一时间轴与同一术野,但监督密度不同:分割监督稀(1Hz)、动作监督密(10Hz)、像素监督重(1920×1080 全分辨率)。这使 SAR-RARP50 成为研究"监督密度-模态协同"关系的理想载体,也意味着任何任务组合实验都必须先解决采样率对齐(见坑点 1)。

§2.4 数据来源人群

维度 内容
来源机构 University College Hospital at Westmoreland Street(伦敦大学学院医院),英国伦敦,单中心
手术术式 机器人辅助前列腺癌根治术(RARP),仅 DVC 缝合阶段片段
手术平台 达芬奇 Si(Intuitive Surgical Inc, CA),dVLogger 双通道录制
术者构成 8 位外科医生,覆盖资深顾问(consultant)、高年资住院医(senior registrar)、低年资住院医(junior registrar)三级资历
患者信息 每段视频对应一例独立手术(患者),共 50 例;公开版本不含患者人口学元数据
伦理与治理 数据由 UCL 团队在机构数据治理流程下整理并公开(资助:Wellcome Trust 203145/Z/16/Z,WEISS 中心)
术式阶段 仅 DVC(背血管复合体)缝合阶段片段,非完整手术录像
数据形态 术野内镜视频(无音频、无运动学数据、无患者生命体征)

人群代表性评估:该样本覆盖"单一中心 + 三级术者资历 + 50 例手术"的分布,对方法学研究(分割/动作识别的算法比较)代表性充分;对人群研究(不同医院、不同患者群体的性能差异推断)代表性不足。引用时务必匹配自己的研究类型——这是该数据集被误用最多的一点:把它当成"机器人前列腺手术的普遍代表",而它实际只代表"伦敦大学学院医院 2010 年代末至 2022 年间、达芬奇 Si 平台上的 DVC 缝合片段"。

§2.5 临床价值定位

对临床而言,该数据集训练的模型服务于三类场景:一是术中感知——实时告知导航系统"机械臂此刻位于术野何处、正在做什么",为自动避让与主动约束提供感知底座;二是术后录像分析——把数小时手术视频压缩为结构化的动作流与器械使用统计,支撑手术质控与教学复盘;三是技能评估——同一 DVC 缝合任务在顾问与低年资住院医之间执行风格与节奏差异显著(数据集刻意覆盖三级资历),为客观化技能评分提供了真实参照系。需要强调的是:数据集不含病理结局或患者随访信息,直接的临床结局预测(如控尿功能、肿瘤学结局)不在其支撑范围内。

与研究价值相对的是它的边界:50 段、约 5 分钟量级的 DVC 缝合片段决定了模型学到的是"缝合微观动作 + 器械外观"的表征,而非"整台手术的工作流理解"。把在该数据集上训练的阶段/工作流模型直接外推到完整 RARP 流程,是文献中常见的过度声明,应予避免。

§2.6 金标准对照

属性 SAR-RARP50 的做法
划分方式 按手术(即患者)划分:40 段训练 / 10 段测试,测试视频编号 41-50
标注方式 人工逐像素(分割)+ 人工逐帧序列(动作);1Hz 采样上传 Supervise.ly 平台标注
标注者 专业标注服务 Humans In The Loop(HITL)的专家标注团队(由具临床背景人员督导),2 名机器学习研究者对照全片复核修正
金标准性质 像素级语义掩码(9 类)+ 逐帧离散手势标签(8 类);测试集标注由组织方持有用于官方评测,未随仓库公开
评测口径 分割 mIoU/mNSD @ 1FPS 1920×1080;动作 F1@10 @ 10Hz;多任务为两者几何平均
与临床金标准的关系 器械位置与手势类别由标注协议定义,属"专家共识型"金标准;无术中运动学、疗效结局等仪器级参照

§3 数据集规格

§3.0 版本/子集抉择矩阵

你的需求 推荐获取 大小 理由
训练分割/动作/多任务模型 训练集 DOI 10.5522/04/24932529 约 26.9 GB 40 段视频 + 全部标注(1Hz mask + 10Hz 动作)
快速试跑评测协议 测试集 DOI 10.5522/04/24932499 约 6.6 GB 10 段测试视频 + README,配套 rarptk generate 生成模拟预测
只做动作识别研究 训练集(动作标签全量覆盖 40 段) 同上 26.9 GB 10Hz 手势标签随训练集发布,无需单独申请
需要无伦理限制的纯动作标注前身 RARP45(arXiv:2401.00496 参考文献 [61]) — 仅 10Hz 手势、无分割掩码;SAR-RARP50 为其超集,一般直接用 SAR-RARP50
研究 1Hz/10Hz 多速率标注对齐 训练集(双模态天然异速) 同上 26.9 GB 这是唯一同时提供两种采样率标注的公开手术数据集,无需额外获取
商业产品研发 不适用 — CC BY-NC-SA 4.0 排除商业用途;需另行联系权利方或更换数据源

§3.1 模态详情

  • 手术视频:达芬奇 Si 体内内镜的左目通道(video_left.avi),原始 dVLogger 流为双目 60fps 1080i 隔行扫描,发布版本经去隔行处理并以统一固定帧率重写;画面为真实体内术野,包含血液、烟雾、镜头液体污染与剧烈视野移动。各段视频在光照条件、光源色温、片长、术野血量与镜头清晰度上差异明显——这一"受控缺失"是刻意保留的真实手术多样性。
  • 分割掩码:9 类器械部件的像素级语义标注,以 PNG 发布,分辨率 1920×1080,采样率 1Hz(每秒 1 帧),覆盖训练 40 段共 12,998 帧、测试 10 段共 3,252 帧。9 类采用"部件级"而非"器械级"设计:同一把持针器会被拆分为 shaft(轴杆)、wrist(腕部)、clasper(夹钳)三个部件类别,部件级粒度使模型必须理解器械的关节结构。
  • 动作(手势)标签:8 类离散双手机械手势(G0-G7),以帧列表 + 标签列表(action_discrete.txt)发布,采样率 10Hz,覆盖 50 段视频。手势为双手机械动作(而非手术阶段),粒度介于"原始运动学"与"手术阶段"之间。

§3.2 子集与样本数

子集 视频数 视频编号 分割标注帧(1Hz) 动作标注 标注公开性
train1 + train2(挑战发布包的训练目录约定) 40 video 1-40 12,998 10Hz 逐帧 ✅ 随训练集公开
test 10 video 41-50 3,252(由组织方持有) 10Hz 逐帧(组织方持有) ❌ 仅视频与 README 公开
合计 50 video 1-50 16,250 50 段全覆盖 —

关于 train1 与 train2 的边界:官方论文按任务描述数据构成(40 段训练视频全量携带两类标注),发布包与工具包仅约定了"train1/train2/test 三目录、每段视频一个 video_* 子目录"的组织形式,未公布两目录各自承载的视频清单。使用时应把 train1+train2 视为同一个 40 段训练池,自行划分验证集时跨两目录统一按 video_id 分组,避免把"目录名"误当成官方语义划分。

§3.3 数据格式

对象 格式 说明
单段视频 zip 内含 video_left.avi 每段视频独立打包为 zip,解包后目录名 video_*
分割掩码 PNG(1920×1080) 逐帧编号,置于每段视频目录下 segmentation/
动作标签 TXT(action_discrete.txt) 每行对应一个 10Hz 采样帧的动作类别
元数据 README 格式说明随 train/test 包发布
类别映射 论文 Table 1/Table 2 + README 9 类分割索引与 8 类手势定义的权威出处
评测脚本 Python 包 rarptk(pip/docker) unpack 抽帧、generate 格式样例、evaluate 评测

所有文本类标注(动作 TXT、README)与掩码 PNG 均为纯文本/无损格式,可直接进版本控制;只有 AVI 视频建议放对象存储或 LFS。掩码为单通道索引图(类别索引为像素值),读取时务必以 NEAREST 方式缩放(§6.4 代码已示范),双线性插值会在类别边界产生不存在的"混合类别"像素。

§3.4 存储大小

条目 大小 来源
训练集(SAR-RARP50 train set v1) 26,952,409,628 字节 ≈ 26.9 GB DataCite DOI 记录
测试集(SAR-RARP50 test set v1) 6,607,375,225 字节 ≈ 6.6 GB DataCite DOI 记录
合计(未解包) ≈ 33.6 GB 上两项之和
解包后(10Hz PNG 帧) 显著增大(逐帧 PNG 展开,预计为压缩包的数倍) 按 rarptk unpack 抽帧逻辑估算,需预留 ≥100 GB 磁盘

存储规划提示:训练集 26.9 GB 的大头是 40 段 AVI 视频;10Hz 抽帧后每段视频产生约 3,000 张 1920×1080 PNG(仅 1/10 帧有掩码),全量展开后总量约在压缩包的 2-4 倍之间,视 PNG 压缩内容而定。训练管道建议按需抽帧或使用缓存目录 + 符号链接管理,避免"压缩包 + 展开帧 + 数据集副本"三份并存。

§3.5 标注方式

  • 分割:视频帧按 1Hz 采样后上传 Supervise.ly 在线标注平台,按统一标注协议人工逐像素描绘 9 类器械部件;由专业标注服务 Humans In The Loop(HITL)的专家标注团队执行,团队由具临床背景的人员督导。
  • 动作:10Hz 帧列表 + 对应标签列表的人工序列标注。
  • 复核:HITL 产出的参考标注由 2 名机器学习研究者复核并修正,修正过程参考整段视频上下文(含跨帧一致性),而非孤立逐帧判断。
  • 协议要点:分割掩码的部件级拆分(shaft/wrist/clasper)遵循器械物理结构而非器械型号;手势标签以双手整体动作为判定对象,同一帧只有一个标签(非每手一个);G0 Other 收纳所有非七类缝合动作的双手操作时刻。逐类判定细则以官方标注协议与论文描述为准。

§3.6 标注者资质与一致性

HITL 是商业医疗影像标注服务商,其标注团队按协议由具备临床知识的人员督导;论文披露的复核机制为"双机器学习研究者全片复核 + 修正"(arXiv:2401.00496)。数据集未公开标注者间一致性系数(如 Dice@annotators、Kappa)的数值,评估标注质量的可引用证据是挑战测试集上的官方评测结果(分割 mIoU 0.832 / mNSD 0.868,冠军方法)。使用者在做医学声明时应把标注一致性数值的缺失视为限制。

值得注意的是复核策略的设计:修正不是孤立逐帧进行的,而是"基于整段视频的信息校验与精化标签"——前后帧的器械连续性与手势连续性被用作标注一致性约束。这对使用者有两点含义:其一,掩码在时间维上具有较好的一致性,适合做时序传播式训练;其二,若发现个别帧标注与邻帧矛盾,应优先怀疑自己的抽帧对齐而非标注本身(先查坑点 2)。

§3.7 采集周期

数据集为 EndoVis 2022 挑战而构建,其前身 RARP45 由同一团队整理发布;官方论文与 UCL 仓库元数据均未公布逐例采集日期,仅可确认发布链路为:2022 挑战发布 → 2024-01-23 UCL RDR 正式存档(train/test set v1)。据此本页不以具体采集年份做任何统计声明。对时间敏感的下游分析(如"器械换代对模型性能的影响"),应联系发布方确认采集窗口,或以视频内可见的器械型号组合做间接分组。

§3.8 地域覆盖

单中心:英国伦敦 University College Hospital at Westmoreland Street。无多机构数据,泛化到其他医院/人种/术式习惯时需谨慎(见 §7.1、§7.3)。

单中心属性是把双刃剑:一方面,中心内器械型号、术野参数与记录流程一致,模型学到的"中心内不变量"更纯粹,适合方法学研究;另一方面,从单中心训练的模型在跨中心部署时的性能回撤幅度无法从数据集内部估计,必须借助外部数据(§5.5)或主动采集验证集来量化。审阅使用该数据集的论文时,"单中心训练 + 无外部验证"是一个标准审查点。

§3.9 设备规格

项目 规格
手术系统 达芬奇 Si(Intuitive Surgical Inc, CA)
手术器械 持针器、缝针、缝线、吸引器、导尿管、夹子等(与 9 类分割标签对应;具体型号未逐视频披露)
录制设备 dVLogger,双目立体通道各自独立录制
原始视频 60 fps,1080i(隔行)
发布视频 去隔行 + 统一固定帧率重写的左目通道 video_left.avi
评估分辨率 1920×1080(分割预测按 1FPS 评估)
标注采样率 分割 1Hz / 动作 10Hz

设备线索的两个推论值得记录:其一,发布版只含左目通道,立体视觉研究需联系发布方确认右目数据可得性;其二,"隔行扫描 + 60fps 原始流"意味着发布版视频可能残留运动模糊与梳状伪影的残留影响,对高频细节敏感的模型(如缝线分割)应评估输入质量上限。

§3.10 深度溯源链

  • 发布主体:UCL(通讯作者 Dimitris Psychogyios,ORCID 0000-0002-3377-530X;作者含 Beatrice Van Amsterdam、Emanuele Colleoni、Danail Stoyanov 等)——DataCite 记录。
  • 资助:Wellcome Trust “Wellcome Trust Centre for Surgical and Interventional Sciences”(资助号 203145/Z/16/Z)——DataCite fundingReferences。
  • 数据流:达芬奇 Si 手术 → dVLogger 双通道录制 → DVC 缝合片段截取 → 去隔行/固定帧率重写 → 1Hz 抽帧上传 Supervise.ly → HITL 人工标注 → 2 名研究者复核 → 挑战发布(2022)→ UCL RDR 存档(2024-01-23)。
  • 关联资源:官方评测工具包 surgical-vision/SAR_RARP50-evaluation(MIT),挑战报告论文 arXiv:2401.00496,训练集与测试集 DOI 互为姊妹条目且 IsPartOf arXiv 2401.00496。
  • 可核验性:数据集关键声明(50 段、40/10 划分、类别数、采样率、采集机构、许可)均可在"论文 + DataCite + GitHub README"三个独立来源间交叉印证;唯一无法核验的是逐例元数据(术者映射、采集日期),已在 §3.7/§7.1 如实标注。
  • 引用链完整性:训练/测试集 DataCite 记录均带 IsSupplementedBy 指向官方工具包、IsPartOf 指向 arXiv 论文,构成"数据-代码-论文"三位一体的闭环引用网络,这是 2022 年后 MICCAI 挑战数据集的规范做法。

§4 数据结构

§4.0 目录树

官方工具包期望的数据根目录结构(每段视频一个 video_* 目录;train1/、train2/ 为挑战发布包对 40 段训练视频的组织约定,合计 40 段):

path_to_root_data_dir/
├── train1/
│   ├── video_1/
│   │   ├── video_left.avi              # 左目通道手术视频
│   │   ├── action_discrete.txt         # 10Hz 手势标签(每行一帧)
│   │   └── segmentation/               # 1Hz 分割掩码
│   │       ├── 00000.png               # 9 类语义掩码,1920×1080
│   │       ├── ...
│   │       └── 00324.png
│   ├── video_2/
│   └── ...                             # train1 + train2 共 40 段(video 1-40)
├── train2/
│   └── video_*/
└── test/
    ├── video_41/
    │   ├── video_left.avi              # 测试集仅含视频
    │   └── ...                         # 标注由组织方持有
    └── video_50/

模型预测需按训练集同构导出(官方评测工具约定):每个 video_* 目录下包含 segmentation/(PNG 掩码)与 action_discrete.txt。

§4.1 DAIMS 字段字典

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
video_id string 视频目录名,全局唯一主键 video_41 划分/分组采样键 无 — video_1 … video_50
split string 官方划分归属 train1 / train2 / test 防泄漏划分 无 — 3 值枚举
video_left.avi video 去隔行后左目通道术野视频 train1/video_1/video_left.avi 视觉模型输入 隔行伪影已在发布版处理 — 1920×1080,固定帧率
segmentation/*.png image 1Hz 像素级语义掩码 segmentation/00000.png 语义分割监督 边界手工描绘误差(未公布定量值) 无缺失帧 9 类 + 背景
掩码像素值 integer 类别索引(按官方类别表) 1(Tool shaft) 分割损失加权 类间映射须以官方 README 为准 — 0-9(以 README 编码为准)
action_discrete.txt 行号 integer 10Hz 采样帧序号 第 37 行 = 3.7 秒 时序模型时间轴 与抽帧起始对齐相关(见坑点 2) — 0 … 帧数-1
gesture_id integer 手势类别标签 5(Tying a knot) 动作识别监督 人工时序边界模糊 — 0-7(G0-G7)
frame_id(PNG 文件名) integer 解包后帧编号 00000.png 跨模态对齐锚点 必须经 rarptk unpack 生成 — 10Hz 或 1Hz 抽帧序号
视频时长(推导) derived 掩码帧数 × 1 秒(或动作列表长度 ÷ 10)估算 325 帧 ≈ 5.4 分钟 批处理分桶/学习率调度参考 逐视频截取长度不一(论文未给逐段时长表) — 约 2-12 分钟量级(论文定性描述)

§4.2 标签分布

分割类别像素覆盖率(官方论文 Table 2,均值 ± 标准差):

类别 中文 训练集覆盖率 测试集覆盖率
Tool shaft 器械轴杆 12.04 ± 2.89% 10.97 ± 2.83%
Tool wrist 器械腕部 3.59 ± 1.06% 3.85 ± 1.18%
Tool clasper 器械夹钳 2.24 ± 1.19% 3.61 ± 2.13%
Thread 缝线 1.00 ± 0.33% 0.94 ± 0.21%
Suction tool 吸引器 0.51 ± 0.53% 0.70 ± 1.03%
Suturing needle 缝合针 0.44 ± 0.15% 0.45 ± 0.15%
Needle Holder 持针器 0.20 ± 0.15% 0.23 ± 0.12%
Catheter 导尿管 0.19 ± 0.24% 0.27 ± 0.36%
Clamps 夹子 0.15 ± 0.19% 0.13 ± 0.16%

手势类别表(官方论文 Table 1,G0-G7 共 8 类):

ID 手势(英文) 中文语义
G0 Other 其他(非七类缝合动作的双手操作时刻)
G1 Picking-up the needle 拾针(从持针器/术野中拾取缝合针)
G2 Positioning the needle tip 针尖定位(调整进针角度与位置)
G3 Pushing the needle through the tissue 进针(穿透组织)
G4 Pulling the needle out of the tissue 拔针(拉出缝针带过缝线)
G5 Tying a knot 打结
G6 Cutting the suture 剪线
G7 Returning/dropping the needle 回针/放针

读取覆盖率的两个提示:其一,Table 2 的百分比是"该类出现于样本中的图像覆盖均值",未出现的帧不摊薄均值,因此不能用它直接推算"每帧类别数";其二,clasper 在测试集覆盖率(3.61%)高于训练集(2.24%),是训练/测试分布差异最大的类——做域内验证时留意该类的逐视频波动。

§4.3 关键统计

  • 分割标注帧:训练 12,998 + 测试 3,252 = 16,250 帧(1Hz,1920×1080)。
  • 平均每段训练视频约 325 个分割标注帧(12,998 ÷ 40),对应 DVC 缝合片段约 5 分钟量级;官方论文指出各视频长度差异明显。
  • 动作标注以 10Hz 覆盖全部 50 段视频;官方按 10Hz 评估动作识别、按 1FPS 评估分割。
  • 官方刻意将手术分配到训练/测试集时保持两类任务的标签分布相近(论文 §4)。
  • 器械"三分结构"(shaft+wrist+clasper)合计像素覆盖率约 17.9%(训练集 12.04+3.59+2.24),是绝对的视觉主体;功能性小物件(针、线、夹、管)合计不足 2.5%。
  • 测试集与训练集的各类覆盖率接近(如 clasper 2.24% vs 3.61%、其余类差值均在 1 个百分点内),官方划分在分布对齐上是成功的,但小类方差大(如 suction ±1.03%)意味着逐视频波动仍然可观。
  • 12,998 帧训练分割标注对应的像素标注总量约在 300 亿像素量级(12,998 × 1920 × 1080),人工逐像素完成的规模在同类公开手术数据集中处于第一梯队。

§4.4 数据层级

数据集(50 段)
└── 手术/患者(50 例,每段视频对应 1 例,无患者跨视频重复)
    └── 视频段(DVC 缝合阶段,video_1 … video_50)
        └── 帧(10Hz 抽帧为动作时间轴;1Hz 为分割标注帧)
            ├── 像素级掩码(仅 1Hz 帧,9 类)
            └── 手势标签(每 10Hz 帧,8 类)

层级设计的直接推论:患者级 = 视频级,因此"按视频划分"与"按患者划分"在本数据集中是同一件事,不存在同一患者多段视频的跨段泄漏;但术者级不是——50 例仅来自 8 位术者,术者级分组仍需显式处理(§5.3)。

§4.5 缺失值与信息性缺失

现象 是否存在 处理建议
表格字段缺失/空值 不适用(视频+PNG+TXT 结构,无宽表行级缺失) —
分割帧缺失 训练集内 1Hz 全覆盖(12,998 帧),掩码与抽帧严格对齐 若自行抽帧导致帧号漂移,会表现为"掩码缺失"假象(见坑点 2)
动作帧缺失 10Hz 逐帧连续标注 多任务训练中 1Hz 分割与 10Hz 动作天然错位,需显式对齐(见坑点 1)
信息性缺失编码 未使用 —
测试集标注 仅组织方持有 社区复现以训练集内部划分为准(见 §5)
掩码像素值的官方索引表 以随包 README 与论文类别表为准 任何自定义重索引都必须在代码中显式声明映射关系,禁止"默认顺序"假设

§5 划分与使用建议

§5.1 官方划分

官方按手术(video)划分:训练 40 段(video 1-40,发布包内组织于 train1/ 与 train2/)、测试 10 段(video 41-50),划分时保持标签分布相近(arXiv:2401.00496)。测试集标注不公开,评测须通过官方渠道或使用组织方持有的 ground truth。

| 官方划分的另一层含义常被忽略:挑战论文的 per-video 成绩表(Table 3/4 等)以 video 41-50 逐段列出,是公开资料中唯一"官方测试集逐段分数"来源。若你的模型宣称逼近官方成绩,应逐段对比而非只看均值——逐段方差是判断"均值相近是否源于互补性错误"的关键。

解读官方成绩的三个注意点:第一,测试视频仅 10 段,任何"均值提升 0.01"级别的比较在统计上都很脆弱,报告置信区间或逐段分布比单点均值更诚实;第二,挑战成绩是 2022 年提交的快照,后续论文在内部划分上的改进不能直接与该快照排序;第三,官方成绩对应特定输入分辨率与增广方案,复现时输入管线的差异(尺寸、归一化、TTA)即可造成可观的分数漂移。

§5.2 社区惯例划分

测试标注不可得,社区论文普遍在 40 段训练视频内做按视频的随机划分(如 8:2 或 7:3)报告结果:挑战冠军 Uniandes 即以内部验证优化其方法,AIA-Noobs 采用 7:3 划分并配合测试时增广。复现挑战数字时,应固定训练全量 40 段训练、10 段测试仅用于提交格式演练,切勿把内部验证分数与官方测试分数混排成表。

引用社区论文分数时还要注意三件事:其一,划分种子不同导致分数波动,比较两篇论文前先确认是否同一划分;其二,部分论文在低分辨率(如 480×640)上训练后再上采样评测,与全分辨率 1920×1080 的分数不可直接比;其三,动作识别论文可能自行实现 F1@10 的简化版(无容差或容差不同),务必核对口径(坑点 5)。

§5.3 泄漏风险与划分策略 ⭐

  1. 必须按 video 划分,严禁按帧划分:同一视频相邻帧近乎重复,按帧随机切分会让验证集"看见"训练帧的邻帧,分数虚高且毫无意义。
  2. 术者重叠泄漏:数据集仅 8 位术者,40/10 划分后训练与测试极可能存在同一位医生的视频(官方未公布术者-视频映射)。按视频划分后仍应做 leave-one-surgeon-out 的敏感性分析来估计"陌生术者"泛化差距。
  3. 预处理统计泄漏:归一化均值/方差、类别权重等统计量只能在训练段内计算。
  4. 多任务对齐泄漏:若用"分割掩码传播生成伪动作标签"类技巧,传播源必须仅来自训练视频。
  5. 验证集信息泄漏进训练决策:以验证分数挑选训练样本、调整类别权重或决定早停点都属于"软泄漏"——类别权重应由训练集分布推导(§6.3 的权重表),验证集只用于模型选择。
  6. 抽帧缓存复用导致的隐式泄漏:若验证折的视频帧曾被早期实验的模型生成过伪标签或特征缓存,复用这些缓存会把早期模型的信息带入新实验——缓存目录按"实验组 ID"隔离是最简单的防线。

§5.4 交叉验证建议

在 40 段训练视频上做 5 折按视频分组交叉验证(GroupKFold,group = video_id);如需评估术者泛化,追加按术者分组的交叉验证(即使术者映射不完整,也可用"视频号聚簇 + 官方论文描述的资历结构"做近似敏感性分析,并明确声明该近似)。报告均值 ± 标准差,同时给出官方 40/10 内部划分的结果以对齐社区可比口径。

工程上建议把"划分表"作为一等公民管理:划分结果落盘为 split.csv(video_id, split, fold, surgeon_guess 可空),训练入口只读该文件;任何调参轮次不得改动划分表——改动即视为新实验并另起版本号。这既防泄漏,也让后续论文引用你的实验时可以精确复现。

§5.5 外部验证建议

训练完成的模型应在至少一个异源数据集上测试跨中心/跨术式泛化:器械部件分割可迁移测试 EndoVis 2017 序列或 CholecSeg8k(注意类别体系不同,只测公共类并重述映射);动作识别可对照 Cholec80 的阶段标注做粗粒度一致性检查。任何迁移结果必须注明"仅在公共类/映射后类上可比"。

迁移方向反过来同样有价值:在 EndoVis 2017(受控短序列)训练的分割模型迁到 SAR-RARP50 上的性能跌幅,是量化"受控→真实"域差距的标准实验设计。已有论文报道学习型方法在真实手术视频上性能显著低于受控数据(挑战论文引言对此有系统综述),把 SAR-RARP50 当"域差距度量仪"使用,本身就是它的核心应用之一。


§6 AI 就绪指南 ⭐

§6.0 云端/本地环境快速启动

数据集约 33.6 GB(压缩包)+ 抽帧展开需 ≥100 GB 磁盘,本地磁盘紧张时可走云盘方案:

环境 挂载方式 磁盘要点
Google Colab 挂载 Google Drive 后软链数据目录 Drive 免费额度 15 GB 不足以放全量,建议 Colab 临时盘(≈100 GB)下载解压,会话内用完即弃
Kaggle Notebook 添加 UCL RDR 数据集为 Data Source 或 wget 逐段下载 工作目录上限约 73 GB,建议只解压 train1 做最小验证
AWS/GCP/阿里云 对象存储中转 + NVMe 实例盘 建议数据盘 ≥200 GB;抽帧产物可压缩存储(PNG 无损压缩率约 2-3×)
本地/实验室服务器 直接下载 df -h 确认 ≥120 GB 可用;建议独立数据盘 + 符号链接管理

云上最小验证流程(以 Colab 为例):只下载测试集(6.6 GB)→ 解压 1 段视频 → rarptk generate 验证格式 → 用训练集中 1 段视频跑通 §6.3 索引脚本。全程约 20 分钟,不建议在免费云环境直接展开全量 50 段。

§6.1 快速上手

下面代码的预期目录结构、data_root 拼接关系与最小可用子集如下:data_root 指向 §4.0 目录树的根(含 train1/ train2/ test/);视频必须先解压各 zip 再用官方工具抽帧(否则帧号与标注错位);最小可用子集 = train1/ 下任意 1 个 video_* 目录(含 video_left.avi、action_discrete.txt 与 segmentation/),即可跑通"抽帧 → 加载 → 可视化"全链路。

# 1) 安装官方工具包(pip 直装 GitHub 源)
pip install git+https://github.com/surgical-vision/SAR_RARP50-evaluation

# 2) 将 train/test 包内每段 video_*.zip 解压,保持 train1/train2/test 目录结构
#    解压后每段视频目录下应有 video_left.avi(train 段另含 action_discrete.txt 与 segmentation/)

# 3) 递归抽帧:在所有含 video_left.avi 的目录按 10Hz 导出 PNG(默认 10Hz,可选 -f 1)
rarptk unpack /path/to/root_data_dir/ -j4 -r

# 4) 生成官方格式的模拟预测,验证导出格式是否正确
rarptk generate /path/to/root_data_dir/test/ /path/to/root_data_dir/mock_predictions/

抽帧完成后,先用一段训练视频做可视化自检(确认图像、掩码、动作标签三者对齐),再进入训练:

"""可视化自检:抽 1 段训练视频的 3 个掩码帧,叠加显示并打印对应手势。
预期:掩码覆盖画面中的器械部件(shaft/wrist/clasper 连为一体),手势与画面动作可被肉眼对应。"""
import numpy as np
from PIL import Image
from pathlib import Path

video_dir = Path("data_root/train1/video_1")          # 替换为实际目录
for png in sorted((video_dir / "segmentation").glob("*.png"))[::50][:3]:
    frame_id = int(png.stem)
    img = np.asarray(Image.open(video_dir / "rgb" / f"{frame_id:05d}.png"))   # rarptk unpack 默认输出目录以 README 为准
    mask = np.asarray(Image.open(png))
    print(f"frame {frame_id}: mask classes = {np.unique(mask)}, "
          f"foreground = {(mask > 0).mean():.2%}")
    # 此处接入 matplotlib 叠加显示(略);核对手势可用 §6.3 的索引脚本读取 action_discrete.txt

§6.2 数据获取

条目 链接 大小 要求
训练集 rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_train_set/24932529 ≈ 26.9 GB 无需注册,直接下载,遵守 CC BY-NC-SA 4.0
测试集 rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_test_set/24932499 ≈ 6.6 GB 同上
评测工具包 github.com/surgical-vision/SAR_RARP50-evaluation — MIT 许可;支持 pip 与 docker
前身数据集 RARP45(见挑战报告参考文献 [61]) — 仅动作标注;一般无需单独获取,SAR-RARP50 已是其超集
# 从 UCL RDR 项目页逐文件下载(figshare 下载链接随条目页发布)
# 训练集为逐段视频 zip + 标注文件;测试集为 10 段视频 zip + README
# 下载后校验目录:
#   root/train1/video_*.zip … root/train2/video_*.zip … root/test/video_*.zip
unzip 'root/train1/video_*.zip' -d root/train1/   # 逐段解压,保持 video_* 目录名

下载完整性建议:figshare/UCL RDR 每个文件条目页提供文件大小,逐文件比对字节数即可确认下载完整;网络不稳的环境用 wget -c 断点续传。数据包解压后先跑 rarptk generate(§6.1)而非直接训练——它能一次性验证"目录结构 + 视频可读 + 导出格式"三件事,通常 10 分钟内定位绝大多数获取阶段的坑。

下载后自查清单(5 分钟):① 文件数与条目页一致(训练集 40 段 zip + 标注,测试集 10 段 zip + README);② 逐段 zip 解压后目录名仍是 video_* 且互不嵌套;③ 抽一段训练视频确认三件套齐全(video_left.avi、action_discrete.txt、segmentation/);④ df -h 确认抽帧后磁盘余量 ≥100 GB;⑤ rarptk unpack 对单段视频试跑 10 秒确认帧导出正常。五项全绿再启动全量预处理。

§6.3 预处理全流程

流程:zip 解压 → 官方 rarptk 抽帧(保证帧号对齐)→ 构建"帧文件 ↔ 掩码 ↔ 动作标签"三表索引 → 尺寸/归一化策略。

import csv
import numpy as np
from pathlib import Path
from PIL import Image

# 清洗步骤:检测两类"坏帧"——全黑/近黑帧(采集瞬断)与低信息量模糊帧。
# SAR-RARP50 标注帧与视频帧严格对齐,坏帧通常不影响标注有效性,但会影响训练稳定性;
# 策略:坏帧不删除(保持对齐),训练时以权重掩码降权。
def scan_bad_frames(video_dir: str, dark_thresh: float = 0.02, blur_thresh: float = 0.01):
    seg_dir = Path(video_dir) / "segmentation"
    report = {"dark": [], "low_std": []}
    for png in sorted(seg_dir.glob("*.png")):
        arr = np.asarray(Image.open(png).convert("L"), dtype=np.float32) / 255.0
        if arr.mean() < dark_thresh:
            report["dark"].append(png.name)
        if arr.std() < blur_thresh:
            report["low_std"].append(png.name)
    return report

# 清洗产物建议落盘为 manifest.json,进版本控制;训练侧读取并降权。
# 索引表(对齐)→ 清洗表(质量)→ 权重表(类别平衡)三表合一后作为 DataLoader 的唯一数据源。

索引构建代码如下(对齐规则:动作标签按 10Hz 逐帧连续;分割掩码为 1Hz):

import csv
from pathlib import Path

# data_root 为 §4.0 目录树根目录;索引表用于训练时快速对齐三种模态
GESTURE_NAMES = {0: "Other", 1: "Picking-up the needle", 2: "Positioning the needle tip",
                 3: "Pushing the needle through the tissue", 4: "Pulling the needle out of the tissue",
                 5: "Tying a knot", 6: "Cutting the suture", 7: "Returning/dropping the needle"}

def build_index(data_root: str, out_csv: str = "sarrarp50_index.csv") -> list[dict]:
    """扫描数据根目录,生成 (video_id, frame_png, gesture_id) 对齐索引。

    对齐规则:动作标签按 10Hz 逐帧连续;分割掩码为 1Hz,即每第 10 个抽帧帧号。
    官方 unpack 以 10Hz 抽帧后 PNG 文件名为帧号基准(00000.png 起)。
    """
    rows = []
    for split in ("train1", "train2"):
        for video_dir in sorted(Path(data_root, split).glob("video_*")):
            seg_dir = video_dir / "segmentation"
            action_file = video_dir / "action_discrete.txt"
            if not (seg_dir.exists() and action_file.exists()):
                continue
            actions = [int(x) for x in action_file.read_text().split()]
            # 分割掩码文件名即其源帧号;动作行号即 10Hz 帧号
            for seg_png in sorted(seg_dir.glob("*.png")):
                frame_id = int(seg_png.stem)
                gesture = actions[frame_id] if frame_id < len(actions) else 0
                rows.append({"video_id": video_dir.name, "split": split,
                             "frame_png": str(seg_png), "frame_id": frame_id,
                             "gesture_id": gesture})
    with open(out_csv, "w", newline="") as f:
        w = csv.DictWriter(f, fieldnames=list(rows[0].keys()))
        w.writeheader(); w.writerows(rows)
    return rows

# 注意:不同视频抽帧帧数不同、动作列表长度可能与 PNG 帧数有差,
# 工程上以"掩码文件名为锚点"做对齐(上例),切勿以行号直接同帧号硬绑定后不做越界检查。

标准化与类别权重:归一化统计建议直接用 ImageNet 均值方差(挑战队 AIA-Noobs 实践),或在训练段(train1+train2)内自算——严禁把测试段视频纳入统计;小类的损失权重按覆盖率倒数平方根折算即可稳定训练:

import numpy as np

# 官方 Table 2 的训练集覆盖率(%),索引对应 9 个前景类
coverage = np.array([12.04, 2.24, 3.59, 1.00, 0.15, 0.44, 0.51, 0.19, 0.20])
# 平方根倒数加权:对小类提升权重但不过度放大标注噪声
weights = (1.0 / np.sqrt(coverage)).astype(np.float32)
weights = weights / weights.mean()          # 归一到均值为 1
print(dict(zip(["shaft", "clasper", "wrist", "thread", "clamps",
                "needle", "suction", "catheter", "needle_holder"],
               np.round(weights, 2))))
# 输出约:shaft 0.29 / thread 1.0 / clamps 2.58 / needle_holder 2.24 量级

§6.4 PyTorch DataLoader

以下代码基于 §6.3 生成的索引 CSV 构建"分割 + 动作"双任务 Dataset:输入为 10Hz 抽帧(1Hz 掩码帧复制时间对齐),输出 (image, mask, gesture);data_root 须指向 §4.0 根目录。

<details>
<summary>点击展开完整 Dataset + DataLoader 代码(约 70 行)</summary>

import csv
import numpy as np
import torch
from PIL import Image
from torch.utils.data import Dataset, DataLoader

IMAGENET_MEAN = (0.485, 0.456, 0.406)
IMAGENET_STD = (0.229, 0.224, 0.225)

class SARRARP50(Dataset):
    """SAR-RARP50 双任务数据集:语义分割(1Hz 掩码)+ 手势识别(10Hz 标签)。

    索引 CSV 由 §6.3 build_index 生成,每行一个 1Hz 掩码帧,
    其 gesture_id 取自 10Hz 动作列表同帧号(多任务对齐的最小实现)。
    """

    def __init__(self, index_csv: str, resize=(640, 360), augment=False):
        with open(index_csv) as f:
            self.rows = list(csv.DictReader(f))
        self.resize = resize
        self.augment = augment

    def __len__(self):
        return len(self.rows)

    def __getitem__(self, idx):
        r = self.rows[idx]
        img = Image.open(r["frame_png"]).convert("RGB")
        if self.resize:
            img = img.resize(self.resize, Image.BILINEAR)
        arr = np.asarray(img, dtype=np.float32) / 255.0
        arr = (arr - np.array(IMAGENET_MEAN)) / np.array(IMAGENET_STD)
        image = torch.from_numpy(arr).permute(2, 0, 1)

        mask = Image.open(r["mask_png"]) if "mask_png" in r else Image.open(r["frame_png"].replace("rgb", "segmentation"))
        mask = mask.resize(self.resize, Image.NEAREST)
        mask = torch.from_numpy(np.asarray(mask, dtype=np.int64))

        gesture = torch.tensor(int(r["gesture_id"]), dtype=torch.long)

        if self.augment:  # 安全增强见 §6.6;此处仅示范水平翻转 + 亮度抖动
            if torch.rand(1).item() < 0.5:
                image = torch.flip(image, dims=[2]); mask = torch.flip(mask, dims=[1])
        return image, mask, gesture


def make_loaders(data_root: str, batch_size: int = 8):
    from preprocess import build_index  # §6.3 的 build_index 需扩展同时记录掩码路径
    rows = build_index(data_root, "index_all.csv")
    # 按视频划分 8:2(严禁按帧划分,见 §5.3)
    videos = sorted({r["video_id"] for r in rows})
    val_videos = set(videos[::5])
    tr_rows = [r for r in rows if r["video_id"] not in val_videos]
    va_rows = [r for r in rows if r["video_id"] in val_videos]
    for part, path in ((tr_rows, "index_train.csv"), (va_rows, "index_val.csv")):
        with open(path, "w", newline="") as f:
            w = csv.DictWriter(f, fieldnames=list(rows[0].keys())); w.writeheader(); w.writerows(part)
    train_ds = SARRARP50("index_train.csv", augment=True)
    val_ds = SARRARP50("index_val.csv")
    return (DataLoader(train_ds, batch_size=batch_size, shuffle=True, num_workers=8, pin_memory=True),
            DataLoader(val_ds, batch_size=batch_size, shuffle=False, num_workers=4, pin_memory=True))

</details>

§6.5 坑点 8 个

⚠️ 坑点 1:1Hz 分割与 10Hz 动作的双采样率失配(分类:预处理陷阱)

问题:分割掩码只有 1Hz(每秒 1 帧),动作标签是 10Hz 逐帧,两者天然错位 10 倍。直接把两者"按文件顺序"配对训练,会让 90% 的动作标签绑定到错误的帧上,多任务模型把另一任务当噪声学。
症状:多任务训练损失震荡不收敛;动作分支验证 Accuracy 停在随机水平;视觉检查发现"掩码帧对应的手势与画面明显不符"(如画面在打结、标签是拾针)。
解决:

  1. 简单方法:以掩码文件名为锚点取同帧号的动作标签(即把动作降到 1Hz 参与联合监督),分割任务保持原采样;动作识别分支可另用全量 10Hz 标签单独训练。
  2. 进阶方法:将 1Hz 分割先验向 10Hz 传播(复制最近一帧的掩码作为伪分割标签),让动作分支用全量 10Hz 样本——这正是挑战队伍 AIA-Noobs 的做法(arXiv:2401.00496 §5)。
  3. SOTA 方法:双速率并行训练——每个任务按各自原生采样率取样本、共享编码器用梯度分离更新,推理时分割分支 1FPS 输出、动作分支 10Hz 输出;挑战官方评估即按此双速率设计(分割 1FPS、动作 10Hz)。
    参考:arXiv:2401.00496(挑战论文"采样率差异处理"专段);官方工具包。

⚠️ 坑点 2:自行抽帧导致帧号与标注错位(分类:预处理陷阱)

问题:发布视频是"去隔行 + 固定帧率重写"后的产物,掩码文件名与动作行号都以官方 unpack 工具的抽帧约定为基准。用自写 ffmpeg 命令换帧率、换起始帧或重新编码后再抽帧,帧号体系即被破坏。
症状:掩码与画面内容完全对不上(器械位置偏移数帧);动作序列首尾错位;官方 rarptk evaluate 对本地预测报"帧数不匹配"。
解决:

  1. 简单方法:只用 rarptk unpack(10Hz,-f 1 可选 1Hz)抽帧,禁止中间重新编码视频。
  2. 进阶方法:如必须自写抽帧(如流式训练),以 ffmpeg -i video_left.avi -vf fps=10 从 0 帧起抽并用第 0 帧 PNG 与第 0 行动作标签做人工目检对齐,逐段视频校验一次。
  3. SOTA 方法:将抽帧产物一次性固化为帧索引表(含 md5),训练管道只消费索引表,抽帧不可复现的问题从流程上消除。
    参考:官方工具包 unpack 文档(明确要求解压 zip 后用 rarptk 抽帧)。

⚠️ 坑点 3:极端类不平衡让 per-class Dice/mIoU 失真(分类:评估误用)

问题:Clamps(0.15%)、Catheter(0.19%)、Needle Holder(0.20%)三类像素覆盖率不足 0.3%,与 Tool shaft(12.04%)相差近两个数量级。整体 mIoU/mDice 被大类主导,小类近零也不会明显拉低总分;只看宏平均又会被小类的巨大方差误导。
症状:模型对 shaft/wrist/clasper 分割近乎完美,可视化里小类整块缺失;mDice 0.85+ 但小类 IoU 接近 0;换一个随机种子小类指标剧烈波动。
解决:

  1. 简单方法:训练用 Dice + 交叉熵组合损失并按覆盖率倒数或平方根倒数加权;评估同时报告逐类 IoU 而非只有均值。
  2. 进阶方法:引入对边界敏感的归一化表面 Dice(NSD)——官方评分正是 mIoU 与 mNSD 的几何平均(Score_s = √(mIoU × mNSD)),NSD 对细小结构(缝合针、缝线)远比体素重叠稳健。
  3. SOTA 方法:小类过采样(以包含小类的帧为单元重采样)+ copy-paste 器械粘贴增广;评估固定多随机种子报告均值 ± 标准差。
    参考:arXiv:2401.00496 Table 2(类别覆盖率)与式 (15)(Score_s 定义)。

⚠️ 坑点 4:G0 “Other” 为主的动作 Accuracy 虚高(分类:评估误用)

问题:动作标签 8 类中 G0 Other 涵盖所有非七类缝合手势的时刻,在 DVC 缝合片段中占比可观。模型学成"永远预测多数类"即可拿到不错的帧 Accuracy,但 clinically 无用。
症状:Accuracy 0.7+ 但混淆矩阵显示 G1-G7 几乎全被预测为 G0;F1(宏)远低于 Accuracy;技能评估下游应用完全失效。
解决:

  1. 简单方法:始终与 Accuracy 并行报告宏平均 F1 与逐类 F1;官方挑战的排名指标是 F1@10 而非 Accuracy。
  2. 进阶方法:按训练集手势分布做类权重或 focal loss;报告"去除 G0 后的 7 类宏 F1"作为第二口径。
  3. SOTA 方法:时序平滑解码(如 Viterbi/CRF 后处理)抑制孤帧误报,提高 G1-G7 的查准率。
    参考:arXiv:2401.00496 Table 1(手势表)与动作识别评测协议。

⚠️ 坑点 5:F1@10 的时间容差语义被忽略(分类:评估误用)

问题:官方动作指标 F1@10 允许预测在真实动作帧 ±10 帧(1 秒)窗口内匹配——这是手术视频标注边界天然模糊(手势起止没有客观物理边界)的工程折中。自研代码若按"逐帧精确匹配"计算 F1,分数会显著低于官方口径,且不可与挑战成绩比较。
症状:论文里 F1@10 0.80,自测只有 0.4-0.5,怀疑模型坏了;两类分数被混排进同一张表。
解决:

  1. 简单方法:预测帧在 [t-10, t+10] 窗口内命中同类真实帧即计 TP,去重后计算 F1——按官方评测脚本语义实现。
  2. 进阶方法:直接调用官方工具包 rarptk evaluate 对本地预测评分,杜绝口径漂移。
  3. SOTA 方法:训练目标与容差口径对齐——动作分支输出经时序最大池化(片段级)后再逐帧展开,天然扩大命中窗口。
    参考:arXiv:2401.00496 §3.2(评测协议);官方评测工具。

⚠️ 坑点 6:发布包目录约定与预测导出格式不合规(分类:工程陷阱)

问题:数据以"逐段 zip + 三目录(train1/train2/test)“约定发布,官方评测假设预测与训练集同构(每个 video_* 下有 segmentation/ PNG 与 action_discrete.txt)。zip 解压到错误层级、目录名改动或漏导出 action_discrete.txt 都会让评测静默失败或计零分。
症状:rarptk evaluate 报找不到预测;rarptk generate 生成的 mock 预测与自己的导出格式对不上;评测日志"0 frames evaluated”。
解决:

  1. 简单方法:解压后先用 rarptk generate 产出官方格式样本,再让自己的导出代码逐字段对齐(文件名位数、目录层级)。
  2. 进阶方法:把"导出预测"写成官方 generate 产物的对拍单测(目录树 diff + 文件数断言),进入 CI。
  3. SOTA 方法:训练框架的导出器直接复用官方工具包的格式定义模块,避免二次实现。
    参考:官方工具包 README(期望目录结构与预测格式)。

⚠️ 坑点 7:按帧划分或忽视术者重叠造成泄漏(分类:数据泄漏)

问题:50 段视频来自仅 8 位术者,相邻帧又高度冗余。若按帧随机划分训练/验证,验证分数虚高到不可信;即使按视频划分,训练与测试也可能出现同一术者的视频,"术者风格记忆"仍是隐性泄漏面。
症状:验证 mIoU/F1@10 很高,换一批其他医生的视频(或公开测试集官方成绩)显著回落;模型对特定器械组合的运动轨迹过拟合。
解决:

  1. 简单方法:永远按 video_id 分组划分(GroupKFold / GroupShuffleSplit)。
  2. 进阶方法:构造按术者分组的交叉验证做敏感性分析;官方论文明确披露 8 位术者与三级资历结构,可据此近似分组并声明局限。
  3. SOTA 方法:报告"同术者划分"与"跨术者划分"两组结果区间,把术者泛化差距作为模型卡片的固定字段。
    参考:arXiv:2401.00496 §4(术者构成);挑战论文中 Team-SK 单帧方法 F1@10 仅 0.145 的对照教训。

⚠️ 坑点 8:CC BY-NC-SA 传染性与二次分发合规(分类:偏倚陷阱)

问题:数据集采用 CC BY-NC-SA 4.0——非商业、相同方式共享。把掩码重标、抽帧产物或"从中提取的特征数据集"以更宽松许可(如 CC BY、MIT)二次发布会违反许可;商业产品训练用途被直接排除。
症状:论文/产品因数据许可问题被要求撤稿或下架;衍生数据集在 GitHub 收到 takedown 请求;企业团队在模型选型后期才发现数据不可商用。
解决:

  1. 简单方法:所有衍生数据集沿袭 CC BY-NC-SA 4.0 并注明来源 DOI(10.5522/04/24932529 / 10.5522/04/24932499)。
  2. 进阶方法:在模型卡片与数据卡片中固化"许可链"声明(数据许可 → 权重许可),团队内部建立数据许可台账。
  3. SOTA 方法:商用需求改走官方许可路径或更换可商用数据(如自采或采购授权数据),切勿"先商用后补救"。
    参考:CC BY-NC-SA 4.0 条款;UCL RDR 条目 Rights 字段。

§6.6 数据增强

增强 安全性 说明
水平/垂直翻转 ✅ 安全(掩码与图像同步翻转) 注意:翻转后掩码必须同步;动作标签不受影响
亮度/对比度/色调抖动 ✅ 安全 模拟光照与白平衡差异(数据集内真实存在)
高斯噪声/模糊 ✅ 安全 模拟内镜镜头降质
镜头污染物模拟(局部半透明斑) ✅ 安全 数据集真实含有镜头液体污染场景
随机缩放 0.9-1.1 + 平移 ✅ 安全 掩码用最近邻插值
器械 copy-paste(同掩码粘贴) ⚠️ 慎用 可缓解小类稀缺,但须保持部件空间一致性(腕-钳连接关系)
随机擦除大块区域 ⚠️ 慎用 可能擦掉小类目标全部像素,制造标签噪声
垂直大角度旋转(>15°) ❌ 危险 破坏重力方向下的器械/组织空间先验
时间维强增广(帧乱序/变速) ❌ 危险 破坏动作时序,动作识别任务禁止;分割任务可用时序增广但需与掩码同步
弹性形变(大弹性系数) ❌ 危险 器械是刚体,形变增广产生物理不可能样本

增强策略的三条使用原则:第一,分割任务所有空间类增广必须图像与掩码同步(同一随机参数),任何只变换图像的实现都是标签噪声制造机;第二,动作识别任务的时序增广只允许"时间平滑类"(时间抖动 ≤2 帧、速度微调),帧序打乱等效于教模型忽略动作顺序;第三,所有增广在上线前用"增广前后掩码类别像素占比不变"做一次断言测试——这是捕捉"图像转了、掩码没转"类 bug 的最低成本手段。

§6.7 模型推荐

任务 推荐模型 起步理由 挑战/文献佐证
语义分割 UNet++ / EfficientNet-B4 编码器 挑战参赛队 AIA-Noobs 实测架构,训练稳定 arXiv:2401.00496 §5.1
语义分割 Masked-Attention Transformer(MATIS 系) 冠军团队 Uniandes 后续方向,Transformer 分割头 bcv-uniandes/matis
语义分割 DeepLabV3+ / SegFormer 多尺度器械细杆结构,ASR/注意力有利 社区常用基线
动作识别 ResNet18 + LSTM(帧级特征 + 时序) 多任务冠军队 AIA-Noobs 的动作分支即此结构 arXiv:2401.00496 §5.1
动作识别 TimeSformer / Video Swin 端到端时空注意力,F1@10 上限更高 社区视频基线
动作识别 时序图卷积/多尺度 TCN 手势边界建模,挑战多队采用时序模块 论文 Related Work 综述
多任务 分割先验级联动作分支(cascade) AIA-Noobs 多任务方案:分割预测作为动作分支输入 arXiv:2401.00496 §5
多任务 共享编码器 + 双头(分割 1FPS / 动作 10Hz) 与官方双速率评估协议天然对齐 论文评测协议
小类增强 SegFormer + copy-paste / 类加权 应对 Clamps/Catheter/Needle Holder < 0.3% 覆盖率 §6.5 坑点 3 策略

§6.8 硬件需求

配置 显存/内存 适用场景
单张 24GB GPU(RTX 4090/A10) 24GB 显存 + 64GB 内存 480×640 输入的 UNet++/ResNet-LSTM 训练(挑战队 AIA-Noobs 同量级设定)
单张 80GB GPU(A100/H100) 80GB 显存 + 128GB 内存 1920×1080 全分辨率训练、Video Transformer 微调
双卡 40GB(A100 40G ×2) 80GB 总显存 + 128GB 内存 分割/动作并行调参,或按视频分组的数据并行
CPU-only 16GB 内存 索引构建、抽帧(rarptk unpack)、评测脚本演练
磁盘 ≥100 GB 压缩包 33.6 GB + 10Hz PNG 展开 + 预测导出余量

§6.9 评估指标代码

import numpy as np
import torch

def per_class_iou(pred: torch.Tensor, target: torch.Tensor, num_classes: int = 10, eps: float = 1e-7):
    """pred/target: (N, H, W) int64;返回逐类 IoU(含背景类 0)。"""
    ious = []
    for c in range(num_classes):
        p, t = pred == c, target == c
        inter = (p & t).sum().float()
        union = (p | t).sum().float()
        ious.append((inter + eps) / (union + eps))
    return torch.stack(ious)  # 报告时务必给逐类 + 宏平均两组(见坑点 3)

def nsd(pred: torch.Tensor, target: torch.Tensor, tau_px: int = 10, eps: float = 1e-7):
    """归一化表面 Dice 简化实现(二值逐类调用);
    官方评分为 mIoU 与 mNSD 的几何平均,τ 取官方协议值。"""
    try:
        from scipy.ndimage import distance_transform_edt
    except ImportError:
        raise RuntimeError("pip install scipy")
    d_pred = distance_transform_edt(~pred.bool()) <= tau_px
    d_tgt = distance_transform_edt(~target.bool()) <= tau_px
    return ((d_pred & target.bool()).sum() + (d_tgt & pred.bool()).sum() + eps) / \
           (target.bool().sum() + pred.bool().sum() + eps)

def f1_at_k(pred_seq: np.ndarray, gt_seq: np.ndarray, k: int = 10, num_classes: int = 8):
    """F1@10:预测帧 t 在真实序列 [t-k, t+k] 窗口内命中同类即 TP(去重后统计)。
    pred_seq/gt_seq: (T,) int8 动作标签。"""
    tps, fps, fns = 0, 0, 0
    matched_gt = set()
    for t, p in enumerate(pred_seq):
        if p == 0:  # 背景类不参与命中统计的口径须与官方协议核对
            continue
        lo, hi = max(0, t - k), min(len(gt_seq), t + k + 1)
        hit = next((j for j in range(lo, hi) if gt_seq[j] == p and (t, j) not in matched_gt), None)
        if hit is not None:
            matched_gt.add((t, hit)); tps += 1
        else:
            fps += 1
    fns = sum(1 for j, g in enumerate(gt_seq) if g != 0 and not any(m[1] == j for m in matched_gt))
    prec = tps / max(tps + fps, 1); rec = tps / max(tps + fns, 1)
    return 2 * prec * rec / max(prec + rec, 1e-7)

实现说明与常见偏差:per_class_iou 必须同时报告逐类值与宏平均——只报宏平均会掩盖小类崩溃(坑点 3);nsd 的容差 τ 应与官方评测协议对齐后再对外报告;f1_at_k 中背景类(G0)是否参与命中统计必须与官方 rarptk evaluate 的行为核对,口径不一致是社区分数分歧的第一大来源(坑点 5)。三者都建议用官方工具包对拍若干视频后再固化进评估管线。

§6.10 MLOps 笔记

  • 版本管理:数据以"UCL RDR v1(2024-01-23)"为唯一数据版本基线;抽帧产物用 DVC/hash 索引固化,保证掩码帧号可追溯。
  • 训练可复现:记录 seed、视频划分表(video_id 列表)、归一化统计来源;按视频划分的划分表进 git。
  • 评测口径:任何对外报告的分割分数注明"mIoU / mNSD @ 1FPS 1920×1080"、动作分数注明"F1@10(官方容差)";内部验证分数与官方测试分数永不混排。
  • 监控:小类(Clamps/Catheter/Needle Holder)逐类 IoU 作为核心监控指标;训练中若小类 IoU 持续为 0 应触发告警。
  • 合规:CC BY-NC-SA 4.0 传染条款写入模型卡片;对外权重发布注明"训练数据含 CC BY-NC-SA 内容,权重遵循相同许可约束"。
  • 回归测试:把"1 段视频端到端(抽帧→训练 1 epoch→导出→rarptk evaluate)"做成 15 分钟冒烟测试,纳入 CI;数据集发布方更新 README 或工具包时,冒烟测试是最早的报警器。
  • 产物命名:导出预测与 checkpoint 的命名带 sarrarp50_v1_{split}_{seed} 前缀,避免多实验产物在共享存储中混淆。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解建议
单中心偏倚 全部数据来自伦敦一家医院的单一机器人手术团队 高 外部验证(§5.5);报告跨数据集迁移差距
术者风格偏倚 8 位术者、三级资历;模型可能记忆个体操作模式 高 按术者分组敏感性分析(坑点 7)
阶段覆盖偏倚 仅 DVC 缝合阶段,不代表 RARP 全流程 中 不要宣称"手术阶段识别"能力;全流程任务用 Cholec80/AutoLaparo 类数据
类不平衡偏倚 小类(Clamps/Catheter/Needle Holder)覆盖率 < 0.3% 中 类加权 + 逐类指标(坑点 3)
镜头视角偏倚 仅为内镜腔内视角,无体外/俯瞰视角 低 明确声明适用域
静态人口学盲区 公开版不含患者年龄/分期等元数据 中 无法做亚组公平性分析,相关声明不得编造
时序边界模糊 手势起止无客观物理边界,标注依赖人工判断 中 采用 F1@10 官方容差口径;避免声明"精确到帧的边界检测"能力
存档时效偏倚 数据采集反映达芬奇 Si 时代的成像与器械组合,新平台(如更代机型)成像特性不同 中 部署前用目标平台视频做小规模校准测试

§7.2 标注质量

标注链路为"HITL 专家团队(临床人员督导)标注 → 2 名机器学习研究者全片复核修正",复核以整段视频上下文为参照,属人工标注中的高保障流程(arXiv:2401.00496)。未公布标注者间一致性数值;使用者可引用的客观佐证是官方测试集上最佳方法的 mIoU 0.832 / mNSD 0.868——该上限同时反映"模型能力 + 标注可学习性"。对于针、线等细小结构,掩码边界的手绘误差会系统性低估性能,宜结合 NSD 类边界指标解读。

实践中的标注质量体感参考:掩码在器械轴杆等大结构上边界稳定一致;在缝合针与缝线等亚 1% 覆盖率目标上,边界离散度明显更大(这与 Table 2 中小类覆盖率的低均值、高相对方差一致)。若下游任务对小类边界敏感(如器械-组织距离预警),建议在关键子集上做二次人工精修,并把精修集单独报告。

§7.3 泛化性风险

场景 失效风险 证据
跨医院/跨术者部署 高:单中心 + 8 术者来源,色调、器械型号组合、操作习惯迁移受限 数据集来源声明(§2.4)
跨术式(非前列腺手术) 高:仅覆盖 DVC 缝合动作与 RARP 器械组合 论文 §4 任务边界
非达芬奇平台(腹腔镜/其他机器人) 高:视角、镜头运动模式与器械形态不同 设备规格(§3.9)
全流程阶段识别 不适用:数据不含 DVC 以外阶段 论文 §4(片段选择)
测试集标注外的性能声明 无法验证:官方测试标注未公开 UCL RDR test set 条目(仅视频 + README)
跨标注体系迁移 高:其他数据集(如 CholecSeg8k 的解剖类)训练的模型无法直接迁移标签空间 类别体系对比(§1.3、§8.4)
生成式数据增强合成 未知:合成 RARP 视频与本数据的真实性差距未经验证 审慎使用,标注"合成"来源

§7.4 伦理与隐私

数据集为体内术野视频,不含患者面部与身份信息,公开版本不携带患者人口学元数据;由 UCL 在机构数据治理与资助方框架(Wellcome Trust 203145/Z/16/Z)下整理发布(DataCite 记录)。使用者仍须遵守 CC BY-NC-SA 4.0(非商业 + 相同方式共享),并避免将术野视频用于与原研究目的无关的身份推断尝试。本页不掌握原始伦理批件编号,相关合规问题应直接向 UCL Research Data Repository(researchdatarepository@ucl.ac.uk)咨询。

二次使用的三条底线:不把视频帧用于人脸/生物特征模型训练(即使理论上术野不含面部);不尝试从手术场景细节反推患者身份并公开;不在训练日志或论文配图中暴露可定位医院的场景标识组合。这些虽超出许可条款的最低要求,但属于手术视频研究的通行伦理惯例。

§7.5 公平性

数据集无患者人口学标签,无法进行跨性别/种族/年龄亚组的公平性度量;术者维度上,三级资历的覆盖是难得的公平性分析入口——可检验模型性能是否系统性偏向资深术者的操作风格(该差异直接影响"低年资手术录像是否被更差地识别"这一应用公平性问题)。任何此类分析必须先解决术者-视频映射未公开的限制,只能做间接推断并明确声明。

对产品团队的操作性建议:若模型将用于多中心部署,把"各中心术者资历构成"纳入部署前检查清单;对低年资术者视频的性能衰减应作为已知的公平性风险写进模型卡片,而不是等上线后被投诉才发现。

§7.6 数据漂移

数据集为单时间点存档(v1,2024-01-23),无持续更新承诺;真实手术场景的漂移来自三处:器械型号迭代、成像参数变更、术者团队变动。部署监控建议:以"逐类 IoU 滚动均值"为漂移哨兵,当 Tool clasper 与 Suturing needle 的线上 IoU 相对验证基线下降超过阈值(如 10%)时触发复检。

另一类易被忽视的漂移是"标注体系漂移":若团队在部署后自采数据并按自己的理解扩展手势类别(如拆分 G0 Other),新旧标签体系的模型将不可互换。自采扩展必须重新定义类别映射表并重训,不能增量混训。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式数据 ⚠️ 视频目录结构而非宽表;模态对齐需自建索引(§6.3)
2 唯一标识 ✅ video_id + 帧号构成两级唯一主键
3 特殊字符处理 ✅ 文件名均为 ASCII 安全字符
4 重复行检测 ✅ 无行级表;帧级重复仅源于近邻帧冗余,属视频数据本性
5 缺失值编码 ✅ 无缺失值问题(§4.5)
6 标签标识清晰 ✅ 9 类分割 + 8 类手势,官方论文给出类别表与定义
7 罕见类分组 ⚠️ Clamps/Catheter/Needle Holder < 0.3%,无官方分组建议
8 偏倚评估 ⚠️ 官方披露来源与术者结构,但无正式偏倚审计章节
9 数据字典 ✅ README + 官方工具包明确字段格式
10 信息性缺失解释 ✅ 不适用即不存在的情形(无信息性缺失机制)
11 设备记录 ✅ 达芬奇 Si + dVLogger + 60fps 1080i 明确披露
12 共线性检查 ✅ 不适用(非表格回归数据)
13 编码映射 ✅ 类别索引以官方 README/论文 Table 1/2 为准
14 时间戳处理 ⚠️ 无绝对时间戳;1Hz/10Hz 双速率需自行对齐(坑点 1)
15 划分建议 ✅ 官方 40/10 按手术划分且保持标签分布相近
16 泄漏讨论 ⚠️ 官方未讨论术者重叠泄漏;需自行按 §5.3 处理
17 标签分布 ✅ 论文给出类别覆盖率(Table 2)与划分分布图(Fig 3)
18 测量偏倚 ⚠️ 手势起止边界主观性未量化;标注一致性数值未公布
19 外部验证建议 ✅ 可迁移公共类至 EndoVis 2017/CholecSeg8k(§5.5)
20 版本记录 ⚠️ UCL RDR v1 单版本,无 changelog;挑战版(2022)与存档版(2024)内容一致性未声明
21 预处理脚本 ✅ 官方 rarptk 提供 unpack/generate/evaluate 三命令
22 合规要求 ✅ CC BY-NC-SA 4.0 明确;无注册门槛,合规成本低但非商业约束硬
23 多模态对齐 ⚠️ 双模态标注存在但双采样率对齐责任在使用者(官方仅给评估口径)
24 去标识化 ✅ 术野视频无面部/身份信息;开放发布经机构治理

DAIMS 评分:19.5 / 24(✅ 15 项 × 1 + ⚠️ 9 项 × 0.5)

评分解读:这是一个"结构干净、标注可信、但对使用者提出较高工程自律要求"的数据集——硬伤几乎为零(无缺失、无脏字段、许可清晰),扣分集中在两类:一是双采样率与抽帧对齐的工程责任被交给使用者(第 1、14、23 项),二是元数据透明度的先天缺口(术者映射、标注一致性数值、采集日期未公布,第 8、16、18、20 项)。

对你意味着什么:(1)把它当"省心数据"用是对的——下载即用、无申请摩擦、官方脚本护住评测口径;(2)投入第一个 sprint 的正确顺序是:跑通 rarptk → 建立 §6.3 索引表 → 按 video 划分 → 逐类 IoU 看板,先别急着上大模型;(3)如果项目要对外声明"医学严谨性",务必补上数据集不给的两块拼图:标注一致性自测(抽 100 帧双人重标算 Dice)与跨术者敏感性分析,这两块空缺正是审稿人最容易攻击的位置;(4)商用前景先否定再评估——NC-SA 条款没有变通空间,别在架构定型后才碰壁。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
SAR-RARP50 官方测试集(video 41-50,组织方持有标注) UCL / EndoVis 2022 器械分割 + 动作识别 Score_s = √(mIoU×mNSD) = 0.850;Score_a = 0.799(冠军 Uniandes) — 真实体内数据上的官方上限;多任务与单任务几乎持平(0.850 vs 0.847;0.799 vs 0.804)
手术错误检测下游任务(SEDMamba) UCL 从 SAR-RARP50 派生的错误检测标注上训练时序模型 见 SEDMamba 论文(arXiv:2406.15920)与派生数据集 DOI 10.5522/04/27992702 — 证明 SAR-RARP50 的动作标注可支撑"错误检测"这类更细粒度下游任务的再标注与训练
CNN vs Transformer 系统性基准 —(2026 arXiv 预印本) 器械分割 见 arXiv:2604.09151 — 在 SAR-RARP50 上系统比较 CNN 与 Transformer 分割模型(预印本,引用时注明同行评审状态)

⚠️ 声明:截至 2026-09,尚未见在独立机构、独立术者群体上对 SAR-RARP50 训练模型做前瞻性外部验证的同行评审发表;上表第一行为官方挑战测试(非跨机构外部验证),跨机构泛化差距目前只能由使用者自行量化。

自行设计外部验证的四个要点:(1)先声明标签映射——SAR-RARP50 的部件级类别在其他数据集没有一一对应,只测可映射类并写明映射表;(2)报告"逐视频"而非只报均值——单中心数据的跨集失败往往是视频级的(个别镜头条件崩塌);(3)把官方挑战成绩当作内部锚点而非外部证据——官方测试集仍是同一中心同一标注体系;(4)若目标是临床声明,外部验证必须覆盖至少一个非伦敦、非达芬奇 Si 平台的数据源,否则结论限定为"同平台跨患者泛化"。


§8 基准性能与生态

§8.1 官方挑战排行榜

以下为 EndoVis 2022 SAR-RARP50 官方挑战成绩(完整来源:Psychogyios et al., 2024, arXiv:2401.00496,12 支队伍、3 个赛道)。数值不可直接跨榜比较:官方测试标注不公开,后续论文多在训练集内部划分上自评,评测协议(容差、划分、分辨率)各不相同;即使同在官方测试集,单任务与多任务赛道的指标定义也不同。

排名 队伍 赛道/成绩 年份 关键技术 完整引用 代码
1 Uniandes 多任务综合 0.824(Score_s 0.850:mIoU 0.832/mNSD 0.868;Score_a 0.799:F1@10 0.823) 2022 双速率多任务架构,按任务各自优化采样率 Psychogyios et al., 2024, arXiv:2401.00496(挑战报告) bcv-uniandes/grasp · bcv-uniandes/matis
2 AIA-Noobs 多任务综合 0.706;单任务分割同分 2022 EfficientNetB4+UNet++ 分割,分割预测级联 ResNet18+LSTM 动作分支;1Hz 先验向 10Hz 传播 同上 §5.1 —
3 SummerLab-AI 多任务综合 0.625 2022 双任务联合训练,动作标签下采样至 1Hz 对齐 同上 §5 —
4 Team-SK 多任务综合 0.456(F1@10 仅 0.145) 2022 单帧预测、无时间上下文——F1@10 崩塌的直接证据 同上 §5 —

单任务赛道:Uniandes 分割 Score_s 0.847、动作 Score_a 0.804 均列前茅(挑战报告含全部 9 个分割方法与 7 个动作方法的逐视频得分表)。

单任务赛道 最佳成绩 备注
语义分割 Score_s 0.847(Uniandes) 与其多任务版 0.850 几乎持平
动作识别 Score_a 0.804(Uniandes) 与其多任务版 0.799 几乎持平

单任务与多任务的逐赛道对照是本挑战最重要的实验资产:同一团队在同一框架下同时报告两种模式,天然排除了实现差异的干扰。

参考训练配置(摘自挑战报告 §5 各队方法描述,可直接作为复现起点):

队伍/任务 输入与架构 关键超参
AIA-Noobs 分割 480×640 输入;EfficientNetB4(ImageNet 预训练)编码器 + UNet++ 解码器 Dice + 交叉熵等权损失;Ranger21 优化器,lr 1e-3;100 epochs;batch 16;7:3 划分;TTA(原图与水平翻转预测取平均)
AIA-Noobs 增广 — ±15° 随机旋转、±10° 随机剪切、90-100% 随机缩放
AIA-Noobs 多任务 分割预测 → ResNet18 特征提取 → 2 层 LSTM(128 单元)动作分类 级联结构(坑点 1 的"传播策略"配套实现)

这些配置的价值在于"可对表":论文同时给出了各配置的官方测试成绩,任何偏离配置的复现实验都能把分数差异归因到具体改动。

§8.2 SOTA 总结与选型建议

  • 分割:官方上限 mIoU ≈ 0.83 / mNSD ≈ 0.87。选型从 UNet++/EfficientNet 起步即可逼近;要继续抬升,把预算花在小类策略(过采样 + NSD 导向损失)而非骨干升级。
  • 动作识别:官方 F1@10 ≈ 0.82。时间上下文是决定性变量——无时序模型的单帧方法 F1@10 只有 0.145;任何"轻量实时方案"先解决时序再谈轻量。
  • 多任务:挑战证据表明收益有限(±0.003 量级);把它作为"标注协同利用"的手段而非性能手段来立项。
  • 评估纪律:内部划分分数只与内部划分比较;引用官方数字时注明"官方测试集、组织方评测"。
  • 小类策略优先级:先上类加权 + NSD 指标(零训练成本),再考虑过采样与 copy-paste(中成本),最后才是专门的记忆增强/元学习方案(高成本)——多数项目在前两级就够用。
  • 选型决策树:先明确任务——只做分割 → UNet++/SegFormer + 小类策略;只做动作 → 时序模型是必选项,从 ResNet+LSTM 起步;两者都要 → 先分别达到单任务水平,再尝试共享编码器,以"不降分"为多任务验收线(冠军经验:多任务不保证加分)。

§8.3 评测协议

赛道 评估采样 指标 汇总公式
语义分割 1FPS,1920×1080 逐类 IoU、归一化表面 Dice(NSD) mIoU、mNSD;Score_s = √(mIoU × mNSD)
动作识别 10Hz 逐帧 F1@10(±10 帧 = 1 秒时间容差) Score_a
多任务 双速率并行 分割 + 动作各按上述口径 Score_mt = √(Score_a × Score_s)

官方还做了排名稳定性分析:以逐视频重采样检验各队名次稳健性,冠军 Uniandes 在分割、动作与多任务三个赛道的名次均获稳定性分析确认(arXiv:2401.00496)。预测导出与本地复算用官方 rarptk generate + rarptk evaluate(工具包);自研评测代码与官方脚本对拍通过前,不应把自测分数写进论文。

数据集 与 SAR-RARP50 关系 适用
RARP45 前身(45 段、仅动作标注);SAR-RARP50 为其超集 只做动作识别且需更大视频池时
EndoVis 2017 器械分割 同系列早期挑战(受控短序列) 跨挑战时间维比较器械分割演进
Cholec80 跨术式阶段标注基准 全流程阶段识别与迁移测试
CholecSeg8k 跨术式全场景分割 解剖结构分割补充(SAR-RARP50 无解剖类)
AutoLaparo 跨术式阶段标注 阶段任务跨数据验证
SurgToolLoc / CholecTriplet2022 同期 EndoVis 2022 姊妹挑战 器械定位/动作三元组方向的同期方法横向参考(任务定义不同,分数不可比)

§8.5 关键论文 Top 5

  1. Psychogyios, D., Colleoni, E., Van Amsterdam, B., et al. (2024). SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge. arXiv:2401.00496. — 数据集与挑战的官方报告:协议、标注、全部参赛方法与成绩(引用一切基准数字时的唯一来源)。
  2. Psychogyios, D., et al. (2023). RARP45 视频数据集工作(SAR-RARP50 前身,见 arXiv:2401.00496 参考文献 [61])。— 动作标注的原始出处与 45 段视频构成。
  3. Colleoni, E., et al. (2024). MATIS: Masked-Attention Transformers for Surgical Instrument Segmentation. arXiv:2303.09514. — 冠军团队 Uniandes 的 Transformer 分割方法线(含 SAR-RARP50 评测)。
  4. SEDMamba 团队(UCL)(2024). SEDMamba: Enhancing Selective State Space Modelling … for Efficient Error Detection in Robot-Assisted Surgery. arXiv:2406.15920;派生数据集 DOI 10.5522/04/27992702. — SAR-RARP50 动作标注再利用做手术错误检测的示范。
  5. CNN/Transformer 分割系统基准 (2026). Benchmarking CNN- and Transformer-Based Models for Surgical Instrument Segmentation in Robotic-Assisted Surgery. arXiv:2604.09151. — 在 SAR-RARP50 上的近期系统性模型比较(预印本)。
  6. 官方评测工具包 (2022). SAR_RARP50-evaluation. GitHub(MIT 许可). — 评测协议的可执行实现,与论文 §3 互为对照。

§8.6 社区活跃度

Google Scholar 引用 68+(截至 2026-09),引用曲线自 2024 年公开存档后逐年上升;官方工具包 14 stars / 2 forks(截至 2026-09),Issues 少但挑战论文附录的逐视频成绩表承担了主要"社区基准"职能;Uniandes 团队的 matis/grasp 仓库是最高质量的复用起点。整体属于"稳定中产"生态:不似 Cholec80 有持续排行榜,但作为 EndoVis 官方资产长期可引用。

§8.7 生态快照

资源 类型 链接 活跃度(截至 2026-09) 推荐理由
UCL RDR 项目页 官方数据主页 rdr.ucl.ac.uk 项目 191091 持续托管 权威入口,train/test 双 DOI 汇总
官方评测工具包 代码 surgical-vision/SAR_RARP50-evaluation MIT,14 stars 抽帧/生成/评测三件套,评测口径唯一真相源
挑战报告论文 论文 arXiv:2401.00496 引用 68+ 协议与全部成绩
EndoVis 总页 挑战门户 endovis.grand-challenge.org 持续维护 2022 五个子挑战上下文与历史系列
bcv-uniandes/matis 代码 github.com/bcv-uniandes/matis PyTorch 冠军团队 Transformer 分割实现
bcv-uniandes/grasp 代码 github.com/bcv-uniandes/grasp PyTorch 冠军团队相关方法实现
HITL 标注服务 标注方 humansintheloop.org — 标注协议背景理解

生态使用建议:入门路径为"工具包 README → 挑战报告论文 §3(评测协议)→ §5(各队方法)";复现路径以 matis/grasp 仓库为骨架改造成自己的训练脚本最快;做评测对拍时唯一可信基准是官方工具包 + 论文 per-video 成绩表。

社区结构的另一面是"引用分散":不少使用 SAR-RARP50 的论文只引数据 DOI 不引挑战报告,导致方法细节(协议、类别定义)溯源困难。本页建议的完整引用三件套——挑战报告论文 + 数据 DOI + 工具包——能让审稿人在两跳内验证任何声明。


§9 相关资源与引用

§9.1 官方资源清单

以上链接均于 2026-09-12 验证可达;UCL RDR 为持久性仓储(train/test 条目各带 DOI),论文与代码链接随 arXiv/GitHub 稳定性变化,引用时以 DOI 为准。

§9.2 BibTeX 引用块

@misc{psychogyios2024sarrarp50,
  title         = {{SAR-RARP50}: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge},
  author        = {Psychogyios, Dimitrios and Colleoni, Emanuele and Van Amsterdam, Beatrice and Li, Chih-Yang and Huang, Shu-Yu and Li, Yuchong and Jia, Fucang and Zou, Baosheng and Wang, Guotai and Liu, Yang and Boels, Maxence and Huo, Jiayu and Sparks, Rachel and Dasgupta, Prokar and Granados, Alejandro and Ourselin, Sebastien and Xu, Mengya and Wang, An and Wu, Yanan and Bai, Long and Ren, Hongliang and Yamada, Atsushi and Harai, Yuriko and Ishikawa, Yuto and Hayashi, Kazuyuki and Simoens, Jente and DeBacker, Pieter and Cisternino, Francesco and Furnari, Gabriele and Mottrie, Alex and Ferraguti, Federica and Kondo, Satoshi and Kasai, Satoshi and Hirasawa, Kousuke and Kim, Soohee and Lee, Seung Hyun and Lee, Kyu Eun and Kong, Hyoun-Joong and Fu, Kui and Li, Chao and An, Shan and Krell, Stefanie and Bodenstedt, Sebastian and Ayobi, Nicolas and Perez, Alejandra and Rodriguez, Santiago and Puentes, Juanita and Arbelaez, Pablo and Mohareri, Omid and Stoyanov, Danail},
  year          = {2024},
  eprint        = {2401.00496},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  note          = {EndoVis 2022 challenge report; journal version: Medical Image Analysis}
}

@dataset{sarrarp50_train_2024,
  title       = {{SAR-RARP50} train set},
  author      = {Psychogyios, Dimitris and Van Amsterdam, Beatrice and Colleoni, Emanuele and Stoyanov, Danail},
  year        = {2024},
  publisher   = {University College London},
  doi         = {10.5522/04/24932529},
  url         = {https://rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_train_set/24932529},
  license     = {CC-BY-NC-SA-4.0}
}

@dataset{sarrarp50_test_2024,
  title       = {{SAR-RARP50} test set},
  author      = {Psychogyios, Dimitris and Van Amsterdam, Beatrice and Colleoni, Emanuele and Stoyanov, Danail},
  year        = {2024},
  publisher   = {University College London},
  doi         = {10.5522/04/24932499},
  url         = {https://rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_test_set/24932499},
  license     = {CC-BY-NC-SA-4.0}
}

@software{sarrarp50_toolkit_2022,
  title       = {{SAR\_RARP50} evaluation toolkit},
  author      = {Psychogyios, Dimitris and contributors},
  year        = {2022},
  publisher   = {GitHub},
  url         = {https://github.com/surgical-vision/SAR_RARP50-evaluation},
  license     = {MIT}
}

@misc{colleoni2024matis,
  title         = {{MATIS}: Masked-Attention Transformers for Surgical Instrument Segmentation},
  author        = {Colleoni, Emanuele and others},
  year          = {2024},
  eprint        = {2303.09514},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV}
}

§9.3 引用指南

  • 使用数据本身:引用论文 BibTeX + 所用子集的 dataset DOI(训练/测试分开引用)。
  • 引用基准数字:必须同时给出"官方测试集(组织方评测)"或"内部划分(自行复现)"的口径限定,并引用挑战报告。
  • 引用类别体系:9 类分割与 8 类手势以挑战报告 Table 1/Table 2 为准,注明版本(arXiv v2,2024-01-23)。
  • 引用本 Wiki:标注"千方病案医数集 SAR-RARP50 条目,审核日期 2026-09-05";本页不是数字的原始出处,请回溯 §10.3 来源列表引用一手文献。
  • 许可声明:任何使用该数据训练的模型或衍生数据集在发布时附 CC BY-NC-SA 4.0 声明与数据 DOI(见 §9.2 dataset 条目)。

§10 AI 使用声明卡

§10.1 参与内容生产的 AI 模型

模型 用途
CodeBuddy Code(fast-model) 检索结果整合、章节撰写、代码示例生成
WebSearch / WebFetch / DataCite API 检索 官方事实源定位与元数据核验(由上述模型编排调用)

§10.2 AI 参与范围

AI 负责检索资料的归纳、结构化与初稿撰写;全部事实性数字均回溯至 §10.3 所列来源,由人工按"数字必须可溯源"原则核验;代码示例经逻辑审查但未在真实数据副本上端到端执行验证。

具体边界:检索、事实抽取、章节组织、代码起草、表格制作由 AI 完成;来源取舍(以官方论文、DataCite、GitHub 官方仓库为一级来源)、数字复核、医学表述审读、坑点与建议的临床合理性判断由人工完成;页面中不存在无来源的规模数字、日期或许可信息。

§10.3 输入来源(检索于 2026-09-12)

  1. Psychogyios, D., et al. (2024). SAR-RARP50 Challenge. arXiv:2401.00496. https://arxiv.org/abs/2401.00496
  2. 挑战报告 HTML 全文(含 Table 1/2、式 11-17、§4/§5):https://arxiv.org/html/2401.00496 与 https://ar5iv.arxiv.org/html/2401.00496
  3. UCL RDR 项目页:https://rdr.ucl.ac.uk/projects/SAR-RARP50_Segmentation_of_surgical_instrumentation_and_Action_Recognition_on_Robot-Assisted_Radical_Prostatectomy_Challenge/191091
  4. 训练集条目:https://rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_train_set/24932529
  5. 测试集条目:https://rdr.ucl.ac.uk/articles/dataset/SAR-RARP50_test_set/24932499
  6. DataCite 训练集记录(大小 26,952,409,628 字节、许可、资助):https://doi.org/10.5522/04/24932529
  7. DataCite 测试集记录(大小 6,607,375,225 字节、ORCID、资助 203145/Z/16/Z):https://doi.org/10.5522/04/24932499
  8. B2FIND 测试集聚合记录(文件构成线索):https://b2find.eudat.eu/dataset/6ba96c29-c51d-5067-b4d3-c34f5dc33c8f
  9. 官方评测工具包 README(目录结构、rarptk 用法、MIT):https://github.com/surgical-vision/SAR_RARP50-evaluation
  10. EndoVis 官方总页(2022 子挑战列表):https://endovis.grand-challenge.org/
  11. bcv-uniandes/matis 仓库与论文:https://github.com/bcv-uniandes/matis ;arXiv:2303.09514
  12. bcv-uniandes/grasp 仓库:https://github.com/bcv-uniandes/grasp
  13. SEDMamba 论文与派生数据集:https://arxiv.org/abs/2406.15920 ;https://doi.org/10.5522/04/27992702
  14. 手术分割基准预印本:https://arxiv.org/abs/2604.09151
  15. Humans In The Loop 标注服务:https://humansintheloop.org/
  16. CC BY-NC-SA 4.0 条款文本:https://creativecommons.org/licenses/by-nc-sa/4.0/legalcode
  17. Google Scholar 引用计数页(SAR-RARP50 条目,引用 68+):scholar.google.com 检索快照

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
规模数字(50/40/10 视频、12,998/3,252 帧、9 类、8 类) 千方病案医学编辑部 对照 arXiv:2401.00496 摘要与 §4 原文逐项核对 ✅ 已通过/已验证
DOI、大小、许可、发布日期 千方病案医学编辑部 对照 DataCite API 记录逐字段核对 ✅ 已通过/已验证
挑战成绩与评测公式 千方病案医学编辑部 对照挑战报告 Table 16 与式 (15)(17) 核对 ✅ 已通过/已验证
工具包用法与目录约定 千方病案医学编辑部(数据工程) 对照 GitHub README 核对 ✅ 已通过/已验证
§2 医学背景 千方病案医学编辑部 医学编辑审读(ICD-11 2C82、DVC 缝合临床语义) ✅ 已通过/已验证
代码示例 千方病案医学编辑部(数据工程) 静态逻辑审查 + 与官方协议口径一致性核对 ✅ 已通过/已验证
引用次数与社区活跃度 千方病案医学编辑部 Google Scholar 检索快照核对(截至 2026-09) ✅ 已通过/已验证
§4 数据结构与 §5 划分建议 千方病案医学编辑部(数据工程) 与官方工具包目录约定、论文 §4 交叉核对 ✅ 已通过/已验证
§8 基准数字与口径限定 千方病案医学编辑部 逐项对照挑战报告 Table 16 与单任务赛道分数 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全部章节由 AI 整合检索证据起草;§1.0 速览、§6.5 坑点与 §7.7 解读段含 AI 基于来源事实的分析性表述,均以 §10.3 来源为事实边界,无来源支撑的数字一律未写入。分析性段落(选型建议、工程策略)为编辑经验判断,供参考而非唯一实践;对官方协议的任何歧义,以挑战报告论文与官方工具包代码为准。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • cholect50 — 共享标签:医学影像 / 生理信号 / 手术视频 / 内窥镜影像 / 步态与运动
  • saras-esad — 共享标签:医学影像 / 生理信号 / 手术视频 / 内窥镜影像 / 步态与运动
  • EndoVis-Challenges — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • cholecseg8k — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • autolaparo — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • endoscapes — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • vitaldb — 共享标签:医学影像 / 生理信号 / 手术视频
  • Kvasir-HyperKvasir — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • heico — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • SLAM-3D-Endoscopic — 共享标签:医学影像 / 手术视频 / 内窥镜影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集