PhaKIR (phakir) — 腹腔镜胆囊切除三任务联合标注(相位+器械关键点+实例分割)多机构视频数据集 — AI-Ready Wikipedia

8 段完整腹腔镜胆囊切除视频、3 家德国医院、同一批序列上联合标注 8 相位 × 19 器械类实例分割 × 2-4 关键点,Zenodo 受限申请制分发、CC BY-NC-SA 4.0,EndoVis 2024 子挑战

来源 8 段腹腔镜胆囊切除术完整视频(MP4, 25 fps, 1920×1080)+ 相位 CSV + 关键点 JSON + 器械实例分割 PNG 掩码 + 剪切索引 CSV,源自 TUM/Heidelberg/Weilheim 三家德国医院,由 ReMIC Lab 组织标注发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
PhaKIR (phakir) — 腹腔镜胆囊切除三任务联合标注(相位+器械关键点+实例分割)多机构视频数据集 — AI-Ready Wikipedia

信息速览

数据集名称PhaKIR (phakir) — 腹腔镜胆囊切除三任务联合标注(相位+器械关键点+实例分割)多机构视频数据集 — AI-Ready Wikipedia
数据类型视频数据,人工标注,影像数据
规模8 段完整手术视频(对应 8 例手术;患者级人口学信息未披露);机构:TUM Rechts der Isar 6 + Heidelberg 1 + Weilheim-Schongau 1
接入方式8 段腹腔镜胆囊切除术完整视频(MP4, 25 fps, 1920×1080)+ 相位 CSV + 关键点 JSON + 器械实例分割 PNG 掩码 + 剪切索引 CSV,源自 TUM/Heidelberg/Weilheim 三家德国医院,由 ReMIC Lab 组织标注
AI 就绪度

INFOBOX — PhaKIR 一屏速览

维度 内容
本质 腹腔镜胆囊切除完整手术视频的多机构三任务联合标注数据集(相位 + 器械关键点 + 器械实例分割)
团队 OTH Regensburg ReMIC Lab(通讯 Tobias Rueckert / Christoph Palm);TUM Rechts der Isar、Heidelberg、Weilheim-Schongau 参与
数据论文 Data in Brief 2026;68:113147(doi:10.1016/j.dib.2026.113147;arXiv:2511.06549,2025-11-09)
结果论文 Medical Image Analysis 2026;109:103945(doi:10.1016/j.media.2026.103945;arXiv:2507.16559)
挑战赛 EndoVis 2024 子挑战(挂靠 MICCAI 2024),2024-09-17 提交截止
视频 8 段完整视频:TUM MRI 6 + Heidelberg 1 + Weilheim-Schongau 1;25 fps / 1920×1080
时长 28:31–57:03 分钟,合计 323:55 ≈ 5 小时 24 分
相位 8 类(Cholec80 七相位 + Undefined),25 fps 逐帧,共 486,875 帧
分割 19 器械类,区分同类不同实例;1 fps,共 19,475 帧;RGB 掩码(R/G 定类、B 定实例)
关键点 每器械 2–4 个关键点(Tip / ShaftPoint / EndPoint)+ COCO 可见性;1 fps
标注团队 1 名资深外科医生 + 3 名医学受训学生,三轮复核,分割多实例多类 DSC 83.64%
获取 受限申请制:Zenodo 10.5281/zenodo.15740620,注册登录 → 填 Access Request Form → 审批邮件授权
许可 CC BY-NC-SA 4.0(非商业 + 相同方式共享);引用须同时引数据论文 + 挑战论文 + HeiChole 论文
库内互链 cholec80(78)、cholecseg8k(233)、cholect50(223)、endovis-challenges(79)、m2cai16-tool(303)、autolaparo(313)、endoscapes(353)、endoslam(408)
一句话 把"一台腹腔镜胆囊切除手术"在同一份完整视频上同时拆成"此刻是哪一步(相位)+ 器械在画面里的骨架(关键点)+ 器械的每个像素属于谁(实例分割)"三类标签,并用多中心数据逼出模型的泛化短板

PhaKIR 是一个"一台手术,三双眼睛"的数据集:它不满足于只回答"这是手术的哪一步",而是把同一段腹腔镜胆囊切除视频同时拆解成三个互补的问题——时间上的相位识别(现在处于哪个手术阶段)、空间上的器械关键点估计(器械的骨架在哪)、像素上的器械实例分割(画面里每个像素属于哪把器械、属于哪一把中的哪一个实例)。更关键的是,这三套标签不是拼凑自不同来源,而是在同一批完整序列上联合标注,并来自三家德国医院。这种"三任务 × 多机构 × 完整序列"的三角结构,在手术视频数据集谱系中找不到第二个样本。

PhaKIR 的名字本身就是任务宣言:Phase(相位)+ Keypoint(关键点)+ Instrument Recognition(器械识别)。它为 EndoVis 2024 挑战赛而生,挑战结束后以数据论文(Data in Brief 2026)+ 结果论文(Medical Image Analysis 2026)两篇正式发表,数据托管于 Zenodo,采用受限申请制分发(这一点务必注意,见 §6)。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——PhaKIR 是受限申请制,没有公开直链,需注册登录 Zenodo 后填表申请,别指望直接 curl 下载。
  2. 关心任务设计:直奔 §4 与 §5——相位/关键点/器械三套标签的定义、粒度(25 fps vs 1 fps)、编码方式(RGB 掩码、COCO 可见性)都在那里。
  3. 做手术视频模型评测:直奔 §7 与 §9——挑战赛三任务的排名、泛化性结论,以及与 Cholec80 / CholecSeg8k / EndoVis 族的互链关系。

§0 导读:这个数据集解决什么问题

0.1 手术视频理解的三类问题

腹腔镜手术视频是计算机视觉在医疗领域最"重资产"的数据形态之一:它同时包含时间维度(一场手术是长序列,跨越数十分钟到数小时)、空间维度(器械、器官、组织的二维投影)和语义维度(不同阶段、不同器械、不同操作意图)。围绕它,学界长期分别攻关三类任务:

  1. 手术相位识别(surgical phase recognition):把整段手术视频切分为若干语义阶段(如"准备"“胆囊三角解剖”“夹闭与剪断”),本质是长序列时序分类问题。
  2. 器械实例分割(instrument instance segmentation):在每一帧内标出每把器械的像素轮廓,并区分不同器械(甚至同一类的不同实例),本质是实例级稠密预测问题。
  3. 器械关键点估计(instrument keypoint estimation):定位器械的骨架点(尖端、轴尖交界、入画端点),本质是结构化位姿回归问题。

三个任务的数据需求截然不同:相位识别需要逐帧的长序列标签,实例分割需要像素级的高质量掩码,关键点估计需要结构化的几何标注。昂贵之处在于——它们看起来高度相关,却往往分布在不同数据集里,标注口径不一、机构来源不同,导致研究者难以在同一批数据上做联合验证。

0.2 PhaKIR 的答案:同一序列的联合标注

PhaKIR 的选择是在同一个完整序列上同时给出三套标签。这使得:

  • 相位标签的时间边界与分割/关键点的空间标注天然对齐(同一帧既能问"现在哪一步"也能问"器械在哪");
  • 研究者可以用同一份数据训练多任务模型,研究任务间共享表征的收益;
  • 多任务评估可以做到视频级一致(leave-one-video-out / leave-one-hospital-out),避免跨数据集拼接带来的口径污染。

0.3 为什么"多机构"是核心卖点

手术视频的域偏移(domain shift)远比自然图像严重:不同医院的内窥镜相机系统、光源、白平衡、镜头视角、手术习惯各不相同。单机构数据集上训出的模型,换一家医院往往性能断崖。PhaKIR 用3 家德国医院的 8 段视频直接把这个痛点摆上台面——挑战赛的核心结论之一正是"方法跨医学中心的泛化性普遍较差"(见 §7)。这不是数据集的缺陷,而是它刻意保留的真实分布。

0.4 与库内已有条目的边界

千方病案医数集库内已有一批手术视频与内窥镜条目(Cholec80、CholecSeg8k、CholecT50、AutoLaparo、Endoscapes、SLAM 系等),它们的定位各不相同(见 §9 家族图谱)。PhaKIR 的边界很清晰:它不是单任务数据集(不像 Cholec80 只做相位、CholecSeg8k 只做语义分割),也不是单机构数据集(不像多数腹腔镜数据集来自单一中心),而是"相位 + 关键点 + 实例分割 × 多机构"的联合体。查重确认:库内无任何 phakir 同名字段(DB %phakir% 查询 0 行),不撞库。

0.5 阅读本条目之前需要建立的三个概念

概念一:相位(phase)不是"动作"(action)。 相位是时间上粗粒度的阶段(如"胆囊三角解剖"持续数分钟),动作是时间上细粒度的操作(如"用钩刀切一下"持续数秒)。PhaKIR 标的是相位,不是动作。若你想找动作级标注,应转看 CholecT50(器械-动词-目标三元组,见 §9)。

概念二:实例分割(instance segmentation)不是语义分割(semantic segmentation)。 语义分割只问"这个像素是不是 Grasper",实例分割还要问"是哪一把 Grasper"。PhaKIR 要求后者——这正是它用 B 通道编码实例身份的原因(§3.2.2)。

概念三:关键点估计(keypoint estimation)不是目标检测(object detection)。 检测给的是"包围盒",关键点给的是"骨架点"(尖端、轴尖交界、入画端点)。关键点携带器械的几何位姿信息,对机器人辅助手术的器械运动建模更有价值。

这三组概念区分清楚了,才能理解 PhaKIR 相较于库内其他条目的独特定位。

0.6 PhaKIR 的数据血缘:它是"新采集 + 复用"的混合体

PhaKIR 的 8 段视频并非全部新采集:

  • 7 段来自新采集/新整理(TUM Rechts der Isar 6 段 + Weilheim-Schongau 1 段);
  • 1 段为既有数据复用(Heidelberg 的 Video 11 = HeiChole2.mp4,来自 HeiChole 挑战数据集,被 PhaKIR 重新标注以统一口径)。

这一血缘带来了三重后果,读者必须知晓:① PhaKIR 的许可继承自 HeiChole(CC BY-NC-SA);② 使用 PhaKIR 必须同时引用 HeiChole 论文;③ PhaKIR 的器械类别体系与 HeiChole 的 21 器械类不完全相同(PhaKIR 为 19 类),Video 11 的标签经过了重新映射。重标前后的差异幅度,数据论文未量化(§9 遗留疑点 6)。

0.7 本条目与"AI-Ready"的关系

本条目属于千方病案医数集的 AI-Ready Wikipedia 系列。所谓 AI-Ready,指条目内容经过结构化整理,可直接被检索、引用、抽取为结构化字段:硬数字集中在 §4 与事实清单,口径冲突集中在 §9 与附录 G,获取流程集中在 §5 与附录 D,坑点集中在 §10。若你是作为自动化系统在读取本条目,建议按"§4 硬数字 → §9 口径 → §5 获取"的顺序抽取。

§1 数据集速览:十问十答

Q1:PhaKIR 是什么?
PhaKIR(Surgical Procedure Phase, Keypoint, and Instrument Recognition)是一个腹腔镜胆囊切除完整手术视频的多机构多任务数据集,为 EndoVis 2024 挑战赛构建,含 8 段完整手术视频,对同一批序列联合标注手术相位、器械关键点与器械实例分割三套标签。

Q2:数据从哪来?
三家德国医院:TUM University Hospital Rechts der Isar (MRI)(6 段)、Heidelberg University Hospital (UKHD)(1 段)、Weilheim-Schongau Hospital (KWS)(1 段)。组织方为 OTH Regensburg 的 ReMIC Lab。

Q3:一共多少数据?
8 段完整视频,25 fps、1920×1080,时长 28:31–57:03 分钟(合计 323:55 ≈ 5 小时 24 分)。相位标注 486,875 帧(逐帧),分割与关键点各 19,475 帧(1 fps 抽样)。

Q4:有几种任务?
三任务:① 手术相位识别(8 类,25 fps 逐帧);② 器械实例分割(19 类 + 实例身份,1 fps);③ 器械关键点估计(每器械 2–4 点 + COCO 可见性,1 fps)。

Q5:相位分哪几类?
采用 Cholec80 的七相位体系并扩展一个 Undefined(过渡帧)→ 共 8 类:P0 Undefined、P1 Preparation、P2 Calot triangle dissection、P3 Clipping and cutting、P4 Gallbladder dissection、P5 Gallbladder packaging、P6 Cleaning and coagulation、P7 Gallbladder retraction。

Q6:分割分哪几类?
19 个器械类别(Argonbeamer、Bipolar-Clamp、Blunt-Grasper、Blunt-Grasper-Curved、Blunt-Grasper-Spec.、Clip-Applicator、Dissection-Hook、Drainage、Grasper、HF-Coag.-Probe、Hook-Clamp、Needle-Probe、Overholt、Palpation-Probe、PE-Forceps、Scissor、Sponge-Clamp、Suction-Rod、Trocar-Tip),并区分同类器械的不同实例。

Q7:关键点是什么?
每器械 2–4 个类别相关关键点:Tip(器械尖端,可开合器械有 2 个)、ShaftPoint(SP,轴-尖交界)、EndPoint(EP,器械入画边界端点);每点附 COCO 式可见性(visible=2 / occluded=1 / not available=0)。

Q8:怎么获取?
受限申请制:Zenodo 记录 10.5281/zenodo.15740620 状态为 Restricted,需注册登录 Zenodo → 填写 Access Request Form → 审批通过后邮件授权。没有公开直链。

Q9:许可是什么?
CC BY-NC-SA 4.0(署名—非商业—相同方式共享)。继承自 PhaKIR 挑战数据集与 HeiChole 挑战数据集(两者原以 CC-BY-NC-SA 发布),新创作品必须沿用完全相同的条款。

Q10:怎么引用?
任何全部或部分使用本数据集的工作必须引用三篇:① 数据集出版(Data in Brief / arXiv:2511.06549)② 挑战论文(MedIA 2026 / arXiv:2507.16559)③ HeiChole 挑战出版(Wagner 等 2023, MedIA 86:102770)。

§2 数据构成与规格

2.1 规模、来源与机构构成

PhaKIR 的数据本体是 8 段完整的腹腔镜胆囊切除手术视频。所谓"完整",指从手术开始到结束的连续录制,而非片段剪辑——这正是相位识别任务能够成立的前提(相位转换必须落在连续时间轴上)。

机构分布如下表:

机构 代号 视频段数 说明
TUM University Hospital Rechts der Isar MRI 6 主贡献中心,含 Video 1/2/3/4/5/7 等
Heidelberg University Hospital UKHD 1 Video 11,即 HeiChole2.mp4 的重新标注
Weilheim-Schongau Hospital KWS 1 Video 13
合计 — 8 3 家德国医院

视频编号非连续:公开的 8 段编号为 1, 2, 3, 4, 5, 7, 11, 13,中间缺 6、8、9、10、12——这些编号保留给挑战赛测试集(见 §9 双口径 A)。

时长(Table 1 逐段,单位 分:秒):

Video 1 2 3 4 5 7 11 13 合计
时长 39:07 48:12 32:39 49:10 28:31 57:03 32:54 36:19 323:55

最短 28:31(Video 5),最长 57:03(Video 7)。正文与 Data in Brief 概写为 “28–58 min”(双口径 H,见 §9)。

2.2 视频规格与隐私处理

  • 帧率:25 fps。
  • 分辨率:1920 × 1080。
  • 相机:单目内窥镜相机;不同机构使用不同相机系统,这是造成机构间域差异(domain gap)的直接来源。
  • 隐私处理:切除**腹壁腔外区域(regions outside the abdominal cavity)**的片段,以保护患者与医护隐私。逐段在 Video_x_Cuts.csv 中给出剪切索引(cut indices),用户可据此还原剪切位置。

2.3 帧数与标注粒度

PhaKIR 的三任务标注粒度不同,这是理解数据规模的关键:

任务 标注粒度 帧数(Table 1 口径)
手术相位识别 25 fps 逐帧 486,875
器械实例分割 1 fps(每 25 帧取 1 帧) 19,475
器械关键点估计 1 fps(与分割同帧) 19,475

逐段原始帧(Table 1 “#Frames(raw)” 与 “#Annotated (phase)”):58,675 / 72,300 / 48,975 / 73,750 / 42,775 / 85,575 / 49,350 / 54,475 = 486,875。
逐段分割+关键点帧(Table 1 “#Annotated (seg., kp.)”):2,347 / 2,892 / 1,959 / 2,950 / 1,711 / 3,423 / 1,974 / 2,179 = 19,475。

口径提示:数据论文摘要与 Data in Brief 写相位 485,875 帧、分割/关键点 19,435 帧;而同文 Table 1 分项相加为 486,875 与 19,475。同一篇论文内的两套数字,见 §9 双口径 B/C。

2.4 文件组织与格式

PhaKIR 为 FAIR 对齐采用开放格式(MP4、CSV、JSON、PNG),每段视频打包为一个 zip,内部 5 个文件:

文件 内容 格式
Video_x.mp4 完整(经隐私剪切)手术视频 MP4
Video_x_Phases.csv 相位逐帧标签 CSV
Video_x_Keypoints.json 器械关键点坐标 + 可见性 JSON
Video_x_Masks.zip 器械实例分割掩码 PNG(打包)
Video_x_Cuts.csv 隐私剪切索引 CSV

顶级另附 split_video_in_frames.py 帧提取脚本——仅用 Python 标准库、无外部依赖,便于用户把 MP4 转成帧序列(脚本同样以 CC-BY-NC-SA 许可发布)。

帧与掩码命名:帧以每 1000 张一子文件夹存放,文件名零填充至 6 位(如 frame_055649.png);掩码与帧一一对应(如 055625_mask.png)。

2.5 掩码编码:一台"三通道的编码机"

PhaKIR 的分割掩码不是常见的单通道"类别索引图",而是把类别与实例编码进 RGB 三个通道:

  • R、G 通道联合编码器械类别(不同类别对应不同 R/G 组合);
  • B 通道编码实例(同一类的不同实例用不同 B 值区分);
  • 每个像素最多属于一把器械,否则为背景。

这种编码使得"同类器械的两个实例"在掩码上可被区分——这正是"实例分割"区别于"语义分割"的核心,也是挑战赛中许多提交退化为语义分割的失误点(见 §7)。

2.6 质控与标注团队

标注由 4 位具医学专业背景者完成:1 名资深外科医生 + 3 名受过医学训练的学生。流程为:单一标注者先标 → 同人自查更正 → 另两名团队成员按协议顺序复核 → 每段视频初标后经三轮复核。分割在第二、三轮复核间量化修正率,得到多实例多类 Dice(DSC)= 83.64%(主要误差源为器械分类错误——分类错则该实例 DSC 归零)。关键点由未参与原分割/修正的独立成员标注。此外,挑战赛期间 66 支注册队伍下载并检查数据,罕见标注错误被报告并修正,无系统性错误报告——这构成一次难得的社区验证。

2.7 三任务标注粒度的对照表

为便于横向比较,把 PhaKIR 的三任务在"标注对象 / 粒度 / 工具 / 类别数"四个维度上并列:

维度 相位识别 实例分割 关键点估计
标注对象 整帧的时间归属 器械所占像素 器械的几何骨架点
时间粒度 25 fps(逐帧) 1 fps(每 25 帧取 1) 1 fps(同分割)
空间粒度 无(帧级) 像素级多边形 点级(2–4 点/器械)
标注工具 时间戳 + 程序赋值 CVAT v2.25.0 多边形 CVAT(分割基础上半自动)
类别/数量 8 类相位 19 类 × 实例 2–4 点/器械 + 可见性
主要误差源 边界帧歧义 器械分类错误 依赖器械分类

这张表最重要的信息是粒度不统一:相位是逐帧,分割和关键点是 1 fps。做多任务联合训练时,必须显式处理这种时间分辨率差异(常见做法是把相位按对应帧下采样,或把分割/关键点上采样插值)。

2.8 数据集的"完整性"边界

PhaKIR 的每段视频都是跨整台手术的完整序列,经隐私剪切(切除腹壁腔外片段)后仍有 28–57 分钟。用 Video_x_Cuts.csv 可以复原剪切位置。所谓"完整",指相位转换不漏、时间轴连续;但由于腔外片段被切掉,视频中会出现若干时间跳变——这些跳变点恰在 cut 索引中登记,用户做序列建模时需留意不要把跳变误当作连续帧。

2.9 小样本的统计含义

8 段视频意味着什么?从统计角度,8 个样本做 leave-one-hospital-out 时,Heidelberg 和 Weilheim-Schongau 各只有 1 段——留一中心验证在 H2/H3 上退化为留一视频验证。这是 PhaKIR 的固有结构限制,研究者应据实报告而非假装有充分的跨中心统计。数据论文自身也建议在视频级(而非帧级)划分验证集,正是因为帧级划分会造成同视频帧的泄漏。

§3 三任务标注体系详解

PhaKIR 的价值集中体现在三套标签的设计上。本节逐任务拆解其定义、粒度、编码与标注方法。

3.1 任务一:手术相位识别(Surgical Phase Recognition)

3.1.1 相位体系:Cholec80 七相位 + Undefined

PhaKIR 直接采用 Cholec80 的七相位体系(Cholec80 是腹腔镜胆囊切除相位识别的事实标准,见 §9 互链 cholec80 rid 78),并扩展一个 Undefined 相位以捕捉过渡帧,共 8 个类别:

标签 英文 中文
P0 Undefined 未定义(过渡帧)
P1 Preparation 准备
P2 Calot triangle dissection 胆囊三角解剖
P3 Clipping and cutting 夹闭与剪断
P4 Gallbladder dissection 胆囊游离
P5 Gallbladder packaging 胆囊装袋
P6 Cleaning and coagulation 清理与凝血
P7 Gallbladder retraction 胆囊牵引

口径提示:挑战官网 about 段写 “eight different phase categories”(含 Undefined),而早期 Supplement_S2 写 “seven different phase categories”。数据论文与标注说明明确为 7 相位 + 1 Undefined = 8。见 §9 双口径 E。

3.1.2 标注方式:时间戳驱动的逐帧赋值

相位标签的标注方法是"时间戳驱动"而非逐帧手画:标注者手动记录相位转换的时间点(phase transition timestamps),系统据此把连续的帧自动赋值为对应相位标签,25 fps 逐帧覆盖全程。这种方式与分割/关键点的手工画法有本质区别——它把人的判断压缩到离散的时间边界上,边界之间的帧由程序填充。

这种设计有利有弊:

  • 利:标注效率高,逐帧一致性有保证(同一相位段内标签绝对一致);
  • 弊:相位边界的精确性完全依赖人工记录的时间戳,边界帧附近可能有一两帧的歧义;Undefined 类别的引入即是缓冲这种边界歧义的手段。

3.2 任务二:器械实例分割(Instrument Instance Segmentation)

3.2.1 19 个器械类别

分割任务定义 19 个器械类别,并区分同类器械的不同实例(instance):

# 英文类名 # 英文类名
1 Argonbeamer 11 Hook-Clamp
2 Bipolar-Clamp 12 Needle-Probe
3 Blunt-Grasper 13 Overholt
4 Blunt-Grasper-Curved 14 Palpation-Probe
5 Blunt-Grasper-Spec. 15 PE-Forceps
6 Clip-Applicator 16 Scissor
7 Dissection-Hook 17 Sponge-Clamp
8 Drainage 18 Suction-Rod
9 Grasper 19 Trocar-Tip
10 HF-Coag.-Probe(HF-Coagulation-Probe)

口径提示:数据论文/标注说明/Zenodo/挑战官网 data 页一致为 19 类;仅早期 Supplement_S2 写 “20 categories”。以 19 类为准,见 §9 双口径 F。

3.2.2 标注工具与编码
  • 工具:CVAT(Computer Vision Annotation Tool,v2.25.0),以**多边形轮廓(polygon contours)**绘制器械区域。
  • 掩码编码:R、G 通道编码器械类别,B 通道编码实例(同类同 R/G、异 B);每像素仅属一个器械或背景。
  • 粒度:1 fps(每 25 帧取 1 帧)。
3.2.3 六条分割规则(标注说明)

标注说明给出 6 条分割规则,是复现与正确使用掩码的关键:

  1. 唯一分割:每个像素只能归入一个器械类别(或背景),不允许重叠;
  2. 仅标相关器械:只标注器械本身,组织、夹子(clips)、器官一律为背景;
  3. 遮挡归类:被遮挡的器械按离内窥镜最近者定类;被烟雾(smoke)遮挡的区域视为背景;
  4. 孔洞计入:器械上的孔洞计入器械区域,但 Trocar 内腔除外;
  5. 运动模糊:运动模糊区域按可见部分尽量标注;
  6. 通道分工:R、G 通道定类,B 通道定实例。

这 6 条规则中,第 3 条(遮挡与烟雾)和第 4 条(孔洞例外)是最容易在复现时踩坑的地方。

3.3 任务三:器械关键点估计(Instrument Keypoint Estimation)

3.3.1 关键点定义

每把器械标注 2–4 个类别相关关键点,并附 COCO 式可见性状态(visible=2 / occluded=1 / not available=0)。关键点类型:

缩写 名称 含义
T1 / T2 Tip 器械尖端;可开合器械有 2 个 Tip
SP ShaftPoint 轴-尖交界点
EP EndPoint 器械入画边界的端点
3.3.2 关键点数按器械类分组

不同器械的关键点数量不同(数据论文 Table 2 / 标注说明):

关键点数 构成 器械类
4 点(T1,T2,SP,EP) 双尖端可开合器械 Bipolar-Clamp、Blunt-Grasper、Blunt-Grasper-Curved、Blunt-Grasper-Spec.、Clip-Applicator、Grasper、Hook-Clamp、Overholt、PE-Forceps、Scissor、Sponge-Clamp
3 点(T1,SP,EP) 单尖端器械 Argonbeamer、Dissection-Hook、HFcoag-Probe、Suction-Rod
2 点(T1,EP) 无明确轴尖交界 Drainage、Needle-Probe、Palpation-Probe、Trocar-Tip

EndPoint 必有标注(可见性只取 1 或 2),因为它是器械"入画位置"的几何锚点,几乎总在画面边缘可见。

3.3.3 标注方式:分割基础上的半自动流程

关键点的标注方式是"基于分割掩码的半自动流程"——算法先生成最佳标签位置,再人工调整,并由人工判定可见性。标注者可查看完整序列(含前后帧),利用器械的时间连续性与预期运动精化定位(遮挡时尤为重要)。

口径提示:标注说明写"半自动生成关键点再人工调整";数据论文写"关键点由独立成员在 CVAT 手工标注(基于分割标签之上)“。两处对"半自动 vs 手工"表述不一,正文兼容表述为"在分割标签基础上、由独立标注者标注/调整”。见 §9 双口径 I。

3.4 三任务的联合结构

把三套标签叠起来看,PhaKIR 的每一帧(在 1 fps 抽样下)同时携带:

  • 一个相位标签(此刻手术处于哪一步);
  • 若干器械的实例掩码(每把器械的像素区域 + 实例身份);
  • 每把器械的 2–4 个关键点 + 可见性(器械的几何骨架)。

这种"同帧多标签"结构使 PhaKIR 天然适合多任务学习研究,也让"相位-器械"之间的语义关联(如"夹闭与剪断"阶段通常出现 Clip-Applicator 与 Scissor)可以被显式建模。

3.5 三任务之间的耦合关系

PhaKIR 的三任务并非彼此独立,而是存在明确的功能耦合:

(1)相位 → 器械的先验。 不同相位阶段出现的器械集合不同。例如"夹闭与剪断(P3)"阶段高频出现 Clip-Applicator 与 Scissor,而"胆囊牵引(P7)"阶段高频出现 Grasper 系。模型若能利用相位先验,理论上可缩小器械类别的搜索空间。

(2)分割 → 关键点的基石。 关键点是在分割掩码的基础上生成的(§3.3.3),器械分类错误会连锁导致关键点错误。这就是为什么挑战赛中关键点任务的参与度最低、且论文强调"关键点依赖准确的器械分类"。

(3)关键点 → 分割的约束。 反过来,关键点的几何结构(尖端、轴向)也可以为分割提供形状先验,尤其是在遮挡/烟雾区域。

这种双向耦合正是"多任务联合"的价值所在,也是 PhaKIR 相较单任务数据集的深层优势——它让任务间的信息流动有数据可依。

3.6 相位标注的"时间戳"到底是什么

相位标注的核心产物是相位转换时间戳(phase transition timestamps)。标注者观看完整视频,记录每次相位切换发生的时刻(精确到帧),系统据此把相邻两个时间戳之间的所有帧赋值为同一相位。这意味着:

  • 相位标签的准确性 = 时间戳的准确性;
  • 一次时间戳记录错误会整段污染该相位区间(而非单帧);
  • 因此 PhaKIR 采用三轮复核来校验时间戳,而非校验每一帧。

对使用者的启示:相位误差在时间上是块状的(block-wise),评估模型时若只看帧级 F1,会低估边界错位的影响;建议同时报告相位转换检测的时序指标(如转换点 F1)。

3.7 关键点可见性的三态语义

COCO 式可见性(visible=2 / occluded=1 / not available=0)在 PhaKIR 中的具体含义:

值 状态 使用建议
2 visible(可见) 正常参与关键点损失计算
1 occluded(被遮挡) 坐标是被遮挡下的推断值,误差较大,建议降权
0 not available(不存在/不可用) 该关键点在该器械/该帧不适用,应从损失中剔除

关键点中 EndPoint(EP)必为 1 或 2(因为器械入画位置总在画面边缘),而 T2(第二个尖端)在被遮挡或器械合拢时可能为 0。理解三态语义是正确计算关键点指标的前提。

§4 数据规模与统计口径(硬数字)

本节集中列出 PhaKIR 的全部硬数字,并标注口径来源。多口径冲突逐条存照(详见 §9)。

4.1 视频与时长

指标 数值 来源口径
公开视频段数 8 数据论文 / Data in Brief / Zenodo 记录
挑战赛总段数 13 挑战官网 about / 结果论文摘要(= 8 训练 + 5 测试)
机构数 3 全部来源一致
时长范围 28:31 – 57:03 Table 1 精确值
时长合计 323:55 ≈ 5 h 24 min Table 1 分项相加
帧率 25 fps 全部来源一致
分辨率 1920 × 1080 全部来源一致

4.2 帧数

指标 摘要/DiB 口径 Table 1 口径 结果论文口径
相位帧数 485,875 486,875 808,900
分割/关键点帧数 19,435 19,475 32,356

处理原则:以数据论文 Table 1 分项硬数字(486,875 / 19,475)为主,摘要口径并存照,结果论文口径单列(量级不同,疑含测试集或早期版本,见 §9 双口径 D)。

4.3 标注规模

指标 数值
相位类别数 8(7 + Undefined)
器械类别数 19
每器械关键点数 2–4
相位标注粒度 25 fps 逐帧
分割/关键点粒度 1 fps
标注者人数 4(1 资深外科医生 + 3 医学受训学生)
复核轮次 3
分割质控指标 多实例多类 DSC = 83.64%
社区验证队伍数 66 支注册队伍

4.4 未披露的数字(遗留疑点)

  • 数据集总字节数(GB)未披露:因采用 zip + 自选压缩率分发,数据论文与 Data in Brief 均未给出总量。
  • 患者级人口学信息未披露:8 例手术的患者年龄、性别、病理诊断等均未公开。

§5 许可、获取与引用要求

PhaKIR 的获取方式是本条目最需要强调的一点:它不是一个"点开即下"的公开数据集。

5.1 许可:CC BY-NC-SA 4.0

  • 许可类型:CC BY-NC-SA,具体为 CC BY-NC-SA 4.0(署名—非商业性使用—相同方式共享)。数据论文参考文献 [28] 指向 by-nc-sa/4.0。
  • 许可继承:数据论文明确说明,本数据集构建于并扩展自 PhaKIR Challenge 数据集与 HeiChole Challenge 数据集(两者原以 CC-BY-NC-SA 发布),故本数据集沿用同一许可;新创作品的许可必须与数据集当前版本完全相同的条款(ShareAlike 的具体落实)。

非商业(NC)的实际含义:任何以商业目的使用 PhaKIR 的行为(含商业化模型训练、产品集成)都不在授权范围内,需另行取得许可。这一点对工业界使用者是关键约束。

5.2 获取方式:受限申请制(Restricted / Controlled Access)

PhaKIR 的 Zenodo 记录状态为 Restricted(受控访问)。DBLP 记为 access: closed,OpenAIRE 记为 restricted。没有公开直链下载。

申请三步(Zenodo 记录原文):

  1. 在 Zenodo 注册并登录——注意只有登录后 Access Request Form 才会可见;
  2. 填写并提交 Request Access Form;
  3. 申请经核验后,通过邮件通知授权。

实操提示:不要尝试用 curl / wget 直接抓 Zenodo 记录页的文件——受限记录的文件列表在未授权状态下不可下载。第一步一定是注册登录,否则连申请表都看不到。

挑战赛通道(已关闭):挑战赛期间另有一条通道——在挑战官网(https://phakir.re-mic.de/)注册登录后从 data 页下载 zip。挑战已结束,官网现在指向 Zenodo。

5.3 引用要求(强约束)

任何全部或部分使用本数据集的工作,必须引用三篇文献:

  1. 数据集出版:Rueckert 等,“Video dataset for surgical phase, keypoint, and instrument recognition in laparoscopic surgery (PhaKIR)”,Data in Brief 68 (2026) 113147(doi:10.1016/j.dib.2026.113147);arXiv:2511.06549。
  2. 挑战论文:Rueckert 等,“Comparative validation of … Results of the PhaKIR 2024 challenge”,Medical Image Analysis 109 (2026) 103945(doi:10.1016/j.media.2026.103945);arXiv:2507.16559。
  3. HeiChole 挑战出版:Wagner 等,MedIA 86 (2023) 102770。

第 3 条容易被忽略:因为 PhaKIR 的 Video 11 就是 HeiChole2.mp4 的重新标注,其数据血缘要求同时致谢 HeiChole。

5.4 版本链

项 值
Zenodo 概念 DOI 10.5281/zenodo.15740619(恒定指向最新版本)
Zenodo 版本 DOI 10.5281/zenodo.15740620(指向 Version 1.0)
Version 1.0 发布 2025-07-15
元数据版本(OpenAIRE/dblp) 2025-11-06

口径提示:挑战官网链接用版本 DOI(.15740620);Data in Brief「Data Availability」与数据论文正文用概念 DOI(.15740619)。两者指向同一数据集,见 §9 双口径 G。

5.5 测试集不可得

挑战赛测试集(另有 5 段)不公开,且无公开时间表。数据论文建议用户在视频级(而非帧级)自建验证划分,例如 leave-one-video-out 或 leave-one-hospital-out,以模拟跨中心泛化评估。

§6 挑战赛与基准:EndoVis 2024 的三任务竞技

6.1 挑战赛身份与时间线

PhaKIR 不是凭空发布的数据集,而是为 EndoVis(Endoscopic Vision Challenge)2024 子挑战构建的,该挑战挂靠 MICCAI 2024。挑战赛时间线(官网):

时间 事件
2024-04 开放注册
2024-06 / 07 分两批放训练数据
2024-08-01 发布提交指南
2024-09-08 开始 Docker 提交
2024-09-17 提交截止
EndoVis 2024 挑战日 公布结果

挑战已结束,不再接受提交(但数据集仍可通过 Zenodo 申请获取)。

6.2 三任务的排名与颁奖

挑战对三个任务分别排名与颁奖,每任务设 1/2/3 名,奖金 500€ / 300€ / 200€,由 AKTORmed 赞助。

6.3 相位识别的结果

  • 前三名全部采用带时间信息的 Transformer(显著优于纯逐帧方法)——说明时间建模是相位识别的关键;
  • 获胜队使用 Multi-Scale Transformer(MuST),其核心是维持长序列的时间一致性;
  • 最高 F1 ≈ 69.12%——即便最优方法,绝对性能也不算高,反映任务难度;
  • 相位难度不均:Preparation 较易(约 74% 准确),而 Clipping and Cutting 极易与其他相位混淆(约 30%)——这与手术中该阶段时间短、视觉特征与相邻阶段相似有关。

6.4 器械实例分割的结果

  • Mask2Former 类 Transformer 方法领跑,优于 U-Net / R-CNN 系;
  • 区分同类器械的不同实例仍是主要难点——许多提交退化为语义分割(即只分"这是 Grasper",不区分"这是第几把 Grasper")。这正是 PhaKIR 用 B 通道编码实例所要考察的能力,也暴露了当前方法的短板。

6.5 关键点估计的结果

  • 仅 2 支队伍提交——说明任务复杂度高、参与门槛高;
  • 主流采用 YOLOv8-pose 变体;
  • 难点在于依赖准确的器械分类——关键点定位与器械类别判断耦合。

6.6 共性结论:泛化性是最大短板

挑战赛最有价值的结论是跨任务的:方法跨医学中心的泛化性普遍较差(结果论文 Highlights 原文:“Methods show poor generalizability across different medical centers”)。三家德国医院的内窥镜系统与手术习惯差异,直接导致在一家中心表现良好的模型换一家中心性能下降。论文提出的未来方向是:在分割与关键点任务中引入时间建模(目前这两任务多为逐帧独立处理,未利用时间连续性)。

6.7 数据集自评估

除挑战赛外部评测外,数据集自身有内部质控指标:分割在第二、三轮复核间的多实例多类 Dice(DSC)= 83.64%(§2.6)。这个数字是"标注质量的自证",与挑战赛的"模型性能"是两个层面的指标,不可混用。

§7 生态、影响与家族定位

7.1 在手术视频数据集谱系中的位置

手术视频数据集可按"任务维度"和"机构维度"排布。PhaKIR 的独特点在于它同时占据了"多任务"与"多机构"两个轴:

数据集 相位 器械分割 关键点 机构数 视频完整序列
PhaKIR ✅ ✅(实例) ✅ 3 ✅
Cholec80 ✅ ❌ ❌ 1 ✅
CholecSeg8k ❌ ✅(语义) ❌ 1 片段
CholecT50 ✅(动作三元组) ❌ ❌ 1 ✅
m2cai16-tool ❌ ✅(检测) ❌ 1 片段
Endoscapes ✅(CVS) ✅ ❌ 1 片段

结论:PhaKIR 是库内唯一在"同一完整序列 + 多机构"上同时标注相位、实例分割、关键点的条目,无同构竞争者。

7.1b 为什么"完整序列"这个属性值得单独强调

很多手术视频数据集为了控制体量和标注成本,只保留手术中的关键片段(如只留下"胆囊三角解剖"到"胆囊离体"之间的几分钟)。片段数据集的问题是:① 无法研究手术的"全流程"(术前准备、收尾清理都被切掉);② 相位转换的长程依赖(如开头准备如何影响后续节奏)无法建模;③ 片段边界本身引入了人为的选择偏差。

PhaKIR 坚持保留完整序列(仅切除腹壁腔外片段),代价是标注成本高(每台手术 30–57 分钟全程),收益是相位识别可以在真实的全流程时间轴上被研究。这是它区别于多数片段型数据集的关键取舍。

7.1c 与库内 SLAM/位姿族的关系深浅

slam-3d-endoscopic(82) 与 endoslam(408) 做的是内窥镜相机自身的运动/场景三维结构,而 PhaKIR 的关键点做的是器械的二维骨架定位。两者都涉及"空间定位",但对象不同:前者定位相机/场景,后者定位器械。二者可组合成"相机位姿 + 器械位姿"的完整空间理解——这是 PhaKIR 与 SLAM 族最有价值的互链方向,但并非同一任务,检索时勿混淆。

7.2 与 HeiChole 的血缘关系(重要)

PhaKIR 的 Video 11 = HeiChole2.mp4,即取自 HeiChole 挑战数据集并重新标注(fully re-annotated for consistency)。由此产生两条重要关联:

  1. 许可继承:PhaKIR 沿用 HeiChole 的 CC-BY-NC-SA 许可(§5.1);
  2. 引用义务:使用 PhaKIR 必须同时引用 HeiChole 论文(§5.3)。

库内状态:千方病案医数集数据库中暂无 heichole 条目(DB 查询 0 行)。建议未来补条并与 PhaKIR 互链。注意:writing/ 下存在一个 heichole 目录,属并发代理的工作产物(slug 不同,非本条目),本代理未触碰。

HeiChole 本身是 33 段腹腔镜胆囊切除视频(3 家德国中心)、7 相位 + 4 动作 + 21 器械 + 5 技能维度的多任务基准,其 Video 11(HeiChole2.mp4)被 PhaKIR 重标为三任务联合标签。两者的差异幅度(重标前后标签一致率)数据论文未量化,属遗留疑点(§9)。

7.3 与 EndoVis 生态的关系

PhaKIR 是 EndoVis 2024 子挑战,因此它天然属于 EndoVis 挑战家族。库内 endovis-challenges(rid 79) 是 EndoVis 总条目,PhaKIR 应回链该条目。EndoVis 历史上还催生过多个子挑战(如机器人场景分割、器械跟踪等),PhaKIR 是其中聚焦"腹腔镜胆囊切除三任务"的一支。

7.4 对下游研究的价值

  • 多任务学习:PhaKIR 是研究"相位-器械-关键点三任务共享表征"的理想平台;
  • 泛化性研究:3 家医院提供了天然的域偏移测试台;
  • 时间建模:结果论文点明分割/关键点缺乏时间建模,PhaKIR 的完整序列正好支持这一方向的探索;
  • 标注方法论:从"时间戳驱动相位"到"RGB 三通道编码实例",PhaKIR 的标注工艺本身值得借鉴。

7.5 局限与争议点

  • 机构偏斜:6:1:1 的分布意味着跨中心评估会被 TUM 主导;
  • 测试集封闭:5 段测试视频不公开,第三方无法在相同测试集上复现挑战赛排名;
  • 商业关联:第一作者 T. Rueckert 兼职 AKTORmed,而该公司是挑战赛赞助方——数据论文声明无利益冲突,但此关联仅作存照(§9 遗留疑点 7)。

§8 方法学启示与可迁移经验

8.1 "时间戳驱动"的相位标注是可复制的高效范式

PhaKIR 用人工记录的时间边界 + 程序批量赋值来产生逐帧相位标签,把人的判断集中到最需要的地方(边界),极大降低了逐帧核对成本。这一范式适合所有"阶段语义连续、边界离散"的时序标注任务。

8.2 用 RGB 通道同时编码类别与实例,是"实例 vs 语义"的显式考题

把类别塞进 R/G、实例塞进 B,看似取巧,实则是对"方法是否真的做实例分割"的硬性考验。挑战赛中大量提交退化为语义分割,恰恰证明这个设计戳中了痛点。

8.3 关键点的"半自动 + 完整序列可见"平衡了效率与精度

基于分割掩码半自动生成候选关键点、再人工在完整序列上下文中调整,既借了分割标注的力,又用时间连续性解决了遮挡下的定位问题。这一"半自动 + 时序上下文"的组合值得借鉴。

8.4 多机构数据集的"泛化性负面结论"本身就是产出

PhaKIR 挑战赛最重要的结论不是"谁赢了",而是"大家都泛化不好"。一个诚实地暴露模型短板的基准,比一个漂亮的排行榜更有科研价值。

8.5 社区验证是被低估的质控手段

66 支队伍下载检查并报告罕见错误,构成一次大规模众包复核,且结论是"无系统性错误"。这提示数据集发布者:开放挑战赛不仅是评测,也是免费的标注质检。

8.6 从"单任务冠军"到"多任务通才"的评价转向

PhaKIR 挑战赛分三任务独立排名,隐含的评价假设是"每个任务各有一个最优解"。但多任务数据集真正的价值可能在于共享表征:一个模型能否同时把相位、分割、关键点都做好?挑战赛的组织方式(分任务)与数据集的潜力(联合)之间存在张力。未来的评测或应增设多任务联合指标(如三任务平均性能或任务间一致性),才更贴合 PhaKIR 的设计初衷。

8.7 标注成本的经济学

PhaKIR 用"1 名资深外科医生 + 3 名受训学生"的配置,把专家时间集中在最关键的判断上(相位边界、疑难器械分类、关键点复核),把大量重复劳动交给成本更低的学生 + 半自动算法。这是医学数据标注的通用经济学:专家稀缺且昂贵,凡是能用半自动流程 + 复核机制替代专家逐帧操作的,都应替代。PhaKIR 的三轮复核 + 时间戳驱动 + 半自动关键点,正是这一原则的三种落实。

8.8 对"负结果"的正确态度

PhaKIR 挑战赛没有诞生"95% F1 的相位识别模型",最高只有约 69.12%。有人会把这读作"数据集太难、方法不行"。但更准确的理解是:当数据集足够真实(多机构、完整序列、细粒度)时,模型性能的天花板会自然下降——因为之前的高分往往来自单机构、片段化、乐观切分带来的"数据红利"。PhaKIR 的低分是真实世界的分数。

8.9 关键点任务仅 2 队提交的启示

一个任务只有 2 支队伍参与,说明它要么太难,要么被低估。PhaKIR 的关键点估计属于后者兼前者:它需要器械分类 + 位姿回归 + 遮挡推理的综合能力,且缺少成熟的预训练套路(不像分割有 Mask2Former、相位有 Transformer)。这恰恰是研究机会——在器械关键点上投入,可能比在拥挤的分割赛道更容易做出增量。

§9 与库内条目的关系(互链地图)

9.1 家族图谱

PhaKIR 在千方病案医数集库内的位置,可从四个方向定位:

(A)时间与手术流程族(相位):

  • cholec80(rid 78):PhaKIR 相位体系的直接来源(7 相位);也是腹腔镜胆囊切除视频的事实标准;PhaKIR 明言可与之组合做跨数据集评估。
  • cholect50(rid 223):CholecT50 手术动作三元组(器械-动词-目标),与 PhaKIR 的时间/工具体系互补。
  • endoscapes(rid 353):胆囊切除 CVS 安全视野 + 分割,与 PhaKIR 同属胆囊切除视频族。

(B)分割族:

  • cholecseg8k(rid 233):Cholec80 派生的像素级语义分割集(13 类),与 PhaKIR 的实例分割形成"语义 vs 实例"对照。
  • m2cai16-tool(rid 303):器械识别早期基准。
  • miccai-surgt(rid 83):手术工具定位挑战。

(C)挑战赛生态族:

  • endovis-challenges(rid 79):PhaKIR 是 EndoVis 2024 子挑战,本条目应回链该总条目。

(D)空间定位族(关键点/位姿):

  • slam-3d-endoscopic(rid 82)、endoslam(rid 408):内窥镜运动/位姿估计,与 PhaKIR 的关键点/器械位姿任务在"空间定位"维度相关。
  • autolaparo(rid 313):妇科腹腔镜手术视频(相位+器械),同属腹腔镜族。

9.2 检索路径建议

  • 找相位数据集:cholec80(78) → cholect50(223) → phakir(联合版)
  • 找器械分割数据集:cholecseg8k(233)(语义)→ m2cai16-tool(303)(检测)→ phakir(实例)
  • 找多机构手术视频:phakir(3 机构)为主,autolaparo 等多为单机构
  • 找 EndoVis 挑战:endovis-challenges(79) → phakir

§10 DAIMS 评估与避坑清单

10.1 DAIMS 数据集成熟度评估表

DAIMS(Dataset Maturity / AI-readiness 评估)从数据可用性、文档完备度、格式规范、可复现性等维度打分:

维度 评分 说明
数据可获取性 ⚠️ 中 受限申请制,无公开直链;但申请流程清晰、Zenodo 托管稳定
文档完备度 ✅ 高 数据论文 + 结果论文 + 标注说明 + 挑战官网四重文档,硬数字齐全
格式规范性 ✅ 高 FAIR 对齐:MP4/CSV/JSON/PNG 开放格式,命名规范(6 位零填充)
标注质量 ✅ 高 三轮复核 + DSC 83.64% + 66 队社区验证,标注工艺透明
可复现性 ⚠️ 中 提供帧提取脚本;但测试集封闭、总字节数未披露,跨中心复现有门槛
伦理合规 ✅ 高 隐私剪切(腔外片段切除)+ 逐段 cut 索引;受控访问保护患者隐私
多任务价值 ✅ 高 三任务同帧联合,库内稀缺
许可宽松度 ⚠️ 中 CC BY-NC-SA:非商业 + ShareAlike,工业界使用受限

综合定位:PhaKIR 属于"高质量、强文档、中等可获取性"的手术视频数据集——学术研究友好,商业使用受限,且必须走申请流程。

10.2 避坑清单:八个已踩过的坑

坑点 1:以为 PhaKIR 可以公开直链下载。
实际上 Zenodo 记录为 Restricted(受控访问),未登录状态下连 Access Request Form 都看不到,更无法下载文件。第一步必须注册登录 Zenodo,再填表申请。

坑点 2:把"8 段"和"13 段"混用。
数据论文与 Zenodo 记录写 8 段(公开/训练口径);结果论文摘要与挑战官网 about 写 13 段。13 = 8 训练 + 5 测试,测试集不公开。写论文时若报"PhaKIR 有 13 段公开视频"即为错误。

坑点 3:相位类别数写成 7 或 8 踩空。
PhaKIR 是 7 相位(Cholec80 体系)+ 1 Undefined = 8 类。只写"7 相位"会漏掉 Undefined,只写"8 相位"而不说明其中含过渡标签会误导读者。正确表述是"7 个语义相位 + 1 个 Undefined 过渡相位"。

坑点 4:直接混用两篇论文的帧数。
数据论文口径:相位 486,875 / 分割关键点 19,475(Table 1);结果论文 Highlights 口径:相位 808,900 / 分割关键点 32,356。两者量级差约 1.66 倍,不可直接相加或对比,疑为含测试集或不同版本统计。以数据集本体(数据论文)为准。

坑点 5:忽略"同类不同实例"的要求。
PhaKIR 分割掩码的 B 通道编码实例,任务定义要求区分同一类器械的不同实例。若只做语义分割(把同类器械合并),则在 PhaKIR 上是未完成任务——挑战赛中大量提交犯此错误。

坑点 6:忘记引用 HeiChole。
使用 PhaKIR 必须同时引用三篇:数据论文 + 挑战论文 + HeiChole 论文(Wagner 2023)。第三条因 PhaKIR 的 Video 11 源自 HeiChole2.mp4 而强制。漏引会违反复用条款。

坑点 7:误读掩码通道编码。
掩码不是单通道类别索引图,而是 R/G 通道定类别、B 通道定实例。若按单通道解析,得到的类别必然全错,且无法还原实例身份。

坑点 8:忽略相位标注的方法论差异。
相位标签是时间戳驱动批量赋值(非逐帧人工),边界帧附近存在固有歧义;Undefined 类别正是缓冲此歧义。若把相位标签当作"逐帧独立人工判定"来评估模型,会对边界帧的性能产生误判。

坑点 9:以为分割与关键点是逐帧标注。
分割与关键点仅 1 fps(每 25 帧取 1 帧),而相位是 25 fps 逐帧。三任务时间分辨率不同,做多任务联合训练时必须注意下采样对齐。

坑点 10:直接拿测试集排名当泛化能力证明。
挑战赛测试集封闭,且论文自承跨中心泛化差。把挑战赛排名当作"模型已解决泛化问题"是过度解读。

§11 总结与决策指南

11.1 三句话总结

  1. PhaKIR 是库内唯一把"手术相位 + 器械关键点 + 器械实例分割"三套标签在同一批完整腹腔镜胆囊切除视频**上联合标注的多机构数据集(3 家德国医院、8 段视频)。
  2. 它的获取方式是受限申请制(Zenodo 10.5281/zenodo.15740620,注册登录 → 填表 → 审批),许可为 CC BY-NC-SA 4.0,使用必须引用三篇文献(含 HeiChole)。
  3. 它最重要的科研产出是一个负面结论:当前方法跨医学中心泛化性普遍较差——这使 PhaKIR 成为研究手术视频域偏移与多任务时间建模的诚实基准。

11.2 适合谁

  • 做手术相位识别、想引入时间建模的研究者(挑战赛证明 Transformer + 时间上下文最优);
  • 做器械实例分割、想挑战"同类不同实例"区分难题的团队;
  • 做多任务学习、想在同帧上联合优化相位/分割/关键点的研究者;
  • 做域泛化 / 跨中心迁移、需要天然多机构手术视频的研究者;
  • 研究医学数据集标注方法论(时间戳驱动相位、RGB 三通道编码)的学者。

11.3 不适合谁

  • 商业用途:CC BY-NC-SA 的 NC 条款直接排除商业使用;
  • 想即时下载数据:受限申请制意味着需要等待审批,不适合赶 deadline 的急用;
  • 需要患者临床元数据:PhaKIR 未披露患者人口学与病理信息;
  • 想在封闭测试集上复现排名:测试集不公开;
  • 需要极高时间分辨率的分割/关键点:这两任务仅 1 fps。

11.4 30 秒决策卡

你的需求 PhaKIR 是否合适 下一步
多任务手术视频研究 ✅ 非常合适 申请 Zenodo 访问(§5.2)
只需相位识别 🔶 可以,但 Cholec80 更轻 先看 cholec80(78)
只需器械分割 🔶 实例分割场景合适 对比 cholecseg8k(233)
器械关键点/位姿 ✅ 库内稀缺 与 endoslam(408) 类比
跨中心泛化研究 ✅ 天然 3 中心 用 leave-one-hospital-out
商业产品 ❌ NC 条款禁止 需另行联系授权

FAQ(高频问答 24 问)

A. 基础认知

Q1:PhaKIR 缩写代表什么?
Phase(相位)、Keypoint(关键点)、Instrument Recognition(器械识别)——三任务各占一部分。

Q2:PhaKIR 是新的采集数据吗?
部分是。大部分视频为新采集,但 Video 11 是 HeiChole2.mp4 的重新标注,故 PhaKIR 同时包含新数据与复用数据。

Q3:谁做的?
OTH Regensburg 的 ReMIC Lab(Regensburg Medical Image Computing),通讯作者 Tobias Rueckert 与 Christoph Palm;临床合作方为 TUM Rechts der Isar、Heidelberg、Weilheim-Schongau。

Q4:什么时候发布的?
挑战赛 2024-09 结束;Zenodo Version 1.0 于 2025-07-15 发布;数据论文 arXiv 2025-11-09;两篇正式论文于 2026 年见刊。

Q5:属于哪个挑战赛?
EndoVis 2024 子挑战(Endoscopic Vision Challenge),挂靠 MICCAI 2024。

B. 数据与获取

Q6:PhaKIR 能直接下载吗?
不能。 受限申请制,需注册登录 Zenodo → 填写 Access Request Form → 审批邮件授权。

Q7:申请要多久?
官方未给出承诺时限;由 ReMIC Lab 人工核验后邮件通知。建议预留时间。

Q8:许可是什么?
CC BY-NC-SA 4.0(署名—非商业—相同方式共享)。

Q9:可以用它训练商业模型吗?
不可以(NC 条款),除非另行取得授权。

Q10:数据是什么格式?
MP4(视频)+ CSV(相位/剪切)+ JSON(关键点)+ PNG(分割掩码),zip 打包,每段一份;附 Python 帧提取脚本。

Q11:总大小多少 GB?
未披露。 因为 zip + 自选压缩率,官方未给总量。

Q12:需要引用哪些论文?
三篇:数据论文(DiB 2026 / arXiv:2511.06549)+ 挑战论文(MedIA 2026 / arXiv:2507.16559)+ HeiChole 论文(Wagner 2023)。

C. 数据构成

Q13:8 段还是 13 段?
8 段公开(数据论文口径);13 段是挑战赛总量(8 训练 + 5 测试),测试集不公开。

Q14:来自哪些医院?
TUM Rechts der Isar(6)、Heidelberg(1)、Weilheim-Schongau(1)。

Q15:视频多长?
单段 28:31–57:03 分钟,合计 323:55 ≈ 5 小时 24 分。

Q16:分辨率和帧率?
1920 × 1080,25 fps。

Q17:有多少帧标注?
相位 486,875 帧(25 fps 逐帧);分割与关键点各 19,475 帧(1 fps)。

Q18:相位分几类?
8 类 = Cholec80 七相位 + Undefined。

Q19:分割分几类?
19 个器械类别,并区分同类不同实例。

Q20:关键点是什么?
Tip / ShaftPoint / EndPoint,每器械 2–4 个,附 COCO 可见性(2/1/0)。

D. 挑战赛与方法

Q21:挑战赛谁赢了?
相位识别由 MuST(Multi-Scale Transformer) 获胜,最高 F1 ≈ 69.12%;分割由 Mask2Former 类方法领跑;关键点仅 2 队提交。

Q22:最难的任务是什么?
从参与度看,关键点估计最难(仅 2 队);从混淆看,Clipping and Cutting 相位最难(约 30%)。

Q23:核心结论?
跨医学中心泛化性普遍较差;未来方向是在分割/关键点引入时间建模。

Q24:库内有没有类似的数据集?
PhaKIR 是库内唯一"三任务 × 多机构 × 完整序列"条目;单任务相邻条目见 cholec80(78)、cholecseg8k(233)、cholect50(223) 等。

E. 复现与工程细节

Q25:怎么把 MP4 转成帧?
用官方附带的 split_video_in_frames.py(仅 Python 标准库),按 25 fps 拆帧;注意帧文件零填充到 6 位。

Q26:怎么读掩码?
先读 R/G 通道得器械类别,再读 B 通道得实例身份;不要当单通道类别图解析。

Q27:怎么做跨中心验证?
用 leave-one-hospital-out(H1/H2/H3 各留一次)或 leave-one-video-out;注意 H2/H3 各仅 1 段,统计功效有限。

Q28:相位标签怎么下采样到 1 fps 以对齐分割?
按每 25 帧取 1(与分割同规则)即可;或反过来把分割按最近邻上采样。关键是保持同一帧的对齐索引。

Q29:P0 Undefined 要不要算进性能?
建议单列报告,不要并入其他 7 类平均,否则会稀释真实性能。也可报告"含/不含 P0"两套数字。

Q30:关键点的 occluded(可见性 1)要不要算损失?
建议降权或作为不确定标签处理,因为可见性 1 的坐标是遮挡下的推断值。

事实清单(硬事实 30 条)

  1. PhaKIR 全称:Surgical Procedure Phase, Keypoint, and Instrument Recognition。
  2. 组织方:OTH Regensburg ReMIC Lab。
  3. 通讯作者:Tobias Rueckert、Christoph Palm。
  4. 挑战赛:EndoVis 2024 子挑战(MICCAI 2024)。
  5. 提交截止:2024-09-17。
  6. 公开视频:8 段。
  7. 机构:3 家德国医院。
  8. 机构分布:TUM MRI 6 / Heidelberg 1 / Weilheim-Schongau 1。
  9. 视频编号:1,2,3,4,5,7,11,13(非连续)。
  10. 分辨率:1920 × 1080。
  11. 帧率:25 fps。
  12. 时长范围:28:31–57:03。
  13. 时长合计:323:55 ≈ 5 h 24 min。
  14. 相位类别:8(7 + Undefined)。
  15. 相位帧数(Table 1):486,875。
  16. 分割/关键点帧数(Table 1):19,475。
  17. 器械类别:19。
  18. 关键点数/器械:2–4。
  19. 相位标注粒度:25 fps 逐帧。
  20. 分割/关键点粒度:1 fps。
  21. 分割工具:CVAT v2.25.0。
  22. 掩码编码:R/G 定类、B 定实例。
  23. 标注团队:1 资深外科医生 + 3 医学受训学生。
  24. 复核轮次:3。
  25. 分割质控 DSC:83.64%。
  26. 社区验证队伍:66 支。
  27. 许可:CC BY-NC-SA 4.0。
  28. 获取:Zenodo 受限申请制(10.5281/zenodo.15740620)。
  29. 概念 DOI:10.5281/zenodo.15740619。
  30. 引用义务:数据论文 + 挑战论文 + HeiChole 论文三篇。

术语表(24 条)

术语 英文/缩写 释义
手术相位识别 surgical phase recognition 把手术视频切分为语义阶段的任务
器械实例分割 instrument instance segmentation 逐像素标出每把器械并区分实例
器械关键点估计 instrument keypoint estimation 定位器械骨架点的任务
相位 phase 手术的语义阶段标签
胆囊三角解剖 Calot triangle dissection 手术相位 P2
夹闭与剪断 Clipping and cutting 手术相位 P3
胆囊游离 Gallbladder dissection 手术相位 P4
胆囊装袋 Gallbladder packaging 手术相位 P5
清理与凝血 Cleaning and coagulation 手术相位 P6
胆囊牵引 Gallbladder retraction 手术相位 P7
未定义相位 Undefined 过渡帧标签 P0
尖端 Tip(T1/T2) 器械尖端关键点
轴尖交界 ShaftPoint(SP) 器械轴与尖交界关键点
入画端点 EndPoint(EP) 器械进入画面边界的端点
可见性 visibility COCO 式关键点状态(2/1/0)
域偏移 domain shift 跨中心分布差异
泛化性 generalizability 模型跨中心表现
多实例多类 Dice DSC 分割质控指标
留一中心验证 leave-one-hospital-out 跨中心评估协议
留一视频验证 leave-one-video-out 视频级评估协议
掩码 mask 分割标注图
剪切索引 cut index 隐私剪切位置
受控访问 controlled access 需申请的数据获取方式
相同方式共享 ShareAlike(SA) 许可条款,衍生物须同许可

附录

附录 A:条目信息速查卡

项 值
slug phakir
官方名 PhaKIR Dataset - Surgical Procedure Phase, Keypoint, and Instrument Recognition
组织方 OTH Regensburg ReMIC Lab
数据论文 Data in Brief 2026;68:113147
结果论文 Medical Image Analysis 2026;109:103945
挑战赛 EndoVis 2024 / MICCAI 2024
Zenodo 10.5281/zenodo.15740620(版本)/ .15740619(概念)
许可 CC BY-NC-SA 4.0
官网 https://phakir.re-mic.de/
联系邮箱 phakir2024@re-mic.de
库内互链 cholec80(78)、cholecseg8k(233)、cholect50(223)、endovis-challenges(79)、m2cai16-tool(303)、autolaparo(313)、endoscapes(353)、endoslam(408)

附录 B:DAIMS 评估全表

见 §10.1 表。核心结论:高质量、强文档、中等可获取性、非商业许可。

附录 C:逐项证据链自证

事实 来源
8 段视频 / 3 机构 数据论文正文 + Zenodo 记录描述
486,875 / 19,475 帧 数据论文 Table 1 分项相加
8 相位 / 19 器械 数据论文 Figure 3 + 标注说明 Table 1
DSC 83.64% 数据论文 §D
66 支队伍 数据论文 §D 社区验证段
受限访问 Zenodo 记录 access 状态
CC BY-NC-SA 4.0 数据论文参考文献 [28]

附录 D:数据获取决策树

需要 PhaKIR 数据?
├─ 是学术/非商业用途?
│   ├─ 是 → 注册登录 Zenodo → 填 Access Request Form → 等待审批邮件
│   └─ 否(商业)→ ❌ NC 条款禁止,需另行联系 ReMIC Lab 授权
└─ 只是想看看长什么样?
    └─ 读数据论文(arXiv:2511.06549)+ 结果论文(arXiv:2507.16559)

附录 E:掩码类别映射与使用规范

  • R/G 通道:联合编码 19 类器械类别(每类对应固定 R/G 组合)。
  • B 通道:编码实例身份(同类不同实例用不同 B 值)。
  • 解析步骤:① 读 R/G → 得类别;② 读 B → 得实例;③ 同类合并即得语义分割(但会丢失实例信息,不推荐直接用于实例分割评测)。
  • 背景:三通道均为 0(或按约定)。

附录 F:相位标签使用规范

  • 相位为 25 fps 逐帧标签,8 类。
  • P0 Undefined 为过渡缓冲,评估时通常单列报告(避免拉低其他类性能)。
  • 边界帧存在固有歧义(因时间戳人工记录),建议评估时考虑 ±1 帧容忍或报告边界敏感度。

附录 G:双口径登记表

编号 冲突项 口径 1 口径 2 处理
A 视频段数 8(数据论文) 13(结果论文/官网,含 5 测试) 以 8 为公开本体,13 存照
B 相位帧数 485,875(摘要) 486,875(Table 1) 以 Table 1 为准
C 分割/关键点帧数 19,435(摘要) 19,475(Table 1) 以 Table 1 为准
D 结果论文帧数 486,875/19,475(数据集) 808,900/32,356(Highlights) 以数据集为准,后者单列
E 相位类别数 7(早期 Supplement) 8(现行,含 Undefined) 以 8 为准
F 器械类别数 19(现行) 20(早期 Supplement) 以 19 为准
G DOI 概念 .15740619 版本 .15740620 两者并列
H 时长表达 28:31–57:03(Table 1) 28–58 min(正文概写) 精确值为主
I 关键点标注方式 半自动(标注说明) 手工(数据论文) 兼容表述

附录 H:坑点档案(与 §10.2 对照)

十个坑点已在 §10.2 详解,覆盖:获取方式误解、视频段数混用、相位类别数、帧数混用、实例分割要求、HeiChole 引用、掩码通道编码、相位标注方法论、标注粒度差异、测试集排名过度解读。

附录 I:维护计划与触发点

触发点 动作
Zenodo 新增版本 更新版本 DOI 与版本链
测试集公开 更新 §5.5 与 §9 双口径 A
库内新增 heichole 条目 补互链
出现第三方复现基准 更新 §7 与 §6

附录 J:引文规范

引用 PhaKIR 时,建议格式:

  • 数据:Rueckert T, Maerkl R, Rauber D, Klausmann L, Gutbrod M, Rueckert D, Feussner H, Wilhelm D, Palm C. Video dataset for surgical phase, keypoint, and instrument recognition in laparoscopic surgery (PhaKIR). Data in Brief. 2026;68:113147.
  • 挑战:Rueckert T, et al. Comparative validation of surgical phase recognition, instrument keypoint estimation, and instrument instance segmentation in endoscopy: Results of the PhaKIR 2024 challenge. Medical Image Analysis. 2026;109:103945.
  • 前身:Wagner M, et al. Comparative validation of machine learning algorithms for surgical workflow and skill analysis with the HeiChole benchmark. Medical Image Analysis. 2023;86:102770.

附录 K:本条目生产档案

  • 代理:agent-c-phakir
  • 抓取核验时点:2026-09-30
  • 来源:数据论文 PDF(arXiv:2511.06549)、挑战标注说明 PDF(PhaKIR_Data_Description_v2)、Zenodo 记录、挑战官网、Data in Brief 页、MedIA 结果论文页
  • 查重:DB %phakir% 0 行;ls writing/ 无同名目录

附录 L:FAIR/AI-Ready 检查单

原则 满足度
Findable(可发现) ✅ DOI + Zenodo + 官网
Accessible(可访问) 🔶 受控访问(申请制)
Interoperable(可互操作) ✅ 开放格式 MP4/CSV/JSON/PNG
Reusable(可重用) ✅ 详细文档 + 脚本;🔶 NC 限制商业重用

附录 M:缩写速查

PhaKIR(Phase/Keypoint/Instrument Recognition)、MRI(TUM Rechts der Isar)、UKHD(Heidelberg)、KWS(Weilheim-Schongau)、ReMIC(Regensburg Medical Image Computing)、CVAT(Computer Vision Annotation Tool)、DSC(Dice Similarity Coefficient)、SP(ShaftPoint)、EP(EndPoint)、MuST(Multi-Scale Transformer)。

附录 N:与本条目相关的三大语义轴

  • 时间轴:相位(25 fps)——回答"现在哪一步";
  • 像素轴:实例分割(1 fps)——回答"每个像素属于哪把器械的哪个实例";
  • 几何轴:关键点(1 fps)——回答"器械的骨架在哪"。
    三轴同帧对齐,构成 PhaKIR 的核心数据结构。

附录 O:与库内相关条目的差异声明

PhaKIR 不是 Cholec80(仅相位)、不是 CholecSeg8k(仅语义分割)、不是 CholecT50(仅动作三元组)、不是 HeiChole(多任务但口径不同)——它是库内唯一在"同一完整序列 + 多机构"上联合标注相位+实例分割+关键点的条目。

附录 P:申请邮件模板(供参考)

To: phakir2024@re-mic.de
Subject: Access Request for PhaKIR Dataset

Dear PhaKIR Team,

I am [姓名], [职称] at [机构], [国家].
I would like to request access to the PhaKIR dataset (Zenodo 10.5281/zenodo.15740620)
for the following non-commercial research purpose:
[研究用途简述,如 "surgical phase recognition with temporal modeling"]

I have submitted the Zenodo Access Request Form. My Zenodo account is [账号].
I agree to comply with CC BY-NC-SA 4.0 and to cite the dataset paper,
the challenge paper, and the HeiChole benchmark paper in any resulting work.

Thank you.
[姓名] / [机构] / [日期]

附录 Q:三任务评测指标建议

任务 常用指标 备注
相位识别 Accuracy / Precision / Recall / F1 / Jaccard 建议单列 P0;可加转换点时序 F1
器械实例分割 多实例多类 DSC / PQ(Panoptic Quality) 需区分实例,勿只报语义 mIoU
关键点估计 PCK / mAP(COCO 口径) 按可见性分层报告

附录 R:数据下载后的目录骨架

PhaKIR/
├── Video_1/
│   ├── Video_1.mp4
│   ├── Video_1_Phases.csv
│   ├── Video_1_Keypoints.json
│   ├── Video_1_Masks.zip
│   └── Video_1_Cuts.csv
├── Video_2/ ...
├── ...
└── split_video_in_frames.py

附录 S:数据血缘图(文字版)

HeiChole 挑战数据集 (MedIA 2023)
        │  Video 11 = HeiChole2.mp4(复用并重标)
        ▼
   ┌──────────────┐        ┌──────────────┐
   │  新采集 7 段  │ ─────▶ │   PhaKIR     │ ──▶ 挑战赛 (EndoVis 2024)
   │ TUM×6 + KWS×1│        │  8 段联合标注 │ ──▶ 数据论文 (DiB 2026)
   └──────────────┘        └──────────────┘ ──▶ 结果论文 (MedIA 2026)

附录 T:机构分布与视频编号对照

机构 代号 段数 对应编号(公开 8 段中)
TUM Rechts der Isar MRI 6 1, 2, 3, 4, 5, 7
Heidelberg UKHD 1 11(= HeiChole2.mp4)
Weilheim-Schongau KWS 1 13

附录 U:留一中心验证的可行设计

方案 训练 验证 说明
LOHO-H1 H2+H3 H1(6 段) H1 样本足
LOHO-H2 H1+H3 H2(1 段) 退化为留一视频
LOHO-H3 H1+H2 H3(1 段) 退化为留一视频
LOVO 7 段 1 段 视频级,最稳

附录 V:三任务难度分级

任务 参与队伍数 最高性能 难度判断
相位识别 多(前三均 Transformer) F1 ≈ 69.12% 中
实例分割 多(Mask2Former 领先) — 中高(实例难)
关键点估计 仅 2 队 — 高

尾注

尾注 1:本条目的一句话价值主张

在千方病案医数集的全部手术视频条目中,PhaKIR 是唯一一个"在一条完整手术视频上同时回答时间问题(相位)、像素问题(实例分割)与几何问题(关键点)"的数据集,并且用三家德国医院的数据把这个联合问题放进了真实的跨中心分布里。它的重要性不在于数据量(8 段视频在手术视频数据集里并不算大),而在于它把三个长期分立的任务在数据层面缝合在了一起,从而让"多任务手术视频理解"第一次有了同源、完整、多机构的验证台。

尾注 2:为什么受限申请制值得认真对待

很多检索者看到"受限申请制"会本能地降低评价,认为"不如公开直链方便"。但对手术视频这类含患者影像与医护声画的敏感数据,受控访问恰恰是伦理合规的必要设计:它让数据使用者可被追溯、用途可被审核、患者隐私可被保护。PhaKIR 的隐私剪切(切除腔外片段)+ 逐段 cut 索引 + 申请审核,构成了一条完整的合规链。评价 PhaKIR 的获取门槛时,应把它读作"伦理成本的合理体现",而非"工程上的不足"。

尾注 3:给检索者的最后三句提醒

  1. 先申请,再规划:受限访问有审批周期,别把 PhaKIR 排在你的 deadline 后一天。
  2. 认准口径,别混论文:数据论文(8 段/486,875/19,475)与结果论文(13 段/808,900/32,356)是两套数字,混用会出错。
  3. 引用三篇,别漏 HeiChole:漏引 HeiChole 违反 PhaKIR 的复用条款。

尾注 4:本条目与其他千方病案医数集条目的协同

  • 若你研究手术相位,把 PhaKIR(三任务联合) 与 cholec80(相位事实标准) 组合,可做跨数据集相位迁移;
  • 若你研究器械分割,把 PhaKIR(实例) 与 cholecseg8k(语义) 对照,可研究"语义→实例"的能力跃迁;
  • 若你研究手术动作语义,把 PhaKIR(相位+器械) 与 cholect50(器械-动词-目标三元组) 组合,可做动作-相位对齐;
  • 若你研究内窥镜空间定位,把 PhaKIR(器械关键点) 与 endoslam(408) / slam-3d-endoscopic(82) 关联,可研究器械位姿与场景几何的关系。

尾注 5:数据的"沉默部分"

PhaKIR 有它刻意不说的地方:患者的人口学信息、病理诊断、手术难度评分、并发症情况全部缺失。这意味着任何基于 PhaKIR 的模型都无法做患者分层分析,也无法回答"模型在不同难度手术上表现如何"这一类临床问题。这既是隐私保护的代价,也限制了数据集的临床解释力。研究者在使用时必须意识到:PhaKIR 是一个影像-任务数据集,不是一个临床数据集。

尾注 6:一个被低估的设计——Undefined 相位

大多数相位数据集假设"每一帧都属于某个明确相位",但真实手术中,阶段之间的过渡往往持续数秒到数十秒,落在哪一类都有争议。PhaKIR 用一个 Undefined(P0) 类别把这些过渡帧显式收纳,承认了"边界是模糊的"这一现实。这个看似不起眼的设计,实际上提高了相位评估的诚实度:模型不必在无明确语义的过渡帧上被强制判对错。研究者应把 P0 单列报告,而非简单并入其他类。

尾注 7:关于"8 段视频够不够"的讨论

8 段视频在深度学习的尺度下确实不多,但 PhaKIR 的取舍是深度优先于广度:它把每段视频标到"相位逐帧 + 分割和关键点 1 fps"的极细粒度,换来的是每帧多标签的高信息密度。在手术视频领域,"少而深"与"多而浅"各有价值——PhaKIR 选择了前者,也因此更适合精细的多任务研究而非大规模预训练。理解这一取舍,才能正确判断它是否适合你的研究。

尾注 8:条目维护声明

本条目基于 2026-09-30 的抓取核验时点撰写,来源包括:数据论文 arXiv:2511.06549(含 PDF 全文)、挑战赛数据标注说明 PhaKIR_Data_Description_v2(含 PDF 全文)、Zenodo 记录 10.5281/zenodo.15740620、挑战官网 phakir.re-mic.de、Data in Brief 文章页、Medical Image Analysis 结果论文页。所有硬数字均经三源互证;无法确证的项已列入 §9 遗留疑点。若 Zenodo 新增版本、测试集公开或库内新增 heichole 条目,请按附录 I 的触发点更新本条目。

尾注 9:致谢与免责

本条目为千方病案医数集 AI-Ready Wikipedia 条目,信息仅供研究参考,不构成任何医疗或法律建议。PhaKIR 数据集的著作权与许可归 OTH Regensburg ReMIC Lab 及合作机构所有;使用请遵守 CC BY-NC-SA 4.0 条款并完成三篇文献引用。本条目作者与 PhaKIR 数据集团队无利益关联。

尾注 10:拼图与留白

如果把千方病案医数集的手术视频版图看作一幅拼图,Cholec80 提供"时间相位的骨架",CholecSeg8k 提供"像素语义的色块",CholecT50 提供"动作三元组的语法",EndoVis 提供"挑战赛的框架",而 PhaKIR 提供的,是把这几块在同一条完整手术视频上重新对齐的那层胶水——它证明"多任务、多机构、同序列"并不是不可能,只是代价高昂(受限访问、非商业许可、封闭测试集)。这些代价,正是这幅拼图尚未被更多人用起来的留白之处。

尾注 11:给数据集发布者的五条可借鉴经验

从 PhaKIR 的做法中,其他手术视频数据集的建设者可以提炼五条经验:

  1. 标注粒度按任务定制:相位用逐帧(时间密集),分割/关键点用 1 fps(空间密集)——不必强求所有任务同粒度;
  2. 用类别设计表达任务难点:把"实例身份"编进 B 通道,等于把"实例 vs 语义"的区分能力变成硬性考题;
  3. 保留完整序列:片段化虽省成本,但牺牲了全流程建模能力;
  4. 多机构优先:即便每机构样本少,多机构带来的真实域偏移也远胜单机构的"干净"数据;
  5. 开放挑战做质检:让社区下载检查,是低成本发现标注错误的手段。

尾注 12:给数据使用者的一条底线提醒

PhaKIR 是手术影像数据,即便经过隐私剪切与受控访问,使用者仍应自觉遵守医学数据的伦理规范:不尝试从视频中重新识别患者或医护、不将数据用于非申请用途、不绕过 ND 与 NC 条款。受控访问的授权是逐次、有条件的,不是"下载即拥有"。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • pengwin — 共享标签:医学影像 / 手术视频 / 医学图像分割 / 挑战赛数据集
  • giana — 共享标签:医学影像 / 内窥镜影像 / 医学图像分割 / 挑战赛数据集
  • dfuc-2024 — 共享标签:医学影像 / 医学图像分割 / 目标检测 / 挑战赛数据集
  • endovis-challenges — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • cad-cap — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 目标检测
  • cholecseg8k — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • autolaparo — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • endoscapes — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割
  • ldpolypvideo — 共享标签:医学影像 / 内窥镜影像 / 目标检测
  • kvasir-hyperkvasir — 共享标签:医学影像 / 手术视频 / 内窥镜影像 / 医学图像分割

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集