产品发布

联影智能开源全球首个医疗视频理解大模型:6245个逐帧标注视频-指令对测试集同步开放

发布于 2026-08-28
阅读 17
#医疗视频理解#开源大模型#逐帧标注#MedVidBench#联影智能
联影智能开源全球首个医疗视频理解大模型:6245个逐帧标注视频-指令对测试集同步开放

联影智能开源全球首个医疗视频理解大模型,同步开放6245个逐帧标注视频-指令对测试集,发布金标准自动评分榜单并发起全球挑战赛。

全球首个:医疗视频理解大模型开源了什么

联影智能日前发布"元智"医疗视频理解大模型,并在GitHub、Hugging Face等全球开发者社区首批开源由6245个视频-指令对构成的标准测试集。这是全球首个面向医疗视频多维理解场景开源的模型,官方称之为提供"可对齐、可复用、可验证"的标准能力框架。

医疗视频理解是一个被低估的难题。影像AI处理的是静态图像,而手术视频、内镜视频、超声动态影像是连续时序数据——AI不仅要"看懂"每一帧,还要理解器械在做什么、操作是否规范、风险在哪里。此前这个领域缺乏统一的模型与评测标准,各家闭门造车。

6245个视频-指令对:逐帧标注的数据工程

这个模型真正的护城河在数据侧。联影智能对海量医疗视频数据集进行了逐帧级精细标注,覆盖器械、位置、操作、风险等核心要素,最终构建起"感知-推理-决策"的完整能力体系。

"逐帧级"三个字的工程量值得展开:一段十分钟的内镜视频可能有上万帧,每一帧的器械类型、空间位置、操作动作、风险等级都需要准确标注——这是视频理解区别于图像分类的劳动密集环节,也是模型质量的直接决定因素。研究团队的底子同样硬:成果多次入选CVPR、NeurIPS、ICLR、ICCV、ICML、AAAI等国际顶级AI会议期刊。

金标准自动评分:榜单与全球挑战赛

开源之外,联影智能同步发布了"医疗视频理解大模型榜单",由系统基于金标准自动评分形成统一排行榜——不靠各家自报成绩,而是同一把尺子量到底。

生态布局更进一步:今年7月,联影智能携手斯特拉斯堡大学和慕尼黑工业大学两大头部学术团队,共同发起医疗视频理解大模型全球挑战赛。参赛者可依托开源模型及数据资源训练优化,在多样化手术视频任务上评测能力,优胜队伍将有机会在2026年9月ECCV 2026期间的专题研讨会上发表成果。

为什么开源:从技术提供者到行业基础设施

开源模型+开放测试集+自动评分榜单+全球挑战赛,这四件套合起来是一套完整的领域基础设施打法。其战略意图在报道中说得很直白:从"技术提供者"升级为"行业基础设施建设者"。

开放模式的价值在于循环:全球开发者与医疗机构参与进来,真实临床场景中的罕见病例、复杂手术成为技术迭代的养料,数据与模型的边界持续外扩。当垂直领域的"公共尺子"立起来之后,后来者要么接入这套标准,要么重新发明它——而重新发明的成本,远高于接入。这或许是中国医疗AI公司第一次在一个细分领域,用开源的方式定义全球技术范式。


千方医数集编辑部 出品

返回医药AI前沿资讯