深度研报

医疗AI评测进入"循证时代":当评分标准不再是答案对错,而是"每一分都有医学证据"

发布于 2026-09-05
阅读 8
#MedEvidence Bench#医疗AI评测#循证医学#大模型评测#黄河医学人工智能大会
医疗AI评测进入"循证时代":当评分标准不再是答案对错,而是"每一分都有医学证据"

首届黄河医学人工智能大会上,国家超算济南中心联合多家医院与高校发布医疗AI循证可信测评系统MedEvidence Bench,把临床指南与权威证据嵌入评价体系,构建“1+4+N”体系,已完成首批国内外大模型评测。

现象切入:医疗大模型这两年进入了"刷榜季"——几乎每周都有新模型宣布在某医学 benchmark 上超越 GPT 系列。但一个尴尬的问题始终悬着:选择题做对了,就证明它能进诊室吗?9 月 5 日,首届黄河医学人工智能大会在济南召开,会上正式发布的医疗人工智能循证可信测评系统 MedEvidence Bench(MEB),给出了一个不同的解题思路。

评测之困:模型的"专业"由谁来裁决

生成式 AI 正加速从知识问答走向辅助诊疗、医学影像等真实临床场景。越靠近临床,评价的风险权重越高——一个事实性错误在闲聊场景是"幻觉",在用药建议场景就是事故。行业的集体焦虑可以概括成一句话:如何科学评判模型的真实专业能力,厘清其适用范围与安全边界?

现有主流评测多以标准化考试题为载体,考的是"知道什么",很难回答"依据可靠吗""这个结论越界了吗"。

MEB 的破题方式:让医学证据当裁判

MEB 由国家超级计算济南中心联合山东健康医疗大数据管理中心、山东大学高等医学研究院、山东第一医科大学附属省立医院、山东大学齐鲁医院等共同建设。其核心机制是把临床指南、专家共识、权威医学证据嵌入整套评价体系:

  • 医学专家先确定考核重点,再对照指南和权威证据制定评分标准;
  • 每个判断都标明适用边界——什么情况下成立、什么情况下不成立;
  • 模型作答后,不只看答案对错,还要追溯依据是否可靠、结论是否越界

用山东省计算中心(国家超算济南中心)主任吴晓明的话说:"每一分,都有医学证据。"

"1+4+N":证据为 1,能力为 4,场景为 N

MEB 构建的"1+4+N"综合评价体系,层次设计颇有讲究:"1"是医学证据这一基石——无论评哪项能力,都尽可能以指南、共识和权威证据为标尺;"4"是医学基础能力、临床推理能力、循证决策能力、安全可信能力四项核心;"N"则向各类真实医疗场景持续延伸。

这一设计的潜台词是:总分没有意义,能力画像才有意义——一个模型可以基础知识扎实但循证决策冒进,评测结果应该暴露这种结构性的短板,而不是被平均分掩盖。

目前 MEB 已对首批国内外主流通用大模型和医学专用大模型完成评测,官方口径是"国产模型表现亮眼,医学专用大模型优势初显"。

评论:从"排行榜"到"参考系"

我们的判断是,MEB 这类循证评测的真正价值不在榜单本身,而在它可能成为两个场景的基础设施:一是医院采购医疗 AI 时的尽职调查参考——院长们需要的不是营销话术,而是"这个模型在哪些边界内可靠"的第三方证据;二是监管体系的技术支撑——医疗 AI 的分级分类监管,终究需要可操作的度量工具。

当然,评测体系自身的生命力取决于两点:证据库能否跟上指南更新速度,以及评测过程能否保持独立与透明。排行榜会过时,"证据驱动评价"这个方法论不会

原文链接闪电新闻(今日头条)

千方医数集编辑部 出品

返回医药AI前沿资讯