ARISE 更新 MAST 医疗 AI 超级智能测试,聚焦临床系统安全性与可靠性
ARISE 的 MAST 页面显示,其 Medical AI Superintelligence Test 基准套件用于评估临床 AI 系统在不同医学领域中的安全性、准确性与可靠性,并在 7 月 25 日更新。该内容值得关注,是因为医疗 AI 的竞争已经不只是模型能力展示,更需要可复现、可比较、面向临床风险的评测框架。随着医疗大模型和临床 AI Agent 进入真实工作流,行业需要更细粒度地衡量幻觉、错误建议、跨科室泛化能力和高风险场景表现,MAST 这类基准可能成为后续产品验证、学术比较和监管讨论的重要参考。
ARISE 更新 MAST 基准,评估医疗 AI 的安全性、推理与多模态能力
ARISE 发布并持续更新 MAST(Medical AI Superintelligence Test)项目,定位为一套面向医疗人工智能的独立评测框架,帮助研究人员、开发者、医疗机构和其他组织更系统地判断“哪些 AI 更值得信任用于医疗问题”。页面信息显示,该项目聚焦临床推理、安全性以及医学影像等多个高风险维度。
MAST 由多机构合作推进,强调通过更贴近真实场景的基准集合,对医疗 AI 进行可比较、可复现的独立评估,而不是只看模型厂商自报的能力展示。
MAST 评什么
根据项目介绍,MAST 当前覆盖一般医疗 AI 使用场景以及面向临床人员的使用场景。其主要评测维度包括诊断推理、管理决策推理、安全性、多模态图像、多模态放射学以及 Agentic 能力等。
这意味着,MAST 并不把医疗 AI 简化为单一问答分数,而是试图把模型在临床高风险环境中最关键的几类能力拆开来看,尤其关注那些可能直接影响建议质量、风险控制和工作流执行的维度。
当前榜单呈现了什么信号
页面显示,在最近一次更新中,OpenAI 的 GPT-5.5、Google 的 Gemini 3.5 Flash 与 Gemini 3.1 Pro、Anthropic 的 Claude Opus 4.7 与 Claude Sonnet 4.6,以及 Meta、Moonshot AI 等公司的模型均被纳入比较。
在综合分数上,GPT-5.5 以 61.6% 位居前列,Gemini 3.5 Flash 和 Claude Opus 4.7 紧随其后。页面还提供了模型间的维度级对比,例如 GPT-5.5 与 Gemini 3.1 Pro 在诊断推理、管理推理、安全、多模态图像、多模态放射学与 Agentic 指标上的差异。
这种展示方式说明,医疗 AI 的强弱已经不能仅靠一个总分来概括。某些模型可能在诊断推理更强,另一些模型则可能在多模态图像或 Agentic 能力上更有优势。
从演示到技术排行榜的完整链路
除了主榜单外,MAST 还提供多个具体基准演示页面和完整技术排行榜入口,涉及 First Do NOHARM v2、SCT-Bench、MedAgentBench v2、PhysicianBench、ReXrank Mini 等测试集,并开放 GitHub 代码仓库与数据探索路径。
这使 MAST 不只是一个“结果网页”,而更像一个对外公开的评测基础设施,方便研究者复核结果、运行自定义模型并在统一框架下进行横向比较。
为什么这类基准越来越重要
随着医疗大模型、临床决策支持系统和 AI 智能体逐步进入真实工作流,行业越来越需要面向临床风险的细粒度评测框架。单纯展示模型能否回答医学问题,已经不足以支撑采购、部署和监管讨论。
MAST 的意义在于,它试图把医疗 AI 的比较重点从“谁看起来更强”转向“谁在安全、高风险推理、多模态医学场景和 Agentic 工作流上更可靠”。对未来的产品验证、学术比较以及监管沟通来说,这类基准体系很可能会变得越来越关键。

