产品发布

OpenEvidence发布医疗AI模型家族Darwin,号称首个MedQA满分模型

发布于 2026-09-03
阅读 20
#医疗大模型#MedQA基准#临床决策#OpenEvidence
OpenEvidence发布医疗AI模型家族Darwin,号称首个MedQA满分模型

OpenEvidence于9月3日发布由Osler、Sackett、Snow、Darwin四款模型组成的医疗AI模型家族,面向认证医生免费开放。研究预览中的Darwin号称首个MedQA满分模型,并在MedXpertQA(72.8%)、HealthBench Professional(82.7%)、NOHARM(87.2%)领先Claude Fable 5与Gemini 3.7。三款生产模型按“快/深/全搜”分级,把医疗AI搜索从单一默认模型拆成可按深度选择的矩阵。

OpenEvidence一口气发四款医疗模型,Darwin凭什么号称“最强”

9月3日,医疗AI搜索平台OpenEvidence发布由四款模型组成的医疗AI模型家族,面向认证临床医生免费开放。这不是一次普通的模型升级,而是把“医疗AI搜索”从单一默认模型,拆成了一个可按深度与速度选择的模型矩阵:Osler、Sackett、Snow三款生产模型即日起可用,研究预览中的Darwin则号称当前最强的医疗AI模型。

产品卡片:四款模型一张表看懂

模型 定位 响应节奏 开放方式
Osler 最快的默认模型 约5秒/答 全量免费
Sackett 更深度的循证搜索 约30秒/答 全量免费
Snow 最深的全调研 约5分钟/答 全量免费
Darwin 最强(研究预览) 研究预览 仅申请开放

四款模型均面向已认证的临床医生,区别在于“想多久、搜多深”。命名也颇具匠心:Osler取自把医学教学从讲堂带到床旁的临床巨擘,Sackett是循证医学之父,Snow是1854年用一份地图锁定霍乱水源的流行病学先驱——暗示模型家族的价值观:临床、循证、证据溯源。

能力拆解:快、深、全搜与研究中预览

Osler是此前驱动OpenEvidence答案的模型继任者,成为平台默认,主打“快”;Sackett面向那些“要看法庭上证据分量”的问题,单答约30秒;Snow是Deep Consult功能的继任者,会跑完一整轮文献调研再出报告,单答约5分钟。三者差异不在准确率,而在思考时长与搜索深度——用户按场景自选。Darwin不公开发布,按申请开放,原因是双用途风险:一个能在病毒学、免疫学、人类遗传学前沿推理的模型,若落入不当之手,可能加速受严格管控的研究。

基准成绩:MedQA满分意味着什么

OpenEvidence称Darwin是首个在MedQA基准上取得满分的AI模型,并在其他榜单领先其点名的Claude Fable 5与Gemini 3.7:MedXpertQA 72.8%、HealthBench Professional 82.7%、NOHARM 87.2%。其评测方法也较严谨——MedQA从1273题测试集中经医师复标注、剔除信息缺失与标注错误后,得到660题终评集,Darwin无一答错;HealthBench Pro用Anthropic发布的LLM-as-judge配置、Claude Opus 4.8评分;NOHARM用官方开源包在30例开放子集上评分。Darwin的能力将在与机构伙伴验证安全护栏后,回流进Osler、Sackett、Snow。

商业化与竞争:免费策略下的护城河

三款生产模型对认证医生无限免费使用,既是临床渗透策略,也是对竞品的防守:医疗AI的答案质量高度依赖证据溯源与实时更新,免费先把医生的工作流占住,再用研究预览Darwin维持“最强”心智。面向专科的模型(从肿瘤、放射、临床遗传起步)已在路线图中。对医疗大模型赛道而言,OpenEvidence把“模型家族+按深度分级+免费临床入口”做成了一种可复制的产品范式——竞争不再只是榜单分数,而是谁先成为医生每天打开的那一个。


千方医数集编辑部 出品

返回医药AI前沿资讯