OpenEvidence发布医疗AI模型家族Darwin,号称首个MedQA满分模型
OpenEvidence于9月3日发布由Osler、Sackett、Snow、Darwin四款模型组成的医疗AI模型家族,面向认证医生免费开放。研究预览中的Darwin号称首个MedQA满分模型,并在MedXpertQA(72.8%)、HealthBench Professional(82.7%)、NOHARM(87.2%)领先Claude Fable 5与Gemini 3.7。三款生产模型按“快/深/全搜”分级,把医疗AI搜索从单一默认模型拆成可按深度选择的矩阵。
OpenEvidence一口气发四款医疗模型,Darwin凭什么号称“最强”
9月3日,医疗AI搜索平台OpenEvidence发布由四款模型组成的医疗AI模型家族,面向认证临床医生免费开放。这不是一次普通的模型升级,而是把“医疗AI搜索”从单一默认模型,拆成了一个可按深度与速度选择的模型矩阵:Osler、Sackett、Snow三款生产模型即日起可用,研究预览中的Darwin则号称当前最强的医疗AI模型。
产品卡片:四款模型一张表看懂
| 模型 | 定位 | 响应节奏 | 开放方式 |
|---|---|---|---|
| Osler | 最快的默认模型 | 约5秒/答 | 全量免费 |
| Sackett | 更深度的循证搜索 | 约30秒/答 | 全量免费 |
| Snow | 最深的全调研 | 约5分钟/答 | 全量免费 |
| Darwin | 最强(研究预览) | 研究预览 | 仅申请开放 |
四款模型均面向已认证的临床医生,区别在于“想多久、搜多深”。命名也颇具匠心:Osler取自把医学教学从讲堂带到床旁的临床巨擘,Sackett是循证医学之父,Snow是1854年用一份地图锁定霍乱水源的流行病学先驱——暗示模型家族的价值观:临床、循证、证据溯源。
能力拆解:快、深、全搜与研究中预览
Osler是此前驱动OpenEvidence答案的模型继任者,成为平台默认,主打“快”;Sackett面向那些“要看法庭上证据分量”的问题,单答约30秒;Snow是Deep Consult功能的继任者,会跑完一整轮文献调研再出报告,单答约5分钟。三者差异不在准确率,而在思考时长与搜索深度——用户按场景自选。Darwin不公开发布,按申请开放,原因是双用途风险:一个能在病毒学、免疫学、人类遗传学前沿推理的模型,若落入不当之手,可能加速受严格管控的研究。
基准成绩:MedQA满分意味着什么
OpenEvidence称Darwin是首个在MedQA基准上取得满分的AI模型,并在其他榜单领先其点名的Claude Fable 5与Gemini 3.7:MedXpertQA 72.8%、HealthBench Professional 82.7%、NOHARM 87.2%。其评测方法也较严谨——MedQA从1273题测试集中经医师复标注、剔除信息缺失与标注错误后,得到660题终评集,Darwin无一答错;HealthBench Pro用Anthropic发布的LLM-as-judge配置、Claude Opus 4.8评分;NOHARM用官方开源包在30例开放子集上评分。Darwin的能力将在与机构伙伴验证安全护栏后,回流进Osler、Sackett、Snow。
商业化与竞争:免费策略下的护城河
三款生产模型对认证医生无限免费使用,既是临床渗透策略,也是对竞品的防守:医疗AI的答案质量高度依赖证据溯源与实时更新,免费先把医生的工作流占住,再用研究预览Darwin维持“最强”心智。面向专科的模型(从肿瘤、放射、临床遗传起步)已在路线图中。对医疗大模型赛道而言,OpenEvidence把“模型家族+按深度分级+免费临床入口”做成了一种可复制的产品范式——竞争不再只是榜单分数,而是谁先成为医生每天打开的那一个。
千方医数集编辑部 出品

