73.1%→88.6%:上海六院用"多智能体"把卒中急诊决策的准确率抬高了一个量级
上海市第六人民医院团队开发结构化多智能体大模型框架,把急性缺血性卒中治疗推荐拆解为摘要、指南推理链、风险评估等专职智能体协作;基于2081例真实与文献病例验证及12名医生前瞻性决策研究,大模型辅助使医生治疗决策准确率从73.1%升至88.6%(OR 2.86),成果发表于Journal of Medical Internet Research。
核心数字:在 2081 例真实与文献病例验证、12 名医生参与的前瞻性决策研究中,上海市第六人民医院团队的结构化多智能体大模型框架,将医生急性缺血性卒中治疗决策的准确率从 73.1% 提升至 88.6%(OR 2.86,95%CI 2.27-3.60)。成果发表于《Journal of Medical Internet Research》。
15.5 个百分点意味着什么
急性缺血性卒中的治疗选择是一场与时间的赛跑:静脉溶栓、血管内取栓或标准内科治疗,各有严格的时间窗、禁忌证与适应证。医生必须在数十分钟内整合神经功能评分、影像、化验与既往史做出判断——这个过程高度依赖专科经验,且对错误"零容忍"。
73.1% 的基线准确率意味着:即使是有经验的医生,每 4 次决策中也有近 1 次不够理想。在神经专科医生短缺的基层,这个数字只会更难看。15.5 个百分点的提升,折合成临床语言,就是每 6-7 名患者中能多 1 人获得正确处置。
框架拆解:为什么"多智能体"比"一个大模型"靠谱
既往单一大模型做卒中推荐,常因长文本、模糊输出和幻觉而难以上临床。上海六院的核心创新是把决策拆成专职智能体的流水线协作:
| 环节 | 智能体 | 职责 |
|---|---|---|
| 第一步 | 摘要智能体 | 从冗长病历中提炼关键临床叙事,降低推理噪声 |
| 第二步 | 指南推理链智能体 | 按指南逻辑推理,输出结构化、可勾选、可审计的建议 |
| 输出层 | —— | 静脉溶栓/血管内取栓/标准内科治疗/非AIS/非卒中+TOAST分型 |
这个设计的巧思在于"可审计":建议不再是自由文本,而是约束在明确类别里的结构化输出——既方便医生快速勾选确认,也让每一次 AI 建议都有据可查、可以复盘。
证据的分量与边界
这项研究的设计在同类工作中属于高配置:2081 例病例验证打底,12 名医生前瞻性决策研究收尾,效应量 OR 2.86 且置信区间不跨 1,统计学上扎实。
但边界同样清晰:研究验证的是决策准确率的提升,而非患者最终预后的改善;12 名医生的样本量也偏小。论文团队自己给出的结论很克制——多智能体编排可提升基层与非专科医生的卒中决策一致性,但仍需前瞻性多中心研究验证临床结局。
从行业视角看,这条"单模型→多智能体"的路线正在成为临床大模型的主流工程范式:当单一模型的能力天花板逼近,用架构分工换取可靠性的提升,可能是医疗 AI 落地更现实的路径。
原文链接:尧图网络
千方医数集编辑部 出品

