深度研报

从「上千万字病历」到结构化专病库:北大团队的双引擎治理账本

发布于 2026-08-31
阅读 9
#["医疗数据"#"专病数据集"#"数据治理"#"AI+医疗"]
从「上千万字病历」到结构化专病库:北大团队的双引擎治理账本

北大李方平在数博会提出医疗数据三字诀困境,用「大模型+小模型」双引擎把血液专病数据治理周期从8-12个月压缩到2-3个月,准确率近100%。

三字诀:医疗数据的「不能用、不敢用、不愿用」

在2026数博会贵州分赛获奖项目路演上,北京大学(天津滨海)新一代信息技术研究院副院长李方平用一个设问开场:智慧医疗的智慧从哪里来?答案被拆成两类数据——电子病历、检查单、CT影像这类临床数据,告诉我们「发生了什么」;医学文献、教材、权威数据库这类医学知识,告诉我们「这意味着什么」。

但他随即抛出了医疗专病数据的三字诀困境:「不能」「不敢」「不愿」。「不能」是数据分析极其复杂,「不敢」是隐私可能出问题,「不愿」是缺少驱动力。这三个字精准戳中了医疗数据要素化的软肋:数据不是没有,而是结构化程度不足以被模型和临床真正使用。

血液病样本:上千万字病历与23.9%的五年生存率

李方平用血液病做切片。血液系统恶性肿瘤是我国重点防治的十大恶性肿瘤之一,儿童和青少年白血病死亡率居癌症首位,成人非早幼粒急性髓系白血病5年生存率仅23.9%。而这类病人的电子病历动辄上千万字,人力根本无法处理。

「高质量的血液专病数据集的每一次提升,都意味着病人诊疗质量的提升就有了可能。」这句话点明了专病数据集的价值逻辑——它不是通用语料的堆砌,而是直接绑定具体病种的诊疗改进。数据质量每上一个台阶,对应的是真实患者的预后改善空间。

双引擎协同:大模型理解,小模型像手术刀

团队的技术方案是「医疗基座大模型+小模型精准计算」的双引擎协同。大模型负责理解、编排和解释,专业小模型负责精准计算——李方平形容它「像医生的外科手术刀一样」,把临床诊疗数据转化为高质量结构化数据集。

这套分工的合理性在于:医疗场景里,通用大模型的强项是语义理解,弱项是精确计算;而专病结构化需要的是可复现、可校验的确定性输出。双引擎把「理解」和「计算」解耦,既保留了大模型的泛化能力,又守住了临床对精度的底线。

效率账本:治理4倍提速,准确率近100%

账本很硬:数据治理周期从传统的8到12个月缩短至2到3个月,效率提升4倍;多中心临床研究数据准备周期从4到6个月缩短至2到3周,效率提升8倍。经AI与专家双轮校验,核心字段抽样准确率几乎达到100%。

在数据安全上,团队实现了三个目标:原始数据不出域(安全)、不可篡改(可信)、可用不可见(隐私)。这三点恰好回应了「不敢」和「不愿」——只有把安全合规做扎实,医疗数据要素才能从「不敢用」走向「放心用」。李方平的目标是从单一病种扩到多个专病领域,把数据要素尽快转化为生产力。


千方医数集编辑部 出品

返回医药AI前沿资讯