行业观察

4亿罕见病患者的「数据长征」:ARPA-H押注患者驱动数据集

发布于 2026-08-31
阅读 18
#["罕见病"#"患者驱动数据集"#"ARPA-H"#"真实世界数据"]
4亿罕见病患者的「数据长征」:ARPA-H押注患者驱动数据集

ARPA-H授予Probably Genetic至多1000万美元,用direct-to-patient模式建全球最大罕见病数据集,直面4亿患者、平均5-7年诊断之旅的痛点。

1000万美元合约:把「诊断之旅」从5-7年压缩到可计算

美国卫生部下属的高级卫生研究计划局(ARPA-H)授予AI平台公司Probably Genetic至多1000万美元合约,属于其RAPID项目(罕见病AI/ML精准集成诊断)。这笔钱的目标不是做一款软件,而是建一个数据集——全球最大的、由患者直接驱动的罕见病数据集。

背景数字触目惊心:全球超4亿罕见病患者(比癌症和HIV患者加起来还多),其中一半尚未确诊,平均「诊断之旅」长达5到7年。Probably Genetic CEO Lukas Lange的表述很直白:这是把精准医疗从「不可及」变成「人人可及」的最后瓶颈。

direct-to-patient:绕开EHR的碎片化陷阱

这套数据集的构建方式值得数据从业者注意。传统罕见病数据高度依赖电子健康档案(EHR),但EHR天生缺关键信息:症状起病时间、严重程度、进展、形态学特征。Probably Genetic选择direct-to-patient模式,直接向患者和照护者采集症状、既往诊断、多模态数据,并提供居家基因检测。

这意味着数据源的颗粒度发生了变化——从「医生记录了什么」转向「患者经历了什么」。对训练诊断模型而言,患者自报的症状时序和严重度,恰恰是罕见病诊断最稀缺的维度。

12万患者、50+组织:数据飞轮的初始速度

Probably Genetic已经积累了12万+患者数据,合作了50+患者权益组织和15+生物制药公司。它把自报症状、临床诊断、EHR、多模态数据转化为结构化的深度表型数据。

这个存量的意义在于:罕见病单一病种样本稀少,只有跨病种、跨地域、跨模态的规模化聚合,才能让AI模型「看见」罕见病的共性模式。ARPA-H的RAPID项目正是看中了这一点——用国家级的资金杠杆,把零散的罕见病数据汇聚成可训练、可评测的资产。

从诊断到药物研发:一份数据两种用途

这份数据集的野心不止于诊断。Probably Genetic明确表示,数据将训练AI识别未确诊患者,同时服务药物研发全周期——从靶点发现、患者分层到临床试验终点选择。多组学表型模型将真实世界证据与疾病生物学连接起来。

一鱼两吃的逻辑很清晰:诊断侧,数据帮患者缩短等待;研发侧,数据帮药企精准分层。当「诊断数据集」和「药物研发数据集」合二为一,罕见病的数据要素价值就被放大了不止一倍。对中国的罕见病数据建设而言,ARPA-H这个样本提供了一个可参照的路径:用公共资金撬动患者端数据供给。


千方医数集编辑部 出品

返回医药AI前沿资讯