深度研报

9850万美元买数据:美国罕见病AI诊断计划,把钱花在了"看不见的地基"上

发布于 2026-09-05
阅读 8
#ARPA-H#RAPID#罕见病#AI诊断#真实世界数据集#合成数据
9850万美元买数据:美国罕见病AI诊断计划,把钱花在了"看不见的地基"上

美国ARPA-H宣布RAPID计划,四份合同五年合计9850万美元,建设罕见病AI诊断数据基础设施:北卡大学建最大真实世界罕见病数据集,Sage Bionetworks建模型测评平台,FDNA采多模态数据,Probably Genetic生成合成数据,OpenAI/Anthropic/AWS/Google提供算力支持。

核心数字9850 万美元、四份合同、近五年周期——美国卫生与公众服务部下属创新机构 ARPA-H 本周宣布 RAPID 计划(Rare Disease AI/ML for Precision Integrated Diagnostics),目标不是开发某个 AI 模型,而是建设让 AI 真正可用于罕见病诊断的数据基础设施

诊断奥德赛:问题卡在数据,不在算法

罕见病患者平均要等待 5-7 年才能获得准确诊断,部分人终身未确诊,全球约 4 亿人受罕见遗传病影响。这个"诊断奥德赛"的根源不是 AI 不够聪明,而是数据先天残疾:基因检测结果在一个系统里,病历在另一个系统里,患者自述症状往往只在互助群里——就像拼图碎片被锁在不同房间,每个房间还有自己的门禁规则。AI 模型训练依赖的大规模、干净、标注一致的数据,在罕见病领域几乎不存在。

四路分工:一份"数据基建"的解剖图

RAPID 的四份合同恰好构成完整的数据流水线:

  • 北卡罗来纳大学(牵头最大份额):联合学术机构、健康数据公司、患者组织,组建史上最大真实世界罕见病数据集——融合临床、基因组与患者报告数据,同时保护隐私;
  • Sage Bionetworks:建设安全的 AI 模型测评比较平台——相当于给所有参赛工具当"裁判";
  • FDNA:开发多模态数据采集工具,直接从诊所和患者处收集照片、视频、语音与主诉(其面部特征分析在遗传病诊断领域有多年积累);
  • Probably Genetic(合同约 1000 万美元):生成合成数据集——统计上逼真但不含真实患者信息,填补数据稀缺与隐私敏感的双重空白,并建设患者端的检测与临床试验导航工具。

数据视角:合成数据为何成了"必需品"

对医疗数据从业者来说,RAPID 最有启发性的是合成数据的定位变化。在常见病领域,合成数据通常是真实数据的"替代品",用于隐私脱敏或数据增广;但在罕见病领域,真实数据的绝对稀缺让合成数据升级为必需品——部分病种全球确诊病例可能只有数百例,不借助合成扩增,模型训练根本无法启动。Probably Genetic CEO Lukas Lange 的判断是:如果计划成功,2026-2030 年可能成为遗传病研究史上最重要的五年。

生态信号与冷思考

值得注意的是生态位:OpenAI、Anthropic、AWS、Google 均承诺提供算力与工程支持(无正式合同);Global Genes 等患者组织参与确保患者声音进入设计环节;ARPA-H 还联合 NASA 卓越协作创新中心开设 Rare Challenges 竞赛平台,让外部团队能基于统一数据与基准测试方案。

冷思考同样必要:数字病理的全球采用率长期滞后,是 AI 疾病检测落地的现实瓶颈之一;数据共享的制度摩擦(各机构数据使用协议)也不会因为一笔联邦经费就消失。但 RAPID 的示范意义已经成立——当所有人都在卷模型时,把预算的大头给数据地基,本身就是一种罕见的清醒。

原文链接The Beat

千方医数集编辑部 出品

返回医药AI前沿资讯