深度研报

Johns Hopkins 联合 FDA 推出工具,检测医疗 AI 中隐藏偏差

发布于 2026-07-22
#AI医疗#FDA#算法偏差#临床安全#诊断
Johns Hopkins 联合 FDA 推出工具,检测医疗 AI 中隐藏偏差

Johns Hopkins 团队与 FDA 合作开发新工具,用于识别医疗 AI 在临床环境中可能存在的隐藏偏差,目标是提升 AI 诊断和决策支持系统的可靠性。该研究聚焦模型在不同人群、数据分布和临床条件下的表现差异,提醒医疗机构不能只看总体准确率,而要持续评估公平性和稳定性。它的意义在于把监管机构和顶级学术机构的注意力拉到 AI 医疗落地后的真实风险治理上,为未来模型审评、部署和监测提供方法参考。

Johns Hopkins 与 FDA 合作推出 G-AUDIT,识别医疗 AI 中的隐藏偏差

Johns Hopkins University 团队与美国食品药品监督管理局 FDA 合作开发了一项新工具,用于识别训练医疗人工智能时可能潜藏的偏差来源,帮助研究人员和监管机构在模型部署前更早发现问题。相关成果已发表于《npj Digital Medicine》。

研究团队指出,很多医疗 AI 模型在总体准确率上看起来表现良好,但它们可能并不是依据真正有临床意义的信号做判断,而是学会了依赖数据中的错误线索。这样的模型一旦进入真实世界,可能对患者照护带来隐蔽但严重的风险。

从“事后审模型”转向“事前审数据”

这项新工具名为 Generalized Attribute Utility and Detectability-Induced bias Testing,简称 G-AUDIT。它与许多聚焦模型输出表现的传统安全措施不同,重点不是在模型训练完成后再检查问题,而是直接分析训练数据本身,找出最可能诱导模型学习错误关联的属性。

研究团队表示,最有意义的改变在于工作方式的转变。过去很多审计都是在问题出现后才检查,而 G-AUDIT 试图在模型学会错误规律之前,就定位哪些数据特征最值得警惕。

医疗 AI 可能像“聪明的汉斯”一样走捷径

研究负责人 Mathias Unberath 用“聪明的汉斯现象”来解释这一风险。历史上那匹看似会算术的马,其实只是学会读取人类身体语言,而非真正理解数学。医疗 AI 也可能出现类似情况,即看似给出正确结论,但实际依赖的是无关信号。

研究者举例称,曾有模型被训练来预测一个人的性别,最后依赖的不是生物学特征,而是睫毛膏这类视觉线索。换到医疗场景中,这种“走捷径”会更加危险,因为模型可能把采集环境、设备差异或附带物品误认为疾病信号。

研究案例揭示潜在临床风险

团队在图像、文本和表格等多种医疗数据上测试了 G-AUDIT。一个典型案例来自皮肤癌数据集:癌症门诊和普通皮肤科门诊使用了不同质量的成像设备,且癌症门诊拍摄图像时更常放置尺子记录病灶大小。

在这种情况下,如果模型直接学习这些数据,就可能错误地把“相机质量”或“图像中是否出现尺子”当作癌症预测信号。一旦模型被迁移到手机拍摄等真实使用环境中,这些线索不再存在,结果就可能出现明显偏差,并进一步放大健康不平等问题。

为监管和真实部署提供新方法

研究团队表示,G-AUDIT 能够对可能引发偏差的属性进行识别和排序,帮助开发者知道到底该审查哪些内容,而不是只检查那些“第一时间想到”的问题。

他们接下来计划继续扩展这项工具,并认为其方法不仅适用于医疗场景,也可能被迁移到更广泛的 AI 应用中。对医疗行业而言,这项研究的重要意义在于,它把 AI 公平性和可靠性治理的重点前移到数据阶段,为未来的模型评估、监管审查和临床落地提供了更具体的技术路径。

返回药研前沿