监管动态

科技部发布《人工智能医学影像研究伦理指引》:训练数据、合成数据、标注全流程立规

发布于 2026-08-27
阅读 19
#AI监管#医学影像#数据合规#伦理治理
科技部发布《人工智能医学影像研究伦理指引》:训练数据、合成数据、标注全流程立规

8月27日,科技部官网发布国家科技伦理委员会医学伦理分委员会研究编制的《人工智能医学影像研究伦理指引》,这是我国AI医学影像领域首份精细化伦理规范文件。《指引》将原始影像数据、训练数据、预训练数据、合成数据、验证与测试数据全部纳入定义范围,针对数据全生命周期提出四项要求:建立数据安全管理体系、严控数据质量与数据集来源、规范脱敏处理确保不可复原、审慎使用合成数据训练模型。同时要求算法开展跨设备、跨医院、跨人群复现性验证,并在数据采集、标注、训练、评估各阶段识别修正算法偏见。专家指出文件标志着该领域伦理治理从'原则性倡导'迈向'精细化指导',对医疗机构、研发企业的数据合规提出可操作标准。

政策出台:AI医学影像首份精细化伦理规范

8月27日,科技部官网发布国家科技伦理委员会医学伦理分委员会研究编制的《人工智能医学影像研究伦理指引》。这是我国人工智能医学影像领域的首份精细化伦理规范文件,覆盖基础算法研究、技术研发、临床验证和转化全链条,旨在防范科技伦理风险,推动负责任创新。

复旦大学附属华东医院放射科主任张军评价,文件标志着该领域伦理治理从"原则性倡导"向"精细化指导"迈出关键一步。

数据全生命周期四项要求逐条解读

《指引》最具操作性的部分是对数据全生命周期的四项要求,直接命中医疗AI数据工作的核心环节:

  • 数据安全管理体系:建立覆盖研究实验、临床试验到转化应用的数据安全管理体系,实现数据使用全程可追溯、可验证。
  • 数据质量把控:严格把控数据质量,选用来源清晰、科学性充分的数据集——数据来源合规性被写入刚性要求。
  • 脱敏规范:规范数据脱敏处理,确保处理后的信息无法重新识别自然人且不能复原。
  • 合成数据审慎使用:通过数学模型、算法或生成式AI模拟生成的影像数据可用于补充训练样本,但须审慎使用。

值得注意的是,《指引》对数据类型给出了完整定义:原始影像数据、训练数据、预训练数据(含领域内与领域外数据)、合成数据、验证与测试数据——监管颗粒度已细化到数据集的用途分层。

算法验证:跨设备、跨医院、跨人群复现性

针对"算法黑箱"问题,《指引》要求算法灵敏性、特异性等核心指标达到适宜标准,经过可重复性测试,并开展跨设备、跨医院、跨人群的复现性验证,防范临床应用中的偏移风险。同时在数据采集、标注、训练、评估各阶段识别并修正算法偏见——标注环节首次被明确写入国家伦理规范的偏见治理要求。

《指引》同时明晰了知情同意豁免情形,要求搭建科研人员、医疗机构、科技企业、监管部门协同的责任体系,实现研究全过程可追溯、可问责。

数据团队自查清单:从采集到标注的合规要点

对医疗数据团队而言,这份文件可以转化为四条自查项:数据集来源是否清晰且科学性充分?脱敏是否达到"不可重识别且不可复原"标准?合成数据在训练配比中是否留有审慎评估记录?标注流程是否有偏见识别与修正机制?

中国人民大学伦理学者王国豫指出,《指引》落地需医疗机构、研发机构、科研人员与伦理审查委员会多方协同。对医疗AI企业来说,数据合规已从"加分项"变为"入场券"。


千方医数集编辑部 出品

返回医药AI前沿资讯