行业观察

22TB 高质量医疗数据集背后:肾病 AI 大模型进临床,数据标注成为医疗 AI 新基建

发布于 2026-08-21
阅读 28
#医疗数据集#数据标注#肾病AI#大模型#数据要素
22TB 高质量医疗数据集背后:肾病 AI 大模型进临床,数据标注成为医疗 AI 新基建

据半岛晨报报道,大连医通康合科技与大连医科大学附属第一医院肾内科共同研发的肾病 AI 大模型已投入临床使用,可迅速梳理海量病历关键信息并从医学影像中发现易被忽略的细微病灶。支撑这个模型的是一条完整的数据产业链:依托数据要素创新实验室,医通康合已参与形成肿瘤、心脏病、VTE 等 6 个高质量数据集,规模达 22TB,医生直接参与高质量标注。临床中不断产生的新数据经清洗、分类、标注后回流数据体系,驱动模型持续迭代。大连市数据标注产业园已入驻 19 家企业、从业约 1100 人,剑指国家级数据标注基地。

一个能在肾内科诊室里梳理海量病历、从医学影像中捕捉细微病灶的 AI 大模型,最近正式投入临床使用。但比"AI 进临床"这个消息更值得行业关注的,是支撑它的一组数字:6 个高质量数据集、22TB 数据规模,以及一条围绕医院生长出来的数据产业链。

肾病 AI 大模型的"临床上岗"

据半岛晨报报道,这款肾病 AI 大模型由大连医通康合科技有限公司与大连医科大学附属第一医院肾内科共同研发。面对一份包含病史、检查指标、影像资料的完整病历,它能迅速提取关键信息,并从医学影像中寻找容易被医生忽略的细微病灶,为诊断提供参考。

这类应用在今天并不新鲜——真正值得拆解的,是它背后的数据工程。

22TB 数据集是怎么炼成的

如果把 AI 大模型比作学生,算法决定它如何学习,高质量数据则是它每天要读的"教材"。而医疗数据的"教材编写"远比想象中复杂。

医通康合总经理钟家豪的表述很直白:"医疗数据专业门槛非常高,并不是简单地在图片上画个框、贴个标签就可以。"哪些数据有价值、如何分类、病灶如何标记,需要专业人员按照医生指导处理;一些高质量数据集甚至需要医生直接参与标注——在 AI 学会识别病灶之前,人必须先告诉它什么是病灶

目前,依托数据要素创新实验室,医通康合已参与形成肿瘤、心脏病、泌尿恶性肿瘤相关 VTE(静脉血栓栓塞症)等 6 个高质量数据集,规模达到 22TB,并仍在推进疑难共病等数据集建设。

更关键的是数据回流机制:模型投入临床后,新产生的临床数据会经过清洗、分类、标注等环节重新进入数据体系。用报道里的话说,AI 不是"训练完就毕业了",而是在真实场景中不断更新"题库"。

一座产业园的公共服务逻辑

单个企业的数据工程成本高昂——专业标注人员、算力、存储、算法工具、安全的数据环境,全链条自建并不经济。这正是大连市数据标注产业园存在的意义:把企业各自承担的成本变成公共服务。

2025 年 9 月开园的这座产业园采用"一平台、一中心、一空间"布局,与中国联通等企业合作引入算力资源和可信数据空间。截至目前已入驻金慧融智、宏图创展、医通康合、中科超硅等 19 家企业,从业人员约 1100 人,并已全部填满一期 1.2 万平方米、启动二期扩展。产业园与近 20 所高校和职业院校共建实训基地,形成"人才孵化—产业培育—市场拓展"链条,规划到 2027 年建成近万人规模的区域性高端数据服务枢纽,并力争国家级高质量数据集与数据标注基地。

医疗数据标注正在被重新定价

这个案例的信号意义在于:数据标注正在告别"屏幕后面的人力密集"刻板印象。越往 AI 产业深处走,数据越专业,对标注者的行业知识、技术能力和数据安全要求越高——医疗恰是这条曲线最陡峭的领域之一。

对医疗数据从业者而言,肾病 AI 大模型的临床落地验证了一条完整路径:医院提供场景与专家知识 → 专业团队完成数据治理与标注 → 高质量数据集驱动垂直模型 → 临床新数据持续回流。22TB 不是终点,而是这条数据飞轮开始转动的起点。

AI 跑得有多快,不只取决于模型有多聪明,也取决于我们能不能持续给它提供足够好的"粮食"。

千方医数集编辑部 出品

返回医药AI前沿资讯