数据标注“国字号”试点落子广州:医疗数据从“沉睡家底”到AI“粮仓”的关键一跃
国家数据局在数博会公布数据标注先行先试城市名单,广州跻身医疗健康领域先行先试行列(9月7日市政务和数据局确认)。广州拥有超7500家医疗机构、年诊疗近2亿人次,将围绕技术攻坚、模数共振、产业跃升、人才沃土四大方向建设,打造“数据—模型—应用”正向循环。
9月7日,记者从广州市政务和数据局获悉:在2026中国国际大数据产业博览会上,国家数据局正式公布全国数据标注先行先试城市名单,广州成功跻身医疗健康领域先行先试行列,斩获数据领域又一张“国字号”试点名片。在AI大模型竞争从算力转向高质量语料的当下,这张名单的产业含义值得逐字拆解——数据标注是高质量数据集建设的关键环节,也是人工智能模型训练的核心底座。
名单落地:39城版图中的广州坐标,医疗健康是重点赛道
数据标注先行先试并非首次布局。此前国家数据局已在成都、合肥等7个城市开展首批试点;本批新增32个城市后,全国版图扩展至39城,深入工业制造、医疗健康、交通运输、具身智能等重点行业领域。国家数据局的部署逻辑清晰:聚焦重点行业破解产业发展痛点,构建高水平数据标注产业体系,以专业化、智能化标注服务带动高知识密度数据集建设,加速“人工智能+”赋能千行百业。
对广州而言,这是继国家数据领域国际合作试点(“来数加工”“Token出海”模式)之后,在数据要素赛道上获得的又一国家级定位。不同的是,这一次的焦点从数据跨境转向了AI训练链的最前端——标注。
广州凭什么:7500家机构、2亿人次诊疗的数据家底
医疗健康领域的数据标注试点为什么落在广州?官方给出的底气是两组数字:作为全国三大医疗高地之一,广州拥有超7500家医疗卫生机构,年诊疗量近2亿人次,沉淀了体量庞大、类型丰富、场景多元的医疗数据资源。
与此同时,广州数字经济产业生态持续完善,数据要素市场化配置改革深入推进,已构建起涵盖数据采集、治理、标注、流通、应用的全链条服务体系。换句话说,广州既有“原料”(医疗数据资源),也有“厂房”(全链条服务体系),承接国家级试点的基础条件齐备。
四大任务拆解:标注技术、模数共振、产业集群、人才网络
围绕先行先试核心任务,广州明确了四大发力方向,每一条都对应着医疗AI数据链的现实短板。
一是技术攻坚。重点攻关智能标注、人机协同标注、跨模态语义对齐标注等关键技术,提升标注效率与精度——医疗数据的特殊性恰恰在于多模态:影像、病理切片、检验指标、病历文本语义体系迥异,跨模态语义对齐是训练医疗多模态大模型的前置条件,也是当前行业公认的难点。
二是模数共振。推动高质量数据集建设、模型训练、场景应用深度耦合,形成“数据—模型—应用”正向循环——数据集不再是一次性交付物,而是在模型应用中持续回流、迭代优化的活资产。
三是产业跃升。依托广州人工智能数据训练中心等载体,引育一批数据标注企业,打造从标注工具研发到行业解决方案输出的完整产业生态。
四是人才沃土。联动在穗高校与职业院校,构建分层分类数据人才培养体系和行业标注专家网络——医疗标注高度依赖临床专业知识,专家网络的建设直接决定标注质量的天花板。
从业者视角:数据标注产业化对医疗AI供应链意味着什么
从千方医数集的观察视角看,此次试点的产业信号有三层。
其一,医疗数据的价值确认路径正在制度化。过去医疗机构的数据多为“沉睡家底”,标注试点将“专业化标注服务带动高知识密度数据集建设”写入政策框架,意味着数据从资源到资产的转化有了国家级的施工通道。
其二,标注正在从劳动密集型环节升级为技术密集型产业。智能标注、人机协同标注被列为攻关方向,预示着“AI预标注+专家审核”的人机协同模式将成为行业标准配置,单纯依靠人力的标注作坊将面临淘汰。
其三,区域竞争进入“数据基建”维度。39城版图中,谁能率先建成高质量医疗数据集的供给能力,谁就能在医疗大模型的产业分工中占据上游。广州以7500家机构的家底入场,接下来的看点是:四大方向何时转化为可交易的数据产品,以及“广州经验”能否真正可复制、可推广。
原文链接:广州市政务和数据局(九派健康转载)
千方医数集编辑部 出品

