深度研报

4000万图像块+国产框架:中山六院肠癌AI揭示病理大模型的数据集构建范式

发布于 2026-08-25
阅读 24
#中山六院#肠癌AI#病理大模型#医疗数据#免疫微环境
4000万图像块+国产框架:中山六院肠癌AI揭示病理大模型的数据集构建范式

广州市公布第二批AI医疗创新项目,中山六院两项肠癌AI项目入选。其一是基于全景多靶点病理AI大模型的肠癌免疫精准诊疗风险分层体系构建,模型基于国产自主开发框架,依托大量HE图像、免疫多色图像以及4000万图像块构建高质量训练数据集,训练样本来源于国内多家三甲医院。模型可自动识别肿瘤细胞、免疫细胞、间质细胞及血管等多维特征,融合免疫细胞空间分布、细胞邻接关系、肿瘤浸润梯度及空间拓扑网络,建立肠癌免疫微环境智能评估体系。两项项目共同推进结直肠癌病理诊断辅助决策支持系统的搭建,打通从病理诊断到治疗决策的完整AI辅助链路。

项目入选:广州市第二批AI医疗创新名单,两项肠癌AI项目入选

8月21日,广州市卫生健康委举行卫生健康数智化成果发布活动,公布第二期人工智能医疗健康行业应用创新揭榜挂帅项目清单。中山大学附属第六医院共有2个聚焦结直肠癌病理诊断领域的前沿项目入选,标志着该院在结直肠癌AI诊疗领域的探索迈向更精准、更系统的新阶段。

此次入选的两项分别为"基于混合智能架构的结直肠癌病理AI辅助诊断与报告生成临床级大模型"与"基于全景多靶点病理AI大模型的肠癌免疫精准诊疗风险分层体系构建"。后者从数据视角看尤为关键——它是典型依靠高质量、大规模标注数据驱动的病理人工智能大模型(Pathology Foundation Model)项目。此前,该院"面向基层赋能的结直肠癌个性化辅助诊疗专病大模型"已在第一期揭榜挂帅活动中入选首批36个项目,在政策、数据和算力的全方位支持下取得良好临床成效。

数据底座:4000万图像块,HE图像+免疫多色图像,多家三甲医院训练样本

从数据集构建(Dataset Construction)视角审视,该项目最核心的工程能力在于其数据底座。模型基于国产自主开发框架搭建,依托大量HE图像(苏木精-伊红染色图像,Hematoxylin-Eosin Stained Image)、免疫多色图像(Multiplex Immunofluorescence Image)以及4000万图像块(Image Patch)构建了高质量训练数据集。

值得关注的是训练样本的来源与结构。其样本并非来自单一中心,而是来源于国内多家三甲医院,重点覆盖我国高发直肠癌亚型和不同治疗背景人群。这一设计直击病理AI落地中的两大痛点:一是数据代表性(Data Representativeness)——多中心、多亚型的样本结构避免了单一中心数据带来的模型偏倚(Bias);二是临床适用性(Clinical Applicability)——覆盖不同治疗背景人群,为后续风险分层与疗效预测提供了差异化的训练分布。

在数据标注层面,该项目围绕免疫微环境(Tumor Immune Microenvironment)构建了多维标注体系。模型训练过程中可自动识别肿瘤细胞、免疫细胞、间质细胞及血管等多维特征,将传统单任务识别升级为多尺度、多特征的联合学习,显著提升了病理图像块的特征表达能力。

模型能力:多维特征识别+免疫微环境空间拓扑网络评估

在数据底座之上,项目的模型能力体现在对免疫微环境的"空间拓扑网络"级评估。训练中模型融合了免疫细胞空间分布、细胞邻接关系、肿瘤浸润梯度及空间拓扑网络(Spatial Topological Network)等多类信息,建立起肠癌免疫微环境智能评估体系。

这一技术路线的价值在于:传统病理AI多停留在"识别细胞类型"的层面,而本项目进一步建模细胞与细胞之间的空间关系——免疫细胞是否聚集、肿瘤浸润边界如何变化、不同细胞邻接是否形成抑制性网络等,这些空间信息正是免疫治疗响应预测的核心生物学信号。模型最终产出用于肠癌风险分层、免疫治疗获益人群筛选以及疗效预测的产品,填补了肠癌精准免疫诊疗工具匮乏的临床空白,并实现核心算法、模型训练、产品转化和临床应用的全流程国产化。

千方视角:病理AI大模型的数据集构建——从图像块到空间拓扑,高质量标注数据的全链路构建

对医疗数据从业者而言,该项目揭示的是一条可复制的病理大模型数据集构建范式(Data Pipeline Paradigm)。

其一,是"从图像块到空间拓扑"的层次化标注策略。4000万图像块构成底层特征学习单元,HE图像与免疫多色图像提供不同维度的信号源,而空间拓扑网络则定义标注的语义层次。这一设计避免了"一刀切"标注的粗放,让模型在不同粒度上分别学习形态学与空间关系。

其二,是多中心、多亚型、多治疗背景的数据治理(Data Governance)思路。它回答了"训练数据从哪来、代表性如何保证"这一核心问题——通过覆盖高发亚型与不同治疗背景人群,降低模型在真实临床分布下的泛化风险。

其三,是国产框架下的全链路自主可控。从核心算法、模型训练到产品转化、临床应用的全流程国产化,意味着数据集构建、预处理、标注规范等环节均沉淀为自主技术资产,这对医疗数据合规与长期迭代尤为关键。

当然,从数据视角仍需审慎看待的挑战包括:免疫多色图像的数据获取成本与标注标准尚未统一、空间拓扑标注的跨中心一致性有待验证、以及数据规模与临床收益之间的量化关系仍需更多循证支撑。但无论如何,中山六院以4000万图像块为底座所构建的病理免疫微环境评估体系,为"病理AI大模型如何正确构建数据集"提供了颇具参考价值的行业范本。


千方医数集编辑部 出品

返回医药AI前沿资讯