Ivy GAP — 胶质母细胞瘤空间转录组与病理图谱 AI-Ready Wikipedia

41 例患者 42 例肿瘤五区空间转录组与病理影像图谱

来源 Allen Institute for Brain Science url: https://glioblastoma.alleninstitute.org/发布时间: 2026-09-16最后更新: 2026-09-25 阅读 36
Ivy GAP — 胶质母细胞瘤空间转录组与病理图谱 AI-Ready Wikipedia

信息速览

数据集名称Ivy GAP — 胶质母细胞瘤空间转录组与病理图谱 AI-Ready Wikipedia
数据类型41 例患者 42 例肿瘤,270 个 RNA-seq 样本,846,743 张 DICOM 影像,3,627 个分区富集基因,五区解剖结构标注
规模41 名患者(42 例肿瘤)
接入方式Allen Institute for Brain Science url: https://glioblastoma.alleninstitute.org/
AI 就绪度

数据集封面

Ivy GAP — 胶质母细胞瘤解剖学空间转录图谱 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 Ivy 胶质母细胞瘤图谱项目(Ivy GAP)
英文全称 Ivy Glioblastoma Atlas Project
别名/简称 Ivy GAP、Ivy Glioblastoma Atlas
疾病分类 ICD-11 2A00.0 胶质母细胞瘤;WHO CNS 中枢神经系统肿瘤分类 4 级
SNOMED CT 394914000(Glioblastoma multiforme)
数据模态 RNA-seq、ISH 组织学图像、H&E 病理图像、MRI(TCIA)、临床与基因组数据
AI 任务类型 空间转录组反卷积、病理图像分割与标注、跨模态对齐、生存与预后建模
样本总数 41 例患者 / 42 例肿瘤;270 个 RNA-seq 样本;846,743 张 TCIA 影像
数据大小 TCIA MRI 139.98 GB(DICOM);组学矩阵、ISH/H&E 图像经门户另行下载
数据格式 CSV、FPKM/TPM 矩阵、BAM、JPEG/PNG(ISH/H&E)、DICOM
许可证 Allen Institute Terms of Use(署名-非商业研究用途自定义许可)
访问级别 组学与 ISH 开放;MRI 申请审核;临床数据库注册后开放
DUO 标签 HMB(生物医学研究)+ NCU(非商业)
语言 英文
首发日期 2016-12(TCIA 影像集上线)
最后更新 2016-12-30(TCIA Version 1);主论文 2018-05-11
发布机构 Allen Institute for Brain Science、Swedish Neuroscience Institute、Ben and Catherine Ivy Foundation
官方主页 https://glioblastoma.alleninstitute.org/
下载地址 https://glioblastoma.alleninstitute.org/static/download.html
DOI 10.1126/science.aaf2666(主论文);10.7937/K9/TCIA.2016.XLwaN6nL(影像)
引用次数 689+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— 多模态开放且元数据完整,但无官方 train/test 划分、MRI 需受限申请、组学与影像需自建对齐流程
页面状态 published

§0 E-E-A-T 审核与免责

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(胶质母细胞瘤分子病理与肿瘤微环境分区)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Ivy GAP 的组学与 ISH 数据受 Allen Institute Terms of Use 约束(非商业研究用途并须署名),MRI 影像需签署 The Cancer Imaging Archive Restricted License Agreement 后方可获取,临床与基因组数据库需注册访问。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§0.1 页面阅读路径

读者画像 推荐路径 预计关注点
数据科学新手 §1.0 → §1.3 → §6.1 → §6.5 这是什么、和别的数据集差在哪、第一天怎么跑通
反卷积/组学方法研究者 §2.2b → §4.1 → §5.3 → 坑点 1/3/6 四区口径、切分键、跨队列批次
病理图像 AI 工程师 §3.9 → §4.6 → §6.3–§6.4 → 坑点 2/7/8 弱标签层级、相邻切片对齐、大图工程
临床研究者 §2.2–§2.5 → §7.1 → §9.2 分区生物学意义、队列局限、引用规范
数据治理/合规 §7.4 → §9.3 → 坑点 5 三路许可、脱敏与关联键审计

本页所有事实性数字的来源清单见 §10.3;页面自身结构化数据(JSON-LD)位于文末 §C,与本页 frontmatter 保持一致。


§1 数据集概览

§1.0 30 秒速览

这是什么? Ivy GAP(Ivy Glioblastoma Atlas Project)是一份"会看解剖位置的胶质母细胞瘤基因图谱"。研究者把 41 例患者的 42 个肿瘤按病理形态切成五个典型区域——浸润前沿、浸润性肿瘤、细胞肿瘤、微血管增殖、坏死周围假栅栏样细胞——再用激光显微切割逐区取样做 RNA 测序,并把每个基因的表达定位到 0.5 μm/像素分辨率的组织学图像上,同时配套术前术后 MRI 与纵向临床数据。

为什么重要? 胶质母细胞瘤是成人最常见、最致命的原发性恶性脑肿瘤,即使接受积极治疗,中位生存期也仅 12–15 个月。同一肿瘤内部不同区域的细胞组成和分子通路差异巨大,而传统 bulk 测序把整个肿瘤混在一起测,抹掉了这种空间异质性。Ivy GAP 第一次系统地、按病理学家认可的解剖分区把"哪个基因在肿瘤的哪个位置表达"变成了可检索、可下载、可复算的公开数据。

我能用它做什么? 训练病理图像分割模型(识别五个解剖结构)、开发 bulk 转录组的空间反卷积方法(用官方 293 基因特征签名把 bulk 数据拆回分区比例)、构建组织学-表达跨模态对齐模型,或把 MRI、临床数据与分区表达联合起来做肿瘤演进研究。

§1.1 摘要

Ivy GAP 由 Ben and Catherine Ivy Foundation 资助,Allen Institute for Brain Science 与 Swedish Neuroscience Institute 的 Ben and Catherine Ivy Center for Advanced Brain Tumor Treatment 合作完成,主论文发表于 2018 年 5 月 11 日的 Science(Puchalski 等,360(6389): 660-663)。技术路线分五步:其一,整体切除(en bloc resection)的新鲜肿瘤组织用定制 L 形支架定向冻结,切成 20 μm 冷冻切片,ISH 与 H&E 切片交替排列,保证每张 ISH 图像都有相邻 H&E 组织学参照;其二,神经病理学家在 H&E 图像上手工绘制五个解剖结构(LE、IT、CT、MVP、PAN)的激光显微切割轮廓,并由另外 3 名神经病理学家独立验证,取得极好的一致性;其三,按轮廓做激光显微切割(LMD),两项 RNA-seq 研究共产生 270 个样本——解剖结构研究 122 个样本(来自 8–10 例肿瘤、每例 3 个 block、每结构三次重复)与癌症干细胞研究 148 个样本(来自 34 例肿瘤的 35 个干细胞簇);其四,四项 ISH 调查(343、37、55、76 个探针基因)把关键标记基因的空间表达落到细胞分辨率图像上;其五,信息学管线完成图像配准、结构本体树构建与基于机器学习的 H&E 自动标注(45×45 像素邻域分类),并推导出 293 基因特征签名用于 bulk 数据反卷积。差异表达分析共发现 3,627 个在 LE、CT、PAN、MVP 中分区富集的基因。

§1.2 战略价值

维度一:空间异质性的"标注基准"。 TCGA、REMBRANDT 等大型项目提供了海量多组学数据,但均为 bulk 口径,无法回答"该分子在肿瘤内何处表达"。Ivy GAP 是唯一由多神经病理学家共识轮廓驱动的五区 LMD 转录组公开资源,其 3,627 个分区富集基因与 293 基因签名已成为把 bulk GBM 数据"翻译"回空间事实的参照系。对 AI 研究者而言,这意味着两类任务第一次拥有了带病理学含义的监督信号:病理图像的结构分割,与转录组的空间解混。

维度二:多模态对齐的天然试验场。 Ivy GAP 的每张 ISH 图像都有相邻 H&E 参照,每个 LMD 样本都有叠加在组织学上的切割轮廓,每个肿瘤都有脱敏编号串联的 MRI 时间进程与临床数据库。这种"同一切片层级上影像、表达、临床三条证据链交汇"的设计,使它成为组织学-表达跨模态预训练、影像组学(radiomics)验证与多模态一致性研究的理想数据源;TCIA 已将其纳入 IvyGAP-Radiomics、DI-Cubed-Reports 与 RSNA-ASNR-MICCAI-BraTS-2021 等分析结果集的参照生态。

维度三:许可友好度与风险的真实组合样本。 Ivy GAP 三路分发的许可结构(门户开放非商业、TCIA 受限、临床库注册)在医疗数据集里极具代表性:它让"开放不等于可再分发、免费不等于无合规"成为可以逐条演练的真实案例。对要在机构内落地医疗多模态数据的团队而言,本页面 §7.4、§9.3 与坑点 5 组成的合规清单本身就是一份可复用的流程模板——从 MTA、IRB 知情同意到脱敏编号贯通、受限影像协议,完整覆盖了临床组学数据对外发布的全部环节。

§1.3 同类数据集横向对比

数据集 规模 模态 空间/分区标注 与 Ivy GAP 的差异化
Ivy GAP 41 例患者 / 42 例肿瘤 LMD RNA-seq + ISH/H&E 图像 + MRI + 临床 五区解剖结构轮廓 + 干细胞簇,神经病理学家共识 唯一按病理分区做转录组取样的图谱,空间分辨率以病理结构为单位
TCGA-GBM 600+ 例多组学 WGS/WXS/RNA-seq/甲基化 + 临床 无空间信息 队列大、随访全,是 Ivy GAP 反卷积签名的主要外部验证对象
REMBRANDT 200+ 例 影像 + 基因表达 + 临床 无分区轮廓 大规模影像-组学配对,但无病理结构级监督
BraTS 2021 1,251 例训练集 多参数 MRI 像素级肿瘤子区域分割 纯影像分割基准,无转录组;子区域定义与 Ivy GAP 结构本体可互译
单细胞图谱(Neftel 2019 等) 数十例、数十万细胞 scRNA-seq 单细胞分辨、无图像配准 提供细胞状态视角,与 Ivy GAP 的解剖分区互补而非重叠

§1.4 版本时间轴

时间 版本/事件 说明
2010-05-20 材料转移协议 Allen Institute 与 Swedish Health Services 签署 MTA,组织采集在 IRB 批准与知情同意下启动
2016-12-30 TCIA IvyGAP Version 1 39 例患者 390 项 MRI 研究(846,743 张 DICOM)上线 The Cancer Imaging Archive
2016–2017 门户与数据库上线 glioblastoma.alleninstitute.org(ISH/RNA-seq/API)与 ivygap.org(临床与基因组数据库)开放
2018-05-11 Science 主论文 Puchalski 等《An anatomic transcriptional atlas of human glioblastoma》发表,GEO 发布 GSE107560
2018-2019 PMC 开放全文 PMCID PMC6414061,方法与补充表全量可查
2018 至今 持续引用与生态扩展 论文被引 689+(截至 2026-09),进入 TCIA 多个分析结果集与 BraTS 生态

版本使用结论:Ivy GAP 为冻结式发布,不存在多版本并行选择问题;"版本管理"的实际含义是管理你自己的分析快照(记录下载日期与清单),并把 TCIA V1 与主论文发表版当作同一事实基线的两个入口。

§1.5 典型应用场景

  1. 五区结构分割:以相邻 H&E 与 ISH 图像、45×45 像素机器学习标注及人工 LMD 轮廓为弱监督信号,训练全切片或大块组织的解剖结构分割模型。数据切面:ISH/H&E SectionDataSet + TumorFeature 统计。
  2. bulk 转录组空间反卷积:用 293 基因签名把 TCGA/CGGA 等 bulk GBM 样本拆解为 LE/CT/PAN/MVP 成分比例,再做生存与亚型关联分析。数据切面:归一化 FPKM 矩阵 + 分区富集基因表。
  3. 组织学-表达跨模态对齐:LMD 轮廓把图像 patch 与分区表达一一配对,可训练跨模态检索、对比学习或多模态大模型的病理下游评测。数据切面:LMD 轮廓叠加图像 + RNA-seq 样本元数据。
  4. 肿瘤微环境生物学研究:LE 富集神经元相关通路、CT 富集胶质细胞分化、PAN 关联应激/缺氧/免疫、MVP 关联血管生成与创伤反应(主论文 GO 分析),可作为机制假设生成器。数据切面:ISH 表达能量值 + 分区均值表达。
  5. 影像组学-分子病理关联:术前 MRI 时间进程与分区表达经脱敏标本编号关联,可研究影像表型与空间分子表型的对应。数据切面:TCIA DICOM + ivygap.org 临床表 + 脱敏编号映射。
  6. 标注协议与方法学教学:两级标签(专家轮廓 + ML 弱标签)、多神经病理学家一致性验证与结构本体设计,可作为医疗 AI 标注协议设计的范本。数据切面:API 文档 + 论文补充材料。

§2 医学背景

§2.1 疾病与术语编码映射

标签 ICD-11 编码 SNOMED CT 术语
胶质母细胞瘤 2A00.0 394914000 Glioblastoma multiforme
弥漫性星形细胞瘤(IDH 突变型) 2A00.1 128240000 Diffuse astrocytoma
少突胶质细胞瘤 2A00.2 46249009 Oligodendroglioma
胶质肉瘤 2A00.1(胶质母细胞瘤谱系) 40399004 Gliosarcoma
星形细胞瘤(间变型,WHO 3 级) 2A00.1 32991001 Anaplastic astrocytoma

注:Ivy GAP 队列以成人幕上弥漫性胶质瘤为主,核心疾病实体为胶质母细胞瘤(WHO CNS 4 级)。ICD-11 编码按 MMS 区块 2A00(星形细胞肿瘤)组织,具体编码以 WHO ICD-11 浏览器为准。

§2.2 疾病简介与流行病学

胶质母细胞瘤(Glioblastoma,GBM)是最常见且最致命的原发性恶性脑肿瘤。主论文开篇即指出:即使患者接受积极治疗,中位生存期仍仅 12–15 个月。肿瘤快速获得新突变,由此加剧的瘤内基因组异质性导致耐药,限制了长期疗效。在 2021 年第 5 版 WHO 中枢神经系统肿瘤分类中,成人型弥漫性胶质瘤被重组为三个实体:胶质母细胞瘤 IDH 野生型、星形细胞瘤 IDH 突变型(伴 1p/19q 完整)与少突胶质细胞瘤(1p/19q 共缺失);GBM 的关键分子诊断标志包括 TERT 启动子突变、EGFR 扩增、+7/−10 染色体拷贝数特征与 CDKN2A/B 纯合缺失。标准治疗为最大安全切除联合放化疗(Stupp 方案:放疗同步替莫唑胺辅助化疗),MGMT 启动子甲基化状态是最重要的疗效预测与预后因子之一——Ivy GAP 主论文亦报告,没有任何解剖分区相关的突变或表达特征对总生存的预测力超过 bulk 肿瘤的 MGMT 启动子甲基化。

GBM 的组织病理学诊断依赖四类经典形态学特征:细胞密度增高、核异型性、微血管增殖与坏死(伴假栅栏样排列)。这些特征在肿瘤内呈不均匀、镶嵌式分布——同一病例中致密的细胞肿瘤核心与稀疏的浸润前沿可以相距数毫米甚至数厘米,而 bulk 组学取样往往横跨多个形态区,这正是 Ivy GAP 以解剖分区为单位重新取样的病理学动机。主论文将这种"形态学组合的个体间与瘤内差异"定义为解剖学异质性(anatomical heterogeneity),并论证其与基因组异质性同等重要。

§2.2b 五区解剖结构与生物学富集

Ivy GAP 五区由神经病理学家在 H&E 上定义,主论文的基因本体(GO)富集分析给出了各区的生物学画像:

分区(缩写) 病理学定义 GO 富集生物学过程(主论文) 典型空间位置
Leading Edge(LE) 浸润前沿,散在肿瘤细胞侵入相对正常脑实质 神经元系统相关基因 肿瘤外围薄壳状区域
Infiltrating Tumor(IT) 浸润性肿瘤细胞区,肿瘤细胞与脑组织混合 未纳入主富集分析(样本有限) LE 与 CT 之间的过渡带
Cellular Tumor(CT) 致密肿瘤细胞区,占比通常最大 胶质细胞分化相关基因 肿瘤核心
Microvascular Proliferation(MVP) 内皮细胞增殖形成的多层微血管丛 血管生成、免疫调节、创伤反应 与血管走行伴行的灶状区域
Pseudopalisading Cells Around Necrosis(PAN) 坏死周围呈假栅栏样排列的肿瘤细胞 应激、缺氧、免疫反应 环绕坏死灶

该表是理解 Ivy GAP 标签语义的钥匙:五区不是互斥的细胞类型,而是同一肿瘤内空间共存的病理学结构。反卷积方法把 bulk 样本近似为这些结构成分的混合,因此四区口径(LE/CT/MVP/PAN,IT 并入或省略)是官方与社区的主流实践。

空间上可把五区想象成同心但破缺的套层:LE 在最外围,向内过渡到 IT 与 CT,MVP 与 PAN 则像岛屿一样镶嵌在 CT 内部并伴随坏死灶分布——这正是"面积占比统计"呈长尾分布的几何根源,也是图像采样策略要按结构而非按网格设计的理由。

§2.3 临床任务定义

临床任务 Ivy GAP 支持方式 支持程度
筛查 无(数据不面向筛查场景) 不适用
诊断分级 提供 H&E/ISH 图像与神经病理学家共识轮廓,可训练 GBM 病理结构识别 强(结构级监督)
分子分型佐证 分区表达 + 临床数据库分子信息(MGMT、IDH 等) 中(需与 TCGA 联合)
预后建模 纵向临床数据 + MRI 时间进程 + 分区反卷积比例 中(队列小,需外部验证)
治疗靶点空间定位 3,627 个分区富集基因与 ISH 靶点图像 强(假设生成)
肿瘤演进研究 初发横断面分区图谱,可作纵向队列(GLASS 等)的基线参照 中(本数据集非纵向)

§2.4 患者人群

维度 描述
来源机构 美国西雅图 Swedish Neuroscience Institute(单中心,神经外科整体切除)
采集时间 2010 年材料转移协议签署后至 2016 年数据发布
样本量 41 例患者、42 例肿瘤;其中 8–10 例进入解剖结构 RNA-seq 研究,34 例进入干细胞 RNA-seq 研究
手术背景 幕上 GBM 整体切除(en bloc resection),组织经 L 形支架定向冻结以保留解剖方位
分子背景 队列以 IDH 野生型成人 GBM 为主;IDH1 突变例数过少,论文未做按区分析
治疗背景 标准多模式治疗(手术 + 放化疗),异质性记录于临床数据库但未做控制
影像子集 39 例患者有 TCIA MRI(术前/术后/随访时间进程)
详细临床信息 纵向临床与基因组数据库(ivygap.org,注册访问)含治疗经过、MRI 时间进程与生存信息

两点解读:其一,整体切除 + 定向冻结的工艺意味着队列偏向可完整切除、位置可及的肿瘤,深部与弥散型病例被系统性排除;其二,41 患者/42 肿瘤的对应关系(1 例患者 2 个肿瘤)在跨库合并与分组切分时必须保留患者级映射(见 §5.3)。

§2.5 临床与科研价值

对临床研究而言,Ivy GAP 的价值在于把病理报告里的形态学术语(“微血管增殖”“假栅栏样坏死”)与分子通路一一挂钩:MVP 区富集血管生成、免疫调节与创伤反应基因,PAN 区富集应激、缺氧与免疫反应基因,LE 区富集神经元系统相关基因,CT 区富集胶质细胞分化基因。这使得以形态学为分层的机制研究、以分区为靶点的药物假设(如针对浸润前沿的侵袭通路、针对 MVP 的抗血管策略)有了直接证据链。对 AI 研究而言,它提供了病理学共识级的空间监督信号与经同行评审的反卷积参照系,是病理基础模型(foundation model)评测 GBM 下游任务时不可替代的外部数据源。

两个具体的使用范式已经过同行评审检验:其一,主论文用 293 基因签名把 167 例 TCGA bulk 样本解析为分区成分,证明空间信息可从普通临床测序数据中"恢复";其二,该签名与临床数据库联合,可把新病例的表达谱对照到图谱上的解剖位置,辅助病理-分子综合判读。前者是方法学范式,后者是转化范式,两者都以本数据集为参照系。

§2.6 金标准参考表

项目 内容
结构划分 五区:Leading Edge(LE)、Infiltrating Tumor(IT)、Cellular Tumor(CT)、Microvascular Proliferation(MVP)、Pseudopalisading Cells Around Necrosis(PAN)
标注方式 神经病理学家在 H&E 图像上手工绘制 LMD 轮廓;另有半自动机器学习对每个 45×45 像素邻域打结构标签并统计核计数与核覆盖率
标注者资质与一致性 1 名神经病理学家会商绘制,3 名额外神经病理学家独立验证,一致性极好(论文补充表 S2)
标注性质 专家共识(LMD 轮廓)+ 弱监督(像素邻域 ML 标签)双轨并存
分子参照 差异表达分析产出 3,627 个分区富集基因;293 基因签名用于 bulk 反卷积并在 167 例 TCGA RNA-seq 样本上验证
验证链条 标记基因的空间富集经 ISH 独立验证(图像级),与转录组定量形成闭环

与同类资源相比,这条"轮廓 → LMD → 转录组 → ISH 验证"的闭环是 Ivy GAP 标签可信度的根基:图像标签有转录组证据支撑,转录组分区有形态学定义锚定,二者互为校验。使用者在做任何弱监督实验时,都应保留这条证据链的引用。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐入口 大小 理由
快速分析分区表达矩阵 Allen 门户下载页 normalized FPKM zip 数百 MB 级 与门户热图同口径,直接可用的基因×样本矩阵
复现转录组定量 GEO GSE107560 + 门户 BAM URL 清单 数十 GB 级 含未归一化 FPKM/TPM 与匿名化 BAM,可重跑上游
训练病理图像模型 门户 ISH/H&E SectionDataSet 与 API 单基因图像集 11–15 张 H&E + 全基因 ISH 带结构标注,0.5 μm/像素
多模态影像研究 TCIA IvyGAP(受限申请) 139.98 GB 39 例患者 390 项研究 DICOM,含术前/术后/随访
临床结局建模 ivygap.org 临床与基因组数据库(注册) 表格数据 纵向临床 + 表达阵列 + 基因组

§3.1 模态详情

模态 内容 规模 格式
解剖结构 RNA-seq 五区 LMD 取样转录组 122 个样本(8–10 例肿瘤 × 3 blocks × 三重复) FPKM/TPM 矩阵、BAM
癌症干细胞 RNA-seq 干细胞簇 LMD 取样转录组 148 个样本、35 个簇、34 例肿瘤 FPKM/TPM 矩阵、BAM
拷贝数 肿瘤拷贝数谱 与 RNA-seq 同批发布 GEO GSE107560
解剖结构 ISH 富集基因原位杂交 主筛选 8 例肿瘤 343 基因;富集基因屏幕 29 例 37 基因 JPEG 图像序列
癌症干细胞 ISH 干细胞标记筛选 16 例 55 基因→20 探针参考集→扩展 42 例;富集基因屏幕 37 例 76 基因 JPEG 图像序列
H&E 组织学 与每张 ISH 相邻的染色切片 每基因 H&E SectionDataSet 11–15 张图像 JPEG/PNG
结构统计 结构面积/核计数/核覆盖率 全部 sub-block CSV
MRI 术前、术后与随访扫描 39 例患者 390 项研究 5,223 series 846,743 张图像 DICOM
临床数据 纵随治疗、生存、分子检测 41 例患者 数据库(注册)

§3.2 按子集样本数

子集 肿瘤数 样本/图像数 用途
Anatomic Structures ISH Survey 8 343 基因探针 结构标记主筛选
Anatomic Structures ISH for Enriched Genes 29 37 基因探针 富集标记验证
Cancer Stem Cells ISH Survey 16(扩展至 42) 55 基因→20 探针参考集 干细胞标记筛选
Cancer Stem Cells ISH for Enriched Genes 37 76 基因探针 干细胞标记验证
Anatomic Structures RNA-Seq 8–10 122 个 RNA 样本 五区转录组
Cancer Stem Cells RNA-Seq 34 148 个 RNA 样本 干细胞簇转录组
TCIA MRI 39 390 studies / 846,743 图像 影像与时间进程
RNA-seq 合计 — 270 个样本 两大研究总和

§3.3 数据格式

数据 格式 说明
汇总表 CSV 患者/肿瘤信息、结构面积占比、基因表达能量值、RNA-seq 样本清单
归一化表达 ZIP(内含矩阵) 门户热图同口径 normalized FPKM
原始定量 CSV 内嵌 URL 未归一化 FPKM 与 TPM 逐样本下载
比对文件 匿名化 BAM 逐样本 URL 清单
参考基因组 ZIP 数据处理所用参考基因组序列
组织学图像 JPEG/PNG ISH 与 H&E,0.5 μm/像素
影像清单 Manifest(TSV/CSV) TCIA Subject-Study-Series 索引,跨库关联起点
临床导出 数据库表格 ivygap.org 注册后按模块导出
API XML/JSON RMA 查询(api.brain-map.org)

§3.4 存储与下载规模

TCIA 影像集为 139.98 GB(846,743 张 DICOM)。组学侧,门户提供归一化 FPKM 矩阵 zip 与未归一化 FPKM/TPM、匿名化 BAM 的 URL 清单(BAM 全量下载数十 GB 级);ISH 图像按基因逐组下载。全量镜像(组学 + 图像 + 影像)建议预留 200 GB 以上磁盘并按研究子集分批获取。

下载策略 建议顺序 磁盘预算 适用者
快速验证 汇总 CSV + 归一化 FPKM zip < 1 GB 反卷积/统计研究
图像开发 汇总 CSV + 精选基因 ISH/H&E 10–50 GB 分割与跨模态研究
全量镜像 CSV + 组学 + 全部 ISH/H&E + BAM 100–200 GB 系统性基准构建
影像全量 TCIA 受限申请 + NBIA 下载器 +140 GB(解压后更多) 影像与影像组学研究

§3.5 标注方式

标注分三层:第一层,专家共识轮廓——1 名神经病理学家与团队会商在 H&E 图像上绘制五个解剖结构的 LMD 切割边界,3 名额外神经病理学家独立验证并取得极好一致性;第二层,半自动机器学习标注——统计学习算法将每个 45×45 像素邻域归入肿瘤特征标签,并同时统计邻域内细胞核数量与核覆盖率,汇总生成每个 sub-block 的结构面积、归一化面积、核计数与核覆盖统计;第三层,结构本体树——解剖特征按"部分于"(part of)关系组织成层级树并赋予可视颜色。用户使用时应区分三类标签的性质差异(详见坑点 7)。

§3.6 采集周期与设备

项目 内容
组织采集 2010-05-20 MTA 签署后启动;Swedish Neuroscience Institute 整体切除
切片工艺 新鲜组织定向冻结,20 μm 冷冻切片,ISH 与 H&E 交替
图像分辨率 0.5 μm/像素(图像查看器可逐细胞检视)
图像组织 每基因一个 ISH SectionDataSet;配套 H&E 每数据集 11–15 张
转录组定量 LMD 后 RNA 提取与 RNA 测序;定量结果以 FPKM/TPM 分发
表达能量 ISH 图像经染色强度量化生成结构级表达能量值(csv 分发)
MRI 设备与协议 临床 MRI 采集(协议细节见主论文 Materials and Methods 与 TCIA 元数据)
质量控制 图像 QC 团队逐切片把关;病理评估表单化管理(论文致谢与补充材料)

§3.7 地域覆盖

单中心队列:美国华盛顿州西雅图 Swedish Neuroscience Institute。不包含多地域人群分层采样设计,地域与人群多样性有限(见 §7 偏倚)。

§3.8 深度溯源链

患者手术记录与知情同意(Swedish)→ 组织转移 MTA(2010-05-20)→ 冷冻切片与染色(Allen Institute 组织处理线)→ ISH/H&E 成像与质量把控(Allen 图像 QC 团队)→ 神经病理学共识轮廓(Puchalski 等)→ LMD 与 RNA-seq(Allen 转录组团队)→ 图像配准、本体构建与 ML 标注(Hawrylycz 信息学团队)→ 门户/GEO/TCIA/ivygap.org 四路分发。全链路在主论文 Materials and Methods 与门户白皮书中有据可查。

§3.9 信息学与工艺要点

信息学管线是 Ivy GAP 与普通病理图像库的分水岭,四个环节在官方文档中均有明确规格:

  1. 图像配准:ISH 与 H&E 交替切片共享同一组织学坐标系,配准后的表达信号可叠加到相邻 H&E 参照上;因系相邻切片,几何上存在固有形变(坑点 2)。
  2. 结构本体:解剖特征按层级树组织(子结构为父结构的一部分),节点着色以强调层级关系;本体可通过 API 的 structure 模型查询。
  3. 半自动标注:统计学习算法对每个 45×45 像素邻域输出肿瘤特征标签,同时输出邻域内细胞核计数与核覆盖率;汇总生成每个 sub-block 的结构面积、归一化面积、核计数与核覆盖率四项统计。
  4. 检索与可视化:门户支持按肿瘤、block、基因表达过滤(解剖特征、分子亚型、临床信息);图像查看器分辨率 0.5 μm/像素;270 个 RNA-seq 样本的 LMD 轮廓可直接叠加显示。

对 AI 工程的含义:上述四个环节决定了 Ivy GAP 的"标注即数据"特性——结构标签、面积统计与表达能量值都是官方产出的一级数据资产,可直接下载用于弱监督训练与空间统计,无需自行从零标注。


§4 数据结构

§4.0 目录树

以下为各官方入口数据组合下载解压后的目录预览(门户 csv 与 zip 文件名以官方下载页为准):

ivy_gap/
├── csv/                                      # 门户下载页汇总表(CSV)
│   ├── patient_tumor_info.csv                # 患者与肿瘤信息
│   ├── fractional_area_of_features.csv       # 各 sub-block 解剖结构面积占比
│   ├── gene_expression_energy.csv            # 各 sub-block 解剖结构基因表达能量值
│   └── rnaseq_samples_metadata.csv           # RNA-seq 样本清单(含显微切割图像链接)
├── rnaseq/
│   ├── normalized_fpkm_heatmap_values.zip    # 归一化 FPKM(门户热图口径)
│   ├── unnormalized_fpkm_tpm_urls.csv        # 未归一化 FPKM/TPM 的逐样本 URL
│   ├── anonymized_bam_urls.csv               # 匿名化 BAM 的逐样本 URL
│   └── reference_genome.zip                  # 数据处理所用参考基因组
├── ish/
│   └── section_data_sets/                    # 逐基因 ISH 图像集 + 相邻 H&E 注释图像
│       ├── <gene>_ish/                       # 每基因一个 SectionDataSet
│       └── <gene>_he/                        # 相邻 H&E,11-15 张/基因
├── tcia_ivygap/                              # 受限申请批准后解压(DICOM)
│   ├── manifest-*.tsl
│   └── IVYGAP/<patient>/<study>/*.dcm        # 39 例患者 390 项研究
└── clinical/                                 # ivygap.org 注册导出(自行整理)
    ├── clinical_longitudinal.csv
    └── expression_array.csv

§4.1 DAIMS 字段字典

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
specimen_name Text sub-block 标本名(患者-block-子块) W32-1-1-K.01 主键、跨库关联 无 无 门户 Specimen 表
tumor_id Text 脱敏肿瘤编号 W32 分组/防泄漏 无 无 41 患者对应 42 肿瘤
structure_id Integer 解剖结构本体 ID 12345 结构映射 本体版本漂移 无 本体树节点
anatomic_feature Text 五区标签(LE/IT/CT/MVP/PAN) CT 分类监督 轮廓边界主观性 无 5 类
fraction_area Float 结构在 sub-block 的面积占比 0.1837 空间统计 切片间变异 无 [0, 1]
nuclei_count Integer sub-block 内核计数汇总 45,211 密度特征 ML 计数误差 无 ≥ 0
nuclei_fraction_coverage Float 核覆盖率 0.42 密度特征 同上 无 [0, 1]
gene_symbol Text 基因符号 EGFR 特征轴 无 无 官方基因列表
fpkm Float 每样本基因表达(口径注意) 12.4153 回归/聚类 批次效应 无 ≥ 0
expression_energy Float 结构级 ISH 表达能量值 7.2 空间表达 染色强度噪声 无 ≥ 0
study Text 六项研究之一 Anatomic Structures RNA-Seq 子集切分 无 无 官方研究名
mri_study_uid Text TCIA 影像研究 UID 1.3.6.1.4.1… 影像关联 跨库需映射表 无 DICOM UID

§4.2 标签分布

五区标签在 RNA-seq 层面的分布严重不均:解剖结构研究的 122 个样本中,差异表达分析仅在 LE、CT、PAN、MVP 四区检出富集基因(合计 3,627 个),IT 区因样本与信号有限未进入主分析。图像层面的 45×45 像素标签呈长尾:CT 通常占据最大面积,LE 与 IT 呈薄壳状分布,MVP 与 PAN 与坏死/血管灶相关、面积占比小。任何以区为类别的分类器都应报告逐类指标并对 IT 做特殊处理(见坑点 1)。

量化标签分布有两个官方抓手:一是下载页的结构面积占比 CSV(每个 sub-block 每个结构的面积与归一化面积),可直接得到全队列的分区面积直方图;二是核计数与核覆盖率统计,可用来做密度加权采样(例如按核密度分桶后再分层抽样 patch)。建议在训练前先把这两份统计画出来——它们是免费的探索性数据分析,也是后续任何"分布一致"论断的基线。

§4.3 关键统计

统计项 数值 来源
患者 / 肿瘤 41 / 42 主论文
RNA-seq 样本 270(122 解剖结构 + 148 干细胞) 主论文
解剖结构研究肿瘤数 8–10(每例 3 blocks) 主论文
干细胞簇 / 肿瘤 35 簇 / 34 例 门户数据总览
分区富集基因 3,627(LE/CT/PAN/MVP) 主论文
反卷积签名 293 基因(应用于 167 例 TCGA 样本) 主论文
ISH 探针基因总数 343 + 37 + 55 + 76(四项调查) 门户数据总览
H&E 图像量 每基因 SectionDataSet 11–15 张 API 文档
切片厚度 / 图像分辨率 20 μm / 0.5 μm-像素 API 文档、主论文
TCIA 影像 39 例 / 390 studies / 5,223 series / 846,743 张 / 139.98 GB TCIA collection
论文被引 689+(截至 2026-09) 聚合学术索引

§4.4 数据层级

Donor(41 例患者)
└── Tumor(42 例肿瘤)
    └── Sub-block Specimen(六项研究分别分配的冷冻亚块,如 W32-1-1-K.01)
        ├── SectionDataSet:逐基因 ISH(每基因一个数据集)
        ├── SectionDataSet:H&E(11-15 张图像,含 ML 结构标注)
        │     └── Section image → 45×45 像素邻域标签 → TumorFeature 统计
        └── LMD sample(RNA-seq 或干细胞簇,270 个)
              └── 与组织学图像叠加的切割轮廓

层级要点:Donor 与 Tumor 是一对多(1 例患者 2 个肿瘤),Specimen 到研究是多对一分配,SectionDataSet 是图像访问的最小完整单元(一个基因的一组 ISH 切片 + 一组相邻 H&E),LMD sample 是表达数据的最小单元。做任何聚合前先明确"以哪一层为样本单位"——以 Tumor 层聚合会丢失 270 样本的空间变异,以样本层做统计则会低估肿瘤内相关性(坑点 4 的统计学根源)。

§4.5 缺失值与信息性缺失

情形 表现 建议处理
IT 区 RNA-seq 样本有限 富集基因表中无 IT 列结果 反卷积按四区口径建模,IT 并入 LE 或单列说明
临床数据库字段选择性填写 ivygap.org 部分随访字段缺失 逐字段统计缺失率并显式编码 NaN
影像-组学非一一对应 TCIA 39 例 vs 组学 41/42 例 以脱敏标本编号为键做内连接,仅保留交集
ISH 染色失败/质量剔除 个别基因图像缺失 以 SectionDataSet 列表为准,不自行推断

§4.6 API 数据模型速查

Allen RMA(RESTful Model Access)按驼峰命名暴露数据模型,Ivy GAP 常用对象如下:

模型 含义 典型查询用途
Donor 患者级实体(Product=Glioblastoma) 列出全部供体
Specimen sub-block 亚块,external_specimen_name 为 W32-1-1-K.01 式编号 按研究(SpecimenType)过滤亚块
TumorFeature 亚块内解剖结构实例,关联 structure 取某亚块的全部结构标签与颜色
SectionDataSet 一组切片图像数据集(逐基因 ISH 或 H&E) 下载图像与标注
Structure 结构本体树节点(层级 part of) 结构编码映射与层级查询
Product 数据产品(“Glioblastoma”) 圈定 Ivy GAP 数据范围

查询语法为 model::Donor,rma::criteria,... 的 RMA 协议,支持 rma::include 联表与 rma::options[num_rows$eqall] 全量分页;返回 XML 或 JSON(query.xml / query.json)。图像与表达值均有专用下载服务(图像下载、ISH 量化表达、RNA-seq 相关性/差异性检索)。对大规模程序化采集而言,RMA 是比逐页爬取更合规、更稳定的入口;注意遵循 Allen Citation Policy,在展示数据的页面上同步署名。

与 §4.1 字段字典配合阅读:RMA 返回的字段名即驼峰形式的实体属性,可直接映射到字典列;遇到未列出的字段,优先查 API 文档的数据模型页而非猜测语义。


§5 数据划分与使用建议

§5.1 官方划分

Ivy GAP 不提供 train/test 划分。官方"划分"仅体现为研究组织学:六项研究各占独立肿瘤亚块(Anatomic Structures ISH Survey 8 例、富集基因屏幕 29 例、干细胞 ISH 16→42 例、干细胞富集 37 例、结构 RNA-seq 8–10 例、干细胞 RNA-seq 34 例),同一肿瘤可被分配至多项研究。

官方分组 队列规模 隶属研究 ML 参考用法
解剖结构系 ISH 筛查 8 例 + ISH 验证 29 例 + RNA-seq 8–10 例 Anatomic Structures 三组 分区监督信号主来源
干细胞系 ISH 筛查 16 例(扩展 42 例)+ ISH 验证 37 例 + RNA-seq 34 例 Cancer Stem Cells 三组 干细胞簇相关任务
影像系 39 例(受限) TCIA 影像组学、时间进程
临床系 41 例(注册) ivygap.org 结局与协变量

由于各研究组肿瘤重叠而非互斥,任何"按研究切 train/test"的做法都不能替代按 tumor_id 的分组切分——前者是数据生产口径,不是泛化评估口径。

§5.2 社区惯例划分

社区实践通常按肿瘤(tumor_id)而非样本切分:以肿瘤为单位做留一法(leave-one-tumor-out)交叉验证或多肿瘤分层分组 K 折,确保同一肿瘤的任何样本/图像不同时出现在训练与验证侧。反卷积方法学论文多以 TCGA/CGGA bulk 队列为外部测试集(Ivy GAP 训练签名 → 167 例 TCGA 样本验证是官方范式)。图像任务中,社区还常用"门户推荐亚块 + 自留肿瘤"的组合:把 8–10 例结构 RNA-seq 肿瘤当作开发集(其 LMD 轮廓最完整),把其余肿瘤留作图像端验证。

§5.3 泄漏风险(重点)

  1. 跨样本同瘤泄漏:同一肿瘤的 3 个 block、多张切片、多幅图像高度相关,随机按样本切分会造成乐观偏差,必须按 tumor_id 分组切分。
  2. 跨库重复个体:门户、GEO、TCIA、ivygap.org 共享同一批脱敏标本编号,合并使用时务必先按编号去重,否则同一患者会同时进入训练与"外部"测试。
  3. 反卷积自证泄漏:用 Ivy GAP 数据推导签名再在内部评估反卷积精度属于自证;应遵循官方范式在 TCGA 等外部队列验证。
  4. 图像裁剪上下文泄漏:从同一张 H&E 大图切出的相邻 patch 共享视野上下文,切分时以 SectionDataSet/亚块为组而非以 patch 为组,否则 patch 级随机划分会把"同一视野"分进两侧。

§5.4 交叉验证与外部验证建议

推荐:组内 leave-one-tumor-out × 组外 TCGA 双层验证;影像任务可用 BraTS 风格多参数 MRI 协议对齐后跨库评估;任何生存分析报告 C-index 时必须同时给出 TCGA 外部验证结果(Ivy GAP 自身 41 例的统计功效不足以支撑稳定的生存结论)。

验证层 数据 切分单位 报告指标
组内 Ivy GAP(门户/GEO) tumor_id(leave-one-tumor-out 或 GroupKFold) macro-F1、逐类召回、反卷积 RMSE
组外 TCGA-GBM bulk RNA-seq 全部 167 例官方验证样本口径为参照 分区比例分布、生物学锚点一致性、C-index
组外影像 BraTS 2021 / REMBRANDT 中心/扫描协议分组 Dice(跨库需重新标注映射协议)
敏感度 Ivy GAP 内部 按样本 vs 按肿瘤两口径对照 两口径性能差距(泄漏敏感度)

三条常见反例(都曾出现在文献复现尝试中,写作此页时以官方口径为对照):其一,把 122 个分区样本当 122 个独立观察做显著性检验(正确做法:肿瘤级聚类bootstrap);其二,把 TumorFeature 的 ML 面积占比当作"真实分割指标"计算 Dice(正确做法:与 LMD 轮廓对比并注明弱监督性质);其三,把门户热图 FPKM 与 GEO 原始定量直接拼接(正确做法:统一重归一化,见坑点 3)。


§6 AI 就绪指南

§6.0 云端快速启动

Ivy GAP 无需特殊云端凭证即可开始:组学与 ISH 数据可直接 HTTP 下载,适合在 Colab/任意 Linux 主机即刻开工。唯一需要线下流程的是 TCIA MRI(签署受限协议)与 ivygap.org(注册)。建议云端工作流:门户 CSV + 归一化 FPKM 起步(数百 MB),确认任务可行后再按需拉取 BAM 或图像全集。

# 三条数据路线的云端最小化启动(以组学路线为例)
mkdir -p ivy_gap/{csv,rnaseq} && cd ivy_gap
# 1) 门户下载页列出的汇总表与归一化矩阵(URL 以官方下载页为准)
wget -c https://glioblastoma.alleninstitute.org/static/download.html -O download_page.html
# 2) 程序化元数据:RMA 一次拉取全部供体
curl -s "https://api.brain-map.org/api/v2/data/query.json?criteria=model::Donor,rma::criteria,products[name$eq'Glioblastoma'],rma::options[num_rows$eqall]" -o donors.json
# 3) GEO 备份通道(RNA-seq 与拷贝数)
wget -c "https://www.ncbi.nlm.nih.gov/geo/download/?acc=GSE107560" -O GSE107560.tar

三条路线的选择逻辑:只做表达与反卷积 → 组学路线(约数百 MB 即可开工);做病理图像分割 → 图像路线(按基因/亚块增量下载 SectionDataSet);做影像关联 → 影像路线(TCIA 受限协议,139.98 GB,务必最后启动)。

启动前的两分钟检查:磁盘余量、wget/curl 可用性、代理环境变量是否影响 NCBI/Allen 域名;受限入口(TCIA/ivygap.org)立即提交申请,利用等待期完成组学路线的全部检查点。

§6.1 快速上手

三条数据路线对应三种不同的起步姿势,先确认你的任务属于哪条:

路线 起步下载 最小可用子集 第一天能做什么
组学 汇总 CSV + 归一化 FPKM zip 基因 × 270 样本矩阵 分区均值、差异表达、反卷积原型
图像 精选基因的 ISH/H&E SectionDataSet 单基因数据集(11–15 张 H&E + ISH) patch 采样、标签检查、弱监督试训
影像 TCIA 受限协议(等待期可先做组学/图像) 单患者 DICOM dcm2niix 转换、QC 流程搭建

以下代码假设目录结构为 §4.0 所示;data_root 指向解压根目录,最小可用子集是 csv/ 汇总表 + rnaseq/normalized_fpkm_heatmap_values.zip——两者合计数百 MB 内,即可完成分区表达分析与反卷积实验。

# 目录结构预期(与 §4.0 一致):
#   data_root/
#     ├── csv/rnaseq_samples_metadata.csv     # 样本元数据(含肿瘤、研究、结构标签)
#     ├── csv/patient_tumor_info.csv          # 患者与肿瘤对照表
#     └── rnaseq/normalized_fpkm_heatmap_values.zip  # 归一化 FPKM 矩阵
# data_root 拼接关系: 所有路径 = data_root / 上述相对路径
# 最小可用子集: 仅 csv/ + normalized_fpkm zip(无需 BAM/ISH/TCIA 即可起步)

from pathlib import Path
import pandas as pd
import zipfile, io

data_root = Path("data_root")  # 替换为你的解压根目录

# 1) 样本元数据:每行一个 RNA-seq 样本
meta = pd.read_csv(data_root / "csv" / "rnaseq_samples_metadata.csv")

# 2) 归一化 FPKM(与门户热图同口径)
with zipfile.ZipFile(data_root / "rnaseq" / "normalized_fpkm_heatmap_values.zip") as zf:
    inner = [n for n in zf.namelist() if n.endswith(".csv")][0]
    fpkm = pd.read_csv(io.BytesIO(zf.read(inner)))

# 3) 以样本清单为准对齐矩阵列(防口径漂移)
common = [c for c in fpkm.columns if c in set(meta["sample_id"])]
fpkm = fpkm.set_index(fpkm.columns[0]).loc[:, common]
print(fpkm.shape)  # 基因 × 样本

§6.2 数据获取

入口 获取方式 前置条件 大小
Allen 门户下载页 浏览器或 wget 直接下载 无 数百 MB–数 GB
Allen API(RMA) HTTP 查询 api.brain-map.org 无 按需
GEO GSE107560 GEO 浏览器或 fetch 工具 无 数十 GB(含 BAM 时)
TCIA IvyGAP 签署 Restricted License Agreement 邮寄至 help@cancerimagingarchive.net 审核通过 + NBIA 下载器 139.98 GB
ivygap.org 临床数据库 网页注册 注册账号 表格数据

获取顺序建议:先门户(当天可用)→ GEO(复核口径/拿原始定量)→ 影像与临床(等待审批期间先做组学与图像),四路数据到位后统一跑 §5.3 的关联键审计。

# 门户下载入口(汇总表与 zip 的直链以官方下载页列表为准)
# 打开下载页后按文件名逐项 wget,示例:
#   wget -P data_root/csv/ <官方汇总CSV直链>
#   wget -P data_root/rnaseq/ <归一化FPKM zip直链>
# GEO RNA-seq(supplementary 包)
wget -c -P data_root/geo/ "https://www.ncbi.nlm.nih.gov/geo/download/?acc=GSE107560"
# Allen RMA API 示例:查询某 sub-block 的肿瘤特征
import requests
url = ("https://api.brain-map.org/api/v2/data/query.json"
       "?criteria=model::TumorFeature,rma::criteria,"
       "data_set(specimen[external_specimen_name$eq'W32-1-1-K.01']),rma::include,structure")
features = requests.get(url, timeout=30).json()

§6.3 预处理全流程

三条路线各有检查点,进入建模前逐项打勾:组学路线(口径确认 → 基因符号对齐 → log2 变换 → 批次审计);图像路线(切片质量筛查 → patch 切分 → 标签层级确认 → 染色归一化);影像路线(DICOM 完整性 → NIfTI 转换 → 颅骨剥离 → 与脱敏编号关联审计)。任一检查点失败都会在下游以"莫名性能天花板"的形式出现,先查预处理再调模型。

表达矩阵路线:加载 → 口径确认 → log2 变换 → 基因符号对齐 → 分组统计。

import numpy as np

# 口径检查:门户热图值为 normalized FPKM;切勿与未归一化 FPKM/TPM 混合(见坑点 3)
expr = np.log2(fpkm + 1)                       # log2(FPKM+1)
expr = expr.loc[~expr.index.duplicated(keep="first")]  # 基因去重

# 按解剖结构聚合(仅解剖结构研究样本)
ann = meta.set_index("sample_id").loc[expr.columns]
groups = ann["anatomic_feature"]
region_mean = expr.T.groupby(groups).mean().T  # 基因 × 五区均值
region_mean.to_csv("region_mean_log2fpkm.csv")

组织学图像路线:加载 ISH/H&E SectionDataSet → 质量筛查 → patch 切分(如 512×512)→ 读取官方 45×45 像素结构标签作弱监督 → 染色归一化(H&E 与 ISH 分开处理)。

import tifffile, numpy as np

def split_patches(image_path, patch=512, stride=512):
    """对 0.5 μm/像素的大图做网格切分;返回 patch 数组与其左上角坐标。"""
    img = tifffile.imread(image_path)
    H, W = img.shape[:2]
    coords = [(y, x) for y in range(0, H - patch + 1, stride)
                     for x in range(0, W - patch + 1, stride)]
    return [(img[y:y+patch, x:x+patch], (y, x)) for y, x in coords]

MRI 路线(获批后):DICOM → NIfTI(dcm2niix)→ 颅骨剥离与配准 → 与脱敏标本编号关联。三路数据最终以 tumor_id + specimen_name 为键关联(见坑点 5)。

# DICOM 转 NIfTI(39 例 390 项研究,建议逐 study 批处理)
dcm2niix -o nifti/ -f "%p_%s" -z y tcia_ivygap/IVYGAP/<patient>/<study>/
# 颅骨剥离与偏置场校正可用 HD-BET / N4(示例参数,按协议调整)
N4BiasFieldCorrection -i nifti/t1.nii.gz -o t1_n4.nii.gz
# 影像-组学关联的内连接审计(防坑点 5)
import pandas as pd
mr = pd.read_csv("tcia_manifest.csv")     # 含 Subject 与 Study UID
meta = pd.read_csv("data_root/csv/patient_tumor_info.csv")
key = mr["Subject"].isin(set(meta["tumor_id"]))
paired = mr[key]                           # 仅保留可关联的研究
assert paired["Subject"].nunique() <= 42, "关联键异常:超出肿瘤总数"

预处理产出统一进 processed/ 目录并保留两份清单:sample_provenance.csv(样本 → 口径 → 来源 URL → 下载日期)与 label_tier.csv(标签 → 层级:LMD 轮廓 / ML 邻域)。

§6.4 PyTorch DataLoader

<details>
<summary>完整可运行的 Dataset 与 DataLoader 代码(点击展开)</summary>

import pandas as pd, numpy as np, torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
import tifffile

class IvyGAPPatchDataset(Dataset):
    """图像 patch + 官方结构标签的弱监督数据集。

    目录预期:
      data_root/ish/section_data_sets/<gene>_he/<sample>.png
    元数据: csv/rnaseq_samples_metadata.csv 提供 specimen 与结构映射。
    """
    LABELS = {"LE": 0, "IT": 1, "CT": 2, "MVP": 3, "PAN": 4}

    def __init__(self, data_root: str, meta_csv: str, patch: int = 512,
                 transform=None):
        self.root = Path(data_root)
        self.meta = pd.read_csv(meta_csv)
        self.patch, self.transform = patch, transform

    def __len__(self):
        return len(self.meta)

    def __getitem__(self, idx):
        row = self.meta.iloc[idx]
        img_path = self.root / "ish" / "section_data_sets" / f"{row['gene']}_he" / f"{row['image_id']}.png"
        img = tifffile.imread(img_path)
        y, x = int(row["y"]), int(row["x"])
        patch = img[y:y+self.patch, x:x+self.patch]
        if self.transform:
            patch = self.transform(patch)
        label = self.LABELS[row["anatomic_feature"]]
        return torch.from_numpy(patch).permute(2, 0, 1).float() / 255.0, label

ds = IvyGAPPatchDataset("data_root", "data_root/csv/rnaseq_samples_metadata.csv")
# 关键: 按 tumor_id 分组的采样/切分,禁止随机打散后直接切 train/val(见坑点 4)
loader = DataLoader(ds, batch_size=16, shuffle=False,
                    num_workers=4, pin_memory=True)

</details>

§6.5 坑点 8 个

# 坑点 分类 一句话提示
1 五区类别不均衡,IT 缺位 标签理解 按 macro-F1 报告,IT 特殊处理
2 相邻切片无完美对齐 预处理陷阱 patch 级或语义级对齐
3 FPKM 口径混用 工程陷阱 全流程锁定一种口径
4 同瘤多样本泄漏 数据泄漏 一律按 tumor_id 分组
5 跨库关联键错配 数据泄漏 specimen_name 内连接 + 白名单
6 跨队列批次误读 评估误用 归一化 + 批次协变量 + 外部锚点
7 ML 标签当金标准 标签理解 声明监督层级
8 大图内存与染色漂移 预处理陷阱 流式 patch + 染色归一化

⚠️ 坑点 1:五区标签类别不均衡,IT 区未进入主差异表达分析(分类:标签理解)

问题:解剖结构 RNA-seq 的 122 个样本中,官方差异表达分析仅在 LE、CT、PAN、MVP 四区检出 3,627 个富集基因,IT(Infiltrating Tumor)区因样本与信号有限未纳入主分析;图像层面 LE/IT 呈薄壳状、MVP/PAN 面积小。直接把五区当均衡多分类处理会系统性低估稀有区性能。
症状:训练出的分区分类器在 IT/MVP/PAN 上 F1 极低、混淆矩阵大量互串;反卷积输出中 IT 比例恒为 0 或方差异常。
解决:

  1. 简单方法:报告逐类指标(macro-F1、每类召回),对 IT 单独说明或与 LE 合并为"浸润带"口径;训练时用类别加权损失或过采样。
  2. 进阶方法:采用 focal loss + 分区层级先验(本体树父子关系),把 LE/IT 建模为层级标签而非互斥类。
  3. SOTA 方法:参考官方 293 基因签名以四区(LE/CT/PAN/MVP)口径做反卷积,把 IT 归入 LE,保持与主论文可比较;对 IT 感兴趣时改用 ISH 图像标签做空间检测。
    参考:Puchalski et al., 2018, Science. doi:10.1126/science.aaf2666(差异表达与 293 基因签名);门户数据总览页。

⚠️ 坑点 2:ISH 与 H&E 是相邻切片,逐像素"完美对齐"并不存在(分类:预处理陷阱)

问题:ISH 与 H&E 来自交替切片(20 μm 厚,相邻而非同一截面),冷冻过程必然引入组织形变与位移;把两者当作同一切片做像素级配准或直接逐像素监督会引入不可控噪声。
症状:配准后结构边界与表达信号系统性错位 1–2 个结构层;以 H&E 预测 ISH 信号时损失平台期居高不下;不同 block 间配准误差方差极大。
解决:

  1. 简单方法:降级到 patch 级(如 45×45 像素邻域以上)对应,容忍局部形变;以官方 ML 结构标签为中间层做弱对齐。
  2. 进阶方法:用弹性配准(如 B-spline free-form deformation)先做粗对齐,再以结构标签一致性作为正则约束。
  3. SOTA 方法:跳过像素级假设,直接做区域级/图像级对比学习(如 SimCLR/CLIP 式跨模态检索),把"对齐"定义为语义而非几何。
    参考:Allen API 文档(ISH 与 H&E 交错切片工艺);Puchalski et al., 2018, Science. doi:10.1126/science.aaf2666。

⚠️ 坑点 3:normalized FPKM 与 un-normalized FPKM/TPM 口径混用(分类:工程陷阱)

问题:门户热图展示的是归一化 FPKM(提供 zip),未归一化 FPKM 与 TPM 需通过 csv 内 URL 逐样本下载,两套口径数值不可直接比较;混用会让聚类、差异表达与反卷积结果系统性漂移。
症状:同一基因在热图与自算箱线图中数值差数倍;外部 GEO 数据与门户矩阵合并后出现整体偏移;文献间数值对不上。
解决:

  1. 简单方法:全流程锁定一种口径(推荐 log2(normalized FPKM+1) 与主论文热图一致),并在元数据中记录口径来源。
  2. 进阶方法:确需合并 TPM 时统一重归一化(按基因长度与库大小重算),并做 quantile 归一化对齐分布。
  3. SOTA 方法:从 BAM 重新定量(需数十 GB 下载与计算资源),用同一工具链产出 TPM/counts,彻底消除口径差异。
    参考:门户下载页说明(normalized FPKM zip 与 un-normalized URL 清单)。

⚠️ 坑点 4:同一肿瘤多样本随机切分导致训练-验证泄漏(分类:数据泄漏)

问题:解剖结构研究每例肿瘤取 3 个 block、每结构三次重复;干细胞研究亦多样本/瘤。随机按样本切分时,同一肿瘤的近重复样本同时出现在训练与验证侧,模型可能只学会了"肿瘤指纹"。
症状:随机切分准确率远高于按肿瘤切分(差距常达两位数百分点);换一批肿瘤测试性能断崖式下跌;交叉验证方差异常小。
解决:

  1. 简单方法:一律按 tumor_id 分组切分(GroupKFold / leave-one-tumor-out)。
  2. 进阶方法:按患者分组更严格(41 患者对应 42 肿瘤,1 例患者 2 瘤),报告两种切分口径的差距作为泄漏敏感度分析。
  3. SOTA 方法:嵌套交叉验证——内层选超参、外层按肿瘤评估,并冻结一个 TCGA 外部队列做最终报告。
    参考:Puchalski et al., 2018, Science. doi:10.1126/science.aaf2666(取样设计);§5.3。

⚠️ 坑点 5:跨库关联键错配,39 例影像 ≠ 42 例肿瘤(分类:数据泄漏)

问题:门户/GEO/TCIA/ivygap.org 四路分发共享脱敏标本编号,但覆盖面不同(MRI 仅 39 例患者;组学 41 患者 42 肿瘤)。用错误键(如把患者 ID 当肿瘤 ID)或全外连接合并,会让"外部测试集"混入训练个体。
症状:合并表行数异常膨胀;影像-表达配对数超过患者数;跨库评估结果好得不合理。
解决:

  1. 简单方法:以 specimen_name(如 W32-1-1-K.01)为唯一键做内连接,先对各库清单做交集审计。
  2. 进阶方法:建立患者→肿瘤→亚块→样本四级映射表,任何跨库合并先通过映射表白名单校验。
  3. SOTA 方法:把映射与去重逻辑固化为数据卡(datasheet)脚本,入库时自动校验"一个肿瘤不得同时出现在 train 与 test 清单"。
    参考:TCIA IvyGAP collection 说明(39 例、脱敏编号关联两个数据库);门户下载页患者/肿瘤信息表。

⚠️ 坑点 6:反卷积签名跨队列应用时的批次效应与结论误读(分类:评估误用)

问题:293 基因签名在 Ivy GAP 数据上推导,官方验证对象是 167 例 TCGA RNA-seq 样本。Ivy GAP(LMD 分区样本)与 TCGA(bulk 手术样本)在取样方式、测序流程上存在系统性批次差异;把跨队列反卷积比例的漂移直接解读为生物学差异是常见误用。
症状:同一患者组织在两库中分区比例显著不同;分区比例与批次代理变量(如测序深度、平台)强相关;生存分析中比例系数随批次翻转。
解决:

  1. 简单方法:应用签名前对表达矩阵做同口径归一化(如上分位数归一),并把批次作为协变量报告。
  2. 进阶方法:ComBat 去批次时保留生物学分组;用已知生物学锚点(如 MVP 比例应与血管标志物正相关)做方向性验证。
  3. SOTA 方法:参照官方范式只做跨队列验证而非内部自证;对生存结论采用多队列元分析(Ivy GAP 派生 + TCGA 验证 + CGGA 复现)。
    参考:Puchalski et al., 2018, Science. doi:10.1126/science.aaf2666(167 例 TCGA 反卷积)。

⚠️ 坑点 7:45×45 像素机器学习标签是弱监督,不是专家金标准(分类:标签理解)

问题:H&E 图像上的结构标注由半自动统计学习算法生成(每个 45×45 像素邻域一个标签,并统计核计数/覆盖率),用于门户可视化与统计汇总;它不是神经病理学家逐像素勾画的金标准(后者仅存在于 LMD 轮廓层面)。
症状:以 ML 标签训练的分割器复现了算法自身的系统误差(边界过度平滑、稀有类漏检);用 ML 标签评估专家轮廓模型时分数虚低;论文间"标注"口径不可比。
解决:

  1. 简单方法:在数据卡中明确区分两级标签——LMD 专家轮廓(共识级)与 ML 像素邻域标签(弱级),按任务选层级。
  2. 进阶方法:以 LMD 轮廓为锚做弱监督学习(轮廓内样本级监督 + ML 标签做形状先验)。
  3. SOTA 方法:半监督/自训练——先用双级标签预训练,再由神经病理学家标注小规模验证集做校准报告。
    参考:Allen API 文档(半自动标注算法与 45×45 邻域定义);Puchalski et al., 2018, Science(LMD 轮廓与三人独立验证)。

⚠️ 坑点 8:0.5 μm/像素大图的内存爆炸与染色归一化陷阱(分类:预处理陷阱)

问题:组织学图像分辨率为 0.5 μm/像素,单张 H&E 覆盖整个亚块截面,直接 imread 整图即可耗尽数 GB 内存;ISH 与 H&E 染色风格、批次间光照差异显著,不做归一化会让模型学到染色而非结构。
症状:DataLoader worker OOM;训练损失正常但验证集指标随批次剧烈波动;模型对染色风格迁移敏感、跨 block 泛化差。
解决:

  1. 简单方法:按 patch 流式读取(tifffile.memmap / openslide 式区域解码),patch 512×512 + stride 采样;磁盘放内存映射。
  2. 进阶方法:H&E 用 Macenko/Reinhard 染色归一化,ISH 用灰度-密度映射标准化;归一化模板选自固定参考 block 并随数据卡存档。
  3. SOTA 方法:染色增广(stain augmentation)替代硬归一化训练,配合 16-bit 保存与 num_workers 内存预算管理。
    参考:门户图像查看器规格(0.5 μm/pixel);Allen API 文档(图像 QC 流程)。

§6.6 数据增强

增强 适用性 说明
随机裁剪/翻转/90° 旋转 ✅ 安全 组织学无方向语义,标准操作
染色增广(HED 抖动) ✅ 安全 提升跨 block 泛化,替代硬归一化
亮度/对比度小扰动 ✅ 安全 模拟扫描光照差异,幅度保守
小角度旋转/弹性形变 ⚠️ 谨慎 会破坏与 LMD 轮廓/结构标签的空间对应
灰度反转/极端缩放 ⚠️ 谨慎 ISH 信号强度有生物学含义,过度扰动破坏表达语义
像素级跨模态混合(图像-表达插值) ❌ 危险 表达是区域级信号,逐像素混合制造生物学上不存在的样本
纵向 MRI 时间点混用为独立样本 ❌ 危险 同一患者时间进程强相关,等同泄漏

增强策略与监督层级联动:用 ML 标签训练时可放开染色增广与几何扰动;用 LMD 轮廓做区域级监督时,几何扰动必须同步作用于轮廓坐标(保持轮廓-图像一致性),否则监督信号与图像错位。

§6.7 模型推荐

任务 推荐模型 官方对接点 理由
五区/结构分割 U-Net / nnU-Net(弱监督配置) 45×45 邻域标签 + LMD 轮廓 与稀疏轮廓和密集弱标签兼容
病理基础模型评测 ViT 系病理预训练(DINOv2 式自监督微调) H&E SectionDataSet Ivy GAP 适合作为 GBM 下游评测集
表达分区反卷积 NNLS / CIBERSORT 式线性解混 293 基因签名 + 分区均值矩阵 官方范式,跨队列可解释
跨模态对齐 CLIP 式双塔(patch × 分区表达) LMD 轮廓正对样本 轮廓提供天然监督对
影像组学 radiomics 特征 + 梯度提升树 TCIA DICOM + ivygap.org 临床 小样本下稳健,可对照官方结果集

§6.8 硬件需求

场景 配置建议
表达分析/反卷积 8 核 CPU、16 GB 内存即可
图像 patch 训练 单张 24 GB GPU + 64 GB 内存(内存映射读取)
全切片级推理 128 GB 内存或分块流式;存储预留 200 GB+
MRI 处理 16 GB 内存 + dcm2niix;DICOM 解压临时空间 300 GB
基础模型微调 多卡 A100/40 GB 级;建议先 patch 级预训练再亚块级微调
硬盘规划 组学 20 GB + 图像 50–100 GB + 影像 140–300 GB,NVMe 优先(大图随机读取)

§6.9 评估指标

指标选型与任务一一对应:分割/分类报 macro-F1 与逐类召回(五区不均衡,坑点 1);反卷积报比例 RMSE 与生物学锚点一致性;检索/对齐报 recall@k;生存报 C-index 且必须外部复现。以下给出可直接复用的实现骨架。

import numpy as np
from sklearn.metrics import f1_score, confusion_matrix

def per_class_report(y_true, y_pred, names=("LE", "IT", "CT", "MVP", "PAN")):
    """逐类指标:五区不均衡,必须报告 macro 与逐类召回(坑点 1)。"""
    macro = f1_score(y_true, y_pred, average="macro")
    rec = dict(zip(names, np.diag(confusion_matrix(y_true, y_pred,
              labels=range(len(names))) /
              np.maximum(confusion_matrix(y_true, y_pred,
              labels=range(len(names))).sum(axis=1), 1))))
    return {"macro_f1": round(macro, 4), **{k: round(v, 4) for k, v in rec.items()}}

def deconv_rmse(proportions_pred, proportions_true):
    """反卷积比例误差:预测与真实比例均需非负且和为 1。"""
    return float(np.sqrt(np.mean((proportions_pred - proportions_true) ** 2)))

def anchor_consistency(props, marker_expr, region="MVP"):
    """生物学锚点一致性:分区比例 × 已知标志物表达的相关方向。"""
    return float(props[region].corr(marker_expr))

生存类任务的指标约定:以 C-index 为主报告,且必须在 TCGA 外部队列复现(Ivy GAP 41 例不足以单独支撑生存结论,见 §7.1);一致性检验用时间依赖 AUC 与校准曲线,按 MGMT 甲基化与年龄分层报告稳定性。图像检索类任务报告 recall@k 与 mAP,切分单位同样是 tumor_id。所有指标的置信区间建议用肿瘤级 bootstrap 估计,而非样本级。

§6.10 MLOps 笔记

  • 数据卡先行:入库前固化样本清单、口径(FPKM vs TPM)、切分键(tumor_id)与映射表版本;四路来源(门户/GEO/TCIA/ivygap.org)分别记录快照日期。
  • 标签分层管理:LMD 轮廓与 ML 标签分字段存储,任何模型报告必须注明监督层级。
  • 外部验证固定化:把 TCGA 验证集清单写进 CI,防止迭代中"外部"悄悄混入训练。
  • 许可检查:CI 中校验分发产物仅含允许再分派的内容(Allen 条款禁止商业再许可;TCIA 影像不得再分发)。
  • 口径追溯:表达矩阵的每一列都能回溯到 SectionDataSet/样本 URL 与下载日期;归一化脚本版本化,任何重算可复现。
  • 漂移监控:部署侧监测表达分布 KS 距离、染色直方图偏移与跨人群性能差(§7.6)。
  • 多任务隔离:分割、反卷积、检索三条线的指标与实验跟踪分开命名空间,避免跨任务比较引起的误读(§8.1)。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 全部样本来自 Seattle 单一中心一家医院 高 联合 TCGA/CGGA 多中心数据外推
手术选择偏倚 仅纳入可整体切除的幕上肿瘤 中 结论限定于手术可及区域
区域取样偏倚 结构 RNA-seq 仅 8–10 例肿瘤 高 反卷积结论以外部验证为准
标注弱监督偏倚 ML 像素标签非专家金标准 中 使用 LMD 轮廓层做高置信任务
IDH 组成偏倚 IDH 突变例数过少未做分区分析 中 结论适用于 IDH 野生型为主队列
生存统计功效不足 41 例难以支撑稳定生存结论 高 生存分析必须在 TCGA 复现
技术批次偏倚 LMD/RNA-seq 流程与 bulk 队列不同 中 同口径归一化 + 批次协变量(坑点 6)
队列时代偏倚 样本采集与治疗反映 2010 年代早中期实践 中 与当代队列对比时注意治疗方案演变

§7.2 标注质量

LMD 轮廓层:1 名神经病理学家会商绘制 + 3 名独立神经病理学家验证,一致性极好(论文补充表 S2),属共识级。ML 像素标签层:算法自动生成,可复现但含系统误差,属弱监督级。两级标签在官方产品中并存,使用者必须显式声明所用层级;未见官方发布的逐像素 IoU 类量化指标,故不建议把 ML 标签当金标准做监督学习评估(坑点 7)。

两层标签各有适用面:做空间统计与机制假设时,LMD 轮廓层的共识性与可解释性最高;做像素级训练时,ML 标签提供了全片覆盖的密集信号,但应在论文中标注"弱监督"并报告与专家轮廓的一致性抽检结果。临床意义上的任何结论(如某结构内某通路激活)都应回到 LMD/转录组层证据,而非仅引用像素标签统计。

§7.3 泛化性

场景 失效风险 证据
跨中心病理图像分割 高(染色/扫描仪差异) 单中心采集,未见跨中心外部影像验证
跨平台表达反卷积 中(批次效应可校正) 官方已在 167 例 TCGA 样本示范并观察一致模式
生存预测 高(统计功效) 41 例队列,主论文亦以 MGMT 甲基化为最强因子
IDH 突变型肿瘤外推 高(人群覆盖不足) IDH1 突变例数过少未做分区分析
儿童脑瘤 不适用 队列为成人
术中/快速病理场景 高(工艺差异) 冻结切片工艺与常规石蜡切片染色特征不同
空间组学新平台(ST/MERFISH) 中(需映射协议) 分区定义可迁移,但基因面板与分辨率不同

§7.4 伦理

组织采集在 IRB 批准协议与知情同意下进行,Allen Institute 与 Swedish Health Services 于 2010-05-20 签署材料转移协议规范组织流转;所有标本与数据以脱敏编号分发。TCIA 影像因头部影像存在人脸重建风险而实行受限访问(签署协议后获取)。临床数据库实行注册访问。再分发与商业使用受 Allen Institute Terms of Use 限制(非商业研究用途 + 署名)。

合规要点速记:其一,三层访问级别对应三份约束文件(Terms of Use / Restricted License Agreement / 注册条款),引用时逐一对齐;其二,脱敏编号(如 W32)是全生态的关联主键,任何二次分析都不得尝试反向识别;其三,论文明确声明作者无竞争性利益,项目由 Ben and Catherine Ivy Foundation 资助;其四,组织再申请走 Swedish Health Services 逐案评审(价值、IRB、科学性)。

§7.5 公平性

队列未公开分人群的按区分析结果,人口学多样性无法保证;使用反卷积或分割模型时应评估跨人群、跨中心性能漂移,并在论文中报告队列组成(41 例成人、单中心、北美医疗体系)。

公平性审计建议:在数据卡中固定记录队列构成并在每次模型更新时复测;对表达类任务,报告分区比例在不同亚组(年龄、性别、分子亚型)间的分布差异;对图像类任务,检验染色与扫描条件相关的性能差。没有分层外部队列时,明确声明"公平性结论无法从本数据集得出"比给出可疑数字更负责任。

§7.6 数据漂移

数据为一次性冻结发布(TCIA Version 1 于 2016-12-30 更新;主论文 2018-05-11),无持续追加,版本漂移风险低;真正的漂移来自"使用场景漂移"——新测序平台、新扫描仪、新染色协议下的分布偏移,需在部署侧监测。

三类典型漂移及对策:其一,平台漂移(Ivy GAP 的 FPKM 口径 vs 新队列的 TPM/counts),用统一重定量或分位数归一桥接;其二,染色漂移(H&E 扫描仪/染色批次差异),用染色归一化或染色增广吸收;其三,人群漂移(单中心北美队列 → 其他医疗体系人群),只能在部署评估中量化、无法在预处理中消除。建议把三者的监控指标(表达分布 KS 距离、染色直方图偏移、跨人群性能差)纳入模型监控面板。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ FPKM 矩阵为基因 × 样本宽格式,门户直接提供
2 唯一标识 ✅ specimen_name / tumor_id 全链唯一且跨库一致
3 特殊字符 ✅ CSV 与 API 字段规范,无混入分隔符
4 重复行 ✅ 样本表按 sample_id 唯一;基因矩阵需自行去重符号重复
5 缺失编码 ⚠️ 缺失无统一编码约定,需使用者自定义 NaN 策略
6 标签标识 ✅ anatomic_feature 五区标签字段明确、官方枚举
7 罕见类分组 ⚠️ IT 区未进入主差异表达分析;MVP/PAN 面积占比小
8 偏倚评估 ✅ 单中心/手术选择/样本量偏倚在论文与白皮书中有明确交代
9 数据字典 ✅ API 文档 + 白皮书 + 下载页说明完整
10 信息性缺失解释 ⚠️ 部分字段缺失原因(如影像覆盖 39 例)需跨页推断
11 设备记录 ⚠️ MRI 协议见论文与 DICOM 元数据;组学测序平台细节分散于补充材料
12 共线性 ⚠️ 结构面积占比、核计数、核覆盖率高度相关,官方未提供共线性提示
13 编码映射 ✅ 解剖结构本体树官方维护并提供查询接口
14 时间戳处理 ⚠️ 纵向临床时间以治疗节点记录,格式需自行统一
15 划分建议 ⚠️ 无官方 train/test 划分,仅按六项研究分组
16 泄漏讨论 ⚠️ 官方未显式讨论同瘤多样本泄漏,需使用者自行按肿瘤分组
17 标签分布 ✅ 官方提供各 sub-block 结构面积占比与核统计汇总
18 测量偏倚 ⚠️ ISH 染色强度与测序深度存在批次差异,未提供官方校正参数
19 外部验证建议 ✅ 官方示范 293 基因签名于 167 例 TCGA 样本的反卷积验证
20 版本记录 ✅ TCIA Version 1(2016-12-30)与主论文(2018-05-11)时间线清晰
21 预处理脚本 ⚠️ 提供白皮书与 API,未提供端到端官方脚本
22 合规要求 ✅ 许可条款、访问流程、引用政策公开明确
23 多模态对齐 ⚠️ ISH 与 H&E 为相邻切片,几何对齐存在固有形变
24 去标识化 ✅ 脱敏编号体系贯通;影像侧以受限访问补强

DAIMS 评分:18.5 / 24

评分解读:12 项 ✅、11 项 ⚠️、1 项 ❌ 以下(无 ❌)。标识、字典、合规、版本、标签分布等"结构性"维度接近满分,反映 Allen Institute 级别的数据管理水准;失分集中在"建模配套"——无官方划分、弱监督标签未充分说明、多模态几何对齐存在物理极限、批次效应需自行处理。这些失分项多数是数据类型决定的客观约束(相邻切片不可能逐像素完美对齐),少数可通过社区工具链弥补。

对你意味着什么:可以直接把 Ivy GAP 当作"分区表达 + 专家轮廓"的可靠参照系使用;但在训练任何模型前,必须自己补三件事——按 tumor_id 的切分方案、两级标签的使用约定、以及跨口径(FPKM/TPM、跨队列)的归一化决策,并把这些决策写进数据卡。若你的任务依赖逐像素影像-组学对齐,请改用区域级设计(见坑点 2)。

落地为行动清单:① 第一天跑通 §6.1 最小子集并画出分区面积直方图;② 冻结切分键与外部验证清单进版本控制;③ 代码评审中把两级标签声明列为合并门禁;④ 任何生存/跨队列结论上线前过 TCGA 复现关卡;⑤ 每季度复查一次许可条款页(Terms of Use 有随时修订权)。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
TCGA bulk RNA-seq(167 例) TCGA 293 基因签名反卷积 分区比例模式一致性(定性) 与 Ivy GAP 分区模式一致 bulk 样本可解出 LE/CT/PAN/MVP 空间成分(主论文 fig. S8)
TCGA 分子亚型对照 TCGA 分区表达与亚型关联 生物学一致性(定性) 与既往研究一致 分区基因集与经典分子亚型的关联方向可复现(主论文)
TCIA 分析结果集(IvyGAP-Radiomics、DI-Cubed-Reports、BraTS-2021 相关) TCIA 生态 影像组学/分割参照 无统一指标 — Ivy GAP 作为 GBM 影像-分子参照进入多任务结果集

§8 基准性能与生态

§8.1 代表性研究与结果

Ivy GAP 无官方竞赛排行榜(不像 BraTS 设有固定测试集)。下表列出有同行评审支撑的代表性结果,数值口径互不相同、不可直接比较(任务与队列不同);与全切片基础模型榜单式的横向对比也不同——Ivy GAP 的价值在提供分区参照系而非榜单名次:

研究 任务 关键结果 年份 完整引用 代码
主论文 五区差异表达 + 反卷积 3,627 个分区富集基因;293 基因签名应用于 167 例 TCGA 样本 2018 Puchalski RB, et al. Science. 2018;360(6389):660-663. doi:10.1126/science.aaf2666 门户 API(非代码库)
TCIA 生态 影像组学/分割参照集 IvyGAP-Radiomics、DI-Cubed-Reports、RSNA-ASNR-MICCAI-BraTS-2021 分析结果收录 2016–2021 Shah N, et al. The Cancer Imaging Archive. 2016. doi:10.7937/K9/TCIA.2016.XLwaN6nL 见 TCIA 结果集页

§8.2 SOTA 总结与选型建议

以 Ivy GAP 为数据源的任务族中:分区反卷积的事实标准是主论文 293 基因签名(或其后续改进,需注明与官方口径的可比性);病理结构分割以弱监督 U-Net 系为主流起点;跨模态对齐尚无公认基准,建议自建协议时把 TCGA 外部验证与两级标签约定写清楚。选型原则:先定监督层级(LMD 轮廓 vs ML 标签),再选模型,最后定切分。

四类任务的成熟度排序:分区反卷积(成熟,有官方签名与 TCGA 验证范式)→ 结构分割(可行,弱监督配置成熟但需自行报告两级标签口径)→ 跨模态对齐(探索期,LMD 正对是天然优势但无基准)→ 影像-分子联合预测(早期,39 例影像样本量限制了端到端深度模型,宜走 radiomics 特征路线)。选择任务时同步评估硬件预算(§6.8)与许可约束(§7.4)。

§8.3 评测协议建议

  1. 反卷积类:在 Ivy GAP 分区均值矩阵上推导/加载签名,输出到 TCGA bulk 样本的比例,报告与已知生物学锚点的一致性(MVP×血管标志物正相关等)。
  2. 分割类:按 tumor_id 分组切分;报告 macro-F1 与逐类召回;如使用 ML 标签需注明弱监督性质。
  3. 跨模态类:以 LMD 轮廓 patch-表达正对为检索评测,报告 recall@k;禁止随机打散后切分。
# 评测协议骨架:组内按肿瘤分组 CV + 组外 TCGA 固定验证
from sklearn.model_selection import GroupKFold

def grouped_cv(dataset, model_factory, n_splits=5):
    """按 tumor_id 分组的 K 折;同一肿瘤绝不跨 train/val(坑点 4)。"""
    groups = dataset.tumor_ids
    gkf = GroupKFold(n_splits=n_splits)
    scores = []
    for tr, va in gkf.split(dataset, groups=groups):
        assert not (set(groups[tr]) & set(groups[va]))
        model = model_factory().fit(dataset[tr])
        scores.append(model.score(dataset[va]))
    return scores

def biological_anchor_check(props, marker_expr, anchor="MVP"):
    """生物学锚点一致性:如 MVP 比例应与血管标志物表达正相关。"""
    return props[anchor].corr(marker_expr)
数据集 关系 与 Ivy GAP 的互补点
TCGA-GBM 主验证伙伴 大队列 bulk 多组学 + 生存,反卷积标准应用场景
REMBRANDT 影像-组学平行队列 更大影像覆盖,无分区轮廓
BraTS 2021 影像分割基准 千例级多参数 MRI 分割,与 Ivy GAP 影像子集协议互补
CGGA 中国人群 GBM 队列 跨人群外部验证
Neftel 2019 scRNA-seq 单细胞状态图谱 提供细胞状态轴,可与分区表达联合解释
GLASS 纵向复发队列 治疗后演进视角,Ivy GAP 为初发手术横断面
TCGA 病理切片库 WSI 图像 大规模 H&E 全切片,可对照 Ivy GAP 冻结切片染色风格

搭配建议:表达方法学以 TCGA-GBM 为外部基准并加 CGGA 复现;图像方法学以 BraTS 协议思想设计跨库评测;机制解释类研究用 Neftel 细胞状态对分区信号去卷积出"什么细胞在哪个区",与 GLASS 纵向数据结合可提出演进假设。

§8.5 关键论文 Top 7

  1. Puchalski RB, et al. An anatomic transcriptional atlas of human glioblastoma. Science. 2018;360(6389):660-663. doi:10.1126/science.aaf2666 — Ivy GAP 主论文:五区 LMD 转录组、3,627 富集基因与 293 基因签名。
  2. Shah N, Feng X, Lankerovich M, Puchalski RB, Keogh B. Data from Ivy Glioblastoma Atlas Project (IvyGAP). The Cancer Imaging Archive. 2016. doi:10.7937/K9/TCIA.2016.XLwaN6nL — MRI 影像集正式数据引用。
  3. The Cancer Genome Atlas Research Network. Comprehensive genomic characterization defines human glioblastoma genes and core pathways. Nature. 2008 — GBM 基因组学奠基作,Ivy GAP 亚型框架的上游。
  4. Verhaak RGW, et al. Integrated genomic analysis identifies clinically relevant subtypes of glioblastoma characterized by abnormalities in PDGFRA, IDH1, EGFR, and NF1. Cancer Cell. 2010 — 经典四亚型(Classical/Proneural/Mesenchymal/Neural)。
  5. Neftel C, et al. An integrative model of cellular states, plasticity, and genetics for glioblastoma. Cell. 2019 — 四种细胞状态(AC/OPC/MES/NPC-like),与分区表达互补的解释轴。
  6. Louis DN, et al. The 2021 WHO Classification of Tumors of the Central Nervous System. Neuro-Oncology. 2021 — 现行分类框架(成人型弥漫性胶质瘤三分实体)。
  7. Ostrom QT, et al. CBTRUS Statistical Report. Neuro-Oncology. 2017 — 美国 CBTRUS 流行病学统计(主论文参考文献 1)。

§8.6 社区活跃度

主论文被引 689+(Google Scholar,截至 2026-09),持续被空间转录组、病理 AI 与肿瘤微环境文献引用;Allen 社区论坛(community.brain-map.org)承载 API 与数据问答;TCIA 侧 IvyGAP collection 有 3.9k 浏览与 30 次数据集引用(截至其页面统计)。无独立 GitHub 组织,生态以门户 API + 论文复现为主。

活跃度评估:作为 2018 年发布的图谱型资源,Ivy GAP 的引用曲线呈"长尾稳定"——早期由 GBM 生物学研究主导,近年因空间转录组与病理基础模型兴起而重新进入方法学论文的引用视野。对使用者而言,这意味着:官方答疑主要沉淀在社区论坛与 API 文档(而非活跃的 issue 列表);复现性问题优先查主论文补充材料(Materials and Methods、表 S1–S16)与门户白皮书。

§8.7 生态快照

资源 类型 链接 推荐理由
Allen 门户 数据门户 https://glioblastoma.alleninstitute.org/ 图像查看器、检索、白皮书
数据下载页 下载 https://glioblastoma.alleninstitute.org/static/download.html 汇总表 + 表达矩阵
RMA API 文档 文档 https://help.brain-map.org/pages/?pageId=8323090 程序化访问唯一官方入口
GEO GSE107560 存档 https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE107560 RNA-seq 与拷贝数原始数据
TCIA IvyGAP 受限影像 https://doi.org/10.7937/K9/TCIA.2016.XLwaN6nL MRI 时间进程(139.98 GB)
ivygap.org 注册数据库 http://ivygap.org/ 纵向临床与基因组
Allen 社区论坛 社区 https://community.brain-map.org/ API 使用与数据问答
Science 补充材料 论文附件 doi:10.1126/science.aaf2666 附件页 方法细节与表 S1–S16(含 LMD 一致性表 S2)
brain-map.org 白皮书 技术文档 https://portal.brain-map.org/ 肿瘤标本与信息学处理工艺

§9 相关资源与引用

§9.1 官方资源

资源 链接 说明
数据门户 https://glioblastoma.alleninstitute.org/ 项目总览、图像查看器、六项研究说明
下载页 https://glioblastoma.alleninstitute.org/static/download.html 汇总 CSV、归一化 FPKM zip、BAM/TPM URL 清单
API 文档 https://help.brain-map.org/pages/?pageId=8323090 数据模型、RMA 查询语法与示例
Terms of Use https://alleninstitute.org/legal/terms-of-use 非商业+署名条款原文
Citation Policy https://alleninstitute.org/citation-policy/ 数据集与图像的引用格式
TCIA collection https://doi.org/10.7937/K9/TCIA.2016.XLwaN6nL MRI 受限访问入口与数据引用
GEO GSE107560 https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE107560 RNA-seq 与拷贝数存档
临床数据库 http://ivygap.org/ 纵向临床与基因组(注册访问)
社区论坛 https://community.brain-map.org/ API 使用问答与数据公告
PMC 开放全文 https://www.ncbi.nlm.nih.gov/pmc/articles/PMC6414061/ 主论文方法与补充材料入口

§9.2 BibTeX 完整引用

@article{puchalski2018ivygap,
  title   = {An anatomic transcriptional atlas of human glioblastoma},
  author  = {Puchalski, Ralph B. and Shah, Nameeta and Miller, Jeremy A. and Dalley, Rachel and Nomura, Steve R. and Yoon, Jae-Guen and Smith, Kimberly A. and Lankerovich, Michael and Bertagnolli, Darren and Bickley, Kris and others},
  journal = {Science},
  volume  = {360},
  number  = {6389},
  pages   = {660--663},
  year    = {2018},
  doi     = {10.1126/science.aaf2666}
}

@dataset{shah2016ivygap_tcia,
  title       = {Data from Ivy Glioblastoma Atlas Project (IvyGAP)},
  author      = {Shah, Nameeta and Feng, Xu and Lankerovich, Michael and Puchalski, Ralph B. and Keogh, Bart},
  year        = {2016},
  publisher   = {The Cancer Imaging Archive},
  doi         = {10.7937/K9/TCIA.2016.XLwaN6nL}
}

@article{neftel2019cellstates,
  title   = {An Integrative Model of Cellular States, Plasticity, and Genetics for Glioblastoma},
  author  = {Neftel, Cyril and Laffy, Julie and Filbin, Mariella G. and Hara, Toshio and Shore, Melissa E. and others},
  journal = {Cell},
  volume  = {178},
  number  = {4},
  pages   = {835--849},
  year    = {2019},
  doi     = {10.1016/j.cell.2019.06.024}
}

@article{verhaak2010subtypes,
  title   = {Integrated Genomic Analysis Identifies Clinically Relevant Subtypes of Glioblastoma Characterized by Abnormalities in {PDGFRA}, {IDH1}, {EGFR}, and {NF1}},
  author  = {Verhaak, Roel G. W. and Hoadley, Katherine A. and Purdom, Elizabeth and Wang, Victoria and Qi, Yuan and others},
  journal = {Cancer Cell},
  volume  = {17},
  number  = {1},
  pages   = {98--110},
  year    = {2010},
  doi     = {10.1016/j.ccr.2009.12.020}
}

@article{tcga2008gbm,
  title   = {Comprehensive genomic characterization defines human glioblastoma genes and core pathways},
  author  = {{The Cancer Genome Atlas Research Network}},
  journal = {Nature},
  volume  = {455},
  pages   = {1061--1068},
  year    = {2008},
  doi     = {10.1038/nature07385}
}

@article{louis2021who5,
  title   = {The 2021 {WHO} Classification of Tumors of the Central Nervous System: a summary},
  author  = {Louis, David N. and Perry, Arie and Wesseling, Pieter and Figarella-Branger, Dominique and others},
  journal = {Neuro-Oncology},
  volume  = {23},
  number  = {8},
  pages   = {1231--1251},
  year    = {2021},
  doi     = {10.1093/neuonc/noab106}
}

§9.3 引用指南

使用本数据集时,至少引用:主论文(Puchalski 2018)+ 所用数据入口(门户/GEO/TCIA 数据集引用)。Allen Institute Citation Policy 要求在使用图像处直接链接来源;TCIA 影像必须带 DOI 引用。衍生再分发需遵守 Terms of Use(非商业 + 署名,TCIA 影像不得再分发)。

三条实操规则:其一,引用"资源 + 论文"双件套——引用数据集本身(TCIA 数据集引用或门户资源引用)的同时必须引用主论文,这在 Allen Citation Policy 中是硬性要求;其二,图像展示即署名——在任何网页、论文或演示文稿中展示门户图像,署名与链接必须出现在同一页面/幻灯片;其三,衍生数据集的许可传导——基于门户数据再加工的衍生数据集继承非商业条款,发布前应逐条核对 Terms of Use,涉及商业用途需邮件 terms@alleninstitute.org 取得书面许可。


§10 AI 使用声明卡

§10.1 AI 模型列表

环节 使用工具/模型 用途
检索辅助 WebSearch 聚合检索 核实规模、许可、机构分工与论文信息
起草辅助 大语言模型(千方病案医学编辑部配置) 结构起草与语言组织
校验工具 check_md.py(千方内部脚本) 格式与纯净度校验

§10.2 AI 参与范围

AI 参与资料检索、初稿起草与格式校验;事实性数字全部回溯至官方页面与同行评审文献并由编辑核对;免责声明、审核结论与最终发布决定由千方病案医学编辑部人工做出。

范围边界:AI 不做医学诊断性表述的最终裁定(§2 的疾病描述以 WHO 分类与主论文为准);AI 不产生本页面之外的数据(所有规模数字均可在 §10.3 来源清单中溯源);代码示例在 AI 起草后经数据工程师审读,属于"模式示范"而非官方实现——官方未发布端到端脚本,这一点在 §7.7 第 21 项已如实标注。

§10.3 输入来源列表

  1. Puchalski RB, et al. An anatomic transcriptional atlas of human glioblastoma. Science. 2018;360(6389):660-663. doi:10.1126/science.aaf2666
  2. Ivy GAP 数据门户(数据总览与 ISH/RNA-seq 六项研究说明):https://glioblastoma.alleninstitute.org/
  3. Ivy GAP 数据下载页:https://glioblastoma.alleninstitute.org/static/download.html
  4. Allen Brain Atlas API 文档(Ivy GAP 章节):https://help.brain-map.org/pages/?pageId=8323090
  5. TCIA IvyGAP collection(39 例 390 studies 846,743 图像 139.98 GB;受限访问):https://doi.org/10.7937/K9/TCIA.2016.XLwaN6nL
  6. Shah N, et al. Data from IvyGAP. The Cancer Imaging Archive. 2016. doi:10.7937/K9/TCIA.2016.XLwaN6nL
  7. GEO Series GSE107560(RNA-seq 与拷贝数):https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE107560
  8. PubMed 29748285(主论文摘要与数据可用性声明):https://pubmed.ncbi.nlm.nih.gov/29748285/
  9. Allen Institute Terms of Use:https://alleninstitute.org/legal/terms-of-use
  10. Allen Institute Citation Policy:https://alleninstitute.org/citation-policy/
  11. CASRAI Allen Brain Map 数据许可与 DMP 指南:https://casrai.org/guides/allen-brain-map-data-sharing-licensing-dmp
  12. GenomeWeb 报道(机构分工与 293 基因签名应用):https://drupal.prod.genomeweb.com/node/69931
  13. brain-map.org Neuroimaging 页(39 例 MRI 经 TCIA 分发):https://brain-map.org/our-research/neuroimaging
  14. 主论文引用统计(689+,截至 2026-09):https://www.ablesci.com/scholar/paper?id=3J12DX2wr
  15. Neftel C, et al. Cell. 2019(相关单细胞状态研究). doi:10.1016/j.cell.2019.06.024
  16. Allen Brain Map 开放科学与数据政策入口:https://brain-map.org/
  17. TCIA 数据使用政策与受限访问说明:https://www.cancerimagingarchive.net/

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与版本时间轴 千方病案医学编辑部 对照官方门户与主论文逐项核对 ✅ 已通过
§2 医学背景(分子病理与微环境分区) 千方病案医学编辑部 医学专业审读,对照 WHO CNS5 与主论文 ✅ 已通过
§3–§4 数据规格与 DAIMS 字段字典 医疗 AI 数据工程师 对照 API 文档与下载页逐字段核对 ✅ 已通过
§6 预处理 Pipeline 与 8 个坑点 医疗 AI 数据工程师 代码本地试运行 + 坑点溯源核对 ✅ 已通过
§7 质量评估与 DAIMS 24 项 千方病案医学编辑部 逐项交叉核对事实与来源 ✅ 已通过
§8–§10 与 §C 结构化数据 千方病案医学编辑部 引用完整性 + JSON-LD 语法校验 ✅ 已通过
§1.3/§8.4 相关数据集对比 千方病案医学编辑部 与对应数据集官方页核对口径 ✅ 已通过
frontmatter 与 INFOBOX 一致性 千方病案医学编辑部 两处规模/许可/机构逐字对齐 ✅ 已通过

§10.5 AI 生成章节标注

本页面各章节初稿由 AI 辅助起草;其中 §1.0/§1.2/§2.5/§7.7 评分解读等评论性内容经编辑部人工改写定稿;全部数字以 §10.3 来源清单核对为准。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • upenn-gbm — 共享标签:医学影像 / 病理图像 / 肿瘤学 / 脑肿瘤
  • bigbrain — 共享标签:医学影像 / 神经科学 / 病理图像
  • ucsf-pdgm — 共享标签:医学影像 / 肿瘤学 / 脑肿瘤
  • fets — 共享标签:医学影像 / 肿瘤学 / 脑肿瘤
  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • sicapv2 — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • msk-impact — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • munich-bmc — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • CIMA — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • CAMELYON16-17 — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集