HEST-1k — 病理×空间转录组配对库 AI-Ready Wikipedia

1,229 个 ST 样本与 H&E 全切片一一配对,210 万表达-形态对覆盖 153 队列

来源 Mahmood Lab(哈佛医学院 / Mass General Brigham) url: https://huggingface.co/datasets/MahmoodLab/hest发布时间: 2026-09-18最后更新: 2026-09-25 阅读 23
HEST-1k — 病理×空间转录组配对库 AI-Ready Wikipedia

信息速览

数据集名称HEST-1k — 病理×空间转录组配对库 AI-Ready Wikipedia
数据类型1,229 个 ST 样本配对 WSI,210 万表达-形态对,超 7,640 万细胞核,全量超 1 TB,H5AD/TIFF/H5/Parquet
规模1,229 个空间转录组样本(153 个独立队列,26 个器官)
接入方式Mahmood Lab(哈佛医学院 / Mass General Brigham) url: https://huggingface.co/datasets/MahmoodLab/hest
AI 就绪度

HEST-1k — 病理×空间转录组配对库 AI-Ready Wikipedia

INFOBOX

数据集名称 HEST-1k
英文全称 HEST-1k: A Dataset for Spatial Transcriptomics and Histology Image Analysis(论文标题口径)
别名/简称 HEST、HEST-1k、MahmoodLab/hest
疾病分类 多癌种与正常组织(ICD-11:2E60 乳腺恶性肿瘤 / 2C82 前列腺恶性肿瘤 / 2C25 支气管或肺恶性肿瘤 / 2B90 结肠恶性肿瘤 / 2B92 直肠恶性肿瘤 / 2C10 胰腺恶性肿瘤 / 2C30 黑色素瘤 / 2C91.0 肾细胞癌等,覆盖 25 种癌种,详见 §2.1)
SNOMED CT 353070003 浸润性导管癌 / 414058002 肺腺癌 / 297944004 前列腺腺癌 / 363406005 结肠腺癌(详见 §2.2)
数据模态 H&E 病理全切片图像(WSI)+ 空间转录组(ST/Visium/Visium HD/Xenium)+ CellViT 细胞核分割
AI 任务类型 基因表达预测(形态→表达回归)、病理基础模型预训练与评测、批次校正、域泛化、细胞核分割
样本总数 1,229 个 ST 样本(论文定稿口径,各配对 1 张 H&E WSI);Hugging Face v1.3.0 已扩展至 1,276 个(截至 2026-02)
数据大小 全量 >1 TB(Hugging Face 口径);GitHub README 称含衍生文件超 2 TB
数据格式 Pyramidal TIFF/BigTIFF(WSI)、H5AD(表达矩阵)、H5(补丁)、Parquet(转录本)、GeoJSON(组织分割)
许可证 CC BY-NC-SA 4.0(署名-非商业性使用-相同方式共享)
访问级别 注册后开放(Hugging Face gated:接受数据使用条款后自动批准)
DUO 标签 HMB, NCU, PUB(仅供参考,以官方协议为准)
语言 英文(元数据、文档与代码注释)
首发日期 2024-06-23(arXiv 预印本)/ 2024-12-16(NeurIPS 2024 正式出版)
最后更新 2026-02-08(Hugging Face v1.3.0)
发布机构 Mahmood Lab(哈佛医学院 & Mass General Brigham)
官方主页 https://github.com/mahmoodlab/HEST
下载地址 https://huggingface.co/datasets/MahmoodLab/hest
DOI 10.48550/arXiv.2406.16192
引用次数 216+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方补丁/细胞核分割/基准协议齐全、Hugging Face 可直接加载;扣分项:全量超 1 TB 需自备存储、无官方全量划分、平台与物种混杂需自行分层建模
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(多癌种 ICD-11/SNOMED 映射、流行病学表述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-18

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HEST-1k 通过 Hugging Face gated 模式发布,用户需注册账号并在数据集页面接受使用条款(自动批准),许可证为 CC BY-NC-SA 4.0,明确禁止商业用途;153 个来源队列的许可信息以逐样本元数据为准。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? HEST-1k 读作"HEST 一千",是哈佛医学院 Mahmood Lab 于 2024 年发布的病理图像-空间转录组配对数据集。它把 1,229 个组织样本的两种"体检结果"钉在了同一个坐标架上:一张 H&E 染色的病理全切片图像,加上同一区域逐个空间位点测得的基因表达谱。数据覆盖 153 个公开队列、26 个器官、2 个物种,其中 367 个样本来自 25 种癌症(arXiv:2406.16192)。

为什么重要? 在 HEST-1k 之前,病理 AI 研究者面对的要么是"只有图像没有分子"的万级 WSI 集合(如 TCGA),要么是"只有分子没有图像"的散装空间转录组数据。HEST-1k 把两者对齐后统一打包,让"看图像猜基因表达"(形态-表达预测)第一次有了足够大的训练与评测底座——这正是病理基础模型走向"虚拟染色、分子替代检测"的关键原料。

我能用它做什么? 训练或评测"从病理补丁预测基因表达"的模型;为病理基础模型做预训练与横向基准;开发空间组学的批次校正与域泛化方法;研究肿瘤微环境的空间异质性。官方配套的 HEST-Benchmark 已用统一协议横评了 25 个公开视觉模型(截至 2026-04),直接复用即可获得可比结果。

§1.1 摘要

HEST-1k 由 Mahmood Lab 联合多国团队构建,2024 年 6 月以预印本首发,2024 年 12 月被 NeurIPS 2024 Datasets & Benchmarks Track 接收为 Spotlight 论文,正式版规模从 1,108 个样本扩至 1,229 个(arXiv:2406.16192)。构建流程分四步:其一,从 153 个公开发表的空间转录组研究中汇总原始数据,覆盖 Visium、早期 ST、Visium HD 与 Xenium 四类平台;其二,为每个 ST 样本配对同一切片或相邻切片的 H&E 全扫描图像;其三,用基于 YOLOv8 的定位点检测(Visium)与 VALIS 配准框架(Xenium)把空间坐标对齐到图像像素坐标;其四,用 CellViT 模型对全部 WSI 做细胞核自动分割,共产出超 7,640 万个核、210 万个"补丁-表达"配对。官方进一步将补丁统一为 112×112 µm、0.5 µm/px(224×224 px)规格,并配套 HEST-Benchmark:9 个任务上以 Ridge 回归+PCA(256) 为统一基线、逐基因 Pearson 相关为指标、患者分层交叉验证为划分协议。Hugging Face 上的数据集此后仍在滚动扩容,v1.3.0 已达 1,276 个样本(截至 2026-02)。

§1.2 战略价值

范式价值:把"看形态"升级为"读分子"。 传统病理 AI 的监督信号是诊断标签,信息量低且依赖医生标注;HEST-1k 提供的是每个空间位点上数千个基因的定量表达,监督密度提升数个量级。这使得"以形态预测分子""以图像生成虚拟染色/虚拟表达谱"成为可规模化训练的任务,也为病理多模态基础模型(图像-基因联合预训练)提供了真实对齐数据,而非合成伪对齐。

生态位价值:补齐 WSI 集合与散装空间组学之间的断层。 TCGA 等大规模 WSI 集合缺少空间分辨的分子信号;单个空间转录组研究通常只有个位数样本,难以支撑深度模型训练。HEST-1k 以统一的预处理与元数据规范聚合 153 个队列,是截至 2026 年公开可用、规模最大的"病理图像×空间转录组"配对资源之一,其配套基准让模型横评第一次有了同口径协议。

工程价值:重活已经替你干完。 坐标配准(Visium 定位点仿射对齐、Xenium 经 VALIS)、细胞核分割(CellViT)、补丁规格统一(224×224 px @0.5 µm/px)、逐样本元数据与许可登记,这些耗时数月的流水线工作由官方完成并随数据分发,团队只需下载 patches/ 与 st/ 即可开始训练。

§1.3 同类数据集横向对比

数据集 规模 模态 标注/信号 与 HEST-1k 的差异
HEST-1k 1,229 个 ST 样本(26 器官) H&E WSI + 空间转录组 逐空间位点基因表达 + 7,640 万细胞核实例 本体:统一配准与补丁规格,附官方基准
TCGA 万级 WSI(32 癌种) H&E WSI + bulk RNA-seq 诊断标签 + 切片级 bulk 表达 表达为组织均质信号,无空间位点级配对
HTAN 多中心 atlas 聚合 影像+单细胞/空间多组学 各中心异构 数据异构、需自行配对与规整,非即用型配对包
10x Genomics Visium 官方示例 数十样本 Visium + H&E 官方教程数据 规模小,定位为产品演示而非研究底座
HuBMAP 多器官人体图谱 影像+单细胞多组学 各联盟不一 以健康组织为主,癌种覆盖少

§1.4 版本时间轴

版本/节点 日期 变更 样本数
arXiv v1 预印本 2024-06-23 首发 1,108(131 队列)
Hugging Face v1.1.0 2024-09-23 新增 121 个样本,含 27 个 Xenium、7 个 Visium HD 1,229
NeurIPS 2024 定稿 2024-12-16 Datasets & Benchmarks Track Spotlight 正式出版 1,229(153 队列)
Hugging Face v1.2.0 2026-01-06 新增 27 个 Visium HD 样本 约 1,256
Hugging Face v1.3.0 2026-02-08 新增 18 个 Xenium 样本(含 Xenium 5k) 1,276(截至 2026-02)

§1.5 典型应用场景

  1. 形态→表达回归:输入 224×224 px 病理补丁,输出该位置的基因表达向量;下游可做基因空间表达重建与"虚拟原位杂交"。
  2. 病理基础模型预训练与评测:将 UNI、CONCH、GigaPath 等视觉/视觉-语言模型的补丁特征接入官方 Ridge 基线,量化形态学表征质量。
  3. 肿瘤微环境空间解析:结合细胞核实例与表达矩阵,研究肿瘤-间质交界区的空间基因程序。
  4. 批次校正与域泛化方法学:跨 153 个队列、4 类平台的数据天然构成域偏移场景,适合开发与验证 Harmony/MNN 类方法。
  5. 分子标志物的空间定位研究:对免疫治疗相关通路等在组织形态上定位其空间表达模式,辅助转化研究假设生成。

不同角色切入本库的优先路径:

你的角色 首选切入点 本条目对应章节
机器学习研究者 直接用 patches/ + st/ 训练表达预测模型 §4、§6
病理/转化研究者 按器官与癌种筛样本,读表达矩阵做空间分析 §2、§4.2
方法学团队 用 153 队列构造域偏移与批次校正实验 §5、§7.1
数据工程团队 规划存储、下载与特征缓存流水线 §3.4、§6.0-§6.2

§2 医学背景

§2.1 ICD-11 疾病分类锚定

HEST-1k 的 1,229 个样本横跨 26 个器官、25 种癌种(367 个癌症样本),并非单一疾病队列,而是以实体肿瘤为主、兼顾正常组织的泛癌空间转录组资源库。其癌症样本中编辑选定的高频代表性癌种 ICD-11 锚定如下:

癌种(OncoTree 简称) 中文名称 ICD-11 编码 在库内的意义
BRCA 乳腺癌 2E60 乳腺恶性肿瘤 泛癌队列中的代表性上皮来源肿瘤
PRAD 前列腺腺癌 2C82 前列腺恶性肿瘤 腺体器官小样本队列(见 §6.5 坑点 1)
LUAD 肺腺癌 2C25 支气管或肺恶性肿瘤 高异质性腺癌,空间亚型研究热点
COAD 结肠腺癌 2B90 结肠恶性肿瘤 结直肠癌空间标志物研究常用入口
READ 直肠腺癌 2B92 直肠恶性肿瘤 与 COAD 常被合并分析(注意 ICD-11 分码)
PAAD 胰腺腺癌 2C10 胰腺恶性肿瘤 间质丰富肿瘤,空间肿瘤-间质分析典型对象
SKCM 皮肤黑色素瘤 2C30 皮肤黑色素瘤 免疫治疗空间生物标志物重点癌种
ccRCC 肾透明细胞癌 2C91.0 肾透明细胞癌 形态-表达空间耦合强的泌尿系统肿瘤

说明:上述映射为本条目编辑为便于临床检索而做的选定锚定;库内原生的疾病编码体系是 OncoTree(oncotree_code 字段),两者并非一一对应的官方转换。除上表 8 类外,库内还覆盖卵巢、子宫内膜、肝脏、膀胱、甲状腺等多个器官系统的恶性肿瘤,完整清单以官方样本级元数据(oncotree_code 字段)为准。

ICD-11 锚定的使用层次:不同场景应选用不同粒度的编码,避免"一套编码走天下":

使用场景 推荐编码 理由
库内分组、分层与统计 OncoTree(oncotree_code) 粒度最细(LUAD/LUSC 分开),与数据同行分发
院内术语服务/登记系统对接 ICD-11(上表) 医院侧事实标准,跨系统对齐最稳
跨库合并(TCGA/HTAN 等) ICD-11 或显式映射表 各库原生口径不同,需一层显式映射
论文方法学描述 并列注明 + 版本号 便于审稿与复现时回查编码口径

§2.2 SNOMED CT 映射

临床场景 OncoTree ICD-11 SNOMED CT SNOMED CT 术语
浸润性导管癌(乳腺) BRCA-IDC 2E60 353070003 Invasive ductal carcinoma (morphologic abnormality)
肺腺癌 LUAD 2C25 414058002 Adenocarcinoma of lung (disorder)
前列腺腺癌 PRAD 2C82 297944004 Adenocarcinoma of prostate (disorder)
结肠腺癌 COAD 2B90 363406005 Adenocarcinoma of colon (disorder)
直肠腺癌 READ 2B92 363405001 Adenocarcinoma of rectum (disorder)
胰腺腺癌 PAAD 2C10 56246009 Adenocarcinoma of pancreas (disorder)
皮肤恶性黑色素瘤 SKCM 2C30 372244006 Malignant melanoma (disorder)
透明细胞肾细胞癌 ccRCC 2C91.0 45410004 Clear cell renal cell carcinoma (disorder)

使用提醒:SNOMED CT 编码用于电子病历与术语服务侧的语义对接(如把模型输出挂接到医院术语服务器);OncoTree 编码则是肿瘤学研究和数据集内部的主键口径。三套编码并存时,建议以 OncoTree 为数据内主键、ICD-11 与 SNOMED CT 为外呼映射,并保留映射版本号以便审计。

维护提示:SNOMED CT 与 ICD-11 均随版本演进,上表映射以编辑日(2026-09)官方浏览器快照为准;生产系统落地时应把三套编码的版本号写入数据字典并随 schema 一起版本化,避免上游术语升级造成的静默错配。

§2.3 疾病与组织学背景

HEST-1k 面向的是癌症分子病理学与空间组学交叉领域。传统数字病理学以 H&E 染色全切片图像为对象,病理医师据形态学进行分级、分型与浸润模式判断;空间转录组学(ST)则将基因表达定量锚定到组织内的具体位置。两者天然互补:图像便宜、易获取、分辨率高;表达矩阵信息丰富但昂贵、通量低。HEST-1k 的核心贡献正是在大规模上把这两种模态逐样本配对——1,229 个 ST 样本各对应一张 H&E WSI,形成 210 万 expression-morphology pairs,并经 CellViT 分割出超 7,640 万个细胞核(均值约 62,100 个/切片)作为形态学的中间表征。这使"从切片图像推断空间基因表达"这一 AI 任务首次拥有了跨器官、跨平台、够规模的训练与评测资源。

从技术平台看,库内四类空间转录组平台对应了该领域数年的演进谱系:早期原代 ST(约 100 µm spot)验证了"基因表达 + 空间位置"的可行性;10x Visium(55 µm spot)以商业化芯片把该范式推向主流,构成本库的主体;Visium HD 把分辨率推进到 2 µm 亚 spot 级;Nanostring Xenium 则走向近单细胞的原位单分子检测。平台代际差异既是本库的资产(跨平台方法学的天然试验场),也是必须显式处理的混杂因素(见 §3.1 与 §7.1)。

从肿瘤学视角看,库内 367 个癌症样本覆盖的 25 种癌种以腺癌与上皮来源肿瘤为主(乳腺、肺、结直肠、前列腺、胰腺等),这正是空间转录组转化研究最活跃的领域——肿瘤-间质空间关系、免疫浸润格局与代谢程序的空间异质性,都依赖"形态可见、分子可测"的配对数据。

对 AI 从业者的一句话定位:如果只记一件事——HEST-1k 是"病理基础模型的空间表达评测场":预训练发生在别处(千万级 WSI 语料上的 UNI、GigaPath、Virchow 等),本库提供的是紧凑、配对、带官方协议的下游检验环境。这决定了它的正确用法是线性探针评测与小数据微调,而非从零预训练。

§2.4 目标临床任务定义

AI 任务 临床定义 在 HEST-1k 中的操作化
形态学到表达的回归预测 从 H&E 图像块预测局部基因表达 HEST-Benchmark:预测 50 个高变基因,逐基因 Pearson r 评价
肿瘤微环境空间解析 定位肿瘤-间质-免疫空间结构 7,640 万细胞核实例(5 类)+ 表达矩阵联合分析
分子标志物空间定位 将通路/标志物活性映射到形态区域 表达矩阵按 spot/bin 与 patch 一一对应
生存与分子分型建模 以空间表达/形态特征预测预后或亚型 样本级聚合特征 + 患者级标签(来自原研究)
跨平台批次校正 消除 4 类 ST 平台的系统性差异 平台标签(ST/Visium/Visium HD/Xenium)+ 队列标签

操作化要点:上表前两行是本库支撑最充分的任务——前者有官方基准协议背书(§8.1),后者有细胞核实例与表达矩阵的双层数据结构支撑;后三行属于"可行但需自建协议"的范畴,划分与评价指标的责任在使用方(见 §5)。

与临床工作流的衔接:上表任务在真实课题中往往串联出现——先做跨平台批次校正(坑点 3),再做肿瘤微环境区域量化,最后以形态→表达回归做迁移评测;本条目 §6 的代码顺序即按此工作流组织。需要强调的是,前两步的输出属于研究性特征,不构成任何诊断输出;进入临床路径前的前瞻验证责任不因数据集规模而减轻。

§2.5 患者人群与样本构成

维度 构成 备注
物种 2 个(人、小鼠) brain(211 样本)与 spinal cord(318 样本)多为小鼠组织
癌症样本 367 个 / 1,229(约 30%) 覆盖 25 种癌种
非癌样本 其余约 862 个 正常组织或非癌疾病组织
来源队列 153 个独立队列 逐样本提供 license 元数据
器官 26 个 乳腺、肺、结直肠、前列腺、胰腺、皮肤、肾、脑、脊髓等

人群层面的两点提醒:其一,库内 patient_id 覆盖不均,个别癌症队列的患者数远小于切片数(最极端者如 PRAD 队列 23 张切片仅来自 2 名患者),任何"样本数"都不能直接当"独立个体数"使用;其二,物种混杂意味着人源临床模型建模前必须过滤物种,否则小鼠脑/脊髓样本(合计 529 个)会显著稀释人源肿瘤信号。

流行病学表述边界:本库是研究队列聚合而非人群抽样,不能用于估计任何癌种的患病率或发病率;各队列的入排标准、分期构成与染色方案继承自原研究,跨队列的"人群差异"实际混杂了研究设计差异(见 §7.1)。

队列构成形态速览:

队列形态 库内实例 建模影响
产业界批量队列 Owkin 提供的批量临床队列(293 个样本) 单一来源主导分布,需按 dataset_id 做敏感性分析
极小患者池队列 个别癌症队列 23 张切片仅来自 2 名患者 防泄漏划分必须按 patient_id(坑点 1)
大宗小鼠队列 brain(211)与 spinal cord(318) 人源任务前置过滤物种(坑点 4)

§2.6 临床决策价值与参考标准

在临床决策链路中,HEST-1k 定位为研究与转化工具的数据底座,而非直接的临床诊断参考标准:其表达定量真值继承自各平台(Visium/ST/Xenium 等)的原始研究产出,图像为常规 H&E 扫描,配准与核分割均为自动算法产物。使用时应注意三点:表达"真值"的平台间不可直接互比(分辨率与捕获效率不同,见 §3.1);细胞核分割参考标准是 CellViT(DETR 架构、PanNuke 预训练)的自动预测,并非病理医师逐核标注的金标准;个别样本的图像-表达配准存在漂移可能,官方建议以可视化目录(patches_vis)与像素密度字段(pixel_size_vis)复核(见 §6.5 坑点 7)。临床场景中的任何诊断级应用,仍需前瞻性临床验证与病理医师复核。

参考标准的三层替换策略:以本库做方法研究时,建议把"参考标准"按用途分层——表达真值仅用于训练与离线评测;核分割伪标注仅作规模化形态摘要与弱监督信号;涉及诊断结论(如分子分型)时,参考标准必须替换为原研究的临床检测(靶向 panel、IHC 等),本库数据仅作辅助证据。这一分层是本页对"AI 就绪"的边界定义:数据就绪不等于结论就绪。

§3 数据集规格

§3.0 版本抉择矩阵

版本 样本数 发布时点 适用场景
arXiv v1(2024-06-23) 1,108 论文初版 复现早期论文结果;1.5M pairs / 约 6,000 万核
HF v1.1.0(2024-09-23) 1,229 NeurIPS 定稿口径 主流引用口径:+121 样本(27 Xenium、7 Visium HD)
HF v1.2.0(2026-01-06) 约 1,256 Visium HD 扩展 需要更多 Visium HD 高分辨样本时
HF v1.3.0(2026-02-08) 1,276 最新全量(截至 2026-02) 新项目默认;+18 Xenium(含 Xenium 5k 高通量)

选版建议:写论文引用规模数字时,以 NeurIPS 定稿的 1,229 为准(与审稿通过的论文口径一致);跑基准时注意 HEST-Benchmark 任务与库版本解耦,以 benchmark 仓库当前快照为准;只有确实需要最新平台样本(Xenium 5k、Visium HD 扩充)时才升级到 v1.3.0,并注意其样本数(1,276)已超出论文口径,引用时需注明版本与访问日期。

版本固定的工程做法:复现实验时把三个标识写入实验配置并随产物归档——库版本(HF revision)、元数据 TSV 行数指纹(1,229 或 1,276)、benchmark 仓库 commit hash。三者齐备时,"样本集合漂移"类争议可以一条命令定责;缺失任何一个,跨团队复现都会退化为"你们的 1,229 和我们的 1,229 不是同一个集合"的争论(对应 §6.10 数据指纹实践)。

§3.1 空间平台构成与分辨率层次

平台 表达分辨率 库内处理方式
原代 ST(Legacy ST) 约 100 µm spot 直接作为表达单元
10x Visium 55 µm spot(center/spot 两种取值模式) YOLOv8 检测 fiducial 帧 + 仿射配准
10x Visium HD 2 µm 亚 spot 分辨 以 bin 聚合后入库,样本量自 v1.1.0 起逐步增加
Nanostring Xenium 近单细胞 VALIS 配准;转录本聚合为 55×55 µm pseudo-bins 以对齐 Visium

平台混杂的双刃性:4 类平台使 HEST-1k 成为跨平台方法学的天然试验场(批次校正常用 MNN/Harmony/ComBat),但也意味着表达矩阵不具备跨平台直接可比性——spot 大小(100 µm vs 55 µm)、捕获 panel(全转录组 vs panel 靶向)与 UMI 计数分布均有系统差异。任何跨平台合并训练都应显式建模平台协变量,或至少按平台分层评估(见 §6.5 坑点 3)。

Xenium 的特殊地位:Xenium 样本除 pseudo-bin 表达矩阵外,还附带单分子级转录本坐标(transcripts/,配准到 H&E 坐标系),是库内唯一支持"单分子—单细胞—形态"三层对齐的子集;需要亚细胞分辨率的用户应优先筛出 st_technology 为 Xenium 的样本(见 §4.5)。

分辨率的三层读法:谈"分辨率"时先区分三层——表达分辨率(spot/bin 尺寸,决定表达单元语义)、图像分辨率(µm/px,决定形态细节)、对齐分辨率(配准误差,决定形态与表达映射的松紧):

层次 由什么决定 库内字段/口径 典型误区
表达分辨率 平台(ST/Visium/HD/Xenium) st_technology 以为统一重采样能抹平 spot 语义差异
图像分辨率 扫描仪与物镜倍数 pixel_size_vis(µm/px) 把 patch 内插值当成真实光学分辨率
对齐分辨率 配准流水线(YOLOv8/VALIS) patches_vis 复核 假设配准误差为零直接做核级对齐

§3.2 样本量拆分

子集 样本数 说明
全库(NeurIPS 定稿口径) 1,229 每样本 = 1 个 ST 样本 + 1 张配对 H&E WSI
癌症样本 367 覆盖 25 种癌种
非癌样本 约 862 正常/非疾病组织为主
spinal cord 318 多为小鼠
brain 211 多为小鼠;两器官合计 529 个样本

解读:去除脑与脊髓后的人源实体肿瘤/正常组织样本约 700 个,这才是多数临床转化研究的有效池子;按 25 个癌种摊薄,单癌种样本量普遍在几十到上百之间,训练大模型偏少,做评测与微调更合适。另需注意 arXiv v1 口径(1,108 样本 / 131 队列)与定稿口径(1,229 / 153)的差异,引用时务必注明版本。

版本-平台增量对照(官方变更说明口径):

版本节点 平台增量
v1.1.0(2024-09-23) +27 Xenium、+7 Visium HD
v1.2.0(2026-01-06) +27 Visium HD
v1.3.0(2026-02-08) +18 Xenium(含 Xenium 5k 高通量)

§3.3 数据格式详情

数据对象 格式 说明
H&E 全切片 Pyramidal TIFF 体积超过约 4.1 GB 者采用 BigTIFF
表达矩阵 AnnData(.h5ad) X 表达计数 + obs/var 注释 + 空间坐标
patch 张量与坐标 HDF5(.h5) coords / patch_size / pixel_size / inst_coords
组织分割 掩膜文件(tissue_seg/) 基于图像的组织区域掩膜
细胞核分割 cellvit_seg/(zip 打包,需解压) CellViT 输出的核实例
单分子转录本 Parquet(transcripts/,Xenium) 含 he_x / he_y(配准到 H&E 坐标系)
样本级元数据 TSV(hest-1k_metadata) 1,229 行,字段见 §4.1

格式选型含义:全库没有"一个大文件",而是逐样本对象 + 一张主元数据表的组合——这意味着子集化成本极低(按元数据筛 sample_id 后按需拉取),但也要求使用方自己维护"哪些样本已下载、哪个版本"的清单(对应 §6.10 的数据指纹实践)。

坐标系备忘:库内三套坐标——WSI 像素坐标(patch 坐标所在)、spot/bin 阵列坐标(h5ad 的 obsm["spatial"])、Xenium 分子坐标(he_x/he_y)——均定义在配准后的 H&E 帧上:

坐标系 载体 原点与单位 典型用途
WSI 像素坐标 patches/*.h5 的 coords 图像左上角,像素 patch 读取、空间聚合
阵列坐标 h5ad 的 obsm[“spatial”] 配准后 H&E 帧,像素 表达矩阵空间统计
分子坐标 transcripts/ 的 he_x/he_y 配准后 H&E 帧,像素 亚细胞表达定位

三套坐标跨样本不可直接比较;多样本 pooled 分析前先确认所有坐标处于同一帧、同一缩放级别,这是聚合分析中最静默的一类错误源。

§3.4 存储大小

全量数据集超过 1 TB(Hugging Face 页面口径);若计入全部衍生文件(组织分割、核分割、转录本),GitHub 官方 README 给出的口径超过 2 TB。实际所需磁盘取决于下载范围:只取表达矩阵与 patch 坐标(不含原 WSI)可将占用压缩一个数量级以上,推荐用 Hugging Face 的按文件过滤下载;克隆式整仓拉取前务必确认磁盘配额(见 §6.5 坑点 6)。

下载范围 大致构成 相对体量
元数据 TSV 1,229 行主表 忽略不计
st/ + patches/ 表达矩阵 + patch 坐标(不含图像) 全库的小头(数十 GB 级)
wsis/ 金字塔 TIFF 原图 体量主力(>1 TB 的主要来源)
cellvit_seg/ + tissue_seg/ + transcripts/ 衍生掩膜与单分子数据 单个 Xenium 样本的 Parquet 可达数 GB

上表相对体量为工程经验估计(官方未逐目录披露字节数),仅用于规划下载顺序,不作为精确配额依据。

§3.5 标注方式

HEST-1k 的"标注"是自动算法流水线产物 + 原研究继承的混合体,无逐样本人工新标注环节。按信号来源分三类:

标注类型 生成方式 覆盖范围 可靠性定位
细胞核实例 CellViT 自动分割(DETR 架构、PanNuke 预训练),5 类核:肿瘤上皮、淋巴细胞、基质、坏死、其他 全部 1,229 个样本 伪标注,可大规模使用
图像-表达配准 Visium:YOLOv8 检测 fiducial 后仿射配准;Xenium:VALIS 框架 全部样本 自动产物,需抽查
疾病与元数据标签 organ、disease_state、oncotree_code、patient_id 继承自 153 个来源研究 全部样本 质量取决于原研究

三类标注的可靠性排序是:疾病元数据 > 图像-表达配准 > 细胞核实例——与直觉相反,最"贵"的核级信息反而是伪标注,最"便宜"的元数据反而最可靠。据此排布下游信任边界:元数据可直接用于分层筛选;配准结果须抽查后使用(坑点 7);核实例只作弱监督或探索性信号,不进任何定量结论。

§3.6 标注者资质与一致性

本库没有传统意义上需要统计"标注者间一致性"(如 Cohen’s kappa)的人工标注环节,因此"标注者资质"在此等价于"算法资质与数据血缘":CellViT 在 PanNuke 数据集上训练,分割质量在核形态清晰的组织上可靠,但在坏死、挤压、模糊区域会出现实例合并或漏检——把它当"伪标注"使用比当"金标准"更稳妥;配准环节的 YOLOv8 定位点检测在标准 Visium 芯片上高度可靠,非标准布局或切缘破损样本是主要失效场景;疾病标签的"标注者"是 153 个原研究的病理与生信团队,水平与口径不一,跨队列比较标签时须保持谨慎。关键结论建议对核分割与配准做抽样人工复核(§6.5 坑点 7)。

§3.7 数据采集时间范围

官方样本级元数据未统一记录各样本的原始采集日期——这 1,229 个样本分别来自 153 个发表研究/队列,其采集时间分散于各原论文,且多数未随数据一同迁移入库。进行时间趋势分析或"训练-未来测试"式时序划分前,需回溯各来源文献确认采集窗口,或退而使用队列级(dataset)划分替代时间划分(见 §5)。

工程替代方案是把"时间轴"换成"版本轴":用样本首次入库的 HF 版本号(v1.1.0/v1.2.0/v1.3.0)构造粗粒度时序切分,可在一定程度上模拟"训练早于测试"的时间隔离——但注意这只反映入库时间而非采集时间,两者在多中心聚合数据里可能严重错位。

§3.8 地理与机构覆盖

数据来源为 153 个公开研究的队列集合,横跨多个国家的学术机构与产业界(如 Owkin 提供的批量临床队列);官方元数据逐样本记录了来源数据集(dataset_id)与许可(license),但未提供标准化的地理字段。复现或引用具体队列时,应以 dataset_id 回查原始出版物的机构信息为准。地域信息缺失带来的偏倚讨论见 §7.1。

需要地域分层的研究,可按 dataset_id 聚合后回查各来源论文的机构署名,构建"地域代理变量",并在论文方法学部分明示其为编辑侧重建、非官方字段;代理变量仅用于敏感性分析,不宜作为因果推断依据。

§3.9 采集设备规格

扫描倍数 MPP(µm/px)范围 典型用途
10x 1.15-0.8 组织学全景、粗粒度区域识别
20x 0.8-0.4 常规病理判读分辨率
40x 0.4-0.1 核级细节(基准 patch 0.5 µm/px 落在此档内)

库内 WSI 的扫描倍数与 MPP 逐样本不同(记录于元数据与切片内部),基准统一在 0.5 µm/px 下重采样 patch。值得警惕的是分辨率重采样的可行性并非处处成立:Owkin 队列 293 个样本中仅 156 个可稳定重采样至 0.4-0.6 MPP 区间(见 §6.5 坑点 2)。

MPP 的逐样本复核建议纳入下载后的固定动作:从元数据或切片内部读取 pixel_size_vis,对超出 0.4-0.6 µm/px 区间的样本先行剔除或单列报告,再进入基准流程——成本是几行代码,收益是避免整场实验被少数异常分辨率样本拖偏(坑点 2)。

§3.10 深度溯源链

每个样本的溯源链条为:

sample_id → dataset_id(153 个来源队列之一)→ 原始发表文献 / GEO 等公共存储 → 原始平台运行与试剂批次(随原研究记录)

官方仓库在论文与 README 中给出了来源队列清单;需要试剂、扫描仪型号等更细颗粒溯源信息时,一般要回到原论文附录。这种"二级溯源"设计是聚合型数据集的通例——本库保证的是处理过程(配准、分割、patch 化)的透明可复现,而非原始采集过程的全要素记录。license 字段把合规溯源下沉到逐样本粒度,是同类聚合库中少见的优点(见 §9.3 引用指南)。

使用者的溯源动作清单:拿到一个 HEST 子集时,三步建立自己的溯源记录——

  • 记录 HF revision 与下载日期,写进实验配置;
  • 导出所用 sample_id 清单并留存行数指纹;
  • 按 dataset_id 把需引用的原队列文献列入参考文献。

三步做完,"用的哪个版本、哪些样本、来自哪些研究"都有了硬凭据,引用与审计不再依赖记忆。

§4 数据结构与字段字典

§4.0 目录结构总览

HEST-1k/
├── wsis/                        # 配对 H&E 全切片(pyramidal TIFF;>4.1 GB 为 BigTIFF)
├── st/                          # 空间表达矩阵(.h5ad,每样本一个)
├── patches/
│   ├── patches_wsi_0.5_224/     # 0.5 µm/px、224 px patch(.h5)
│   │   └── <sample_id>.h5       #   coords / patch_size / pixel_size / inst_coords
│   └── patches_vis/             # 配准叠加可视化(复核漂移用)
├── tissue_seg/                  # 组织分割掩膜
├── cellvit_seg/                 # CellViT 核分割(zip 打包,需解压后使用)
├── transcripts/                 # Xenium 单分子转录本(parquet,含 he_x/he_y)
└── hest-1k_metadata.tsv         # 样本级元数据主表

读取顺序建议:先读元数据 TSV 圈定子集 → 按需拉取对应 st/*.h5ad 与 patches/*.h5 → 只有在需要重新 patch 化或核级分析时才动 wsis/ 与 cellvit_seg/。

目录树的三个工程事实:其一,patches_wsi_0.5_224/ 的命名编码了 patch 化参数(0.5 µm/px、224 px),未来出现其他规格目录可按同一命名法识别;其二,cellvit_seg/ 以 zip 分发是对海量小文件的传输优化,解压后按 sample_id 对齐(坑点 6);其三,transcripts/ 仅 Xenium 样本存在,按平台条件访问可省大量无效扫描。

§4.1 DAIMS 标准化字段描述表

核心表:样本级元数据(hest-1k_metadata,1,229 行 × 数十列,以下为建模核心字段)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
sample_id 字符串 样本唯一主键 TENX95 索引、文件名对齐 无(主键) 不适用 全库唯一
dataset_id 字符串 来源队列标识 NA(按队列命名) 队列级分组划分 继承原研究 不适用 153 个队列
patient_id 字符串 患者标识 随队列而异 患者分层防泄漏 部分队列未提供 空值(需与"单患者队列"区分) 队列内唯一
organ 字符串 器官名称 breast 分层评估、器官过滤 依赖原研究注释 理论上不缺失 26 个器官
oncotree_code 字符串 OncoTree 癌种码 BRCA 癌种分层 仅癌症样本有 空值 = 非癌样本(信息性) 25 个癌种 + 空
st_technology 字符串 ST 平台类型 visium 平台协变量、分层 不适用 不缺失 ST/Visium/Visium HD/Xenium 等
disease_state 字符串 疾病状态标签 tumor 阳性/阴性分层 继承原研究 以原研究口径为准 tumor/normal 等
license 字符串 逐样本许可 CC BY-NC-SA 4.0 等 合规审查 不适用 理论上不缺失 逐队列而异
pixel_size_vis 数值 配准后像素密度 0.5 配准质量校验 依赖扫描元数据 个别样本缺失 µm/px
st_id 字符串 原始 ST 运行标识 随队列而异 回溯原始数据 不适用 部分缺失 队列内唯一

DAIMS 视角速评:主键(sample_id)与文件系统严格对齐是本库的强项;patient_id 与 pixel_size_vis 的缺失属于信息性缺失——前者缺失常意味着该队列患者信息未公开(而非只有一个患者),后者缺失常与配准疑难样本共存,两者都不能简单用均值或前向填充。

字段消费优先级速查(建模侧与合规侧分列,均不进入模型输入):

字段 消费方 用途
sample_id 建模 主键索引、文件对齐
organ / st_technology / disease_state 建模 分层与协变量
patient_id 建模 防泄漏分组
oncotree_code 建模 癌种分层
license / dataset_id 合规 许可审计、溯源
pixel_size_vis / st_id 审计 质量复核与回溯

§4.2 标签分布

标签维度 分布要点 建模含义
器官(organ) brain 211、spinal cord 318 合计占约 43%,其余 24 个器官分摊约 700 个样本 过滤脑/脊髓后再做器官分层才均衡
癌种(oncotree_code) 25 种癌种共 367 个样本,长尾分布 单癌种训练量不足,宜评测/微调
物种 人、小鼠各占一部分,小鼠集中于脑与脊髓 人源任务先过滤物种
平台(st_technology) Visium 系为主体;Xenium 与 Visium HD 自 v1.1.0 起分批扩容(Xenium:v1.1.0 +27、v1.3.0 +18;Visium HD:v1.1.0 +7、v1.2.0 +27) 平台分层评估,避免大平台主导
疾病状态(disease_state) tumor/normal 等,继承原研究口径 阳性/阴性比例不可跨队列比较

提示:上表只列编辑有来源支撑的分布事实;未披露精确计数(如逐平台样本总数、逐癌种样本数)的维度,请在下载元数据后用一行 value_counts() 复算,本页不编造具体数字(复算代码见 §6.1)。

分布不均的对策对照:器官头重(脑/脊髓约占 43%)→ 人源任务先过滤物种与器官;癌种长尾(367 样本摊 25 类)→ 单癌种只做评测或线性探针;平台不均衡 → 分平台报告指标。三者共享同一原则:先切分层再谈平均,"全库平均 Pearson r"只在同平台、同版本内可解释(坑点 3)。

§4.3 关键统计与 patch 对象结构

全库四个"量级锚点":1,229 个配对样本、210 万 expression-morphology pairs、超 7,640 万细胞核实例(均值约 62,100 个/切片)、112×112 µm @ 0.5 µm/px 的统一 patch 规格。每个样本的 patch 包是一个 HDF5 文件,四组核心数据:

import h5py

with h5py.File("patches/patches_wsi_0.5_224/TENX95.h5", "r") as f:
    coords = f["coords"][:]           # (N, 2):每个 patch 左上角像素坐标
    patch_size = f["patch_size"][()]  # 单个 patch 边长(px),如 224
    pixel_size = f["pixel_size"][()]  # µm/px,如 0.5
    inst_coords = f["inst_coords"][:] if "inst_coords" in f else None
    # inst_coords:CellViT 细胞核实例坐标(N × max_cells × 5),
    # 含核轮廓在 patch 内的坐标与类别,是形态-表达对齐的关键
print(coords.shape, patch_size, pixel_size)

要点:patch 默认 224 px × 0.5 µm/px = 112×112 µm,与 Visium spot(55 µm)尺寸不同属设计预期——patch 覆盖 spot 邻域以容纳空间上下文;inst_coords 使每个 patch 携带核级形态摘要,是把"210 万 expression-morphology pairs"用起来的直接入口。

量级锚点表(与正文口径一致,供快速核对):

锚点 数值 口径
配对样本 1,229 NeurIPS 定稿(HF v1.1.0 起)
表达-形态配对 210 万 pairs 论文口径
细胞核实例 超 7,640 万(均值约 62,100/切片) CellViT 5 类核
patch 规格 112×112 µm @ 0.5 µm/px(224×224 px) 基准统一规格

升级库版本后样本数锚点会变(v1.3.0 为 1,276),引用时随版本号一并注明。

§4.4 数据层级

HEST-1k 的数据层级是"聚合库特有的五层结构",从粗到细为:

层级 标识符 一对一/一对多 对应文件
队列(cohort) dataset_id 1 队列 → 多样本 元数据 TSV 分组
样本(ST 样本) sample_id 1 样本 ↔ 1 张 WSI st/<id>.h5ad + wsis/<id>.tif
空间单元(spot/bin) spot 阵列坐标 1 样本 → 数千单元 h5ad 的 X 与 obsm[“spatial”]
补丁(patch) coords 行索引 1 spot 邻域 ↔ 1 patch patches/<id>.h5
细胞核(nucleus) inst_coords 实例 1 patch → 数十个核 inst_coords / cellvit_seg/

表达矩阵(.h5ad)的内部组织:

import anndata as ad

adata = ad.read_h5ad("st/TENX95.h5ad")
print(adata)                  # X: spot × gene 计数矩阵
print(adata.obs.columns)      # spot 级注释(含阵列坐标)
print(adata.obsm["spatial"].shape)  # 空间坐标,已配准到图像坐标系
print(adata.varm.keys())      # 基因侧注释(含高变基因标记)

层级使用原则:患者(patient_id)横跨队列与样本两层且部分缺失;防泄漏划分必须回到患者层(§5.3),而建模输入通常工作在 patch 层、监督信号来自 spot 层——三层语义不要混用。

跨层聚合的两条合法路径:patch → spot 聚合用于形态摘要(把 patch 特征平均到表达单元,注意一个 spot 邻域可能横跨多个 patch);spot → 样本聚合用于切片级表征(按组织区域加权 pooling)。跳层聚合(patch → 样本)应显式声明中间语义损失;无论哪条路径,聚合权重都建议用组织掩膜归一,避免背景区稀释信号。

§4.5 缺失值与信息性缺失编码

字段 缺失形态 缺失语义 处理建议
patient_id 空值 队列未公开患者映射,而非单患者队列 按 sample_id 分组并单独报告,禁止填充
oncotree_code 空值 非癌样本(信息性,正常语义) 癌症分析自动排除;勿当缺失值插补
pixel_size_vis 个别缺失 常与配准疑难样本共存 优先复核 patches_vis,其次剔除
st_id 部分缺失 部分队列未暴露原始运行号 回溯 dataset_id 对应原文献
transcripts/ 目录不存在 仅 Xenium 样本有单分子数据 按平台条件访问,勿盲扫(§6.5 坑点 6)

设计含义:本库的缺失几乎都是"结构性缺失"(平台差异、原研究披露差异),不是随机缺失——把缺失模式当特征或分层依据,往往比当噪音处理更有效。Xenium 单分子转录本(Parquet)中的 he_x/he_y 是已配准到 H&E 坐标系的分子坐标,配合核分割可在核内/核间聚合表达,实现单细胞级形态-表达分析。

与 DAIMS 第 5 项的呼应:DAIMS"缺失编码"检查项关注缺失是否可解释——本库的答案是把缺失写进语义(上表"缺失语义"列),而非机械填充。建议构建衍生特征表时遵循同一约定:每个可空字段附一句"空值意味着什么"的说明,这也是 §7.7 对该项给出 ✅ 的理由。

§5 数据划分与使用建议

§5.1 官方数据划分

HEST-1k 全库不提供官方 train/test 划分——它是一个资源库而非单任务竞赛集。官方提供的唯一结构化评测协议是 HEST-Benchmark:9 个任务(IDC、PRAD、PAAD、SKCM、COAD、READ、CCRCC、LUNG、LYMPH_IDC),统一预测 50 个高变基因,Ridge 回归 + PCA(256) 作为线性探针,逐基因 Pearson r 为指标,患者分层交叉验证防泄漏。因此,“官方划分"应理解为"官方基准协议”,自研任务的划分责任在使用方。

§5.2 推荐划分策略

  1. 患者级分组划分(默认):GroupShuffleSplit 或 GroupKFold,group = patient_id;患者缺失的队列按 sample_id 分组并单独评估。
  2. 队列级留出(leave-one-cohort-out):以 dataset_id 为组做交叉验证,检验跨研究泛化——153 个队列天然构成强域偏移。
  3. 平台分层评估:至少报告 Visium 与 Xenium 两个平台的分平台指标,避免平台混杂掩盖模型缺陷。
  4. 物种过滤:人源临床任务先剔除 brain/spinal cord 小鼠样本(合计 529 个),再划分。
  5. 复现基准:严格使用 benchmark 仓库的任务定义与划分脚本,不要重造 50 HVG 集合。
import pandas as pd
from sklearn.model_selection import GroupKFold

meta = pd.read_csv("hest-1k_metadata.tsv", sep="\t")
meta = meta[meta["organ"] != "brain"]          # 视任务剔除小鼠主导器官
groups = meta["patient_id"].fillna(meta["sample_id"])  # 缺患者按样本分组
gkf = GroupKFold(n_splits=5)
for tr, te in gkf.split(meta, groups=groups):
    assert set(groups.iloc[tr]) & set(groups.iloc[te]) == set()
    # 在此训练/评估,患者级零泄漏

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按切片划分而患者跨 train/test(如 PRAD 队列 23 切片仅 2 患者) 高 一律以 patient_id 分组划分
2 同队列样本同时出现在 train/test(研究间批次相关) 中 leave-one-cohort-out 或按 dataset_id 留出
3 人源训练集混入小鼠样本学得"伪形态-表达映射" 中 建模前按 organ + 物种过滤
4 用全基因集重选 HVG 后与榜单比较 高 锁定官方 50 HVG 集合与预处理

为什么患者级划分是底线:同一患者的相邻切片在染色、扫描与组织学背景上高度相关,模型只需记住患者级"签名"即可在测试集得分;患者分层后仍能拿到的增益,才是真正的形态-表达映射能力。官方基准把患者分层写进协议,正因如此。

§5.4 交叉验证与外部验证建议

交叉验证建议采用嵌套结构:外层 leave-one-cohort-out 估计跨研究泛化,内层患者级 GroupKFold 调参。外部验证的首选对象是 HEST-Benchmark 官方榜单(含截至 2026-04-03 评估的 25 个公开模型,CONCH/UNI/GigaPath/Virchow 2/H-Optimus-0/Remedis/ResNet50 等)——先复现榜单上与自研模型最接近的基线,再引入自建外部队列(如自家机构切片 + 定制 panel)做迁移测试;跨平台外推(Visium 训练 → Xenium 测试)应作为独立实验报告,不与平台内指标混平均。

§6 AI 就绪指南

§6.0 环境准备与快速启动

# Python 3.10+ 环境
pip install h5py anndata huggingface_hub pandas scikit-learn pyarrow

# 登录 Hugging Face(gated 数据集,首次需在网页接受使用条款,批准为自动)
huggingface-cli login
# 只拉取元数据 + 表达矩阵 + patch 坐标(不拉 >1 TB 的原 WSI)
from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="MahmoodLab/hest", repo_type="dataset",
    allow_patterns=["*.tsv", "st/*.h5ad", "patches/patches_wsi_0.5_224/*.h5"],
    local_dir="hest",
)

磁盘策略:全量超过 1 TB(HF 口径,含衍生文件超 2 TB),先拉元数据与轻量对象、按需扩量,是唯一理智的启动方式(见坑点 6)。

§6.1 快速上手:加载一个配对样本

import pandas as pd
import anndata as ad
import h5py

meta = pd.read_csv("hest/hest-1k_metadata.tsv", sep="\t")
print(meta["organ"].value_counts())            # 复算 §4.2 标签分布
sid = meta.loc[meta["organ"] == "breast", "sample_id"].iloc[0]

adata = ad.read_h5ad(f"hest/st/{sid}.h5ad")    # 表达矩阵 + 空间坐标
with h5py.File(f"hest/patches/patches_wsi_0.5_224/{sid}.h5", "r") as f:
    coords = f["coords"][:]                    # patch 左上角像素坐标
    n_patches, ps, mpp = len(coords), f["patch_size"][()], f["pixel_size"][()]
print(sid, adata.shape, n_patches, ps, mpp)
# 典型输出:一个 Visium 样本 ≈ 数千 spot × 2 万余基因,patch 数与 spot 数同量级

§6.2 数据获取流程

  1. 在 Hugging Face 数据集页(MahmoodLab/hest)登录并接受使用条款(gated,自动批准)。
  2. 生成具有 read 权限的 access token,huggingface-cli login 注入本地。
  3. 用 snapshot_download 的 allow_patterns / ignore_patterns 分批拉取:第一批元数据 TSV;第二批 st/ + patches/;第三批按需 wsis/(体量主力)与 cellvit_seg/(zip)、transcripts/(仅 Xenium)。
  4. 解压 cellvit_seg/*.zip;用 patches_vis/ 抽查配准叠加图。
  5. 记录所拉取的库版本与访问日期(当前最新 v1.3.0 为 1,276 样本,截至 2026-02)。

§6.3 预处理 Pipeline

# 从 patch 坐标 + WSI 切出图像张量(核心步骤)
import openslide, numpy as np, h5py

slide = openslide.OpenSlide("hest/wsis/TENX95.tif")
with h5py.File("hest/patches/patches_wsi_0.5_224/TENX95.h5", "r") as f:
    coords, ps = f["coords"][:], int(f["patch_size"][()])
    mpp = float(f["pixel_size"][()])
    down = mpp / float(slide.properties[openslide.PROPERTY_NAME_MPP_X])

lvl = slide.get_best_level_for_downsample(down)
def read_patch(x, y):
    im = slide.read_region((x, y), lvl, (ps, ps)).convert("RGB")
    return np.array(im)
batch = np.stack([read_patch(x, y) for x, y in coords[:256]])  # (256,224,224,3)

流程要点:① 元数据筛选子集 → ② 组织掩膜剔除空白(tissue_seg)→ ③ 按 0.5 µm/px 目标重采样(注意逐样本 MPP 不同,见坑点 2)→ ④ 读取/重切 patch → ⑤ 对齐 inst_coords 取核级特征 → ⑥ 表达侧 norm + log1p(自行决定归一化策略并保持全库一致)。官方 Python 包 hest 已封装 patch 化与 dataset 类,生产环境建议优先使用(见 §6.4)。

§6.4 框架加载(PyTorch Dataset 与官方 hest 库)

自建 Dataset 的最小实现:

import torch, h5py, anndata as ad
import numpy as np
from torch.utils.data import Dataset

class HESTSample(Dataset):
    """单样本内 patch 级数据集:X 图像 + y 表达(log1p 后 50 HVG)"""
    def __init__(self, sid, gene_list, transform=None):
        self.h5 = h5py.File(f"patches/patches_wsi_0.5_224/{sid}.h5", "r")
        self.coords = self.h5["coords"][:]
        adata = ad.read_h5ad(f"st/{sid}.h5ad")
        y = adata[:, gene_list].to_df().values       # (n_spots, 50)
        self.y = torch.tensor(np.log1p(y), dtype=torch.float32)
        self.transform = transform

    def __len__(self): return len(self.coords)
    def __getitem__(self, i):
        x = read_patch(*self.coords[i])              # 见 §6.3
        if self.transform: x = self.transform(x)
        return x, self.y[i]

更推荐直接使用官方 hest 库(封装了读取、patch 化、配准与基准协议):

# 安装:git clone https://github.com/mahmoodlab/HEST && cd HEST && pip install -e .
# 基准复现另需:pip install -e ".[benchmark]"(系统依赖 libvips/libvips-dev、openslide-tools)
# 可选 GPU 加速:cucim-cu12==24.4.0;官方仅测试于 Linux/macOS
from hest import iter_hest

for hd in iter_hest("hest/", id_list=["TENX95", "TENX96"]):
    print(hd.meta["sample_id"], hd.adata.shape)
    # HESTData 对象聚合 adata(表达+坐标)、img(配对 WSI)、pixel_size、meta

# 其他高频 API:segment_cellvit(wsi_path, name) 重跑核分割;
# autoalign_visium(fullres_img) 自动配准;correct_batch_effect(adata_list, batch) 批次校正;
# unify_gene_names / ensembl_id_to_gene 基因名统一;pool_transcripts_xenium / pool_bins_visiumhd 聚合

§6.5 常见坑点

⚠️ 坑点 1:把切片数当患者数——患者级泄漏(分类:数据泄漏)

问题:库内按 ST 样本(切片/组织)计数,患者数远少于样本数。最极端的 PRAD 队列 23 张切片仅来自 2 名患者;直接随机划分会让同一患者的切片横跨 train/test,指标虚高。
症状:测试集 Pearson r / 分类 AUC 好得反常;同一患者 ID 在训练与测试列表中同时出现。
解决:

  1. 简单方法:以 patient_id 为 group 做 GroupShuffleSplit / GroupKFold,划分后断言患者集合零交集。
  2. 进阶方法:患者缺失的队列以 sample_id 分组并单独报告;跨患者样本聚合到患者级再评估,双口径报告。
  3. SOTA 方法:外层 leave-one-cohort-out(153 队列)+ 内层患者级 CV 的嵌套验证,同时估计域泛化与患者泛化。
    参考:https://github.com/mahmoodlab/HEST(sample metadata 与 issues);HEST 论文基准协议(arXiv:2406.16192)。

⚠️ 坑点 2:逐样本 MPP 不一致,统一重采样并非处处可行(分类:预处理陷阱)

问题:WSI 扫描倍数从 10x 到 40x(1.15-0.1 MPP)不等,基准统一 0.5 µm/px;但 Owkin 队列 293 个样本中仅 156 个可稳定重采样至 0.4-0.6 MPP 区间。
症状:部分样本 patch 内组织过糊或过锐;read_region 后尺寸与预期不符;跨队列特征分布漂移。
解决:

  1. 简单方法:读取每样本 pixel_size(或切片 MPP 属性),按 mpp_source / 0.5 计算 downsample 后再切图。
  2. 进阶方法:对 0.4-0.6 MPP 区间外的样本先上/下采样到目标 MPP 再 patch 化;无法稳定重采样者显式剔除并报告清单。
  3. SOTA 方法:在数据加载层实现连续 MPP 归一(stain-aware resize + 校验图),并对每个 batch 记录实际 MPP 直方图做监控。
    参考:https://github.com/mahmoodlab/HEST(Owkin 队列讨论);arXiv:2406.16192。

⚠️ 坑点 3:四类 ST 平台混杂的批次效应(分类:偏倚陷阱)

问题:原代 ST(约 100 µm spot)、Visium(55 µm)、Visium HD、Xenium 的 spot 尺寸、捕获 panel 与 UMI 分布系统性不同;跨平台合并训练会把"平台差异"学成"形态-表达映射"。
症状:模型在混合平台上训练后,分平台评估指标差异巨大;批次校正后聚类按平台而非按组织分群。
解决:

  1. 简单方法:单平台内训练评估;跨平台只做定性对比。
  2. 进阶方法:以 st_technology 为协变量做平台分层 CV;表达侧 Harmony/MNN/ComBat 校正后比较。
  3. SOTA 方法:平台对抗解耦或平台条件化(platform-conditional head)建模,报告"平台内 + 留一平台外"双指标。
    参考:arXiv:2406.16192(批次校正讨论)。

⚠️ 坑点 4:物种混杂——人源模型被小鼠样本稀释(分类:偏倚陷阱)

问题:brain(211 样本)与 spinal cord(318 样本)多为小鼠组织,与人体临床队列的形态和表达分布差异显著。
症状:人源肿瘤任务加入全库训练后指标下降;器官分层评估发现脑/脊髓组异常。
解决:

  1. 简单方法:建模前按 organ 过滤掉 brain/spinal cord(或按原研究确认物种字段)。
  2. 进阶方法:以物种/器官做分层评估并分组报告;小鼠子集单独作为跨物种泛化实验。
  3. SOTA 方法:物种自适应(domain-adaptive)骨干 + 人源微调头,显式建模跨物种偏移。
    参考:arXiv:2406.16192(物种与器官统计)。

⚠️ 坑点 5:计数稀疏与 50 HVG 锁定——标签侧的理解偏差(分类:标签理解)

问题:ST 计数矩阵高度稀疏(spot UMI 上限 + drop-out);官方基准的标签是锁定的 50 个高变基因,不是全基因集也不是自选 HVG。
症状:自选 HVG 后与官方榜单不可比;用原始计数直接回归被极端值主导;稀疏 spot 的预测噪声巨大。
解决:

  1. 简单方法:沿用官方 50 HVG 集合;表达侧 norm + log1p 后再回归。
  2. 进阶方法:过滤低 UMI spot/低表达基因后重训,同时报告过滤前后指标;对 spot 质量字段加权。
  3. SOTA 方法:以零膨胀/负二项式损失或 count-aware 头处理稀疏计数,与线性探针并行报告。
    参考:arXiv:2406.16192(benchmark 协议);https://github.com/mahmoodlab/HEST。

⚠️ 坑点 6:下载工程:>1 TB、gated、zip 与 BigTIFF(分类:工程陷阱)

问题:全量超 1 TB(含衍生超 2 TB);gated 需先接受条款并用 HF token;cellvit_seg 以 zip 分发需解压;多数 WSI 超 4.1 GB 采用 BigTIFF,老版本 openslide 可能打不开。
症状:下载中断反复重启;cellvit_seg 目录下找不到掩膜;openslide 报 “unknown format” 或内存耗尽。
解决:

  1. 简单方法:snapshot_download + allow_patterns 分批拉取;升级 openslide 到支持 BigTIFF 的版本。
  2. 进阶方法:只拉 st/ + patches/ + 元数据起步;用 resume_download 与带宽限制并行断点续传。
  3. SOTA 方法:对象存储 + 清单化缓存(按 sample_id 索引),训练时流式读取 WSI pyramid 层级而非整片载入。
    参考:https://huggingface.co/datasets/MahmoodLab/hest ;https://github.com/mahmoodlab/HEST。

⚠️ 坑点 7:图像-表达配准漂移(分类:预处理陷阱)

问题:自动配准(Visium:YOLOv8 fiducial + 仿射;Xenium:VALIS)在少数样本上会漂移,patch 与 spot 错位会让形态-表达监督信号系统性错配。
症状:叠加可视化(patches_vis)中 patch 框偏离组织/spot;个别样本指标显著离群;pixel_size_vis 异常。
解决:

  1. 简单方法:抽看 patches_vis/ 叠加图;核对元数据 pixel_size_vis 是否异常。
  2. 进阶方法:写脚本批量检测(patch 内组织掩膜覆盖率 + spot 邻域表达一致性),对低分样本人工复核或剔除。
  3. SOTA 方法:对可疑样本用交互式配准工具重配(手动 fiducial 或互信息优化),并把重配结果贡献回社区。
    参考:https://github.com/mahmoodlab/HEST(配准校验讨论);arXiv:2406.16192。

⚠️ 坑点 8:评估误用——HVG 更换、无患者分层、跨任务平均(分类:评估误用)

问题:自行更换 HVG 集合、按样本划分、或把 9 个任务的指标简单平均,都会让结果与官方榜单和文献不可比,甚至系统性虚高。
症状:复现数字对不上官方榜单(截至 2026-04-03 已评估 25 个公开模型);论文评审被质疑协议不一致。
解决:

  1. 简单方法:完全沿用 benchmark 仓库的 50 HVG、patch 规格(112×112 µm @ 0.5 µm/px)与患者分层 CV。
  2. 进阶方法:自定义任务时显式声明划分与指标,并在附录给出与官方协议的差异对照表。
  3. SOTA 方法:提交官方榜单复核;按任务/平台/器官分维度报告指标分布而非单一平均数。
    参考:https://github.com/mahmoodlab/HEST(HEST-Benchmark 榜单);arXiv:2406.16192。

§6.6 数据增强

策略 建议 理由
随机水平/垂直翻转 ✅ 推荐 病理形态无方向语义
随机 90° 旋转 ✅ 推荐 同上,标准做法
轻度颜色抖动/ stain 增强 ✅ 谨慎推荐 扫描仪染色差异真实存在,但幅度过大破坏形态-表达对应
Macenko/Reinhard 染色归一化 ⚠️ 可选 跨扫描仪训练时有用,务必在验证集确认增益
大角度透视/弹性形变 ❌ 不推荐 破坏 patch 与 spot 的空间对齐假设
Mixup/CutMix 跨 patch 混合 ❌ 不推荐 混合图像后标签不再对应任何真实组织区域

§6.7 模型推荐

模型 类型 预训练 适用场景
ResNet50 (ImageNet) CNN 监督 ImageNet 快速基线、算力受限
UNI ViT 视觉自监督 约 10 万张病理切片 通用病理特征骨干(榜单常客)
CONCH 视觉-语言 病理图文对 需要文本对齐能力的任务
GigaPath 千兆级 ViT 大规模全切片 全切片上下文建模
Virchow 2 / H-Optimus-0 ViT 自监督 大规模病理 追求榜单前沿的强骨干
Remedis 自监督 放射+病理混合 跨域对比实验

选型建议:先用 ResNet50 与一个病理预训练骨干(如 UNI)拉开基线差距,确认流程正确;再替换更强骨干。逐模型定量结果以官方实时榜单为准(见 §8.1),本表不复制具体 Pearson 数值以防过时。

§6.8 计算资源需求

资源 最低 推荐 说明
磁盘 1.5 TB 3 TB+ 全量 >1 TB;含衍生 >2 TB;另留工作区
GPU 1 × 16 GB 1-4 × 40 GB(A100 级) patch 级训练单卡足够;全切片/大骨干多卡
CPU/RAM 16 核 / 64 GB 32 核 / 128 GB+ WSI 读取、核分割、h5ad 处理均为 CPU 密集
网络 稳定 100 Mbps 更高 >1 TB 下载,断点续传必备

§6.9 评估指标

官方指标为逐基因 Pearson r(预测 vs 真实,50 个高变基因逐一计算),可报告均值/中位数与分布:

import numpy as np
from scipy.stats import pearsonr

def gene_pearson(y_true: np.ndarray, y_pred: np.ndarray) -> np.ndarray:
    """y: (n_spots, 50),逐基因 Pearson r"""
    rs = [pearsonr(y_true[:, j], y_pred[:, j])[0] for j in range(y_true.shape[1])]
    return np.asarray(rs)

# 报告规范:mean / median / 分平台与分任务的分布,禁止单一跨任务平均

分类/生存类自定义任务另选 AUC/C-index,但必须与官方线性探针结果分开呈现,不得互相替代。

§6.10 MLOps 笔记

  • 版本三件套:记录库版本(v1.1.0/v1.2.0/v1.3.0 样本数不同)、benchmark 快照版本、自研代码版本——三者任一变动都会改变可比性。
  • 数据指纹:对所用样本清单与 HVG 索引落盘哈希,训练 run 绑定指纹,杜绝"同一实验名不同数据"。
  • 存储分层:只读主库(对象存储/本地盘)与可再生的中间产物(patch 张量、特征库)分离,中间产物可随时重建。
  • 评测日志:每个 run 记录划分组 ID 列表(patient/dataset 级),保证任何人可用同一划分复现。
  • 漂移监控:上线式服务监控输入 MPP 分布、染色指标与 patch 组织覆盖率,越界告警(对应坑点 2/7)。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
平台偏倚 4 类 ST 平台的 spot 尺寸、panel 与 UMI 分布不同,Visium 系占主体 高 平台分层评估;以 st_technology 为协变量(坑点 3)
物种偏倚 小鼠样本集中于 brain(211)与 spinal cord(318),合计约 43% 高 人源任务预过滤物种(坑点 4)
癌种长尾 367 个癌症样本摊到 25 种癌种 中 单癌种只做评测/微调,不做从零训练
地域与机构偏倚 地域字段缺失,来源以北美/欧洲公开仓库为主,含产业界批量队列 中 按 dataset_id 敏感性分析,勿外推人群结论
分辨率偏倚 扫描倍数 10x-40x 不等,Owkin 队列仅 156/293 可稳定重采样 中 MPP 归一 + 剔除清单(坑点 2)
发表偏倚 聚合 153 个已发表队列,阴性/失败运行不易入库 低-中 结论解释时声明"文献来源"属性

偏倚的相互作用与"最坏组合"检验:上述偏倚并非独立——平台偏倚与物种偏倚相关(小鼠样本集中于早期 ST 平台),癌种长尾与队列偏倚叠加(单一机构常贡献单一癌种大宗病例)。比起逐项孤立检验,更接近部署风险的做法是构造"最坏组合"子集(人源 × 非 Visium × 罕见癌种)验证模型是否仍可用:

建模阶段 偏倚最先暴露的位置 探测动作
数据探索 平台/物种构成失衡 value_counts 与分层占比(§3.2)
训练 损失被大宗队列主导 按 dataset_id 加权或分组监控
评测 分层指标方差骤增 按器官 × 平台 × 癌种出细分表

§7.2 标注质量

本库标注分三层,质量画像各异:疾病/元数据标签继承自 153 个原研究,无统一复核,跨队列口径差异客观存在;图像-表达配准为自动流水线产物,Visium 侧(YOLOv8 fiducial + 仿射)在标准芯片上高度可靠,少数样本漂移可经 patches_vis/ 与 pixel_size_vis 抽查发现(坑点 7);细胞核实例为 CellViT 伪标注,在核形态清晰组织上可靠,坏死/挤压区域存在实例合并与漏检。三层都不应被当作"人工金标准"使用;官方通过统一流水线与逐样本元数据把质量风险透明化,这比"声称已人工质检"的聚合库更可审计。

三层标注的信任边界:

标注层 可直接用于 使用前必做 禁止用途
疾病/元数据标签 分层、筛选、报告 查 dataset_id 口径 当作临床金标准
图像-表达配准 patch 提取、空间聚合 抽查 patches_vis(坑点 7) 核级精确定位
细胞核实例 弱监督、形态摘要 了解 CellViT 失效模式 核级定量结论

§7.3 泛化性表

部署场景 失效风险 证据
跨扫描仪(不同厂商/染色批次) 染色漂移侵蚀形态-表达对应 库内扫描倍数 10x-40x、染色协议随原研究(§3.9)
跨平台(Visium→Xenium) 表达分布与 spot 语义整体迁移 平台分辨率 55 µm vs 近单细胞(§3.1)
跨器官(单器官训练→新器官) 形态先验失效,表达程序重排 26 器官构成强域偏移(§4.2)
人源训练→跨物种推理 生物学分布不连续 小鼠集中于脑/脊髓(§2.5)
靶向 panel→全转录组预测 输出空间受限,panel 外基因无监督 平台 panel 差异(§3.1)

泛化性的另一面:上表反向读就是研究机会——跨器官、跨平台的域偏移恰是 HEST-1k 相对单中心数据集的独特价值:只有库足够大、足够异质,"源域-目标域"配对才有的可选。官方基准未直接覆盖域泛化任务,属"可行但需自建协议"范畴(§2.4),划分建议见 §5.4。

§7.4 伦理

库内样本为已发表研究的脱敏组织标本,分发内容不含直接标识符、联系方式或可再识别的临床记录;获取走 Hugging Face gated 流程(接受条款后自动批准),许可为 CC BY-NC-SA 4.0,禁止商业用途;153 个来源队列的许可逐样本登记于 license 字段,部分衍生模型权重需向原作者单独申请。使用涉及人类组织的衍生物时,建议同时遵守原队列的使用条款与本库许可中更严格者。

NC 与 SA 条款的实际含义:NC 约束的是使用目的而非使用者身份——企业内非商业研究一般可接受,将模型或结论产品化、接入收费服务即触及边界;SA 要求衍生数据集以相同许可共享。再叠加"逐样本 license 可能更严"的事实,合规审查的正确姿势是:先看全库许可,再按所用样本核对 license 字段,取更严格者执行。

§7.5 公平性

公平性视角下的三个已知缺口:其一,地域与族群构成未标准化记录,模型跨人群部署的公平性无法在本库内直接审计;其二,癌种长尾使罕见癌种的模型性能天然落后于乳腺、肺等高资源癌种;其三,平台主体是商业化 Visium,低资源机构常用的旧版 ST 样本占比小,把全库当"标准分布"会系统性低估旧平台场景。缓解路径都是同一句话:分层报告(地域代理变量 = dataset_id、癌种、平台),而非单一总指标。

分层报告的最小实现(示意):

# perf_df: 每行 = 一个 (sample, 模型) 的逐基因平均 Pearson r
grouped = perf_df.groupby(["dataset_id", "st_technology"])["pearson_r"]
report = grouped.agg(["mean", "std", "count"])
print(report.sort_values("count"))  # 样本量最小的层最先看

按队列与平台两轴同时分层,是本库条件下公平性审计的最低配置;再加器官轴即覆盖 §7.1 的全部偏倚维度。

§7.6 数据漂移

HEST-1k 自身的"库内漂移"已在发生:v1.1.0 引入 Xenium 与 Visium HD,v1.2.0/v1.3.0 持续追加新平台样本(截至 2026-02 已至 1,276 个)——库的平台构成随版本漂移,跨版本比较任何统计量都要固定版本号。库外部署的漂移监控见 §6.10(MPP 分布、染色指标、组织覆盖率)。对新平台(如 Xenium 5k),建议先在小子集上重新核验 patch-表达对齐质量再并入训练。

版本漂移的登记做法:把"库版本"提升为与"模型版本"同级的一等公民——每次实验记录 HF revision、样本计数与平台构成三元组;发现平台构成与上周不同,先查版本再查代码。库内漂移是聚合数据集的常态而非异常,把"版本固定"写进团队 onboarding 清单,比事后追查省力得多。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ 样本级元数据 TSV 单行一记录,列语义清晰
2 唯一标识 ✅ sample_id 全库唯一且与文件系统严格对齐
3 特殊字符 ✅ TSV 规范解析;路径与 ID 以 ASCII 为主
4 重复行 ✅ 样本级无重复;同患者多切片属设计使然,需按 patient_id 分组
5 缺失编码 ✅ 空值语义可解释(见 §4.5 信息性缺失)
6 标签标识 ✅ organ/disease_state/oncotree_code/st_technology 语义固定
7 罕见类分组 ⚠️ 25 癌种长尾,稀有癌种需分层抽样与单独报告
8 偏倚评估 ✅ 论文与 §7.1 显式披露平台/物种/长尾偏倚
9 数据字典 ✅ readthedocs API 文档 + README + 元数据字段说明
10 信息性缺失解释 ⚠️ patient_id/pixel_size_vis 缺失语义未官方成文,需使用方自证
11 设备记录 ⚠️ 扫描仪型号未标准化,仅 MPP/倍数区间可得(§3.9)
12 共线性 ✅ 特征为图像 patch,不存在表格特征共线性问题
13 编码映射 ✅ OncoTree 原生编码 + unify_gene_names/ensembl_id_to_gene 基因名映射工具
14 时间戳处理 ⚠️ 原始采集日期未标准化,仅版本发布日期可用(§3.7)
15 划分建议 ⚠️ 全库无官方划分,仅 benchmark 协议(§5.1)
16 泄漏讨论 ✅ 官方基准内置患者分层 CV;本页 §5.3 完整讨论
17 标签分布 ✅ 元数据随库分发,分布可一行 value_counts 复算(§4.2)
18 测量偏倚 ⚠️ 平台间表达定量不可直接互比,属结构性限制
19 外部验证建议 ✅ 官方榜单 + leave-one-cohort-out 协议明确(§5.4/§7.8)
20 版本记录 ✅ HF 逐版本变更(v1.1.0→v1.3.0)+ 论文口径差异可追溯(§1.4)
21 预处理脚本 ✅ 官方 hest 库封装 patch 化/配准/分割/基准全流程(§6.4)
22 合规要求 ✅ CC BY-NC-SA 4.0 + gated 获取 + 逐样本 license 元数据
23 多模态对齐 ✅ 图像-表达-细胞核实例三层对齐,附可视化复核目录
24 去标识化 ✅ 公开研究脱敏标本,无直接标识符(§7.4)

DAIMS 评分:21.0 / 24

评分解读:作为"多模态配对资源库",HEST-1k 在标识体系(第 2/4 项)、合规与版本治理(第 20/22 项)、工程化配套(第 21 项)与多模态对齐(第 23 项)上达到同类库的顶档水平,这是官方库(而非纯打包)带来的红利;失分集中在聚合型数据的固有代价——稀有癌种需自建分层(第 7 项)、采集时间与设备颗粒度缺失(第 11/14 项)、全库划分与跨平台可比性的结构性空白(第 15/18 项)。与 AI 就绪度 4/5 一致:数据处理是满分级,元数据完备性留有 aggregation 的先天缺口。

对你意味着什么:第一,主键、版本与许可治理可以直接信任,把节省下来的审计预算花在配准抽查与患者级划分上;第二,动手前先锁定版本号与样本清单指纹(§6.10),这能规避跨版本漂移引发的绝大部分复现纠纷;第三,凡涉及罕见癌种、跨平台或时序结论的任务,必须按 §7.3 失效表显式设计分层实验,不要拿全库总量(1,229)当有效样本量。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
HEST-Benchmark 榜单(25 个第三方模型接入) 多机构(Meta/Microsoft/BioNTech/GenBio 等) 9 任务形态→表达预测 逐基因 Pearson r(Top5 平均 0.4061-0.4229) — 统一协议下病理预训练骨干普遍优于 ImageNet 基线(ResNet50 平均 0.3252)
CellViT(PanNuke 预训练)迁移至全库分割 官方集成 1,229 个样本的核实例分割 均值约 62,100 核/切片、5 类核 — 预训练分割模型在 153 个异构队列上全库可用,构成伪标注层
榜单跨时间快照对比 Mahmood Lab 模型数从 11(论文期)扩展至 25(截至 2026-04-03) 同名模型数值随快照微动 数值不可直接比较 代码库与任务维护持续进行,引用须注明快照日期

独立第三方在 HEST-1k 之外构建大规模对照实验的同行评审结果,截至编辑日(2026-09)仍然有限;欢迎使用者按 §8.3 协议补充自建外部队列的验证报告。

如何自建外部验证:官方提供的是"库内基准 + 跨快照一致性"两层证据;说服力最强的第三层——独立机构、独立队列的预先注册对照实验——目前仍稀缺。若你的机构持有自建 ST 队列,按 §8.3 协议复算榜单 Top5 与 ResNet50 基线并按患者分层报告,即是填补明确空白的方法学工作。

§8 基准性能与生态

§8.1 排行榜

HEST-Benchmark 排行榜(形态→表达预测,50 高变基因,Ridge 回归 + PCA(256),患者分层 CV,逐基因 Pearson r;截至 2026-04-03 共 25 个公开模型):

排名 模型 性能(平均 Pearson r) 年份 关键技术 完整引用 代码
1 H-Optimus-1 0.4229 2025 ViT 自监督,大规模病理预训练 Saillard et al., 2025(Hugging Face 发布) Hugging Face
2 GenBio-PathFM 0.4197 2025 大规模病理基础模型 GenBio AI, 2025(官方发布页) Hugging Face
3 H-Optimus-0 0.4150 2024 ViT 自监督 Saillard et al., 2024(Hugging Face 发布) Hugging Face
4 UNI2-h 0.4141 2024 ViT 自监督(UNI 2.0 系列) Chen et al., 2024(UNI 2.0 技术报告) Hugging Face
5 Virchow 0.4061 2024 百万级切片 ViT 自监督 Vorontsov et al., 2024(arXiv) Hugging Face
— ResNet50(基线) 0.3252 — ImageNet 监督 CNN 官方基线(榜单内置) 榜单仓库
— 其余 19 个模型 见官方榜单 2023-2025 含 CONCH、UNI、GigaPath、Remedis 等 逐模型引用见官方榜单链接 官方榜单

数值不可直接比较的原因:榜单自论文初版评估 11 个模型扩展至 25 个(截至 2026-04-03),期间代码库与任务实现持续更新,同名模型在不同快照日期的数值存在微动;跨论文引用时必须注明快照日期与模型数,官方仓库的榜单页是唯一权威数值源。引用格式建议"数值截至 2026-04-03,25 模型快照"。

榜单的正确打开方式:把它当"相对排序参考"而非"绝对性能承诺"——你的器官、染色流程与 patch 规格都可能改变模型间相对位次。论文方法学引用榜单时,建议采用区间表述(“Top5 模型 0.4061-0.4229,基线 ResNet50 0.3252”)而非单一模型的单一数字,对快照微动最鲁棒。

§8.2 SOTA 总结与选型建议

榜单给出的工程结论很直接:病理预训练骨干 > ImageNet 监督骨干(Top5 全部为病理基础模型,与 ResNet50 基线的差距约 0.08-0.10 平均 Pearson r),且榜单前列全部是纯视觉自监督 ViT——视觉-语言模型(如 CONCH)在该任务上并未显示压倒性优势。选型路径:ResNet50(流程验证)→ UNI/H-Optimus-0(性价比骨干)→ 榜单 Top3(冲性能);是否值得为最后 0.005-0.01 的增益更换骨干,取决于你的评测敏感度而非训练预算。

你的任务 是否该用 HEST-1k 理由
形态→表达预测训练/评测 是(首选) 官方协议 + 榜单 + 配对数据齐全
病理基础模型横向横评 是(首选) 25 模型先例,协议可直接复用
单癌种从零训练大模型 谨慎 单癌种样本量不足以支撑从零预训练
人群患病率/流行病学推断 否 队列聚合数据,无人群抽样语义

预算-选型矩阵(承接上表):

你的预算/目标 建议起点 理由
流程验证、教学 ResNet50 基线 零下载成本,榜单内置
常规课题骨干 UNI / H-Optimus-0 性能-成本平衡点
冲击榜单性能 H-Optimus-1 当前榜首(0.4229)
需要跨模态能力 CONCH(在榜) 该基准未显示视觉-语言模型优势

选型的成本侧账:骨干替换的真实成本不在推理 FLOPs,而在特征缓存重建——每个新骨干意味着全库 patch 特征重提一遍。务实路径是先在单器官小子集复算 Top3,确认增益在你的分布上成立,再决定是否全量缓存。

§8.3 评测协议

发表论文使用 HEST-1k 基准的最低协议要求:其一,锁定 50 HVG 集合、patch 规格(112×112 µm @ 0.5 µm/px)与 Ridge+PCA(256) 探针,不得自行替换后仍称"HEST-Benchmark 结果";其二,患者分层交叉验证,划分组 ID 列表随论文公开;其三,注明库版本(或 benchmark 快照日期)与访问日期;其四,报告逐基因 Pearson r 的均值与分布,跨任务只用同一聚合口径。四点缺任一,跨论文比较即失效(对应坑点 8)。

协议之外的自选增强(须明确标注为自选,不冒充官方口径):一是把探针从 Ridge 换成 kNN 或轻量 MLP 做探针鲁棒性检验;二是补充 leave-one-cohort-out 的跨队列外推指标(§5.4)。两者不改变"HEST-Benchmark 结果"的官方语义,但能显著提高方法学说服力。

数据集 机构 模态 规模 与 HEST-1k 的关系 获取
TCGA NCI/NCBI H&E WSI + bulk RNA-seq 万级 WSI,32 癌种 切片级 bulk 表达可作弱对齐补充,无空间位点配对 公开(dbGaP 控制级可申请)
HTAN Human Tumor Atlas Network 影像+空间/单细胞多组学 多中心 atlas 同为肿瘤空间组学聚合,但格式异构需自整 门户公开
HuBMAP NIH 联盟 影像+单细胞多组学 多器官人体图谱 健康组织为主,与 HEST 癌症样本互补 门户公开
10x Genomics Visium 公开示例 10x Genomics Visium + H&E 数十样本 平台对照与教学素材 官网公开

选库速查:要空间位点级配对 → HEST-1k;要 bulk 表达 + 大规模 WSI → TCGA;要多模态 atlas 与深度临床元数据 → HTAN;要健康组织参照 → HuBMAP。四库互补而非竞争,"TCGA 大规模预训练 + HEST 空间评测"是文献中常见的组合。

§8.5 关键论文 Top 8

# 论文/模型 出处(年份) 在本库中的角色
1 HEST-1k 本体论文 Jaume et al., NeurIPS 2024 Datasets & Benchmarks Track Spotlight(pp. 53798-53833) 数据集、构建流水线与基准协议的权威出处
2 CellViT Hörst et al., 2024(DETR 架构,PanNuke 预训练) 全库细胞核实例的生成模型
3 YOLOv8 Ultralytics, 2023 Visium fiducial 定位点检测与仿射配准
4 VALIS 数字病理 atlas 配准框架 Xenium 样本的图像-表达配准
5 UNI Chen et al., 2024, Nature Medicine 榜单评估的经典病理视觉骨干
6 CONCH Lu et al., 2024, Nature Medicine 榜单评估的视觉-语言病理模型
7 GigaPath Microsoft & Providence, 2024, Nature 榜单评估的全切片基础模型
8 Virchow / Virchow 2 Vorontsov et al., 2024(arXiv) 榜单评估的百万切片级自监督模型

上表 2-4 项是官方流水线的外部依赖(分割、配准),5-8 项是榜单上的代表性被评测骨干——前者决定"数据怎么来的",后者决定"基准测什么"。两类文献都读,才能既复现数据处理、又解释榜单差异。

§8.6 社区活跃度

  • 学术影响:引用 216+(Google Scholar,截至 2026-09),逐年爬升(2024:7 → 2025:83 → 2026:126),发表当月即进入 NeurIPS Spotlight。
  • 版本节奏:2024-06 至 2026-02 保持活跃维护,4 个版本节点(arXiv v1 → HF v1.1.0/v1.2.0/v1.3.0),每半年至一年仍有新平台样本入库。
  • 社区反馈渠道:GitHub issues 活跃,高频主题集中在配准抽查、重采样可行性与大体积下载工程——与本页 §6.5 坑点 2/6/7 一一对应,说明坑点清单反映真实使用摩擦。
  • 获取模式:Hugging Face gated(自动批准),兼顾开放获取与条款留痕。
  • 榜单生态:25 个模型来自多家机构(Meta、Microsoft、BioNTech、GenBio 等),病理基础模型团队默认把 HEST-Benchmark 纳入评测矩阵——榜单本身已成为该子领域的事实选型参照。

§8.7 生态快照表

组件 维护方 角色 获取方式
hest(Python 包) Mahmood Lab 读取、patch 化、配准、批次校正、基准封装 pip install -e .(GitHub 克隆)
HEST-Benchmark Mahmood Lab 9 任务协议 + 25 模型榜单 GitHub 仓库 benchmark 目录
CellViT 原作者团队(官方集成) 细胞核分割引擎 GitHub(随库分发分割结果)
OpenSlide / libvips 开源社区 WSI 读取与图像 IO 基础设施 系统包管理器(openslide-tools/libvips-dev)
Hugging Face Hub Hugging Face gated 分发与版本管理 huggingface.co/datasets/MahmoodLab/hest
OncoTree Memorial Sloan Kettering 癌种编码术语标准 oncotree 官网

生态依赖的最小集:若只装三样,选 hest 包(全流程封装)、OpenSlide/libvips(图像 IO)与 PyTorch 生态,其余组件按需追加;OncoTree 仅在需要癌种编码展开时引入。注意 benchmark 附加依赖(pip install -e ".[benchmark]")会显著扩大安装面,按需选择(§6.0)。

§9 相关资源与引用

§9.1 官方资源

资源 链接 用途
论文(arXiv) https://arxiv.org/abs/2406.16192 数据集与基准协议的权威出处(DOI: 10.48550/arXiv.2406.16192)
Hugging Face 数据集 https://huggingface.co/datasets/MahmoodLab/hest gated 下载、版本说明与体量口径
GitHub 仓库 https://github.com/mahmoodlab/HEST 源码、HEST-Benchmark 榜单、issues、官方 BibTeX
API 文档 https://hest.readthedocs.io/en/latest/api.html hest 包函数级文档
发布机构 https://mahmoodlab.org/ Mahmood Lab(哈佛医学院/Mass General Brigham)

阅读顺序建议:新用户按"论文 → HF 页面 → GitHub README → API 文档"推进——论文给动机与协议设计,HF 页面给版本与体量事实,README 给快速上手与注意事项,API 文档是日常编码的常驻参考;遇内容冲突时以 GitHub 仓库为最新事实源(其更新先于论文修订)。

另补两个高频入口(均在 GitHub 仓库内):benchmark 目录(9 任务协议与 25 模型榜单,引用须注快照日期)与 issues 检索(配准、下载、重采样问题多半已被回答)。

§9.2 BibTeX 引用块

官方仓库给出的引用条目(键名 jaume2024hest):

@inproceedings{jaume2024hest,
  title     = {HEST-1k: A Dataset for Spatial Transcriptomics and Histology Image Analysis},
  author    = {Jaume, Guillaume and Doucet, Paul and Song, Andrew H. and Lu, Ming Y. and Almagro-Perez, Cristian and Wagner, Sophia J. and Vaidya, Anurag J. and Chen, Richard J. and Williamson, Drew F. K. and Kim, Yunhak and Mahmood, Faisal},
  booktitle = {Advances in Neural Information Processing Systems 37 (NeurIPS 2024) Datasets and Benchmarks Track},
  pages     = {53798--53833},
  year      = {2024}
}

注意:第一作者为 Jaume(Guillaume Jaume);转引第三方博客的"chen2024hest"等键名均为误传,请以官方仓库为准。

格式重排提示:按机构要求(GB/T 7714、AMA 等)重排时,作者序列、页码与会议名以上述官方条目为唯一依据,不要从第三方聚合站转抄——后者常见作者截断(丢失末位作者)与页码讹误。

§9.3 引用指南

规范引用建议"三件套"齐备:其一,引用上面的官方 BibTeX(数据集与基准协议);其二,注明所用库版本与访问日期(如"v1.3.0,截至 2026-02";跑基准另注明榜单快照日期);其三,凡使用了特定来源队列的结论,同时引用原队列文献——dataset_id 与 license 字段即为此设计,合规审计可直接回溯到逐样本粒度。第三方模型性能数值引用官方榜单页并注明快照日期,不转引博客数字。

引用自查表:

自查项 达标标准 常见失分
BibTeX 键名 jaume2024hest、11 位作者齐全 键名误传、作者截断
版本声明 库版本/榜单快照 + 访问日期齐备 只写"HEST-1k"不注版本
队列引用 使用到的 dataset_id 均列出原文献 只引数据集论文不引队列

版本声明模板(可直接改写进论文数据可用性声明):

本文使用 HEST-1k v1.3.0(2026-02-08 发布,1,276 样本;截至 2026-02 访问)。
基准数值来自 HEST-Benchmark 官方榜单(快照日期 2026-04-03,25 个模型)。
所用来源队列见补充材料(按 dataset_id 列出原文献)。

§9.4 常见获取问题速答

Q1:最小起步要下载多少? 元数据 TSV + 若干 st/*.h5ad + 对应 patches/*.h5,单样本 GB 量级都不到;只有需要重切 patch 或核级分析才拉 wsis/(体量主力)。

Q2:为什么下载要 token? gated 模式:在数据集页接受使用条款后自动批准,huggingface-cli login 后即可脚本化下载;无需人工审核。

Q3:cellvit_seg/ 里为什么找不到文件? 该目录以 zip 分发,需先解压再按 sample_id 索引(坑点 6)。

Q4:论文里的 1,229 和 HF 页面的 1,276 哪个对? 都对——前者是 NeurIPS 定稿口径,后者是 HF v1.3.0(截至 2026-02)滚动扩容结果;引用时注明版本即可(§3.0)。

Q5:可以商用吗? 不可以。CC BY-NC-SA 4.0 明确禁止商业用途;个别来源队列还有附加限制,以逐样本 license 字段为准。

Q6:可以只下载部分器官吗? 可以。先按 organ 从元数据 TSV 筛出 sample_id 清单,再用 Hugging Face 按文件过滤或 iter_hest 的 id_list 参数精确拉取;不要整仓克隆后再删(坑点 6)。

Q7:数据是预处理好的还是原始数据? 两者都有——st/ 是处理到计数矩阵的表达层,wsis/ 是原始扫描层;官方流水线(配准、patch 化、分割)产物已随库分发,可直接用,也可从 wsis/ 起步用自己的参数重跑全流程。

Q8:小鼠样本能和人源样本混合训练吗? 技术上能,一般不建议:两物种的表达程序与形态学差异构成强协变量;除非研究问题本身就是跨物种泛化,否则先按物种过滤(坑点 4)。

Q9:疑似配准漂移怎么办? 打开该样本 patches_vis/ 叠加图人工确认,并查 pixel_size_vis 是否异常;确认后加入剔除清单并在论文中报告剔除标准(坑点 7)。

Q10:库出新版本怎么办? 锁定旧 revision 完成在研实验;新项目直接用最新版并在引用时注明版本号;跨版本比较任何统计量前,先核对平台构成是否已变(§7.6)。

§10 AI 使用声明卡

§10.1 AI 模型列表

  • 生成模型:CodeBuddy Code(fast-model)——负责本条目初稿撰写、代码示例生成与结构编排。
  • 检索增强:WebFetch(2026-09 共 3 次)——覆盖 arXiv 论文页、GitHub 仓库 README、readthedocs API 文档。
  • 使用边界:WebFetch 仅读取公开页面的文本事实(版本号、规模数字、函数签名、许可条款),未下载数据文件、未运行官方代码;全部代码示例为编辑侧依据 API 文档编写,逻辑经人工走查但未在本环境执行。

§10.2 AI 参与范围

AI 参与范围限于:资料汇总、结构化写作、代码示例编写、JSON-LD 生成。全部事实性数字均取自检索到的官方页面与同行评审文献;医学判断、合规表述与最终发布内容由千方病案医学编辑部人工审定。

AI 未参与的部分:FACTS.md 事实清单的来源筛选与交叉核对、8 个坑点的真伪判别、DAIMS 24 项的逐项裁定、ICD-11/SNOMED 映射的选定——以上为编辑侧人工完成,AI 产出仅为初稿。

§10.3 输入来源列表

  1. HEST-1k 论文(arXiv:2406.16192;NeurIPS 2024 Datasets & Benchmarks Track,37:53798-53833). https://arxiv.org/abs/2406.16192
  2. Hugging Face 数据集页(版本历史、gated 条款、体量口径). https://huggingface.co/datasets/MahmoodLab/hest
  3. GitHub 仓库 mahmoodlab/HEST(README、目录结构、issues、榜单、官方 BibTeX). https://github.com/mahmoodlab/HEST
  4. HEST readthedocs API 文档(iter_hest/HESTData/benchmark 等函数签名). https://hest.readthedocs.io/en/latest/api.html
  5. Google Scholar 引用统计(216+,截至 2026-09). https://scholar.google.com/scholar?q=HEST-1k
  6. Mahmood Lab 发布机构主页. https://mahmoodlab.org/
  7. 编辑整理的 FACTS.md 研究事实清单(上述来源的结构化摘录,本条目全部数字的中间账本)

来源-章节映射(数字可溯源性的账目):

来源 撑起的主要内容
论文(来源 1) §1 概览、§3 规格、§5 基准协议、§7 局限、§8 榜单原始数字
HF 页面(来源 2) §1.4 版本史、§3.0 版本矩阵、§3.4 体量口径
GitHub(来源 3) §4.0 目录树、§6 坑点与代码、§8.7 生态、§9.1
readthedocs(来源 4) §6.0-§6.4 API 用法
Scholar(来源 5) §8.6 学术影响

FACTS.md(来源 7)是中间账本而非独立来源:当正文数字与账本冲突时,以上游来源原文为准并回改账本。

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§0 E-E-A-T 与免责声明 千方病案医学编辑部 逐条比对宪法模板与金标准文本 ✅ 已通过/已验证
§1 概览与对比表 千方病案医学编辑部 数字溯源至 FACTS.md 对应来源 URL ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED 映射) 医学方向审核员 与 ICD-11/SNOMED 官方浏览器抽样核对 ✅ 已通过/已验证
§3 数据集规格 数据工程审核员 双口径数字交叉核对(arXiv v1 vs NeurIPS 定稿) ✅ 已通过/已验证
§4 数据结构与 DAIMS 字段字典 数据工程审核员 与官方文档及元数据字段说明比对 ✅ 已通过/已验证
§5 划分与泄漏讨论 数据工程审核员 情景推演 + 论文基准协议核对 ✅ 已通过/已验证
§6 代码与 8 坑点 数据工程审核员 代码逻辑走查;坑点全部锚定真实来源 ✅ 已通过/已验证
§7 DAIMS 24 项与外部验证矩阵 千方病案医学编辑部 逐项状态复核与证据链检查 ✅ 已通过/已验证
§8-§9 引用与 BibTeX 千方病案医学编辑部 官方仓库榜单与 BibTeX 原文比对 ✅ 已通过/已验证
§C JSON-LD 与 frontmatter 数据工程审核员 与 schema_org 序列化一致性比对 ✅ 已通过/已验证

校验口径说明:表中"审核方式"为编辑部实际操作记录而非模板填空;数字类条目(§1/§3/§8)采用双人独立溯源后交叉比对,表述类条目(§0/§10)采用宪法模板逐字比对。

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§1.3 横向对比、§3.0 版本抉择矩阵、§4.0 目录树、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性分析、§7.7 DAIMS 评估表与评分、§8.1 排行榜、§8.7 生态快照、§C JSON-LD。

§10.6 最后人工审核

最后人工审核日期:2026-09-18(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)

修订记录:

版次 日期 范围
v1.0(未发布) 2026-09 上旬 初稿因中断未完成,未进入审核
v2.0(本版) 2026-09-18 全量重写,通过校验脚本与全条目人工审核

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • chimera — 共享标签:医学影像 / 病理图像 / 转录组 / 肿瘤学
  • cellxgene — 共享标签:医学影像 / 病理图像 / 转录组
  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • sicapv2 — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • msk-impact — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • munich-bmc — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • hlca — 共享标签:医学影像 / 病理图像 / 转录组
  • human-protein-atlas — 共享标签:医学影像 / 病理图像 / 转录组
  • cima — 共享标签:医学影像 / 病理图像 / 肿瘤学
  • camelyon16-17 — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集