Human Cell Atlas — 人类细胞图谱全身单细胞参考图谱 AI-Ready Wikipedia

2016 年发起的国际开放联盟 · 7,050 万细胞 · 18 个生物网络 · 多组织单细胞与空间图谱

来源 Human Cell Atlas Consortium / HCA Data Coordination Platform (EBI, Broad Institute, UCSC) url: https://data.humancellatlas.org发布时间: 2026-09-13最后更新: 2026-09-25 阅读 34
Human Cell Atlas — 人类细胞图谱全身单细胞参考图谱 AI-Ready Wikipedia

信息速览

数据集名称Human Cell Atlas — 人类细胞图谱全身单细胞参考图谱 AI-Ready Wikipedia
数据类型7,050 万细胞 · 多组织多模态,18 个生物网络图谱,CC BY 4.0 开放,Data Portal + CELLxGENE Census,月度更新快照
规模细胞级参考图谱(非患者队列):约 7,050 万细胞 / 1.12 万捐赠者 / 527 项目(截至 2026-09)
接入方式Human Cell Atlas Consortium / HCA Data Coordination Platform (EBI, Broad Institute, UCSC) url: https://data.humancellatlas.org
AI 就绪度

数据集封面

Human Cell Atlas — 人类细胞图谱全身单细胞参考图谱 AI-Ready Wikipedia


INFOBOX

数据集名称 Human Cell Atlas(人类细胞图谱,HCA)
英文全称 Human Cell Atlas(国际人类细胞图谱联盟)
别名/简称 HCA、人类细胞图谱、HCA Consortium、HCA Bionetworks(生物网络)、HCA Data Portal
疾病分类 非疾病专病数据集——健康人体多组织细胞参考图谱,支撑疾病单细胞研究的对照基线与细胞易损性定位(典型应用:ICD-11 CA23 哮喘 / CA22 慢性阻塞性肺疾病 / RA01 COVID-19 / 5A14 1 型糖尿病 / BA41 急性心肌梗死,详见 §2.1)
SNOMED CT 195967001 Asthma / 13645005 Chronic obstructive lung disease / 840539006 COVID-19 / 46635009 Diabetes mellitus type 1 / 22298006 Myocardial infarction(见 §2.1b)
数据模态 单细胞/单核 RNA 测序(scRNA/snRNA-seq)、空间转录组成像、染色质可及性、CITE-seq 蛋白、V(D)J 免疫库序列、标准化的供体/样本/协议元数据
AI 任务类型 细胞类型聚类与注释、跨组织/跨研究整合、标注迁移(label transfer)、细胞组成反卷积、疾病-对照差异组成分析、单细胞基础模型预训练
样本总数 约 7,050 万细胞、1.12 万捐赠者、527 个项目、997 个实验室(HCA Data Portal 实时统计,截至 2026-09;2024-12 口径为 9,200 捐赠者 / 6,270 万细胞 / 478 项目)
数据大小 滚动增长:单项目注释矩阵通常 GB 级,全联盟含原始 FASTQ 远大于此;实时规模以 Data Portal 首页计数为准
数据格式 FASTQ(原始测序)、AnnData h5ad(注释矩阵)、TSV/CSV 元数据模板、cxg 交互格式;导出经 Portal 生成的 curl 命令或 Terra workspace
许可证 CC BY 4.0(HCA Data Release Policy / Data Use Agreement);Tier 2 潜在标识元数据与 embargo 数据按 managed access 管理
访问级别 开放(CC BY 4.0,免注册浏览与下载)/ 受控(managed access 元数据与未解除 embargo 数据)
DUO 标签 NRES(开放部分);含潜在标识的 Tier 2 字段与 embargo 数据另须协议与审批(MOR 适用)
语言 英文(数据本体、元数据模板与门户)
首发日期 2016-10(联盟伦敦启动会议)/ 2017-06(DCP 由 CZI 资助启动)/ 2017-10(白皮书与 HCA Registry 发布)
最后更新 滚动月度更新(Data Portal 快照);2024-11 Nature Portfolio 发表 45+ 篇"迈向首版草案图谱"论文合集
发布机构 Human Cell Atlas Consortium;数据协调由 HCA Data Coordination Platform(EBI/Broad Institute/UCSC Genomics Institute 合作)承担
官方主页 https://www.humancellatlas.org/(联盟)/ https://data.humancellatlas.org/(数据门户)
下载地址 https://data.humancellatlas.org/(Data Explorer 检索与导出);跨研究聚合访问另见 CZ CELLxGENE Discover 与 Census
DOI 10.7554/eLife.27041(2017 愿景论文,Google Scholar 引用 2,856+,截至 2026-09)/ 10.1038/s41586-024-08338-4(2024 Nature 里程碑综述)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— FAIR 水准高:CC BY 4.0 开放、标准化元数据 schema 与本体校验、快照式发布、Census 提供 Python/R API 与版本化 LTS;扣分项:无预分割 ML 任务集、跨项目批次与标注口径不一、Tier 2/embargo 分级增加工程处理成本
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 应用映射、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(细胞/供体/样本主键体系、Tier 1/Tier 2 元数据分级、本体化标注字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Human Cell Atlas 联盟、Wellcome Sanger Institute、Broad Institute、Chan Zuckerberg Initiative、EBI 及 UCSC 无任何商业利益关联。本页面不销售 HCA 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HCA 开放数据按 CC BY 4.0 发布,使用时须按 HCA Data Release Policy 规范致谢与引用;Tier 2 潜在标识元数据与未解除 embargo 的数据须经 managed access 流程并遵守数据使用协议,禁止任何形式的重识别尝试。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? Human Cell Atlas(人类细胞图谱,HCA)是 2016 年 10 月在伦敦 Wellcome 总部启动会议上发起的国际开放科学联盟,由 Aviv Regev(Broad Institute)与 Sarah Teichmann(Wellcome Sanger Institute)共同创立,目标是像"人口普查"一样,对人体约 37 万亿个细胞中的每一种细胞类型建立分子与空间参考图谱。截至 2026-09,联盟已聚集 3,900+ 成员、1,700+ 机构与 100+ 国家/地区,通过 18 个 Biological Network(肺、心、肝、免疫、神经、皮肤、肠道、生殖等)汇集了 527 个项目、约 7,050 万细胞与 1.12 万捐赠者的数据,并正组装"首版草案图谱"(first draft atlas)。

为什么重要? 过去 150 年里,人类识别细胞类型主要依赖形态与少数染 marks;单细胞测序让"每种细胞有什么分子身份、在身体什么位置、随发育与疾病如何变化"第一次可以被系统性回答。HCA 把这些数据汇聚成开放、标准化、可跨研究比较的公共资源,已成为解读疾病细胞机制、靶点发现与细胞类型分辨率精准医学的全球参考底座;2024 年 11 月 Nature Portfolio 一次性发表 45+ 篇论文合集,宣告图谱建设从数据采集阶段进入整合阶段。

我能用它做什么? 如果你是单细胞计算研究者,可以从 HCA Data Portal(data.humancellatlas.org)或 CZ CELLxGENE Discover/Census 获取标准化注释矩阵,做细胞类型发现、跨组织整合、标注迁移与基础模型预训练;如果你是疾病研究者,可以把疾病单细胞数据投影到 HCA 健康参考上做差异细胞组成分析。它是"健康人体参考图谱",不是疾病队列——适合做机制与对照,不适合做患病率或诊断推断。

读者画像与适用边界。 本条目最适合四类读者:(1) 单细胞生信/ML 工程师——需要大规模、多组织、标准化注释的训练语料;(2) 器官生物学与发育研究者——需要各 Biological Network 的整合图谱;(3) 转化医学研究者——需要健康基线做疾病比较;(4) 数据基础设施/FAIR 实践者——研究联盟级数据治理如何落地。需澄清一个常见误区:HCA 的"捐赠者"是经书面知情同意的组织捐献者(含胚胎、胎儿、儿童与成人组织),不是临床患者队列;数据为去标识化细胞级图谱,不构成电子病历或流行病学样本。

§1.1 摘要

Human Cell Atlas 联盟于 2016-10-13/14 在伦敦 Wellcome 总部由启动会议宣告成立,共同创立者 Aviv Regev 与 Sarah Teichmann 担任组织委员会联合主席。2017 年是奠基之年:6 月 Chan Zuckerberg Initiative(CZI)资助建立数据协调平台 DCP(由 EBI、Broad Institute 与 UCSC 合作);10 月联盟发表愿景论文 Regev et al., “The Human Cell Atlas”(eLife 6:e27041,Google Scholar 引用 2,856+,截至 2026-09),CZI 同月资助 38 个先导项目;2017-10 白皮书(2018-10 以 arXiv:1810.05192 预印本形式给出详细建设蓝图)与 HCA Registry(会员注册机制)相继发布。联盟以"开放数据、开放代码、开放社区"为宪章承诺,任何人注册并同意其伦理原则即可成为会员,截至 2026-09 已发展至 3,900+ 成员、1,700+ 机构、100+ 国家/地区(联盟官网口径;2024-12 学术评述口径为 3,200+ 成员/1,700+ 机构/99 国)。

数据层面,HCA 采用"各实验室生产 + 集中治理 + 快照发布"的滚动模式:数据经 DCP 校验(Tier 1 整合必需元数据 / Tier 2 高价值或潜在标识元数据分级)后存入 Terra Data Repository,通过 Data Portal(data.humancellatlas.org)的 Data Explorer 提供检索与导出。截至 2026-09,Portal 实时统计为约 7,050 万细胞、1.12 万捐赠者、527 个项目、997 个实验室(2024-12 学术评述口径为 6,270 万细胞/9,200 捐赠者/478 项目)。组织覆盖由 18 个 Biological Network(脂肪、乳腺、发育、眼、遗传多样性、肠道、心脏、免疫、肾脏、肝脏、肺、肌骨、神经系统、口腔颅面、类器官、胰腺、生殖、皮肤)与非洲/亚洲/拉丁美洲/中东 4 个区域网络推进;肺、神经系统与眼三个网络已率先组装出草案图谱(draft atlas),其中 Sikkema et al. 2023(Nature Medicine 29:1563-1577)的健康与疾病肺脏整合细胞图谱是跨数据集整合方法的代表作。2024-11,Nature Portfolio 以 45+ 篇论文的合集宣告 HCA 进入"首版草案图谱"整合阶段,同期 Rood et al. 综述提出细胞图谱正从"细胞普查"走向"生物学基础模型"的五阶段愿景。

技术解读补充。 从数据工程视角,HCA 与单一研究组数据集最大的不同在于"联邦生产、中央治理、本体对齐":每个项目用自己的平台与协议产出数据,但必须按统一 schema 提交(CELLxGENE 最小 schema 与 HCA Tier 1/Tier 2 字段是社区协调的产物,HCA 与 HuBMAP、HTAN 共同参与制定),细胞类型、组织、疾病、发育阶段等标签被约束到受控本体词表,使跨研究聚合在统计与语义两个层面都可行。这带来三重工程后果:其一,用户拿到的不是单一文件,而是"Portal 快照 + 跨研究聚合视图(Census)+ 各网络整合图谱"三层入口,需按任务选择(见 §3.0);其二,跨实验室批次效应与标注口径差异是常态,须按 §5-§6 的分组与校正策略处理;其三,滚动更新意味着"复现"必须锁定版本(Census LTS 或导出快照 ID),见坑点 7。

§1.2 战略价值

维度一:人体细胞类型的统一语义底座。 HCA 的核心资产不是某个器官的表达矩阵,而是"同一套本体语言下的全身细胞类型参考":细胞类型、组织、疾病、发育阶段标签经受控本体对齐后,任何一个器官图谱中的类型都可以在全局框架内被定位与比较。对 AI 而言,这意味着跨研究的标签可迁移、跨组织的模型可评估——这是把单细胞方法从"单数据集技巧"推向"通用细胞表征"的前提,也是细胞类型基础模型(foundation model)路线把 HCA/CELLxGENE 语料作为首选预训练数据源的原因。

维度二:疾病细胞机制研究的健康基线。 HCA 聚焦健康与基础研究背景组织,但它对医学的最大杠杆恰是"提供正常参考,使疾病偏离可测":COVID-19 期间的肺脏免疫图谱、哮喘气道细胞普查、1 型糖尿病胰腺图谱等工作都以 HCA 生态的健康参考为对照。Rood et al. 2024 综述将细胞图谱的医学价值归纳为五条路径——细胞普查、三维空间地图、基因型-表型连接、发育四维地图与最终的生物学基础模型——每一条都以"健康全图谱"为基线假设。HCA 正是通过"正常 vs 病变"的对照逻辑,而非自带疾病队列,成为转化医学基础设施。

维度三:开放科学与联盟数据治理的范式样本。 HCA 在数据治理上的设计——Tier 1/Tier 2 元数据分级、managed access 保护潜在标识字段、embargo 机制、强制数据贡献者协议、CC BY 4.0 开放许可、Ethics/Equity 工作组与区域网络(非洲/亚洲/拉美/中东)的公平架构——使其成为"全球分布、伦理先行、可复现"的联盟数据治理样板。对数据基础设施团队而言,DCP 的"联邦提交、集中校验、快照发布、云端导出(curl/Terra)"流水线是可借鉴的工程范式;月度更新与版本化快照让"开放"与"可复现"这对矛盾得到了务实平衡。

§1.3 同类数据集横向对比

数据集/图谱 范围 规模 模态 差异化特点
Human Cell Atlas(本条目) 人体全身多组织/多发育阶段 约 7,050 万细胞、527 项目(截至 2026-09) scRNA/snRNA + 空间 + 多组学 全球联盟、18 网络、本体化治理、CC BY 4.0
CZ CELLxGENE Discover/Census 跨联盟聚合(含 HCA) 2023-10 口径 1,102 数据集、9,020 万细胞(5,620 万去重) 以转录组为主 标准化 schema + Census Python/R API,最适合程序化取数
BICCN/BICAN 运动皮层与全鼠脑图谱 哺乳动物脑(小鼠/狨猴/人) 全鼠脑 >3,000 万细胞、>5,300 类型 转录组+表观+空间+电生理+形态 多模态交叉验证最深入,脑专一
HuBMAP 人体多器官 多组织单细胞与成像 转录组+空间+成像 与 HCA 协调 schema,侧重组织微环境结构
单研究组器官图谱(非联盟) 单一组织/疾病 通常数万-数十万细胞 以转录组为主 深度大、批次可控,但缺乏跨研究可比性

§1.4 版本时间轴

时间 版本/事件 说明
2016-10 联盟启动 伦敦 Wellcome 启动会议,Regev 与 Teichmann 共同创立
2017-06 DCP 启动 CZI 资助数据协调平台,EBI/Broad/UCSC 合作承建
2017-10 愿景论文 + 先导资助 eLife 6:e27041 发表;CZI 资助 38 个先导项目
2017-10 / 2018-10 白皮书 + Registry 2017-10 发布白皮书与 HCA Registry;2018-10 预印本 arXiv:1810.05192 给出详细建设蓝图
2018 伦理架构落地 Ethics Working Group 设立,审查同意、数据保护与共享议题
2019-2023 生物网络数据滚动上线 各 Biological Network 数据经 DCP 持续发布;肺图谱等跨数据集整合方法成熟(Vieira Braga 2019;Sikkema 2023)
2024-11 迈向首版草案图谱 Nature Portfolio 45+ 篇合集;Rood et al. 综述提出"细胞普查→基础模型"五阶段;肺/神经/眼三网络草案图谱已组装
滚动 月度快照更新 Data Portal 持续纳入新项目(2024-12:478 项目/6,270 万细胞 → 2026-09:527 项目/7,050 万细胞)

两点时间线说明:其一,HCA 没有"最终版"概念——它是滚动汇集的活的图谱,任何引用都应落到具体日期口径(如"截至 2026-09 为 7,050 万细胞");其二,“首版草案图谱"在 2024-11 合集时尚在组装中,学界预期其发布是一个持续多年的过程,检索到的旧口径数字(如 6,270 万)与新口径(7,050 万)都是"对的”,只是截点不同(见坑点 7)。

§1.5 典型应用场景

  1. 跨组织细胞类型发现与注释:在多组织 scRNA/snRNA 语料上训练聚类与注释模型,用 HCA 的本体化标签(细胞类型/组织/发育阶段)做监督对齐与复核。
  2. 标注迁移与自动注释:把已有图谱(如肺、免疫网络草案)作为参考,用 label transfer 给新实验数据自动打细胞类型标签。
  3. 疾病-对照差异组成分析:将哮喘、COVID-19、糖尿病等疾病单细胞数据映射到 HCA 健康参考上,定位易损细胞类型与组成偏移。
  4. 单细胞基础模型预训练:以跨研究聚合语料(CELLxGENE Census 等)做基因-细胞通用表征学习,再在下游任务微调。
  5. 发育与衰老轨迹研究:利用发育网络与多年龄段供体数据,做谱系追踪、拟时序与年龄相关细胞组成建模。

从应用到任务的取舍提示。 上述场景中,第 1、2 个以"开放注释矩阵"即可开展,规模控制在 GB 级;第 3 个需要自带疾病数据,HCA 仅作对照基线;第 4 个需要大规模多研究聚合与算力投入,适合 Census API + 云端;第 5 个对供体元数据完整性依赖高,Tier 2 字段可能走受控流程。立项前应明确:把 HCA 当训练语料(表征学习)、参考基准(标注迁移)还是对照基线(疾病比较)——三者要求的下载规模、版本锁定与合规级别不同,详见 §3.0 与 §6.2。

§1.6 关键术语速查

术语 全称/含义 在本数据集中扮演的角色
HCA Human Cell Atlas / 人类细胞图谱 联盟与图谱总称
Bionetwork Biological Network / 生物网络 按器官/系统组织的 18 个数据与图谱生产网络
Regional Network 区域网络 非洲/亚洲/拉丁美洲/中东 4 个区域协调网络,改善全球代表性
DCP Data Coordination Platform / 数据协调平台 EBI/Broad/UCSC 合作的数据治理与发布中枢(2017-06 启动)
Data Portal data.humancellatlas.org 官方数据门户,Data Explorer 检索 + 快照导出
TDR Terra Data Repository DCP 底层云端存储与快照管理设施
Tier 1 / Tier 2 元数据 元数据分级 Tier 1 为整合必需字段;Tier 2 为高价值或潜在标识字段(部分受控)
embargo 数据禁运 图谱发表前数据仅对整合团队可见的保密机制
CELLxGENE Discover CZI 单细胞聚合平台 跨研究浏览与可视化;与 HCA schema 协调
Census CELLxGENE Census 版本化跨研究语料库,Python/R API(TileDB-SOMA),含 LTS 长期支持版本
AnnData / h5ad 单细胞数据容器 注释矩阵标准格式(X 表达层 + obs 细胞元数据 + var 基因元数据)
first draft atlas 首版草案图谱 18 个网络图谱整合后的第一版全身参考,2024-11 起进入组装阶段
celltype.info HCA 细胞注释平台 细胞类型标注与查询的社区工具
Equity Working Group 公平工作组 联合各地科学家推进全球公平参与、培训与路演
DCA Data Contributor Agreement / 数据贡献者协议 数据提交的强制合规门槛,确保符合当地数据保护法规

§2 医学与生物学背景

§2.1 ICD-11 编码映射

HCA 本身不是某单一疾病的专病数据集,而是健康人体的细胞类型参考图谱。其疾病相关性体现在:为以特定细胞类型易损、缺失或组成偏移为特征的疾病提供正常基线与机制线索。下表给出 HCA 数据生态(健康参考 + 疾病对照研究)最典型支撑的 ICD-11 应用映射(应用场景映射,非患病率标注):

ICD-11 编码 中文名 英文名 与 HCA 的关联逻辑
CA23 哮喘 Asthma 肺网络细胞普查识别哮喘中新出现的细胞状态(Vieira Braga 2019)
CA22 慢性阻塞性肺疾病 Chronic obstructive pulmonary disease 健康-疾病整合肺图谱(Sikkema 2023)支撑气道疾病细胞研究
RA01 COVID-19 COVID-19 HCA 肺与免疫网络在疫情中被用于定位病毒靶细胞与病理免疫细胞
5A14 1 型糖尿病 Type 1 diabetes mellitus 胰腺网络刻画胰岛细胞类型,支撑自身免疫靶细胞研究
BA41 急性心肌梗死 Acute myocardial infarction 心脏网络提供心肌与非心肌细胞参考,支撑心梗后修复研究

注意:本条目不含疾病状态的患者队列表型,ICD-11 仅作为 HCA 生态所支撑的上游疾病研究场景的语义锚点;请勿把 HCA 当作疾病患病率或诊断数据集使用。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 SNOMED CT 术语
哮喘 CA23 195967001 Asthma
慢性阻塞性肺疾病 CA22 13645005 Chronic obstructive lung disease
COVID-19 RA01 840539006 COVID-19
1 型糖尿病 5A14 46635009 Diabetes mellitus type 1
急性心肌梗死 BA41 22298006 Myocardial infarction

ICD-11 与 SNOMED CT 均为"应用场景语义锚点",用于在百科中把 HCA 与上游疾病研究主题做编码映射,便于检索与互操作;HCA 数据本身不含这些疾病的患病样本或诊断标签,映射仅供理解其研究用途边界,不可当作数据集内含的疾病标注。

§2.2 疾病简介与流行病学背景

人体约由 37 万亿个细胞构成,每种疾病最终都表现为特定细胞类型的分子状态、数量或空间组织偏离常态。HCA 聚焦的"健康参考"因此是理解疾病的基础设施:呼吸系统方面,肺网络的细胞普查已在健康与哮喘肺中识别新的细胞状态(Vieira Braga et al. 2019),健康-疾病整合肺细胞图谱进一步把多种气道疾病的细胞变化纳入统一比较框架(Sikkema et al. 2023);免疫与肺网络在 COVID-19 疫情中被广泛用于识别病毒进入受体表达细胞与病理性免疫状态;胰腺网络与心脏网络分别为 1 型糖尿病与心肌梗死等疾病提供细胞级正常基线。需强调:HCA 的"流行病学"意义不在于患病率统计,而在于提供疾病背景下细胞类型易损性研究的正常基线。

为何 HCA 选择"全身多网络"而非单器官突破。 联盟的设计有方法论上的三重考虑:其一,单细胞技术的成熟度在 2016 年前后刚好允许以可承受成本对多组织并行采样,联盟化可摊薄协议开发成本;其二,“每种细胞类型在全身的分布"本质是跨器官问题——免疫细胞几乎所有组织都有,发育过程贯穿多系统,只有全身网络才能回答"同一类型在不同器官中是否同一”;其三,医学价值最大的疾病(肿瘤微环境、代谢、自身免疫)都横跨多器官。因此 HCA 以 18 个 Biological Network 为生产单元、以 4 个区域网络改善人群代表性,形成"网络分工 + 全局整合"的架构。

相关疾病研究的方向性定位。 从疾病谱来看,HCA 关联的主要方向是"细胞类型分辨率下的疾病机制":(1) 呼吸道疾病——哮喘与 COPD 的气道上皮/免疫细胞状态变化已有专门图谱支撑;(2) 代谢与内分泌疾病——胰腺网络对胰岛细胞类型的刻画支撑 1 型糖尿病的自身免疫靶细胞研究;(3) 心血管疾病——心脏网络提供心肌、内皮与间质细胞的参考构成;(4) 神经与感觉系统——神经与眼网络的草案图谱为神经退行与视网膜病变研究铺垫;(5) 发育与先天异常——发育网络对胚胎与胎儿组织的刻画为先天性疾病提供细胞级线索。需要再次强调:这些是 HCA 数据拟支撑的"上游研究场景",任何患病率/预后结论都必须另配真实临床样本,不能在健康参考图谱上直接下流行病学推断。

§2.3 生物学/临床研究任务定义

任务 定义 在本数据集中的实现
全身细胞类型普查 建立人体各组织细胞类型的层次化目录 18 个 Biological Network 按器官推进,统一本体对齐
跨组织类型同源性判定 判定同一细胞类型在不同器官中的分布与特化 免疫、内皮等泛组织类型靠跨网络整合对齐
健康-疾病对照 以健康参考为基线定位疾病易损细胞 肺/胰腺/心脏网络支撑哮喘、糖尿病、心梗等研究
发育谱系刻画 刻画从胚胎到成人的细胞谱系与分化轨迹 发育网络采集胚胎/胎儿/儿童组织做拟时序与谱系推断
标注迁移与图谱整合 把跨实验室数据整合为统一图谱 Sikkema 2023 等确立大规模跨数据集整合方法

§2.4 样本与供体人群表

HCA 数据为细胞级参考图谱,非患者队列。组织来自经书面知情同意的捐赠者(含死后组织、手术残留组织、胚胎与胎儿组织等),须符合当地伦理法规与 HCA 伦理框架;直接标识符在编码过程中移除,数据匿名化后进入公有领域资源。以下为供体/样本概况(依据已发表论文与官方治理文件):

维度 说明
样本来源 经知情同意的人体组织捐赠者(死后/手术/发育阶段组织),非前瞻性临床队列
覆盖阶段 从胚胎、胎儿到儿童与成人组织;健康与基础研究背景为主,部分疾病对照
规模 1.12 万捐赠者、约 7,050 万细胞、527 项目(截至 2026-09)
地域构成 100+ 国家/地区参与;非洲/亚洲/拉美/中东区域网络持续改善代表性
伦理机制 书面知情同意 → 编码去标识 → 匿名化数据进入公有领域;Ethics/Equity 工作组治理
访问分级 开放(CC BY 4.0)/ managed access(Tier 2 潜在标识字段)/ embargo(图谱发表前保密)
区域构成 非洲/亚洲/拉丁美洲/中东区域网络由当地研究者领导,持续提升全球代表性

无公开的供体级年龄-性别-族裔分层总表可整表引用;涉及人群亚组分析须回溯各项目原始论文与对应元数据(部分 Tier 2 字段如自我报告族裔、BMI 按受控流程提供)。

§2.5 临床/科研价值

HCA 的价值在于把"疾病在细胞层面发起与演化"变成可系统检验的问题:(1) 提供全身每种细胞类型的分子与空间档案,作为疾病比较的基线;(2) 提供跨研究可比的标准化语料,使药物靶点、生物标志物与脱靶效应的细胞类型归因成为可能;(3) 提供发育与衰老的参考轨迹,支撑再生医学与年龄相关疾病研究;(4) 通过区域网络与伦理框架,让图谱成果更公平地惠及不同人群。它不直接用于个体诊断,而是支撑从机制发现到转化研究的整条链路。

从"细胞身份"到"临床转化"的价值链路。 HCA 把过去只能按组织学粗略描述的器官,变成可按分子身份寻址的细胞类型地图。对转化研究者,这条链路分四步:(1) 定位——在健康参考中找到目标细胞类型的分布与标记基因;(2) 归因——把疾病 GWAS 变异、药物响应或病理信号映射到具体细胞类型;(3) 验证——用疾病单细胞数据与模型系统检验该类型是否真的易损;(4) 干预——设计靶向该类型的治疗策略。每一步都依赖"健康图谱 + 标准化语料"这个底座,但最终临床兑现仍需独立验证与监管审批。

§2.6 金标准表

划分/标注层面 标注方式 标注者 性质
细胞类型标注(cell_type) 计算聚类 + 本体化命名 + 专家判读 各项目作者团队,经整合网络协调 共识标注,随聚类粒度与本体版本演化
组织/疾病/发育阶段标签 受控本体词表对齐(schema 必填字段) 数据提交者 + DCP 治理团队 结构化元数据,经提交校验
网络草案图谱注释 跨数据集整合 + 参考锚点标注 各 Biological Network 整合团队 联盟级共识(如肺/神经/眼草案)
Tier 2 敏感元数据 结构化采集 + 受控管理 数据提交者 + 治理团队 部分字段 managed access

金标准的使用哲学:HCA 的 cell_type 是"计算发现 + 本体约束 + 专家确认"的共识标签,不是一行一个唯一正确答案的硬真值。做监督学习时建议:以所选快照/Census LTS 的注释为训练标签,同时声明标注粒度与本体版本;把"该标注能否在独立研究/平台上复现"作为评估维度。若你的聚类结果与官方标签不一致,优先排查批次、平台与本体版本差异(坑点 2/4),而非认定自己出错——标注本身随图谱演化而更新(见 §7.6)。


§3 数据集规格

§3.0 版本抉择矩阵

HCA 数据以"滚动快照 + 多层入口"形式演进,无单一压缩包版本。用户应依据目标选择数据入口:

你的需求 推荐数据入口 规模/内容 理由
按项目检索并下载权威文件 HCA Data Portal(data.humancellatlas.org)Data Explorer 527 项目 / 7,050 万细胞(截至 2026-09) 官方权威来源:按 tissue/assay/donor 过滤,导出 manifest + curl 或推入 Terra
程序化取数、训练模型 CZ CELLxGENE Census 跨研究聚合语料,Python/R API(TileDB-SOMA) 版本化 LTS 快照、统一 schema、切片直取 AnnData/Seurat 对象,最适合 ML
交互浏览、快速勘探 CELLxGENE Discover Explorer / Portal 内嵌浏览器 精选注释矩阵 免下载可视化,先看聚类与标记基因再决定是否深挖
使用某个器官的整合图谱 对应 Biological Network 草案图谱(肺/神经/眼等已发布) 跨项目整合的图谱级数据 已整合、已注释,适合直接做参考与标注迁移
原始 FASTQ 再分析 Portal 导出 → Terra workspace 项目级原始数据 需自建比对/定量 pipeline,成本高、仅在必要时使用

§3.1 模态详情

HCA 数据以转录组为主轴,多模态随项目扩展:

模态 技术 产出数据类型 覆盖
单细胞转录组 scRNA-seq(10x 等液滴平台、Smart-seq 类全长平台) 基因表达矩阵 + 细胞元数据 全身多组织,规模主力
单核转录组 snRNA-seq 适合冷冻/复杂组织 脑、心、肌骨等组织补充
空间转录组 Visium、MERFISH 等空间成像 原位表达 + 空间坐标 部分器官网络的空间验证
蛋白与表观扩展 CITE-seq(蛋白)、ATAC(可及性)等 多模态矩阵 随项目而异
免疫库序列 V(D)J 富集测序 TCR/BCR 克隆型 免疫网络相关项目
元数据 Tier 1/Tier 2 结构化模板 供体/样本/协议字段 全部项目强制

多模态与元数据如何被治理。 HCA 的技术重心不在"同一细胞测所有模态",而在"跨项目数据可比":(1) 表达矩阵按 AnnData h5ad 提交,X 层为 raw counts(部分项目另附 normalized 层),稀疏矩阵(≥50% 零值时强烈建议 csr 格式)降低存储与传输成本;(2) 元数据按 Tier 1(整合必需)与 Tier 2(高价值或潜在标识,如自我报告族裔、BMI)分级采集,Tier 2 中含潜在标识的字段进入受控系统;(3) 细胞类型、组织、疾病、发育阶段等标签对齐受控本体词表,保证跨研究语义一致。因此用户看到的一个 cell_type 标签,背后是"该项目聚类 + 本体对齐 + 治理校验"的合力——跨项目使用时仍须警惕标注口径与批次差异(见坑点 2/4)。

§3.2 关键子集样本数

子集 规模 来源
全联盟(Data Portal 实时) 约 7,050 万细胞 / 1.12 万捐赠者 / 527 项目 / 997 实验室 Data Portal 首页(截至 2026-09)
全联盟(2024-12 学术评述口径) 6,270 万细胞 / 9,200 捐赠者 / 478 项目 PMC 学术评述(2024-12)
CZ CELLxGENE 聚合语料(含 HCA) 2023-10 口径 1,102 数据集 / 9,020 万细胞(5,620 万去重) CELLxGENE Discover 论文
肺脏整合图谱(健康+疾病) 跨数据集整合的器官级参考 Sikkema et al. 2023, Nat Med 29:1563-1577
健康与哮喘肺细胞普查 跨研究气道细胞普查,识别新细胞状态 Vieira Braga et al. 2019, Nat Med 25:1153-1163
草案图谱网络 肺、神经系统、眼三网络率先组装 Nature 合集(2024-11)

各口径的细胞计数定义不一(是否去重、是否含疾病数据、QC 阈值),跨来源引用时须回查原始出处并注明截点日期。

§3.3 数据格式

数据类别 典型格式 说明
原始测序 FASTQ 经 Portal 上传,embargo 期内仅整合团队可见
注释矩阵 AnnData h5ad X 层 raw counts(≥50% 零值强烈建议 scipy.sparse.csr);所有矩阵层形状/标签一致
归一化矩阵 h5ad 附加层 部分项目附 normalized 层,便于直接可视化
元数据 TSV/CSV 模板(Tier 1/Tier 2) 经 DCP 治理团队校验后入库
交互格式 cxg CELLxGENE Explorer 所用格式
跨研究语料 Census(TileDB-SOMA) 版本化 S3 存储 + Python/R API

格式互操作提示:注释矩阵的 h5ad 是 scanpy/Seurat 生态的通用交换格式,可直接读入;Census 输出可直接转为 AnnData 或 Seurat 对象;跨研究分析优先用 Census(统一 schema、锁定 LTS 版本),按项目精修再回 Portal 取权威文件。注意 CELLxGENE schema 要求提交 raw counts——把 normalized 数据当 counts 做差异分析或再建模是常见错误(坑点 3)。

§3.4 存储大小

HCA 数据规模随项目滚动增长(2026-09 口径:约 7,050 万细胞、527 项目),联盟未公布单一的"总字节数"权威值。量级感知:单个项目的注释矩阵(h5ad)通常在数百 MB 至数 GB;一次跨研究 Census 子集切片通常 GB 级以内;含原始 FASTQ 的全量数据远大于此,建议留在云端(Terra)而非本地常驻。实用原则:按"组织 × 疾病 × assay"过滤出最小必需子集,先在云端勘探,再决定本地下载范围(见 §6.2)。

§3.5 标注方式

标注以计算聚类 + 本体对齐 + 专家注释为主(弱监督/半自动范式):各项目对表达矩阵做无监督聚类,依标记基因与已知生物学命名,再按社区 schema 把标签对齐到受控本体词表;DCP 治理团队对元数据完整性与格式做提交校验;网络整合团队在图谱级再做跨项目注释协调。CELLxGENE 的 11 个必填元数据字段(物种、组织、年龄、性别、族裔、assay、细胞类型、悬液类型、供体、疾病、ID)构成了跨研究注释的最小公约数。

标注三层递进:(1) 项目内聚类——Leiden/Louvain 等算法产出簇,专家赋名;(2) 本体对齐——把簇标签映射到细胞类型本体词表,使"肝中的巨噬细胞"与"肺中的巨噬细胞"可比;(3) 图谱级协调——网络整合团队做跨项目参考锚点,统一粒度与命名。对做监督学习的用户,意味着 cell_type 是"经治理的共识标签",但跨项目粒度仍可能不一(有的到亚型、有的只到大类),使用前务必统计标签分布并声明粒度(见坑点 2)。

§3.6 标注者资质与一致性

标注由各项目的细胞图谱专家(生物学+计算)完成,网络整合团队(含肺、神经、眼等草案图谱作者)负责跨项目协调;元数据由数据提交者填报、DCP 治理团队(wrangler team)校验。一致性保证主要靠三条:统一 schema 与提交校验(格式层)、本体对齐(语义层)、网络级整合复核(生物学层)。由于是联邦式生产,跨项目标注的粒度与置信度并不天然统一——用户应把"标注质量分层"纳入分析设计(如区分"参考图谱注释"与"单项目注释")。

§3.7 采集周期

联盟 2016-10 启动,数据生产自 2017 年先导项目起滚动进行:DCP 于 2017-06 上线治理流程;2019 年起各网络数据陆续经 Portal 发布;Data Portal 以月度为节奏更新快照(AWS Open Data 注册口径:monthly update)。2024-11 的 Nature 合集标志"整合阶段"开启,此后新增数据持续汇入直至首版草案图谱完成。

§3.8 地域覆盖

HCA 为全球开放联盟:官网口径 3,900+ 成员、1,700+ 机构、100+ 国家/地区(2026-09)。组织委员会与主要数据中心位于英国(Wellcome Sanger、EBI)与美国(Broad、UCSC、CZI),但样本与实验室遍布全球;非洲、亚洲、拉丁美洲、中东 4 个区域网络由当地研究者发起与领导,负责协调本区域优先级、组织培训与路演,确保图谱代表并惠及全球人群。Equity 工作组与各地科学家合作举办线上线下会议,推进公平参与。

§3.9 设备与测序平台

单细胞平台以 10x Genomics 液滴系统与 Smart-seq 类全长方案为主力,单核方案覆盖冷冻组织;空间转录组采用 Visium 等捕获芯片与 MERFISH 类原位成像;蛋白扩展用 CITE-seq 抗体寡核苷酸标记;免疫库用 V(D)J 富集测序。提交规范对矩阵层有明确技术要求(raw counts、稀疏 csr、层形状一致);具体平台信息以各项目元数据中的 protocol 字段为准。

§3.10 深度溯源链

从原始数据到图谱的溯源链为:实验室采样与知情同意(含 Data Contributor Agreement)→ FASTQ 上传 + 元数据模板(Tier 1/Tier 2 分级)→ DCP 治理校验(wrangler 审核)→ TDR 存储(快照式)→ Data Portal 发布(Data Explorer 检索)→ 网络整合(图谱级注释)→ 论文发表(embargo 解除)。每一环都有协议与校验记录;embargo 机制保证"图谱发表前,数据仅整合团队可见",解除后转入开放。

治理环节明细:

环节 责任方 关键机制
采样与同意 各实验室 书面知情同意 + 数据贡献者协议(DCA)
提交与校验 提交者 + DCP wrangler 元数据模板、问卷(定制字段/embargo 判定)、安全文件夹上传
存储与快照 DCP / TDR Tier 1/Tier 2 分级、受控字段隔离存储
发布与导出 Data Portal Data Explorer、manifest + curl、Terra workspace
embargo 管理 联盟 + 整合团队 图谱发表前保密,仅整合团队可见;可申请提前解除

§3.11 参与机构与分工

HCA 由联盟会员(个人注册、同意伦理原则)与机构伙伴构成,核心分工如下:

角色 代表机构 职能
共同创立/治理 Aviv Regev、Sarah Teichmann 及组织委员会 战略方向、网络协调、伦理框架
数据生产 18 个 Biological Network 成员实验室 各器官/系统的单细胞与空间数据采集
区域协调 非洲/亚洲/拉美/中东区域网络 本区域优先级、培训、公平参与
数据治理与发布 DCP(EBI/Broad/UCSC Genomics Institute) 元数据校验、TDR 存储、Portal 发布
资助方 Wellcome、CZI、Helmsley、MRC、EU、BHF、Klarman Family Foundation 等 资金支持(CZI 2017-06 资助 DCP、2017-10 资助 38 先导项目)
跨联盟标准协调 HCA/HuBMAP/HTAN 与 CZI 最小 schema 与本体对齐

具体某数据集的实验室归属、建议引用与致谢请以 Data Portal 中该项目页与随附引用指南为准。


§4 数据结构

§4.0 目录树(示意)

HCA 数据非单一压缩包,而是"Portal 项目页 + TDR 快照 + CELLxGENE 聚合"多层形态。下表为从 Data Portal 导出某项目后常见的组织方式示意:

hca_project_export/
├── project.json              # 项目级元数据(标题、描述、贡献者、许可)
├── donors/                   # 供体级元数据(去标识化)
│   └── donor_metadata.tsv
├── specimens/                # 样本/标本级元数据(组织、取材部位)
│   └── specimen_metadata.tsv
├── protocols/                # 实验协议元数据(assay、解离、测序平台)
│   └── library_prep.tsv
├── expression/               # 表达矩阵(AnnData h5ad,X 层为 raw counts)
│   ├── sample_A.h5ad
│   └── sample_B.h5ad
├── cell_metadata/            # 细胞级元数据(本体化标签)
│   └── cells.csv
├── manifest.tsv              # 文件清单(Portal 生成,配合 curl 批量下载)
└── README_hca_access.md      # 导出说明与引用指引

实际文件路径随项目与导出方式而异,请以 Data Portal 中该项目页的 manifest 与导出说明为准;CELLxGENE 会以 h5ad/cxg 封装而非原始目录;Census 则经 API 切片返回 AnnData/Seurat 对象。

"一个细胞"在不同入口里的不同呈现。理解 HCA 的数据组织,核心是认清"同一生物对象在三层入口中有三种载体":

数据对象 出现于 关键标识/如何关联
一个细胞/核的表达 + 注释 Portal 导出 h5ad / CELLxGENE h5ad cell_id(关联 donor/样本/项目)
跨研究聚合视图 CELLxGENE Discover / Census 统一 schema 字段(tissue/cell_type/disease/assay 等)
器官级整合图谱 各 Biological Network 草案 图谱参考锚点 + 类型归属(整合团队协调)
原始读段 Portal(FASTQ) 文件级 manifest,须自建 pipeline

绝大多数跨入口关联是"统一 schema 字段"层面的语义对齐,而不是同一记录的逐行 join:同一细胞类型在不同入口的标签可能粒度不同(项目内亚型 vs 图谱级大类)。做多入口研究时,应在应用层以 schema 字段为键显式对齐并锁定版本(坑点 7),不要假定三个入口的表格天然可逐行拼接。

§4.1 DAIMS 字段字典(核心细胞元数据表)

以下为 CELLxGENE 最小 schema 11 必填字段(HCA 提交时对齐)与常见扩展字段(列名随入口略有差异):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
cell_id / obs 名 Text 唯一细胞/核标识 AAACCTGCAT…-1 主键/关联 唯一性经提交校验 不应缺失 数据集内唯一
donor_id Text 供体标识(去标识化) D_0042 分组/泄漏控制 供体间批次效应 不应缺失 项目内唯一
species Text 物种 Homo sapiens 过滤 无 不应缺失 受控词表
tissue Text 组织(本体化) lung 分层/过滤 取材定位误差 不应缺失 组织本体词表
assay Text 测序/成像方法 10x 3’ v2 批次校正 平台批次效应 不应缺失 方法本体词表
disease Text 疾病状态(本体化) normal 疾病对照 报告口径差异 不应缺失 疾病本体词表
cell_type Text 细胞类型(本体化) alveolar macrophage 分类标签 聚类不确定性 低置信标注 细胞类型本体词表
suspension_type Text 悬液类型 cell / nucleus 模态区分 制备差异 不应缺失 cell/nucleus
age Text 供体年龄 34 发育/年龄分层 自报/记录误差 NA 显式 年份/发育阶段
sex Text 生理性别 female 分层 记录口径 NA 显式 female/male/unknown
ethnicity_self_reported Text 自我报告族裔(Tier 2) — 公平性审计 自报偏差 NA/受控 受控词表
development_stage Text 发育阶段(本体化) adult 发育建模 阶段判定误差 NA 显式 发育本体词表
dataset_version Text 所属快照/Census 版本 Census LTS 2024 版本锁定 版本漂移 不应缺失 版本号

§4.2 标签分布

HCA 的标签分布由 18 个网络的覆盖决定:肺、免疫、心脏、肾脏、肠道等器官深度大,部分组织(如某些发育阶段与罕见取材部位)样本稀少;细胞类型分布上,免疫细胞(T 细胞、巨噬细胞、B 细胞等)因取材便利在全联盟占比高,而深部组织特异类型(如神经元亚型、胰岛内分泌细胞)依赖专门网络。健康供体数据占主体,疾病对照(哮喘、COVID-19、糖尿病等)集中于少数网络。各标签的实际占比随截点日期、QC 与去重口径而变,用户须按实际下载的快照统计自身子集分布,而非直接套用官网计数。

标签构成的语义解释。 HCA 的 cell_type 标签对齐到细胞类型本体词表,粒度从大类(immune cell)到亚型(LAMP3+ 树突细胞)不一:项目内注释可能用更细的簇名,图谱级整合则倾向统一到参考粒度。组织(tissue)与疾病(disease)标签同为本体化字段,“normal” 是健康对照的规范取值。理解"同一类型在不同项目粒度不同"是解读标签分布的前提(见坑点 2)。

§4.3 关键统计

  • 全联盟规模:约 7,050 万细胞 / 1.12 万捐赠者 / 527 项目 / 997 实验室(Data Portal,截至 2026-09)。
  • 2024-12 口径:6,270 万细胞 / 9,200 捐赠者 / 478 项目。
  • 联盟规模:3,900+ 成员、1,700+ 机构、100+ 国家/地区(官网,2026-09)。
  • 生物网络:18 个 Biological Network + 4 个区域网络。
  • 草案图谱:肺、神经系统、眼三网络率先组装(2024-11)。
  • CELLxGENE 聚合语料:1,102 数据集 / 9,020 万细胞(5,620 万去重,2023-10 口径)。
  • CELLxGENE 最小 schema:11 个必填元数据字段。
  • 元数据分级:Tier 1(整合必需)/ Tier 2(高价值或潜在标识,部分受控)。
  • 更新节奏:Data Portal 月度快照;Census 提供版本化 LTS。
  • 愿景论文引用:2,856+(Google Scholar,截至 2026-09)。

§4.4 数据层级

与患者→检查→切片的临床层级不同,HCA 的层级是 联盟 → Biological Network/区域网络 → 项目 → 供体 → 样本/标本 → 细胞/核。元数据在供体、样本、协议、细胞四级分别采集(Tier 1/Tier 2 分级贯穿各级);跨研究聚合的关键中间键是 schema 字段(tissue/cell_type/disease/assay/donor)。

层级拆解为下表,帮助理解"某一记录处于哪个粒度":

层级 粒度示例 说明
联盟 HCA 顶层框架,统一伦理与许可
网络 Lung Bionetwork / 非洲区域网络 决定器官语境与整合团队
项目 某实验室某研究 数据生产与引用单元,含 embargo 状态
供体 donor_id(去标识化) 个体与批次来源,分组交叉验证单元
样本/标本 specimen(组织、取材部位) 协议与解离信息挂载层
细胞/核 cell_id 单记录 实际测量单元,表达 + 注释

关键:跨项目分析时,"供体"与"项目"是两个必须同时保留的分组维度——同一供体可能贡献多个样本,同一项目必然共享协议批次;只按其一分组都会造成泄漏或校正不足(见 §5.3)。

§4.5 缺失值 + 信息性缺失编码

  • 模态与字段缺失是信息性的:并非每项目都采集空间、蛋白或 V(D)J 数据;Tier 2 字段(如自我报告族裔)在部分项目缺失或走受控流程。这是设计所致,须显式处理而非当随机缺失丢弃。
  • 疾病标签的 “normal” 与疾病名称是规范取值;未采集疾病信息的场合按 schema 规则填报,不应把"正常"与"未记录"混为一谈。
  • 年龄/发育阶段:成人供体常以年龄给出,发育阶段样本用发育阶段词表;两者互补但不同粒度,建模时应统一分层方式。
  • 编码惯例:开放数据以 NA/空值显式标注缺失并伴随说明列,不鼓励用 0 或 -1 隐式编码(避免被当作真实测量值)。
  • 版本间差异:滚动更新意味着同一项目在不同快照中的细胞数、注释可能变化;始终引用快照/Census LTS 版本号,跨版本对比前先 diff 元数据。
  • 跨入口口径差异:Portal 项目页、CELLxGENE 与网络图谱对同一数据的"细胞数"可能不同(去重、QC、纳入标准不同),跨来源引用须注明口径(坑点 7)。

§5 划分与使用建议

§5.1 官方划分

HCA 无"官方 train/test"划分——它是滚动参考图谱而非带标注任务的 ML 数据集。官方提供的是数据层级与语义组织的自然分组:用户应按项目/网络、供体、组织、疾病状态与 assay 切分,以控制批次与语义差异;Census 的 LTS 版本则提供"稳定快照"这一事实上的版本边界。

§5.2 社区惯例划分

社区在跨组织建模与标注迁移任务中的通行做法:

  • 按供体划分:以 donor_id 做分组交叉验证,避免同一供体细胞跨 train/valid 泄漏(供体间组织微环境与批次差异远大于细胞间)。
  • 按项目/研究划分:把一个项目整体留出做外部验证,检验跨实验室泛化——这是标注迁移与基础模型评测的标准协议。
  • 按组织划分:训练组织留出(如除肺外全部训练、肺验证),评估"跨组织类型识别"的泛化;同源类型(免疫细胞)与组织特化类型应分开报告。
  • 按时间/版本划分:用早期快照训练、新快照验证,模拟图谱演化下的标注漂移。
  • 按网络划分:以某个 Biological Network 整体留出,评估"器官级图谱对全身语料的代表性",适合网络间协调研究。

§5.3 划分策略与泄漏风险

  • 细胞级随机切分的过度乐观:同一供体/样本的细胞高度相关(批次、取材部位、细胞组成),按细胞随机切分会造成供体/批次泄漏,验证指标虚高。必须按 donor_id(含样本层级)做分组(group)划分。
  • 跨入口重复计数泄漏:同一研究的数据可能同时出现在 Portal 项目、CELLxGENE 聚合与网络图谱三层入口中;跨入口取样而不去重,会把"同一批细胞"同时放进训练与验证。
  • 疾病对照的结构性关联:疾病-对照比较中,对照与健康参考高度重叠(正是 HCA 的设计目的);若把 HCA 对照数据用于训练再把疾病数据与之比较,须避免把"健康参考的注释选择"当作独立验证证据。
  • 标注演化泄漏:图谱整合团队的注释由"训练了整合模型的参考数据"产出;在相同数据上评测"整合注释预测能力"会循环论证。

§5.4 交叉验证建议

优先 GroupKFold by donor_id(样本层级同属一个供体时按供体分组);做跨实验室泛化时改用 GroupKFold by project;每个 fold 保持组织/疾病/assay 结构尽量均衡。类别层面:把罕见细胞类型与"低置信/未分类"细胞单独成类评估,避免删除后夸大精确率。推荐同时报告三组结果——留供体(个体泛化)、留项目(实验室泛化)、留组织(跨组织泛化),分别对应三类部署场景。

推荐的划分组合(依任务与数据规模):

任务 建议划分 说明
单组织细胞类型分类 GroupKFold by donor 供体数通常充足,可做稳健组间验证
标注迁移(新数据自动注释) 按项目留出 参考图谱来自其他研究,检验真实迁移场景
跨组织类型识别 组织留出 + 同源类型锚点 免疫等泛组织类型单独报告
疾病-对照差异组成 供体分组 + 对照来源声明 声明对照是否来自健康参考
基础模型预训练/评测 版本边界(LTS)+ 项目留出 预训练语料与评测集不重叠

§5.5 外部验证建议

利用官方独立数据作外部验证:(1) 留出项目/研究——同 schema 但不同实验室的数据;(2) 空间转录组子集——作为独立模态验证注释的空间合理性;(3) 各网络草案图谱——更大规模独立整合注释;(4) 对应疾病数据集(如哮喘、COVID-19 研究)——验证健康参考在疾病场景的区分力。所有外部验证须引用对应原始论文与版本。

外部验证矩阵(本数据集可用的官方独立数据):

外部数据 用途 为何是独立证据 关键注意
留出项目数据 跨实验室泛化 平台/协议独立重测 声明 schema 版本一致
空间转录组子集 注释空间验证 独立成像模态 粒度对齐后再比对
肺/神经/眼网络草案图谱 图谱级一致性 联盟整合团队独立注释 注释粒度差异
疾病单细胞研究(哮喘/COVID-19 等) 疾病场景区分力 独立人群与研究 仅作迁移评测,勿当患病率

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

HCA 数据的官方入口本身就是云端形态,多数勘探无需本地下载:

  • HCA Data Portal(data.humancellatlas.org):Data Explorer 按 tissue/assay/disease/donor 过滤,页面内嵌可视化,可导出 manifest + curl 或推入 Terra workspace。
  • CZ CELLxGENE Discover(cellxgene.cziscience.com):跨研究聚合浏览与交互可视化,schema 与 HCA 协调。
  • CELLxGENE Census:Python/R API 直连版本化语料(TileDB-SOMA),切片直取 AnnData/Seurat 对象,含 LTS 长期支持版本。
  • Terra:DCP 底层云端分析环境,适合大规模工作流。
  • celltype.info:HCA 细胞类型注释查询平台。

对只做"看聚类、验 marker"的用户,Portal/CELLxGENE 网页即可完成;要程序化取数直接上 Census;要原始 FASTQ 再分析才进入 Terra 工作流。

一条推荐的云端起步路径(零本地安装):

  1. 打开 data.humancellatlas.org → Explore Data,用 tissue = lung + disease = normal 过滤,浏览候选项目;
  2. 在 CELLxGENE Discover 中打开同一数据集,交互查看 UMAP 与标记基因(如 EPCAM 标记上皮、PTPRC 标记免疫);
  3. 确认所需子集后,用 Census Python API 切片取数并锁定 LTS 版本;
  4. 需要权威文件或原始数据时,回 Portal 生成 manifest + curl 或推入 Terra(见 §6.2)。

§6.1 快速上手

本小节假设用户已通过 Census API 获取一个小规模多组织切片(如肺+血液的正常供体数据)。Census 输出即 AnnData 对象,obs 含统一 schema 字段,可直接进入 scanpy 流程。

import cellxgene_census
import scanpy as sc

# 用上下文管理器打开指定版本的 Census(复现请固定 census_version)
with cellxgene_census.open_soma(census_version="latest") as census:
    adata = cellxgene_census.get_anndata(
        census=census,
        organism="Homo sapiens",
        obs_value_filter="tissue == 'lung' and disease == 'normal'",
    )

print("AnnData 形状:", adata.shape)
print("obs 字段:", list(adata.obs.columns)[:12])
print("assay 分布:\n", adata.obs["assay"].value_counts().head())
print("donor 数:", adata.obs["donor_id"].nunique())

从 Census 到本地建模的最小流程:

# 标准预处理(按 assay 分别 QC 后再整合)
def qc_subset(adata, min_genes=200, pct_mt_max=20):
    adata.var["mt"] = adata.var_names.str.startswith("MT-")  # 人类基因用大写 MT- 前缀
    sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], inplace=True, percent_top=None)
    adata = adata[adata.obs["pct_counts_mt"] < pct_mt_max, :].copy()
    sc.pp.filter_cells(adata, min_genes=min_genes)
    return adata

# 按 assay 分组 QC,避免平台混拼污染
adata = qc_subset(adata)
sc.pp.normalize_total(adata, target_sum=1e4)
sc.pp.log1p(adata)
sc.pp.highly_variable_genes(adata, n_top_genes=3000)
sc.pp.pca(adata)
print("QC 后细胞数:", adata.n_obs)

关键纪律:X 层是 raw counts(Census 直取即为 counts),先 QC 再 normalize;人类基因前缀为 MT-,跨物种时注意大小写与命名差异(坑点 3/4)。

§6.2 数据获取

获取流程视数据类别而定:

数据类别 入口 流程/限制
项目级权威文件 data.humancellatlas.org → Data Explorer 过滤 → Add to cart → 导出 manifest + 生成的 curl 命令,或推入 Terra workspace;CC BY 4.0
跨研究聚合切片 CELLxGENE Census(Python/R API) open_soma(census_version=...) + get_anndata 切片;开放 S3 后端
交互可视化 CELLxGENE Discover / Portal 内嵌浏览器 免下载在线浏览
Tier 2 受控元数据 按项目页说明申请 含潜在标识字段走 managed access,签署使用协议
原始 FASTQ Portal 导出 → Terra 建议 Terra 内处理,避免本地大文件搬运
embargo 数据 联盟整合团队 图谱发表前仅整合团队可见;可申请提前解除
# Portal 导出的 manifest 批量下载示意(curl 命令由 Portal 自动生成,此处演示核对逻辑)
import pandas as pd

# manifest 示例列:file_path, size_bytes
manifest = pd.read_csv("manifest.tsv", sep="\t")
print("待下载文件数:", len(manifest))
print("总大小(GB):", round(manifest["size_bytes"].sum() / 1e9, 1))

# 按 h5ad/矩阵类文件过滤,跳过大体积 FASTQ(除非确需再分析)
needed = manifest[manifest["file_path"].str.endswith((".h5ad", ".h5", ".csv", ".tsv"))]
print("过滤后文件数:", len(needed))

版本锁定清单(写入你的实验记录):Census census_version(LTS 优先)、Portal 项目页快照日期、schema 版本、下载时间与 manifest 校验和。滚动更新下,这四项缺一不可复现(坑点 7)。

§6.3 预处理全流程

目标:将 Census/Portal 获取的多项目数据整合为可训练的 AnnData:按 assay QC → 标准化 → 批次校正 → 本体化标签检查。最小可用子集为单组织 2-3 个项目。

import scanpy as sc
import numpy as np

def preprocess_multisite(adata_list, batch_key="dataset_id"):
    """多项目数据整合:各自 QC+HVG 后合并,再按批次校正。"""
    processed = []
    for ad in adata_list:
        ad.var["mt"] = ad.var_names.str.startswith("MT-")
        sc.pp.calculate_qc_metrics(ad, qc_vars=["mt"], inplace=True, percent_top=None)
        ad = ad[ad.obs["pct_counts_mt"] < 20, :].copy()
        sc.pp.filter_cells(ad, min_genes=200)
        sc.pp.normalize_total(ad, target_sum=1e4)
        sc.pp.log1p(ad)
        sc.pp.highly_variable_genes(ad, n_top_genes=2000)
        processed.append(ad[:, ad.var["highly_variable"]].copy())
    import anndata as ad_mod
    merged = ad_mod.concat(processed, join="outer", label=batch_key)
    sc.pp.pca(merged)
    return merged

# 批次校正:社区常用 Harmony(以 project/donor 为 batch);
# 深度整合可用 scVI/scIB 系列,跨平台差异大时优先深度方法
# import harmonypy
# sc.external.pp.harmony_integrate(merged, key="dataset_id")

print("要点:按项目 QC → 合并 → 批次校正;donor_id/project 全程保留作分组键。")

标注审计三步(合并后必做):(1) 统计 cell_type 标签粒度分布,识别"大类 vs 亚型"混杂项目;(2) 抽查经典 marker 是否落在预期类型(见 §7.2 表);(3) 检查 disease/sex/age 等字段的取值规范性。标注口径不一的项目应在建模前决定"统一粒度"或"分粒度建模"(坑点 2)。

关键纪律:合并前统一基因命名(symbol vs Ensembl)、保留 donor_id/project 两级分组键、锁定快照版本;合并后再做标签审计,顺序不可颠倒。

§6.4 PyTorch DataLoader

构建细胞分类任务(以 cell_type 为标签)的可运行 Dataset。大规模语料建议用按需读取与供体分组,避免整矩阵载入内存。

import torch
import numpy as np
from torch.utils.data import Dataset, DataLoader

class CellTypeDataset(Dataset):
    """从 AnnData 读取细胞,返回(表达向量, 细胞类型标签)。
    做供体分组交叉验证时,obs 须含 donor_id。"""
    def __init__(self, adata, label_key="cell_type", type_to_idx=None):
        self.X = adata.X
        self.y = adata.obs[label_key].values
        if type_to_idx is None:
            self.type_to_idx = {t: i for i, t in enumerate(sorted(set(self.y)))}
        else:
            self.type_to_idx = type_to_idx
        self.idx_arr = np.arange(self.X.shape[0])

    def __len__(self):
        return self.X.shape[0]

    def __getitem__(self, i):
        row = self.idx_arr[i]
        x = torch.as_tensor(self.X[row].toarray().squeeze(), dtype=torch.float32) \
            if hasattr(self.X[row], "toarray") else torch.as_tensor(self.X[row], dtype=torch.float32)
        y = self.type_to_idx[self.y[row]]
        return x, y

# 使用示例(adata 来自 §6.3 预处理)
# ds = CellTypeDataset(adata)
# loader = DataLoader(ds, batch_size=256, shuffle=True, num_workers=4)
# xb, yb = next(iter(loader))
# print("batch 形状:", xb.shape, "标签形状:", yb.shape)

大规模内存建议:csr 稀疏存储 + 小 batch;Census 切片可分块拉取;供体分组用 sklearn GroupKFold by donor_id,切勿细胞级随机切分(见 §5.3)。

§6.5 坑点 8 个

以下 8 个坑点取自 HCA 的联盟级数据形态(滚动更新、多入口、本体化标注、Tier 分级、全球人群)所特有的失败模式,而非泛化清单。它们按影响贯穿"数据理解(坑点 2、8)→ 划分与泄漏(坑点 1、5)→ 预处理与批次(坑点 3、4)→ 工程与合规(坑点 6、7)"四个环节,多数在真实单细胞流水线中极难事后排查,建议在项目开始时即规避。

⚠️ 坑点 1:把"细胞数"当成"独立样本数"做随机切分(分类:数据泄漏)

问题:同一供体/样本的成千上万细胞高度相关(取材、批次、细胞组成、解离方案),按细胞随机切分会让同一供体的细胞同时进入训练与验证集,导致验证指标虚高、部署后泛化崩盘。HCA 供体规模(1.12 万)远小于细胞规模(7,050 万),切分单元的选择影响巨大。
症状:训练/验证准确率都逼近 1,但在新供体/新实验室数据上精度骤降;按项目分组的评测结果比随机切分低一大截。
解决:

  1. 简单方法:改用按 donor_id 的 GroupKFold,保证任一供体的细胞只出现在单侧;样本层级同供体时按供体分组。
  2. 进阶方法:同时报告"留供体"与"留项目"两套指标(个体泛化 vs 实验室泛化),把供体作为随机效应建模。
  3. SOTA 方法:跨项目 + 跨组织双重留出评测作为最终泛化证据,纳入置信区间与每类 per-class 指标。
    参考:https://data.humancellatlas.org(供体/样本层级元数据说明)

⚠️ 坑点 2:把 cell_type 标签当唯一权威真值,忽略粒度与本体演化(分类:标签理解)

问题:HCA 的细胞类型标注来自数百个项目与多个整合团队:有的项目注释到大类(immune cell),有的到亚型(LAMP3+ DC);图谱级整合注释又与项目级注释粒度不同;本体词表随图谱演化更新。把不同来源标签直接合并为一个标签空间,会把"粒度差异"当"真值冲突"。
症状:跨项目合并后同一类型出现多个近义标签;分类模型在"细粒度项目"上训练后无法预测"粗粒度项目";不同论文报告的类型数对不上。
解决:

  1. 简单方法:合并前统计标签分布与粒度,声明分析所用粒度层级;近义标签做映射表。
  2. 进阶方法:用 celltype.info 等官方注释平台核对类型语义;按"参考图谱注释 vs 项目内注释"分层建模。
  3. SOTA 方法:多解析度聚类 + 跨项目一致性评测,以独立 marker 与跨平台复现决定粒度,报告标签演化对结论的敏感性。
    参考:https://celltype.info(HCA 细胞注释平台)

⚠️ 坑点 3:raw counts 与 normalized 数据混淆(分类:预处理陷阱)

问题:HCA/CELLxGENE 提交规范要求 X 层为 raw counts(≥50% 零值强烈建议 csr 稀疏存储),部分项目另附 normalized 层便于可视化。不同入口(Census 切片 vs 项目导出 vs 第三方转发文件)拿到的矩阵层可能不同;把已 normalize 的数据再做一次 normalize/log、或把 log 数据直接做差异分析与方差建模,都是常见错误。
症状:QC 指标(总 counts、基因数)分布异常;差异表达结果被抹平;自编码器训练目标失真。
解决:

  1. 简单方法:读入后先检查整数性与最大值(raw counts 为非负整数),确认 X 层含义再进入流程。
  2. 进阶方法:以 adata.raw 保留 counts 副本;normalize/log 前先完成 QC 与过滤。
  3. SOTA 方法:在 pipeline 中显式记录矩阵层来源与版本;用 Census 直取可保证统一为 counts 口径。
    参考:https://www.humancellatlas.org/wp-content/uploads/2025/04/Data-Ingestion-Instructions_250225_published_v1.1.1.pdf(提交规范:raw counts 与稀疏矩阵要求)

⚠️ 坑点 4:跨实验室/平台批次效应直接合并(分类:预处理陷阱)

问题:HCA 汇集 997 个实验室的数据,解离方案(酶解 vs 核提取)、平台(10x vs Smart-seq)、测序深度差异显著;不同组织的细胞组成天然不同。直接合并会让 UMAP 按项目/平台成团而非按细胞类型,模型学到"实验室指纹"。
症状:可视化中同类型细胞按项目分开;分类特征重要性集中在平台特异基因;留项目评测性能暴跌。
解决:

  1. 简单方法:各项目先单独 QC+normalize,再合并做批次校正(Harmony/BBKNN);基因命名统一。
  2. 进阶方法:深度整合(scVI/scIB 系列)处理跨平台差异;把 donor/project 作为显式协变量。
  3. SOTA 方法:用留项目评测量化"实验室泛化",对整合后 embedding 做批次混淆统计(kBET 类指标)验证校正效果。
    参考:https://cellxgene.cziscience.com/(统一 schema 与跨研究聚合实践)

⚠️ 坑点 5:跨入口重复数据未去重,评测集被污染(分类:数据泄漏)

问题:同一研究的数据可能同时出现在 HCA Data Portal 项目页、CELLxGENE Discover 聚合与各网络草案图谱三层入口;Census 聚合语料与 Portal 项目数据存在重叠。跨入口取样组建训练/验证集而不去重,会把"同一批细胞"同时放进两侧。
症状:验证性能异常高;重复计算细胞数对不上官网口径;合并数据集时同一研究出现多次。
解决:

  1. 简单方法:以项目/研究标识为去重键,构建"数据源清单"后再切分。
  2. 进阶方法:按研究级去重后做 GroupKFold by project;记录每个细胞记录的入口来源。
  3. SOTA 方法:只用单一权威入口(如 Census LTS)组建全部分析数据,其他入口仅作交叉核对。
    参考:https://data.humancellatlas.org(与 CELLxGENE 的数据关系说明)

⚠️ 坑点 6:Tier 2 受控元数据与 embargo 数据当开放数据使用(分类:工程陷阱 / 合规)

问题:HCA 开放数据为 CC BY 4.0,但 Tier 2 中含潜在标识的字段(如自我报告族裔、BMI)按 managed access 保护,需签署数据贡献者/使用协议;embargo 期内的项目数据仅整合团队可见。把"联盟开放"误解为"一切字段/数据全部可取"会触碰合规边界。
症状:某些字段批量下载失败或缺失;计划中的人群亚组分析拿不到族裔字段;论文引用了 embargo 期数据。
解决:

  1. 简单方法:分析前在项目页核对每字段的访问级别,区分 Tier 1/Tier 2。
  2. 进阶方法:受控字段走正式申请并登记使用范围;开放替代字段(如区域级信息)做近似分析。
  3. SOTA 方法:项目内建立"字段-访问级别-用途"合规矩阵,发表前做合规审查。
    参考:https://www.humancellatlas.org/wp-content/uploads/2025/04/Data-Ingestion-Instructions_250225_published_v1.1.1.pdf(Tier 1/Tier 2 分级与 managed access 机制)

⚠️ 坑点 7:不锁版本,跨快照/Census 版本导致复现漂移(分类:工程陷阱)

问题:HCA 是滚动更新的活的图谱:Portal 月度快照(2024-12:478 项目/6,270 万细胞 → 2026-09:527 项目/7,050 万细胞),Census 有 weekly 与 LTS 两类版本。今天下载的数据三个月后可能已更新,注释与细胞数都可能变化;论文与代码若不记录版本,他人无法复现。
症状:同一代码不同时间跑出不同细胞数;合作者对不上数据量;审稿人质疑数字与官网不一致。
解决:

  1. 简单方法:所有分析固定 census_version(优先 LTS)或记录 Portal 快照日期,写入论文方法节。
  2. 进阶方法:保存 manifest 与校验和;用数据版本清单(快照 ID + 下载时间 + schema 版本)锁定输入。
  3. SOTA 方法:CI 中对固定版本做回归测试(细胞数/标签分布断言),跨版本迁移时先 diff 元数据再更新基线。
    参考:https://chanzuckerberg.github.io/cellxgene-census/(Census 版本化与 LTS 机制)

⚠️ 坑点 8:把健康参考图谱当疾病患病率/临床诊断数据(分类:标签理解 / 偏倚陷阱)

问题:HCA 以健康与基础研究背景组织为主体,疾病数据集中于部分网络;它是"正常参考",不是疾病队列,不含患病率、预后或个体诊断标签。用它训练"健康 vs 患病"分类器并外推临床结论,是把参考图谱当临床数据的类别性误用;同时全联盟的人群构成存在地理与族裔偏倚(区域网络正在改善),把当前语料当"全人类都如此"会放大偏倚。
症状:用 HCA 健康数据加疾病标签做"诊断模型";把某种细胞类型的比例外推为人群患病风险;忽略族裔构成差异做人群级论断。
解决:

  1. 简单方法:明确用途为"参考基线/机制研究",疾病结论另配真实患者队列;引用数据时注明截点与构成。
  2. 进阶方法:把 HCA 用作"正常对照"做差异细胞组成分析(反卷积/差异丰度),校正批次与组成混杂后再做疾病关联。
  3. SOTA 方法:分层审计人群代表性(年龄/性别/族裔/地域),对代表性不足的亚组限定结论范围,或引入区域网络数据进行补偿。
    参考:https://www.humancellatlas.org(联盟关于公平性与伦理框架的官方立场)

§6.6 数据增强

安全 ✅:细胞类型不平衡时做类别加权/下采样;跨项目用 Harmony/scVI 做稳健化;对表达矩阵做随机 dropout 掩码模拟测序噪声以训练自编码器鲁棒性;按供体重加权改善人群代表性偏倚。

危险 ❌:对 scRNA 做随机翻转/旋转(无空间意义);引入不存在的基因或跨物种基因随机替换制造假多样性;对已被 QC 丢弃的低质量细胞重采样作为"新数据";把不同疾病数据混入"健康参考"当对照。

增强操作用法速查:

操作 是否安全 说明
类别下采样/加权 安全 缓解免疫细胞等优势类型主导
表达随机 dropout 掩码 安全 模拟测序噪声,适合自编码器鲁棒性
Harmony/scVI 批次校正 安全 以 project/donor 为 batch
随机翻转/旋转 scRNA 危险 单细胞无空间对称性,引入假结构
跨物种基因随机替换 危险 破坏本体语义与同源关系
重采样 QC 丢弃细胞当新数据 危险 把噪声当真实,污染标签

增强哲学:单细胞数据的"增强"应尊重测量与生物结构——只在有意义的轴上引入变化(技术噪声、类别失衡、供体重加权),而绝不能引入生物学上不存在的自由度(伪基因、假空间变换)。

§6.7 模型推荐

任务 推荐方法 理由 关键工具
细胞类型聚类 Leiden/Louvain + 多分辨率扫描 社区标准、可复现 scanpy、Seurat
跨研究整合 Harmony、scVI、scIB 工作流 处理 997 实验室级批次差异 harmonypy、scvi-tools
细胞类型分类(监督) 线性模型/浅层 MLP on PCA 或预训练嵌入 高维稀疏下稳健可解释 sklearn、PyTorch
标注迁移(自动注释) 参考图谱 label transfer 复用 HCA 图谱给新数据打标签 scArches、scANVI、Azimuth
细胞组成反卷积 反卷积/差异丰度 疾病-对照组成分析 MuSiC、CARD、Milo
基础模型预训练 单细胞自监督/transformer 学习基因-细胞通用表示 scGPT、scBERT 类模型
程序化取数 Census API 切片 版本化、统一 schema、直取 AnnData cellxgene-census(Python/R)

选型提示。 监督分类/标注迁移通常不直接吃原始高维稀疏表达,而是先做 PCA 或图谱预训练嵌入,再在其上训练线性/浅层模型——既省算力又更鲁棒、可解释。跨研究任务务必锁定版本并留项目评测(坑点 5/7);如果目标是疾病比较,则 HCA 只提供正常基线,最终分析需引入真实患者数据(坑点 8)。

§6.8 硬件需求

任务规模 内存 存储 加速 备注
网页勘探/可视化(Portal/CELLxGENE) 无 无 无 云端即可
Census 单组织切片分析 16-32 GB 数十 GB CPU 数十万细胞
多组织多项目整合 64-128 GB+ 数百 GB GPU(scVI/深度整合可选) 数百万细胞
全语料基础模型训练 高内存节点 云端(Terra/S3) 多 GPU 建议云端 + 分块流式读取

本地 vs 云端的取舍。 绝大多数"跑通一个分类模型"的任务,单组织切片(数十万细胞)在 16-32 GB 内存本地即可完成;只有多组织整合或预训练基础模型才需要云端/集群。HCA 原始 FASTQ 与全量语料不建议本地常驻,优先 Census API 切片或 Terra 云端处理。csr 稀疏矩阵能显著降低内存占用,推荐全程使用。

§6.9 评估指标

import numpy as np
from sklearn.metrics import adjusted_rand_score, normalized_mutual_info_score, accuracy_score

# 聚类 vs 参考标注
def cluster_metrics(true_labels, pred_labels):
    return {
        "ARI": round(adjusted_rand_score(true_labels, pred_labels), 4),
        "NMI": round(normalized_mutual_info_score(true_labels, pred_labels), 4),
    }

# 监督分类在留出供体/项目上的宏观指标(务必组间评测)
def report_acc(y_true, y_pred):
    return {"accuracy": round(accuracy_score(y_true, y_pred), 4)}

print("推荐报告:留供体/留项目 ARI/NMI/宏F1 + 每类 marker 命中率 + 标签粒度声明。")
# GroupKFold 留供体评估(监督分类任务的标准做法)
import numpy as np
from sklearn.model_selection import GroupKFold
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import f1_score, balanced_accuracy_score

def evaluate_out_of_donor(X, y, groups):
    """X: 细胞级特征(建议用已降维/嵌入后的稠密特征),y: 类型标签(整数),groups: 供体 id"""
    scores_f1, scores_bacc = [], []
    gkf = GroupKFold(n_splits=5)
    for tr_idx, va_idx in gkf.split(X, y, groups):
        clf = LogisticRegression(max_iter=2000)
        clf.fit(X[tr_idx], y[tr_idx])
        yp = clf.predict(X[va_idx])
        scores_f1.append(f1_score(y[va_idx], yp, average="macro", zero_division=0))
        scores_bacc.append(balanced_accuracy_score(y[va_idx], yp))
    return {"macro_F1": np.mean(scores_f1), "balanced_acc": np.mean(scores_bacc)}

# 程序化"标签粒度声明"(评测报告的强制输出项)
def label_granularity_report(adata):
    """统计 cell_type 标签分布与粒度信号,写入实验记录。"""
    vc = adata.obs["cell_type"].value_counts()
    report = {
        "n_unique_labels": int(vc.shape[0]),
        "top10_labels": vc.head(10).to_dict(),
        "rare_label_frac": float((vc < 100).sum() / vc.shape[0]),  # 稀有标签占比
    }
    return report

# 报告示例:留供体宏F1 之外,附 label_granularity_report(adata) 与本体版本号,
# 使他人可以在同一粒度与版本下复算你的结果。
# X = adata.obsm['X_pca']  # 例如 PCA 前 50 维(来自 §6.3 预处理)
# y = adata.obs['cell_type'].map(label_map).values
# groups = adata.obs['donor_id'].values
# print(evaluate_out_of_donor(X, y, groups))

评估纪律重申:只报告"留供体/留项目"的组间指标;宏 F1 比准确率更能反映类别不平衡;把低置信/未分类细胞作为独立类别,避免删除后虚高;跨组织任务单独报告同源类型与组织特化类型两组结果。聚类任务沿用上方 ARI/NMI。禁止只用细胞级随机切分指标宣称 SOTA。

§6.10 MLOps 笔记

  • 数据版本与溯源:记录 Census 版本(LTS 优先)/Portal 快照日期、schema 版本与下载时间;保存 manifest 与校验和,锁定可复现输入。
  • 环境:scanpy/scvi-tools 版本会显著影响结果;固定 conda/pip 锁文件,记录 h5py/TileDB-SOMA 版本。
  • 批次登记:把 donor_id/project/assay/tissue 作为列全程保留,作为随机效应与泄漏审计依据。
  • 缓存与增量:Census 切片结果本地缓存并校验;快照更新后显式决定是否重建基线。
  • 合规门槛:Tier 2 受控字段纳入使用协议与访问日志审计;开放部分的使用仍须按 CC BY 4.0 致谢。
  • CI 基线:对固定版本快照建立回归测试(细胞数、标签分布、marker 命中断言),任何代码/依赖升级后跑回归。

部署前五问清单(把"能跑"推进到"可信地跑"):

问题 若不回答会怎样 最小行动
我锁定了快照/Census LTS 版本吗? 复现漂移、审稿质疑 记录版本号 + 下载时间
我的 QC 阈值与矩阵层口径可复现吗? 细胞数与结果不可比 版本清单记录阈值与 X 层含义
我的划分尊重 donor/project 分组吗? 验证指标虚高 GroupKFold by donor/project
我声明了标签粒度与本体版本吗? 无法与其他工作比较 声明 cell_type 粒度 + 映射表
我的合规边界(Tier 2/embargo)清楚吗? 合规与重识别风险 字段-访问级别-用途矩阵

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
人群/地域偏倚 贡献集中于欧洲与美国研究机构,族裔与地域构成不均一 中高 区域网络(非洲/亚洲/拉美/中东)持续补偿;分析前审计人群构成
组织覆盖不均 部分器官深度大(肺/免疫/心/肾),部分组织样本稀少 中 明确结论的器官边界;跨组织外推需专门验证
平台/批次效应 多平台多解离方案引入技术伪差 中高 按项目 QC + Harmony/scVI 批次校正,留项目评测
健康样本主导 以健康/基础研究背景组织为主体,疾病数据集中于少数网络 中 仅作正常基线使用;疾病结论配真实患者数据
标注粒度不一 各项目注释粒度与本体版本存在差异 中 统计标签粒度、建映射表、声明所用层级
供体构成混杂 年龄、性别、取材部位构成随网络而异 中 按 donor 分层并控制协变量

§7.2 标注质量

标注基于计算聚类 + 本体对齐 + 专家判读,非单一人工标注。质量保证有三层机制:提交时 schema 校验(必填字段与格式)、治理团队审核(元数据完整性)、网络整合复核(图谱级注释协调)。标注的语义锚点统一到受控本体词表,使跨研究可比;但粒度与置信度跨项目不完全统一,属于"经治理的共识标注"而非绝对 gold standard。

如何用标记基因快速做"标注 sanity check":拿到注释后,可抽查经典组织/细胞类型 marker 是否落在预期类型中,作为标签质量的低成本验证:

预期细胞大类 常用 marker(示意) 若出现偏差
上皮细胞 EPCAM / KRT8 检查是否混入基质或免疫细胞
T 细胞 CD3D / CD3E 免疫亚型是否错分
B 细胞 MS4A1 / CD79A 浆细胞与 B 细胞是否混淆
巨噬细胞/单核 LYZ / CD68 / FCGR3A 单核与巨噬边界是否合理
内皮细胞 PECAM1 / VWF 血管区污染是否清洗
成纤维细胞 COL1A1 / DCN 基质细胞是否被归并

说明:具体 marker 与阈值以你下载的数据版本与项目注释为准,此处仅供快速抽查;跨物种/跨平台时基因命名(大小写、前缀)需统一(见坑点 3/4)。

§7.3 泛化性

泛化场景 失效风险 证据/缓解
单组织 → 全身 中(组织特化类型差异大) 用各网络草案图谱验证跨组织存在性
当前人群 → 其他人群 中高(地域/族裔构成偏倚) 区域网络数据补偿;限定结论范围
健康参考 → 疾病场景 中(疾病状态下组成偏移) 仅作对照基线;差异组成需患者数据
当前版本 → 未来快照 中(滚动更新,注释演化) 锁定 LTS/快照版本;跨版本先 diff
转录组 → 多模态部署 中(空间/蛋白子集有限) 用空间子集验证,勿假设全数据含多模态
网络草案 → 全联盟语料 中(草案注释粒度更统一) 以草案图谱为参考锚点,分层评估

泛化的诚实边界:HCA 尚未完成首版草案图谱,其覆盖是"逐步逼近全身"的过程而非已完成态。当任务要求全人群论断时,应清醒认识当前语料的地域与族裔构成;当任务要求疾病外推时,健康参考只解决"正常是什么样",不能回答"病人群体的分布如何";当任务要求多模态(空间、蛋白)时,注意这些模态仅覆盖部分项目。所有跨组织、跨人群结论应报告"覆盖边界"与"代表性审计"两条线(见坑点 8)。

§7.4 伦理

HCA 建立了联盟级伦理架构:每位捐赠者经书面知情同意后采样;直接标识符(姓名、住址等)在编码过程中移除,匿名化数据进入全球可访问的公有领域资源;Ethics Working Group(2018 年设立)审查同意、数据保护与材料/数据共享议题;Equity 工作组推进全球公平参与。Tier 2 中含潜在标识的字段按 managed access 保护,embargo 机制保护未发表图谱数据,数据贡献者协议(DCA)为强制门槛。

伦理要点补充:(1) 人体组织属高敏感生物样本,二次使用须符合原同意范围与当地法规;(2) 开放/受控分级是伦理落地的技术机制——潜在标识字段(自我报告族裔、BMI 等)受控提供,规避通过表达谱与表型组合重识别供体的风险;(3) 发育阶段样本(胚胎/胎儿组织)涉及专门的伦理审查框架,使用时应尊重相应规范;(4) 本条目不鼓励在未获相应伦理许可的前提下,将 HCA 数据与个体临床记录任意拼接。

§7.5 公平性

非临床决策数据集,传统"公平性"(按人群子群预测误差)不完全适用。相关关注点是人群代表性与图谱公平性——HCA 为此设立了区域网络与 Equity 工作组,明确承诺创建"开放、伦理、公平、有代表性"的图谱。

可以类比"公平性"的四点自查:(1) 地域代表——数据贡献与样本来源的地域构成,非洲/亚洲/拉美/中东区域网络正在改善但当前构成仍偏欧美;(2) 族裔代表——自我报告族裔字段受控提供,人群级论断前须评估构成;(3) 年龄与发育阶段覆盖——成人组织占比高,发育阶段样本集中于专门网络;(4) 性别与疾病谱覆盖——按网络而异。做法上:凡做人群层面的强论断,应报告样本构成与范围上限;对代表性不足的亚组限定结论或引入补偿数据。

§7.6 数据漂移

HCA 是滚动更新的活的图谱:规模从 2024-12 的 478 项目/6,270 万细胞增长到 2026-09 的 527 项目/7,050 万细胞;标注本体与整合注释持续演化;各网络草案图谱发布后,项目级注释会被图谱级注释逐步协调。用旧快照训练的模型部署到新快照时,会遇到"标签漂移"(注释粒度/命名变化)与"覆盖漂移"(新组织/人群进入语料)。

漂移的具体形态:(1) 规模增长——官网计数逐月上升,任何"总细胞数"表述都必须带截点日期;(2) 注释演化——本体版本与图谱级整合注释更新后,同名类型的成员可能调整;(3) 入口同步差异——Portal 快照与 CELLxGENE/Census 的同步节奏不同,同一时刻各入口数字可能不一致。应对方法:把版本号(Census LTS/Portal 快照日期)作为数据的显式特征参与建模与报告;训练与评估使用同一版本;跨版本迁移时先做"标签映射 + 元数据 diff"的兼容层,而不是假定旧标签在新快照上仍逐一对齐(见坑点 7)。

§7.7 DAIMS 24 项检查表

# 检查项 状态 说明
1 宽格式数据 ✅ 每细胞一条记录 + schema 化元数据,结构清晰
2 唯一标识 ✅ cell_id 主键;donor_id/project_id 分组键完备
3 特殊字符 ✅ 数据本体英文 ASCII 为主,本体化标签规范
4 重复行 ⚠️ 跨入口(Portal/CELLxGENE/网络图谱)存在重复发布,需按研究去重
5 缺失编码 ✅ schema 必填字段强制 + NA 显式标注惯例
6 标签标识 ✅ cell_type/tissue/disease 等本体化标签体系
7 罕见类分组 ⚠️ 罕见细胞类型与稀少组织存在,需低丰度归并/单独评估
8 偏倚评估 ✅ 官方设 Equity 工作组与区域网络主动治理代表性
9 数据字典 ✅ 公开 schema 与 Tier 1/Tier 2 字段定义
10 信息性缺失解释 ✅ 模态/字段缺失为设计所致并有分级说明
11 设备记录 ✅ assay/protocol 元数据字段强制采集
12 共线性 ⚠️ 基因高度共表达,需降维与批次处理
13 编码映射 ⚠️ 本体版本与跨入口命名需自行对齐
14 时间戳处理 ⚠️ 滚动更新下需用户自行记录快照日期
15 划分建议 ✅ 官方提供网络/供体/组织/疾病语义分组维度,社区惯例成熟
16 泄漏讨论 ✅ §5.3 详述供体/跨入口/标注演化泄漏
17 标签分布 ⚠️ 需按下载快照自统计,不套用官网计数
18 测量偏倚 ⚠️ 平台/解离方案差异为系统性测量偏倚
19 外部验证建议 ✅ §5.5 提供留项目/草案图谱/疾病数据外部验证
20 版本记录 ✅ Census LTS + Portal 月度快照可追溯
21 预处理脚本 ⚠️ Census API 官方提供,端到端预处理仍需自建
22 合规要求 ✅ CC BY 4.0 + Tier 分级 + DCA + embargo 机制完备
23 多模态对齐 ⚠️ 以转录组为主轴,空间/蛋白为部分项目扩展,同细胞多模态有限
24 去标识化 ✅ 编码去标识 + 匿名化 + managed access 分级保护

DAIMS 评分:19.5 / 24

评分解读:HCA 在 FAIR 开放、唯一标识、数据字典、合规机制与去标识化上达到联盟级数据治理的标杆水准——schema 强制、本体对齐、CC BY 4.0 与 Tier 分级是其显著优势;扣分集中在"滚动更新带来的版本与重复管理负担"(跨入口重复、时间戳自理)、"标注粒度跨项目不一"与"多模态对齐有限"这三类问题。这些不是数据质量缺陷,而是"活的、联邦式"图谱的固有工程形态。

对你意味着什么:做研究可以直接信任其元数据治理与本体化标注,把 HCA 当作高质量的跨研究训练语料与参考基线;但要把它当成"需锁定版本、自建划分"的滚动资源,而不是开箱即用的 ML benchmark。落地建议:(1) 锁定 Census LTS 或 Portal 快照并记录下载时间;(2) 严格按 donor/project 分组划分并留项目做外部验证;(3) 统计标签粒度并声明本体版本;(4) 跨入口使用前按研究去重;(5) 疾病结论配真实患者数据,人群论断前先做代表性审计。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
肺脏健康-疾病整合图谱 HCA 肺网络(Sikkema 2023) 跨数据集整合与疾病参考映射 图谱级注释一致性 健康与疾病数据统一框架 跨研究整合方法可支撑多疾病比较
健康与哮喘肺细胞普查 HCA 相关研究(Vieira Braga 2019) 疾病场景下新细胞状态识别 细胞状态发现 健康参考之外新增哮喘数据 疾病中出现健康肺未见的新细胞状态
空间转录组子集 部分网络项目 注释的空间合理性验证 空间-分子一致性 独立成像模态 类型分布与组织结构吻合
CZ CELLxGENE 聚合语料 CZI(含 HCA 数据) 跨研究 schema 一致性 统一 schema 字段对齐 同源数据不同入口 最小 schema 使跨联盟聚合可行

上表仅收录已发表且有同行评审/论文支撑的验证结果,具体数值以对应论文为准,未列出的非经核验指标不纳入。

§7.9 可复现性清单与质量小结

HCA 的质量最终取决于"用户能否用清楚的口径重算出别人发布的结论"。建议在每次分析中留存以下可复现信息:

记录项 说明 对应风险(坑点)
Census 版本/Portal 快照日期 + 下载时间 锁定数据版本,防跨版本漂移 坑点 7 / §7.6
QC 阈值(min_genes、线粒体)与 X 层口径 决定最终细胞数与结果 坑点 3
入口清单与去重记录 防跨入口重复计数 坑点 5
标签粒度与本体版本 决定类型数与可比性 坑点 2
划分方式(donor/project group) 决定指标可信度 坑点 1
Tier 2 字段访问级别声明 合规边界 坑点 6

质量小结:HCA 的最大优势是联盟级数据治理带来的跨研究可比性——统一 schema、本体对齐、CC BY 4.0 与伦理分级使"7,050 万细胞"真正可以被程序化消费;最大使用成本是滚动更新与多入口形态带来的版本管理负担。把它当作"活的参考图谱"而非"固定基准"来使用,锁定版本、声明粒度、分组评测,就能同时享受其规模红利与工程可靠性。


§8 基准与生态

§8.0 为什么这里没有传统排行榜

与图像/文本基准数据集不同,HCA 是滚动参考图谱而非"固定 train/test + 排行榜"的 ML 基准。原因有三:(1) 它是普查性、持续增长的公共资源,目标是被社区反复再分析而非被单一指标竞赛;(2) 标签粒度与覆盖随快照演化,无法定义一个跨版本稳定统一的"准确率";(3) 官方没有提供预切分的 train/valid 集。因此本节的"代表性工作"展示的是方法学里程碑与生态影响,而非可排序的分数——任何声称在该数据上"刷新 SOTA 精度"的报告,都必须说明其所用快照版本、细胞子集、划分方式与标签粒度(见 §8.3 评测协议),否则其数字不具有可比较性。

§8.1 相关评测与代表性工作

HCA 生态中没有统一排行榜,但其整合方法与平台论文常被当作跨研究单细胞分析的参考基线。以下为若干代表性方法学与生态工作:

排名/角色 方法/成果 性能/结论 年份 关键技术 完整引用
联盟愿景与蓝图 “The Human Cell Atlas” 愿景论文与白皮书 确立开放、社区驱动的全身细胞图谱路线 2017/2018 社区共识设计 Regev A. et al., eLife 6:e27041, 2017;白皮书 arXiv:1810.05192
跨数据集整合方法 健康-疾病整合肺细胞图谱 大规模跨研究器官图谱的整合与使用范式 2023 跨数据集整合 Sikkema L. et al., Nat Med 29:1563-1577, 2023
疾病细胞普查 健康与哮喘肺细胞普查 识别哮喘中新出现的细胞状态 2019 跨研究细胞普查 Vieira Braga F.A. et al., Nat Med 25:1153-1163, 2019
聚合平台 CZ CELLxGENE Discover 统一最小 schema 的跨联盟浏览/取数平台(1,102 数据集、9,020 万细胞,2023-10 口径) 2023 最小 schema、Census API CZ CELLxGENE Discover 论文(bioRxiv preprint, 2023)
里程碑综述 细胞图谱五阶段愿景 从细胞普查走向统一生物学基础模型 2024 图谱整合与 AI Rood J.E. et al., Nature 636:1065-1071, 2024

说明:上表性能列以"结论/方法学结果"而非统一数字呈现;各工作使用不同细胞集与标准,数值不可直接横向比较。HCA 的价值更在于作为全局参考底座,而非在单一指标上排名。

§8.2 SOTA 总结与选型建议

当前"细胞图谱"生态的 SOTA 形态是全身覆盖 + 标准化语料 + 基础模型:HCA 以 18 个网络推进全身覆盖(肺/神经/眼草案已发布),CELLxGENE/Census 提供标准化聚合语料与版本化 API,Rood et al. 2024 描绘了"细胞普查→3D 地图→基因型-表型连接→发育 4D 地图→生物学基础模型"的五阶段路线。选型建议:做单器官深度研究用对应网络草案图谱;做跨研究建模与基础模型用 Census 语料;做疾病对照用健康参考 + 疾病研究数据组合。

§8.3 评测协议

  • 聚类:ARI/NMI(见 §6.9);以多分辨率 + marker 一致性评估粒度稳健性。
  • 分类(监督):GroupKFold by donor/project 的宏 F1/ACC;报告留供体与留项目两组结果。
  • 标注迁移:在留出项目/研究上评测,声明参考图谱版本与标签粒度映射。
  • 跨组织:组织留出评测,分"同源类型"与"组织特化类型"两条线报告。
  • 报告规范:声明所用快照/Census LTS 版本、QC 阈值、X 层口径(counts)、标签本体版本与数据截点日期。

§8.4 相关数据集

数据集 类型 与 HCA 的关系/差异
CZ CELLxGENE Discover / Census 跨联盟聚合平台 HCA 数据的重要消费入口;统一 schema、版本化 API
BICCN/BICAN 脑细胞图谱 哺乳动物脑多模态图谱 脑专一、多模态交叉验证更深;HCA 神经网络与之互补
HuBMAP 人体多器官图谱 与 HCA 协调 schema;侧重组织微环境结构与成像
Fly Cell Atlas 果蝇全身单细胞图谱 跨物种对照;"全身普查"范式在模式生物的平行实践
单研究组器官图谱 单组织/疾病研究 深度大、批次可控;可作 HCA 网络数据的深度补充
CuratedAtlasQueryR 语料 R 生态聚合视图 2,900 万级细胞 harmonized 元数据,适合 R 用户快速查询

对比启示:与"单器官单研究"图谱相比,HCA 的不可替代性在于"全身范围 + 本体统一 + 治理规范 + 全球人群覆盖";代价是滚动更新与跨项目批次负担。当研究仅需"一个组织的深度矩阵"时,专项图谱往往更轻量;当需要"跨组织参考、人群规模与标准化语义"时,HCA 是首选底座。

§8.5 关键论文 Top 10

  1. Regev A., Teichmann S.A., Lander E.S. et al., 2017, eLife 6:e27041. doi:10.7554/eLife.27041 — 联盟愿景论文,确立开放全身细胞图谱路线(Google Scholar 引用 2,856+,截至 2026-09)。
  2. Regev A. et al., 2018, The Human Cell Atlas White Paper. doi:10.48550/arXiv.1810.05192 — 详细建设蓝图:目标、阶段与设计原则。
  3. Rozenblatt-Rosen O., Stubbington M.J.T., Regev A., Teichmann S.A., 2017, Nature 550:451-453 — “From vision to reality”:联盟组织与路线解读。
  4. Rood J.E., Wynne S., Robson L., Hupalowska A., Randell J., Teichmann S.A., Regev A., 2024, Nature 636:1065-1071. doi:10.1038/s41586-024-08338-4 — 里程碑综述:细胞图谱五阶段愿景与基础模型路线。
  5. Sikkema L. et al., 2023, Nat Med 29:1563-1577 — 健康-疾病整合肺细胞图谱:跨数据集整合范式。
  6. Vieira Braga F.A. et al., 2019, Nat Med 25:1153-1163 — 健康与哮喘肺细胞普查,识别新细胞状态。
  7. Schiller H.B. et al., 2019, Am J Respir Cell Mol Biol 61:31-41 — 人类肺细胞高分辨率参考图谱。
  8. HuBMAP Consortium, 2019, Nature 574:187-192. doi:10.1038/s41586-019-1629-x — 同期人体图谱计划,与 HCA 互补协调。
  9. CZ CELLxGENE Discover, 2023, bioRxiv preprint — 统一最小 schema 的跨联盟聚合平台与 Census。
  10. Li H. et al., 2022, Science 375:eabk2432 — Fly Cell Atlas:全身细胞普查范式的跨物种平行实践。

如何用这些论文做技术选型:新手从第 1、2、4 篇入手最经济——第 1 篇理解联盟目标与开放原则,第 2 篇掌握建设蓝图,第 4 篇看清图谱生态的演进方向;做肺/呼吸研究精读第 5-7 篇;理解数据平台选型读第 9 篇;需要跨物种参照再看第 10 篇。按你的组织与任务挑对应文献即可。

§8.6 社区活跃度

HCA 是全球最活跃的生命科学数据联盟之一:官网口径 3,900+ 成员、1,700+ 机构、100+ 国家/地区(截至 2026-09),数据月度更新,2024-11 Nature 合集一次性发布 45+ 篇论文。愿景论文(eLife 2017)Google Scholar 引用 2,856+(截至 2026-09),2024 Nature 综述发表未满两年 Scopus 引用已逾百(108,OUCI 口径)。生态方面,CELLxGENE Discover/Census 已成为单细胞社区事实上的聚合标准之一,R/Bioconductor 提供 hca、cellxgenedp、CuratedAtlasQueryR 等接入包;区域网络与年度会议持续扩大会员基础。具体引用计数随数据库更新,请以各检索平台当日数值为准。

§8.7 生态快照表

资源 类型 链接 推荐理由
HCA 官网 联盟门户 https://www.humancellatlas.org/ 联盟新闻、网络介绍、伦理框架
HCA Data Portal 数据门户 https://data.humancellatlas.org/ Data Explorer 检索、导出、Terra 集成
CZ CELLxGENE Discover 聚合平台 https://cellxgene.cziscience.com/ 跨研究可视化与下载
CELLxGENE Census 程序化 API https://chanzuckerberg.github.io/cellxgene-census/ 版本化语料 + Python/R 切片
celltype.info 注释平台 https://celltype.info/ 细胞类型标注查询
AWS Open Data 注册页 数据注册 https://registry.opendata.aws/humancellatlas/ 云端数据集入口与引用指南
Nature 草案图谱合集 论文合集 https://go.nature.com/3CDjvKL 45+ 篇"迈向首版草案图谱"全景
数据提交规范 治理文档 https://www.humancellatlas.org/wp-content/uploads/2025/04/Data-Ingestion-Instructions_250225_published_v1.1.1.pdf Tier 1/Tier 2 与提交流程权威说明
R/Bioconductor 接入 工具生态 bioconductor.github.io/ISMB.OSCA/articles/hca.html hca/cellxgenedp/CuratedAtlasQueryR 教程

社区生态结论:HCA 的开放许可与标准化治理使其数据被大量下游平台与图谱吸收(CELLxGENE/Census、R 生态、各网络草案图谱),形成"联盟生产、多方复用"的生态正循环。新进入者应优先从官方门户与 Census API 起步,降低本地装配成本(见 §6.0、§6.2)。


§9 相关资源与引用

§9.1 官方资源

下载入口决策速查:

想找什么 首选入口 备选
按项目浏览与权威下载 Data Portal Data Explorer AWS Open Data
程序化取数/训练模型 CELLxGENE Census API cellxgenedp(R/Python)
交互看聚类与 marker CELLxGENE Discover Portal 内嵌浏览器
细胞类型语义查询 celltype.info 本体词表
某器官整合图谱 对应 Bionetwork 页面(Portal) 网络草案图谱论文
原始 FASTQ 再分析 Portal 导出 → Terra 云端工作流

若不确定某数据在哪个入口,先在 Data Portal 检索项目名,项目页会给出数据状态(开放/embargo)、引用指南与导出方式,避免在多入口间盲目寻找。

§9.2 BibTeX 引用

@article{regev2017hca,
  title = {The Human Cell Atlas},
  author = {Regev, Aviv and Teichmann, Sarah A. and Lander, Eric S. and Amit, Ido and Benoist, Christophe and Birney, Ewan and Bodenmiller, Bernd and Campbell, Peter and Carninci, Piero and Clatworthy, Menna and others},
  journal = {eLife},
  volume = {6},
  pages = {e27041},
  year = {2017},
  doi = {10.7554/eLife.27041}
}

@article{regev2018whitepaper,
  title = {The Human Cell Atlas White Paper},
  author = {Regev, Aviv and Teichmann, Sarah A. and Rozenblatt-Rosen, Orit and Stubbington, Michael J. T. and Ardlie, Kristin and Amit, Ido and Arlotta, Paola and Bader, Gary and Benoist, Christophe and Biton, Moshe and others},
  journal = {arXiv preprint arXiv:1810.05192},
  year = {2018},
  doi = {10.48550/arXiv.1810.05192}
}

@article{rozenblattrosen2017vision,
  title = {The Human Cell Atlas: from vision to reality},
  author = {Rozenblatt-Rosen, Orit and Stubbington, Michael J. T. and Regev, Aviv and Teichmann, Sarah A.},
  journal = {Nature},
  volume = {550},
  pages = {451--453},
  year = {2017}
}

@article{rood2024foundation,
  title = {The Human Cell Atlas from a cell census to a unified foundation model},
  author = {Rood, Jennifer E. and Wynne, Samantha and Robson, Lucia and Hupalowska, Anna and Randell, John and Teichmann, Sarah A. and Regev, Aviv},
  journal = {Nature},
  volume = {636},
  pages = {1065--1071},
  year = {2024},
  doi = {10.1038/s41586-024-08338-4}
}

@article{sikkema2023lung,
  title = {An integrated cell atlas of the lung in health and disease},
  author = {Sikkema, Lisa and Ramírez-Suástegui, Cecilia and Strobl, Daniel C. and Zappia, Luke and Madissoon, Elo and Markodimitraki, Anastasia and others},
  journal = {Nature Medicine},
  volume = {29},
  pages = {1563--1577},
  year = {2023}
}

@article{vieirabraga2019asthma,
  title = {A cellular census of human lungs identifies novel cell states in health and in asthma},
  author = {Vieira Braga, Fabio A. and Kar, Gokcen and Berg, Marijn and Carpaij, Orianne A. and Polanski, Krzysztof and Simon, Lukas M. and others},
  journal = {Nature Medicine},
  volume = {25},
  pages = {1153--1163},
  year = {2019}
}

@article{schiller2019lungatlas,
  title = {The human lung cell atlas: a high-resolution reference map of the human lung in health and disease},
  author = {Schiller, Herbert B. and Montoro, Daniel T. and Simon, Lukas M. and Rawlins, Emma L. and Meyer, Kerstin B. and Strunz, Manuel and others},
  journal = {American Journal of Respiratory Cell and Molecular Biology},
  volume = {61},
  pages = {31--41},
  year = {2019}
}

§9.3 引用指南

使用 HCA 数据时,须在论文/工具中致谢并引用:联盟层面的引用首选 Regev et al. 2017(eLife 6:e27041);所用具体数据集应引用其原始论文与 Data Portal 项目页(每项目页附建议引用);平台与整合方法(如肺图谱)引用对应论文。开放数据按 CC BY 4.0,须注明出处并给出许可链接;受控/embargo 数据的使用与发表须遵守对应协议;引用官网计数时务必注明截点日期(如"截至 2026-09")。

§9.4 常见问题(获取与使用决策)

问题 回答
该不该下载"全量"? 不存在单一全量包;多数任务只需按组织/疾病/assay 过滤的最小子集(GB 级),用 Census 切片或 Portal 导出即可;原始 FASTQ 建议留在 Terra
下载后有使用协议要签吗? 开放数据 CC BY 4.0 免签;Tier 2 受控字段与 embargo 数据须走申请与协议流程
能用它训练模型再发布吗? 开放部分可以(CC BY 4.0,须致谢与引用);受控部分按协议处理
官网数字和我下载的对不上? 正常现象:官网是滚动实时计数,你的快照是固定截点;两者口径(去重/QC/纳入标准)也不同——引用时注明版本与截点(坑点 7)
细胞类型标签和我预期的不一样? HCA 标签为本体化共识标注,粒度随项目而异;先核对本体语义与标注粒度(坑点 2),再排查批次与 QC 差异
是否适合做疾病诊断模型? 不适合;本图谱为健康参考,诊断/患病率/预后须另配真实患者数据(坑点 8)
想要某个供体的族裔/BMI 等字段怎么办? 属 Tier 2 潜在标识字段,按 managed access 申请;或使用可用字段做近似分析(坑点 6)
多个项目都有我研究的组织,选哪个? 先在 Data Portal 对比各项目的样本量、assay 与疾病覆盖,再优先选择已并入网络草案图谱、注释更完整的项目;跨项目使用时按 §5.3 分组
能把 HCA 数据和自己的实验数据混在一起训练吗? 可以且常见(标注迁移场景),但须锁定 HCA 版本、保留来源列,并把"你的数据"整体留出做外部验证(坑点 5/7)

§9.5 学习与教程

  • HCA 官网 “Join & Learn” 区:联盟介绍、网络页面与伦理框架材料
  • Data Portal Guides:Data Explorer 检索、导出与 Terra 集成的官方指南
  • CELLxGENE Census 文档:Python/R 快速上手与切片示例
  • R/Bioconductor ISMB 教程(hca 包等):R 用户的数据接入路径
  • Nature 草案图谱合集(2024-11):理解各网络成果与整合方法的全景入口

对零代码起步者,官方门户 + CELLxGENE 可视化是门槛最低的路径;掌握基本单细胞概念(§1.6 术语表)后,再按 §6.0-§6.4 进入程序化取数与建模即可,无需先通读全部网络论文。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 文本生成辅助:本条目由 AI 写作 Agent(千方医数集写作 Agent)基于公开检索资料起草,非模型直接输出。

§10.2 AI 参与范围

AI 用于:结构化检索并核实 HCA 事实、组织百科章节与表格、起草代码示例与坑点分析、生成 frontmatter/INFOBOX/JSON-LD 骨架。所有数字、规模、DOI 与许可事实均经人工对照公开来源核实;因检索未证实而省略的数值(如联盟总存储字节数、部分网络的单项细胞数)不予编造。

事实核实方法说明。 本条目属 YMYL(Your Money or Your Life)医学类信息,编辑部采用"检索-来源归档-人工核对-入库"的四段流程:(1) AI 依据任务简报发起多次 WebSearch,覆盖联盟官网、Data Portal 实时统计、Nature 合集页、学术评述(PMC)、CZ CELLxGENE 论文与提交规范 PDF;(2) 每次检索的硬事实(细胞数、成员数、DOI、日期、许可、schema 字段)归档到 FACTS.md 并附来源 URL;(3) 人工编辑逐条核对,重点校验存在口径冲突的数字(如"2024-12 的 478 项目/6,270 万细胞 vs 2026-09 的 527 项目/7,050 万细胞""3,200+ vs 3,600+ vs 3,900+ 成员"等),选择最贴切、有直接来源的表述并注明截点;(4) 无法获得可靠来源的数据(如联盟总存储字节数、Census 当前版本号)一律省略而不猜测。正文内关键数字均带内联来源或 DOI,便于读者复核。

§10.3 输入来源列表

  1. HCA 联盟官网 humancellatlas.org(联盟介绍、成员统计、伦理框架)
  2. HCA Data Portal data.humancellatlas.org(实时统计:7,050 万细胞/1.12 万捐赠者/527 项目/997 实验室)
  3. 数据提交规范 PDF(Data Ingestion Instructions v1.1.1,2025-04:Tier 1/Tier 2、FASTQ/h5ad 要求、embargo)
  4. Nature “The Human Cell Atlas: towards a first draft atlas” 合集页(2024-11:18 网络、三草案、62M 细胞/9,100 捐赠者口径)
  5. Rood et al. 2024 Nature 综述(doi:10.1038/s41586-024-08338-4:五阶段愿景、参考文献中的白皮书与肺图谱)
  6. PMC 学术评述(2024-12:9,200 捐赠者/6,270 万细胞/478 项目、3,200+ 成员/99 国、伦理与匿名化机制)
  7. Regev et al. 2017 eLife(愿景论文,Google Scholar 引用 2,856+)
  8. CZ CELLxGENE Discover 论文(bioRxiv preprint:最小 schema 11 字段、90.2M 细胞口径)
  9. CZ CELLxGENE Census 文档(TileDB-SOMA、LTS 版本、Python/R API)
  10. evo-byte 单细胞数据平台评述(Portal/TDR/curl 导出、CC BY 4.0、Census 用法)
  11. AWS Open Data 注册页(UCSC 管理、月度更新、引用指南)
  12. Bioconductor ISMB 教程(hca/cellxgenedp/CuratedAtlasQueryR 接入)
  13. OUCI/Scopus 引用记录(Rood 2024 引用 108)
  14. BICCN 百科条目(本编辑部范式参考,用于联盟级参考图谱的章节结构)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
frontmatter schema_org / INFOBOX 千方病案数据工程编辑部 字段与来源交叉核对 ✅ 已通过/已验证
§2 医学/生物学背景与 ICD/SNOMED 映射 千方病案医学编辑部 编码与文献核对 ✅ 已通过/已验证
§3-§5 数据规格与划分 千方病案数据工程编辑部 与论文/门户对照 ✅ 已通过/已验证
§6 代码与坑点 千方病案数据工程编辑部 语法与逻辑复核 ✅ 已通过/已验证
§7 DAIMS 与偏倚 千方病案医学编辑部 评分与风险复核 ✅ 已通过/已验证
§8-§9 引用与生态 千方病案编辑部 DOI/引用核对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全文由 AI 辅助生成并经编辑部逐模块人工校验;AI 起草与检索,事实核验与医学/工程把关由人工完成。凡正文引用的硬数字均带内联来源或 DOI 与截点日期,未获来源者不写入正文。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • hubmap — 共享标签:基因组学与多组学 / 医学影像 / 单细胞基因组学 / 病理图像 / 肿瘤学
  • icgc — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • tabula-muris — 共享标签:基因组学与多组学 / 医学影像 / 单细胞基因组学 / 病理图像
  • upenn-gbm — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • gdsc — 共享标签:基因组学与多组学 / 医学影像 / 病理图像 / 肿瘤学
  • cellxgene — 共享标签:基因组学与多组学 / 医学影像 / 病理图像
  • hlca — 共享标签:医学影像 / 单细胞基因组学 / 病理图像
  • human-protein-atlas — 共享标签:基因组学与多组学 / 医学影像 / 病理图像
  • kpmp — 共享标签:基因组学与多组学 / 单细胞基因组学 / 病理图像
  • ocelot — 共享标签:医学影像 / 病理图像 / 肿瘤学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集