信息速览

HCL(Human Cell Landscape,人类细胞景观)— 中国团队构建的人体单细胞图谱 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | HCL(Human Cell Landscape,人类细胞景观) |
| 英文全称 | Human Cell Landscape |
| 别名/简称 | HCL、HCL DGE Data、scHCL(配套 R 包) |
| 疾病分类 | 不适用(健康人体多器官细胞图谱;供体元数据含 20 种疾病状态标签,详见 §2.4) |
| SNOMED CT | 不适用(正常组织结构级图谱;组织级 SNOMED CT 映射见 §2.1b) |
| 数据模态 | 单细胞 RNA 测序转录组(scRNA-seq 数字基因表达矩阵 DGE) |
| AI 任务类型 | 细胞类型注释/分类、聚类与降维、批次校正与整合、轨迹推断、跨物种映射、marker 基因发现 |
| 样本总数 | 702,968 个单细胞 / 60 种人体组织类型 / 102 种细胞簇 / 843 种细胞亚类 / 58 名供体(HCA 口径) |
| 数据大小 | 约 884.2 MB(GSE134355_RAW.tar,处理后 DGE 矩阵);原始 fastq 另计(HCA 口径 254 个 fastq.gz 文件) |
| 数据格式 | TXT(DGE 矩阵,行=基因、列=细胞)/ fastq.gz(原始 reads)/ XLSX(注释表) |
| 许可证 | Creative Commons Attribution 4.0 International(CC BY 4.0) |
| 访问级别 | 开放(无需注册、无需申请,下载时须遵守 CC BY 4.0 署名要求) |
| DUO 标签 | NRES(无限制;CC BY 4.0 署名要求) |
| 语言 | 英文(注释、元数据与文档) |
| 首发日期 | 2020-02-10(GEO 公开)/ 2020-03-25(论文在线发表) |
| 最后更新 | 2024-08-26(GEO 系列最后更新;HCA 项目页 2025-02-14 更新) |
| 发布机构 | 浙江大学医学院干细胞与再生医学中心(郭国骥/韩晓平团队) |
| 官方主页 | http://bis.zju.edu.cn/HCL/ |
| 下载地址 | https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE134355 ;https://figshare.com/articles/HCL_DGE_Data/7235471 |
| DOI | 10.1038/s41586-020-2157-4 |
| 引用次数 | 1,100+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 有处理后 DGE、两级注释标签与 scHCL/Huatuo 注释生态;扣分项:DGE 为 TXT 大矩阵需格式转换、无官方 train/test 划分、无标准 h5ad 发布 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、组织系统与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(DGE 矩阵结构、细胞条码与簇标签体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与浙江大学医学院、ggjlab 团队、Springer Nature 无任何商业利益关联。本页面不销售 HCL 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受浙江大学或相关机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HCL 以 CC BY 4.0 国际许可发布,用户可自由下载、使用与再分发,但须署名原始论文(Han et al., Nature 2020)并遵守 HCA 数据发布政策。样本由浙江大学医学院系统合作医院在伦理批准下捐赠采集,使用时请尊重供体贡献。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
HCL(Human Cell Landscape,人类细胞景观) 是浙江大学医学院郭国骥、韩晓平团队联合 16 家附属医院与研究单位,于 2020 年 3 月发表于 Nature 的人体单细胞转录组图谱。团队用自主开发的 Microwell-seq 高通量低成本低单细胞测序平台,对中国汉族捐赠者的胎儿与成人组织进行大规模单细胞测序,最终获得 702,968 个经过质量控制的单细胞,覆盖 60 种人体组织类型,无监督聚类鉴定出 102 种细胞簇与 843 种细胞亚类。
它为什么重要?这是全球第一个覆盖人体主要器官的单细胞转录组图谱(先于 Tabula Sapiens 等同类工作),也是首个以中国人群样本为主体的人体细胞图谱。论文提出的"单细胞 HCL 分析"(scHCL)流程把"给一个细胞查身份"变成了可在线调用的标准服务;配套的 R 包与 Huatuo XGBoost 模型集至今仍是中文细胞注释生态的基座。论文在 Google Scholar 的引用已超过 1,100 次(截至 2026-09)。
你能用它做什么:给任何人类单细胞/ bulk RNA 测序数据做细胞类型注释(scHCL 参考映射)、研究某组织里有哪些已知与未知细胞类型、做胚胎-成人发育对照或人-鼠跨物种比较、评估干细胞分化/类器官培养产物的细胞构成,或把它当作单细胞机器学习(注释、整合、批次校正)的公开训练语料。数据以 CC BY 4.0 完全开放,无需注册即可下载。
§1.1 摘要
HCL 的技术路线可以概括为"低深度高通量 + 伪细胞聚合 + 两级聚类注释"。Microwell-seq 将单个细胞与磁珠条码共装进约 20 万个微米级微孔,再经裂解、反转录与 HiSeq X Ten 测序获得全转录组数字表达矩阵;单细胞测序深度虽低于 10X 类液滴平台,但凭借超大规模(702,968 个细胞、平均每组织超过 10,000 个细胞)换取了细胞类型覆盖的完备性——论文 Extended Data 图 1d 显示,代表性组织的主要细胞类型数在约 8,000 个细胞时已接近饱和。分析侧,团队用 Seurat/Scanpy 完成质量控制、降维与聚类,得到 102 个细胞簇并进一步细分出 843 个亚类;对每簇合并出伪细胞(pseudo-cell,共 30,053 个)后再做转录因子网络(SCENIC)与配体-受体(CellPhoneDB)分析,规避了单细胞低深度噪声。图谱同时收录胎儿与成人组织以及多种细胞培养体系,与小鼠 MCA 图谱构成跨物种比较框架。数据以 TXT 格式 DGE 矩阵发布于 GEO(GSE134355)、CNGB(CNP0000325)与 figshare,代码与 scHCL R 包开源于 GitHub。
§1.2 战略价值分析
人群代表性维度:在 HCL 之前,国际单细胞图谱版图几乎完全由欧美研究团队的 droplet 平台数据构成。HCL 以汉族供体样本为主体,系统覆盖胎儿与成人两套发育阶段的 60 种组织,为亚洲人群的细胞表达基线提供了公开参照——这对解读中国人群疾病组织单细胞数据(哪些是病理状态、哪些只是人群基线差异)具有直接的参照价值,也为后续中国团队的大规模图谱(如多个器官专项图谱)确立了方法学模板。
注释生态维度:HCL 最重要的 AI 资产不是矩阵本身,而是围绕它生长出的注释工具链:官方 scHCL R 包以皮尔逊相关系数把查询细胞映射到 HCL 簇;Huatuo 项目进一步把 357 个 HCL 簇/44 个主要细胞大类训练成 300+ 个预训练 XGBoost 模型。配合其 CC BY 4.0 的完全开放许可,HCL 成为中文单细胞社区默认的"参考图谱底座"之一,也是检验注释/整合算法跨平台迁移能力(microwell-seq ↔ droplet)的天然试金石。
方法学范式维度:HCL 与同团队的小鼠细胞图谱 MCA(2018)构成"平台自证闭环":低深度微孔测序 + 伪细胞聚合能否与高深度液滴平台得出一致的细胞类型划分?论文用 t-SNE 对照、bulk RNA-seq 相关性(>0.8)与转录组随机性分析给出了正面回答,并把"干细胞/祖细胞转录组随机性强、分化细胞状态分明稳定"确立为跨物种可复现的规律。这一范式影响了中国乃至亚洲单细胞图谱工程的平台选型与预算规模估算。
§1.3 横向对比
| 数据集 | 物种 | 平台 | 规模 | 组织/样本覆盖 | 标注体系 | 许可 |
|---|---|---|---|---|---|---|
| HCL(本条目) | 人 | Microwell-seq | 702,968 细胞 | 60 种组织类型,胎儿+成人+细胞培养,58 名供体(HCA 口径) | 102 簇 / 843 亚类两级 | CC BY 4.0 |
| MCA(Han et al. 2018) | 小鼠 | Microwell-seq | 见官方页 | 近全部主要小鼠器官 | 同团队两级聚类 | 开放获取 |
| Tabula Sapiens(2022) | 人 | 液滴类 | 见官方页 | 多器官,单供体系链 | 专家注释 | 开放获取 |
| HCA Data Portal(本项目集成) | 人 | Microwell-Seq(HCL 项目) | 703.0k 细胞估算 | 37 解剖实体 / 21 器官部位 / 9 发育阶段 | 同 HCL | CC BY 4.0 |
| CZ CELLxGENE(托管版) | 人 | 同 HCL | 同 HCL | 同 HCL,在线可视化 | 同 HCL | 随托管政策 |
说明:MCA、Tabula Sapiens 的规模数字本页面未做独立核实,以各自官方发布为准,故不在此列出具体数值,避免口径混用;HCL 一切数字以 Nature 论文与 GEO 页面为准。
§1.4 版本时间轴
| 时间 | 事件 | 说明 |
|---|---|---|
| 2018 | MCA 先行发表 | 同团队小鼠细胞图谱(Cell 2018)确立 Microwell-seq 管线,HCL 的人类版本开始推进 |
| 2019-07-16 | GEO 提交 | GSE134355 系列提交至 NCBI GEO |
| 2020-02-10 | GEO 公开 | GSE134355 转为 public,附 GSE134355_RAW.tar(884.2 MB 处理后 DGE) |
| 2020-03-25 | 论文在线发表 | Han et al., Nature 581:303-309(正式期号 2020 年 5 月,PMID 32214235) |
| 2020(论文发表期) | figshare DGE 镜像 | HCL_DGE_Data 上线 figshare(7235471),与 MCA_DGE_Data 配套 |
| 2024-08-26 | GEO 最后更新 | GSE134355 系列元数据最后一次更新 |
| 2025-02-14 | HCA 项目页更新 | HCA Data Explorer 收录版本(254 个 fastq.gz + 1 tar + 1 xlsx) |
§1.5 典型应用场景
- 细胞类型注释参考映射:用 scHCL R 包或 Huatuo 模型集,把自己研究中的肿瘤/类器官/分化细胞数据映射到 HCL 簇,快速获得细胞身份与置信度排序(论文演示了肝芽类器官、脑类器官、iPS 分化胚状体、CD34+ 脐血等 8 类案例)。
- 组织细胞构成基线查询:研究某器官(如肾、肺)时,先查 HCL 的该组织 t-SNE 与 marker 基因表,建立"正常情况下有哪些细胞、各表达什么"的先验,再做疾病对照设计。
- 发育与干细胞研究:利用胎儿-成人双阶段覆盖,分析细胞类型在两个阶段的表达保守性,或验证干细胞分化方案的产物是否落在正确的轨迹位置上。
- 算法基准与整合评测:把 HCL 当作公开语料评测批次校正、跨平台(microwell-seq ↔ 10X)注释迁移、百万级矩阵加载与稀疏表达建模等工程与算法问题。
- 跨物种比较:与 MCA 的小鼠数据做正交基因/调控网络比较,识别人鼠保守的遗传网络与物种特异的转录因子调控子。
场景与入口的对应关系速查:
| 场景 | 首选入口 | 配套章节 |
|---|---|---|
| 注释参考映射 | scHCL R 包 / Huatuo | §6.2、§6.7、坑点 7 |
| 组织构成基线 | 在线门户 / CELLxGENE | §6.0、§2.1 |
| 发育与干细胞研究 | GEO 全量 DGE + PAGA | §6.3、坑点 5 |
| 算法基准评测 | GEO DGE + 供体分组协议 | §5.4、§8.3 |
| 跨物种比较 | HCL + MCA figshare 双下载 | §8.4、§8.5 |
§2 医学背景
§2.1 ICD-11 相关疾病领域映射
HCL 是健康人体图谱,不针对特定疾病;但它覆盖的组织系统各自对应 ICD-11 中的疾病章节。研究这些器官的疾病单细胞数据时,HCL 可充当对照基线。
| 组织/细胞系统 | HCL 代表组织 | ICD-11 相关疾病领域(章节名) | 映射说明 |
|---|---|---|---|
| 泌尿系统 | 肾脏(胎儿+成人) | 泌尿系统疾病(含肾小球与肾小管间质疾病) | 论文对胎儿/成人肾做了配对分析与配体-受体图谱,是肾脏病研究的常用对照 |
| 呼吸系统 | 肺 | 呼吸系统疾病(含气道与肺实质疾病) | AT1/club 细胞等肺上皮类型在图谱中有完整覆盖 |
| 造血与免疫 | 骨髓、脐血、外周血、脾、胸腺 | 血液或造血器官疾病;免疫系统疾病 | 免疫细胞簇构成图谱最大板块之一 |
| 消化系统 | 肝、肠、胃、胰腺 | 消化系统疾病 | 肝脏样本含肝病中心来源供体(见 §2.4 疾病状态说明) |
| 循环系统 | 心脏、血管 | 循环系统疾病 | 内皮细胞 14 个主要簇为血管生物学提供参照 |
| 神经系统 | 小脑等 | 神经系统疾病 | 脑区覆盖有限(小脑之外的脑区未纳入,见 §7.1) |
| 内分泌系统 | 胰岛、肾上腺 | 内分泌、营养或代谢疾病 | 胰岛 β 细胞分化方案质控案例见论文 |
| 生殖系统 | 睾丸、卵巢、胎盘 | 泌尿生殖系统疾病;妊娠相关病症 | 生殖内分泌合作单位参与采样 |
| 骨骼肌肉系统 | 骨髓间质、肌肉 | 肌肉骨骼系统或结缔组织疾病 | 间充质细胞 4 个免疫活性簇的跨组织分析 |
| 皮肤 | 皮肤(胎儿+成人) | 皮肤疾病 | 胎儿皮肤样本用于发育对照 |
§2.1b SNOMED CT 结构概念映射
| 组织/细胞系统 | SNOMED CT 概念 | 概念码 | 说明 |
|---|---|---|---|
| 泌尿系统 | Kidney structure(肾脏结构) | 64033007 | 胎儿与成人肾脏样本 |
| 呼吸系统 | Lung structure(肺结构) | 39607008 | 成人肺组织样本 |
| 消化系统 | Liver structure(肝结构) | 10200004 | 肝组织与肝相关疾病样本 |
| 循环系统 | Heart structure(心结构) | 80248007 | 成人心脏样本 |
| 神经系统 | Brain structure(脑结构) | 12738006 | 小脑等有限脑区 |
| 造血系统 | Bone marrow structure(骨髓结构) | 42275009 | 成人骨髓样本 |
| 循环系统 | Blood vessel structure(血管结构) | 59820001 | 内皮细胞跨组织分析 |
| 皮肤 | Skin structure(皮肤结构) | 39937001 | 胎儿与成人皮肤样本 |
以上为结构(structure)层级概念码,用于组织级检索与术语对齐;细胞类型级(如 specific granulocyte)的 SNOMED 编码本条目不逐一展开,建议在数据字典中按簇名映射。
§2.2 背景简介与人群特征
单细胞转录组学的核心医学问题是:同一器官里混着多少种细胞、它们各自表达什么、疾病状态下谁先失衡。在 HCL 之前,人类主要器官的细胞类型清单主要来自分散的单组织研究,缺少同一平台、同一管线产出的全景参照。HCL 用统一的 Microwell-seq 平台与统一的分析管线回答"人体正常细胞景观"这一问题,覆盖胚胎与成年主要器官,样本来自中国汉族捐赠人群。
技术背景上,2018 年同团队的小鼠细胞图谱 MCA(Cell)已经证明 Microwell-seq 在器官全景尺度上的可行性;HCL 把同一套"低成本高通量 + 无监督聚类 + 人工校注"的范式推到人体尺度,并在三个方面拓展:覆盖胎儿与成人两个发育阶段、建立可在线调用的 scHCL 注释服务、与 MCA 构成人-鼠跨物种比较框架。
人群层面,样本由浙江大学医学院系统的合作医院与实验室采集(含生殖内分泌、肾病、肝胆胰外科、神经外科、骨髓移植等专科团队),以汉族供体为主;项目同时收录多种细胞培养体系(胚胎体、iPS 分化、H9/OP9 共培养、类器官等)作为"标准品"与组织样本并行分析。供体元数据中标注了疾病状态标签(HCA 口径下供体层面 20 种、标本层面 16 种疾病状态),意味着"每个供体都是健康人"的假设并不严格成立,使用时需读取元数据并做分层。
§2.3 临床任务定义
HCL 支撑的不是单一诊断任务,而是三类医学 AI 基础任务:
| 任务 | 定义 | 输入 | 输出 | 在临床研究中的角色 |
|---|---|---|---|---|
| 参考注释(reference mapping) | 将新样本的每个细胞映射到 HCL 已定义的细胞身份 | 单细胞 DGE 矩阵 | 每细胞簇标签 + 相似度/置信度 | 疾病组织分析的第一步:先分清"谁是谁" |
| 正常基线对照 | 比较疾病组织与图谱基线的细胞构成差异 | 疾病 scRNA-seq + HCL 参照 | 细胞比例偏移、异常表达状态 | 筛查疾病相关细胞亚群与 marker |
| 分化/培养质控 | 评估干细胞分化、类器官培养产物与目标细胞的接近程度 | 培养/分化样本 scRNA-seq | 谱系判定 + 发育轨迹位置 | 细胞治疗与类器官工程的放行依据 |
其中"参考注释"是 AI 建模最直接的入口:以 HCL 簇标签为监督信号训练分类器,或在表达空间做最近邻/相关性映射。需注意该任务的本质是域迁移——训练分布(microwell-seq、汉族人群、含胎儿组织)与应用分布(多为 droplet 平台、疾病组织)存在系统性差异,具体坑点见 §6.5。
§2.4 供体人群画像
| 维度 | 内容 | 来源 |
|---|---|---|
| 来源机构 | 浙江大学医学院干细胞与再生医学中心牵头,16 家以上附属医院与合作单位采样 | HCA 项目贡献者列表 |
| 人种/族裔 | 中国汉族捐赠人群(Han Chinese) | Nature 论文方法部分 |
| 发育阶段 | 胎儿与成人双阶段(HCA 口径 9 个发育阶段标签) | HCA 项目页 |
| 供体数 | 58 名(HCA Data Explorer 口径) | HCA 项目页 |
| 疾病状态 | 供体层面 20 种、标本层面 16 种疾病状态标签(含肾病中心等来源样本) | HCA 项目页 |
| 样本类型 | 手术/分娩获取的实体组织、血液骨髓样本、细胞培养体系(胚胎体、类器官、iPS 分化物等) | Nature 论文 + HCA 项目页 |
| 年龄/性别构成 | 论文未披露完整的年龄与性别分布表;按组织来源可推断覆盖胎儿与成人均有 | 本页面核对结论 |
§2.5 临床价值
对临床研究而言,HCL 的价值在于把"细胞身份判定"从经验变成可复现的计算流程。肿瘤科医生拿到一份瘤旁与瘤组织的 scRNA-seq 数据时,第一步是分清肿瘤细胞、基质细胞与浸润免疫细胞各处于什么状态——scHCL 类参考映射提供了这一步的自动化基线。生殖医学与产前研究领域,胎儿组织的覆盖让发育毒性、先天畸形相关研究有了人类参照。干细胞治疗领域,论文展示的分化细胞产物评估流程(如胰岛 β 细胞分化方案七阶段采样)直接对应细胞治疗产品放行检验中"到底培养出了什么"的问题。肾病、肝病等专科合作单位的参与也让 HCL 中保留了部分疾病状态样本,为疾病-对照配对研究提供了同一图谱内的素材。
§2.6 金标准说明
| 属性 | HCL 的实际情况 |
|---|---|
| 划分性质 | 全量数据一次性无监督聚类,无官方训练/验证/测试划分 |
| 标注方式 | 无监督聚类(Seurat/Scanpy 管线)+ marker 基因人工校注的两级体系(102 簇 → 843 亚类) |
| 标注者 | 团队内干细胞与单细胞领域研究者(论文作者团队),非独立第三方复核 |
| 一致性证据 | 供体批次混合分析(肾组织 7 个样本、约 4.5 万细胞)显示不同供体细胞在各簇内充分混合,提示批次效应相对较低;未报告簇级注释者间一致性指标(如 Cohen’s kappa) |
| 性质界定 | 属于"领域共识参考注释"而非病理金标准:簇身份以经典 marker 基因与文献一致性为准,未经组织学/流式独立验证 |
§3 数据集规格
§3.0 版本抉择矩阵
HCL 没有传统意义的"多版本",但有四个分发渠道,内容与体量不同。选错渠道是新手最常见的浪费(详见 §6.5 坑点 1):
| 你的需求 | 推荐渠道 | 大小 | 理由 |
|---|---|---|---|
| 做细胞类型注释/训练分类器 | figshare HCL_DGE_Data 或 GEO RAW.tar | 约 884.2 MB 压缩 | 处理后 DGE 矩阵,直接可用 |
| 严格复现论文图表 | GEO GSE134355 + GitHub ggjlab/HCL | 约 884.2 MB + 代码仓库 | 论文 Data availability 指定的组合 |
| 需要原始 reads 重比对 | INSDC SRP214806 或 CNGB CNP0000325 的 fastq | 254 个 fastq.gz(HCA 口径),数十 GB 级 | 只有原始数据能支持自定义比对与 UMI 处理 |
| 只想浏览/查询若干基因 | bis.zju.edu.cn/HCL 在线门户或 CZ CELLxGENE | 0(在线) | 无需下载,支持交互可视化与在线 scHCL 注释 |
| 快速试跑 scHCL R 包 | GitHub ggjlab/scHCL 内置 hcl_lung 示例 | 数 MB | 2,884 基因 × 80 细胞示例矩阵随包发布 |
§3.1 数据模态详情
HCL 是单模态数据集:单细胞 RNA 测序转录组。Microwell-seq 的技术原理决定了它的一切数据特性——磁珠携带条码与 UMI,单个细胞沉降进微米级微孔后与磁珠配对,经裂解与反转录将 mRNA 转为带条码的 cDNA,随后混合测序(HiSeq X Ten)。相比液滴平台,Microwell-seq 单细胞测序深度较低、每细胞检出基因数较少,但成本极低、细胞通量极高,且对大细胞与脆弱细胞的耐受性更好(这正是 HCL 能覆盖数十万细胞的经济基础)。
对 AI 使用者的三个直接推论:其一,表达矩阵高度稀疏,0 值既可能是真低表达也可能是漏检(dropout),缺失机制与高深度平台不同;其二,每细胞基因检出数分布的右移空间有限,照搬 10X 社区的 QC 阈值会误杀大量合法细胞(见 §6.5 坑点 4);其三,跨平台建模时 microwell-seq 与 droplet 数据的系统偏移显著,直接合并训练效果差,需配平或用整合算法(见 §6.5 坑点 7)。
| 数据特性 | Microwell-seq(HCL) | 液滴平台(10X 类) | 对使用者的含义 |
|---|---|---|---|
| 单细胞测序深度 | 较低(每细胞检出基因数少) | 较高 | QC 阈值不可互抄;dropout 比例更高 |
| 单次通量/成本 | 极高通量、低成本 | 高通量、成本更高 | 数十万细胞级图谱的经济可行来源 |
| 大细胞/脆弱细胞兼容性 | 微孔捕获耐受性更好 | 微流道可能造成偏好 | 特殊细胞类型覆盖的补充价值 |
| 数据形态 | UMI 计数 DGE(TXT 矩阵) | UMI 计数(h5/mtx) | HCL 需自行转 AnnData/h5ad |
| 与 bulk 一致性 | 平均表达相关 >0.8(论文) | 同样高 | 聚合层面的生物学可靠性相当 |
§3.2 按子集的样本数
| 子集口径 | 数量 | 来源 |
|---|---|---|
| 单细胞总数(QC 后) | 702,968 | Nature 论文 |
| 组织/培养类型数 | 60 种(GEO Overall design 口径);67 种(Elucidata 口径,含细胞培养) | GEO / Elucidata |
| 细胞簇 | 102 | Nature 论文 |
| 细胞亚类 | 843 | Nature 论文 |
| 供体数 | 58(HCA Data Explorer 口径) | HCA 项目页 |
| 解剖实体 / 器官部位 | 37 / 21 | HCA 项目页 |
| 发育阶段 | 9 | HCA 项目页 |
| GEO 系列页面样本列表 | 141 个 GSM 条目(按组织-样本命名,如 Adult-Bone-Marrow1) | GEO GSE134355 |
| HCA 项目页文件 | fastq.gz 254 个 + tar 1 个 + xlsx 1 个 | HCA 项目页 |
注意"141 vs 254"的差异是口径问题:GEO 页面样本列表与 HCA 项目文件清单的统计单位不同(DGE 上传单位 vs fastq 文件数),引用时务必注明口径,详见 §6.5 坑点 8。
§3.3 数据格式
| 格式 | 内容 | 位置 |
|---|---|---|
| TXT(DGE 矩阵) | 每组织/样本一个文件:行=基因(HUGO 符号),列=细胞条码,值=UMI 计数 | GSE134355_RAW.tar、figshare |
| TAR | 上述 TXT 的打包(GSE134355_RAW.tar,884.2 MB) | GEO 补充文件 |
| fastq.gz | 原始测序 reads(细胞条码+UMI+cDNA) | SRA / CNGB |
| XLSX | 细胞注释与簇-亚类-主要类型映射表 | GEO/HCA 附带 |
| R data | scHCL 包内置示例 hcl_lung(2,884 基因 × 80 细胞) | GitHub ggjlab/scHCL |
§3.4 存储大小
| 项目 | 大小 | 说明 |
|---|---|---|
| GSE134355_RAW.tar | 884.2 MB | GEO 官方数字(处理后 DGE,TAR of TXT) |
| 解压后 TXT 全集 | 数 GB 级 | 全转录组行 × 70 万细胞列;建议预留 10 GB 磁盘 |
| 转 h5ad/loom 后 | 视稀疏化程度,通常低于原始 TXT | 建议转 sparse CSC/CSR 存储 |
| 原始 fastq | 未核实具体总量 | HCA 口径 254 个 fastq.gz;按 SRA 页面实际显示为准 |
| 内存(全量分析) | 建议 ≥64 GB RAM | 全矩阵读入 R/Python 的实际需求见 §6.5 坑点 1 |
§3.5 标注方式
HCL 的标签不是人工逐格标注,而是计算优先、人工校验的两级体系:先用 Seurat/Scanpy 管线做全图无监督聚类得到 102 个簇,再按差异表达基因与经典 marker 文献为每个簇指派身份,并在簇内继续细分出 843 个亚类。簇与亚类的层级映射由官方注释表维护(Huatuo 项目使用的映射文件名 HCL_Cell_Cluster_Annatation.txt,注意官方拼写 Annatation)。因此所有标签都是"聚类定义 + 专家命名",同一簇内的异质性、跨平台时的簇边界漂移,都是标签使用的固有约束。
§3.6 标注者资质与一致性
标注由论文作者团队(干细胞与单细胞转录组领域研究者)完成,多个附属医院专科团队(肾病、肝胆胰、生殖内分泌、神经外科、骨髓移植等)参与样本采集与对应组织身份判定。论文未报告注释者间一致性统计量(如 kappa),提供的一致性证据是:肾组织 7 个样本(4 个胎儿肾 n=22,439 细胞、3 个成人肾 n=22,692 细胞)的 Seurat 分析中,不同供体的细胞在各簇内充分混合,提示批次效应相对较低;主要细胞类型数在每组织约 8,000 细胞时接近平台期,团队平均每组织采集超过 10,000 个细胞。
§3.7 采集周期
论文未给出统一的样本采集起止窗口。可核实的时间锚点如下:
| 时间锚点 | 日期 | 来源 |
|---|---|---|
| GEO 系列提交 | 2019-07-16 | GEO GSE134355 |
| GEO 转为 public | 2020-02-10 | GEO GSE134355 |
| 论文在线发表 | 2020-03-25 | Nature(bioRxiv 引文页) |
| 处理细胞数统计截止 | 2019-12-31 | Extended Data 图 1b |
| GEO 元数据最后更新 | 2024-08-26 | GEO GSE134355 |
| HCA 项目页更新 | 2025-02-14 | HCA Data Explorer |
引用采集期时建议写"2019 年及以前采集、2020 年发布",避免臆造精确窗口;需要时间协变量的建模应使用发育阶段(fetal/adult)而非采集日期。
§3.8 地域覆盖
样本全部来自中国(杭州及浙江省内浙江大学医学院系统合作医院网络),供体以汉族人群为主。这是 HCL 区别于欧美图谱的核心人群属性,也是向其他人群外推时必须标注的边界条件(见 §7.1、§7.5)。
§3.9 设备规格
| 环节 | 设备/试剂 | 说明 |
|---|---|---|
| 单细胞捕获 | Microwell-seq 微孔芯片 | 磁珠条码 + 微孔共定位,单次可处理大量细胞 |
| 测序 | Illumina HiSeq X Ten | GEO 平台记录 GPL20795/GPL21273 |
| 文库类型 | 3’ 端计数文库(单端) | HCA 元数据 Paired end: false |
| 分析环境 | Seurat/Scanpy、t-SNE、SCENIC、CellPhoneDB、velocyto、PAGA | 论文方法与 AMiner 解读 |
§3.10 深度溯源链
| 层级 | 实体 | 可核验地址 |
|---|---|---|
| 论文 | Han et al., Nature 581:303-309(2020),DOI 10.1038/s41586-020-2157-4,PMID 32214235 | nature.com/articles/s41586-020-2157-4 |
| 机构 | 浙江大学医学院干细胞与再生医学中心(通讯:韩晓平、郭国骥) | HCA 项目页联系人 |
| 主数据库 | GEO GSE134355 / INSDC SRP214806 / BioProject PRJNA554845 | ncbi.nlm.nih.gov/geo |
| 国内镜像 | CNGB Nucleotide Sequence Archive CNP0000325 | db.cngb.org |
| 镜像分发 | figshare HCL_DGE_Data(7235471)与 MCA_DGE_Data(5435866) | figshare.com |
| 门户 | bis.zju.edu.cn/HCL 与 db.cngb.org/HCL | 浙大/华大门户 |
| 代码 | github.com/ggjlab/HCL(图形代码)、ggjlab/scHCL(R 包) | GitHub |
| 国际集成 | HCA Data Explorer 项目 1fac187b-1c3f-41c4-b6b6-6a9a8c0489d1;CZ CELLxGENE;UCSC Cell Browser | 各平台检索 HCL |
§4 数据结构
§4.0 目录树
GEO 补充文件解压后的典型布局(GSE134355_RAW.tar → TXT 按组织/样本命名;hcl 目录与注释表为官方门户/工具链使用的组织方式示意):
data_root/
├── GSE134355_RAW.tar # GEO 补充文件(884.2 MB)
├── GSE134355_RAW/ # 解压后:每组织/样本一个 DGE TXT
│ ├── Adult-Bone-Marrow1_dge.txt
│ ├── Adult-Adipose1_dge.txt
│ ├── Adult-Adrenal-Gland2_dge.txt
│ ├── Fetal-Kidney1_dge.txt
│ ├── ... # 按组织-编号命名,共 60 种类型/141 个 GSM 口径
│ └── HCL_DGE.xlsx # 注释表(XLSX,GEO/HCA 附带)
├── annotation/
│ └── HCL_Cell_Cluster_Annatation.txt # 簇→主要类型映射(官方拼写 Annatation)
├── scHCL/ # R 包(ggjlab/scHCL)
│ ├── data/hcl_lung.rda # 示例矩阵:2,884 基因 × 80 细胞
│ └── R/ # scHCL()、scHCL_vis() 等函数
└── HCL_figures/ # ggjlab/HCL 论文图形代码
说明:TXT 文件名以 GEO 实际下载为准;上表中目录名 annotation/、scHCL/ 为整理建议,仓库原始结构见各自 GitHub 页面。data_root 与代码中的路径拼接关系见 §6.1。
§4.1 DAIMS 字段字典
以 DGE 矩阵与注释表的核心字段为对象(8 列:字段/类型/说明/示例/AI 用途/观测误差/信息性缺失/取值范围):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差来源 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| gene_symbol | Text | HUGO 基因符号(行索引) | TP53 | 特征名/通路映射 | 基因名版本差异 | 无 | 全转录组(论文示例:肾 17,058、肺 16,910 个可检出基因) |
| cell_barcode | Text | 细胞条码(列名),含组织前缀与序号 | Adult-Bone-Marrow1_XXX | 样本/组织溯源 | 无(发布态) | 无 | 702,968 个唯一列 |
| UMI count | Float | 条码-基因对的 UMI 计数 | 3.0 | 监督标签/聚类输入 | 测序深度不足导致的漏检 | 0=未检出或漏检(不可区分) | 非负整数,稀疏 |
| cluster_id | Label | 一级簇编号 | C17 | 分类目标变量 | 聚类边界随参数漂移 | 无 | C0-C101,共 102 簇 |
| subcluster_id | Label | 簇内亚类编号 | C17_4 | 细粒度分类 | 亚类样本量小、不稳定 | 无 | 843 个亚类 |
| major_cell_type | Label | 簇归属的大类(如 immune/epithelial) | immune | 粗粒度分层评估 | 大类边界有专家约定 | 无 | Huatuo 口径 44 大类 |
| tissue | Text | 组织/培养类型 | Fetal-Kidney | 分层抽样/域标签 | 同组织多供体合并 | 无 | 60 种类型 |
| developmental_stage | Label | 发育阶段标签 | fetal / adult | 分层与偏倚控制 | 阶段粒度有限 | 无 | HCA 口径 9 个阶段 |
§4.2 标签分布
HCL 的 102 个簇呈高度长尾分布:免疫与上皮相关簇的细胞量占绝对多数,而部分组织特异簇(如某些胎儿间质、神经相关亚群)只有数千甚至数百细胞。论文以 t-SNE 全景观与分组织 t-SNE 呈现构成,未在正文发布逐簇完整细胞数表。分布特征可归纳为下表:
| 分布特征 | 表现 | 对建模的影响 |
|---|---|---|
| 长尾不均衡 | 头部簇(免疫/上皮)细胞量占绝对多数,尾部簇数百量级 | 宏平均与加权平均指标分化明显,需双轨报告 |
| 组织-簇块状结构 | 每个簇主要由若干组织贡献,跨组织共享簇集中在免疫等大类 | 组织留出评估时尾部簇可能整簇消失 |
| 供体覆盖不均 | 部分簇在特定供体缺席(如某胎儿肾供体缺 C19、某成人肾供体缺 C22) | 供体分组切分的标签空间不一致 |
| 两级粒度 | 102 簇 → 843 亚类,Huatuo 另归并 44 大类 | 粒度选择直接改变任务难度与指标量级 |
对监督学习而言:直接以 cluster_id 为标签做多分类时,尾部簇的 F1 会被头部簇淹没,应按 §5 的分层策略报告宏平均;或按 Huatuo 的做法把 357 个可用簇归并为 44 个主要大类再训练。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 细胞总数(QC 后) | 702,968 | Nature 论文 |
| 簇/亚类 | 102 / 843 | Nature 论文 |
| 每组织平均细胞数 | >10,000(主要类型数在约 8,000 细胞时饱和) | Extended Data 图 1d |
| pseudo-cell 总数(网络分析) | 30,053 | Extended Data 图 2b |
| 覆盖 TF 数 | 1,521(人 TF-TF 相关矩阵) | Extended Data 图 2c |
| 跨物种正交 TF 调控子 | 140 个,归入 15 个主要模块 | 人-鼠比较分析 |
| bulk vs microwell-seq 相关性 | >0.8(肾/肺平均表达) | Extended Data 图 1c |
| scHCL 注释示例规模 | hcl_lung:2,884 基因 × 80 细胞 | scHCL 包 README |
§4.4 数据层级
HCL 的层级结构为:供体(58 名)→ 组织/培养类型(60 种)→ 采样样本(GEO 口径 141 个 GSM 条目)→ 细胞(702,968 个)→ 簇归属(102 簇 → 843 亚类)。
| 层级 | 数量 | 标识方式 | 关联注意 |
|---|---|---|---|
| 供体 | 58(HCA 口径) | 匿名供体 ID(HCA 元数据) | 发布矩阵以条码前缀区分组织而非显式供体表,跨组织供体关联需借助 HCA 元数据 |
| 组织/培养类型 | 60 种 | 条码前缀(如 Adult-Bone-Marrow1) | 胎儿与成人样本共用一套簇编号体系 |
| 采样样本 | 141 个 GSM 条目(GEO 口径) | GSM 编号 | 与 HCA 的 254 个 fastq 口径不同,引用需注明 |
| 细胞 | 702,968 | 唯一细胞条码 | 稀疏矩阵的列(或转置后行) |
| 簇归属 | 102 簇 / 843 亚类 | C0-C101 与亚类编号 | 部分簇在特定供体中天然缺席 |
供体级分析的两个注意点:其一,部分簇在特定供体中天然缺席(论文肾组织分析显示某胎儿肾供体缺 C19、某成人肾供体缺 C22),做供体级划分时会出现标签空间不一致;其二,同一供体的多组织样本散布在不同组织文件中,重建"供体 × 组织"矩阵需要 HCA 层的元数据桥接。
§4.5 缺失值与信息性缺失
DGE 矩阵没有显式缺失标记:所有未检出基因均记为 0,其中混有两种机制——真实的低/无表达(生物学 0)与测序深度不足导致的漏检(技术 dropout)。
| 缺失形态 | 机制 | 判别线索 | 工程处理 |
|---|---|---|---|
| 生物学 0 | 该基因在该细胞确无表达 | 与细胞类型 marker 谱一致 | 保留 0 值语义,作为特征 |
| 技术 dropout | 测序深度不足导致漏检 | 深度越低的细胞非零基因越少 | 稀疏建模、深度协变量、MAD 型 QC |
| 簇缺席 | 该组织/供体天然不含某细胞类型 | 整簇在分组织文件中无对应细胞 | 合并训练时统一标签空间并登记缺席组合 |
| 元数据缺失 | 部分元数据字段官方未披露 | HCA 与 GEO 字段对不齐 | 以 HCA 项目页为元数据主源 |
Microwell-seq 的低深度使技术 dropout 比例高于液滴平台,且论文未提供官方的缺失机制说明文档。工程含义:稀疏矩阵应使用稀疏数据结构存储;基于"非零率"的特征筛选阈值要重新标定;下游模型若假设 0 均为真值,会在低深度细胞上系统性低估表达。
§5 数据划分与使用建议
§5.1 官方划分情况
HCL 是图谱型数据集,官方不提供 train/val/test 划分——102 个簇由全量数据一次性无监督聚类得出,任何"官方标签 + 同批数据评估"的组合都自带标签泄漏(见 §6.5 坑点 4)。也因此,社区不存在"官方基准划分"这一概念:引用任何第三方注释性能数字前,必须先核对其切分协议是否为供体分组或外部数据测试。
§5.2 社区惯例划分
| 惯例做法 | 切分单位 | 适用场景 | 风险 |
|---|---|---|---|
| 整体参考 | 不切分 | 把 HCL 当外部参考做自家数据的注释 | 无内部评估,性能完全取决于目标域 |
| 组织留出(leave-one-tissue-out) | 组织 | 评测模型对未见组织的泛化 | 组织间差异大,指标偏低属正常 |
| 供体分组切分 | 供体 | 图谱内部的监督任务评估 | 需处理供体缺簇的标签空间问题 |
| 发育阶段分层 | fetal / adult | 避免发育捷径特征 | 各层样本量与标签空间不同 |
§5.3 泄漏风险(重点)
| 泄漏类型 | 机制 | 典型症状 | 对策 |
|---|---|---|---|
| 标签泄漏 | 簇标签来自含测试集的全量聚类 | 内部指标虚高、外部跳水 | 供体/组织级切分 + 外部数据复测 |
| 供体泄漏 | 同一供体细胞跨训练/测试集 | 测试集出现训练供体的"分身"细胞 | GroupKFold(组=供体) |
| 发育阶段混杂 | 胎儿-成人表达差异成为捷径特征 | 注释结果与发育阶段强相关 | 按 stage 分层建模与报告 |
| 组织重复 | 同组织多样本近乎复制分布 | 按细胞随机切分时指标失真 | 同组织的样本整组同侧 |
| 平台混杂 | microwell-seq 与 droplet 差异被当成分类信号 | 跨平台测试性能骤降 | 平台分层评估、整合层建模 |
§5.4 交叉验证建议
以供体为分组键做 GroupKFold(或以"供体×组织"为组),保证每折的供体互斥;胎儿与成人分别跑独立交叉验证并分开报告;报告宏平均 F1 与每簇召回,重点监控支持度小于 500 的尾部簇;对供体缺簇导致的标签空间不一致,显式取并集并对缺席类填 0 支持度,而不是静默丢弃。
| 协议项 | 推荐设置 | 理由 |
|---|---|---|
| 分组键 | 供体(无供体表时退化为"样本/GSM") | 供体内细胞高度相关 |
| 折数 | 5 折 | 单细胞数据规模下稳定且成本可控 |
| 指标 | macro-F1 为主,附 balanced accuracy | 长尾分布下的公平度量 |
| 尾部簇 | 支持度 <500 单列明细 | 防头部簇掩盖失效 |
| 阶段 | fetal/adult 分列 | 避免发育捷径效应污染结论 |
| 种子 | ≥3 个种子报均值±标准差 | 单种子排名不可靠 |
§5.5 外部验证建议
至少在一个非 microwell-seq 平台(如 10X 产生的公开人类 scRNA-seq 数据,可从 CZ CELLxGENE 获取)上验证注释迁移性能,并报告相对内部验证的下降幅度作为泛化性的诚实度量;跨人群应用需在非汉族人群数据上复测;疾病场景建议与器官专项图谱配对(HCL 作正常对照臂),避免把平台差异误读为疾病效应(见 §7.8)。
§6 AI 就绪指南
§6.0 云端快速启动
不下载任何文件的最快路径:打开 CZ CELLxGENE 或 UCSC Cell Browser 的 HCL 项目页,浏览器内交互查看 t-SNE、按基因着色;或访问 bis.zju.edu.cn/HCL 在线门户,直接用网页版 scHCL 上传小规模表达矩阵(数百细胞量级)做在线注释。适合前期调研与教学演示;一旦需要批量训练,转入 §6.1 本地流程。
§6.1 快速上手
# ============ 目录结构预期 ============
# data_root/
# ├── GSE134355_RAW/ # 解压后的按组织 DGE TXT
# │ └── Adult-Bone-Marrow1_dge.txt
# └── annotation/
# └── HCL_Cell_Cluster_Annatation.txt
#
# data_root 拼接关系:下方所有路径均以环境变量 HCL_ROOT 为 data_root 前缀。
# 最小可用子集:任选一个组织的 dge.txt(百 MB 内)即可跑通全流程;
# 不必一次加载全部 60 种组织。
import os, gzip
import pandas as pd
import scanpy as sc
HCL_ROOT = os.environ.get("HCL_ROOT", "./data_root")
# 单个组织的 DGE TXT:行=基因,第一列基因为行名;读入后转置为 细胞×基因
path = os.path.join(HCL_ROOT, "GSE134355_RAW", "Adult-Bone-Marrow1_dge.txt")
df = pd.read_csv(path, sep="\t", index_col=0)
adata = sc.AnnData(df.T) # 细胞 × 基因
adata.var_names_make_unique()
# 标准 Scanpy 预览流程(QC 阈值含义见 §6.5 坑点 4)
sc.pp.filter_cells(adata, min_genes=200)
sc.pp.filter_genes(adata, min_cells=3)
adata.layers["counts"] = adata.X.copy()
sc.pp.normalize_total(adata, target_sum=1e4)
sc.pp.log1p(adata)
sc.pp.highly_variable_genes(adata, n_top_genes=2000)
sc.pp.pca(adata, n_comps=30)
sc.pp.neighbors(adata); sc.tl.umap(adata)
sc.tl.leiden(adata, resolution=1.0, key_added="leiden")
print(adata)
第一轮跑通后,再考虑多组织合并与全量规模(先读 §6.5 坑点 1 的内存预算)。
§6.2 数据获取
| 渠道 | 内容 | 大小 | 是否需注册 |
|---|---|---|---|
| GEO GSE134355 | GSE134355_RAW.tar(处理后 DGE) | 884.2 MB | 否 |
| figshare HCL_DGE_Data | DGE 镜像 | 见下载页 | 否 |
| SRA(SRP214806)/ CNGB(CNP0000325) | 原始 fastq | 254 个 fastq.gz(HCA 口径) | 否 |
| bis.zju.edu.cn/HCL | 在线门户与文档 | — | 否 |
| GitHub ggjlab/HCL、ggjlab/scHCL | 图形代码、R 包 | 数 MB | 否 |
# 渠道一:GEO 处理后 DGE(推荐,约 884.2 MB)
wget -P data_root/ "https://www.ncbi.nlm.nih.gov/geo/download/?acc=GSE134355&format=file&file=GSE134355%5FRAW%2Etar"
tar -xf data_root/GSE134355_RAW.tar -C data_root/GSE134355_RAW/
# 渠道二:figshare 镜像(论文 Data availability 指定)
# 浏览器打开 https://figshare.com/articles/HCL_DGE_Data/7235471 下载
# 渠道三:原始数据(重比对才需要)
# SRA: SRP214806 / CNGB: CNP0000325 —— 按需用 sra-tools 或 CNGB 下载器
# 注释工具
git clone https://github.com/ggjlab/scHCL.git # R 包(devtools::install_github("ggjlab/scHCL"))
下载完成后核对文件大小(约 884.2 MB)与解压后的 TXT 数量是否与 GEO 样本列表一致。
§6.3 预处理全流程
# 多组织合并 → 稀疏化 → QC → 归一化 → HVG → 保存 h5ad
# 目标:把数十个 TXT 合并为一个稀疏 AnnData,供训练与可视化复用
import os, glob
import numpy as np
import pandas as pd
import scipy.sparse as sp
import scanpy as sc
HCL_ROOT = os.environ.get("HCL_ROOT", "./data_root")
adatas = []
for path in sorted(glob.glob(os.path.join(HCL_ROOT, "GSE134355_RAW", "*_dge.txt"))):
tissue = os.path.basename(path).replace("_dge.txt", "")
df = pd.read_csv(path, sep="\t", index_col=0).T # 细胞 × 基因
a = sc.AnnData(sp.csr_matrix(df.values), dtype="float32")
a.obs_names = [f"{tissue}_{b}" for b in df.index] # 条码加组织前缀防撞名
a.var_names = df.columns.astype(str); a.var_names_make_unique()
a.obs["tissue"] = tissue
a.obs["stage"] = "fetal" if tissue.startswith("Fetal") else "adult"
adatas.append(a)
del df
adata = sc.concat(adatas, join="outer") # outer 保留各组织特有基因,缺失记 0
X = sp.csr_matrix(adata.X); X.eliminate_zeros()
adata = sc.AnnData(X, obs=adata.obs, var=adata.var)
# ---- QC:microwell-seq 低深度,阈值必须低于 10X 惯例(见坑点 4)----
sc.pp.filter_cells(adata, min_genes=200) # 而不是 500/1000
sc.pp.filter_genes(adata, min_cells=3)
adata.layers["counts"] = adata.X.copy()
sc.pp.normalize_total(adata, target_sum=1e4)
sc.pp.log1p(adata)
sc.pp.highly_variable_genes(adata, n_top_genes=3000, flavor="seurat")
adata_hvg = adata[:, adata.var.highly_variable].copy()
sc.pp.scale(adata_hvg, max_value=10)
sc.pp.pca(adata_hvg, n_comps=50)
sc.pp.neighbors(adata_hvg); sc.tl.umap(adata_hvg)
sc.tl.leiden(adata_hvg, resolution=1.0, key_added="leiden")
adata_hvg.write(os.path.join(HCL_ROOT, "hcl_merged_hvg.h5ad"), compression="gzip")
流程要点:合并时用 join="outer" 保留组织特异基因;layers["counts"] 保留原始计数供损失函数(如负二项)使用;scale 只在 HVG 子集上做,避免全矩阵膨胀。
§6.4 PyTorch DataLoader
# 以"预测 HCL 簇标签"为示例任务:需要每个细胞的簇标签。
# 标签来源:官方注释表/XLSX(HCL_Cell_Cluster_Annatation.txt 提供 簇→主要类型 映射,
# 簇级标签通常需从 GEO 附表或 HCA 元数据获取细胞-簇对应关系)。
import h5py
import numpy as np
import scipy.sparse as sp
import torch
from torch.utils.data import Dataset, DataLoader
class HCLDataset(Dataset):
"""h5ad(含 counts 层与 obs 标签列)的稀疏感知 Dataset。
目录结构预期:data_root/hcl_merged_hvg.h5ad(§6.3 产物)
"""
def __init__(self, h5ad_path, label_key="leiden", split="train",
donor_groups=None, train_frac=0.8, seed=0):
with h5py.File(h5ad_path, "r") as f:
self.genes = [g for g in f["var/_index"][:]]
X = sp.csr_matrix(
(f["X/data"][:], f["X/indices"][:], f["X/indptr"][:]),
shape=(len(f["obs/_index"][:]), len(self.genes)))
labels = np.array([l.decode() if isinstance(l, bytes) else l
for l in f[f"obs/{label_key}"][:]])
rng = np.random.default_rng(seed)
idx = rng.permutation(X.shape[0])
k = int(train_frac * len(idx))
self.indices = idx[:k] if split == "train" else idx[k:]
self.X, self.labels = X, labels
self.label2id = {l: i for i, l in enumerate(sorted(set(labels)))}
def __len__(self):
return len(self.indices)
def __getitem__(self, i):
j = self.indices[i]
row = torch.from_numpy(np.asarray(self.X[j].todense())).float().squeeze(0)
y = self.label2id[self.labels[j]]
return row, y
train_ds = HCLDataset("./data_root/hcl_merged_hvg.h5ad", split="train")
val_ds = HCLDataset("./data_root/hcl_merged_hvg.h5ad", split="val")
# 建议生产环境改用按供体分组的划分(§5),此处随机划分仅作演示。
train_dl = DataLoader(train_ds, batch_size=1024, shuffle=True, num_workers=4)
val_dl = DataLoader(val_ds, batch_size=4096, shuffle=False, num_workers=4)
n_classes = len(train_ds.label2id)
§6.5 八个坑点
⚠️ 坑点 1:全量 DGE 一次性读入导致内存爆炸(分类:工程陷阱)
问题:702,968 个细胞 × 全转录组列的 DGE 若以 TXT 全量读入并用稠密数组承载,需要数十 GB 内存,普通工作站(32-64 GB)直接 OOM;pandas 默认 parse 还会把所有计数当 float64,内存再翻倍。
症状:pd.read_csv阶段进程被内核杀掉(Killed),或读到一半机器卡死;R 用户则常见R session aborted。
解决:
- 简单方法:按组织逐文件读入,每读完一个就转
scipy.sparse.csr_matrix/R 的dgCMatrix并立即del原始 DataFrame(§6.3 代码即此策略)。- 进阶方法:用
chunksize流式读取单个大 TXT,或先在 shell 里awk抽取目标基因行/列子集再读入;行列名去重(var_names_make_unique())避免 AnnData 合并报错。- SOTA 方法:落盘为 h5ad(稀疏)或 AnnData-Zarr 分块存储后,用
sc.read_h5ad(..., backed="r")或 dataloader 按批物化,全量分析常驻内存可控制在 10 GB 内。
参考:GEO GSE134355 补充文件说明(884.2 MB RAW.tar);Scanpy 文档 reading/concatenation 章节。
⚠️ 坑点 2:低深度平台的 QC 阈值照搬 10X 社区惯例(分类:预处理陷阱)
问题:Microwell-seq 单细胞测序深度显著低于 10X 类平台,每细胞检出基因数天然偏少。若照搬 droplet 社区的
min_genes=500/1000或高 UMI 下限做过滤,会把大量真实细胞(尤其低转录本含量的干细胞/祖细胞——恰是 HCL 的研究重点)误判为空滴而删除。
症状:过滤后细胞数远低于官方 702,968 口径;t-SNE 上干细胞相关簇消失;各组织回收细胞比例严重不均。
解决:
- 简单方法:QC 阈值下移(如
min_genes=200),先画每细胞基因数分布再定阈值,而不是抄参数。- 进阶方法:按组织分层定阈值——不同组织的转录负荷差异大;用 MAD(中位绝对偏差)准则(
median ± 3*MAD)替代固定数字。- SOTA 方法:采用对测序深度稳健的模型化方法(如 scVI 的深度校正潜变量模型),把深度作为协变量建模而非硬过滤;或参考论文 Extended Data 图 1d 的饱和分析估算各组织有效细胞量。
参考:Han et al., Nature 2020 方法部分与 Extended Data 图 1;scVI-tools 文档。
⚠️ 坑点 3:两套标签体系混用——102 簇编号与 843 亚类层级(分类:标签理解)
问题:HCL 同时存在一级簇(C0-C101 共 102 个)、簇内亚类(843 个)与主要细胞大类(Huatuo 口径 44 类)三层标签。不同分发渠道(GEO XLSX、HCA 元数据、Huatuo 映射文件)暴露的层级和粒度不一,把"簇编号"当"亚类编号"或把不同层级的标签拼进同一列,会造成标签空间错乱。
症状:分类任务类别数对不上文献(102/357/843/44 各说各话);混淆矩阵出现大量不可能的跨界错误;复现他人结果时类别对不齐。
解决:
- 简单方法:开工前固定一个层级(建议 Huatuo 的 44 大类或 102 簇),并把所用映射文件(如 HCL_Cell_Cluster_Annatation.txt)与代码一起版本化。
- 进阶方法:写显式的层级校验函数——断言每个亚类的前缀簇编号与一级簇一致,断言训练/验证集标签集合一致;对缺席组合(供体缺簇,见坑点 8)显式登记。
- SOTA 方法:用层级分类(hierarchical classification)建模,损失函数同时约束大类与细类一致性;或用 CLAMS/Cell Ontology 类本体工具把三层标签对齐到标准细胞本体。
参考:Huatuo 项目 DeepWiki(357 clusters / 44 major types 说明);Nature 论文主图聚类层级。
⚠️ 坑点 4:用全量聚类标签做监督任务 = 结构性标签泄漏(分类:数据泄漏)
问题:HCL 的簇标签是对全量细胞(含你要划入测试集的部分)无监督聚类后人工校注的产物。测试集细胞参与了决定"类别边界"的聚类,标签本身内含测试集分布信息——随机切分后的高准确率有相当部分来自这一结构性泄漏。
症状:内部验证准确率/F1 高得漂亮,换到外部数据集(自有样本、droplet 数据)性能大幅跳水;同一模型在不同随机种子下性能波动异常小。
解决:
- 简单方法:至少按供体(GroupKFold)或按组织留出做评估,杜绝细胞级随机切分。
- 进阶方法:报告"内部(供体分组)+ 外部(非 microwell-seq 平台)"双套指标,把内外差值作为泛化性的诚实度量(§7.8 矩阵)。
- SOTA 方法:把问题定义为"参考映射"而非"闭集分类"——用 scArches 类架构冻结 HCL 参考潜空间、只训练查询数据的映射头,从任务定义上隔离泄漏;评估时引入 OOD(未见簇/未知类型)拒识能力。
参考:§5 划分建议;scArches(Lotfollahi et al., Nature Biotechnology 2022 概念)。
⚠️ 坑点 5:胎儿-成人混杂导致"发育阶段捷径特征"(分类:偏倚陷阱)
问题:HCL 把胎儿与成人组织放进同一矩阵、同一套簇编号。胎儿细胞转录组随机性更高(论文核心发现之一),许多基因(如胚胎期血红蛋白、发育转录因子)在胎儿样本中系统性高表达。若建模时不分层,模型会优先学会"区分胎儿 vs 成人"这条捷径,而非细胞类型本身。
症状:注释模型在成人疾病样本上把一堆细胞误判为胎儿类型;特征重要性 Top 榜被发育基因占据;按发育阶段分层的指标差异巨大。
解决:
- 简单方法:训练前按
stage(fetal/adult,条码前缀或 HCA 元数据)分列建模、分列报告指标。- 进阶方法:把发育阶段作为协变量纳入模型(scVI 的 batch key / 条件变量),让潜空间剥离阶段效应。
- SOTA 方法:用 PAGA/轨迹类方法(论文同款)先构建发育连续体,再在轨迹坐标系中定义任务;或仅在"发育守恒"的细胞类型集合上做跨阶段迁移。
参考:Han et al., Nature 2020 图 3 与"转录组随机性"结论;HCA 项目页 9 个发育阶段标签。
⚠️ 坑点 6:"健康图谱"假设不成立——疾病状态样本混入(分类:偏倚陷阱)
问题:HCL 常被当作纯正常对照,但其供体元数据含疾病状态标签(HCA 口径:供体层面 20 种、标本层面 16 种),且样本来自肾病中心、肝胆胰外科等临床科室——例如肝脏样本即来自含肝病背景的合作单位。不读元数据就把所有细胞当"正常基线",会污染对照设计。
症状:疾病-对照差异表达出现假阴性(对照本身含病理细胞);把图谱内某簇当成"新发现的疾病细胞";两篇论文用同一 HCL 子集得出矛盾基线。
解决:
- 简单方法:下载 HCA 项目页元数据,按 donor/specimen 的 disease status 字段过滤后再用。
- 进阶方法:把疾病状态标签保留为协变量,做敏感性分析(含/不含病理样本各跑一遍),报告结论稳健性。
- SOTA 方法:与疾病专项图谱(如肾脏/肝脏专项)做配对设计,用 HCL 仅提供"同一平台、同管线"的对照臂,避免跨平台混淆变量。
参考:HCA Data Explorer 项目页(16/20 disease statuses);Nature 论文合作单位列表。
⚠️ 坑点 7:跨平台直接迁移——microwell-seq 参考注释 droplet 数据(分类:评估误用)
问题:scHCL 用皮尔逊相关系数把查询细胞映射到 HCL 簇,这在同平台数据上表现良好;但 HCL 与 10X 等液滴平台在基因检出分布、深度、3’ 覆盖偏好上系统性不同,把 HCL 参考直接套到 droplet 数据并按同一阈值判"注释成功",会系统性低估或错配。
症状:注释结果中大量细胞置信度低于阈值;已知类型的细胞被映射到错误簇;换用不同平台数据性能差异远超预期。
解决:
- 简单方法:迁移前把两平台数据各自归一化到可比空间(CPM+log1p、共同高变基因集),并只用两平台都稳定检出的管家/类型 marker 基因子集计算相似度。
- 进阶方法:用 Harmony/scVI 先做跨平台整合再映射;或在自有数据上先跑无监督聚类,再对簇(而非单细胞)做参考匹配,稀释单细胞噪声。
- SOTA 方法:scArches 式"冻结参考、增量映射";或训练时混入公开 droplet 数据做平台对抗增广,显式学习平台不变表征;评估时按平台分层报告。
参考:Han et al., Nature 2020(scHCL 设计初衷为在线注释);Korsunsky et al., Nature Biotechnology 2019(Harmony)。
⚠️ 坑点 8:规模与样本口径混乱——引用数字必注明出处(分类:工程陷阱)
问题:HCL 的规模数字在不同官方渠道不一致:论文/figshare 口径 702,968 细胞;HCA Explorer 显示 703.0k 估算与 58 供体;浙大 cellatlas 页面出现过 “599,926 cells” 与 “>700,000” 并存;GEO 样本列表 141 个 GSM 条目而 HCA 列 254 个 fastq.gz。不做口径声明地混引,轻则审稿质疑,重则下游管线以错误总量做断言。
症状:代码里assert n_cells == 702968在另一下载渠道的数据上失败;论文方法部分与结果部分细胞数对不上;团队内部多份数据副本"总量"互相矛盾。
解决:
- 简单方法:全项目只认一个主口径(建议论文的 702,968),任何数字旁标注"(口径+来源+截至日期)";加载后以实际计数为准而非硬编码断言。
- 进阶方法:为每个下载渠道建一份 ingestion 清单(渠道、文件数、细胞数、MD5、下载日期),入库时自动核对并落版本日志。
- SOTA 方法:用 DVC/LakeFS 类数据版本工具把"渠道-快照-统计"三元组固化,任何指标都能回溯到确切的数据快照。
参考:Nature 论文摘要(702,968);GEO GSE134355;HCA 项目页;bis.zju.edu.cn/cellatlas 页面口径并存的直接观察。
§6.6 数据增强
- ✅ 安全:基因级随机 mask(按小概率把非零值置 0,模拟 dropout,训练时用损失重建)、基于泊松/负二项重采样的 count 扰动(保持计数语义)、对 HVG 子集的高斯微扰(仅 log 空间、幅度小)、Mixup 类表达向量插值(仅限同簇内、标签软化的场景)。
- ❌ 危险:跨簇/跨组织细胞拼接后赋单标签(制造不存在的细胞状态);把归一化后的 log 值当 count 再做泊松采样(破坏计数分布);对 QC 过滤前的原始矩阵随机抽样后声称"与官方规模一致";在参考映射任务中把查询数据的簇结构信息回灌训练集(见坑点 4)。
§6.7 模型推荐
| 模型/工具 | 类型 | 适用任务 | 备注 |
|---|---|---|---|
| scHCL(官方 R 包) | 相关性参考映射 | 快速细胞身份判定 | scHCL() 返回 top 命中与相关系数,scHCL_vis() 可视化 |
| Huatuo(ggjlab) | XGBoost 模型集(357 簇/44 大类) | 批量注释 | 300+ 预训练模型;自定义类型需自行训练 |
| Scanpy + Leiden | 无监督管线 | 图谱复聚类、探索性分析 | §6.3 流程即基于此 |
| scVI / scANVI | 深度生成模型 | 深度校正、批次整合、半监督注释 | 对低深度 microwell-seq 尤其合适 |
| Harmony | 图形整合 | 跨供体/平台校正后联合分析 | 轻量、PCA 空间迭代 |
| scArches | 参考映射微调 | 把 HCL 做成可增量映射的参考 | 冻结参考、查询侧训练(见坑点 4 SOTA) |
§6.8 硬件需求
| 场景 | 内存 | GPU | 磁盘 |
|---|---|---|---|
| 单组织子集探索(§6.1) | 16 GB | 不需要 | 10 GB |
| 多组织合并 + Scanpy 全流程 | 64 GB | 可选(UMAP/PCA 加速) | 50 GB |
| 全量 scVI/深度模型训练 | 64-128 GB | 单卡 ≥16 GB 显存 | 100 GB |
| 原始 fastq 重比对 | 64 GB 起 | 不需要 | ≥1 TB(254 个 fastq.gz 解压后) |
§6.9 评估指标代码
# 注释/分类任务的诚实评估:按供体分组 + 宏平均 + 尾部簇监控
from sklearn.metrics import f1_score, balanced_accuracy_score, classification_report
import numpy as np
def evaluate(y_true, y_pred, labels=None):
macro_f1 = f1_score(y_true, y_pred, average="macro", labels=labels, zero_division=0)
w_f1 = f1_score(y_true, y_pred, average="weighted", labels=labels, zero_division=0)
bacc = balanced_accuracy_score(y_true, y_pred)
print(f"macro-F1={macro_f1:.4f} weighted-F1={w_f1:.4f} balanced-acc={bacc:.4f}")
# 尾部簇(支持度 < 500)单独报告,防止头部簇掩盖
support = np.bincount(y_true)
tail = [i for i, s in enumerate(support) if 0 < s < 500]
if tail:
rep = classification_report(y_true, y_pred, labels=tail, zero_division=0)
print("---- 尾部簇明细 ----\n", rep)
return macro_f1, w_f1, bacc
务必同时报告 macro-F1(对尾部簇敏感)与 weighted-F1(反映真实构成),并附评估所用的切分方式说明(供体分组与否)。
§6.10 MLOps 笔记
- 版本锚点:GEO 系列最后更新 2024-08-26;任何实验记录写明"GSE134355,下载日期,RAW.tar 大小 884.2 MB 核对通过"。
- 口径声明:在数据卡(datasheet)中固定写"702,968 细胞(Nature 论文口径)",其余口径仅作交叉参考(见坑点 8)。
- 标签版本化:注释表(含官方拼写 HCL_Cell_Cluster_Annatation.txt)与处理代码同仓库版本化;簇层级变更(102/843/44)必须触发重训评估。
- 复现链:环境(scanpy/anndata 版本)→ h5ad 中间产物 → 划分种子 → 指标日志四件套入库,保证任意指标可回放。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 人群偏倚 | 供体为中国汉族人群,其他族裔外推未经验证 | 高 | 跨人群应用前先在目标人群样本上校准 |
| 覆盖偏倚 | 60 种组织类型并未穷尽人体:小脑之外的多数脑区未纳入(Huatuo 官方文档明示) | 中高 | 脑研究改用专项图谱;避免对未覆盖组织做"阴性"结论 |
| 健康偏倚 | 被当作"健康基线",但供体元数据含 20 种疾病状态标签,临床科室来源样本可能带病理状态 | 中高 | 读取 HCA 疾病状态字段并过滤/分层(坑点 6) |
| 稀有亚型欠采样 | 罕见细胞亚型采样深度有限(Huatuo 文档明示),长尾簇细胞量小 | 中 | 罕见类合并评估或过采样;不做小样本簇的强结论 |
| 平台偏倚 | Microwell-seq 低深度、3’ 计数,与 droplet 数据存在系统差异 | 中 | 跨平台整合(Harmony/scVI)后再映射(坑点 7) |
| 供体不均 | 部分簇在特定供体天然缺席(如某胎儿肾供体缺 C19、某成人肾供体缺 C22) | 低中 | 供体分组划分;缺席组合显式登记 |
§7.2 标注质量
簇身份由作者团队按差异表达基因与经典 marker 文献人工校注,属领域共识式参考注释;论文提供的一致性证据为供体批次混合分析(肾组织 7 样本、约 4.5 万细胞跨供体充分混合)与平台间表达相关性(>0.8)。未报告注释者间一致性统计量(kappa 等),簇边界亦无组织学/流式独立验证。
| 一致性证据 | 内容 | 支撑强度 |
|---|---|---|
| 供体批次混合 | 4 胎儿肾 + 3 成人肾样本(n=22,439/22,692 细胞)跨供体在簇内充分混合,批次效应相对较低 | 中高(Seurat 定量分析) |
| 深度饱和 | 主要细胞类型数在约 8,000 细胞时接近平台期,平均每组织采集 >10,000 细胞 | 中高(下采样曲线) |
| 平台对照 | microwell-seq 与 bulk RNA-seq 平均表达相关 >0.8;与 10X Tabula Muris 肺数据的聚类对照 | 中(定性 + 相关性) |
| 注释者间一致性 | 未报告 | 无 |
| 独立病理验证 | 无(簇身份以 marker 文献一致性为准) | 无 |
使用建议:把标签视为"高质量起点"而非绝对真值,关键结论用自有数据中独立 marker 染色/流式复核;对亚类粒度(843 个)的标签尤其要谨慎——样本量小、边界不稳。
§7.3 泛化性
| 应用场景 | 失效风险 | 证据/理由 |
|---|---|---|
| 同平台(microwell-seq)汉族组织注释 | 低 | 论文演示的 scHCL 即为此场景 |
| droplet 平台数据注释 | 中高 | 平台深度/覆盖系统差异;需整合层(坑点 7) |
| 疾病组织注释 | 中 | 疾病特异细胞状态(肿瘤、激活免疫)可能不在参考内(Huatuo 文档明示) |
| 非汉族人群 | 未知(无公开验证) | 人群构成单一,建议先小样本校准 |
| 胎儿/发育类器官 | 中 | 有胎儿覆盖但阶段粒度有限(9 个阶段标签);类器官状态可能无对应簇 |
| 脑区研究 | 高 | 小脑之外脑区未覆盖 |
§7.4 伦理
样本由浙江大学医学院系统合作医院在机构伦理批准下采集,供体为知情同意的汉族捐赠者;论文声明作者无竞争利益(competing interests)。发布数据为细胞级表达矩阵与匿名供体元数据,不含直接身份信息。数据再发布须遵守 CC BY 4.0 署名要求与 HCA 数据发布政策。
§7.5 公平性
HCL 的人群构成单一(汉族供体),性别、年龄的完整分布论文未披露。这带来两类公平性风险:其一,注释模型在其他族裔人群上的漂移未被量化,临床转化前必须补齐;其二,若下游任务涉及性别特异或年龄特异细胞状态(如生殖、衰老),图谱内相应分层的样本量可能不足以支撑训练。
| 公平性维度 | 现状 | 风险等级 | 缓解 |
|---|---|---|---|
| 族裔 | 汉族供体为主 | 高(外推未验证) | 目标人群校准后再部署 |
| 性别 | 论文未披露分布 | 中 | 分层评估;性别特异任务谨慎 |
| 年龄/发育 | 胎儿+成人双阶段但粒度有限(9 阶段标签) | 中 | 按阶段分层报告 |
| 地域 | 浙江省内医院网络 | 低中 | 跨中心数据复测 |
缓解:分层评估、目标人群校准、必要时与人群多样性图谱联合使用。
§7.6 数据漂移
数据集本身为静态发布(GEO 2024-08-26 后无内容更新),"漂移"主要发生在应用侧:
| 漂移源 | 方向 | 影响 | 缓解 |
|---|---|---|---|
| 平台迁移 | microwell-seq → 10X/多组学成为主流 | 参考与目标数据的深度/覆盖差距扩大 | 整合层建模(scVI/scArches) |
| 注释标准演进 | 细胞本体与社区共识持续更新 | 簇名/层级与最新文献脱节 | 版本化映射表并记录聚类口径 |
| 元数据修订 | HCA/GEO 元数据偶发更新(2024-08/2025-02) | 下游管线需重跑校验 | 固定快照 + ingestion 清单 |
| 样本可得性 | figshare/GEO 双渠道 | 渠道间文件组织差异 | 主渠道 + 镜像校验(坑点 8) |
缓解:把平台与注释版本写进模型卡;重大场景用近期同平台数据微调映射头而非直接沿用。
§7.7 DAIMS 数据质量评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式支持 | ⚠️ | DGE 为基因×细胞宽矩阵(70 万+列),需稀疏/分块处理 |
| 2 | 唯一标识 | ✅ | 细胞条码含组织前缀,可唯一溯源到样本 |
| 3 | 特殊字符处理 | ✅ | 基因符号与条码命名规范,无空格/全角混入 |
| 4 | 重复行检查 | ✅ | 基因行按符号组织;读入时 var_names_make_unique() 兜底 |
| 5 | 缺失值编码 | ⚠️ | 无显式缺失码,0 混合"真低表达"与"漏检"两种机制 |
| 6 | 标签标识 | ✅ | 簇/亚类/大类三层标签体系完整 |
| 7 | 罕见类分组 | ⚠️ | 长尾簇细胞量小;Huatuo 文档明示罕见亚型欠采样 |
| 8 | 偏倚评估 | ✅ | 论文含深度饱和、供体批次混合、平台对照分析 |
| 9 | 数据字典 | ⚠️ | 无官方完整 data dictionary;字段含义散见论文方法与门户 |
| 10 | 信息性缺失解释 | ❌ | dropout 机制无官方说明文档 |
| 11 | 设备记录 | ✅ | HiSeq X Ten(GEO 平台记录)与 Microwell-seq 方法详述 |
| 12 | 共线性检查 | ❌ | 官方未提供基因共线性/冗余分析 |
| 13 | 编码映射 | ⚠️ | 簇→亚类→大类映射文件存在(HCL_Cell_Cluster_Annatation.txt),但层级口径需自行统一 |
| 14 | 时间戳处理 | ✅ | 快照型数据无时序字段,不存在时间戳语义问题 |
| 15 | 划分建议 | ⚠️ | 官方无 train/test 划分;切分方案由用户自建(§5) |
| 16 | 泄漏讨论 | ❌ | 官方文档未讨论参考标签的结构性泄漏 |
| 17 | 标签分布 | ⚠️ | 以 t-SNE 呈现构成,无逐簇完整细胞数表 |
| 18 | 测量偏倚 | ✅ | 深度饱和分析(约 8,000 细胞平台期)与 bulk 相关性(>0.8)已量化 |
| 19 | 外部验证建议 | ⚠️ | 论文做平台/跨物种对照,但未给出标准化外部验证协议 |
| 20 | 版本记录 | ✅ | GEO 提交/公开/更新时间链完整(2019-07-16/2020-02-10/2024-08-26) |
| 21 | 预处理脚本 | ✅ | ggjlab/HCL 图形代码与 scHCL R 包开源 |
| 22 | 合规要求 | ✅ | CC BY 4.0 明确,署名即可自由使用 |
| 23 | 多模态对齐 | ❌ | 纯转录组单模态,无影像/临床对齐资产 |
| 24 | 去标识化 | ✅ | 供体匿名化,无直接身份信息 |
DAIMS 评分:15.5 / 24(✅ 计 1 分、⚠️ 计 0.5 分、❌ 计 0 分:11 个 ✅ + 9 个 ⚠️)
评分解读:这是一个"底子干净、文档偏薄"的图谱型数据集——数据本身结构规范(标识、命名、许可、版本链全绿),硬伤集中在三处:缺失机制不透明(dropout)、无官方划分与泄漏讨论、缺失官方数据字典。对于以"参考注释"为核心任务的使用者,这些短板有成熟的社区工作法可绕过;对于直接把 DGE 当标准监督数据集用的新手,三处短板都是真实的翻车点(见 §6.5 坑点 3/4/8)。
对你意味着什么:(1) 开工第一周先做三件事——按 §6.3 建稀疏 h5ad、按供体分组定划分、把簇层级统一到单一粒度并版本化映射表;(2) 不要向数据集索取它没有的东西——需要数据字典就自己从 GEO 元数据生成并入库,需要划分就按 §5 协议自建;(3) 所有对外报告的细胞数一律标"702,968(论文口径)",屏蔽多口径干扰;(4) 跨平台/跨人群应用前,把 §7.8 的外部验证跑完再下结论。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| bulk RNA-seq(肾/肺) | 论文内部对照 | 表达一致性 | 平均基因表达相关 >0.8 | — | microwell-seq 与 bulk 高度一致(Extended Data 图 1c) |
| 10X Tabula Muris 肺数据 | 外部公开数据 | 聚类对照 | 定性(簇数与类型回收) | — | 同类型数下 microwell-seq 检出更多细胞类型簇(Extended Data 图 1a) |
| 小鼠 MCA 全图 | 同团队 | 跨物种比较 | 140 个正交 TF 调控子/15 模块 | — | 主要细胞类型表达模式跨物种保守(Nature 论文图 4) |
| 干细胞分化/类器官样本(肝芽、脑类器官、iPS 胚状体、CD34+ 脐血等) | 论文应用案例 | 参考注释 | 定性判定 | — | scHCL 可稳健定义培养细胞谱系(论文图 3 相关案例) |
说明:HCL 时代尚无统一的单细胞注释公开基准榜,上表收录的是论文内自带且有图源支撑的对照实验,未收录未经本页面核实的第三方基准数字。
§8 基准性能与生态
§8.1 基准生态现状
HCL 与多数图谱型数据集一样,不存在官方排行榜:单细胞注释任务的"榜"分散在各工具论文与第三方评测(如 scIB 类整合基准)中,且切分方式各异,数字不可直接比较。本页面不做跨论文数字对比表,仅列出基于 HCL 可复现的评估协议与主要工具(§8.2-§8.3);引用任何第三方性能数字前,请核对其切分是否为供体分组(见 §5 泄漏讨论)。
"无统一榜单"的三个结构性原因值得展开:其一,任务定义不唯一——是闭集分类(102 簇/843 亚类/44 大类三种粒度可选)、开放集发现,还是跨平台映射,各评测口径不一;其二,切分协议不统一——细胞级随机切分(含泄漏)、供体分组、组织留出与外部数据测试的结果不可比;其三,参考图谱会被持续再聚类与再注释,静态榜单很快失效。相比之下,工具机制层面的对比是稳定的:
| 工具 | 机制 | 标签粒度 | 跨平台处理 | 适用边界 |
|---|---|---|---|---|
| scHCL(官方) | 与 HCL 簇的皮尔逊相关映射 | 簇级 + top-n 候选 | 无(同平台最优) | microwell-seq 或相近深度数据 |
| Huatuo | 357 簇 XGBoost 模型集(需 MAGIC imputation) | 簇/44 大类 | 部分鲁棒 | 批量注释、成人组织 |
| Seurat anchors | 锚点对齐迁移 | 自定义 | 通过整合层 | 跨平台标准做法之一 |
| scVI/scANVI | 深度生成 + 半监督 | 自定义 | 深度/批次建模 | 低深度与跨平台首选 |
§8.2 SOTA 总结与选型建议
以"HCL 作参考的细胞注释"为任务轴:同平台小规模查询用官方 scHCL 相关性映射最省事;批量、生产化注释选 Huatuo 的 XGBoost 模型集;跨平台(droplet 目标域)优先 scVI/scArches 路线,把平台差异建模掉而不是硬映射;需要细粒度新类型发现时回到 Scanpy 无监督聚类再与 HCL 簇对齐。总体而言,"深度生成模型 + 冻结参考"是当前社区公认最稳的跨平台范式,纯相关性映射仅在查询数据与 HCL 平台/组织构成接近时可信。
§8.3 评测协议建议
- 划分:以"供体"(或"供体×组织")为组做 GroupKFold,5 折;胎儿与成人分别报告。
- 任务:以簇标签为目标的闭集分类 + 留一组织的外推任务双轨。
- 指标:macro-F1(主)、weighted-F1、balanced accuracy、尾部簇(支持度 <500)宏 F1;附混淆矩阵热图。
- 外推测试:至少一个 droplet 平台公开人类数据集(如 CELLxGENE 收录的独立研究)做零样本迁移,报告内外差值。
- 显著性:多工具对比需多种子均值±标准差;不做单种子排名。
§8.4 相关数据集
| 数据集 | 物种 | 与 HCL 的关系 | 许可 |
|---|---|---|---|
| MCA(Mouse Cell Atlas) | 小鼠 | 同团队同平台的小鼠版,跨物种比较的配套数据(MCA_DGE_Data figshare 5435866) | 开放获取 |
| Tabula Sapiens | 人 | 后续多器官人类图谱(液滴平台),跨平台对照素材 | 开放获取 |
| HCA Data Portal | 人 | HCL 项目以标准元数据集成于 HCA Explorer(项目 1fac187b) | CC BY 4.0 |
| CZ CELLxGENE | 人 | HCL 的在线可视化与分发渠道之一 | 随托管政策 |
| 肾脏/肝脏等器官专项图谱 | 人 | 疾病对照设计的配对参考(HCL 做正常臂) | 各自许可 |
§8.5 关键论文 Top 8
- Han X, Zhou Z, Fei L, et al. Construction of a human cell landscape at single-cell level. Nature 581:303-309 (2020). DOI 10.1038/s41586-020-2157-4 —— HCL 本体论文:图谱构建、scHCL 流程、人鼠比较。
- Han X, Wang R, Zhou Y, et al. Mapping the Mouse Cell Atlas by Microwell-Seq. Cell 172:1091-1107 (2018). DOI 10.1016/j.cell.2018.02.001 —— 小鼠细胞图谱 MCA:Microwell-seq 平台方法与 HCL 的前作。
- Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biology 19:15 (2018). DOI 10.1186/s13059-017-1382-0 —— HCL 分析管线的开源底座之一。
- Wolf FA, Hamey FK, Plass M, et al. PAGA: graph abstraction reconciles clustering with trajectory inference. Genome Biology 20:59 (2019). DOI 10.1186/s13059-019-1663-x —— 论文用于胎儿-成人轨迹分析的图抽象方法。
- Aibar S, González-Blas CB, Moerman T, et al. SCENIC: single-cell regulatory network inference and clustering. Nature Methods 14:1083-1086 (2017). DOI 10.1038/nmeth.4463 —— 伪细胞层面的 TF 调控网络推断方法。
- Korsunsky I, Millard N, Fan J, et al. Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Biotechnology 37:1298-1306 (2019). DOI 10.1038/s41587-019-0336-z —— 跨供体/跨平台整合的常用工具(坑点 7 进阶方案)。
- Lopez R, Regier J, Cole MB, et al. Deep generative modeling for single-cell transcriptomics. Nature Methods 15:1053-1058 (2018). DOI 10.1038/s41592-018-0229-2 —— scVI 深度生成模型:低深度数据的深度校正与整合框架。
- Traag VA, Waltman L, van Eck NJ. From Louvain to Leiden: guaranteeing well-connected communities. Scientific Reports 9:5233 (2019). DOI 10.1038/s41598-019-41695-z —— 聚类算法(Leiden)的方法学保障。
§8.6 社区活跃度
论文引用超过 1,100 次(Google Scholar,截至 2026-09,年度引用自 2020 年起持续为两位数到两百+区间,2023-2025 仍保持高位),属于单细胞图谱论文中的常青引用体。官方 GitHub 生态活跃度中等:scHCL 仓库 47 stars/10 forks(截至 2026-09 检索),提交历史 11 次;ggjlab 组织下的 Huatuo 为后续维护的主要注释资产。数据托管层面,HCA 项目页 2025-02-14 仍在更新,CZ CELLxGENE 与 UCSC Cell Browser 均保持集成。
| 活跃度指标 | 现状(截至 2026-09) | 解读 |
|---|---|---|
| 论文年度引用 | 2020:79 / 2021:192 / 2022:224 / 2023:216 / 2024:166 / 2025:189 / 2026(部分):77 | 引用持续处于高位,未随时间衰减 |
| scHCL 仓库 | 47 stars / 10 forks / 11 commits | 维护性工具,不追求活跃迭代 |
| Huatuo 模型集 | 300+ XGBoost 模型,357 簇/44 大类 | 官方注释生态的实际主力 |
| 数据渠道 | GEO(2024-08 更新)、HCA(2025-02 更新)、figshare/CNGB 镜像 | 多渠道冗余,可及性好 |
总体判断:数据集本体稳定维护、社区工具以"够用"为主,重大功能迭代已转向 Huatuo 等衍生项目。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/热度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| ggjlab/HCL | GitHub 仓库 | https://github.com/ggjlab/HCL/ | 见仓库页 | 论文图表复现代码 |
| ggjlab/scHCL | GitHub 仓库(R 包) | https://github.com/ggjlab/scHCL/ | 47 stars / 10 forks | 官方注释工具,含示例数据 |
| ggjlab/huatuo | GitHub 仓库(模型集) | https://github.com/ggjlab/huatuo | 见仓库页 | 357 簇/44 大类 XGBoost 注释模型 |
| HCA Data Explorer 项目页 | 数据门户 | https://explore.data.humancellatlas.org/projects/1fac187b-1c3f-41c4-b6b6-6a9a8c0489d1 | — | 标准元数据最全的官方镜像 |
| CZ CELLxGENE | 在线可视化 | cellxgene.cziscience.com | — | 免下载交互浏览 |
| UCSC Cell Browser | 在线可视化 | cells.ucsc.edu | — | 快速查看 t-SNE 与基因表达 |
| CNGB HCL 门户 | 数据门户 | https://db.cngb.org/HCL/ | — | 国内快速下载镜像 |
§9 相关资源与引用
§9.1 官方资源列表
数据获取
- GEO 系列页(处理后 DGE 与样本表):https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE134355
- figshare DGE 镜像:https://figshare.com/articles/HCL_DGE_Data/7235471
- CNGB 国家基因库镜像(CNP0000325):https://db.cngb.org/HCL/
- INSDC 原始数据:SRP214806 / BioProject PRJNA554845
浏览与在线分析
- 浙大官方门户:http://bis.zju.edu.cn/HCL/
- HCA Data Explorer 项目页:https://explore.data.humancellatlas.org/projects/1fac187b-1c3f-41c4-b6b6-6a9a8c0489d1
- CZ CELLxGENE 与 UCSC Cell Browser(站内检索 HCL)
代码与工具
- 论文图形代码:https://github.com/ggjlab/HCL/
- scHCL 注释 R 包:https://github.com/ggjlab/scHCL/
- Huatuo 注释模型集:https://github.com/ggjlab/huatuo
论文与文档
- 原始论文:https://www.nature.com/articles/s41586-020-2157-4 (免费获取,Unpaywall 收录)
§9.2 BibTeX 引用块
@article{Han2020HCL,
author = {Han, Xiaoping and Zhou, Ziming and Fei, Lijiang and Sun, Huiyu and Wang, Renying and Chen, Yao and Chen, Haide and Wang, Jingjing and Tang, Huanna and Ge, Wenhao and Zhou, Yincong and Ye, Fang and Jiang, Mengmeng and Wu, Junqing and Xiao, Yanyu and Jia, Xiaoning and Zhang, Tingyue and Ma, Xiaojie and Zhang, Qi and Bai, Xueli and Lai, Shujing and Yu, Chengxuan and Zhu, Lijun and Lin, Rui and Gao, Yuchi and Wang, Min and Wu, Yiqing and Zhang, Jianming and Zhan, Renya and Zhu, Saiyong and Hu, Hailan and Wang, Changchun and Chen, Ming and Huang, He and Liang, Tingbo and Chen, Jianghua and Wang, Weilin and Zhang, Dan and Guo, Guoji},
title = {Construction of a human cell landscape at single-cell level},
journal = {Nature},
volume = {581},
number = {7808},
pages = {303--309},
year = {2020},
doi = {10.1038/s41586-020-2157-4},
pmid = {32214235}
}
@article{Han2018MCA,
author = {Han, Xiaoping and Wang, Renying and Zhou, Yiming and Fei, Lijiang and Sun, Huiyu and Lai, Shujing and Saadatpour, Alireza and Zhou, Ziming and Chen, Haide and Ye, Fang and Huang, Da and Xu, Yangyuan and Huang, Wansheng and Jiang, Mengmeng and Jiang, Xiaoyuan and Mao, Jiayu and Chen, Yao and Lu, Chen and Xie, Jin and Fang, Qi and Wang, Yibin and Yue, Ruiqi and Gao, Tianchi and Li, Qianfan and Shah, Shardul N. and Li, Xun and Zhou, Huanming and Zhu, Yuan and Cui, Yiqing and Shi, Leming and Guo, Guoji},
title = {Mapping the Mouse Cell Atlas by Microwell-Seq},
journal = {Cell},
volume = {172},
number = {5},
pages = {1091--1107.e17},
year = {2018},
doi = {10.1016/j.cell.2018.02.001}
}
@article{Wolf2018Scanpy,
author = {Wolf, F. Alexander and Angerer, Philipp and Theis, Fabian J.},
title = {SCANPY: large-scale single-cell gene expression data analysis},
journal = {Genome Biology},
volume = {19},
pages = {15},
year = {2018},
doi = {10.1186/s13059-017-1382-0}
}
@article{Korsunsky2019Harmony,
author = {Korsunsky, Ilya and Millard, Nghia and Fan, Jean and Slowikowski, Kamil and Zhang, Fangcheng and Wei, Kevin and Baglaenko, Yuri and Brenner, Michael and Loh, Po-Ru and Raychaudhuri, Soumya},
title = {Fast, sensitive and accurate integration of single-cell data with Harmony},
journal = {Nature Biotechnology},
volume = {37},
pages = {1298--1306},
year = {2019},
doi = {10.1038/s41587-019-0336-z}
}
@article{Lopez2018scVI,
author = {Lopez, Romain and Regier, Jeffrey and Cole, Michael B. and Jordan, Michael I. and Yosef, Nir},
title = {Deep generative modeling for single-cell transcriptomics},
journal = {Nature Methods},
volume = {15},
pages = {1053--1058},
year = {2018},
doi = {10.1038/s41592-018-0229-2}
}
@article{Aibar2017SCENIC,
author = {Aibar, Sara and Gonz{\'a}lez-Blas, Carmen Bravo and Moerman, Thomas and Huynh-Thu, V{\^a}n Anh and Imrichova, Hana and Hulselmans, Gert and Rambow, Florian and Marine, Jean-Christophe and Huis, Pieter and Aibar, Ignacio and others},
title = {SCENIC: single-cell regulatory network inference and clustering},
journal = {Nature Methods},
volume = {14},
pages = {1083--1086},
year = {2017},
doi = {10.1038/nmeth.4463}
}
§9.3 引用指南
引用分三层:使用数据引 Han et al. 2020(Nature);使用平台方法细节引 Han et al. 2018(Cell,MCA);使用注释工具则引用对应工具仓库/文档(scHCL、Huatuo)。CC BY 4.0 要求再分发时保留许可声明与来源署名;给数据快照建立版本锚点时,建议同时记录 GEO 系列号与下载日期(见 §6.10)。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| fast-model(CodeBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§10 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-13 | 5 组检索:官方主页与 HCA 项目页、GEO 与 figshare 获取细节、论文引用量、scHCL/Huatuo 生态、局限与坑点素材 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 Nature 论文页、GEO GSE134355、HCA Data Explorer 项目页、figshare、GitHub(ggjlab 系列)等公开来源整理结构化信息;(2) 生成 §6 的 Python/Shell 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Han et al. (2020), Nature 581:303-309 — HCL 原始论文(DOI: 10.1038/s41586-020-2157-4,PMID: 32214235)
- NCBI GEO 系列页 GSE134355(提交/公开/更新时间、GSE134355_RAW.tar 884.2 MB、60 种组织设计、141 个 GSM 条目)
- HCA Data Explorer 项目页 1fac187b-1c3f-41c4-b6b6-6a9a8c0489d1(703.0k 细胞估算、58 供体、37 解剖实体、9 发育阶段、16/20 疾病状态、CC BY 4.0 政策)
- figshare HCL_DGE_Data(7235471)与 MCA_DGE_Data(5435866)页面(论文 Data availability 指定)
- CNGB Nucleotide Sequence Archive CNP0000325(https://db.cngb.org/)
- 浙大官方门户 http://bis.zju.edu.cn/HCL/ 与 cellatlas 页面(含口径并存的直接观察)
- GitHub ggjlab/scHCL README(47 stars、hcl_lung 示例 2,884×80、函数签名与返回结构)
- GitHub ggjlab/HCL(论文图形代码仓库)
- Huatuo 项目文档(DeepWiki 镜像 ggjlab/huatuo:357 簇/44 大类、300+ XGBoost 模型、覆盖局限说明)
- Han et al. (2018), Cell 172:1091-1107 — MCA 小鼠图谱论文(平台前作)
- AMiner 论文解读页(方法工具链:Seurat/Scanpy、PAGA、CellPhoneDB、velocyto、SCENIC;发现要点)
- Google Scholar 引用快照(Cited by 1,149,截至 2026-09 检索;含 2020-2026 年度分布)
- Unpaywall 记录(10.1038/s41586-020-2157-4 开放获取状态)
- Nature 论文 Extended Data 图 1/2 说明(深度饱和、供体批次效应、pseudo-cell n=30,053、TF 矩阵 1,521)
- Scanpy/SCENIC/Harmony/scVI 等方法学论文(DOI 见 §8.5 与 §9.2)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11 领域映射、SNOMED CT 结构码、人群画像) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(规模数字、渠道矩阵、设备与溯源链) | 千方病案医学编辑部 | 与 GEO、HCA 项目页及论文 Data availability 交叉比对 | ✅ 已验证 |
| §4 数据结构(DGE 矩阵字典、标签体系、缺失机制) | 千方病案医学编辑部 | 与论文方法部分及官方门户文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 scHCL/Scanpy 官方文档比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 生态与引用数表述 | 千方病案医学编辑部 | 与 Google Scholar 快照及 GitHub 页面交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- tabula-sapiens — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- single-cell-portal — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- kpmp — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- metabolights — 共享标签:基因组学与多组学 / 转录组
- metabolomics-workbench — 共享标签:基因组学与多组学 / 转录组
- immport — 共享标签:基因组学与多组学 / 转录组
- geo — 共享标签:基因组学与多组学 / 转录组
- fantom5 — 共享标签:基因组学与多组学 / 转录组
- tcga — 共享标签:基因组学与多组学 / 转录组
- cellxgene — 共享标签:基因组学与多组学 / 转录组
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

