信息速览
KPMP — 肾脏多组学精准医学图谱 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Kidney Precision Medicine Project (KPMP) Data Atlas |
| 英文全称 | Kidney Precision Medicine Project |
| 别名/简称 | KPMP、KPMP Kidney Tissue Atlas、KPMP Atlas Data Repository |
| 疾病分类 | 肾脏疾病谱(ICD-11:GB61 慢性肾脏病 / GB60 急性肾损伤 / GB6Z 肾衰竭未特指 / 5A11 2 型糖尿病肾脏受累组合编码;另含 Healthy Reference 健康参考) |
| SNOMED CT | 433144002 Chronic kidney disease / 298036008 Acute kidney failure / 127013003 Diabetic renal disease / 73211009 Diabetes mellitus / 64033007 Kidney structure(详见 §2.2) |
| 数据模态 | 肾组织 WSI、单细胞/单核 RNA-seq、10x Multiome、空间转录组、CODEX、3D 组织成像、ATAC-seq/CUT&RUN、WGS、蛋白质组学 |
| AI 任务类型 | 细胞类型注释、肾组织区室分割、空间邻域建模、疾病状态分类、跨组学整合、生物标志物与通路发现、染色归一化 |
| 样本总数 | 612 名参与者 / 22,824 个数据文件 / WSI 6,625 张 / 9 类 assay |
| 数据大小 | 开放镜像 12,387 文件(数 TB 级,WSI 主导);Zenodo 参考图谱包 2.9 GB;受控原始测序另计 |
| 数据格式 | h5ad、SVS/TIFF(WSI 与分割掩膜)、FASTQ/BAM(受控原始测序)、CSV(分箱化元数据) |
| 许可证 | CC BY 4.0(公开数据);受控数据经 DUA 授权 |
| 访问级别 | 开放(WSI+processed 组学)+ 申请审核(raw sequencing 与临床病理数据,签署 DUA) |
| DUO 标签 | HMB, NPUNCU, PUB(依据 DUA 条款整理,以 KPMP 官方协议为准) |
| 语言 | 英文 |
| 首发日期 | 2017 年秋(NIDDK 项目启动) |
| 最后更新 | 按季度滚动发布(Recently Released - QX 2026);开放镜像 2026-05-08 更新 |
| 发布机构 | KPMP Consortium(NIH/NIDDK 资助,19 项 U 系基金;含 Central Hub U24 与 12 个组织解析位点) |
| 官方主页 | https://www.kpmp.org/ |
| 下载地址 | https://atlas.kpmp.org/repository/ |
| DOI | 10.1126/sciadv.abn4965(Sci Adv 2022)/ 10.1038/s41586-023-05769-3(Nature 2023)/ 10.48698/z30t-0a62(KPMP 数据 DOI) |
| 引用次数 | 164+(Google Scholar,Sci Adv 2022 原始论文,截至 2026-09);Nature 2023 图谱论文 326+(Scopus,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— FAIR 设计、Explorer 交互式验证、开源分析脚本与 Docker;扣分项:无官方任务划分、公开元数据分箱化、跨库注释粒度不一致 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、肾脏病理与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(参与者-样本-assay 三级层级、分箱化元数据)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-18
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NIH、NIDDK、KPMP 联盟及其成员机构无任何商业利益关联。本页面不销售 KPMP 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 NIH、NIDDK 或 KPMP 的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。KPMP 公开数据采用 CC BY 4.0 许可;原始测序与临床病理数据属受控访问,需与 KPMP 签署数据使用协议(DUA)并遵守其发表审批流程。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? KPMP(Kidney Precision Medicine Project,肾脏精准医学项目)是美国 NIH 下属 NIDDK 资助的十年期多中心联盟,目标是像绘制"细胞级地图"一样,把人类健康肾脏和患病肾脏(急性肾损伤、慢性肾脏病、糖尿病肾脏受累)逐细胞、逐空间位点地解析清楚。它把每份肾活检组织同时做成显微全切片图像(WSI)与多种分子图谱——单细胞测序、空间转录组、CODEX 蛋白成像等,全部汇总在一个公共数据门户上。
为什么重要? 肾脏病的传统诊断依赖病理医师在显微镜下"看形态",同样的切片、同样的诊断,分子层面的机制却可能完全不同。KPMP 用 Science Advances 2022(56 名成人、80,289 个单细胞)和 Nature 2023(超过 40 万细胞/核、51 种主细胞类型、28 种细胞状态)两篇参考图谱给出了肾脏的首个多组学细胞地图,并配套开源了分析代码、分割模型和交互式 Explorer,成为后续所有肾脏 AI 研究绕不开的"地基数据"。
我能用它做什么? 五类高频用法:给单细胞/单核数据做细胞类型注释(51 类参考标签直接可用);训练或验证肾组织分割模型(官方提供 7 类结构掩膜);做疾病状态分类(健康参考 vs AKI vs CKD vs DM-R);跨组学整合(同一参与者同时有空间、染色质与转录组数据);以及在受控环境里挖掘 WGS 与临床病理数据发现生物标志物。
§1.1 摘要
KPMP 于 2016 年由 NIDDK workshop 确定框架、2017 年秋启动,采用"招募队列 + 组织解析位点 + 中央枢纽 + 生物样本库"的多中心架构,招募 AKI、CKD、DM-R 与 Healthy Reference 四类参与者(截至 2026-09 在册 612 名),按统一协议采集肾活检与供体组织:一条核心做组织学(WSI),其余核心做分子分析,并同步收集基线与纵向尿液、血浆、血清、DNA 与粪便样本。数据经 Honest Broker 去标识后分两层发布——开放层(CC BY 4.0:WSI、processed 组学矩阵、分箱化临床元数据,截至 2026-09 共 22,824 个文件)与受控层(raw sequencing、临床病理明细,签署 DUA 后 12-36 小时响应、1 个月内交付)。核心产出为 2022 年 Science Advances 参考细胞图谱与 2023 年 Nature 健康与损伤细胞状态/微环境(niche)图谱,全部分析脚本开源于 GitHub(github.com/KPMP),并配套 Explorer 交互式验证平台。
核心数字速览(截至 2026-09,详见 §3):
- 人:612 名在册参与者(AKI / CKD / DM-R / Healthy Reference 四招募组)。
- 文件:22,824 个(开放 + 受控),其中 WSI 6,625 张。
- 图谱:Sci Adv 2022 参考图谱 56 名成人 / 80,289 单细胞;Nature 2023 超过 40 万细胞/核、51 种主细胞类型、28 种细胞状态、约 120 万 3D neighborhoods。
- 访问:开放层 CC BY 4.0;受控层 DUA(12-36 小时响应);HPC Enclave 支持云端分析。
- 持续更新:季度滚动发布;2025-02 外部评估委员会建议项目延长 5 年。
§1.2 战略价值分析
维度一:肾脏 AI 的"参考坐标系"。 在 KPMP 之前,肾脏单细胞研究各自标注细胞类型,注释词汇互不兼容;KPMP 与 HuBMAP 联合采用 ASCT+B 表、Cell Ontology 与 Uberon 统一细胞与组织术语,其 51 种主细胞类型与 28 种细胞状态的参考图谱已成为肾脏领域事实上的注释基准——Satija 实验室 Azimuth 平台的 Human Kidney 参考即基于 KPMP Nature 2023 图谱构建。任何新的肾脏单细胞数据集,都可以映射到这套坐标系上做迁移标注与差异分析。
维度二:病理影像与分子图谱的"对齐样本"。 同一参与者、同一活检组织同时拥有 WSI 形态学数据与多组学分子数据,这使 KPMP 成为"影像-分子"多模态建模的稀缺训练场:可以做形态学预测分子状态(如从 WSI 预测区室基因表达)、用分子标签反哺影像标注、检验染色归一化与域偏移。官方开源的 7 类肾结构分割掩膜(IFTA、肾小管、肾小球等)进一步降低了病理影像模型的冷启动门槛。
维度三:受控数据治理的"范本工程"。 KPMP 的 Honest Broker 模式(中央枢纽保存可识别数据、生物样本库仅存去标识数据)、公开元数据全分箱化、受控数据 DUA 审批与发表委员会制度,为"基因组级敏感数据如何 AI-Ready"提供了一个可复用的治理模板——对国内团队设计医疗数据分级开放机制具有直接参考价值。
维度四:AI 治理与合规研究的"活教材"。 从 NIDDK RFA 设计、中央 IRB、DSMB 到 Honest Broker、元数据分箱与发表委员会,KPMP 公开了治理机制运作的几乎全部细节。做医疗 AI 合规、数据信托(data trust)或隐私增强技术治理研究时,它提供了少见的"全流程可引用"的一手案例。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 标注/分层 | 与 KPMP 的差异化 |
|---|---|---|---|---|
| KPMP | 612 参与者 / 22,824 文件 | WSI + 单细胞/空间/染色质/蛋白多组学 | 4 招募组 + Cell Ontology 注释 + 7 类分割掩膜 | 同人多组学对齐 + 受控治理范本 |
| NEPTUNE | 2,000+ 名肾小球疾病队列 | 活检组织 + 尿/血生物样本 + 分子数据 | 肾小球疾病分型(微小病变/FSGS/膜性肾病) | 纵向临床结局更强,无空间组学深度 |
| CureGN | 2,000+ 名肾小球疾病队列 | 活检 + 临床随访 | 疾病分型 + 纵向结局 | 长期结局队列,组学深度低于 KPMP |
| HuBMAP | 多器官健康组织图谱 | 单细胞 + 空间组学 + 3D 成像 | 健康供体为主 | 与 KPMP 共享 12 个核心变量,器官覆盖广但肾脏疾病谱窄 |
| GTEx | 838 名供体 / 17,000+ 组织样本 | Bulk 转录组/基因组 | 健康组织按器官/部位 | 无单细胞分辨率与影像 |
| CPTAC | 癌症蛋白基因组学(含肾癌队列) | 蛋白组+基因组+影像 | 病例-对照 | 癌症对照场景,无健康肾脏参考深度 |
§1.4 版本演进时间轴
| 时间 | 里程碑 |
|---|---|
| 2016 | NIDDK 举办肾脏精准医学 workshop 并发布 RFA,确定项目框架 |
| 2017 秋 | KPMP 项目正式启动,招募队列与协议落地 |
| 2022-06 | Science Advances 发表参考细胞图谱(56 名成人、80,289 单细胞、9 类 assay),配套数据 DOI 10.48698/z30t-0a62 |
| 2022 财年 | NIDDK 扩展招募与组织解析规模,新增 12 个组织解析位点(TIS) |
| 2023-07 | Nature 发表健康与损伤细胞状态/niche 图谱(超过 40 万细胞/核、51 种主细胞类型) |
| 2024-01 | Nature Communications 发表肾脏染色质景观图谱(multiome、WGBS、CUT&RUN),数据 DOI 10.48698/HHE6-YV15 |
| 2025-02 | 外部评估委员会建议项目延长 5 年;在册参与者约 500 名、计划新招募 500+ 名 |
| 2026 | Atlas 按季度滚动发布;开放镜像(Mount Sinai Data Ark)2026-05-08 更新至 12,387 文件 |
§1.5 典型 AI 应用场景
| # | 场景 | 输入 | 产出 | 关键注意 |
|---|---|---|---|---|
| 1 | 细胞类型自动注释 | 外部肾脏 sc/sn 数据 + KPMP 51 类参考 | 迁移标注结果 + 置信度 | Cell Ontology 词表对齐(坑点 2) |
| 2 | 肾组织多区室分割 | WSI + 官方 7 类掩膜 | 分割模型 + GFA 自动定量 | 多染色域偏移(坑点 5) |
| 3 | WSI 疾病状态分类 | 6,625 张 WSI + 招募组标签 | 弱监督分类 + 可解释热图 | Reference 仅 110 张,极端不均衡 |
| 4 | 形态-分子多模态建模 | WSI 与空间转录组配对 | 形态→分子状态映射 | 对齐粒度为组织块级(坑点 8) |
| 5 | 生物标志物与通路发现 | 受控层 WGS/染色质 + 临床表型 | 候选靶点与通路 | 需 DUA + 发表委员会审批(坑点 7) |
| 6 | 治理与合规研究 | 公开的治理文档与流程 | 数据信托/合规框架案例 | 治理细节以官方文档为准 |
§2 医学背景
§2.1 ICD-11 疾病分类锚定
KPMP 覆盖的疾病与状态在 ICD-11(MMS)中的锚定如下:
| 疾病/状态 | ICD-11 编码 | 说明 |
|---|---|---|
| 慢性肾脏病(CKD) | GB61(GB61.0-GB61.5 按分期细分) | KPMP 主要招募组之一,CKD 招募组对应 GB61 各期 |
| 急性肾损伤(AKI) | GB60(GB60.0-GB60.2 按分期细分) | KPMP AKI 招募组对应 GB60 各期 |
| 肾衰竭,未特指 | GB6Z | 部分回顾性/混合来源样本的兜底编码 |
| 2 型糖尿病肾脏受累(DM-R) | 5A11 + GB61 组合编码 | ICD-11 采用糖尿病主编码与肾病后编码组合;KPMP DM-R 招募组对应此类 |
| 健康参考(Healthy Reference) | 无疾病编码 | 供体/移植监测组织的"无疾病表现"参考组,不赋予 ICD 编码 |
注意:KPMP 的招募分组(AKI/CKD/DM-R/Reference)是研究协议分层,不完全等价于 ICD-11 临床编码;入库映射时建议保留 enrollment_category 原始值。
映射注意事项:
- ICD-11 的 GB60 定义与 KDIGO AKI 定义同源(肌酐/尿量三联标准),分期编码 GB60.0-GB60.2 直接对应 KDIGO 1-3 期,映射是"平行"的。
- CKD 分期 GB61.0-GB61.5 与 eGFR 分箱(公开层)可建立稳定映射;但分箱粒度粗于临床分期,细粒度分期需受控层。
- DM-R 不是独立 ICD-11 类目,必须以糖尿病主编码 + 肾病后编码的组合编码表达;数据库设计时避免把它压平成单一编码。
- 健康参考(Healthy Reference)是 KPMP 自定义的研究分层,跨库映射时建议映射到"正常/无疾病表现"的自定义类别而非强行挂编码。
§2.2 SNOMED CT 映射
| 中文标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 慢性肾脏病 | GB61 | 433144002 | Chronic kidney disease (disorder) |
| 急性肾损伤 | GB60 | 298036008 | Acute kidney failure (disorder) |
| 糖尿病肾病 | 5A11+GB61 | 127013003 | Diabetic renal disease (disorder) |
| 2 型糖尿病 | 5A11 | 73211009 | Diabetes mellitus (disorder) |
| 肾脏(解剖结构) | — | 64033007 | Kidney structure (body structure) |
映射使用说明:
- 以上 5 条覆盖 KPMP 四招募组 + 组织学对象的最小映射集;细分病理形态(如局灶节段性肾小球硬化、膜性肾病)在 KPMP 公开层没有逐例病理诊断字段,受控层做病理诊断映射时再按需扩展。
- SNOMED CT 码为国际版( disorder/body structure 语义标签如括注);跨库映射时以 code + 语义标签双字段入库,避免只用中文标签硬对齐。
- 细胞与组织层级的本体(Cell Ontology、Uberon)与 SNOMED 是两套体系:前者服务单细胞注释,后者服务临床诊断编码,二者在数据字典中并存、不要互转。
§2.3 疾病简介
慢性肾脏病(CKD):肾脏结构或功能异常持续超过 3 个月,按 eGFR 与白蛋白尿分期(KDIGO G1-G5/A1-A3)。GBD 估计全球 CKD 患者约 7 亿、患病率约 10%,是公共卫生负担增长最快的慢性病之一;终末期需透析或移植,早中期缺乏分子级的进展风险分层工具。
急性肾损伤(AKI):48 小时内血肌酐升高 ≥ 0.3 mg/dl、或升至基线 1.5 倍以上、或尿量 < 0.5 ml/kg/h 持续 6 小时以上(KDIGO 定义,与 ICD-11 GB60 定义一致)。住院与 ICU 患者中常见,重症监护环境下发生率可达 50% 以上;幸存者进入 CKD 的风险显著升高——AKI-to-CKD 转化机制是 KPMP 的核心科学问题之一。
糖尿病肾脏受累(DM-R):糖尿病是全球 ESRD 的首要病因,约 30-40% 的糖尿病患者出现肾脏损害;KPMP 设立 DM-R 招募组以在分子层面分离"糖尿病背景"与"肾脏损伤本身"的信号。
肾脏活检的现状:肾活检是肾脏病分子分型的金标准入口,但临床开展率低;经皮穿刺活检存在出血风险(KPMP 知情材料给出的基线:总体出血并发症约 12.5%,肉眼血尿约 1/25,血肿约 1/10,需输血 < 1/50,约 1/140 需干预止血,感染 < 1/200,死亡约 1/2500)。这也是 KPMP 坚持"一次活检、多模态榨干"设计的原因。
三类疾病的对比速览:
| 维度 | CKD | AKI | DM-R |
|---|---|---|---|
| 起病 | 隐匿、渐进 | 急骤(小时-天) | 隐匿(糖尿病背景多年) |
| 分期体系 | eGFR 五期(GB61.0-61.5) | KDIGO 三期(GB60.0-60.2) | 沿用 CKD 分期 + 糖尿病组合编码 |
| 核心病理 | 纤维化/肾单位丢失 | 小管损伤/炎症/微循环障碍 | 系膜扩张、基底膜增厚、间质纤维化 |
| KPMP 招募焦点 | 进展风险分层 | AKI-to-CKD 转化机制 | 分离糖尿病背景与肾脏损伤信号 |
| 公开层标签粒度 | eGFR 分箱 | KDIGO Stage | 病程分箱 + A1c 分箱 |
临床价值定位:KPMP 不直接产出可部署的诊疗产品,而是为"分子分型 → 靶点 → 试验分层"提供基础设施:其细胞状态参考已被用于重新解释肾活检的分子异质性,为 CKD 进展分层、AKI 转归预测与糖尿病肾病亚型发现提供候选标志物池。对 AI 团队而言,它的价值在于把"病理形态-细胞状态-分子通路-临床分组"四层信息在同一个队列里打通。
§2.4 临床任务定义
KPMP 数据支持的临床 AI 任务按"筛查-诊断-分级-预后"框架定义如下:
- 筛查/分诊(弱):无人群筛查用途;受控层的纵向尿检/血检流支持 AKI 风险预警类探索。
- 诊断:WSI 层面区分健康参考、AKI、CKD、DM-R 四状态;单细胞层面做细胞类型注释(Cell Ontology 词表);空间层面识别损伤 niche(如近端小管损伤/应激状态)。
- 分级:CKD 按 eGFR 分箱分期、AKI 按 KDIGO 分期;病理层面自动定量球性硬化/IFTA/间质纤维化负荷。
- 预后(探索):结合纵向随访数据做进展标志物发现;公开层因元数据分箱化,预后建模主要在受控层开展。
| 任务层 | 输入数据 | 标签来源 | 公开层可行性 |
|---|---|---|---|
| 诊断(四状态分类) | WSI / 组学矩阵 | enrollment_category | ✅ 可行(类不均衡需处理) |
| 诊断(细胞注释) | sc/sn h5ad | author_cell_type + ontology id | ✅ 可行(参考级标签) |
| 分级(病理定量) | WSI + 分割掩膜 | 7 类结构掩膜 | ✅ 可行(掩膜为参考级) |
| 分级(eGFR/KDIGO) | 元数据 | 分箱字段 | ⚠️ 仅分箱粒度 |
| 预后(进展/转归) | 纵向随访(受控层) | 临床结局 | ❌ 需 DUA 受控申请 |
§2.5 患者人群特征
| 招募组 | WSI 文件数 | 典型样本来源 | 协议类型 |
|---|---|---|---|
| Healthy Reference | 110 | 活体供体、移植预灌注活检、肿瘤肾切除远端正常组织 | HRT Living Donor、HRT Percutaneous Nephrolithotomy 等 |
| CKD | 4,905 | 经皮穿刺活检、肿瘤肾切除 | KPMP Main、Pilot 1、Other |
| AKI | 998 | 活检(自限性/透析依赖 AKI 幸存者) | KPMP Main |
| DM-R | 612 | 糖尿病肾脏受累活检 | KPMP Main |
| 合计 | 6,625 | Transplant Pre-perfusion Biopsy、Intra-operative Biopsy、Percutaneous Needle Biopsy、Tumor Nephrectomy、Deceased Donor Nephrectomy 等 | 六类研究协议 |
人群画像:截至 2026-09 在册参与者 612 名,以美国多中心招募为主;eGFR 采用 race-free CKD-EPI 公式计算并分箱发布;补充组织来自 DiaComp、各组织解析位点与密歇根肿瘤肾切除队列。更细粒度的人口学构成(年龄/性别/种族)在公开层仅以分箱形式提供。
使用人群表时的三点提示:
- 表中数字是 WSI 文件数(非参与者数):一个参与者可贡献多张不同染色的切片,换算不成立。
- Healthy Reference 仅 110 张 WSI(约 2%),任何四分类任务都必须显式处理类不均衡。
- 样本类型与协议类型的组合决定了域偏移结构——建模前先做 study_protocol × sample_type 交叉计数。
§2.6 金标准/参考标准
| 维度 | 内容 | 标注者/来源 | 性质 |
|---|---|---|---|
| 肾结构分割掩膜 | 7 类:IFTA、管周毛细血管、动脉/小动脉、肾小管、球性硬化肾小球、非球性硬化肾小球、皮质 | 深度学习模型(Ginely et al. 2023)预分割 + 病理医师复核;边界定义见 Protocols.io Renal Multicompartment Segmentation | 参考/弱标签 |
| 细胞类型注释 | author_cell_type + cell_type_ontology_term_id(Cell Ontology) | KPMP/HuBMAP 联合 ASCT+B 框架下的专家审定 | 参考图谱级 |
| 病理 adjudication | 参考组织的"无结构病变"判定 | KTACC 肾脏病理核心 | 专家裁定 |
| 疾病分组 | AKI/CKD/DM-R/Reference 招募组 | 协议入组标准(非病理再判定) | 协议标签 |
金标准使用要点:
- 分割掩膜是"模型预分割 + 人工复核"产物,用于训练弱监督分割器是安全的,作为绝对真值评估更精细的模型时会封顶——建议自留 10% 做双人独立复核。
- 细胞注释的"author_cell_type"是专家审定值,"cell_type_ontology_term_id"是跨库映射键,两者粒度可能不同(作者标签更细),优先用后者做一致性分析。
- Reference 组的 adjudication 只声明"无结构病变",不排除分子层面的应激/缺血印记(坑点 6)。
§3 数据集规格
§3.0 版本抉择矩阵
KPMP 数据分散在多个入口,按需求选路:
| 你的需求 | 推荐入口 | 大小 | 理由 |
|---|---|---|---|
| 复现 Sci Adv 2022 参考图谱 | Zenodo DOI 10.5281/zenodo.6410326(KPMP-Datasets.zip) | 2.9 GB | 与论文冻结版本一致,CC BY 4.0,一键下载 |
| 最新全量开放数据 | Atlas Repository(atlas.kpmp.org/repository/) | 数 TB 级 | 按季度滚动发布,含全部 assay 的开放文件 |
| 批量镜像 WSI 与 processed 组学 | Mount Sinai Data Ark 开放镜像 | 12,387 文件(WSI 6,088) | 校园网/VPN + Data Ark DUA,适合离线批下载 |
| raw sequencing / 临床病理明细 | Controlled Access(kpmp.org/controlled-data,签 DUA) | 受控 | WGS 4,878 文件等全部受控;12-36 小时响应 |
| 受控数据分析但无法本地落地 | KPMP HPC Enclave(Minerva 超算) | 云端 | 数据不可下载、只能导出计算结果;超 1 TB 计算量 $149/TB/年 |
| 复现染色质图谱论文 | Gisch 2024 配套数据(DOI 10.48698/HHE6-YV15) | 受控+开放混合 | multiome/WGBS/CUT&RUN 原始数据走 DUA |
| 浏览空间代谢组/IMC | Atlas Spatial Viewer | 在线 | 免代码浏览 IMC 81、spatial metabolomics 141 个数据集 |
| 交互式验证不用写代码 | Atlas Explorer / Spatial Viewer | 在线 | scRNA-seq 113 样本、snRNA-seq 156 样本可直接浏览 |
§3.1 模态详细说明
| Assay | 文件数(截至 2026-09) | 内容 | 开放/受控 |
|---|---|---|---|
| WSI(全切片病理图像) | 6,625 | Frozen H&E、H&E、PAS、SIL、TOL、TRI 多染色全切片 | 开放 |
| scRNA-seq | 1,828 | 解离单细胞悬液测序(h5ad) | 开放(processed)/ raw 受控 |
| snRNA-seq | 2,070 | 单核测序(h5ad) | 开放(processed)/ raw 受控 |
| 10x Multiome | 1,790 | 同核 RNA+ATAC | 开放(processed)/ raw 受控 |
| Spatial Transcriptomics | 1,697 | 区域转录组(Visium 类) | 开放(processed)/ raw 受控 |
| ATAC-Seq | 1,147 | 染色质可及性 | 开放(processed)/ raw 受控 |
| CODEX | 702 | 高维蛋白成像 | 开放 |
| 3D Tissue Imaging | 1,288 | 三维组织成像 | 开放 |
| CUT&RUN | 591 | 4 种组蛋白修饰靶向谱 | 开放(processed)/ raw 受控 |
| WGS | 4,878 | 全基因组测序 | 全部受控 |
| 蛋白质组学(regional proteomics) | 见 Spatial Viewer 统计 | 区域蛋白谱(MassIVE MSV000089251) | 开放 |
Assay 选择指南:
- 注释/图谱复现:scRNA-seq + snRNA-seq 起步;Nature 2023 整合以 snRNA-seq 为主干。
- 顺式调控:10x Multiome(同核 RNA+ATAC)优于分开的 ATAC-seq;组蛋白修饰细看 CUT&RUN。
- 空间表达:Spatial Transcriptomics 覆盖区域级表达;更高分子分辨率看论文配套的单分子空间数据。
- 蛋白成像:CODEX(702 文件)是蛋白级空间表型主力;IMC 与空间代谢组主要在 Spatial Viewer 浏览。
- 影像:WSI 覆盖最全(四招募组都有),分割掩膜配套,是病理 AI 的主入口。
- 遗传层:WGS 全部受控,需 DUA,属"第二阶段"数据。
§3.2 样本量拆分
- 参与层级:612 名在册参与者(AKI/CKD/DM-R/Healthy Reference 四招募组)。
- 文件层级:Repository 总计 22,824 个文件(开放 + 受控,截至 2026-09 官网主页表)。
- Explorer 可交互子集:scRNA-seq 113 样本、snRNA-seq 156 样本、regional transcriptomics 36、regional proteomics 31。
- Spatial Viewer 子集:WSI 625、CODEX 164、3D imaging 149、IMC 81、spatial transcriptomics 203、spatial metabolomics 141。
- 开放镜像:12,387 文件,其中 WSI 6,088(Mount Sinai Data Ark,2026-05-08 更新)。
- Nature 2023 整合分析:58 个参考组织(35 名供体)+ 52 个疾病组织(36 名患者),超过 40 万细胞/核,约 120 万个 3D 邻域(neighborhoods)。
参与者到文件的放大系数:612 名参与者 → 22,824 个文件,人均约 37 个文件——来自"一次活检多模态榨干"的设计(多核心、多染色、多 assay 并测)。做统计推断时单位始终是参与者,做存储与管线规划时单位才是文件。
Explorer 与 Spatial Viewer 的定位:两者是官方预计算的交互子集(合计数百个数据集),不是全量数据——全量在 Repository。Explorer 适合快速验证基因-细胞类型关系,Spatial Viewer 适合免代码浏览多模态空间数据;两者都无法替代本地分析(坑点 4)。
§3.3 数据格式详情
- 组学矩阵:h5ad(AnnData),观测变量含 Age_binned、nCount_RNA、percent.mt、author_cell_type、cell_type_ontology_term_id、tissue_ontology_term_id、suspension_type 等。
- WSI:常见 OpenSlide 兼容格式(SVS/TIFF 为主),配套 GeoJSON/TIFF 分割掩膜。
- 原始测序:FASTQ/BAM,全部受控(dbGaP phs002249 收录 HuBMAP 姊妹 snRNA-seq raw 数据)。
- 元数据:CSV,字段全分箱化(Age_binned、eGFR_binned、A1c_binned 等)。
- 蛋白质组:MassIVE(MSV000089251)标准 RAW/processed 输出。
- 分割掩膜:7 类结构的标签图(TIFF)与配套边界定义文档(Protocols.io Renal Multicompartment Segmentation)。
- 辅助文件:各 release 附数据发布说明(release notes)与 Change Log;Obs/var 层自带字段语义,AnnData 读取后即可追溯。
格式选择建议:矩阵类任务(注释/整合)只吃 h5ad;影像类任务(分割/分类)吃 WSI + 掩膜;复现论文走 Zenodo 冻结包;跨库对齐一律以 ontology term id 为键,不要用字符串标签对齐。
§3.4 存储大小
- 开放镜像 12,387 文件以 WSI 为主,体量在数 TB 级;建议预留 5 TB 以上磁盘用于全量镜像 + 解压缓冲。
- Zenodo 参考图谱包仅 2.9 GB,适合复现两篇主论文。
- 受控原始测序(WGS 4,878 文件等)按 TB 级估算,建议在 HPC Enclave 或机构 HPC 内处理。
容量规划参考:
| 场景 | 磁盘 | 内存 | GPU |
|---|---|---|---|
| 复现参考图谱(Zenodo 包) | 50 GB | 32 GB | 无需 |
| 单细胞注释/整合(Explorer 子集量级) | 500 GB | 64 GB | 单卡 24 GB 足够 |
| 全量 h5ad 整合(40 万细胞级) | 2 TB | 128 GB | 单卡 A100 80 GB 推荐 |
| WSI 分割/MIL(万张级) | 5 TB(NVMe 优先) | 64 GB | 单卡 24-48 GB |
| 受控 WGS 二级分析 | 不适用(云端) | 不适用 | HPC Enclave 配额 |
§3.5 标注方式
- 细胞注释:专家审定 author_cell_type + Cell Ontology term id;与 HuBMAP 联合制定 ASCT+B 表与 Uberon 组织词表。
- 结构分割:7 类结构掩膜由深度学习模型(Ginely et al. 2023)生成、病理医师逐片复核。
- 状态注释:Nature 2023 定义 28 种细胞状态(如损伤/应激态近端小管),作为疾病状态分类的弱标签。
- 临床元数据:分箱化类别变量,非连续值。
§3.6 标注者资质
肾脏病理核心(KTACC)由资深肾脏病理医师组成,负责结构 adjudication 与分割复核;细胞注释由 KPMP 与 HuBMAP 的计算生物学家 + 肾脏专家联合审定并映射 Cell Ontology;分割模型的训练与评估由 Central Hub 计算团队完成。
§3.7 数据采集时间范围
2017 年秋项目启动至今持续入组与随访;FY2022 扩展后组织解析规模显著增长;2025-02 外部委员会建议延长 5 年。Atlas 数据按季度打包发布(“Recently Released - QX Year”),历史版本经 Atlas Data Change Log 追溯。
时间粒度提示:公开层保留的是"研究时间结构"(基线/纵访点、协议阶段),不含绝对就诊日期;做时序建模时以访视序数而非真实日期为时间轴。
§3.8 地理覆盖
美国多中心:若干招募站点(Recruitment Sites)+ 12 个组织解析位点(Tissue Interrogation Sites)+ Central Hub(U24)+ 中央生物样本库(KTACC);中央 IRB 设于华盛顿大学圣路易斯。
§3.9 采集设备规格
单细胞/单核与 multiome 采用 10x Genomics Chromium 平台;空间转录组采用 Visium 类阵列;CODEX 为高维循环免疫荧光成像;另含成像质谱(IMC)与空间代谢组;WSI 由各招募/解析位点扫描仪数字化后统一入库;蛋白质组与染色质分别经质谱与测序平台产出。各 assay 的详细平台参数见 Atlas 各 assay 页面与论文 Methods。
对复现敏感的设备细节:
- sc/sn 悬液的解离与冻存流程在 TIS 间存在规程差异,suspension_type 是最重要的分层变量。
- Visium 类阵列的 spot 直径与间距决定了 niche 建模的邻接定义,跨数据集比较时统一用 spot 级图。
- CODEX 通道命名与循环配准质量在官方通道表中维护,通道子集选择前先查表。
- WSI 无统一扫描仪——染色 + 站点组合才是有效"批次键"。
§3.10 深度溯源链
NIDDK 资助(19 项 U 系基金,如 U01DK133081、U01DK133091、U24DK114886、UH3DK114926)→ 招募站点知情同意与活检 → Honest Broker(Central Hub 持有可识别数据)→ KTACC 去标识生物样本与数据 → Atlas 季度发布(附 Change Log)→ Zenodo/GEO(GSE163603、GSE121862、GSE140989、GSE183279)/MassIVE(MSV000089251)/dbGaP(phs002249)镜像。分析代码全程开源于 github.com/KPMP(含 Reference-Tissue-Cell-Atlas-Manuscript-2022 全套脚本与 Docker 镜像 iyengarlab/kpmp-rp-apps、kpmp-cs-apps)。
溯源链自查三问(写方法学论文时可直接回答):
- 这批文件来自哪个 release?——release notes + Change Log 可回溯到季度与撤回记录。
- 这份组织的原始协议是什么?——study_protocol 与 sample_type 字段直达协议类型与取样方式。
- 这套分析谁做的、能重跑吗?——github.com/KPMP 对应论文仓库 + Docker 镜像版本即完整环境。
§4 数据结构详解
§4.0 目录结构预览
以 Zenodo 参考图谱包与 Atlas 开放层的逻辑组织为例(具体目录名以实际 release 为准):
KPMP/
├── metadata/ # 参与者与样本级分箱化元数据(CSV)
│ ├── participant_metadata.csv # enrollment_category、Age_binned、eGFR_binned 等
│ └── sample_metadata.csv # sample_type、tissue_type、study_protocol、suspension_type
├── scRNAseq/ # 解离细胞 h5ad
│ └── *.h5ad # author_cell_type、cell_type_ontology_term_id
├── snRNAseq/ # 单核 h5ad
├── multiome/ # 10x Multiome(RNA+ATAC 同核)
├── spatial-transcriptomics/ # 区域转录组
├── codex/ # CODEX 高维蛋白成像
├── 3d-tissue-imaging/ # 三维成像
├── atac-seq/ # 染色质可及性
├── cut-and-run/ # 组蛋白修饰
├── wsi/
│ ├── *.svs # 多染色全切片(Frozen H&E/H&E/PAS/SIL/TOL/TRI)
│ └── segmentation-masks/ # 7 类结构掩膜(TIFF/GeoJSON)
└── CHANGELOG.md # 对应 Atlas Data Change Log 的版本说明
目录约定与官方 release 的对应关系:metadata/ 对应 release notes 中的参与者/样本级元数据文件;各 assay 目录对应 Repository 的 assay 分类页;wsi/segmentation-masks/ 对应官方 7 类结构掩膜发布页。实际下载的包若为按季度组织的结构,先展开季度目录再映射到本约定。
§4.1 DAIMS 标准化字段描述表
| 字段 | 类型 | 取值/示例 | 说明 |
|---|---|---|---|
| enrollment_category | 类别 | AKI / CKD / DM-R / Healthy Reference | 四招募组,核心分组标签 |
| study_protocol | 类别 | KPMP Main、Pilot 1、Pilot1v2、HRT Living Donor、HRT Percutaneous Nephrolithotomy、Other | 研究协议;Other 含非 KPMP 补充组织 |
| sample_type | 类别 | Transplant Pre-perfusion Biopsy、Intra-operative Biopsy、Percutaneous Needle Biopsy、Tumor Nephrectomy、Deceased Donor Nephrectomy 等 | 组织获取方式 |
| tissue_type | 类别 | cortex / medulla / papilla 等 | 解剖区域 |
| Age_binned | 有序类别 | 分箱年龄段 | 公开层唯一年龄形式 |
| eGFR_binned | 有序类别 | race-free CKD-EPI 分箱 | 基线肾功能 |
| A1c_binned / 糖尿病病程分箱 | 有序类别 | 分箱值 | DM-R 组关键协变量 |
| Albuminuria / Proteinuria | 类别 | KDIGO 白蛋白尿等级等 | 分箱化 |
| KDIGO Stage | 类别 | 1 / 2 / 3 | 仅 AKI 组提供 |
| RAAS Blockade | 类别 | 是/否等 | 用药背景 |
| suspension_type | 类别 | cell / nuclei | 区分 sc 与 sn |
| author_cell_type | 类别 | 51 种主细胞类型 + 28 种状态 | 专家审定标签 |
| cell_type_ontology_term_id | 类别 | Cell Ontology ID | 跨库映射键 |
| tissue_ontology_term_id | 类别 | Uberon ID | 组织词表 |
| 染色类型(WSI) | 类别 | Frozen H&E、H&E、PAS、SIL、TOL、TRI、Other | 批次/域偏移来源 |
| 分割掩膜 | 多通道标签 | 7 类结构 | WSI 配套 |
| release 版本 | 字符串 | “Recently Released - QX Year” | 数据版本键,入库必填 |
字段工程三条纪律:
- 分层字段不下沉:enrollment_category、study_protocol 是参与者级属性,不要复制到细胞级 obs——会放大伪重复。
- 分箱字段保序:Age_binned/eGFR_binned 用有序类别(ordinal)编码,绝不当无序 one-hot 处理。
- 本体字段做键:跨库对齐只用 cell_type_ontology_term_id / tissue_ontology_term_id,字符串标签仅作展示。
§4.2 标签分布统计
- WSI 按招募组分布:CKD 4,905(约 74%)≫ AKI 998(约 15%)> DM-R 612(约 9%)> Healthy Reference 110(约 2%)——极度不均衡,分类建模需重加权或重采样。
- WSI 按染色分布:多染色并存(Frozen H&E、H&E、PAS、SIL、TOL、TRI、Other),H&E 系占比最高;染色是首要批次变量。
- 细胞标签:Nature 2023 图谱覆盖 51 种主细胞类型、28 种细胞状态;Sci Adv 2022 参考图谱为 56 名成人 80,289 个单细胞、9 类 assay。
- 除此之外没有现成的"任务标签":没有官方的 train/test 或阳性/阴性标签,一切任务标签均需从 enrollment_category、细胞注释与病理掩膜派生。
分布健康检查代码(每次 release 更新后重跑,比例漂移 > 5% 告警):
import pandas as pd
wsi = pd.read_csv("KPMP/metadata/wsi_manifest.csv") # 以实际 manifest 为准
by_group = wsi["enrollment_category"].value_counts(normalize=True) * 100
by_stain = wsi["stain_type"].value_counts(normalize=True) * 100
print(by_group.round(1)) # CKD ~74% / AKI ~15% / DM-R ~9% / Reference ~2%
print(by_stain.round(1)) # H&E 系主导;PAS/SIL/TOL/TRI 为少数域
§4.3 关键字段描述性统计
- 参考图谱规模:56 名成人(Sci Adv 2022);超过 40 万细胞/核、45 名健康供体 + 48 名疾病患者(Nature 2023)。
- 空间粒度:约 120 万个 3D 邻域(neighborhoods)用于 niche 建模。
- 元数据粒度:所有临床变量均为分箱类别(Age、eGFR、A1c、Albuminuria、Proteinuria、糖尿病/高血压病程)。
- 层级深度:参与者 → 就诊/活检 → 活检核心(core 1 组织学,core 2/3 分子)→ 组织块/悬液 → assay → 文件。
| 统计口径 | 数值 | 出处 |
|---|---|---|
| 参与者 | 612(在册) | atlas.kpmp.org 主页 |
| 数据文件 | 22,824(开放 + 受控) | atlas.kpmp.org 主页 |
| WSI | 6,625 | atlas.kpmp.org 主页 |
| Nature 2023 整合样本 | 58 参考组织(35 供体)+ 52 疾病组织(36 患者) | Nature 2023 |
| 细胞/核 | > 400,000 | Nature 2023 |
| 主细胞类型 / 细胞状态 | 51 / 28 | Nature 2023 |
| 3D 邻域 | ~1,200,000 | Nature 2023 |
| Sci Adv 2022 参考图谱 | 56 名成人 / 80,289 单细胞 / 9 类 assay | Sci Adv 2022 |
| 开放镜像 | 12,387 文件(WSI 6,088) | Mount Sinai Data Ark(2026-05-08) |
§4.4 数据层级关系
参与者(612)
└── 就诊 / 活检事件(基线 + 纵访)
└── 活检核心
├── core 1 → 组织学 → WSI(多染色)→ 分割掩膜
└── core 2 / core 3 → 分子解析
├── 解离悬液 → scRNA-seq(suspension_type=cell)
├── 冻存核 → snRNA-seq / Multiome(suspension_type=nuclei)
├── 空间阵列 → Spatial Transcriptomics
└── 成像 → CODEX / 3D Imaging / IMC
└── 配套生物样本 → 尿液/血浆/血清/DNA/粪便(受控层)
跨表关联依赖参与者与样本级脱敏 ID;注意 KPMP 的 cell_id 为隐藏值,跨数据集细胞级对齐需经 Cell Ontology 术语层。
§4.5 缺失值情况与信息性缺失编码
- 分箱字段以显式类别枚举,未收集/不适用项在元数据中有对应类别,不产生 NaN 式静默缺失。
- KDIGO Stage 仅 AKI 组有意义——其他组该字段的结构性缺失是"设计使然",不是数据质量问题。
- 部分样本因组织量不足只完成部分 assay;assay 缺失与活检核心分配策略(core 1 组织学)直接相关。
- Explorer 中 reference UMAP 不随招募组过滤更新、两字母基因符号有搜索 cutoff——这些是工具层限制,易被误读为"数据缺失"(见坑点 4)。
缺失核查清单(新 release 入库前逐项过一遍):
| 检查 | 方法 | 预期 |
|---|---|---|
| 分箱类别枚举漂移 | 对比新旧 release 的类别集合 | 集合只增不减;新增类别需更新编码器 |
| KDIGO 结构性缺失 | 确认非 AKI 组该字段为空属设计使然 | 不计为数据质量问题 |
| assay 缺失 vs 核心分配 | 追溯 sample_metadata 的 core 分配 | 缺失应有组织量不足或协议原因 |
| 撤回文件 | 比对 Atlas Data Change Log | 已撤回文件不进训练池 |
§5 数据划分与使用建议
§5.1 官方数据划分
KPMP 提供参考图谱与季度 release,不提供任何官方训练/验证/测试划分,也没有固定基准任务。所有任务标签(疾病分组、细胞类型、分割掩膜)都是研究性参考,不是评测集。
这不是缺陷而是定位:图谱型数据集的价值在"参考坐标系"与"覆盖深度",评测集需要的是冻结快照与固定标签口径——两者对版本管理的诉求相反。需要固定评测时,自行冻结一份 release 快照并公开划分脚本即可。
§5.2 推荐划分策略
按参与者而非切片/样本划分,避免同一人的多张切片、多个 assay 跨训练与测试集泄漏;在参与者内按 enrollment_category 分层:
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
meta = pd.read_csv("KPMP/metadata/participant_metadata.csv") # 参与者级分箱元数据
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(meta, groups=meta["participant_id"]))
train_p = set(meta.iloc[train_idx]["participant_id"])
test_p = set(meta.iloc[test_idx]["participant_id"])
assert len(train_p & test_p) == 0 # 参与者级零泄漏
# 按 enrollment_category 检查分层性
print(meta.groupby("enrollment_category")["participant_id"].count())
另建议留出一个招募站点做域外测试(leave-one-site-out),检验跨扫描仪/跨实验室的染色域偏移:
# 留一站点(site)外推验证:以站点字段为组键
from sklearn.model_selection import LeaveOneGroupOut
logo = LeaveOneGroupOut()
for train_idx, test_idx in logo.split(meta, groups=meta["site"]):
# train: 其余全部站点;test: 单一站点 —— 估计跨实验室泛化下界
...
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 同一参与者的多张 WSI / 多个 assay 分跨训练与测试集 | 高 | 一切划分以 participant_id 为组键 |
| 2 | 同一活检核心的"切片对"(相邻切片染色不同)跨集合 | 高 | 以活检核心/组织块为最小划分单元 |
| 3 | 细胞注释来自参考图谱后再训练注释器并回测同源数据 | 中 | 注释器评测用外部数据集(如 NEPTUNE/HuBMAP 肾脏数据) |
| 4 | 季度 release 新旧版本文件混用导致重复样本 | 中 | 以单次 release 快照 + Change Log 去重 |
§5.4 交叉验证建议
小样本层(参与者 ≤ 612)推荐 5 折参与者级分组交叉验证 + 每折内按招募组分层的复合策略;空间模型推荐留一 TIS(组织解析位点)交叉验证,直接估计"跨实验室泛化";时序型分析(受控层纵向数据)推荐按时间切分的前向验证。
- 每折都重算 class 权重:招募组占比在不同折间会波动,固定权重会放大方差。
- 报告结果时给出"折间均值 ± 标准差",并附每折的招募组构成表。
- 若做 WSI MIL,patch 特征提取在折外固定(特征提取不参与训练折),避免特征侧泄漏。
§5.5 外部验证
- NEPTUNE / CureGN:肾小球疾病队列,验证疾病分组与病理定量模型的外部效度。
- HuBMAP 肾脏数据:健康供体参考,验证细胞注释可移植性(注意两者仅 12 个核心共享元变量,见坑点 2)。
- GTEx 肾脏(皮/髓质):bulk 层面的组织表达 sanity check。
- 本站收录的肾脏病理条目:可用作 WSI 域偏移对照(无手动站内互链,检索站内"肾脏病理"标签即可)。
外部验证的三条实用路径:
- 注释迁移:KPMP 训练的注释器在 HuBMAP 肾脏数据上报告 macro-F1 保持率(期望 > 0.85,粒度坍缩到共同祖先后)。
- 分割外推:官方掩膜训练的分割器在 NEPTUNE 活检扫描上报告 Dice 与 GFA 相关性。
- 域偏移压力测试:H&E 模型直接推理 PAS/SIL 切片,量化染色域下降幅度,作为归一化方法的收益基线。
§6 AI 就绪指南
§6.0 云端快速启动
Google Colab / Kaggle 均可直接跑通"下载参考图谱包 → 读 h5ad → 出 UMAP"的最短链路(约 10 分钟):
# Colab 一键环境
!pip -q install scanpy anndata leidenalg openslide-python tifffile
!wget -q --show-progress https://zenodo.org/records/6410326/files/KPMP-Datasets.zip
!unzip -q KPMP-Datasets.zip -d KPMP
适用说明:此链路只覆盖 Zenodo 冻结包(2022 参考图谱口径);要分析最新季度数据,把 wget 换成从 atlas.kpmp.org/repository/ 下载对应 assay 文件即可,后续代码不变。Colab 免费档磁盘约 100 GB,仅够参考图谱包 + 中间产物;全量 WSI 请勿在 Colab 展开。
§6.1 快速上手(本地版)
# 1) 建议的隔离环境
conda create -n kpmp python=3.11 -y
conda activate kpmp
pip install scanpy anndata leidenalg scvi-tools openslide-python tifffile pandas
# 2) 目录约定
mkdir -p kpmp/{raw,processed,models}
# 3) 最短链路:读一个 snRNA-seq h5ad 并复现注释维度
import scanpy as sc
adata = sc.read_h5ad("kpmp/raw/snRNAseq_sample.h5ad")
print(adata.shape) # cells × genes
print(adata.obs.columns.tolist()) # Age_binned / author_cell_type / ...
print(adata.obs["author_cell_type"].value_counts()) # 51 类主细胞类型参考
# 4) 元数据先行:任何建模前先摸清参与者-样本结构
import pandas as pd
pm = pd.read_csv("kpmp/raw/metadata/participant_metadata.csv")
print(pm["enrollment_category"].value_counts()) # 四招募组构成
print(pm["Age_binned"].value_counts()) # 分箱年龄段
print(pm["study_protocol"].value_counts()) # 六类协议(含 Other 非 KPMP 组织)
目录注释:kpmp/raw 存放官方原始文件(不要改名重写),kpmp/processed 存放 QC 后的中间产物,kpmp/models 存放模型与随机种子,保证季度 release 更新时可复现。
§6.2 数据获取流程
- 浏览开放层:进入 atlas.kpmp.org/repository/,按 assay/招募组/协议筛选,逐文件或按 release 批量下载。
- 快速复现论文:Zenodo 下载 KPMP-Datasets.zip(2.9 GB,CC BY 4.0,DOI 10.5281/zenodo.6410326)。
- 批量镜像:申请 Mount Sinai Data Ark(需校园网/VPN + Data Ark DUA),脚本化同步 12,387 个开放文件。
- 申请受控层:在 kpmp.org/controlled-data 提交 DUA 请求(12-36 小时响应,签署后 1 个月内交付);发表需过 KPMP Publications and Presentations Committee(每两周审批)。申请要点:写清研究目的、所需 assay 与数据范围、数据安全措施(存储位置/访问控制/销毁计划)——范围越精确,审批越快。
- 无算力落地条件:申请 KPMP HPC Enclave(Minerva 超算)——数据不可下载、只能导出计算结果;超 1 TB 计算量按 $149/TB/年计费。
- 镜像数据集:GEO(GSE163603、GSE121862、GSE140989、GSE183279)、MassIVE(MSV000089251)、dbGaP(phs002249,HuBMAP 姊妹 raw snRNA-seq)。
各通道对比与适用人群:
| 通道 | 延迟 | 适合人群 | 关键约束 |
|---|---|---|---|
| Repository 手动下载 | 即时 | 个人探索、小任务 | 逐文件,量大时低效 |
| Zenodo 冻结包 | 即时 | 论文复现 | 版本固定(2022 图谱),不含最新季度 |
| Data Ark 镜像 | 数天 | 批量镜像、TB 级 WSI | 需校园网/VPN + DUA |
| DUA 受控申请 | 1 个月内交付 | 需要临床明细/raw seq | 委员会审批发表;禁再识别 |
| HPC Enclave | 审批后即时 | 无本地 TB 级算力团队 | 数据不可导出,只导结果;超量付费 |
| GEO/MassIVE/dbGaP | 数天 | 特定 assay 补充 | 覆盖不完全,注意版本口径 |
§6.3 预处理 Pipeline
import glob
import pandas as pd
import scanpy as sc
files = glob.glob("KPMP/scRNAseq/*.h5ad") + glob.glob("KPMP/snRNAseq/*.h5ad")
adatas = []
for f in files:
a = sc.read_h5ad(f)
a.obs["source_file"] = f
adatas.append(a)
adata = sc.concat(adatas, join="outer") # 跨文件合并(变量取并集)
# 1) sc vs sn 分层:不要混着做同一种 QC
adata = adata[adata.obs["suspension_type"].isin(["cell", "nuclei"])].copy()
# 2) 基础 QC(核数据 percent.mt 阈值应更宽松)
adata.var_names_make_unique()
sc.pp.filter_cells(adata, min_genes=200)
sc.pp.filter_genes(adata, min_cells=10)
if "percent.mt" not in adata.obs:
adata.var["mt"] = adata.var_names.str.startswith(("MT-", "mt-"))
sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], inplace=True)
sc.pp.filter_cells(adata, min_genes=200)
adata = adata[adata.obs["percent.mt"] < 25].copy()
# 3) 标准化 + 高变基因 + PCA + Leiden(复现图谱一级结构)
sc.pp.normalize_total(adata, target_sum=1e4)
sc.pp.log1p(adata)
sc.pp.highly_variable_genes(adata, n_top_genes=3000, batch_key="suspension_type")
sc.pp.pca(adata, n_comps=50)
sc.pp.neighbors(adata, n_neighbors=15)
sc.tl.umap(adata)
sc.tl.leiden(adata, resolution=1.0, key_added="leiden")
工程要点:跨 release 合并前先按 Change Log 剔除撤回文件;sc 与 sn 分别 QC 后再合并做整合;所有中间产物带 release 版本号后缀。
空间转录组管线的最小实现(Visium 类阵列):
import pandas as pd
import scanpy as sc
# 读入 spot × gene 矩阵与坐标(以 release 实际文件结构为准)
adata = sc.read_h5ad("KPMP/spatial-transcriptomics/sample_sp.h5ad")
coords = adata.obsm["spatial"] # spot 网格坐标
# 空间邻域图(六边形网格)→ niche 聚类
sc.pp.neighbors(adata, n_neighbors=6, use_rep="X_pca")
sc.tl.leiden(adata, resolution=0.5, key_added="niche")
adata.obs["niche"].value_counts() # 邻域类别 → 与组织区室注释对读
CODEX / 3D 成像属影像堆栈,建议走 tifffile + numpy 通道化处理,通道语义以官方通道表为准;IMC 与空间代谢组当前主要经 Spatial Viewer 交互浏览。
§6.4 框架加载
# WSI + 分割掩膜读取(OpenSlide 生态)
import openslide
from pathlib import Path
slide_path = next(Path("KPMP/wsi").glob("**/*.svs")) # 若为其他格式,替换扩展名即可
slide = openslide.OpenSlide(slide_path)
print(slide.level_count, slide.level_dimensions) # 多级金字塔
thumb = slide.get_thumbnail((1024, 1024)) # 快速缩略图
# 分割掩膜:7 类结构计数
import numpy as np
import tifffile
mask = tifffile.imread("KPMP/wsi/segmentation-masks/sample_mask.tiff")
classes = {
1: "IFTA", 2: "peritubular capillary", 3: "artery/arteriole",
4: "tubule", 5: "globally sclerotic glomerulus",
6: "non-globally sclerotic glomerulus", 7: "cortex",
}
vals, cnts = np.unique(mask, return_counts=True)
print({classes[v]: int(c) for v, c in zip(vals, cnts) if v in classes})
空间分析框架(Squidpy)的接入方式:
import squidpy as sq
sq.gr.spatial_neighbors(adata_spatial, coord_type="generic", n_neighs=6)
sq.gr.nhood_enrichment(adata_spatial, cluster_key="author_cell_type")
sq.pl.nhood_enrichment(adata_spatial, cluster_key="author_cell_type") # 区室邻接富集
# scvi-tools 批次整合(sc/sn + 染色/站点多批次)
import scvi
scvi.model.SCVI.setup_anndata(
adata, batch_key=["suspension_type"], categorical_covariate_keys=["enrollment_category"],
)
model = scvi.model.SCVI(adata)
model.train(max_epochs=200)
adata.obsm["X_scVI"] = model.get_latent_representation()
§6.5 常见坑点
以下 8 个坑点按"遇到频率 × 损失量级"排序整理,前三个几乎每个新团队都会踩;每条给出问题-症状-解决-参考四段,解决措施与 §6.3/§6.4 的代码一一对应。
⚠️ 坑点 1:公开临床元数据全部分箱化——连续变量建模基本不可行(分类:隐私-可用性权衡)
问题:为控制再识别风险,公开层所有临床变量(Age、eGFR、A1c、Albuminuria、Proteinuria、糖尿病/高血压病程)均以分箱类别发布,没有连续值。
症状:想做 eGFR 连续值回归、精确亚组分层或时间-事件建模时,发现协变量只有"档位";把分箱当连续值硬回归会引入系统性偏差。
解决:公开层按有序类别编码(ordinal encoding)或做分箱敏感性分析;确需连续值/精确随访,走受控层 DUA 申请;论文中明确声明分析粒度为分箱级。
参考:KPMP Atlas Data Release Notes(kpmp.org/help-docs/software?tabname=atlasdatareleasenotes)。
⚠️ 坑点 2:KPMP 与 HuBMAP 的整合陷阱——仅 12 个核心共享变量且注释粒度不一致(分类:跨库整合陷阱)
问题:两库元变量仅有 12 个核心对齐(KPMP 23 个 vs HuBMAP 13 个);KPMP cell_id 为隐藏值;细胞注释粒度不同——KPMP 常停在"近曲小管上皮细胞"级别,HuBMAP 细分到分段亚型。
症状:直接 outer-join 元数据后大量 NaN;把两库细胞标签当同一词表混训,注释器输出粒度漂移。
解决:以 cell_type_ontology_term_id 为键,在 Cell Ontology 层级上做坍缩(向上取共同祖先)或展开(按比例拆分)后再整合;元数据仅保留 12 个共享核心变量做联合分析。
参考:ICIBM 2025 海报(cns.iu.edu/docs/publications/ICIBM_2025_Poster_Ruopeng_Wu.pdf);KPMP/HuBMAP ASCT+B 表。
⚠️ 坑点 3:数据会撤回与替换——跨版本数字漂移(分类:版本管理陷阱)
问题:Atlas 按季度滚动发布,官方会撤回或替换文件(Atlas Data Change Log 记录原因);“Recently Released - QX Year” 每季度刷新,各 assay 文件数与总数随版本变化。
症状:论文里写的 22,824 文件在三个月后对不上;旧代码读到已撤回文件名;两个团队用不同季度快照得到不同结论。
解决:锁定单一 release 快照(记录下载日期与版本号);合并多季度数据前先按 Change Log 去重与剔除;在论文与方法中写明 release 版本与下载日期。
参考:Atlas Data Change Log(kpmp.org/help-docs/software?tabname=atlasdatareleasenotes)。
⚠️ 坑点 4:Explorer 可视化的"假象"——reference UMAP 不随过滤更新(分类:工具误用)
问题:Atlas Explorer 的 reference UMAP 是预计算的固定嵌入;按 AKI/CKD/Reference 过滤时只有 feature plot 与数据表更新,UMAP 布局不变;两字母基因符号搜索有 cutoff。
症状:截图汇报"某基因在 AKI 中聚团",实际 UMAP 显示的是全量参考的邻域结构;搜索短基因符号(如 “UMOD” 无碍,但两字母符号被截断)漏检。
解决:把 Explorer 仅当探索工具,正式分析下载数据本地重算 UMAP;短符号用完整列表匹配;已知问题先查 Known Issues Tracker。
参考:KPMP help-docs(kpmp.org/help-docs/software);Known Issues Tracker。
⚠️ 坑点 5:sc/sn、raw/processed、多染色混杂——不分层就引入批次混杂(分类:预处理陷阱)
问题:同一 Repository 里 scRNA-seq 与 snRNA-seq 并存(suspension_type 区分)、raw 与 processed 并存、WSI 含 6+ 种染色(Frozen H&E/H&E/PAS/SIL/TOL/TRI);三类混杂彼此叠加。
症状:sc 与 sn 混 QC 导致核数据被误杀(percent.mt 分布不同);processed 与 raw 重复计入样本量;H&E 模型迁移到 PAS 上性能暴跌(染色域偏移)。
解决:管线第一层就按 suspension_type 分支;以单染色子集训练并用 StainNet/Macenko 归一化做域适应;统计样本量时明确"文件/样本/参与者"三层口径。
参考:atlas.kpmp.org 主页各 assay 统计表;Sci Adv 2022 Methods。
⚠️ 坑点 6:Healthy Reference ≠ 健康对照(分类:生物学解释陷阱)
问题:参考组织来自活体供体、移植预灌注活检、肿瘤肾切除远端组织等,仅经病理 adjudication “无结构病变”;供体年龄偏高、移植缺血背景、肿瘤微环境都可能留下分子印记。
症状:把 Reference 当"正常基线"训练,模型把"年龄/缺血相关信号"学成了"健康特征";跨组比较时 Reference 与真实健康人群表达谱系统偏移。
解决:解释 Reference 时注明组织来源协议(study_protocol 字段);关键结论用肿瘤肾切除正常组织 vs 供体组织双通道交叉验证;谨慎宣称"健康肾脏图谱"。
参考:Sci Adv 2022(doi.org/10.1126/sciadv.abn4965)参考组织定义部分。
⚠️ 坑点 7:受控数据的获取与使用规则——DUA 审批不是走过场(分类:访问合规陷阱)
问题:WGS 全部 4,878 文件与 raw sequencing、临床病理明细均为受控数据;需签 DUA(12-36 小时响应、1 个月内交付);发表需过 KPMP Publications and Presentations Committee(每两周审批);HPC Enclave 数据不可下载、只能导出结果。
症状:按公开数据节奏规划受控分析,交付时间全面滞后;把受控数据片段截图进预印本,触发合规审查;试图把 raw FASTQ 拉回本地集群被拒。
解决:把 DUA 审批与发表委员会时间写入项目排期;结果导出走 HPC Enclave 的既定流程;预印本前先过委员会;引用数据时遵循官方 citation guideline。
参考:kpmp.org/controlled-data;kpmp.org/help-docs/kpmp-hpc-enclave。
⚠️ 坑点 8:活检取样的结构性偏倚——core 分配与并发症率(分类:采样与评估误用)
问题:一次活检通常取 2-3 条核心:core 1 做组织学、core 2/3 做分子分析——形态与分子数据来自不同物理组织;经皮穿刺活检本身有 12.5% 出血并发症率,AKI 急症期活检更偏向幸存者与能耐受者(选择偏倚)。
症状:假设 WSI 与空间组学"同点对齐"导致空间对应关系断裂;AKI 组样本系统性偏向轻症幸存者,重症结局被低估。
解决:以组织块/核心为最小对齐单元,避免夸大"像素级"影像-分子配对;在受控层结合临床流程数据校正选择偏倚;引用官方并发症基线做临床可行性论证。
参考:kpmp.org 知情材料与活检说明;Nature 2023 Methods(组织分配部分)。
§6.6 数据增强
- WSI:染色扰动(HED 通道抖动、Macenko/StainNet 归一化)、随机缩放(多尺度 10×/20×)、patch 随机裁剪;增强只作用于训练集。
- 单细胞:scVI 类隐变量增强、随机基因 dropout、库深重采样(target_sum 扰动)。
- 空间:跨切片配准抖动(配准误差 ~ 半个 spot 直径量级的扰动);spot 表达的邻域混合(graph smoothing)。
- 原则:所有增强保持标签语义不变——不要把"球性硬化肾小球"patch 增强后仍标为可计数病灶。
# 染色归一化(Macenko)最小示例:把 PAS/SIL 目标域拉到 H&E 参考域
from staintools import StainNormalizer # pip install staintools
normalizer = StainNormalizer(method="macenko")
normalizer.fit(read_image_as_uint8("reference_he_patch.png")) # 参考域(H&E patch)
patch_norm = normalizer.transform(read_image_as_uint8("pas_patch.png"))
§6.7 模型推荐
| 任务 | 首选 | 备选 | 说明 |
|---|---|---|---|
| 细胞类型注释 | scANVI(半监督) | Azimuth 参考映射、CellTypist | 用 51 类参考迁移;Cell Ontology 词表对齐 |
| 跨库整合 | scVI/scVI+ Harmony | WNN(multiome) | 处理 sc/sn 与跨研究批次 |
| 肾结构分割 | U-Net/HoVer-Net | CellViT 类基础模型 | 7 类掩膜可直接微调;关注 GFA 定量 |
| WSI 分类(弱监督) | CLAM/ABMIL | ViT patch embedding + MIL | 参与者级 GroupShuffleSplit |
| 空间 niche 建模 | GraphSAGE/GNN | NicheNet 配体-受体 | 对接 1.2M 3D neighborhoods 思路 |
| 染色质-转录组 | Multiome WNN / ArchR | Signac | 10x Multiome 直接支持 |
选型三条经验:
- 51 类长尾注释下,先报 macro-F1 再看 per-class 混淆矩阵——少类(如特定免疫亚群)常被总体 accuracy 掩盖。
- WSI 任务先用 ResNet/ViT-small patch 特征 + MIL 验证管线,再上病理基础模型;数据量(6,625 张)不足以从零训练大模型。
- 整合类不要追求"一个模型吃下所有 assay"——按 suspension_type 分支建模再在 latent 空间对齐,比混训更稳。
§6.8 计算资源需求
- 存储:全量开放镜像数 TB 级(WSI 主导);参考图谱复现仅需 2.9 GB。
- 单细胞管线:40 万细胞级整合建议 64 GB 内存 + 单卡 A100(scvi-tools 200 epochs 约 2-4 小时)。
- WSI 深度学习:patch 提取是 IO 瓶颈,建议 NVMe + 多进程;MIL 训练单卡即可。
- 受控 WGS:本地不可行时使用 HPC Enclave(数据不出境;超 1 TB 计算量 $149/TB/年)。
§6.9 评估指标
from sklearn.metrics import f1_score, balanced_accuracy_score, roc_auc_score
# 细胞类型注释(多类不均衡 → 宏平均为主)
f1_macro = f1_score(y_true, y_pred, average="macro")
bacc = balanced_accuracy_score(y_true, y_pred)
auc_ovr = roc_auc_score(y_true, y_proba, multi_class="ovr", average="macro")
- 注释/分类:macro-F1(51 类长尾)、balanced accuracy、按招募组拆分的 AUC。
- 分割:Dice/hausdorff,重点是球性硬化肾小球的召回(病灶计数直接影响 GFA)。
- 空间:Leiden/注释 niche 的一致性(NMI)、跨切片配准误差。
- 跨域:KPMP→HuBMAP / KPMP→NEPTUNE 的性能保持率(域偏移敏感指标)。
# 分割 Dice(按结构类别分别计算,避免大区域类主导)
import numpy as np
def dice_per_class(y_true, y_pred, n_classes=8): # 0 为背景,1-7 为结构
out = {}
for c in range(1, n_classes):
a, b = (y_true == c), (y_pred == c)
inter = np.logical_and(a, b).sum()
out[c] = 2 * inter / (a.sum() + b.sum() + 1e-9)
return out # 关注 class 5(球性硬化肾小球)的召回
§6.10 MLOps 笔记
- 版本钉死:以 release 版本号 + 下载日期为数据版本键;季度更新时用 Change Log 做差量审计。
- 复现:官方提供 Docker 镜像(iyengarlab/kpmp-rp-apps、kpmp-cs-apps)与分析脚本仓库,优先复用而非重写。
- 数据健康检查:每次数据更新后重跑 §5.3 泄漏自检与 §4.2 分布漂移对比(WSI 按组/按染色的比例变化 > 5% 即告警)。
- 发布合规:受控层衍生结果发表前预留 2-4 周(发表委员会双周审批节奏)。
团队协作补充约定:
- 数据契约:入湖时保留 release 版本、下载日期、Change Log hash 三字段,任何表都可追溯到数据快照。
- 代码契约:分支命名带 release 版本(如
feat/Q1-2026-cell-annotation),模型卡记录数据快照与划分脚本 commit。 - 评审契约:审稿人问"数据版本"时,直接给 Change Log 链接 + 快照日期,不用口头解释。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚 | 机制 | 缓解措施 |
|---|---|---|
| 参考组织≠健康 | Reference 来自供体/移植/肿瘤肾切除,带缺血、年龄、肿瘤微环境背景 | 按 study_protocol 分层分析;双通道交叉验证(坑点 6) |
| 疾病组严重不均衡 | WSI:CKD 4,905 vs Reference 110 | 重加权/重采样;macro 指标;少类过采样 |
| 招募选择偏倚 | AKI 活检偏向能耐受的幸存者;CKD 偏向转诊中心病例 | 受控层临床流程校正;外推时声明人群来源 |
| 站点/协议批次 | 多招募站 + 12 个 TIS + 六类协议(含 Other 非 KPMP 组织) | 留一站点验证;批次协变量入模 |
| 染色域偏移 | 6+ 种染色并存 | 单染色建模 + 染色归一化(坑点 5) |
| 分箱信息损失 | 公开层全部临床变量分箱 | 有序编码 + 敏感性分析(坑点 1) |
| 组织来源混杂 | 非 KPMP 协议补充组织(DiaComp、肿瘤肾切除)混入分组统计 | 以 study_protocol=“Other” 过滤或分层报告 |
| 版本漂移 | 季度 release 的文件集合与撤回 | 固化快照 + Change Log diff(坑点 3) |
§7.2 标注质量评估
细胞注释经 KPMP/HuBMAP 联合专家审定并挂接 Cell Ontology,属领域内最高标准;分割掩膜为"深度学习预分割 + 病理医师复核"的混合产物,边界细则公开(Protocols.io),但个体掩膜精度未逐片量化披露;病理 adjudication 只声明"无结构病变",不等于分子层面正常。
质量使用建议:把 author_cell_type 当"金参考"做迁移学习目标;把掩膜当"银标准"——在其上训练没问题,但评估自家新模型时建议对少量样本做病理医师独立复标,避免把预分割模型的系统性错误固化进下一代模型。
§7.3 泛化性讨论
人群以美国多中心为主,种族/年龄粒度受分箱限制;组织获取方式多样(供体、移植、肿瘤肾切除、经皮活检),不同来源的组织处理流程存在系统差异;将 KPMP 训练的模型外推到低中收入地区或非活检场景(如尸检、穿刺细针)时应做域适应与前瞻验证。
三个泛化边界要写进论文 limitation:
- 参考组织边界:Reference 组的"健康"是组织学意义的,分子基线受供体年龄与移植缺血影响(坑点 6)。
- 设备与流程边界:多站点扫描仪与 12 个 TIS 的处理流程差异是隐性域变量,模型在"留一站点"设置下的表现才是诚实估计。
- 编码边界:cell ontology 粒度与外部数据集不完全兼容,跨库评测必须先声明坍缩/展开策略(坑点 2)。
§7.4 伦理考量
全部参与者经知情同意;项目设 Data Safety Monitoring Board、中央 IRB(华盛顿大学圣路易斯)与 NIDDK 外部专家小组;采用 Honest Broker 模式隔离可识别数据;WGS 等 potentially identifiable 数据全部受控;基因组数据再识别是长期风险,使用者不得尝试再识别(DUA 明文约束)。
对 AI 团队的具体含义:公开层可以自由分析与发表(CC BY 4.0,引用即可);受控层的任何再分发、展示(含会议截图中的原始 FASTQ 元数据)都受 DUA 约束;把公开层与其推断结果二次合并(例如与外部基因数据库联合)时,仍需按"无再识别尝试"原则自审。
§7.5 公平性评估
# 公平性只能在分箱粒度上评估——这本身是 KPMP 公开层的公平性局限
import pandas as pd
meta = pd.read_csv("KPMP/metadata/participant_metadata.csv")
tab = pd.crosstab(meta["enrollment_category"], meta["Age_binned"], normalize="index")
print((tab * 100).round(1)) # 各招募组年龄构成(%)
- 组间代表性:招募组极不均衡(CKD 主导),少类(Reference、DM-R)模型性能需单独报告。
- 人口学粒度:年龄等仅分箱,无法做细粒度亚组公平性分析;种族相关分析在公开层不可行(eGFR 采用 race-free 公式是设计取向)。
- 准入公平:CC BY 4.0 开放层 + DUA 受控层 + HPC Enclave 免算力申请(超量付费)三档设计,对资源受限团队相对友好。
- 解读纪律:报告性能时同时给出"按招募组 × 分箱年龄段"的分层指标;任何跨组差异结论都要注明"分箱粒度"限定。
- 引用倡议:官方 citation guideline 要求"数据 + 论文"双引用——这将使用量反馈给资助方,是开放数据生态能持续的前提。
§7.6 数据漂移提示
季度滚动发布意味着:文件集合、元数据类别枚举、Explorer 预计算嵌入都可能随版本变化;FY2022 扩展与 2025 年项目延长会改变招募构成;官方撤回文件后旧版本不再可追溯下载。任何长期项目都应固化 release 快照并在 CI 中加入分布漂移断言。
已知的漂移类型与应对:
| 漂移类型 | 表现 | 应对 |
|---|---|---|
| 文件撤回/替换 | Change Log 记录原因;旧文件名失效 | CI 中做文件清单 diff |
| 类别枚举扩展 | 分箱字段新增类别 | 编码器改为"只增不减"设计 |
| 招募构成变化 | 每组文件占比漂移 | 训练前重算 §4.2 分布并重加权 |
| 预计算嵌入更新 | Explorer UMAP 布局与旧截图不一致 | 不以截图为证据,本地重算 |
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ⚠️ | 各 assay 内部为样本×特征宽格式;跨 assay 需自行建参与者-样本索引 |
| 2 | 有唯一标识符列 | ✅ | 参与者/样本/文件三级脱敏标识,元数据跨表可关联 |
| 3 | 无 Unicode 或特殊字符 | ✅ | 结构化元数据为 ASCII;WSI 为二进制格式不受影响 |
| 4 | 无重复行 | ⚠️ | 跨季度 release 拼接时存在版本重复,需按 Change Log 去重 |
| 5 | 缺失值已识别并编码 | ✅ | 分箱字段以显式类别枚举,未收集项有对应类别 |
| 6 | 标签列被明确标识 | ⚠️ | 无任务式标签;enrollment_category、author_cell_type、掩膜需自行派生目标 |
| 7 | 已对罕见类别(<3%)进行分组 | ✅ | 分箱化与协议归组本身就是分组;细类已在 release notes 枚举 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 列出 6 类偏倚与缓解措施 |
| 9 | 有完整的数据字典 | ✅ | help-docs 数据发布说明 + 各 assay 页面 + h5ad obs/var 字段自描述 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | KDIGO 仅 AKI、core 分配导致的 assay 缺失有文档;其余以类别枚举隐含 |
| 11 | 数据采集设备和设置已记录 | ✅ | 10x Chromium、CODEX、IMC、Visium 类平台与协议类型均有记录 |
| 12 | 已移除完全共线性变量 | ❌ | 发布数据保留全部原始列,未做共线性清理 |
| 13 | 对编码的映射标准已说明 | ✅ | Cell Ontology + Uberon + ASCT+B;eGFR 用 race-free CKD-EPI 并说明 |
| 14 | 对时间戳的处理已明确说明 | ⚠️ | 纵访时间保留相对结构;出生日期等敏感时间已分箱,绝对时间粒度受限 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无任何划分;本条目 §5.2 给出参与者级建议 |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 四种 KPMP 特有泄漏模式 |
| 17 | 标签分布已被分析 | ✅ | §4.2 招募组/染色/细胞类型分布 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | core 分配、协议分层与非 KPMP 组织(§7.1、坑点 8) |
| 19 | 外部验证建议已给出 | ✅ | §5.5 NEPTUNE/CureGN/HuBMAP/GTEx |
| 20 | 数据更新和版本信息已记录 | ✅ | 季度 release + Atlas Data Change Log 完整可溯 |
| 21 | 最小必要预处理脚本已提供 | ✅ | github.com/KPMP 全套分析脚本 + Docker 镜像 |
| 22 | 合规使用要求已明确 | ✅ | CC BY 4.0/DUA/发表委员会三层规则成文 |
| 23 | 多模态对齐方法已说明 | ⚠️ | 同参与者多模态经元数据对齐;影像-空间精细配准需自行实现 |
| 24 | 去标识化方法已被记录 | ✅ | Honest Broker 模式 + 元数据分箱化成文公开 |
DAIMS 评分:19 / 24
评分解读:优秀——FAIR 设计、字典与版本治理属同类数据集第一梯队,分析脚本全开源;失分集中在"研究性数据集"的共性短板:无官方划分、无任务标签、公开元数据分箱化导致连续变量建模不可行。
对你意味着什么:
- 做细胞注释/整合/方法学基准:几乎开箱即用——51 类参考标签、ontology 映射、开源脚本齐备,直接按 §5-§6 落地。
- 做分割/病理影像:7 类掩膜 + 6,625 张多染色 WSI 是公开肾脏病理数据中少见的量级,注意染色域与"掩膜是参考级而非绝对真值"。
- 做需要连续协变量/精确纵向时间的研究:开放层只能当特征素材库,务必规划 DUA 受控申请(§3.0 路线 4),或与外部数据集组合补齐。
- 做教学与合规研究:治理文档公开完整,可直接作为"敏感基因组数据分级开放"的案例教材。
- 一句话:把它当参考坐标系而不是 benchmark 来用,就不会踩空。
§7.8 外部验证矩阵
| 外部数据集 | 模态 | 适合验证 | 注意差异 |
|---|---|---|---|
| NEPTUNE | 肾小球疾病活检 + 分子 | 疾病分组/病理定量外推 | 队列构成(肾病综合征为主)与 KPMP 不同 |
| CureGN | 肾小球疾病纵向队列 | 长期结局关联 | 无空间组学 |
| HuBMAP(肾脏) | 健康供体单细胞+空间 | 注释迁移、健康参考校正 | 仅 12 个共享核心变量;注释粒度差异(坑点 2) |
| GTEx(肾皮/髓质) | Bulk 转录组 | bulk 级 sanity check | 无单细胞分辨率 |
| HCA Data Portal | 跨组织细胞图谱 | 术语对齐 | 组织来源与健康标准不同 |
§8 基准性能与生态
§8.1 排行榜
KPMP 是"图谱型"数据集,没有集中式排行榜。事实上的评测基准有两类:一是复现 Sci Adv 2022 / Nature 2023 的参考图谱结构(Leiden/注释一致性);二是官方掩膜上的分割精度与 Explorer 子集上的注释迁移。社区基准散见于各论文,采用前须核对各自的数据快照版本(季度 release 差异会让数字不可比)。
自建评测的三个锚点(保证与他人可比):
- 数据快照:声明 release 版本与下载日期;跨论文比较只认"同快照"数字。
- 划分协议:引用本条目 §5.2 的参与者级 GroupShuffleSplit + 招募组分层,或自行公开划分脚本。
- 指标口径:注释用 macro-F1/balanced accuracy,分割用 per-class Dice(重点报 class 5/6 肾小球两类),跨库用"坍缩到共同祖先"后的保持率。
§8.2 SOTA 总结与选型建议
- 参考图谱数字(截至 2026-09 已发表的最完整口径):Nature 2023——超过 40 万细胞/核、45 名健康供体 + 48 名疾病患者、51 种主细胞类型、28 种细胞状态、约 120 万 3D neighborhoods;Sci Adv 2022——56 名成人、80,289 单细胞、9 类 assay。
- 选型建议:注释类任务直接用 Nature 2023 参考标签 + Azimuth 映射起步;分割类任务用官方 7 类掩膜微调,重点报告球性硬化与 IFTA 的 Dice;疾病分类类任务注意 Reference 仅 110 张 WSI 的极端不均衡;整合类任务优先 scvi-tools 并把 suspension_type 与 study_protocol 作为批次变量。
- 两篇主论文引用量(2026-09):Sci Adv 2022 原始论文 Google Scholar 164+;Nature 2023 图谱论文 Scopus 326+(Princeton 机构页面口径)。
参考图谱覆盖的主细胞类型举例(Cell Ontology 词表,完整清单以 Nature 2023 补充材料与 h5ad 内 author_cell_type 为准):
| 区室 | 代表性细胞类型 |
|---|---|
| 肾小球 | 足细胞(podocyte)、系膜细胞、肾小球内皮、壁层上皮细胞 |
| 近端小管 | 近曲小管上皮细胞(S1/S2/S3 段细分) |
| 髓袢 | 降支/升支细段、升支粗段(TAL) |
| 远端与连接段 | 远曲小管细胞、连接小管细胞 |
| 集合管 | 主细胞(principal cell)、闰细胞(A 型/B 型) |
| 内皮/间质 | 管周毛细血管内皮、直小血管内皮、成纤维细胞、周细胞、淋巴管内皮 |
| 免疫 | 巨噬细胞、单核细胞、T/NK 细胞、B 细胞 |
28 种细胞状态主要刻画损伤/应激维度(如近端小管损伤态、适应态),是把"疾病组 vs 参考组"差异落到细胞分辨率的关键标签层。
引用这些数字时的口径纪律:51/28 是 Nature 2023 图谱的口径,Sci Adv 2022 参考图谱是 9 类 assay 的另一套快照;两者覆盖的组织集合与版本不同,不要在正文里混用(如"51 类 × 80,289 细胞"这类拼接口径)。
§8.3 官方评测协议
官方不组织评测,但有两条硬性协议:展示或发表 KPMP 数据必须遵循 Atlas 主页的 citation guideline;受控数据成果发表需经 Publications and Presentations Committee 审批(双周节奏)。挑战赛方面,KPMP 数据曾作为肾脏分割与分析类挑战的素材来源之一,参加任何挑战赛前请核对组委会声明的数据版本与官方掩膜出处。
对 Challenge 组织者的提示:以 KPMP 为底座的挑战赛应冻结快照、发布自己的划分与评测服务器,并声明掩膜来自官方发布(Ginely et al. 2023 模型 + 病理复核)——否则成绩在不同季度 release 之间不可比。
§8.4 相关数据集
| 数据集 | 关系 | 组合用法 |
|---|---|---|
| NEPTUNE / CureGN | 同疾病域纵向队列 | 外部结局验证 |
| HuBMAP | 治理与术语共建伙伴 | 12 共享变量对齐、健康参考校正 |
| Human Cell Atlas | 上游术语与标准 | Cell Ontology/ASCT+B 对齐 |
| GTEx | 健康组织 bulk 参考 | 表达谱 sanity check |
| CPTAC | 癌症蛋白基因组学 | 肿瘤肾切除子样本的癌症对照扩展 |
| Human Protein Atlas | 组织/细胞级蛋白表达参考 | 蛋白标志物的组织分布 sanity check |
§8.5 关键论文 Top 8
- Hansen et al., Science Advances 2022(10.1126/sciadv.abn4965)——KPMP 参考细胞图谱:56 名成人、80,289 单细胞、9 类 assay。
- Lake et al., Nature 2023(10.1038/s41586-023-05769-3)——健康与损伤肾脏的细胞状态与 niche 图谱:51 主细胞类型、28 状态。
- Gisch et al., Nature Communications 2024(10.1038/s41467-023-44467-6)——肾脏染色质景观(multiome、WGBS、CUT&RUN、4 种组蛋白修饰)。
- 肾乳头空间图谱, Nature Communications 2023(10.1038/s41467-023-38975-8)——Visium 空间转录组与结石病免疫损伤。
- Ginely et al., 2023——肾脏多区室深度学习分割模型(官方 7 类掩膜的模型来源,见 KPMP Resources 与 Protocols.io)。
- KPMP 染色质浏览器配套数据集(DOI 10.48698/HHE6-YV15)——染色质景观的官方数据 DOI。
- KPMP 项目描述文档(RFA-DK-20-028 等 NIDDK 文件)——架构、Honest Broker 与数据治理的一手依据。
- Sci Adv 2022 参考图谱数据 DOI(10.48698/z30t-0a62)——论文与数据的官方绑定入口。
§8.6 社区活跃度
- 代码:github.com/KPMP 组织下维护论文级分析脚本(Reference-Tissue-Cell-Atlas-Manuscript-2022 等)与 Docker 镜像(iyengarlab/kpmp-rp-apps、kpmp-cs-apps)。
- 门户:Atlas Explorer/Spatial Viewer 提供免代码交互;help-docs 与 Known Issues Tracker 持续维护。
- 治理:季度数据发布 + Change Log + 双周发表委员会,运转节奏稳定;2025 年项目延长建议意味着未来数年仍会持续产出。
| 社区资产 | 位置 | 状态 |
|---|---|---|
| 论文级分析脚本 | github.com/KPMP(Reference-Tissue-Cell-Atlas-Manuscript-2022 等) | 持续可用 |
| 官方 Docker 镜像 | iyengarlab/kpmp-rp-apps、kpmp-cs-apps | 与论文配套 |
| 已知问题追踪 | KPMP help-docs Known Issues Tracker | 活跃维护 |
| 数据变更日志 | Atlas Data Change Log | 每季度更新 |
| 项目公告 | kpmp.org/news(含 Atlas Explorer 发布公告) | 持续更新 |
§8.7 生态快照
镜像与索引:GEO(GSE163603、GSE121862、GSE140989、GSE183279)、MassIVE(MSV000089251)、dbGaP(phs002249)、Zenodo(DOI 10.5281/zenodo.6410326)、Mount Sinai Data Ark 开放镜像(12,387 文件)、NIDDK KPMP DOI Collection。
工具生态:Satija 实验室 Azimuth 的 Human Kidney 参考基于 KPMP 图谱构建,是肾脏单细胞注释事实上的入口;KPMP/HuBMAP ASCT+B 表被 HuBMAP 门户复用;官方 Docker 镜像支持一键复现两篇主论文。
下游影响:Sci Adv 2022 原始论文被引 164+(Google Scholar,截至 2026-09),Nature 2023 图谱论文被引 326+(Scopus,截至 2026-09);肾脏单细胞、空间组学与病理 AI 的后续研究几乎都以 KPMP 参考图谱为注释与对照基线,是本站"基因组学与多组学 + 病理图像"交叉类别的核心底层资产。
生态时间线展望:项目已获外部委员会延长建议(2025-02),叠加 FY2022 扩展后的招募放量,未来数年季度 release 的样本与 assay 覆盖仍会增长;与 HuBMAP/HCA 的术语共建使 KPMP 注释体系在新细胞类型进入时保持可扩展——长期项目可把它当作"持续供给的基线数据源"而非一次性快照。
§9 相关资源与引用
官方资源
| 资源 | 链接 |
|---|---|
| 项目主页 | https://www.kpmp.org/ |
| Atlas 门户 | https://atlas.kpmp.org/ |
| Explorer | https://atlas.kpmp.org/explorer/ |
| Repository | https://atlas.kpmp.org/repository/ |
| Controlled Data | https://kpmp.org/controlled-data |
| 帮助文档 | https://www.kpmp.org/help-docs/software |
| HPC Enclave | https://www.kpmp.org/help-docs/kpmp-hpc-enclave |
| 资源与协议 | https://kpmp.org/resources/ |
| GitHub | https://github.com/KPMP |
| Zenodo 参考图谱包 | https://doi.org/10.5281/zenodo.6410326 |
| HuBMAP | https://portal.hubmapconsortium.org/ |
配套标准与工具链
| 资产 | 用途 | 入口 |
|---|---|---|
| ASCT+B 表(肾) | 细胞-组织术语锚定 | KPMP/HuBMAP help-docs |
| Protocols.io 分割边界定义 | 掩膜类别边界细则 | kpmp.org/resources/ |
| Known Issues Tracker | Explorer/工具已知问题 | kpmp.org/help-docs |
| Atlas Data Change Log | 撤回/替换与版本追溯 | kpmp.org/help-docs/software |
| Kidney chromatin browser | 染色质数据浏览 | KPMP DOI Collection(10.48698/HHE6-YV15) |
BibTeX
@article{hansen2022reference,
title = {A reference map of human kidney single cells and single nuclei},
author = {Hansen, Jessica and others},
journal = {Science Advances},
volume = {8},
number = {23},
pages = {eabn4965},
year = {2022},
doi = {10.1126/sciadv.abn4965}
}
@article{lake2023atlas,
title = {An atlas of healthy and injured cell states and niches in the human kidney},
author = {Lake, Blue B. and others},
journal = {Nature},
volume = {619},
number = {7970},
pages = {585--594},
year = {2023},
doi = {10.1038/s41586-023-05769-3}
}
@article{gisch2024chromatin,
title = {A chromatin landscape of the human kidney and its change in disease},
author = {Gisch, Danielle L. and others},
journal = {Nature Communications},
year = {2024},
doi = {10.1038/s41467-023-44467-6}
}
@dataset{kpmp2022zenodo,
title = {KPMP Reference Tissue Cell Atlas datasets},
author = {{KPMP Consortium}},
year = {2022},
doi = {10.5281/zenodo.6410326},
url = {https://zenodo.org/records/6410326}
}
引用政策:使用 KPMP 数据请引用对应论文与数据 DOI,并遵循 Atlas 官方 citation guideline;受控数据成果须先行通过 KPMP Publications and Presentations Committee 审批。
数据 DOI 引用示例:复现 Sci Adv 2022 图谱时同时引用论文 DOI 10.1126/sciadv.abn4965 与数据 DOI 10.48698/z30t-0a62;使用 Zenodo 包时引用 10.5281/zenodo.6410326;使用染色质数据时引用 10.48698/HHE6-YV15——“用哪份快照,引哪个 DOI”。
获取 FAQ
- 问:不签 DUA 能用到多少数据? 答:开放层覆盖全部 WSI(6,625 张)与 processed 组学矩阵及分箱化元数据;WGS 与 raw sequencing、临床病理明细必须走 DUA。
- 问:引用数以哪个口径为准? 答:两篇主论文分别按 Google Scholar(164+)与 Scopus(326+)口径,截至 2026-09; KPMP 数据自身亦有官方 DOI(10.48698/z30t-0a62 等),署名时优先引用所用数据的对应 DOI。
- 问:Explorer 里能看到的数据和下载的完全一致吗? 答:Explorer 是预计算子集(scRNA-seq 113 样本等),与全量 Repository 版本可能存在时间差;正式分析以下载数据为准。
- 问:能给国内团队快速建镜像吗? 答:公开层可通过 Mount Sinai Data Ark(签 Data Ark DUA)或逐 release 下载方式镜像;受控层数据不出 HPC Enclave,无法本地镜像。
§10 AI 使用声明卡
§10.1 AI 模型使用
本条目撰写过程中使用大语言模型辅助整理文献事实、生成代码框架与统一术语;全部规模数字、日期、DOI 与访问条款均来自官方门户与已发表论文,经编辑部交叉核验。
§10.2 AI 参与范围
AI 参与了:事实抽取与归类(依据 FACTS 事实清单)、章节初稿生成、代码示例起草、JSON-LD 序列化。AI 未参与:数据真实性裁定、评分最终决定(DAIMS 19/24 经编辑部复核)与合规性判断。
§10.3 输入来源
- KPMP 官方门户:kpmp.org、atlas.kpmp.org(含 Explorer/Repository/help-docs/controlled-data/HPC Enclave 页面)。
- 已发表论文:Sci Adv 2022(10.1126/sciadv.abn4965)、Nature 2023(10.1038/s41586-023-05769-3)、Nat Commun 2024(10.1038/s41467-023-44467-6)、Nat Commun 2023(10.1038/s41467-023-38975-8)。
- 数据镜像与登记库:Zenodo 6410326、GEO、MassIVE、dbGaP phs002249、Mount Sinai Data Ark。
- 治理文件:NIDDK RFA-DK-20-028、KPMP DOI Collection、ICIBM 2025 跨库整合海报。
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) | 千方病案医学编辑部 | 交叉审核(ICD-11 GB60/GB61 经 WHO 编码源核对) | ✅ 已通过 |
| §3 数据集规格(文件数、版本矩阵) | 千方病案医学编辑部 | 与 atlas.kpmp.org 主页统计表及 help-docs 交叉比对 | ✅ 已验证 |
| §4 数据结构(层级、字段字典) | 千方病案医学编辑部 | 与 release notes 及 h5ad 字段文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 github.com/KPMP 官方脚本比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 生态与引用数表述 | 千方病案医学编辑部 | 与 Scholar/Scopus 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-18
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- tabula-sapiens — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- single-cell-portal — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- hcl — 共享标签:基因组学与多组学 / 单细胞基因组学 / 转录组
- cellxgene — 共享标签:基因组学与多组学 / 病理图像 / 转录组
- tabula-muris — 共享标签:基因组学与多组学 / 病理图像 / 单细胞基因组学
- hlca — 共享标签:病理图像 / 单细胞基因组学 / 转录组
- human-protein-atlas — 共享标签:基因组学与多组学 / 病理图像 / 转录组
- human-cell-atlas — 共享标签:基因组学与多组学 / 病理图像 / 单细胞基因组学
- hubmap — 共享标签:基因组学与多组学 / 病理图像 / 单细胞基因组学
- geo — 共享标签:基因组学与多组学 / 转录组
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

