BICCN — 哺乳动物脑细胞普查多模态图谱 AI-Ready Wikipedia | 千方病案医数集

NIH BRAIN 计划跨物种运动皮层细胞普查图谱 · 数百万细胞 · 多模态

来源 BRAIN Initiative Cell Census Network (BICCN) / BRAIN Cell Data Center (BCDC), Allen Institute url: https://www.biccn.org发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称BICCN — 哺乳动物脑细胞普查多模态图谱 AI-Ready Wikipedia | 千方病案医数集
数据类型数百万细胞 · 多模态,跨小鼠/狨猴/人类运动皮层,CC BY 4.0 开放,NeMO/BIL/DANDI 档案,biccn.org 门户浏览
规模运动皮层细胞普查图谱(细胞级数据,非患者队列):小鼠/狨猴/人类供体数百万细胞
接入方式BRAIN Initiative Cell Census Network (BICCN) / BRAIN Cell Data Center (BCDC), Allen Institute url: https://www.biccn.org
AI 就绪度

数据集封面

BICCN — 哺乳动物脑细胞普查多模态图谱 AI-Ready Wikipedia


INFOBOX

数据集名称 BICCN(BRAIN Initiative Cell Census Network)
英文全称 BRAIN Initiative Cell Census Network(美国 BRAIN 计划脑细胞普查网络)
别名/简称 BICCN、脑细胞普查网络、Cell Census Network、BRAIN Initiative Cell Census
疾病分类 非疾病专病数据集——健康与疾病相关脑区(初级运动皮层 MOp/M1)多物种细胞参考图谱,支撑全谱系神经退行与精神疾病细胞类型分辨率研究(典型应用:ICD-11 8A00 阿尔茨海默病 / 8B60 帕金森病 / 8B61 运动神经元病(含 ALS)/ 6A20 精神分裂症,详见 §2.1)
SNOMED CT 26929004 Alzheimer’s disease / 49092000 Parkinson’s disease / 266292006 Motor neuron disease(见 §2.1b)
数据模态 单细胞/单核转录组(scRNA/snRNA-seq)、单核 DNA 甲基化组、单核染色质可及性(snATAC-seq)、空间转录组(MERFISH)、电生理(Patch-seq 膜片钳)、神经元三维形态、环路输入-输出示踪、遗传工具品系
AI 任务类型 细胞类型无监督聚类与注释、跨模态细胞类型整合(SCF/LIGER)、跨物种细胞类型匹配、标记基因识别、空间细胞分割与坐标回归、形态-电生理-转录组关联建模、细胞类型基础模型表示学习
样本总数 运动皮层普查主数据:>220 万细胞/核(转录组)+ >100 万细胞(染色质/表观组)[旗舰+11 伴文,Nature 2021];小鼠 MOp 单独 >50 万细胞
数据大小 NeMO 档案中 BICCN 分子数据 241.3 TB(850,292 个文件,截至 2021-09-28)
数据格式 依档案而异:基因表达/注释矩阵(HDF5/CSV/parquet 等,经 cellxgene/NeMO Analytics/Azimuth)、原始 FASTQ/表观测序、影像数据、电生理 NWB
许可证 CC BY 4.0(小鼠/狨猴/开放同意人类数据,免费开放)+ Allen Institute/BCDC Terms of Use;受限制人类数据经 NIMH Data Archive/NeMO 申请审核
访问级别 开放(CC BY 4.0,免注册下载与可视化)/ 申请审核(未获开放同意的人类受控数据)
DUO 标签 NRES(开放部分),受控人类部分另须 IRB/审批(MOR 适用)
语言 英文(数据本体、元数据与门户)
首发日期 2017(BICCN 启动)/ 2018-11 前后(首个数据发布)/ 2021-10-06(Nature 运动皮层图谱旗舰)
最后更新 2023-12-13(BICCN/BICAN 全小鼠脑图谱发布,Nature 10 篇)
发布机构 NIH BRAIN Initiative / BICCN 联盟;BRAIN Cell Data Center(BCDC,Allen Institute)门户与集成
官方主页 https://www.biccn.org/
下载地址 https://www.biccn.org/data(BCDC 数据目录)/ https://www.biccn.org/cell-census-primary-motor-cortex(运动皮层普查数据指引)
DOI 10.1038/s41586-021-03950-0(Nature 2021 旗舰)/ 10.1101/2022.10.26.513573(BICCN 数据生态用户指南 preprint)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 高度 FAIR、开放 CC BY 4.0、官方云端可视化与分析工具(NeMO Analytics、cellxgene、Azimuth、Terra);扣分项:无预分割 ML 任务集(非监督基准图谱)、数据分散于多档案格式不一、需用户自建划分与拼接
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 应用映射、临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(细胞 ID 主键体系、cell_type/cluster 标注字段、模态溯源)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 NIH BRAIN Initiative、BICCN、BRAIN Cell Data Center(Allen Institute)及任一数据档案无任何商业利益关联。本页面不销售 BICCN 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BICCN 开放数据按 CC BY 4.0 发布,使用时须按 BICCN 及其生产实验室要求规范致谢与引用;未获开放同意的人类数据须通过 NIMH Data Archive/NeMO 受控申请并遵守数据使用协议,禁止任何形式的重识别尝试。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? BICCN(BRAIN Initiative Cell Census Network,脑细胞普查网络)是美国国立卫生研究院(NIH)BRAIN 计划于 2017 年发起的国际合作项目,目标是像人口普查一样,把哺乳动物大脑里的每一种细胞都编成一本"零件目录"。它的第一个里程碑,是用一套多模态技术(测序、空间成像、电生理、形态重建)彻底普查了小鼠、狨猴和人类大脑中负责运动的初级运动皮层(MOp/M1),在 2021 年 10 月的 Nature 专集中一次性发表了 16 篇研究论文,标题为 “A multimodal cell census and atlas of the mammalian primary motor cortex” 的主论文章作为整个项目的总纲。

为什么重要? 大脑由数十亿神经元组成,但过去我们对"大脑有多少种细胞、每种在哪、长什么样、做什么"缺乏统一答案。BICCN 把转录组、表观组、空间位置、电生理和形态这些信息拼到一起,确立了一个跨物种统一的细胞类型分类体系,发现人类运动皮层存在上百种转录组定义的细胞类型,其中许多在三种哺乳动物中保守存在。这为破解帕金森病、肌萎缩侧索硬化(ALS)、阿尔茨海默病等疾病"哪种细胞最先受累、如何精准干预"提供了细胞层面的"罗塞塔石碑"。

我能用它做什么? 如果你是研究脑细胞分类、跨物种比较、神经发育或脑疾病细胞易损性的科研人员/数据科学家,可以直接从 biccn.org 或 NeMO 档案下载开放数据(CC BY 4.0)构建自己的分类模型;BICCN 还提供了云端分析(NeMO Analytics、cellxgene、Azimuth)和一批遗传工具品系,可用来验证你发现的细胞类型在真实脑组织中的位置与功能。它是一个"参考图谱",不是患病率的临床数据集——适合做机制研究,不适合做疾病诊断或流行病推断。

读者画像与适用边界。 本条目最适合四类读者:(1) 计算神经科学家——需要一套经多模态验证的细胞类型标签与标记基因;(2) 单细胞生信/ML 工程师——要在转录组/表观数据上训练分类或整合模型;(3) 转化与疾病研究者——要定位神经退行疾病中易损细胞类型并回投动物模型;(4) 数据基础设施/FAIR 实践者——研究联盟级开放科学如何落地。对以上用户 BICCN 是高质量的参考资源;但若你想找"带疾病标签、可用于患病/预后预测的队列数据",本图谱并不适用,应转向患者队列数据集。此外需澄清一个常见误区:BICCN 是"正常细胞参考图谱 + 部分健康/基础研究背景组织"的细胞级数据,不是电子病历或影像学患者库,其"供体"概念与临床患者完全不同。

§1.1 摘要

BICCN(2017-2022)由 NIH BRAIN 计划资助,是一个由数据产出中心、数据档案与标准制定者组成的网络化联盟。其首个成果是针对哺乳动物初级运动皮层(MOp/M1)的多模态细胞普查与图谱,发表于 2021 年 10 月的 Nature 专集(17 篇论文,另在 Nature Portfolio 增发 10 篇)。主论文章通过协调分析单细胞转录组、染色质可及性、DNA 甲基化组、空间分辨率单细胞转录组、形态与电生理特性,以及细胞分辨率输入-输出环路映射,并经由跨模态计算整合,建立了统一的细胞类型机制框架。技术上,小鼠 MOp 由 7 套 scRNA/snRNA-seq 数据外加 snmC-seq2 甲基化与 snATAC-seq 可及性数据推导出 90 个转录组神经元类型(总计 116 个转录组类型),经 SCF/LIGER 整合为 56 个分子定义的神经元类型;整合分析用到的细胞数超过 50 万。跨物种(小鼠、狨猴、人类)比较确立了 45 个保守细胞类型,同时在人类运动皮层发现约 100-127 种转录组类型,反映了物种特化的谷氨酸能神经元多样性与进化差异。该网络建立了数据 Level 0-4 分层、按季度公开发布的开放生态,由 BRAIN Cell Data Center(BCDC,位于 Allen Institute)统一索引,数据归档于 NeMO(转录组/表观组)、BIL(图像)、DANDI(电生理)与 BossDB(电镜)四大档案,开放数据以 CC BY 4.0 授权。

技术解读补充。 从数据工程视角,BICCN 运动皮层普查的特别之处在于"同一脑区被 9 个以上独立团队以各自擅长的工具并行刻画,再统一整合"——这与多数单实验室数据集由单一 pipeline 从头到尾产出的路径截然不同。整合过程需要解决三层难题:其一,不同 assay 的灵敏度与 dropout 模式不同,须先在各自内部 QC 再合并(见坑点 4);其二,多模态来自不同细胞,除 Patch-seq 外没有"同一细胞"的逐点对应,须靠统计映射(SCF/LIGER)而非逐记录 join 来实现对齐(见坑点 3);其三,跨物种基因命名与差异表达必须归一,才能做保守类型判定(见坑点 5)。理解这套结构,是正确使用 BICCN 数据的前提:它的价值恰恰建立在多模态交叉验证之上,而这一结构也决定了它不能当作单一格式、单一标注的平面表来处理——用户拿到的是"一套可交叉验证的分类学 + 分散于多档案的原始/注释层",需要按 §4-§6 的方法自行组装与锁版本。

§1.2 战略价值

维度一:跨物种细胞类型统一分类学的参考锚点。 BICCN 的核心贡献不是单个数据集,而是一套"分子→空间→形态→电生理→环路"可交叉验证的细胞类型组织框架。对数据科学/AI 而言,这意味着用户拿到的不是一份平铺的表达矩阵,而是一套带层次(class/subclass/type)、可逐模态验证的标注体系。SCF 与 LIGER 等整合算法证明了"转录组类型在电生理、形态、投射上高度吻合",因此任何在该数据上训练的分类模型都可借助多模态标签做交叉检验——这是多数仅含单一模态的单细胞数据集不具备的结构性优势。

维度二:脑疾病细胞易损性研究的转化杠杆。 BICCN 工作明确指向 ALS、帕金森、运动神经元病与阿尔茨海默等疾病"在特定细胞类型中发起"的假说——例如人类 Betz 细胞(投射到脊髓的大型运动神经元)在 ALS 中退化。通过把正常运动皮层建成基线图谱,研究者可以定位疾病中易损的细胞类型、在啮齿类动物模型中寻找对应同源类型并做药物靶向。这一"正常参考 vs 病变比较"的逻辑使 BICCN 成为脑疾病细胞类型分辨率研究的地基,尽管它本身不包含疾病状态的患者队列数据。

维度三:开放可复现的 FAIR 数据基础设施标杆。 BICCN 在数据共享方法论上同样具有范式意义:按季度公开、Level 0-4 数据分层、四大主题档案(NeMO/BIL/DANDI/BossDB)+ BCDC 中央目录 + Terra 云端标准管线的架构,使数据在产出当天即可被外部团队检索、可视化与再分析(截至 2021-09-28 已被下载 478.3 TB)。对从事数据基础设施、可复现单细胞工作流或 FAIR 度量的团队,BICCN 提供了一个"联盟级开放科学如何落地"的可借鉴样板——开放许可 CC BY 4.0 加上清晰致谢约定,显著降低了再分析的法律摩擦,这也是其被大量下游单细胞研究采纳的原因之一。

§1.3 同类数据集横向对比

数据集/图谱 物种 规模 模态 覆盖脑区 差异化特点
BICCN 运动皮层普查(本条目) 小鼠/狨猴/人类 >220 万细胞(转录组)+>100 万(表观组) 转录组+表观组+空间(MERFISH)+电生理+形态+环路 初级运动皮层 MOp/M1 多模态交叉验证 + 跨物种统一分类 + 遗传工具品系
BICCN/BICAN 全小鼠脑图谱(2023) 小鼠 >3,000 万细胞、>5,300 细胞类型 转录组+空间+表观组 全脑 全脑覆盖、层级 34 类/338 亚类/1,201 超型/5,322 簇
Allen Brain Cell Atlas 小鼠 ~700 万 scRNA(~400 万过 QC)+~430 万 MERFISH 转录组+空间 全脑 在线可视化平台,与 BICCN 数据同源
Human Cell Atlas(脑相关子集) 人类 依项目而异 单细胞多组学 多器官/多脑区 人体全身范围,非脑专一、非普查性
脑区专项 scRNA 图谱(非联盟单组) 通常数万-数十万细胞 以转录组为主 单一/少数脑区 规模小、少多模态交叉验证,缺乏遗传工具

§1.4 版本时间轴

时间 版本/事件 说明
2017 BICCN 启动(五年阶段 2017-2022) NIH BRAIN 计划授予多中心网络项目,目标系统化全小鼠脑细胞普查 + 人与非人灵长类原型
2018-11 前后 首个数据发布 首批发布 >130 万小鼠脑细胞分子身份 + 300 个小鼠脑解剖数据
2021-10-06 运动皮层普查(Nature 专集) 17 篇 Nature + 10 篇 Nature Portfolio;主论文章确定跨物种分类体系,数据全面开放
2022 BICCN 数据生态用户指南(preprint) bioRxiv 10.1101/2022.10.26.513573 描述 FAIR 生态、Level 0-4 分层与档案体系
2023-10-12 人类与 NHP 细胞图谱(Science 系 24 篇) 转向人类与非人灵长类细胞图谱,为 BICAN 铺路
2023-12-13 全小鼠脑图谱(Nature 10 篇) BICCN 五年成果收尾:>3,000 万细胞、>5,300 类型,经 BICCN/BICAN 协调

两点时间线说明:其一,"篇数"在不同出处略有出入——2021 专集常被记为 Nature 16 篇研究 + 1 篇观点(合计 17 篇)另加 Nature Portfolio 10 篇;本表与正文依据 Nature 沉浸专包与 NIH 官方口径以"17 篇 Nature + 10 篇 Nature Portfolio"为准。其二,2018 首发布早于 2021 主成果,说明 BICCN 从开始就按季度边产边发,用户检索到的"早期数据"可能缺少后续统一分类,引用时须核对版本。

§1.5 典型应用场景

  1. 细胞类型无监督发现与注释:在运动皮层(或扩展至全鼠脑)scRNA/snRNA 数据上训练聚类/图谱基础模型,产出可复现的 cell type 标注,并用 BICCN 多模态标签验证。
  2. 跨物种细胞类型匹配:利用 BICCN 跨物种转录组一致性,把人类脑中鉴定的疾病易损类型投射到小鼠模型做机制与药物实验。
  3. 空间细胞类型定位:结合 MERFISH 空间转录组数据,把转录组定义的细胞类型映射到皮层分层(L2/3、L5、L6 等)坐标,做空间先验的细胞分割。
  4. Patch-seq 多模态关联建模:用同一细胞的电生理、形态与转录组联合数据训练"转录组→电生理/形态"预测模型。
  5. 遗传工具与扰动研究的靶标设计:基于标记基因与 Cre/Flp 品系设计细胞类型特异性工具,用于功能验证与脑疾病建模。

从应用到任务的取舍提示。 上述场景中,前三个是纯"细胞图谱科学"任务,直接以 BICCN 开放数据即可开展,方法多为无监督聚类、图谱对齐与空间统计;第四个涉及跨模态数据、需以 Patch-seq 同细胞子集为训练前提;第五个则把数据当作"靶标设计参考",真正落地还需回到湿实验。用户在立项时应明确:是把 BICCN 当作训练数据(做分类/表征学习)、验证数据(做跨模态/跨物种一致性评测),还是参考基线(做机制/转化分析)——三者要求的下载规模、标注粒度与合规级别都不同,详见 §3.0 版本抉择与 §6.2 获取流程。

§1.6 关键术语速查

术语 全称/含义 在本数据集中扮演的角色
MOp / M1 primary motor cortex / 初级运动皮层 2021 普查聚焦的脑区(小鼠 MOp、灵长类 M1)
BCDC BRAIN Cell Data Center 位于 Allen Institute 的中央数据中心与门户(biccn.org
NeMO / BIL / DANDI / BossDB 四大数据档案 转录组·表观组 / 图像 / 神经生理 / 电镜的体积档案
sc/snRNA-seq 单细胞/单核 RNA 测序 定义转录组细胞类型的基准数据
snmC-seq2 单核甲基化测序 表观(DNA 甲基化)层面的类型证据
snATAC-seq 单核染色质可及性测序 表观(开放染色质)层面的类型证据
MERFISH 空间转录组成像 给细胞类型放回空间位置
Patch-seq 膜片钳+biocytin+scRNA 对同一细胞同时测电生理/形态/转录组
SCF / LIGER 跨模态整合算法 把转录组+表观/多 assay 映射到统一类型
t-type transcriptomic type / 转录组类型 分类的基本"类型"单元
CCF Common Coordinate Framework 小鼠数据空间锚定的三维坐标框架

§2 医学与生物学背景

§2.1 ICD-11 编码映射

BICCN 本身不是某单一疾病的专病数据集,而是健康与疾病背景下哺乳动物初级运动皮层的细胞类型参考图谱。其疾病相关性体现在:建立正常运动皮层细胞基线,用于研究以特定细胞类型易损/退化为特征的神经退行与运动障碍疾病。下表给出 BICCN 数据最典型支撑的 ICD-11 应用映射(应用场景映射,非患病率标注):

ICD-11 编码 中文名 英文名 与 BICCN 的关联逻辑
8A00 阿尔茨海默病 Alzheimer disease 细胞类型分辨率下研究皮层神经元易损性
8B60 帕金森病 Parkinson disease 运动环路与多巴胺相关运动神经元研究
8B61 运动神经元病 Motor neuron diseases 运动皮层 Betz 细胞/投射神经元在 ALS 中退化
8B62 肌萎缩侧索硬化症(ALS) Amyotrophic lateral sclerosis BICCN 人类运动皮层数据明确指向 ALS 细胞易损研究
6A20 精神分裂症 Schizophrenia 兴奋/抑制神经元组成失衡与皮层层级研究

注意:本条目不含疾病状态的患者队列表型,ICD-11 仅作为 BICCN 支撑的上游疾病研究场景的语义锚点;请勿将本图谱当疾病患病率/诊断数据集使用。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 SNOMED CT 术语
阿尔茨海默病 8A00 26929004 Alzheimer’s disease
帕金森病 8B60 49092000 Parkinson’s disease
运动神经元病 8B61 266292006 Motor neuron disease
肌萎缩侧索硬化 8B62 86044003 Amyotrophic lateral sclerosis
精神分裂症 6A20 58214004 Schizophrenia

ICD-11 与 SNOMED CT 均为"应用场景语义锚点",用于在百科中把 BICCN 与上游疾病研究主题做编码映射,便于检索与互操作;BICCN 数据本身不含这些疾病的患病样本或诊断标签,映射仅供理解其研究用途边界,不可当作数据集内含的疾病标注。

§2.2 疾病简介与流行病学背景

BICCN 聚焦的初级运动皮层(MOp/M1)位于额叶中央前回一带,是协调复杂随意运动的最终输出节点——信号从皮层经皮质脊髓束投射到脊髓并驱动肌肉。从神经生物学角度看,理解运动皮层"由哪些细胞类型组成、各自的比例、空间分布、电生理与形态特征",是理解运动障碍疾病的关键前提。BICCN 的 2021 年成果被 Karolinska 等参与机构明确表述为可增进对 ALS、帕金森病与运动神经元病等"攻击控制运动的神经元"疾病的理解;NIH 亦指出该图谱可用于研究精神分裂症、成瘾、癫痫与阿尔茨海默病的细胞基础。需强调:BICCN 是正常细胞类型参考图谱,其"流行病学"意义不在于患病率统计,而在于提供疾病背景下细胞类型易损性研究的正常基线

为何选运动皮层作为普查首个目标。 联盟选择 MOp/M1 有方法论上的三重考虑(BICCN 论文与综述均有论述):其一,它在三种哺乳动物间结构与细胞类型高度保守,便于做跨物种同源比较——这是把小鼠模型研究结论迁移到人类的前提;其二,它是新皮层的代表性"外层壳",理解其六层结构与兴奋/抑制组成,有助于推广到整个新皮层;其三,它直接支配运动,运动障碍(ALS、帕金森等)的细胞病理可从输出通路(如 Betz 细胞—皮质脊髓束)入手追踪。正因如此,运动皮层普查被视为"绘制整个哺乳动物大脑"的第一个样板而非终点。

相关神经疾病的方向性定位。 从疾病谱来看,BICCN 关联的主要方向是"运动系统受攻击"的疾病:(1) 肌萎缩侧索硬化(ALS)——运动皮层 Betz 细胞与皮质脊髓运动神经元退化是核心病理之一,BICCN 对人类运动皮层大型投射神经元的电生理与转录组刻画(含其向脊髓的投射)正为该病的细胞易损性研究提供了正常基线;(2) 帕金森病与运动神经元病——涉及基底节-丘脑-皮层运动环路,BICCN 伴文之一专门绘制了小鼠皮质-基底节-丘脑并行网络;(3) 更广义的皮层回路失衡(精神分裂症等)——以兴奋/抑制神经元组成与层状组织为切入点。需要再次强调:这些是 BICCN 数据拟支撑的"上游研究场景",本图谱不含对应疾病的患者队列数据,任何患病率/预后结论都必须另配真实临床样本,不能在正常参考图谱上直接下流行病学推断。

§2.3 生物学/临床研究任务定义

任务 定义 在本数据集中的实现
细胞类型分类(本体构建) 将细胞按转录组/表观组划分为层次化、可跨模态复现的类型 主论文章以 116 转录组类型 / 56 整合神经元类型构建小鼠 MOp 分类学
跨物种保守性定位 判定某细胞类型在小鼠/狨猴/人类间是否同源 确立 45 个跨物种保守类型,并识别物种特化谷氨酸能类型
疾病易损细胞定位 识别神经退行疾病中最先受累的细胞类型 为 ALS 中 Betz 细胞退化等提供正常基线对照
标记基因发现 为每一细胞类型找出稳定 marker gene 供遗传工具使用 用于设计 Cre/Flp 品系与空间原位验证
多模态表型关联 建立"转录组类型→电生理/形态/投射"对应关系 Patch-seq、MERFISH、环路示踪联合建模

§2.4 样本与供体人群表

BICCN 数据为细胞级参考图谱,非患者队列。人类样本来自脑组织供体(死后组织与神经外科手术切除组织等),须经知情同意与机构伦理管理;不同限制级别决定了开放或受控访问。以下为供体/样本概况(依据多篇已发表论文与门户描述):

维度 说明
物种来源 小鼠(Mus musculus)、狨猴(Callithrix jacchus)、人类(Homo sapiens)
人类样本性质 脑组织供体(死后组织、手术切除组织等),非前瞻性临床队列、非随机人群
时间 数据采集/发布跨 2017-2023(BICCN 阶段)
年龄/性别/种族 因数据分散于多档案与多论文,未统一发布;人类亚组组成不均一
开放 vs 受控 小鼠/狨猴/开放同意人类数据开放(CC BY 4.0);未获开放同意人类数据受控申请
脑区 初级运动皮层 MOp(小鼠)/ M1(灵长类)为主;扩展至全鼠脑等

无公开的供体级年龄-性别-种族分层表可整表引用;涉及人群亚组分析须直接回溯各原始论文的 Methods 与对应档案元数据。

§2.5 临床/科研价值

BICCN 的价值在于把"脑疾病在细胞层面发起"的假设变成可检验的资源:(1) 提供正常运动皮层每种细胞类型的分子、空间、电生理与形态档案,作为疾病比较的基线;(2) 提供跨物种同源映射,使人类疾病类型可在小鼠模型中实验干预;(3) 提供遗传工具品系与标记基因,支撑细胞类型特异性的功能验证与潜在精准基因治疗思路(NIH 明确提及基因组疗法靶向特定细胞类型的远景)。它不直接用于个体诊断,而是支撑从机制到药物研发的转化链条。

从"分子身份"到"药物靶点"的价值链路。 BICCN 把过去只能按解剖层次粗略描述的脑区,变成了可按分子身份寻址的细胞类型地图。对制药与转化研究者,这意味着:(1) 可在"疾病 GWAS/遗传变异落在哪些细胞类型"与"该类型 marker 与基因调控元件"之间建立联系,判断某变异是否富集于易损类型(BICCN 的小鼠脑基因调控元件图谱为解读人类非编码风险变异提供了直接工具);(2) 遗传工具品系(Cre/Flp)让研究者能在动物模型里特异激活/沉默目标类型,把"该类型是否驱动疾病表型"从相关推进到因果;(3) 跨物种同源让人类发现可回投小鼠做机制验证,再以人类图谱做最终确认。这条链路最终指向 NIH 所说的"以细胞类型和神经网络为靶点的精准治疗",但每一步的临床兑现仍需独立验证与监管审批。

§2.6 金标准表

划分/标注层面 标注方式 标注者 性质
转录组细胞类型(class/subclass/type) 无监督聚类 + 专家判读(多套 scRNA/snRNA + snmC + snATAC 交叉) BICCN 各产出实验室与整合工作组 共识分类学,无单一权威数;随分辨率与标准变化(56-116 类型量级)
整合分子神经元类型 SCF、LIGER 多模态整合 BICCN 计算工作组(含合作大学团队) 面向跨模态一致性,论文标注为方法学结论
空间细胞归属 MERFISH 原位成像 + 转录组比对 庄小威实验室等产出中心 提供空间坐标与簇归属,与转录组定义交叉确认
形态/电生理表型 Patch-seq、biocytin 染色、重建 各产出实验室 与转录组类型关联,作为生物学有效性证据
环路输入-输出 顺行/逆行示踪 + 单神经元重建 各产出实验室 细胞分辨率接线图,附于解剖类伴文

金标准的使用哲学:本数据没有"一行一个唯一正确答案"式的硬标签,而是"多模态交叉验证下的共识类型"。做监督学习时建议:以某份官方注释(如主论文章整合注释)为训练标签,但把"该类型能否被另一模态/平台独立复现"作为评估维度;把共识类型当作强先验而非不可挑战的真值。若你的聚类发现与官方标签不一致,优先排查 assay/批次/命名差异(坑点 4/5),而非认定自己出错——BICCN 本身即承认类型数与归属随方法而变(坑点 2)。


§3 数据集规格

§3.0 版本抉择矩阵

BICCN 数据以"普查发布 + 后续图谱演化"形式演进,无单一 SQL/CSV 包版本。用户应依据目标选择数据入口:

你的需求 推荐数据入口 规模/内容 理由
做运动皮层细胞类型分类/标注 BICCN 运动皮层普查(Nature 2021,含小鼠/狨猴/人类) >220 万细胞转录组 + >100 万表观组;小鼠 MOp >50 万细胞 主论文章配套整合数据,跨模态标签最全
交互浏览/低门槛可视化 BCDC 门户 + cellxgene / NeMO Analytics / Azimuth 精选注释矩阵 免下载即可可视化,适合先勘探再深挖
全脑广度研究 BICCN/BICAN 全小鼠脑图谱(2023-12) >3,000 万细胞、>5,300 类型 全脑覆盖、层级分类学最完整
深度做表观/甲基化 对应表观论文数据(NeMO / Brain Cell Methylation Viewer 等) snmC-seq2/snATAC-seq 数据集 表观层需要专门档案与浏览器
训练自己的基础模型(海量原始数据) NeMO 档案全量(注意多档案多格式) 累计 241.3 TB(截至 2021-09-28) 需自建下载与拼接 pipeline,见 §6.2 坑点

§3.1 模态详情

BICCN 运动皮层普查整合了六类模态:

模态 技术 产出数据类型 覆盖
转录组 scRNA-seq / snRNA-seq(10x、SMART-Seq、Smart-seq 等) 基因表达矩阵、cell 元数据 小鼠 MOp >50 万细胞;跨物种合计 >220 万
DNA 甲基化组 snmC-seq2 单核甲基化谱 小鼠皮层多区域、人/狨猴
染色质可及性 snATAC-seq 开放染色质区域谱 多脑区/跨物种(>100 万细胞)
空间转录组 MERFISH 原位表达 + 空间坐标 小鼠 MOp ~30 万细胞、95 神经元/非神经元簇
形态 + 电生理 Patch-seq(膜片钳 + biocytin + scRNA) 同一细胞的电生理、形态、转录组 500+ 神经元(跨物种)
形态/环路 全脑成像 + 顺/逆行示踪 + 单神经元重建 三维形态重建、输入-输出接线图 >1,700 神经元重建

多模态如何被整合。 这六类模态并非简单拼盘,而是围绕"同一套转录组定义的类型"做正交验证:

  • 转录组/表观组给出"分子身份"分类主轴(哪类基因开启、染色质可及/甲基化如何),是定义类型的基准;
  • MERFISH 空间转录组把分子类型放回三维空间,确认其分布在皮层哪些层与亚层;
  • Patch-seq 对同一个细胞同时测电生理、形态与转录组,把"分子类型"与"功能表型"直接挂钩;
  • 环路示踪(顺/逆行 + Epi-retro-seq/Retro-MERFISH + 单神经元重建)把类型映射到输入/输出连接,构建"细胞分辨率接线图"。
    因此用户看到的一个 cell_type 标签,背后是分子、空间、电生理、形态、连接多重证据的汇聚——这既提高了标注可信度,也意味着跨模态的"类型数/成员"可能不完全一致(见坑点 3)。

§3.2 关键子集样本数

子集 规模(细胞/类型) 来源
小鼠 MOp 分子整合图谱 >50 万细胞;90 神经元/116 总转录组类型;56 整合神经元类型 Yao et al. 2021 / 主论文章
跨物种(人/狨猴/小鼠)比较 合计 >45 万细胞(部分伴文统计)与 45 个保守类型 Bakken et al. 2021 / 综述引用
人类运动皮层 约 100-127 转录组类型(随标准波动) 主论文章 / 学术报道
主数据 + 11 篇伴文合计 >220 万(转录组)+>100 万(表观组) Nature 沉浸专包
MERFISH 小鼠 MOp ~30 万细胞、95 簇 Zhang et al. 2021

各伴文与档案的细胞计数口径不一(如 QC 前后、是否含非神经元),跨论文引用时须回查原始表。

§3.3 数据格式

档案 数据类型 典型格式
NeMO(转录组/表观组) 表达矩阵、聚类注释、原始测序 HDF5、CSV/TSV 注释、FASTQ/BAM 等
BIL(图像) 脑影像、原位图像 多通道影像栈、TIFF/定制格式
DANDI(神经生理) Patch-seq 电生理 NWB(Neurodata Without Borders)、HDF5
BossDB(电镜) 体积电镜数据 分层体积数据块

门户上的精选数据另经 cellxgene / NeMO Analytics / Azimuth / Single Cell Portal 等以注释矩阵 + 可视化形式提供。

格式互操作提示:开放注释矩阵多以 .h5ad(scanpy/cellxgene 生态标准)或 CSV/TSV + HDF5 表达提供,能被 scanpy/Seurat 直接读取;原始测序(FASTQ/BAM)与空间/影像/电生理分属不同档案且为不同对象,需要各自的 SDK/管道。所谓"一个包把所有模态装好"在 BICCN 中并不存在——跨模态研究要么在云端(NeMO Analytics/Terra)处理,要么按类型各自下载后以 cell_id/类型为键在应用层对齐。这也是本条目把它评为 4/5(而非 5/5)AI 就绪度的主因:数据 FAIR、工具齐全,但缺少一个可直接用于 ML 训练的统一预处理包。

§3.4 存储大小

NeMO 档案中 BICCN 分子数据累计 850,292 个文件、241.3 TB 存储(截至 2021-09-28),用户已下载 478.3 TB。加上 BIL(图像)、DANDI(电生理)与 BossDB(电镜)后总量更大。开放精选注释矩阵通常为 GB 级以下,可快速下载。

量级感知:单个小鼠 MOp assay 的注释矩阵 + 表达通常在数 GB 级、数十万细胞,可在本地完成大部分任务;241.3 TB 是全生态(含原始 FASTQ、全部物种与模态)累计量,仅基础模型训练才需要触碰。详见 §6.2 与 §9.4。

§3.5 标注方式

标注以自动聚类 + 专家注释 + 跨模态交叉验证为主(弱监督/半监督范式):细胞类型先由无监督聚类(RNA/甲基化/可及性)界定,再由专家依据 marker 基因与跨模态一致性命名;MERFISH 空间归属与 Patch-seq 表型作为独立验证通道。遗传工具品系(Cre/Flp)的构建由分子/发育工作组完成。整体标注是"计算聚类 + 专家共识",非单一人群人工标注,因此类型数量与粒度会随方法变化。

标注三层递进:(1) 无监督发现——Leiden/Louvain 等按转录组/表观相似度分簇,簇数随分辨率参数而变;(2) 专家命名——依据 marker 基因、已知解剖与电生理知识给簇赋予 type/subclass/class 名称;(3) 多模态确认——用 MERFISH 空间、Patch-seq 表型、环路投射反查"这个转录组类型是否在空间/功能/连接上自洽"。对希望复用标注做监督学习的用户,意味着 cell_type 是"经多重确认的共识标签"而非单纯聚类号;但类型数与成员仍可能随数据版本与整合方法漂移(见坑点 2)。

§3.6 标注者资质与一致性

标注由 BICCN 各产出实验室与跨机构整合工作组协作完成,涉及细胞图谱、空间成像、电生理与形态专家。一致性通过跨实验室/跨模态复现来保证(例如同一转录组类型在 10x 与 SMART-Seq、单细胞与单核数据间的复现率评估);主论文章采用 AUROC 等指标定量验证类型可复现性。由于是分布式多中心工作,各中心命名与粒度经整合工作组协调但非全自动统一,用户跨档案使用时需注意口径。

§3.7 采集周期

BICCN 五年阶段(2017-2022)持续采集与发布,数据按季度公开发布;运动皮层普查主数据于 2021-10-06 随 Nature 专集整体发布;全鼠脑图谱于 2023-12-13 发布(接续至 BICAN 协调)。

§3.8 地域覆盖

BICCN 为跨大西洋网络化合作,主要协调与数据中心位于美国(Allen Institute BCDC、NeMO、PSC、MIT、NIH 各研究所),但实际数据采集涉及多国实验室(如 Karolinska 提供人类数据、美国多校协作)。人类脑组织来源机构分散,具体地域须回溯原始论文。

§3.9 设备与测序平台

测序平台包括 10x Genomics(scRNA v2/v3 等)、SMART-Seq/Smart-seq 全长测序、单核平台;甲基化为 snmC-seq2;可及性为 snATAC-seq;空间成像为 MERFISH(多种错误鲁棒荧光原位杂交);电生理为膜片钳(Patch-seq)。小鼠空间坐标锚定于 Allen Mouse Common Coordinate Framework(CCF)。

§3.10 深度溯源链

从原始档案到论文结论的溯源链为:实验室原始采集(Level 0)→ QC/QA 校验并附元数据(Level 1)→ 关联到脑区/核团(Level 2)→ 计算特征(Level 3)→ 带生物学注释的整合数据(Level 4)。跨模态整合(SCF/LIGER)位于 Level 3-4 之间;每层数据经 BCDC 目录索引,可在 biccn.org 追溯论文与档案链接。

Data Level 明细(BICCN 各项目按此标注产出层级):

Level 定义 说明
Level 0 原始数据 各实验室在特定 assay 平台直接产出的原始数据
Level 1 QC/QA 校验 通过质量校验并带相应元数据
Level 2 关联数据 与特定脑区或核团关联
Level 3 计算特征 附计算所得的特征(cluster 等)
Level 4 整合注释 带生物学相关注释并与其他来源比较的整合数据

§3.11 参与机构与分工

BICCN 由 NIH BRAIN 计划 2017 年资助的 U01/RF1/U19 数据产出中心、R24 数据档案与 U24 数据中心(BCDC)组成。理解分工有助于定位数据与致谢:

角色 代表机构 职能
数据产出 各大学与研究所实验室(哈佛庄小威、Salk Ecker、Allen 曾红葵/Zeng、Baylor Tolias 等) 分别产出转录组/表观/空间/电生理/环路数据
数据档案 NeMO(马里兰)、BIL(PSC)、DANDI(MIT)、BossDB 存储、标准化、提供 FAIR 访问
数据中心 BRAIN Cell Data Center(Allen Institute,主任 Michael Hawrylycz) 目录、门户、数据集成与标准
云端分析 Terra/AnVIL 标准化可复现 omics pipeline

具体某数据集的实验室归属、建议引用与致谢请以其在 biccn.org 数据目录中的 landing page 与随附示例引用为准。


§4 数据结构

§4.0 目录树(示意)

BICCN 数据非单一压缩包,而是分散于多档案。下表为在 BCDC 门户/NeMO 下载某运动皮层整合注释集后常见的组织方式示意:

biccn_mop_census/
├── cell_metadata/            # 每细胞/核一条记录(主键 cell_id)
│   ├── mouse_mop_metadata.csv
│   ├── marmoset_mop_metadata.csv
│   └── human_mop_metadata.csv
├── expression/               # 基因表达矩阵(HDF5 / CSV)
│   ├── mouse_mop_matrix.h5
│   └── human_mop_matrix.h5
├── clusters/                 # 聚类归属与层级
│   └── transcriptomic_types.tsv   # cell_id -> subclass / type
├── markers/                  # 标记基因
│   └── cluster_markers.csv
├── spatial/                  # MERFISH 空间坐标与簇(若含)
│   └── merfish_spatial.h5ad
├── patchseq/                 # Patch-seq 表型(若含,见 DANDI)
│   └── patchseq_ephys_meta.csv
└── README_biccn_access.md    # 出处与致谢指引

实际文件路径随档案与项目而异,请以 biccn.org 数据目录中该数据集 landing page 为准;cellxgene/Azimuth 等会以服务化格式(如 .h5ad/cxg)封装而非原始目录。

"一个细胞"在不同档案里的不同呈现。理解 BICCN 的数据组织,核心是认清"同一种生物对象在四个档案中有四种载体":

数据对象 出现于 关键标识/如何关联
一个细胞/核的转录组 NeMO 注释矩阵 + 表达 cell_id(与类型、供体关联)
该细胞的空间位置(若 MERFISH) NeMO/BIL 空间数据 空间坐标 + 类型归属(非同细胞实测)
该细胞的电生理/形态(若 Patch-seq) DANDI + Neuromorpho 以同一 Patch-seq 细胞 ID 关联转录组
该细胞的形态/连接(重建/示踪) BossDB / BIL + 重建 以神经元/标本 ID 关联

由于绝大多数记录来自不同细胞,跨档案的"关联"是类型级或标本级的统计对应,而不是同一条记录的一次性 join(Patch-seq 除外)。在做多模态研究时,应在应用层(§6.3)以 cell_id/类型/标本为键进行显式对齐,而不是假定各档案的表格天然可逐行拼接。

§4.1 DAIMS 字段字典(核心细胞元数据表)

以下为小鼠/跨物种整合注释中常见核心字段(列名随档案略有差异):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
cell_id Text 唯一细胞/核标识 MOp_191205_AAACCTGC 主键/关联 唯一性经 QC 不应缺失 档案内唯一
donor/specimen_id Text 供体或标本 ID ID_497523_196469 批次/个体分层 供体间批次效应 以 NA 显式标注 依档案
species Text 物种 mouse 跨物种分组 mouse/marmoset/human
region Text 脑区 MOp 空间过滤 解剖取样误差 NA 显式 MOp/全脑扩展
assay Text 测序/成像平台 snRNA-10x 批次校正 平台批次效应 NA 显式 scRNA/snRNA/snmC/snATAC 等
subclass Text 亚类标注 L2/3 IT 分类标签 聚类不确定 低置信以 NA/其他 见各数据聚类本体
cell_type Text 转录组类型标注 L2/3 IT_1 分类标签 随分辨率波动 低置信标注 56-116 类型量级
marker_genes Text(数组) 定义该类型的标记基因 Slc17a7,… 特征/可解释性 依赖聚类 NA 基因名
cell_identity_score Float 聚类复现/置信评分 0.93 样本加权 方法学噪声 NA 显式 0-1
n_genes / pct_mito Float QC 指标(基因数/线粒体占比) 2,300 / 8.1 QC 过滤与协变量 技术噪声 QC 前后异 依 assay
brain_region_sub Text 皮层亚层/核团归属 L5 空间分层 取材定位误差 NA 显式 MOp 分层等
dataset_version Text 所属发布/档案版本 NeMO 241.3TB 批次 版本追踪 版本漂移 NA 显式 依档案
cluster_reproducibility Float 跨 assay 复现率/显著性 0.87 稳健性筛选 方法学 NA 0-1/AUROC

§4.2 标签分布

小鼠 MOp 的 116 个转录组类型由 59 个抑制性(GABAergic)神经元、31 个兴奋性(glutamatergic)神经元与 26 个非神经元簇构成(另有综述记为 90 神经元 + 26 非神经元)。跨物种保守性体现为 45 个在三种哺乳动物中保守的类型(24 GABAergic + 13 glutamatergic + 8 非神经元)。各类型占比随取样区域与 QC 而变,用户须按实际下载的注释矩阵统计自身子集分布,而非直接套用论文图。

类型构成的生物学解释。 运动皮层作为新皮层,其兴奋性神经元以谷氨酸能的锥体细胞(intratelencephalic, IT;extratelencephalic, ET/PT;以及 corticothalamic, CT 等投射亚型)为主,并因投射目标不同而具有不同标记基因;抑制性神经元则由 GABAergic 的多种亚型(Pvalb、Sst、Vip、Lamp5、Sncg 等家族)构成,各亚型在层与空间上有精细差异。BICCN 的整合分类把这些传统电生理/形态概念落到分子身份上——例如抑制性大类下再细分为几十个更细的转录组类型。理解"同一类型在不同聚类分辨率下会分裂或合并"是解读标签分布的前提(见坑点 2)。

§4.3 关键统计

  • 小鼠 MOp 转录组类型:90 神经元 / 116 总;整合后 56 神经元类型。
  • 人类运动皮层转录组类型:约 100-127(随分组标准波动,非唯一权威值)。
  • 跨物种保守类型:45 个。
  • 主数据累计:>220 万细胞(转录组)+>100 万细胞(表观组)。
  • 小鼠 MOp 整合用 >50 万细胞。
  • MERFISH 小鼠 MOp ~30 万细胞、95 簇。
  • Patch-seq:500+ 神经元(跨物种同细胞多模态)。
  • 形态重建:>1,700 神经元。
  • NeMO BICCN 数据:850,292 文件 / 241.3 TB(截至 2021-09-28)。
  • 全部 BICCN(非仅运动皮层)五年:>3,000 万细胞、>5,300 类型(全鼠脑,2023)。

§4.4 数据层级

与患者→检查→切片的临床层级不同,BICCN 的层级是 物种 → 脑区/核团 → 供体/标本 → 单细胞/核(assay 特异性)→ 细胞类型/表型。空间模态在单细胞之上叠加坐标层;环路模态在单细胞之上叠加输入/输出连接。跨模态关联的关键中间键是 cell_id 与聚类类型(subclass/type);由于不同 assay 来自不同细胞,多模态的"同一细胞"关联仅存在于 Patch-seq(同一细胞同时有转录组+电生理+形态)与少数集成数据,跨 assay 关联是统计性的(经 SCF/LIGER 映射)。

层级拆解为下表,帮助理解"某一记录处于哪个粒度":

层级 粒度示例 说明
物种 mouse / marmoset / human 顶层分组,决定命名与比较框架
脑区/核团 MOp(M1)、全脑扩展 决定空间语境;皮层 vs 皮层下差异大
供体/标本 ID_497523_196469 个体与批次来源,是分组交叉验证的单元
细胞/核 单记录 cell_id 实际测量单元,各 assay 记录彼此不同细胞
类型/表型 L2/3 IT_1;Patch-seq 表型 聚类标注与同细胞多模态表型

关键:绝大多数记录是"某 assay 下的一个细胞",其空间/表型/连接标签来自"同一分子类型"的统计推断而非同细胞实测(Patch-seq 除外)。做逐模态一致性判断时务必区分这两类证据(见坑点 3 与 §5.3)。

§4.5 缺失值 + 信息性缺失编码

  • 模态缺失是信息性的:并非每细胞都有所有模态,例如绝大多数 scRNA 细胞没有 Patch-seq 表型。这是采样设计所致,须在整合建模时显式处理(如 SCF 的跨模态邻居框架),而非当作随机缺失丢弃。
  • 细胞类型标注缺失/低置信:BICCN 明确表示类型数量与归属随聚类分辨率变化,低置信细胞常标为 “LowQC”、谱系外 “Other” 或仅到 class 级。使用时应把"无法明确分型"当作真实生物连续体信号,而非错误。
  • 人类样本的年龄/性别/死因等表型在部分档案缺失或仅开放汇总级;凡涉及人群亚组比较需回溯受控数据。
  • 编码惯例:开放 CC BY 4.0 数据通常以空值/NA 表示确实缺失并伴随注释列说明原因,不鼓励用 0 或 -1 隐式编码(避免被当作真实测量值)。
  • QC 前后细胞数差异显著:以全鼠脑图谱为例,~700 万细胞测序、约 400 万通过 QC——分析时应记录并报告 QC 后细胞数,防止把"测序细胞"与"可用细胞"混淆。
  • 跨版本/跨论文口径差异:同一脑区的计数在不同发布(含非神经元与否、QC 阈值)下不同,应始终引用具体档案与版本号。

§5 划分与使用建议

§5.1 官方划分

BICCN 无"官方 train/test"划分——它是细胞普查参考图谱而非带标注任务的 ML 数据集。官方提供的是数据层级(Level 0-4)与物种/模态/脑区组织的自然分组:用户应按物种(小鼠/狨猴/人类)、assay(scRNA/snRNA/snmC/snATAC)、脑区与层级切分,以控制批次与进化差异。

§5.2 社区惯例划分

社区在细胞类型分类与跨模态整合任务中的通行做法:

  • 按物种划分:小鼠做训练/内部验证,人类与狨猴做跨物种迁移/外推(检验跨物种保守性)。
  • 按 assay/平台划分:把一种平台(如 10x v2)作训练、另一平台(如 SMART-Seq)作外部验证,评估跨技术可复现性(主论文章即采用此思路做复现率评估)。
  • 按供体划分:以标本/供体而非细胞为划分单元,避免同一供体的细胞跨 train/valid 泄漏(尤其人类小样本场景)。

§5.3 划分策略与泄漏风险

  • 细胞级随机切分的过度乐观:同一供体/标本的大量细胞高度相关(批次、取材部位、细胞组成),若按细胞随机切分会造成严重的供体/批次泄漏,使验证指标虚高。必须按供体/标本做分组(group)划分,并把供体视为随机效应。
  • 多模态关联泄漏:Patch-seq 中"同一细胞"同时有转录组+电生理+形态,训练集与验证集若混入同一细胞的不同模态记录,会夸大多模态一致性。跨模态映射(如 SCF)产生的是统计性关联而非同细胞观测,做一致性评测时需避免把映射输出当独立证据重复计数。
  • 空间坐标泄漏:MERFISH 邻近细胞共享空间自相关,空间细胞分割或区域归类的评测需做空间分组交叉验证(如按切片/ROI 分组)。

§5.4 交叉验证建议

优先 GroupKFold by donor/specimen_id(无法取到供体时以 specimen/批次替代);每个 fold 保持物种/assay/皮层类型结构尽量均衡。对分类性能做分层评估时,把"低置信/Other/连续体"细胞作为单独类别处理,避免在排除后夸大精确率。推荐报告跨 assay 与跨物种两组验证,分别对应技术稳健性与进化泛化性。

推荐的划分组合(依任务与数据规模):

任务 建议划分 说明
小鼠 MOp 单 assay 分类 GroupKFold by specimen 供体最多、细胞量大,可做稳健组间验证
跨物种保守性迁移 小鼠训练 → 狨猴/人类外推 检验进化泛化,报告保守类型与特化类型表现
跨 assay 稳健性 平台 A 训练 → 平台 B 外推 检验是否学到平台指纹(坑点 4)
空间归属评测 按 MERFISH 切片/ROI 分组 规避空间自相关导致的乐观(坑点 §5.3)
监督分类 + 小样本人类 Leave-one-donor-out 人类供体少,逐供体留出报告均值±CI

§5.5 外部验证建议

利用官方独立数据作外部验证:(1) 同源但不同 pipeline 的转录组数据(跨 assay 复现);(2) MERFISH 空间归属作为"独立模态"验证转录组聚类;(3) 全鼠脑图谱(2023)中运动皮层子集作为全脑尺度的独立验证;(4) Allen Brain Cell Atlas 数据。跨物种任务中,以人类数据外验小鼠模型类型、反之亦然。所有外部验证须引用对应原始论文。

外部验证矩阵(本数据集可用的官方独立数据)

外部数据 用途 为何是独立证据 关键注意
不同 assay 的 MOp 转录组(10x vs SMART-Seq vs snRNA) 类型复现性 平台独立重测 统一基因命名与 QC 阈值
MERFISH 空间数据 聚类空间验证 独立成像模态 仅做类型级比对,非同细胞
全鼠脑图谱(2023)MOp 子集 全脑框架一致性 更大规模独立重注释 确认分类学层级一致
人类/NHP 图谱(2023) 跨物种同源 独立物种/脑区扩展 用保守类型锚点,勿逐基因强比

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

BICCN 数据本身多由官方云端工具托管,无需本地下载即可勘探:

  • NeMO Analyticshttps://nemoarchive.org/):在云端读取 BICCN 单细胞数据,运行 notebook 与聚类分析。
  • cellxgene / Azimuth:交互可视化注释矩阵,适合快速判断聚类粒度与标记基因。
  • Terra/AnVIL:官方提供云端标准化 omics 处理环境(BICCN 使用 Terra 云端平台做可复现分析)。
  • CZI cellxgene Discover / Allen Brain Cell Atlas:全鼠脑(2023)等数据的浏览与切片下载。

对只做"交互式看聚类、验证 marker"的用户,云端即可完成;对要训练自研模型的用户,才进入 §6.2 的原始数据下载。

一条推荐的云端起步路径(零本地安装):

  1. 打开 biccn.org → Data Catalog,用 species = mouse + modality = transcriptomics 过滤,找到目标整合注释集的 landing page;
  2. 在 cellxgene / NeMO Analytics 中打开该数据集,交互式查看 UMAP、检索 marker(如 Slc17a7 标记兴奋性、Gad1 标记抑制性);
  3. 确认所需 assay/脑区后,在 NeMO Analytics 中运行现成 notebook 或导出所选子集;
  4. 需要自定义模型时,把目标注释矩阵(.h5ad)下载到本地或 Terra,进入 §6.3/§6.4 的本地流程。
    这样能以分钟级速度判断"这份数据是否适合我的问题",避免过早投入大下载与装配成本。

§6.1 快速上手

本小节假设用户已从 biccn.org 数据目录或 NeMO 下载一个"运动皮层整合注释集",典型包含 cell_metadata/*.csv(每细胞一行)与 expression/*.h5(基因表达)。data_root 指向你解压后的本地根目录;最小可用子集可选小鼠 MOp 某一 assay(如 scRNA 10x 小鼠 MOp)的注释 CSV + 表达 HDF5,数 GB 级以内即可运行下述代码。

import os
import pandas as pd
import scanpy as sc

# data_root:你本地解压 BICCN 数据的根目录(含 cell_metadata / expression 子目录)
data_root = "/path/to/biccn_mop_census"
meta_path = os.path.join(data_root, "cell_metadata", "mouse_mop_metadata.csv")
expr_path = os.path.join(data_root, "expression", "mouse_mop_matrix.h5")

meta = pd.read_csv(meta_path)
print("细胞/核总数:", len(meta))
print("列:", list(meta.columns)[:12])
print("assay 计数:\n", meta["assay"].value_counts().head())

# 载入表达矩阵为 AnnData(scanpy 可读 HDF5/10x 类格式,必要时需按档案转换)
adata = sc.read_10x_h5(expr_path)  # 若档案为 h5ad/cxg 请改用 sc.read_h5ad / cellxgene 读取
adata.obs = adata.obs.join(meta.set_index("cell_id"), how="left")
print("AnnData 形状:", adata.shape)

档案格式差异处理。 BICCN 数据散落于多档案,读入方式依来源而异,务必先看 landing page 的格式说明再写解析器:

数据来源形态 常见格式 推荐读取 说明
cellxgene / Azimuth 导出 .h5ad / cxg sc.read_h5ad 已含 obs 注释,最省事
NeMO 表达矩阵 HDF5 / CSV / mtx sc.read_10x_h5 / sc.read_mtx / pd.read_csv 需自己拼 obs 元数据
DANDI 电生理 NWB(.nwb) pynwb.NWBHDF5IO 与转录组是不同对象,需按 cell_id 映射
BossDB 电镜 / BIL 影像 体积数据 专用 SDK 主要用于形态/连接分析
# 例:把 cellxgene 的 h5ad 与纯注释 CSV 对齐(保持 cell_id 顺序)
# if adata.obs_names 顺序与 meta 的 cell_id 不一致,用 reindex 对齐而非按行 concat
aligned = meta.set_index("cell_id").reindex(adata.obs_names)
assert aligned.notna().all().all(), "存在未匹配的细胞,检查 cell_id 字典与 QC 过滤差异"
adata.obs = adata.obs.join(aligned, how="left")

§6.2 数据获取

获取流程视数据类别而定:

数据类别 入口 流程/限制
开放整合注释(小鼠/狨猴/开放人类) biccn.org → Data Catalog;或 cellxgene/Azimuth 免注册下载或云端浏览,CC BY 4.0
原始分子数据 NeMO 档案 直接下载;BICCN 数据累计 241.3 TB,需按 assay 分批
图像数据 BIL 下载/在计算围场处理
神经生理 DANDI NWB 下载或 API
电镜体积 BossDB 体积数据接口
受限制人类数据 NIMH Data Archive / NeMO 申请 未获开放同意的人类数据需审批流程
# 以 NeMO 档案下载 BICCN 运动皮层某 assay 的示例(真实 URL 以数据目录 landing page 为准)
# 档案提供 manifest/globus 等批量下载方式。示意用 requests 下载单个 manifest 列出的文件:
import subprocess
# manifest 常以 TSV 给出每条文件路径。批量下载可用档案推荐的 Aspera/Globus/S3 客户端。
print("请先到 biccn.org/data 检索目标数据集,取得 NeMO landing page 与 manifest 后批量下载。")
print("开放注释矩阵(如 cellxgene .h5ad)可直链下载,通常 <1GB。")
# 实用建议:批量下载前先下载小体积的 manifest,核对文件数/总大小与 QC 过滤后的样本数一致
import pandas as pd

# manifest 示例列:file_path, size_bytes
manifest = pd.read_csv("manifest.tsv", sep="\t")
print("待下载文件数:", len(manifest))
print("总大小(GB):", round(manifest["size_bytes"].sum() / 1e9, 1))

# 按 assay/物种过滤只下你需要的最小子集(例如只下小鼠 scRNA 的矩阵,而非全量 FASTQ)
needed = manifest[manifest["file_path"].str.contains("mouse", case=False)]
print("过滤后文件数:", len(needed))

§6.3 预处理全流程

目标:将散落的 cell 元数据 + 表达矩阵整合为可训练的 AnnData,做基础 QC(线粒体占比、基因数、双细胞)与按 assay 的批次处理。最小可用子集为单个小鼠 MOp assay。

import scanpy as sc
import numpy as np

# 1) 格式归一与 QC(对每一 assay 子集分别执行)
def qc_subset(adata, min_genes=200, pct_mito_max=20):
    adata.var["mt"] = adata.var_names.str.startswith("mt-")  # 小鼠线粒体前缀 mt-;人 MT-
    sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], inplace=True, percent_top=None)
    adata = adata[adata.obs["pct_counts_mt"] < pct_mito_max, :].copy()
    sc.pp.filter_cells(adata, min_genes=min_genes)
    return adata

# 2) 标准化与高变基因(先做过滤再合并,避免不同 assay 混拼污染)
#    注意:不要直接对多 assay 合体后再挑高变基因,除非先做批次校正
# 3) 多 assay/跨物种整合:推荐先各自 normalize + HVG,再用 Harmony/scanorama 整合
#    (BICCN 论文用 SCF/LIGER,社区常用 Harmony 做后续批次校正)
# sc.pp.normalize_total(adata, target_sum=1e4)
# sc.pp.log1p(adata)
# sc.pp.highly_variable_genes(adata, n_top_genes=2000)
# sc.pp.pca(adata)
# import harmonypy  # 或 sc.external.pp.harmony_integrate(adata, "assay")

print("预处理核心要点:按 assay 过滤→标准化→整合;把 cell_id 作为唯一键,donor/specimen 作批次。")

一份更完整的单 assay→AnnData 预处理脚本(集成多文件、QC、去重,作为后续建模输入):

import os, glob
import pandas as pd, scanpy as sc

def load_one_assay(cell_dir, expr_path, assay_tag):
    """cell_dir 下各标本的注释 CSV 合并 + 载入对应表达矩阵"""
    files = sorted(glob.glob(os.path.join(cell_dir, "*.csv")))
    dfs = [pd.read_csv(f) for f in files]
    meta = pd.concat(dfs, ignore_index=True).drop_duplicates(subset="cell_id")
    adata = sc.read_10x_h5(expr_path)  # 按档案格式调整
    adata.obs_names = adata.obs_names.str.replace("-1$", "", regex=True)  # 去除 10x 后缀以便与 cell_id 匹配
    meta = meta.set_index("cell_id").reindex(adata.obs_names)
    meta["assay"] = assay_tag
    adata.obs = adata.obs.join(meta, how="left")
    return adata

# mouse_rna = load_one_assay("cell_metadata", "mouse_mop_matrix.h5", "scRNA-10x")
# mouse_rna = qc_subset(mouse_rna)          # 复用上方 QC 函数
# 说明:真实 cell_id 命名与 QC 请以档案说明为准;这里给出结构参考而非可对任意档案直接跑通的承诺。

关键纪律:合并前先 drop_duplicates(subset="cell_id")reindex 到表达矩阵的细胞顺序,避免行错位导致的标签错配——这是单细胞流水线最常见且最难排查的错误之一。

§6.4 PyTorch DataLoader

构建细胞分类任务(以 cell_type 为标签)的可运行 Dataset。数据规模大,推荐用按需读取的表达切片与供体分组,避免整矩阵载入内存。

import torch
from torch.utils.data import Dataset, DataLoader

class CellTypeDataset(Dataset):
    """从元数据+表达矩阵读取细胞,返回(表达向量, 细胞类型标签)。
    假设已有 scanpy AnnData(adata.X 为预处理后稀疏矩阵),cell_type 存于 obs。
    做供体分组用 GroupKFold 时,obs 须含 specimen_id。"""
    def __init__(self, adata, label_key="cell_type", type_to_idx=None):
        self.X = adata.X            # 稀疏或稠密
        self.y = adata.obs[label_key].values
        if type_to_idx is None:
            self.type_to_idx = {t: i for i, t in enumerate(sorted(set(self.y)))}
        else:
            self.type_to_idx = type_to_idx
        self.idx_arr = np.arange(self.X.shape[0])

    def __len__(self):
        return self.X.shape[0]

    def __getitem__(self, i):
        row = self.idx_arr[i]
        x = torch.as_tensor(self.X[row].toarray().squeeze(), dtype=torch.float32) \
            if hasattr(self.X[row], "toarray") else torch.as_tensor(self.X[row], dtype=torch.float32)
        y = self.type_to_idx[self.y[row]]
        return x, y

# 使用示例(adata 来自 §6.3 预处理)
# ds = CellTypeDataset(adata)
# loader = DataLoader(ds, batch_size=256, shuffle=True, num_workers=4)
# xb, yb = next(iter(loader))
# print("batch 形状:", xb.shape, "标签形状:", yb.shape)

大规模内存建议:用 csr_matrix 稀疏存储 + 小 batch 逐块读取;供体数少的人类数据务必用 GroupKFold(sklearn.model_selection.GroupKFold),切勿细胞级随机切分(见 §5.3)。

§6.5 坑点 8 个

以下 8 个坑点取自 BICCN 的联盟级数据形态(多档案、多 assay、跨物种、多模态、开放/受控分级)所特有的失败模式,而非泛化清单。它们按影响贯穿"数据理解(坑点 2、8)→ 划分与泄漏(坑点 1、3)→ 预处理与批次(坑点 4、5)→ 工程与合规(坑点 6、7)"四个环节,多数在真实单细胞流水线中极难事后排查,建议在项目开始时即规避。

⚠️ 坑点 1:把"细胞数"当成"独立样本数"做随机切分(分类:数据泄漏)

问题:同一供体/标本的成千上万细胞高度相关(取材、批次、细胞组成),按细胞随机 split train/valid 会把同一标本的细胞同时塞进两边,导致验证指标虚高、部署泛化崩盘。
症状:训练/验证 AUROC 都逼近 1,但在外部新供体上精度骤降。
解决

  1. 简单方法:改用按 specimen_id/donorGroupKFold,保证任一样本的细胞只出现在单侧。
  2. 进阶方法:把供体作为随机效应做分层(如 batch 列传入集成算法),并在论文中同时报告"组内"与"组间(leave-one-donor-out)"两套指标。
  3. SOTA 方法:跨供体/跨物种迁移评测作为最终泛化证据,纳入置信区间。
    参考https://www.ncbi.nlm.nih.gov/pmc/articles/PMC8494634/(主论文章的方法学与批次表述)

⚠️ 坑点 2:把"整合后类型数"当成唯一权威分类(分类:标签理解)

问题:BICCN 明确表示人类/小鼠运动皮层细胞类型数随分组标准从几十到 100+ 波动(127 或 130 或 100 都对,取决于聚类分辨率)。若把单一数字或单一注释表当 gold standard,会掩盖分类的不确定性。
症状:不同论文/档案的类型数不一致(如 56 vs 90 vs 116 神经元类型),用户困惑该信哪个。
解决

  1. 简单方法:在元数据中保留层级字段(class/subclass/type)而非只取最细 type,报告时声明使用哪一级粒度。
  2. 进阶方法:用聚类稳定性/分辨率扫描(如 scanpy 的 resolution sweep)展示谱系,把"连续体细胞"标注出来而非硬切。
  3. SOTA 方法:做多解析度 + 多模态一致性评测,以跨模态复现(如电生理是否吻合)决定粒度。
    参考https://news.sciencenet.cn/htmlnews/2021/10/466543.shtm(类型数随标准波动的公开报道)

⚠️ 坑点 3:跨模态关联被误当成同细胞观测(分类:评估误用 / 数据泄漏)

问题:除 Patch-seq 的"同一细胞多模态"外,绝大多数 scRNA 与电生理/形态/MERFISH 数据来自不同细胞;SCF/LIGER 生成的是统计性跨模态映射。若把映射输出当独立同细胞证据用于"一致性验证",会循环论证、夸大一致性。
症状:宣称"转录组与电生理完美一致",实则是同一批推断循环。
解决

  1. 简单方法:区分"同细胞观测"(Patch-seq 细胞子集)与"统计映射",只对真正同细胞子集算逐细胞一致性。
  2. 进阶方法:跨模态评测用独立采样与置换检验,报告效应量与显著性。
  3. SOTA 方法:以留出细胞/留出模态做验证,避免把整合算法输出当 ground truth。
    参考https://doi.org/10.1038/s41586-021-03950-0(主论文章对跨模态一致性的表述)

⚠️ 坑点 4:忽略不同 assay/平台的批次效应直接合并(分类:预处理陷阱)

问题:10x、SMART-Seq 与 snRNA 平台在 dropout、灵敏度、双细胞率上差异巨大;小鼠/人类前缀(mt-/MT-)与基因命名(Ensembl vs symbol)也各异。直接合体会生成以平台为界的伪聚类。
症状:UMAP 上细胞按 assay 成团而非按细胞类型,分类模型学的是平台指纹。
解决

  1. 简单方法:各 assay 先单独过滤(线粒体阈值、min_genes),再 normalize + log1p 后才整合。
  2. 进阶方法:用 Harmony/scanorama/BBKNN 以 assay 为 batch 校正;基因命名统一到 symbol。
  3. SOTA 方法:复现 SCF/LIGER 跨模态整合框架并做批次置换检验。
    参考https://www.nature.com/immersive/d42859-021-00067-2(BICCN 多平台数据统计)

⚠️ 坑点 5:跨物种直接套用小鼠基因集/标记到人类(分类:偏倚陷阱)

问题:人类运动皮层存在大量物种特化谷氨酸能类型与差异基因(如转录因子表达差异),小鼠 marker 未必在人类对应类型中特异。
症状:用小鼠 marker 列表给人类细胞打标签时大量无法分型或误分,跨物种 AUROC 虚高/偏低失真。
解决

  1. 简单方法:先做物种正交化(只保留 1:1 直系同源基因并统一命名),再比较。
  2. 进阶方法:以跨物种保守类型(45 个)为对照锚点,把物种特化类型单独建模。
  3. SOTA 方法:用图谱级对齐(标注 + 迁移)后做细胞类型同源匹配,并对物种差异基因做专项分析。
    参考https://www.nature.com/articles/s41583-021-00541-w(跨物种保守性与特化表述)

⚠️ 坑点 6:人类数据开放 vs 受控不分,误当全部开放可下载(分类:工程陷阱 / 合规)

问题:只有"开放同意"的人类样本走 CC BY 4.0 开放;未获开放同意的人类数据须经 NIMH Data Archive/NeMO 受控申请。混淆二者会导致合规风险或下载失败。
症状:按开放数据集处理人类受控数据,触发使用限制或审批缺失。
解决

  1. 简单方法:下载前在 biccn.org 数据目录核对每个数据集 “release status / terms of use”。
  2. 进阶方法:对受控数据走正式申请并签署 DUA,遵守禁止重识别条款。
  3. SOTA 方法:项目内做数据分类矩阵(开放/受控/边界样本),发布前逐条合规审查。
    参考https://biccn.org/data(各档案访问流程);https://biccn.org/terms-of-use(许可条款)

⚠️ 坑点 7:空间与注释数据类型异构,误用单一解析器(分类:工程陷阱)

问题:BICCN 数据跨 NeMO/BIL/DANDI/BossDB 四大档案,格式从 HDF5/CSV 到影像栈到 NWB 电镜体积各不相同;"下载一个包就能跑"并不存在。
症状:代码在某种 assay 上跑通,换档案或换模态立刻崩溃。
解决

  1. 简单方法:先明确目标是哪种模态/档案,用官方可视化(cellxgene/NeMO Analytics)先探明格式。
  2. 进阶方法:按模态分别写适配器,统一转成 AnnData/h5adNWB 后再合并。
  3. SOTA 方法:用 BICCN 的 Terra/标准化 pipeline 与社区标准(NWB、BIDS、h5ad)做端到端可复现分析。
    参考https://www.biorxiv.org/content/10.1101/2022.10.26.513573v1.full.pdf(BICCN 数据生态用户指南)

⚠️ 坑点 8:把细胞类型参考图谱当疾病患病率/临床诊断数据(分类:标签理解 / 偏倚陷阱)

问题:BICCN 是正常与基础脑区细胞普查,不是疾病队列,不含患病率、预后或个体诊断标签。用它训练"分类健康 vs 患病"或做临床决策会构成类别性误用。
症状:用户试图加装疾病标签后模型无意义或产生误导性结果。
解决

  1. 简单方法:明确其用途为"参考基线/机制研究",疾病相关结论需另配真实患者队列。
  2. 进阶方法:把 BICCN 用作"正常对照"与疾病单细胞数据做差异细胞组成分析,而非直接打患病标签。
  3. SOTA 方法:采用严谨的差异丰度/伪 bulk 设计,纠正细胞组成与批次混杂后再做疾病关联推断。
    参考https://www.nimh.nih.gov/news/science-updates/2021/nih-brain-initiative-unveils-detailed-atlas-of-the-mammalian-primary-motor-cortex(NIH 对研究用途的官方定位)

§6.6 数据增强

安全 ✅:细胞类型不平衡时做类别加权/下采样;跨 assay 用 Harmony 等做稳健化;对表达矩阵做随机 dropout 掩码模拟测序噪声以训练自编码器鲁棒性;多模态缺失模态用跨模态插补(如 SCF)作输入增强(仅限统计推断,不作同细胞证据)。

危险 ❌:对 scRNA 做随机翻转/旋转(无空间意义);引入不存在的基因或用同源基因随机替换制造假多样性;对已被 QC 丢弃的低质量细胞重采样作为"新数据";把 MERFISH 空间坐标做违背解剖结构的任意平移当作增强。

增强操作用法速查

操作 是否安全 说明
类别下采样/加权 安全 缓解长尾类型不平衡
表达随机 dropout 掩码 安全 模拟测序噪声,适合自编码器鲁棒性
Harmony/SCF 跨模态插补缺失模态 安全(统计推断内) 勿把插补当同细胞实测
随机翻转/旋转 scRNA 危险 单细胞无空间对称性,引入假结构
同源基因随机替换造多样性 危险 制造伪信号、破坏生物语义
重采样 QC 丢弃细胞当新数据 危险 把噪声当真实,污染标签

增强哲学:单细胞数据的"增强"应尊重测量与生物结构——只在有意义的轴上引入变化(技术噪声、类别失衡、缺失模态),而绝不能引入生物学上不存在的自由度(随机空间变换、伪基因)。

§6.7 模型推荐

任务 推荐方法 理由 关键工具
细胞类型聚类 Leiden/Louvain + 多分辨率扫描 社区标准、可复现 scanpy、Seurat
跨模态/跨物种整合 SCF、LIGER、Harmony BICCN 论文验证 SCF/LIGER;Harmony 便于批次校正 harmonypy、rliger、SCF
细胞类型分类(监督) 浅层 MLP/LogReg on PCA/embedding 在降维嵌入上效果好、可解释 sklearn、PyTorch
跨物种同源匹配 标注对齐/迁移、图谱级 mapping 处理 1:1 直系同源与特化类型 Azimuth、scArches
空间/表型关联建模 图神经网络、GNN on graph 编码空间自相关与邻近交互 PyTorch Geometric
批量/细胞组成反卷积 反卷积 / 组成差异分析 病-正常比较时校正细胞组成 MuSiC、CARD、Milo
标注迁移到新数据 标签传播 / 图谱标注(label transfer) 复用已有图谱做新数据自动标注 scArches、Azimuth、scANVI
表征学习/预训练 单细胞自监督 / 基础模型 学习基因-细胞通用表示 scBERT、scGPT、Geneformer 等

选型提示。 监督分类/标注迁移通常不直接吃原始高维稀疏表达,而是先做 PCA 或图谱预训练嵌入,再在其上训练线性/浅层模型——既省算力又更鲁棒、可解释。跨物种任务务必限定在 1:1 直系同源基因上(见坑点 5),且以保守类型为锚点;如果目标是做疾病比较,则 BICCN 只提供正常基线,最终分析需引入真实患者数据(见坑点 8)。

§6.8 硬件需求

任务规模 内存 存储 加速 备注
勘探/可视化(cellxgene/Azimuth) 8-16 GB 数 GB 云端即可
小鼠 MOp 单 assay 分析 32-64 GB 数十 GB CPU 数十万细胞
跨物种多 assay 整合 128 GB+ 数百 GB GPU(PCA/embedding)可选 >百万细胞
全量 NeMO 训练基础模型 高内存节点 241.3 TB(全量) 多 GPU 需分批 + 云端 Terra

本地 vs 云端的取舍。 绝大多数"跑通一个分类模型"的任务,小鼠单 assay(数十万细胞)在 32-64 GB 内存的本地机器即可完成;只有做全量跨物种整合或预训练基础模型才需要云端/集群。241.3 TB 的全量 NeMO 数据不建议本地常驻,优先用 Terra/AnVIL 云端的标准化环境做分布式处理(见 §6.10)。稀疏矩阵(scipy.csr)能显著降低内存占用,推荐全程使用。

§6.9 评估指标

import numpy as np
from sklearn.metrics import adjusted_rand_score, normalized_mutual_info_score, accuracy_score

# 聚类 vs 参考标注
def cluster_metrics(true_labels, pred_labels):
    return {
        "ARI": round(adjusted_rand_score(true_labels, pred_labels), 4),
        "NMI": round(normalized_mutual_info_score(true_labels, pred_labels), 4),
    }

# 监督分类在 GroupKFold 留出供体上的宏观准确率/宏 F1(务必组间评测)
def report_acc(y_true, y_pred):
    return {"accuracy": round(accuracy_score(y_true, y_pred), 4)}

# 跨模态"同细胞"一致性(仅用于 Patch-seq 同细胞子集)
# 建议配合置换检验报告显著性;对统计映射输出勿当同细胞一致性重复计数。
print("推荐报告:留供体(out-of-donor) ARI/NMI/宏F1 + 每类 marker 命中率。")
# GroupKFold 留供体评估(监督分类任务的标准做法)
import numpy as np
from sklearn.model_selection import GroupKFold
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import f1_score, balanced_accuracy_score
from sklearn.decomposition import PCA

def evaluate_out_of_donor(X, y, groups):
    """X: 细胞级特征(建议用已降维/嵌入后的稠密特征),y: 类型标签(整数),groups: 供体 id"""
    scores_f1, scores_bacc = [], []
    gkf = GroupKFold(n_splits=5)
    for tr_idx, va_idx in gkf.split(X, y, groups):
        clf = LogisticRegression(max_iter=2000)
        clf.fit(X[tr_idx], y[tr_idx])
        yp = clf.predict(X[va_idx])
        scores_f1.append(f1_score(y[va_idx], yp, average="macro", zero_division=0))
        scores_bacc.append(balanced_accuracy_score(y[va_idx], yp))
    return {"macro_F1": np.mean(scores_f1), "balanced_acc": np.mean(scores_bacc)}

# X = pca_embedding  # 例如 PCA 前 50 维(来自 §6.3 预处理的 adata.obsm['X_pca'])
# y = adata.obs['cell_type'].map(label_map).values
# groups = adata.obs['specimen_id'].values
# print(evaluate_out_of_donor(X, y, groups))

评估纪律重申:只报告"留供体(out-of-donor)"的组间指标;宏 F1 比准确率更能反映类别不平衡;把低置信/Other/连续体细胞作为独立类别,避免删除后虚高。聚类任务沿用 §6.9 上方的 ARI/NMI。

评测纪律:聚类用 ARI/NMI;监督分类用宏 F1/ACC;必须留供体做组间验证;低置信/Other 细胞单独成类评估。禁止只用随机切分指标宣称 SOTA。

§6.10 MLOps 笔记

  • 数据版本与溯源:BICCN 数据跨多档案与多次发布,务必记录数据集的 landing page DOI、档案版本与下载时间;用数据版本清单(含 assay、QC 阈值)锁定可复现输入。
  • 环境:scanpy/Seurat 版本会显著影响聚类;建议固定 conda/pip 锁文件,记录 scanpy 与 h5py 版本。
  • 批次登记:把 donor/specimen/assay/中心作为列全程保留,作为随机效应与泄漏审计依据。
  • 缓存与增量:241.3 TB 全量不现实地反复下载,用档案的 S3/Globus 增量同步并做本地缓存校验(checksum)。
  • 合规门槛:人类受控数据纳入 DUA 与访问日志审计;发布物仅使用 CC BY 4.0 开放部分时仍须致谢原始生产实验室。
  • CI 基线:为聚类结果建立黄金子集回归测试,任何代码/依赖升级后跑回归,防止无意的标签漂移。

部署前五问清单(把"能跑"推进到"可信地跑"):

问题 若不回答会怎样 最小行动
我锁定了数据版本与 landing page 吗? 复现漂移、评审质疑 记录 DOI + 下载时间
我的 QC 阈值与 assay 可复现吗? 细胞数与组成不可比 版本清单记录阈值
我的划分尊重 donor 分组吗? 验证指标虚高 用 GroupKFold by donor
我声明了分类粒度与低置信细胞吗? 无法与其他工作比较 明确 type/subclass/class
我的合规边界(开放/受控)清楚吗? 合规与重识别风险 数据分类矩阵 + DUA 审计

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
物种取样不对称 小鼠细胞量级 > 狨猴/人类,跨物种比较深度不均 用保守类型锚点做平衡比较,报告统计功效
人类供体非随机 死后/手术样本来源不均一,年龄、死因、机构混杂 中高 回溯 Methods,按供体分层并控制协变量
平台/批次效应 多 assay 多平台引入技术伪差 中高 按 assay 过滤+批次校正(Harmony/SCF),留供体验证
脑区聚焦偏置 主成果集中于运动皮层,非全脑泛化 需外推时用全鼠脑图谱/其他脑区数据
类型数不确定 类型粒度随聚类标准波动 保留多层级标注,声明所用粒度
标注共识依赖 类型命名依赖专家共识与跨中心协调 用跨模态复现与标记基因验证

§7.2 标注质量

标注基于无监督聚类 + 多模态交叉验证 + 专家判读,非单一人工标注。主论文章采用跨平台/跨 assay 的复现率评估(如 10x vs SMART-Seq、单细胞 vs 单核),以 AUROC 等指标定量验证类型可复现性;MERFISH 空间归属与 Patch-seq 表型作为独立验证通道。质量控制的强度是 BICCN 相对单组图谱的重要优势,但标注仍为共识性而非绝对 gold standard。

如何用标记基因快速做"标注 sanity check":拿到注释后,可抽查经典神经/细胞类型 marker 是否落在预期类型中,作为标签质量的低成本验证:

预期细胞大类 常用 marker(示意) 若出现偏差
兴奋性(谷氨酸能) Slc17a7(VGlut1) 检查是否混入非神经元
抑制性(GABAergic) Gad1 / Gad2 检查亚型是否错分
少突胶质 Mbp / Olig1 非神经元是否被归并
小胶质 Cx3cr1 / P2ry12 免疫细胞是否混入神经元簇
内皮/血管 Pecam1 取材污染信号是否被清洗

说明:具体 marker 与阈值以你下载的数据版本与官方聚类为准,此处仅供快速抽查;跨物种时 marker 命名(大写/前缀)需统一(见坑点 5)。

§7.3 泛化性

泛化场景 失效风险 证据/缓解
小鼠 MOp → 小鼠其他脑区 中(皮层 vs 皮层下差异大) 用全鼠脑图谱(2023)验证运动皮层类型在其他脑区的存在性
小鼠 → 人类 中高(物种特化谷氨酸能类型、基因命名差异) 用 45 个保守类型做跨物种锚点,特化类型单独建模
运动皮层 → 疾病比较 中(无疾病状态样本) 仅作正常基线,疾病需配真实患者单细胞数据
不同 assay → 部署 中(平台指纹) 跨 assay 留出验证 + 批次校正

泛化的诚实边界:BICCN 运动皮层普查并非全脑图谱——它被设计为"把方法跑通的样板",其直接结论严格限于 MOp/M1。当任务要求全脑或跨脑区泛化时,应优先迁移到 2023 全鼠脑图谱或补充其他脑区数据;当任务要求人类疾病外推时,需清醒认识人类样本的非随机性(以死后/手术组织为主)与跨物种基因表达差异,避免把"运动皮层中保守的 45 个类型"当作"整个人类大脑都如此"。所有跨物种结论应报告"保守类型表现"与"特化类型表现"两条线(见坑点 5)。

§7.4 伦理

人类样本经知情同意与机构伦理管理;数据按开放/受控分级发布,未获开放同意的人类数据不开放以免重识别风险。BICCN 数据作为"正常脑细胞参考"研究用途清晰,NIH 官方定位为加速脑疾病机制研究与潜在精准治疗的基础资源。本条目涉及死后/手术脑组织样本,须尊重供体尊严与知情同意边界。

伦理要点补充:(1) 人类脑组织属于高敏感生物样本,其获取须有明确知情同意,样本用于本研究外的二次使用须符合原同意范围与机构伦理;(2) 开放/受控分级是伦理落地的技术机制——"开放同意"的样本才可开放分发,其余走受控审批,规避通过序列/表型重识别供体的风险;(3) 本条目不鼓励在未获相应伦理与知情同意的前提下,将 BICCN 人类数据与患者临床数据任意拼接;(4) 使用应服务于正当科研与医学进步,避免将正常脑组织参考数据用于有悖于供体意愿的目的。

§7.5 公平性

非临床决策数据集,传统"公平性"(按人群子群预测误差)不完全适用。相关关注点是供体异质性与跨物种外推是否被夸大——在论文/报告中应避免用小鼠数据过度外推人类结论,避免把单一物种单一脑区的发现描述为普遍规律。

可以类比"公平性"的三点自查:(1) 供体代表性——人类样本是否覆盖足够多样的人群,还是集中于特定年龄/来源,若研究声称"人类大脑通常……",需评估样本代表性;(2) 物种代表——把小鼠结论当人类结论是否越界,跨物种分析应只就"保守类型"做强陈述;(3) 脑区代表——运动皮层结论是否被错误宣传为全脑普遍规律。做法上:凡做人群/物种/脑区层面的强论断,应报告样本构成与范围上限,并优先用全鼠脑图谱、人类/NHP 图谱等更大范围数据佐证。

§7.6 数据漂移

BICCN 数据随时间追加新 assay、新物种与新脑区(2018 → 2021 运动皮层 → 2023 全鼠脑),标注与分类学亦演化。用早期版本训练再部署到新版本数据时,类型名与分类粒度可能已变(如从"56 神经元类型"走向更细/更全的分类)。建议固定数据版本并做标签迁移评估。

漂移的具体形态:(1) 类型粒度变细——2021 运动皮层以"56 神经元类型"为常用粒度,2023 全鼠脑把类型细化为"34 类/338 亚类/1,201 超型/5,322 簇"的四级层次;(2) 覆盖范围扩大——从单脑区扩展到全脑,早期"只在 MOp 定义的类型"需在全脑框架中重新核对归属;(3) 标注口径更新——随整合方法(SCF/LIGER/Harmony)与新数据,同名的 subtype 成员可能微调。应对方法是:把版本号作为数据的显式特征参与建模与报告,训练与评估使用同一版本;跨版本迁移时先做"标签映射 + 保留层次"的兼容层,而不是假定旧标签在新数据上仍逐一对齐。

§7.7 DAIMS 24 项检查表

# 检查项 状态 说明
1 宽格式数据 每细胞/核一条记录的元数据 + 表达矩阵,结构清晰
2 唯一标识 cell_id 为唯一键;供体/标本亦给标识
3 特殊字符 数据本体为英文 ASCII 为主,marker 基因名规范
4 重复行 ⚠️ 跨档案/跨论文有重复发布;需以 landing page 为权威去重
5 缺失编码 ⚠️ 模态缺失常见(信息性),需显式区分,避免 0/-1 隐式编码
6 标签标识 提供 class/subclass/type 层级标注与 marker genes
7 罕见类分组 ⚠️ 极小细胞类型存在,需做低丰度归并/单独评估
8 偏倚评估 主论文章讨论跨物种/批次与类型不确定性
9 数据字典 ⚠️ 各档案有元数据说明,但无全联盟统一 SQL 字典
10 信息性缺失解释 多模态缺失为采样设计所致(见 §4.5)
11 设备记录 assay/平台列齐全(10x/SMART/snmC/snATAC 等)
12 共线性 ⚠️ 基因高度共表达,需 PCA/去批处理降维
13 编码映射 ⚠️ 物种间基因命名/Ensembl-symbol 需统一
14 时间戳处理 ⚠️ 发布/下载时间需记录以锁版本
15 划分建议 官方按物种/assay/脑区分组;社区 GroupKFold by donor(见 §5)
16 泄漏讨论 §5.3 详述供体/多模态/空间泄漏
17 标签分布 ⚠️ 需按下载注释自统计,不套用论文图
18 测量偏倚 ⚠️ 平台 dropout/双细胞率差异为系统性测量偏倚
19 外部验证建议 §5.5 提供跨 assay/跨物种/全鼠脑外部验证
20 版本记录 数据分层 Level 0-4 + 多次发布可追溯
21 预处理脚本 ⚠️ 官方 Terra/标准化 pipeline 存在,但本地一键脚本需自建
22 合规要求 CC BY 4.0 + 人类受控数据 DUA(见 §6.5 坑点 6)
23 多模态对齐 cell_id→类型→空间/表型对齐逻辑清晰(见 §4.4)
24 去标识化 开放数据为去标识化汇总级图谱;受控数据禁重识别

DAIMS 评分:18.5 / 24

评分解读:BICCN 在 FAIR 开放、唯一标识、去标识化、多模态对齐与外部验证建议上达到顶级参考图谱水准;扣分集中在"非单一包、跨档案异构、无统一 SQL 字典与一键本地脚本"这类工程化可及性问题,以及"类型数随标准波动、需用户自统计分布"的标注模糊性。这些都不是数据质量问题,而是分布式联盟大规模数据的固有工程形态。

对你意味着什么:做研究可以直接信任其分类标注并用多模态标签交叉验证;但要把它当成"需自己组装与锁版本"的参考资源,而不是开箱即用的 ML benchmark。落地建议:(1) 严格按 donor 做 GroupKFold 并留供体出外部验证;(2) 固定数据版本、记录 QC 阈值与 assay;(3) 遵守开放/受控分级,勿把受控人类数据当开放数据处理;(4) 对连续体细胞做单独评估,声明所用分类粒度;(5) 疾病相关结论必须引入真实患者队列,勿直接在本图谱上加装疾病标签。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
全鼠脑图谱运动皮层子集(2023) Allen Institute / BICCN-BICAN 转录组细胞类型在皮层其他区域的存在性验证 层级分类学匹配 运动皮层类型在全脑框架内整体一致 背/腹脑区组织二分、转录因子 code 决定细胞身份
跨 assay 复现(10x vs SMART-Seq、单细胞 vs 单核) BICCN 各实验室 类型可复现性 AUROC/复现率(主论文章) 高度复现 转录组类型在多平台稳健
MERFISH 空间归属 哈佛/庄小威实验室 独立模态验证转录组聚类 空间-分子一致性 相互印证 多数类型具层状组织
Patch-seq 同细胞 BICCN 多实验室 转录组-电生理-形态一致性 表型-分子对应 分子类型在表型上吻合 为分子定义类型提供生物学有效性证据

上表仅收录已发表且有同行评审/论文支撑的验证结果,数值以对应论文为准,未列出的非经核验指标不纳入。

§7.9 可复现性清单与质量小结

BICCN 作为联盟级数据,其质量最终取决于"用户能否用清楚的口径重算出别人发布的结论"。建议在每次分析中留存以下可复现信息:

记录项 说明 对应风险(坑点)
数据 landing page / DOI + 下载时间 锁定数据版本,防跨版本漂移 坑点 2 / §7.6
QC 阈值(min_genes、线粒体、双细胞) 决定最终细胞数与组成 坑点 4
assay 构成与是否去批 平台效应归属 坑点 4
分类粒度(type/subclass/class) 决定类型数与比较 坑点 2
划分方式(donor group/随机) 决定指标可信度 坑点 1
基因命名/直系同源过滤 跨物种可比性 坑点 5
开放 vs 受控声明 合规边界 坑点 6

质量小结:BICCN 的最大优势是多模态、多中心、多物种的交叉验证带来的高标注可信度;最大使用成本是去中心化数据形态带来的组装与版本负担。把它当作"参考图谱"而非"现成 ML 基准"来使用,就能同时享受其生物学严谨性与工程灵活性。


§8 基准与生态

§8.0 为什么这里没有传统排行榜

与图像/文本基准数据集不同,BICCN 是开放参考图谱而非"固定 train/test + 排行榜"的 ML 基准。原因有三:(1) 它是普查性数据,目标是被社区反复再分析而非被单一指标竞赛;(2) 类型数与标注随聚类粒度变化,无法定义一个跨方法稳定统一的"准确率";(3) 官方没有提供预切分的 train/valid 集。因此本节的"代表性工作"展示的是方法学里程碑与生态影响,而非可排序的分数——任何声称在该数据上"刷新 SOTA 精度"的报告,都必须说明其所用的细胞集、assay、划分方式与类型粒度(见 §8.3 评测协议),否则其数字不具有可比较性。

§8.1 相关评测与代表性工作

BICCN 不是带统一排行榜的 ML benchmark,但主论文章中的方法学结论常被当作细胞类型整合/分类的参考基线。以下为若干代表性方法学与生态工作:

排名/角色 方法/成果 性能/结论 年份 关键技术 完整引用 代码
旗舰整合框架 BICCN 跨模态整合(SCF/LIGER) 得出 56 整合神经元类型(对应 90 转录组类型),跨模态高一致 2021 SCF、LIGER 多模态映射 BRAIN Initiative Cell Census Network, 2021, Nature 598:86-102. doi:10.1038/s41586-021-03950-0 NeMO Analytics / BICCN 工具集
小鼠 MOp 转录表观图谱 Yao et al. 转录组+表观组图谱 >50 万细胞,56+ 神经元类型的系统表征 2021 多 assay 整合 + 复现性统计 Yao Z. et al., 2021, Nature 598:103-110. doi:10.1038/s41586-021-03500-8 NeMO / cellxgene
跨物种比较 Comparative motor cortex analysis 人/狨猴/小鼠 45 万+ 细胞比较、45 保守类型 2021 跨物种转录组学 Bakken T.E. et al., 2021, Nature 598:111-119. doi:10.1038/s41586-021-03465-8 跨物种浏览器
MERFISH 空间图谱 小鼠 MOp 空间细胞图谱 ~30 万细胞、95 簇空间组织 2021 MERFISH Zhang M. et al., 2021, Nature 598:137-143. doi:10.1038/s41586-021-03741-x cellxgene
Patch-seq 表型变异 Phenotypic variation of t-types in mouse motor cortex 形态-电生理-转录组同细胞层级 2021 Patch-seq Scala F. et al., 2021, Nature 598:144-150. doi:10.1038/s41586-021-03971-9 Neuromorpho / DANDI

说明:上表性能列以"结论/方法学结果"而非统一数字呈现;各方法使用不同细胞集与标准,数值不可直接横向比较。BICCN 的价值更在于作为统一分类参考,而非在单一指标上排名。

§8.2 SOTA 总结与选型建议

当前"细胞类型图谱"的 SOTA 形态已从单一脑区演进到全脑 + 跨物种 + 多模态:BICCN 运动皮层普查确立了方法框架,2023 全鼠脑图谱(>5,300 类型、4 级层次)将之推广到全脑,BICAN 正延伸至人类与非人灵长类。选型建议:研究运动皮层/方法学验证用 2021 运动皮层普查;需全脑广度用 2023 全鼠脑图谱;做人类细胞易损性/疾病转化用人类与 NHP 图谱(2023)。

§8.3 评测协议

  • 聚类:ARI/NMI(见 §6.9);以多分辨率 + 跨模态复现评估粒度稳健性。
  • 分类(监督):GroupKFold by donor 的宏 F1/ACC;报告 out-of-donor 结果。
  • 跨物种:用保守类型锚点做匹配,报告物种特化类型占比。
  • 报告规范:声明所用分类粒度(type/subclass/class)、QC 阈值、assay 构成与数据版本(landing page DOI)。

§8.4 相关数据集

数据集 类型 与 BICCN 的关系/差异
Allen Brain Cell Atlas / 全鼠脑图谱 全鼠脑单细胞+空间 BICCN 全脑里程碑,在线可视化;运动皮层类型在其中验证
Human Cell Atlas(脑子集) 人体全身多组学 更广人体范围,非普查性、跨脑区深度较低
BICCN 人类/NHP 细胞图谱(2023) 人+非人灵长类多脑区 BICCN 的人类/灵长类延伸,为 BICAN 铺路
脑区专项 scRNA 图谱 单组研究 单/少脑区、少多模态交叉验证,可作补充
Brain Initiative 单模态专项(如 Patch-seq/NHP) 方法专项 与 BICCN 普查互补,聚焦某一技术细节
NeMO 上其他 BRAIN 项目单细胞数据 单细胞组学 同为 BRAIN 生态,可做跨项目整合与复现

对比启示:与"专项但单组"的 scRNA 图谱相比,BICCN 的不可替代性在于"同一脑区被多模态交叉验证 + 多物种统一分类 + 遗传工具成套"。代价是数据量巨大、需自行装配;因此当研究仅需"某个脑区的表达矩阵"时,专项图谱往往更轻量,而当需要"可靠的细胞类型定义 + 跨物种 + 环路/形态"时 BICCN 才是首选。

§8.5 关键论文 Top 10

  1. BRAIN Initiative Cell Census Network (BICCN), 2021, Nature 598:86-102. doi:10.1038/s41586-021-03950-0 — 旗舰:哺乳动物运动皮层多模态细胞普查与图谱总纲。
  2. Yao Z. et al., 2021, Nature 598:103-110. doi:10.1038/s41586-021-03500-8 — 小鼠 MOp 转录组+表观组细胞图谱与计算整合方法。
  3. Bakken T.E. et al., 2021, Nature 598:111-119. doi:10.1038/s41586-021-03465-8 — 人类、狨猴与小鼠运动皮层比较细胞学分析,确立跨物种保守性。
  4. Zhang M. et al., 2021, Nature 598:137-143 — 小鼠 MOp MERFISH 空间分辨细胞图谱。
  5. Scala F. et al., 2021, Nature 598:144-150 — Patch-seq 揭示小鼠运动皮层转录组类型表型变异。
  6. Yao Z. et al., 2023, Nature (whole mouse brain) doi:10.1038/s41586-023-06812-z — 全鼠脑高分辨率转录组+空间图谱(>5,300 类型)。
  7. Ecker J.R. et al., 2017, Neuron 96:542-557. doi:10.1016/j.neuron.2017.10.007 — BICCN 前期:共识文件确立生成全面脑图谱的路径。
  8. BRAIN Initiative Cell Census Network Data Ecosystem, bioRxiv 2022. doi:10.1101/2022.10.26.513573 — FAIR 数据生态用户指南,Level 0-4 与档案体系。
  9. Zeng H. & Sanes J.R., 2017, Nat Rev Neurosci 18:530-546. doi:10.1038/nrn.2017.85 — 神经元类型分类挑战与路径前瞻。
  10. Winnubst J. & Arber S., 2021, Nature — 观点文章(census of cell types in the brain’s motor cortex),配套解读普查方法论。

如何用这些论文做技术选型:新手从第 1、2、8 篇入手最经济——第 1 篇建立全貌与分类框架,第 2 篇给出小鼠 MOp 转录/表观整合的方法与数据,第 8 篇讲清如何获取与使用数据生态。做跨物种比较精读第 3 篇;做空间/表型整合分别看第 4、5 篇;需要全脑上下文再看第 6 篇;理解"为何要普查细胞类型"的概念背景读第 7、9 篇。逐篇精读不必一次读完,按你的模态与任务挑对应的 companion paper 即可。

§8.6 社区活跃度

BICCN 数据被广泛用于后续单细胞研究、跨物种工具开发与神经科学 AI 方法评估。2021 Nature 运动皮层专集与 2023 全鼠脑图谱均属高影响力成果,被 Nature Reviews、NIH 新闻等持续引用;BICAN 延续联盟并在 biccn.org / brain-bican.org 发布数据集与研讨会,社区访问活跃(NeMO BICCN 数据截至 2021-09-28 已被下载 478.3 TB)。具体引用计数随数据库更新,请以各检索平台当日数值为准。

§8.7 生态快照表

资源 类型 链接 推荐理由
BCDC 数据目录 门户/检索 https://biccn.org/data 官方数据集发现与访问入口
Nature 沉浸专包 综述 https://www.nature.com/immersive/d42859-021-00067-2 运动皮层普查全貌与工具概览
NeMO Analytics 云端分析 https://nemoarchive.org/ 免本地处理浏览/分析单细胞
cellxgene / Azimuth 可视化 https://cellxgene.cziscience.com/ 交互查看注释与标记基因
Allen Brain Cell Atlas 全鼠脑浏览 https://alleninstitute.org/ 2023 全鼠脑图谱可视化
brain-bican.org BICAN 门户 https://brain-bican.org/ BICCN 后续人类/灵长类图谱
BIL 图像档案 影像 biccn.org/data 脑影像/原位图下载与围场
DANDI 神经生理 biccn.org/data NWB 电生理下载
Terra/AnVIL 云端计算 biccn.org/data BICCN 标准化可复现管线
Brain Cell Methylation Viewer 表观可视化 biccn.org/data 甲基化图谱浏览
Mouse CCF 空间坐标系 解剖参考 biccn.org/data 小鼠数据空间锚定

社区生态结论:BICCN 的开放与 FAIR 基础设施使其数据被大量下游工具与图谱吸收(如全鼠脑图谱、Allen Brain Cell Atlas),形成"一次普查、多方复用"的生态正循环。新进入者应优先从官方可视化与云端工具起步,降低本地装配成本(见 §6.0、§6.2)。


§9 相关资源与引用

§9.1 官方资源

下载入口决策速查

想找什么 首选入口 备选
运动皮层普查的注释矩阵/工具 biccn.org/cell-census-primary-motor-cortex NeMO Analytics
跨物种/跨 assay 整合数据 biccn.org → Data Catalog 检索 cellxgene、Azimuth
原始 FASTQ / 表观测序 NeMO 档案 Terra 云端
电生理(Patch-seq) DANDI NWB 专用 SDK
影像(原位图/全脑) BIL 计算围场
电镜体积 BossDB 专用体积接口

若不确定某数据集放在哪个档案,先在 biccn.org Data Catalog 用 species/modality/technique 过滤,landing page 会给出所在档案与下载链接,避免在多档案间盲目寻找。

§9.2 BibTeX 引用

@article{biccn2021multimodal,
  title = {A multimodal cell census and atlas of the mammalian primary motor cortex},
  author = {{BRAIN Initiative Cell Census Network (BICCN)} and Callaway, Edward M. and Dong, Hong-Wei and Ecker, Joseph R. and Hawrylycz, Michael J. and Huang, Z. Josh and Lein, Ed S. and Ngai, John and Osten, Pavel and Ren, Bing and Tolias, Andreas S. and White, Owen and Zeng, Hongkui and Zhuang, Xiaowei},
  journal = {Nature},
  volume = {598},
  number = {7879},
  pages = {86--102},
  year = {2021},
  doi = {10.1038/s41586-021-03950-0}
}

@article{biccn2021mouseepigenome,
  title = {A transcriptomic and epigenomic cell atlas of the mouse primary motor cortex},
  author = {Yao, Zizhen and Liu, Hanqing and Xie, Fangming and Fischer, Stephan and Zeng, Hongkui and Mukamel, Eran A. and others},
  journal = {Nature},
  volume = {598},
  pages = {103--110},
  year = {2021},
  doi = {10.1038/s41586-021-03500-8}
}

@article{biccn2021comparative,
  title = {Comparative cellular analysis of motor cortex in human, marmoset and mouse},
  author = {Bakken, Trygve E. and Lein, Ed S. and others},
  journal = {Nature},
  volume = {598},
  pages = {111--119},
  year = {2021},
  doi = {10.1038/s41586-021-03465-8}
}

@article{biccn2023wholebrain,
  title = {A high-resolution transcriptomic and spatial atlas of cell types in the whole mouse brain},
  author = {Yao, Zizhen and van Velthoven, Cindy T. J. and Kunst, Michael and Zeng, Hongkui and others},
  journal = {Nature},
  year = {2023},
  doi = {10.1038/s41586-023-06812-z}
}

@article{biccn2022ecosystem,
  title = {The BRAIN Initiative Cell Census Network Data Ecosystem: A User's Guide},
  author = {{BRAIN Initiative Cell Census Network Data Ecosystem Collaboration}},
  journal = {bioRxiv},
  year = {2022},
  doi = {10.1101/2022.10.26.513573}
}

@article{ecker2017lessons,
  title = {The BRAIN Initiative Cell Census Consortium: Lessons Learned toward Generating a Comprehensive Brain Cell Atlas},
  author = {Ecker, Joseph R. and Ngai, John and others},
  journal = {Neuron},
  volume = {96},
  pages = {542--557},
  year = {2017},
  doi = {10.1016/j.neuron.2017.10.007}
}

§9.3 引用指南

使用 BICCN 数据(无论已发表与否)时,须在论文/工具中致谢并引用 BICCN 及产出该数据集的生产实验室;每数据集 landing page 附有建议引用示例。开放数据按 CC BY 4.0,须注明出处并给出许可链接;未发布数据优先与数据产出者协调。跨模态多论文引用的主论文章引用 biccn2021multimodal。

§9.4 常见问题(获取与使用决策)

问题 回答
该不该下载全量? 大多数任务只需某 assay/物种/脑区的最小注释集(GB 级),不必下载 241.3 TB 全量;全量仅面向基础模型训练且建议云端进行
下载后有使用协议要签吗? 开放数据 CC BY 4.0 免签;受控人类数据需经 NIMH Data Archive/NeMO 申请并遵守 DUA
能用它训练自己的模型再发布吗? 开放部分可以(CC BY 4.0,须致谢);受控部分不可,须按 DUA 处理
类型数不一致怎么办? 类型数随分类粒度变化是特性而非缺陷;声明所用的粒度与数据版本即可
我只有表达矩阵、没有表观/空间,能用于跨模态研究吗? 不能做同细胞跨模态,但可做类型级比对或引用其他 assay 的类型定义作为外键
是否适合做临床诊断模型? 不适合;本图谱为正常细胞参考,诊断/患病率/预后须另配真实患者数据(见坑点 8)

§9.5 学习与教程

  • BICCN 官方 What’s New 与 Webinar:https://www.biccn.org/(含全鼠脑、人类/NHP 图谱研讨会回放)
  • Nature 沉浸专包的"BICCN by the numbers":理解各模态与工具全貌
  • BICCN 数据生态用户指南(bioRxiv preprint):官方推荐的端到端数据获取与使用路径
  • cellxgene / NeMO Analytics 官方文档:交互式浏览注释矩阵与导出

对零代码起步者,官方可视化 + 云端 notebook 是门槛最低的路径;掌握基本单细胞概念(§1.6 术语表)后,再按 §6.0-§6.4 进入本地建模即可,无需先通读全部 17+ 篇论文。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 文本生成辅助:本条目由 AI 写作 Agent(千方医数集写作 Agent)基于公开检索资料起草,非模型直接输出。

§10.2 AI 参与范围

AI 用于:结构化检索并核实 BICCN 事实、组织百科章节与表格、起草代码示例与坑点分析、生成 frontmatter/INFOBOX/JSON-LD 骨架。所有数字、规模、DOI 与许可事实均经人工对照公开来源核实;因检索未证实而省略的数值(如未获可靠来源的特定细胞计数与引用量)不予编造。

事实核实方法说明。 本条目属 YMYL(Your Money or Your Life)医学类信息,编辑部采用"检索-来源归档-人工核对-入库"的四段流程:(1) AI 依据任务简报发起多次 WebSearch,覆盖官方门户、旗舰论文、Nature 沉浸专包、档案许可页、NIH/NIMH 新闻稿与领域综述;(2) 每次检索的硬事实(细胞数、类型数、DOI、日期、许可)归档到 FACTS.md 并附来源 URL;(3) 人工编辑逐条核对,重点校验存在口径冲突的数字(如"16 vs 17 篇"“56 vs 116 类型”">220 万细胞"等)并选择最贴切、有直接来源的表述;(4) 无法获得可靠来源的数据(例如特定实时引用计数)一律省略而不猜测。正文内关键数字均带内联 DOI 或官网链接,便于读者复核。

§10.3 输入来源列表

  1. Nature 旗舰论文(doi:10.1038/s41586-021-03950-0)
  2. BICCN 官方门户 biccn.org(What’s New / 总览 / Data / Terms of Use)
  3. BCDC 运动皮层普查数据指引(biccn.org/cell-census-primary-motor-cortex)
  4. Nature 沉浸专包(BICCN by the numbers)
  5. BICCN 数据生态用户指南 preprint(bioRxiv 10.1101/2022.10.26.513573)
  6. INCF 博客对 BICCN 数据生态的评述
  7. NIH/NIMH 新闻稿(2018 首发布、2021 运动皮层图谱)
  8. NIH 新闻稿(2023 全鼠脑图谱、2023 人类/NHP 图谱)
  9. Nature Reviews Neuroscience 摘要(s41583-021-00541-w)
  10. Nature 全鼠脑图谱论文(s41586-023-06812-z)
  11. EurekAlert/Allen Institute 全鼠脑图谱新闻稿
  12. Karolinska/上海大学/科学网等学术与科普报道
  13. GTEx 百科条目(本编辑部范式参考,用于非患者参考图谱的章节结构)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
frontmatter schema_org / INFOBOX 千方病案数据工程编辑部 字段与来源交叉核对 ✅ 已通过/已验证
§2 医学/生物学背景与 ICD/SNOMED 映射 千方病案医学编辑部 编码与文献核对 ✅ 已通过/已验证
§3-§5 数据规格与划分 千方病案数据工程编辑部 与论文/档案对照 ✅ 已通过/已验证
§6 代码与坑点 千方病案数据工程编辑部 语法与逻辑复核 ✅ 已通过/已验证
§7 DAIMS 与偏倚 千方病案医学编辑部 评分与风险复核 ✅ 已通过/已验证
§8-§9 引用与生态 千方病案编辑部 DOI/引用核对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全文由 AI 辅助生成并经编辑部逐模块人工校验;AI 起草与检索,事实核验与医学/工程把关由人工完成。凡正文引用的硬数字均带内联来源或 DOI,未获来源者不写入正文。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集