Allen Brain Atlas — 多模态脑图谱 AI-Ready Wikipedia | 千方病案医数集

全脑基因表达+连接组+细胞类型多模态公共图谱

来源 Allen Institute for Brain Science url: https://portal.brain-map.org/发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称Allen Brain Atlas — 多模态脑图谱 AI-Ready Wikipedia | 千方病案医数集
数据类型约 20,000 个基因 ISH,3,702 个人脑微阵列样本,非商业免费须引用
规模非患者队列(脑组织转录组/连接组研究图谱)
接入方式Allen Institute for Brain Science url: https://portal.brain-map.org/
AI 就绪度

数据集封面

Allen Brain Atlas — 多模态脑基因图谱 AI-Ready Wikipedia


INFOBOX

字段
数据集名称 Allen Brain Atlas(艾伦脑图谱,ABA)
英文全称 Allen Brain Atlas
别名/简称 ABA;Allen Brain Map(数据门户现名)
疾病分类(ICD-11) 主要服务于神经/精神疾病研究,如 6A60(精神分裂症)、6A02(孤独症谱系障碍)、8A00(阿尔茨海默病)、8A61(帕金森病)、8A62(癫痫);图谱本身非临床队列
SNOMED CT 25064009(精神分裂症)/ 237896000(孤独症)/ 416750008(阿尔茨海默型痴呆)/ 40956001(帕金森病)等脑病相关概念
数据模态 原位杂交 ISH + DNA 微阵列 + RNA 测序 + 中尺度连接组成像 + 细胞类型电生理/形态 + MRI/DTI
AI 任务类型 空间转录组表征、影像-基因关联、细胞类型分类、连接组建模、神经疾病候选基因定位
样本总数 小鼠 ISH 约 20,000 个基因;人脑微阵列 6 供体 3,702 样本;细胞类型数据库数万细胞;BrainSpan 524 个人组织样本
数据大小 分组件下载:微阵列人脑数百 MB;CCF 模板 10–100 μm 体素;小鼠 ISH/连接组原始成像达 TB 级
数据格式 图像(JPEG/WebP 分片)、CSV、NIFTI、NWB、SWC、JSON/XML(结构本体)
许可证 Allen Terms of Use(非商业免费、须按 Citation Policy 引用;商业用途须机构书面批准;非 CC0/CC BY)
访问级别 开放(公开浏览与下载,无需账号申请)
DUO 标签 NPUNCU
语言 英文
首发日期 2004(Allen Mouse Brain Atlas 在线发布)
最后更新 持续更新(细胞类型/连接组等子图谱滚动发布,截至 2024-02 收录更新)
发布机构 Allen Institute for Brain Science(美国西雅图)
官方主页 https://portal.brain-map.org/
下载地址 https://portal.brain-map.org/(分图谱下载)
DOI 各子图谱由配套论文标注(如 Lein 2007: 10.1038/nature05453;Hawrylycz 2012: 10.1038/nature11405;Oh 2014: 10.1038/nature13186)
引用次数 Hawrylycz 2012(Nature)3,600+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 文档顶尖、官方 SDK(AllenSDK)与 REST API 齐备、生态活跃;扣分项:多子图谱无统一数据划分、海量成像原始数据需缓存策略、跨模态配准门槛高
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(脑结构与神经精神疾病的 ICD-11/SNOMED CT 映射、临床任务边界、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(多子图谱主键体系、模态对齐)、§5 数据划分策略、§6 预处理 Pipeline 与坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Allen Institute for Brain Science、BrainSpan 联盟及各资助机构无任何商业利益关联。本页面不销售 Allen Brain Atlas 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受艾伦研究所的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Allen Brain Atlas 数据可公开访问且对非商业研究免费,但艾伦研究所持有版权并保留权利,非商业使用须按官方 Citation Policy 正确引用,商业用途须另行取得书面批准。DUO 标签仅供参考,具体使用限制以数据集官方 Terms of Use 为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? Allen Brain Atlas 是由美国艾伦脑科学研究所(西雅图)从 2004 年起构建的一套多模态全脑公开图谱。它回答一个基础问题:在大脑的每个解剖位置,哪些基因被"打开"、神经细胞如何连接、又有多少种细胞类型。小鼠图谱用原位杂交(ISH)逐基因绘制了约 20,000 个基因的脑内表达;人脑图谱用微阵列覆盖了 6 名供体 3,702 个精确取样位点的转录组。

为什么重要? 精神分裂症、自闭症、阿尔茨海默病等疾病常与特定脑区或特定细胞类型的基因异常相关。ABA 首次把"基因在哪里表达"这一维度和经典解剖、影像及连接数据放进同一个三维坐标框架,成为连接基因组学与脑影像的桥梁。Lein 2007 与 Hawrylycz 2012 两篇旗舰论文累计被引用数千次,是神经科学领域被引用最多的开放资源之一。

我能用它做什么? 研究基因的脑区特异性表达、把 MRI 灰质萎缩图与局部基因表达做空间关联、按表达谱对细胞类型分类、训练空间转录组或细胞类型模型,以及为神经发育障碍筛选候选基因。AI 用户最常用 AllenSDK(Python 官方包)读取数据,把基因表达当特征、脑解剖当标签或把影像当查询信号。

§1.1 技术摘要

Allen Brain Atlas 是一个持续演进的开放数据家族,通过统一门户 brain-map.org 提供,技术上以"解剖参考图谱 + 共同坐标框架(Common Coordinate Framework, CCF)+ 标准化采集管线"为共同骨架。其核心成员如下。

Allen Mouse Brain Atlas:用自动化高通量原位杂交(ISH)对成年小鼠脑近全基因组(约 20,000 个基因)做细胞级分辨率表达成像,Lein 等 2007 年在 Nature 报道。它把每张全切片图像经图像配准与信号量化映射到统一三维参考空间,从而支持"某基因在某结构是否富集"的全局交叉搜索与差异查询。它是全图谱中覆盖基因数最完整、分辨率达到细胞级的一层。

Allen Human Brain Atlas:2010 年起在线发布,成人部分以 Agilent DNA 微阵列为主模态,对 6 名供体(5 男 1 女)的 3,702 个神经解剖精确取样位点测量 58,692 个探针的转录水平,并把每个取样点映射回个体 MRI 坐标并进一步转入 MNI152 空间。它同时携带一组互补 ISH 子研究:Cortex Study(视觉/颞叶皮层约 1,000 基因)、Subcortex Study(皮层下 55+10 基因)、Schizophrenia Study(DLPFC 60 基因,覆盖 50+ 对照与精神分裂症病例)、Autism Study(前额/颞/枕皮层 25 基因,11 对照 + 11 自闭症病例)与 Neurotransmitter Study。截至 2012 年已累计超过 46,000 张 ISH 图像。早期全脑 micro-array survey 还包含每剖面超过 62,000 个探针、约 700 个解剖位点与接近 50M 单脑测量,最终定型为上述 6 供体 3,702 样本的主队列。

Allen Mouse Brain Connectivity Atlas:用表达增强型绿色荧光蛋白(EGFP)的重组腺相关病毒(AAV-EGFP)作为顺行示踪剂标记轴突投影,再以串行双光子(serial two-photon, STP)断层扫描对整脑成像(每脑约 750 GB、140 个序列切片),经信号分割与体素化后配准到共同参考脑,输出中尺度连接矩阵。Oh 等 2014 年在 Nature 报道其参考平均模板由 1,231 个脑平均构建,并指出约 25% 的扫描脑因成像或标注质量问题被剔除。后续 Harris 等 2019 年进一步刻画皮层—丘脑连接的层级组织。

Allen Cell Types Database:针对成年小鼠初级视皮层为主的单神经元开展全细胞膜片钳电生理记录、biocytin 形态重建与转录组测序,把三类特征映射回共同坐标。2018 年发布使小鼠细胞数由约 1,000 增至 1,900+;2020 年前后转录组层面扩展至人类超过 33,000 个、小鼠超过 44,000 个细胞,并配套提供 GLIF 点神经元模型(645 个神经元)与生物物理模型等建模资源。

BrainSpan / 发育图谱:把表达谱延展到发育时间轴。产前部分(Miller 等 2014 年在 Nature 报道)基于 4 个捐献完整胎脑(15–16 周与 21 周),对约 300 个精细解剖区域做 ISH、定制微阵列与超高分辨率 MRI/DTI 联合分析;BrainSpan Developmental Transcriptome 则覆盖 8 孕周至 40 岁、最多 16 个皮层与皮层下结构的 RNA-seq 与 exon 微阵列,共 42 个脑、524 个人组织样本。

参考图谱 / CCF:小鼠以 CCFv3 平均脑(10 μm 体素,由 1,675 只 C57BL/6J 小鼠构建)为解剖空间,标注覆盖 43 个等皮层区及分层、314 个皮层下灰质、81 个纤维束与 8 个脑室结构;模板体积支持 10/25/50/100 μm 多种分辨率下载。

所有子图谱共享统一结构本体与坐标,数据经 AllenSDK 与 REST API 提供,格式含 CSV 注释/表达表、图像分片、NIFTI 体素、NWB 电生理与 SWC 形态文件,形成标准化、可计算的研究基础。

§1.2 战略价值

多模态空间锚定带来的交叉验证价值。 ABA 的核心创新不是单一模态,而是把"表达(转录)—结构(解剖/影像)—连接(connectome)—细胞(类型)"放进同一三维参考空间。这使研究者能把临床上得到的影像表型(如某脑区萎缩)锚定到该处基因表达,实现"表型到分子"的反向定位;它因此在遗传神经病学(frontotemporal dementia 等)中成为空间关联分析的黄金资源。对 AI 而言,这一"统一坐标"本身就是结构性先验:任何带坐标的脑测量(患者萎缩 t-map、任务激活图、病灶图)都可与 ABA 的表达向量对齐,从而在一个平台内完成多源异构数据的对齐与推理。

开放科学与生态杠杆价值。 艾伦研究所采用"免费共享、须引用、商业另批"的开放模型,配官方 SDK、知识库与活跃社区论坛,使数万研究者可直接复用,显著降低神经科学数据工程门槛。数据自带标准化采集管线(探针设计、配准、QC),其跨批次可控性使上游质量远高于实验室分散数据集,为深度学习提供稳定输入。因为配套论文(Lein 2007、Hawrylycz 2012、Oh 2014、Miller 2014、Harris 2019)均为 Nature 级方法学背书,引用链清晰,AI 论文可在 methods 段用规范 BibTeX 精确标注所用数据子集与版本。

跨发育与跨物种的可迁移价值。 通过小鼠全基因组 ISH 与人类/产前图谱并置,ABA 提供了"保守 vs 人特异"的分子解剖标尺:一方面可把在小鼠模型中验证的细胞类型/连接结论迁移到人;另一方面可用 BrainSpan 发育时间轴重建神经发育障碍基因在胎儿—幼儿期的时空表达,为自闭症、精神分裂症等"发育起源"假说提供证据。这种多时间点、多物种对照使 ABA 成为一个可供表征学习与迁移学习反复采样的"标准化脑空间"。

§1.3 同类数据集横向对比

数据集 物种/覆盖 模态 空间分辨率 规模与标注 差异化
Allen Brain Atlas(ABA) 小鼠+人+恒河猴,全脑/多发育期 ISH、微阵列、RNA-seq、连接组、细胞类型、MRI/DTI 细胞级至体素级 约 20,000 基因 ISH;3,702 人脑样本;数万细胞 唯一把表达+连接+细胞类型+影像统一进共同坐标的多模态家族
Allen Cell Types Database(属 ABA 家族) 小鼠皮层为主 电生理、形态、转录组 单细胞 数千至数万细胞 专精细胞分类与神经元建模
Human Connectome Project(HCP) 成人脑影像为主 MRI/fMRI/DTI 影像体素 1,200+ 受试者 侧重功能与结构连接影像,缺基因表达
GTEx 多人多器官(含脑区) RNA-seq 组织块 数百例多组织 覆盖全身体,脑区解剖粒度较 ABA 人脑图谱粗
UK Biobank Brain Imaging 数十万成人 MRI 影像体素 数十万受试者 人群级队列+基因型,但无细胞级脑表达图谱
BrainSpan(属 ABA 家族) 人脑发育全程 RNA-seq、exon microarray、ISH 组织至区域 42 脑、524 样本 专精发育时间轴

对比提示:上表用于快速定位"谁和谁在什么维度上有交集",不是同等规模下的替代榜单。选择资源时应同时考虑坐标空间、模态、物种与是否含疾病态/临床结局——没有单一"最大"图谱能同时满足所有需求,ABA 的独特价值在于把表达、连接与细胞整合进统一参考空间。

§1.4 版本时间轴

时间 里程碑 说明
2003 艾伦研究所成立 Paul G. Allen 捐资创立,使命为构建开放脑图谱
2004 Allen Mouse Brain Atlas 上线 小鼠全基因组 ISH 图谱首个公开版本(版权年 2004)
2007-01 Lein 2007 发表于 Nature 报道约 20,000 基因小鼠脑 ISH 图谱;DOI 10.1038/nature05453
2010-05 Allen Human Brain Atlas 上线 首发单脑全脑微阵列 survey
2010 前后 BrainSpan 联盟启动 人脑发育转录图谱计划(NIH NIMH/NICHD 资助)
2011 发育参考图谱公开 成人 + 产前参考图谱及组织学、MRI/DWI 数据上线
2012-09 Hawrylycz 2012 发表于 Nature 报道 6 供体人脑微阵列转录组图谱;DOI 10.1038/nature11405
2014-04 Oh 2014 发表于 Nature 报道小鼠中尺度连接组;DOI 10.1038/nature13186
2014-04 Miller 2014 发表于 Nature 报道产前人类脑转录图谱;DOI 10.1038/nature13185
2018-06 细胞类型数据近乎翻倍 小鼠细胞由约 1,000 增至 1,900+
2019-10 AllenSDK 弃用 Python 2 SDK 转向纯 Python 3
2020 转录组扩至数万细胞 人类 >33,000 + 小鼠 >44,000 单细胞转录组
2020 前后 Brain Observatory 细胞扩至 63,000+ 视皮层活动数据规模大幅增长
近年 更名 Allen Brain Map 门户整合细胞图谱、连接组与分析工具(re3data 收录更新 2024-02)

§1.4b 版本化现状说明

ABA 各子图谱均"各自版本化、滚动发布",没有一个统一的主版本号。例如 CCF 从 v1 演进到 v3;AllenSDK 以 npm/pip 语义化版本发布(2.x);细胞类型数据按年度批量扩展;Brain Observatory 按 study(Visual Coding / Visual Behavior)分期。因此在使用时必须记录数据获取日期与子图谱/工具版本(如"截至 2024-02 从 portal 获取的 Human Atlas 微阵列"),否则跨时间对比与复现都会受到影响。

§1.5 典型应用场景

  1. 影像-转录组空间关联:把患者的灰质萎缩/病灶图与 ABA 局部基因表达叠加,识别驱动疾病空间模式的分子模块(常用于神经退行性疾病)。方法上通常取每个微阵列样本的 MNI 坐标,从外部 VBM t-map 抽出对应 t 值,再对每基因做空间回归并做跨供体元分析,得到"该处基因越高表达、该处萎缩越重"的排序列表。
  2. 神经发育障碍基因定位:在 BrainSpan 发育轴上查询自闭症/精神分裂症候选基因的表达时空模式,寻找其在兴奋性神经元富集等线索;若某一基因在产前新生成兴奋性细胞中富集,可据此提出发育期病因假说。
  3. 细胞类型分类与图谱:用 Cell Types Database 的转录组/电生理/形态特征训练分类器,建立大脑细胞"分类学";跨模态(电生理 vs 转录组 vs 形态)的表征融合是常见的研究与工程议题。
  4. 连接组网络建模:基于 Connectivity Atlas 的中尺度连接矩阵构建脑网络模型,研究脑区间层级组织、富俱乐部结构与传播动力学,作为理解脑疾病"网络扩散"的参考拓扑。
  5. 空间转录组基础模型预训练:用配准到共同坐标的细胞级基因表达做大规模自监督/表征学习基准,学习"表达 + 空间 + 结构"的统一表征,进而迁移到新物种或新技术的少样本任务。

§1.6 谁在用与为何重要(社区视角)

ABA 的使用者横跨多个群体:计算神经科学家用它构建连接模型;影像学家用它把 MRI 表型做分子解释;遗传学家用它把 GWAS 命中基因做脑区功能定位;细胞生物学家与单细胞研究者用它建立新皮层细胞分类。正是这种"基因、影像、连接、细胞"四合一的特性,使其成为把基因组学证据、影像学表型和动物模型连接起来的关键桥梁资源,也是空间转录组时代最具复用价值的"历史坐标锚点"——新数据常通过"注册到 CCF / 与 ABA 对齐"来获得可比性。

§1.7 FAQ 快速答疑

Q1:ABA 是需要申请账号的受控数据集吗? 不需要。浏览与下载公开免费、无需注册申请,属"开放"访问。但需注意它不是 CC0/CC BY 之类开放许可证:艾伦研究所持有版权,非商业使用须按 Citation Policy 引用,商业使用须书面批准。

Q2:它有统一的 train/test 划分吗? 没有。各子图谱是面向生物学查询的开放资源,官方不提供机器学习划分;需要你自己按供体/结构分组建立验证(见 §5)。

Q3:我应该下载"整个 ABA"吗? 一般不应。它没有单一下载包,各子图谱独立分发且量级差异极大(微阵列数百 MB 到 Brain Observatory 数十 TB)。建议按任务先取最小子集起步(如单供体微阵列 CSV),再按需扩展(见 §6.2)。

Q4:小鼠 ISH 结论能直接用于人类吗? 不能直接外推。人鼠在皮层结构、细胞组成与表达谱上存在系统差异;应把人脑图谱/BrainSpan 作为人类终点,小鼠结论作为候选假设。

Q5:ABA 适合做临床诊断模型吗? 不适合。它是研究级分子解剖图谱,不含患者结局与诊断金标准;任何诊断/治疗用途都需要独立临床数据与监管审批(见 §2.2c)。

Q6:多个子图谱如何对齐? 靠共同解剖本体与坐标空间(CCFv3/MNI)。具体做法见 §4.1c/§4.6——把各模态都落到同一参考空间再按结构聚合,而不是用样本 ID 硬拼。


§2 医学背景

§2.1 ICD-11 编码映射

标签 ICD-11 编码 中文名
精神分裂症 6A60 精神分裂症及相关原发性精神病性障碍
孤独症谱系障碍 6A02 孤独症谱系障碍
阿尔茨海默病 8A00 阿尔茨海默病
帕金森病 8A61 帕金森病
癫痫 8A62 癫痫(特发性或症状性)
额颞叶痴呆相关 8A22.0 额颞叶痴呆
焦虑与恐惧相关障碍 6B0Z(示例研究领域) 情绪障碍相关脑回路研究
多发性硬化(示例) 8A40 神经退行/脱髓鞘脑区研究

说明:ABA 不是按某种 ICD-11 疾病采集的患者队列,因此上表是把图谱"可服务的脑疾病研究领域"与 ICD-11 编码做研究对应,而非病例诊断标签映射。凡是依赖疾病诊断标签的临床任务,都不应直接使用 ABA 的供体/病例结构。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语
精神分裂症 6A60 25064009 Schizophrenia
孤独症谱系障碍 6A02 237896000 Autistic disorder
阿尔茨海默型痴呆 8A00 416750008 Alzheimer’s disease
帕金森病 8A61 40956001 Parkinson’s disease
癫痫 8A62 84757009 Epilepsy
脑结构(图谱采样框架) 12738006 Brain structure
前额叶皮层(样本区) 123080004 Prefrontal lobe structure
海马结构(样本区) 90949007 Hippocampal structure

映射原则:图谱的"主体标签"其实是神经解剖术语(structure ontology),对应 SNOMED 的解剖概念;疾病概念仅出现在少数疾病 ISH 子研究及 BrainSpan 的疾病相关基因分析中。此处把解剖样本结构与疾病诊断概念并列,仅用于让检索者在 SNOMED 语义下理解图谱的解剖采样范围。

§2.2 疾病/研究背景与"患者人群"说明

Allen Brain Atlas 本身不是临床患者队列,而是基础神经科学的多模态脑图谱,属公共卫生与脑神经研究范畴。其医学价值在于:许多脑疾病具有高度空间选择性——阿尔茨海默病先累及内嗅皮层与海马,帕金森病累及黑质多巴胺能系统,精神分裂症与背外侧前额叶(DLPFC)及谷氨酸/GABA 失衡相关。理解"哪类细胞、哪个脑区在疾病中最脆弱"往往需要先知道健康脑中各基因、各细胞类型的正常空间分布。

ABA 的多个子数据集直接以疾病研究为对象:人脑精神分裂症 ISH 研究在 DLPFC 对超过 50 例对照与精神分裂症(SCZ)病例调查 60 个候选基因;自闭症 ISH 研究在 11 例对照与 11 例自闭症病例的前额/颞/枕皮层调查 25 个基因;BrainSpan 发育图谱被用于寻找自闭症相关基因在发育皮层的富集。因此图谱提供的是"健康与疾病来源脑组织的正常/异常分子解剖基线",而非流行病学患病率。下表把与图谱密切相关的疾病与研究价值对应起来,便于检索。

疾病/领域 流行病学要点 ABA 相关子图谱 图谱的贡献
精神分裂症 终生患病率约 0.5–1%,多发于青春期—成年早期,病因含显著的遗传与发育成分 Human ISH Schizophrenia Study、BrainSpan DLPFC 60 基因 + 发育轴表达定位
自闭症谱系障碍 全球患病率约 1%,以社交沟通障碍与刻板行为为核心 Human ISH Autism Study、BrainSpan 产前皮层表达富集研究
阿尔茨海默病 最常见痴呆,65 岁以上患病率随龄显著上升 Human / Mouse 表达图谱 内嗅皮层—海马脆弱性基因空间解释
帕金森病 65 岁以上患病率约 1–2%,黑质多巴胺能神经元变性 表达图谱 + 细胞类型 区域与细胞类型易损定位
额颞叶痴呆 中老年早发痴呆,基因突变(MAPT/GRN/C9orf72)驱动 Human 微阵列 影像-表达空间关联(GENFI 类研究)
神经发育障碍研究 多种(自闭症、精神发育、脑性瘫痪) BrainSpan 发育转录组时间轴

由于供体样本有限且非随机人群,这些子研究的主要角色是"提出分子-解剖假说",而非提供疾病患病率或治疗结局证据;ABA 的每一种疾病结论都应视为需要在独立队列中验证的机制线索。

§2.2b 图谱如何支撑疾病研究的实例逻辑

以额颞叶痴呆研究为例(PMC7667525):研究者用 VBM 得到基因型(MAPT/GRN/C9orf72)驱动萎缩的 t-map,再取 ABA 微阵列供体中与目标皮层样本 MNI 坐标对齐的表达值,对每个基因做"该处表达越高、萎缩越重/越轻"的空间关联,用跨供体加权 Z-score(Stouffer 元分析)合并 P 值,再以 Benjamini–Hochberg 做 FDR 校正。最终可发现萎缩区富集星形胶质细胞与内皮细胞相关基因,而神经元/小胶质相关基因在被保留的区域富集。这一"影像表型 → 分子机制"的工作流正是 ABA 空间坐标价值的典型体现,也是 AI 用户设计影像-基因联合建模时的可复制范式。

§2.2c 图谱与"临床决策"的边界

必须强调:ABA 不包含患者个体结局、治疗反应或诊断金标准,任何基于 ABA 的模型都不能直接用于个体患者的诊断、分诊或治疗决策。它的正当用途是研究级的空间分子解剖定位、机制假说生成与跨模态关联。将其结果桥接到临床,须经由独立、经过伦理与监管审核的临床研究与器械审批流程。AI 使用者也应在模型部署边界中明确此限制。

§2.3 临床与研究任务定义

任务类别 定义 ABA 的支撑角色
风险机制(非筛查) 定位与疾病易感脑区/细胞类型相关的基因与分子通路 空间表达图谱 + GWAS/候选基因空间关联
表型-分子定位 把影像学(萎缩/病灶)表型锚定到局部基因表达 MNI 坐标样本 + 影像配准
发育期病因研究 重建神经发育障碍基因在胎-幼期的时空表达 BrainSpan 发育转录组
生物标志物发现的基础 识别疾病富集脑区与细胞类型的标记分子 细胞类型转录组 + ISH 标记基因

§2.4 供体/动物人群表

维度 成人微阵列(Human Brain Atlas) 产前图谱 BrainSpan 转录组
来源 多个机构捐献的死后脑组织 捐献胎脑 死后脑组织
时间跨度 2004–2011(建模样本多为 18–68 岁) 15–16 周、21 周孕后 8 孕周至 40 岁
性别构成 6 供体:5 男 1 女 未逐一公布(伦理核准) 男女性别均覆盖
种族/民族 以白种人为主(供体有限)
就医类型 非临床队列,死后脑组织 非临床队列 非临床队列
数量 6 供体(微阵列主队列) 4 个完整胎脑 42 个脑、524 样本

注意:人脑供体来自死后脑组织库与多家医院病理/捐献系统,故"就医类型"严格说是"死后脑组织捐献",非门诊/住院患者的临床诊疗队列;样本量小且非随机,任何群体层面的患病率或人群统计都不应由 ABA 得出。

§2.5 临床价值

  • 把 GWAS 从"清单"变成"空间坐标":图谱显示 84% 的人类基因在脑中表达,为研究者提供每个基因的脑区"数字指纹",可反向圈定候选基因最相关的脑区。
  • 跨物种与跨发育对照:小鼠全基因组 ISH 与人脑图谱并置,能区分保守表达与人特异表达,帮助将小鼠模型结论迁移到人。
  • 影像学研究的分子解释:为 MRI 中观察到的局部萎缩/异常提供基因与细胞类型的分子假设,是"影像表型组学"的关键数据层。
  • 疾病机制的分层假设:脑疾病可理解为"特定脑区 × 特定细胞类型 × 特定发育窗口"的脆弱性组合,ABA 恰好为这三个维度提供了空间、细胞与时间三个轴的可查询坐标。
  • 转化桥梁:通过 BrainSpan 与疾病 ISH 子研究,把基础表达谱与精神疾病/神经发育障碍的候选基因关联起来,为后续在独立队列或临床前模型中的靶向验证提供起点。

§2.6 金标准与数据性质表

维度 说明
划分方式 解剖结构本体(structure ontology)+ 共同坐标框架(CCF/MNI)驱动,非随机训练/测试划分
标注方式 人工解剖标注(专家)+ 自动化探针设计/信号分割 + 参考图谱配准
标注者 艾伦研究所内部神经解剖学团队与内部评审
性质 研究级"发现资源",非监督学习的临床金标准;作为对照/空间参考使用

§2.7 术语与缩写速查

术语/缩写 含义
ABA / Allen Brain Atlas 艾伦脑图谱(数据家族总称)
Allen Brain Map 数据门户现名(brain-map.org
ISH 原位杂交,用于成像基因在脑切片中的表达位置
CCF(Common Coordinate Framework) 小鼠脑共同坐标参考空间;CCFv3 为 10 μm 平均脑
MNI 空间 蒙特利尔神经学研究所立体空间,影像/坐标对齐常用
mesoscale connectome 中尺度连接组,脑区间(非突触级)连接矩阵
ISH / 微阵列 / RNA-seq 三种表达测量技术(成像 / 探针 / 测序)
GLIF 广义泄漏积分发放神经元模型
BrainSpan 人类发育脑转录图谱
RIN RNA 完整性指数,衡量组织 RNA 质量
NIFTI / NWB / SWC 影像体积 / 神经数据格式 / 形态重建格式

使用说明:本表供快速定位术语;各概念的权威定义请以艾伦官方文档与论文为准。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐子图谱/版本 大小(参考) 理由
小鼠脑全基因组基因表达定位 Allen Mouse Brain Atlas(ISH) 数十 GB 级图像数据 约 20,000 基因细胞级表达,最全覆盖
人脑转录组与影像/临床研究关联 Allen Human Brain Atlas(微阵列) 数百 MB(6 供体) 3,702 样本 + MNI 坐标,社区研究主流
小鼠脑区间连接 Allen Mouse Brain Connectivity Atlas 数百 GB–TB 原始成像 中尺度 connectome,AAV 示踪 + STP 断层
单神经元分类与建模范式 Allen Cell Types Database 按细胞/按 NWB-SWC 拉取 电生理 + 形态 + 转录组 + 神经元模型
人类神经发育疾病研究 BrainSpan / Developing Human Atlas 数百 MB–数 GB 8 孕周至 40 岁 + 产前图谱
全脑影像配准参考空间 Allen Mouse CCF(CCFv3) 10–100 μm 模板体积 标准解剖注释 + 参考空间

§3.1 模态详情

模态 子图谱 技术 空间分辨率/精度 输出
原位杂交表达成像 Mouse ISH / Human ISH 非同位素 ISH,自动化高通量 细胞级图像 全切片图像 + 信号量化
微阵列转录组 Human / Mouse / Developing Agilent DNA 微阵列 解剖取样点 表达矩阵 + 批校正值
RNA 测序 BrainSpan / Cell Types RNA-seq(含单细胞/核) 组织块或单细胞 RPKM/CPM、单细胞表达
连接组成像 Mouse Connectivity AAV-EGFP + 串行双光子断层 0.35 μm 平面 / 100 μm 层距 全脑投影图像 + 连接矩阵
细胞类型电生理/形态 Cell Types 膜片钳 + biocytin 重建 单细胞 电生理 traces + SWC
影像解剖 多子图谱 MRI/DTI/NIFTI 影像体素 3D 参考脑 + 弥散张量

§3.2 按子图谱样本数

子图谱 规模(检索核实) 来源论文
Allen Mouse Brain Atlas(ISH) 约 20,000 个基因 Lein 2007
Allen Human Brain Atlas(微阵列) 6 供体 / 3,702 样本 / 58,692 探针 Hawrylycz 2012
Human Brain ISH(累计) >46,000 张 ISH 图像(2012) PLOS pbio.1001453
Allen Mouse Brain Connectivity Atlas 数百次注射实验,平均模板由 1,231 脑构建 Oh 2014
Allen Cell Types Database 小鼠皮层 1,900+ 细胞(2018);转录组人 >33,000 + 鼠 >44,000 细胞(2020) 艾伦新闻
BrainSpan Developmental Transcriptome 42 脑 / 524 个人组织样本 知识库

覆盖深度提示:各子图谱的"基因数 × 解剖分辨率 × 供体数"三者互不可比。例如小鼠 ISH 覆盖全基因组但物种是小鼠;人脑微阵列覆盖全基因组但粒度是取样点(非细胞);细胞类型数据库达到单细胞但在组织覆盖上聚焦。理解"你想回答的问题需要哪种覆盖组合",比追求单一"最大规模"更重要。

§3.2b 覆盖差异如何影响选型

  • 若你要做基因空间定位(某基因在哪些脑区表达)→ 首选小鼠 ISH(约 20,000 基因)或人脑微阵列(全基因组、区域粒度)。
  • 若你要做人类疾病影像关联 → 用带 MNI 坐标的人脑微阵列,才能与 MRI 对齐。
  • 若你要做单细胞类型 → 用 Cell Types Database,勿从微阵列反推单细胞。
  • 若你要做发育时间轴 → 用 BrainSpan,勿用成人图谱推断早期。
  • 若你要做脑区连接 → 用 Connectivity Atlas,其输出是结构/体素连接而非表达。

§3.3 数据格式表

类型 格式 用途
表达/注释 CSV(SampleAnnot、Probes、Ontology、MicroarrayExpression) 微阵列样本与探针
全切片图像 JPEG/WebP 分片 + image service API ISH/组织学可视化
影像体积 NIFTI MRI/DTI 模板与弥散
神经记录/模型 NWB、SWC 电生理、形态重建
结构本体 JSON/XML/CSV 解剖层级与标注
元数据/清单 manifest.json SDK 本地缓存管理

§3.3b 文件命名与内部一致性

下载包内 CSV 的列名、行组织与编码在不同子图谱甚至同一子图谱不同发布版本间存在差异。例如微阵列包常含 SampleAnnot.csv(每个微阵列样本一行,列含 sample_id、structure、structure_id_path、MNI 坐标、RNA Integrity Number 等)、MicroarrayExpression.csv(表达矩阵)、Probes.csv(探针到基因映射)、Ontology.csv(结构本体层级)与 README.txtREADME.txt 是判断表头语义的第一手依据,任何自动化流程都应在读取时打印列名并与 README 核对,防止行列错位。

§3.4 存储大小

Allen Brain Atlas 无单一下载包,各子图谱独立分发:成人微阵列人脑数据每供体约数百 MB(含 SampleAnnot、MicroarrayExpression、Probes、Ontology);CCFv3 模板体积可自 10 μm 至 100 μm 各分辨率下载;小鼠连接组与 Brain Observatory 原始成像量达 TB 级(如 Visual Coding 全量约 855 GB、部分原始资源 ~80 TB),多经 AWS S3 公共桶按需拉取。建议先下载微阵列 CSV 起步,再按需扩展。下载策略的关键是"按需 + 缓存 + 复用 manifest",避免一次性全量落盘;对云端分析优先把任务迁移到 S3 就近的计算节点。

§3.5 标注方式

标注对象 标注方式 手段与参考 人工/自动
解剖结构 人工解剖勾画 Nissl/组织学染色 + Allen Reference Atlas 人工为主
CCF 参考空间 半自动体素标注 多模态参考数据 + 平均模板 半自动
ISH 表达信号 自动信号分割与量化 染色强度图像管线 自动
连接组投影 信号检测与体素化 EGFP 分割 + 三维体素计数 自动
连接组注射位点 人工勾画 比对参考图谱 人工
探针→基因 官方 + 社区重注释 官方注释 + Re-Annotator 等 自动/校验
细胞类型 特征 + 无监督聚类 电生理/形态/转录组特征聚类 自动 + 专家审核

§3.6 标注者资质与一致性

解剖标注由艾伦研究所专业解剖学家完成,多图谱沿用统一的 Allen Reference Atlas / 本体以确保一致性。连接组研究中手动与信息学标注注射位点差异经校验,配准变异的精度以 ~49 μm 中位变异衡量(Oh 2014 全文)。由于标注内置为管线一部分,重复性经内部 QC 与公开方法学 white paper 描述,但无对外公开的逐图人机一致性评分。使用者如需在精细深部结构(如丘脑亚核)上做分类标签,应自行复核个别关键结构,避免把共享本体/参考的"系统误差"当作独立标签噪声。

§3.7 采集周期

  • 小鼠 ISH:2004–2007(Lein 2007 报道)。图像经标准化批次生成,批次间可控性在论文补充数据中有对照。
  • 人脑微阵列:2004 年起多供体滚动采集,2010 首次发布,后续增补。
  • 连接组/细胞类型/转录组:2010 年代至 2020 年代持续滚动发布,非单次终点型采集。
  • 因属滚动发布,跨年份研究必须固定版本与 SDK 日期,报告"数据获取截至 YYYY-MM"以利复现。

§3.8 地域覆盖

供体与样本来自美国多家机构(含死亡捐献脑库)及合作高校(Yale、UCLA、USC、马萨诸塞总医院等);小鼠为标准化 C57BL/6J 系及转基因品系。属于研究性样本,不具地域人群代表性。人脑供体以美国白人人群为主,跨族群表达差异不在设计范围内,研究结论不应外推到族群层面。

§3.9 设备规格

模态 主要设备/平台 关键参数
微阵列 Agilent 定制平台 每 profile 58,692 探针(人脑)
RNA-seq Illumina(BrainSpan 等) Gencode v10 注释比对,RPKM 汇总
ISH 自动化染色 + 整片高倍扫描 细胞级分辨率
连接组 TissueCyte 1000 串行双光子 0.35 μm x–y、100 μm 层距、整脑连续成像
结构影像 超高分辨率 MRI + DTI 提供模板与弥散张量
细胞电生理 脑片膜片钳 全细胞记录 + biocytin 重建
单细胞转录组 10x/NM 类建库测序 数千至数万细胞/批次

§3.10 深度溯源链

样本 →(死后脑库/协作机构伦理核准)→ 解剖取材与 Nissl/免疫参考 →(微阵列/ISH/RNA-seq)→ 原始表达信号 →(归一化/批校正 white paper)→ 表达矩阵 →(CCF/MNI 配准)→ 空间化数据 → AllenSDK/API 对外分发。连接组经 AAV 注射 → STP 成像 → 信号分割 → 三维体素投影 → 连接矩阵;细胞类型经全细胞记录 + biocytin 重建 + 转录组 → 分类与模型。

可追溯性评估:表达矩阵的归一化与批校正有官方 white paper(Microarray Data Normalization)与时间戳,可复现性较好;但完整到"切片批次—染色批次—扫描批次"的逐级元数据并未全部公开成统一清单,深度的批次归因(哪一批次解释了哪些方差)需要研究者在供体/批次级别自行建模。


§4 数据结构

§4.0 目录树(以人脑微阵列下载包为例)

ahba_microarray/
├── donor_9861/                    # 每供体一个 zip(样例)
│   ├── SampleAnnot.csv            # 每个微阵列样本一行:结构、MNI 坐标、RIN 等
│   ├── MicroarrayExpression.csv   # 样本 × 探针 归一化表达矩阵
│   ├── Probes.csv                 # 探针到基因/转录本映射
│   ├── Ontology.csv               # 解剖结构本体与 structure_id_path 层级
│   └── README.txt                 # 内容清单与说明
└── (AllenSDK 缓存)
    └── manifest.json              # SDK 本地缓存映射(需自行规划落盘路径)

目录结构解读:微阵列"一份 zip = 一个供体",内含上述核心 CSV;Ontology.csvstructure_id_path/ 分隔给出父子层级(如 /脑/皮层/新皮层/...),SampleAnnot.csvsample_id 为主键、含结构与 MNI 坐标。把"样本表 + 探针表 + 结构本体"三者按主键 join,即可从原始表达矩阵还原"每个样本位于哪个结构、测了哪些基因"。连接组/细胞类型目录由 AllenSDK 的对应 Cache 按 manifest 管理,目录结构随 SDK 版本变化,请以 readthedocs 当前说明为准。

§4.1 DAIMS 字段字典(核心表)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
sample_id Integer 解剖取样点唯一标识 159346326 记录主键 不适用 正整
structure_id_path Text 解剖本体层级路径(CSV) “/997/…/10249/” 解剖标签 手动划分误差 缺失即"未归类" 本体路径
structure_acronym Text 结构缩写 “HIP” 标签/过滤 解剖命名差异 空串表示未映射 本体词表
mni_x / mni_y / mni_z Float 样本中心 MNI 坐标(mm) -31.5 空间配准/关联 配准误差 mm 级 缺失表示未配准 有符号 mm
entrez_id Integer Entrez 基因标识 7414 基因主键 探针歧义 无(探针决定) Entrez 词表
gene_symbol Text 基因符号 “RELN” 特征名 命名版本差异 空串 HGNC 词表
表达值(probe×sample) Float 归一化/批校正后表达 5.42 特征/标签 探针-基因映射误差 NaN 表示该样本该探针缺失 连续(可负,Z/标准化)
probe_id Text Agilent 探针标识 “A_24_P…” 特征粒度 一探针多基因 Agilent 词表
RIN Float RNA 完整性指数 7.5 QC 过滤 组织降解 NaN 未测 0–10
donor / age / sex Text/Int 供体与人口学 “H0351”/68/“M” 批效应/分层 供体批差异 见 §3.4
cell_id(Cell Types) Integer 神经元唯一标识 512887936 单细胞主键 正整
etype / mtype Text 电生理/形态类型 “L4 … e13” 分类标签 分类不确定性 类型词表

§4.1b DAIMS 字段字典(ISH 实验与连接组视图)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
experiment_id(ISH) Integer ISH 实验/图像系列唯一标识 71717640 图像主键 正整
gene_symbol(ISH) Text 实验所测基因 “Calb1” 标签/分组 空串 HGNC 词表
图像系列/切片 Image Nissl/ISH/免疫系列切片 section id 图像任务输入 染色/批次差异 缺片表示未采集 图像对象
injection_experiment_id(连接) Integer AAV 注射实验标识 477836675 连接组实验主键 正整
injection_structure Text 注射位点结构 “primary motor area” 起点标签 位点勾画误差 空串 本体词表
injection_coordinates Float×3 注射中心坐标 参考空间坐标 空间定位 配准误差 缺失未配准 连续 mm
projection_signal(体素/结构) Float/Int 目标结构投影信号 像素/体素计数 连接强度特征 信号分割误差 0 表示无检测 ≥0
Cre_line / organism Text 转基因/物种(连接、细胞) “Vip-IRES-Cre” 细胞亚群分层 词表
ephys_traces NWB 对象 电生理记录 波形输入 记录噪声 缺失未记录 NWB

§4.1c 主键与跨表 join 提示

各子图谱共享解剖本体(structure ontology)与参考坐标(CCF/MNI)作为"软主键",但并无跨子图谱的统一外键。要把 ISH 表达、微阵列表达、连接组与细胞类型对齐,正确做法是"都落到共同坐标/共同解剖结构"再合并,而不是按样本 ID 硬拼。常见的可执行路径是:先固定一个参考空间版本(CCFv3 或 MNI),把每类数据的结构/坐标标准化到该空间,再按其覆盖粒度聚合;表达矩阵与细胞元数据可按 entrez_id 与基因符号做受控词表 join,结构之间用 structure_id_path 的父链聚合。

§4.2 标签分布

微阵列样本按解剖结构本体分布,皮层/皮层下/小脑/脑干不等;人脑 ISH 按研究(Cortex/Subcortex/Schizophrenia/Autism)分区。小鼠 CCFv3 标注覆盖 43 个等皮层区及其分层、314 个皮层下灰质结构、81 个纤维束与 8 个脑室结构——这是图像/连接组体素的"标签空间"。单细胞转录组为数十个离散细胞类型聚类。图谱自身不提供"病例/对照"式的疾病标签;仅精神分裂症与自闭症 ISH 子研究携带病例-对照二元信息。

标签空间 粒度 示例层级 缺失/覆盖特征
解剖本体(structure) 区域 脑→皮层→新皮层→等皮层区→层 深部小结构样本稀疏
CCF 参考空间 体素 43 isocortical + 分层 / 314 subcortical 灰质/白质/脑室全覆盖
发育阶段(BrainSpan) 时间 8 孕周→40 岁,42 脑 某些结构在某时间点缺失
探针/基因 分子 基因→转录本→探针 一基因多探针
细胞类型 单细胞 类型→亚型→supertype 聚类分辨率依赖算法
病例/对照 二值 仅 SCZ/Autism ISH 子研究 不覆盖多数疾病

§4.3 关键统计

  • 人脑微阵列:6 供体、3,702 样本、58,692 探针、约 19,980+ 个唯一基因(探针重注释后)。
  • 84% 人类基因在脑中表达(Hawrylycz 团队早期分析)。
  • 小鼠 ISH:约 20,000 个基因、细胞级分辨率。
  • 连接组:每脑约 750 GB 成像数据、140 个序列切片;平均模板来自 1,231 个脑。
  • 细胞类型:小鼠皮层(2018)1,900+ 细胞;转录组人 >33,000、鼠 >44,000 细胞(2020)。

§4.4 数据层级

物种/供体(donor/animal)
 └─ 解剖结构与参考图谱(CCF/MNI 空间)
     ├─ 基因表达(ISH 全切片 或 微阵列/RNA-seq 表达矩阵,按 structure)
     ├─ 连接组(注入位点 → 投影体素投影体积)
     └─ 细胞类型(单细胞转录组/电生理/形态,映射回参考空间)

§4.5 缺失值 + 信息性缺失

图谱是"全面但有选择"的取样:各子图谱覆盖的基因数/解剖数不完全相同(如 ISH 仅覆盖选基因,微阵列全基因组但粒度是取样点)。缺失可能意味着"未检测/未测"(non-informative)或"该基因在该脑区不被表达"(信息性,生物学意义)。探针到基因的重注释会因多义探针/基因间区而剔除部分探针(社区流程中剔除比例显著),因此做特征工程前应先清洗探针映射与零表达探针。

缺失类型 含义 处理建议
未检测/未测(non-informative) 该子图谱未覆盖该基因/结构 置缺失,勿当作"低表达"
表达低于检出限 测量技术灵敏度不足 可用 RIN/QC 过滤或阈值标记
生物学"不表达"(informative) 基因在该脑区/发育期天然不表达 保留为信息性零,勿任意剔除
探针被重注释剔除 多义/基因间/不可映射探针 去重注释再聚合
结构在某发育期无样本 取样设计未覆盖 用插值/邻域填充需谨慎

实操要点:对"未测"与"不表达"分开编码(如分别用 NA0),保留原始语义;零表达探针建议在聚合前按表达样本数过滤,而不是一律删除——否则会丢掉真实的空间限制性表达信号。

§4.6 一个"基因级"整合示例(概念)

把不同子图谱对齐成一张可查询的宽表是常见诉求。假设你想研究基因 G 在人脑中是否在特定皮层深度富集:先在微阵列表达矩阵找到 G 的所有探针并按结构聚合,得到"结构→表达"向量;再把这些结构的 MNI 坐标映射到参考脑,与 CCF/另一供体的 ISH 图像或连接组区域比对。实际工程中建议按 §4.1c 的"统一坐标空间 + 受控词表 join"路径实现,并用 README 核对每步列名,而不是依赖某一子图谱自带的"快捷表"。

# 概念:把样本-表达矩阵聚合成"结构×基因"并附 MNI 坐标(示意)
# import pandas as pd
# def gene_by_structure(samp, expr, probes, gene_symbol="RELN", col="structure_acronym"):
#     probe_ids = probes.loc[probes["gene_symbol"] == gene_symbol, "probe_id"]
#     vals = expr[probe_ids].mean(axis=1)            # 基因内多探针取均值
#     out = samp.assign(expr_g=vals)[["sample_id", col, "mni_x", "mni_y", "mni_z", "expr_g"]]
#     return out.groupby(col).mean(numeric_only=True).reset_index()  # 结构级汇总

提示:这里默认基因→探针为可聚合的一对多;实际请先做探针清洗(§6.3)与结构/坐标核对,避免多义映射污染结果。


§5 划分与使用建议

§5.1 官方划分

Allen Brain Atlas 没有为机器学习设定的官方 train/validation/test 划分。它的"划分"维度是解剖结构本体、发育阶段、供体/动物与探针/细胞,全部面向生物学查询而非基准竞赛。研究者在自定义任务(如细胞类型分类、区域基因表达预测)时需自行划分。

§5.2 社区惯例划分

  • 细胞类型分类:按小鼠/人、皮层区域、转基因 Cre 系划分;典型做法按细胞或按"供体×脑区×层"留出,避免同一动物切片泄漏。
  • 影像-表达关联:多数研究用全量健康供体表达作为"空间先验",用独立临床队列(如 GENFI 的 VBM t-map)做关联验证——即 ABA 本身不分 train/test,外部验证交由疾病队列。
  • 空间转录组表征:社区把按解剖划分的结构当标签,基因表达当输入,做区域分类。

§5.3 泄漏风险(重点)

  • 供体/样本批效应:6 个微阵列供体间存在系统性差异,若样本与供体未分离做交叉验证,模型会学习"哪个供体"而非"哪个脑区"。
  • 探针→基因多对一:同一基因有多个探针且互相关联,逐探针抽样会造成实质冗余。
  • 配准共享:同一参考脑/参考图谱被反复用于不同任务的坐标锚定,不能把共享参考空间当作独立样本。
  • 病例-对照子研究(SCZ/Autism ISH)样本量小且结构强相关,训练/验证需按病例对照分开。
  • 邻近样本空间自相关:MNI 坐标相近的样本表达高度相似,坐标近邻切分会造成空间泄漏。

§5.4 交叉验证建议

按"供体"分组(Leave-One-Donor-Out)评估批效应泛化;对结构/区域任务按结构分层;细胞类型任务按动物或切片分组,并在报告里给出供体级方差,避免把生物学真实信号误当噪声平均掉。下面给出按供体分层交叉验证的示例(sklearn GroupKFold),供微阵列特征建模复用。

import pandas as pd
from sklearn.model_selection import GroupKFold, cross_val_score
from sklearn.ensemble import RandomForestClassifier

# expr: 样本×基因;donor: 每样本所属供体;y: 每样本结构标签
# groups = df["donor"].values
# gkf = GroupKFold(n_splits=len(set(groups)))          # Leave-One-Donor-Out
# clf = RandomForestClassifier(n_estimators=200)
# scores = cross_val_score(clf, expr, y, cv=gkf, groups=groups, scoring="balanced_accuracy")
# print("LODO balanced acc:", scores.mean(), "+-", scores.std())
任务 建议分组单元 目的
微阵列区域分类/表达预测 供体(donor) 消除批效应
ISH/连接组空间任务 供体/动物 + 结构 buffer 降空间自相关
单细胞/细胞类型分类 动物或切片 防同一动物泄漏
发育轴任务(BrainSpan) 个体(donor) 防个体内部多区泄漏
病例-对照 ISH 病例 vs 对照 防分组泄漏

§5.5 外部验证建议

对神经疾病结论,将模型/关联结果在独立临床队列(如 GENFI、ADNI 萎缩图、PsychENCODE)上验证;对细胞类型,可在另一物种(人 vs 鼠)或另一技术(RNA-seq vs MERFISH)上做跨验证,检验生物学可迁移性而非仅仅拟合某一图谱。推荐至少做一个"跨技术"或"跨队列"验证:若只在同一图谱内自洽,模型可能只是记住了参考空间的某种结构,而非真正的生物学规律。

§5.6 何时该用 / 何时不该用 ABA(决策清单)

适合用它:定位基因的脑区表达;把影像表型做分子解释;建立细胞类型分类基线;构建参考脑网络拓扑;为神经发育障碍做候选基因时空定位;给空间转录组模型做坐标对齐/预训练。

不适合用它:作为人群队列做患病率/流行病学统计;作为患者诊断或治疗模型训练集;作为某一人群表达的代表分布;在未做跨技术/跨队列验证时,直接推广小鼠或少数供体的"绝对表达量"结论。

判断准则:先问自己"结论要在什么尺度上成立"。若尺度是"这一批研究脑组织/参考空间",ABA 合适;若尺度是"某人群、某患者或某临床结局",请另找具代表性、带结局的临床数据。


§6 AI 就绪指南 ⭐

§6.0 云端快速启动

海量成像数据(连接组/Visual Coding 约 80 TB 量级)官方提供 AWS S3 公共桶(arn:aws:s3:::allen-brain-observatory,区域 us-west-2)。可在 AWS EC2 实例上启动 Jupyter 并用 AllenSDK 的缓存对象直读 S3,避免本地巨量下载。微阵列与 CCF 模板较小,本地即可处理。

云端三步建议

  1. 在 S3 桶所在区域(us-west-2)开一台带足够 NVMe 与计算资源的实例。
  2. pip install allensdk,用对应的 ProjectCache 指到 S3 上的 manifest(SDK 会按需拉取所需文件到本地缓存)。
  3. 分析完及时停实例;海量原始文件保留在 S3 桶,不重复下载。

成本提示:云端按运行时长与存储计费,小实验本地即可,仅当确实需要数十 GB–TB 数据时才上云,以免为闲置存储付费。

§6.1 快速上手

先说明目录预期:下面代码假定一个 data_root 目录,AllenSDK 会把 manifest 与拉取的数据放到其中;若只做入门,请先下载微阵列(按供体 zip,内含 CSV),再用 pandas 读取即可,不需要全量图像。

最小可用子集 = 单供体 SampleAnnot.csv + Probes.csv + MicroarrayExpression.csv(数百 MB 内)。

§6.2 数据获取

获取路径:门户 https://portal.brain-map.org/ 分图谱浏览/下载;微阵列 zip 可从对应 download tab 拉取;推荐用 AllenSDK 做程序化获取与组织。

子图谱 获取方式 参考量级
Human microarray 门户 download tab(按供体 zip) 数百 MB/供体
Mouse ISH 图像 AllenSDK image download / API 数十 GB 级
CCFv3 模板 AllenSDK 或 download server 10–100 μm 各体积
Connectivity / Cell Types AllenSDK ProjectCache 按需缓存
BrainSpan 转录组 brainspan.org download 页 数百 MB–GB
# 1. 安装官方 SDK(Python 3)
#    pip install allensdk
#    版本更新见 https://allensdk.readthedocs.io/

# 2. 用 AllenSDK 拉取细胞类型数据集(最小示例),需先设缓存目录
from allensdk.core.cell_types_cache import CellTypesCache
import tempfile, os

data_root = os.path.join(tempfile.gettempdir(), "aba_demo")  # 请替换为你的数据目录
ctc = CellTypesCache(manifest_file=os.path.join(data_root, "cell_types_manifest.json"))

# 列出可用的细胞元数据表格(含 cell_id、结构、转基因、分类等)
cells = ctc.get_cells()
print(cells.shape)
print(cells.head())

补充:人脑微阵列的另一种程序化获取(HTTP)

若不便装 SDK,也可直接请求数据服务接口获取清单文件并拼接下载地址。下面给出概念性骨架(具体端点与参数以 help.brain-map.org 为准,勿直接照搬未核实的 URL):

# 概念示例:通过结构化下载 API 取"结构→基因"清单需拼查询;此处仅示意思路
# 正规做法:查阅 help.brain-map.org 的 RMA / image download 文档后用其端点
# 然后按返回 JSON 里的文件地址下载到本地 data_root 并解压

提示:微阵列各供体数据以 zip 分发(内含 SampleAnnot/Probes/MicroarrayExpression/Ontology/README),推荐下载后用 §6.3 读取并核对表头;若你更需要"全脑影像"或"连接组",则改用 AllenSDK 的对应 Cache 与 S3 桶。

§6.3 预处理全流程

微阵列表达常见预处理:读取 → 探针映射清洗 → 按结构/供体聚合 → 挑每基因代表探针 → 标准化(Z-score)→ 供体级批效应校正。

import pandas as pd
import numpy as np

def load_ahba(root, sample_file="SampleAnnot.csv", probe_file="Probes.csv",
              expr_file="MicroarrayExpression.csv"):
    """读入单供体微阵列 zip 内的三份核心 CSV。"""
    samp = pd.read_csv(f"{root}/{sample_file}")
    probes = pd.read_csv(f"{root}/{probe_file}")
    expr = pd.read_csv(f"{root}/{expr_file}")  # 行=样本, 列=探针(或反之,按实际表头)
    return samp, probes, expr

def pick_representative_probe(expr, probes, gene_col="gene_symbol"):
    """每个基因选与其它探针相关性最高的一支作代表,降冗余。"""
    keep = []
    for g, sub in probes.groupby(gene_col):
        sub_expr = expr[sub["probe_id"]]
        if sub_expr.shape[1] < 1:
            continue
        corr = sub_expr.corr().abs()
        # 选平均相关最高的探针
        avg = corr.mean(axis=1)
        keep.append(avg.idxmax())
    return expr[list(set(keep))]

# 使用示例(路径按实际 zip 解压后调整)
# samp, probes, expr = load_ahba("/path/to/donor_dir")
# expr_rep = pick_representative_probe(expr, probes)
# z = (expr_rep - expr_rep.mean()) / expr_rep.std()

注:完整微阵列 zip 内含 README.txt 说明各文件表头含义;不同版本表头(如 sample_id/probe_id)以随包文件为准,请先 print 前几行核对列名再跑上游逻辑。

§6.4 PyTorch DataLoader

下面的 Dataset 类按(结构、基因/探针、表达值)三元组构造,可被监督的区域分类或表达预测使用;数据用 pandas 预载到内存(微阵列规模适中),再喂给 DataLoader。

import torch
from torch.utils.data import Dataset, DataLoader

class AllenRegionDataset(Dataset):
    """把解剖结构→表达谱组织成样本。结构编码为离散标签(区域分类演示)。"""

    def __init__(self, expr, structure_codes, structure_ids):
        # expr: [n_samples x n_features] 已标准化的表达矩阵
        # structure_codes: [n_samples] 每个样本对应结构的整数编码
        self.X = torch.tensor(expr.values.astype("float32"))
        self.y = torch.tensor(structure_codes.astype("int64"))

    def __len__(self):
        return len(self.y)

    def __getitem__(self, idx):
        return self.X[idx], self.y[idx]

# 假想:expr_rep 为 (样本×基因) 的 DataFrame;labels 为每样本结构标签
# dataset = AllenRegionDataset(expr_rep, labels, structure_ids)
# loader = DataLoader(dataset, batch_size=64, shuffle=True)
# for xb, yb in loader:
#     logits = model(xb)          # 你的分类器
#     loss = criterion(logits, yb)
#     break

把 Dataset 扩展到其它模态(思路):原理是把"单一样本 = 一条带标签的记录"这个抽象沿用下去——

  • 细胞类型分类:用 cell_id 行当样本,特征取该细胞的基因表达/电生理/形态向量,标签取 etype/mtype,并按 donor/animal 传给 DataLoader 做组划分。
  • ISH/图像:若做图像级表达识别,让 Dataset 在 __getitem__ 里按 experiment_id 从本地缓存取对应切片(建议用 AllenSDK 缓存而非每次下载)。
  • 影像-表达关联:常不以 DataLoader 为主,而先取微阵列样本的 MNI 坐标,在外部影像上采样做批量空间计算。

通用提醒:无论哪种模态,都应在 Dataset 里携带供体/动物分组字段(用于 §5.4 的 GroupKFold),而不是只给特征与标签;否则很难做正确的供体级验证。

§6.5 坑点(8 个)

⚠️ 坑点 1:微阵列供体批效应被误当脑区信号(分类:偏倚陷阱)

问题:6 个微阵列供体间存在系统性表达差异,若不做供体级划分,模型会学到"判别供体"而非"判别脑区"。
症状:按随机样本切分时精度很高,但 Leave-One-Donor-Out 或换供体后精度骤降。
解决

  1. 简单方法:报告分层结果前,先按 donor 做组级交叉验证。
  2. 进阶方法:用官方 white paper 的批量校正或 ComBat 等残差化供体效应,再做特征。
  3. SOTA 方法:把供体当随机效应建模(混合模型/元分析),或仅用于同供体内部结构相对比较。
    参考:Microarray Data Normalization technical white paper(human.brain-map.org Documentation);PMC7667525 方法(供体分层/排除)。

⚠️ 坑点 2:探针-基因映射歧义被忽视(分类:标签理解)

问题:一个基因常对应多个探针,且部分探针跨多个基因或落到基因间/不可映射区域,直接按探针列当作独立基因特征会引入冗余与错误标签。
症状:同一基因不同探针给出相矛盾的表达谱,特征共线性膨胀、可解释性崩溃。
解决

  1. 简单方法:对每个基因选一支代表探针(如与同基因其它探针相关性最高者)。
  2. 进阶方法:用 Re-Annotator 等工具重注释探针,剔除多义/基因间/不可映射探针后再聚合。
  3. SOTA 方法:将表达聚合到基因水平并给出探针不确定性权重,或在正则化模型中显式处理探针结构。
    参考:Richiardi 2015 / PMC7667525(重注释流程、剔除数量);Re-Annotator(Arloth et al.)。

⚠️ 坑点 3:MicroarrayExpression.csv 行列语义与探针表不一致导致错位(分类:工程陷阱)

问题:微阵列表达矩阵行/列组织(样本×探针 vs 探针×样本)及列名在不同下载包间并不统一,直接按位置合并会串行。
症状:特征与基因名错位,模型"训练即满分、测试失灵",且难以察觉。
解决

  1. 简单方法:任何合并前先核对 SampleAnnot/Probes 与表达矩阵的公共键与顺序,打印表头抽查。
  2. 进阶方法:用 mergeprobe_id/sample_id 显式 join,避免隐式按列位置拼接。
  3. SOTA 方法:写进统一的数据加载器并做单元测试(表头列名 + 维度断言 + 抽查值比对)。
    参考:OHBM Seattle Challenge 2013 数据说明(zip 内含文件结构与表头);AllenSDK 示例 notebook。

⚠️ 坑点 4:ISH 图像与连接组海量数据下载策略失当(分类:工程陷阱)

问题:全切片图像、STP 连接组与 Brain Observatory 原始成像达数十 GB–80 TB,若全部下载本地会耗尽磁盘;官方 SDK 默认组织也可能产生大量中间缓存。
症状:磁盘写满、下载中途失败、SDK manifest.json 路径错误导致反复重拉。
解决

  1. 简单方法:先只拉微阵列/CSV 起步,按需选子集图像。
  2. 进阶方法:用 AllenSDK ProjectCache 设好缓存目录并复用 manifest.json,断点续用;对海量数据走官方 AWS S3 桶直读。
  3. SOTA 方法:分析任务迁移到 S3 附近的 EC2 计算节点,采用"把算法推给数据"的云端范式。
    参考:AllenSDK readthedocs(CloudCache / ecephys 数据访问);brain-map.org tutorial。

⚠️ 坑点 5:人类供体样本量小、人口学偏倚被过度外推(分类:偏倚陷阱)

问题:成人微阵列主队列仅 6 供体且性别偏男,任何"人脑表达均值/分布"都不代表人群;把它当临床队列做患病率/预测会误导。
症状:声称的"人脑表达规律"在多样本脑库或另一技术数据上不稳健。
解决

  1. 简单方法:报告供体数并把结论限定为"本研究供体范围内"。
  2. 进阶方法:与 BrainSpan、GTEx、PsychENCODE 等多源转录组做交叉一致。
  3. SOTA 方法:对结论用独立死后脑组织/单细胞数据验证,避免单一图谱当作人群金标准。
    参考:Hawrylycz 2012(6 供体方法说明);GTEx / PsychENCODE 对照。

⚠️ 坑点 6:共享参考空间被当作独立样本造成重复/泄漏(分类:数据泄漏)

问题:所有 ISH/连接组/细胞被配准到同一 CCF 或共享 MNI 空间,跨脑"邻近"样本在坐标上高度相关;若建模把它们当 i.i.d. 样本,验证被高估。
症状:用空间邻近做交叉验证时精度虚高,真实空间外推失败。
解决

  1. 简单方法:按结构/供体/动物分组做组交叉验证,勿按坐标邻近切分。
  2. 进阶方法:在训练/测试间引入空间间隔(buffer),降低空间自相关泄漏。
  3. SOTA 方法:空间统计/field 建模把坐标当显式协变量,或报告跨供体相对比较结果。
    参考brain-map.org 空间配准文档;CCF 社区工具列表(配准方法为独立课题)。

⚠️ 坑点 7:过时教程沿用已弃用的 Python 2 AllenSDK API(分类:工程陷阱)

问题:AllenSDK 在 2019-10 起弃用 Python 2 并移除旧文件/依赖,网上旧博客仍用 py2 时代的类名与方法。
症状import 报错、StructureTree/缓存类名或参数不匹配、示例代码不可运行。
解决

  1. 简单方法pip install -U allensdk 并只参考官方 readthedocs 当前 notebook。
  2. 进阶方法:把示例迁移到 ProjectCache/当前缓存对象;关注官方 What's New 变更记录。
  3. SOTA 方法:用 Docker 固定 AllenSDK 版本 + Python 3.11 环境,确保可复现。
    参考:AllenSDK GitHub(index.rst What’s New);allensdk.readthedocs.io

⚠️ 坑点 8:把"免费可下载"误认为可任意再分发/商用(分类:数据泄漏 / 合规)

问题:ABA 数据"免费共享"易让人误以为等同 CC0/CC BY;实际艾伦研究所持有版权,非商业使用须按 Citation Policy 引用,商业用途须书面批准。
症状:在商业化产品/衍生数据集里再分发或商用,面临合规与版权风险。
解决

  1. 简单方法:阅读官方 Terms of Use 与 Citation Policy,逐字引用数据。
  2. 进阶方法:对外工具/论文中给出每个图谱/图像的规范引用(含 URL)。
  3. SOTA 方法:如需商用或再分发派生数据,提前联系艾伦研究所获取书面授权。
    参考alleninstitute.org citation policy;Allen Brain Map Terms of Use;CASRAI 指南。

§6.6 数据增强

场景 增强操作 安全/危险 理由
微阵列区域分类 结构级表达 + 高斯噪声/自举 安全 ✅ 提升鲁棒性,不破坏生物学
图像模态(ISH/组织学) 翻转、旋转、平移 安全 ✅ 空间不敏感任务可接受
单细胞分类 基因子采样/bagging 安全 ✅ 提高类别平衡性
基因共表达分析 对离散计数随意扰动 危险 ❌ 破坏真实共表达结构
空间预测 坐标插值生成"新脑区" 危险 ❌ 合成样本非真实,泄漏风险
任何任务 增强后未正确按供体切分 危险 ❌ 供体泄漏

实操建议:增强应当服务于"提升对生物学/采样噪声的鲁棒性",而非伪造结构;凡涉及合成/扰动样本,都应注明并确认其不进入供体训练集泄漏。对微阵列这类小样本高维数据,优先用正则化与跨供体验证,而不是堆砌增强。

§6.7 模型推荐表

任务 推荐模型 输入 说明
脑区/结构分类 MLP/GBDT(表达为特征) 基因表达向量 基线简单稳健,适合做上界判断
影像-表达空间关联 空间相关/回归、稀疏回归 MNI 表达 + 影像 t-map 逐坐标相关或空间模型
细胞类型分类 随机森林/SVM→深度分类 单细胞表达 类别高度结构化,树模型常强
连接组网络 图网络/连接矩阵统计 区域连接矩阵 用于网络级脑建模
空间转录组表征 自编码器/Transformer(表达+坐标) 表达+结构/坐标 社区新兴方向

选型要点:先跑"表达→结构"的简单 MLP/GBDT 基线以判断任务可解性与供体方差;若你真正关心的是"该脑区在疾病中脆弱",应优先采用空间关联方法而非分类精度作为评价,因为后者易受供体/结构不平衡支配。深度模型适合大样本单细胞/图像,但在 6 供体微阵列上容易被批效应主导,需谨慎设计。

§6.8 硬件需求表

场景 CPU 内存 GPU 存储 建议
入门/微阵列分析 16 GB 可选 数十 GB 笔记本即可
单细胞/全图像批量 64 GB 8–16 GB VRAM 数百 GB–TB 云端或工作站
连接组/Brain Observatory 海量 多卡 数十–80 TB 迁至 S3 附近计算

预判:绝大多数初学与影像-基因关联研究用不上 GPU,瓶颈在下载与组织数据而非计算。建议在购买/租用大规模存储前,先用微阵列 CSV 与 AllenSDK 小规模缓存跑通基线,再评估是否需要 GPU 与 TB 级磁盘。

§6.9 评估指标代码

import numpy as np
from sklearn.metrics import accuracy_score, f1_score, balanced_accuracy_score

def evaluate_region_classification(y_true, y_pred):
    """区域分类报告的指标:宏 F1 与平衡精度对类别不平衡更稳健。"""
    print("accuracy        :", round(accuracy_score(y_true, y_pred), 4))
    print("balanced_acc    :", round(balanced_accuracy_score(y_true, y_pred), 4))
    print("macro_f1        :", round(f1_score(y_true, y_pred, average="macro"), 4))
    print("weighted_f1     :", round(f1_score(y_true, y_pred, average="weighted"), 4))

# 对影像-表达关联,报告空间相关 r 与置换检验 p 值:
def spatial_corr(x, y):
    r = np.corrcoef(x, y)[0, 1]
    return r

§6.10 MLOps 笔记

  • 用 AllenSDK 缓存 + manifest.json 锁定下载,配合 Docker 固定 SDK/Python 版本保证可复现。
  • 所有样本级/供体级划分在跑数前固定,避免迭代中渗漏。
  • 记录数据获取日期与子图谱版本,因滚动发布导致"数据漂移"需在论文中标注版本。
  • 版权标注:把引用模板写进配置(数据集名+图谱+URL+论文 DOI),自动进 methods 段。
  • 实验版本化:把"图谱版本 + SDK 版本 + 供体划分 + 探针清洗规则 + 归一化方式"写进一条运行 hash,任何改动触发新 run,保证论文可追溯。
  • 存储治理:为每类大文件(NWB、图像、模板)设定独立目录与引用计数,防止重复下载;对共享/复用文件用符号链接避免副本爆炸(SDK 新版本已自动构造跨版本相同文件的链接)。

§6.11 一个可运行的端到端最小示例

下面给出一条"下载最小数据 → 训练 → 按供体评估"的完整主线(假设你已把微阵列 zip 解压到 data_root)。它演示了 §6.3–§6.4 的拼装,也作为后续替换成图像/单细胞数据的模板。

# 伪真实流程:从单供体微阵列做"结构分类"基线
# 需要:data_root 下有某供体的 SampleAnnot.csv / Probes.csv / MicroarrayExpression.csv
import os
import pandas as pd
from sklearn.preprocessing import LabelEncoder
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import cross_val_score

DATA = "/path/to/donor_dir"          # 改成实际路径
def read_files(root):
    samp = pd.read_csv(os.path.join(root, "SampleAnnot.csv"))
    probes = pd.read_csv(os.path.join(root, "Probes.csv"))
    expr = pd.read_csv(os.path.join(root, "MicroarrayExpression.csv"))
    return samp, probes, expr

samp, probes, expr = read_files(DATA)
print("samples:", samp.shape, "| probes:", probes.shape)

# 取结构粗粒度标签(用一级结构减少类不平衡)
def coarse_structure(path_str):
    parts = [p for p in str(path_str).split("/") if p]
    return parts[2] if len(parts) > 2 else parts[-1]   # 按本体层级取粗结构

labels = samp["structure_id_path"].map(coarse_structure)
enc = LabelEncoder(); y = enc.fit_transform(labels)

# 探针按基因聚合:挑每基因代表列(简版:取前若干探针列)
probe_cols = expr.columns.tolist()   # 视实际表头
X = expr[probe_cols].fillna(0).values.astype("float32")

# 若表达按 供体/结构 归一化后,X 即可直接训练
clf = RandomForestClassifier(n_estimators=100, random_state=0)
scores = cross_val_score(clf, X, y, cv=3, scoring="balanced_accuracy")
print("3-fold balanced acc:", scores.mean())

说明:实际运行前请按 §6.3 实现探针代表选取与供体分层交叉验证(§5.4),并核对表头;上例仅为把数据流串起来的可运行骨架。

§6.12 常见分析路径小结

你的问题 走哪一层数据 官方/社区入口
某基因在哪个脑区高表达 微阵列表达 / ISH 图像 human/mouse.brain-map.org gene search
某脑区富集哪些基因 表达矩阵 + 结构过滤 差异/相关搜索工具
影像萎缩 vs 局部表达 微阵列 + MNI 坐标 空间关联工作流
神经元属于哪一类型 单细胞转录组/电生理/形态 Cell Types Database + AllenSDK
脑区之间如何连接 连接矩阵 Connectivity Atlas + Brain Explorer

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
供体数量与人口学偏倚 成人微阵列仅 6 供体、偏男、以白种人为主 限定结论范围,多源交叉验证
解剖取样偏倚 皮层/结构覆盖不匀,某些深部结构样本稀疏 按结构分层、报告样本量
探针-基因映射偏倚 多义探针与基因间探针引入噪声 重注释 + 挑代表探针
技术平台偏倚 微阵列 vs RNA-seq 检出灵敏度不同 跨技术验证关键结论
采集批次偏倚 跨年份/跨供体批次效应 white paper 归一化 + 批效应模型
物种偏倚(小鼠→人) 小鼠 ISH 结论不能直接外推人类 人鼠对照、以人类数据为终
发育阶段取样偏倚 产前集中于 15–21 周窗口 BrainSpan 全发育轴互补
死因/终末期影响 死后脑组织受死因与终末期影响 BrainSpan 排除标准
覆盖偏倚 皮层详、深部/脑干稀疏 按结构分层报告

§7.2 标注质量

解剖标注由艾伦研究所专业团队依托统一 Allen Reference Atlas 完成;ISH 信号与连接组信号经自动化管线量化并有 QC 标准(如连接组剔除约 25% 成像质量不足的脑)。人工解剖标注在深部精细结构上存在专家间差异(社区配准研究中以 ~39–49 μm 量级变异衡量),但没有对外公开的统一逐结构人机一致性评分,使用时应自行复核关键结构的标注。

评估上需要注意:标注的"重复性"集中在采集管线的批次可控性(Lein 2007 论文补充数据对 ISH 平台的重复性做了对照),而"解剖学正确性"更多依赖参考图谱本身被接受的程度。CCFv3 已作为社区标准广泛用于坐标配准,但其边界在个体间仍存在解剖变异,把标签当作绝对真值会低估生物学变异。建议在模型论文中既报告所用本体版本,也说明是否做了边界校核。

§7.3 泛化性表

场景 失效风险 证据
用 6 供体表达代表"人脑" 高(供体偏倚) Hawrylycz 2012 供体有限
小鼠 ISH 直接推人脑表达 高(物种差异) BrainSpan 人鼠差异论文
空间关联结论跨临床队列 需独立队列验证(如 GENFI)
配准空间外推到实验图像 不同模态须专门注册方法
发育规律外推到 <8 孕周 高(窗口外无数据) BrainSpan 范围 8 孕周起
深部结构结论跨图谱 深部样本稀疏

§7.4 伦理

人脑组织来自经死亡脑库与机构伦理委员会核准的捐献,使用前按标准剔除药物滥用、神经/精神疾病、显著病变等(BrainSpan white paper 标准)。所有数据去标识化,仅发布聚合的解剖与分子测量,不含个人可识别信息。小鼠实验遵循动物福利标准,由研究所 IACUC 监管。

研究伦理要点:对研究者而言,使用死后脑组织转录组应在材料方法中披露供体来源与伦理核准信息;对产前/儿童期数据(BrainSpan 覆盖胎儿期样本),使用者更应审慎处理,不做超出"发育表达谱"范围的推断;任何把表达与行为/认知表型直接挂钩的强主张都需额外证据支持。

§7.5 公平性

ABA 不是人群队列,不提供用于医疗公平性评估的人口学代表性样本;其供体构成偏白、偏男且非随机。研究者不得用它推导任何人群的疾病分布或照护公平性结论。若你的研究意在服务特定人群,需在独立、具代表性的人群队列中补充数据,并把 ABA 仅作为分子解剖先验使用,而不是当作人群统计样本。

§7.6 数据漂移

各子图谱为滚动发布,随新供体/新技术持续增补;探针设计、归一化方法与 CCF 版本随年代演进(CCFv1→v3 等)。跨年份比较或复现时,必须记录并固定所用图谱版本、SDK 版本与获取日期,否则可复现性受损。AllenSDK 亦持续迭代(2.x 系列、2019-10 起弃用 Python 2),教程与 API 可能过时,务必以官方 readthedocs 与 GitHub What’s New 为准。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ⚠️ 各子图谱格式不一(矩阵 vs 图像 vs 单细胞),需自行转长/标准化
2 唯一标识 sample_id / probe_id / cell_id / structure 均有稳定 ID
3 特殊字符 ⚠️ 结构本体路径含 / 层级分隔,需注意解析
4 重复行 ⚠️ 一基因多探针、多结构共用参考,非严格无重复
5 缺失编码 ⚠️ 缺失(未测 vs 不表达)语义未系统区分
6 标签标识 结构本体与 CCF 标签规范清晰
7 罕见类分组 ⚠️ 深部小结构样本稀疏,需分层/聚合
8 偏倚评估 供体/人口学偏倚已被广泛讨论
9 数据字典 ⚠️ 官方有 white paper/README,但无统一全家族字典
10 信息性缺失解释 ⚠️ 未系统区分"未测"与"不表达"
11 设备记录 采集设备与成像参数在论文/white paper 有记录
12 共线性 ⚠️ 探针多对一与空间邻近致高共线性
13 编码映射 ⚠️ 探针→基因映射需社区重注释校正
14 时间戳处理 ⚠️ 各子图谱发布/采集日期分散,需自行整理
15 划分建议 无官方 ML train/test 划分
16 泄漏讨论 供体/共享参考空间泄漏风险可识别
17 标签分布 ⚠️ 结构样本分布不均,需自行统计
18 测量偏倚 微阵列批效应已有官方 white paper 与社区缓解
19 外部验证建议 社区惯例以独立疾病队列验证
20 版本记录 ⚠️ 图谱滚动发布,需自行锁定版本
21 预处理脚本 ⚠️ 官方无统一端到端脚本,SDK 提供组件
22 合规要求 许可/引用政策明确
23 多模态对齐 ⚠️ 靠共同坐标空间对齐,跨模态一一映射仍需自定义
24 去标识化 人脑组织去标识化、聚合发布

DAIMS 评分:14.5 / 24

评分解读:Allen Brain Atlas 在唯一标识、偏倚评估、设备记录、去标识化与合规说明上表现优秀,体现其"研究级开放资源"的严谨性;主要失分集中在"机器学习就绪"的软件层面——无官方 train/test 划分、缺失语义与数据字典未统一、探针映射与空间共线性需要自行清洗、跨模态对齐依赖参考空间而非一一对应文件。作为基础科学图谱而非竞赛基准,这些不足属"待使用者自行封装"而非"数据本身缺陷"。

对你意味着什么:若目标是立即做基准训练,请先自己固定一套划分(按供体/结构)并在论文中写明版本与 SDK 日期;若目标是做影像-表达或基因定位研究,请优先采用官方归一化微阵列 + 重注释探针 + 供体分层,并在独立疾病队列验证;若目标是可复现与合规发布,务必锁定 CCF/图谱版本、固定 Python/Docker 环境、并按官方 Citation Policy 逐字引用数据与图谱。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
GENFI 额颞叶痴呆 VBM 萎缩图 GENFI 联盟 影像-基因空间关联 空间相关显著性 需独立校正 萎缩图与星形/内皮细胞相关基因富集相关(PMC7667525)
BrainSpan/GTEx 交叉 艾伦/NIH 等 人脑表达一致性 表达谱一致 供体/技术差异 多源转录组需交叉核对
PsychENCODE NIH 系 精神疾病基因调控 基因优先级 发育期病因定位
MERFISH/单细胞空间数据 艾伦等 细胞类型转录组一致性 类型映射重叠 技术/分辨率差异 以单细胞技术复核 ISH/微阵列结论
SEA-AD 艾伦等 阿尔茨海默病态表达 疾病相关基因空间定位 疾病态 vs 健康基线 补图谱健康基线的疾病对照

使用说明:ABA 提供的是健康/疾病来源的分子解剖基线,真正的"疾病验证"必须落在独立、含病例对照与结局的队列上;上表多数外部验证属于"技术交叉一致性"而非"结局预测验证",读者不应据此得出任何临床有效性结论。


§8 基准性能与生态

§8.1 排行榜

Allen Brain Atlas 本身没有标准化公共排行榜。作为研究资源,它的"基准"更常体现为被引证的方法学工作流与社区挑战赛(如 OHBM Seattle Challenge 2013"影像×ABA 整合"),这些任务的数值不可直接跨方法比较。下表列出代表性方法/工作流作为生态基线而非正式排名:

排名 模型/方法 性能 年份 关键技术 完整引用 代码
影像-表达空间相关(OHBM 挑战基线) 逐坐标相关 2013 坐标采样 + 相关 OHBM Seattle Challenge 2013 GitHub 示例
Re-Annotator 重注释流程 探针正确映射 2015 重注释 Richiardi et al. 2015 Re-Annotator
GENFI 空间关联分析 FDR 显著富集 2020 空间随机效应 + 元分析 PMC7667525
皮层-丘脑层级连接刻画 系统级分类 2019 图/层级分析 Harris et al. 2019

⚠️ 表中"性能"不具统一可比性,因任务、数据版本与验证协议各异;引用前请查阅原文方法。若读者需要在自有数据上建立基准,建议以"按供体分层 + 平衡精度/宏 F1"为统一报告口径(见 §6.9)。

§8.2 SOTA 总结与选型建议

当前领域不存在单一 SOTA 榜单;成熟做法是用官方归一化表达 + 重注释探针做特征,按供体划分,再在独立疾病队列验证空间关联。对空间转录组表征,新兴 Transformer/坐标模型正在兴起,建议以简单 MLP/相关基线为上界判断后再升级。选型三问:①任务是否真需要深度学习(6 供体微阵列往往不需要);②评价指标是分类精度还是空间关联显著性(后者更能体现疾病脆弱性);③是否有独立外部队列做终点验证(否则结果易停留在图谱自洽)。

§8.3 评测协议

  • 固定图谱版本 + AllenSDK 版本 + 获取日期。
  • 按供体做组交叉验证,报告供体级方差。
  • 影像-表达任务用空间相关 + 置换检验/元分析校正。
  • 关键结论跨多源转录组与独立临床队列复核。
  • 报告结构本体与 CCF/MNI 参考版本,便于他人对齐与复现。

§8.4 相关数据集表

数据集 关联 与 ABA 互补
Human Connectome Project 功能/结构连接影像 提供人群功能连接,缺基因表达
GTEx 多组织转录组 覆盖全身体,补脑外对照
PsychENCODE 精神疾病基因调控 疾病基因调控补充发育表达
UK Biobank 人群队列影像 大样本影像 + 遗传
CCF / Allen Reference Atlases ABA 内部参考 标准解剖空间
MERFISH/空间转录组(含艾伦 ABC Atlas) 单细胞空间表达 比 ISH 更高的空间转录分辨率,可与 ABA 做交叉验证
SEA-AD(西雅图 AD 图谱) 阿尔茨海默病细胞图谱 补 ABA 所缺的疾病态空间表达
CZ Cell x Gene 单细胞托管 让 ABA 细胞类型可在线浏览比对

用法提示:做跨数据集研究时,务必核对表达谱的来源技术(微阵列 vs RNA-seq)、坐标空间(CCF/MNI)与样本纳入标准是否可比,避免把不同粒度数据直接合并。

§8.5 关键论文

  • Lein, E.S. et al. (2007). Genome-wide atlas of gene expression in the adult mouse brain. Nature, 445, 168–176. DOI 10.1038/nature05453 — 建立约 20,000 基因小鼠 ISH 全基因组图谱,奠定 ABA 范式。
  • Hawrylycz, M.J. et al. (2012). An anatomically comprehensive atlas of the adult human brain transcriptome. Nature, 489, 391–399. DOI 10.1038/nature11405 — 报道 6 供体 3,702 样本人脑微阵列转录组,是最被引的人脑表达资源。
  • Oh, S.W. et al. (2014). A mesoscale connectome of the mouse brain. Nature, 508, 207–214. DOI 10.1038/nature13186 — 建立 AAV 示踪 + 串行双光子的小鼠中尺度连接组。
  • Miller, J.A. et al. (2014). Transcriptional landscape of the prenatal human brain. Nature, 508, 199–206. DOI 10.1038/nature13185 — 绘制产前人类脑转录图谱,服务神经发育障碍研究。
  • Harris, J.A. et al. (2019). Hierarchical organization of cortical and thalamic connectivity. Nature, 575, 195–202. DOI 10.1038/s41586-019-1716-z — 连接组层级组织的后续系统刻画。
  • Sunkin, S.M. et al. (2013). Allen Brain Atlas: an integrated spatio-temporal portal for exploring the central nervous system. Nucleic Acids Res., 41, D996–D1008 — 门户结构与数据服务的综述。
  • Tasic, B. et al. (2018). Shared and distinct transcriptomic cell types across neocortical areas. Nature(细胞类型转录组系列) — 建立新皮层细胞类型转录组分类。
  • Shen, E.H., Overly, C.C., Jones, A.R. (2012). The Allen Human Brain Atlas: comprehensive gene expression mapping of the human brain. Trends Neurosci., 35, 711–714. DOI 10.1016/j.tins.2012.09.005 — 人脑图谱子图谱构成与设计要点的综述。

引用策略:凡使用某一子图谱,建议同时引用其主论文与配套参考图谱/门户论文,形成完整的 methods 引用闭环。

§8.6 社区活跃度

艾伦研究所报告其开放资源每年吸引约 350,000 名全球神经科学家交互(brain-map.org 首页 2020 前后口径)。AllenSDK 在 GitHub 活跃维护、文档持续更新,社区论坛 community.brain-map.org 提供官方答疑,并鼓励提交 Community Tool。多篇旗舰论文引用量数千,数据被广泛用于基因-影像关联研究。需要说明:这些交互与引用反映的是"学术复用热度",并不代表存在统一、可比的基准排行榜——比较结果时必须看各自原文方法与协议。

§8.7 生态快照表

资源 类型 链接 推荐理由
AllenSDK Python SDK github.com/AllenInstitute/AllenSDK 官方数据访问与缓存
Allen Brain Map 门户 数据门户 portal.brain-map.org 全子图谱浏览/下载入口
Allen Brain Map 知识库 文档 knowledge.brain-map.org 引用/图谱/工具权威来源
社区论坛 论坛 community.brain-map.org 官方答疑与 Community Tool
BrainSpan 发育图谱 brainspan.org 发育转录组下载
Allen Reference Atlases / CCF 参考图谱 atlas.brain-map.org 解剖注释与模板体积
Allen Institute 论文/白皮书 文献 alleninstitute.org 方法与归一化细节

生态提示:ABA 的价值很大程度来自其配套社区工具(如脑配准、可视化、空间建模)与持续更新的 SDK/文档。选择工具时优先官方维护或社区广泛采用的方案,并留意其数据版本与 CCF 版本是否匹配;同时把这些工具一并写进论文的 methods,以利他人复现。


§9 资源与引用

§9.1 官方资源

§9.1b 教程与入门路径(建议顺序)

  1. 先在官网用 Gene Search / Structure 浏览器熟悉数据结构,形成"某个基因在哪表达"的直觉。
  2. 读一两个官方入门 tutorial(help.brain-map.org / brain-map.org tutorials),了解 ISH 与微阵列的不同获取方式。
  3. 装 AllenSDK,跟着 readthedocs 的 notebook 跑通 Cell Types Cache 与 CCF 模板下载。
  4. 做一次最小可复现分析:下载一个供体微阵列 → 读取 CSV → 按结构聚合 → 用 §6.11 骨架训练一个结构分类基线。
  5. 复现一篇方法学论文(如影像-表达空间关联)作为质量控制,再把流程迁移到你自己的任务上。
  6. 若需商用或再分发,先读 Terms of Use 与 Citation Policy,必要时联系研究所取得书面授权。

§9.2 BibTeX

@article{lein2007genome,
  author  = {Lein, Ed S. and Hawrylycz, Michael J. and Ao, Nancy and others},
  title   = {Genome-wide atlas of gene expression in the adult mouse brain},
  journal = {Nature},
  year    = {2007},
  volume  = {445},
  number  = {7124},
  pages   = {168--176},
  doi     = {10.1038/nature05453}
}

@article{hawrylycz2012anatomically,
  author  = {Hawrylycz, Michael J. and Lein, Ed S. and Guillozet-Bongaarts, Angela L. and others},
  title   = {An anatomically comprehensive atlas of the adult human brain transcriptome},
  journal = {Nature},
  year    = {2012},
  volume  = {489},
  number  = {7416},
  pages   = {391--399},
  doi     = {10.1038/nature11405}
}

@article{oh2014mesoscale,
  author  = {Oh, Seung Wook and Harris, Julie A. and Ng, Lydia and others},
  title   = {A mesoscale connectome of the mouse brain},
  journal = {Nature},
  year    = {2014},
  volume  = {508},
  number  = {7495},
  pages   = {207--214},
  doi     = {10.1038/nature13186}
}

@article{miller2014transcriptional,
  author  = {Miller, Jeremy A. and Ding, Song-Lin and Sunkin, Susan M. and others},
  title   = {Transcriptional landscape of the prenatal human brain},
  journal = {Nature},
  year    = {2014},
  volume  = {508},
  number  = {7495},
  pages   = {199--206},
  doi     = {10.1038/nature13185}
}

@article{harris2019hierarchical,
  author  = {Harris, Julie A. and Mihalas, Stefan and Hirokawa, Karla E. and others},
  title   = {Hierarchical organization of cortical and thalamic connectivity},
  journal = {Nature},
  year    = {2019},
  volume  = {575},
  number  = {7781},
  pages   = {195--202},
  doi     = {10.1038/s41586-019-1716-z}
}

§9.3 引用指南

数据集引用建议按艾伦官方 Citation Policy:给出"数据集名 + 图谱 + 来源 URL + 对应论文 DOI",并在 figures/methods 中同时引用配套参考图谱与数据。示例:Allen Institute for Brain Science (2004). Allen Mouse Brain Atlas [dataset]. Available from mouse.brain-map.org. 再配 Lein et al. 2007, Nature. DOI 10.1038/nature05453。图像复用署名为 Image credit: Allen Institute for Brain Science. 加具体 URL。

何时必须引用:引用政策是使用条件(非仅学术惯例)——凡在论文、海报、网页、工具或公开材料中使用艾伦数据/图像/工具,都应在标题图注或材料方法中给出规范引用;若你构建并分发包含艾伦派生数据的可视化或工具,请在相关界面与说明中标注来源与引用。

常见引用写法(示意,按你实际使用的图谱替换)

Data: Allen Institute for Brain Science (2012). Allen Human Brain Atlas
      [dataset]. Available from human.brain-map.org.
      https://human.brain-map.org/
Reference atlas: Allen Institute for Brain Science (2011).
      Allen Reference Atlas – Mouse Brain [brain atlas].
      Available from atlas.brain-map.org.
Primary paper: Hawrylycz, M.J. et al. (2012). Nature 489:391-399.
      https://doi.org/10.1038/nature11405
Image credit: Allen Institute for Brain Science.
      [link to the specific page where the image is found]

商业/再分发提示:非商业研究可免费使用但须正确引用;若涉及商业用途、或以派生数据形式对外再分发,请先阅读 Allen Brain Map Terms of Use,并向研究所申请书面授权后再进行。

§9.4 支持与进一步帮助

需求 入口
数据/工具使用问题 社区论坛 community.brain-map.org(官方答疑)
数据获取与下载报错 AllenSDK GitHub issues
API 端点细节 help.brain-map.orgapi.brain-map.org 文档
许可证/引用/商用咨询 alleninstitute.org Citation Policy / Terms of Use,必要时联系研究所
算法/软件工具发布 提交 Community Tool(官方鼓励)

说明:以上链接为公开入口,实际使用请以艾伦研究所当期为发布的最新文档与政策为准;本页列出的链接仅为便于检索,不构成对任何第三方站点的背书。


§10 AI 使用声明卡

§10.1 AI 模型列表

本页面由 CodeBuddy Code(fast-model)辅助撰写;未使用医疗专用微调生成模型。

§10.2 AI 参与范围

用于起草结构、从检索事实中组织内容、撰写代码示例;所有规模数字与引用均回溯到公开来源并经人工核对。

§10.3 输入来源列表

  1. brain-map.org 官方门户(子图谱与文档)
  2. alleninstitute.org 新闻与 Citation Policy
  3. help.brain-map.org 数据/API 文档
  4. Lein et al. 2007, Nature(nature.com, DOI 10.1038/nature05453)
  5. Hawrylycz et al. 2012, Nature(nature.com, DOI 10.1038/nature11405)
  6. Oh et al. 2014, Nature(pubmed, DOI 10.1038/nature13186)
  7. Miller et al. 2014, Nature(DOI 10.1038/nature13185)
  8. Harris et al. 2019, Nature(DOI 10.1038/s41586-019-1716-z)
  9. PLOS pbio.1001453(Allen Human Brain Atlas 综述)
  10. knowledge.brain-map.org(BrainSpan 转录组元数据)
  11. allensdk.readthedocs.io 与 AllenSDK GitHub
  12. re3data(Allen Brain Map 记录)与 SciCrunch(RRID)
  13. PMC7667525 / CASRAI 指南(许可与影像-基因关联方法)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景与 ICD-11/SNOMED 映射 千方病案医学编辑部 交叉审核 ✅ 已通过
§4 DAIMS 数据字典 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 预处理与坑点 千方病案医学编辑部 交叉审核 ✅ 已通过
规模数字与引用(§3/§8) 千方病案医学编辑部 对照来源核对 ✅ 已通过
§0 免责与合规声明 千方病案医学编辑部 交叉审核 ✅ 已通过

§10.5 AI 生成章节标注

正文绝大部分章节由 AI 依据检索事实起草后经人工交叉审核;无未经核实的临床主张或编造数字。

§10.6 最后人工审核日期

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集