信息速览

BigBrain — 20 µm 细胞分辨 3D 人脑图谱 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | BigBrain |
| 英文全称 | BigBrain — An Ultrahigh-Resolution 3D Human Brain Model |
| 别名/简称 | BigBrain 2015 release、BB |
| 疾病分类 | 神经系统疾病解剖参照框架(应用领域 ICD-11:6D85 痴呆 / 8A61 癫痫 / 8A00 帕金森病 / 8B11 脑梗死,详见 §2.1) |
| SNOMED CT | 12738006 Brain structure(脑结构)/ 49049000 Disorder of brain(脑疾患)(详见 §2.1b) |
| 数据模态 | 离体组织学切片(细胞体染色)+ 离体 MRI + 皮层表面网格 |
| AI 任务类型 | 皮层分层分割、细胞体实例分割、histology-MRI 跨模态配准、脑区分割/配准、染色强度回归、超分辨率参照 |
| 样本总数 | 1 名捐献者 / 7,404 张组织学切片 |
| 数据大小 | 原始切片扫描约 1 TB;CONP 镜像子集 112.5 GB(316 个文件,含 40 µm blocks 与 100-400 µm 体数据) |
| 数据格式 | MINC (.mnc)、NIfTI (.nii)、MNI-OBJ / GIFTI / STL 表面、切片扫描图 |
| 许可证 | CC BY-NC-SA 4.0 International(署名-非商业-相同方式共享) |
| 访问级别 | 开放(匿名 FTP / LORIS / EBRAINS 直接下载,使用须引用原始论文) |
| DUO 标签 | NCU(非商业使用;无其他附加限制) |
| 语言 | 英文(元数据与文档) |
| 首发日期 | 2013-06-21(Science 论文发表);2014-03-12 开放匿名 FTP 下载 |
| 最后更新 | 2015 release(主数据集);1 µm 重扫描子集 2022 年发布 |
| 发布机构 | Forschungszentrum Jülich(INM-1) & 麦吉尔大学 Montreal Neurological Institute |
| 官方主页 | https://bigbrainproject.org |
| 下载地址 | https://bigbrain.loris.ca |
| DOI | 10.1126/science.1235381(论文);CONP 镜像 ARK:n2t.net/ark:/70798/d7k3xtt8440k06khv0 |
| 引用次数 | 1,140+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 标准格式多分辨率分发、工具链(siibra/BigBrainWarp)成熟;扣分项:无监督任务官方划分、MINC 工具链有版本坑、20 µm 全量数据需大存储与 HPC 级资源 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
- 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 / SNOMED CT 映射、神经解剖学基础)、§7 偏倚分析。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BigBrain 采用 CC BY-NC-SA 4.0 许可证,允许署名前提下的非商业使用与相同方式共享,使用数据须引用 Amunts et al. 2013 Science 原始论文。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? BigBrain 是一个"数字化的完整人脑"。研究团队把一位 65 岁捐献者的大脑用石蜡包埋后切成 7,404 张 20 µm 厚的薄片,逐片染色(标记细胞体)、扫描,再像拼图一样重新拼回一个三维的脑。最终得到的 3D 模型分辨率达到 20 µm——比常规 MRI 图谱(约 1 mm)精细约 50 倍,接近单个细胞的尺度。
为什么重要? 在 BigBrain 出现之前,所有公开的人脑参考图谱都只能看到"毫米级"的宏观结构,看不见皮层内部的微观构造。BigBrain 首次把显微尺度的细胞结构装进了可计算的 3D 坐标框架,让科学家能把基因表达、受体分布、功能 MRI 等各种数据"钉"到真实的解剖细节上,也 2014 年入选 MIT Technology Review 年度十大进展。
我能用它做什么? 训练皮层分层分割模型、检测单个细胞体、把你的 MRI 数据与显微解剖对齐、构建染色强度剖面来刻画皮层微结构。原始论文在 Google Scholar 已被引用 1,140+ 次(截至 2026-09),是脑图谱与神经影像 AI 方向的基础设施级数据集。
§1.1 摘要
BigBrain 由德国 Forschungszentrum Jülich(INM-1,Katrin Amunts / Karl Zilles 团队)与加拿大麦吉尔大学 Montreal Neurological Institute(Alan Evans 团队)合作完成,历时约 5 年、投入约 1,000 小时人工处理,2013 年 6 月 21 日发表于 Science Amunts et al., 2013, Science. DOI: 10.1126/science.1235381。技术路线为:全脑离体 MRI 扫描(0.444 mm 各向同性)→ 石蜡包埋 → 大规模切片机切成 7,404 张 20 µm 冠状切片 → Merker 法细胞体染色 → 2400 dpi 平板扫描(单张图像最大 13,000 × 11,000 像素,原始数据约 1 TB)→ 人工去伪影 + 软件逐片配准 → 重建为 20 µm 各向同性 3D 体数据。分发的体数据提供 100/200/300/400 µm 多分辨率版本,覆盖组织学原生空间、MNI ICBM152 与 MNI ADNI 参照空间,格式为 MINC 与 NIfTI 双轨;另有皮层表面网格与 2015 release 的分块(40 µm blocks)数据。数据以 CC BY-NC-SA 4.0 开放,经匿名 FTP、LORIS 与 EBRAINS 三个渠道分发。
| 阶段 | 操作 | 产出 | 关键参数 |
|---|---|---|---|
| 1 | 离体 MRI 扫描 | 空间参照 | 0.444 mm 各向同性(离颅固定脑) |
| 2 | 石蜡包埋 + 大规模切片 | 7,404 张冠状切片 | 厚度 20 µm;每切一层拍摄未切面作参照 |
| 3 | Merker 细胞体染色 | 染色切片 | 灰质深染、白质不着色 |
| 4 | 平板扫描数字化 | 原始图像序列 | 2400 dpi;单张最大 13,000 × 11,000 像素;合计约 1 TB |
| 5 | 人工去伪影 + 序列配准 | 对齐后的切片堆栈 | 对齐到 blockface 影像与离体 MRI |
| 6 | 3D 重建与降采样 | 20 µm 各向同性模型 + 100-400 µm 体数据 | 三套坐标空间(组织学/ICBM152/ADNI) |
§1.2 战略价值
维度一:显微尺度与宏观图谱之间的"桥梁"。 常规人神经影像的体素在 1 mm 量级,而皮层厚约 2-4 mm、分为 6 层,宏观影像完全无法分辨层间结构。BigBrain 的 20 µm 各向同性分辨率恰好落在"看得见层状结构、又覆盖全脑"的独特位置:它是第一个能把体外细胞级观察与在体影像统一到一个坐标框架的全脑模型。BigBrainWarp 工具箱(eLife 2022)封装了 BigBrain 与 MNI152、fsaverage 等标准空间之间的变换,使"微观解剖特征 × 宏观功能数据"的联合分析成为可复现的常规操作 Wagstyl et al., 2022, eLife. DOI: 10.7554/eLife.70119。
维度二:AI 微结构建模的训练底座。 皮层 6 层的自动分割(CNN,2020)、1 µm 重扫描上的细胞体实例分割(2022-2023 扩展至约 900 个皮层 patch、约 52 GB)等里程碑工作都以 BigBrain 为数据基础;这些标注与模型反过来使 BigBrain 成为"从单一标本到全脑微结构图谱"的放大器。对 AI 团队而言,它同时提供了超大数据量(1 TB 原始扫描)、干净的灰白质对比(染色特性决定)和真实的三维连续性——这是二维病理切片集合不具备的属性。
维度三:开放科学生态的坐标锚点。 BigBrain 是欧洲 Human Brain Project / EBRAINS 体系的核心模板:Julich-Brain 概率图谱以它为 10 个核心脑之一,基因表达、受体密度等"区域特征"通过 EBRAINS Knowledge Graph 挂接到 BigBrain 空间;德国-加拿大 HIBALL 联合实验室(2020-2025,600 万欧元)继续以其为基础开发下一代多模态脑模型。选择把数据处理管线建在 BigBrain 空间上,等于接入一个持续维护、引用充分、工具链完整的生态,而非一次性数据快照。
§1.3 同类数据集横向对比
| 数据集 | 模态与规模 | 分辨率 | 标注 | 与 BigBrain 的差异化 |
|---|---|---|---|---|
| BigBrain(本页) | 1 例全脑,7,404 张切片,原始约 1 TB | 20 µm 各向同性(体数据 100-400 µm 多分辨率) | 皮层 6 层分割(CNN + 人工校验)、细胞结构分区参照 | 首个显微尺度全脑 3D 模型;灰白质对比来自细胞体染色 |
| Julich-Brain Atlas | 多例脑的细胞结构概率图谱(BigBrain 为其 10 个核心脑之一) | 概率图挂接于 MNI 空间 | 200+ 个皮层区的专家细胞结构图谱(Amunts et al. 2020) | 提供群体级概率分区;BigBrain 提供单一标本的显微底图 |
| Allen Human Brain Atlas | 1-2 例供体的基因表达 + 组织学 | 表达数据 100-300 µm 网格 | 全基因组表达谱 | 提供分子维度数据;3D 体参照能力弱于 BigBrain |
| ICBM152 / MNI 空间模板 | 数百名被试平均的 MRI 模板 | 约 1 mm | 无细胞级标注 | 在体影像标准空间;需经 BigBrainWarp 类工具与 BigBrain 互转 |
| NextBrain(2024,预印本) | 5 个半脑,约 10,000 张 H&E + LFB 切片 | 组织学全分辨率 + 概率图谱 | 333 个 ROI 手工标注 | 多标本概率化 + 直接服务 MRI 自动分割;数据尚在预印本阶段 |
| AHEAD 工作 | 2 例标本的定量 MRI + 配准组织学 | 亚毫米级 | 数十个基底节区结构 | 聚焦基底节;覆盖范围远小于 BigBrain 全脑 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2013-06-21 | Science 论文发表,图谱首发 | Amunts et al., Science 340(6139):1472-1475 |
| 2013-09-03 | NIfTI 体数据替换 | 官方修复初始格式转换的强度错误(详见坑点 1) |
| 2014-03-12 | 匿名 FTP 全量开放 | 全部切片与体数据开放匿名下载 |
| 2015 release | 主数据集正式版 | 7,404 张切片的轴/冠/矢三方向 20 µm 重建 + 组织学空间、MNI ICBM152、MNI ADNI 空间多分辨率 3D 重建(EBRAINS KG 登记版本) |
| 2022 | 1 µm 重扫描子集 | 选定切片以 1 µm 面内分辨率重扫描并对齐到 20 µm 空间(DOI: 10.25493/JWTF-PAB) |
| 2023 | 1 µm 皮层 patch 扩展 | 约 900 个 patch、约 52 GB,含分层标注与细胞体分割 |
§1.5 典型应用场景
- 皮层分层分割建模:以 100 µm 体数据 + 皮层表面为输入,训练/评估 6 层分割模型(Wagstyl et al. 2020 的官方基线)。
- histology-MRI 跨模态配准研究:用 BigBrainWarp 在 BigBrain、MNI152、fsaverage 之间变换特征图,研究微结构-功能关系。
- 细胞体实例分割:在 1 µm 重扫描 patch(约 52 GB、约 900 个 patch)上训练检测/分割网络,产出层级细胞密度。
- 超分辨率与合成参照:以 BigBrain 为"真值"研究 MRI 超分辨率或跨模态合成(如 T1-T2* 融合对比)。
- 微结构特征工程:沿等体积皮层表面采样染色强度剖面,提取分层特征用于分区、老化或疾病研究。
- 教学与科普可视化:siibra explorer 的云端渲染让 20 µm 全脑在浏览器中自由探索,是神经解剖教学与科普传播的高质量素材来源。
§2 医学背景
§2.1 ICD-11 编码映射
BigBrain 本身是解剖参照框架而非疾病数据集;下表列出其衍生研究最常服务的神经系统疾病领域(ICD-11 第 08 章"神经系统疾病"及精神章节相关编码):
| 标签 | ICD-11 编码 | 中文名称 | 与 BigBrain 的关系 |
|---|---|---|---|
| 解剖参照框架 | —(非疾病实体) | 人脑结构参照 | 全页数据集的定位:为各疾病研究提供显微解剖坐标框架 |
| 痴呆 | 6D85 | 痴呆 | 皮层萎缩与分层改变的微结构参照 |
| 癫痫 | 8A61 | 癫痫 | 致痫灶定位研究中皮层微结构建模参照 |
| 帕金森病 | 8A00 | 帕金森病 | 皮层下核团与皮层分区研究参照 |
| 脑梗死 | 8B11 | 脑梗死 | 卒中后皮层重塑研究的解剖底图 |
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 脑结构(解剖) | — | 12738006 | Brain structure(body structure) |
| 脑疾患 | 8A00-8B5Z 域 | 49049000 | Disorder of brain |
| 痴呆 | 6D85 | 52448006 | Dementia |
| 癫痫 | 8A61 | 128613002 | Seizure disorder |
§2.2 医学背景简介
人脑参考图谱的演进。 从 Brodmann(1909)与 von Economo(1925)的细胞结构分区图,到 Talairach 与 MNI 系列的 MRI 模板,人脑制图长期停留在宏观尺度:在体 MRI 的体素约 1 mm,无法分辨平均仅 2-4 mm 厚、由 6 层构成的皮层内部结构。BigBrain 的贡献是用连续切片组织学把"细胞体密度"这一微观维度数字化——Merker 染色使灰质深染、白质近乎不着色,从而在全脑范围内给出灰白质边界与层状结构的连续三维刻画 Amunts et al., 2013, Science。
皮层的分层结构。 新皮层由外向内分为 I-VI 层:I 层细胞稀疏;II、IV 层为颗粒层,细胞体密集(染色深);III、V 层含大锥体细胞。在染色强度沿皮层深度的剖面(staining intensity profile)上,I/II 交界处急剧变深、IV 层出现第二个峰——这些特征是自动分层算法的物理基础,也是 BigBrain 衍生研究最常提取的定量特征(BigBrainWarp 论文附录给出采样与平滑协议)。
| 层 | 名称 | 细胞构成 | 染色强度剖面特征 |
|---|---|---|---|
| I | 分子层 | 稀疏神经元、密集神经毡 | 全层最低强度基线 |
| II | 外颗粒层 | 小型颗粒细胞密集 | I/II 交界处急剧加深 |
| III | 外锥体层 | 中型锥体细胞 | 中等强度,随深度渐变 |
| IV | 内颗粒层 | 密集颗粒细胞(感觉区尤甚) | 第二个显著强度峰,分隔颗粒上层/下层 |
| V | 内锥体层 | 大型锥体细胞(运动区 Betz 细胞) | 强度回落 |
| VI | 多形层 | 多形细胞,过渡入白质 | 渐弱过渡至白质近零信号 |
流行病学语境。 作为参照框架,BigBrain 服务的人群疾病规模庞大:痴呆、癫痫、帕金森病、脑卒中均为全球高负担神经系统疾病。需要强调:BigBrain 标本为 1 例 65 岁男性、无神经系统与精神疾病记录,它提供的是"健康对照"级别的解剖参照,而非疾病队列数据;任何疾病结论都需要在疾病队列上验证。
流行病学角色定位三句话:① BigBrain 不提供任何患病率、发病率数据——它的"样本量"是 1 例健康标本;② 它在疾病研究中的位置是"对照解剖底座",例如为阿尔茨海默病皮层变薄研究提供层级的解剖参照系;③ 评估某疾病模型是否"解剖学合理"时,BigBrain 衍生的层厚/强度梯度常被用作健康基线(如 BigBrainWarp 教程中微结构梯度与疾病影像特征的对照范式)。
§2.3 临床任务定义
| 任务 | 输入 | 输出 | BigBrain 的角色 |
|---|---|---|---|
| 皮层分层分割(研究级) | 100 µm 体数据 + pial/white 表面 | 每体素/每顶点的 1-6 层标签 | 官方标注与 CNN 基线的训练底座 |
| 细胞体检测/分割(研究级) | 1 µm patch 原图 | 胞体轮廓与计数 | 提供层级细胞密度估计,替代百年前的手工计数 |
| 跨模态配准 | 在体 MRI / fMRI 特征图 | BigBrain 或 MNI 空间的映射 | 作为显微解剖靶空间,评估配准精度 |
| MRI 分割先验(转化研究) | 在体 MRI | ROI 分割 | 微结构先验来源(如经 Julich-Brain 概率图间接应用) |
§2.4 患者人群(标本)描述
| 维度 | 内容 |
|---|---|
| 来源 | 遗体捐献(死后脑),德国 Jülich 与加拿大蒙特利尔合作处理 |
| 数量 | 1 例(单一标本,无队列) |
| 年龄/性别 | 65 岁男性 |
| 临床筛查 | 死亡时临床记录无神经系统或精神疾病(官方 FAQ 表述) |
| 人种/族群 | 原始文献未记载(该维度缺失) |
| 标本状态 | 离颅、福尔马林固定后石蜡包埋;离体 MRI 于固定后采集 |
§2.5 临床与科研价值
对科研与转化而言,BigBrain 的价值在三点:其一,解剖真值——在体影像永远无法直接看到细胞层级的灰白质细节,BigBrain 提供了唯一的全脑级显微参照;其二,坐标锚点——基因表达、受体密度、电生理等异构数据可通过配准挂接到同一显微解剖框架(Julich-Brain 概率图即以 BigBrain 为核心脑之一);其三,AI 基础设施——层分割、胞体检测等模型以它为标准底座,衍生数据集(分层分割、1 µm patch)持续降低后来者的入门成本。临床直接应用(如个体患者的手术规划)尚属研究阶段,受单标本变异与配准不确定性限制(见 §7.3)。
需要强调的方法学边界:BigBrain 捕捉的是"细胞体密度"这一种组织学对比(Merker 染色),不携带髓鞘(如 Luxol Fast Blue)、纤维走向(如 DTI)或分子标记信息;用它做"全脑微结构"结论时,结论范围仅限胞体密度维度,扩展到其他组织学维度需引入衍生或配对数据集。
§2.6 金标准对照表
| 维度 | 内容 |
|---|---|
| 参照性质 | 单一标本的连续切片组织学 3D 重建(解剖参照,非疾病标签金标准) |
| 标注方式 | 人工去伪影(逐切片)+ 软件序列配准;皮层分层为"少量人工标注 + CNN 全脑外推"(Wagstyl et al. 2020);1 µm patch 分层由专家标注并经四眼校验(2023 扩展数据集) |
| 标注者资质 | 细胞结构分区由 Jülich INM-1 细胞结构学专家完成;patch 层边界标注经双人独立核验 |
| 一致性 | 官方文献未公布层间标注的定量一致性系数(如 Dice/Kappa),该维度不可得 |
| 空间参照 | 组织学原生空间 + MNI ICBM152 + MNI ADNI 三套坐标(配准非完美但质量很高,官方 FAQ 表述) |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 与在体 MRI/fMRI 快速对齐做 ROI 与特征映射 | 100 µm 体数据(MNI ICBM152 空间,NIfTI/MINC) | 112.5 GB(CONP 子集合计,含全部分辨率) | 已在标准空间,常用工具直接读取 |
| 皮层分层/微结构建模 | 100 µm 体数据(组织学空间,光学平衡版)+ 表面网格 | 同上 | BigBrainWarp 的 intensity profile 协议即基于此 |
| 细胞级形态学 | 1 µm 重扫描子集(2022)+ 约 900 个 patch(2023) | 约 52 GB | 面内 1 µm 可分辨单个胞体 |
| 全分辨率复现/大规模训练 | 20 µm 3D blocks(5×5×5 分块 + legend 体积) | 约 1 TB(官方全量) | 保留全部原始信息,需 HPC 级存储 |
| 快速定位与浏览 | EBRAINS siibra explorer 在线版 | 0(在线) | 免下载,支持逐层放大到 20 µm |
§3.1 模态详情
组织学切片(核心模态)。 7,404 张冠状连续切片,切片厚度 20 µm,Merker 法染细胞体(灰质深染、白质不着色)。数字化以 2400 dpi 平板扫描完成,单张图像最大 13,000 × 11,000 像素,原始记录约 1 TB;重采样后形成 20 µm 各向同性 3D 重建。分发的重建切片覆盖轴、冠、矢三个方向(2015 release)。
Merker 法(1983)的实用意义在于:它对石蜡切片的细胞体染色深、背景浅,灰白质对比强且对福尔马林固定兼容,使整脑规模的连续切片保持染色一致性可控;同时它不标记髓鞘,白质近乎"透明",这既成就了清晰的分层信号,也意味着纤维束信息需借助其他模态(如离体 MRI 或扩散数据)补足。
离体 MRI(辅助模态)。 离颅、福尔马林固定后的脑以 0.444 mm 各向同性体素扫描,作为切片配准的空间参照;注意该 MRI 位于"processing space"(y-z 轴翻转),且非在体状态(详见坑点 3)。
表面网格(衍生模态)。 皮层 pial 与 white matter 表面以 MNI-OBJ 分发(另有 GIFTI、STL 等转换格式),顶点规模以 327,680(每半球)为代表,供分层采样与表面分析使用。
§3.2 子集与样本构成
| 子集 | 内容 | 数量/规模 |
|---|---|---|
| 重建切片 | 20 µm 重建的组织学切片(轴/冠/矢) | 7,404 张 |
| 多分辨率体数据 | 100/200/300/400 µm 各向同性,MINC+NIfTI,三种空间 | 分辨率 4 档 × 空间 3 套 |
| 40 µm blocks | 全脑按 5×5×5 分块 + legend 体积 | 全分辨率近似替代 |
| 皮层表面 | pial/white,左右半球 | 每半球 327,680 顶点级 |
| 离体 MRI | 固定脑 T1 类对比 | 1 个序列(0.444 mm) |
| 皮层分层分割(衍生) | 6 层表面网格 + 体素掩膜 | 全皮层(Wagstyl et al. 2020) |
| 1 µm patch(衍生) | 重扫描 patch + 分层标注 + 胞体分割 | 约 900 个 patch / 约 52 GB(2023) |
§3.3 格式清单
| 对象 | 格式 | 说明 |
|---|---|---|
| 体数据 | MINC (.mnc) / NIfTI (.nii) | 双格式分发;MINC 为 MNI 原生格式,需 MINC2 工具链(坑点 4) |
| 切片图像 | 扫描图(重建序列) | 20 µm 重建版切片,轴/冠/矢三方向 |
| 表面 | MNI-OBJ / GIFTI / STL | STL 仅适合 3D 打印,叠合分析用 .gii(坑点 5) |
| 配准网格 | MINC grid | BigBrain→ICBM2009sym 非线性变换场 |
| 元数据 | EBRAINS KG 记录 / FAQ / README | 官方文档与知识图谱条目 |
格式选择的工程建议:Python 生态(nibabel/nilearn/PyTorch)优先 NIfTI;需要使用官方配准网格做自定义变换时才进入 MINC 工具链,且务必容器化(坑点 4);表面分析统一 GIFTI;STL 仅用于 3D 打印输出(坑点 5)。跨渠道下载时先核对格式版本再入管线,避免混用新旧分发(坑点 1)。
§3.4 存储大小
原始切片扫描约 1 TB(官方口径);EBRAINS KG 登记的全量下载约 1 TB;CONP DataLad 镜像子集 112.5 GB、316 个文件(40 µm blocks + 100-400 µm 体数据);2023 年扩展的 1 µm patch 数据集约 52 GB。磁盘规划建议:只做对齐与分层研究预留 200 GB 足够;复现全分辨率训练建议 2 TB 起步(含工作副本)。
不同渠道"全量"的定义不同,做存储预算时先确认口径:CONP 子集是"体数据+blocks"级别的精选(112.5 GB),而 FTP/EBRAINS 的 1 TB 包含原始切片扫描序列。团队常见做法是:本地保留 CONP 子集(日常分析),把 1 TB 全量放对象存储或集群共享盘按需拉取(DataLad 的按需 get 即为此设计)。
§3.5 标注方式
标注分三个层级:① 人工去伪影——逐切片由人工标记并剔除组织破损、污渍等伪影(Amunts et al. 2013 流程);② 皮层分层——Wagstyl et al. 2020 先在少量 2D 切片上人工标注 6 层边界,再用卷积神经网络沿 3D 皮层剖面全脑外推,输出表面网格与体素掩膜;③ 细胞结构分区与 patch 标注——Jülich 专家在冠状切片上做细胞结构分区(构成 Julich-Brain 图谱),2023 年的 1 µm patch 数据集包含专家层边界标注,经四眼程序校验。全脑层级没有"分类标签"概念,标注本质是空间掩膜与轮廓。
§3.6 标注者资质与一致性
细胞结构分区与 patch 层边界由 Jülich INM-1 的细胞结构学专家(cytoarchitectonics 团队)完成;patch 标注采用四眼(双人独立)校验流程。官方未发布分层标注的定量一致性指标(如逐层 Dice 或 Kappa),引用分层结果时应转引原论文的验证方式而非自行假设一致性数值。
§3.7 采集周期
标本处理与数字化历时约 5 年,其中切片、染色、扫描等采集环节投入约 1,000 小时人工劳动;配准与重建在麦吉尔与 Jülich 两地并行完成。2013 年首发后,体数据格式修复(2013-09)、FTP 开放(2014-03)与 2015 release 逐步完成分发体系。
| 阶段 | 时间跨度 | 说明 |
|---|---|---|
| 标本处理与切片染色 | 约 5 年内完成 | 含石蜡包埋、7,404 张切片、Merker 染色 |
| 数字化与重建 | 至 2013-06 论文发表 | 扫描约 1 TB、人工去伪影、3D 重建 |
| 分发体系建设 | 2013-06 至 2015 release | NIfTI 修复、FTP 开放、多分辨率/多空间分发 |
| 衍生扩展 | 2020-2023 | 分层分割、1 µm 重扫描与 patch 数据集 |
§3.8 地域覆盖
单一标本(捐献者族群信息未公开),不存在地域覆盖维度;机构地理覆盖为德国 Jülich(切片、染色、细胞结构分区)与加拿大蒙特利尔(MRI、配准、分发、LORIS 平台)。
§3.9 设备规格
| 环节 | 设备/参数 |
|---|---|
| 离体 MRI | 0.444 mm 各向同性体素(场强/序列细节官方页未列明) |
| 切片 | 大规模切片机(large-scale microtome),冠状面,20 µm 厚度 |
| 染色 | Merker 法(1983),细胞体染色 |
| 数字化 | 平板扫描仪,2400 dpi,单张最大 13,000 × 11,000 像素 |
| 每切片配准参照 | 未切面逐层摄影(blockface 影像)+ 离体 MRI |
§3.10 深度溯源链
捐献脑 → 离体 MRI(0.444 mm)→ 石蜡包埋 → 7,404 张 20 µm 冠状切片 → Merker 染色 → 2400 dpi 扫描(约 1 TB)→ 人工去伪影 → 逐切片对齐(blockface + MRI 参照)→ 20 µm 各向同性 3D 重建 → 多分辨率降采样(100-400 µm)→ 空间变换(ICBM152/ADNI)→ 表面重建与分层分割(衍生)→ 1 µm 重扫描(衍生)。每一步均有原始论文或官方 FAQ 文档支撑,衍生数据集在 EBRAINS Knowledge Graph 独立登记、可溯源至同一标本。
§4 数据结构
§4.0 目录树
以下为典型下载/解压后的目录结构预览(文件名取自官方 FTP、FAQ 与 BigBrainWarp 文档中出现的真实文件;不同渠道的组织方式可能略有差异):
bigbrain/
├── license.txt # CC BY-NC-SA 4.0 许可文本
├── sections/ # 20 µm 重建切片(2015 release)
│ ├── coronal/ # 冠状方向重建切片序列
│ ├── axial/ # 轴向重建切片序列
│ └── sagittal/ # 矢状重建切片序列
├── volumes/
│ ├── histological_space/ # 组织学原生空间
│ │ ├── full8_100um_optbal.mnc # 100 µm 光学平衡版(BigBrainWarp 协议默认)
│ │ ├── full8_200um_optbal.mnc
│ │ └── full8_100um.nii # NIfTI 版本(2013-09-03 后替换版)
│ ├── icbm152_space/ # MNI ICBM152 空间
│ │ ├── BigBrainHist-to-ICBM2009sym-nonlin_grid_0.mnc # 非线性配准网格
│ │ └── bigbrainSym_* # 变换后的对称化版本(BigBrainSym)
│ └── adni_space/ # MNI ADNI 空间
├── blocks/ # 40 µm 3D blocks(5×5×5 分块)
│ ├── block_* # 子体积 + 小重叠区
│ └── legend_volume # 记录每体素所属 block 的图例体积
├── surfaces/
│ ├── pial_left_327680.obj # 皮层表面(每半球 327,680 顶点)
│ ├── white_left_327680.obj # 白质表面
│ └── *.gii # GIFTI 版本(跨软件叠合推荐)
├── mri/
│ └── bigbrain_exvivo_0.444mm.mnc # 离体 MRI(processing space,y-z 翻转)
└── derivatives/ # 经 EBRAINS 分发的衍生数据集
├── cortical_layers/ # 6 层分割:表面网格 + 体素掩膜(Wagstyl 2020)
└── 1um_sections/ # 1 µm 重扫描子集(Schiffer 2022)
§4.1 DAIMS 字段字典
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 体素强度 | 整数灰度 | Merker 染色深浅,灰质深、白质浅 | 组织学空间体数据的数值体素 | 分层分割/灰白质分割的输入 | 切片间染色与扫描批次漂移 | 无缺失编码;撕裂区为异常强度 | 依文件位深而定 |
| voxel_size | 浮点三元组 | 各向同性体素边长 | 100(µm) | 重采样与感受野计算 | 固定元数据,无误差 | — | 20/40/100/200/300/400 |
| space | 字符串 | 体数据所在坐标空间 | icbm152_space | 跨数据集对齐 | 配准残余误差(离体参照所致) | — | histological/icbm152/adni |
| section_id | 整数 | 切片序号(1-7,404) | 3701 | 切片级交叉验证分组 | — | — | 1-7,404 |
| pial_surface | 表面网格 | 软脑膜面(327,680 顶点/半球) | pial_left_327680.obj | 分层采样的上边界 | 内嗅皮层撕裂区局部失真 | — | 顶点坐标(mm) |
| white_surface | 表面网格 | 白质面(327,680 顶点/半球) | white_left_327680.obj | 分层采样的下边界 | 同上 | — | 顶点坐标(mm) |
| cortical_layer_label | 整数 | 皮层 1-6 层掩膜 | 4(第 IV 层) | 分割标签 | CNN 外推 + 少量人工标注 | 无第 7"未知"编码;皮层外为 0 | 0-6 |
| 配准网格 | MINC grid | BigBrain→ICBM2009sym 非线性场 | BigBrainHist-to-ICBM2009sym-nonlin_grid_0.mnc | 自定义空间变换 | 皮层下区配准精度较低(引 BigBrainWarp 讨论) | — | 位移场 |
| mri_intensity | 浮点/整数 | 离体 MRI 强度 | 0.444 mm 序列体素 | histology-MRI 融合 | 离体固定后对比度偏离在体 T1 | — | 依序列而定 |
| block_legend | 整数体积 | 每体素所属 40 µm block 编号 | 63(5×5×5 之一) | 分块并行读取 | — | — | 1-125 |
| plane | 字符串 | 重建切片的方向 | coronal | 序列读取与展示 | — | — | axial/coronal/sagittal |
| legend_volume | 整数体积 | blocks 子集的 block 归属图例 | legend 体积内体素值 | 拼接与并行调度 | — | — | 0-125 |
| encoding_format | 字符串 | 文件容器格式 | nii / mnc | 管线分支与校验 | — | — | MINC/NIfTI/OBJ/GIFTI/STL |
§4.2 标签分布
BigBrain 的"标签"是空间掩膜而非类别计数:皮层 6 层标签覆盖全部新皮层(每层体积随脑区变化,第 I 层最薄、IV 层在颗粒区最显著);1 µm patch 数据集的分层标注集中于 Julich-Brain 图谱已定义的细胞结构区(2023 年扩展覆盖 78 个新增区,累计约 900 个 patch)。层标签在体素层面不均衡(深层与浅层体积差异大),做逐层分割评估时必须报告逐层指标而非全局均值。
| 标签对象 | 形式 | 覆盖范围 | 稀疏点 |
|---|---|---|---|
| 皮层 6 层掩膜 | 体素级 0-6 | 全部新皮层 | 皮层外为 0;异型皮层(allocortex)处理以官方文档为准 |
| 层边界表面 | 顶点级网格 | 全皮层 | 撕裂区局部不可靠(坑点 6) |
| 细胞结构分区 | 概率图(经 Julich-Brain) | 已定义区 | 区边界个体间漂移(§7.3) |
| 胞体轮廓 | 1 µm patch 内实例 | 约 900 个 patch | patch 覆盖不均匀,集中于可辨识区 |
§4.3 关键统计
- 标本数:1;切片数:7,404;切片厚度:20 µm
- 原始扫描:约 1 TB;单张图像最大 13,000 × 11,000 像素(2400 dpi)
- 重建分辨率:20 µm 各向同性;分发体数据:100/200/300/400 µm
- 离体 MRI:0.444 mm 各向同性
- 表面顶点:327,680/半球(pial 与 white 各一套)
- 1 µm patch:约 900 个、约 52 GB(2023 扩展后)
| 统计维度 | 数值 | 出处 |
|---|---|---|
| 冠状切片总数 | 7,404 | 官方 FAQ / Science 论文 |
| 切片厚度 | 20 µm | 官方 FAQ |
| 原始数字化数据量 | 约 1 TB | Jülich 图谱页 |
| 数字化设备分辨率 | 2400 dpi | Wikipedia 词条(引 Science 播客) |
| 离体 MRI 体素 | 0.444 mm 各向同性 | 官方 FAQ |
| 处理人工投入 | 约 1,000 小时 | LiveScience 报道(经 Wikipedia 转引) |
| 建设周期 | 约 5 年 | Los Angeles Times 报道(经 Wikipedia 转引) |
| Google Scholar 引用 | 1,140+(截至 2026-09) | Google Scholar |
§4.4 数据层级
层级结构为:捐献者(1)→ 标本处理批次(石蜡块)→ 切片(7,404)→ 图像/体素(多分辨率体数据与 blocks)。与临床影像"患者→检查→序列→切片"的层级对应关系:捐献者↔患者、离体 MRI↔一次检查、组织学重建↔衍生序列、切片↔图像帧。理解该层级对设计交叉验证至关重要:同一脑区的相邻切片高度自相关,随机切分帧级样本必然泄漏(见 §5.3 与坑点 7)。
| BigBrain 层级 | 临床影像对应物 | 典型数量 | 分组验证粒度 |
|---|---|---|---|
| 捐献者 | 患者 | 1 | 不可用(仅 1 例) |
| 石蜡块/处理批次 | 检查 | 少量 | 过粗 |
| 切片 | 序列内图像帧 | 7,404 | ✅ 推荐(leave-section-out) |
| 皮层区域 | ROI | 数十到数百 | ✅ 推荐(leave-region-out) |
| patch/体素 | 体素 | 10⁹ 级 | ❌ 禁止直接随机划分 |
§4.5 缺失值与信息性缺失
本数据集没有表格数据的"缺失编码"问题;信息性"缺失"以空间形式存在:① 左内嗅皮层小撕裂区——pial 表面与微结构 profile 在该区不可靠(官方 FAQ 与 BigBrainWarp 文档明示),分析时应空间掩膜剔除而非填充;② 原始文献未记载捐献者族群等人口学信息——引用时保持"不可得"而非推测;③ 100 µm NIfTI 版本曾因转换器文件大小限制缺失(后补齐)——旧镜像中可能仍缺该文件,缺文件本身就是"需更新分发版"的信号。
§5 划分与使用建议
§5.1 官方划分
无。BigBrain 是参考图谱而非监督基准,官方不提供 train/val/test 划分;衍生数据集(分层分割、1 µm patch)同样以完整发布为原则,不附带官方划分文件。这不是缺陷而是定位:图谱的价值在于"完整、唯一、可引用",任何切分都会破坏其参照语义;把它当监督学习数据集用是社区自发的延伸用法,切分责任随之转移到使用者。
§5.2 社区惯例
社区常见做法有两类:① 半球间/区间验证——训练与评估分别取自不同半球或不同细胞结构区(利用左右半球近似对称但统计独立的表面);② patch 网格切分——把皮层表面按空间网格分组,以组为单位划分,保证同一网格内样本不同时出现在训练与测试集(Wagstyl et al. 2020 及后续工作使用空间分组的思路)。以切片为单位(leave-section-out)的划分更为保守,适合评估对切片级伪影的鲁棒性。
选择划分粒度的经验法则:粒度越粗(半球 > 区域 > 切片 > patch),指标越保守、越接近真实跨标本表现;粒度越细,越容易自欺。建议论文主表用最粗粒度(半球或区域),附录给出细粒度结果并明确标注其乐观性。
§5.3 泄漏风险 ⚠️
这是本数据集做机器学习时最重要的风险:全数据来自同一大脑。三维连续性意味着相邻体素/相邻 patch/相邻切片高度自相关——随机逐体素或逐 patch 划分会把"几乎相同的组织"分进训练与测试集,得到虚高指标(详见坑点 7)。正确姿势:所有划分必须在空间块(region/section/hemisphere)级别完成,并在论文中明确报告划分粒度。此外,若你的任务使用了官方 CNN 分层结果作为输入特征,注意官方标注本身是"少量人工 + CNN 外推"的产物,把它当真值训练再评估会形成循环论证。
§5.4 划分策略建议
- 分割任务:以皮层表面空间网格(如 1 cm² 尺度)分组做分组 K 折;至少一组完全位于对侧半球。
- 胞体检测:以 patch 为单位分组,同一切片的相邻 patch 不得跨训练/测试集。
- 配准任务:以脑区为单位留出(leave-region-out),报告分区级别的变换误差而非全局均值。
- 任何任务:固定随机种子 + 记录划分文件哈希,便于复现。
§5.5 交叉验证建议
5 折分组交叉验证是性价比最高的选择;样本充裕时(如 patch 级)可用 10 折。禁止在同一折内混合左右半球对应区域与同半球相邻区域后又做"独立测试"的表述——后者只是重复训练集。报告结果时同时给出折间标准差。
§5.6 外部验证建议
建议在以下方向寻求外部效度:① 跨标本——NextBrain(5 个半脑、约 10,000 张 H&E + LFB 切片,2024 预印本)与 AHEAD 标本提供独立组织学;② 跨模态——把 BigBrain 衍生特征映射到 MNI152 空间后与 HCP 等在体数据比较(BigBrainWarp 教程 2/3 即此范式);③ 跨物种方法迁移——Allen 成鼠图谱上的分层/分区方法迁移实验。凡涉及外部验证,先确认对方许可协议允许(BigBrain 为 NC 限制,重组数据需注意相同方式共享条款)。
实施顺序建议:先做"内部空间分组 + 对侧半球外推"(零额外数据成本),再做"跨模态一致性"(需 BigBrainWarp,成本中),最后考虑跨标本(需处理染色风格差异,成本高但说服力最强)。每一级通过再进入下一级,避免在第一级就过度投资调参。
§6 AI 就绪指南 ⭐
§6.0 EBRAINS 在线快速体验
不下载任何数据即可体验 20 µm 全脑:打开 EBRAINS siibra explorer(https://atlases.ebrains.eu/viewer),选择 BigBrain 模板,即可逐层浏览并放大到细胞体级别;BigBrain 皮层分层分割与细胞结构图均已挂接在该 viewer 上。适合快速确认解剖结构、校准预处理假设后再决定下载哪个分辨率。
建议的三步在线勘测流程:① 在 coronal 视图定位你的目标脑区,记录大致切片号区间(为 §5 的分组划分做先验);② 切换到皮层分层图(Wagstyl et al. 2020)叠合模式,确认目标区层标签完整(避开撕裂区,坑点 6);③ 放大到 20 µm 观察染色对比与伪影分布,为 §6.3 的强度规整参数设定提供依据。这三步通常能省掉一整轮"下载后才发现数据不符合预期"的返工。
§6.1 快速上手
预期目录结构见 §4.0;下例假设你已下载 100 µm 体数据(CONP 子集或 FTP),data_root 指向解压根目录,代码读取组织学空间的 100 µm MINC/NIfTI 体数据并输出基本统计。最小可用子集:单个 100 µm 体数据文件 + 一对 pial/white 表面即可跑通分层采样原型。
# 目录预期:
# data_root/
# volumes/histological_space/full8_100um.nii (100 µm 体数据)
# surfaces/pial_left_327680.obj (表面,可选)
# data_root 与文件的拼接关系:data_root + 各子路径;路径不存在时请对照 §4.0 检查下载渠道差异
import nibabel as nib
import numpy as np
from pathlib import Path
data_root = Path("/data/bigbrain") # 修改为你的解压根目录
vol_path = data_root / "volumes" / "histological_space" / "full8_100um.nii"
img = nib.load(str(vol_path)) # 100 µm 各向同性体数据
data = img.get_fdata(dtype=np.float32) # 惰性读取转 float32
print("形状 (mm 网格):", data.shape)
print("体素间距 (mm):", img.header.get_zooms()[:3])
print("强度分位数 1/50/99%:", np.percentile(data, [1, 50, 99]))
# 灰质深染 → 低强度值(Merker 染色深=暗)。先用分位数确认方向,再写阈值逻辑。
brain_mask = data > np.percentile(data, 40) # 粗略前景掩膜,仅作演示
print("前景体素占比: %.1f%%" % (100 * brain_mask.mean()))
第二步(可选但推荐):沿皮层采样染色强度剖面——这是本数据集最有特色的分析单元。官方推荐用 BigBrainWarp 的 sample_intensity_profiles.sh(输入 100 µm 体数据 + pial/white 表面 .obj,50 等体积表面 + 平滑):
# BigBrainWarp 官方剖面采样(参数含义:50 层等体积内插表面)
bash sample_intensity_profiles.sh \
-in_vol full8_100um_optbal.mnc \
-upper_surf pial_left_327680.obj \
-lower_surf white_left_327680.obj \
-wd tests \
-num_surf 50
# 产出:每顶点一条 50 维强度剖面,可直接做分层特征/矩参数化(BigBrainWarp 教程 3)
若需在 Python 侧原型化(不等价于官方等体积构建,仅用于快速验证数据方向性):从表面顶点沿法向线性插值体数据采样。原型代码请以官方脚本输出校准后再进入正式管线。
§6.2 数据获取
| 渠道 | 地址 | 内容 | 适用场景 |
|---|---|---|---|
| LORIS | https://bigbrain.loris.ca | 体数据与表面(多分辨率) | 常规下载首选 |
| 匿名 FTP | https://bigbrain-ftp.loris.ca | 全部切片与体数据 | 批量下载(建议命令行客户端,勿用浏览器) |
| EBRAINS KG | https://search.kg.ebrains.eu(检索 BigBrain) | 全量约 1 TB + 衍生数据集 | 生态内引用与衍生数据 |
| CONP/DataLad | https://portal.conp.ca/dataset?id=projects/bigbrain-datalad | 112.5 GB 子集(316 文件) | 版本化获取(DataLad 增量同步) |
# 方式一:FTP 批量下载(Filezilla 亦可;浏览器可能限制大文件)
# 注意:100 µm NIfTI 曾因转换器限制缺失、后已补齐——务必从官方渠道取最新版(坑点 1)
wget -c ftp://bigbrain-ftp.loris.ca/<目标子目录>/<文件> # 具体目录以 FTP 索引为准
# 方式二:CONP / DataLad 版本化获取(推荐给需要可复现的项目)
datalad install https://github.com/conpdatasets/bigbrain-datalad.git
cd bigbrain-datalad && datalad get volumes/ # 按需取子目录
下载后校验:对照官方页面的文件清单与大小(CONP 子集合计 112.5 GB / 316 文件);MINC 文件请用 mincinfo 确认可读(坑点 4)。
# 下载后完整性体检三步:
# 1) NIfTI 头信息与体素间距
python3 -c "import nibabel as nib; i=nib.load('full8_100um.nii'); print(i.shape, i.header.get_zooms())"
# 2) MINC 可读性(MINC2 环境)
mincinfo full8_100um.mnc
# 3) 强度分布抽查(灰质深染=低值;分布异常则触发坑点 1 排查)
python3 -c "import nibabel as nib, numpy as np; d=np.asarray(nib.load('full8_100um.nii').dataobj); print(np.percentile(d,[1,25,50,75,99]))"
渠道选择决策:日常研究选 CONP/DataLad(版本化、增量同步);需要原始切片扫描选匿名 FTP(浏览器易断,用命令行);需要衍生数据集(分层分割、1 µm patch)与统一元数据选 EBRAINS KG;只需要个别体数据文件选 LORIS。无论哪个渠道,首次下载后把"渠道 + 日期 + 文件清单哈希"写进项目 README,这是坑点 1 类版本事故的唯一长效解药。
§6.3 预处理全流程
流程:格式统一 → 强度规整 → 重采样/分块 → 表面对齐 → 质控。以下给出以 NIfTI + Python 为主的可运行骨架(MINC 工具链命令附后)。
# 预处理:强度规整 + 颅外背景剥离 + 简单去噪。输入:100 µm NIfTI;输出:规整后的体数据
import nibabel as nib
import numpy as np
from scipy import ndimage
def preprocess_volume(in_path: str, out_path: str) -> None:
img = nib.load(in_path)
data = img.get_fdata(dtype=np.float32)
# 1) 背景剥离:组织学重建的背景近似为 0,用鲁棒阈值替代硬编码
bg = np.percentile(data, 30)
mask = data > bg
data = np.where(mask, data, 0.0)
# 2) 强度规整:按前景分位数拉伸到 0-1(不要用全局 min/max,伪影会造成压缩)
fg = data[mask]
lo, hi = np.percentile(fg, [1, 99])
data = np.clip((data - lo) / max(hi - lo, 1e-6), 0, 1)
# 3) 轻度平滑抑制切片级噪点(保守平滑;更强去噪请参照 BigBrainWarp 协议:
# 深度向迭代分段线性 + 表面高斯 FWHM≈2,见坑点 8 参考文献附录)
data = ndimage.median_filter(data, size=(1, 1, 1)) # 3D 逐体;size 可按实验调
out = nib.Nifti1Image(data.astype(np.float32), img.affine, img.header)
nib.save(out, out_path)
preprocess_volume("/data/bigbrain/volumes/histological_space/full8_100um.nii",
"/data/work/bigbrain_100um_clean.nii")
# MINC 工具链等价操作(官方配准网格重采样示例)
# 坑点 4:确保 mincresample 来自 MINC2 安装(which mincresample 检查路径)
mincresample -like BigBrainHist-to-ICBM2009sym-nonlin_grid_0.mnc \
full8_100um.mnc bigbrain_icbm_100um.mnc
40 µm blocks 的拼接:读取 legend 体积确定每体素所属 block,按 block 编号加载子体积、沿重叠区做线性融合;仅在全分辨率任务需要,100 µm 研究可跳过。拼接参考实现如下:
# blocks 拼接(全分辨率任务用;输入为官方 40 µm blocks + legend 体积)
# 思路:legend 体积每体素记录其所属 block 编号 → 按 block 收集体素坐标 →
# 多 block 重叠区取均值融合。内存受限时按 z 层流式处理。
import numpy as np
import nibabel as nib
from pathlib import Path
from collections import defaultdict
def stitch_blocks(blocks_dir: str, legend_path: str, out_path: str) -> None:
legend = np.asarray(nib.load(legend_path).dataobj)
blocks_root = Path(blocks_dir)
acc = defaultdict(list) # voxel_index -> [(block_data, mask)] 太耗内存,
# 实践中改为:按 legend 值分组坐标,逐 block 写入输出画布并记录覆盖次数
ids = np.unique(legend)
ids = ids[ids > 0] # 0 为背景/未分配
shape = legend.shape
canvas = np.zeros(shape, dtype=np.float32)
count = np.zeros(shape, dtype=np.uint8)
for bid in ids:
block = nib.load(str(blocks_root / f"block_{int(bid):03d}.mnc"))
data = np.asarray(block.dataobj, dtype=np.float32)
coords = np.argwhere(legend == bid)
# block 内局部坐标 = 全局坐标 - block 原点(原点从 block 头文件 affine 取整可得)
origin = np.rint(block.affine[:3, 3] / 0.04).astype(int) # 0.04 mm = 40 µm
local = coords - origin
ok = (local >= 0).all(axis=1) & (local < np.array(data.shape)).all(axis=1)
g = coords[ok]; l = local[ok]
canvas[g[:, 0], g[:, 1], g[:, 2]] += data[l[:, 0], l[:, 1], l[:, 2]]
count[g[:, 0], g[:, 1], g[:, 2]] += 1
canvas[count > 0] /= count[count > 0] # 重叠区线性平均
nib.save(nib.Nifti1Image(canvas, np.diag([0.04, 0.04, 0.04, 1])), out_path)
# stitch_blocks("/data/bigbrain/blocks", "/data/bigbrain/blocks/legend.mnc",
# "/data/work/bigbrain_40um_stitched.nii")
注意:block 文件命名与原点约定以实际下载版本的头文件为准(上述命名按官方 5×5×5 分块 + legend 说明整理);首次拼接后务必与 100 µm 体数据做逐层对比目检。
§6.3b 预处理质控清单
预处理管线建议内置以下逐项检查(任一失败即中断并人工复核):
| # | 检查项 | 通过标准 |
|---|---|---|
| 1 | 体素间距核对 | 100 µm 数据读出 0.1 mm |
| 2 | 强度方向核对 | 灰质深染=低值,分位数范围合理 |
| 3 | 前景占比 | 处于颅腔合理区间;异常偏大提示背景未剥离 |
| 4 | 左右半球体素量 | 大致相当;显著失衡提示加载/裁剪错误,勿误判为解剖 |
| 5 | 与官方表面初叠 | pial 表面落在皮层带内(抽查 3 个冠状层面) |
| 6 | 切片轴漂移曲线 | 平滑无跳变;剧烈跳变提示坏切片,对照 §4.5 撕裂区 |
| 7 | 坐标空间断言 | BigBrain 原生 vs BigBrainSym 标识正确(坑点 2) |
§6.4 PyTorch DataLoader
以"皮层分层分割的 3D patch 训练"为例:从 100 µm 体数据滑动窗采样 patch,表面网格顶点定位皮层区域(此处简化为强度掩膜内采样;完整等体积表面采样请用 BigBrainWarp 的 surface tools)。完整脚本超过 30 行,折叠如下:
<details>
<summary>展开完整 PyTorch Dataset + DataLoader 代码(约 60 行)</summary>
# bigbrain_patches.py
# 依赖:pip install nibabel numpy torch
# 目录预期(§4.0):
# data_root/volumes/histological_space/full8_100um.nii
# 注意:patch 划分必须空间分组(§5.3),示例以 z 轴(切片轴)区间做分组演示
import numpy as np
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
class BigBrainPatchDataset(Dataset):
"""从 BigBrain 100 µm 体数据中采样固定尺寸 3D patch。
patch 组(group)由切片轴区间决定:同组 patch 只能整体进入训练或验证,
以缓解同一脑区相邻组织的自相关泄漏(见 §5.3 / 坑点 7)。
"""
def __init__(self, volume_path: str, patch_size=(64, 64, 64),
stride=32, group="train", n_groups=5):
img = nib.load(volume_path)
self.vol = img.get_fdata(dtype=np.float32)
self.ps = patch_size
self.stride = stride
# 背景剥离后按前景体素生成候选中心
self.mask = self.vol > np.percentile(self.vol, 40)
centers = np.argwhere(self.mask)[::8] # 稀疏采样候选中心
z_bins = np.linspace(self.vol.shape[2], 0, n_groups + 1)
z_idx = np.digitize(centers[:, 2], z_bins) - 1
keep = (z_idx < n_groups)
self.centers = centers[keep & (z_idx == (0 if group == "train" else 1))]
def __len__(self):
return len(self.centers)
def __getitem__(self, i):
x, y, z = self.centers[i]
h = self.ps[0] // 2
patch = self.vol[x-h:x+h, y-h:y+h, z-h:z+h]
patch = np.clip(patch, 0, 1)
patch = torch.from_numpy(patch.copy()).unsqueeze(0) # (1, D, H, W)
# 演示任务:重建/自监督返回自身;监督任务请在此挂接层标签掩膜
return patch, torch.zeros(1)
train_ds = BigBrainPatchDataset("/data/bigbrain/volumes/histological_space/full8_100um.nii",
group="train")
val_ds = BigBrainPatchDataset("/data/bigbrain/volumes/histological_space/full8_100um.nii",
group="val")
train_dl = DataLoader(train_ds, batch_size=4, shuffle=True, num_workers=4,
pin_memory=True, persistent_workers=True)
val_dl = DataLoader(val_ds, batch_size=4, shuffle=False, num_workers=2)
for batch in train_dl: # 冒烟测试
x, _ = batch
print(x.shape) # torch.Size([4, 1, 64, 64, 64])
break
</details>
工程要点:① 体数据以 get_fdata 惰性加载后再切片,避免一次性物化整个数组导致内存峰值;② patch 归一化参数必须来自训练组统计并在验证组复用(按 patch 各自归一化是隐性泄漏);③ num_workers > 0 时注意 fork 后的内存复制——100 µm 体数据约 GB 级,建议 num_workers=2-4 并配合 persistent_workers=True;④ 若挂接层标签掩膜,掩膜与体数据必须同 affine(先做一次一致性断言)。
§6.5 坑点 8 个
⚠️ 坑点 1:旧版 NIfTI 文件强度错误(分类:预处理陷阱)
问题:2013 年首发时的 NIfTI 体数据在格式转换中存在强度缺陷,官方于 2013-09-03 替换了全部 NIfTI 文件;从旧镜像、论文附件或他人网盘获得的数据可能仍是坏版本。
症状:在 fslview、mricron 或 afni 中打开 NIfTI 体数据,灰白质对比异常或整体强度显示错误;同样的组织在 MINC 版本中显示正常。
解决:
- 简单方法:从官方渠道(bigbrain.loris.ca / bigbrain-ftp.loris.ca)重新下载 NIfTI 体数据,不要使用任何 2013 年 9 月前的缓存副本。
- 进阶方法:下载后立即做强度直方图体检——灰质应呈深染(低值)、白质浅染(高值)的单峰+肩部结构;异常双峰或整体反转即弃用。校验脚本可参照 §6.1 的分位数打印。
- SOTA 方法:项目内统一用 DataLad/CONP 版本化获取(CONP ARK 登记的子集),用版本号+文件清单哈希锁定数据来源,杜绝"谁机器上哪个版本"的混淆。
参考:官方 FAQ(https://bigbrain-ftp.loris.ca/bigbrain-ftp/FAQ.html)
⚠️ 坑点 2:BigBrain 与 BigBrainSym 混用(分类:工程陷阱)
问题:原始重建因死后组织变形相对标准颅内位姿有倾斜;BigBrainSym 是非线性变换到 ICBM152 空间的版本。两者坐标不通用,但文件名相似、极易拿错。
症状:在 BigBrain 原生体数据上取的坐标去查 ICBM152 图谱对不上区域;或配准结果出现系统性几度倾斜、跨模态叠图"错位但看起来差不多"。
解决:
- 简单方法:明确任务空间——与 MRI 对齐一律用 BigBrainSym/ICBM152 空间文件;纯组织学分析用原生空间。命名约定参考 BigBrainWarp:脚本参数区分
bigbrain与bigbrainsym。- 进阶方法:所有坐标操作前断言体数据的 affine/体素间距元数据,与预期空间不符立即报错退出,而不是静默运行。
- SOTA 方法:用 BigBrainWarp 提供的容器化变换函数在空间之间迁移特征图,避免手写变换矩阵;迁移后抽查 3 个解剖标志点(如中央沟、胼胝体、海马)验证。
参考:BigBrainWarp FAQ(https://bigbrainwarp.readthedocs.io/en/latest/pages/FAQs.html)
⚠️ 坑点 3:配准后脑的不对称是离体伪影不是发现(分类:偏倚陷阱)
问题:BigBrain 的空间参照是离颅、福尔马林固定后的离体 MRI,而非颅内活体状态;固定与离体过程引入形变,配准后的体数据呈现明显不对称。
症状:分析"左右半球差异"时得到异常强的不对称性,误以为是生物学发现写进结论。
解决:
- 简单方法:不在 BigBrain 上做左右不对称性结论;该数据集的正当用途是微结构与坐标参照,不是人群水平形态统计。
- 进阶方法:若必须做对称分析,先做双侧镜像平均或明确声明离体形变来源;对照离体 MRI(0.444 mm,processing space,y-z 轴翻转)时先翻转轴。
- SOTA 方法:引用 Lewis et al. 2020 的多模态表面匹配结果——表面配准后几何畸变已降到不同个体间 MRI 配准的水平——并在此精度边界内陈述结论。
参考:官方 FAQ + Wagstyl et al., 2022, eLife. DOI: 10.7554/eLife.70119
⚠️ 坑点 4:MINC1/MINC2 工具链冲突(分类:工程陷阱)
问题:BigBrain 的网格与配准文件是 MINC2 格式,而 FreeSurfer 自带的
mincresample常是 MINC1 实现,混用直接报错。
症状:文件明明存在,运行报Error: opening MINC file BigBrainHist-to-ICBM2009sym-nonlin_grid_0.mnc。
解决:
- 简单方法:
which mincresample检查路径,确保 PATH 优先指向 MINC2 安装(MINC ToolKit),而非 FreeSurfer 目录。- 进阶方法:容器内固化 MINC2 工具链(Docker 镜像内只装 MINC ToolKit),宿主机的 FreeSurfer 不进入容器 PATH。
- SOTA 方法:若团队统一 Python 栈,优先走 NIfTI + nibabel 路线,把 MINC 命令局限在一次性转换步骤,减少环境依赖面。
参考:BigBrainWarp FAQ(https://bigbrainwarp.readthedocs.io/en/latest/pages/FAQs.html)
⚠️ 坑点 5:STL 表面无法与体数据叠合(分类:工程陷阱)
问题:官方分发的皮层表面有 STL 版本,但 STL 只存几何、不带 world→voxel 坐标变换,在 3D Slicer 或 Freeview 中叠到 BigBrain 体数据上会错位。这不是数据缺陷,而是格式能力限制。
症状:表面网格与体数据"对不上号",看起来像配准坏了;换软件依旧。
解决:
- 简单方法:叠合分析一律用 .gii(GIFTI)或 MNI-OBJ 版本表面;STL 留给 3D 打印。
- 进阶方法:若只有 STL,自行按官方发布的体数据 affine 手工构建变换再导入,并抽查顶点是否落在皮层带上。
- SOTA 方法:直接采用 BigBrainWarp 分发的已配准表面(含 327,680 顶点标准网格),跳过本地格式转换环节。
参考:官方 FAQ(https://bigbrain-ftp.loris.ca/bigbrain-ftp/FAQ.html)
⚠️ 坑点 6:左内嗅皮层撕裂区(分类:预处理陷阱)
问题:标本在左内嗅皮层存在一处小撕裂,官方明确该区 pial 表面构建与微结构 profile 不可靠。
症状:涉及内侧颞叶的 ROI 统计出现离群值;pial 表面在左内嗅皮层附近出现异常凸起或断裂。
解决:
- 简单方法:ROI 分析先做可视化巡检(EBRAINS viewer),确认 ROI 不覆盖撕裂区;覆盖则剔除该样本并记录。
- 进阶方法:以官方表面在该区的网格质量做掩膜(如曲率/自相交检测),自动排除不可靠顶点。
- SOTA 方法:全脑 profile 管线内置"伪影区注册表",把已知问题区与自动检测的异常区一并排除,并在论文附表中披露排除清单。
参考:BigBrainWarp FAQ(https://bigbrainwarp.readthedocs.io/en/latest/pages/FAQs.html)
⚠️ 坑点 7:patch/体素级划分导致单脑泄漏(分类:数据泄漏)
问题:全部数据来自同一大脑,相邻体素/patch/切片高度自相关;随机划分会把近乎相同的组织同时放进训练与测试集。
症状:验证指标极高(如 Dice > 0.98)但换一个脑区或换一个标本立刻崩塌;审稿人一句"single subject split?"即被击穿。
解决:
- 简单方法:以切片轴(z 区间)或皮层表面空间网格分组划分,保证分组间无相邻组织(§5.4 给出具体策略)。
- 进阶方法:leave-region-out 交叉验证 + 报告折间标准差;对分割任务额外做"对侧半球外推"测试。
- SOTA 方法:接入外部组织学数据(NextBrain、AHEAD)做跨标本验证;无法获取时,至少做跨模态验证——把 BigBrain 学到的特征映射到 MNI152 后与在体数据一致性对比。
参考:Wagstyl et al., 2022, eLife(单标本局限性的正式讨论);§5.3
⚠️ 坑点 8:跨模态配准误差被当作解剖差异(分类:评估误用)
问题:histology-MRI 配准受组织学伪影、强度对比差异与形态畸变三重困扰;皮层下区在早期配准中精度较低(后续以 T1-T2* 融合对比与形状先验改进)。把配准残差当成解剖学差异解释是常见错误。
症状:微结构特征映射到 MRI 空间后"边界偏了 1-2 mm",被解读为该区皮层结构特殊;或不同论文在同一区给出矛盾结果。
解决:
- 简单方法:所有跨模态结论以体素/顶点为单位报告配准不确定性范围,不声称亚体素精度。
- 进阶方法:使用 BigBrainWarp 封装的官方变换路径(含 Lewis et al. 2020 表面匹配与 Xiao et al. 2019 皮层下改进),并在方法学部分引用所选路径的精度评估。
- SOTA 方法:对关键结论做"变换路径敏感性分析"——同一特征分别经体积路径与表面路径映射,两条路径结果一致才写入结论。
参考:Wagstyl et al., 2022, eLife. DOI: 10.7554/eLife.70119
§6.6 数据增强
| 类别 | 操作 | 理由 |
|---|---|---|
| ✅ 安全 | 小角度旋转(±5°内)、小尺度弹性形变、强度抖动/直方图微扰、高斯噪声 | 模拟切片对位残差与染色批次差异,不破坏层状拓扑 |
| ✅ 安全 | 沿切片轴的随机偏移采样 | 等效于扩大切片覆盖,保持 3D 连续性 |
| ✅ 安全 | 小幅高斯模糊/降采样-再超分组合 | 模拟不同分辨率输入,提升跨尺度鲁棒性 |
| ❌ 危险 | 左右镜像翻转 | 脑存在真实不对称且标签空间(区域)不镜像,翻转破坏解剖语义 |
| ❌ 危险 | 大幅弹性形变(>1 层厚度量级) | 皮层各层厚度本身是建模目标,大幅形变直接篡改标签几何 |
| ❌ 危险 | 跨染色风格迁移(如把 Merker 风格迁到 H&E)后仍当 Merker 标注训练 | 强度-标签对应关系被破坏,需重标注才可用 |
§6.7 模型推荐
| 任务 | 推荐模型 | 理由与出处 |
|---|---|---|
| 皮层分层分割 | U-Net 类 CNN(官方基线)/ nnU-Net | 官方 6 层分割即 CNN 沿 3D 剖面分类(Wagstyl et al. 2020) |
| 细胞体实例分割 | Contour Proposal Networks | 官方 1 µm patch 胞体检测所用方法(Upschulte et al. 2022, Medical Image Analysis) |
| 跨模态配准 | BigBrainWarp 封装 + T1-T2* 融合对比 | 官方工具链;皮层下配准改进见 Xiao et al. 2019(经 eLife 论文转引) |
| 超分辨率/合成 | 3D U-Net / GAN 类 | 以 100 µm 为输入、20 µm blocks 为监督的跨分辨率学习 |
| 自监督预训练 | masked volume modeling(MAE 式) | 1 TB 原始扫描提供充足无标注 3D 上下文 |
| 微结构特征回归 | 表面 CNN / 图卷积 | 以 327,680 顶点表面网格为图结构,回归染色 profile 特征 |
§6.8 硬件需求
| 场景 | 内存 | 显存 | 存储 | 说明 |
|---|---|---|---|---|
| 100 µm 分析/分层原型 | 16-32 GB | 8-11 GB | 200 GB | 单卡可完成全部教程级任务 |
| 表面/profile 管线 | 32-64 GB | 不必需 | 500 GB | 等体积表面构建内存开销大 |
| 全分辨率 blocks 训练 | 128 GB 起 | 24 GB+(多卡更佳) | 2 TB 起 | 需 HPC 级存储与并行 IO |
| 在线浏览/质控 | 8 GB | 不必需 | 0 | EBRAINS viewer 云端渲染 |
上表按"够用且留 30% 余量"估计:100 µm 体数据单精度加载约占数 GB 内存,加 DataLoader 多进程副本与训练激活值后 32 GB 是舒适线;全分辨率 20 µm 数据体素量约为 100 µm 的 125 倍,任何全量操作都必须分块(blocks 子集即为官方给出的分块方案),并优先考虑直接在集群对象存储上流式读取而非本地全量落盘。
§6.9 评估指标代码
# 分层分割评估:逐层 Dice + 表面 Hausdorff 距离(Wagstyl et al. 2020 使用表面距离族指标)
import numpy as np
from scipy.spatial import cKDTree
def dice_per_layer(pred: np.ndarray, gt: np.ndarray, n_layers: int = 6) -> dict:
scores = {}
for layer in range(1, n_layers + 1):
p, g = pred == layer, gt == layer
denom = p.sum() + g.sum()
scores[layer] = 2.0 * (p & g).sum() / denom if denom else np.nan
return scores
def hausdorff_95(pred_pts: np.ndarray, gt_pts: np.ndarray) -> float:
d1 = cKDTree(gt_pts).query(pred_pts, k=1)[0]
d2 = cKDTree(pred_pts).query(gt_pts, k=1)[0]
return float(max(np.percentile(d1, 95), np.percentile(d2, 95)))
print(dice_per_layer(pred_labels, gt_labels))
表面协议下的补充指标(与 Wagstyl et al. 2020 对齐):
# 层边界表面指标:对每对相邻层边界(如 II/III 与 IV/V)提取等值面顶点后计算
# ① 平均边界距离(mean boundary distance,mm);② 95% Hausdorff(上方函数复用)。
# 报告规范:逐层 + 逐边界分别报告,附分区(lobe 或细胞结构区)细分;
# 全局均值会掩盖感觉区与运动区的层厚梯度差异(官方论文的核心发现之一)。
def layer_boundary_metrics(metrics_by_region: dict) -> dict:
summary = {}
for region, m in metrics_by_region.items():
summary[region] = {
"mean_dist_mm": float(np.mean([x["dist"] for x in m])),
"hd95_mm": float(np.percentile([x["hd95"] for x in m], 95)),
"n_vertices": int(sum(x["n"] for x in m)),
}
return summary
§6.10 MLOps 笔记
- 数据版本化:记录"2015 release + 替换版 NIfTI"的获取日期与渠道;用 DataLad/CONP 子集做可复现锚点。
- 环境容器化:MINC2 工具链与 Python 依赖分容器管理,规避坑点 4 的 PATH 冲突。
- 划分存档:空间分组的划分清单(patch/region ID 列表)作为 artifact 提交,训练日志记录其哈希。
- 不确定性登记:所有跨模态产物写入所用变换路径与版本(BigBrainWarp release 号),坑点 8 的敏感性分析结果入实验台账。
- 合规流水线:下游发布物遵守 CC BY-NC-SA 4.0——署名 Amunts et al. 2013、非商业、相同方式共享;引用 EBRAINS 条目的 Terms & Conditions。
落地建议:把上述五条固化为 CI 检查——① 下载脚本强制走版本化渠道并在日志打印数据指纹;② 容器镜像内 which mincresample 自检指向 MINC2;③ 划分文件哈希不匹配即终止训练;④ 跨模态实验的元数据表缺失"变换路径"字段即告警;⑤ 发布前跑一次许可证审计脚本(扫描产物中的署名与许可声明)。BigBrain 数据量适中、渠道稳定,是搭建"图谱数据 MLOps 模板"的理想练手对象,这套模板可平移到后续任何组织学数据集。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 单标本偏倚 | 1 例 65 岁男性,无个体间变异,无法重复 | 高 | 作为参照而非训练人群;跨标本验证用 NextBrain/AHEAD |
| 离体形变 | 固定与离颅过程引入形变,配准后残留不对称/倾斜 | 高 | 明确任务空间(坑点 2/3);表面匹配降低畸变 |
| 染色批次漂移 | 7,404 张切片分批处理,强度沿切片轴漂移 | 中 | 强度规整 + profile 平滑协议(深度向+表面向) |
| 标注外推 | 全脑层标签为"少量人工 + CNN 外推" | 中 | 评估时逐层报告;关键区域人工复核 |
| 局部缺损 | 左内嗅皮层撕裂区表面与 profile 不可靠 | 低(局域) | 空间掩膜剔除(坑点 6) |
| 年龄维度缺失 | 标本为 65 岁单一年龄点,无法建模发育/老化轨迹 | 高(对老化研究) | 老化结论须引入多年龄队列影像数据 |
| 性别维度缺失 | 仅男性标本 | 高(对性别差异研究) | 同上;禁止以 BigBrain 外推女性脑结构结论 |
§7.2 标注质量
分层标注由专家在小量切片上完成、CNN 全脑外推,方法学发表于 PLOS Biology(2020);1 µm patch 的层边界由专家标注并经四眼程序校验(2023 数据集说明)。官方未公布逐层一致性定量系数;使用者应以"经同行评审的流程质量"而非"数值一致性"来引用其可信度,并在自己的研究中对采样子集做独立抽检。
对标注的实用预期管理:全脑体素级层掩膜在皮层内部平滑区域表现可靠,而在皮层折叠剧烈区(沟底/回顶)与撕裂区附近误差集中;若你的任务恰好聚焦这些区域,建议在训练前用官方表面质量检查顶点,并准备小规模自建标注作为补充监督。细胞结构分区标注(Julich-Brain 体系)的可靠单元是"区"而非"体素"——区边界有概率意义,引用时用概率图而非硬边界。
§7.3 泛化性
| 应用场景 | 失效风险 | 证据 |
|---|---|---|
| 跨个体皮层分区映射 | 高——皮层区边界相对脑沟位置个体间漂移,联合皮层尤甚 | BigBrainWarp(eLife 2022)对单标本局限的正式讨论 |
| 在体 MRI 精细分割先验 | 中——离体对比与在体不同,需模态适配 | Xiao et al. 2019 T1-T2* 融合动机(经 eLife 转引) |
| 功能数据挂接 | 中——BigBrain 模板上无功能连接/功能分区数据(挂接于 MNI152 模板) | 多模态探索软件对比研究(PMC12849229) |
| 微结构 profile 特征 | 低-中——方法成熟但受撕裂区与染色漂移限制 | BigBrainWarp 附录采样/平滑协议 |
§7.4 伦理
标本来自遗体捐献,用于研究用途;官方公开资料未包含捐献者身份信息(匿名),数据集不携带任何个人或表型数据,不构成可识别个体。使用时需遵守 CC BY-NC-SA 4.0 与 EBRAINS 平台条款;涉及二次分发衍生数据时,注意"相同方式共享"条款要求衍生库以同许可发布。
伦理审查要点自查:① 捐献知情同意覆盖的范围以官方文档为准,二次用途(如商业不可行)不越界;② 图像不含面部,数据集中也无身份标识,个体可识别风险极低——仍建议衍生产品不做任何去匿名化尝试;③ 与其他开放数据联合发布时,检查联合数据是否引入可识别性;④ 引用与致谢遵循 §9.4 指南,这是开放数据的伦理闭环。
§7.5 公平性
数据集仅有单一男性、单一年龄点标本,族群未记载——任何跨性别、跨年龄、跨族群的推断都无依据。它适合做"解剖参照",绝不适合做人群代表性训练数据;以其为先验的临床工具必须在多样化人群中独立验证。
| 公平性维度 | 数据集现状 | 对模型的影响 | 建议 |
|---|---|---|---|
| 性别 | 仅男性标本 | 女性脑解剖映射精度无证据支撑 | 禁止跨性别外推;标注单性别适用范围 |
| 年龄 | 仅 65 岁时点 | 年轻/高龄脑的萎缩与层厚差异未覆盖 | 参照结论限"成年参照"语境 |
| 族群 | 未记载 | 无法评估人群结构偏倚 | 保持"未记载"表述,勿默认代表性 |
| 健康状态 | 无神经/精神疾病记录 | 疾病脑的映射偏差未知 | 疾病研究需在疾病队列上验证 |
§7.6 数据漂移
切片级漂移:染色与扫描分批进行,强度分布沿切片轴缓慢变化——时间轴上的"漂移"在本数据集表现为空间轴漂移,profile 管线需内置强度规整。版本漂移:NIfTI 替换(2013-09)与 100 µm NIfTI 补齐是两次实质变更,旧缓存仍在流通,团队应锁定单一获取渠道(见坑点 1)。
| 漂移类型 | 表现 | 检测方法 | 缓解 |
|---|---|---|---|
| 空间轴强度漂移 | 强度分位数沿切片号缓慢变化 | 按切片聚合分位数画趋势线 | 前景分位数规整(§6.3) |
| 版本漂移 | 同名文件不同批次内容不同 | 文件哈希与官方清单比对 | 锁定渠道 + DataLad 版本 |
| 工具链漂移 | MINC1/MINC2 行为差异 | which mincresample 检查 | 容器固化(坑点 4) |
| 注释版本漂移 | 衍生数据集迭代(2020→2022→2023) | 记录衍生集版本号 | 元数据表登记版本字段 |
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 影像型数据集,无宽表概念;体数据 + 元数据代替 |
| 2 | 唯一标识 | ✅ | 标本/切片序号明确;CONP ARK 与 EBRAINS KG 登记可溯源 |
| 3 | 特殊字符 | ✅ | 文件名与元数据无特殊字符问题 |
| 4 | 重复行 | ✅ | 无重复记录;分块数据含少量有意重叠并有 legend 体积说明 |
| 5 | 缺失编码 | ⚠️ | 无表格缺失编码概念;撕裂区为空间型"缺失"需自行掩膜 |
| 6 | 标签标识 | ✅ | 层标签 0-6 语义清晰(0 为皮层外);表面网格成对发布 |
| 7 | 罕见类分组 | ❌ | 无类别标签体系;patch 覆盖集中于已定义细胞结构区 |
| 8 | 偏倚评估 | ⚠️ | 单标本/单性别/离体形变均已官方确认,但无定量偏倚度量 |
| 9 | 数据字典 | ✅ | FAQ、EBRAINS KG、BigBrainWarp 文档构成事实字典 |
| 10 | 信息性缺失解释 | ⚠️ | 撕裂区与人口学缺失有文字说明,无机器可读编码 |
| 11 | 设备记录 | ⚠️ | 切片机/扫描仪/ MRI 参数有记载,但非逐文件元数据 |
| 12 | 共线性 | ✅ | 不适用(无表格特征);强度通道单一 |
| 13 | 编码映射 | ✅ | MINC/NIfTI 世界坐标与配准网格定义完整 |
| 14 | 时间戳处理 | ❌ | 单时点标本,无时间维度可处理 |
| 15 | 划分建议 | ❌ | 官方无划分;需用户自行空间分组(§5.4) |
| 16 | 泄漏讨论 | ⚠️ | 单脑自相关风险明确存在,官方文档未展开讨论,本页 §5.3/坑点 7 补足 |
| 17 | 标签分布 | ⚠️ | 层标签体素级不均衡且官方未发布分布统计 |
| 18 | 测量偏倚 | ⚠️ | 染色批次漂移与扫描批次效应存在,官方有定性说明 |
| 19 | 外部验证建议 | ✅ | 跨标本/跨模态路径清晰(BigBrainWarp 教程、NextBrain) |
| 20 | 版本记录 | ✅ | 2013 首发、2013-09 替换、2015 release、2022/2023 衍生扩展,脉络可查 |
| 21 | 预处理脚本 | ⚠️ | BigBrainWarp 提供 profile/变换脚本,但无官方端到端预处理管线 |
| 22 | 合规要求 | ✅ | CC BY-NC-SA 4.0 + 引用要求明确 |
| 23 | 多模态对齐 | ✅ | 组织学-MRI-表面三模态对齐体系完备(含离体 MRI 与配准网格) |
| 24 | 去标识化 | ✅ | 源头匿名,无个人敏感信息 |
DAIMS 评分:16.0 / 24
评分解读:24 项中 11 项 ✅、10 项 ⚠️、3 项 ❌,得分 16.0。✅ 集中在可溯源标识、坐标/格式规范、合规与版本记录——这是官方维护二十余年的老牌图谱的强项;⚠️ 多为"文档有定性说明但缺机器可读/定量形式"的半成品状态;3 个 ❌(无类别体系、无时间维度、无官方划分)根源于数据集类型——它是解剖参照而非监督基准,属结构性不可得而非质量缺陷。
对你意味着什么:① 直接把 BigBrain 当"干净版"用是安全的——标识、坐标、许可证都不用你操心;② 但任何监督学习任务都必须自己设计空间分组划分并自行报告一致性,官方不会替你做;③ 引用层标签或 profile 结果时,把"人工+CNN 外推"的流程性质写进方法学,别写成"人工金标准";④ 撕裂区与人口学缺失要进入你的数据 QA 清单,做成显式掩膜而非事后排除。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| MNI152 / fsaverage 标准空间 | 麦吉尔/MNI 生态 | BigBrain 特征映射到在体空间 | 表面配准几何畸变 | 降至"不同个体 MRI 配准"水平 | Lewis et al. 2020 多模态表面匹配显著改进(eLife 2022 转述) |
| 在体 MRI 皮层下配准 | Xiao et al. 2019(经 eLife 转引) | BigBrain→MNI 皮层下对齐 | 配准误差 | 相对初始 release 改进 | T1-T2* 融合对比 + 核团形状先验提升皮层下对齐 |
| 皮层分层全脑分割 | Wagstyl et al. 2020, PLOS Biology | 6 层自动分割 | 层边界与厚度梯度 | — | 感觉与运动皮层的皮层/层厚梯度分化得到验证 |
| 1 µm patch 胞体检测 | Upschulte et al. 2022, MedIA | 实例分割 | 胞体计数/轮廓 | 20 µm→1 µm 分辨率跃迁 | 揭示跨皮层层级细胞密度梯度(Jülich 2023 扩展报告) |
§8 基准性能与生态
§8.1 排行榜与代表性结果
BigBrain 没有标准化的竞赛式排行榜(无统一切分协议与官方评测服务器);下表收录同行评审的代表性结果。各行动数值不可直接比较:输入分辨率、任务定义、评估协议均不同。
| 排名 | 模型/方法 | 性能/结果 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | CNN 皮层分层分割 | 全脑 6 层分割;感觉/运动皮层层厚梯度分化验证 | 2020 | 3D 皮层剖面 + 少量人工标注监督 | Wagstyl K, et al., 2020, PLOS Biology. DOI: 10.1371/journal.pbio.3000678 | 经 EBRAINS 分发 |
| 2 | Contour Proposal Networks | 1 µm patch 胞体实例分割,支撑层级细胞密度测量 | 2022 | 轮廓提议网络的生物医学实例分割 | Upschulte E, et al., 2022, Medical Image Analysis | Jülich 发布 |
| 3 | BigBrainWarp 工具箱 | BigBrain↔MNI152/fsaverage 跨模态映射标准化 | 2022 | 容器化变换封装 + 三教程 | Wagstyl K, et al., 2022, eLife. DOI: 10.7554/eLife.70119 | https://github.com/caseypaquola/BigBrainWarp |
| 4 | MSM 表面匹配(BigBrain 版) | 表面配准几何畸变降至个体间 MRI 配准水平 | 2020 | 多模态表面匹配 + 高分辨率重铺 | Lewis LB, et al., 2020(经 eLife 2022 转述) | 经 BigBrainWarp 分发 |
| 5 | 原始重建 | 20 µm 各向同性全脑 3D 模型首发 | 2013 | 7,404 切片重建 + blockface/MRI 对齐 | Amunts K, et al., 2013, Science. DOI: 10.1126/science.1235381 | 数据开放 |
§8.2 SOTA 总结与选型建议
没有"统一 SOTA"可选:任务是拼图式的。选型建议:做分层分割从官方 CNN 复现起步再换 nnU-Net;做胞体检测直接采用 Contour Proposal Networks 的 Jülich 实现;任何跨模态映射不要自研变换,优先 BigBrainWarp。自监督预训练(1 TB 原始扫描)是当前明显的机会窗口,但必须配空间分组评测。
三条主线的机会-成熟度判断:① 分层分割——官方基线已强,增量空间在折叠剧烈区与 border zone(区间过渡带)的鲁棒性;② 胞体实例分割——1 µm patch 数据(约 900 个、约 52 GB)把任务从"能不能做"推进到"规模化做",跨 patch 泛化是活跃前沿;③ 跨模态——变换工具链成熟,真正的难点在"映射结果的可解释性与不确定性量化",适合方法学论文而非刷点。对以应用为目的的团队,建议从 ① 或 ③ 的使用侧切入,避免在 ② 的标注密集环节重复造轮子。
§8.3 评测协议
建议协议:① 输入统一为 100 µm 体数据 + 官方表面(327,680 顶点);② 划分按 §5.4 空间分组;③ 指标逐层 Dice + 95% Hausdorff(§6.9 代码);④ 所有跨模态结果报告变换路径与版本;⑤ 与官方基线(Wagstyl 2020 分层)同表对比,注明输入与划分差异。
协议落地细节:⑥ 输入分辨率固定后不混用"训练 100 µm、评估 40 µm"的组合——分辨率本身是信息量变量;⑦ 评估区域默认排除撕裂区并在表中注明;⑧ 随机种子固定 3 次重复取均值±标准差;⑨ 若与官方 CNN 对比,尽量采用其实现的剖面采样协议(50 等体积表面 + 平滑参数见 BigBrainWarp 附录),避免"同一指标名、不同采样定义"的假对比;⑩ 发表时附划分文件与随机种子,接受社区复算。
§8.4 相关数据集
| 数据集 | 关系 | 模态/规模 | 适用 |
|---|---|---|---|
| Julich-Brain Atlas | BigBrain 为其 10 个核心脑之一 | 概率细胞结构图(Amunts et al. 2020, Science) | 群体级分区先验 |
| 1 µm 重扫描子集 | BigBrain 衍生 | 选定切片 1 µm 重扫(DOI: 10.25493/JWTF-PAB) | 细胞级形态学 |
| 约 900 patch 数据集(2023) | BigBrain 衍生 | 约 52 GB,含层标注与胞体分割 | 监督式胞体检测 |
| NextBrain | 后继项目(预印本) | 5 个半脑、约 10,000 张 H&E+LFB、333 ROI | 跨标本验证与 MRI 分割 |
| Allen Human Brain Atlas | 平行生态 | 基因表达 + 组织学(100-300 µm 网格) | 分子维度联合分析 |
| ICBM152/MNI 模板 | 配准目标 | 群体平均 MRI(约 1 mm) | 在体影像标准空间 |
§8.5 关键论文 Top 6
- Amunts K, et al. BigBrain: An Ultrahigh-Resolution 3D Human Brain Model. Science 340(6139):1472-1475, 2013. DOI: 10.1126/science.1235381 — 数据集奠基论文:7,404 切片重建 20 µm 全脑模型。
- Merker B. Silver staining of cell bodies by means of physical development. J Neurosci Methods 9(3):235-241, 1983. DOI: 10.1016/0165-0270(83)90086-9 — BigBrain 采用的细胞体染色方法原始文献。
- Wagstyl K, et al. BigBrain 3D atlas of cortical layers: Cortical and laminar thickness gradients diverge in sensory and motor cortices. PLOS Biology 18(4):e3000678, 2020. DOI: 10.1371/journal.pbio.3000678 — 全脑 6 层 CNN 分割与层厚梯度发现。
- Wagstyl K, et al. The BigBrainWarp toolbox for integration of BigBrain 3D histology with multimodal neuroimaging. eLife 11:e70119, 2022. DOI: 10.7554/eLife.70119 — 跨模态整合标准工具链与单标本局限的系统讨论。
- Amunts K, et al. Julich-Brain: A 3D probabilistic atlas of the human brain’s cytoarchitecture. Science 370(6520), 2020. DOI: 10.1126/science.abc9453 — BigBrain 所在的群体级细胞结构概率图谱体系。
- Schiffer C, et al. Selected 1 micron scans of BigBrain histological sections (v1.0). EBRAINS, 2022. DOI: 10.25493/JWTF-PAB — 细胞级重扫描衍生数据集。
§8.6 社区活跃度
原始论文引用 1,140+(Google Scholar,截至 2026-09),年均引用持续增长;围绕 BigBrain 的专门研讨会(BigBrain Workshop 系列,2023 年于雷克雅未克举办第 7 届)已形成年度机制;HIBALL 德加联合实验室(2020-2025,600 万欧元)持续投入下一代多模态脑模型;EBRAINS 平台把 BigBrain 作为 Human Brain Atlas 的核心模板维护。社区问题主要通过官方 FAQ、BigBrainWarp 文档与 EBRAINS 支持邮箱(curation-support@ebrains.eu)解决。
社区参与的四个入口:① 数据纠错——发现质量问题可经 EBRAINS 支持邮箱反馈(官方 KG 页面明示转发数据保管人);② 工具贡献——BigBrainWarp 接受 PR,surface tools 与变换函数是主要贡献区;③ 衍生数据集发布——在 EBRAINS KG 登记、互相引用形成网络;④ 年度 BigBrain Workshop 是展示衍生工作与对接官方团队的最短路径。对国内团队,建议从 ② 与 ③ 切入,工具型贡献的门槛与回报比最优。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/热度截至 2026-09 | 推荐理由 |
|---|---|---|---|---|
| BigBrainWarp | 工具箱 | https://github.com/caseypaquola/BigBrainWarp | eLife 发表、文档完善 | 跨模态映射事实标准 |
| siibra / siibra explorer | 平台工具 | https://atlases.ebrains.eu/viewer | EBRAINS 官方组件 | 在线浏览与多图谱挂接 |
| EBRAINS Knowledge Graph | 数据平台 | https://search.kg.ebrains.eu | 欧盟脑计划基础设施 | 衍生数据集统一登记 |
| CONP Portal | 数据镜像 | https://portal.conp.ca/dataset?id=projects/bigbrain-datalad | 加拿大开放神经科学平台 | DataLad 版本化获取 |
| LORIS / FTP | 分发平台 | https://bigbrain.loris.ca | 官方渠道 | 全量与多分辨率下载 |
§9 相关资源与引用
§9.1 官方资源清单
- 项目主页(含地图、模型、工具总览):https://bigbrainproject.org
- 图谱页(Jülich Brain Atlas 站内):https://julich-brain-atlas.de/atlas/bigbrain
- 数据下载(LORIS):https://bigbrain.loris.ca
- 匿名 FTP 与官方 FAQ:https://bigbrain-ftp.loris.ca 与 https://bigbrain-ftp.loris.ca/bigbrain-ftp/FAQ.html
- EBRAINS KG 项目页:https://search.kg.ebrains.eu/instances/Project/af8d3519-9561-4060-8da9-2de1bb966a81
- 在线浏览(siibra explorer):https://atlases.ebrains.eu/viewer
- BigBrainWarp 文档:https://bigbrainwarp.readthedocs.io ;代码:https://github.com/caseypaquola/BigBrainWarp
- CONP 镜像(DataLad):https://portal.conp.ca/dataset?id=projects/bigbrain-datalad
- 机构页(FZ Jülich INM-1):https://www.fz-juelich.de/en/inm/inm-1/expertise/tools-services-and-research-data/bigbrain
§9.1b 常见任务-资源速查
| 你要做的事 | 首选资源 | 备选 |
|---|---|---|
| 快速看某个脑区 20 µm 细节 | siibra explorer 在线 | 下载 100 µm 体数据本地浏览 |
| 与自己的 MRI 数据对齐 | BigBrainWarp | mincresample + 官方配准网格 |
| 复现皮层分层分割 | Wagstyl 2020 论文 + BigBrainWarp surface tools | EBRAINS 直接下载官方分层结果 |
| 细胞体检测训练 | 1 µm patch 数据集(2023,约 52 GB) | 1 µm 重扫描子集(2022) |
| 全分辨率训练/复现 | FTP 全量 + blocks 拼接(§6.3) | EBRAINS KG 全量条目 |
| 查某个文件是什么 | 官方 FAQ | EBRAINS KG 元数据 |
| 跨标本组织学验证 | NextBrain(预印本,谨慎引用) | AHEAD 标本 |
§9.2 教程与学习路径
- 零下载入门:siibra explorer 在线浏览 BigBrain 与分层图(EBRAINS viewer)。
- 跨模态整合:BigBrainWarp 官方三教程(ROI 初始化、微结构梯度、intensity profile 矩参数化)。
- 分层复现:按 Wagstyl et al. 2020 方法节复现剖面采样与 CNN 分层(等体积表面构建见 BigBrainWarp surface tools)。
- 细胞级分析:申请/下载 1 µm patch 子集,跑通胞体检测与层级密度统计。
学习路径的推荐顺序:先走 1 → 2(两周内可完成,建立空间直觉与工具链手感),再按课题需要二选一深入 3 或 4。教程 3 需要皮层表面处理经验(推荐先修 FreeSurfer/Mothership 类表面管线基础);教程 4 需要实例分割工程经验。两者共同的前置是把 §6.1-6.3 的数据获取与预处理跑通——这一步的产出(规整后的 100 µm 体数据 + 官方表面)是后续所有方向共享的基础设施。
§9.3 BibTeX 完整引用
@article{amunts2013bigbrain,
author = {Amunts, Katrin and Lepage, Claude and Borgeat, Louis and Mohlberg, Hartmut and Dickscheid, Timo and Rousseau, Marc-{\'E}tienne and Bludau, Sebastian and Bazin, Pierre-Louis and Lewis, Lindsay B. and Oros-Peusquens, Ana-Maria and Shah, Nadim J. and Lippert, Thomas and Zilles, Karl and Evans, Alan C.},
title = {BigBrain: An Ultrahigh-Resolution 3D Human Brain Model},
journal = {Science},
volume = {340},
number = {6139},
pages = {1472--1475},
year = {2013},
doi = {10.1126/science.1235381}
}
@article{merker1983silver,
author = {Merker, Bj{\"o}rn},
title = {Silver staining of cell bodies by means of physical development},
journal = {Journal of Neuroscience Methods},
volume = {9},
number = {3},
pages = {235--241},
year = {1983},
doi = {10.1016/0165-0270(83)90086-9}
}
@article{wagstyl2020bigbrain,
author = {Wagstyl, Konrad and Larocque, St{\'e}phanie and Cucurull, Guillem and Lepage, Claude and Cohen, Joseph Paul and Bludau, Sebastian and Palomero-Gallagher, Nicola and Lewis, Lindsay B. and Funck, Thomas and Spitzer, Hannah and Dickscheid, Timo and Fletcher, Paul C. and Romero, Adriana and Zilles, Karl and Amunts, Katrin and Bengio, Yoshua and Evans, Alan C.},
title = {BigBrain 3D atlas of cortical layers: Cortical and laminar thickness gradients diverge in sensory and motor cortices},
journal = {PLOS Biology},
volume = {18},
number = {4},
pages = {e3000678},
year = {2020},
doi = {10.1371/journal.pbio.3000678}
}
@article{wagstyl2022bigbrainwarp,
author = {Wagstyl, Konrad and Paquola, Casey and Larocque, St{\'e}phanie and others},
title = {The BigBrainWarp toolbox for integration of BigBrain 3D histology with multimodal neuroimaging},
journal = {eLife},
volume = {11},
pages = {e70119},
year = {2022},
doi = {10.7554/eLife.70119}
}
@article{amunts2020julich,
author = {Amunts, Katrin and Mohlberg, Hartmut and Bludau, Sebastian and Zilles, Karl},
title = {Julich-Brain: A 3D probabilistic atlas of the human brain's cytoarchitecture},
journal = {Science},
volume = {370},
number = {6520},
year = {2020},
doi = {10.1126/science.abc9453}
}
@dataset{schiffer2022selected,
author = {Schiffer, Christian and Lepage, Claude and Omidyeganeh, Mona and Mohlberg, Hartmut and others},
title = {Selected 1 micron scans of BigBrain histological sections (v1.0)},
year = {2022},
publisher = {EBRAINS},
doi = {10.25493/JWTF-PAB}
}
§9.4 引用指南
使用 BigBrain 数据时:① 必引 Amunts et al. 2013(官方明确要求);② 使用衍生数据集时加引对应文献(分层→Wagstyl 2020;1 µm→Schiffer 2022;工具→Wagstyl 2022);③ 经 EBRAINS 访问须遵守平台 Terms & Conditions 的引用与致谢要求;④ 涉及染色方法学引 Merker 1983。本文页(千方病案医数集)可作为辅助资源引用,但不能替代上述原始文献。
§10 AI 使用声明卡
§10.1 本页涉及的 AI 模型列表
| 模型/系统 | 用途 | 提供方 |
|---|---|---|
| 大语言模型(写作辅助) | 本页文字初稿整理与结构化 | 千方病案医数集写作管线 |
| 大语言模型(检索辅助) | 检索结果摘要与事实核对辅助 | 千方病案医数集写作管线 |
§10.2 AI 参与范围说明
AI 参与了检索结果整理、初稿撰写与格式规范化。全部硬数字(切片数、分辨率、大小、许可证、引用量、日期)均要求检索来源支撑并经人工核对;代码示例为常规工具用法整理,未经逐行运行验证(见技术免责声明)。医学与解剖学表述经编辑部人工审核。
AI 未参与的环节:医学编码映射的最终裁定(ICD-11/SNOMED 与应用的对应关系由编辑部复核)、坑点与偏倚结论的事实裁决(逐条回溯到官方 FAQ 或同行评审文献)、页面状态与审核日期的写入。所有检索来源以 §10.3 清单为准,未在清单内的信息一律未进入正文。
§10.3 输入来源列表
- Amunts K, et al. BigBrain: An Ultrahigh-Resolution 3D Human Brain Model. Science 340(6139):1472-1475, 2013. DOI: 10.1126/science.1235381
- Jülich Brain Atlas 官方 BigBrain 页面:https://julich-brain-atlas.de/atlas/bigbrain
- BigBrain 官方 FAQ:https://bigbrain-ftp.loris.ca/bigbrain-ftp/FAQ.html
- EBRAINS Knowledge Graph 项目页:https://search.kg.ebrains.eu/instances/Project/af8d3519-9561-4060-8da9-2de1bb966a81
- CONP Portal BigBrain 数据集页:https://portal.conp.ca/dataset?id=projects/bigbrain-datalad
- FZ Jülich INM-1 BigBrain 机构页:https://www.fz-juelich.de/en/inm/inm-1/expertise/tools-services-and-research-data/bigbrain
- BigBrainWarp FAQ:https://bigbrainwarp.readthedocs.io/en/latest/pages/FAQs.html
- Wagstyl K, et al. The BigBrainWarp toolbox. eLife 11:e70119, 2022. DOI: 10.7554/eLife.70119(含 bioRxiv 预印本 10.1101/2021.05.04.442563)
- Wagstyl K, et al. BigBrain 3D atlas of cortical layers. PLOS Biology 18(4):e3000678, 2020. DOI: 10.1371/journal.pbio.3000678
- Merker B. Silver staining of cell bodies. J Neurosci Methods 9(3):235-241, 1983. DOI: 10.1016/0165-0270(83)90086-9
- Schiffer C, et al. Selected 1 micron scans of BigBrain histological sections (v1.0). EBRAINS, 2022. DOI: 10.25493/JWTF-PAB(HAL: hal-03933525)
- BigBrain Project"Maps & Models"页面(bigbrainproject.org 内容镜像):https://github.com/3design/3design.github.io/blob/ca17217f05e5cbaf95cb0b77c94e204ba9394694/maps-and-models.html
- JuSER 记录 FZJ-2023-04793(BigBrain Analysis: Cellular-Level Precision at 1µm Resolution):https://juser.fz-juelich.de/record/1018412
- 多模态脑数据探索软件对比研究:PMC12849229
- Nature 新闻 Whole human brain mapped in 3D(2013):https://www.nature.com/articles/nature.2013.13245
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与全部规模数字 | 千方病案医学编辑部 | 对照官方页/FAQ/EBRAINS KG 逐项核对 | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 医学术语与编码人工复核 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 对照 CONP/FTP/BigBrainWarp 文档核对 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 坑点逐条对照官方 FAQ/eLife 论文溯源 | ✅ 已通过 |
| §7 DAIMS 与偏倚分析 | 千方病案医学编辑部 | 逐项评估状态与说明核对 | ✅ 已通过 |
| §8-§9 引用与生态信息 | 千方病案医学编辑部 | 引用量与文献元数据核对(截至 2026-09) | ✅ 已通过 |
§10.5 AI 生成章节标注
初稿由 AI 写作管线生成;§0 免责声明为编辑部固定模板;全部章节经上表所列人工校验后发布,不存在未审核的 AI 生成内容。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致;引用量等动态数据标注截至 2026-09)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- human-connectome-project — 共享标签:医学影像 / 神经科学 / 脑影像
- adam-aneurysm — 共享标签:医学影像 / 神经科学 / 脑影像
- oasis — 共享标签:医学影像 / 神经科学 / 脑影像
- fastmri — 共享标签:医学影像 / 神经科学 / 脑影像
- enigma — 共享标签:医学影像 / 脑影像
- hbn-eeg — 共享标签:医学影像 / 神经科学
- ivy-gap — 共享标签:医学影像 / 神经科学 / 病理图像
- atlas-v2 — 共享标签:医学影像 / 神经科学 / 脑影像
- bcnb — 共享标签:医学影像 / 病理图像
- cytoimagenet — 共享标签:医学影像 / 病理图像
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

