ENIGMA — 国际多中心脑影像遗传联盟 AI-Ready Wikipedia | 千方病案医数集

50 个工作组、43 国 200+ 机构的分布式脑影像遗传荟萃分析联盟

来源 ENIGMA Consortium(USC Stevens 神经影像与信息学研究所) url: http://enigma.ini.usc.edu/发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称ENIGMA — 国际多中心脑影像遗传联盟 AI-Ready Wikipedia | 千方病案医数集
数据类型50 个活跃工作组,43 国 200+ 机构,GWAS 汇总 51,665 人,26 种脑疾病,协议公开共享,汇总统计申请获取
规模代表性 GWAS 汇总 30,717-51,665 名受试者
接入方式ENIGMA Consortium(USC Stevens 神经影像与信息学研究所) url: http://enigma.ini.usc.edu/
AI 就绪度

数据集封面

ENIGMA(国际多中心脑影像遗传联盟)— 全球分布式脑影像遗传荟萃分析联盟 AI-Ready Wikipedia

INFOBOX

字段 内容
数据集名称 ENIGMA 国际脑影像遗传学联盟
英文全称 Enhancing NeuroImaging Genetics through Meta Analysis (ENIGMA) Consortium
别名/简称 ENIGMA;ENIGMA1/ENIGMA2/ENIGMA3(三代 GWAS 项目)
疾病分类(ICD-11) 6A20(精神分裂症)、6A60(双相 I 型)、6A71(复发性抑郁障碍)、6B40(创伤后应激障碍)、6A05(注意缺陷多动障碍)、8A61–8A6Y(癫痫)、8A00(帕金森病)等 26 种脑疾病
SNOMED CT 58214004(精神分裂症)、35489007(抑郁障碍)、84757004(癫痫)、49049000(帕金森病)
数据模态 结构 MRI(T1)、弥散 MRI(DWI/DTI)、功能 MRI、EEG/MEG/MRS、全基因组基因分型与 DNA 甲基化
AI 任务类型 脑结构表型提取与分割 QC、GWAS/荟萃分析、病例-对照效应估计、跨站点谐波化(harmonization)、脑龄与 normative 建模
样本总数 代表性 GWAS 汇总 30,717-51,665 名受试者;疾病工作组荟萃 N=1,868-10,105(见正文)
数据大小 无集中托管总量:原始影像由各站点自持;GWAS 汇总统计各研究数十 MB 量级,经申请获取
数据格式 跨站点统一 CSV 计量表(FreeSurfer 派生)、GWAS 汇总统计文本文件、公开协议(PDF/Word)与脚本(GitHub/NITRC)
许可证 分布式许可:协议与 QC 脚本公开可复用;汇总统计经申请审核;原始数据适用各来源队列各自许可
访问级别 申请审核(GWAS 汇总统计);加入工作组后协作分析(个体级数据不集中共享)
语言 英语(协议、文档与支持邮件)
首发日期 2009 年(联盟成立);2012 年(ENIGMA1 首篇 GWAS 论文)
最后更新 持续运行(官网 50 个活跃工作组,截至 2026-09)
发布机构 USC Mark and Mary Stevens 神经影像与信息学研究所(Keck School of Medicine of USC)
官方主页 http://enigma.ini.usc.edu/
下载地址 GWAS 汇总统计申请页协议总页
DOI 10.1038/s41398-020-0705-1(联盟十年综述,标识性引用)
AI 就绪度评分 ⭐⭐⭐(3/5)— 协议、QC 脚本与汇总统计齐备且公开申请可得;扣分项:原始影像不可整体下载、个体级数据须加入工作组协作获取,AI 直接复用以汇总统计与协议为主
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、覆盖疾病谱与临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典(跨站点计量表与汇总统计双形态)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 ENIGMA 联盟、USC 及各参与机构无任何商业利益关联。本页面不销售 ENIGMA 数据,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 ENIGMA 或 USC 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ENIGMA 的分析协议与 QC 脚本公开可复用(引用要求见官方协议页);GWAS 汇总统计须经官方申请表审核后获取;原始影像与个体级数据由各参与站点/来源队列自持并适用各自许可与伦理约束。具体使用限制以 ENIGMA 官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? ENIGMA(Enhancing NeuroImaging Genetics through Meta Analysis,直译"通过荟萃分析增强神经影像遗传学")是一个全球科学家联盟:截至 2019-2020 年,它聚合了 43 个国家、200 余家机构的 1,400 余名科学家,下设 50 个工作组,研究 26 种重大脑疾病(精神分裂症、抑郁症、双相障碍、癫痫、帕金森病等)来源。它由 USC 的 Paul Thompson 实验室于 2009 年牵头发起 来源

为什么重要? 单个实验室扫几百人的脑 MRI,几乎不可能发现微弱但真实的大脑结构差异。ENIGMA 让全球各站点用同一套公开协议处理各自的数据、只上传统计结果做荟萃,从而把样本推到数万级别——其皮层结构 GWAS 汇总了 51,665 人、60 个队列 来源,是迄今最大规模的脑影像遗传学研究。

我能用它做什么? 你可以直接申请下载现成的 GWAS 汇总统计(约 5 个工作日审核)做遗传分析或 MR 表型工程 来源;也可以免费复用其公开的分割、QC、谐波化协议来处理自己的影像数据 来源;若需要个体级数据,则申请加入对应工作组协作。注意:ENIGMA 不是"一个可以整体下载的数据集"。

§1.1 摘要

ENIGMA 的方法论核心是"分布式汇聚":数据永远留在各参与站点,联盟分发的只有标准化协议——FreeSurfer/FIRST 自动分割、逐受试者目视 QC、1000 Genomes 插补、站点级关联分析;各站点按约定格式(统一 CSV 计量表、固定命名的 GWAS 汇总统计文件)仅上传结果,由中心站点(USC Stevens 影像遗传中心等)执行固定效应逆方差加权荟萃 来源。这条路线在三代 GWAS 项目中逐步升级:ENIGMA1(海马/颅内体积先导,Stein et al. 2012)、ENIGMA2(7 个皮层下结构 + 颅内体积,Hibar et al. 2015,30,717 人)、ENIGMA3(34 个皮层区域面积与厚度,Grasby, Jahanshad et al. 2020,51,665 人)来源。在疾病方向,各工作组用同一管线完成了精神分裂症(N=9,572)、双相障碍(N=6,503)、重性抑郁(N=10,105)、PTSD(N=1,868)等迄今最大的脑影像病例-对照荟萃 来源。对 AI 研究者,其直接可用资产是:公开协议与 QC 脚本、可申请的 GWAS 汇总统计、以及发表文献中的效应量基准。

§1.2 战略价值

维度一:方法学基础设施价值。 ENIGMA 公开的不只是数据,而是一整套经过数十万次质检打磨的多中心影像分析工作流:皮层 QC 2.0 协议(2017-04 更新)规定了从 FreeSurfer 提取、目视核查、离群日志到人群直方图复核的完整步骤 来源;DTI 协议覆盖 DICOM 转换、FA 图质量控制与 GWAS 前插补 QC,现托管于 ENIGMA GitHub 与 NITRC 来源。任何机构在启动多中心 MRI 研究时,直接采用 ENIGMA 协议即可继承其跨站点可比性——这是该"数据集"对 AI 团队最持久的输出。

维度二:样本效力与可复现性价值。 联盟荟萃效应量极小的真实脑-病关联:成人抑郁患者眶额皮质、扣带回、岛叶与颞叶皮层变薄,Cohen’s d 仅 -0.10 至 -0.14,只有在 20 个队列、8,105 人的汇聚下才稳定检出 来源。这类"小效应、大样本"结论天然自带多站点复现属性——每个效应都在不同扫描仪、不同人群、不同大洲上重复出现,为 AI 模型的泛化性假设提供了难得的经验参照系。

维度三:分布式科学范式的制度样本。 ENIGMA 证明了"数据不动、协议动、结果动"的协作模式在医疗 AI 时代可以规模化运行:以 2019-09 的 ENIGMA-MDD 为例,14 国 35 机构 45 队列在无集中数据仓库的前提下完成了 14,160 人的累计汇聚,联盟将此归因于低成本数据汇集、标准化协议协调分析、数百名跨领域专家协作与统一 QA 四项机制 来源。对受隐私监管约束的国内医疗 AI 团队,这套制度设计(协议公开、结果汇聚、站点自持)是可以直接借鉴的落地模板,其 FAIR 实现细节已有专文总结 来源

§1.3 同类数据集横向对比

数据集 规模 模态 数据形态 与 ENIGMA 的差异
ENIGMA 50 工作组、43 国;代表性 GWAS 30,717-51,665 人 来源 sMRI/dMRI/fMRI/EEG/基因组 分布式:站点自持 + 协议共享 + 汇总统计汇聚 以荟萃分析网络形态存在,无集中下载体
UK Biobank 约 50 万名参与者队列 sMRI/dMRI/fMRI/基因组/临床 集中托管,经申请获取个体级数据 单一队列内部一致性好,但站点变异与多样性低于跨国联盟
ADNI 数千名受试者纵向随访 sMRI/dMRI/PET/CSF 集中托管,注册后下载 聚焦阿尔茨海默病,ENIGMA 将 ADNI 作为输入队列之一
ABCD 约 1.2 万名儿童青少年 sMRI/dMRI/fMRI/基因组 集中托管(NIMH 数据档案) 单一标准化协议的青年队列;ENIGMA 覆盖全生命周期与多疾病
PGC 数十万人级精神疾病 GWAS 基因组 汇总统计共享联盟 纯遗传联盟;ENIGMA 与其互补,把脑影像作为内表型

§1.4 版本时间轴

时间 版本/里程碑 说明
2009 联盟成立 USC 发起,目标:提升脑影像 GWAS 统计效力 来源
2012 ENIGMA1(Stein et al., Nature Genetics) 海马体积/颅内体积 GWAS 先导,70 家机构、12,826 人 + CHARGE 12,171 人复现 来源
2014 联盟首篇综述(Brain Imaging and Behavior) 整合 24,997 人影像-遗传分析 来源
2015 ENIGMA2(Hibar et al., Nature) 30,717 人、50 队列皮层下体积 GWAS,5 个新位点 来源
2015-2016 疾病工作组爆发期 30+ 工作组、35 国;SCZ/MDD 最大影像荟萃发表 来源
2017-04 皮层 QC 2.0 协议 简化目视 QC 流程,向后兼容 来源
2020 ENIGMA3(Grasby, Jahanshad et al., Science) 51,665 人皮层面积/厚度 GWAS,199 个过多重校正显著位点 来源
2020 十年综述(Translational Psychiatry) 1,400+ 科学家、43 国、50 工作组全景 来源
2022-2024 汇总统计持续扩充 纵向 GWAS(Brouwer 2022)、ICV/皮层下联合(Garcia-Marin 2024)开放申请 来源
2026-09 官网现状 50 个活跃工作组持续招募 来源

§1.5 典型应用场景

  1. 脑结构 GWAS 与多基因风险研究:直接下载 ENIGMA2/ENIGMA3 汇总统计,计算多基因风险分数(PRS)与脑体积/皮层厚度的关联,或做孟德尔随机化 来源
  2. 多中心 AI 模型谐波化基准:用 ENIGMA 协议 + 各站点 FreeSurfer 输出,评测 ComBat 等站点效应校正方法,再检验 site×diagnosis 交互 来源
  3. 病例-对照效应量参考系:将自己队列的皮层/皮层下效应量与 ENIGMA 发表基准(如 MDD d=-0.10~-0.14)对比,判断样本量与效应是否合理 来源
  4. normative 生长曲线构建:利用联盟汇聚的数万健康对照计量,建立各年龄段的皮层下体积参考区间,识别个体偏离 来源
  5. 影像 QC 教学与自动化标注器训练:ENIGMA 目视 QC 协议提供好/坏分割图例与离群日志格式,可用于训练分割质量分类器 来源

§1.6 联盟工作组地图

理解 ENIGMA 的数据形态,先要理解其组织结构。官网当前列出的 50 个活跃工作组分三类,各类协作方式一致、数据形态相同 来源

类别 数量 代表工作组 与 AI 研究者的关系
疾病组(临床) 约 30 个 MDD、SCZ、BD、PTSD、ADHD、OCD、Epilepsy、Parkinson’s、Anxiety、Eating Disorders、Suicidal Thoughts & Behaviors、TBI、HIV、22q11.2、Autism、Sleep、Chronic Pain、FTD、Stroke Recovery 等 加入后按协议贡献站点数据参与荟萃
方法学组(技术) 约 12 个 GWAS、Cortical Thickness、DTI & Connectomics、rs-fMRI、tb-fMRI、EEG、MEG、MRS、Epigenetics、CNVs、Subcortical Shape、BrainAGE 协议直接公开复用,是 AI 工程最常交互的对象
生命历程/横向组 数个 Lifespan、Plasticity、Laterality、Environment、Evolution、Meditation、Neuromodulation、Neurofeedback、ORIGINs 提供纵向与发育视角的表型扩展

三大方法支柱贯穿所有疾病组:皮层下体积(ENIGMA2 路线)、皮层厚度/面积(ENIGMA3 路线)、白质微结构(DTI 路线)来源。任何新加入的站点只需掌握这三条管线,即可参与几乎所有工作组的项目——这正是协议共享的杠杆效应。


§2 医学背景

§2.1 ICD-11 编码映射表

标签 ICD-11 编码 ICD-11 中文名 说明
精神分裂症 6A20 精神分裂症 ENIGMA-SCZ 荟萃 N=9,572(4,474 例)来源
双相障碍 6A60 双相 I 型障碍 ENIGMA-BD 荟萃 N=6,503(2,447 例)来源
重性抑郁 6A70/6A71 单次发作/复发性抑郁障碍 ENIGMA-MDD 荟萃 N=10,105(2,148 例)来源
PTSD 6B40 创伤后应激障碍 ENIGMA-PTSD 荟萃 N=1,868 来源
ADHD 6A05 注意缺陷多动障碍 ENIGMA-ADHD 工作组 来源
强迫障碍 6B20 强迫障碍 ENIGMA-OCD 工作组 来源
癫痫 8A61–8A6Y 癫痫 ENIGMA-Epilepsy 工作组 来源
帕金森病 8A00 帕金森病 ENIGMA-Parkinson’s 工作组 来源

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 SNOMED 术语
精神分裂症 6A20 58214004 Schizophrenia (disorder)
抑郁障碍 6A70/6A71 35489007 Depressive disorder (disorder)
癫痫 8A61–8A6Y 84757004 Epilepsy (disease)
帕金森病 8A00 49049000 Parkinson’s disease (disorder)

§2.2 疾病简介与流行病学

ENIGMA 覆盖 26 种重大脑疾病,横跨精神病学(抑郁、双相、精神分裂、焦虑、强迫、PTSD、成瘾)、神经病学(癫痫、帕金森、卒中恢复、共济失调、创伤性脑损伤、额颞痴呆)与神经发育(自闭症、ADHD、抽动障碍)来源。以最核心的三种为例:重性抑郁障碍全球患病率约数个百分点量级,是致残主因之一;精神分裂症患病率约 1%,与皮层灰质变薄相关;双相障碍患病率约 1%-2%。这些疾病的共同特征是:单一影像指标的组间效应量普遍很小(Cohen’s d 多在 0.1-0.3 区间),单中心样本难以稳定检出,必须依赖多中心汇聚——这正是 ENIGMA 存在的医学理由 来源

从影像遗传学角度,脑结构是典型的复合内表型(endophenotype):Hibar et al. 2015 证明常见变异对皮层下体积的效应是结构特异性的(如 rs945270 单点解释壳核体积 0.52% 方差)来源;Grasby et al. 2020 估计常见变异合计解释总皮层表面积 34%(SE=3%)、平均厚度 26%(SE=2%)来源。这些遗传度数字界定了任何脑影像 AI 模型可达到的预测上限的生物学来源。

核心疾病的高层流行病学画像(均为公开文献共识量级,供定位参考;具体数字以 WHO/各国官方统计为准):

疾病 全球患病率量级 影像表型发现(ENIGMA) WG 覆盖
重性抑郁 成人约数个百分点 成人眶额-扣带回-岛叶-颞叶变薄;青少年表面积降低 来源 MDD、Anxiety、STB
精神分裂症 约 1% 皮层下体积与皮层效应基准(N=9,572 荟萃)来源 SCZ、CHR、Relatives、Schizotypy
双相障碍 1%-2% N=6,503 荟萃效应谱 来源 BD
癫痫 约 1% 专设国际癫痫工作组(联盟扩张样本)来源 Epilepsy
帕金森病 老年人群随年龄陡增 专设工作组 来源 Parkinson’s
ADHD 儿童青少年约 5% 量级 神经发育方向 WG 来源 ADHD、Autism、Tourette’s

§2.2b 内表型逻辑:为什么"脑结构 + 基因组"是正确的组合

精神疾病的高维遗传结构(多基因、上位效应、基因-环境交互)使得直接以诊断为目标的研究效力受限;ENIGMA 的奠基假设是:以 MRI 派生的脑计量为中间表型,能更可重复地把基因变异与神经生物学机制连接起来 来源。这条逻辑链决定了联盟的三大设计选择:(1) 表型必须自动化提取(FreeSurfer/FIRST),否则数万人样本无法人工标注;(2) 协议必须跨站点统一,否则荟萃失效;(3) 只汇聚统计结果而非原始数据,否则伦理与法律成本不可承受。这三条选择直接塑造了 §4 描述的数据结构——AI 研究者看到的一切形态,都是这条内表型逻辑的工程投影。

§2.3 临床任务定义

任务 定义 ENIGMA 中的角色
筛查 识别脑结构偏离人群 normative 的个体 联盟汇聚的数万健康对照提供 normative 参考区间 来源
诊断辅助 病例-对照脑结构差异模式 各疾病工作组跨站点复现的效应模式(如 MDD 皮层变薄区域谱)来源
分级/亚型 按首发/复发、发病年龄、青少年 vs 成人分层 MDD 效应在首发与成人起病患者中最强,青少年表现为表面积下降而非变薄 来源
预后/进展 纵向体积变化 ENIGMA-Plasticity 纵向 GWAS(Brouwer et al. 2022)汇总统计开放申请 来源
内表型定位 基因 → 脑结构 → 疾病风险链路 三代 GWAS 项目的核心任务 来源

§2.4 患者人群表

子群体 来源队列类型 年龄范围 说明
健康对照 人群队列、志愿者、双生子登记 全生命周期 汇聚于各 GWAS 与疾病荟萃对照组;ENIGMA3 中 51,665 人来自 60 个队列 来源
MDD 患者 临床队列、社区研究 成人 + 青少年(分设) 2019-09 时 ENIGMA-MDD 累计 9,788 健康 + 4,372 MDD 来源
精神分裂症患者 临床队列(含家族设计) 成人为主 荟萃 N=9,572,4,474 例 来源
双相/PTSD/成瘾等 临床队列 成人为主 各工作组独立汇总 来源
特殊人群 22q11.2 缺失综合征、HIV、化疗后认知等 视队列而定 50 个工作组中的专病方向 来源

性别与种族字段在联盟层面不设统一人口学配额:各站点队列的年龄/性别/祖源构成由站点自报,ENIGMA2 discovery 样本为欧裔(分析前剔除非欧裔个体)来源,跨祖源扩展是联盟公开承认的局限(见 §7)。

§2.5 临床价值

ENIGMA 产出的效应模式为临床转化提供了三层价值。第一层是可复现的疾病脑结构指纹:成人 MDD 的眶额-扣带回-岛叶-颞叶变薄谱在 20 个全球队列中一致出现,且在首发与成人起病亚组最强,提示状态性而非纯素质性改变 来源。第二层是药物/环境调节因子识别:联盟层面可检验年龄、性别、药物暴露等调节变量,这是单中心不可能的统计效力 来源。第三层是个体化预测的地基:Thompson et al. 2015 明确提出 ENIGMA 正在构建"连接个体脑扫描与基因组数据的未来预测因子",其数万人 normative 数据可用于检测特定群体偏离正常发育或老化的程度 来源

从转化路径看,这三层价值对应三个时间尺度:疾病指纹(已交付,可直接引用为文献基准)→ 调节因子图谱(持续产出,随 WG 扩展累积)→ 个体预测(愿景阶段,依赖 normative 数据与机器学习的结合)。临床 AI 团队应据此校准预期:ENIGMA 今天能给你的是"经过 20 个队列复现的效应量参考系"与"公开可复用的多中心工作流",而不是一个可以直接上线的诊断模型——后者需要你的本地数据、本地扫描仪与本地人群来完成最后一公里 来源

§2.6 金标准与参考基准描述

维度 内容
划分方式 无单一 train/test 划分:各研究在荟萃前由协议规定站点级分析模型与协变量;机器学习类研究自行划分并需处理站点分层
标注方式 影像结构标注 = FreeSurfer/FIRST 自动分割 + 强制目视 QC(好/坏分割图例 + 直方图正态检查 + 离群日志)来源;诊断标签 = 各站点临床诊断(站点自报标准)
标注者资质 分割由自动管线产出;QC 由站点影像分析人员按统一图例执行;跨站点一致性由中心站点随机抽检复核(如 Vermont 中心抽检)来源
性质 研究性参考基准(reference benchmark):效应量与位点发现以同行评审荟萃论文形式固化,而非挑战赛式榜单

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本/资产 大小/门槛 理由
跑脑结构 GWAS、PRS、MR ENIGMA2 汇总统计(Hibar 2015)+ ENIGMA3 汇总统计(Grasby 2020) 各数十 MB;在线申请表 + 约 5 个工作日审核 皮层下 7 结构 + ICV 与 34 皮层区域两代完整位点谱 来源
处理自己机构的 MRI 数据 ENIGMA 皮层/皮层下/DTI 公开协议与 QC 脚本 免费,GitHub/NITRC 下载 直接继承跨站点可比的分割与 QC 工作流 来源
做疾病组间荟萃/跨疾病对比 加入对应疾病工作组(如 ENIGMA-MDD,14 国 35 机构) 提交站点数据承诺书,邮箱申请 个体级数据仅在组内按协议协作分析 来源
纵向/发育研究 ENIGMA-Plasticity 纵向汇总统计(Brouwer 2022) 申请获取 纵向皮层与皮层下指标 GWAS 来源
EEG 表型遗传研究 ENIGMA-EEG 汇总统计(Smit 2018) 申请获取 振荡活动 GWAS 来源

§3.1 模态详情

模态 内容 典型用途 采集方式
结构 MRI(T1) 皮层下 7 结构体积(伏隔核、尾状核、壳核、苍白球、杏仁核、海马、丘脑)、ICV、34 区域皮层厚度/表面积 分割 QC、体积荟萃、GWAS 各站点临床/研究扫描仪,FreeSurfer/FIRST 统一提取 来源
弥散 MRI(DWI/DTI) FA/MD 等扩散张量指标、TBSS 骨架 白质微结构 GWAS(ENIGMA-DTI) FSL 生态预处理,协议不强限软件但要求关键步骤完整 来源
功能 MRI / 任务 fMRI rs-fMRI 与任务态工作组 功能连通与激活荟萃 专设 rs-fMRI/tb-fMRI 工作组 来源
基因组 全基因组基因分型 + 1000 Genomes (phase 1 v3) 插补 站点级 GWAS → 中心荟萃 各站点商业芯片 + 统一插补协议 来源
EEG / MEG / MRS 振荡活动 GWAS、波谱工作组 电生理-遗传联合 ENIGMA-EEG/MEG/MRS 工作组 来源
甲基化 血液 DNA 甲基化 + 皮层下体积 EWAS 表观遗传-影像关联 ENIGMA-Epigenetics 协议(2016 版)来源

§3.2 按子集样本数表

子集/研究 样本量 队列数 出处
ENIGMA1 先导(海马/ICV) 12,826(+CHARGE 12,171 复现) 70 机构 来源
ENIGMA2 皮层下体积 GWAS 30,717 50 队列 来源
ENIGMA3 皮层面积/厚度 GWAS 51,665 60 队列 来源
SCZ 病例-对照荟萃 9,572(4,474 例) 多队列 来源
BD 病例-对照荟萃 6,503(2,447 例) 多队列 来源
MDD 病例-对照荟萃 10,105(2,148 例) 多队列 来源
MDD 皮层荟萃(Schmaal 2016) 2,148 MDD + 7,957 对照 20 队列 来源
ENIGMA-MDD 网络累计 9,788 健康 + 4,372 MDD 35 机构/45 队列/14 国 来源

§3.3 数据格式表

资产 格式 结构说明
跨站点计量表 CSV/电子表格 按 FreeSurfer 输出目录结构抽取的体积/厚度列,列布局跨站点一致(如皮层下体积列沿用 aseg 惯例命名),非影像协变量由各站点按约定格式整理 来源
GWAS 汇总统计 文本(每行一个变异) 位点 ID、等位、频率、效应量、SE、P、N 等列,供固定效应荟萃 来源
分析协议 PDF/Word 皮层、皮层下、插补、关联、荟萃全流程步骤 来源
QC 脚本 Matlab/R/HTML 报告 标准切面图生成、离群日志、直方图 来源
DTI 工具 GitHub/NITRC 包 预处理-QC-GWAS 三段式 来源

§3.4 存储大小

ENIGMA 无集中托管的数据总量可言——这正是其数据形态的本质。可申请的 GWAS 汇总统计以文本为主,单个研究文件数十 MB 量级,官方未公布精确字节数 来源。若以协议复现视角估算自己站点的处理开销:单受试者 FreeSurfer 全脑分割的中间产物通常为数 GB 级别,数万受试者规模的完整镜像只在各站点本地存在,联盟层面从不聚合。AI 团队做规划时应按"自己队列的原始数据 + 数十 MB 汇总统计"建模,而非按"全量镜像"建模。

存储规划参考表:

工作负载 数据量级 存储/内存建议 说明
读取全部已发表汇总统计 数百 MB-数 GB 本地磁盘即可 9 类研究申请齐备后的总量
皮层下 GWAS 复现(P 值处理) 单文件数十 MB pandas/awk 内存即可 每行一个变异
站点级 FreeSurfer 批处理 每受试者数 GB 500 GB-数 TB recon-all 时长数小时/人
跨站点计量表聚合 每万人数十 MB CSV 内存足够 宽格式,见 §4.1
DTI 预处理(FSL) 每受试者原始 DWI 数 GB 磁盘密集 协议不强限实现 来源

§3.5 标注方式

标注对象 方式 性质
皮层下结构分割 FreeSurfer(全脑)/ FIRST 自动分割 自动 + 强制人工 QC
皮层厚度/面积 FreeSurfer 表面重建 + Desikan 图谱 ROI 自动 + 强制人工 QC 来源
分割质量标签 目视核查标准切面图,好/坏图例对照,离群值日志辅助 人工(站点执行 + 中心抽检)来源
疾病诊断 各站点临床诊断(DSM/ICD 体系,站点自报) 人工(跨站点异质)
遗传变异-表型关联 站点级 GWAS + 中心固定效应荟萃 统计产出

§3.6 标注者资质与一致性

ENIGMA 的"标注"以管线自动化为主、人工核查为辅。QC 执行者是各站点熟悉 FreeSurfer 输出的影像分析人员,协议用统一图例、QC 模板与离群日志把主观性压到最低 来源;中心站点(如物质依赖荟萃中的 Vermont 中心)对每研究随机子样本再抽检,确保跨站点 QC 一致性 来源。联盟层面未发布 QC 评分者间 Kappa 统计,协议以"分割差/误标者剔除 + 直方图正态确认"为操作化标准;ENIGMA 脑测量协议的可靠性已由多篇独立文献验证 来源

§3.7 采集周期

联盟本身不采集数据,而是汇聚各站点既有队列:时间跨度从早期 GWAS(Stein 2012)至 2024 年仍新增的汇总统计(Garcia-Marin et al., Nat Genetics 2024)来源。每个具体荟萃的采集窗口由其包含队列各自决定,论文方法学部分逐队列披露。纵向方向由 ENIGMA-Plasticity 工作组专责 来源

采集与更新节奏全景:

层面 节奏 说明
联盟整体 持续运行(2009 至今) 50 个 WG 中不断有新组创立(如近年新增 Sleep、Chronic Pain、Meditation 等)来源
疾病 WG 项目 按研究周期,数年一轮 如 MDD WG 2012 成立、2019 发布七年综述 来源
GWAS 代际 约 3-5 年一代 ENIGMA1(2012)→ ENIGMA2(2015)→ ENIGMA3(2020)
汇总统计发布 论文发表后开放申请 2022/2024 年仍在新增 来源
协议更新 按需修订 皮层 QC 2.0(2017-04);DTI PreImputationQC(2024-04)来源

§3.8 地域覆盖

2019-2020 年口径:43 个国家、200 余家机构、六大洲 来源。单工作组层面:ENIGMA-MDD 覆盖 14 国、45 队列、六洲(2019-09)来源;2015 年口径为 35 国 来源。官网维护各工作组参与站点清单 来源。注意地域覆盖不等于祖源均衡:GWAS discovery 样本以欧裔为主(见 §7.1)。

§3.9 设备规格

ENIGMA 不统一扫描仪——多中心异质性是其方法论前提。物质依赖荟萃的补充材料披露:各站点使用不同采集协议,分析统一在 FreeSurfer 5.3 完成,7 个双侧皮层下与 34 个双侧皮层 ROI 提取,站点作为协变量/随机因子进入模型 来源。DTI 方向协议明确允许站点按自身扫描参数选择最优预处理路径(如仅 6/12 方向时不做 HARDI 算法)来源。设备型号/场强逐站点清单见各荟萃论文补充表。

设备与采集参数的工程处理框架:

参数 跨站点状况 协议处理方式 AI 管线建议
扫描仪厂商/场强 各站点不同 不强制;站点作为统计因子 建模前完成站点清单与设备字典
T1 序列参数 各站点不同 统一进入 FreeSurfer 自动管线 记录序列版本号入溯源
DWI 方向数 6/12 至 HARDI 不等 允许站点按方向数选路径 来源 低方向数据跳过高阶算法
分割软件版本 项目内锁定 统一版本(如 FreeSurfer 5.3)来源 版本写入产出物
QC 抽检 中心站点执行 随机子样本二级核查 来源 模拟抽检机制自建

对 AI 团队的含义:不要指望"拿到一张统一的设备参数表"——设备信息散布在各论文补充材料中,重建这份字典本身是多中心项目的前置工程。

§3.10 深度溯源链

可追溯链条为:来源队列(UK Biobank、ADNI、CHARGE、IMAGEN 等)→ 站点本地采集与脱敏 → ENIGMA 公开协议处理(分割/QC/插补)→ 站点级统计文件 → 中心荟萃 → 同行评审论文 → 汇总统计开放申请 来源。每一环都有书面痕迹:协议版本(如皮层 QC 2.0,2017-04)、队列清单(ENIGMA-MDD 成员名单 PDF)、论文补充材料。AI 研究者引用任一 ENIGMA 数字时,应回溯到具体荟萃论文而非联盟层面的笼统数字。


§4 数据结构

§4.0 目录树

以下为申请获批后GWAS 汇总统计 + 复用协议时的典型工作目录形态(ENIGMA 不存在"解压后的统一数据集目录",这是其与常规数据集最大的结构差异):

enigma_workspace/
├── protocols/                        # 从官网/GitHub 下载的公开协议与脚本
│   ├── enigma2_subcortical/          # ENIGMA2 皮层下体积协议
│   │   ├── ENIGMA2_Association_Protocol_MethodB.pdf
│   │   └── imputation_protocol.pdf
│   ├── enigma3_cortical/             # ENIGMA3 皮层协议 + QC 2.0
│   │   ├── cortical_QC_scripts_v2/   # Matlab QC 脚本(切面图/离群日志/直方图)
│   │   └── ENIGMA3_Protocol.doc
│   └── enigma_dti/                   # DTI 三段式协议(NITRC 包)
├── sumstats/                         # 申请获批后下载的 GWAS 汇总统计
│   ├── enigma2_subcortical_hibar2015/
│   │   ├── putamen_volume_gwas.txt   # 每行一个变异:MarkerName/等位/频率/Beta/SE/P/N
│   │   ├── hippocampus_volume_gwas.txt
│   │   └── icv_gwas.txt
│   └── enigma3_cortical_grasby2020/
│       ├── sa_total_gwas.txt         # 皮层总表面积
│       └── ct_34regions/             # 34 区域厚度/面积各一文件
├── local_site/                       # 你的站点数据(自持,按 ENIGMA 协议组织)
│   ├── freesurfer/                   # FreeSurfer subjects 目录(沿用官方目录结构)
│   │   └── sub-001/
│   │       ├── label/                # 分割标签
│   │       ├── stats/                # aseg.stats / aparc.stats(计量抽取源)
│   │       └── surf/                 # 表面重建输出
│   ├── qc/                           # QC 产物:切面图 PNG、离群日志、直方图
│   └── measures/                     # 按约定列布局汇总的跨站点风格 CSV
│       └── subcortical_volumes.csv   # SubjID/Site/诊断/年龄/性别/ICV/各结构体积
└── meta_analysis/                    # 站点级统计上传前的自检脚本与结果

§4.1 DAIMS 字段字典

以最常用的皮层下体积计量表(ENIGMA2 风格,列名沿用 FreeSurfer aseg 惯例)为例:

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SubjID string 站点内受试者唯一 ID SUBJ_0147 主键、防重复 ID 复用需站点自查 非空文本
Site string 扫描站点代码 SiteA 站点效应建模、分层划分 站点改名需对照清单 协议约定代码
Diagnosis int/string 病例-对照标签 0/1 或站点编码 分类目标 站点间诊断标准异质 -9 或留空(视项目)
Age float 采捕时年龄 34.5 协变量、分层 自报/档案差 -9 视队列
Sex int 生理性别编码 0/1 协变量、公平性分析 编码方向需站点确认 -9
ICV (eTIV) float 颅内体积(mm³) 1,482,000 体积校正协变量 FreeSurfer 版本敏感 空值需 QC 排查 约 1.0-1.9×10⁶
Left-Hippocampus float 左海马体积(mm³) 4,102 回归目标/特征 分割 QC 后残差 QC 剔除 约 2,500-6,000
Right-Putamen float 右壳核体积(mm³) 6,155 回归目标/特征 同上 QC 剔除 约 4,000-8,500
是否 QC 通过 bool 目视 QC 结论 TRUE 样本过滤 抽检一致性无公开统计

汇总统计文件的典型字段:MarkerName(rs ID)、A1/A2(效应/参考等位)、Freq(等位频率)、BETA(每等位效应)、SE、P、N(有效样本量)——这是 ENIGMA2 各站点上传、中心做逆方差加权固定效应荟萃的标准产出形态 来源

§4.2 标签分布

以疾病方向为例(Thompson et al. 2020 汇总):SCZ 荟萃病例占比约 46.7%(4,474/9,572);BD 约 37.6%(2,447/6,503);MDD 约 21.3%(2,148/10,105);PTSD 荟萃 N=1,868 来源。ENIGMA-MDD 网络累计口径下病例占比约 30.9%(4,372/14,160)来源。GWAS 方向(ENIGMA2/3)以健康人群为主,病例-对照为协变量层级而非主标签。任何以"诊断"为目标的 AI 任务都应意识到:多数工作组荟萃中对照显著多于病例,且病例构成(首发/复发、用药状态)跨站点异质 来源

标签分布速查:

研究 病例 对照 病例占比 对 AI 的含义
SCZ 荟萃 4,474 5,098 46.7% 接近均衡,分类任务可行 来源
BD 荟萃 2,447 4,056 37.6% 中度失衡 来源
MDD 荟萃 2,148 7,957 21.3% 明显失衡;效应小,以效应量为主口径 来源
MDD 网络累计 4,372 9,788 30.9% 网络层面持续扩容 来源
ENIGMA2 GWAS —(以人群为主) 30,717 表型驱动 无诊断标签主轴,标签=体积表型 来源

§4.3 关键统计

统计量 数值 出处
皮层下体积显著位点(ENIGMA2) 5 个新 + 3 个强化(合计 8 个量级) 来源
最强单点效应(rs945270→壳核) P=1.08×10⁻³³,解释 0.52% 方差 来源
皮层显著位点(ENIGMA3) discovery 306 个;199 个过多重校正通过 来源
皮层结构遗传度(SNP-based) 表面积 34%(SE 3%);厚度 26%(SE 2%) 来源
MDD 成人皮层厚度效应 Cohen’s d -0.10 至 -0.14 来源
MDD 青少年效应 总表面积降低;区域 d -0.26 至 -0.57 来源

§4.4 数据层级

联盟层(Consortium)
 └── 工作组(WG,50 个:疾病组/方法组)
      └── 研究项目(如 ENIGMA2、ENIGMA3、SCZ 荟萃)
           └── 参与站点(Site,约 200+ 机构)
                └── 来源队列(Cohort,如 UK Biobank、ADNI)
                     └── 受试者(Subject,SubjID 站点内唯一)
                          └── 扫描会话(Session,纵向方向含多次)
                               └── 序列(Series,T1/DWI/fMRI)
                                    └── 派生计量(ROI 体积/厚度 → CSV 行)
                                         └── 汇总统计(GWAS 文件,无个体行)

个体级数据止步于站点层;联盟层流动的是计量行与统计文件 来源

§4.5 缺失值与信息性缺失

情形 表现 处理约定
分割失败/误标 QC 图例对照不合格,进入离群日志 整受试者剔除并记录原因 来源
部分协变量缺采集 站点 CSV 中留空或哨兵值 各项目协议规定模型必选协变量,缺失者剔除出该模型
非欧裔个体(ENIGMA2 discovery) 分析前主动剔除 MDS 对齐 HapMap III 后过滤 来源
纵向随访脱落 会话级缺失 Plasticity 方向按纵向模型处理 来源
协变量采集差异(如吸烟史) 仅部分站点有字段 按可用子集分析(如 37.7%/42.2% 覆盖时的独立分析)来源

信息性缺失在联盟层面是主动设计而非事故:祖源过滤、QC 剔除都是"数据缺席即结论"的组成部分,AI 管线应把剔除日志当作一等公民数据。


§5 数据划分与使用建议

§5.1 官方划分

ENIGMA 不存在官方 train/val/test 划分——它是荟萃分析联盟而非机器学习基准。官方"划分"体现为协议中的分析纪律:每站点独立执行同一关联模型(如 ENIGMA2 的 Method A/B/C 分别对应无关健康样本、病例-对照、家系设计)来源,结果按固定命名回传。复现性的保障单位是"协议版本 + 站点独立性",不是留出集。

把联盟纪律翻译成机器学习语言:

ENIGMA 协议概念 机器学习对应物 说明
站点级独立分析 分布式训练中的本地拟合 个体数据不出站点 来源
汇总统计上传 联邦学习中的梯度/统计聚合 聚合对象是统计量而非样本
Method A/B/C 设计选择 任务特定的模型族选择 无关健康样本/病例-对照/家系对应不同假设
中心 QC(跨站点分布比对) 聚合前的异常检测 识别"异常站点"再进荟萃 来源
固定效应荟萃 权重聚合(逆方差加权) 效应量层面的集成

这一对照并非修辞:ENIGMA 的工作流就是一套前深度学习时代的联邦统计学习范式,理解它可以直接映射到现代隐私保护机器学习架构的设计。

§5.2 社区惯例与策略建议

在 ENIGMA 资产上做机器学习时,社区惯例是:以队列/站点为划分单位(leave-one-site-out),而非按受试者随机划分;阈值调优在同一站点内部完成,跨站点只做评估。构建 normative 模型时,健康对照按年龄段分层采样以覆盖全生命周期 来源。使用汇总统计做 PRS/MR 时不涉及划分,但需要独立 summary statistics 做发现/目标样本分离。

§5.3 泄漏风险(重点)

  1. 站点-个体双泄漏:同一受试者可能同时出现在多个 WG 的研究(如既是 GWAS 对照又是某疾病队列亲属),按受试者随机划分会跨集泄漏家系结构;家系设计需专门协变量(ENIGMA2 Method C 即为家系而设)来源
  2. 纵向泄漏:同一受试者的多次扫描若分属 train/test,模型会记住个体基线;Plasticity 纵向数据必须按受试者切分 来源
  3. 荟萃结论泄漏:用 ENIGMA 发表效应量(如 MDD 变薄区域谱)做特征选择后,再在同一来源队列上评估诊断模型,会高估性能;应使用与结论队列无重叠的目标样本。
  4. 祖先层泄漏:祖源与诊断/站点相关时,含祖源主成分的模型会把群体结构当作疾病信号;GWAS 侧已用 MDS 协变量处理,ML 侧同样需要在划分前评估祖源分布 来源

§5.4 交叉验证与外部验证建议

推荐嵌套结构:内层按站点分层 K 折调参,外层 leave-one-site-out 估计跨扫描仪泛化;最终以完全独立的公开队列(如 UK Biobank、ABCD、HCP)做外部验证。ENIGMA 自身的历史也示范了这一纪律——各荟萃把发现样本与 CHARGE 等外部联盟复现样本分离(ENIGMA1 即 12,826 发现 + 12,171 复现)来源

划分策略速查表:

策略 适用数据 实现 防御的泄漏
Leave-one-site-out 多站点计量表 按 Site 枚举留出 站点机器效应泄漏
家族原子划分 含亲属/家系样本 以家族为单位切分(对照 ENIGMA2 Method C)来源 同胞跨集
按受试者切分纵向 会话级重复扫描 划分键=SubjID 而非会话 个体基线记忆 来源
发现/目标样本分离 PRS/MR 用独立汇总统计做目标样本 荟萃结论泄漏回发现集
祖源分层评估 跨祖源扩展 PC 分层内评估再汇总 祖源混淆 来源

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

ENIGMA 没有官方云镜像(数据形态决定)。最小可行路径全部本地完成:

  1. 汇总统计申请页 选择研究(如 ENIGMA2)→ 填写短申请表 → 约 5 个工作日内邮件收到下载说明。
  2. 下载协议与 QC 脚本:协议总页 / ENIGMA GitHub / NITRC。
  3. 复用自有 MRI 数据(或公开队列如 ADNI/UK Biobank 单独申请)按协议处理。

第一天工作清单(按小时计):

时段 动作 产出
第 1 小时 浏览官网工作组清单,确定目标 WG 与资产类型 资产需求清单
第 2 小时 提交汇总统计申请表(选 ENIGMA2 与/或 ENIGMA3) 申请确认
第 3 小时 下载并浏览协议总页的三条管线文档 协议摘要笔记
第 4 小时 克隆 ENIGMA GitHub 脚本仓库、注册 NITRC 可执行脚本集
等待期(约 5 个工作日) 用公开协议在自己数据上试跑一次分割 + QC 站点管线 dry-run
获批后 下载汇总统计,运行 §6.1 上手脚本 首个 GWAS 分析

§6.1 快速上手

# -*- coding: utf-8 -*-
# ============================================================
# ENIGMA GWAS 汇总统计最小上手脚本
# ------------------------------------------------------------
# 目录结构预期(data_root 拼接关系):
#   data_root/
#     sumstats/enigma2_subcortical_hibar2015/
#       hippocampus_volume_gwas.txt   # 申请获批后获得的文件
# 最小可用子集:任一汇总统计文件(数十 MB,无需原始影像)
# 依赖:pandas, numpy
# ============================================================
import pandas as pd

DATA_ROOT = "enigma_workspace"   # 见 §4.0 目录树

# 读取一份汇总统计(列名以实际下载文件头为准:
# MarkerName/A1/A2/Freq/Beta/SE/P/N 为典型列)
hippo = pd.read_csv(
    f"{DATA_ROOT}/sumstats/enigma2_subcortical_hibar2015/hippocampus_volume_gwas.txt",
    sep=r"\s+",
)

# 标准 GWAS 显著性阈值与边界检查
significant = hippo[hippo["P"] < 5e-8].sort_values("P")
print(f"全基因组显著位点数:{len(significant)}")
print(significant.head())

# 用 ENIGMA2 已知最强位点做健全性检查:
# 壳核体积 rs945270 应为 P=1.08e-33(0.52% 方差,Hibar 2015)
# 若读取的是壳核文件,此位点应出现在最顶部

要点:你从第一分钟就能做真实的遗传分析,而不需要任何影像设备——这是 ENIGMA 对 AI 研究者最友好的入口。

§6.2 数据获取全流程

步骤 动作 入口 门槛
1 选定汇总统计研究(ENIGMA2/3、CHARGE 系、Plasticity、EEG 等 9 类) 申请页
2 填写在线申请表(用途声明) 同上页面各研究专属表单 约 5 个工作日审核
3 收到邮件下载说明 → 下载 邮件内链接 学术用途
4 需个体级数据/参与荟萃 → 联系对应 WG 官网工作组页,联系 enigma@ini.usc.edu 站点承诺 + 协议遵守
5 复用协议处理自有数据 协议总页(引用要求:ENIGMA1→Stein 2012、ENIGMA2→Hibar 2015、ENIGMA3→Grasby 2020) 免费
6 DTI 工具包 NITRC / ENIGMA GitHub 免费
# 协议获取示例(GitHub/NITRC 托管)
git clone https://github.com/enigma-docs  # ENIGMA 协议文档与脚本入口
# DTI 支持邮件:support.enigmaDTI@ini.usc.edu
# 一般咨询:enigma@ini.usc.edu

§6.3 预处理全流程(站点侧)

以皮层下体积(ENIGMA2 路线)为例,全流程=格式转换→分割→QC→汇总:

# -*- coding: utf-8 -*-
# 站点侧预处理:从 FreeSurfer 输出抽取 ENIGMA 风格计量 CSV
# 前提:已按官方协议完成 FreeSurfer recon-all 与 FIRST 分割 + 目视 QC
# 输入:freesurfer/subjects/*/stats/aseg.stats(FreeSurfer 标准结构)
# 输出:跨站点一致列布局的 subcortical_volumes.csv
import re
from pathlib import Path

def parse_aseg_stats(path: Path) -> dict:
    """从 aseg.stats 抽取结构体积与 ICV(FreeSurfer 标准输出)"""
    measures = {}
    for line in path.read_text().splitlines():
        m = re.match(r"^# measure ([\w-]+),\s*([\d.]+),", line)
        if m:
            measures[m.group(1)] = float(m.group(2))
    for line in path.read_text().splitlines():
        m = re.match(r"^(\d+)\s+([\w-]+)\s+(\d+)\s+([\d.]+)\s", line)
        if m:
            measures[m.group(2)] = float(m.group(4))  # 结构体积 mm^3
    return measures

rows = []
for aseg in sorted(Path("local_site/freesurfer").glob("*/stats/aseg.stats")):
    subject = aseg.parts[-3]
    m = parse_aseg_stats(aseg)
    rows.append({
        "SubjID": subject,
        "Site": "SiteA",                      # 站点代码(协议约定)
        "ICV": m.get("EstimatedTotalIntraCranialVol"),
        "Left-Hippocampus": m.get("Left-Hippocampus"),
        "Right-Putamen": m.get("Right-Putamen"),
        # ...按协议补齐其余结构列
    })

import pandas as pd
pd.DataFrame(rows).to_csv("local_site/measures/subcortical_volumes.csv", index=False)

清洗与标准化的联盟纪律:QC 不过者整行剔除并记录;直方图确认各 ROI 分布正态;版本(FreeSurfer、协议版本)写入溯源日志。DTI 方向的站点侧流程更重:DICOM→NIfTI 转换(dcm2nii)后,需检查 b0 数量与位置、多采集合并以提升信噪比、梯度方向与 FA 图对齐核查(官方 QC 工具 ENIGMA-DTI_QC_FA_V1),再进入 TBSS 与 GWAS 前插补 QC 来源。增强(augmentation)在 GWAS 路线不适用——统计管线中不存在数据增强概念;影像深度学习路线见 §6.6。

DTI 路线的三段式步骤(官方协议口径):

阶段 内容 关键检查
预处理 DICOM→DWI/NIfTI 转换、采集组织核对、去噪去伪影 b0 数量与编码方向、多采集是否同梯度
ENIGMA-DTI 处理 FA 图计算、配准、TBSS 骨架 ENIGMA-DTI_QC_FA_V1 梯度方向核查
GWAS 分析 插补前 QC → 关联 → 汇总上传 PreImputationQC 协议(2024-04 更新版托管于 ENIGMA-Git)来源

协议明确不强制单一软件:站点可用自身最优流程,只要关键步骤齐全——这为深度学习预处理(如自研去噪网络)留出了合规空间,但产出指标仍须过官方 QC 来源

§6.4 PyTorch DataLoader 完整示例

基于 ENIGMA 派生计量(CSV)做 normative 回归/分类任务的完整可运行骨架:

# -*- coding: utf-8 -*-
# ============================================================
# ENIGMA 派生计量表 → PyTorch Dataset/DataLoader
# 目录结构预期:
#   data_root/measures/subcortical_volumes.csv
#     列:SubjID, Site, Diagnosis, Age, Sex, ICV, Left-Hippocampus, ...
#   data_root/qc/pass_list.txt          # 目视 QC 通过的 SubjID 列表
# 最小可用子集:任一计量 CSV(无影像依赖)
# 任务示例:以皮层下体积向量预测 Age(脑龄回归骨架)
# ============================================================
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader

VOLUME_COLS = [
    "Left-Hippocampus", "Right-Hippocampus",
    "Left-Putamen", "Right-Putamen",
    "Left-Caudate", "Right-Caudate",
    "Left-Pallidum", "Right-Pallidum",
    "Left-Amygdala", "Right-Amygdala",
    "Left-Accumbens", "Right-Accumbens", "Thalamus-Proper",
]

class EnigmaMeasuresDataset(Dataset):
    """One record per subject (QC-passed rows only, site-deduplicated)."""

    def __init__(self, data_root: str, volume_cols=VOLUME_COLS):
        df = pd.read_csv(f"{data_root}/measures/subcortical_volumes.csv")
        with open(f"{data_root}/qc/pass_list.txt") as f:
            passed = set(x.strip() for x in f)
        df = df[df["SubjID"].isin(passed)]                     # QC 过滤
        df = df.drop_duplicates(subset="SubjID", keep="first") # 防 ID 复用
        df = df.dropna(subset=volume_cols + ["ICV", "Age"])
        df = df[df["ICV"] > 0]
        # ICV 校正:体积除以 ICV(结构特异性效应,勿用全局效应混杂)
        icv = df["ICV"].values.reshape(-1, 1)
        self.X = torch.tensor(df[volume_cols].values / icv, dtype=torch.float32)
        self.y = torch.tensor(df["Age"].values, dtype=torch.float32).unsqueeze(1)
        self.site = df["Site"].values

    def __len__(self):
        return len(self.y)

    def __getitem__(self, idx):
        return self.X[idx], self.y[idx]

ds = EnigmaMeasuresDataset("data_root")
# 站点分层划分建议:按 Site 做 leave-one-site-out(见 §5),示例从简
loader = DataLoader(ds, batch_size=64, shuffle=True, num_workers=2)
x_batch, y_batch = next(iter(loader))
print(x_batch.shape, y_batch.shape)

§6.5 坑点(8 个真实特有失败模式)

⚠️ 坑点 1:把 ENIGMA 当成"可整体下载数据集"(分类:工程陷阱)

问题:ENIGMA 是分布式联盟——原始 MRI 与基因型永远留在各站点,集中可得的只有协议、脚本与申请制的 GWAS 汇总统计。按常规数据集思路找"全量下载入口"会一无所获。
症状:在官网反复搜索 download/zip 链接无果;以为申请表失败;尝试从第三方"打包"渠道获取(许可风险)。
解决

  1. 简单方法:接受数据形态,先申请汇总统计(短表单,约 5 个工作日审核,邮件发放下载说明)参考
  2. 进阶方法:需要个体级数据时,向对应 WG 提交站点参与承诺(enigma@ini.usc.edu),在协议约束下协作分析 参考
  3. SOTA 方法:混合策略——用汇总统计完成方法学预研,再单独申请 UK Biobank/ADNI 等来源队列的个体级数据本地复现,两头拼接 参考
    参考ENIGMA FAIR 实践论文(Brain Informatics 2021)

⚠️ 坑点 2:忽略站点效应,把机器差异当疾病信号(分类:偏倚陷阱)

问题:各站点扫描仪/序列/人群不同,站点效应与诊断标签相关时(病例多来自某几家医院),未校正的站点效应会直接伪装成疾病效应。
症状:不同站点效应方向相反;加入站点项后疾病效应骤降;荟萃异质性 I² 高企。
解决

  1. 简单方法:回归模型把 site 作为协变量/随机因子,并显式检验 site×diagnosis 交互(物质依赖荟萃即如此执行)参考
  2. 进阶方法:ComBat/谐波化校正影像指标后复跑;用 leave-one-site-out 评估模型稳定性。
  3. SOTA 方法:站点级统计→中心荟萃(ENIGMA 原生路线),天然免疫站点级数据混流;对深度学习结合 site-aware 归一化层 参考
    参考ENIGMA 多站点协议描述

⚠️ 坑点 3:跳过目视 QC,只删数值离群值(分类:预处理陷阱)

问题:ENIGMA QC 的核心是目视核查标准切面图对照好/坏分割图例——数值上"不极端"的分割误标(如海马边界漂移)只有看图才能发现,而这类误差在数万人样本里足以系统性污染 ROI 均值。
症状:某 ROI 直方图出现双峰/长尾;剔除 3σ 离群值后仍有站内不连续;效应量被稀释。
解决

  1. 简单方法:完整执行 ENIGMA QC 协议——Matlab 脚本生成切面图 → 目视 → 剔除并记入离群日志 → 直方图确认正态 参考
  2. 进阶方法:用 QC 模板标准化记录,中心抽检复核(模拟 Vermont 中心二级核查)参考
  3. SOTA 方法:训练 QC 分类器预筛(用 ENIGMA 好坏图例做种子样本),人工只复核边界样本 参考
    参考ENIGMA 皮层 QC 2.0 协议

⚠️ 坑点 4:跨站点混用不同 FreeSurfer 版本(分类:预处理陷阱)

问题:FreeSurfer 大版本间体积/厚度定义有系统性偏移;荟萃中各站点版本不同会引入与站点完全共线的工具效应,与坑点 2 叠加后几乎无法归因。
症状:同站点同批数据升级版本后 ROI 均值整体平移;跨版本合并的 normative 曲线呈阶梯状。
解决

  1. 简单方法:单项目内锁定统一版本(如物质依赖荟萃统一 FreeSurfer 5.3)参考
  2. 进阶方法:跨版本不可避免时,把版本作为协变量并做版本内荟萃后合并。
  3. SOTA 方法:纵向数据用 FreeSurfer longitudinal 流程(ENIGMA-Plasticity 协议)保证时点间一致性 参考
    参考ENIGMA 纵向分割协议

⚠️ 坑点 5:个体重复出现在多个研究/队列中导致划分泄漏(分类:数据泄漏)

问题:受试者可能同时是 GWAS 对照、疾病荟萃队列成员或亲属对;按行随机划分 train/test 时,同一个体(或其同胞)会跨集出现,模型性能被记忆效应虚高。
症状:留出集指标异常好;按站点划分后骤降;亲属识别测试命中。
解决

  1. 简单方法:SubjID 去重 + 站点级划分 参考
  2. 进阶方法:家系样本走专门设计(ENIGMA2 Method C 即为家系模型而设),ML 侧用家族聚类稳健标准误 参考
  3. SOTA 方法:建立跨 WG 的个体/家系映射表,划分以"家族×站点"为原子单位;纵向数据再叠加按受试者切分 参考
    参考ENIGMA2 关联协议 A/B/C

⚠️ 坑点 6:体积不做 ICV 校正或用比率法粗暴相除(分类:标签理解)

问题:皮层下体积与头围强相关;不做 ICV 校正会检出"大脑袋效应"而非目标信号,而简单比率(体积/ICV)又会引入与 ICV 的伪负相关——Hibar 2015 明确指出变异是结构特异性而非全局效应。
症状:几乎所有结构都与"疾病"显著相关且方向一致;控制 ICV 后效应消失或反转。
解决

  1. 简单方法:把 ICV 作为回归协变量(ENIGMA 标准做法)参考
  2. 进阶方法:比率法 vs 协变量法做敏感性分析,报告两种口径。
  3. SOTA 方法:按结构分层建模(残差化 + 结构特异阈值),并用 ENIGMA2 位点(如 rs945270→壳核)做阳性对照验证管线灵敏度 参考
    参考Hibar et al., Nature 2015

⚠️ 坑点 7:祖源混淆——把群体结构当脑结构信号(分类:偏倚陷阱)

问题:ENIGMA2 discovery 样本在分析前主动剔除了非欧裔个体(MDS 对齐 HapMap III),因为祖源同时影响等位频率与影像协变量;直接混合祖源做 GWAS 或 ML 会产生幽灵关联。
症状:曼哈顿图出现染色体大片信号堆积;主成分与诊断/站点强相关;跨祖源验证性能崩塌。
解决

  1. 简单方法:沿用联盟纪律——分析前做祖源推断,单祖源内分析 参考
  2. 进阶方法:祖源分层数据各自 GWAS 后做跨祖源荟萃;ML 侧保留 PC 协变量但在划分前检查 PC-标签相关。
  3. SOTA 方法:采用跨祖源荟萃框架(联盟后续工作向多祖源扩展),并将非欧样本量不足如实写入局限性 参考
    参考Hibar et al., Nature 2015 方法部分

⚠️ 坑点 8:跨年龄/疾病亚组直接比较效应量(分类:评估误用)

问题:ENIGMA-MDD 显示成人表现为皮层变薄(d -0.10~-0.14)而青少年表现为表面积降低(区域 d -0.26~-0.57),且首发/复发亚组模式不同——把不同年龄结构、亚组构成的队列效应量混在一起比较会得出"效应不一致"的错误结论。
症状:复现研究结果"打架";meta 回归异质性无法解释;AI 模型在不同年龄段测试集上表现漂移且被误判为过拟合。
解决

  1. 简单方法:按联盟方式预先分层(成人 vs 青少年、首发 vs 复发),分层内荟萃 参考
  2. 进阶方法:meta 回归显式建模年龄/病程调节变量后再谈合并效应。
  3. SOTA 方法:为不同生命阶段训练独立 normative 模型,评估时按年龄段报告偏差曲线 参考
    参考Schmaal et al., Mol Psychiatry 2016

§6.6 数据增强建议

操作 判定 说明
GWAS 汇总统计复用(PRS/MR/colocalization) ✅ 安全 汇总统计天然可复用,无需个体数据
协议复用到自有影像 ✅ 安全 官方明示欢迎(注明引用)参考
站点内随机翻转/旋转影像 ✅ 安全(ML 路线) 不改变体积/厚度语义
跨站点直方图匹配后混合训练 ⚠️ 谨慎 等效于谐波化,须保留站点标签做消融
用合成交织伪造跨站点个体 ❌ 危险 破坏站点-个体溯源,制造幽灵样本
对 QC 剔除样本"补值"回用 ❌ 危险 违反协议,QC 剔除即终局 参考

§6.7 模型推荐

任务 推荐方法 理由
皮层/皮层下 ROI 表型提取 FreeSurfer + FIRST(ENIGMA 官方管线) 联盟全部荟萃的可比性基石 参考
站点效应校正 回归协变量 + ComBat 与 ENIGMA 模型纪律兼容 参考
脑龄/normative 回归 高斯过程/分位数回归 + 按生命阶段分层 联盟 normative 数据覆盖全生命周期 参考
病例-对照分类 保守报告:以效应量对比为主,分类为辅 疾病效应量小(d≈0.1-0.3),分类指标易夸大 参考
遗传发现 站点级 GWAS + 固定效应逆方差荟萃 ENIGMA 原生范式 参考
白质微结构 FSL TBSS + ENIGMA-DTI 协议 官方三段式流程 参考

§6.8 硬件需求

场景 CPU 内存 存储 说明
汇总统计分析(PRS/MR) 4 核 16 GB 100 GB 纯文本统计,笔记本可跑
单受试者 FreeSurfer recon-all 8 核 32 GB 500 GB/受试者约数 GB 数小时/受试者,批量需集群
数百人站点级队列处理 32 核集群 128 GB 节点 5-10 TB GWAS 需插补基础设施
全流程深度学习(影像路线) +1 GPU(≥16 GB 显存) 64 GB 10 TB+ 影像属站点自持,按自身规模估算

§6.9 评估指标代码

# -*- coding: utf-8 -*-
# ENIGMA 场景常用评估:效应量 + 站点稳健性 + normative 偏差
import numpy as np
import pandas as pd

def cohens_d(case, control):
    """病例-对照效应量(联盟论文报告口径)"""
    n1, n2 = len(case), len(control)
    s = np.sqrt(((n1 - 1) * case.var() + (n2 - 1) * control.var()) / (n1 + n2 - 2))
    return (case.mean() - control.mean()) / s

def site_stratified_d(df, roi="Left-Hippocampus"):
    """逐站点效应量 + 站点间符号一致性( leakage-free 的最低要求)"""
    ds = {s: cohens_d(g[g.Diagnosis == 1][roi], g[g.Diagnosis == 0][roi])
          for s, g in df.groupby("Site") if g.Diagnosis.nunique() == 2}
    signs = np.sign(list(ds.values()))
    return ds, float(signs.mean())   # 一致性比例:1.0/-1.0 = 完全同向

def normative_zscore(value, age_bin_mean, age_bin_sd):
    """相对 ENIGMA 风格 normative 参考的个体偏离(Z 分数)"""
    return (value - age_bin_mean) / age_bin_sd

def site_x_diagnosis_test(df, roi="Left-Hippocampus"):
    """site×diagnosis 交互检查:交互显著时主效应不可外推
    (对应 Mackey 2018 荟萃的做法:交互项不显著才从模型中剔除)"""
    import statsmodels.formula.api as smf
    model = smf.ols(f'{roi} ~ Diagnosis * C(Site) + Age + Sex + ICV', data=df).fit()
    inter_terms = [k for k in model.params.index if 'Diagnosis:C(Site)' in k]
    return {k: float(model.pvalues[k]) for k in inter_terms}

指标选用对照表:

指标 适用场景 ENIGMA 口径注意
Cohen’s d 病例-对照荟萃主指标 联盟论文以逐 ROI d 值报告(如 -0.10~-0.14)来源
P 值/显著位点数 GWAS 区分 discovery(5×10⁻⁸)与复现校正(8.3×10⁻¹⁰)口径 来源
方差解释率 单点/全体遗传度 rs945270 0.52%;SA 34%/厚度 26% 来源
站点符号一致性 自建多中心模型 完全同向(±1.0)是荟萃可合并的底线
AUC/F1 ML 分类辅助参考 非联盟主口径,报告时须附效应量对照

§6.10 MLOps 笔记

  • 版本三元组:任何产出必须绑定(协议版本,FreeSurfer 版本,队列清单版本)——ENIGMA 论文方法学即按此披露(如皮层 QC 2.0 / 2017-04)参考
  • QC 日志入库:离群日志与剔除原因要作为一等公民存储,荟萃回溯时"谁被剔除、为什么"与保留样本同样重要。
  • 结果命名约定:若向 WG 回传统计,严格按项目规定的输出命名(中心脚本按名读取,数百个 meta 由命名驱动)参考
  • 申请时效管理:汇总统计申请约 5 个工作日审核,应列入项目关键路径 参考
  • 引用合规自动化:ENIGMA1/2/3 协议各有指定引用(Stein 2012 / Hibar 2015 / Grasby 2020),在代码仓库 CI 中检查引用完整性 参考

MLOps 检查清单(上线前逐项确认):

检查项 通过标准 失败后果
协议版本记录 产出物含协议版本字符串 结果无法对应任何已发表口径
QC 通过率监控 与联盟文献量级一致(过高/过低都异常) 静默引入坏分割样本
站点覆盖报告 每个 batch 报告站点构成 站点效应混入模型更新
汇总统计哈希 记录下载文件校验和 申请文件更新后结果不可复现
引用清单 CI 校验指定引用存在于文稿 违反协议引用要求

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
祖源偏倚 ENIGMA2 discovery 样本为欧裔(分析前剔除非欧裔)参考 MDS 祖源对齐、跨祖源分层荟萃
站点/设备偏倚 扫描仪与序列跨站点异质 site 协变量/随机因子、QC 抽检、谐波化 参考
诊断标准异质 各站点临床诊断体系与入组标准不一 工作组内统一最低入组定义、敏感性分析
参与偏倚 志愿者/人群队列的健康对照自选择 normative 曲线标注来源人群限制 参考
小效应误读风险 d≈0.1 量级效应在媒体与下游引用中被夸大 用联盟原始效应量口径引用 参考
地域代表性 欧美与大洋洲站点占多数,非洲/拉美代表性有限 新工作组扩张(非洲等地),引用时声明 参考

§7.2 标注质量

影像派生标注(体积/厚度)质量由三层保障:自动分割管线一致性、逐受试者目视 QC(好/坏图例 + 离群日志 + 直方图正态检查)、中心随机抽检 参考。诊断标签质量依赖站点临床标准,联盟未做统一复核——跨站点诊断异质性是公开的方法学议题(各荟萃以敏感性分析处理)。QC 评分者间一致性无联盟级公开统计;ENIGMA 协议产出的脑测量可靠性已获多篇独立验证 参考

§7.3 泛化性评估

场景 失效风险 证据
欧裔发现模型 → 非欧人群 高:等位频率与影像协变量结构均漂移 ENIGMA2 主动剔除非欧裔 参考
科研扫描仪 → 临床扫描序列 高:序列差异直接改变分割输入 站点协议异质为常态 参考
成人 normative → 青少年 高:效应方向都不同(厚度 vs 面积) Schmaal 2016 双分层 参考
单疾病模型 → 跨疾病迁移 中:跨诊断共享调节因子但效应谱不同 联盟支持跨疾病对比的设计初衷 参考
汇总统计 → 个体预测 结构性限制:汇总统计不含个体协变量分布 数据形态决定 参考

§7.4 伦理考量

个体级数据脱敏在各站点完成,联盟层流动的只有汇总统计与计量表——这本身就是隐私设计 参考。精神疾病数据涉及污名化风险,任何二次分析应避免以诊断为目标的无端个体化解读。基因数据不可匿名化复原,汇总统计发布前联盟按惯例做等位频率审计(申请表中亦要求用途声明)。使用 ENIGMA 协议发表时需按官方要求引用对应项目论文 参考

伦理合规自查表:

合规点 责任方 ENIGMA 的实现 复用者义务
个体数据脱敏 各参与站点 站点侧脱敏后才能汇出派生计量 参考 使用自有数据时对等脱敏
伦理批准 各参与站点 数据保留于原始 IRB/伦理同意范围内 汇总统计二次分析按申请表承诺执行
用途声明 申请者 申请表审核(约 5 个工作日)参考 用途变更需重新申报
再识别风险控制 联盟+申请者 只发布聚合统计;基因汇总统计按惯例审计 禁止尝试从汇总统计反推个体
归属引用 复用者 协议指定引用(ENIGMA1/2/3 各自论文)参考 发表时逐项核对

§7.5 公平性

联盟的公平性短板即其历史语境:欧裔主导的 discovery 样本、欧美主导的站点分布,意味着基于 ENIGMA 的 normative 模型在非洲、拉美等人群中系统性地缺少校准锚点。联盟以扩展新工作组回应(如新增方向持续创立),但在引用任何"脑结构 normative"结论时,必须限定人群范围。性别维度上,联盟设有 Sex Differences 方向专门研究正常变异 参考

公平性风险分级:

人群 代表性状况 风险 使用建议
欧洲裔 discovery GWAS 主体 参考 基准性最强 可直接使用但注明范围
北美/大洋洲裔 站点密集 参考 低-中 常规使用
东亚裔 有参与站点 normative 校准需谨慎
非洲/拉美裔 代表性有限 避免直接外推
低资源地区临床人群 几乎缺失 需本地数据重建参考

§7.6 数据漂移

三类漂移需要监控:(1) 工具漂移——FreeSurfer 版本演进改变输出定义(QC 2.0 协议即为此设计向后兼容规则);(2) 队列漂移——新站点/新世代队列加入使 normative 分布移动(汇总统计 2022/2024 年持续扩容)参考;(3) 疾病定义漂移——DSM/ICD 版本更新影响诊断标签语义。长期运行的脑影像 AI 服务应把这三者作为版本化输入而非隐含假设。

漂移监控表:

漂移源 信号 检测方法 缓解动作
工具漂移 同批数据跨版本 ROI 均值平移 版本 A/B 对照子样本 锁版本或版本内分层建模
队列漂移 normative 曲线整体位移 新旧队列分布对比(KS 检验) 重建 normative 参考
疾病定义漂移 同诊断标签的效应量变化 跨年代 meta 回归 诊断标准版本入标签元数据
采集技术迭代 新序列与旧管线不兼容 QC 通过率骤降 管线适配或剔除记录

§7.7 DAIMS 数据质量自检

# 检查项 状态 说明
1 宽格式支持 跨站点计量表为宽格式 CSV(每受试者一行)参考
2 唯一标识 SubjID 站点内唯一;跨站点需 Site+SubjID 复合键
3 特殊字符处理 FreeSurfer 列名含连字符(Left-Hippocampus),解析时注意
4 重复行处理 ⚠️ 联盟不集中去重;复用者需自行处理 ID 复用与家系
5 缺失编码 ⚠️ 哨兵值(如 -9)因项目而异,需按各项目协议确认
6 标签标识 诊断标签口径在各荟萃方法学中明示
7 罕见类分组 ⚠️ 小样本疾病(如 PTSD 荟萃 N=1,868)亚组分析效力有限
8 偏倚评估 站点效应/祖源/诊断异质均有协议级缓解
9 数据字典 协议+QC 脚本公开,列布局跨站点统一 参考
10 信息性缺失解释 祖源过滤/QC 剔除均为显式设计
11 设备记录 ⚠️ 逐站点设备参数在各论文补充表,无集中字典
12 共线性检查 ICV 校正等共线性处理是协议核心步骤
13 编码映射 ⚠️ 诊断编码跨站点异质(DSM/ICD 混用)
14 时间戳处理 ⚠️ 纵向数据由 Plasticity 方向管理,横向项目多未含会话时间戳
15 划分建议 本 Wiki §5 给出站点分层/家族原子划分建议
16 泄漏讨论 §5.3 四类泄漏路径成文
17 标签分布 §4.2 病例占比有据可查
18 测量偏倚 工具版本效应被显式管理(坑点 4)
19 外部验证建议 §7.8 矩阵与 §5.4 建议
20 版本记录 协议版本(ENIGMA1/2/3、QC 2.0)与论文一一对应
21 预处理脚本 QC/分割/关联脚本官方公开(GitHub/NITRC)
22 合规要求 申请表 + 用途声明 + 引用要求成文
23 多模态对齐 ⚠️ sMRI-基因组对齐成熟;EEG/MEG/MRS 方向协议独立演进
24 去标识化 站点侧脱敏 + 联盟层仅汇总统计 参考

DAIMS 评分:17.5 / 24

评分解读:ENIGMA 在"协议与脚本公开、版本记录、合规、去标识化"等治理维度接近满分——这是联盟十年协作方法学的直接产物。失分集中在"集中式数据管理"维度(重复行、缺失编码、设备字典、时间戳等):这些不是疏漏,而是分布式形态的结构性代价——数据从未被聚合到一处,自然也不存在一份统一的集中式数据字典。⚠️ 项提示复用者必须自行补齐跨站点工程 glue。

对你意味着什么:如果你的任务只需要汇总统计(PRS、MR、方法学基准),ENIGMA 的治理质量让你可以放心直接上手,工程成本几乎为零;如果你要做个体级影像建模,请把预算中的一半留给"补齐集中式数据集才有的东西"——ID 映射、哨兵值统一、设备清单重建——并严格按 §6.5 的 8 个坑点自查。评分中每个 ⚠️ 都对应 §6.5 的一个具体坑点。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
CHARGE 联盟 独立心血管队列联盟 ENIGMA1 海马/ICV 位点复现 复现显著性 发现样本 12,826 + 复现 12,171 跨联盟固定效应荟萃成功复现先导位点 参考
ENIGMA3 replication 样本 60 队列内部发现/复现分离 皮层位点复现 241 SA + 14 厚度位点复现显著 discovery 33,992 欧裔 199 位点过多重校正;SA 遗传度 34% 参考
双生子样本 联盟内大型双生子登记 体积遗传度验证 高遗传度(P<1×10⁻⁴) 与既往文献分布一致 保证 GWAS 表型有遗传信号可挖 参考
meta vs mega 对比 联盟内 Radua et al. 2020 荟萃与个体级聚合方法学对比 效应一致性 个体级 FreeSurfer 计量共享场景 两种范式结论兼容,meta 保留隐私优势 参考

§8 基准性能与生态

§8.1 里程碑"排行榜"

ENIGMA 的"榜单"形态是位点发现里程碑而非模型竞赛。以下按时间列出,注意各研究表型/样本不同,数值不可直接横向比较:

排名(时间序) 研究 标志性结果 年份 关键技术 完整引用 代码/数据
1 ENIGMA1 海马/ICV 首批影像 GWAS 位点 2012 FreeSurfer/FIRST + 1000 Genomes 插补 + 站点级 GWAS 荟萃 Stein JL et al., 2012, Nature Genetics. doi:10.1038/ng.2345(协议指定引用 参考 汇总统计申请制
2 ENIGMA2 30,717 人皮层下 GWAS;rs945270(P=1.08×10⁻³³) 2015 统一分割 QC + 逆方差固定效应荟萃 Hibar DP et al., 2015, Nature 520(7546):224-229. doi:10.1038/nature14101 汇总统计申请制
3 SCZ 皮层下/皮层荟萃 病例-对照效应基准(5,000/10,000 人量级) 2016/2018 协议化 FreeSurfer + 站点模型 van Erp TGM et al., 2016/2018(见 FAIR 论文引用 参考 效应量见论文
4 MDD 皮层荟萃 20 队列成人变薄谱(d -0.10~-0.14) 2016 FreeSurfer 统一 + 成人/青少年分层荟萃 Schmaal L et al., 2016, Molecular Psychiatry. doi:10.1038/mp.2016.60 效应量见论文
5 CHARGE 联合 ICV/海马 GWAS ICV(Adams 2016)与海马(Hibar 2017)位点 2016/2017 ENIGMA-CHARGE 联合荟萃 Adams HH et al., 2016, Nat Neurosci;Hibar DP et al., 2017, Nat Commun(汇总统计开放申请 参考 汇总统计申请制
6 ENIGMA3 51,665 人皮层结构 GWAS;199 过校正位点;SA 遗传度 34% 2020 FreeSurfer Desikan 图谱 + 306 位点发现-复现两段式 Grasby KL, Jahanshad N et al., 2020, Science. doi:10.1126/science.aaz7069(协议指定引用 参考 汇总统计申请制
7 纵向 GWAS(Plasticity) 纵向皮层/皮层下变化位点 2022 纵向 FreeSurfer 流程 + 荟萃 Brouwer RM et al., 2022, Nat Neurosci(汇总统计开放申请 参考 汇总统计申请制
8 十年全景 43 国 50 WG 26 疾病体系确立 2020 分布式协议共享范式综述 Thompson PM et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-0705-1 开放获取

为何数值不可直接比较:各行样本量(12,826→51,665)、表型(单结构体积→34 区域双指标→纵向变化)、多重比较口径(5×10⁻⁸ vs 8.3×10⁻¹⁰)与祖源范围均不同;效应位点的"排名"只在同一研究内部有意义。

§8.2 SOTA 总结与选型建议

若你的目标是遗传发现:ENIGMA2+ENIGMA3 汇总统计组合是当前公开可得的最强脑结构 GWAS 资源组合,配合 GWAS Catalog 可直接进入精细定位。若你的目标是疾病脑影像基准:各疾病工作组的荟萃效应量(而非分类准确率)才是该领域的"金标准数字",选型时应复现效应量而非刷 AUC。若你的目标是多中心方法学研究:ENIGMA 协议+QC 脚本是最被验证过的跨站点工作流,直接采用即站在联盟十年工程之上。

按研究目标的选型路径:

你的目标 首选资产 次选/补充 反模式(勿做)
GWAS/精细定位 ENIGMA2 + ENIGMA3 汇总统计 CHARGE 系(ICV/海马)、Plasticity 纵向 来源 试图下载原始影像
PRS/孟德尔随机化 ENIGMA2/3 汇总统计 + 独立疾病 GWAS PGC 疾病汇总统计 用同一样本做暴露与结局
疾病脑影像复现 各 WG 荟萃论文效应量 加入 WG 做站点贡献 只报 AUC 不报效应量
谐波化方法研究 ENIGMA 协议 + 站点 FreeSurfer 输出 公开队列个体级数据 无站点标签直接混合
QC 自动化研究 ENIGMA QC 图例与离群日志格式 自建标注迭代 只按数值阈值过滤(坑点 3)
normative 建模 联盟 normative 数据思路 + 公开队列 分生命阶段建模 来源 全年龄段单模型一刀切

§8.3 评测协议

联盟内评测的固定姿势:站点级分析(协议规定模型与协变量)→ 按约定命名回传 → 中心 QC(跨站点分布比对识别异常站点)→ 固定效应荟萃 → 异质性/敏感性分析(leave-one-site-out、meta 回归)。公开引用任何 ENIGMA 效应量时应给出:队列数、样本构成、协变量集、多重比较口径。

引用 ENIGMA 数字的最低报告清单:

必报项 示例(ENIGMA2) 为什么必须
研究代际 ENIGMA2(Hibar et al., Nature 2015) 三代协议表型不同,不可混称
样本与队列数 30,717 人、50 队列 同名表型样本量差异巨大
祖源范围 discovery 13,171 欧裔 来源 决定结论可外推范围
多重比较口径 全基因组 5×10⁻⁸ 与复现校正口径(8.3×10⁻¹⁰)不同
协变量集 年龄、性别、站点、ICV 等 协变量不同效应不可比
QC 口径 目视 QC 通过样本 QC 松紧直接影响效应量
数据集 关系 说明
UK Biobank 输入队列 + 对照资源 ENIGMA3 纳入 UK Biobank 数据 参考
ADNI 输入队列 神经退行方向重要数据源 参考
CHARGE 平行联盟/复现伙伴 ENIGMA1 复现样本提供方 参考
IMAGEN 输入队列 青少年队列 参考
PGC 互补联盟 纯疾病 GWAS,与影像内表型互补

§8.5 关键论文 Top 10

  1. Thompson PM et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-0705-1 — 联盟十年全景综述,规模数字权威出处。
  2. Grasby KL, Jahanshad N et al., 2020, Science. doi:10.1126/science.aaz7069 — ENIGMA3 皮层结构 GWAS,51,665 人。
  3. Hibar DP et al., 2015, Nature 520(7546):224-229. doi:10.1038/nature14101 — ENIGMA2 皮层下体积 GWAS,30,717 人。
  4. Stein JL et al., 2012, Nature Genetics — ENIGMA1 先导 GWAS(协议指定引用)。
  5. Thompson PM et al., 2014, Brain Imaging and Behavior 8(2):153-182. doi:10.1007/s11682-013-9269-5 — 联盟首篇综述,70 机构 24,997 人。
  6. Schmaal L et al., 2016, Molecular Psychiatry. doi:10.1038/mp.2016.60 — MDD 皮层荟萃,20 队列 8,105 人。
  7. Thompson PM et al., 2015, NeuroImage. doi:10.1016/j.neuroimage.2015.11.057 — 个体化预测与 normative 数据愿景。
  8. Schmaal L et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-0842-6 — ENIGMA-MDD 七年方法论全景,分布式协作机制详解。
  9. (FAIR 实践)ENIGMA 数据治理论文, 2021, Brain Informatics. doi:10.1007/s12021-021-09559-y — 分布式 FAIR 形态第一手描述。
  10. van Erp TGM et al., 2016/2018(SCZ 荟萃系列)— 精神分裂症皮层下/皮层效应基准 参考

§8.6 社区活跃度

维度 状态 证据
工作组 50 个活跃,持续招募新站点与新方向 官网工作组清单 来源(截至 2026-09)
活跃研究 200+ 项进行中 十年综述 来源
协议维护 GitHub + NITRC 双通道,DTI 插补 QC 协议 2024-04 仍在更新 官方协议页 来源
支持体系 总邮箱 enigma@ini.usc.edu;DTI 专线 support.enigmaDTI@ini.usc.edu DTI 协议页 来源
数据扩容 汇总统计 2022(Plasticity)、2024(Garcia-Marin)持续新增 申请页 来源
培训 联盟目标之一即 workshops 与方法培训 官网使命陈述 来源

加入路径:向 enigma@ini.usc.edu 提出加入现有组或组建新组的意向;个体研究者通常经由其所在机构站点加入对应 WG 的具体研究项目 来源

§8.7 生态快照表

资源 类型 链接 Star/状态 截至 2026-09 推荐理由
ENIGMA 官网 门户 enigma.ini.usc.edu 50 WG 活跃 一切入口
协议总页 协议库 imaging-protocols QC 2.0(2017-04 版) 多中心影像工作流金标准
汇总统计申请 数据入口 download-enigma-gwas-results 9 类研究开放申请 AI 研究者最短路径
ENIGMA GitHub 代码 github.com/enigma-docs 官方维护 脚本与协议最新版
NITRC 包 代码 NITRC(DTI) DTI 三段式 弥散方向工具链
十年综述 文献 doi:10.1038/s41398-020-0705-1 开放获取 规模数字与结构权威出处

§9 相关资源与引用

§9.1 官方资源

§9.1b 支持与培训资源

资源 类型 说明
enigma@ini.usc.edu 邮件支持 加入工作组、组建新组、一般咨询 来源
support.enigmaDTI@ini.usc.edu 邮件支持 DTI 处理问题专线,联盟承诺有专家网络答疑 来源
ENIGMA GitHub 代码与协议 协议最新修订的第一发布渠道 来源
NITRC 工具分发 DTI 三段式工具包下载 来源
联盟 workshops 培训 官网使命明确包含关键方法培训与会议 来源
成员名单 PDF 治理 各 WG 参与站点清单(如 MDD 2019-10 名单)来源

新人上手建议路径:先以"协议复用者"身份在自己的数据上跑通一条管线(风险最低),再以"站点贡献者"身份加入对应 WG(获得个体级协作),最后视需求申请汇总统计做遗传分析——三个身份可以叠加。

§9.2 BibTeX 完整引用

@article{Thompson2020ENIGMA,
  author  = {Thompson, Paul M. and Jahanshad, Neda and Ching, Christopher R. K. and Salminen, Lotta E. and Thomopoulos, Sophia I. and Bright, Susan and others},
  title   = {ENIGMA and global neuroscience: a decade of large-scale studies of the brain in health and disease in more than 40 countries},
  journal = {Translational Psychiatry},
  volume  = {10},
  year    = {2020},
  doi     = {10.1038/s41398-020-0705-1}
}

@article{Hibar2015Subcortical,
  author  = {Hibar, Derrek P. and Stein, Jason L. and Renteria, Miguel E. and others},
  title   = {Common genetic variants influence human subcortical brain structures},
  journal = {Nature},
  volume  = {520},
  number  = {7546},
  pages   = {224--229},
  year    = {2015},
  doi     = {10.1038/nature14101}
}

@article{Grasby2020Cortex,
  author  = {Grasby, Katrina L. and Jahanshad, Neda and Painter, Jodie N. and others},
  title   = {The genetic architecture of the human cerebral cortex},
  journal = {Science},
  volume  = {367},
  number  = {6484},
  year    = {2020},
  doi     = {10.1126/science.aaz7069}
}

@article{Thompson2014ENIGMA,
  author  = {Thompson, Paul M. and Stein, Jason L. and Medland, Sarah E. and others},
  title   = {The {ENIGMA} Consortium: large-scale collaborative analyses of neuroimaging and genetic data},
  journal = {Brain Imaging and Behavior},
  volume  = {8},
  number  = {2},
  pages   = {153--182},
  year    = {2014},
  doi     = {10.1007/s11682-013-9269-5}
}

@article{Schmaal2016CorticalMDD,
  author  = {Schmaal, Lianne and Hibar, Derrek P. and S{\"a}mann, Philipp G. and others},
  title   = {Cortical abnormalities in adults and adolescents with major depression based on brain scans from 20 cohorts worldwide in the {ENIGMA} Major Depressive Disorder Working Group},
  journal = {Molecular Psychiatry},
  year    = {2016},
  doi     = {10.1038/mp.2016.60}
}

@article{Schmaal2020MDDSeven,
  author  = {Schmaal, Lianne and Veltman, Dick J. and van Erp, Theo G. M. and others},
  title   = {{ENIGMA} {MDD}: seven years of global neuroimaging studies of major depression through worldwide data sharing},
  journal = {Translational Psychiatry},
  volume  = {10},
  year    = {2020},
  doi     = {10.1038/s41398-020-0842-6}
}

@article{Thompson2015Individual,
  author  = {Thompson, Paul M. and Andreassen, Ole A. and Arias-Vasquez, Alejandro and others},
  title   = {{ENIGMA} and the individual: predicting factors that affect the brain in 35 countries worldwide},
  journal = {NeuroImage},
  volume  = {145},
  pages   = {389--408},
  year    = {2017},
  doi     = {10.1016/j.neuroimage.2015.11.057}
}

@article{ENIGMA2021FAIR,
  author  = {{ENIGMA Consortium}},
  title   = {{ENIGMA}: promoting findability, accessibility, interoperability, and reusability of neuroimaging data},
  journal = {Brain Informatics},
  year    = {2021},
  doi     = {10.1007/s12021-021-09559-y}
}

§9.3 引用指南

按官方协议页要求:复用 ENIGMA1 协议引用 Stein et al. 2012(Nature Genetics);复用 ENIGMA2 引用 Hibar et al. 2015(Nature);复用 ENIGMA3 引用 Grasby et al. 2020(Science);复用 DTI 协议请引用 ENIGMA 主页 参考。引用联盟整体时使用 Thompson et al. 2020 十年综述。所有规模数字建议回溯到对应原始论文而非二级转引。


§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途 版本/说明
大语言模型(CodeBuddy,fast-model) 初稿撰写、结构组织、代码示例生成 2026-09 生成

§10.2 AI 参与范围

AI 参与了本页面的资料汇总、结构编排、DAIMS 评估初稿与代码骨架撰写;所有事实性数字均经检索核实并附来源链接,由人工编辑部复核;医学解读与偏倚结论经编辑部交叉审核。

§10.3 输入来源列表

  1. Thompson PM et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-0705-1 — https://pubmed.ncbi.nlm.nih.gov/32198361
  2. Hibar DP et al., 2015, Nature 520(7546):224-229. doi:10.1038/nature14101 — https://pubmed.ncbi.nlm.nih.gov/25607358
  3. Grasby KL, Jahanshad N et al., 2020, Science. doi:10.1126/science.aaz7069 — https://www.duo.uio.no/handle/10852/83293
  4. Thompson PM et al., 2014, Brain Imaging and Behavior 8(2):153-182. doi:10.1007/s11682-013-9269-5 — https://openaccess.city.ac.uk/id/eprint/15086/
  5. Schmaal L et al., 2016, Molecular Psychiatry. doi:10.1038/mp.2016.60 — https://pubmed.ncbi.nlm.nih.gov/27137745
  6. Schmaal L et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-0842-6 — https://www.nature.com/articles/s41398-020-0842-6
  7. Thompson PM et al., 2017, NeuroImage. doi:10.1016/j.neuroimage.2015.11.057 — https://doi.org/10.1016/j.neuroimage.2015.11.057
  8. ENIGMA 联盟 FAIR 论文, 2021, Brain Informatics. doi:10.1007/s12021-021-09559-y — https://doi.org/10.1007/s12021-021-09559-y
  9. ENIGMA 官网主页(50 个活跃工作组,截至 2026-09 抓取)— http://enigma.ini.usc.edu/
  10. ENIGMA 协议总页(皮层 QC 2.0、ENIGMA1/2/3 指定引用)— https://enigma.ini.usc.edu/protocols/imaging-protocols/
  11. ENIGMA 遗传协议页(插补与关联 Method A/B/C)— https://enigma.ini.usc.edu?p=381/
  12. ENIGMA DTI 协议页(NITRC 工具包、支持邮箱)— https://enigma.ini.usc.edu/?p=2060/
  13. ENIGMA GWAS 汇总统计申请页(9 类研究、5 个工作日审核)— https://enigma.ini.usc.edu/research/download-enigma-gwas-results/
  14. Mackey S et al., 2018, American Journal of Psychiatry 补充材料(多站点协议与 site×diagnosis 检验)doi:10.1176/appi.ajp.2018.17040415 — https://ajp.psychiatryonline.org/doi/suppl/10.1176/appi.ajp.2018.17040415/suppl_file/appi.ajp.2018.17040415.ds001.pdf
  15. Sousa AMM 等演化分析(引用 ENIGMA3 汇总统计的下游使用示例)— https://pmc.ncbi.nlm.nih.gov/articles/PMC7945014/

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与规模数字 千方病案医学编辑部 逐条对照来源链接核数 ✅ 已通过/已验证
§2 医学背景与编码映射 千方病案医学编辑部 ICD-11/SNOMED 码表交叉核对 ✅ 已通过/已验证
§3-§4 数据规格与结构 千方病案医学编辑部 对照官方协议页与 FAIR 论文 ✅ 已通过/已验证
§6 AI 就绪指南与坑点 千方病案医学编辑部 代码可运行性检查 + 坑点溯源 ✅ 已通过/已验证
§7 质量评估与 DAIMS 千方病案医学编辑部 逐项状态复核 ✅ 已通过/已验证
§8-§10 基准、引用与声明卡 千方病案医学编辑部 引用完整性核查 ✅ 已通过/已验证
  • 官网工作组清单核对:正文引用的 WG 名称(MDD/SCZ/BD/PTSD/ADHD/OCD/Epilepsy/Parkinson’s 等)逐一对照官网入口存在且拼写一致(截至 2026-09)参考
  • 引用完整性核查:ENIGMA1/2/3 协议指定引用与正文对应关系逐项核对 参考

§10.5 AI 生成章节标注

以下章节由 AI 辅助生成初稿并经人工复核:§1.0 速览、§1.1 摘要、§6 代码示例、§7.7 DAIMS 表及三段解读。事实性内容(数字、日期、论文出处)均以 §10.3 来源为准;所有来源链接在人工复核中逐一点击验证可达且内容相符。

§10.6 最后人工审核日期

2026-09-05(与 §0.3 审核日期一致)

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集