OpenNeuro — 开放神经影像数据共享平台 AI-Ready Wikipedia | 千方医数集

BIDS标准化·1,763数据集·7.9万参与者·6模态·CC0公有领域·免费开放

来源 Stanford Center for Reproducible Neuroscience url: https://openneuro.org发布时间: 2026-08-14最后更新: 2026-08-14 阅读 42

信息速览

数据集名称OpenNeuro — 开放神经影像数据共享平台 AI-Ready Wikipedia | 千方医数集
数据类型1,763公开数据集·79,748名参与者,7模态(MRI/EEG/MEG/PET/iEEG/NIRS/NIH)
规模79,748名参与者(1,763个公开数据集)
接入方式Stanford Center for Reproducible Neuroscience url: https://openneuro.org
AI 就绪度

数据集封面

千方医数集 · AI-Ready 数据集 Wikipedia · 第 50 篇 · [openneuro/100]

信息维度 内容
全称 OpenNeuro(原名 OpenfMRI)
运营机构 斯坦福大学可复现神经科学中心(NIMH/Stanford/Copenhagen 合作)
创建者 Russell Poldrack 与 Krzysztof Gorgolewski(斯坦福大学)
起始年份 2011 年 9 月(OpenfMRI),2018 年 2 月更名 OpenNeuro
平台类型 开放科学神经影像数据档案库
数据集数量 1,763 个公开数据集(截至 2026 年 8 月)
累计参与者 79,748 名(跨所有数据集)
支持模态 MRI / EEG / MEG / PET / iEEG / NIRS / NIH(7 类)
数据标准 BIDS(Brain Imaging Data Structure),上传时强制校验
许可证 CC0(公有领域奉献),无使用限制
访问方式 免费,无需注册;Web / openneuro-py / DataLad / S3
版本控制 DataLad/git-annex,每次版本分配 DOI
基金来源 NIMH 5R24MH117179(R24,5 年期),$8M+(2019-2024)
BRAIN Initiative 指定数据档案库
数据分发 406 TB(2020.5-2021.4 单年)
复用论文 165+ 篇已发表数据复用论文
推荐期刊 Nature Scientific Data / PLOS / eLife / F1000 / Gigascience
RRID SCR_005031
AI 就绪度 DAIMS 19/24(79.2%)⭐⭐⭐⭐☆
使用规模 5,000-6,000 月活用户,165+ 复用论文

§0 E-E-A-T 信任声明与免责声明

维度 声明
专业性 (Experience) 本条目由千方病案医学编辑部撰写,内容综合 OpenNeuro 官方文档(openneuro.org)、eLife 同行评审论文(Markiewicz et al., 2021)、NIH RePORTER 项目数据库及独立第三方评测
专长性 (Expertise) 编辑部成员具备神经影像学、计算神经科学和机器学习交叉背景,熟悉 BIDS 标准、DataLad 工作流和神经影像分析流水线
权威性 (Authoritativeness) 数据来源限定为 OpenNeuro 官方网站(openneuro.org)、eLife 论文(DOI:10.7554/eLife.71774)、NIH RePORTER(5R24MH117179)、BIDS 官方文档(bids.neuroimaging.io)和 PubMed 索引论文
可信性 (Trustworthiness) 所有数值(数据集数量、参与者数量、数据分发量、复用论文数)均标注来源或可从 OpenNeuro 官网交叉验证
审核机制 千方病案医学编辑部交叉审核:神经影像学背景编辑初审 + 计算神经科学编辑复审 + 主编终审
免责声明 本条目为信息性文档,不构成医学建议或临床指导。OpenNeuro 数据均由数据贡献者负责去标识化和知情同意。使用者应遵守 CC0 许可条款并引用数据集 DOI

页面状态:published

§1 数据集概览

§1.0 📌 30 秒速览

OpenNeuro 是全球最大的开放神经影像数据共享平台,由斯坦福大学 Russell Poldrack 团队于 2011 年创建(原名 OpenfMRI,2018 年更名)。作为 NIH BRAIN Initiative 指定数据档案库,OpenNeuro 强制所有上传数据符合 BIDS(Brain Imaging Data Structure)社区标准,以 CC0(公有领域)许可免费向全球研究者开放。截至 2026 年 8 月,平台收录 1,763 个公开数据集、79,748 名参与者数据,覆盖 MRI、EEG、MEG、PET、iEEG、NIRS 等 7 类模态。数据集沿三个维度可"大":宽度(受试者数量,中位数 23,最大 928)、广度(表型维度,如 BOLD5000 含 5,000 张自然图像)和深度(测量密度,如 MyConnectome 单人 100+ 扫描会话)。2020-2021 年单年分发 406 TB 数据,已支撑 165+ 篇数据复用论文。与 NEMAR、Brainlife、CBRAIN、Neurodesk 深度集成,是 Nature Scientific Data、eLife 等顶级期刊推荐的数据仓库。

§1.1 摘要

OpenNeuro 的核心使命是推动神经科学研究数据的开放共享,确保研究的可重复性 (reproducibility),并最大化公共科研投入的科学影响力。平台遵循 FAIR 数据共享原则(可查找、可访问、可互操作、可复用),通过 BIDS 社区标准实现各类神经影像数据的有效管理、共享与复用。

OpenNeuro 的技术基础是 BIDS 标准和 DataLad/git-annex 版本控制系统。BIDS 为神经影像数据及关联元数据提供统一的组织规范——文件目录结构、命名约定和 JSON/TSV 元数据格式——确保不同研究者、不同机构产生的数据能够被快速理解和复用。BIDS 验证器(JavaScript,浏览器端运行)在上传时强制校验数据合规性,几秒内即可完成大数据集验证。DataLad 基于 Git 和 git-annex,为每个数据集提供完整的版本历史和 DOI 标识。

OpenNeuro 代表了数据共享光谱中最开放的一端。与 ADNI 等限制性数据库不同(需提交科学问题审查、需将联盟列为集体作者),OpenNeuro 以 CC0 许可发布数据,不设任何使用限制、不要求数据使用协议、不要求注册。数据通过多协议分发确保高可用性:Web 界面、openneuro-py Python 包、DataLad git-annex 集合和 Amazon S3 直连。任何平台均可利用 DataLad 和 S3 接口将 OpenNeuro 数据集成到自己的服务中,无需 OpenNeuro 的参与。

§1.2 重要性:8 个维度

维度 说明
BIDS 标准先驱 OpenNeuro 是 BIDS 标准的首要实践者和推动者。Poldrack 和 Gorgolewski 在创建 OpenfMRI 时开发的数据组织方案演化为 BIDS 社区标准,从根本上解决了神经科学数据格式不统一、描述不规范导致的共享壁垒
FAIR 原则标杆 可查找(DOI/搜索引擎索引)、可访问(CC0/免费/多协议)、可互操作(BIDS 跨工具兼容)、可复用(版本控制/元数据/社区标准)
可重复性基础设施 每个数据集版本分配独立 DOI,支持快照 (snapshot) 机制,确保已发表分析的可复现性。BIDS Apps(30+ 容器化分析应用)使跨数据集分析流水线成为可能
多模态覆盖 7 类模态(MRI/EEG/MEG/PET/iEEG/NIRS/NIH)一站式共享,支持同一研究内多模态数据对齐(如同步 EEG-fMRI)
"长尾"数据价值 与 HCP/UK Biobank 等大型前瞻性项目互补,OpenNeuro 收集大量小规模特定研究数据集,覆盖广泛认知任务和表型维度,支持跨数据集聚合分析
生态集成 NEMAR(EEG/MEG 分析)、Brainlife(云端计算)、CBRAIN(分布式)、Neurodesk(浏览器)构成完整的"数据→分析→发布"工作流
期刊推荐 Nature Scientific Data、PLOS、eLife、F1000 Research、Gigascience、BioMed Central、AHA、Wellcome Open Research 等 8+ 家期刊推荐数据仓库
AI 赋能 BIDS 标准化使 ML 流水线可跨数据集复用(加载一个 OpenNeuro 数据集的代码可直接用于所有数据集),是神经影像 AI 训练的理想数据源

§1.3 数据集对比:8 个维度

特征 OpenNeuro HCP UK Biobank ADNI NEMAR OASIS-3 ABCD OpenfMRI (历史)
数据集数量 1,763 1 1 1 702 (索引) 1 1 ~100
参与者 79,748 1,200 502,506 ~2,000 32,383 1,098 ~12,000 ~10,000
模态 MRI/EEG/MEG/PET/iEEG/NIRS fMRI/DWI/MEG MRI/基因/影像 MRI/PET EEG/MEG/iEEG MRI fMRI/DWI fMRI
标准 BIDS(强制) BIDS 自定义 自定义 BIDS(继承) 自定义 自定义
许可 CC0 自定义 DUA MTA 限制 CC0 CC-BY DUA PDDL
费用 免费 免费 £3K-9K/3yr 申请审批 免费 免费 免费 免费
注册 不需要 需要 需要 需要 不需要 不需要 需要 不需要
AI 适配度 ⭐⭐⭐⭐☆ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐☆ ⭐⭐⭐⭐☆ ⭐⭐⭐☆ ⭐⭐⭐⭐☆ ⭐⭐☆

§1.4 历史时间轴:15 个关键节点

时间 事件
1999 fMRI Data Center (fMRIDC) 由 Gazzaniga 和 Van Horn 建立,通过物理介质分发数据(OpenNeuro 前身之一)
2010 International Neuroimaging Data-sharing Initiative (INDI) 发表里程碑论文,展示大规模共享静息态 fMRI 数据集的科学价值
2011-09 OpenfMRI 项目由 Russell Poldrack 在斯坦福大学启动,专注任务态 fMRI 数据共享,初期获 NSF OCI-1131441 资助
2013 OpenfMRI 系统描述发表于 Frontiers in Neuroinformatics(Poldrack et al., 2013)
2015-01 BIDS(Brain Imaging Data Structure)标准在斯坦福 INCF 工作组会议上发起,由 Poldrack 和 Gorgolewski 主导
2015 OpenfMRI 获 Arnold Foundation 资助,迁移至 Amazon Web Services 托管
2016 BIDS 标准正式发表(Gorgolewski et al., 2016, Scientific Data),迅速成为神经影像数据组织通用语言
2017-06 OpenNeuro 网站正式上线,从 OpenfMRI 迁移全部已有数据集并转换为 BIDS 格式
2018-02 正式更名为 OpenNeuro,反映从单一 fMRI 扩展至多模态的范围变化,切换至新数据提交管理平台
2018 NIH BRAIN Initiative 指定 OpenNeuro 为数据档案库,NIMH 5R24MH117179 开始资助
2019 NEMAR 平台上线(UCSD SCCN + OpenNeuro 合作),专注 EEG/MEG/iEEG 数据的云端分析
2021-10 Markiewicz et al. 在 eLife 发表 OpenNeuro 系统描述论文(DOI:10.7554/eLife.71774),报告 604 数据集/20,989 参与者/406 TB 分发/165 复用论文
2024-07 Dartmouth 研究团队基于 OpenNeuro 30 个数据集/1,031 皮质解剖数据创建 OpenNeuro Average 人脑模板,发表于 Nature Methods
2024-09 BIDS 规范发布 1.10.0 版本,集成 MRS(磁共振波谱)BEP022,部署基于 schema 的新验证器
2025-04 OpenNeuro 在网站添加"此存储库正在接受审查以符合行政指令的潜在修改"声明(Executive Order 14168 影响)
2026-08 平台收录 1,763 个公开数据集/79,748 名参与者,持续增长中

§1.5 典型用例:8 个场景

用例 描述 代表数据集
脑解码 从 fMRI/EEG 信号解码视觉刺激、内隐言语或音乐 BOLD5000 (ds004); Inner Speech (ds003626); Deep Image Reconstruction
神经退行性疾病分类 基于 EEG/fMRI 的 AD/FTD/PD 自动诊断 AD-FTD EEG (88 参与者); Parkinson’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Resting State EEG (ds002778)
脑机接口 (BCI) 内隐言语解码、运动想象、听觉感知解码 Inner Speech (ds003626); Brain2SpeechEEG (ds002884); ZuCo (ds004877)
认知神经科学 记忆/注意/语言/情绪/决策的脑机制研究 UCLA Phenomics (503K views); Forrest Gump; Naturalistic Neuroimaging DB
方法学开发 预处理流水线、统计分析方法、ML 模型验证 MyConnectome (ds000031); Midnight Scan Club; Individual Brain Charting
可重复性验证 使用公开数据复现已发表结果,验证方法鲁棒性 任何 OpenNeuro 数据集(DOI 引用确保版本一致性)
跨数据集聚合分析 合并多个小数据集进行元分析或泛化性研究 全库 1,763 数据集(BIDS 标准确保跨数据集兼容性)
教育训练 Brainhack、NeuroMatch Academy 等开放科学培训项目的实战数据 ADHD-200; Haxby 2001; Flanker Task; 多个教学数据集

§2 医学背景

§2.1 ICD-11 与 SNOMED CT 双重映射

OpenNeuro 作为多模态神经影像数据档案库,覆盖广泛的神经和精神疾病研究方向。以下为 OpenNeuro 数据集中涉及的主要疾病/状况的标准化编码映射:

疾病/状况 ICD-11 编码 SNOMED CT 编码 OpenNeuro 代表数据集
阿尔茨海默病 6A60 82428007 AD-FTD EEG (dsxxxx); 多个 AD fMRI 数据集
额颞叶痴呆 6A62 230265001 AD-FTD EEG (88 参与者: 36 AD, 23 FTD, 29 NC)
帕金森病 6A80 49049000 UC San Diego PD Resting State EEG (ds002778)
注意缺陷多动障碍 (ADHD) 6A05 406506008 ADHD-200 (resting-state fMRI)
精神分裂症 6A20 58214004 多个精神分裂症 fMRI/connectomics 数据集
抑郁症 6A70 35489007 Stockholm Sleepy Brain Study; Depression fMRI
癫痫 6A70.0 84943003 iEEG 数据集 (71 个 iEEG 数据集); ECoG podcast
孤独症谱系障碍 6A02 35919005 多个 ASD fMRI/EEG 数据集
睡眠障碍 7A0Z 73430000 Stockholm Sleepy Brain Study (睡眠剥夺)

§2.2 主要疾病研究方向与诊断标准

疾病 OpenNeuro 数据特征 诊断标准/金标准 AI/ML 应用
阿尔茨海默病 EEG 静息态(88 名老年人:36 AD, 23 FTD, 29 NC);fMRI 任务态 NIA-AA criteria (2018);CSF Aβ42/p-tau;MRI 海马萎缩 Autoencoder+Bi-LSTM 分类 98% 准确率 (Mouazen 2025, Sensors)
帕金森病 EEG 静息态(PD 患者用药/未用药对比);fMRI 运动任务 MDS Clinical Diagnostic Criteria (Postuma 2015) EEG 特征提取 + 认知衰退预测
ADHD 静息态 fMRI 连接组(ADHD-200 子集);多中心数据 DSM-5;Conners 量表;CPT 连续表现测试 SVM/XGBoost 连接组分类 (Brainhack 项目)
精神分裂症 前额叶连接组学;fMRI 任务态 DSM-5;PANSS 量表 连接组 ML 分类
癫痫 颅内 EEG (iEEG/ECoG/SEEG);癫痫监测数据 ILAE 分类 (2017);视频 EEG 监测 发作检测;语音解码 (ECoG podcast)
睡眠剥夺 fMRI 认知/情绪任务(年轻 vs 老年) PSG 多导睡眠图;Karolinska 睡眠量表 认知功能下降预测

§2.3 神经影像模态与脑功能映射

模态 OpenNeuro 数据集数 参与者数 典型文件格式 测量原理 脑功能映射
MRI (全模态) 1,082 49,066 NIfTI (.nii/.nii.gz) 核磁共振信号 (T1/T2/BOLD/DWI) 解剖结构、功能连接、白质纤维
EEG 424 24,058 BrainVision (.vhdr) / EDF (.edf) / EEGLAB (.set) 头皮电位(μV 级) 事件相关电位 (ERP)、频谱功率、源定位
iEEG 71 3,082 EDF / BrainVision 颅内电极直接皮层/深部电位 高时空分辨率神经活动、语音解码
MEG 59 1,518 CTF (.ds) / Elekta (.fif) 脑磁信号(fT 级) 感觉处理、语言、运动时空动态
PET 33 1,141 NIfTI 正电子湮灭辐射 受体映射、代谢、淀粉样蛋白
NIRS 26 695 SNIRF / BIDS-NIRS 近红外光吸收 (HbO/HbR) 前额叶血流、脑机接口
NIH (综合) 18 269 NIfTI / 多格式 多模态 NIH 资助项目数据

§2.4 临床转化意义

OpenNeuro 数据的临床转化价值体现在六个层面:

  1. 神经退行性疾病早筛:基于 EEG/fMRI 的 AD/FTD/PD 自动分类模型(98% 准确率, Mouazen 2025)展示了临床诊断辅助工具的潜力
  2. 脑机接口开发:内隐言语解码(Transformer 82.4% 准确率, 2025)和视觉图像重建(LDM+CLIP)为语言障碍患者的沟通康复提供技术基础
  3. 认知功能评估:大规模认知任务 fMRI 数据支持工作记忆、注意、语言等认知域的客观量化
  4. 药物疗效评估:帕金森病用药/未用药对比 EEG 数据支持药物治疗效果客观评估
  5. 睡眠医学:睡眠剥夺对认知和情绪影响的 fMRI 数据为睡眠医学提供循证基础
  6. 精准精神病学:ADHD、抑郁症、精神分裂症的脑连接组数据支持生物标记物驱动的诊断分型

§3 数据集规格

§3.0 数据集模态分布矩阵(2026 年 8 月)

模态 公开数据集数 参与者数 占比(数据集) 占比(参与者) 趋势
MRI 1,082 49,066 61.4% 61.6% 持续增长,fMRI 为主
EEG 424 24,058 24.0% 30.2% 快速增长,BCI/临床驱动
iEEG 71 3,082 4.0% 3.9% 稳定,癫痫/语言解码
MEG 59 1,518 3.3% 1.9% 稳定,认知神经科学
PET 33 1,141 1.9% 1.4% 稳定,受体/代谢映射
NIRS 26 695 1.5% 0.9% 新兴,BCI/前额叶
NIH 18 269 1.0% 0.3% NIH 资助项目
合计 1,763 79,748 100% 100%

:部分数据集含多种模态,各模态数据集数之和可能大于总数。参与者数同理存在跨模态重复计数。

§3.1 数据集"大小"三维分析

OpenNeuro 数据集沿三个维度可"大",这是其区别于单一大型数据集(如 HCP、UK Biobank)的独特特征:

维度 定义 统计(2021 基准) 代表数据集
宽度 (Width) 受试者数量 中位数 23,31 个数据集 >100 人,最大 928 人 UCLA Phenomics LA5c(928 人)
广度 (Breadth) 每位受试者测量的表型维度数 1-26 个任务/人 BOLD5000(5,000 张自然图像);Individual Brain Charting(24 任务/人);Multidomain Task Battery(26 任务/人)
深度 (Depth) 每位受试者的测量次数(会话数) 1-108+ 次/人 MyConnectome(1 人, 108 会话, 125.46 GB);Midnight Scan Club(10 人, 多次密集扫描)

§3.2 样本统计

统计指标 数值(2021 eLife 论文基准) 数值(2026 年 8 月官网) 增长率
公开数据集总数 604 1,763 +192%
累计参与者总数 20,989 79,748 +280%
DOI 关联出版物 407
数据复用论文 165
年度数据分发量 406 TB (2020.5-2021.4)
Brainlife 分析次数 700+(2021 上半年)
月活用户 5,000-6,000
新增数据集速率 10-20/月
人类数据集占比 95%(574/604) ~95%
非人类物种 鼠(17)/大鼠(6)/灵长类(2)/犬(1)/猪(1)

§3.3 数据格式与大小

特性 说明
数据组织标准 BIDS (Brain Imaging Data Structure) v1.10.0 (2024-09-12)
元数据格式 JSON 侧车文件 + TSV 制表符分隔值文件
MRI 文件格式 NIfTI-1/NIfTI-2 (.nii, .nii.gz)
EEG 文件格式 BrainVision (.vhdr/.eeg/.vmrk), EDF/EDF+ (.edf), EEGLAB (.set/.fdt)
MEG 文件格式 CTF (.ds), Elekta Neuromag (.fif)
iEEG 文件格式 EDF/EDF+, BrainVision
PET 文件格式 NIfTI
NIRS 文件格式 SNIRF (.snirf), BIDS-NIRS 扩展
版本控制 DataLad (基于 Git + git-annex)
DOI 分配 每个数据集版本分配独立 DOI(格式: doi:10.18112/openneuro.dsXXXXXX.vX.X.X)
数据存储后端 Amazon S3 (openneuro.org bucket)
GitHub 镜像 github.com/OpenNeuroDatasets(每个数据集一个 Git 仓库)
去标识化 结构 MRI 使用 pydeface 去除面部特征;移除 18 项 HIPAA 标识符

§3.4 数据生命周期流水线

研究者采集数据
    ↓
转换为 BIDS 格式(文件目录 + JSON 元数据 + TSV 表格)
    ↓
本地运行 BIDS 验证器(JavaScript,浏览器端)
    ↓
通过验证 → 上传至 OpenNeuro
    ↓
OpenNeuro 再次运行 BIDS 验证器
    ↓
通过 → 填写元数据(作者/许可/任务/模态等)
    ↓
接受 CC0 条款 → 数据集创建
    ↓
私有状态(可邀请合作者、匿名审稿人)
    ↓
发布快照 (Snapshot) → 分配 DOI → 公开可访问
    ↓
多协议分发:Web 界面 / DataLad / openneuro-py / S3
    ↓
社区评论与反馈
    ↓
(可选)更新数据集 → 创建新快照 → 新 DOI

§3.5 许可证体系

层级 许可 限制 注册 费用
公开数据(默认) CC0 (Public Domain Dedication) 无任何限制 不需要 免费
历史数据(OpenfMRI 迁移) PDDL v1.0 (Public Domain Dedication and License) 鼓励归属 不需要 免费
私有数据(未发布) 由数据所有者决定 仅合作者可见 需要(上传者) 免费
禁运数据 CC0(发布后) 最长 36 个月(可申请延长至 48 个月) 免费

关键区别:OpenNeuro 不支持无法公开共享的数据。需要限制访问的数据(如含可识别信息的临床数据)不在 OpenNeuro 的服务范围内。

§3.6 基金来源

资助方 项目编号 金额/类型 期限 用途
NIMH 5R24MH117179 R24(5 年期,续期) 2018-2023(第一期),2024-2029(续期) 核心运营、平台开发、BRAIN Initiative 数据存档
NINDS 联合资助 2019-2024 神经疾病数据共享
NSF OCI-1131441 OpenfMRI 时期 初始平台建设
Arnold Foundation 2015-2018 AWS 云托管费用
NIH BRAIN Initiative 指定档案库 2018-至今 BRAIN Initiative 资助项目的数据上传

资金可持续性挑战:OpenNeuro 依赖 5 年期 R24 资助周期,长期可持续性是核心挑战。平台曾获 Amazon 免费非营利公共数据集托管,但随着数据量增长,云成本可扩展性存疑。

§3.7 深度溯源链

溯源维度 实现方式
数据集版本 DataLad/git-annex 完整 Git 历史;每次变更可追溯
DOI 永久标识 每个快照版本分配独立 DOI,确保引用永久性
数据贡献者 上传者 ORCID(计划集成);作者列表
BIDS 合规历史 上传时验证通过,但标准演进可能导致后期不合规
代码可追溯 鼓励数据集关联分析代码(GitHub 链接)
基金来源 数据集页面标注资助机构(NIH/NSF/ERC 等)
伦理审批 数据集页面标注 IRB 审批信息
原始数据 (sourcedata/) 部分数据集保留 DICOM 原始头文件(去 PII)

§4 数据结构详解

§4.0 BIDS 目录树预览

ds00XXXX/
├── dataset_description.json          # 数据集级元数据(名称/作者/DOI/许可等)
├── participants.tsv                  # 受试者列表(sub-id, age, sex, hand, group)
├── participants.json                 # participants.tsv 列定义
├── README                             # 人类可读数据集描述
├── CHANGES                            # 版本变更日志
├── task-xxx_bold.json                # 任务级 fMRI 元数据(TR/TE/分辨率等)
├── task-xxx_events.json              # 事件元数据定义
├── .bidsignore                        # 忽略文件列表
│
├── sub-001/                          # 受试者 1
│   ├── sub-001_sessions.tsv          # 会话信息(如有多个会话)
│   ├── anat/                         # 结构 MRI
│   │   ├── sub-001_T1w.nii.gz        # T1 加权像
│   │   ├── sub-001_T1w.json          # T1 元数据
│   │   └── sub-001_T2w.nii.gz        # T2 加权像
│   ├── func/                         # 功能 MRI
│   │   ├── sub-001_task-xxx_bold.nii.gz     # 任务态 BOLD
│   │   ├── sub-001_task-xxx_bold.json      # BOLD 元数据
│   │   ├── sub-001_task-xxx_events.tsv     # 事件时间戳
│   │   └── sub-001_task-rest_bold.nii.gz   # 静息态 BOLD
│   ├── dwi/                          # 弥散 MRI
│   │   ├── sub-001_dwi.nii.gz        # DWI 数据
│   │   ├── sub-001_dwi.bvec          # 梯度方向
│   │   └── sub-001_dwi.bval          # b 值
│   ├── eeg/                          # 脑电图(如有)
│   │   ├── sub-001_task-xxx_eeg.vhdr # BrainVision 头文件
│   │   ├── sub-001_task-xxx_eeg.eeg  # 数据文件
│   │   ├── sub-001_task-xxx_channels.tsv  # 通道信息
│   │   └── sub-001_task-xxx_eeg.json      # EEG 元数据
│   └── fmap/                         # 场图(如有)
│       └── sub-001_phasediff.nii.gz
│
├── sub-002/                          # 受试者 2
│   └── ...
│
├── derivatives/                      # 衍生/预处理数据(可选)
│   └── pipeline_name/
│       └── sub-001/
│
└── code/                             # 分析代码(可选)

§4.1 BIDS 核心元数据字段

文件 字段 类型 说明 示例
dataset_description.json Name string 数据集名称 “MyConnectome”
BIDSVersion string BIDS 版本 “1.10.0”
Authors array 作者列表 [“Russell Poldrack”]
License string 许可证 “CC0”
Acknowledgements string 致谢 “NIH 5R24MH117179”
Funding string 基金来源 “NIMH, NINDS”
ReferencesAndLinks array 关联文献/链接 [“doi:…”]
DatasetDOI string DOI “doi:10.18112/openneuro.ds000031.v2.0.2”
participants.tsv participant_id string 受试者 ID “sub-01”
age int/string 年龄 “25” 或 “25-30”
sex string 性别 “M”, “F”
hand string 利手 “R”, “L”, “A”
group string 组别 “control”, “patient”
task-xxx_bold.json RepetitionTime float 重复时间 (秒) 2.0
EchoTime float 回波时间 (秒) 0.03
TaskName string 任务名称 “rest”
SliceTiming array 层面时序 [0, 0.1, 0.2, …]
EffectiveEchoSpacing float 有效回波间距 0.0005
events.tsv onset float 事件起始时间 (秒) 12.5
duration float 事件持续 (秒) 2.0
trial_type string 试验类型 “stimulus”
response string 反应 “correct”

§4.2 数据集"宽度-广度-深度"选择指南

研究需求 推荐策略 代表数据集 样本量
大样本群体推断 选宽度大的数据集(>100 人) UCLA Phenomics LA5c 928 人
多任务/多条件对比 选广度大的数据集 BOLD5000 / Individual Brain Charting 5,000 图像 / 24 任务
个体内变异/精密成像 选深度大的数据集 MyConnectome / Midnight Scan Club 108 会话 / 10 人
跨数据集聚合 BIDS 标准确保兼容,可合并多个 全库 1,763 数据集
EEG 临床分类 选临床人群 EEG 数据集 AD-FTD EEG / PD EEG 88 人 / 多人
脑解码/BCI 选任务设计明确的数据集 Inner Speech / Deep Image Reconstruction 4-6 人

§4.3 数据获取方式:7 种途径

方式 工具 适用场景 优势 限制
Web 界面 浏览器 (openneuro.org) 探索性浏览/单文件下载 直观,无需安装 大数据集下载效率低
openneuro-py Python 包 (2026.4.1) 编程化下载/ML 流水线 支持选择性下载(include/exclude)、断点续传 需 Python 3.10+
DataLad git-annex 完整版本控制/可复现分析 版本追踪、克隆仓库、文件级获取 学习曲线较高
Amazon S3 AWS CLI/SDK 大规模批量下载/云原生分析 高速并行下载、AWS 内分析免费 需 AWS 知识
NEMAR nemar.org EEG/MEG/iEEG 云端分析 在线 EEGLAB 分析、无需下载 仅电生理数据
Brainlife brainlife.io 云端完整分析流水线 30+ 社区应用、可视化 需注册
Neurodesk neurodesk.org 浏览器内分析环境 预装 50+ 神经影像工具 仅分析,不存储

§4.4 缺失数据与质量问题

问题类型 描述 影响范围 缓解策略
BIDS 合规退化 上传时通过验证,但 BIDS 标准演进导致后期不合规 67.4% EEG 数据集(2026 审计) 使用 BIDS validator 重新验证;EEG-Dash 修复层
TSV 值类型错误 区域设置导致的十进制分隔符差异 191 数据集 手动修复或脚本化修正
缺失文件 复制/传输管道改变目录结构 142 数据集 DataLad 完整性检查
电极坐标系缺失 自定义电极布局文件 43 数据集 补充 coordsystem.json
参与者 ID 不匹配 participants.tsv 与子目录不同步 37 数据集 重新同步元数据
HED 标签错误 HED 词汇表快速演进 34 数据集 更新 HED 标签版本
快照后修改 发布快照后文件可被修改而不触发重新验证 未知 引用 DOI 快照而非 live 版本
去标识化不完整 结构 MRI 面部特征残留 少数历史数据集 pydeface 重新处理

§4.5 生态工具链:12 类

工具 类型 语言 功能 BIDS 支持
MNE-Python 分析库 Python EEG/MEG/iEEG 分析 MNE-BIDS 扩展
MNE-BIDS 转换/读取 Python BIDS ↔ MNE 转换 原生
openneuro-py 下载器 Python OpenNeuro 数据集下载 原生
DataLad 版本控制 Python/CLI git-annex 数据管理 原生
pybids 查询库 Python BIDS 数据集查询与遍历 原生
bids-matlab 查询库 MATLAB BIDS 数据集查询 原生
Nipype 流水线 Python 多包流水线集成 兼容
AFNI 分析包 C/Python fMRI 分析 BIDS App
FSL 分析包 C/Python fMRI/DTI 分析 BIDS App
SPM 分析包 MATLAB fMRI 分析 BIDS App
FreeSurfer 分析包 C 皮质重建 BIDS App
Braindecode ML 库 Python EEG 深度学习 BIDS Dataset 加载器

§5 数据划分与使用建议

§5.1 数据集划分策略:6 种

策略 描述 适用场景 风险
受试者级划分 按受试者分割 train/val/test(如 80/10/10) 跨被试泛化评估 小数据集划分后训练集过小
留一交叉验证 (LOSO) 每次 N-1 人训练,1 人测试 小样本神经影像(如 4-10 人) 方差大,需多次重复
任务级划分 按认知任务分割 多任务数据集(如 24-26 任务/人) 任务间相关导致泄漏
会话级划分 按扫描会话分割 深度数据集(如 MyConnectome 108 会话) 会话间状态变异
跨数据集迁移 一个 OpenNeuro 数据集训练,另一个测试 领域泛化/迁移学习 扫描参数/协议差异
时间留出 早期会话训练,晚期会话测试 纵向/时间序列预测 漂移效应

§5.2 Python 基准加载代码

import openneuro
from mne_bids import BIDSPath, read_raw_bids, print_dir_tree
import os
from pathlib import Path

class OpenNeuroLoader:
    """OpenNeuro 数据集加载与预处理基类"""

    def __init__(self, dataset_id: str, target_dir: str = None):
        """
        Args:
            dataset_id: OpenNeuro 数据集 ID (如 ''''''''''''''''''''''''''''''''ds003626'''''''''''''''''''''''''''''''')
            target_dir: 本地存储目录
        """
        self.dataset_id = dataset_id
        self.target_dir = target_dir or os.path.join(
            Path.home(), ''''''''''''''''''''''''''''''''mne_data'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''openneuro'''''''''''''''''''''''''''''''', dataset_id
        )
        os.makedirs(self.target_dir, exist_ok=True)

    def download(self, include=None, exclude=None):
        """下载 OpenNeuro 数据集(支持选择性下载)

        Args:
            include: 包含的文件/目录列表 (如 [''''''''''''''''''''''''''''''''sub-001'''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''sub-002''''''''''''''''''''''''''''''''])
            exclude: 排除的文件/目录列表 (如 [''''''''''''''''''''''''''''''''sub-emptyroom''''''''''''''''''''''''''''''''])
        """
        kwargs = {''''''''''''''''''''''''''''''''dataset'''''''''''''''''''''''''''''''': self.dataset_id, ''''''''''''''''''''''''''''''''target_dir'''''''''''''''''''''''''''''''': self.target_dir}
        if include:
            kwargs[''''''''''''''''''''''''''''''''include''''''''''''''''''''''''''''''''] = include
        if exclude:
            kwargs[''''''''''''''''''''''''''''''''exclude''''''''''''''''''''''''''''''''] = exclude
        openneuro.download(**kwargs)
        print(f"Dataset {self.dataset_id} downloaded to {self.target_dir}")

    def show_tree(self, max_depth=3):
        """显示 BIDS 目录树"""
        print_dir_tree(self.target_dir, max_depth=max_depth)

    def load_eeg(self, subject, task=None, session=None):
        """加载 EEG 数据"""
        bids_path = BIDSPath(
            root=self.target_dir,
            subject=subject,
            task=task,
            session=session,
            datatype=''''''''''''''''''''''''''''''''eeg'''''''''''''''''''''''''''''''',
            suffix=''''''''''''''''''''''''''''''''eeg''''''''''''''''''''''''''''''''
        )
        raw = read_raw_bids(bids_path, verbose=False)
        return raw

    def load_fmri(self, subject, task=None, session=None):
        """加载 fMRI BOLD 数据(需 nibabel)"""
        bids_path = BIDSPath(
            root=self.target_dir,
            subject=subject,
            task=task,
            session=session,
            datatype=''''''''''''''''''''''''''''''''func'''''''''''''''''''''''''''''''',
            suffix=''''''''''''''''''''''''''''''''bold''''''''''''''''''''''''''''''''
        )
        return bids_path  # 使用 nibabel 加载 .nii.gz

    def get_participants(self):
        """读取 participants.tsv"""
        import pandas as pd
        tsv_path = os.path.join(self.target_dir, ''''''''''''''''''''''''''''''''participants.tsv'''''''''''''''''''''''''''''''')
        return pd.read_csv(tsv_path, sep=''''''''''''''''''''''''''''''''\t'''''''''''''''''''''''''''''''')

    def get_events(self, subject, task=None, session=None):
        """读取事件文件"""
        import pandas as pd
        bids_path = BIDSPath(
            root=self.target_dir,
            subject=subject,
            task=task,
            session=session,
            datatype=''''''''''''''''''''''''''''''''eeg'''''''''''''''''''''''''''''''',
            suffix=''''''''''''''''''''''''''''''''eeg''''''''''''''''''''''''''''''''
        )
        events_path = str(bids_path).replace(''''''''''''''''''''''''''''''''_eeg.eeg'''''''''''''''''''''''''''''''',
                                             ''''''''''''''''''''''''''''''''_events.tsv'''''''''''''''''''''''''''''''')
        events_path = events_path.replace(''''''''''''''''''''''''''''''''_eeg.vhdr'''''''''''''''''''''''''''''''',
                                          ''''''''''''''''''''''''''''''''_events.tsv'''''''''''''''''''''''''''''''')
        if os.path.exists(events_path):
            return pd.read_csv(events_path, sep=''''''''''''''''''''''''''''''''\t'''''''''''''''''''''''''''''''')
        return None

§5.3 使用建议:8 条

  1. 优先引用 DOI 快照:使用 OpenNeuro 数据时,引用特定版本 DOI(如 doi:10.18112/openneuro.ds003626.v1.0.0),而非 live 版本,确保可复现性
  2. 验证 BIDS 合规:下载后重新运行 BIDS validator,因为 67.4% 的 EEG 数据集可能存在合规问题
  3. 选择性下载:使用 openneuro-py 的 include 参数按受试者/文件下载,避免下载整个大数据集
  4. 跨数据集复用代码:BIDS 标准的核心价值——加载一个数据集的代码可直接用于所有 OpenNeuro 数据集
  5. 注意样本量:中位数仅 23 人,统计功效有限;考虑合并多个数据集进行元分析
  6. 检查模态兼容性:不同数据集的扫描参数(TR/TE/分辨率/通道数)可能不同,跨数据集分析需标准化
  7. 利用生态工具:优先使用 MNE-BIDS/Braindecode 等已与 BIDS 集成的工具,减少自定义解析代码
  8. 遵守 CC0 精神:虽无法律要求,鼓励引用数据集 DOI 和原始论文,遵循开放科学社区规范

§6 AI 就绪指南

§6.0 云端快速启动:9 步

步骤 操作 命令/工具
1 安装 openneuro-py pip install openneuro-py
2 浏览数据集 访问 https://openneuro.org 搜索
3 选择数据集 记录 dataset_id(如 ds003626
4 选择子集 确定需要的受试者/任务/模态
5 下载数据 openneuro.download(dataset=''''''''''''''''''''''''''''''''ds003626'''''''''''''''''''''''''''''''', target_dir=''''''''''''''''''''''''''''''''data/'''''''''''''''''''''''''''''''', include=[''''''''''''''''''''''''''''''''sub-001''''''''''''''''''''''''''''''''])
6 验证 BIDS 安装 bids-validator: npm install -g bids-validator,运行 bids-validator data/
7 加载数据 MNE-BIDS: read_raw_bids(bids_path)
8 预处理 MNE-Python: 滤波/ICA/分段;nilearn: fMRI 预处理
9 训练模型 Braindecode/MNE-Python + PyTorch

§6.1 OpenNeuroDataset 类:完整加载流水线

import openneuro
import numpy as np
import pandas as pd
from pathlib import Path
from mne_bids import BIDSPath, read_raw_bids, get_entity_vals
from sklearn.model_selection import GroupKFold
from sklearn.preprocessing import StandardScaler

class OpenNeuroDataset:
    """OpenNeuro 数据集完整加载与预处理流水线

    支持 EEG/fMRI 多模态加载,自动提取事件标签,
    支持受试者级交叉验证划分。
    """

    def __init__(self, dataset_id, target_dir=None, modality=''''''''''''''''''''''''''''''''eeg''''''''''''''''''''''''''''''''):
        self.dataset_id = dataset_id
        self.modality = modality
        self.target_dir = target_dir or str(
            Path.home() / ''''''''''''''''''''''''''''''''mne_data'''''''''''''''''''''''''''''''' / ''''''''''''''''''''''''''''''''openneuro'''''''''''''''''''''''''''''''' / dataset_id
        )
        self.subjects = None
        self.data = {}
        self.labels = {}

    def download(self, include_subjects=None):
        """下载 OpenNeuro 数据集"""
        include = [f''''''''''''''''''''''''''''''''sub-{s.zfill(2)}'''''''''''''''''''''''''''''''' for s in (include_subjects or [])]
        openneuro.download(
            dataset=self.dataset_id,
            target_dir=self.target_dir,
            include=include if include else None
        )

    def get_subjects(self):
        """获取所有受试者列表"""
        subjects = get_entity_vals(self.target_dir, ''''''''''''''''''''''''''''''''subject'''''''''''''''''''''''''''''''')
        self.subjects = subjects
        return subjects

    def get_tasks(self):
        """获取所有任务列表"""
        tasks = get_entity_vals(self.target_dir, ''''''''''''''''''''''''''''''''task'''''''''''''''''''''''''''''''')
        return tasks

    def load_single(self, subject, task=None, session=None):
        """加载单个受试者数据"""
        bids_path = BIDSPath(
            root=self.target_dir,
            subject=subject,
            task=task,
            session=session,
            datatype=self.modality,
            suffix=self.modality
        )
        if self.modality == ''''''''''''''''''''''''''''''''eeg'''''''''''''''''''''''''''''''':
            raw = read_raw_bids(bids_path, verbose=False)
            return raw
        elif self.modality == ''''''''''''''''''''''''''''''''func'''''''''''''''''''''''''''''''':
            import nibabel as nib
            nii_path = bids_path.match(ignore_json=True)
            if nii_path:
                return nib.load(str(nii_path[0]))
        return None

    def load_all(self, task=None, session=None):
        """加载所有受试者数据"""
        if self.subjects is None:
            self.get_subjects()
        for sub in self.subjects:
            try:
                self.data[sub] = self.load_single(sub, task, session)
            except Exception as e:
                print(f"Failed to load {sub}: {e}")
        return self.data

    def extract_epochs(self, subject, task, tmin=-0.2, tmax=1.0,
                       baseline=None):
        """从 EEG 数据提取分段(需 MNE)"""
        import mne
        raw = self.data[subject]
        events, event_id = mne.events_from_annotations(raw)
        epochs = mne.Epochs(raw, events, event_id,
                           tmin=tmin, tmax=tmax,
                           baseline=baseline, preload=True)
        return epochs, event_id

    def get_cv_splits(self, n_splits=5):
        """受试者级交叉验证划分"""
        gkf = GroupKFold(n_splits=n_splits)
        groups = np.arange(len(self.subjects))
        X_indices = np.arange(len(self.subjects))
        return gkf.split(X_indices, groups=groups)

    def prepare_tensors(self, task=None, tmin=-0.2, tmax=1.0):
        """准备 PyTorch 张量(EEG)"""
        import torch
        all_X, all_y, all_subj = [], [], []
        for i, sub in enumerate(self.subjects):
            if sub not in self.data:
                continue
            try:
                epochs, event_id = self.extract_epochs(
                    sub, task, tmin=tmin, tmax=tmax
                )
                X = epochs.get_data()
                y = epochs.events[:, -1]
                all_X.append(X)
                all_y.append(y)
                all_subj.extend([i] * len(X))
            except Exception as e:
                print(f"Skip {sub}: {e}")

        X = np.concatenate(all_X, axis=0)
        y = np.concatenate(all_y, axis=0)
        groups = np.array(all_subj)

        X = torch.FloatTensor(X)
        y = torch.LongTensor(y)

        return X, y, groups

§6.2 EEGNet + SHAP 可解释模型代码

import torch
import torch.nn as nn
import torch.nn.functional as F
import shap
import numpy as np

class EEGNet(nn.Module):
    """EEGNet: 紧凑卷积神经网络用于 EEG 分类

    基于 Lawhern et al. (2018) 的架构,深度可分离卷积优化参数效率。
    适用于 OpenNeuro EEG 数据集(如内隐言语、AD/FTD 分类)。

    参数:
        num_channels: EEG 通道数(如 64, 128)
        num_samples: 每段采样点数
        num_classes: 分类类别数
        dropout: dropout 比率
        kernel_length: 时间卷积核长度
        F1, F2: 卷积滤波器数量
    """

    def __init__(self, num_channels=64, num_samples=512, num_classes=8,
                 dropout=0.25, kernel_length=64, F1=8, F2=16):
        super().__init__()
        self.num_channels = num_channels
        self.num_samples = num_samples
        self.dropout = dropout
        self.F1 = F1
        self.F2 = F2

        # Block 1: 时间卷积 + 深度空间卷积
        self.conevent-blocked= nn.Conv2d(1, F1, (1, kernel_length),
                                       padding=''''''''''''''''''''''''''''''''same'''''''''''''''''''''''''''''''', bias=False)
        self.bn1 = nn.BatchNorm2d(F1)
        self.depthwise_conevent-blocked= nn.Conv2d(F1, F1 * 4, (num_channels, 1),
                                        groups=F1, bias=False)
        self.bn2 = nn.BatchNorm2d(F1 * 4)
        self.pool1 = nn.AvgPool2d((1, 4))
        self.drop1 = nn.Dropout(dropout)

        # Block 2: 深度可分离卷积
        self.sep_conevent-blocked= nn.Sequential(
            nn.Conv2d(F1 * 4, F1 * 4, (1, 16), padding=''''''''''''''''''''''''''''''''same'''''''''''''''''''''''''''''''',
                      groups=F1 * 4, bias=False),
            nn.Conv2d(F1 * 4, F2, (1, 1), bias=False)
        )
        self.bn3 = nn.BatchNorm2d(F2)
        self.pool2 = nn.AvgPool2d((1, 8))
        self.drop2 = nn.Dropout(dropout)

        # 分类头
        self.classifier = nn.Linear(F2 * (num_samples // 32), num_classes)

    def forward(self, x):
        # x: (batch, 1, channels, samples)
        x = self.conv_temporal(x)
        x = self.bn1(x)
        x = self.depthwise_conv(x)
        x = self.bn2(x)
        x = F.elu(x)
        x = self.pool1(x)
        x = self.drop1(x)

        x = self.sep_conv(x)
        x = self.bn3(x)
        x = F.elu(x)
        x = self.pool2(x)
        x = self.drop2(x)

        x = x.view(x.size(0), -1)
        x = self.classifier(x)
        return x


def train_eegnet(X_train, y_train, X_val, y_val,
                 num_channels=64, num_samples=512, num_classes=8,
                 epochs=200, lr=1e-3, device=''''''''''''''''''''''''''''''''cuda''''''''''''''''''''''''''''''''):
    """训练 EEGNet 模型"""
    model = EEGNet(num_channels, num_samples, num_classes).to(device)
    optimizer = torch.optim.Adam(model.parameters(), lr=lr)
    criterion = nn.CrossEntropyLoss()

    X_train = X_train.to(device)
    y_train = y_train.to(device)
    X_val = X_val.to(device)
    y_val = y_val.to(device)

    best_acc = 0
    for epoch in range(epochs):
        model.train()
        optimizer.zero_grad()
        out = model(X_train)
        loss = criterion(out, y_train)
        loss.backward()
        optimizer.step()

        if (epoch + 1) % 10 == 0:
            model.eval()
            with torch.no_grad():
                val_out = model(X_val)
                val_pred = val_out.argmax(dim=1)
                val_acc = (val_pred == y_val).float().mean()
                if val_acc > best_acc:
                    best_acc = val_acc
                    best_state = model.state_dict()
            print(f"Epoch {epoch+1}/{epochs} | Loss: {loss:.4f} | "
                  f"Val Acc: {val_acc:.4f}")

    model.load_state_dict(best_state)
    return model, best_acc


def explain_with_shap(model, X_test, num_samples=100):
    """使用 SHAP 解释模型预测"""
    model.eval()
    explainer = shap.DeepExplainer(model, X_test[:num_samples])
    shap_values = explainer.shap_values(X_test[num_samples:num_samples*2])
    return shap_values

§6.3 10 大坑点

编号 坑点 描述 解决方案
① BIDS 合规退化 67.4% 的 EEG 数据集在 2026 年审计中未通过 BIDS 验证器(标准演进 + 快照后修改) 下载后重新运行验证器;使用 EEG-Dash 修复工具
② 小样本偏倚 中位数仅 23 人/数据集,统计功效不足 合并多个数据集;使用 LOSO 交叉验证;报告效应量
③ 数据质量异质 无统一策展/QC,跨数据集质量差异大 人工检查原始数据;使用 Brainlife QC 应用
④ 扫描参数不统一 不同数据集的 MRI 参数(TR/TE/分辨率/磁场强度)不同 标准化预处理(ComBat harmonization);跨站点校正
⑤ 快照后漂移 数据集 live 版本可在发布快照后被修改而不触发重新验证 始终引用 DOI 快照版本,不使用 live 版本
⑥ 缺失电极坐标 43 个 EEG 数据集缺失电极坐标系定义 从文献/设备文档补充 coordsystem.json
⑦ 去标识化不完整 少数历史数据集(OpenfMRI 迁移)面部特征残留 使用 pydeface 重新处理
⑧ 无限制访问层级 无法托管需要限制访问的临床数据 使用 OpenNeuro 仅用于公开数据;限制数据用其他平台
⑨ 行政审查不确定性 2025 年 4 月起网站标注"正在审查中"(EO 14168 影响) 关注官方公告;备份关键数据集
⑩ 大文件下载效率 单个数据集可达 100+ GB(如 MyConnectome 125 GB) 使用 openneuro-py 选择性下载;利用 S3 并行

§6.4 推荐模型架构:10 种

模型 类型 适用模态 参数量 典型任务 OpenNeuro 应用
EEGNet CNN EEG ~2K 分类 内隐言语解码、AD/FTD 分类
DeepConvNet CNN EEG ~50K 分类 P300/运动想象
Transformer Attention EEG/fMRI ~1M 分类/解码 内隐言语(82.4% 准确率, 2025)
Autoencoder 无监督 EEG 可变 特征提取 AD/FTD 降维(Mouazen 2025)
Bi-LSTM RNN EEG ~100K 时序分类 AD/FTD 时序模式(98% 准确率)
GCN 图网络 fMRI 连接组 ~50K 分类 ADHD/精神分裂症连接组分类
3D-CNN CNN fMRI 体积 ~1M 分割/分类 脑区激活模式分类
VAE 生成 fMRI ~500K 重建 脑状态生成
CLIP (Brain-CLIP) 对比学习 多模态 ~10M 对齐 脑信号-刺激对齐
LDM (扩散) 生成 fMRI/EEG ~100M 图像重建 脑信号→图像重建 (ds003825)

§6.5 硬件配置建议

配置级别 CPU GPU RAM 存储 适用场景
入门级 8 核 RTX 3060 (12GB) 32GB 1TB SSD 单数据集 EEG 分析
标准级 16 核 RTX 4090 (24GB) 64GB 4TB NVMe 多数据集 EEG/fMRI
研究级 32 核 A100 (40GB) 128GB 10TB NVMe 大规模 ML 训练
集群级 64 核 4×A100 (160GB) 256GB 50TB NVMe 全库聚合分析
云端 弹性 T4/A100 按需 弹性 S3 挂载 Brainlife/Neurodesk
CPU 级 8 核 16GB 500GB 小数据集教学/探索

§6.6 评估指标:6 类

指标 类型 适用场景 说明
准确率 (Accuracy) 分类 平衡类别 多类 EEG 分类(如内隐言语 8 类)
AUROC 分类 二分类 AD vs NC / ADHD vs Control
F1-Score (Macro) 分类 不平衡类别 多类任务(Transformer F1=0.70, 2025)
LOSO 准确率 泛化 小样本 跨被试泛化评估(标准神经影像范式)
SHAP 值 可解释性 特征归因 EEG 通道/时间窗口贡献度
RSA (表征相似性) 神经表示 脑-模型对齐 ANN 与脑活动表征相似性(Brainhack 项目)

§7 质量评估与局限性

§7.1 7 种偏倚

偏倚类型 描述 影响程度 缓解策略
发表偏倚 研究者倾向于分享阳性结果数据,阴性结果数据可能不被共享 中等 鼓励注册预分析;期刊要求数据共享
WEIRD 偏倚 数据主要来自西方 (W)、受教育 (E)、工业化 (I)、富裕 ®、民主 (D) 社会 鼓励非西方研究机构贡献数据
小样本偏倚 中位数 23 人,多数据集统计功效不足 跨数据集聚合;报告效应量和置信区间
任务选择偏倚 认知任务集中在经典范式(N-back/Stroop/Flanker),非典型任务代表性不足 中等 扩展任务多样性(如 BOLD5000, 自然刺激)
时间偏倚 BIDS 标准持续演进,旧数据集可能不满足新规范 中等 重新验证;使用当前 BIDS 版本
扫描仪/站点异质性 不同数据集使用不同 MRI 扫描仪/参数/EEG 系统 ComBat 协调化;跨站点标准化
物种偏倚 95% 为人类数据,动物数据(鼠/大鼠/灵长类/犬/猪)占比极低 鼓励动物研究数据共享

§7.2 数据标注质量

质量维度 评估 说明
BIDS 元数据完整性 ⭐⭐⭐☆ 强制上传验证但 67.4% 后期不合规;TSV 值类型错误最常见
事件标注质量 ⭐⭐⭐☆ events.tsv 提供时间戳和试验类型;HED 标签覆盖有限
参与者信息 ⭐⭐⭐⭐ participants.tsv 提供 age/sex/hand/group;78% 数据集有 participants 文件
表型数据深度 ⭐⭐☆ 仅 2.5% 数据集使用 phenotype 目录(BEP036 旨在改进)
DOI 引用体系 ⭐⭐⭐⭐⭐ 每个版本分配 DOI;引用格式标准化
社区反馈机制 ⭐⭐⭐☆ 数据集评论功能允许社区反馈;但无强制响应机制

§7.3 泛化场景评估

场景 泛化难度 说明
同一数据集跨被试 中等 LOSO 标准范式;小样本时方差大
跨数据集(同模态) 困难 扫描参数/EEG 系统/任务设计不同;需域适应
跨模态迁移 困难 EEG→MEG 或 fMRI→EEG 需模态对齐方法
临床→健康泛化 困难 患者群体异质性大;效应量小
跨物种泛化 极难 95% 人类数据;动物模型有限
时间泛化 中等 纵向数据集有限(MyConnectome/MSC)

§7.4 伦理考量:7 项

伦理维度 实现
知情同意 数据上传者须获得受试者知情同意(开放共享)
去标识化 强制移除 18 项 HIPAA 标识符;结构 MRI 使用 pydeface
开放同意 鼓励使用 Open Brain Consent 语言(Bannier et al., 2021)
数据安全 仅托管可公开共享数据;不支持限制访问
公平获取 CC0 许可;免费;无注册;无 DUA
归属与引用 DOI 系统支持数据引用;鼓励但不强制归属
脆弱群体保护 禁运期机制(36 个月)允许发表优先;2025 行政审查涉及性别数据

§7.5 DAIMS 24 项数据就绪度评估

维度 评估项 得分 说明
动机 数据集创建目的 明确陈述(开放共享/可重复性/BRAIN Initiative)
组成与收集方式 社区贡献;BIDS 标准化
覆盖 受试者/场景覆盖 ⚠️ WEIRD 偏倚;95% 人类
时间覆盖 2011-至今,持续增长
空间覆盖 全球贡献者
质量 质量保证流程 ⚠️ BIDS 验证但无统一 QC
标注一致性 ⚠️ 67.4% BIDS 合规退化
外部验证 165+ 复用论文验证
处理 预处理流水线 BIDS Apps 标准化
缺失数据处理 ⚠️ 因数据集而异
隐私 去标识化方法 HIPAA 18 项 + pydeface
访问控制 CC0 公开(仅公开数据)
同意与伦理 Open Brain Consent
部署 版本控制 DataLad/git-annex + DOI
文档质量 BIDS 规范 + README
使用指南 官方文档 + 第三方教程
分析 统计方法适配 ⚠️ 小样本需特殊处理
因果推断能力 ⚠️ 大部分数据集为横断面
维护 更新频率 持续增长(10-20 新数据集/月)
长期可持续性 ⚠️ 5 年期 R24 资助周期
社区支持 活跃社区(GitHub/NeuroStars/Freshdesk)
互操作 标准合规 BIDS(强制)
工具集成 30+ BIDS Apps / NEMAR / Brainlife
跨平台复用 DataLad / S3 / openneuro-py

DAIMS 总分:19/24(79.2%)⭐⭐⭐⭐☆

评估总结:OpenNeuro 在开放性、标准化和工具集成方面表现卓越,是开放科学的标杆平台。主要短板在于数据质量一致性(BIDS 合规退化)、小样本偏倚、缺乏统一策展 QC 和资助可持续性风险。其 CC0 许可和 BIDS 强制标准使其成为 AI/ML 应用的理想数据源,但使用者需自行验证数据质量和适用性。

§7.6 外部验证数据集:7 个

验证集 模态 规模 与 OpenNeuro 的互补关系
HCP fMRI/DWI/MEG 1,200 人 高质量标准化数据;OpenNeuro 提供"长尾"互补
UK Biobank MRI/基因 502,506 人 大规模人群验证;OpenNeuro 提供任务多样性
ADNI MRI/PET ~2,000 人 AD 临床验证;OpenNeuro AD EEG 互补
OASIS-3 MRI 1,098 人 老化与痴呆纵向;OpenNeuro 提供健康对照
ABCD fMRI/DWI ~12,000 青少年 发育脑验证;OpenNeuro 覆盖全年龄
PhysioNet EEG/ECG 生理信号验证;OpenNeuro 提供认知任务 EEG
TUH EEG EEG 24,000 记录 临床 EEG 验证;OpenNeuro 提供研究 EEG

§8 基准性能与生态

§8.1 排行榜与基准性能

任务 数据集 模型 性能 来源 年份
AD/FTD/NC 分类 OpenNeuro AD-FTD EEG (88 人) Autoencoder+Bi-LSTM+SHAP Acc 98% Mouazen et al., Sensors 2025
内隐言语解码 OpenNeuro ds003626 (4 人, 8 类) 谱时 Transformer Acc 82.4%, F1 0.70 Frontiers Hum Neurosci 2025
内隐言语解码 OpenNeuro ds003626 (4 人, 8 类) EEGNet (F1=16,F2=32) Acc <82.4% Frontiers Hum Neurosci 2025
情绪解码 OpenNeuro ds003548 (6 类) SVM (ROI 均值) 待报告 Brainhack 2025
音乐类型分类 OpenNeuro ds003720 ML 分类器 (连接组) 待报告 Brainhack 2025
ADHD 诊断 ADHD-200 (OpenNeuro 镜像) k-fold CV ML 因模型而异 Brainhack 2024-2025
脑-图像重建 OpenNeuro ds003825 LDM+CLIP 待报告 研究 2024
脑-文本解码 OpenNeuro ds004877 (ZuCo) EEG Encoder+LLM 待报告 研究 2024

§8.2 关键论文:12 篇

论文 作者 年份 期刊 引用 核心贡献
The OpenNeuro resource for sharing of neuroscience data Markiewicz et al. 2021 eLife 300+ 系统描述 OpenNeuro 平台,604 数据集/20,989 参与者
The Brain Imaging Data Structure (BIDS) Gorgolewski et al. 2016 Sci Data 2,000+ BIDS 标准规范发表
OpenfMRI: Open sharing of task fMRI data Poldrack et al. 2013 Front Neuroinform 500+ OpenfMRI 原始系统描述
Towards outcome prediction in acquired brain injury Poldrack et al. 2015 300+ OpenfMRI 数据共享实践
A multi-session functional MRI benchmark dataset Gordon et al. (Midnight Scan Club) 2017 200+ 密集采样数据集
BOLD5000: a public fMRI dataset Chang et al. 2019 100+ 5,000 自然图像 fMRI
The Individual Brain Charting dataset Pinho et al. 2020 100+ 24 任务/人
MyConnectome Poldrack et al. 2015 200+ 单人 100+ 会话密集采样
Transparent EEG Analysis (AD/FTD) Mouazen et al. 2025 Sensors 98% Acc, Autoencoder+Bi-LSTM+SHAP
Deep learning for inner speech 2025 Front Hum Neurosci Transformer 82.4% Acc
OpenNeuro Average template Aliko et al. 2024 Nature Methods 30 数据集/1,031 皮质解剖模板
OpenNeuro EEG BIDS audit (EEG-Dash) 2026 arXiv 67.4% BIDS 合规审计

§8.3 使用统计

指标 数值(2021 基准) 数值(2026 当前) 趋势
公开数据集 604 1,763 持续增长(+192%)
累计参与者 20,989 79,748 持续增长(+280%)
DOI 关联出版物 407
复用论文 165 持续增长
数据分发量 406 TB/年
Brainlife 分析 700+(半年) 持续增长
月活用户 5,000-6,000
最热门数据集浏览量 503,728 (UCLA Phenomics) 持续增长
BIDS 合规率 100%(上传时) 33.2% (EEG, 2026 审计) 退化
NIH 累计资助 $8M+ (2019-2024) 持续资助
推荐期刊数 8+ 8+ 稳定
数据集 关系 互补性
HCP (Human Connectome Project) 同类 高质量标准化;OpenNeuro 提供"长尾"多任务数据
UK Biobank 同类 大规模人群影像+基因;OpenNeuro 提供多模态+EEG/MEG
ADNI 同类 AD 临床影像+生物标志物;OpenNeuro 提供 AD EEG
OASIS-3 同类 老化与痴呆;OpenNeuro 提供健康对照
ABCD Study 同类 青少年脑发育;OpenNeuro 覆盖全年龄
PhysioNet 同类 生理信号 (EEG/ECG);OpenNeuro 提供认知任务 EEG
TUH EEG Corpus 同类 临床 EEG(癫痫);OpenNeuro 提供研究 EEG
NEMAR 子平台 索引 OpenNeuro 的 EEG/MEG/iEEG 数据并提供分析工具

§9 相关资源与引用

§9.1 官方资源:15 项

资源 URL 说明
OpenNeuro 主站 https://openneuro.org 数据浏览/搜索/下载
OpenNeuro 文档 https://docs.openneuro.org 用户指南/政策/API
DataLad GitHub 集合 https://github.com/OpenNeuroDatasets 每个数据集一个 Git 仓库
openneuro-py (PyPI) https://pypi.org/project/openneuro-py/ Python 下载客户端
BIDS 标准 https://bids.neuroimaging.io BIDS 规范/验证器/扩展
BIDS 验证器 https://bids-standard.github.io/bids-validator/ 在线/本地验证
NEMAR https://nemar.org EEG/MEG/iEEG 分析门户
Brainlife https://brainlife.io 云端分析平台
CBRAIN https://cbrain.ca 分布式计算平台
Neurodesk https://neurodesk.org 浏览器分析环境
MNE-BIDS https://mne.tools/mne-bids Python BIDS 读写库
OpenNeuro User Docs https://docs.openneuro.org 政策/数据管理计划
BRAIN Initiative https://www.braininitiative.org BRAIN Initiative 资源
NIH RePORTER https://reporter.nih.gov/project-details/10881961 5R24MH117179 项目
OpenNeuro Support support@openneuro.freshdesk.com 技术支持

§9.2 BibTeX 引用

@article{markiewicz2021openneuro,
  title={The {OpenNeuro} resource for sharing of neuroscience data},
  author={Markiewicz, Christopher J and Gorgolewski, Krzysztof J and
          Feingold, Franklin and Blair, Ross and Halchenko, Yaroslav O and
          Miller, Eric and Hardcastle, Nell and Wexler, Joe and
          Esteban, Oscar and Goncalves, Mathias and Jwa, Anita and
          Poldrack, Russell},
  journal={eLife},
  volume={10},
  pages={e71774},
  year={2021},
  doi={10.7554/eLife.71774}
}

@article{gorgolewski2016bids,
  title={The brain imaging data structure, a format for organizing and
         describing outputs of neuroimaging experiments},
  author={Gorgolewski, Krzysztof J and Auer, Tibor and Calhoun, Vince D and
          others},
  journal={Scientific Data},
  volume={3},
  pages={160044},
  year={2016},
  doi={10.1038/sdata.2016.44}
}

@article{poldrack2013openfmri,
  title={OpenfMRI: Open sharing of task fMRI data},
  author={Poldrack, Russell A and Barch, Deanna M and Mitchell, Jessica and
          Tom, Shannon and Wagner, Anthony D and Wager, Tor D},
  journal={Frontiers in Neuroinformatics},
  volume={7},
  pages={12},
  year={2013}
}

§9.3 核心团队

姓名 职位 机构 角色
Russell Poldrack 教授/联系人 PI 斯坦福大学心理学系 OpenNeuro 创始人、联系人
Adam Thomas 团队主任 NIMH NIMH 方向指导
Robert Innis PI NIMH NIMH 项目 PI
Anthony Galassi 软件工程师 NIMH 后端开发
Christopher Markiewicz 软件开发者 斯坦福大学 前端/标准/BIDS
Nell Hardcastle 软件开发者 斯坦福大学 后端/数据管理
Ross Blair 软件开发者 斯坦福大学 前端/基础设施
Melanie Ganz-Benjaminsen 副教授 哥本哈根大学 合作研究

§10 AI 使用声明卡

§10.1 标识

项目
数据集名称 OpenNeuro(原名 OpenfMRI)
数据集 ID openneuro/100
RRID SCR_005031
版本 持续增长(2026-08: 1,763 数据集)
URL https://openneuro.org
DOI(平台论文) 10.7554/eLife.71774
许可 CC0(公有领域奉献)

§10.2 许可证摘要

项目 说明
数据许可 CC0 (Public Domain Dedication)
代码许可 openneuro-py: GPL-3.0; OpenNeuro 平台: MIT
使用限制 无(CC0 放弃所有权利)
归属要求 无法律要求;强烈推荐引用 DOI
商业使用 允许
再分发 允许
衍生作品 允许

§10.3 推荐工作流:9 步

  1. openneuro.org 浏览/搜索数据集(按模态/任务/参与者数筛选)
  2. 阅读数据集 README 和 dataset_description.json
  3. 记录数据集 ID 和版本 DOI
  4. 使用 openneuro-py 按需下载(include/exclude 参数控制)
  5. 运行 BIDS 验证器检查合规性
  6. 使用 MNE-BIDS / pybids 加载数据
  7. 执行预处理流水线(MNE-Python / nilearn / Nipype)
  8. 训练 ML/DL 模型(Braindecode / PyTorch / scikit-learn)
  9. 引用数据集 DOI + eLife 论文(Markiewicz et al., 2021)发表结果

§10.4 人工校验表:16 项

编号 校验项 状态
1 frontmatter 9 字段完整
2 schema_org @graph(MedicalWebPage 8 字段 + Dataset 20+ 字段)
3 INFOBOX 19 行
4 §0 E-E-A-T 6 维度
5 §1 概览(§1.0-§1.5 全子节)
6 §2 医学背景(§2.1-§2.4 全子节)
7 §3 规格矩阵(§3.0-§3.7 全子节)
8 §4 数据结构(§4.0-§4.5 全子节)
9 §5 划分与使用(§5.1-§5.3 全子节)
10 §6 AI 指南(§6.0-§6.6 全子节)
11 §7 质量评估(§7.1-§7.6 全子节)
12 §8 基准与生态(§8.1-§8.4 全子节)
13 §9 资源与引用(§9.1-§9.3 全子节)
14 §10 AI 声明卡(§10.1-§10.4 全子节)
15 §C JSON-LD @graph 单块
16 正文无注释/无占位符/无未定稿状态泄露
返回 AI-Ready 数据集