Human Connectome Project (HCP) — 多模态脑连接组学影像数据集 AI-Ready Wikipedia | 千方医数集

1,206名健康青年 · 3T+7T MRI+MEG · CIFTI灰质体 · 91,282灰质体 · ~81TB

来源 WU-Minn-Ox Consortium url: https://www.humanconnectome.org/发布时间: 2026-08-14最后更新: 2026-08-14 阅读 32

信息速览

数据集名称Human Connectome Project (HCP) — 多模态脑连接组学影像数据集 AI-Ready Wikipedia | 千方医数集
数据类型 1,206名健康青年,约 76TB 数据量,91,282 灰质体,3T+7T MRI+MEG
规模1,206名健康青年成人(非患者队列)
接入方式WU-Minn-Ox Consortium url: https://www.humanconnectome.org/
AI 就绪度

数据集封面

INFOBOX

字段
数据集全称 Human Connectome Project Young Adult (HCP-YA)
创建机构 WU-Minn-Ox Consortium(华盛顿大学 · 明尼苏达大学 · 牛津大学等 10 所机构)
核心项目 NIH Blueprint for Neuroscience Research(16 个 NIH 研究院中心资助)
官方网站 humanconnectome.org
数据来源 1,206 名 22-35 岁健康青年双胞胎及非双胞胎兄弟姐妹
影像模态 3T MRI(T1w/T2w/rfMRI/tfMRI/dMRI)+ 7T MRI + MEG
扫描设备 定制 Siemens Skyra Connectom 3T(100 mT/m 梯度)+ 7T Siemens Magnetom
数据格式 NIfTI / CIFTI-2.0 / GIFTI / NIfTI-2
空间标准 91,282 grayordinates(~60k 皮层表面顶点 + ~30k 皮层下体素),2mm 间距
数据大小 ~76 TB(S1200 发布)/ ~81.4 TB(含处理与分析数据)
许可证 WU-Minn HCP Open Access Data Use Terms(自定义,允许再分发)
DUO 标签 Open Access(无疾病限制)+ Restricted Data(家庭结构/精确年龄等需单独申请)
AI 就绪度 ★★★★★(DAIMS 21/24,87.5%)
基准地位 神经影像学领域引用最多的开放数据集;5000+ 篇同行评审论文使用

§0 E-E-A-T 信任声明与免责声明

维度 声明
专业性(Expertise) HCP 由 WU-Minn-Ox Consortium 执行,PI 为 Kamil Ugurbil 博士(明尼苏达大学,CMRR 主任)和 David Van Essen 博士(华盛顿大学,神经科学系主任)。联盟涵盖 10 所机构的 100+ 研究人员和工程师。使用定制化 Siemens 3T Connectom 扫描仪(100 mT/m 梯度场强,远超标准 40 mT/m),开发多波段并行采集、CIFTI 灰质体坐标系统和 MSMAll 多模态配准技术。行为数据采集基于 NIH Toolbox(NIH Blueprint 资助开发的标准评估工具箱)。基因分型由华盛顿大学 GTAC 中心完成,使用定制 Illumina 芯片(2M+ SNP)。
经验性(Experience) Phase I(2010-2012)进行方法优化和协议验证;Phase II(2012-2015)完成 1,206 名受试者数据采集。多次公开发布:Q1(68 名, 2013)、Q3、S500(523 名, 2014)、S900(2015)、S1200(1,206 名, 2017 年 3 月,最终新受试者发布)、S1200 Extensively Processed(2017 年 7 月)、HCP-YA 2025(2025 年 8 月,更新处理)。截至 2021 年,已有 1,500+ 篇论文使用 HCP 数据(Elam et al., 2021),截至 2025 年估计超过 5,000 篇。
权威性(Authoritativeness) HCP 是 NIH Blueprint for Neuroscience Research 旗舰项目(资助号 1U54MH091657),由 16 个 NIH 研究院和中心联合资助,McDonnell Center for Systems Neuroscience 额外支持。Glasser et al. 2016 多模态皮层分区(360 区域)发表于 Nature(引用 5,000+)。Krakencoder(Nature Methods 2025)在 HCP 数据上训练,成为连接组翻译的里程碑。HCP 数据共享模式被 UK Biobank Brain Imaging、ABCD Study 等后续大型项目效仿。
可信性(Trustworthiness) 全部成像参数、预处理流水线和行为评估工具均公开文档化。最小预处理流水线代码开源(GitHub: WashingtonUniversity/Pipelines)。46 名受试者(全部 MZ 双胞胎)完成重测,可评估测试-重测信度。基因验证的家庭结构纠正了 36 对自报为 DZ 的双胞胎为 MZ。QC_Issue 标记系统标识数据质量问题。数据使用条款要求引用特定致谢语句。
透明性(Transparency) 原始论文详细描述了采集流程:受试者招募 → 筛查 → 行为测试 → 3T MRI 扫描(2 天 × 4 模态)→ 7T MRI(子集)→ MEG(子集)→ 基因采样 → 预处理流水线 → 质量控制 → 数据发布。每个受试者的成像数据目录结构完全一致。S1200 Reference Manual(2018 年 4 月更新)提供完整的协议、文件名和目录结构文档。HCP-YA 2025 发布附新附录 3 文档。
审核机制 [千方病案医学编辑部]交叉审核:神经影像数据集内容审核、脑连接组学方法论准确性、AI 基准性能数据一致性

免责声明:HCP 是健康青年成人队列数据集,不包含临床患者数据。fMRI 信号反映 BOLD 血流动力学响应,而非直接神经电活动。扩散 MRI 纤维追踪可能产生假阳性连接或遗漏复杂交叉纤维。数据集中的脑连接组为宏观连接组(macro-connectome),分辨率约 2mm,远高于细胞/突触级别的微观连接组。本页面旨在为 AI/ML 从业者提供数据集使用指南,不构成医学诊断或治疗建议。

§1 数据集概览

§1.0 📌 30 秒速览

维度 要点
是什么 1,206 名 22-35 岁健康青年的多模态脑影像数据集(3T/7T MRI + MEG + 行为 + 基因)
为什么重要 神经影像学领域最大、最高质量、最广泛使用的开放脑连接组学数据集;定义了 CIFTI 灰质体标准、多波段采集和最小预处理流水线
核心技术 定制 Siemens Connectom 3T(100 mT/m 梯度)· 多波段并行采集 · CIFTI-2.0(91,282 grayordinates)· MSMAll 多模态配准 · FIX 去噪
数据规模 ~76 TB(S1200)/ 1,206 受试者 / 5 大影像模态 + 行为 + 基因
关键发布 S1200(2017-03,最终新受试者)· S1200 Extensively Processed(2017-07)· HCP-YA 2025(2025-08,更新处理)
许可证 WU-Minn HCP Open Access Data Use Terms(自定义,允许再分发,需注册同意)
DAIMS 21/24(87.5%)— 数据采集/预处理/文档/维护满分;扣分项:非完全去标识化、基因数据受控访问
AI 就绪 完整预处理流水线 + Python/REST API + AWS S3 云端访问 + Connectome Workbench 可视化工具

§1.1 摘要

Human Connectome Project(HCP)Young Adult 是由美国 NIH Blueprint for Neuroscience Research(16 个 NIH 研究院和中心)和 McDonnell Center for Systems Neuroscience 联合资助的大规模多模态脑连接组学影像数据集。项目由华盛顿大学-明尼苏达大学-牛津大学联盟(WU-Minn-Ox Consortium)执行,PI 为 Kamil Ugurbil(明尼苏达大学)和 David Van Essen(华盛顿大学),涵盖 10 所机构的 100+ 研究人员。

HCP 在 2012-2015 年间采集了 1,206 名 22-35 岁健康青年双胞胎及非双胞胎兄弟姐妹的多模态脑影像数据。3T MRI 在华盛顿大学使用定制化 Siemens Skyra Connectom 扫描仪(100 mT/m 梯度场强,标准扫描仪仅 40 mT/m)完成,涵盖 5 大模态:结构像(T1w/T2w,0.7mm 各向同性)、静息态 fMRI(4 次 run,2mm,TR=720ms)、7 种任务态 fMRI(工作记忆/赌博/运动/语言/社交/关系/情绪)、高角分辨率扩散 MRI(3 壳层 b=1000/2000/3000,每壳层 90 方向,1.25mm)。7T MRI 在明尼苏达大学对 184 名受试者完成,MEG 在圣路易斯大学对 95 名受试者完成。全部受试者还完成了基于 NIH Toolbox 的行为评估和基因分型(2M+ SNP,通过 dbGaP 受控访问)。

HCP 的核心创新包括:(1) 定制化 Connectom 3T 扫描仪(100 mT/m 梯度场强),实现前所未有的空间分辨率和角度采样密度;(2) 多波段/同步多层(SMS)并行采集技术,大幅缩短扫描时间;(3) CIFTI-2.0 文件格式和灰质体(grayordinate)坐标系统(91,282 个 grayordinates = ~60k 皮层表面顶点 + ~30k 皮层下体素),将皮层表面分析和皮层下体积分析统一在同一框架内;(4) MSMAll(Multimodal Surface Matching)跨被试配准,利用皮层结构、功能、髓鞘等多种特征实现精确的个体间对齐;(5) 最小预处理流水线(Glasser et al., 2013),系统化处理空间伪影、畸变校正、皮层表面生成、跨模态配准和标准空间对齐;(6) Glasser et al. 2016 多模态皮层分区(HCP-MMP1.0,360 区域),基于结构、功能、髓鞘、皮层厚度等多模态特征自动分区,发表于 Nature。

S1200 发布(2017 年 3 月)是最终新受试者发布,包含 1,206 名受试者的行为和 3T MR 影像数据,总量约 76 TB。S1200 Extensively Processed 发布(2017 年 7 月)增加了组平均功能连接组、PTN(分区+时间序列+网络矩阵)和 Group ICA 分析数据。HCP-YA 2025 发布(2025 年 8 月)对已有 3T 和 7T 数据进行了更新处理,包括 SE-based 偏置场校正、多 run FIX、时间 ICA 和 Reclean(空间 ICA 改进),处理后的数据可用于 1,071 名受试者。

HCP 数据通过 ConnectomeDB(Aspera 下载)、Amazon S3(AWS Public Data Sets)和 BALSA(共享分析结果)公开访问。截至 2025 年,HCP 数据已被超过 5,000 篇同行评审论文使用,成为神经影像学、计算神经科学和脑网络 AI 研究的事实标准基准数据集。

§1.2 为什么重要

HCP 的重要性体现在以下六个维度:

  1. 数据质量革命:HCP 使用定制化 3T Connectom 扫描仪(100 mT/m 梯度场强),配合多波段并行采集,实现了 0.7mm 各向同性结构像(标准为 1mm)、1.25mm 扩散 MRI(标准为 2-2.5mm)和 2mm 功能 MRI(标准为 3mm),同时扫描时间缩短 3-5 倍。这些参数即使在十年后仍超越大多数临床扫描设置。

  2. CIFTI 灰质体范式:HCP 引入的 CIFTI 格式和 grayordinate 坐标系统将皮层表面分析(适合薄片状皮层灰质)和皮层下体积分析(适合球状核团)统一在同一框架内,91,282 个标准空间灰质体在所有受试者和模态间完全对齐,大幅降低了数据存储和计算需求。

  3. 开放科学标杆:HCP 建立了神经影像学开放数据共享的黄金标准——从数据采集协议、预处理流水线代码(开源)、数据使用条款到可视化工具(Connectome Workbench),全部公开。这一模式被 UK Biobank Brain Imaging、ABCD Study 等后续大型项目效仿。

  4. AI/ML 基准平台:HCP 数据已成为脑网络深度学习的标准评测集。性别分类(准确率 94.4%)、脑年龄预测(MAE 2.44 年)、智力预测(r=0.628)、结构-功能连接组预测(Krakencoder, Nature Methods 2025)等任务均以 HCP 为核心训练和评估数据集。

  5. 遗传-影像桥梁:1,206 名受试者中有 149 对 MZ 双胞胎和 94 对 DZ 双胞胎(基因验证),使脑连接的遗传力分析成为可能。2M+ SNP 基因分型数据通过 dbGaP 提供,支持 GWAS 和影像遗传学研究。

  6. 生态系统辐射:HCP 方法论催生了 Lifespan HCP(4 个年龄段:胎儿/0-5/6-21/36-100+)、HCP-Disease(18 个疾病相关项目)和 HCP-Style 协议,形成覆盖全生命周期和多种脑疾病的连接组学生态系统。

§1.3 数据集对比表

数据集 受试者数 年龄范围 核心模态 空间分辨率 数据量 许可证 特色
HCP-YA 1,206 22-35 3T+7T MRI, MEG 0.7mm(T1w)/1.25mm(dMRI)/2mm(fMRI) ~76 TB HCP Open Access 定制100mT/m扫描仪, CIFTI灰质体, 91,282 grayordinates
UK Biobank ~100,000 40-69 3T MRI 1mm(T1w)/2mm(fMRI/dMRI) ~2 PB CC BY 4.0 超大规模流行病学队列,影像+基因+临床
ABCD Study ~12,000 9-10 3T MRI 1mm(T1w)/1.7mm(dMRI)/2.4mm(fMRI) ~400 TB NDA 青少年发育纵向追踪,10年随访
ADNI ~2,000 55-90 1.5T/3T MRI, PET 1mm(T1w)/2mm(dMRI/fMRI) ~200 TB ADNI DUA 阿尔茨海默病,临床+影像+生物标志物
Cam-CAN ~700 18-88 3T MRI, MEG 1mm(T1w)/2mm(dMRI/fMRI) ~30 TB CC BY-NC-SA 4.0 全生命周期健康老化,MEG+MRI
OpenNeuro 多数据集 多种 多模态 多种 可变 CC0/CC BY 4.0 开放神经影像数据共享平台
AOMIC ~1,000 18-35 3T MRI 1mm(T1w)/2mm(fMRI/dMRI) ~10 TB CC BY 4.0 荷兰健康成人,fMRI+行为
NATTK ~300 18-89 3T MRI, MEG 1mm(T1w)/2mm(dMRI/fMRI) ~5 TB Open 北欧健康老化,MEG+MRI+认知

§1.4 时间轴

时间 事件
2009 NIH Blueprint for Neuroscience Research 发起 HCP 征集
2010 WU-Minn-Ox Consortium 获得 5 年资助(1U54MH091657);Phase I 开始方法优化
2012-08 Phase II 数据采集开始(1,206 名受试者)
2013 Q1 发布(68 名受试者);核心方法论文发表于 Neuroimage 专刊(Glasser et al. 2013; Barch et al. 2013; Sotiropoulos et al. 2013; Ugurbil et al. 2013; Smith et al. 2013)
2014 Q3 发布;500 Subjects 发布(523 名,~17 TB);Amazon S3 上线
2015 S900 发布;数据采集结束(10 月)
2016 7T 初始发布(6 月);Glasser et al. 360 区域多模态皮层分区发表于 Nature(8 月)
2017-03 S1200 发布(最终新受试者,1,206 名,~76 TB)
2017-07 S1200 Extensively Processed rfMRI 数据发布
2018 Connectome in a Box 程序结束(3 月);S1200 Reference Manual 更新(4 月)
2021 1,500+ 篇使用 HCP 的论文发表(Elam et al. 2021)
2025-08 HCP-YA 2025 发布(更新处理:SE-based 偏置场校正、多 run FIX、时间 ICA、Reclean;1,071 名处理 / 1,113 名未处理)

§1.5 典型用例

# 用例 典型方法 数据子集
1 脑连接组构建与分析 结构/功能连接矩阵 + 图论分析 100 名无亲缘关系受试者
2 性别分类 GNN/CNN on FC matrix 1,003 名有完整 rfMRI 的受试者
3 脑年龄预测 3D CNN on T1w/T2w + dMRI 1,064 名受试者
4 结构-功能连接组预测 Encoder-Decoder (Krakencoder) 683 名受试者,15 种连接组"风味"
5 遗传力分析 MZ/DZ 双胞胎设计 149 MZ 对 + 94 DZ 对
6 视觉刺激解码 CNN/LSTM on fMRI 时间序列 tfMRI 数据(工作记忆/语言等任务)

§2 脑连接组学背景

§2.1 脑连接组学核心概念

脑连接组学(Connectomics)旨在系统性地映射和分析大脑内部的结构和功能连接模式。HCP 数据集涵盖两大类连接组:

结构连接组(Structural Connectome, SC)

  • 基于扩散 MRI(dMRI)和白质纤维追踪(tractography)重建大脑白质纤维束的物理连接
  • HCP dMRI 采用 3 壳层设计(b=1000/2000/3000 s/mm²),每壳层 90 方向(共 270 方向),1.25mm 各向同性分辨率
  • 可建模纤维方向分布函数(FODF)、交叉纤维、部分容积效应
  • 常用指标:各向异性分数(FA)、平均扩散率(MD)、轴向扩散率(AD)、径向扩散率(RD)

功能连接组(Functional Connectome, FC)

  • 基于静息态 fMRI(rfMRI)的 BOLD 信号时间相关性,推断脑区间功能协同
  • HCP rfMRI 采集 4 次 run(2 天 × 2 相位编码方向 LR/RL),每次 ~1,200 时间点,TR=720ms
  • 4 次 run 合计 ~4,800 时间点(约 60 分钟),为目前最大的单被试 rfMRI 数据量
  • 常用指标:Pearson 相关、偏相关、互信息

任务态功能连接(Task-based FC)

  • HCP 7 种任务态 fMRI 激活不同脑网络,可比较任务态与静息态功能连接差异
  • 7 任务覆盖:认知(工作记忆/关系推理)、情感(赌博/情绪)、社交(社交认知)、语言、运动

§2.2 ICD-11 / SNOMED CT 映射

HCP 是健康队列数据集,不直接包含疾病诊断。但其脑连接组数据被广泛用于理解以下神经/精神疾病的连接组学病理基础:

ICD-11 编码 疾病/状况 SNOMED CT 概念 ID HCP 中的相关应用
6A20 精神分裂症谱系障碍 58214002 HCP 正常连接组作为对照,比较精神分裂症患者的结构/功能连接异常
6A00 孤独症谱系障碍 35919005 HCP 正常连接组用于理解社交认知网络的典型模式
6A70 重度抑郁障碍 370143000 HCP 行为数据中 SSAGA 评估的亚临床抑郁症状与脑连接关联
6A60 焦虑障碍 48694002 HCP 情绪处理任务 fMRI 激活模式与焦虑评分关联
6A40 双相障碍 254310006 HCP 正常连接组作为双相障碍对照基准
6E11 阿尔茨海默病 26929004 HCP 健康青年连接组用于理解早期脑连接退化
8A04 帕金森病 49049000 HCP 运动任务 fMRI 和黑质-纹状体连接作为帕金森病研究参照
8A01 多发性硬化 24700007 HCP dMRI 白质纤维束作为正常白质参照
6A21 物质使用障碍 57126006 HCP 行为数据中 SSAGA 评估的酒精/物质使用与脑连接关联

§2.3 3T Connectom 扫描仪技术对比

参数 HCP 3T Connectom 标准 3T (如 Siemens Prisma) 优势倍数
最大梯度场强 100 mT/m 40-80 mT/m 1.25-2.5×
有效梯度转换率 91 mT/m/s 150-200 mT/m/s
dMRI 空间分辨率 1.25 mm 各向同性 2-2.5 mm 各向同性 1.6-2×
dMRI 方向数 270(3 壳 × 90) 30-64(单壳层) 4-9×
dMRI 最大 b 值 3,000 s/mm² ≤1,500 s/mm²
T1w 空间分辨率 0.7 mm 各向同性 1.0 mm 各向同性 1.4×
fMRI 空间分辨率 2.0 mm 各向同性 3.0 mm 各向同性 1.5×
fMRI 时间分辨率 TR = 720 ms TR = 1,500-2,500 ms 2-3.5×
头线圈 32 通道 32-64 通道 ~
多波段因子 3-8 通常无或 2

§2.4 临床与转化意义

HCP 虽为健康队列,但对临床神经科学和转化医学具有深远影响:

  1. 正常连接组参照:HCP 提供了 1,206 名健康成人的高质量脑连接组数据,为脑疾病(精神分裂症、自闭症、抑郁症、阿尔茨海默病等)的连接组学病理研究提供了可靠的正常对照基准。

  2. 脑分区标准:Glasser et al. 2016 基于多模态特征(结构、功能、髓鞘、皮层厚度、皮层面积)的 360 区域皮层分区(HCP-MMP1.0)已成为新的脑图谱标准,被纳入 FreeSurfer、FSL 和 AFNI 等主流神经影像软件。

  3. 预处理标准化:HCP 最小预处理流水线已成为脑影像预处理的黄金标准,被全球数千实验室采用。HCP-Style 协议被应用于 HCP-Lifespan、HCP-Disease、ABCD Study 等后续项目。

  4. AI 驱动的生物标志物发现:HCP 数据已用于训练脑年龄预测模型(MAE 2.44 年),可用于评估脑健康状态和神经退行性疾病风险。性别分类(94.4% 准确率)和个体识别功能连接组指纹证明个体化脑连接模式的高度独特性。

  5. 遗传-影像整合:2M+ SNP 基因分型数据与多模态影像数据结合,支持影像遗传学(imaging genetics)研究,揭示遗传变异如何影响脑结构和功能。

§3 数据集规格

§3.0 版本总览

版本 发布日期 受试者 核心内容 数据量 状态
Q1 2013 68 初始发布,最小预处理流水线验证 ~3 TB 已被后续版本取代
Q3 2013 72 增量发布 ~3.5 TB 已被后续版本取代
S500 2014 523 500 Subjects,~17 TB ~17 TB 已被 S1200 取代
S900 2015 ~900 增量发布 ~50 TB 已被 S1200 取代
S1200 2017-03 1,206 最终新受试者发布 ~76 TB 被 HCP-YA 2025 取代
S1200 Extensively Processed 2017-07 1,003/812 组平均功能连接组 + PTN + Group ICA ~35 GB(PTN)/ 33 GB(dense connectome) 仍在使用
HCP-YA 2025 2025-08 1,113 更新处理:SE-based 偏置场校正、多 run FIX、时间 ICA、Reclean ~81 TB 当前推荐版本

版本选择建议:新项目应使用 HCP-YA 2025 发布。HCP-YA 2025 数据不应与 S1200(2017)数据混用,因处理流程已更新。S1200 Extensively Processed 中的组平均数据仍可参考。

§3.1 数据来源与采集

维度 详情
3T MRI 采集 华盛顿大学圣路易斯分校,定制 Siemens Skyra “Connectom” 3T 扫描仪(100 mT/m 梯度,32 通道头线圈),1,113 名受试者完成 3T 结构扫描
7T MRI 采集 明尼苏达大学 CMRR,Siemens Magnetom 7T,184 名受试者(含结构/rfMRI/视网膜映射/电影观看/dMRI)
MEG 采集 圣路易斯大学,95 名受试者(静息态 + 任务态 MEG)
行为测试 华盛顿大学扫描前完成,基于 NIH Toolbox + SSAGA + 人格量表 + 睡眠问卷等
基因采集 全血或唾液样本 → NIMH Repository and Genomics Resource (NRGR) → 华盛顿大学 GTAC 中心 → Illumina 定制芯片 → 2M+ SNP → dbGaP 受控访问
受试者招募 ~300 个双胞胎及非双胞胎兄弟姐妹家庭,圣路易斯地区
家庭结构(基因验证) 149 对 MZ 双胞胎(298 人)/ 94 对 DZ 双胞胎(188 人)/ 156 个非双胞胎家庭 / 88 名无亲缘关系个体 / 共 457 个不同家庭
数据采集时间段 2012 年 8 月 – 2015 年 10 月

§3.2 样本统计

统计维度 数值
总招募受试者 1,206
完成 3T 结构扫描 1,113
四模态全完成(T1w/T2w + rfMRI + tfMRI + dMRI) 889
完成 3T 重测(Retest,全部 MZ 双胞胎) 46(21 对 MZ + 4 名 MZ 个体)
完成 7T MRI 184
完成 MEG 95
有可用基因数据 1,142 / 1,206
年龄范围 22-35 岁
性别 约 54% 女性 / 46% 男性
种族/族裔 多元(详见 Restricted Data)

§3.3 数据格式与大小

模态 格式 每受试者大小(未处理) 每受试者大小(已处理) 备注
T1w 结构像 NIfTI-2 ~35 MB ~0.5 GB 0.7mm 各向同性,3D MPRAGE
T2w 结构像 NIfTI-2 ~35 MB ~0.5 GB 0.7mm 各向同性
结构像合计 71 MB 1.1 GB 含表面重建
rfMRI(4 次 run) CIFTI-2 / NIfTI 4 GB 11.6 GB FIX 去噪后 3.9 GB(compact)/ 7.7 GB(extended)
tfMRI(7 任务) CIFTI-2 / NIfTI 3.4 GB 13.1 GB 分析后 2.8 GB
dMRI NIfTI-2 2.6 GB 1.2 GB 含 BEDPOSTX 1.3 GB
3T 合计 ~11 GB ~40 GB 未处理+已处理 ~51 GB
7T 合计 ~13 GB ~105 GB 未处理+已处理 ~118 GB
MEG ~10 GB ~16 GB 源级 32 GB

总数据量

范围 数据量
3T 未处理(1,113 名受试者) 15.2 TB
3T 已处理(1,113 名受试者) 63.0 TB
3T 合计(含分析数据) 81.4 TB
MEG 未处理(95 名受试者) 799 GB
MEG 已处理(95 名受试者) 1.2 TB
S1200 总量 ~76 TB

§3.4 HCP 预处理流水线

HCP 最小预处理流水线(Glasser et al., 2013, Neuroimage 80:105-124)是 HCP 的核心创新之一,系统化处理多模态 MRI 数据:

原始数据
  ├── 结构 MRI 流水线 (PreFreeSurfer)
  │   ├── 梯度非线性校正 (Gradient Nonlinearity Correction)
  │   ├── 运动校正与平均 (Motion Correction & Averaging)
  │   ├── 偏置场校正 (Bias Field Correction)
  │   ├── T1w/T2w 配准与分割 (T1w/T2w Registration & Segmentation)
  │   ├── FreeSurfer 重建 (Cortical Surface Reconstruction)
  │   └── 表面配准 (Surface Registration: MSMSulc)
  │
  ├── 功能 MRI 流水线 (fMRIVolume)
  │   ├── 磁敏感伪影校正 (Susceptibility Distortion Correction: topup)
  │   ├── 运动校正 (Motion Correction: MCFLIRT)
  │   ├── 配准到结构像 (B0-to-T1w: BBRegister)
  │   ├── 强度归一化 (Intensity Normalization)
  │   └── 配准到标准空间 (MNI Volume Space)
  │
  ├── 功能 MRI 表面化 (fMRISurface)
  │   ├── 体积到表面映射 (Volume-to-Surface Mapping)
  │   ├── 灰质体生成 (CIFTI Grayordinate Creation)
  │   └── 表面平滑 (Surface Smoothing)
  │
  ├── 扩散 MRI 流水线 (DiffusionPreprocessing)
  │   ├── 磁敏感伪影校正 (topup)
  │   ├── 涡流和运动校正 (FSL EDDY)
  │   ├── 梯度非线性校正 (Gradient Nonlinearity Correction)
  │   └── 配准到结构像 (b0-to-T1w: BBRegister)
  │
  └── 后处理
      ├── rfMRI: FIX 去噪 (ICA + 自动分类)
      ├── rfMRI: MSMAll 多模态配准 (结构+功能+髓鞘)
      ├── tfMRI: 任务激活分析 (GLM)
      └── dMRI: BEDPOSTX (纤维方向建模) + 概率追踪

HCP-YA 2025 更新处理

  • SE-based 偏置场校正(Spin-echo based intensity bias field correction)应用于所有 fMRI 数据
  • 消除运动回归因子作为 fMRI 清洗步骤(按 Glasser et al. 2019 NeuroImage 建议)
  • 多 run FIX 用于 3T 任务态 fMRI
  • Reclean(空间 ICA 改进)和时间 ICA 流水线及处理输出
  • 数据重新打包以匹配 HCP Lifespan 项目格式

§3.5 许可证

许可类型 适用范围 核心条款
Open Access Data Use Terms 影像数据 + 大部分行为数据 (1) 不得尝试识别受试者身份;(2) 不得尝试联系受试者;(3) 遵守机构 IRB 规定;(4) 可在相同条款下再分发原始数据和衍生数据;(5) 必须在发表物中致谢特定语句;(6) 违规将终止访问权限
Restricted Data Use Terms 家庭结构、精确年龄、利手、族裔/种族、体重/BMI、SSAGA 精神访谈、药检结果、HbA1c/TSH、内分泌疾病信息、父母精神病史 需单独申请(每位研究者独立申请);不得在发表物中报告个体 HCP Subject ID;家庭结构是唯一可在发表物中报告的个体级受限数据元素;其他受限数据元素的报告需基于 ≥3 名受试者
dbGaP Controlled Access 基因分型数据(2M+ SNP) 通过 NIH dbGaP 申请,需符合 dbGaP 数据访问委员会审批
CC BY-NC-SA 4.0 BALSA 上的部分衍生数据 署名-非商业-相同方式共享
MIT HCP Pipelines 代码 开源,允许修改和再分发

致谢要求:使用 HCP 数据的发表物须包含以下致谢语句:

“Data were provided [in part] by the Human Connectome Project, WU-Minn Consortium (Principal Investigators: David Van Essen and Kamil Ugurbil; 1U54MH091657) funded by the 16 NIH Institutes and Centers that support the NIH Blueprint for Neuroscience Research; and by the McDonnell Center for Systems Neuroscience at Washington University.”

§3.6 基金来源

资助方 说明
NIH Blueprint for Neuroscience Research 16 个 NIH 研究院和中心联合资助(资助号 1U54MH091657)
McDonnell Center for Systems Neuroscience 华盛顿大学 McDonnell 系统神经科学中心
Amazon Web Services AWS Public Data Sets 项目提供 S3 云存储
NIMH Repository and Genomics Resource (NRGR) 生物样本处理、存储和分发

§3.7 深度溯源链

层级 来源
受试者 圣路易斯地区招募,~300 个双胞胎/兄弟姐妹家庭
采集设备 3T: 定制 Siemens Skyra Connectom (WashU) / 7T: Siemens Magnetom (UMinn CMRR) / MEG: (Saint Louis U.)
行为工具 NIH Toolbox (NIH Blueprint 资助开发) + SSAGA + Achenbach ASR + NEO 五因子 + PSQI
基因平台 Illumina MEGA + ImmunoArray + PsychArray + Neuro Consortium chip (华盛顿大学 GTAC)
预处理 HCP Minimal Preprocessing Pipelines (Glasser et al. 2013) + FSL + FreeSurfer + Connectome Workbench
数据平台 ConnectomeDB (Aspera) / Amazon S3 (hcp-openaccess) / BALSA
文档 S1200 Reference Manual (2018 年 4 月更新) / HCP-YA 2025 Appendix 3

§4 数据结构详解

§4.0 目录结构预览

每个 HCP 受试者的数据目录结构如下(以受试者 100206 为例):

100206/
├── T1w/
│   ├── T1w_acpc.nii.gz           # AC-PC 对齐 T1w
│   ├── T1w_divided_by_T2w.nii.gz  # T1w/T2w 比值(髓鞘图)
│   └── T2w_acpc.nii.gz           # AC-PC 对齐 T2w
├── T2w/
│   └── T2w_acpc.nii.gz
├── MNINonLinear/
│   ├── T1w.nii.gz                 # 标准空间 T1w
│   ├── T2w.nii.gz                 # 标准空间 T2w
│   ├── wm.nii.gz                  # 白质掩膜
│   ├── csf.nii.gz                 # 脑脊液掩膜
│   ├── roi/
│   │   ├── atlas_ROI2.nii.gz     # ROI 图谱
│   │   └── ...
│   ├── Results/
│   │   ├── rfMRI_REST1_LR/
│   │   │   ├── rfMRI_REST1_LR.nii.gz        # 体积空间 rfMRI
│   │   │   ├── rfMRI_REST1_LR_Atlas.dtseries.nii  # CIFTI 灰质体时间序列
│   │   │   ├── rfMRI_REST1_LR_hp2000_clean.dtseries.nii  # FIX 去噪后
│   │   │   └── Movement_Regressors.txt     # 运动回归因子
│   │   ├── tfMRI_WM_LR/
│   │   │   ├── tfMRI_WM_LR.nii.gz
│   │   │   ├── tfMRI_WM_LR_Atlas.dtseries.nii
│   │   │   └── EVs/                       # 实验设计变量
│   │   └── ... (其他任务和 run)
│   ├── fsaverage_LR32k/
│   │   ├── 100206.L.midthickness.32k_fs_LR.surf.gii  # 皮层表面
│   │   ├── 100206.R.midthickness.32k_fs_LR.surf.gii
│   │   ├── 100206.L.very_inflated.32k_fs_LR.surf.gii
│   │   └── ...
│   └── nfswbk/
│       └── ... (FreeSurfer 输出)
├── Diffusion/
│   ├── bvals                     # b 值
│   ├── bvecs                     # 梯度方向
│   ├── data.nii.gz               # 原始扩散数据
│   ├── nodif_brain_mask.nii.gz   # 脑掩膜
│   └── eddy_results/             # EDDY 校正结果
├── unprocessed/
│   ├── 3T/
│   │   ├── T1w_MPR1.nii.gz
│   │   ├── T2w_SPC1.nii.gz
│   │   ├── rfMRI_REST1_LR.nii.gz
│   │   ├── rfMRI_REST1_RL.nii.gz
│   │   ├── tfMRI_WM_LR.nii.gz
│   │   ├── tfMRI_WM_RL.nii.gz
│   │   ├── Diffusion.nii.gz
│   │   └── ... (其他模态)
│   └── 7T/ (如有)
├── Evs/
│   └── ... (任务实验设计)
└── 100206_3T_Structural_unproc.zip  # 打包未处理数据

§4.1 DAIMS 数据字典

影像数据字段
字段名 数据类型 描述 格式 空间分辨率 单位
T1w_acpc NIfTI-2 T1 加权结构像 3D 体积 0.7 mm³ 任意强度
T2w_acpc NIfTI-2 T2 加权结构像 3D 体积 0.7 mm³ 任意强度
T1w_divided_by_T2w NIfTI-2 髓鞘图(T1w/T2w 比值) 3D 体积 0.7 mm³ 比值
rfMRI_REST{1,2}_{LR,RL}_Atlas CIFTI-2 灰质体空间静息态 fMRI 时间序列 2D 矩阵 (91282 × T) 2 mm BOLD % 信号变化
rfMRI_…_hp2000_clean CIFTI-2 FIX 去噪后灰质体时间序列 2D 矩阵 (91282 × T) 2 mm BOLD % 信号变化
tfMRI_{Task}_{LR,RL}_Atlas CIFTI-2 任务态 fMRI 灰质体时间序列 2D 矩阵 (91282 × T) 2 mm BOLD % 信号变化
data (dMRI) NIfTI-2 扩散加权像 4D 体积 (x × y × z × dir) 1.25 mm³ 任意强度
bvals 文本 b 值列表 1D 向量 s/mm²
bvecs 文本 梯度方向向量 2D 矩阵 (3 × N) 单位向量
{L,R}.midthickness.32k_fs_LR GIFTI 皮层中厚度表面网格 2D 网格 32k 顶点/半球 mm
{L,R}.thickness.32k_fs_LR GIFTI 皮层厚度图 1D 向量 32k 顶点/半球 mm
{L,R}.curvature.32k_fs_LR GIFTI 皮层曲率图 1D 向量 32k 顶点/半球 任意
{L,R}.sulc.32k_fs_LR GIFTI 沟深图 1D 向量 32k 顶点/半球 mm
{L,R}.myelinmap.32k_fs_LR GIFTI 髓鞘图 1D 向量 32k 顶点/半球 比值
行为数据字段(节选)
字段名 类别 描述 采集工具
Age 人口学 年龄(Open Access: 5 岁区间;Restricted: 精确岁数) 自报告
Gender 人口学 性别 自报告
SSAGA_* 精神健康 酒精/物质使用障碍诊断(Restricted) SSAGA 电话访谈
NEO-FFI_* 人格 五因子人格量表 NEO-FFI 问卷
PSQI_* 睡眠 匹兹堡睡眠质量指数 PSQI 问卷
PMAT24_A_CR 认知 流体智力(矩阵推理正确数) Penn 矩阵推理测试
PicSeq_Unadjusted 认知 情景记忆(图片序列) NIH Toolbox
ListSort_Unadjusted 认知 工作记忆(列表排序) NIH Toolbox
CardSort_Unadjusted 认知 执行功能(卡片分类) NIH Toolbox
Flanker_Unadjusted 认知 抑制控制(侧抑制) NIH Toolbox
ReadEng_Unadjusted 认知 阅读解码(结晶智力) NIH Toolbox
PicVocab_Unadjusted 认知 词汇理解(结晶智力) NIH Toolbox
DDisc_* 决策 延迟折扣(自我控制/决策) 延迟折扣任务
Endurance_Unadjusted 运动 有氧耐力 NIH Toolbox
Dexterity_Unadjusted 运动 精细运动灵活度 NIH Toolbox
GripStrength_Unadjusted 运动 握力 NIH Toolbox
Odor_Unadjusted 感觉 嗅觉 NIH Toolbox
Taste_Unadjusted 感觉 味觉 NIH Toolbox
Noise_Collection 感觉 听力 NIH Toolbox
Vision_Collection 感觉 视力 NIH Toolbox

§4.2 7 种任务态 fMRI 设计

任务 缩写 采集日 核心条件 持续时间 认知领域
工作记忆 WM Day 1 0-back vs 2-back × ~5 min/run × 2 工作记忆、注意力
赌博 GAMBLING Day 1 赌赢 vs 赌输(金钱奖惩) ~3 min/run × 2 奖励处理、决策
运动 MOTOR Day 1 手/脚/舌/左/右运动 ~4 min/run × 2 运动控制
语言 LANGUAGE Day 2 故事理解 vs 算术计算 ~4 min/run × 2 语言处理、算术
社交 SOCIAL Day 2 社交互动 vs 随机运动(ToM) ~4 min/run × 2 社会认知、心理理论
关系 RELATIONAL Day 2 关系匹配 vs 控制匹配 ~3 min/run × 2 关系推理
情绪 EMOTION Day 2 恐惧/愤怒面孔 vs 中性形状 ~2 min/run × 2 情绪处理

§4.3 CIFTI 灰质体系统

HCP 引入的 CIFTI(Connectivity Informatics Technology Initiative)格式和灰质体(grayordinate)坐标系统是 HCP 的核心创新:

维度 数值 说明
总灰质体数 91,282 皮层表面顶点 + 皮层下体素
皮层表面顶点 ~59,412 2mm 平均顶点间距,32k 分辨率/半球
皮层下体素 ~31,870 2mm 各向同性,皮层下灰质核团
标准空间 MNI152 + fsaverage_LR32k 体积 + 表面双重标准空间
文件格式 CIFTI-2.0 2D 矩阵(灰质体 × 时间/灰质体)
跨被试对齐 MSMAll 多模态表面配准(结构+功能+髓鞘+沟深+厚度)
数据压缩 CIFTI 仅存储灰质 相比全脑体素减少 ~80% 存储量

§4.4 数据获取方式

# 方式 说明 访问门槛 速度
1 ConnectomeDB (Aspera) 注册 → 同意 DUT → 浏览/选择受试者和模态 → Aspera 高速下载 注册账号 + 同意 Open Access DUT 快(Aspera 加速)
2 Amazon S3 注册 → 同意 DUT → 创建 AWS 凭据 → 通过 AWS CLI/SDK/boto3 访问 hcp-openaccess bucket 注册 + DUT + AWS 账户 快(云端直接处理)
3 Connectome in a Box (CinaB) 预装 8TB 硬盘邮寄 已于 2018 年 3 月终止
4 BALSA 共享分析结果、场景文件、分区图谱 部分需注册
5 HCP Pipelines (GitHub) 预处理流水线源代码 无(MIT 许可)
6 Connectome Workbench 数据可视化、分析和探索工具 无(开源下载)
7 dbGaP 基因分型数据(2M+ SNP) dbGaP 受控访问申请 慢(审批流程)
8 AWS EC2 云端处理 在 S3 数据旁直接启动 EC2 实例处理 DUT + AWS 账户 + 计算费用 快(数据零迁移)

§4.5 缺失值与数据质量

问题类型 影响 处理方式
部分模态缺失 889/1,113 有四模态完整数据 使用有完整数据的受试者;或对缺失模态进行插补
rfMRI 重建版本差异 r177 vs r227 算法影响前 1/3 vs 后 2/3 受试者 推荐 812 名 r227 受试者用于跨被试一致性分析
运动伪影 高运动受试者数据质量下降 FIX 去噪 + 运动回归;EDDY 校正(dMRI);排除高运动受试者(FD > 0.5mm)
QC_Issue 标记 部分受试者有脑解剖/处理/数据噪声问题 QC_Issue 字段标记;详见 S1200 Reference Manual 和 HCP QC Issues wiki
重测数据 46 名 MZ 双胞胎完成完整重测 用于测试-重测信度评估;注意不要用重测数据覆盖初次扫描数据
7T/MEG 子集 仅 184 名有 7T / 95 名有 MEG 分析 7T/MEG 时样本量显著减小

§4.6 生态工具

# 工具 类型 功能
1 Connectome Workbench 可视化 CIFTI 数据浏览、可视化、分析和场景管理
2 HCP Pipelines 预处理 结构/功能/扩散 MRI 最小预处理流水线
3 FSL 分析 fMRI/dMRI 分析(FSL EDDY, BEDPOSTX, FEAT, FIX)
4 FreeSurfer 结构 皮层表面重建、分割、配准
5 AFNI 分析 fMRI 分析、体积空间处理
6 ANTs 配准 高级配准工具(用于体积空间标准化)
7 nilearn (Python) ML 功能连接组分析、脑网络机器学习
8 DIPY (Python) dMRI 扩散 MRI 分析和纤维追踪
9 nibabel (Python) I/O NIfTI/GIFTI/CIFTI 文件读写
10 wbplot (Python) 可视化 Connectome Workbench Python 绑定
11 AWS boto3 云端 Amazon S3 数据访问和 EC2 云端处理
12 DataLad 数据管理 HCP 数据集版本管理和分布式下载

§5 数据划分与使用建议

§5.1 划分策略

策略 划分方式 样本量 适用场景 注意事项
100 Unrelated HCP 提供的 100 名无亲缘关系受试者 100 跨被试分析,避免家庭结构混淆 最常用子集,行为和影像数据完整
Unrelated 80/20 100 Unrelated 中随机 80/20 划分 80 训练 / 20 测试 机器学习模型训练和验证 确保训练/测试集无家庭结构重叠
S1200 All (stratified) 全部 1,206 名受试者,按家庭分层 ~965 训练 / ~241 测试 大样本分析,最大化统计功效 必须处理家庭结构非独立性
Leave-One-Family-Out 按家庭留一交叉验证 457 折 严格的家庭级泛化评估 计算量大但避免家庭泄露
Test-Retest Split 46 名 MZ 重测受试者 46 对 测试-重测信度评估 仅 MZ 双胞胎,可能有偏差
MZ/DZ Twin Split 149 MZ 对 + 94 DZ 对 243 对 遗传力分析 需 Restricted Data 访问权限

§5.2 基准配置

# 推荐:100 Unrelated Subjects 基准配置
UNRELATED_100 = [
    # HCP 提供的 100 名无亲缘关系受试者 ID 列表
    # 可从 ConnectomeDB 下载或从 HCP unrestricted behavioral data 获取
]

# 功能连接组计算
PARCELLATION = "Glasser360"  # Glasser et al. 2016, 360 皮层区域
FC_METHOD = "pearson"        # Pearson 相关
# 每名受试者: 360 × 360 功能连接矩阵

# 划分
from sklearn.model_selection import train_test_split
train_ids, test_ids = train_test_split(
    UNRELATED_100, test_size=0.2, random_state=42, stratify=gender_labels
)
# 80 训练 / 20 测试

§5.3 使用建议

# 场景 推荐子集 推荐模态 注意事项
1 功能连接组分析 100 Unrelated rfMRI (FIX 去噪后) 使用 4 run 平均或分别分析
2 结构连接组分析 100 Unrelated dMRI (BEDPOSTX) 使用概率追踪
3 脑年龄预测 全部 1,113 有 3T 结构 T1w + dMRI 多模态优于单模态
4 性别分类 100 Unrelated rfMRI FC matrix FC 指纹效应强
5 遗传力分析 149 MZ + 94 DZ 对 任意模态 需 Restricted Data
6 测试-重测信度 46 Retest 受试者 rfMRI/dMRI 仅 MZ 双胞胎

§6 AI 就绪指南

§6.0 云端快速启动

# 1. 安装 AWS CLI 并配置 HCP S3 凭据
pip install awscli
aws configure  # 输入从 ConnectomeDB 获取的 Access Key ID 和 Secret Access Key

# 2. 列出 HCP S3 数据
aws s3 ls s3://hcp-openaccess/HCP/ no-sign-request endpoint-url https://s3.amazonaws.com

# 3. 下载单个受试者的 rfMRI 数据(CIFTI 格式)
aws s3 cp s3://hcp-openaccess/HCP/100206/MNINonLinear/Results/rfMRI_REST1_LR/rfMRI_REST1_LR_Atlas_MSMAll.dtseries.nii ./

# 4. 安装 Python 神经影像工具
pip install nibabel nilearn dipy numpy scipy scikit-learn torch

§6.1 快速上手代码

import numpy as np
import nibabel as nib
from nilearn import connectome
from sklearn.model_selection import train_test_split
from sklearn.svm import SVC
from sklearn.metrics import accuracy_score, classification_report

# ===== 1. 加载 CIFTI 灰质体时间序列 =====
def load_cifti_timeseries(filepath):
    """加载 CIFTI 灰质体时间序列 (.dtseries.nii)"""
    cifti = nib.load(filepath)
    data = cifti.get_fdata()  # shape: (timepoints, 91282)
    return data

# ===== 2. 计算功能连接组 (FC) =====
def compute_fc(timeseries, parcellation=None, n_regionevent-blocked=360):
    """
    计算功能连接组矩阵
    - 使用 Glasser 360 分区或自定义分区
    - 返回 N×N Pearson 相关矩阵
    """
    if parcellation is not None:
        # 按分区提取平均时间序列
        roi_timeseries = np.zeros((timeseries.shape[0], n_regions))
        for i in range(n_regions):
            mask = (parcellation == i)
            roi_timeseries[:, i] = timeseries[:, mask].mean(axis=1)
    else:
        roi_timeseries = timeseries

    # Pearson 相关矩阵
    corr = np.corrcoef(roi_timeseries.T)
    # Fisher z 变换
    fc = np.arctanh(corr)
    np.fill_diagonal(fc, 0)
    return fc

# ===== 3. 加载多受试者数据并构建数据集 =====
def build_fc_dataset(subject_ids, base_path="/data/HCP"):
    """
    为多名受试者构建功能连接组数据集
    返回: X (N_subjects × N_features), subject_ids
    """
    fc_list = []
    for sid in subject_ids:
        # 加载 4 次 rfMRI run 并平均
        fcs = []
        for run in ["REST1_LR", "REST1_RL", "REST2_LR", "REST2_RL"]:
            filepath = f"{base_path}/{sid}/MNINonLinear/Results/rfMRI_{run}/rfMRI_{run}_Atlas_MSMAll_hp2000_clean.dtseries.nii"
            ts = load_cifti_timeseries(filepath)
            fc = compute_fc(ts, n_regionevent-blocked=360)
            fcs.append(fc)
        avg_fc = np.mean(fcs, axis=0)
        # 取上三角作为特征向量
        upper_tri = avg_fc[np.triu_indices(360, k=1)]
        fc_list.append(upper_tri)

    X = np.array(fc_list)
    return X

# ===== 4. 性别分类基准 =====
def sex_classification_baseline(X, labels):
    """HCP 性别分类基准:SVM on FC upper triangle"""
    X_train, X_test, y_train, y_test = train_test_split(
        X, labels, test_size=0.2, random_state=42, stratify=labels
    )

    svm = SVC(kernel=''''''''''''''''rbf'''''''''''''''', C=1.0, gamma=''''''''''''''''scale'''''''''''''''')
    svm.fit(X_train, y_train)
    y_pred = svm.predict(X_test)

    acc = accuracy_score(y_test, y_pred)
    print(f"Sex Classification Accuracy: {acc:.4f}")
    print(classification_report(y_test, y_pred, target_names=["Female", "Male"]))
    return svm

# ===== 5. 运行 =====
# subject_ids = [...]  # 100 Unrelated subjects
# labels = [...]       # 0=Female, 1=Male
# X = build_fc_dataset(subject_ids)
# model = sex_classification_baseline(X, labels)

§6.2 数据获取详细流程

步骤 操作 耗时
1 访问 ConnectomeDB 并注册账号 5 分钟
2 接受 WU-Minn HCP Open Access Data Use Terms 5 分钟
3a (选项 A) 使用 ConnectomeDB Aspera 下载选定受试者/模态 视数据量
3b (选项 B) 设置 AWS S3 凭据,通过 boto3/CLI 访问 hcp-openaccess bucket 10 分钟
3c (选项 C) 在 AWS EC2 上启动实例,在 S3 数据旁直接处理 15 分钟
4 (如需基因数据) 通过 NIH dbGaP 申请受控访问 2-4 周
5 (如需 Restricted Data) 填写 Restricted Access Application 并提交 1-2 周

§6.3 预处理管道

# HCP 数据已预处理,通常无需额外预处理
# 以下是常见的后处理步骤:

import numpy as np
from scipy.signal import butter, filtfilt

def postprocess_rfMRI(timeseries, tr=0.72):
    """
    HCP rfMRI 后处理(在最小预处理流水线之上)
    """
    # 1. 去除线性趋势
    from scipy.signal import detrend
    ts = detrend(timeseries, axis=0, type=''''''''''''''''linear'''''''''''''''')

    # 2. 带通滤波 (0.008-0.08 Hz) - 已在 HCP 流水线中完成
    # HCP 使用 2000s 高通截止,不做低通(保留任务相关信号)
    # 如需额外低通滤波:
    nyquist = 1 / (2 * tr)
    low = 0.08 / nyquist
    high = 0.008 / nyquist
    b, a = butter(4, [high, low], btype=''''''''''''''''band'''''''''''''''')
    ts = filtfilt(b, a, ts, axis=0)

    # 3. 全脑信号回归 (GSR) - 可选,有争议
    global_signal = ts.mean(axis=1, keepdims=True)
    # ts = ts - global_signal @ np.linalg.pinv(global_signal) @ ts

    # 4. 标准化
    ts = (ts - ts.mean(axis=0)) / (ts.std(axis=0) + 1e-8)
    return ts

def parcellate_cifti(timeseries, atlas="Glasser360"):
    """
    将 91,282 灰质体时间序列分区为 360 区域平均时间序列
    """
    # 加载 Glasser 360 分区标签 (CIFTI format)
    # 每个灰质体分配到 1-360 中的一个区域
    if atlas == "Glasser360":
        parcel_labels = load_glasser_parcellation()  # shape: (91282,)
        n_parcels = 360

    roi_ts = np.zeros((timeseries.shape[0], n_parcels))
    for i in range(n_parcels):
        mask = (parcel_labels == (i + 1))
        roi_ts[:, i] = timeseries[:, mask].mean(axis=1)

    return roi_ts

§6.4 PyTorch 数据加载器

import torch
from torch.utils.data import Dataset, DataLoader
import nibabel as nib
import numpy as np

class HCPDataset(Dataset):
    """
    HCP 功能连接组数据集,适用于性别分类/脑年龄预测等任务
    """
    def __init__(self, subject_list, labels, base_path="/data/HCP",
                 parcellation="Glasser360", modality="rfMRI"):
        self.subjects = subject_list
        self.labels = labels
        self.base_path = base_path
        self.parcellation = parcellation
        self.n_regionevent-blocked= 360 if parcellation == "Glasser360" else 200

    def __len__(self):
        return len(self.subjects)

    def __getitem__(self, idx):
        sid = self.subjects[idx]

        # 加载 4 run rfMRI 并计算平均 FC
        fcs = []
        for run in ["REST1_LR", "REST1_RL", "REST2_LR", "REST2_RL"]:
            filepath = f"{self.base_path}/{sid}/MNINonLinear/Results/rfMRI_{run}/rfMRI_{run}_Atlas_MSMAll_hp2000_clean.dtseries.nii"
            cifti = nib.load(filepath)
            ts = cifti.get_fdata()  # (T, 91282)

            # 分区
            roi_ts = parcellate_cifti(ts, self.parcellation)

            # FC 矩阵
            fc = np.corrcoef(roi_ts.T)
            fc = np.arctanh(fc)
            fcs.append(fc)

        avg_fc = np.mean(fcs, axis=0)
        label = self.labels[idx]

        return torch.FloatTensor(avg_fc), torch.LongTensor([label])


# GNN 数据加载器(用于脑网络图)
class HCPGraphDataset(Dataset):
    """
    将 HCP 功能连接组转换为图数据,用于 GNN
    节点 = 脑区(360 个 Glasser 区域)
    边 = 功能连接(阈值化或全连接)
    节点特征 = 度、聚类系数、效率等图论指标
    """
    def __init__(self, subject_list, labels, base_path="/data/HCP",
                 edge_threshold=0.5, node_features="graph_metrics"):
        self.subjects = subject_list
        self.labels = labels
        self.base_path = base_path
        self.edge_threshold = edge_threshold
        self.node_features = node_features

    def __len__(self):
        return len(self.subjects)

    def __getitem__(self, idx):
        # ... 加载 FC 矩阵 ...
        fc = load_fc_for_subject(self.subjects[idx], self.base_path)

        # 构建邻接矩阵(阈值化)
        adj = (np.abs(fc) > self.edge_threshold).astype(np.float32)
        np.fill_diagonal(adj, 0)

        # 节点特征
        if self.node_features == "identity":
            x = torch.eye(360)  # one-hot 节点身份
        elif self.node_features == "graph_metrics":
            x = compute_graph_metrics(fc)  # 度、聚类系数等

        edge_index = torch.from_numpy(np.array(np.nonzero(adj))).long()

        return {
            ''''''''''''''''x'''''''''''''''': torch.FloatTensor(x),
            ''''''''''''''''edge_index'''''''''''''''': edge_index,
            ''''''''''''''''edge_weight'''''''''''''''': torch.FloatTensor(fc[adj > 0]),
            ''''''''''''''''y'''''''''''''''': torch.LongTensor([self.labels[idx]])
        }

§6.5 8 大坑点与解决方案

# 坑点 影响 解决方案
1 家庭结构非独立性 双胞胎/兄弟姐妹数据不独立,交叉验证中训练/测试集泄露导致性能虚高 使用 100 Unrelated 子集;或按家庭划分(Leave-One-Family-Out)
2 rfMRI 重建版本差异 r177(前 1/3)vs r227(后 2/3)算法不同,影响跨被试一致性 使用 812 名 r227 受试者;或明确报告使用的重建版本
3 运动伪影 高运动受试者 FC 被运动噪声污染,尤其影响头动大的受试者 排除 FD > 0.5mm 受试者;使用 scrubbing/censoring;检查运动回归因子
4 功能连接指标选择 Pearson 相关 vs 偏相关 vs 互信息等 239 种方法产生不同 FC 矩阵 报告使用的 FC 计算方法;参考 Nature Methods 2025 FC 基准研究
5 分区方案影响 Glasser360 vs Schaefer200 vs AAL 等不同分区影响 GNN/CNN 性能 报告使用的分区方案;可尝试多分区对比
6 数据量与存储 全部 S1200 数据 ~76 TB,单个受试者 ~51 GB 使用 AWS EC2 云端处理(数据零迁移);或按需下载特定模态/子集
7 S1200 vs HCP-YA 2025 不兼容 2025 发布的更新处理(SE-based 偏置场校正、时间 ICA 等)与 S1200 数据不应混用 选择一个版本并保持一致;新项目推荐 HCP-YA 2025
8 非完全去标识化 Open Access 数据虽已去标识,但某些受限数据组合可能识别个体 不在发表物中报告个体 Subject ID;不将家庭结构与其他受限数据组合报告;遵守 Restricted Data Use Terms

§6.6 模型推荐

# 模型/方法 任务 推荐理由
1 SVM (RBF kernel) 性别分类 FC 上三角作为特征,简单高效,基线性能好
2 BrainNetCNN 脑网络分类/回归 专为脑网络设计的 CNN,捕捉 FC 矩阵空间结构
3 GNN (GCN/GAT/GraphSAGE) 脑网络分类/回归 直接在脑图上学习,无需展平 FC 矩阵
4 3D CNN (ResNet) 脑年龄预测 直接处理 3D T1w 体素数据
5 Spatio-Temporal GNN 性别分类/智力预测 同时建模 FC 空间和时间动态(准确率 94.4%)
6 Krakencoder (Encoder-Decoder) SC→FC 预测 225 条翻译路径,15 种连接组"风味"间转换
7 Transformer (ViT) 视觉刺激解码 从 fMRI 时间序列重建视觉刺激
8 ComBat 多站点数据协调 HCP 与其他数据集(如 UK Biobank)联合分析时的批次效应去除
9 Linear Mixed Effects 遗传力分析 处理 MZ/DZ 双胞胎家庭结构的混合效应模型
10 Ridge Regression 智力/行为预测 FC→行为预测的经典方法
11 Graph Diffusion Convolution 脑网络分类 在非欧几里得脑图上高效学习
12 Multimodal Fusion (sMRI+dMRI) 脑年龄预测 sMRI+dMRI 融合优于单模态(MAE 2.44 年)

§6.7 硬件配置建议

配置级别 CPU RAM GPU 存储 适用场景
入门 8 核 32 GB 2 TB SSD 100 Unrelated 受试者 + 单模态 FC 分析
中级 16 核 64 GB 1× RTX 3090 (24GB) 10 TB 全部 1,206 受试者 + CNN/GNN 训练
高级 32 核 128 GB 2× RTX 4090 (48GB) 50 TB 多模态融合 + 3D CNN 体素级分析
超算 64+ 核 256+ GB 4+× A100 (160GB+) 100+ TB 全量数据 + 大型 Transformer
云端 AWS c5.4xlarge 32 GB 按需 GPU S3 直挂 无需本地存储,数据零迁移

§6.8 评估指标

指标 适用任务 HCP 基准范围 说明
Accuracy 性别分类 85-94.4% 二分类准确率
AUC-ROC 性别分类 / 个体识别 0.85-0.99 个体识别(FC 指纹)通常接近 1.0
MAE (Mean Absolute Error) 脑年龄预测 2.44-4.36 年
Pearson r 智力/行为预测 0.15-0.63 与实际行为得子的相关
脑年龄预测 0.26-0.91 解释方差
avgrank 个体识别 55-83% 多 FC 方法中的百分位排名
ICC (Intraclass Correlation) 测试-重测信度 0.5-0.9 FC 矩阵元素的重测信度

§7 质量评估与局限性

§7.1 偏倚分析

# 偏倚类型 描述 缓解措施
1 健康志愿者偏倚 仅纳入健康青年成人,排除神经/精神疾病 与 HCP-Disease 项目数据联合分析;注意泛化性限制
2 地理/人口偏倚 主要来自圣路易斯地区,族裔/种族多样性有限 报告样本人口学特征;与其他地区数据集联合验证
3 年龄范围偏倚 22-35 岁青年成人,不含发育期和老年期 使用 Lifespan HCP 扩展年龄段分析
4 扫描仪偏倚 全部 3T 数据来自单台定制 Connectom 扫描仪,参数远超标准临床 报告扫描仪型号和参数;考虑与其他数据集(如 UK Biobank 标准采集)对比验证
5 家庭结构偏倚 双胞胎/兄弟姐妹设计优化遗传力分析但引入非独立性 使用 100 Unrelated 子集;或统计中处理家庭随机效应
6 社会经济偏倚 能完成多天扫描的受试者可能有特定社会经济特征 报告社会经济指标(如有);与人口学数据对比
7 运动伪影偏倚 高运动受试者数据质量下降,运动与年龄/性别相关 运动回归;排除高运动受试者;报告运动统计

§7.2 标注质量

数据类型 标注来源 质量评估
结构像分割 FreeSurfer 自动分割 + 人工 QC HCP QC 流程检查表面和分割质量
功能连接 自动计算(Pearson 相关等) 测试-重测信度 ICC 0.5-0.9
任务态激活 GLM 自动分析 任务设计经过预实验验证
行为数据 标准化问卷和计算机化测试 NIH Toolbox 有已知信效度
基因分型 Illumina 芯片自动基因分型 GTAC 中心标准 QC 流程
家庭结构 基因验证(纠正了 36 对自报 DZ 为 MZ) 基因验证比自报告更可靠

§7.3 泛化性评估

场景 泛化性 证据
跨年龄泛化 有限 22-35 岁范围窄,不能推广到儿童或老年人
跨人群泛化 中等 主要白人/西方人群;与 ABCD Study、UK Biobank 对比验证
跨疾病泛化 受限 健康队列,需与 HCP-Disease 数据联合分析
跨扫描仪泛化 受限 单台定制扫描仪,需与标准采集数据对比
跨方法泛化 5000+ 论文验证多种分析方法的可重复性
跨物种泛化 不适用 仅人类数据

§7.4 伦理考量

# 伦理维度 HCP 的处理
1 知情同意 所有受试者签署书面知情同意书,经华盛顿大学 IRB 批准
2 隐私保护 Open Access 数据去标识化;Restricted Data 需单独申请;禁止识别个体
3 数据再识别风险 非完全去标识化——某些受限数据组合可能识别个体,故实施分级访问
4 基因数据伦理 基因分型数据通过 dbGaP 受控访问,不公开
5 双胞胎伦理 双胞胎研究需特别考虑隐私和家庭关系敏感性
6 公平性 行为评估工具(NIH Toolbox)经过多种族验证;报告样本人口学特征

§7.5 DAIMS 24 项数据就绪度评估

# DAIMS 评估项 评分 说明
1 动机(Motivation) NIH Blueprint 明确资助目标:映射健康成人脑连接组
2 组成(Composition) 1,206 名受试者,5 大模态 + 行为 + 基因,完整记录
3 采集过程(Collection Process) 详细文档化:Phase I 优化 + Phase II 采集,全部参数公开
4 预处理(Preprocessing) 最小预处理流水线开源(Glasser et al. 2013),HCP-YA 2025 更新
5 标注(Labeling) 行为标签标准化(NIH Toolbox);影像标签自动生成
6 清洗(Cleaning) QC_Issue 系统;FIX 自动去噪;EDDY 校正
7 使用(Uses) 5000+ 论文验证多种用途
8 分发(Distribution) ConnectomeDB + AWS S3 + BALSA 多渠道
9 维护(Maintenance) 2013-2025 持续更新;Connectome Coordination Facility (CCF) 运营
10 组成-样本量(Sample Size) 1,206 名受试者,足够大样本
11 采集-仪器(Instruments) 定制 Connectom 3T + 7T + MEG,全部参数公开
12 采集-时间范围(Timeframe) 2012-2015 明确记录
13 采集-知情同意(Consent) WashU IRB 批准,书面知情同意
14 采集-隐私(Privacy) ⚠️ 去标识但非完全去标识;分级访问机制
15 预处理-原始数据(Raw Data) 原始未处理数据完整提供
16 预处理-软件(Software) HCP Pipelines 开源(MIT),FSL/FreeSurfer 公开
17 标注-方法(Method) 自动标注(GLM/分割)+ 标准化行为评估
18 标注-标注者(Annotators) N/A 影像数据为自动处理,非人工标注
19 清洗-噪声(Noise) FIX/EDDY 系统化去噪
20 清洗-拒绝(Rejected) QC_Issue 标记低质量数据
21 分发-许可证(License) WU-Minn HCP Open Access DUT(自定义但清晰)
22 分发-费用(Fees) 免费(AWS S3 处理费用除外)
23 使用-任务(Tasks) 广泛适用,5000+ 论文
24 维护-更新(Updates) S1200 (2017) → HCP-YA 2025 (2025) 持续更新

DAIMS 总分:21/24(87.5%)— ⭐⭐⭐⭐⭐

扣分项:隐私保护非完全去标识化(#14);标注者维度不适用于影像自动处理(#18);预处理软件中部分依赖商业软件(FreeSurfer 部分功能)。

§7.6 外部验证数据集

# 数据集 验证场景 样本量 与 HCP 的差异
1 UK Biobank Brain Imaging 跨扫描仪/跨人群验证 ~100,000 标准 Siemens Prisma(80mT/m),年龄 40-69
2 ABCD Study 跨年龄验证(青少年) ~12,000 年龄 9-10,标准采集协议
3 Cam-CAN 跨年龄验证(全生命周期) ~700 年龄 18-88,3T + MEG
4 ADNI 临床验证(阿尔茨海默病) ~2,000 老年人 + 痴呆,1.5T/3T
5 HCP-Lifespan 跨年龄扩展 多项目 4 个年龄段,HCP-Style 协议
6 HCP-Disease 临床验证 18 个项目 多种脑疾病,HCP-Style 协议

§8 基准性能与生态

§8.1 排行榜

性别分类(HCP rfMRI FC → Male/Female)
# 方法 准确率 AUC-ROC 样本量 年份 参考
1 Spatio-Temporal GNN (ST-GCN) 94.4% 1,003 2024 KCL, skeleton-based action recognition adapted
2 BrainNetCNN ~90% 1,003 2021 Kawahara et al.
3 GNN (GCN simple) 85.1% 147 (BRIGHT) 2025 Tomography 2025, adult validation
4 SVM (RBF, FC upper-tri) ~88-90% ~0.90 100 Unrelated 2018-2024 经典基线
5 FFN (Feedforward NN) ~88-90% 897 2022 PMC9120557
6 CNN ~88-90% 897 2022 PMC9120557
脑年龄预测
# 方法 MAE (年) 样本量 模态 年份
1 Global-Local Attention Net (multimodal) 2.44 0.258 1,064 T1w + dMRI 2025
2 3D CNN (dual-channel, T1+T2) 3.327 0.968* 1,700+ (HCP-YA + HCP-Aging) T1w + T2w 2025
3 NOSA BrainAge multi-site (含 HCP) T1w 2025

*R²=0.968 来自 HCP-Aging 子集(年龄范围更大),HCP-YA 的 R²=0.258(年龄范围窄 22-35)

智力预测
# 方法 指标 任务 年份
1 ST-GNN Pearson r 0.325 流体智力 2024
2 Dual-channel CNN Pearson r 0.628 流体智力 2025
3 Dual-channel CNN Pearson r 0.486 结晶智力 2025
4 Ridge Regression Pearson r ~0.15-0.25 流体智力 (PMAT) 经典基线
结构-功能连接组预测
# 方法 avgrank (个体识别) avgcorr_demean 样本量 年份
1 Krakencoder (fusion SC) 83% 683 2025 (Nature Methods)
2 Krakencoder (single SC) ~72% 683 2025
3 deepnet (baseline) ~42% lower than Krakencoder 683 2025
4 graphnet (baseline) ~42% lower than Krakencoder 683 2025

§8.2 关键论文

# 论文 期刊 年份 核心贡献
1 Van Essen et al. “The WU-Minn HCP: An overview” Neuroimage 80:62-79 2013 HCP 项目概述
2 Glasser et al. “The minimal preprocessing pipelines for the HCP” Neuroimage 80:105-124 2013 最小预处理流水线
3 Ugurbil et al. “Pushing spatial and temporal resolution for fMRI and dMRI” Neuroimage 80:80-104 2013 3T Connectom 扫描仪技术
4 Sotiropoulos et al. “Advances in diffusion MRI acquisition” Neuroimage 80:104-125 2013 dMRI 采集和预处理
5 Barch et al. “Function in the human connectome: task-fMRI” Neuroimage 80:169-189 2013 7 种任务态 fMRI 设计
6 Smith et al. “rfMRI preprocessing and analysis” Neuroimage 80:144-168 2013 rfMRI 预处理
7 Glasser et al. “A multi-modal parcellation of human cerebral cortex” Nature 536:171-178 2016 360 区域皮层分区 (HCP-MMP1.0)
8 Van Essen et al. “The HCP: A data acquisition perspective” Neuroimage 62:62-79 2012 数据采集设计
9 Elam et al. “The HCP: A retrospective” PMC9387634 2021 HCP 回顾(1500+ 论文)
10 Krakencoder Nature Methods 2025 连接组通用语言空间
11 FC Benchmarking (239 methods) Nature Methods 2025 功能连接计算方法全景评估
12 Kruper et al. “Tractometry of the HCP” Front. Neurosci. 2024 HCP dMRI 束量化

§8.3 使用统计

指标 数值
同行评审论文数(2021 年) 1,500+(Elam et al. 2021)
同行评审论文数(2025 年估计) 5,000+
ConnectomeDB 注册用户 数万(全球)
HCP-Lifespan 子项目 4 个年龄段(胎儿/0-5/6-21/36-100+)
HCP-Disease 子项目 18 个疾病相关项目
CCF 支持的连接组研究 20 个
# 数据集 关系 说明
1 HCP-Lifespan (4 项目) 扩展 4 个年龄段(胎儿/0-5/6-21/36-100+),HCP-Style 协议
2 HCP-Disease (18 项目) 扩展 脑疾病连接组研究(精神分裂症/抑郁/焦虑等)
3 UK Biobank Brain Imaging 对照 ~100,000 名 40-69 岁,标准采集协议,更大样本量
4 ABCD Study 对照 ~12,000 名 9-10 岁青少年,纵向追踪
5 ADNI 临床参照 阿尔茨海默病,老年临床队列
6 Cam-CAN 对照 全生命周期健康老化(18-88 岁),3T + MEG
7 OpenNeuro 平台 开放神经影像数据共享平台
8 Human Brain Atlas (Jülich) 互补 细胞结构学脑图
9 Allen Brain Atlas 互补 转录组学脑图

§8.5 生态快照

                    HCP 生态系统
                         │
        ┌────────────────┼────────────────┐
        │                │                │
   数据采集层        数据处理层        AI/ML 应用层
        │                │                │
   ┌────┴────┐     ┌─────┴─────┐    ┌─────┴─────┐
   │3T Connectom│   │HCP Pipelines│   │性别分类   │
   │7T Magnetom│   │(Glasser 2013)│   │脑年龄预测 │
   │MEG (SLU)  │   │FSL/FreeSurfer│   │智力预测   │
   │行为测试   │   │FIX/EDDY    │    │SC→FC预测  │
   │基因分型   │   │MSMAll/CIFTI │    │视频解码   │
   └────┬────┘     └─────┬─────┘    └─────┬─────┘
        │                │                │
        └────────────────┼────────────────┘
                         │
                    数据分发层
                         │
              ┌──────────┼──────────┐
              │          │          │
         ConnectomeDB  AWS S3    BALSA
         (Aspera)    (云端)    (共享结果)
              │          │          │
         ┌────┴────┐     │     ┌────┴────┐
         │Open Access│    │     │CC BY-NC-SA│
         │Restricted │    │     │(衍生数据) │
         │dbGaP(基因)│    │     └──────────┘
         └──────────┘    │
                    ┌────┴────┐
                    │EC2 云端 │
                    │数据处理 │
                    └─────────┘

§9 相关资源与引用

§9.1 官方资源

# 资源 URL
1 HCP 官方网站 https://www.humanconnectome.org/
2 ConnectomeDB(数据下载) https://db.humanconnectome.org/
3 HCP Young Adult 研究页面 https://humanconnectome.org/study/hcp-young-adult
4 HCP-YA 2025 发布文档 https://www.humanconnectome.org/study/hcp-young-adult/document/hcp-young-adult-2025-release
5 S1200 Reference Manual (PDF) https://www.humanconnectome.org/storage/app/media/documentation/s1200/HCP_S1200_Release_Reference_Manual.pdf
6 Open Access Data Use Terms https://www.humanconnectome.org/study/hcp-young-adult/document/wu-minn-hcp-consortium-open-access-data-use-terms
7 Restricted Data Use Terms (PDF) https://humanconnectome.org/storage/app/media/data_use_terms/DataUseTerms_HCP_RestrictedAccess_11Feb2022.pdf
8 AWS S3 访问指南 https://wiki.humanconnectome.org/docs/How To Connect to Connectome Data via AWS.html
9 HCP Pipelines (GitHub) https://github.com/WashingtonUniversity/Pipelines
10 Connectome Workbench https://www.humanconnectome.org/software/connectome-workbench
11 BALSA(共享分析结果) https://balsa.wustl.edu/
12 HCP QC Issues Wiki https://wiki.humanconnectome.org/
13 HCP 致 acknowledgement 指南 https://www.humanconnectome.org/about/acknowledgehcp.html
14 HCP Users 讨论组 https://groups.google.com/g/hcp-users

§9.2 BibTeX

@article{vanessen2013overview,
  title={The WU-Minn Human Connectome Project: An overview},
  author={Van Essen, David C and Smith, Stephen M and Barch, Deanna M and Behrens, Timothy EJ and Yacoub, Essa and Ugurbil, Kamil},
  journal={Neuroimage},
  volume={80},
  pages={6279},
  year={2013},
  publisher={Elsevier},
  doi={10.1016/j.neuroimage.2013.05.041}
}

@article{glasser2013minimal,
  title={The minimal preprocessing pipelines for the Human Connectome Project},
  author={Glasser, Matthew F and Sotiropoulos, Stamatios N and Wilson, J Anthony and Coalson, Timothy S and Fischl, Bruce and Andersson, Jesper L and Xu, Junqian and Jbabdi, Saad and Webster, Matthew and Polimeni, Jonathan R and others},
  journal={Neuroimage},
  volume={80},
  pages={105124},
  year={2013},
  publisher={Elsevier},
  doi={10.1016/j.neuroimage.2013.04.127}
}

@article{glasser2016multimodal,
  title={A multi-modal parcellation of human cerebral cortex},
  author={Glasser, Matthew F and Coalson, Timothy S and Robinson, Emma C and Hacker, Carl D and Harwell, John and Yacoub, Essa and Ugurbil, Kamil and Andersson, Jesper and Beckmann, Christian F and Jenkinson, Mark and others},
  journal={Nature},
  volume={536},
  number={7615},
  pages={171178},
  year={2016},
  publisher={Nature Publishing Group},
  doi={10.1038/nature18933}
}

@article{ugurbil2013pushing,
  title={Pushing spatial and temporal resolution for functional and diffusion MRI in the Human Connectome Project},
  author={Ugurbil, Kamil and Xu, Junqian and Auerbach, Edward J and Moeller, Steen and Vu, An T and Duarte-Carvajalino, Jesus G and Lenglet, Christophe and Wu, Xiaoping and Schmitter, Samuel and Van de Moortele, Pierre-Fran{\c{c}}ois and others},
  journal={Neuroimage},
  volume={80},
  pages={80104},
  year={2013},
  publisher={Elsevier},
  doi={10.1016/j.neuroimage.2013.05.012}
}

§9.3 核心团队

姓名 角色 机构
Kamil Ugurbil 共同 PI 明尼苏达大学 CMRR
David Van Essen 共同 PI 华盛顿大学圣路易斯
Stephen Smith rfMRI 预处理 牛津大学 FMRIB
Matthew Glasser 预处理流水线/皮层分区 华盛顿大学
Stamatios Sotiropoulos dMRI 采集/处理 牛津大学
Deanna Barch 任务态 fMRI/行为数据 华盛顿大学
Essa Yacoub 7T MRI 明尼苏达大学
Timothy Behrens dMRI 分析 牛津大学
Daniel Marcus ConnectomeDB 平台 华盛顿大学
Jennifer Elam 外展协调 华盛顿大学
Kamil Ugurbil 3T Connectom 扫描仪 明尼苏达大学
(Plus 100+ 其他研究人员和工程师) 10 所机构

§10 AI 使用声明卡

§10.1 数据集标识

字段
数据集名称 Human Connectome Project Young Adult (HCP-YA)
数据集 ID human-connectome-project/95
版本 HCP-YA 2025(推荐)/ S1200(2017)
发布日期 2017-03-01(S1200)/ 2025-08-11(HCP-YA 2025)
页面状态 published

§10.2 许可证摘要

维度 说明
商业使用 允许(Open Access 数据无商业使用限制)
再分发 允许(在相同 Data Use Terms 下)
衍生作品 允许(衍生数据须在相同 DUT 下分发)
署名要求 强制致谢特定语句
受限数据 家庭结构/精确年龄/族裔等需单独申请
基因数据 dbGaP 受控访问
  1. 注册 ConnectomeDB 账号并同意 Open Access DUT
  2. 选择数据子集(推荐 100 Unrelated 或按需选择)
  3. 选择数据获取方式(ConnectomeDB Aspera 下载 / AWS S3 云端访问)
  4. 安装 HCP Pipelines(如需重新预处理)或直接使用已处理数据
  5. 安装 Python 神经影像工具(nibabel, nilearn, DIPY)
  6. 加载 CIFTI 灰质体时间序列并计算功能连接组
  7. 按家庭结构划分训练/测试集(100 Unrelated 推荐)
  8. 训练模型并使用 HCP 基准评估(性别分类 94.4% / 脑年龄 MAE 2.44 年)
  9. 如需外部验证,使用 UK Biobank / ABCD / Cam-CAN 数据集

§10.4 人工校验表

# 校验项 状态
1 数据集名称与版本准确
2 受试者数量与子集说明准确
3 扫描仪参数与技术规格准确
4 预处理流水线描述准确
5 许可证条款准确
6 基准性能数据引用准确
7 ICD-11/SNOMED CT 映射合理
8 DAIMS 评分合理
9 坑点与解决方案实用
10 引用文献准确
返回 AI-Ready 数据集