FCP-1000 — 全球首个千例静息态功能连接组开放数据集 AI-Ready Wikipedia

1,414 名受试者、35 个国际中心的首个大规模静息态 fMRI 开放共享项目

来源 INDI(International Neuroimaging Data-sharing Initiative)/ NITRC url: https://fcon_1000.projects.nitrc.org/发布时间: 2026-09-12最后更新: 2026-09-25 阅读 67
FCP-1000 — 全球首个千例静息态功能连接组开放数据集 AI-Ready Wikipedia

信息速览

数据集名称FCP-1000 — 全球首个千例静息态功能连接组开放数据集 AI-Ready Wikipedia
数据类型1,414 名健康志愿者,35 个国际中心,静息态 fMRI + T1 结构像,NIfTI/DICOM 格式,注册后免费获取,S3 匿名下载
规模1,414 名健康志愿者(FCP Classic 托管 1,288 例)
接入方式INDI(International Neuroimaging Data-sharing Initiative)/ NITRC url: https://fcon_1000.projects.nitrc.org/
AI 就绪度

数据集封面

FCP-1000(千例功能连接组项目)— 首个千例级开放功能连接组 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 FCP-1000(千例功能连接组项目)
英文全称 1000 Functional Connectomes Project
别名/简称 FCP、FCP Classic、fcon_1000、FCP-INDI
疾病分类 健康志愿者队列(无疾病特异性 ICD-11 编码)
SNOMED CT 不适用(健康人群方法学数据集)
数据模态 静息态 fMRI(R-fMRI)+ 部分 T1 加权结构像
AI 任务类型 功能连接组建模、ICA 分解、脑区划分、脑龄/性别预测、跨站点泛化与 Harmonization、自监督预训练
样本总数 论文口径 1,414 名志愿者 / 35 个国际中心;FCP Classic 实际托管 1,288 例 / 24 站
数据格式 NIfTI(部分集合含 DICOM)+ 表型 CSV
许可证 数据版权归各贡献站点;注册后非商业研究无限制使用
访问级别 注册后开放(NITRC 注册 + INDI 项目申请);Amazon S3 通道匿名可取
DUO 标签 官方未发布 DUO 标注;按使用条款等效于 NPUNCU(非商业非营利)
语言 英文(文档与元数据);受试者分布于多语言国家
首发日期 2009-12-11
最后更新 INDI 系列持续扩容(NITRC 新闻流 2024-06 仍有新 Release 公告)
发布机构 INDI(International Neuroimaging Data-sharing Initiative)、NITRC、Child Mind Institute
官方主页 fcon_1000.projects.nitrc.org
下载地址 NITRC 项目页、S3 bucket
DOI 无官方数据集 DOI;引用原始论文 DOI 10.1073/pnas.0911855107
引用次数 2,500+(Scopus,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— NIfTI 即取即用、PCP 预处理衍生丰富;扣分项:无官方划分、无临床标签、扫描参数跨站异质需自行对齐
页面状态 published

§0 E-E-A-T 信任声明与免责声明

  • 医学审核者:千方病案医学编辑部(神经影像方向编辑)交叉审核:§2 医学背景(静息态 fMRI 与功能连接组科学基础)、§7 偏倚分析。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。FCP-1000 要求用户在 NITRC 注册并通过 INDI 项目访问申请,数据仅限非商业研究使用,发表成果时须引用原始论文(Biswal et al., 2010, PNAS)及相应贡献站点。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? 2009 年 12 月 11 日,一批神经科学家做了一件当时看来激进的事:把自己实验室里锁在硬盘上的静息态 fMRI 数据——健康人闭眼躺着扫描约 6-10 分钟的脑成像——毫无保留地公开到网上。这就是 FCP-1000:来自 35 个国际中心、1,414 名志愿者的静息态功能磁共振数据集,是神经影像历史上第一个"千例级"开放共享项目(Biswal et al., 2010, PNAS)。

为什么重要? 在它之前,一篇脑成像论文通常只报告十几到几十人;在它之后,“数据聚合 + 公开共享"成为神经科学的基本范式。Biswal 等人用这批数据证明:不同国家、不同扫描仪、不同参数独立采集的静息态数据,可以聚合出高度一致的大脑功能连接"底图”,并且年龄与性别真实地刻印在连接模式中。它直接催生了 ABIDE、ADHD-200、CoRR 等 INDI 系列数据集——包括今天千方医数集收录的同系条目。

我能用它做什么? 训练和测试功能连接估计算法(ICA、脑区划分、连接矩阵估计)、构建脑龄或性别预测的 normative 模型、为疾病分类模型寻找健康的对照底座、评测你的模型在跨站点数据上的泛化能力,或者为 fMRI 基础模型做大规模自监督预训练。注意:它不含疾病标签——需要病例对照数据请使用 ABIDE(自闭症)或 ADHD-200(注意缺陷多动障碍)。

§1.1 技术摘要

FCP-1000 的构建方式是"回溯性聚合":组织者向全球实验室征集其既往独立采集的静息态 fMRI 数据(健康志愿者闭眼静息扫描),统一匿名化后按共同目录结构整理,于 2009-12-11 通过 NITRC 一次性发布。论文口径为 1,414 名志愿者、35 个中心;实际以 FCP Classic 形式托管 1,288 例、24 个站点,年龄跨 18-80 岁(Kennedy et al., 2016, NeuroImage)。各站点扫描参数刻意保留原始状态:TR 从 1.8 s 到 3.0 s 不等,时间点数从 105 到 295 不等,层数 33-47。项目发布原始 NIfTI/DICOM 数据与少量预处理脚本(运动校正、6 mm FWHM 平滑、12 DOF affine 配准至 MNI152),但不做统一预处理;衍生生态由 Preprocessed Connectomes Project(PCP)以 CCS、C-PAC、DPARSF、NIAK 四条管线补齐。每个受试者的表型信息仅为年龄、性别、利手——这是匿名化与共享伦理权衡的结果。2010 年项目升级为 INDI(International Neuroimaging Data-sharing Initiative),成为 ABIDE、ADHD-200、CoRR、NKI-Rockland 等系列数据集的母体,数据通道扩展至 Amazon S3 公开 bucket(fcp-indi)。

§1.2 战略价值

维度一:开放神经影像的范式原点。 FCP-1000 证明了"竞争前共享"在脑科学中可行且高产——35 个实验室在无任何协调采集协议的前提下贡献数据,最终产出了一篇 Scopus 引用 2,500+ 的旗舰论文(截至 2026-09)。它建立的"注册-申请-免费非商业使用"流程、按站点组织的目录规范与 NITRC/S3 双通道分发模式,被此后几乎所有大型神经影像数据集(ABIDE、ADHD-200、CoRR、NKI-RS,乃至方法上更深的 HCP)继承或对标。对今天的研究者,理解 FCP 就是理解整个开放神经影像生态的历史起点与数据血缘上游。

维度二:健康大脑的 normative 底座与跨站点试验床。 对 AI 工程师,FCP-1000 提供了两件稀缺资产。其一是健康人群的大规模静息态数据:训练脑龄回归、性别分类、个体指纹(connectome fingerprinting)等 normative 模型时,它是天然的训练底座与对照池。其二是"真实世界级"的参数异质性:24 个站点的 TR、时间点数、层数、厂商各不相同——这恰恰是临床落地时无法回避的挑战。用它做 leave-one-site-out 泛化评测、ComBat 类 Harmonization 研究、站点混杂消融,比在单一中心精修数据上得出的结论更具外部效度。IEEE 文献综述明确将 FCP 描述为该领域新方法的"公共试验床(common test bed)"(IEEE Xplore 综述)。

§1.3 同类数据集横向对比

数据集 规模 模态 标注/标签 与 FCP-1000 的差异化
FCP-1000(本条目) 1,414 人 / 35 中心(Classic 托管 1,288 例 / 24 站) R-fMRI + 部分 T1 仅年龄/性别/利手 健康队列;首个千例级开放共享;参数异质保留原貌
ABIDE I/II I 期 1,112 数据集(539 ASD + 573 对照)/ 17 站 R-fMRI + T1 + 表型 ASD 诊断 疾病对照设计;FCP 的 INDI 系列兄弟项目(详见千方 ABIDE 条目)
ADHD-200 全样本 973(947 有标签)/ 8 站 R-fMRI + T1 + 表型 ADHD 三分类 儿童青少年精神疾病数据;FCP 的 INDI 系列兄弟项目(详见千方 ADHD-200 条目)
CoRR 1,652 名受试者 R-fMRI(多重复会话) 重测可靠性设计 专攻信度与可重复性;沿用 FCP 发布体系
HCP S1200 1,206 名受试者 R-fMRI + 任务 fMRI + dMRI + MEG 行为与遗传丰富表型 统一协议同型扫描仪采集、质量极高但人群窄(22-35 岁兄弟姐妹家系);获取需接受受限数据条款

§1.4 版本时间轴

时间 事件 说明
2009-12-11 FCP 首批数据发布 经 www.nitrc.org/projects/fcon_1000/ 公开静息态 fMRI 数据(Biswal et al., 2010)
2010-03-09 Biswal et al. PNAS 论文发表 聚合分析 1,093 例 / 24 站,确立跨站点聚合可行性(PNAS 107(10):4734-4739)
2010 INDI 成立 FCP 升级为下一代共享计划,分 INDI-Retrospective 与 INDI-Prospective 两翼(NITRC 论坛公告)
2010-12-17 周年多数据集发布 Beijing Enhanced 180 人(R-fMRI+DTI,55 人含 IQ)、Beijing 睁闭眼 48 人、Beijing Short TR(TR=400 ms/2000 ms)、NYU IPN 首批 49 名成人(同上)
2011-2012 ADHD-200、ABIDE 陆续发布 INDI-Retrospective 旗帜项目(详见千方对应条目)
2013 前后 PCP 预处理衍生上线 CCS/C-PAC/DPARSF/NIAK 四管线版本开放(preprocessed-connectomes-project.org)
2014-2016 数据迁入 Amazon S3 公开 bucket OHBM hackathon 将 CoRR/ABIDE/ACPI/ADHD-200 及部分 NKI-RS 上传至 fcp-indi bucket(O’Connor et al., 2016, GigaScience)
2024-06 INDI 新闻流仍在更新 NKI-Rockland 等数据集新 Release 持续公告(NITRC RSS)

§1.5 典型应用场景

  1. 功能连接估计方法的基准评测:24 站点参数各异的真实数据是检验 ICA、种子相关、度中心性等估计器稳健性的天然考场;IEEE 综述将 FCP 列为领域方法的标准试验床(IEEE Xplore)。
  2. 脑龄与性别预测(normative modeling):健康队列 + 年龄 18-80 岁,适合建立脑形态-功能规范模型,再迁移到疾病数据上检测偏离。
  3. 跨站点泛化与 Harmonization 研究:leave-one-site-out 评测、ComBat/深度 Harmonization 消融——站点效应即现成的"自然实验变量"。
  4. 脑区划分与 ICA 模板构建:千例级聚合是生成可复用 atlas(如 CC200/CC400 类 parcellation)与 ICN 模板的理想原料。
  5. fMRI 基础模型自监督预训练:数千例 4D NIfTI 免费可取,可作为大规模预训练的补充语料,再向小样本临床数据微调。

§2 医学背景

§2.1 疾病与人群分类映射表(ICD-11)

FCP-1000 是健康志愿者方法学数据集,不含疾病诊断标签,因此没有疾病特异性 ICD-11 编码。下表按"研究主题"给出其在疾病分类体系中的定位说明,供建库与检索使用:

标签 ICD-11 编码 SNOMED CT 说明
健康志愿者队列 不适用(无疾病编码) 不适用 全部受试者为健康人;数据集定位为方法学与 normative 资源
脑结构与功能研究 不适用 脑部解剖属 SNOMED 解剖结构轴 涉及全脑静息态功能网络,不指向特定疾病
精神障碍研究背景 第 6 章(精神、行为或神经发育障碍,章节级) 不适用 FCP 作为健康对照底座,服务于 ABIDE(自闭症)、ADHD-200 等疾病数据集的对照分析;疾病编码见对应条目

§2.1b SNOMED CT 映射说明

静息态功能连接组不是临床诊疗概念,SNOMED CT 中没有"functional connectome"的直接编码。工程实践中的映射策略是:以"脑(解剖结构)+ 功能磁共振成像(操作)"两条概念轴组合表达。若你的知识库需要严格编码,建议在入库层使用数据集原生字段(modality=R-fMRI、cohort=healthy),不要硬造 SNOMED 映射——错误映射比缺省更危险。

§2.2 疾病/科学背景简介

静息态功能磁共振成像(R-fMRI)测量的是人在闭眼静息时血氧水平依赖(BOLD)信号的自发低频波动(<0.1 Hz)。功能相关脑区之间的这些波动存在时间相关性,即"功能连接";全部连接的集合构成个体的"功能连接组"(functional connectome)(Biswal et al., 2010)。静息范式无需任务设计,对儿童、失语、痴呆等难以配合任务的群体天然友好,且同一数据可反复挖掘——这是它成为大规模共享首选模态的原因。

Biswal 等人在 FCP 首批数据上回答了三个奠基性问题:第一,不同中心独立采集的数据能否聚合?答案是肯定的——SCA(种子相关分析)与 ICA 均复现出一致的网络拓扑;第二,连接组是否存在普遍架构?正性与负性功能连接的宏观模式跨站点高度一致,同时个体间差异位点也稳定可循;第三,哪些因素塑造个体差异?年龄与性别是最显著的统计学决定因素(同上)。这些结论将 R-fMRI 从"实验室现象"提升为"可聚合的定量表型",为影像遗传学、发育与病理生物标志物研究打开了大门。

流行病学层面,FCP 覆盖健康人群 18-80 岁(FCP Classic 口径),各站点以大学生与社区成人为主;它与疾病数据集(ABIDE、ADHD-200)构成"健康底座 + 病例对照"的完整拼图。

§2.2b 静息态 fMRI 衍生度量词典

FCP/PCP 生态中反复出现的衍生指标,建模前务必分清其定义与去噪依赖:

度量 层级 定义一句话 对去噪策略的敏感性
ALFF / fALFF 体素 低频(0.01-0.1 Hz)波动幅度(标准化比值) 对带通与 GSR 敏感
ReHo 体素/簇 邻近体素 BOLD 的时间一致性(KCC) 对平滑核敏感
VMHC 体素 左右半球镜像体素的连接同质性 需对称模板配准
度/特征向量中心性 体素 全脑连接图中的节点重要性 对 GSR 敏感(负连接被抑制)
SCA(种子相关) ROI 指定种子与全脑的相关图 对种子定义与噪声回归敏感
Dual regression ICN 网络 以模板 ICN 空间回归得到的个体网络图 对模板选择敏感

(定义与依赖关系依据 PCP Functional Preprocessing 文档。)

§2.3 临床任务定义

FCP-1000 不提供临床筛查/诊断/分级/预后任务的金标准标签。社区基于它定义的方法学任务包括:

任务 输入 输出 在 FCP 上的形态
性别分类 功能连接矩阵 二分类 健康二分类基准,检验连接组信息量
脑龄回归 功能/结构特征 连续年龄 normative 模型训练,供疾病数据检测"脑龄偏离"
网络分解 4D BOLD 空间 ICN 模板 跨站点 ICA 一致性评测
个体识别 分会话连接矩阵 相同/不同人 connectome fingerprinting 信度研究
站点分类 连接矩阵 站点标签 站点效应量化与 Harmonization 评估

§2.4 受试者人群表

维度 描述 来源
来源人群 各中心既往研究招募的健康志愿者 Biswal et al., 2010
采集时间 各站点项目启动前独立采集;2009-12-11 聚合首发 同上(Data Availability)
年龄 FCP Classic 全库 18-80 岁;各站点子集更窄(如 Beijing 18-26 岁、Baltimore 20-40 岁) NITRC-IR 论文、NITRC wiki
性别 跨站不均衡:Beijing 76M/122F、Bangor 20M/0F、Cambridge 约 123F NITRC wiki FCPClassic
种族/民族 未系统记录(匿名化表型仅年龄/性别/利手) IEEE 综述
就医类型 不适用(健康社区人群,非患者) 同上

§2.5 临床价值定位

FCP-1000 的临床价值是间接但基础的:它提供"健康长什么样"的参照系。疾病研究(自闭症、ADHD、抑郁症)中发现的连接异常,都需要与健康的分布比较才能定义"异常";脑龄模型需要健康数据训练才能在患者上计算偏离度;跨站点机器学习的偏倚诊断需要在健康数据上先行验证。换言之,FCP 不是用来诊断的,而是用来定义"正常"的——这是它写入神经影像史册的方式。

§2.6 金标准与参考分析

维度 内容
划分方式 无官方划分;Biswal 2010 论文按"全库聚合 + 跨站点一致性验证"组织分析
标注方式 无临床标注;表型(年龄/性别/利手)由各站点临床评估后匿名化汇总
标注者资质 各站点研究团队按当地 IRB 规范采集与记录健康筛查信息
参考分析 论文用 SCA 与 ICA 在 1,093 例 / 24 站复现一致网络架构;年龄、性别效应经跨站点检验(Biswal et al., 2010)
外部对照 Tomasi & Volkow 在 22 个 FCP 数据集 / 979 例上验证功能连接密度(FCDM)的空间恒定性(PNAS 107(21):9885)

§3 数据集规格

§3.0 版本抉择矩阵

FCP-1000 生态内存在多个"形态"的数据入口,按需求选择:

你的需求 推荐版本 大小 理由
复现 2009 论文口径的原始聚合分析 FCP Classic(NITRC 分卷下载) 分站点 tar 分卷(Beijing 分 5 个 part) 与论文一一对应的原始站点集合
不想注册、想立即批量拉取 Amazon S3 公开 bucket(s3://fcp-indi/data/Projects/) 匿名逐对象下载 免注册;AWS CLI/Cyberduck 直连,适合脚本化
需要已去噪的衍生指标(ALFF/REHO/VMHC/centrality) PCP 预处理系列 每受试者每衍生一个文件 四管线 × 四策略,逐文件 HTTP 取用,无需本地跑管线
需要 XNAT 数据库式管理 INDI-XNAT 虚拟机 需预留约 30 GB 以上空间 官方提供 VirtualBox 虚拟机,含数据库(NITRC wiki)
需要 BIDS 结构与 fMRIPrep 衍生 S3 内 ADHD-200/Rockland 等 RawDataBIDS 与 Outputs 路径 逐集合不同 INDI 系列部分集合已提供 BIDS 化与 fMRIPrep 输出(NeuroStars 讨论)

§3.1 模态详情

  • 静息态 fMRI(R-fMRI,核心模态):健康志愿者闭眼/静息采集的 4D BOLD 序列。跨站点参数保留原始状态:TR 1.8-3.0 s,单例时间点 105-295,层数 33-47(Tomasi & Volkow Table 2、NITRC wiki)。NYU_TRT 子集提供 3 次重复会话(TR 2.0 s、197 时间点/次),可直接做 test-retest 信度分析。
  • T1 加权结构像(部分受试者):如 Cambridge 站点 198 例配备 MP-RAGE T1(3T Trio,1.2 mm 各向同性体素规格见站点描述),支持结构-功能联合建模(中国科学院心理所论文方法部分)。
  • 后续扩展(INDI 系):Beijing Enhanced 等集合追加 DTI;NKI-Rockland 追加多频 TR 的 multiband 序列——这些属于 INDI 扩展集合,不计入 FCP Classic 口径。

§3.2 按站点样本数表

FCP Classic 具名站点集合(依据 FCDM 论文 Table 2 与 NITRC wiki,22 个可用数据集共 979 例用于该分析;站点全表见 FcpTable.html):

站点 样本数 性别(M/F) 年龄(岁) TR(s) 时间点
Baltimore 23 8/15 20-40 2.5 123
Bangor 20 20/0 19-38 2.0 265
Beijing 198 76/122 18-26 2.0 255
Berlin 26 13/13 23-44 2.3 195
Cambridge 198 75/123 18-30 3.0 119
Cleveland 31 11/20 24-60 2.8 127
Dallas 24 12/12 20-71 2.0 115
Leiden 31 23/8 20-27 2.2 215
Leipzig 37 16/21 20-42 2.3 195
Newark 19 9/10 21-39 2.0 135
New York A 59 40/19 20-49 2.0 192
New York B 20 8/12 18-46 2.0 175
NYU_TRT 27 10/17 22-49 2.0 197
Ontario 11 未记录 未记录 3.0 105
Orangeburg 20 15/5 20-55 2.0 165
Oulu 103 37/66 20-23 1.8 245
Oxford 22 12/10 20-35 2.0 175
Queensland 19 11/8 20-34 2.1 190
Saint Louis 31 14/17 21-29 2.5 127
Taipei A / Taipei B 14 / 8 未记录 未记录 2.0 295 / 175

(另有 MIT 站 38 例见 FCDM 论文;上表为该论文 Table 2 具参数子集。)

§3.3 数据格式表

格式 用途 说明
NIfTI(.nii/.nii.gz) 影像主格式 FCP Classic 与 S3 通道均以 NIfTI 分发(NITRC-IR)
DICOM 原始归档 INDI-Lite 目录内每受试者含 DICOM 与 NIFTI 两个子目录(NITRC wiki)
CSV 表型 每受试者一个 Phenotypic CSV(年龄/性别/利手)
tar 分卷 NITRC 打包 部分站点数据按 part 分卷(Beijing 分 5 个 part)
BIDS 部分集合 S3 上 ADHD-200/Rockland 等集合提供 RawDataBIDS 结构

§3.4 存储大小

官方未发布 FCP Classic 的单一总量数字,实际占用随选择站点与格式(DICOM 双份与否)浮动。可参考的锚点:Beijing 站点 NIfTI 分 5 个 part 打包下载;C-PAC 团队的预计算基准输出(4 种策略全量衍生)约为每人 333 GB 量级的磁盘预留(含两份输出副本,C-PAC appendix)。规划磁盘时建议:只取所需站点与模态,S3 逐对象下载天然支持按需子集。

§3.5 标注方式

无人工疾病标注。表型数据(年龄、性别、利手)由各站点在采集时记录、匿名化后随数据发布;INDI 侧的工作是统一目录与格式,而非补充标注。因此任何监督任务都需要使用者自行定义(性别/年龄/站点)或引入外部疾病数据集。

§3.6 标注者资质与一致性

不适用(无标注环节)。健康筛查与人口学记录由各站点按当地规范执行;各站点为发表论文级研究团队(站点 PI 包括 Pekar、Colcombe、Zang 等领域学者,见 NITRC wiki FCPClassic),筛查标准跨站不完全一致,使用时应视为"站点级独立队列"。

§3.7 采集周期

数据为各站点既往独立采集的回溯性汇总,无统一采集窗口;项目层面以 2009-12-11 为首发里程碑,此后经 INDI 以"季度/月度"节奏持续纳入新集合(NYU IPN 计划每季度上传 25-50 例,NKI-Rockland 自 2010-10-08 起每周上传 5-7 例,NITRC 论坛公告)。

§3.8 地域覆盖

站点分布于北美、欧洲、亚洲与澳洲:美国(Baltimore、Cambridge/MIT、Cleveland、Dallas、Newark、New York、Orangeburg、Saint Louis)、加拿大(Ontario)、英国(Bangor、Oxford、Cambridge)、德国(Berlin、Leipzig)、荷兰(Leiden)、芬兰(Oulu)、中国(Beijing)、中国台北(Taipei)、澳大利亚(Queensland)等(Tomasi & Volkow Table 2)。

§3.9 设备规格

跨站点设备与序列为"自然异质"状态:场强以 3T 为主(如 Cambridge/Oulu 等 Siemens 3T Trio),TR 1.8-3.0 s、时间点 105-295、层数 33-47,EPI 体素约 3-4 mm 量级(站点间不同)。INDI 官方不提供统一的设备登记表,精确参数需逐站点读取 NIfTI 头文件——这正是 §6 中预处理管线的第一个输入。

§3.10 深度溯源链

  1. 采集层:35 个国际中心各自的研究项目(当地 IRB 批准 + 知情同意)。
  2. 聚合层:FCP 组织者(Milham 等)统一匿名化、按站点组织目录(门户 Credits)。
  3. 托管层:NITRC 项目页与 fcon_1000 门户网站(NITRC + Child Mind Institute 运维)。
  4. 分发层:NITRC 分卷下载 / INDI-XNAT 虚拟机 / Amazon S3 公开 bucket(fcp-indi)。
  5. 引用层:使用成果须引用 Biswal et al., 2010, PNAS 与相应贡献站点。

§4 数据结构

§4.0 目录树

INDI-Lite 发行结构(每受试者一目录;NITRC wiki):

fcon_1000/
├── {SiteName}/                     # 站点名,如 Beijing、Cambridge
│   ├── {SubjectID}/                # 受试者目录,如 Beijing_sub00887
│   │   ├── {SessionID}/            # 会话目录(部分受试者多次会话)
│   │   │   ├── DICOM/              # 原始 DICOM 序列
│   │   │   ├── NIFTI/              # NIfTI 影像(R-fMRI 4D + T1 3D)
│   │   │   │   ├── {SubjectID}_rest.nii.gz
│   │   │   │   └── {SubjectID}_anat.nii.gz
│   │   │   └── Phenotypic/         # 表型 CSV(年龄/性别/利手)
│   │   │       └── {SubjectID}.csv
│   ├── ...
├── NYU_TRT/                        # test-retest 子集:每人 3 次会话
└── scripts/                        # 官方预处理脚本(运动校正/平滑/MNI152 配准)

S3 通道的 INDI 标准结构(bucketname/data/Projects/{ProjectName}/{DataType};O’Connor et al., 2016):

s3://fcp-indi/data/Projects/
├── ADHD200/
│   ├── RawDataBIDS/                # BIDS 化原始数据
│   │   ├── NYU/  KKI/  OHSU/  Peking_1/ ...
│   │   │   └── sub-XXXXXXX/ses-1/{anat,func}/
│   └── Outputs/fmriprep/           # fMRIPrep 衍生(smoothAROMAnonaggr 等)
├── ABIDE_Initiative/Outputs/{pipeline}/{strategy}/{derivative}/
├── RocklandSample/RawDataBIDSLatest/
└── ...                             # CoRR、ACPI 等集合

§4.1 DAIMS 字段字典

核心表:受试者级表型 CSV + 影像文件清单的合并视图(8 列):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SubjectID string 受试者唯一标识(站点前缀 + 编号) Beijing_sub00887 主键;连接/表型对齐 无(官方统一命名) 不适用 全库唯一
Site string 采集站点 Beijing 站点效应控制、leave-one-site-out 无 不适用 24 站点名
Age float 采集时年龄(岁) 24 脑龄回归、协变量 站点自报精度不一 空/NaN = 未记录 18-80
Sex string/编码 性别 M / F 性别分类、分层 站点编码不统一(1/2 或 M/F) 空 = 未记录 {M,F} 或
Handedness string 利手 R 协变量(少数站点缺失) 站点自报 空 = 未记录
TR float 重复时间(s),自 NIfTI 头读取 2.0 频域标准化、滤波设计 以头文件为准 不适用 1.8-3.0
Timepoints int 4D 体数(时间点) 255 有效时长与 scrubbing 预算 无 不适用 105-295
NIfTI 路径 string 影像文件相对路径 NIFTI/{SubjectID}_rest.nii.gz DataIndex 构建 无 不适用 文件存在性

§4.2 标签分布

以性别为例(FCDM 论文 Table 2 口径的 22 数据集子集):女性占比整体偏高(如 Beijing 122/198、Cambridge 123/198),但站点间极端分化——Bangor 全为男性(20/20)、Oulu 女性占 63%、Leiden 男性占 74%。年龄上,多数站点为 18-30 岁的年轻成人,Cleveland(24-60 岁)、Dallas(20-71 岁)、Baltimore(20-40 岁)等站点提供中老年延伸。任何跨站合并训练都必须显式建模这两个分布。

§4.3 关键统计

  • 论文口径 1,414 例 / 35 中心;Classic 托管 1,288 例 / 24 站(NITRC-IR)。
  • 单例有效时长跨度约 3.5-10.2 分钟(时间点 105-295 × TR 1.8-3.0 s),直接影响连接矩阵的信噪比预算。
  • NYU_TRT 提供每例 3 次会话(共 27 例),是库内唯一的重复测量子集。

§4.4 数据层级

项目(FCP/INDI)
└── 站点(24 个 Classic 站点)
    └── 受试者(SubjectID 唯一)
        └── 会话(通常 1 次;NYU_TRT 3 次)
            └── 序列(R-fMRI 4D、T1 3D)
                └── 卷(时间点)/ 切片

§4.5 缺失值与信息性缺失

缺失情形 编码形态 工程处理建议
站点未记录人口学(Ontario、Taipei A/B) 表型字段留空 合并时保留"缺失即信息"标志位;勿默认填充均值
表型列名跨站不统一 同义列(sex/gender) 建立列名归一化映射后再 concat
部分站点无 T1 目录缺 anat 序列 按文件存在性生成模态掩码,结构-功能分析仅用有 T1 子集
年龄以区间报告的站点 区间字符串 解析为中点 + 区间宽度双列,避免类型报错

§5 数据划分与使用建议

§5.1 官方划分

无。FCP-1000 是资源型数据集,官方只提供站点集合,不提供任何 train/val/test 划分或比赛协议。

§5.2 社区惯例划分

  • leave-one-site-out(LOSO):每次以一个站点为测试集,其余为训练集——跨站点泛化的标准协议,也与 ADHD-200 竞赛的站点式划分传统一致。
  • 跨站点随机分层:按受试者随机划分、以站点做分层抽样;适合方法内部比较,但泛化结论弱于 LOSO。
  • test-retest 设计:用 NYU_TRT 的 3 次会话做"会话 1 训练、会话 2/3 测试",检验模型信度。

§5.3 泄漏风险(重点)

  1. 同一受试者多次会话跨集:NYU_TRT 每人 3 次会话;若按"扫描"为单位随机划分,同一人的会话会同时落入训练与测试集,性能虚高。必须按 SubjectID 分组划分。
  2. 站点与设备完全共变:受试者嵌套于站点,站点嵌套于设备与协议。随机划分下模型可以靠站点指纹作弊;诊断"站点可分性"应作为任何连接组模型的前置 sanity check。
  3. 血缘重叠:ABIDE 等后续数据集的部分对照站点与 FCP 站点存在历史血缘(如纽约大学系统)。把 FCP 当预训练底座、ABIDE 当下游测试时,需人工核对站点重叠,防止同一队列的近亲样本跨集。

§5.4 交叉验证建议

推荐嵌套协议:外层 LOSO(泛化)+ 内层受试者级 5 折(调参);所有标准化(如 Fisher z、ComBat 参数)仅在训练折内估计。性别分类等二分类任务报告 AUC 与 balanced accuracy,并附站点级分解。

# 嵌套划分最小实现:外层 leave-one-site-out + 内层受试者级 5 折
import numpy as np
import pandas as pd
from sklearn.model_selection import GroupKFold

def nested_site_splits(pheno: pd.DataFrame):
    """yield (train_idx, test_idx)——外层按站点,内层按受试者分组。"""
    for site in sorted(pheno["site"].unique()):
        test_mask = pheno["site"] == site
        train = pheno[~test_mask]
        gkf = GroupKFold(n_splits=5)
        for tr_sub, _ in gkf.split(train, groups=train["subject"]):
            train_idx = train.index[tr_sub]
            test_idx = pheno.index[test_mask]
            yield train_idx, test_idx

# 用法:for tr, te in nested_site_splits(pheno_df): ...
# 要点:内层 GroupKFold 以 subject 分组,杜绝同人跨折(坑点 3 的内层版本)

§5.5 外部验证建议

FCP 训练的 normative 模型应优先在 ABIDE/ADHD-200 的对照子集上验证迁移性(同为 INDI 发布体系、格式相近),再考虑 HCP(协议统一但人群不同)。反向路径(疾病数据训练 → FCP 测试)可作为"健康分布回归"的检验。


§6 AI 就绪指南

§6.0 云端快速启动

FCP/INDI 数据在 AWS 公开 bucket 匿名可读,无需账号即可在任意 EC2/SageMaker 实例上直接挂载分析:

# 预检:无需凭证即可列出对象(--no-sign-request 匿名访问)
aws s3 ls s3://fcp-indi/data/Projects/ --no-sign-request

# 最小子集试水:仅拉取 ADHD-200 的 BIDS 表型文件(数 MB)
aws s3 cp s3://fcp-indi/data/Projects/ADHD200/RawDataBIDS/NYU_phenotypic.csv . \
  --no-sign-request

# 防火墙严格的内网环境可追加 --no-verify-ssl(官方文档给出的参数)
aws s3 cp s3://fcp-indi/data/Projects/ADHD200/RawDataBIDS/NYU_phenotypic.csv . \
  --no-sign-request --no-verify-ssl

机构防火墙与 Cyberduck 匿名登录的已知坑见 §6.5 坑点 5、坑点 6。

§6.1 快速上手

以下代码假设你已经通过 §6.2 获取了若干站点的 NIfTI 数据,目录结构如 §4.0 所示({data_root}/{Site}/{SubjectID}/{SessionID}/NIFTI/*.nii.gz)。data_root 为数据根目录拼接点;最小可用子集建议从 Beijing(198 例、参数规整)或 NYU_TRT(信度分析)开始。

# 快速上手:扫描 FCP 数据目录,构建 (subject, site, nifti_path, TR, timepoints) 索引
# 预期目录结构(INDI-Lite):
#   data_root/
#     Beijing/Beijing_sub00887/session_1/NIFTI/*.nii.gz
#     Cambridge/Cambridge_sub00889/session_1/NIFTI/*.nii.gz
import nibabel as nib
from pathlib import Path

def build_index(data_root: str) -> list:
    """遍历 data_root,返回受试者级元数据索引(最小可用子集:单会话 R-fMRI)。"""
    rows = []
    for nifti in sorted(Path(data_root).rglob("*.nii.gz")):
        name = nifti.name.lower()
        if "rest" not in name:          # 只要静息态序列
            continue
        site = nifti.relative_to(data_root).parts[0]
        subject = nifti.relative_to(data_root).parts[1]
        img = nib.load(nifti)            # 只读头文件,不加载全量数据
        rows.append({
            "subject": subject,
            "site": site,
            "path": str(nifti),
            "tr": float(img.header.get_zooms()[3]),
            "timepoints": int(img.shape[3]),
        })
    return rows

idx = build_index("./fcon_1000")
print(f"共索引 {len(idx)} 个 R-fMRI 序列,"
      f"站点数 {len({r['site'] for r in idx})}")

§6.2 数据获取

通道 前置条件 方式 适合场景
NITRC 分卷下载 NITRC 注册 + INDI 项目申请(姓名/机构/研究级别/邮箱/专长;通常数小时至 1 天内批准) 网页下载 tar 分卷(Beijing 分 5 part) 复现 Classic 论文口径
Amazon S3 无(匿名) aws s3 cp/ls --no-sign-request、Cyberduck、Boto 脚本 批量脚本化、云端分析
INDI-XNAT 虚拟机 NITRC 注册 VirtualBox 虚拟机(预留约 30 GB 以上) 本地数据库式管理
PCP 预处理衍生 无 逐文件 HTTP GET(URL 模板拼接,不支持通配符) 只要 ALFF/REHO/衍生矩阵
# 通道一:NITRC 注册后获取(申请页)
#   https://fcon_1000.projects.nitrc.org/indi/req_access.html
# 批准后从 FCP Classic 数据表逐站点下载 tar 分卷:
#   https://fcon_1000.projects.nitrc.org/fcpClassic/FcpTable.html

# 通道二:S3 匿名拉取整个站点(以 ADHD-200 BIDS 为例,INDI 家族演示)
aws s3 sync s3://fcp-indi/data/Projects/ADHD200/RawDataBIDS/KKI ./KKI \
  --no-sign-request --exclude "*" --include "*_rest*.nii.gz"

# 通道四:PCP 预处理衍生的逐文件 URL 模板(不支持通配符,逐文件 GET)
#   https://s3.amazonaws.com/fcp-indi/data/Projects/ABIDE_Initiative/Outputs/\
#   [pipeline]/[strategy]/[derivative]/[FILE_ID]_[derivative].[ext]
#   pipeline   = ccs | cpac | dparsf | niak
#   strategy   = filt_global | filt_noglobal | nofilt_global | nofilt_noglobal
#   derivative = alff | falff | reho | vmhc | lfcd | func_preproc | rois_cc200 | ...
#   .nii.gz 用于图类衍生;ROI 时序(rois_*)为 .1D 文本
# 表型聚合:把 S3 上各站点散落的 Phenotypic CSV 归一为一张总表
# 目标:subject, site, age, sex, handedness(§4.1 字典的落地形态)
import io
import urllib.request
import pandas as pd

S3 = "https://fcp-indi.s3.amazonaws.com/data/Projects"

def fetch_pheno(site: str, csv_name: str) -> pd.DataFrame:
    url = f"{S3}/{site}/{csv_name}"
    txt = urllib.request.urlopen(url, timeout=30).read().decode(errors="replace")
    df = pd.read_csv(io.StringIO(txt))
    df.columns = [c.strip().lower() for c in df.columns]     # 列名归一化(§4.5)
    out = pd.DataFrame({"site": site, "subject": df.iloc[:, 0].astype(str)})
    for src, dst in [("age", "age"), ("sex", "sex"), ("gender", "sex"),
                     ("handedness", "handedness")]:
        if src in df.columns:
            out[dst] = df[src].values
    return out

if __name__ == "__main__":
    # 示例:聚合两个站点的表型(文件名以站点实际发布为准)
    frames = []
    for site, csv_name in [("ADHD200/RawDataBIDS/NYU", "NYU_phenotypic.csv"),
                           ("ADHD200/RawDataBIDS/KKI", "KKI_phenotypic.csv")]:
        try:
            frames.append(fetch_pheno(site, csv_name))
        except Exception as exc:
            print(f"跳过 {site}: {exc}")     # 缺失站点保留日志,勿静默
    merged = pd.concat(frames, ignore_index=True)
    merged["sex"] = merged["sex"].map(lambda v: {"1": "M", "2": "F"}.get(str(v), str(v)))
    merged.to_csv("phenotypic_merged.csv", index=False)
    print(merged.groupby("site").size())
# 通道三:无 AWS CLI 环境用纯 Python 逐对象下载(S3 REST LIST + GET)
# 要点:bucket 不支持通配符,必须先 LIST(分页 marker)再逐 key GET
import urllib.parse
import urllib.request
import time
from pathlib import Path
import xml.etree.ElementTree as ET

S3_BASE = "https://fcp-indi.s3.amazonaws.com"
NS = "{http://s3.amazonaws.com/doc/2006-03-01/}"

def list_keys(prefix: str):
    """匿名 LIST 对象 key(每页 1000,marker 翻页)。"""
    marker, keys = "", []
    while True:
        q = {"prefix": prefix, "max-keys": "1000"}
        if marker:
            q["marker"] = marker
        url = f"{S3_BASE}/?{urllib.parse.urlencode(q)}"
        root = ET.fromstring(urllib.request.urlopen(url, timeout=60).read())
        contents = root.findall(f"{NS}Contents")
        keys += [c.find(f"{NS}Key").text for c in contents]
        if root.find(f"{NS}IsTruncated").text != "true":
            return keys
        marker = keys[-1]
        time.sleep(0.2)

def download(key: str, dest: Path, retries: int = 4):
    dest.parent.mkdir(parents=True, exist_ok=True)
    url = f"{S3_BASE}/{urllib.parse.quote(key, safe='/')}"
    for attempt in range(retries):
        try:
            with urllib.request.urlopen(url, timeout=120) as r, open(dest, "wb") as f:
                while chunk := r.read(1 << 20):
                    f.write(chunk)
            return
        except Exception:
            if attempt == retries - 1:
                raise
            time.sleep(2 ** attempt)   # 指数退避重试

if __name__ == "__main__":
    targets = [k for k in list_keys("data/Projects/ADHD200/RawDataBIDS/")
               if k.endswith("_T1w.nii.gz")][:50]     # 演示:先取 50 个
    for i, k in enumerate(targets, 1):
        download(k, Path("out") / k.split("RawDataBIDS/")[-1])
        print(f"[{i}/{len(targets)}] {k}")

§6.3 预处理全流程

FCP 官方只做极轻量的演示级脚本(运动校正、6 mm FWHM 平滑、12 DOF affine 配准 MNI152),生产级预处理需自建。以下给出"校验 → 去噪 → 配准 → 提时序 → 连接矩阵"的最小可运行链路(nilearn 路线):

# 预处理链路:从原始 4D NIfTI 到 200 节点功能连接矩阵
# 依赖:pip install nilearn nibabel numpy
import numpy as np
from nilearn import datasets, image
from nilearn.maskers import NiftiLabelsMasker
from nibabel import load

def load_and_validate(path: str) -> dict:
    """步骤 0:读取头文件做参数校验(跨站异质性入口)。"""
    img = load(path)
    tr, n_tp = float(img.header.get_zooms()[3]), int(img.shape[3])
    assert n_tp >= 100, f"时间点过少: {n_tp}"
    return {"tr": tr, "n_tp": n_tp, "img": img}

def connectivity_from_timeseries(ts: np.ndarray) -> np.ndarray:
    """步骤 4:ROI 时序 -> Fisher z 变换的 Pearson 连接矩阵。"""
    corr = np.corrcoef(ts.T)
    fisher_z = np.arctanh(np.clip(corr, -0.999, 0.999))
    np.fill_diagonal(fisher_z, 0)
    return fisher_z

def subject_connectome(path: str) -> tuple:
    """完整单例链路:校验 -> 去噪滤波(0.01-0.1 Hz)-> 提时序 -> 连接矩阵。"""
    meta = load_and_validate(path)
    atlas = datasets.fetch_atlas_schaefer_2018(n_rois=200, yeo_networks=7)
    masker = NiftiLabelsMasker(
        atlas.maps, labels=atlas.labels,
        standardize=True, detrend=True,
        low_pass=0.1, high_pass=0.01, t_r=meta["tr"],
    )
    ts = masker.fit_transform(path)          # (timepoints, 200)
    return connectivity_from_timeseries(ts), meta

if __name__ == "__main__":
    import glob
    demo = sorted(glob.glob("fcon_1000/Beijing/*/session_1/NIFTI/*rest*.nii.gz"))[:5]
    mats = [subject_connectome(p)[0] for p in demo]
    print("连接矩阵形状:", mats[0].shape, "| 上三角均值:",
          np.mean([m[np.triu_indices(200, 1)].mean() for m in mats]))

大规模生产请直接采用社区管线:PCP 提供 CCS/C-PAC/DPARSF/NIAK 四条预计算管线与 4 种去噪策略(filt_global/filt_noglobal/nofilt_global/nofilt_noglobal),衍生 ALFF/fALFF、REHO、VMHC、度/特征向量中心性、dual regression ICN 与 SCA 图,统一 3×3×3 mm、6 mm FWHM(PCP Pipelines);INDI 家族部分集合在 S3 提供 fMRIPrep 输出(NeuroStars)。

§6.4 PyTorch DataLoader

# PyTorch 数据集:受试者级功能连接矩阵 + 站点/性别/年龄标签
# 目录预期(与 §6.1 索引衔接):
#   data_root/{Site}/{SubjectID}/.../NIFTI/*rest*.nii.gz
#   phenotypic.csv 含列: subject, site, age, sex
# 最小子集:Beijing(198 例)即可完整跑通性别二分类
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader, WeightedRandomSampler

class FCPConnectomeDataset(Dataset):
    """功能连接组数据集:读取预计算连接矩阵缓存。

    用法:
      ds = FCPConnectomeDataset("phenotypic.csv", cache_dir="conn_cache")
      loader = make_loader(ds, batch_size=32)
    """
    def __init__(self, pheno_csv: str, cache_dir: str, n_rois: int = 200):
        self.df = pd.read_csv(pheno_csv).dropna(subset=["sex"])
        self.cache_dir = cache_dir
        self.n_rois = n_rois
        self.sex_map = {"M": 0, "F": 1, "1": 0, "2": 1}   # 兼容站点编码差异
        self.iu = np.triu_indices(n_rois, 1)              # 上三角索引

    def __len__(self) -> int:
        return len(self.df)

    def __getitem__(self, i: int):
        row = self.df.iloc[i]
        mat = np.load(f"{self.cache_dir}/{row['subject']}_conn.npy")  # (200, 200) Fisher z
        x = torch.from_numpy(mat[self.iu]).float()                    # (19,900,)
        y = torch.tensor(self.sex_map[str(row["sex"])], dtype=torch.long)
        age = torch.tensor([float(row["age"])], dtype=torch.float32)
        return x, y, age, row["site"]        # site 供 LOSO 划分与批次诊断

def make_loader(ds: FCPConnectomeDataset, batch_size: int = 32) -> DataLoader:
    # 性别不均衡时用加权采样(如 Bangor 全男性站点混入训练集)
    counts = ds.df["sex"].astype(str).map(ds.sex_map).value_counts()
    w = ds.df["sex"].astype(str).map(ds.sex_map).map(lambda v: 1.0 / counts[v])
    sampler = WeightedRandomSampler(w.values, num_samples=len(ds), replacement=True)
    return DataLoader(ds, batch_size=batch_size, sampler=sampler)

§6.5 坑点 8 个

⚠️ 坑点 1:TR 与时间点跨站异质——频域与时长不可直接混算(分类:预处理陷阱)

问题:FCP 各站 TR 从 1.8 s 到 3.0 s、时间点从 105 到 295 不等。同一 0.01-0.1 Hz 带通对应不同的采样点数;单例有效时长从约 3.5 到 10.2 分钟不等,连接矩阵信噪比随之系统性变化。

症状:把全库矩阵混在一起统计时,"站点"成为最强预测因子;低 TR 站点的高频混叠伪影污染 ALFF 类指标;模型学到的其实是"这台机器的 TR"而不是脑。

解决:

  1. 简单方法:从 NIfTI 头文件逐例读取 TR/时间点入库(§6.1 索引脚本),所有滤波按时域频率而非固定点数设置;构建"有效时长"列并作为协变量。
  2. 进阶方法:时长截断对齐(如统一取前 5 分钟)后再估计连接矩阵,消除时长-信度混淆;或按站点分组做标准化。
  3. SOTA 方法:对频率相关指标(ALFF/fALFF)按各站 Nyquist 频率重采样到统一网格,或在回归框架内加入 TR 与时长交互项(参照 FCDM 论文对各站 tp/TR 的显式列表,PNAS 107(21):9885)。

参考:Tomasi & Volkow 2010 Table 2;PCP 四管线差异表。

⚠️ 坑点 2:没有官方划分——随机划分让"站点指纹"偷分(分类:数据泄漏)

问题:FCP 无官方 train/test 划分。受试者完全嵌套于站点(站点→设备→协议三层共变),按扫描随机划分会让模型通过站点专属信号(扫描仪噪声、序列参数)预测标签。

症状:性别分类准确率在随机 10 折上轻松虚高,LOSO 一换就塌;查看特征重要性全是大脑边缘/背景区域(而非网络节点)。

解决:

  1. 简单方法:一律按 SubjectID 分组划分,先跑一个"预测站点"的 sanity check 量化指纹强度。
  2. 进阶方法:外层 leave-one-site-out + 内层受试者级 CV;训练折内估计 ComBat/标准化参数。
  3. SOTA 方法:站点对抗(gradient reversal)或站点无关表征学习,并在论文中同时报告 LOSO 与站点内两种口径(参照 INDI 系疾病数据集竞赛的站点式划分传统)。

参考:IEEE 综述对 FCP 无采集协调的转述;Biswal et al., 2010。

⚠️ 坑点 3:NYU_TRT 同人三会话——按扫描划分即同人泄漏(分类:数据泄漏)

问题:NYU_TRT 子集每名受试者含 3 次会话(TR 2.0 s、每次 197 时间点)。以"扫描"为采样单位随机划分,同一人的重复会话会分别落入训练与测试集。

症状:个体分类/指纹任务准确率异常亮眼;换成跨受试者任务立刻回落——因为模型做的是"认人"不是"辨性别"。

解决:

  1. 简单方法:GroupShuffleSplit/GroupKFold(group=SubjectID),同一人的所有会话永远同侧。
  2. 进阶方法:信度研究显式用会话 1 训练、会话 2/3 测试(test-retest 协议),并把 ICC 随任务指标一起报告。
  3. SOTA 方法:把会话间相关(self-similarity)作为样本权重或数据增强轴,做会话级 cross-fitting。

参考:Tomasi & Volkow 2010 Table 2(NYU_TRT 3 会话)。

⚠️ 坑点 4:表型只有年龄/性别/利手——别把 FCP 当临床数据集用(分类:标签理解)

问题:受匿名化与共享伦理限制,FCP 表型信息仅年龄、性别、利手,且个别站点(Ontario、Taipei A/B)连人口学都未记录。数据集不含任何临床诊断、认知分数或 IQ。

症状:想复现"脑-行为关联"时找不到协变量;把 FCP 混入疾病研究的对照组时无法匹配诊断排除标准。

解决:

  1. 简单方法:任务限定为人口学可定义的目标(性别/年龄/站点/信度);缺失人口学的站点仅用于无监督分析。
  2. 进阶方法:需要丰富表型时改用 INDI 系后续集合——Beijing Enhanced(55 例含 FS-IQ/V-IQ/P-IQ)或 NKI-Rockland(精神与认知全套),NITRC 论坛公告。
  3. SOTA 方法:疾病对照研究直接使用 ABIDE/ADHD-200(qianfanghub 已有专条),FCP 仅作健康 normative 参照。

参考:IEEE 综述对表型限制的说明。

⚠️ 坑点 5:NITRC 网站不稳定——下载通道要有 Plan B(分类:工程陷阱)

问题:fcon_1000 门户基于 NITRC 框架,历史上多次出现登录态失效、无法下载的报告(如 2022-10 tracker #10156,用户登录后无法保持会话,官方建议改走 S3)。Beijing 等热门站点还被切成 5 个 tar part,中断重试成本高。

症状:登录后点击下载跳回登录页;大文件下载中断后无法断点续传。

解决:

  1. 简单方法:同一数据在 S3 公开 bucket 有副本时优先 S3 匿名通道(--no-sign-request),逐对象天然可断点。
  2. 进阶方法:用 §6.2 的 Python LIST+GET 脚本带指数退避重试与"已下载跳过"逻辑,构建可恢复的批量下载。
  3. SOTA 方法:下载前先 LIST 汇总对象大小做磁盘预算;对 tar part 用分卷校验后再解压,避免半卷污染目录。

参考:NITRC tracker #10156;NITRC wiki FCPClassic。

⚠️ 坑点 6:Cyberduck 匿名登录 S3 失败——协议切换 workaround(分类:工程陷阱)

问题:官方推荐 Cyberduck 浏览 bucket,但其匿名登录 S3 有已知连接问题;机构防火墙还可能拦截 TLS 校验。

症状:Cyberduck 匿名登录报错卡死;aws s3 cp 在校园网报 SSL/防火墙错误。

解决:

  1. 简单方法:官方 workaround——Cyberduck 新建书签时先选 FTP 协议勾选 Anonymous Login,再切换为 Amazon S3 协议(ADHD-200 下载指引 PDF)。
  2. 进阶方法:命令行统一加 --no-sign-request;防火墙环境按官方指引追加 --no-verify-ssl(仅限数据公开只读场景)。
  3. SOTA 方法:在云端(EC2/SageMaker)直接跑下载与分析,绕开本地网络栈;用 Boto 官方 SDK 替代 GUI 工具实现可审计的下载日志。

参考:NATVIEW 下载 PDF(–no-verify-ssl 参数)。

⚠️ 坑点 7:PCP 四管线 × 四策略结果不可互比——引用衍生数据必须注明来源(分类:预处理陷阱)

问题:PCP 用 CCS/C-PAC/DPARSF/NIAK 四条管线处理,去噪策略(是否全局信号回归、是否带通)各不相同;NIAK 甚至不做 slice timing。同一个"ALFF"在不同管线-策略组合下数值分布不同。

症状:把不同管线输出的衍生指标混池训练,站点与管线效应纠缠;复现文献数字对不上(对方用了 filt_global 而你用了 nofilt_noglobal)。

解决:

  1. 简单方法:每次实验锁定单一 pipeline+strategy 组合,文件名/路径原样记录(URL 模板中 {pipeline}/{strategy}/{derivative} 三段)。
  2. 进阶方法:把管线×策略作为实验因子做敏感性分析(PCP 的设计初衷就是量化去噪决策的影响)。
  3. SOTA 方法:需要最新去噪时在 S3 的 fMRIPrep 输出上接 XCP-D 自定义后处理,并注意 fMRIPrep 输出默认未回归 GSR/WM/CSF——与 PCP 输出不可直接混用(NeuroStars 讨论)。

参考:PCP Functional Preprocessing;C-PAC preconfig 文档。

⚠️ 坑点 8:站点性别极端失衡——Bangor 全男、Beijing 女多(分类:偏倚陷阱)

问题:站点级性别分布极端:Bangor 20 例全男性、Leiden 男性 74%、Beijing/Cambridge 女性 62%。合并训练时性别信号与站点信号完全共变。

症状:性别分类器退化为站点分类器;分层评估发现某站点 AUC 接近 1 而另一站点接近随机。

解决:

  1. 简单方法:训练集内按性别分层采样(§6.4 的 WeightedRandomSampler),并报告站点级 AUC 分解。
  2. 进阶方法:剔除单性别站点后再训练性别分类;或在站点内标准化连接特征后再合并。
  3. SOTA 方法:站点混淆变量显式建模(混淆回归/对抗去偏),并评估"性别效应"与"站点效应"的方差分解。

参考:NITRC wiki FCPClassic 站点表;Tomasi & Volkow 2010 Table 2。

§6.6 数据增强

操作 判定 说明
时间窗随机裁剪(≥4 分钟窗) ✅ 安全 保留低频波动结构,等效增加样本
空间随机平移/旋转后重采样(小幅) ✅ 安全 1-2 mm 内扰动模拟配准误差
高斯噪声注入(时序 SNR >20 dB) ✅ 安全 提升对噪声鲁棒性
信号幅值缩放(per-volume) ✅ 安全 模拟强度归一化差异
时间轴反转 ❌ 危险 破坏 BOLD 血氧响应的因果时序结构
时间点乱序抽样 ❌ 危险 摧毁自相关,连接矩阵失义
随机体素 dropout ❌ 危险 制造伪缺失,污染 ROI 均值时序
大角度三维旋转(>10°) ❌ 危险 引入插值伪影并破坏 atlas 对齐

§6.7 模型推荐

模型类别 适用任务 输入形态 推荐理由与注意
线性/正则化回归(Ridge、ElasticNet) 脑龄、性别 上三角连接向量 连接组小样本高维首选基线;可解释
BrainNetCNN 性别/年龄 矩阵 边-节点卷积显式建模拓扑;参数量适中
3D CNN(含 ensemble) 体素级回归/分类 预处理 4D 衍生图 文献验证过大规模连接组预测(PMC6777738);注意显存
图神经网络(GCN/BrainGNN) 网络分类、个体识别 连接图 parcellation 当节点;警惕站点泛化
跨模态自编码器/Transformer 自监督预训练 ROI 时序或矩阵 FCP 适合作预训练语料之一;需与 HCP/UKB 混合扩规模
ICA/dual regression 网络分解 4D 原始 FCP 的经典用法;站点间 ICN 一致性检验

§6.8 硬件需求

场景 CPU RAM 磁盘 说明
单站点快速原型(nilearn 路线) 8 核 16 GB 约 100 GB Beijing 198 例即可跑通
C-PAC 基准管线(4 例并行) 12+ 核 约 56 GB 约 720 GB(含两份 333 GB 输出副本 + 55 GB 工作目录) 官方 benchmark 配置(C-PAC appendix)
全库连接矩阵生产 集群/HPC 每例约 14 GB 峰值 按需(只缓存矩阵则 <10 GB) 矩阵可缓存,原始 4D 不必常驻
深度模型训练 1× A100/40GB 级 32 GB 200 GB 矩阵输入为主,体素级需更多

§6.9 评估指标

# 评估套件:性别分类(AUC/balanced acc + 站点分解)、脑龄(MAE/r)、信度(ICC)
import numpy as np
import pandas as pd
from sklearn.metrics import roc_auc_score, balanced_accuracy_score

def eval_sex(y_true, y_prob, site) -> pd.DataFrame:
    """性别分类:总体 + 分站点(坑点 8 的分解报告)。"""
    y_true, y_prob = np.asarray(y_true), np.asarray(y_prob)
    rows = [{
        "scope": "overall",
        "auc": roc_auc_score(y_true, y_prob),
        "bal_acc": balanced_accuracy_score(y_true, (y_prob > .5).astype(int)),
    }]
    for s in pd.unique(site):
        m = site == s
        if len(set(y_true[m])) > 1:      # 单性别站点跳过
            rows.append({
                "scope": f"site={s}",
                "auc": roc_auc_score(y_true[m], y_prob[m]),
                "bal_acc": balanced_accuracy_score(y_true[m], (y_prob[m] > .5).astype(int)),
            })
    return pd.DataFrame(rows)

def eval_age(y_true, y_pred) -> dict:
    """脑龄回归:MAE 与 Pearson r。"""
    y_true, y_pred = np.asarray(y_true), np.asarray(y_pred)
    return {"mae_years": float(np.abs(y_true - y_pred).mean()),
            "pearson_r": float(np.corrcoef(y_true, y_pred)[0, 1])}

def icc_2_1(values: np.ndarray) -> float:
    """ICC(2,1):NYU_TRT 三会话信度(subjects × sessions 矩阵)。"""
    n, k = values.shape
    grand = values.mean()
    ms_r = ((values.mean(1) - grand) ** 2).sum() * k / (n - 1)
    residual = values - values.mean(1, keepdims=True) - values.mean(0) + grand
    ms_e = (residual ** 2).sum() / ((n - 1) * (k - 1))
    return float((ms_r - ms_e) / (ms_r + (k - 1) * ms_e))

§6.10 MLOps 笔记

  • 数据版本:以"通道 + 站点 + 下载日期"为版本键(如 s3-fcp-indi@2026-09、nitrc-classic@2026-09);FCP Classic 与 S3 副本可能存在集合差异,实验记录必须写明通道。
  • 特征存储:连接矩阵上三角(19,900 维 @ 200 ROI)约 160 KB/例 float32,全库矩阵缓存 <1 GB——优先缓存矩阵而非原始 4D。
  • 站点监控:把"站点可分性 AUC"作为生产模型的常设监控指标,站点漂移即再训练信号(对应 §7.6)。
  • 可复现:预处理统一走 C-PAC Docker(版本固定),或在仓库内 pin nilearn/nibabel 版本;PCP 衍生数据记录 pipeline/strategy/derivative 三元组。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
站点/设备效应 无统一采集协议,TR、时间点、厂商跨站异质 高 LOSO 评估;ComBat/Harmonization;参数协变量化
性别分布失衡 Bangor 全男(20/20)、Beijing 女 62%、Leiden 男 74% 高 分层采样;单性别站点剔除或单独报告
年龄分布集中 多数站点 18-30 岁学生样人群,中老年样本少 中 年龄分层加权;外推时声明适用域
人群代表性(WEIRD) 样本以欧美高校/社区健康志愿者为主,种族/民族未记录 中 谨慎跨人群外推;引用时明示人群局限
表型稀薄 仅年龄/性别/利手,无临床/认知变量 中 任务限定人口学目标;丰富表型改用 INDI 后续集合
选择性托管 论文口径 1,414 例/35 中心,Classic 实际托管 1,288 例/24 站 低 以官方 FcpTable 实际清单为准

§7.2 标注质量

无人工标注环节;表型由各站点自记、匿名化汇总,无统一跨站核查协议。性别编码不统一(1/2 与 M/F 并存)、个别站点人口学缺失(Ontario、Taipei A/B),使用前必须做列名归一化与缺失审计(见 §4.5)。

§7.3 泛化性

目标场景 失效风险 证据/机理
单中心临床数据 高 FCP 为健康志愿者、参数异质;直接迁移会遭遇分布与协议双重漂移
其他 INDI 数据集(ABIDE/ADHD-200) 中低 同发布体系、格式相近,但含患者群体与站点差异
HCP 类统一协议数据 中 协议统一但人群(22-35 岁家系)与 FCP 学生样人群不同
儿童青少年任务 高 Classic 主体为成人(18-80 岁,主体 18-30);儿童数据请用 ADHD-200/ABIDE
跨厂商迁移 中 厂商与站点共变;需 Harmonization 中转

§7.4 伦理与合规

数据在各站点按当地 IRB 批准与知情同意采集,发布前完全匿名化:无姓名、无出生日期、无直接标识符,表型仅年龄/性别/利手(IEEE 综述)。使用条款:注册后非商业研究无限制使用;再分发与公开发表须遵循官方条款并引用 Biswal 2010 与贡献站点。禁止任何试图重标识受试者的分析。

§7.5 公平性

FCP 的多国站点是天然的多人群实验室,但种族/民族变量未记录,无法做正式的公平性审计。性别分析需警惕站点-性别共变(坑点 8);年龄维度上 18-30 岁过采样,中老年结论应降权。为公平性研究使用 FCP 时,建议以"站点"作为社会经济与文化差异的代理分层,并在论文中明示该代理的局限。

§7.6 数据漂移

FCP 天然携带三类漂移:采集参数漂移(TR/时间点/厂商)、站点批次漂移(各站点独立招募与筛查)、时间漂移(INDI 持续纳入新集合,如 NKI-RS 按周增量上传)。跨年度混用数据时,先做参数分布对比与站点指纹检测;对持续更新的集合(NKI-RS Release 制),以 Release 号冻结实验版本。

§7.7 DAIMS 数据质量评估

# 检查项 状态 说明
1 宽格式支持 ✅ 表型 CSV 可平铺合并;影像以文件清单宽表索引
2 唯一标识 ✅ 站点前缀 + SubjectID 全库唯一
3 特殊字符处理 ⚠️ 站点名/文件名跨集合大小写与连字符不完全统一,需归一化
4 重复行检查 ✅ SubjectID+SessionID 联合唯一(NYU_TRT 多会话除外,属设计使然)
5 缺失编码 ⚠️ 空值/NAN/留空混用,无官方统一缺失编码文档
6 标签标识 ❌ 无疾病标签(设计使然,非缺陷)
7 罕见类分组 ❌ 无类别型诊断标签可分组
8 偏倚评估 ✅ 站点/性别/年龄偏倚文献记录充分(Biswal 2010、站点表)
9 数据字典 ⚠️ INDI-Lite 结构有 wiki 说明,但字段级字典需自行从文件头提取
10 信息性缺失解释 ✅ Ontario/Taipei 人口学缺失属站点未记录,语义明确
11 设备记录 ❌ 无统一设备登记表,参数需逐例读头文件
12 共线性风险 ⚠️ 站点与设备/参数完全共变,建模须去混淆
13 编码映射 ⚠️ 性别编码跨站不统一(1/2 vs M/F)
14 时间戳处理 ⚠️ 无采集时间戳列(匿名化取舍),时序分析仅靠序列元数据
15 划分建议 ⚠️ 官方无划分;社区 LOSO 惯例成熟但需自建
16 泄漏讨论 ✅ 本 Wiki §5.3 与坑点 2/3 给出系统处理
17 标签分布 ✅ 性别/年龄分布可由表型直接审计(§4.2)
18 测量偏倚 ✅ TR/时长异质已有量化文献(FCDM Table 2)
19 外部验证建议 ✅ INDI 家族内(ABIDE/ADHD-200)验证路径明确
20 版本记录 ⚠️ Classic 一次性发布;INDI 扩展集合版本散见论坛/新闻流,无统一 changelog
21 预处理脚本 ✅ 官方演示脚本 + PCP 四管线 + C-PAC 开源
22 合规要求 ✅ 注册 + 非商业条款明确(NITRC wiki)
23 多模态对齐 ⚠️ 部分 T1 缺失,结构-功能对齐仅限有 T1 子集
24 去标识化 ✅ 匿名化彻底(无姓名/生日/ID 链接),表型最小化

DAIMS 评分:14.5 / 24

评分解读:作为一个 2009 年启动、以"开放优先"为使命的数据集,FCP-1000 在去标识化、合规、可获取性(多通道分发)与偏倚透明度上表现优秀;失分点集中在"无标签、无统一设备记录、编码不统一、无官方划分"——这些多数是回溯性聚合设计的历史必然,而非运维缺陷。对方法学研究它是 4 星级底座;对依赖丰富标注的临床建模任务,它只是参照系而非训练集。

对你意味着什么:(1)跑任何监督任务前,先花半天做"站点指纹 + 性别分层"体检(§6.9 代码可直接用),能帮你避开论文被拒最常见的两个坑;(2)把 FCP 定位为预训练/normative 底座与泛化考场,临床问题转用 ABIDE/ADHD-200 并回链 FCP 做健康对照;(3)所有实验锁定"通道 + 站点 + pipeline/strategy"三元组并写入配置,跨管线混比数字是文献复现失败的第三大来源。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
FCP 35 中心聚合(内部即"多中心") 35 国际中心(Biswal 2010) 跨站 SCA/ICA 一致性 网络架构跨站复现 论文内对照 正/负连接普遍架构成立;年龄性别为显著决定因素(PNAS)
FCP 22 数据集 / 979 例(FCDM) NIDA/NYU 等(Tomasi & Volkow 2010) 局部功能连接密度空间恒定性 跨站 lFCD 图形一致(FWE 校正显著) 9 站参数异质下验证 后扣带/腹侧楔前叶为最高密度 hub;个体间变异 <26%(PNAS 107(21):9885)
NYU_TRT 三会话重测 NYU(含于 FCP) FCDM 重测信度 会话间无显著 lFCD 差异 会话 2 vs 3 lFCD 类指标在重测下稳定(同上)
C-PAC 重现性基准 FCP-INDI 团队 管线输出重现性(ALFF/centrality/VMHC 等) Pearson r + 一致性相关系数 本地重算 vs 预计算 为管线选型提供量化重现性依据(C-PAC appendix)

§8 基准性能与生态

§8.1 排行榜与里程碑研究

FCP-1000 无官方竞赛排行榜(它不是比赛数据集)。社区以其为试验床产出的里程碑研究如下;各行数值不可直接横向比较——任务、子集、预处理与指标定义均不同:

# 研究 任务 关键结果 年份 完整引用 代码
1 跨站聚合奠基 SCA/ICA 一致性、年龄性别效应 1,093 例/24 站复现普遍架构 2010 Biswal BB, et al. (2010). Toward discovery science of human brain function. PNAS 107(10):4734-4739. DOI 10.1073/pnas.0911855107 官方脚本(FCP Scripts 版块)
2 功能连接密度图 lFCD 空间分布 979 例跨站恒定;后扣带 hub 2010 Tomasi D, Volkow ND (2010). Functional connectivity density mapping. PNAS 107(21):9885 未公开官方仓库
3 NITRC 影像库体系化 数据基础设施 FCP Classic 1,288 例/24 站托管规格 2016 Kennedy DN, et al. (2016). The NITRC image repository. NeuroImage 124:1069-1073 平台级
4 C-PAC 管线 自动化预处理 千例级一键处理框架 2013 Craddock RC, et al. (2013). Towards automated analysis of connectomes: The Configurable Pipeline for the Analysis of Connectomes (C-PAC)(fcp-indi.github.io) GitHub FCP-INDI
5 S3 云分发 数据基础设施 fcp-indi 公开 bucket 体系确立 2016 O’Connor D, et al. (2016). Sharing data in the cloud. GigaScience 5(Suppl 1):A18 INDI-Tools

§8.2 SOTA 总结与选型建议

没有"FCP 排行榜第一名"。选型逻辑应是:方法学论文 → 以 Biswal 2010 的跨站一致性协议为骨架,报告 LOSO;工具论文 → 对照 C-PAC/PCP 输出做重现性基准(Pearson r + 一致性相关系数);模型论文 → 线性基线先跑通,再上 BrainNetCNN/GNN,并始终报告站点分解。把"站点可分性"与"性别分层 AUC"作为两张常设诊断表,比追逐单一 SOTA 数字更有科学价值。

§8.3 评测协议

建议协议:外层 leave-one-site-out;训练折内 5 折调参;连接矩阵统一 0.01-0.1 Hz 带通 + Fisher z;报告总体与站点级 AUC/balanced accuracy(分类)、MAE/Pearson r(回归)、ICC(2,1)(信度);任何 Harmonization 步骤仅在训练折内拟合参数;附"站点可分性"诊断。

数据集 关系 规模 适用差异
ABIDE I/II INDI 兄弟项目 I 期 1,112 数据集(539 ASD + 573 对照)/ 17 站 疾病对照(自闭症);qianfanghub 专条
ADHD-200 INDI 兄弟项目 全样本 973(947 有标签)/ 8 站 儿童青少年 ADHD;qianfanghub 专条
CoRR INDI 重测专项 1,652 名受试者 信度/可重复性设计
NKI-Rockland(Enhanced) INDI 前瞻采集 目标 1,000 人,6-85 岁 富表型 + 纵向
Beijing Enhanced / EOEC / Short TR INDI-Retro/Pro 扩展 180 例 / 48 例 / 短 TR 队列 DTI 追加、睁闭眼、TR=400 ms 方法研究
HCP S1200 同期平行项目 1,206 名受试者 协议统一、表型丰富,获取门槛更高

§8.5 关键论文 Top 5

  1. Biswal BB, et al. (2010). Toward discovery science of human brain function. PNAS 107(10):4734-4739. DOI 10.1073/pnas.0911855107 —— 项目奠基论文:证明多中心静息态数据可聚合,确立开放共享范式。
  2. Tomasi D, Volkow ND (2010). Functional connectivity density mapping. PNAS 107(21):9885 —— 在 FCP 979 例上建立 FCDM 方法并验证跨站恒定性与重测信度。
  3. Kennedy DN, et al. (2016). The NITRC image repository. NeuroImage 124:1069-1073 —— 给出 FCP Classic 托管规格(1,288 例/24 站/18-80 岁/NIfTI)的权威口径。
  4. Craddock RC, et al. (2013). Towards automated analysis of connectomes: C-PAC.(fcp-indi.github.io)—— 把千例级预处理工程化,是 PCP 衍生生态的技术底座。
  5. O’Connor D, et al. (2016). Sharing data in the cloud. GigaScience 5(Suppl 1):A18 —— 记录 FCP/INDI 数据迁入 AWS 公开 bucket 的结构与工具链。

§8.6 社区活跃度

  • NITRC 论坛/新闻流:项目公告与数据发布主渠道,2009 至 2024-06 持续有 Release 新闻(NITRC RSS)。
  • NeuroStars 论坛:INDI 家族数据使用问题的活跃问答社区(如 ADHD-200 预处理讨论)。
  • GitHub FCP-INDI 组织:C-PAC、INDI-Tools 等工具链的维护主页(github.com/FCP-INDI)。
  • 学术热度:Biswal 2010 Scopus 引用 2,500+(截至 2026-09),常年位居开放神经影像引文榜首梯队。

§8.7 生态快照

资源 类型 链接 推荐理由
C-PAC 预处理管线 fcp-indi.github.io FCP/INDI 生态官方管线,Docker 开箱即用
PCP 预处理衍生数据 preprocessed-connectomes-project.org 四管线 × 四策略衍生指标免跑管线直取
nilearn Python 分析库 nilearn.github.io 快速原型:masker/连接矩阵/GLM 一站式
AFNI / FSL 经典工具链 afni.nimh.nih.gov / fsl.fmrib.ox.ac.uk C-PAC 底层组件,学管线前先懂工具
Cyberduck S3 GUI cyberduck.io 官方推荐的可视化下载器(注意匿名登录 workaround)
NeuroStars 问答社区 neurostars.org INDI 家族问题的第一求助地
NITRC 门户与注册 nitrc.org/projects/fcon_1000 注册申请与分卷下载入口

§9 相关资源与引用

§9.1 官方资源

§9.2 BibTeX 引用块

@article{biswal2010fcp,
  author  = {Biswal, Bharat B. and Mennes, Maarten and Zuo, Xi-Nian and Gohel, Suril and Kelly, Clare and Smith, Stephen M. and Beckmann, Christian F. and Adelstein, Jonathan S. and Buckner, Randy L. and Colcombe, Stan and Dogonowski, Anne-Marie and Ernst, Monique and Fair, Damien and Hampson, Michelle and Hoptman, Matthew J. and Hyde, James S. and Kiviniemi, Vesa J. and K{\"o}tter, Rolf and Li, Shi-Jiang and Lin, Ching-Po and Lowe, Mark J. and Mackay, Clare and Madden, David J. and Madsen, Kristoffer H. and Margulies, Daniel S. and Mayberg, Helen S. and McMahon, Katie and Monk, Christopher S. and Mostofsky, Stewart H. and Nagel, Bonnie J. and Pekar, James J. and Peltier, Scott J. and Petersen, Steven E. and Riedl, Valentin and Rombouts, Serge A. R. B. and Rypma, Bart and Schlaggar, Bradley L. and Schmidt, Sein and Seidler, Rachael D. and Siegle, Greg J. and Sorg, Christian and Teng, Gao-Jun and Veijola, Juha and Villringer, Arno and Walter, Martin and Wang, Lihong and Weng, Xu-Chu and Whitfield-Gabrieli, Susan and Williamson, Peter and Windischberger, Christian and Zang, Yu-Feng and Zhang, Hong-Ying and Castellanos, F. Xavier and Milham, Michael P.},
  title   = {Toward discovery science of human brain function},
  journal = {Proceedings of the National Academy of Sciences},
  year    = {2010},
  volume  = {107},
  number  = {10},
  pages   = {4734--4739},
  doi     = {10.1073/pnas.0911855107}
}

@article{tomasi2010fcdm,
  author  = {Tomasi, Dardo and Volkow, Nora D.},
  title   = {Functional connectivity density mapping},
  journal = {Proceedings of the National Academy of Sciences},
  year    = {2010},
  volume  = {107},
  number  = {21},
  pages   = {9885},
  note    = {Analysis of 979 subjects from 22 FCP datasets}
}

@article{kennedy2016nitrc,
  author  = {Kennedy, David N. and Abraham, Stephen A. and Bates, John F. and Crowley, Anthony and Ghosh, Satrajit and Gillespie, Thomas and Goncalves, Mathias and Grethe, Jeffrey S. and Halchenko, Yaroslav O. and Hanke, Michael and Haselgrove, Christian and Hodge, Steven M. and Jarecka, Dorota and Kaczmarzyk, Jakub and Keator, David and Meyer, Kurt and Molfese, Peter J. and Poline, Jean-Baptiste and Reese, Tom and Strother, Stephen and Travers, Jason and Turner, Jessica A.},
  title   = {The NITRC image repository},
  journal = {NeuroImage},
  year    = {2016},
  volume  = {124},
  pages   = {1069--1073}
}

@misc{oconnor2016s3,
  author       = {O'Connor, David and Clark, Daniel J. and Milham, Michael P. and Craddock, R. Cameron},
  title        = {Sharing data in the cloud},
  howpublished = {GigaScience 5(Suppl 1):A18},
  year         = {2016}
}

§9.3 引用指南

引用时请遵循官方要求:任何使用 FCP/INDI 数据的成果须引用 Biswal et al., 2010(数据集奠基论文);使用具体站点数据时同时引用该站点的对应文献;使用 PCP 预处理衍生数据时注明管线与策略(如 “C-PAC, filt_global”)。千方医数集引用格式:千方病案医数集. FCP-1000(千例功能连接组项目)AI-Ready 百科. https://www.qianfanghub.com/ai-ready-dataset/1000-functional-connectomes/295 (截至 2026-09)。


§10 AI 使用声明卡

§10.1 本页面使用的 AI 模型

用途 模型类型 说明
资料检索与汇编 大语言模型(检索增强) 聚合官方门户、NITRC wiki、PNAS 论文、NITRC-IR 论文与社区讨论的公开信息
结构化改写 大语言模型 将来源信息改写为本 Wiki 结构;未改动关键数字
代码生成 大语言模型辅助 §6 代码基于公开 API(nilearn/nibabel/AWS CLI)撰写并经人工复核

§10.2 AI 参与范围

AI 负责检索汇总、初稿撰写与代码骨架;关键数字(1,414/35、1,288/24、TR 与时间点范围、站点样本数、Scopus 引用数、C-PAC 硬件参数)均溯源至检索到的原始来源并由人工核对;医学表述与偏倚结论经编辑部审核。

§10.3 输入来源列表

  1. Biswal BB, et al. (2010). Toward discovery science of human brain function. PNAS 107(10):4734-4739. DOI 10.1073/pnas.0911855107 — https://www.pnas.org/doi/abs/10.1073/pnas.0911855107
  2. Tomasi D, Volkow ND (2010). Functional connectivity density mapping. PNAS 107(21):9885 — https://www.pnas.org/content/107/21/9885
  3. Kennedy DN, et al. (2016). The NITRC image repository. NeuroImage 124:1069-1073 — https://d.docksci.com/the-nitrc-image-repository_5a446e3cd64ab2e92ea04a44.html
  4. FCP/INDI 官方门户 — https://fcon_1000.projects.nitrc.org/
  5. NITRC wiki:fcon 1000:INDI(访问流程/INDI-XNAT vs INDI-Lite) — https://www.nitrc.org/plugins/mwiki/index.php?oldid=8039
  6. NITRC wiki:fcon 1000:FCPClassic(站点级样本与参数) — https://www.nitrc.org/plugins/mwiki/index.php?oldid=7989
  7. NITRC 论坛:FCP/INDI 周年发布公告(2010-12-17,Milham) — https://www.nitrc.org/forum/forum.php?thread_id=1916&forum_id=1735
  8. NITRC 新闻 RSS(NKI-RS Release 序列) — https://nitrc.org/export/rss20_news.php?group_id=296
  9. re3data:INDI 与 FCP 注册条目(许可/机构/RRID) — http://www.re3data.org/repository/r3d100011555 及 r3d100011565
  10. IEEE 综述(FCP 规模口径、限制与 common test bed 定位) — https://ieeexplore.ieee.org/document/8052510/
  11. PCP Functional Preprocessing(四管线 × 四策略) — https://preprocessed-connectomes-project.org/abide/Pipelines.html
  12. C-PAC 文档(Pre-configured Pipelines / benchmark appendix) — https://fcp-indi.github.io/docs/nightly/user/pipelines/preconfig 及 https://fcp-indi.github.io/docs/user/appendix.html
  13. O’Connor D, et al. (2016). Sharing data in the cloud. GigaScience 5(Suppl 1):A18 — https://paperity.org/p/89905183/sharing-data-in-the-cloud
  14. Rockland Sample 数据访问页(S3 路径与下载工具) — https://rocklandsample.org/?p=1570/
  15. ADHD-200 AWS 下载指引 PDF(Cyberduck workaround) — https://fcon_1000.projects.nitrc.org/indi/adhd200/download_scripts/Download_Instructions_ADHD200.pdf
  16. NATVIEW 下载指引 PDF(–no-sign-request/–no-verify-ssl 参数) — https://fcon_1000.projects.nitrc.org/indi/retro/NAT_VIEW/Instructions_Download_Neuroimaging_EEGFMRI_NATVIEW.pdf
  17. NITRC tracker #10156(下载故障与 S3 替代) — https://www.nitrc.org/tracker/index.php?aid=10156&atid=102&func=detail&group_id=6
  18. NeuroStars:ADHD200 preprocessed 输出讨论(fMRIPrep 去噪差异) — https://neurostars.org/t/adhd200-preprocessed-output-data-files/26418/3
  19. Scopus 引用数(NJIT 机构库页面) — https://researchwith.njit.edu/en/publications/toward-discovery-science-of-human-brain-function/
  20. 中国科学院心理所知识库(Cambridge 站点设备参数用例) — https://ir.psych.ac.cn/bitstream/311026/20744/1/Yang2016_BSAF.pdf
  21. Ensemble learning with 3D CNNs for functional connectome-based prediction — https://www.ncbi.nlm.nih.gov/pmc/articles/pmc6777738/
  22. qianfanghub 内部条目:ABIDE(writing/abide/FACTS.md)、ADHD-200(writing/adhd-200/FACTS.md)——兄弟项目规模口径

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§1 概览与 §1.3 对比表 千方病案医学编辑部 对照检索来源逐数字核对 ✅ 已通过/已验证
§2 医学背景 千方病案医学编辑部(神经影像方向) 静息态 fMRI 科学表述审读 ✅ 已通过/已验证
§3 规格(站点表/参数) 千方病案医学编辑部 对照 NITRC wiki 与 FCDM Table 2 ✅ 已通过/已验证
§4 DAIMS 字段字典 数据工程师 目录树与官方 INDI-Lite 说明核对 ✅ 已通过/已验证
§6 代码与坑点 数据工程师 代码逻辑走查 + 坑点溯源确认 ✅ 已通过/已验证
§7 DAIMS 与偏倚 千方病案医学编辑部 偏倚条目逐条对照来源 ✅ 已通过/已验证
§8-§9 引用与 BibTeX 千方病案医学编辑部 引用信息完整性核查 ✅ 已通过/已验证

§10.5 AI 生成章节标注

§1-§10 正文由 AI 辅助生成初稿;§0 审核声明、三段免责声明与 §10 声明卡为编辑部维护的固定模板;关键数字段落(§3.2 站点表、§8.1 引用信息、§10.3 来源列表)逐条经人工溯源。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


§C 机器可读结构化数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • cam-can — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像 / 队列研究
  • aomic — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像 / 队列研究
  • ppmi — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像 / 队列研究
  • healthy-brain-network — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像 / 队列研究
  • aibl — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像 / 队列研究
  • abide — 共享标签:神经科学 / 公共卫生与流行病学 / 脑影像
  • nki-rockland — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
  • adhd-200 — 共享标签:神经科学 / 脑影像 / 队列研究
  • ADNI — 共享标签:神经科学 / 脑影像 / 队列研究
  • abcd-study — 共享标签:公共卫生与流行病学 / 脑影像 / 队列研究

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集