信息速览

NKI-Rockland Sample — 全生命周期多模态脑影像队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Enhanced NKI-Rockland Sample(NKI-RS) |
| 英文全称 | Enhanced Nathan Kline Institute - Rockland Sample |
| 别名/简称 | NKI-RS、Enhanced NKI-RS、NKI Rockland Sample、eNKI-RS |
| 疾病分类 | 跨诊断社区样本(ICD-11:6A05 注意缺陷多动障碍 / 6A70 单相抑郁障碍 / 6B00 广泛性焦虑障碍 / 6A20 精神分裂症;无单一疾病标签,详见 §2.1) |
| SNOMED CT | 406506008 Attention deficit hyperactivity disorder / 370143000 Major depressive disorder / 21897009 Generalized anxiety disorder / 58214004 Schizophrenia(详见 §2.1b) |
| 数据模态 | 静息态 fMRI(3 种 TR)、任务 fMRI(呼吸暂停/视觉棋盘格)、DTI(137 方向)、T1 加权解剖像、pCASL(纵向子研究)、呼吸心跳生理记录、神经心理与诊断访谈、基因样本 |
| AI 任务类型 | 脑龄回归、性别与认知预测、功能连接-行为映射、精神症状维度建模、影像 QC 预测、可重复性与可靠性基准 |
| 样本总数 | 1,500 名受试者(Sample I,2011-2020);纵向儿科子研究 369 名(入组 6.0-17.0 岁) |
| 数据大小 | TB 量级(DICOM + NIfTI/BIDS 双格式;官方经 aws_links.csv 逐对象分发,未公布单一总量) |
| 数据格式 | DICOM、NIfTI(BIDS 1.0.0 目录结构) |
| 许可证 | CC BY-NC(影像开放部分);高维表型需 Data Usage Agreement(DUA) |
| 访问级别 | 开放下载(Neuroimaging Release)/ 申请审核(Full Phenotypic Release,机构签署 DUA) |
| DUO 标签 | NRES(影像开放部分,无限制);Full Phenotypic Release 附加 DUA 保密义务 |
| 语言 | 英文 |
| 首发日期 | 2013-01-02(Enhanced NKI-RS ‘Lite’ Release,首批 181 人) |
| 最后更新 | 持续更新(Sample II 自 2021 起按季度前瞻发布,截至 2026-09) |
| 发布机构 | Nathan S. Kline Institute for Psychiatric Research(NKI)与 FCP/INDI 联盟 |
| 官方主页 | https://fcon_1000.projects.nitrc.org/indi/enhanced/ |
| 下载地址 | https://fcon_1000.projects.nitrc.org/indi/enhanced/neurodata.html(S3:s3://fcp-indi/data/Projects/RocklandSample/RawDataBIDSLatest) |
| DOI | 10.3389/fnins.2012.00152(数据描述论文)/ 10.15387/fcp_indi.corr.nki1(24 人 TRT pilot) |
| 引用次数 | 967+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— BIDS 标准化 + 官方 QC 文档 + 生态成熟(fMRIPrep 官方教程即采用其数据);扣分项:无官方任务划分、高维表型需 DUA、BIDS 1.0.0 元数据不完整、无现成预处理衍生数据 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、跨诊断队列与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(BIDS 层级与表型字段)、§5 数据划分策略(TRT/纵向泄漏防控)、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 Nathan Kline Institute、Child Mind Institute、FCP/INDI 无任何商业利益关联。本页面不销售 NKI-RS 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NKI-RS 影像数据以 CC BY-NC 开放分发;高维表型数据(含条目级精神科问卷与诊断访谈)须完成并由机构授权代表签署公证 Data Usage Agreement(DUA)后方可获取。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? NKI-Rockland Sample(NKI-RS)是一个"给全年龄段人脑拍照 + 做全套体检"的开放数据工程:研究团队在美国纽约州罗克兰郡以社区流病方式招募了约 1,500 名 6-85 岁的普通居民,每人接受 2 天的深度评估——既做多种先进 MRI 扫描(含三种不同速度的静息态 fMRI 与高速 DTI),也做精神科访谈、智力与认知测验、问卷、血液化验与睡眠体动记录,且数据随采随发。
为什么重要? 在它之前,脑影像研究要么样本小,要么只招募"超级健康"的对照,难以反映真实人群。NKI-RS 首次把"全生命周期 + 深表型 + 开放共享"三件事合成一份数据,并刻意纳入轻中度心理困扰者,让脑-行为关系研究更接近真实世界。它还是 HCP 式多波段序列向开放社区推广的第一次大规模演练(配套 24 人重测试点)。
我能用它做什么? 训练跨年龄的脑龄/性别/认知预测模型、检验预处理流水线在真实社区数据上的稳健性、用条目级心理量表做脑-症状维度关联、利用内置重测与纵向子样本评估指标可靠性。影像部分无需任何申请即可下载;高维表型签署免费 DUA 后即可获取。
§1.1 摘要
NKI-RS 由美国 Nathan S. Kline Institute for Psychiatric Research(奥兰治堡,纽约州)主导,NIMH 多项基金与纽约州精神卫生办公室资助,是 1,000 Functional Connectomes Project(FCP)/ 国际神经影像数据共享倡议(INDI)系列数据资源中规模最大、表型最深的"机构中心式"队列。Sample I(2011-2020)共入组 1,500 名 6-85 岁社区受试者,采用 2 天评估协议,覆盖一般健康、体格、神经认知、DSM-IV 诊断访谈与行为五大领域,并采集多波段静息态 fMRI(TR=645 ms/3 mm、1400 ms/2 mm、2500 ms/3 mm 三种协议)、137 方向 2 mm DTI、呼吸暂停与视觉棋盘格任务 fMRI,以及扫描中同步呼吸心跳记录(Nooner et al., 2012)。数据按季度前瞻性发布:影像与有限表型(年龄/性别/利手)免协议开放下载;高维表型经 DUA 通过 LORIS 或 COINS 获取。该资源已有 967+ 次引用(Google Scholar,截至 2026-09),衍生出脑龄预测、连接组-智力关联、可靠性方法学等大量研究,并与 ABIDE、ADHD-200、HBN 等同门数据集共同构成开放神经影像的公共基础设施。
§1.2 战略价值
维度一:全生命周期参照系。NKI-RS 把 6-85 岁的连续年龄谱压进同一个 3T 平台、同一套序列组合中,使它成为"一生之中大脑如何变化"的天然参照数据集。对 AI 研究者而言,这意味着可以在一份样本内同时建模儿童期发育、成年稳定期与老年萎缩三种形态学规律,而不必拼接多个采集协议互不兼容的数据集;脑龄、规范建模(normative modeling)等任务也因此获得了跨年龄训练与外部验证的公共坐标。同类的 ABCD 与 HBN 聚焦发育期,HCP 聚焦青年成人,而 NKI-RS 的稀缺性恰恰在"全谱覆盖 + 社区招募"的组合。
维度二:深表型 × 跨诊断设计。NKI-RS 刻意不排除轻中度精神障碍受试者(transdiagnostic 社区设计),量表覆盖症状维度与优势面(如 Conners 症状量表 + SWAN 优势/弱点量表),并提供条目级(item-level)响应数据。这让机器学习模型能在连续症状谱上学习脑-行为映射,而不是在人为二分类的"病例 vs 对照"边界上过拟合,也使基于 RDoC 框架的维度化研究成为可能。条目级数据的再识别风险由 DUA 机制兜底,形成了"开放影像 + 受控表型"的双层治理范式。
维度三:方法学与生态的试验田。24 人多波段重测试点、三种 TR 协议并存、季度前瞻发布、免署名免审稿的开放策略,使 NKI-RS 成为预处理流水线(fMRIPrep、C-PAC、NIAK)、可靠性方法(TRT 子集)与共享治理模式的事实测试床——斯坦福 fMRIPrep 官方教程即以其重测试点数据为教学样本(教程)。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 年龄范围 | 模态与标注 | 差异化定位 |
|---|---|---|---|---|
| NKI-RS | 1,500(Sample I)+ 纵向儿科 369 | 6-85 岁 | 3 种 TR rsfMRI、DTI、任务 fMRI、生理记录;诊断访谈 + 条目级问卷 + 基因 | 全生命周期社区队列,重测/纵向子样本内置,开放影像 + DUA 表型双层结构 |
| ABIDE I(同门) | 539 名受试者(17 站点) | 约 7-64 岁 | rsfMRI + 结构 MRI + 临床诊断标签 | 自闭症病例-对照多站点联盟,诊断标签明确但表型较浅 |
| ADHD-200(同门) | 约 970 名受试者(8 站点聚合) | 7-21 岁 | rsfMRI + 结构 MRI + ADHD 诊断 | 竞赛起家的 ADHD 分类基准,站点异质性显著 |
| HCP S1200 | 1,200 名 | 22-37 岁 | 多模态 MRI(定制协议)+ 行为全套 | 青年成人最深模态组合,采集协议专机定制,NKI-RS 多波段序列即源自 HCP 技术 |
| ABCD Study | 约 11,800 名(基线) | 9-10 岁入组纵向 | 多模态 MRI + 全套表型 | 美国国家级儿童发育纵向队列,体量最大但年龄段窄(发育期) |
| HBN | 2,000+ 名(持续增长) | 5-21 岁 | 多模态 MRI + 深表型(临床增益样本) | 儿科临床丰富样本,与 NKI-RS 共享 COINS/LORIS 基础设施与发布哲学 |
上述对比数字为各数据集公开发布资料中的规模口径,采集协议与发布状态随时间变化,使用前请以各自官方页面为准。
§1.4 版本时间轴
| 时间 | 里程碑 | 说明 |
|---|---|---|
| 2010-2011 | Pilot 阶段 | 单日协议试点,招募经验反哺正式设计(Nooner et al., 2012) |
| 2011 | Sample I 启动 | NIMH 四项基金支撑的正式采集,2 天协议上线 |
| 2012-12 | 24 人多波段重测试点 | 验证 HCP 式快 TR 序列可靠性,独立 DOI(10.15387/fcp_indi.corr.nki1) |
| 2013-01-02 | ‘Lite’ Release | 首批 181 人影像 + 有限表型开放(发布公告) |
| 2013-03-07 | ‘FULL PHENOTYPIC’ Release | 首批 200 人全套表型 + 影像(DUA 生效) |
| 2011-2020 | Sample I 持续季度发布 | 累计 1,500 人,DICOM/NIfTI 前瞻共享 |
| 2021 至今 | Sample II | 经 INDI 与 NIMH Data Archive(NDA)双通道季度发布,采集持续(Atlas 记录) |
§1.5 典型应用场景
- 跨年龄脑龄与规范建模:以 6-85 岁连续谱训练脑龄回归或分位数回归模型,用内置重测子样本报告预测稳定性(已有研究在 NKI-RS 上以 N=210 做外部验证、N=120 重测与 N=77 纵向扫描检验模型可靠性(Zhao et al., 2019))。
- 功能连接-行为维度映射:条目级心理量表 + 三种 TR 静息数据,支持 RDoC 式连续症状建模与图论指标-智力关联研究(Sci Rep, 2024)。
- 预处理流水线基准测试:三种 TR 协议与真实社区数据质量(含临床受试者)是检验 fMRIPrep/C-PAC/NIAK 稳健性的天然压力测试场。
- 可靠性方法学研究:24 人多波段 TRT 试点 + 样本内约 3 周内重扫子集,适合研究 ICC、信噪比与最小可检测效应随 TR 的变化。
- 数据治理与合规教学案例:"开放影像 + DUA 表型 + defacing + 县级地理粗化"构成多层级隐私治理的教科书式范例。
§2 医学背景
§2.1 ICD-11 编码映射表
NKI-RS 是社区样本而非疾病登记库,其"疾病维度"来自跨诊断筛查与诊断访谈——下表列出该样本主要测量/可建模的精神障碍及其 ICD-11 编码。
| 标签/领域 | ICD-11 编码 | 中文名称 | 在 NKI-RS 中的体现 |
|---|---|---|---|
| 注意缺陷多动障碍 | 6A05 | ADHD | Conners 成人/儿童 ADHD 量表 + SWAN 优势弱点量表条目 |
| 单相抑郁障碍 | 6A70 | 抑郁障碍 | BDI-II、GDS-LF(老年版)、儿童抑郁量表等条目级评分 |
| 广泛性焦虑障碍 | 6B00 | 广泛性焦虑 | 状态-特质焦虑量表(STAI)等焦虑维度条目 |
| 精神分裂症谱系 | 6A20 | 精神分裂症 | DSM-IV 诊断访谈(K-SADS/结构化访谈)覆盖的诊断类别 |
| 跨诊断症状维度 | 6E20Z 等 | 行为/情绪维度 | 五大评估域(General/Physical/Neurocognitive/Diagnostic/Behavioral)全部条目级响应 |
ICD-11 编码用于检索与任务定义参考;NKI-RS 原始数据以 DSM-IV 诊断访谈为临床标准,映射到 ICD-11 时应复核编码细则。
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| ADHD | 6A05 | 406506008 | Attention deficit hyperactivity disorder(disorder) |
| 抑郁障碍 | 6A70 | 370143000 | Major depressive disorder(disorder) |
| 广泛性焦虑 | 6B00 | 21897009 | Generalized anxiety disorder(disorder) |
| 精神分裂症 | 6A20 | 58214004 | Schizophrenia(disorder) |
| 焦虑状态(维度) | — | 48694002 | Anxiety(finding) |
§2.2 疾病/人群背景与流行病学
NKI-RS 的科学问题不是某一种疾病,而是全生命周期中脑结构与功能如何变化、以及精神症状如何在人群中连续分布。传统病例-对照设计把"病例"从人群中抽出比较,制造了"超级健康对照"偏差;NKI-RS 反其道而行——以社区流病方式招募罗克兰郡居民,宽纳入标准允许轻中度精神疾病(无论过去或现在)入组,让样本保留真实人群的症状异质性(Tobe et al., 2022)。这正是 NIMH 战略计划(RDoC 跨诊断议程)所呼吁的资源形态:足够功效、深表型、先进影像、开放共享(Nooner et al., 2012)。对 AI 而言,这意味着 NKI-RS 的"标签"是连续维度而非二分类,模型评估应以回归与维度关联为主轴。
与该数据集核心研究维度对应的社区流行病学背景(量级参考,非 NKI-RS 样本实测值):
| 障碍维度 | 社区患病率量级 | 发育窗口 | 与 NKI-RS 表型的对应 |
|---|---|---|---|
| ADHD | 儿童期约 5%(权威综述共识区间) | 儿童起病,部分持续至成年 | Conners/SWAN 条目 + K-SADS 诊断 |
| 抑郁障碍 | 终生患病率两位数百分比量级 | 青春期起病率陡增 | BDI-II/GDS-LF/儿童抑郁量表条目 |
| 焦虑障碍 | 最常见的儿童-成人精神障碍类群 | 全年龄段 | STAI 等条目 |
| 精神分裂症谱系 | 约 1% 量级 | 青少年晚期-成年早期 | 结构化访谈诊断类别 |
| 睡眠/体动异常 | 老年与发育期均常见 | 全年龄段 | ≥1 晚体动记录仪数据 |
上表患病率为精神病学教科书的公认量级,用于说明任务背景;NKI-RS 自身的条目级分布请以 DUA 层数据实测为准。
发育分段与研究切入点。NKI-RS 的 6-85 岁谱可粗分为三段:儿童期(约 6-12 岁,灰质体积与皮层厚度达峰后开始修剪,是"规范发育曲线"敏感段)、青少年-成年早期(约 13-30 岁,髓鞘化与功能网络分化加速,精神障碍高发起病窗口)、中年-老年(30 岁以后,萎缩与血管性变化渐显,脑龄差研究的主战场)。三段对应完全不同的先验与运动噪声水平——把年龄段作为建模轴心而非噪声,是使用该数据集的第一设计决策。
§2.3 临床/科研任务定义
| 任务类型 | 定义 | 在 NKI-RS 上的实现方式 |
|---|---|---|
| 筛查(dimensional) | 用脑影像指标预测症状维度得分 | 条目级量表聚合 → 多变量回归;跨诊断设计避免对照过纯 |
| 发育轨迹刻画 | 建立 6-85 岁形态学/功能指标的年龄规范曲线 | 全谱横断样本拟合分位曲线;纵向儿科子研究(N=369,24-30 个月)验证轨迹 |
| 可靠性评估 | 量化成像指标与预测模型的重测稳定性 | 内置重测子集(约 3 周内重扫)与 24 人 TRT 试点 |
| 诊断辅助(不可直接用于临床) | 识别符合诊断类别者 | DSM-IV 访谈标签可用,但样本非临床登记,阳性率低,适合维度建模优先 |
| 预后/队列分层 | 以脑-行为特征对人群分层 | 结合基因、体动记录、实验室指标做多模态聚类 |
§2.4 患者人群构成
| 维度 | 描述 |
|---|---|
| 来源 | 美国纽约州罗克兰郡及周边社区,社区广告与外展招募(须居住于该郡) |
| 时间 | Sample I:2011-2020;Sample II:2021 至今(持续) |
| 年龄 | 6-85 岁(设计目标);纵向儿科子研究入组 6.0-17.0 岁 |
| 性别 | 男性与女性均纳入(影像发布附带 age/sex/handedness 三列公开表型) |
| 临床状态 | 社区跨诊断:纳入轻中度精神疾病(过去或现在),非健康对照筛除设计 |
| 就医类型 | 社区居民,不基于临床就诊;部分受试者从未接受精神科治疗 |
§2.5 临床与科研价值
对临床科学而言,NKI-RS 提供了"正常发育 + 症状维度"双重参照:一方面,全谱年龄样本可直接建立儿童至老年的脑结构/功能规范曲线(类似儿科生长曲线的脑版);另一方面,跨诊断深表型允许检验症状维度与环路指标的连续关联,为 RDoC 式分类学提供证据。对临床 AI 而言,它是难得的"贴近真实人群"的训练/校准来源——多数医院数据存在转诊偏倚,而 NKI-RS 的社区招募使模型至少见过"没来看病的脑子"。必须强调:该样本地理上集中于罗克兰郡,且不能替代临床验证,任何诊断类模型都需在外部临床队列上独立验证后方可声称临床效用。
落地到三类具体受益者:
- 方法学研究者:重测/纵向结构使可靠性、信噪比、最小可检测效应研究无需额外采集即可开展;
- 临床 AI 团队:以 NKI-RS 做"人群校准层",修正医院数据过度代表重症的偏倚(仅限公开/合规层);
- 教学场景:免协议的影像 + 官方教程生态,使其成为神经影像机器学习课程的事实教材。
§2.6 金标准与标注体系
| 维度 | 描述 |
|---|---|
| 诊断/标注划分 | 无病例-对照切分;以 DSM-IV 结构化访谈(儿童 K-SADS 等)做诊断评估,量表以连续维度记录并保留条目级响应 |
| 标注方式 | 结构化访谈(受训评估者)+ 自评/家长评量表 + 计算机化认知测验;影像无病变标注,为"自然状态"成像 |
| 标注者资质 | 2 天协议由研究团队按标准化手册执行;条目级数据经 COINS 平台电子化录入(减少誊抄误差) |
| 一致性 | 协议经 24 人试点迭代收敛;发布前对影像做 QC 并随数据发布 QC 文档;重测子集支持测量稳定性检验 |
| 标注性质 | 全部标注为脱敏后的研究性标注,非临床决策用途 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 获取方式 | 理由 |
|---|---|---|---|
| 快速跑通预处理/深度学习管线 | Neuroimaging Release(BIDS) | AWS S3 / NITRC 免协议下载 | 无 DUA 门槛,含影像 + age/sex/handedness,立即可用 |
| 脑-行为关联、症状维度建模 | Full Phenotypic Release | 签署 DUA 后经 LORIS/COINS 获取 | 条目级量表、诊断访谈、实验室、体动记录全在此层 |
| 可靠性/方法学研究 | 24 人 TRT pilot(DOI 10.15387/fcp_indi.corr.nki1) | FCP/INDI 试点专页下载 | 同批受试者重复多波段协议,含校准任务 |
| 发育轨迹/纵向建模 | 纵向儿科子研究(N=369)+ Sample II | DUA + NDA / INDI | 24-30 个月多波次,入组 6.0-17.0 岁,增加 pCASL |
| 需要原始 DICOM 重建 | 原始 DICOM 发布 | 同 S3 清单 | 便于自定义重建与 BIDS 重整(分发以 DICOM、NIFTI 双格式为主) |
§3.1 模态详情
| 模态 | 序列参数 | 时长 | 用途 |
|---|---|---|---|
| 静息态 fMRI(多波段-快 TR) | TR=645 ms,3 mm 各向同性 | 10 min | 时间分辨率优先:动态功能连接、高频生理噪声研究 |
| 静息态 fMRI(多波段-高分辨) | TR=1400 ms,2 mm 各向同性 | 10 min | 空间分辨率优先:皮层定位、精细连接组(官方 QC 主要基于此协议) |
| 静息态 fMRI(标准 EPI) | TR=2500 ms,3 mm 各向同性 | 5 min | 与历史/传统协议兼容的参考序列 |
| DTI(多波段) | 137 方向,2 mm 各向同性,<7 min | <7 min | 白质纤维追踪与结构连接组 |
| 任务 fMRI | 呼吸暂停(breath-holding)+ 视觉棋盘格(blocked design);TR=645/1400 ms | 各若干 min | 血管反应性与对比噪声校准,可校正静息指标 |
| 解剖像 | T1 加权(MPRAGE 类)结构像 | — | 形态学、分割、皮层厚度(纵向子研究另含形态学 MRI 与 pCASL 灌注) |
| 扫描中生理记录 | 心脏(心电/脉搏)+ 呼吸 | 与 MRI 同步 | 生理噪声建模、时刻计数 |
| 表型/基因 | 2 天五大域评估 + 血液/唾液基因样本 + ≥1 晚体动记录 | 2 天 | 深表型关联与遗传分析 |
§3.1b 生理与行为通道
NKI-RS 相对同代开放队列的一个独特优势是把"扫描时的人"也数字化了——这些通道对 AI 建模既是协变量也是研究对象:
| 通道 | 采集方式 | AI 用法 |
|---|---|---|
| 心脏信号 | MRI 同步心电/脉搏记录 | 生理噪声回归;心跳-呼吸耦合研究 |
| 呼吸信号 | MRI 同步呼吸带 | 呼吸峰-全局信号波动建模;CO2/血管反应性参照 |
| 体动记录 | 腕表式 actigraphy(≥1 晚) | 睡眠-脑形态关联;日节律协变量 |
| 眼动校准 | 任务前校准扫描 | 注视稳定性 QC;视力校正残余噪声评估 |
| 任务行为 | 棋盘格/呼吸暂停任务日志(Vision Egg 脚本可复现刺激) | 任务表现 QC;血管反应性个体差异 |
§3.2 按子集样本数
| 子集 | 样本数 | 说明 |
|---|---|---|
| Sample I 全体(2011-2020) | 1,500 | 四项 NIMH 基金研究的合并资源 |
| BIDS 原始影像(RawDataBIDSLatest) | 1,334 | 公开 S3 桶中 BIDS 化的影像主体 |
| 首批 Lite 发布(2013-01) | 181 | 影像 + age/sex/handedness |
| 首批全套表型发布(2013-03) | 200 | DUA 保护的高维表型 |
| 24 人多波段 TRT 试点 | 24 | 成人,重复 R-fMRI/DTI + 校准任务 |
| 纵向儿科子研究 | 369 | 24-30 个月多波次,入组 6.0-17.0 岁 |
| 样本内重测/纵向(脑龄研究口径) | 120(重测,<1 个月)/ 77(纵向,1.22±0.29 年) | 一篇 NKI-RS 脑龄论文报告的可用重复扫描规模 |
§3.3 数据格式表
| 对象 | 格式 | 说明 |
|---|---|---|
| 原始影像 | DICOM + NIfTI | 双格式分发 |
| 整理后影像 | BIDS 1.0.0 目录(RawDataBIDSLatest) | subject/session/anat/func 标准命名 |
| 公开表型 | CSV(随影像附带) | AGE、SEX、HANDEDNESS 三列 |
| 高维表型 | LORIS/COINS 导出(表格 + 条目级) | DUA 获取 |
| S3 下载清单 | aws_links.csv | 全部对象的 S3 链接总表 |
| 刺激/任务文件 | Vision Egg 格式脚本 | 棋盘格、呼吸暂停、眼动校准任务的刺激设计与执行脚本 |
§3.4 存储大小
官方未公布单一总量数字;数据经 S3 逐对象分发(完整清单见 aws_links.csv),规模随季度发布持续增长。工程经验估算:1,334 例 BIDS 影像(每例含 3 种 TR 静息 + DTI + 解剖 + 任务序列)加原始 DICOM,整体处于 TB 量级;建议为完整镜像预留 2 TB 以上磁盘,并为 fMRIPrep 等预处理衍生数据另留同等空间。逐受试者按需下载(见 §6.2 过滤下载)是更经济的起点。
§3.5 标注方式
NKI-RS 的"标注"是多层表型测量而非影像病变标注:诊断层为 DSM-IV 结构化访谈结果;量表层为数十种自评/他评问卷(保留条目级响应);认知层为计算机化神经心理测验得分;生理层为扫描中呼吸心跳波形;行为层为体动记录仪睡眠/活动数据。全部表型经 COINS 平台电子化录入(受试者与研究人员直接 web 录入,消除纸质誊抄),并按 HIPAA 去标识后分层发布。影像数据不做人工病灶分割,属于"开放自然成像",因此该数据集最适合自监督、回归与维度关联任务。
§3.6 标注者资质与一致性
评估由 NKI-RS 研究团队按标准化手册(SOP)执行:诊断访谈由受训评估者完成,认知测验采用有常模的标准化工具(如 NIHTB 类工具与经典神经心理量表),问卷为已发表量表的官方版本。质量控制方面:2 天协议先经 24 人试点迭代;影像采集后统一 QC(QC 文档随发布更新,官方主要对 TR=1400 ms 协议执行 QC);条目级电子录入从机制上消除了纸质双录误差。重测子集为测量一致性提供了实证检验通道。
§3.7 采集周期
| 阶段 | 时间窗 | 发布节奏 |
|---|---|---|
| Pilot | 2010-2011 | 内部迭代,未开放 |
| Sample I(首批影像) | 2012-03 至 2012-11 产出首批 181 人 | 2013-01 Lite、2013-03 Full Phenotypic |
| Sample I(常态) | 2011-2020 | 季度前瞻发布 |
| Sample II | 2021 至今 | INDI + NDA 双通道季度发布 |
Pilot 2010-2011 → Sample I 2011-2020(首批影像采集 2012 年 3 月-11 月即产出 181 人 Lite 发布,此后按季度前瞻发布,即数据在采集当季即公开)→ Sample II 2021 至今(INDI + NDA 双通道季度发布)。"随采随发"意味着同一份镜像在不同日期下载会得到不同受试者数——复现他人结果时务必记录下载日期与受试者清单。
§3.8 地域覆盖
单一地理焦点:美国纽约州罗克兰郡(Rockland County)及周边社区。这是设计特征而非缺陷——社区流病式招募要求地理限定,但代价是居住地仅能粗化到郡级(无法满足 HIPAA 18 项完全去标识中的地理项),并构成样本外推的边界条件。人口学构成反映当地 catchment,而非全美代表性样本(官方亦明确声明 baseline 非代表性样本)。
§3.9 设备规格
3T MRI 平台(NKI 先进脑成像中心 CABI),核心创新为将 HCP 式多波段(multiband/SMS)快 TR 序列引入开放数据:静息 fMRI 同时提供 TR=645 ms(3 mm)与 1400 ms(2 mm)两种多波段协议及传统 2500 ms EPI;DTI 为 137 方向 2 mm 多波段方案(<7 min)。任务 fMRI 附带 Vision Egg 刺激脚本以保证刺激条件可复现。扫描同步记录心脏与呼吸生理信号,为生理噪声回归提供原始通道。
§3.10 深度溯源链
| 层级 | 内容 |
|---|---|
| 资助 | NIMH(R01MH094639、U01MH099059、R01AG047596、R01MH101555 等)、NY State Office of Mental Health、Child Mind Institute |
| 采集 | Nathan S. Kline Institute for Psychiatric Research(Orangeburg, NY)先进脑成像中心 |
| 整编 | FCP/INDI 联盟(NITRC 托管);COINS 平台(表型信息化);BIDS 化由 FCP-INDI 维护 |
| 分发 | fcon_1000.projects.nitrc.org(Neuroimaging Release,CC BY-NC)→ LORIS(data.rocklandsample.rfmh.org)/ COINS Data Exchange(Full Phenotypic Release,DUA)→ NDA(Sample II) |
| 描述论文 | Nooner et al., 2012(doi:10.3389/fnins.2012.00152);纵向儿科子研究:Tobe et al., 2022(doi:10.1038/s41597-022-01329-y) |
§4 数据结构
§4.0 目录树
BIDS 版(RawDataBIDSLatest)解压后的典型结构如下(受试者 ID 为 A 开头的 8 位编号,session 名依研究波次而异):
RawDataBIDSLatest/
├── dataset_description.json # BIDS 数据集描述
├── participants.tsv # 受试者清单(subject_id 等)
├── sub-A00028185/
│ ├── ses-NFB3/ # 研究波次 session(名称随子研究而异)
│ │ ├── anat/
│ │ │ └── sub-A00028185_ses-NFB3_T1w.nii.gz
│ │ ├── fmap/ # 场映射(畸变校正用)
│ │ │ ├── sub-A00028185_ses-NFB3_magnitude1.nii.gz
│ │ │ └── sub-A00028185_ses-NFB3_phasediff.nii.gz
│ │ └── func/
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-645_bold.nii.gz
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-645_bold.json
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-1400_bold.nii.gz
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-1400_bold.json
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-2500_bold.nii.gz
│ │ ├── sub-A00028185_ses-NFB3_task-rest_acq-2500_bold.json
│ │ ├── sub-A00028185_ses-NFB3_task-breathhold_acq-1400_bold.nii.gz
│ │ └── sub-A00028185_ses-NFB3_task-checkerboard_acq-1400_bold.nii.gz
│ └── ses-NFB3/(同上,另一波次或重测扫描)
├── sub-A00032778/ ...
└──(共 1,334 例受试者目录)
受试者 ID、session 命名与实际文件存在性以你下载当日 S3 清单为准;非全部受试者均拥有全部三种 TR 序列(缺失是该数据集常态,见 §4.5)。
§4.1 DAIMS 8 列字段字典
以 BIDS 公开层 + 公开表型三列为核心字典(高维表型字段随量表众多,以 LORIS 导出字典为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| subject_id | str | 受试者唯一标识(BIDS 目录名) | sub-A00028185 | 样本索引/泄漏防控 | 无(系统生成) | 无 | A+8 位数字 |
| session | str | 扫描波次/会话 | ses-NFB3 | 区分纵向波次 | 无 | 无 | 数据集特定 |
| task | str | 任务类型 | task-rest | 区分静息/任务 | 无 | 无 | rest/breathhold/checkerboard 等 |
| acq | str | 采集协议标签(TR 协议) | acq-1400 | 区分 645/1400/2500 ms | 无 | 无 | 645/1400/2500 |
| RepetitionTime | float | BOLD 重复时间(秒,JSON) | 1.4 | 协议一致性检查 | 无 | JSON 缺失 | 0.645/1.4/2.5 |
| AGE | float | 受试年龄(岁,公开表型) | 34.7 | 脑龄回归核心标签 | 自报/核实误差 | 空值=未公开 | 6-85 |
| SEX | str | 性别(公开表型) | M / F | 分层/公平性分析 | 自报 | 空值=未公开 | M/F |
| HANDEDNESS | str | 利手(公开表型) | R / L | 分层变量 | 自评量表 | 空值=未公开 | R/L/混合 |
| 诊断访谈结果 | str | DSM-IV 结构化访谈诊断(DUA 层示例字段) | ADHD-CT 等 | 症状建模/亚组 | 评估者间信度依赖培训 | 未评估=NA | 量表特定 |
| 量表条目 | int | 条目级响应(DUA 层,如 CBCL/SWAN) | 0/1/2(CBCL 三级) | 维度化建模核心 | 拒答/漏答非随机 | 999 类哨兵值视量表而定 | 量表定义域 |
| 体动记录 | float | 活动计数/睡眠参数(DUA 层) | sleep_efficiency=0.91 | 日节律协变量 | 佩戴依从性差异 | 未佩戴=空 | 设备定义域 |
DUA 层字段(诊断、量表、实验室、体动)的完整字典随 LORIS/COINS 导出提供;上表仅列代表性字段形态。
§4.2 标签分布
公开层连续标签:AGE 覆盖 6-85 岁全谱(社区招募,各年龄段近均匀铺开,儿童与老年端样本相对更薄);SEX 与 HANDEDNESS 为类别标签(利手以右利为主流)。真正的"任务标签"(症状维度、诊断)位于 DUA 表型层,呈连续分布且按量表年龄版本分层。请注意:官方未发布按任务的划分文件,标签分布应在自己下载的镜像上重新统计(见 §5)。
DUA 层标签的两个结构性特点,建模前必须内化:
- 连续优先:社区跨诊断设计使症状量表天然呈连续分布,官方团队亦建议社区样本表型优先采用"维度分布"工具(如 SWAN 之于 Conners),因此回归/分位数建模比二分类更贴合数据本性。
- 版本分层:同一构念在儿童/成人使用不同量表(如抑郁维度分别由儿童与成人工具覆盖),跨年龄段聚合时以标准化分数对齐,或显式把量表版本作为协变量,否则模型学到的可能是"年龄 × 工具"的伪相关。
§4.3 关键统计
| 统计项 | 数值/描述 | 来源 |
|---|---|---|
| Sample I 受试者总数 | 1,500 | 官方 NKI-RS I 页面 |
| BIDS 公开镜像 | 1,334 例 | FCP-INDI 分发记录 |
| 年龄覆盖 | 6-85 岁 | 设计目标 |
| 静息 TR 协议数 | 3(645/1400/2500 ms) | 发布协议 |
| DTI 采集 | 137 方向 / 2 mm / <7 min | 发布协议 |
| 多波段重测试点 | 24 人(独立 DOI) | FCP-INDI |
| 纵向儿科子研究 | N=369,24-30 个月 | Tobe et al., 2022 |
| 重测/纵向可用性(一项脑龄研究口径) | 重测 N=120(<1 个月);纵向 N=77(1.22±0.29 年) | Zhao et al., 2019 |
| 公开表型列数 | 3(AGE/SEX/HANDEDNESS) | 发布结构 |
细节来源:Sample I 合计 1,500 名受试者、BIDS 镜像 1,334 例(来源);每名受试者尝试三种 TR 静息协议 + DTI + 任务序列,但实际可用组合因人因波次而异(官方 QC 主要覆盖 1400 ms 协议)。
§4.4 数据层级
项目(NKI-RS)
└── 受试者(subject_id,如 A00028185)
└── 波次/会话(session,纵向波次与重测扫描)
└── 序列(modality/task/acq,如 task-rest acq-1400)
└── 文件(NIfTI + JSON sidecar)
表型侧:受试者 → 评估域(五大域)→ 量表 → 条目级响应
基因侧:受试者 → 血液/唾液样本 → 分型数据
影像与表型在受试者层面联结;条目级表型经 COINS/LORIS 关联到同一 subject_id。
§4.5 缺失值与信息性缺失编码表
| 缺失场景 | 机制 | 对 AI 的影响 | 处理建议 |
|---|---|---|---|
| 部分受试者缺少某 TR 协议 | 序列尝试但未全部成功;QC 淘汰 | 协议维度样本不平衡 | 建模前显式记录 acq 协议为协变量 |
| 公开表型仅 3 列 | 设计性分层(其余入 DUA 层) | 无法仅凭公开层做行为建模 | 需行为标签时走 DUA 流程 |
| 纵向波次未到齐 | 季度前瞻发布、采集进行中 | 失访模式非随机 | 按波次建模并对失访建模敏感性分析 |
| 量表年龄版本不同 | 儿童版/成人版工具并存 | 条目空间不齐 | 用标准化分数或按年龄段分层建模 |
| JSON sidecar 字段缺失 | BIDS 1.0.0 早期整理遗留 | fMRIPrep 校验告警 | 见坑点 4(IntendedFor/SliceTiming 补齐) |
§5 划分与使用建议
§5.1 官方划分
官方不提供训练/验证/测试划分——NKI-RS 定位为发现科学资源而非竞赛基准。这是社区实践中的第一共识:任何论文中的"NKI-RS 结果"都对应作者自定义的子样本与划分,横向比较前必须核对样本筛选标准(官方明确要求发表时仔细记录筛选准则)。
§5.2 社区惯例划分
- 随机分层 + 协议分层:按 AGE 分箱(如 6-12/13-17/18-59/60+)与 acq 协议做分层抽样,保证各折叠年龄谱与协议分布一致。
- 受试者级划分:一切划分必须在 subject_id 层面进行(见 §5.3)。
- 外部验证式划分:以 NKI-RS 作外部测试集(如 HBN 训练 → NKI-RS 验证的脑龄研究范式),或反向使用。
- 重测配对保留:TRT 试点与样本内重扫子集单独存放,用于可靠性评估而非训练。
§5.3 泄漏风险(重点)
NKI-RS 的泄漏面比常规数据集更宽,源自三重重复结构:同一受试者多波次扫描(session)、约 3 周内重扫子集(TRT)、纵向儿科子研究多波次;此外社区招募意味着家庭成员可能同属样本。若按文件级随机划分,同一颗脑出现在训练与测试两侧,指标将显著虚高。铁律:以 subject_id 为最小划分单元;如涉及家族聚集或同一住址受试者,按家族/家庭组划分更稳妥。跨研究复用(NKI-RS ↔ HBN/ABIDE)时还需注意采集站点与协议差异造成的分布位移。
§5.4 交叉验证建议
推荐 5-10 折分组 K 折(GroupKFold,按 subject_id 或家族分组),外层再按年龄段做嵌套校验;脑龄类任务普遍以年龄分层 + 性别分层抽样构建折叠。报告指标时附上各折样本的年龄/协议构成,便于读者判断外推范围。
§5.5 外部验证建议
优先级排序:① 同门系列(ABIDE、ADHD-200、HBN——同为 FCP/INDI 生态,表型可对接);② HCP/UK Biobank(成人端,协议差异大,是检验协议鲁棒性的好标靶);③ 本地临床队列(如具备)。跨数据集使用时统一 BIDS 化并记录协议差异(TR、体素、扫描时长),避免把协议效应误读为人群效应。
§5.6 划分方案速查
| 研究目标 | 推荐划分 | 分组键 | 注意事项 |
|---|---|---|---|
| 脑龄回归(单协议) | 5 折 GroupKFold + 年龄分箱分层 | subject_id | 每折报告年龄范围与 MAE 分箱 |
| 脑-行为关联(DUA 层) | 10 折 + 症状得分分位分层 | subject_id | 量表版本需在折内一致 |
| 跨库外部验证(NKI↔HBN) | 单库训练/另一库全量测试 | 数据集 | 先做协议谐波化再比较 |
| 可靠性研究 | TRT 子集独立成组 | subject_id + session | 重复测量进混合效应模型 |
| 协议稳健性检查 | 按协议切三份独立实验 | acq(645/1400/2500) | 结论须在 ≥2 个协议内复现 |
| 家族聚集样本 | 按家庭组分折 | family_id(自行从表型推断) | 无法确定时保守按 subject_id 并声明局限 |
§6 AI 就绪指南
§6.0 云端快速启动
数据托管于 AWS S3 公开桶(FCP-INDI),支持免签名匿名访问;在 SageMaker/EC2/GCP 等任何具备 AWS CLI 的环境即可直接拉取:
# 前置:安装 AWS CLI(任何云主机或本地)
# 查看桶内结构(匿名列出)
aws s3 ls --no-sign-request s3://fcp-indi/data/Projects/RocklandSample/RawDataBIDSLatest/ | head
# 或先下载完整 S3 链接清单做本地筛选
wget http://fcon_1000.projects.nitrc.org/indi/enhanced/aws_links.csv
完整镜像为 TB 量级,云端建议先拉清单、按受试者过滤后再同步(见 §6.2),避免整桶全量下载。
§6.1 快速上手
目录结构预期:以下脚本假设你的本地目录为
data_root/
└── RawDataBIDSLatest/ # BIDS 根(S3 下载产物)
├── dataset_description.json
├── participants.tsv
└── sub-A*/ses-*/anat|func|fmap/...
data_root 拼接关系:data_root = 你指定的根目录,实际 BIDS 根为 data_root/RawDataBIDSLatest;所有代码以 bids_root = data_root / "RawDataBIDSLatest" 拼接。最小可用子集:任选 10-20 名受试者的 T1w + task-rest acq-1400 序列即可完整跑通下述 DataLoader——这也是官方 QC 覆盖最全的协议。
# pip install nibabel numpy torch
from pathlib import Path
import nibabel as nib
import numpy as np
import pandas as pd
data_root = Path("./data") # 你的根目录
bids_root = data_root / "RawDataBIDSLatest" # BIDS 根 = data_root + 固定子目录
# ---- 1) 枚举受试者与可用的 静息1400 序列 ----
episodes = []
for sub_dir in sorted(bids_root.glob("sub-*")):
subject_id = sub_dir.name.removeprefix("sub-")
for bold in sub_dir.glob("ses-*/func/*task-rest_acq-1400_bold.nii.gz"):
episodes.append({"subject_id": subject_id, "bold": str(bold)})
print(f"可用 静息1400 序列数: {len(episodes)}")
# ---- 2) 读取公开表型(participants.tsv 或官方 pheno CSV)----
# 公开表型三列:AGE / SEX / HANDEDNESS(若用 participants.tsv 列名可能不同,注意对齐)
pheno = pd.read_csv(bids_root / "participants.tsv", sep="\t")
print(pheno.head())
# ---- 3) 抽查一个影像文件 ----
img = nib.load(episodes[0]["bold"])
print(img.shape, img.header.get_zooms()) # 如 (64, 64, 33, 930) 与 (2.0, 2.0, 2.0, 1.4)
§6.2 数据获取
| 渠道 | 内容 | 认证 | 说明 |
|---|---|---|---|
| AWS S3(公开桶) | BIDS 影像 RawDataBIDSLatest | 无需注册(--no-sign-request) |
推荐主通道,支持按受试者过滤 |
| NITRC / fcon_1000 网页 | 压缩包逐受试者点选下载 | 无 | 小样本试用友好 |
| LORIS(data.rocklandsample.rfmh.org) | 高维表型 | DUA 审批后账号 | 条目级问卷/诊断/实验室 |
| COINS Data Exchange | 高维表型(另一入口) | DUA | 官方称 DUA 审批 <5 分钟(机构签名公证) |
| NDA | Sample II 增量 | NDA 账号 | 纵向/新增波次 |
# 1) 精准拉取:仅下载 10 名受试者的完整数据(把 A00028185 等换成清单内实际 ID)
for SUB in A00028185 A00032778 A00036049 A00037530 A00039378; do
aws s3 sync --no-sign-request \
"s3://fcp-indi/data/Projects/RocklandSample/RawDataBIDSLatest/sub-${SUB}" \
"./data/RawDataBIDSLatest/sub-${SUB}"
done
# 2) 全量镜像(TB 量级,谨慎执行;建议 nohup/断点续传)
# aws s3 sync --no-sign-request \
# s3://fcp-indi/data/Projects/RocklandSample/RawDataBIDSLatest ./data/RawDataBIDSLatest
# 3) 表型(DUA 审批后):按 LORIS/COINS 站点指引导出 CSV
下载完整性自检(下载后立即执行,建立实验快照):
# 受试者目录数、各模态文件数、JSON sidecar 数——三项写入 MANIFEST,随实验存档
echo "subjects: $(ls ./data/RawDataBIDSLatest | grep -c '^sub-')"
echo "bold files: $(find ./data/RawDataBIDSLatest -name '*_bold.nii.gz' | wc -l)"
echo "json sidecars: $(find ./data/RawDataBIDSLatest -name '*_bold.json' | wc -l)"
find ./data/RawDataBIDSLatest -type f | sort | xargs sha1sum > MANIFEST.sha1 # 可选:完整哈希
§6.3 预处理全流程
推荐以 fMRIPrep 为骨架(官方文档与斯坦福教程均以 NKI 数据示范)。先补齐 BIDS 1.0.0 元数据短板,再跑流水线:
# 步骤 0:BIDS 校验(预期会有 IntendedFor / SliceTiming 告警 → 见坑点 4)
docker run --rm -v $PWD/data:/data:ro -v $PWD/out:/out \
nipreps/fmriprep:latest /data/RawDataBIDSLatest /out/fmriprep participant \
--participant-label A00028185 \
--fs-license-file /data/license.txt \
--ignore slicetiming \ # sidecar 无 SliceTiming 时的稳妥选择
--output-spaces MNI152NLin2009cAsym
# 结构像线:fMRIPrep 内建 FreeSurfer 表面重建;defacing 数据需重点核对结果(坑点 1)
# 步骤 1:静息 fMRI 去噪(confounds → numpy,最小闭环示例)
import numpy as np, pandas as pd
conf = pd.read_csv("out/fmriprep/sub-A00028185/func/"
"sub-A00028185_ses-NFB3_task-rest_acq-1400_bold_confounds.tsv",
sep="\t")
cols = ["trans_x", "trans_y", "trans_z", "rot_x", "rot_y", "rot_z", # 24P 运动参数
"framewise_displacement", "a_comp_cor_00", "a_comp_cor_01",
"csf", "white_matter", "global_signal"]
nuis = conf[cols].fillna(method="bfill")
# FD 阈值(0.5 mm)统计被"污染"的时间点比例,作为 QC 指标
fd = conf["framewise_displacement"].fillna(0).to_numpy()
print(f"FD>0.5 的时间点占比: {(fd > 0.5).mean():.2%}")
# 步骤 2:ROI 时间序列(Schaefer 100/400 atlas 皆可,用 nilearn)
from nilearn.maskers import NiftiLabelsMasker
masker = NiftiLabelsMasker(
"schaefer_2018_400Parcels_17Networks_order_FSLMNI152_2mm.nii.gz",
standardize=True, detrend=True, low_pass=0.08, high_pass=0.01, t_r=1.4)
ts = masker.fit_transform("out/fmriprep/.../task-rest_acq-1400_bold_"
"space-MNI152NLin2009cAsym_desc-preproc_bold.nii.gz")
fc = np.corrcoef(ts.T) # 400x400 功能连接矩阵
np.save("sub-A00028185_fc400.npy", fc) # 进入特征库
对齐注意:645 ms 数据时间自相关特性与常规不同(见坑点 3);跨协议联合分析时建议先在协议内分别建特征、再以协议为协变量合并,而非混池平均。
结构像侧(形态学特征,供 §6.4 的 t1_features 输入):
# FreeSurfer 重建(defaced 数据,注意坑点 1:逐例核对 recon-all 报告)
recon-all -s sub-A00028185 -i ./data/RawDataBIDSLatest/sub-A00028185/ses-NFB3/anat/sub-A00028185_ses-NFB3_T1w.nii.gz -all -qcache
# 或直接采用 fMRIPrep 的 --fs-no-reconall 关闭表面流,用Volume基线
# 形态学特征导出:aseg.stats 汇总为定长向量(皮层厚度均值 + 分区体积)
import re, numpy as np
from pathlib import Path
def extract_t1_features(freesurfer_subj_dir: str) -> np.ndarray:
"""从 FreeSurfer subjects/<id>/stats 汇出定长特征向量。
特征 = 全脑皮层厚度均值/标准差 + aseg 各分区体积(标准化为颅内体积比)。
目标目录结构:freesurfer_subj_dir/<subject_id>/stats/{aseg.stats,lh.aparc.stats}"""
root = Path(freesurfer_subj_dir)
feats = []
aseg = (root / "stats" / "aseg.stats").read_text()
icv = float(re.search(r"Estimated Total Intracranial Volume, (\d+)", aseg).group(1))
for line in aseg.splitlines():
m = re.match(r"^\s*\d+\s+(\S+)\s+(\d+)", line)
if m: # 结构名 + 体积
feats.append(int(m.group(2)) / icv) # 颅内体积归一
for hemi in ("lh", "rh"):
aparc = (root / "stats" / f"{hemi}.aparc.stats").read_text()
th = [float(l.split()[4]) for l in aparc.splitlines()
if l and l.split()[0].isdigit()] # 68 分区皮层厚度
feats += [np.mean(th), np.std(th)] + th
return np.asarray(feats, dtype=np.float32) # 逐受试者定长向量 → *_t1_features.npz
§6.4 PyTorch DataLoader 完整代码
任务示例:脑龄回归(T1 形态学特征 + 功能连接双分支输入),数据为 BIDS 影像 + 公开三列表型;划分按 subject_id 分组(见 §5.3)。
import numpy as np
import pandas as pd
import torch
from pathlib import Path
from torch.utils.data import Dataset, DataLoader
class NKIRSAgeDataset(Dataset):
"""脑龄回归数据集。
预期目录结构(data_root 由调用方传入,BIDS 根固定为其下 RawDataBIDSLatest):
data_root/
├── features/ # §6.3 产出的逐受试者特征
│ ├── A00028185_fc400.npy # 400x400 功能连接矩阵
│ └── A00028185_t1_features.npz # FreeSurfer/多图谱形态学特征
└── pheno.csv # 列: subject_id, AGE, SEX
划分说明:fold 由外部按 subject_id 分组生成(GroupKFold),本类不做切分。
"""
def __init__(self, data_root: str, subject_ids, transform=None):
self.root = Path(data_root)
self.ids = list(subject_ids)
pheno = pd.read_csv(self.root / "pheno.csv").set_index("subject_id")
self.age = {sid: float(pheno.loc[sid, "AGE"]) for sid in self.ids}
self.transform = transform
def __len__(self):
return len(self.ids)
def __getitem__(self, idx):
sid = self.ids[idx]
fc = np.load(self.root / "features" / f"{sid}_fc400.npy")
iu = np.triu_indices(400, k=1) # 上三角向量化
fc_feat = fc[iu].astype(np.float32)
t1 = np.load(self.root / "features" / f"{sid}_t1_features.npz")
t1_feat = t1["features"].astype(np.float32)
x = np.concatenate([fc_feat, t1_feat])
if self.transform:
x = self.transform(x)
return torch.from_numpy(x), torch.tensor(self.age[sid], dtype=torch.float32)
class ClipQuantile:
"""安全增强:按训练集分位数截尾(仅用训练集统计量,防泄漏)。"""
def __init__(self, lo_q=0.01, hi_q=0.99):
self.lo_q, self.hi_q = lo_q, hi_q
self.lo = self.hi = None
def fit(self, X):
self.lo, self.hi = np.quantile(X, [self.lo_q, self.hi_q], axis=0)
return self
def __call__(self, x):
return np.clip(x, self.lo, self.hi)
def make_loaders(data_root, folds, batch_size=64):
tr_ids, va_ids = folds # 外部 GroupKFold 产物
tf = ClipQuantile().fit(
np.stack([NKIRSAgeDataset(data_root, [s])[0][0].numpy() for s in tr_ids]))
ds_tr = NKIRSAgeDataset(data_root, tr_ids, transform=tf)
ds_va = NKIRSAgeDataset(data_root, va_ids, transform=tf) # 验证集仅复用变换
return (DataLoader(ds_tr, batch_size=batch_size, shuffle=True, num_workers=4),
DataLoader(ds_va, batch_size=batch_size, shuffle=False, num_workers=4))
# 训练循环骨架(MLP 脑龄回归)
model = torch.nn.Sequential(
torch.nn.Linear(79_800 + 200, 512), torch.nn.GELU(), torch.nn.Dropout(0.3),
torch.nn.Linear(512, 128), torch.nn.GELU(), torch.nn.Linear(128, 1))
opt = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-2)
lossf = torch.nn.L1Loss() # MAE(岁),脑龄主流指标
# for x, y in train_loader: ... # 标准循环略
§6.5 坑点 8 个
⚠️ 坑点 1:defaced 解剖像对 FreeSurfer 与形态学测量的系统性影响(分类:预处理陷阱)
问题:NKI-RS 出于隐私对全部解剖像做了去面部处理(defacing),官方文档明确提醒这可能影响 FreeSurfer 等依赖面部/头部结构的工具;去面部算法对脑体积估计的扰动在文献中亦有系统报告。
症状:表面重建偶发失败或皮质边缘异常;不同受试者间体积/皮层厚度出现非生物学的小幅系统偏移;跨数据集(未 deface 的 HCP 等)比较时协议差异混入测量误差。
解决:
- 简单方法:跑通后逐例目检 fMRIPrep/FreeSurfer HTML 报告,剔除重建异常个体;
- 进阶方法:避免共享/复用"已 skull-strip"的中间产物,坚持从原始 defaced T1w 重新处理(fMRIPrep 官方 FAQ 明确反对未知预处理级别的输入);对体积类分析,将"是否 deface"作为批间协变量或在协议内做 Z 分数标准化;
- SOTA 方法:体积敏感的纵向/跨库研究改用不依赖面部的配准策略(以脑内解剖标志为准),并用重测子集量化 defacing 引入的测量噪声上限。
参考:NKI-RS 官方 Data Access 文档(fcon_1000.projects.nitrc.org/indi/enhanced/);Impact of defacing on automated brain atrophy estimation, Cancer Imaging, 2022, doi:10.1186/s13244-022-01195-7;fMRIPrep FAQ(nipreps/fmriprep docs/faq.rst)。
⚠️ 坑点 2:三种 TR 协议并存导致的"协议异质性"偏倚(分类:偏倚陷阱)
问题:同一批受试者内并存 TR=645/1400/2500 ms 三种静息协议,且官方 QC 主要覆盖 1400 ms 数据;若不分协议混池训练/统计,协议效应(信噪比、有效时长、采样率)会与年龄/行为效应纠缠。
症状:加一个 acq 哑变量后结果大幅变化;不同论文在"同一数据集"上复现不出彼此的效应量;按协议分组的连接组密度系统性不同。
解决:
- 简单方法:单协议子集建模(645 或 1400),论文明确声明协议口径;
- 进阶方法:协议内标准化 + 协议哑变量回归;合并前对各协议分别做时间带通与规范化,检查组间分布;
- SOTA 方法:把协议作为域标签做域自适应/谐波化(ComBat 类),并以协议间一致效应作为稳健性证据(先证协议内可重复,再谈合并)。
参考:FCP-INDI NKI-RS 发布文档与 QC 说明;Stammen/Sci Rep 2024 中按 NKI_TR645/1400/2500 分别建模的实践(doi:10.1038/s41598-024-51333-y)。
⚠️ 坑点 3:多波段快 TR 数据的时间自相关与多重校正失配(分类:评估误用)
问题:TR=645/1400 ms 的多波段序列改变了 BOLD 时间自相关结构——官方发布说明明确指出分析时必须处理这一变化,且空间平滑度非均匀,常规 Gaussian Random Field(GRF)族丛校正的前提可能不成立。
症状:有效自由度被高估,p 值偏乐观;同一模型在 2500 ms 与 645 ms 数据上显著性不同;梯度/自相关诊断图与教科书形态不符。
解决:
- 简单方法:对快 TR 数据重采样或按块降采样到常规 TR 再做经典检验;
- 进阶方法:使用参数有效自由度/预白化(如 FSL FILM、AFNI 3dREMLfit)替代默认 OLS;丛水平推断改用无需 GRF 假设的置换检验(PALM/FSL 或 permuted GLM);
- SOTA 方法:按 HCP 协作组的快 TR 预处理建议(Beckmann/Smith 团队流程)处理,直接在原生 TR 下以参数化谱方法建模时间依赖。
参考:FCP-INDI NKI 多波段数据发布说明(data-indi/brain release notes;NITRC 公告 msg_id=7516)。
⚠️ 坑点 4:BIDS 1.0.0 元数据不完整——fMRIPrep 校验告警与静默降级(分类:工程陷阱)
问题:NKI BIDS 发布早于现行 BIDS 规范细化,field map 侧缺
IntendedFor、BOLD JSON 缺SliceTiming;斯坦福 fMRIPrep 官方教程即以 NKI 数据为例列出了这些必须处理的告警。
症状:bids-validator 黄色告警;fMRIPrep 跳过或错误执行畸变校正/层计时校正,功能像与结构像对齐残差增大;多人并行处理时报错位置漂移。
解决:
- 简单方法:以
--ignore slicetiming --ignore fieldmaps先跑通(接受无畸变校正的精度损失);- 进阶方法:为 fmap JSON 批量写入
IntendedFor(按受试者目录 glob 生成),对 1400 ms 协议补SliceTiming(SMS 序列按采集厂商参数);- SOTA 方法:用
bidsmreye/sdcflows现行工具链复检校正质量,并以呼吸暂停任务 fMRI(NKI 自带)作为畸变/血管反应性校准的生理参照。
参考:Stanford fMRIPrep 教程(reproducibility.stanford.edu/fmriprep-tutorial-running-the-docker-image/);bids-standard 规范文档。
⚠️ 坑点 5:重测/纵向/多波次结构导致的划分泄漏(分类:数据泄漏)
问题:NKI-RS 内置三种重复结构——同受试者多 session、约 3 周内重扫子集、24-30 个月纵向儿科子研究(N=369);文件级随机划分会让同一颗脑同时出现在训练与测试侧。
症状:测试 MAE/AUROC 好得不像话(脑龄 MAE 低至个位数月);打乱随机种子后指标剧烈波动;审稿人以泄漏质疑复现。
解决:
- 简单方法:一切划分按
subject_id分组(sklearn GroupKFold);- 进阶方法:同时按家族/家庭聚集分组(社区样本常见多成员入组),并把 session 当作受试者内重复测量而非独立样本;
- SOTA 方法:把重复结构当作特性——用重测对报告 ICC 与预测稳定性(如 Zhao et al., 2019 在 NKI-RS 内以 N=120 重测、N=77 纵向子样本检验脑龄模型可靠性),泄漏隐患转化为方法学卖点。
参考:Zhao et al., 2019, NeuroImage 202:116149(doi:10.1016/j.neuroimage.2019.116149);Tobe et al., 2022(doi:10.1038/s41597-022-01329-y)。
⚠️ 坑点 6:把社区样本当"健康对照"库使用(分类:标签理解)
问题:NKI-RS 刻意纳入轻中度精神疾病(过去或现在)受试者,是 transdiagnostic 社区样本;文献反复警告其并非"超级健康对照",且精神量表以缺陷条目为主、优势维度不足。
症状:用"所有受试者=正常发育规范"建模时,规范分位数被临床亚群拖偏;ADHD/抑郁亚组效应消失或反转;与临床队列拼接后分布错位。
解决:
- 简单方法:建模前用 DUA 层诊断/量表得分定义"参考子集",明确排除标准并记录;
- 进阶方法:以症状维度连续建模替代二分类,将诊断状态作协变量;
- SOTA 方法:做规范建模时分位数回归直接容纳异质性,并对"症状载荷"做敏感性分析(纳入/剔除临床亚群对比)。
参考:Tobe et al., 2022(设计依据);Sci Rep 2024 中对 NKI 样本 IQ 与健康自报的筛选描述(doi:10.1038/s41598-024-51333-y)。
⚠️ 坑点 7:条目级高维表型的缺失模式与跨年龄量表版本(分类:工程陷阱)
问题:Full Phenotypic Release 的量表按年龄段使用不同工具(儿童/成人版本并存),条目空间不齐;条目级数据本身缺失模式非随机(长问卷疲劳效应)。
症状:直接 pd.concat 后大量 NaN;以均值填补后模型"学会"了年龄段而非症状;跨年龄段模型在两版量表交界处出现系统性跳变。
解决:
- 简单方法:按年龄段分层建模,或只使用全年龄共有的核心量表(如 CBCL/SWAN 覆盖段);
- 进阶方法:使用量表标准化分数(T 分数/常模分)对齐版本;缺失用多重插补并对插补模型做敏感性分析;
- SOTA 方法:在条目级用IRT/因子模型把不同版本量表映射到统一潜变量,再入模(这也是 NKI 团队推荐的社区样本维度化表型方向)。
参考:Nooner et al., 2012(评估协议五域结构);Tobe et al., 2022(量表清单与年龄分层)。
⚠️ 坑点 8:再识别风险与 DUA 合规边界——二次分发红线(分类:工程陷阱)
问题:NKI-RS 居住地仅粗化到郡级(社区设计所需,官方声明因此不满足 HIPAA 18 项完全去标识),加上条目级高维表型,组合再识别风险真实存在;DUA 明确要求使用者保护保密性并防止泄露。
症状:把高维表型片段+公开表型上传到第三方工具/笔记本平台;在论文附表中放出小格联表(如某郡×某年龄段×罕见诊断);团队同学把 DUA 数据复制到个人网盘。
解决:
- 简单方法:遵守最小必要原则——公开层能完成的分析不用 DUA 层;DUA 层数据不出受控环境;
- 进阶方法:对小样本格做 k-匿名检查(合并稀疏单元格)后再制表;派生特征(连接矩阵、因子分)经渗出评估后才能外发;
- SOTA 方法:建立数据管理计划(DMP):访问审计、加密存储、发布前泄露审查;引用而非重分发(官方要求引用数据源即可,禁止以原格式二次分发)。
参考:NKI-RS Data Access Overview(fcon_1000.projects.nitrc.org/indi/enhanced/);DUA 文本(官方 data/DUA.pdf)。
§6.6 数据增强
| 方法 | 安全性 | 说明 |
|---|---|---|
| 特征级截尾/标准化(训练集统计量) | ✅ | 常规且无泄漏 |
| 时间方向反转(静息 fMRI) | ✅ | 静息信号无方向性,等效增加样本 |
| 裁剪扫描时长(10 min → 随机 5 min 子段) | ✅ | NKI 官方 2500 ms 协议即 5 min,可研究时长敏感性 |
| 连接矩阵 Fisher-Z 后加微噪声 | ✅ | 正则化手段,注意别破坏结构 |
| 水平翻转(影像体数据) | ❌ | 大脑偏侧化真实存在,翻转破坏解剖不对称性 |
| 年龄/性别标签改写式增强 | ❌ | 标签不是噪声,改写即造假 |
| 强幅运动/稀疏伪影注入当"增强" | ❌ | NKI 的运动是真实混杂,不是免费多样性 |
§6.7 模型推荐表
| 任务 | 推荐起点 | 进阶 | 理由 |
|---|---|---|---|
| 脑龄回归 | 岭回归/ElasticNet(特征:皮层厚度+体积) | 分位数回归神经网络 | 线性基线在脑龄任务上长期强势;Zhao et al., 2019 用岭回归取得 r=0.84 级交叉验证表现 |
| 连接组-行为预测 | PLS/CCA + 正则化 | graph-CNN(消息传递) | 样本-特征比低,先浅后深 |
| 症状维度建模 | 弹性网多任务回归 | 多模态变分自编码器 | 条目级高维稀疏,正则化优先 |
| QC/运动预测 | 梯度提升树(FD 统计量特征) | 时序 CNN | FD 与年龄强相关,树模型可解释 |
| 自监督预训练 | MAE/ViT 在 T1 切片 | 跨模态对比学习(T1↔fMRI) | 全生命周期数据适合预训练后再小样本微调 |
§6.8 硬件需求表
| 阶段 | 最低配置 | 推荐配置 |
|---|---|---|
| 下载与整理(20 例) | 4 核 / 16 GB / 100 GB SSD | 8 核 / 32 GB / 500 GB SSD |
| fMRIPrep(单受试者) | 4 核 / 8 GB RAM / 约 2-6 h | 16 核 / 32 GB / FreeSurfer 容器化 |
| fMRIPrep(200 例批量) | 队列化 + 500 GB 工作区 | SLURM 集群 / 云上 32 核 × 并行,工作区 ≥2 TB |
| 特征级模型训练(连接矩阵/形态学) | CPU 即可 | 1× 消费级 GPU(8 GB)加速网格搜索 |
| 端到端影像深度学习 | 1× 12 GB GPU | 2× 24 GB GPU + 混合精度 |
§6.9 评估指标代码
import numpy as np
from scipy.stats import pearsonr
from sklearn.metrics import mean_absolute_error, r2_score
def brain_age_metrics(y_true, y_pred):
"""脑龄回归标准四件套:MAE(岁)、Pearson r、R²、脑龄差偏倚。"""
y_true, y_pred = np.asarray(y_true), np.asarray(y_pred)
pad = y_pred - y_true # predicted age difference (PAD)
return {
"MAE": mean_absolute_error(y_true, y_pred),
"r": pearsonr(y_true, y_pred)[0],
"R2": r2_score(y_true, y_pred),
# 脑龄经典伪影:回归到均值使 PAD 与真实年龄负相关;校正后应≈0
"PAD_age_corr_raw": pearsonr(y_true, pad)[0],
}
def de_biased_pad(y_true, y_pred):
"""简单脑龄去偏:用训练集拟合 PAD ~ age 线性项扣除(Smith et al. 常用思路)。"""
y_true, y_pred = np.asarray(y_true, float), np.asarray(y_pred, float)
b = np.polyfit(y_true, y_pred - y_true, 1) # 仅可在训练集拟合
return (y_pred - y_true) - np.polyval(b, y_true)
def icc2_1(values, targets):
"""单测度 ICC(2,1):重测可靠性(targets=受试者, values=重复扫描)。
输入为长表:每行一个观测。"""
import pandas as pd
df = pd.DataFrame({"t": targets, "v": values})
msb = (df.groupby("t").mean().mean() - df.v.mean()) ** 2
# 简化示意;严格实现请用 pingouin.intraclass_corr
from pingouin import intraclass_corr
return intraclass_corr(df, targets="t", ratings="v",
nan_policy="raise").query("Type=='ICC2'")["ICC"].item()
§6.10 MLOps 笔记
- 数据快照即版本:NKI-RS 季度发布意味着"同一名数据集"会悄悄长大;把下载日期 + 受试者清单哈希写入 DVC/LakeFS 或至少一个
MANIFEST.csv,实验才可复现。 - DUA 数据隔离:公开层与 DUA 层分目录、分权限;训练容器只挂载当次所需层,日志中禁止打印条目级表型原文。
- 协议卡片:每个模型登记 acq 协议构成、年龄范围、defacing 状态;跨协议合并训练时把协议占比写入模型卡。
- QC 前置:把 FD>0.5 mm 占比、FreeSurfer Euler 数等 QC 统计做成特征库常备列——它们既是排除标准也是预测目标。
- 长任务监控:fMRIPrep 批量任务建议以 Nipype/Nextflow 编排,逐受试者断点续跑,失败样本自动进重试队列(NKI 真实数据中总有个体触发长尾错误)。
- 特征库优先:连接矩阵/形态学特征只算一次、版本化存储(parquet/npz + 特征卡),后续模型迭代以特征库为输入——NKI-RS 体量下端到端重算代价高,特征复用是团队效率的分水岭。
- 可重复性披露模板:论文方法节固定披露五元组:下载日期、受试者数、acq 协议构成、FD 剔除标准、划分种子。NKI-RS 的滚动发布特性使这五项缺一不可。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 地理偏倚 | 单一郡招募(罗克兰郡及周边),人口构成非全美代表 | 中 | 外推时声明范围;跨库(HCP/ABCD/HBN)复检 |
| 协议异质性 | 三种 TR 协议并存,QC 覆盖不均 | 中 | 协议分层建模/谐波化(坑点 2) |
| 运动混杂 | 头动随年龄强相关,儿童与老年端 FD 更高 | 高 | FD 协变量/剔除高 FD 帧;运动-年龄联合建模 |
| 临床构成偏倚 | 跨诊断设计纳入轻中度病例,非健康对照库 | 中 | 维度化建模;明确排除标准(坑点 6) |
| 发布时间偏倚 | 季度前瞻发布导致不同时期镜像规模不同 | 低 | 记录下载日期与清单哈希(§6.10) |
| defacing 测量偏倚 | 解剖像去面部影响部分工具的体积/表面输出 | 中 | 逐例 QC + 工具敏感性分析(坑点 1) |
§7.2 标注质量
诊断层依赖 DSM-IV 结构化访谈(受训评估者),量表层为有常模的标准化工具并以条目级电子录入(COINS 平台)消除誊抄误差;影像无病变标注。整体标注质量在开放队列中属上乘,但两个固有限制需内化:① DSM-IV 与现行 ICD-11/RDoC 框架存在代差;② 2 天协议中的自评量表受疲劳影响,条目级缺失非随机(坑点 7)。
§7.3 泛化性表
| 场景 | 失效风险 | 证据/机制 |
|---|---|---|
| 单一郡模型 → 全美/全球部署 | 高 | 地理 catchment 限制;官方明确 baseline 非代表性样本 |
| 成人端模型 → 儿童端(或反向) | 高 | 6-85 岁跨度内脑形态规律分段剧变;量表版本不同 |
| 协议内模型 → 混协议输入 | 中-高 | TR 差异改变信噪与自相关(坑点 2/3) |
| NKI-RS 训练 → HBN/ABIDE 测试 | 中 | 同门数据但站点与人群构成不同;文献显示跨库时性能普遍回落 |
| 症状维度模型 → 临床诊断 | 高 | 社区样本阳性率与临床转诊人群不同;诊断标签为 DSM-IV 代差 |
§7.4 伦理与合规
全部数据按 HIPAA 匿名化(去标识 + defacing + 发布时序随机化),影像层 CC BY-NC 开放;高维表型层以 DUA 约束(机构授权代表签署公证,官方称流程 <5 分钟),DUA 不限制分析范围、不要求共同署名。受试者(未成年人为监护人+本人)经 NKI 与 Montclair State University IRB 批准的协议知情同意。使用者义务:不尝试再识别、不二次分发原格式数据、发表时引用数据源并记录筛选准则。
§7.5 公平性
公开层提供 AGE/SEX/HANDEDNESS 三列,可做基础的亚组公平性审计;更细的人口学维度位于 DUA 层。已知注意点:利手右利占多数、郡级人群构成的族裔分布不等于全美分布,跨性别/性别少数维度在该代资源中无专门设计。公平性研究的可行路径:以性别×年龄段做分箱性能差距(brain age MAE gap)、以协议构成做亚组稳健性检查,并把结论限制在罗克兰郡 catchment 内。
# 亚组公平性审计:性别 × 年龄段的脑龄 MAE 差距(公开表型即可执行)
import pandas as pd
def fairness_audit(y_true, y_pred, demo: pd.DataFrame) -> pd.DataFrame:
df = demo.copy()
df["abs_err"] = abs(pd.Series(y_pred, index=demo.index) -
pd.Series(y_true, index=demo.index))
df["age_bin"] = pd.cut(df["AGE"], bins=[6, 12, 18, 40, 60, 85],
labels=["6-12", "13-18", "19-40", "41-60", "60+"])
tab = df.pivot_table(values="abs_err", index="age_bin",
columns="SEX", aggfunc=["mean", "count"])
tab["max_gap_yrs"] = tab["mean"].max(axis=1) - tab["mean"].min(axis=1)
return tab.round(3) # max_gap 超过模型总体 MAE 的 1/4 即需在论文中披露
§7.6 数据漂移
两条真实的漂移通道:① 队列漂移——季度滚动发布使样本量与构成随时间变化,跨月下载的镜像即"不同数据集";② 协议/流程漂移——Sample I→II 期间序列与发布通道(INDI→NDA)演进。缓解:实验固定数据快照(§6.10)、模型上线后以新季度增量做季度级监测、以重测子集锚定测量系统稳定性。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | BIDS 影像逐文件一观测;表型 CSV 逐受试者一行 |
| 2 | 有唯一标识符列 | ✅ | subject_id(A+8 位)全局唯一,贯穿影像/表型/基因 |
| 3 | 无 Unicode 或特殊字符 | ⚠️ | 影像层规范;表型层个别量表字符串字段含变长文本与标点,需清洗 |
| 4 | 无重复行 | ✅ | 受试者级无重复;重复的是"合法重复测量"(session/TRT),须保留 |
| 5 | 缺失值已识别并编码 | ⚠️ | 影像缺失天然可见(文件不存在);表型层缺失散布且非随机,需自建缺失审计 |
| 6 | 标签列被明确标识 | ⚠️ | 公开层仅 AGE/SEX/HANDEDNESS;行为标签在 DUA 层且无单一"主标签"列 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 诊断类别长尾(社区样本低患病率),罕见诊断需合并或按维度处理 |
| 8 | 已发布偏倚评估 | ✅ | 官方论文明示社区招募/非代表性/跨诊断设计(Nooner 2012;Tobe 2022) |
| 9 | 提供数据字典 | ⚠️ | BIDS 层有标准字典;表型层依赖各量表官方手册,无统一导出字典 |
| 10 | 信息性缺失有解释 | ⚠️ | QC 淘汰/协议未成功可见于 QC 文档;量表拒答动机未系统解释 |
| 11 | 设备与采集参数记录 | ✅ | BIDS JSON(TR/体素)+ 序列说明齐全;扫描同步生理信号为额外加分 |
| 12 | 无共线性风险提示 | ❌ | 官方未提示;年龄-运动-协议三者强相关是已知结构,需自行处理 |
| 13 | 编码映射表(分类→标准码) | ⚠️ | DSM-IV 基础访谈,官方未发布到 ICD-11/SNOMED 的映射 |
| 14 | 时间戳一致性 | ✅ | session/波次结构清晰;发布时序随机化用于隐私,不影响分析时间线 |
| 15 | 提供划分建议 | ❌ | 官方不提供划分;需自行按 subject_id/家族分组(§5.3) |
| 16 | 泄漏风险有讨论 | ✅ | 重复测量/纵向/家族结构在论文与官方文档中均有明示 |
| 17 | 标签分布已发布 | ⚠️ | 年龄/性别构成可见于论文图表;量表维度分布需 DUA 层自行统计 |
| 18 | 测量偏倚已评估 | ✅ | defacing 影响官方主动披露;运动-年龄混杂为文献共识 |
| 19 | 外部验证建议 | ✅ | 官方倡导与未来采集协调对接(harmonization 章节);社区有成熟跨库先例 |
| 20 | 版本记录 | ✅ | 发布公告逐条可查(2013-01 Lite、2013-03 Full、季度滚动) |
| 21 | 提供预处理脚本 | ⚠️ | 官方发布原始层 + QC 文档,不含一键衍生管线;fMRIPrep 教程覆盖 |
| 22 | 合规要求明确 | ✅ | CC BY-NC + DUA 双层结构,义务与禁止事项书面化 |
| 23 | 多模态对齐 | ✅ | subject_id/session 贯穿影像-生理-表型-基因;COINS/LORIS 内联 |
| 24 | 去标识化流程披露 | ✅ | 官方文档详述(去标识、defacing、发布时序随机化、郡级地理粗化) |
DAIMS 评分:17.5 / 24
评分解读:良好偏上——身份体系、多模态对齐、合规与去标识化披露达到开放队列一流水准;主要短板集中在"非竞赛型资源"的天然空缺:无官方划分、无统一表型字典、共线性与罕见类处理留给研究者。
对你意味着什么:① 开工第一天就把 subject_id → session → acq 三级清单建好,它同时是防泄漏与 QC 的地基;② 不要指望下载后即得行为标签——预算 1-2 周走 DUA 并自建表型字典;③ 把"年龄×协议×FD"做成任何模型的第一组协变量,这是该数据集最廉价也最有效的稳健性投资;④ 若你的任务强依赖诊断标签,优先考虑 ABIDE/ADHD-200/HBN,NKI-RS 的价值在维度与生命周期而非病例对照。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| HBN → NKI-RS | Child Mind Institute / NKI | 皮层形态协变模式复现 + 脑龄 ridge 回归 | 年龄预测 r=0.84(交叉验证);NKI-RS 外部验证 N=210 | 非 AUROC 任务 | HBN 训练的协变模式在 NKI-RS 独立复现;NKI-RS 重测(N=120)与纵向(N=77)子样本证实模型可靠性(Zhao et al., 2019, NeuroImage 202:116149) |
| NKI-RS ↔ HCP/UMN/RUB 多库对照 | NKI / HCP / 波鸿鲁尔大学 / 明尼苏达大学 | 功能连接图论指标 × 一般智力 g 因子 | 跨库一致性分析(相关模式) | 非 AUROC 任务 | NKI 三种 TR 静息子集(N=385/348/383)与 HCP 等库结论一致,支持连接组-g 因子关联的稳健性(Sci Rep, 2024, doi:10.1038/s41598-024-51333-y) |
| NKI TRT pilot 内部 | NKI | 多波段协议重测可靠性 | 重复 R-fMRI/DTI 协议可靠性检验 | — | 24 人试点验证了 HCP 式快 TR 序列在社区数据上的可行性与稳定性,成为正式样本的协议依据(FCP-INDI 发布文档) |
外部验证数字均为同行评审或官方文档支撑的原始报告口径,评估协议各异、不可直接横向比较。
§8 基准性能与生态
§8.1 排行榜与研究基准
NKI-RS 没有官方排行榜——它是发现科学资源而非竞赛基准,社区实践以"自定义子样本 + 外部验证"为常态。下表收录以 NKI-RS 为主场或验证场、有同行评审支撑的代表性结果:
| 排名 | 模型/研究 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 脑龄 ridge 回归(HBN 训练,NKI-RS 外部验证) | 年龄预测 r=0.84;NKI-RS 验证 N=210、重测 N=120、纵向 N=77 | 2019 | JIVE 协变分解 + 岭回归 + 重测/纵向可靠性检验 | Zhao Y. et al., 2019, NeuroImage. doi:10.1016/j.neuroimage.2019.116149 | 未公开官方实现 |
| 2 | 连接组图论 × g 因子(NKI 三 TR 子集) | 跨库一致的相关模式(非预测 AUROC 任务) | 2024 | 功能连接图论 + g 因子层级模型 + 协议内分别建模 | Sci Rep 14, doi:10.1038/s41598-024-51333-y | 未公开官方实现 |
⚠️ 数值不可直接比较的原因:两项研究的任务不同(回归 vs 相关分析)、子样本筛选标准不同(健康自报筛选、协议子集)、NKI-RS 无官方划分,任何"同数据集跑分表"都需先核对作者的自定义筛选准则。
§8.2 SOTA 总结与选型建议
在脑龄类任务上,传统特征(形态学度量/连接矩阵)+ 线性模型仍是难以击败的基线,深度模型需要明显更大的样本(通常联合 HBN/ABCD/UK Biobank 预训练)才有优势;NKI-RS 在这条路线上的独特价值是内置重测与纵向子样本——任何声称"更准"的模型都应顺带报告重测 ICC 与纵向稳定性。在脑-行为关联上,维度化建模 + 协议分层是社区共识。若你的目标是刷公开榜单,NKI-RS 不是合适的战场;若目标是方法学严谨性与生命周期覆盖,它是稀缺资产。
§8.3 评测协议建议
- 固定数据快照(记录下载日期与受试者清单哈希);
- subject_id(或家族)分组的 5-10 折 GroupKFold,年龄分箱分层;
- 报告 MAE(岁)+ Pearson r + PAD-年龄相关(脑龄任务);ICC(2,1)(可靠性任务);
- 协议构成(acq 占比)与 FD 统计随结果一同披露;
- 外部验证至少一个同门库(ABIDE/ADHD-200/HBN)或协议差异明确的成人库。
§8.4 相关数据集表
| 数据集 | 关系 | 与 NKI-RS 的互补性 |
|---|---|---|
| ABIDE I/II | 同门(FCP/INDI 系列) | 明确诊断标签(自闭症),弥补 NKI-RS 无影像-诊断切分的短板 |
| ADHD-200 | 同门 | ADHD 竞赛基准,分类任务可直接对标 |
| Healthy Brain Network(HBN) | 生态姐妹库(同 COINS/LORIS 基础设施) | 儿科临床丰富样本;文献中互为外部验证(Zhao 2019 范式) |
| HCP S1200 / HCP-Development | 技术上游 | 多波段序列技术来源;成人深模态对照 |
| ABCD Study | 同代大型队列 | 体量与纵向深度更强,年龄段窄(9-10 岁入组) |
| 1000 Functional Connectomes(FCP-1000) | 直接前身 | 首代开放 rsfMRI 聚合库,NKI-RS 是其"机构中心式"升级版 |
§8.5 关键论文 Top5
- Nooner KB, Colcombe SJ, Tobe RH, … Milham MP. (2012). The NKI-Rockland Sample: A Model for Accelerating the Pace of Discovery Science in Psychiatry. Frontiers in Neuroscience, 6:152. doi:10.3389/fnins.2012.00152 —— 数据集奠基论文:设计理念、2 天协议、开放共享与隐私框架。
- Tobe RH, MacKay-Brandt A, Lim R, … Milham MP. (2022). A longitudinal resource for studying connectome development and its psychiatric associations during childhood. Scientific Data, 9:300. doi:10.1038/s41597-022-01329-y —— 纵向儿科子研究(N=369)设计白皮书,含 pCASL 与量表清单。
- Zhao Y, Klein A, Castellanos FX, Milham MP. (2019). Brain Age Prediction: Cortical and Subcortical Shape Covariation in the Developing Human Brain. NeuroImage, 202:116149. doi:10.1016/j.neuroimage.2019.116149 —— 以 NKI-RS 为外部验证与可靠性检验场的脑龄建模范式。
- Biswal BB, Mennes M, Zuo XN, … Milham MP. (2010). Toward discovery science of human brain function. PNAS, 107(10):4734-4739. doi:10.1073/pnas.0911855107 —— 1000 Functional Connectomes 运动宣言,NKI-RS 的直接思想源头。
- Scientific Reports (2024). Investigating robust associations between functional connectivity based on graph theory and general intelligence. Sci Rep, 14. doi:10.1038/s41598-024-51333-y —— 用 NKI 三种 TR 子集做协议内稳健性检验的近期范例。
§8.6 社区活跃度
- 数据发布后 967+ 次引用(Google Scholar,截至 2026-09),纵向子研究论文另有 57 次引用——在队列类资源中属持续高活跃。
- NITRC 论坛(FCP/INDI)承载发布与答疑;NeuroStars 社区存在大量 NKI-RS 预处理讨论;斯坦福 fMRIPrep 官方教程以其 TRT 数据为教学样本,保证了新生研究者的入门通路。
- 衍生资源持续出现:DSI Studio 纤维重建分发(labsolver)、data-indi GitHub 镜像、qianfanghub 同门系列(abide/adhd-200/1000-functional-connectomes)互链。
- 提问惯例:NITRC/NeuroStars 上 NKI-RS 相关问题通常在 1-2 个工作日内由 FCP-INDI 团队或社区成员回应;发布类公告(如 2013 年 Lite 与 Full Phenotypic Release)均以 NITRC 论坛帖与邮件列表存档形式可查。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| FCP/INDI Enhanced NKI-RS 官方页 | 数据门户 | https://fcon_1000.projects.nitrc.org/indi/enhanced/ | 在线维护 | 获取、协议文档、QC 与 DUA 的总入口 |
| Rockland Sample 官网 | 项目主页 | https://rocklandsample.org | 在线维护 | Sample I/II 说明与协议文档(含原型论文链接) |
| aws_links.csv | 下载清单 | http://fcon_1000.projects.nitrc.org/indi/enhanced/aws_links.csv | 在线 | 全部 S3 对象清单,精准下载的依据 |
| S3 公开桶 | 数据托管 | s3://fcp-indi/data/Projects/RocklandSample/RawDataBIDSLatest | 在线(免签名) | BIDS 影像主通道 |
| LORIS 实例 | 表型门户 | https://data.rocklandsample.rfmh.org/ | DUA 后可用 | 条目级表型导出 |
| COINS Data Exchange | 表型门户(备用) | https://coins.trendscenter.org/ | DUA 后可用 | 表型另一入口,历史文献多由此引用 |
| 24 人 TRT pilot 专页 | 补充数据集 | http://fcon_1000.projects.nitrc.org/indi/pro/eNKI_RS_TRT/FrontPage.html | 在线 | 可靠性研究专用,独立 DOI |
| Stanford fMRIPrep 教程(NKI 版) | 教程 | https://reproducibility.stanford.edu/fmriprep-tutorial-running-the-docker-image/ | 在线 | 官方推荐的预处理入门路径,含 NKI 特有告警处理 |
| data-indi GitHub | 代码/文档镜像 | https://github.com/FCP-INDI | 在线 | NKI-RS 网页源码与发布记录 |
§9 相关资源与引用
§9.1 官方资源清单
- 官方主页:https://fcon_1000.projects.nitrc.org/indi/enhanced/(数据访问、共享政策、QC 文档、FAQ)
- 项目官网:https://rocklandsample.org(Sample I/II、协议手册、发表文献库)
- 数据访问总览:Data Access Overview(Neuroimaging Release 与 Full Phenotypic Release 的边界说明)
- S3 清单:aws_links.csv
- DUA 文本:data/DUA.pdf
- TRT pilot:eNKI_RS_TRT 专页(DOI 10.15387/fcp_indi.corr.nki1)
- 发布历史:NITRC 公告(Lite 2013-01、Full Phenotypic 2013-03)
- 教程:Stanford fMRIPrep × NKI 教程
§9.2 BibTeX 引用块
@article{nooner2012nkirockland,
title = {The {NKI-Rockland} Sample: A Model for Accelerating the Pace of
Discovery Science in Psychiatry},
author = {Nooner, Kate Brody and Colcombe, Stanley J. and Tobe, Russell H.
and Mennes, Maarten and Benedict, Melissa M. and Moreno, Alexis L.
and Panek, Laura J. and Brown, Shaquanna and Zavitz, Stephen T.
and Li, Qingyang and Sikka, Sharad and Gutman, David and Bangaru,
Saroja and Schlachter, Rochelle Tziona and Kamiel, Stephanie M.
and Anwar, Ayesha R. and Hinz, Caitlin M. and Kaplan, Michelle S.
and Rachlin, Anna B. and Adelsberg, Samantha and Cheung, Brian
and Khanuja, Ranjit and Yan, Chaogan and Craddock, Cameron C.
and Calhoun, Vincent and Courtney, William and King, Margaret
and Wood, Dylan and Cox, Christine L. and Kelly, A. M. Clare
and Di Martino, Adriana and Petkova, Eva and Reiss, Philip T.
and Duan, Nancy and Thomsen, Dawn and Biswal, Bharat
and Coffey, Barbara and Hoptman, Matthew J. and Javitt, Daniel C.
and Pomara, Nunzio and Sidtis, John J. and Koplewicz, Harold S.
and Castellanos, Francisco Xavier and Leventhal, Bennett L.
and Milham, Michael P.},
journal = {Frontiers in Neuroscience},
volume = {6},
pages = {152},
year = {2012},
doi = {10.3389/fnins.2012.00152}
}
@article{tobe2022longitudinal,
title = {A longitudinal resource for studying connectome development and
its psychiatric associations during childhood},
author = {Tobe, Russell H. and MacKay-Brandt, Anna and Lim, Ryan
and Kramer, Melissa and Breland, Melissa M. and Tu, Lucia
and Tian, Yiwen and Trautman, Kristin Dietz and Hu, Caixia
and Sangoi, Raj and Alexander, Lindsay and Gabbay, Vilma
and Castellanos, F. Xavier and Leventhal, Bennett L.
and Craddock, R. Cameron and Colcombe, Stanley J.
and Franco, Alexandre R. and Milham, Michael P.},
journal = {Scientific Data},
volume = {9},
pages = {300},
year = {2022},
doi = {10.1038/s41597-022-01329-y}
}
@article{biswal2010discovery,
title = {Toward discovery science of human brain function},
author = {Biswal, Bharat B. and Mennes, Maarten and Zuo, Xi-Nian and Gohel,
Suril and Kelly, Clare and Smith, Stephen M. and Beckmann, Christian F.
and Adelstein, Jonathan S. and Buckner, Randy L. and Colcombe, Stan
and Dogonowski, Anne-Marie and Ernst, Monique and Fair, Damien
and Hampson, Michelle and Hoptman, Matthew J. and Hyde, James S.
and Kiviniemi, Vesa J. and K{\"o}tter, Rolf and Li, Shi-Jiang
and Lin, Ching-Po and Lowe, Mark J. and Mackay, Clare and Madden,
David J. and Madsen, Kristoffer H. and Margulies, Daniel S.
and Mayberg, Helen S. and McMahon, Katie and Monk, Christopher S.
and Mostofsky, Stewart H. and Nagel, Bonnie J. and Pekar, James J.
and Peltier, Scott J. and Petersen, Steven E. and Riedl, Verena
and Rombouts, Serge A. R. B. and Rypma, Bart and Schlaggar, Bradley L.
and Schmidt, Steffi and Seidler, Rachelle D. and Siegle, Greg J.
and Sorg, Christian and Teng, Gao-Jun and Veijola, Juha
and Villringer, Arno and Walter, Martin and Wang, Lixia
and Weng, Xuchu and Whitfield-Gabrieli, Susan and Williamson, Peter
and Windischberger, Christian and Zang, Yu-Feng and Zhang, Hong-Ying
and Castellanos, F. Xavier and Milham, Michael P.},
journal = {Proceedings of the National Academy of Sciences},
volume = {107},
number = {10},
pages = {4734--4739},
year = {2010},
doi = {10.1073/pnas.0911855107}
}
@article{zhao2019brainage,
title = {Brain Age Prediction: Cortical and Subcortical Shape Covariation
in the Developing Human Brain},
author = {Zhao, Yihong and Klein, Arno and Castellanos, F. Xavier
and Milham, Michael P.},
journal = {NeuroImage},
volume = {202},
pages = {116149},
year = {2019},
doi = {10.1016/j.neuroimage.2019.116149}
}
§9.3 引用指南
- 使用影像数据:引用 Nooner et al. 2012(并建议注明下载日期与受试者清单哈希);
- 使用纵向儿科子研究:追加引用 Tobe et al. 2022;
- 使用 TRT pilot:引用其专页 DOI 10.15387/fcp_indi.corr.nki1 及 Nooner et al. 2012;
- 官方明确要求:不需要共同署名、不需要审稿、不需要提交分析计划;但发表时须仔细记录对样本的筛选准则——这是社区惯例,也是可重复性的底线。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 环节 | 使用模型/工具 | 用途 |
|---|---|---|
| 资料检索与汇总 | 大语言模型(CodeBuddy Code) | 检索要点归纳、初稿撰写 |
| 事实核验 | 大语言模型 + WebSearch | 交叉核对数字与来源 |
| 语言润色 | 大语言模型 | 中英混排与术语统一 |
§10.2 AI 参与范围
AI 参与了检索汇总、初稿撰写与格式整理;章节结构、事实取舍、数字来源核验、医学与工程结论由千方病案医学编辑部人工审核定稿。
§10.3 输入来源列表
- Nooner KB, et al. (2012). Frontiers in Neuroscience, 6:152. doi:10.3389/fnins.2012.00152. PMID 23087608
- Tobe RH, et al. (2022). Scientific Data, 9:300. doi:10.1038/s41597-022-01329-y. PMCID PMC9197863
- Zhao Y, Klein A, Castellanos FX, Milham MP. (2019). NeuroImage, 202:116149. doi:10.1016/j.neuroimage.2019.116149. PMID 31476430
- FCP/INDI Enhanced NKI-RS 官方页(数据访问/QC/DUA):https://fcon_1000.projects.nitrc.org/indi/enhanced/
- NKI-RS Data Access Overview(GitHub FCP-INDI/nki-rs-webpages):https://github.com/FCP-INDI/nki-rs-webpages/blob/master/access.html
- Rockland Sample 官网(NKI-RS I 概览):https://rocklandsample.org?p=798/
- NITRC 发布公告(Lite Release,2013-01-02):https://nitrc.org/forum/message.php?msg_id=7516
- Neurobureau-hubs 邮件存档(Full Phenotypic Release,2013-03-07):https://www.nitrc.org/pipermail/neurobureau-hubs/2013-March/000317.html
- Atlas of Longitudinal Datasets NKI-RS 条目:https://atlaslongitudinaldatasets.ac.uk/datasets/nki-rs
- JAMA Network Open 2024 数据共享声明(NKI-RS 访问路径官方复述):JAMA Netw Open. doi:10.1001/jamanetworkopen.2023.55901(附 PDF)
- Scientific Reports (2024). doi:10.1038/s41598-024-51333-y(NKI 三 TR 子集 g 因子研究,含样本筛选细节)
- Stanford Center for Reproducible Neuroscience:fMRIPrep 教程(NKI TRT 数据示例与 BIDS 告警清单)
- data-indi/brain 发布说明(multiband 数据注意事项、TRT pilot 协议表):https://github.com/data-indi/brain/releases
- labsolver.org NKI Rockland 专页(license 表述、纵向波次标签、DTI 重建参数):https://brain.labsolver.org/nki_rockland.html
- Cancer Imaging (2022). doi:10.1186/s13244-022-01195-7(defacing 对脑体积估计的影响综述)
- Google Scholar 引用计数快照(Nooner 2012:967+;Tobe 2022:57,截至 2026-09)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 schema_org 双节点一致性 | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
| INFOBOX 22 字段与来源核对 | 千方病案医学编辑部 | 与官方页面及论文逐项比对 | ✅ 已验证 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | WHO ICD-11 浏览器与 SNOMED CT 检索复核 | ✅ 已通过 |
| §3-§4 规模数字与数据结构 | 千方病案医学编辑部 | 与 FACTS.md 来源清单逐条溯源 | ✅ 已验证 |
| §5 划分与泄漏策略 | 千方病案医学编辑部 | 数据工程复核(subject 分组原则) | ✅ 已通过 |
| §6 预处理 Pipeline 与 8 坑点 | 千方病案医学编辑部 | 与官方文档/教程/issues 交叉比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 24 项评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准数字与引用表述 | 千方病案医学编辑部 | 与原文及 Scholar 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cam-can — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- 1000-functional-connectomes — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- aomic — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- ppmi — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- healthy-brain-network — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- aibl — 共享标签:神经科学 / 公共卫生与流行病学 / 队列研究
- ckb — 共享标签:公共卫生与流行病学 / 队列研究
- biccn — 共享标签:神经科学 / 公共卫生与流行病学
- allen-brain-atlas — 共享标签:神经科学 / 公共卫生与流行病学
- all-of-us — 共享标签:公共卫生与流行病学 / 队列研究
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
