信息速览

ABCD — 青少年脑发育纵向队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Adolescent Brain Cognitive Development Study |
| 英文全称 | The Adolescent Brain Cognitive Development (ABCD) Study® |
| 别名/简称 | ABCD Study、ABCD、ABCD 联盟 |
| 疾病分类 | 一般人群发育队列,非特定疾病库(关联精神健康/物质使用等:ICD-11 参考 6A7Z 抑郁障碍 / 6C40 使用酒精所致障碍 / 6C41 使用大麻所致障碍等,见 §2.1) |
| SNOMED CT | 参见 §2.1b(如 191604008 儿童青少年发育评估 / 192979006 童年情绪障碍 / 66214007 青少年精神健康问题筛查等) |
| 数据模态 | 脑结构/功能 MRI、行为心理量表、认知测试、遗传与生物样本、环境地理 |
| AI 任务类型 | 发育轨迹预测、脑龄预测、精神健康风险预测、物质使用预测、结构/功能影像分类与回归、遗传影像关联、亲属嵌套机器学习 |
| 样本总数 | 11,878 名入组儿童(约 2,100 名双胞胎/三胞胎)/ 21 个采集点 / 随访至成年 |
| 数据大小 | 约 100 TB(累计全模态) |
| 数据格式 | NDA tabulated(.txt/.Rds)+ NIfTI/DICOM(BIDS)+ FreeSurfer derivatives + 基因型/测序 VCF |
| 许可证 | NDA Data Use Certification(DUC),受控访问,非公开下载 |
| 访问级别 | 申请审核(NDA / NBDC Data Hub,凭 DUC) |
| DUO 标签 | IRB + PUB(需经批准与数据使用认证;发布需注册 NDA Study) |
| 语言 | 英语 |
| 首发日期 | 2017 年(Fast Track);2019-04-02(Data Release 2.0) |
| 最后更新 | 2026 年(Data Release 7.0) |
| 发布机构 | ABCD Consortium(NIH/NIDA 主导;托管于 NIMH Data Archive) |
| 官方主页 | https://abcdstudy.org/ |
| 下载地址 | https://nda.nih.gov/abcd |
| DOI | 各 release 单独 DOI(如 10.15154/1520504) |
| 引用次数 | Casey 2018 影像论文约 2,600+;Hagler 2019 管线约 865(截至 2026-09,Google Scholar/PlumX) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方 curated 与集中处理管线现成,但划分/亲属拆分与版本兼容需自行实现,坑点较多 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、青少年发育与精神健康/物质使用临床任务定义、人群与金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(NDA 表层级与成像 QC 纳入变量)、§5 数据划分策略(亲属/位点嵌套)、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 ABCD Consortium、NIDA、NIMH Data Archive 无任何商业利益关联。本页面不销售 ABCD 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 ABCD 相关机构任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ABCD 数据托管于 NIMH Data Archive(NDA),为受控访问:研究者须创建 NDA 账户、完成 NDA Data Use Certification(DUC)与负责的数据/生物样本使用培训,经批准后通过 NDA 或 NBDC Data Hub 访问;自 2025-06-02 起 NDA 不再接受新的 ABCD 访问申请,新访问改经 NBDC Data Hub。发布基于 NDA 数据的研究前须创建 NDA Study 并登记 DOI。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? ABCD(Adolescent Brain Cognitive Development)是美国 NIH 主导的迄今最大青少年脑发育纵向队列。2016-2018 年从 21 个美国采集点通过学校系统招募了 11,878 名 9-10 岁儿童,将一路随访到 19-20 岁成年初期。每一名儿童都做了约 2 小时的脑部磁共振扫描,还配了大量心理、行为、遗传、环境量表与生物样本数据。
为什么重要? 过去几乎没有这种规模、跨厂商统一协议的儿童脑影像 + 行为 + 遗传纵向数据库。它让研究者能回答「正常青少年大脑如何随年龄变化」「哪些童年经历(屏幕时间、睡眠、物质暴露、家庭环境)与脑发育和精神健康相关」。约 100 TB 的数据托管于 NIMH Data Archive,是神经科学与机器学习公认的基础资源,其设计论文已被引用数千次。
我能用它做什么? 若你是 AI/ML 研究者,可做脑龄预测、儿童精神健康或物质使用风险分类、脑结构/功能影像回归等任务;也可做发育轨迹建模或孪生/遗传设计。数据以年度 curated release 形式发布,需先在 NDA 申请受控访问。想做之前务必读完本页 §6 的 8 个坑点——亲属嵌套、影像 QC 与版本兼容是新手最常见的翻车点。
§1.1 摘要
ABCD 是一项前瞻性、观察性纵向队列研究,覆盖美国 21 个数据采集点,纳入约 11,878 名基线 9-10 岁(平均约 9.9 岁)儿童及其照护者。队列采用多阶段、偏向流行病学的学校抽样招募,并在四个特设位点补充了孪生子对以服务遗传设计。成像与行为评估遵循统一协议:神经影像采用 Siemens / GE / Philips 三类 3T 平台可运行的 harmonized 序列,含 sMRI(T1/T2)、dMRI、rs-fMRI 与 task-fMRI(MID、Stop-Signal、Emotional N-Back);非影像域含家长/儿童/教师报告的心理与物质使用工具(如 CBCL、KSADS-5)、NIH Toolbox 认知电池、激素与遗传生物样本,以及 COVID 补充与环境/地理链接数据。影像由 ABCD DAIC 集中用统一管线处理(Hagler et al., 2019),curated 数据每年经 NIMH Data Archive 发布,截至 2026 年已发布 Data Release 7.0。本数据集常被批评的一点是其抽样并非严格全国概率样本,且观测在家庭与位点层面存在嵌套,须在统计建模中显式处理(见 §5、§6.5、§7)。
§1.2 战略价值
多维度的脑-行为-环境纵向深度(发育科学价值)。 ABCD 是迄今可公开获取的、规模最大且采集协议统一的儿童多模态脑影像纵向资源。每两年一次成像、每年一次行为评估、每半年一次物质使用/精神健康抽查的密集时间结构,叠加孪生子样本,使研究者能够区分基因、共享家庭环境与非共享环境对发育轨迹的贡献。这种「密集表型 + 遗传 + 环境」组合在同类公开数据集中几乎无出其右,为发育神经科学与规范化轨迹建模提供了不可替代的底料。
机器学习基准与公共卫生信号价值。 ABCD 的公开程度与规模使其成为「脑龄」「精神健康风险」「物质使用」等预测任务的天然训练/验证场,亦为影像质量与设备 harmonization 方法学提供大规模实测样本。从 NIH 资助与引用数据看(Casey 2018 被引约 2,600+,Hagler 2019 约 865),其方法学论文已成为多中心影像研究的引用锚点,研究成果可直接转译为儿童保健、教育与政策层面的公共卫生洞察。
方法学与工具链价值(对 AI 工程者)。 ABCD 是最能暴露多中心影像「真实坑点」的公开资源之一:厂商差异、孪生嵌套、QC 后样本骤减、release 版本漂移都真实存在且已被社区记录。对从事多中心/纵向/去批量方法学的研究组而言,它既是训练集也是「压力测试集」——一套方法若在 ABCD 上站得住,通常也能迁移到其他多中心队列。官方与社区(DCAN、neuroHarmonize、family-aware 指南)提供了相对完整的前处理与划分范例,是把「经验教训」落到代码的好平台。
§1.3 同类数据集横向对比表
| 数据集 | 规模 | 模态 | 年龄/随访 | 差异点 |
|---|---|---|---|---|
| ABCD Study | 11,878 名 / 21 点 | sMRI+dMRI+rs/task-fMRI+行为+遗传+环境 | 9-10 岁起,随访至成年 | 美国最大、跨厂商统一协议、孪生子嵌套、受控 NDA 访问 |
| NIH HBCD(HEALthy BCD) | 计划数千名 | 神经影像+发育行为 | 产前-婴幼儿 | 更早年龄窗、姊妹研究、同走 NBDC 受控流程 |
| IMAGEN | 约 2,000 名 | MRI+遗传+行为 | 14 岁起随访 | 欧洲队列、青少年-青年、规模较小、早期开放 |
| Human Connectome Project (HCP) Dev | 约 1,300 名 | 高分辨率结构/功能 | 5-21 岁横断 | 深度高但非全国抽样、样本量小 |
| NCANDA | 约 800 名 | MRI+酒精使用随访 | 12-21 岁 | 聚焦酒精与成瘾、规模小 |
注:同类横向对比仅作定位参考,规模/随访等以各官方来源为准。
ABCD 的独特定位:它是这些队列中唯一将「全国分散多中心 + 统一采集协议 + 孪生子嵌套 + 公开滚动 release + 万级样本」同时做到的。相比 HCP-Development 的高深度低样本,ABCD 换取了更大人口与更长随访;相比欧洲 IMAGEN,它规模更大且含孪生与遗传测序。其代价是影像「深度」与单点质检不如单中心高深度研究精细,以及便利抽样带来的代表性局限——理解这组权衡,是正确选择 ABCD 而非姊妹队列的前提。
§1.4 版本时间轴表
| Data Release | 发布时间 | 主要内容 |
|---|---|---|
| Fast Track | 2017 年 | 未处理 DICOM 影像 + 基础人口(仅技术方法开发用) |
| 1.1 | 2018 年 | 约半队列基线 curated 数据 |
| 2.0 | 2019-04-02 | 全队列(11,878)基线 + 首次 Smokescreen 基因型 |
| 3.0 | 2020 年 | 全队列 1 年/6 个月随访 + 约半 2 年随访影像 |
| 4.0 | 2021 年 | 2 年随访影像时间点 + COVID 补充调查 + 外部链接数据 |
| 5.0 | 2023 年 | 全队列 2 年随访影像 + 3 年随访表型(表格改单 zip 打包) |
| 5.1 | 2024 年 | 修补 5.0 数据质量问题 |
| 7.0 | 2026 年 | 第 7 次随访(9-17 岁)+ 约 80% 队列全基因组测序 + 亚研究数据 |
版本读取提示:curated release 具累积性——后一版通常包含前一版的主体数据并追加新随访,但变量命名与打包方式会变(如 5.0 起表格改单 zip)。因此「更新到最新版」并不总是无痛升级;若只需基线分析,用 4.0 或 5.0 即可获得最稳定的社区可比结果(§3.0、§6.5 坑点 3)。
§1.5 典型应用场景
- 规范化脑发育建模与脑龄预测:用 sMRI 衍生的皮层厚度/面积/体积估算儿童脑龄,刻画个体偏离典型发育的程度。
- 精神健康与物质使用风险预测:以影像 + 量表 + 环境特征预测抑郁/内化-外化问题或未来物质使用起始。
- 孪生/遗传影像关联研究:利用孪生子对与全基因组测序数据分解遗传与共享环境影响。
- 设备/厂商 harmonization 方法学:在已知厂商-位点效应的多中心数据上开发去批量、harmonization 或鲁棒建模方法。
- 睡眠/屏幕时间/环境暴露与发育关联分析:结合 COVID 补充与环境地理链接数据研究社会决定因素对脑与行为的影响。
§1.6 局限速览
- 非全国概率样本:学校/同意便利抽样,做「全国代表性」点估计需加权。
- 家庭与位点嵌套:孪生/同胞 + 多厂商多中心,建模必须处理非独立观测。
- 影像完成与 QC 缺失具信息性:QC 后可用样本显著小于入组数。
- 纵向随访未完成:流失/COVID 中断使随访结局缺失非随机。
- 受控访问 + release 滚动:跨版本变量漂移,需锁定版本并合规申请。
- 无官方 ML 标签:结局标签多由研究者自造,评测可比性有限。
§2 医学背景
§2.1 ICD-11 编码表
ABCD 是研究「发育中人群」而非「单一疾病」的数据集,因此不映射单一 ICD-11 病种。下表列出其在神经/精神/成瘾表型研究中常关联的 ICD-11 相关类目,供按结果变量检索文献时参考。
| 研究关注域 | ICD-11 编码 | 中文名称(简) | 说明 |
|---|---|---|---|
| 抑郁/内化症状 | 6A70-6A7Z | 抑郁障碍谱系 | 队列随访结局常见方向 |
| 焦虑障碍 | 6B0Z | 焦虑或恐惧相关障碍 | 儿童内化问题 |
| 使用酒精所致障碍 | 6C40 | 使用酒精所致障碍 | 青少年饮酒结局 |
| 使用大麻所致障碍 | 6C41 | 使用大麻所致障碍 | 青少年大麻结局 |
| 注意缺陷多动障碍 | 6A05 | 注意缺陷多动障碍 | 外化/认知研究 |
| 品行障碍 | 6C90 | 品行障碍 | 外化行为结局 |
说明:编码均为结果层面的研究参照,ABCD 数据本身是一般人群队列,入组时排除少数疾病(如精神分裂症、中重度 ASD、智力障碍、物质使用障碍诊断),详见 §2.4。
§2.1b SNOMED CT 映射表
| 标签(中文) | ICD-11 | SNOMED CT | 术语(中文) |
|---|---|---|---|
| 青少年发育评估 | 无单一码 | 191604008 | 儿童青少年发育评估 |
| 童年情绪/内化问题 | 6B0Z | 192979006 | 童年情绪障碍 |
| 童年外化/品行问题 | 6C90 | 1288899003 | 童年行为障碍(简) |
| 物质使用障碍筛查 | 6C4Z | 66214007 | 物质使用障碍筛查(简) |
| 精神健康问题筛查 | 无单一码 | 365982005 | 精神健康状况筛查 |
| 认知发育测量 | 无单一码 | 113320000 | 认知功能评估 |
§2.2 疾病简介与流行病学背景
ABCD 服务于一个关键科学问题:儿童期到青少年期是大脑大规模重塑、同时也是精神疾病与物质使用首次高发的窗口。此前多数神经影像研究依赖横断或小样本便利样本,难以把「基因—家庭—环境—神经发育—行为结局」串成因果链条。ABCD 通过 9-10 岁基线入组并将人群随访到 19-20 岁,正是为了捕捉这一从童年到成年的连续转变,为建立「正常发育的国家级标准」提供参照。在入组时,约 42% 的样本被认定为存在内化/外化早期征象或物质滥用风险相关特征,使队列同时适合研究与风险人群对照,尽管它也因便利抽样(学校参与 + 家长知情同意)而存在选择性。
流行病学定位:美国流行病学显示,多数精神障碍在 24 岁前首次起病,青少年期是物质使用起始、情绪障碍攀升与外化行为突出的窗口。ABCD 之所以从 9-10 岁起随访,是希望在成瘾与多数精神病理大规模显现之前建立基线,从而能够区分「先存在的易感因素」与「发育中发生的变化」。数据入组时即排除少数已诊断人群(精神分裂症、中重度 ASD、智力障碍、物质使用障碍诊断),因此它刻画的是「尚无严重精神疾病诊断的儿童」的一般发育轨迹,而非临床患病样本;这一点对解释结果边界至关重要。
§2.3 临床任务定义
ABCD 数据可支撑如下几类研究任务:
| 任务类型 | 输入特征 | 目标/标签 | 场景 |
|---|---|---|---|
| 筛查/风险预测 | 影像 + 量表 + 环境 | 未来物质使用起始、内化/外化综合征分 | 人群风险分层 |
| 诊断分类(研究性) | CBCL/KSADS 衍生的症状维分 | 临床阈值病例 vs 对照 | 精神表型建模 |
| 分级/轨迹 | 纵向结构影像 | 脑发育成熟度偏离(如脑龄 gap) | 个体偏离检测 |
| 预后 | 基线影像 + 环境 | 多年后精神健康/学业结局 | 发展预测 |
§2.4 患者人群表
| 项目 | 说明 |
|---|---|
| 来源 | 美国 21 个数据采集点,学校系统招募;4 个位点另加州登记处孪生子补充 |
| 招募时间 | 基线 2016-2018(研究者常写 2016-09 至 2018-11) |
| 年龄 | 基线 9-10 岁(约 9.9 岁),随访至 19-20 岁 |
| 性别 | 约 48% 女 / 52% 男(基线全入组) |
| 种族/民族 | 依据美国人口结构;家长自我报告,倾向较高社会经济学参与的便利性 |
| 就医类型 | 社区儿童(非临床样本);非英语不流利、重大神经疾病、TBI、极早产及若干诊断者排除 |
| 孪生/亲属 | 约 2,100 名孪生/三胞胎;含 4 个位点的专门孪生子补充样本 |
人群限定要点:ABCD 不是「患病儿童」队列,而是「无严重精神疾病诊断的社区儿童」队列。入组排除精神分裂症、中重度 ASD、智力障碍、物质使用障碍等诊断,且须英语流利、无 MRI 禁忌。因此任何「患病率/患病模型」都只能刻画「未被排除人群中的风险分层」,不可外推到临床就诊群体或非英语/严重残障人群。
§2.5 临床价值
- 提供迄今最大规模的、随访至成年的儿童脑发育多模态公开参照,支撑发育神经科学与精神健康研究。
- 通过孪生子 + 遗传(Smokescreen 基因型、全基因组测序)设计,帮助在人群尺度上分离遗传与共享环境贡献。
- 环境与地理位置链接数据(EPA、ACS、犯罪报告等)支持社会决定因素与暴露对发育结局的建模,具有直接公共卫生含义。
§2.6 金标准表
| 用途 | 划分/标注方式 | 标注者 | 性质 |
|---|---|---|---|
| 精神/行为结局 | CBCL 综合征与 DSM 取向量表分;KSADS-5 诊断模块 | 家长/儿童结构化访谈 | 半结构化临床评估(非金标准诊断) |
| 认知 | NIH Toolbox 年龄校正分 | 统一管理电脑化测试 | 心理测量学标准分 |
| 脑影像 QC | 自动化 + 人工评级;mr_y_qc__incl 推荐纳入标记 |
DAIC 受训 MR 分析员 + 神经放射复核 | 影像纳入金标准(推荐依据) |
| 入组排除诊断 | 入组筛选(KSADS 等) | 临床受训面试官 | 研究排他标准 |
§3 数据集规格
§3.0 版本抉择矩阵
ABCD 是持续滚动的多版本数据,选错 release 是高频错误。
| 你的需求 | 推荐版本 | 规模/范围 | 理由 |
|---|---|---|---|
| 只做基线横断影像/表型、追求稳定 | Data Release 4.0 | 全队列基线(约 11,878) | 基线完整、随附 release note 稳定、社区论文最多 |
| 需要 2 年随访纵向影像 | Data Release 5.0 / 5.1 | 全队列 2 年随访影像 + 3 年表型 | 首个全队列第二影像时间点;5.1 修复 5.0 质量问题 |
| 当前最新、含遗传测序与长随访 | Data Release 7.0 | 至第 7 次随访(9-17 岁)+ WGS 约 80% | 最新表型与测序;受 NBDC 新访问流程约束 |
| 训练/评测要最干净基线 | Data Release 4.0 + 推荐影像纳入 QC 子集 | 依 QC 过滤,约万级 | 用 mr_y_qc__incl 控制 QC;勿混不同 release 派生变量 |
| 首次上手/复现 2023-2024 论文 | Data Release 4.0 或 5.0 | 全队列基线 | 与多数已发表方法、教程一致 |
关键铁律:不同 release 之间的表变量命名与取值可能漂移,切勿把不同 release 下载的派生变量直接拼接;同一分析务必锁定单一 release 并在论文中写明。
§3.1 模态详情
| 模态 | 采集细节 | 输出/派生指标 |
|---|---|---|
| 结构 MRI (sMRI) | 3D T1 1 mm³ isometric;3D T2 | 皮层厚度、面积、体积、沟深、T1/T2 强度(FreeSurfer v5.3 Desikan/Destrieux + subcortical) |
| 扩散 MRI (dMRI) | DWI 1.7 mm³,multi-band 3,96 方向,b=0-3000 | AtlasTrack 纤维束 + DTI 指标(FA/MD/LD/TD)+ RSI |
| 静息态 fMRI | 4×5 分钟 runs,EPI 2.4 mm³,TR=800 ms | Gordon 分区 ROI-ROI 功能连接(Pearson→Fisher z) |
| 任务 fMRI | MID、Stop-Signal、Emotional N-Back,各 2 runs | 任务激活 ROI 对比 + E-Prime 行为文件 |
| 行为/临床 | 家长/儿童/教师报告量表(CBCL、KSADS-5 等)+ NIH Toolbox | 综合征分、诊断模块、认知标准分 |
| 遗传 | Smokescreen 基因型阵列 + TOPMed 插补;7.0 起约 80% 队列 WGS | 常见变异 + 依赖/吸烟/尼古丁代谢相关变异;全基因组测序 |
| 生物样本 | 唾液等(激素、遗传、物质暴露分析) | 皮质醇、基因型等 |
| 环境/地理 | 学校成绩、EPA、ACS、犯罪、铅暴露、空气污染等链接 | ABCD 派生暴露/地域指标 |
表型/表域组织:非影像表按 NDA 领域组织,如 demographics、mental_health、substance_use、neurocognition、culture_environment、novel_technology 等;每个域含若干 instrument 表,语义可由 NDA 数据字典/DEAP 检索。影像表按 sMRI/dMRI/rs-fMRI/task-fMRI 分区组织(详见 §4.0 目录树)。
§3.2 按子集样本数表
| 子集 | 人数(约) | 说明 |
|---|---|---|
| 基线全入组 | 11,878 | 含约 2,100 孪生/三胞胎 |
| 含结构影像(完成 MRI) | 约 11,810 | 少数未完成 MRI |
| 通过影像 QC(T1 等) | 约 10,783 | 依研究 QC 标准变化 |
| 遗传(Smokescreen 基因型) | 近 11,000 | Release 2.0 起 |
| 单次研究最终分析集 | 数千 | 因协变量/Q 条件过滤锐减,如单研究降至约 8,125 |
说明:人数随 QC 与 release 而变,具体以官方 demographics 与 release notes 为准。
§3.3 格式表
| 数据类型 | 格式 | 分发方式 |
|---|---|---|
| 表格/表型/衍生影像指标 | NDA tabulated .txt / .Rds | 认证后经 NDA 表格包(5.0 起单一 .zip) |
| 原始/处理影像 | DICOM(BIDS source)、NIfTI(BIDS raw/derivatives)、FreeSurfer 输出 | NDA download manager 文件型 |
| 遗传 | 基因型文本 + VCF(测序) | NDA 文件型 |
| 行为原始 | E-Prime .txt/.log(任务 fMRI 配套) | NDA 文件型 |
§3.4 存储大小
- 全队列基线多模态累计约 100 TB(官方多采用此表述)。
- 表格数据(单个 release 全表)相对小(GB 级),瓶颈在文件型影像与遗传。
- 实际下载体量高度依赖所选子集与 release,详见 §6.2 的 NDA 下载流程。
§3.4b 如何按需裁剪子集(省流量)
| 目标分析 | 需要下载 | 建议 |
|---|---|---|
| 表格 ROI/表型建模 | 单一 release 表格包(影像+非影像 tabulated .zip) | GB 级,下载成本低 |
| 体素/表面级影像建模 | NIfTI BIDS 影像(按人/系列) | 大,建议留在 NBDC compute-in-place |
| 遗传(基因型/测序) | 基因型文件 / VCF | 大且专用,用遗传工具链处理 |
| 复现某论文 | 仅该论文声明用到的表与 release | 优先,省时且一致性高 |
经验:绝大多数「AI 就绪」实验只需表格型 ROI 数据;除非你要做体素级模型,否则不必碰约 100 TB 的原始影像。
§3.5 标注方式
- 行为/精神表型:家长与儿童经结构化/半结构化访谈与量表(CBCL 为自报式、KSADS-5 为临床诊断式访谈),教师报告辅助——人为主导的标准化流程,非深度学习弱标注。
- 认知:NIH Toolbox 电脑化测试自动打分,年龄校正分。
- 影像派生指标:集中处理管线自动计算,经人工 QC 标记是否纳入;
mr_y_qc__incl是官方推荐纳入标记。 - 金标准标签(如抑郁):研究中常把 KSADS-5 症状计数阈值化为二分类,非影像驱动,属外部标签。
§3.6 标注者资质与一致性
- 量表由受过培训的研究协调员/访谈者统一施测;影像 QC 由 DAIC 受训 MR 分析员人工评级,结构性异常由持证神经放射医师复核。
- 多中心一致性靠统一 protocol + 集中 DAIC 处理缓解,但厂商差异仍是残余方差来源(见 §6.5 坑点 6、§7.1)。
§3.7 采集周期
- 成像每 2 年一次;行为每年一次;物质使用/精神健康每半年一次。
- 影像单次约 100-120 分钟,含模拟器脱敏与运动监测(如 Siemens 站点使用 FIRMM)。
§3.8 地域覆盖
- 美国境内 21 个数据采集点(分布在主要城市与科研机构);个别文献以「初始 22 site 招募」表述,最终数据采集为 21 site。
- 环境/地理链接覆盖社区尺度(EPA 智能位置、ACS、FBI 犯罪、空气/铅暴露等)。
§3.9 设备规格
| 设备 | 规格 |
|---|---|
| MRI 平台 | Siemens、GE、Philips 三类 3T,harmonized protocol(无需厂商非商业升级) |
| 线圈/序列 | 支持 multiband EPI;sMRI 1 mm³、DWI 1.7 mm³ multi-band 3、fMRI 2.4 mm³ TR 800 ms TE 30 ms |
| 配套 | E-Prime(任务呈现)、FIRMM 实时运动监测(部分位点) |
§3.10 深度溯源链
ABCD 数据溯源的官方链条可概括为:学校/社区招募 → 位点依统一 protocol 采集(影像 + 量表 + 生物样本)→ 原稿上送 DAIC/NDA → DAIC 集中处理管线(Hagler 2019)产出衍生影像指标 + 影像 QC → NDA 按年度 curated release 组织 → 研究者经 DEAP/NDA/NBDC 检索变量与下载。文件型与表格型数据链路分离,溯源时务必记录 release 版本与变量所依赖的 imaging/instrument 表。
§4 数据结构
§4.0 目录树
ABCD 表格数据的组织以 NDA 为准,5.0 起影像与非影像各打包为单一大 .zip;文件型影像经 NDA download manager 另取。以下为「解压/规整后」的示意结构(非官方逐字路径),帮助理解层级:
abcd_release4/ # 下载到的 curated 表格包(示意根)
├── imaging/ # 影像表格域(.txt / .Rds)
│ ├── mri_y_smr_area_dsk.txt # 结构 MRI 面积(Desikan 分区)
│ ├── mri_y_smr_thk_dsk.txt # 结构 MRI 皮层厚度
│ ├── mri_y_dti_fa_at.txt # 扩散 MRI FA(AtlasTrack)
│ ├── mri_y_rsfmr_cor_gp.txt # 静息态功能连接(Gordon)
│ └── mri_y_tfmr_mid_beh.txt # 任务行为(MID 等)
├── qc/ # 影像质量与推荐纳入
│ └── mri_y_qc__incl.txt # 各模态 include(1)/exclude(0)
├── mental_health/ # 心理健康域(含 CBCL 等派生表)
├── substance_use/ # 物质使用域
├── neurocognition/ # 认知域(NIH Toolbox 分)
├── demographics/ # 人口/家庭结构
└── ... # 其余域(culture_environment 等)
文件型影像(NIfTI/DICOM/FreeSurfer/遗传)不在此树内,由 NDA download manager 按人/系列选择下载。
§4.1 DAIMS 8 列字段字典(核心表示例)
以下选 3 张最具代表性的官方表列展示字段结构与取值,字段名以 ABCD 官方/community 通用简写示意。
表 A:abcd_person(人口/样本根,示意)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| src_subject_id | string | NDA 主体标识,全表关联键 | NDAR_INVxxxxxxxx | 主键/分组 | 无 | 受控缺失 | NDA 发放 ID |
| interview_age | integer | 评估年龄(月) | 119 | 协变量/分层 | 依访视日期 | 999 | 108-132 等 |
| sex | string | 出生性别 | M / F | 协变量 | 自报 | 999 | M/F/其他 |
| rel_family_id | string | 家庭/亲属簇标识(孪生/同胞共享) | Family_1234 | 嵌套随机效应 | 结构定义 | 无 | 按家庭 |
| rel_twin | string | 孪生类型标记 | NotTwin/DZ/MZ | 遗传设计 | 依来源 | 999 | MZ/DZ/NotTwin |
表 B:mri_y_qc__incl(影像推荐纳入 QC,示意)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| src_subject_id | string | 关联键 | NDAR_INV… | 主键 | 无 | 受控缺失 | NDA ID |
| iqc_t1_ok_ser | integer | T1 通过/序列级 QC | 0/1 | 结构模态纳入 | 评级主观 | 999 | 0/1 |
| mri_y_qc__incl_t1 | integer | 推荐纳入 T1w(可算) | 0/1 | 过滤样本 | 评级主观 | 999 | 0/1 |
| incl_rsfmri | integer | 推荐纳入 rsfMRI | 0/1 | 过滤 | 评级主观 | 999 | 0/1 |
| incl_dti | integer | 推荐纳入 dMRI | 0/1 | 过滤 | 评级主观 | 999 | 0/1 |
| incl_sst/incl_mid/incl_nback | integer | 各任务纳入 | 0/1 | 任务子集 | E-Prime 错误 | 999 | 0/1 |
表 C:mri_y_smr_thk_dsk(结构 MRI 皮层厚度 Desikan,示意)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| src_subject_id | string | 关联键 | NDAR_INV… | 主键 | 无 | 受控缺失 | NDA ID |
| mri_y_smr_thk_cdk_lh_bankssts | float | 左脑 bankssts 皮层厚度(mm) | 2.71 | 特征 | 采集/分割误差 | 999/NaN | ≥0 |
| interview_age | integer | 年龄(月) | 119 | 协变量 | 依访视 | 999 | 108-132 等 |
| visit | integer | 访视序号(基线/随访) | 1 | 纵向时间 | 无 | 999 | 1-7 |
表列数因 domain/release 而异,字段名以上述官方缩写规则推断,实际以 NDA data dictionary(DEAP/API)为准。
表 D:mri_y_rsfmr_cor_gp(静息态功能连接,Gordon 分区,示意)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| src_subject_id | string | 关联键 | NDAR_INV… | 主键 | 无 | 受控缺失 | NDA ID |
| interview_age | integer | 年龄(月) | 119 | 协变量 | 依访视 | 999 | 108-132 等 |
| mri_y_rsfmr_cor_ngp_nt_… | float | 网络间功能连接(Fisher z) | 0.12 | 网络级特征 | 头动/QC | 999/NaN | ~-1~1+ |
| mri_y_rsfmr_cor_gp_roi_… | float | ROI-ROI 连接(352 区域) | 0.05 | 图/边特征 | 头动 | 999/NaN | 连续 |
| fd_mean | float | 平均帧位移(运动代理) | 0.18 | QC/协变量 | 计算 | 999 | ≥0 |
注:rs-fMRI 矩阵维度高(数千 ROI 对),预处理通常需先降维到网络级或稀疏边;字段名以 NDA 字典为准。
§4.1b 特征选择与共线性提示
- 结构表 ROI 特征跨分区且左右对称,存在强共线性;深度特征选择(LASSO/组稀疏)或先降到区域/网络级是常见做法。
- 影像特征对「厂商」与「位点」高度相关,建模前先检验去批量后的可分性(见 §6.5 坑点 6)。
- 同一人的纵向多访视需按人聚合,避免同一主体作为多条独立样本被重复计数。
§4.2 标签分布(示例域)
- 性别人口:基线约 48% 女 / 52% 男。
- 孪生状态:约 2,100 名孪生/三胞胎(含 4 个特设位点的孪生子补充)。
- 影像 QC 标签:
mr_y_qc__incl各模态为 0/1;单次研究过滤后样本通常显著小于入组总数。 - 结局分布:CBCL/KSADS 衍生症状分为连续或阈值二分类,具体分布随研究子集变化,无官方「金标准标签」表。
§4.3 关键统计
- 基线入组:11,878 名儿童;常用「含基线数据队列」写作 11,875。
- 采集点:21 个。
- 随访成像:每 2 年;截至 2026 年 7.0 达第 7 次随访(约 9-17 岁)。
- 数据总量:约 100 TB(累计多模态)。
§4.4 数据层级
ABCD 数据的统计单元沿「人」而非「患者—检查—序列—切片」组织的病床式层级:
site(21 采集点)
└─ family / sibling cluster
└─ youth (src_subject_id,各访视 interview_age)
├─ 表型表(CBCL/KSADS/cognition …,每访视一行)
├─ 影像表(每模态分区行;衍生指标 ROI 级)
└─ 文件型:影像 NIfTI/DICOM 序列 + FreeSurfer 输出
层级关系是建立随机效应(位点、家庭)与防止泄漏的关键(§5.3)。
§4.5 缺失值 + 信息性缺失编码表
| 场景 | 编码/处理 | 信息性解释 |
|---|---|---|
| 未做/未通过影像 | 表中无行或 QC=0 | 高度信息性:青少年运动/配合度影响成像完成 |
| 量表未作答 | 999/NaN 等官方编码 | 缺失模式可能与主题相关 |
| 某模态严重 artifact | 该模态 QC=0、派生值缺失 | 若 T1 全坏,其他模态多无法派生 |
| 随访未到 | 尚无该访视行 | 纵向事件时序,随 release 累积 |
| 受控字段 | NDA 层面的隐私缺失 | 地理位置等受控分发 |
§4.6 宽/长格式切换与纵向规整
官方影像/表型多为「每人每访视」的组织。做纵向或跨访视分析前,常需把「一人多行」的随访记录规整为时间轴。示例(假设按 interview_age 排序):
import pandas as pd
def wide_to_long_visits(df):
# df: 每行是一人一访视,含 interview_age, visit
# 输出:长格式主表,便于按 visit 或 age bin 切片
return df.sort_values(["src_subject_id", "interview_age"])
# 跨访视取基线 = 每人 interview_age 最小的一行
baseline = (df.sort_values("interview_age")
.groupby("src_subject_id", as_index=False)
.nth(0))
print("baseline rows:", len(baseline))
注意:visit 列号随 release 与访视完成度漂移,不要硬编码访视序号;按年龄/完成标记过滤更稳。
§4.7 与其他数据库的关联能力
- 可与学校成绩(SEDA)、EPA、ACS、FBI 犯罪、铅/空气暴露等链接外部数据做环境暴露分析(随 release 提供派生指标)。
- 遗传数据支持跨库共定位/PRS 类分析,但受控授权范围内使用。
- 不直接提供可链接到个人医疗记录或学校身份的信息(去标识化约束)。
§5 划分与使用建议
5.1 官方划分
ABCD 没有官方「训练/验证/测试」划分。官方提供的是年度 curated release(累积、随访问波次扩展)与按域组织的表,没有预打包的 ML split。官方工具(DEAP)用于变量探索与子集构建,但已于 2023-06-01 停用 DEAP(分析功能部分迁至 NBDC 的 compute-in-place 环境)。研究者在发布前须在 NDA 创建 Study 并获 DOI,作为该研究所用数据子集的可追溯锚点。
5.2 社区惯例划分
- 多数论文用「基线 + QC 通过 + 所需协变量完整」的可用样本,作为固定分析集,并把该子集人数与来源 release 写明。
- 少数公开基准(如脑龄、抑郁风险预测)给出预划分训练/测试集,但非官方、未统一,需自行核验 leakage 控制。
- 社区替代处理产物(如 ABCD-BIDS Community Collection、DCAN abcd-hcp-pipeline)提供另一条影像预处理路径,可与官方衍生态互证。
5.3 泄漏风险(重点)
ABCD 特有且最易踩的泄漏源是亲属与位点嵌套:
- 家庭内孪生/同胞共享基因、家庭环境与 MRI 扫描仪,若孪生/同胞被拆到训练与测试两侧,模型可借高度相关的家庭内特征「作弊」,严重虚高评估。
- 建议以 rel_family_id 为分组做 GroupShuffleSplit 或 Leave-Family-Out,保证同一家庭的全部成员落在同一折。
- 影像采集的位点(site)是第二个层级:同一扫描仪/位点的图像有系统性偏差,跨位点预测须防位点泄漏(用 site 感知划分或 harmonization)。
5.4 交叉验证建议
- 采用分层 + 按家庭分组的 K 折(family-aware),同时按影像纳入 QC 过滤。
- 报告需含分层位点比例与孪生分配,避免某折垄断某个位点或某孪生子对。
5.5 外部验证建议
- 用 HCP-Development、NCANDA、IMAGEN 等同龄结构影像队列做跨队列泛化检验;承认厂商/协议差异。
- 行为/精神表型可对照 NHANES/学校普查的分布作描述性校准(非严格因果)。
- 见 §7.8 外部验证矩阵。
5.6 推断与加权指南
ABCD 面向「人群推断」有三种主流路线(Heeringa & Berglund 2020;FACTS 指南):
- 设计/加权法:把 ABCD 视作准概率样本,采用倾向权重 + ultimate-cluster 分层来计算人群点估计与稳健标准误——适合描述性流行病学。
- 模型控制法:回归中纳入位点与关键社会人口学协变量,解释为「条件关联」而非「无偏人群因果」。
- 孪生/同胞设计:以家庭内对照控制不可测家庭层面混杂——适合因果性更强的验证。
建议:AI/ML 论文通常用路线 2+3 的组合并透明报告;不要在没有加权或模型控制时把 ABCD 描述为「美国代表性样本」。
5.7 复现与审稿要点
- 写明:release 版本、结局定义、QC 过滤、协变量、随机种子与家庭感知划分方式。
- 审稿人应确认孪生/同胞未被拆散、结局阈值敏感性与厂商/位点是否已控制。
- 建议预注册(OSF)并在 NDA 创建 Study 登记 DOI,便于他人复现同一数据子集。
§6 AI 就绪指南
§6.0 云端快速启动
由于 ABCD 是受控访问数据(不能公开批量缓存),最快的生产路径是在 NBDC Data Hub(NIH 官方安全云)内 compute-in-place 分析:获批后你在安全环境中直接跑脚本,避免上传/下载约 100 TB 影像。若只需表格/衍生变量,可在获批后将较小表格包拉到本地;文件型影像建议留在 NBDC 处理。本页示例基于本地表格工作流,假设你已通过 NDA/DUC 取得某个 release 的表格 zip。
运行位置决策表
| 分析规模 | 建议运行位置 | 理由 |
|---|---|---|
| 表格 ROI / 表型 / 小型影像子集 | 本地工作站 | 数据量小、迭代快、易复用既有 ML 栈 |
| 体素/表面级影像、全队列 | NBDC Data Hub | 免传输约 100 TB,符合 DUC 安全要求 |
| 遗传(WGS) | NBDC 或专用 HPC | 需专用工具链与大内存 |
| 大型训练 + 超参搜索 | NBDC / 获批 HPC | 规模与合规兼顾 |
提示:先看你要用的特征是否已在「表格型 ROI 表」里(多数是)——若是,完全无需进入影像文件层。
§6.1 快速上手
环境与数据预期
data_root:解压后的 release 根目录,含imaging/、qc/、mental_health/等域子目录(示意,见 §4.0)。- 本示例用最小可用子集:只读
abcd_person(人口/亲属)、mri_y_qc__incl(影像 QC)与一个结构表,不触碰大文件型影像。- 表列名因 release 与字典而异,务必先打印列名再引用。
import pandas as pd
DATA_ROOT = "/path/to/abcd_release/" # 解压后表格根
# 1) 打印列名,避免猜错(release 间列名会漂移)
qc = pd.read_csv(f"{DATA_ROOT}/qc/mri_y_qc__incl.txt", sep="\t", low_memory=False)
print("QC columns:", list(qc.columns)[:12])
print("QC shape:", qc.shape)
§6.2 数据获取
访问流程(官方,随 2025-06 起迁移):
| 步骤 | 动作 | 说明 |
|---|---|---|
| 1 | 创建 NDA 账户 | 需机构邮箱与管理员背书 |
| 2 | 完成负责的数据使用培训(DUC / Responsible Data and Biospecimen Use Training) | 理解受控访问与未成年人隐私条款 |
| 3 | 提交 Data Use Certification 并获批 | 老流程经 NDA;2025-06-02 后新申请改经 NBDC Data Hub |
| 4 | 在 NDA 建立 Study 生成 DOI | 记录你所用于发布的数据子集 |
| 5 | 下载表格 / 文件 | 表格包单 zip;影像/遗传用 download manager 或 NBDC compute-in-place |
# 伪代码:示意下载管理(实际用官方 NDA download manager / NBDC)
# nda download-manager --collection 2147 --release 4.0 --output ./abcd_release
print("下载以官方 NDA/NBDC 工具为准,勿手工 curl 受控端点")
大小:表格包 GB 级;全影像约 100 TB,通常不必全量下载。
获取排障速查
| 症状 | 常见原因 | 处理 |
|---|---|---|
| 表格 zip 下载不了 | 未登录 / 无 DUC / 未获该 release 授权 | 回 NDA 完成认证与授权,按官方指引下载 |
| 影像文件大、下载超时 | 直接拉全量文件型数据 | 用 download manager 分批,或改 NBDC compute-in-place |
| 变量找不到 | 版本列名漂移 / 命名规则不同 | 用 NDA 数据字典核对,别猜列名 |
| 想用 7.0 但账号走老流程 | 访问通道已迁移 | 2025-06-02 起新申请走 NBDC Data Hub |
| 需要公开缓存加速 | 受控数据不可公开缓存 | 合规途径只有 NDA/NBDC 官方渠道 |
§6.3 预处理全流程
目标:把表格数据规整成「每人每访视一条、附 QC 与家庭簇」的分析表。关键在过滤 QC 与控制缺失编码。
import numpy as np
import pandas as pd
def build_baseline_table(data_root: str) -> pd.DataFrame:
person = pd.read_csv(f"{data_root}/demographics/abcd_person.txt", sep="\t", low_memory=False)
qc = pd.read_csv(f"{data_root}/qc/mri_y_qc__incl.txt", sep="\t", low_memory=False)
# 只保留基线访视(示意:访视列取基线值)
baseline = person[person["visit"] == 1].copy()
# 亲属/家庭簇键:用于防泄漏与随机效应(缺失补独立簇)
baseline["rel_family_id"] = baseline["rel_family_id"].fillna("fam_" + baseline["src_subject_id"])
# 影像 QC:仅保留官方推荐纳入 T1 且通过 DTI 的记录
m = baseline.merge(qc[["src_subject_id", "interview_age", "incl_dti", "incl_t1"]],
on="src_subject_id", how="left")
m = m[m["incl_dti"] == 1] # 依官方推荐影像纳入过滤
# 清理 999/NaN 的官方信息性缺失:不在此处静默填充
print("usable subjects:", m["src_subject_id"].nunique())
return m
注意:绝不把 999 当普通数值喂给模型——先用数据字典确认官方缺失编码;影像缺失通常信息性,应建模而非插补。
§6.4 PyTorch DataLoader
数据层级是「人—访视—分区 ROI」。下面给一个把多模态 ROI 特征 + 人口协变量 + 二分类标签封装成
Dataset的最小可运行骨架(家庭感知分组需在外部用 GroupKFold,见 §6.5 坑点 4)。
import torch
from torch.utils.data import Dataset
class ABCDROIDataset(Dataset):
"""每条样本 = 某人的基线 ROI 特征 + 协变量 + 标签。
用法:先在外部按 rel_family_id 做 GroupShuffleSplit 得到训练/测试 idx。"""
def __init__(self, df, feat_cols, label_col="dep_outcome"):
self.X = df[feat_cols].astype(np.float32).fillna(0.0).values # 缺失已预处理为占位
self.C = df[["interview_age", "sex_coded", "site_coded"]].astype(np.float32).values
self.y = df[label_col].astype(np.float32).values
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return (torch.tensor(self.X[i]), torch.tensor(self.C[i])), torch.tensor(self.y[i])
# 组装
feat = [c for c in df.columns if c.startswith("smr_thk_")] # 示意:结构厚度特征
ds = ABCDROIDataset(train_df, feat_cols=feat)
loader = torch.utils.data.DataLoader(ds, batch_size=64, shuffle=True)
print("batches:", len(loader))
代码仅作骨架示意,非官方认可实现;请勿将 999 缺失直接 fillna 用作生产默认,应先核对字典。
§6.4b 多模态 + 家庭感知的训练组织
当把结构 + 功能连接 + 人口协变量一起喂模型时,建议保留模态维度,并让 DataLoader 兼容家庭感知采样。示例:
class MultiModalCollator:
"""把同一 batch 内的 ROI 结构、功能连接与协变量拼装为 dict 张量。"""
def __call__(self, batch):
sMRI = torch.stack([b[0]["smr"] for b in batch])
rsfmri = torch.stack([b[0]["rsfmri"] for b in batch])
cov = torch.stack([b[1] for b in batch])
y = torch.tensor([b[2] for b in batch], dtype=torch.float32)
return {"smr": sMRI, "rsfmri": rsfmri, "cov": cov}, y
配合自定义按家庭分组的 GroupSampler 或 WeightedRandomSampler 使用,可在采样层面缓解类别不平衡并保持家庭完整。生产要点:特征顺序与 release 绑定,切勿在不同 release 间混用预训练权重或特征索引(§6.5 坑点 3)。
§6.5 坑点 8 个
⚠️ 坑点 1:忽略孪生/同胞的家庭嵌套,导致过拟合与虚高评估(分类:数据泄漏 / 偏倚陷阱)
问题:ABCD 含约 2,100 名孪生/三胞胎及大量同胞,同一家庭成员共享基因、环境与同一扫描仪。若不把
rel_family_id纳入建模或划分,观测非独立、标准误被低估,且孪生可能被拆到训练与测试两侧造成信息泄漏,让评测虚高。
症状:交叉验证精度出奇地高、换样本即崩塌;单变量回归显著性膨胀;报告的标准误过小。
解决:
- 简单方法:把同一
rel_family_id的成员强制归入同一折,用 GroupKFold/Leave-Family-Out 做评测。- 进阶方法:拟合三层混合模型,随机效应为家庭(嵌套于位点)与位点,见 Saragosa-Harris 等推荐的 three-level model。
- SOTA 方法:孪生专项设计——同卵/异卵孪生对做 ACE 分解或孪生差异模型,处理非共享环境。
参考:Saragosa-Harris et al. 2022, Dev Cogn Neurosci(PMC9156875);Iacono et al. 2018, Dev Cogn Neurosci。
⚠️ 坑点 2:把「含基线数据」11,875 与「全入组」11,878 混淆,且忽略 QC 后可用样本骤减(分类:标签理解 / 工程陷阱)
问题:官方在不同语境给出 11,878(全入组)与 11,875(含基线数据)两个数;且影像 QC 后可用结构影像约降至 10,783,再加协变量/结局过滤后常只剩数千。论文若用「11,875 名」却只在数千人上建模而不说明,会误导读者并埋下可复现隐患。
症状:样本量前后文不一致;别人复现不出你的 N;高估影像完整率。
解决:
- 简单方法:论文 Methods 固定写「入组 11,878 / 分析纳入 X(release 版本)」,并给出过滤流水线。
- 进阶方法:报告从入组到分析集的每一步人数与过滤理由(QC、协变量、结局)。
- SOTA 方法:用推荐影像纳入
mr_y_qc__incl+ 预设排除,并在 OSF/NDA Study 预注册纳入标准。
参考:abcdstudy.org 官方 demographics;Nature Sci Rep 2025(s41598-025-88398-2)展示 QC 后人数;FACTS 本页 §3.2。
⚠️ 坑点 3:跨 Data Release 混拼派生变量,版本不兼容(分类:工程陷阱 / 预处理陷阱)
问题:ABCD 每年滚动的 curated release 改变表变量命名、取值与打包方式(如 4.0→5.0 表格改单 zip、DEAP 停用)。把不同 release 的变量或表直接
concat,会静默产生错误或失效特征。
症状:同变量不同版本列名对不上;某些取值(缺失码、QC 标记)含义随 release 变化;复现崩溃。
解决:
- 简单方法:整个分析锁定单一 release,下载时记录版本号与日期。
- 进阶方法:用 NDA 数据字典与官方 release notes 核对列名变更;为合并做显式 schema 校验(assert 列集一致)。
- SOTA 方法:维护一个版本固定的「feature 清单」(release + 变量 + 字典 URL),进 pipeline 前做字段校验。
参考:NDA 官方 release notes(nda.nih.gov/abcd、wiki.abcdstudy.org/release-notes);abcdstudy.org data-sharing 页面的 4.0 vs 5.0 差异说明。
⚠️ 坑点 4:忽略影像 QC,直接用全影像样本做模态特定分析(分类:偏倚陷阱 / 预处理陷阱)
问题:结构影像衍生指标的正确可用集是「T1 通过 QC 且完成 MRI」的人群,约 10,783;而运动、T1 严重 artifact 会连带使 dMRI/rs-fMRI/task-fMRI 无法派生。研究者若不加 QC 过滤,会把坏模态当缺失处理或混入噪声,扭曲关联。
症状:结果对 QC 阈值极敏感;某模态样本数莫名偏少;与已发表论文可比性差。
解决:
- 简单方法:按官方
mri_y_qc__incl(或分模态 incl_dti/incl_rsfmri/incl_sst…)过滤,并报告过滤后 N。- 进阶方法:T1 全坏(
iqc_t1_ok_ser=0)则整访视所有模态不可用,直接剔除;对轻度运动用分级 QC 或做 motion 校正建模。- SOTA 方法:把运动/QC 作协变量或分层,或用 ABCD-BIDS 社区管线(DCAN)重新处理以缓解。
参考:Hagler et al. 2019 影像 QC;ABCD imaging docs(docs.abcdstudy.org);Casey et al. 2018。
⚠️ 坑点 5:把特殊孪生子补充样本当作一般人群样本混用(分类:偏倚陷阱 / 数据泄漏)
问题:4 个特设位点从州登记处额外招募了每 site 约 150-250 对孪生子;研究默认将孪生子并入一般样本分析,未显式分层。若做人群统计量估计,孪生子的过度代表会偏倚方差与点估计。
症状:描述性统计与全国/学校普查系统性偏差;遗传相关估计被污染。
解决:
- 简单方法:需要人群描述时用倾向加权或显式剔除孪生子补充层做敏感性分析。
- 进阶方法:对孪生子标记分层(MZ/DZ/非孪生)分别建模,或做 family-level 加权。
- SOTA 方法:用 site + twin-supplement 层做超总体建模 / 伪随机化校准到美国学龄人口。
参考:Garavan et al. 2018(招募设计);Heeringa & Berglund ABCD 加权指南;ABCD baseline population guide(10.1101/2020.02.10.942011)。
⚠️ 坑点 6:忽视厂商与位点效应,把多中心影像直接当同源(分类:工程陷阱 / 偏倚陷阱)
问题:ABCD 在 Siemens/GE/Philips 三类 3T 上采集,位点与厂商带来系统性方差(跨厂商 harmonized 但非逐像素同源)。若不控制,影像-行为关联会被厂商伪影污染,跨位点泛化差。
症状:同模型在去位点后精度骤降;某厂商子集独占高特征值;厂商与结局伪相关。
解决:
- 简单方法:把
site/mri_info_manufacturer作为哑变量协变量,或按厂商分层报告。- 进阶方法:用 ComBat/neuroHarmonize 对 ROI 指标做 batch harmonization(拟合在基线,应用于全表)。
- SOTA 方法:建立 site-aware 深度模型或域泛化(如混合效应/对抗域对齐),并在保留位点上验证。
参考:Hagler et al. 2019(含设备效应的技术综述);Casey et al. 2018 imaging across 21 sites;community harmonization 文献。
⚠️ 坑点 7:把「随访缺失」当随机缺失,忽略纵向选择性保留(分类:偏倚陷阱 / 数据泄漏)
问题:ABCD 纵向随访存在受试流失与选择性完成(COVID 期影像中断、约 87% 完成 2 年随访等)。以基线为训练、以随访结局为标签时,缺失结局不是随机,容易引入存活/完成偏差。
症状:用「有随访标签」子集建模时样本系统性偏向上层社会经济学/较低风险儿童;纵向坡度估计偏。
解决:
- 简单方法:比较「有/无随访」两群的人口与基线特征,报告差异并在论文注明。
- 进阶方法:用逆概率加权(IPW)或完整样本加权的纵向混合模型,处理缺失结局。
- SOTA 方法:联合建模缺失机制与结局(如共享参数模型 / pattern-mixture),或只用官方「保留至某访视」的完成者集并报告权重。
参考:Volkow et al. 2020 综述(随访设计);NDA release notes(各访视完成率);ABCD practice guide(PMC9156875)。
⚠️ 坑点 8:把研究用的自造标签当成官方金标准,或忽略任务行为(E-Prime)与结局的边界(分类:标签理解 / 评估误用)
问题:ABCD 没有官方「抑郁 0/1」等 ML 标签;研究者常用 KSADS-5 症状计数或 CBCL 阈值得出二分类,阈值设定影响标签分布与评测。任务 fMRI(尤其 Stop-Signal)存在已被指出的设计问题,直接套用其行为变量会引入系统性测量误差。
症状:同结局不同标签定义结果相反;复现时阈值差异导致 AUC 明显变动;Stop-Signal 反应时/正确率与既有任务认知模型不符。
解决:
- 简单方法:完整描述标签来源(量表、版本、阈值),并报告不同阈值的敏感性。
- 进阶方法:优先用连续症状分或官方量表的标准化 T 分而非自造二分类;对 Stop-Signal 参考 Bissett 等的修正建议。
- SOTA 方法:预注册结局定义;把行为变量作为多模态输入而非硬标签,或显式建模任务级测量误差。
参考:KSADS-5 / CBCL 官方手册;Bissett et al. 2021, eLife(Stop-Signal 设计问题);ABCD 测量综述(Luciana et al. 2018、Barch et al. 2018)。
§6.6 数据增强
安全 ✅
- ROI 特征层面的稳健缩放与残差化(z-score、白化)。
- 对结构/功能影像的几何增强(轻微平移/旋转)仅在以体素或表面为输入的自监督/表征任务中使用,需保证坐标空间一致。
- 合法缺失机制的合成(按家庭/位点分层采样做平衡)。
危险 ❌
- 对表格值盲目加噪声模拟「增强」——扭曲有序/阈值变量,制造虚假标签。
- 跨孪生对做像素级 MixUp/拼接,会制造不存在的个体并引入家庭泄漏。
- 把
999缺失直接当合法值参与增强。
§6.7 模型推荐表
| 任务 | 特征类型 | 推荐起点 | 说明 |
|---|---|---|---|
| 脑龄预测 | sMRI ROI/表面 | 简单线性/岭回归 + 卷积(SurfaceNet) | 先线性基线再上深度,防过拟合 |
| 抑郁风险二分类 | 多模态 ROI + 量表 | 逻辑回归/GBDT + 规范 XGBoost 基线 | 首选可解释强、样本有限 |
| 发育轨迹 | 纵向 ROI | 潜增长/线性混合模型、LSTM 可选 | 嵌套与随访缺失优先于复杂网络 |
| 静息功能连接 | 连接矩阵 | 图神经网络 / 边特征分类 | 先验证不混厂商标签 |
| harmonization | ROI 批量效应 | ComBat/neuroHarmonize | 拟合须在基线不混评测折 |
§6.8 硬件需求表
| 场景 | CPU/RAM | GPU | 建议 |
|---|---|---|---|
| 表格/ROI 特征建模 | 8-16 GB RAM 即可 | 可选 | 常规工作站可跑 |
| 体素级影像 CNN | 64 GB+ RAM | 16 GB+ VRAM | 推荐 NBDC 或 HPC 分批 |
| FreeSurfer/DCAN 重处理 | 高内存多核 | 无强需 | 多站点作业、耗时以天计 |
| WGS 遗传分析 | 高内存 | 无 | 需专用遗传工具链 |
§6.9 评估指标代码
儿童精神健康/物质使用结局多为不平衡二分类或连续维分,评估务必用校准的 PR-AUC/ROC-AUC,并给出分位点分层。
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss
def report_metrics(y_true, y_prob):
return {
"ROC-AUC": round(roc_auc_score(y_true, y_prob), 3),
"PR-AUC": round(average_precision_score(y_true, y_prob), 3),
"Brier": round(brier_score_loss(y_true, y_prob), 3),
}
# 用在家庭感知的验证折上;勿用默认 KFold 破坏家庭分组
§6.10 MLOps 笔记
- 版本钉住:把 ABCD release 号、变量清单、字典 URL 与数据处理脚本一起入库(DVC/git-lfs)。
- 防泄漏门禁:CI 里断言
GroupShuffleSplit的测试折不含与训练折同rel_family_id的样本。 - 可复现:用 NDA Study DOI 记录分析用子集,OSF 预注册结局定义。
- 合规:受控数据不上公开 repo/缓存;在 NBDC 内 compute-in-place 时遵循 DUC 的安全要求。
- 再训练:release 每有 major 更新需重跑特征校验与去批量,勿沿用旧权重直接部署。
§6.11 一个完整的最小训练脚本(家庭感知防泄漏)
演示从表格到训练的最短路径:按
rel_family_id做 Leave-Family-Out 划分,训练一个逻辑回归预测「内化风险」。仅作骨架,不构成临床推荐。
import numpy as np
import pandas as pd
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import GroupShuffleSplit
from sklearn.metrics import roc_auc_score
from sklearn.preprocessing import StandardScaler
# --- 载入并组装(假设 build_baseline_table 已在 §6.3 定义) ---
df = build_baseline_table("/path/to/abcd_release/") # 见 §6.3
feat_cols = [c for c in df.columns if c.startswith("smr_thk_") or c.startswith("dti_fa_")]
X = df[feat_cols].fillna(0.0)
y = (df["cbcl_internalizing_t"] > 60).astype(int).values # 示意:阈值二分类,非官方标签
# 家庭感知划分:保证同一家庭不会同时出现在训练/测试
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(X, y, groups=df["rel_family_id"]))
# 训练/评测
sc = StandardScaler().fit(X.iloc[train_idx])
clf = LogisticRegression(max_iter=2000)
clf.fit(sc.transform(X.iloc[train_idx]), y[train_idx])
prob = clf.predict_proba(sc.transform(X.iloc[test_idx]))[:, 1]
print("family-aware ROC-AUC:", round(roc_auc_score(y[test_idx], prob), 3))
# 对照:错误示范——用随机 KFold 会把孪生/同胞拆散,产生乐观偏差
警示:上述 AUC 仅在同一 release + 同一结局定义下可比;换 release/标签/QC 后数值会变(§6.5 坑点 3、5、8)。
§6.12 数据字典与语义检索
- 官方数据字典:NDA(nda.nih.gov/abcd)与 docs.abcdstudy.org 可按 instrument/变量检索。
- DEAP(已于 2023-06 停用)的历史语义已迁移到 NBDC 分析界面与社区字典 App。
- 任何分析第一步都是把「你想要的 construct」映射到具体 instrument 与字段名,再核对字典里的取值范围与缺失码——这能避免 §6.5 坑点 3/7 大半问题。
§6.13 端到端检查清单(AI 就绪)
- 锁定 release(写死版本号与数据 DOI),建立数据字典快照。
- 明确结局定义(量表 + 阈值 + 版本),做标签敏感性分析。
- 影像特征按官方推荐纳入 QC 过滤,报告过滤后 N。
- 建立 family-aware 划分(GroupShuffleSplit / Leave-Family-Out)。
- 把厂商/位点作协变量或做 harmonization;报告分层位点。
- 处理信息性缺失(影像缺失建模 / IPW),不静默插补 999。
- 报告 ROC/PR-AUC、Brier、分层公平性与选择/随访偏差。
§6.14 「最容易成功」的分析路径
对多数使用者,成功率最高的是「基线横断 + 官方推荐纳入 QC 的 ROI 特征 + 家庭感知二分类/回归 + 单一 release」这一组合:数据量适中、QC 明确、文献可比、泄漏可控。在此之上叠加纵向随访或体素级影像前,先跑通 §6.13 清单并复现一篇近两年论文,再逐步加复杂度,是降低翻车率的最佳策略。
§7 质量评估与局限性
§7.1 已知偏倚表
| 类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 抽样/选择偏差 | 学校系统 + 家长知情同意的便利抽样,非严格全国概率样本 | 高 | 倾向加权、报告限制、避免宣称全国点估计 |
| 家庭/孪生嵌套 | 观察在家庭与位点层面聚类 | 高 | 家族分组 CV、多层混合模型 |
| 厂商/位点偏差 | Siemens/GE/Philips 跨厂商系统性方差 | 中 | 厂商哑变量、ComBat/neuroHarmonize、位点感知建模 |
| 影像完成/QC 缺失 | 运动/配合影响完成,影像缺失具信息性 | 中 | 用推荐纳入 QC、对缺失机制建模 |
| 随访选择性保留 | 纵向流失、COVID 期中断 | 中-高 | IPW、比较完成/流失群、报告完成率 |
| 报告/量表偏差 | 家长/儿童自报内化-外化,存在测量噪声 | 中 | 多报告者、标准 T 分、敏感性分析 |
| 人群异质性 | 白人/较高 SES 家庭相对代表性偏高 | 中 | 分层报告与交互检验 |
§7.2 标注质量
- 量表为标准化临床/研究工具(CBCL、KSADS-5、NIH Toolbox),有成熟心理测量学基础;但家长-儿童一致性有限、自我报告受社会期许影响。
- 影像 QC 由 DAIC 集中、受训分析员人工评级,辅以神经放射复核,比单点影像研究更可控;但仍存在主观阈值差异。
§7.3 泛化性表
| 场景 | 失效风险 | 证据/说明 |
|---|---|---|
| 迁移到其他厂商/非 ABCD 序列 | 中-高 | 厂商差异显著,需 harmonization 后再泛化 |
| 迁移到不同年龄窗/临床人群 | 高 | ABCD 是社区 9-17 岁一般人群,非临床样本 |
| 人群层面推断(全国) | 中 | 便利抽样,需权重与模型校准方可达准 |
| 纵向预测跨 release | 中 | 随随访累积,标签/变量版本漂移 |
| 新环境(学校/干预) | 高 | 观察性数据不可外推因果 |
§7.4 伦理
- 未成年人影像与遗传属高敏感;受控访问 + DUC + 负责的数据/生物样本使用培训是基本合规门槛。
- 涉及种族、民族、SES 等社会构造变量的建模须谨慎,避免把观察到的组差异简化为生物学差异,建议结合结构性与背景语境解释。
- 研究不构成诊断;不得用于个体风险披露。
§7.5 公平性
- 样本以美国学龄儿童为主、非全国概率;种族/民族比例与较低 SES 覆盖存在系统偏倚。
- 模型若不加约束可能放大「少数群体预测更差」的不公平;建议按组分层报告性能并做偏差缓解(如校准、重加权)。
§7.6 数据漂移
- 跨 release:变量命名、取值、缺失码随时间漂移(4.0→5.0→7.0)。
- 跨随访:队列随年龄增长,行为/发育分布在纵向自然漂移,横断与纵向结论不可混谈。
- 设备漂移:同一厂商设备长期使用亦有扫描漂移,多中心长期队列需持续 QC。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 官方以每人每访视长/宽混合,表型多宽格式可读 |
| 2 | 唯一标识 | ✅ | src_subject_id 为全库关联主键 |
| 3 | 特殊字符 | ✅ | 文本字段总体整洁,未见明显非法字符 |
| 4 | 重复行 | ✅ | 主键约束清晰,官方 curated 去重良好 |
| 5 | 缺失编码 | ⚠️ | 有官方缺失码(如 999/NaN),但含义需查字典,跨 release 漂移 |
| 6 | 标签标识 | ⚠️ | 无官方统一结局标签,研究中自造二分类易歧义 |
| 7 | 罕见类分组 | ⚠️ | 精神表型临床阈值病例相对少,需分组/加权重处理 |
| 8 | 偏倚评估 | ✅ | 官方文档与社区综述(Saragosa-Harris、Heeringa)提供充分指引 |
| 9 | 数据字典 | ✅ | NDA 数据字典/DEAP 语义可检索,官方 release notes 详实 |
| 10 | 信息性缺失解释 | ✅ | 影像/随访缺失机制有官方说明与社区讨论 |
| 11 | 设备记录 | ✅ | 厂商/序列/位点字段齐备 |
| 12 | 共线性 | ⚠️ | ROI 特征高度相关(分区/对称脑区),建模须做特征选择 |
| 13 | 编码映射 | ⚠️ | 量表/诊断映射较全,但研究者自定义编码需核对 |
| 14 | 时间戳处理 | ⚠️ | interview_age 依访视,需按基线/随访对齐 |
| 15 | 划分建议 | ⚠️ | 无官方 ML split,须自建 family-aware 划分 |
| 16 | 泄漏讨论 | ✅ | 家庭/孪生/位点泄漏为社区共识重点 |
| 17 | 标签分布 | ⚠️ | 结局标签分布随定义与子集变化,须透明报告 |
| 18 | 测量偏倚 | ✅ | 多报告者、厂商 QC 等有官方文档支撑 |
| 19 | 外部验证建议 | ⚠️ | 无官方外部基准,建议跨队列自建 |
| 20 | 版本记录 | ⚠️ | release 滚动、表变量漂移,需锁定单一版本 |
| 21 | 预处理脚本 | ✅ | DAIC 集中管线(Hagler 2019)与社区 BIDS 管线现成 |
| 22 | 合规要求 | ✅ | 受控 DUC 流程清晰,有官方培训 |
| 23 | 多模态对齐 | ⚠️ | 各模态以人/访视对齐,ROI 级派生指标经集中处理 |
| 24 | 去标识化 | ✅ | NDA 受控访问 + 未成年人脱敏协议 |
DAIMS 评分:18.5 / 24
评分解读:ABCD 在基础数据工程(唯一标识、字典、QC 文档、合规与外部资源)上非常扎实,且缺失机制与设备效应被官方与社区充分记录,是少有的「坑点有据可循」的大规模队列。扣分主要集中在「AI 就绪」侧:无官方 ML split、结局标签需自造、ROI 高共线性、release 间变量漂移、随访与影像缺失的非随机性,都需要研究者自行承担工程与统计责任。
对你意味着什么:不要指望「下载即开箱训练」。你必须在动手前就把版本锁死、写清结局定义、建立 family-aware 划分,并对 QC 后样本骤减有预期;把缺失机制与厂商效应作为分析的一部分而不是补丁。做到这几点,ABCD 足以支撑可复现且有临床/政策意义的发育模型。
DAIMS 评分使用建议:在立项时把 24 项逐条转成一份「ABCD 数据处理 checklist」(如:第 20 项写死 release 号、第 5/10 项核对缺失码、第 12 项做共线性过滤、第 15/16 项固定 family-aware split),可系统性地规避本页 §6.5 的多数坑点,也是向审稿人展示严谨性的直接抓手。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| HCP-Development | Washington Univ | 脑龄/结构表型迁移 | 泛化误差 | 中等下降 | 跨协议厂商需 harmonization 才稳定 |
| NCANDA | SRI/MUSC | 物质使用/认知关联 | 显著性方向 | 方向一致 | 支持年龄窗的可迁移性 |
| IMAGEN | 欧洲多中心 | 精神健康轨迹 | 效应量 | 需校准 | 强调多中心方差控制 |
| ABCD-BIDS Community Collection | 社区(OSU) | 影像派生指标 | 与官方相关性 | 高度相关 | 官方 vs 社区管线结果总体一致 |
注:外部矩阵仅为「有同行评审支撑的方向性证据」示意,具体数值随方法与子集变化,以各论文为准。
§7.9 数据质量与完整性总评
ABCD 的「质量」需分层看待:
| 层面 | 强度 | 说明 |
|---|---|---|
| 采集协议 | 高 | 21 site harmonized、集中 DAIC 处理,跨厂商仍残差方差 |
| 表型深度 | 高 | CBCL/KSADS/NIH Toolbox 等成熟工具 + 多报告者 |
| QC 文档 | 高 | 官方推荐纳入 QC + 神经放射复核、release notes 详实 |
| AI 就绪 | 中 | 无官方 split、标签需自造、release 漂移、高共线性 ROI |
| 人群代表性 | 中 | 便利抽样需加权/审慎表述 |
| 可复现基础 | 中高 | NDA Study DOI + 社区指南支持,但无统一评测协议 |
总体判断:作为「发展科学/公共卫生研究的数据资产」,ABCD 处于顶尖;作为「即开即用的 ML 基准」,需要研究者承担较多工程与统计责任。若你的目标是发布可复现、可比的 ML 结果,务必建立版本锁定的标准化预处理,详见 §6。
§8 基准性能与生态
§8.1 排行榜
ABCD 没有官方综合排行榜;下表列在 ABCD 上被社区反复引用的代表性任务与其结果(非可直接横向比较——特征集/标签/QC/划分各不相同)。
| 排名/代表 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 脑龄代表性 | SurfaceNet / 岭回归基线 | R² 常报告 0.3-0.6(随特征/清洗) | 2022+ | sMRI 表面形态 + 严格 QC | 见综述与预印本,结果不可直接比较 | 多社区 repo |
| 抑郁风险 | 逻辑/GBDT + 多模态 ROI | ROC-AUC 报告 0.7-0.85(标签定义差异大) | 2023 | KSADS-5 阈值二分类 + family split | 见 PMC10168288 等 | GitHub 各公开 |
| 物质使用 | 结构化 + 影像特征 | AUC 方向性稳健、数值因标签漂移 | 2023+ | 纵向随访标签 + 环境 | Volkow 综述引用 | 无统一 |
| harmonization 基准 | ComBat/neuroHarmonize | 去位点后方差下降 | 2019+ | 批量效应校正 | Hagler 2019 方法学 | neuroHarmonize |
不可直接比较的原因:ABCD 无统一评测协议;结果对 QC 过滤、结局阈值、亲属/位点划分与 release 版本高度敏感。任何「最优」宣称都须附完整配置。
§8.2 SOTA 总结与选型建议
- 影像单模态任务(脑龄、结构分类):先跑「免费」线性/GBDT 基线并严格 QC,深度模型常仅带来有限增益而引入泄漏风险。
- 表型/结局预测:优先可解释、校准好的模型;平衡不平衡标签。
- 纵向:混合效应/潜增长优于把随访当独立样本的简单网络。
§8.3 评测协议
- 家庭感知划分 + 分层位点 + 锁定 release + 报告 QC 后样本 + 结局定义敏感性 + 按组分层公平性。参见 §5.3/§5.4/§6.9。
§8.4 相关数据集表
| 数据集 | 与 ABCD 关系 |
|---|---|
| HBCD(HEALthy BCD) | NIH 姊妹前瞻队列,覆盖产前-婴幼儿,同 NBDC 受控访问 |
| NCANDA / IMAGEN | 青少年脑-成瘾/发育早期队列,横断参照 |
| HCP-Development | 高深度 5-21 岁横断,用于跨协议泛化验证 |
| UK Biobank(影像子集) | 成人大规模影像,年龄窗外的补充参照 |
§8.5 关键论文 Top 表
| 文献 | 一句话贡献 |
|---|---|
| Casey et al. 2018, Dev Cogn Neurosci 32:43-54 | 规定 ABCD 21 site 的多厂商 harmonized 影像采集协议与可行性证据 |
| Hagler et al. 2019, NeuroImage 202:116091 | ABCD 集中影像处理/QC 管线方法学参考,附技术指标 |
| Volkow et al. 2018, Dev Cogn Neurosci 32:4-7 | 综述 ABCD 从成瘾到多域 NIH 协作的源起与意义 |
| Barch et al. 2018, Dev Cogn Neurosci 32:55-66 | 人口/身体/精神健康评估域的 rationale 与量表清单 |
| Garavan et al. 2018, Dev Cogn Neurosci 32:16-22 | 学校抽样招募设计、孪生子补充与人群选择性问题 |
| Jernigan & Brown 2018, Dev Cogn Neurosci 32:1-3 | ABCD 在生物医学数据共享版图中的定位导言 |
| Volkow et al. 2020, Neuropsychopharmacology | ABCD 在理解精神/躯体健康风险中的设计与综述 |
| Saragosa-Harris et al. 2022, Dev Cogn Neurosci 55:101115 | ABCD 数据使用的实践指南(亲属嵌套、复现、社区惯例) |
| Bissett et al. 2021, eLife | 揭示 ABCD Stop-Signal 任务设计问题并给修正建议 |
§8.6 社区活跃度
- 每年多篇高引方法学与成果论文;abcdstudy.org 维护公开出版物库(含数千篇 ABCD 相关成果索引)。
- 大量教程/代码在 GitHub(ABCD-STUDY、DCAN-Labs/abcd-hcp-pipeline、beepboopstats 语义字典 App 等)。
- NDA/NBDC 提供官方数据字典、DEAP/NBDC 分析、年度会议与研讨会视频。
- 实践社区(学界方法学综述、OSF 预注册、NDA Study DOI)推动「家庭感知 + 版本锁定」成为事实规范,显著降低新手踩坑概率。
参与途径:获批访问后可加入 NBDC 分析社区、订阅 NDA ABCD 更新、参加 abcdstudy.org 年度公开会议,并在 GitHub 上维护可复现管线。
§8.7 生态快照表
| 资源 | 类型 | 推荐理由(截至 2026-09) |
|---|---|---|
| abcdstudy.org | 官方门户 | 数据发布、出版物、protocol 一手来源 |
| nda.nih.gov/abcd | 数据托管 | 唯一受控下载入口 |
| wiki.abcdstudy.org | 官方文档 | release notes 与数据文档权威页 |
| DCAN-Labs/abcd-hcp-pipeline | 开源管线 | 社区替代影像处理(BIDS) |
| ABCD data dictionary (NDA/DEAP) | 工具 | 变量/表语义检索 |
| beepboopstats.com/abcd-dictionary | 社区工具 | 语义搜索字典 App |
| Saragosa-Harris 2022 guide | 论文 | 入门数据使用最佳实践 |
§9 相关资源与引用
官方资源
- 官方主页:https://abcdstudy.org/
- 数据托管:https://nda.nih.gov/abcd
- 官方文档 / release notes:https://wiki.abcdstudy.org/release-notes/start-page.html
- 数据共享说明:https://abcdstudy.org/scientists/data-sharing/
- MRI 协议页:https://abcdstudy.org/scientists/protocols-mri/
- NDA NBDC Data Hub:经 https://nda.nih.gov/abcd 指引
- 遗传与社区管线:https://github.com/ABCD-STUDY(DCAN abcd-hcp-pipeline)
BibTeX 完整引用块
@article{volkow2018conception,
title={The conception of the ABCD study: From substance use to a broad NIH collaboration},
author={Volkow, Nora D and Koob, George F and Croyle, Robert T and Bianchi, Diana W
and Gordon, Joshua A and Koroshetz, Walter J and P{\'e}rez-Stable, Eliseo J
and Riley, William T and Bloch, Michele H and Conway, Kevin and others},
journal={Developmental Cognitive Neuroscience}, volume={32}, pages={4-7},
year={2018}, doi={10.1016/j.dcn.2017.10.002}}
@article{casey2018imaging,
title={The Adolescent Brain Cognitive Development (ABCD) study: Imaging acquisition across 21 sites},
author={Casey, BJ and Cannonier, Tariq and Conley, May I and Cohen, Alexandra O and others},
journal={Developmental Cognitive Neuroscience}, volume={32}, pages={43-54},
year={2018}, doi={10.1016/j.dcn.2018.03.001}}
@article{hagler2019image,
title={Image processing and analysis methods for the Adolescent Brain Cognitive Development Study},
author={Hagler Jr, Donald J and Hatton, Sean N and Cornejo, M Daniela and Makowski, Carolina and others},
journal={NeuroImage}, volume={202}, pages={116091},
year={2019}, doi={10.1016/j.neuroimage.2019.116091}}
@article{barch2018demographic,
title={Demographic, physical and mental health assessments in the adolescent brain and cognitive development study: Rationale and description},
author={Barch, Deanna M and Albaugh, Matthew D and Avenevoli, Shelli and Chang, Linda and others},
journal={Developmental Cognitive Neuroscience}, volume={32}, pages={55-66},
year={2018}, doi={10.1016/j.dcn.2017.10.010}}
@article{garavan2018recruiting,
title={Recruiting the ABCD sample: Design considerations and procedures},
author={Garavan, Hugh and Bartsch, Hauke and Conway, Kevin and Decastro, Anthony and others},
journal={Developmental Cognitive Neuroscience}, volume={32}, pages={16-22},
year={2018}, doi={10.1016/j.dcn.2018.04.004}}
引用指南
- 优先引用你实际所用 release 的 DOI(在 NDA 下载页给出)与方法学论文(Hagler 2019、Casey 2018)。
- 若用社区 BIDS 管线,另引 DCAN-Labs/abcd-hcp-pipeline 对应 DOI。
- 引用格式遵循目标期刊/会议要求,并附数据字典/版本说明。
附录:ABCD 常用缩略语表
| 缩略语 | 全称 | 含义 |
|---|---|---|
| ABCD | Adolescent Brain Cognitive Development | 数据集/研究名 |
| NIDA/NIMH | National Institute on Drug Abuse / Mental Health | 主资助 / 数据归档主办 NIH 所 |
| NDA | NIMH Data Archive | 数据托管平台(ABCD 所在 collection) |
| NBDC | NIH Brain Development Cohorts Data Hub | 2025 起安全分析/访问通道 |
| DAIC | Data Analysis and Informatics Center | ABCD 集中影像处理中心 |
| DUC | Data Use Certification | 受控访问授权书 |
| DEAP | Data Exploration and Analysis Portal | 已停用(2023-06)的探索分析门户 |
| sMRI/dMRI | structural / diffusion MRI | 结构/扩散磁共振 |
| rs-fMRI | resting-state fMRI | 静息态功能磁共振 |
| MID/SST/nBack | Monetary Incentive Delay / Stop-Signal / Emotional N-Back | 三种任务 fMRI 范式 |
| CBCL | Child Behavior Checklist | 儿童行为量表(内化/外化) |
| KSADS-5 | Kiddie Schedule for Affective Disorders and Schizophrenia | 诊断式访谈模块 |
| ROI | region of interest | 感兴趣区(分区指标) |
| FD | framewise displacement | 帧位移(运动代理) |
| WGS | whole-genome sequencing | 全基因组测序(7.0 起约 80% 队列) |
附录:数据与文档官方链接索引
| 链接 | 用途 |
|---|---|
| https://abcdstudy.org/ | 官方主页、出版物、协议 |
| https://nda.nih.gov/abcd | 数据申请与下载 |
| https://wiki.abcdstudy.org/release-notes/start-page.html | release notes(最新) |
| https://docs.abcdstudy.org/ | 成像与 QC 数据文档 |
| https://abcdstudy.org/scientists/data-sharing/ | 访问流程与版本差异 |
| https://github.com/ABCD-STUDY | 官方/关联代码仓库 |
| https://github.com/DCAN-Labs/abcd-hcp-pipeline | 社区 BIDS 处理管线 |
引用指南(补充)
- 数据本体引用:用你在 NDA 下载页可见的 release DOI(如 2.0.1 数据 DOI 10.15154/1503209,各版本不同)。
- 结构/方法引用:Casey 2018(影像采集)、Hagler 2019(处理管线)、Barch 2018(表型)。
- 综述定位:Volkow 2018、Jernigan & Brown 2018。
- 复现/设计:Saragosa-Harris 2022(实践指南)、Garavan 2018(招募)。
- 伦理/隐私:以 NDA DUC 与培训要求为准,勿以任何单一期刊建议取代。
§10 AI 使用声明卡
10.1 AI 模型列表
- Anthropic Claude(写作辅助、文本组织与代码示例草拟)。
- 上述模型参与本页的章节起草、表格整理与代码骨架生成。
10.2 AI 参与范围
AI 用于内容组织、格式规范化与代码示例草拟;所有事实经检索核对,未以 AI 输出替代真实数据来源。
10.3 输入来源列表
- NIDA:ABCD Curated Data Releases — https://nida.nih.gov/drug-topics/adolescent-brain/abcd-curated-data-releases
- ABCD Study 官网 Data Sharing — https://abcdstudy.org/scientists/data-sharing/
- ABCD 数据共享归档 — https://abcdstudy.org/5jas
- ABCD 官方文档/影像 Overview — https://docs.abcdstudy.org/v/7_0_3/documentation/imaging/
- NDA ABCD 数据托管 — https://nda.nih.gov/abcd
- Casey et al. 2018 Dev Cogn Neurosci — https://doi.org/10.1016/j.dcn.2018.03.001
- Hagler et al. 2019 NeuroImage — https://doi.org/10.1016/j.neuroimage.2019.116091
- Volkow et al. 2020 Neuropsychopharmacology 综述 — https://doi.org/10.1038/s41386-020-0736-6
- Barch et al. 2018 Dev Cogn Neurosci — https://doi.org/10.1016/j.dcn.2017.10.010
- Garavan et al. 2018 Dev Cogn Neurosci — https://doi.org/10.1016/j.dcn.2018.04.004
- Saragosa-Harris et al. 2022 Dev Cogn Neurosci(实践指南)— https://doi.org/10.1016/j.dcn.2022.101115
- ABCD 基线人群分析指南预印本 — https://doi.org/10.1101/2020.02.10.942011
- 实例论文(QC 后样本、多模态抑郁预测)— PMC10168288 / s41598-025-88398-2
10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景与编码映射 | 千方病案医学编辑部 | 医学交叉审核 | ✅ 已通过 |
| §7 偏倚与 DAIMS 评估 | 千方病案医学编辑部 | 医学交叉审核 | ✅ 已通过 |
| §4 DAIMS 数据字典 | 千方病案医学编辑部 | 数据工程交叉审核 | ✅ 已通过 |
| §5/§6 划分与坑点 | 千方病案医学编辑部 | 数据工程交叉审核 | ✅ 已通过 |
| §3 模态与 release 规格 | 千方病案医学编辑部 | 来源比对 | ✅ 已通过 |
| §8 生态与基准引用 | 千方病案医学编辑部 | 来源比对 | ✅ 已通过 |
| §1/§9 概览与链接 | 千方病案医学编辑部 | 来源比对 | ✅ 已通过 |
| 规模数字与 release 事实 | 千方病案医学编辑部 | 来源比对 | ✅ 已通过 |
10.5 AI 生成章节标注
- 本文正文各章节均在检索证据基础上由 AI 起草、经人工交叉审核定稿;无纯 AI 生成的未经核实论断。
- 代码示例为技术骨架,须在真实数据上验证后再用于生产。
10.6 最后人工审核日期
- 2026-09-05
10.7 已知勘误与治理提示
- Data Release 5.1 为修复 5.0 数据质量问题的补丁版;引用时注明具体 release,避免只说「ABCD」。
- DEAP 已于 2023-06-01 停用;依赖其语义索引的旧教程/工具需迁移到 NDA 字典或 NBDC 界面。
- 访问通道自 2025-06-02 起由 NDA 转向 NBDC Data Hub;撰写方法时请引用你实际获批的渠道与 release DOI。
