信息速览

Healthy Brain Network(健康脑网络) — 儿童青少年跨诊断脑与精神健康队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Healthy Brain Network(健康脑网络) |
| 英文全称 | Healthy Brain Network(HBN) |
| 别名/简称 | CMI-HBN、HBN Biobank、Healthy Brain Network Biobank |
| 疾病分类(ICD-11) | 6A05 注意缺陷多动障碍;6A00 孤独症谱系障碍;6B00 广泛性焦虑障碍;6A03 发展性学习障碍;6A70 抑郁发作 |
| SNOMED CT | 注意缺陷多动障碍 406506008;孤独症谱系障碍 702375004;抑郁障碍 370143000;焦虑 21897009(上位概念) |
| 数据模态 | 结构 MRI、静息态/自然观看 fMRI、扩散峰度成像、EEG、眼动、语音/视频、基因分型、actigraphy、认知/行为/临床评估 |
| AI 任务类型 | 脑龄预测、精神病理维度回归、诊断分类、表型插补、多模态融合、影像 QC 预测 |
| 样本总数 | 表型约 4,867 名;多模态 MRI 3,905 名;EEG+眼动 4,142 名(Release 11,数据截至 2022-11) |
| 数据大小 | EEG Release 8 单版本 157.19 GB(9,305 个文件);MRI 总量未公开精确数字 |
| 数据格式 | BIDS(MRI/EEG,NIfTI/TSV)、CSV(表型,LORIS 导出) |
| 许可证 | MRI 及 NC 子集 CC BY-NC-SA 4.0;EEG 公开子集 CC BY-SA 4.0 |
| 访问级别 | MRI/表型:申请审核(注册 + 签署 DUA);EEG 公开子集:注册后开放(OpenNeuro) |
| DUO 标签 | NPUNCU(非商业、非营利使用) |
| 语言 | 英语(评估工具为英文标准化量表) |
| 首发日期 | 2017-06(Release 1,n=664) |
| 最后更新 | 2024-06(Release 11 公告;数据截止 2022-11-23) |
| 发布机构 | Child Mind Institute(美国儿童心理研究所) |
| 官方主页 | FCP/INDI 官方门户 |
| 下载地址 | AWS S3 BIDS_curated;EEG:OpenNeuro ds005505-ds005516 |
| DOI | 10.1038/sdata.2017.181 |
| 引用次数 | 676+(Springer Nature 引用统计,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 影像已 BIDS 化且有 RBC 社区预处理衍生数据,但表型分散在数十个量表 CSV 需手动拼接,历次 release 存在重复行与编码修复,且无官方 ML 划分 |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED 映射、儿童青少年精神病理学基础、金标准诊断流程)、§7 偏倚分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HBN 要求用户通过官方门户注册账户并签署数据使用协议(DUA)后访问 MRI 与表型数据;EEG 公开子集采用 CC BY-SA 4.0,NC 子集禁止商用。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? Healthy Brain Network(HBN,健康脑网络)是美国 Child Mind Institute(儿童心理研究所)在纽约都会区开展的一项大型儿童青少年脑与心理健康研究。研究团队通过社区广告,邀请那些对孩子心理健康或学习能力有担忧的家庭前来参加约 12 小时(4 次访视)的全面评估,包括智力与学业测验、精神科临床访谈、体格检查以及脑部扫描,然后把脱敏后的数据免费开放给全世界的研究者。截至 Release 11,已有约 4,867 名 5-21 岁受试者的数据释放,最终目标是 10,000 名。
为什么重要? 绝大多数成年精神疾病起病于 24 岁之前,儿童青少年期正是干预的黄金窗口,但精神科至今缺乏客观的生物标志物。HBN 的独特之处在于"跨诊断"设计:它不按单一疾病招募,而是同时纳入 ADHD、焦虑、孤独症、学习障碍等各种程度的症状与诊断,让研究者可以在同一个样本里比较不同疾病的脑机制,这正是 NIMH 倡导的 RDoC 研究范式所需要的数据形态。
我能用它做什么? 训练脑龄预测模型、从脑影像预测认知与精神病理维度、做多模态融合(MRI+EEG+基因+行为)、研究 ADHD 或阅读障碍的神经机制、开发儿童影像质控算法,或作为缺失值插补与表型预测的方法学试验场。Kaggle 2024 年基于 HBN 数据举办的问题性网络使用预测竞赛吸引了超过 3,500 支队伍参赛。
§1.1 摘要
HBN 采用社区推荐招募(community-referred recruitment)模式,在纽约都会区 4 个站点面向 5-21 岁儿童青少年持续采集,每位受试者完成 4 次各约 3 小时的访视:第 1 次为知情同意、WISC-V/WAIS-IV 等智力测验与首轮临床访谈;第 2 次为约 105 分钟的多模态 MRI 扫描(结构像、两段各 5-10 分钟的静息态 fMRI、自然观看 fMRI 与扩散峰度成像);第 3 次为 WIAT-III 学业成就、CELF-5 语言测验、NIH Toolbox 认知测验与体能测量;第 4 次为 129 通道 EEG 与 K-SADS 临床诊断访谈。诊断由持证临床医师执行 K-SADS-COMP 半结构化访谈,结合算法生成诊断与临床团队共识诊断双轨输出。数据以季度节奏经 FCP/INDI 门户分批释放,MRI 与表型经注册并签署 DUA 后获取,EEG 公开子集在 OpenNeuro 以 BIDS 格式开放,整体构成目前规模最大、表型最全的公开儿童跨诊断脑影像资源之一。
§1.2 战略价值
维度一:跨诊断设计的不可替代性。 主流公开脑影像数据集要么聚焦单一疾病(如 ABIDE 之于孤独症),要么以健康发育为轴(如 HCP-D)。HBN 刻意按"症状维度而非诊断类别"招募,样本同时覆盖临床受累程度从高到低的整个谱系,并附带 K-SADS 共识诊断、数十种维度化量表(E-SWAN、SWAN 等)与 p-factor 式总体精神病理负荷指标。对 AI 研究者,这意味着可以在同一数据上定义诊断分类、维度回归、症状亚型发现等多种任务,并直接检验"诊断边界是否可信"这一临床核心问题。
维度二:多模态与临床闭环的乘积效应。 HBN 在同一受试者身上对齐了脑结构/功能/扩散 MRI、129 通道任务态 EEG、眼动、语音视频、基因分型、体格体能与家庭环境变量,且受试者完成评估后会获得正式的诊断咨询与转诊建议——这使数据天然带有"真实临床工作流"印记。对模型开发者,这是稀缺的可做多模态对齐与跨模态预训练的儿科资源;对卫生系统研究者,它提供了检验"筛查-转诊"数字疗法闭环的沙盘。
维度三:滚动生物样本库的方法学试金石。 HBN 的季度 release、四阶段协议演进、双许可体系与历次数据修复(重复行、列名漂移、字典纠错)构成了一部活的"大规模临床数据工程教材"。对 ML 系统研究者,它比静态竞赛数据更接近真实生产环境:数据会增长、编码会变化、许可有边界。把 HBN 作为基准库的团队,等于同时测试模型的稳健性与数据管线的工程成熟度——这两者正是医疗 AI 从论文走向产品的分水岭。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 年龄段 | 模态 | 标注 | 与 HBN 的差异化 |
|---|---|---|---|---|---|
| HBN | 表型约 4,867 名;MRI 3,905 名(R11) | 5-21 岁 | sMRI、静息/自然观看 fMRI、DKI、EEG、眼动、基因、语音、actigraphy | K-SADS 共识诊断 + 数十种维度量表 | 跨诊断、临床受累谱系完整、表型最深 |
| ABIDE I/II | 约 1,111 名 | 5-64 岁 | sMRI + 静息 fMRI | 孤独症/对照诊断 | 单病种、表型较浅 |
| ADHD-200 | 约 949 名 | 7-21 岁 | sMRI + 静息 fMRI | ADHD/对照诊断 | 单病种、规模小,为 HBN 前身项目 |
| NKI-Rockland | 600+ 名 | 6-85 岁 | 多模态 MRI + EEG 等 | 社区样本表型 | 全年龄段但非临床聚焦 |
| HCP-Dvelopment | 600+ 名 | 5-21 岁 | 多模态 MRI + 行为 | 健康发育队列 | 无临床诊断深表型 |
| ABCD | 约 11,800 名 | 9-10 岁起纵向 | 多模态 MRI + 表型 | 纵向队列 | 纵向性强但需 NDA 申请、开放度低于 HBN |
§1.4 版本时间轴
| 时间 | 版本/事件 | 内容 |
|---|---|---|
| 2017-06 | Release 1 | 首次释放 664 名受试者;HBN Biobank 正式启动 |
| 2017-12 | 数据描述论文发表 | Alexander et al., Scientific Data 4:170181 |
| 2022-10 | dMRI 分析就绪资源 | Richie-Halford et al. 释放 2,747 名 BIDS 化预处理 dMRI |
| 2024-04 | 网站与文档大更新 | 更新量表清单、数据字典;拆分 KSADS 诊断表;清理重复行 |
| 2024-06 | Release 11 公告 | 数据截止 2022-11-23:表型 n=4,867、EEG+眼动 n=4,142、MRI n=3,905 |
| 2024-10 | HBN-EEG FAIR 化 | 9 个 release 上线 OpenNeuro(ds005505-ds005516),BIDS+HED 标注 |
§1.5 典型应用场景
- 脑龄与发育里程碑预测:以结构 MRI 或连接组特征预测实足年龄,评估发育偏移;Modabbernia et al. 2023 已在含 HBN 在内的多个儿科数据集上系统评测了 12 类算法。
- 精神病理维度回归:从多模态特征预测 K-SADS 诊断、p-factor 式总体精神病理负荷或 E-SWAN/SWAN 维度分,进行跨诊断生物标志物发现。
- 多模态融合与预训练:MRI+EEG+基因+表型的对齐建模,如 Riaz 等基于 HBN 构建个体化 EEG 头模型与 lead-field 的工作。
- 学习障碍机制研究:结合 WIAT-III、TOWRE-2、CELF-5 与扩散指标研究阅读/语言障碍的白质基础。
- 数据方法学基准:缺失值插补、队列偏倚校正、影像 QC 自动化(Fibr 社区科学 QC 网络即诞生于 HBN dMRI)。
§1.6 快速自检:这个数据集适合你吗
| 你的情况 | 适合度 | 理由 |
|---|---|---|
| 研究儿童 ADHD/焦虑/学习障碍脑机制 | ⭐⭐⭐⭐⭐ | 跨诊断深度表型的最佳公开来源 |
| 做脑龄/发育曲线建模 | ⭐⭐⭐⭐⭐ | 样本量与年龄跨度兼备,且有现成对比框架 |
| 需要 EEG+影像同人多模态 | ⭐⭐⭐⭐ | EID 可对齐,但 EEG 公开子集需注意 release 口径 |
| 做人群患病率/流行病学估计 | ⭐⭐ | 社区推荐招募非代表性样本,官方明示不适合 |
| 需要纵向干预效果数据 | ⭐⭐ | 横断面为主,随访仅季度报告与 CRISIS 两时点 |
| 商用产品训练 | ⭐⭐ | 主体许可为 CC BY-NC-SA,商用需另行授权 |
§2 医学背景
§2.1 ICD-11 编码映射表
HBN 覆盖的核心诊断类别及标准术语映射如下(诊断本体以 K-SADS-COMP 产出的 DSM-5 诊断为准,ICD-11/SNOMED CT 为对映编码):
| 标签(中文) | ICD-11 编码 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 注意缺陷多动障碍 | 6A05 | 406506008 | Attention deficit hyperactivity disorder |
| 孤独症谱系障碍 | 6A00 | 702375004 | Autism spectrum disorder |
| 广泛性焦虑障碍 | 6B00 | 21897009(焦虑,上位概念) | Generalised anxiety disorder |
| 发展性学习障碍 | 6A03 | — | Developmental learning disorder |
| 抑郁发作 | 6A70 | 370143000 | Depressive episode / depressive disorder |
| 抽动障碍(按需评估) | 8A05 | — | Tic disorders(YGTSS 用于按需评估) |
| 强迫障碍(按需评估) | 6B24 | — | Obsessive-compulsive disorder(Y-BOCS/ CY-BOCS 用于按需评估) |
§2.2 疾病简介与流行病学
HBN 所针对的精神健康与学习障碍是儿童青少年期最常见的慢性健康问题之一。HBN 原始论文引用的流行病学证据指出:约 75% 的可诊断精神障碍在 24 岁之前起病,因此发育期是理解与拦截精神病理的关键窗口。传统研究范式依赖"单一病例组 vs 超健康对照"的极端比较设计,样本量小、缺乏共病信息,导致脑-行为关联发现缺乏特异性,临床可用生物标志物的寻找进展缓慢。HBN 的应对策略有二:一是采用跨诊断(transdiagnostic)模型,围绕跨诊断边界的行为与神经生物学维度组织数据;二是支持诊断亚型(subtyping)研究,通过行为或生物学同质亚群解释诊断类别内部变异。数据集特意覆盖临床实践中常见受累程度的全谱系,而非仅纳入"确诊-健康"二元人群,从而保留了真实临床鉴别诊断(如区分原发精神病性问题还是心境问题)所必需的复杂度。
§2.2b 跨诊断框架下的关键构念
HBN 的量表体系有意支持"维度优先"的分析路径,以下构念在使用诊断标签之外提供了更细粒度的目标变量:
| 构念 | 实现量表 | 分析意义 |
|---|---|---|
| 总体精神病理负荷(p-factor 近似) | Overall Psychopathology 因子(RBC 统计均值 0.22,SD 0.96);由多量表因子分析派生 | 全脑-精神病理关联的首选连续目标 |
| ADHD 症状维度 | SWAN(双向计分)、Conners、E-SWAN | 保留亚阈值症状,避免二分化信息损失 |
| 焦虑维度 | SCARED(家长/自评双报告)、STAI(18+)、MFQ | 多报告者一致性可建模 |
| 自闭特质维度 | SRS-2、SCQ、ASSQ、RBS | 连续特质 + 按需 ADOS 确诊 |
| 损害/功能 | Columbia 病损量表(CIS)、WHODAS | 区分症状与功能损害 |
| 家庭与环境 | Barratt SES、APQ、CPIC、ACES、NLES | 混杂控制与环境暴露建模 |
小结提示:诊断标签与维度标签并非二选一。HBN 的设计哲学是"双轨并报"——以 K-SADS 共识诊断锚定临床含义,以维度量表刻画连续变异;AI 建模时建议以维度回归为主任务、诊断分类为辅助任务,可同时获得统计功效与临床可解释性。
§2.3 临床任务定义
| 任务类型 | 定义 | HBN 中的实现 |
|---|---|---|
| 筛查 | 从无目标人群中识别高受累个体 | CMI Symptom Checker、SWAN/E-SWAN 维度量表;社区推荐招募本身即一次真实筛查 |
| 诊断 | 确立精神障碍类别标签 | K-SADS-COMP 持证临床医师访谈 → 算法诊断 + 临床共识 DSM-5 诊断(家长/青少年/临床医师三视角拆分于 R11) |
| 分级 | 症状严重程度量化 | 各量表 T 分数与原始分、Columbia 病损量表(CIS)、YGTSS/Y-BOCS 按需分级 |
| 预后/转归 | 预测随访转归 | 家庭季度随访报告(Quarterly Mental Health Report);CRISIS COVID 两时点调查 |
| 认知刻画 | 智力/学业/语言能力定位 | WISC-V/WAIS-IV、WIAT-III、CELF-5、CTOPP-2、TOWRE-2、NIH Toolbox |
§2.4 患者人群表
| 维度 | 描述 |
|---|---|
| 来源 | 社区推荐招募:广告招募对子女精神/学习症状有担忧的纽约都会区家庭,非临床转诊、非流行病学抽样 |
| 采集时间 | 2017 年起持续招募(R11 数据截止 2022-11-23) |
| 年龄 | 5-21 岁(PennLINC 整理 MRI 子集平均约 10.3-10.4 岁) |
| 性别 | 女性占比约 33-36%(RBC/PennLINC 统计口径) |
| 种族 | 多元纽约都会区人群;原始 release 未提供可直接引用的种族构成汇总 |
| 就医类型 | 社区样本:受试者此前未必进入临床体系,完成评估后获诊断咨询报告与转诊 |
| 右利手占比 | 约 77-82%(不同整理版本口径) |
§2.5 临床价值
HBN 的临床价值链条是"数据 → 生物标志物 → 工具 → 服务"。对研究者,它是检验儿童精神病理脑机制假说的公共试验场;对算法开发者,K-SADS 共识诊断与维度量表并存的标注体系允许同时训练分类器与回归器并比较临床效用;对临床系统,HBN 证明了"评估即福利"的招募模式可在社区环境中低成本获取深度临床数据,参与家庭获得正式诊断咨询与转诊,这一模式本身可作为儿童心理健康服务体系的设计参考。研究发起方 Child Mind Institute 的 INDI 生态(ADHD-200、ABIDE、NKI-Rockland)此前已支持 900+ 篇论文,HBN 延续并放大了该开放科学路线。
§2.6 金标准表
| 划分 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|
| K-SADS-COMP 半结构化访谈(家长 + 儿童青少年双视角) | 计算机化 web 版访谈,算法自动生成诊断 | 持证临床医师(心理学家 + 社工,精神科医师药理咨询支持) | 算法诊断(可复现) |
| 临床共识诊断 | 访谈后由临床团队结合全部材料综合裁定 | 临床团队 | 共识金标准(含临床判断) |
| 三视角诊断拆分(R11 起) | Diagnosis_KSADS_T / _P / _D 三表 | 青少年自述、家长报告、临床医师 | 多源标签,支持一致性建模 |
| 评分质量控制 | 临床医师初评 → 研究助理复评 → 双人独立双录入 | 医师 + 两名研究助理 | 三重校验 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 最新最全表型 + 诊断标签 | 官方 Release 11(LORIS/门户) | 表型 CSV 集合(GB 级) | R11 完成 KSADS 三视角拆分与重复行清理,数据截止 2022-11 |
| 现成 BIDS MRI + 预处理衍生 | PennLINC RBC/AI2D 整理版(3,887 sessions) | 数 TB 级(DataLad) | CuBIDS 质控 + sMRIPrep/fMRIPrep/XCP-D/QSIPrep 衍生全流程可复现 |
| BIDS+HED 标注 EEG | OpenNeuro ds005505-ds005516(R1-R9 公开子集) | 单版本约 130-160 GB | FAIR 化、CC BY-SA 许可、附带事件标注 |
| 快速跑表格基准 | Kaggle CMI-PIU 竞赛子集 | 约 GB 级 | 已切好 train/test,指标与基线现成(QWK) |
| 可靠性/扫描条件方法研究 | HBN-SSI(13 名 × 12 sessions × 4 条件) | 小体积 | 专用重测信度试验台 |
§3.1 模态详情
- 结构 MRI(morphometric MRI):T1w/T2w 形态学扫描,支持皮层厚度、体积与形态计量分析;1.5T 与 3T Siemens 平台混布于多站点。
- 静息态 fMRI:每名受试者 2 扫、每扫 5-10 分钟,共 10-20 分钟数据;儿童人群短扫描,运动敏感。
- 自然观看 fMRI(naturalistic viewing):观看动画/电影片段的被动任务 fMRI,对临床与发育人群耐受性更高,支持受试者间相关(ISC)分析。
- 扩散峰度成像(DKI):单 shell 以上的扩散序列,支持 DTI/DKI/NODDI 重建;Fibr 项目已释放 2,747 名预处理版本。
- EEG:129 通道高密度网帽、500 Hz 采样;任务含静息态、对比变化检测、序列学习、符号搜索、环绕抑制与多部自然观看影片;与桌面眼动仪同步采集。
- 眼动追踪:与 EEG 任务并行的桌面式眼动数据,BIDS 化工具已开发待发布。
- 语音/视频:结构化语音评估与行为视频样本,支持语音生物标志物研究。
- 基因/生物样本:唾液/颊拭子与血液(内分泌、免疫、代谢谱 + 基因分型)。
- 体格与体能:FITNESSGRAM(俯卧撑、卷腹、躯干伸展、坐位体前屈、握力)、心肺耐力测试、心率血压、身高体重腰围、生物电阻抗。
- 表型评估:数十种标准化量表,覆盖精神症状、家庭环境、创伤、物质使用、睡眠、青春发育与生活史(详见 §4.1)。
§3.1b EEG 任务清单(BIDS task 命名)
OpenNeuro BIDS-EEG 数据集中的任务命名与内容(task 标签取自官方 BIDS 文件清单):
| BIDS task 标签 | 任务内容 |
|---|---|
| task-RestingState | 静息态 EEG |
| task-contrastChangeDetection | 对比变化检测(被动视觉任务) |
| task-seqLearning6target / task-seqLearning8target | 序列学习(6/8 目标版本) |
| task-symbolSearch | 符号搜索(加工速度) |
| task-surroundSupp | 环绕抑制 |
| task-DespicableMe / task-DiaryOfAWimpyKid / task-FunwithFractals / task-ThePresent | 自然观看(动画影片片段),与桌面眼动同步 |
每个 task 目录附 _eeg.json(采集参数)与 _events.json(HED 层级标注事件),支持毫秒级事件锁定分析。
§3.2 按子集样本数表
| 子集 | 受试者数 | 说明 |
|---|---|---|
| 表型数据(R11 总量) | 4,867 | 数据截止 2022-11-23 |
| EEG + 眼动(R11 总量) | 4,142 | 部分 EEG 受试者表型数据计划于 R12 补齐 |
| 多模态 MRI(R11 总量) | 3,905 | PennLINC RBC 整理 3,887 sessions |
| dMRI 分析就绪资源(Fibr/RBC) | 2,747 | BIDS + 去噪/畸变/运动校正 |
| EEG BIDS OpenNeuro R1-R9 | 136/152/183/324/330/134/381/257/295(R1-R9 各自) | 公开 CC BY-SA 子集 |
| EEG NC 子集 | 458 | CC BY-NC-SA,仅 S3 分发,禁商用 |
| HBN-SSI 重复扫描子研究 | 13 | 12 sessions × 4 fMRI 条件 |
| 首次释放 R1(历史) | 664 | 2017-06 |
§3.3 数据格式表
| 数据类型 | 格式 | 组织方式 |
|---|---|---|
| MRI 影像 | NIfTI(BIDS 规范) | BIDS_curated S3 目录:sub-<ID>/ses-<ID>/anat、func、dwi |
| EEG | BIDS-EEG(.set/.edf,HED 事件标注) | OpenNeuro 每 release 一个 BIDS 数据集 |
| 表型/行为 | CSV/TSV(LORIS 导出) | 按量表一表(如 Basic_Demos、WISC、KSADS、EHQ、Barratt) |
| 眼动 | 原始格式(BIDS 化工具开发中) | LORIS/门户 |
| 基因 | 原始 + 整理格式 | 按官方数据字典 |
| 预处理衍生 | NIfTI/TSV(fMRIPrep、XCP-D、QSIPrep、FreeSurfer 输出) | RBC DataLad 数据集 |
§3.4 存储大小
EEG 单个 release 版本约 130-160 GB 量级(Release 8 为 157.19 GB、9,305 个文件);多模态 MRI 全量为数 TB 级,官方未公布单一精确总量,建议按受试者增量同步(aws s3 sync --exclude "*" --include "sub-XXXX*")。表型 CSV 集合为 GB 级以下。规划磁盘时按"全量 MRI ≥ 5 TB + 工作副本"估计是保守安全的起点。
§3.5 标注方式
标注呈"临床访谈金标准 + 维度量表弱监督"双层结构:(1) 诊断标签来自 K-SADS-COMP 持证临床医师半结构化访谈,含算法生成与临床共识两条产出线,可视为金标准人工标注;(2) 数十种自评/家长评量表构成维度化、部分弱监督的连续标签(CBCL、SCARED、MFQ、SWAN 等),由受试者通过 NextGen 电子病历患者门户直接电子录入以消除转录错误;(3) 认知与学业标签来自施测者施测的标准化测验,机器可读原始分与标准分并存。无第三方独立复评诊断一致性数据公开,使用诊断标签时应以"临床共识 + 算法"双轨并报。
§3.6 标注者资质与一致性
临床团队由心理学家与社会工作者组成(均持照或在持照人员直接监督下施测),精神科医师提供药理咨询支持。诊断访谈由持证临床医师执行。所有临床测验执行"三重校验":施测临床医师初评、训练有素的研究助理全量复评、最后由两名不同研究助理双人独立双录入数据库。这使量表数据录入错误率显著低于常规研究;但公开数据中不含标注者间一致性系数(如 Kappa),使用者无法直接评估诊断可靠性,需依赖共识诊断的程序性保障。
§3.7 采集周期
2017 年起持续招募与采集,数据以季度节奏分批释放;R11 数据截止 2022-11-23;截至 2024 官方口径累计入组约 4,136 名(Atlas 口径)至释放表型 4,867 份数据集(R11 口径,含回溯补录)。研究分四阶段推进:Phase I(1-500)建立 Staten Island 原型与移动 MRI 试验;Phase II(501-1,000)修订加固协议(加入语音、唾液基因、自然观看 fMRI 与家庭随访);Phase III(1,001-8,500)多站点固定扫描仪扩展;Phase IV(8,501-10,000)流行病学目标抽样。协议随阶段演进意味着并非所有受试者拥有全部量表,跨 release 列名与编码亦有漂移。
阶段演进对数据可用性的影响:
| 阶段(受试者编号) | 新增/变化的采集内容 | 对建模的影响 |
|---|---|---|
| Phase I(1-500) | 基础协议:诊断、表型、EEG、MRI;测试移动 MRI | 早期受试者缺语音/基因/自然观看 fMRI |
| Phase II(501-1,000) | 加入语音、唾液基因、自然观看 fMRI、家庭随访;KSADS-COMP/E-SWAN 定型 | 跨阶段量表可得性差异显著 |
| Phase III(1,001-8,500) | 三中心扩展、固定 MRI、家庭抽血、actigraphy | 站点变量从 2 站扩展至多站,扫描仪异质性上升 |
| Phase IV(8,501-10,000) | 流行病学目标抽样 | 抽样权重策略将不同于前三阶段 |
实用结论:涉及"全量表可用"的分析建议默认使用 Phase III 主体样本;跨阶段分析必须显式加入阶段/站点协变量并做可得性偏差敏感性分析。
§3.8 地域覆盖
全部受试者来自美国纽约都会区,设曼哈顿与斯塔滕岛两个 Diagnostic Research Center(诊断研究中心),MRI 扫描分布于纽约都会区 4 个采集站点(Phase III 起转多站点固定扫描仪模式,并测试过移动 MRI 平台)。地域集中是解读泛化性时的关键约束:结论对城市、英语主导、北美医疗语境下的儿童人群成立性最强。
§3.9 设备规格
| 设备 | 规格 |
|---|---|
| MRI | Siemens 1.5T 与 3T 平台混布(多站点);结构 T1w/T2w、静息/自然观看 fMRI(2×5-10 min)、DKI 序列 |
| EEG | 129 通道高密度电极网,500 Hz 采样,与桌面眼动仪同步 |
| 眼动 | 桌面式眼动追踪仪(与 EEG 任务并行) |
| 体能 | FITNESSGRAM 标准化器材、握力计、生物电阻抗分析仪、心血管耐力测试 |
| 生理 | 心率、血压、身高体重腰围测量 |
§3.10 深度溯源链
原始评估(临床医师/施测者)→ NextGen 电子病历门户电子录入或双人双录入 → COINS/LORIS 数据平台归档 → Child Mind Institute 数据团队季度清理与脱敏 → FCP/INDI(NITRC)门户与 AWS S3(s3://fcp-indi)发布 → 社区整理版(PennLINC RBC BIDS 化、OpenNeuro BIDS-EEG、Fibr dMRI 预处理、Kaggle 竞赛子集)。每一环均有可追溯的官方公告或同行评审论文背书;引用时区分"官方原始数据"与"社区整理衍生数据"是保证可复现性的第一步。
§4 数据结构
§4.0 目录树
官方 S3 BIDS_curated 桶 + LORIS 表型导出后的整体结构预览:
data_root/
├── BIDS_curated/ # s3://fcp-indi/data/Projects/HBN/BIDS_curated/
│ ├── dataset_description.json
│ ├── participants.tsv # 受试者级影像参与信息(BIDS 规范)
│ ├── sub-NDAR*/ # 受试者目录(EID 形如 NDARXXXxxxx)
│ │ ├── ses-1/
│ │ │ ├── anat/
│ │ │ │ ├── sub-NDAR*/ses-1/T1w.nii.gz
│ │ │ │ └── sub-NDAR*/ses-1/T2w.nii.gz
│ │ │ ├── func/
│ │ │ │ ├── sub-NDAR*task-rest_bold.nii.gz # 静息态(2 扫)
│ │ │ │ ├── sub-NDAR*task-movie*bold.nii.gz # 自然观看(电影/动画)
│ │ │ │ └── *.json # 采集参数
│ │ │ └── dwi/
│ │ │ └── sub-NDAR*dwi.nii.gz # DKI 序列
│ ├── derivatives/ # 社区预处理衍生(qsiprep 等)
│ │ └── qsiprep/
│ └── ... # 部分站点受试者无 ses 层级,直接 sub-*/anat|func
├── pheno/ # LORIS 门户导出的表型(每量表一 CSV)
│ ├── Basic_Demos.csv # 受试者人口学(EID、Age、Sex、Site…)
│ ├── EHQ.csv # 爱丁堡利手问卷
│ ├── WISC.csv # WISC-V 智力测验
│ ├── WIAT.csv # WIAT-III 学业成就
│ ├── KSADS/ # 诊断访谈
│ │ ├── Diagnosis_KSADS_T.csv # 青少年自述诊断(R11 拆分)
│ │ ├── Diagnosis_KSADS_P.csv # 家长报告诊断
│ │ └── Diagnosis_KSADS_C.csv # 临床医师共识诊断
│ ├── CBCL.csv / SCARED.csv / MFQ.csv / SWAN.csv / E-SWAN.csv …
│ ├── Barratt.csv # 家庭社会经济地位
│ └── PCIAT.csv # 家长-儿童网络成瘾测验(Kaggle PIU 目标来源)
├── BIDS_EEG/ # s3://fcp-indi/data/Projects/HBN/BIDS_EEG/
│ ├── cmi_bids_R1 … cmi_bids_R11 # 每 release 一个 BIDS-EEG 数据集
│ └── cmi_bids_NC # CC BY-NC-SA 子集(禁商用)
└── DERIVATIVES_RBC/ # PennLINC Reproducible Brain Chart(可选)
├── fmriprep/ xcpd/ qsiprep/ freesurfer/
└── QC/ # xcpd_qc_metrics.tsv 等质控指标
代码块说明:data_root 即你的本地根目录;MRI 路径拼接规则为 data_root/BIDS_curated/{sub}/{ses}/{modality}/;表型为 data_root/pheno/{量表名}.csv;最小可用子集 = Basic_Demos.csv + Diagnosis_KSADS_C.csv + BIDS_curated 中 100-200 名 T1w 完整受试者。
§4.1 DAIMS 字段字典(核心表)
| 字段(表.列) | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Basic_Demos.EID | Text | 受试者唯一标识(NDAR 前缀) | NDAREK982EDP | 主键,跨表 join | 无(生成规则固定) | 不适用 | 全库唯一 |
| Basic_Demos.Age | Integer | 评估时年龄(岁) | 10 | 脑龄/发育模型协变量 | 依访视日记录 | 罕见缺失即 NA | 5-21 |
| Basic_Demos.Sex | Text | 登记性别 | M / F | 分层与公平性评估 | 登记口径,非自述性别 | NA | 枚举 |
| Basic_Demos.Site | Text | 采集站点 | SI / RU / CBIC / ME… | 站点混淆校正 | 站点间协议差异 | NA | 枚举(多站点) |
| EHQ.EHQ_Total | Float | 爱丁堡利手总分 | 50.0 | 利手协变量 | 自报偏倚 | NA | -100~100 |
| WISC.FSIQ | Float | WISC-V 全量表智商 | 104.7 | 认知水平标签 | 施测版本/年龄规则差异 | NA | 约 40-160 |
| WIAT.ReadComp | Float | 阅读理解标准分 | 95 | 学习障碍建模 | 版本演进(WIAT 列漂移) | NA | 标准分尺度 |
| KSADS.*_raw / _sev | Integer/Text | 症状条目原始分与严重度 | 0/1/2/3 或文本码 | 症状维度回归 | 访谈者间变异 | NA | 按条目定义 |
| Diagnosis_KSADS_C.* | Integer | 共识诊断类别列(每诊断一列) | 0=无 / 1=既往 / 2=当前(按列定义) | 分类标签金标准 | 共识非独立双评 | NA | 按列定义 |
| Barratt.Barratt_Total | Integer | Barratt 社会经济地位总分 | 43.0 | SES 协变量/混杂控制 | 家长自报 | NA | 3-66 |
| PCIAT.PCIAT_Total | Integer | 家长-儿童网络成瘾测验总分 | 35 | PIU 严重度代理 | 家长报告主观性 | NA | 0-100 |
| SII(Kaggle 派生) | Integer | 问题性网络使用严重度指数(由 PCIAT 分档) | 0-3 | Kaggle PIU 目标标签 | 派生规则固定 | 目标行可缺(插补即任务) | 0-3 |
| TOWRE.SWE / PDE | Integer | 单词阅读/假词解码效率标准分 | 98 | 阅读障碍建模 | 施测者差异 | NA | 标准分尺度 |
| MRIOpen / 影像 QC 衍生列 | Float | RBC xcpd_qc 指标(DVARS 等) | 0.21 | 质控过滤/QC 预测 | 管线版本相关 | NA | 连续 |
§4.2 标签分布
诊断标签沿"算法 K-SADS + 临床共识"双轨给出;R11 将青少年/家长/临床医师三视角拆分为独立表,使用时应选定单一视角或显式建模分歧。社区招募设计使标签分布高度不均衡:典型类别(如 ADHD 相关诊断)样本充足,低患病率类别(如精神病性谱系)稀少。行为派生标签亦显著偏斜:Kaggle PIU 竞赛公开的 SII 分布中约 60% 样本为 0、约 85% 样本小于 2,类别 3 极少,直接以准确率评估会失真,应采用 QWK 与分层抽样。
诊断标签使用决策表:
| 场景 | 推荐标签源 | 注意事项 |
|---|---|---|
| 训练诊断分类器 | Diagnosis_KSADS_C(临床共识) | 二值化时注意区分"既往/当前"编码 |
| 研究报告者一致性 | KSADS_T vs _P vs _C 三表对比 | 按受试者配对,勿当独立样本 |
| 大样本维度回归 | 维度量表总分/因子分 | 校验 T 分数年龄适用性(坑点 4) |
| 复刻 Kaggle PIU | SII(PCIAT 派生) | 特征中必须剔除 PCIAT 列族(坑点 2) |
| 亚型发现 | 诊断 + 维度联合 | 先做共病结构分析再聚类 |
§4.3 关键统计
- PennLINC RBC 整理版(MRI):3,887 sessions;平均年龄约 10.3-10.4 岁;女性约 33-36%;右利手约 77-82%;平均 Overall Psychopathology 0.22(SD 0.96,RBC 口径)。
- MRI 完成 session 数与预处理通过率(RBC,v25 管线):sMRIPrep 结构 3,736/3,813;fMRIPrep 功能 3,596/3,725;QSIPrep 3,298/3,301——即约 2-4% 的 session 在不同模态上因质量或缺失未通过。
- EEG OpenNeuro R1:n=136,129 通道、500 Hz、总录音时长 117 小时;男女比约 90:46。
- 研究目标 10,000 名;R11 数据截止 2022-11-23 时释放表型数据集 4,867 份、MRI 3,905 份。
§4.4 数据层级
层级:研究(HBN) → 受试者(EID,NDAR 前缀唯一 ID) → 访视(4 次访视;影像侧为 BIDS session) → 序列/量表(每个 MRI 序列或每份量表 CSV) → 文件/条目(NIfTI 文件或量表条目)。表型侧主键为 EID(多数量表一受试者一行);影像侧主键为 (EID, ses-) 二元组。跨模态对齐一律以 EID 为枢纽;EEG 侧同样使用 EID 命名,与 MRI/表型可直接 join。同一家族中可能有多名成员各自拥有独立 EID 参与研究,构建受试者级划分时应注意避免家族级信息泄漏。
各层级的键与典型粒度:
| 层级 | 键/标识 | 典型粒度 | 注意 |
|---|---|---|---|
| 受试者 | EID | 1 行/人(Basic_Demos) | 全库主键,跨模态 join 枢纽 |
| 访视 | (EID, session) | 影像 1-N sessions;表型按访视记录 | 部分受试者无 ses 层级目录 |
| 影像序列 | (EID, ses, modality, task/acq) | 每序列 1-N 文件 | BIDS entities 决定唯一性 |
| 量表 | (EID, 量表名) | 1 行/人/量表 | 重复行风险见坑点 1 |
| 量表条目 | (EID, 量表名, 条目列) | 数十至数百列/表 | 条目级分析注意缺失模式 |
| 家族 | 兄弟姐妹关系字段 | 1-N 人/家族 | 划分时按家族分组防泄漏 |
§4.5 缺失值与信息性缺失
| 情形 | 编码/表现 | 处理建议 |
|---|---|---|
| 受试者未完成某量表 | 表型 CSV 中整行缺失或该量表文件中无该 EID | 视为任务级缺失:明确"可评估总体"后再插补或建模 |
| 条目拒答 | 单元格 NA/空 | 记录缺失模式;对量表总分用官方计分手册的缺失规则或按比例折算 |
| 量表不适用(年龄超限) | 按年龄规则跳过(如 WISC-V 仅 6-17 岁,18+ 用 WAIS-IV) | 非随机缺失,禁止当作随机 NA 插补;按年龄段分模型 |
| 按需施测的补充诊断 | 仅疑似病例施测(ADOS、YGTSS、Y-BOCS 等) | 缺失=未指示而非阴性;不可编码为 0 |
| 影像未过 QC | 无衍生文件 | 用 RBC 的 QC 通过清单过滤,报告通过率 |
| COVID 期补充调查 | 仅 LORIS 提供 CRISIS 两时点数据 | 独立处理,不与主表型默认合并 |
§5 划分与使用建议
§5.1 官方划分
HBN 官方不提供机器学习训练/验证/测试划分——数据按 release 滚动扩充,且官方定位为分析性资源而非竞赛基准。任何论文中出现的"官方划分"表述均为误传。唯一官方切分的特例是 Kaggle CMI-PIU 竞赛子集(train/test 由竞赛方固定,private LB 以约 62% 测试数据计算),该切分仅对 PIU 任务有效。
§5.2 社区惯例划分
社区常见做法:(1) 按 EID 受试者级 80/10/10 随机划分(配合分层:诊断类别或年龄分箱);(2) 按采集站点留一站做外部验证(4 站点 LOO),检验站点泛化;(3) 10 折交叉验证 + 重复随机种子(Kaggle PIU 冠军方案即用多 seed/多折集成对抗划分噪声);(4) 按研究阶段(Phase I/II vs III)划分模拟协议漂移。滚动 release 使用者还应冻结"数据截止日期"(如 R11 = 2022-11-23)以保证可复现。
# split.py — 站点分层 + 诊断分箱分层的受试者级划分
import numpy as np, pandas as pd
from sklearn.model_selection import StratifiedKFold
core = pd.read_csv(f"{DATA_ROOT}/pheno/Basic_Demos.csv").drop_duplicates("EID")
core = core.drop_duplicates("EID") # 坑点 1:先去重
core["age_bin"] = pd.qcut(core["Age"], q=4, labels=False, duplicates="drop")
core["strata"] = core["Site"].astype(str) + "_" + core["age_bin"].astype(str)
skf = StratifiedKFold(n_splits=10, shuffle=True, random_state=42)
for tr_idx, te_idx in skf.split(core, core["strata"]):
train_ids = set(core.iloc[tr_idx]["EID"])
test_ids = set(core.iloc[te_idx]["EID"])
# 每折内部再切 val;或改用 LeaveOneGroupOut(groups=Site) 做留站验证
break
§5.3 泄漏风险(重点)
- 目标派生特征泄漏:Kaggle PIU 的 SII 由 PCIAT 总分直接分档派生,任何 PCIAT 条目/总分进入特征都会导致近完美拟合——竞赛公开讨论中已多次出现该陷阱,正确做法是显式剔除 PCIAT 列族再预测。
- 重复行泄漏:R11 之前多个量表(WAIS、WISC、KSADS、TRF 等)存在 COINS 上传错误造成的重复参与者行,同一受试者同时出现在训练与测试会虚高性能;务必按 EID 去重后再划分。
- 三视角诊断泄漏:Diagnosis_KSADS_T/P/D 三表描述同一受试者同一诊断的三方口径,混用为"多源特征"会让标签信息绕道进入特征。
- 站点泄漏:同一站点受试者同时入训练与测试时,模型可学到站点指纹(扫描仪/协议差异)而非生物学信号;建议站点分层或留站验证。
- 纵向/家族泄漏:多成员家族与随访数据(季度报告、CRISIS)跨集,需按家族/受试者组划分。
§5.4 交叉验证建议
对维度回归任务用 10 折 CV(EID 级、按目标分箱分层)+ 站点分层;对稀有类别分类任务用分层重复 CV(≥5 seeds)并报告类级指标;对模型比较保持同一 CV 折结构(配对比较)。Kaggle PIU 高分方案显示:QWK 对阈值选择敏感,先回归/排序后优化离散化阈值可稳定提升 0.01-0.02,但阈值须在 OOF(out-of-fold)预测上优化。
§5.5 外部验证建议
儿童脑影像任务的首选外部集为 ABIDE(孤独症)、ADHD-200(ADHD,HBN 的姊妹项目)、NKI-Rockland(全龄社区样本)与 HCP-D(健康发育);成人任务可外推至 UK Biobank 但应预期大幅性能衰减。跨数据集验证时至少对齐:扫描场强与序列参数、fMRI 扫描时长、表型量表版本(HBN 用 WISC-V,多数旧数据集用 WISC-IV)。Modabbernia et al. 2023 提供了 HBN/ABIDE/HCP-D/ABCD 多库脑龄预测的对齐比较框架与代码,适合作为外部验证的起点实现。
| 外部集 | 与 HBN 的对齐成本 | 推荐验证任务 |
|---|---|---|
| ADHD-200 | 低(同为 INDI 生态、诊断标签同源) | ADHD 分类迁移 |
| ABIDE | 低-中(诊断体系不同,需重新定义任务) | ASD 特质/孤独症分类外推 |
| NKI-Rockland | 中(年龄段重叠部分可直接对齐) | 连接组可靠性、方法迁移 |
| HCP-D | 中(年龄段匹配但为健康发育样本) | 脑龄/发育指标校准 |
| ABCD | 高(需 NDA 申请;量表版本部分重叠) | 大样本外验、偏倚方向检验 |
§6 AI 就绪指南
§6.0 云端快速启动(AWS S3)
MRI 影像托管在公开可读的 FCP-INDI S3 桶上(无需密钥即可 aws s3 ls),适合先同步小样本再扩量:
# 前置:安装 AWS CLI v2;BIDS_curated 桶为公开可读
# 查看桶结构(无需凭证)
aws s3 ls s3://fcp-indi/data/Projects/HBN/BIDS_curated/ --no-sign-request | head
# 仅同步 50 名受试者的 T1w(增量最小子集,约数十 GB)
aws s3 sync s3://fcp-indi/data/Projects/HBN/BIDS_curated/ ./data/BIDS_curated \
--no-sign-request --exclude "*" --include "*/anat/*T1w*" \
| head -n 200 # 生产环境去掉 head,并按受试者白名单精确同步
EEG 公开子集同样可直接从 S3 或 OpenNeuro 获取:
aws s3 sync s3://fcp-indi/data/Projects/HBN/BIDS_EEG/cmi_bids_R1/ ./data/BIDS_EEG_R1 --no-sign-request
# 或 OpenNeuro 官方下载:https://openneuro.org/datasets/ds005505
§6.1 快速上手:环境准备与首张连接组
预期目录结构见 §4.0;DATA_ROOT 指向 data_root;data_root/BIDS_curated 为 BIDS 根,data_root/pheno 存放 LORIS 导出的量表 CSV。最小可用子集 = Basic_Demos.csv + Diagnosis_KSADS_C.csv + 任意数量带 T1w 的受试者。MRI/表型数据下载需先在 LORIS 门户(data.healthybrainnetwork.org)注册并签署 DUA;下例假设你已完成:
# ============================================================
# quickstart.py — 10 分钟打通:读表型 → join 诊断 → 找到有 T1w 的受试者
# 目录假设:
# DATA_ROOT/pheno/Basic_Demos.csv # 人口学主表
# DATA_ROOT/pheno/Diagnosis_KSADS_C.csv # 临床共识诊断
# DATA_ROOT/BIDS_curated/sub-NDAR*/... # 影像(可只同步部分)
# ============================================================
import os
from pathlib import Path
import pandas as pd
DATA_ROOT = Path(os.environ.get("HBN_DATA_ROOT", "./data"))
demos = pd.read_csv(DATA_ROOT / "pheno/Basic_Demos.csv")
diag = pd.read_csv(DATA_ROOT / "pheno/Diagnosis_KSADS_C.csv")
# 合并诊断与人口学(EID 为跨表主键)
core = demos.merge(diag, on="EID", how="inner")
print(core.shape) # 例如 (4900+ 行 × 数十列),取决于导出字段
# 扫描本地已同步的 BIDS 受试者,与表型求交集
bids_sub = {p.name.split("_")[0] for p in (DATA_ROOT/"BIDS_curated").glob("sub-*")}
have_img = core[core["EID"].isin(bids_sub)]
print(f"表型 {len(core)} 行中,本地有影像的 {len(have_img)} 行")
# have_img 即可直接开训的最小可用分析集
§6.2 数据获取流程
| 资源 | 入口 | 前置条件 | 大小 |
|---|---|---|---|
| 表型 + 全量 MRI | FCP/INDI 官方门户 → LORIS(data.healthybrainnetwork.org) | 注册账户 + 签署 DUA | MRI 数 TB 级;表型 GB 级以下 |
| BIDS MRI 增量同步 | s3://fcp-indi/data/Projects/HBN/BIDS_curated/ |
公开可读(--no-sign-request) |
按受试者计约 3-10 GB/人 |
| BIDS 预处理衍生(QSIPrep 等) | .../BIDS_curated/derivatives/qsiprep/ |
同上 | 数 TB 级 |
| EEG 公开子集 | OpenNeuro ds005505-ds005516;S3 BIDS_EEG/cmi_bids_R1..R11 |
OpenNeuro 注册 | 约 130-160 GB/release |
| EEG NC 子集 | S3 BIDS_EEG/cmi_bids_NC |
DUA;仅研究用途 | 458 名受试者 |
| Kaggle PIU 子集 | Kaggle 竞赛页 | Kaggle 账号 + 竞赛规则接受 | GB 级 |
# 表型数据需登录 LORIS 后导出/或按官方指引申请
# https://data.healthybrainnetwork.org → request account → sign DUA → query
# 官方用户支持:CMIDataUsage@childmind.org
§6.3 预处理全流程
第一步:表型清洗(去重、列漂移对齐、目标构造)
# clean_pheno.py — 官方在 R11 前后修复过重复行与编码,历史上
# WAIS/WISC/KSADS/TRF 等表出现过重复参与者行:先按 EID 去重再合并。
import pandas as pd
def load_dedup(path, key="EID"):
df = pd.read_csv(path)
dup = df.duplicated(subset=key, keep="last").sum()
if dup:
print(f"{path.name}: drop {dup} duplicated rows for key={key}")
return df.drop_duplicates(subset=key, keep="last").set_index(key)
# 经验规则:总分行 > 条目分;后一 release 优先于旧 release
pheno = {f.stem: load_dedup(f) for f in (DATA_ROOT/"pheno").glob("*.csv")}
wide = pheno["Basic_Demos"].join(pheno["Barratt"], how="left")
wide = wide.join(pheno["WISC"], how="left").join(pheno["EHQ"], how="left")
# 年龄超限导致的量表缺失属"结构性缺失",不要无差别插补:
wide = wide[wide["Age"].between(6, 17)] if "WISC" in wide else wide
第二步:MRI 标准化预处理(fMRIPrep + XCP-D 主线)
# 结构+功能:容器化运行,BIDS 根 = data/BIDS_curated
fmriprep data/BIDS_curated out/fmriprep participant \
--participant-label NDAREK982EDP \
--output-spaces MNI152NLin2009cAsym:res-2 anat \
--nprocs 16 --omp-nthreads 8 --mem-gb 60 -w work/
# 静息态后处理(去混淆、平滑、QC 指标):XCP-D
xcp_d out/fmriprep out/xcpd participant \
--input-type fmriprep --task-id rest \
--despike --smoothing 6 --nprocs 8 -w work/
第三步:功能连接组提取(供机器学习使用)
from nilearn.connectome import ConnectivityMeasure
from nilearn import datasets, input_data
# 以 Schaefer 400 为例;对每个受试者的 XCP-D 输出 denoised timeseries 提取 FC
atlas = datasets.fetch_atlas_schaefer_2018(n_rois=400)
masker = input_data.NiftiLabelsMasker(atlas.maps, standardize=True)
cm = ConnectivityMeasure(kind="correlation")
fc = cm.fit_transform([masker.fit_transform(ts) for ts in rest_timeseries_list])
# fc: (n_subjects, 400, 400) → 向量化上三角即可喂给 Ridge/SVM/GBDT
超 30 行的 fmriprep 全参数讨论、DKI 重建(QSIPrep + DIPY NODDI)与 EEG 预处理(MNE-BIDS + HED 事件读取)细节建议直接采用 RBC 衍生数据或参考官方管线文档,避免重复造轮子。
第四步:EEG 预处理(MNE-BIDS 主线,129 通道 500 Hz)
# eeg_prep.py — 从 OpenNeuro 下载的 BIDS-EEG 读取并预处理
# 目录假设:DATA_ROOT/BIDS_EEG_R1/(OpenNeuro ds005505 下载目录)
from mne_bids import BIDSPath, read_raw_bids
import mne
bids_path = BIDSPath(root=DATA_ROOT/"BIDS_EEG_R1",
subject="NDARCJ475WJP", # R1 示例受试者
task="RestingState", datatype="eeg")
raw = read_raw_bids(bids_path) # 自动载入通道/事件元数据
raw.load_data()
raw.resample(250) # 500 Hz → 250 Hz
raw.notch_filter((60, 120, 180, 240)) # 工频谐波
raw.filter(l_freq=1., h_freq=40.) # 保留低频漂移以下做 ICA 前处理
raw.set_eeg_reference("average", projection=True)
ica = mne.preprocessing.ICA(n_components=30, random_state=42, max_iter="auto")
ica.fit(raw)
# ica.find_bads_eog(raw) / ica.apply(raw) 视任务类型启用
§6.4 PyTorch DataLoader 完整示例
以"结构 MRI 体素特征 → 脑龄回归"与"表型 → QWK 分档"两个任务为例,展示受试者级 Dataset 与安全切分:
# hbn_dataset.py — 受试者级划分的多模态 Dataset
# 目录假设:DATA_ROOT/BIDS_curated/sub-NDAR*/ses-*/anat/*T1w*
# DATA_ROOT/pheno/Basic_Demos.csv(Age 作为回归目标)
import numpy as np, pandas as pd, torch
from torch.utils.data import Dataset, DataLoader, WeightedRandomSampler
import nibabel as nib
from pathlib import Path
class HBNBrainAge(Dataset):
"""T1w 灰质统计特征 + 人口学 → 年龄回归(极简、CPU 可跑)。
生产建议换用 FreeSurfer/fMRIPrep 衍生特征或已训练的 encoder。"""
def __init__(self, data_root: Path, split_ids: list[str]):
demos = pd.read_csv(data_root/"pheno/Basic_Demos.csv")
demos = demos[demos["EID"].isin(split_ids)].dropna(subset=["Age"])
self.rows = [r for r in demos.itertuples()
if list(data_root.glob(f"BIDS_curated/{r.EID}*/**/*T1w*.nii.gz"))]
self.data_root = data_root
def __len__(self): return len(self.rows)
def _feats(self, eid: str) -> np.ndarray:
f = sorted(self.data_root.glob(f"BIDS_curated/{eid}*/**/*T1w*.nii.gz"))[0]
v = np.asarray(nib.load(f).dataobj, dtype=np.float32)
v = v[v > 0]
# 直方图 + 强度矩:体素级数据的轻量统计摘要
hist = np.histogram(v, bins=64, range=(0, 255))[0].astype(np.float32)
hist /= (hist.sum() + 1e-8)
return np.concatenate([hist, [v.mean(), v.std()]])
def __getitem__(self, i):
r = self.rows[i]
x = torch.from_numpy(self._feats(r.EID))
y = torch.tensor([float(r.Age)], dtype=torch.float32)
return x, y
# ---- 受试者级 8:1:1 划分(先去重、后划分,杜绝 EID 跨集) ----
eid_all = pd.read_csv(DATA_ROOT/"pheno/Basic_Demos.csv")["EID"].drop_duplicates()
rng = np.random.default_rng(42); perm = rng.permutation(len(eid_all))
n = len(eid_all)
splits = {k: set(eid_all.iloc[v]) for k, v in {
"train": perm[:int(n*.8)], "val": perm[int(n*.8):int(n*.9)],
"test": perm[int(n*.9):]}.items()}
loaders = {k: DataLoader(HBNBrainAge(DATA_ROOT, ids), batch_size=32,
shuffle=(k == "train"), num_workers=4)
for k, ids in splits.items()}
§6.4b 连接组 → 症状维度回归端到端示例
从功能连接组到维度表型预测的最小可复现管线(Ridge + 站点分层 CV):
# fc_regression.py — 上三角 FC 特征 → SWAN/诊断得分回归
# 依赖:XCP-D 输出的 timeseries(或任意 denoised 4D 数据)、nilearn
import numpy as np, pandas as pd, torch
from pathlib import Path
from nilearn.connectome import ConnectivityMeasure, vec_to_sym_matrix
from sklearn.linear_model import RidgeCV
from sklearn.model_selection import cross_val_predict, GroupKFold
from sklearn.metrics import mean_absolute_error
# 1) 组装 X(FC 向量)与 y(维度目标)、groups(站点)
rows = pd.read_csv(DATA_ROOT/"pheno/merged_features.csv") # 含 EID、Site、SWAN_Total、ts 路径
cm = ConnectivityMeasure(kind="correlation")
X = cm.fit_transform([np.load(p)["ts"] for p in rows["ts_path"]]) # (n, N, N)
tri = np.triu_indices_from(X[0], k=1)
X = X[:, tri[0], tri[1]] # (n, N*(N-1)/2)
y, groups = rows["SWAN_Total"].values, rows["Site"].values
# 2) 站点分层 GroupKFold + Ridge(Fisher-z 提示:np.arctanh(X) 更稳妥)
model = RidgeCV(alphas=np.logspace(-3, 3, 13))
pred = cross_val_predict(model, np.arctanh(X), y, groups=groups,
cv=GroupKFold(n_splits=4), n_jobs=-1)
print("MAE:", mean_absolute_error(y, pred))
print("r:", np.corrcoef(y, pred)[0, 1])
# 3) 稳健性检查:与头动 FD 的偏相关(坑点 7)
fd = rows["mean_FD"].values
resid_y = y - np.polyval(np.polyfit(fd, y, 1), fd)
resid_p = pred - np.polyval(np.polyfit(fd, pred, 1), fd)
print("FD 校正后 r:", np.corrcoef(resid_y, resid_p)[0, 1])
要点:(1) GroupKFold(groups=Site) 保证同一站点不跨集,可直接替换为留站验证;(2) 相关值向量化后先做 Fisher-z(arctanh)再回归;(3) 报告 FD 校正前后的相关变化,是连接组研究的最低限度稳健性证据。
§6.5 坑点 8 个(HBN 真实失败模式)
⚠️ 坑点 1:表型 CSV 中的重复受试者行(分类:工程陷阱)
问题:R11 之前,COINS 平台上传错误导致 WAIS、WISC、KSADS、TRF、GARS、PBS、TBI 等大量量表表出现同一受试者的重复行;官方在 2022-11 与 2024-04 两轮修复中清理了 HBN_R4/R7/R8/R10_Pheno 及上述量表,但社区镜像与旧下载仍携带脏数据。
症状:merge 后行数莫名翻倍;同一 EID 以不同分数出现两次;交叉验证中同一受试者跨集导致验证分数虚高。
解决:
- 简单方法:
df.drop_duplicates(subset="EID", keep="last")并在合并前后打印行数对账。- 进阶方法:重复行分数不一致时按"总分行优先、后 release 优先"裁决,写进数据版本记录。
- SOTA 方法:以 DVC/LakeFS 固化清洗脚本与数据哈希,CI 中加入"EID 唯一性"断言测试。
参考:NITRC FCP/INDI 官方 release 公告(R11 修复清单)
⚠️ 坑点 2:PCIAT 条目预测 SII 的目标泄漏(分类:数据泄漏)
问题:Kaggle CMI-PIU 的目标 SII(严重度指数)由 PCIAT(家长-儿童网络成瘾测验)总分直接分档派生;把 PCIAT 条目或总分放入特征可轻松"刷"出近完美分数,但模型在现实中不可用。
症状:训练/验证指标高得离谱(如 QWK > 0.9),去掉 PCIAT 后断崖式下跌至 0.47 左右。
解决:
- 简单方法:显式剔除所有
PCIAT*列族后再划分。- 进阶方法:以"仅物理/行为/表型特征预测 SII"重定义任务,与竞赛冠军方案(private QWK 0.482)对齐口径。
- SOTA 方法:用
PreInt_EduHx_computerinternet_hoursday等客观使用时长特征替代家长报告,构造更可辩护的标签代理。
参考:Kaggle PIU 11th place writeup(SII 分布与 PCIAT 可靠性讨论)
⚠️ 坑点 3:三视角诊断表与算法/共识双轨标签混用(分类:标签理解)
问题:2024-04 起
Diagnosis_KSADS拆分为青少年(T)、家长(P)、临床医师(D)三表,且数据同时存在算法生成诊断与临床共识诊断两条产出线;把三个视角当独立样本或把三方列当独立特征会把标签信息绕道泄漏进模型,也会高估标签可靠性。
症状:加入 KSADS_P 后分类指标异常提升;不同论文报告的同一疾病患病率对不上。
解决:
- 简单方法:固定单一视角(一般取
Diagnosis_KSADS_C共识)作为标签,其余视角仅作分析。- 进阶方法:构建"视角不一致"特征(T/P/D 是否一致)作为难度信号,而非直接拼接三方条目。
- SOTA 方法:对共识与算法诊断训练"分歧模型",用分歧样本做主动学习或人工复标队列。
参考:NITRC R11 公告(2024-04 数据字典变更)
⚠️ 坑点 4:量表列名与编码的跨 release 漂移(分类:工程陷阱)
问题:官方多次重命名量表(ARI_S→ARI_SR、Bia_final→BIA、FFQ_final→FFQ、temp_disc_final→Temp_Disc_Final),删除重复仪器(AUDIT),并修复多组数据字典编码(CPIC、DTS、GRIT、ICU、SCQ、SDQ、SRS、STAI 等);旧代码在新 release 上会静默失败或语义错读。SRS_Pre 的 T 分数标准化基于 <4.5 岁样本,对更大儿童并不准确。
症状:KeyError 或列全空;SRS-2 相关特征在学龄儿童上呈天花板/地板效应。
解决:
- 简单方法:锁定单一 release(建议 R11)+ 记录所用文件哈希。
- 进阶方法:维护"列名→语义"映射层(schema 文件),加载数据先过 schema 校验(pandera/frictionless)。
- SOTA 方法:跨 release 构建可追溯的仪器版本图谱,对 T 分数类指标按年龄重新标准化后再入模。
参考:NITRC R11 公告(量表重命名与字典修复清单)
⚠️ 坑点 5:双许可体系与 NC 子集商用违规(分类:工程陷阱)
问题:HBN 按"参与者知情同意"分双许可:EEG R1-R11 的公开部分为 CC BY-SA 4.0(OpenNeuro 可下载),另有 458 名受试者的 NC 子集为 CC BY-NC-SA 4.0 且不在 OpenNeuro 托管;MRI/RBC 整理版整体按 CC BY-NC-SA 界定。将 NC 部分混入商用产品或训练后闭源商用模型会违反许可。
症状:法务审计时无法说明训练集许可构成;下游模型声明"CC BY"却包含 NC 数据。
解决:
- 简单方法:下载后按目录隔离
cmi_bids_NC与公开子集,训练清单中记录每条样本的许可。- 进阶方法:构建许可字段随样本元数据走(manifest.tsv 附加 license 列),导出模型卡时自动汇总。
- SOTA 方法:商用场景仅使用显式 BY-SA 子集,或与 Child Mind Institute(CMIDataUsage@childmind.org)洽谈商用数据协议。
参考:OpenNeuro ds005512 许可声明、HBN-EEG FAIR 论文许可一节
⚠️ 坑点 6:多站点 1.5T/3T 扫描仪混淆(分类:偏倚陷阱)
问题:HBN 影像跨纽约都会区 4 个站点采集,1.5T 与 3T Siemens 平台混布,Phase III 起才转多站点固定模式;站点/场强与年龄、SES、诊断构成相关,模型容易学到"站点指纹"。
症状:留站点验证时性能骤降;特征重要性被扫描仪参数主导;FC 边强度呈站点聚类。
解决:
- 简单方法:Site 作为协变量回归掉,或分层抽样保证各集站点构成一致。
- 进阶方法:留一站(leave-one-site-out)交叉验证报告站点泛化;ComBat/Longitudinal ComBat 调和影像衍生特征。
- SOTA 方法:对抗性站点解耦(gradient reversal)或域不变表征(DANN/IRM),并报告调和前后对比。
参考:PennLINC RBC/AI2D HBN 页(站点与预处理完成率)
⚠️ 坑点 7:儿童短扫描静息态 fMRI 的运动伪影(分类:预处理陷阱)
问题:HBN 静息态为每名受试者 2 扫、每扫 5-10 分钟,且发育期人群头动频繁;运动与年龄、ADHD 症状相关,未处理的头动会伪造"症状-连接"关联。
症状:QC 指标(DVARS/FD)与预测目标相关;高运动受试者 FC 整体偏移;重复实验结果不稳。
解决:
- 简单方法:以 FD 阈值 scrubbing + 回归 24 个运动参数,剔除高运动受试者并报告剔除率。
- 进阶方法:直接采用 RBC 的 XCP-D 衍生(已去混淆+QC 指标),用其
xcpd_qc指标列做敏感度分析。- SOTA 方法:运动与表型联合建模去混淆;报告连接-行为关联对 FD 的偏相关与敏感性曲线。
参考:Richie-Halford et al. 2022(QC 网络 ROC-AUC 0.947 的社区科学 QC)
⚠️ 坑点 8:EEG R10/R11 元数据缺失与 NC 子集不可见(分类:工程陷阱)
问题:HBN-EEG 的 R10/R11 不少个体数据文件缺 BIDS 必需元数据,未纳入 OpenNeuro(FAIR 版本仅覆盖 R1-R9 及 NC 子集另置 S3);同时 NC 子集(458 人)不在 OpenNeuro 可见,使用者常误以为 EEG 全量已公开。
症状:按 OpenNeuro 统计的 EEG 样本量与论文口径(4,000+)对不上;脚本在 R10/R11 上报 missing participants.json 字段。
解决:
- 简单方法:EEG 建模只用 R1-R9 OpenNeuro 版本,明确声明样本口径。
- 进阶方法:需要 R10/R11 时走 S3 原始目录 + 自行补全 JSON(参考官方 BIDS 转换脚本),并重新走 QC。
- SOTA 方法:用 EEGDash/BIDS 标准化索引层管理多 release,样本元数据与许可一并落库。
参考:HBN-EEG FAIR 论文(Data Records 一节)
§6.6 数据增强(安全 ✅ / 危险 ❌)
| 策略 | 适用模态 | 判定 | 说明 |
|---|---|---|---|
| 随机裁剪时间窗(静息 fMRI/EEG) | fMRI/EEG | ✅ | 5-10 分钟短扫描内滑窗可扩样本,注意窗长一致性 |
| 时间维随机时移/相位抖动 | EEG | ✅ | 小幅抖动模拟采样漂移,保持 HED 事件对齐 |
| 强度归一化域随机化 | MRI | ✅ | z-score + 随机伽马,模拟站点强度差 |
| 空间随机翻转(左右) | MRI | ⚠️ | 需同步翻转利手标签或剔除利手不对称分析 |
| fMRI 头动参数加噪 | fMRI | ❌ | 会把运动伪影当增强,污染症状-连接关联 |
| 跨受试者混合(Mixup 标签) | 表型 | ⚠️ | 诊断标签混合破坏临床语义,仅限维度回归 |
| 复制粘贴小类样本过采样 | 表型 | ❌ | 制造虚假确定性样本,夸大稀有类别性能 |
§6.7 模型推荐表
| 任务 | 推荐起点 | 理由 |
|---|---|---|
| 表型 → 分档预测(QWK) | LightGBM/XGBoost + 阈值优化 | Kaggle PIU 冠军方案验证;表格数据强基线 |
| 脑龄预测(结构 MRI) | Ridge/SVM 于皮层特征;3D CNN/ResNet 于体素 | Modabbernia 2023 系统评测 12 类算法可直接复用 |
| 连接组 → 症状维度 | 弹性网 + ComBat 调和;GNN | 高维小效应场景线性模型稳,GNN 捕捉拓扑 |
| EEG 编码 | EEGNet/Conformer(MNE-BIDS 加载) | 129 通道高密度数据规范成熟 |
| 多模态融合 | 早期融合(拼接)→ 中期融合(per-modality encoder + attention) | 从简到繁,先建立单模态上限 |
| 影像 QC | Fibr QC 网络思路(CNN 回归专家评分) | HBN dMRI 已有 ROC-AUC 0.947 先例 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐 |
|---|---|---|
| 表型分析/表格建模 | 8 GB 内存、无 GPU | 16 GB 内存 |
| 单受试者 fmriprep | 16 GB 内存、8 核 | 32-64 GB 内存、16 核、500 GB SSD |
| 全量预处理(3,900+ sessions) | HPC/云批处理 | 多节点 Slurm(RBC 采用 DataLad+BABS 编排) |
| 深度模型训练 | 单卡 24 GB(RTX 4090 级) | 单卡 40-80 GB(A100/H100)+ 混合精度 |
| EEG 批处理 | 32 GB 内存 | 64 GB(R1 全 release 117 小时录音级数据) |
§6.9 评估指标代码
# metrics.py — HBN 常用指标:QWK(分档)与 MAE/相关(脑龄)
import numpy as np
from sklearn.metrics import cohen_kappa_score, mean_absolute_error
def qwk(y_true, y_pred, min_r=0, max_r=3):
"""Quadratic Weighted Kappa:Kaggle PIU 官方指标。
y_pred 为连续值时先在 OOF 上优化切分阈值再离散化。"""
y_true = np.clip(np.asarray(y_true).round(), min_r, max_r).astype(int)
y_pred = np.clip(np.asarray(y_pred).round(), min_r, max_r).astype(int)
return cohen_kappa_score(y_true, y_pred, weights="quadratic",
labels=list(range(min_r, max_r + 1)))
def brain_age_metrics(y_true, y_pred):
mae = mean_absolute_error(y_true, y_pred)
r = np.corrcoef(y_true, y_pred)[0, 1]
# 预测脑龄差(PAD)去年龄偏置:避免"年龄越大 PAD 越偏"的回归向均值假象
pad = np.asarray(y_pred) - np.asarray(y_true)
pad_corr = pad - np.polyval(np.polyfit(y_true, pad, 1), y_true)
return {"MAE": mae, "r": r, "PAD_MAE_after_debias": np.abs(pad_corr).mean()}
QWK 场景下的阈值优化(Kaggle PIU 前列方案的标配步骤):
# threshold_opt.py — 仅在 OOF 预测上优化连续值→离散档位的切分点
import numpy as np
from scipy.optimize import minimize
from sklearn.metrics import cohen_kappa_score
def qwk_from_thresholds(cont, y_true, cuts):
disc = np.digitize(cont, sorted(cuts))
return cohen_kappa_score(y_true, disc, weights="quadratic")
def optimize_thresholds(oof_cont, y_true, n_classes=4):
y_true = np.asarray(y_true).astype(int)
best, best_cuts = -1, None
for seed in range(20): # 多起点避免局部最优
rng = np.random.default_rng(seed)
cuts = np.sort(rng.uniform(y_true.min(), y_true.max(), n_classes - 1))
res = minimize(lambda c: -qwk_from_thresholds(oof_cont, y_true, c),
cuts, method="Nelder-Mead")
if -res.fun > best:
best, best_cuts = -res.fun, np.sort(res.x)
return best_cuts, best # best_cuts 用于测试集离散化
注意:阈值必须在训练折的 OOF 预测上搜索、再冻结应用于测试集;在测试集上反复搜阈值属于评估污染。
§6.10 MLOps 笔记
- 数据版本化:官方数据滚动扩充(季度 release、R11 数据截止 2022-11-23),实验必须绑定 release 号 + 文件哈希;建议 DVC 管理
pheno/清洗产物。 - 许可追溯:样本级记录许可(BY-SA / BY-NC-SA),模型卡中声明训练集许可构成,NC 子集隔离。
- 可复现预处理:优先复用 RBC 衍生(CuBIDS 校验、DataLad+BABS 编排),自建管线时把 fmriprep/XCP-D 版本写入 W&B/MLflow run 元数据。
- 评估纪律:所有划分在 EID 去重后进行;报告站点分层与留站结果;QWK 阈值仅在 OOF 上优化。
- 漂移监控:上线场景监控年龄/性别/站点构成与量表版本分布;CRISIS(COVID 期)数据应视为独立协变量层,不得与常规数据无脑合并。
交付前发布清单(release checklist):
[ ] 数据:release 号 + 数据截止日 + 文件哈希已记录
[ ] 清洗:EID 唯一性断言通过;量表映射层版本化
[ ] 划分:受试者级去重后切分;站点分层;家族分组核查
[ ] 标签:诊断口径(算法/共识/视角)已声明;目标派生特征已剔除
[ ] 评估:OOF 阈值冻结;类级指标 + FD 敏感性 + 留站结果齐备
[ ] 合规:样本级许可清单;模型卡含许可构成与 NC 声明
[ ] 引用:Alexander 2017(+模态专属论文)与 release 号写入脚注
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 招募偏倚 | 社区推荐 + 150 美元报酬吸引对症状有担忧的家庭,非流行病学抽样(官方明示 baseline 非代表性) | 高 | 结论限定"临床受累谱系";不做患病率估计;敏感性分析比较受累程度分层 |
| 性别失衡 | 女性约 33-36%,男性偏多 | 中 | 分层评估;按性别分箱报告 |
| 站点/设备混淆 | 4 站点、1.5T/3T 混布 | 高 | ComBat 调和、留站验证、站点对抗解耦(见坑点 6) |
| 运动-症状混杂 | 儿童头动与 ADHD/年龄相关 | 高 | FD scrubbing、运动协变量回归(坑点 7) |
| 报告偏倚 | 大量量表依赖家长/青少年自评(PCIAT、CBCL 等) | 中 | 使用多视角(T/P/D)交叉验证标签;敏感性分析 |
| 协议漂移 | 四阶段演进,量表增删、版本更新 | 中 | 冻结 release;阶段分层;仪器版本图谱(坑点 4) |
| 稀有类别稀缺 | 低患病率诊断样本极少,SII 类别 85% < 2 | 中 | 分层重采样;类级指标;合并类别建模 |
§7.2 标注质量
诊断标注的金标准程序完备:持证临床医师执行 K-SADS-COMP(DSM-5 半结构化访谈,家长+儿童双视角),临床团队结合全部材料产出共识诊断;量表数据经"医师初评-助理复评-双人双录入"三重校验。局限在于公开数据不含标注者间一致性统计(Kappa/ICC),且共识诊断融合了临床判断,其可复现性无法从数据本身定量评估。建议使用时同时报告算法诊断与共识诊断两种口径的结果。
标注质量控制程序表:
| 环节 | 执行者 | 控制手段 |
|---|---|---|
| 诊断访谈 | 持证临床医师(心理学家/社工) | K-SADS-COMP 计算机化访谈,标准化条目与算法计分 |
| 量表施测 | 受试者/家长电子直录 | NextGen 电子病历门户直录,消除纸笔转录错误 |
| 测验初评 | 施测临床医师 | 按官方手册计分 |
| 全量复评 | 训练有素的研究助理 | 独立复评全部临床测验响应 |
| 数据入库 | 两名不同研究助理 | 双人独立双录入,差异触发核对 |
| 补充施测 | 语言病理学家等 | 仅对筛查阳性者(如 CELF-5 筛查未通过)按需施测 |
§7.3 泛化性表
| 部署场景 | 失效风险 | 证据/机制 |
|---|---|---|
| 在其他城市/国家儿童人群直接应用 | 高 | 数据全部来自纽约都会区,文化/医疗语境单一 |
| 应用于全年龄段 | 高 | 5-21 岁样本训练的模型在成人脑上外推失效 |
| 应用于随机健康筛查 | 中-高 | 招募偏向有症状担忧家庭,患病谱系右偏 |
| 跨扫描仪(GE/Philips)部署 | 中-高 | 样本内仅 Siemens 1.5T/3T,厂商间谐波差异未见覆盖 |
| 时间外推(2023 后采集数据) | 中 | 协议演进 + COVID 影响(CRISIS 数据显示生活模式改变) |
| 临床鉴别诊断(共病样本) | 中 | HBN 保留共病谱系,比单一疾病数据集更贴近真实,但共识诊断不含独立双评 |
| 学龄前儿童(<5 岁)应用 | 极高 | 样本年龄下限 5 岁,学龄前发育期脑外推无证据支撑 |
| 非英语/非北美语境 | 高 | 量表为英文标准化版本,语言与文化效度需当地验证 |
| 高共病复杂临床样本 | 中 | 样本含真实共病但共识诊断流程不公开逐例材料,无法复核 |
§7.4 伦理
受试者为未成年人,知情同意由监护人完成并附儿童同意(assent)程序;参与家庭获得全面诊断咨询报告、反馈会谈与转诊建议(评估即福利),另获 150 美元报酬。数据经 Child Mind Institute 脱敏后释放;MRI 与表型访问需注册并签署 DUA;按参与者同意分双许可(含禁商用的 NC 子集)。研究设排除标准保护急性安全风险儿童(如急性自杀风险、未治疗精神病性状态不纳入扫描流程)。
§7.5 公平性
性别构成失衡(女性约 33-36%)要求分性别评估关键指标;社会经济地位(Barratt 量表)覆盖面广但社区推荐模式可能低估低获取医疗资源群体;官方未发布可直接引用的完整种族构成汇总,做公平性审计时需基于数据内 Basic_Demos/Barratt 字段自行统计并避免小样本下标。建议报告"分层最小类性能"而非仅整体均值。
公平性审计的最低操作集:
| 审计项 | 操作 | 依据字段 |
|---|---|---|
| 性别分层性能 | 分 M/F 报告主指标,禁止只报合并值 | Basic_Demos.Sex |
| 年龄分箱性能 | 5-9/10-14/15-21 三箱分别报告 | Basic_Demos.Age |
| SES 敏感性 | 按 Barratt 四分位分层,检验低 SES 层性能衰减 | Barratt.Barratt_Total |
| 站点公平 | 留站性能差异作为泛化下界 | Basic_Demos.Site |
| 小样本保护 | 任一分层单元 <30 例时合并或只做描述 | 全部分层字段 |
§7.6 数据漂移
三种漂移需监控:(1) 协议漂移——四阶段量表增删与版本更新(坑点 4);(2) 情境漂移——COVID 期间新增 CRISIS 调查(2020-04、2021-02 两时点),家庭生活与筛查行为模式改变;(3) 组合漂移——随招募推进受累谱系与诊断构成变化。应对:以 release/日期分层评估模型指标稳定性,关键特征做 PSI 监控。
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ⚠️ | 官方按量表分表(数十个 CSV),宽表需自行拼接(R4-R10 曾提供合并 Pheno 导出) |
| 2 | 唯一标识 | ✅ | EID(NDAR 前缀)全库唯一,跨影像/EEG/表型一致 |
| 3 | 特殊字符处理 | ✅ | CSV 采用标准编码,量表列名英文下划线式,无乱码风险 |
| 4 | 重复行 | ⚠️ | 历史 release 存在 COINS 上传重复行,R11 已修复;旧镜像仍需去重(坑点 1) |
| 5 | 缺失编码 | ✅ | 空值/NA 语义一致;按需施测量表缺失含义明确 |
| 6 | 标签标识清晰度 | ⚠️ | 算法诊断与共识诊断双轨 + T/P/D 三视角并存,需文档级澄清后使用(坑点 3) |
| 7 | 罕见类分组 | ✅ | 按需补充诊断(ADOS/YGTSS/Y-BOCS)覆盖稀有类并提供分组依据 |
| 8 | 偏倚评估 | ✅ | 官方论文明示社区推荐设计与非代表性,偏倚来源可系统列举(§7.1) |
| 9 | 数据字典 | ✅ | 2024-04 官方文档大更新:量表清单 + 数据字典成体系 |
| 10 | 信息性缺失解释 | ✅ | 年龄超限、按需施测等结构性缺失机制明确(§4.5) |
| 11 | 设备记录 | ✅ | BIDS JSON 记录采集参数;站点字段(Site)可查;1.5T/3T 混布已知 |
| 12 | 共线性检查 | ⚠️ | 量表间高相关普遍(CBCL 与各症状量表共病结构),官方核查过重叠仪器对但需使用者自行做共线性诊断 |
| 13 | 编码映射 | ⚠️ | 多次量表重命名/编码修复(ARI_S→ARI_SR 等),跨 release 需映射层(坑点 4) |
| 14 | 时间戳处理 | ⚠️ | 表型为访视级而非条目级时间戳;影像 session 日期在 BIDS 中规范;纵向(CRISIS/随访)需另行对齐 |
| 15 | 划分建议 | ⚠️ | 无官方 ML 划分;社区惯例成熟(§5.2);Kaggle PIU 子集有固定切分 |
| 16 | 泄漏讨论 | ✅ | 重复行/三视角/PCIAT 泄漏模式明确可查(§5.3、坑点 2) |
| 17 | 标签分布 | ✅ | SII 分布(60% 为 0、85% < 2)等有公开口径;诊断分布可由 KSADS 表统计 |
| 18 | 测量偏倚 | ⚠️ | 家长报告主观性(PCIAT)、T 分数年龄标准化问题(SRS_Pre)均有公开记录 |
| 19 | 外部验证建议 | ✅ | ABIDE/ADHD-200/HCP-D/ABCD 可外验;Modabbernia 2023 提供对齐框架 |
| 20 | 版本记录 | ✅ | 季度 release 机制 + NITRC 官方公告逐条记录变更(R11 全清单) |
| 21 | 预处理脚本 | ✅ | RBC(fMRIPrep/XCP-D/QSIPrep/FreeSurfer)与 Fibr dMRI 提供可复现衍生管线 |
| 22 | 合规要求 | ✅ | DUA + 双许可体系清晰;NC 子集禁商用明确声明 |
| 23 | 多模态对齐 | ✅ | EID 枢纽 + BIDS session 结构;EEG 与眼动同步采集 |
| 24 | 去标识化 | ✅ | 官方脱敏后释放;录音录像与影像经清理;访问受 DUA 约束 |
DAIMS 评分:20 / 24(✅ 16 项 × 1 分 + ⚠️ 8 项 × 0.5 分 + ❌ 0 项)
评分解读:HBN 在标识体系、去标识化、合规、版本记录、官方字典与预处理脚本上达到公开数据集的标杆水平;失分集中在"滚动 release 的工程性噪声"(重复行修复、列名漂移、无官方 ML 划分、双轨标签)——这些是大型滚动生物样本库的固有形态,而非数据质量缺陷。
对你意味着什么:(1) 直接采用 R11 + RBC 衍生数据,可绕开大部分 ⚠️ 项;(2) 把"EID 去重 + 量表映射层 + 单一诊断口径"写进数据加载器并固化测试;(3) 划分必须自建,报告时说明划分协议;(4) 使用 T 分数量表前核对年龄适用范围;(5) 建立样本级许可清单以防 NC 子集混入商用链路。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| HBN dMRI 专家评分 held-out 集 | Fibr 社区科学联盟(多机构) | 自动化 dMRI QC | ROC-AUC 0.947 | — | 神经网络 QC 与专家高度一致,验证社区科学标注范式 |
| Kaggle CMI-PIU private 测试集(约 62% 测试数据) | Kaggle/Child Mind Institute | SII 分档预测 | QWK 0.482(冠军) | public/private 榜单大幅洗牌 | 标签噪声与分布偏移下,跨榜单稳定性本身即外验信号 |
§8 基准性能与生态
§8.1 排行榜与代表性结果
| 排名 | 模型/方案 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Lennart Haupts(Kaggle PIU private LB) | QWK 0.482 | 2024 | 多 seed/多折集成 + OOF 阈值优化 | Haupts, L., 2024, Kaggle CMI-PIU Competition. https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use/leaderboard | 有(公开 notebook) |
| 2 | Aradhye Agarwal | QWK 0.478 | 2024 | 表格模型集成 + 阈值搜索 | Agarwal, A., 2024, Kaggle CMI-PIU Competition. https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use/leaderboard | — |
| 3 | Jobayer Hossain | QWK 0.478 | 2024 | 梯度提升集成 | Hossain, J., 2024, Kaggle CMI-PIU Competition. https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use/leaderboard | — |
| — | 自动 dMRI QC(社区科学) | ROC-AUC 0.947 | 2022 | CNN + 专家/社区科学混合标注 | Richie-Halford, A. et al., 2022, Scientific Data. DOI 10.1038/s41597-022-01594-9(Fibr 项目论文) | 有(github.com/fibr) |
| — | 脑龄预测系统评测 | 12 类算法对比 | 2023 | 影像衍生特征 + 正则化回归/CNN | Modabbernia, A. et al., 2023, Human Brain Mapping. DOI 10.1002/hbm.26010 | github.com/AmirhosseinModabbernia/DevelopmentalBrainAge |
数值不可直接比较的原因:Kaggle 三行共享同一任务/切分,可直接排序;QC 与脑龄两行任务、指标、子集完全不同,仅代表各自方向的最强公开先例。Fibr 论文的 ROC-AUC 在其 held-out 专家评分集上计算,不可迁移到其他 QC 定义。不同论文的脑龄 MAE 受数据子集、管线版本与年龄范围影响,跨文比较需对齐协议(Modabbernia 2023 即为此目的而生)。
§8.2 SOTA 总结与选型建议
表格任务(表型→SII/诊断)当前最优公开成绩 QWK ≈ 0.48,说明该任务信号有限、标签噪声主导——把它当作"现实基线"而非可大幅超越的对手。脑龄预测在儿科多库对齐框架下是最成熟的方向。建议研究路线:先复现 Kaggle 前列方案的口径 → 再迁移到诊断/维度任务 → 最后做多模态融合(fMRI+EEG+表型),每一步保持站点分层评估。
选型速查:
| 目标 | 起点方案 | 升级方向 |
|---|---|---|
| 快速发表级基线 | Ridge/弹性网于 FreeSurfer 特征,10 折 CV + 站点分层 | 加入皮层形态学模板特征或 DLMUSE 类自动分割 |
| 表格竞赛级性能 | LightGBM 集成 + OOF 阈值优化 | 多 seed bagging + 目标变换(秩变换) |
| 方法创新(跨诊断) | 维度回归 + 偏倚敏感性分析 | 多任务学习(诊断+维度联合)或不平衡表征学习 |
| 多模态创新 | 单模态上限逐一确认 | 中期融合 + 模态 dropout;EEG-影像对齐预训练 |
| QC/数据质量研究 | Fibr QC 协议复现 | 主动学习扩充专家评分;跨数据集 QC 迁移 |
§8.3 评测协议
Kaggle PIU:固定 train/test 切分、QWK 指标、代码竞赛(禁外网数据);private LB 以约 62% 测试数据计算。学术协议:受试者级划分 + 站点分层/留站、OOF 阈值优化、报告均值±标准差与类级指标;诊断任务同时报告算法/共识两口径。脑龄任务遵循 Modabbernia 2023 的特征提取与偏置校正协议(含 PAD 去偏)。
§8.4 相关数据集表
| 数据集 | 机构 | 关系 | 获取 |
|---|---|---|---|
| ADHD-200 | INDI | HBN 前身生态,单病种 ADHD | fcon_1000(开放) |
| ABIDE I/II | INDI | 孤独症跨库外验首选 | fcon_1000(开放) |
| NKI-Rockland | NKI | 全龄社区样本,可靠性与方法学外验 | fcon_1000(开放) |
| HBN-SSI | Child Mind Institute | HBN 重测信度子研究(13 人 × 12 sessions × 4 条件) | fcon_1000/hbn_ssi(开放) |
| HCP-D | 华盛顿大学等 | 健康发育对照队列 | ConnectomeDB 申请 |
| ABCD | NIMH 支持联盟 | 大样本纵向(9-10 岁起) | NDA 申请 |
§8.5 关键论文 Top 6
- Alexander, L. M. et al., 2017, Scientific Data. DOI 10.1038/sdata.2017.181 —— HBN 设计、协议与首释(n=664)的权威描述。
- Richie-Halford, A. et al., 2022, Scientific Data. DOI 10.1038/s41597-022-01594-9 —— 2,747 名 BIDS 化预处理 dMRI + 社区科学 QC 范式(ROC-AUC 0.947)。
- HBN-EEG Consortium, 2024, bioRxiv. DOI 10.1101/2024.10.03.615261 —— EEG 的 FAIR/BIDS/HED 实现、双许可结构与 release 覆盖。
- Modabbernia, A. et al., 2023, Human Brain Mapping. DOI 10.1002/hbm.26010 —— 含 HBN 在内的儿科脑龄预测算法系统评测。
- O’Connor, D. et al., 2024, bioRxiv. DOI 10.1101/078881 —— HBN-SSI 重测信度资源(13 人 × 12 sessions × 4 条件)。
- Kaggle, 2024, CMI-PIU Competition. https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use —— 3,500+ 队参赛的 PIU 预测基准(QWK 口径确立)。
§8.6 社区活跃度
HBN 所在的 INDI 生态在 2017 年官方新闻稿口径下已服务全球 3,000+ 研究者并支撑 952 篇论文(截至 2017-03);HBN 自身论文截至 2026-09 检索获 Springer 口径 676 次引用、63k 次访问,属于儿科脑影像领域核心基础设施级数据集。官方维护 NITRC 门户公告、HBN 支持论坛与 CMIDataUsage@childmind.org 邮箱支持,文档于 2024-04 大版本更新。
社区参与形态多元:官方季度 release 公告与数据字典更新保持透明;NeuroStars 论坛上可检索到大量 HBN 具体问题(BIDS 同步、fMRIPrep 兼容、表型合并)的官方或社区解答;2022 年 Fibr 项目开创了"社区科学标注"(citizen scientist QC)范式;2024 年 Kaggle PIU 竞赛以 3,500+ 队伍的规模把数据集带入泛机器学习社区。遇到数据问题时,建议按"官方公告 → NeuroStars → 官方邮箱"顺序排查,多数 release 相关疑问在 R11 公告清单中已有答案。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 状态(截至 2026-09 检索) | 推荐理由 |
|---|---|---|---|---|
| FCP/INDI HBN 门户 | 官方数据门户 | https://fcon_1000.projects.nitrc.org/indi/cmi_healthy_brain_network/ | 活跃维护 | 首选入口:量表清单、数据字典、DUA |
| HBN LORIS 平台 | 数据查询/导出 | https://data.healthybrainnetwork.org | 活跃 | 表型查询与 CRISIS 数据唯一来源 |
| OpenNeuro EEG | BIDS-EEG 托管 | https://openneuro.org/datasets/ds005505 | 9 releases 公开 | FAIR 化 EEG,CC BY-SA |
| AWS S3 fcp-indi 桶 | 对象存储 | s3://fcp-indi/data/Projects/HBN/ | 公开可读 | MRI/EEG 增量同步 |
| PennLINC RBC/AI2D | 预处理衍生 | https://pennlinc.github.io/AI2D/docs/datasets/HBN | 活跃(v25 管线) | 免自建 fmriprep/XCP-D/QSIPrep |
| DevelopmentalBrainAge | 基准代码 | github.com/AmirhosseinModabbernia/DevelopmentalBrainAge | 可复现 | 脑龄预测多库对齐起点 |
| Kaggle CMI-PIU | 竞赛基准 | https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use | 已结赛(2024-12) | 表格基线与社区方案库 |
§9 相关资源与引用
§9.1 官方资源导航
- 官方门户(量表清单/数据字典/DUA 入口):FCP/INDI CMI Healthy Brain Network
- 研究官网:healthybrainnetwork.org;Child Mind Institute 项目页
- LORIS 数据平台(表型查询/CRISIS/DUA):data.healthybrainnetwork.org
- EEG BIDS 公开子集:OpenNeuro ds005505(R1)至 ds005516(R11);NEMAR 镜像
- AWS S3:
s3://fcp-indi/data/Projects/HBN/BIDS_curated/(MRI)、s3://fcp-indi/data/Projects/HBN/BIDS_EEG/(EEG) - 社区预处理:PennLINC RBC/AI2D、Reproducible Brain Chart 文档
- 用户支持:CMIDataUsage@childmind.org;NITRC FCP/INDI 新闻列表(release 公告)
- 配套工具文档(处理 HBN 数据会用到):
§9.2 BibTeX 完整引用
@article{Alexander2017HBN,
author = {Alexander, Lindsay M. and Escalera, Jasmine and Ai, Lei and Andreotti, Charissa and Febre, Karina and Mangone, Alexander and Vega-Potler, Natan and Langer, Nicolas and Alexander, Alexis and Kovacs, Meagan and Litke, Shannon and O'Hagan, Bridget and Andersen, Jennifer and Bronstein, Batya and Bui, Anastasia and Bushey, Marijayne and Butler, Henry and Castagna, Victoria and Camacho, Nicolas and Chan, Elisha and Citera, Danielle and Clucas, Jon and Cohen, Samantha and Dufek, Sarah and Eaves, Megan and Fradera, Brian and Gardner, Judith and Grant-Villegas, Natalie and Green, Gabriella and Gregory, Camille and Hart, Emily and Harris, Shana and Horton, Megan and Kahn, Danielle and Kabotyanski, Katherine and Karmel, Bernard and Kelly, Simon P. and Kleinman, Kayla and Koo, Bonhwang and Kramer, Eliza and Lennon, Elizabeth and Lord, Catherine and Mantello, Ginny and Margolis, Amy and Merikangas, Kathleen R. and Milham, Judith and Minniti, Giuseppe and Neuhaus, Rebecca and Levine, Alexandra and Osman, Yael and Parra, Lucas C. and Pugh, Ken R. and Racanello, Amy and Restrepo, Anita and Saltzman, Tian and Septimus, Batya and Tobe, Russell and Waltz, Rachel and Williams, Anna and Yeo, Anna and Castellanos, Francisco X. and Klein, Arno and Paus, Tomas and Leventhal, Bennett L. and Craddock, R. Cameron and Koplewicz, Harold S. and Milham, Michael P.},
title = {An open resource for transdiagnostic research in pediatric mental health and learning disorders},
journal = {Scientific Data},
volume = {4},
pages = {170181},
year = {2017},
doi = {10.1038/sdata.2017.181},
pmid = {29257126},
pmcid = {PMC5735921}
}
@article{RichieHalford2022HBNdMRI,
author = {Richie-Halford, Adam and Cieslak, Matthew and Ai, Lei and Caffarra, Sendy and Covitz, Sydney and Franco, Alexandre R. and Karipidis, Iliana I. and Kruper, John and Milham, Michael and Avelar-Pereira, B{\'a}rbara and Roy, Ethan and Sydnor, Valerie J. and Yeatman, Jason D. and {The Fibr Community Science Consortium} and Satterthwaite, Theodore D. and Rokem, Ariel},
title = {An analysis-ready and quality controlled resource for pediatric brain white-matter research},
journal = {Scientific Data},
volume = {9},
pages = {623},
year = {2022},
doi = {10.1038/s41597-022-01594-9}
}
@article{Modabbernia2023BrainAge,
author = {Modabbernia, Amirhossein and Millan, Marisa J. and Malhotra, Anil and others},
title = {Systematic evaluation of machine learning algorithms for neuroanatomically-based age prediction in youth},
journal = {Human Brain Mapping},
year = {2023},
doi = {10.1002/hbm.26010}
}
@article{HBNEEG2024FAIR,
author = {{HBN-EEG Consortium}},
title = {HBN-EEG: The FAIR implementation of the Healthy Brain Network (HBN) electroencephalography dataset},
journal = {bioRxiv},
year = {2024},
doi = {10.1101/2024.10.03.615261}
}
@article{OConnor2024HBNSSI,
author = {O'Connor, David and Vega Potler, Natan and Kovacs, Meagan and Xu, Ting and Ai, Lei and Pellman, John and Vanderwal, Tamara and Parra, Lucas and Cohen, Samantha and Ghosh, Satrajit and Escalera, Jasmine and Grant-Villegas, Natalie and Osman, Yael and Bui, Anastasia and Craddock, R. Cameron and Milham, Michael P.},
title = {The Healthy Brain Network Serial Scanning Initiative: A resource for evaluating inter-individual differences and their reliabilities across scan conditions and sessions},
journal = {bioRxiv},
year = {2024},
doi = {10.1101/078881}
}
§9.3 引用指南
- 使用全库或任一模态:必引 Alexander et al. 2017;使用 EEG:必引 HBN-EEG 2024 + Alexander 2017;使用 dMRI 预处理版:必引 Richie-Halford 2022;使用 RBC 衍生:按其数据集页面致谢要求注明管线版本。
- 引用数据版本:注明 release 号与数据截止日期(如 “Release 11, data cutoff 2022-11-23”)。
- 基准比较:注明划分协议与指标口径,Kaggle PIU 结果引用 private LB 并注明 2024 结赛。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| fast-model(CodeBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-08 | 6 组检索:官方门户与新闻稿、原始论文与引用统计、release 公告与修复清单、量表协议、EEG FAIR 与获取方式、Kaggle 基准 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 FCP/INDI 官方门户、NITRC release 公告、Alexander 2017 原始论文、HBN-EEG FAIR 论文、PennLINC RBC 文档与 Kaggle 竞赛页面整理结构化信息;(2) 生成 §6 的 Python/Bash 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源列表
- Alexander, L. M. et al., 2017, Scientific Data. DOI 10.1038/sdata.2017.181 — https://www.nature.com/articles/sdata2017181
- Springer Nature 引用统计页(676 citations / 63k accesses,截至 2026-09 检索)— https://link.springer.com/article/10.1038/sdata.2017.181
- Child Mind Institute 官方新闻稿(R1 释放,n=664,社区推荐模式,$150 报酬)— https://childmind.org/news/healthy-brain-network-child-mind-institutes-youth-mental-health-study-releases-groundbreaking-open-dataset
- NITRC FCP/INDI 官方新闻 RSS(R11 公告、数据截止 2022-11-23、修复清单、CRISIS)— https://nitrc.org/export/rss20_news.php?group_id=296
- AFNI/NIMH 论坛 FCP/INDI R1 公告(n=664、目标 10,000、模态清单)— https://discuss.afni.nimh.nih.gov/t/fcp-indi-new-data-release-cmi-healthy-brain-network-resting-state-fmri-naturalistic-viewing-fmri-diffusion-mri-eeg-and-more/643
- HBN 原始论文全文(欧洲 PMC 镜像,四阶段设计、访视表、量表清单、K-SADS-COMP 程序)— https://staging.europepmc.org/articles/PMC5735921
- HBN Biobank bioRxiv 预印本全文(诊断评估细节、WISC-V/KBIT/WAIS-IV 年龄规则、语言测验)— https://www.biorxiv.org/content/10.1101/149369v1.full-text
- Atlas of Longitudinal Datasets:HBN 条目(截至 2024 累计 4,136 人、首采 2017、排除标准、资助方)— https://atlaslongitudinaldatasets.ac.uk/datasets/hbn
- PennLINC AI2D HBN 页(3,887 sessions、平均年龄 10.3、36% 女性、CC BY-NC-SA、RBC 管线完成率)— https://pennlinc.github.io/AI2D/docs/datasets/HBN
- Reproducible Brain Chart 文档(平均年龄 10.4、33% 女性、82% 右利手、Overall Psychopathology 统计)— https://reprobrainchart.github.io/docs/datasets/HBN
- Richie-Halford et al. 2022 全文(dMRI N=2,747、QC ROC-AUC 0.947、5000 目标表述)— https://gala.gre.ac.uk/id/eprint/47361/7/47361_FARMER_An_analysis-ready_and_quality_controlled_resource_for_pediatric_brain_white-matter_research.pdf
- HBN-EEG FAIR 论文全文(11 releases 4,000+ 参与者、双许可、R10/R11 元数据缺口、129 通道)— https://www.biorxiv.org/content/10.1101/2024.10.03.615261v1.full
- OpenNeuro ds005512 页面(EEG 各 release 受试者数、R8 157.19 GB/9,305 文件、许可声明)— https://openneuro.org/datasets/ds005512/versions/1.0.1
- EEGDash 数据集 API 页(R1 136 人、129 通道、500 Hz、117 小时、性别构成)— https://eegdash.org/api/dataset/eegdash.dataset.ON005505.html
- NeuroStars 讨论(S3 BIDS_curated 桶路径与内容:静息态+两个电影任务)— https://neurostars.org/t/unprocessed-hcp-data-in-bids-format-for-fmriprep/24767/4
- Meisler 等 FBA 项目文档(DUA 获取流程、LORIS 表型查询字段、qsiprep 衍生 S3 路径)— https://github.aichem.org/smeisler/Meisler_Reading_FBA
- Modabbernia et al. 2023, Human Brain Mapping(脑龄预测系统评测、HBN 纳入)— https://wol-prod-cdn.literatumonline.com/doi/10.1002/hbm.26010
- Kaggle CMI-PIU 排行榜(冠军 0.482、QWK 指标、private LB 62% 口径)— https://www.kaggle.com/competitions/child-mind-institute-problematic-internet-use/leaderboard
- Kaggle PIU 11th place writeup(SII 分布 60%/85%、PCIAT 主观性讨论)— https://kaggle.com/competitions/child-mind-institute-problematic-internet-use/writeups/aggie-analytics-11th-place-solution-for-the-child-
- HBN-SSI 记录页(13 人 × 12 sessions × 4 条件、DOI 10.1101/078881)— https://lerxe.net/Record/207-XBI000087505
- Pitt LNCD wiki CMI-HBN 条目(3 站点 1.5T/3T Siemens、rest fMRI 2×5-10 min、排除标准)— http://lncd.pitt.edu/wiki/doku.php?do=export_xhtml&id=bigdata:cmi
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(子集行数、版本矩阵、设备) | 千方病案医学编辑部 | 与官方门户及 release 公告交叉比对 | ✅ 已验证 |
| §4 数据结构(目录树、DAIMS 字段字典) | 千方病案医学编辑部 | 与 BIDS 规范及 LORIS 字段文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方管线文档比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Springer 统计快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页面 §1-§9 正文、§6 代码示例与 §C JSON-LD 均由 AI 生成初稿并经人工交叉审核修订;§0 审核声明、三段免责声明与 §10.4 人工校验表由人工维护。
§10.6 最后人工审核日期
最后人工审核日期:2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
