信息速览

ADHD-200 Sample — 注意力缺陷多动障碍多中心脑影像竞赛 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ADHD-200 Sample(ADHD-200 注意力缺陷多动障碍脑成像竞赛数据集) |
| 英文全称 | The ADHD-200 Sample / ADHD-200 Global Competition dataset |
| 别名/简称 | ADHD-200、ADHD200、ADHD-200 Sample、1000 Functional Connectomes Project-INDI ADHD 联盟、ADHD-200 Preprocessed(Neuro Bureau 预处理版) |
| 疾病分类 | 注意缺陷与多动障碍(ICD-11:6A05 注意缺陷与多动障碍 / 6A05.0 以注意缺陷为主 / 6A05.1 以多动-冲动为主 / 6A05.2 混合表现) |
| SNOMED CT | 406506008 Attention deficit hyperactivity disorder(详见 §2.1b) |
| 数据模态 | 脑静息态功能磁共振(rs-fMRI)+ 结构 T1 + 表型(诊断/量表/IQ/用药) |
| AI 任务类型 | ADHD/对照三分类与二分类、ADHD 亚型判别、功能连接组学建模、多站点域适应、生物标志物可重复性研究 |
| 样本总数 | 训练 776 名受试者(285 ADHD + 491 对照,7-21 岁)+ 留出测试 197 名(有标签 171 名);含 Neuro Bureau 处理口径全样本 973 人(585 TDC + 362 ADHD + 26 未知) |
| 数据格式 | NIfTI(.nii.gz)/ CSV 表型 / .1D 与 .mat ROI 时间序列 / tar.gz 分包 |
| 许可证 | 非商业研究免费使用(1000 Functional Connectomes Project / INDI 协议);Preprocessed 衍生数据免数据使用协议 |
| 访问级别 | 注册后开放(需注册免费 NITRC 账号下载;部分渠道匿名 S3 读取) |
| DUO 标签 | 无正式 DUO 标注;按数据协议实际约束近似 NCU(非商业) |
| 语言 | 英文(元数据与文档);受试者分布于中、美、荷兰等国家 |
| 首发日期 | 2011-03-01(ADHD-200 Sample 训练集发布) |
| 最后更新 | 2025-11-21(data-indi/adhd200 GitHub 镜像重发布) |
| 发布机构 | ADHD-200 Consortium / INDI(协调人 Michael Milham、Damien Fair、Maarten Mennes、Stewart Mostofsky) |
| 官方主页 | http://fcon_1000.projects.nitrc.org/indi/adhd200/ |
| 下载地址 | http://fcon_1000.projects.nitrc.org/indi/adhd200/;Preprocessed:http://preprocessed-connectomes-project.github.io/adhd200 |
| DOI | 10.3389/fnsys.2012.00062(主参考论文);10.1016/j.neuroimage.2016.06.034(Preprocessed 论文) |
| 引用次数 | 494+(Google Scholar,ADHD-200 Consortium 2012,截至 2026-09 检索) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 多管线预处理衍生与 CC200/CC400 时间序列齐备、竞赛划分明确、社区基准丰富;扣分项:原始表型需手工清洗、测试子集标签口径不统一、无官方持续的排行榜更新 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、ADHD 诊断亚型与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(表型字段映射、多中心目录层级)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 ADHD-200 Consortium、Child Mind Institute、INDI 及 Neuro Bureau 无任何商业利益关联。本页面不销售 ADHD-200 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 ADHD-200 Consortium 及其成员机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ADHD-200 原始数据仅供非商业研究使用,需注册免费 NITRC 账号并遵守 1000 Functional Connectomes Project / INDI 数据共享协议;发布成果时应按引用指南标注所使用站点与资助来源。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? ADHD-200 是一个在 2011 年公开的「多中心 ADHD 脑影像竞赛数据集」。全球 8 个研究机构把自己已经采集好的注意力缺陷多动障碍(ADHD)儿童青少年和健康对照的脑扫描——包括静息态功能磁共振(躺在扫描仪里放松时记录的大脑活动视频)、T1 结构像和临床表型——匿名化后拼在一起。训练子集 776 人(285 名 ADHD + 491 名对照,7-21 岁),另留出 197 名无标签测试者给全世界的队伍盲评。它是 1000 Functional Connectomes Project / INDI 生态里最早、最经典的精神科疾病数据集之一。
为什么重要? ADHD 影响约 5%-10% 学龄儿童,但诊断完全依赖症状量表与专家访谈,缺乏客观生物学工具。ADHD-200 用「开放数据 + 全球竞赛」的方式,第一次让机器学习团队在跨 8 个中心、近千人规模上检验「能否用脑影像判别 ADHD」。它公开了真实世界的残酷事实:跨中心影像分类精度普遍只有约 50%-62%,仅靠表型(年龄、性别、IQ)就能拿到 62.5% 的最高分——这让整个领域冷静下来,也推动了后续对头动混杂、站点域偏移的系统研究,并直接催生了 ABIDE、CC200 分区等生态。
我能用它做什么? 最主流的用法是「用脑功能连接预测 ADHD」:把每个受试者的 fMRI 提炼成功能连接矩阵(通常用 CC200 的 200 个脑区),训练 SVM、自编码器或图神经网络做 ADHD/对照分类,并在留出测试子集或 leave-one-site-out 上评估。它也是研究头动混杂校正、多站点调和(harmonization)、预处理可重复性的标准试验场。注意:它的跨站点精度普遍 ~60%,拿来做「AI 分类教程」与「方法学研究」很好,直接宣称临床可用则不行(详见 §6.5 坑点与 §8)。
§1.1 技术摘要
ADHD-200 采用「既有数据回顾性汇聚 + 竞赛驱动开放」模式:8 个中心各自沿用本地扫描协议(无需统一硬件),在本地 IRB 批准与 HIPAA 匿名化后,将 rs-fMRI、T1 结构与表型提交至 INDI(International Neuroimaging Data-sharing Initiative),经 1000 Functional Connectomes Project 基础设施于 NITRC 发布。2011-03-01 公开训练集 776 个数据集(491 名典型发育对照 TDC + 285 名 ADHD,7-21 岁)[1];2011-07-01 再放留出测试集 197 名无诊断标签受试者(其中 6 个站点,含 2 个未入训练集的站点以增加难度;26 名 Brown 站点受试者标签从未公开)[1][2]。表型含 DSM-IV 诊断状态、ADHD 亚型、维度症状量表、年龄、性别、IQ 与终身用药状态,rs-fMRI 附初步视觉 QC(usable vs questionable)[1]。全样本(Neuro Bureau 口径)为 973 人(585 TDC、362 ADHD、26 未知)[3]。
Neuro Bureau 的 ADHD-200 Preprocessed 为破除预处理门槛,用 Athena(AFNI+FSL,nuisance 回归)、Burner(SPM8/DARTEL 灰质 VBM)、NIAK(CBRAIN,ICA 去噪)三条管线预处理并开放衍生数据,含 AAL/Harvard-Oxford/CC200/CC400 等图谱 ROI 时间序列与 fALFF、ReHo、ICN 空间图 [3][4]。其中 CC200/CC400(Craddock 功能分区)正是为 ADHD-200 设计的,后被 ABIDE 等沿用 [5]。主参考论文为 ADHD-200 Consortium (2012) Front Syst Neurosci 6:62 [1],Preprocessed 论文为 Bellec 等 (2017) NeuroImage [4]。
一句话把握数据形态:这是一个「每个受试者一包 NIfTI(BOLD + T1)+ 一行表型 + 一列质量标记」的多中心影像库。它同时提供官方训练/测试竞赛划分,但测试子集标签口径不统一(171 vs 197 vs 162),且跨站点外推是最大难点——上手第一步永远是「把 4D BOLD 提炼成功能连接或低维特征」(§6.3 起给出完整代码)。
§1.2 战略价值
维度一:作为精神疾病影像分类的事实标准(历史地位)。 ADHD-200 是全球首个以「开放竞赛」形式大规模评估脑影像 ADHD 分类的精神科数据集。21 支队伍、50 队报名的规模,确立了「跨中心留出测试 + 盲评」的评估范式;竞赛揭示的「表型优于影像」「未见站点精度大幅下降」「平均精度 49.8%」等结论,成为后续 ADHD 生物标志物研究反复引用与检验的基准(§8)。任何想在精神疾病影像分类上证明方法价值的团队,都绕不开与 ADHD-200 结果的对齐 [1][2][6]。
维度二:连接组学方法与多站点偏倚研究的天然平台。 8 个中心扫描仪厂家、场强、TR、时长、入组标准全部不同,构成最真实的域偏移(domain shift)与头动混杂场景。CC200/CC400 功能分区由此诞生,被 ABIDE、精神疾病广泛复用 [5];Neuro Bureau 三管线并发的预处理策略,成为「管线选择如何影响结论」的可重复性研究的标杆数据 [4]。对一个把「跨中心可推广性」放在首位的临床转化团队,ADHD-200 是比任何单站点数据都更严苛的试金石。
维度三:公共数据集治理的样板。 776/197 的明确划分、对发布后数据错误的官方修正记录(2011-04-11 结构体素修正、2011-07-01 表型修正)[7]、对下载的注册追踪与引用要求,让 ADHD-200 成为理解「开放神经影像数据生命周期」的案例,也是后人(ABIDE 等)直接沿用的治理模板。
维度四:作为「头动/站点等混杂」教具的教育价值。 对刚进入神经影像 ML 的学生或团队,ADHD-200 是绝佳的「真实多中心场景第一课」:它数据规模适中(数百 MB 即可跑通 CC200 基线)、有明确的留出测试、且混杂因素(头动、站点、IQ、表型泄漏)异常突出——几乎能把神经影像领域每一个典型陷阱都踩一遍而不至于让样本崩塌。正因如此,它常被用作教程与 benchmark 的载体(§8.7 生态),而非简单的「刷精度」数据集。理解它,约等于掌握了多中心 rs-fMRI 分类分析的核心方法论。
把四个维度放在一起看,ADHD-200 的定位可以一句话概括:它是「多中心、多混杂、带官方留出测试」的精神疾病影像分类试炼场——适合做方法学与可重复性研究,也适合做「诚实报告」的训练,但不适合被用来宣称某个分类器已达临床级精度。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 ADHD-200 的差异化 |
|---|---|---|---|---|
| ADHD-200 | 776 训练 + 197 测试(8 中心) | rs-fMRI + T1 + 表型 | DSM-IV ADHD 亚型 + 症状量表 + IQ | 本体;以竞赛形式提供官方留出测试,任务为 ADHD 判别 |
| ABIDE I+II | 2,226 个数据集 / 2,156 名(17+19 站点) | rs-fMRI + T1 + 表型(部分 dMRI) | DSM-IV-TR ASD 诊断 + ADOS/ADI-R/IQ | 姊妹联盟(同一 INDI 生态),任务为自闭症而非 ADHD |
| ADHD-200 Chinese 衍生研究 | 聚焦 PKU 单中心子样本 | rs-fMRI + 表型 | 同上 | 部分研究用 PKU 192+ 子集做单中心高精度建模 |
| MIL / 其他 ADHD 数据 | 数十至数百人 | rs-fMRI/T1 | 各异 | 单中心、规模小,通常无独立留出测试,精度报告普遍虚高 |
| UK Biobank(脑影像子集) | 目标约 10 万(截至 2026-09 已释放数万人) | T1/T2/fMRI/dMRI | 健康人群 + 丰富 EHR | 规模大一个数量级但 ADHD 专科病例极少、非竞赛标签 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 关键内容 |
|---|---|---|
| 2011-03-01 | ADHD-200 Sample 训练集发布 | 776 个 rs-fMRI + 解剖数据集、8 中心、491 TDC + 285 ADHD(7-21 岁),经 NITRC/INDI 开放 [1] |
| 2011-04-11 | 结构体素大小修正 | 73 名受试者结构像 x/z 维度颠倒(涉 Peking_1、NYU_part2、OHSU),重新发布修正结构像与受试者名单 [7] |
| 2011-07-01 | 表型修正 | 49 名受试者性别或 IQ 字段错误(涉 Peking_1、KKI、NYU_part1、OHSU),发布 quick-fix 表型 CSV [7] |
| 2011-07-01 | ADHD-200 竞赛测试集发布 | 197 名无标签受试者(6 站点,含 2 个未入训练集站点);172 名通过 QC [2] |
| 2011-08/09 | 竞赛结果揭晓 | 21 队提交;平均精度 49.8%;最佳整体得分由仅用表型的 Alberta 队取得(62.52%)[1] |
| 2011-05 起 | ADHD-200 Preprocessed 陆续发布 | Neuro Bureau 的 Athena/Burner/NIAK 三管线预处理衍生,含 CC200/CC400 时间序列 [4] |
| 2012-09-05 | 主参考论文发表 | ADHD-200 Consortium,Front Syst Neurosci 6:62 [1] |
| 2016-06 | Neuro Bureau Preprocessed 论文接收 | Bellec 等,NeuroImage 144:275-286(2017 年出版)[4] |
| 2025-11-21 | data-indi/adhd200 镜像重发布 | 标准化 NIfTI 衍生物 + phenotypic.csv + qc.tsv,BIDS 风格组织(GitHub)[7] |
§1.5 典型应用场景
- ADHD vs 对照分类基准:以 CC200 图谱 200 个 ROI 时间序列构建皮尔逊相关功能连接矩阵,用 SVM、去噪自编码器、GNN 等做二分类或三分类,在竞赛留出测试子集上评测(§8.1)。
- 多站点调和与域适应研究:用站点标签研究 ComBat、对抗域适应、站点感知损失函数,检验跨站点迁移能力(§6.5 坑点 1)。
- 头动混杂与质控方法研究:在 ADHD(hyperkinetic)人群上研究 FD/scrubbing 阈值选择、头动协变量校正对连接估计与分类的影响(§6.5 坑点 2)。
- 表型-影像对比研究:复现「仅表型(年龄/性别/IQ/站点)即可达 62.52%」的发现,检验 IQ 等特征对分类的混淆作用(§6.5 坑点 6)。
- 发育轨迹与异质性研究:用 TDC 对照组 + 智力/症状维度量表,刻画儿童青少年 rs-fMRI 连接随年龄的发育轨迹 [3]。
- 功能分区(parcellation)方法验证:CC200/CC400 分区诞生于此,作为评估新分区方案的公共数据 [5]。
§1.6 命名澄清:几个容易混淆的「ADHD-200」
ADHD-200 这个名字在文献中常被指代多个略有不同的对象,写论文和跑实验前务必分清:
- ADHD-200 Sample:本页主讲的原始多中心数据(训练 776 + 留出测试 197),由 ADHD-200 Consortium 经 INDI 发布 [1]。
- ADHD-200 Global Competition:2011 年基于上述数据举办的分类算法竞赛(三分类、留出测试盲评),是「Sample」的评测事件而非独立数据集 [1]。
- ADHD-200 Preprocessed:Neuro Bureau 对 Sample 的预处理衍生(Athena/Burner/NIAK 三管线),含 CC200/CC400 时间序列,另有独立论文 [4]。
- data-indi/adhd200:2025-11 重组织的 BIDS 风格 GitHub 镜像,属于同一数据的不同分发形态 [7]。
规模口径也因此有三个常见值:776(官方训练)、973(Neuro Bureau 处理全样本,585 TDC+362 ADHD+26 未知)、947(973 扣除 26 未标)。引用或报告数字时务必写明用的是哪一个口径(§5.3、§7.7)。
§2 医学背景
§2.1 ICD-11 编码映射表
| 标签 | ICD-11 编码 | ICD-11 中文名 | 备注 |
|---|---|---|---|
| 注意缺陷与多动障碍(总类) | 6A05 | 注意缺陷与多动障碍 | ADHD-200 受试者的核心疾病;DSM-IV 时代采集,定义与 ICD-11 存在演变差异 |
| 以注意缺陷为主 | 6A05.0 | 注意缺陷与多动障碍,以注意缺陷为主 | 对应 ADHD-200 表型中的 Inattentive(ADHD-I)亚型 |
| 以多动-冲动为主 | 6A05.1 | 注意缺陷与多动障碍,以多动-冲动为主 | 对应 Hyperactive-Impulsive(ADHD-HI)亚型,样本极少 |
| 混合表现 | 6A05.2 | 注意缺陷与多动障碍,混合表现 | 对应 ADHD-Combined(ADHD-C)亚型,ADHD-200 中最常见 |
| 典型发育对照 | 无对应编码 | — | 对照组按各站点排除标准筛查,非患者 |
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 参考 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 注意缺陷与多动障碍 | 6A05 | 406506008 | Attention deficit hyperactivity disorder (disorder) |
| 以注意缺陷为主(历史亚型) | 6A05.0 | 74610003 | Attention deficit hyperactivity disorder, predominantly inattentive type (disorder) |
| 以多动-冲动为主(历史亚型) | 6A05.1 | 405663007 | Attention deficit hyperactivity disorder, predominantly hyperactive impulsive type (disorder) |
| 混合型(历史亚型) | 6A05.2 | 406505007 | Attention deficit hyperactivity disorder, combined type (disorder) |
| 静息态功能磁共振检查 | — | 71658009 | Magnetic resonance imaging (procedure) 下位概念 |
编码映射仅用于检索与互操作目的;临床编码请以 WHO ICD-11 与 SNOMED International 官方版本为准。ADHD-200 按 DSM-IV-TR 亚型(Combined/Inattentive/Hyperactive-Impulsive)标注,历史亚型在 ICD-11 中已并入 6A05 表现型谱系。
§2.2 疾病简介与流行病学
注意缺陷与多动障碍(ADHD)是一种以持续性的注意力缺陷、多动与冲动为特征的神经发育障碍,症状始于儿童期且常在多种环境(家庭、学校)造成功能损害 [8]。流行病学上 ADHD 影响约 5%-10% 学龄儿童,美国经济负担估计每年超过 360 亿美元 [7][9]。男孩比例显著高于女孩(约 2-3:1 至 4:1),这与 ADHD-200 训练集中约 62% 为男性、ADHD 组内男性占比更高的构成一致(详见 §7.5)。亚型层面,DSM-IV 区分 ADHD-Combined(注意缺陷与多动-冲动均显著)、ADHD-Inattentive(以注意缺陷为主)、ADHD-Hyperactive-Impulsive(以多动-冲动为主,最少见)[8]。ADHD 在发育中常伴焦虑、对立违抗、学习障碍等共病;症状随发育改变——多动多随年龄减弱而注意力问题在学业环境更凸显。缺乏客观生物学诊断工具与高度共病/异质性,是推动 ADHD-200 大规模影像共享的根本原因 [1][9]。
从神经影像视角看,ADHD 的核心假设集中在「额-纹状体-小脑网络」与默认网络(default mode network, DMN)的功能连接异常:任务态研究常报告前额叶激活不足,静息态研究则在 DMN 与注意网络之间出现「去抑制」样改变。这些假设大多基于数十人的单中心样本,统计功效不足、结论难以重复。ADHD-200 的价值正在于把样本量推到近千人、覆盖多协议,让此类群体层面的连接假设第一次可以在足够功效下接受检验——这也是其被设计为「静息态为主」而非任务态的原因:静息态更易在多中心统一、且对幼儿与多动人群耐受性更好 [1][3]。
需特别指出的是,ADHD-200 的采集与标注发生在 DSM-IV-TR / ICD-10 时代(2011 年前),其「ADHD-Combined / Inattentive / Hyperactive-Impulsive」亚型对应 DSM-5/ICD-11 中 6A05 的表现型谱系,但并非一一等同——现代 ICD-11 强调症状的持续表现维度而非离散「亚型」(§2.1b)。因此用 ADHD-200 的亚型标签推导现代分类学结论时需谨慎,应视为历史分类学下的临床分组。
临床诊断本身也具挑战:ADHD 依赖家长/教师报告的跨环境症状证据,主观性高、评估工具版本混杂(§2.7)。ADHD-200 的对照(TDC)由各站点按排除精神疾病标准招募,但不同站点对「典型发育」的界定宽严不一,可能导致对照组的亚临床共病率差异——这直接关系分类模型的对照可区分性(§7.1)。
§2.3 临床任务定义
| 任务 | 定义 | ADHD-200 支持度 |
|---|---|---|
| 诊断(ADHD vs 对照二分类) | 表型 DX/DIAGNOSIS 区分 ADHD 与典型对照;竞赛也以三分类形式评测 | 核心任务,训练集 776 名全有标签 |
| 亚型区分(三分类) | ADHD-C / ADHD-I / TDC;ADHD-HI 因样本极少通常并入 ADHD 或剔除 | 部分支持:ADHD-C 与 ADHD-I 有可建模样本量,ADHD-HI 极少(多中心 0-6 例) |
| 症状严重度回归 | ADHD_Index(ADHD-RS/CPRS-LV 维度分)、Inattentive/Hyper-Impulsive 分量作连续目标 | 支持:表型含 ADHD Measure 与 ADHD Index 列,但跨量表不可直接加总 |
| 认知水平分层 | FIQ/VIQ/PIQ 作协变量或分层特征 | 支持:多数受试者有至少一种 WISC/WASI 测量 |
| 发育轨迹 | 年龄 × 连接组(对照组内) | 支持:TDC 7-21 岁跨度(NeuroIMAGE 至 26 岁)[3] |
§2.4 患者人群表
训练子集按中心分布(竞赛官方口径与 2025 Springer 复现表一致)[1][10]:
| 中心代码 | 机构(国家) | 训练样本 | ADHD | 对照 | 测试(有标签) |
|---|---|---|---|---|---|
| PKU | 北京大学(中国) | 194 | 78 | 116 | 51 |
| NYU | 纽约大学儿童研究中心(美国) | 222 | 123 | 99 | 41 |
| OHSU | 俄勒冈健康与科学大学(美国) | 79 | 37 | 42 | 34 |
| KKI | 肯尼迪克里格研究所(美国) | 83 | 22 | 61 | 11 |
| NeuroIMAGE | Donders 研究所 / Nijmegen(荷兰) | 48 | 25 | 23 | 25 |
| Pitt | 匹兹堡大学(美国) | 89 | 0 | 89 | 9 |
| WashU | 圣路易斯华盛顿大学(美国) | 61 | 0 | 61 | 0 |
| Brown | 布朗大学/Bradley Hospital(美国) | 0(不入训练) | — | — | 26(标签未公开) |
| 合计 | 8 中心 | 776 | 285 | 491 | 171(+26 未标) |
- 年龄:训练集总体 7-21 岁,均值约 11.99 ± 3.21(NeuroIMAGE 偏大,OHSU 偏小)[10];Neuro Bureau Preprocessed 口径 7-27 岁 [3]
- 性别:训练集约 484 名男性 / 291 名女性(约 62% 男性);ADHD 组内男性占比高于对照组 [10]
- 智力:FIQ 在训练集 TDC 约 114 vs ADHD 约 106(p<0.001),ADHD 平均低约 7-10 分 [1]
- 诊断:DSM-IV ADHD 亚型(Combined/Inattentive/Hyperactive-Impulsive)经各站点临床确认;对照组按各站点排除精神疾病标准筛查
- 测试集:197 名发布(172 名过 QC),其中 Brown 26 名标签未公开 → 常用有标签 171 名;部分研究因 Pitt/WashU 训练集全对照而进一步剔除,用 162 名 [11]
§2.5 临床价值
ADHD 临床诊断依赖主观行为量表与家长/教师报告,耗时且缺乏客观标准。ADHD-200 的临床价值在于提供「影像 → 诊断」映射的公共试验场与跨中心可重复性的现实检验:一方面竞赛证明功能连接等特征在群体水平可判别 ADHD,最佳特异性模型(Eloyan 等)识别对照准确率高达 94%(但仅识别出 21% 的 ADHD 患者)[1][6];另一方面竞赛平均精度仅 49.8%,且仅用表型即可达 62.52% [1][6],清晰表明影像生物标志物距离临床仍有差距。这推动领域将 ADHD-200 定位为「方法开发与生物标志物筛选平台」,而非「即插即用的临床诊断训练集」。对儿科精神疾病而言,7-21 岁的年龄构成覆盖 ADHD 干预与转归研究最关键的发育窗口。
§2.6 金标准与标注方式
| 项目 | 内容 |
|---|---|
| 划分方式 | 官方竞赛划分:训练 776 / 留出测试 197(2011-07-01,无标签盲评);社区再评估常用 LOSO 与 10 折 CV(§5、§6.5 坑点 1) |
| 标注方式 | 各站点临床人员依据 DSM-IV 标准做 ADHD 亚型诊断;表型含 ADHD Measure(ADHD-RS 或 CPRS-LV)与 ADHD Index 维度分 |
| 标注者资质 | 各站点持证临床医师/研究人员按本地标准诊断;非 ADHD-200 中心统一重新标注、无统一一致性 κ 发布 |
| 标注性质 | 回顾性汇聚(各站点既有临床数据),非前瞻性统一采集;测试子集诊断标签盲评、由官方统一核对 |
| 临床确认工具 | DSM-IV 诊断 + ADHD-RS/CPRS-LV 症状量表 + WISC/WASI IQ 测量;对照组按排除标准筛查 |
§2.7 表型中的诊断工具:字段到量表的映射
用表型做症状建模前,先分清 ADHD-200 两个关键的临床工具,它们不可互换:
- ADHD Rating Scale-IV(ADHD-RS):表型中
ADHD Measure = 1对应此量表。由临床人员基于 DSM-IV 条目对注意缺陷与多动-冲动症状评分,是 ADHD-200 最常见的严重度工具之一。 - Conners’ Parent Rating Scale-Revised, Long Version(CPRS-LV):表型中
ADHD Measure = 2。由家长填写的行为量表,量表维度与 ADHD-RS 不同。 - IQ 测量:
IQ Measure标记所用智力量表,1=WISC-IV、2=WASI、3=WISCC-R(中国修订版)。三者量纲与常模不同,跨受试者比较 FIQ 前必须显式处理量表的差异。
用错的两个常见结果:把 ADHD Index 跨不同 ADHD Measure 直接加总当连续回归目标(ADHD-RS 与 CPRS-LV 维度不互等,§6.5 坑点 5);把 FIQ 缺失当 0 或直接删除(FIQ 在 973 全样本缺失率高达 92.7%——多数站点对未入组临床测试的对照不测 FIQ,属信息性缺失,§7.7 检查项 10)。建议保留 ADHD Measure 作为分组列、只对同量表内部做连续建模,并把量表缺失显式建模为「信息性缺失」[12]。
§2.8 共病、用药与纵向信息在 ADHD-200 中的可用性
ADHD 是异质性疾病,约半数儿童伴至少一种共病(对立违抗、焦虑、学习障碍等)。ADHD-200 表型虽提供了共病与用药相关字段,但需清醒认识其可用性边界:
- Secondary_Dx(共病诊断):字段存在,但 973 全样本缺失率约 71.5%,且不同站点记录口径不一——绝大多数「典型对照」与相当比例 ADHD 未系统评估共病。用于「共病分层」仅能覆盖小部分有记录的 ADHD 子样本(§4.5)。
- Med_Status(终身用药状态):缺失率约 42%,且「是否用药」与 ADHD 严重度、就诊类型相关,属于信息性而非随机缺失;若把「未用药」硬编码为无治疗史会引入偏倚。多数站点只记录终身用药的二元存在,不提供当前剂量/停药时间。
- 纵向复扫:仅 NeuroIMAGE 与部分 WUSTL 受试者提供重复扫描(WUSTL 有 15 人二次会话)[3];因此 ADHD-200 基本是横断面设计,不适合做「纵向变化」的任务,只适合研究发育横截面(跨年龄)。若遇到论文声称用 ADHD-200 做纵向预测,需核查其是否仅利用了横断面年龄信息。
实际含义:若你的研究问题依赖共病/用药,建议在方法学框架中先声明这些字段的高缺失与信息性本质,选择「有记录子样本」或显式建模缺失,而非当作完整的临床协变量全集(§6.5 坑点 5、7)。对多数连接组学/影像分类研究而言,这些字段常被排除,仅以性别、年龄、IQ 为主协变量。
§2.9 术语映射实战:把 DSM-IV 标签对接到现代分类学
写论文或做跨数据集合并时,常需把 ADHD-200 的历史 DSM-IV 亚型与现代 ICD-11/SNOMED 对齐。下面的映射可作速查,但请牢记 ADHD-200 的标签是「2011 年前的临床分组」,映射仅用于检索/合并,不能当作同一诊断实体的证据:
| ADHD-200 字段(DSM-IV) | ICD-11 | 说明 |
|---|---|---|
| ADHD-Combined(ADHD-C) | 6A05.2(混合表现) | 注意缺陷与多动-冲动均显著,DSM-IV 中最常见 |
| ADHD-Inattentive(ADHD-I) | 6A05.0(以注意缺陷为主) | 无显著多动-冲动 |
| ADHD-Hyperactive-Impulsive(ADHD-HI) | 6A05.1(以多动-冲动为主) | 最少见;ADHD-200 中样本极少 |
| 典型对照(TDC) | 无 | 各站点排除精神疾病后招募 |
跨数据集(如把 ADHD-200 与 ABIDE 对照、或与现代 DSM-5 研究合并)时,除亚型外还需注意诊断流程差异:ADHD-200 无 ADOS/ADI-R 类「自闭症确认工具」,它的「对照」是「无 ADHD/无精神疾病」而非「无任何神经发育状况」——若你把 ADHD-200 对照当作通用健康对照用于跨疾病比较,需谨慎(§7.5)。术语映射应始终在论文 Methods 里以一张表写明,避免读者/下游误判你的亚型定义。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小/形式 | 理由 |
|---|---|---|---|
| 快速跑功能连接分类 baseline | ADHD-200 Preprocessed(Athena,CC200 ROI 时间序列) | 每受试者 tab-delimited .1D,约 0.5-2 MB | 免去本地 fMRI 预处理,直接拿到 200 个 ROI 时间序列 |
| 复现竞赛 62.52% 表型基线 | 原始表型 CSV + 测试子集表型(含诊断) | 数 KB CSV | 含 age/sex/handedness/IQ/站点列,可复现 Alberta 队 logistic 分类 |
| 需要自定义预处理(ICA、fmriprep) | 原始 NIfTI(NITRC 官网逐站 tar.gz) | 数 GB 至数十 GB | 完整 4D 原始数据 + T1,自由控制每一步 |
| 深度学习/体数据建模 | ADHD-200 Preprocessed(NIAK ROI1000/ROI3000)或自预处理 | BIDS 风格 / .mat | NIAK 高分辨率分区适合深度连接组学 |
| 复现 Craddock 分区或神经科学 | Athena ICN/fALFF/ReHo + Burner GM 图 | .nii.gz 逐受试者 | 结构衍生完整,可直接做 VBM/连接图分析 |
§3.1 模态详情
- 静息态 fMRI(核心模态):每名受试者一次 rs-fMRI 扫描(睁眼/闭眼、时长与 TR 因站点而异);ADHD 与对照指令与注视条件差异需在分析中核对。数据未经统一 scrubbing,头动伪差需自行处理(§6.5 坑点 2)。NeuroIMAGE 为任务态兼容口径部分;多数学者聚焦静息态连接。
- T1 加权结构像:每名受试者一卷高分辨率结构扫描,用于空间配准、灰质 VBM、颅内体积与皮层特征提取;部分站点存在早期 x/z 维度颠倒(已官方修正)[7]。
- 表型数据:单文件 CSV(可按站点下载),含诊断状态、DSM-IV 亚型、ADHD Measure/Index、Inattentive/Hyper-Impulsive 分量、扫描年龄、性别、利手、IQ Measure/VIQ/PIQ/FIQ、Secondary Dx、Med Status 等 [3][12]。
- QC 标记:训练集附初步 rs-fMRI 质量评估(usable vs questionable,基于视觉时间序列检查)[1];Preprocessed 进一步提供逐受试者质量衍生。
§3.2 按子集样本数表
| 子集 | 人数 | ADHD | 对照 | 备注 |
|---|---|---|---|---|
| ADHD-200 Sample 训练集 | 776 | 285 | 491 | 2011-03-01 发布,8 中心 [1][10] |
| ADHD-200 竞赛测试集(发布) | 197 | —(无标签) | — | 2011-07-01 发布,6 站点 [1] |
| 测试集通过 QC | 172 | — | — | 视觉检查 + 最大欧氏位移 <4mm [2] |
| 测试集有公开标签 | 171 | 77 | 94 | 剔除 Brown 26 名未标受试者 [10] |
| 常用三中心外推测试口径 | 162 | 73 | 89 | 再剔除 Pitt/WashU(其训练集全对照)[11] |
| Neuro Bureau 处理全样本 | 973 | 362 | 585(+26 未知) | 585 TDC + 362 ADHD + 26 未知 [3] |
§3.3 数据格式表
| 数据类型 | 格式 | 组织方式 | 获取渠道 |
|---|---|---|---|
| 原始影像 | NIfTI(.nii.gz) | 按中心/受试者 tar.gz 分包 | fcon_1000 官网 ADHD-200 页面逐站下载 |
| 表型 | CSV | 单文件宽表(可逐站合并) | 官网表型文件 / data-indi-adhd200 mirror phenotypic.csv |
| 预处理衍生(Athena) | .nii.gz(体指标)+ .1D/.txt(ROI 时序) | pipeline × derivative 目录 | Preprocessed GitHub/NITRC/S3 |
| 预处理衍生(Burner) | .nii.gz 灰质密度图 | VBM 衍生物目录 | Preprocessed GitHub/NITRC |
| 预处理衍生(NIAK) | .mat/.nii(ROI1000/ROI3000 时序) | pipeline 目录 | Preprocessed GitHub/NITRC |
| 汇总 + QC | CSV | phenotypic + qc.tsv | data-indi mirror / Preprocessed |
§3.4 存储大小
ADHD-200 官方未发布统一总体积;实际取决于获取范围:全量原始 NIfTI(4D rs-fMRI + T1 × 973 人)为数 GB 至数十 GB 量级;社区最常用的「Athena CC200 ROI 时间序列」全样本仅约数百 MB;体指标(fALFF/ReHo/ICN/GM)逐受试者 .nii.gz 合计约数 GB。建议按需下载所需中心与衍生(§6.2 给出代码),避免整桶同步。data-indi/adhd200 GitHub 镜像以 release asset 分包(2025-11-21,972 个资产)[7]。
§3.5 标注方式
- 诊断分组(DX/DIAGNOSIS):人工临床标注。各站点按 DSM-IV 标准诊断,分 ADHD-Combined / ADHD-Inattentive / ADHD-Hyperactive-Impulsive 亚型;对照组按本地排除标准筛查 [1]。
- 症状严重度(ADHD_Index 等):ADHD-RS 或 CPRS-LV 量表人工评定结果,缺失随站点工具选择而异 [12]。
- IQ:WISC-IV / WASI / WISCC-R 测量结果,多数对照站点未测 FIQ(信息性缺失)[12]。
- 质量标注:训练集官方给出 usable/questionable 初步 QC;Preprocessed 附带逐受试者质量衍生 [1][3]。
§3.6 标注者资质与一致性
诊断由各站点临床医师/研究团队按 DSM-IV 做出,多经本地结构化临床访谈确认;因数据为回顾性汇聚,各站点确诊流程、量表版本与纳入标准不统一,ADHD-200 汇聚时未做跨站点标注一致性重测或 κ 统计的公开发布。ADHD-I 与 ADHD-C 的切分在缺乏统一结构化访谈的站点间可能系统性漂移(§7.2)。使用亚型标签做精细建模时应显式承认此不确定性。
§3.7 采集周期
各中心为既有数据回顾性贡献,采集时间分布于 2005-2011 年区间(无统一采集窗口);NeuroIMAGE 为纵向病例对照样本(原 NeuroIMAGE 研究),其余多为横断面便利样本。2011-03-01 训练集统一发布,2011-07-01 测试集补充发布 [1][2]。
§3.8 地域覆盖
- 北美洲:美国 6 家(Brown、KKI、NYU、OHSU、Pittsburgh、WashU)
- 亚洲:中国北京(北京大学,PKU,分 Peking_1/2/3 子中心)
- 欧洲:荷兰(Donders 研究所 / NeuroIMAGE 样本)
- 8 家独立中心横跨 3 大洲,构成 ADHD-200 多站点/跨地域/跨扫描仪的异质性来源(详见 §7.1)。
§3.9 设备规格
官方未提供逐受试者统一设备表,但各中心扫描仪厂家(GE/Philips/Siemens)与场强(以 3T 为主,含 1.5T)不一,TR、体素、时长、静息态指令(睁眼/闭眼/注视)各异,neurobureau/wiki 及 Neuro Bureau Preprocessed 文档逐站列出结构/功能采集参数 [3]。这构成 ADHD-200 最大的域偏移来源(§6.5 坑点 1);具体到受试者级的扫描参数需从站点原 DICOM/NIfTI header 读取,原始表型不含。
§3.10 深度溯源链
数据采集于各站点既有研究项目(含 NeuroIMAGE 等纵向项目)→ 各站点本地 IRB 批准并 HIPAA 去标识(去面部/去 PHI)→ 提交 INDI → 1000 Functional Connectomes Project 基础设施汇聚与重新组织 → NITRC 发布(tarball + NITRC-IR 双渠道)→ 竞赛(训练 776/测试 197)→ Neuro Bureau 另建 ADHD-200 Preprocessed 处理管线 → 官方记录并修正两批数据错误(2011-04-11 结构、2011-07-01 表型)[7]。2025-11-21 data-indi 团队将数据重新组织为 BIDS 风格镜像并发布 [7]。诊断标签的「金标准」始终是各站点 DSM-IV 临床判断,无独立活检或客观金标准——这是神经影像分类不可回避的局限。
§3.11 站点采集差异与受试者级元数据
多中心数据的真实复杂程度,往往无法用一张「模态」表表达,而藏在每站的扫描协议细节里。Neuro Bureau 的 ADHD-200 Preprocessed 文档([3] 的 Table 2/Table 3)逐站列出了结构像与功能像采集参数,这里抽取最具分析影响度的差异维度:
| 维度 | 站点间差异范围(典型) | 对下游的影响 | 处理建议 |
|---|---|---|---|
| 扫描仪厂家/场强 | GE / Philips / Siemens;以 3T 为主,含 1.5T | 图像对比度与几何差异 → 站点捷径 | 站点分组 CV(LOSO) |
| TR(重复时间) | 约 1.5-3.5 秒量级 | 时间分辨率不同,频率滤波有效带宽不同 | 统一带通下限;关注 Nyquist 差异 |
| 静息态时长/时间点数 | 数十至数百帧不等 | 连接矩阵估计精度与稳定性不同 | 设最小帧数门槛(§6.3) |
| 静息态指令 | 睁眼注视 / 闭眼 / 睁眼自由 | 眼动与认知状态影响 DMN 等 | 站点分层;做敏感性分析 |
| 空间分辨率/体素 | 各异(含 4×4×4 等重采样) | MNI 配准与 ROI 平均后的信号 | 用 Preprocessed 统一重采样衍生 |
| 视野覆盖 | 覆盖不全时 ROI 缺失 | 连接矩阵列缺失 | 缺失 ROI 显式编码(§6.5 坑点 3) |
| 结构像方向 | 早期存在 x/z 维度颠倒(已官方修正) | 配准错乱 | 下载现代镜像并核对(§6.5 坑点 8) |
一个重要提醒:ADHD-200 的官方表型文件本身不含受试者级扫描参数列——你要拿到 TR、体素、时长等,只能回读各受试者 NIfTI header 或 Neuro Bureau 文档。因此「受试者级扫描参数是否可作为协变量」取决于你能否自行从影像 header 抽取,而非表型直接给出。这让跨站点比较时,最稳妥的起点是直接使用已统一重采样到 MNI 的 Preprocessed 衍生(Athena/NIAK),它们已把站点间几何/分辨率差异抹平了一部分(§3.0 抉择矩阵)。
§3.12 获取后的自检清单
下载后正式分析前,建议按清单做一次「完整性 + 一致性」自检,把大多数复现问题扼杀在建模之前(§6.5 坑点 8):
| 检查 | 通过标准 | 若失败 |
|---|---|---|
| 受试者数 | 训练 776 / 测试有标签 171 | 重新核对表型与拆分列(§5.8) |
| SUB_ID 去重 | 无跨 train/test 的 SUB_ID | 查二次会话与拆分 bug(§5.3) |
| 时间序列文件 | 每 FILE_ID 均有对应 .1D,且帧数 ≥20 | 补下载缺失中心(§6.2) |
| 缺失统一 | 无空串/n/a 混入数值列 | 跑 §6.3 清洗脚本 |
| 站点映射 | Peking_1/2/3、NYU_part1/2 映射到标准中心 | 建站点枚举映射表(§4.6) |
| 结构像方向 | 复现时用现代镜像 | 核对版本与 commit(§6.5 坑点 8) |
| 测试口径 | 明确 171(或 162)并写入日志 | 重跑划分,记录剔除逻辑(§5.8) |
把这张表做成一个可执行的 verify() 脚本放进仓库,能极大提升 ADHD-200 工作的可复现性与团队协作质量(§6.10 受试者级泄漏门禁)。
§4 数据结构
§4.0 目录树
以 ADHD-200 Preprocessed(Neuro Bureau,Athena CC200 口径)与官方表型混合结构为例,data_root 解压后预期如下:
adhd200_root/
├── phenotypic/ # 官方表型(训练/测试)
│ ├── ADHD200_All_AgeGroups_RAW_2.txt # 全量含诊断(官方原始)
│ ├── ADHD200_All_AgeGroups_RAW_2.csv # 便捷 CSV
│ ├── ADHD200_All_AgeGroups_TEST_RAW_2.txt # 测试含诊断(赛后)
│ └── qc.tsv # data-indi 镜像 QC 汇总(可选)
├── data_archives/ # 官网逐站原始 NIfTI tar.gz(可选下载)
│ ├── Peking_1/ Peking_2/ Peking_3/
│ ├── NYU_part1/ NYU_part2/
│ ├── KKI/ OHSU/ NeuroIMAGE/ Pitt/ WashU/ Brown/
├── preprocessed/ # ADHD-200 Preprocessed 衍生
│ ├── Athena/ # AFNI+FSL,nuisance 回归(WM/CSF/运动)
│ │ ├── cc200_roi_timeseries/ # <SITE>/<SUBID>_cc200_roi_timeseries.1D
│ │ ├── cc400_roi_timeseries/
│ │ ├── aal_roi_timeseries/ harvardoxford_roi_timeseries/
│ │ ├── alff/ falff/ reho/ icn_maps/ # 体指标
│ │ └── func_preproc_4d/ # 4D BOLD(可选)
│ ├── NIAK/ # ICA 去噪,CBRAIN
│ │ ├── roi1000_timeseries/ roi3000_timeseries/
│ ├── Burner/ # SPM8/DARTEL VBM 灰质密度图
│ │ └── grey_matter_maps/
注:各镜像对目录命名略有差异;FILE_ID 通常为 SITE_SUBID(如 Peking_1_0023442)。data-indi/adhd200 镜像提供标准化 phenotypic.csv 与 qc.tsv,可直接对齐受试者级。
§4.1 DAIMS 8 列字段字典
表型核心字段(以官方 ADHD200_All_AgeGroups 系列为准,含 data-indi 清洗镜像)[12]:
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SUB_ID | 整数 | 受试者唯一标识 | 9750801 | 主键/受试者去重 | 无 | 无 | 站点内唯一 |
| DX | 整数 | 诊断分组 | 0/1 | 分类标签 | 亚型切分站点间漂移 | 测试集无标签用 NaN/空 | 0=对照、1=ADHD |
| DX_GROUP 或 DIAGNOSIS | 文本/整数 | DSM-IV 亚型 | ADHD-Combined | 三分类标签 | 亚型不稳定 | 对照无亚型 | Control/ADHD-C/ADHD-I/ADHD-HI |
| ADHD_Measure | 整数 | 所用症状量表 | 1 | 量表分层的分组列 | 站点工具不一 | 部分缺失 | 1=ADHD-RS、2=CPRS-LV |
| ADHD_Index | 浮点 | 症状严重度(分) | 40.5 | 连续回归目标 | 跨量表不互等 | 缺失率高 | 依量表 0-100+ |
| Inattentive / Hyper_Impulsive | 浮点 | 分量维度分 | 18/12 | 亚型相关回归 | 跨量表不互等 | 缺失 | 依量表 |
| AGE_AT_SCAN | 整数/浮点 | 扫描时年龄 | 11 | 协变量/发育建模 | 无 | 少 | 7-27 |
| SEX | 文本/整数 | 性别 | M/F | 分层/协变量 | 历史字段错误(已修) | 少 | M/F |
| Handedness | 整数 | 利手 | R | 协变量 | 无 | 部分缺失 | R/L/A |
| IQ_Measure | 整数 | 智力量表 | 1 | 量表分层 | 量表版本不一 | 部分缺失 | 1=WISC-IV、2=WASI、3=WISCC-R |
| Verbal_IQ / Performance_IQ / Full4_IQ / Full2_IQ | 浮点 | VIQ/PIQ/FIQ | 109/103/112 | 认知协变量 | 量表版本差异 | Full2 IQ 缺失 92.7% | 依量表 |
| Med_Status | 文本 | 用药状态 | No | 混杂控制 | 记录不完备 | 973 中缺失 42% | Yes/No |
| Secondary_Dx | 文本 | 共病诊断 | None | 异质性控制 | 记录不完备 | 973 中缺失 71.5% | 文本 |
§4.2 标签分布
三分类(对照 / ADHD-C / ADHD-I / ADHD-HI)在可用有标签训练子集内的分布随口径略有差异;多数学者采用 776 全训练(对照 491)并聚焦 ADHD-C 与 ADHD-I。NeuroIMAGE/KKI/PKU 等中心 ADHD-I 相对充足,而 ADHD-HI 在多数中心为 0-6 例,几乎不可独立建模——实践上把 ADHD-HI 并入 ADHD 或剔除(§6.5 坑点 4)。具体中心级标签分布见 §2.4 表与 Neuro Bureau Table 1 [3]。
按亚型做一个粗略分布概览(训练集,776 口径;源自 §2.4 表与多来源汇总 [3][10]):
| 亚型 | 相对规模 | 代表性中心 | 建模建议 |
|---|---|---|---|
| ADHD-Combined(ADHD-C) | 最多(约占 ADHD 一半以上) | NYU、OHSU、NeuroIMAGE | 三分类主要对象 |
| ADHD-Inattentive(ADHD-I) | 次多 | PKU、NYU、KKI | 可独立建模 |
| ADHD-Hyperactive-Impulsive(ADHD-HI) | 极少(0-6 例/中心) | 各中心 | 并入 ADHD 或剔除(§6.5 坑点 4) |
| 典型对照(TDC) | 491 | 所有中心 | 二分类阴性类 |
需注意亚型分布在中心间高度不均匀——NYU 以 ADHD-C 为主而 PKU 有较多 ADHD-I,因此「三分类 vs 二分类」的选择会与站点混淆;跨中心比较亚型判别性能时务必同时控制站点(§7.1)。
§4.3 关键统计
- 年龄均值(训练集):11.99 ± 3.21 岁(PKU 11.98 ± 1.86、NeuroIMAGE 16.99 ± 2.71、OHSU 8.83 ± 1.12 等)[10]
- 性别:训练集男性 484 / 女性 291(约 62% 男性)[10]
- IQ 差异:训练集 FIQ TDC 约 114 vs ADHD 约 106(p<0.001);测试集 113 vs 103 [1]
- 头动:ADHD 组头动系统性更高(hyperkinetic 人群典型现象),需用运动统计量作协变量或剔除 [3][13]
- 缺失:FIQ(Full2)缺 92.7%、Secondary Dx 缺 71.5%、Med Status 缺 42%(973 口径)[12]
解读这些统计的实践含义:① 年龄跨中心差异极大(NeuroIMAGE 偏大、OHSU 偏小),做年龄匹配/协变量前先把年龄中心化并按站点分层;② IQ 的组间显著差异意味着「以 FIQ 为协变量的连接差异」可能部分只是 IQ 效应——影像分类若要剥离表型,须用 IQ 作协变量并报告纯影像 vs 影像+表型(§6.5 坑点 6);③ 高字段缺失提醒你把表型列当作「可用性不一」的稀疏矩阵而非完整协变量集(§4.5)。
§4.4 数据层级
受试者(SUB_ID)→ 站点(SITE)→ 检查会话(Session,NeuroIMAGE/WUSTL 部分受试者二次会话,WUSTL 有 15 人二次扫描)→ 序列(rs-fMRI 4D BOLD、T1 3D)→(预处理后)体素时间序列 → ROI 时间序列(Athena/NIAK)。绝大多数分析落在「ROI 时间序列 → 功能连接矩阵(n×n)→ 上三角向量 → 分类器」这一浓缩链路。
这条链路的每个「节点」都可能出错:站点段误拆成不同中心(§4.6)、二次会话未去重造成泄漏(§5.3)、T1 与 rs-fMRI 来自不同会话导致配准不一致(需核对该 SUB_ID 是否有双会话)。一个稳健的实践是始终以 SUB_ID 为受试者级最小单元,所有派生特征(连接矩阵、灰质体积)都按 SUB_ID 聚合后再进入下游,任何下游操作都不得越过受试者边界。
§4.5 缺失值 + 信息性缺失编码表
| 字段 | 缺失程度 | 缺失性质 | 处理建议 |
|---|---|---|---|
| Full2_IQ | 92.7% 缺失(973 口径) | 信息性:多为未测 IQ 的对照/非测试样本 | 保留 ADHD Measure 分组;用 FIQ 作协变量需先过滤 |
| Secondary_Dx | 71.5% 缺失 | 信息性:站点未系统采集共病 | 弃用或仅子样本分析(§6.5 坑点 7) |
| Med_Status | 42% 缺失 | 记录不完备 | 作二元混杂控制需谨慎;缺失不等于未用药 |
| ADHD_Index 等量表 | 随站点/ADHD Measure 缺失 | 结构性:对照常无 ADHD-RS 完整分 | 区分「没测」与「缺失」 |
| 测试集 DX | 26 名 Brown 未公开 | 结构性 | 用 171 名有标签测试子集 |
§4.6 FILE_ID 与多源对齐
各渠道对受试者标识的命名不统一,是复现时最常见的地雷之一(§6.5 坑点 8)。官方 NITRC 表型与 Neuro Bureau Preprocessed 常用 FILE_ID(形如 Peking_1_0023442,前缀为站点段 + 补零数字),而原始 tarball 与 data-indi 镜像可能用纯 SUB_ID 或重排后的目录层级。对齐时遵循三条原则:
# 1) 优先以受试者级数字 ID 为主键,FILE_ID 可逆解析
# FILE_ID 规则通常为:<SITE段>_<受试者补零ID>
fid = 'Peking_1_0023442'
site_part = fid.rsplit('_', 1)[0] # 'Peking_1'
sub_num = fid.rsplit('_', 1)[1] # '0023442'
# 2) 训练与测试各自去重后再合并,避免跨 split 重复
train_ids = set(train_phen['SUB_ID']); test_ids = set(test_phen['SUB_ID'])
assert train_ids.isdisjoint(test_ids), 'train/test 存在受试者级重叠(泄漏)!'
# 3) 跨源(官方/Neuro Bureau/data-indi)merge 前,先核对列并集与每行是否一一对应
merged = train_phen.merge(preproc_meta, on='SUB_ID', how='inner', validate='one_to_one')
站点段本身也随分发变化——官方用 Peking_1/Peking_2/Peking_3 与 NYU_part1/NYU_part2,而部分镜像用 PKU/NYU。做站点级分层(LOSO)前,务必把「文件里的站点段」映射到你自己的标准站点枚举,否则会误把 Peking_1/2/3 当成三个不同站点拆分测试(它们属同一北京大学中心,跨子段拆分相当于无意的受试者-站点泄漏)。
§5 划分与使用建议
§5.1 官方划分
ADHD-200 提供唯一的官方划分:训练 776(2011-03-01,有标签)与留出测试 197(2011-07-01,盲评无标签)[1]。竞赛后官方公布了测试子集诊断标签,形成当前「训练 776 + 测试有标签 171(剔除 Brown 26)」的社区标准口径 [10]。此划分天然支持「在训练上拟合、在留出测试上报告」的诚实评估协议。
§5.2 社区惯例划分
- 留出测试评测:用官方训练 776 拟合,在测试 171(或 162)上报告——最接近竞赛协议。
- LOSO(leave-one-site-out):训练内留一站点做测试,衡量跨站点泛化,是比随机 k 折更诚实的做法(§6.5 坑点 1)。
- 站点内 / 单中心 CV:只在 PKU、NYU 等大站点内做 CV 可获更高精度,但无法外推,且会学进站点协变量(§7.1)。
§5.3 泄漏风险(重点)
- 受试者级重复:WUSTL 15 名受试者有二次扫描会话,随机划分会把同一人拆进训练与测试 → 信息泄漏。训练/测试必须落在 SUB_ID 级,用会话/重复结构去重。
- 表型特征泄漏:把站点、年龄、性别、IQ 当输入特征会系统性夸大精度——Alberta 队仅用这些表型即达 62.52%,高于多数影像模型(§6.5 坑点 6)。若研究「影像是否优于表型」,表型只能作为对比基线或分层,不能混入影像模型再宣称影像贡献。
- 测试子集口径漂移:报告精度时必须写清测试样本数(171/197/162 对应不同剔除),否则数字不可直接比较(§8)。
- 亚型标签泄漏:对照无亚型;三分类须防模型用「是否被评 ADHD-RS」学亚型。
§5.4 交叉验证建议
- 首选 LOSO 或「站点感知分层 k 折」(每组不跨站点),在训练内用二次分层保持 ADHD/对照比例。
- 若用随机 k 折,务必在同一 SUB_ID 去重后进行,并同时报告按站点透视精度,检查是否存在站点捷径(§6.5 坑点 1)。
§5.5 外部验证建议
在官方留出测试子集(171)上报告是对齐竞赛的最简外部验证;进一步可在 ABIDE 等(同为 INDI 生态、CC200 分区相通)上做跨疾病/跨站点迁移,验证特征与管线是否只在 ADHD-200 上成立(§7.8)。
§5.6 划分代码骨架
import numpy as np, pandas as pd
# 假设 df 已含每行 SUB_ID / SITE / DX / ADHD subtype
# 1) 受试者级去重:WUSTL 二次会话只保留该 SUB_ID 首次
df = df.sort_values('SUB_ID').drop_duplicates('SUB_ID')
# 2) 站点感知分层拆分(示例:训练/测试由官方划分决定,此处仅站内 CV)
sites = df['SITE'].values
# LOSO 单折
test_site = 'PKU'
trn = df[df['SITE'] != test_site]; tst = df[df['SITE'] == test_site]
# 3) 二分类标签:对照=0,其余 ADHD 亚型合并=1(与多数基准一致)
y_trn = (trn['DX'] == 1).astype(int).values
y_tst = (tst['DX'] == 1).astype(int).values
print('train', len(trn), 'test', len(tst), 'pos_rate', y_trn.mean().round(3))
§5.7 划分策略纵深对比与选择
下表汇总 ADHD-200 最常见的四种评估策略及其诚实程度,帮你选一个「既可信又可发表」的协议:
| 策略 | 做法 | 诚实度 | 何时用 | 何时别用 |
|---|---|---|---|---|
| 官方留出测试 | 训练 776 → 测试 171/162 | 高 | 对齐竞赛、发表口径明确 | 测试样本有限、调参需训练内再拆 |
| LOSO | 训练内留一站点 | 高 | 衡量跨站点泛化 | 站点内疾病率极端(全对照站点)需谨慎 |
| 站点感知分层 k 折 | 每折不跨站点 | 中高 | 训练内调参与热启动 | 不能替代官方留出测试报告 |
| 随机 k 折(全样本) | 任意切分 | 低 | 极早期 sanity check | 作为对外宣称的主指标(会虚高) |
实践中建议:主数字用「官方留出测试」,方法学讨论补充「LOSO」,并在两者都给出按站点透视表。若论文需要更多测试样本用于统计分析,可在训练内做站点感知分层折并明确标注「非官方口径」。
§5.8 关于「测试子集三口径」的更细说明
ADHD-200 的留出测试子集在文献里有三种常见样本量,容易造成报告混乱,这里一次讲清(§6.5 坑点 7 的延伸):
| 口径 | 样本量 | 剔除逻辑 | 代表用法 |
|---|---|---|---|
| 197 | 全部发布测试 | 含 Brown 26 名未标(评测时无法评分) | 竞赛原始发布口径 |
| 171 | 197 − 26 未标 | 仅剔除无标签的 Brown 站点 | 多数影像基准(Springer 2025 复现表)[10] |
| 162 | 171 − Pitt(9) − WashU(0) | 再剔除训练集全对照的站点 | ASTNet 等聚焦「病例/对照都来自 5 站」的研究 [11] |
为什么会有第 3 种?Pitt 与 WashU 的训练集全部是典型对照(§2.4),若你的训练集与测试都来自这些「无 ADHD 病例」站点之外的子集,报告时剔除它们能让「训练/测试的站点构成更一致」。但注意:这三种口径的阳性率先验不同,直接比较 accuracy 会失真。写作时请在 Methods 明确写出你用哪一种(如「官方留出测试 171 名,剔除了 26 名未标 Brown 受试者」),并用 balanced accuracy 降低类别先验影响(§8.3)。
§6 AI 就绪指南
§6.0 云端快速启动(可选)
若本地无 NIfTI/Matlab 环境,可直接使用 ADHD-200 Preprocessed 的 Athena CC200 时间序列(纯文本 .1D),配合 numpy/scikit-learn 即可端到端完成基线,无需影像学预处理栈。以下 §6.1-§6.4 均假设此最小可用子集。
§6.1 快速上手
目录结构预期(见 §4.0):data_root/preprocessed/Athena/cc200_roi_timeseries/<SITE>/<FILE_ID>_cc200_roi_timeseries.1D,每文件为 (n_timepoints, 200) 制表符分隔时间序列;data_root/phenotypic/<csv> 为每行一受试者的表型宽表,含 FILE_ID/SITE/DX 等列。
data_root 拼接关系:data_root 指向你解压到的 adhd200_root/,代码据此拼出时间序列目录与表型路径。最小可用子集 = 训练集 + 有标签测试子集(可只下载 PKU/NYU/KKI 等大中心的 Athena CC200)。
# 1) 安装依赖
# pip install numpy scipy scikit-learn pandas
# 2) 下载 Preprocessed CC200 时间序列与官方表型(§6.2 给出渠道示例)
# 3) 建立本地目录结构:data_root/preprocessed/Athena/cc200_roi_timeseries/ 与 data_root/phenotypic/
import os, numpy as np, pandas as pd
DATA_ROOT = '/path/to/adhd200_root' # data_root 拼接基座
PHEN = os.path.join(DATA_ROOT, 'phenotypic', 'phenotypic.csv') # data-indi 清洗镜像
TS_DIR = os.path.join(DATA_ROOT, 'preprocessed', 'Athena', 'cc200_roi_timeseries')
df = pd.read_csv(PHEN)
# 关键列是否齐备
assert {'FILE_ID','SITE','DX','SUB_ID'}.issubset(df.columns)
def load_ts(fid):
p = os.path.join(TS_DIR, fid.split('_')[0], f'{fid}_cc200_roi_timeseries.1D')
return np.loadtxt(p) # (T, 200)
# 示例:加载一个样本
X0 = load_ts(df['FILE_ID'].iloc[0])
print('sample timepoints x ROIs:', X0.shape)
§6.2 数据获取
| 渠道 | 内容 | 是否需登录 | 备注 |
|---|---|---|---|
| fcon_1000 官网 ADHD-200 页 | 原始 NIfTI + 官方表型(逐站 tar.gz) | NITRC 账号 | 历史主渠道;含分中心目录与表型图例 |
| ADHD-200 Preprocessed GitHub | Athena/Burner/NIAK 衍生 + CC200/CC400 | 免登录(GitHub) | 含下载说明与 S3 桶 |
| data-indi/adhd200 GitHub(2025-11) | BIDS 风格镜像 + phenotypic.csv + qc.tsv | 免登录 | 现代最简入口,release asset 分包 |
| NITRC-IR | XNAT 按表型搜索下载影像 | NITRC 账号 | 早期渠道 |
# 示例:用 git/gh 拉取 data-indi/adhd200 清洗表型(或以官网 CSV 替代)
# curl -L -o phenotypic.csv https://github.com/data-indi/adhd200/raw/main/.../phenotypic.csv
# 示例:wget 下载单中心 Athena CC200 时间序列(URL 以实际 release asset 为准)
# wget <release_asset_url>/PKU_cc200_roi_timeseries.tar.gz && tar -xzf ...
下载流程分步(推荐顺序):
- 获取表型与标签:从官方表型(
ADHD200_All_AgeGroups系列)或 data-indi 镜像的phenotypic.csv拉取诊断/亚型/量表列;这是区分训练 776 与测试 171 的唯一依据,务必先下载并核对 SUB_ID。 - 获取功能衍生:从 ADHD-200 Preprocessed(或 data-indi)拉取 Athena CC200 ROI 时间序列;这是最小可用子集,建议只按你需要的中心下载,避免整桶同步(§3.4)。
- 可选:拉取原始 NIfTI:仅当需要自定义预处理或体数据深度学习时才逐站下载 tarball。
- 可选:QC 汇总:若做头动质控,需 Preprocessed/qc.tsv 或自行从 NIfTI header/时序算运动统计量(§6.5 坑点 2)。
账号与许可提示:官方 tarball 下载需注册免费 NITRC 账号(用于下载统计追踪与错误联系);Preprocessed 与 data-indi 渠道免登录。所有数据仅限非商业研究,发布需按 §9.3 引用指南致谢 [3][7]。
§6.3 预处理全流程
使用官方 Athena CC200 时间序列(已做运动校正、nuisance 回归 WM/CSF/运动、带通滤波、MNI 配准 [3])。若使用原始 NIfTI,请自行实现以下环节(此处给出从 CC200 时序构建功能连接矩阵的最小流程,可直接运行):
import numpy as np, pandas as pd
from sklearn.model_selection import train_test_split
def build_connectome(ts):
"""ts: (T, R) ROI 时间序列 -> (R,R) 皮尔逊相关矩阵"""
return np.corrcoef(ts.T)
def upper_triangle(mat):
"""取上三角(不含对角线)作平坦特征"""
iu = np.triu_indices(mat.shape[0], k=1)
return mat[iu]
# 组装:逐受试者读取 -> 连接矩阵 -> 上三角特征
def build_all(df, load_ts):
feats, y, site = [], [], []
for fid, dx, st in zip(df['FILE_ID'], df['DX'], df['SITE']):
ts = load_ts(fid)
if ts.shape[0] < 20: # 时间点数过少跳过
continue
feats.append(upper_triangle(build_connectome(ts)))
y.append(int(dx == 1)); site.append(st)
return np.array(feats), np.array(y), np.array(site)
X, y, site = build_all(df, load_ts)
print('X shape (n, edges):', X.shape, '| 阳性率:', y.mean().round(3))
清洗与质控的工程要点(务必先于建模)
从原始官方表型到可用建模表,建议按下列顺序做清洗,每一步都对应一个真实失败模式(详见 §6.5 坑点 5、8):
import pandas as pd, numpy as np
# 1) 缺失统一:把 NaN / 空串 / n/a / -9999 统一为 np.nan
for c in df.columns:
if df[c].dtype == object:
df[c] = df[c].replace({'': np.nan, 'n/a': np.nan, 'NA': np.nan, 'nan': np.nan})
# 2) ADHD Measure 作分组列,避免跨量表相加(坑点 5)
# 只对 ADHD Measure==1(ADHD-RS)内部做连续 ADHD_Index 建模
# 3) 受试者级去重:二次会话(如 WUSTL)只保留每 SUB_ID 首次(坑点重复行)
df = df.sort_values('SUB_ID').drop_duplicates('SUB_ID', keep='first')
# 4) 标签口径固定:DX==1 为 ADHD;DX_GROUP 亚型(C/I/HI)单独保留
df['y_binary'] = (df['DX'] == 1).astype(int)
# 5) 头动门槛:若 Preprocessed qc.tsv 有 FD/位移列,剔除超标(坑点 2,示例阈值自行定)
# df = df[df['mean_fd'] < 0.2] # 具体阈值按文献与方法节自定
print('清洗后受试者数:', len(df), '| 二分类阳性率:', round(df['y_binary'].mean(), 3))
§6.4 PyTorch DataLoader 完整可运行代码
对需要梯度建模(GNN/深度连接组学)的受试者,推荐在 CC200 连接矩阵上训练;此处给出可从 CC200 ROI 时间序列端到端加载的 PyTorch Dataset 与 DataLoader:
import torch, numpy as np
from torch.utils.data import Dataset, DataLoader
class ADHDConnectomeDataset(Dataset):
"""每受试者一条记录:ROI 时间序列 -> 连接矩阵;标签 0=对照/1=ADHD"""
def __init__(self, df, ts_dir, n_roi=200, transform=None):
self.df = df.reset_index(drop=True)
self.ts_dir = ts_dir
self.n_roi = n_roi
self.transform = transform
def __len__(self):
return len(self.df)
def _load_ts(self, fid):
site = fid.split('_')[0]
path = f'{self.ts_dir}/{site}/{fid}_cc200_roi_timeseries.1D'
return np.loadtxt(path) # (T, 200)
def __getitem__(self, idx):
row = self.df.iloc[idx]
ts = self._load_ts(row['FILE_ID'])
ts = torch.as_tensor(ts, dtype=torch.float32)
ts = ts - ts.mean(0, keepdim=True) # 去均值(简单标准化)
ts = ts / (ts.std(0, keepdim=True) + 1e-6) # 单位方差
C = torch.corrcoef(ts.T) # (200, 200) 连接矩阵
if self.transform is not None:
C = self.transform(C)
y = torch.tensor(float(row['DX'] == 1))
return C.unsqueeze(0), y
# 用法示例
train_ds = ADHDConnectomeDataset(df[df['SITE'] != 'PKU'], TS_DIR)
test_ds = ADHDConnectomeDataset(df[df['SITE'] == 'PKU'], TS_DIR)
train_loader = DataLoader(train_ds, batch_size=32, shuffle=True)
for C, y in train_loader:
print('batch connectome:', C.shape, 'labels:', y.shape)
break
§6.5 坑点(8 个)
⚠️ 坑点 1:跨站点域偏移使随机 k 折精度虚高(分类:评估误用)
问题:ADHD-200 8 个中心扫描仪厂家/场强/TR/协议/静息态指令全部不同,站点与诊断倾向相关;分类器可学到「站点签名」而非疾病信号,随机 k 折会高估精度。
症状:随机 10 折精度明显高于 LOSO 或官方留出测试;按站点透视时某一中心(如数据量最大的 NYU)主导判别;对未见站点测试(2 个未入训练集站点)精度骤降(竞赛:训练内 54.1% vs 未见站点 40.2%)[1]。
解决:
- 简单方法:报告 LOSO 或官方留出测试(171 子集),并把按站点透视精度作为强制附录。
- 进阶方法:训练内做站点感知分层,加入站点作为协变量/线性 SVR 回归掉站点;使用 Z-score 归一化到站点均值为 0、方差为 1。
- SOTA 方法:ComBat/neuroHarmonize 调和,或用对抗域适应/站点感知损失函数,做「调和前后」LOSO 消融(参考 ABIDE 生态的 harmonization 实践)。
参考:https://www.frontiersin.org/articles/10.3389/fnsys.2012.00062/pdf ;https://www.biorxiv.org/content/10.1101/037044v2.full
⚠️ 坑点 2:头动伪差在 ADHD 组系统性更高(分类:偏倚陷阱)
问题:ADHD 是 hyperkinetic 人群,病例组头动显著高于对照组;头动会系统改变连接估计,模型可能学的是「谁动得多」而非疾病本身。
症状:头动指标(如 RMS displacement、FD)在 ADHD/对照间差异显著;加入头动协变量后精度下降或特征重要度排序剧变;做不做 scrubbing 结论不同 [13]。
解决:
- 简单方法:至少把某种运动统计量(如平均 FD 或 RMS deviation)作为组水平协变量,或剔除 FD 超标受试者。
- 进阶方法:scrubbing 高 FD 时间帧 + 报告 scrub 后保留时长;用 ICA-AROMA / NIAK 的 ICA 去噪衍生(NIAK 已内建 ICA 结构化噪声衰减)[3]。
- SOTA 方法:在个体层将运动建模为连续协变量并纳入受试者级预测(如运动感知的深度模型),并做头动-结果敏感性分析。
参考:https://www.biorxiv.org/content/10.1101/037044v2.full ;https://link.springer.com/article/10.1038/s43856-025-01015-1
⚠️ 坑点 3:管线/预处理选择改变功能连接结论(分类:预处理陷阱)
问题:ADHD-200 Preprocessed 的 Athena(nuisance 回归运动/WM/CSF)、NIAK(ICA 去噪)等采用不同哲学,ROI 定义(AAL/CC200/CC400/ROI1000)也异;选择不同 pipeline 与图谱,连接矩阵与分类精度可能明显不同,且无官方「最好」答案 [3]。
症状:同一分类器在不同 Preprocessed 管线/图谱下精度与特征排序不同;与文献比较时因对方用不同 pipeline 而无法复现。
解决:
- 简单方法:固定使用 CC200 + 一个主流策略(如 Athena 或后续 C-PAC),并写清版本。
- 进阶方法:做 pipeline/图谱敏感性分析,报告跨配置的精度区间;优先引用所仿 pipeline 论文。
- SOTA 方法:用多图谱多管线集成或做稳健性检验,结论须对合理预处理变化稳健。
参考:https://preprocessed-connectomes-project.github.io/adhd200 ;https://www.biorxiv.org/content/10.1101/037044v2.full
⚠️ 坑点 4:ADHD-HI 亚型样本极少,三分类不稳(分类:标签理解)
问题:ADHD-Hyperactive-Impulsive 在多数中心仅 0-6 例(见 §2.4 标签分布),独立建模几乎不可行,却常被混入三分类任务造成类别失衡与方差爆炸。
症状:三分类时 ADHD-HI 类 F1 极低或无法收敛;报告的「三分类精度」实质依赖把 HI 并入 ADHD 或剔除的口径。
解决:
- 简单方法:把 ADHD-HI 并入 ADHD(二分类)或显式剔除并注明;多数基准只建模 ADHD-C、ADHD-I 与对照 [11]。
- 进阶方法:报告多分类时同时给二分类结果与按亚型分层 F1,避免被总体精度掩盖。
- SOTA 方法:将亚型当作有序/多标签或分层目标建模,或只在子样本(如只 ADHD-C vs ADHD-I)内做亚型判别。
参考:https://pmc.ncbi.nlm.nih.gov/articles/PMC10312905 ;https://www.nature.com/articles/s43856-025-01015-1
⚠️ 坑点 5:原始表型缺失与量表混用陷阱(分类:工程陷阱)
问题:表型 FIQ(Full2)缺失 92.7%、Secondary Dx 缺失 71.5%、Med Status 缺失 42%;ADHD Measure 分 ADHD-RS(1)与 CPRS-LV(2)两种不同量表,IQ 也分 WISC-IV/WASI/WISCC-R,字段缺失多为「没测/结构性」,混用会污染建模 [12]。
症状:把缺失硬填 0 或整行删除引入偏倚;把 ADHD-RS 与 CPRS-LV 的 ADHD Index 直接相加当回归目标(量纲不互等);FIQ 作协变量时因 92.7% 缺失而样本崩塌。
解决:
- 简单方法:ADHD Measure 作分组列、只对同量表内部做连续建模;FIQ 先过滤有值子集。
- 进阶方法:把「缺失」显式编码为类别并当作信息性缺失建模(§7.7 检查项 10),或用量表内插补而非跨量表。
- SOTA 方法:对高缺失字段选择性地建模,或联合建模缺失机制,避免删除偏差。
参考:https://pmc.ncbi.nlm.nih.gov/articles/pmid/39962416/
⚠️ 坑点 6:表型/人口学可预测诊断,会夸大影像贡献(分类:偏倚陷阱 / 评估误用)
问题:竞赛实测仅用站点/年龄/性别/利手/IQ 的 logistic 分类即达 62.52% 的最高精度与 124/195 的最高分,优于多数影像模型——把 IQ 等强混淆特征混进影像模型会系统性高估「影像判别力」[6]。
症状:影像特征重要度前几名是年龄/IQ/站点相关特征;宣称「影像达 X%」但未对照表型基线;跨年龄分层后影像精度骤降。
解决:
- 简单方法:把表型-only 模型作为强制对照基线,报告影像相对表型的增量(竞赛已证表型基线近 60%-62%)。
- 进阶方法:在受试者级将年龄/IQ/性别作为协变量回归后,再评估纯影像信号;或用匹配样本。
- SOTA 方法:做「影像增量」消融,诚实区分「影像+表型」与「纯影像」的贡献(后续研究组合可达 65% vs 表型 59.6%)[6]。
参考:https://www.ncbi.nlm.nih.gov/pubmed/23060754/ ;https://www.nature.com/articles/tp2017164.pdf
⚠️ 坑点 7:跨中心 CV 易过拟合,测试口径混乱(分类:评估误用)
问题:Pitt/WashU 训练集全为对照(§2.4),随机划分会把「站点全对照」当信号;且测试子集口径有 197/172/171/162 多种(Brown 未标、Pitt/WashU 剔除),报告精度不清口径即不可比较。
症状:不同论文报 60%、55%、65% 等精度却无法对齐;某些模型在含全对照站点的随机折上精度虚高。
解决:
- 简单方法:固定用官方训练 776 + 测试 171(或标注剔除策略的 162),并在方法节写明剔除哪些站点/受试者。
- 进阶方法:报告 LOSO + 官方留出双口径,检验一致性。
- SOTA 方法:把站点当作分组做站点级 CV,避免全对照站点与疾病站点混排;报告每个站点的敏感性/特异性。
参考:https://pmc.ncbi.nlm.nih.gov/articles/PMC11169645/ ;https://link.springer.com/article/10.1038/s43856-025-01015-1
⚠️ 坑点 8:历史数据修正与新镜像混用导致复现不一致(分类:工程陷阱)
问题:ADHD-200 官方在发布后记录了两批修正——2011-04-11 结构像 x/z 维度颠倒(73 名受试者,涉 Peking_1/NYU_part2/OHSU)与 2011-07-01 表型错误(49 名受试者性别或 IQ);早期下载或非官方镜像可能保留未修正版本,2025 年起的 data-indi 镜像又重排了目录结构,新旧混用会引发复现失败 [7]。
症状:同一 SUB_ID 在不同渠道得到不同结构像方向或表型值;复现论文时对不上 FILE_ID;目录层级(Peking_1 vs PKU)命名不一致。
解决:
- 简单方法:统一从现代镜像(data-indi/adhd200,phenotypic.csv 已并入修正)或官方最新 tarball 获取,避免混用旧版。
- 进阶方法:下载后核对结构像方向(x/z)与受试者数(776/171),跑
qc.tsv与表型一致性断言。- SOTA 方法:在方法节记录数据来源渠道与版本指纹(git commit/下载日期),保证可追溯与可复现。
参考:https://github.com/data-indi/disease/releases
§6.6 数据增强
安全 ✅:训练折内、受试者级之上的连接矩阵增强——连接矩阵上加少量同站点同标签噪声、ROI 顺序的图拓扑 dropout、以及站点内重采样 bootstrap。
危险 ❌:在 4D 时间序列上做时序切片/翻转产生的「新样本」派生自同一受试者,绝不能跨 train/test;跨站点插值或把表型列洗牌做增广会引入泄漏与伪信号(§6.5 坑点 1、6)。
§6.7 模型推荐表
| 模型类型 | 输入 | 适用 | 参考性能(ADHD-200 口径) |
|---|---|---|---|
| logistic(仅表型) | 站点/年龄/性别/利手/IQ | 基线/混淆对照 | 62.52%(竞赛最高整体分)[6] |
| RBF-SVM 投票 | 结构+功能特征 | 多站点分类基线 | 55%(Colby 等)[6] |
| 随机森林/线性分类器 | CC200 连接上三角 | 快速 baseline | ~50%-60% 常见 |
| 去噪自编码器+MLP / GNN | 功能连接矩阵 | 深度连接组学 | 需报告 LOSO/留出测试口径 |
| 站点感知深度模型 | 连接 + 站点标签 | 调和与域适应 | 须做「调和前后」消融 |
选型的实践建议:先跑「表型-only」与「CC200 连接 + 线性/RF」两个廉价基线锁定「这个任务到底多难」,再决定是否上深度模型。多数情况下,CC200 连接上三角(约 19,900 维)+ 线性 SVM/逻辑回归 + L2 就是很好的基线;只有当你想论证「深度/图模型在连接组上有增量」时,才值得在 (200,200) 连接矩阵上训练 GNN/自编码器,且务必用官方留出测试或 LOSO 报告(§6.5 坑点 1、7),不要用训练集内的随机折自嗨。
§6.8 硬件需求表
| 任务 | 最低 | 推荐 | 说明 |
|---|---|---|---|
| CC200 连接 + 传统 ML | 2 核 CPU / 4 GB RAM | 4 核 / 8 GB | 数百 MB 数据,几乎无门槛 |
| 深度连接组学(GNN/自编码器) | 4 GB 显存 | 8-16 GB 显存 | 连接矩阵 (200×200),小批量即可 |
| 原始 NIfTI 预处理/体数据 DL | 16 GB RAM + 磁盘 | 32 GB + GPU | 需自行重跑 Athena 类管线 |
硬件结论:绝大多数 ADHD-200 的经典 ML 实验在普通笔记本上即可完成(§6.11)。真正需要 GPU 的只有两类场景——体素级 4D 数据上的深度学习、以及把连接矩阵喂给大模型做端到端训练。即便是后者,(200,200) 的单通道矩阵用 8 GB 显存已足够跑小批量;若你用自研 Athena 类全流程重新预处理 973 名受试者的原始 NIfTI,才需要 32 GB 级 RAM 与可观磁盘(§3.4)。
§6.9 评估指标代码
from sklearn.metrics import accuracy_score, balanced_accuracy_score, \
precision_recall_fscore_support, confusion_matrix
def report_eval(y_true, y_pred, groups=None):
print('accuracy :', round(accuracy_score(y_true, y_pred), 3))
print('balanced acc :', round(balanced_accuracy_score(y_true, y_pred), 3))
p, r, f, _ = precision_recall_fscore_support(y_true, y_pred, average='binary')
print(f'precision {p:.3f} / recall {r:.3f} / F1 {f:.3f}')
print(confusion_matrix(y_true, y_pred))
if groups is not None: # 按站点透视,检查站点捷径
for g in np.unique(groups):
m = groups == g
print(f' site {g}: acc={accuracy_score(y_true[m], y_pred[m]):.3f} (n={m.sum()})')
诚实报告三要点:① 给 accuracy 的同时给 balanced accuracy(ADHD/对照比例因剔除口径而异);② 二分类与按站点透视都要给;③ 报告所用测试子集样本数与剔除策略(§6.5 坑点 7)。
§6.10 MLOps 笔记
- 版本锁定:表型、CC200 时间序列、目录结构都会因渠道(官方 tarball / Neuro Bureau / data-indi)不同而变化,把数据来源与版本(git commit/下载日期)写进实验记录(§6.5 坑点 8)。
- 特征持久化:功能连接上三角特征与站点/受试者元数据以 parquet/npz 缓存,供多次实验复用,避免重复读 .1D。
- 受试者级泄漏门禁:在 pipeline 里对
SUB_ID做去重 + 划分断言,防止二次会话与重复进入 train/test。 - 公平指标流水线:把按站点、按性别、按亚型的分层指标做成自动报告,纳入 CI。
- 追踪可复现:记录头动/剔除阈值、ADHD Measure、测试口径(171/162),任何精度数字都要能回查其定义。
§6.11 端到端基线的资源估算
一个「官方留出测试 + CC200 连接 + 线性分类」的端到端基线,其资源占用通常远小于你的直觉:
| 步骤 | 数据量 | 时间(典型) | 内存 |
|---|---|---|---|
| 下载 Athena CC200 时间序列(全样本) | 数百 MB | 数分钟-数十分钟(带宽相关) | — |
| 读取并构建连接矩阵(776+171 人) | 每样本 200×200 矩阵 | 约 1-2 分钟(numpy) | < 4 GB |
| 连接矩阵 flatten + 训练线性/RF 分类器 | (n, 19900) 特征 | 约 1-5 分钟 | < 8 GB |
| 深度连接组学(GNN 小批量) | (200,200) 图 | 依 epoch 数而定 | 8-16 GB 显存 |
要点:把「CC200 ROI 时间序列 → 连接矩阵 → 上三角特征」这一步结果缓存成 npz/parquet,后续多次实验(不同模型、不同消融)可秒级复用,避免重复读上千个 .1D 文件(§6.10 特征持久化)。对仅做经典 ML 的用户,整个过程在普通笔记本上即可完成,无需 GPU。
§6.12 最小复现脚本:官方留出测试上的线性基线
把 §6.1-§6.9 收敛成一个「拿来即用」的最小脚本,用于在官方留出测试(171)上跑出可对齐的线性基线。假设 data_root 下已有 Athena CC200 时间序列与表型(§6.2 获取步骤):
import os, glob, numpy as np, pandas as pd
from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import StandardScaler
DATA_ROOT = '/path/to/adhd200_root'
phen = pd.read_csv(os.path.join(DATA_ROOT, 'phenotypic', 'phenotypic.csv'))
train = phen[phen['split'] == 'train'] # split 列由你按官方口径构造(776)
test = phen[phen['split'] == 'test'] # 有标签 171
def ts_path(fid):
site = fid.split('_')[0]
return os.path.join(DATA_ROOT, 'preprocessed', 'Athena',
'cc200_roi_timeseries', site, f'{fid}_cc200_roi_timeseries.1D')
def edge_features(fid):
ts = np.loadtxt(ts_path(fid)) # (T, 200)
C = np.corrcoef(ts.T)
iu = np.triu_indices(200, k=1)
return C[iu] # 19900 维上三角
# 逐受试者构建特征(约 776+171 个文件,数分钟内)
Xtr = np.stack([edge_features(f) for f in train['FILE_ID']])
Xte = np.stack([edge_features(f) for f in test['FILE_ID']])
ytr = (train['DX'] == 1).astype(int).values
yte = (test['DX'] == 1).astype(int).values
# 标准化 + L2 逻辑回归(经典基线)
scaler = StandardScaler().fit(Xtr)
clf = LogisticRegression(C=1.0, max_iter=2000).fit(scaler.transform(Xtr), ytr)
pred = clf.predict(scaler.transform(Xte))
print('official held-out test accuracy:',
round((pred == yte).mean(), 3), '(n=%d)' % len(yte))
运行前请核对三点:① 时间序列文件确实存在(否则先按 §6.2 下载缺失中心);② 每样本时间点数 ≥ 20(否则 np.corrcoef 估计不稳,§3.11);③ 测试子集确实只含 171 名有标签受试者(§5.8)。这个脚本不包含表型、不剔除站点、不做 LOSO——它只给你一个「连影像都只是基线」的起点,提醒你把更复杂的结论建立在超过这个数字的可控协议上(§7.9)。
§7 质量评估与局限性
§7.1 已知偏倚表
| 类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 站点域偏移 | 扫描仪厂家/场强/TR/协议/指令站点间不一,站点与诊断倾向相关 | 高 | LOSO、ComBat 调和、站点感知模型(§6.5 坑点 1) |
| 头动混杂 | ADHD 组头动系统性更高,影响连接估计 | 高 | 运动协变量/剔除、scrubbing、ICA-AROMA(§6.5 坑点 2) |
| 性别不平衡 | 训练集约 62% 男性;ADHD 组男性占比更高 | 中 | 分层报告、性别匹配子分析(§7.5) |
| 亚型样本失衡 | ADHD-HI 极罕见(0-6 例),三分类不稳 | 高 | 并入 ADHD 或剔除,避免独立建模(§6.5 坑点 4) |
| IQ 混淆 | TDC FIQ 114 vs ADHD 106,差异显著 | 高 | 表型-only 对照基线、IQ 作协变量(§6.5 坑点 6) |
| 便利抽样 | 各站点临床/社区便利样本,非人口学代表 | 中 | 仅作方法学平台,勿外推患病率 |
§7.2 标注质量
- 训练集官方提供 usable/questionable 初步 rs-fMRI QC(视觉时间序列检查)[1]。
- 亚型诊断由各站点独立按 DSM-IV 做出,无跨站点一致性 κ 发布;ADHD-C/ADHD-I 切分存在站点间漂移风险。
- 测试子集(197)中有 26 名 Brown 受试者标签从未公开,另有若干未过 QC,导致有标签测试样本数在 171-162 间浮动——所有精度报告必须注明口径(§6.5 坑点 7)。
逐点的深层含义:① 「usable/questionable」只是初步视觉 QC,不代表「无头动」——你需要自己结合头动统计量再筛(§6.5 坑点 2);② 亚型标签的可靠性高度依赖站点是否用了结构化访谈(如 K-SADS);未用统一访谈的站点,其 ADHD-C vs ADHD-I 的切分可能与金标准有系统性偏差——因此用亚型标签做「亚型间脑差异」结论时要格外谨慎,最好同时按站点做亚型敏感性分析;③ 正因为测试集标签曾属「竞赛盲评」,官方在赛后公布标签的方式已成为社区对齐基准,但不同镜像对该文件的清洗程度不一,务必用同一份并注明版本(§6.5 坑点 8)。
§7.3 泛化性表
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 同一站点内 CV | 低但虚高 | 单中心可到 79%-93% 精度,多不可外推 [6] |
| 跨站点(LOSO/官方留出) | 高 | 竞赛未见站点 40.2% vs 训练内 54.1% [1] |
| 跨数据集(ABIDE 等) | 高 | 尚无统一跨疾病泛化基准,CC200 管线可复用但标签不同 |
| 临床部署 | 极高 | 竞赛精度普遍 ~60%,缺乏前瞻性临床验证 [6] |
「泛化」在 ADHD-200 上应被拆成三个可分别检验的层次:站内泛化(同一中心未见受试者)、站间泛化(训练未见过的中心)、跨协议泛化(换一种扫描协议/指令)。竞赛数据提示站内泛化明显好于站间(单中心可到 79%-93% vs 跨中心 ~50%-62%),而「跨协议」在当前官方留出测试里并未单独隔离——因为测试与训练往往共享大部分扫描协议。若你的研究想论证「算法可推广」,至少要在站间层次给出证据;只报单中心高精度在方法论上基本无外推价值(§6.5 坑点 1)。
§7.4 伦理
数据经各站点 IRB 批准并 HIPAA/1000FCP 去标识(去面部、去 PHI),为儿科精神疾病影像开放共享树立了早期治理先例 [1][7]。研究者须尊重非商业限制,儿童神经影像成果用于疾病时须格外谨慎地避免过度解读;任何「AI 诊断 ADHD」的表态必须附临床验证与监管提示(见免责声明)。
§7.5 公平性
- 性别:训练集约 62% 为男性,ADHD 组内男性占比更高;报告分层精度以避免掩盖女性表现差异。
- 亚型:ADHD-HI 几乎不可单独分析;ADHD-I 在 PKU 等中心相对充足,其余中心稀缺。
- 年龄:7-21(Preprocessed 至 26),覆盖儿童青少年为主;NeuroIMAGE 偏年长、OHSU 偏年幼,站点与年龄强相关——分析时年龄与站点混淆需同时处理。
- 种族/文化:中、美、荷站点组成跨文化样本,但非均衡、非人口代表。
§7.6 数据漂移
ADHD-200 为 2011 年定稿的历史数据(含修正),新镜像在目录/字段命名上调整但不改数据本身;随时间推移采集协议已过时、诊断标准已从 DSM-IV 演进到 DSM-5/ICD-11,模型在新人群/新协议上需重新校准。任何「截至」数字均以检索时为准。
§7.7 DAIMS 24 项评估表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 表型为单文件宽表,字段齐全(data-indi 镜像清洗版) |
| 2 | 唯一标识 | ✅ | SUB_ID/FILE_ID 作受试者主键 |
| 3 | 特殊字符 | ⚠️ | 原始表型存在空串/n/a 混用,需清洗(§6.5 坑点 5) |
| 4 | 重复行 | ⚠️ | WUSTL 等 15 名二次会话受试者,需 SUB_ID 去重(§5.3) |
| 5 | 缺失编码 | ⚠️ | NaN/空串混用;信息性缺失未显式标记(§4.5) |
| 6 | 标签标识 | ✅ | DX/DX_GROUP 明确,亚型有 Control/ADHD-C/I/HI |
| 7 | 罕见类分组 | ⚠️ | ADHD-HI 极稀少,官方未提供推荐合并策略(§6.5 坑点 4) |
| 8 | 偏倚评估 | ⚠️ | 头动/站点/IQ 偏倚在文献中充分讨论但官方未内建修正(§7.1) |
| 9 | 数据字典 | ✅ | 官方提供表型图例(legend);data-indi 进一步整理 |
| 10 | 信息性缺失解释 | ⚠️ | FIQ/Secondary Dx/Med Status 的高缺失未在文件中标注性质(§4.5) |
| 11 | 设备记录 | ⚠️ | 无统一受试者级设备表,需从站点/Neuro Bureau 文档补 |
| 12 | 共线性 | ⚠️ | 站点与年龄/协议强相关,需显式处理(§7.5) |
| 13 | 编码映射 | ✅ | DSM-IV 亚型与表型字段编码文档清楚 |
| 14 | 时间戳处理 | ⚠️ | 扫描时间戳与修正版本需核对(§6.5 坑点 8) |
| 15 | 划分建议 | ✅ | 官方训练/测试划分明确(776/171) |
| 16 | 泄漏讨论 | ⚠️ | 二次会话与表型泄漏官方未系统警示(本页 §5.3、§6.5) |
| 17 | 标签分布 | ✅ | 中心级标签分布可查(§2.4) |
| 18 | 测量偏倚 | ⚠️ | ADHD-RS vs CPRS-LV、WISC 版本差异为测量偏倚源(§2.7) |
| 19 | 外部验证建议 | ✅ | 官方留出测试 + ABIDE 跨域迁移(§7.8) |
| 20 | 版本记录 | ✅ | 两批官方修正 + data-indi 2025 镜像记录在案 [7] |
| 21 | 预处理脚本 | ✅ | Athena/NIAK/Burner 脚本公开(Neuro Bureau)[4] |
| 22 | 合规要求 | ✅ | HIPAA 去标识、非商业条款清楚 [7] |
| 23 | 多模态对齐 | ✅ | rs-fMRI 与 T1 与表型可按 SUB_ID 对齐 |
| 24 | 去标识化 | ✅ | 去面部/去 PHI 符合 HIPAA/1000FCP [1] |
DAIMS 评分:19.0 / 24
评分解读:ADHD-200 在「唯一标识、标签分布、版本记录、去标识化、预处理脚本、外部验证建议」上得分扎实——作为 2011 年的竞赛数据集,它意外地拥有比很多现代数据集更清晰的划分与修正记录。扣分集中在「缺失编码(混用 NaN/空串)、信息性缺失未显式标记、二次会话去重、测量偏倚(跨量表)与头动/站点偏倚无官方内建修正」——这些是本数据集实际使用的最大负担,也是 §6.5 八个坑点的核心来源。
对你意味着什么:拿数据的第一周,把清洗与去重做扎实(SUB_ID 去重 + 缺失统一为 NaN + ADHD Measure 分层)比花时间调模型回报更高。随后所有「精度数字」都必须绑定两件事——测试口径(171/162)与是否含表型/是否 LOSO——否则你报告的 accuracy 无法与任何文献对齐,也无法诚实支撑「影像判别 ADHD」的结论。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ADHD-200 官方留出测试(171 有标签) | ADHD-200 Consortium | 三分类(TDC/ADHD-C/ADHD-I) | 平均 49.8%(37.4-60.5%) | 未见站点精度降约 14pp(54.1%→40.2%) | 跨站点外推是核心瓶颈 [1] |
| 测试集中未入训练集站点 | ADHD-200 6 测试站点 | 二分类诊断 | 40.2%(未见站点) | 显著低于训练内站点 | 站点域偏移主导判别 [1] |
| ABIDE(同为 INDI 生态) | 跨 ASD 联盟 | CC200 管线复用/域迁移 | 方法迁移研究 | 跨疾病待系统基准 | 管线/分区可复用,标签不同需重训 |
§7.9 现实检验:一个负责任的评估协议
把 §7 的偏倚分析落到实践,一个「负责任的 ADHD-200 报告」至少应包含以下六点,这既是对读者负责,也是让论文经得起同行审稿:
- 样本与口径声明:写明训练用 776、测试用 171(或 162,并说明剔除 Brown/Pitt/WashU 的原因);写清是否剔除 ADHD-HI。
- 特征与模态声明:区分「纯影像」与「影像+表型」;若含表型,必须同时给「仅表型」基线以证明影像增量(§6.5 坑点 6)。
- 头动与质控:报告是否用运动统计量作协变量、剔除阈值、QC(usable/questionable)取舍(§6.5 坑点 2)。
- 划分与验证:主数字用官方留出测试,方法学补充 LOSO;禁止只报随机 k 折作为结论(§6.5 坑点 1、7)。
- 分层报告:按站点、按性别、按亚型的敏感性/特异性/精度至少透视一版(§7.5)。
- 局限与临床边界:明确此类数据不能直接外推到临床诊断,需前瞻性验证。
把这六点写成「补充方法」小节,你的工作就能在 ADHD-200 这类高引用但高挑战的数据集上站稳可信度。
§8 基准性能与生态
§8.1 排行榜(ADHD-200 竞赛与社区代表性结果)
⚠️ 下列精度口径不一致(三分类 vs 二分类、留出测试 vs LOSO vs 站点内 CV、是否用表型特征、测试子集样本数),数值不可直接比较,仅按口径归类供参考 [1][6]:
| 排名 | 模型/方法 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 竞赛最高整体分 | Alberta logistic(仅表型) | 62.52% 精度、124/195 分 | 2012 | 站点/年龄/性别/利手/IQ 的 logistic | Brown MRG et al., Front Syst Neurosci 6:69 (2012). doi:10.3389/fnsys.2012.00069 | — |
| 竞赛最高特异度 | Hopkins(Eloyan 等) | 61% 精度、94% 特异度、21% 灵敏度 | 2012 | 结构/功能判别、特异度优先 | Eloyan A et al., Front Syst Neurosci 6:65 (2012) | — |
| 竞赛影像方法 | UCLA RBF-SVM 投票 | 55%(二分类,39% 基线) | 2012 | 多模态 SVM-RFE + 投票 | Colby JB et al., Front Syst Neurosci 6:59 (2012). doi:10.3389/fnsys.2012.00059 | — |
| 竞赛平均(21 队) | 全体提交 | 49.8%(37.4-60.5%) | 2012 | 训练内 54.1%、未见 40.2% | ADHD-200 Consortium, Front Syst Neurosci 6:62 (2012) | — |
| 后续(组合) | 表型+功能影像 | 65% vs 表型 59.6% | 2017 | 组合模态 | 综述引第三方,Uddin et al., Transl Psychiatry 7:e1008 (2017) | — |
| 后续单中心(sMRI) | 白质单模态 | 93%(单中心) | 2017 | 结构测量 | 见 Transl Psychiatry 综述所引 | — |
§8.2 SOTA 总结与选型建议
ADHD-200 的「SOTA」高度依赖评估协议:单中心可报告 79%-93%,但跨中心诚实水平约 50%-62%,且仅用表型即可触及这一上限 [1][6]。结论性建议:若目标是「证明方法在 ADHD 上有竞争力」,请在官方留出测试(171)或 LOSO 上报告,并把表型-only(~60%)设为不可逾越的对照;任何高于 ~62% 的跨中心纯影像结果都需警惕口径或泄漏(§6.5 坑点 6、7)。
§8.3 评测协议
要在一个「可比」的基础上评估,建议固化下列协议(同时写进 Methods,§7.9):
- 任务与标签:固定二分类(对照 vs ADHD)或三分类(对照/ADHD-C/ADHD-I);写明是否剔除 ADHD-HI(§6.5 坑点 4)。若用三分类,随机基线不是 50% 而是 ~33%-39%(§8.1)。
- 划分:训练 = 官方 776;测试 = 171(或明确标注剔除策略的 162)。禁止在官方测试上反复调参(会过拟合竞赛口径),调参应在训练内另拆。
- 特征:CC200/CC400 连接上三角(§6.3 代码);报告前先做受试者级去重(§5.3)。
- 指标:accuracy + balanced accuracy + 按站点分层的 sensitivity/specificity + 表型-only 基线(§6.9 代码)。务必注明阳性率口径(三分类 vs 二分类的类别先验不同)。
- 可追溯:记录所用 pipeline(Athena/Burner/NIAK)、CC200 vs CC400、头动阈值、ADHD Measure 分层(§6.10)。
一个常见的口径陷阱:很多论文把「三分类任务」做成「二分类」后报告 accuracy,却没有说明对照先验从 ~60% 变成 ~50%——这会让数字看起来比竞赛结果高不少,但实际并未超过表型基线。评测协议必须同时写明「类别数」与「是否含表型」,否则你报的 60%+ 无法判断是进步还是口径差异(§6.5 坑点 6、7)。
§8.4 相关数据集表
| 数据集 | 模态 | 关系 |
|---|---|---|
| ABIDE I/II | rs-fMRI + T1 + 表型 | 同一 INDI 生态的 ASD 联盟,复用 CC200/CC400 与预处理管线;任务为自闭症分类 |
| ADHD-200 Preprocessed | 预处理衍生 | 本数据集的 Neuro Bureau 多管线处理版(Athena/Burner/NIAK) |
| ADHD-200 Chinese(PKU 子集研究) | rs-fMRI + 表型 | PKU 子样本的衍生/单中心研究,可获更高单中心精度但不可外推 |
| NeuroIMAGE | sMRI/dMRI/fMRI + 表型 | 独立纵向病例对照研究(NeuroIMAGE 站点即 ADHD-200 站点之一的前身) |
| Human Connectome Project | 多模态 | 健康人群超高分辨率,无 ADHD 病例标签,无法做分类 |
| CHARLS / 其他人群队列 | 非影像 | 公共卫生视角的对照,不适用于 rs-fMRI 连接分析 |
§8.5 关键论文 Top 5-10
以下为理解 ADHD-200 最值得精读的论文;标注的贡献可帮助你决定先读哪一篇:
- ADHD-200 Consortium (2012). The ADHD-200 Consortium: a model to advance the translational potential of neuroimaging in clinical neuroscience. Front Syst Neurosci 6:62. doi:10.3389/fnsys.2012.00062 — 主参考论文,定义数据集结构、规模、QC 与竞赛规则;先读这一篇建立骨架。[1]
- Brown MRG et al. (2012). ADHD-200 Global Competition: diagnosing ADHD using personal characteristic data can outperform resting state fMRI measurements. Front Syst Neurosci 6:69. doi:10.3389/fnsys.2012.00069 — 用仅表型模型拿下竞赛最高分,是「表型 vs 影像」争论的核心证据;做基线前必读。[6]
- Colby JB et al. (2012). Insights into multimodal imaging classification of ADHD. Front Syst Neurosci 6:59. doi:10.3389/fnsys.2012.00059 — 结构+功能多模态 RBF-SVM 的影像代表方法,55%。
- Bellec P, Chu C, et al. (2017). The Neuro Bureau ADHD-200 Preprocessed repository. NeuroImage 144(B):275-286. doi:10.1016/j.neuroimage.2016.06.034 — 三管线的权威技术文档;使用任何 Preprocessed 数据都必须引用。[4]
- Eloyan A et al. (2012). Automated diagnoses of attention deficit hyperactive disorder using magnetic resonance imaging. Front Syst Neurosci 6:61. doi:10.3389/fnsys.2012.00061 — 高特异度(94%)判别;提示「低假阳性」路径的可能。[6]
- Uddin LQ et al. (2017). Progress and roadblocks in the search for brain-based biomarkers of autism and attention-deficit/hyperactivity disorder. Transl Psychiatry 7:e1218. doi:10.1038/tp.2017.164 — ADHD 生物标志物综述与基准汇整,含单中心 vs 多中心精度对照表。[6]
- Craddock RC et al. (2012). A whole brain fMRI atlas generated via spatially constrained spectral clustering. Hum Brain Mapp 33(8):1914-28. doi:10.1002/hbm.21333 — CC200/CC400 分区源论文;理解「为什么 200 个 ROI」必读。[5]
- Di Martino A et al. (2014). The autism brain imaging data exchange. Mol Psychiatry 19:659-667. doi:10.1038/mp.2013.78 — ABIDE 主论文,展示 ADHD-200 所启发的更大规模联盟范式。
- Power JD / Satterthwaite TD 等头动方法文献 — 头动对静息态连接与群体差异的混杂;做质控必读。[13]
§8.6 社区活跃度
- 数据 2011 年发布后长期在 NITRC/fcon_1000 生态使用;竞赛论文集中发表于 Front Syst Neurosci 2012 卷 6 专题,形成稳定引用群。
- 2025-11-21 data-indi 团队将 ADHD-200 重发布为 BIDS 风格 GitHub 镜像(data-indi/adhd200),成为现代获取入口,说明数据仍被持续维护与再分发 [7]。
- 后续 ABIDE、CC200/CC400 生态持续活跃,直接沿用 ADHD-200 衍生物;CC200/CC400 至今是多中心 rs-fMRI 连接组学的常用分区。
- Google Scholar 引用 ~494(主论文,截至 2026-09);Preprocessed 论文(NeuroImage 2017)亦有稳定引用,反映「用数据必引」的社区惯例。
§8.7 生态快照表
| 资源 | 类型 | 链接 | Star/状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| ADHD-200 官网(fcon_1000) | 官方页 | http://fcon_1000.projects.nitrc.org/indi/adhd200/ | N/A | 原始数据与表型图例 |
| ADHD-200 Preprocessed | 预处理衍生 | https://preprocessed-connectomes-project.github.io/adhd200 | N/A | CC200/CC400 时间序列与管线说明 |
| data-indi/adhd200 | GitHub 镜像 | https://github.com/data-indi/adhd200(经 disease release) | 2025-11-21 发布 | 现代 BIDS 风格清洗入口 |
| Neuro Bureau 论坛 | 社区 | NITRC neurobureau 论坛 | 活跃度随年代下降 | 预处理疑难与 QC 讨论 |
| Craddock atlas(CC200/CC400) | 图谱 | 多来源(原 Neuro Bureau) | 广泛复用 | 连接组学标准分区 [5] |
§8.8 ADHD-200 竞赛专题与代表性参赛论文
2011 年 ADHD-200 全球竞赛的参赛方法集中发表为 Frontiers in Systems Neuroscience 的专题(2012,卷 6)。这些论文是理解「什么是本数据集可复现的基线」的一手文献,也展示了方法谱系(从纯表型到多模态 SVM、再到图论):
| 参赛团队/论文 | 方法要点 | 在本 Wiki 的位置 |
|---|---|---|
| Alberta(Brown 等) | 仅表型 logistic;62.52%,124/195 | §8.1 竞赛最高整体分 |
| JHU/Hopkins(Eloyan 等) | 影像判别、特异度优先;61%、94% 特异度 | §8.1 最高特异度 |
| UCLA(Colby 等) | 多模态 SVM-RFE + 站点投票 RBF-SVM;55% | §8.1 影像方法 |
| UCF(Dey 等) | 图论网络特征(degree/3-cycle)+ PCA-LDA | §6.5 坑点 4 参考 |
| 其余队伍 | 覆盖统计、计算机视觉、神经科学背景 | §8.1 平均 49.8% [1] |
这批论文的共通教训被多次重申:① 影像分类在留出测试上普遍挣扎在 ~50%-62%;② 表型/站点特征是强混淆源;③ 未见站点泛化是硬瓶颈。任何新方法若想在 ADHD-200 上「有说服力」,都应对齐这批基线而非只报单中心或随机 k 折。
§9 资源与引用
§9.1 BibTeX
主参考论文与 Preprocessed 论文的 BibTeX 如下:
@article{ADHD200Consortium2012,
title={The ADHD-200 Consortium: a model to advance the translational potential
of neuroimaging in clinical neuroscience},
author={The ADHD-200 Consortium},
journal={Frontiers in Systems Neuroscience},
volume={6},
pages={62},
year={2012},
doi={10.3389/fnsys.2012.00062}
}
@article{Bellec2017ADHD200Preprocessed,
title={The {Neuro Bureau} {ADHD}-200 Preprocessed repository},
author={Bellec, Pierre and Chu, Carlton and Chouinard-Decorte, Fran{\c{c}}ois
and Benhajali, Yassine and Margulies, Daniel S and Craddock, R Cameron},
journal={NeuroImage},
volume={144},
number={Part B},
pages={275--286},
year={2017},
doi={10.1016/j.neuroimage.2016.06.034}
}
§9.2 官方与社区资源
- 官方主页:http://fcon_1000.projects.nitrc.org/indi/adhd200/
- Preprocessed:https://preprocessed-connectomes-project.github.io/adhd200
- 现代镜像:https://github.com/data-indi/adhd200(data-indi/disease releases)
- RRID:SCR_005358(ADHD-200 Sample)/ SCR_000576(ADHD-200 Preprocessed)
§9.3 引用指南
使用 ADHD-200 数据应引用主参考论文(ADHD-200 Consortium 2012)[1];使用 Preprocessed 数据再追加引用 Bellec 等 2017 [4] 并注明所用 pipeline(Athena/Burner/NIAK);在论文中明确列出所用站点与数据子集,并按 ADHD-200 Consortium 要求致谢各站点资助来源。
引用时的「致谢/出处」要素,建议在论文 Methods 的 Data Availability 段这样写:
本研究所用数据来自 ADHD-200 Consortium 公开共享的 ADHD-200 Sample(经 1000 Functional Connectomes Project / INDI 于 NITRC 分发),训练子集 776 名受试者,留出测试取有公开标签的 171 名;功能连接特征来自 ADHD-200 Preprocessed 的 Athena(CC200)衍生。主参考文献为 [ADHD-200 Consortium 2012] 与 [Bellec et al. 2017]。
§9.4 下载与复现注意事项
- 多源校验:同一 SUB_ID 在不同渠道(官方 tarball、Neuro Bureau、data-indi)的字段与目录命名可能不同;跨源混合使用前先做 FILE_ID/受试者级并集校验(§6.5 坑点 8)。
- 受试者级对齐:训练/测试、rs-fMRI 与 T1、表型与 QC 全部以 SUB_ID 对齐;Preprocessed 的 FILE_ID 常为
SITE_SUBID(如Peking_1_0023442)。 - 引用归属:FDA/监管或商业用途不符合非商业许可,须先行确认使用条款(§10.3 免责)。
- 版本指纹:记录下载日期与镜像 commit/asset 号,确保可复现(§6.10)。
§9.5 常见问题速查
| 现象 | 可能原因 | 处理 |
|---|---|---|
| 测试集只有 162 人可算 | 剔除了 Brown 未标 + Pitt/WashU 全对照站点 | 明确写清口径(§6.5 坑点 7) |
| 结构像配准错乱 | 早期 x/z 颠倒数据 | 换现代镜像并核对(§6.5 坑点 8) |
| ADHD_Index 相加结果诡异 | 跨 ADHD Measure/量表相加 | 按 ADHD Measure 分组建模(§6.5 坑点 5) |
| FIQ 行基本为空 | Full2 IQ 结构性缺失 92.7% | 过滤有值子集或信息性缺失建模(§4.5) |
| 单中心精度 >90% | 站点捷径 / 过拟合 | 换 LOSO/留出测试并报告(§6.5 坑点 1) |
§10 AI 使用声明卡
§10.1 AI 模型列表
本 Wiki 的撰写使用了通用大语言模型(LLM)辅助文本组织与代码骨架生成。未使用任何针对本数据集训练的图像/分类模型参与内容生产。
§10.2 AI 参与范围
- AI 辅助组织章节结构、撰写代码示例与中英混排叙述。
- 所有规模数字、日期、DOI、URL 均以 WebSearch 核实的公开来源为准(见 FACTS 与正文引用),禁止编造。
- 代码示例旨在示范流程,未在本数据集上端到端跑通输出精度数字;不含虚构性能结果。
§10.3 输入来源列表(摘引)
- ADHD-200 Consortium 2012, Front Syst Neurosci — 数据集/竞赛定义、规模、平均精度 [1]
- ADHD-200 Global Competition Test Dataset Released, NITRC 论坛 2168 — 测试集 QC 与发布 [2]
- Neuro Bureau ADHD-200 Preprocessed (BioRxiv/NeuroImage) — 973 口径、三管线、二次会话 [3][4]
- data-indi/disease Releases (ADHD-200 Sample) — 修正记录、data-indi 镜像、获取/许可 [7]
- ADHD-200 RRID SCR_005358 (SciCrunch) — 站点清单与描述
- Brown MRG et al. 2012 — 表型基线 62.52% [6]
- Colby JB et al. 2012 — UCLA 影像方法 55%
- Eloyan A et al. 2012 — 高特异度判别
- Uddin et al. 2017, Transl Psychiatry — ADHD 生物标志物综述/基准汇整 [6]
- Springer 2025 (Transformer-based structural connectivity) — 训练/测试中心级统计表 [10]
- PMC11169645 (ASTNet) — 620 子样本与 162 测试口径 [11]
- PMC39962416 — 表型缺失率与 ADHD Measure/IQ 编码 [12]
- WHO ICD-11 6A05 / SNOMED CT — 医学编码映射 [8]
- Neuro Bureau wiki/CC200 — 分区与 Athena 流程 [5]
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED、人群、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §4 数据字典 / §5 划分策略 | 千方病案医学编辑部(数据工程) | 交叉审核 | ✅ 已通过 |
| §6 预处理 Pipeline 与坑点 | 千方病案医学编辑部(数据工程) | 交叉审核 | ✅ 已通过 |
| §8 基准数字与引用核对 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
§10.5 AI 生成章节标注
§1-§10 全文由 AI 辅助起草、编辑部按宪法逐节审核并修正事实;页面不含任何待补数据或缺失引用。
§10.6 最后人工审核日期
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
§10.7 正文引用编号对照(索引)
正文中以方括号编号引用的主要来源,统一列在下方,方便读者核验事实出处(完整 URL 见 §8.5 与 §10.3):
| 编号 | 来源 |
|---|---|
| [1] | ADHD-200 Consortium, Front Syst Neurosci 6:62 (2012) — 数据集与竞赛定义、规模、平均精度 |
| [2] | ADHD-200 Global Competition Test Dataset Released, NITRC 论坛 2168 — 测试集 QC 与发布 |
| [3] | Neuro Bureau ADHD-200 Preprocessed(BioRxiv/NeuroImage)— 973 口径、三管线、二次会话 |
| [4] | Bellec et al., NeuroImage 144(B):275-286 (2017) — Preprocessed 管线权威 |
| [5] | Craddock et al., Hum Brain Mapp 33:1914-28 (2012) — CC200/CC400 分区 |
| [6] | Brown 等 / Eloyan 等 / Uddin 等 / 竞赛影像论文 — 基准数字与表型混淆 |
| [7] | data-indi/disease Releases(ADHD-200 Sample)— 修正记录、镜像、许可 |
| [8] | WHO ICD-11 6A05 / SNOMED CT 官方 — 医学编码映射 |
| [9] | 流行病学与负担文献(数据发布正文)— ADHD 患病率与负担 |
| [10] | Springer 2025(Transformer-based structural connectivity)— 训练/测试中心级统计 |
| [11] | PMC11169645(ASTNet)— 620 子样本与 162 测试口径 |
| [12] | PMC39962416 — 表型缺失率与 ADHD Measure/IQ 编码 |
| [13] | Power / Satterthwaite 等头动方法文献 — 头动混杂讨论 |
注:表中 URL 已在对应正文/§10.3 内联引用;本页所有「截至」数字均以 2026-09 检索时为准,读者引用时应复核最新来源。
