信息速览

ABIDE I/II 自闭症脑成像交换数据集 — 全球最大多中心 ASD 脑影像 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Autism Brain Imaging Data Exchange I & II(ABIDE I/II) |
| 英文全称 | Autism Brain Imaging Data Exchange I and II |
| 别名/简称 | ABIDE、ABIDE-I、ABIDE-II、ABIDE Initiative、1000 Functional Connectomes Project-INDI 自闭症联盟 |
| 疾病分类 | 自闭症谱系障碍(ICD-11:6A02 自闭症谱系障碍 / 6A02.0 无智力发育障碍 / 6A02.5 自闭症谱系障碍,其他特指) |
| SNOMED CT | 414146005 Autism spectrum disorder / 191847005 Asperger syndrome / 80660006 Pervasive developmental disorder(详见 §2.1b) |
| 数据模态 | 脑静息态功能磁共振(rs-fMRI)+ 结构 T1 + 表型(II 期部分站点含 dMRI) |
| AI 任务类型 | ASD vs 对照二分类、多站点域适应、功能连接组学建模、图神经网络分类、数据增广、生物标志物可重复性研究 |
| 样本总数 | 2,226 个数据集(I 期 1,112 + II 期 1,114,官网口径)/ 2,156 名独立横断面受试者 |
| 数据格式 | NIfTI(BIDS 1.1.1)/ CSV 表型 / .1D ROI 时间序列 / tar.gz 分包 |
| 许可证 | CC BY-NC-SA 4.0(原始数据);Preprocessed 衍生数据为 BSD 风格许可 |
| 访问级别 | 开放(注册免费 NITRC 账号后下载;S3 桶支持匿名读取) |
| DUO 标签 | 无正式 DUO 标注;按 CC BY-NC-SA 实际约束近似 NCU(非商业)+ 归因要求 |
| 语言 | 英文(元数据与文档);受试者分布于多语言国家 |
| 首发日期 | 2012 年(ABIDE I);2016-06(ABIDE II) |
| 最后更新 | 2017-03-27(ABIDE II 第三次发布更新) |
| 发布机构 | Child Study Center, NYU Langone Medical Center / Nathan S. Kline Institute / Child Mind Institute(ABIDE Consortium) |
| 官方主页 | http://fcon_1000.projects.nitrc.org/indi/abide/ |
| 下载地址 | http://fcon_1000.projects.nitrc.org/indi/abide/abide_I.html 与 abide_II.html;AWS S3:s3://fcp-indi/data/Projects |
| DOI | 10.1038/mp.2013.78(I 期论文)/ 10.1038/sdata.2017.10(II 期论文) |
| 引用次数 | 3,301+(Google Scholar,Di Martino 2014,截至 2026-09);II 期论文 646 次(Nature,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— BIDS 化、预处理衍生数据与 QC 列齐备、社区基准成熟;扣分项:无官方数据划分、多站点域偏移未做官方调和、表型字段需手工清洗 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、ASD 诊断标准与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(表型字段映射、多站点层级结构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NYU Langone、Nathan S. Kline Institute、Child Mind Institute 及 ABIDE Consortium 无任何商业利益关联。本页面不销售 ABIDE 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 ABIDE Consortium 及其成员机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ABIDE 原始数据采用 CC BY-NC-SA 许可发布,用户需注册免费 NITRC 账号、遵守 1000 Functional Connectomes Project / INDI 数据共享协议,商业用途需另行授权。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? ABIDE(Autism Brain Imaging Data Exchange,自闭症脑成像数据交换)是一个由全球 36 个研究站点(I 期 17 个、II 期 19 个)组成的开源数据联盟。各家把自己已经采集好的自闭症谱系障碍(ASD)患者和健康对照的脑扫描数据——包括静息态功能磁共振(受试者躺在扫描仪里什么都不做时记录的大脑活动视频)、T1 结构像和临床评估表——统一匿名化后放到互联网上,供任何人免费下载。两期合计约 2,226 个数据集、2,156 名独立受试者,是 ASD 神经影像领域当之无愧的第一大公开数据资源。
为什么重要? 自闭症是一种高度异质性的神经发育障碍,任何单个实验室几年也就能扫描几十到一百多名受试者,得出的结论往往无法重复。ABIDE 用「数据汇总」的思路把几十个实验室的样本拼在一起,让研究者第一次能在近千人的尺度上验证「ASD 大脑连接异常」这类假设。2014 年 I 期论文已被引用超过 3,300 次(截至 2026-09),它甚至改变了神经影像领域的数据共享文化——此后的 ADHD-200、HCP 等联盟都直接受其启发。
我能用它做什么? 最主流的用法是「用脑功能连接预测自闭症」:把每个受试者的 fMRI 提炼成一个 200×200 的功能连接矩阵,喂给机器学习或图神经网络模型做 ASD/对照二分类。它也是研究多站点数据调和(harmonization)、fMRI 数据增广、预处理管线可重复性的标准试验场。注意:它的分类精度普遍只有 60%-75%,拿它做「AI 辅助诊断」教程可以,直接宣称临床可用则不行(详见 §8 与 §6.5 坑点)。
§1.1 技术摘要
ABIDE 采用「草根联盟 + 中心化汇聚」模式:各站点沿用自己原有的扫描协议(无需统一硬件或序列),在本地 IRB 批准与 HIPAA 匿名化后,将静息态 fMRI、T1 加权结构像与表型数据提交至纽约大学 Langone 医学中心Child Study Center(I 期,2012 年发布,Di Martino 等 [1])与 Child Mind Institute / Nathan S. Kline Institute 联合体(II 期,2016 年发布,Di Martino 等 [2])。I 期 17 个站点贡献 1,112 个数据集(539 名 ASD、573 名年龄匹配典型对照,7-64 岁);II 期 19 个站点贡献 1,114 个数据集(官网口径 521 名 ASD、593 名对照,5-64 岁),其中含 38 名受试者的纵向复扫与 284 个弥散成像数据集,两期合计 2,156 名独立横断面受试者 [2]。所有数据经 NITRC 平台开放下载,并镜像至 AWS S3 开放桶(BIDS 1.1.1 组织);Preprocessed Connectomes Project 进一步提供 C-PAC、CCS、DPARSF、NIAK 四条预处理管线 × 四种去噪策略的衍生数据,含 ROI 时间序列、ALFF/fALFF、ReHo、VMHC 等指标及自动+人工双重质量控制列 [3][4]。诊断分组由各站点持证临床医师按 DSM-IV-TR 标准给出,并用 ADI-R 和/或 ADOS 量表确认 [1]。
一句话把握数据形态:这是一个「每个受试者一包 NIfTI(BOLD + T1)+ 一行表型 + 一列质量指标」的多中心影像库,而非单表回归任务。上手的第一步永远是「把 4D BOLD 提炼成功能连接或低维特征」,绝大多数 AI 实践都发生在这条浓缩链路上(§6.3 起给出完整代码)。因为它没有官方划分,所有「测试」都必须你自己用受试者级 + 站点感知的方式定义——这既是自由度,也是坑(§5、§6.5)。
§1.2 战略价值
维度一:方法学基础设施价值。 ABIDE 是「多站点异质性」这一神经影像核心难题的最佳公共研究平台。17+19 个站点意味着扫描仪厂家、场强、TR、体素大小、扫描时长、被试人口学构成全部混杂——这正是检验域适应(domain adaptation)、ComBat 调和、站点感知交叉验证等方法的天然试炼场。Abraham 等 [5] 直接在 ABIDE 上系统比较了管线选择对分类性能的影响,Wolfers 等 [6] 的元分析则用 57 项 ABIDE 研究揭示了「样本越大、报告精度越低」的行业现象。任何想把 fMRI 分类模型推向临床的团队,都应先在 ABIDE 上接受 leave-one-site-out 的拷问。
维度二:临床科学价值。 ASD 的行为诊断依赖 ADOS/ADI-R 量表与专家经验,耗时长、主观性强。ABIDE 把「脑连接」与「临床标注」配对开放,使寻找影像生物标志物成为可能;I 期论文自身就用 763 名男性受试者复现了 ASD 额叶-后部低连接的核心发现 [1]。II 期补充的共病精神病学变量与女性样本,使解析 ASD 异质性、研究性别差异成为可能 [2]。对 AI 社区而言,它还是检验「数据增广能否弥补罕见病样本不足」这一命题的理想舞台——因为它提供了同域态(rs-fMRI 连接组)下罕见的大样本。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 ABIDE 的差异化 |
|---|---|---|---|---|
| ABIDE I+II | 2,226 个数据集 / 2,156 名独立受试者 | rs-fMRI + T1 + 表型(部分 dMRI) | DSM-IV-TR 诊断 + ADOS/ADI-R/IQ | 本体;多站点 ASD 分类与连接组学事实标准 |
| ADHD-200 | 约 970 名受试者、8 站点 | rs-fMRI + T1 + 表型 | ADHD 亚型诊断 + 临床量表 | 姊妹联盟(同一 INDI 生态),任务为 ADHD 而非 ASD,管道与 BIDS 生态相通 |
| UK Biobank(脑影像子集) | 约 10 万名受试者目标(截至 2026-09 已释放数万人) | T1/T2/fMRI/dMRI | 健康人群 + 丰富 EHR | 样本量大一个数量级但 ASD 病例极少、申请门槛高、非专科临床标注 |
| Human Connectome Project (HCP) | 约 1,200 名健康年轻人(S1200) | 多模态 fMRI/dMRI/T1 | 行为与人格量表,无 ASD 病例 | 采集协议极致统一、质量极高,但无临床诊断标签,不能做 ASD 分类 |
| ABCC(Adolescent Brain Cognitive Development) | 约 11,800 名儿童队列 | 结构 + fMRI + dMRI | 精神行为量表(SDQ 等) | 纵向人群队列,ASD 标签非核心且以量表筛查为主 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 关键内容 |
|---|---|---|
| 2012 年 | ABIDE I 发布 | 17 站点、1,112 个数据集(539 ASD + 573 对照,7-64 岁),NITRC/INDI 平台开放 [1] |
| 2013 年 | Preprocessed Connectomes Project 启动 | Neuro Bureau 团队发布 C-PAC/CCS/DPARSF/NIAK 四管线预处理衍生数据 [3] |
| 2014-06 | I 期论文发表 | Di Martino et al., Molecular Psychiatry 19(6):659-667 [1] |
| 2016-06 | ABIDE II 开放 | 19 站点、1,114 个数据集(5-64 岁),含纵向子集与 dMRI [2] |
| 2016-09-25 | ABIDE II 第一次发布更新 | 新增/修正站点数据与表型 [2] |
| 2017-03-14 | II 期论文发表 | Di Martino et al., Scientific Data 4:170010 [2] |
| 2017-03-27 | ABIDE II 第三次发布更新 | 当前最终版本 [2] |
| 2018-12 | fmriprep 衍生数据上架 | fcp-indi S3 桶提供 fmriprep 1.2.5 输出(BIDS 1.1.1)[4] |
§1.5 典型应用场景
- ASD vs 对照分类基准:以 CC200 图谱 200 个 ROI 时间序列构建皮尔逊相关功能连接矩阵,用 SVM、自编码器、GCN/GNN 模型做二分类(§8.1 排行榜)。
- 多站点调和与域适应研究:用站点标签研究 ComBat、深度调和、站点感知损失函数,检验模型跨站点迁移能力(§6.5 坑点 1)。
- fMRI 数据增广方法验证:在功能连接或 4D 体数据上验证时序切片、生成模型、图增广等策略对罕见病小样本场景的增益。
- 连接组学科学与生物标志物:复现 ASD 额叶-后部低连接、默认网络异常等发现,评估 ALFF/ReHo/VMHC 等指标在 ASD 中的群体差异。
- 纵向可靠性与性别差异分析:用 38 名纵向受试者评估个体内稳定性;用 II 期扩大的女性样本做 ASD 性别差异初步研究 [2]。
§2 医学背景
§2.1 ICD-11 编码映射表
| 标签 | ICD-11 编码 | ICD-11 中文名 | 备注 |
|---|---|---|---|
| 自闭症谱系障碍(总类) | 6A02 | 自闭症谱系障碍 | ABIDE 受试者的核心疾病;DSM-IV-TR 时代采集,与 ICD-11 定义存在演变差异 |
| 无智力发育障碍 | 6A02.0 | 自闭症谱系障碍,无智力发育障碍,无功能性语言损害 | I 期样本以高功能(FIQ ≥ 80 为主)个体居多 |
| 伴智力发育障碍 | 6A02.3 | 自闭症谱系障碍,伴智力发育障碍及功能性语言损害 | 少量样本 |
| Asperger 综合征(历史亚型) | 6A02.Z | 自闭症谱系障碍,未特指 | DSM-IV-TR 299.00 Asperger’s Disorder 在 ICD-11 中并入 6A02,ABIDE 的 DSM_IV_TR 字段保留该历史亚型 |
| PDD-NOS(历史亚型) | 6A02.Z | 自闭症谱系障碍,未特指 | 待分类的广泛发育障碍,ABIDE 表型 DSM_IV_TR 字段中存在 |
| 典型对照 | 无对应编码 | — | 对照组按各站点排除标准筛查,非患者 |
§2.1b SNOMED CT 映射表
| 标签 | ICD-11 参考 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 自闭症谱系障碍 | 6A02 | 414146005 | Autism spectrum disorder (disorder) |
| Asperger 综合征(历史) | 6A02.Z | 191847005 | Asperger’s syndrome (disorder) |
| 广泛性发育障碍(历史大类) | 6A02.Z | 80660006 | Pervasive developmental disorder (disorder) |
| 儿童孤独症(历史) | 6A02.3 | 698978003 | Childhood autism (disorder) |
| 静息态功能磁共振检查 | — | 71658009 | Magnetic resonance imaging (procedure) 下位概念 |
编码映射仅用于检索与互操作目的;临床编码请以 WHO ICD-11 与 SNOMED International 官方版本为准。
§2.2 疾病简介与流行病学
自闭症谱系障碍(Autism Spectrum Disorder, ASD)是一组以社交沟通持续性缺陷、受限且重复的行为/兴趣/活动模式为特征的神经发育障碍,症状始于发育早期,且常伴随感觉敏化、共病焦虑/ADHD/睡眠障碍等 [1][2]。DSM-IV-TR 时代(ABIDE 采集期)将自闭症、Asperger 综合征与 PDD-NOS 视为独立诊断,DSM-5 与 ICD-11 之后统一并入谱系维度,这也是 ABIDE 表型中 DSM_IV_TR 字段仍保留历史亚型的原因。流行病学上,ASD 估计影响全球超过 1% 的儿童 [7],男女比例约 4:1,这一性别失衡直接反映在 ABIDE 的样本构成中(I 期女性仅约 20%,详见 §7.5)。ASD 的高度异质性——智力水平从重度受损到天才、语言从无口语到流利、共病谱系宽——是单一实验室难以应对、需要 ABIDE 类多中心大样本的根本原因。
§2.3 临床任务定义
| 任务 | 定义 | ABIDE 支持度 |
|---|---|---|
| 诊断(ASD vs 对照) | 基于 ADOS/ADI-R 与临床医师 DSM-IV-TR 判断的分组标签 DX_GROUP | 核心任务,全样本有标签 |
| 亚型区分 | Autism vs Asperger vs PDD-NOS(DSM_IV_TR 字段) | 部分支持:历史亚型标签存在但各站点判定标准不一 |
| 症状严重度回归 | ADOS_TOTAL、ADI-R 社会互动分(A)、SRS 总分作连续目标 | 部分支持:量表得分缺失因站点而异 |
| 认知水平分层 | FIQ/VIQ/PIQ 与所用智力量表 | 支持,需处理站点间量表不一致 |
| 共病解析(II 期) | 共病精神病学变量与脑连接的关联 | 支持:II 期强化的精神病学表型 [2] |
§2.4 患者人群表
ABIDE I 期 17 站点按站点样本量分布(受试者均为各站点 2012 年前已采集的既有数据)如下 [8]:
| 站点代码 | 机构 | 样本数 | 站点代码 | 机构 | 样本数 |
|---|---|---|---|---|---|
| NYU | 纽约大学 Langone 医学中心 | 184 | STANFORD | 斯坦福大学 | 40 |
| UM | 密歇根大学 | 145 | Caltech | 加州理工学院 | 38 |
| USM | 犹他大学医学院 | 101 | OLIN | 哈特福德医院 Olin 研究所 | 36 |
| UCLA | 加州大学洛杉矶分校 | 99 | SDSU | 圣地亚哥州立大学 | 36 |
| KUL | 鲁汶大学(比利时) | 64 | SBL | 格罗宁根大学 Social Brain Lab(荷兰) | 30 |
| LMU | 慕尼黑大学(德国) | 57 | OHSU | 俄勒冈健康与科学大学 | 28 |
| PITT | 匹兹堡大学医学院 | 57 | CMU | 卡内基梅隆大学 | 27 |
| YALE | 耶鲁儿童研究中心 | 56 | — | 合计(QC 后) | 1,102 |
| KKI | 肯尼迪克里格研究所 | 55 | — | I 期发布总数 | 1,112 |
| TCD | 都柏林三一学院(爱尔兰) | 49 | — | — | — |
- 年龄:I 期 7-64 岁(中位约 14.7 岁)[9];II 期 5-64 岁 [2]
- 性别:I 期约 739 名男性 / 363 名女性(合计 1,102 名 QC 样本口径)[8];女性占约 33% 但 ASD 组内女性比例更低
- 智力:I 期以高功能个体为主(多数 FIQ ≥ 80),各站点入组标准不同
- 诊断:ASD 组经 ADI-R 和/或 ADOS 确认;对照组按各站点排除标准(精神疾病、神经疾病、家族史等)
- II 期:新增 BNI、ETH Zurich(瑞士)、GU、IU、UC Davis、ONRC、SU 等站点,19 站点合计 1,114 个数据集 [2][10]
§2.5 临床价值
ASD 行为诊断平均延迟 2-3 年,且高度依赖专家资源。ABIDE 的临床价值在于提供「影像 → 诊断」映射研究的公共试验场:一方面,数项研究已证明功能连接特征在群体水平可分离 ASD 与对照(60%-75% 精度区间),并复现了额叶-后部低连接、默认网络异常等生物学发现 [1][11];另一方面,Wolfers 等 [6] 对 57 项研究的元分析明确警示:样本越小、报告精度越高,单中心结果难以外推。这促使领域将 ABIDE 定位为「生物标志物候选筛选与调和方法的开发平台」,而非「即插即用的诊断模型训练集」。对儿童青少年特发人群而言,ABIDE 的中位年龄约 14.7 岁的构成,恰好覆盖 ASD 干预窗口最关键的儿童-青少年期。
§2.6 金标准与标注方式
| 项目 | 内容 |
|---|---|
| 划分方式 | 无官方训练/测试划分;社区惯例为 leave-one-site-out(LOSO)与 10 折交叉验证(§5、§6.5 坑点 1) |
| 标注方式 | 各站点临床医师依据 DSM-IV-TR 标准做诊断分组(DX_GROUP),ADI-R/ADOS 量表确认;非 ABIDE 中心统一重新标注 |
| 标注者资质 | 各站点董事会认证的精神科医师或临床心理师;部分站点为研究团队但经一致化培训 |
| 标注性质 | 回顾性汇聚(各站点既有临床数据),非前瞻性统一采集;无双重盲评或标注一致性统计的统一发布 |
| 临床确认工具 | ADI-R(父母访谈)、ADOS(半结构化观察)、DSM-IV-TR 标准、SRS 量表;ABIDE II 增加共病精神病学评估 [2] |
§2.7 表型中的诊断工具:字段到量表的映射
用表型做「症状严重度」建模前,先分清两个最重要的临床工具分别量了什么,它们高度互补、不可互换:
- ADI-R(Autism Diagnostic Interview-Revised,修订版自闭症诊断访谈):面向父母的结构化访谈,回溯受试者的发展史与行为。表型中对应
ADI_R_SOCIAL_TOTAL_A(社交互动,A 域)、ADI_R_VERBAL_TOTAL_BV/ADI_R_NONVERBAL_TOTAL_BV(言语/非言语交流,B 域)等。它侧重「发育早期的症状证据」,适合分域(社交/交流/刻板)分析。 - ADOS(Autism Diagnostic Observation Schedule,自闭症诊断观察量表):面向受试者的半结构化观察评估,表型中
ADOS_TOTAL(交流+社交的总分)、ADOS_COMM/ADOS_SOCIAL等。它给出「当下表现」的严重度,随所用模块(模块 1-4 依语言水平而定)不同计分跨度量纲不同。 - SRS(Social Responsiveness Scale,社会反应量表):父母/教师填写的连续评分,
SRS_RAW_TOTAL可当连续严重度标度,比 ADOS 更适合做回归目标。
用错的两个常见结果:把 ADOS_TOTAL 直接当连续回归目标但没处理模块差异(§6.5 坑点 4 邻接问题);在对照组的缺失 ADOS 上硬编码 0(对照组根本没有 ADOS,因为临床评估只给患者做)。建议按官方严重度标定(Calibrated Severity Score)换算后再做跨模块/跨受试者比较,或把量表缺失显式建模为「信息性缺失」(§7.7 检查项 10)。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小/形式 | 理由 |
|---|---|---|---|
| 快速跑功能连接分类 baseline | ABIDE Preprocessed(C-PAC, filt_noglobal, rois_cc200) | 每受试者一个 .1D 文件,约 0.5-2 MB × 1,112 | 免去本地 fMRI 预处理,直接拿到 200 ROI 时间序列 |
| 需要自定义预处理(ICA、fmriprep) | 原始 BIDS(S3:ABIDE/RawDataBIDS) | 数 TB 级 | 完整 4D 原始数据,自由控制每一步 |
| 复现 Di Martino 2014 或做站点调和研究 | ABIDE I 完整包 + 汇总表 Phenotypic_V1_0b_preprocessed1.csv | 站点 tar.gz + CSV | SUB_IN_SMP 列标记论文主分析样本(1,102) |
| 研究 II 期共病表型/女性样本/纵向 | ABIDE II Release 3(2017-03-27) | 站点 tar.gz + 表型 CSV | 精神病学共病变量、38 名纵向受试者、284 个 dMRI |
| 大规模深度学习/体数据建模 | S3 BIDS + fmriprep 1.2.5 衍生输出 | BIDS/derivatives | BIDS 1.1.1 目录规范、可直读 BIDSDataLoader 生态 |
§3.1 模态详情
- 静息态 fMRI(核心模态):各受试者一次静息态扫描(睁眼或闭眼、注视十字因站点而异),TR 因站点而异(约 1.5-3.5 秒范围,详见各站点剖面),时间点数从数十到数百不等;部分受试者有第二次会话(NYU 等)。数据未经 scrubbing,原始头动参数可从预处理输出获得 [12]。
- T1 加权结构像:每受试者一卷 MPRAGE 或等价序列,用于皮层分割、颅内体积与结构特征提取;各站点分辨率不一。
- 表型数据:73 字段 CSV(ABIDE I),含诊断分组、DSM-IV-TR 亚型、扫描时年龄、性别、利手、FIQ/VIQ/PIQ 及所用智力量表、ADI-R 社会互动/言语交流分量、ADOS 总分、SRS、用药状态等 [7]。
- dMRI(仅 II 期):284 个数据集含弥散成像,可用于白质结构连接研究 [2]。
§3.2 按子集样本数表
| 子集 | 数据集数 | ASD | 对照 | 备注 |
|---|---|---|---|---|
| ABIDE I 全集 | 1,112 | 539 | 573 | 17 站点,2012 年发布 [1] |
| ABIDE I QC 主分析集 | 1,102 | — | — | Di Martino 2014 论文实际分析样本(SUB_IN_SMP=1)[8] |
| ABIDE II 全集 | 1,114 | 521 | 593 | 19 站点,2016-06 发布(官网口径)[2] |
| ABIDE II 独立横断面 | 1,044 | 487 | 557 | 剔除纵向第二次扫描 [2] |
| ABIDE I+II 独立横断面合计 | 2,156 | 1,026 | 1,130 | II 期论文口径 [2] |
| ABIDE I+II 数据集口径合计 | 2,226 | — | — | 含 38 名受试者纵向第二次扫描(UCLA、PITT 两个纵向集)[2] |
§3.3 数据格式表
| 数据类型 | 格式 | 组织方式 | 获取渠道 |
|---|---|---|---|
| 原始影像 | NIfTI (.nii.gz) | BIDS 1.1.1(sub-*/anat、func) | S3:s3://fcp-indi/data/Projects/ABIDE/RawDataBIDS |
| 原始影像(站点原始包) | tar.gz | 按站点分包 | fcon_1000 官网页面逐站点下载 |
| 表型 | CSV | 单文件宽表 | 官网 Phenotypic 文件 / S3 镜像 |
| 预处理衍生 | .nii.gz(体指标)与 .1D(ROI 时序) | pipeline/strategy/derivative/ 目录 | S3:fcp-indi/data/Projects/ABIDE_Initiative/Outputs |
| 汇总+QC | CSV | Phenotypic_V1_0b_preprocessed1.csv | S3 镜像,含 16 项自动 QC 与 3 位标注者人工 QC [3] |
§3.4 存储大小
ABIDE 官方未发布统一的总体积统计;实际大小取决于获取范围:全量原始 BIDS 为 TB 级(4D fMRI + T1 × 2,226 个数据集),而社区最常用的「C-PAC + CC200 ROI 时序」子集仅约 1-2 GB。建议按需下载(§6.2 给出按表型筛选拉取的代码),避免整桶同步。Preprocessed 单管线全样本体指标(如 ALFF/ReHo 每人一个 .nii.gz)下载量约数十 GB 量级,启动前请预留磁盘与带宽。
§3.5 标注方式
- 诊断分组(DX_GROUP):人工临床标注。各站点持证临床医师按 DSM-IV-TR 诊断标准给出,ADI-R 和/或 ADOS 确认,非 ABIDE 中心统一重测 [1]。
- 临床量表:ADOS_TOTAL、ADI-R 各分量表、SRS、FIQ/VIQ/PIQ 均为临床人工评估结果;缺失因站点工具选择而异 [7]。
- 质量标注:Preprocessed 版本提供 3 位标注者对解剖与功能影像的人工 QC 评分(qc_rater_1-3 及备注列),外加 16 项自动质量指标 [3]。
§3.6 标注者资质与一致性
诊断由各站点董事会认证的精神科医师或临床心理师做出;部分站点由研究团队按统一化流程评估。各站点入组与确诊流程独立执行,ABIDE 汇聚时未做跨站点的标注一致性重测或 κ 统计的统一发布——这是使用 ADOS/ADI-R 分量表做精细建模时需要显式承认的不确定性(可重复性讨论见 [12] 与 §7.2)。
§3.7 采集周期
ABIDE 汇聚的是各站点 2012 年(I 期)/ 2016 年(II 期)之前已完成的既有扫描,单站点原始采集跨越数年,扫描协议随站点设备升级存在批次差异;ABIDE II 两个纵向集在 1-4 年间隔内对 38 名受试者完成两次采集 [2]。整体发布窗口为 2012-2017。
§3.8 地域覆盖
I 期站点分布于美国(11 个)、比利时(KUL)、德国(LMU)、荷兰(SBL)、爱尔兰(TCD)[8];II 期新增瑞士(ETH Zurich)、加拿大与美国多州站点(BNI、GU、IU、UC Davis、ONRC、SU 等),共 19 个站点 [2][10]。元数据语言为英文。
§3.9 设备规格
- 多厂家混合:站点间扫描仪厂家、场强与序列参数差异显著(各站点剖面在 fcon_1000 官网逐站公布 MRI 协议),构成本数据集最大的域偏移来源(§6.5 坑点 1)。
- TR/体素:功能像 TR 与体素大小站点间不一致;分析时必须按站点分层检查采样率对头动指标(如 Framewise Displacement)的影响 [12]。
- 扫描时长:功能像时间点数站点间从数十到数百不等,构建连接矩阵时需统一可用帧数或用标准化方法。
§3.10 深度溯源链
原始采集(各站点 IRB 批准的研究项目)→ 各站点匿名化(HIPAA,去面部)→ NYU Langone Child Study Center 汇聚与表型整理(I 期)/ NKI + Child Mind Institute(II 期)→ NITRC/INDI 平台发布(1000 Functional Connectomes Project 生态)→ AWS S3 fcp-indi 开放桶镜像(BIDS 化)→ Preprocessed Connectomes Project(Craddock 等主持,四管线 × 四策略 + QC)[1][2][3]。溯源各环节均有公开文档与署名页面,II 期论文提供 ISA-Tab 机器可读元数据 [2]。
§4 数据结构
§4.0 目录树预览
以下展示 AWS S3 fcp-indi 桶中 ABIDE 的典型 BIDS 目录与预处理衍生数据布局(原始数据下载到本地 data_root 后):
data_root/ # 本地挂载点,例如 /datasets/abide
└── RawDataBIDS/ # ABIDE I 原始 BIDS(匿名 S3:s3://fcp-indi/data/Projects/ABIDE/RawDataBIDS)
├── sub-0050001/ # 每个受试者一个目录(SUB_ID 七位补零)
│ ├── anat/
│ │ └── sub-0050001_T1w.nii.gz
│ └── func/
│ └── sub-0050001_task-rest_bold.nii.gz
│ └── sub-0050001_task-rest_bold.json # 含 TR、翻转角、采集协议等元数据
├── sub-0050002/
└── participants.tsv # BIDS 级表型索引(部分镜像含)
Outputs/ # Preprocessed Connectomes Project 衍生(原 s3.amazonaws.com/fcp-indi/...)
└── ABIDE_Initiative/
├── Phenotypic_V1_0b_preprocessed1.csv # 汇总表:表型 + FILE_ID + 16 项 QC + 人工 QC + SUB_IN_SMP
└── Outputs/
├── cpac/ # pipeline: cpac | ccs | dparsf | niak
│ └── filt_noglobal/ # strategy: filt_* / nofilt_* × *_global / *_noglobal
│ ├── alff/ # 衍生体指标:.nii.gz
│ ├── reho/
│ ├── vmhc/
│ ├── lfcd/
│ └── rois_cc200/ # ROI 时间序列:.1D(200 列,CC200 图谱)
│ └── NYU_0050001_rois_cc200.1D
└── ...
注:S3 桶路径多年间有迁移;下载前务必先用
aws s3 ls探测目标前缀是否存在,无法访问时改走 fcon_1000 官网逐站点 tar.gz 通道(§6.2 给出可回退的 wget 命令)。
§4.1 DAIMS 字段字典
以下为 Preprocessed 汇总表 Phenotypic_V1_0b_preprocessed1.csv 的核心字段字典(诊断/临床核心列):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SUB_ID | 整数 | 受试者唯一编号 | 50001 | 记录级主键 | 无 | 无 | 10001-51858 |
| SITE_ID | 文本 | 采集站点代码 | NYU | 域分组、LOSO 划分 | 站点命名约定(UM/UM1) | 无 | NYU, UM, USM… |
| FILE_ID | 文本 | SITE_ID_SUB_ID(七位补零) | NYU_0050001 | 映射到预处理文件名 | 需用预处理版才有 | 无 | 站点_7 位编号 |
| DX_GROUP | 整数 | 诊断分组 | 1 | 分类标签 | 各站点诊断标准差异 | 无 | 1=ASD, 2=对照 |
| DSM_IV_TR | 整数 | DSM-IV-TR 类别 | 0/1/2/3/4 | 亚型分析 | 历史亚型已并入谱系 | 对照为 0 | 0=Control,1=Autism,2=Aspergers,3=PDD-NOS,4=Aspergers/PDD |
| AGE_AT_SCAN | 浮点 | 扫描时年龄(年) | 14.2 | 协变量、分层 | 站点记录精度不一 | NaN | 5.0-64.0 |
| SEX | 整数 | 性别 | 1 | 协变量、公平性 | 生物性别自报 | NaN | 1=男, 2=女 |
| HANDEDNESS | 整数 | 利手 | 1/2/3 | 协变量 | 自报 | NaN | 1=R,2=L,3=两者 |
| FIQ/VIQ/PIQ | 浮点 | 全量表/言语/操作智商 | 105 | 认知分层 | 各站点智力量表不同 | NaN | 约 40-150 |
| IQ_TEST | 文本 | 所用智力量表 | WISC-IV | 量表调和 | 站点间量表不一致 | NaN | WISC/WAIS/SB… |
| ADOS_TOTAL | 浮点 | ADOS 总分(交流+社交) | 9 | 严重度回归 | 模块/版本不同,跨度大 | NaN | 约 0-27 |
| ADOS_GOTHAM/SEV | 浮点 | ADOS 严重度标定(II 期有) | 7 | 严重度标准化 | 需校准 | NaN | 0-10 |
| ADI_R_SOCIAL_TOTAL_A | 浮点 | ADI-R 社会互动子量表 A | 14 | 症状域分析 | 父母访谈主观性 | NaN | 0-30 |
| SRS_RAW_TOTAL | 浮点 | 社会反应量表原始分 | 82 | 症状连续评分 | 版本差异 | NaN | 0-195 |
| MEDICATION | 整数 | 扫描时是否用药 | 1 | 混杂识别 | 自报/记录不一 | NaN | 0/1 |
| SUB_IN_SMP | 整数 | 是否入 Di Martino 2014 主分析 | 1 | 复现论文样本 | 固定 | 无 | 0/1 |
注:各站点字段缺失情况差异极大;NaN/空串/n/a 混用是使用原始表型文件的常见坑(见 §6.5 坑点 4)。
§4.2 标签分布
| 分组 | ABIDE I | ABIDE II |
|---|---|---|
| ASD | 539(48.5%) | 521(46.8%,官网口径) |
| 对照 | 573(51.5%) | 593(53.2%) |
| 合计 | 1,112 | 1,114 |
组别基本均衡,但站点内比例失衡显著(如 NYU 对照组 105 对 ASD 79、USM 对照组 101 对 ASD 58 [8]),因此用全样本随机划分做分类会学进站点协变量(§6.5 坑点 1)。性别在组内同样失衡:I 期 ASD 组男性约 79%,对照组男性约 76% [8]。
§4.3 关键统计
- 两期合计独立受试者 2,156 人(I 期 1,112 + II 期独立 1,044),其中 ASD 共 1,026、对照 1,130 [2]。
- I 期年龄中位约 14.7 岁,范围 7-64 岁 [9];II 期范围 5-64 岁 [2]。
- I 期最大站点 NYU 贡献 184 个数据集(16.5%),前 3 站点(NYU、UM、USM)合计约 39% [8]。
- II 期含 284 个 dMRI 数据集与 38 名纵向复扫受试者 [2]。
§4.4 数据层级
受试者(SUB_ID)→ 站点(SITE_ID)→ 一次影像会话(session)→ 序列(T1 / resting BOLD / 可选 dMRI)→ 4D 功能像切片/时间帧;表型以受试者为粒度宽表存储。多站点汇聚使「受试者」与「扫描仪批次」高度相关——同一站点的受试者共享同一套采集参数,这是连接分析中站点域偏移的物理根源。
§4.5 缺失值
| 字段类别 | 缺失特征 | 处理建议 |
|---|---|---|
| 诊断量表(ADOS/ADI-R/SRS) | ASD 组量表覆盖完整,对照常无 ADOS(因无临床评估必要);仅部分受试者有全套 | 按任务选子集;量表缺失的对照不要硬编码 0 |
| IQ | FIQ/VIQ/PIQ 因站点工具不同部分缺失 | 用 FIQ 做主 IQ 协变量最稳,逐字段检查 |
| SEX/HANDEDNESS | 个别站点整体缺失 | 需站点感知插补或直接剔除该特征 |
| 表型 vs 影像 | 表型有的受试者未必有全部影像会话(多会话) | 以影像 FILE_ID 为准 join 表型 |
§4.6 预处理汇总表的关键列速查(FILE_ID 映射 + QC)
Preprocessed 汇总表 Phenotypic_V1_0b_preprocessed1.csv 在原始表型基础上新增三类关键列,是构建可用样本的首选依据:
| 列 | 说明 | AI 用途 |
|---|---|---|
| FILE_ID | SITE_ID_SUB_ID(SUB_ID 七位补零) | 拼接到衍生文件名(rois 时序、体指标),是表型↔影像 join 的钥匙 |
| SUB_IN_SMP | 是否入 Di Martino 2014 论文主分析 | 复现论文样本(1,102 人) |
| func_mean_fd / func_perc_fd | 平均/百分比帧位移(头动代理) | 头动协变量或剔除阈值 |
| func_outlier / func_dvars | 离群帧比例 / 帧间 BOLD 方差 | scrubbing 前置检查 |
| anat_snr / anat_fber / anat_fwhm / anat_cnr / anat_efc / anat_qi1 | T1 信噪比/伪影能量/平滑度等自动质量指标 | 结构像 QC 筛选 |
| func_snr / func_gsr | 功能信噪比 / 全局信号残差代理 | 功能像 QC |
| qc_rater_1 / qc_anat_rater_2 / qc_func_rater_2 / qc_anat_rater_3 | 多位标注者对解剖/功能像的人工 QC 评分 | 人工质量门控(把标注者拒绝的受试者剔除) |
| qc_notes_rater_* | 标注者备注 | 异常排查(头动、伪影、脑区裁剪) |
使用惯例:多数严谨研究要求「带标签 + 头动达标 + 人工 QC 通过」三者同时满足才纳入分析。不同论文阈值不同,务必在方法节写清你用哪几列、阈值多少(如
func_mean_fd < 0.3mm、qc_func_rater_2 == 1),否则无法与其他工作对齐——这直接对应 §6.5 坑点 2 与坑点 7。
§4.7 站点命名与多会话的坑位地图
站点代码并非一一对应「一个机构一个名字」,ABIDE I 就有同机构被拆为多个站点的先例,跨期使用时极易配错:
| 站点/会话 | 机构 | 注意 |
|---|---|---|
| UM-1 / UM-2(I 期) | 密歇根大学 | 同一机构两个独立采集队列,站点代码不同 |
| UCLA-1 / UCLA-2(I 期) | 加州大学洛杉矶分校 | 同上 |
| LEUVEN-1 / LEUVEN-2 | 鲁汶大学 | 同上 |
| NYU(I 期多会话) | 纽约大学 | 部分受试者有两次扫描会话,需按 SUB_ID 去重 |
| UCLA_Long / PITT(II 期纵向) | UCLA / 匹兹堡 | II 期纵向集,38 人 1-4 年两次扫描 |
处理建议:构造 SUB_ID → 站点 + 会话的显式映射表;做 LOSO 前先确认该站点的「重复会话受试者」不会被拆进两折(§6.5 坑点 5);论文复现时核对对方用哪个站点拆分版本。
§5 划分与使用建议
§5.0 官方划分
ABIDE 不提供任何官方训练/测试/验证划分。受试者以「数据集」为单位独立开放,站点间无重叠受试者(II 期论文明确说明两期样本独立 [2],但同站点代码命名需注意 UM_1/UM_2、UCLA_1/UCLA_2、LEUVEN_1/LEUVEN_2 的拆分)。
§5.1 社区惯例划分
社区事实标准有两种评估协议(见表):
| 协议 | 做法 | 场景 | 代表性结果(精度) |
|---|---|---|---|
| 10 折交叉验证 | 受试者级随机 10 折 | 报告泛化上限 | Heinsfeld 70%、EV-GCN 81% [11][13] |
| Leave-One-Site-Out(LOSO) | 每次留一个站点做测试 | 检验跨站点迁移 | Heinsfeld 65%、Graph2Img 80% [11][14] |
§5.2 划分策略建议
- 报告精度的诚实基线是 LOSO:随机 k 折会把站点签名也当判别信号,得到虚高精度(普遍高 5-15 个百分点)。即使你用随机划分,也请同时给出 LOSO 以披露域偏移真实成本。
- 亚组划分:如需研究性别差异,请按「同站点内」做男女性匹配(性别 × 站点强相关,避免把性别与站点混淆)。
- 多会话受试者:UCLA/PITT 纵向集同一人有两次扫描,随机划分会把同一人拆进训练与测试 → 信息泄漏(§6.5 坑点 5)。训练/测试必须落在受试者级。
§5.3 泄漏风险(重点)
- 站点标签泄漏:分类器可轻易学到「站点 → 诊断倾向」而非「连接 → ASD」。症状严重的学术中心倾向收录更多确诊患者,导致站点与标签相关。缓解:LOSO + 站点感知批归一化 + 报告混淆矩阵按站点透视。
- 受试者级泄漏(纵向):同受试者两次会话若被随机划分进入训练与测试,测试性能被污染。必须按 SUB_ID 划断。
- 表型泄漏(量表泄漏):部分论文(如某些多模态模型)把 ADOS/SRS 等诊断量表特征喂给模型——这些分数本身就是诊断的一部分,等价于把标签泄漏进特征(CodeSOTA 将其列为「数据泄漏」项)。纯影像任务禁止用临床量表做输入;想探讨量表-影像关系时应改用预测任务而非分类。
- 预处理泄漏:跨站点统一的 Z-score 若在合并所有站点后计算,会把站点均值/方差信息带入;规范做法是 LOSO 内、或至少按站点拆分估计标准化参数。
§5.4 交叉验证建议
推荐「受试者级、嵌套」设计:外层 LOSO(披露跨站点鲁棒性)+ 内层站点内 5 折(调超参)。所有特征选择、ComBat 调和参数、阈值搜索必须在训练折内估计,严禁在全样本上先行标准化/调参后交叉验证(双盲防泄漏)。
§5.5 外部验证建议
ABIDE 本身是「验证集仓库」:把 ABIDE I 训练的模型拿到 ABIDE II 上验证是标准的跨数据测试(两期站点与样本独立)[2]。更强外推需用 NDAR、ADHD-200(同类多站点 rs-fMRI,检验是否只学到 ASD 特异信号还是通用连接伪差)、UK Biobank 的配对健康对照做阴性对照。§7.8 给出有同行评审支撑的外部验证结果。
§5.6 受试者级 + 嵌套 LOSO 的最小可用流程
把前面规范落到一个可直接套用的受试者级嵌套评估骨架,避免训练与测试折之间漏出「同受试者」或「同站点签名」:
import numpy as np, pandas as pd
from itertools import combinations
from sklearn.model_selection import train_test_split
from sklearn.svm import LinearSVC
from sklearn.metrics import accuracy_score
df = pd.read_csv('Phenotypic_V1_0b_preprocessed1.csv')
# 1) 受试者级去重:多会话只保留该 SUB_ID 第一次(示例),并据此重建 FILE_ID 集合
df = df.drop_duplicates(subset='SUB_ID', keep='first')
# 2) 只保留带标签、头动达标、有人工 QC 通过的样本(阈值按需调整)
ok = df['DX_GROUP'].isin([1, 2]) & (df['func_mean_fd'].fillna(1) < 0.3)
df = df[ok].reset_index(drop=True)
sites = df['SITE_ID'].values
y = (df['DX_GROUP'].values == 1).astype(int) # ASD=1
# 3) 组装特征(伪码:每行一张 CC200 连接上三角向量,X shape (n, 19900))
# X = build_all_connectomes(df['FILE_ID'].values)
# 4) LOSO 循环:留一站点,训练折内再 split 做调参(此处省略内部 search)
from collections import defaultdict
per_site_acc = defaultdict(list)
for test_site in np.unique(sites):
test = sites == test_site
train = ~test
if len(set(y[test])) < 2:
continue # 测试折全同标签则跳过(此站点信息量不足)
clf = LinearSVC(class_weight='balanced', max_iter=5000)
clf.fit(X[train], y[train])
per_site_acc[test_site].append(accuracy_score(y[test], clf.predict(X[test])))
print('各站点测试精度:', {k: round(float(np.mean(v)), 3) for k, v in per_site_acc.items()})
print('LOSO 总平均:', round(float(np.mean([v[0] for v in per_site_acc.values()])), 3))
要点:
- 特征构建、标准化、任何参数搜索都只基于
train折(含站点拆分前的统一归一化要改为「按训练折估计后应用到测试折」)。 - 若站点过多导致 LOSO 折内样本太偏,可改用「站点成组 k-fold(GroupKFold)」作为折中——但它仍会让多个站点共享一组,无法像 LOSO 那样逐站披露迁移能力。
- 结果请同时给「按站点透视表」与「总体均值 ± 站点间标准差」,后者直接反映域偏移的代价(§6.5 坑点 1)。
§6 AI 就绪指南
§6.0 云端快速启动
Preprocessed 数据无需 GPU 即可完成连接组提取与分类 baseline;模型训练需要 GPU 时建议 1× NVIDIA V100/A100(或云端租用)。由于原始 BIDS 体积为 TB 级,强烈建议先用 Preprocessed 的 CC200 ROI 时序跑通全流程(约 1-2 GB),确认方法正确后再按需拉取原始数据重训。所有下载命令通过 AWS CLI 匿名访问(–no-sign-request),无需账号密钥。
若你只有一台笔记本或 CPU 云机,也完全够用:连接组 + SVM 的基线(§5.6、§6.3)在 8 核 CPU 上几分钟内即可跑完;真正吃 GPU 的只是深度/GNN 模型的训练阶段。建议把「数据下载 → 特征缓存 → 模型训练」拆成三步脚本,缓存 .npy 特征,避免每次改模型都重新解析几千个 .1D 文件。
§6.1 快速上手
本数据集是体数据 + 表型宽表结构,非表格回归任务。第一步通常是把每名受试者的 4D fMRI 提炼为功能连接矩阵。先准备 Preprocessed 数据:
# 1) 安装依赖
pip install nilearn scikit-learn pandas numpy nibabel
# 2) 下载 Preprocessed 汇总表(含 FILE_ID 映射、QC 与标签),约数 MB
curl -O https://s3.amazonaws.com/fcp-indi/data/Projects/ABIDE_Initiative/Phenotypic_V1_0b_preprocessed1.csv
# 3) 建立本地目录结构(data_root/rois_cc200)
mkdir -p abide/rois_cc200
本指南采用最小可用子集 = 1 条 C-PAC 管线(filt_noglobal 策略,不回归全局信号,避免 GSR 争议)+ CC200 图谱 200 ROI 时序。目录预期为 data_root/rois_cc200/<FILE_ID>_rois_cc200.1D;若改从官网拉取,需自行解包各站点 tar.gz。
§6.2 数据获取
| 渠道 | 内容 | 命令/方式 | 大小 |
|---|---|---|---|
| AWS S3(推荐,匿名) | 原始 BIDS / 预处理衍生 | aws s3 sync s3://fcp-indi/data/Projects/ABIDE_Initiative/Outputs/cpac/filt_noglobal/rois_cc200/ abide/rois_cc200/ --no-sign-request |
每受试者 ~0.5-2 MB |
| AWS S3 原始 BIDS | 全量 4D 原始 | aws s3 sync s3://fcp-indi/data/Projects/ABIDE/RawDataBIDS/ abide/raw/ --no-sign-request |
TB 级,慎用 |
| fcon_1000 官网 | 站点原始包 | NITRC 登录后逐站点下载 tar.gz | 逐站点数 GB |
| Preprocessed 官网 | QC/汇总表 | curl -O http://preprocessed-connectomes-project.org/abide/Phenotypic_V1_0b_preprocessed1.csv |
数 MB |
按表型筛选受试者再定向下载的脚本见 [3](Python 示例脚本随该页发布)。获取后第一步检查列:确认存在 DX_GROUP、AGE_AT_SCAN、FILE_ID、SUB_IN_SMP;缺 FILE_ID 的是未预处理的旧表型文件,无法映射到衍生文件名。
§6.2a 下载到可用状态:一个验证脚本
拿到表型 CSV 后,先把「能用哪些受试者」盘点清楚再拉数据,避免整桶同步后才发现格式不符。下面脚本可一键验证可用子集规模:
import pandas as pd
df = pd.read_csv('Phenotypic_V1_0b_preprocessed1.csv', dtype={'SUB_ID': str})
# 关键列是否齐备
req = ['SUB_ID', 'SITE_ID', 'FILE_ID', 'DX_GROUP', 'AGE_AT_SCAN']
missing_cols = [c for c in req if c not in df.columns]
if missing_cols:
raise SystemExit(f"表型缺少列: {missing_cols} —— 请改用 Preprocessed 版汇总表")
# 归一缺失编码(NaN / 空串 / n/a / -9999 统一为 NaN)
df = df.replace({'n/a': None, 'NA': None, '': None, -9999: None})
# 标签完整性
has_label = df['DX_GROUP'].isin([1, 2])
print('带诊断标签的受试者:', has_label.sum())
# 头动质量筛(按文献常用 FD 阈值,示例)
if 'func_mean_fd' in df.columns:
good_motion = df['func_mean_fd'].astype(float) < 0.3
print('FD<0.3mm 且带标签:', int((has_label & good_motion).sum()))
# 站点分布(用于 LOSO)
print(df.groupby('SITE_ID').size().sort_values(ascending=False).head(10))
下载本身分「需注册」与「免注册」两类:NITRC 官网渠道需登录逐站点取 tar.gz;AWS S3 渠道免注册(--no-sign-request),但路径前缀可能随维护迁移——首次连接先探测:
# 探测 S3 前缀是否存在(成功则列出文件)
aws s3 ls s3://fcp-indi/data/Projects/ABIDE_Initiative/Outputs/cpac/filt_noglobal/rois_cc200/ --no-sign-request | head -5
# 若上面失败,尝试 fcp-indi 根看可用的 ABIDE 前缀
aws s3 ls s3://fcp-indi/data/Projects/ --no-sign-request
# 官网回退渠道:预处理的 wget 逐文件下载示例(不可用通配符,需枚举 URL)
# curl -O https://s3.amazonaws.com/fcp-indi/data/Projects/ABIDE_Initiative/Outputs/cpac/filt_noglobal/rois_cc200/NYU_0050001_rois_cc200.1D
若你只需要少数受试者做方法验证,可在浏览器/Cyberduck 直接浏览该 S3 前缀按需取文件,无需一次性拉全量。全量拉取前请核对磁盘与带宽(Preprocessed 单管线 ROI 时序子集约 1-2 GB;原始 BIDS 为 TB 级)。
§6.3a 四管线 × 四策略与衍生指标速查
Preprocessed Connectomes Project 的目录命名把「预处理管线」与「去噪策略」解耦,理解它才能选对文件:
| 维度 | 取值 | 含义 |
|---|---|---|
| pipeline | cpac / ccs / dparsf / niak | C-PAC(Configurable Pipeline for the Analysis of Connectomes)、CCS(Connectome Computation System)、DPARSF(静息态处理助手,SPM 基础)、NIAK(NeuroImaging Analysis Kit) |
| strategy | filt_global / filt_noglobal / nofilt_global / nofilt_noglobal | 是否带通滤波(filt_)× 是否回归全局信号(_global)的 2×2 组合 |
| 结构管线 | ANTS / CIVET / FreeSurfer | 用于皮层厚度、体积等结构衍生测量(独立于功能管线) |
衍生指标(derivative)分两类:
- 体指标(.nii.gz):alff、falff(低频振幅)、reho(局部一致性)、vmhc(体素镜像同伦连接)、lfcd(低频波动连接密度)、degree_/eigenvector_/dual_regression 等
- ROI 时序(.1D):rois_aal(AAL 116)、rois_cc200/rois_cc400(CC 图谱 200/400 ROI)、rois_dosenbach160、rois_ho、rois_ez、rois_tt
选型建议:入门/通用分类选 cpac/filt_noglobal/rois_cc200(不回归全局信号避免负相关争议,200 维适中);需与文献对比时优先抄对方所用 pipeline 与 strategy,否则结论无可比性(对应 §6.5 坑点 3)。
§6.3 预处理全流程
本指南默认使用已预处理的 CC200 ROI 时序(节省数小时)。若要处理原始数据,先经过 fmriprep 或 C-PAC;此处给出从 ROI 时序到可训练特征的标准流程:
import pandas as pd, numpy as np
from scipy.stats import pearsonr
pheno = pd.read_csv('Phenotypic_V1_0b_preprocessed1.csv')
# 精简为可用样本:标注完整 + 平均头动达标(按文献常用阈值 FD<0.2mm,示例)
usable = pheno.dropna(subset=['DX_GROUP', 'AGE_AT_SCAN'])
usable = usable[usable['func_mean_fd'].fillna(1.0) < 0.3] # 头动过大的受试者剔除(示例阈值)
print('可用受试者:', len(usable))
def load_roi_timeseries(file_id, data_dir='abide/rois_cc200'):
"""返回形状 (n_time, 200) 的 ROI 时序矩阵"""
path = f"{data_dir}/{file_id}_rois_cc200.1D"
ts = np.loadtxt(path) # 每列一个 ROI 的 BOLD 时序
return ts
def build_connectome(ts):
"""Pearson 相关矩阵 (200,200),去除对角线,Fisher z 变换"""
c = np.corrcoef(ts.T)
z = np.arctanh(np.clip(c, -0.9999, 0.9999))
np.fill_diagonal(z, 0) # 去对角(自相关)
iu = np.triu_indices_from(z, k=1)
return z[iu] # 上三角向量作为特征
Xs, ys = [], []
for _, r in usable.iterrows():
try:
ts = load_roi_timeseries(r['FILE_ID'])
Xs.append(build_connectome(ts))
ys.append(1 if r['DX_GROUP'] == 1 else 0) # 1=ASD, 0=对照
except Exception:
continue # 文件缺失的受试者跳过
X = np.stack(Xs); y = np.array(ys)
print('特征维度(上三角 200x200):', X.shape)
§6.4 PyTorch DataLoader
端到端可运行的分类 DataLoader(受试者级 + 支持 LOSO 站点划分):
import torch
from torch.utils.data import Dataset, DataLoader
import numpy as np, pandas as pd
class AbideConnectomeDataset(Dataset):
"""功能连接上三角向量数据集;site 用于 LOSO 分组"""
def __init__(self, pheno_path, data_dir='abide/rois_cc200', site_filter=None):
df = pd.read_csv(pheno_path)
df = df.dropna(subset=['DX_GROUP'])
if site_filter is not None:
df = df[df['SITE_ID'].isin(site_filter)]
self.X, self.y, self.sites, self.ids = [], [], [], []
for _, r in df.iterrows():
try:
ts = np.loadtxt(f"{data_dir}/{r['FILE_ID']}_rois_cc200.1D")
except Exception:
continue
c = np.corrcoef(ts.T); np.fill_diagonal(c, 0)
z = np.arctanh(np.clip(c, -0.9999, 0.9999))
self.X.append(z[np.triu_indices_from(z, k=1)])
self.y.append(1 if r['DX_GROUP'] == 1 else 0)
self.sites.append(r['SITE_ID']); self.ids.append(r['FILE_ID'])
self.X = torch.tensor(np.stack(self.X), dtype=torch.float32)
self.y = torch.tensor(self.y, dtype=torch.long)
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return self.X[i], self.y[i]
# 用法示例:留出 NYU 站点做测试(LOSO 单折)
train_ds = AbideConnectomeDataset('Phenotypic_V1_0b_preprocessed1.csv', site_filter=['NYU'])
train_dl = DataLoader(train_ds, batch_size=32, shuffle=True)
for xb, yb in train_dl: # xb: (B, 19900), yb: (B,)
print(xb.shape, yb.shape)
break
§6.5 坑点(8 个)
⚠️ 坑点 1:多站点域偏移使随机 k 折精度虚高(分类:评估误用)
问题:ABIDE 17+19 个站点在扫描仪厂家、场强、TR、入组标准上均不同,站点与诊断倾向相关(高收治中心含更多确诊患者)。随机交叉验证让分类器学到「哪个站点 → 哪个标签」的捷径,而非「连接异常 → ASD」的生物学信号。
症状:同一模型随机 10 折精度(70%-81%)显著高于 leave-one-site-out(LOSO,63%-65%),差 5-15 个百分点 [11][14];混淆矩阵按站点透视时某些站点异常高。
解决:
- 简单方法:至少同时报告 LOSO 精度;测试集必须为完整站点而非跨站点随机采样。
- 进阶方法:站点感知批归一化、把 SITE_ID 作为预测混淆矩阵的分层变量,用 ComBat/neuroHarmonize 做批量调和后再分类。
- SOTA 方法:Adversarial 域适应 / 站点感知损失函数(如把域判别器损失反转对抗),在特征空间消除站点签名(相关 GNN/对抗方法见 §8)。
参考:Heinsfeld et al., 2018, NeuroImage: Clinical [11];Frontiers 图学习综述对 LOSO 与 10 折的逐站点对比 [14]
⚠️ 坑点 2:头动伪差在 ASD 组系统性更高(分类:偏倚陷阱)
问题:ASD 受试者在静息扫描中不自主头动显著高于对照,头动本身会改变功能连接估计;若不当协变量回归或剔除,模型学到的「ASD 信号」可能是「更爱动」的头动伪差。
症状:头动大的受试者被系统误分;去除高头动受试者后模型精度骤降(说明判别主要来自头动);scrubbing 后不同站点可用帧数差异巨大,样本构成被站点扭曲 [12]。
解决:
- 简单方法:用 Preprocessed 表的
func_mean_fd/func_perc_fd作协变量或按阈值(如 FD < 0.3 mm)剔除;报告剔除前后精度变化。- 进阶方法:24 参数 Friston 头动模型 + scrubbing + 帧位移加权,并在站点层面归一化 scrubbing 造成的可用帧差异 [12]。
- SOTA 方法:ICA-AROMA 运动去噪 + 在空模型/置换检验里显式建模头动与诊断的关联。
参考:Torres & Denisova, 2016, Front. Integr. Neurosci.(ABIDE 头动分析)[12]
⚠️ 坑点 3:GSR 与带通滤波策略改变功能连接结论(分类:预处理陷阱)
问题:全局信号回归(GSR)与带通滤波争议已久:是否回归全局信号会反转某些连接的方向甚至组间差异符号。ABIDE 官方为此把 4 条管线 × 4 种策略并列发布,而非替你选一个。
症状:同一批受试者在filt_globalvsfilt_noglobal策略下得到相反的组间连接模式;论文间无法复现,因为双方用的策略不同。
解决:
- 简单方法:默认用
filt_noglobal(避免 GSR 引入负相关假象);报告所用 strategy。- 进阶方法:把「策略选择」作为显式的稳健性分析维度,报告多种策略下的结论一致性(Abraham 等 [5] 的做法)。
- SOTA 方法:用 ICA 去噪 / fMRIPrep 默认流程替代 GSR 二选一;或在多种预处理设定上做集成。
参考:Preprocessed Connectomes Project 官方下载说明(4 strategy 定义)[3];Abraham et al., 2017, NeuroImage [5]
⚠️ 坑点 4:原始表型 CSV 的缺失值与大坑编码混乱(分类:工程陷阱)
问题:ABIDE 原始表型用
NaN、n/a、空串、-9999等混用表示缺失;且非预处理版表型不含FILE_ID列(无法映射到衍生文件名);DSM-IV-TR 亚型编码在个别文件里还不一致。
症状:pd.read_csv后DX_GROUP出现字符串空值导致astype崩溃;dropna 误删整行;用旧表型文件 join 影像文件名全部失败。
解决:
- 简单方法:统一用 Preprocessed 汇总表
Phenotypic_V1_0b_preprocessed1.csv(含 FILE_ID、QC、SUB_IN_SMP),而非官网原始表型文件。- 进阶方法:清洗脚本把
NaN/NA/''/-9999统一为np.nan,并按字段域白名单校验 DX_GROUP ∈ {1,2}、SEX ∈ {1,2}。- SOTA 方法:社区已发布标准化表型清洗脚本(surchs/ASD_subtype_code_supplement 的 scripts/pheno),直接复用其
abide_1_prepare_pheno.py等脚本 [4]。
参考:NITRC 论坛「abide phenotypic data」线程 [15];ASD subtype code supplement [4]
⚠️ 坑点 5:纵向/多会话受试者导致受试者级泄漏(分类:数据泄漏)
问题:NYU 部分受试者有两次扫描会话,II 期更含 UCLA/PITT 两个纵向集(38 人 1-4 年复扫)。若随机把「会话/数据集」而非「受试者」作为划分单元,同一人会同时进入训练与测试。
症状:模型在个别站点测试精度异常高;换人复现时性能崩盘——因为它记住了人而非规律。
解决:
- 简单方法:始终以 SUB_ID 做划分单元,多会话取其一或作为独立增强后仍保证 SUB_ID 不出现在两折。
- 进阶方法:构建受试者级去重表(同一 SUB_ID 全保留但归入同一 fold)再交叉验证。
- SOTA 方法:对 II 期独立横断面子集(1,044,剔除纵向第二次)评估,再单独用纵向集做个体内稳定性研究 [2]。
参考:Di Martino et al., 2017, Scientific Data(II 期纵向口径)[2];Frontiers 站点拆分研究 [14]
⚠️ 坑点 6:样本规模口径不一致误导报告(分类:标签理解)
问题:ABIDE 官网宣传「2,226 个数据集」是含纵向重复的数据集口径,而论文主分析用「2,156 名独立受试者」(II 期论文)或「1,044 名独立 II 期横断面」。多篇研究把 1,114 当独立人数上报,造成口径混乱。
症状:复现论文时样本数对不上;引用「2,226 名患者」在严谨同行评审中被质疑;报告 AUC 时分母不清。
解决:
- 简单方法:统一报「数据集数」与「独立受试者数」两个数字,并在方法节说明是否剔除纵向复扫。
- 进阶方法:用 SUB_ID 去重后自报独立人数并写进 README。
- SOTA 方法:以 II 期论文的独立横断面子集(1,044)为基准,把纵向集单列报告 [2]。
参考:Di Martino et al., 2017, Scientific Data [2]
⚠️ 坑点 7:原始数据未经 scrubbing,质量需自筛(分类:预处理陷阱)
问题:ABIDE 原始头动时间序列未经 scrubbing 处理保留(好事:可研究原始运动),但也意味着没有「官方干净的成品」——Preprocessed 只是按管线跑完,自动 QC 列
func_outlier/func_perc_fd与人工 QC 评分需使用者自行筛选。
症状:直接喂全部数据训练,高头动站点/受试者的噪声主导梯度,LOSO 时坏站点拖垮整体。
解决:
- 简单方法:用汇总表的
func_mean_fd与人工 QC(qc_rater_*)双重筛选,剔除 FD > 0.3mm 或 QC 判废的受试者。- 进阶方法:per-site 质量分析——某站点若
func_outlier比例整体偏高,单独评估是否站点级采集问题。- SOTA 方法:用 fmriprep 的头部运动 + ICA-AROMA 输出做统一的运动与噪声回归,替代依赖官方 QC 列。
参考:Preprocessed Connectomes Project 质量评估说明 [3];ABIDE 头动研究 [12]
⚠️ 坑点 8:ASD 异质性 + 单一中心交叉验证过拟合(分类:评估误用)
问题:ASD 是高度异质谱系(智力、语言、共病、性别、症状严重度差异大),而多数研究只在 ABIDE 一个源上随机交叉验证;Wolfers 等 [6] 元分析 57 项研究显示样本越大报告精度越低——单源小数据上的 80%+ 精度多半是过拟合的假繁荣。
症状:论文报 85% 甚至 98% 精度(如某些仅用部分受试者的工作),外部复制时掉到 60% 上下;不同站点上指标差异巨大。
解决:
- 简单方法:固定报告 LOSO + 按亚组(性别/年龄/站点)分层的指标;避免只报全样本单精度。
- 进阶方法:用独立外部集(ABIDE II 验证 ABIDE I 模型)做真正的外推评估(§7.8)。
- SOTA 方法:规范模型(normative modeling)识别亚型而非单一分类阈值;对精度声明附置信区间与置换检验 p 值,警惕 <300 样本量的非典型高精度报告。
参考:Wolfers et al., 2019(57 项研究元分析)[6];HBM 框架比较论文 [13]
§6.6 数据增强
安全 ✅:功能连接层面的图增强——ROI 子集采样、相关矩阵加性高斯噪声(σ 小)、弹性扰动连接权重;时序层面的滑动窗口切片重构多个连接矩阵。这些保持诊断标签语义、物理上可解释。
安全 ✅(有条件):多会话受试者的二次会话作为独立样本(须保证受试者不跨 train/test 折,否则泄漏)。
危险 ❌:对未经严格运动校正的 BOLD 做随机时间位移(会放大头动伪差);把 Z-score 在合并所有站点后全局标准化再增广(把站点分布泄进训练分布)。
危险 ❌:无条件图拓扑增广(随机加/删边)——ASD 相关连接差异极微弱,粗放增广会淹没真实信号。
一个「安全、可解释」的滑动窗口增广示例(在 ROI 时序层面做,事后从连接矩阵采样特征):
def sliding_window_augment(ts, win=120, stride=30, min_len=120):
"""把一条 (T, 200) 时序切成多条长度 win 的重叠子序列用于连接估计。
ts: 原始 (T, 200);T 需显著大于 win 才有增广价值。"""
out = []
for start in range(0, ts.shape[0] - win + 1, stride):
seg = ts[start:start + win]
# 运动污染检查:若子序列帧位移整体偏高则跳过(需先有 FD 时序)
out.append(seg)
return out # 每个元素为 (win, 200)
# 使用时注意:
# 1) 增广产生的「新样本」由同一受试者派生,绝不能跨 train/test 折(§6.5 坑点 5)
# 2) 与 §5.6 结合:增广只能在训练折内做,测试折永远用原始受试者
何时增广有价值:当你要用 GNN/CNN 这种「吃大量样本」的模型、而手头只有 1,000-2,000 个受试者时,滑动窗口能把每条时序切成多条估计,近似把受试者数放大一个量级。但要同步做强正则或 dropout,否则易过拟合时序本身的站点/头动模式。
§6.7 模型推荐表
| 模型族 | 代表工作 | 典型精度(ABIDE I, LOSO) | 适用场景 | 注意 |
|---|---|---|---|---|
| 经典连接组 + SVM | Abraham 2017 [5] | 10 折 67% | 稳健 baseline、方法学稳健性 | 快、可解释、无需 GPU |
| 堆叠去噪自编码 + MLP | Heinsfeld 2018 [11] | 70% / LOSO 65% | 深度学习起步基准 | 代码开源(acerta-abide) |
| 图卷积/图网络 GCN | Parisot 2018 | 70.4%(10 折) | 把站点/表型编码进图 | 需防站点→边泄漏 |
| EV-GCN(边变异) | Huang & Chung 2020 | 81%(10 折,非 LOSO) | 高阶连接变异性建模 | LOSO 未必如此高 |
| 多图谱深度集成 | Wang 2020 AIMAFE | — | 跨图谱鲁棒特征 | 计算量大 |
| Transformer/时序 | Dvornek 2017 LSTM | 68.5% | 直接建模时序 | 需较长时间序列 |
选型建议:先跑 Abraham 风格连接组 SVM 当 budget baseline(CPU 分钟级),再加 Heinsfeld 风格深度模型;追求跨站点泛化时优先 GNN + 对抗域适应,并用 LOSO 卡线。
§6.8 硬件需求表
| 阶段 | 典型负载 | 建议硬件 | 说明 |
|---|---|---|---|
| 连接组特征提取(2,226 受试者) | CPU 密集 | 8 核 CPU + 16 GB 内存 | 几分钟到 1 小时 |
| 经典 SVM/GBDT 分类 | CPU | 4 核即可 | 秒到分钟级 |
| 图/自编码深度模型 | 特征维度 ~20k,样本 ~1-2k | 1× GPU(8-16 GB 显存) | 几分钟到数小时 |
| 全量原始 BIDS + fmriprep | 4D 体数据 | 需大内存 + 多核/GPU;磁盘 TB 级 | 最耗时,建议先跑 ROI 子集 |
§6.9 评估指标代码
from sklearn.model_selection import LeaveOneGroupOut
from sklearn.svm import LinearSVC
from sklearn.metrics import accuracy_score, roc_auc_score, confusion_matrix
import numpy as np
# X: (n, 19900), y: 0/1, sites: 站点分组数组(与 X 行对齐)
logo = LeaveOneGroupOut()
accs, aucs = [], []
for train_idx, test_idx in logo.split(X, y, groups=sites):
clf = LinearSVC(class_weight='balanced', max_iter=5000)
clf.fit(X[train_idx], y[train_idx])
accs.append(accuracy_score(y[test_idx], clf.predict(X[test_idx])))
if len(set(y[test_idx])) == 2:
aucs.append(roc_auc_score(y[test_idx], clf.decision_function(X[test_idx])))
print(f"LOSO 平均精度: {np.mean(accs):.3f} ± {np.std(accs):.3f}")
print(f"LOSO 平均 AUC: {np.mean(aucs):.3f}")
# 诚实报告:务必附上按站点透视的混淆矩阵,观察是否存在站点捷径
§6.10 MLOps 笔记
- 版本锁定:表型与影像都须记录 S3 拉取日期与路径;Preprocessed 管线版本(C-PAC 等)影响结论,写入实验卡片。
- Conda/Docker:建议固定 Python 3.10 + nilearn/scikit-learn 版本;社区提供可复现 Docker 镜像(如 simexp/niak 系列)[4]。
- 实验追踪:把 SITE_ID 分布、可用样本数、策略(filt_global 等)、QC 阈值全部记进 config,作为 LOSO 可复现性的前提。
- 漂移监控:数据集自 2017 年后未再大幅更新,无需版本漂移监控;真正风险是你在更新库版本后重跑预处理结果漂移。
- 自动化建议:把「表型清洗 → 去重 → 特征化 → LOSO」串成一个可重复的 pipeline 脚本(Makefile 或 Python CLI),每次改阈值只改一个 config 文件,保证任何一版结果都能回溯到当时的样本口径。
§6.11 故障排查(常见报错与对策)
| 报错 / 现象 | 根因 | 对策 |
|---|---|---|
ValueError 表型读取失败 / 列数不对 |
用了非 Preprocessed 旧表型,或缺失编码使 CSV 解析错行 | 统一用 Phenotypic_V1_0b_preprocessed1.csv;pd.read_csv 时把缺失编码替换后再读 |
| 所有衍生文件名都 404 / S3 前缀为空 | S3 路径经多年迁移,前缀已变动或你拼错 FILE_ID | 先 aws s3 ls 探测(§6.2a);改用官网 tar.gz 通道回退 |
rois_cc200.1D 行数(时间点)不一致 |
各站点 TR 不同 → 不同受试者帧数不同 | 按需截到最小公共帧数或用滑动窗口;勿直接 stack |
| 模型精度离奇高(>90%) | 站点泄漏或受试者(多会话)泄漏 | 改用 LOSO + SUB_ID 去重(§6.5 坑点 1、5);检查是否把 ADOS 当输入 |
| LOSO 时某站点精度为 0% 或 100% | 该站点测试折几乎全同标签,或样本过少 | 报告中注明该站点信息量不足并跳过;不要掩盖 |
| 复现某论文数字对不上 | 对方用的样本/管线/划分与你不同 | 核对受试者 N、pipeline/strategy、评估协议(§8.3) |
| dtype 报错:DX_GROUP 混入空串 | 原始表型缺失用 '' 表示 |
统一 df['DX_GROUP'] = df['DX_GROUP'].astype(float) 前先 replace 空串 |
| 想用 fmriprep 但拉全量太大 | 原始 BIDS 为 TB 级 | 仅对需要的受试者/站点拉取;或用官方 fmriprep 衍生前缀按 FILE_ID 取 |
经验法则:ABIDE 上 90% 的「复现失败」不是模型问题,而是样本口径(受试者 N、多会话去重、QC 阈值)或评测协议(10 折 vs LOSO)没对齐。动手前先在方法节用一句话钉死这三点,能省掉整周的对坑时间。
§6.12 从 0 到可复现结果的端到端路线
把全篇落到一张执行路线图,方便直接照着排期:
- Day 1(约 1-2 小时):下载 Preprocessed 汇总表 +
rois_cc200(1-2 GB,§6.2);跑 §6.2a 脚本确认可用 N 与站点分布。 - Day 1(0.5 小时):跑 §6.3 脚本生成连接上三角特征(X: n×19,900),存
.npy与站点/标签数组。 - Day 2(2-4 小时):跑 §5.6 的 LOSO SVM baseline,得到逐站点精度与总均值(预计 60%-70% 区间)。
- Day 2-3(选做):换成 Heinsfeld 风格 SDA+MLP(§6.7),用 GPU 训 1-3 小时,对比 10 折 vs LOSO。
- Day 3-4(若要方法学):加入 ComBat/neuroHarmonize 或对抗域适应,做「调和前后」的 LOSO 消融(§6.5 坑点 1 进阶)。
- 收尾:按 §8.3 协议写全 7 项元数据;按 §9.4 清单填 README;跑一次 §9.4 的自查再提交。
这套流程不追求刷分,而是保证你的结果可复现、口径透明、能在别人论文里安全引用——这正是本数据上绝大多数工作最终失败(在评审或复现环节)的地方。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 多站点域偏移 | 扫描仪厂家/场强/TR/入组标准站点间差异,站点与诊断倾向相关 | 高 | LOSO、ComBat 调和、站点感知模型、对抗域适应(§6.5 坑点 1) |
| 头动混杂 | ASD 组头动系统性更高,影响连接估计 | 高 | FD 协变量/剔除、scrubbing、ICA-AROMA(§6.5 坑点 2) |
| 性别失衡 | 全样本女性约 20%-33%,ASD 组内女性更少 | 中 | 站点内性别匹配、ABIDE II 女性样本、分层报告(§7.5) |
| 收治/转诊偏倚 | 高功能男性 ASD 相对过度采样,智力受损严重者占比低 | 中 | 按 FIQ 分层、明确样本可代表人群边界 |
| 量表工具异质 | ADOS 模块/版本、IQ 量表站点间不一致 | 中 | 用严重度标定(CSS)、统一 FIQ 主协变量(§6.5 坑点 4) |
| 地域偏倚 | 以北美/欧洲为主,多为高收入地区 | 中 | 外推时注明地理局限,勿声称全球普适 |
§7.2 标注质量
诊断分组 DX_GROUP 源自各站点持证临床医师的 DSM-IV-TR 判断,属相对可靠的人工金标准,但跨站点入组与确诊流程独立、未做统一重测或 κ 一致性统计,精细使用 ADOS/ADI-R 分量表时存在不可量化的站点评定偏差;II 期虽强化表型仍以回顾性汇聚为主 [1][2][12]。临床量表(ADOS、IQ、用药)的个体间可重复性曾被 Torres 等公开质疑,建议对关键量表做再测稳定性检验或用严重度标定 [12]。
§7.3 泛化性表
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 单源随机 k 折内部性能 | 低(但虚高) | 站点签名被当作判别信号,Heinsfeld 70% vs LOSO 65% [11][14] |
| 跨站点(LOSO)迁移 | 中-高 | 逐站点精度波动大(61%-94%),部分站点拖低整体 [14] |
| 跨数据集(ABIDE I → II) | 高 | 两期站点/样本独立,是真实外推测试,多数模型外推掉点 |
| 临床部署(未知中心) | 极高 | 域偏移 + 异质性 + 无前瞻性验证,属科研数据不可直接临床化 |
§7.3b 如何判断你的结果「算不算好」
在 ABIDE 上,一个可复现、口径透明的「中等精度」(LOSO 约 65%)远好于一个来路不明、只能在特定子集复现的「高精度」。判断标准建议用三条基线锚定:
- 随机猜测底线:两期样本基本均衡(约 5:5),随机猜测精度约 50%,AUC 约 0.5。低于 60% 且未做任何特征筛选时,先怀疑头动/QC 筛选不足,而非方法失效。
- 连接组 + SVM 基准(Abraham 口径,10 折约 67%):如果你的深度模型在 10 折上打不过它,说明复杂度没换来增益;在 LOSO 上,绝大多数方法都回落到 65% 附近。
- LOSO 才是「诚实」数字:把 LOSO 精度当作对外宣称的主指标。若 LOSO 明显低于 10 折(差 >5 个百分点),说明你的判别里混入了站点信息——此时报高精度反而暴露方法缺陷(§6.5 坑点 1)。
一句话校准:在 ABIDE 上「80% 以上、可复现、跨站点稳定」目前并不存在公认方法;谁声称个体级 90%+,谁就先欠读者一份 LOSO + 受试者去重 + 代码公开的账。
§7.4 伦理
ABIDE 数据经各站点 IRB 批准采集、受试者/监护人知情同意、并按 HIPAA 完全匿名化(无受保护健康信息、结构像去除面部)后公开 [1][2]。作为公开去标识化研究数据,二次使用一般不新增 IRB 审批,但研究者仍需遵守 CC BY-NC-SA(非商业 + 相同方式共享)约束与 1000 FCP/INDI 协议。不能借「自动诊断」宣称替代临床医师,避免对个体的确定性诊断宣传(§10 伦理栏)。
§7.5 公平性
性别不均衡是全数据集结构性偏倚:I 期 ASD 组女性占比远低于男性(约 21%),导致女性 ASD 的影像表征研究证据稀疏。缓解路径:(1) 用 II 期扩大的女性样本做站点内匹配(II 期专为增强女性与共病覆盖而设计 [2]);(2) 分类评估必须按性别分层报告而非只看总精度;(3) 避免在小样本女性子集上过度下结论。年龄上以儿童-青少年为主(中位约 14.7 岁 [9]),成年晚期 ASD 外推证据不足。
§7.6 数据漂移
数据集采集期为 2012-2017 年并已定型,无持续数据漂移。真正可迁移性风险来自「方法学漂移」:ASD 诊断标准从 DSM-IV-TR 转向 DSM-5/ICD-11、预处理工具版本更新,都可能使历史标注与新协议间出现语义漂移——训练时须明确标注所用诊断版次。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 表型为宽表;ROI 时序为长格式(每列一个 ROI) |
| 2 | 唯一标识 | ✅ | SUB_ID(受试者)+ FILE_ID(会话/衍生映射)双主键 |
| 3 | 特殊字符 | ✅ | 站点名英文无特殊字符;文件名 ASCII |
| 4 | 重复行 | ⚠️ | 多会话受试者(纵向集)在数据集口径下重复,需按 SUB_ID 去重 |
| 5 | 缺失编码 | ⚠️ | NaN/空串/n/a 混用,需统一清洗(§6.5 坑点 4) |
| 6 | 标签标识 | ✅ | DX_GROUP 1/2 明确;DSM_IV_TR 亚型注释含混 |
| 7 | 罕见类分组 | ⚠️ | 女性 ASD、个别亚型样本少,未见官方聚合 |
| 8 | 偏倚评估 | ⚠️ | 官方列出站点差异但无正式偏倚声明报告 |
| 9 | 数据字典 | ✅ | ABIDE_LEGEND_V1.02.pdf 逐字段定义 |
| 10 | 信息性缺失解释 | ⚠️ | 量表缺失与站点工具相关,未显式文档化 |
| 11 | 设备记录 | ✅ | 逐站点 MRI 协议/剖面公开 |
| 12 | 共线性 | ⚠️ | 站点与性别/智商等强相关,官方未量化 VIF |
| 13 | 编码映射 | ✅ | DSM-IV-TR → DSM-5/ICD-11 可追溯 |
| 14 | 时间戳处理 | ✅ | AGE_AT_SCAN 明确;无精确采集日期以防重识别 |
| 15 | 划分建议 | ⚠️ | 官方无划分;社区事实标准为 LOSO(本页 §5) |
| 16 | 泄漏讨论 | ⚠️ | 官方未系统警示站点/受试者级泄漏(本页 §6.5 坑点 1、5) |
| 17 | 标签分布 | ✅ | 两期 ASD/对照基本均衡(约 5:5),站点内失衡 |
| 18 | 测量偏倚 | ⚠️ | 多站点采集器偏差存在,官方未发布偏倚审计 |
| 19 | 外部验证建议 | ⚠️ | 未在官方文档给出;社区用 ABIDE I↔II 交叉验证 |
| 20 | 版本记录 | ✅ | I V1.0b、II Release 更新日志齐全(2016-09、2017-03) |
| 21 | 预处理脚本 | ✅ | PCP 四管线 + QC 开源;fmriprep 衍生公开 |
| 22 | 合规要求 | ✅ | CC BY-NC-SA + INDI 协议 + NITRC 注册门槛清晰 |
| 23 | 多模态对齐 | ⚠️ | rs-fMRI/T1/dMRI(部分) 以 SUB_ID 对齐,dMRI 覆盖率不全 |
| 24 | 去标识化 | ✅ | HIPAA 匿名化 + 结构像去面部,仅保留数字 SUB_ID |
DAIMS 评分:15.0 / 24
评分解读:ABIDE 在「唯一标识」「版本记录」「预处理脚本」「去标识化」「合规」上达公开数据集的教科书级水准,可直接落地。丢分集中在科研数据集的通病:缺失编码不统一(检查项 5)、无官方数据划分与泄漏警示(15、16)、站点偏倚未量化(8、12、18)、以及因历史采集导致的重复行与多模态对齐不足(4、23)——这些多数不是 ABIDE 独有问题,而是多中心回顾性汇聚的结构性代价。
对你意味着什么:请勿把 ABIDE 当「干净封装」直接喂模型。上手时务必做三件事:(1) 用 Preprocessed 汇总表 + 统一缺失编码清洗(对应 5、10);(2) 用 SUB_ID 去重再划分,并把 SITE_ID 泄漏(16)显式写进方法节;(3) 训练前先看检查项 12/18 的站点×性别共线,按站点分层报告。做到这三点,你就能避开多数同行踩过的、也是 DAIMS 扣分最集中的区域。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ABIDE II(用 ABIDE I 训练模型外推) | ABIDE Consortium | ASD vs 对照 | 精度 | 较 I 期内部掉点 | 两期样本独立,是标准跨数据外推测试 [2] |
| 多中心 rs-fMRI 通用连接伪差检验 | ADHD-200(同 INDI 生态) | 阴性对照分类 | 精度 | — | 检验模型学到的是 ASD 特异信号还是通用伪差 |
| Heinsfeld 跨站点自我评估 | lsa-pucrs | ASD vs 对照 | 精度 70%/LOSO 65% | 10 折 vs LOSO 差 5pp | 站点签名主导虚高,需 LOSO [11] |
| Wolfers 57 项研究元分析 | — | 汇总 | 精度趋势 | 样本越大精度越低 | 单源小样本高精度多为过拟合 [6] |
注:ABIDE 上多数「外部验证」实为站内留出或跨站点 LOSO;真正跨独立数据集(ABIDE I→II)的公开严格评测仍偏少,这是本领域公认空缺。
外推验证的可操作建议:若要写「跨数据集泛化」,最省力且严谨的路线是——用 ABIDE I 全部 17 站点训练,直接拿 ABIDE II 做一次 hold-out 测试(两期受试者与站点独立,II 期论文已声明无重叠 [2])。这比在 I 期内部做任何留出都能更真实地回答「你的模型到新中心还灵不灵」。其次是拿 ADHD-200 的同构 rs-fMRI 做「阴性对照」:一个理想 ASD 分类器对 ADHD(另一人群标签)不应表现出可迁移的高判别力,否则说明你学的是「多站点共同伪差」而非 ASD 特异信号。
§7.9 局限性小结
把本数据集的短板浓缩成一句话:ABIDE 是「广度换深度」的回顾性汇聚——样本覆盖全球多中心,但站点、设备、诊断、表型、头动在站点内高度耦合,无法事后拆干净。这意味着:(1) 任何单个中心出的「高精度个体分类」都缺乏跨中心证据,不能当作生物标志物;(2) 表型量表站点间口径不一,精细回归需自行调和;(3) 数据集采集于 DSM-IV-TR 时代并已定型,无法跟进 DSM-5/ICD-11 的新诊断切分。科研上它依然是方法学与连接组学的黄金标准试验场,但在使用和引用时必须把这些局限写清楚。
§8 基准性能与生态
§8.1 排行榜
ABIDE 无官方排行榜,以下为公开论文代表性结果(口径标注务必区分 10 折 vs LOSO,因不可直接比较):
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Heinsfeld(堆叠去噪自编码+MLP) | 70%(10 折)/65%(LOSO) | 2018 | SDA 预训练 → MLP | Heinsfeld et al., 2018, NeuroImage: Clinical, 17:16-23. DOI 10.1016/j.nicl.2017.08.017 | github.com/lsa-pucrs/acerta-abide |
| 2 | EV-GCN(Edge-Variational GCN) | 81%(10 折,非 LOSO) | 2020 | 边变异图卷积 | Huang, W., Chung, I-F., et al. 2020(MICCAI 相关工作) | — |
| 3 | AIMAFE(多图谱深度集成) | — | 2020 | 多图谱特征+集成 | Wang et al., 2020, J. Neurosci. Methods, 343:108840. DOI 10.1016/j.jneumeth.2020.108840 | — |
| 4 | GCN(Parisot) | 70.4%(10 折) | 2018 | 图卷积 + 表型 | Parisot et al., 2018, Med. Image Anal., 48:117-130. DOI 10.1016/j.media.2018.06.001 | — |
| 5 | Abraham(连接组+SVM) | 67%(10 折) | 2017 | 特征稳健性 | Abraham et al., 2017, NeuroImage, 147:736-745. DOI 10.1016/j.neuroimage.2016.10.045 | nilearn |
| 6 | Graph2Img CNN(LOSO) | 66%(10 折)/80%(LOSO) | 2022 | 图嵌入→CNN | Salehi et al., 2022, Front. Neurosci.(图学习综述) | — |
| 7 | Dvornek LSTM | 68.5% | 2017 | RNN 时序 | Dvornek et al., 2017/2018, IEEE ISBI | — |
⚠️ 数值不可直接比较的原因:各研究所用受试者子集(全样本 1,112 vs 部分 403+468 vs 505+530)、预处理管线(C-PAC/DPARSF/CC200 图谱不同)、评估协议(10 折 vs LOSO)均不同。EV-GCN 的 81%、Graph2Img 的 80%(LOSO)等「高精度」多以特定子集或图谱为前提,切勿把不同口径数字直接 PK。
§8.2 SOTA 总结与选型建议
跨站点泛化(LOSO)目前仍徘徊在 65%-80%,远未到临床门槛;可复现性上 Abraham 2017 的 nilearn 连接组 pipeline 是最稳 baseline,Heinsfeld 2018 是深度学习开源起点。若你要做「ASD 分类」教程,用 Abraham/Heinsfeld 口径即可;若目标是「跨中心可用」,请以 LOSO 为主线指标并以对抗域适应为方向,而不是追逐 10 折榜单高名次。
把 ABIDE 上的精度放在一起看,会得到几个反直觉但重要的结论:
- 样本量越大、报告的精度未必越高。Wolfers 等 [6] 对 57 项研究的元分析清楚显示,早期小样本(单站点、几十人)动辄报 80%-90% 的精度,而建立在 1,000+ 人多站点上的工作普遍回落到 60%-75%。这不是方法退步,而是前者的高精度多半来自小样本过拟合与单站点捷径;后者牺牲了「好看」换来了「更可能成立」的结论。
- 评测协议对指标的影响甚至大于模型架构。同一个模型,随机 10 折可能是 70%,LOSO 降到 65%(Heinsfeld [11]);某些研究只报 10 折高精度、却回避 LOSO,读者若不看方法会被数字误导。引用任何 ABIDE 精度前,先确认它用的是哪种划分。
- 高精度声明往往藏在「子集」里。个别公开渠道宣称 98% 甚至更高的 SOTA,实测多为「仅用部分受试者/特定图谱」的局部结果,无法在全样本或独立站点上复现。遇到异常高的精度,第一反应应是核对受试者数与评测口径,而非惊叹方法。
选型建议(按目标分档):
- 要一个诚实且可跑的 baseline → Abraham 风格连接组 + SVM,CPU 分钟级,得到 ~67%(10 折)级别的可复现基线;
- 要深度学习演示 → Heinsfeld 风格 SDA + MLP,开源代码可直接复现(github.com/lsa-pucrs/acerta-abide),~70%(10 折)/65%(LOSO);
- 要追求跨站点泛化上限 → 图神经网络(GCN/GNN)+ 对抗域适应或站点感知损失,以 LOSO 为最终指标,不要用 10 折数字宣称 SOTA;
- 要方法学论文 → 关注「管线/策略稳健性」(Abraham 范式)或「站点调和 vs 模型架构」的消融,这是本数据上最有发表空间的缝隙。
§8.3 评测协议(推荐标准)
为避免「数字无法比较」的行业通病,建议凡在 ABIDE 上做的分类都公开以下七件事:
- 用哪个版本(I / II / 合并)与哪个样本筛选(全量 1,112 / QC 1,102 / 论文子集 505+530 等),并给出实际纳入 N。
- 预处理 pipeline 与 strategy(如
cpac/filt_noglobal)与图谱(如 CC200),是否做了 fmriprep/ICA-AROMA 等额外步骤。 - 评估协议:随机 k 折 / LOSO / GroupKFold,折数与随机种子。
- 头动与人工 QC 筛选阈值(
func_mean_fd、qc_rater_*)。 - 指标:精度 + AUC + 按站点透视混淆矩阵;给出均值 ± 站点间标准差。
- 是否做受试者级去重(多会话)。
- 代码与随机种子公开(可复现)。
若你的论文只报一个「全样本精度数字」,请至少说明第 2、3、5 项,否则读者无法判断它与 Heinsfeld 70% 或 Abraham 67% 是否同口径。
§8.3b 从文献中提取可比结果的小抄
引用别人数字前先问五个问题,避免把不同口径硬 PK:
| 问题 | 若答「是」则该数字需警惕 |
|---|---|
| 受试者数是否远小于 1,112(如几百)? | 可能是子集过拟合的高精度 |
| 是否只报随机 k 折、未报 LOSO? | 精度可能虚高 5-15 个百分点 |
| 是否声称接近或超过 90% 的个体精度? | 在 ABIDE 多站点上极其可疑 |
| 是否用了 ADOS/SRS 等临床量表当输入特征? | 存在表型/标签泄漏(§5.3、§6.5 坑点) |
| 预处理与图谱是否与本数据集默认(C-PAC/CC200)不同? | 管线差异本身就会改变结论 |
§8.4 相关数据集表
| 数据集 | 模态/任务 | 关系 |
|---|---|---|
| NDAR | ASD 全模态 + 基因 | 同疾病互补;NIH 资助,样本含更广年龄 |
| ABCC(ADHD-200) | 儿童多站点 rs-fMRI | 姊妹联盟(同 INDI 生态),任务为 ADHD |
| UK Biobank 脑影像 | 万人多模态 | 超大健康对照,可做阴性对照 |
| HCP | 健康多模态 | 无临床标签,作方法学参照 |
§8.5 关键论文 Top 论文
- Di Martino A, et al. The autism brain imaging data exchange: towards a large-scale evaluation of the intrinsic brain architecture in autism. Mol Psychiatry. 2014;19(6):659-667. DOI 10.1038/mp.2013.78 — 创立 ABIDE I 的资源论文,报告 1,112 个数据集与全脑功能连接分析。
- Di Martino A, et al. Enhancing studies of the connectome in autism using the autism brain imaging data exchange II. Sci Data. 2017;4:170010. DOI 10.1038/sdata.2017.10 — ABIDE II 资源论文,新增 1,044 独立样本 + 纵向与 dMRI。
- Abraham A, et al. Deriving reproducible biomarkers from multi-site resting-state data: an autism-based example. NeuroImage. 2017;147:736-745. DOI 10.1016/j.neuroimage.2016.10.045 — 系统证明管线选择影响分类结论,成方法学基准。
- Heinsfeld AS, et al. Identification of autism spectrum disorder using deep learning and the ABIDE dataset. NeuroImage: Clinical. 2018;17:16-23. DOI 10.1016/j.nicl.2017.08.017 — 首个开源深度 ASD 分类(70%),确立 LOSO 与随机折的差距。
- Nielsen JA, et al. Multisite functional connectivity MRI classification of autism: ABIDE results. Front. Hum. Neurosci. 2013 — 早期证明多站点大样本使小样本高精度回落。
- Parisot S, et al. Disease prediction using graph convolutional networks. Med Image Anal. 2018;48:117-130. DOI 10.1016/j.media.2018.06.001 — GCN + 表型融合引入 ASD 分类。
上述排序按「与 ABIDE 数据集关联的奠基性」而非单纯引用量:1-2 是两期数据的资源出处(必引),3-4 确立了方法学与评测基线(复现必引),5-6 代表「站点效应」「图建模」两个重要支线的起点。做综述或新方法时,1-4 是你绕不开的引用锚点。
§8.5b 关键论文阅读顺序建议
对新手最省力的阅读顺序,按「先懂数据 → 再懂基线 → 后懂前沿」排:
- 先读 Di Martino 2014(§8.5 #1)的图 1 与样本表,建立「17 站点、1,112、5:5」的直觉;
- 接着读 Abraham 2017(#3)的方法节,理解「管线稳健性」为何比单一结果重要;
- 然后读 Heinsfeld 2018(#4)的结果表,记下「10 折 70% vs LOSO 65%」这一关键落差;
- 最后看 Huang & Chung 的 EV-GCN 或 Parisot GCN(#6),了解图方法如何在连接组上建模站点/表型。
按这个顺序,你会在动手前就避开本数据上 80% 的「数字不可比」与「站点泄漏」坑。
§8.6 社区活跃度
ABIDE I 论文 Google Scholar 被引 3,301+(截至 2026-09)[16],II 期被引 646(Nature,截至 2026-09)[2];它是 nilearn、scikit-learn、C-PAC 教程的标准示例数据,相关代码(acerta-abide、nilearn 示例、ASD subtype supplement)长期维护。自 2017 年后不再发布新数据版本,活跃度集中于方法研究而非数据更新。
§8.7 生态快照表
| 资源 | 类型 | 链接/渠道 | 活跃度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| ABIDE 官网(NITRC) | 官方数据源 | fcon_1000.projects.nitrc.org/indi/abide/ | 维护中 | 权威站点与逐站点协议 |
| Preprocessed Connectomes Project | 预处理衍生 | preprocessed-connectomes-project.org/abide/ | 稳定 | QC + 四管线衍生 |
| AWS S3 fcp-indi | 开放镜像 | s3://fcp-indi/data/Projects | 可用 | 匿名高速下载 |
| nilearn ABIDE 示例 | 官方教程 | nilearn.github.io | 活跃 | 上手最快 |
| acerta-abide | 代码 | github.com/lsa-pucrs/acerta-abide | 存档 | Heinsfeld 复现 |
生态判断(截至 2026-09):ABIDE 已从「数据发布平台」演进为「方法学基准基础设施」——它不追求新数据增长(2017 年后冻结),而是被 nilearn/scikit-learn/C-PAC 生态当作标准示例数据持续引用。对新手这是好事(资料、代码、教程多且稳);对想发「新方法」的人则是挑战(baseline 与口径之争比刷精度更能出成果)。使用它时,把你定位为「在这套冻结但成熟的数据上贡献可复现方法」,而不是期待它更新。
§8.8 一个反直觉的基准真相
小结 ABIDE 基准领域最反直觉、却最能帮你避坑的三点:
- 你很难真正「战胜」这个数据集。 因为它的瓶颈是域偏移与异质性,不是模型容量——复杂度堆上去大多换来 LOSO 上 1-3 个百分点的抖动,而非质变。
- 最被高估的数字是随机 k 折精度,最被低估的是「报告口径」。 一篇交代清楚、用 LOSO、只报 65% 的工作,其科学价值通常高于一篇含糊报 80% 的工作。
- 多站点本身既是噪声也是机会。 正因为域偏移如此显著,ABIDE 成了测试「数据调和」「域适应」「数据增广」的稀缺公共载体——你若在别的单中心数据上做这些方法没意义,在 ABIDE 上做才有说服力。
§9 资源与引用
§9.1 官方资源
- 官方主页:http://fcon_1000.projects.nitrc.org/indi/abide/(含 I/II 各站点 MRI 协议与下载入口)
- ABIDE I 页面:http://fcon_1000.projects.nitrc.org/indi/abide/abide_I.html
- ABIDE II 页面:http://fcon_1000.projects.nitrc.org/indi/abide/abide_II.html
- 表型字段图例:ABIDE_LEGEND_V1.02.pdf
- Preprocessed:http://preprocessed-connectomes-project.org/abide/(download/Pipelines/quality_assessment)
- 开放镜像:AWS S3
s3://fcp-indi/data/Projects(匿名访问)
§9.2 BibTeX 引用
@article{DiMartino2014ABIDE,
title = {The autism brain imaging data exchange: towards a large-scale evaluation of the intrinsic brain architecture in autism},
author = {Di Martino, Adriana and Yan, Chao-Gan and Li, Qingyang and Denio, Erin and Castellanos, Francisco X and Alaerts, Kaat and Anderson, Jeffrey S and Assaf, Michal and Bookheimer, Susan Y and Dapretto, Mirella and others},
journal = {Molecular Psychiatry},
volume = {19},
number = {6},
pages = {659--667},
year = {2014},
publisher = {Nature Publishing Group},
doi = {10.1038/mp.2013.78}
}
@article{DiMartino2017ABIDEII,
title = {Enhancing studies of the connectome in autism using the autism brain imaging data exchange II},
author = {Di Martino, Adriana and O'Connor, David and Chen, Bosi and Alaerts, Kaat and Anderson, Jeffrey S and Assaf, Michal and Balsters, Joshua H and Baxter, Leslie and Beggiato, Anita and Bernaerts, Sylvie and others},
journal = {Scientific Data},
volume = {4},
number = {1},
pages = {170010},
year = {2017},
publisher = {Nature Publishing Group},
doi = {10.1038/sdata.2017.10}
}
@article{Abraham2017Biomarkers,
title = {Deriving reproducible biomarkers from multi-site resting-state data: an autism-based example},
author = {Abraham, Alexandre and Milham, Michael P and Di Martino, Adriana and Craddock, R Cameron and Samaras, Dimitris and Thirion, Bertrand and Varoquaux, Ga{\"e}l},
journal = {NeuroImage},
volume = {147},
pages = {736--745},
year = {2017},
publisher = {Elsevier},
doi = {10.1016/j.neuroimage.2016.10.045}
}
@article{Heinsfeld2018Deep,
title = {Identification of autism spectrum disorder using deep learning and the ABIDE dataset},
author = {Heinsfeld, Anibal S{\'o}lon and Franco, Alexandre Rosa and Craddock, R Cameron and Buchweitz, Augusto and Meneguzzi, Felipe},
journal = {NeuroImage: Clinical},
volume = {17},
pages = {16--23},
year = {2018},
publisher = {Elsevier},
doi = {10.1016/j.nicl.2017.08.017}
}
§9.3 引用指南
期刊论文请同时引用数据描述论文(I 期 Mol Psychiatry 2014 与 II 期 Sci Data 2017 二者皆引,因数据分两期发布)与 Preprocessed 版本说明 [3];方法研究加引 Abraham 2017 以确保预处理口径透明。
| 你在文中做了什么 | 应引用的条目 | 理由 |
|---|---|---|
| 只用了 ABIDE I 数据 | DiMartino 2014 (Mol Psychiatry) | 数据描述源 |
| 用了 ABIDE II 或两期合并 | DiMartino 2017 (Sci Data) | 提供 II 期与合并口径(2,156 独立横断面) |
| 用了 C-PAC/CC200 等预处理衍生 | PCP 说明 [3] 或 Craddock et al. 2013 | 衍生数据版权归属与口径声明 |
| 做了多管线稳健性/调和 | Abraham 2017 | 方法学标杆 |
| 深度学习分类 | Heinsfeld 2018 | 开源深度 baseline |
| 头动 QC 讨论 | Torres & Denisova 2016 [12] | ABIDE 头动/scrubbing 实证 |
§9.4 可复现性清单
提交或发布 ABIDE 相关代码前,建议把以下项写进 README 或实验卡片,它们直接决定他人能否复现你的数字:
- [ ] 数据版本与来源(NITRC 官网 or S3;拉取日期;BIDS/预处理版本号)
- [ ] 表型文件路径与清洗脚本(是否用 Preprocessed 汇总表)
- [ ] 可用样本筛选逻辑与最终 N(标签 + FD 阈值 + QC 列与阈值)
- [ ] 受试者级去重方式(多会话处理)
- [ ] 评估协议(k 折/LOSO、随机种子、GroupKFold 分组列)
- [ ] 特征构建(图谱、连接矩阵、标准化方式、是否 Fisher z)
- [ ] 模型与超参(架构、输入维度、搜索空间)
- [ ] 按站点透视结果表(可追踪是否残留站点捷径)
- [ ] 环境锁定(Python/库版本、Docker 镜像或 requirements.txt)
§9.5 代码与工具索引
| 用途 | 工具/仓库 | 说明 |
|---|---|---|
| 连接组分类 | nilearn 官方 ABIDE 示例 | 与 Abraham 2017 一致的可运行基线 |
| 深度学习复现 | github.com/lsa-pucrs/acerta-abide | Heinsfeld 2018 源码 |
| 表型清洗 | surchs/ASD_subtype_code_supplement | abide_*_prepare_pheno.py 系列 |
| 亚型分析 | 同 surchs 仓库 + NIAK | 复现 ASD 亚型论文 |
| 数据浏览 | Cyberduck / aws s3 ls |
匿名浏览 S3 fcp-indi 前缀 |
| 批量调和 | neuroHarmonize / ComBat | 站点偏倚去除(需自行评估对标签的影响) |
| 预处理 | C-PAC / fMRIPrep | 从原始数据重跑(对应 TB 级需求场景) |
§10 AI 使用声明卡
§10.1 AI 模型列表
本页面撰写过程使用了通用大语言模型辅助生成结构框架与代码模板,未使用针对本数据集训练的特化 AI 模型。
§10.2 AI 参与范围
AI 辅助完成章节起草、代码脚手架与格式排版;全部医学事实、数字、坑点与基准引用由人工依据原始文献与官方文档核对后定稿。
§10.3 输入来源列表
本页内容依据以下公开来源人工核写:
- Di Martino et al., 2014, Molecular Psychiatry(ABIDE I 论文)
- Di Martino et al., 2017, Scientific Data(ABIDE II 论文)
- Preprocessed Connectomes Project 官方下载/QC 页
- fcon_1000 ABIDE 官网(abide_I.html、abide_II.html)
- NYU Langone Data Catalog ABIDE I&II 条目
- NITRC 论坛「abide phenotypic data」线程
- PMC6044186(ABIDE I 站点样本统计表)
- Frontiers in Integrative Neuroscience(ABIDE 头动与 scrubbing 讨论)
- Wolfers et al., 2019 元分析(57 项研究)
- Frontiers 图学习/神经网络方法比较研究(LOSO vs 10 折逐站点)
- HBM(Hum Brain Mapp)ABIDE 分类框架比较综述
- Heinsfeld et al., 2018 全文(PMC5635344)
- qmenta ABIDE 数据卡片(许可/字段说明)
- surchs/ASD_subtype_code_supplement(清洗与 S3 脚本)
- forbow-lab open-data wiki ABIDE(S3/BIDS/fmriprep 布局)
- Scopus/PlumX 与 Google Scholar 引用统计页
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED/疾病流行病学) | 千方病案医学编辑部 | 对照文献交叉核对 | ✅ 已通过 |
| §3-§4 数据集规格与数据结构(规模/版本/目录树) | 千方病案医学编辑部 | 对照官方页面与论文核对 | ✅ 已通过 |
| §6-§8 坑点与基准(8 坑、LOSO/10 折数字) | 千方病案医学编辑部 | 对照论文方法与结果核对 | ✅ 已通过 |
| §7 DAIMS 24 项与评分解读 | 千方病案医学编辑部 | 逐项比对数据结构核验 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页整体由 AI 辅助草拟,§1-§9 已按宪法人工审查;AI 生成的代码均为参考模板,使用者须在自有环境验证后再使用。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
