信息速览

INFOBOX
| 数据集名称 | ADNI |
| 英文全称 | Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative |
| 别名 / 简称 | ADNI1、ADNI-GO、ADNI2、ADNI3、ADNI4 |
| 疾病分类 | 6A20 Dementia due to Alzheimer disease / 6D81 Mild cognitive disorder |
| SNOMED CT | 26929004 Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s disease (disorder) / 82497001 Mild cognitive impairment (disorder) |
| 数据模态 | 影像(MRI / PET)+ 结构化(临床 / 认知 / CSF / 血浆)+ 基因组 + 多模态 |
| AI 任务类型 | 图像分类、回归预测、生存分析、时序预测、多模态融合 |
| 样本总数 | 2,500+ 名参与者(20+ 年纵向随访,17,000+ MRI 序列,3,000+ PET 扫描,11,720 血浆样本) |
| 数据大小 | ~500+ GB(影像)/ ~5 GB(CSV 临床与认知数据) |
| 数据格式 | DICOM / NIfTI / CSV |
| 许可证 | ADNI Data Use Agreement(非商业研究用途,需在线签署 DUA) |
| 访问级别 | 申请审核(在线申请 + DUA + DPC 审查) |
| DUO 标签 | HMB, NPUNCU, PUB |
| 语言 | 英文 |
| 首发日期 | 2004-10(ADNI1 正式启动) |
| 最后更新 | 2025-06(ADNI4 进行中) |
| 发布机构 | Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative(PI: Michael W. Weiner, M.D., UCSF / NCIRE / VA Medical Center) |
| 官方主页 | https://adni.loni.usc.edu/ |
| 下载地址 | https://ida.loni.usc.edu/ |
| DOI | 10.1016/j.jalz.2005.06.005 |
| 引用次数 | 4,500+(Google Scholar,截至 2026-07) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 标准化采集协议、ADNIMERGE.csv 主表、完善的 QC 流程、详尽的在线文档;扣分项:无官方 train/val/test 划分、多文件格式非 BIDS 原生、多中心扫描仪变异 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-08-10
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。部分数据集要求额外资质认证(如 PhysioNet CITI Training)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览(Overview)
§1.0 📌 30 秒速览(Executive Summary)
ADNI(Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative)是由 Michael W. Weiner 博士于 2004 年发起的全球最大、运行时间最长的阿尔茨海默病纵向多模态观察性研究队列,累计入组 2,500+ 名参与者,覆盖认知正常(CN)、轻度认知障碍(MCI)和阿尔茨海默病(AD)痴呆三个诊断组,在美国和加拿大 60+ 个临床中心进行,随访跨度已超过 20 年。
它的独特价值在于将 MRI 结构/功能影像、多示踪剂 PET(淀粉样蛋白、tau、FDG)、CSF 生物标志物、血浆生物标志物、APOE 基因型和全套神经心理学评估在同一队列中纵向配对采集——这种"同一患者、同一时间点、多模态全覆盖"的设计在全球独此一家。截至 2024 年 1 月,ADNI 已催生 5,500+ 篇科学出版物,45,000+ 名注册研究者来自 140+ 个国家,累计下载量达 3.97 亿次,是阿尔茨海默病 AI 研究的事实标准基础设施。
你可以用它来:训练一个基于 MRI 的 AD 三分类(CN/MCI/AD)深度学习模型、研究多模态生物标志物融合对疾病进展预测的增益、或者验证血浆 p-tau217 作为无创筛查标志物的诊断性能。
§1.1 摘要
ADNI 由美国国立衰老研究所(NIA)资助(U19AG024904),采用公私合作(PPP)模式运营——NIA 提供核心资助,FNIH(Foundation for the National Institutes of Health)管理行业合作伙伴关系,Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Association 召集私营部门科学委员会(PPSB)。ADNI 数据通过南加州大学 LONI 实验室的影像数据档案(IDA)分发,采用在线申请 + 数据使用协议(DUA)+ 数据发布委员会(DPC)审查的三级访问机制,免费向全球研究者开放。
ADNI 经历五个阶段迭代:ADNI1(2004-2009,1.5T MRI + FDG/PIB PET)→ ADNI-GO(2009-2011,首次 3T 全面部署)→ ADNI2(2011-2016,Florbetapir/FLAIR/T2*)→ ADNI3(2016-2022,tau PET 全面部署)→ ADNI4(2022-2027,$145M 全额资助,1,500 院内受试者 + 4,000+ 远程血液队列)。截至 2024 年 4 月,影像序列总量达 17,141 个 3D T1w、6,877 个 FLAIR、3,237 个 dMRI、2,846 个 ASL、2,968 个 TF-fMRI,以及 2,861 个高分辨率海马扫描。数据每日通过电子数据采集(EDC)系统更新。
§1.2 战略价值分析
技术创新维度:ADNI 开创了"多模态纵向配对采集"的研究范式,将原本碎片化的神经影像、生物标志物和临床评估整合到统一的标准化协议中。这一设计使得研究者首次能够在个体层面追踪从认知正常到 MCI 再到 AD 痴呆的完整转化轨迹,并定位每种模态在疾病连续谱中的异常时间窗口。ADNI 提出的 ATN(Amyloid-Tau-Neurodegeneration)框架已成为 2018 年 NIA-AA 研究框架的生物分期基础,并在 2024 年修订标准中扩展为 ATX(N) 体系——新增 I(炎症/免疫)、V(血管)、S(α-突触核蛋白)三个非核心维度。ADNI 的 Centiloid 标准化方法(0 = 青年正常,100 = 中重度 AD)使不同淀粉样蛋白 PET 示踪剂的结果可跨平台比较,已成为全球临床试验的统一度量。
应用影响维度:ADNI 数据直接推动了 FDA 批准的三种淀粉样蛋白 PET 示踪剂(Amyvid/Neuraceq/Vizamyl)的临床验证,并支撑了 Lecanemab(Leqembi)和 Donanemab 等抗淀粉样蛋白单抗药物的疾病修饰治疗试验设计。ADNI4 首次引入远程血液队列(4,000+ 人),将血浆 p-tau217 的社区级无创筛查变为可能——这种"抽一管血即可筛查 AD 病理"的能力正在重塑全球 AD 早筛策略。ADNI4 的 50-60% 代表性不足人群(URP)入组目标也标志着该队列从"以白人高教育群体为主"向"人口学多样化"的战略转型。
生态推动维度:ADNI 建立了全球神经退行性疾病数据共享的黄金标准——其数据治理模式(PPP + 免费开放 + DUA 审查)已被澳大利亚 AIBL、日本 J-ADNI、欧洲 EPAD、韩国 CADDementia 等区域性队列复制,形成了"全球 ADNI 网络"。FreeSurfer 脑分割流程、Schwarz 去面部算法、ADNIMERGE.csv 主表设计、LONI IDA 数据分发架构均已成为行业事实标准,被数百个研究团队和商业公司直接复用。
§1.3 横向对比
| 数据集 | 样本量 | 模态 | 标注方式 | 随访时长 | 核心差异化 |
|---|---|---|---|---|---|
| ADNI | 2,500+ | MRI + PET + CSF + 血浆 + 基因 + 认知 | 临床专家诊断(NIA-AA 标准) | 20+ 年 | 多模态纵向配对,全球 AD 研究基石 |
| OASIS-3 | 1,098 | MRI + PET | 临床 + 尸检病理 | 15 年 | 尸检病理金标准更丰富 |
| AIBL | 576 | MRI + PET + 血液 | 临床诊断 | 15 年 | 澳大利亚队列,提供地理多样性 |
| NACC | 40,000+ | 临床 + 认知 + 部分 MRI/PET | 临床 + 尸检 | 30 年 | 北美多中心,尸检率最高,规模最大 |
| DLBS | 356 | MRI + 认知 + 血液 | 临床 | 12 年 | 达拉斯寿命脑研究,健康老化聚焦 |
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2004-10 | ADNI1 正式启动(NIA 资助,$60M,800 名参与者:200 CN + 400 MCI + 200 AD) |
| 2005 | 基础论文发表(Mueller et al., Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, DOI: 10.1016/j.jalz.2005.06.005) |
| 2008 | PIB PET 淀粉样蛋白成像首次大规模临床应用 |
| 2009-10 | ADNI-GO 启动(200 名早期 MCI,首次 3T MRI 全面部署) |
| 2011 | ADNI2 启动(550 名新入组,Florbetapir + FLAIR + T2*,合并 EMCI/LMCI 为统一 MCI) |
| 2013 | ADNI2 数据全面上线,ADNIMERGE.csv 主表发布 |
| 2016 | ADNI3 启动($120M,tau PET/Flortaucipir 全面部署,1,084 总入组,29% URP) |
| 2018 | NIA-AA 研究框架发布(ATN 生物分期,以 ADNI 数据为核心证据) |
| 2020 | ADNI 数据助力 Lecanemab 临床试验设计 |
| 2022 | ADNI4 启动($145M NIA 全额资助,1,500 院内 + 4,000+ 远程血液队列,50-60% URP 目标) |
| 2023 | Lecanemab(Leqembi)获 FDA 完全批准 |
| 2024-01 | ADNI 统计:5,500+ 论文 / 45,000+ 研究者 / 140+ 国 / 3.97 亿次下载 |
| 2024-04 | MRI Core 发表影像数据总览(PMID: 39258539) |
| 2024 | NIA-AA 2024 修订标准发布(Core 1/Core 2 生物标志物分类,ATX(N) 扩展) |
§1.5 典型 AI 应用场景
- AD 三分类(CN/MCI/AD):使用 3D T1w MRI 训练 3D ResNet/CNN 模型,在 FreeSurfer 提取的脑区体积特征上实现 92%+ 三分类准确率
- 疾病进展预测:基于纵向 MRI 变化率(BSI/TBM)和基线生物标志物(APOE4/CSF Aβ42/tau),预测 MCI 到 AD 痴呆的转化时间
- 多模态融合:联合 MRI 结构特征、PET 代谢/淀粉样蛋白/tau 信号、CSF 生物标志物和认知评分,通过多模态深度网络提升早期诊断灵敏度
- 血浆 p-tau217 无创筛查:利用 ADNI4 远程血液队列数据,验证血浆 p-tau217 作为社区级 AD 病理筛查标志物的诊断性能(≥90% 准确率)
- 联邦学习与外部验证:在 ADNI 上训练模型,在 OASIS/AIBL/NACC 上进行外部验证,评估跨数据集泛化性
§2 医学背景(Medical Context)
§2.1 ICD-11 编码
| 诊断组 | ICD-11 编码 | 中文疾病名 |
|---|---|---|
| AD 痴呆 | 6A20 | Dementia due to Alzheimer disease |
| AD 早发型 | 6A20.0 | Dementia due to Alzheimer disease with early onset |
| AD 晚发型 | 6A20.1 | Dementia due to Alzheimer disease with late onset |
| 轻度认知障碍 | 6D81 | Mild cognitive disorder |
§2.1b SNOMED CT 映射
| 数据集诊断标签 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s disease | 6A20 | 26929004 | Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s disease (disorder) |
| Mild cognitive impairment | 6D81 | 82497001 | Mild cognitive impairment (disorder) |
| Dementia | 6A20 | 52448006 | Dementia (disorder) |
| Cognitive normal | — | 261665006 | Normal cognition (finding) |
§2.2 疾病简介
阿尔茨海默病(AD)是最常见的导致痴呆的神经退行性疾病,占全球痴呆病例的 60-80%。其核心病理特征为脑内 β-淀粉样蛋白(Aβ)胞外沉积形成老年斑、异常磷酸化 tau 蛋白胞内聚集形成神经原纤维缠结(NFT),以及进行性突触丢失和神经元死亡。流行病学方面,全球约 5,500 万人患有痴呆(WHO 2023),美国约 690 万 65 岁以上人群罹患 AD 痴呆(2024 Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Association 报告),预计 2060 年将增至 1,380 万。全球痴呆年经济成本约 1.3 万亿美元。
§2.3 临床任务定义
| 任务类型 | 描述 | AI 在此任务中的角色 |
|---|---|---|
| 早期筛查 | 在认知正常人群中识别已有 AD 病理但尚未出现临床症状的高危个体 | 基于影像/血液标志物的自动化筛查模型 |
| 诊断分类 | 区分 CN / MCI / AD 三组,辅助临床诊断决策 | 三分类深度学习模型 |
| 进展预测 | 预测 MCI 患者在未来 1-3 年内转化为 AD 痴呆的风险 | 生存分析 / 时序预测模型 |
| 治疗监测 | 在抗 Aβ/tau 药物试验中量化疾病修饰治疗的生物标志物变化 | 纵向影像变化率量化(BSI/TBM) |
| 分期评估 | 基于 ATN/ATX(N) 框架进行生物分期(A-D)和临床分期(0-6) | 多模态融合自动分期 |
§2.4 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 美国和加拿大 60+ 个 ADNI 认证临床中心(学术医学中心、记忆门诊、VA 医疗中心) |
| 采集时间 | 2004 年至今(ADNI1→ADNI4,跨越 20+ 年) |
| 年龄分布 | 55-90 岁(入组时),均值约 75 岁 |
| 性别比例 | 约 50% 男性 / 50% 女性 |
| 种族分布 | 白人 >80%(ADNI1-3),ADNI4 目标 50-60% URP(代表性不足人群) |
| 教育水平 | 均值约 16 年(高教育水平群体) |
| 入组标准 | CN:MMSE 29-30,CDR 0;MCI:MMSE 24-30,CDR 0.5,逻辑记忆受损;AD:MMSE 20-26,CDR 0.5-1.0,满足 NINCDS/ADRDA 标准 |
§2.5 临床意义
AD 的临床挑战在于:脑内 Aβ 沉积可在认知症状出现前 15-20 年即已开始,而当前临床诊断依赖认知量表(MMSE/CDR)在症状已较明显时才能可靠区分。ADNI 的核心价值在于提供了"病理变化→认知变化→临床诊断"的完整纵向证据链,使 AI 模型能够在病理亚临床期即进行预测——这对疾病修饰治疗(DMT)的时间窗决策至关重要。2023 年 Lecanemab 获 FDA 完全批准,标志着 AD 治疗进入"早期干预"时代,ADNI 数据在这一里程碑中发挥了不可替代的奠基作用。
§2.6 金标准
| 数据划分 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| 临床诊断 | NIA-AA 标准 + 神经心理学评估 + 影像/CSF 辅助 | ADNI Clinical Core 认证神经科医生/精神科医生 | 临床参考标准 |
| 影像 QC | 标准化协议 + 中心化质控 | MRI Core(Mayo Clinic)/ PET Core(UC Berkeley) | 中心化技术标准 |
| CSF 生物标志物 | Innogenetics xMAP Luminex 平台(Aβ42/t-tau/p-tau181),CV <15% | Biomarker Core(University of Pennsylvania) | 实验室参考标准 |
| 病理确认 | 脑组织尸检 + NIA-Reagan 标准 | Neuropathology Core | 组织病理学金标准(仅限自愿捐脑参与者子集) |
| 认知评估 | MMSE / ADAS-Cog13 / CDR-SB / 逻辑记忆 / DSST / Trail Making | 经培训的 ADNI 临床评估员 | 标准化心理测量 |
§3 数据集规格(Specifications)
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速入门 / 资源有限 / 仅做分类 benchmark | ADNIMERGE.csv + T1w MRI 子集 | ~20 GB | 含所有参与者的诊断/认知/FreeSurfer 体积特征,MRI 取 1.5T T1w 即可 |
| 多模态融合研究(MRI + PET + CSF) | ADNI2/3 完整数据 | ~200 GB | 3T MRI + Florbetapir/Flortaucipir PET + CSF 三模态配对最完整 |
| tau PET 分析 / 疾病分期 | ADNI3 完整数据 | ~150 GB | Flortaucipir tau PET 全面部署,含 Centiloid 标准化 |
| 最新队列 / URP 多样性 / 血浆 p-tau217 | ADNI4 数据(持续更新中) | 增量更新 | 1,500 院内 + 4,000+ 远程血液队列,50-60% URP,新示踪剂 |
| 纵向变化率分析 | ADNI1 + GO + 2 纵向数据 | ~100 GB | 跨 1.5T→3T 的最长随访时间跨度,BSI/TBM 定量分析覆盖最完整 |
§3.1 模态详细说明
ADNI 的多模态数据覆盖以下七大模态类别:
MRI 影像(截至 2024-04-25,来源 PMID:39258539):
- 3D T1 加权(17,141 序列):矢状位 MPRAGE/IR-SPGR,1.0-1.25mm 各向同性
- FLAIR(6,877 序列):ADNI-GO 起引入,3D 采集
- T2/PD 双回波(3,140 序列):ADNI1 1.5T 协议
- T2* GRE(6,623 序列):微出血检测
- dMRI 弥散张量(3,237 序列):ADNI-GO 起,30+ 方向
- ASL 灌注成像(2,846 序列):ADNI-GO 起,Siemens PICORE
- TF-fMRI 静息态功能(2,968 序列):task-free 即静息态,ADNI-GO 起
- 高分辨率海马(2,861 序列):ADNI2 起新增,海马亚区分割专用
PET 影像:
- FDG PET:脑葡萄糖代谢,全期覆盖
- 淀粉样蛋白 PET:11C-PIB(ADNI1)→ 18F-Florbetapir/Amyvid(ADNI2)→ 18F-Florbetaben/Neuraceq(ADNI3)→ 18F-Flutafuranol(ADNI4 新增)
- tau PET:18F-Flortaucipir/Tauvid(ADNI3)→ 18F-MK6240 + 18F-PI2620(ADNI4 新增)
- Centiloid 标准化:全淀粉样蛋白 PET 示踪剂统一量化(0 = 青年正常,100 = 中重度 AD)
CSF 生物标志物(UPenn Biomarker Core):
- Aβ42(阈值 <977 pg/mL 为阳性)
- t-tau(总 tau)
- p-tau181(磷酸化 tau-181)
- 检测平台:Innogenetics xMAP Luminex,CV <15%
血浆生物标志物(ADNI3/4 重点扩展):
- Aβ42/40 比值(C2N 质谱)
- p-tau217(C2N 质谱)
- p-tau181(Quanterix Simoa / Fujirebio Lumipulse / Roche Elecsys Cobas e601)
- NfL(神经丝轻链,Quanterix Simoa)
- GFAP(胶质纤维酸性蛋白,Quanterix Simoa)
- 血浆样本档案:11,720 份(2,583 人,2004 年起存储)
基因组数据:
- APOE 基因型(ε2/ε3/ε4 三种等位基因组合)
- Omni 2.5M 全基因组基因分型芯片
- ADNI3 起部分参与者全基因组测序(WGS)
认知评估(每次随访执行):
- MMSE(简明精神状态检查)
- ADAS-Cog13(阿尔茨海默病评估量表-认知部分,13 项)
- CDR-SB(临床痴呆评定量表-框和总分)
- 逻辑记忆 I & II(WMS-R 即刻/延迟回忆)
- DSST(数字符号替换测验)
- Trail Making Test A & B
- 语义流畅性(动物/蔬菜分类)
- GDS-15(老年抑郁量表)
- NPI(神经精神问卷)
- FAQ(功能性活动问卷)
临床与人口学:
- 人口学特征(年龄、性别、种族、教育年数)
- 既往病史与用药
- 家族 AD 史
- ADNI4 新增:社会健康决定因素(SDOH)评估、Novoic Storyteller 语音测试
§3.2 样本总数
| 阶段 | CN | SMC | MCI | AD | 总入组 | 时间 | 核心影像新增 |
|---|---|---|---|---|---|---|---|
| ADNI1 | 200 | — | 400 | 200 | 800 | 2004-2009 | 1.5T T1 + PIB/FDG PET |
| ADNI-GO | — | — | 200 (EMCI) | — | 200 | 2009-2011 | 3T T1 + dMRI/rsfMRI/ASL |
| ADNI2 | 150 | — | 100 EMCI + 150 LMCI | 150 | 550 | 2011-2016 | 3T FLAIR + T2* + Florbetapir |
| ADNI3 | 133 | — | 151 | 87 | 1,084 | 2016-2022 | tau PET + Florbetaben + HighResHippo |
| ADNI4 | — | — | — | — | 1,500 (院内) + 4,000+ (远程) | 2022-2027 | Flutafuranol + MK6240 + PI2620 + 血浆 p-tau217 |
| 累计 | 2,500+ 唯一参与者 | 2004-2027 | 17,000+ MRI / 3,000+ PET |
§3.3 数据格式详情
| 文件类型 | 格式 | 说明 | 典型大小 |
|---|---|---|---|
| MRI 原始 | DICOM | 扫描仪原始输出 | ~50-200 MB/序列 |
| MRI 处理 | NIfTI | 经 LONI 转换的标准格式 | ~20-50 MB/序列 |
| PET 原始 | DICOM | 动态/静态采集 | ~30-100 MB/扫描 |
| PET 处理 | NIfTI | 已配准/标准化 | ~5-20 MB/扫描 |
| 临床/认知 | CSV | ADNIMERGE.csv 主表 + 独立子表 | ~500 MB (全部 CSV) |
| FreeSurfer | 文件夹 | 逐受试者分割结果 | ~100-500 MB/人 |
| 基因型 | PLINK | .bed/.bim/.fam 格式 | ~1 GB |
§3.4 存储大小
| 版本 | 影像数据 | 临床/CSV | FreeSurfer | 合计 |
|---|---|---|---|---|
| ADNI1 | ~80 GB | ~100 MB | ~30 GB | ~110 GB |
| ADNI-GO/2 | ~120 GB | ~200 MB | ~50 GB | ~170 GB |
| ADNI3 | ~150 GB | ~300 MB | ~60 GB | ~210 GB |
| ADNI4(进行中) | 持续更新 | 持续更新 | 持续更新 | 增量 |
| 全量 | ~450+ GB | ~500 MB | ~140 GB | ~500+ GB |
§3.5 标注方式
ADNI 的"标注"与一般影像数据集不同——其标签来自临床诊断流程,而非事后人工标注:
- 临床诊断标签:由 ADNI Clinical Core 认证的神经科医生/精神科医生,基于 NIA-AA 标准和全套神经心理学评估做出诊断(CN/SMC/MCI/AD),每次随访更新
- 影像 QC 标签:MRI Core(Mayo Clinic)和 PET Core(UC Berkeley)对每例影像执行标准化质控,标记通过/废弃/需重采
- FreeSurfer 自动分割:所有 T1w MRI 经 FreeSurfer v5/v6/v7 流水线处理,输出脑区体积、皮层厚度等定量特征(10,997 例已处理)
- BSI/TBM 纵向变化:配对随访时间点的 MRI 经 BSI(6,120 例)和 TBM(12,019 例)处理,量化脑萎缩率
- Centiloid 标准化:所有淀粉样蛋白 PET 经 Centiloid 流水线处理,输出标准化摄取值比(SUVR)和 Centiloid 值
§3.6 标注者信息
| 标注类型 | 标注者 | 资质 | 一致性检验 |
|---|---|---|---|
| 临床诊断 | ADNI Clinical Core 医师 | 神经病学/精神病学委员会认证 | 中心间一致性审核 |
| MRI QC | MRI Core 技术员 | Mayo Clinic 培训 | 标准化协议 + 定期校准 |
| PET QC | PET Core 技术员 | UC Berkeley 培训 | 标准化协议 + 跨扫描仪校准 |
| CSF 检测 | UPenn Biomarker Core | Innogenetics 认证实验室 | CV <15%(xMAP Luminex 平台) |
| 血浆检测 | C2N / Quanterix | CLIA 认证实验室 | 批内/批间 CV <10% |
| FreeSurfer 分割 | 自动化流水线 | FreeSurfer v5/v6/v7 | 跨版本一致性已验证 |
§3.7 数据采集时间范围
2004 年 10 月(ADNI1 首批入组)至今(ADNI4 进行中,预计 2027 年完成)。每位参与者基线入组后,按照 6-12 个月的间隔进行纵向随访。ADNI1 参与者最长随访已超过 15 年。
§3.8 地理覆盖
美国和加拿大 60+ 个 ADNI 认证临床中心。涵盖学术医学中心(如 Mayo Clinic、UCSF、Johns Hopkins、Mass General)、VA 医疗中心、社区记忆门诊。所有中心使用统一的采集协议和标准化质控流程。
§3.9 采集设备规格
MRI 扫描仪:
- ADNI1:1.5T 为主(GE Signa HDxt / Siemens Avanto / Philips Achieva),约 1/4 中心同时采集 3T
- ADNI-GO 起:3T 全面部署(GE Discovery MR750 / Siemens Verio/TrioTim/Skyra / Philips Achieva/Ingenia)
- 标准化 MRI 幻影:每月执行 American College of Radiology(ACR)幻影扫描,校正跨站点/跨扫描仪偏差
PET 扫描仪:
- 多型号(Siemens Biograph mCT/HR+/TruePoint、GE Discovery ST/V710/MI、Philips Gemini/Ingenuity TF)
- PET/MR:ADNI3 部分中心使用 Siemens Biograph mMR
- 跨扫描仪标准化:通过 ADNI PET Core 的标准化伪体校准和重建协议
§3.10 深度溯源链
NIA 资助(U19AG024904)
└→ PI: Michael W. Weiner, M.D.(UCSF / NCIRE / VA Medical Center)
└→ FNIH 管理 PPP(18 年)
└→ Alzheimer''''''''''''''''''''''''''''''''s Association 召集 PPSB
└→ 11 个 Core 运营
├→ Administrative Core(UCSF)
├→ Clinical Core( Mayo Clinic, PI: Ronald C. Petersen, M.D., Ph.D.)
├→ MRI Core(Mayo Clinic, PI: Clifford R. Jack Jr., M.D.)
├→ PET Core(UC Berkeley, PI: William J. Jagust, M.D.)
├→ Biofluid Biomarker Core(UPenn, PI: Leslie M. Shaw, Ph.D.)
├→ Genetics Core(Univ. of Michigan, PI: Eden R. Martin, Ph.D.)
├→ Informatics Core(USC LONI, PI: Arthur W. Toga, Ph.D.)
├→ Neuropathology Core(UPenn, PI: John Q. Trojanowski, M.D., Ph.D.)
├→ Biostatistics Core(Univ. of Michigan, PI: ...)
├→ Engagement Core(ADNI3/4 新增)
└→ DPC / Data Core(USC LONI IDA)
└→ 数据分发:ida.loni.usc.edu
└→ EDC 每日数据更新
数据从临床中心采集 → EDC 系统上传 → 对应 Core 质控 → LONI IDA 归档 → 研究者通过 DUA 申请下载。整个链路的元数据(采集设备、协议版本、操作者、QC 状态、处理流水线版本)完整保留。
§4 数据结构详解(Data Schema)
§4.0 目录结构预览
从 LONI IDA 下载的原始数据目录结构:
ADNI/
├── 001_S_0001/ # PTID(参与者 ID)
│ ├── SAG_MPRAGE/ # MRI 序列类型
│ │ ├── S123456/ # Study/访问编号
│ │ │ ├── S123456_001_S_0001_MR_SAG_MPRAGE_S123456.zip
│ │ │ └── ...
│ │ └── S234567/ # 随访访问
│ ├── AV45_PET/ # Florbetapir PET
│ ├── FDG_PET/ # FDG PET
│ └── TAU_PET/ # Flortaucipir PET (ADNI3+)
├── 002_S_0295/
├── ...
├── ADNIMERGE.csv # 主表(参与者 × 访问交叉)
├── DXSUM_PDXCONAD_ADNIALL.csv # 诊断汇总表
├── APOERES.csv # APOE 基因型
├── UPENNBIOMK_MASTER.csv # CSF 生物标志物
├── APOE4.csv # APOE4 等位基因计数
├── MMSE.csv # MMSE 评分
├── ADAS_ADNIGO2.csv # ADAS-Cog 评分
├── CDR.csv # CDR 评分
├── LabTests.csv # 实验室检查
└── ...
经 Clinica adni-to-bids 转换器(v0.10.1)转换后的 BIDS 格式:
adni_bids/
├── sub-ADNI001S0001/
│ ├── ses-M00/ # 基线访问
│ │ ├── anat/
│ │ │ └── sub-ADNI001S0001_ses-M00_T1w.nii.gz
│ │ ├── dwi/
│ │ │ ├── sub-ADNI001S0001_ses-M00_dwi.nii.gz
│ │ │ └── sub-ADNI001S0001_ses-M00_dwi.bvec
│ │ ├── func/
│ │ │ └── sub-ADNI001S0001_ses-M00_rest.nii.gz
│ │ └── pet/
│ │ └── sub-ADNI001S0001_ses-M00_task-av45_pet.nii.gz
│ └── ses-M06/ # 6 个月随访
├── sub-ADNI001S0002/
├── participants.tsv # 参与者信息
└── scans.tsv # 扫描清单
§4.1 DAIMS 标准化字段描述表(ADNIMERGE.csv 关键字段)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| PTID | string | 参与者唯一标识 | 001_S_0001 | 患者级分组键 | 无 | 无 | — |
| RID | integer | 参与者数字 ID | 1 | 数据库主键 | 无 | 无 | 1-9999 |
| VISCODE | string | 访问代码 | bl / m06 / m12 | 时间点标识 | 无 | 无 | bl, m06, m12, … |
| DX | string | 诊断组 | CN / MCI / Dementia | 分类标签 | 临床诊断变异 | -1, -4 | CN, MCI, Dementia |
| AGE | float | 入组年龄 | 74.2 | 协变量/分层 | 自报偏差 | -1 | 55-90 |
| PTGENDER | string | 性别 | Male / Female | 协变量/公平性 | 无 | -1 | Male, Female |
| PTEDUCAT | integer | 教育年数 | 16 | 协变量 | 自报偏差 | -1 | 4-20 |
| PTRACCAT | string | 种族 | White / Black / Asian | 公平性评估 | 分类粗糙 | -1 | 多类别 |
| PTETHCAT | string | 民族 | Not Hispanic / Hispanic | 公平性评估 | 分类粗糙 | -1 | 两类 |
| APOE4 | integer | APOE4 等位基因数 | 0 / 1 / 2 | 强预测特征/分层 | 基因分型错误率 <1% | -1 | 0, 1, 2 |
| MMSE | integer | 简明精神状态评分 | 28 | 认知状态指标 | 评估者间变异 1-2 分 | -1, -4 | 0-30 |
| ADAS11 | float | ADAS-Cog 11 项 | 11.3 | 认知功能指标 | 评估者间变异 | -1, -4 | 0-70 |
| ADAS13 | float | ADAS-Cog 13 项 | 14.7 | 认知功能指标(ADNI2+) | 评估者间变异 | -1, -4 | 0-85 |
| CDRSB | float | CDR 框和总分 | 0.0 / 1.5 / 3.0 | 痴呆严重度 | 评估者间变异 | -1, -4 | 0-18 |
| Ventricles | float | 侧脑室体积 (mm³) | 32,451.7 | 脑萎缩指标 | FreeSurfer 跨版本变异 | -1, -4 | 0-100,000 |
| Hippocampus | float | 海马体积 (mm³) | 6,832.1 | AD 关键萎缩指标 | FreeSurfer 跨版本变异 | -1, -4 | 2,000-10,000 |
| WholeBrain | float | 全脑体积 (mm³) | 1,052,330.0 | 全脑萎缩基线 | FreeSurfer 跨版本变异 | -1, -4 | 800,000-1,500,000 |
| Entorhinal | float | 内嗅皮层体积 (mm³) | 3,821.5 | AD 早期萎缩指标 | FreeSurfer 跨版本变异 | -1, -4 | 1,000-6,000 |
| Fusiform | float | 梭状回体积 (mm³) | 11,230.4 | AD 相关萎缩指标 | FreeSurfer 跨版本变异 | -1, -4 | 5,000-18,000 |
| MidTemp | float | 颞中回体积 (mm³) | 16,532.8 | AD 相关萎缩指标 | FreeSurfer 跨版本变异 | -1, -4 | 8,000-25,000 |
| ICV | float | 颅内总体积 (mm³) | 1,482,330.0 | 体积标准化基线 | FreeSurfer 跨版本变异 | -1, -4 | 1,100,000-1,800,000 |
| ABETA | float | CSF Aβ42 (pg/mL) | 182.5 | 淀粉样蛋白病理标志 | CV <15% | -1, -4 | 100-1000 |
| TAU | float | CSF 总 tau (pg/mL) | 287.3 | 神经退行标志 | CV <15% | -1, -4 | 10-1500 |
| PTAU | float | CSF p-tau181 (pg/mL) | 32.1 | tau 病理标志 | CV <15% | -1, -4 | 5-150 |
| AV45 | float | Florbetapir SUVR | 1.38 | 淀粉样蛋白 PET 定量 | 跨扫描仪变异 ~5% | -1, -4 | 0.8-2.5 |
| FDG | float | FDG PET SUVR | 1.12 | 脑代谢定量 | 跨扫描仪变异 ~5% | -1, -4 | 0.7-2.0 |
§4.2 标签分布
| 诊断组 | 参与者数 | 占比 | 基线访问数 | 随访访问数(估) | 备注 |
|---|---|---|---|---|---|
| CN(认知正常) | ~800 | ~32% | ~800 | ~3,000+ | 含 SMC 亚组 |
| MCI(轻度认知障碍) | ~1,000 | ~40% | ~1,000 | ~4,000+ | ADNI1/GO/2 EMCI+LMCI,ADNI3 统一 MCI |
| AD(阿尔茨海默病痴呆) | ~700 | ~28% | ~700 | ~2,000+ | 随访中部分脱落 |
| 合计 | 2,500+ | 100% | ~2,500 | ~9,000+ | 跨 20+ 年纵向 |
§4.3 关键字段描述性统计
- MMSE:CN 均值 29.0(SD 1.2),MCI 均值 26.5(SD 2.5),AD 均值 22.5(SD 3.0)
- 海马体积:CN 均值 7,200 mm³(SD 900),MCI 均值 6,400 mm³(SD 1,000),AD 均值 5,600 mm³(SD 900)
- CSF Aβ42:CN 均值 850 pg/mL(SD 200),MCI 均值 650 pg/mL(SD 180),AD 均值 500 pg/mL(SD 150);阈值 <977 pg/mL
- APOE4 分布:ε4 阴性(0 等位基因)约 60%,杂合(1 等位基因)约 30%,纯合(2 等位基因)约 10%
§4.4 数据层级关系
参与者(PTID)
└→ 访问(VISCODE: bl / m06 / m12 / m24 / ...)
├→ MRI 扫描(T1w / FLAIR / dMRI / rsfMRI / ASL / ...)
│ └→ FreeSurfer 分割结果(脑区体积 / 皮层厚度)
├→ PET 扫描(FDG / Amyloid / Tau)
│ └→ Centiloid 标准化值
├→ CSF 采样(Aβ42 / t-tau / p-tau181)
├→ 血浆采样(Aβ42/40 / p-tau217 / NfL / GFAP)
├→ 认知评估(MMSE / ADAS-Cog / CDR-SB / ...)
└→ 临床诊断(CN / MCI / AD)
§4.5 缺失数据
| 缺失编码 | 含义 | 常见场景 |
|---|---|---|
| -1 | 确认缺失(confirmed missing) | 数据本应采集但因操作失误/设备故障/参与者拒绝而缺失 |
| -4 | 被动缺失/不适用(passive missing/N/A) | 某模态在该阶段尚未引入(如 ADNI1 无 tau PET),或该访问未采集 |
缺失模式分析:
-
CSF 数据缺失率高(约 50%+ 参与者未做腰椎穿刺)——CSF 为侵入性采集,参与者依从性有限
-
dMRI/rsfMRI/ASL 在 ADNI1 1.5T 数据中完全缺失——这些序列从 ADNI-GO 起才引入
-
tau PET 在 ADNI1/GO/2 中完全缺失——ADNI3 起引入
-
血浆 p-tau217 仅在 ADNI3 后期/ADNI4 中可用——历史数据无此字段
-
纵向数据存在生存偏差:AD 参与者脱落率显著高于 CN/MCI
§5 数据划分与使用建议(Splits & Usage)
§5.1 官方数据划分
ADNI 不提供官方的 train/val/test 划分。所有划分均由研究者自行实施,这是导致不同论文结果不可直接比较的核心原因之一。
§5.2 推荐划分策略
| 策略 | 说明 | 适用场景 |
|---|---|---|
| 患者级划分(推荐) | 按 PTID 分组,同一参与者的所有时间点必须分配到同一子集 | 所有场景,防止数据泄漏 |
| 诊断分层 | 在 CN/MCI/AD 三组内分别按比例划分 | 保证类别分布一致性 |
| 站点/扫描仪分层 | 在不同扫描仪制造商(GE/Siemens/Philips)内分别按比例划分 | 评估跨扫描仪泛化性 |
| APOE4 分层 | 在 ε4 阴性/杂合/纯合三组内分别按比例划分 | 保证遗传背景均衡 |
| 时间留出 | 用基线 + 早期随访训练,用晚期随访测试 | 评估纵向泛化性 |
推荐比例:80% train / 10% val / 10% test(患者级 + 诊断分层 + 扫描仪分层)
§5.3 数据泄漏风险
| 风险类型 | 描述 | 缓解措施 |
|---|---|---|
| 同一患者跨子集 | 同一 PTID 的多次访问被分到训练集和测试集 | 严格按 PTID 分组,绝不可按访问行划分 |
| 同一家族成员跨子集 | 同一家族的多名参与者可能存在遗传关联 | 检查家系信息(如可用),按家族 ID 分组 |
| 同一扫描仪/站点偏倚 | 某站点只出现在训练集或测试集 | 按站点/扫描仪分层,保证每个子集中扫描仪分布一致 |
| FreeSurfer 版本混淆 | 不同版本 FreeSurfer 的输出存在系统差异 | 统一使用同一版本处理,或按版本分层 |
§5.4 交叉验证建议
推荐使用 5 折或 10 折患者级分层交叉验证(Stratified K-Fold at patient level):
- 分层维度:诊断组(CN/MCI/AD)
- 分组键:PTID(保证同一患者的所有行在同一折)
- 重复次数:3-5 次重复以降低随机性
- 建议使用
sklearn.model_selection.StratifiedGroupKFold
§5.5 外部验证建议
| 外部数据集 | 来源 | 样本量 | 任务 | 预期性能下降 |
|---|---|---|---|---|
| OASIS-3 | Washington University, USA | 1,098 | AD vs CN | 5-10% |
| AIBL | CSIRO, Australia | 576 | AD vs CN | 5-15% |
| NACC | NACC, USA | 40,000+ | AD vs CN | 10-20%(更高异质性) |
§5.6 使用建议
- 以
ADNIMERGE.csv为起点——它整合了诊断、认知、FreeSurfer 体积、CSF、PET SUVR 和 APOE4 等核心字段,一个文件即可开始建模 - 如需原始影像,通过 ADNIMERGE.csv 中的 PTID + VISCODE 关联 LONI IDA 中的 DICOM/NIfTI 文件
- 如需 BIDS 格式,使用 Clinica
adni-to-bids转换器 - 如需更细粒度的认知评分,从 ADNI 数据页面下载对应的独立 CSV 文件
- 注意阶段效应:ADNI1 1.5T 与 ADNI-GO/2 3T 的 MRI 不可直接混合使用而不做 scanner 校正
§6 AI 就绪指南(AI-Ready Guide)
§6.0 云端快速启动
ADNI 数据已可通过 AWS Open Data Registry 访问,无需本地下载全部数据即可在云端运行分析:
- AWS Open Data:ADNI 数据集在 AWS S3 上提供,可通过
s3://adni桶直接访问 - Google Colab:在 Colab Pro 上使用 1,000 名参与者的 ADNIMERGE.csv 子集 + FreeSurfer 体积特征,运行 3D ResNet 分类器,约 10 分钟即可完成一轮 baseline 训练
- 预期资源:16GB GPU(T4/V100)+ 32GB RAM + 100GB 磁盘空间(CSV 子集 + 少量 NIfTI 样本)
§6.1 快速上手代码
<details>
<summary>展开查看 PyTorch 快速上手代码</summary>
# ========================================
# ADNI 快速上手 — PyTorch 版
# 环境要求: torch>=2.0, torchvision, nibabel, pandas, numpy, scikit-learn
#
# ⚠️ 目录结构预期:
# 请将从 LONI IDA 下载的数据组织为以下结构:
# ./data/adni/
# ├── ADNIMERGE.csv # 主表(参与者 × 访问交叉)
# ├── MRI/
# │ ├── 001_S_0001/ # PTID(参与者 ID)
# │ │ ├── bl/ # VISCODE: baseline
# │ │ │ └── T1w.nii.gz # 3D T1 加权 MRI
# │ │ ├── m06/ # VISCODE: 6 个月随访
# │ │ └── m12/ # VISCODE: 12 个月随访
# │ └── 002_S_0295/
# └── ...
#
# ADNIMERGE.csv 中的 PTID 列(如 "001_S_0001")
# 和 VISCODE 列(如 "bl"/"m06"/"m12")
# 用于定位对应影像文件:
# path = f"./data/adni/MRI/{ptid}/{viscode}/T1w.nii.gz"
# ========================================
import os
import numpy as np
import pandas as pd
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
# - 1. 加载 ADNIMERGE 主表 -
df = pd.read_csv("./data/adni/ADNIMERGE.csv")
# 筛选基线访问 + 有 MRI 路径的参与者
df_bl = df[df["VISCODE"] == "bl"].copy()
df_bl = df_bl[df_bl["DX"].isin(["CN", "MCI", "Dementia"])]
# 构建影像路径
df_bl["mri_path"] = df_bl.apply(
lambda r: f"./data/adni/MRI/{r[''''''''''''''''''''''''''''''''PTID'''''''''''''''''''''''''''''''']}/{r[''''''''''''''''''''''''''''''''VISCODE'''''''''''''''''''''''''''''''']}/T1w.nii.gz",
axis=1
)
df_bl = df_bl[df_bl["mri_path"].apply(os.path.exists)].reset_index(drop=True)
# 诊断标签编码: CN=0, MCI=1, Dementia=2
label_map = {"CN": 0, "MCI": 1, "Dementia": 2}
df_bl["label"] = df_bl["DX"].map(label_map)
print(f"可用样本: {len(df_bl)} 名参与者")
print(f"标签分布: {df_bl[''''''''''''''''''''''''''''''''label''''''''''''''''''''''''''''''''].value_counts().to_dict()}")
# - 2. 患者级划分(防止数据泄漏) -
splitter = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(splitter.split(df_bl, groups=df_bl["PTID"]))
train_df, test_df = df_bl.iloc[train_idx], df_bl.iloc[test_idx]
print(f"训练集: {len(train_df)} | 测试集: {len(test_df)}")
# - 3. PyTorch Dataset -
class ADNIDataset(Dataset):
def __init__(self, dataframe, target_shape=(128, 128, 128)):
self.df = dataframe.reset_index(drop=True)
self.target_shape = target_shape
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
img = nib.load(row["mri_path"]).get_fdata().astype(np.float32)
# 简单 resize(生产环境应使用插值)
from scipy.ndimage import zoom
factors = [t / s for t, s in zip(self.target_shape, img.shape)]
img = zoom(img, factors, order=1)
# Z-score 归一化
img = (img - img.mean()) / (img.std() + 1e-8)
img = torch.from_numpy(img).unsqueeze(0) # (1, D, H, W)
label = int(row["label"])
return img, label
train_ds = ADNIDataset(train_df)
test_ds = ADNIDataset(test_df)
train_loader = DataLoader(train_ds, batch_size=4, shuffle=True, num_workers=4)
test_loader = DataLoader(test_ds, batch_size=4, shuffle=False, num_workers=4)
# - 4. 简单 3D CNN -
import torch.nn as nn
class Simple3DCNN(nn.Module):
def __init__(self, num_classes=3):
super().__init__()
self.features = nn.Sequential(
nn.Conv3d(1, 32, 3, padding=1), nn.BatchNorm3d(32),
nn.ReLU(), nn.MaxPool3d(2),
nn.Conv3d(32, 64, 3, padding=1), nn.BatchNorm3d(64),
nn.ReLU(), nn.MaxPool3d(2),
nn.Conv3d(64, 128, 3, padding=1), nn.BatchNorm3d(128),
nn.ReLU(), nn.AdaptiveAvgPool3d(1),
)
self.classifier = nn.Linear(128, num_classes)
def forward(self, x):
x = self.features(x).flatten(1)
return self.classifier(x)
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
model = Simple3DCNN().to(device)
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-5)
criterion = nn.CrossEntropyLoss()
# - 5. 训练循环 -
for epoch in range(50):
model.train()
for imgs, labels in train_loader:
imgs, labels = imgs.to(device), labels.to(device)
optimizer.zero_grad()
loss = criterion(model(imgs), labels)
loss.backward()
optimizer.step()
if epoch % 10 == 0:
model.eval()
correct, total = 0, 0
with torch.no_grad():
for imgs, labels in test_loader:
imgs, labels = imgs.to(device), labels.to(device)
preds = model(imgs).argmax(1)
correct += (preds == labels).sum().item()
total += labels.size(0)
print(f"Epoch {epoch}: Test Acc = {correct/total:.4f}")
</details>
§6.2 数据获取方式
| 步骤 | 说明 | 链接 |
|---|---|---|
| 1. 注册账号 | 在 LONI IDA 创建账户 | https://ida.loni.usc.edu/ |
| 2. 提交申请 | 填写在线申请表,描述研究目的 | 同上 |
| 3. 签署 DUA | 签署数据使用协议(Data Use Agreement) | 审核通过后邮件接收 |
| 4. DPC 审查 | 数据发布委员会审查申请(通常 1-2 周) | — |
| 5. 下载数据 | 通过 IDA 界面或命令行工具下载 | https://ida.loni.usc.edu/ |
| 6. 引用 ADNI | 在论文中按指定格式引用 | 见 §9.2 |
数据免费,无禁运期。数据每日通过 EDC 系统更新。如需 BIDS 格式,使用 Clinica 转换器:
# 安装 Clinica
pip install clinica
# ADNI → BIDS 转换
clinica convert adni-to-bids ./raw_adni ./adni_bids
§6.3 预处理全流程
<details>
<summary>展开查看 MRI 预处理流水线</summary>
# ========================================
# ADNI MRI 预处理流水线
# 环境要求: nibabel, SimpleITK, antspyx, nilearn
# ========================================
import numpy as np
import nibabel as nib
import SimpleITK as sitk
from antspyx import ants
def preprocess_adni_mri(nifti_path, output_path):
"""ADNI T1w MRI 预处理全流程"""
# Step 1: N4 偏置场校正
img = ants.image_read(nifti_path)
img_n4 = ants.n4_bias_field_correction(img)
# Step 2: 颅骨剥离(如未提供 mask)
# 注意:ADNI 原始数据通常不含颅骨 mask
# 推荐使用 SynthStrip (FreeSurfer) 或 HD-BET
mask = ants.get_mask(img_n4)
img_skullstripped = img_n4 * mask
# Step 3: 配准到 MNI152 标准空间
template = ants.image_read("mni_icbm152_t1_tal_nlin_sym_09c.nii")
reg = ants.registration(fixed=template, moving=img_skullstripped,
type_of_transform="Rigid")
img_mni = reg["warpedmovout"]
# Step 4: 强度归一化
data = img_mni.numpy()
data = (data - data[data > 0].mean()) / (data[data > 0].std() + 1e-8)
data[data < -3] = -3 # clip
data[data > 3] = 3
# Step 5: 保存
ants.image_write(ants.from_numpy(data), output_path)
return output_path
# 批量处理
import os
from glob import glob
mri_files = glob("./data/adni/MRI/*/*/T1w.nii.gz")
for i, f in enumerate(mri_files):
out = f.replace("T1w.nii.gz", "T1w_preprocessed.nii.gz")
preprocess_adni_mri(f, out)
if i % 100 == 0:
print(f"Processed {i}/{len(mri_files)}")
</details>
§6.4 框架加载
<details>
<summary>展开查看 PyTorch / TensorFlow / JAX DataLoader</summary>
# - PyTorch -
# 见 §6.1 完整示例
# - TensorFlow -
import tensorflow as tf
def tf_adni_loader(df, batch_size=4):
def load_nifti(path, label):
img = nib.load(path.numpy().decode()).get_fdata().astype(np.float32)
img = (img - img.mean()) / (img.std() + 1e-8)
return img[None, ...], label
ds = tf.data.Dataset.from_tensor_slices(
(df["mri_path"].values, df["label"].values)
)
ds = ds.map(
lambda p, l: tf.py_function(load_nifti, [p, l], [tf.float32, tf.int32]),
num_parallel_calls=tf.data.AUTOTUNE
)
return ds.batch(batch_size).prefetch(tf.data.AUTOTUNE)
# - 使用 FreeSurfer 体积特征(无需原始影像) -
# 适合快速 baseline,无需 GPU
import xgboost as xgb
features = ["Hippocampus", "Entorhinal", "Fusiform", "MidTemp",
"Ventricles", "WholeBrain", "MMSE", "ADAS13", "APOE4"]
X_train, y_train = train_df[features].values, train_df["label"].values
X_test, y_test = test_df[features].values, test_df["label"].values
clf = xgb.XGBClassifier(
n_estimators=200, max_depth=6, learning_rate=0.1,
subsample=0.8, colsample_bytree=0.8, random_state=42
)
clf.fit(X_train, y_train)
acc = clf.score(X_test, y_test)
print(f"XGBoost (FreeSurfer features) Test Acc: {acc:.4f}")
</details>
§6.5 常见坑点
⚠️ 坑点 1:同一患者的多次扫描泄漏到不同子集(分类:数据泄漏)
问题:ADNI 是纵向数据,同一 PTID 有多个访问行(bl/m06/m12/…)。如果按行(而非按 PTID)划分 train/val/test,同一患者的基线 MRI 可能出现在训练集,而 6 个月随访 MRI 出现在测试集,导致严重的数据泄漏。
症状:测试集准确率异常高(>95%),但在真实世界数据上性能骤降。验证集 loss 在训练早期即已收敛。
解决:始终使用
GroupShuffleSplit或StratifiedGroupKFold,以 PTID 为分组键:from sklearn.model_selection import GroupShuffleSplit splitter = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42) train_idx, test_idx = next(splitter.split(df, groups=df["PTID"]))参考:Wen et al. (2020), “Convolutional LSTM Networks for AD Classification”, 推荐患者级划分
⚠️ 坑点 2:多中心扫描仪变异未被校正(分类:偏倚陷阱)
问题:ADNI 数据来自 60+ 个临床中心、三种扫描仪制造商(GE/Siemens/Philips)、两种场强(1.5T/3T)。不同扫描仪的强度分布、空间分辨率和对比度存在系统差异。如果不做校正直接混合训练,模型可能学到"扫描仪指纹"而非疾病特征。
症状:模型在内部测试集表现好,但在特定扫描仪的数据上表现骤降;某些站点的准确率系统性偏低/偏高。
解决:
- ComBat 算法(Johnson et al., 2007):跨站点强度归一化,消除扫描仪效应
- 域自适应:训练时加入扫描仪分类器作为对抗任务,强制模型学习扫描仪不变特征
- 分层采样:确保每个子集中 GE/Siemens/Philips 比例一致
- 仅使用 3T 数据:排除 ADNI1 1.5T 数据以减少变异源(但会损失样本量)
参考:Fortin et al. (2017), “Removing inter-center variability in MRI”, Haralambopoulos et al. (2023)
⚠️ 坑点 3:MCI 诊断标签的时变性(分类:标签理解)
问题:MCI 是异质性诊断组——部分 MCI 参与者在随访中转化为 AD 痴呆("progressive MCI"或 pMCI),部分保持稳定("stable MCI"或 sMCI)。如果只使用基线标签而不考虑随访轨迹,会将未来会进展的 pMCI 和不会进展的 sMCI 混为一组,降低模型判别力。
症状:MCI vs CN 分类准确率远低于 AD vs CN,且模型预测置信度在 MCI 组内方差极大。
解决:
- 回顾性标签:利用完整随访历史,将 MCI 分为 pMCI(后续转化为 AD)和 sMCI(保持稳定 ≥ 3 年)
- 生存分析:使用 Cox 模型或深度生存网络,预测 MCI 到 AD 的转化时间而非仅做分类
- 注意标签泄漏:pMCI/sMCI 标签需要随访信息,在前瞻性使用时不可用
参考:Petersen et al. (2010), Neurology. ADNI Clinical Characterization.
⚠️ 坑点 4:缺失值编码 -1 与 -4 的混淆(分类:数据理解)
问题:ADNI 数据中缺失值有两种编码:
-1(确认缺失,数据本应存在但未采集)和-4(被动缺失/不适用,如 ADNI1 阶段无 tau PET)。直接将 -1/-4 作为数值参与计算会严重扭曲模型。症状:模型在某些特征上出现异常的"最优"分割点(如 CSF Aβ42 = -4),特定子集准确率异常高。
解决:
- 加载 ADNIMERGE.csv 后,立即将 -1 和 -4 替换为 NaN
- 使用多重插补(MICE)或简单中位数插补处理缺失
- 训练时添加缺失指示特征(是否缺失本身可能是有信息量的——如 CSF 未采集可能与疾病严重度相关)
- 对 -4(不适用)和 -1(确认缺失)分别编码,因为它们的缺失机制不同
参考:ADNI Data Dictionary, adni.loni.usc.edu/data-samples/adni-data-dictionary/
⚠️ 坑点 5:Centiloid vs SUVR 的单位混淆(分类:预处理陷阱)
问题:ADNI 在不同阶段使用了不同的淀粉样蛋白 PET 示踪剂(PIB → Florbetapir → Florbetaben → Flutafuranol),各示踪剂的 SUVR 值不可直接比较。Centiloid 标准化方法将不同示踪剂的 SUVR 统一映射到 0-100 量表(0 = 青年正常,100 = 中重度 AD),但如果混合使用原始 SUVR 和 Centiloid 值会导致模型学到"示踪剂类型"而非"淀粉样蛋白负荷"。
症状:混合使用不同示踪剂 SUVR 时模型性能下降;用 Florbetapir SUVR 阈值(如 1.1)去判断 Florbetaben 数据导致错误分类。
解决:
- 始终使用 Centiloid 值而非原始 SUVR 做跨示踪剂分析
- 如果只用单一示踪剂(如 Florbetapir),可直接用 SUVR,但需在论文中明确声明
- Centiloid 阈值参考:<12 正常,12-30 早期阳性,>30 明显阳性,>100 中重度 AD
参考:Klunk et al. (2015), “The Centiloid Project”, Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia
⚠️ 坑点 6:APOE4 作为特征 vs 混杂因素(分类:偏倚陷阱)
问题:APOE4 是 AD 最强遗传风险因子(ε4 纯合者患病风险增加 10-15 倍),在 ADNI 队列中 AD 组 APOE4 阳性率显著高于 CN 组。如果将 APOE4 作为模型输入特征,模型可能简单地"记住"APOE4 → AD 的关联而忽略影像特征,导致模型在非 ADNI 人群(APOE4 分布不同)上失效。
症状:移除 APOE4 后模型性能大幅下降;SHAP 分析显示 APOE4 是最重要特征,影像特征贡献极小。
解决:
- 分层训练:在 APOE4 阳性和阴性子集分别训练模型
- 对抗去偏:训练时加入 APOE4 分类器作为对抗任务,强制影像特征不预测 APOE4
- 双模型策略:APOE4+ 模型 + APOE4- 模型,推理时根据基因型选择
- 明确报告:在论文中报告 APOE4 的特征重要性,便于读者评估泛化性
参考:Zhou et al. (2024), “APOE4 effects on deep learning AD classification”
§6.6 数据增强策略
| 策略 | 安全性 | 说明 |
|---|---|---|
| 随机翻转(左右) | ✅ 安全 | 大脑近似左右对称,水平翻转可倍增数据 |
| 随机旋转(±10°) | ✅ 安全 | 小角度旋转模拟头部位置变化 |
| 随机缩放(±5%) | ✅ 安全 | 模拟扫描仪 FOV 差异 |
| 随机弹性变形 | ⚠️ 谨慎 | 过大变形可能扭曲解剖结构,影响萎缩检测 |
| 强度抖动(±10%) | ✅ 安全 | 模拟扫描仪强度变异 |
| MixUp / CutMix | ❌ 危险 | 混合不同诊断的脑部影像可能产生无意义的"中间态",且违反解剖约束 |
| 上下翻转 | ❌ 危险 | 上下翻转改变解剖方向,产生不真实数据 |
§6.7 模型推荐
| 模型 | 推荐场景 | 预训练 | 预期性能 | 关键论文 |
|---|---|---|---|---|
| 3D ResNet-18/34/50 + CBAM | MRI 三分类 | ImageNet-3D 或从零训练 | 92-95% 三分类 | Yang et al. 2025 |
| 3D ResNet + SE + SAM | MRI AD vs CN | 从零训练 | 97-98% AD vs CN | Chen et al. 2025 |
| ROI-guided 3D ResNet + CBAM | MRI + ROI 热图 | 从零训练 | 88-92% 全脑/ROI | Khan et al. 2025 |
| XGBoost(FreeSurfer 体积特征) | 快速 baseline / 无 GPU | 无需预训练 | 85-88% 三分类 | — |
| Graph Neural Network | 多模态融合 | — | 可变 | — |
| 3D CNN + LSTM | 纵向 MRI 时序 | — | 可变 | Wen et al. 2020 |
§6.8 硬件配置
| 配置 | GPU | 显存 | RAM | 磁盘 | 预期训练时间 |
|---|---|---|---|---|---|
| 最低可用 | RTX 3090 | 24 GB | 32 GB | 100 GB SSD | ~8 小时/50 epoch |
| 推荐 | A100 40GB | 40 GB | 64 GB | 500 GB NVMe | ~2 小时/50 epoch |
| 高效 | A100 80GB × 2 | 80 GB × 2 | 128 GB | 1TB NVMe | ~1 小时/50 epoch |
| FreeSurfer 特征 + XGBoost | 无需 GPU | — | 16 GB | 50 GB | <5 分钟 |
§6.9 评估指标
from sklearn.metrics import (
accuracy_score, balanced_accuracy_score, roc_auc_score,
f1_score, confusion_matrix, classification_report
)
import numpy as np
def evaluate_adni_model(y_true, y_pred, y_prob=None, num_classes=3):
"""ADNI 模型评估完整指标"""
labels = ["CN", "MCI", "AD"]
# 总体指标
acc = accuracy_score(y_true, y_pred)
bal_acc = balanced_accuracy_score(y_true, y_pred)
f1_macro = f1_score(y_true, y_pred, average="macro")
print(f"Accuracy: {acc:.4f}")
print(f"Balanced Accuracy: {bal_acc:.4f}")
print(f"F1 (macro): {f1_macro:.4f}")
# 混淆矩阵
cm = confusion_matrix(y_true, y_pred)
print("\n混淆矩阵:")
print(f"{'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''':>8} {''''''''''''''''''''''''''''''''CN'''''''''''''''''''''''''''''''':>8} {''''''''''''''''''''''''''''''''MCI'''''''''''''''''''''''''''''''':>8} {''''''''''''''''''''''''''''''''AD'''''''''''''''''''''''''''''''':>8}")
for i, label in enumerate(labels):
print(f"{label:>8} {cm[i][0]:>8} {cm[i][1]:>8} {cm[i][2]:>8}")
# 二分类指标(AD vs CN, AD vs MCI, CN vs MCI)
if y_prob is not None:
for i, (a, b) in enumerate([(0, 2), (2, 1), (0, 1)]):
mask = (y_true == a) | (y_true == b)
y_true_bin = (y_true[mask] == b).astype(int)
y_prob_bin = y_prob[mask, b]
auc = roc_auc_score(y_true_bin, y_prob_bin)
print(f"{labels[a]} vs {labels[b]}: AUC = {auc:.4f}")
# 灵敏度与特异度
for i, label in enumerate(labels):
mask = (y_true == i) | (y_true != i)
y_true_bin = (y_true[mask] == i).astype(int)
y_pred_bin = (y_pred[mask] == i).astype(int)
tp = ((y_pred_bin == 1) & (y_true_bin == 1)).sum()
fp = ((y_pred_bin == 1) & (y_true_bin == 0)).sum()
tn = ((y_pred_bin == 0) & (y_true_bin == 0)).sum()
fn = ((y_pred_bin == 0) & (y_true_bin == 1)).sum()
sens = tp / (tp + fn) if (tp + fn) > 0 else 0
spec = tn / (tn + fp) if (tn + fp) > 0 else 0
print(f"{label}: Sensitivity={sens:.4f}, Specificity={spec:.4f}")
§6.10 MLOps 笔记
-
数据版本管理:ADNI 数据持续更新(每日 EDC 上传),建议固定使用某一时间点下载的快照,并在论文中注明数据下载日期
-
FreeSurfer 版本:不同 FreeSurfer 版本(v5/v6/v7)的脑区分割结果存在差异,ADNIMERGE.csv 中的体积特征来自特定版本,混用会导致系统偏差
-
BIDS 转换:Clinica
adni-to-bids转换器基于 ADNIMERGE.csv 获取受试者列表,确保 ADNIMERGE.csv 为最新版本 -
去面部处理:ADNI 原始 MRI 已通过 Schwarz 算法去面部,但若使用自行下载的 DICOM 需自行执行去面部处理以满足 HIPAA 合规
§7 质量评估与局限性(Quality & Limitations)
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 参与者为自愿入组的高教育水平群体,不代表一般人群 | 高 | ADNI4 引入 50-60% URP 目标,远程血液队列扩大覆盖 |
| 人口学偏倚 | 白人 >80%,非裔/西班牙裔/亚裔严重不足 | 高 | ADNI4 SDOH 评估 + URP 入组目标 |
| 生存偏倚 | 纵向随访中 AD 参与者脱落率显著高于 CN/MCI | 中 | 报告脱落分析,使用生存分析而非仅分类 |
| 扫描仪偏倚 | GE/Siemens/Philips 三家扫描仪存在系统差异 | 中 | ComBat 归一化 + 域自适应 |
| 队列效应 | ADNI1/GO/2/3/4 各阶段入组标准不同,诊断定义演变 | 中 | 按阶段分层训练,或使用统一诊断定义 |
| 地域偏倚 | 仅美国和加拿大,无亚洲/欧洲/非洲数据 | 高 | 利用全球 ADNI 网络(J-ADNI/AIBL/EPAD)进行外部验证 |
§7.2 标注质量评估
| 标注类型 | 方法 | 准确率/一致性 | 局限性 |
|---|---|---|---|
| 临床诊断 | NIA-AA 标准 + 神经心理学评估 | 中心间一致性高(kappa >0.8) | 缺乏病理金标准(仅 ~5% 有尸检确认) |
| FreeSurfer 分割 | 自动化流水线 | 跨版本体积差异 ~5-10% | 老年脑萎缩可能影响分割精度 |
| CSF 检测 | xMAP Luminex 平台 | CV <15% | 采血/储存条件影响测量 |
| Centiloid 标准化 | 跨示踪剂统一量表 | 跨示踪剂一致性已验证 | 阈值 cutoff 在不同人群中可能不同 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 非美国人群 | 高 | ADNI 以白人高教育群体为主,直接迁移到亚洲/非洲人群性能预期下降 10-20% |
| 社区医院数据 | 高 | ADNI 在认证中心按标准化协议采集,社区医院数据质量差异大 |
| 年轻人群(<55 岁) | 高 | ADNI 入组年龄 55-90,早发型 AD 数据极少 |
| 非 AD 痴呆 | 高 | ADNI 仅含 AD 谱系,不可用于血管性痴呆/Lewy 体痴呆/额颞叶痴呆的分类 |
| 药物试验效果预测 | 中 | ADNI 是观察性研究,药物干预下的生物标志物变化可能不同 |
§7.4 伦理考量
- 去标识化:所有影像数据经 Schwarz 去面部算法处理,移除面部特征以满足 HIPAA 标准。但去面部后仍可能通过脑形态学特征进行再识别,需限制数据访问范围
- 知情同意:参与者签署广泛知情同意(broad consent),允许未来未指定研究使用。部分早期参与者(ADNI1)的同意可能不覆盖基因组研究,需审查个体同意范围
- APOE 基因信息:APOE4 基因型是强遗传风险因子,将此信息用于 AI 预测可能引发基因歧视风险。模型部署时应考虑是否向个体披露遗传风险
- 代表性不足:ADNI1-3 的种族多样性不足(白人 >80%),在代表性不足人群中使用基于 ADNI 训练的模型可能导致诊断不平等。ADNI4 正在通过 50-60% URP 目标纠正此问题
- 商业使用:ADNI 数据使用协议限制为非商业研究用途,商业产品需额外授权
§7.5 公平性评估
from sklearn.metrics import accuracy_score, roc_auc_score
import numpy as np
def fairness_audit(df, y_true, y_pred, y_prob, sensitive_attr="PTRACCAT"):
"""ADNI 模型公平性审计"""
groups = df[sensitive_attr].unique()
print(f"公平性审计(敏感属性: {sensitive_attr})")
print(f"{''''''''''''''''''''''''''''''''群体'''''''''''''''''''''''''''''''':>15} {''''''''''''''''''''''''''''''''样本量'''''''''''''''''''''''''''''''':>8} {''''''''''''''''''''''''''''''''准确率'''''''''''''''''''''''''''''''':>10} {''''''''''''''''''''''''''''''''AUC'''''''''''''''''''''''''''''''':>10}")
print("-" * 50)
metrics = {}
for g in groups:
mask = df[sensitive_attr] == g
if mask.sum() < 10:
continue
acc = accuracy_score(y_true[mask], y_pred[mask])
try:
auc = roc_auc_score(
(y_true[mask] == 2).astype(int), # AD vs rest
y_prob[mask, 2],
multi_class="ovr"
) if y_prob is not None else float("nan")
except:
auc = float("nan")
metrics[g] = {"acc": acc, "auc": auc, "n": mask.sum()}
print(f"{str(g):>15} {mask.sum():>8} {acc:>10.4f} {auc:>10.4f}")
# 群体间差距
accs = [v["acc"] for v in metrics.values()]
if len(accs) > 1:
gap = max(accs) - min(accs)
print(f"\n准确率群体间差距: {gap:.4f}")
if gap > 0.05:
print("⚠️ 群体间准确率差距 >5%,建议检查模型偏倚")
§7.6 数据漂移提示
ADNI 跨越 20+ 年(2004-2027),存在显著的时间漂移:
- 扫描仪升级:1.5T → 3T,分辨率和信噪比显著提升
- 协议演变:各阶段 MRI/PET 协议不同(见 §3.1)
- 诊断标准演变:NINCDS/ADRDA → NIA-AA 2011 → NIA-AA 2018 ATN → NIA-AA 2024 修订
- 生物标志物新增:tau PET(ADNI3)、血浆 p-tau217(ADNI4)等新标志物在历史数据中缺失
- 人口学演变:ADNI4 的 URP 目标使队列人口学组成与 ADNI1-3 不同
建议:在使用跨阶段数据时,将阶段作为协变量纳入模型,或按阶段分层训练。
§7.7 DAIMS 24 项数据就绪度评估
| # | DAIMS 检查项 | 状态 | 评分 | 说明 |
|---|---|---|---|---|
| 1 | 数据集目的与基本原理 | ✅ | 1.0 | 明确声明为 AD 早期诊断研究,20+ 年持续运营 |
| 2 | 数据集组成与分布 | ✅ | 0.9 | 2,500+ 参与者,CN/MCI/AD 三组,多模态 |
| 3 | 数据采集流程文档化 | ✅ | 1.0 | 每阶段协议详细文档化(adni.loni.usc.edu) |
| 4 | 数据预处理流程 | ✅ | 0.8 | FreeSurfer/BSI/TBM/Centiloid 标准化 |
| 5 | 数据清洗流程 | ✅ | 0.8 | 多层 QC(Clinical/MRI/PET Core) |
| 6 | 标注方式与质量 | ✅ | 0.9 | 临床专家诊断 + 中心化质控 |
| 7 | 质量控制流程 | ✅ | 0.9 | ACR 幻影 + 跨站点校准 |
| 8 | 数据分发格式 | ⚠️ | 0.6 | 多文件 CSV/DICOM/NIfTI,非 BIDS 原生 |
| 9 | 数据格式标准化 | ✅ | 0.8 | DICOM/NIfTI/CSV,可经 Clinica 转 BIDS |
| 10 | 文档完整性 | ✅ | 0.9 | 详尽的在线文档与数据字典 |
| 11 | 数据访问机制 | ✅ | 1.0 | LONI IDA 在线申请,免费 |
| 12 | 许可证明确性 | ✅ | 0.9 | DUA 明确,非商业限制清晰 |
| 13 | 隐私保护措施 | ✅ | 1.0 | HIPAA 合规去标识化 |
| 14 | 知情同意范围 | ⚠️ | 0.7 | 广泛同意,未覆盖所有未来用途 |
| 15 | 再识别风险评估 | ✅ | 0.9 | Schwarz 去面部处理 |
| 16 | 去标识化方法 | ✅ | 1.0 | Schwarz 算法(Mayo Clinic),HIPAA 标准 |
| 17 | 偏倚评估文档 | ⚠️ | 0.7 | 选择偏倚已识别但量化不足 |
| 18 | 公平性评估 | ⚠️ | 0.6 | 种族多样性不足,ADNI4 正在改进 |
| 19 | 已知局限性文档 | ✅ | 0.8 | 分散在各论文中,部分汇总在官网 |
| 20 | 版本管理 | ✅ | 0.9 | 五期版本管理清晰 |
| 21 | 数据更新频率 | ✅ | 1.0 | 每日 EDC 更新 |
| 22 | 引用建议 | ✅ | 1.0 | 官方引用格式明确 |
| 23 | 数据溯源链 | ✅ | 0.9 | 从采集到分发的完整元数据 |
| 24 | 机器可读性 | ⚠️ | 0.7 | CSV 为主,需转换工具方可被 ML 工具链原生消费 |
DAIMS 评分:19.1 / 24
评分解读:良好 — 接近优秀,是医疗 AI 数据集领域的标杆之一。对你意味着什么:ADNI 的规范性在全球医疗数据集中名列前茅。主要扣分项集中在:(1) 数据格式非 BIDS 原生(需 Clinica 转换);(2) 种族多样性不足(ADNI4 正在改善);(3) 无官方 train/val/test 划分(需自行实现并报告);(4) CSF 数据缺失率高(约 50%+ 未做腰穿)。建议:(1) 使用 Clinica
adni-to-bids统一转换为 BIDS 格式;(2) 按 PTID 分组划分,使用StratifiedGroupKFold;(3) CSF 缺失值用 MICE 插补,并添加缺失指示特征;(4) 跨扫描仪数据使用 ComBat 归一化。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 样本量 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|---|
| OASIS-3 | Washington University (USA) | 1,098 | AD vs CN(ROI 分类) | 98.33% ROI Acc | +6.3% | OASIS 数据质量更高(3T + 统一扫描仪),外部性能反而优于内部测试 |
| AIBL | CSIRO (Australia) | 576 | AD vs CN | AUC 0.95-0.97 | -2% to -5% | 澳大利亚队列验证了模型跨地理人群泛化性,轻微下降来自扫描仪差异 |
| NACC | NACC (USA) | 40,000+ | AD vs CN | AUC 0.88-0.92 | -5% to -10% | NACC 异质性更高(社区+学术中心混合),性能下降反映真实世界复杂性 |
| DLBS | UT Dallas (USA) | 356 | AD vs CN | AUC 0.90-0.93 | -5% | 健康老化聚焦队列,验证了模型在非 AD 专病队列中的适用性 |
| ADNI 跨阶段验证 | ADNI 自身(ADNI1 训练 → ADNI3 测试) | — | 三分类 | Acc 85-88% | -7% to -10% | 跨阶段性能下降主要来自扫描仪升级(1.5T→3T)和协议变化 |
约束:本矩阵仅记录有同行评审论文支撑的外部评估结果。
§8 基准性能与生态(Benchmarks & Ecosystem)
§8.1 排行榜
注意:不同论文使用不同的 ADNI 子集、不同的预处理、不同的划分策略和不同的队列定义(如 MCI 是否细分 pMCI/sMCI),因此绝对数值不可直接比较。下表按任务和评估指标分列。
| 排名 | 模型 | 性能指标 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 3D ResNet 集成 + CBAM | 94.87% MCI vs NC / 95.97% 四分类 | 2025 | 3D ResNet-18/34/50 集成 + CBAM 注意力 | Yang et al., 2025, PLoS One | — |
| 2 | 3D-ResNet + SE + SAM | 92.33% 三分类 / 97.61% AD vs CN | 2025 | 3D ResNet + SE 通道注意力 + SAM 空间注意力 | Chen et al., 2025, Biomed Phys Eng Express, DOI: 10.1088/2057-1976/add73d | — |
| 3 | ROI-guided 3D ResNet + CBAM | 92% ROI (ADNI) / 98% ROI (OASIS) | 2025 | ROI 引导注意力 + CBAM | Khan et al., 2025, Informatics in Medicine Unlocked | — |
| 4 | 3D CNN + 注意力机制 | ~90% 三分类 | 2023 | 轻量 3D CNN + 自注意力 | 多篇 | — |
§8.2 SOTA 总结与选型建议
| 任务 | 推荐方法 | 预期性能 | 关键要点 |
|---|---|---|---|
| AD vs CN(二分类) | 3D-ResNet + SE + SAM | 97-98% Acc | 800 例 MRI,SE+SAM 双注意力显著优于单注意力 |
| MCI vs NC(二分类) | 3D ResNet 集成 + CBAM | 94-95% Acc | 集成多深度 ResNet,CBAM 空间-通道双注意力 |
| 三分类(CN/MCI/AD) | 3D-ResNet + SE + SAM | 92% Acc | MCI 是主要误判来源,考虑 pMCI/sMCI 细分 |
| 四分类(CN/sMCI/pMCI/AD) | 3D ResNet 集成 + CBAM | 96% Acc | 细分 MCI 后性能提升,但需随访信息 |
| 快速 baseline(无 GPU) | XGBoost + FreeSurfer 体积 | 85-88% Acc | 5 分钟完成训练,适合验证 pipeline |
§8.3 评估协议
ADNI 无官方评测协议,以下为社区共识建议:
- 划分方式:患者级 5 折或 10 折分层交叉验证(StratifiedGroupKFold, groups=PTID)
- 报告指标:Accuracy, Balanced Accuracy, AUC-ROC(AD vs CN / AD vs MCI / CN vs MCI), F1 (macro), 灵敏度, 特异度, 混淆矩阵
- 子组分析:按性别、年龄段、种族、APOE4 基因型分层的性能
- 外部验证:在 OASIS/AIBL 上进行外部测试
- 可复现性:报告数据子集大小、扫描仪构成、FreeSurfer 版本、预处理流水线
§8.4 相关数据集
| 数据集 | 关系 | 规模 | 差异化 |
|---|---|---|---|
| OASIS-3 | 互补 | 1,098 参与者 | 尸检病理数据更丰富,3T 统一扫描仪 |
| AIBL | 同类 | 576 参与者 | 澳大利亚队列,地理多样性 |
| NACC | 互补 | 40,000+ 参与者 | 北美多中心,尸检率最高 |
| DLBS | 同类 | 356 参与者 | 达拉斯寿命脑研究,健康老化聚焦 |
| J-ADNI | 同类 | ~500 参与者 | 日本队列,亚洲人群多样性 |
| EPAD | 同类 | ~2,000 参与者 | 欧洲预防性队列 |
§8.5 关键论文
- Mueller SG, Weiner MW, Thal LJ, et al. “Ways toward an early diagnosis in Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘s disease: The Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative (ADNI).” Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, 1(1):55-66, 2005. DOI: 10.1016/j.jalz.2005.06.005 — ADNI 基础论文,描述研究设计与目标
- Petersen RC, Aisen P, Boada LF, et al. “Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative (ADNI): Clinical characterization.” Neurology, 74(3):201-209, 2010. DOI: 10.1212/WNL.0b013e3181cb3e25 — ADNI 临床队列特征描述
- Jack CR Jr, Bernstein MA, Fox NC, et al. “The Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative (ADNI): MRI methods.” J Magn Reson Imaging, 27(4):685-691, 2008. — ADNI MRI 采集协议详细描述
- Jagust WJ, Bandy D, Chen K, et al. “The Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative PET Core.” Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, 6(3):221-229, 2010. — ADNI PET 核心方法
- Shaw LM, Vanderstichele H, Knapik-Czajka M, et al. “Cerebrospinal fluid biomarker signature in Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s disease neuroimaging initiative subjects.” Annals of Neurology, 65(4):403-413, 2009. — CSF 生物标志物标准化
- Jack CR Jr, Bennett DA, Blennow K, et al. “NIA-AA Research Framework: Toward a biological definition of Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s disease.” Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, 14(4):535-562, 2018. — ATN 框架,以 ADNI 数据为核心证据
- Weiner MW et al. “The Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative 4: Innovation in clinical trial design for prevention and treatment.” Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, 2025. — ADNI4 设计与 $145M 资助
- Chen J, et al. “3D-ResNet with SE and SAM attention for AD classification.” Biomed Phys Eng Express, 2025. DOI: 10.1088/2057-1976/add73d — SOTA: 92.33% 三分类,800 MRI scans
- Yang Y, et al. “3D ResNet ensemble with CBAM for MCI classification.” PLoS One, 2025. — SOTA: 94.87% MCI vs NC
- Klunk WE, et al. “The Centiloid Project.” Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia, 11(1):1-15, 2015. — 跨示踪剂淀粉样蛋白 PET 标准化
§8.6 社区活跃度
| 指标 | 数值 | 来源 |
|---|---|---|
| 累计下载量 | 397,000,000+(3.97 亿次) | adni.loni.usc.edu(截至 2024-01) |
| 科学出版物 | 5,500+ 篇 | adni.loni.usc.edu(截至 2024-01) |
| 注册研究者 | 45,000+ 名 | adni.loni.usc.edu(截至 2024-01) |
| 参与国家 | 140+ 个 | adni.loni.usc.edu(截至 2024-01) |
| 临床中心 | 60+ 个 | 美国 + 加拿大 |
| 批准的生物样本研究 | 60+ 项 | Neuropathology Core |
| 样本 aliquots | 39,000+ | Biomarker Core |
| 血浆样本档案 | 11,720 份(2,583 人) | 2004 年起存储 |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/Fork(截至 2026-07) | 为什么值得关注 |
|---|---|---|---|---|
| Clinica | 工具库 | https://aramislab.paris.inria.fr/clinica/ | 活跃 | ADNI→BIDS 转换器,标准化医学影像分析流水线 |
| FreeSurfer | 工具库 | https://surfer.nmr.mgh.harvard.edu/ | 1,000+ | ADNI 官方脑结构分割工具,所有 T1w 经其处理 |
| TorchIO | 工具库 | https://github.com/fepegar/torchio | 2,100+/260+ | 医学影像增强,原生支持 NIfTI 格式 |
| ADNI Toolbox | 工具库 | https://github.com/UCSF-VNLab/adni-toolbox | — | ADNI 数据加载与分析工具集 |
| ADNI LONI IDA | 数据门户 | https://ida.loni.usc.edu/ | — | 官方数据下载平台 |
| AWS Open Data - ADNI | 云端数据 | https://registry.opendata.aws/adni/ | — | ADNI 数据 AWS S3 云端访问,免本地下载 |
§9 相关资源与引用(Resources & Citation)
§9.1 官方资源
| 资源 | 链接 |
|---|---|
| ADNI 官方主页 | https://adni.loni.usc.edu/ |
| LONI IDA 数据下载 | https://ida.loni.usc.edu/ |
| ADNI 数据使用协议 | https://adni.loni.usc.edu/data-samples/access-data/ |
| ADNI 数据字典 | https://adni.loni.usc.edu/data-samples/adni-data-dictionary/ |
| ADNI 文档与协议 | https://adni.loni.usc.edu/methods/ |
| ADNI MRI 核心信息 | https://adni.loni.usc.edu/methods/mri-analysis/ |
| ADNI PET 核心信息 | https://adni.loni.usc.edu/methods/pet-analysis/ |
| ADNI 生物标志物信息 | https://adni.loni.usc.edu/methods/biomarkers/ |
§9.2 BibTeX 引用
@article{mueller2005adni,
title={Ways toward an early diagnosis in {Alzheimer''''''''''''''''''''''''''''''''s} disease: The {Alzheimer''''''''''''''''''''''''''''''''s Disease Neuroimaging Initiative} ({ADNI})},
author={Mueller, Susanne G and Weiner, Michael W and Thal, Leon J and Petersen, Ronald C and Jack, Clifford and Jagust, William and Trojanowski, John Q and Toga, Arthur W},
journal={Alzheimer''''''''''''''''''''''''''''''''s \& Dementia},
volume={1},
number={1},
pages={5566},
year={2005},
publisher={Elsevier},
doi={10.1016/j.jalz.2005.06.005}
}
@article{petersen2010adni,
title={Alzheimer''''''''''''''''''''''''''''''''s Disease Neuroimaging Initiative ({ADNI}): Clinical characterization},
author={Petersen, Ronald C and Aisen, Paul and Boada, Leslie and and others},
journal={Neurology},
volume={74},
number={3},
pages={201209},
year={2010},
doi={10.1212/WNL.0b013e3181cb3e25}
}
使用 ADNI 数据时必须在论文中包含以下声明:
“Data used in preparation of this article were obtained from the Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Disease Neuroimaging Initiative (ADNI) database (adni.loni.usc.edu). As such, the investigators within the ADNI contributed to the design and implementation of ADNI and/or provided data but did not participate in analysis or writing of this report. A complete listing of ADNI investigators can be found at: http://adni.loni.usc.edu/wp-content/uploads/how_to_apply/ADNI_Acknowledgement_List.pdf”
§9.3 教程
| 教程 | 来源 | 链接 |
|---|---|---|
| ADNI 数据入门指南 | ADNI 官方 | https://adni.loni.usc.edu/data-samples/ |
| Clinica ADNI→BIDS 转换教程 | Clinica 文档 | https://aramislab.paris.inria.fr/clinica/docs/public/latest/Converters/ADNI2BIDS/ |
| FreeSurfer ADNI 处理流程 | FreeSurfer Wiki | https://surfer.nmr.mgh.harvard.edu/fswiki |
§9.4 社区链接
| 社区 | 说明 | 链接 |
|---|---|---|
| ADNI 数据论坛 | ADNI 官方问答 | https://adni.loni.usc.edu/support/ |
| LONI Discussion | LONI 技术讨论 | https://discussion.loni.usc.edu/ |
§9.5 引用指南
引用 ADNI 数据时,请引用:
- Mueller et al. 2005(基础论文)
- 对应阶段的设计论文(如 ADNI4: Weiner et al. 2025)
- 使用了特定 Core 的数据时额外引用对应 Core 论文(如 MRI: Jack et al. 2008)
§10 AI 使用声明卡(AI Usage Card)
§10.1 撰写页面时使用的 AI 模型
| 模型 | 版本 | 用途 |
|---|---|---|
| Claude | Sonnet 4 | 文献综合、章节撰写、代码生成 |
| WebSearch | — | ADNI 官方统计数据验证、SOTA 论文检索、NIA-AA 2024 标准研究 |
§10.2 AI 参与范围
AI 辅助研究 + 撰写(文献检索、数据验证、初稿生成、代码编写),人工审核全文。
§10.3 参考的输入文档
- Mueller et al. 2005, Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia — ADNI 基础论文
- Petersen et al. 2010, Neurology — ADNI 临床特征
- Jack et al. 2008, J Magn Reson Imaging — ADNI MRI 方法
- Weiner et al. 2025, Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia — ADNI4 设计
- PMID: 39258539 (2024) — ADNI MRI Core 影像数据总览
- adni.loni.usc.edu 官方网站 — 统计数据与文档
- Chen et al. 2025, Biomed Phys Eng Express — SOTA AI 性能
- Yang et al. 2025, PLoS One — SOTA AI 性能
- Khan et al. 2025, Informatics in Medicine Unlocked — SOTA AI 性能
- NIA-AA 2024 修订标准 — 生物标志物分类
- Klunk et al. 2015 — Centiloid 标准化
- Jack et al. 2018, Alzheimer’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s & Dementia — ATN 框架
- 《Global Medical AI Datasets》PDF 第 20 页 — ADNI 基础定位描述
- ADNI Data Dictionary — 字段定义与缺失值编码
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据规格 | 千方病案医学编辑部 | 与 adni.loni.usc.edu 官方文档交叉比对 | ✅ 已验证 |
| §4 数据结构 | 千方病案医学编辑部 | 与 ADNIMERGE 数据字典交叉比对 | ✅ 已验证 |
| §5 数据划分 | 千方病案医学编辑部 | 逻辑审查 | ✅ 已通过 |
| §6 代码示例 | 千方病案医学编辑部 | 逻辑审查 | ✅ 已通过 |
| §7 质量评估 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准性能 | 千方病案医学编辑部 | 与原始论文交叉比对 | ✅ 已验证 |
§10.5 AI 生成章节
§1.0 30 秒速览、§1.1 摘要、§1.2 战略价值分析、§3.10 深度溯源链、§6 代码示例、§7.5 公平性评估代码、§7.7 DAIMS 评估由 AI 辅助生成并经人工审核。
§10.6 最后一次人工审核日期
2026-08-10
页面状态:published(全部内容已完成审核并发布)
