NACC — 美国阿尔茨海默病国家协调中心队列 AI-Ready Wikipedia

56,000+ 受试者、37 个 ADRC、最长 20 年随访的阿尔茨海默病国家纵向数据库

来源 National Alzheimer's Coordinating Center(NIA 资助,华盛顿大学托管) url: https://www.naccdata.org/发布时间: 2026-09-13最后更新: 2026-09-25 阅读 56
NACC — 美国阿尔茨海默病国家协调中心队列 AI-Ready Wikipedia

信息速览

数据集名称NACC — 美国阿尔茨海默病国家协调中心队列 AI-Ready Wikipedia
数据类型56,000+ 名受试者,217,000+ 次临床评估,37 个 ADRC 中心,15,000+ 人有 MRI/PET,CSV 免费申请获取
规模56,000+ 名受试者(20,000+ 名活跃随访)
接入方式National Alzheimer's Coordinating Center(NIA 资助,华盛顿大学托管) url: https://www.naccdata.org/
AI 就绪度

数据集封面

NACC — 美国阿尔茨海默病国家协调中心队列 AI-Ready Wikipedia | 千方病案医数集


INFOBOX

字段 内容
数据集名称 NACC
英文全称 National Alzheimer’s Coordinating Center(含 Uniform Data Set, UDS)
别名/简称 NACC UDS;NACC Database;ADRC Uniform Data Set
疾病分类 阿尔茨海默病与痴呆谱系(ICD-11:6D80 AD 所致痴呆 / 6D71 轻度神经认知障碍;另覆盖 6D81、6D82、6D83 等,详见 §2.1)
SNOMED CT 26929004 Alzheimer’s disease / 44782729 Dementia due to Alzheimer’s disease(详见 §2.1b)
数据模态 纵向临床评估 + 神经心理测验 + 脑 MRI/PET + CSF 与基因生物标志物 + 标准化神经病理
AI 任务类型 痴呆分类与鉴别诊断、MCI 转化预测、纵向认知衰退建模、临床-病理一致性验证
样本总数 56,000+ 名受试者(20,000+ 名活跃随访;37 个活跃 ADRC,官方统计,截至 2026-06 数据冻结)
数据格式 CSV(Quick Access Files,按表单组织的宽表)+ 表单 PDF + RDD 数据字典
许可证 NACC 数据使用协议(DUA),数据对全球研究者免费
访问级别 申请审核(在线数据请求 + 签署 DUA,约 2 个工作日获批)
DUO 标签 GRU(通用研究用途;具体条款以 NACC DUA 为准)
语言 英语(表单协议与数据字典;UDSv4 表单提供西班牙文版)
首发日期 1999 年(NACC 成立);UDS 自 2005-09 起采集
最后更新 2026-06 数据冻结(下一冻结 2026-09,官方)
发布机构 美国国家老龄研究院(NIA)资助、华盛顿大学托管(U24 AG072122)
官方主页 https://www.naccdata.org/
下载地址 NACC Data Front Door 数据请求系统
DOI 数据集无独立 DOI;引用论文 DOI 10.1097/WAD.0b013e318142774e
引用次数 949+(Google Scholar,Beekly 2007 数据集论文,截至 2026-09,来源)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 季度数据冻结 + 完整 RDD 数据字典 + 缺失编码规范统一,可直接读入 DataFrame;扣分项:无官方训练/测试划分、跨版本纵向拼接与影像下载需手动实现
页面状态 published

§0 医学与技术审核声明

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NACC 要求研究者通过 Data Front Door 提交数据请求、签署数据使用协议(DUA),并遵守 NIA/ADRC 项目的数据治理要求。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

  • 医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、AD/MCI/CN 临床任务定义、金标准描述)、§7 偏倚分析。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

§1 数据集概览

§1.0 📌 30 秒速览

这是什么? NACC(National Alzheimer’s Coordinating Center,美国国家阿尔茨海默病协调中心)是美国国家老龄研究院(NIA)于 1999 年设立、由华盛顿大学托管的"国家仓库":全美 37 个活跃的阿尔茨海默病研究中心(ADRC)按同一套标准化表单(Uniform Data Set, UDS),每年对每位受试者做一次全面评估——从人口学、家族史、用药、神经科查体、CDR 分级到成套神经心理测验——再把数据汇总到 NACC。截至 2026-06 数据冻结,已有 56,000+ 名受试者、217,000+ 次临床评估。

为什么重要? 它是全世界规模最大、历史最长的阿尔茨海默病纵向数据库之一:同一套协议跨 42+ 个中心连续采集 20+ 年,且"临床诊断"与"尸检神经病理"可以关联(近 60% 已故受试者捐赠大脑)。这意味着 AI 模型第一次可以在"数万人级别"上用病理金标准检验自己的判断,而不只是和另一个临床标签互相对照。

我能用它做什么? 签一份免费 DUA、等约 2 个工作日,你就能拿到整库 CSV:训练 MCI→痴呆转化预测模型(Lin 等 2018 用 15 个非侵入变量达到 >75% AUC)、验证影像模型的外部效度(Nature Communications 2022 多模态深度学习以 NACC 为训练核心)、或做认知衰退纵向建模、试验人群富集与队列设计。注意:它不是人群代表样本,不能用于估计痴呆的流行率。

§1.1 技术摘要

NACC 的核心是 UDS——由 ADRC 临床任务 force(Clinical Task Force)定义、NIA 强制各中心执行的标准化年度评估协议。每名临床核心(Clinical Core)受试者被赋予唯一 NACCID,按初访包(IVP)与年度随访包(FVP)采集人口学、家族史、用药(DRUG1-DRUG40 宽格式)、健康史、生命体征、神经科查体(含 UPDRS 运动部分)、CDR® Plus NACC FTLD、NPI-Q、GDS 与功能量表,并由共识小组或单一医师给出基于标准的病因学诊断(正常、受损非 MCI、MCI、痴呆及各型病因)。神经心理电池历经四个版本(v1→v4),自 v3 起全面改用非专有测验(MoCA、Craft Story 21、Number Span、MINT),并通过等百分位等值换算表与旧电池建立 crosswalk。除 UDS 外,NACC 还整合了标准化 MRI/PET(SCAN 协议与 CLARiTI 联盟)、CSF 生物标志物、经 ADGC/NCRAD 的基因数据,以及 8,700+ 例标准化神经病理(NP 表)。数据以季度冻结的 Quick Access Files(CSV)形式经 Data Front Door 免费发布,配 Researchers Data Dictionary(RDD)统一跨版本字段语义。

§1.2 战略价值

维度一:纵向金标准的"规模×时间×病理"三重杠杆。 ADNI 等试验型队列以影像与生物标志物见长,但样本量通常以千计;NACC 以 56,000+ 受试者、217,000+ 次评估的体量承载同一套协议的年度随访(官方),且允许临床标签与尸检病理直接对表(8,700+ 例神经病理,占已故受试者 58%)。对 AI 研究者而言,这是验证"模型判断是否真的对应病理"的最经济路径——例如 Venugopalan 等 2022 将模型预测与 NACC 神经病理分级对照,确认疾病特异性模式与死后病理一致。

维度二:异质性本身就是研究对象。 37 个中心、25 个州、多种扫描仪与多种族人群,使 NACC 天然适合回答"模型能否跨站点泛化"这一部署级问题——即使答案是"目前不能"(见 §6.5 坑点 7)。同时,FTLD、LBD、唐氏综合征等专病模块让研究者能在同一框架下研究混合病因痴呆的鉴别诊断,这是单病种试验队列难以提供的。对真实世界证据(RWE)与监管科学而言,NACC 的转诊病例系列属性是明确的局限(不能外推人群患病率),但作为"临床诊疗场景的富集样本",它恰当地模拟了模型未来服务的就诊人群。

维度三:方法学基座与"公共对照组"价值。 UDSv3 起电池非专有化,使 NACC 的评估框架可以移植到其他研究(官方点名 DIAN、ARTFL、LEFFTDS 等网络采用 UDS 表单),研究者因此能把自家小队列的分数与 NACC 的大样本分布"对表"。对试验设计与监管科学,NACC 提供了历史对照的统计功效来源;对方法学论文,"在 NACC 上验证、在 ADNI 上外验、在病理上对质"的三段式已成为可引用的验证模板。这意味着即便你的最终目标不是 NACC 本身,把它作为校准场也能提升结论的可信度。

§1.3 同类数据集横向对比

数据集 规模 模态 标注 与 NACC 的差异化
NACC UDS 56,000+ 人、217,000+ 次评估、20+ 年 临床+神经心理+MRI/PET+CSF/基因+神经病理 共识/医师临床诊断 + 尸检病理金标准 国家级多中心汇总,规模与纵向深度最大,含病理对表
ADNI 以千计受试者,多阶段 深度影像(3T MRI、amyloid/tau PET)+CSF+基因 试验级标准化采集 影像-生物标志物深度更强;NACC 规模大、临床协议统一且含病理
AIBL 累计入组 3,000+ 人、18 个月间隔 3T MRI+PET+血液+生活方式 临床诊断(ADNI 1 协议) 双中心澳洲队列,血液生物标志物采集密度高
ADSP/ADGC 基因数据 万人级基因组(v3 时期经 ADGC 可申请基因数据 13,180 人) 基因组+表型链接 经 ADGC 申请 基因组深度;可与 NACCID/家族史链接互补
UK Biobank 痴呆子集 50 万人级全库 影像子样本 + EHR 链接 登记与随访编码 人群代表性更强;NACC 的临床评估深度与诊断质量更高

§1.4 版本时间轴

版本/里程碑 时间 关键变化 来源
NACC 成立 1999 年 NIA 设立国家协调中心,建库汇总 ADRC 数据 NIA
UDSv1 2005-09 首版统一数据集,29 个 ADRC 实施 IVP/FVP 年度评估 Beekly 2007
UDSv2 2008-03 起 神经心理电池沿用含专有测验(WMS-R、BNT 等) Monsell 2016
UDSv3 2015-03 电池换非专有测验(MoCA/Craft Story/MINT 等);新增影像/CSF 链接 Besser 2018
FTLD/LBD 模块 2012-01 / 2017-08 专病补充模块(FTLD 模块 1,324 人完成) Besser 2018
UDSv4 试点→全面实施 2024→2025 REDCap 电子采集、1,255 个变量、新增 SDOH/MBI/言语学习/抗淀粉样药物 EDCS 论文
CLARiTI 数据并入 2026-06 冻结 2,000 名受试者 amyloid/tau PET 影像数据 官方

§1.5 典型应用场景

  1. MCI→痴呆转化预测与试验富集:仅用非侵入临床变量预测 4 年内转化,为抗淀粉样蛋白试验的入组前筛省下昂贵的 PET 成本(Lin 2018;Pang 2023)。
  2. 多模态痴呆鉴别诊断:MRI+临床变量融合模型区分 NC/MCI/AD/非 AD 痴呆,并以 NACC 病理数据校验预测(Venugopalan 2022)。
  3. 神经心理电池 crosswalk 与纵向等值:新旧测验等百分位换算表(Monsell 2016)支撑跨版本纵向建模。
  4. 临床-病理一致性研究:诊断准确性、混合病理(AD+血管病+LBD)对认知衰退的独立贡献分析。
  5. 跨站点泛化与调和基准:以 37 中心异质性检验模型对站点/扫描仪效应的鲁棒性。

§2 医学背景

§2.1 ICD-11 编码映射

NACC 的 UDS 诊断标签覆盖"认知正常 → 受损非 MCI → MCI → 痴呆(分病因)"完整谱系。ICD-11 将痴呆归入第 6 章神经认知障碍(6D80-6D8Z),MCI 对应新设的 6D71(WHO-FIC 基础库)。

UDS 诊断标签 ICD-11 编码 ICD-11 术语
认知正常(NC) — 非疾病状态;作为对照臂参与映射
受损但不符合 MCI(impaired, not MCI) 6E0Y 其他特指的神经认知障碍
轻度认知障碍(MCI) 6D71 轻度神经认知障碍 / Mild neurocognitive disorder
AD 所致痴呆(早发) 6D80.0 AD 所致痴呆,早发型(<65 岁)
AD 所致痴呆(晚发) 6D80.1 AD 所致痴呆,晚发型(≥65 岁)
AD 痴呆混合型(伴脑血管病) 6D80.2 混合型,伴脑血管病
脑血管病所致痴呆(血管性痴呆) 6D81 Dementia due to cerebrovascular disease
路易体病所致痴呆(DLB) 6D82 Dementia due to Lewy body disease
额颞叶痴呆(FTD,含 FTLD 模块人群) 6D83 Frontotemporal dementia
帕金森病痴呆(LBD 模块人群) 6D85.0 Dementia due to Parkinson disease
唐氏综合征痴呆(DS 模块人群) 6D85.9 Dementia due to Down syndrome
痴呆伴行为/心理症状(NPI-Q 对应) 6D86.x 痴呆的行为或心理紊乱(修饰码)

第 8 章(神经系统疾病)另设疾病实体码:8A20 Alzheimer disease、8A22 Lewy body disease、8A23 额颞叶变性,可在 post-coordination 中与 6D8x 痴呆码联用(Nervenarzt 2025 对照表)。

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 SNOMED 术语
阿尔茨海默病(疾病实体) 8A20 26929004 Alzheimer’s disease
AD 所致痴呆 6D80 44782729 Dementia due to Alzheimer’s disease
轻度神经认知障碍(MCI) 6D71 无跨方言统一首选码 以 ICD-11 6D71 为锚点;相关概念归入 26929004 认知障碍层级
血管性痴呆 6D81 23069000 Vascular dementia
额颞叶痴呆 / 路易体病痴呆 6D83 / 6D82 以 ICD-11 为锚点 FTLD 与 DLB 概念层级经 OMOP/Athena 词表核对

MCI 在 SNOMED CT 国际版中缺乏统一首选码,实际映射以 ICD-11 6D71 为准;上表编码经 OMOP/Athena 标准词表交叉核对(同 AIBL 条目 §2.1b 口径)。

§2.2 疾病简介与流行病学

阿尔茨海默病(AD)是以 β 淀粉样斑块与 tau 缠结为病理特征、以情景记忆减退起病并渐进累及多认知域的神经退行性疾病;相关痴呆(ADRD)还包括脑血管病、路易体病、额颞叶变性等病因,且老年人群中混合病理极为常见——这正是 NACC 病理数据反复展示的核心事实之一。全球老龄化背景下,ADRD 是失能与照护负担的首要病因之一;美国 NIA 因此自 1984 年起资助 ADRC 网络开展深度临床与研究性评估。NACC 的角色是为该网络提供统一"操作系统":自 2005 年 9 月起以 UDS 强制统一各中心的临床核心数据,使跨中心汇总与分析成为可能(NIA 官方说明)。

疾病进程通常跨越数十年:临床前阶段(病理改变已启动但认知正常)→ MCI(轻度功能受损)→ 痴呆期。ICD-11 新设的 6D71 轻度神经认知障碍正是为这一前驱期提供官方编码(Nervenarzt 2025 对照)。NACC 的纵向设计恰好覆盖这三阶段:同一受试者的年度访视序列可以完整记录 NC→MCI→痴呆的转化轨迹,也可以停留在任一阶段——这也是"中位访视次数仅 3 次"的队伍中,转化研究必须显式处理删失(censoring)的原因。此外,AD 所致痴呆在 ICD-11 中按早发/晚发(6D80.0/6D80.1)与混合型(6D80.2 伴脑血管病、6D80.3 伴其他非血管病因)细分,与 NACC 病因学诊断字段(含"混合型"选项)的概念结构对应良好。

需要强调的流行病学边界:NACC 样本为转诊/志愿者病例系列(referral-based case series),各中心招募协议不同,部分中心要求同意尸检方可入组,认知正常志愿者受教育程度偏高——因此 NACC 数据不可用于估计全美或任何地区的痴呆患病率/发病率(官方 Researcher’s Guide)。

§2.3 临床任务定义

任务 定义 UDS 支撑变量
筛查 识别可疑认知下降人群 MoCA/MMSE、GDS、B9 临床医生症状判断
诊断(分期) 区分 NC / 受损非 MCI / MCI / 痴呆 NACCUDSD、CDR®(B4)、功能量表(B7)
鉴别诊断 AD vs 血管性 vs DLB vs FTD vs PDD D1a/D2 病因学诊断、UPDRS(B3)、FTLD/LBD 模块
预后 预测转化与衰退轨迹 纵向 NACCMOCA/CDRSUM、DECAGE 起病年龄、里程碑表
病理验证 临床标签 vs 尸检金标准 NP 表神经病理数据 + 死亡里程碑
治疗监测 疾病修饰药物使用与安全性(v4 新增) A4a ADRD 特定治疗表

§2.3b 神经心理测验-认知域映射

UDS 电池跨版本的主要测验与认知域对应(v2→v3 更换,v4 增补言语学习):

认知域 v1-v2 测验 v3-v4 测验 备注
全局认知 MMSE MoCA 测量性质不同,不可直接拼接(坑点 2)
情景记忆(延迟回忆) WMS-R 逻辑记忆 IA/II Craft Story 21 即刻/延迟回忆 crosswalk ρ 范围内等值
注意/工作记忆 WMS-R 数字广度 Number Span 跨版本换算
命名/语言 波士顿命名测验(BNT) 多语言命名测验(MINT) v3 起非专有
执行/加工速度 TMT A/B TMT A/B(沿用) 两版本均含
语义流畅性 动物流畅性 动物流畅性(沿用) 两版本均含
言语列表学习 各中心自选(不一致) v4 新增言语学习测验 v3 因非专有原则缺失 RAVLT 类测验
抑郁 GDS GDS(沿用) B6 表
神经精神症状 NPI-Q NPI-Q(沿用) B5 表

施测培训与认证由 NACC/CTF 提供(如 CDR 培训、NPI-Q 认证模块);v4 电池支持远程(视频)施测的补充规程(VCog 研究资源)。

§2.4 患者人群构成

维度 描述 备注
来源 37 个活跃 ADRC(25 个州),历史累计 42+ 个中心 官方
时间 UDS 自 2005-09 连续采集至今,季度冻结发布 1999 年建库
年龄 以老年人群为主(ADRC 老龄队列;早发型 AD 与 DS 模块覆盖更年轻亚组) 非统一抽样框,各中心自主招募
认知状态 正常 / 受损非 MCI / MCI / 痴呆(含 AD、血管性、DLB、FTD、PDD、DS 等病因) 纯与混合病因并存
性别/种族 两性均纳入;种族/族裔跨中心异质 v4 拆分更细粒度种族变量(如 RACEASIAN、RACEMENA)
就医类型 专科记忆门诊与研究性评估(转诊、自荐、社区招募) 志愿者系列,非人群抽样;CN 组受教育程度偏高
特殊选择 部分 ADRC 要求同意尸检方入组 近 60% 已故受试者为脑捐献者

§2.5 临床价值

对临床 AI 而言,NACC 提供了三块"稀缺拼图"。其一,诊断过程的结构化记录:UDS 不只记录结论,还记录得出结论的过程(查体发现、量表得分、医师判断),使模型可以学习"临床推理的中间表征"而非只有黑箱标签。其二,病理锚点:近 60% 已故受试者的标准化神经病理(NP 表)让"金标准"从临床共识升级为组织学证据,可直接量化临床诊断的假阳性/假阴性率。其三,治疗时代的真实场景:UDSv4 新增 A4a 疾病修饰药物表与 SDOH 模块,使模型研究"抗淀粉样蛋白治疗人群的真实世界特征"成为可能——这正是单臂试验数据无法回答的问题。

§2.6 金标准定义

要素 内容
划分 无官方训练/测试划分;全库以季度冻结发布,研究者自行划分(建议按 NACCID 分组,见 §5)
标注方式 各 ADRC 共识小组或单一医师依据标准(NINCDS-ADRDA、NIA-AA、DSM-5-TR 等)给出临床病因学诊断;神经心理测验由受训 psychometrist 施测
标注者 受训临床医生/神经心理师/临床研究协调员;跨 37 中心
一致性 各中心间诊断实践存在差异(官方承认的已知偏倚,见 §7.1);病理 NP 表提供死后验证
性质 前瞻性标准化纵向采集;临床标签被视为领域金标准,但与病理并非完全一致

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小/形态 理由
最大样本量的临床/神经心理建模 Quick Access Files(全版本 UDS 合并,RDD 协调) 临床 CSV 数十 MB 至数 GB 跨 v1-v4 字段已在 RDD 中尽可能协调,样本量最大
使用最新变量(SDOH、抗淀粉样药物、言语学习) UDSv4 数据 + v3→v4 crosswalk v4 表单 CSV v4 才包含新概念;crosswalk 支持与历史数据拼接
需要新旧神经心理分数等值换算 UDSv3 + crosswalk 换算表 C2 电池 CSV + Monsell 2016 换算表 MoCA 与 MMSE、Craft Story 与 WMS-R 等值化
影像建模(MRI/PET) SCAN 协议数据 + CLARiTI(2026-06 冻结已并入) 影像按受试者下载 15,000+ 人有 MRI/PET;CLARiTI 提供 amyloid/tau PET
病理验证研究 UDS + NP 表(v8)关联 病理 CSV 8,700+ 例尸检数据,58% 已故受试者覆盖
复现 2015-2024 年间已发表结果 UDSv3 数据 v3 CSV 2015-03 至 v4 实施前的文献均基于 v3

§3.1 模态详情

模态 内容 覆盖范围 来源/备注
纵向临床评估(UDS) 人口学、家族史、用药、健康史、生命体征、神经科查体、CDR、NPI-Q、GDS、FAS、病因学诊断 全部 56,000+ 受试者,每人 1-20 次(中位 3 次),217,000+ 次评估 官方统计
神经心理电池 v1-v2:MMSE、WMS-R 逻辑记忆/数字广度、BNT 等;v3-v4:MoCA、Craft Story 21、Number Span、MINT、TMT、动物流畅性等 全部受试者(电池随版本变化) Monsell 2016
脑 MRI/PET 标准化(SCAN)与混合协议 MRI、脑体积、amyloid/tau PET 与 SUVR 15,000+ 人有 MRI/PET,每人 1-14 次检查;CLARiTI 覆盖 2,000 名受试者 官方;NIA
CSF 生物标志物 Aβ、tau 系列 子集(v3 时期 1,100 人有 CSF 数据) Besser 2018
基因数据 APOE 基因型;经 ADGC 的基因数据(v3 时期 13,180 人)、NCRAD DNA 样本(23,381 人) 子集,凭申请链接 Besser 2018
神经病理(NP) 标准化 NP 表:AD 病理(CERAD/NIA-AA)、LBD、血管病理等 8,700+ 例尸检,占已故受试者 58% Besser 2018 NP 论文
专病模块 FTLD 模块(2012-01 起,1,324 人)、LBD 模块(2017-08 起)、DS 模块 自愿提交的子集 Besser 2018

§3.1b UDS 表单清单(v4)

UDSv4 的表单体系(初访 IVP 与随访 FVP 复用同一编号体系;C2/C2T 文档需获批数据请求后访问):

表单 名称 内容要点
A1 受试者人口学 年龄、教育、种族(v4 拆分为 RACEASIAN 等独立元素)、婚姻/居住
A1a 社会健康决定因素(SDOH,可选) v4 新增模块
A2 协同参与者人口学 家属/照护者信息
A3 家族史 一级亲属痴呆史(v4 变量经 crosswalk 与 v3 衔接)
A4 / A4a 用药 / ADRD 特定治疗 DRUG1-40 宽格式;A4a 记录抗淀粉样蛋白等疾病修饰药物(v4 新增)
A5/D2 健康史 / 临床医生评估疾病 自报健康史 + 医生判定疾病
B1 生命体征与人体测量 血压、身高体重等
B3 UPDRS 运动检查 帕金森样体征量化
B4 CDR® Plus NACC FTLD 痴呆分期 + FTLD 行为/语言域
B5 NPI-Q 神经精神症状问卷(对应 ICD-11 6D86 症状修饰维度)
B6 GDS 老年抑郁量表
B7 NACC 功能评估量表(FAS) 日常功能
B8 神经科查体发现 局灶体征、锥体外系征等
B9 临床医生症状判断 含 DECAGE(认知下降起始年龄)等回溯判断字段
C2 / C2T 神经心理电池 MoCA、Craft Story 21、Number Span、MINT、TMT、动物流畅性、RAVLT 类言语学习(v4)等

§3.2 按子集样本数

子集 规模 说明
UDS 临床核心(全量) 56,000+ 人 / 217,000+ 次评估 20,000+ 人活跃随访(截至 2026-06)
有 MRI/PET 者 15,000+ 人(1-14 次检查) 含 SCAN 标准化与混合协议
神经病理 8,700+ 例尸检 占已故受试者 58%
CSF 生物标志物(v3 时期统计) 1,100 人 Besser 2018
MRI 区域脑体积(v3 时期统计) 1,317 人 同上
可下载 amyloid PET(v3 时期统计) 370 人 同上;CLARiTI 并入后大幅扩充
ADGC 基因数据 / NCRAD DNA(v3 时期统计) 13,180 人 / 23,381 人 凭申请链接
FTLD 模块 1,324 人(464 人有纵向) 2012-01 起实施

§3.3 数据格式

数据类型 格式 说明
临床/神经心理/病理 CSV(Quick Access Files) 按表单与访视类型组织,配 RDD 数据字典与编码指南
表单协议 PDF + REDCap XML/zip UDSv4 表单可下载;C2/C2T 文档凭获批数据请求访问
影像 DICOM(经 NACC 数据平台分发) SCAN 与 CLARiTI 元数据/QC/分析变量亦入 Quick Access CSV
跨版本映射 crosswalk(人读版 + JSON) 14 个 v3 表单、583 变量的 v3→v4 映射

§3.4 存储大小

官方未公布统一的总字节数。经验参考:仅临床 CSV(全版本)通常在数十 MB 至数 GB 量级,影像部分随所选受试者与模态而定(GB 至 TB 级)。请在数据请求页按所选数据流查看实际大小——本条不给无来源的具体数字。规划存储时建议按"临床 CSV(小)+ 影像元数据(小)+ 影像本体(大头)"三层估预算;表格建模无需下载任何影像,这也是 NACC 对表格研究者的最大便利之一。

§3.5 标注方式

标注=临床评估本身。UDS 是"表格化的一次临床 encounter":受训临床人员按标准化表单直接记录(纸质或 REDCap 电子采集),经各中心数据核心质控后提交 NACC。诊断字段由共识小组或单一医师给出,依据 NIA-AA、DSM-5-TR(v4)等现行标准;NACC 对提交数据执行统一错误检查(Form Validator 规则库),研究者侧另有 RDD 统一编码语义。与"众包标注"类数据集不同,UDS 的"标注者"即临床团队,标注成本内嵌于诊疗流程。

§3.6 标注者资质与一致性

施测者为受训临床医生、神经心理师(psychometrist)与研究协调员;NACC 与临床任务 force(CTF)提供各表单的施测与认证培训(如 CDR 培训、NPI-Q 认证模块)。诊断路径因中心而异——共识小组或单一医师——这是官方明确记录的跨中心差异来源;跨版本电池变化亦由 CTF 组织 crosswalk 研究控制(ρ=0.68-0.78)。没有全局的"标注者间一致性 κ"统一发布,使用者应以中心效应建模(见 §5.3、§7.1)。

§3.7 采集周期

UDS 协议要求年度随访(±6 个月窗口),直至受试者退出或死亡;死亡/退出经 Milestones 表记录。官方统计口径为每人 1-20 次访视、中位数 3 次。数据以季度冻结发布(最近 2026-06,下次 2026-09),Quick Access Files 为累计全量快照。

采集场景包括到院访视、居家访视与视频/电话远程访视(v4 提供认知电池远程施测的补充规程与筛查材料,如听力和环境筛查);晚期因健康退出的受试者可仅保留尸检随访而不视为违反协议——这意味着"访视序列戛然而止"不等于"数据质量问题",而是协议设计的一部分,建模时应与真实脱落区分处理。

§3.8 地域覆盖

美国 25 个州的 37 个活跃 ADRC(历史累计 42+ 个),覆盖东西海岸、中西部与南部主要学术医学中心;无美国以外中心的 UDS 数据。与 AIBL(澳洲双中心)、ADNI(北美+全球站点)相比,NACC 的地域广度体现为"多点学术医疗中心网络"而非"全国概率抽样"。

§3.9 设备规格

UDS 临床部分不依赖特定设备(生命体征、人体测量按表单规程)。影像部分:SCAN(Standardized Centralized Alzheimer’s & related Neurodegenerative disease imaging)协议统一 3T MRI 与 amyloid/tau PET 采集参数,并提供公共 dashboard 展示各中心 SCAN 合规数据量与 QC 状态;历史 MRI 覆盖 Siemens/Philips/GE 等多厂商——多厂商异质性是影像建模必须显式处理的维度(Venugopalan 2022 用互信息分析量化了该混杂)。

§3.10 深度溯源链

受试者(ADRC 临床核心,知情同意)→ 施测(受训临床人员,UDS 表单纸质/REDCap)→ 中心数据核心(本地质控)→ ADRC Portal 提交(NACC Data Platform)→ NACC 统一错误检查(Form Validator 规则库)→ 季度数据冻结(Quick Access Files)→ Data Front Door 申请发布(DUA)→ 研究者。每一环节均有书面协议与版本记录(FORMVER、v3→v4 crosswalk、错误检查规则库 GitHub 版本控制),可追溯到具体表单版本与采集方式。


§4 数据结构

§4.0 目录树

Quick Access Files 按数据流与表单组织(以下为示意结构,文件名以实际下载包为准;IVP=初访包,FVP=随访包):

nacc_quick_access_202606/
├── UDS/                                  # 统一数据集(按表单分文件)
│   ├── uds_ivp_a1.csv                    # A1 人口学(初访)
│   ├── uds_fvp_a1.csv                    # A1 人口学(随访)
│   ├── uds_ivp_a3.csv                    # A3 家族史
│   ├── uds_fvp_a4.csv                    # A4 用药(DRUG1-DRUG40)
│   ├── uds_fvp_a4a.csv                   # A4a ADRD 疾病修饰药物(v4 新增)
│   ├── uds_ivp_b4.csv                    # B4 CDR Plus NACC FTLD
│   ├── uds_fvp_b5.csv                    # B5 NPI-Q
│   ├── uds_fvp_b6.csv                    # B6 GDS
│   ├── uds_fvp_b7.csv                    # B7 功能评估(FAS)
│   ├── uds_fvp_c2.csv                    # C2 神经心理电池总分
│   ├── uds_ivp_d1a.csv                   # D1a 临床医生诊断(v4)
│   └── uds_fvp_d2.csv                    # D2 病因学诊断
├── NP/                                   # 神经病理表
│   └── np_form_v8.csv
├── IMAGING/                              # 影像元数据(影像本体经平台分发)
│   ├── scan_mri_metadata.csv
│   └── clariti_pet_metadata.csv
├── BIOMARKERS/
│   └── csf_biomarkers.csv
└── docs/
    ├── RDD-UDS.pdf                       # Researchers Data Dictionary
    ├── Coding_Guidebook_UDSv4.pdf
    └── uds_v3_to_v4_crosswalk.json

§4.1 DAIMS 字段字典(核心 10 字段)

下表覆盖 UDS 合并表中建模最常用的字段(语义以 RDD-UDS 为准):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
NACCID 文本 受试者唯一标识 NACC123456 分组键、泄漏防控 无(系统生成) 无 全库唯一
FORMVER 整数 该访视所用 UDS 版本(1/1.2/2/3/4) 3 版本分层与调和 无 无 1-4
NACCUDSD 整数(标签) UDS 诊断:1=正常,2=受损非 MCI,3=MCI,4=痴呆 3 分类目标变量 中心间诊断实践差异 无(有效值必填) 1-4
NACCAGE 整数 访视时年龄(岁) 78 协变量/分层 记录误差小 999=未知 ≥18
SEX 整数 生物学性别(v4 拆分性别与性别认同) 1 协变量/公平性分析 报告误差 9=未知 1=男,2=女
EDUC 整数 受教育年限 16 协变量(CN 组偏高) 自报误差 999=未知 0-36
NACCMOCA 整数 MoCA 总分(v3 起替代 MMSE) 24 认知分期主指标 施测者间差异 88/888=未施测;v3 前为 -4 0-30
NACCMMSE 整数 MMSE 总分(v1-v2) 27 旧版本认知分期 施测者间差异 88/888=未施测 0-30
CDRSUM 浮点 CDR 框盒总分 4.5 痴呆严重度连续指标 评级者间差异 999=未评级 0-18
DECAGE 整数 认知下降起始年龄(B9) 71 预后建模特征 随访视可变(医师回溯判断) 999=未知 ≥18
DRUG1-DRUG40 文本 用药宽格式(每次访视最多 40 种药名) atenolol 共病/多药研究 抄录与拼写差异 空位=未报告 自由文本

§4.1b 跨版本变量迁移示例

v3→v4 crosswalk 的典型映射(EDCS 论文与官方 crosswalk 文件):

v3 变量/概念 v4 变量/概念 迁移类型 建模提示
MMSE(NACCMMSE) MoCA(NACCMOCA) 电池更换(v2→v3 即已发生) 用 crosswalk 换算表或版本分层(坑点 2)
MOMPRDX(母亲-主要诊断) MOMETPR 重命名 + 应答编码重定义(如 050→01、410→02、430→07) 数值编码不可直接比较,须查映射字典
单一多级种族变量 RACEASIAN、RACEMENA 等独立元素 结构拆分 横向分析需按新结构重组;纵向拼接需拆分旧变量
无言语列表学习测验 v4 言语学习测验 新增 v4 前无对应数据,纵向模型需允许结构缺失

官方为 14 个 v3 表单、583 个变量提供了人读版与 JSON 版 crosswalk;1,255 个 v4 变量中 605 个(48.1%)可直接映射,仅 11 个部分可映射——纵向拼接前先跑一遍 crosswalk,比事后调试便宜得多。

§4.2 标签分布

NACC 未在单一页面发布各诊断的精确计数(计数随每次冻结变化)。研究者应在拿到数据后第一时间自行统计 NACCUDSD 频次。可核查的结构性事实:正常认知与 MCI、痴呆并存,痴呆人群覆盖 AD、血管性、DLB、FTD、PDD 等纯与混合病因;专病模块(FTLD/LBD/DS)为自愿提交的补充子集;ADRC 项目天然向"可能发展为神经退行性疾病"的人群富集(官方说明)。注意类别不平衡:中位访视次数仅 3 次,长期纵向"转化"标签(NC→MCI→痴呆)在每个冻结快照中都是少数类。

§4.3 关键统计

  • 217,000+ 次临床评估,每人 1-20 次,中位数 3 次(官方,截至 2026-06)。
  • 15,000+ 人有 MRI/PET,每人 1-14 次检查;8,700+ 例神经病理(已故者 58%)。
  • UDSv4 含 1,255 个唯一变量,605 个(48.1%)与 v3 直接映射,11 个仅部分可映射(EDCS 论文)。
  • 1,600+ 篇已发表研究使用 NACC 数据(截至 2026-06 官方口径;2018-03 时为 481 篇,Besser 2018)。
  • 神经心理电池换算质量:新旧测验配对相关 ρ=0.68-0.78,等百分位等值换算表随 crosswalk 研究发布(Monsell 2016)。
  • UDSv4 过渡规模:90+ 名成员横跨 32 个 ADRC 参与电子采集工作组;错误检查规则在 2025 年 rollout 后已用于 313+ 次 UDSv4 上传(EDCS 论文)。

§4.4 数据层级

ADRC(中心,n=37)
└── 受试者(NACCID,n=56,000+)
    └── UDS 访视(IVP/FVP,1-20 次/人,FORMVER 标记版本)
        ├── 表单响应(A1-A5/D2、B1-B9、C2/C2T、D1a/D2)
        ├── 神经心理分测验分数(C2)
        └── 关联数据(按 NACCID 链接)
            ├── 影像检查(MRI/PET,1-14 次/人,SCAN/CLARiTI)
            ├── CSF 生物标志物(子集)
            ├── 基因数据(APOE;ADGC/NCRAD 凭申请)
            └── 神经病理检查(NP 表,死亡后,8,700+ 例)

§4.5 缺失值与信息性缺失编码

NACC 缺失编码是语义化的,直接进 ML 管线前必须展开(Researcher’s Guide):

编码 含义 处理建议
8 / 88 / 888 未施测/未评估(位数随字段量纲变化) 视为缺失,禁止当数值参与均值
9 / 99 / 999 未知(知道应填但未获答案) 与 8 系分开建模或合并,语义不同
-4 该 UDS 版本未收集该变量;或 skip 模式导致无法回填 信息性缺失:与 FORMVER 交叉即知版本断点
空串(DRUG 等) 未报告用药 该访视无第 N 种药,非数据错误

官方对 -4 的完整定义还包括"skip 模式导致的缺失且无法由前一题的隐含值回填"——也就是说部分 skip 缺失已被官方按逻辑回填过,剩下的 -4 是回填也不可行的格子。因此不要在下游"更聪明地"二次回填 -4:官方已做过一轮,二次推断只会引入自己的假设。

关键点:-4 是信息性缺失——它标记"这个格子空是因为版本不收集",把 -4 当普通缺失填补会把版本结构泄漏进填补值;按 FORMVER 分层后做缺失分析是正确姿势。

§4.6 多模态对齐操作要点

NACC 的多模态链接全部经由 NACCID 完成(NIA 官方:" Often, multiple types of data are available for the same participants, in which case participant IDs can be used to tie the various available data together")。实操要点:

  1. 时点对齐:影像/CSF/基因数据与 UDS 访视的采集日期并不重合,融合建模前先建立"最近邻访视匹配"窗口(如影像日期落在某次 UDS 访视 ±6 个月内才配对)。
  2. 覆盖矩阵先行:先做 NACCID 级的模态覆盖矩阵统计(UDS×MRI×PET×CSF×NP),确定多模态子样本量再设计实验,避免"设计完才发现样本不够"。
  3. 版本维度:对齐时保留各模态各自的版本/协议标记(UDS 的 FORMVER、影像的 SCAN 合规标记、NP 表版本),多模态样本的版本组合本身要作为敏感性分析维度。
  4. 病理对表:NP 数据只有死亡后才有,做多模态-病理联合分析时样本进一步收缩(v3 时期 8,700+ 例中各模态覆盖不一),务必报告联合样本的筛选漏斗。

§5 数据划分与使用建议

§5.1 官方划分

无。NACC 以"全库快照"方式发布,不提供官方训练/验证/测试划分——任何论文中的划分都是作者自定,横向比较需谨慎(见 §8.1)。这一设计的利与弊都很清楚:利在于全库可用、无"刷榜过拟合";弊在于结果可比性差、初学者容易掉进访视级切分的泄漏陷阱。把 §5.2-§5.3 的惯例当作"事实上的协议"执行,是当前社区的最优解。

§5.2 社区惯例划分

  • 按受试者分组切分:以 NACCID 为组键做 GroupShuffleSplit/GroupKFold,同一受试者的所有访视永不跨集——这是社区事实标准。
  • 按访视时间切分:训练集取早期冻结时间窗、测试集取其后时间窗(前瞻式验证),用于模拟部署场景。
  • 按中心留出:留出 1-3 个完整 ADRC 作外部测试集,检验站点泛化(Venugopalan 2022 的做法之一)。
  • 转化预测的任务式切分:以"基线访视→第 4 年诊断"构造样本对,按受试者分组切分(Lin 2018、Pang 2023 口径)。

§5.3 划分策略与泄漏风险(重点)

  1. 受试者级泄漏:同一 NACCID 的 20 次访视高度相关,随机按"行"切分会让测试集准确率虚高数个百分点。必须 GroupKFold(NACCID)。
  2. 版本断点泄漏:神经心理电池 v2→v3 换测验(MMSE→MoCA 等),若训练集恰好全是 v2、测试集全是 v3,模型学到的是"版本识别器"。策略:按 FORMVER 分层抽样,或使用 crosswalk 换算表对齐分数(Monsell 2016)。
  3. 中心泄漏:37 个中心的招募协议与诊断实践不同,随机切分后测试集往往混有训练中心的"老熟人"。留出整中心可测泛化上限。
  4. 死亡/退出信息泄漏:Milestones 表记录了退出原因;若把"是否退出/死亡时间"相关特征放进基线特征矩阵,会造成时间泄漏。特征时间窗必须早于预测目标窗。
  5. 纵向回溯字段:DECAGE 等字段每次访视可能被医师回溯修正,用"最近值"作为基线特征等于用了未来信息;基线特征应取初访时点的值(Researcher’s Guide)。

§5.4 交叉验证建议

分组 5-fold(NACCID)作为默认;报告 mean±SD;外层再按 FORMVER 与中心做分层。转化预测任务建议用嵌套 CV 报告 AUC(少数类场景用 PR-AUC 补充)。影像子研究样本量小得多(15,000+ 人中按模态再筛),CV 折数可降至 5 且必须保持受试者分组。

§5.5 外部验证建议

目标 推荐外部队列 说明
影像模型泛化 ADNI、AIBL、OASIS、PPMI、FHS Venugopalan 2022 已建立 8 队列验证范式
临床模型泛化 ADNI(UDS 框架同源)、OASIS(UDS 规程) 临床变量可用 UDS2↔UDS3 换算表对齐
病理验证 NACC 自身 NP 表(内部金标准) 临床-病理一致性分析(非传统"外部"但为最强验证)
人群外推 HRS、CHARLS 等人群研究 仅用于"对照人群分布",不可宣称 NACC 模型代表人群

§5.6 分组划分示例代码

# 受试者分组 + FORMVER 分层的复合切分(防坑点 2/3 的最小实现)
import numpy as np
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

def split_by_subject(df: pd.DataFrame, seed: int = 42):
    # df: 访视级面板,必须含 NACCID 与 FORMVER 两列
    gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=seed)
    train_idx, test_idx = next(gss.split(df, groups=df["NACCID"]))
    train_df, test_df = df.iloc[train_idx], df.iloc[test_idx]
    # 断言:受试者不跨集
    assert set(train_df["NACCID"]).isdisjoint(set(test_df["NACCID"]))
    # 断言:版本构成大体一致(各版本占比差 <5 个百分点)
    for col in ["FORMVER"]:
        tr = train_df[col].value_counts(normalize=True)
        te = test_df[col].value_counts(normalize=True)
        for v in set(tr.index) | set(te.index):
            assert abs(tr.get(v, 0) - te.get(v, 0)) < 0.05, f"{col}={v} 版本构成失衡"
    return train_df, test_df

# 进一步:外层留出 2 个中心做"伪外部"测试(中心编码列以官方 RDD 为准)

§6 AI 就绪指南

§6.0 云端快速启动

NACC 数据平台为获批研究者提供安全沙盒(sandbox)用于协作分析;数据本体不公开下载,因此没有"一键 Colab"路径。推荐工作流:本地/机构 HPC 下载 Quick Access CSV → pandas/DuckDB 合并 → PyTorch 建模。若需要影像,经 NACC 数据平台按受试者批量下载(SCAN/CLARiTI 元数据在 Quick Access CSV 中先行筛人)。

表格研究者的最小硬件门槛极低:全库临床 CSV 在一台 32 GB 内存的普通工作站上即可完成合并与训练——NACC 的"重"在数据治理(版本、缺失语义、站点效应),而非算力。真正的算力门槛只出现在 3D 影像子集上。

§6.1 快速上手

代码块前的目录假设:

data_root/
├── uds_fvp_a1.csv        # 任意 UDS 表单 CSV(此处以随访人口学为例)
├── uds_fvp_c2.csv        # C2 神经心理总分
└── uds_fvp_d2.csv        # D2 病因学诊断
# data_root = 你解压 Quick Access Files 的目录
# 最小可用子集 = 任一访视级 CSV:行=访视,含 NACCID 即可开始
# NACC UDS 最小可用分析:pandas 合并三张表,构造受试者级面板
import pandas as pd

DATA_ROOT = "data_root/"  # 与上方目录树一致;行末拼接 data_root + 文件名

a1 = pd.read_csv(DATA_ROOT + "uds_fvp_a1.csv", low_memory=False)   # 人口学
c2 = pd.read_csv(DATA_ROOT + "uds_fvp_c2.csv", low_memory=False)   # 神经心理
d2 = pd.read_csv(DATA_ROOT + "uds_fvp_d2.csv", low_memory=False)   # 诊断

# 访视级合并:NACCID 是唯一受试者键;若表内含访视次数字段(如 VISITNUM)需一并 join
panel = a1.merge(c2, on="NACCID", how="inner", suffixes=("_a1", "_c2"))
panel = panel.merge(d2, on="NACCID", how="inner", suffixes=("", "_d2"))

# 第一步永远是:展开语义化缺失编码(8/88/888、9/99/999、-4)
missing_codes = [8, 88, 888, 9, 99, 999, -4]
num_cols = ["NACCAGE", "EDUC", "NACCMOCA", "CDRSUM"]
for col in num_cols:
    if col in panel.columns:
        panel.loc[panel[col].isin(missing_codes), col] = float("nan")

print(panel.groupby("FORMVER")["NACCID"].nunique())  # 各版本受试者数,检查版本断点

§6.2 数据获取

步骤 内容 耗时/备注
1. 注册账号 在 naccdata.org 注册研究者账号 免费
2. 提交数据请求 经 Data Front Door 选择数据流(UDS/NP/影像元数据等)与版本范围 官方称约 15 分钟填完
3. 签署 DUA 在线签署数据使用协议 机构可能需 IRB 备案
4. 获得数据 官方称 2 个工作日内交付;Quick Access Files 为 CSV 打包下载 影像另行批量下载
5. C2/C2T 文档 神经心理电池文档需获批请求后凭邮件密码访问 表单页

请求流程注意点:①机构 IRB 备案/豁免由接收方确认,官方提供治理咨询通道;②基因数据(ADGC/NCRAD)是独立申请流,不随 UDS Quick Access 自动附带;③影像本体不经 Quick Access 分发,需在平台按受试者批量下载;④DUA 禁止再分发与再识别,公开代码库不得附带数据本体。

# 下载后的一致性自检(示例):统计版本分布与缺失编码占比
import pandas as pd
df = pd.read_csv("data_root/uds_fvp_c2.csv", low_memory=False)
print(df["FORMVER"].value_counts(dropna=False))          # 版本断点在哪
frac_sentinel = (df[["NACCMOCA"]].isin([88, 888, -4])).mean()
print(frac_sentinel)                                     # 信息性缺失占比
print(df.groupby("FORMVER")["NACCMOCA"].apply(lambda s: s.isna().mean()))

§6.2b 影像子集获取(SCAN/CLARiTI)

环节 做法 备注
筛人 用 Quick Access CSV 的影像元数据(SCAN/CLARiTI 变量)先确定有 MRI/PET 的 NACCID 避免盲目申请全量影像
质控预查 SCAN 公共 Dashboard 查看各中心数据量与 QC 状态 剔除 QC 不过关的中心子集
下载 经 NACC 数据平台按受试者批量获取 DICOM 元数据/QC/分析变量已入 Quick Access
CLARiTI 2026-06 冻结起提供 amyloid/tau/神经退变 PET(约 2,000 名受试者) 临床-影像-人口学异质队列
调和 多厂商 MRI/PET 需 ComBat/域对抗处理 见坑点 7

§6.3 预处理全流程

<details>
<summary>展开完整预处理代码(缺失展开 → 版本调和 → 访视级特征 → 受试者级样本构造)</summary>

# 预处理 Pipeline:CSV 访视宽表 → 受试者级建模样本
# 目录假设:data_root/ 下有 uds_fvp_a1.csv 与 uds_fvp_c2.csv
import numpy as np
import pandas as pd

DATA_ROOT = "data_root/"

def load_uds():
    a1 = pd.read_csv(DATA_ROOT + "uds_fvp_a1.csv", low_memory=False)
    c2 = pd.read_csv(DATA_ROOT + "uds_fvp_c2.csv", low_memory=False)
    return a1, c2

# 步骤 1:语义化缺失展开
# NACC 规范:8/88/888=未施测,9/99/999=未知,-4=该版本未收集(信息性缺失)
def expand_sentinels(df: pd.DataFrame, num_cols: list) -> pd.DataFrame:
    df = df.copy()
    sentinels = [8, 88, 888, 9, 99, 999, -4, -4.0]
    for col in num_cols:
        if col in df.columns:
            df[col] = pd.to_numeric(df[col], errors="coerce")
            df.loc[df[col].isin(sentinels), col] = np.nan
    return df

# 步骤 2:跨版本调和(神经心理分数)
# v1-v2 用 MMSE(NACCMMSE),v3-v4 用 MoCA(NACCMOCA):不要直接拼接原始分!
# 方案 A:按版本分层建模;方案 B:用 Monsell 2016 crosswalk 换算表对齐后再合并
def harmonize_cognitive(df: pd.DataFrame) -> pd.DataFrame:
    df = df.copy()
    df["COG_SCORE"] = np.where(df["FORMVER"] >= 3, df.get("NACCMOCA"), df.get("NACCMMSE"))
    df["COG_INSTRUMENT"] = np.where(df["FORMVER"] >= 3, "MoCA", "MMSE")
    return df

# 步骤 3:访视级特征(只用该访视或更早的信息)
def build_visit_features(a1: pd.DataFrame, c2: pd.DataFrame) -> pd.DataFrame:
    a1 = expand_sentinels(a1, ["NACCAGE", "EDUC"])
    c2 = expand_sentinels(c2, ["NACCMOCA", "NACCMMSE", "CDRSUM"])
    visit = a1.merge(c2, on=["NACCID"], how="inner", suffixes=("", "_c2"))
    visit = harmonize_cognitive(visit)
    return visit

# 步骤 4:受试者级样本(基线特征 + 未来诊断变化作为标签)
def build_subject_samples(visit: pd.DataFrame) -> pd.DataFrame:
    visit = visit.sort_values(["NACCID"])           # 实际应按访视日期/次序列排序
    baseline = visit.groupby("NACCID").first().reset_index()  # 初访时点特征,防回溯泄漏
    # 转化标签示例:基线 NACCUDSD==1(正常),任一后续访视出现 3(MCI)或 4(痴呆)
    later = visit.groupby("NACCID")["NACCUDSD"].max()
    baseline["PROGRESS_LABEL"] = ((baseline["NACCUDSD"] == 1) & (later >= 3)).astype(int)
    cols = ["NACCID", "NACCAGE", "EDUC", "COG_SCORE", "COG_INSTRUMENT",
            "NACCUDSD", "PROGRESS_LABEL"]
    return baseline[[c for c in cols if c in baseline.columns]]

if __name__ == "__main__":
    a1, c2 = load_uds()
    visit = build_visit_features(a1, c2)
    subjects = build_subject_samples(visit)
    print(subjects["PROGRESS_LABEL"].value_counts())  # 转化率 sanity check

</details>

§6.4 PyTorch DataLoader 完整代码

<details>
<summary>展开 Dataset 类 + transform + DataLoader 实例化(可运行)</summary>

# NACC 受试者级表格数据 → PyTorch Dataset
# 目录假设同 §6.3;产出 subjects.csv 后可直接喂给本模块
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader

class NACCSubjectDataset(Dataset):
    """受试者级表格数据集:一行=一名受试者(基线访视特征+转化标签)。

    设计要点:
    - 缺失值以 NaN 进入,用列均值填补并附加缺失指示位(信息性缺失可学习)
    - 类别变量 one-hot;连续变量 z-score
    - split 参数隔离训练/验证/测试,划分必须已在 pandas 层按 NACCID 分组完成
    """

    def __init__(self, csv_path: str, split: str = "train",
                 label_col: str = "PROGRESS_LABEL", seed: int = 42):
        df = pd.read_csv(csv_path, low_memory=False)
        # 受试者级分组划分(GroupShuffleSplit 等价实现,防止访视级泄漏)
        rng = np.random.RandomState(seed)
        subjects = df["NACCID"].unique()
        rng.shuffle(subjects)
        n = len(subjects)
        tr, va = subjects[:int(0.7 * n)], subjects[int(0.7 * n):int(0.85 * n)]
        id_set = {"train": set(tr), "val": set(va),
                  "test": set(subjects[int(0.85 * n):])}[split]
        self.df = df[df["NACCID"].isin(id_set)].reset_index(drop=True)

        self.feature_cols = [c for c in ["NACCAGE", "EDUC", "COG_SCORE", "CDRSUM"]
                             if c in self.df.columns]
        X = self.df[self.feature_cols].astype(float)
        self.missing_mask = X.isna().values.astype(np.float32)
        self.col_mean = X.mean(axis=0)
        X = X.fillna(self.col_mean)
        self.mu, self.sd = X.mean(axis=0), X.std(axis=0).replace(0, 1)
        Xz = ((X - self.mu) / self.sd).values.astype(np.float32)
        self.X = np.concatenate([Xz, self.missing_mask], axis=1)  # 缺失指示位
        self.y = self.df[label_col].values.astype(np.float32)

    def __len__(self):
        return len(self.df)

    def __getitem__(self, idx):
        return (torch.from_numpy(self.X[idx]),
                torch.tensor(self.y[idx], dtype=torch.float32))

if __name__ == "__main__":
    ds = NACCSubjectDataset("subjects.csv", split="train")
    dl = DataLoader(ds, batch_size=256, shuffle=True, num_workers=4,
                    pin_memory=True)
    xb, yb = next(iter(dl))
    print(xb.shape, yb.mean().item())  # [B, 特征维 x2];正类率 sanity check

</details>

§6.5 坑点 8 个

⚠️ 坑点 1:把 8/88/888、9/99/999、-4 当数值送进模型(分类:预处理陷阱)

问题:NACC 用语义化哨兵值标记缺失:8/88/888=未施测,9/99/999=未知,-4=该 UDS 版本未收集。直接 pd.read_csv 后这些值是合法数值,均值、标准化、树模型分裂阈值全部被污染。
症状:MoCA 均值低得不合常理(被 88/888 拉偏);xgboost 学到"分数=999 的样本预后特别差"这类伪规则;两个中心间差异其实是缺失编码占比差异。
解决:

  1. 简单方法:读入后一次性将哨兵值替换为 NaN(见 §6.3 expand_sentinels),再统计每列缺失率。
  2. 进阶方法:把"缺失指示位"作为额外特征保留(缺失本身有信息:未施测可能与疾病晚期相关),数值用中位数/模型内建缺失处理(LightGBM 原生支持 NaN)。
  3. SOTA 方法:按 FORMVER 分层做多状态缺失分析(MCAR/MAR/MNAR 诊断),对 -4 驱动的版本性缺失用版本分层填补或缺失诱导多重插补(MICE)并在敏感性分析中对比。
    参考:NACC Researcher’s Guide「Missing Data」节

⚠️ 坑点 2:MMSE 与 MoCA 直接拼接成一条"认知分数"时间序列(分类:标签理解 / 预处理陷阱)

问题:UDSv1-v2 施测 MMSE,v3 起换 MoCA。两者测量性质不同(MMSE 适合中重度筛查,MoCA 对轻度损伤更敏感),总分不可直接比较。把 NACCMMSE 与 NACCMOCA 串成一条曲线做衰退斜率,会把版本切换点误判为"认知加速下降"。
症状:衰退斜率在 2015-03(v3 实施)附近出现系统性跳变;混版本回归中 FORMVER 的系数远大于临床协变量。
解决:

  1. 简单方法:只用单一版本的子队列(如全 v3+)建模,损失样本量但保正确性。
  2. 进阶方法:使用 NACC crosswalk 研究(2014 年初施测、同批受试者同时做新旧测验)产出的等百分位等值换算表,把 MMSE 换算为 MoCA 等值分后再合并;换算表相关系数 ρ=0.68-0.78。
  3. SOTA 方法:把测验版本作为测量模型的一部分(items-level IRT 或带版本随机效应的混合模型),而非在总分层面硬换算;敏感性分析中报告"仅同版本子队列"的结果。
    参考:Monsell et al. 2016 Crosswalk Study;Researcher’s Guide「MMSE vs MoCA」节

⚠️ 坑点 3:访视级随机切分造成受试者级泄漏(分类:数据泄漏)

问题:NACC 是纵向数据,同一 NACCID 最多 20 次访视。按"行"(访视)随机切分后,同一名受试者几乎必然同时出现在训练集与测试集,模型只需记住人即可得高分。
症状:测试集 AUC 比留出中心验证高 5-15 个百分点;"每中心准确率"方差极大。
解决:

  1. 简单方法:GroupKFold/GroupShuffleSplit(group=NACCID),任何切分脚本先断言 set(train_ids) & set(test_ids) == ∅。
  2. 进阶方法:受试者分组 + FORMVER 分层 + 中心分层的复合切分,保证每折版本构成一致。
  3. SOTA 方法:时间前瞻式划分(训练早于验证/测试时间窗)+ 留出整中心外部测试集,双轨报告内部与跨站点性能。
    参考:§5.2-§5.3;Venugopalan et al. 2022 的多队列验证设计

⚠️ 坑点 4:DECAGE 等"回溯修正"字段的未来信息泄漏(分类:数据泄漏 / 标签理解)

问题:B9 表的 DECAGE(认知下降起始年龄)等字段由医师在每次访视回溯判断并可能修改——诊断变了,回溯的起病年龄也变。用"最近一次访视的 DECAGE"作为基线特征,等于把未来访视的结论塞进了基线特征矩阵。
症状:含 DECAGE 的基线模型性能"异常好",但前瞻式时间划分后性能骤降。
解决:

  1. 简单方法:基线特征一律取初访(IVP)时点的值。
  2. 进阶方法:保留"值随访视变化"的序列作为动态特征,但严格用 t 时刻之前的访视预测 t 之后的转化(特征窗与标签窗时间隔离)。
  3. SOTA 方法:对可变字段建立"报告过程模型",把修正事件本身当作信息(诊断修正往往先于正式诊断标签改变)。
    参考:Researcher’s Guide「Data Values that Can Vary Over Time」节

⚠️ 坑点 5:把健康史自报条目当作临床诊断特征(分类:标签理解 / 偏倚陷阱)

问题:A5/D2 健康史表收集的是受试者或协同参与者自报的健康状况;同一疾病在临床医生诊断表中另有记录(如帕金森病)。自报与医生判定不一致时,用自报列做"帕金森共病"特征会引入系统性错分。
症状:共病特征的效应方向不稳定;与文献发病率对比时显著偏高(自报假阳性多)。
解决:

  1. 简单方法:优先使用临床医生判定来源的同一变量(官方 Guide 明确建议)。
  2. 进阶方法:构造"自报与医生判定一致性"特征本身,把不一致当作噪声协变量。
  3. SOTA 方法:多来源证据融合(自报+查体+UPDRS B3),用弱监督整合而不是单列取舍。
    参考:Researcher’s Guide「Participant Health History Form Data」节

⚠️ 坑点 6:忽视 DRUG1-DRUG40 宽格式的列位置语义(分类:工程陷阱)

问题:用药以宽格式存储——DRUG1 到 DRUG40 是"第 1-40 种报告的药",同一药物在不同访视可能落在不同列;列序没有药理学含义。把 DRUG3 当"第三种常用药"或对 DRUG 编号做 one-hot 都是错误建模。
症状:药物特征在访视间"漂移";按列聚合的药物频率与真实用药谱对不上。
解决:

  1. 简单方法:把 40 列融化为长格式(NACCID, 访视, 药名),再按药名/RxNorm 归一化做 one-hot 或嵌入。
  2. 进阶方法:药名字符串清洗(大小写、盐型缩写)+ 词形归并 + ATC 类别映射,构造"药物类暴露计数"特征。
  3. SOTA 方法:用药序列的时序嵌入(如按访视窗口聚合的 bag-of-ATC + 时间衰减权重)。
    参考:Researcher’s Guide「Medication Data」节

⚠️ 坑点 7:37 个中心 + 多厂商扫描仪的站点混杂(分类:偏倚陷阱 / 评估误用)

问题:NACC 汇聚 37 个 ADRC、25 个州,影像覆盖多厂商(Siemens/Philips/GE)。诊断流行率、招募构成、扫描仪分布都与中心绑定——模型可能学到"中心指纹"而非疾病特征。Venugopalan 等 2022 专门用 tSNE 聚类与互信息分数(MIS)检验了 ADRC ID、扫描仪品牌与诊断标签的相关性。
症状:影像模型在训练中心内表现好,跨中心 AUC 明显下降;Grad-CAM 热区出现在脑外/颅骨区域。
解决:

  1. 简单方法:特征层面加入中心/厂商协变量;或至少报告"留出中心"性能作为下界。
  2. 进阶方法:ComBat/whitening 影像调和 + 厂商重采样;表格数据用中心随机效应混合模型。
  3. SOTA 方法:域对抗(DANN)/不变风险最小化(IRM)约束表征对中心不变;以外部队列(ADNI/OASIS)做迁移评估。
    参考:Venugopalan et al. 2022, Nat Commun;NIA 数据说明

⚠️ 坑点 8:把 NACC 当人群样本解释流行率与筛查阳性率(分类:偏倚陷阱)

问题:NACC 是转诊/志愿者病例系列:各中心自定招募协议、部分中心要求同意尸检才入组、正常认知志愿者受教育程度偏高。用它估计痴呆患病率、发病率或模型在一般人群中的假阳性率都会系统性偏移。
症状:MCI 患病率远高于人群调查值;CN 组 MoCA 分布整体右移(高教育保护效应)。
解决:

  1. 简单方法:论文与报告中明确标注"临床富集样本",避免任何患病率表述。
  2. 进阶方法:以 IPW(逆概率加权)对教育/年龄/性别分布做人群再权重,敏感性分析呈现。
  3. SOTA 方法:与人群队列(HRS 等)做 transportability 分析,显式估计选择偏倚函数。
    参考:官方数据说明「not a statistically based sample」;Researcher’s Guide「Incidence and Prevalence Rates」节

§6.6 数据增强

类别 操作 判定
表格 受试者级重采样(SMOTE 类)平衡转化标签 ✅ 仅在训练折内,且报告 PR-AUC
表格 缺失指示位特征化(保留缺失信息) ✅ 语义化缺失的正确用法
表格 跨版本分数随机替换(MMSE/MoCA 互换) ❌ 破坏测量等值性
影像 随机裁剪、旋转、弹性形变(MRI) ✅ 小幅度(≤15°、形变系数小)
影像 强度归一化之外的任意直方图变换 ❌ PET 定量 SUVR 语义会被破坏
影像 厂商间风格迁移生成合成数据 ⚠️ 需在留出中心验证增益,防风格伪影学进模型
时序 访视序列时间抖动(±6 个月协议窗口内) ✅ 反映协议真实容差
时序 前向填充 DECAGE 等回溯字段 ❌ 未来信息泄漏(坑点 4)

§6.7 模型推荐

任务 推荐模型 理由
MCI 转化预测(表格) LightGBM/XGBoost + 分组 CV Lin 2018 用 15 个临床变量达 >75% AUC;树模型对语义化缺失友好
纵向衰退建模 混合效应模型 / LSTM-Transformer 序列模型 年度访视稀疏不规则,混合效应是统计基线
影像分类(MRI 子集) 3D ResNet/ViT + ComBat 调和 需处理多厂商(坑点 7)
多模态融合 CNN(影像)+ CatBoost(表格)双塔融合 Venugopalan 2022 范式,可对照医师水平
临床-病理一致性 逻辑回归 + 校准曲线 可解释性优先,病理验证要求错误可追溯

§6.8 硬件需求

场景 最低配置 推荐配置
临床 CSV 建模 16 GB 内存,无 GPU 32-64 GB 内存(全库 CSV 合并峰值)
表格深度学习 + 单张 8 GB GPU 单张 24 GB GPU
3D MRI 训练 24 GB GPU ×1 40-80 GB GPU ×2-4(3D 卷积显存密集)
PET 大规模预训练 — 多卡 A100/H100 级,或经 NACC 沙盒

§6.9 评估指标代码

# 分组 CV + 双指标评估(AUC 与 PR-AUC),转化预测任务模板
from sklearn.model_selection import GroupKFold
from sklearn.metrics import roc_auc_score, average_precision_score
import lightgbm as lgb
import numpy as np

def grouped_cv_auc(X, y, groups, n_splits=5, seed=42):
    oof_pred = np.zeros(len(y))
    gkf = GroupKFold(n_splits=n_splits)
    for tr_idx, va_idx in gkf.split(X, y, groups):
        model = lgb.LGBMClassifier(
            n_estimators=500, learning_rate=0.05,
            num_leaves=31, random_state=seed)
        model.fit(X.iloc[tr_idx], y.iloc[tr_idx])
        oof_pred[va_idx] = model.predict_proba(X.iloc[va_idx])[:, 1]
    return roc_auc_score(y, oof_pred), average_precision_score(y, oof_pred)

# groups 必须是 NACCID(受试者级),否则就是坑点 3

§6.10 MLOps 笔记

  • 数据版本管理:以冻结版本为数据快照键(如 nacc-2026-06),任何实验配置记录所用冻结号与 FORMVER 过滤条件;季度冻结会改变样本构成,跨冻结比较需重跑。
  • 可复现性:NACC 数据受 DUA 约束不可再分发,代码仓库只提交切分索引(NACCID 列表哈希)而非数据本体;DVC/MLflow 记录特征管道版本。
  • 监控与漂移:部署后监控输入分布漂移(年龄、教育、版本构成)与 MoCA 分数漂移;UDSv4 切换期(2024-2025)是天然的概念漂移压力测试窗口。
  • 合规流水线:DUA 禁止受试者级数据再分发与身份再识别尝试;公开 benchmark 应只发布聚合指标与模型权重;发表前遵循 NACC 的引用与致谢规范(见 §9)。
  • 冻结切换演练:每年 3 月/6 月/9 月/12 月冻结更新时,先在影子环境重跑特征管道并 diff 样本构成(新增受试者数、各 FORMVER 占比、诊断分布),确认无模式突变后再替换生产数据源。
  • 长周期实验的"版本卫生":跨度超过 2024-2025 的纵向实验必须显式声明 UDSv3/v4 的窗口划分;v4 变量未经 crosswalk 不得与 v3 变量同列计算。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
选择偏倚 转诊/志愿者富集样本;部分中心要求同意尸检;CN 组高教育 高 明确非人群推断用途;IPW 敏感性分析(坑点 8)
中心效应 37 中心招募协议、诊断实践(共识 vs 单医师)不一 高 留出中心验证;中心随机效应
版本断点 四个版本量表更换(MMSE→MoCA、电池重设计、TBI 定义变化) 高 crosswalk 换算;按 FORMVER 分层(坑点 2)
测量偏倚 自报(健康史)与医生判定并存 中 优先医生判定来源(坑点 5)
缺失机制 -4 版本性缺失与 8/9 系未施测缺失混合 中 语义化展开 + 版本分层填补(坑点 1)
生存偏倚 死亡/退出上报频率各中心不一;晚期退出者只随访尸检 中 生存分析建模;Milestones 数据谨慎使用
设备混杂 多厂商 MRI/PET 与中心绑定 中(影像子集高) ComBat/域对抗(坑点 7)

§7.2 标注质量

临床诊断由受训临床团队依据现行标准给出,被领域视为金标准;但"金标准"有三层含义需要区分:临床标准金标准(UDS 诊断)、定量测评锚点(CDR、神经心理电池)与组织学金标准(NP 表尸检)。三者并不完全一致——诊断 discordance 本身是 NACC 支持的重要研究方向(例如 PSP 人群中诊断与病理高度不一致的报道)。跨中心施测一致性由统一表单、培训与错误检查控制,但无全局 κ 统计发布;UDS3 新旧电池换算的等值质量有定量证据(ρ=0.68-0.78,仅逻辑记忆有学习效应)。

对 ML 研究者的操作性建议:把 NACCUDSD 当作"强但非完美"的弱标签使用——若研究目标是病理验证,直接以 NP 表为锚;若目标是临床部署模拟,则以 UDS 诊断为目标并报告校准曲线;若目标是转化预测,注意标签定义窗口(转化发生在两次访视之间,实际时点只能在访视粒度上近似)。三种用法对应三种"标签质量"含义,混用是常见的审稿雷区。

§7.3 泛化性

部署场景 失效风险 证据/机制
一般人群筛查 高 富集样本(§7.1);官方明示不可用于患病率
社区记忆门诊 中 人群构成较接近临床转诊场景,但教育/族裔分布仍偏
多中心医院网络 中 中心效应可迁移为"站点效应",需调和
抗淀粉样治疗时代 中 历史数据基本无疾病修饰药物暴露(v4 起才系统记录)
非 AD 痴呆(FTD/PDD/DS) 高 专病模块为自愿提交子集,规模小

§7.4 伦理

各 ADRC 对所有受试者与协同参与者收集书面知情同意;数据经脱敏(NACCID 化,不含姓名/邮箱等直接标识)后经 DUA 分发;基因数据(APOE、ADGC/NCRAD)为高敏数据,凭额外申请并受 DUA 约束;再识别尝试与受试者级再分发被禁止。研究者发表成果需遵循 NACC 引用规范。使用涉及人类受试者数据时,机构 IRB 备案/豁免由接收方负责确认。

治理支持是官方服务的一部分:NACC 提供研究治理咨询通道,覆盖 IRB 批准问题、其他 ADRC 的 IRB 语言范例、ADRC-NACC DTUA(数据转移与使用协议)咨询与知情同意书修订——在启动项目前先走一遍治理咨询,可以避免数据到手后才发现合规缺口的情况。

§7.5 公平性

NACC 覆盖多种族/族裔人群,且 v4 将单一多级种族变量拆分为独立元素(如 RACEASIAN、RACEMENA),提高了族裔分析的颗粒度;官方论文亦强调 UDS 可支撑针对特定族裔的细粒度分析。但需注意:中心与族裔高度绑定(地理/机构因素),少数族裔子样本量仍受招募结构限制;公平性审计应报告分组性能(按性别、族裔、中心规模),并警惕"教育年限"作为协变量时对低教育群体的系统性校正偏差。

§7.6 数据漂移

四个已知漂移源:①版本漂移——v3(2015-03)与 v4(2025)切换改变变量语义与电池构成;②人群漂移——ADRC 招募政策与人群认知随时间变化(如近年主动扩招少数族裔队列);③治疗环境漂移——抗淀粉样蛋白药物上市后,就诊人群构成与期望改变(v4 A4a 表开始系统记录);④采集方式漂移——纸质到 REDCap 电子采集、远程访视(视频/电话)引入。建议所有纵向模型在报告时附"训练窗-测试窗"划分的敏感性分析。

实操监控建议:对每个部署中的模型维护"漂移仪表盘",至少跟踪三条曲线随冻结版本的走势——样本量与访视次数分布、NACCUDSD 构成比、MoCA/CDR 分位数曲线;任一曲线出现台阶式变化时,优先排查版本切换与招募政策变化,而非直接归因于人群认知变化。

§7.7 DAIMS 数据集评估

# 检查项 状态 说明
1 宽格式 ✅ 访视级宽表 + DRUG1-40 用药宽格式,官方文档明确定义
2 唯一标识 ✅ NACCID 系统级唯一,官方文档确认
3 特殊字符 ✅ CSV 为规范编码;药名等自由文本有已知拼写变体需清洗
4 重复行 ✅ 访视级数据以 NACCID+访视键定位;官方 QC 规则库约束提交质量
5 缺失编码 ✅ 8/88/888、9/99/999、-4 语义在 RDD 明确定义
6 标签标识 ✅ NACCUDSD 四级诊断 + 病因学诊断字段,标准依据明确
7 罕见类分组 ⚠️ 专病(FTD/PDD/DS)与少数族裔子样本较小,需合并或分层设计
8 偏倚评估 ✅ 官方文档系统披露选择/招募偏倚(§7.1)
9 数据字典 ✅ RDD-UDS + Coding Guidebook + DED 三级文档体系
10 信息性缺失解释 ✅ -4 语义(版本未收集/skip)官方文档明示
11 设备记录 ⚠️ 影像厂商/参数经 SCAN 与元数据记录,但临床访视无设备字段需求
12 共线性 ⚠️ 量表总分与分项高度共线(MoCA 与其子项),建模需特征选择
13 编码映射 ✅ v3→v4 crosswalk(人读版+JSON)、UDS2↔UDS3 换算表齐备
14 时间戳处理 ✅ 访视日期用于协议合规(±6 个月)计算;里程碑时间可追溯
15 划分建议 ⚠️ 无官方划分;社区惯例为受试者分组切分(§5.2)
16 泄漏讨论 ✅ 本条目 §5.3 系统讨论;回溯字段官方 Guide 提示
17 标签分布 ⚠️ 随冻结变化,官方未发布固定频次表,需自行统计
18 测量偏倚 ✅ 自报 vs 医生判定、跨中心施测差异均有官方说明
19 外部验证建议 ✅ 与 ADNI/AIBL/OASIS/PPMI 等链接路径清晰(§5.5、§7.8)
20 版本记录 ✅ FORMVER 逐访视记录版本;季度冻结 + crosswalk 版本控制
21 预处理脚本 ⚠️ 官方提供 Form Validator(提交侧 QC)与 crosswalk,但无研究者侧官方预处理库
22 合规要求 ✅ DUA + 知情同意 + 基因数据分级管控,路径明确
23 多模态对齐 ⚠️ NACCID 链接影像/CSF/基因/病理,但访视时点对齐需研究者自行处理
24 去标识化 ✅ NACCID 替代直接标识;不含姓名/邮箱

DAIMS 评分:19.5 / 24

评分解读:NACC 在"数据治理成熟度"维度接近开源医疗数据的最高水准——四级缺失编码语义、逐访视版本标记、三级文档体系、官方披露偏倚,这四项多数公开数据集做不到。扣分集中在"研究者侧工程支持":无官方划分、无研究者预处理库、标签频次需自行统计、多模态时点对齐靠用户——这些不是数据质量问题,而是把"统计调查级严谨"转化为"ML 管线即插即用"之间仍然存在的工程缝隙。

对你意味着什么:①你的第一周应该全部花在 RDD + Researcher’s Guide 上,然后写自己的 expand_sentinels + 版本调和模块(§6.3 可以直接抄);②任何性能数字必须伴随"受试者分组切分 + FORMVER 分层"的说明,否则一律不可信(坑点 1/2/3);③不要在这套数据上谈"人群患病率"——把这句话写进你的论文 limitation;④若做影像,先跑留出中心实验再谈 SOTA(坑点 7)。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
ADNI、AIBL、FHS、OASIS、PPMI、LBDSU、NIFD(8 队列) 多机构(USC、AIBL 联盟等) MRI CNN 的 NC/MCI/痴呆分期与 AD/nADD 鉴别 与执业神经科/神经放射科医师对比 外部队列验证(论文报告跨队列一致性) 以 NACC 训练的模型可迁移;站点/扫描仪偏倚经 MI 分析排除为主要混杂(Venugopalan 2022, Nat Commun)
OASIS(UDS 规程同源) 华盛顿大学 非影像与融合模型外验 论文报告队列间指标 相对内部保持 UDS 框架同源性支撑临床变量迁移(同上)
NACC 神经病理(NP 表) NACC/ADRC 网络 模型预测 vs 尸检病理分级 一致性分析(n=110) — 疾病特异性影像模式与死后病理改变对应(同上)
NACC UDSv2→v3 换算验证 NACC crosswalk 研究 新旧电池等值 ρ=0.68-0.78 — 等百分位等值换算表有效,逻辑记忆有学习效应需注意(Monsell 2016)

§8 基准性能与生态

§8.1 排行榜与代表性结果

NACC 没有官方排行榜:所有已发表结果使用自定义划分、不同版本数据与不同冻结快照,数值不可直接比较。下表按任务归类代表性同行评审结果("性能"列保留各论文自己的口径):

排名 模型 性能 年份 关键技术 完整引用 代码
1 多模态深度学习(MRI CNN + CatBoost 融合) NC/MCI/痴呆分期与 AD/nADD 鉴别,达到与执业神经科医师、神经放射科医师相当的水平;预测与尸检病理分级对应 2022 双任务(COG/ADD)、8 队列训练-外验范式、站点/扫描仪互信息偏倚检验 Venugopalan J, et al. Multimodal deep learning for Alzheimer’s disease dementia assessment. Nature Communications, 2022, 13: 3404. DOI 10.1038/s41467-022-31037-5 论文未附公开仓库
2 ML 转化预测 + 概率计算器(UDSv3 临床变量) NC→MCI 与 MCI→AD 的 N 年转化概率估计;发布用户友好转化概率计算器用于试验预筛 2023 仅临床变量的变量选择 + 多模型比较;提供 2/3/4 年窗口 Pang Y, Kukull W, Sano M, et al. Predicting Progression from Normal to MCI and from MCI to AD Using Clinical Variables in the National Alzheimer’s Coordinating Center Uniform Data Set Version 3. Journal of Prevention of Alzheimer’s Disease, 2023, 10(2): 301-313. DOI 10.14283/jpad.2023.10 计算器随论文发布
3 Big-data ML(UDSv2) 15 个非侵入临床变量预测 4 年内 MCI 转化,ROC AUC >75%;31,872 例、748 变量+128 衍生变量 2018 bootstrap 变量选择 + 电子表格概率计算器 Lin M, Gong P, Yang T, Ye J, Albin RL, Dodge HH. Big Data Analytical Approaches to the NACC Dataset: Aiding Preclinical Trial Enrichment. Alzheimer Disease & Associated Disorders, 2018, 32(1): 18-27. DOI 10.1097/WAD.0000000000000228 论文附录

排名仅反映方法学与验证强度的综合成熟度,不代表同一协议下的性能排序:三者数据版本(v2/v3/多队列)、标签定义与划分全部不同。

§8.2 SOTA 总结与选型建议

  • 表格临床建模已接近"变量选择收益"的上限:Lin 2018 与 Pang 2023 一致表明,十余个非侵入临床变量即可获得可用的转化概率估计;继续堆变量的边际收益主要在纵向动态特征而非基线静态特征。
  • 影像/多模态是当前前沿:Venugopalan 2022 确立了"NACC 训练 + 多队列外验 + 病理对照"的完整验证链;复现该范式时,站点调和(坑点 7)比换骨干网络更重要。
  • 选型建议:目标"试验富集工具"→ 轻量树模型 + 校准 + 概率计算器(可解释可部署);目标"诊断辅助"→ 多模态融合 + 病理一致性验证;目标"方法学论文"→ 版本调和与跨站点泛化本身就是贡献点。
  • 一个反直觉提醒:在 NACC 上,“更大更深的模型"往往不如"更好的切分与调和”——受试者分组、版本分层与中心留出这三件事的收益,历史上高于模型结构的微调(§8.1 三篇代表作的共同点正是协议严谨而非模型激进)。

§8.3 评测协议

社区没有统一评测协议,但可总结出可复用的"NACC 基准三件套":①受试者分组切分(NACCID 为组键);②FORMVER 分层或版本调和(crosswalk 换算);③至少一种"非随机"验证(留出中心、时间前瞻或外部队列)。报告指标建议:分类任务 AUC + PR-AUC + 校准(转化预测是少数类场景);纵向建模报告斜率估计的置信区间;病理对照任务报告敏感度/特异度与 discordance 置信区间。

建议在论文表格中固定披露四个"协议元数据":所用数据冻结版本、FORMVER 过滤范围、样本构造窗口(基线→标签的时间跨度)、切分方式(组键与折数)。这四项缺失是 NACC 结果无法横向比较的直接原因——也是让自家结果可被引用的最低配置。

数据集 关系 可链接点 差异化
ADNI 北美试验型 AD 队列 诊断标签、部分 UDS 规程同源变量 影像/生物标志物深度更高;NACC 规模大 10 倍量级、含尸检病理
AIBL 澳洲纵向队列 认知量表体系相近(ADNI 1 协议) 血液生物标志物密度高;双中心
OASIS 华盛顿大学发布的 UDS 规程队列 UDS 变量直接同源 免费影像+临床子集,规模小
PPMI 帕金森病进展标志物计划 LBD 模块人群对接 运动障碍病种侧重
ADGC / NCRAD 基因/样本库 经 NACCID 家族史与基因数据链接 基因组深度;NACC 提供临床表型底座
CLARiTI ADRC 影像联盟 2026-06 冻结起经 NACC 发布 amyloid/tau PET 2,000 名受试者的深度 ADRD 影像

§8.5 关键论文 Top 8

  1. Beekly DL, Ramos EM, Lee WW, et al. The National Alzheimer’s Coordinating Center (NACC) database: the Uniform Data Set. Alzheimer Disease & Associated Disorders, 2007, 21(3): 249-258. DOI 10.1097/WAD.0b013e318142774e — 数据集奠基论文(Google Scholar 被引 949+,截至 2026-09)。
  2. Morris JC, Weintraub S, Chui HC, et al. The Uniform Data Set (UDS): clinical and cognitive variables and descriptive data from Alzheimer Disease Centers. Alzheimer Disease & Associated Disorders, 2006, 20(4): 210-216. DOI 10.1097/01.wad.0000213865.09806.92 — UDS 设计与首批描述性数据。
  3. Besser L, Kukull W, Knopman DS, et al. Version 3 of the National Alzheimer’s Coordinating Center’s Uniform Data Set. Alzheimer Disease & Associated Disorders, 2018, 32(4): 351-358. DOI 10.1097/WAD.0000000000000279 — UDSv3 全景(含附加数据模态统计与局限性)。
  4. Weintraub S, Salmon D, Mercaldo N, et al. The Alzheimer’s Disease Centers’ Uniform Data Set (UDS): the neuropsychologic test battery. Alzheimer Disease & Associated Disorders, 2009, 23(2): 91-101. DOI 10.1097/WAD.0b013e318191c7dd — v1-v2 神经心理电池。
  5. Weintraub S, Besser L, Dodge HH, et al. Version 3 of the Alzheimer Disease Centers’ neuropsychological test battery in the Uniform Data Set (UDS). Alzheimer Disease & Associated Disorders, 2018, 32(1): 10-17. DOI 10.1097/WAD.0000000000000223 — v3 非专有电池设计。
  6. Monsell SE, Dodge HH, Zhou XH, et al. Results from the NACC Uniform Data Set neuropsychological battery Crosswalk Study. Alzheimer Disease & Associated Disorders, 2016, 30(2): 134-139. DOI 10.1097/WAD.0000000000000111 — 新旧测验等值换算表(ρ=0.68-0.78)。
  7. Besser LM, Kukull WA, Teylan MA, et al. The revised National Alzheimer’s Coordinating Center’s Neuropathology Form—available data and new analyses. Journal of Neuropathology & Experimental Neurology, 2018, 77(8): 717-726. DOI 10.1093/jnen/nly049 — 神经病理表修订与可用数据。
  8. Venugopalan J, Tong L, Sivakumar P, et al. Multimodal deep learning for Alzheimer’s disease dementia assessment. Nature Communications, 2022, 13: 3404. DOI 10.1038/s41467-022-31037-5 — 以 NACC 为核心的多模态深度学习与病理验证范式。

§8.6 社区活跃度

NACC 是"机构化运营"型数据资源而非"社区仓库"型资源:活跃度体现在官方渠道而非 GitHub star。①季度数据冻结持续滚动(最近 2026-06,下次 2026-09);②年度 ADRC 会议与常态化 webinar(如 UDSv4 临床培训、DSM-5-TR 专题);③Discourse 社区论坛与 NACC Navigator/支持体系;④官方 GitHub 库持续维护错误检查脚本与 crosswalk 工具;⑤1,600+ 篇已发表研究构成持续增长的引用生态(官方,截至 2026-06)。

从引用轨迹看增长斜率:2018-03 官方统计的 UDS 论文为 481 篇(Besser 2018),Beekly 2007 数据集论文的 Google Scholar 年度被引在 2020 年后仍保持每年 60-130 次(截至 2026-09 的引用页记录)——对一篇 2007 年的数据集描述论文而言,这说明社区使用仍在扩张而非衰减。研究者侧的二次生态(crosswalk 工具包、公开教学代码)以官方 GitHub 与社区论坛为主节点,第三方 Star 数不是活跃度的合理度量。

§8.7 生态快照

资源 类型 链接 Star 截至 2026-09 推荐理由
NACC 官网与 Data Front Door 官方入口 naccdata.org —(机构站点) 数据请求与文档的唯一官方门户
NACC GitHub Library 官方代码库 GitHub @naccdata 以官方维护记录为准 Form Validator、error check、crosswalk JSON
UDSv4 表单与文档 官方文档 表单页 — 表单 PDF、REDCap XML、编码指南
Researcher’s Guide 官方指南 指南页 — 坑点的一手来源,动笔前必读
GAAIN / Atlas 纵向队列目录 第三方目录 Atlas 条目 — 队列元数据速查

§9 相关资源与引用

§9.1 官方资源

  • 官方主页:https://www.naccdata.org/ — 数据冻结公告、统计数字、入口导航。
  • 数据说明(About NACC Data):UDS 纵向临床表型数据 — 研究人群与采集方法官方描述。
  • 研究者指南:The NACC Researcher’s Guide — 缺失编码、版本变化、变量选择、写作规范的权威答案。
  • UDS 表单与文档:v4 表单页 — IVP/FVP 表单 PDF、编码指南、REDCap 文件、C2/C2T 访问说明。
  • UDSv4 资源中心:UDSv4 Resources and Tools — crosswalk、培训视频、Form Validator、沙盒说明。
  • NIA 官方数据访问说明:How Researchers Can Tap Into Data — NACC/NCRAD/CLARiTI 全景与获取流程(15 分钟申请、2 个工作日交付)。
  • 社区支持:NACC Navigator、社区论坛(Discourse)、nacchelp@uw.edu 支持渠道(官网"Need Assistance"入口)。
  • SCAN 公共 Dashboard:经官网 NACC News 入口访问,实时查看各中心标准化 MRI/PET 数据量与 QC 状态(NACC News)。
  • NIA ADRC 网络页:Find an ADRC — 中心列表与 NACC/NCRAD/CLARiTI 分工说明。

§9.2 BibTeX 完整引用

@article{beekly2007nacc,
  title   = {The National Alzheimer's Coordinating Center (NACC) database: the Uniform Data Set},
  author  = {Beekly, Duane L and Ramos, Erin M and Lee, William W and Deitrich, Woodrow D and Jacka, Mary E and Wu, Joylee and Hubbard, Janene L and Koepsell, Thomas D and Morris, John C and Kukull, Walter A},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {21},
  number  = {3},
  pages   = {249--258},
  year    = {2007},
  doi     = {10.1097/WAD.0b013e318142774e}
}

@article{morris2006uds,
  title   = {The Uniform Data Set (UDS): clinical and cognitive variables and descriptive data from Alzheimer Disease Centers},
  author  = {Morris, John C and Weintraub, Sandra and Chui, Helena C and Cummings, Jeff and Decarli, Charles and Ferris, Steven and Foster, Norman L and Galasko, Douglas and Graff-Radford, Neill and Peskind, Elaine R and Beekly, Duane and Ramos, Erin M and Kukull, Walter A},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {20},
  number  = {4},
  pages   = {210--216},
  year    = {2006},
  doi     = {10.1097/01.wad.0000213865.09806.92}
}

@article{besser2018uds3,
  title   = {Version 3 of the National Alzheimer's Coordinating Center's Uniform Data Set},
  author  = {Besser, Lilah and Kukull, Walter and Knopman, David S and Chui, Helena and Galasko, Douglas and Weintraub, Sandra and Jicha, Gregory and Carlsson, Cynthia and Burns, Jeffrey and Quinn, Joseph and others},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {32},
  number  = {4},
  pages   = {351--358},
  year    = {2018},
  doi     = {10.1097/WAD.0000000000000279}
}

@article{weintraub2009npb,
  title   = {The Alzheimer's Disease Centers' Uniform Data Set (UDS): the neuropsychologic test battery},
  author  = {Weintraub, Sandra and Salmon, David and Mercaldo, Nathan and others},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {23},
  number  = {2},
  pages   = {91--101},
  year    = {2009},
  doi     = {10.1097/WAD.0b013e318191c7dd}
}

@article{weintraub2018npb3,
  title   = {Version 3 of the Alzheimer Disease Centers' neuropsychological test battery in the Uniform Data Set (UDS)},
  author  = {Weintraub, Sandra and Besser, Lilah and Dodge, Hiroko H and others},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {32},
  number  = {1},
  pages   = {10--17},
  year    = {2018},
  doi     = {10.1097/WAD.0000000000000223}
}

@article{monsell2016crosswalk,
  title   = {Results from the NACC Uniform Data Set neuropsychological battery Crosswalk Study},
  author  = {Monsell, Sarah E and Dodge, Hiroko H and Zhou, Xiao-Hua and Bu, Yunqi and Besser, Lilah M and Mock, Charles and Hawes, Steven E and Kukull, Walter A and Weintraub, Sandra},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {30},
  number  = {2},
  pages   = {134--139},
  year    = {2016},
  doi     = {10.1097/WAD.0000000000000111}
}

@article{besser2018np,
  title   = {The revised National Alzheimer's Coordinating Center's Neuropathology Form: available data and new analyses},
  author  = {Besser, Lilah M and Kukull, Walter A and Teylan, Merilee A and Bigio, Eileen H and Cairns, Nigel J and Kofler, Julia K and Montine, Thomas J and Schneider, Julie A and Nelson, Peter T},
  journal = {Journal of Neuropathology and Experimental Neurology},
  volume  = {77},
  number  = {8},
  pages   = {717--726},
  year    = {2018},
  doi     = {10.1093/jnen/nly049}
}

@article{lin2018bigdata,
  title   = {Big Data Analytical Approaches to the NACC Dataset: Aiding Preclinical Trial Enrichment},
  author  = {Lin, Ming and Gong, Pinghua and Yang, Tao and Ye, Jieping and Albin, Roger L and Dodge, Hiroko H},
  journal = {Alzheimer Disease and Associated Disorders},
  volume  = {32},
  number  = {1},
  pages   = {18--27},
  year    = {2018},
  doi     = {10.1097/WAD.0000000000000228}
}

@article{pang2023predicting,
  title   = {Predicting Progression from Normal to MCI and from MCI to AD Using Clinical Variables in the National Alzheimer's Coordinating Center Uniform Data Set Version 3: Application of Machine Learning Models and a Probability Calculator},
  author  = {Pang, Y and Kukull, W and Sano, M and Albin, R L and Shen, C and Zhou, J and Dodge, H H},
  journal = {Journal of Prevention of Alzheimer's Disease},
  volume  = {10},
  number  = {2},
  pages   = {301--313},
  year    = {2023},
  doi     = {10.14283/jpad.2023.10}
}

@article{venugopalan2022multimodal,
  title   = {Multimodal deep learning for Alzheimer's disease dementia assessment},
  author  = {Venugopalan, Janani and Tong, Liang and Sivakumar, Pradeep and others},
  journal = {Nature Communications},
  volume  = {13},
  pages   = {3404},
  year    = {2022},
  doi     = {10.1038/s41467-022-31037-5}
}

§9.3 引用指南

使用 NACC 数据发表论文时的最低引用集:数据集论文(Beekly 2007)+ 所用版本论文(UDSv3 用 Besser 2018;电池分析加 Weintraub 2018)+ 官方数据获取日期与冻结版本。NACC 官网提供 Publications 页面登记与规范表述示例;在方法学部分建议显式声明:样本为 ADRC 转诊/志愿者系列、数据冻结版本、FORMVER 范围与缺失编码处理策略——这些正是审稿人最常追问的四点。

发布代码时的合规清单:

  1. 仓库不含任何 NACC 数据本体(含样例行);DUA 禁止再分发。
  2. 切分索引以哈希/随机种子表达,可复现但不可还原受试者列表。
  3. 示例输出使用聚合统计,不出现 NACCID。
  4. 致谢段包含 NACC(U24 AG072122)与 ADRC 网络的标准表述。

§10 AI 使用声明卡

§10.1 本条目使用的 AI 模型列表

用途 模型/工具 版本 使用方式
资料检索与事实核验 联网搜索代理(CodeBuddy 内置) 2026-09 可用版 检索官方文档与同行评审文献
条目撰写 大语言模型写作代理 fast-model 基于 FACTS.md 事实清单起草
代码示例生成 大语言模型写作代理 fast-model 生成后按官方文档人工核对字段名与流程

§10.2 AI 参与范围说明

AI 负责检索汇总、初稿撰写、代码示例与表格组织;所有医学结论、编码映射(ICD-11/SNOMED)、数字与引用均经人工对照来源核验;结构与合规性由千方病案医学编辑部按写作宪法审核。

§10.3 输入来源列表

  1. NACC 官方主页(数据冻结统计)。https://www.naccdata.org/
  2. NACC:Longitudinal Neurocognitive and Clinical Phenotype Data。https://www.naccdata.org/about-nacc-data/longitudinal-neurocognitive-and-clinical-phenotype-data
  3. NACC:The NACC Researcher’s Guide。https://naccdata.org/the-nacc-researchers-guide
  4. NIA:How Researchers Can Tap Into Data and Samples From Alzheimer’s Disease Research Centers。https://www.nia.nih.gov/research/dn/how-researchers-can-tap-data-and-samples-alzheimers-disease-research-centers
  5. NACC:UDSv4 Resources and Tools。https://www.naccdata.org/udsv4-resources-and-tools/
  6. NACC:UDSv4 Forms and Documentation。https://naccdata.org/data-collection/forms-documentation/uds-4
  7. Besser L, et al. Version 3 of the NACC’s Uniform Data Set. Alzheimers Dis Assoc Disord, 2018。https://pmc.ncbi.nlm.nih.gov/articles/PMC6249084/
  8. Monsell SE, et al. NACC UDS Neuropsychological Battery Crosswalk Study. Alzheimers Dis Assoc Disord, 2016。http://cloudfront.escholarship.org/uc/item/0gs0k7v4
  9. EDCS 跨联盟实施论文(UDSv4 变量与 crosswalk 统计)。Alzheimers Dement, 2025。https://alz-journals.onlinelibrary.wiley.com/doi/10.1002/alz.71105
  10. NACC UDSv4 更新邮件(2024-01、2024-08)。https://files.alz.washington.edu/UDS4/uds4-email-updates/
  11. Lin M, et al. Big Data Analytical Approaches to the NACC Dataset. Alzheimers Dis Assoc Disord, 2018。https://pmc.ncbi.nlm.nih.gov/articles/PMC5854492
  12. Pang Y, et al. Predicting Progression…UDS Version 3. J Prev Alz Dis, 2023。https://pmc.ncbi.nlm.nih.gov/articles/PMC10033942/
  13. Venugopalan J, et al. Multimodal deep learning for Alzheimer’s disease dementia assessment. Nat Commun, 2022。https://www.nature.com/articles/s41467-022-31037-5.pdf
  14. Beekly DL, et al. NACC database UDS(Google Scholar 引用页)。2007。https://scholar.google.com.py/citations?citation_for_view=4c09AkMAAAAJ%3AfEOibwPWpKIC
  15. WHO-FIC 基础库:ICD-11 神经认知障碍条目。https://icd.who.int/dev11/f/en/
  16. Nervenarzt 2025:Dementia—changes from ICD-10 to ICD-11(编码对照表)。https://link-proxy.springer.com/article/10.1007/s00115-025-01885-9/tables/1

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射) 千方病案医学编辑部 WHO-FIC 基础库与 Nervenarzt 对照表双源核对 ✅ 已通过
规模数字(56,000+/217,000+/8,700+/15,000+/1,600+) 千方病案医学编辑部 官方主页与 NIA 页面交叉核对(2026-06 口径) ✅ 已验证
版本历史与 UDSv4 变量统计 千方病案医学编辑部 官方更新邮件 + EDCS 论文核对 ✅ 已验证
§4 DAIMS 数据字典字段名 千方病案医学编辑部 Researcher’s Guide 与已上线 AIBL 条目口径核对 ✅ 已通过
§6.1-§6.4 代码示例 千方病案医学编辑部(数据工程) 逻辑走查 + 字段名/缺失编码与官方文档比对 ✅ 已通过
§6.5 坑点 1-8 千方病案医学编辑部 逐条对应 Researcher’s Guide / 论文 limitations 溯源 ✅ 已验证
§8 基准引用 千方病案医学编辑部 DOI 与期刊卷期页码逐条核对 ✅ 已验证
§9 BibTeX 千方病案医学编辑部 与 PubMed/期刊页卷期核对 ✅ 已通过

§10.5 AI 生成章节标注

全部章节由 AI 起草,经 §10.4 所列人工校验后定稿;无"纯 AI 未校验"章节。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核声明一致)

页面状态:published(全部内容已完成审核并发布)


§C 结构化数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ADNI — 共享标签:电子健康记录 / 神经科学 / 队列研究 / 阿尔茨海默病
  • rosmap — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究 / 阿尔茨海默病
  • HRS — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究
  • adhd-200 — 共享标签:电子健康记录 / 神经科学 / 队列研究
  • nifd — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究
  • outcomerea — 共享标签:电子健康记录 / 队列研究 / 临床电子病历
  • OpenSAFELY — 共享标签:电子健康记录 / 队列研究 / 临床电子病历
  • CPRD — 共享标签:电子健康记录 / 队列研究 / 临床电子病历
  • dbgap — 共享标签:电子健康记录 / 队列研究 / 临床电子病历
  • qresearch — 共享标签:电子健康记录 / 队列研究 / 临床电子病历

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集