PPMI — 帕金森病进展标志物计划 AI-Ready Wikipedia | 千方病案医数集

1,500+ 名受试者、12 国近 50 站点的帕金森病多模态纵向队列

来源 The Michael J. Fox Foundation for Parkinson's Research(MJFF) url: https://www.ppmi-info.org发布时间: 2026-09-08最后更新: 2026-09-08 阅读 2

信息速览

数据集名称PPMI — 帕金森病进展标志物计划 AI-Ready Wikipedia | 千方病案医数集
数据类型1,500+ 名受试者,12 国近 50 个站点,DaTscan+MRI+CSF 组学,Tier 1 数据每日刷新,免费申请获取
规模1,500+ 名受试者(PPMI 2.0 目标 4,500 名)
接入方式The Michael J. Fox Foundation for Parkinson's Research(MJFF) url: https://www.ppmi-info.org
AI 就绪度

数据集封面

PPMI(帕金森病进展标志物计划) — 全球最大帕金森病多模态纵向队列 AI-Ready Wikipedia

INFOBOX

数据集名称 PPMI(帕金森病进展标志物计划)
英文全称 Parkinson’s Progression Markers Initiative
别名/简称 PPMI;PPMI 2.0;帕金森进展标志物计划
疾病分类(ICD-11) 8A00.0 帕金森病(不伴痴呆)
SNOMED CT 49049000(Parkinson’s disease)
数据模态 脑 MRI、DaTscan SPECT、CSF/血液生物样本、基因组学、数字传感器、临床纵向随访
AI 任务类型 诊断分类、进展预测、亚型聚类、生物标志物发现、影像组学
样本总数 1,500+ 名受试者(PPMI 2.0 目标 4,500 名,扩展后 4,000+ 志愿者)
数据大小 临床与影像数据数百 GB;原始基因组数据超 250 TB
数据格式 CSV、DICOM、NIfTI、VCF、BAM、FASTQ
许可证 PPMI Data Use Agreement(免费)
访问级别 注册申请审核(DPC/DAC 一周内审批)
DUO 标签 GRU、IRB、PUB
语言 英语
首发日期 2010-06
最后更新 Tier 1 数据每日刷新(截至 2026-09)
发布机构 The Michael J. Fox Foundation for Parkinson’s Research(MJFF)
官方主页 https://www.ppmi-info.org
下载地址 https://www.ppmi-info.org/access-data-specimens/download-data
DOI 10.1016/j.pneurobio.2011.09.005
引用次数 1,607+(Semantic Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— Tier 1 数据开放 + 数据字典与共识分析数据集齐备,但无官方训练/测试划分、无官方预处理脚本,影像需自行完成 DICOM→NIfTI 转换
页面状态 published

§0 医学与数据工程审核声明

  • 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、帕金森病流行病学与临床任务定义)、§7 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PPMI 要求用户完成在线注册、电子签署 PPMI Data Use Agreement 并通过 Data and Publications Committee(DPC)资格审核。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? PPMI 是 Michael J. Fox 帕金森研究基金会(MJFF)于 2010 年发起的观察性国际多中心纵向队列研究。它对刚确诊、尚未用药的帕金森病患者、有前驱期风险因素的人群、携带致病基因变异者以及健康对照,进行长达多年的持续追踪,同时采集临床量表、脑影像(DaTscan SPECT 与 MRI)、脑脊液与血液生物样本、基因组学乃至可穿戴传感器数据。所有数据去标识后开放共享,研究者免费申请即可获取。

为什么重要? 帕金森病长期缺乏经过验证的进展生物标志物,药物研发因此屡屡受挫。PPMI 用"标准化采集 + 即时开放共享"的范式改写了这一局面:其队列数据支撑了 α-突触核蛋白种子扩增检测(αSyn-SAA)等里程碑成果——该检测对帕金森病的诊断敏感性达 87.7%、特异性达 96.3%,被业界视为帕金森病研究的"game changer"。截至 2026-09,PPMI 数据累计下载已超过 5,300 万次。

我能用它做什么? 你可以构建帕金森病早期诊断与进展预测模型、做多模态生物标志物发现(影像 + 组学 + 量表)、对前驱期人群(嗅觉减退、快速眼动睡眠行为障碍)进行风险分层,或为临床试验设计模拟受试者富集策略。本 Wiki 提供从注册下载到 PyTorch 加载的完整路径,以及 8 个真实坑点的规避方案。

§1.1 技术摘要

PPMI 采用多中心观察性队列设计,原始研究(NCT01141023)于 2010 年 6 月启动,在 24 个站点入组 423 名未经治疗的早期帕金森病患者、196 名健康对照和 64 名 SWEDD(扫描无多巴胺能缺陷证据)受试者;PPMI 2.0(NCT04477785)自 2020 年 7 月起将队列扩展至近 50 个站点、12 个国家、目标 4,500 名志愿者,其中约 2,000 名为前驱期参与者。入组时以 DaTscan DAT 成像确认多巴胺能缺陷作为客观入组锚点,之后按标准化协议在基线及定期随访中重复采集 MDS-UPDRS、MoCA、UPSIT 嗅觉、REMBDQ 等临床量表,3T 结构 MRI 与 DTI,DaTscan SPECT,以及血、脑脊液、尿液样本;组学层面覆盖全基因组/全外显子组测序、RNA 测序、蛋白质组与代谢组,并扩展了可穿戴数字传感器。数据经去标识后通过基于 LONI 的 PPMI 数据库按四层体系开放,临床数据每晚刷新、影像数据每月整合,并随附数据字典、Code List 与共识委员会分析数据集(Consensus Committee Analytic Dataset)用于队列归属判定。

§1.2 战略价值

维度一:开放科学范式的标杆。 PPMI 是神经退行性疾病领域最早承诺"数据即采即共享"的大型产业-学术联合体,公开数据与同行评审产出形成正循环:截至 2017 年 12 月数据下载即突破 150 万次,2023 年 αSyn-SAA 里程碑论文登上 Lancet Neurology 后,该队列直接改写了帕金森病的生物学定义框架。对 AI 团队而言,这意味着可以站在 1,607+ 篇引用(设计论文,Semantic Scholar,截至 2026-09)的成熟研究生态之上,复用大量已发表的队列定义、预处理约定与阴性/阳性结果,显著降低研究立项风险。

维度二:纵向多模态整合的独特性。 在帕金森病领域,同时覆盖影像(DaTscan + MRI + DTI + PET 亚研究)、体液生物样本(CSF/血/尿)、多层组学(基因组、转录组、蛋白组、代谢组)、数字传感器与全面临床量表的开放纵向队列几乎没有替代品:ADNI 聚焦阿尔茨海默病,BioFIND 仅为 PPMI 的对照补充,Fox Insight 规模更大但缺乏生物样本与影像。PPMI 的"基线影像锚定 + 多年重复采样"结构,使其天然适合构建进展预测、里程碑事件(如异动症出现、认知转化)预测与治疗反应模拟等纵向 AI 任务。

维度三:生物学定义队列的标签可信度。 与多数依赖临床诊断标签的数据库不同,PPMI 的核心标签体系建立在三重客观锚点之上:入组时的 DaTscan DAT 成像确认多巴胺能缺陷、统一的基因变异注释(GBA/LRRK2/SNCA/PRKN/PINK1)、以及 2023 年起可用作分子分层的 αSyn-SAA 状态(Tier 3 申请)。这一"生物学定义队列"使 AI 模型的学习目标从"模仿临床医生的判断"升级为"逼近疾病的生物学事实",直接回应了帕金森病 AI 研究中最受诟病的标签噪声问题;同时约 16% 的临床疑似病例被影像重分类为 SWEDD 的经验,也为标签质量管理提供了定量依据(见坑点 1、坑点 2)。

§1.3 同类数据集横向对比

数据集 疾病/人群 规模 核心模态 标注/队列定义 与 PPMI 的差异
PPMI 帕金森病 + 前驱期 + 基因携带者 + 对照 1,500+(目标 4,500) DaTscan、MRI、CSF/血样本、组学、传感器、量表 影像锚定 + 共识委员会分析数据集 多模态最全、开放层级最清晰
ADNI 阿尔茨海默病谱系 2,000+ MRI、PET、CSF、基因组 诊断共识 + 影像标志物 疾病不同;同样开放,纵向影像更重
BioFIND 帕金森病患者 + 对照 约 400 CSF/血样本、量表 与 PPMI 同源协议 规模小,主要作独立复制队列
Fox Insight 帕金森病患者 + 对照 数万(在线注册) 在线量表、基因 自报 + 基因分型 无影像/生物样本,临床深度较浅
PD GEnE 帕金森病基因联盟 数千(汇总多队) 基因组学 遗传队列 聚焦遗传发现,非纵向多模态

§1.4 版本与阶段时间轴

阶段 时间 关键变化 规模
PPMI 原始研究 2010-06 启动(NCT01141023) 21→24 个站点;早期 PD + HC + SWEDD 三队列;临床、影像、生物样本标准化协议上线 423 PD / 196 HC / 64 SWEDD
基因注册与扩展队列 2011 年起 LRRK2、GBA 等变异携带者与非显现携带者(NMC)入组;NeuroX 等基因分型数据并入 约 300 名基因变异携带者
数据开放里程碑 2017-12 数据下载突破 150 万次;四层数据体系与出版政策成熟 累计 1,500+ 受试者
PPMI 2.0 2020-07 启动(NCT04477785) Clinical/Remote/Digital/Online 四协议并行;前驱期队列大规模扩招;数字传感器与 FOUNDIN-PD 组学接入 目标 4,500,随访 5–8 年,预计 2033 年完成
持续刷新 截至 2026-09 Tier 1 临床数据每日刷新、影像每月整合;累计下载超 5,300 万次 近 50 站点、12 国

时间轴解读:PPMI 的演进史本质上是帕金森病生物标志物研究的三次跃迁——从"临床定义队列"(2010)到"影像定义队列"(DaTscan 锚定入组),再到"分子定义队列"(αSyn-SAA 与多组学接入)。对 AI 使用者,选择分析窗口时应当意识到:越早期的数据波次,其队列定义越偏临床;越新的波次,生物学分层变量越丰富。这决定了跨年代合并分析时需要把"入组协议版本"作为元变量显式处理。

§1.5 典型应用场景

  1. 早期诊断分类:基于 DaTscan 纹状体结合率、CSF α-突触核蛋白与 MDS-UPDRS 构建帕金森病 vs 健康对照分类器,并分析 LRRK2 等遗传亚组的阴性案例。
  2. 进展预测:利用纵向 MDS-UPDRS、MoCA 与影像随访问,预测异动症发生、姿势不稳/步态障碍亚型转化与认知下降等里程碑。
  3. 前驱期风险分层:对嗅觉减退与 iRBD 前驱队列建模,结合 αSyn-SAA 状态(经申请)评估转化为显性帕金森病的风险。
  4. 多模态亚型聚类:整合影像组学、蛋白组与临床轨迹做无监督分型,复现并扩展 PPMI 生物学异质性发现。
  5. 数字生物标志物验证:用可穿戴传感器步态/震颤数据与经典量表对齐,验证远程监测终点的心理测量学性能。

场景与数据域映射速查:

场景 最小数据域 进阶数据域 预期体量
诊断分类 MDS-UPDRS、人口学、SBR 表 DaTscan DICOM、CSF 表格数百 MB 起
进展预测 纵向量表 + LEDD + 影像纵向 + NfL 表格 + 影像子集
前驱期分层 UPSIT、REMBDQ、人口学 + Tier 3 SAA/DaTscan 小体量 + 申请
亚型聚类 量表 + SBR + 基因状态 + 蛋白/代谢组 中等,组学需申请
数字终点 传感器波次 + 量表锚点 + 完整 PPMI 2.0 协议 波次相关

§2 医学背景

§2.1 ICD-11 编码表

标签 ICD-11 编码 中文名称 说明
PD 8A00.0 帕金森病(不伴痴呆) PPMI 新诊断队列主诊断,入组时未用药、Hoehn-Yahr 早期
SWEDD 扫描无多巴胺能缺陷证据 研究定义状态而非独立 ICD-11 疾病实体;影像学排除后归入
Prodromal PD 前驱期帕金森综合征 ICD-11 无对应编码,按 PPMI 研究协议(嗅觉减退或 RBD)定义
iRBD 7A21 快速眼动睡眠行为障碍 PPMI 前驱期入组风险因素之一

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 术语
帕金森病 8A00.0 49049000 Parkinson’s disease
帕金森病(临床发现语境) 8A00.0 56225001 Parkinsonian syndrome(帕金森综合征)
快速眼动睡眠行为障碍 7A21 REM sleep behaviour disorder(以 ICD-11 为准)
嗅觉减退 Hyposmia(PPMI 以 UPSIT 量化,不依赖诊断编码)

§2.2 疾病简介与流行病学

帕金森病是仅次于阿尔茨海默病的第二常见神经退行性疾病,病理特征为黑质多巴胺能神经元进行性丢失与 α-突触核蛋白异常聚集形成的路易体,临床上表现为运动迟缓、静止性震颤、肌强直等运动症状及嗅觉减退、快速眼动睡眠行为障碍、便秘等前驱期非运动症状。疾病在 80 岁以上人群患病率可达约 4%,随老龄化进程疾病负担持续攀升。临床诊断长期依赖运动症状与多巴胺能药物反应,缺乏客观进展标志物,这也是 PPMI 立项的直接动因——以影像(DaTscan DAT 成像)与体液(CSF α-突触核蛋白、tau 蛋白等)生物标志物锚定生物学定义的早期队列,为疾病修饰疗法临床试验提供可量化终点。PPMI 2018 年队列表明:以 DAT 成像为锚点时约 16% 的临床疑似帕金森病被重新归类为 SWEDD,凸显了生物标志物锚定入组对队列纯度的价值;2023 年 αSyn-SAA 结果进一步显示,散发性帕金森病伴嗅觉减退亚组的检测敏感性高达 98.6%,而 LRRK2 帕金森病仅 67.5%,揭示了临床表型一致者背后的分子异质性。

§2.3 临床任务定义

任务 输入 目标输出 PPMI 支撑数据
筛查 嗅觉测试(UPSIT)、RBD 问卷(REMBDQ)、家族史 前驱期高风险判定 前驱期队列纵向随访
诊断 DaTscan SBR、CSF α-突触核蛋白、MDS-UPDRS PD vs HC vs SWEDD 分类 全队列基线影像 + 体液
分级/严重度 MDS-UPDRS I–IV、Hoehn-Yahr、LEDD 严重度回归/轨迹建模 每 3–6 个月重复量表
预后 基线影像 + 组学 + 早期轨迹 异动症、认知转化、步态失稳预测 纵向里程碑事件记录
分型 多模态整合(影像 + 蛋白组 + 基因) 生物学亚型聚类 FOUNDIN-PD 多组学

§2.4 患者人群构成

子队列 来源/定义 时间范围 年龄 规模 备注
新诊断未用药 PD 确诊 7 年内、≥30 岁、DAT 成像证实缺陷 2010 年起 中老年为主 423(原始队列核心) 约 9% 基线仅单一帕金森体征
健康对照(HC) 与 PD 队列同源招募、年龄匹配 2010 年起 中老年为主 196(原始队列核心) CSF α-突触核蛋白 2,204 pg/mL
SWEDD 临床疑似 PD 但 DAT 扫描无缺陷 2010 年起 中老年为主 64 后续研究证实并非早期 PD
基因变异携带者 GBA、LRRK2、SNCA、PRKN、PINK1 变异 2011 年起 成人 约 300(含非显现携带者 310 名 SAA 分析纳入) LRRK2 G1920S 为重点亚组
前驱期队列 嗅觉减退(hyposmia)或 iRBD,≥60 岁高危 PPMI 2.0 起大规模扩招 ≥60 目标 2,000 αSyn-SAA 阳性率 85%–89%

人群结构对 AI 研究的直接含义:其一,"新诊断未用药"起点使疾病修饰类预测问题(从近自然病程起点建模)成为可能,这在以诊疗clinic记录为主的数据库中难以获得;其二,SWEDD 与非显现携带者两类"临床-生物学错位"人群是天然的对照组设计,可用于检验模型是否学到真正的疾病生物学;其三,前驱期扩招至约 2,000 人意味着"症状前预测"任务的数据密度将在未来数年快速上升,早期入局者可积累方法学先发优势。

§2.5 临床价值

对研究者而言,PPMI 队列的临床价值首先体现在"以生物学重新定义疾病分期":DaTscan 锚定的入组设计将临床疑似的早期患者客观分层,避免了临床误诊对训练标签的污染;αSyn-SAA 则提供了可直接对应路易病理的分子分期工具,前驱期人群中 85%–89% 的阳性率使"症状前生物学诊断"成为可能。对药企与试验设计者,PPMI 的纵向轨迹直接支撑了试验富集策略——用生物标志物筛选最可能进展的受试者,缩短疾病修饰试验的观察周期。对 AI 团队,队列的"每 3–6 个月重复采集 + 多模态同步"结构,提供了稀缺的"治疗开始前基线 + 自然病程"序列数据,是训练纵向预测模型、校准进展速率估计的黄金数据源。

§2.6 金标准与标注规范

划分维度 标注内容 标注方式 标注者 性质
队列归属 PD / HC / SWEDD / Prodromal / NMC 共识委员会分析数据集(Consensus Committee Analytic Dataset)统一判定 PPMI 共识委员会(运动障碍专家 + 统计核心) 研究级金标准
影像诊断 DAT 多巴胺能缺陷 中心化阅片 + 纹状体 SBR 定量 中央影像核心实验室(John Seibyl 等) 影像金标准
临床评估 MDS-UPDRS、MoCA、UPSIT 等 标准化认证评定员现场评估 各站点认证评定员 多中心标准化
分子状态 αSyn-SAA 阳性/阴性 Amprion 平台盲法检测 独立检测实验室 分子金标准(部分 Tier 3)
基因状态 致病变异携带/非携带 标准化测序与变异注释 遗传核心(NIA/NIH 协作) 遗传金标准

§3 数据集规格

§3.0 版本抉择矩阵

PPMI 无传统"版本号",而是按数据层级(Tier)与数据域(Domain)组织。根据你的研究目标选择下载范围:

你的需求 推荐获取范围 大小 理由
快速复现表格数据类 ML(量表/人口学) Tier 1 临床 CSV(Study Data) 数百 MB 每日刷新、无 embargo、含数据字典
影像组学/深度学习 IDA 影像档案(DaTscan DICOM、MRI) 数十 GB/受试者子集 影像每月整合,需自行 DICOM→NIfTI
基因关联分析 Tier 2 基因分型(NeuroX/NeuroBooster)+ WES/WGS gVCF gVCF 数百 GB;FASTQ 超 250 TB FASTQ/BAM 需单独申请 Aspera 传输
多组学整合(蛋白/转录/代谢) FOUNDIN-PD 与 RNA-seq 数据 RNA-seq 约 154 TB 面向 iPSC 与批间标准化研究
前驱期生物学状态分析 Tier 3 申请(前驱期 DaTscan、αSyn-SAA) 小体量 CSV 需 Data Access Committee 批准

§3.1 模态详情

  • 临床随访:MDS-UPDRS I–IV(含 ON/OFF 状态)、Modified Hoehn & Yahr、MoCA、Montreal Cognitive Assessment、UPSIT 嗅觉识别测试、REMBDQ 快速眼动睡眠行为障碍问卷、Epworth 嗜睡量表、SCOPA-AUT 自主神经、汉密尔顿抑郁/焦虑量表、LEDD 左旋多巴等效剂量、Semantic Verbal Fluency 等神经心理测验,按 BL(基线)至 V26 事件编码组织,原始队列随访超过 5 年,PPMI 2.0 计划随访 5–8 年。
  • DaTscan SPECT:123I-ioflupane 多巴胺转运体成像,标准化采集协议与中心阅片,提供纹状体(尾状核、壳核前/后部)特异性结合率(SBR)定量,是队列入组的影像锚点。
  • 结构 MRI 与 DTI:3T 标准化协议的 T1/T2 加权与弥散张量成像,多中心采集;社区已建立 BIDS 转换与 fMRIPrep 预处理流程(如 Stanford Mind Data Hub 对 356 名受试者 835 次 T1/T2 扫描的标准化)。
  • PET 亚研究:部分子研究采集分子影像 PET,不构成全队列覆盖。
  • 生物样本:纵向采集血液、脑脊液(CSF 采集率 >97%)与尿液,覆盖 α-突触核蛋白(基线 PD 1,845 / HC 2,204 / SWEDD 2,141 pg/mL)、总 tau(45/53)、磷酸化 tau(16/18)、NfL 及 αSyn-SAA 种子扩增检测。
  • 组学:NeuroX、Immunochip、Illumina NeuroBooster 基因分型;全外显子组测序(WES)、全基因组测序(WGS)gVCF;RNA 测序;蛋白质组与代谢组;FOUNDIN-PD 项目的 95 例 iPSC 多组学数据。
  • 数字传感器:可穿戴设备采集步态、震颤与日常活动数据,随 PPMI 2.0 Digital Applications 协议扩展。

§3.2 按子集样本数

子集 定义 样本数(基线) 关键特征
早期 PD 未用药、DAT 缺陷、确诊 7 年内 423 MDS-UPDRS 总分 32.4;纹状体 SBR 降 45%
健康对照 年龄匹配、无神经系统疾病 196 MDS-UPDRS 总分 4.6
SWEDD 疑似 PD 但 DAT 无缺陷 64 MDS-UPDRS 总分 28.2;非 PD
基因变异携带者 GBA/LRRK2/SNCA/PRKN/PINK1 约 300 含非显现携带者
非显现携带者(NMC) 致病变异但无运动症状 310(SAA 分析) LRRK2 PD 亚组 SAA 阳性率仅 67.5%
前驱期(RBD/hyposmia) 单一前驱标志 51(SAA 分析)+ 扩招至 2,000 SAA 阳性 44/51
影像预处理子集 社区标准化(Mind Data Hub 示例) 356 名受试者 / 835 次扫描 PD 542、HC 135、Prodromal 82、SWEDD 76 条记录

§3.3 数据格式

数据域 格式 组织方式 说明
临床量表/人口学 CSV 每张表一个评估工具,按 PATNO + EVENT_ID 关联 每晚刷新、周日全量更新
影像(DaTscan/MRI) DICOM LONI IDA 层级目录,每月整合 需转 NIfTI 做后续处理
基因分型 PLINK/CSV NeuroX、Immunochip、NeuroBooster Tier 2 公开
测序 gVCF、BAM、FASTQ 按受试者组织 gVCF 直接下载;BAM/FASTQ 走 Aspera 申请
组学矩阵 CSV/Matrix FOUNDIN-PD、RNA-seq 部分需申请表单
文档 PDF/CSV 数据字典、Code List、Data User Guide 登录 LONI 后 Study Data/Study Docs 获取

§3.4 存储大小

  • Tier 1 临床 CSV 全套:数百 MB 量级,普通工作站可处理。
  • 影像:按受试者子集数十 GB 起步,DaTscan 全队列约数百 GB;MRI 因多中心多时点规模更大。
  • 原始测序:WES BAM 约 15 TB、WES FASTQ 约 130 GB、WGS FASTQ 约 70 TB、FOUNDIN-PD 约 25 TB、RNA 测序约 154 TB(官方 Access Data 页面数字,截至 2026-09)。
  • 累计下载量 53,691,765 次(临床 1,800,550 + 影像 51,891,215;截至 2026-09 检索时),影像体量占绝对主导。

§3.5 标注方式

PPMI 的"标注"本质是研究协议驱动的多源判定:队列标签(PD/HC/SWEDD/Prodromal/NMC)由共识委员会分析数据集统一裁定,而非研究者从单张 CSV 直接读取;影像定量(SBR)由中央影像核心实验室按标准协议产出;量表评分由各站点认证评定员按操作手册采集;分子检测(αSyn-SAA、CSF 蛋白)由独立实验室盲法完成;基因状态由遗传核心统一变异注释。因此 AI 研究者面对的是"协议化标注"而非事后人工标注,标签质量高但获取路径有讲究。

§3.6 标注者资质与一致性

  • 临床评定员经 MDS-UPDRS 标准化认证,多中心间执行统一操作手册与认证考核。
  • 影像阅片由具备核医学资质的中央实验室统一完成,避免站点间阅片漂移。
  • 分子检测采用统一平台与批次控制(SAA 使用 Amprion 条件,多实验室间一致性经同一样本平行复测验证)。
  • 共识委员会由运动障碍病学、统计学与数据管理专家组成,队列裁定结果以分析数据集形式发布并随数据更新迭代。

§3.7 采集周期

  • 原始队列:基线(BL)后按月(V01–V04,0–12 个月)至双年访(V05 起)重复采集,随访超过 5 年,部分受试者追踪超过 10 年;量表、影像与生物样本的重复频率不同步(影像与 CSF 访视间隔更长)。
  • PPMI 2.0:计划随访 5–8 年(NCT04477785,预计 2033-12 完成),前驱期与远程协议并行,数字传感器高频采集。
  • 数据发布:临床数据每晚传输、每周日全量更新;影像每月整合。

访视命名与典型时间轴(以官方仪表板/数据字典命名体系为准,R 开头为 PPMI 2.0 远程访视):

访视代码 距基线时间 典型内容 覆盖特点
BL 0 全套量表 + DaTscan + MRI + 血/CSF/尿 入组强制,覆盖率最高
V01–V04 1–12 个月 全套量表(Part III 可含 ON/OFF)+ 部分样本 逐月波次,流失初现
V05–V12 18–60 个月 量表 + 周期性影像/CSF 双年访节奏,影像访视稀疏化
V13–V26 72–180 个月 量表为主 + 存活受试者样本 覆盖显著下降,需生存偏差处理
R 系列 PPMI 2.0 起 远程量表 + 数字传感器 与现场访视并行记录

§3.8 地域覆盖

站点遍布 12 国近 50 个中心,以北美与欧洲学术运动障碍中心为主,非欧洲/非北美血统人群代表性不足是官方文档确认的局限。

国家/地区 角色 代表站点 备注
美国 主导站点群 宾夕法尼亚大学、西北大学、斯坦福大学医学中心、爱荷华大学(统计核心)、罗切斯特大学(CTCC) 原始研究 24 站点主体
加拿大 扩展站点 蒙特利尔神经科学研究所(The Neuro)等 3 个站点 扩展获 Weston Family Foundation 支持
德国 欧洲核心 Paracelsus-Elena Klinik(Kassel) 脑脊液生物标志物研究重镇
奥地利/法国/意大利/荷兰/挪威/西班牙/希腊/以色列/英国 欧洲与中东站点 各国学术运动障碍中心 SAA 分析覆盖 33 个中心中的多国参与
全球协调 MJFF 总部 纽约 研究发起与资助协调

§3.9 设备规格

  • SPECT:标准化 DaTscan(123I-ioflupane)协议,各站点 SPECT 相机按中央核心实验室质控要求校准,采集参数与重建流程统一。
  • MRI:3T 标准化协议(T1/T2/DTI 序列),多厂商平台,采集协议与影像核心实验室质控统一。
  • 分子检测:CSF/血浆生物标志物采用统一酶联与扩增平台;αSyn-SAA 使用 Amprion 检测条件。
  • 测序:WES/WGS 基于全血提取 DNA;转录组、蛋白组与代谢组按 FOUNDIN-PD 多组学标准流程。
  • 传感器:PPMI 2.0 引入的可穿戴与家用数字设备,按 Digital Applications 协议采集步态、震颤与活动数据。

§3.10 深度溯源链

数据从采集到发布的完整链条:站点采集(认证评定员/技师)→ 中心化质控(影像核心、生物样本库、统计核心)→ 数据管理(LONI 平台入库、去标识化)→ 分层发布(Tier 1–4)→ 研究者申请(DUA 签署 + DPC/DAC 审核)→ 年度使用回报与衍生数据回流(研究者需将新分析产生的新数据交回数据与出版委员会)。所有引用须标注数据获取日期与使用层级(出版政策要求显式声明 Tier 1–4 使用情况),并注明 RRID: SCR_006431。

溯源链各环节与责任主体:

环节 责任主体 关键产出 质控要点
现场采集 各站点认证评定员/影像技师 原始量表、DICOM、样本 人员认证与协议遵从
影像质控 影像核心实验室 合格性判定 + SBR 定量 相机校准与协议一致性
样本与检测 生物样本库/检测实验室 CSF/血/尿分析结果 链式保管与批次控制
统计与共识 统计核心 + 共识委员会 共识分析数据集 队列裁定的可追溯性
数据管理 LONI 平台运营方 去标识化数据层 去标识核验与刷新管线
访问治理 DPC / DAC 申请审批与 Tier 分层 资格筛查与用途审查

§4 数据结构

§4.0 目录树

登录 LONI 平台下载解压后,典型临床数据包组织如下(文件名以实际下载版本为准):

PPMI/
├── Study_Data/                          # Tier 1 临床 CSV(每晚刷新)
│   ├── Demographics_YYYYMMDD.csv        # 人口学:PATNO、年龄、性别、教育
│   ├── Socio-Economics_YYYYMMDD.csv     # 教育年限、利手、种族/族裔
│   ├── SCREEN.csv                       # 全部签署知情同意者名单
│   ├── Participant_Status.csv           # 全部入组者名单与队列状态
│   ├── MDS-UPDRS_Part_I.csv             # 日常非运动症状
│   ├── MDS-UPDRS_Part_II.csv            # 日常生活运动体验
│   ├── MDS-UPDRS_Part_III.csv           # 运动检查(含 NP3TOT 总分)
│   ├── MDS-UPDRS_Part_IV.csv            # 异动症等并发症
│   ├── Cognitive_Categorization.csv     # MoCA 等认知分类
│   ├── UPSIT.csv                        # 嗅觉识别测试
│   ├── REM_Sleep_Behavior_Disorder.csv  # REMBDQ 问卷
│   ├── Epworth_Sleepiness_Scale.csv     # 嗜睡量表
│   ├── Medical_Conditions_Log.csv       # 既往病史
│   ├── Current_Medication_Log.csv       # 用药记录(LEDD 计算依据)
│   └── Consensus Committee Analytic Dataset/  # 队列归属金标准
├── Imaging/                             # LONI IDA 影像(每月整合)
│   ├── DaTscan/                         # SPECT DICOM,按受试者/访视层级
│   │   └── {PATNO}/
│   │       └── {EVENT_ID}/
│   │           └── *.dcm
│   ├── MRI/                             # T1/T2/DTI DICOM
│   │   └── {PATNO}/{EVENT_ID}/...
│   └── DatScan_Analysis/                # 中心实验室 SBR 定量表
├── Biospecimen_Analysis_Results/        # 体液检测结果 CSV
│   ├── CSF_Biochem.csv                  # α-突触核蛋白、tau、Aβ42
│   └── Plasma_Biochem.csv
├── Genetics/                            # 基因分型与测序
│   ├── NeuroX/                          # PLINK 格式
│   ├── WGS_gVCF/                        # 按受试者 gVCF
│   └── FOUNDIN-PD/                      # 多组学(部分需申请)
├── Study_Docs/
│   ├── Data_Dictionary.csv              # 字段含义
│   ├── Code_List.csv                    # 编码表
│   └── Data_User_Guide.pdf              # 官方使用指南
└── Source_Documents/                    # 采集协议与操作手册 PDF

§4.1 DAIMS 字段字典

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
PATNO 文本 受试者唯一标识符 3001 主键;分组划分依据 无(中心分配) 不适用 3001 起
EVENT_ID 文本 访视事件编码 BL、V01、V04 纵向对齐键 访视漂移 不适用 BL–V26 等
INFODT 日期 访视日期 2011-03 时序特征;跨模态对齐 录入延迟/更正 空值 2010 起
RECRUIT 整数 招募途径(队列来源) 1 子队列分层 协议变更 空值 编码表
APPRDX 整数 申请诊断(队列标签) 1 = PD 分类标签(需与共识数据集核对) SWEDD 重分类 空值 编码表
NP3TOT 整数 MDS-UPDRS Part III 总分 32.4(均值) 严重度回归核心特征 评定员间变异 空值 0–132
UPSIT 文件列 整数 嗅觉识别测试总分 22 前驱期风险特征 学习效应小 空值 0–40
SBR(DatScan_Analysis) 浮点 纹状体分区特异性结合率 2.31 诊断与进展影像终点 相机间校准残差 不适用 约 0.3–7
CSF_ALPHA_SYN 浮点 CSF α-突触核蛋白(pg/mL) 1845(PD 基线均值) 分子标志物 批间变异 空值 数百–数千
LEDD 浮点 左旋多巴等效日剂量(mg) 400 药物混杂校正 换算表差异 0 = 未用药 ≥0
sex/性别编码 整数 性别 1 = 男,2 = 女 公平性分析 录入规范 0 = 未知 0–2
EDUCYRS 整数 教育年限 16 协变量 自报偏差 空值 10–24
NP2PTOT 整数 MDS-UPDRS Part II 总分(日常运动体验) 12 自我报告负担特征 主观量表波动 空值 0–52
MCATOT 整数 MoCA 总分 27 认知轨迹/痴呆转化 教育/年龄混杂 空值 0–30
REMBDQ 文件列 整数 REM 睡眠行为障碍问卷得分 5 前驱期风险特征 回顾性自报 空值 0–13
ENROLL_CAT 文本 入组类别(参与者状态表) PD / HC / GEN+ 快速名单过滤 非最终标签 空值 编码表
COHORT(共识数据集) 文本 共识委员会裁定队列 PD 唯一可信标签源 随认知更新 不适用 PD/HC/SWEDD/PRODROMA/NMC 等

§4.2 标签分布

以 Mind Data Hub 预处理影像子集(835 条记录)为例:PD 542 条(64.9%)、健康对照 135 条(16.2%)、前驱期 82 条(9.8%)、SWEDD 76 条(9.1%);性别分布男性 556 条(66.6%)、女性 279 条(33.4%)。原始队列基线层面为 423 PD / 196 HC / 64 SWEDD;SAA 分析纳入的 1,123 人中 PD 545、HC 163、SWEDD 54、前驱期 51、NMC 310。整体呈"病例主导、SWEDD 与前驱期小类"的分布——SWEDD 等小类不应与 PD 混合训练(见坑点 1)。

§4.3 关键统计

  • 基线 MDS-UPDRS 总分:PD 32.4、HC 4.6、SWEDD 28.2(Marek 2018)。
  • 影像:PD 平均纹状体 SBR 较对照降约 45%,对侧壳核降约 68%。
  • CSF 基线(PD/HC/SWEDD):α-突触核蛋白 1,845/2,204/2,141 pg/mL;总 tau 45/53;磷酸化 tau 16/18 pg/mL;CSF 采集率 >97%。
  • 影像子集教育年限:中位约 15–16 年(10–24 范围,Mind Data Hub 子集)。
  • 随访深度:纵向访视矩阵按受试者流失逐波稀疏,V05 之后覆盖率明显下降(官方仪表板按访视展示在访人数)。

分组画像速查表(原始队列基线,来源:Marek 2018):

指标 早期 PD 健康对照 SWEDD
基线人数 423 196 64
MDS-UPDRS 总分 32.4 4.6 28.2
纹状体 SBR 相对变化 −45% 参照 无多巴胺能缺陷
对侧壳核 SBR 相对变化 −68% 参照 无多巴胺能缺陷
CSF α-突触核蛋白(pg/mL) 1,845 2,204 2,141
CSF 总 tau(pg/mL) 45 53
CSF 磷酸化 tau(pg/mL) 16 18
基线仅单一帕金森体征比例 约 9%

对 AI 建模的启示:PD 与 HC 在量表与分子指标上呈大效应量分离(适合分类基线),但 PD 与 SWEDD 的临床量表接近(32.4 vs 28.2),区分二者几乎完全依赖影像定量——这正是"量表-only 模型会把 SWEDD 判成 PD"的数据学根源。

§4.4 数据层级

数据按"研究(PPMI / PPMI 2.0 协议)→ 受试者(PATNO)→ 访视(EVENT_ID,如 BL/V01…)→ 模态与文件"组织:

Study(NCT01141023 / NCT04477785)
└── Subject(PATNO,跨研究沿用)
    ├── Visit(EVENT_ID:BL、V01…V26;R 开头为远程访视)
    │   ├── Clinical(CSV 行:PATNO + EVENT_ID + 表内字段)
    │   ├── Imaging(DICOM 目录:PATNO/EVENT_ID/序列)
    │   └── Biospecimen(采样记录 → 检测结果行)
    └── Genetics(跨访视静态:基因分型/测序结果)

层级设计的两个工程要点:第一,基因数据挂在受试者层而非访视层(一次测序终身有效),合并纵向表时注意不要重复计费样本量;第二,影像目录中存在"同一 EVENT_ID 多次扫描"(重扫/补扫)的情况,按目录名时间戳取最新一次或与中心定量表对齐,切勿按文件数当受试者数。

§4.5 缺失值与信息性缺失

缺失模式 表现 信息性含义 建议处理
访视级稀疏 受试者流失导致后期访视行缺失 随访存活偏差(更差结局者更易缺失) 纵向模型用逆概率加权或联合建模
模态级缺口 某访视有量表无影像/CSF 影像与 CSF 访视频率低于量表 按模态分别定义分析集并记录筛选规则
条目级空值 量表单项空缺、LEDD 未计算 部分为"未用药"的真实 0,部分为漏填 区分真实 0 与 NaN;LEDD 结合用药日志重建
隐私级隔离 前驱期/HC 的 SAA 结果不在公开层 Tier 3 限制设计 申请或改用已发表汇总统计
编码未知 性别 0、利手 0 等未知码 未采集而非拒绝 归入"未知"类别,不参与分层变量统计

§5 数据划分与使用建议

§5.1 官方划分

PPMI 不提供训练/验证/测试划分——它是一个持续增长的自然病程队列,而非竞赛基准。官方提供的"划分工具"只有共识委员会分析数据集(用于确定每个受试者的队列归属)与 Data User Guide。任何以表格或论文形式出现的"官方划分"都应视为社区实践而非官方规范。

§5.2 社区惯例划分

  • 横断面分类任务:按受试者 70/15/15 或 80/20 划分,部分研究采用分层抽样保持队列比例;更多研究直接用 GroupKFold 交叉验证报告均值±标准差。
  • 纵向预测任务:以时间为切点(如用基线 + 12 个月内数据预测 24 个月里程碑),按受试者划分训练/测试,避免轨迹片段跨集。
  • 外部队列验证:以 BioFIND(MJFF 同源协议对照队列)或后续独立采集数据作为外部测试。

§5.3 泄漏风险(重点)

  1. 受试者泄漏:同一 PATNO 的多个访视行高度相似,若按行随机划分,测试集性能虚高——这是 PPMI 类纵向数据最常见的泄漏形态(见坑点 3)。
  2. 时间泄漏:用访视 t 的特征预测 t 之前定义的标签(如用 V02 的 MDS-UPDRS 预测基线诊断)会引入未来信息。
  3. 队列定义泄漏:诊断标签本身部分由 DaTscan 结果定义,再用 DaTscan 做诊断分类属于循环论证;应明确任务定义(临床预测 vs 影像定量)。
  4. 衍生数据回流:研究者提交回 PPMI 的衍生数据可能包含自己此前分析轨迹,做超大范围合并时注意重复。

§5.3b 划分策略建议对照表

任务形态 推荐划分 验证方式 关键约束
基线诊断分类 按 PATNO 分组 70/15/15 5 折 GroupKFold 报均值±标准差 类别分层;SWEDD 单独类
纵向里程碑预测 训练限早期波次,测试用后段 时间外推 + 受试者分组双约束 特征窗口与标签窗口不重叠
影像深度学习 按受试者分组划分,站点分层 分站点子组报告 防相机差异泄漏到特征归一化
组学/基因关联 全量分析(非监督学习场景) 报告效应量与多重校正 祖源分层,避免跨祖源混合
数字传感器建模 按波次划分(训练早期波) PPMI 2.0 新波外部测试 协议漂移显式记录

§5.4 交叉验证建议

  • 按 PATNO 做 GroupKFold(5–10 折),报告折间均值与标准差。
  • 纵向任务用"留出后段年份"的时间外推验证(训练 2010–2018 波,测试 2020 后 PPMI 2.0 波)以评估协议漂移影响。
  • 小类(SWEDD、SNCA/PRKN/PINK1 携带者)用分层分组抽样,防止某折完全缺失该类。
验证方案 适用任务 抗泄漏 抗漂移 实施成本
5 折 GroupKFold 横断面分类/回归
分组 + 分层抽样 含小类的分类
时间外推(早期波 → 2.0 波) 纵向预测
留一站点(Leave-One-Site-Out) 影像/多中心泛化
BioFIND 外部验证 生物标志物复制 最强 最强 高(需另行申请)

无论选择哪种方案,划分脚本应与快照一同归档,使任何第三方能用同一数据态复现同一划分。

§5.5 外部验证建议

优先选择:BioFIND(同协议独立队列,适合生物标志物复制验证);本地/区域临床队列(评估跨医疗系统泛化);PPMI 2.0 新入组波次(评估协议升级带来的分布漂移)。报告外部验证时须注明训练数据的获取日期快照,因为 Tier 1 数据每日刷新,不同日期下载的数据内容不同。


§6 AI 就绪指南

§6.0 云端快速启动

PPMI 无官方云端镜像(数据需登录下载),但 Google Colab 搭配挂载 Google Drive 的方式适合处理 Tier 1 CSV:

# Colab 环境准备:将下载的 PPMI Study Data CSV 上传至 Google Drive 后挂载
from google.colab import drive
drive.mount('/content/drive')
DATA_ROOT = '/content/drive/MyDrive/PPMI/Study_Data'

§6.1 快速上手

以下代码假设你已下载 Tier 1 的 Study Data CSV。目录结构预期与 §4.0 一致:data_root 指向存放 MDS-UPDRS_Part_III.csvDemographics_*.csvParticipant_Status.csv 等文件的目录。最小可用子集是"MDS-UPDRS Part III + 人口学 + 参与者状态"三张表,即可完成"基线 PD vs HC 严重度分析"的最小闭环。

import pandas as pd
from pathlib import Path

# data_root 与目录结构的拼接关系:data_root / 文件名(扁平结构,无子目录)
data_root = Path('/content/drive/MyDrive/PPMI/Study_Data')

# 1) 参与者状态表:入组者名单 + 队列状态(与 SCREEN 表区分)
status = pd.read_csv(data_root / 'Participant_Status.csv')
enrolled = status[status['ENROLL_CAT'].notna()]          # 仅保留入组者
print(enrolled['COHORT'].value_counts())                  # 队列分布

# 2) MDS-UPDRS Part III:取基线访视(EVENT_ID == 'BL')
updrs3 = pd.read_csv(data_root / 'MDS-UPDRS_Part_III.csv')
baseline = updrs3[updrs3['EVENT_ID'] == 'BL']
# 注意:Part III 存在 ON/OFF 两种状态,基线未用药者只有单一状态

# 3) 合并人口学,构造最小分析集
demo_cols = ['PATNO', 'AGE_AT_VISIT']                     # 列名以下载数据的 Data_Dictionary 为准
demo = pd.read_csv(next(data_root.glob('Demographics_*.csv')))
mini = baseline[['PATNO', 'NP3TOT']].merge(
    demo[demo_cols], on='PATNO', how='inner'
)
print(mini.groupby('PATNO').size().describe())            # 校验一人一行

关键点:列名随下载日期快照变化(官方每日刷新),任何硬编码列名都应先对照 Data_Dictionary.csvCode_List.csv 校验。

§6.2 数据获取

步骤 操作 耗时 说明
1 访问 https://www.ppmi-info.org/access-data-specimens/download-data 即时 官方数据入口
2 在线申请:填写机构信息、研究动机 约 20 分钟 需科学/教育机构隶属或说明
3 电子签署 PPMI Data Use Agreement 即时 法律约束:合规使用 + 出版政策
4 DPC 审核 1 周内 多数申请快速通过
5 获得账号,登录 LONI 平台下载 Study Data / 影像 下载时长视网络 影像按受试者子集勾选
6 (可选)BAM/FASTQ 等大数据:提交 Genetic Data Request Form 数天排队 经 IBM Aspera 传输,需求 TB 级存储
7 (可选)Tier 3(前驱期 DaTscan、αSyn-SAA):书面申请 DAC 数周 PDF 申请,逐案审批

数据全程免费;使用中需遵守:年度使用回报、发表前经 DPC 审阅(2 周)、结果数据回流。引用格式必须注明数据获取日期与使用的 Tier 层级。

申请注意事项:机构隶属信息需与可验证的学术/教育机构一致(DPC 会筛查申请者机构与研究理由);数据使用协议为电子签署,对商用与再识别行为有明确禁止条款;若后续需要 FASTQ/BAM 或 Tier 3 数据,建议在首次申请时即阅读对应表单要求,避免二次排队;账号对应个人,组内多人使用时各自申请。

§6.3 预处理全流程

流程:CSV 清洗 → 队列标签对齐(共识数据集)→ 特征工程(LEDD 重建、访视对齐)→(影像分支)DICOM → NIfTI → 定量特征。

import numpy as np
import pandas as pd

def build_baseline_table(data_root: Path) -> pd.DataFrame:
    """构造基线分析表:队列标签以共识委员会分析数据集为准。"""
    # 1) 读取各源表
    updrs3 = pd.read_csv(data_root / 'MDS-UPDRS_Part_III.csv')
    meds   = pd.read_csv(data_root / 'Current_Medication_Log.csv')
    consensus = pd.read_csv(data_root / 'Consensus_Analytic_Dataset.csv')

    # 2) 清洗:统一 PATNO 类型;剔除 INFODT 空行
    for df in (updrs3, meds):
        df['PATNO'] = df['PATNO'].astype('Int64')
    updrs3 = updrs3[updrs3['INFODT'].notna()]

    # 3) 基线未用药筛选:BL 访视
    bl = updrs3[updrs3['EVENT_ID'] == 'BL'].copy()

    # 4) LEDD 重建:从用药日志按换算表聚合(示意;实际用官方换算系数)
    ledd = (meds.groupby('PATNO')['LEDD']
                .max().rename('LEDD_baseline').reset_index())
    bl = bl.merge(ledd, on='PATNO', how='left')
    bl['LEDD_baseline'] = bl['LEDD_baseline'].fillna(0)   # 未用药 = 真实 0

    # 5) 标签对齐:以共识数据集覆盖 research_group(关键防错步骤)
    bl = bl.merge(consensus[['PATNO', 'COHORT_DEFINITION']],
                  on='PATNO', how='left')
    return bl

baseline_tbl = build_baseline_table(data_root)

影像分支(DaTscan 示例):DICOM → NIfTI 后,按中央实验室同款分区(尾状核、壳核前/后 + 参考区如枕叶皮层)提取均值并计算 SBR;若无需自算,直接使用 DatScan_Analysis 表的中心定量结果。MRI 建议复用社区 BIDS 转换脚本与 fMRIPrep 流程后做体素/形态学特征提取。

# DaTscan DICOM → NIfTI → 分区 SBR 的最小流水线(示意,需 dcm2niix 与 nibabel)
# 目录预期:raw/{PATNO}/{EVENT_ID}/*.dcm(LONI 影像包解压后结构)
import subprocess, nibabel as nib, numpy as np
from pathlib import Path

def convert_dicom_to_nifti(dicom_dir: Path, out_dir: Path) -> Path:
    """单个 SPECT 序列转换;输出 out_dir/{PATNO}_{EVENT_ID}.nii.gz"""
    out_dir.mkdir(parents=True, exist_ok=True)
    out = out_dir / f'{dicom_dir.parent.name}_{dicom_dir.name}.nii.gz'
    subprocess.run(['dcm2niix', '-z', 'y', '-o', str(out_dir),
                    '-f', out.stem.replace('.nii', ''), str(dicom_dir)],
                   check=True, capture_output=True)
    return out

def region_sbr(img: nib.Nifti1Image, target_mask, ref_mask) -> float:
    """SBR = (靶区均值 - 参考区均值) / 参考区均值,复刻中心实验室定义。
    target_mask/ref_mask 为与影像同网格的布尔掩码(尾状核/壳核分区、枕叶参考区)。"""
    data = np.asarray(img.dataobj, dtype=np.float64)
    tgt, ref = data[target_mask].mean(), data[ref_mask].mean()
    return float((tgt - ref) / ref)

# 生产建议:优先使用官方 DatScan_Analysis 表的 SBR;自算仅用于影像深度学习输入侧,
# 且必须逐站点核对重建/衰减校正参数一致性(见坑点 6)。

§6.4 PyTorch Dataset

以"纵向 MDS-UPDRS 轨迹 → 预后分类"为例的完整可运行 Dataset(40+ 行,已折叠):

<details>
<summary>点击展开完整 PyTorch DataLoader 代码</summary>

import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.preprocessing import StandardScaler

class PPMILongitudinalDataset(Dataset):
    """受试者为样本:把每人的访视序列打包成 (seq_len, feat_dim)。

    预期目录(与 data_root 拼接):
      data_root/
        MDS-UPDRS_Part_III.csv      # 主特征
        Demographics_*.csv          # 静态协变量
        consensus.csv               # 共识分析数据集导出的队列标签
    最小可用子集:MDS-UPDRS Part III + 人口学。
    """
    def __init__(self, data_root: str, max_len: int = 12):
        root = Path(data_root)
        up = pd.read_csv(root / 'MDS-UPDRS_Part_III.csv')
        demo = pd.read_csv(next(root.glob('Demographics_*.csv')))
        consensus = pd.read_csv(root / 'consensus.csv')

        # 特征列:Part III 分项 + 总分
        feat_cols = [c for c in up.columns if c.startswith('NP3')
                     and up[c].dtype.kind in 'if']
        up = up[up['INFODT'].notna()].sort_values(['PATNO', 'INFODT'])

        # 访视日期解析 → 相对月数(时间对齐特征)
        up['INFODT'] = pd.to_datetime(up['INFODT'], errors='coerce')
        up = up.dropna(subset=['INFODT'])
        up['MONTH'] = ((up['INFODT'] - up.groupby('PATNO')['INFODT']
                        .transform('min')).dt.days / 30.44)

        self.scaler = StandardScaler().fit(up[feat_cols])
        up[feat_cols] = self.scaler.transform(up[feat_cols])

        static = demo.set_index('PATNO')
        label_map = dict(zip(consensus['PATNO'],
                             (consensus['COHORT'] == 'PD').astype(int)))

        self.samples = []
        for patno, g in up.groupby('PATNO'):
            feats = self.scaler.transform(g[feat_cols]) if False else g[feat_cols].to_numpy(np.float32)
            months = g['MONTH'].to_numpy(np.float32)
            seq = np.concatenate([feats, months[:, None]], axis=1)
            self.samples.append({
                'x': torch.tensor(seq[:max_len]),                # (L, F+1)
                'static': torch.tensor(static.loc[patno].values[:2],
                                       dtype=torch.float32),
                'y': label_map.get(patno, -1),
                'patno': patno,
            })

    def __len__(self):
        return len(self.samples)

    def __getitem__(self, idx):
        return self.samples[idx]

def collate(batch):
    xs = [b['x'] for b in batch]
    lens = torch.tensor([len(x) for x in xs])
    xs_pad = torch.nn.utils.rnn.pad_sequence(xs, batch_first=True)
    return {
        'x': xs_pad, 'lengths': lens,
        'static': torch.stack([b['static'] for b in batch]),
        'y': torch.tensor([b['y'] for b in batch]),
        'patno': [b['patno'] for b in batch],
    }

# 实例化:按 PATNO 分组划分(防泄漏),DataLoader 批量加载
ds = PPMILongitudinalDataset('/content/drive/MyDrive/PPMI/Study_Data')
loader = DataLoader(ds, batch_size=32, shuffle=True,
                    collate_fn=collate, num_workers=2)

</details>

§6.5 坑点 8 个

⚠️ 坑点 1:把 SWEDD 当作帕金森病训练(分类:标签理解)

问题:SWEDD(扫描无多巴胺能缺陷证据)受试者有帕金森样症状、基线 MDS-UPDRS 高达 28.2,但独立分析证实其并非早期帕金森病。若用 research_group/APPRDX 粗粒度标签训练 PD vs 非PD 分类器,SWEDD 的归属错误会直接污染训练分布。
症状:分类器在"PD vs HC"上表现优异,但对临床疑诊病例的外部验证准确率显著下降;模型对壳核 SBR 特征的注意力异常低。
解决

  1. 简单方法:训练前从 PD 类中剔除 SWEDD(以共识分析数据集为准),或在三分类 PD/HC/SWEDD 中显式建模。
  2. 进阶方法:把 SWEDD 作为"症状阳性、生物学阴性"的对照类单独分析,检验模型是否学到了多巴胺能缺陷生物学而非运动症状表面模式。
  3. SOTA 方法:以 DAT 成像 + αSyn-SAA 状态构建生物学分层标签(需申请 Tier 3),按生物学定义复训练与评估。
    参考:Lee JW et al., PLoS One 2021(PPMI 数据分析证实 SWEDD 非早期 PD);Marek 2018(Ann Clin Transl Neurol, 10.1002/acn3.644)。

⚠️ 坑点 2:直接用单表 research_group 确定队列归属(分类:标签理解)

问题:官方明确要求队列归属以"Consensus Committee Analytic Dataset"为准;各业务 CSV 中的队列字段(如 APPRDX/RECRUIT)反映申请/招募时状态,与最终共识裁定存在差异(例如 16% 疑似 PD 被影像重分类为 SWEDD)。
症状:同一受试者在不同表中标签不一致;论文复现数字与官方发表数字对不上。
解决

  1. 简单方法:下载 LONI 平台 Study Data 中的共识分析数据集及其使用指南,以其 COHORT 字段为唯一标签源。
  2. 进阶方法:编写标签对齐层(见 §6.3 代码),把所有表通过 PATNO 挂到共识标签上,并在分析代码中禁止直接读取业务表的队列字段。
  3. SOTA 方法:锁定"下载日期快照 + 共识数据集版本"双锚点写入实验记录,保证每日刷新的数据流可复现。
    参考:PPMI Data User Guide;Getting Started With Parkinson’s Disease Data(Zenodo, 2024)。

⚠️ 坑点 3:按行随机划分导致受试者泄漏(分类:数据泄漏)

问题:纵向数据中同一 PATNO 有多条访视行,行级随机划分会让同一受试者的相邻访视同时出现在训练与测试集,模型只需"记住个体"即可得高分。
症状:测试 AUC 高达 0.95+ 且特征重要性集中于年龄/个体稳定项;换一个完全独立的受试者队列,性能暴跌 10–20 个百分点。
解决

  1. 简单方法:按 PATNO 做 GroupShuffleSplit / GroupKFold 划分。
  2. 进阶方法:时间外推验证——用早期入组波训练、后期波(或 PPMI 2.0)测试,同时检查协议变化(传感器加入、站点扩容)的影响。
  3. SOTA 方法:双重稳健评估(受试者分组 + 时间前推),并在报告中给出"新受试者 + 新协议"的组合性能下界。
    参考:§5.3;Frontiers in Aging Neuroscience 2023 综述(10.3389/fnagi.2023.1076657)对 PPMI ML 实践的系统梳理。

⚠️ 坑点 4:SCREEN 与 PARTICIPANT STATUS 混用(分类:工程陷阱)

问题:SCREEN 表包含所有签署知情同意者,PARTICIPANT STATUS 表仅含实际入组者;且入组名单因站点表单提交延迟而滞后。不加过滤直接 join 会把"同意但未入组"者带入分析。
症状:样本量比论文多出若干"幽灵受试者";按队列分组时出现共识数据集中不存在的 PATNO。
解决

  1. 简单方法:以 PARTICIPANT STATUS 表为入组白名单,与其余表按 PATNO inner join。
  2. 进阶方法:合并后与共识分析数据集做差集校验,输出异常 PATNO 清单并人工复核。
  3. SOTA 方法:把该校验固化为数据摄入 CI 步骤,每次下载快照自动跑一致性断言。
    参考:PPMI FAQ(官方说明 SCREEN/PARTICIPANT STATUS 关系与 PATNO 合并要求)。

⚠️ 坑点 5:临床每日刷新与影像每月整合的时间错位(分类:评估误用)

问题:临床 CSV 每晚刷新、周日全量更新,影像每月整合且 DA 中访问视日期(INFODT)存在录入延迟与更正。跨模态合并时若以"最近一次下载快照"为基准,不同模态可能对应不同时间态的数据版本。
症状:同一 EVENT_ID 的临床评分在两次下载间变化;影像 - 临床合并表出现访视日期相差数月的配对。
解决

  1. 简单方法:锁定一次下载快照归档,全部实验基于同一快照。
  2. 进阶方法:跨模态对齐用 INFODT 容差窗(如 ±90 天)并记录配对规则;对齐失败的行显式丢弃而非静默最近邻。
  3. SOTA 方法:建立数据版本卡(快照日期、行数、校验和),用 DVC 或等价物管理,使论文可复现到具体数据态。
    参考:PPMI FAQ(更新频率官方说明);§6.10 MLOps 笔记。

⚠️ 坑点 6:DaTscan 定量直接用原始像素强度(分类:预处理陷阱)

问题:SBR(特异性结合率)= 靶区均值 / 参考区本底,直接用 DICOM 像素强度或未配准的 SUV 类指标,会混入各站点相机与采集条件差异,SPECT 重建与衰减校正参数不统一时尤为严重。
症状:多站点混合训练后,站点指示变量成为最强特征;模型学到"哪台相机"而非"多少多巴胺能缺陷"。
解决

  1. 简单方法:直接使用官方 DatScan_Analysis 表的中心实验室 SBR 定量,不自算。
  2. 进阶方法:自算时严格复刻中心协议——同一参考区(如枕叶)、同一种体素阈值规则,并按站点做重建参数分层质检。
  3. SOTA 方法:ComBat 类站点谐波校正 + 保留"诊断性"影像特征做双路输入,兼顾定量终点与深度特征。
    参考:PPMI 采集协议文档(SPECT acquisition protocol);Marek 2018 的 SBR 组间差异报告。

⚠️ 坑点 7:忽略 Tier 限制造成选择偏差(分类:偏倚陷阱)

问题:前驱期与 HC 的 αSyn-SAA 结果、前驱期 DaTscan 属于 Tier 3(需 DAC 批准);原始 WGS/传感器属 Tier 2(需表单)。研究者若只在公开层拼数据,会系统性地缺失"最关键的生物学状态"维度,且缺失与否本身与前驱期状态相关。
症状:SAA 相关分析在公开层无法复现已发表数字;前驱期样本量比论文少一截。
解决

  1. 简单方法:明确列出所需变量的 Tier 归属(出版政策有四层定义),提前规划 DAC 申请(PDF 书面申请)。
  2. 进阶方法:对无法申请的 Tier 3 变量,用已发表汇总统计做外部校准而非个案合并。
  3. SOTA 方法:引用时严格按官方模板声明 Tier 使用情况(如 “Use of a mix of Tier 1 and Tier 2 data…”),避免审稿合规问题。
    参考:PPMI Publication Policy(四层体系与引用模板);PPMI Access Data 页面(sequestered data 说明)。

⚠️ 坑点 8:忽视 UPDRS 评估状态与药物混杂(分类:评估误用)

问题:MDS-UPDRS Part III 存在 ON/OFF 药物状态评估;纵向随访中受试者陆续开始用药,LEDD 与评估状态共同构成强混杂。直接把不同状态、不同用药期的评分混入同一轨迹,模型学到的是"用药史"而非"疾病进展"。
症状:轨迹预测模型在用药起始点附近出现系统性跳变;LEDD 相关特征重要性压倒影像/生物标志物特征。
解决

  1. 简单方法:只用基线(未用药)数据做诊断类任务;纵向任务明确筛选 ON 或 OFF 状态一致的访视。
  2. 进阶方法:把 LEDD 与用药起始时间作为协变量/中介变量显式建模(如联合模型或 g-methods)。
  3. SOTA 方法:对"治疗起始"建模为时间依赖混杂,用边际结构模型或以 PPMI 早期未用药窗口限定研究问题。
    参考:Marek 2018(未用药队列设计动机);Sci Rep 2023(10.1038/s41598-023-49617-w)中 UPDRS III 与治疗时长同时进入最优特征集的证据。

§6.6 数据增强

数据类型 安全增强 ✅ 危险增强 ❌ 原因
表格/时序 训练折内重采样;小幅时间抖动(±1 个月);特征高斯噪声(σ ≤ 0.05);同类受试者轨迹 Mixup 跨受试者拼接轨迹;测试折内拟合任何变换 拼接制造不存在的病程;折内拟合造成归一化泄漏
DaTscan/MRI 轻度旋转(≤10°)、平移(≤5%)、小幅弹性形变、强度标准化内扰动 左右翻转;跨站点风格迁移后仍称"多中心评估" 帕金森病有显著侧别差异,翻转即改病;风格迁移破坏站点泛化的评估有效性
传感器信号 时间窗裁剪、幅值缩放(±10%)、加性噪声 通道混叠、重采样改变采样率语义 步态节律特征对时频结构敏感
分子/组学 批内标准化、留一染色体验证 合成"小类"样本后仍报告真实分布性能 合成样本掩盖真实小类困难

§6.7 模型推荐

任务 推荐模型 起点 备注
基线诊断分类(表格) XGBoost / Random Forest sklearn 单机 公开文献 RF 平均准确率 96%–97%
纵向进展预测(序列) GRU/LSTM → Transformer 编码器 PyTorch 用 §6.4 的 padding + lengths 输入
影像诊断(DaTscan) ResNet/DenseNet 2.5D(冠状切片堆叠) torchvision 输入用中心 SBR 配合做混合特征
MRI 形态学 3D CNN 或 FreeSurfer/ANTs 特征 + SVM 社区 BIDS 流程 小样本下传统特征常更稳
多模态亚型聚类 变分多视图模型 / Similarity Network Fusion 可复现参考实现 先做模态内标准化
可穿戴信号 时序 CNN(1D ResNet) 与量表对齐后训练 注意波次/协议偏倚

§6.8 硬件需求

场景 最低配置 推荐配置 说明
Tier 1 表格 ML 8 GB 内存笔记本 16 GB 内存 CSV 全套数百 MB
影像子集处理 32 GB 内存 + 500 GB 磁盘 64 GB + 2 TB NVMe DICOM→NIfTI 转换 IO 密集
3D CNN 训练 11 GB 显存 GPU(RTX 2080 Ti) 24 GB+(RTX 3090/4090) 2.5D 方案可降至 8 GB
基因组原始数据 不建议本地 HPC/云对象存储 WGS FASTQ 70 TB、RNA-seq 154 TB
长序列纵向模型 单卡 8 GB 单卡 16 GB 序列短(≤12 访视),瓶颈在数据工程

§6.9 评估指标代码

import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score
from sklearn.model_selection import GroupKFold

def grouped_cv_auc(model, X, y, groups, n_splits=5):
    """按受试者分组交叉验证,返回 AUC 与 AUPRC(处理类别不平衡)。"""
    aucs, aps = [], []
    gkf = GroupKFold(n_splits=n_splits)
    for tr, te in gkf.split(X, y, groups):
        model.fit(X[tr], y[tr])
        p = model.predict_proba(X[te])[:, 1]
        aucs.append(roc_auc_score(y[te], p))
        aps.append(average_precision_score(y[te], p))
    print(f'AUC {np.mean(aucs):.3f}±{np.std(aucs):.3f} | '
          f'AUPRC {np.mean(aps):.3f}±{np.std(aps):.3f}')
    return aucs, aps

# 报告规范补充:
# 1) 同时报告敏感性/特异性(对照 SAA 论文的 87.7%/96.3% 量级)
# 2) 分站点/分队列子组性能(公平性)
# 3) 折间标准差而非单次划分点估计

纵向生存/里程碑任务的补充评估代码(C-index 与时间依赖 AUC 的最简实现路径):

import numpy as np
from lifelines.utils import concordance_index

def c_index(durations, events, risk_scores):
    """风险分数越高越易发生里程碑(如异动症确诊、痴呆转化)。
    durations: 到事件或删失的月数;events: 0/1 事件指示。"""
    return concordance_index(durations, -np.asarray(risk_scores), events)

# 时间依赖 AUC 简易版:固定 horizon t0,把未在 t0 前删失者按
# "t0 前发生 = 1" 重组二分类后计算 AUC;删失个体按 ISC 建议剔除或加权。
def time_dependent_auc(durations, events, risk, t0, auc_fn):
    mask_dur = durations <= t0
    y = events[mask_dur].astype(int)                    # t0 前发生事件者
    risk_pos = risk[mask_dur]
    censor_after = (~mask_dur) & (durations > t0)       # 存活超过 t0 的对照
    y_true = np.concatenate([y, np.zeros(censor_after.sum())])
    scores = np.concatenate([risk_pos, risk[censor_after]])
    return auc_fn(y_true, scores)

# 报告建议:C-index 为主指标(对删失稳健),时间依赖 AUC 按多个 t0 网格报告曲线。

§6.10 MLOps 笔记

  • 数据版本化:Tier 1 每日刷新意味着"最新"是一个移动靶;每次下载落盘快照(日期 + 校验和 + 行数清单)并纳入实验元数据。
  • 标签单一来源:共识分析数据集作为只读标签层挂载,任何实验不得绕过。
  • 漂移监控:PPMI 2.0 引入新站点、新协议与前驱期扩招,部署模型需监控输入分布(站点构成、传感器波次)漂移,并预设"仅限原始队列分布"的使用边界。
  • 合规流水线:发表前 DPC 审阅(2 周窗口)应纳入项目排期;年度使用回报设为日历任务。
  • 可复现引用:所有产出在方法节写明"数据获取日期 + Tier 使用声明 + RRID: SCR_006431",与出版政策模板保持一致。
MLOps 环节 PPMI 特有要求 建议实现
数据摄入 每日刷新 → 快照而非实时拉取 定期归档 + 校验和 + 行数断言
特征仓库 访视级特征 + 受试者级静态特征分层 双层键值(PATNO / PATNO+EVENT_ID)
标签管理 共识数据集版本即标签版本 标签表带版本号外键
实验追踪 记录 Tier 声明与引用合规项 追踪元数据含 data_snapshot_date
上线监控 分布漂移按站点/波次监控 PSI 分组监控 + 阈值告警
发布流程 发表/部署前 DPC 审阅合规 项目日历预置 2 周审阅窗

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
招募偏倚 受试者来自学术运动障碍中心,社区病例与基层首诊人群覆盖不足 外部验证用社区队列;报告站点构成
祖源偏倚 非欧洲血统人群代表性不足(官方文档确认) 分祖源敏感性分析;基因研究避免跨祖源直接合并
转诊/入组偏倚 以 DaTscan 锚定入组,排除了"临床疑似但 DAT 正常"者 明确任务总体;SWEDD 单独分析
生存/流失偏差 后期访视覆盖逐波下降,重症与失能者更易退出 逆概率加权;联合建模;报告各访视在访人数
时间波次偏倚 传感器数据仅见于后期波次;PPMI 2.0 协议升级 波次分层评估;协议变量入协变量
药物混杂 随访中用药起始改变表型与生物标志物 限定未用药窗口或显式建模 LEDD(坑点 8)

§7.2 标注质量

队列标签由共识委员会分析数据集统一裁定,具备多学科专家共识、影像锚定与协议化流程,标注质量在同类队列中属最高档;影像定量由中央实验室完成,消除了站点阅片差异;分子检测平台统一并经实验室间一致性验证。相对薄弱处在于:临床量表仍依赖站点评定员(已标准化认证但评定员间变异不可避免);队列定义随科学认知演进而更新(如 SWEDD 的重新解释、SAA 的引入),历史版本标签存在"知识时点"差异。

标注链路质量评估:

标注环节 质量机制 残余风险 对 AI 的影响
队列归属 共识委员会 + 影像锚定 认知演进导致的定义漂移 跨年代分析需锁定同一版本共识数据集
影像定量 中央实验室统一阅片/定量 相机校准残差 站点谐波校正
临床量表 MDS-UPDRS 认证评定员 评定员间变异(尤其 Part III) 多评定员站点做敏感性分析
分子检测 统一平台盲法 + 批次控制 批间漂移 纳入批次协变量
基因注释 遗传核心统一流程 变异解读随时间更新 引用注释版本

§7.3 泛化性

场景 失效风险 证据/机制
社区/基层医疗人群 学术中心招募人群,首诊构成与共病谱不同
非欧洲/非北美人群 祖源代表性不足(官方确认局限),基因频率差异大
晚期帕金森病 队列为早期未用药起步,晚期表型覆盖薄
LRRK2 等特定遗传亚组 该亚组生物学异质(SAA 阳性率仅 67.5%),影像表型较轻
跨影像设备中心 SPECT 协议标准化但仍残留相机差异(坑点 6)
远程/数字终点迁移 传感器波次集中,协议与人群双漂移

泛化性总评:PPMI 训练的模型最可靠的适用域是"学术运动障碍中心的早期帕金森病评估场景";向基层、非欧洲人群与晚期疾病外推时,应默认存在性能衰减并给出子组证据,而非假设泛化。若研究目标本身在适用域之外,应把"分布偏移"作为实验设计的一等公民,而非事后再补。

实践中推荐的做法是:在项目立项文档中显式写明目标适用域与 PPMI 适用域的重叠度,并为重叠域外的每个外推维度预设一个可测量的验证子集。

§7.4 伦理

受试者经各站点 IRB 批准并签署知情同意;数据去标识后按 Data Use Agreement 共享,直接标识符与精确活动日期被隔离在 Tier 4 不对外释放;基因数据具有潜在再识别风险,仅向签署协议并通过委员会筛查的研究者开放;发表须经 DPC 审阅并遵守开放获取要求;使用者需年度回报分析情况并将衍生数据回流委员会。

§7.5 公平性

官方仪表板公开队列的性别(男 48.9% / 女 51.1%,全体注册口径)与种族分布,方便公平性审计。已知问题:非欧洲血统样本占比低,直接影响多基因风险模型与跨祖源泛化;性别在不同分析子集中代表性不一(影像预处理子集男性约 66.6%)。建议在所有报告中输出按性别、种族、站点分层的性能子组表。

公平性审计要点速查:

维度 已知状态 建模风险 建议动作
性别 注册口径接近均衡;影像子集男性偏多(66.6%) 子集选择引入性别偏移 报告按性别分层的 AUC
种族/祖源 非欧洲血统显著欠代表 基因模型对少数祖源失效 祖源分层分析;避免跨祖源合并 GWAS
年龄 以 60 岁以上为主,年轻病例稀少 早发型 PD 外推差 报告年龄分箱性能
地理/站点 北美+欧洲学术中心集中 站点相机/流程差异成为伪特征 站点分层 + 谐波校正
社会经济 教育年限 10–24 年,自报偏差 认知量表的教育混杂 教育校正后的认知常模化

§7.6 数据漂移

队列处于"活数据"状态:临床数据每晚刷新、影像每月整合;PPMI 2.0 带来协议升级(数字传感器、远程访视 R 开头事件、前驱期扩招至 2,000)与站点扩容(近 50 个)。跨波次分析时的协议漂移主要表现为:量表采集情境变化(现场 vs 远程)、传感器端点加入、访视命名体系更新(官方注明"/"左右的新旧访视名对照)。对训练-部署时间线超过一年的模型,建议按波次做分布监控并设定再训练触发条件。

漂移监控清单:

漂移源 监控信号 触发动作
协议升级(PPMI 2.0) 远程访视占比、新端点出现频率 分协议建模或加协议协变量
站点扩容 新站点样本占比、站点级特征分布 站点分层评估 + 谐波校正复核
传感器波次 传感器数据覆盖率随时间变化 波次内归一化与评估
队列标签演进 共识数据集版本差异 锁定版本并记录变更日志
数据刷新 快照间行数/分布差异 版本卡 + 校验和比对

§7.7 DAIMS 数据质量清单

# 检查项 状态 说明
1 宽格式 每表一个评估工具,一行一访视记录,宽表合并顺畅
2 唯一标识 PATNO 贯穿全部表与影像目录
3 特殊字符 字段名规范,无特殊字符陷阱
4 重复行 ⚠️ SCREEN 与 PARTICIPANT STATUS 名单重叠,需显式白名单去重
5 缺失编码 ⚠️ 空值与"未采集"混用,LEDD 的 0 与 NaN 语义不同
6 标签标识 ⚠️ 业务表队列字段与共识分析数据集存在差异
7 罕见类分组 SNCA/PRKN/PINK1 等小类有独立队列编码可分层
8 偏倚评估 官方仪表板公开人口学与在访人数
9 数据字典 Data_Dictionary + Code_List + Data User Guide 齐备
10 信息性缺失解释 ⚠️ 访视稀疏与模态缺口需自行解读(§4.5)
11 设备记录 影像核心实验室质控记录与采集协议文档可溯
12 共线性 ⚠️ MDS-UPDRS 总分与分量表、LEDD 与用药项高度共线
13 编码映射 Code_List 提供全量编码对照
14 时间戳处理 ⚠️ INFODT 为访视日,存在录入延迟;两模态刷新频率不同
15 划分建议 无官方划分,需自行按 PATNO 分组
16 泄漏讨论 ⚠️ 官方未提供,但本 Wiki §5.3/坑点 3 给出完整方案
17 标签分布 仪表板按队列/访视/性别/种族展示
18 测量偏倚 ⚠️ 多中心量表评定员间变异;SPECT 相机差异
19 外部验证建议 BioFIND 等同源独立队列明确可用
20 版本记录 每日/每月更新节奏 + 快照日期可引用(需自行固化)
21 预处理脚本 无官方端到端脚本;社区有 BIDS/fMRIPrep 流程
22 合规要求 DUA + 四层引用规范 + 出版政策清晰可执行
23 多模态对齐 ⚠️ 影像/CSF 访视频率低于量表,需容差窗对齐
24 去标识化 去标识完整,直接标识符隔离于 Tier 4

DAIMS 评分:17.5 / 24(✅ 13 项 ×1 + ⚠️ 9 项 ×0.5 + ❌ 2 项 ×0)

评分解读:PPMI 在标识体系、数据字典、编码映射、合规与去标识化方面达到队列研究的顶级水准,扣分集中在"无官方划分与预处理脚本"(对机器学习用户是真实门槛)以及纵向数据固有的缺失复杂性与多模态对齐成本。⚠️ 项多数可以通过本 Wiki §5、§6 的操作方案工程化解决,❌ 两项需要团队自建基础设施。

对你意味着什么:如果你的任务是表格类诊断/预后建模,PPMI 可在 1–2 天内跑通端到端流程(下载快照 → 共识标签 → GroupKFold 基线);如果涉及影像或多模态对齐,请预算 1–2 周用于 DICOM 转换、站点质控与容差窗对齐,并把"无官方划分"转化为自己固定的快照 + 分组协议,否则结果不可复现。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
尸检病理频率(文献汇总对照) 多中心尸检研究 LRRK2 携带者路易病理一致性 αSyn-SAA 阳性率 67.5% vs 尸检 Lewy 病理频率相当 分子检测 vs 病理金标准 SAA 阳性率与 LRRK2 尸检路易病理报告频率吻合(Siderowf 2023 讨论)
同一样本多实验室复测 Amprion 等三平台 SAA 实验室间一致性 优秀的一致性(MDS 官方评述) 检测环节而非队列 支撑 SAA 作为可转移生物标志物(MDS Moving Along 2023)
PPMI 2.0 新波次 MJFF(前驱期扩招) 前驱期生物学验证 前驱期 SAA 阳性率 85%–89% 从 51 例扩展至 2,000 计划 前驱期阳性率在扩招波次持续得到确认

注:PPMI 自身即该领域的"验证源队列",多数外部验证以"在 PPMI 发现 → 独立队列复制"的方向进行;上表仅收录有同行评审支撑的结果。


§8 基准性能与生态

§8.1 排行榜

PPMI 无官方排行榜;下表汇总可复现的公开基准。⚠️ 各行数据子集、特征、划分方式不同,数值不可直接横向比较,仅作量级参考。

排名 任务 模型 性能 年份 关键技术 完整引用 代码
1 PD 诊断分类(表格) Random Forest + 粗糙集特征选择 平均准确率 97% 2023 四种特征选择与四种分类器系统对比 Hema MS et al., 2023, Multimedia Tools and Applications. DOI: 10.1007/s11042-023-15280-6 未公开
2 PD 早期检测(步态子集) 多算法对比后特征选择 准确率 91.9% 2023 PPMI Gait 子集特征工程 + 实时数据外测 Poojaa C, Alex JSR, 2023, arXiv:2304.09245 未公开
3 异动症预测(表格) Random Forest(7 特征) AUC 中位 0.881 2023 Bootstrap 30 次;UPDRS III + 语义流畅性 + 治疗时长等 7 特征 (Sci Rep) 2023, Scientific Reports 13:22426. DOI: 10.1038/s41598-023-49617-w 未公开
分子诊断参照(非 ML) CSF αSyn-SAA 敏感性 87.7% / 特异性 96.3% 2023 种子扩增检测,1,123 人 Siderowf A et al., 2023, Lancet Neurology 22(5):407-417. DOI: 10.1016/S1474-4422(23)00109-6 不可(湿实验)

§8.2 SOTA 总结与选型建议

  • 表格类任务的公开最优在 92%–97% 准确率区间,但注意多数未采用受试者分组划分,存在高估风险(坑点 3);以 GroupKFold 复现时性能普遍下降。
  • 分子参照(αSyn-SAA)为该领域提供了"非 ML 金标准"锚点:任何影像/表格分类器都应报告对 SAA 状态的一致性或与之的互补性。
  • 选型建议:小样本表格场景从 XGBoost/RF 起步并专注特征工程质量;影像任务用 2.5D CNN 而非重训练 3D 大模型;纵向任务优先考虑可解释的联合模型或带注意力机制的中型序列模型。

按研究阶段的选型路线图:

阶段 目标 建议技术栈 判断标准
探索期 建立可复现基线 pandas + sklearn + GroupKFold 分组划分下 AUC 稳定
特征期 挖掘多模态信号 中心 SBR + CSF + 量表融合特征 特征重要性符合临床先验
深度期 影像/序列端到端 2.5D CNN / 序列 Transformer 相对特征基线有显著增量
严谨期 外推与公平性 时间外推 + 子组审计 + 谐波校正 外部波次性能衰减可解释
产出期 试验富集模拟 进展速率模型 + 富集收益曲线 与 SAA 分层互证

§8.3 评测协议

社区通行做法(虽无官方规范,但高质量论文趋同):受试者分组划分;报告 AUC、敏感性、特异性与子组性能;声明数据快照日期与 Tier 使用层级;队列标签引用共识分析数据集;分子类研究同时报告置信区间(SAA 论文给出 95% CI 的做法已成惯例)。

协议要素 推荐做法 反例(应避免)
划分 按 PATNO 分组 + 类别分层 行级随机划分(泄漏)
指标 AUC + 敏感性/特异性 + CI 仅报告准确率
标签 共识分析数据集单一来源 从业务表直接取 research_group
复现声明 数据快照日期 + Tier 声明 + RRID 只写"来自 PPMI"
比较 同划分协议内比较 跨论文直接比较数字
数据集 机构 模态重点 规模 与 PPMI 的关系
BioFIND MJFF CSF/血样本、量表 约 400 同源协议独立对照队列,适合复制验证
ADNI NIH/学界联盟 MRI、PET、CSF 2,000+ 方法论同源(PPMI 设计参照 ADNI),疾病不同
Fox Insight MJFF 在线量表、基因 数万 大规模但无影像/生物样本的线上队列
FOUNDIN-PD MJFF 联合体 iPSC 多组学 95 iPSC 与 PPMI 队列衔接的组学深化项目
NACC/ADRC 队列 NIA 临床随访 数万 神经退行性疾病对照研究背景

§8.5 关键论文 Top 6

以下 6 篇构成 PPMI 研究的"最小阅读集":2 篇队列定义论文告诉你数据如何产生,1 篇分子里程碑定义了该领域当前的评价天花板,其余 3 篇覆盖标签陷阱、方法学综述与可复现基准。

  1. Marek K et al., 2011, Progress in Neurobiology 95(4):629-635. DOI: 10.1016/j.pneurobio.2011.09.005 — PPMI 设计论文:确立"标准化采集 + 即时开放"的队列范式(引用 1,607+,Semantic Scholar,截至 2026-09)。
  2. Marek K et al., 2018, Annals of Clinical and Translational Neurology 5(12):1460-1477. DOI: 10.1002/acn3.644 — 队列基线数据论文:423/196/64 三队列的影像、CSF 与量表完整基线特征。
  3. Siderowf A et al., 2023, Lancet Neurology 22(5):407-417. DOI: 10.1016/S1474-4422(23)00109-6 — αSyn-SAA 里程碑:敏感性 87.7%/特异性 96.3%,揭示 LRRK2 与嗅觉亚组分子异质性。
  4. Lee JW et al., 2021, PLoS One — 基于 PPMI 数据证实 SWEDD 不是早期帕金森病(标签工程必读)。
  5. Frontiers in Aging Neuroscience, 2023. DOI: 10.3389/fnagi.2023.1076657 — PPMI 机器学习研究现状系统综述。
  6. Scientific Reports, 2023, 13:22426. DOI: 10.1038/s41598-023-49617-w — 异动症预测最小特征集(7 特征 AUC 0.881)示范。

§8.6 社区活跃度

截至 2026-09 检索时,PPMI 累计下载 53,691,765 次(临床 1,800,550 + 影像 51,891,215),显示持续高强度的社区使用;设计论文 Semantic Scholar 引用 1,607+(截至 2026-09),且近年每年仍有大量新引用(2025 年新增引用涵盖脑龄估计、多模态基础模型等前沿方向)。官方维护数据仪表板、生物样本仪表板与出版物列表,数据使用问题由 ppmi@michaeljfox.org 支持响应。

社区活跃度指标速览:

指标 数值 截至时点 含义
累计下载次数 53,691,765 2026-09 检索时 官方 Access Data 页面唯一下载计数
其中临床数据下载 1,800,550 2026-09 检索时 表格数据使用体量
其中影像数据下载 51,891,215 2026-09 检索时 影像占绝对主导
设计论文引用 1,607+(Semantic Scholar) 2026-09 学界渗透度
2017-12 下载量 >1,500,000 2017-12(Marek 2018) 开放十年间的增长轨迹
数据更新节奏 临床每日 / 影像每月 持续 活数据状态

§8.7 生态快照

资源 类型 链接 状态 推荐理由
PPMI 官网 研究/受试者门户 https://www.ppmi-info.org 活跃(截至 2026-09) 研究设计、队列介绍与新闻
Access Data 下载页 数据入口 https://www.ppmi-info.org/access-data-specimens/download-data 每日/每月更新 申请入口 + 使用统计 + Tier 说明
LONI PPMI 数据库 数据平台 登录后访问(IDA) 持续运营 全部 CSV/影像/基因数据的实际托管层
Data User Guide 官方文档 LONI 登录后 Study Data 区 随数据更新 字段语义与访视命名权威解释
Data Dictionary + Code List 官方文档 LONI 登录后 Study Docs 随数据更新 所有列名与编码的唯一权威
社区 BIDS/fMRIPrep 转换脚本 社区代码 Stanford Mind Data Hub 页面引用的 GitHub 脚本 可用 MRI 数据标准化到 BIDS 的现成起点
Getting Started With Parkinson’s Disease Data 社区指南 Zenodo(2024) 稳定 第三方视角的入坑路线图

§9 相关资源与引用

§9.1 官方资源

§9.1b 文档资源速查表

文档 位置 用途 使用时机
Data User Guide LONI 登录 → Study Data 字段语义、访视命名、分析约定 第一次分析前通读 §1-§5
Data Dictionary LONI 登录 → Study Docs 全部列名含义 任何硬编码列名前
Code List LONI 登录 → Study Docs 编码值对照(队列/性别/利手等) 解析分类变量时
Consensus Committee Analytic Dataset + 指南 LONI 登录 → Study Data 队列归属金标准 定义标签前必读
操作手册(Clinical/Bio specimen/Genetics/影像协议) 官网 Research Documents 采集协议细节 复现定量指标时
Publication Policy 官网 PDF 引用模板、Tier 声明、DPC 流程 投稿前
Data Use Agreement 官网 PDF 法律条款与使用边界 申请时签署、复查条款时

§9.2 BibTeX 完整引用

@article{marek2011ppmi,
  title   = {The Parkinson Progression Marker Initiative (PPMI)},
  author  = {Marek, Kenneth and Jennings, Danna and Lasch, Shirley and Siderowf, Andrew and Tanner, Caroline and Simuni, Tanya and Coffey, Chris and Kieburtz, Karl and Flagg, Emily and Chowdhury, Sohini and Poewe, Werner and Mollenhauer, Brit and Sherer, Todd and Frasier, Mark and Meunier, Claire and Rudolph, Alice and Casaceli, Cindy and Seibyl, John and Mendick, Susan and Schuff, Norbert and Zhang, Ying and Toga, Arthur and Crawford, Karen and others},
  journal = {Progress in Neurobiology},
  year    = {2011},
  volume  = {95},
  number  = {4},
  pages   = {629--635},
  doi     = {10.1016/j.pneurobio.2011.09.005}
}

@article{marek2018cohort,
  title   = {The Parkinson's progression markers initiative (PPMI) -- establishing a PD biomarker cohort},
  author  = {Marek, Kenneth and Chowdhury, Sohini and Siderowf, Andrew and Lasch, Shirley and Coffey, Christopher S. and Caspell-Garcia, Chelsea and Simuni, Tanya and Jennings, Danna and Tanner, Caroline M. and Trojanowski, John Q. and Shaw, Leslie M. and Seibyl, John and Schuff, Norbert and Singleton, Andrew and Kieburtz, Karl and Toga, Arthur W. and Mollenhauer, Brit and Galasko, Douglas and Chahine, Lana M. and Weintraub, Daniel and Foroud, Tatiana and others},
  journal = {Annals of Clinical and Translational Neurology},
  year    = {2018},
  volume  = {5},
  number  = {12},
  pages   = {1460--1477},
  doi     = {10.1002/acn3.644}
}

@article{siderowf2023saa,
  title   = {Assessment of heterogeneity among participants in the Parkinson's Progression Markers Initiative cohort using alpha-synuclein seed amplification: a cross-sectional study},
  author  = {Siderowf, Andrew and Concha-Marambio, Luis and Lafontant, David-Erick and Farris, Carly M. and Ma, Yihua and Urenia, Paula A. and Nguyen, Hieu and Alcalay, Roy N. and Chahine, Lana M. and Foroud, Tatiana and Galasko, Douglas and Kieburtz, Karl and Merchant, Kalpana and Mollenhauer, Brit and Poston, Kathleen L. and Seibyl, John and Simuni, Tanya and Tanner, Caroline M. and Weintraub, Daniel and Videnovic, Aleksandar and Choi, Seung Ho and Kurth, Ryan and Caspell-Garcia, Chelsea and Coffey, Christopher S. and Frasier, Mark and Oliveira, Luis M. A. and Hutten, Samantha J. and Sherer, Todd and Marek, Kenneth and Soto, Claudio},
  journal = {The Lancet Neurology},
  year    = {2023},
  volume  = {22},
  number  = {5},
  pages   = {407--417},
  doi     = {10.1016/S1474-4422(23)00109-6}
}

§9.3 引用指南

使用 PPMI 数据时按出版政策执行:方法节写明数据获取日期(如 “Data used were obtained on 2026-08-20 from the PPMI database, RRID: SCR_006431”);显式声明所用的 Tier 层级(Tier 1 开放 / Tier 2 需表单 / Tier 3 需 DAC 批准);致谢注明 “PPMI – a public-private partnership – is funded by the Michael J. Fox Foundation for Parkinson’s Research and funding partners”;发表前将稿件提交 DPC 审阅;完成后向委员会回报衍生数据。

常见引用错误对照:

常见错误 官方要求 后果
只写"数据来自 PPMI" 注明获取日期 + Tier 使用声明 审稿合规退回
使用 Tier 3 数据仍称"开放数据" 按模板声明 DAC 审批路径 误述访问性质
遗漏致谢资助方 完整列出 PPMI 资助伙伴 违反 DUA 致谢条款
发表前未经 DPC 审阅 投稿前提交审阅(2 周窗) 违反出版政策
未回报衍生数据 向委员会提交新生成数据 影响后续申请资格

§10 AI 使用声明卡

§10.1 本页面使用的 AI 模型

环节 模型/工具 用途
资料检索 AI 搜索聚合工具 对官方站点、ClinicalTrials.gov、PubMed/期刊页与开放指南做事实检索与交叉核对
写作辅助 大语言模型(本页面作者代理) 结构组织、中文化行文与代码示例生成

§10.2 AI 参与范围

AI 参与了:检索结果的筛选与汇总、章节结构组织、初稿行文、代码示例编写。AI 未参与:医学事实的最终裁定、审核流程签发、对数据集内容的任何修改(本页面为百科条目,不改动数据集本身)。

范围边界说明:所有规模数字、队列构成、生物标志物数值、基准性能与流程描述均可在 §10.3 输入来源中找到对应出处;凡检索无法核实的字段一律省略而非估计;代码示例经过静态走查,但不保证在任意下载快照上直接运行(列名以 Data Dictionary 为准)。

§10.3 输入来源列表

  1. Marek K et al., 2011, Progress in Neurobiology 95(4):629-635. DOI: 10.1016/j.pneurobio.2011.09.005(PubMed: 21930184)
  2. Marek K et al., 2018, Annals of Clinical and Translational Neurology 5(12):1460-1477. DOI: 10.1002/acn3.644(PubMed: 30564614)
  3. Siderowf A et al., 2023, Lancet Neurology 22(5):407-417. DOI: 10.1016/S1474-4422(23)00109-6(PubMed: 37059509)
  4. PPMI 官方站点:https://www.ppmi-info.org
  5. PPMI Access Data 页面:https://www.ppmi-info.org/access-data-specimens/download-data
  6. PPMI FAQ:https://www.ppmi-info.org/help-and-resources/faqs
  7. PPMI Publication Policy:https://www.ppmi-info.org/sites/default/files/docs/ppmi-publication-policy.pdf
  8. ClinicalTrials.gov NCT04477785(PPMI 2.0 Clinical):https://clinicaltrials.gov/study/NCT04477785
  9. Data Community of Practice, Getting Started With Parkinson’s Disease Data v1, Zenodo, 2024:https://zenodo.org/records/11167238
  10. Atlas of Longitudinal Datasets — PPMI-PD 条目:https://atlaslongitudinaldatasets.ac.uk/datasets/ppmi-pd
  11. Stanford Mind Data Hub — PPMI 数据描述:https://stai.stanford.edu/data/199
  12. Hema MS et al., 2023, Multimedia Tools and Applications. DOI: 10.1007/s11042-023-15280-6
  13. Scientific Reports, 2023, 13:22426. DOI: 10.1038/s41598-023-49617-w
  14. Poojaa C, Alex JSR, 2023, arXiv:2304.09245
  15. Frontiers in Aging Neuroscience, 2023. DOI: 10.3389/fnagi.2023.1076657
  16. Semantic Scholar 引用统计:https://www.semanticscholar.org/paper/c17b1e8b3bfea4cfaa1414a853d31b9d3e50c6fc

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§0 审核声明与免责 千方病案医学编辑部 逐条比对金标准模板 ✅ 已通过
§1-§2 事实与医学背景 千方病案医学编辑部 对照 PubMed/官网原文核数字 ✅ 已通过
§3-§5 规格/结构/划分 数据工程审核(编辑部委派) 对照官方 Access Data/FAQ 核流程 ✅ 已通过
§6 代码与坑点 数据工程审核(编辑部委派) 代码静态走查 + 坑点溯源核对 ✅ 已通过
§7-§8 质量/基准 千方病案医学编辑部 DAIMS 逐项核对 + 引用完整性 ✅ 已通过
frontmatter 与 JSON-LD 千方病案医学编辑部 Schema 一致性与 URL 占位校验 ✅ 已通过

§10.5 AI 生成章节标注

本页面全部章节由 AI 辅助生成初稿,经 §10.4 所列人工审核流程逐模块核验后发布;事实性内容以 §10.3 输入来源为准。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集