信息速览

ROS/MAP — 老化与阿尔茨海默病纵向多组学队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ROS/MAP(ROSMAP) |
| 英文全称 | Religious Orders Study and Memory and Aging Project |
| 别名/简称 | ROSMAP、ROS+MAP、Religious Orders Study / Rush Memory and Aging Project |
| 疾病分类 | 阿尔茨海默病与认知衰老全谱系(ICD-11:6D85 阿尔茨海默病 / 6D86 痴呆 / 6D87 轻度神经认知障碍,详见 §2.1) |
| SNOMED CT | 26929004 Alzheimer’s disease / 61854002 Mild cognitive impairment / 52448006 Dementia(详见 §2.1) |
| 数据模态 | 纵向临床认知评估(21 项测验)、死后脑神经病理定量、基因组(基因分型/WGS)、转录组(bulk RNA-seq/单核 RNA-seq/miRNA)、表观组(DNA 甲基化/ChIP-seq)、蛋白组(TMT)、代谢组 |
| AI 任务类型 | 认知衰退(斜率)预测、病理 AD 分类、临床-病理不一致建模、xQTL 与 GWAS 共定位、多组学整合、单细胞细胞类型解析、药物靶点发现 |
| 样本总数 | 截至 2017-10:3,322 名入组者 / 1,702 名死亡 / 1,475 例脑尸检 / 458 人具备全部组学层;截至 2018-03:入组超 3,500 人、2,093 人已基因分型 |
| 数据格式 | TSV/CSV(表达矩阵与元数据)、IDAT(甲基化)、BAM/CRAM(测序)、H5AD/MTX(单细胞) |
| 许可证 | AD Knowledge Portal Data Use Agreement(general research use) |
| 访问级别 | 申请审核(Synapse 账号 + Data Use Certificate,与 Rush University Medical Center 或 SAGE 签署) |
| DUO 标签 | GRU(general research use) |
| 语言 | 英文 |
| 首发日期 | 1994 年(ROS 启动)/ 1997 年(MAP 启动) |
| 最后更新 | 持续进行中(截至 2018-03 入组超 3,500 人;2023-10 单核多组学数据上架) |
| 发布机构 | 拉什大学医学中心拉什阿尔茨海默病中心(RADC);PI:David A. Bennett |
| 官方主页 | AD Knowledge Portal — ROSMAP |
| 下载地址 | Synapse study syn3219045;组织/数据附加请求经 RADC Resource Sharing Hub |
| DOI | 10.1038/sdata.2018.142(数据描述论文)/ 10.7303/syn3219045(Synapse 数据集) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 元数据极其丰富、多组学层数字齐全、ComBat 处理版本可用;扣分项:受控访问需 DUC、bulk RNA-seq 仅提供 FPKM 而非原始 counts、无官方机器学习划分、跨组学个体 ID 对接需手工桥接 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、认知测验体系与神经病理金标准定义、队列人群统计)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(多组学个体 ID 桥接、纵向评估结构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-13
审核方式:交叉审核
利益冲突声明:千方病案医数集与拉什大学医学中心、拉什阿尔茨海默病中心、Synapse/SAGE 及 AMP-AD 计划无任何商业利益关联。本页面不销售 ROS/MAP 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述任何机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ROS/MAP 数据经 Synapse AD Knowledge Portal 以受控访问方式开放,使用者须注册 Synapse 账号并签署 Data Use Certificate(可与 Rush University Medical Center 或 SAGE 签署),数据按 general research use 条款提供并附署名要求。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
ROS/MAP 是拉什大学医学中心拉什阿尔茨海默病中心(RADC)主导的两条合并分析的纵向队列:Religious Orders Study(ROS)自 1994 年起招募全美 40 余个修会团体的修女、神父与修士,Rush Memory and Aging Project(MAP)自 1997 年起招募伊利诺伊州东北部持续照料退休社区的普通老人。两条队列共用同一套评估与病理方案,设计上就是为了合并分析,社区统称 ROSMAP。
它为什么重要:入组者在每年一次的随访中接受 21 项认知测验,去世后把大脑捐出来做结构化神经病理检查(尸检率超过 86%)——这意味着每个个体的「生前认知轨迹」和「死后脑内真实病理」被完整配对。截至 2017-10,队列已入组 3,322 人、完成 1,475 例脑尸检,平均死亡年龄 88.8 岁,堪称人类老化与痴呆研究的「黄金标本库」。
你能用它做什么:训练认知衰退预测模型(主性状是每个人自己的认知斜率)、做临床诊断与脑内病理不一致的机制研究、跑基因组到蛋白组的 xQTL 共定位寻找药物靶点、整合多组学做阿尔茨海默病的分子分型。它是 AMP-AD 计划的核心队列,数据经 Synapse AD Knowledge Portal 免费受控开放——你只需要一份 Data Use Certificate。
§1.1 摘要
ROS/MAP 采用「前瞻性纵向临床评估 + 死后脑捐赠 + 多组学生物标志物」的三层设计。入组时所有参与者均无痴呆征象,签署 Anatomic Gift Act 脑捐赠协议与数据再利用的 repository consent,此后每年在拉什大学接受包括 21 项认知测验在内的年度临床评估;认知分数合成 Global Cognitive Score 及情景记忆、语义记忆、工作记忆、知觉速度、视空间 5 个认知域,主分析性状为线性混合模型估计的个体 Global Cognitive Slope。去世后,脑组织按 NIA-Reagan、改良 CERAD 与 Braak 分期做结构化神经病理判定,并在 8 个脑区对 Aβ 与 tau 做图像立体测量定量。组学层面,截至 De Jager 等 2018 年的数据描述论文:全基因组基因分型 n=2,090、WGS n=1,179、DNA 甲基化 n=740、ChIP-seq H3K9ac n=712、miRNA n=702、DLPFC bulk RNA-seq n=638;此后又追加 TMT 蛋白组(596 样本)与两个实验室的 DLPFC 单核 RNA-seq/snATAC 数据(MIT 约 427 名、Columbia 约 424 名捐赠者)。截至 2017-10 有 458 人具备全部组学层。数据经 Synapse AD Knowledge Portal(study syn3219045)受控开放,是 AMP-AD Target Discovery Program 的核心队列资源。
§1.2 战略价值分析
临床-病理配对维度:绝大多数阿尔茨海默病数据集要么只有生前临床诊断、要么只有死后病理,ROS/MAP 把同一批人的三十年纵向认知轨迹与死后定量神经病理完整配对,且尸检率超过 86%——这意味着样本选择偏倚远小于普通尸检系列。它因此成为研究「临床-病理不一致」的世界级资源:截至 2017-10,队列里有 95 人达到临床 AD 诊断却无病理 AD,另有 174 人认知完全正常却携带充分病理 AD。这两个数字本身就是 AD 领域最深刻的问题之一——为什么有人带病理而不痴呆——的原始证据,也是任何试图把「脑内病理」映射到「认知结局」的模型必须面对的基准事实。
多组学深度与生态位维度:ROS/MAP 是 AMP-AD 计划中组学层级最完整的队列之一:从基因分型、WGS、甲基化、ChIP-seq、miRNA、bulk RNA-seq 到 TMT 蛋白组与单核 RNA-seq,同一批逝者的同一块脑区(DLPFC)被反复测量。这种「同一人群、多组学、有病理表型」的结构,使它成为 GWAS→eQTL/pQTL→共定位→靶点验证这条药物发现流水线的事实标准数据源:近年的 xQTL 社区(如 Columbia 与 MIT 联合维护的分析手册)以 ROSMAP 作为旗舰示例,其 snRNA-seq 伪批量矩阵与 QTL 结果已成为 AD 靶点共定位分析的开箱即用输入。对 AI 研究者而言,它还提供了罕见的「个体级多组学 + 纵向临床结局」配对,可直接支撑多模态融合与生存分析的建模研究。
把两个维度合起来看,ROS/MAP 在数据集版图上的位置可以概括为一句话:它不是最大的 AD 数据集,却是把「人生轨迹、脑内真相、分子图谱」三件事对齐到同一个人身上的最完整尝试——需要规模请找 UK Biobank,需要影像请找 ADNI,但需要「同一人从认知到分子到病理的完整链条」,ROS/MAP 仍是第一候选。
§1.3 同类数据集横向对比
| 数据集 | 队列类型 | 规模(有来源口径) | 模态 | 标注/表型 | 与 ROS/MAP 的差异化 |
|---|---|---|---|---|---|
| ROS/MAP | 两条合并纵向队列(修士+社区老人) | 3,322 入组 / 1,475 例尸检(截至 2017-10) | 年度认知测验 + 神经病理 + 基因分型/WGS/甲基化/ChIP-seq/miRNA/RNA-seq/TMT 蛋白组/单核 | 认知斜率 + NIA-Reagan/改良 CERAD/Braak + 8 脑区 Aβ/tau 定量 | 组学层最全、临床-病理配对最深、尸检率 >86% |
| MSBB(Mount Sinai Brain Bank) | 尸检脑库(syn3159438) | 详见门户 | bulk RNA-seq 等 + 病理 | 病理分期为主 | 缺少像 ROS/MAP 这样的前瞻性年度认知轨迹;AMP-AD 同门队列 |
| MayoRNAseq(Mayo Clinic) | 尸检脑库 | 详见门户 | bulk RNA-seq + 病理 | 病理确诊 AD/PSP/CBD | 病例-对照式尸检设计,无纵向认知随访 |
| ADNI | 纵向影像队列 | 详见官网 | MRI/PET/脑脊液/基因分型 | 临床诊断 + 影像生物标志物 | 以活体影像为核心,无死后脑多组学;人群更年轻 |
| UK Biobank | 人群队列 | 约 50 万人(官方口径) | 影像/EHR/基因分型 | 广谱表型 | 规模巨大但老化脑特异组学浅;AD 特异性不如 ROS/MAP |
对比表中的「详见门户/官网」表示本文不引用未核实数字;引用他库规模请以各自官方页面为准。
§1.4 版本时间轴
| 时间 | 里程碑 | 说明 |
|---|---|---|
| 1994 年 | ROS 启动 | 招募全美 40 余个修会团体的修女/神父/修士,入组需无痴呆征象 |
| 1997 年 | MAP 启动 | 从伊利诺伊州东北部持续照料退休社区招募社区老人,方案与 ROS 对齐以便合并分析 |
| 2012 年 | Bennett 设计论文 | Curr Alzheimer Res 9(6):628-645 系统描述两条队列设计 |
| 2017-10-08 | 队列快照 | 3,322 人入组(72.7% 女性)、1,702 人死亡、1,475 例脑尸检、尸检率 >86%、458 人全组学层、平均死亡年龄 88.8 岁 |
| 2018-03 | 队列快照 | 合计入组超过 3,500 人,2,093 人完成基因分型 |
| 2018 年 | 多组学 atlas 论文 | De Jager 等 Scientific Data 5:180142 发布各组学层样本量与获取方式 |
| 2018-2023 年 | 组学层持续扩容 | TMT 蛋白组(596 样本)、MIT/Columbia 两个单核 RNA-seq 数据集、snATAC 多组学等相继上架 Synapse |
| 至今 | 持续随访与上架 | 两条队列仍在入组与随访,数据经 AD Knowledge Portal 持续更新 |
§1.5 典型应用场景
- 认知衰退预测:以年度认知测验纵向数据建模个体认知斜率,融合基因/甲基化/蛋白组特征做早期风险分层。
- 临床-病理不一致机制研究:利用 95 例临床 AD 无病理 AD、174 例认知正常有病理 AD 的天然对照组,寻找认知弹性(resilience)的分子基础。
- xQTL 与药物靶点共定位:用 ROSMAP 的 eQTL/pQTL/mQTL 与 AD GWAS 统计量做共定位,是 AMP-AD 生态的标准靶点发现流水线。
- 单细胞分辨率 AD 解析:基于 MIT/Columbia 两个 DLPFC 单核 RNA-seq 数据集做细胞类型比例与细胞状态建模,关联 Braak 期与认知斜率。
- 多组学整合方法学基准:同批个体、同块脑区的多组学配对结构,是检验 MOFA+、DIABLO、多模态深度学习等方法的标准测试场。
场景选择的共同前提是明确「你的标签在哪一层」:场景 1-2 的标签在临床/病理层,场景 3 的标签在分子层(QTL),场景 4-5 的「标签」实为无监督结构。同一份 ROS/MAP 数据在不同场景下对应的有效样本量、划分方式与评价指标完全不同——这正是本页面用一整个 §5 和 §6.5 讲清结构的原因。
上手顺序建议:新手从场景 1(认知建模,临床元数据层)入门,两周内可以跑通端到端;场景 3-5 需要先完成 §6.1-6.3 的数据接机与 ID 桥接,预留一个月的学习曲线。团队引入 ROS/MAP 时,第一个月的目标不是出模型,而是把 §5.3 的泄漏清单变成仓库里的自动化检查。
§2 医学背景
§2.1 疾病与术语编码映射表
ROS/MAP 覆盖的认知衰老与痴呆谱系在本百科采用 ICD-11 与 SNOMED CT 双映射。需要强调:ROS/MAP 的核心表型并非单纯的临床诊断编码,而是「定量神经病理 + 纵向认知」的组合,下表用于与外部 EHR/术语系统对接。
| 标签/术语 | ICD-11 编码 | ICD-11 中文名 | SNOMED CT 码 |
|---|---|---|---|
| 阿尔茨海默病 | 6D85 | 阿尔茨海默病 | 26929004 Alzheimer’s disease |
| 痴呆(综合征层) | 6D86 | 痴呆 | 52448006 Dementia |
| 轻度神经认知障碍/MCI | 6D87 | 轻度神经认知障碍 | 61854002 Mild cognitive impairment |
| 血管性痴呆(鉴别诊断) | 6D81 | 血管性痴呆 | 29079001 Vascular dementia(详见门户病理元数据) |
注:ROS/MAP 原始数据使用研究自有编码(认知测验得分、病理分期),上表仅为跨系统对接提供术语桥梁;具体变量编码以门户元数据页为准。
对接实操的三个提醒:其一,队列内的「痴呆/正常」判定是研究流程定义的年度状态,与 ICD-11 的疾病分类不是一对一关系,映射时应映射「状态」而非「人」;其二,同一参与者不同年份可能跨状态(如正常→MCI→痴呆),以 EHR 编码回溯 ROS/MAP 个体时需锁定评估年份;其三,ICD-11 的 6D87(轻度神经认知障碍)与队列内的 MCI 判定在操作定义上有差异,跨库对接时优先使用各库自有的操作性定义并在论文中说明。
§2.2 疾病简介与流行病学要点
阿尔茨海默病(AD)以 β-淀粉样斑块沉积与神经原纤维缠结(tau)为核心病理特征,临床表现为渐进性记忆与认知功能下降。ROS/MAP 对 AD 的独特贡献在于用定量方法刻画病理:尸检时在 8 个脑区(海马、内嗅皮层、前扣带回、中额回、额上回、颞下回、角回、距状皮层)对 Aβ 与 tau 染色切片做图像立体测量,而不是只给一个「有/无」的定性判断。
理解 ROS/MAP 的表型体系需要先理解三套神经病理分期,它们从不同角度刻画同一块脑组织:
- NIA-Reagan 标准:综合斑块与缠结负荷给出 AD 病理诊断的「likelihood」分级(低/中/高),是病理层最接近「AD 诊断」的标签。
- 改良 CERAD 评分:以神经炎斑块密度为中心的半定量分级(从无到频繁四级),偏重老年斑负荷。
- Braak 分期:按神经原纤维缠结在脑内的解剖扩散顺序分期(I-VI),刻画 tau 病理的空间进展。
三者互不相同又高度相关——用哪个作为「病理 AD」标签,是每篇 ROS/MAP 论文必须显式声明的第一件事(见坑点 3)。定量病理层则把三者的「等级」换成「密度」,支持更精细的剂量-反应建模。
队列内的几个流行病学锚点(均有文献来源):
- 截至 2017-10,入组 3,322 人中 72.7% 为女性,平均死亡年龄 88.8 岁——这是一个超高龄队列,去世前的共存疾病与药物暴露谱远比年轻队列复杂。
- 某 ROSMAP 单细胞/转录组研究的亚队列中 61% 符合 NIA-Reagan 病理 AD 标准(平均年龄约 88 岁,64% 女性),说明队列病理负荷接近「半数阳性」,对二分类建模既非极端不平衡也非天然平衡。
- 临床-病理不一致规模可观:95 人达到临床 AD 诊断标准却无病理 AD,174 人认知未受损却有充分病理 AD(截至 2017-10)。这一现象是队列被反复引用的核心原因之一。
认知测量的合成逻辑也值得入门前了解:每年 21 项测验先换算为 z 分,再合成 Global Cognitive Score 与 5 个认知域分数,纵向建模时用线性混合模型为每人估计一条「认知轨迹斜率」。这个设计把「认知老化」从横断面比较升级为个体内轨迹建模,也决定了任何以 ROS/MAP 做机器学习的研究,其标签工程都要从理解这套合成规则开始。
§2.3 临床任务定义
| 任务 | 输入 | 输出 | 在 ROS/MAP 中的定义 |
|---|---|---|---|
| 认知衰退预测 | 基线组学/人口学/早期随访 | 认知斜率(Global Cognitive Slope) | 线性混合模型估计的个体年化 z 分变化;队列主分析性状 |
| 病理 AD 分类 | 组学/认知特征 | NIA-Reagan(低/中/高likelihood) | 死后神经病理判定,三档有序 |
| 病理负荷分级 | 组学/影像替代物 | 改良 CERAD 斑块评分、Braak 期 | 有序分级(Braak I-VI) |
| 临床-病理不一致建模 | 全部生前数据 | 痴呆 是否伴随病理 AD | 95 例临床阳性/病理阴性、174 例临床阴性/病理阳性 |
| 靶点发现(xQTL) | GWAS 统计量 + 组学 QTL | 共定位基因/蛋白 | DLPFC eQTL/pQTL/mQTL 与 AD GWAS 共定位 |
| 细胞类型解析 | 单核 RNA-seq | 细胞比例/状态 | MIT(约 427 名)与 CUIMC(约 424 名)两个 DLPFC 数据集 |
任务间的标签关系值得强调:认知斜率是「连续、纵向、生前面向未来」的结局;病理分期是「有序、横断面、死后回顾」的金标准;xQTL 与细胞类型任务则是「机制层」的中间表型。三个层面通过个体主键连接,任何把跨层标签混用的做法都会破坏任务定义(见 §4.2 与坑点 3)。
§2.4 患者人群画像表
| 维度 | ROS | MAP | 来源口径 |
|---|---|---|---|
| 来源人群 | 全美 40 余个修会团体的修女/神父/修士 | 伊利诺伊州东北部持续照料退休社区老人 | De Jager 2018;门户研究页 |
| 启动年份 | 1994 年 | 1997 年 | 同上 |
| 入组标准 | 无痴呆征象 | 无痴呆征象 | 同上 |
| 性别构成 | 两队列合并 72.7% 女性(截至 2017-10) | 同左 | De Jager 2018 |
| 年龄特征 | 平均死亡年龄 88.8 岁(截至 2017-10 快照) | 同左 | 同上 |
| 种族/地理 | 以美国为主(修会团体遍布全美;MAP 集中于大芝加哥地区) | 同左 | 门户研究页 |
| 就医/随访类型 | 每年一次到院临床评估 + 死后尸检 | 同左 | Bennett 2018 |
该人群「生活方式相对同质、依从性极高、终身随访到死亡」,是 ROS/MAP 混杂控制的关键设计,但也限制了向普通社区人群的外推(详见 §7.1)。
§2.5 临床与科研价值
对临床研究者,ROS/MAP 提供了「生前可测」与「死后可验」的闭环:任何声称能预测 AD 的生物标志物或模型,都可以在这套数据上用尸检金标准来检验,而不是用临床上不够特异的诊断标签。对基础研究者,8 脑区定量病理 + 多组学的组合使得「病理如何被分子机制承载」这个问题第一次拥有了个体级分辨率。对药物研发者,AMP-AD 生态中的 xQTL 共定位流水线把 ROSMAP 组学作为默认输入,多个进入后续验证的 AD 靶点假设都依赖这套数据。对 AI 研究者,纵向认知斜率作为连续、个体化、噪声可量化的结局变量,比横断面二分类更能检验模型对「变化」的建模能力。
从队列设计方法论看,ROS/MAP 还提供了一个被反复复制的模式论证:修士/修女群体生活方式高度同质、无职业毒物暴露差异、依从性近乎完美,使得「年龄与遗传之外的环境混杂」被结构性压缩;MAP 加入社区老人则恢复了人群代表性。这种「内部效度 + 外部效度」的双队列互补设计,是它在同类脑库中长期保持参考地位的方法学根基。
§2.6 标注金标准表
| 表型 | 划分/分级体系 | 标注方式 | 标注者 | 性质 |
|---|---|---|---|---|
| AD 病理诊断 | NIA-Reagan 标准(低/中/高 likelihood) | 尸检组织学 + 免疫染色 | 拉什大学研究神经病理团队 | 死后金标准 |
| 斑块负荷 | 改良 CERAD 评分 | 半定量图像评估 | 同上 | 死后金标准 |
| 缠结负荷 | Braak 分期 | 组织学分期 | 同上 | 死后金标准 |
| 定量病理 | 8 脑区 Aβ/tau 图像立体测量 | 染色切片图像分析定量 | 研究团队方案化测量 | 死后定量 |
| 认知功能 | 19 项 ROS/MAP 共有测验 → Global Cognitive Score 与 5 认知域 | 每年当面测验 + z 分合成(以队列基线为参照) | 标准化心理测量流程 | 前瞻纵向 |
| 认知结局 | Global Cognitive Slope | 线性混合模型个体斜率 | 分析期统计推导 | 派生标签 |
与一般临床数据集的区别在于:ROS/MAP 的「金标准」不在生前而在死后。生前临床判定(正常/MCI/痴呆)在队列数据中只是中间变量;建模研究若以「脑内真实病理」为终点,应使用病理层标签;若以「可观察的临床状态」为终点,才使用临床层标签。这一区分贯穿本文全部任务定义与坑点。
§3 数据集规格
§3.0 数据层抉择矩阵
ROS/MAP 没有传统意义上的「版本号」,而是一个持续扩容的多组学实体集合。选择下载哪一层比选择版本更重要:
| 你的需求 | 推荐数据层 | 规模口径 | 理由 |
|---|---|---|---|
| 入门:认知衰退建模 | 临床元数据 + bulk RNA-seq(syn3388564) | RNA-seq n=638(De Jager 2018) | 表达矩阵单文件即开即用,协变量齐全 |
| 蛋白组/pQTL 研究 | TMT 蛋白组(syn17015098) | 596 样本、8,425 蛋白 | ADSP FGC xQTL 管线已产出处理版 |
| 单细胞分辨率 | MIT snRNA-seq/snATAC(syn52293417)+ CUIMC snRNA-seq(syn31512863) | 约 427 + 约 424 名捐赠者 | 两库合并需处理重叠 donor(见坑点 8) |
| 靶点共定位 | 基因分型(n=2,090)+ 各组学 QTL 汇总统计 | De Jager 2018 口径 | 优先用社区已发布的 QTL 结果省算力 |
| 表观机制 | 甲基化 IDAT(syn7357283)+ ChIP-seq H3K9ac(n=712) | n=740(甲基化) | IDAT 需自行标准化,算力需求较高 |
| 全基因组层面 | WGS(syn11707420) | n=1,179 | 受控访问,文件体量最大,建议用云端 Synapse 计算资源 |
§3.1 模态详情
| 模态 | 内容 | 采集/处理要点 | 来源支撑 |
|---|---|---|---|
| 年度临床认知评估 | 21 项认知测验,ROS/MAP 共有 19 项;合成 Global Cognitive Score 与 5 个认知域(情景记忆 7 项、语义记忆 3、工作记忆 3、知觉速度 2、视空间 2) | 每年一次到院评估;z 分以队列分布标准化 | De Jager 2018 |
| 神经病理 | NIA-Reagan、改良 CERAD、Braak 分期 + 8 脑区 Aβ/tau 立体测量定量 | 死后标准化取材与染色 | De Jager 2018;Wang 2020 |
| 基因分型 | 全基因组芯片,n=2,090(截至 2018-03 已分型 2,093 人) | 含前 3 基因分型 PC 用于祖先校正 | De Jager 2018;Bennett 2018 |
| WGS | n=1,179 | 受控访问实体 syn11707420 | De Jager 2018;社区文献 |
| DNA 甲基化 | n=740,IDAT 原始文件 | 受控访问实体 syn7357283;需自行归一化 | 同上 |
| ChIP-seq | H3K9ac,n=712 | DLPFC 组蛋白修饰谱 | De Jager 2018 |
| miRNA | n=702 | 小 RNA 测序 | 同上 |
| bulk RNA-seq | DLPFC,n=638;分发 FPKM 矩阵 | RIN>5 且 RNA≥5 µg 入选;RIN 分层池化建库;分发前经 quantile normalization + ComBat | De Jager 2018;Wang 2020 |
| TMT 蛋白组 | 596 样本、8,425 蛋白(raw);QTL 分析版约 7,712 蛋白 × 416 样本 | 50 批 × 8 样本;每批 2 个 pooled 参考通道;median polish 去技术方差;缺失≥50% 蛋白剔除;FDR<1% | xQTL 社区手册 |
| 单核 RNA-seq/snATAC | MIT 约 427 名(syn52293417)+ CUIMC 约 424 名(syn31512863)捐赠者;10x Genomics Chromium 平台,GRCh38 参照 | 两库部分 donor 重叠,合并需协调(见 §7.1) | xQTL 社区手册;Xiong 2023 |
| 代谢组 | 已列入门户数据类型 | 样本量口径见门户实体页 | 门户研究页 |
§3.2 按子集样本数表
| 子集 | 样本数 | 截至口径 | 备注 |
|---|---|---|---|
| 全队列入组 | 3,322 人 | 2017-10-08 | 72.7% 女性 |
| 全队列入组 | >3,500 人 | 2018-03 | 持续入组 |
| 死亡 | 1,702 人 | 2017-10-08 | — |
| 脑尸检 | 1,475 例 | 2017-10-08 | 尸检率 >86% |
| 全部组学层齐备 | 458 人 | 2017-10-08 | 建模时注意选择偏倚 |
| 基因分型 | 2,090 人 | De Jager 2018 | 2018-03 口径 2,093 人 |
| WGS | 1,179 人 | De Jager 2018 | — |
| DNA 甲基化 | 740 人 | De Jager 2018 | — |
| ChIP-seq H3K9ac | 712 人 | De Jager 2018 | — |
| miRNA | 702 人 | De Jager 2018 | — |
| bulk RNA-seq | 638 人 | De Jager 2018 | 某 RNA-seq 研究子集为 542 样本(540 脑,自 724 候选筛出) |
| TMT 蛋白组 | 596 样本 | xQTL 社区手册 | 8,425 蛋白(raw) |
| snRNA-seq(MIT) | 约 427 名捐赠者 | xQTL 社区手册 | syn52293417 |
| snRNA-seq(CUIMC) | 约 424 名捐赠者 | xQTL 社区手册 | syn31512863 |
§3.3 数据格式表
| 数据层 | 格式 | 说明 |
|---|---|---|
| 表达矩阵/元数据 | TSV、CSV | 如 ROSMAP_RNAseq_FPKM_gene.tsv(基因 × 样本 FPKM) |
| 甲基化 | IDAT | Illumina 原始信号,需 minfi 等工具处理 |
| 测序原始数据 | BAM/CRAM | WGS 等受控访问实体 |
| 单细胞 | MTX/H5AD 等门户分发格式 | MIT/CUIMC 两库均有伪批量矩阵发布 |
| 蛋白组 | CSV(log2 丰度矩阵) | TMT 处理版已归一化 |
§3.4 存储大小
ROS/MAP 数据按 Synapse 实体逐层分发,门户未公布统一的总大小口径,本文不引用未核实的体积数字。经验上:临床元数据与表达矩阵为 MB-GB 级,可本地处理;WGS BAM/CRAM 与单核原始文件为 TB 级,建议使用 Synapse 提供的云存储/计算或仅下载处理版矩阵。下载时以每个实体的 contentSize 字段为准。
规划磁盘时的实用策略:先下载全部 TSV/CSV 元数据与处理版矩阵(总量可控),完成 ID 桥接与任务定义后,再决定是否需要原始测序文件。绝大多数发表级分析(差异表达、QTL、机器学习建模)在处理版矩阵上即可完成,这也是 AMP-AD 社区「无发表禁运、中间结果共享」设计带来的实际便利。
§3.5 标注方式
- 认知标签:标准化心理测量(21 项测验)+ 统计合成(z 分 → composite → 混合模型斜率),全部规则化,无人工自由标注。
- 病理标签:结构化神经病理协议(NIA-Reagan/改良 CERAD/Braak)+ 图像立体测量定量,属「专家按协议判定 + 仪器化测量」混合模式。
- 组学数据:仪器产出 + 官方处理管线(FPKM、ComBat、TMT median polish 等),非人工标注。
§3.6 标注者资质与一致性
病理判定由拉什大学研究神经病理团队按统一协议完成,认知评估由培训后的年度随访团队按标准化流程实施。队列方案强调评估工具与病理判定体系在 ROS 与 MAP 两条队列间完全一致(19/21 项测验共有),这是两队列可合并分析的基础。观察者间一致性系数未在本文引用的公开材料中给出,此处不作数字声明。
对使用者的实际影响:由于判定协议在两队列间完全一致且由同一套机构执行,「队列来源」本身可以视为标注体系不变的证据;反过来,若把 ROS/MAP 与 MSBB/Mayo 等外部脑库的数据直接混合训练,病理判定协议的差异将成为新的标注偏倚源,混合前应做标签分布与定义的对齐审计。
§3.7 采集周期
- 临床评估:每年 1 次,1994 年(ROS)/ 1997 年(MAP)起至今,参与者随访直至死亡。
- 病理采集:死亡后即时取材,死后间隔(PMI)作为协变量记录。
- 组学生成:分期分批(如 TMT 蛋白组分 50 批;RNA-seq 按 RIN 分层池化建库),各层生成时间不同,下载时注意实体页的发布批次说明。
采集节奏对建模的直接影响有三点:其一,年度间隔意味着「认知变化」的分辨率是一年,更短时间尺度的波动(如急性谵妄)不在数据中;其二,组学只测一次(死亡时),因此多组学是「终点快照」,与生前轨迹的关系必须靠配对推断;其三,各层组学生成年代不同,跨层合并时要意识到「同一块脑、不同年代测」的技术代差。
§3.8 地域覆盖
美国本土:ROS 覆盖全美 40 余个修会团体(地理上分散),MAP 集中于伊利诺伊州东北部大芝加哥地区的持续照料退休社区。无国际站点。
§3.9 设备与平台规格
| 层 | 平台/参数 | 来源支撑 |
|---|---|---|
| bulk RNA-seq | Illumina HiSeq,101 bp 双端;链特异性 dUTP 建库 + poly-A 选择;深层参考样本约 150 M reads,常规目标约 50 M reads | Wang 2020 |
| 单核测序 | 10x Genomics Chromium;GRCh38 参照 | xQTL 社区手册 |
| TMT 蛋白组 | 串联质谱标签(TMT)等压标记质谱;Percolator 过滤 PSM 与肽段 FDR<1% | xQTL 社区手册 |
| 基因分型/WGS/甲基化/ChIP-seq/miRNA | 以门户各实体页声明的平台为准(本文不对未核实平台型号作数字声明) | 门户 |
§3.10 深度溯源链
个体参与者(签署 Anatomic Gift Act + repository consent)→ RADC 年度临床评估(21 项测验原始分)→ 死亡 → 尸检取材(8 脑区)→ 神经病理判定(NIA-Reagan/改良 CERAD/Braak)+ 组织分装 → 各组学实验(分批次)→ 官方处理管线(FPKM/ComBat/median polish 等)→ Synapse 实体(各层独立实体 ID)→ AD Knowledge Portal study syn3219045(DOI 10.7303/syn3219045)→ 描述论文 De Jager 2018(DOI 10.1038/sdata.2018.142)。每一环节均可在门户或论文中回溯;引用数据时门户要求同时引用研究与分析结果来源(Data Access 页的署名要求)。
§4 数据结构
§4.0 目录树
ROS/MAP 在 Synapse 上以实体树组织(每个实体有唯一 synID)。以下为典型下载视角的结构,实体 ID 均为门户公开 ID:
AD Knowledge Portal — Study syn3219045 (ROSMAP)
├── 元数据层(门户 Study Metadata / Data Access 页)
│ ├── 研究描述、资助号(U01AG046152、R01AG048015、R01AG061356、
│ │ R01AG15819、U01AG061359、P30AG10161 等)
│ ├── 各组学层发布论文 DOI(基因分型 10.1038/mp.2017.20、
│ │ 甲基化 10.1038/nn.3786、RNA-seq 10.1038/s41593-018-0154-9、
│ │ ChIP-seq 10.1038/s41593-018-0291-1、miRNA 10.1186/s13024-017-0191-y、
│ │ TMT 蛋白组 10.1126/sciadv.aaz9360)
│ └── 临床与病理变量字典(逐实体分发)
├── bulk 组学实体
│ ├── syn3388564 bulk RNA-seq(DLPFC)
│ │ └── ROSMAP_RNAseq_FPKM_gene.tsv (约 640 样本 × 55,889 基因,FPKM)
│ ├── syn17015098 TMT 蛋白组(DLPFC,50 批次)
│ ├── syn7357283 DNA 甲基化 IDAT(受控)
│ └── syn11707420 WGS 原始数据(受控)
├── 单核组学实体
│ ├── syn52293417 MIT/Kellis lab snRNA-seq + snATAC(约 427 名捐赠者)
│ └── syn31512863 CUIMC/De Jager lab snRNA-seq(约 424 名捐赠者)
├── 基因分型实体(n=2,090)与 ChIP-seq(n=712)、miRNA(n=702)、代谢组实体
└── 配套资源
├── RADC Resource Sharing Hub(radc.rush.edu,组织/数据附加请求)
└── UCSC Cell Browser(rosmap-ad-aging-brain.cells.ucsc.edu,单细胞在线浏览)
§4.1 DAIMS 字段字典(核心字段)
| 字段(语义) | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| 个体唯一标识 | Text/Integer | 每位参与者主键,跨组学层桥接依据 | 门户元数据主键 | 多组学对齐的主键 | 论文历史 ID 与门户 ID 可能不同,以元数据映射表为准 | 无 | 每人一行 |
| 来源队列(study index) | Binary | ROS 或 MAP | ROS | 批次协变量,建模必须纳入 | 无 | 无 | ROS/MAP |
| 随访年度年龄 | Float | 每次年度评估时年龄 | 88.8 为队列平均死亡年龄(2017-10 口径) | 时间轴建模、协变量 | 自报出生日期误差 | 无 | 高龄段为主 |
| Global Cognitive Score | Float | 19 项共有测验 z 分合成 | 连续值 | 主结局之一 | 练习效应、年度波动 | 无 | 连续 |
| 5 认知域分数 | Float | 情景记忆 7 项/语义 3/工作 3/知觉速度 2/视空间 2 | 连续值 | 域特异性建模 | 同上 | 无 | 连续 |
| Global Cognitive Slope | Float | 混合模型个体年化斜率 | 连续值 | 队列主分析性状 | 短随访个体噪声大(坑点 7) | 无 | 连续 |
| NIA-Reagan 判定 | Ordinal | AD 病理 likelihood | 低/中/高 | 病理金标准标签 | 病理医师间变异 | 无 | 三档 |
| 改良 CERAD 评分 | Ordinal | 斑块负荷 | 无→频繁四级 | 病理标签 | 同上 | 无 | 四档 |
| Braak 分期 | Ordinal | 缠结负荷分期 | I-VI | 病理标签 | 同上 | 无 | I-VI |
| 8 脑区 Aβ/tau 定量 | Float | 图像立体测量密度 | 连续值 | 定量病理建模 | 染色与图像分析批次 | 无 | ≥0 |
| RIN | Float | RNA 完整度 | 入选门槛 >5 | RNA-seq 质控协变量 | 平台依赖 | 无 | 连续(>5) |
| PMI | Float | 死亡后间隔 | 连续值 | 质控协变量 | 记录误差 | 无 | 连续 |
| FPKM 表达值 | Float | 55,889 基因 × 约 640 样本 | ≥0 | 转录组建模 | 已 ComBat,非 counts(坑点 1) | 无 | ≥0 |
| TMT 蛋白丰度 | Float | 8,425 蛋白 × 596 样本 | log2 中心化值 | 蛋白组建模 | 50 批 TMT 批次残余 | 缺失≥50% 蛋白已剔除(MNAR,坑点 6) | 连续 |
| 基因分型 PC | Float | 前 3 PC 代表祖先 | 连续值 | 群体结构校正 | — | 无 | 连续 |
字段字典的使用建议:把这张表当作「schema review」的起点而非终点——正式开工前,用门户元数据把每一行映射到具体列名,形成项目私有的字段映射文档(连同取值范围的实际 min/max)。本表刻意保留语义层描述而非硬编码列名,因为门户各实体的列名会随版本更新微调,语义层的映射文档比列名层的更耐久。
两张派生表也值得提前规划:其一,「个体 × 组学层覆盖矩阵」(哪些人有哪几层),多组学研究的第一张表;其二,「个体 × 标签层对照表」(临床判定 vs 病理判定并排),不一致研究的核心输入。这两张表都能在 1 小时内从元数据生成,却能让后续所有分析的地基清晰可见。
§4.2 标签分布
ROS/MAP 的表型体系不是单一列,而是三层结构:临床层(每年随访中的认知正常/MCI/痴呆判定,比例随队列老化动态变化,本文不引用未核实的横断面比例)、病理层(亚队列证据:某单细胞/转录组研究中 61% 符合 NIA-Reagan 病理 AD)、不一致层(95 例临床 AD 无病理 AD、174 例认知正常有病理 AD,截至 2017-10)。建模者应显式声明自己使用的是哪一层标签——三者互不相同,混淆是本项目最常见的方法学错误(见坑点 3)。
三层结构还隐含一个统计设计要点:病理层与不一致层标签只在尸检子集上有定义,而尸检子集相对全队列存在选择性(见 §7.1 幸存者偏倚)。因此「全队列临床建模」与「尸检子集病理建模」是两类不同的研究,样本量、外推范围与基线率都不同,综述比较两类研究结果时必须先对齐这一前提。
§4.3 关键统计速览
| 统计项 | 数值 | 口径 |
|---|---|---|
| 入组人数 | 3,322(72.7% 女性) | 截至 2017-10-08 |
| 死亡/尸检 | 1,702 / 1,475(尸检率 >86%) | 截至 2017-10-08 |
| 平均死亡年龄 | 88.8 岁 | 截至 2017-10-08 |
| 全组学层齐备 | 458 人 | 截至 2017-10-08 |
| 基因分型 | 2,090 人 | De Jager 2018(2018-03 口径 2,093) |
| 共有认知测验 | 19/21 项,5 个认知域 | De Jager 2018 |
| 临床-病理不一致 | 95 例 vs 174 例 | 截至 2017-10-08 |
| RNA-seq QC 通过率参考 | 542 样本入选(自 724 个候选,门槛 RIN>5 且 RNA≥5 µg) | Wang 2020 亚队列 |
| TMT 蛋白规模 | 8,425 蛋白(raw)→ 约 7,712(QTL 分析版)× 416 样本 | xQTL 社区手册 |
读表要点:从「入组 3,322」到「全组学层齐备 458」的漏斗损耗不是数据质量问题,而是「队列先于组学存在 + 各层分批铺开」的结构性结果。做单层建模时有效样本量以该层为准;做多组学融合时直接用 458 口径,不要用全队列数字夸大统计功效。
§4.4 数据层级
ROS/MAP 的层级是「人 → 年度随访 → 组学样本 → 脑区 → 细胞」:
参与者(唯一主键)
├── 年度随访 × N(21 项测验 → 合成分数 → 个体斜率)
└── 死亡后
├── 神经病理判定(NIA-Reagan / 改良 CERAD / Braak)
├── 8 脑区定量病理(Aβ/tau 密度)
└── 组学层(同一 DLPFC 区多层测量)
├── 基因分型 / WGS(每人一份)
├── 甲基化 / ChIP-seq / miRNA / bulk RNA-seq / TMT 蛋白(每人至多一份)
└── 单核 RNA-seq(MIT / CUIMC 两库,每人一份或重叠)
关键含义:同一参与者在不同数据层以不同样本 ID 出现,合并多组学必须经门户元数据的个体主键桥接(见坑点 4)。
把层级关系翻译成数据操作:纵向层(临床)与死亡后层(病理 + 组学)的连接键是「个体」,组学层之间的连接键也是「个体」,而组学层内部还有第二级键(样本/文库)。因此任何 join 操作都应声明发生在哪一级——按个体 join 会膨胀行数(一对多),按样本 join 则要求桥接表先行。把这两级键画进项目的数据流图,是团队协作中最值得的前期投入。实际操作中还有第三类「隐性层级」:单核数据内部是 donor → 样本 → 细胞三层,伪批量聚合时聚合到哪一层(donor×细胞类型是最常用粒度)直接决定后续 QTL 分析的自由度,这一选择没有对错但必须在方法学声明中固定下来。
§4.5 缺失值与信息性缺失
| 缺失类型 | 表现 | 处理建议 |
|---|---|---|
| 组学层结构性缺失 | 仅 458 人(2017-10 口径)全层齐备;WGS(1,179)、甲基化(740)等层人数递减 | 按研究问题选层,避免「多组学 = 全员齐全」的错觉;对层缺失做敏感性分析 |
| TMT 蛋白缺失 | 低丰度蛋白系统性缺失(MNAR);缺失≥50% 的蛋白已在发布版剔除 | 禁止简单均值填补;用 MNAR 感知方法或建模缺失指示变量 |
| 随访长度差异 | 个体随访次数不同,斜率估计精度不同 | 用斜率标准误加权或做灵敏度分析(坑点 7) |
| 病理与组学重叠不全 | 组学样本未必都有完整病理定量 | 合并前以个体主键取交集并报告损失 |
| 临床量表缺失 | 年度评估存在漏访与个别测验缺失 | 合成分数已按协议处理;自行建模时勿把漏访当作随机 |
补充一个常被忽视的细节:ROS/MAP 的组学层以「死亡时点」为锚,而认知轨迹贯穿整个余生。把组学当「预测因子」去预测「更早年份的认知」属于时序倒置;合理的使用方式是组学解释或预测「死亡前最后若干年的下降速度」或「病理负荷」,这一点在设置任务时必须想清楚。
§5 划分与使用建议
§5.1 官方划分
ROS/MAP 是分析型队列数据集,没有官方机器学习 train/test 划分——这与影像竞赛数据集根本不同。官方提供的是全体入组者与全部测量,由研究者自行定义研究人群与划分。任何论文声称的「官方划分」都不存在,复现时应以原文的人群纳入条件为准。
「没有官方划分」带来的复现事实:同一篇论文的数字,其他团队往往无法精确复现,因为人群筛选(如是否限定尸检样本、是否限定某组学层齐备者)、划分随机种子、协变量口径三者中任何一个不同都会改变结果。负责任的做法是把自己的纳入条件写成代码随论文发布,而不是引用他人论文的样本量当作可比对象。
§5.2 社区惯例划分
社区常见做法(源自已发表分析模式):
- 按个体(donor/projid)划分:所有以人为最小单元的模型必须按参与者划分,严禁按行(年度随访记录)随机划分——后者会把同一人的相邻年份分进 train 与 test,造成近乎完美的假精度(见坑点 5)。
- 分层依据:以病理标签(如 NIA-Reagan 档位)或认知斜率三分位分层,保持标签分布一致。
- 两队列交叉:因 ROS/MAP 天然含 ROS 与 MAP 两条队列,一个经典稳健性检验是「train on ROS, test on MAP」或反之,检验跨队列泛化(study index 必须作为协变量,见坑点 1)。
- 纵向时间切分:以随访年份切分(早期年份训练、晚期年份测试)适合评估模型的时间外推能力。
三种惯例的选择与任务时间尺度相关:横断面分类用个体分层划分即可;预测「未来下降」的纵向模型必须用时间切分(否则用了未来信息);机制解释类分析(如差异表达)则不需要划分,但需要全量样本上的多重检验校正。三者的评估语义完全不同,混用表格是同类论文比较中常见的错位来源。
§5.3 泄漏风险清单(重点)
| 风险 | 机制 | 缓解 |
|---|---|---|
| 个体内重复测量泄漏 | 同一人多年记录进入 train 与 test | 一律按个体划分(GroupShuffleSplit / GroupKFold) |
| 跨组学层泄漏 | 同一人的基因型在 train、其表达/蛋白在 test | 划分以个体主键为组键,跨层一致 |
| 斜率标签泄漏 | 用全部随访数据估计斜率后又用部分随访数据做特征 | 特征只用基线或截断时点前数据;标签用截断后数据估计 |
| 预处理泄漏 | ComBat/z 分标准化在全数据上拟合 | 标准化参数只在 train 折内估计 |
| 两库单细胞重叠 donor | MIT 与 CUIMC 数据集共享部分捐赠者 | 合并后按 donor 去重再划分(坑点 8) |
§5.4 交叉验证与外部验证建议
- 交叉验证:按个体分组的 5 折 GroupKFold;对斜率回归任务,报告每折 MAE 与折间标准差。
- 内部交叉验证:ROS↔MAP 互测是最低成本的外推检验。
- 外部验证:AMP-AD 生态内的 MSBB(syn3159438)与 MayoRNAseq 提供独立脑库;ADNI 提供活体影像独立人群。跨库时注意脑区、平台与人群构成的系统性差异(详见 §7.8 外部验证矩阵)。
一个实操提醒:ROS/MAP 的组学层人数不平衡(基因分型 2,090 → 蛋白组 596 → 单核约 850 名捐赠者),交叉验证的设计必须随「最大特征集的交集样本」调整——先取各层主键交集得到有效建模人群,再在这个人群上做组键划分,避免在「理论样本量」上做功效计算。对斜率任务,还应检查每折内随访年数分布是否均衡;若某折集中了大量短随访个体,该折的标签噪声会系统性抬高误差,此时应改用分层分组划分(按随访次数分箱分层)。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
ROS/MAP 的 WGS 与单核原始数据体量大,官方推荐两条云端路径:
- Synapse 云执行:数据留在 Synapse,用其 Python API 定向拉取所需实体(见 §6.1),或使用门户支持的 Terra/Sage Bionetworks 云工作空间,避免 TB 级下载。
- 只下处理版:表达矩阵(syn3388564)、蛋白组(syn17015098)与社区维护的伪批量矩阵为 MB-GB 级,本地即可完成绝大多数建模任务。
云端与本地之间的一条分界经验:凡是「矩阵进、矩阵出」的分析(表达处理、建模、QTL 扫描的输入准备)本地完成;凡是「文件进、文件出」的处理(BAM 比对、单核定量)放到云端。ROS/MAP 官方与社区几乎已经把「文件级」处理做完并发布,云端方案主要是给需要重新定量的少数研究者准备的。
§6.1 快速上手
下面的代码假设你已完成 Data Use Certificate 签署,并在环境变量中配置了 Synapse 凭证。最小可用子集 = bulk RNA-seq 表达矩阵 + 临床/病理元数据两张表。
上手路径的设计逻辑:先跑通「一行矩阵」(表达矩阵),再接入「一人多行」的纵向结构(临床元数据),最后才考虑跨组学合并——这个顺序与数据的结构难度一致,也是排查问题最快的学习曲线。如果你是新团队接手这套数据,建议把本节到 §6.3 的代码完整跑一遍当作「数据接机」流程。
# 目录结构预期(下载后):
# data/
# ├── ROSMAP_RNAseq_FPKM_gene.tsv # 来自 syn3388564,行=基因,列=RNA-seq 样本 ID
# └── ROSMAP_metadata.csv # 门户元数据:个体主键、年龄、性别、RIN、
# # PMI、study(ROS/MAP)、病理与认知标签
# data_root 拼接关系:所有路径基于 data_root = "data/"
# 最小可用子集:FPKM 矩阵 + 元数据即可跑通本节全部示例
import os
import pandas as pd
# pip install synapseclient (需要 Synapse 账号,且已获 ROSMAP 受控访问权)
from synapseclient import Synapse
syn = Synapse()
syn.login() # 首次使用会引导交互式登录,或用 authToken 环境变量
data_root = "data/"
os.makedirs(data_root, exist_ok=True)
# 拉取 bulk RNA-seq 实体(syn3388564)
syn.get("syn3388564", downloadLocation=data_root)
# 读取 FPKM 矩阵:行 = 基因(55,889),列 = RNA-seq 样本
fpkm = pd.read_csv(
os.path.join(data_root, "ROSMAP_RNAseq_FPKM_gene.tsv"),
sep="\t", index_col=0
)
print(fpkm.shape) # 约 (55889, 640):基因为行,样本为列
# 元数据中的 RIN、PMI、study(ROS/MAP)、年龄等列用于后续协变量校正
§6.2 数据获取流程
| 步骤 | 操作 | 说明 |
|---|---|---|
| 1. 注册 | 在 adknowledgeportal.synapse.org 注册 Synapse 账号 | 实名 + 机构信息 |
| 2. 签署 DUC | 在 Data Access 页接受 Data Use Certificate/Agreement | 可与 Rush University Medical Center 或 SAGE 签署;一般研究用途即时或快速审批 |
| 3. 下载 | 网页逐实体下载,或 synapse get syn3388564 命令行/Python API |
命令行工具:pip install synapseclient |
| 4. 附加请求 | 组织切片等实物资源经 RADC Resource Sharing Hub | 非数据层资源 |
| 5. 署名 | 发表时按门户要求引用研究与分析来源 | 二级使用无发表禁运,但署名要求强制 |
流程总量评估:从注册到拿到第一份表达矩阵,顺利情况下当天即可完成(DUC 为一般研究用途设计、在线签署);瓶颈通常不在审批而在后续的 ID 桥接与元数据理解——这也是本页面把大量篇幅放在 §4 结构与 §6.5 坑点上的原因。
# 命令行方式下载三个常用实体(需先完成 DUC)
pip install synapseclient
synapse get syn3388564 # bulk RNA-seq FPKM
synapse get syn17015098 # TMT 蛋白组
synapse get syn52293417 # MIT snRNA-seq/snATAC
申请环节的常见疑问:DUC 审批为一般研究用途设计,多数学术申请可自助完成;与企业机构合作或涉及商业用途时,按门户 Data Access 页的具体条款执行。签署后同一账号可访问该门户下其他研究(如 MSBB),但每个研究仍需在门户内单独接受其数据使用条件。任何情况下,下载数据不得转存共享给未签约第三方——这是 DUC 的核心限制。
§6.3 预处理全流程
ROS/MAP 的预处理核心不是「从零清洗」,而是「在官方已处理数据上做正确的二次处理」。三个关键动作:低表达过滤、log2 变换、批次与协变量校正。
import numpy as np
import pandas as pd
# ---- 步骤 1:低表达过滤 ----
# 社区常用口径:FPKM>2 的样本占比 >80% 才保留该基因
# (严格版教程过滤后约 640 样本 × 11,304 基因;官方口径平均 FPKM>1 保留 13,153 基因)
expr = fpkm.copy()
expressed = (expr > 2).sum(axis=1) > 0.8 * expr.shape[1]
expr = expr.loc[expressed]
# ---- 步骤 2:log2(FPKM+1) 变换,稳定方差 ----
expr_log = np.log2(expr + 1)
# ---- 步骤 3:样本与元数据对齐(按个体主键桥接,见坑点 4)----
meta = pd.read_csv(os.path.join(data_root, "ROSMAP_metadata.csv"), index_col=0)
common = meta.index.intersection(expr_log.columns)
expr_log = expr_log[common]
meta = meta.loc[common]
assert expr_log.shape[1] == meta.shape[0], "样本-元数据未对齐"
# ---- 步骤 4:ComBat 去批次 ----
# 协变量回归口径(官方论文口径):年龄、性别、RIN、核糖体碱基比例、
# 比对 reads 数、study index(ROS/MAP)、PMI + 3 个基因分型 PC
# pip install neuroCombat
from neuroCombat import neuroCombat
batch_col = "study" # ROS/MAP 作为批次轴
covars = meta[["study", "age_death", "sex", "RIN", "PMI"]].copy()
covars[batch_col] = covars[batch_col].astype(str)
data = expr_log.T.values # neuroCombat 期望 样本 × 基因
combat_out = neuroCombat(
dat=data,
covars=covars,
batch_col=batch_col,
continuous_cols=["age_death", "RIN", "PMI"],
)
expr_corrected = pd.DataFrame(
combat_out["data"].T, # 还原为 基因 × 样本
index=expr_log.index,
columns=expr_log.columns,
)
# ---- 步骤 5:验证批次已消除(按 study 分组的均值差应大幅缩小)----
before = expr_log.mean(axis=0).groupby(meta[batch_col]).mean()
after = expr_corrected.mean(axis=0).groupby(meta[batch_col]).mean()
print("校正前后两队列均值差:", abs(before.diff()).sum(), "→", abs(after.diff()).sum())
注意:官方发布的 RNA-seq 矩阵在分发前已做过一次 quantile normalization + ComBat(Wang 2020 口径)。上述二次校正用于你自己的批次轴(如建库批、年份);不要对已 ComBat 的数据再无限次套 ComBat,过度校正会抹掉真实生物学信号。
合并多组学前还应做一次跨层一致性校验(性别交叉检查是其中最便宜有效的一项):
# ---- 步骤 6:跨层一致性校验(性别推断,防样本错配,见坑点 4)----
# RPS4Y1(Y 染色体)与 XIST(X 染色体失活)的表达可推断样本性别:
# 男性样本:RPS4Y1 高 / XIST 低;女性样本:RPS4Y1 近零 / XIST 高
def infer_sex(expr_log, xist="XIST", ygene="RPS4Y1"):
x = expr_log.loc[xist] if xist in expr_log.index else None
y = expr_log.loc[ygene] if ygene in expr_log.index else None
if x is None or y is None:
raise KeyError("XIST/RPS4Y1 不在矩阵中:请确认基因 ID 类型(Ensembl/Symbol)")
# 简单二分:以两基因表达的相对大小划男女(正式分析可用 SVM)
return (y > x).map({True: "M", False: "F"})
predicted = infer_sex(expr_log)
mismatch = predicted != meta["sex"]
print(f"性别不一致样本数:{mismatch.sum()}")
if mismatch.sum() > 0:
print(meta.loc[mismatch, ["sex"]].assign(predicted=predicted[mismatch]))
# 一致性校验失败的样本应剔除或回溯 ID 映射,禁止静默保留
§6.4 PyTorch Dataset 与 DataLoader
以「基因表达 + 协变量 → 认知斜率回归」为例,完整可运行骨架:
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
class ROSMAPDataset(Dataset):
"""表达矩阵 + 协变量 → 认知斜率。
关键设计:所有划分以个体主键为组(group),保证同一人的
全部数据只出现在一个子集中(防泄漏,见坑点 5)。
"""
def __init__(self, expr_df, meta_df, feature_genes=None):
# feature_genes: 训练折内选出的基因列表(防特征选择泄漏)
genes = feature_genes if feature_genes is not None else expr_df.index
self.X_expr = torch.tensor(
expr_log.loc[genes, expr_df.columns].T.values, dtype=torch.float32
)
cov = meta_df[["age_death", "sex", "RIN", "PMI"]].copy()
cov["sex"] = (cov["sex"] == "F").astype(float)
cov = (cov - cov.mean()) / (cov.std() + 1e-8)
self.X_cov = torch.tensor(cov.values, dtype=torch.float32)
self.y = torch.tensor(
meta_df["cognitive_slope"].values, dtype=torch.float32
)
def __len__(self):
return len(self.y)
def __getitem__(self, idx):
return self.X_expr[idx], self.X_cov[idx], self.y[idx]
# 按个体划分(此处每人一条聚合记录;若用纵向记录请以个体 ID 为 group)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
groups = meta.index # 个体主键
train_idx, test_idx = next(gss.split(np.zeros(len(groups)), groups=groups))
train_ds = ROSMAPDataset(
expr_log.iloc[:, train_idx], meta.iloc[train_idx]
)
test_ds = ROSMAPDataset(
expr_log.iloc[:, test_idx],
meta.iloc[test_idx],
feature_genes=expr_log.index, # 生产中应改为 train 折内选基因
)
train_loader = DataLoader(train_ds, batch_size=64, shuffle=True, num_workers=2)
test_loader = DataLoader(test_ds, batch_size=128, shuffle=False)
import torch.nn as nn
class SlopeNet(nn.Module):
def __init__(self, n_genes, n_cov=4, hidden=256):
super().__init__()
self.expr_branch = nn.Sequential(
nn.Linear(n_genes, hidden), nn.ReLU(), nn.Dropout(0.3),
nn.Linear(hidden, 64), nn.ReLU(),
)
self.cov_branch = nn.Sequential(nn.Linear(n_cov, 16), nn.ReLU())
self.head = nn.Linear(64 + 16, 1)
def forward(self, x_expr, x_cov):
return self.head(
torch.cat([self.expr_branch(x_expr), self.cov_branch(x_cov)], dim=1)
).squeeze(-1)
device = "cuda" if torch.cuda.is_available() else "cpu"
model = SlopeNet(n_genes=train_ds.X_expr.shape[1]).to(device)
opt = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-2)
crit = nn.MSELoss()
for epoch in range(20):
model.train()
for x_expr, x_cov, y in train_loader:
x_expr, x_cov, y = x_expr.to(device), x_cov.to(device), y.to(device)
opt.zero_grad()
loss = crit(model(x_expr, x_cov), y)
loss.backward()
opt.step()
# 评估(生产环境请扩展为 §5.4 的分组交叉验证 + §6.9 的完整指标)
model.eval()
preds, truths = [], []
with torch.no_grad():
for x_expr, x_cov, y in test_loader:
preds.append(model(x_expr.to(device), x_cov.to(device)).cpu())
truths.append(y)
print(slope_metrics(torch.cat(truths).numpy(), torch.cat(preds).numpy()))
§6.5 八个坑点 ⚠️
⚠️ 坑点 1:把 FPKM 矩阵当原始 counts 用(分类:预处理陷阱)
问题:ROS/MAP 分发的 bulk RNA-seq 是处理后的 FPKM 矩阵(且分发前已做过 quantile normalization + ComBat),很多研究者误当 raw counts 喂给 DESeq2/edgeR 这类需要原始计数与负二项模型的工具,或把官方 ComBat 误认为自己做批次校正的证据。
症状:DESeq2 直接报错(要求整数矩阵); dispersion 估计异常;差异表达结果与发表文献系统性不符;重复 ComBat 后组间真实差异也消失了。
解决:
- 简单方法:接受 FPKM 做回归/机器学习任务(先 log2(FPKM+1)、过滤低表达基因),差异表达改用 limma-voom 之外适合连续值的线性模型框架,不再用 DESeq2。
- 进阶方法:需要 counts 级建模时,申请受控访问下的比对层面资源或用社区重新处理的 counts 版本;同时检查官方处理记录,确认已有 quantile + ComBat 步骤,避免重复校正。
- SOTA 方法:按官方论文口径重建协变量回归(年龄、性别、RIN、核糖体碱基比例、比对 reads 数、study index、PMI + 3 个基因分型 PC 逐基因回归取残差),或使用 xQTL 社区维护的统一处理版本。
参考:De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142;Wang et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-01175-9
⚠️ 坑点 2:忽略 ROS/MAP 双队列结构(study index)(分类:工程陷阱)
问题:ROS 与 MAP 是两条队列,入组人群(修会 vs 社区退休社区)、启动时间(1994 vs 1997)与建库批次均不同。把两队列数据简单合并而不把 study 纳入模型,会把队列效应误读为生物学发现。
症状:PCA 前 2 主成分按 ROS/MAP 分开;「显著基因」复现率低;在 ROS 上训练的模型到 MAP 上性能骤降(或反之)。
解决:
- 简单方法:把 study index 作为回归协变量(官方分析口径即如此)。
- 进阶方法:ComBat 以 study 为批次轴 + 年龄/性别/RIN/PMI 为连续协变量;并对关键结论做「单队列内复现」检验。
- SOTA 方法:train on ROS, test on MAP 的跨队列外推评估作为标准报告项;对单细胞数据则用两库 harmonized 版本并纳入 dataset 协变量。
参考:De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142;xQTL 社区手册(statfungen/xqtl-resources)
⚠️ 坑点 3:混淆临床诊断与病理标签(分类:标签理解)
问题:ROS/MAP 同时提供临床层标签(年度随访中的痴呆判定)与病理层标签(NIA-Reagan/改良 CERAD/Braak)。两者并不等价——截至 2017-10 有 95 例临床 AD 但无病理 AD、174 例认知正常但有充分病理 AD。用错标签层会让「AD 分类」论文与文献不可比,也会掩盖不一致样本的信号。
症状:与病理金标准论文比较时 AUC 对不上;模型把「认知弹性老人」系统性判为阴性却在病理验证时翻车;审稿人指出标签定义不清。
解决:
- 简单方法:每个任务显式声明标签层(临床判定 vs NIA-Reagan vs Braak vs 定量病理),并在论文表格中并列报告。
- 进阶方法:把不一致样本(临床+/病理−、临床−/病理+)单独抽出做亚组分析——这恰恰是 ROS/MAP 的招牌研究价值。
- SOTA 方法:多任务建模同时预测临床轨迹与病理负荷,显式建模两者的残差相关,直接量化临床-病理映射的强度。
参考:De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142;Bennett et al., 2018, J Alzheimers Dis 64(s1):S161-S189. doi:10.3233/JAD-179939
⚠️ 坑点 4:跨组学层个体 ID 无法直接对齐(分类:工程陷阱)
问题:各组学层在 Synapse 上是独立实体,样本 ID 体系各不相同(RNA-seq 样本 ID、甲基化样本 ID、基因分型个体 ID、单细胞 donor ID),且部分论文使用历史 ID。跨层合并时靠列名猜测对齐,会产生静默的错配。
症状:多组学合并矩阵维度对不上;「配对样本」相关性接近 0(应为高相关);eQTL 分析中基因型与表达样本数不一致且无报错。
解决:
- 简单方法:只用门户元数据里的个体主键做映射,禁止按样本 ID 字符串模糊匹配。
- 进阶方法:合并后做完整性校验——同一人跨层的性别(RPS4Y1/XIST 表达可推断)与基因型一致性检查;样本离群用 RLE、层次聚类、D 统计量三重检测。
- SOTA 方法:使用 xQTL 社区维护的 harmonized 元数据与伪批量矩阵(MIT/CUIMC 合并版已处理重叠 donor 与 ID 映射)作为输入。
参考:statfungen/xqtl-resources;Allesøe et al. 相关管线文档见社区手册;性别检查方法见 BMC Bioinformatics 2021, doi:10.1186/s12859-021-04307-0
⚠️ 坑点 5:按行(年度随访记录)划分 train/test(分类:数据泄漏)
问题:ROS/MAP 的纵向结构意味着同一人有最多数十年、每年一条的评估记录。若把「人-年」记录当独立样本随机划分,同一人相邻年份几乎相同的记录会同时出现在训练与测试集中。
症状:认知状态分类准确率高得不真实(>99%);上线/跨队列测试时性能崩塌;审稿人一句「patient-level split?」直接击沉论文。
解决:
- 简单方法:GroupShuffleSplit/GroupKFold,以个体主键为 group。
- 进阶方法:分层按个体聚合(每人的标签聚合后进入划分);纵向任务用时间切分(早期随访训练、晚期随访测试)。
- SOTA 方法:交叉验证 + ROS↔MAP 互测 + 时间外推三重评估同时报告;斜率任务额外用斜率标准误做加权。
参考:本文 §5.3 泄漏清单;De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142
⚠️ 坑点 6:TMT 蛋白组的批次与 MNAR 缺失(分类:预处理陷阱)
问题:TMT 蛋白组分 50 批(每批 8 样本 + 2 个 pooled 参考通道),批次效应是设计内嵌的;同时质谱蛋白组缺失天然 MNAR——低丰度蛋白系统性缺失,发布版已剔除缺失≥50% 的蛋白(8,425 → QTL 分析约 7,712 蛋白 × 416 样本)。
症状:不做批内参考通道校正时跨批比较完全失真;用均值/中位数填补缺失后,差异蛋白被低丰度假象主导;pQTL 结果无法复现文献。
解决:
- 简单方法:直接使用发布版已归一化矩阵(median polish 已去技术方差、缺失≥50% 已剔除),不自行从 raw 重来。
- 进阶方法:保留批次/参考通道信息做敏感性分析;缺失值用 MNAR 感知方法(如基于缺失指示变量的双重建模),禁用简单均值填补。
- SOTA 方法:使用 ADSP FGC xQTL 管线的产物(含 FDR<1% 过滤与协变量回归版矩阵),并按社区手册的 covariates 对齐 QTL 分析。
参考:ROSMAP DLPFC proteomics — xQTL 社区手册;TMT 蛋白组论文 doi:10.1126/sciadv.aaz9360
⚠️ 坑点 7:认知斜率标签的估计误差被忽略(分类:评估误用)
问题:队列主分析性状 Global Cognitive Slope 是混合模型估计量,不是直接观测:随访年数少的个体斜率标准误大,把这些「低质量斜率」与高质量斜率一视同仁地放进回归/训练,会放大标签噪声并让结果向随访长的个体倾斜。
症状:预测模型 R² 上不去且折间波动巨大;敏感性分析(剔除短随访者)后结论反转;与发表的 slope 关联效应量对不上。
解决:
- 简单方法:设定最低随访次数门槛(如 ≥3 次评估)并报告被排除比例。
- 进阶方法:用每个个体斜率的标准误做加权最小二乘/加权训练损失。
- SOTA 方法:跳过预估计,直接把纵向原始分数建模为联合/多层模型(随机效应即个体轨迹),让模型显式吸收估计不确定性。
参考:De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142(斜率定义);Bennett et al., 2018, J Alzheimers Dis. doi:10.3233/JAD-179939
⚠️ 坑点 8:单核双数据集合并的批次与重叠 donor(分类:工程陷阱)
问题:DLPFC 单核 RNA-seq 有两个互补数据集——MIT/Kellis(约 427 名捐赠者,syn52293417)与 CUIMC/De Jager(约 424 名,syn31512863)。两库存在部分重叠捐赠者,且预处理流程不同(比对、细胞分型、归一化均独立完成)。直接 cbind 合并会把「实验室效应」当成生物学差异,重叠 donor 还会造成样本重复。
症状:合并后 UMAP 按数据集而非细胞类型分开;伪批量 eQTL 中同一 donor 出现两次导致自由度虚高;细胞比例差异被实验室身份完全解释。
解决:
- 简单方法:优先使用社区已 harmonized 的合并伪批量矩阵(六大细胞类型:星形胶质细胞、兴奋性/抑制性神经元、小胶质细胞、少突胶质细胞、OPC)。
- 进阶方法:自行合并时先按 donor ID 求交集去重,再以 dataset(CUIMC/MIT)与 study(ROS/MAP)为协变量纳入 eQTL/差异表达模型。
- SOTA 方法:按社区手册的完整协变量集(性别、死亡年龄、PMI、study、dataset、检出基因数、基因型 PC、表达 PC)建模,并用 SuSiE 系列做精细定位与共定位。
参考:ROSMAP Mega snRNA-seq — xQTL 社区手册;Xiong et al., 2023, Cell(全文)
§6.6 数据增强
| 操作 | 评价 | 说明 |
|---|---|---|
| 基因 mask/特征 dropout | ✅ 安全 | 训练时随机屏蔽基因特征,提升鲁棒性 |
| 协变量抖动(高斯噪声) | ✅ 安全 | 对连续协变量加小噪声,缓解高龄共线 |
| 跨队列混合采样 | ✅ 安全 | ROS/MAP 互为天然增强集 |
| 对表达矩阵加乘性噪声 | ⚠️ 谨慎 | 破坏 log 空间分布,需验证 |
| SMOTE 类过采样病理标签 | ❌ 危险 | 表型连续且共线,合成样本无生物学意义 |
| 随机拼接不同个体的多组学层 | ❌ 危险 | 摧毁「同一人跨层配对」这一核心价值 |
增强策略的选择逻辑取决于任务:对「协变量鲁棒性」敏感的任务(如病理分类),特征 dropout 与协变量抖动收益最大;对「跨队列泛化」敏感的任务,与其做合成增强,不如直接利用 ROS/MAP 双队列结构做交替训练。所有增强都应在个体级划分之后进行,任何跨越 train/test 边界拟合的增强参数(如全局均值方差)本身就是泄漏。
落地为检查清单时,逐项确认三件事:
- 增强是否只作用于训练折(在 DataLoader 之前的划分点实现);
- 增强后的样本-标签对应关系是否保持(按个体主键校验);
- 复现实验时增强随机种子是否与划分种子一起记录。
这三条在组学数据的 failure mode 里排位不高,但一旦违反,错误会以「折间方差莫名增大」的温和形式出现,极难定位。
§6.7 模型推荐表
| 任务 | 推荐起点 | 升级方案 | 理由 |
|---|---|---|---|
| 认知斜率回归 | 弹性网/梯度提升 + 协变量 | 多模态神经网络(§6.4 骨架) | 样本量级下线性模型常强于深度模型 |
| 病理分类 | 逻辑回归/LightGBM | 多实例/多任务网络 | 标签为有序三档,基线即可很强 |
| 多组学整合 | MOFA+ / DIABLO | 对比学习融合 | 同人跨层配对是天然监督信号 |
| eQTL/pQTL | TensorQTL | SuSiE 精细定位 + coloc 共定位 | xQTL 社区标准管线 |
| 单细胞分析 | 标准扫描流程 + 伪批量 | Harmony/scanorama 整合 | 先伪批量再做 QTL 更稳 |
选型的两条经验法则:第一,ROS/MAP 的有效样本量在组学融合层最高只有数百(458 人全层齐备口径),深度模型只有在特征已高度结构化(如细胞类型比例、模块特征分数)后才值得上;第二,凡是能用「官方/社区已发布的处理版」解决的问题(伪批量矩阵、QTL 汇总统计),就不要从原始数据重跑——社区版本经过了重叠 donor 去重与批次协调,自己重跑容易踩坑点 8。
§6.8 硬件需求
| 层 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 临床元数据 + 表达矩阵 | 8 GB RAM 普通笔记本 | 32 GB RAM | MB-GB 级,本地足够 |
| TMT 蛋白组/QTL | 16 GB RAM | 64 GB RAM | 矩阵小但 QTL 扫描吃内存 |
| 甲基化 IDAT 处理 | 32 GB RAM | 64+ GB RAM | minfi 逐芯片处理耗时 |
| 单核原始数据 | 不建议本地 | 云端(Synapse/Terra)或 128 GB RAM 工作站 | TB 级 |
| WGS | 不建议本地 | 云端 + CRAM 流式读取 | 只用汇总统计可免下载 |
内存之外的第二个瓶颈是 ID 桥接的计算形式:55,889 基因 × 数百样本的矩阵在 32 GB 机器上用 pandas 全量操作已接近舒适上限,若叠加多组学融合(数万个特征 × 数百个体 × 多层),建议直接上 Polars/Dask 或分块处理。数据本身的规模并不吓人,吓人的是「多层矩阵 × 多次重采样」的组合爆炸——把交叉验证的外层分组键固定、内层特征筛选增量进行,可以把内存峰值压回桌面级。
§6.9 评估指标代码
import numpy as np
from sklearn.metrics import mean_absolute_error, r2_score, roc_auc_score
# ---- 斜率回归任务:MAE + R² + 加权 MAE(用斜率标准误) ----
def slope_metrics(y_true, y_pred, se=None):
out = {
"MAE": mean_absolute_error(y_true, y_pred),
"R2": r2_score(y_true, y_pred),
}
if se is not None: # 低误差(随访长)个体权重高
w = 1.0 / (np.asarray(se, dtype=float) ** 2)
out["wMAE"] = float(np.sum(w * np.abs(y_true - y_pred)) / np.sum(w))
return out
# ---- 有序病理分类任务:宏平均 AUC + 逐档 AUC ----
def ordinal_auc(y_true_onehot, proba):
aucs = []
for k in range(y_true_onehot.shape[1]):
try:
aucs.append(roc_auc_score(y_true_onehot[:, k], proba[:, k]))
except ValueError: # 某折缺该档
continue
return {"macro_AUC": float(np.mean(aucs)), "per_class_AUC": aucs}
# ---- 跨队列外推:train on ROS → test on MAP(或反向) ----
def cross_cohort_eval(fit_fn, X_ros, y_ros, X_map, y_map):
model = fit_fn(X_ros, y_ros)
return {"MAP_test_MAE": mean_absolute_error(y_map, model.predict(X_map))}
指标选择的映射关系:斜率回归用 MAE/R²(配 wMAE 吸收估计误差,见坑点 7);有序病理分类用宏平均 AUC 而非准确率(三档有序且分布不均);跨队列外推的核心指标是「相对内部验证的误差衰减比」,单一绝对值没有意义。所有指标都应在分组交叉验证的每一折上计算并报告折间波动。
§6.10 MLOps 笔记
- 版本化输入:记录每个 Synapse 实体的 synID 与版本号(实体页可见),合成 manifest.yaml 入库;门户数据持续更新,未固定版本的结果不可复现。
- DUC 合规自动化:受控数据只允许在授权环境内处理;建立下载审计记录(谁、何时、哪个实体)。
- 特征存储:基因过滤口径(如 FPKM>2 且 80% 样本表达)作为代码而非人工步骤,保证 train/test 一致。
- 实验追踪:记录协变量口径(官方 8 项 vs 自定义)——这是同类论文间结果差异的第一大来源。
- 模型卡:必须声明标签层(临床 vs 病理)、划分方式(个体级)与队列口径(ROS/MAP 合并或单队列)。
- 数据快照冻结:论文投稿前冻结「实体版本 + 下载日期 + 行列数」三元组,审稿补实验时用同一快照。
- 跨层主键单一来源:ID 桥接表全项目只维护一份,任何脚本禁止自行重推映射。
- 回归测试:把「性别一致性校验、样本数守恒、标签分布对比」做成 CI 检查,防止上游数据更新后静默破坏下游。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 幸存者偏倚 | 组学/病理仅覆盖存活到尸检的个体;死亡即失访的极端高龄选择性缺失 | 高 | 建模时纳入死亡竞争风险;避免把尸检子集当随机样本 |
| 人群构成偏倚 | 修会成员与退休社区居民:生活方式相对同质、教育水平偏高、健康意识强 | 高 | 混杂减少是设计优点;外推到一般人群需保守声明 |
| 超高龄共线 | 平均死亡年龄 88.8 岁,年龄-共病-病理-认知高度纠缠,缺年轻对照 | 高 | 协变量选择谨慎;敏感性分析;避免过度调整中介变量 |
| 性别偏倚 | 入组 72.7% 女性(截至 2017-10) | 中 | 分层分析;性别作为协变量 |
| 组学层选择偏倚 | 仅 458 人(2017-10 口径)全层齐备;各层数量递减(基因分型 2,090 → RNA-seq 638 等) | 中 | 报告每层有效样本量;对层缺失建模 |
| TMT/质谱 MNAR | 低丰度蛋白系统性缺失,缺失≥50% 蛋白已被剔除 | 中 | MNAR 感知填补;缺失指示变量 |
| RIN 分层池化 | RNA-seq 建库按 RIN 分层池化,RIN 与批次嵌套 | 中 | RIN 与批作为协变量;ComBat |
| 临床-病理不一致 | 95 例临床 AD 无病理 AD、174 例认知正常有病理 AD(截至 2017-10) | 双面 | 不是「噪声」而是研究对象;分层报告 |
| 练习效应 | 年度重复测验导致分数漂移 | 低-中 | 官方合成分数已按协议处理;自建标签需注意 |
这张表的阅读方式:严重程度为「高」的四项都是队列设计的结构性产物(幸存者、人群构成、高龄共线、多组学覆盖不均),文档层面无法修复,只能在研究设计与结论外推时消化;严重程度为「中/低」的各项属于技术层偏倚,协变量建模与敏感性分析即可控制。把两类偏倚分开处理,是 ROS/MAP 分析方案的成熟标志。
§7.2 标注质量
病理金标准由拉什大学研究神经病理团队按统一协议(NIA-Reagan/改良 CERAD/Braak)判定,认知评估为标准化心理测量流程,两条队列方案完全一致(19/21 项共有测验),标注体系内部一致性在领域内公认优秀。公开材料未提供逐例观察者间 Kappa 数字,本文不作数字声明。定量病理(8 脑区图像立体测量)把传统半定量分期升级为连续测量,是同类脑库中少见的标注深度。
从 AI 建模视角看,这套标注有三个额外优点:其一,病理判定在死亡后一次性完成,不受模型研究进展的影响,不存在「标签随时代漂移」;其二,认知测验的合成规则(z 分 → composite → 斜率)完全透明可复现,任何研究者可以用原始测验分数重建标签做敏感性分析;其三,三层标签(临床/病理/不一致)天然构成「弱标签 + 金标准」的半监督结构,是标签噪声学习方法的理想试验场。
§7.3 泛化性评估表
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 推广到年轻人群(<65 岁) | 高 | 队列平均死亡年龄 88.8 岁,无年轻对照层 |
| 推广到非美国/非高教育人群 | 高 | 人群为美国修会成员与中西部退休社区居民 |
| 推广到临床转诊连续样本 | 中-高 | 入组标准为「无痴呆」,与记忆门诊人群分布不同 |
| ROS→MAP 跨队列迁移 | 中 | 同协议双队列,是最现实的内推检验(坑点 2) |
| 推广到 AMP-AD 同类脑库(MSBB/Mayo) | 中 | 脑区、平台、病理方案有差异,需再校准 |
| 单细胞两库互换(MIT↔CUIMC) | 中 | 预处理与平台批次差异(坑点 8) |
泛化性的总体判断:ROS/MAP 是「深度换广度」的数据集——单个人群内纵向与组学深度全球顶级,但人群广度刻意收窄。把它当作「机制发现与假设生成」的引擎,再在更广人群中做验证,是符合其设计哲学的用法;反过来把它当作「直接部署的预测器训练集」,则从第一步就误用了数据。
§7.4 伦理与治理
研究经拉什大学医学中心 IRB 批准,每位参与者签署知情同意、Anatomic Gift Act 脑捐赠协议与允许数据再利用的 repository consent。数据经 Synapse AD Knowledge Portal 受控分发:注册账号、签署 Data Use Certificate(可与 Rush University Medical Center 或 SAGE 签署),注册流程的目的即在于保护 ROSMAP 参与者的匿名性。数据按 general research use 条款开放,二级使用无发表禁运,但署名要求强制。去世捐赠者的遗传与表观遗传数据属敏感个人信息,任何再识别企图均被协议禁止。
对 AI 研究者的两条实操含义:其一,这套数据的「可再识别风险」虽然因捐赠者去世而结构性地低于活体队列,但基因组数据仍属受控资源,衍生数据(如模型权重、嵌入向量)的公开同样应评估成员推断风险;其二,使用组织衍生新数据(如自行测序)同样在 DUC 约束内,新数据的发布路径应提前与门户沟通。
§7.5 公平性
队列以白人、高教育、女性偏多的美国老年人群为主(72.7% 女性,截至 2017-10),非洲裔、西班牙裔与其他族裔的样本占比有限,本文不对未核实的族裔比例作数字声明。模型在该队列内校准后应用于少数族裔人群时应预期性能下降;祖先结构可用基因分型 PC(官方提供前 3 个)做统计校正,但统计校正无法替代代表性数据的收集。
教育程度是公平性分析的另一个关键协变量:修会成员与退休社区居民的教育水平普遍高于一般人群,而教育本身与认知储备(cognitive reserve)相关——这正是「临床-病理不一致」的经典解释路径之一。在 ROS/MAP 上训练的认知模型若不显式建模教育,很容易把「高教育人群的认知弹性」误学为「低病理风险的普遍规律」。
§7.6 数据漂移
两个方向的漂移值得监控:(1) 时间漂移——1994 年与 2020 年代的入组者在教育、共病谱、治疗暴露(如胆碱酯酶抑制剂普及)上不同,跨年代建模应纳入入组年代;(2) 技术漂移——组学平台跨批次升级(如 TMT 试剂代次、单细胞 10x 版本),跨批次分析必须保留批次协变量。门户数据持续更新,固定实体版本号是防止结果随时间不可复现的第一道防线。
第三种漂移是「队列构成漂移」:早期 ROS 以修会成员为主体,后期 MAP 社区老人占比上升,两条队列的相对构成随时间变化。做跨年代比较时,最好把「队列 × 年代」的联合分布画出来检查,避免把构成变化误读为时代效应。
§7.7 DAIMS 24 项数据质量检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 表达/蛋白矩阵基因×样本宽表,列名即样本 ID |
| 2 | 唯一标识 | ✅ | 个体主键贯穿全部数据层与随访记录 |
| 3 | 特殊字符 | ✅ | 元数据字段规范,未见编码异常报告 |
| 4 | 重复行 | ✅ | 发布矩阵按样本聚合;人年结构在临床层显式建模 |
| 5 | 缺失编码 | ⚠️ | 各层数据缺失口径不一,需逐实体阅读元数据 |
| 6 | 标签标识 | ✅ | 临床/病理/不一致三层标签结构清晰可辨 |
| 7 | 罕见类分组 | ✅ | 病理有序档位(NIA-Reagan 三档/Braak I-VI)定义规范 |
| 8 | 偏倚评估 | ✅ | 队列论文对幸存者与人群偏倚披露充分 |
| 9 | 数据字典 | ✅ | 门户逐实体元数据完整 |
| 10 | 信息性缺失解释 | ⚠️ | TMT 的 MNAR 缺失机制依赖社区文档补充说明 |
| 11 | 设备记录 | ✅ | 测序平台与参数(HiSeq 101 bp PE、10x Chromium 等)在论文与实体页声明 |
| 12 | 共线性 | ❌ | 超高龄队列年龄-共病-病理-认知固有共线,无法用文档修复 |
| 13 | 编码映射 | ⚠️ | 论文历史 ID 与门户 ID 需经元数据桥接表手工对齐 |
| 14 | 时间戳处理 | ✅ | 年度随访结构化,visit 序与年龄字段齐备 |
| 15 | 划分建议 | ✅ | 无官方划分但社区惯例(个体级划分)高度一致 |
| 16 | 泄漏讨论 | ✅ | 纵向结构与跨层配对的泄漏路径均可在文档层面识别 |
| 17 | 标签分布 | ✅ | 病理负荷(亚队列 61% 病理 AD)与不一致规模(95/174)有文献口径 |
| 18 | 测量偏倚 | ✅ | RIN/PMI/批次/队列来源均有记录并进协变量集 |
| 19 | 外部验证建议 | ✅ | MSBB/MayoRNAseq/ADNI 外部验证路径明确 |
| 20 | 版本记录 | ⚠️ | 无传统版本号,需以 Synapse 实体版本快照替代 |
| 21 | 预处理脚本 | ✅ | 官方处理管线 + xQTL 社区开源手册 |
| 22 | 合规要求 | ✅ | DUC 流程、署名要求、无发表禁运条款明确 |
| 23 | 多模态对齐 | ⚠️ | 跨层样本 ID 体系不同,合并需桥接表与一致性校验 |
| 24 | 去标识化 | ✅ | 死后捐赠者数据 + 受控访问 + 注册制保护匿名 |
DAIMS 评分:20.5 / 24
评分解读:20.5 分属于「研究级数据集的顶档区间」。丢分集中在三处:超高龄协变量固有共线(结构性的,无法修复)、跨层 ID 桥接与历史编码映射的手工成本、以及无传统版本号带来的复现管理负担。这些都不是「数据脏」,而是「深度纵向 + 多组学 + 持续更新」这类数据集的固有代价。与同类脑库相比,ROS/MAP 的元数据完整度与协议一致性处于第一梯队。
对你意味着什么:如果你要做认知衰退预测或多组学建模,这套数据可以直接开工——把工程精力花在 ID 桥接脚本与实体版本固定上,而不是怀疑数据质量。如果你的方法对协变量共线敏感(如因果推断),要么限制在特定层(如纯病理亚组),要么明确声明共线性风险。任何情况下都不要按行划分数据,并且从第一天起用 manifest 记录 synID + 实体版本。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| MSBB(syn3159438) | 西奈山伊坎医学院 | bulk 转录组 AD 差异表达/分类 | 见原文献 | 中(脑区与平台差异) | AMP-AD 三库联合再分析确认跨库可重复的 AD 模块 |
| MayoRNAseq | 梅奥诊所 | 病理确认 AD 转录组签名 | 见原文献 | 中 | 病例-对照设计结果与队列来源结论方向一致 |
| ADNI | NIA 资助多中心 | 认知衰退预测跨队列迁移 | 见原文献 | 高(影像 vs 组学) | 人群年轻约一档,模型需重新校准 |
| ROS↔MAP 互测 | 拉什大学 | 同协议双队列外推 | 低衰减 | 小 | study index 校正后跨队列泛化是最可靠的内推检验 |
表中不引用未核实的具体性能数字;跨库数字比较无意义的原因:各研究的脑区选择、平台、预处理管线与人群纳入条件均不同(详见 §8.3)。
§8 基准性能与生态
§8.1 代表性分析结果表
ROS/MAP 不是竞赛型数据集,没有官方排行榜。下表列出以 ROS/MAP 数据完成、方法学上有代表性的已发表分析;各行数字不可直接比较(人群子集、预处理、任务定义均不同),此处只给出任务与方法定位。
选择这些代表工作的标准:或定义了该数据层标准处理口径(Wang 2020 之于 bulk RNA-seq),或展示了数据层的研究上限(Xiong 2023 之于单核多组学),或已成为社区默认输入(xQTL 伪批量之于靶点共定位)。检索更多工作时,以「ROSMAP」与本文 §3.1 的各实体 ID 为关键词在门户与文献库交叉检索,命中率最高。
| 研究 | 任务 | 方法要点 | 完整引用 | 代码/资源 |
|---|---|---|---|---|
| 皮质免疫网络图谱 | 小胶质细胞程序与 Aβ/tau 病理关联 | DLPFC bulk RNA-seq(542 样本)+ 共表达网络 | Wang et al., 2020, Translational Psychiatry. doi:10.1038/s41398-020-01175-9 | 数据 syn3388564 |
| AD 表观基因组解析 | snATAC/snRNA 多组学、aQTL、GWAS 共定位 | 427 名捐赠者 DLPFC 单核 ATAC/RNA | Xiong et al., 2023, Cell. 全文 | KellisLab/AD_regulome_analysis(Zenodo 8287248) |
| RNA-seq eQTL 质控管线 | 自动化 QC(性别校验/离群/批次) | RPS4Y1/XIST 性别推断 + SVM;RLE/聚类/D 统计量 | BMC Bioinformatics, 2021. doi:10.1186/s12859-021-04307-0 | 管线文档 |
| xQTL 旗舰伪批量 | 六大细胞类型 eQTL + SuSiE 精细定位 + 共定位 | MIT+CUIMC 合并(去重重叠 donor) | xQTL 社区手册(statfungen/xqtl-resources) | cumc/fungen-xqtl-analysis |
| 多组学 atlas | 各组学层首发规模与获取协议 | 队列描述与组学汇总 | De Jager et al., 2018, Scientific Data. doi:10.1038/sdata.2018.142 | study syn3219045 |
§8.2 SOTA 总结与选型建议
- 认知建模:在高龄队列上,带协变量的线性/梯度提升基线往往不输深度模型;深度模型的价值在多组学融合与单细胞分辨率。
- 靶点发现:xQTL 共定位(SuSiE 精细定位 + coloc)已是社区事实标准,直接复用社区 QTL 汇总统计可省大量算力。
- 单细胞:优先使用 harmonized 伪批量矩阵;原始细胞级分析建议在云端完成。
- 跨库研究:以 MSBB/MayoRNAseq 做外部验证是最低成本的稳健性证据。
把「任务-方法-数据层」三者对齐是选型的关键:认知建模用临床层全队列样本(样本量最大);机制解释用病理层尸检子集(标签最硬);靶点发现用分子层(QTL)。最常见的错配是在小样本层上跑复杂模型、在大样本层上回答只有小样本层才能回答的问题(如把基因分型结果直接解释为病理机制而不经 QTL 桥接)。
§8.3 评测协议
发布基于 ROS/MAP 的结果时,建议最低限度报告:标签层(临床/病理/不一致)、人群纳入条件与有效 n(逐组学层)、个体级划分方式、协变量口径(官方 8 项或自定义)、Synapse 实体版本、代码链接。缺省这些信息的 ROS/MAP 结果几乎无法被复现或比较——这是 AMP-AD 社区反复强调的实践共识。
对照类研究还应报告「两条队列分别的结果」与合并结果:合并分析因为统计功效更高通常是主结果,但两队列结论一致才是稳健性的核心证据。涉及单核数据的研究则需报告两库(MIT/CUIMC)的处理一致性策略与重叠 donor 的处理方式。若使用了门户上他人发布的中间结果(如 QTL 汇总统计),按 §9.3 的引用指南同时引用原始研究与再分析来源。
§8.4 相关数据集表
| 数据集 | 关系 | 获取 | 与 ROS/MAP 的互补 |
|---|---|---|---|
| MSBB(syn3159438) | AMP-AD 同门脑库 | AD Knowledge Portal | 不同人群的独立尸检系列 |
| MayoRNAseq | AMP-AD 同门脑库 | AD Knowledge Portal | 病例-对照式病理分层 |
| ADNI | 纵向影像队列 | adni.loni.usc.edu | 活体影像生物标志物 |
| ROSMAP 单核两库(syn52293417/syn31512863) | ROS/MAP 子资源 | 同门户 | 单细胞分辨率 |
| RADC Research Resource Sharing Hub | 同机构资源共享 | radc.rush.edu | 组织与附加数据请求 |
跨库组合使用的两条边界:其一,AMP-AD 三库(ROSMAP/MSBB/MayoRNAseq)的元数据在门户内互相引用,联合再分析有成熟的先例可循;其二,与 ADNI 等活体队列组合时,「组学终点 vs 影像终点」的任务不对称性使直接融合困难,可行路径是分别建模再在解释层汇总,而非特征层硬拼。
§8.5 关键论文 Top 5
- De Jager PL, et al. A multi-omic atlas of the human frontal cortex for aging and dementia research. Scientific Data 5:180142 (2018). doi:10.1038/sdata.2018.142 —— 数据描述主论文:各组学层样本量、获取协议与认知测量体系的权威口径。
- Bennett DA, et al. Religious Orders Study and Rush Memory and Aging Project. J Alzheimers Dis 64(s1):S161-S189 (2018). doi:10.3233/JAD-179939 —— 双队列设计与研究进展综述(截至 2018-03 入组 >3,500 人)。
- Bennett DA, et al. Overview and findings from the religious orders study and memory and aging project. Curr Alzheimer Res 9(6):628-645 (2012). —— 早期设计论文,阐明修士+社区双队列的方法学动机。
- Xiong X, et al. Epigenomic dissection of Alzheimer’s disease pinpoints causal variants and reveals epigenome erosion. Cell (2023). —— DLPFC 单核 ATAC/RNA 多组学与 aQTL,展示 ROSMAP 单细胞层的研究上限。
- Wang 等,皮质免疫网络图谱研究. Translational Psychiatry (2020). doi:10.1038/s41398-020-01175-9 —— bulk RNA-seq 协变量校正与网络分析的标准参考实现。
各组学层的原始发布论文(基因分型 10.1038/mp.2017.20、甲基化 10.1038/nn.3786、RNA-seq 10.1038/s41593-018-0154-9、ChIP-seq 10.1038/s41593-018-0291-1、miRNA 10.1186/s13024-017-0191-y、TMT 蛋白组 10.1126/sciadv.aaz9360)DOI 已在 §3.1 列出,使用对应数据层时必须同时引用。
这批论文的分工可以这样理解:De Jager 2018 回答「数据有什么、怎么拿」,两篇 Bennett 论文回答「队列是怎么设计的」,Wang 2020 回答「bulk 层怎么分析才规范」,Xiong 2023 回答「单细胞层能走多远」。新人入场的阅读顺序建议与该顺序一致,再按所用数据层补充对应原始论文。
§8.6 社区活跃度
ROS/MAP 的活跃度体现在 AMP-AD 生态而非传统论坛:Synapse 门户持续上新数据层与再分析结果;Columbia 与 MIT 联合维护的 xQTL 手册把 ROSMAP 作为旗舰示例并持续更新管线;拉什 RADC Hub 提供组织资源共享;多个团队在门户上发布可复用的中间结果(无发表禁运机制鼓励早期共享)。对使用者,最有效的社区入口是门户的 Data Access 页与研究论坛,以及 statfungen/xqtl-resources 等开源手册。
衡量这套数据「还活着」的三个信号:其一,2023 年仍有新的单核多组学层(snATAC/snRNA)上架;其二,xQTL 手册的旗舰分析以 ROSMAP 为例持续迭代(SuSiE 精细定位、共定位模型都有配套 Synapse 结果实体);其三,围绕 ROSMAP 的方法学论文(如 eQTL 质控管线)仍在以它作为标准测试场。本文不对论坛帖子数、GitHub Star 数等未核实指标作数字声明。
§8.7 生态快照表
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| AD Knowledge Portal 数据门户 | 官方门户 | adknowledgeportal.synapse.org | 数据、元数据与 DUC 的唯一权威入口 |
| Synapse study 页 | 数据集页 | syn3219045 | 全部实体与元数据的导航根 |
| RADC Resource Sharing Hub | 机构资源 | radc.rush.edu | 组织切片与附加数据请求 |
| xQTL 社区手册 | 分析手册 | statfungen/xqtl-resources | 蛋白组/单核 QTL 的开箱即用指南 |
| KellisLab AD_regulome_analysis | 分析代码 | GitHub(Zenodo 8287248) | snATAC/QTL 复现代码 |
| UCSC Cell Browser | 可视化 | rosmap-ad-aging-brain.cells.ucsc.edu | 单细胞数据在线浏览,零下载 |
生态使用的推荐路径:新人从门户研究页进入 → 读 De Jager 2018 建立全貌 → 按任务选定数据层(§3.0 矩阵)→ 从 xQTL 手册或本文 §6.3/6.4 起步 → 结果确认后回 §9.3 核对引用组合。把本文当作「导航层」,把门户与手册当作「权威层」,两层配合可以避开绝大多数上手弯路。
§9 相关资源与引用
§9.1 官方资源入口
- 数据门户与研究页:AD Knowledge Portal — ROSMAP —— 研究描述、全部实体与元数据的权威入口
- 数据获取与署名规则:Data Access 说明页 —— DUC 条款、署名要求与「无发表禁运」政策的原文
- Synapse 数据集 DOI:10.7303/syn3219045 —— 论文中引用数据集本体时使用
- 组织/附加资源:RADC Resource Sharing Hub —— 组织切片、影像与附加数据的请求入口
- 单细胞在线浏览:UCSC Cell Browser —— 零下载浏览 MIT 单核数据
- xQTL 分析手册:statfungen/xqtl-resources —— 蛋白组/单核 QTL 的第三方维护实践手册
§9.2 BibTeX 引用块
@article{DeJager2018ROSMAP,
title = {A multi-omic atlas of the human frontal cortex for aging and dementia research},
author = {De Jager, Philip L and others},
journal = {Scientific Data},
volume = {5},
pages = {180142},
year = {2018},
doi = {10.1038/sdata.2018.142}
}
@article{Bennett2018ROSMAP,
title = {Religious Orders Study and Rush Memory and Aging Project},
author = {Bennett, David A and others},
journal = {Journal of Alzheimer's Disease},
volume = {64},
number = {s1},
pages = {S161--S189},
year = {2018},
doi = {10.3233/JAD-179939}
}
@article{Bennett2012Overview,
title = {Overview and findings from the religious orders study and memory and aging project},
author = {Bennett, David A and others},
journal = {Current Alzheimer Research},
volume = {9},
number = {6},
pages = {628--645},
year = {2012}
}
@article{Xiong2023Epigenomic,
title = {Epigenomic dissection of Alzheimer's disease pinpoints causal variants and reveals epigenome erosion},
author = {Xiong, X and others},
journal = {Cell},
year = {2023},
url = {https://www.cell.com/cell/fulltext/S0092-8674(23)00974-1}
}
@article{Wang2020Microglial,
title = {A cortical immune network map identifies distinct microglial transcriptional programs associated with beta-amyloid and tau pathologies},
journal = {Translational Psychiatry},
year = {2020},
doi = {10.1038/s41398-020-01175-9}
}
@misc{ROSMAPSynapse,
title = {ROSMAP — Religious Orders Study and Memory and Aging Project},
howpublished = {Synapse AD Knowledge Portal, study syn3219045},
year = {2023},
doi = {10.7303/syn3219045}
}
§9.3 引用指南
使用 ROS/MAP 数据发表时,门户要求同时引用:(1) 研究来源(本文 §8.5 的队列论文与 §3.1 对应数据层的原始发布论文 DOI);(2) 所用的分析结果来源(若使用门户上他人发布的中间结果);(3) 数据获取门户(Synapse AD Knowledge Portal,DOI 10.7303/syn3219045)。署名要求是 DUC 的一部分,签约即生效。
两种高频场景的引用示例:只用了 bulk RNA-seq 做认知建模的论文,最低组合是「De Jager 2018 + Bennett 2018 + RNA-seq 原始论文(10.1038/s41593-018-0154-9)+ 门户 DOI」;使用了社区伪批量 QTL 结果的论文,还需引用该结果的研究来源与 xQTL 手册。引用不全会被视为违反 DUC 署名要求,影响后续申请。
§10 AI 使用声明卡
§10.1 本页面生产使用的 AI 模型列表
| 模型 | 用途 | 使用阶段 |
|---|---|---|
| 大语言模型(CodeBuddy 内置模型) | 资料检索整合、结构化写作、代码示例生成 | 全流程 |
§10.2 AI 参与范围说明
AI 负责检索整合公开文献、起草章节结构与代码示例;全部事实性数字均要求有可回溯的检索来源(见 §10.3);人工审核者对医学内容、编码映射、坑点可操作性与合规声明负最终责任。
本页面的数字纪律:凡检索来源未能给出的数字(如 Google Scholar 引用次数、未核实的组学平台型号、未核实的族裔比例与总数据体积),一律省略而不估算;凡以「约/超过」表述的数字(如约 427/约 424 名单核捐赠者),保留来源文档的原始口径。审核者核验了关键数字与来源的一一对应关系,未发现无来源数字。
§10.3 输入来源列表
- De Jager PL, et al. A multi-omic atlas of the human frontal cortex for aging and dementia research. Scientific Data 5:180142 (2018). doi:10.1038/sdata.2018.142
- Bennett DA, et al. Religious Orders Study and Rush Memory and Aging Project. J Alzheimers Dis 64(s1):S161-S189 (2018). doi:10.3233/JAD-179939
- Bennett DA, et al. Overview and findings from the religious orders study and memory and aging project. Curr Alzheimer Res 9(6):628-645 (2012).
- Synapse AD Knowledge Portal ROSMAP 研究页(study syn3219045,DOI 10.7303/syn3219045)。
- AD Knowledge Portal Data Access 页(DUC、署名要求、无发表禁运条款)。
- Wang 等. A cortical immune network map identifies distinct microglial transcriptional programs associated with beta-amyloid and tau pathologies. Translational Psychiatry (2020). doi:10.1038/s41398-020-01175-9
- Xiong X, et al. Epigenomic dissection of Alzheimer’s disease pinpoints causal variants and reveals epigenome erosion. Cell (2023).
- ROSMAP DLPFC protein expression — xQTL 社区手册(statfungen/xqtl-resources)。
- ROSMAP Mega snRNA-seq expression — xQTL 社区手册(statfungen/xqtl-resources)。
- A pipeline for RNA-seq based eQTL analysis with automated quality control procedures. BMC Bioinformatics (2021). doi:10.1186/s12859-021-04307-0
- regionalpcs 改进 DNA 甲基化关联分析(含 WGS syn11707420 与 IDAT syn7357283 受控访问说明)。PMC11698866。
- Multicellular communities are perturbed in the aging human brain and Alzheimer’s disease(含 syn3388564、syn17015098、RADC Hub 数据可用性声明)。PMC10789499。
- CoExpNets Tutorial 3(ROSMAP_RNAseq_FPKM_gene.tsv 文件名与基因过滤口径)。rdrr.io/github/juanbot/CoExpNets。
- Allele specific expression in Alzheimer’s disease(ROSMAP syn3219045 与 MSBB syn3159438 数据可用性交叉证实)。Alzheimer’s & Dementia。
- UCSC Cell Browser rosmap-ad-aging-brain(Xiong 2023 数据可视化入口)。
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(组学层样本量、获取协议) | 千方病案医学编辑部 | 与 De Jager 2018 及 Synapse 门户页交叉比对 | ✅ 已验证 |
| §4 数据结构(实体树、DAIMS 字段字典) | 千方病案医学编辑部 | 与门户实体 ID 及社区手册交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方处理口径比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 代表性结果与生态链接 | 千方病案医学编辑部 | 与原文及门户快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 数据层抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-13
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- nacc — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究 / 阿尔茨海默病
- nifd — 共享标签:医学影像 / 电子健康记录 / 神经退行性疾病 / 队列研究
- copdgene — 共享标签:医学影像 / 电子健康记录 / 队列研究
- oai — 共享标签:医学影像 / 电子健康记录 / 队列研究
- chest-imagenome — 共享标签:医学影像 / 电子健康记录 / 队列研究
- hrs — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究
- adni — 共享标签:电子健康记录 / 队列研究 / 阿尔茨海默病
- neptune — 共享标签:医学影像 / 病理图像 / 队列研究
- i-spy — 共享标签:医学影像 / 电子健康记录 / 病理图像
- chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
