信息速览

HRS — 全球老龄研究的标杆纵向队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Health and Retirement Study(HRS,健康与退休研究) |
| 英文全称 | Health and Retirement Study |
| 别名/简称 | HRS、HRS-AHEAD、健康与退休研究队列 |
| 疾病分类 | 老龄全疾病谱。核心映射:ICD-11 6D80–6D8Z 痴呆 / BA00.Z 原发性高血压 / 5A11 2 型糖尿病 / 8B21 缺血性卒中 / BA41 急性心肌梗死 / 6A70 抑郁发作 / MG2A 衰弱 |
| SNOMED CT | 52448006 Dementia / 26929004 Alzheimer’s disease / 38341003 Hypertension / 44054006 Type 2 diabetes mellitus / 230690007 Stroke / 763357007 Frailty(详见 §2.2) |
| 数据模态 | 纵向调查(社会经济 + 健康自报)+ 认知测验 + 身体测量 + 生物标志物(干血斑 DBS / 静脉血 VBS)+ 基因组(GWAS/PGS/甲基化)+ 行政记录联动(Medicare/SSA/NDI) |
| AI 任务类型 | 痴呆/认知障碍算法分类、死亡预测、多病共存(multimorbidity)建模、健康轨迹聚类、GWAS 与多基因评分、因果推断、算法公平性审计 |
| 样本总数 | 43,216 名年龄合格参与者(1992-2016 累计,Dorr 2024 口径);每波 18,000-23,000 人;16 个核心波次(1992-2022) |
| 数据大小 | 公开调查数据数百 MB(按波/产品分包);基因型数据约 20,000 人 × 250 万 SNP(受控访问) |
| 数据格式 | SAS / Stata / SPSS / R 数据文件 + 部分 CSV;dbGaP/NIAGADS 分发 PLINK/VCF 基因型 |
| 许可证 | HRS Conditions of Use(公开层)/ Sensitive Health Data Agreement(敏感层)/ Restricted Data Agreement + VDI(受限层)/ dbGaP·NIAGADS DAR(基因) |
| 访问级别 | 三级分级:公开(注册即得)/ 敏感健康数据(补充申请)/ 受限数据(RDA + 安全飞地) |
| DUO 标签 | HMB, NPUNCU, IRB |
| 语言 | 英文(问卷另备西班牙语版本) |
| 首发日期 | 1992(第一波核心访谈)/ 1993(AHEAD 并入) |
| 最后更新 | 2025-11(2022 HRS Core Final V1.0)/ 2025-12(2022 Tracker Final V1.0) |
| 发布机构 | 密歇根大学社会研究所(Institute for Social Research, ISR)调查研究中心(SRC) |
| 官方主页 | https://hrs.isr.umich.edu/ |
| 下载地址 | https://hrsdata.isr.umich.edu/data-products/public-survey-data |
| DOI | 10.1093/ije/dyu067(Sonnega 2014 队列论文)/ dbGaP: phs000428 |
| 引用次数 | Sonnega 2014 约 1,870+(Semantic Scholar/OpenAlex 口径,截至 2026-09);使用 HRS 数据的出版物累计 9,000+(HRS 官方统计,截至 2024) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 文档与 RAND 衍生文件教科书级、三级访问体系成熟、痴呆算法谱系完整;扣分项:无官方 ML 划分、认知标签为算法推断、基因/生物标志物需多平台交叉回链 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、痴呆流行病学数据、临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(HHIDPN 主键、波次前缀变量体系、RAND 派生变量)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与密歇根大学 ISR、NIA、SSA、RAND Corporation 无任何商业利益关联。本页面不销售 HRS 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守 HRS 的 Conditions of Use 及相应级别的数据协议。HRS 公开数据仅限研究与统计用途,禁止任何形式的重识别尝试;敏感与受限数据需另行申请并遵守补充协议;基因数据须遵守 dbGaP/NIAGADS 的数据使用条款。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
HRS 是密歇根大学社会研究所执行、美国国立老龄化研究所(NIA)与社会保障局(SSA)资助的全国代表性老龄纵向队列。它从 1992 年起每两年访谈一次美国 50 岁以上人群,累计覆盖 43,216 名参与者(1992-2016 口径),内容横跨收入财富、健康认知、工作退休、家庭代际四大主题,并在 2006 年后加入生物标志物与全基因组数据,还可个体级联动 Medicare 医保、社保与国家死亡指数记录。
它的地位一句话概括:全球老龄研究的"基础设施与方法学模板"。HRS 首创的"公开/敏感/受限"三级数据分级体系、steady-state 队列刷新设计、以及 ADAMS/HCAP 痴呆临床诊断子研究,被 30 余个国家的姊妹队列(英国 ELSA、欧洲 SHARE、中国 CHARLS 等)完整复制。使用 HRS 数据的出版物累计已超过 9,000 篇(官方统计,截至 2024)。
你可以用它来:训练痴呆/认知障碍的算法分类模型并与 ADAMS 临床金标准对标、做死亡与多病共存的长期预测、评估医保与退休政策对健康结局的因果效应、或者在 2 万人 GWAS 数据上做社会基因组学(PGS)研究。跨国比较研究可经 Gateway to Global Aging 直接拼接 30 余个协调化姊妹队列。
§1.1 摘要
HRS 采用多阶段区域概率抽样,1992 年首批入组 51-61 岁人群及其配偶(7,600 户、12,600 余人),1993 年并入 AHEAD(1923 年及以前出生)队列,1998 年合并 CODA 与 War Baby 队列后进入 steady-state 稳态设计——此后每 6 年补充一个 51-56 岁新出生队列(2004 EBB、2010 MBB、2016 LBB、2022 EGENX),持续代表美国 50 岁以上社区居住人群。核心访谈每两年一次、每次 90 分钟-3 小时,混合面对面/电话/邮寄/网络模式;一半的增强面对面子样本每 4 年轮做一次身体测量与血液采集。2022 年第 16 波核心数据 Final V1.0 于 2025-11 发布。数据以三级体系分发:公开层(注册免费下载)、敏感健康数据层(生物标志物/ADAMS/HCAP/PGS,补充申请)、受限层(Medicare/SSA/NDI 联动与地理信息,RDA + 虚拟桌面飞地)。RAND 公司出品的 RAND HRS Longitudinal File 将全部 16 波整理为"一人一行"的宽格式派生变量文件,是绝大多数分析的实际起点。
§1.2 战略价值分析
范式开创维度:HRS 是第一个把详细经济变量与健康变量放进同一份问卷的老年纵向研究(Juster & Suzman 1995),它确立的三件事至今仍是全球队列研究的默认模板:steady-state 队列刷新机制(保持横断面代表性的同时保留纵向追踪)、基于知情同意的行政记录个体级联动(Medicare/SSA/NDI/雇主养老金)、以及"公开/敏感/受限"三级数据分级——这套按重识别风险分层开放的工程方案,后来被 UK Biobank、All of Us 等几乎所有大型人群研究以不同形式继承。
生态推动维度:围绕 HRS 生长出了老龄研究领域最完整的工具链——RAND HRS Longitudinal File 把 30 年 16 波数千变量整理成统一命名(R1-R16 前缀)的分析就绪文件;USC 的 Gateway to Global Aging 把 HRS 与 30 余个国际姊妹队列协调为同定义变量;ADAMS 与 HCAP 两个临床诊断子研究为"问卷认知数据 → 临床痴呆诊断"提供了全国代表性校准集,直接催生了 Gianattasio 等一整套痴呆算法分类文献。这套"队列—衍生文件—校准子研究—算法谱系"的完整闭环,使 HRS 成为流行病学机器学习少有的"有金标准可对标"的真实世界数据源。
临床与政策影响维度:HRS 数据直接改写了美国痴呆政策叙事——ADAMS 首次给出全国代表性痴呆患病率(2002 年 71 岁以上 13.9%,Plassman 2007);Hurd 等人 2013 年在 NEJM 估算痴呆年经济成本约 2,000 亿美元(该文被引近 2,000 次,被反复引用于国会 AD 研究拨款辩论);Langa 等人 2017 年证实美国痴呆患病率从 2000 年 11.6% 降至 2012 年 8.8%。在医保政策端,HRS-Medicare 联动数据是多病共存、临终照护支出与长期护理研究的标准证据源。
§1.3 横向对比
| 数据集 | 累计规模 | 国家/地区 | 模态 | 核心差异化 |
|---|---|---|---|---|
| HRS | 43,216(1992-2016) | 美国 | 调查+认知+生物标志物+基因+医保联动 | 模板级队列;ADAMS/HCAP 痴呆金标准;三级访问体系;30+ 国际姊妹队列枢纽 |
| ELSA | 约 19,000 | 英格兰 | 调查+护士访视生物标志物 | HRS 最直接的欧洲姊妹;Harmonized ELSA 可跨库拼接 |
| SHARE | 约 140,000(28 国合计) | 欧洲大陆+以色列 | 调查+物理测量+DBS | 覆盖国家最多;Wave 3 起加入生命史模块 |
| CHARLS | 约 20,000 | 中国 | 调查+体检+血液 | 中国版 HRS;Harmonized CHARLS 已上线 |
| UK Biobank | 500,000 | 英国 | 深度生物标志物+影像+基因+EHR | 规模与分子深度远超 HRS;但无医保政策变量、无两年波次高频社会经济数据 |
| NHATS | 约 8,000/轮 | 美国 | 调查+认知+功能 | 每年随访、聚焦功能与照护;与 HCAP 有认知共校准研究 |
HRS 的不可替代性在三点:时间纵深最长且仍在继续(1992 至今 16 波)、唯一拥有全国代表性痴呆临床诊断校准子研究(ADAMS/HCAP)、以及与 Medicare/SSA 行政数据的三十年联动传统——这使它同时是流行病学、卫生经济学与社会基因组学的交汇点。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 1990 | 美国国会指示 NIA 创建 HRS(RFA AG-90-002) |
| 1992 | 第一波核心访谈:HRS 队列(1931-41 出生,12,600+ 人) |
| 1993 | AHEAD 队列(1923 年及以前出生)启动 |
| 1998 | HRS/AHEAD/CODA/WB 四队列合并,进入 steady-state 稳态设计 |
| 2001 | CAMS(消费与活动邮寄调查)启动;ADAMS 痴呆子研究启动(2001-2005,856 人完成评估) |
| 2004 | EBB 队列(1948-53 出生)入组;增强面对面引入身体测量与 Leave-Behind 心理问卷 |
| 2006 | 首次采集干血斑生物标志物与唾液 DNA;心理社会问卷扩展 |
| 2010 | MBB 队列(1954-59 出生)入组 |
| 2011 | dbGaP 发布首批基因型数据(phs000428,v1:2006-2008 样本) |
| 2013 | Hurd et al. NEJM 发表痴呆货币成本研究(约 $200B/年) |
| 2014 | Sonnega et al. 队列论文发表(Int J Epidemiol,权威引用入口) |
| 2016 | LBB 队列(1960-65 出生)入组;静脉血研究(VBS)与 HCAP 痴呆评估启动 |
| 2020 | COVID-19 专项模块 |
| 2022 | 第 16 波核心访谈;EGENX 队列(1966-71 出生)入组;第二波 HCAP |
| 2025-05 | RAND HRS Longitudinal File 2022 (V1) 发布 |
| 2025-11 | 2022 HRS Core Final V1.0 发布;2025-12 发布 2022 Tracker Final V1.0 与 EGENX 扩展队列 Early V1.0 |
§1.5 典型 AI 应用场景
- 痴呆/认知障碍算法分类:以 ADAMS/HCAP 临床诊断为金标准,用问卷与认知测验变量训练分类器(Langa-Weir 切点、Gianattasio LASSO/Expert 算法为其谱系),灵敏度 77-83%、特异度 92-94%。
- 死亡与多病共存预测:利用 16 波纵向轨迹 + NDI/exit 死亡终点做生存分析与多病共存轨迹聚类;HRS-Medicare 联动支持 CCW 21 病种口径的高多病共存研究(Dorr 2024)。
- 卫生经济与政策因果推断:退休、医保政策变动对健康与支出影响的准实验评估(HRS 的设计初衷)。
- 社会基因组学:约 20,000 人 GWAS + PGS v5 + 表观遗传时钟,研究基因×社会经济环境交互(行为与社会基因组学的标杆数据源)。
- 跨国老龄比较:经 Gateway to Global Aging 与 ELSA/SHARE/CHARLS 等 30+ 协调化队列做跨库同定义变量分析。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
HRS 核心问卷以"医生是否告知过诊断"的自报条目覆盖老龄主要慢病谱,映射至 ICD-11 如下:
| HRS 自报条目(RAND 变量示例) | 中文名称 | ICD-11 对应 | 备注 |
|---|---|---|---|
| High blood pressure(RwHIBPE) | 高血压 | BA00.Z 原发性高血压,未特指 | 65+ 人群自报患病率约 55-60%(HRS 文献口径) |
| Diabetes(RwDIABE) | 糖尿病 | 5A11 2 型糖尿病 | 可联动 DBS/VBS 的 HbA1c 客观校验 |
| Heart disease / Heart attack(RwHEARTE) | 冠心病/心肌梗死 | BA52 慢性缺血性心脏病 / BA41 急性心肌梗死 | 自报"heart condition"为复合条目 |
| Stroke(RwSTROKE) | 卒中 | 8B21 缺血性卒中 / 8B22 脑出血 | 含 TIA 追问 |
| Cancer(RwCANCRE) | 恶性肿瘤(除皮肤) | 2C00-2F9Z 恶性肿瘤章节 | 受限层有 Cancer Site 精细编码 |
| Lung disease(RwLUNGE) | 慢性肺病 | CA40-CA4Z / CB40-CB4Z 呼吸系统章节 | 含 COPD 等 |
| Arthritis(RwARTHRE) | 关节炎 | FA01 骨关节炎 / FA20-FA2Z 炎性关节病 | 未细分类型 |
| Psychiatric problems(RwPSYCHE) | 精神心理问题 | 6A70 抑郁发作 / 6B00-6B0Z 焦虑障碍章节 | 另有 CES-D 8 项抑郁量表(RwDEPRE 等) |
| Memory-related disease(RwMEMRYE) | 记忆相关疾病 | 6D80-6D8Z 痴呆 | 核心层仅自报;临床诊断见 ADAMS/HCAP |
| ADL/IADL 困难(RwADLA/RwIADLA) | 功能障碍 | MG2A 衰弱(age-related frailty)/ MG44 日常生活活动困难 | 5 项 ADL + 5 项 IADL |
§2.2 SNOMED CT 映射
| 临床场景 | HRS 数据路径 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 痴呆 | ADAMS/HCAP 临床诊断 + 核心算法推断 | 52448006 | Dementia (disorder) |
| 阿尔茨海默病 | ADAMS 分型诊断 | 26929004 | Alzheimer’s disease (disorder) |
| 轻度认知障碍(CIND/MCI) | ADAMS CIND / HCAP MCI | 386805003 | Mild cognitive impairment (disorder) |
| 高血压 | 自报 + 血压实测 + DBS 无 | 38341003 | Hypertensive disorder, systemic arterial (disorder) |
| 2 型糖尿病 | 自报 + HbA1c(DBS/VBS) | 44054006 | Type 2 diabetes mellitus (disorder) |
| 卒中 | 自报 + Medicare claims | 230690007 | Stroke (disorder) |
| 心肌梗死 | 自报 + Medicare claims | 22298006 | Myocardial infarction (disorder) |
| 抑郁 | CES-D 8 项 + 自报 | 35489007 | Depressive disorder (disorder) |
| 衰弱 | ADL/IADL + 握力 + 步行速度 | 763357007 | Frailty (finding) |
§2.3 疾病简介
HRS 面向人口老龄化全疾病谱,其医学重心是认知衰退与痴呆。痴呆是老年人群致残与致死的首要原因之一:ADAMS 子研究(856 名 71 岁以上参与者的临床评估)估计 2002 年美国 71 岁以上人群痴呆患病率为 13.9%、无痴呆认知障碍(CIND)为 22.2%(Plassman 2007/2008);Langa 等人 2017 年基于 HRS 算法分类报告 65 岁以上患病率从 2000 年 11.6% 降至 2012 年 8.8%。经济负担同样惊人:Hurd 等人 2013 年(NEJM)估计痴呆年货币成本约 2,000 亿美元,为美国最昂贵的慢病之一。此外,高血压、糖尿病、心脏病、卒中与关节炎构成的多病共存(multimorbidity)是 HRS-Medicare 联动研究的主战场——65 岁以上 FFS 受益人中多病共存(≥2 种 CCW 慢病)为常态,高多病共存(≥5 种)与住院、死亡强相关(Dorr 2024)。
§2.4 临床任务定义
| AI 任务 | 临床定义 | 标准参考 | 在 HRS 中的操作化 |
|---|---|---|---|
| 痴呆分类 | 记忆与多项认知域受损并影响日常功能 | ADAMS 临床共识诊断(NINCDS-ADRDA 等) | 核心层:Langa-Weir 切点(0-27 分,0-6 为痴呆)或 Gianattasio 算法;校准层:ADAMS/HCAP |
| CIND/MCI 识别 | 认知受损未达痴呆标准 | ADAMS CIND / HCAP MCI(Manly 2022) | Langa-Weir 7-11 分;HCAP 算法 |
| 死亡预测 | 全因死亡 | NDI + exit interview | Tracker 文件死亡年份 + exit 访谈 |
| 多病共存评估 | ≥2 种 / ≥5 种慢病共存 | HHS Multimorbidity Framework + CMS CCW 算法 | HRS-Medicare FFS claims(22,791 人可算 CCW) |
| 衰弱表型 | Fried 表型(体重下降/疲乏/握力低/步速慢/活动少) | Fried et al. 2001 | 身体测量(握力、计时行走)+ 问卷条目组合 |
| 抑郁筛查 | CES-D 8 项 ≥3/4 分 | CES-D 简版社区切点 | RwDEPRE 等派生变量 |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 美国全国多阶段区域概率抽样(社区居住 50+ 人群;搬入养老机构后继续追踪) |
| 采集时间 | 1992 年至今(核心 16 波至 2022;每两年一波) |
| 累计规模 | 43,216 名年龄合格受访者(1992-2016,至少一波有正权重;Dorr 2024);23,000+ 户(Sonnega 2014) |
| 每波规模 | 18,000-23,000 人 |
| 入组年龄 | 新队列 51-56 岁(配偶不限年龄);AHEAD 为 70+ |
| 性别 | 约 55-60% 女性(老龄队列典型构成,随存活结构波动) |
| 种族/族裔 | 非裔与西班牙裔 2:1 超采(原始设计);不作其他少数族裔超采——全国代表性估计必须使用抽样权重 |
| 出生队列 | HRS 1931-41 / AHEAD ≤1923 / CODA 1924-30 / WB 1942-47 / EBB 1948-53 / MBB 1954-59 / LBB 1960-65 / EGENX 1966-71 |
| 追踪规则 | 夫妇双方均入组;失能时由 proxy(多为配偶/子女)代答;死亡后做 exit interview 与 post-exit |
| 应答率 | 基线约 73%;随访 80-90%+;2016 年前面板保留率持续 >85% |
§2.6 金标准/参考标准
HRS 的标签体系是"多源异构"的,不同路径的可靠性差异极大——这是使用该数据训练模型前必须理解的第一课:
| 数据来源 | 记录方式 | 产生者 | 金标准性质 |
|---|---|---|---|
| 核心问卷疾病条目 | 自报"医生是否告知过诊断"(2 年回顾窗) | 受访者本人或 proxy | 中等可靠:高血压/糖尿病自报与实测一致性较好;痴呆自报严重低估 |
| 认知测验(TICS 系电池) | 访谈员施测:即时/延迟 10 词回忆、serial 7s、倒数、命名、定向 | 受训访谈员 | 筛查工具非诊断;proxy 受访者不测,改用 IQCODE 与访谈者评估 |
| ADAMS 临床诊断 | 入户神经心理测验 + 神经科检查 + 病史,专家共识诊断 | ADAMS 临床团队( Duke/密歇根等) | 全国代表性痴呆诊断金标准(856 人,A-D 波) |
| HCAP 认知诊断 | 2016/2022 两轮:扩展神经心理测验 + 知情人访谈 | HCAP 团队 | ADAMS 的当代接班(≥65 岁随机半样本) |
| 生物标志物 | DBS(2006-2014)/ 静脉血 VBS(2016):HbA1c、血脂、CRP、胱抑素 C、ATN、GDF-15、suPAR | 实验室检测 | 客观定量;采样率为半样本且有 consent 选择 |
| Medicare claims | CMS 计费记录(FFS 受益人) | CMS | 行政编码:CCW 算法可操作化 21 种慢病;仅覆盖 FFS(22,791/43,216) |
| 死亡 | NDI 匹配 + exit interview | 国家死亡指数 + 亲属 | 高可靠;exit 提供死亡日期、临终照护与遗产信息 |
| 基因分型 | Illumina HumanOmni 2.5 Quad,CIDR 执行 | NIH CIDR | 约 20,000 人 × 250 万 SNP;QC 报告公开 |
§3 数据集规格
§3.0 版本抉择矩阵
HRS 的数据产品体系庞大,90% 的"从哪开始"困惑可用下表解决:
| 你的需求 | 推荐产品 | 获取层级 | 理由 |
|---|---|---|---|
| 绝大多数流行病学/ML 分析(纵向、派生变量、收入财富插补) | RAND HRS Longitudinal File 2022 (V1) | 公开(注册) | 一人一行宽格式,16 波统一命名(R1-R16),含 RAND 收入/资产/医疗支出插补;社区分析的事实标准 |
| 需要问卷原始变量、模块级细节、官方 codebook | 原始波次文件(Biennial Core) | 公开(注册) | 每波一个产品包,按 Section(A-Y)分模块;变量名为波次前缀(如 H12…) |
| 跨国比较研究 | Harmonized HRS(Gateway to Global Aging) | 公开(注册) | USC 出品的跨波协调变量版,与 Harmonized ELSA/SHARE/CHARLS 同定义 |
| 痴呆临床金标准建模 | ADAMS A-D 波 + HCAP 2016/2022 | 敏感健康数据 | 856 人(ADAMS)+ ≥65 半样本(HCAP)的临床/神经心理诊断 |
| 血液生物标志物/ATN/转录组 | Biomarker Data 2006-2016 + VBS 2016 | 敏感健康数据 | DBS 六波 + 静脉血(V3.0,2025-04);ATN 约 4,500 人;RNASeq n=3,748 |
| GWAS/PGS/甲基化 | dbGaP phs000428(v1/v2)/ NIAGADS(v3/v4/DNAm)/ PGS v5 | dbGaP·NIAGADS DAR / 敏感 | 基因型走 NIH 平台,须用 cross-reference 文件回链 HHIDPN |
| Medicare/SSA/NDI 联动、精确日期、地理 | Restricted Data(RDA + VDI 飞地) | 受限 | 须提交研究计划与 IRB,虚拟桌面内分析 |
一句话结论:先用公开层 RAND Longitudinal File 跑通全流程;需要临床标签、分子数据或行政联动时,再逐级申请敏感/受限层。
§3.1 模态详细说明
HRS 包含五大模态:
- 纵向社会调查(核心):2022 版 codebook 按 Section 组织——PR Preload / A Coverscreen / B Demographics / C Physical Health / D Cognition / E Family / F Parents&Siblings / G Functional Limitations & Helpers / H Housing / I Physical Measures / J Employment / J2 Pension / J3 Retirement / M Disability / N Health Services & Insurance / P Expectations / Q Assets & Income / R Asset Change / S Widowhood & Divorce / T Wills / V Modules / W Event History·Internet·Social Security / LB Leave-Behind。每波还有随机分配的实验模块(V 区)。
- 认知测量:TICS 系电池(即时/延迟 10 词回忆、serial 7s、倒数计数、物品命名、日期与总统定向,总分 0-35);proxy 受访者走知情人评估路径;ADAMS/HCAP 提供临床级神经心理测验。
- 身体测量与生物标志物:增强面对面子样本(每 4 年轮换)测握力、血压、身高体重、腰围、计时行走、肺功能;2006 起 DBS(HbA1c/总胆固醇/HDL/CRP/胱抑素 C),2016 VBS 静脉血(ATN 神经退行标志物约 4,500 人、GDF-15、suPAR、甲状腺 n=1,022、RNASeq n=3,748)。
- 基因组:2006-2012 年唾液 DNA(2006 漱口法→2008 起 Oragene,完成率 83%/84%/80%),约 20,000 人 Illumina HumanOmni 2.5 分型;衍生 PGS v5、表观遗传时钟、端粒(2008)、APOE/5-HTT、外显子组与 DNAm(NIAGADS)。
- 行政联动:Medicare claims(>80% 同意、98% 匹配)、SSA 收入/福利记录、NDI、雇主养老金与健康计划、VA;另有地理/NaNDA 环境上下文受限数据。
§3.2 样本量拆分(波次 × 队列结构)
核心波次与进入队列(16 波,1992-2022):
| 进入年份 | 队列(出生年份) | 角色 |
|---|---|---|
| 1992 | HRS(1931-41) | 创始队列,12,600+ 人(7,600 户) |
| 1993 | AHEAD(≤1923) | 高龄队列(1993/1995 单独访谈) |
| 1998 | CODA(1924-30)+ WB(1942-47) | 合并进入 steady-state |
| 2004 | EBB(1948-53) | 首次 6 年刷新 |
| 2010 | MBB(1954-59) | 第二次刷新 |
| 2016 | LBB(1960-65) | 第三次刷新 |
| 2022 | EGENX(1966-71) | 第四次刷新(Final V1.0 于 2025-11 发布) |
关键子研究规模:
| 子研究 | 年份 | 规模 | 层级 |
|---|---|---|---|
| ADAMS(痴呆诊断) | 2001-2005(A-D 波) | 856 人完成评估(自 1,770 名抽样) | 敏感 |
| HCAP | 2016 / 2022 | ≥65 岁随机半样本 | 敏感 |
| VBS 静脉血 | 2016 | ATN 约 4,500 人;RNASeq 3,748 | 敏感 |
| 基因分型 | 2006-2012 | 约 20,000 人 | dbGaP/NIAGADS |
| Medicare 联动 | 1991 起持续 | 25,881 人联动;22,791 为 FFS(1992-2016 口径) | 受限 |
| CAMS 消费活动 | 2001-2023(12 波) | 核心子样本邮寄问卷 | 公开 |
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 公开波次文件 | SAS / Stata / SPSS + codebook(HTML/PDF) | 按 Section 分模块 zip 分包 |
| RAND 产品 | Stata(.dta)/ SAS(.sas7bdat)为主 | Longitudinal File、Fat Files、Detailed Imputations、CAMS 等 |
| Tracker 文件 | 同上 | 一人一行的跨波状态总表(2022 Final V1.0,2025-12) |
| 基因型 | PLINK / VCF(dbGaP、NIAGADS) | 须配 cross-reference 文件回链 HHIDPN |
| 敏感健康数据 | SAS/Stata 数据文件 | 经 Sensitive Health Data Order Form 申请后下载 |
| 受限数据 | VDI 虚拟桌面内访问 | 数据不出飞地,结果导出需审核 |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| 公开调查全量(16 波 + RAND 产品) | 数百 MB 至约 1 GB | 按波/产品分包下载,普通笔记本可处理 |
| RAND Longitudinal File 2022 | 约百 MB 级 | 单行记录 × 数千变量宽表 |
| 基因型(约 20,000 × 2.5M SNP) | 数十 GB(PLINK) | 走 dbGaP/NIAGADS 受控下载 |
| VDI 受限数据 | 不计本地 | 飞地内计算 |
§3.5 标注方式
HRS 无传统 ML 标注管线,"标签"来源四层:
- 自报条目:“自上次访谈以来,是否有医生告诉过您患有……”——低成本但存在回忆与诊断通达偏倚。
- 测验与测量:认知电池、CES-D、握力、血压、步行速度——仪器/访谈员施测。
- 临床裁决(校准层):ADAMS(神经心理 + 神经科检查 + 专家共识)与 HCAP(扩展测验 + 知情人报告,Manly 2022 算法)——痴呆/CIND/MCI 金标准。
- 行政记录:Medicare CCW 算法病种标记、NDI 死亡、SSA 收入——计费/登记口径。
由此衍生出算法标注层:Langa-Weir 切点、Hurd 模型、Gianattasio Expert/LASSO/modified Hurd 等,把核心问卷变量映射为痴呆概率/分类——这是 HRS 独有的"标注即研究对象"现象(详见 §6.5 坑点 2、3)。
§3.6 标注者资质
| 角色 | 资质/质控 |
|---|---|
| 访谈员 | SRC 专业访谈团队,统一培训与认证;混合模式施测 |
| ADAMS 评估者 | 受过神经心理测验专项培训的评估员入户施测;诊断由多学科专家共识会议裁定 |
| HCAP 评估者 | 同 ADAMS 体系;知情人报告由配偶/近亲/好友提供 |
| 基因分型 | NIH 下属 Center for Inherited Disease Research(CIDR)执行,QC 报告公开 |
| 血液检测 | 合作临床实验室(CLIA 体系) |
§3.7 数据采集时间范围
核心调查 1992-2022(16 波,2024 波在田野中);AHEAD 分支 1993/1995 单独采集后于 1998 并入。生物标志物 2006 起;基因 2006-2012(v4 扩至 2006-2016);VBS 2016;HCAP 2016/2022;CAMS 2001-2023。注意公开层不含精确日期(仅年份),月/日级日期属受限数据。
§3.8 地理覆盖
美国全国( contiguous US 多阶段区域概率抽样;原始设计另对佛罗里达居民超采)。公开数据仅含 Census region 级地理;Census tract 级地理与 NaNDA 环境上下文属受限数据。
§3.9 采集设备规格
| 采集 | 设备/方法 | 时段 |
|---|---|---|
| 基因分型 | Illumina HumanOmni 2.5 Quad BeadChip(2.5M SNP),CIDR | 2006-2012(v4 至 2016) |
| DNA 采样 | 2006 漱口法 → 2008 起 Oragene 唾液管 | 2006-2012 |
| 干血斑(DBS) | 滤纸血斑,HbA1c/血脂/CRP/胱抑素 C/IL6 | 2006-2016 |
| 静脉血 | VBS 2016:ATN、GDF-15、suPAR、甲状腺、RNASeq、DNAm | 2016 |
| 身体测量 | 握力计、血压计、计时行走步道、肺功能仪 | 2004 起增强面对面 |
| 认知 | TICS 系标准化访谈电池(电话可施测) | 全程 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 抽样框 | 多阶段区域概率抽样(Heeringa & Connor 1995) | 全国住户 → 普查区 → 住户筛选;非裔/西裔 2:1 超采 |
| 2. 田野采集 | SRC 访谈员混合模式施测;proxy 机制 | 核心 2 年波次;增强面对面 4 年轮半样本 |
| 3. 衍生加工 | RAND Center for the Study of Aging | 原始波次 → Fat Files → Longitudinal File(含收入/资产/支出插补与概念变量) |
| 4. 校准子研究 | ADAMS(2001-2005)/ HCAP(2016/2022) | 抽样自核心 → 临床评估 → 权重回推全国 |
| 5. 分子层 | CIDR 分型 + 合作实验室检测 | 唾液/DBS/静脉血 → GWAS/PGS/甲基化/标志物面板 |
| 6. 行政联动 | CMS/SSA/NDI/雇主(知情同意) | 个体级加密链接;同意率 >80%、匹配率 98% |
| 7. 分级发布 | hrsdata.isr.umich.edu 三层体系 | 公开(注册)/ 敏感(补充申请)/ 受限(RDA+VDI);基因走 dbGaP/NIAGADS + cross-reference |
§4 数据结构详解
§4.0 目录结构预览
以公开层典型下载组合为例(RAND 产品 + 2022 波次原始文件 + Tracker):
hrs_data/
├── rand/
│ ├── randhrs1992_2022v1.dta # RAND Longitudinal File 2022 (V1):一人一行宽表(核心起点)
│ ├── randhrs1992_2022v1.sas7bdat # 同上 SAS 版
│ ├── randhrs1992_2022v1.pdf # RAND Codebook(变量构造与插补文档,必读)
│ ├── randhrsfat2022.dta # 2022 Fat File(该波原始变量 RAND 化)
│ └── randhrs_imputations2022v1.dta # Detailed Imputations File 2022
├── biennial/
│ ├── h22core/ # 2022 Core Final V1.0(按 Section 分包)
│ │ ├── h22a_r.dta # Section A: Coverscreen(Respondent)
│ │ ├── h22c_r.dta # Section C: Physical Health
│ │ ├── h22d_r.dta # Section D: Cognition
│ │ ├── h22g_r.dta # Section G: Functional Limitations
│ │ ├── h22n_r.dta # Section N: Health Services & Insurance
│ │ └── ... # B/E/F/H/I/J/M/P/Q/R/S/T/V/W/LB 等
│ ├── h20core/ h18core/ ... # 其余波次(H20/H18/... 波次前缀不同)
│ └── codebook/ # 官方 HTML/PDF codebook
├── tracker/
│ └── trk2022tr_r.dta # 2022 Tracker Final V1.0:跨波状态总表(含死亡/失访)
└── harmonized/
└── harmonized_hrs.dta # Gateway to Global Aging 协调版(可选)
关键认知:原始波次文件按 HHID + PN(或合并键 HHIDPN)关联;RAND 文件已把家庭/配偶信息拍平到受访者记录上。波次前缀规则:原始文件用 H1-H16 风格前缀(1992 为 H1),RAND 变量用 R1-R16 受访者级前缀、H1-H16 家庭级前缀、S1-S16 配偶前缀。
§4.1 DAIMS 标准化字段描述表
RAND HRS Longitudinal File 核心字段(宽表,波次变量以 Rw 表示 w=1…16)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| HHIDPN | CHAR(9) | 个人唯一 ID(HHID+PN 合并) | “010077010” | 一切关联的主键 | 无 | 不允许缺失 | 字符串 |
| HHID / PN | NUM | 户 ID / 个人号 | 10077 / 10 | 拆分主键;家庭聚合 | 无 | 不允许缺失 | 正整数 |
| Hacohort | NUM | 进入队列 | 3 | 队列分层/时代效应 | 无 | 不允许缺失 | 0=HRS,1=AHEAD,2=CODA,3=WB,4=EBB,5=MBB,6=LBB,7=EGENX |
| RAGENDER | NUM | 性别 | 2 | 协变量/公平性 | 极少冲突 | 不允许缺失 | 1=男,2=女 |
| RARACEM / RAHISPAN | NUM | 种族 / 西裔 | 1 / 0 | 公平性分析 | 自报 | 少量缺失 | 1=白,2=黑,3=其他 |
| RABYEAR | NUM | 出生年 | 1936 | 年龄计算(公开层无月日) | 无 | 不允许缺失 | 1890-1971+ |
| RwAGE | NUM | 该波访谈年龄 | 74 | 时序特征 | 由出生年推算 | 未访谈该波为缺失 | 0-110 |
| RwIWSTAT | NUM | 该波访谈状态 | 1 | 样本流/删失定义 | 无 | 不允许缺失 | 1=自答,2=proxy,4=死亡,5=失访等 |
| RwCOGTOT | NUM | 认知总分(0-35) | 22 | 认知结局/特征 | proxy 不可测 | proxy 为缺失(MNAR,见坑点 4) | 0-35 |
| RwHIBPE / RwDIABE / RwHEARTE / RwSTROKE / RwCANCRE / RwLUNGE / RwARTHRE / RwPSYCHE | NUM | 八类自报疾病(“医生告知”) | 1 | 多病共存计数/结局 | 自报偏倚;2 年回顾窗 | 缺失表未确诊或漏报 | 0/1(部分波有 .d/.r 特殊码) |
| RwADLA / RwIADLA | NUM | ADL/IADL 困难计数 | 2 | 衰弱/功能结局 | 自报 | 少量缺失 | 0-5 / 0-5 |
| RwDEPRE | NUM | CES-D 8 项抑郁症状数 | 3 | 抑郁筛查 | 自报 | proxy 缺失 | 0-8 |
| RwSHLT | NUM | 自评健康 | 2 | 通用健康指标 | 自报 | 少量缺失 | 1=极好-5=差 |
| RwWTRESP | NUM | 受访者分析权重 | 1245.3 | 全国代表性估计必用 | 设计权重 | 无权者为 0 | ≥0 |
| RAEYEAR | NUM | exit 访谈年(死亡年份近似) | 2012 | 生存分析终点 | exit 访谈滞后 | 生存者为缺失(右删失) | 1994-2022 |
原始波次文件(Section C/D 示例,H22 前缀):变量按 Section 编号(如 HC036 高血压、HD174 延迟回忆),逐波 codebook 查询;与 RAND 派生变量可经 HHIDPN 回链补充未派生的原始变量。
§4.2 标签分布统计
| 结局 | 阳性率/分布 | 口径与出处 |
|---|---|---|
| 痴呆(65+,2012,Langa-Weir 算法) | 8.8% | Langa et al. 2017, JAMA Intern Med |
| 痴呆(65+,2012,Hudomiet 算法口径) | 10.5% | Hudomiet et al. 2018 |
| 痴呆(71+,2002,ADAMS 临床诊断) | 13.9% | Plassman et al. 2007 |
| CIND(71+,2002,ADAMS) | 22.2% | Plassman et al. 2008 |
| 高血压(65+,自报) | 约 55-60% | HRS 文献典型区间 |
| 糖尿病(65+,自报) | 约 20-25% | HRS 文献典型区间 |
| 多病共存(≥5 种 CCW 病种,FFS 联动子集) | 见 Dorr 2024 | HRS-Medicare 22,791 人 FFS 口径 |
| 死亡(面板累计) | Tracker 文件可查 | 1992-2022 间大量波次死亡事件,exit 覆盖高 |
⚠️ 同一"痴呆"结局在不同算法下患病率相差近 2 倍(8.8% vs 10.5% 仅是 2012 年一个横断面)——标签口径必须在论文方法学中显式声明(详见 §6.5 坑点 2)。
§4.3 关键字段描述性统计
- 核心访谈时长 90 分钟-3 小时;proxy 受访者占比随年龄上升(高龄段约 10%+)。
- RAND Longitudinal File 变量量级为数千列 × 4 万余人;每位受访者波次数从 1(新入组/早亡)到 16(全程存活)不等。
- 认知总分(RwCOGTOT,0-35)在高龄与低教育子群中左偏;Langa-Weir 版(0-27)专为跨年龄可比裁剪。
- 收入/资产/医疗支出由 RAND 多步插补(Detailed Imputations File 可查组件),直接使用原始未插补字段会有系统性项目无应答。
§4.4 数据层级关系
Household(HHID)
└─ Respondent(HHIDPN;夫妇各自成记录)
├─ Core Interview ×16 波(Section A-Y 模块)
├─ Exit / Post-Exit Interview(死亡后由亲属完成)
├─ 增强面对面半样本(身体测量 + DBS/VBS + Leave-Behind)
├─ 子研究(ADAMS / HCAP / CAMS / Diabetes / PDS / HWB / Life History / COVID-19)
├─ 分子层(GWAS / PGS / DNAm / Telomere / RNASeq——经 cross-reference 回链)
└─ 行政联动(Medicare / SSA / NDI / Pension——受限层)
- RAND 宽表 vs 原始波次文件:RAND 是"人 × 波次变量"的宽表(一人一行);原始文件是"波次 × 模块"的纵表集合。长格式纵向建模需把 RAND 宽表 reshape 为 person-wave 长表。
- 配偶/家庭变量:
S1-S16前缀为受访者配偶变量;H1-H16为家庭级(财务应答人提供)。建模时注意夫妻样本的非独立性。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 变量示例 | 机制 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| 波次缺失(attrition) | 全部波次变量 | 失访/死亡,与健康认知相关(MNAR) | RwIWSTAT 标明失访/死亡 | 需生存/IPCW 等正式处理,不可简单 complete-case |
| proxy 认知缺失 | RwCOGTOT | proxy 不测认知电池(设计性缺失) | proxy 受访者另有 IQCODE/访谈者评估变量 | 删 proxy 样本 → 高估人群认知、低估痴呆(坑点 4) |
| 项目无应答 | 收入/资产/医疗支出 | 拒答敏感财务问题 | RAND 已多重插补;原始字段含 .d/.r 特殊码 | 用 RAND 插补值,勿自行均值填充 |
| 特殊 SAS 缺失码 | 原始波次变量 | .d=不知道 .r=拒答 .m=其他 | 编码本身携带应答行为信息 | 建模前统一映射并考虑"拒答指示变量" |
| 生物标志物未采 | DBS/VBS 各指标 | 半样本设计 + consent 选择 | 采样指示变量可查 | 分析须用对应子样本权重 |
| 死亡终点删失 | RAEYEAR / NDI | 存活至末波为右删失 | Tracker 状态 | Kaplan-Meier/Cox 正确处理 |
§5 数据划分与使用建议
§5.1 官方数据划分
HRS 不提供官方 train/validation/test 划分——它是调查数据而非 ML 基准数据,社区也没有统一的固定划分。这意味着:任何两篇 HRS 机器学习论文的结果,在队列定义、波次窗口、权重处理不同时都不可直接比较。做方法学研究时应自行固定并公开划分代码。
§5.2 推荐划分策略
- 按人划分(基础纪律):同一受访者的多个波次必须落在同一侧。夫妻同户共享暴露(住房、财务),严格场景建议按 HHID 划分。
- 时间外验证(推荐):train 用 ≤2014 波、test 用 2016+ 波,评估模型对新波次/新队列(LBB 2016 入组、EGENX 2022 入组)的外推能力——HRS 的队列刷新设计天然提供"新出生队列外部测试"。
- 算法校准场景:以 ADAMS(2001-2005)为金标准训练、以 HCAP(2016)为时间外验证,复刻 Gianattasio 2019 的 time-split 验证设计。
- 权重感知评估:报告性能时同时给出未加权(预测个体)与加权(估计人群参数)两套口径,二者差异本身即算法公平性信号(Gianattasio 2019 加权/未加权 accuracy 差可达 10 个百分点)。
import pandas as pd
rand = pd.read_stata("rand/randhrs1992_2022v1.dta",
convert_categoricals=False)
# 按人划分:同一 HHIDPN 的全部波次归同一侧
subjects = rand["HHIDPN"].unique()
rng = pd.Series(subjects).sample(frac=1.0, random_state=42).to_numpy()
n_test = int(len(subjects) * 0.2)
test_ids = set(rng[:n_test])
rand["is_test"] = rand["HHIDPN"].isin(test_ids)
assert not (set(rand.loc[rand.is_test, "HHIDPN"])
& set(rand.loc[~rand.is_test, "HHIDPN"]))
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 同一受访者跨波泄漏(按 person-wave 随机划分) | 高 | 按 HHIDPN(或 HHID)分组划分 |
| 2 | 用未来波次变量预测当前结局(Preload 区含上次访谈信息,方向别搞反) | 高 | 严格按波次时间方向构造特征 |
| 3 | exit/post-exit 信息(死亡情况、临终照护)进入生存预测特征 | 高 | exit 变量只作终点与审查信息 |
| 4 | ADAMS/HCAP 诊断变量直接作为核心层特征(它们只存在于子样本) | 中 | 校准子研究只用于标签训练/验证 |
| 5 | Medicare claims 中的结局同期信息(用出院诊断预测"当期死亡") | 中 | claims 特征截断至预测时点之前 |
§5.4 交叉验证建议
- 5-10 折按 HHIDPN 分组交叉验证;小样本子研究(ADAMS n=856)用嵌套 CV 防止调参泄漏。
- 时间分层:以入组队列(Hacohort)为折叠轴做"留一队列验证",检验跨出生队列稳健性。
§5.5 外部验证
经典路径:HRS 训练 → ELSA/SHARE/CHARLS(经 Gateway to Global Aging 协调变量跨库验证,认知算法文献已大量采用);NHATS(美国本土同主题队列,与 HCAP 有正式认知共校准研究);ADAMS → HCAP(库内时间外金标准迁移)。注意跨国验证时问卷条目、访谈模式与文化差异(见 §7.3)。
§6 AI 就绪指南
§6.0 云端快速启动
30 分钟拿到数据的最短路径(无需任何审批):① 在 https://hrsdata.isr.umich.edu/user/register 注册账号(邮箱验证即可);② 登录后进入 RAND HRS Products → RAND HRS Longitudinal File 2022 (V1),下载 .dta 或 .sas7bdat;③ 配合官方 Codebook(PDF)与 Sonnega 的《Using HRS Data: A Guide for New Users》(含 R/SAS/Stata/SPSS 四语言示例代码)即可开工。公开层点击即得,无人工审核环节。
不想下载的在线探索:HRS Concordance 工具(跨波变量检索)与官网 codebook 可在线查阅全部公开变量定义;Gateway to Global Aging(g2aging.org)提供跨库协调变量的在线检索。
§6.1 快速上手(Python + RAND 文件)
# ========================================
# HRS 快速上手 — Python + RAND Longitudinal File
# 环境要求: pandas>=2.0, numpy, scikit-learn
#
# ⚠️ 目录结构预期:
# ./hrs_data/
# └── rand/
# └── randhrs1992_2022v1.dta # RAND Longitudinal File 2022 (V1)
#
# RAND 文件为宽表:一人一行;波次变量带 R1-R16 前缀
# (w=1 对应 1992,w=16 对应 2022)。
# 分析前建议 reshape 为 person-wave 长表。
# ========================================
import pandas as pd
import numpy as np
df = pd.read_stata("hrs_data/rand/randhrs1992_2022v1.dta",
convert_categoricals=False)
# --- 步骤 1:宽表 → 长表(以 2000-2016 共 9 个波次为例:w=5..13 中 2016 为 w=13)
WAVES = list(range(5, 14)) # 2000(w5) 到 2016(w13)
YEAR = {w: 1992 + 2 * (w - 1) for w in WAVES} # w5=2000 ... w13=2016
long = (df.set_index("HHIDPN")
.rename(columns={f"R{w}AGE": f"age_{w}" for w in WAVES}))
def wave_var(df, stub, waves):
cols = {f"R{w}{stub}": w for w in waves if f"R{w}{stub}" in df.columns}
sub = df[["HHIDPN"] + list(cols)].melt(id_vars="HHIDPN",
value_name=stub, var_name="tmp")
sub["wave"] = sub["tmp"].map(cols)
return sub.drop(columns="tmp")
parts = [wave_var(df, s, WAVES) for s in
["AGE", "IWSTAT", "COGTOT", "HIBPE", "DIABE", "STROKE",
"HEARTE", "ADLA", "DEPRE", "SHLT", "WTRESP"]]
long = parts[0]
for p in parts[1:]:
long = long.merge(p, on=["HHIDPN", "wave"], how="outer")
long["year"] = long["wave"].map(YEAR)
# --- 步骤 2:Langa-Weir 痴呆分类(0-27 版本:0-6 痴呆 / 7-11 CIND / 12-27 正常)
# 注:COGTOT 为 0-35 全量表;严格的 Langa-Weir 需用即时+延迟回忆+serial7+倒数的
# 0-27 子分数。此处以官方发布的 Langa-Weir 分类文件或自行按 0-27 重算为准。
def lw_classify(score27):
if pd.isna(score27): return np.nan
return 2 if score27 <= 6 else (1 if score27 <= 11 else 0) # 2=痴呆 1=CIND 0=正常
print(long.groupby("year")["COGTOT"].mean())
print(f"person-wave 记录数: {len(long):,}")
§6.2 数据获取流程
| 层级 | 内容 | 入口 | 流程与周期 |
|---|---|---|---|
| 公开 | 16 波核心 + exit + CAMS + RAND 全部产品 + Tracker + Harmonized | https://hrsdata.isr.umich.edu/ | 注册 → 在线同意 Conditions of Use → 立即下载(分钟级) |
| 敏感健康 | 生物标志物 6 波、VBS 2016、ADAMS、HCAP、PGS v5、表观遗传时钟、端粒、APOE、PDS 等 | 同站 Sensitive Health Data Order Form | 补充注册申请,人工处理(数个工作日) |
| 受限 | Medicare/SSA/NDI 联动、精确日期、地理、雇主养老金、候选基因/SNP、外显子 | Restricted Data(RDA + VDI) | 提交研究计划 + IRB 批件 + 签署 RDA;VDI 飞地内分析(周-月级) |
| 基因 | 基因型 v1/v2(dbGaP phs000428)、v3/v4 与 DNAm(NIAGADS) | dbGaP / NIAGADS DAR | NIH 平台授权访问申请 → 获批后再向 HRS 申请 cross-reference 文件 + 签署 Genetic Data Access Use Agreement |
合规要点:公开数据仅限研究与统计用途、禁止重识别、发表需寄送副本;三层协议不可混用;dbGaP 数据与 HRS 表型数据合并必须通过官方 cross-reference 文件(HHIDPN ↔ dbGaP subject ID),禁止自行匹配。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整 5 步预处理代码(痴呆算法分类任务示例)</b></summary>
# 步骤 1:构建分析队列(65+、自答或 proxy、有认知或 proxy 评估)
import pandas as pd, numpy as np
rand = pd.read_stata("hrs_data/rand/randhrs1992_2022v1.dta",
convert_categoricals=False)
trk = pd.read_stata("hrs_data/tracker/trk2022tr_r.dta")
w = 13 # 2016 波
d = pd.DataFrame({
"HHIDPN": rand["HHIDPN"],
"age": rand[f"R{w}AGE"],
"iwstat": rand[f"R{w}IWSTAT"],
"cogtot": rand[f"R{w}COGTOT"],
"proxy": (rand[f"R{w}IWSTAT"] == 2).astype(int),
"wt": rand[f"R{w}WTRESP"],
"female": (rand["RAGENDER"] == 2).astype(int),
"race": rand["RARACEM"],
"hisp": rand["RAHISPAN"],
"educ": rand["RAEDYRS"] if "RAEDYRS" in rand else np.nan,
})
d = d[d["age"] >= 65]
# 步骤 2:标签——优先使用官方 Langa-Weir 分类发布文件;
# 或 Gianattasio-Power 算法发布文件(2000-2016 痴呆概率与分类)。
# 自行重算时:0-27 子分数 = 即时回忆(0-10)+延迟回忆(0-10)+serial7(0-5)+倒数(0-2)
# 自答者:0-6 痴呆 / 7-11 CIND / 12-27 正常;proxy 走 IQCODE 路径单独切点。
d["dem_lw"] = np.where(d["cogtot"] <= 6, 2,
np.where(d["cogtot"] <= 11, 1, 0)) # 示意:严格口径请用 0-27 子分数
# 步骤 3:特殊缺失码清洗 + 特征工程
for c in ["cogtot", "educ"]:
d[c] = pd.to_numeric(d[c], errors="coerce")
d["any_adl"] = (rand[f"R{w}ADLA"] > 0).astype(float)
d["multimorb"] = (rand[[f"R{w}HIBPE", f"R{w}DIABE", f"R{w}HEARTE",
f"R{w}STROKE", f"R{w}CANCRE", f"R{w}LUNGE",
f"R{w}ARTHRE", f"R{w}PSYCHE"]]
.apply(pd.to_numeric, errors="coerce").sum(axis=1))
# 步骤 4:权重与抽样设计声明(全国估计必做)
# survey 设计:分层 + 聚类 + 权重;Python 可用 samplics/statsmodels,
# R 生态推荐 survey 包(svydesign(ids=~HHID, weights=~R13WTRESP))。
# 步骤 5:导出训练矩阵(自答与 proxy 分开建模或加 proxy 指示变量)
d.to_parquet("hrs_wave13_analytic.parquet")
print(d["dem_lw"].value_counts(normalize=True))
</details>
优先复用社区成品:Langa-Weir 认知分类官方发布文件(1995-2016)、Gianattasio-Power 痴呆概率与分类文件(2000-2016,含 Expert/Hurd/LASSO 三算法)、RAND 插补与概念变量——自行从原始波次重建这些内容属于重复造轮子且易错。
§6.4 框架加载
import torch
from torch.utils.data import Dataset, DataLoader
class HRSDataset(Dataset):
"""person-wave 长表 → 张量。weights 列可选传入用于加权损失。"""
def __init__(self, X, y, w=None):
self.X = torch.FloatTensor(np.nan_to_num(X))
self.y = torch.LongTensor(y)
self.w = None if w is None else torch.FloatTensor(w)
def __len__(self):
return len(self.y)
def __getitem__(self, i):
if self.w is None:
return self.X[i], self.y[i]
return self.X[i], self.y[i], self.w[i]
loader = DataLoader(HRSDataset(X_train, y_train, w_train),
batch_size=512, shuffle=True)
# 加权交叉熵:loss = (F.cross_entropy(logits, y, reduction="none") * w).mean()
import xgboost as xgb # 表格基线:XGBoost + 调查权重
dtrain = xgb.DMatrix(X_train, label=y_train, weight=w_train)
params = {"objective": "multi:softprob", "num_class": 3,
"eval_metric": "mlogloss", "max_depth": 5, "eta": 0.05}
model = xgb.train(params, dtrain, num_boost_round=800)
§6.5 常见坑点
⚠️ 坑点 1:不用抽样权重做全国估计——超采设计直接反噬结论(分类:评估误用)
问题:HRS 对非裔与西班牙裔做 2:1 超采、多阶段区域概率抽样还有聚类与分层。不加权时少数族裔占比虚高一倍,任何"美国 65+ 人群患病率/均值"类估计系统性错误;标准误也因忽略聚类而被低估。
症状:你算出的痴呆患病率、种族构成与官方文献(如 Langa 2017 的 8.8%)对不上;置信区间异常窄。
解决:描述性与人群参数估计一律使用权重(RAND 的
RwWTRESP,配合分层/聚类变量走 survey 设计:R 的survey::svydesign或 Pythonsamplics);Gianattasio 2019 显示加权/未加权 accuracy 差可达 10 个百分点——两套口径都报告。预测个体结局(非人群参数)的纯 ML 任务可用未加权,但必须在方法学中声明。参考:HRS《Sample Design and Methods》(Heeringa & Connor 1995);RAND《HRS Weights Explained》;Gianattasio et al. 2019, Epidemiology 30(2):291-302。
⚠️ 坑点 2:痴呆标签多套算法并存,患病率差近 2 倍(分类:标签理解)
问题:核心问卷没有临床痴呆诊断,社区存在 Herzog-Wallace、Langa-Kabeto-Weir、Crimmins、Wu、Hurd、Gianattasio 等多套算法。2012 年 65+ 患病率估计从 8.8%(Langa 2017)到 10.5%(Hudomiet 2018)不等;Gianattasio 2019 报告五算法灵敏度 53-90%、特异度 79-97%。
症状:换一个算法,你的"痴呆阳性样本"换手率高达 30%+;与文献比性能时对方用的是另一套标签。
解决:方法学中显式声明算法名称、版本与切点;主分析 + 至少一套替代算法做敏感性分析;追求跨种族公平性用 Gianattasio 2020 推荐算法;需要临床金标准时直接以 ADAMS/HCAP 子样本为标签训练。
参考:Gianattasio et al. 2019(DOI: 10.1097/EDE.0000000000000945);Gianattasio et al. 2020(DOI: 10.1097/EDE.0000000000001101)。
⚠️ 坑点 3:跨种族 naïve 应用单一切点 → 差异研究系统性偏倚(分类:偏倚陷阱)
问题:Gianattasio 2019 证实:同一切点在非裔/西裔中灵敏度更高、特异度更低(教育与测验文化偏倚所致)。直接套用切点做"种族间痴呆率差异"研究,会把测量误差当成真实差异,得出夸大且可能方向错误的 disparity 结论。
症状:少数族裔"患病率"异常高;算法分组性能表中 sens/spec 跨组差 >5 个百分点。
解决:采用 Gianattasio 2020 开发的公平性约束算法(跨组 sens 差 ≤3pp、spec 差 ≤5pp,总体 acc 90-92%);或按组分别校准切点并报告分组性能;差异研究必须引用该文献说明算法选择理由。
参考:Gianattasio, Ciarleglio & Power 2020, Epidemiology 31(1):126-133。
⚠️ 坑点 4:删掉 proxy 受访者 = 删掉最可能痴呆的人(分类:偏倚陷阱)
问题:proxy 受访者(多为认知/身体严重受损者)不测 TICS 电池,
COGTOT为缺失。complete-case 分析直接删除他们,等于按结局选择样本——ADAMS 缺失样本中约一半后被诊断为痴呆。症状:高龄段"认知均分"异常偏高;痴呆患病率被低估;预测模型在养老机构人群中失效。
解决:proxy 用其专属评估路径(IQCODE 知情人评分 + 访谈者观察 + JORM 等)构造标签;或把 proxy 指示变量作为特征并做敏分;正式方法用多重插补/选择模型。Weir et al. 2011(HRS vs ELSA)系统量化了该偏倚。
参考:Weir, Faul, Langa 2011, Longitudinal and Life Course Studies 2(2):170-184;Crimmins et al. 2011, J Gerontol B 66(S1)。
⚠️ 坑点 5:"自上次访谈以来新诊断"是 2 年间期发病,不是现患(分类:标签理解)
问题:疾病条目问的是"since last interview, has a doctor told you…“。把新发条目当横断面患病率、或忽略 2 年窗口期内的死亡/失访者(他们的间期事件不可观测),都会扭曲发病/患病估计。且自报条目依赖"看过医生且被告知”——无医保/低就医人群系统性低估。
症状:发病率随随访间隔长短"变化";低 SES 组慢病率反常地低。
解决:区分"累计曾患(ever)"与"间期新发(incident)"变量;间期事件用离散时间生存模型处理死亡竞争风险;客观指标(HbA1c、血压实测、Medicare claims)校验自报。
参考:HRS 核心 codebook Section C 说明;Dorr et al. 2024(CCW claims 口径对照)。
⚠️ 坑点 6:面板流失与死亡是 MNAR,complete-case 分析结论外推受限(分类:评估误用)
问题:随访应答 80-90% 虽高,但流失与认知差、健康差、高龄强相关;死亡更是健康轨迹的终点事件。把"活到下一波且有完整数据"当分析集,模型学的是"幸存者健康轨迹"。
症状:高龄段危险因素效应被低估(死亡竞争风险);纵向轨迹异常"健康化"。
解决:生存结局用 Cox/共享随机效应联合模型;重复测量用逆概率删失加权(IPCW)或多重插补;死亡作为竞争事件而非删失(Fine-Gray)。Tracker 文件提供每波状态(存活/失访/死亡)供正式建模。
参考:HRS Tracker 文档;Weir et al. 2011。
⚠️ 坑点 7:RAND 宽表前缀与波次年份映射搞错(分类:工程陷阱)
问题:RAND 宽表中
R1-R16对应 1992-2022 双年波次,但 1993/1995 是 AHEAD 单独年份,导致R2=1993(AHEAD)/R3=1994 的映射与"纯双年"直觉不符;受访者级Rw、配偶级Sw、家庭级Hw前缀混用会拿错变量;宽表直接喂模型还会把 16 波当独立样本(泄漏,见坑点 5 关联)。症状:时间趋势图出现诡异断点;合并后行数爆炸或变量全缺。
解决:先查 RAND Codebook 的波次年表再写 reshape;统一以
HHIDPN为键;只取所需 stub(COGTOT/HIBPE/...)逐 stub melt;家庭/配偶变量明确降级为特征而非独立样本。参考:RAND HRS Longitudinal File Codebook(randhrs1992_2022v1.pdf)。
⚠️ 坑点 8:Medicare 联动只有 FFS,且申请路径与公开层完全不同(分类:工程陷阱)
问题:① Medicare claims 仅覆盖 fee-for-service 受益人(43,216 中 22,791 可算 CCW),Medicare Advantage(管理式医疗) enrollee 无 claims——MA 占比随年代上升,直接当"全人群医疗利用"会有时代性选择偏倚;② 联动数据属受限层(RDA+VDI),基因型又在 dbGaP/NIAGADS,跨平台回链必须用官方 cross-reference 文件,流程以月计。
症状:2010 年后医疗利用"突然下降"(实为 MA 渗透);以为注册了 HRS 账号就能下基因数据,项目排期被打乱。
解决:claims 分析限定 FFS 子集并声明外推边界;按 CCW 官方算法定义病种(≥1 住院或 ≥2 门诊等规则);基因/受限数据提前 2-3 个月启动 dbGaP/NIAGADS DAR 与 RDA 申请,把 cross-reference 等待期计入排期。
参考:Dorr et al. 2024, BMC Geriatrics 24:777;hrs.isr.umich.edu Genetic Data Access Summary。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 对连续变量(年龄、教育年限)加小幅噪声做稳健性检验 | 对认知测验分做 SMOTE 后再用同一切点分类(切点语义被破坏) |
| 按波次 bootstrap 重抽样估计置信区间 | 跨出生队列生成"合成受访者"(队列效应是真实信号) |
| 缺失指示变量 + 多重插补池化 | 用未来波次信息回填当前缺失(时间泄漏) |
| 保留 proxy 指示变量做数据增广 | 合并自答与 proxy 认知分后假装同质分布 |
| 不平衡处理:class weight / 加权损失 | 过采样少数族裔后声称"全国代表性" |
§6.7 模型推荐
| 任务 | 推荐方案 | 特征 | 参考性能 |
|---|---|---|---|
| 痴呆分类(对标社区) | Gianattasio LASSO/Expert 逻辑回归族 | 认知 + 功能 + 人口学(ADAMS 校准) | sens 77-83% / spec 92-94% / acc 90-92%(Gianattasio 2020) |
| 快速基线 | XGBoost + 调查权重 | RAND 派生变量单波截面 | 因队列而异,先复现 Langa-Weir 一致性 |
| 认知轨迹 | 线性混合模型 / 潜类别轨迹(LCGA) | 多波 COGTOT 长表 | — |
| 死亡预测 | Cox / 竞争风险 / 梯度提升生存(XGBoost AFT) | 多波时变协变量 | C-index 文献典型 0.75-0.85 |
| 多病共存聚类 | CCW 病种计数 + 轨迹聚类 | HRS-Medicare FFS 子集 | Dorr 2024 范式 |
| GWAS/PGS | PLINK 2 + REGENIE;PGS v5 直接可用 | 基因型(dbGaP/NIAGADS) | QC 报告见 CIDR 文档 |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 5 GB(公开层) | 100 GB+(含基因型 PLINK 文件与派生集) |
| 内存 | 8 GB(RAND 宽表可进内存) | 32 GB(长表 reshape + 多重插补) |
| GPU | 不需要(表格模型) | 1 × 16 GB(深度时序/LLM 特征工程实验) |
| 计算时间 | RAND 基线全流程 < 1 小时 | ADAMS 校准 + 敏感性分析 1-2 天 |
| 受限数据 | VDI 飞地内按配额 | 以 RDA 批准配置为准 |
§6.9 评估指标
from sklearn.metrics import roc_auc_score, brier_score_loss
import numpy as np
def weighted_sens_spec(y_true, y_pred, w):
"""调查加权的灵敏度/特异度——HRS 文献标准报告口径"""
y_true, y_pred, w = map(np.asarray, (y_true, y_pred, w))
tp = w[(y_true == 1) & (y_pred == 1)].sum()
fn = w[(y_true == 1) & (y_pred == 0)].sum()
tn = w[(y_true == 0) & (y_pred == 0)].sum()
fp = w[(y_true == 0) & (y_pred == 1)].sum()
return tp / (tp + fn), tn / (tn + fp)
def report(y_true, y_prob, y_pred, w, group=None):
sens, spec = weighted_sens_spec(y_true, y_pred, w)
print(f"Weighted Sens: {sens:.3f} Spec: {spec:.3f}")
print(f"AUROC: {roc_auc_score(y_true, y_prob, sample_weight=w):.4f}")
print(f"Brier: {brier_score_loss(y_true, y_prob, sample_weight=w):.4f}")
if group is not None: # 公平性:分种族/族裔报告 sens/spec 差
for g in np.unique(group):
m = group == g
s, p = weighted_sens_spec(y_true[m], y_pred[m], w[m])
print(f" group={g}: sens={s:.3f} spec={p:.3f}")
社区共识:痴呆算法任务报加权 sens/spec/accuracy(对照 Gianattasio 2020 门槛:总体 acc ≥80%、sens ≥75%、spec ≥90%,跨组差 ≤5pp);生存任务报 C-index 与校准曲线;人群参数估计报加权值 + 设计效应校正的标准误。
§6.10 MLOps 笔记
- 版本锁定:注明产品全名与版本(如 “RAND HRS Longitudinal File 2022 (V1), released May 2025”)与下载日期;波次文件区分 Early/Final Release(Early 数据可能修订)。
- 引用义务:HRS 数据产品引用格式为 “Health and Retirement Study, (2022 Core Final, Version 1.0) public use dataset. Produced and distributed by the University of Michigan with funding from the National Institute on Aging (grant number NIA U01AG009740). Ann Arbor, MI, (2025).”;RAND 文件另有自身引用要求;发表后须向 HRS 寄送出版物副本(Conditions of Use 条款)。
- 账号体系:2020-09-01 起 HRS 数据下载迁移到新系统,旧账号需重新注册;教程中的老链接(hrsonline.isr.umich.edu 旧路径)可能失效。
- 政策风险提示:2025-03-31 起 NIH 要求在 RAND 产品页标注"repository under review for potential modification in compliance with Administration directives"——长期项目建议本地归档所用版本并记录校验和。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 幸存者/选择偏倚 | 基线为社区居住人群;高龄段样本是"活到该年龄且未入住机构前已入组"的选择集 | 高 | 用刷新队列补入新 51-56 岁人群;结论限定于队列覆盖人群 |
| 失访偏倚(MNAR) | 流失与认知差、健康差相关 | 高 | IPCW / 联合模型 / 多重插补;Tracker 状态正式建模 |
| 自报与回忆偏倚 | 疾病条目为 2 年回顾自报;依赖就医与告知 | 中高 | 客观指标校验(HbA1c/血压/claims);声明口径 |
| 算法测量偏倚 | 认知测验跨种族/教育测量不等值;单一切点差异误分类 | 高(差异研究) | Gianattasio 2020 公平性算法;分组建模与报告 |
| proxy 选择偏倚 | proxy 不测认知电池,删除即按结局选择 | 高 | proxy 专属标签路径(坑点 4) |
| Medicare FFS 偏倚 | claims 仅 FFS 受益人;MA 渗透随年代上升 | 中高 | 限定 FFS 子集并声明;时代分层 |
| 队列/时代混杂 | 不同出生队列暴露于不同医疗与政策时代 | 中 | 队列固定效应或分层;时间外验证 |
| 基因采样偏倚 | DNA consent 率约 80%, consent 者更健康/高 SES | 中 | 基因子样本权重;与全样本对比基线 |
§7.2 标注质量评估
| 标签路径 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| ADAMS 临床诊断 | 高(专家共识) | 多波复测稳定 | 仅 856 人(2001-2005),年代较早 |
| HCAP 分类(Manly 2022) | 高 | 与 ADAMS 纵向可比设计 | 半样本;2022 波为 Early Release |
| Langa-Weir 切点 | 中(对 ADAMS 校准) | 简单可复现 | 跨种族不等值(坑点 3);0-27 版截断信息 |
| Gianattasio 算法 | 中高(总体 acc 90-92%) | 三算法互参 | 训练标签仍是 ADAMS(代际误差可传播) |
| 自报疾病条目 | 中 | 波次间稳定 | 就医通达依赖;痴呆严重低估 |
| Medicare CCW 标记 | 中高 | 算法标准化 | FFS only;计费驱动 |
| NDI/exit 死亡 | 高 | 双源互证 | exit 日期精度依赖亲属回忆 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨国迁移(HRS → ELSA/SHARE/CHARLS) | 中高 | 问卷条目、访谈模式与文化差异;Harmonized 变量缓解但不能消除;认知共校准文献(NHATS×HCAP)显示跨研究分数不可直接互换 |
| 跨时代(1990s 队列 → 2020s) | 中高 | 痴呆患病率本身在下降(Langa 2017);MA 渗透改变 claims 覆盖 |
| 跨亚群体(种族/教育/高龄) | 高 | 算法分组性能差异(Gianattasio 2019/2020);85+ 与 proxy 人群 |
| 美国 → 非美国医疗体系 | 高 | 医保政策变量(Medicare/Medicaid/雇主保险)无对应物 |
| 调查 → 临床部署 | 高 | 自报与 2 年颗粒度不满足临床实时性 |
§7.4 伦理考量
- HRS 受访者签署了分层知情同意(访谈、生物样本、行政联动、基因分别同意);下游使用者必须尊重同意范围——例如未同意 SSA 联动者的数据不可强行关联。
- 三级访问体系本身是伦理工程:公开层已去标识;敏感/受限层申请即承诺不重识别、不转授、安全存储。VDI 飞地内结果导出需经披露审查。
- 差异研究伦理:痴呆算法的种族差异既是科学问题也是公平性问题——使用未经公平性约束的算法做政策相关估计可能固化结构性偏误(Gianattasio 2020 的立项动机)。
- 基因数据遵循 dbGaP Genomic Data Sharing 政策;PGS 在不同祖源人群中的可迁移性有限,跨祖源推断需谨慎声明。
- 政策环境提示:2025-03-31 NIH 要求在 RAND 产品页添加仓库审查提示语,联邦数据政策的后续变化可能影响访问条款,长期项目应跟踪官方公告。
§7.5 公平性评估
import numpy as np, pandas as pd
def group_sens_spec(y, p, w, g):
"""分种族/族裔的加权 sens/spec —— Gianattasio 2020 公平性门槛复刻"""
out = {}
for grp in np.unique(g):
m = g == grp
tp = w[m & (y == 1) & (p == 1)].sum(); fn = w[m & (y == 1) & (p == 0)].sum()
tn = w[m & (y == 0) & (p == 0)].sum(); fp = w[m & (y == 0) & (p == 1)].sum()
out[grp] = {"sens": tp / (tp + fn), "spec": tn / (tn + fp)}
return pd.DataFrame(out).T
perf = group_sens_spec(y_test, y_pred, w_test, race_eth)
print(perf)
# 门槛检查(Gianattasio 2020):跨组 sens 差 ≤3pp、spec 差 ≤5pp
assert perf["sens"].max() - perf["sens"].min() <= 0.03 + 1e-9, "sens 组间差超标"
assert perf["spec"].max() - perf["spec"].min() <= 0.05 + 1e-9, "spec 组间差超标"
已知公平性事实:naïve 单一切点在非裔/西裔中 sens 偏高、spec 偏低(Gianattasio 2019);教育年限是认知测验分数的最强混杂之一;proxy 占比随年龄与认知状态上升,高龄少数族裔双重受影响。
§7.6 数据漂移提示
- 结局本身在漂移:痴呆患病率 2000→2012 下降(11.6%→8.8%),用旧波次训练的"患病率先验"会高估当下。
- 覆盖在漂移:Medicare Advantage 渗透使 FFS claims 子集随年代越来越不具代表性。
- 测量在演进:2004 起身体测量、2006 起 DBS、2016 起 VBS/HCAP——纵向合并时变量可用性本身是时间函数;模块(V 区)每波随机分配且经常更换。
- 队列在刷新:新入组队列(EGENX 2022)改变年龄×队列×时期的可识别结构,APC 分析需正式方法。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | RAND 一人一行宽表 + 可 reshape 长表 |
| 2 | 有唯一标识符列 | ✅ | HHIDPN 全局唯一,跨全部产品 |
| 3 | 无 Unicode 或特殊字符 | ⚠️ | 结构化变量为 ASCII;含少量开放文本与特殊缺失码(.d/.r/.m)需清洗 |
| 4 | 无重复行 | ✅ | Tracker/主键约束保证;合并操作不当会人为制造重复(工程侧) |
| 5 | 缺失值已识别并编码 | ✅ | §4.5 六类缺失机制 + RAND 插补 |
| 6 | 标签列被明确标识 | ⚠️ | 核心无"官方标签"——痴呆需算法派生且多套并存(坑点 2) |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 罕见病种(如个别癌种)未分组;受限层 Cancer Site 需自行合并 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 八类偏倚 + 官方权重体系 |
| 9 | 有完整的数据字典 | ✅ | 每波 codebook + RAND Codebook + Concordance 在线工具 |
| 10 | 对"信息性缺失"有明确编码解释 | ✅ | §4.5 + proxy/attrition 文献(Weir 2011) |
| 11 | 数据采集设备和设置已记录 | ✅ | §3.9 芯片型号、采血管、测量设备全记录 |
| 12 | 已移除完全共线性变量 | ⚠️ | 派生变量与原始变量并存(如 COGTOT 与其分项),需自行选择 |
| 13 | 对编码的映射标准已说明 | ✅ | 自报条目→ICD-11/SNOMED 映射见 §2;claims 用 ICD-9/10 + CCW |
| 14 | 对时间戳的处理已明确说明 | ✅ | 公开层仅年份;精确日期属受限层,规则公开 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 无官方 ML 划分(调查数据传统) |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 五种 HRS 特有泄漏模式 |
| 17 | 标签分布已被分析 | ✅ | §4.2 多口径患病率对照 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 坑点 3/4/6 + Gianattasio 系列文献 |
| 19 | 外部验证建议已给出 | ✅ | §5.5 姊妹队列 + ADAMS→HCAP + NHATS |
| 20 | 数据更新和版本信息已记录 | ✅ | 每产品 Early/Final release notes 完整 |
| 21 | 最小必要预处理脚本已提供 | ✅ | 官方新用户指南含 R/SAS/Stata/SPSS 四语言示例 |
| 22 | 合规使用要求已明确 | ✅ | 三级访问体系文档完备 |
| 23 | 多模态对齐方法已说明 | ⚠️ | 基因/生物标志物/调查的对齐依赖 cross-reference 文件,流程文档化但跨平台 |
| 24 | 去标识化方法已被记录 | ✅ | 公开层去标识 + 三级风险分层体系公开可查 |
DAIMS 评分:20 / 24
评分解读:优秀——调查类数据集中文档化与合规工程的全球标杆,扣分集中在 ML 视角的结构性空缺。
对你意味着什么:HRS 的 19 个 ✅ 来自三十年沉淀的工程化文档体系:每波 codebook、RAND 派生变量文档、四语言示例代码、完整的缺失与权重文档。四个 ⚠️/❌ 项几乎全部指向同一件事——它不是为机器学习而生的:无官方划分(自行按 HHIDPN 分组 + 时间外验证)、无官方标签(痴呆标签必须显式选择算法并做敏感性分析)、罕见类别未合并(自行归并)、多模态跨平台回链(基因走 dbGaP/NIAGADS + cross-reference)。按 §5/§6 的建议操作后,它实际是流行病学 ML 中少有的"有临床金标准可校准、有三十年时间外验证轴"的高质量训练场。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| ADAMS B/C/D 波(时间外验证) | Duke/密歇根 | 五套痴呆算法(2002-2009 vs 2000-2002 训练) | 加权 accuracy 87-94% | 相对训练集 91-94% 略降 | 算法跨时间稳健但灵敏度显著下降(Gianattasio 2019) |
| HCAP 2016 | 密歇根 HRS | ADAMS 校准算法的当代适用 | 算法间患病率估计差仍在 | N/A | ADAMS→HCAP 是库内金标准时间外验证轴 |
| NHATS(共校准) | Johns Hopkins 等 | 认知分数跨研究可比性 | 共校准模型 | N/A | 不同研究的认知分数不可直接互换,需正式链接模型 |
| ELSA(英格兰) | UCL | proxy 认知偏倚对比 | 分布偏移量化 | N/A | proxy 机制偏倚在两国同向存在(Weir 2011) |
| CHARLS/SHARE/KLoSA(Harmonized) | 各国姊妹队列 | 认知与慢病跨国比较 | 协调变量口径 | N/A | Gateway to Global Aging 协调后可做描述性跨库分析,模型迁移仍需重新校准 |
HRS 在 2026 年还值得用吗? 非常值得,且不可替代。需要分子深度与影像:UK Biobank/All of Us 更合适;需要两年颗粒度的社会经济×健康×认知纵向全貌 + 痴呆临床校准 + 医保联动:全球范围内没有第二个数据源同时具备这三样。
§8 基准性能与生态
§8.1 排行榜(痴呆算法分类——HRS 唯一成体系的"榜单")
HRS 不是 ML 竞赛数据集,没有持续刷榜的 leaderboard。最接近"排行榜"的是 Gianattasio 等人对痴呆分类算法的系统比较——这是流行病学算法评估的教科书案例。
可比组 1:既有五算法系统比较(Gianattasio et al. 2019;训练=HRS+ADAMS Wave A 2000-2002;验证=ADAMS B/C/D 2002-2009 时间外;ADAMS 临床诊断为金标准):
| 算法 | 灵敏度(训练) | 特异度(训练) | 加权 accuracy(训练→验证) | 特点 | 完整引用 |
|---|---|---|---|---|---|
| Crimmins | 最高(上限 90%) | 较低 | 91-94% → 87-94% | 灵敏度优先 | Gianattasio KZ, Wu Q, Glymour MM, Power MC. “Comparison of Methods for Algorithmic Classification of Dementia Status in the Health and Retirement Study.” Epidemiology 2019;30(2):291-302. DOI: 10.1097/EDE.0000000000000945 |
| Herzog-Wallace | 较低 | 最高(上限 97%) | 同上区间 | 特异度优先 | 同上 |
| Wu / Hurd | 中 | 中 | accuracy 最大化 | 回归模型法 | 同上 |
| Langa-Kabeto-Weir | 中 | 中 | 同上 | 切点法,社区最常用 | 同上 |
注:未加权验证集灵敏度降至 18-62%——算法间绝对数值只在同队列、同权重、同验证设计下可比。
可比组 2:公平性约束新算法(Gianattasio et al. 2020;目标:跨种族 sens 差 ≤5pp 且总体 acc ≥80%、sens ≥75%、spec ≥90%):
| 算法 | 灵敏度 | 特异度 | 总体 accuracy | 跨种族 sens 差 | 完整引用 |
|---|---|---|---|---|---|
| Expert Model | 77-83% | 92-94% | 90-92% | ≤3pp | Gianattasio KZ, Ciarleglio A, Power MC. “Development of algorithmic dementia ascertainment for racial/ethnic disparities research in the U.S. Health and Retirement Study.” Epidemiology 2020;31(1):126-133. DOI: 10.1097/EDE.0000000000001101 |
| LASSO Model | 同上区间 | 同上区间 | 同上 | ≤3pp | 同上 |
| Modified Hurd | 同上区间 | 同上区间 | 同上 | ≤3-5pp | 同上 |
代表性人群参数基准(非 ML 但为该领域最常被引用的"金标准数字"):
| 估计 | 数值 | 完整引用 |
|---|---|---|
| 美国 71+ 痴呆患病率(2002,ADAMS 临床诊断) | 13.9% | Plassman BL et al. Neuroepidemiology 2007;29:125-132. DOI: 10.1159/000109998 |
| 美国 71+ CIND 患病率(2002) | 22.2% | Plassman BL et al. Ann Intern Med 2008;148:427-434 |
| 美国 65+ 痴呆患病率 2000→2012 | 11.6% → 8.8% | Langa KM et al. JAMA Intern Med 2017;177(1):51-58 |
| 痴呆年货币成本(2010 口径) | 约 $1,570-2,150 亿 | Hurd MD et al. N Engl J Med 2013;368:1326-1334 |
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 做患病率/差异流行病学 | Gianattasio 2020 推荐算法(公平性约束) | 跨种族误分类差最小,发表审查友好 |
| 快速复现社区惯例 | Langa-Weir 官方分类文件 | 引用最多、实现最简单;须声明切点与局限 |
| 训练新 ML 模型 | ADAMS/HCAP 临床标签为 y,核心变量为 X | 金标准标签;n 小,用嵌套 CV |
| 生存/轨迹建模 | RAND 长表 + Cox/联合模型 | 文档成熟,审稿人熟悉 |
| 方法学创新(LLM/新算法) | RAND Longitudinal File + 公开队列定义 | 零成本起步;如 MedFeat(arXiv:2603.02221)用 LLM 生成医学特征在 RAND HRS 上评测 |
§8.3 官方评测协议
无官方 ML 协议。社区事实标准(痴呆算法方向):ADAMS 临床诊断为金标准;训练/时间外验证按 ADAMS 波次切分;报告加权 sens/spec/accuracy + 分组(种族/族裔)性能;患病率估计必须与 ADAMS 人内诊断的估计对比(Gianattasio 体系)。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| ADAMS | 子研究 | 856 人痴呆临床诊断校准集(2001-2005) |
| HCAP | 子研究 | 2016/2022 两轮,ADAMS 的当代接班;≥65 半样本 |
| ELSA / SHARE / CHARLS / KLoSA / TILDA / MHAS 等 | 姊妹队列 | 30+ 国;Harmonized 版经 g2aging.org 统一定义 |
| NHATS | 同类(美国) | 年度随访、聚焦功能照护;与 HCAP 认知共校准 |
| UK Biobank | 互补 | 分子/影像深度 vs HRS 的社会经济与政策纵深 |
| All of Us | 互补 | EHR+基因 vs HRS 的纵向调查传统 |
| Medicare CCW / NDI | 联动源 | 受限层行政数据本体 |
§8.5 关键论文 Top 10
- Sonnega A et al. (2014), Int J Epidemiol 43(2):576-585. “Cohort Profile: the Health and Retirement Study (HRS).” — 权威引用入口与研究设计总览。DOI: 10.1093/ije/dyu067
- Juster FT, Suzman R (1995), J Human Resources 30:S7-S56. “An Overview of the Health and Retirement Study.” — 奠基性设计文献。DOI: 10.2307/146277
- Plassman BL et al. (2007), Neuroepidemiology 29:125-132. “Prevalence of dementia in the United States: the Aging, Demographics, and Memory Study.” — 首个全国代表性痴呆患病率。DOI: 10.1159/000109998
- Plassman BL et al. (2008), Ann Intern Med 148:427-434. CIND 患病率 22.2%。
- Hurd MD et al. (2013), N Engl J Med 368:1326-1334. “Monetary Costs of Dementia in the United States.” — 政策影响力天花板,被引近 2,000 次。
- Langa KM et al. (2017), JAMA Intern Med 177(1):51-58. “A Comparison of the Prevalence of Dementia in the United States in 2000 and 2012.” — 患病率下降经典证据。
- Crimmins EM et al. (2011), J Gerontol B 66(S1):i121-i126. “Assessment of Cognition Using Surveys and Neuropsychological Assessment.” — 调查认知数据 vs 临床诊断的方法学基石。
- Gianattasio KZ et al. (2019), Epidemiology 30(2):291-302. 五套痴呆算法系统比较。DOI: 10.1097/EDE.0000000000000945
- Gianattasio KZ et al. (2020), Epidemiology 31(1):126-133. 公平性约束算法。DOI: 10.1097/EDE.0000000000001101
- Fisher GG, Ryan LH (2018), Work Aging Retire 4(1):1-9. HRS 25 周年综述与数据体系导览。DOI: 10.1093/workar/wax032
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| 使用 HRS 数据的出版物 | 9,000+(官方统计,截至 2024) |
| 注册用户 | 25,000+(2017 年 NIA RFA 口径);18,000+ 外部活跃用户(2024 口径) |
| 年数据下载量 | 38,000+ 次(2024) |
| NIH 资助联动 | FY2022:135 个项目 / 122 位 PI 使用 HRS 数据 |
| Sonnega 2014 引用 | 约 1,870+(Semantic Scholar/OpenAlex 口径,截至 2026-09) |
| 国际姊妹队列 | 30+ 国(Gateway to Global Aging 枢纽) |
| Hurd 2013(NEJM)引用 | 近 2,000 次(官方口径) |
§8.7 生态快照
| 资源 | 类型 | 链接 | 规模(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| HRS 数据门户 | 官方平台 | https://hrsdata.isr.umich.edu/ | 全产品目录 | 三层访问唯一入口;2020 年新账号体系 |
| RAND HRS Products | 官方衍生 | https://www.rand.org/health/surveys/hrs/hrs-data.html | Longitudinal/Fat/Imputations/CAMS 全系列 | 90% 分析的实际起点;Codebook 是派生变量圣经 |
| Gateway to Global Aging | 跨国平台 | https://g2aging.org/ | 30+ 协调化队列 | Harmonized HRS/ELSA/SHARE/CHARLS 跨库同定义变量 |
| HRS Concordance 工具 | 检索工具 | hrs.isr.umich.edu | 跨波变量检索 | 找"哪个波次问过什么"的最快路径 |
| dbGaP phs000428 | 基因平台 | NCBI dbGaP | 基因型 v1/v2 | GWAS 数据官方入口 |
| NIAGADS | 基因平台 | niagads.org | v3/v4/DNAm | AD 基因组学专用库,HRS v3+ 在此 |
| Langa-Weir 分类文件 / Gianattasio-Power 算法文件 | 官方派生标签 | hrsdata 敏感层 | 1995-2016 / 2000-2016 | 免重建的认知标签成品 |
| HRS Bibliography | 文献库 | hrs.isr.umich.edu/publications | 9,000+ 篇 | 检索任一主题已有的 HRS 文献,避免重复选题 |
§9 相关资源与引用
官方资源
- 研究主页:https://hrs.isr.umich.edu/
- 数据门户(下载/申请):https://hrsdata.isr.umich.edu/
- 公开数据目录:https://hrsdata.isr.umich.edu/data-products/public-survey-data
- RAND 产品:https://www.rand.org/health/surveys/hrs/hrs-data.html 与 https://hrsdata.isr.umich.edu/data-products/rand
- 敏感健康数据:https://hrsdata.isr.umich.edu/data-products/sensitive-health
- 基因数据访问指引:https://hrs.isr.umich.edu/data-products/genetic-data/access-summary
- dbGaP 研究页:phs000428(NCBI dbGaP)
- 跨国协调:https://g2aging.org/
- 新用户指南:Sonnega《Using HRS Data: A Guide for New Users》(官网 Documentation 区,含 R/SAS/Stata/SPSS 示例)
BibTeX 引用
% 1) 队列论文(期刊引用首选)
@article{sonnega2014cohort,
title={Cohort Profile: the Health and Retirement Study (HRS)},
author={Sonnega, Amanda and Faul, Jessica D and Ofstedal, Mary Beth
and Langa, Kenneth M and Phillips, John W R and Weir, David R},
journal={International Journal of Epidemiology},
volume={43}, number={2}, pages={576--585}, year={2014},
doi={10.1093/ije/dyu067}
}
% 2) 数据本体引用(HRS 官方要求格式,按所用产品替换名称与年份)
% Health and Retirement Study, (2022 Core Final, Version 1.0) public use
% dataset. Produced and distributed by the University of Michigan with
% funding from the National Institute on Aging (grant number NIA
% U01AG009740). Ann Arbor, MI, (2025).
% 3) RAND 文件(如使用)
@techreport{randhrs2022,
title={RAND HRS Longitudinal File 2022 (V1) Documentation},
author={{RAND Center for the Study of Aging}},
institution={RAND Corporation}, year={2025},
note={Includes 16 waves of Core and Exit Interview data, 1992-2022}
}
% 4) 奠基设计文献(方法学章节引用)
@article{juster1995overview,
title={An Overview of the Health and Retirement Study},
author={Juster, F Thomas and Suzman, Richard},
journal={Journal of Human Resources},
volume={30}, pages={S7--S56}, year={1995}, doi={10.2307/146277}
}
许多论文漏引第 2 条数据本体——这违反 Conditions of Use。投稿前请逐项核对;使用受限/基因数据还须按其 DUA 追加致谢条款。
教程与学习资源
- 官方视频教程(Introduction to HRS / 数据下载演示):https://hrs.isr.umich.edu/documentation
- 新用户指南(四语言示例代码):官网 Documentation 区
- RAND 产品 FAQ 与《HRS Weights Explained》(权重必读):RAND HRS resources 页
- dbGaP 申请演示视频(HRS 官网链接)
- Training Genomics for Social Scientists(一年一度基因组学工作坊,以 HRS 为教学数据)
- Gateway to Global Aging 跨国研究指南
原始论文
- Sonnega A, Faul JD, Ofstedal MB, Langa KM, Phillips JWR, Weir DR (2014). “Cohort Profile: the Health and Retirement Study (HRS).” Int J Epidemiol 43(2):576-585. DOI: 10.1093/ije/dyu067. PMID: 24671021. PMCID: PMC3997380.
- Juster FT, Suzman R (1995). “An Overview of the Health and Retirement Study.” J Human Resources 30:S7-S56. DOI: 10.2307/146277.
- Heeringa SG, Connor JH (1995). “Sample Design and Methods for the Health and Retirement Study.” SRC Technical Report, University of Michigan.
- Fisher GG, Ryan LH (2018). “Overview of the Health and Retirement Study and Introduction to the Special Issue.” Work Aging Retire 4(1):1-9. DOI: 10.1093/workar/wax032.
- Bugliari D et al. “RAND HRS Longitudinal File Codebook.” RAND Center for the Study of Aging(各版本随文件发布).
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:官方页面、RAND 产品页、Sonnega 2014 全文、dbGaP、算法比较论文、引用快照交叉验证 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 HRS 官方页面、RAND 文档、Sonnega 2014 队列论文、Gianattasio 2019/2020 算法论文、dbGaP 与 NIH RFA 文档中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Sonnega A et al. (2014), Int J Epidemiol 43(2):576-585 — HRS 队列论文全文(PMC3997380,DOI: 10.1093/ije/dyu067)
- health.gov — Healthy People 数据源页 HRS 条目(设计、应答率、Medicare 同意与匹配率)
- HRS 官方数据门户(hrsdata.isr.umich.edu):公共数据目录、Sensitive Biomarker and Health Data 目录、RAND 产品目录
- RAND Corporation — RAND HRS Longitudinal File 2022 (V1) 产品页与 Updates(rand.org/health/surveys/hrs)
- HRS 官网 — Genetic Data Access Summary(dbGaP/NIAGADS/VDI 申请路径)
- NCBI dbGaP — phs000428 HRS 研究页(基因分型平台、样本、QC)
- NIH Grants — RFA-AG-18-005(25,000+ 用户、HCAP、静脉血、无禁运发布政策)与 RFA-AG-12-001(steady-state 设计史)
- Dorr DA et al. (2024), BMC Geriatrics 24:777 — 43,216 累计参与者口径与 Medicare FFS 联动范式
- Gianattasio KZ et al. (2019), Epidemiology 30(2):291-302 — 五算法比较(DOI: 10.1097/EDE.0000000000000945)
- Gianattasio KZ et al. (2020), Epidemiology 31(1):126-133 — 公平性算法(DOI: 10.1097/EDE.0000000000001101)
- Plassman BL et al. (2007) Neuroepidemiology 29:125-132 与 (2008) Ann Intern Med 148:427-434 — ADAMS 患病率
- Crimmins EM et al. (2011), J Gerontol B 66(S1):i121-i126 — 认知评估方法学(PMC3165454)
- HRS 2022 Final Release Codebook(hrs.isr.umich.edu/meta/2022,Section 结构)
- HRS 数据发布公告(2025:2022 Core Final V1.0 / Tracker / EGENX / HCAP 2022 / VBS RNASeq 与 ATN)
- reference.org HRS 条目 — 18,000+ 用户、38,000+ 下载、9,000+ 出版物、NIH FY2022 资助统计
- St. Clair P et al., “The RAND HRS Data File”(SSA Bulletin v65n2,RAND 文件设计史)
- Langa KM et al. (2017), JAMA Intern Med 177(1):51-58;Hurd MD et al. (2013), NEJM 368:1326-1334(患病率与成本基准数字)
- Juster FT, Suzman R (1995), J Human Resources 30:S7-S56(DOI: 10.2307/146277)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11 映射、痴呆流行病学、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(波次、队列、访问分级、RAND 产品) | 千方病案医学编辑部 | 与 HRS 官方数据门户及 RAND 页面交叉比对 | ✅ 已验证 |
| §4 数据结构(HHIDPN 主键、RAND 前缀体系、DAIMS 字段字典) | 千方病案医学编辑部 | 与 RAND Codebook 文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方文档比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar/OpenAlex 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
