信息速览

CHARLS — 中国老龄健康与养老全国追踪队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | CHARLS(中国健康与养老追踪调查) |
| 英文全称 | China Health and Retirement Longitudinal Study |
| 别名/简称 | CHARLS、中国健康与养老追踪调查、CHARLS-HCAP(认知子研究) |
| 疾病分类 | 老龄健康全疾病谱(ICD-11:BA00 原发性高血压 / 5A11 2 型糖尿病 / 6A70 抑郁发作 / 6D80 阿尔茨海默病 / CA22 慢性阻塞性肺疾病,详见 §2.1) |
| SNOMED CT | 38341003 Hypertensive disorder / 44054006 Diabetes mellitus type 2 / 35489007 Depressive disorder / 52448006 Dementia(详见 §2.1b) |
| 数据模态 | 结构化问卷(CAPI)、体格测量、静脉血生物标志物、生命历程回溯、死亡登记 |
| AI 任务类型 | 认知衰退预测、抑郁筛查、慢病风险建模、生存分析、纵向轨迹聚类、政策评估(因果推断) |
| 样本总数 | 基线 17,708 人 / 10,257 户;2018 追访 19,816 人;覆盖 450 个村/社区(官方) |
| 数据大小 | 按 wave 分卷发布(Stata .dta 压缩包;各卷大小见官方数据平台) |
| 数据格式 | Stata .dta(可用 pandas / R / SAS 直接读取) |
| 许可证 | CHARLS Data Use Agreement(仅限学术研究,禁商用与再分发) |
| 访问级别 | 申请审核(实名注册 + 机构邮箱 + 官方审核后免费下载) |
| DUO 标签 | GRU, NPUNCU, PUB |
| 语言 | 中文问卷;文档/codebook 中英双语 |
| 首发日期 | 2013(基线数据公开发布) |
| 最后更新 | 2023-11-16(Wave 5 / 2020 全国追访数据发布,见官方) |
| 发布机构 | 北京大学国家发展研究院(National School of Development, Peking University) |
| 官方主页 | https://charls.pku.edu.cn/ |
| 下载地址 | https://charls.charlsdata.com/pages/data/111/zh-cn.html |
| DOI | 无数据集 DOI;方法学论文 DOI 10.1093/ije/dys203(Zhao et al. 2014) |
| 引用次数 | 4,434+(Semantic Scholar,截至 2026-09,API 查询) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方 Harmonized 整合版 + 完整 codebook、权重体系成熟;扣分项:Stata 原生格式需转换、无官方 AI 划分与靶标定义、跨 wave 模块差异需人工核对 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
- 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(老龄健康疾病谱、ICD-11/SNOMED CT 映射)、§7 偏倚分析(流失、自报与客观测量差异、生存者偏倚)。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
审核分工说明:医学侧(编辑部)负责疾病谱、编码映射与流行病学表述的临床合理性;数据工程侧(工程师)负责抽样设计、权重体系、字段字典与全部可运行代码的复核。两条审核线独立进行、交叉签字,任一模块未通过则整页退回修订。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CHARLS 要求用户以真实姓名注册数据平台、使用机构邮箱提交申请并遵守 CHARLS 数据使用协议(仅限学术研究、禁止商业用途、禁止再分发与公开原始微观数据)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? CHARLS 是北京大学国家发展研究院主持的中国健康与养老追踪调查,一套针对全国 45 岁及以上中老年人的代表性追踪数据。基线于 2011-2012 年完成,访问了 150 个县、450 个村/社区约 1 万户家庭中的 17,708 人(官网),此后每 2-3 年追踪一轮,最新公开到 2020 年第五轮。它与美国 HRS 同属一个国际老龄调查家族,变量设计刻意保持可比。
为什么重要? 中国正在经历全球规模最大的老龄化,但此前一直缺少全国代表性、可跨年追踪、且同时含"问卷 + 体格 + 血液"的老龄微观数据。CHARLS 补上了这个缺口:研究者既能看经济变量(养老金、收入、转移支付),也能看客观健康(血压、握力、HbA1c),还能追踪同一个人十年间的变化,是养老与老龄健康政策研究的事实标准数据集。
我能用它做什么? 训练认知衰退/抑郁/慢病风险的纵向预测模型,构建老龄健康轨迹聚类,做医疗保险与退休政策的因果推断,或将问卷、体格测量、血检三类模态对齐做多模态融合。注册后免费下载,但必须以真实姓名申请并遵守仅限学术使用的协议。
§1.1 技术摘要
CHARLS 采用多阶段分层 PPS 概率抽样:第一阶段按区域、城乡、人均 GDP 分层,从除西藏外的全部县级单位中抽 150 个县;第二阶段在每县抽 3 个村/社区(共 450 个);随后用自研 CHARLS-GIS(基于 Google Earth)完成户普查与抽样框构建,每户随机抽取 1 名 45 岁及以上者并纳入其配偶(Zhao et al. 2014)。基线 2011-06 至 2012-03 完成访问 10,257 户、17,708 人,应答率超过 80%;此后 2013、2015、2018、2020 四轮全国追踪,追踪样本再接触率超过 90%、panel 应答率维持在 86% 以上(Frontiers 2023),并在原 PSU 内补入 refresher 样本以补充新达龄人群。数据以 Stata .dta 按 wave 分模块发布,提供截面与追踪两套权重;另有官方整合清洗版 Harmonized CHARLS(Version D)与配套代码文档。体格测量与静脉血生物标志物并非每轮完整采集,是跨 wave 分析时最大的结构性陷阱(见 §6.5)。
§1.2 战略价值
维度一:老龄健康 AI 的"中国底座"数据。CHARLS 是目前中国唯一同时具备全国代表性、动态追踪、多模态健康测量(问卷 + 体格 + 血检)的老龄专项公开数据(行业评估)。对 AI 而言,它提供了 1.9 万量级、带完整抽样权重、跨越 10 年的表格型纵向数据,适合发展轨迹预测、事件风险建模与跨模态融合方法;其与 HRS 家族的 harmonized 设计,还允许模型在多国队列间做外部验证与迁移学习。
维度二:政策与经济研究的事实标准。CHARLS 覆盖工作、退休、养老金、医疗保险、家庭转移支付与消费资产等经济模块,使它成为医保整合、新农保、延迟退休等政策评估的首选数据;截至 2024 年 12 月 31 日累计注册用户 126,016 人(北大 5,981、国内其他机构 113,823、国际 6,212)(北大 ISSS 2024 年度报告),方法学论文被引 4,434+(Semantic Scholar,截至 2026-09)。对于 AI 团队,这意味着丰富的已发表结论可作 sanity check,也意味着"简单跑分"类结果极易被审稿人用既有文献挑战。
维度三:国际可比性带来的"杠杆"。CHARLS 与 HRS、ELSA、SHARE、MHAS、LASI 等同属 HRS 家族并保持 harmonized(UMich Biomarker Network),变量含义与计分方式经过跨文化校准。对 AI 团队,这意味着同一套模型可以直接在多国队列上做"训练—迁移—校准"闭环:在 CHARLS 上学到的认知/失能表征,可以拿到 HRS 验证,再返回校准中国场景,这是单国数据集无法提供的实验设计空间。
§1.3 同类数据集横向对比
| 数据集 | 地域 | 入组年龄 | 规模(代表性一轮) | 追踪周期 | 生物标志物 | 与 CHARLS 的差异 |
|---|---|---|---|---|---|---|
| CHARLS | 中国 28 省 | 45+(含配偶) | 17,708(基线)→ 19,816(2018) | 2-3 年 | 静脉血(2011/2015/2018/2020)+ 体格 | 本条目对象;HRS 兼容、全国代表性 |
| HRS(美国) | 美国 | 51+ | 约 2 万 | 2 年 | 血液 + 基因 | CHARLS 的模板与对标对象,变量映射最深 |
| ELSA(英格兰) | 英格兰 | 50+ | 约 1.2 万 | 2 年 | 护士访视采血 | 样本量小,护理测量流程更重 |
| SHARE(欧洲) | 欧洲 28+ 国 | 50+ | 累计 10 万+ | 2 年 | 部分 wave 采血 | 跨国比较利器,但各国模块深浅不一 |
| CLHLS(中国) | 中国 22 省 | 65+/80+ 高龄 | 约 1.6 万 | 2-3 年 | 部分生化 | 聚焦高龄与长寿,入组年龄更高 |
| CFPS(中国) | 中国 25 省 | 全年龄 | 约 1.5 万户 | 2 年 | 无血检 | 全年龄家庭追踪,健康模块较浅 |
§1.4 版本时间轴
| 年份 | 事件 | 说明 |
|---|---|---|
| 2008 | 两省预调查(pilot) | 浙江甘肃 2,685 人;DBS 干血点;2012 年两省追访 |
| 2011-2012 | 全国基线 Wave 1 | 17,708 人 / 10,257 户;首次静脉血 |
| 2013 | Wave 2 | 18,264 人;含死亡家属问卷;无血检 |
| 2014 | 生命历程调查 | 20,547 人;童年与成年史回溯 |
| 2015 | Wave 3 | 20,284 人;第二次静脉血 |
| 2016 | 口述历史专题 | 老年口述史子调查 |
| 2018 | Wave 4 + HCAP | 19,816 人;新增认知深访子研究 CHARLS-HCAP;第三次采血 |
| 2020 | COVID 特殊调查 + Wave 5 | 19,395 人;Wave 5 数据 2023-11-16 发布;第四次采血 |
| 2021-2023 | Wave 6 田野 | 在采/整理中,尚未公开下载 |
(样本量来源:Zhao, CHARLS Update 2023;Wave 4 发布口径为 19,816,官方更新稿为 19,817,相差 1 人属统计口径差异。)
阅读时间轴的两条提示:其一,"调查年份"与"数据发布年份"相差 1-3 年(如 Wave 5 于 2023 年才发布),引用数据时要同时写清两者;其二,专题调查(2014/2016/HCAP/COVID)与全国 wave 的抽样口径不同,与全国 wave 合并前须核对其样本定义与权重文件。
§1.5 典型应用场景
- 认知衰退预测:利用 2011-2020 多轮 TICS 改版记忆与心智状态测试,训练个体级认知轨迹与痴呆风险模型,CHARLS-HCAP 子研究可作临床校标。
- 抑郁筛查与心理健康监测:CES-D 10 项量表(0-30 分,≥10 为抑郁)长期采集,适合做筛查阈值迁移、多模态(文字 + 经济变量)风险分层。
- 慢病与多病共存建模:自报慢病 + 血压/HbA1c/血脂等客观测量可构建共病网络、代谢综合征识别与"体检-自报差异"校正模型。
- 健康经济学与政策因果推断:医保类型、养老金参保与退休年龄等变量支持 DID/RD 等设计,评估医保整合与延迟退休的健康效应。
- 死亡与生存分析:死亡登记、死因与退出问卷支持全因/特定死因的离散时间生存模型与竞争风险分析。
- 跨文化迁移与多队列联邦建模:以 harmonized 变量为桥梁,把在 CHARLS 上训练的认知/失能模型迁移到 HRS/ELSA/SHARE 验证,再回迁校准,构成多队列联邦式的实验设计(§1.2 维度三)。
§2 医学背景
§2.1 ICD-11 编码映射表
CHARLS 不携带 ICD 编码字段,疾病由"医生告知的慢性病诊断"自报变量承载。下表给出研究中常用结局的标准编码,供下游建模时统一标签体系。
| 研究标签 | ICD-11 编码 | ICD-11 中文名 | CHARLS 对应测量 |
|---|---|---|---|
| 原发性高血压 | BA00 | 原发性高血压 | 自报诊断 + 血压测量(≥140/90 mmHg) |
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | 自报诊断 + HbA1c / 血糖检测 |
| 抑郁发作 | 6A70 | 抑郁发作 | CES-D 10 项得分(筛查,非临床诊断) |
| 阿尔茨海默病及痴呆 | 6D80 / 6D8Z | 阿尔茨海默病 / 痴呆 | TICS 改版认知测验 + 知情者问卷;HCAP 子研究 |
| 慢性阻塞性肺疾病 | CA22 | 慢性阻塞性肺疾病 | 自报诊断 + 峰流速测量 |
| 卒中 | 8B11 | 脑梗死(卒中类) | 自报诊断 + 死因登记 |
| 肥胖 | 5B80 | 肥胖 | BMI(身高体重测量)与腰围 |
§2.1b SNOMED CT 映射表
| 研究标签 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 高血压 | BA00 | 38341003 | Hypertensive disorder (disorder) |
| 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2 (disorder) |
| 抑郁障碍(筛查) | 6A70 | 35489007 | Depressive disorder (disorder) |
| 痴呆 | 6D8Z | 52448006 | Dementia (disorder) |
| 慢性阻塞性肺疾病 | CA22 | 13645005 | Chronic obstructive lung disease (disorder) |
| 肥胖 | 5B80 | 414916001 | Obesity (finding) |
§2.2 疾病背景与流行病学
老龄化宏观背景。CHARLS 面向的核心"疾病景观"是人口老龄化带来的慢性非传染性疾病与功能衰退。据 Crimmins et al.,到 2050 年中国 65 岁及以上人口将超过 3.66 亿、占总人口四分之一以上——这相当于在一代人之内完成多数发达国家经历上百年的年龄结构转变,而社会保障与慢病管理体系需同步扩容。
慢病与共病负担。队列内的主要慢病类别是高血压、糖尿病、心脏病、卒中、癌症、慢性肺病、关节疾病与消化系统疾病,由"医生告知"的自报诊断承载。中国老年人口就医可及性不足、慢病知晓率偏低,自报健康信息系统性低估真实疾病负担,这正是 CHARLS 在全国代表性调查中引入血检与体格测量的首要理由——用客观测量校准自报,并识别大量"自报阴性但测量阳性"的未确诊者。
认知与心理健康。认知维度上,CHARLS 使用改版 TICS(情景记忆 10 词即时/延迟回忆 0-20 分、心智状态 0-11 分、总分 0-31)并辅以知情者认知减退问卷(Nature Sci Rep 2026);2018 年启动的 CHARLS-HCAP 子研究参照美国 HCAP 协议,为认知量表提供痴呆临床评估的校准链接。抑郁维度采用 CES-D 10 项简版,在 CHARLS 2018 数据中 Cronbach’s α = 0.784(Frontiers 2024),≥10 分通常作为筛查阳性阈值。
功能与照护。ADL/IADL 失能项数、握力、步速、平衡与峰流速共同构成躯体功能层,是把"疾病"翻译为"照护需求"的中间变量;长期照护保险、家庭照料与代际转移研究普遍以功能状态为核心结局。
AI 建模常用的核心结局与操作定义:
| 结局 | 操作定义(常见做法) | 测量来源 | 类不平衡 |
|---|---|---|---|
| 抑郁筛查阳性 | CES-D 10 总分 ≥ 10 | 问卷(CES-D) | 中 |
| 认知衰退 | 末轮 - 首轮总分下降 ≥ 2 分(或分域下降) | TICS 改版 | 中 |
| 高血压(患病状态) | 自报诊断 ∨ 测量 SBP ≥ 140 或 DBP ≥ 90 | 问卷 + 体格 | 无(常见) |
| 糖尿病(患病状态) | 自报诊断 ∨ HbA1c ≥ 6.5% | 问卷 + 血检 | 无(常见) |
| 失能进展 | ADL/IADL 项数较上轮增加 | 问卷 | 低-中 |
| 死亡(全因) | 退出问卷确认为死亡 + 年份 | 死亡登记 | 高(需生存框架) |
§2.3 临床任务定义
| 任务类型 | 定义 | CHARLS 中的实现 | 建模注意 |
|---|---|---|---|
| 筛查 | 在社区人群中识别高风险个体 | CES-D ≥10 抑郁筛查;认知测验低分者;高血压/糖尿病"自报阴性但测量阳性"的未确诊者 | 阈值需按 wave 重估;筛查阳性 ≠ 临床诊断 |
| 诊断 | 确定疾病存在 | 不适用(CHARLS 非临床诊断数据);仅医生告知诊断 | 把自报诊断当诊断金标会低估患病率 |
| 分级 | 疾病严重程度分层 | ADL/IADL 失能项数;认知分域得分;握力/步速等躯体功能 | 分级变量跨 wave 模块覆盖不同 |
| 预后 | 未来事件预测 | 死亡、失能、认知衰退、卒中/心梗新发 | 必须使用追踪权重与离散时间设计 |
§2.4 研究人群特征
| 属性 | 描述 |
|---|---|
| 来源 | 全国多阶段 PPS 抽样:28 省区市 → 150 县 → 450 村/社区 → 户 → 个人 |
| 时间 | 基线 2011-06 至 2012-03;追踪 2013/2015/2018/2020(每轮田野跨约 1 年) |
| 年龄 | 45 岁及以上(入组随时间自然老化;refresher 补入新达龄者) |
| 性别 | 男女性均覆盖;配偶不限年龄一并入组 |
| 城乡 | 城市社区与农村村庄并重,抽样按城乡分层 |
| 种族/民族 | 以汉族为主,含少数民族聚居省份样本;官方未单独按民族设层 |
| 就医/居住类型 | 社区居住(non-institutionalized)人群;不含机构养老者 |
| 排除 | 抽样框不含西藏;港澳台不在范围;机构化居住者不在户抽样框 |
| 跟踪单位 | 以村/社区为追踪锚点;迁出者失访,同 PSU 内补入 refresher 样本 |
§2.5 临床与研究价值
对医学 AI 而言,CHARLS 的价值在于三件事的组合:一是全国代表性,结论可以外推到中国 45 岁以上社区人群,而非医院选择人群;二是客观健康测量,血检与体格数据可以校正发展中国家普遍存在的自报漏诊/漏报;三是纵向深度,同一人最多 5 轮、跨越约 10 年,支持疾病前期标志物研究与轨迹建模。它同时与 HRS/ELSA/SHARE/MHAS 等国际队列保持 harmonized(UMich Biomarker Network),是中国老龄健康模型做外部验证或反向出海的首选训练底座。北京大学-《柳叶刀》健康老龄化委员会报告即以 CHARLS 为核心证据源之一(charls.pku.edu.cn)。
同时必须记住三点使用边界:CHARLS 观察的是社区居住人群,不含住院与机构养老场景;所有疾病"诊断"都是自报或测量替代,不是临床 adjudication;45 岁以下人群(除 45 岁前入组者的年轻配偶)不在推断范围内。任何把 CHARLS 模型直接用于个体临床决策的表述都是对数据范围的误用。
§2.6 金标准与标注体系
| 维度 | 内容 |
|---|---|
| 划分 | 官方无训练/验证/测试划分;按 wave 时序或按 PSU 聚类自行划分(见 §5) |
| 标注方式 | 观察性测量,非人工标注;标签来自三类来源:受访者自报(CAPI)、护士体格测量、实验室血检 |
| 标注者资质 | 统一培训的 CAPI 访员;护理专业毕业、经北大公卫项目与 HRS 视频训练的采血护士;参与常规室间质控的实验室(97% 合格率) |
| 一致性 | 采血到 CBC 检测中位 97 分钟;hsCRP/HbA1c/血脂等检测批内/批间 CV 均在 5.7% 以内(Hu et al. PAA 2014) |
| 性质 | 观察性纵向队列;非随机、非盲、无干预;因果推断需依赖设计(权重/工具变量/DID) |
§3 数据集规格
§3.0 版本抉择矩阵
CHARLS 按 wave 分卷发布,并有官方整合版。先决定"用哪个包",再决定"用哪几轮"。
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速跑通纵向 ML 原型 | Harmonized CHARLS Version D | 单包 | 官方跨 wave 整合、变量名统一、附代码文档,省去大量清洗 |
| 复刻经济学/政策文献 | 逐 wave 原始 .dta(2011-2020) | 5 卷 | 原始变量与官方问卷一一对应,便于对照 codebook |
| 生物标志物研究 | Wave 1(2011)+ Wave 3(2015)血检表(辅以 2018/2020) | 子集 | 2011/2015 静脉血指标最全;2013 无血检 |
| 认知与痴呆研究 | Wave 1-4 + CHARLS-HCAP(2018 子样本) | 子集 | HCAP 提供深入认知评估作为校标 |
| 死亡/生存分析 | Wave 1-5 + 退出及死因问卷 | 子集 | 死亡登记与家属访谈含死因与临终医疗信息 |
| 空间/区域分析 | 保密数据(需另签协议) | 申请 | 公开包 2015 后不含城市;县/社区编码走保密通道 |
§3.1 模态详情
| 模态 | 内容 | 采集方式 | 覆盖 wave |
|---|---|---|---|
| 问卷-人口学与家庭 | 年龄、教育、婚姻、家庭结构与代际转移 | 面对面 CAPI | 全部 wave |
| 问卷-健康与功能 | 自报慢病、ADL/IADL、疼痛、生活方式 | 面对面 CAPI | 全部 wave |
| 问卷-认知与抑郁 | TICS 改版(记忆/心智状态)、CES-D 10、知情者问卷 | 访员施测 | 全部 wave |
| 问卷-经济 | 工作、退休、养老金、医保、收入消费资产 | 面对面 CAPI | 全部 wave |
| 体格测量 | 血压、脉搏、身高、体重、腰围、小腿长、臂长、峰流速、握力、5 次坐立、步速、平衡 | 护士/访员现场测量 | 每轮有测量但项目跨 wave 有增减(陷阱,见 §6.5 坑点 2) |
| 血液生物标志物 | 血常规、hsCRP、HbA1c、血脂四项、血糖、BUN、肌酐、尿酸、胱抑素 C | 静脉血 3 管,冷链送 CDC 实验室 | 2011、2015、2018、2020(2013 无) |
| 生命历程 | 童年健康/家庭/教育、成年职业与婚姻史 | 结构化回溯访谈 | 2014 专题 |
| 死亡登记 | 退出名单、死因、临终医疗与费用 | 家属/知情者问卷 | 各轮滚动采集 |
| 社区问卷 | 村/社区基础设施、社保、价格与灾害 | 村级知情者 | 2011 年含社区问卷 |
§3.2 按子集样本数
| 子集 | 样本量 | 说明 |
|---|---|---|
| Wave 1(2011)访问 | 17,708 人 / 10,257 户 | 主受访者 10,069 + 配偶 7,639(Maelstrom) |
| Wave 2(2013) | 18,264 人 | 官方更新稿口径 |
| Wave 3(2015) | 20,284 人 | 含补入样本 |
| Wave 4(2018) | 19,816 人 | 数据发布口径 |
| Wave 5(2020) | 19,395 人 | 官方更新稿口径 |
| 2014 生命历程 | 20,547 人 | 专题回溯调查 |
| 2011 采血 | 11,847 人(应答 67%) | 静脉血(Hu et al.) |
| 2015 采血 | 13,013 人 | 150 县静脉血(Crimmins et al.) |
| 含生物样本总人数 | 12,122 人(Maelstrom 口径) | 含 2008 pilot DBS |
| 2008 pilot | 2,685 人 | 浙江甘肃;DBS 干血点 |
§3.3 数据格式
| 格式 | 用途 | 说明 |
|---|---|---|
| Stata .dta | 官方发布格式 | 全部问卷与测量表;pandas.read_stata / pyreadstat / R haven 可直接读 |
| 问卷、codebook、users’ guide | 每个 wave 附完整文档 | |
| 压缩包 ZIP | 下载分发 | 按 wave 分卷;数据平台审核通过后下载 |
| Harmonized CHARLS | 官方整合版 | Version D,附 Stata/代码文档 |
| CSV / Parquet | 自行转换 | 经 pandas/haven 导出;转换脚本随仓库管理 |
§3.4 存储与规模
数据按 wave 分卷发布,单 wave 解压后含数十个 .dta 模块文件与文档。全库为表格型数据,总量远小于影像类数据集,瓶颈不在存储而在跨 wave 变量对齐与权重处理:
| 分析配置 | 建议磁盘 | 说明 |
|---|---|---|
| 单 wave 分析(问卷 + 权重) | < 5 GB | 最小原型 |
| 全 5 轮原始包 + 文档 | 约 10-20 GB | 覆盖大多数研究 |
| 全 5 轮 + Harmonized 版 + 派生数据 | 50 GB | 推荐的工作环境 |
| 加临时处理中间件(宽表、插补) | 100 GB | 深度序列模型训练预留 |
(各 wave 压缩包大小以官方数据平台实际显示为准;官方未发布全库汇总体量数字,本页不硬造。)
§3.5 标注方式
CHARLS 无监督式"标注"。其"标签"分三层:(1)自报层——医生告知诊断、ADL/IADL、CES-D 等,由访员按问卷逐题记录;(2)测量层——护士用标准化流程实测血压、握力、峰流速等;(3)实验室层——静脉血经中国 CDC 实验室网络与首都医科大学临床检验中心检测,含完整质控。AI 任务标签(如"抑郁阳性"“认知衰退”)需由使用者按上述变量构造,官方不提供现成 AI 靶标列。
§3.6 标注者/采集者资质与质量
- 访员经统一培训并用 CAPI 施测,问卷逻辑与跳转由程序控制。
- 采血与体格测量由护理专业毕业护士执行,培训参考 HRS 官方生物标志物与体能测试视频(Crimmins et al.)。
- 实验室参与常规室间质控(97% 合格),hsCRP 批内 CV < 1.3%、HbA1c 批内 CV 1.9%、血脂类批内 CV ≤ 1.5%(Hu et al. PAA 2014)。
- 92% 受访者过夜空腹采血;采集至 CBC 检测中位时间 97 分钟。
§3.7 采集周期
| 轮次 | 田野窗口 | 本轮要点 | 数据发布 |
|---|---|---|---|
| Wave 1 | 2011-06 至 2012-03 | 全国基线 + 首次静脉血 | 2013(基线发布) |
| Wave 2 | 2013-06 至 2014-03 | 首轮全国追踪;含死亡家属问卷;无血检 | 2014-2015 |
| 生命历程 | 2014 | 童年与成年史专题回溯 | 2015-2016 |
| Wave 3 | 2015 | 第二次静脉血 | 2016-2017 |
| Wave 4 | 2018 | 第三次采血;启动 HCAP 认知子研究 | 2020-09 发布 |
| Wave 5 | 2020-2021 | 第四次采血;受疫情影响部分流程调整 | 2023-11-16 发布 |
| Wave 6 | 2021-2023 | 田野在采/整理中 | 尚未公开 |
(发布节点见官网;轮次规模见 Zhao CHARLS Update 2023。)官方仅公开调查的年份与月份,部分受访者访谈跨年(2011 基线部分延至 2012 完成),精确访问日期不公开。
§3.8 地域覆盖
抽样框覆盖中国大陆除西藏外全部县级单位,样本实际分布于 28 个省(自治区、直辖市)的 150 个县、450 个村/社区,城乡兼顾:
| 层级 | 数量 | 公开数据可见性 |
|---|---|---|
| 省(自治区、直辖市) | 28 | ✅ 公开(区域变量) |
| 县 | 150 | 🔒 保密协议 |
| 村/社区(PSU) | 450 | 🔒 保密协议 |
| 城市 | — | 2015 年后不再公布 |
| 城乡属性 | 0/1 变量 | ✅ 公开 |
§3.9 设备与测量规程
| 测量 | 设备/规程要点 |
|---|---|
| 血压/脉搏 | 标准化电子血压计,坐位静息测量;护士现场操作 |
| 血脂(2008 pilot) | CardioChek-PA 现场快速检测仪(总胆固醇量程 100-400 mg/dL;HDL 15-100 mg/dL) |
| 血液采集(2011 起) | 护士采集 3 管静脉血:2 mL CBC、4 mL 血浆/buffy coat(0.5 mL 冻存管,-80°C)、2 mL HbA1c;4°C 冷链 2 周内转运(Hu et al.) |
| 干血点(2008 pilot) | Whatman 903 Protein Saver 卡,风干 ≥4 小时,-20°C 冻存 |
| 体格与体能 | 身高体重腰围、小腿/臂长、峰流速、握力、5 次坐立计时、步速、平衡测试 |
| 抽样工具 | CHARLS-GIS(基于 Google Earth 的户列表与制图软件) |
§3.10 深度溯源链
| 环节 | 执行方 | 质控要点 | 潜在偏差 |
|---|---|---|---|
| 抽样 | 北大 CHARLS 项目组 | PPS + 区域/城乡/GDP 分层;抽样程序在 Stata 中固定执行 | 覆盖偏倚(不含西藏) |
| 户框构建 | CHARLS-GIS(Google Earth) | 电子制图 + 住户列表 | 漏户/临时居住者 |
| CAPI 问卷 | 统一培训访员 | 程序化跳转逻辑 | 应答/代理误差 |
| 体格测量 | 护士 | 标准化流程,HRS 视频训练 | 姿势/时点差异 |
| 采血与冷链 | 护士 + 县级 CDC/医院 | 4°C、2 周内送检;CBC 中位 97 分钟 | 检测延迟风险(可量化) |
| 实验室检测 | 首都医科大学临床检验中心等 | 每日质控样;97% 室间质控合格 | 批间效应 |
| 冻存与复检 | 中国 CDC 北京(-80°C) | 血浆/buffy coat 三管冻存 | 样本使用需 PI 审批 |
| 清洗与发布 | 北大 CHARLS 项目组 | codebook + users’ guide | 版本迭代(需固定) |
| 获取 | charls.charlsdata.com | 实名注册 + 审核 | 使用侧合规责任 |
每个环节的偏差进入 §7.1 偏倚表评估。
§4 数据结构
§4.0 目录树
CHARLS 各 wave 独立压缩包,解压后按模块组织(以下为典型结构示意;实际文件名与目录以各 wave 下载包内说明为准):
charls/
├── Wave1_2011/
│ ├── CHARLS_2011_Baseline_National_User_Guide.pdf
│ ├── codebook/ # 各模块 codebook(中英)
│ ├── dem_2011.dta # 人口学(Demographics)
│ ├── hh_income_2011.dta # 家庭收入与支出
│ ├── health_status_2011.dta # 健康状况与功能(H)
│ ├── cognition_2011.dta # 认知与抑郁
│ ├── health_care_insurance_2011.dta # 医疗与保险
│ ├── work_retirement_pension_2011.dta
│ ├── biomarker_2011.dta # 体格测量
│ ├── blood_2011.dta # 血检结果(仅 2011/2015/2018/2020)
│ ├── weights_2011.dta # 截面/追踪权重
│ └── PSU_2011.dta # 抽样信息(社区编码受控)
├── Wave2_2013/ ... (同构,另含退出/死因问卷)
├── Wave3_2015/ ... (含第二次血检)
├── Wave4_2018/ ... (含 HCAP 子研究文件)
├── Wave5_2020/ ... (2023-11-16 发布)
├── LifeHistory_2014/ # 生命历程专题
└── Harmonized_CHARLS_VersionD/ # 官方整合版(含代码与文档)
§4.1 DAIMS 字段字典(核心变量)
字段名以 Harmonized CHARLS(前缀 ra/rw = respondent/record-wave)为参照;原始包变量名前缀按模块不同,需对照各 wave codebook。
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| ID | Text | 受访者唯一编码(跨 wave 不变) | “011528003” | 主键,跨 wave/跨表 JOIN | 无 | 无缺失 | 平台生成 |
| rw/wave | Int | 调查轮次 | 3 | 时序索引 | 无 | 无 | 1-5 |
| ragey_e | Int | 访访时年龄(岁) | 67 | 年龄特征 | 回答者报年龄偏差 | 无 | 45-100+ |
| ragender | Int | 性别(1=男,2=女) | 2 | 人口学特征 | 无 | 无 | 1,2 |
| raeducl | Int | 教育程度( harmonized 分级) | 2 | SES 特征 | 自报学历噪声 | 无 | 1-4 |
| r10shlt | Int | 自评健康(1=极好…5=很差) | 3 | 结局/特征 | 语言参照漂移 | 无 | 1-5 |
| r_adla / r_iadla | Int | ADL / IADL 失能项数 | 1 | 失能分级 | 代理应答误差 | 无 | 0-5 / 0-5 |
| rcesd10 | Float | CES-D 10 抑郁得分(0-30) | 11.0 | 抑郁筛查标签 | 情绪状态日间波动 | 个别项缺失按官方规则补齐 | 0-30 |
| rtr20 / rtr30 | Int | 词组即时/延迟回忆(0-10) | 6 | 认知轨迹 | 访员施测差异 | 无 | 0-10 |
| rser7 | Int | 心智状态(日期定向+计算/画图) | 5 | 认知轨迹 | 教育相关差异 | 无 | 0-7 |
| rsbp / rdbp | Float | 收缩压/舒张压(mmHg) | 148 / 86 | 高血压客观标签 | 现场测量波动;多次测量取均值 | 未测量=-999(见 §4.5) | 70-250 / 40-140 |
| rweightk / rheightm | Float | 体重 kg / 身高 m | 62.4 / 1.58 | BMI 计算 | 站姿误差 | 未测量=-999 | >0 |
| rgrip | Float | 握力(kg) | 27.0 | 躯体功能 | 优势手/姿势差异 | 未测量=-999 | >0 |
| rhba1c | Float | 糖化血红蛋白(%) | 6.4 | 糖尿病客观标签 | 实验室批次效应 | 未采血=-999 | 4-16 |
| rldlch / rglucose | Float | LDL-C(mg/dL)/ 空腹血糖 | 128 / 104 | 代谢特征 | 空腹状态差异(92% 空腹) | 未采血=-999 | >0 |
| rwthh / wtlv | Float | 截面 / 追踪权重 | 1.234 | 全国外推 | 极端权重不稳定 | 无 | ≥0 |
| urban_nbs | Int | 城乡(社区属性) | 0 | 分层评估 | — | 受控披露 | 0,1 |
| rheara | Int | 听力自评(5 级) | 3 | 感官功能特征 | 主观尺度 | 无 | 1-5 |
| rpainany | Int | 是否受疼痛困扰 | 1 | 症状特征 | 主观耐受差异 | 无 | 0,1 |
| rlivem | Int | 居住安排(与子女同住等) | 2 | 家庭结构特征 | 界定口径跨轮微调 | 无 | 分类码 |
| rexpendy | Float | 家庭年消费支出(元) | 38,400 | 经济特征 | 回忆偏倚;需价格平减 | 无 | ≥0 |
| rslphrs | Float | 夜间睡眠时长(小时) | 7.0 | 生活方式特征 | 自报时长偏乐观 | 无 | 0-24 |
§4.2 标签分布(常见任务阳性率参考)
以下分布为构造标签的常见起点;具体数值随 wave 与清洗规则浮动,使用时应按自选样本重算:
| 任务标签 | 常见构造 | 分布特征 | 依据 |
|---|---|---|---|
| 抑郁筛查阳性 | CES-D 10 ≥ 10 | 社区老年人群普遍报告在 1/3 量级;2018 wave α = 0.784 | Frontiers 2024 |
| 未确诊高血压 | 自报无 ∧ 测量 ≥140/90 mmHg | 因知晓率有限而规模可观,是客观测量的核心价值点 | Crimmins et al. |
| 认知总分 | 词组回忆 + 心智状态(0-31) | 随年龄/教育显著分层;情景记忆 0-20、心智状态 0-11 | Nature Sci Rep 2026 |
| 死亡(全因) | 退出问卷确认死亡 | 类不平衡明显;建议离散时间人-轮格式 | §3.1 死亡登记模块 |
§4.3 关键统计
- 抽样设计效应:450 个村/社区为一级抽样单元(PSU),跨社区聚类相关显著,置信区间必须考虑聚类稳健标准误。
- 追踪保持率:基线受访者各轮再接触率 >90%,panel 应答率 >86%(Frontiers 2023)。
- 2011→2020 完整匹配:常见纵向研究保留约 1.3-1.4 万人(如 17,597→匹配 2020 后 13,659,Ovid 2026),衰减结构见 §6.5 坑点 1。
- 血检覆盖:2011 年 67% 受访者采血;女性(69%)高于男性(65%)、农村(71%)高于城市(Hu et al.)。
- 跨轮可比的纵向认知记录:仅要求两轮以上认知测验者,一项全国研究即保留 47,825 条人-轮记录、14,729 名受访者(2011-2020;Nature Sci Rep 2026),可作为面板规模量级参考。
- 教育结构:基线人群跨越扫盲前与义务教育普及两代,低教育比例高,认知测验存在教育依赖性,分域建模时须分层。
§4.4 数据层级
省级(公开) ── 县级(保密) ── 社区/村级 PSU(保密) ── 户 household ── 个人 respondent
├── 多 wave 记录 wave(1-5)
│ ├── 问卷模块(dem/health/cognition/economy...)
│ ├── 体格测量表
│ └── 血检表(2011/2015/2018/2020)
└── 退出记录 exit(死亡/失访)
AI 建模的最小单位是"个人-轮"(person-wave);跨表合并一律以 ID + wave 为键。
两个实践细节:同一家庭内夫妻的 ID 前缀相关,严格场景按户分组可由 ID 映射表实现;死亡受访者仅存在于"退出问卷"中,构造完整风险集时要把 exit 记录并入对应 person-wave,否则生存分析的风险集会系统性剔除最重病例。
§4.5 缺失值与信息性缺失编码
| 编码/情形 | 含义 | 处理建议 |
|---|---|---|
| Stata “.” | 系统缺失(未问/跳答) | 按模块规则判定是否结构性跳过 |
| -999 类哨兵值 | 未测量(如血检未采、体格未做) | 先转 NaN 再插补;不要当真值 |
| 血检缺失 | 采血应答 67%,与性别/城乡相关 | 建模时检验 MCAR;用逆概率加权 |
| 代理应答(proxy) | 认知重损者由知情者代答 | 标记 proxy 变量,敏感性分析 |
| 跳答(如无医保者跳过医保类型) | 结构性缺失,信息量大 | 编"无该事件"哑变量,勿与随机缺失混淆 |
| “不知道/拒绝” | 未提供 | 与系统缺失分开编码,做敏感性分析 |
| 极端权重 | 少数样本权重过大 | 报告权重分布;截断敏感性分析(勿默认) |
信息性缺失是 CHARLS 的常态而非异常:未采血、未测体格本身携带健康与地区信息(见 §6.5 坑点 2/7),直接完整案例删除会引入选择偏倚。
§5 数据划分与使用建议
§5.1 官方划分
官方不提供任何训练/验证/测试划分。CHARLS 是分析型调查数据,所有划分由使用者构造。
§5.2 社区惯例划分
| 划分方式 | 做法 | 适用 | 风险控制 |
|---|---|---|---|
| 时序划分(推荐) | 2011/2013 训练 → 2015 验证 → 2018/2020 测试 | 预测类任务 | 模拟"用过去预测未来";自动暴露量表漂移 |
| 人级划分 | 按 ID 划分(同一人所有轮次同侧) | 静态横断面任务 | 杜绝同人多轮泄漏 |
| PSU 群组划分 | 按村/社区整组划分 | 泛化能力评估 | 最保守;符合抽样设计 |
| 家庭级划分 | 按户划分 | 含配偶/家庭变量任务 | 控制配偶相关性 |
随机行级划分在 CHARLS 上几乎必然泄漏,禁止作为正式评估口径。
§5.3 泄漏风险(重点)
- 同人多轮泄漏:同一 ID 出现在多轮,行级随机划分将训练信息直接泄入测试;必须以人(或家庭/PSU)为分组键。
- 配偶/家庭相关性:夫妻同时入组,健康与经济变量高度相关;严格场景按户分组。
- PSU 聚类泄漏:同村共享环境与设施,按 PSU 分组划分更保守。
- 标签构造泄漏:用 wave t 的自报诊断回填 wave t-1 的"既往病史"变量时,注意时间方向,避免把结局变量经派生变量带回特征。
- Harmonized 版泄漏:Harmonized CHARLS 部分派生变量跨 wave 信息回溯(如"曾患"),入模前逐变量核对其构造代码。
§5.4 交叉验证建议
- 分组 K 折(GroupKFold,组 = ID 或 PSU)用于模型选择;时间外推评估(§5.2 时序划分)作为终评。
- 类不平衡任务(死亡、痴呆)用分层 + 分组双重约束。
- 报告时同时给出未加权与加权(抽样权重)指标,说明全国外推口径。
- K 折的分层维度建议同时覆盖 wave 与城乡;对时间敏感任务(如死亡)禁用"未来轮次参与训练"的折。
§5.5 外部验证建议
- HRS(美国)/ ELSA / SHARE:同属 HRS 家族且变量 harmonized,适合做跨文化迁移与模型稳健性检验(UMich Biomarker Network)。
- CLHLS / CFPS(中国):同城不同设计,检验对中国人群的覆盖一致性;CLHLS 聚焦高龄,CFPS 覆盖全年龄。
- CHARLS-HCAP(2018 子样本):内部金标准,用于把认知筛查模型对接临床痴呆评估。
- CHARLS 生命历程(2014)+ 口述历史(2016): Childhood 与成年期回溯变量支持早期生命历程暴露与晚年健康的跨代建模;回溯数据本身含回忆偏倚,作特征时需声明。
- 跨数据集验证时先统一量表版本与单位(见 §6.5 坑点 3),再迁移。
§6 AI 就绪指南
§6.0 环境与云端快速启动
CHARLS 是 GB 量级表格数据,任何 4 GB 内存的本地/云端 Python 环境均可处理,无特殊硬件或云依赖:
pip install pandas pyreadstat scikit-learn torch
§6.1 快速上手
# ============================================================
# 目录结构预期(与 §4.0 目录树对应):
# charls/
# ├── Wave1_2011/ # 各 wave 目录
# └── Harmonized_CHARLS_VersionD/
# data_root 与文件名拼接关系:data_root / "Wave1_2011" / f"{module}_2011.dta"
# 最小可用子集:单 wave 的 dem_*.dta + health_status_*.dta + weights_*.dta
# (变量名以实际下载包 codebook 为准;下面以 Harmonized 版变量风格示意)
# ============================================================
import pandas as pd
from pathlib import Path
data_root = Path("charls")
# 读取单模块(Stata .dta;仅加载需要的列以省内存)
dem = pd.read_stata(
data_root / "Harmonized_CHARLS_VersionD" / "H_CHARLS_Demo_Track.dta",
columns=["ID", "rwwave", "ragey_e", "ragender", "raeducl", "racesd10", "r10shlt"],
)
# 长表:一人多行(每人每 wave 一行)
print(dem.groupby("rwwave")["ID"].nunique()) # 各轮人数核对(应接近 §3.2 表)
# 计算抑郁筛查标签(CES-D 10 ≥ 10)
dem["dep_flag"] = (dem["racesd10"] >= 10).astype("float")
dem.loc[dem["racesd10"].isna(), "dep_flag"] = float("nan")
print(dem["dep_flag"].mean()) # 阳性率 sanity check(§4.2)
要点:一读 codebook 二看分布三再建模;Harmonized 版变量名跨 wave 统一,是上手的最低摩擦路径。
两个常见起步错误:其一,用 convert_categoricals=True 读原始包时遇到值标签缺失会抛错,建议先读数值再按 codebook 手动映射;其二,直接 pd.concat 各轮原始包会出现同名变量口径不一致(坑点 3),起步阶段宁可只用 Harmonized 版,跑通后再回原始包做精修。
§6.2 数据获取
申请流程(全部免费,仅限学术):
| 步骤 | 操作 | 要点 |
|---|---|---|
| 1 | 打开 charls.charlsdata.com → 数据用户注册 | 必须真实姓名 |
| 2 | 填写登录/个人/联系信息并激活账号 | 需机构或学校邮箱(协议) |
| 3 | 登录后在数据列表点"申请数据" | 选择所需 wave(可全选) |
| 4 | 等待官方审核 | 通过后邮件通知;周期通常数个工作日,学位/职称信息完整可加速(见 §6.5 坑点 6) |
| 5 | 下载各 wave ZIP | 按 wave 分卷,Stata .dta |
| 6 | 需要县/社区编码等保密数据时 | 另签保密数据使用协议单独申请 |
合规红线(协议原文要点):仅限学术研究;禁止商业用途;禁止以任何形式再发布原始微观数据;禁止向第三方转让账号或数据;发表时须致谢北京大学国家发展研究院并引用官方 Users’ Guide。
# 下载后校验:各 wave 人数与官方口径对齐(§3.2)
import pandas as pd
for wave_dir, wave_no in [("Wave1_2011", 1), ("Wave2_2013", 2), ("Wave3_2015", 3),
("Wave4_2018", 4), ("Wave5_2020", 5)]:
df = pd.read_stata(f"charls/{wave_dir}/dem_{wave_no}.dta")
print(wave_no, df["ID"].nunique())
§6.3 预处理全流程
格式转换 → 多轮拼接 → 清洗 → 标准化 → 特征构造:
# ============================================================
# 预处理管线:跨 wave 纵向面板构造(认知衰退预测为例)
# 前置:已按 §6.1/6.2 下载并解压各 wave 到 charls/
# ============================================================
import pandas as pd
import numpy as np
from pathlib import Path
root = Path("charls")
# 1) 逐轮读取认知相关列(列名以各 wave codebook 为准)
frames = []
for d, no in [("Wave1_2011", 1), ("Wave2_2013", 2), ("Wave3_2015", 3),
("Wave4_2018", 4), ("Wave5_2020", 5)]:
cog = pd.read_stata(root / d / f"cognition_{no}.dta",
convert_categoricals=False) # 先读数值,标签自行映射
cog = cog[["ID", "iwewave", "tr20", "tr30", "ser7", "cesd10"]]
cog.columns = ["ID", "wave", "word_imm", "word_delay", "mental_status", "cesd10"]
cog["wave"] = no
frames.append(cog)
panel = pd.concat(frames, ignore_index=True)
# 2) 认知总分(0-31)与哨兵值清洗
panel["cognition"] = panel["word_imm"] + panel["word_delay"] + panel["mental_status"]
panel.loc[panel["cognition"] < 0, "cognition"] = np.nan # -8/-9 类负码 → NaN
# 3) 宽↔长检查:同一人同轮应只有一行
assert panel.duplicated(["ID", "wave"]).sum() == 0
# 4) 标准化:分 wave z 标准化(缓解跨 wave 量表漂移,见坑点 3)
panel["cognition_z"] = panel.groupby("wave")["cognition"] \
.transform(lambda s: (s - s.mean()) / s.std())
# 5) 构造"认知衰退"标签:末轮比首轮下降 ≥ 2 分
first = panel.sort_values("wave").groupby("ID")["cognition"].first()
last = panel.sort_values("wave").groupby("ID")["cognition"].last()
decline = (first - last >= 2).astype("float")
decline[first.isna() | last.isna()] = np.nan
panel = panel.merge(decline.rename("decline_flag"), on="ID")
合并血检与体格时,先检查该 wave 是否采集(坑点 2),再以 ID + wave 内连接;权重变量在最后一步按分析类型选择(坑点 8)。
§6.4 PyTorch DataLoader(认知衰退预测)
# ============================================================
# LongitudinalTabularDataset:person-level 样本
# X = 各轮特征序列(pad 到 max_len),y = 认知衰退标签
# 前置:panel 来自 §6.3;按 ID 分组划分,杜绝同人多轮泄漏
# ============================================================
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
FEATURES = ["cognition_z", "cesd10", "age"] # 按需扩展
class LongitudinalTabularDataset(Dataset):
def __init__(self, panel: pd.DataFrame, ids, max_len=5):
self.samples = []
sub = panel[panel["ID"].isin(ids)]
for pid, g in sub.groupby("ID"):
g = g.sort_values("wave")
y = g["decline_flag"].dropna()
if y.empty:
continue
seq = g[FEATURES].to_numpy(dtype=np.float32)
seq = np.nan_to_num(seq, nan=0.0)
mask = np.zeros(max_len, dtype=np.float32)
mask[: len(seq)] = 1.0
seq = np.pad(seq, ((0, max_len - len(seq)), (0, 0)))
self.samples.append((torch.tensor(seq), torch.tensor(mask),
torch.tensor(float(y.iloc[0]))))
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
return self.samples[idx]
# 人级分组划分(§5.2)
rng = np.random.default_rng(42)
ids = panel["ID"].dropna().unique()
rng.shuffle(ids)
tr, va, te = np.split(ids, [int(.7 * len(ids)), int(.85 * len(ids))])
train_ds = LongitudinalTabularDataset(panel, tr)
val_ds = LongitudinalTabularDataset(panel, va)
train_dl = DataLoader(train_ds, batch_size=64, shuffle=True, num_workers=2)
val_dl = DataLoader(val_ds, batch_size=256, num_workers=2)
# 模型:带掩码的小型 GRU(处理 max_len=5 的不等长序列)
from sklearn.metrics import roc_auc_score
class DeclineNet(torch.nn.Module):
def __init__(self, n_feat=len(FEATURES), hidden=32):
super().__init__()
self.gru = torch.nn.GRU(n_feat, hidden, batch_first=True)
self.head = torch.nn.Linear(hidden, 1)
def forward(self, x, mask):
out, _ = self.gru(x) # [B, L, H]
valid = mask.unsqueeze(-1) * out # 只保留真实轮次
denom = mask.sum(1, keepdim=True).clamp(min=1)
pooled = valid.sum(1) / denom # 掩码平均池化
return self.head(pooled).squeeze(-1)
model = DeclineNet()
opt = torch.optim.Adam(model.parameters(), lr=1e-3)
pos_w = torch.tensor( # 处理类不平衡:按训练集正负比设置
(len(train_ds) - sum(int(s[2]) for s in train_ds.samples))
/ max(sum(int(s[2]) for s in train_ds.samples), 1))
lossf = torch.nn.BCEWithLogitsLoss(pos_weight=pos_w)
for epoch in range(10):
model.train()
for x, m, y in train_dl:
opt.zero_grad()
loss = lossf(model(x, m), y)
loss.backward()
opt.step()
model.eval()
with torch.no_grad():
yv = torch.cat([y for _, _, y in val_dl])
sv = torch.cat([model(x, m) for x, m, _ in val_dl])
auc = roc_auc_score(yv.numpy(), torch.sigmoid(sv).numpy())
print(f"epoch {epoch}: val AUROC = {auc:.4f}")
§6.5 坑点(8 个,CHARLS 真实特有失败模式)
⚠️ 坑点 1:追踪流失与样本代表性的衰减——"全国代表性"随时间蒸发(分类:偏倚陷阱)
问题:社区追踪设计下,永久迁出原调查点者基本失访;死亡、失能者逐步退出,同时 PSU 内补入 refresher 样本。每轮"总人数"看似稳定(20,284 @2015),但基线 17,708 人匹配到 2020 后通常只剩约 1.3-1.4 万,且流失非随机——高龄、失能、认知差、农村与低收入者更易流失。
症状:用全轮合并样本训练的模型在高龄/农村亚组上性能骤降;不加权的全国外推结论与统计年鉴对不上;各论文"同一指标"的样本量与均值互相打架。
解决:
- 简单方法:每轮用官方截面权重 + 分组特征,报告按性别/城乡/年龄分层的覆盖表,先看清"谁在样本里"。
- 进阶方法:纵向分析一律用官方追踪(panel)权重与逆概率加权;对流失建模(生存模型或 IPW),把"存活并留在样本中"作为显式条件。
- SOTA 方法:敏感性分析对比"完整面板 vs 每轮截面"两套结论;用 refresher 样本构造重复截面(refreshed cross-section)恢复各时点代表性;报告流失前后协变量均衡性(标准化差异)。
参考:Nature Sci Rep 2026(社区追踪设计说明);Zhao et al. 2014。
⚠️ 坑点 2:血检/体格测量并非每轮都有——跨 wave 特征矩阵天然有洞(分类:预处理陷阱)
问题:静脉血仅 2011/2015/2018/2020 采集(2013 无);体格测量各轮项目有增减;教学指南口径下完整体检数据集中在 2011/2013/2015。跨 wave 分析若默认所有模态每轮齐备,特征矩阵将出现整块系统性空洞。
症状:合并后 HbA1c 在 2013 全为空;某些体能指标后半程消失;或模型把"该轮没采血"学成了保护性特征。
解决:
- 简单方法:先画"模态 × wave"覆盖矩阵再合并;把 -999 类未测量哨兵值统一转 NaN,绝不当真值。
- 进阶方法:缺测本身建模——增加"has_blood_waveX"指示列,插补用分 wave 中位数/_missForest;评估时做"仅问卷特征"与"全特征"双版本。
- SOTA 方法:信息性缺失用联合建模(JM 多重插补)或逆概率加权校正采血选择效应(2011 采血应答 67%,女 69%/男 65%、农 71%/城 61%,选择明显);对血检 wave 单独构造子队列。
参考:人大健康学院使用指南;Hu et al. PAA 2014。
⚠️ 坑点 3:认知量表版本变更——TICS 词表与计分跨 wave 漂移(分类:标签理解)
问题:认知测量由改版 TICS 组成(10 词即时/延迟回忆 + 心智状态),不同 wave 的词表与个别计分存在版本变更;直接把原始分拼成跨 wave 序列,会把"量表变了"误读为"认知变了"。
症状:2011 与相邻轮的均值跳变;认知衰退率在轮次边界出现不自然台阶;基于认知总分训练的轨迹模型把轮次识别成了最重要的特征。
解决:
- 简单方法:每轮内部 z 标准化后再合并(§6.3 第 4 步),轨迹分析用相对名次而非原始分。
- 进阶方法:对共答题目构造"等值子量表";用锚题做跨轮等值(linking),或 IRT 校准到同一量尺。
- SOTA 方法:在 Harmonized CHARLS(官方已整理认知分域)上复核;用 2018 HCAP 子研究做外部校准点,把筛查分映射到临床评估量尺;报告量表版本敏感性分析。
参考:Nature Sci Rep 2026(认知测验与信度描述);Harmonized CHARLS Version D 文档。
⚠️ 坑点 4:PSU/社区标识保密——地理分析在公开数据里做不了(分类:工程陷阱)
问题:为保护受访者,公开数据只到省/区域层级:仅公开调查年月(部分跨年)、2015 年后不再公布城市信息,县/村/社区编码与社区问卷细节属于"保密数据",须另签保密数据使用协议单独申请。
症状:想按城市/县做空间特征或分层抽样,发现公开包里根本没有可用地理码;把村庄编码与公开包 JOIN 直接失败;论文外审被要求提供地理层级说明。
解决:
- 简单方法:公开层面用省份/区域 + 城乡二元变量;不承诺任何低于省级的空间结论。
- 进阶方法:在保密协议内申请地理标识,在受控环境完成空间特征工程后仅输出聚合/脱敏特征;与气象、环境栅格(如 ERA5)对齐时用"基线城市/县"而非个人定位。
- SOTA 方法:发表时说明地理信息的获取与使用合规路径;将空间协变量的构造代码与保密数据申请凭证一并归档,保证可复现性审查。
参考:人大指南(2015 后不公布城市);CHARLS 注册协议。
⚠️ 坑点 5:自报与体检数据打架——两个"患病率"都是真的(分类:标签理解)
问题:医生告知的自报诊断系统性低估真实负担(就医可及性差、知晓率低),而客观测量(血压 ≥140/90、HbA1c ≥6.5%)覆盖"未确诊者"。用哪个做标签,得到的"患病率"与模型任务完全不同。
症状:高血压/糖尿病标签阳性率远低于文献;或模型在自报标签上 AUROC 很高、在客观标签上骤降;两个团队的"患病率"结论互相矛盾。
解决:
- 简单方法:任务定义先于建模——明确标签是"已确诊"(自报)还是"患病状态"(自报 ∨ 测量阳性),并在论文标题里写清。
- 进阶方法:三分类(已确诊 / 未确诊测量阳性 / 阴性)或把"知晓率"作为独立输出;用测量校正自报(回归校准)。
- SOTA 方法:参照 Crimmins 等的思路,用生物标志物直接重估疾病负担并对比自报,输出"自报偏差校正因子";对知晓率做城乡/SES 分层分析,作为公平性指标。
参考:Crimmins et al.(2015 血检设计与理由)。
⚠️ 坑点 6:实名 + 机构资质审核——申请周期要排进项目计划(分类:工程陷阱)
问题:数据免费但流程刚性:真实姓名注册、机构/学校邮箱、逐 wave 申请审核、发表须致谢;商用与再分发被明确禁止。审核周期与账号唯一性常被低估,卡在 Deadline 前夜。
症状:公共邮箱/信息不完整被退回;同组多人共用一个账号下载数据(违反协议);临时想补 Wave 4 却发现要重新走申请。
解决:
- 简单方法:立项当天就发起注册与申请,一次勾选所有可能用到的 wave;用机构邮箱并确保职称/单位信息与发表署名一致。
- 进阶方法:组内建立"单一下载点 + 内部数据台账",标注下载日期、版本(Harmonized Version D 等)与协议条款,保证论文可复现审查时对得上。
- SOTA 方法:把 CHARLS 引用规范(Zhao et al. 2014 + Users’ Guide)写进团队模板;需要保密地理数据的项目,把保密协议审批与 IRB 备案并行推进(CHARLS 自身 IRB 编号 IRB00001052-11015,可写入伦理声明)。
参考:注册协议;Springer BMC Public Health 2025(伦理声明范式)。
⚠️ 坑点 7:冻存样本与检测指标受限——血检 ≠ 全部生物样本(分类:预处理陷阱)
问题:公开血检只是已完成 assay 的部分指标(血常规、hsCRP、HbA1c、血脂、血糖、BUN、肌酐、尿酸、胱抑素 C);血浆/buffy coat 冻存样本、新增检测与 DNA 类分析由 PI 团队逐案审批,不在公开包内。2008 pilot 的 DBS 指标(如 CRP、血红蛋白)与 2011 起静脉血指标也不可混用。
症状:想加炎症/遗传新指标发现公开表里没有;把 pilot DBS 值与静脉血值当同一量尺合并;血浆样本申请被误以为随数据下载自动获得。
解决:
- 简单方法:以官方 biomarker 文档为准圈定可用指标;DBS(2008)与静脉血(2011 起)分库处理,不拼接。
- 进阶方法:新指标需求按官方渠道提交样本使用提案,同时报告检测平台与质控差异;跨实验室指标换算前先做分布对齐检查。
- SOTA 方法:对关键 assay 引用官方批内/批间 CV(如 hsCRP < 1.3%/5.7%)做测量误差建模;批次效应用 ComBat 类方法跨 wave 校正并留出保留集验证。
参考:Crimmins et al.;Hu et al. PAA 2014;Biomarker Data in CHARLS。
⚠️ 坑点 8:多 wave 合并的权重用错——截面权重套在面板分析上(分类:评估误用)
问题:CHARLS 同时提供截面权重与追踪面板权重,且每轮文件不同、refresher 样本补入使权重基期变化。把某轮截面权重直接用于 2011-2020 固定面板分析,推断人群立即错位。
症状:加权均值与官方报告对不上;置信区间异常窄或宽;同一模型换一轮的权重结果翻转;审稿人质疑"全国代表性"。
解决:
- 简单方法:先确定分析设计——单轮截面用该轮截面权重;固定面板用与起始轮匹配的追踪权重;每轮重复截面用各轮自己的截面权重。
- 进阶方法:合并多轮时按"分析人群在每轮都在场"的原则重配权重;分层/聚类协变量(PSU、层)与权重一起喂给 svy/复杂调查设计对象再估标准误。
- SOTA 方法:对 attrition 做 IPW 后再叠加纵向权重;对比加权/未加权/极值权重截断三种口径的稳健性;机器学习外推任务报告加权指标为主、未加权为辅。
参考:Zhao et al. 2014(权重体系);Frontiers 2023(权重与追踪率)。
§6.6 数据增强
- ✅ 安全:SMOTE/类别重加权用于失衡结局(死亡、痴呆);时间窗口滑动的伪轮次采样;对连续特征加小幅度高斯噪声做一致性正则;Mixup(仅特征空间,标签平滑)。
- ❌ 危险:跨 wave 直接复制个体行当新样本(破坏协方差结构);对血检指标做与生理常识冲突的线性放缩;在未加权样本上做采样后宣称全国代表性;把 refresher 样本与基线样本混合采样而不打权重标签。
§6.7 模型推荐
| 任务 | 推荐起点 | 进阶 | 说明 |
|---|---|---|---|
| 认知/抑郁风险预测 | Logistic + Lasso / XGBoost | 序列模型(Transformer/GRU over waves) | 序列模型吃 multi-wave;先打过 XGBoost 基线 |
| 生存分析(死亡/失能) | 离散时间 logistic / Cox | DeepSurv、随机生存森林 | 人-轮长格式 + 追踪权重 |
| 轨迹聚类 | 组轨迹 / latent class growth | 深度时序聚类 | 注意坑点 3 量表漂移 |
| 因果推断 | IPTW / DID / RD | 双重机器学习(DML) | 用经济与政策变量;权重见坑点 8 |
| 多轮补全/插补 | 分 wave 中位数 + 指示列 | MissForest / JM 多重插补 | 呼应坑点 2 的模态空洞 |
| 死因分类 | 自报死因汇总统计 | 文本编码(死因描述) | 注意死因由家属/知情者报告 |
| 多模态融合 | 问卷 + 血检两流 MLP | 跨模态注意力 | 处理坑点 2 的模态空洞 |
§6.8 硬件需求
| 阶段 | CPU | 内存 | GPU | 磁盘 |
|---|---|---|---|---|
| 单轮清洗/分析 | 4 核 | 8 GB | 无 | 10 GB |
| 全 5 轮面板 + Harmonized | 8 核 | 16 GB | 无 | 50 GB |
| 深度序列模型训练 | 8 核 | 32 GB | 单卡 16 GB 可跑 | 100 GB |
§6.9 评估指标代码
# 加权 AUROC 与分组稳健评估(抽样设计感知)
import numpy as np
from sklearn.metrics import roc_auc_score
def weighted_auroc(y, score, w):
# 以抽样权重加权排序;sklearn 不支持 sample_weight 时手动实现
order = np.argsort(score)
y, w = np.asarray(y)[order], np.asarray(w)[order]
P = w[y == 1].sum(); N = w[y == 0].sum()
ranks = np.empty(len(y)); r = 1
i = 0
while i < len(y):
j = i
while j + 1 < len(y) and score[order][j + 1] == score[order][i]:
j += 1
ranks[i:j + 1] = (i + j + 2) / 2.0 # 平均秩处理并列
i = j + 1
return (ranks[y == 1] * w[y == 1]).sum() / (P * N)
# 按亚组(城乡/性别/年龄段)分别报告 AUROC,检查公平性(坑点 1/5 的下游体现)
def subgroup_report(df, y, score, w, by):
return df.groupby(by).apply(
lambda g: weighted_auroc(g[y], g[score], g[w]))
# 连续结局(如末轮认知总分)的加权 RMSE 与 MAE
def weighted_rmse(y, pred, w):
e2 = (np.asarray(y) - np.asarray(pred)) ** 2
return float(np.sqrt(np.average(e2, weights=np.asarray(w))))
# 生存任务的 Harrell C-index(离散时间人-轮格式下用时间依赖 AUROC 近似亦可)
def concordance_index(durations, events, risk):
d, e, r = map(np.asarray, (durations, events, risk))
n = 0; c = 0
for i in range(len(d)):
mask = (d > d[i]) | ((d == d[i]) & (e[i] == 1) & (e == 0))
if e[i] == 1:
n += mask.sum()
c += (r[i] > r[mask]).sum() + 0.5 * (r[i] == r[mask]).sum()
return c / max(n, 1)
§6.10 MLOps 笔记
- 版本对齐:数据版本(各 wave 发布日 + Harmonized Version D)与代码版本一起登记;CHARLS 不停更,复现实验必须固定 wave 发布版本。
- 特征字典:Harmonized 变量名(如 rcesd10)与原始问卷题号做双向映射表入库,新成员上手成本减半。
- 监控漂移:上线后按 wave/年份监控输入分布(PSI)与标签率;老龄队列天然存在"人群老化"漂移(§7.6)。
- 权重感知的指标服务:线上评估接口同时返回加权/未加权两套指标与 PSU 聚类稳健区间,防止"只看未加权均值"的口径漂移。
- 可复现性包:发布模型时附带 FACTS 式数字溯源表(每个数字对应官方或同行评审来源)与数据下载凭证哈希,审稿与合规审计一次通过。
- 合规流水线:数据下载、账号、致谢与引用规范纳入 CI 文档检查(坑点 6);对外发布仅限聚合结果,禁止任何微观行数据出域。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 流失偏倚 | 迁出者失访,高龄/失能/农村/低收入更易流失;panel 收缩重构(§6.5 坑点 1) | 高 | 追踪权重 + IPW;分层报告 |
| 生存者偏倚 | 基线后即死亡/重病者退出,横截面高估健康水平 | 高 | 生存框架建模;死亡退出显式处理 |
| 自报低估 | 慢病自报漏诊漏报(可及性/知晓率) | 高 | 客观测量校正(坑点 5) |
| 测量条件偏倚 | 采血应答 67% 且与性别/城乡相关;92% 空腹 | 中 | 采血选择模型;空腹指示控制 |
| 季节/时点偏倚 | 调查跨年,不同地区访问季节不同 | 中 | 季节协变量控制;敏感性分析 |
| 实验室批次效应 | 跨 wave 检测批次与平台差异 | 中 | 质控 CV 评估;批次校正 |
| 覆盖偏倚 | 抽样框不含西藏、不含机构居住者 | 中 | 明确外推范围声明 |
| 代理应答 | 重度认知受损者由知情者代答 | 中 | proxy 标记;敏感性分析 |
| 量表漂移 | 认知词表跨 wave 版本变更 | 中 | 等值处理(坑点 3) |
| 回忆偏倚 | 消费/收入/医疗费用按回忆报告 | 中 | 价格平减;与宏观统计校核 |
| 家庭聚集性 | 夫妻同时入组,健康与经济高度相关 | 中 | 按户聚类稳健标准误/分组划分 |
§7.2 标注质量
标签链路三类来源,可靠度分层清晰:实验室指标带批内/批间 CV 与室间质控(最高);护士标准化体格测量次之;自报与知情者问卷再次之。CES-D 10 在 2018 wave α = 0.784;认知测验经 Cronbach’s α 与 KMO 检验显示良好信效度(Nature Sci Rep 2026)。官方无"标注一致性"(如双录校验)公开数字,使用者应把自报层视为含噪标签并做测量误差建模。
按可信度分级的实操建议:血检与体格层可直接作为特征与锚点;自报诊断优先用于"就诊行为/知晓率"建模而非疾病真值;知情者代答的记录单独打标,避免与健康受访者的自评混入同一分布。所有标签构造代码随论文/模型仓库一并发布,是 CHARLS 类二手构造标签可复现的最低要求。
§7.3 泛化性
| 场景 | 失效风险 | 证据/理由 |
|---|---|---|
| 外推至全中国社区人群 | 中 | 全国 PPS 抽样 + 权重;但不含西藏与机构人群(§7.1) |
| 迁移到医院/临床人群 | 高 | 社区人群 vs 就医人群分布完全不同;症状谱更重 |
| 迁移至其他 HRS 家族国家 | 中 | 变量 harmonized 但文化/医疗体系差异显著 |
| 长时程外推(预测 >5 年) | 中高 | 人群老化 + 时代效应;需漂移监控 |
| 农村→城市迁移人群 | 中 | 流动人口迁出原址即失访,该亚组先天稀薄(坑点 1) |
| 少数民族聚居区 | 中 | 未单独设层,样本量与语言适配限制泛化证据强度 |
§7.4 伦理
CHARLS 获北京大学生物医学伦理委员会批准(IRB00001052-11015;生物样本 IRB00001052-11014),全部受访者签署书面知情同意(Springer 2025)。二级使用者仍需自行完成所在机构的伦理审查/豁免,并遵守仅学术、禁再分发的数据协议(§6.2)。血液样本的后续使用(新增检测、基因类分析)由 PI 团队依公共卫生/医学专业意见逐案审批,不随公开数据自动授权;涉及保密地理数据的项目,伦理备案中应写明数据层级与聚合输出策略。
§7.5 公平性
数据支持城乡、性别、年龄段、教育、区域的公平性审计:采血应答的性别/城乡差(69%/65%、71%/61%)、自报与测量的知晓率差、流失的城乡梯度,都是建模前应量化的系统性差异。建议对所有交付模型输出 §6.9 的亚组指标表。
三条具体审计建议:其一,认知类特征对教育高度敏感,低教育亚组应单独校准阈值,避免筛查模型系统性误报;其二,经济特征(消费、资产)在城乡间量纲与结构不同,直接进模型会学出"城乡代理变量";其三,血检特征只在采血亚组有值,而采血概率本身依赖性别与城乡(坑点 2),缺失指示变量会变成公平性敏感特征,应纳入偏差审查清单。
§7.6 数据漂移
三类漂移叠加:(1)人群老化——队列年龄结构整体右移,截断年龄阈值的行为会改变样本构成;(2)时代效应——医保政策、诊断标准与移动医疗普及改变自报行为;(3)测量更替——认知量表与体检项目跨 wave 变动。缓解:一切"跨时间"比较都过一遍权重 + 量表等值(坑点 3/8);生产环境按 §6.10 监控输入分布。
针对 Wave 6(2021-2023 在采)的预案:新数据发布后,固定旧版本训练的模型应先在"W6 vs W5"的分布对比上重新验证,更新特征字典与权重文件,再决定是否热更新;这也是把"数据会持续发布"写进 MLOps 契约的意义。
§7.7 DAIMS 24 项检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ✅ | 各模块一行一人;合并后为人-轮长表 |
| 2 | 有唯一标识符列 | ✅ | ID 跨 wave 不变;ID + wave 定位记录 |
| 3 | 无 Unicode 或特殊字符 | ⚠️ | 变量值为数值码;中文变量标签/值标签需 pyreadstat 映射 |
| 4 | 无重复行 | ✅ | 官方数据主键唯一;合并时仍需 assert 防自造重复 |
| 5 | 缺失值已识别并编码 | ✅ | Stata “.” + 哨兵值;§4.5 编码表 |
| 6 | 标签列被明确标识 | ⚠️ | 无官方 AI 靶标;CES-D ≥10、认知衰退等由社区惯例构造 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | 慢病/职业/医保类型低频类众多,需自行归组 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 九类偏倚与缓解 |
| 9 | 有完整的数据字典 | ✅ | 各 wave codebook + Harmonized 版变量字典 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | 哨兵值明确;但"未采血"的健康选择机制需自行建模(坑点 2/7) |
| 11 | 数据采集设备和设置已记录 | ✅ | §3.9 采血/体格规程与设备文档完整 |
| 12 | 已移除完全共线性变量 | ⚠️ | 未执行;收入-消费-资产等多源变量共线性显著 |
| 13 | 对编码的映射标准已说明 | ✅ | ICD-11/SNOMED 映射见 §2.1;诊断靠自报需声明 |
| 14 | 对时间戳的处理已明确说明 | ✅ | 公开调查年/月(部分跨年);生日与访问月可算年龄 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 官方无划分;§5 给出社区惯例与时序/分组方案 |
| 16 | 数据泄漏风险已被讨论 | ✅ | §5.3 五类泄漏模式 |
| 17 | 标签分布已被分析 | ✅ | §4.2 常见任务阳性率与不平衡说明 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 采血 67% 选择效应;§4.5/§7.1/坑点 2 |
| 19 | 外部验证建议已给出 | ✅ | §5.5 HRS/ELSA/SHARE/CLHLS/HCAP |
| 20 | 数据更新和版本信息已记录 | ✅ | 各 wave 发布日期明确(2013→2023-11-16);Wave 6 在采 |
| 21 | 最小必要预处理脚本已提供 | ✅ | 官方 Harmonized CHARLS 附整合代码;本页 §6.3 管线 |
| 22 | 合规使用要求已明确 | ✅ | 实名注册 + 机构邮箱 + DUA;仅学术(§6.2) |
| 23 | 多模态对齐方法已说明 | ⚠️ | 问卷-体格-血检以 ID+wave 对齐;模态覆盖空洞需自行处理(坑点 2) |
| 24 | 去标识化方法已被记录 | ✅ | ID 编码化、地理掩蔽(2015 后无城市;县/村受控披露) |
DAIMS 评分:20.0 / 24
评分解读:优秀——抽样、文档、权重与去标识化体系成熟,官方整合版(Harmonized)大幅降低清洗成本;扣分集中在"无官方 AI 划分与靶标"、"跨 wave 测量一致性需人工核对"与地理信息受控这三件队列调查数据的结构性短板,而非数据质量问题。
对你意味着什么:把 CHARLS 当"带权重的纵向表格库"用,基本可以即下即跑:先用 Harmonized 版完成原型,再按本页坑点清单做三轮检查(权重口径、量表等值、模态空洞),最后用 §5.2 时序/分组划分交付。省下的清洗时间应全部投入标签定义(自报 vs 客观)与公平性审计——这才是 CHARLS 类数据拉开论文与产品差距的地方。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| Harmonized CHARLS ↔ HRS 认知量表 | 北大 & USC/RAND | 认知分域跨文化可比性 | 分域均值/分布可比性 | 见论文(方向性一致) | 认知分域与 HRS 映射后可跨队列比较(Lei et al., J. Human Resources 2013 语境) |
| CHARLS 2015 血检 vs 自报健康 | 北大 & USC | 自报校准 | 疾病负担重估 | 自报系统性低于客观测量 | 生物标志物揭示"未知疾病"负担(Crimmins et al., PMC6825825) |
| 中国健康老龄化路径分析(柳叶刀委员会) | 北京大学 | 人群健康轨迹估计 | 政策情景指标 | 以 CHARLS 为核心证据源 | CHARLS 可支撑国家级健康老龄化目标测算(charls.pku.edu.cn) |
| 2011 基线血检子样本 vs 全样本 | 北大 & 中国 CDC | 采血选择效应 | 应答率与协变量差 | 采血者偏女/偏农(69/65、71/61%) | 使用血检需校正选择效应(Hu et al. PAA 2014) |
| CHARLS-HCAP(2018 子样本) | 北大 & 国际 HCAP 网络 | 认知筛查 ↔ 临床评估 | 校准对接(方向性) | 内部子样本,规模有限 | 把筛查量表链接到痴呆临床评估协议(Zhao, CHARLS Update 2023) |
§8 基准性能与生态
§8.1 排行榜现状
CHARLS 无官方基准排行榜或固定测试集;下列为社区中具代表性的已发表基准研究,任务与清洗规则各异,数值不可直接比较:
| 排名 | 研究(任务) | 模型/方法 | 报告性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|---|
| 1 | 认知测验信效度基线 | TICS 改版分域测验 | Cronbach’s α / KMO 优秀(分域与总分) | 2026 | 量表验证 | 见 Nature Sci Rep 2026 | 无 |
| 2 | 抑郁筛查(CES-D 10) | 阈值 ≥10 筛查 | 2018 wave α = 0.784 | 2024 | 量表信度 | 见 Frontiers 2024 | 无 |
| 3 | 纵向认知分析范式 | 人-轮面板(47,825 记录 / 14,729 人) | — | 2026 | 多轮匹配管线 | 见 Nature Sci Rep 2026 | 无 |
| 4 | 2015 血检方法学基准 | 静脉血 assay 全流程 | 批内 CV ≤ 5.7%(各指标) | 2021 | 质控链 | Crimmins et al. | 无 |
(完成引用见 §8.5 与 §9 BibTeX;表中"性能"为方法学/信度指标,因任务定义与样本各异,禁止横向排名。)
解读上,CHARLS 的"基准"事实上由两条线构成:方法学线(量表信效度、血检质控,如上表)与应用线(大量认知/抑郁/慢病预测论文,但各自清洗规则不同)。AI 团队引用应用线数字时,必须同时引用其样本构造与权重口径,否则不可比。
§8.2 SOTA 总结与选型建议
CHARLS 上的"领先方法"不是某个模型,而是一套公认的分析规范:Harmonized 版起步 → 官方权重 + PSU 聚类 → 时序/分组划分 → 亚组公平性报告。深度序列模型只有在打过 XGBoost/Logistic 基线并处理了量表漂移与流失之后才有意义。
§8.3 评测协议建议
- 固定 wave 版本与 Harmonized 版本号,写进实验配置与论文复现包;
- 采用人级/PSU 级划分,禁用行级随机划分;
- 权重口径(截面/面板/未加权)作为超参数显式登记;
- 报告未加权 + 加权双指标,注明推断人群;
- 亚组(城乡/性别/年龄/教育)指标全覆盖,任一亚组失效必须解释;
- 对"标签定义"(自报 vs 客观)做敏感性分析,给出两套结论的差异表;
- 对量表漂移处理方式(原始分/标准化/等值)做消融;
- 公开全部派生变量构造代码,接受社区复算。
§8.4 相关数据集
| 数据集 | 关系 | 可组合点 |
|---|---|---|
| HRS(美国) | 模板与对标 | 变量级 harmonized;跨文化迁移 |
| ELSA / SHARE | HRS 家族 | 欧洲外部验证 |
| CLHLS | 中国同域互补 | 高龄段与长寿研究衔接 |
| CFPS | 中国全年龄 | 家庭层面跨代际拼接 |
| MHAS(墨西哥)/ LASI(印度) | HRS 家族发展中成员国 | 发展中国家老龄健康跨国外推 |
| CHARLS-HCAP | 内部子研究 | 认知筛查 ↔ 临床评估校准 |
| COVID-19 特殊调查(2020) | 内部子调查 | 疫情冲击下的健康与经济动态 |
§8.5 关键论文 Top 6
- Zhao Y, Hu Y, Smith JP, Strauss J, Yang G. Cohort Profile: The China Health and Retirement Longitudinal Study (CHARLS). International Journal of Epidemiology. 2014;43(1):61-68. DOI 10.1093/ije/dys203 — 队列设计、抽样与基线的权威画像,被引 4,434+(Semantic Scholar,截至 2026-09)。
- Crimmins EM, Hu P, et al. Venous Blood-Based Biomarkers in the CHARLS: Rationale, Design, and Results From the 2015 Wave. 2021. PMCID PMC6825825 — 血检采集、冷链与质控的方法学细节。
- Zhao Y, Strauss J, et al. China Health and Retirement Longitudinal Study, 2011-2012 National Baseline Users’ Guide. Peking University, 2013 — 使用者必读的官方指南与致谢/引用规范载体。
- Bugliari D, et al. Harmonized CHARLS Version D. Peking University & USC, — 官方跨 wave 整合版文档与代码。
- Zhao Y, et al. CHARLS Update(HRS Around the World, 2023-08)— 各轮户数/人数、专题调查与 Wave 6 进度的官方口径。
- Zhao Y, et al. The path to healthy ageing in China: a Peking University–Lancet Commission. The Lancet — 以 CHARLS 为核心证据的国家级健康老龄化议程。
- Lei X, Hu Y, McArdle JJ, Smith JP, Zhao Y. Gender Differences in Cognition among Older Adults in China. Journal of Human Resources — 基于 CHARLS 的认知性别差异与跨文化测验方法学,展示认知分域的处理范式。
§8.6 社区活跃度
- 累计注册用户 126,016 人(截至 2024-12-31;北大 ISSS 2024 年报)。
- 常设 CHARLS 数据培训与征文:中国经济学年会数据用户专场、CEAC CHARLS Sessions、美人口学会(PAA)报告(官网 News 持续更新)。
- 官方渠道:官网新闻/邮件(charls_info@pku.edu.cn);数据问题经平台工单与培训答疑。
- 人才与研究网络:CHARLS 项目组在北大与武汉大学等地设研究团队,持续招聘访员与核查员;配套《社会经济调查理论方法与实践》《健康与养老研究田野调查》等课程形成人才培养链路(官网新闻)。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| CHARLS 官网 | 官方门户 | charls.pku.edu.cn | 公告、文档、论文入口 |
| 数据平台 | 下载/申请 | charls.charlsdata.com | 实名注册与按 wave 下载 |
| 注册协议 | 合规 | Agreement | 学术使用与致谢条款原文 |
| Cohort Profile 论文 | 方法学 | PubMed 23243115 | 抽样与队列设计引用首选 |
| UMich Biomarker Network 页 | 三方介绍 | biomarker-network.isr.umich.edu | 生物标志物跨 wave 速览 |
| 北大 ISSS 年度报告 | 官方统计 | isss.pku.edu.cn | 用户规模与发布史 |
§9 相关资源与引用
§9.1 官方资源
- 官网(中文 / 英文):https://charls.pku.edu.cn/ / https://charls.pku.edu.cn/en/ — 公告、新闻、论文与培训入口,数据发布信息第一时间在此更新。
- 数据平台与下载:https://charls.charlsdata.com/pages/data/111/zh-cn.html — 实名注册后按 wave 申请下载,含各轮 codebook 与 users’ guide。
- 注册与使用协议:https://charls.charlsdata.com/users/sign_up/agreement/en.html — 学术使用限制、致谢与引用要求的原始文本,申请前必读。
- Harmonized CHARLS:https://charls.charlsdata.com/pages/Data/harmonized_charls/zh-cn.html — 官方跨 wave 整合版(Version D)及配套代码与文档;保密数据(县/社区编码)亦经此通道申请。
- 生物标志物文档(2008 pilot):https://charls.pku.edu.cn/en/doc/Blood2008.pdf — DBS 采集、储存与 assay 方法的原始说明,理解血检质量体系的起点。
- HRS 家族对照:CHARLS 与 HRS 及 UMich Biomarker Network 页面提供跨队列变量映射背景。
§9.2 BibTeX
@article{zhao2014charls,
author = {Zhao, Yaohui and Hu, Yisong and Smith, James P. and Strauss, John and Yang, Gonghuan},
title = {Cohort profile: The China Health and Retirement Longitudinal Study (CHARLS)},
journal = {International Journal of Epidemiology},
volume = {43},
number = {1},
pages = {61--68},
year = {2014},
doi = {10.1093/ije/dys203}
}
@techreport{charls2013guide,
author = {Zhao, Yaohui and Strauss, John and Yang, Gonghuan and Giles, John and Hu, Peifeng (Perry) and Hu, Yisong and Lei, Xiaoyan and Park, Albert and Smith, James P. and Wang, Yafeng},
title = {China Health and Retirement Longitudinal Study, 2011--2012 National Baseline Users' Guide},
institution = {National School of Development, Peking University},
year = {2013}
}
@article{crimmins2021venous,
author = {Crimmins, Eileen M. and Hu, Peifeng and others},
title = {Venous Blood-Based Biomarkers in the China Health and Retirement Longitudinal Study: Rationale, Design, and Results From the 2015 Wave},
year = {2021},
note = {PMCID: PMC6825825}
}
@techreport{harmonizedcharls,
author = {Bugliari, Delia and others},
title = {Harmonized CHARLS, Version D},
institution = {Peking University and University of Southern California},
year = {2021},
url = {https://charls.charlsdata.com/pages/Data/harmonized_charls/zh-cn.html}
}
@unpublished{zhao2023update,
author = {Zhao, Yaohui},
title = {{CHARLS} Update},
note = {HRS Around the World Workshop, August 22, 2023},
url = {https://event.roseliassociates.com/hrs-around-the-world/wp-content/uploads/sites/8/2023/09/09_Zhao_CHARLS-Update.pdf}
}
§9.3 引用指南
使用 CHARLS 数据的论文须致谢:“We thank the China Center for Economic Research, the National School of Development of Peking University for providing the data”(协议原文要求),并至少引用 §9.2 中的官方指南与队列画像论文;涉及生物标志物时补引 Crimmins 2021;使用 Harmonized 版时补引该版本文档。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型列表
| 模型 | 用途 |
|---|---|
| CodeBuddy(fast-model) | 资料检索汇总、章节起草、代码示例生成 |
§10.2 AI 参与范围
AI 参与:检索结果归纳、初稿撰写、代码示例编写、表格组织。AI 不参与:事实核准、数字溯源与最终定稿。全部关键数字均回溯至 §10.3 所列官方与同行评审来源,由人工复核后收录。
AI 生成内容的三条硬约束:凡涉及具体数字(样本量、日期、引用数、CV 值)必须逐条回到输入来源核对;凡涉及协议条款必须以官方协议原文为准,不做 paraphrase 级转述;凡代码示例必须语法完整、注释说明目录假设,由工程师复核可运行性。
§10.3 输入来源列表
- Zhao Y, Hu Y, Smith JP, Strauss J, Yang G. Cohort Profile: CHARLS. Int J Epidemiol. 2014;43(1):61-68. DOI 10.1093/ije/dys203(PMID 23243115)
- CHARLS 官网(中/英). https://charls.pku.edu.cn/ / https://charls.pku.edu.cn/en/
- CHARLS 数据用户注册协议. https://charls.charlsdata.com/users/sign_up/agreement/en.html
- CHARLS 数据平台. https://charls.charlsdata.com/pages/data/111/zh-cn.html
- Zhao Y. CHARLS Update. HRS Around the World, 2023-08. https://event.roseliassociates.com/hrs-around-the-world/wp-content/uploads/sites/8/2023/09/09_Zhao_CHARLS-Update.pdf
- Crimmins EM, et al. Venous Blood-Based Biomarkers in the CHARLS: Rationale, Design, and Results From the 2015 Wave. PMCID PMC6825825
- Hu P, et al. Venous Blood Based Biomarker Data from CHARLS. PAA 2014. https://gero.usc.edu/cbph/files/4_30_2014_PAA/Hu_Venous_blood_based_biomarker_data_from_CHARLS.pdf
- Biomarker Data in CHARLS(2008 Pilot). https://charls.pku.edu.cn/en/doc/Blood2008.pdf
- UMich Biomarker Network: CHARLS. https://biomarker-network.isr.umich.edu/studies-with-biomarkers/charls/
- Maelstrom Research: CHARLS. https://www.maelstrom-research.org/study/charls
- 中国人民大学健康学院:CHARLS 数据资源介绍. https://health.ruc.edu.cn/zwwz/sjzy_x/dcsj/3c61795330614130bc2fb9fc868f7243.htm
- 北京大学中国社会科学调查中心 2024 年度报告. http://www.isss.pku.edu.cn/docs/2025-06/20250605130803393137.pdf
- Long-term temperature variability and cognitive performance among mid-to-older-aged adults in China. Sci Rep(Nature). https://www.nature.com/articles/s41598-026-52594-5
- Frontiers in Public Health 2023:CHARLS 感官损伤与主观幸福感. https://www.frontiersin.org/articles/10.3389/fpubh.2023.1099754/full
- Frontiers 2024:代际支持与抑郁(CES-D). https://www.frontiersin.org/article/1621444
- BMC Public Health 2025:基于 CHARLS 的空气污染与认知衰退队列. https://rd.springer.com/article/10.1186/s12889-025-23211-3
- Semantic Scholar API:Zhao 2014 引用数. https://api.semanticscholar.org/graph/v1/paper/DOI:10.1093/ije/dys203
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与版本时间轴 | 千方病案医学编辑部 | 逐条数字对照官方与同行评审来源 | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 术语编码复核 | ✅ 已通过 |
| §3 数据集规格 | 千方病案医学编辑部 | 官方文档交叉核对 | ✅ 已通过 |
| §4 数据结构与 DAIMS 字典 | 医疗 AI 数据工程师 | 字段与 codebook 惯例核对 | ✅ 已通过 |
| §5-§6 划分与 AI 指南、8 坑点 | 医疗 AI 数据工程师 | 代码可运行性 + 坑点溯源审查 | ✅ 已通过 |
| §7-§8 质量评估与生态 | 千方病案医学编辑部 | 偏倚来源与引用完整性审查 | ✅ 已通过 |
| §9-§10 资源引用与声明卡 | 千方病案医学编辑部 | BibTeX 与链接核验 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页 §6 代码示例、§3/§4 部分表格与 §8 部分内容为 AI 辅助起草,经 §10.4 所列人工复核修订后收录;全部数字与结论以输入来源列表为准。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
