信息速览

NHIS — 美国国民健康访谈调查 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | National Health Interview Survey(NHIS) |
| 英文全称 | National Health Interview Survey |
| 别名/简称 | NHIS、NHIS Household/Person File、IPUMS NHIS、Sample Adult/Child File |
| 疾病分类 | 全疾病谱自报健康调查(ICD-11:BA00 高血压 / 5A11 2 型糖尿病 / CA23 哮喘 / CA22 慢阻肺 / 6A70 抑郁发作 / FA00-FA3Z 关节炎等多病种筛查) |
| SNOMED CT | 38341003 Hypertensive disorder / 73211009 Diabetes mellitus / 195967001 Asthma / 271737000 Anemia(详见 §2.2) |
| 数据模态 | 结构化访谈问卷(家庭访谈)、分类健康状态与行为变量、调查权重与抽样设计变量 |
| AI 任务类型 | 患病率估计、健康不平等分析、慢病风险因素挖掘、患病风险预测、调查加权统计推断、健康政策评估 |
| 样本总数 | 2006-2015 设计年均约 87,500 人/35,000 户;2019 年 redesign 后年均约 27,000 名成人 + 9,000 名儿童;IPUMS 口径年均约 100,000 人/45,000 户 |
| 数据大小 | 单年公开文件随年份与组件而异;IPUMS NHIS 整合 1963 年至今 17,000+ 变量 |
| 数据格式 | ASCII Fixed-width(CDC 官方,配 SAS/SPSS/Stata 声明文件)、CSV + DDI XML(IPUMS 提取) |
| 许可证 | 美国联邦政府作品(公有领域);IPUMS NHIS 遵循 NCHS 负责任使用条款免费分发 |
| 访问级别 | 开放(CDC 官网直接下载;IPUMS 注册后免费定制提取) |
| DUO 标签 | NRES, GRU |
| 语言 | 英文(问卷以英语与西班牙语执行,文档与变量标签为英文) |
| 首发日期 | 1957 年(年度调查首次执行) |
| 最后更新 | 持续年度更新(IPUMS NHIS V8.1 发布于 2025-08-06) |
| 发布机构 | 美国疾病控制与预防中心(CDC)国家卫生统计中心(NCHS) |
| 官方主页 | https://www.cdc.gov/nchs/nhis/ |
| 下载地址 | https://www.cdc.gov/nchs/nhis/(官方单年文件);https://nhis.ipums.org/(跨年整合提取) |
| DOI | 10.18128/D070.V8.1(IPUMS NHIS V8.1) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 免费公开、文档体系完备、IPUMS 提供 60 年跨年整合变量与 DDI 元数据;扣分项:无官方 ML 划分、须自行实现调查加权、2019 redesign 造成跨年断裂、缺失码需手工重编码 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
本文由 千方病案医学编辑部 联合医学与数据工程双人团队完成交叉审核。
医学审核者:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、人群统计、金标准对照)、§7 偏倚分析(自报偏差、覆盖偏差与公平性影响)。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 与坑点(调查加权、缺失码重编码、聚类划分)。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NHIS 公开使用文件为美国联邦政府作品,可自由获取,但使用时应遵循 NCHS 的负责任使用与引用要求;通过 IPUMS NHIS 获取时须完成注册并同意 NCHS 负责任使用条款。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
NHIS(National Health Interview Survey,国民健康访谈调查) 是美国 CDC 国家卫生统计中心(NCHS)自 1957 年起每年执行的家庭访谈调查,也是了解美国平民非机构人口健康状况的最主要信息来源。每年有数万户家庭接受受过专业训练的访员入户访谈,回答关于健康状态、慢性病、就医经历、保险覆盖和生活方式的问题(IPUMS)。
它重要在于三点:时间跨度——近 70 年不间断的年度监测,是观察美国人口健康趋势(吸烟率下降、肥胖率上升、保险覆盖变化)的首选数据源;代表性——多阶段概率抽样设计配合调查权重,可以把几万人的样本推回全国数亿人口;可得性——微观数据免费公开,无需申请审批。
你能用它来:估计任一慢病的全国患病率及其趋势、训练带调查加权的疾病风险预测模型、研究健康不平等(按种族/收入/教育/保险状态切片),或把 NHIS 作为公共卫生数据分析教学的入门数据集。注意它是横断面自报数据——可以做关联和预测,不能做因果推断,也不等于临床确诊数据。
§1.1 摘要
NHIS 是一项由 NCHS 主持、美国人口普查局(Census Bureau)受托执行的家户访谈调查:访员携带 CAPI(计算机辅助个人访谈)设备入户,按多阶段概率抽样设计完成面试,问卷以英语和西班牙语双语执行(SGIM)。2006-2015 设计下每年完成约 87,500 人、35,000 户的访谈;2019 年 1 月问卷重构(redesign)后,核心产出调整为每年约 27,000 名随机抽取的样本成人(Sample Adult)与 9,000 名样本儿童(Sample Child),问卷拆分为 annual core、rotating core、sponsored content 与 emerging content 四类组件(PMC11366641)。调查内容覆盖总体健康状态、急慢性疾病分布、功能受限、医疗服务获取与利用、保险覆盖以及运动、饮食、烟酒等健康行为(IPUMS)。官方单年文件以 ASCII 定宽格式发布;跨年研究首选 IPUMS NHIS——它把 1963 年至今的数据整合为 17,000+ 个跨年一致编码的变量,并提供 DDI XML 元数据与在线提取系统。对 AI 而言,NHIS 是典型的"大样本、低维、全分类"表格数据:建模不难,难点全在调查加权、聚类结构、缺失码与跨年断裂四件事上。
§1.2 战略价值分析
时间纵深维度:NHIS 是极少数能把"今天的健康问题"放进"70 年历史坐标"里讨论的公开数据。它的年度连续性使研究者能够回答诸如"美国成人自报糖尿病患病率过去二十年如何变化""不同教育水平人群的吸烟率差距是否在扩大"这类纵向趋势问题,而不必拼接异质数据源。IPUMS NHIS 的整合变量体系(如 EDUCREC2 这类桥接变量)进一步把跨年编码差异抹平,让 1963 年至今的比较成为可能(IPUMS FAQ)。对 AI 研究者,这意味着可以做时间外推测试:用 2000-2015 年训练、2016-2023 年评估,直接观察概念漂移对模型的影响——这是大多数单时点医疗数据集给不了的实验条件。
政策与公平性维度:NHIS 是美国联邦健康政策监测的基石数据,保险覆盖、就医障碍、预防服务利用等官方统计大量出自 NHIS。它同时按种族、收入、教育、保险状态等社会经济维度提供丰富的分层变量,是研究健康不平等的标准工具。IPUMS 还公开了与国家死亡指数(NDI)链接的死亡结局信息(1986-2014 年受访成人及 2015 年起的样本成人,IPUMS Health Surveys),使"自报健康→死亡结局"的生存分析与模型校准研究成为可能。对关注算法公平性的团队,NHIS 提供了在人口学代表性样本上审计模型子组性能的天然试验场。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 标注/结局 | 与 NHIS 的差异化 |
|---|---|---|---|---|
| NHIS | 年均约 100,000 人(IPUMS 口径),1963 至今 | 家庭访谈问卷(全分类表格) | 自报疾病/状态;IPUMS 提供 NDI 死亡链接 | 年度连续、跨度最长、完全免费开放 |
| NHANES(CDC/NCHS) | 每年约 5,000 名受访者 | 访谈 + 体检(实验室、影像) | 自报 + 客观测量 | 有体测/化验金标准,但样本小一个数量级 |
| BRFSS(CDC/州) | 每年 40 万+ 电话访谈 | 电话问卷(全分类表格) | 自报 | 州级覆盖但无家庭级微观设计变量细节 |
| MEPS(AHRQ/IPUMS) | 每年数万人 | 访问+报销记录(纵向面板) | 医疗支出/利用 | 与 NHIS 抽样衔接,纵向随访、含费用 |
| NHIS-NHID(韩国) | 全韩 5,000 万+ 人口 | 理赔+体检记录(纵向) | 诊疗索赔诊断(KCD 编码) | 同名不同物:韩国 NHIS 是保险机构,NHID 是理赔数据库,见 §2.6 辨析 |
§1.4 版本时间轴
| 年份 | 事件 | 意义 |
|---|---|---|
| 1957 | 首次执行 | 美国国家级家庭健康访谈调查开端 |
| 1985 | 抽样设计重构 | 初级抽样单元(PSU)由 376 个压缩至 198 个 |
| 1995 | 抽样设计更新 | 依 1990 年人口普查重建抽样框 |
| 1997 | 问卷重构 | 确立 Family Core + Sample Adult Core + Sample Child Core 三模块结构 |
| 2006 | 新十年设计 | 2006-2015 设计:年均约 87,500 人/35,000 户 |
| 2014 | 样本扩增 | 部分年份扩至 60,000+ 户、112,000 人 |
| 2016 | 新抽样框 | 依 2010 年人口普查更新 |
| 2019 | 问卷重构(2019 redesign) | 四组件结构;约 27,000 样本成人 + 9,000 样本儿童;新权重体系 |
(来源:PMC5055461、PMC11366641)
§1.5 典型应用场景
- 慢病患病率趋势监测:用加权估计回答"2023 年美国成人自报糖尿病患病率是多少,过去十年怎么变的"。
- 健康不平等研究:按种族/教育/收入/保险状态切片,量化就医障碍与预防服务利用差距。
- 调查加权风险预测:以样本成人为训练集,预测高血压/糖尿病/关节炎等自报诊断(参考 Chen & Long 2025 的关节炎预测工作,AUC = 0.813)。
- 就医行为与延迟分类:预测延迟牙科护理等就医行为(参考 Vu et al.,LightGBM 准确率 84.87%)。
- 健康经济学与政策评估:评估保险覆盖扩张、公共卫生运动对行为与利用的影响;结合 NDI 链接做生存分析。
§2 医学背景
§2.1 ICD-11 编码映射
NHIS 以自报方式覆盖全疾病谱,下表列出其核心慢病条目与 ICD-11 的对应关系(编码取自 WHO ICD-11 浏览器的实体类目,用于把自报条目挂接到标准疾病分类体系):
| NHIS 自报条目 | ICD-11 编码 | ICD-11 中文名 | 说明 |
|---|---|---|---|
| Hypertension(高血压) | BA00 | 原发性高血压 | 含"曾被告知患高血压"条目 |
| Diabetes(糖尿病) | 5A11 | 2 型糖尿病 | 区分 1 型(5A10)/ 2 型 / 妊娠期 |
| Asthma(哮喘) | CA23 | 哮喘 | "曾患哮喘且目前仍有"双重确认 |
| COPD/Emphysema(慢阻肺/肺气肿) | CA22 | 慢性阻塞性肺疾病 | 含慢性支气管炎 |
| Coronary heart disease(冠心病) | BA41-BA4Z | 缺血性心脏病 | 含心绞痛与心肌梗死史条目 |
| Cancer(癌症) | 2A00-2F9Z | 恶性肿瘤 | 追问癌种与发现时间 |
| Arthritis(关节炎) | FA00-FA3Z | 炎症性关节炎/骨关节炎等 | 以"Have you ever had arthritis?"单一笼统条目询问(Chen & Long 2025) |
| Depression(抑郁) | 6A70-6A7Z | 抑郁发作/持续性抑郁障碍 | 含抑郁症状量表(如 K6 类条目) |
| Stroke(卒中) | 8B11 | 脑梗死 | 含脑血管病史条目 |
| Functional limitations(功能受限) | QD40-QD5Z | 功能与活动受限 | 日常活动/工作受限条目族 |
§2.1b SNOMED CT 映射
| NHIS 自报条目 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| Hypertension | BA00 | 38341003 | Hypertensive disorder (disorder) |
| Diabetes | 5A11 | 73211009 | Diabetes mellitus (disorder) |
| Asthma | CA23 | 195967001 | Asthma (disorder) |
| Anemia(贫血,体检关联条目) | 3A00 | 271737000 | Anemia (disorder) |
映射提示:NHIS 自报条目测的是"曾被告知/自我认知的疾病",与 ICD/SNOMED 编码所代表的临床确诊实体之间存在验证鸿沟,建模时应把映射视为语义近似而非等价转换。
§2.2 疾病简介与流行病学
NHIS 监测的对象不是单一疾病,而是美国平民非机构人口的全疾病谱健康状态。其核心自报慢病(高血压、糖尿病、哮喘、慢阻肺、冠心病、关节炎、抑郁、癌症)恰是美国疾病负担的主流构成,也是全球疾病负担研究中 DALY 占比最高的几类慢性非传染性疾病。以 2023 年 NHIS 为例,在 26,031 名有完整分析的样本成人中,自报关节炎者 6,849 人(约 26.3%),凸显关节炎作为美国最常见的慢病类别之一(Chen & Long 2025)。
NHIS 同时是官方患病率统计与趋势分析的基础数据:保险覆盖率、吸烟率、肥胖相关行为、就医延迟等全国统计均出自该调查。其问卷语言为英语与西班牙语,覆盖 50 个州与哥伦比亚特区的平民非机构人口;现役军人、长期照护机构居民与海外美国公民不在覆盖范围内(PMC5055461)。
为什么自报慢病条目值得建模:尽管是"软"标签,自报诊断与临床确诊的一致性呈结构化规律——特异度通常很高("说过有病"的人绝大多数真的被告知过),灵敏度受医疗可及性调节(未就诊者构成系统性漏报)。这本身就是一个可研究的信号:自报状态差异 = 疾病负担差异 × 诊断可及性差异,而后者正是健康不平等研究的核心对象。因此 NHIS 的标签不仅可用于患病预测,其"标签误差结构"本身携带公共政策信息。
问卷的信息架构(对建模者最有用的三块):
| 信息块 | 典型条目族 | 建模用途 |
|---|---|---|
| 健康状态与结局 | 自评健康 5 级、自报诊断(高血压/糖尿病/哮喘/COPD/冠心病/癌症/关节炎/抑郁/卒中)、功能受限 | 标签/结局 |
| 医疗系统接触 | 保险类型、就诊次数、延迟就医/未就医原因、预防服务利用 | 标签或强预测因子 |
| 行为与社会经济 | 吸烟饮酒、身体活动、BMI、教育、收入贫困比、就业、婚姻 | 协变量/特征 |
§2.3 临床任务定义
| 任务 | 输入 | 标签 | 性质 |
|---|---|---|---|
| 患病率估计(官方统计型) | 加权样本 | 自报疾病二分类 | 描述性推断,须报告置信区间 |
| 慢病风险预测 | 人口学 + 行为 + 共病变量 | 自报诊断(如 arthritis) | 预测建模,典型 AUC 0.75-0.85 |
| 就医行为分类 | 社会经济 + 保险 + 健康状态 | 延迟就医/未就医 | 预测建模,类别不平衡 |
| 健康不平等审计 | 分组变量(种族/教育/收入) | 各类健康结局 | 子组性能与校准分析 |
| 生存分析(进阶) | 自报健康 + 协变量 | NDI 链接死亡结局 | 需 IPUMS 死亡链接子集 |
§2.4 患者人群表
| 维度 | 内容 |
|---|---|
| 来源 | 美国平民非机构人口的家庭住户(多阶段概率抽样) |
| 时间 | 每年持续执行(1957 至今;IPUMS 微数据自 1963 年起整合) |
| 年龄 | 全年龄段(Sample Child 覆盖儿童;Sample Adult 覆盖 18 岁及以上成人) |
| 性别 | 男女均覆盖,问卷含性别专用条目族 |
| 种族 | 覆盖主要种族/族裔群体,含西班牙语裔专项过采样设计(历史年份) |
| 就医类型 | 一般人口(非患者群体),不针对特定医疗机构就诊人群 |
| 排除 | 现役军人、长期照护机构居民、海外美国公民 |
§2.5 临床价值
对临床与公共卫生研究者,NHIS 的价值在于提供人群基线:临床队列(如医院 EHR 队列)中的患病率、共病结构与行为分布都必须相对人群基线校准,否则会陷入选择偏倚。NHIS 的加权估计正是这一人群参照系。对 AI 团队,NHIS 常被用作"预训练特征挖掘池":从数十年自报变量中筛选风险因素组合,再迁移到临床数据上验证。其保险与就医障碍条目族也是医疗可及性 NLP/表格模型的标准外生变量来源。
具体而言,NHIS 在三类研究设计中不可替代:
- 率的标准源:当你的临床模型宣称"目标人群患病率为 X%"时,X 的权威出处通常是 NHIS 的加权估计而非任何医院队列。
- 偏倚探针:把你的医院队列与 NHIS 人群分布对比(年龄/性别/种族/保险结构),可以量化选择偏倚的方向与幅度——这是外部署名性校准的标准做法。
- 假说孵化器:NHIS 的行为×结局关联(如睡眠、就业与慢病)可以在免费、大样本、人群代表性条件下先筛一轮,把假说带到更昂贵的临床数据上验证。
§2.6 金标准对照与同名辨析
| 维度 | NHIS(本条目) | NHANES | 临床确诊数据 |
|---|---|---|---|
| 划分方式 | 多阶段概率抽样(住户) | 复杂概率抽样(住户+体检车) | 就诊人群/登记系统 |
| "标注"方式 | 训练有素访员访谈 + 自报 | 访谈 + 标准化体检/化验 | 医生诊断 + 病历验证 |
| 标注者 | Census Bureau 训练访员 | 访员 + 执业医技人员 | 执业医师 |
| 数据性质 | 自报(软金标准,人群代表性强) | 自报+客观测量(混合金标准) | 临床金标准(人群代表性弱) |
与韩国 NHIS-NHID 的辨析(重要):韩国也存在缩写为"NHIS"的机构——National Health Insurance Service(国民健康保险公团),它是韩国的单一法定保险人,约 97% 韩国人口为其订阅者,其余 3% 由医疗救助覆盖(DMJ 综述)。其运营的 NHID(National Health Information Database)建立于 2012 年,覆盖全韩 5,000 万+ 人口,由资格库、体检库、诊疗利用库、长期照护库与医疗机构库五个子库组成,诊断按 KCD(基于 ICD-10)编码,本质是理赔 + 体检的纵向全人群数据库(IJE Data Resource Profile、Korean Circ J)。二者在英文缩写上撞车,但数据性质完全不同:美国 NHIS 是 CDC/NCHS 的横断面访谈调查(自报、免费公开),韩国 NHID 是保险理赔数据库(诊疗记录、需申请审批)。本条目只覆盖美国 CDC/NCHS 的 NHIS;检索文献时若见"NHIS + 5,000 万人口 + KCD + NHID"组合,那是韩国数据,请勿混用。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 单年快速分析/复现某年论文 | CDC 官方单年公开文件 | 单年数十 MB 级 | 与官方文档、变量编码一一对应 |
| 跨年趋势/合并多年建模 | IPUMS NHIS(V8.1) | 按提取的变量×年份定制 | 17,000+ 整合变量、统一编码、DDI XML 元数据 |
| 自报健康→死亡结局研究 | IPUMS NHIS 死亡链接模块 | 随主提取附带 | 1986-2014 受访成人 + 2015 起 sample adults 的 NDI 链接结局 |
| 精细地理/受限变量 | NCHS Research Data Center(RDC) | 现场受限访问 | 公开文件已做地理粗化,敏感变量须在 RDC 内分析 |
§3.1 模态详情
NHIS 是纯结构化表格数据,无影像、无文本、无信号。三条主要信息流:
- Household/Family 层问卷:住户与家庭构成、家庭收入区间、地域(Census Region 与含粗化的 MSA 标识)。
- Person 层问卷:全体家庭成员的人口学特征、自评健康、急慢性疾病、功能受限、保险覆盖、就医利用。
- Sample Adult / Sample Child 专项问卷:每户随机抽取一名成人(与一名儿童)回答更细的行为风险条目——吸烟饮酒、身体活动、体重身高(BMI)、疫苗接种、心理健康量表等。
每条记录都伴随调查设计变量(权重、分层、PSU 标识),这是与普通表格数据集的本质区别。
模态对照表:
| 信息流 | 观测单位 | 覆盖人群 | 典型变量族 | AI 用途 |
|---|---|---|---|---|
| Household 问卷 | 户 | 全部抽中住户 | 住户构成、住房、家庭收入区间 | 聚类结构/背景协变量 |
| Family 问卷 | 家庭 | 全部家庭 | 家庭关系、家庭收入贫困比 | 社会经济特征 |
| Person 问卷 | 人 | 全体家庭成员 | 人口学、保险、就诊、自评健康、常见病 | 标签与基础特征 |
| Sample Adult 专项 | 人(每户 1 名成人) | 18 岁及以上 | 行为风险、BMI、心理量表、专项慢病 | 高级特征与主标签源 |
| Sample Child 专项 | 人(每户 1 名儿童) | 17 岁及以下 | 儿童健康、发育、就诊 | 儿童健康建模 |
| 设计变量 | 全层级 | 全部 | 权重、分层、PSU、方差单位 | 加权估计/设计感知训练 |
§3.2 按子集样本数
| 子集 | 2006-2015 设计(年均) | 2019 redesign 后(年均) |
|---|---|---|
| 全体受访者(person 层) | 约 87,500 人 | 随家庭结构约 3-4 万人级 |
| 家庭/住户(household 层) | 约 35,000 户(2014 扩增年份 >60,000 户、112,000 人) | redesign 结构下按年发布 |
| Sample Adult | 含于 person 层 | 约 27,000 名成人 |
| Sample Child | 含于 person 层 | 约 9,000 名儿童 |
| IPUMS 口径均值 | 约 100,000 人 / 45,000 户(1963 至今平均) | 同左 |
(来源:PMC5055461、PMC11366641、IPUMS)
§3.3 数据格式
| 格式 | 来源 | 说明 |
|---|---|---|
| ASCII 定宽(fixed-width) | CDC 官网 | 官方原始形态,配套 SAS/SPSS/Stata 输入声明文件 |
| CSV + DDI XML | IPUMS NHIS | 在线提取系统产出,元数据即 DDI 标准文件 |
| ipumsr/Python 直读 | IPUMS API | 支持 R(ipumsr)与 API 方式提交提取请求并下载 |
§3.4 存储大小
官方未发布整库总量数字(此处不虚构)。经验参照:单年公开文件为数十 MB 级,整库多年合并(全变量)可达 GB 级;IPUMS 按需提取,只取所需变量与年份时通常在百 MB 以内。实际大小取决于所选年份跨度与变量数,建议以提取系统的实时报告为准。
§3.5 标注方式
NHIS 没有第三方"标注",其"标签"即受访者自报 + 访员记录:疾病条目多为"是否曾被医生告知患有 X"的二元条目,健康状态为五级自评量表(excellent→poor)。部分条目有双重确认设计(如哮喘需"曾患 + 目前仍有"),部分配有症状量表。这意味着标签的"噪声来源"是自报认知偏差而非标注员分歧(NIOSH)。
按"标注"性质把核心变量分为四类:
| 变量类 | 生成机制 | 误差性质 | 建模含义 |
|---|---|---|---|
| 自报诊断(HYPEV/DIBEV 等) | "曾被医生告知"叙事 | 特异度高、灵敏度受可及性调节 | 可作标签,须声明自报属性 |
| 自评量表(HEALTH 等) | 主观五级评分 | 主观但跨年稳定 | 优质连续/有序结局 |
| 自报行为(SMOKEV/BMI 输入) | 回忆/估算 | 社会期望偏差、BMI 系统低估 | 特征级处理即可 |
| 设计变量(WEIGHT/PSU) | NCHS 计算生成 | 无测量误差,有模型假设 | 必须按官方文档使用 |
§3.6 采集者资质与质量控制
访谈由美国人口普查局(Census Bureau)的专业受训访员执行,使用 CAPI 设备按标准化问卷流程提问;NCHS 负责问卷设计、抽样、权重与质控发布。访员的标准化训练与 CAPI 的逻辑跳转控制是质量控制的两道主闸门(PMC5055461)。
质控链条的四个环节:抽样(依人口普查抽样框滚动更新)→ 访员(Census Bureau 招募培训、持设备入户)→ 采集(CAPI 强制跳转与取值域校验,英语/西语双语)→ 后处理(NCHS 加权、披露规避、发布)。每一环节都有公开方法文档,异常年份(如回应率异常波动)会在官方文档中说明——使用者在做趋势分析前应先读当年度的方法报告。
§3.7 采集周期
年度连续执行(1957 至今),每年度数据按日历年内完成的访谈汇总发布;redesign 年份(如 2019)发布时附专门的权重与设计文档。
对趋势研究的实操含义:年度粒度意味着"时间"变量的最小单位是一年;疫情等年度内冲击被摊薄进年度数据,无法做月度级事件研究。需要更细时间粒度的场景应改用行政数据或登记系统。
§3.8 地域覆盖
覆盖美国 50 个州与哥伦比亚特区的平民非机构人口。公开文件中的地理标识已粗化(Census Region/Division、MSA 状态);州级及更细地理属受限变量,须经 NCHS RDC 访问(SGIM)。
§3.9 设备规格
不适用(无物理测量设备)。"采集设备"为访员使用的 CAPI 计算机辅助访谈系统;2019 redesign 前后均以 CAPI 为主形态(PMC5055461)。
§3.10 深度溯源链
原始受访家庭(Census Bureau 访员 CAPI 采集)→ NCHS 问卷设计/抽样/加权/脱敏(披露规避:扰动、封顶编码、地理粗化)→ NCHS 公开使用文件(CDC 官网发布)→ IPUMS Minnesota 大学整合(变量跨年统一编码、DDI 文档、DOI 版本化发布 10.18128/D070.V8.1)→ 千方病案医数集百科化。每一环节均有官方文档背书,溯源完整。
§4 数据结构
§4.0 目录树
以下为"下载 IPUMS 提取包 + 官方单年文件"的典型工作目录结构(以 IPUMS 提取 nhis_00001.csv 为例):
nhis_data_root/
├── ipums/ # IPUMS NHIS 定制提取(推荐入口)
│ ├── nhis_00001.csv # 主数据(矩形化,一人一行)
│ ├── nhis_00001.xml # DDI 元数据(变量定义/编码/可比性)
│ └── nhis_00001.cbk # 提取书签(可复现提取请求)
├── cdc_official/ # CDC 官方单年文件(按需)
│ └── 2023/
│ ├── personx.xxd # person 层 ASCII 定宽文件
│ ├── adultx.xxd # Sample Adult 文件
│ ├── childx.xxd # Sample Child 文件
│ └── *.sas / *.sps / *.do # SAS/SPSS/Stata 声明文件
└── README.md # 记录下载日期、版本(V8.1)、提取参数
§4.1 DAIMS 字段字典
以下为 IPUMS NHIS 核心变量字典(8 列;示例值为典型编码,具体取值以当年 codebook/DDI 为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| person_id | Integer | 个体唯一记录号 | 1,024,357 | 主键/去重 | 无(官方分配) | 无 | 随年份计数 |
| SEX | Integer | 性别 | 1=男,2=女 | 人口学特征 | 访谈记录 | 极少见 | 1-2 |
| AGE | Integer | 年龄(周岁) | 43 | 人口学特征 | 自报 | 998/999 类未知码 | 0-85+(高龄封顶) |
| EDUCREC2 | Integer | IPUMS 教育桥接变量(跨年一致分级) | 分级码本取值 | 社会经济分层 | 自报学历 | 98/99 未知 | 分级码本 |
| HEALTH | Integer | 自评健康(5 级) | 2=很好 | 核心结局/标签 | 自报主观 | 7 拒答/9 不知道 | 1-5 |
| HYPEV | Integer | 曾被告知高血压 | 1=是,2=否 | 慢病标签 | 自报诊断 | 7 拒答/9 不知道 | 1-2 |
| DIBEV | Integer | 曾被告知糖尿病 | 1=是,2=否 | 慢病标签 | 自报诊断 | 7 拒答/9 不知道 | 1-2 |
| SMOKEV | Integer | 一生吸烟 ≥100 支 | 1=是,2=否 | 行为风险 | 自报行为 | 7/9 类 | 1-2 |
| BMI | Float | 体重指数(成人自报身高体重计算) | 27.4 | 行为风险/连续协变量 | 自报测量误差 | 编码本定义缺失值 | 依年份有效区间 |
| WEIGHT | Float | 个体抽样权重 | 126.7 | 加权估计/加权训练 | 设计计算 | 无 | >0 连续 |
| REGION | Integer | Census Region | 3=South | 分层/地域协变量 | 设计分配 | 无 | 1-4 |
| EDUC | Integer | 最高学历(IPUMS 整合编码) | 分级码本取值 | 社会经济特征 | 自报学历 | 98/99 未知 | 分级码本 |
| INCFAM | Integer | 家庭收入区间(分级编码) | 依年份码本 | 社会经济特征 | 自报区间 | 97/99 类 | 分级码本 |
| PSU/STRATA | Integer | 初级抽样单元/分层标识 | 依年份 | 方差估计/分组划分 | 设计分配 | 无 | 依年份码本 |
注:变量名以 IPUMS NHIS 整合编码体系为参照,CDC 原始文件的变量名随年份不同(如 2019 后成人文件以 AD 开头命名)。同一概念跨文件对不上时,先用 IPUMS 的变量交叉表对齐。
§4.2 标签分布
NHIS 的"标签"依任务而变,无单一全局分布。两个有来源的参照点:
- 关节炎(2023 年):26,031 名样本成人中 6,849 名自报关节炎(正类约 26.3%),中度不平衡(Chen & Long 2025)。
- 延迟牙科护理:该二分类任务存在明显类别不平衡,Vu et al. 采用 SMOTE 处理后 LightGBM 达到 84.87% 准确率。
多数慢病二分类标签的患病率落在个位数到三成之间;建模时应直接从数据中统计目标年份的实际分布,而非沿用其他年份的数字。
§4.3 关键统计
- 覆盖时段:IPUMS NHIS 微数据 1963 年至今,17,000+ 整合变量(IPUMS)。
- 年度规模:redesign 前年均约 87,500 人;redesign 后约 27,000 成人 + 9,000 儿童(PMC11366641)。
- 死亡链接:1986-2014 受访成人及 2015 起 sample adults 的 NDI 链接结局公开可用(IPUMS)。
- 双语执行:英语与西班牙语(SGIM)。
- 抽样设计:多阶段概率抽样;1985 年 PSU 由 376 个压缩至 198 个,2016 年随新抽样框再次更新(PMC5055461)。
- 权重构成(2019 redesign 后):选择概率倒数 × 无回应调整(倾向得分)× 校准 raking(年龄/性别/种族/教育/Census Division/MSA)(PMC11366641)。
有效样本量警示:加权后"名义 n=27,000"的真实信息量小于 n=27,000 的简单随机样本——设计效应(design effect)使加权估计的等效样本量更小,置信区间比教科书公式更宽。任何把 n 当作独立同分布样本量的做法都会系统性高估显著性(与坑点 1/5 联动)。
§4.4 数据层级
NHIS 是三级嵌套结构(与影像数据的"患者→检查→序列→切片"对应关系不同):
household(住户)
└── family(家庭)
└── person(个体)── 1:1 ── sample_adult / sample_child(专项问卷)
同一家庭内的成员共享环境、收入与保险变量,强相关;统计建模必须把家庭/PSU 聚类纳入方差估计(详见坑点 5)。
§4.5 缺失值与信息性缺失编码
NHIS 公开文件沿用美国联邦调查体系的专用缺失码传统,这是 AI 建模的第一杀手(详见坑点 3):
| 编码含义 | 典型码 | 建模处理 |
|---|---|---|
| 合法应答 | 1=是,2=否;1-5 级量表 | 正常参与训练 |
| Don’t know(不知道) | 9(及量表类 8/9) | 必须从数值中剔除或转为显式类别 |
| Refused(拒答) | 7(及量表类 7) | 同上 |
| 不适用(跳转逻辑未问) | 0 或空段 | 按变量 universe 处理,勿当负类 |
| 未成年/未进专项问卷 | 依 codebook | 子集建模时过滤 |
提醒:具体编码因年份与变量而异,动手前必须查对应年度 codebook 或 IPUMS DDI XML 中的 codes 段,本表给出的是体系性规律而非逐变量精确码。
信息性缺失的两面性:NHIS 的"拒答/不知道"不是随机噪声。收入与保险类条目的拒答率在低收入群体更高(隐私顾虑),疾病条目的"不知道"与医疗素养相关。两种处理路线各有正当性:①把缺失码归为 NaN 后插补——保持特征矩阵干净,适合预测交付场景;②保留为显式类别——让"不回答"本身参与预测,适合社会学解释场景。无论选哪条,都要在数据卡里写明并在敏感性分析里对比两条路线的性能差异。
§4.6 与 CDC 原始文件的变量对应
IPUMS 整合变量 ≠ CDC 原始变量名,跨体系工作前先做对齐:
| 概念 | CDC 原始文件 | IPUMS 整合 |
|---|---|---|
| 自评健康 | 逐年独立命名,随年份与问卷组件变化 | HEALTH(跨年一致编码) |
| 高血压自报 | 同上 | HYPEV |
| 抽样权重 | redesign 前后体系不同,名随年份变 | WEIGHT(配套设计变量组) |
| 教育 | 三代编码方案并存(年限→单年→学位) | EDUCREC2 桥接变量 |
(CDC 原始文件的精确变量名随年份变化,一律以当年 codebook 为准,此处不逐枚举。IPUMS 官方提供 IPUMS↔NHIS 变量交叉表(crosswalk),对不上的概念先查它。这种"逐年命名漂移"是 NHIS 数据工程成本的主要来源,也是推荐 IPUMS 入口的原因。)
§5 划分与使用建议
§5.1 官方划分
没有官方 ML 划分。NHIS 的设计目的是统计推断而非 ML 基准,官方提供的是抽样设计(分层/PSU/权重),不是 train/val/test。任何划分均为社区自定义。
§5.2 社区惯例划分
三种常见做法的对比:
| 划分方式 | 操作 | 优点 | 风险 |
|---|---|---|---|
| 单年随机划分 | 单年内 70/15/15 逐行切分 | 最简单、复现性好 | 家庭/PSU 跨集泄漏(坑点 5) |
| 跨年外推划分 | 早年训练、近年测试(如 2015-2018 训练 / 2019-2023 测试) | 免费检验概念漂移与时间泛化 | 需先处理 redesign 断点(坑点 2) |
| 设计感知划分 | 按 PSU(至少按家庭)分组切分 | 与调查推断逻辑一致,发表级底线 | 实现稍复杂;折数受 PSU 数限制 |
- 单年随机划分:简单但破坏聚类结构,仅适合教学演示。
- 跨年外推划分:NHIS 特有的"免费"泛化实验——数据本身就是按时间排列的。
- 设计感知划分:保证测试集家庭与训练集零重叠——发表级工作的底线。
§5.3 泄漏风险(重点)
| 泄漏源 | 机制 | 缓解 |
|---|---|---|
| 家庭聚类泄漏 | 同一家庭成员同时落入训练与测试集,共享收入/环境/保险 | 以 household_id 为单位分组划分(GroupShuffleSplit) |
| PSU 聚类泄漏 | 同一初级抽样单元的住户相似(地理/社区) | 以 PSU 为分组单位划分 |
| 权重误用泄漏 | 测试评估用未加权指标,与训练目标不一致 | 训练与评估都明确加权策略并固定 |
| 跨年信息泄漏 | 用 t 年数据预测 t 年全国统计后又用 t+1 年微调评测 | 冻结训练年份,测试年份仅评估一次 |
§5.4 交叉验证建议
设计感知的 K 折:按 PSU(或至少按 household)分组做 GroupKFold;若做加权评估,每折内分别计算加权指标后合并。不要做"先 SMOTE 再划分"的顺序错误——所有重采样只能发生在训练折内部(Vu et al. 的 SMOTE 用法应据此理解)。
§5.5 外部验证建议
- NHANES:同为 NCHS 数据,含客观测量——用 NHANES 体检金标准检验 NHIS 自报标签的准确性,是最有价值的外部验证方向。
- BRFSS:电话问卷版本的同类条目,可跨模态(入户 vs 电话)检验条目稳定性。
- MEPS:与 NHIS 抽样衔接的纵向面板,适合检验"预测的就医行为"在后续年度是否兑现。
外部验证的三步操作:先对齐变量定义(同一疾病条目在两个调查中的问法可能不同);再对齐人群范围(NHANES 的采样人群与 NHIS 相同,但有效样本更小);最后报告跨数据集的性能衰减幅度而非只报绝对值——衰减小于 0.02 AUC 可视为同一人群内的稳健结论,大于 0.05 需怀疑标签定义漂移。
§5.6 受限数据(RDC)使用须知
若公开变量的粒度不够(州级地理、精确收入、民族细分类等),走 NCHS Research Data Center 通道:提交研究计划 → 审批 → 在受控环境(现场或远程执行终端)内分析 → 输出经 NCHS 披露审查后放行。三点预期管理:周期以月计、成本按官方规定、输出不允许含小单元格(避免重识别)。绝大多数 ML 原型工作用公开文件即可完成,RDC 属发表前精化的最后一步。
§6 AI 就绪指南
§6.0 云端快速启动
NHIS 无官方云端镜像(数据免费公开,本地下载即是最快路径)。无需 GPU 服务器:任何 4 GB 内存以上的机器即可完成单年建模;多年合并建议 16 GB 内存。若需在托管环境运行,把 IPUMS 提取的 CSV(含 DDI XML)放入任意 Notebook 环境即可,不存在需要预热的计算集群。
§6.1 快速上手
# ============================================================
# 目录结构预期(data_root 必须与下载产物一致):
# nhis_data_root/
# ├── ipums/
# │ ├── nhis_00001.csv ← IPUMS 提取主数据(一人一行)
# │ └── nhis_00001.xml ← DDI 元数据(记录变量名/编码/权重)
# └── cdc_official/2023/ ← CDC 官方单年文件(本例不直接使用)
#
# data_root 拼接关系:DATA_ROOT / "ipums" / "nhis_00001.csv"
# 最小可用子集:任一年份的 sample adult 记录 + WEIGHT + 一个
# 二分类标签(如 HYPEV)即可跑通本管线,无需下载全部年份。
# ============================================================
import pandas as pd
DATA_ROOT = "nhis_data_root" # 按你的实际路径修改
df = pd.read_csv(
f"{DATA_ROOT}/ipums/nhis_00001.csv",
low_memory=False,
)
# 限定样本成人子集(专项问卷只覆盖随机抽中的成人)
adult = df[df["SAMPLE"] == 1].copy() # SAMPLE 取值以 DDI 为准
# 第一步永远是:处理专用缺失码(7=拒答 9=不知道,见坑点 3)
valid = adult["HYPEV"].isin([1, 2])
adult = adult[valid]
print(adult[["SEX", "AGE", "HYPEV", "WEIGHT"]].head())
§6.2 数据获取
| 途径 | 步骤 | 费用 | 门槛 |
|---|---|---|---|
| CDC 官网单年文件 | 访问 https://www.cdc.gov/nchs/nhis/ → 选年份 → 下载 ASCII 文件 + 声明文件 | 免费 | 无注册 |
| IPUMS NHIS 定制提取 | https://nhis.ipums.org/ 注册(同意 NCHS 负责任使用条款)→ 选变量与年份 → 提交提取 → 下载 CSV+DDI | 免费 | 邮箱注册 |
| NCHS RDC 受限变量 | 提交研究计划审批 → 现场远程执行 | 按官方规定 | 审批制 |
# IPUMS API 方式提交提取请求(R 语言 ipumsr 示例,见官方 vignette)
# library(ipumsr)
# define_extract("nhis",
# description = "adult core 2023",
# samples = "us2023a",
# variables = list("SEX", "AGE", "HEALTH", "HYPEV", "DIBEV",
# "SMOKEV", "BMI", "WEIGHT")
# ) |> submit_extract()
(API 支持详见 ipumsr vignette。)
IPUMS 提取五步清单(网页流程,约 10 分钟):
- 注册账号并同意 NCHS 负责任使用条款(一次性行为)。
- Select Data:勾选年份样本(如 us2023a)与变量(按 §4.1 字段字典)。
- 提交提取请求,等待服务器处理(通常几分钟到数小时,视数据量)。
- 下载
nhis_XXXXX.csv+ DDI XML(两者必须放同一目录配套使用)。 - 用
ipumsr::read_ipums_micro(R)或 Python 解析 DDI 后读入 CSV;保留提取书签 .cbk 备查。
# 用 DDI XML 给 CSV 补上标签与取值说明(读取后的标准动作)
import xml.etree.ElementTree as ET
def load_codebook_labels(ddi_path: str) -> dict:
"""从 DDI XML 提取 变量 → 取值标签 映射,把数字编码翻译回语义。"""
root = ET.parse(ddi_path).getroot()
ns = {"d": "ddi:codebook:2_5"} # DDI 2.5 命名空间,依实际文件头调整
labels: dict[str, dict[str, str]] = {}
for var in root.findall(".//d:var", ns):
name = var.get("name")
pairs: dict[str, str] = {}
for cat in var.findall("d:catgry", ns):
val = (cat.findtext("d:catValu", default="", namespaces=ns) or "").strip()
txt = (cat.findtext(".//d:txt", default="", namespaces=ns) or "").strip()
if val:
pairs[val] = txt
labels[name] = pairs
return labels
# labels = load_codebook_labels(f"{DATA_ROOT}/ipums/nhis_00001.xml")
# adult["HEALTH_label"] = adult["HEALTH"].astype(str).map(labels.get("HEALTH", {}))
§6.3 预处理全流程
import numpy as np
import pandas as pd
def preprocess_nhis(df: pd.DataFrame, label_col: str = "HYPEV") -> pd.DataFrame:
"""NHIS 表格数据标准预处理:缺失码→NaN、子集过滤、权重保留。"""
out = df.copy()
# 1) 专用缺失码重编码:把 7/8/9 系列从"数值"还原为 NaN(坑点 3)
binary_cols = ["HYPEV", "DIBEV", "SMOKEV"]
for c in binary_cols:
if c in out.columns:
out[c] = out[c].where(out[c].isin([1, 2]))
out[c] = out[c].map({1: 1, 2: 0})
# 2) 多分类变量同样剔除未知码(具体码以 DDI 为准)
if "HEALTH" in out.columns:
out["HEALTH"] = out["HEALTH"].where(out["HEALTH"].isin([1, 2, 3, 4, 5]))
# 3) 连续变量:BMI 的生理无效值置 NaN(按年份有效区间校准)
if "BMI" in out.columns:
out["BMI"] = out["BMI"].mask(out["BMI"] < 10)
# 4) 标签完整性过滤
out = out[out[label_col].notna()]
# 5) 年龄封顶说明:高龄常被封顶编码(如 85+),保留原值勿"恢复"
return out
def weighted_prevalence(df: pd.DataFrame, col: str, w: str = "WEIGHT") -> float:
"""加权患病率:任何全国口径数字都必须带权重(坑点 1)。"""
sub = df[df[col].notna()]
return float((sub[col] * sub[w]).sum() / sub[w].sum())
adult_p = preprocess_nhis(adult, "HYPEV")
print(f"加权高血压患病率: {weighted_prevalence(adult_p, 'HYPEV'):.1%}")
要点:标准化在 NHIS 中=统一编码口径(用 IPUMS 桥接变量如 EDUCREC2),而非数值 z-score;增强仅限重采样(见 §6.6)。
跨年合并管线(配合坑点 2,多年训练的标准前置步骤):
def merge_years(frames: dict[int, pd.DataFrame], label_col: str = "HYPEV") -> pd.DataFrame:
"""合并多个年份的预处理后数据:统一列、加年份特征、标记 redesign 断点。
frames: {year: DataFrame},每个 DataFrame 已过 preprocess_nhis。
"""
parts = []
for year, df in frames.items():
part = df.copy()
part["YEAR"] = year
part["POST_2019"] = int(year >= 2019) # redesign 断点哑变量
parts.append(part)
# 只保留所有年份共有的列(自然过滤掉 redesign 前后不兼容条目)
common = set.intersection(*(set(p.columns) for p in parts))
merged = pd.concat([p[list(common)] for p in parts], ignore_index=True)
# 每年样本量与标签阳性率:合并后第一件事就是看趋势是否有台阶
report = merged.groupby("YEAR")[label_col].agg(["size", "mean"])
print(report)
return merged
跑完 merge_years 后先看打印的年度阳性率表:若 2019 处出现台阶而你对底层流行病学没有解释,先怀疑变量口径断裂(回 IPUMS Comparability 注释),而不是兴奋地当成"趋势发现"。
§6.4 PyTorch DataLoader
import torch
from torch.utils.data import Dataset, DataLoader, WeightedRandomSampler
class NHISDataset(Dataset):
"""NHIS 表格二分类数据集。
特征:人口学 + 行为 + 共病(全部数值化后拼接);
标签:自报诊断二分类;权重:抽样权重(供加权损失/评估用)。
"""
def __init__(self, df: pd.DataFrame,
label_col: str = "HYPEV",
feature_cols: list[str] | None = None):
feats = feature_cols or ["AGE", "SEX", "BMI", "SMOKEV"]
self.X = torch.tensor(
df[feats].fillna(df[feats].median()).to_numpy(np.float32))
self.y = torch.tensor(df[label_col].to_numpy(np.float32))
self.w = torch.tensor(df["WEIGHT"].to_numpy(np.float32))
# 归一化权重到均值 1,避免损失尺度漂移
self.w = self.w / self.w.mean()
def __len__(self) -> int:
return len(self.y)
def __getitem__(self, idx: int):
return self.X[idx], self.y[idx], self.w[idx]
# 训练/测试按家庭分组划分(坑点 5:严禁逐行随机划分)
from sklearn.model_selection import GroupShuffleSplit
groups = adult_p["household_id"] if "household_id" in adult_p else adult_p["person_id"] // 100
tr_idx, te_idx = next(GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
.split(adult_p, groups=groups))
train_ds = NHISDataset(adult_p.iloc[tr_idx])
test_ds = NHISDataset(adult_p.iloc[te_idx])
# 用加权随机采样抵消抽样设计对训练分布的扭曲(与坑点 1 配套)
sample_weights = train_ds.w.numpy()
sampler = WeightedRandomSampler(sample_weights, num_samples=len(train_ds), replacement=True)
train_loader = DataLoader(train_ds, batch_size=256, sampler=sampler)
test_loader = DataLoader(test_ds, batch_size=1024, shuffle=False)
model = torch.nn.Sequential(
torch.nn.Linear(train_ds.X.shape[1], 128), torch.nn.ReLU(), torch.nn.Dropout(0.2),
torch.nn.Linear(128, 64), torch.nn.ReLU(),
torch.nn.Linear(64, 1), # 输出 logit
)
# 完整训练循环(加权 BCE + Adam + 早停)
import torch.nn.functional as F
def train(model, train_loader, test_loader, epochs: int = 30, lr: float = 1e-3):
opt = torch.optim.Adam(model.parameters(), lr=lr)
best_auc, best_state, patience = 0.0, None, 0
for epoch in range(epochs):
model.train()
for X, y, w in train_loader:
logit = model(X).squeeze(-1)
loss = (w * F.binary_cross_entropy_with_logits(logit, y, reduction="none")).mean()
opt.zero_grad(); loss.backward(); opt.step()
metrics = weighted_eval(model, test_loader)
print(f"epoch {epoch}: {metrics}")
if metrics["weighted_auc"] > best_auc: # 按加权 AUC 早停
best_auc, best_state, patience = metrics["weighted_auc"], model.state_dict(), 0
else:
patience += 1
if patience >= 5:
break
if best_state is not None:
model.load_state_dict(best_state)
return model
# trained = train(model, train_loader, test_loader)
§6.5 坑点清单(8 个)
⚠️ 坑点 1:忽略调查权重与复杂设计,全国估计直接有偏(分类:评估误用)
问题:NHIS 采用多阶段概率抽样且各群体抽样概率不同,逐行等权统计或等权训练会把过采样群体放大、欠采样群体缩小,得到的"患病率/准确率"既不代表全国也不代表任何已知总体。
症状:你算出的患病率与 CDC 官方发布值差出数个百分点;模型在总人口口径上的校准曲线系统性偏移。
解决:
- 简单方法:一切全国口径数字用加权估计——
加权患病率 = Σ(y·w)/Σw,报告时附设计自由度的置信区间。- 进阶方法:训练时用
WeightedRandomSampler(按权重采样)或加权损失Σ(w·BCE)/Σw;评估同时报告加权与未加权两套指标。- SOTA 方法:用 R 的
survey包(svydesign(ids=~PSU, strata=~STRATA, weights=~WEIGHT))或 Python 的samplics做设计感知的标准误与分层计算;ML 评估采用加权 bootstrap 置信区间。
参考:SGIM 数据集指南、PMC11366641
⚠️ 坑点 2:跨 redesign 年份混用,2019 前后变量根本不对齐(分类:工程陷阱)
问题:2019 年 1 月 NHIS 完成问卷重构(四组件结构)并引入全新权重体系,大量条目在 redesign 前后问法、编码、可选范围都不同,直接把 2018 与 2019 后的数据纵向拼接会制造假趋势。
症状:趋势图在 2019 处出现莫名的台阶式跳变;合并多年训练的模型对"年份"特征产生异常重要性。
解决:
- 简单方法:跨年研究先切 redesign 断点(如 2015-2018 与 2019-2023 分段分析),确认变量在 IPUMS 桥接变量下是否连续。
- 进阶方法:只用 IPUMS 的整合变量(如 EDUCREC2 这类显式跨年一致编码),并阅读其 comparability 注释;对断点变量加年份哑变量或分段项。
- SOTA 方法:做断点敏感性分析——分别在 redesign 前后子样本上训练同一模型,比较特征重要性与系数方向;把 redesign 断裂写进模型卡片的 limitation。
参考:PMC11366641、IPUMS FAQ(教育变量跨年示例)
⚠️ 坑点 3:把 7/8/9 专用缺失码当真值(分类:预处理陷阱)
问题:NHIS 继承联邦调查编码传统,用 7(拒答)、9(不知道)等数字表示缺失;不做处理时它们是合法数值,模型会把"不知道自己有没有糖尿病(9)"当成比"有(1)"更极端的阳性特征。
症状:逻辑回归里"不知道"组表现出远高于"是"组的系数;树模型的分裂点大量落在 7/9 附近;AUC 虚高或虚低不可复现。
解决:
- 简单方法:按当年 codebook 把缺失码改写为 NaN,再走填充或显式"未知"类别。
- 进阶方法:把"拒答/不知道"保留为显式类别(而非 NaN 填充)——拒绝回答糖尿病问题本身携带健康素养信息,往往有预测力。
- SOTA 方法:对缺失机制建模——区分"跳转未问(结构缺失)“与"应答缺失”,前者按变量 universe 过滤,后者才允许编码为信息性类别。
参考:CDC NIOSH NHIS 说明、各年度 codebook
⚠️ 坑点 4:自报诊断 ≠ 临床确诊,标签本身是软的(分类:标签理解)
问题:NHIS 的疾病标签来自"是否曾被医生告知",且健康结局未经医疗专业人员或病历验证(NIOSH);它测的是疾病认知而非疾病生物学状态,存在漏报(未确诊者)与误报(认知混淆)双向误差。
症状:模型在 NHIS 上表现良好,迁移到 EHR 确诊队列时标签定义"对不上";与 NHANES 体检结果比对时发现自报高血压低估实际测量高血压。
解决:
- 简单方法:把标签重命名为"自报/曾被告知 X"并贯穿论文表述,禁止写成"X 确诊预测"。
- 进阶方法:用 NHANES 做验证子研究——在 NHANES 同时具备自报与体检测量的条目上估计自报灵敏度/特异度,再讨论对模型的影响。
- SOTA 方法:对标签噪声做显式建模(noise-adaptive learning 或标签不确定性传播),把自报误差率作为先验纳入损失。
参考:NIOSH Strengths and Limitations
⚠️ 坑点 5:家庭与 PSU 聚类导致随机划分泄漏(分类:数据泄漏)
问题:同一家庭的成员共享收入、保险、环境与生活方式,同一 PSU 的住户共享社区环境;逐行随机划分会让"同屋成员"分跨训练与测试集,测试指标虚高。
症状:随机划分的测试 AUC 比按家庭划分高出 0.02-0.05 且方差异常小;删除家庭级特征后性能骤降。
解决:
- 简单方法:以
household_id为组做GroupShuffleSplit/GroupKFold,保证家庭不跨集。- 进阶方法:以 PSU 为组划分(更严格),或用整群 bootstrap 估计指标置信区间。
- SOTA 方法:直接在混合效应框架(GLMM)或 GEE 下建模,显式估计组内相关系数(ICC)再决定划分粒度。
参考:宪法级通用准则与 SGIM 的设计提示
⚠️ 坑点 6:罕见子组估计不稳定,小样本组一碰就碎(分类:偏倚陷阱)
问题:按"种族 × 疾病 × 年龄段"等交叉切片后,个别单元格只剩几十个样本;NIOSH 亦指出低收入、农业与矿业从业人群在样本中代表性不足(NIOSH),子组结论极易翻转。
症状:子组患病率年际摆动巨大;公平性审计中某些子组的校准曲线呈锯齿状。
解决:
- 简单方法:凡报告子组数字必附置信区间与样本量;n<50 的单元格只给 pooled 结果。
- 进阶方法:合并多年份数据增大子组样本量(配合坑点 2 的断点处理);用层次收缩(partial pooling)稳住小组估计。
- SOTA 方法:小区域估计(small area estimation)方法,把 NHIS 与人口普查协变量结合生成稳定的子组/区域估计。
参考:NIOSH Strengths and Limitations
⚠️ 坑点 7:患病率类任务的类别不平衡与 SMOTE 误用(分类:标签理解)
问题:多数慢病标签正类占比从个位数到三成不等;不平衡处理如果放在划分之前(如全量 SMOTE 后再切分),合成样本会把"邻居"信息带入测试集,指标虚高。
症状:SMOTE 后测试 F1 明显高于无增强基线,但按时间外推立刻崩塌;合成样本的分布与真实人群不符。
解决:
- 简单方法:先用 class weight / 加权损失(配合坑点 1 的权重),这是与调查数据语义最一致的做法。
- 进阶方法:若必须重采样,只在训练折内部进行;报告 PR-AUC 与加权敏感性而非单一 Accuracy。
- SOTA 方法:阈值移动(threshold moving)+ 校准分析;对加权采样与重采样做对照消融。
参考:Vu et al.(SMOTE 处理延迟牙科护理分类)
⚠️ 坑点 8:横断面数据写因果句(分类:偏倚陷阱)
问题:NHIS 是横断面调查,暴露与结局同期测量,无时间先后;NCHS 官方明确"不能做因果推断"(NIOSH)。把"吸烟与慢病相关"写成"吸烟导致"是综述审稿最常见的退稿理由。
症状:论文被审稿人指出"cross-sectional design cannot support causal claims";政策建议部分被要求改写。
解决:
- 简单方法:全文统一用"关联/预测/风险标志物"语言,Discussion 明示横断面局限。
- 进阶方法:需要因果语言时改用纵向资源——IPUMS 的 NDI 死亡链接(1986-2014 受访成人 + 2015 起 sample adults)做生存分析,或 MEPS 面板做前后对照。
- SOTA 方法:目标试验模拟(target trial emulation)框架 + 倾向得分,在明确声明假设的前提下逼近因果问题。
参考:NIOSH、IPUMS Health Surveys(NDI 链接)
§6.6 数据增强
- ✅ 安全:类权重 / 加权随机采样(与调查权重语义一致);训练折内 SMOTE(仅限类别不平衡强且样本充足时);按家庭分组的重采样。
- ❌ 危险:全量 SMOTE 后再划分(泄漏,见坑点 7);对加权数据做朴素过采样导致有效样本量失真;用 GAN 合成"受访者"并把合成数据计入患病率(扭曲全国估计,属方法学造假);噪声注入到分类编码(7/9 缺失码会被噪声改成"真值")。
§6.7 模型推荐
| 模型 | 适用场景 | 备注 |
|---|---|---|
| 加权 Logistic 回归 | 基线/可解释性首选 | 配 survey 标准误即为官方级估计 |
| LightGBM / XGBoost | 表格强基线,Vu et al. 用 LightGBM 达 84.87% | 注意缺失码先处理,支持 categorical 特征 |
| 列线图/评分卡 | 临床转化友好的风险工具 | Chen & Long 2025 关节炎列线图 AUC = 0.813 |
| 深度 MLP | 特征多且有交互假设时 | 单年数万样本下通常不优于 GBDT |
| 生存模型(Cox/离散时间) | NDI 死亡链接研究 | 仅限有链接资格的年份子集 |
| 层次贝叶斯/小区域估计 | 小样本子组与区域估计 | 直接回应坑点 6 |
| 混合效应模型(GLMM) | 需要显式处理家庭聚类的推断 | 坑点 5 的建模级解法 |
选型路线建议:加权 Logistic(基线)→ LightGBM(性能)→ GLMM/层次模型(推断严谨性)。前两步回答"能不能预测",第三步回答"效应有多大、证据多硬"——三者互补而非替代。
§6.8 硬件需求
| 配置 | 最低 | 建议 |
|---|---|---|
| 内存 | 4 GB(单年) | 16 GB(多年合并) |
| CPU | 2 核 | 8 核(GBDT 训练) |
| GPU | 不需要 | 不需要(表格模型收益有限) |
| 磁盘 | <1 GB | <5 GB(含多年文件与中间产物) |
§6.9 评估指标
import numpy as np
import torch
from sklearn.metrics import roc_auc_score
@torch.no_grad()
def weighted_eval(model, loader) -> dict:
"""加权 AUC + 加权准确率:与调查推断口径一致的评估(坑点 1 配套)。"""
model.eval()
ys, ps, ws = [], [], []
for X, y, w in loader:
ys.append(y.numpy())
ps.append(torch.sigmoid(model(X)).numpy())
ws.append(w.numpy())
y, p, w = map(np.concatenate, (ys, ps, ws))
auc = float(roc_auc_score(y, p, sample_weight=w))
acc = float(np.average((p > 0.5) == y, weights=w))
return {"weighted_auc": auc, "weighted_acc": acc}
# 加权置信区间:整群/家庭分层的 bootstrap(保留聚类结构)
def weighted_auc_ci(y_true, y_score, weights, n_boot: int = 1000, seed: int = 42) -> tuple:
rng = np.random.default_rng(seed)
n = len(y_true)
stats = []
for _ in range(n_boot):
idx = rng.integers(0, n, n) # 简化版 bootstrap;发表级请按 PSU 整群重抽
stats.append(roc_auc_score(y_true[idx], y_score[idx], sample_weight=weights[idx]))
lo, hi = np.percentile(stats, [2.5, 97.5])
return float(lo), float(hi)
§6.10 MLOps 笔记
- 数据版本化:NHIS 每年发布新年份、IPUMS 每年更新版本快照(当前 V8.1,2025-08-06 起)——用 DVC/MLflow 记录"提取书签 + 版本号 + 下载日期",保证可复现。
- 年度再训练节律:把"新年份发布"作为再训练触发器;同时监控新旧行 Drift(PSI/KS)——redesign 年(2019)必须按断点处理而非静默合并。
- 监控:线上/新数据上的加权患病率与训练期基线比对;标签分布突变优先怀疑编码变化而非真实流行病学变化。
- 审计留痕:保留每个模型版本的变量清单与 codebook 页码引用,审查时能回答"这个特征 2019 年后还算数吗"。
年度更新检查清单(每次新年份数据落地时过一遍):
[ ] 记录新版本号与发布日期(IPUMS 快照 / CDC 年份)
[ ] 检查目标标签变量的定义与取值域是否变化
[ ] 权重字段名/体系是否变化(redesign 年重点)
[ ] 重跑年度加权患病率基线,与上一年对比
[ ] 重跑模型评估,PSI 超 0.2 的特征列入人工审查
[ ] 更新数据卡:版本、样本量、已知断点
§6.11 与官方资源的对接
- 官方权重与设计文档:每年度 data release 均附 sample design / variance estimation 文档,务必读当年版(CDC)。
- IPUMS user notes:方差估计、权重选择、与原始文件的变量链接说明(IPUMS FAQ)。
- 变量跨年可比性:优先查阅 IPUMS 各变量页的 “Comparability” 段。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解方式 |
|---|---|---|---|
| 自报偏差 | 回忆偏差与社会期望偏差;结局未经专业人员或病历验证(NIOSH) | 高 | NHANES 客观测量交叉验证;标签命名透明化 |
| 覆盖偏差 | 排除现役军人、机构人口、海外公民;机构人群(养老院等)恰恰是高风险群体 | 中 | 明确推断总体为"平民非机构人口" |
| 无回应/欠代表 | 低收入、农业与矿业人群代表性不足(NIOSH) | 中 | 权重校准;子组报告附置信区间(坑点 6) |
| 断点偏差 | 2019 redesign 使跨年比较出现结构性断裂(PMC11366641) | 高 | 分段分析;IPUMS 桥接变量 |
| 测量粒度偏差 | BMI 等来自自报身高体重,含系统低估 | 中 | 敏感性分析;与 NHANES 测量值比对 |
| 应答偏差 | "不知道/拒答"非随机分布(收入、素养相关) | 中 | 信息性缺失显式建模(坑点 3 进阶) |
| 时点偏差 | 年度汇总摊薄年内事件;疫情年份访问方式特殊 | 低-中 | 跨 2019-2022 比较谨慎解读(§7.6) |
§7.2 标注质量
NHIS 无标注者一致性概念(标签=自报+访员记录),其质量核心是访员标准化(Census Bureau 训练 + CAPI 逻辑控制)与双重确认条目设计(如哮喘"曾患+仍有")。标签效度研究通常用 NHANES 的体检金标准对照自报条目——结论方向一致:自报高血压/糖尿病灵敏度中等、特异度高,即"说过有病的多数真有病,没说有病的未必真没病"(未确诊者是系统性漏报来源)。使用建议:把标签当"疾病认知"测度而非诊断测度。
§7.3 泛化性
| 迁移场景 | 失效风险 | 证据/机制 |
|---|---|---|
| → 全体美国人口(含机构/军人) | 高 | 设计排除即无法推断(PMC5055461) |
| → 临床就诊人群 | 高 | 人群 vs 就诊人群分布差异大;症状/严重度谱不同 |
| → 其他国家 | 高 | 医疗制度、问卷语言与文化应答风格不同 |
| → NHIS 后续年份(跨 redesign) | 中-高 | 2019 断裂(PMC11366641) |
| → NHIS 年内/近期年份 | 低 | 同设计同编码下外推 1-3 年通常稳定 |
§7.4 伦理
数据经 NCHS 披露规避处理(标识符移除、扰动、封顶、地理粗化)后以公开使用文件形式发布,属最低伦理门槛数据(美国联邦政府作品,公有领域);IPUMS 分发要求注册并同意 NCHS 负责任使用条款。受访者知情同意由 NCHS/Census Bureau 采集程序覆盖。使用者义务:正确引用、不得试图重识别、报告受限变量须走 RDC 通道。
§7.5 公平性
NHIS 的种族/族裔、教育、收入、保险维度使其成为公平性审计的友好样本,但需注意三点:西班牙语裔与亚裔在部分年份有专项设计(过采样),合并年份时要读设计文档;低收入与农业/矿业人群欠代表(NIOSH)意味着模型对这些群体的"公平"结论建立在更稀薄的证据上;小样本子组(坑点 6)必须报告区间而非点值。
子组审计的最小代码骨架:
def subgroup_audit(df: pd.DataFrame, group_col: str, model, feat_cols: list) -> pd.DataFrame:
"""按子组报告加权阳性率与预测阳性率,检查校准一致性。"""
rows = []
for g, sub in df.groupby(group_col):
if len(sub) < 50: # 坑点 6:小样本组只报告规模
rows.append({group_col: g, "n": len(sub), "note": "small cell, pooled only"})
continue
y = sub["HYPEV"].to_numpy()
w = sub["WEIGHT"].to_numpy()
X = torch.tensor(sub[feat_cols].fillna(sub[feat_cols].median()).to_numpy(np.float32))
p = torch.sigmoid(model(X)).squeeze(-1).detach().numpy()
rows.append({
group_col: g, "n": len(sub),
"weighted_true_rate": float((y * w).sum() / w.sum()),
"weighted_pred_rate": float((p * w).sum() / w.sum()),
})
return pd.DataFrame(rows)
# audit = subgroup_audit(adult_p, "REGION", model, ["AGE", "SEX", "BMI", "SMOKEV"])
读表规则:weighted_true_rate 与 weighted_pred_rate 的差在各子组间应大体一致且接近 0;某子组预测率系统性偏低说明模型在该群体欠校准——这正是公平性报告该写的内容。
§7.6 数据漂移
三种漂移并存:真实流行病学漂移(吸烟率长期下降、肥胖与糖尿病上升——正是数据价值所在);设计漂移(1985/1995/1997/2016/2019 的设计与问卷节点);COVID 冲击(2020 年起访问方式与回应率受疫情影响,跨 2019-2022 的比较需谨慎解读)。工程上用 PSI/KS 监控特征分布、监控加权患病率基线即可覆盖前两类;redesign 断裂靠版本断点管理(坑点 2)。
def psi(expected: np.ndarray, actual: np.ndarray, bins: int = 10) -> float:
"""人口稳定指数:监控连续特征在新旧年份间的分布漂移。"""
edges = np.quantile(expected, np.linspace(0, 1, bins + 1))
edges[0], edges[-1] = -np.inf, np.inf
e = np.histogram(expected, edges)[0] / len(expected)
a = np.histogram(actual, edges)[0] / len(actual)
e, a = np.clip(e, 1e-6, None), np.clip(a, 1e-6, None)
return float(((a - e) * np.log(a / e)).sum())
# 经验阈值:PSI < 0.1 稳定;0.1-0.2 需关注;> 0.2 触发人工审查
# (先剔除 redesign 断点年份,否则 PSI 反映的是编码变化而非人群变化)
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 一人一行矩形化(IPUMS 默认),层级经 ID 关联 |
| 2 | 唯一标识 | ✅ | person/household/family ID 完备 |
| 3 | 特殊字符 | ✅ | 纯 ASCII 定宽/CSV,无多字节陷阱 |
| 4 | 重复行 | ✅ | 官方文件无重复;合并多文件时需按 ID 去重 |
| 5 | 缺失编码 | ⚠️ | 7/8/9 专用缺失码体系,须按 codebook 重编码(坑点 3) |
| 6 | 标签标识 | ✅ | 二分类/多分类标签语义清晰(自报条目族) |
| 7 | 罕见类分组 | ⚠️ | 小样本子组不稳定(坑点 6),需区间报告 |
| 8 | 偏倚评估 | ✅ | §7.1 五类偏倚有官方文档支撑 |
| 9 | 数据字典 | ✅ | codebook + IPUMS DDI XML 双体系,17,000+ 变量全文档化 |
| 10 | 信息性缺失解释 | ✅ | 拒答/不知道可保留为信息性类别(坑点 3 进阶) |
| 11 | 设备记录 | ❌ | 无物理设备测量(访谈调查),不适用而非缺失 |
| 12 | 共线性 | ⚠️ | 共病与功能受限条目族高度相关,回归前需检查 VIF |
| 13 | 编码映射 | ✅ | IPUMS 桥接变量 + ICD-11/SNOMED 映射表(§2.1) |
| 14 | 时间戳处理 | ✅ | 年度粒度,无时区/毫秒问题 |
| 15 | 划分建议 | ⚠️ | 无官方划分;须家庭/PSU 分组划分(§5、坑点 5) |
| 16 | 泄漏讨论 | ✅ | §5.3 泄漏矩阵覆盖家庭/PSU/权重/跨年四源 |
| 17 | 标签分布 | ✅ | §4.2 有基准数字(关节炎 26.3%) |
| 18 | 测量偏倚 | ⚠️ | 自报 BMI/疾病认知系统性误差(§7.1) |
| 19 | 外部验证建议 | ✅ | NHANES/BRFSS/MEPS 三通道(§5.5) |
| 20 | 版本记录 | ✅ | 年度发布 + IPUMS 版本快照(V8.1,DOI 版本化) |
| 21 | 预处理脚本 | ⚠️ | 官方提供读取声明文件;加权/缺失码管线需自建(§6.3) |
| 22 | 合规要求 | ✅ | 公有领域 + 负责任使用条款,门槛极低 |
| 23 | 多模态对齐 | ❌ | 单模态表格数据,不适用 |
| 24 | 去标识化 | ✅ | NCHS 披露规避 + RDC 受限通道 |
DAIMS 评分:17.5 / 24
评分解读:数据治理基本面(标识、文档、合规、去标识化、版本管理)达到公开数据的第一梯队;失分集中在"统计调查→ML 数据集"的转换层——缺失码体系、无官方划分、调查加权门槛与自报测量偏倚,这些不是数据缺陷而是其作为官方统计调查的本性。对熟悉 survey 方法的团队,真实可用度高于 17.5;对直接拿来跑 ML 的团队,需先补坑点 1/3/5 三课。
对你意味着什么:(1) 动手前先决定"加权 or 不加权"并贯穿全程(坑点 1);(2) 把缺失码重编码写进数据管线的第一道工序(坑点 3);(3) 永远按家庭分组划分(坑点 5);(4) 跨年研究先查 IPUMS Comparability 注释确认变量是否跨越 2019 断点(坑点 2);(5) 论文表述把"确诊预测"降级为"自报风险预测"(坑点 4)。做到这五条,NHIS 是免费数据里工程风险最低的高质量表格数据源之一。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| NHIS 2023 内部建模(26,031 名成人) | NCHS | 关节炎风险预测(列线图) | AUC = 0.813 | —(内部基准) | 14 个特征(含共病/行为)即可达诊断级判别(Chen & Long 2025) |
| NHIS 内部建模(延迟牙科护理) | NCHS | 就医延迟二分类(LightGBM+SMOTE) | Accuracy = 84.87% | —(内部基准) | 教育、收入贫困比、保险与自评健康是最强预测因子(Vu et al.) |
| NHANES 体检对照 | NCHS | 自报标签效度 | 定性(灵敏度中等/特异度高) | 自报偏低估 | 未确诊者构成系统性漏报,迁移到临床数据时须重新校准阈值 |
注:NHIS 社区尚无统一定榜的外部验证基准;上表只收录同行评审来源。不同研究因年份/子集/标签定义不同,数值不可直接互比。
§8 基准性能与生态
§8.1 排行榜(已发表 ML 研究收录)
NHIS 无官方排行榜;下表收录以 NHIS 公开数据为训练源的代表性同行评审建模研究:
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 列线图(SVM-RFE 特征筛选) | AUC = 0.813 | 2025 | SVM-RFE 筛 14 特征 + 校准曲线 + DCA | Chen T, Long Z, 2025, PLoS One 20(11):e0336018. doi:10.1371/journal.pone.0336018 | 未公开 |
| 2 | LightGBM | Accuracy = 84.87% | 2025 | SMOTE 类别平衡 + 四模型对比 | Vu G, et al., 2025, NHIS 延迟牙科护理分类研究(PMC12907638) | 未公开 |
⚠️ 两行数值不可直接比较:任务不同(患病预测 vs 就医行为分类)、指标不同(AUC vs Accuracy)、年份子集与特征集不同。
§8.2 SOTA 总结与选型建议
NHIS 表格任务的性能天花板大致在 AUC 0.78-0.85 区间(自报标签的信息上限决定),继续堆模型复杂度收益有限。选型建议:先加权 Logistic 拿基线,再上 LightGBM 验证增量,最后才考虑深度模型;把精力花在坑点 1/3/5 的方法学正确性上比堆结构更有价值。
§8.3 评测协议
可复现评测的最小协议:(1) 固定年份与样本子集(sample adult);(2) 缺失码重编码方案写明;(3) 家庭分组划分(给出 random_state);(4) 报告加权与未加权双套指标;(5) 报告点估计 + 置信区间;(6) 引用数据版本(IPUMS V8.1 或具体年份官方文件)。
协议模板(写进论文/报告的方法节即可直接使用):
数据:NHIS [年份] Sample Adult 公开文件(NCHS 发布)/ IPUMS NHIS V8.1 提取
样本:[n] 名成人;排除 [标签缺失/未知码] [m] 例
特征:[列表],缺失码 7/8/9 归为 [NaN/显式类别],处理方式 [如中位数填充]
划分:按 [household_id/PSU] GroupShuffleSplit,test_size=0.2,random_state=[42]
加权:训练 [WeightedRandomSampler/加权 BCE];评估 [加权 AUC/加权 Acc]
不确定性:[整群/分层] bootstrap × [1000] 次的 95% CI
版本与日期:数据 [V8.1,下载于 YYYY-MM-DD];代码 [commit/repo]
§8.4 相关数据集
| 数据集 | 机构 | 与 NHIS 关系 | 互补点 |
|---|---|---|---|
| NHANES | CDC/NCHS | 同门(访谈+体检车) | 客观测量金标准 |
| BRFSS | CDC/各州 | 同类电话问卷 | 州级全覆盖 |
| MEPS | AHRQ | 与 NHIS 抽样衔接 | 纵向费用/利用 |
| NHIS-NHID | 韩国 NHIS | 同名异构(理赔库) | 全人群纵向理赔(§2.6 辨析) |
| PSID | 密歇根大学 | 家庭面板调查 | 跨代追踪 |
§8.5 关键论文 Top5
- Chen T, Long Z. Predicting arthritis risk with machine learning: insights from the 2023 NHIS data. PLoS One, 2025, 20(11): e0336018. doi:10.1371/journal.pone.0336018 — SVM-RFE+列线图的 NHIS 建模样板。
- Vu G, et al. Classifying Delayed Dental Care Using Machine Learning: A NHIS Analysis. 2025(PMC12907638)— 类别不平衡与公平性变量的处理范例。
- Parsons VL, et al. Design and estimation for the National Health Interview Survey, 2006–2015. National Center for Health Statistics(PMC5055461)— redesign 前十年设计与权重的方法学源头。
- Seong SC, et al. Data Resource Profile: The National Health Information Database (NHID) of the NHIS in South Korea. Int J Epidemiol, 2017, 46(3): 799-800. doi:10.1093/ije/dyw253 — 与美国 NHIS 做同名辨析时必引。
- Blewett LA, Rivera Drew JA, King ML, Williams KCW. IPUMS Health Surveys: National Health Interview Survey, Version 6.4. IPUMS, University of Minnesota, 2019. doi:10.18128/D070.V6.4 — 跨年整合体系的官方引用(当前版本 V8.1,doi:10.18128/D070.V8.1)。
§8.6 社区活跃度
NHIS 是美国卫生服务研究与流行病学界的基础设施级数据:NCHS 每年发布新年份并维护官方文档与教程;IPUMS NHIS 持续版本化更新(V8.1 于 2025-08-06 上线)并运营用户支持与新闻邮件(IPUMS FAQ);基于 NHIS 的论文年产出以千计,数据问答在 StackOverflow/R-survey 社区高度活跃。无 Kaggle/HuggingFace 榜单生态,符合其官方统计调查定位。
对使用者的实际含义:遇到变量口径、权重选择、方差估计问题时,优先级依次为——当年官方方法文档 → IPUMS 变量页与 user notes → R-survey 社区问答。几乎所有常见问题都已有官方答案,这是 NHIS 作为"老牌官方数据"相比新兴开放数据集的隐性优势:坑都被前人踩过且文档化了。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| CDC NHIS 官网 | 官方主页 | https://www.cdc.gov/nchs/nhis/ | 文件下载与方法文档第一入口 |
| IPUMS NHIS | 整合数据系统 | https://nhis.ipums.org/ | 跨年变量整合与定制提取 |
| IPUMS Health Surveys | 项目主页 | https://ipums.org/projects/ipums-health-surveys | NHIS+MEPS 与死亡链接说明 |
| NCHS RDC | 受限数据通道 | 经 NCHS 官网入口 | 精细地理/敏感变量 |
| ipumsr vignette | 工具文档 | https://dntp.epbi.cwru.edu/web/packages/ipumsr/vignettes/ipums.html | R/API 提取工作流 |
| NIOSH NHIS 职业健康页 | 官方专题 | https://cdc.gov/niosh/surveillance/nhis/index.html | 职业数据与 limitation 权威表述 |
(Star 数不适用:均非代码仓库。链接访问与说明更新截至 2026-09。)
§9 相关资源与引用
§9.1 官方资源
- NHIS 官方主页(CDC/NCHS):https://www.cdc.gov/nchs/nhis/ —— 年度文件、问卷、方法文档总入口
- Survey Methods / Sample Design 文档:各年度随数据发布,redesign 年份(2019)必读
- IPUMS NHIS:https://nhis.ipums.org/ —— 注册后免费定制跨年提取
- IPUMS NHIS FAQ 与 User Notes:https://nhis.ipums.org/nhis-action/faq —— 权重、方差估计、变量链接
- IPUMS Health Surveys(含 NDI 死亡链接说明):https://ipums.org/projects/ipums-health-surveys
- NIOSH 职业健康专题:https://cdc.gov/niosh/surveillance/nhis/index.html
§9.2 教程与工具
- ipumsr(R)官方 vignette:IPUMS 数据的提取、下载与读取全流程
- R
survey包:svydesign/svymean是设计感知分析的社区标准 - NCHS 官方教程页:数据发布时附示例代码(SAS/SPSS/Stata)
§9.3 BibTeX 引用
@misc{ipums_nhis_2025,
author = {Blewett, Lynn A. and Rivera Drew, Julia A. and King, Miriam L. and Williams, Kari C.W.},
title = {{IPUMS Health Surveys: National Health Interview Survey, Version 8.1}},
year = {2025},
publisher = {IPUMS, University of Minnesota},
doi = {10.18128/D070.V8.1},
url = {https://nhis.ipums.org/}
}
@article{chen2025arthritis,
author = {Chen, Tianhua and Long, Zhiwei},
title = {Predicting arthritis risk with machine learning: Insights from the 2023 {N}ational {H}ealth {I}nterview {S}urvey data},
journal = {PLoS One},
year = {2025},
volume = {20},
number = {11},
pages = {e0336018},
doi = {10.1371/journal.pone.0336018}
}
@article{seong2017nhid,
author = {Seong, Sang Cheol and Kim, Yeon-Yong and Khang, Young-Ho and Park, Jong Heon and Kang, Hee-Jin and Lee, Heeyoung and Do, Cheol-Ho and Song, Jong-Sun and Bang, Ji Hyon and Ha, Seongjun and Lee, Eun-Joo and Shin, Soon Ae},
title = {Data Resource Profile: The National Health Information Database of the National Health Insurance Service in {S}outh {K}orea},
journal = {International Journal of Epidemiology},
year = {2017},
volume = {46},
number = {3},
pages = {799--800},
doi = {10.1093/ije/dyw253}
}
@techreport{parsons2014design,
author = {Parsons, Vanessa L. and Moriarity, Christopher and Jonas, Kimberly and Moore, Tamra F. and Davis, Philip E. and Tompkins, Larry},
title = {Design and Estimation for the {N}ational {H}ealth {I}nterview {S}urvey, 2006--2015},
institution = {National Center for Health Statistics},
year = {2014},
url = {https://pmc.ncbi.nlm.nih.gov/articles/PMC5055461/}
}
@misc{cdc_nhis_portal,
author = {{National Center for Health Statistics}},
title = {National Health Interview Survey},
year = {2025},
publisher = {Centers for Disease Control and Prevention},
url = {https://www.cdc.gov/nchs/nhis/}
}
§9.4 引用指南
- 用 IPUMS 提取数据时:引用 IPUMS NHIS 数据集(含版本与 DOI,如上
ipums_nhis_2025),并可附提取参数以供复现。 - 用 CDC 官方单年文件时:引用对应年度的 NHIS 数据发布与 NCHS 机构(
cdc_nhis_portal+ 具体年份文件页)。 - 方法溯源:设计/权重问题引
parsons2014design与当年 sample design 文档;韩国数据辨析引seong2017nhid。
§10 AI 使用声明卡
§10.1 本页使用的 AI 模型
本页面内容生产使用大型语言模型(CodeBuddy,Claude 系)辅助完成资料整理、结构化写作与代码示例起草。
§10.2 AI 参与范围
AI 参与:文献检索结果的整理与归纳、章节初稿撰写、代码示例起草、表格结构化。AI 不参与:事实最终裁定(全部硬事实须有检索来源)、医学与数据工程审核(由千方病案医学编辑部完成)、发布决策。
§10.3 输入来源列表
- IPUMS Health Surveys: NHIS, Version 6.4(ipums.org/projects/ipums-health-surveys/d070.v6.4)
- IPUMS Health Surveys 项目主页(ipums.org/projects/ipums-health-surveys)
- IPUMS NHIS About 页(nhis.ipums.org/nhis/aboutIPUMSNHIS.shtml)
- IPUMS NHIS FAQ(nhis.ipums.org/nhis-action/faq)
- Parsons VL, et al. Design and estimation for the NHIS, 2006–2015(PMC5055461)
- 2019 NHIS redesign 权重与估计研究(PMC11366641)
- Chen T, Long Z. PLoS One, 2025, 20(11):e0336018(PMC12654921 / dx.plos.org)
- Vu G, et al. NHIS 延迟牙科护理分类研究(PMC12907638)
- SGIM NHIS 数据集指南(sgim.org/resource/national-health-interview-survey-nhis)
- NIOSH NHIS 职业健康专题(cdc.gov/niosh/surveillance/nhis/index.html)
- Seong SC, et al. Int J Epidemiol, 2017, 46(3):799-800(NHID Data Resource Profile)
- Korean Circ J, 2020(doi:10.4070/kcj.2020.0171,NHID 结构)
- Diabetes Metab J, 2025, 49(1):13-21(doi:10.4093/dmj.2024.0780,韩国 NHID 综述)
- ipumsr 官方 vignette(dntp.epbi.cwru.edu/web/packages/ipumsr/vignettes/ipums.html)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、人群表、同名辨析) | 千方病案医学编辑部 | 与 WHO ICD-11 浏览器及检索来源交叉比对 | ✅ 已通过 |
| §3 数据集规格(样本数、版本矩阵、溯源链) | 千方病案医学编辑部 | 与 PMC5055461/PMC11366641/IPUMS 官方页交叉比对 | ✅ 已验证 |
| §4 数据结构(字段字典、缺失码体系) | 千方病案医学编辑部 | 与 IPUMS DDI 文档体系交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与 ipumsr 官方工作流比对 | ✅ 已通过 |
| §7 DAIMS 评估与偏倚分析 | 千方病案医学编辑部 | 与 NIOSH/SGIM limitation 表述交叉比对 | ✅ 已验证 |
| §8 基准收录 | 千方病案医学编辑部 | 与原文摘要数值逐项核对 | ✅ 已验证 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.1-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- NHANES — 共享标签:公共卫生与流行病学 / 调查数据 / 流行病学
- CHARLS — 共享标签:公共卫生与流行病学 / 调查数据 / 流行病学
- Global-Burden-of-Disease — 共享标签:公共卫生与流行病学 / 流行病学
- HealthData-gov — 共享标签:公共卫生与流行病学 / 流行病学
- BRFSS — 共享标签:公共卫生与流行病学 / 调查数据
- mics — 共享标签:公共卫生与流行病学 / 调查数据
- DHS-Program — 共享标签:公共卫生与流行病学 / 调查数据
- ncd-risc — 共享标签:公共卫生与流行病学 / 流行病学
- jhu-csse-covid-19 — 共享标签:公共卫生与流行病学 / 流行病学
- CDC-WONDER — 共享标签:流行病学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
