信息速览

MEPS(医疗支出面板调查)— 美国医疗支出与保险金标准调查 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Medical Expenditure Panel Survey(MEPS) |
| 英文全称 | Medical Expenditure Panel Survey |
| 别名/简称 | MEPS、MEPS-HC / MEPS-IC / MEPS-MPC、医疗支出面板调查 |
| 疾病分类 | 全疾病谱(家庭自报 + ICD-10/CCSR 编码;如 ICD-11:5A11 2 型糖尿病 / BA00 原发性高血压 / CA22 COPD / CA23 哮喘 / 6A70 抑郁发作,详见 §2.1) |
| SNOMED CT | 44054006 Diabetes mellitus type 2 / 38341005 Hypertensive disorder / 13645005 Chronic obstructive lung disease / 195967001 Asthma(详见 §2.2) |
| 数据模态 | 结构化调查数据(家庭访谈)、纵向面板、事件级支出记录、处方药记录 |
| AI 任务类型 | 医疗支出预测、医疗利用预测、保险覆盖动态分析、慢病负担与共病分析、调查加权机器学习、因果推断与政策评估 |
| 样本总数 | 每数据年约 15,000 户 / 约 37,000 人(面板接触约 35,000 人,5 轮访谈);1996-2024 共 29 个数据年 |
| 数据大小 | 单文件 ZIP 0.2-59 MB(person 级主文件数 MB 至十余 MB;XLSX 版可达数十 MB) |
| 数据格式 | ASCII(.dat,附 SAS/SPSS/Stata/R 编程语句)、SAS transport、SAS V9、Stata、XLSX |
| 许可证 | 公有领域(U.S. Government work;AHRQ 请求引用来源) |
| 访问级别 | 开放(无需注册,直接下载;使用受 PHS Act 308(d)/903© 统计用途约束) |
| DUO 标签 | GRU(通用研究用途,仅限统计分析与报告) |
| 语言 | 英文 |
| 首发日期 | 1996(首个数据年) |
| 最后更新 | 2025-09(HC-252 Panel 27 纵向文件发布;最新数据年为 2024,HC-256) |
| 发布机构 | 美国医疗保健研究与质量局(Agency for Healthcare Research and Quality, AHRQ) |
| 官方主页 | https://meps.ahrq.gov |
| 下载地址 | https://meps.ahrq.gov/data_stats/download_data_files.jsp |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 多格式与官方编程语句齐备、文档与 codebook 顶级、公有领域零门槛;扣分项:无单一全量文件、需自行池化与加权、旧版 CPORT transport 文件需绕行 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、慢病标签与调查任务定义、人群覆盖与金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(负值缺失编码、权重与方差设计变量)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 AHRQ、Westat、Research Triangle Institute 无任何商业利益关联。本页面不销售 MEPS 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 AHRQ 或其承包商的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MEPS 公开使用文件属公有领域、可免费直接下载,但依《公共卫生服务法》308(d)/903© 条款仅限统计报告与分析用途,禁止再识别任何个人或机构,禁止与 MEPS/NHIS 之外的可识别记录联结。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? MEPS(Medical Expenditure Panel Survey,医疗支出面板调查)是美国联邦机构 AHRQ 自 1996 年起每年开展的大型家庭调查。它像一个全国性的"医疗记账本":每年访问约 15,000 户、近 37,000 名普通美国人,用 5 轮访谈追踪他们两年内看了几次病、花了多少钱、谁付的钱、有没有保险,并向医院、医生和药房核实账单细节。数据完全公开、免费下载。
为什么重要? 美国医疗支出占 GDP 近五分之一,但"谁在花钱、花在哪、谁买单"一直缺乏全国尺度的微观答案。MEPS 是唯一同时测量美国人如何使用医疗保健、如何支付、以及健康保险覆盖状况的全国数据源,官方称其为医疗成本与使用、保险覆盖"最完整的数据来源"。从 ACA(奥巴马医改)评估到药价研究,几乎所有美国卫生政策实证研究都绕不开它。
我能用它做什么? 如果你做 AI/机器学习,MEPS 是极佳的表格数据基准:预测个人年度医疗支出(典型的零膨胀右偏分布)、预测就医利用、识别高额费用人群、做公平性分析(官方对少数族裔和低收入家庭过抽样)。如果你做政策/经济学研究,它可以做全国代表性估计——前提是正确使用抽样权重与方差设计变量(见 §6.5 坑点)。
§1.1 摘要
MEPS 由三个互补组件构成:**家庭组件(HC)**对前一年 NHIS(国家健康访问调查)应答家庭的全国代表性子样本进行 5 轮访谈,覆盖 2 个完整日历年,采集人口学、健康状况、医疗服务使用、费用与支付来源、保险与就业信息;**医疗提供者组件(MPC)**在受访者授权后向医院、医生与药房电话核实家庭难以准确报告的费用细节,主要用作支出插补来源;保险组件(IC)从雇主处采集工作场所健康保险的类型与成本。自 2002 年起年度样本稳定在约 15,000 户(约 37,000 人),全年核心访谈应答率一般约 66%。数据以 HC-xxx 编号的公开使用文件(PUF)发布,提供 ASCII、SAS、Stata、XLSX 多格式及配套编程语句,属公有领域。对 AI 而言,MEPS 的核心挑战不在数据规模而在统计正确性:抽样权重、分层/整群设计、多年池化时的方差结构衔接与人员跨年重叠,是模型评估可信与否的分水岭(§6.5)。
§1.2 战略价值
维度一:医疗 AI 的"真实世界费用"锚点。 医院内部数据(如 EHR 数据库)几乎没有可比的全国对照:某个模型预测的"高风险高费用人群"在全体人口中是什么比例?自付负担如何分布?MEPS 提供全国代表性基准,使模型输出可以锚定到真实人口结构——这是单中心数据集无法提供的战略能力。
维度二:调查科学 + 机器学习的交叉训练场。 MEPS 完整暴露了表格化真实数据的全部"脏活":负值缺失编码、分层整群抽样、跨年池化、插补值混入标签、变量名带年份后缀。把这些坑点逐个解决(§6.5),等于掌握了一套可迁移到任何政府调查数据(NHIS、NHANES、CES)的工程方法论,这也是近年调查加权 ML 研究选择 MEPS 作基准的原因。
§1.3 同类数据集横向对比
| 数据集 | 主办方 | 规模 | 内容侧重 | 与 MEPS 的差异 |
|---|---|---|---|---|
| MEPS | AHRQ | 每年约 15,000 户 / 约 37,000 人 | 医疗支出、支付来源、保险覆盖(家庭+提供者+雇主三源) | 唯一同时测支出+利用+保险的全国微观来源,含提供者核实 |
| NHIS | NCHS(CDC) | 每年约 3 万-4 万户 | 健康状况、疾病、可及性(无支出金额) | MEPS 的抽样框来源;健康信息更深,但无费用数据 |
| NHANES | NCHS(CDC) | 每年约 5,000 受检者 | 体检、实验室检查、营养 | 有客观体测/生化指标,但样本小、无支出追踪 |
| HRS | 密歇根大学/NIA | 每两年约 2 万名 50+ 成人 | 老龄化、退休、资产 | 聚焦 50 岁以上人群与养老;MEPS 覆盖全年龄段 |
| HCUP NIS | AHRQ | 每年数百万住院记录 | 医院住院费用与结局(行政 claims) | 样本量大但仅限住院事件、无人口背景与保险外细节 |
| CEX | 美国劳工统计局 | 每年数千户 | 家庭全部消费支出 | 医疗只是消费类别之一,无临床细节 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 1996 | 首个数据年 | 三组件(HC/IC/MPC)框架确立;另开展过护理院组件(NHC) |
| 2002 | 样本扩至约 15,000 户;共同方差结构启用 | 此后年度文件可直接池化(2019 年前) |
| 2006 | NHIS 新抽样设计 | 亚裔纳入过抽样,MEPS 过抽样随之调整 |
| 2018 | transport 文件改用 CPORT 过程 | .ssp 文件 R/Stata 无法直读,需改用 ASCII(见坑点 5) |
| 2019 | 方差结构再次变更 | 跨 2019 池化必须使用 HC-036 Pooled Linkage 文件(见坑点 2) |
| 2020 | COVID-19 冲击 | 2020 成为首个含三个面板的数据年;官方警告池化 2020 需谨慎(见坑点 6) |
| 2024 | 数据年 2024 文件发布 | HC-256(Full Year Consolidated)、HC-255(Conditions)、HC-254A(Prescribed Medicines)等 |
| 2025-09 | HC-252 发布 | Panel 27 纵向数据文件(2022-2023),含 LONGWT 纵向权重 |
§1.5 典型应用场景
- 年度医疗支出预测与高额费用人群识别:以人口学、健康与保险特征预测 TOTEXP(年度总支出),服务于保费定价、风险调整与资源规划。
- 健康保险覆盖动态分析:利用面板结构研究个人跨年的保险状态转换(如 Medicaid 参保/退出、雇主保险变动),为政策评估提供微观证据。
- 慢病经济负担与共病研究:基于自报疾病(含 ICD-10/CCSR 编码)估计糖尿病、高血压等慢病的人群级支出差异。
- 调查加权机器学习基准:在保留分层整群设计的约束下比较 GBT、两部模型等算法,是调查统计与 ML 交叉论文的常用试验台。
- 支付来源与自付负担分析:拆解 TOTSLF/Medicare/Medicaid/商保各支付通道,评估医改前后的负担转移。
§2 医学背景
§2.1 疾病编码体系(ICD-10/CCSR 与 ICD-11 映射)
MEPS 家庭自报的疾病信息在发布文件中以 ICD-10 编码与 AHRQ Clinical Classification Software Refined(CCSR)类别形式提供(自 HC-199 起条件文件即随附 ICD-10 与 CCSR 编码)。下表给出常见慢病标签与 ICD-11 的对照关系:
| MEPS 常见自报疾病 | ICD-10(文件提供) | ICD-11 编码 | 术语说明 |
|---|---|---|---|
| 糖尿病(DIABDX) | E11 | 5A11 | 2 型糖尿病 mellitus,慢病共病分析首选标签 |
| 高血压(HIBPDX) | I10 | BA00 | 原发性高血压,MEPS 自报患病率最高的慢病之一 |
| 冠心病(CHDDX) | I25 | BA41 | 慢性缺血性心脏病,高额支出人群核心构成 |
| 哮喘(ASTHDX) | J45 | CA23 | 哮喘,儿童与成人支出分层常用变量 |
| COPD(COPDDX) | J44 | CA22 | 慢性阻塞性肺疾病,老年高额支出驱动因素 |
| 卒中(STRKDX) | I63/I64 | 8B11 | 脑梗死等脑血管病,功能状态与支出强关联 |
| 抑郁(通过 SAQ/PHQ 等条目) | F32/F33 | 6A70 | 抑郁发作,与利用率和自评健康强相关 |
| 肥胖(BMI 派生) | E66 | 5B80 | 肥胖症,由自报身高体重计算的 BMI 派生 |
说明:MEPS 原始文件提供的是 ICD-10 与 CCSR 编码(如 CCSR 类别 END003 糖尿病、CIRC008 原发性高血压),上表 ICD-11 编码为千方编辑部补充的映射参考,用于跨数据集对齐,不随 MEPS 文件发布。
§2.2 SNOMED CT 映射
| 疾病/概念 | SNOMED CT 码 | 首选术语 | 备注 |
|---|---|---|---|
| 2 型糖尿病 | 44054006 | Diabetes mellitus type 2 | 对应自报变量 DIABDX |
| 高血压性疾患 | 38341005 | Hypertensive disorder (disorder) | 对应自报变量 HIBPDX |
| 慢性阻塞性肺疾病 | 13645005 | Chronic obstructive lung disease | 对应自报变量 COPDDX |
| 哮喘 | 195967001 | Asthma | 对应自报变量 ASTHDX |
| 卒中 | 230690007 | Cerebrovascular accident | 对应自报变量 STRKDX |
| 冠心病 | 232353008 | Coronary arteriosclerosis (disorder) | 冠心病簇概念,对应 CHDDX |
MEPS 本身不发布 SNOMED CT 编码;上表为编辑部提供的标准映射,供将 MEPS 标签与 EHR/理赔数据对齐时使用。
§2.3 领域简介与"疾病"流行病学
MEPS 的医学背景不是单一疾病,而是人群级医疗支出与保险覆盖这一横断面领域。其流行病学特征有三条主线。其一,支出分布极度右偏:相当比例人群全年几乎无医疗支出,而少数高额费用者贡献总支出的主要份额,这决定了支出预测必须按"两部分模型"(有无支出 × 支出金额)或零膨胀/Tweedie 损失建模。其二,慢病与支出强关联:高血压、糖尿病、心脏病、哮喘等慢病的共病数量是个人支出与利用率的最强预测因子之一,MEPS 的慢病自报标签(DIABDX、HIBPDX 等)因此在费用风险模型中被广泛用作核心特征。其三,保险状态是支出可及性的调节变量: uninsured 人群的利用与支出结构系统性不同,任何不带保险特征的支出模型都会产生结构性偏差。
§2.3.1 常用疾病自报变量速查
Consolidated person 级文件内置一组以 DX 结尾的自报诊断变量(取值 1=是 / 2=否 / 负值=缺失),是费用风险建模最常用的疾病特征:
| 变量 | 疾病含义 | 典型用途 |
|---|---|---|
| HIBPDX | 高血压诊断 | 共病计数、高血压费用研究 |
| DIABDX | 糖尿病诊断(不含妊娠期) | 糖尿病经济负担、疾病管理评估 |
| CHDDX | 冠心病诊断 | 高额费用人群识别 |
| ANGIDX | 心绞痛诊断 | 心血管共病 |
| MIDX | 心肌梗死病史 | 心血管风险分层 |
| STRKDX | 卒中诊断 | 功能状态与长期照护研究 |
| ASTHDX | 哮喘诊断 | 儿童与成人呼吸疾病支出 |
| COPDDX | 慢阻肺诊断 | 老年高额支出驱动因素 |
| CANCERDX | 癌症诊断(不含皮肤癌) | 肿瘤费用与生存研究 |
| ARTHDX | 关节炎诊断 | 老年功能受限与费用 |
| CHOLDX | 高胆固醇诊断 | 心血管一级预防分析 |
| EMPHDX | 肺气肿诊断 | 慢性呼吸病共病组合 |
使用提示:以上均为自报是否曾被告知患病,与临床确诊存在已知差异(§7.1);做疾病特异性模型时建议按 CCSR(条件文件)交叉校验。
§2.4 研究任务定义
| 任务类型 | 定义 | MEPS 支持方式 |
|---|---|---|
| 支出筛查/预测 | 预测个人年度总支出或识别高额费用人群 | person 级 TOTEXP 及其分支付来源 |
| 利用预测 | 预测就诊/住院/急诊/处方次数与费用 | 事件级文件聚合到 person |
| 保险动态分析 | 跨年保险状态转换、无保险持续时间 | 2 年面板 + 各轮保险条目 |
| 政策因果评估 | 改革前后利用/负担变化的差分设计 | 多年池化 + 体重构 |
| 公平性审计 | 模型性能的种族/收入/年龄分层差异 | 过抽样保证子群样本量 |
§2.5 人群覆盖
| 维度 | 内容 |
|---|---|
| 数据来源人群 | 前一年 NHIS 应答家庭的全国代表性子样本 |
| 时间窗口 | 每面板 5 轮访谈、覆盖 2 个完整日历年 |
| 年龄 | 全年龄段(含儿童;成人另有自填问卷 SAQ) |
| 性别/种族 | 全覆盖;黑人与西裔全程过抽样,2006 年起亚裔纳入过抽样,另有低收入家庭过抽样 |
| 就医/机构类型 | 美国平民非机构人口:不含养老院、长期住院机构、军队与海外人口 |
| 样本量 | 每年目标约 14,500-15,000 户、约 37,000 人(面板接触约 35,000 人) |
§2.6 临床与政策价值
对临床 AI 而言,MEPS 最重要的价值是人群参照系:单中心 EHR 模型的风险评分需要"普通人群里这个评分意味着什么"的对照,MEPS 提供全国代表性分布。对卫生政策而言,MEPS 是美国医保改革实证研究的核心证据源:保险扩展对利用与自付负担的影响、处方药费用趋势、慢病管理缺口等结论几乎都以其为数据底座。AHRQ 官方持续发布基于 MEPS 的统计简报与交互式汇总表(MEPS Trends),可直接用作模型的宏观校验目标。
§2.7 支出"金标准"的构成
| 维度 | 内容 |
|---|---|
| 划分方式 | 无官方 ML 划分;官方按数据年(HC-xxx)与文件层级(person/event/condition/RX)组织 |
| 标注方式 | 家庭自报 → MPC 提供者/药房核实 → 预测均值匹配(PMM)插补缺失支出 |
| “标注者” | 约 350 名受训现场访员;每户由单一受访者代报全家信息;药房与提供者事后核实 |
| 数据性质 | 概率抽样调查微观数据(非临床采集);发布前经保密处理与统计编辑 |
§3 数据集规格
§3.0 版本抉择矩阵
MEPS 按"数据年 + 文件层级 + 专项文件"三维组织,没有单一"全量包"。先选对文件再动手:
| 你的需求 | 推荐文件 | 大小量级 | 理由 |
|---|---|---|---|
| 单年横断面支出/保险建模 | 最新 Full Year Consolidated Data File(2024 年为 HC-256) | 数 MB 至十余 MB | 一个人一行,person 级全变量,直接可用 |
| 小子群(罕见病/低收入细分)需更大样本 | 池化多年 person 级文件 + HC-036/HC-036BRR | 每增一年约增数 MB | 池化提升子群估计精度,但需统一方差结构 |
| 个体跨年变化(保险转换、支出转移) | 纵向文件(最新为 HC-252,Panel 27,2022-2023) | 数 MB | 含 LONGWT 纵向权重,两年文件合并为一体 |
| 处方药利用与费用 | Prescribed Medicines 文件(2024 年为 HC-254A)+ CLNK 联结 | 数 MB | NDC 药名、数量、支付渠道,可联结到人 |
| 就诊/住院/急诊事件明细 | Event Files(2024 年为 HC-254 系列) | 每文件 0.2-3 MB | 事件级 charges 与支付来源,可聚合 |
| 雇主侧保险成本 | IC 仅发布汇总表,无微观 PUF | — | 微观数据不公开,只能用在线表格 |
§3.1 模态详情
MEPS 的"模态"是结构化调查数据。HC 核心:人口学、家庭结构与收入(POVCAT 收入类别)、健康状况与自评、慢病自报标签、医疗利用(门诊/住院/急诊/居家/处方)、费用与支付来源(自付/medicare/medicaid/商保/其他)、就业与保险、就医可及性与满意度;成人附加自填问卷(SAQ,含 PHQ 类抑郁条目等)。MPC 核实:在受访者签署授权后,向报告过的医院、医生、家庭健康机构与药房电话核实就诊日期、诊断/操作、charges 与支付;药房子组件记录 NDC 药名、数量与支付但不收集诊断。IC:向雇主调查保险的类型与成本,每年 list sample 覆盖约 40,000 家企业与政府机构。
§3.1.1 年度文件族一览(2024 数据年为例)
| 文件编号 | 文件名 | 层级 | 核心内容 |
|---|---|---|---|
| HC-256 | 2024 Full Year Consolidated Data File | person | 全年人口学、保险、利用、支出汇总变量 |
| HC-255 | 2024 Medical Conditions File | condition | 自报疾病 + ICD-10/CCSR 编码 |
| HC-254 系列 | 2024 Event Files | event | 门诊/住院/急诊/居家照护事件明细与费用 |
| HC-254A | 2024 Prescribed Medicines File | RX | 处方药购买:NDC、数量、支付渠道 |
| HC-254I | 2024 Event Files 附录 | 联结 | CLNK 处方-事件联结文件等 |
| HC-252 | Panel 27 纵向文件(2022-2023) | person×2 年 | LONGWT 纵向权重,两年变量合并 |
同构文件族每年滚动发布(1996-2024 共 29 套),另有全库通用的 HC-036 池化联结文件与 HC-036BRR 方差复制文件(§6.5 坑点 2、6)。
§3.2 子集与样本量
| 子集 | 规模 | 说明 |
|---|---|---|
| 面板接触 | 约 14,500 户 / 约 35,000 人 | 每面板 5 轮、约 2.5 年 |
| 日历年完成样本 | 目标约 14,500-15,000 户 / 约 37,000-37,500 人 | 由两个面板的相邻轮次拼接出单年估计 |
| 历史演变 | 1996 与 1998-2000 约 10,000 户;1997、2001 约 13,500 户;2002 起约 15,000 户 | 早年样本较小,池化时注意年代差异 |
| IC list sample | 每年约 40,000 机构 | 雇主侧保险调查 |
| 现场力量 | 约 350 名访员、约 200 个初级抽样单元 | 全国概率抽样执行基础 |
§3.3 数据格式
| 格式 | 说明 | 适用人群 |
|---|---|---|
| ASCII(.dat,ZIP) | 固定宽度文本,附 SAS/SPSS/Stata/R 编程语句(colspecs 权威来源) | 所有用户;R/Stata 用户的推荐绕行格式(坑点 5) |
| SAS transport | 2018 起为 CPORT 过程生成的 .ssp,R/Stata 不能直读 | 仅 SAS(需 CIMPORT) |
| SAS V9 | 原生 sas7bdat 文件 | pandas.read_sas / haven::read_sas 直读 |
| Stata | .dta(旧年代文件无此格式) | Python 的 pyreadstat、Stata 用户 |
| XLSX | 便于预览,大文件可达数十 MB | 快速浏览,不建议建模用 |
§3.4 存储大小
以已核实的发布页数据为例:HC-252(Panel 27 纵向文件)ASCII ZIP 3.7 MB、SAS transport ZIP 4.5 MB、SAS V9 ZIP 4.7 MB、Stata ZIP 3.5 MB、XLSX ZIP 59 MB,codebook PDF 11 MB;HC-201(2017 Full Year Consolidated)ASCII ZIP 8.8 MB、SAS V9 ZIP 12 MB、Stata ZIP 13 MB、XLSX ZIP 81 MB;小型事件文件(如 HC-220C 其他医疗支出)ASCII ZIP 仅 0.2 MB。完整研究(多年池化含事件/处方文件)预留 1-2 GB 磁盘即可,无需 GPU 存储。
§3.5 标注方式
MEPS 的"标注"分三层:第一层人工访谈——受训访员以 CAPI/CAVI 执行结构化问卷,软件内置取值范围与跳转逻辑校验;第二层提供者核实——MPC 电话回访医院/医生/药房校正家庭报告的费用;第三层统计插补——缺失支出用预测均值匹配(PMM)插补,AHRQ 自身已验证用机器学习(梯度提升、随机森林、深度神经网络、堆叠集成)替代 OLS 可将插补质量显著提升(R² 提升 108%-227%,见 §8.5)。对建模者来说关键认知是:文件中的支出变量已是"核实+插补"后的产物,并非纯观测值。
§3.6 报告者资质与一致性
每户数据由单一家庭受访者代报,存在代理报告误差(对配偶/子女的就诊与病情记忆偏差),这是调查类数据的固有属性而非缺陷。访员方面,新访员经一周培训上岗,约 350 人分布约 200 个初级抽样单元;Blaise CAPI 问卷约 50 个节、平均单次访谈约 90 分钟。由于是单一报告者模式,MEPS 不适用"多标注者一致性(kappa)"框架;官方以应答率(全年核心约 66%)与插补质量报告代替。
§3.7 采集周期
每个面板 5 轮访谈,间隔约 6 个月,覆盖 2 个完整日历年;每年上一个面板收尾、新面板启动,形成滚动设计。日历年 N 的完整估计由"N 年属 Round 3-5 的面板 + N 年属 Round 1-3 的面板"拼接而成(2020 年起个别年份出现三个面板并存)。单轮访谈后数据即回传编辑,全年数据在编辑与插补完成后分阶段发布汇总报告、微观文件与汇总表。
§3.8 地域覆盖
覆盖美国本土及 DC 的平民非机构人口,抽样地理单元为约 200 个初级抽样单元;不覆盖军队、海外与机构人口(养老院/长期住院)。由于与 NHIS 共用抽样框,城市/农村与区域分布具有全国代表性;州级估计仅在部分大州可行,官方另提供区域级汇总表。
§3.9 采集工具规格
- CAPI 主力:Blaise 编程的计算机辅助面访,约 50 个问卷节、逾 1,000 页纸质等价物,平均约 90 分钟
- 辅助模式:COVID 后引入 CAVI(视频)与电话访谈,按效率混合分派
- 质量工具:内置医疗提供者目录检索、常见疾病/药品检索字典,减少录入歧义
- 补充自填:成人 SAQ(web/纸质),含健康状态、抑郁条目、就医体验
§3.10 深度溯源链
NCHS NHIS(抽样框,应答家庭)→ AHRQ 保留面板中抽取 MEPS 子样本 → Westat 执行 HC 五轮访谈(约 2.5 年)→ 受访者授权后 RTI 执行 MPC 提供者/药房核实 → 支出缺失以 PMM(提供者数据优先作 donor)插补 → 按《公共卫生服务法》保密条款脱敏编辑 → 以 HC-xxx PUF 在 meps.ahrq.gov 公开发布(ASCII/SAS/Stata/XLSX + codebook + 编程语句)。每一环节均可通过官方 Methodology Report 系列追溯。
§4 数据结构
§4.0 目录树
以下为"某数据年 person 级 Consolidated 文件"(以 2024 年 HC-256 为例,编号 h256)从官网下载解压后的典型内容;不同文件类型后缀略有差异(p=person、e=event、c=condition、a=RX 类,以官方下载页为准):
meps_h256/
├── h256doc.pdf # 主文档:研究设计、变量来源、合并指南
├── h256cb.pdf # Codebook(PDF 版,另有数据库驱动 HTML 版)
├── h256p.zip # person 级数据文件(ZIP 容器)
│ ├── h256p.dat # ASCII 固定宽度数据(.dat)
│ ├── h256ssp.zip # SAS transport(CPORT .ssp,2018 起勿直读)
│ ├── h256sas.zip # SAS V9(sas7bdat)
│ ├── h256sta.zip # Stata(.dta)
│ └── h256xlsx.zip # XLSX 预览版
├── h256p_sas.txt # SAS 编程语句(读取/标注 .dat 的权威 colspecs)
├── h256p_spss.txt # SPSS 编程语句
├── h256p_stata.do # Stata 编程语句
└── h256p_R.r # R 编程语句(haven/foreign 读取指引)
配套文件族(同年份通常还包括):event 级文件(office-based、hospital outpatient、ER、inpatient stay、home health、other medical items)、Prescribed Medicines 文件、Medical Conditions 文件(含 ICD-10/CCSR)、CLNK 事件-处方联结文件,以及全库通用的 HC-036 池化联结文件与 HC-036BRR 方差复制文件。
§4.1 DAIMS 核心字段字典(person 级 Consolidated 文件)
变量名规则:除 PANEL 等常量外,多数变量带 2 位年份后缀(如 2024 年的 DUPERSID24、TOTEXP24、PERWT24F;2005 年起面板变量固定为 PANEL)。下表以后缀
xx表示任意数据年。
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差来源 | 信息性缺失编码 | 取值范围/备注 |
|---|---|---|---|---|---|---|---|
| DUPERSIDxx | Text | 人员唯一 ID(乱码化),跨年文件中同一人 ID 相同 | 2320001101 | 主键;池化/纵向合并;防泄漏分组键 | 无(系统生成) | 无缺失 | 面板号+序号拼接 |
| PANEL | Integer | 面板编号(2005 起无年份后缀) | 28 | 识别样本代次;池化去重 | 无 | 无缺失 | 1-28+ |
| PERWTxxF | Float | person 级全年抽样权重(外推至全国人口) | 15420.6 | 全国代表性估计必须加权 | 无应答调整+事后分层 | 无缺失 | 正实数 |
| AGELAST | Integer | 调查期末年龄 | 47 | 年龄特征/分层 | 自报 | 无缺失 | 0-85+ |
| SEX | Integer | 性别 | 1 | 特征;公平性审计 | 自报 | 无 | 1=男 2=女 |
| RACETHNX | Text | 种族/西裔(合并类别) | HISPANIC | 公平性分群 | 自报 | 无 | 分类变量 |
| POVCATxx | Integer | 家庭收入相对贫困线类别 | 2 | 社会经济特征;分层加权 | 自报+推算 | 负值 | 1-5(另有负值缺失码) |
| HIBPDX/DIABDX 等 | Integer | 慢病自报诊断(1=是 2=否) | 1 | 疾病特征/标签 | 回忆+代理报告偏差 | 负值缺失码 | 1/2,负值=缺失 |
| TOTEXPxx | Float | 年度医疗总支出(核实+插补后) | 3820.5 | 回归目标(右偏,配合 TOTSLF 等) | 家庭报告+MPC 核实+PMM 插补 | 无负值(插补后) | ≥0,右偏 |
| TOTSLFxx | Float | 年度自付支出 | 610.2 | 自付负担分析 | 同上 | 无 | ≥0 |
| VARSTR / VARPSU | Integer | 方差估计分层/整群变量 | 134 / 2041 | 设计正确方差估计必用 | 设计变量 | 无 | 逐年含义见 codebook |
§4.1.1 事件级与处方级关键字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差来源 | 信息性缺失编码 | 取值范围/备注 |
|---|---|---|---|---|---|---|---|
| EVNTIDX | Text | 事件唯一 ID(每次就诊/住院/急诊/居家照护一行) | 232100210012 | 事件聚合到 person 的主键 | 系统生成 | 无缺失 | 全局唯一 |
| DUPERSID | Text | 事件所属人员 ID | 2320001101 | 与 person 文件联结键 | 系统生成 | 无缺失 | 同 §4.1 |
| EVENTRN | Integer | 同一人员的第几次事件 | 3 | 事件序列/时间排序 | 系统生成 | 无 | ≥1 |
| VISTYPE / ASPTYPE | Integer | 就诊类型/场所细分 | 1 | 场所分层建模 | 访谈判定 | 无 | 分类 |
| TOTSLF / TOTMCR / TOTMCD / TOTPRV | Float | 事件级分支付来源金额 | 85.0 | 支付结构拆解 | 家庭报告+MPC 核实+插补 | 无 | ≥0 |
| RXRECIDX | Text | 处方记录唯一 ID | 232100210112 | 处方分析主键 | 系统生成 | 无缺失 | 全局唯一 |
| LINKIDX | Text | 处方↔事件联结 ID(CLNK 亦可用) | 232100210012 | 处方-事件-人三级联结 | 系统生成 | 无缺失 | 对应 EVNTIDX |
| RXNDC | Text | 国家药品代码 NDC | 00071015523 | 药品级特征/品类映射 | 药房核实 | 部分缺失 | 11 位编码 |
§4.2 标签分布特征
支出目标 TOTEXP 的两个结构事实必须进入建模设计。第一,零膨胀:相当比例受访者全年无医疗支出(健康年轻人群大量聚集在 0),直接回归会被零值主导;常用做法是两部分模型(先分类"有无支出/是否高额者",再回归正额)或直接使用 Tweedie/零膨胀损失。第二,极端右偏:少数高额用户(慢病多重共病、住院事件)贡献大部分总支出,均值不等于中位数;评估时建议同时报告加权均值、中位数与分位(如 P90/P99),并注意 AHRQ 文档说明的中位数等复杂估计量宜用 BRR 而非 Taylor 线性化(§6.5 坑点 2)。
动手建模前先"看见"分布(权重版分位数):
def weighted_quantile(x, q, w):
order = np.argsort(x)
x, w = np.asarray(x)[order], np.asarray(w)[order]
cw = np.cumsum(w) - 0.5 * w
cw /= np.sum(w)
return np.interp(q, cw, x)
q = weighted_quantile(pooled["TOTEXP"], [0.5, 0.75, 0.9, 0.99],
pooled["PERWT"])
print("加权 P50/P75/P90/P99:", q) # 观察右偏与高额尾部
print("零支出占比(加权):",
np.sum(pooled["PERWT"] * (pooled["TOTEXP"] == 0))
/ np.sum(pooled["PERWT"]))
§4.3 关键统计
- 数据年覆盖:1996-2024 连续 29 个数据年,每年一套完整文件族
- 单年 person 级样本:目标约 37,000 人;池化 2-4 年后可达 7 万-15 万人,支撑小样本子群
- 文件体积:单文件 ZIP 0.2-59 MB(person 级主文件 3.7-8.8 MB ASCII 量级,XLSX 可达 59-81 MB)
- 权重总和:PERWTxxF 求和约等于当年美国平民非机构人口(权重外推口径,池化时须除以年数,坑点 6)
- 应答率:全年核心访谈一般约 66%;近期面板 Round 1 约 65%
§4.4 数据层级
Panel(面板,2 年 5 轮)
└── Household(户)—— 同户成员共享家庭变量(聚集!)
└── Person —— DUPERSID 主键;person 级 Consolidated 文件
├── Event —— 每次就诊/住院/急诊/居家照护一行(EVNTIDX 主键)
│ └── Prescribed Medicine —— RXRECIDX 主键,LINKIDX 联结事件与人员
└── Condition —— CONDIDX 主键,自报疾病 + ICD-10/CCSR
合并方向:事件/条件/处方文件通过 DUPERSID(+ 事件文件的 EVNTIDX、RX 的 LINKIDX)联结回 person 文件;跨年合并时因变量名带年份后缀(TOTEXP17 vs TOTEXP03F),需按官方映射改名后行拼接(坑点 8)。
# 事件级 → person 级聚合(生成利用特征)
def event_features(events: pd.DataFrame, person_keys: pd.DataFrame):
agg = (events.groupby("DUPERSID")
.agg(n_events=("EVNTIDX", "count"),
ev_tot=("TOTSLF", "sum"))) # 事件级自付合计
return person_keys.merge(agg, on="DUPERSID", how="left").fillna(
{"n_events": 0, "ev_tot": 0.0})
# 处方 ↔ 事件 ↔ 人 三级联结(RXRECIDX→LINKIDX→EVNTIDX/DUPERSID)
def link_rx(rx: pd.DataFrame, events: pd.DataFrame):
return rx.merge(events[["EVNTIDX", "DUPERSID"]],
left_on="LINKIDX", right_on="EVNTIDX", how="left")
§4.5 缺失值与信息性缺失编码
MEPS 的分类变量用负值编码缺失原因——这不是错误数据,而是"为什么缺"的元信息(信息性缺失):
| 编码 | 含义 | 建模处理建议 |
|---|---|---|
| -1 | INAPPLICABLE(不适用,跳转逻辑未问) | 保留为独立类别或按结构缺失处理 |
| -7 | REFUSED(拒答) | 信息性强(拒答与非拒答人群系统性不同),保留类别 |
| -8 | DON’T KNOW(不知道) | 保留类别或按自报噪声处理 |
| -9 | NOT ASCERTAINED(未能确定) | 审查其在子群的分布后决定丢弃/保留 |
| 其他负值 | 各文件另有定义 | 一律以该文件 codebook 负值表为准 |
支出类变量(TOTEXP 等)发布前已插补,不出现负值;直接把负值当真值参与均值/训练是最常见的入门错误(坑点 3)。
上线前的负值审计门禁(把"发现即修复"固化为代码):
def audit_negative_codes(df: pd.DataFrame, cat_cols: list[str]) -> dict:
"""返回各列负值占比;负值占比异常升高的列说明读取/改名有 bug(坑点 8)"""
report = {}
for c in cat_cols:
if c in df.columns:
v = pd.to_numeric(df[c], errors="coerce")
report[c] = float((v < 0).mean())
assert max(report.values(), default=0.0) < 0.6, "负值占比异常,检查列对齐"
return report
§5 划分与使用建议
§5.1 官方划分
无。MEPS 是统计调查而非 ML 基准,官方只提供"数据年 + 文件层级"的组织方式,不提供 train/val/test 划分,也不提供官方预处理脚本(仅提供读取数据的编程语句与 GitHub 示例)。
§5.2 社区惯例
- 单年横断面:取最新数据年文件,随机/分层划分;但见 §5.3,纯随机划分在含多年数据时是错的
- 多年池化:为子群功效池化 2-4 个数据年,权重除以年数;划分时按人分组
- 纵向任务:使用 HC-252 类纵向文件,按面板/人划分,避免同一人两年信息分属训练与测试
常见池化组合的适用边界:
| 池化组合 | 典型目的 | 权重处理 | 关键约束 |
|---|---|---|---|
| 单年(如仅 HC-256) | 快速基线、大子群 | 原样使用 | 小子群功效不足 |
| 相邻 2 年 | 常规子群分析 | ÷2 | 必须 DUPERSID 分组(坑点 4) |
| 3-4 年 | 罕见病/低收入细分 | ÷N | 2002-2018 可直接拼方差变量 |
| 10 年(趋势研究) | 长趋势/官方简报风格 | ÷N | 跨 2019 必须 HC-036 统一结构(坑点 2) |
| 含 2020 年 | COVID 敏感性分析 | ÷N | 官方明示谨慎解读(坑点 6) |
§5.3 泄漏风险(重点)
- 同一人跨数据年重复出现(MEPS 特有):面板覆盖 2 个日历年,同一个人(同一 DUPERSID)会同时出现在相邻两年的 Consolidated 文件中。若把 2022+2023 池化后随机划分,同人的两年记录分属 train/test,测试集虚高。必须按
DUPERSID(或 DUPERSID+PANEL)分组划分。 - 家庭聚集:同户成员共享收入、保险与就医环境,特征高度相关;严格设计应按户(家庭 ID)做组级划分,至少在公平性/因果分析中检验户聚集效应。
- 插补信息回流:支出是全样本 PMM 插补产物,插补模型本身使用了全样本协变量关系;极端严格的设计可按"有无插补"做敏感性分析,但对描述性建模通常可接受。
§5.4 交叉验证建议
- 用
GroupKFold/GroupShuffleSplit(groups=DUPERSID);纵向任务 groups=面板-人 - 分层键建议用支出分位数(如是否进入前 10% 高额组),保证每折的高额人群比例稳定
- 折内统计(均值、分位)一律带 PERWT 权重;折间方差解释性报告需叠加设计效应(VARSTR/VARPSU 或 BRR)
- 调参折(val)与最终报告(test)分开;单年样本约 3.7 万人,无需为数据规模担忧过度切分
§5.5 外部验证建议
- NHANES:有客观体测/生化指标,可校验 MEPS 自报慢病标签的外部效度
- NHIS:同源抽样框(NHIS 是 MEPS 的母样本),健康与可及性变量更丰富,适合交叉核对趋势
- HCUP(NIS/KID):住院级真实费用对照,可校验 MEPS 住院支出事件的合理性
- HRS:50 岁以上老龄化队列,校验老年支出与功能状态的跨库一致性
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
MEPS 是轻量结构化数据(单年 person 文件数 MB),本地即可完成全部流程,无云端镜像依赖:任意装有 Python 3.10+/R 4.x 的环境,磁盘预留 1-2 GB(含多年池化与事件文件)足够。Colab/Kaggle Notebook 亦可直接运行本文代码(先通过浏览器将下载页的 ZIP 上传至工作区)。
§6.1 快速上手
# ============================================================
# 目录结构预期(data_root 由你自行组织,本文代码均从 data_root 拼接):
# data_root/
# ├── h256p.zip → 解压后 h256p.dat / h256p.sas7bdat(SAS V9 版)
# └── ...(按需补充 event / RX / condition 文件)
# 最小可用子集:单个数据年的 person 级 Full Year Consolidated 文件
# (如 2024 年 HC-256)即可完成支出预测端到端实验。
# 官方不提供整合包;请从下载页按文件逐个下载(§6.2)。
# ============================================================
import pandas as pd
from pathlib import Path
DATA_ROOT = Path("data_root")
# 推荐路径:下载 "SAS V9 format"(sas7bdat),pandas 可直读(见坑点 5)
df = pd.read_sas(DATA_ROOT / "h256" / "h256p.sas7bdat", format="sas7bdat",
encoding="latin-1")
print(df.shape) # 约为 3 万+ 行 × 数百列
print(df[["DUPERSID24", "AGELAST", "TOTEXP24", "PERWT24F"]].head())
§6.2 数据获取
| 步骤 | 说明 | 链接/要点 |
|---|---|---|
| 1. 定位文件 | 官方下载页按数据年列出全部 PUF 及各格式 ZIP | https://meps.ahrq.gov/data_stats/download_data_files.jsp |
| 2. 选择格式 | 建模用 SAS V9 / Stata / ASCII;XLSX 仅预览 | R 与 Stata 用户勿选 transport 版(坑点 5) |
| 3. 下载 | 右键另存为 ZIP(无需注册、无 license 按钮) | 公有领域,即点即下 |
| 4. 读文档 | 同页 Documentation/Codebook PDF+HTML 与四语言编程语句 | codebook 是负值编码的唯一权威 |
| 5. 方差与池化文件 | 多年池化需 HC-036 / HC-036BRR | 每年更新,见坑点 2、6 |
| 6. 编程示例 | 官方 GitHub 提供 SAS/Stata/R 加载示例 | https://github.com/HHS-AHRQ/MEPS |
# 下载后从 ZIP 解出数据文件的通用工具(不依赖具体 zip 命名)
import zipfile
def extract_first_dat(zip_path: Path, dest: Path) -> Path:
with zipfile.ZipFile(zip_path) as zf:
members = [m for m in zf.namelist() if m.lower().endswith(
(".dat", ".sas7bdat", ".dta", ".xlsx"))]
zf.extract(members[0], dest)
return dest / members[0]
§6.3 预处理全流程
流程:格式载入 → 负值缺失处理 → 特征工程 → 目标构造(两部分)→ 池化权重校正 → 设计变量保留。
# ---------- 1) 载入与负值处理(坑点 3) ----------
import numpy as np
NEG_CODES = {-1, -7, -8, -9} # 常见负值缺失码;以 codebook 为准
CAT_COLS = ["SEX", "RACETHNX", "POVCAT24", "HIBPDX", "DIABDX", "ASTHDX"]
def load_person_year(fp: Path, year: int) -> pd.DataFrame:
suf = str(year)[2:]
df = pd.read_sas(fp, format="sas7bdat", encoding="latin-1")
# 分类列:负值 → "MISSING_x" 信息性类别(不要 drop,也不要当真值)
for c in CAT_COLS:
if c in df.columns:
df[c] = df[c].where(~df[c].isin(NEG_CODES), df[c].astype(object))
df[c] = df[c].astype("category")
# 支出列:发布文件无负值;clip 防御性保底
df["TOTEXP"] = df[f"TOTEXP{suf}"].clip(lower=0)
df["PERWT"] = df[f"PERWT{suf}F"]
df["YEAR"] = year
return df
# ---------- 2) 多年池化(权重除以年数,坑点 6) ----------
def pool_years(dfs: list[pd.DataFrame]) -> pd.DataFrame:
k = len(dfs)
pooled = pd.concat(dfs, ignore_index=True)
pooled["PERWT"] = pooled["PERWT"] / k # 总量类估计必须;比例类不受影响
return pooled
# ---------- 3) 两部分模型目标(零膨胀 + 右偏,§4.2) ----------
pooled["ANY_SPEND"] = (pooled["TOTEXP"] > 0).astype(int)
pooled["LOG_SPEND"] = np.log1p(pooled["TOTEXP"]) # 仅对正额部分回归
# ---------- 4) 特征工程示例 ----------
pooled["N_CHRONIC"] = (pooled[["HIBPDX", "DIABDX", "ASTHDX"]]
.astype(str).isin(["1.0", "1"]).sum(axis=1))
设计正确方差估计(R,池化场景):
# R: survey 包 + HC-036(跨 2019 池化必须,坑点 2)
library(survey)
options(survey.lonely.psu = "adjust")
pooled <- merge(pooled, hc036, by = c("DUPERSID", "PANEL")) # 统一方差结构
des <- svydesign(ids = ~VARPSU, strata = ~VARSTR, weights = ~PERWT,
data = pooled, nest = TRUE)
svymean(~TOTEXP, des) # 全国估计与设计正确标准误
Python 侧没有 survey 包的等价完整实现,加权描述统计可先行落地:
def weighted_mean(x, w):
return np.sum(x * w) / np.sum(w)
def weighted_se_brr(df, value_col, brr_flags, weight_col="PERWT"):
"""BRR 方差估计:brr_flags 为 128 列 0/1 指示(HC-036BRR)
复制权重 = flag × 2 × 权重(Fay 改良可改乘数,坑点 2)"""
ests = []
for flag in brr_flags:
w_rep = np.where(df[flag] == 1, 2.0, 0.0) * df[weight_col]
ests.append(weighted_mean(df[value_col].to_numpy(), w_rep))
ests = np.array(ests)
point = weighted_mean(df[value_col].to_numpy(), df[weight_col].to_numpy())
return point, np.sqrt(((ests - point) ** 2).mean() / 2)
§6.4 PyTorch DataLoader 完整代码
<details>
<summary>点击展开:支出预测的 Dataset / DataLoader(两部分任务,加权损失)</summary>
# ============================================================
# 前置:data_root 下已按 §6.3 生成 pooled DataFrame(单年或多池化)
# 任务:两部分——(a) ANY_SPEND 二分类;(b) 正额 LOG_SPEND 回归
# 要点:PERWT 作为样本权重传入损失;划分按 DUPERSID 分组(坑点 4)
# ============================================================
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
NUM_COLS = ["AGELAST", "N_CHRONIC"]
CAT_COLS = ["SEX", "RACETHNX", "POVCAT24", "HIBPDX", "DIABDX", "ASTHDX"]
class MepsDataset(Dataset):
"""每个样本 = 一名受访者;返回 (数值特征, 类别特征, 分类目标, 回归目标, 权重)"""
def __init__(self, df: pd.DataFrame):
self.x_num = torch.tensor(df[NUM_COLS].to_numpy(np.float32))
self.x_cat = torch.tensor(
pd.get_dummies(df[CAT_COLS]).to_numpy(np.float32))
self.y_cls = torch.tensor(df["ANY_SPEND"].to_numpy(np.float32))
self.y_reg = torch.tensor(df["LOG_SPEND"].to_numpy(np.float32))
# 权重归一化到均值 1,避免 loss 尺度随权重总和漂移
w = df["PERWT"].to_numpy(np.float32)
self.w = torch.tensor(w / w.mean())
def __len__(self):
return len(self.y_cls)
def __getitem__(self, i):
return (self.x_num[i], self.x_cat[i],
self.y_cls[i], self.y_reg[i], self.w[i])
def make_loaders(df: pd.DataFrame, batch_size: int = 256):
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr_idx, te_idx = next(gss.split(df, groups=df["DUPERSID"]))
train_ds = MepsDataset(df.iloc[tr_idx].reset_index(drop=True))
test_ds = MepsDataset(df.iloc[te_idx].reset_index(drop=True))
return (DataLoader(train_ds, batch_size, shuffle=True, num_workers=2),
DataLoader(test_ds, batch_size, num_workers=2))
# 训练循环中的加权损失示例:
# loss = (w * (logits - y_reg) ** 2).mean() # 回归支路
# loss = (w * F.binary_cross_entropy_with_logits(
# logits, y_cls, reduction="none")).mean() # 分类支路
</details>
§6.5 八大坑点
⚠️ 坑点 1:忽略抽样权重做"全国"结论(分类:偏倚陷阱)
问题:MEPS 是概率抽样且对少数族裔与低收入家庭过抽样,不加权直接算均值/训练模型,点估计对全国人口有系统性偏差。
症状:报告的"人均年支出"与 AHRQ 官方 MEPS Trends 简报对不上;子群占比与人口普查口径明显不符。
解决:
- 简单方法:所有描述统计改用加权版本(numpy 按 PERWT 加权均值/分位;pandas
groupby后手动加权)。- 进阶方法:R
survey包建模——svyglm(TOTEXP ~ ..., design = des),des由svydesign(ids=~VARPSU, strata=~VARSTR, weights=~PERWT, nest=TRUE)构成,系数与标准误自动设计正确。- SOTA 方法:ML 场景将权重传入损失(加权 GBT:XGBoost/LightGBM 的
sample_weight;神经网络加权损失,见 §6.4),并对子群指标做加权分解,报告权重前后差异作为稳健性检验。
参考:官方文件明确"Data must be weighted to produce national estimates"(https://meps.ahrq.gov/mepsweb/data_stats/download_data/pufs/h126i/h126idoc.pdf);IPUMS MEPS 方差与权重说明(https://meps.ipums.org/meps/userNotes_variance.shtml)。
⚠️ 坑点 2:方差估计忽略复杂设计或用错池化方差结构(分类:评估误用)
问题:MEPS 分层整群抽样下,普通
std()或朴素 bootstrap 给出的标准误过窄,置信区间与显著性检验失效;池化多年时若方差结构没接对,误差进一步放大。
症状:同一个均值,论文里标准误是官方表格的 1/3;把 1996-2001 或 2019 之后的数据与早年直接 concat 后svymean报错或结果异常。
解决:
- 简单方法:单年分析直接用文件自带的 VARSTR/VARPSU(Taylor 线性化):
svydesign(ids=~VARPSU, strata=~VARSTR, weights=~PERWT, nest=TRUE)。- 进阶方法:池化 2002-2018 各年可直接拼接(共同方差结构);凡涉及 2002 前或 2019 后的池化,先合并 HC-036 Pooled Linkage 文件统一分层/整群编号(该文件每年更新)。
- SOTA 方法:中位数、两分位之比、非线性两部模型等 Taylor 难以处理的估计量,改用 BRR:用 HC-036BRR 的 128 个半样本指示变量构造复制权重
BRR_i × 2 × PERWT(Fay 改良可用 0.5/1.5 乘数),再取复制分布方差。
参考:HC-220E 文档 §4.4(https://meps.ahrq.gov/mepsweb//data_stats/download_data/pufs/h220e/h220edoc.pdf);HC-036BRR 文档(https://meps.ahrq.gov/data_stats/download_data/pufs/h36brr/h36brr18doc.shtml)。
⚠️ 坑点 3:把负值缺失编码当真实数值(分类:预处理陷阱)
问题:MEPS 分类变量用 -1/-7/-8/-9 等负值表示"不适用/拒答/不知道/未能确定",直接进模型会把这些原因码当有序数值或真实类别。
症状:收入类别 POVCAT 出现"负数档位";"平均年龄 41.7 岁"之类的结果被拉低;树模型特征重要性里缺失原因码名列前茅。
解决:
- 简单方法:建模前按 codebook 负值表把负值转 NaN 再丢弃该行(会损失样本并可能引入选择偏差,慎用于子群分析)。
- 进阶方法:保留为"信息性缺失"类别(
MISSING_REFUSED等),树模型天然支持;线性模型用缺失指示变量 + 均值/中位数填充。- SOTA 方法:把缺失机制纳入分析目标——按缺失原因分层比较结局分布,检验信息性缺失假设(MAR/非 MAR),必要时做敏感性分析并披露。
参考:各年 Codebook 的负值编码页(如 https://meps.ahrq.gov/mepsweb/data_stats/download_data_files_detail.jsp?cboPufNumber=HC-256 )。
⚠️ 坑点 4:池化多年数据时同一人跨文件导致泄漏(分类:数据泄漏)
问题:MEPS 面板覆盖 2 个日历年,同一人(相同 DUPERSID)出现在相邻两年的 Consolidated 文件中;多年池化后随机划分 train/test,同人的两年记录一边一半。
症状:测试集指标显著优于单年模型(同人的支出/习惯两年高度相关);线上/换年验证时性能骤降却找不到 bug。
解决:
- 简单方法:
GroupShuffleSplit(groups=df["DUPERSID"])按人划分;划分后train ∩ test 的 DUPERSID 数应为 0写成单元测试。- 进阶方法:更严格的按家庭分组(同户成员特征/结局相关),并按支出分位分层保证各折高额人群比例稳定(§5.4)。
- SOTA 方法:按"数据年"做留出法(如训练 ≤2022、测试 2023),直接度量时间外推能力;再叠加人级分组 CV 作为方差下界参考,双口径报告。
参考:面板 2 年 5 轮设计(https://sam.gov/opp/ffee7c5e4f014b069bed9a736b2176ff/view);HC-252 纵向文件说明(https://meps.ahrq.gov/data_stats/download_data_files_detail.jsp?cboPufNumber=HC-252)。
⚠️ 坑点 5:SAS transport(.ssp)文件 R/Stata 读不了(分类:工程陷阱)
问题:2018 年起 MEPS 的 SAS transport 文件改用 CPORT 过程生成,R(haven)与 Stata 不能直接读取,下载后第一时间撞墙。
症状:haven::read_xpt("h256p.ssp")报"invalid file";Stataimport sasxport失败;只有 SAS 能用proc cimport恢复。
解决:
- 简单方法:改下载同页的 ASCII(.dat)+ R/Stata 编程语句,用固定宽度读取(R
readr::read_fwf/ pandasread_fwf,colspecs 取自官方语句)。- 进阶方法:改下载 SAS V9(sas7bdat) 或 Stata(.dta) 版本:
pd.read_sas(fp, format="sas7bdat")/haven::read_sas()直读,一分钟开工。- SOTA 方法:团队级统一用官方 GitHub 的加载脚本封装一层
load_meps(year, level)工具函数,锁定格式选择与列名后缀处理(联动坑点 8),CI 中对不同数据年做读取冒烟测试。
参考:HC-205 下载页官方说明"cannot be read directly into R or Stata"(https://meps.ahrq.gov/mepsweb/data_stats/download_data_files_detail.jsp?cboPufNumber=HC-205);官方示例仓库 https://github.com/HHS-AHRQ/MEPS 。
⚠️ 坑点 6:池化时权重不除以年数 / 无视 2020 年断点(分类:偏倚陷阱)
问题:单年权重把样本外推到"该年人口";合并 N 年后仍用原权重,总量与标准误整体放大 N 倍。同时 2020 年因 COVID 采集模式剧变,官方明确提示池化需谨慎。
症状:池化两年后"全国总支出"变成官方年度值的两倍;2020-2022 池化模型在保险与利用特征上系数跳变。
解决:
- 简单方法:池化 N 年 →
PERWT / N再做一切估计(比例类估计不受影响但除也无害)。- 进阶方法:在模型中加入年份固定效应与 2020 交互项,检验 COVID 断点;预算类结论只在剔除 2020 或加虚变量后给出。
- SOTA 方法:对 2020 做两套口径(含/不含)的预注册式敏感性分析;纵向任务改用 LONGWT 的官方纵向文件(如 HC-252),避免手工重构权重。
参考:HC-036BRR 文档 §4.0(https://meps.ahrq.gov/mepsweb/data_stats/download_data/pufs/h036brr/h36brr19doc.pdf);HC-220E 池化警告(https://meps.ahrq.gov/mepsweb//data_stats/download_data/pufs/h220e/h220edoc.pdf)。
⚠️ 坑点 7:把 TOTEXP 当纯观测标签——它含插补与核实成分(分类:标签理解)
问题:发布文件中的支出已是"家庭报告 + MPC 提供者核实 + PMM 插补"的混合产物;把它当作纯净 ground truth 解读模型残差会误判误差来源。
症状:对"插补 donor 密集区"的样本残差偏小、对极小额事件残差偏大;与临床账单数据库对账时发现系统级差异,误以为是模型 bug。
解决:
- 简单方法:在结果中明确标注"TOTEXP 为插补后官方变量";不要用家庭自报费用自行"纠正"它。
- 进阶方法:两套目标对比——官方 TOTEXP vs 自建"事件级求和"(事件文件汇总到人),差异分布即插补/核实效应的代理。
- SOTA 方法:按 McClellan 等(2023)的思路自训插补层(ML-in-PMM),在"原始 donor 池"上重插补并与官方对比,量化标签不确定度后传播到下游模型评估。
参考:官方插补方法与 ML 插补验证(https://pmc.ncbi.nlm.nih.gov/articles/PMC10012220 ,DOI 10.1111/1475-6773.14115);MPC 定位说明(https://meps.ahrq.gov/data_stats/download_data/pufs/h152g/h152gdoc.shtml)。
⚠️ 坑点 8:变量名带年份后缀,池化拼表列错位(分类:工程陷阱)
问题:多数变量带 2 位年缀(TOTEXP17、PERWT03F、DUPERSID24),2005 年起 PANEL 又无后缀;不同数据年列名不一致,
pd.concat/rbind会静默产生错位或全空列。
症状:池化 1997+2003 后 TOTEXP 一列一半为 NaN;用 1997 年代码读 2003 年文件报"列不存在";BRR 合并键漏掉 PANEL 导致权重错配。
解决:
- 简单方法:写映射函数统一改名(
TOTEXP{suf} → TOTEXP、PERWT{suf}F → PERWT),concat 前断言"关键列全存在且无全空列"。- 进阶方法:维护一份"数据年 × 文件 × 变量映射表"(从各年 codebook 抽取),版本化入库;HC-036BRR 文档给出了跨年改名的官方示例(WTDPER96 → PERWT03F 之类)可直接抄。
- SOTA 方法:用
frictionless/JSON Schema 描述每年文件结构,CI 里对 1996-2024 全数据年做"读取-改名-池化-行数守恒"回归测试,任何 AHRQ 重发布(如 HC-199 的 2022 年重发布)触发重跑。
参考:HC-036BRR 文档变量改名与合并指南(https://meps.ahrq.gov/data_stats/download_data/pufs/h36brr/h36brr18doc.shtml);HC-199 重发布说明(https://meps.ahrq.gov/mepsweb//data_stats/download_data_files_detail.jsp?cboPufNumber=HC-199&prfricon=yes )。
§6.6 数据增强策略
| 策略 | 评级 | 说明 |
|---|---|---|
| 特征派生(共病计数、年龄平方、支付来源占比) | ✅ 安全 | 不改变统计结构,仅信息重表达 |
| log1p 支出变换 / 两部分目标重构 | ✅ 安全 | 与右偏零膨胀分布匹配(§4.2) |
| 折内标准化(用训练折统计量) | ✅ 安全 | 防止测试集统计量泄漏 |
| 按权重重采样(smote/过采样少数子群) | ❌ 危险 | 破坏抽样概率结构,全国估计失效;加权损失替代 |
| 对个体加高斯噪声"造数据" | ❌ 危险 | 调查变量多为离散/分类,噪声产生不存在的组合 |
| 跨面板拼接但不改权重/方差变量 | ❌ 危险 | 同时踩坑点 2 与坑点 6 |
§6.7 模型推荐
| 模型 | 适用任务 | 理由 | 注意点 |
|---|---|---|---|
| 加权 GBT(XGBoost/LightGBM) | 支出/利用预测 | 表格 SOTA,sample_weight 直接吃 PERWT |
按 DUPERSID 分组 CV(坑点 4) |
| 两部分模型(Logit + 加权回归) | 支出零膨胀结构 | 与 §4.2 分布特征匹配,可解释 | 正额部分注意 log 尺度 |
| svyglm(R survey) | 全国推断与政策估计 | 设计正确标准误 | 中位数等估计量用 BRR(坑点 2) |
| 堆叠集成(Staked Ensemble) | 插补改进/竞赛级精度 | 官方 ML 插补研究的最优方案 | 需自建 donor 池,工程量较大 |
| Tweedie GBT | 单阶段支出建模 | 兼容零值与连续正额 | 损失参数 p 需调优 |
| 加权浅层 MLP / TabNet | 表格深度基线 | 学术对比常见 | 小表格数据上通常不敌 GBT,需加权损失 |
§6.8 硬件需求
| 配置 | 要求 | 说明 |
|---|---|---|
| CPU | 4 核即可 | 单年 3.7 万行、数百列,pandas/sklearn 全程无压力 |
| 内存 | ≥8 GB | 池化 4 年 + 事件文件聚合 <2 GB |
| GPU | 非必需 | 表格模型 CPU 即可;深度模型一张入门卡足够 |
| 磁盘 | 1-2 GB | 全部 29 个数据年 person 级文件 <1 GB |
§6.9 评估指标代码
# 加权评估:与官方口径一致(权重 PERWT + 分组测试集)
import numpy as np
def weighted_metrics(y_true, y_pred, w):
wm = lambda a: np.sum(a * w) / np.sum(w)
mae = np.sum(np.abs(y_true - y_pred) * w) / np.sum(w)
rmse = np.sqrt(np.sum((y_true - y_pred) ** 2 * w) / np.sum(w))
ybar = wm(y_true)
r2 = 1 - np.sum((y_true - y_pred) ** 2 * w) / np.sum((y_true - ybar) ** 2 * w)
return {"wMAE": mae, "wRMSE": rmse, "wR2": r2}
# 分类支路:加权 AUC / 高额人群(如支出前 10%)召回
from sklearn.metrics import roc_auc_score
def top_decile_recall(y_true, score, w, q=0.9):
thr = np.quantile(y_true, q)
top = y_true >= thr
order = np.argsort(-score)
k = int(round(q * len(score))) # 预测的前 10%
pred_top = np.zeros_like(top); pred_top[order[:k]] = True
return np.sum(top & pred_top) / np.sum(top) # 无加权版,加权版按 w 聚合
校准与子群公平性(回归任务的选型依据):
def calibration_table(y_true, y_pred, w, bins=10):
"""按预测分位分桶,输出加权预测/实际均值——看高估还是低估尾部"""
order = np.argsort(y_pred)
splits = np.array_split(order, bins)
rows = []
for s in splits:
rows.append({
"pred_wmean": weighted_mean(y_pred[s], w[s]),
"true_wmean": weighted_mean(y_true[s], w[s]),
})
return pd.DataFrame(rows)
def subgroup_wmae(y_true, y_pred, w, group):
"""按种族/收入类别分组的加权 MAE——公平性审计起点"""
y_true, y_pred, w = map(np.asarray, (y_true, y_pred, w))
out = {}
for g in pd.unique(group):
m = np.asarray(group) == g
out[g] = np.sum(np.abs(y_true[m] - y_pred[m]) * w[m]) / np.sum(w[m])
return out
§6.10 MLOps 笔记
| 环节 | 做法 | MEPS 特有注意点 |
|---|---|---|
| 数据版本 | HC-xxx 编号 + 发布月作为数据集 tag(如 meps-hc256-2025) |
AHRQ 偶有重发布(HC-199 曾于 2022-11 重发布),需固定编号+月份 |
| 质量门禁 | 负值审计(§4.5)、分组泄漏断言、权重总和守恒写入 CI | 权重总和随池化年数变化,断言按 ÷N 后口径(坑点 6) |
| 漂移监控 | 监控各数据年加权利率/支出均值/慢病患病率偏移 | 已知漂移源:NHIS 抽样框更新、2020 COVID、CAVI 引入(§7.6) |
| 可复现 | 锁定 codebook 版本与编程语句文件;记录 VARSTR/VARPSU 口径 | 跨 2019 池化必须记录 HC-036 版本(坑点 2) |
| 发布合规 | 衍生数据/模型卡注明来源与 PHS Act 308(d) 统计用途 | 引用 AHRQ + 具体文件编号(§9.3) |
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 自报/代理报告偏差 | 全户由单一受访者代报,就诊与病情记忆有误 | 中 | MPC 提供者核实 + PMM 插补校正支出 |
| 无应答偏差 | 全年核心应答率约 66%,失访/拒答非随机 | 中 | 事后分层 raking 调权;子群结论附稳健性检验 |
| 覆盖缺口 | 不含养老院/长期机构/军队/海外人口 | 中 | 明确结论适用范围;老年机构人群改用其他数据源 |
| 过抽样设计偏差 | 黑人/西裔/亚裔/低收入户过抽样 | 低(有意设计) | 加权后恢复全国代表性;无权重分析会放大偏差 |
| 插补不确定 | 支出缺失由 PMM 填充,单套插补值 | 低-中 | 敏感性分析;官方 ML 插补研究持续改进 |
| COVID 断点 | 2020 年采集模式剧变,官方提示池化谨慎 | 高(仅涉 2020) | 年份固定效应/剔除 2020 敏感性分析(坑点 6) |
§7.2 标注质量
MEPS 无"标注者一致性"概念,质量由三层机制保证:CAPI/Blaise 问卷内置范围与跳转校验(约 50 节、平均 90 分钟访谈);MPC 药房与提供者电话核实校正家庭报告;支出缺失经 PMM 插补,AHRQ 已用同行评审研究验证 ML 替代 OLS 可显著提升插补质量(见 §7.8)。疾病标签(DIABDX 等)为自报诊断,与临床确认存在已知差异,用于费用建模通常可接受,用于临床精度任务需外部队列确认。
§7.3 泛化性
| 场景 | 失效风险 | 证据/说明 |
|---|---|---|
| 平民非机构人口内的全国推断 | 低 | 官方设计目标,权重+设计变量下成立 |
| 机构/军人/海外人群 | 高 | 明确不在覆盖范围,禁止外推 |
| 单州/次州级估计 | 中-高 | 抽样按全国/区域设计,多数州样本不足 |
| 其他国家 | 高 | 支付制度完全不同,仅方法学可迁移 |
| 2020 年前后趋势外推 | 中 | COVID 断点(坑点 6);NHIS 抽样框更新 |
| 儿童与老人细分子群 | 中 | 需多年池化提升功效(§3.0) |
§7.4 伦理
数据属公有领域,但发布依据《公共卫生服务法》308(d)/903©:仅限统计报告与分析;禁止任何再识别尝试;禁止与 MEPS/NHIS 之外的可识别记录联结。对 AI 研究,这意味着禁止构建试图还原受访者身份的模型或特征组合;发布衍生数据集时必须保持官方脱敏水平。
§7.5 公平性
MEPS 对黑人、西裔、亚裔与低收入家庭有意过抽样,使子群分析具备足够统计功效——这是其对公平性审计的独特价值(多数 EHR 数据库少数族裔样本不足)。配套提供种族/西裔合并类别、收入贫困线类别(POVCAT)与保险状态变量。注意:任何公平性结论必须在加权后得出(坑点 1),否则过抽样本身会扭曲子群指标。
§7.6 数据漂移
已知漂移源:NHIS 抽样框周期性更新(如 2006、2016、2023 设计变更传导至 MEPS 样本);2018 transport 格式与 2019 方差结构变更;2020 COVID 采集模式变化(官方文档明示);CAVI 等混合模式的持续引入。建议所有跨年模型报告"按数据年分层的性能"而非单一年份结果。
§7.7 DAIMS 数据集质量检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用性 | ✅ | person 级 Consolidated 文件一人一行,数百列即取即用 |
| 2 | 唯一标识 | ✅ | DUPERSID 全局唯一;跨年同人可追踪 |
| 3 | 特殊字符处理 | ⚠️ | ASCII 固定宽度需按官方语句解析;字符变量含空格填充 |
| 4 | 重复行检查 | ⚠️ | 单年文件内无重复;同人跨年出现易被误判为重复(设计使然,坑点 4) |
| 5 | 缺失值编码 | ✅ | 负值原因码体系完备(-1/-7/-8/-9 等) |
| 6 | 标签标识 | ✅ | 支出目标 TOTEXP 及分支付来源命名清晰 |
| 7 | 罕见类别分组 | ⚠️ | 小子群单年功效不足,官方建议池化多年 |
| 8 | 偏倚评估 | ✅ | 应答率、过抽样、非应答调整均有官方方法论报告 |
| 9 | 数据字典 | ✅ | Codebook PDF+HTML 双版,变量来源可追溯 |
| 10 | 信息性缺失解释 | ✅ | 负值即"为何缺失"的元信息,官方文档详述 |
| 11 | 设备记录 | ⚠️ | 不适用:调查微观数据无设备元数据,需注意勿套用影像类检查 |
| 12 | 共线性风险 | ⚠️ | 分支付来源之和=TOTEXP,回归特征需剔除其中之一 |
| 13 | 编码映射 | ⚠️ | ICD-10/CCSR 官方提供;SNOMED/ICD-11 需自行映射(§2.1) |
| 14 | 时间戳处理 | ⚠️ | 粒度为轮次/日历年,事件具体日期信息有限 |
| 15 | 划分建议 | ✅ | 本文 §5 提供分组/池化/纵向三套策略 |
| 16 | 泄漏讨论 | ✅ | 跨年同人泄漏有显式讨论与代码断言(§5.3、坑点 4) |
| 17 | 标签分布 | ✅ | 零膨胀+右偏结构已文档化(§4.2) |
| 18 | 测量偏倚 | ✅ | 自报/代理/MPC 核实三层来源明确标注 |
| 19 | 外部验证建议 | ✅ | §5.5、§7.8 给出外部数据集矩阵 |
| 20 | 版本记录 | ✅ | HC-xxx 编号即版本,发布月可查 |
| 21 | 预处理脚本 | ⚠️ | 官方仅提供读取语句与 GitHub 示例,无端到端 pipeline |
| 22 | 合规要求 | ✅ | 公有领域声明 + 308(d)/903© 使用协议随文件发布 |
| 23 | 多模态对齐 | ⚠️ | RX-事件-人三键联结可行(RXRECIDX/LINKIDX/DUPERSID),需 CLNK 辅助 |
| 24 | 去标识化 | ✅ | 直接标识移除,DUPERSID 乱码化,308(d) 法律约束 |
DAIMS 评分:19.5 / 24(16 项 ✅、8 项 ⚠️、0 项 ❌)
评分解读:MEPS 在"标识、缺失编码、文档、合规"四个维度接近满分,反映联邦统计机构三十年方法论沉淀;失分集中在工程衔接层——固定宽度旧格式、变量名年缀、无官方 pipeline、池化方差结构这些"用起来"的环节,恰好是 ML 工程师而非统计学家的传统盲区。
对你意味着什么:可以直接把 MEPS 当作"统计正确性已背书"的数据源用于全国推断与支出建模;把工程预算花在 §6.5 的八个坑点上(特别是分组划分、权重处理与方差结构),而不是数据清洗本身。若项目需要设备/影像模态或州级精度,它不是合适选择。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ML-in-PMM 插补(2016-2017 MEPS) | AHRQ(官方内部) | 支出插补质量 | 插补 R² +227%(+0.397)、预测 R² +108% | 相对 OLS 基线 | 堆叠集成+按支付向量匹配最优 |
| 自身 2000-2015 池化 | 学术研究(Int J Qual Health Care) | 糖尿病支出预测 | 随机森林建模 | 见 DOI | 慢病标签可支撑疾病特异性费用模型 |
| 头颈癌直接支出估计 | 学术研究(Value Health) | 疾病专项支出估计方法比较 | 方法间一致性 | 见 DOI | 估计方法选择显著影响专项支出结论 |
| NHEA(国民卫生支出账户) | CMS 口径 | MEPS 总支出宏观校对 | 收支平衡调整 | 见引用 | MEPS 与国民账户存在系统性口径差,宏微观各有适用 |
§8 基准性能与生态
§8.1 研究基准表
MEPS 无官方 ML 排行榜;下表汇总已发表、有同行评审支撑的代表性量化结果:
| 排名 | 方法 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Stacked Ensemble(ML-in-PMM) | 插补 R² +227%(+0.397)、预测 R² +108%(+0.156)vs OLS | 2023 | GBM/RF/极端随机森林/DNN 堆叠 + 按支付来源向量匹配 | McClellan C, Mitchell E, Anderson J, Zuvekas S. Health Serv Res. 2023;58(2):423-432. doi:10.1111/1475-6773.14115 | 未公开(AHRQ 内部研究) |
| 2 | Random Forest 支出预测 | MEPS 2000-2015 糖尿病人群费用建模 | 2020 | RF + 调查协变量 | Int J Qual Health Care. 2020;32(2):99-112. doi:10.1093/intqhc/mzz135 | 未公开 |
| 3 | 专项支出估计方法比较 | 头颈癌直接医疗支出多方法对比 | 2014 | 估计方法学 | Value Health. 2014;17(1):90-97. doi:10.1016/j.jval.2013.10.004 | 未公开 |
⚠️ 上表数值不可直接比较:三者目标(插补质量/人群费用/专项估计)、数据年与指标定义均不同;MEPS 研究的"性能"永远相对于其任务与年份,跨论文横向排名无意义。
§8.2 SOTA 总结与选型建议
- 做插补/数据生产:堆叠集成 ML-in-PMM 是当前最强公开方案(官方验证)
- 做人群支出预测:加权 GBT(XGBoost/LightGBM)+ 两部分目标是最实用组合;svyglm 作为可解释基准
- 做政策因果评估:主用设计正确的加权估计(survey 框架),ML 仅作异质性探索
- 一句话:先用 survey 框架守住统计正确性,再用 ML 买精度,顺序不能反。
§8.3 评测协议
- 固定数据年与文件编号(如 HC-256,2025 发布)写进实验配置
- 测试集按 DUPERSID 分组留出(或按年留出,§5.4)
- 所有指标加权(PERWT);全国推断补充设计正确标准误(VARSTR/VARPSU 或 BRR)
- 报告加权 MAE/RMSE/R² + 高额人群召回(前 10%)+ 分年稳定性
- 声明 2020 年是否纳入及处理方式(坑点 6)
结果报告模板(可直接复用):
任务:年度总支出预测(两部分模型)
数据:MEPS HC-256(2024),n≈3.7 万,权重 PERWT24F
划分:按 DUPERSID 分组 80/20(或按数据年留出)
指标(加权,测试集):wMAE / wRMSE / wR² / 前列人群召回
统计口径:VARSTR/VARPSU Taylor(或 HC-036BRR,128 复制)
2020 处理:未涉及 / 已剔除 / 已加年份固定效应
限制:自报标签、PMM 插补标签、非机构人口覆盖
§8.4 相关数据集
| 数据集 | 机构 | 关系 | 联动价值 |
|---|---|---|---|
| NHIS | NCHS | MEPS 母抽样框 | 健康变量更全,可跨库对齐趋势 |
| NHANES | NCHS | 互补(客观体检) | 校验自报慢病标签效度 |
| HRS | 密歇根大学/NIA | 50+ 队列 | 老年支出/功能状态交叉验证 |
| HCUP NIS/KID | AHRQ | 住院行政数据 | 住院费用真实值对照 |
| CEX | BLS | 全品类消费调查 | 医疗消费份额宏观对照 |
§8.5 关键论文 Top 5
- McClellan C, Mitchell E, Anderson J, Zuvekas S. Using machine-learning algorithms to improve imputation in the Medical Expenditure Panel Survey. Health Serv Res. 2023;58(2):423-432. doi:10.1111/1475-6773.14115 — 官方验证 ML 替代 OLS 进入 PMM 插补,堆叠集成使插补 R² 提升 227%。
- Cohen SB. Design strategies and innovations in the Medical Expenditure Panel Survey. Med Care. 2003;41(7 Suppl):III-5-III-12. — MEPS 抽样设计与方法论创新的奠基性概述。
- Sing M, Banthin JS, Selden TM, Cowan CA, Keehan SP. Reconciling medical expenditure estimates from the MEPS and the NHEA, 2002. Health Care Financ Rev. 2006;28(1):25-40. — 界定 MEPS 与国民卫生账户的口径差异,宏观校对必读。
- Int J Qual Health Care. 2020;32(2):99-112. doi:10.1093/intqhc/mzz135 — 用随机森林在 MEPS 2000-2015 池化数据上预测糖尿病人群医疗支出的代表性应用。
- Value Health. 2014;17(1):90-97. doi:10.1016/j.jval.2013.10.004 — 系统比较疾病专项直接医疗支出的估计方法,揭示方法选择对结论的影响。
§8.6 社区活跃度
- 官方 GitHub(HHS-AHRQ/MEPS)持续更新 SAS/Stata/R 加载示例,issue 由 AHRQ 团队响应
- 官方支持邮箱 MEPSProjectDirector@ahrq.hhs.gov,方法论问题直达项目组
- IPUMS MEPS 提供统一变量名的整合版数据,降低跨年成本(方法学与官方 PUF 并行)
- 学术社区以卫生服务研究年会(AcademyHealth)等为主要阵地,无独立排行榜社区
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度 | 推荐理由 |
|---|---|---|---|---|
| MEPS 官网 | 官方门户 | https://meps.ahrq.gov | 持续更新(最新 2025-09 发布) | 全部文件/文档/汇总表入口 |
| HHS-AHRQ/MEPS | GitHub 官方仓库 | https://github.com/HHS-AHRQ/MEPS | 官方维护 | 四语言加载示例,快速起步 |
| MEPS summary tables archive | GitHub 官方仓库 | https://github.com/HHS-AHRQ/MEPS-summary-tables-archive | 官方维护 | 汇总表应用源码(public domain) |
| MEPSnet / MEPS Trends | 在线分析工具 | https://meps.ahrq.gov/mepstrends/home/index.html | 官方维护 | 模型输出的宏观校验目标 |
| IPUMS MEPS | 第三方整合 | https://meps.ipums.org | 持续服务 | 统一变量名与整合面板 |
| HC-036 / HC-036BRR | 方差/池化文件 | 官方下载页 | 每年更新 | 池化正确性必需(坑点 2、6) |
§9 相关资源与引用
§9.1 官方资源
- 官网主页:meps.ahrq.gov
- 数据下载页(按 HC 编号):download_data_files.jsp
- 版权与使用声明(公有领域):copyright.jsp
- 官方编程示例仓库:github.com/HHS-AHRQ/MEPS
- 汇总表应用源码:github.com/HHS-AHRQ/MEPS-summary-tables-archive
- 在线汇总分析:MEPSnet / MEPS Trends(官网导航栏入口)
- 方差估计与池化文件:HC-036 / HC-036BRR(下载页检索编号即可)
- 咨询联系:MEPSProjectDirector@ahrq.hhs.gov(Center for Financing, Access, and Cost Trends, AHRQ, Rockville, MD)
- 第三方整合镜像:IPUMS MEPS
新手上手官方文档的推荐阅读顺序(先读什么、跳过什么):
- 首选某年 Full Year Consolidated 的 Documentation PDF(如 h256doc):A-D 节覆盖背景、样本设计、技术信息与变量来源对照,是理解一切的入口
- 同文件 Codebook(HTML 版可快速检索变量):查负值编码、取值范围、年份后缀
- HC-036BRR 文档:只要做池化/方差估计必读(§6.5 坑点 2、6、8 的官方出处)
- 官方 GitHub 示例:直接抄对应语言的加载代码,避免从零解析固定宽度
- Methodology Report 系列:需要应答率、无应答调整、raking 细节时按年检索
§9.2 BibTeX 引用
@misc{ahrq_meps_hc256,
title = {Medical Expenditure Panel Survey, 2024 Full Year
Consolidated Data File (HC-256)},
author = {{Agency for Healthcare Research and Quality}},
year = {2025},
howpublished = {\url{https://meps.ahrq.gov}},
note = {Rockville, MD: AHRQ}
}
@article{cohen2003design,
author = {Cohen, Steven B.},
title = {Design Strategies and Innovations in the Medical Expenditure
Panel Survey},
journal = {Medical Care},
year = {2003},
volume = {41},
number = {7 Suppl},
pages = {III-5--III-12}
}
@article{mcclellan2023meps,
author = {McClellan, Chandler and Mitchell, Emily and Anderson, Jeffery
and Zuvekas, Steven},
title = {Using Machine-Learning Algorithms to Improve Imputation in the
Medical Expenditure Panel Survey},
journal = {Health Services Research},
year = {2023},
volume = {58},
number = {2},
pages = {423--432},
doi = {10.1111/1475-6773.14115}
}
@article{sing2006reconciling,
author = {Sing, Merrill and Banthin, Jessica S. and Selden, Thomas M.
and Cowan, Cathy A. and Keehan, Sean P.},
title = {Reconciling Medical Expenditure Estimates from the {MEPS} and
the {NHEA}, 2002},
journal = {Health Care Financing Review},
year = {2006},
volume = {28},
number = {1},
pages = {25--40}
}
§9.3 引用指南
AHRQ 要求:基于 MEPS 数据的任何发表请引用 AHRQ 与 MEPS 作为数据来源,并指明具体 HC-xxx 文件编号与数据年。推荐句式:"Data are from the 2024 Full Year Consolidated Data File (HC-256), Agency for Healthcare Research and Quality, Medical Expenditure Panel Survey (meps.ahrq.gov)。"研究设计问题可引用官方 Methodology Report 系列(官网 Methods 区可检索各年报告)。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型列表
| 用途 | 模型类型 | 说明 |
|---|---|---|
| 初稿撰写与结构化 | 大语言模型(对话式 LLM) | 按本站 Schema/宪法规范生成初稿 |
| 代码生成辅助 | 代码 LLM | §6 代码示例的生成与走查 |
| 事实核查辅助 | 联网检索 LLM | §11 检索规范下交叉验证关键数字 |
§10.2 AI 参与范围
AI 完成初稿撰写、代码起草、格式规范化与一致性检查;全部关键数字(样本量、应答率、文件大小、方差机制、基准结果)均溯源至 §10.3 列出的官方/同行评审来源并经人工核对;医学映射(ICD-11/SNOMED)由编辑部按标准术语核对;最终结构与结论由人工审定。
§10.3 输入来源列表
- Agency for Healthcare Research and Quality. MEPS 官网. https://meps.ahrq.gov
- AHRQ Data Tools 总览(MEPS 定位描述). https://www.ahrq.gov/data/index.html
- MEPS Copyright Notice(公有领域声明). https://meps.ahrq.gov/mepsweb/copyright.jsp
- MEPS-HC/MPC 数据使用协议与背景(HC-144A 文档). https://meps.ahrq.gov/mepsweb/data_stats/download_data/pufs/h144a/h144adoc.pdf
- MEPS-HC 背景/样本设计(HC-126I 文档). https://meps.ahrq.gov/mepsweb/data_stats/download_data/pufs/h126i/h126idoc.pdf
- MPC/Pharmacy 组件说明(HC-152G 文档). https://meps.ahrq.gov/data_stats/download_data/pufs/h152g/h152gdoc.shtml
- AHRQ-24-10004 采购公告(面板/访员/CAPI 细节). https://sam.gov/opp/ffee7c5e4f014b069bed9a736b2176ff/view
- OMB Supporting Statement Part B(样本量与应答率目标). https://omb.report/icr/201412-0935-002/doc/52554902
- NCBI Bookshelf, Health, United States 附录 I(历史样本量/应答率/前身调查). https://www.ncbi.nlm.nih.gov/books/NBK20998/
- MEPS HC-252 Panel 27 纵向文件页. https://meps.ahrq.gov/data_stats/download_data_files_detail.jsp?cboPufNumber=HC-252
- MEPS HC-205 页(CPORT 格式说明). https://meps.ahrq.gov/mepsweb/data_stats/download_data_files_detail.jsp?cboPufNumber=HC-205
- MEPS HC-220C 事件文件页(格式与三面板说明). https://meps.ahrq.gov//data_stats/download_data_files_detail.jsp?cboPufNumber=HC-220C
- MEPS HC-220E 文档(方差结构/BRR/池化警告). https://meps.ahrq.gov/mepsweb//data_stats/download_data/pufs/h220e/h220edoc.pdf
- MEPS HC-036BRR 文档(128 复制权重/权重除以年数/变量改名). https://meps.ahrq.gov/data_stats/download_data/pufs/h36brr/h36brr18doc.shtml 、 https://meps.ahrq.gov/mepsweb/data_stats/download_data/pufs/h036brr/h36brr19doc.pdf
- McClellan C, et al. Health Serv Res. 2023;58(2):423-432. doi:10.1111/1475-6773.14115. https://pubmed.ncbi.nlm.nih.gov/36495183/
- Int J Qual Health Care. 2020;32(2):99-112. doi:10.1093/intqhc/mzz135. https://pubmed.ncbi.nlm.nih.gov/32159759/
- Value Health. 2014;17(1):90-97. doi:10.1016/j.jval.2013.10.004
- IPUMS MEPS 权重与方差用户指南. https://meps.ipums.org/meps/userNotes_variance.shtml
- GitHub: HHS-AHRQ/MEPS 与 MEPS-summary-tables-archive(public domain 声明). https://github.com/HHS-AHRQ/MEPS
- Taylor 线性化与 BRR 方法比较论文. https://www.academia.edu/122139116/
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter / schema_org / INFOBOX | 千方病案医学编辑部 | 对照宪法逐字段核对 + URL 占位检查 | ✅ 已通过/已验证 |
| §0 信任声明与免责 | 千方病案医学编辑部 | 逐字核对三段免责 + 利益冲突声明 | ✅ 已通过/已验证 |
| §1 概览与对比表 | 千方病案医学编辑部 | 数字溯源核对(sam.gov/omb/NCBI) | ✅ 已通过/已验证 |
| §2 医学背景与术语映射 | 千方病案医学编辑部 | ICD-11/SNOMED 标准术语核对 | ✅ 已通过/已验证 |
| §3 规格与文件体系 | 千方病案医学编辑部 | 官方下载页逐文件核对 | ✅ 已通过/已验证 |
| §4 数据结构与 DAIMS 字段字典 | 千方病案医学编辑部 | codebook/官方文档比对 | ✅ 已通过/已验证 |
| §5 划分与泄漏分析 | 千方病案医学编辑部 | 面板设计文档复核 | ✅ 已通过/已验证 |
| §6 AI 就绪指南与 8 坑点 | 千方病案医学编辑部 | 代码走查 + 坑点溯源官方文档 | ✅ 已通过/已验证 |
| §7 质量评估与 DAIMS 24 项 | 千方病案医学编辑部 | 逐项复核 + 评分核算 | ✅ 已通过/已验证 |
| §8 基准与生态 | 千方病案医学编辑部 | 论文 DOI 与引用信息核对 | ✅ 已通过/已验证 |
| §9 引用块 | 千方病案医学编辑部 | BibTeX 语法与字段核对 | ✅ 已通过/已验证 |
| §C JSON-LD | 千方病案医学编辑部 | 与 frontmatter 序列化一致性核对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页全部章节由 AI 起草初稿并经人工交叉审核后发布;其中 §6 代码示例与 §6.5 坑点为 AI 基于 §10.3 官方来源整理,代码未在 MEPS 全量数据上端到端复跑,使用前请按 §6.1 目录约定自行验证。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
§C 结构化数据(JSON-LD)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- hcup-nis — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
- cms-de-synpuf — 共享标签:公共卫生与流行病学 / 卫生服务研究 / 医保理赔
- nhis-nhid — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔
- marketscan — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔
- seer-medicare — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔
- premier-pinc-ai — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔
- CHARLS — 共享标签:公共卫生与流行病学 / 电子健康记录 / 调查数据
- cms-medicare-lds — 共享标签:公共卫生与流行病学 / 卫生服务研究 / 医保理赔
- ices-ontario — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究
- HealthData-gov — 共享标签:公共卫生与流行病学 / 医保理赔
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

