CMS Medicare LDS — 全美医保理赔研究金标准 AI-Ready Wikipedia

覆盖约 6,760 万受益人的美国联邦医保理赔有限数据集

来源 Centers for Medicare & Medicaid Services (CMS) url: https://www.cms.gov/data-research/cms-data/data-available-researchers发布时间: 2026-09-15最后更新: 2026-09-25 阅读 36
CMS Medicare LDS — 全美医保理赔研究金标准 AI-Ready Wikipedia

信息速览

数据集名称CMS Medicare LDS — 全美医保理赔研究金标准 AI-Ready Wikipedia
数据类型5%/100% 两档抽样,约 6,760 万受益人总体(2024),8 类 SAF 理赔文件族,付费申请获取(DUA),覆盖 1999 年起年度更新
规模全体 Medicare 受益人约 6,760 万(2024);5% 档抽样约 340 万
接入方式Centers for Medicare & Medicaid Services (CMS) url: https://www.cms.gov/data-research/cms-data/data-available-researchers
AI 就绪度

数据集封面

联邦医保有限数据集(CMS Medicare LDS) — 全美医保理赔研究旗舰 AI-Ready Wikipedia


INFOBOX

数据集名称 联邦医保有限数据集(Claims/Encounter LDS)
英文全称 CMS Medicare Limited Data Set(含 Standard Analytical Files 衍生)
别名/简称 Medicare LDS、Medicare SAF LDS、MBSF LDS、CCW Limited Data Set
疾病分类 全疾病谱老年/残障人群(ICD-11:BA00 原发性高血压 / 5A11 2 型糖尿病 / CB4Z 心力衰竭 / 1G4Z 脓毒症等,详见 §2.1)
SNOMED CT 38341003 Hypertension / 44054006 Diabetes mellitus type 2 / 84114007 Heart failure / 91302008 Sepsis(详见 §2.1b)
数据模态 行政医保理赔(FFS 理赔 + MA encounter)、月度参保登记、诊断/操作编码、支付金额
AI 任务类型 再入院预测、费用预测、慢病表型、医保反欺诈、利用率预测、死亡风险、政策因果评估
样本总数 全体 Medicare 受益人约 6,760 万(2024);LDS 提供 5% 与 100% 两档(Carrier/DME 仅 5%)
数据大小 按文件/年份计价获取,无统一压缩包体;单文件年费 $100-$7,000(官方费率表)
数据格式 定长文本(fixed-width)数据文件 + 官方 Record Layout 数据字典
许可证 CMS LDS Data Use Agreement(HIPAA 45 CFR 164.514(e),仅限研究用途)
访问级别 申请审核(EPPE 提交 DUA + 机构资质 + 付费)
DUO 标签 HMB(生物医学研究)、IRB(需机构审查)、NPUNCU(非商业非营利)
语言 英文
首发日期 现行 SAF LDS 数据覆盖自 1999 年起,目录持续年度更新
最后更新 2025-08(按发布时间表释出 CY2024 年度 SAF/MBSF)
发布机构 Centers for Medicare & Medicaid Services(CMS,美国联邦医疗保险和补助服务中心)
官方主页 https://www.cms.gov/data-research/cms-data/data-available-researchers
下载地址 https://www.cms.gov/data-research/cms-data/data-available-researchers/requesting-limited-data-sets-lds-files
引用次数 不可得(行政数据产品无单一定标论文,引用以 CMS/ResDAC 文档与使用研究计)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方数据字典完备、结构规范、字段语义清晰;扣分项:无官方划分与预处理脚本、定长格式需自行解析、DUA 限制再分发
页面状态 published

§0 E-E-A-T 专队审核声明

  • 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(老年慢病流行病学、ICD-11/SNOMED 双映射)、§7 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。CMS Medicare LDS 要求研究者通过 CMS EPPE 系统签署数据使用协议(DUA)并付费获取,全程受 HIPAA 隐私规则与 CMS 数据发布政策约束。DUO 标签仅供参考,具体使用限制以 CMS LDS DUA 条款为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? Medicare LDS 是美国联邦医疗保险和补助服务中心(CMS)面向研究者发布的"有限数据集"文件族:把 Medicare 按服务收费(FFS)的住院、门诊、医生、耐久医疗设备等理赔记录,连同每位受益人的参保登记信息,按 HIPAA 有限数据集标准剥离姓名、住址、社会安全号等直接标识符后打包发布。它提供 5% 与 100% 两档抽样,数据覆盖自 1999 年起并逐年更新。

为什么重要? Medicare 是全球规模最大的单一支付方医保体系之一:2024 年覆盖约 6,760 万人、年度支出约 1.12 万亿美元(2025 年 Trustees 报告)。LDS 把这套体系的行政理赔以可链接到个人的粒度开放给研究界,是真实世界证据、健康经济学与医保 AI 领域被引用最多的数据基础设施之一。

我能用它做什么? 训练再入院/利用率/费用预测模型、做慢病表型与共病网络挖掘、检测异常理赔与欺诈模式、评估医保支付政策的因果效应。注意它不含 Part D 处方明细,也不含 MA 登记期的 FFS 理赔——这两点是选型时的第一道闸门(见 §6.5 坑点 2、坑点 3)。

§1.1 摘要

CMS 以三档隐私级别发布研究数据:公开使用文件(PUF)、有限数据集(LDS)与研究可识别文件(RIF)(CMS 官方说明)。LDS 处于中间层:保留受保护健康信息(PHI)与具体日期、县/州地理等研究关键要素,但不含 HIPAA 隐私规则 45 CFR 164.514(e)(2) 定义的直接标识符(ResDAC 对比页)。文件族包括 Master Beneficiary Summary File(MBSF,逐受益人逐年的参保/人口学/慢病标志)与 8 类 Standard Analytical Files(SAF:Inpatient、Outpatient、Carrier、DME、HHA、Hospice、SNF 等,逐条 final-action 理赔)。现行目录仅提供 5% 与 100% 两档抽样,其中 Carrier 与 DME 仅有 5% 档(CMS LDS Files 费率页)。获取走 CMS EPPE 系统的 DUA 流程,处理周期一般 2-3 周,2026-08-11 起新增数据管理计划自审(DMP SAQ)并改为仅经 CCW VRDC 安全下载交付。

§1.2 战略价值

维度一:规模与代表性的不可替代性。 2024 年 Medicare 覆盖 6,760 万人(60.3M 65 岁以上、7.3M 残障人士),2024 年总支出 1,122.1 亿美元级——即约 1.12 万亿美元(Trustees 2025)。100% 档 LDS 意味着可以在这个量级上做全人群面板分析,而不是抽样推断;5% 档(约 340 万受益人)则把管线开发与原型验证的成本压到最低。对 AI 而言,这是极少数可以覆盖 30 年时间跨度、按月粒度追踪参保状态的患者级理赔语料。

维度二:真实验证与政策回路的闭环。 LDS 的编码体系(ICD-9/10-CM/PCS、HCPCS/CPT、DRG、revenue center)与美国临床记账现实完全一致,模型学到的分布就是记账行为的分布——这既是价值(真实世界泛化)也是陷阱(upcoding 与编码漂移,见 §7.1)。MedPAC、GAO、参议院监督文件均以 Medicare 理赔/encounter 数据为证据底座(MedPAC 2025 年 6 月报告、GAO-22-106026),研究产出可直接进入政策讨论回路。

维度三:合规确定性的工程价值。 相比 RIF 的 3-5 个月审批与 VRDC 内分析约束,LDS 的 DUA 处理周期一般 2-3 周,且(2026-08 新规后)经 CCW VRDC 安全下载到机构内合规环境自主分析——既保留了控制权,又满足 CMS ARS 5.1 安全基线(CMS 申请页)。对需要多轮迭代的 AI 研发而言,"数据在本地、合规在协议"的工作模式显著降低了实验循环成本;代价是再分发禁止与销毁义务必须内建到 MLOps 流程(见 §6.10)。

§1.3 同类数据集横向对比

数据集 规模 模态 标注 与 Medicare LDS 的差异化
CMS Medicare LDS(本条) 全体约 6,760 万受益人(2024),5%/100% 两档 FFS 理赔 + MA encounter + 登记版慢病标志 无监督标签,结局需自行派生 全人群、长时程、付费 DUA、县/州地理
CMS RIF(VRDC 内) 与 LDS 同源全量 同 LDS + ZIP + 出生日期 + PDE 同上 更高识别度、必须 VRDC 内分析、处理 3-5 个月
SEER-Medicare 癌症登记链接 Medicare 理赔 癌症登记 + 理赔 肿瘤分期/部位金标准 仅癌症人群,登记-理赔链接是其独有价值
MarketScan 数千万商业+Medicare 补充参保人 商业理赔 + 实验室 无 商业人群为主、家庭级链接,US 地理粒度更细但老年 Medicare FFS 完整度不及 LDS
HCUP NIS/NEDS 年千万级出院记录 医院住院/急诊抽样 无 医院级抽样无个人跨年链接,LDS 胜在纵向
MIMIC-IV 约 25.7 万成人住院 ICU 波形/实验室/笔记 ICU 结局丰富 单中心深度 vs LDS 全国广度,完全互补

§1.4 版本时间轴

时间 事件 说明
1999 起 现行 SAF LDS 数据覆盖起点 NPI/UPIN 自 1999 年起加密保留并提供 crosswalk(ResDAC)
2010 起 LDS 理赔文件恢复精确日期 此前仅季度+年;2009 年日期单独文件提供(ResDAC)
2013 起 Carrier SAF 恢复真实 NPI 1999-2012 为加密 NPI,crosswalk 可免费申请(ResDAC)
2015-10-01 美国 ICD-9-CM → ICD-10-CM/PCS 切换 跨 2015 年数据需编码映射(CMS ICD-10)
2025-07-10 CMS 退休旧 LDS 产品 2006-2015 年度 SAF、2006-2016 Denominator、2012 Provider Master Crosswalk;季度文件仅留近 2 个滚动年(CMS)
2026-08-11 LDS DUA 新规生效 新版 Attachment A、DMP SAQ 强制、取消实体介质、仅 CCW VRDC 安全下载、延期须报告公开发表(CMS)
2027-02 LDS 费用上调 20% 官方费率表更新(CMS)
2024 MA 渗透率达 54% MA 登记 32.8M,FFS 理赔覆盖人群占比相应收缩(KFF)

§1.5 典型应用场景

  1. 再入院与利用率预测:以 MBSF 登记建立人口骨架、Inpatient SAF 提供入出院时间轴,预测 30 天再入院(RRx-DRG、Plan of Care 变量完整)。
  2. 医疗费用与利用预测:Carrier+Outpatient+DME 行级支付金额支持年度费用负担建模,是精算与风险调整研究的标准数据底座。
  3. 医保反欺诈/异常检测:行级 HCPCS/CPT 编码 × 医师 NPI × 县级地理,支撑异常计费模式与供应方行为挖掘。
  4. 慢病表型与共病网络:MBSF 自带 27 项 CCW 慢病标志(如糖尿病、心衰、CKD),可与理赔派生表型交叉验证。
  5. 政策因果评估:支付规则变化、DRG 调整等自然实验以 LDS 100% 档做前后对照,是健康经济学的主流设计。
  6. 供应方行为研究:Carrier 的行级服务 × 医师 NPI × 县级地理支持转诊网络、治疗强度与供应链行为分析(2013+ 年份为真实 NPI 时代)。
  7. 健康 disparities 研究:MBSF 种族/县地理与外连县社会经济文件(AHRF)结合,做可及性与结局差异分析(注意 §7.5 的种族字段置信度限制)。

§2 医学背景

§2.1 疾病/结局编码映射表(ICD-11)

Medicare LDS 覆盖全疾病谱;下表列出老年人群高负担、且在理赔数据中编码稳定的代表性结局,供模型标签设计与 §2.1b 术语映射使用。

结局/标签 ICD-11 编码 ICD-11 中文名 在 LDS 中的主要来源
原发性高血压 BA00 原发性高血压 Carrier/Outpatient 诊断位 + MBSF 慢病标志
2 型糖尿病 5A11 2 型糖尿病 MBSF Diabetes 标志 + 全 SAF 诊断位
急性心肌梗死 BA41 急性心肌梗死 Inpatient 主诊断 + DRG
心力衰竭 CB4Z 心力衰竭 MBSF Heart Failure 标志 + Inpatient 诊断
脓毒症 1G4Z 脓毒症 Inpatient 主/次诊断
肺炎 CA4Z 肺炎 Inpatient/Outpatient 诊断位
急性肾损伤 8B6Z 急性肾损伤 Inpatient 诊断位
终末期肾病 GB64 慢性肾脏病 5 期 MBSF ESRD 指示 + 登记资格字段
慢性阻塞性肺疾病 CA22 慢性阻塞性肺疾病 MBSF COPD 标志 + 全 SAF 诊断位
阿尔茨海默病 6D80 阿尔茨海默病 MBSF Alzheimer 标志 + Carrier 诊断位

§2.1b SNOMED CT 映射表

标签/术语 ICD-11 SNOMED CT 码 SNOMED 术语
原发性高血压 BA00 38341003 Hypertensive disorder, systemic arterial
2 型糖尿病 5A11 44054006 Diabetes mellitus type 2
急性心肌梗死 BA41 22298006 Myocardial infarction
心力衰竭 CB4Z 84114007 Heart failure
脓毒症 1G4Z 91302008 Sepsis
肺炎 CA4Z 233604007 Pneumonia
慢性阻塞性肺疾病 CA22 13645005 Chronic obstructive pulmonary disease
阿尔茨海默病 6D80 26929004 Alzheimer’s disease
终末期肾病 GB64 46177005 End stage renal disease

§2.2 疾病背景与流行病学

Medicare 人群以 65 岁以上老年人与残障人士为主体:2024 年 6,760 万覆盖者中,60.3M 为 65 岁以上、7.3M 为残障人士(2025 Trustees 报告)。这是一组多病共存、功能衰退风险高的人群:基于 CMS Medicare Current Beneficiary Survey 2022 年调查,近半数(45%)受益人患有 4 种及以上慢病,28% 存在日常生活功能损伤,17% 存在认知损伤(KFF, Medicare 101)。这意味着 LDS 中的"标签"天然是共病密集、多标签、长尾分布的——单一疾病二分类设计在该人群上经常失效,更稳的做法是多任务/表型聚类(见 §6.7)。

理赔数据记录的是"被记账的疾病",而非"真实患病率":FFS 记账激励下轻症可能漏记,MA 风险调整激励下诊断可能被系统性放大(MedPAC 估计 MA 计划获付为传统 Medicare 同类受益人成本的 122%,2024 年约合 830 亿美元超额支付,KFF 2024)。用 LDS 做流行病学推断时必须区分"记账流行率"与"真实流行率"两条线。

对老年人群建模的三条流行病学事实值得写入任何研究设计:第一,多病共存是常态而非例外(45% 有 4+ 慢病),单病标签会系统性低估疾病负担,多标签/共病网络设计是默认正确选项;第二,功能与认知损伤(28%/17%)在理赔编码中显著低估——这两类状态主要通过评估类文件(MDS/OASIS)而非理赔码呈现,纯 LDS 管线对"衰弱"相关结局的召回率天然偏低;第三,残障通道人群(2024 年 7.3M)比老年人群年轻但病情更重,任何把年龄当主要特征的模型都要为这条非单调通道单独设层。

§2.3 临床任务定义

任务 定义 LDS 支撑要素
筛查/风险分层 用既往理赔预测未来不良结局(死亡、再入院、高费用) MBSF 人群骨架 + 历史诊断/费用特征
诊断 事后从理赔序列识别未编码慢病(表型算法) ICD 编码位 + HCPCS + DRG
分级/分组 按资源利用强度与共病负担分层(如 risk score 复算) 支付金额、DRG、revenue center 明细
预后 生存分析:从诊断到死亡/再入院的时变建模 经核验死亡日期(仅 validated)+ 入出院日期
异常检测 供应方计费模式偏离检测 行级 HCPCS × NPI × 县级地理

§2.4 患者人群画像

维度 内容 来源
数据来源 CMS 行政理赔与登记(非主动采集队列) CMS
时间范围 1999 年起,年度文件(8 月发布)+ 季度文件 CMS LDS Files
年龄 65+ 老年人为主体,另有 7.3M 65 岁以下残障/ESRD 人群(2024) Trustees 2025
性别 老年组女性占比更高:20% 样本 2017 年女性约 59.7% UNC Sheps Center
种族 20% 样本 2017 年:白人 84.8%、黑人 7.5%、亚裔 2.2%、西班牙裔 1.8%、原住民 0.4%、未知 1.6% UNC Sheps Center
就医类型 FFS 理赔覆盖住院/门诊/医生/DME/HHA/Hospice/SNF;MA 期服务仅 encounter ResDAC

§2.5 临床价值

对医学 AI 而言,LDS 的核心价值是把"服务发生"这一最硬的真实世界终点(住院确实发生、支付确实支付)以全国规模、30 年跨度提供给模型。它常被用作:影像/ICU 单中心模型的外部验证底座(结局锚点)、治疗模式比较效果研究的证据源、以及支付政策(如 DRG、两轨支付)自然实验的对照面板。其经核验的死亡日期使生存分析终点可靠——ResDAC 对 2017 年 100% MBSF 的对比显示 LDS 与 RIF 均含 2,291,538 条经核验死亡日期,RIF 仅额外多 1,211 条未核验记录,差异可忽略(Duke/ResDAC 分析)。

§2.6 金标准对照表

项目 内容
划分性质 无官方 ML 划分;社区惯例为按 BENE_ID 受益人级划分(见 §5)
标注方式 无人工标注;标签从编码(ICD/HCPCS/DRG)与登记标志派生(弱监督/规则监督)
标注者 编码由医方记账与 Medicare Administrative Contractors 审核生成,非研究标注
标注性质 记账流行率(coding-based prevalence),非临床金标准
结局核验 死亡日期仅收录经 SSA 核验者;MBSF 慢病标志为 CMS 官方算法版本化产出

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小/成本 理由
原型开发、方法学论文、教学 LDS 5% 档(MBSF + Inpatient + Outpatient + Carrier + DME) MBSF $250/年,Inpatient $400/年等(费率表) 约 340 万受益人,桌面级可跑,费用最低
全人群政策评估、稀有结局、州级推断 LDS 100% 档(MBSF + Inpatient + Outpatient 等) MBSF $1,000/年,Outpatient $7,000/年等 全量受益人;注意 Carrier/DME 无 100% 档
需要 Part D 处方、ZIP、出生日期 RIF(VRDC 内分析) ResDAC 费用页,处理 3-5 个月 LDS 刻意不含这些要素,只有 RIF 有
零成本先探结构 SynPUF / MCBS PUF 等公开文件 免费 结构近似 SAF,但规模与保真度不可替代 LDS

§3.1 模态详情

  • FFS 理赔(核心模态):8 类 Standard Analytical Files,逐条 final-action 理赔,含诊断(最多 25 位)、操作、DRG、revenue center 明细、行级 HCPCS/CPT、支付与收费金额。Carrier 文件为 CMS-1500 表单(医师/供应方),其余为机构理赔(UB-04 族)。
  • MA encounter(补充模态):MA 计划向 CMS 申报的 encounter 记录,覆盖 MA 登记期服务;公开版不含医方付款与受益人自付信息(参议院监督信件),且完整性问题有明确记录(见 §7.1)。
  • 登记(MBSF):逐受益人逐年记录,含月度 A/B/C/D 资格标志、HMO/MA 登记月数、县/州、年初年龄、性别、种族、ESRD 指示、经核验死亡日期与慢病标志段(OSU DataCore 描述)。

规则制定文件族(Rule-Making LDS):随联邦公报规则发布而释出的专项文件,供支付规则影响分析:

文件 100% 档年费 发布节奏
IPF PPS(精神专科) $3,000 随拟议/最终规则
OPPS(门诊支付) $3,000 随拟议/最终规则
OPPS PHP(部分住院) $1,000 随拟议/最终规则
ESRD $600 随拟议/最终规则
ASC(门诊手术中心) $1,500 随拟议/最终规则
HH PPS(居家健康) $1,200(2017-2021)/ $1,500(2022+) 随拟议/最终规则
MedPAR Hospital (National) $3,600 随拟议/最终规则
MedPAR LTCH / SNF $100 / $650 随拟议/最终规则

(来源:CMS LDS Files 费率表。)

§3.2 按子集/文件类型的样本构成

文件 记录粒度 5% 档年费 100% 档年费
MBSF(Base) 每受益人每年 1 条 $250 $1,000
Inpatient SAF 每住院理赔 1 条 $400 $3,000
Outpatient SAF 每门诊机构理赔 1 条 $1,000 $7,000
Carrier SAF 每医师/供应方理赔行 $1,700 n/a(不提供)
DME SAF 每设备理赔行 $800 n/a(不提供)
Home Health SAF 每 HHA 理赔 $300 $2,000
Hospice SAF 每 Hospice 理赔 $300 $1,000
SNF SAF 每 SNF 理赔 $300 $1,000
MedPAR / PSPS(汇总型) MedPAR 住院汇总 / 医师程序汇总 n/a $100-$400 段位

(费率均为每数据年,2026-02 前价格;2027-02 起上调 20%。来源:CMS LDS Files 费率表。另有规则制定文件族:IPF PPS、OPPS、ESRD、ASC、HH PPS、MedPAR Hospital/LTCH/SNF。)

§3.3 格式

格式 说明
定长文本(fixed-width) 官方交付形态,配 Record Layout 数据字典(字段起点/长度/类型)
Record Layout(PDF/网页) 官方数据字典,变量名、取值码表齐全
交叉引用文件 1999-2012 加密 NPI/UPIN crosswalk(免费申请)
交付介质 2026-08-11 起仅 CCW VRDC 安全下载(实体介质已取消)
文档伴随件 LDS Worksheet(选型与费用估算工作表)、各文件码表附录

解析工程要点:定宽文件不要用"按分隔符猜测"的通用读取器——先由 Record Layout 机器可读化生成 colspecs(§6.1 的 JSON 形态),再走显式列边界解析;所有字段先按字符串读入、后按码表显式转换,避免前导零丢失(CCN、ICD 码都依赖前导零)。

§3.4 存储大小

官方不提供统一包体:按"文件 × 年份"计价与交付,单文件体量随理赔量线性增长。工程上建议按"5% 档全文件族 + 10 年"预估为数十 GB 级、100% 档同窗口为 TB 级做容量规划(经验量级,非官方数字;下单前用 CMS LDS Worksheet 估算,下载)。

§3.5 标注方式

  • 无人工标注:所有"标签"由三类机制派生——(1)记账编码(ICD/HCPCS/DRG);(2)CMS 官方算法标志(MBSF 的 CCW 慢病标志,基于固定算法逐年重算);(3)登记事实(资格、死亡、ESRD)。
  • 版本化算法:CCW 慢病标志算法有版本演进,跨年合并时须确认所用版本(ResDAC 文档提供各版本定义)。

§3.6 标注者资质与一致性

诊断编码由医方(医院/HIM 编码员、医师计费团队)按记账规则填写,Medicare Administrative Contractors 与 MAC 审核支付。一致性不适用于传统 inter-annotator agreement 框架;替代质量证据是 CMS 对 MA encounter 数据的持续校验工作——GAO 2022 年认定校验尚未完成(GAO-22-106026),这是使用 encounter 模态时的已知质量边界。

§3.7 采集周期

理赔随服务发生实时提交、按 run-off 周期成熟:LDS 年度文件带 6 个月 run-off,季度文件 3 个月(RIF 年度 12 个月)(ResDAC)。年度 SAF/MBSF 每年 8 月发布;季度文件 Q3/Q4/Q1/Q2 分别于 2/5/8/11 月发布(CMS)。成熟度口径(CCW/J-PAL):季度文件在季度结束后约 4 个月可得、约 93% 成熟;年度刷新在年后约 14 个月、100% 成熟(J-PAL)。设计分析窗口时把这条延迟链当作硬约束:任何"最新年"分析天然滞后 14-20 个月。

§3.8 地域覆盖

美国 50 州、哥伦比亚特区与海外领地(波多黎各、美属维尔京群岛等)。LDS 地理粒度为县(county)+州,无 ZIP(MCBS/HOS 两个调查型 LDS 例外,含 ZIP 与出生日期);MedPAR LDS 仅州(ResDAC)。

§3.9 设备规格

不适用传统"设备"概念;DME SAF 是设备相关模态:记录耐用医疗设备理赔行(HCPCS E 码族),但不含设备序列号或个体设备追踪。1999-2012 年 NPI 加密、2013 起真实 NPI 的规则适用于所有供应方字段(ResDAC)。

§3.10 深度溯源链

医方服务 → 记账(CMS-1500 / UB-04 族表单)
        → Medicare Administrative Contractors 审核支付
        → CMS 整合为 Standard Analytical Files(final-action 理赔)
        → MA 计划按合同申报 encounter 记录
        → HIPAA 45 CFR 164.514(e) 直接标识符剥离(LDS 转换)
        → EPPE DUA 审批 → CCW VRDC 安全下载交付
        → 研究者环境(DMP SAQ 安全标准 ARS 5.1 约束)

§4 数据结构

§4.0 目录树(解包示意)

各文件年度发布为独立交付包;以下为 5% 档多文件多年度的典型落盘组织(文件名以随附交付清单为准):

cms_lds_5pct/
├── mbsf/
│   ├── mbsf_base_2019.dat              # 登记主文件(每受益人每年 1 条)
│   ├── mbsf_cc_2019.dat                # 慢病标志段(CCW 27 项)
│   └── 2019_MBSF_Record_Layout.pdf     # 官方数据字典
├── inpatient/
│   ├── clm_ip_2019.dat                 # 理赔主记录
│   ├── rev_cntr_ip_2019.dat            # revenue center 明细
│   ├── dgns_ip_2019.dat                # 诊断编码明细
│   └── 2019_IP_Record_Layout.pdf
├── carrier/
│   ├── clm_car_2019.dat                # Carrier 理赔头记录
│   ├── line_car_2019.dat               # 行级服务明细(HCPCS/CPT)
│   └── 2019_CAR_Record_Layout.pdf
├── outpatient/ …
├── dme/ …
├── hha/ …
├── hospice/ …
├── snf/ …
└── crosswalk/
    └── npi_upin_crosswalk_1999_2012.dat  # 免费申请的加密 NPI 对照

§4.1 DAIMS 字段字典(核心 12 字段)

字段名 类型 说明 示例值 AI 用途 观测误差/陷阱 信息性缺失 取值范围
BENE_ID 文本 加密受益人唯一 ID,跨文件跨年链接主键 1SP2…(8-11 位加密串) 患者级聚合、划分单元 无明文身份;跨 DUA 不可复用 无 官方编码空间
CLM_ID 文本 理赔唯一 ID 14 位数字串 理赔去重、行级聚合头 修订理赔会产生同 ID 多版本 无 官方编码空间
CLM_ADMSN_DT 日期 (Inpatient/SNF)入院日期 2019-03-14 时序建模的起点锚 仅这两类文件有;其他 SAF 无"开始日" 无 文件年内
CLM_THRU_DT 日期 理赔结束日(全 SAF 保留) 2019-03-18 唯一通用日期 无 CLM_FROM_DT,开始日需推断 无 文件年内
NCH_CLM_TYPE_CD 类别 理赔类型码 71(门诊);60(IP) 区分机构/服务类型 码表随年份微调 无 官方码表
PRVDR_NUM 文本 机构 CCN 220001 医院级聚合 MedPAR 类文件亦含 无 6 位 CCN
PRF_PHYSN_NPI 文本 执行医师 NPI(Carrier) 10 位数字 供应方网络/行为 2013 前为加密 NPI 可空 10 位
CLM_DRG_CD 类别 MS-DRG 编码(IP) 193(简单肺炎) 病例分组/严重度 年度 DRG 版本变化 可空 DRG 码表
ICD_DGNS_CD1 文本 首诊断编码(ICD-9/10-CM) I50.9 标签派生主源 2015-10 切换断层 可空 ICD 码空间
CLM_PMT_AMT 数值 Medicare 支付额(美元) 6123.45 费用目标变量 含 0 支付的拒绝/调整理赔 无 ≥0
BENE_AGE(MBSF) 整数 年初/年末年龄 74 分层变量 非"精确年龄";SAF 侧为年龄区间 无 0-115
BENE_DEATH_DT 日期 经核验死亡日期 2021-07-02 生存终点 仅 validated 日期收录 空=存活或未核验 文件跨度内
BENE_RACE_CD 类别 种族编码(CMS 口径) 1(White)… 5(Hispanic)、0(Unknown) 公平性切片 历史误分类记录在案 0=未知 0-6
HMO_IND_01-12 类别 月度 HMO/MA 登记指示 0(FFS 月份) FFS 掩码(坑点 1 解药) 月份粒度,非日 无 0/1/2/9
BENE_STATE_CNTY 文本 州+县 SSA/FIPS 码 370/063 地理特征与区域固定效应 无 ZIP;MedPAR 仅州 无 官方码表

§4.2 标签分布

以 MBSF 慢病标志为例(CCW 27 项算法):高血压、高脂血症、类风湿关节炎/骨关节炎、缺血性心脏病、糖尿病是老年人群最常见标志;阿尔茨海默病及相关痴呆、心衰、CKD 呈强年龄梯度。2022 年 MCBS 显示 45% 受益人有 4+ 慢病(KFF)。理赔派生标签呈长尾:单一 ICD 码可覆盖百万级理赔,长尾码则年计数个位数——分层抽样与罕见码合并是预处理必选项(见 §6.3)。

§4.3 关键统计

  • 人群规模:2024 年 Medicare 总覆盖 67.6M(Trustees 2025);MA 32.8M、占合格人口 54%(KFF 2024)——即约 46% 为 FFS 期,理赔 SAF 的实际覆盖人群规模以此为准。
  • 20% 参照系:UNC Sheps 维护的 20% 样本 2017 年"A/B/D 全月覆盖 + 至少 1 条理赔"受益人 3,860,066 人,可外推全量约 1,930 万活跃 FFS 受益人/年(2017)(Sheps)。
  • 死亡终点完备性:2017 年 100% MBSF 含 2,291,538 条经核验死亡日期,LDS 与 RIF 一致(Duke/ResDAC)。
  • 发布节奏锚点:年度文件 8 月发布(CY2024 文件于 2025-08 窗口释出);季度文件 4 个月后可得、93% 成熟,14 个月后年度刷新 100% 成熟(J-PAL)。
  • 地理覆盖锚点:2024 年 7 个州(含波多黎各)MA 份额 ≥60%(KFF),县域级 FFS 密度差异极大——县级建模须检查有效样本量。

§4.4 数据层级

受益人(BENE_ID,MBSF 每年 1 条)
 └─ 理赔(CLM_ID,每 final-action 理赔 1 条,跨 8 类 SAF)
     └─ 行/明细(revenue center 行、行级 HCPCS 服务、诊断位 1-25)

同一次住院会展开为:1 条 IP 理赔头 + N 条 revenue center 行 + M 条诊断码——聚合方向(claim-level vs line-level)在 SQL/pandas 中极易搞错,见坑点 5。

跨文件链接的三条铁律:

  1. MBSF 是骨架:先建人年表,再 left join 各 SAF,方向永远"登记 → 理赔",反向 join 会静默丢人。
  2. CLM_ID 是理赔主键、行表用复合键:line/revenue 表按 CLM_ID + 行号 唯一,单按 CLM_ID 聚合会双计。
  3. 日期锚点按文件类型选择:住院锚 CLM_ADMSN_DT,其余锚 CLM_THRU_DT(坑点 3)。

§4.5 缺失值与信息性缺失

编码/现象 含义 AI 处理建议
空白/0001-01-01 类哨兵日期 该日期字段不适用(如门诊理赔无入院日) 按文件类型建立"字段适用性掩码",勿当真日期
YYYYQn(2009 前) 日期退化为季度+年 季度粒度时间特征,禁止插值成精确日
空诊断位 未填(≤25 位不齐) 掩码处理,勿编码为"无病"
支付=0 拒付/调整/二次理赔 区分"拒绝理赔"与"免费服务"
BENE_DEATH_DT 空 存活或死亡未核验 生存分析右删失处理,勿当确定存活

§5 划分与使用建议

§5.1 官方划分

无。CMS 不提供 train/val/test 划分——它是行政数据产品而非 ML 基准。这意味着划分即研究设计的一部分:划分方案须在论文方法节完整披露(抽样档、时间窗、地理窗、BENE_ID 指纹生成方式),并随代码发布划分指纹的生成脚本(不含指纹文件本身——BENE_ID 属 DUA 管控内容)。

§5.2 社区惯例

  • 按 BENE_ID 受益人级划分(hash 取模或随机抽样),全部分件共享同一 MBSF 人群骨架;这是唯一能防患者泄漏的单元(见坑点 5)。
  • 按时间外推:训练用早年份、测试用晚年份,模拟前瞻部署;代价是编码漂移(ICD-10 切换、DRG 更版)会直接打在测试集上。
  • 按州/县留出:地理外推测试,检验模型对支付政策区域差异的鲁棒性。
  • 20%/5% 交叉复核:机构同时持有多个抽样档时,用 20% 档结论复核 5% 档管线(UNC Sheps 20% 样本是社区参照系,Sheps)。

抽样口径提示:现行官方 LDS 目录只有 5% 与 100% 两档(Carrier/DME 仅 5%);20% 抽样主要存在于学术机构自持队列与 RIF 侧(CMS 费率表、UCSF Pepper)。跨档比较时先对齐"抽样档 × 文件族 × 年份"三元组。

§5.3 泄漏风险(重点)

  1. 患者泄漏:同一受益人的一条 IP 理赔 + 十条 Carrier 理赔 + 一条死亡记录必须落在同一分件;任何 claim-level 随机划分都会让测试集 AUC 虚高。
  2. 时间泄漏:用"理赔结束日之后才可能知道"的字段(如最终支付金额在 run-off 期内仍会修订)预测住院期间结局,属于部署期不可得特征。
  3. 链接泄漏:与 NPPES、AHRF 等外部文件连接时,连接键本身可能编码结局信息(如 ESRD 机构 NPI 与 ESRD 标签强相关)。

§5.4 交叉验证建议

  • 首选 GroupKFold(group=BENE_ID),5 折;大人群下单折即百万级受益人,标准误极小。
  • 时序任务用 前向链(expanding window):如 2014-2016 训练、2017 验证、2018 测试,并在报告中标注 ICD 版本跨越。
  • 费用类任务注意零膨胀与重尾:报告分位数损失/MAPE 而非仅 MSE。
  • 折间统计监控:每折打印人群构成(年龄带、性别、dual 占比、MA 渗透率)——大人群下随机波动极小,任何折间构成差异都是划分实现的 bug 信号而非抽样噪声。
  • 报告习惯:主表报总体指标,附表必带 FFS/MA 与老年/残障两个分层切片;单列数字不作为主要结论呈现。

§5.5 外部验证建议

  • 与 SEER-Medicare(癌症登记链接)对比肿瘤相关表型的捕获率;注意 SEER 仅覆盖登记区域。
  • 与 MarketScan Medicare 补充数据交叉验证处方相关结局——LDS 无 PDE,药物暴露必须外源。
  • 与 MIMIC-IV/单中心 EHR 做结局锚点校准:理赔"记账流行率" vs EHR"临床流行率"的差异本身就是研究产出。
  • 与 NPPES(医师注册)按 NPI 连接补齐供应方属性(专科、组织隶属),注意 1999-2012 需先过 crosswalk(ResDAC)。
  • 与 **Area Health Resource File(AHRF)**按县码连接补充医师密度、床位等县域协变量——这是社区处理"地理分辨率降级"的标准外连路径。

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

LDS 不可公开下载,无"一键云端启动"形态。两种合规起点:其一,先用免费的 Synthetic PUF / MCBS PUF 在云端跑通管线结构;其二,在已获批 DUA 的机构内,将交付包挂载到满足 DMP SAQ(ARS 5.1 安全标准)的受控环境(2026-08-11 起强制,CMS)。以下代码均假设数据已在合规环境内。

§6.1 快速上手

# ============================================================
# 目录结构预期(data_root 下):
#   data_root/
#     mbsf/mbsf_base_2019.dat          # 定宽文本,每受益人每年 1 条
#     inpatient/clm_ip_2019.dat        # 定宽文本,每 IP 理赔 1 条
#     inpatient/colspecs_ip_2019.json  # 由官方 Record Layout 转出的
#                                      #   {col_name: (start, end)} 字典
# data_root = 前缀路径;读文件时按 f"{data_root}/{subdir}/{fname}" 拼接。
# 最小可用子集:MBSF(人群骨架)+ Inpatient(结局时间轴)即可启动
#   再入院/死亡率类任务;Carrier/Outpatient 提供门诊特征。
# ============================================================
import json
import pandas as pd

DATA_ROOT = "/secure/lds_5pct"  # DUA 合规环境内的挂载路径

def load_fixed_width(subdir: str, fname: str, layout_json: str) -> pd.DataFrame:
    """按官方 Record Layout 解析 CMS 定宽文本文件。
    colspecs 由 layout 转换脚本一次生成,避免手工抄错字段边界。"""
    with open(f"{DATA_ROOT}/{subdir}/{layout_json}") as f:
        colspecs = {k: tuple(v) for k, v in json.load(f).items()}
    df = pd.read_fwf(
        f"{DATA_ROOT}/{subdir}/{fname}",
        colspecs=list(colspecs.values()),
        names=list(colspecs.keys()),
        dtype=str,            # 先全按字符串读入,再按字典显式转换
    )
    return df

mbsf = load_fixed_width("mbsf", "mbsf_base_2019.dat", "colspecs_mbsf_2019.json")
ip = load_fixed_width("inpatient", "clm_ip_2019.dat", "colspecs_ip_2019.json")

# 受益人骨架 + 当年住院计数:最小组件
bene_year = mbsf[["BENE_ID", "AGE_AT_END_BEF_REF_YR", "BENE_SEX_IDENT_CD"]]
ip_counts = ip.groupby("BENE_ID").size().rename("n_ip_claims")
cohort = bene_year.merge(ip_counts, on="BENE_ID", how="left").fillna({"n_ip_claims": 0})
print(cohort.describe())

免费 crosswalk 还原加密 NPI(1999-2012 供应方分析的前置步骤):

# NPI/UPIN crosswalk 随 LDS DUA 免费申请(ResDAC "Add LDS Files" 页),
# 键为加密值 → 真实 NPI。加载后用于统一 1999-2012 与 2013+ 的供应方 ID 空间:
#   加密期记录: PRF_PHYSN_NPI = "X7Q3…"(加密串)
#   2013+ 记录: PRF_PHYSN_NPI = "1234567893"(真实 10 位)
def normalize_physn_id(df, crosswalk: dict | None = None):
    npi = df["PRF_PHYSN_NPI"]
    if crosswalk is not None:
        npi = npi.map(lambda x: crosswalk.get(x, x))   # 加密串 → 真实 NPI
    return npi.where(npi.str.fullmatch(r"\d{10}"), other=pd.NA)  # 2013 前未还原的置空

实操建议:crosswalk 只解决"加密→真实"映射;2012 年以前 UPIN 时代的鲁棒性仍有限,医师级长时序分析默认从 2013 年起跑。

§6.2 数据获取

申请流程(2026-08-11 起生效版):

  1. 机构在 CMS EPPE 系统注册 DUA Requester 角色(须先完成两门 EPPE 培训)。
  2. 填写新版 Attachment A: LDS Request Application(研究描述 1-4 页 + 文件/年份清单)。
  3. 在 EPPE 提交 DUA 请求;CMS 在 3 个工作日内响应,整体处理一般 2-3 周(CMS 申请页)。
  4. 机构须有已获批的 DMP SAQ(按 CMS ARS 5.1 安全标准自审的数据环境)。
  5. 付费后经 CCW VRDC 安全下载获取(实体介质已取消);DUA 到期须销毁或延期,2026-08 起延期需提交公开发表清单。
# 费用估算脚本(价格以官方费率表为准,2027-02 起整体 +20%)
LDS_FEES_PER_YEAR_5PCT = {          # 来源: CMS LDS Files 费率表
    "MBSF": 250, "Carrier": 1700, "DME": 800, "HHA": 300,
    "Hospice": 300, "Inpatient": 400, "Outpatient": 1000, "SNF": 300,
}
years = range(2015, 2020)           # 5 个数据年
files = ["MBSF", "Inpatient", "Outpatient", "Carrier"]   # 原型开发推荐组合
cost = sum(LDS_FEES_PER_YEAR_5PCT[f] for _ in years for f in files)
print(f"5% 档 4 文件 x 5 年 ≈ ${cost:,}(2027-02 后 ×1.2)")

季度文件(如需追赶最新数据的场景):费率独立于年度文件,同样 2027-02 起上调(CMS 费率表):

文件 5% 季度费 100% 季度费 发布窗口
MBSF $150 $625 每季度滚动
Inpatient SAF $250 $1,875 Q3→2 月 / Q4→5 月 / Q1→8 月 / Q2→11 月
Outpatient SAF $625 $4,375 同上
Carrier SAF $1,075 n/a 同上

预算提醒:季度 × 4 的年费普遍高于年度文件(如 100% Inpatient:4×$1,875 = $7,500 vs 年度 $3,000)——季度只用于追赶最新数据的过渡期,追平后切回年度文件口径。

§6.3 预处理全流程

import numpy as np
import pandas as pd

# ---- 1. 类型与哨兵值清洗 --------------------------------------------
DATE_COLS = ["CLM_ADMSN_DT", "NCH_BENE_DSCHRG_DT", "CLM_THRU_DT"]
for c in DATE_COLS:
    ip[c] = pd.to_datetime(ip[c], errors="coerce")   # 哨兵/空值 → NaT

# "字段适用性掩码":门诊类理赔天然无入院日,缺省不是错误
ip["has_admission_dt"] = ip["CLM_ADMSN_DT"].notna()

# ---- 2. ICD-9/ICD-10 断层统一(2015-10-01 切换) ---------------------
def icd_to_chapter_family(code: str, claim_year: int) -> str:
    """把 9/10 版诊断码归并到粗粒度族,绕开版本断层。
    生产环境请换用 CMS/GEMs 官方映射文件做细粒度对齐。"""
    if pd.isna(code):
        return "NA"
    return f"v10_{code[0]}" if claim_year >= 2016 else f"v9_{code[0]}"

ip["claim_year"] = ip["CLM_THRU_DT"].dt.year
ip["dx_family"] = [
    icd_to_chapter_family(c, y) for c, y in zip(ip["ICD_DGNS_CD1"], ip["claim_year"])
]

# ---- 3. 受益人月度 FFS 掩码(坑点 3 的解药,先建后用) ---------------
HMO_COLS = [f"HMO_IND_{m:02d}" for m in range(1, 13)]     # 月度 HMO/MA 指示
hmo = mbsf.set_index("BENE_ID")[HMO_COLS].apply(pd.to_numeric, errors="coerce")
ffs_months = (hmo == 0).sum(axis=1).rename("n_ffs_months")  # 0=FFS 月份
mbsf_feat = mbsf.set_index("BENE_ID").join(ffs_months)

# ---- 4. 理赔级 → 受益人年度特征表 ------------------------------------
ip["los"] = (ip["NCH_BENE_DSCHRG_DT"] - ip["CLM_ADMSN_DT"]).dt.days
agg = ip.groupby("BENE_ID").agg(
    n_ip=("CLM_ID", "nunique"),
    tot_ip_pmt=("CLM_PMT_AMT", "sum"),
    mean_los=("los", "mean"),
).join(mbsf_feat[["n_ffs_months", "AGE_AT_END_BEF_REF_YR"]], how="outer")

# ---- 5. 常见码合并(长尾处理) ---------------------------------------
vc = ip["dx_family"].value_counts()
rare = vc[vc < 1000].index                     # 年计数 <1000 的族并入其他
ip["dx_family"] = ip["dx_family"].where(~ip["dx_family"].isin(rare), "OTHER")

DuckDB 批量管线(多年份多文件时的推荐形态)——定宽文件先用 §6.1 的 colspecs 转成 CSV 落盘,之后全部分析在列存/DuckDB 内完成:

-- 1. 建表:各 SAF 年度 CSV 按分区外挂(year/file 两级分区)
CREATE VIEW ip_all AS
SELECT * FROM read_csv_auto('derived/ip/ip_*.csv', union_by_name=true);

CREATE VIEW mbsf_all AS
SELECT * FROM read_csv_auto('derived/mbsf/mbsf_*.csv', union_by_name=true);

-- 2. 受益人年骨架 + FFS 月份掩码(坑点 1;HMO_IND_M = 0 表示 FFS 月份)
CREATE OR REPLACE TABLE bene_year_ffs AS
SELECT BENE_ID, REF_YR,
       AGE_AT_END_BEF_REF_YR AS age,
       (  CASE WHEN HMO_IND_01 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_02 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_03 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_04 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_05 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_06 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_07 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_08 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_09 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_10 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_11 = 0 THEN 1 ELSE 0 END
        + CASE WHEN HMO_IND_12 = 0 THEN 1 ELSE 0 END) AS ffs_months
FROM mbsf_all;

-- 3. 理赔去重:同 CLM_ID 取 final-action(坑点 4 的兄弟问题——修订多版本)
CREATE OR REPLACE TABLE ip_final AS
SELECT * EXCLUDE (rn) FROM (
  SELECT *, row_number() OVER (
      PARTITION BY CLM_ID ORDER BY CLM_THRU_DT DESC, CLM_PMT_AMT DESC) AS rn
  FROM ip_all
) WHERE rn = 1;

-- 4. 人年特征聚合(claim 级 → bene 级,方向为登记骨架 left join)
SELECT b.BENE_ID, b.REF_YR, b.age, b.ffs_months,
       count(i.CLM_ID)             FILTER (WHERE i.CLM_ID IS NOT NULL) AS n_ip,
       coalesce(sum(i.CLM_PMT_AMT), 0)                                  AS ip_pmt,
       avg(date_diff('day', i.CLM_ADMSN_DT, i.NCH_BENE_DSCHRG_DT))      AS mean_los
FROM bene_year_ffs b
LEFT JOIN ip_final i USING (BENE_ID)
GROUP BY ALL;

(12 个月度指示列逐列展开,与 §6.3 的 HMO_COLS pandas 写法一一对应。)

§6.4 PyTorch DataLoader

# 预期输入:§6.3 产出的受益人年度特征表 + 按受益人聚合的理赔序列
# 目标任务示例:次年是否发生住院(人群骨架上的二分类)
import torch
from torch.utils.data import Dataset, DataLoader

class BeneYearDataset(Dataset):
    """每条样本 = (受益人, 年份);特征 = 当年理赔摘要 + 登记协变量。"""
    def __init__(self, agg: pd.DataFrame, label: pd.Series, num_feats: list[str]):
        self.X = agg[num_feats].astype("float32").fillna(0.0)
        self.y = label.reindex(agg.index).astype("float32")
        self.groups = agg.index.get_level_values("BENE_ID")

    def __len__(self):
        return len(self.X)

    def __getitem__(self, i):
        return self.X.iloc[i].to_numpy(), self.y.iloc[i]

def make_grouped_split(bene_ids: pd.Index, seed: int = 42):
    """受益人级 80/10/10 划分——防患者泄漏的唯一正确单元。"""
    rng = np.random.default_rng(seed)
    u = pd.unique(bene_ids)
    rng.shuffle(u)
    n1, n2 = int(0.8 * len(u)), int(0.9 * len(u))
    tr, va, te = set(u[:n1]), set(u[n1:n2]), set(u[n2:])
    return {
        "train": bene_ids.isin(tr),
        "val": bene_ids.isin(va),
        "test": bene_ids.isin(te),
    }

ds = BeneYearDataset(
    agg,
    label=(agg["n_ip_next_year"] > 0),          # 需用下一年数据预先算好
    num_feats=["n_ip", "tot_ip_pmt", "mean_los", "n_ffs_months",
               "AGE_AT_END_BEF_REF_YR"],
)
mask = make_grouped_split(agg.index.get_level_values("BENE_ID"))
train_loader = DataLoader(
    torch.utils.data.Subset(ds, np.flatnonzero(mask["train"])),
    batch_size=4096, shuffle=True, num_workers=4,
)

最小可用模型与训练循环(与上方 Dataset 配套,<details> 内为完整可运行版本):

<details>
<summary>展开:MLP 基线模型 + 分组感知训练/验证循环(约 45 行)</summary>

import torch
import torch.nn as nn

class BeneMLP(nn.Module):
    """费用/利用率类任务的强基线:宽表特征 + 两层 MLP。"""
    def __init__(self, n_feats: int, hidden: int = 256, p_drop: float = 0.3):
        super().__init__()
        self.net = nn.Sequential(
            nn.Linear(n_feats, hidden), nn.ReLU(), nn.Dropout(p_drop),
            nn.Linear(hidden, hidden), nn.ReLU(), nn.Dropout(p_drop),
            nn.Linear(hidden, 1),
        )

    def forward(self, x):
        return self.net(x).squeeze(-1)

def run_epoch(model, loader, optimizer, criterion, device="cuda"):
    model.train() if optimizer else model.eval()
    tot, n = 0.0, 0
    with torch.set_grad_enabled(optimizer is not None):
        for X, y in loader:
            X, y = X.to(device), y.to(device)
            logits = model(X)
            loss = criterion(logits, y)
            if optimizer:
                optimizer.zero_grad()
                loss.backward()
                optimizer.step()
            tot += loss.item() * len(y)
            n += len(y)
    return tot / n

device = "cuda" if torch.cuda.is_available() else "cpu"
model = BeneMLP(n_feats=len(ds.X.columns)).to(device)
criterion = nn.BCEWithLogitsLoss()          # 二分类:次年是否住院
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-4)

val_loader = DataLoader(
    torch.utils.data.Subset(ds, np.flatnonzero(mask["val"])),
    batch_size=8192, shuffle=False,
)
for epoch in range(20):
    tr = run_epoch(model, train_loader, optimizer, criterion, device)
    va = run_epoch(model, val_loader, None, criterion, device)
    print(f"epoch {epoch:02d}  train={tr:.4f}  val={va:.4f}")

</details>

提示:费用类任务把 criterion 换成 SmoothL1 并对 log1p 后的目标回归;生存任务把输出改为 Cox 部分似然头。num_feats 需与训练/推理两阶段严格一致并随模型 artifact 序列化。

§6.5 坑点 8 个

⚠️ 坑点 1:混入 MA 登记月份,FFS 理赔"消失"造成假性零利用(分类:偏倚陷阱)

问题:LDS 理赔文件只含 FFS 期服务;受益人在 Medicare Advantage 登记月份产生的服务仅以 encounter 形式存在。若不按月过滤,MA 人群会呈现"没有理赔"的假象,再入院/利用率/费用模型把 MA 月份学成"健康"。
症状:队列里出现大量整年零理赔受益人;按州/县分层时 MA 渗透率高的地区(如佛罗里达)利用率系统性偏低;2024 年 MA 已占合格人口 54%(KFF),不清洗则超过半数登记月份被错误建模。
解决:

  1. 简单方法:用 MBSF 的 12 个月度 HMO/MA 指示列(HMO_IND_01-12)构建月度掩码,仅保留 FFS 月份的人年。
  2. 进阶方法:对 MA 月份不丢弃而是打上 coverage_type 特征让模型显式学习;结局窗口落在 FFS 月份内,特征窗口允许跨月。
  3. SOTA 方法:MA 分析采用 Meyers & Werner 建议的三角验证——用 MDS/OASIS/MedPAR 等非 MA 上报数据源核对利用率,并对 MA 风险分数做固定幅度(如 16%)下调敏感性分析(LDI/JAMA Netw Open 2025)。
    参考:Meyers & Werner, JAMA Network Open, 2025;KFF MA 2024 Enrollment Update。

⚠️ 坑点 2:LDS 没有 Part D 处方明细(PDE),药物暴露变量整体缺失(分类:标签理解)

问题:研究者常沿用 RIF 时代文档写管线,假设有 PDE 文件;LDS 刻意不含 Part D 处方理赔(Duke 数据指南),药物暴露、依从性(PDC)、药物-药物相互作用等标签根本无从派生。
症状:read_pde_* 报文件不存在;试图从 Carrier 的 J-code/NDC 字段重建处方时发现仅覆盖医生诊室给药(如化疗、注射剂),口服药完全缺失;文献对比时 PDC 指标无法复现。
解决:

  1. 简单方法:选型阶段直接把"需要处方明细"列为 RIF 升级触发条件,LDS 内不做药物结局。
  2. 进阶方法:药物结局改用外部数据源(MarketScan、State All-Payer Databases)与 LDS 按 BENE_ID 之外的自然键(年份+县+年龄带)聚合对齐,接受粒度损失。
  3. SOTA 方法:用适应症指向性给药编码(Carrier/Outpatient 的特定 HCPCS)做"给药事件"而非"药物暴露"标签,并在论文 limitation 中明确只代表注射/输注场景。
    参考:Duke: What type of Medicare data are right for my study?;ResDAC RIF/LDS 对比。

⚠️ 坑点 3:只有 CLM_THRU_DT、没有 CLM_FROM_DT,时序起点被悄悄替换(分类:预处理陷阱)

问题:LDS 理赔文件为去标识化删去了 claim-from date,仅保留 through date;除 Inpatient/SNF 有入院日外,门诊/Carrier 类服务的"开始日"不存在。拿 through date 当服务开始日会把时序整体右移,窗口特征与暴露-结局时序随之失真(ResDAC 字段差异表)。
症状:门诊事件在"结局前 30 天窗口"的占比异常高;感染类结局的暴露期计算系统性提前;同一模型在 RIF 上复跑性能下降(说明 LDS 管线确实用了错误起点)。
解决:

  1. 简单方法:全部时间特征只使用 through date,并在文档中声明"事件锚 = 服务结束日",做保守估计。
  2. 进阶方法:住院类用 CLM_ADMSN_DT 作起点、门诊类用 through date 作上界,构造区间特征([admission, through] 覆盖)而非点特征。
  3. SOTA 方法:对时长敏感的任务直接升级到 RIF(含 from date),或在 LDS 内用季度粒度建模(尤其 2010 年前数据本来就只有季度+年)。
    参考:ResDAC: Differences between RIF, LDS, and PUF Data Files。

⚠️ 坑点 4:ICD-9 → ICD-10 断层(2015-10-01)打断跨年标签连续性(分类:预处理陷阱)

问题:2015 年 10 月 1 日起美国理赔由 ICD-9-CM 切换到 ICD-10-CM/PCS(CMS ICD-10)。ICD-10 码空间数倍于 ICD-9,字符串前缀特征、码频统计、one-hot 维度全部在 2015/2016 交界处断裂。
症状:以"码频 top-k"做特征时 2016 年后 top-k 集合大换血;跨 2015 的病人级纵向轨迹断链;按主诊断首字符分桶的模型精度在 2016 测试年骤降。
解决:

  1. 简单方法:特征只用 GEMs 双向映射后的粗分类(如 CCS/RxNorm 类别层),不使用原始码。
  2. 进阶方法:用 CMS General Equivalence Mappings 把 ICD-9 前向映射到 ICD-10、重叠期(2015Q4 双编码政策窗口)人工核对,构建版本无关的表型字典。
  3. SOTA 方法:按版本分模型或加 version embedding;跨版本迁移用对比对齐(同病族两版码共享表示),并把切换期设为独立验证切片。
    参考:CMS ICD-10-CM 官方页。

⚠️ 坑点 5:claim-level 随机划分导致受益人泄漏,AUC 虚高(分类:数据泄漏)

问题:一条 BENE_ID 会同时出现在 MBSF、IP、OP、Carrier、DME 等文件且跨多年。若按理赔行随机划分 train/test,同一受益人的历史理赔直接出现在测试集,模型只需记住患者即可"预测"其未来。
症状:测试 AUC 达到反常高位(如 >0.95)且远超文献基线;换数据集复跑性能塌方;per-patient 误差分布呈双峰(认识的人 vs 不认识的人)。
解决:

  1. 简单方法:划分前 groupby("BENE_ID") 取唯一键,用 hash 取模或 GroupShuffleSplit 保证患者级互斥(见 §6.4 代码)。
  2. 进阶方法:GroupKFold + 时间外推双重约束(训练年 < 测试年),并检查跨分件的 BENE_ID 交集为空作为 CI 断言。
  3. SOTA 方法:为每个实验固化"受益人指纹"文件(bene_id + split_assignment),所有后续实验复用同一划分文件,团队级防漂移。
    参考:见 §5.3 泄漏清单;划分断言示例见 §6.9。

⚠️ 坑点 6:双保险(dual eligible)人群的 Medicaid 侧服务完全不可见(分类:偏倚陷阱)

问题:约两成 Medicare 受益人同时享有 Medicaid(双保险人群),其长期护理、行为健康、transportation 等服务主要在 Medicaid 侧记账。Medicare LDS 不含任何 Medicaid 数据,该弱势子群的利用与费用被系统性低估。
症状:按 MBSF 的 Medicaid 买断标志分层时,双保险子群住院后"出院去向缺失"比例异常高;护理院相关结局几乎全靠 SNF/MDS 外部文件兜底。
解决:

  1. 简单方法:在队列定义中显式标记 dual status 并做分层报告,避免把双保险样本混入总体均值。
  2. 进阶方法:护理相关结局改用 MDS(护理院最小数据集)与 OASIS(居家健康)等 CMS 评估类文件补充(Meyers & Werner 推荐的数据三角,LDI)。
  3. SOTA 方法:需要全谱服务时申请 Medicaid 侧 T-MSIS 研究文件并与 Medicare 数据链接(更高识别度、走 RIF 流程),接受 6-8 个月获取周期。
    参考:CHCS 双保险数据技术简报。

⚠️ 坑点 7:run-off 未成熟数据低估利用率,年度文件"早拿"反成错(分类:工程陷阱)

问题:LDS 年度文件带 6 个月 run-off、季度文件 3 个月;理赔从提交到 final action 有滞后。刚发布的年度文件里,年末理赔尚未成熟,直接汇总会把最后几个月利用率算低,时间序列趋势、季节性、年度对比全部偏斜。
症状:每年 11-12 月的理赔量曲线"莫名"下滑;用 Q4 季度文件外推全年时利用率偏低;同一研究两年复跑数字对不上(因为取数时点不同成熟度不同)。
解决:

  1. 简单方法:年度分析只用年度文件(6 个月 run-off),放弃"抢跑"的季度增量。
  2. 进阶方法:对必须使用季度数据的场景,用历史成熟度曲线(3 个月 run-off 季度文件约为 93% 成熟,J-PAL 引 CCW 口径)做通胀修正,并固定"数据截至日"元数据。
  3. SOTA 方法:建立机构级"数据快照台账"(file × vintage × run-off),所有指标按 vintage 可复现;跨年比较仅用同 vintage 系列。
    参考:ResDAC run-off 说明;J-PAL Medicare Data 指南。

⚠️ 坑点 8:年龄只有年初值/区间档、NPI 有加密期,人口学与供应方特征被降级(分类:预处理陷阱)

问题:LDS 不含出生日期——MBSF 只给年初/年末年龄,SAF 只给年龄区间(ResDAC);NPI 在 1999-2012 为加密值(需免费 crosswalk 还原)。按精确年龄做时间依赖协变量、或把加密 NPI 当真实医师 ID 做跨年聚合,都会得到静默错误。
症状:年龄相关风险模型在"精确年龄"文献区间上系统性偏移(年初 vs 生日错过半年);2012 前后的医师级指标(同一医师跨年计数)突然断裂,像换了一个人。
解决:

  1. 简单方法:年龄统一用"日历年整岁"口径并注明;跨 2012 年的医师分析申请 NPI/UPIN crosswalk 统一键。
  2. 进阶方法:生存分析用时变年龄(按日历年推进),SAF 年龄区间作为稳健性检查的粗分桶。
  3. SOTA 方法:医师级模型仅在 2013+ 数据上训练(真实 NPI 时代),1999-2012 仅用于历史背景或经 crosswalk 还原后的粗粒度分析。
    参考:ResDAC LDS 字段差异;CMS LDS Files(crosswalk 申请入口)。

§6.6 数据增强

  • ✅ 安全:按 BENE_ID 的重加权/子采样;时间窗口滑移(保持 FFS 月份掩码一致性);诊断码→CCS 族聚合后的同族替换;县级聚合特征加高斯噪声(仅县级以上聚合统计,不触条款)。
  • ❌ 危险:任何形式的行复制再发布(DUA 禁止再分发数据或衍生数据文件);对加密 BENE_ID 做碰撞重组;把 county+state+年龄+性别组合重新细化为可识别粒度(违反 LDS 去标识化前提);用生成模型"补全"个体级记录。

合规判断的判别式:增强操作是否作用在"受益人级记录"上、以及是否扩大了可识别性。前者的产物仍受 DUA 管控(留在合规环境内可用),后者直接触碰 HIPAA LDS 的存在前提。时序类增强(窗口滑移、run-off 模拟扰动)作用在特征窗口而非记录本体,属于双安全区;任何"合成受益人"路线一律不做。

§6.7 模型推荐

任务 推荐模型 理由
年度费用/利用率预测 GBDT(XGBoost/LightGBM) 表格稀疏特征、长尾目标、强解释基线
再入院/死亡风险 逻辑回归 → 时序池化(GRU/Transformer over claims) 先建立可审计基线再上深度时序
慢病表型 规则表型(CMS 官方算法)+ 弱监督(PATE/soNar 类) 官方算法做教师,理赔序列做学生
反欺诈异常检测 Isolation Forest + 图自编码器(BENE-PRV 二部图) 供应方网络结构是欺诈最强信号
政策因果评估 DID/合成控制 + 双重机器学习 100% 档面板天然适配
序列表示预训练 掩码理赔码建模(BERT 式,词表 = HCPCS/ICD 族) 类似 EHR 基础模型路线,语料量大

§6.8 硬件需求

场景 配置建议
5% 档原型(单年 4 文件) 32 GB 内存 + 500 GB SSD,pandas/DuckDB 即可
5% 档 10 年全文件族 64-128 GB 内存 + 2 TB NVMe,建议 DuckDB/Spark 本地模式
100% 档多年 云端集群或 VRDC 内分析(RIF 级体量),列存 + 分区(year × file)
深度时序预训练 单卡 A100 80G 级起步(5% 档);100% 档多卡数据并行
100% 档 SQL 聚合 16 核 + 128 GB 内存节点(DuckDB/Spark),NVMe 列存分区
合规存储底座 加密盘 + 访问审计日志(DMP SAQ / ARS 5.1 环境要求)

§6.9 评估指标代码

from sklearn.metrics import roc_auc_score, average_precision_score
import numpy as np

def grouped_auc_report(y_true, y_score, groups, splits):
    """按 §5 的受益人级划分报告 AUC/PR-AUC,并断言无患者跨分件。"""
    for name, m in splits.items():
        idx = np.flatnonzero(m)
        y, s, g = y_true[idx], y_score[idx], groups[idx]
        assert len(set(g)) == len(set(g).intersection(
            set(np.concatenate([groups[np.flatnonzero(v)]
                                for k, v in splits.items() if k != name])
        ))) == len(set(g)), "患者跨分件:划分泄漏!"
        print(f"{name:>5}  AUC={roc_auc_score(y, s):.4f}  "
              f"PR-AUC={average_precision_score(y, s):.4f}  "
              f"n_bene={len(set(g)):,}")

# 费用类任务:零膨胀重尾,报告分位数损失
def pinball_loss(y_true, y_pred, q=0.9):
    d = y_true - y_pred
    return float(np.mean(np.maximum(q * d, (q - 1) * d)))

§6.10 MLOps 笔记

  • 合规即流水线:DMP SAQ(ARS 5.1)约束存储环境;数据集清单、vintage 台账、销毁记录进入 DUA 台账;受益人级统计对外发布须 CMS 事先授权(CHCS 简报)。
  • 版本 = file × year × vintage:把 §6.5 坑点 7 的成熟度固化为数据版本三元组;模型注册表引用数据版本而非模糊的"2020 数据"。
  • 监控:上线后监控输入分布(MA 渗透率、ICD 版本占比、NPI 时代占比)——这三个分布漂移是 §6.5 坑点 1/4/8 的在线化身。
  • 复现:DUA 期内锁定 pinned 版本 + seed + 划分指纹文件;DUA 到期后代码可留、数据销毁,论文复现依赖机构重建同 vintage 数据。
  • 获取的排期现实:ResDAC 建议 DUA 草案到数据到手预留 6-8 个月(含 Privacy Board 与处理期,J-PAL);LDS 自身处理 2-3 周,大头在机构安全材料(DMP SAQ)与审批排队——立项时把获取排期写进时间线。
  • 依赖外连文件的版本管理:NPPES(每月更新)、AHRF(每年更新)与 crosswalk 的版本也进入数据版本三元组,否则供应方/地理特征的复现会静默漂移。
  • 成本核算:LDS 按文件×年份计费、2027-02 起整体上调 20%(CMS);多年份多文件订单先跑 §6.2 估算脚本,把费用写进预算,避免中途追加文件触发二次审批。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解
覆盖偏倚(FFS-only 理赔) MA 月份服务无 FFS 理赔,2024 年 MA 占 54%(KFF) 高 月度 FFS 掩码 + coverage 特征
Encounter 完整性偏倚 MA encounter 对住院/居家健康/SNF 漏报最重,牙科 2024 年前系统不接收(MedPAC 2025-06) 高 三角验证外部数据源
Upcoding 偏倚 MA 风险调整激励放大诊断记录,MedPAC 估计 122% 获付(约 $83B/2024)(KFF) 高 风险分数敏感性下调(如 16%)
双保险信息缺口 Medicaid 侧服务不可见 中 dual 分层 + MDS/OASIS 补充
编码版本断层 2015-10 ICD-9→10 切换 中 GEMs 映射 + 版本特征
地理分辨率 仅县/州,无 ZIP(除 MCBS/HOS) 低-中 县级社会经济外连(AHRF)
发布滞后偏倚 年度文件滞后 14-20 个月、run-off 内未成熟理赔低估末期利用 中 vintage 台账 + 成熟度修正(坑点 7)
抽样档位混淆 Carrier/DME 无 100% 档,全人群处方/供应方分析被迫降档 中 选型期用 §3.0 矩阵对齐需求与档位

§7.2 标注质量

无人工标注体系;质量由三层保证:记账编码的支付审核(MAC 层)、CMS 官方慢病算法的版本化定义、死亡日期的 SSA 核验。已知边界:GAO 认定 MA encounter 数据的完整性与准确性校验未完成(GAO-22-106026);未核验死亡日期不进入 LDS(2017 年仅差 1,211 条,影响可忽略,Duke/ResDAC)。

从 ML 工程视角把三层质量保证翻译成三道闸门:第一道,诊断标签的效度声明——引用 CMS 官方表型定义(如 CCW 慢病算法)而非自造 ICD 码清单,并在论文中附算法版本号;第二道,理赔成熟度声明——所有计数类指标绑定 vintage 与 run-off 口径(§6.5 坑点 7);第三道,终点覆盖声明——生存分析的删失时点与死亡日期核验规则写入方法节。三道闸门齐备的分析,在评审中基本免疫"理赔数据质量"类质疑。

§7.3 泛化性

场景 失效风险 证据/机制
MA 高渗透地区 高 2024 年 7 个州 MA 份额 ≥60%(KFF);FFS 理赔稀疏
65 岁以下人群 中-高 残障/ESRD 通道人群与老年人群疾病谱差异大
美国 65 岁以下商业保险人群 高 支付规则、编码行为完全不同(见 MarketScan 类数据)
跨 2015 年模型部署 中 ICD 断层 + DRG 更版
单病种精准临床推断 高 理赔编码粒度不及 EHR/登记
处方暴露与药物安全研究 极高 LDS 无 PDE(坑点 2),必须外源数据
实时/近实时监测场景 极高 数据滞后 14-20 个月(§3.7)

§7.4 伦理

数据主体为老年与残障人群,属敏感人群级 PHI(虽去直接标识符仍为 identifiable 数据)。使用受 DUA 约束:仅限研究、须有助于改进 Medicare/Medicaid 项目、衍生工具须公共领域、受益人级统计发表须 CMS 事先授权(CHCS)。2026-08 起新增 DMP SAQ 与延期发表报告义务,强化全生命周期问责。

§7.5 公平性

LDS 的种族字段(BENE_RACE_CD)存在历史性误分类(研究人员长期记录其与美国人口普查口径的差异),跨种族模型公平性分析须标注该字段置信度;性别为二元编码。双保险、低收入(Medicare Savings Programs 标志可派生)与农村县样本应作为公平性切片默认纳入。

三条可操作建议:其一,所有公平性结论同时报告"编码口径"与"自报口径"差异(MCBS 调查侧可作为自报参照);其二,MA 高渗透县(2024 年 7 个州 ≥60%,KFF)的 FFS 样本稀疏,公平性切片在这些县的置信区间必须显式放宽;其三,65 岁以下残障通道人群(2024 年 7.3M)与老年人群的疾病谱差异巨大,建议任何总体指标都按"老年/残障"双通道分层重算一次,防止总体均值掩盖弱势子群。

§7.6 数据漂移

三大漂移源:编码体系(ICD-10、DRG 更版)、覆盖结构(MA 渗透率十年翻倍至 54%)、政策(支付规则与 run-off 规则调整)。年度文件 8 月发布意味着"最新"数据天然滞后 14-20 个月;时序模型必须把 vintage 差距写入生产监控。

在线监控面板建议固定五个指标:月度 FFS 月份占比(坑点 1 的在线化身)、ICD-10 新码占比(编码漂移)、真实 NPI 时代记录占比(供应方特征健康度)、经核验死亡日期覆盖率(终点质量)、final-action 修订率(run-off 成熟度代理)。任何指标越界都应触发数据版本与模型版本的联合复审,而不是单侧重训。

§7.7 DAIMS 24 项检查表

# 检查项 状态 说明
1 宽格式 ✅ 每 SAF 单表逐理赔(行),MBSF 单表逐人年
2 唯一标识 ✅ 加密 BENE_ID 跨文件跨年稳定链接
3 特殊字符 ✅ 定宽字段无分隔符歧义;文本码表规整
4 重复行 ⚠️ 理赔修订/调整产生同 ID 多版本,需按 CLM_ID 取 final-action
5 缺失编码 ✅ 官方码表明确哨兵值与空白语义
6 标签标识 ⚠️ 无内置 ML 标签;结局需从编码/登记派生并自证效度
7 罕见类分组 ✅ 长尾码可按 CCS/族层合并,官方码表支持
8 偏倚评估 ⚠️ FFS 覆盖偏倚、upcoding、encounter 缺口均有文献记录但无官方量化包
9 数据字典 ✅ Record Layout 完整(字段/长度/码表),ResDAC 文档体系成熟
10 信息性缺失解释 ✅ 日期/年龄/地理降级均有官方规则可查(§4.5)
11 设备记录 ⚠️ DME SAF 存在但无设备级序列号/追踪
12 共线性 ⚠️ 收费-支付-允许额多列强相关,费用模型需降维/正则
13 编码映射 ✅ ICD/HCPCS/DRG 码表 + NPI crosswalk 官方可得
14 时间戳处理 ⚠️ 无 CLM_FROM_DT、2010 前仅季度粒度,时序精度降级
15 划分建议 ✅ 受益人级划分路径清晰(§5),无官方划分但有明确正确做法
16 泄漏讨论 ✅ 患者/时间/链接三类泄漏均有成熟社区对策
17 标签分布 ✅ MBSF 慢病标志与编码流行率可完整统计
18 测量偏倚 ⚠️ 记账流行率 ≠ 临床流行率;MA upcoding 定量证据充分
19 外部验证建议 ✅ SEER-Medicare、MarketScan、MDS/OASIS 路径明确
20 版本记录 ✅ 年度/季度发布时间表 + 退休公告公开可查
21 预处理脚本 ⚠️ 官方无脚本;社区工具(SAS/pandas 模板)丰富但需自适配
22 合规要求 ✅ DUA/EPPE/DMP SAQ 全流程文档化
23 多模态对齐 ⚠️ 纯理赔模态;与影像/文本/EHR 链接需外部数据与 CMS 批准
24 去标识化 ✅ HIPAA 164.514(e) 标准流程 + 加密 ID + 县/州级地理

DAIMS 评分:19.5 / 24

评分解读:15 项 ✅、9 项 ⚠️、0 项 ❌。作为行政理赔数据,LDS 在标识稳定性、数据字典、去标识化与合规文档上达到该类数据的最高水准;扣分集中在"ML 产品化"一侧——无官方标签与划分、理赔修订与编码断层需要管线自愈、MA/双保险带来的覆盖偏倚必须用外部数据三角校正。没有 ❌ 意味着不存在"结构性不可用"项:所有 ⚠️ 都有明确的工程对策。

对你意味着什么:(1)可以直接把 LDS 当作"值得投入管线"的一级数据源——链接键、字典、合规路径全部齐备;(2)开工前先写三段固件:月度 FFS 掩码、CLM_ID final-action 去重、BENE_ID 划分指纹(对应坑点 1/4/5 的永久解);(3)任何涉及药物、MA 服务、Medicaid 侧、精确年龄的题目,先确认需要 RIF 或外部数据再决定是否申请 LDS,避免拿到数据才发现字段不存在。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
100% RIF MBSF(同源) CMS/ResDAC 死亡日期完备性对照 经核验死亡日期计数 LDS=RIF:2,291,538 条(2017);RIF 多 1,211 条未核验 LDS 生存终点可靠(Duke/ResDAC)
MCBS 调查 CMS/NORC MA 补充福利利用对照 计划上报率 vs 调查利用率 2021 年视力/听力类上报与调查一致,牙科类远低于调查 encounter 仅对部分服务可用(MedPAC 2025-06)
MedPAR/MPR 对照 CMS MA 计划住院上报一致性 计划间住院率一致性 部分合同住院上报异常偏低 计划级上报异质需逐合同审查(MedPAC)
20% 样本学术队列 UNC Sheps FFS 活跃人群规模外推 人年计数 2017 年 3,860,066(×5 ≈ 1,930 万) 5%/20% 外推一致性好(Sheps)

§8 基准性能与生态

§8.1 代表性研究基准

该数据集没有 Kaggle 式统一排行榜——不同研究使用不同年份窗口、不同文件组合与自定义划分,性能数字不可直接比较。下表收录有同行评审或官方监督机构支撑的代表性发现:

排名 模型/研究 性能(定性结论) 年份 关键技术 完整引用 代码
- MA 数据分析综述社论 识别 MA encounter 漏报最重的领域(护理院/居家健康)与 upcoding 偏倚,给出 6 步校正法 2025 数据三角验证、风险分数敏感性 Meyers DJ, Werner RM. Studying Medicare Advantage With Existing Data—Pitfalls, Challenges, and Opportunities. JAMA Network Open, 2025.(LDI 摘要) 无
- MedPAC 国会报告分析 量化 encounter 数据对补充福利的上报缺口:牙科 2024 年前系统不接收;视力/听力上报率可用 2025 计划级上报率分布分析 MedPAC. Report to the Congress: Medicare and the Health Care Delivery System, Chapter 2, June 2025.(PDF) 无
- GAO 监督评估 认定 CMS 对 encounter 数据完整性/准确性校验未完成,风险调整诊断未经病历级验证 2022 监督审计 U.S. GAO. Medicare Advantage: Continued Monitoring and Implementing GAO Recommendations Could Improve Oversight. GAO-22-106026, 2022.(GAO) 无

§8.2 SOTA 总结与选型建议

理赔数据上的"SOTA"由任务定义决定:表格型费用/利用率预测中 GBDT 系仍是默认强基线;时序理赔码预训练(BERT 式)在表型迁移上持续有产出;政策因果评估的公信力来自设计而非模型复杂度。选型建议:先用 §6.7 首行基线锁定数据质量,再决定是否上深度模型;任何"超出文献合理性"的成绩先查坑点 5(泄漏)。

与影像/ICU 基准的"榜单文化"不同,理赔数据的声誉机制是复现与监管引用:一项分析被 MedPAC/GAO/参议院文件引用(如本条 §8.1 的三篇),其价值超过任何单点 AUC。因此团队选型时优先考虑可审计性——特征可追溯到码表、划分可复现到指纹文件、结论可拆到 FFS/MA 分层。

§8.3 评测协议

  1. 固定 vintage 与 run-off 口径(报告"数据截至日")。
  2. 受益人级划分 + 时间外推双报告。
  3. 报告记账流行率与按 CMS 官方算法表型的双口径。
  4. MA/FFS 分层报告为默认义务,不作可选项。
  5. 费用任务报分位数损失与重尾切片。
  6. 外部验证引用 §7.8 矩阵路径(RIF 同源对照、MCBS 调查对照、MedPAR 一致性),未做外部对照的结论标注为内部基准。
  7. 涉及 MA encounter 的分析须声明计划级上报异质性检查(逐合同审查)与 upcoding 敏感性分析。

§8.4 相关数据集

数据集 关系 适用补充场景
CMS RIF(VRDC) 同源全量可识别版 需要 PDE/ZIP/出生日期时
SEER-Medicare 癌症登记 × Medicare 理赔 肿瘤结局与分期
T-MSIS/MAX Medicaid 侧理赔 双保险全谱服务
MarketScan 商业+Medicare 补充 处方与商业人群外推
MDS/OASIS 护理院/居家健康评估 MA 漏报领域的三角验证
CMS SynPUF 合成公开数据 管线教学与结构预研

§8.5 关键论文与官方文件 Top 7

  1. Meyers DJ, Werner RM. Studying Medicare Advantage With Existing Data—Pitfalls, Challenges, and Opportunities. JAMA Network Open, 2025. — MA 数据局限的系统校正框架。
  2. MedPAC. Report to the Congress: Medicare and the Health Care Delivery System, Ch.2, June 2025. — MA encounter 数据完整性的国会级量化评估。
  3. MedPAC. MA supplemental benefits analysis, April 2025. — 补充福利上报可用性逐服务分解。(PDF)
  4. U.S. GAO. Medicare Advantage: Continued Monitoring… GAO-22-106026, 2022. — encounter 数据校验缺口的权威认定。
  5. CMS. Data Available to Researchers / Requesting LDS Files. 持续更新. — 官方获取流程与 2026-08 新规的唯一权威来源。(链接)
  6. ResDAC. Differences between RIF, LDS, and PUF Data Files. 持续更新. — 字段级去标识化差异的标准引用。(链接)
  7. J-PAL. Medicare Data guide. 持续更新. — 获取周期、VRDC 与费用的第三方实用总结。(链接)

§8.6 社区活跃度

ResDAC 是官方技术支持枢纽(明尼苏达大学运营);学术界围绕 Medicare 数据形成了跨机构复用网络(如 UCSF Pepper Center 的 CMS Data Reuse Initiative、UNC Sheps 的 20% 样本计划、Duke 与 OSU 的机构数据核心);MedPAC/GAO 每年发布基于该数据体系的监督分析。生态以健康服务研究为中心,ML 社区的活跃度集中于 SynPUF 与衍生公开基准。

对新人研究者的 practical 地图:第一步加入机构已有的 DUA(多数大学的资助发展办公室或数据中心持有存量 LDS,OSU DataCore 与 Duke 的页面展示了典型持有窗口 2010-2020,OSU、Duke);第二步在 5% 档上完成管线并对照本文档的 8 坑点逐项自检;第三步再决定是否追加 100% 档或升级 RIF。这条路径把最长 6-8 个月的获取等待期与学习曲线并行化。

§8.7 生态快照

资源 类型 链接 推荐理由
ResDAC 知识库 官方文档 https://resdac.org 字段/文件/流程的标准答案
CCW VRDC 访问环境 https://resdac.org/cms-virtual-research-data-center-vrdc RIF 分析与(2026-08 后)LDS 下载通道
CMS LDS Files 页 官方目录 https://www.cms.gov/es/node/173131 文件清单与费率
Sheps 20% 样本统计 学术参考 https://www.shepscenter.unc.edu/data/medicare-data-20-sample 人群构成参照系
Duke Medicare 数据指南 机构指南 https://duke.atlassian.net/wiki/spaces/PD/pages/33588487 LDS vs RIF 选型速查
MedPAC 报告库 监督分析 https://www.medpac.gov 数据质量与政策背景年度更新
20% 样本学术网络(Pepper Center) 机构复用 https://peppercenter.ucsf.edu/cms-reuse 机构级 DUA 复用模式参考

§9 相关资源与引用

§9.1 官方资源

§9.2 BibTeX

@misc{cms_medicare_lds_2025,
  title        = {CMS Medicare Limited Data Set (Claims/Encounter LDS)},
  author       = {{Centers for Medicare \& Medicaid Services}},
  year         = {2025},
  howpublished = {Research data product, DUA-governed release via CMS EPPE},
  url          = {https://www.cms.gov/data-research/cms-data/data-available-researchers}
}

@misc{resdac_rif_lds_puf,
  title        = {Differences between RIF, LDS, and PUF Data Files},
  author       = {{Research Data Assistance Center (ResDAC)}},
  year         = {2025},
  howpublished = {Knowledge Base Article},
  url          = {https://resdac.org/node/1771}
}

@article{meyers2025ma,
  title   = {Studying Medicare Advantage With Existing Data---Pitfalls, Challenges, and Opportunities},
  author  = {Meyers, David J. and Werner, Rachel M.},
  journal = {JAMA Network Open},
  year    = {2025},
  note    = {Editorial, published July 23, 2025}
}

@techreport{medpac2025june,
  title      = {Report to the Congress: Medicare and the Health Care Delivery System, Chapter 2},
  author     = {{Medicare Payment Advisory Commission}},
  institution= {MedPAC},
  year       = {2025},
  month      = {June},
  url        = {https://www.medpac.gov/wp-content/uploads/2025/06/Jun25_Ch2_MedPAC_Report_To_Congress_SEC.pdf}
}

@techreport{gao2022ma,
  title      = {Medicare Advantage: Continued Monitoring and Implementing GAO Recommendations Could Improve Oversight},
  author     = {{U.S. Government Accountability Office}},
  institution= {GAO},
  year       = {2022},
  number     = {GAO-22-106026},
  url        = {https://www.gao.gov/products/GAO-22-106026}
}

@misc{kff_ma_2024,
  title        = {Medicare Advantage in 2024: Enrollment Update and Key Trends},
  author       = {{Kaiser Family Foundation}},
  year         = {2024},
  howpublished = {Issue Brief},
  url          = {https://www.kff.org/medicare/issue-brief/medicare-advantage-in-2024-enrollment-update-and-key-trends/}
}

§9.3 引用指南

引用本数据集时以 CMS 官方 DUA 条款为第一引用(许可与使用范围的法律载体),ResDAC 文档作为字段级技术引用;使用 MA encounter 或分年份口径的研究须在方法节注明 vintage 与 run-off。引用本 Wiki 条目可使用 frontmatter citeAs 字段。

期刊投稿的三条格式惯例:其一,数据可用性声明写"available from CMS under a Data Use Agreement (request via the CMS EPPE system)“并附申请页 URL,不写"可公开获取”;其二,方法节的"数据"小节列出文件族 × 年份 × 抽样档(如"MBSF + Inpatient + Outpatient + Carrier, 5%, CY2015-CY2019")三项齐备;其三,涉 MA 的分析在 limitation 引用 Meyers & Werner (2025) 与 MedPAC (2025),把 §7.1 的偏倚清单转化为显式 limitation 段落。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 大语言模型(CodeBuddy Code,fast-model):本词条初稿撰写、结构组织与代码示例生成。

§10.2 AI 参与范围

  • 参与:文献检索结果整合、章节起草、代码示例编写、表格生成、语言润色。
  • 不参与:事实核查的最终判定、医学与合规判断、审核签发。

§10.3 输入来源列表

  1. CMS. Data Available to Researchers. https://www.cms.gov/data-research/cms-data/data-available-researchers
  2. CMS. Requesting Limited Data Set (LDS) Files. https://www.cms.gov/data-research/cms-data/data-available-researchers/requesting-limited-data-sets-lds-files
  3. CMS. Limited Data Set (LDS) Files(文件清单与费率表). https://www.cms.gov/es/node/173131
  4. CMS. Data Disclosures and Data Use Agreements (DUAs). http://www.cms.hhs.gov/data-research/cms-data/data-disclosures-and-data-use-agreements-duas
  5. ResDAC. Differences between RIF, LDS, and PUF Data Files. https://resdac.org/node/1771
  6. Duke University. What type of Medicare data are right for my study? https://duke.atlassian.net/wiki/spaces/PD/pages/33588487
  7. KFF. Medicare Advantage in 2024: Enrollment Update and Key Trends. https://www.kff.org/medicare/issue-brief/medicare-advantage-in-2024-enrollment-update-and-key-trends/
  8. KFF. Medicare 101. https://kff.org/medicare/health-policy-101-medicare/
  9. MedPAC. Report to the Congress, Ch.2 (June 2025). https://www.medpac.gov/wp-content/uploads/2025/06/Jun25_Ch2_MedPAC_Report_To_Congress_SEC.pdf
  10. MedPAC. Assessing the utilization and delivery of MA supplemental benefits (April 2025). https://www.medpac.gov/wp-content/uploads/2025/04/Tab-E-MA-supplemental-April-2025.pdf
  11. U.S. GAO. GAO-22-106026 (2022). https://www.gao.gov/products/GAO-22-106026
  12. LDI (Univ. of Pennsylvania). Six Ways Researchers Can Better Analyze Medicare Advantage. https://ldi.upenn.edu/our-work/research-updates/six-ways-researchers-can-better-analyze-medicare-advantage-ma
  13. UNC Sheps Center. Medicare Data (20% Sample): Descriptive Statistics. https://www.shepscenter.unc.edu/data/medicare-data-20-sample/descriptive-statistics-2
  14. J-PAL. Medicare Data. https://povertyactionlab.org/fr/node/2524
  15. CHCS. Integrating Medicare and Medicaid Data to Support Improved Care for Dual Eligibles. https://www.chcs.org/usr_doc/Integrating_Medicare_and_Medicaid_Data_for_Duals.pdf
  16. 2025 Medicare Trustees Report(via Missouri Hospitals Association 摘要). https://www.mohospitals.org/resources/medicare-trustees-issue-2025-report/
  17. UCSF Pepper Center. CMS Data Reuse Initiative. https://peppercenter.ucsf.edu/cms-reuse
  18. OSU DataCore. CMS Claims. https://sites.google.com/view/osudatacore/coredata/cms-claims
  19. Duke Population Health. Medicare 5% Limited Data Set. https://populationhealth.duke.edu/medicare-5-limited-data-set
  20. U.S. Senate. Cassidy-Warren-Blackburn-Cortez Masto letter to CMS on MA data collection. https://www.cassidy.senate.gov/newsroom/press-releases/cassidy-warren-blackburn-cortez-masto-call-for-better-medicare-advantage-data-collection-reporting

§10.4 人工校验

内容模块 审核者 审核方式 审核状态
§1 概览与 §3 规格(费率/抽样/流程) 千方病案医学编辑部 对照 CMS/ResDAC 原文逐项核对 ✅ 已通过/已验证
§2 医学背景与流行病学数字 千方病案医学编辑部 对照 Trustees/KFF/MCBS 原文核对 ✅ 已通过/已验证
§4 数据字典与 §6 代码 千方病案医学编辑部 字段对照 Record Layout 惯例;代码静态走查 ✅ 已通过/已验证
§5 划分策略与 §7 偏倚分析 千方病案医学编辑部 对照 MedPAC/GAO/KFF 证据核对 ✅ 已通过/已验证
§8-§10 引用与声明 千方病案医学编辑部 链接可达性与引用完整性检查 ✅ 已通过/已验证

§10.5 AI 生成章节标注

本词条全部章节由 AI 辅助起草,经上述人工模块化校验后发布;数据、费率、流程类硬事实以官方来源(CMS/ResDAC/GAO/MedPAC)为准。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • GEMINI — 共享标签:公共卫生与流行病学 / 临床电子病历 / 卫生服务研究 / 真实世界数据
  • nhs-hes — 共享标签:公共卫生与流行病学 / 临床电子病历 / 卫生服务研究 / 真实世界数据
  • cms-de-synpuf — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究
  • marketscan — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
  • optum-clinformatics — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
  • seer-medicare — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
  • premier-pinc-ai — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究 / 真实世界数据
  • who-gho — 共享标签:公共卫生与流行病学 / 卫生服务研究
  • snds — 共享标签:公共卫生与流行病学 / 医保理赔 / 真实世界数据
  • meps — 共享标签:公共卫生与流行病学 / 医保理赔 / 卫生服务研究

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集