HCUP-NEDS — 全美急诊样本 AI-Ready Wikipedia

全美最大急诊就诊抽样库:每年 3,000 万+ 就诊

来源 Agency for Healthcare Research and Quality (AHRQ) — Healthcare Cost and Utilization Project (HCUP) url: https://www.hcup-us.ahrq.gov/nedsoverview.jsp发布时间: 2026-09-14最后更新: 2026-09-25 阅读 48
HCUP-NEDS — 全美急诊样本 AI-Ready Wikipedia

信息速览

数据集名称HCUP-NEDS — 全美急诊样本 AI-Ready Wikipedia
数据类型约 3,000 万+ 就诊/年(未加权),加权估计 1.4 亿+ 就诊/年,2006–2023 数据年,每数据年 1,000 美元,CSV + SAS/Stata 装载程序
规模每年约 3,000 万+ 急诊就诊(就诊级记录,非患者级)
接入方式Agency for Healthcare Research and Quality (AHRQ) — Healthcare Cost and Utilization Project (HCUP) url: https://www.hcup-us.ahrq.gov/nedsoverview.jsp
AI 就绪度

数据集封面

HCUP-NEDS 全美急诊样本 — 急诊就诊研究旗舰库 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 全美急诊样本(HCUP-NEDS)
英文全称 Nationwide Emergency Department Sample (NEDS), Healthcare Cost and Utilization Project (HCUP)
别名/简称 NEDS;HCUP-NEDS;全美急诊样本
疾病分类(ICD-11) 全病因急诊就诊(如 BA41 急性心肌梗死、CA22 慢性阻塞性肺疾病、CA23 哮喘)
SNOMED CT 22298006(心肌梗死)、13645005(慢性阻塞性肺疾病)、195967001(哮喘)等
数据模态 急诊就诊出院摘要(含死亡结局、费用与抽样权重)
AI 任务类型 就诊级结局预测、住院转化预测、费用估计、疾病负担趋势监测
样本总数 每年约 3,000 万+ 就诊(2022 年未加权 3,200 万)
数据大小 2006 版 CSV 约 11 GB;官方建议预留 60–100 GB 工作空间
数据格式 CSV(附 SAS/Stata 装载程序)
许可证 HCUP Data Use Agreement(付费商业许可)
访问级别 商业许可
DUO 标签 HMB(生物医学研究用途;HCUP DUA 另禁再识别与再分发)
语言 英语
首发日期 2006(首个数据年)
最后更新 2023(数据年,截至 2026-09)
发布机构 AHRQ / HCUP
官方主页 https://www.hcup-us.ahrq.gov/nedsoverview.jsp
下载地址 HCUP Central Distributor(https://www.distributor.hcup-us.ahrq.gov/)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 有官方抽样权重、分层变量与 SAS/Stata 装载程序,但无官方数据划分与一键建模脚本,需自行实现加权分析与费用处理
页面状态 published

§0 E-E-A-T 信任与审核声明

  • 医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(急诊就诊流行病学、ICD-11/SNOMED CT 映射)、§7 质量评估与偏倚分析。
  • 数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HCUP-NEDS 要求用户完成 HCUP Data Use Agreement(DUA)在线培训课程并签署 DUA 后方可获取数据。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§1 数据集概览

§1.0 📌 30 秒速览

这是什么? NEDS(Nationwide Emergency Department Sample,全美急诊样本)是由美国医疗研究与质量局 AHRQ 在 HCUP 项目下发布的急诊就诊数据库。它不是把全美每一家医院的记录都装进来,而是对参与州的医院所属急诊科做约 20% 的分层概率抽样,把抽中医院的所有急诊就诊完整保留,再用抽样权重把样本放大为全国估计。未加权每年约 3,000 万+ 就诊记录,加权后代表超过 1.4 亿次全国急诊就诊。

为什么重要? 急诊科是美国医疗体系里最贴近"全人口入口"的场景:不分年龄、不分保险状态、全天候开放。要回答"美国一年有多少心肌梗死患者进了急诊、花了多少钱、多少人收进了病房、多少人死在急诊"这类全国性问题,NEDS 是公开可购的最大数据源,覆盖约 84.7% 美国人口与 83.9% 的美国急诊就诊(2022 年)。

我能用它做什么? 你可以做全国/区域层面的急诊利用、费用与结局统计;做伤病负担与趋势监测(如阿片、枪伤、中暑相关就诊);也可以构建就诊级机器学习任务,例如"从诊断编码预测该就诊是否收入住院"“预测急诊费用分位”,并用官方权重做全国代表性的模型评估。但它不能做患者级追踪、州级估计或与其他 HCUP 数据库关联。

§1.1 技术摘要

NEDS 的构造分三步。第一步,收集参与州数据组织提供的两套州级数据库:SEDD(State Emergency Department Databases)收录未收入同院住院的急诊就诊(治疗即离院、转往他院等),SID(State Inpatient Databases)收录经急诊收入同院住院的就诊。第二步,在两库都参与的州内,以人口普查区、创伤中心级别、城市/农村位置、教学状态、医院所有权五个变量分层,对医院所属急诊科做约 20% 系统随机抽样,并隐式按州与邮编前 3 位排序以保证地理代表性。第三步,为每条就诊记录计算就诊级权重 DISCWT(医院级另有 HOSPWT),使加权样本还原全国就诊总量。诊断与住院操作使用 ICD-9-CM(2006–2015 上半年)或 ICD-10-CM/PCS(2016 起)编码,急诊操作使用 CPT 编码。数据以 CSV 分发,附 SAS/Stata 装载程序。

这一设计的直接推论是:NEDS 的分析对象是"就诊"而非"患者",且估计精度的单位是抽样层而非州或县。理解了这两点,本词条后续关于权重、划分与坑点的所有建议都能归结到同一个原则——尊重抽样设计。

§1.2 战略价值

维度一:全国代表性的急诊研究基础设施。 NEDS 是美国公开可购的最大全支付方急诊数据库,2022 年未加权 3,200 万就诊、加权约 1.37 亿就诊。巨大的样本量意味着罕见病与罕见操作也有足够事件数,官方文档明确指出这使跨医院类型分析与相对不常见疾病研究成为可能。对于需要"全国口径"结论的卫生政策研究(如急诊费用、转诊模式、死亡结局),NEDS 提供的是抽样调查级的统计推断框架,而非简单的病历聚合。18 个数据年的连续性还赋予它一个稀缺能力:把"急诊体系如何随政策与人口结构演变"变成可量化的问题,这是绝大多数单中心数据集在原理上无法回答的。

维度二:医疗 AI 的"人口级分布"校准器。 多数 EHR 深度学习数据集(如 MIMIC 系列)来自单中心或少数中心,疾病谱与付费结构高度偏态。NEDS 覆盖 40 个州与哥伦比亚特区、城市与农村、教学与非教学、公立与私立医院,可以作为模型先验分布与基线发生率的校准来源:模型在单中心训练时学到的"住院转化率""费用分布"是否偏离全国真实分布,可以用 NEDS 加权统计直接检验。这种"分布对照"用法几乎不需要建模,就能显著提升研究的说服力。

维度三:方法学上"抽样调查思维"的教科书。 与把全部病历搬进仓库的"大数据"路线不同,NEDS 展示了调查统计的完整链条:显式分层、系统随机抽样、隐式排序控制地理代表性、权重扩展、复杂抽样方差。对 AI 团队而言,这份数据自带一套"如何在有限样本上做出全国推断"的标准答案——包括两个 10% 子样本的估计/验证拆分设计。这套思维在构建任何"全国代表性"医疗 AI 评测集时都可以直接移植。

§1.3 同类数据集横向对比

数据集 规模(每年) 模态 分析层级 与 NEDS 的差异化
NEDS 未加权 3,000 万+ 就诊 急诊就诊出院摘要 就诊级 急诊全病因、含治疗即离院与住院就诊两类
HCUP-NIS 约 700 万住院出院 住院出院摘要 就诊级 只覆盖住院,不含未入院的急诊就诊
HCUP-NRD 约 1,400 万记录 住院再入院(SID 患者链接) 患者级可跨年 有患者链接但仅限住院,无法追踪急诊
HCUP-KID 约 300 万记录(3 年一版) 儿童住院出院摘要 就诊级 聚焦儿科住院,非急诊场景
HCUP-NASS 全国门诊手术样本 门诊手术摘要 就诊级 手术室场景,与急诊互补
NHAMCS(CDC) 数千就诊/年(调查样本) 前瞻性全国调查 访视级 样本小但含诊疗过程细节,常被官方推荐为 NEDS 的交叉验证源
MIMIC-IV-ED 约 42.5 万就诊(2008–2019) 单中心 ED 电子病历(含生命体征) 就诊级(单中心) 深度特征丰富但无全国代表性,与 NEDS 互补

§1.4 版本时间轴

数据年 参与规模 关键变化
2006 24 个州,约 2,600 万记录 NEDS 首发,CSV 约 11 GB
2012 30 个州,约 3,100 万记录 文档建议预留 60–100 GB 工作空间
2015 35 个 HCUP Partner 组织 因 ICD-9-CM→ICD-10-CM/PCS 切换,数据年拆为两个文件
2016 全年 ICD-10-CM/PCS 自此诊断与住院操作使用 ICD-10 编码体系
2017 37 个组织 未加权 3,350 万就诊,加权 1.45 亿
2021 40 个州 覆盖持续扩大
2022 41 个组织,未加权 3,200 万、加权约 1.37 亿 新墨西哥州入框;无住院记录的 ED 被排除出抽样框
2023 40 个州 + 哥伦比亚特区 数据元素大改版:删除 HOSP_REGION、RACE 等,费用字段改名

上表只列关键节点;每次发布 HCUP 都在 Overview 页公布当版 What’s New,购买前建议通读当年条目——NEDS 的"版本破坏"几乎都发生在这些不起眼的公告里(2023 年的元素改版就是典型,见坑点 6)。

§1.5 典型应用场景

  1. 全国急诊疾病负担监测:用 DISCWT 加权统计特定病种(如 COPD、中暑、枪伤)的全国急诊就诊数与趋势,官方 HCUP Fast Stats 本身就基于 NEDS 发布此类统计。
  2. 住院转化预测:以就诊的诊断/操作编码与人口学特征为输入,预测该急诊就诊是否收入同院住院,辅助分诊资源规划研究。
  3. 费用与支付结构分析:按支付方、医院类型分析急诊费用分布,结合 cost-to-charge 比率把费用换算为成本。
  4. 医疗 AI 模型的全国基线校准:把单中心模型的发生率、费用分布与 NEDS 加权全国分布对照,检验泛化性。
  5. 政策评估的前后对照:利用 2006–2023 的长时序,做政策实施前后的中断时间序列分析(需处理 ICD 切换断点)。
  6. 教学与方法学训练:NEDS 是教授"复杂抽样 + 医疗行政数据"的天然教材——抽样设计、权重、方差、报告规范一应俱全,且有免费 HCUPnet 可核对。

§2 医学背景

§2.1 ICD-11 对照编码表

NEDS 本身使用 ICD-9-CM(2006–2015 上半年)与 ICD-10-CM/PCS(2016 起)编码,不使用 ICD-11。下表给出急诊场景中高频病种在两套体系间的对照,便于 AI 团队把 NEDS 标签映射到现代术语标准。

类别 ICD-11 编码 中文名称 ICD-10-CM 对应 说明
急性心肌梗死 BA41 急性心肌梗死 I21 急诊高危胸痛的主要转归
慢性阻塞性肺疾病急性加重 CA22 慢性阻塞性肺疾病 J44 急诊常见呼吸系统主诉
哮喘急性发作 CA23 哮喘 J45 儿童与成人急诊高频病种
肺炎 CA40 肺炎 J18 急诊感染性疾病代表
焦虑与恐惧相关障碍 6B0 焦虑与恐惧相关障碍 F41 急诊精神行为类就诊代表
脓毒症 1G40 脓毒症 A41 急诊危重症代表
损伤与中毒 按部位分码 损伤、中毒和外因 S/T 章 急诊创伤就诊的主体,按部位与外因分别编码

§2.1b SNOMED CT 映射表

标签 ICD-11 SNOMED CT 码 术语
心肌梗死 BA41 22298006 Myocardial infarction (disorder)
慢性阻塞性肺疾病 CA22 13645005 Chronic obstructive pulmonary disease (disorder)
哮喘 CA23 195967001 Asthma (disorder)
肺炎 CA40 233604007 Pneumonia (disorder)
焦虑状态 6B0 21897009 Anxiety (finding)
脓毒症 1G40 91302008 Sepsis (disorder)

§2.2 疾病与场景简介:美国急诊利用流行病学

急诊科是美国医疗体系中对全人群开放、无预约门槛的照护入口,其利用强度长期处于高位。按 NEDS 加权估计,2022 年全美急诊就诊约 1.37 亿人次,2017 年约 1.45 亿人次——相当于每 100 名居民每年 0.4 次左右的就诊强度。就诊谱系横跨三类:约八成左右的"治疗即离院"(treat-and-release)轻中症就诊、经急诊收入同院住院的重症就诊,以及少量转院与急诊死亡事件。支付方覆盖 Medicare、Medicaid、商业保险、自费与无费用人群,这使 NEDS 成为观察医保政策(如医疗补助扩张)对急诊利用影响的天然实验场。从 AI 视角看,急诊场景的核心预测问题是"入口分流":在信息有限(主诉、诊断码、人口学)的条件下预测资源使用强度(住院、操作、费用)与风险(死亡、转院),这与住院场景"信息充分的预后预测"有本质差异。

从数据结构看,NEDS 把这两类来源明确分工:SEDD 侧记录未收入同院住院的就诊(含治疗即离院、转往他院、急诊死亡等去向),SID 侧记录经急诊收住同院的就诊。这一分工决定了费用与操作字段的分布——治疗即离院就诊的费用在急诊费用字段,收住院就诊的费用拆分为急诊与住院两段(2023 年起住院段被移除)。建模者必须先确定研究人群属于哪一类,再决定读哪些文件、用哪些标签,否则会把两类"半个事件"拼成错误的研究对象。

急诊还是观察健康不平等的前哨:无保险与医疗补助人群把急诊当作主要照护入口,乡村医院关闭潮使农村急诊承担更重的转诊压力,这些结构性现象都以就诊级记录的形式沉淀在 NEDS 中,配合邮编收入四分位与都市属性字段可以量化分析。

§2.3 临床任务定义

  • 筛查/分诊辅助:预测就诊是否需要收住院或转入高级别机构,输入为诊断/操作编码、年龄、性别、支付方与医院特征;NEDS 可提供全国分布校准,但不含生命体征等床旁时序特征。
  • 诊断分组:把 ICD 编码聚合为临床分类(HCUP 自带 Clinical Classifications Software/Refined 工具族),做多标签分类或表征学习预训练。
  • 费用/成本估计:预测就诊费用分位或总费用,需处理费用缺失与"费用≠成本"问题。
  • 预后与结局:急诊死亡、转院去向的就诊级预测;受限于无患者链接,不能做再入院等纵向任务。

各任务的标签与口径约束:

任务 监督信号 口径约束
住院转化预测 收入同院住院 = 正类(SID 侧记录) 分母是全部就诊;转院就诊需按坑点 2 处理
急诊死亡预测 急诊死亡去向 事件占比很小,注意类不平衡与低事件数层的方差
费用估计 TOTCHG_ED(名义美元) 缺失非随机;2023 年收住院就诊费用缺失
疾病负担监测 特定 ICD 码/CCS 组 跨 2015/2016 需分段或桥接(坑点 4)

§2.4 患者人群表

维度 内容
来源 美国 40 个州与哥伦比亚特区的社区医院所属急诊科(2023 数据年)
时间 2006–2023 数据年(年度发布)
年龄 全年龄段;2012 起 90 岁及以上合并为单一类别
性别 男/女二分(FEMALE 字段)
种族 2022 及以前年份含 RACE 字段;2023 起被移除
就医类型 全支付方:Medicare/Medicaid/商业保险/自费/无费用/其他(PAY1)
覆盖人口 2022 年覆盖美国常住人口的 84.7% 与全部急诊就诊的 83.9%
居住地属性 邮编收入四分位(ZIPINC_QRTL)+ 都市/非都市(PL_NCHS2,2023 起)
医院谱系 城市与农村、教学与非教学、公立/私立非营利/私立营利、各级创伤中心(按层抽样)

§2.5 临床价值

对临床与政策研究而言,NEDS 的价值在于把"急诊发生了什么"从单中心轶事升级为全国统计事实:某病种急诊就诊量、住院转化比例、急诊死亡率、费用负担都可以给出带标准误的全国估计,并可跨 18 个数据年观察趋势。对 AI 而言,它提供了在人口级分布上检验模型输出合理性的参照系,以及一个足够大的"编码级"语料库用于预训练诊断码表征。

需要同时记住它的边界:NEDS 回答"发生了多少、花了几何、结局如何",但不回答"为什么"——它没有生命体征、检验检查、影像与文本病程,也没有就诊时间。凡是需要临床过程细节的问题,NEDS 的正确用法是提供全国分母与分布,把机制问题留给更细粒度的数据源。

§2.6 金标准对照表

属性 内容
划分方式 全国分层概率抽样(约 20% 医院所属急诊科),无训练/测试划分
标注方式 行政编码:认证编码员按 ICD-9-CM/ICD-10-CM 编码指南对出院摘要赋码(自动生成的分组字段如 CCS/CCIR 为程序派生)
标注者资质 参与州数据组织的专业医疗编码人员(遵循官方编码指南与州上报规范)
性质 回顾性、就诊级、全支付方行政数据库;是"急诊利用与费用"研究的事实标准数据源,与 CDC 的 NHAMCS 前瞻调查互为交叉验证

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
最新全国横断面估计 2023 数据年 数十 GB(建议 60–100 GB 工作空间) 框架最新,但注意区域/种族字段已删除、费用字段改名
跨年趋势分析 2016–2022(ICD-10 段)+ 2006–2015(ICD-9 段)分段处理 各年数十 GB 避免编码切换断点污染趋势
机器学习建模入门 任意单一年份 2016–2022 约 11–60 GB 字段稳定、全年 ICD-10-CM、价格固定 1,000 美元/年
患者级纵向分析 不适用,改用州级 SID/SEDD 或 HCUP-NRD — NEDS 无患者标识、不可与其他 HCUP 库关联

§3.1 模态详情

NEDS 的单一模态是急诊就诊出院摘要(ED discharge abstract):每条记录对应一次急诊就诊的结算摘要,包含就诊去向(离院/转院/收住院/急诊死亡)、诊断码列表、操作码列表、人口学(年龄、性别)、支付方、邮编收入四分位、居住地都市属性,以及医院属性(区域、都市/农村、教学状态、所有权、创伤级别)与费用字段。文件组织为 4 个就诊级文件 + 1 个医院级文件,逐文件职责如下:

文件 层级 来源 核心内容 关联键
Core 就诊级 SEDD + SID 全部急诊就诊:人口学、支付方、权重、就诊去向、数据年 KEY_ED
Supplemental ED 就诊级 SEDD 未收住院就诊的补充字段(急诊费用、离院去向等) KEY_ED
Supplemental Inpatient 就诊级 SID 收住院就诊的住院段:住院总费用、住院时长、ICD 住院操作码 KEY_ED
Diagnosis and Procedure Groups 就诊级 HCUP 派生 诊断码列表(I10_DX1 起)、操作码列表、官方分组(CCS/CCIR 等) KEY_ED
Hospital 医院级 AHA/TIEP 医院属性(区域、城乡、教学、所有权、创伤级别)与 HOSPWT HOSP_ED

注意两点官方口径:其一,Supplemental ED 与 Core 通过 KEY_ED 一对一连接;其二,收住院就诊的住院操作码来自 SID 住院记录,无法确认是否在急诊内实施。KEY_ED 是跨文件主键。

§3.2 按年份样本规模表

数据年 参与州/组织 未加权就诊数 加权估计
2006 24 州 约 2,600 万 —
2012 30 州 约 3,100 万 —
2017 37 个组织 3,350 万 1.45 亿
2022 41 个组织 3,200 万 约 1.37 亿

按就诊去向的构成,NEDS 记录可分为五类 ED 事件:治疗即离院、转入他院、收入同院住院、急诊死亡、离院方式未知/其他;官方文档提示"事件类型未知"的记录本身存在偏倚(部分州缺失比例高)。2022 数据年的 41 个 HCUP Partner 组织为:阿拉斯加、阿肯色、亚利桑那、加利福尼亚、科罗拉多、康涅狄格、哥伦比亚特区、佛罗里达、佐治亚、夏威夷、艾奥瓦、伊利诺伊、印第安纳、堪萨斯、肯塔基、马萨诸塞、马里兰、缅因、密歇根、明尼苏达、密苏里、密西西比、蒙大拿、新墨西哥、北卡罗来纳、北达科他、内布拉斯加、新罕布什尔、新泽西、纽约、俄亥俄、俄勒冈、罗得岛、南卡罗来纳、南达科他、田纳西、得克萨斯、犹他、佛蒙特、威斯康星与怀俄明——这些州合计覆盖美国常住人口的 84.7% 与全部急诊就诊的 83.9%。州清单逐年变化,做多年分析前务必查当年 Introduction 附录。

§3.3 格式表

组成 格式 说明
就诊级数据 CSV(逗号分隔,ASCII) 每数据年一组,自解压压缩包分发
医院级数据 CSV 与就诊级通过 HOSP_ED 关联
装载程序 SAS/Stata 脚本 官方提供装载与格式定义程序;R/SPSS 有社区示例
文档 PDF/网页 Introduction(当年)、Description of Data Elements、HCUP Methods Series

格式层面的三点工程提示:CSV 为 ASCII 纯文本,无 UTF-8 多语言问题;变量名与缺失码由官方装载程序权威定义,直接 read_csv 时务必核对表头与类型(费用、权重列按浮点读入);2015 年两个文件的表头与 Core 不同(分别对应 ICD-9 与 ICD-10 段),不要假设跨年表头一致。

§3.4 存储大小

2006 版全部 CSV 约 11 GB,装载进 SAS 约 9 GB;官方建议研究者预留 75–100 GB 工作空间(2006 版文档)或 60–100 GB(2012 版文档)。2022 版就诊级 CSV 体量显著大于 2006 版,实际解压后按当年装载程序为准。使用 pandas 全量读取不现实,建议 pyarrow 分块或数据库装载。

§3.5 标注方式

NEDS 的"标注"是行政编码而非研究性标注:参与州的编码员按官方指南把出院摘要转为 ICD-CM 诊断码/住院操作码与 CPT 急诊操作码;HCUP 在此之上用软件工具自动派生分组字段(如 CCS 临床分类、CCIR 慢病指标 v2025.1、Elixhauser 合并症等)。因此标签质量取决于编码实践,属于弱监督性质的真实世界标签。

派生分组的生成流程可以概括为:原始码 → HCUP 工具查表映射 → 分组字段随 Diagnosis and Procedure Groups 文件一并发布。这一流程是确定性的、版本化的,可复现性优于人工标注;代价是分组粒度固定,若你的任务需要更细的映射(如把 ICD-10-CM 细码映射到自有本体),需要自建映射层并处理版本漂移。

§3.6 标注者资质与一致性

编码由各州数据组织认证的医疗编码人员完成,遵循统一的 ICD-CM 编码指南与州上报要求;HCUP 不公开逐条标注者信息与标注者间一致性系数。跨州编码实践的系统性差异是已知的偏倚来源,官方文档建议分析前先做描述统计并按区域检查异常缺失。实践中的三个缓解动作:把"数据年 + 抽样层"作为标注环境的代理协变量;对关键标签做跨年稳定性检验;在论文 limitation 中明确行政编码与临床表型之间的语义距离。

§3.7 采集周期

按日历年采集与发布(2015 年除外——该数据年因编码切换拆分为两段)。新数据年通常在其后 1–2 年内通过 HCUP Central Distributor 发布,截至 2026-09 可购数据年为 2006–2023。各历史年份相互独立销售与下载,均自带当年装载程序与文档;历年 Introduction 在 HCUP-US 存档,构成完整的"数据谱系"记录链。价格按数据年计费,购买多年时预算线性增长。

§3.8 地域覆盖

参与州从 2006 年的 24 个增长到 2023 年的 40 个州 + 哥伦比亚特区(2022 年为 41 个 Partner 组织),2022 年框架覆盖美国常住人口的 84.7% 与全部急诊就诊的 83.9%。注意:州与医院地理标识不在 NEDS 文件中发布,抽样框不把"州"作为分层变量,因此不能做州级估计;2023 起连人口普查区字段也被移除,区域估计亦不可行。

参与规模扩大的关键节点:

数据年 参与州/组织数 说明
2006 24 州 首发框架
2012 30 州 隐式州/ZIP3 排序细节最完整的版本之一
2015 35 个组织 编码切换年份,数据年拆分
2017 37 个组织 覆盖 80.9% 人口
2021 40 州 框架基本成型
2022 41 个组织 新墨西哥州入框;无住院记录的 ED 出框
2023 40 州 + DC 区域字段移除,覆盖统计口径微调

§3.9 设备与医院属性规格

医院属性来自 AHA 年度调查数据库与创伤信息交换计划(TIEP):区域(2023 前含于 HOSP_REGION)、都市/农村(HOSP_URCAT4)、教学状态(HOSP_UR_TEACH)、所有权(HOSP_CONTROL)、创伤级别(HOSP_TRAUMA,因保密在部分年份折叠:I+II 所有年份折叠、I–III 于 2006–2010 折叠、III 与非创伤自 2011 起合并)。NEDS 不含任何医疗设备级数据。

§3.10 深度溯源链

急诊就诊事件 → 参与州数据组织收集的出院摘要(SEDD/SID)→ HCUP 统一格式转换与质量审查 → 分层抽样(NEDS_STRATUM)与权重计算(DISCWT/HOSPWT)→ HCUP Central Distributor 封装分发(CSV + 装载程序)→ 用户签署 DUA 后下载。每一环节都有官方文档可追溯:Introduction(当年版)记录抽样框与权重公式,Description of Data Elements 记录字段语义,Database Documentation 记录历年变化。

溯源链上的三个"审计锚点"值得写进你的数据文档:当年参与州清单(Introduction 附录)、当年权重公式与分层定义、当年 What’s New 元素变更列表。三者齐备,任何复现争议都能在文档层面闭环。

§4 数据结构

§4.0 目录树

数据年 2022 解压后的典型结构(文件名以当年装载程序为准):

neds_2022/
├── neds_2022_core.csv                 # 就诊级主文件:每行一次急诊就诊
├── neds_2022_supp_ed.csv              # Supplemental ED:治疗即离院/转院就诊补充字段(SEDD 来源)
├── neds_2022_supp_inpatient.csv       # Supplemental Inpatient:收住院就诊的住院字段(SID 来源)
├── neds_2022_dx_pr_grps.csv           # 诊断与操作分组:ICD 码列表 + 官方派生分组(CCS 等)
├── neds_2022_hospital.csv             # 医院级文件:医院属性 + HOSPWT
├── SAS/
│   ├── NEDS_2022_Core_Load.sas        # 官方 SAS 装载程序(定义变量名/格式/缺失码)
│   └── ...
├── Stata/
│   └── ...
└── docs/
    └── NEDSIntroduction2022.pdf       # 当年 Introduction(抽样设计与权重公式)

§4.1 DAIMS 字段字典(Core 文件核心字段)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
KEY_ED Integer NEDS 就诊记录唯一标识,连接 Core 与两个 Supplemental 文件 2022012345(示意) 主键、文件关联 无(官方定义) 无 正整数
YEAR Integer 数据年 2022 时间分层 无 无 2006–2023
HOSP_ED Integer 加密的医院急诊科标识(抽样聚类单位) 47(示意) 聚类稳健标准误、GroupKFold 不可跨年比较 无 正整数
NEDS_STRATUM Integer 抽样层编号(区域×创伤×城乡×教学×所有权) 15(示意) 复杂抽样设计对象 层随年份定义变化 无 正整数
DISCWT Float 就诊级抽样权重,代表该记录在全国中的就诊数 4.86 全国估计、加权损失 20% 抽样下权重多接近 5 无 正实数
AGE Integer 就诊时年龄(岁);2012 起 90+ 合并为 90 67 人口学特征、年龄分层 高龄段信息被截断 -9/-88 0–90
FEMALE Integer 性别(1=女,0=男) 1 人口学特征 编码来源差异 -9 0/1
PAY1 Integer 主要支付方:1 Medicare/2 Medicaid/3 私保/4 自费/5 无费用/6 其他 2 支付结构、公平性分析 州间支付方细分类不同 -9/-88 1–6
ZIPINC_QRTL Integer 患者邮编层面家庭收入四分位(1 最低–4 最高) 3 社会经济分层 邮编级生态学代理 -9/-88 1–4
PL_NCHS2 Integer 患者居住地属性:1 都市/2 非都市(2023 起替代 PL_NCHS) 1 城乡差异分析 分辨率较旧字段下降 -9/-88 1–2
I10_NDX Integer 该记录 ICD-10-CM 诊断码个数(2016 起) 9 复杂度特征、多标签输入 编码上限随年份变化 -9 ≥0
I10_NPR Integer 该记录 ICD 住院操作码个数(2016 起,收住院就诊) 2 住院段强度特征 位置不可辨(ED 或住院) -9 ≥0
TOTCHG_ED Float 急诊就诊总费用(名义美元;2023 改名 TOTCHG_ED_2023) 2,850(示意) 费用预测、负担估计 费用≠成本;缺失非随机 缺失即空 ≥0
HOSP_URCAT4 Integer 医院都市/农村位置分类 1(大都市)(示意) 医院分层特征 2023 起不再有折叠类别 -9/-88 1–4
HOSP_TRAUMA Integer 创伤中心级别(部分年份折叠) 2 创伤能力分层 折叠限制细分分析 -9/-88 1–4

医院级文件另有 HOSPWT(医院级权重,约等于 5);诊断与操作码列表(I10_DX1 起、CPT 列表)在 Diagnosis and Procedure Groups 文件中,不占 Core 文件列。

§4.2 标签分布

NEDS 的"标签"是开放集合:任何 ICD 码或官方分组都可作为监督信号。官方没有发布单一年份全量标签分布,但提供两个免费入口获取官方口径分布:HCUPnet 在线查询系统(任意病种 × 年份 × 分层的加权计数)与 HCUP Fast Stats(预设主题的全国趋势)。建模前的推荐做法是用这两个入口锚定目标标签的加权发生率,再对照自己的加权样本统计。

# 标签锚定:把自己的加权发生率与官方口径对表,差异应在小数点级别。
# y_hat_count = (df[y] * df["DISCWT"]).sum()        # 加权分子
# rate = y_hat_count / df["DISCWT"].sum()           # 加权发生率
# 对照:HCUPnet 查询同一病种、同一年份、同一分层的全国率。
# 若两者差距 > 5%,优先排查:缺失码未清洗、子集混入转院双记录、
# 就诊事件类型口径不一致(见坑点 2/3/7)。

§4.3 关键统计

  • 样本结构:约 20% 抽样率下,就诊级权重 DISCWT 的量级约为 4–5(每条样本代表约 5 条全国就诊);医院级权重 HOSPWT 量级相近。
  • 就诊去向构成:五类 ED 事件中,治疗即离院占绝大多数,收入同院住院次之,急诊死亡占比很小;"事件类型未知"记录在部分州集中。
  • 转院记录约占 1.5%(转往其他急诊或急性照护医院),且只有转出、接收双方都被抽中时才同时出现两条记录。
  • 费用缺失:2015 年加权约 15.1% 的就诊缺急诊费用(收住院就诊缺 24.8%、治疗即离院缺 15.2%),缺失集中于西部。
  • 覆盖率:2022 年框架覆盖 84.7% 美国常住人口与 83.9% 美国急诊就诊;未覆盖部分由权重校正吸收,但稀有亚群(如某些乡村急诊模式)的方差会更大。
  • 空间粒度:患者侧只有邮编收入四分位与都市属性(2023 起二分);医院侧无州、无经纬度——任何"地理精细"分析都需要降级或换数据源。

权重计算公式(官方 Introduction 原文口径):

权重 公式 含义
DISCWT [DNs(universe) ÷ ADNs(sample)] × (4 ÷ Qi) 层 s 内就诊的全国代表数;Qi 为该医院贡献数据的季度数(通常为 4)
HOSPWT Ns(universe) ÷ Ns(sample) 层 s 内医院的全国代表数;20% 抽样下约等于 5

§4.4 数据层级

数据年 (YEAR)
└── 抽样层 (NEDS_STRATUM,层内含 ≥2 家抽样 ED)
    └── 医院急诊科 (HOSP_ED,医院级文件给 HOSPWT)
        └── 就诊 (KEY_ED,Core + Supplemental ED [+ Supplemental Inpatient])
            └── 编码列表 (诊断 ICD-CM / 操作 CPT,在 Dx & Procedure Groups 文件)

关键点:"患者"这一层级不存在。同一患者一年内多次就诊会表现为多条独立记录,且无法识别;跨年同样不可链接。机器学习中的"实例"只能是 KEY_ED,聚类/分组单位只能是 HOSP_ED 或 NEDS_STRATUM。

跨文件装配示例:

# 装配一次完整的"治疗即离院"就诊画像:
# Core(人口学+权重)⨝ Supplemental ED(急诊费用+去向)
import pandas as pd

core = pd.read_parquet("neds_2022/core_clean.parquet")
supp_ed = pd.read_csv("neds_2022/neds_2022_supp_ed.csv",
                      usecols=["KEY_ED", "TOTCHG_ED", "DISP_ED"])  # 列名以当年文档为准
visit = core.merge(supp_ed, on="KEY_ED", how="left", validate="one_to_one")
print(visit[["KEY_ED", "DISCWT", "TOTCHG_ED"]].head())

§4.5 缺失值与信息性缺失

字段/情形 缺失模式 官方口径 处理建议
TOTCHG_ED(急诊费用) 非随机缺失,2015 加权 15.1%,收住院就诊达 24.8%,集中于西部 官方建议"例数 × 平均费用"估计总费用 加权分析 + 缺失机制敏感性分析;勿直接按行求和
RACE(种族) 2022 及以前部分州上报;2023 起整列移除 2023 版 What’s New 明示删除 跨年公平性分析需降级到 2022 或改用其他来源
PL_NCHS → PL_NCHS2 2023 起分辨率从多类降为两类 官方明示合并 跨年模型按年份选择字段并记录语义差异
TOTCHG_IP(住院费用) 2023 起删除;收住院就诊的 TOTCHG_ED_2023 置缺失 官方明示 2023 费用模型只覆盖治疗即离院就诊
ED 事件类型 部分州未知比例高,缺失有偏 官方 Limitations 明示 分析前按层做缺失描述统计
通用编码 HCUP 缺失码 -9(缺失)、-88(不适用)等 Description of Data Elements 加载时显式替换为 NaN,勿当真实数值
高龄段 90 岁及以上合并为 90(2012 起全 HCUP 全国库口径) 官方统一截断 年龄特征以"90+"类别参与建模,勿按连续值外推
医院属性折叠 HOSP_TRAUMA 部分年份折叠(I+II;III 与非创伤自 2011 合并) 官方明示 创伤级别分析按当年折叠口径分组

§5 划分与使用建议

§5.1 官方划分

官方没有提供训练/验证/测试划分,因为 NEDS 是统计调查型数据库而非基准数据集。但官方设计留了口子:约 20% 抽样率使样本可以拆成两个 10% 子样本,分别用于模型估计与验证(官方文档原话:“enables the user to split the NEDS into two 10% subsamples for estimation and validation of models”)。这是官方唯一认可的划分思路。

需要强调:把 20% 样本随机对半拆开后,每一半仍是有效的概率样本,各自的加权估计都指向同一个全国总体——这意味着两个 10% 子样本上的性能差异可以直接解读为抽样方差,而不是常见的"分布偏移"。这是 NEDS 相对普通医疗数据集做模型验证的一个独特优势:验证不确定性有清晰的统计含义。

§5.2 社区惯例划分

文献中常见三种做法:其一,按数据年划分(如用 2016–2019 训练、2020–2022 测试),适合考察时间外推;其二,按医院划分(以 HOSP_ED 分组的 GroupShuffleSplit/GroupKFold),避免同一医院的系统性行为差异把信息泄到测试侧;其三,随机按就诊划分——仅当模型不使用任何医院级特征时勉强可用,否则会高估性能。

划分方式 适用任务 优点 风险
按数据年(时间外推) 趋势/漂移研究 最接近部署现实 跨 2015 与 2023 断点时口径不可比
按医院(GroupKFold, 组=HOSP_ED) 就诊级结局预测 防医院特征泄漏 各折规模差异需检查
双 10% 子样本(官方思路) 统计建模与验证 与官方设计对齐 样本减半,方差增大
随机按就诊 仅限无医院特征的基线 实现最简单 医院聚类泄漏,性能虚高

推荐落地代码:

# 医院级分组划分 + 抽样层分层检查:保证每折覆盖主要 NEDS_STRATUM。
from sklearn.model_selection import GroupKFold
import pandas as pd

df = pd.read_parquet("neds_2022/core_clean.parquet",
                     columns=["KEY_ED", "HOSP_ED", "NEDS_STRATUM"])
gkf = GroupKFold(n_splits=5)
for fold, (tr, te) in enumerate(gkf.split(df, groups=df["HOSP_ED"])):
    tr_strata = df.iloc[tr]["NEDS_STRATUM"].nunique()
    te_strata = df.iloc[te]["NEDS_STRATUM"].nunique()
    print(f"fold {fold}: train {len(tr):,} rows / {tr_strata} strata; "
          f"test {len(te):,} rows / {te_strata} strata")

§5.3 泄漏风险(重点)

  • 转院对泄漏:同一次病情经 ED 转院会产生转出与接收两条记录(合计约 1.5%),若随机划分,同一次病情的两个"副本"会分属训练与测试两侧。缓解:建模前按转院去向字段过滤或把转院对视为同一组做分组划分。
  • 医院聚类泄漏:使用 HOSP_URCAT4、HOSP_TRAUMA 等医院特征时,同一医院就诊共享这些特征,随机划分会让模型"记住医院"。缓解:以 HOSP_ED 为组做划分。
  • 权重与划分的交互:任何子集上的全国估计仍须用 DISCWT 且方差计算要尊重抽样设计;把加权思想带进训练(加权损失)时,注意权重总和随子集变化。

§5.4 交叉验证建议

推荐 GroupKFold(组 = HOSP_ED)+ 分层(按目标标签),重复 5 折;报告折间方差。若做时间外推验证,保留最末 1–2 个数据年为留出集,并单独报告 ICD-10 段内的结果。

§5.5 外部验证建议

官方推荐的交叉核对渠道:HCUPnet(免费在线查询,任意加权统计口径)与 NHAMCS(CDC 前瞻性全国调查)。模型研究报告应把关键发生率与这两个入口的官方数字对表,作为外部效度证据。

§6 AI 就绪指南

§6.0 云端快速启动

NEDS 通过 HCUP Central Distributor 在线下载(全国库支持在线下载交付),无官方 Docker/托管镜像。云上工作流建议:申请购买后把 CSV 上传至对象存储,用 pyarrow/DuckDB 做列式查询,或装载进 BigQuery/Athena/Redshift 等;单数据年就诊级 CSV 在 4 核 16 GB 实例上用分块读取即可处理,无需 GPU。

§6.1 快速上手

以下代码假设你已购买并下载 2022 数据年,解压目录结构如 §4.0 所示。data_root 即 neds_2022/ 目录路径;最小可用子集是 Core 文件的少数几列(KEY_ED、YEAR、AGE、FEMALE、PAY1、DISCWT、HOSP_ED、NEDS_STRATUM),用 pyarrow 按列读取可在笔记本环境完成。

环境要求:Python 3.10+、pyarrow(或 pandas 2.x 自带 Arrow 引擎);不需要 GPU;首次按列读取 2022 Core 的 8 列约需 2–4 GB 内存与 1–2 分钟。

# 目录结构预期:data_root = "neds_2022/",其中包含 neds_2022_core.csv 等五个 CSV。
# data_root 拼接关系:文件路径 = os.path.join(data_root, "neds_2022_core.csv")。
# 最小可用子集:Core 文件 + 少量列;本例只读 8 列,内存占用约 2–4 GB。
import pyarrow.csv as pacsv
import pyarrow as pa

DATA_ROOT = "neds_2022"

cols = ["KEY_ED", "YEAR", "HOSP_ED", "NEDS_STRATUM",
        "DISCWT", "AGE", "FEMALE", "PAY1"]

read_opts = pacsv.ReadOptions(column_names=None)  # 2022 Core 首行为表头
table = pacsv.read_csv(
    f"{DATA_ROOT}/neds_2022_core.csv",
    read_options=read_opts,
    convert_options=pacsv.ConvertOptions(include_columns=cols),
)
df = table.to_pandas()
print(df.shape)            # 约 3,200 万行 × 8 列
print(df["DISCWT"].sum())  # 加权就诊总数,应接近官方加权估计(2022 约 1.37 亿)

第一行结果若与官方量级吻合(未加权约 3,000 万+),说明装载正确;第二步是检验权重是否被正确解析的"金标准"动作。

§6.2 数据获取

步骤 内容 备注
1 完成 DUA 在线培训课程 约 15 分钟,生成完成代码
2 在 HCUP Central Distributor 注册账号并完善 Profile 所有使用者(含合作者)都需各自完成培训并签 DUA
3 在线下单选择数据年并在线签署 DUA NEDS 每数据年 1,000 美元、学生价 200 美元(2016 起口径,截至 2026-09 官方宣讲材料)
4 在线下载全国库 自解压压缩包,含 CSV 与 SAS/Stata 装载程序

多年研究的项目预算参考(按官方定价口径估算):

研究设计 建议购买 预算量级 说明
单年横断面建模 1 个数据年(2016–2022 任选) 1,000 美元 学生价 200 美元
ICD-10 段趋势 2016–2022 共 7 年 7,000 美元 加权统计为主,无需全买
2006–2023 全时序 18 个数据年 18,000 美元 需处理 ICD 切换与 2023 改版
# 下载完成后(示例,文件名以下载页为准):
# neds_2022_core.exe → 双击/解压得到 neds_2022_core.csv
unzip -o neds_2022_core.zip -d neds_2022/
ls -lh neds_2022/   # 检查五个 CSV + SAS/Stata 目录是否齐全

注意事项:DUA 禁止再识别个人、禁止向未签署方再分发数据;引用与发表需按 HCUP 要求注明数据来源(见 §9.3)。

§6.3 预处理全流程

流程:CSV → Parquet(列式缓存)→ 缺失码清洗 → 权重与设计变量绑定 → 标签构造(ICD 分组)→ 费用处理。

<details>
<summary>预处理代码(约 40 行,点击展开)</summary>

# 预期目录:data_root 下有 neds_2022_core.csv 与 neds_2022_dx_pr_grps.csv。
# 本脚本产出:neds_2022_core.parquet(清洗后的列式缓存)+ 一张就诊级标签表。
import pyarrow.csv as pacsv
import pyarrow.parquet as pq
import pandas as pd
import numpy as np

DATA_ROOT = "neds_2022"

# 1) CSV → Parquet:一次性转换,后续读取快一个数量级
core = pacsv.read_csv(f"{DATA_ROOT}/neds_2022_core.csv").to_pandas()
pq.write_table(pa.Table.from_pandas(core), f"{DATA_ROOT}/core.parquet")

# 2) 缺失码清洗:HCUP 用 -9/-88 等负数标记缺失,必须显式转 NaN
na_codes = [-9, -88, -99]
for c in ["AGE", "FEMALE", "PAY1", "ZIPINC_QRTL"]:
    core[c] = core[c].mask(core[c].isin(na_codes))

# 3) 权重与设计变量:任何全国估计都要带 DISCWT + NEDS_STRATUM + HOSP_ED
design_cols = ["KEY_ED", "DISCWT", "NEDS_STRATUM", "HOSP_ED"]
assert core[design_cols].notna().all().all(), "设计变量不应缺失"

# 4) 标签构造示例:读诊断分组文件,把 I10_DX1.. 列摊平成多热向量
dx = pacsv.read_csv(
    f"{DATA_ROOT}/neds_2022_dx_pr_grps.csv",
    convert_options=pacsv.ConvertOptions(include_columns=["KEY_ED"]),
).to_pandas()  # 实际使用时按需加入 I10_DX1..I10_DXn 列(n 随年份变化)

# 5) 目标标签示例:是否收入同院住院(用 Core 的就诊去向/事件类型字段构造)
#    收住院就诊在 SID 侧,注意与 Supplemental Inpatient 文件关联(见坑点 7)
# 6) 费用处理:费用缺失非随机,保留缺失掩码列
core["TOTCHG_ED_missing"] = core["TOTCHG_ED"].isna().astype(int)

core.to_parquet(f"{DATA_ROOT}/core_clean.parquet", index=False)

</details>

费用→成本换算(配合 HCUP Cost-to-Charge Ratio 文件使用):

# HCUP 提供 CCR 文件:按医院组给出 费用/成本 比率。
# 预期输入:core_clean.parquet + ccr_<year>.csv(医院组 → CCR 映射,列名以 CCR 文档为准)。
import pandas as pd

ccr = pd.read_csv("neds_2022/ccr_2022.csv")  # 键:医院组标识
df = pd.read_parquet("neds_2022/core_clean.parquet")
df = df.merge(ccr, on=["HOSP_ED"], how="left")  # 实际键以 CCR 文档为准

# 成本 = 费用 ÷ CCR;仅对费用非缺失的就诊计算
df["COST_ED"] = df["TOTCHG_ED"] / df["CCR"]
# 全国总成本估计(例数×均值口径对缺失稳健):
total_cost = (df["COST_ED"].mean() * df["DISCWT"].notna().sum())  # 示意,正式版须加权

标准化建议:年龄除以 90(注意 90+ 已截断),费用做 log1p 后再按数据年 z-score;诊断码先经 HCUP CCS/CCIR 聚类再进模型可显著降维并跨 ICD 版本可比。

装载阶段高频错误速查:

现象 根因 修复
DISCWT 求和只有数百万量级 权重列被当字符串读入或列错位 显式 dtype=float 并对照 HCUPnet
AGE/PAY1 出现负值 HCUP 缺失码未清洗 按 -9/-88 等码表 mask 成 NaN
KEY_ED 合并后重复 转院双记录或跨年拼接未过滤 merge 加 validate;按数据年隔离
2023 年 KeyError/整列 NaN 元素改名或删除(坑点 6) 年份→列映射适配层
表头与文档不符 用错年份的 Description of Data Elements 核对当年文档与装载程序

预处理之后的统计建模(全国口径回归)参考实现:

# R:复杂抽样加权回归(官方推荐口径:strata + cluster + weight)
library(survey)
df <- read.csv("neds_2022/neds_2022_core.csv")
des <- svydesign(ids = ~HOSP_ED, strata = ~NEDS_STRATUM,
                 weights = ~DISCWT, data = df, nest = TRUE)
fit <- svyglm(y_admit ~ AGE + FEMALE + factor(PAY1), design = des)
summary(fit)   # 系数与标准误均已按抽样设计校正
# Python:statsmodels 复杂调查近似(仅当忽略层内相关可接受时使用;
# 严格口径请用 R survey / SAS SURVEYREG)
import statsmodels.api as sm
import pandas as pd

df = pd.read_parquet("neds_2022/core_clean.parquet")
X = sm.add_constant(df[["AGE", "FEMALE"]])
glm = sm.GLM(df["y_admit"], X, family=sm.families.Binomial(),
             freq_weights=df["DISCWT"]).fit()   # freq_weights 复现加权点估计
print(glm.summary())  # 注意:标准误未校正层内聚类,谨慎用于推断

§6.4 PyTorch DataLoader 完整示例

任务:以 ICD-10 多热向量 + 人口学特征预测该急诊就诊是否收入同院住院;按医院(HOSP_ED)分组划分,返回加权样本供加权损失使用。

<details>
<summary>PyTorch Dataset 与 DataLoader(约 55 行,点击展开)</summary>

# 预期输入:core_clean.parquet(§6.3 产出),并已把诊断码多热矩阵存为 X.npz(行序与 df 对齐)。
# 目录结构:data_root 下 core_clean.parquet + X.npz + y_admit.npy + group_hosp.npy。
import numpy as np
import pandas as pd
import torch
import torch.nn as nn
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit

DATA_ROOT = "neds_2022"

class NEDSVisitDataset(Dataset):
    """NEDS 就诊级数据集:X = [诊断多热 | 人口学],y = 是否收住院,w = DISCWT 权重。"""
    def __init__(self, indices: np.ndarray):
        self.X = np.load(f"{DATA_ROOT}/X.npz")["X"]          # sparse csr 亦可按需改造
        self.y = np.load(f"{DATA_ROOT}/y_admit.npy")
        self.w = df.loc[indices, "DISCWT"].to_numpy(np.float32)  # 加权损失用
        self.idx = indices

    def __len__(self):
        return len(self.idx)

    def __getitem__(self, i):
        j = self.idx[i]
        x = (torch.from_numpy(self.X[j].toarray()).float().squeeze(0)
             if hasattr(self.X[j], "toarray") else torch.from_numpy(self.X[j]).float())
        return x, torch.tensor(self.y[j], dtype=torch.long), torch.tensor(self.w[i], dtype=torch.float)

class MLPClassifier(nn.Module):
    """加权多标签/二分类基线:输入多热诊断向量 + 人口学。"""
    def __init__(self, in_dim: int, hidden: int = 256, dropout: float = 0.3):
        super().__init__()
        self.net = nn.Sequential(
            nn.Linear(in_dim, hidden), nn.ReLU(), nn.Dropout(dropout),
            nn.Linear(hidden, hidden), nn.ReLU(), nn.Dropout(dropout),
            nn.Linear(hidden, 1),
        )

    def forward(self, x):
        return self.net(x).squeeze(-1)

df = pd.read_parquet(f"{DATA_ROOT}/core_clean.parquet",
                     columns=["KEY_ED", "DISCWT", "HOSP_ED"])
groups = df["HOSP_ED"].to_numpy()
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(df, groups=groups))  # 医院级分组划分,防泄漏

train_loader = DataLoader(
    NEDSVisitDataset(train_idx), batch_size=4096, shuffle=True,
    num_workers=4, pin_memory=True,
)
test_loader = DataLoader(
    NEDSVisitDataset(test_idx), batch_size=8192, shuffle=False, num_workers=4,
)

model = MLPClassifier(in_dim=X_DIM)        # X_DIM = 诊断多热维度 + 2(AGE/FEMALE)
criterion = nn.BCEWithLogitsLoss(reduction="none")  # 逐样本损失,供加权
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-4)

# 加权训练循环:损失乘 DISCWT 后按权重归一,等价于加权对数似然
def run_epoch(loader, train: bool = True):
    model.train(train)
    total, total_w = 0.0, 0.0
    for x, y, w in loader:
        with torch.set_grad_enabled(train):
            logits = model(x)
            loss_vec = criterion(logits, y.float())
            loss = (loss_vec * w).sum() / w.sum()
            if train:
                optimizer.zero_grad()
                loss.backward()
                optimizer.step()
        total += (loss_vec * w).sum().item()
        total_w += w.sum().item()
    return total / total_w  # 加权平均损失

</details>

§6.5 坑点 8 个(真实特有失败模式)

⚠️ 坑点 1:不做加权直接算"全国数字"(分类:评估误用)

问题:NEDS 是 20% 分层抽样,每条记录只代表约 5 条全国就诊。直接对样本求均值/求和,得到的既不是全国估计,方差也完全错误;官方文档明确要求"produce national estimates, weights MUST be used"。
症状:你的"全美急诊就诊 800 万"与官方 HCUPnet 同口径的 1.37 亿相差数倍;论文审稿被问"为什么不用 DISCWT/survey 设计";置信区间窄得离谱。
解决:

  1. 简单方法:所有总量估计乘以 DISCWT;率的估计用加权分子/加权分母。
  2. 进阶方法:用复杂抽样设计计算方差——R:svydesign(ids=~HOSP_ED, strata=~NEDS_STRATUM, weights=~DISCWT) + svymean/svyglm;SAS:PROC SURVEYMEANS 指定 STRATA NEDS_STRATUM; CLUSTER HOSP_ED; WEIGHT DISCWT;;Stata:svyset HOSP_ED [pweight=DISCWT], strata(NEDS_STRATUM)。方差用 Taylor 线性化(官方 Methods Series 报告给出推导)。
  3. SOTA 方法:域估计(domain estimation)处理子人群;把加权统计与 HCUPnet 官方数字逐项对表作为单元测试;模型评估采用加权 AUC/加权 Brier 并报告设计效应。
    参考:Introduction to the NEDS(当年版)“Calculating National Estimates”;HCUP Methods Series #2003-02;热相关就诊研究(IJERPH 2022, DOI 10.3390/ijerph192214781)演示了 DISCWT + Taylor 线性化的完整实践。

⚠️ 坑点 2:转院就诊被记成两条(分类:数据泄漏)

问题:患者从 A 院 ED 转往 B 院时,产生"转出"与"接收"两条就诊记录(合计约占 NEDS 的 1.5%),且只有两家医院都被抽中时两条才会同时出现在数据里。把这两条当独立事件会重复计数,随机划分还会把同一次病情的两个副本拆进训练/测试两侧。
症状:转诊链条研究里事件数偏大;随机划分下模型在同源"双记录"上的验证分数虚高;按就诊去向聚合时"转院"一格与文献口径对不上。
解决:

  1. 简单方法:结局建模中把"转往他院"就诊单独分层或剔除,官方口径转院仅约 1.5%,剔除的偏倚可控并报告。
  2. 进阶方法:以"离院去向 = 转院"为键把转出记录与其同层接收记录做敏感性分析对照(含/不含两种口径都报告);划分时把同一年份同层的转院链视为同一组做分组划分。
  3. SOTA 方法:需要完整转诊链时改用州级 SEDD/SID(有患者链接字段)重建链路,再回到 NEDS 做全国加权。
    参考:Introduction to the NEDS, 2015/2016 “Limitations” 一节。

⚠️ 坑点 3:把就诊级当患者级用(分类:数据泄漏 / 标签理解)

问题:NEDS 的分析单位是"就诊"不是"人":同一年内同一患者多次来急诊就是多条记录,且数据里没有任何患者标识。所有"患者轨迹/再入院/依从性"类任务在 NEDS 上原理上不可行。
症状:用"历史就诊"特征训练出的模型离线 AUC 虚高(同一人的相邻就诊高度相似且可能跨训练/测试侧);描述统计把就诊数当患病人数;审稿意见直指 unit of analysis 错误。
解决:

  1. 简单方法:把研究问题限定在就诊级(“该就诊是否收住院/花多少钱”),语言与图表全部使用"就诊"口径。
  2. 进阶方法:若必须引入聚类结构,用 HOSP_ED 做混合效应模型或分组划分 + 聚类稳健标准误,明确这是"医院内相关"而非"患者内相关"。
  3. SOTA 方法:患者级问题改用 HCUP-NRD(住院再入院有验证过的患者链接)或州级 SID/SEDD。
    参考:Introduction to the NEDS, 2015 “encounter-level records, not patient-level”;HCUP Fast Stats “Unit of Analysis”。

⚠️ 坑点 4:跨 2015/2016 的 ICD 断点(分类:预处理陷阱)

问题:美国于 2015-10-01 从 ICD-9-CM 切换到 ICD-10-CM/PCS;NEDS 2015 数据年因此拆成两个文件,2016 起才是完整 ICD-10 年度。两套编码的粒度与定义差异巨大(急诊就诊类型的部分定义在 ICD-10 下更宽或更窄),直接拼接 2006–2023 做趋势或训练,标签定义已经变了。
症状:跨切换点的病种计数出现"断崖"——例如某些症状类主诊在 ICD-10 下暴增;把 ICD-9 与 ICD-10 的码位当同一特征空间训练时大量标签只在单侧出现;CCS 分组在两段的编号/含义不完全一致。
解决:

  1. 简单方法:趋势分析以 2015-10-01 为切点分段报告;机器学习只用单一编码体系内数据(推荐 2016–2022)。
  2. 进阶方法:用 HCUP 官方临床分组(CCS/CCIR 等)做跨版本桥接标签——官方在 Diagnosis and Procedure Groups 文件中提供 ICD-10 版分组(2023 版含 CCIR v2025.1);或用 CMS General Equivalent Mappings(GEMs)做码级映射并标注映射不确定性。
  3. SOTA 方法:中断时间序列(ITS)设计显式建模切换断点;对映射做双向 GEM 校验与人工抽查,报告映射覆盖率。
    参考:HCUP Fast Stats “Clinical Coding for Emergency Department Visits”;NEDS Overview “File Structure”。

⚠️ 坑点 5:费用 ≠ 成本,且缺失非随机(分类:标签理解)

问题:TOTCHG_ED 是医院账面费用(charge)而非成本(cost),且缺失严重且非随机:2015 年加权 15.1% 缺失,收住院就诊达 24.8%,缺失集中于西部。直接对未缺失行求和/求均分会产生系统性偏倚,把 charge 当 cost 报告则高估资源消耗。
症状:全国总费用估计比官方 HCUP 统计简报高出 10%–20%;费用模型在西部医院上系统偏低;把"log 费用"解释为"成本"被卫生经济审稿人退稿。
解决:

  1. 简单方法:按官方建议用"加权例数 × 加权平均费用"估计总费用(对缺失稳健的口径)。
  2. 进阶方法:用 HCUP Cost-to-Charge Ratio(CCR)文件把费用换算为成本;按医院层(区域 × 城乡 × 教学 × 所有权)分层比较缺失模式,把"费用缺失掩码"作为特征或做分层加权。
  3. SOTA 方法:多重插补(含区域、支付方、医院层的辅助变量)+ 完整报告插补前后估计差异;2023 年注意 TOTCHG_IP 已删除、收住院就诊的 TOTCHG_ED_2023 置缺失,费用模型在该年只覆盖治疗即离院就诊。
    参考:Introduction to the NEDS, 2015 “Missing Values” 与费用缺失统计;NEDS Overview “What’s New in the 2023 NEDS”。

⚠️ 坑点 6:2023 元素大改版摧毁跨年 Pipeline(分类:工程陷阱)

问题:2023 数据年为保证全国估计精度做了元素级重构:删除 HOSP_REGION 与 RACE;NEDS_STRATUM/HOSP_ED/KEY_ED 重新编码以抹除区域信息;PL_NCHS 变为二分的 PL_NCHS2;TOTCHG_ED 改名 TOTCHG_ED_2023 且口径调整(西部区域调整);TOTCHG_IP 删除。按旧 schema 写死的 ETL 会在 2023 年上直接崩掉或静默产出 NaN。
症状:KeyError: 'HOSP_REGION';跨年 concat 后 2023 年区域/种族列全空;2023 年住院就诊费用整列缺失被误当数据 bug 上报。
解决:

  1. 简单方法:在装载层建立"年份 → 列映射表",字段改名/删除处显式分支;读取前用 schema.version == year 断言。
  2. 进阶方法:把共有的"稳定列子集"抽成适配层(KEY_ED、YEAR、AGE、FEMALE、PAY1、DISCWT、HOSP_ED、NEDS_STRATUM),版本差异收敛在适配层内并写单元测试。
  3. SOTA 方法:把 2023 视为新数据面板单独维护特征仓库;需要 2023 年统一口径时接受"无区域/无种族"的约束并重新审视下游所有依赖区域的分析。
    参考:NEDS Overview “What’s New in the 2023 AHRQ HCUP NEDS”。

⚠️ 坑点 7:只读 Core 文件就开工(分类:标签理解 / 工程陷阱)

问题:NEDS 是五文件结构:收住院就诊的住院费用、住院时长与操作码在 Supplemental Inpatient 文件;治疗即离院/转院就诊的补充字段在 Supplemental ED 文件;诊断码列表在 Diagnosis and Procedure Groups 文件。此外,对收住院就诊,官方明确无法区分某操作发生在急诊还是住院期间(操作码来自 SID 住院记录)。
症状:费用研究只覆盖了一部分就诊;把住院期间的阑尾切除术当"急诊操作"统计;用 KEY_ED 之外的字段关联文件得到错配。
解决:

  1. 简单方法:任何分析前先画清楚"我的字段在哪个文件",用 KEY_ED 连接 Core ↔ Supplemental ED,收住院就诊再连 Supplemental Inpatient。
  2. 进阶方法:按 ED 事件类型(五类)分层统计并报告;操作分析明确标注"SID 来源操作 = 住院期间,位置不可辨"。
  3. SOTA 方法:把 CPT(ED 操作)与 ICD-PCS(住院操作)建成两套独立特征通道,禁止跨通道混用标签语义。
    参考:NEDS Overview “AHRQ HCUP NEDS File Structure”;Introduction to the NEDS, 2016 Limitations。

⚠️ 坑点 8:州级推断与隐私折叠的边界(分类:偏倚陷阱)

问题:NEDS 不含州标识、抽样不以州分层、不可与其他 HCUP 库关联,官方明确反对州级估计;创伤级别等医院属性因保密被折叠(I+II 所有年份折叠;III 与非创伤自 2011 合并);2023 起连人口普查区也删除。同时 2006→2023 参与州从 24 涨到 40+DC,跨早期年份的"全国"覆盖本身在变化。
症状:想给某州卫健委做报告时发现无从下手;创伤 I 级 vs II 级的对比做不出来;2006–2010 长趋势里"参与州扩张"被误读为"急诊量暴涨"。
解决:

  1. 简单方法:只做官方支持的全国/区域估计(2023 前可用 HOSP_REGION;2023 起仅全国);创伤级别分析按当年折叠口径分组。
  2. 进阶方法:长趋势用"固定州子集"敏感性分析——用官方各年 Introduction 附录里的参与州清单锁定共同州集,对照全样本口径差异。
  3. SOTA 方法:州级问题直接购买对应州 SID/SEDD;把 NEDS 权重与 NHAMCS 交叉核对以确证全国口径的稳健性。
    参考:Introduction to the NEDS, 2016 Limitations;HCUP Overview Course “NEDS/Sample Design”。

§6.6 数据增强(安全与危险操作)

操作 判定 说明
诊断码 dropout(随机置零 1–2 个次诊断) ✅ 安全 模拟编码不全,保持主诊断不动
负采样(无事件就诊配对) ✅ 安全 用于对比学习预训练
加权重采样到自采样分布 ✅ 安全 等价于 Bootstrap,配合分层做不确定性
按 HOSP_ED 分组的病例级重加权 ✅ 安全 域自适应常用
对年龄/费用做随机噪声 ⚠️ 谨慎 年龄已 90+ 截断;费用重尾,噪声会破坏分位数结构
用权重反向放大罕见类生成"合成就诊" ❌ 危险 权重反映抽样设计而非标签分布,会造成双重校正
把转院对拆成两条独立样本训练 ❌ 危险 见坑点 2
混合 ICD-9 与 ICD-10 码向量 ❌ 危险 见坑点 4

§6.7 模型推荐表

任务 推荐模型 理由
住院转化预测 GBDT(XGBoost/LightGBM)+ 多热 ICD 特征 表格强基线,可解释,训练成本低
诊断码表征预训练 掩码自编码 / MLP-Mixer 于 CCS/CCIR 分组输入 编码空间稀疏,先聚类降维再预训练更稳
费用分位预测 LightGBM quantile / 两阶段 hurdle 模型 零膨胀 + 重尾,分位损失更贴政策口径
趋势建模 中断时间序列(GLM + 样条) 直接服务政策问题,可处理 ICD 断点
多任务(去向 × 费用) 共享底座多 heads,加权损失 联合学习去向与资源使用

§6.8 硬件需求表

场景 配置 说明
单年数据探索 8 核 / 32 GB 内存 / 200 GB SSD pyarrow 分块 + 列裁剪即可
多年 ETL 与建模 16 核 / 64 GB / 1 TB SSD 60–100 GB/年为官方空间口径,多年翻倍
GPU 训练 单卡 24 GB(如 A10/4090 级)足够 特征是稀疏表格,瓶颈在 IO 不在算力
数据库装载 BigQuery/Athena/DuckDB 任选 适合反复切片的探索型工作流

§6.9 评估指标代码

# 加权评估:任何"全国口径"的模型指标都应带 DISCWT 权重。
import numpy as np
from sklearn.metrics import roc_auc_score

def weighted_auc(y_true, y_score, w):
    # 按权重重排后交给 sklearn:重复样本近似(大样本下精确度足够)
    rng = np.random.default_rng(0)
    w = np.asarray(w, dtype=np.int64)  # DISCWT 约 4–5,先乘 1e4 取整做重复计数
    reps = np.maximum((w * 10_000).astype(np.int64), 1)
    idx = np.repeat(np.arange(len(y_true)), reps)
    noise = rng.normal(0, 1e-6, size=idx.shape)  # 打散重复序避免整块排序偏倚
    return roc_auc_score(y_true[idx], y_score[idx] + noise)

def weighted_sum(values, w):
    return float(np.sum(np.asarray(values) * np.asarray(w)))  # 全国估计口径

def weighted_brier(y_true, y_prob, w):
    # 加权 Brier 分数:全国口径的校准质量
    y_true, y_prob, w = map(np.asarray, (y_true, y_prob, w))
    return float(np.sum(w * (y_prob - y_true) ** 2) / np.sum(w))

def calibration_table(y_true, y_prob, w, n_bins: int = 10):
    # 按预测分位分桶,输出加权观测率,用于校准曲线
    edges = np.quantile(y_prob, np.linspace(0, 1, n_bins + 1))
    bins = np.clip(np.digitize(y_prob, edges[1:-1]), 0, n_bins - 1)
    rows = []
    for b in range(n_bins):
        m = bins == b
        rows.append({
            "bin": b,
            "weighted_n": float(w[m].sum()),
            "mean_pred": float(np.sum(w[m] * y_prob[m]) / np.sum(w[m])),
            "obs_rate": float(np.sum(w[m] * y_true[m]) / np.sum(w[m])),
        })
    return rows

配套动作:把同一口径的加权统计在 HCUPnet 上重查一遍,两者应一致(官方把 HCUPnet 作为权重正确性的核对工具)。

方差与设计效应的近似评估(分层自助法):

# 近似复杂抽样方差:按 NEDS_STRATUM 层内重抽 HOSP_ED 聚类(分层 cluster bootstrap)。
# 正式发表建议使用官方 Methods Series 的 Taylor 线性化/jackknife 口径。
import numpy as np

def stratified_cluster_bootstrap(df, statistic_fn, n_boot: int = 500, seed: int = 0):
    rng = np.random.default_rng(seed)
    stats = []
    for _ in range(n_boot):
        parts = []
        for _, grp in df.groupby("NEDS_STRATUM"):
            hosp = grp["HOSP_ED"].dropna().unique()
            if len(hosp) < 2:  # 层内至少 2 家(官方抽样设计原则)
                parts.append(grp)
                continue
            pick = rng.choice(hop, size=len(hop), replace=True)
            parts.append(grp[grp["HOSP_ED"].isin(pick)])
        boot = pd.concat(parts)
        stats.append(statistic_fn(boot))  # 如加权率/加权均值
    return np.std(stats)  # 设计方差的近似标准误

§6.10 MLOps 笔记

  • 版本即数据年:特征仓库按 data_year 分区,schema 变化(2015 拆分、2023 改版)必须体现在版本号里。
  • 设计变量入特征库:DISCWT、NEDS_STRATUM、HOSP_ED 与特征同等对待,任何服务化预测都不允许"忘带权重"。
  • 合规即代码:DUA 约束(禁止再识别、禁止再分发)应落入数据访问层:输出接口不暴露 HOSP_ED 明细组合,日志脱敏。
  • 漂移监控:监控 ICD 编码构成、支付方分布、费用缺失率的月度/年度漂移,重点盯 2015-10 与 2023 两个已知断点。
  • 可复现:保存当年 Introduction PDF 与装载程序 checksum,作为数据谱系的一部分。
  • 成本管控:购买数据年按需最小化——多数研究 2–3 个数据年即可支撑,避免"先买 18 年"的预算陷阱。
  • 协作合规:团队每位成员单独完成 DUA 培训并签署协议;数据存放于受控存储桶,访问日志留存,退出成员即时回收权限。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
覆盖/选择偏倚 框架排除联邦医院、康复/精神科等非社区机构;2006 年仅 24 州,2022 年覆盖 84.7% 人口与 83.9% 急诊就诊 中 使用权重;对参与州变化做敏感性分析
缺失非随机 急诊费用缺失集中西部(2015 加权 15.1%,收住院 24.8%) 高 例数×均值法、分层插补、缺失掩码
编码实践偏倚 州间 ICD 编码与上报口径差异;ED 事件类型缺失本身有偏 中 按层描述统计;跨州对比降级为全国口径
结构断点 ICD-9→ICD-10 切换(2015/2016);2023 元素删改 高 分段分析;固定列适配层;ITS 设计
生态学误用风险 无州标识、无患者链接,州级/患者级结论不可支撑 高 任务改用 SID/SEDD/NRD
抽样框动态变化 2022 起无住院记录的 ED 被排除出框,2012 起框定义持续收紧 低-中 读当年 Introduction 的框定义表
高龄信息截断 2012 起 90+ 合并为单一类别,老年亚组分析失去分辨率 低 高龄作为类别变量;注明截断口径
种族/区域字段移除 2023 起无 RACE 与 HOSP_REGION,公平性与区域分析链断裂 中(纵向研究) 分析链终止于 2022;跨年研究冻结旧口径

§7.2 标注质量

标签来自行政编码流程:认证编码员按 ICD-CM 指南赋码,HCUP 统一清洗并派生分组。没有公开的标注者间一致性(kappa)数字,但 ICD 编码体系本身有全国统一指南与审计(州数据组织承担上报质量责任)。对 AI 的含义:标签噪声是"系统性、州相关"的,不是随机的——这比随机噪声更危险,务必按层做敏感性分析。

标注层面 质量控制机制 已知弱点
诊断/操作赋码 统一 ICD-CM 编码指南 + 州上报规范 州间实践差异;ED 与住院操作位置不可辨
就诊去向/事件类型 官方五分类定义 部分州"未知"比例高且有偏
派生分组(CCS/CCIR 等) HCUP 软件工具自动生成,版本化发布 聚类粒度粗,可能抹平临床差异
费用字段 医院账单系统直接上报 缺失非随机(西部集中);charge≠cost

§7.3 泛化性评估表

场景 失效风险 证据
推广到非美国体系 高 ICD-10-CM/PCS、CPT、美国支付结构均属地化
推广到 2024 年后的急诊实践 中 2023 元素改版后口径变化;参与州构成继续演变
州/地方政策推断 高 官方明示不能做州级估计、州不标识
罕见病全国计数 低 官方强调大样本支持"相对不常见疾病"研究
危重精细表型(如创伤严重度细分) 中 HOSP_TRAUMA 折叠;无生理指标
患者纵向结局 不可行 无患者标识(官方 Limitations)
费用成本换算任务 中 依赖 CCR 文件的质量与时效;charge 与 cost 的医院账目差异
城乡急诊差异研究 低-中 PL_NCHS2(2023 起)为二分口径,分辨率有限

§7.4 伦理考量

NEDS 为脱敏出院摘要,不含直接标识符、不含精确服务日期,90 岁以上年龄合并,州与医院地理信息移除,因此研究多可豁免 IRB(文献中常见表述)。合规核心是 HCUP DUA:完成培训、签署协议、禁止再识别与再分发、发表时注明来源。把 NEDS 用于 AI 训练时,还应在模型卡中声明数据许可边界。

对 AI 场景有两点额外提醒:其一,虽然单条记录脱敏,但"医院级特征 + 罕见病 + 时间窗"的组合可能在极少数情况下提高推断风险,公开发布模型输出时应避免暴露可组合的细粒度单元格;其二,DUA 对数据存放位置与访问权限有约定,云上部署时把数据驻留与访问控制纳入合规审计范围。

§7.5 公平性

支付方(PAY1)、邮编收入四分位(ZIPINC_QRTL)、都市属性(PL_NCHS2)支持支付与城乡公平性分析;性别为二分字段。注意两个公平性相关缺口:其一,RACE 字段 2023 起被移除,种族差异纵向研究在 2023 后不可延续;其二,区域字段 2023 起删除,地域 disparities 分析受限。这些是官方为保护医院保密做出的取舍,而非数据质量缺陷。

公平性建模建议:把公平性分析限定在字段可用的数据年内并明确声明口径;涉及支付方与收入分层的结论,务必以加权口径报告(未加权的样本构成会系统性放大或缩小亚组差异);模型层面的亚组评估同样使用加权指标,与 §6.9 的评估代码保持一致。

§7.6 数据漂移

NEDS 的漂移有三种:真实利用漂移(如 2017→2022 加权总量从 1.45 亿降至约 1.37 亿);编码体系漂移(2015-10 切换);结构漂移(2023 字段删改、2022 框定义收紧)。建模时前两者表现为协变量与标签分布迁移,第三者直接改变特征可用性——建议把"数据年"作为一等公民纳入任何纵向模型的监控面板。

漂移类型 触发点 监控信号 应对动作
真实利用漂移 年度更新 加权总量、病种构成比 重训周期与阈值再校准
编码体系漂移 2015-10 切换 标签计数断崖、码位分布突变 分段模型 + GEMs 桥接
结构漂移 2022 框收紧、2023 字段删改 列存在性告警、覆盖率变化 schema 适配层 + 版本冻结
参与州扩张 2006–2023 持续 州清单(Introduction 附录) 固定州子集敏感性分析

§7.7 DAIMS 数据质量 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ 就诊级宽表,一就诊一行,列式裁剪友好
2 唯一标识 ✅ KEY_ED 全库主键,官方明示跨文件连接逻辑
3 特殊字符 ✅ ASCII CSV,编码统一,装载程序定义格式
4 重复行 ⚠️ 转院产生双记录(约 1.5%);重复就诊按设计存在
5 缺失编码 ✅ HCUP 缺失码(-9/-88 等)统一并有文档
6 标签标识 ✅ ICD-CM/CPT + 官方派生分组(CCS/CCIR)
7 罕见类分组 ✅ 年 3,000 万+ 样本使罕见病计数可行(官方声明)
8 偏倚评估 ⚠️ 官方 Limitations 覆盖框架与缺失偏倚,但无定量校正工具
9 数据字典 ✅ Description of Data Elements 逐年发布
10 信息性缺失解释 ✅ 费用缺失的规模与西部集中官方明示
11 设备记录 ❌ 无任何设备/耗材级数据
12 共线性 ⚠️ 医院属性(区域×城乡×教学×所有权)高度相关,未提供诊断
13 编码映射 ✅ 官方提供 ICD 切换说明与 CCS/CCIR 桥接分组
14 时间戳处理 ⚠️ 无就诊日期时间,仅数据年(与季度粒度缺失),纵向建模受限
15 划分建议 ⚠️ 官方仅给"两个 10% 子样本"思路,无基准划分
16 泄漏讨论 ⚠️ 官方不讨论 ML 泄漏;转院/医院聚类泄漏需自行处理(见 §6.5)
17 标签分布 ✅ HCUPnet/Fast Stats 提供官方加权分布
18 测量偏倚 ⚠️ 州间编码差异已知但无逐州校准系数
19 外部验证建议 ✅ 官方推荐 NHAMCS 对照与 HCUPnet 核对
20 版本记录 ✅ 逐年 What’s New + 历年 Introduction 存档
21 预处理脚本 ✅ 官方 SAS/Stata 装载程序;R 需自行实现
22 合规要求 ✅ DUA 培训 + 签署 + 发表署名规则明确
23 多模态对齐 ❌ 单一模态(行政摘要),无影像/文本/时序对齐问题
24 去标识化 ✅ 无直接标识、90+ 合并、州与医院地理信息移除

DAIMS 评分:18.5 / 24

评分解读:NEDS 在"结构完整性"(主键、宽表、数据字典、版本记录、合规)上接近满分,这是 30 余年官方数据工程积累的结果;扣分集中在三个结构性约束——无患者层级(重复与泄漏相关两项)、无设备与多模态、以及时间戳与划分指引的缺失。⚠️ 项大多不是数据"错误",而是调查型数据库与机器学习工作流之间的语义错位。

对你意味着什么:如果你的任务是就诊级分类/费用/趋势建模,NEDS 是可直接开工的 4 星级数据源,把 §6.5 的 8 个坑点清单变成 CI 测试即可规避绝大多数返工;如果你需要患者轨迹、设备信号或多模态对齐,请直接换数据源(NRD/州 SID/MIMIC 系列),在任何 NEDS 变体上"硬做"患者级模型都是方法学错误而非工程难题。

§7.8 外部验证矩阵

外部数据源/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
HCUPnet AHRQ 加权计数/率核对 加权总量一致性 官方把 HCUPnet 作为权重正确性核对工具 任何 NEDS 分析的"金标准"对表入口
NHAMCS CDC 全国急诊就诊率对比 就诊计数/率 官方文档附录提供两源可比基准(Appendix D) 官方推荐的跨源交叉验证调查
州级 SID/SEDD 各州数据组织 州级利用率 州内计数/率 仅限参与州、口径为全量而非抽样 州级问题的正确数据源(NEDS 不支持)
HCUP Statistical Briefs AHRQ 官方预计算全国统计 加权计数/率 与自算结果直接可比 现成的"答案册",快速验证口径

§8 基准性能与生态

§8.1 代表性研究基准

NEDS 没有官方排行榜(它不是竞赛基准),以下是经同行评审、可核 DOI 的代表性 AI/统计研究,方法与口径互不可直接比较(数据年、加权策略、任务定义不同):

表中年份、数据窗口与方法要点均取自对应论文或其公开版本;三篇研究覆盖"外因伤害监测、慢性病负担趋势、环境健康监测"三类典型用法,共同点是全部使用 DISCWT 加权并显式处理抽样设计——这正是 NEDS 上任何严肃分析的入场券。

研究 任务 数据年 方法要点 完整引用 代码
急诊枪伤流行病学 伤情分层与全国计数 2009–2012 ICD 外因码识别 + R survey/sqlsurvey 复杂抽样加权,与 HCUPnet 核对 《The epidemiology of firearm injuries managed in US emergency departments》, Injury Epidemiology, 2018. DOI 10.1186/s40621-018-0168-5(作者列表见 DOI 页) 论文内方法描述
COPD 住院与急诊负担趋势 疾病负担与费用趋势 2006–2011 NIS + NEDS 双库加权趋势,ICD-9 CCS 127 定义 COPD 与支气管扩张症住院/急诊就诊趋势与费用研究, Chest, 2016(CDC Stacks 编号 cdc_34640) 论文内方法描述
中暑相关急诊就诊趋势 环境健康监测 2008–2020 ICD-9/ICD-10 双段编码 + DISCWT + Taylor 线性化;989 家抽样 ED 《Emergency Department Visits for Heat-Related Emergency Conditions in the United States from 2008–2020》, IJERPH 19(22):14781, 2022. DOI 10.3390/ijerph192214781 论文内方法描述

§8.2 SOTA 总结与选型建议

NEDS 文献的主流范式仍是"加权统计 + 复杂抽样推断",机器学习建模文献相对少且多为表格模型。选型建议:先建 GBDT 加权基线(几乎不可被复杂模型超越,因为信息瓶颈在编码摘要本身);再做编码表征预训练;慎用深度序列模型——NEDS 没有真正的时序(无就诊内时间戳、无患者跨就诊序列)。

一条务实的项目路线:

  1. 第 1 周:单数据年装载(官方程序或 pyarrow),把 DISCWT/HOSP_ED/NEDS_STRATUM 三件套接入统计管线,用 HCUPnet 完成 5 个病种的加权计数对表。
  2. 第 2–3 周:构造 CCS/CCIR 多热特征,跑通 GBDT 加权基线(住院转化 + 费用分位两个任务)。
  3. 第 4 周起:加入第二个数据年做时间外推验证;把 8 个坑点的检查项固化为数据测试集。
  4. 发表前:按 §9.3 核对 HCUP 发表要求,报告中给出加权估计、标准误、设计效应与转院处理口径。

§8.3 评测协议

NEDS 社区事实标准:使用 DISCWT + NEDS_STRATUM + HOSP_ED 的复杂抽样推断;全国估计与 HCUPnet 对表;趋势研究必须声明 ICD 切点;多源对比时用官方 Appendix D 基准。报告应包含:加权估计点值、标准误、设计效应、以及是否做了转院/重复就诊处理。

投稿前自查清单(源自官方 Limitations 与社区惯例):

检查项 通过标准
权重与设计 全部全国口径数字使用 DISCWT,方差按分层/聚类设计计算
官方对表 ≥3 个关键估计与 HCUPnet 数值一致
口径声明 明确就诊级口径;未暗示患者级或州级结论
断点处理 跨 2015/2016 与 2023 的分析有显式分段说明
缺失处理 费用类估计说明缺失规模与处理方法
DUA 合规 数据来源署名;未再分发原始数据
数据集 机构 关系
HCUP-NIS AHRQ 住院侧姊妹库,同属全国库家族(NIS/NEDS/NRD/KID/NASS)
HCUP-NRD AHRQ 有验证患者链接的住院再入院库
HCUP-KID AHRQ 儿童住院样本
HCUP-NASS AHRQ 门诊手术样本
SID/SEDD AHRQ + 各州 NEDS 的州级母库,支持州级与患者级分析
NHAMCS CDC 急诊全国调查,官方推荐交叉验证源
HCUP Statistical Briefs AHRQ 基于 NEDS/NIS 的官方主题统计简报库,可作口径参照
NEDS Archive(历年 Introduction) AHRQ 各数据年抽样框与州清单存档
MIMIC-IV-ED MIT-LCP 单中心深度 ED 电子病历,特征更细但无全国代表性

§8.5 关键文献 Top 8

  1. Agency for Healthcare Research and Quality. Introduction to the NEDS, 2022. HCUP(含 41 个 Partner 组织、84.7% 人口覆盖与 2022 版抽样设计)— 当前数据年的权威文本。
  2. Agency for Healthcare Research and Quality. Introduction to the NEDS, 2021. HCUP, 2024(Issued March 2024)— 当年抽样框、权重与 Limitations 的权威文本。
  3. Agency for Healthcare Research and Quality. Introduction to the HCUP NEDS, 2012(Issued November 2014)— 20% 分层抽样与隐式州/ZIP3 排序的最详细版本。
  4. Agency for Healthcare Research and Quality. Introduction to the NEDS, 2015/2016(HCUP-US 网页版)— 费用缺失统计、转院双记录与创伤级别折叠的原始出处。
  5. Agency for Healthcare Research and Quality. Overview of the NEDS(HCUP-US 官方概览页)— 文件结构、2023 改版与购买入口的权威索引。
  6. Agency for Healthcare Research and Quality. HCUP Fast Stats — 基于 NEDS 的官方全国急诊统计工具,含 ICD 切换口径说明。
  7. 《The epidemiology of firearm injuries managed in US emergency departments》, Injury Epidemiology, 2018, DOI 10.1186/s40621-018-0168-5 — 复杂抽样加权分析的代表实现。
  8. 《Emergency Department Visits for Heat-Related Emergency Conditions in the United States from 2008–2020》, IJERPH, 2022, DOI 10.3390/ijerph192214781 — 跨 ICD-9/ICD-10 双段编码监测的范例。

另值得研读:COPD 与支气管扩张症住院/急诊趋势研究(Chest, 2016,CDC Stacks cdc_34640)展示了 NIS+NEDS 双库负担研究模板;AHRQ 的 Producing National HCUP Estimates 在线课程给出 SAS/R/Stata 三套加权分析演示。

§8.6 社区活跃度

NEDS 的"社区"是学术与政策社群:HCUP-US 维护出版物检索系统收录基于 HCUP 的论文;HCUPnet 与 Fast Stats 提供免编码查询;HCUP User Support(hcup@ahrq.gov)与 Central Distributor 提供官方答疑。每年有大量使用 NEDS 的急诊医学、卫生政策与卫生经济学论文发表,是急诊断面引用密度最高的全国性数据源之一。技术社区(GitHub/Stack Overflow)上可检索到 NEDS 的 R/Python 装载示例,但非官方维护,使用前请以官方装载程序为准。

参与方式建议:关注 HCUP-US 的 What’s New 公告获取新数据年与元素变更通知;官方在线教程(HCUP Overview Course 与 Producing National HCUP Estimates)覆盖从装载到加权推断的全流程;对装载与分析问题的官方支持渠道为 hcup@ahrq.gov 与 866-290-HCUP 免费热线。

§8.7 生态快照表

资源 类型 链接 活跃度 推荐理由
NEDS Overview 官方文档 https://www.hcup-us.ahrq.gov/nedsoverview.jsp 持续更新(截至 2026-09 含 2023 版) 一切的入口
NEDS Database Documentation 官方文档 https://hcup-us.ahrq.gov/db/nation/neds/nedsdbdocumentation.jsp 逐年归档 字段与历年变化的权威来源
HCUPnet 在线查询 https://datatools.ahrq.gov/hcupnet 免费可用 权重正确性对表工具
HCUP Fast Stats 统计仪表盘 https://datatools.ahrq.gov/hcup-fast-stats 免费可用 官方急诊趋势统计
HCUP Central Distributor 购买门户 https://www.distributor.hcup-us.ahrq.gov/ 商业运营 唯一正式获取渠道
HCUP 在线教程 教程 https://www.hcup-us.ahrq.gov/HCUP_Overview/HCUP_Overview/index508.jsp 免费 装载到加权推断的全流程示范
DUA 培训课程 合规工具 https://www.hcup-us.ahrq.gov/tech_assist/dua.jsp 免费 获取数据前的必修课

§9 相关资源与引用

§9.1 官方资源

§9.2 BibTeX 引用块

@techreport{hcup_neds_introduction_2022,
  author      = {{Agency for Healthcare Research and Quality}},
  title       = {Introduction to the {HCUP} Nationwide Emergency Department Sample ({NEDS}), 2022},
  institution = {Healthcare Cost and Utilization Project (HCUP)},
  address     = {Rockville, MD},
  year        = {2022}
}

@techreport{hcup_neds_introduction_2012,
  author      = {{Agency for Healthcare Research and Quality}},
  title       = {Introduction to the {HCUP} Nationwide Emergency Department Sample ({NEDS}), 2012},
  institution = {Healthcare Cost and Utilization Project (HCUP)},
  address     = {Rockville, MD},
  year        = {2012}
}

@techreport{hcup_neds_introduction_2015,
  author      = {{Agency for Healthcare Research and Quality}},
  title       = {Introduction to the {HCUP} Nationwide Emergency Department Sample ({NEDS}), 2015},
  institution = {Healthcare Cost and Utilization Project (HCUP)},
  address     = {Rockville, MD},
  year        = {2015}
}

@misc{hcup_neds_overview,
  author = {{Agency for Healthcare Research and Quality}},
  title  = {Overview of the Nationwide Emergency Department Sample ({NEDS})},
  howpublished = {HCUP-US, \url{https://www.hcup-us.ahrq.gov/nedsoverview.jsp}},
  year   = {2026},
  note   = {Accessed 2026-09-13}
}

@misc{hcup_neds_faststats,
  author = {{Agency for Healthcare Research and Quality}},
  title  = {{HCUP} Fast Stats: Emergency Department Visits for the Nation},
  howpublished = {\url{https://datatools.ahrq.gov/hcup-fast-stats}},
  year   = {2026},
  note   = {Accessed 2026-09-13}
}

§9.3 引用指南

HCUP 官方要求:使用 NEDS 发表时注明数据来源与数据年(推荐引用当年 Introduction,格式如上),并在方法部分写明加权与方差计算策略。HCUP-US 提供官方引用格式页与 “Requirements for Publishing with HCUP Data” 清单,投稿前请逐条核对。

正文中的推荐署名格式(英文投稿):

The data in this study come from the HCUP Nationwide Emergency Department
Sample (NEDS). For further information on the NEDS, contact HCUP User
Support: hcup@ahrq.gov / Phone 1-866-290-HCUP.

对中文稿件,建议在数据来源段落写明:数据来自美国医疗研究与质量局 AHRQ 的 HCUP 项目全美急诊样本(NEDS),数据年为 [年份],经 HCUP Central Distributor 购买并签署 DUA 使用。使用本数据训练的模型在论文中应声明许可边界(不可再识别、不可再分发)。

§10 AI 使用声明卡

§10.1 AI 模型列表

  • 主笔模型:CodeBuddy Code(fast-model),负责检索汇总、结构组织与初稿生成。
  • 辅助工具:WebSearch(事实核查),pyarrow/pandas(示例代码本地逻辑推演)。

§10.2 AI 参与范围

AI 完成文献检索、事实抽取、章节撰写与代码示例起草;人类编辑负责医学与数据工程交叉审核、数字来源复核与最终发布决策。所有关键数字均需可追溯至 §10.3 列出的官方来源。

AI 未参与的部分:数据获取与 DUA 签署流程无法由 AI 代办;对官方文档未覆盖的推断性结论(如具体的模型性能数字)本文一律不给出,因此不存在 AI"补数字"环节。

§10.3 输入来源列表

  1. Agency for Healthcare Research and Quality. Overview of the NEDS. https://www.hcup-us.ahrq.gov/nedsoverview.jsp(2026-09 检索)
  2. AHRQ. Introduction to the NEDS, 2022. https://hcup-us.ahrq.gov/db/nation/neds/NEDSIntroduction2022.pdf(2026-09 检索)
  3. AHRQ. Introduction to the NEDS, 2021. https://hcup-us.ahrq.gov/db/nation/neds/NEDSIntroduction2021.pdf(2026-09 检索)
  4. AHRQ. Introduction to the HCUP NEDS, 2017. https://www.hcup-us.ahrq.gov/db/nation/neds/NEDS2017Introduction.pdf(2026-09 检索)
  5. AHRQ. Introduction to the HCUP NEDS, 2012(updated Jan 2019). https://hcup-us.ahrq.gov/db/nation/neds/IntroductionNEDS2012_updatedJan2019.pdf(2026-09 检索)
  6. AHRQ. Introduction to the NEDS, 2015. https://hcup-us.ahrq.gov/db/nation/neds/NEDS_Introduction_2015.jsp(2026-09 检索)
  7. AHRQ. Introduction to the NEDS, 2016. https://hcup-us.ahrq.gov/db/nation/neds/NEDS_Introduction_2016.jsp(2026-09 检索)
  8. AHRQ. NEDS Introduction, 2006. http://www.hcup-us.ahrq.gov/db/nation/neds/NEDS_Introduction_2006v2.jsp(2026-09 检索)
  9. AHRQ. HCUP Overview Course(NEDS/Sample Design). https://www.hcup-us.ahrq.gov/HCUP_Overview/HCUP_Overview/index508.jsp(2026-09 检索)
  10. AHRQ. Producing National HCUP Estimates(508 课程). https://hcup-us.ahrq.gov/tech_assist/nationalestimates/508_course/508course_2018.jsp(2026-09 检索)
  11. AHRQ. HCUP Overview Presentation(定价与购买流程). https://hcup-us.ahrq.gov/news/exhibit_booth/hcup_90_min_pres.jsp(2026-09 检索)
  12. AHRQ. HCUP Fast Stats. https://datatools.ahrq.gov/hcup-fast-stats(2026-09 检索)
  13. AHRQ. NIS Introduction, 2015(90+ 岁合并的全库口径). https://hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2015.jsp(2026-09 检索)
  14. Injury Epidemiology(2018). DOI 10.1186/s40621-018-0168-5(2026-09 检索)
  15. IJERPH 19(22):14781(2022). DOI 10.3390/ijerph192214781(2026-09 检索)
  16. CDC Stacks(Chest 2016,NIS+NEDS COPD 研究). https://stacks.cdc.gov/view/cdc/34640/cdc_34640_DS1.pdf(2026-09 检索)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景与 ICD/SNOMED 映射 千方病案医学编辑部 逐项对照 ICD-11/SNOMED 官方术语 ✅ 已通过
§3/§4 规格与数据结构 千方病案医学编辑部 对照官方 Introduction 与 What’s New 逐字段核对 ✅ 已通过
§6 预处理与 8 坑点 千方病案医学编辑部(数据工程) 代码逻辑走查 + 官方 Limitations 逐条溯源 ✅ 已通过
§7 质量评估与 DAIMS 千方病案医学编辑部 偏倚矩阵与官方文档交叉验证 ✅ 已通过
全文数字来源 千方病案医学编辑部 每个数字回查 §10.3 来源 ✅ 已通过
DUA/许可表述 千方病案医学编辑部 对照官方 DUA 培训与购买流程页 ✅ 已通过

§10.5 AI 生成章节标注

初稿由 AI 生成,经 §10.4 所列人工交叉审核后发布;关键统计(规模、覆盖、价格、缺失率)均为官方文档原始表述的直接转写,未做外推。

代码示例(§6.1、§6.3、§6.4、§6.9)为 AI 起草的教学示意,列名与文件名以当年官方装载程序为准;示例中出现的具体数值仅用于说明量级,不构成基准性能声明。

§10.6 最后人工审核日期

2026-09-05

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • meps — 共享标签:电子健康记录 / 卫生服务研究 / 调查数据
  • mimic-br — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • pcornet — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • mc-med — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • virus-registry — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • outcomerea — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • pedsnet — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • truveta — 共享标签:电子健康记录 / 临床电子病历 / 重症监护
  • gemini — 共享标签:电子健康记录 / 卫生服务研究 / 临床电子病历
  • nwicu — 共享标签:电子健康记录 / 临床电子病历 / 重症监护

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集