HCUP-NIS — 全美住院样本 AI-Ready Wikipedia

全美最大 all-payer 住院出院样本,年约 700 万记录加权代表 3,300 万+ 住院

来源 AHRQ Healthcare Cost and Utilization Project (HCUP) url: https://hcup-us.ahrq.gov/db/nation/nis/发布时间: 2026-09-14最后更新: 2026-09-25 阅读 46
HCUP-NIS — 全美住院样本 AI-Ready Wikipedia

信息速览

数据集名称HCUP-NIS — 全美住院样本 AI-Ready Wikipedia
数据类型每年约 700 万条出院记录,36 个数据年(1988-2023),加权代表 3,300 万+ 次住院,约 760-1,033 MB 压缩 ASCII/年,付费购买 + DUA 签署获取
规模每年约 700 万名出院患者样本(2023 年 6,743,716 条记录)
接入方式AHRQ Healthcare Cost and Utilization Project (HCUP) url: https://hcup-us.ahrq.gov/db/nation/nis/
AI 就绪度

数据集封面

HCUP-NIS 全美住院样本 — 全国代表性住院出院样本 AI-Ready Wikipedia


INFOBOX

数据集名称 全美住院样本(HCUP-NIS)
英文全称 National (Nationwide) Inpatient Sample(曾名 Nationwide Inpatient Sample)
别名/简称 NIS、HCUP NIS、HCUP-NIS
疾病分类 全病种住院覆盖(ICD-11 示例:BA41 急性心肌梗死 / 1G40 脓毒症 / CA40 肺炎 / 5A11 2 型糖尿病 / 8B11 脑梗死)
SNOMED CT 22298006 Myocardial infarction / 233604007 Pneumonia / 73211009 Diabetes mellitus(其余经 NLM 官方 ICD-10-CM↔SNOMED CT 映射文件对齐,详见 §2.1b)
数据模态 住院出院摘要(discharge abstract,行政-临床混合结构化表格)
AI 任务类型 院内死亡预测、费用/住院时长预测、疾病负担估计、医疗政策评估、表格深度学习基准、趋势分析
样本总数 每年约 700 万条出院记录;2023 年 6,743,716 条 / 14,181 家医院;1988-2023 共 36 个数据年
数据大小 约 760-1,033 MB / 数据年(压缩加密产品文件,2018 年官方价目所列区间)
数据格式 固定宽度 ASCII + 官方 SAS / SPSS / Stata 加载程序
许可证 HCUP Data Use Agreement(DUA)
访问级别 申请审核(向 HCUP Central Distributor 付费购买 + 完成 DUA 在线培训并签署)
DUO 标签 非标准 DUO 体系:DUA 约束仅限科研与聚合统计、禁止再识别与再发布(映射近似 HMB + PUB)
语言 英文
首发日期 1988(数据年;首年覆盖 8 个州)
最后更新 2023 数据年(截至 2026-09 为最新发布版本)
发布机构 美国医疗保健研究与质量局(AHRQ)HCUP 项目
官方主页 https://hcup-us.ahrq.gov/db/nation/nis/
下载地址 https://hcup-us.ahrq.gov/tech_assist/centdist.jsp
AI 就绪度评分 ⭐⭐⭐(3/5)— 官方文档、加载程序与权重体系完备,全国估计生态成熟;扣分项:ASCII 需自行转换为建模格式、无患者级标识、权重与方差设计需专门技能
页面状态 published

§0 E-E-A-T 信任声明与免责声明

  • 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、疾病流行病学)、§7 偏倚分析。
  • 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
  • 审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HCUP-NIS 要求用户完成 HCUP 官方 DUA 在线培训、签署数据使用协议并向 HCUP Central Distributor 付费购买。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? HCUP-NIS(全美住院样本)是美国卫生与公共服务部下属 AHRQ 机构运行的 HCUP 项目中规模最大的数据库。它不是某一家医院的数据,而是从全美约 45 个州 + 哥伦比亚特区的社区医院出院记录中,按科学抽样方案抽出约 20% 的出院记录,每年约 700 万条。每条记录是一份"出院账单摘要":患者年龄性别、最多 30 个诊断码与 15 个手术码、住了几天、花了多少钱、最后是否死亡、用哪种保险支付等 100 余个变量。加权后,这 700 万条记录可以代表全美超过 3,300 万次住院。

为什么重要? 它是卫生服务研究领域全球被引用最多的数据资产之一:只要你想回答"全美一年有多少人做了这个手术"“这类疾病的住院总费用是多少”“医保政策改革后住院模式变没变”,NIS 几乎是唯一免费层级之上、公开可购买、覆盖全病种、全国代表性的数据来源。对 AI 团队,它提供了别人没有的"全国级样本量 + 官方概率权重 + 官方方差计算规范"三件套——这意味着模型输出可以直接挂上"全美"这个量词。

我能用它做什么? 训练表格预测模型(院内死亡、费用、住院时长)、做疾病负担与资源利用的全国估计、给医疗政策评估提供前后对照、为稀缺病种研究提供足够大的样本。但要注意三条红线:不能用 NIS 做州级估计,不能用 NIS 做患者级再入院研究,跨 2012 与 2015 年的趋势分析必须处理权重与编码断层——这正是本文 §6.5 八个坑点要解决的问题。

§1.1 技术摘要

NIS 采用"抽样 + 加权外推"的经典调查统计设计。抽样框来自 HCUP 各州数据伙伴提交的州住院数据库(SID),2023 年覆盖 45 州 + 哥伦比亚特区,约占全美出院量的 97%。2012 年 redesign 之后,NIS 按医院特征(人口普查分区、城乡、教学身份、床位规模、所有权)分层,在每层内对出院记录做系统抽样,抽样率约 20%,构成近似自加权的出院样本;每条记录携带出院权重 DISCWT,权重约等于该条记录在其层内代表的目标总体出院数。分析者用 DISCWT 求和得到全国总量估计,配合官方方差计算规范与 HOSP_NIS 聚类变量计算标准误;跨 2012 年的趋势分析需改用官方 TRENDWT(1993-2011 趋势权重)。数据以固定宽度 ASCII 分发,官方同时提供 SAS、SPSS、Stata 三种加载程序与逐年数据字典。

三点设计细节值得 AI 从业者特别注意。第一,2012 后的出院抽样是"自加权"(self-weighting)设计——估计均值与率时权重可省,但估计总量时权重不可省,这打破了很多工程师"要么永远加权、要么永远不加权"的二分直觉。第二,权重是"层内常量":同层内所有出院记录共享同一权重,权重信息量等价于"层大小 ÷ 层内样本数",因此它不能当作个体重要性分数使用。第三,官方明确建议趋势分析从 1993 年开始——1988-1992 年仅有 8-11 个州参与,覆盖不足半数出院人口,哪怕有加权也无法完全修正覆盖缺口。

§1.2 战略价值

维度一:全国代表性的不可替代性。 单中心 EHR 数据(如 MIMIC-III)深度有余而代表性不足;NIS 恰好相反——它牺牲了个体纵向深度,换取了"样本 → 全美总体"的严格统计外推能力。官方说明其抽样框覆盖约 97% 美国出院量,且所有患者不论支付方全部纳入。这意味着在 NIS 上用正确权重得到的估计,天然带有全国结论资格,这是医疗 AI 论文从"某院数据"升级为"全国证据"的最短路径。

维度二:规模与稀缺病种覆盖。 每年约 700 万条记录、36 个数据年(1988-2023)的纵向跨度,让罕见手术、罕见并发症、特殊人群(如高龄产妇、多发伤)都有足够样本量。官方明确指出其大样本"适合生成全国与区域估计,并支持罕见疾病、非常见治疗与特殊人群分析"。对长尾标注稀缺的 AI 任务,这是天然的训练池。

维度三:方法学基础设施完备。 从逐年数据字典、抽样设计报告、方差计算报告、趋势权重文件,到免费的 HCUPnet 在线查询与官方教程系列,AHRQ 提供了完整的"如何正确使用"方法论栈。这使 NIS 成为学习"复杂调查数据 + 机器学习"交叉方法的最佳练手场——错误做法(如忽略权重)会立刻被审稿人识别。

维度四:获取门槛低、合规路径清晰。 与多数国家级卫生数据需要漫长伦理审批不同,NIS 走"申请表 + 在线培训 + 签署 DUA + 付费"的标准化流程,单年价格在数百美元量级(历史价目 $200-$625,学生价 $20-$125),个人研究者与学生都可负担。DUA 条款以"仅限科研与聚合统计、禁止再识别与再发布"为骨架,边界清楚,适合作为团队数据合规体系的第一块拼图。

§1.3 同类数据集横向对比

数据集 规模 模态 标注方式 与 NIS 的差异化
HCUP-NIS 每年约 700 万条出院记录,1988-2023 出院摘要(全国概率样本) ICD-9/10 行政编码 + APR-DRG 派生 全国代表性 + 官方权重,适合外推
HCUP-NRD 全国再入院数据库(2013 起) 出院摘要 + 患者级链接 同 NIS 编码体系 唯一支持全国再入院/纵向分析
HCUP-KID 儿科出院抽样(三年一版) 出院摘要(儿童专项) 同 NIS 编码体系 儿童专科出院样本,含出生缺陷权重设计
HCUP-NEDS 全国急诊科样本 急诊出院摘要 ICD 编码 + ED 变量 急诊场景,与 NIS 住院场景互补
HCUP-SASD 参与州门诊手术库 门诊手术摘要 ICD 编码 覆盖门诊手术场景
HCUP-SID 参与州全量出院(州级) 出院摘要(州全量) 同 NIS 编码体系 可做州级估计与州内患者级链接(Revisit Files)
MIMIC-III 46,520 名患者 / 58,976 次住院 单中心 ICU 全维度 EHR 临床标注 + ICD 码 时序深度 + 波形/影像/文本,但无全国代表性
CDC NHDS 全美出院调查(已停止收集) 出院摘要 ICD 码 曾是 NIS 的对照基准,规模小一个量级

读表的正确姿势:先定位"分析单元"一列的差异——NIS/NRD/KID/NEDS/SID 全部是出院记录级,MIMIC-III 是患者-住院-ICU 入住多级。这一差异决定了 NIS 家族适合"服务发生了什么"的横断面与趋势问题,而 MIMIC-III 适合"患者身上发生了什么"的纵向深度问题;两者在论文中互为外部验证而非竞争关系。

§1.4 版本时间轴

年份/数据年 事件 对分析的影响
1988 NIS 首个数据年发布,仅 8 个州参与 早期年份(1988-1992,8-11 州、<50% 出院覆盖)代表性有限
1998 第一次抽样与权重策略修订(剔除康复医院、改进代表性) 1998 前后估计需注意设计变化
2012 重大 redesign:从"抽 20% 医院保留全部出院"改为"从全部参与医院抽约 20% 出院记录";剔除 LTACH;分层由 4 个人口普查区改为 9 个普查分区;删除医院权重与州标识;年龄 90 岁以上聚合为 90+ 一次性趋势中断(出院数约 -4.3% 等,见坑点 2);1993-2011 需改用 TRENDWT
2015-10-01 美国切换 ICD-10-CM/PCS;2015 NIS 前三季度 ICD-9-CM、第四季度 ICD-10-CM/PCS 分文件存储 编码断层(见坑点 3);字段名出现 I10_ 前缀
2016 文件结构修订,ICD-10 时代标准化 2016 起字段命名趋稳
2023 因州参与变化删除 HOSP_REGION/HOSP_DIVISION/RACE,PL_NCHS 收缩为两类,TOTCHG 改为 TOTCHG_2023 跨年比较部分特征再次断裂(见坑点 8)
2025-2026 官方生态持续运营:2025 州数据库发布、CCS/手术标记工具 2026.1 版本更新 工具年度更新需纳入特征注册表版本管理(见 §6.10)

§1.5 典型应用场景

  1. 全国疾病负担与费用估计:用 DISCWT 加权估计某疾病年住院例数、总费用、平均住院日——HCUP 自身的 Statistical Brief 系列即基于此模式。典型产出是"按年 × 按分组"的全国估计表,配合官方方差给出置信区间。
  2. 院内死亡/并发症预测基准:以 ICD 编码派生特征 + APR-DRG 严重度预测 DIED,构成表格学习的真实世界大规模基准。注意 APR-DRG 派生字段与目标的共线关系(见 §5.3)。
  3. 医疗政策评估:利用 1988-2023 的 36 年跨度与官方趋势权重,做政策实施前后的间断时间序列(ITS)分析。Medicaid 扩容、支付改革、DRG 付费推行等经典政策问题均以此库为数据基座。
  4. 医疗费用机器学习:以 TOTCHG/COST(经 Cost-to-Charge Ratio 转换)为目标的回归建模,配合对数变换与加权评估。费用是右偏分布,评估指标建议同时报告中位数绝对误差与加权均值误差。
  5. 健康差异研究:按预期支付方、患者居住地城乡(PL_NCHS/PL_NCHS2)、收入四分位(ZIPINC_QRTL)分层的利用差异分析。种族/民族维度受字段缺失与 2023 移除限制(见 §7.5)。
  6. 罕见病与罕见手术的全国画像:年 700 万条的样本基数让年发生率千分之一量级的病种也有数千条样本,是单中心数据无法企及的规模。

§2 医学背景

§2.1 疾病与手术覆盖(ICD-11 对照表)

NIS 本身携带 ICD-9-CM(2015 年 9 月 30 日前)或 ICD-10-CM/PCS(2015 年 10 月 1 日起)诊断与手术编码。为方便国际读者与跨标准建模,下表给出住院场景中最具代表性的病种及其 ICD-11 对照:

病种选择说明:下表五类覆盖了 NIS 使用中最典型的住院场景(急性事件、感染、慢病并发症、神经事件);NIS 实际覆盖全部 ICD 章节,任何病种的编码集合都应通过官方 CCSR 分组查询而非手工挑选,以避免漏掉低频位次诊断。

住院代表病种 ICD-11 编码 ICD-11 中文名 NIS 中的编码载体
急性心肌梗死 BA41 急性心肌梗死 ICD-9-CM 410.x → ICD-10-CM I21.-
脓毒症 1G40 脓毒症 ICD-9-CM 995.9x/038.x → ICD-10-CM A41.-
肺炎 CA40 细菌性肺炎(总目) ICD-9-CM 486 → ICD-10-CM J18.-
2 型糖尿病 5A11 2 型糖尿病 ICD-9-CM 250.x0 → ICD-10-CM E11.-
脑梗死 8B11 脑梗死 ICD-9-CM 434.x/436 → ICD-10-CM I63.-

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语
急性心肌梗死 BA41 22298006 Myocardial infarction (disorder)
肺炎 CA40 233604007 Pneumonia (disorder)
2 型糖尿病 5A11 73211009 Diabetes mellitus (disorder)
其余全部病种 — 经映射文件查询 美国国家医学图书馆(NLM)官方发布 ICD-10-CM ↔ SNOMED CT 双向映射文件,可免费下载;建议在 ETL 阶段批量对齐而非手工映射

§2.2 疾病简介与流行病学

NIS 覆盖短期非联邦社区医院的全部出院病种,包括内、外、妇、儿、精神(受州限制)等。以住院率为观察窗口的美国核心慢病格局可由 NIS 直接刻画:心血管疾病(急性心梗、心力衰竭)与呼吸系统感染(肺炎、脓毒症)长期占据住院死亡率与费用榜前列;2 型糖尿病则以并发症形式广泛渗透于住院人群。

从建模视角理解 NIS 的"流行病学"有三个要点。其一,NIS 观察的是住院事件流而非人群队列——它回答"美国一年发生了多少次某类住院",而非"多少人有某病";患病率估计需要转向 NHANES 等人群调查。其二,住院率同时受发病率与医疗利用行为影响:支付政策、门诊化趋势(日间手术替代住院)都会改变"同样疾病 → 不同住院量"的映射,这也是趋势建模中最常见的混杂来源。其三,官方派生分组(CCSR/CCIR)把数万个 ICD 码折叠为临床可解释的疾病大类,是流行病学层面建模的推荐特征粒度。

由于 NIS 是全病种数据库,任何以住院为终点的疾病负担指标(出院例数、住院率、院内死亡、费用)都可加权估计。HCUPnet 在线系统免费提供历年 NIS 全国统计,可作为建模目标的快速参照。

§2.3 临床任务定义

  • 筛查/负担监测:按编码集合(如 CCSR 分组)加权估计疾病住院量与趋势,不涉及个体诊断。产出为"全国估计表",评估单位是估计量本身(加权总数/率及其方差)。
  • 诊断相关任务:以诊断码组合预测院内死亡(DIED)、并发症、非常规出院,属弱监督——标签即行政编码本身。任务定义需与编码语义对齐:例如"脓毒症住院"应由 CCSR 分组定义,而非手工 ICD 码白名单。
  • 分级任务:APR-DRG 的严重度(severity of illness 1-4 级)与死亡风险(risk of mortality 1-4 级)提供了官方分级标签,位于 Severity Measures 文件。它们既可作为标签也可作为特征——但不可同时用于与诊断相关的任务(共线,见 §5.3)。
  • 预后/资源任务:住院时长 LOS(天)、总费用 TOTCHG(美元,名义价)回归;再入院预测需改用 NRD(见坑点 4)。名义费用跨年不可直接比较,需经 Cost-to-Charge Ratio 转换为费用(cost)并考虑通胀调整。

§2.4 患者人群画像

维度 内容
数据来源 HCUP 参与州(2023 年 45 州 + 哥伦比亚特区)社区医院出院摘要
时间范围 日历年,1988-2023
覆盖范围 全部支付方患者;短期非联邦社区医院(剔除康复与长期急性照护医院)
抽样人口占比 抽样框医院约占全美出院量 97%(2015 年:>97% 人口、>96% 出院量)
年龄特殊处理 2012 起年龄 >89 聚合为 90+(上截断)
种族/民族 2016-2018 年缺失约 5% 及以下(2016: 5.1%、2017: 4.3%、2018: 3.3%);2023 起字段移除
未加权/加权规模 2023 年 6,743,716 条;2020 年未加权 6,471,165 → 加权 32,355,827

人群画像的使用方式:这张表定义了 NIS 结论的"适用人群"——短期非联邦社区医院的住院人群。它天然排除联邦医院(如退伍军人事务部医院)、康复与长期急性照护机构,也因州保密法对特定病种覆盖不全。任何把 NIS 结论外推到"全美所有医疗机构"或"全人群患病率"的表述都超出了数据设计边界。

§2.5 临床价值

对临床研究者,NIS 的价值在于"把单中心观察升级为全国证据":一项新技术(如 TAVR)、一类新药副作用、一种新术式的住院结局变化,都可以在 NIS 上以百万级样本验证。对临床 AI 团队,NIS 提供了衡量模型"外部效度"的参照系——当模型在单中心数据上报告 AUROC 时,NIS 的加权全国分布可以回答"该模型面对的是怎样的全国人群结构"。

具体的三种用法:人群画像——在开发阶段用 NIS 校准目标人群的年龄/性别/合并症构成,判断单中心数据是否偏移;结局锚定——用 NIS 的全国加权死亡/并发症率作为模型的先验参照,判断模型预测的绝对风险是否落在合理区间;部署前压力测试——把模型特征分布与 NIS 全国分布对比,提前发现"模型只见过教学医院患者"这类部署风险。

§2.6 金标准参照(标注体系)

属性 内容
划分方式 无官方机器学习划分;统计推断以抽样层(NIS_STRATUM)+ 医院聚类(HOSP_NIS)为设计单元
标注方式 医院病案编码员按 ICD-9-CM/ICD-10-CM/PCS 规则对出院摘要编码(管理型自动标注,非研究性人工标注);HCUP 在此之上以软件派生 APR-DRG、CCS/CCSR、合并症指标等
标注者资质 参与州医院与州数据组织的病案编码专业人员,遵循官方编码指南
标注性质 回溯性行政数据;编码质量受医院与州差异影响,HCUP 提供质量控制程序说明

需要强调:NIS 的"金标准"属性体现在抽样与派生方法层面而非临床验证层面——它的权重与分组体系由官方方法报告背书,可视为"全国估计"任务的金标准;但它的编码标签并未与病历逐一核对,临床细节任务上它是弱标签数据。两个层面分开评价,是正确使用 NIS 的前提。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小(单年压缩产品文件) 理由
快速上手表格建模、学习权重用法 任一 2016-2022 单年 约 760-1,033 MB ICD-10 时代统一字段名、单文件结构
跨 2012 的长期趋势研究 1993-2023 多年 + TRENDWT 文件(1993-2011) 按年累加 TRENDWT 使 1993-2011 与 redesign 后可比
ICD-9 与 ICD-10 双编码研究 2014 + 2016(避开 2015)或 2015 双文件 2015 年为双结构文件 2015 混合编码年需按季度处理
全国再入院/纵向研究 改用 HCUP-NRD(2013 起) — NIS 无患者级标识(见坑点 4)
州级估计或州内患者链接 改用 HCUP-SID — NIS 不做州级代表性设计(见坑点 7)
与 AHA 医院属性链接 2011 及以前的 NIS(含 AHA 医院标识)或 AHA 许可数据 — 2012 redesign 删除医院标识与州标识

§3.1 模态详情

NIS 的单一模态是住院出院摘要(discharge abstract):每条记录对应一次住院,由医院财务与病案系统生成的行政-临床混合表格。内容覆盖:主要/次要诊断与手术编码、患者人口学(年龄、性别、居住地邮编收入四分位、城乡类型)、医院特征(所有权、教学身份、床位规模、城乡位置、所在人口普查分区)、支付方(MEDICARE/MEDICAID/PRIVATE/SELF-PAY 等)、资源利用(LOS、总费用 TOTCHG、经 CCR 转换的费用 COST)、结局(DIED、出院去向)、严重度(APR-DRG 及其风险等级,独立文件提供)。

“行政-临床混合"的含义值得展开:诊断/手术编码具有临床内容(什么病、做了什么操作),但采集动机是计费——编码完整度与报销激励挂钩,临床细节(实验室值、生命体征、用药、影像)一概不采集。因此 NIS 适合回答"服务发生了什么”(utilization、cost、outcome),不适合回答"生理过程发生了什么"。无影像、无波形、无文本、无化验值——这是纯表格数据库,100 余个临床与非临床变量(官方口径"more than 100 clinical and nonclinical variables")。

每个数据年由 3-4 个数据文件构成:核心文件(出院记录 + 权重)、严重度文件(APR-DRG 系列)、诊断/手术分组文件(CCS/CCSR/CCIR 派生),2012 年前另有医院权重文件(Hospital Weights File,2012 redesign 后取消)。

§3.2 按年份样本规模

数据年 参与州 未加权出院记录 医院 来源
1988 8 约 500 万量级(首年) 约 800-1,000 量级 NIS Overview(参与州数);2000 年 Introduction(年记录/医院量级)
2000-2002 逐年增加 每年约 500-800 万 约 800-1,000 NIS 2000 Introduction
2005 37 每年约 800 万 约 1,000 2005 NIS Design Report
2020 47+DC 6,471,165(加权 32,355,827) — HCUP Statistical Brief #302
2015 46+DC 混合编码年(ICD-9 前三季 + ICD-10 Q4) — NIS 2015 Introduction(抽样框覆盖 >97% 人口)
2023 45+DC 6,743,716 14,181 NIS Overview;NIS 2023 Summary Statistics

§3.3 格式规格

组件 格式 说明
出院核心文件(Inpatient Core File) 固定宽度 ASCII(.ASC) 每条记录一次住院,主键 KEY_NIS
严重度文件(Severity Measures File) 固定宽度 ASCII APR-DRG、风险等级等(2012 前另有独立疾病严重度文件)
诊断/手术分组文件(DX_PR_GRPS) 固定宽度 ASCII CCS/CCSR、CCIR 等 HCUP 软件派生分组
加载程序 SAS / SPSS / Stata 官方读取 ASCII 的列宽定义与格式程序,可直接改为 Python 解析规格
文档 PDF / 网页 逐年 Introduction、数据元素说明、File Specifications
补充文件 固定宽度 ASCII / Excel Cost-to-Charge Ratio Files、Hospital Market Structure(HMS)、1993-2011 Trend Weights(免费)、NIS Hospital Ownership Files 等,仅可与 HCUP 数据库配合使用
医院权重文件(仅 2012 前) 固定宽度 ASCII Hospital Weights File,用于把样本医院外推到全国医院总体;2012 redesign 后取消
分发形态 单个 PKWARE 加密压缩 ZIP / 年 HCUP Central Distributor 安全数字下载,密码随发票提供

格式的两点工程影响:固定宽度 ASCII 意味着解析成本集中在"列宽定义的正确性"上(官方 SAS 加载程序是唯一权威来源),而加密压缩意味着解压环节必须纳入合规管理(密码不可入库、不可写日志)。两者都指向同一个实践结论:ASCII → Parquet 的转换应写成一次性的、带对账的、可审计的管线步骤,而不是临时脚本。

§3.4 存储大小

2018 年官方申请价目表所列产品文件大小:NIS 2011 为 857 MB、2012 为 767 MB、2014-2016 为 760 MB、2006 为 1,033 MB。解压并加载为二进制分析格式后,建议按"压缩文件的 3-5 倍"预留磁盘;用 Parquet 列存并按年分区通常可将单年核心文件控制在数百 MB 内。

一个被反复验证的存储策略:原始 ASCII 永久归档(只读、DUA 合规主体),Parquet 副本按"年 × 文件类型"分区供训练读取,派生特征表(CCSR 多热、合并症标记)单独建库。三者以数据年 + KEY_NIS 打通血缘,任何一个 Parquet 损坏都可以从 ASCII 一键重建。多数团队的真实瓶颈不是磁盘而是加载 CPU——固定宽度解析是纯 CPU 操作,一次性转换后再训练的成本几乎为零。

§3.5 标注方式

NIS 的"标签"分三层,全部为回溯性派生,无前瞻性人工标注:

  1. 原始行政编码层:医院病案编码员按联邦与州规则填写 ICD 诊断/手术码——这是弱监督性质的自动可用标注,覆盖率接近 100%(住院摘要必备字段)。
  2. HCUP 软件派生层:AHRQ 以确定性软件从原始码派生 APR-DRG 严重度与死亡风险(4 级)、CCS/CCSR 临床分组、Elixhauser 合并症指标(CMR_* 系列)等。同一条原始编码必然得到同一派生结果——这是规则系统的"自动标注"。
  3. 结局层:DIED(院内死亡)、LOS、TOTCHG 由医院直接上报,非编码派生。

三层标签的"可信度排序"与"建模成本"正好相反:结局层最干净但只能回答资源/结局问题;编码层覆盖最全但带编码噪声;派生层介于两者之间且完全可复现。建议的建模策略是:主任务标签优先取结局层,特征优先取派生层,原始编码仅作为特征的原始素材并经 CCSR 聚合后再进入模型。

§3.6 标注者资质与一致性

原始编码由参与州医院的病案编码专业人员完成,遵循 ICD 编码指南与 HCUP 编码实践规范(HCUP Coding Practices 文档)。HCUP 不公开编码员间一致性系数;跨州编码实践差异通过统一的数据元素定义与质量控制程序(HCUP Quality Control Procedures 文档)收敛。建模者应把"编码实践漂移"视为标注噪声来源之一(见 §7.1 与坑点 3)。

与人工研究标注相比,这种行政标注体系有两个可利用的优点:覆盖密度极高(每条住院记录必有编码,不存在"标注排队"问题)与时间连续性极好(36 个数据年同一体系演化)。缺点是标签语义被报销规则中介——研究者若发现某诊断码的使用率在某政策节点跳变,应先怀疑编码激励变化而非疾病谱变化。

§3.7 采集周期

NIS 以日历年为数据年,每年发布一个数据集(约滞后 2 年:2023 数据年于 2025 年前后发布)。所有日期型信息被抽象为季度(DQTR,入院季度)与 LOS(住院天数),不提供具体入院/出院日期。这一"季度粒度上限"是隐私保护的设计结果,也决定了时间建模的天花板:可以做季节性分析(如流感季住院高峰),不能做日内/小时级时序分析。多年度使用时,数据年即日历年这一点与部分以财年组织的医疗数据库不同,跨库对齐时应核对年份定义。

§3.8 地域覆盖

覆盖美国参与州的社区医院出院:2023 年为 45 州 + 哥伦比亚特区(首年 1988 年仅 8 州,2015 年为 46 州 + DC)。注意三点:其一,参与州逐年变化,早期年份覆盖不足半数人口,官方因此建议趋势分析从 1993 年开始;其二,部分州因保密法禁止上报 HIV/AIDS、行为健康与人工流产相关记录,相关病种估计存在系统性低报;其三,NIS 的地理信息只到"医院所在人口普查分区"与"患者居住地城乡类型/邮编收入四分位"两个粒度——2023 年起医院普查分区字段也被移除,地理粒度进一步收窄。

§3.9 设备规格

不适用。NIS 为行政摘要数据,不包含设备型号、检查原始信号或影像;治疗过程仅以 ICD 手术编码体现。若需设备/监护层信息,需转向单中心 EHR 数据集并在 NIS 上做结局层外部对照。

§3.10 深度溯源链

医院 HIMS/病案系统
  → 州数据组织(HCUP Partner,如州医院协会/州卫生厅)
    → HCUP 州住院数据库(SID,州级全量出院)
      → AHRQ 分层系统抽样(2012 起:9 个普查分区 × 城乡 × 教学 × 床位 × 所有权)
        → NIS 出院样本(约 20% 抽样率,DISCWT 加权)
          + AHA 年度医院调查链接(医院属性)
          + ARF 县级资源文件链接(地区属性)
            → 全国加权估计(官方方差规范)

溯源链的每一跳都有对应的官方文档:州伙伴列表见 HCUP Partners 页、SID 与 NIS 的抽样关系见各年 Introduction、分层定义见 2012 Redesign Report、链接文件(AHA/ARF)的可用性受州限制约束(2012 起医院标识从 NIS 移除,链接需改用 SID 或 AHA 直接许可)。做数据审计时,这条链就是从你的分析结果回溯到"原始上报记录"的完整路径。


§4 数据结构

§4.0 目录树

以 NIS 2019 单年产品为例,解压后的典型结构(文件名以当年 File Specifications 为准):

NIS_2019/
├── NIS_2019_CORE.ASC                  # 出院记录核心文件(每行一条住院)
├── NIS_2019_DX_PR_GRPS.ASC            # HCUP 诊断/手术分组(CCS/CCSR 等)
├── NIS_2019_SEVERITY.ASC              # APR-DRG 严重度与死亡风险
├── SAS_Load_Programs/                 # 官方 SAS/SPSS/Stata 加载程序
│   ├── _NIS_2019_CORE.SAS             # 含逐字段列宽定义(colspecs 的权威来源)
│   ├── _NIS_2019_CORE.SPS
│   └── _NIS_2019_CORE.DO
├── FileSpecifications_NIS_2019.pdf    # 逐字段字节位置与取值说明
├── NIS_Description_of_Data_Elements.pdf
└── NIS_Introduction_2019.pdf

2015 年为特殊结构:核心数据按季度拆分为 ICD-9-CM 文件(Q1-Q3)与 ICD-10-CM/PCS 文件(Q4),加载时需分别处理后合并(见坑点 3)。

几个跨年不变的规律值得记住:无论哪一年,核心文件都满足"一行 = 一次住院"、权重列都叫 DISCWT、医院列都叫 HOSP_NIS(2012 起替代旧的 HOSPID)、记录主键都叫 KEY_NIS(2012 起)。把管线锚定在这些不变量上、把可变部分参数化,是维护多年 NIS 管线的成本最低方式。

§4.1 DAIMS 数据字典(核心字段)

字段名 类型 说明 示例值 AI 用途 观测误差/陷阱 信息性缺失编码 取值范围
KEY_NIS 整数 出院记录唯一标识(2012 起) 301001 主键/去重 跨年不复用,不可当作患者 ID 无缺失 当年唯一
HOSP_NIS 整数 医院编号(年度内脱敏) 41 聚类变量/分组 CV 每年重新编号,跨年不追踪同一医院 无缺失 1-14,181(2023)
NIS_STRATUM 整数 抽样层编号 12 方差设计/分层抽样 2023 起编码不再含普查分区信息 无缺失 当年定义
AGE 整数 入院年龄(岁) 67 人口学特征 2012 起 >89 一律记 90 以缺失码标记 0-90+
FEMALE 二值 性别(1=女) 0 人口学特征 极少数缺失 负值/空 0/1
DISCWT 浮点 出院权重(全国外推) 5.1 加权估计必用 2012 前后逻辑不同;趋势分析用 TRENDWT 无缺失 约 5 上下
LOS 整数 住院天数 4 回归目标/特征 极端值需截尾处理 以缺失码标记 ≥0
DIED 二值 院内死亡(1=死亡) 0 分类目标 类别极不平衡 无缺失 0/1
TOTCHG 浮点 总住院费用(名义美元) 48,200 回归目标 右偏严重需对数;2023 改名 TOTCHG_2023 以缺失码标记 ≥0
DX1-DX30 字符 诊断码(2014 起 30 个) I21.4 主要特征源 2015 起字段名 I10_DXn;2009 前 15 个、2009-2013 25 个 空位 ICD 码表
PR1-PR15 字符 手术码(2014 起 15 个) 0T086ZZ 操作/并发症特征 同上,ICD-10-PCS 结构全新 空位 ICD 码表
PAY1 分类 预期主要支付方 1 分组/公平性分析 类别跨年偶有调整 以缺失码标记 1-6
ZIPINC_QRTL 分类 患者邮编收入四分位 3 社会经济特征 2023 起随其他字段调整 以缺失码标记 1-4
APRDRG_Risk_Mortality 分类 APR-DRG 死亡风险等级 3 分级标签/共线源 由诊断码软件派生,与 DX 特征共线 以缺失码标记 0-4
PL_NCHS / PL_NCHS2 分类 患者居住地城乡类型 1 地域差异分析 2023 收缩为 metro/non-metro 两类 以缺失码标记 1-2(2023)
HOSP_LOCTEACH 分类 医院城乡位置与教学身份 1 医院分层特征 部分医院类别折叠(2023 起取消折叠类别) 无缺失 1-4
HOSP_BEDSIZE 分类 医院床位规模分组 3 医院规模特征 分组阈值按地区床位分布定义 无缺失 1-3
DQTR 整数 入院季度(1-4) 2 季节性特征/时间粒度上限 2015 年 Q4 与编码切换重合 无缺失 1-4

字段字典的完整版本(含全部 100+ 变量、逐字节取值说明)见官方《NIS Description of Data Elements》与当年 File Specifications;上表仅收录建模中最常触及的核心字段。字段存在性因数据年而异——任何字段进入特征清单前,先查当年的可用性清单(2023 年变化最大,见坑点 8)。

§4.2 标签体系与分布

NIS 的三大建模标签——DIED(二值)、LOS(计数)、TOTCHG(连续)——的分布均可由官方免费渠道核对:HCUPnet 提供历年加权全国统计,官方 Summary Statistics(MaskedStats PDF)提供当年未加权的逐字段均值/最值。建模者应在写代码前先用这两个免费源校准自己的加载结果(例如核对某年加权住院总数是否与官方一致),这比任何本地合理性检查都可靠。

标签 类型 官方核对渠道 建模注意
DIED 二值(院内死亡) HCUPnet 全国统计;MaskedStats 极不平衡;建议加权损失 + 按医院分组划分
LOS 计数(天) HCUPnet 平均住院日 长尾截尾;redesign 后均值口径变化约 -1.5%
TOTCHG 连续(美元) HCUPnet 费用统计(2023 用 TOTCHG_2023) 右偏需对数;名义价跨年不可直接比较
APRDRG_Risk_Mortality 有序 4 级 Severity 文档与官方 APR-DRG 方法报告 与诊断码强共线,勿与 DX 特征混用

§4.3 关键统计

以已核实的官方数字为锚点:2023 年未加权 6,743,716 条出院记录来自 14,181 家医院;2020 年未加权 6,471,165 条、加权代表 32,355,827 次住院;2023 年官方 DX_PR_GRPS 文件统计显示 CMR_HTN_UNCX(非复杂高血压合并症标记)加权均值居合并症类前列。诊断字段容量经历三次扩容:2009 前 15 个 → 2009-2013 年 25 个 → 2014 起 30 个。

自检三件套(任何加载管线都应内置):

  1. 规模对账:加载后的记录数应与官方 Summary Statistics 中的 KEY_NIS 总数一致(如 2023 年 6,743,716)。
  2. 权重对账:DISCWT 求和应与 HCUPnet 同年加权住院总数一致(量级核对;2020 年为 32,355,827)。
  3. 均值对账:抽 3-5 个连续字段(AGE/LOS/TOTCHG)的未加权均值与官方 MaskedStats 比对,容差应在浮点精度内。

§4.4 数据层级

全国总体(加权外推目标)
└── 数据年(YEAR,36 个)
    └── 抽样层(NIS_STRATUM,年内分层单元)
        └── 医院(HOSP_NIS,聚类单元,跨年不追踪)
            └── 出院记录(KEY_NIS,分析单元)★ 建模粒度
                └── 诊断/手术码序列(DX1-30 / PR1-15,特征源)

关键理解:分析单元是出院记录,不是患者。同一患者一年内多次住院会以多条独立记录出现,且无任何字段可将它们连接。

层级结构的另一层含义是"方差结构":全国估计的方差由抽样层与医院聚类共同决定,与记录数并非倒数关系——700 万条记录的置信区间不会比"有效样本量"(层数 × 医院数尺度)窄太多。这就是为什么官方方差报告反复强调 cluster 与 strata 的设置,也是许多 AI 论文低估 NIS 结果不确定性的根源。

§4.5 缺失值与信息性缺失

  • HCUP 沿用统一的缺失值惯例:数值/分类字段以负值编码缺失(加载程序与 formats 程序提供对应标签),字符编码字段以空位表示"该位次未使用"。加载时必须将负值转回缺失,否则会被当成合法取值污染统计(见坑点 8)。
  • 信息性缺失典型:费用类字段缺失与医院上报习惯相关;RACE 缺失率 2016-2018 年约 3-5%,且缺失与州上报要求相关(结构性而非随机);部分州整体缺失 HIV/AIDS、行为健康、人工流产记录(州级保密法限制)——这是"州 → 缺失"的确定性信息性缺失。
  • AGE 的 90+ 聚合(2012 起)与 PL_NCHS 的类别收缩(2023 起)属于"信息被有意截断",不是缺失,但同样改变跨年特征语义。

处理原则:把缺失分为"可插补"与"必须披露"两类。随机的单字段缺失(如个别 LOS)可用常规插补;结构性缺失(州级病种限制、RACE 集体缺失)插补是伪解——正确做法是限定研究人群、换用可得字段或在结论中披露边界。判断依据只有一个:缺失是否与"缺失本身"之外的真实状态相关(如"某州不上报人工流产记录"与患者无关)。


§5 数据划分与使用建议

§5.1 官方划分

无。NIS 是统计调查数据集,官方只提供抽样设计(分层/聚类/权重),不提供机器学习训练/验证/测试划分。任何"官方 benchmark 划分"的说法均不成立。这与图像/文本竞赛数据集形成鲜明对比:NIS 的"正确用法"是推断而非预测竞赛,划分方案本身就是研究设计的一部分,需要在论文中显式声明并论证。

§5.2 社区惯例划分

文献中的常见做法:按数据年划分(如 2016-2019 训练、2020-2021 测试)以模拟时间外推;或随机划分但报告设计加权指标。更稳健的实践是按医院聚类划分(以 HOSP_NIS 为组键做 GroupShuffleSplit),因为 2012 年后的出院记录仍聚类于医院,随机划分会让同一医院的高度相似病例同时出现在训练与测试侧,虚高性能。时间划分与医院分组划分可以叠加:先用数据年切分时间窗,再在窗内按医院分组,以同时模拟"时间漂移 + 空间泛化"双重挑战。

§5.3 划分策略建议与泄漏风险

  • 患者重复入院泄漏(不可见):无患者 ID 也无法显式排除,同一慢性病患者多次记录携带近似的合并症签名,随机划分会低估其在测试侧的"新鲜度"。缓解:按医院分组划分 + 在讨论中明确残余风险。
  • 特征泄漏高危字段:APRDRG_Risk_Mortality/APRDRG_Severity 由诊断码(含死亡相关诊断)派生,与 DIED 目标强共线——若目标是"编码前预测",严禁把任何 APR-DRG/CCS 派生字段放入特征。
  • 时间字段泄漏:DQTR 属于入院信息,若目标定义含"住院后结局",入院季度可用;但任何出院后才产生的字段(如延伸费用项)不得入特征。
  • 加权与划分的交互:划分应在记录层进行,但评估必须回全样本口径用 DOMAIN/SUBPOP 方式计算(见坑点 5),否则加权指标与方差都会失真。
  • 断层年处理:训练集若同时含 2015 年前后数据,编码特征空间不同构——要么按编码系统分桶建模,要么统一到 CCSR 聚合层。跨 2012 的划分同理需考虑 TRENDWT 口径。

§5.4 交叉验证建议

推荐分层(按数据年)+ 分组(按医院)的重复 GroupKFold;折内保持全样本用于方差估计。对超大单年样本(约 700 万条),一次固定 80/20 按医院分组的划分已足够稳定,k 折带来的计算成本通常不成比例。

若坚持 k 折,两个工程细节能省下大量麻烦:其一,把"每折的医院集合"落盘复用,保证不同模型/超参在完全相同的折上比较;其二,GBDT 类模型在大样本下方差很小,优先把算力花在"跨年外推测试"而不是 k 折内卷——对政策类应用,时间外推能力几乎总是比随机 CV 分数更接近真实风险。

§5.5 外部验证建议

  • 同期对照:CDC 的全国医院出院调查类数据可作独立基准(官方明确建议用外部数据源校验 NIS 估计,如 HCUPnet 免费统计交叉核对)。
  • 时间外推:用 redesign 前后双权重(TRENDWT + DISCWT)分别拟合同一模型,检验结论稳健性。
  • 跨库验证:HCUP 家族内用 SID(州全量)验证 NIS 加权估计,或用 NRD 验证与再入院相关的扩展结论。

外部验证的黄金标准是"双库一致性":同一研究问题在 NIS(全国样本)与 SID/NRD(全量或患者级)上分别估计,若结论方向一致且量级相近,报告的说服力远超任何内部验证技巧——这也是官方 NIS Comparison Report 采用的思路,值得研究设计直接借鉴。


§6 AI 就绪指南 ⭐

§6.0 云端快速启动

NIS 不能直接从云端对象存储拉取(付费 + DUA),但官方提供了两条免费"云上预演"路径:HCUPnet 在线查询(可生成全国统计表)与官方免费下载的 1993-2011 TRENDWT 文件。建议团队先用 HCUPnet 生成目标标签的官方加权值,作为后续本地管线的结果校验基准;购买数据后的一切加权估计都应先与 HCUPnet 对账。

预演的价值在于把"数据没到之前就能做的工程"全部前置:schema 参数化框架、对账测试、加权评估工具、按医院分组的划分器——这些都不依赖原始数据本身。数据到位当天即可跑通端到端管线,而不是从读文件开始踩坑。

§6.1 快速上手

以下代码演示从官方 ASCII 到 pandas 的最小加载链路。目录结构预期与 data_root 拼接关系已写入注释;最小可用子集建议从单年核心文件开始。

# ============================================
# 目录结构预期(data_root 为你本地根目录):
# data_root/
# └── NIS_2019/                        # 单年产品解压目录
#     ├── NIS_2019_CORE.ASC            # 核心文件(本脚本的目标)
#     ├── SAS_Load_Programs/_NIS_2019_CORE.SAS   # 官方列宽权威定义
# data_root 拼接关系:所有路径 = data_root / "NIS_2019" / 文件名
# 最小可用子集:仅核心文件即可完成权重加权估计
# ============================================
import pandas as pd
from pathlib import Path

data_root = Path("/data/hcup")                     # 按你的环境修改
core_path = data_root / "NIS_2019" / "NIS_2019_CORE.ASC"

# 列宽(colspecs)必须取自官方 SAS 加载程序,切勿手抄网络版本。
# 下方字典为示意结构:键为字段名,值为 (起始列, 结束列)——
# 完整清单以当年 FileSpecifications_NIS_2019.pdf 为准。
demo_colspecs = {
    "KEY_NIS":   (0, 8),
    "AGE":       (36, 39),
    "FEMALE":    (103, 104),
    "DIED":      (111, 112),
    "LOS":       (117, 120),
    "TOTCHG":    (132, 140),
    "DISCWT":    (153, 163),
}

df = pd.read_fwf(core_path, colspecs=list(demo_colspecs.values()),
                 names=list(demo_colspecs.keys()))

# HCUP 负值缺失惯例:先转 NaN,再做任何统计
for c in df.columns:
    df.loc[df[c] < 0, c] = float("nan")

# 一次加权估计自检:加权住院总数应与官方 HCUPnet 公布值同量级
weighted_total = df["DISCWT"].sum()
print(f"加权住院总数(自检): {weighted_total:,.0f}")

三处最容易翻车的细节:colspecs 必须来自官方加载程序而非二手资料;负值缺失必须在任何统计之前处理;DISCWT 只参与估计、不参与训练时优化权重的选择(后者是模型超参,前者是总体外推系数——混淆两者是新手高频错误)。

§6.2 数据获取

步骤 内容 渠道
1 下载并填写申请表(NIS/KID/NASS/NEDS/NRD 通用 Application Kit) HCUP-US 官网
2 完成 DUA 在线培训(强制)并打印签署 DUA hcup-us.ahrq.gov/tech_assist/dua.jsp
3 将申请表、签署 DUA、付款提交 HCUP Central Distributor 电话 866-556-4287 / HCUPDistributor@AHRQ.gov
4 获取密码,安全数字下载单年加密 ZIP 产品 在线 Central Distributor 系统

参考价格(2018 年官方价目,历史数据点):NIS 2016 单年 $625(学生 $125);2014-2015 年 $500(学生 $100);2011-2013 年 $350(学生 $50);2002-2006 年 $200(学生 $20)。学生折扣需学生证或注册办/导师证明信且不可转让。价格随年份调整,下单前以当年价目为准。

合规要点(DUA 硬约束):仅限科研与聚合统计用途;禁止向未授权者再发布、禁止在网站或公开仓库上传;禁止尝试再识别个人或医院;表格单元观察数 ≤10 时存在再识别风险警示;违反可依联邦法处最高 $10,000 罚款与最高 5 年监禁。发表时必须致谢 HCUP 并注明所用数据库。

多年购买的务实建议:价目表按"数据年 × 用户类型"计价,组合购买成本线性叠加。团队立项时的常见组合是"3 个 ICD-10 稳定年(如 2017-2019)起步 + 按需扩展";若研究目标跨 2012 redesign,务必同步下载免费的 1993-2011 TRENDWT 文件再决定回溯购买哪些旧年份数据——先核对趋势权重覆盖再下单,可避免为用不上的年份付费。学生价仅限申请者本人学术用途(毕业论文/capstone 等),不得转让给合作者,多人项目应按成人价购买或由符合资格者分别申请。

# 解压示例:Central Distributor 提供 PKWARE 加密 ZIP,密码随交付邮件提供
# (密码不可公开或写入任何代码仓库)
7z x NIS_2019.ASC.zip -p<YOUR_PASSWORD> -o/data/hcup/NIS_2019

解压后的第一件事不是建模,而是把交付清单(发票 + 文件清单 + 版本说明)存档到团队数据登记系统:DUA 审计、论文投稿、团队交接都依赖这份"我们买过什么"的记录。密码走团队密钥管理通道,与代码仓库物理隔离。

§6.3 预处理全流程

(1)ASCII → Parquet 一次性转换:把逐年的 read_fwf 结果转为列存 Parquet,后续训练零解析成本:

import pandas as pd
from pathlib import Path

def ascii_to_parquet(asc_path: Path, parquet_path: Path, colspecs: dict):
    """将官方固定宽度 ASCII 转为 Parquet;colspecs 从官方 SAS 加载程序转译。
    转换函数只需写一次,36 个数据年循环复用。"""
    df = pd.read_fwf(asc_path, colspecs=list(colspecs.values()),
                     names=list(colspecs.keys()))
    df.to_parquet(parquet_path, index=False)      # 建议按年分区存储

# 循环示意:多年管线
for year in [2016, 2017, 2018, 2019]:
    src = Path(f"/data/hcup/NIS_{year}/NIS_{year}_CORE.ASC")
    dst = Path(f"/data/parquet/nis_{year}_core.parquet")
    ascii_to_parquet(src, dst, load_official_colspecs(year))

(2)缺失与编码规范化:负值缺失转 NaN;ICD 字段统一加 I10_ 前缀命名逻辑(2015 Q4 起);把 90+ 视为独立类别而非连续年龄尾部。

(3)特征工程:诊断/手术码 → 多热向量或 CCSR 分组聚合;TOTCHG 取对数;LOS 截尾(如 P99)。特征工程的三条纪律:

  • 原始 ICD 码进模型前先过 CCSR/CCIR 聚合层,除非任务本身就是编码级预测;
  • 任何"由诊断派生的标签类字段"(APR-DRG、合并症标记)必须登记与任务目标的关系,防止共线与标签泄漏;
  • 所有派生特征记录工具版本(如 CCSR v2025.1),版本升级按 schema 事件管理。

(4)权重入表:DISCWT 永远随行携带,评估阶段用;TRENDWT 文件(1993-2011)按 KEY 合并。

(5)加载后对账自检:任何一年数据加载完成、进入特征工程之前,先跑三道官方对账(见 §4.3)。以下是对账代码骨架:

def audit_nis_load(df: pd.DataFrame, year: int,
                   official_records: int, official_weighted_total: int,
                   tol: float = 0.005) -> list:
    """加载后对账:记录数 / 加权总数 / 权重取值范围。
    official_* 数值取自当年官方 Summary Statistics 与 HCUPnet。"""
    checks = []
    n = len(df)
    checks.append(("记录数一致", abs(n - official_records) / official_records < 1e-9,
                   f"本地 {n:,} vs 官方 {official_records:,}"))
    w_total = df["DISCWT"].sum()
    checks.append(("加权总数一致", abs(w_total - official_weighted_total) / official_weighted_total < tol,
                   f"本地 {w_total:,.0f} vs 官方 {official_weighted_total:,}"))
    checks.append(("权重非负且非零", bool((df["DISCWT"] > 0).all()),
                   f"min={df['DISCWT'].min()}"))
    for name, ok, detail in checks:
        print(f"[{'PASS' if ok else 'FAIL'}] {name}: {detail}")
    return [c for c in checks if not c[1]]

三道对账全部通过后,该数据年才允许进入特征工程与训练缓存;任何 FAIL 都优先怀疑 colspecs 转译错误或文件版本不匹配,而不是怀疑官方数字。

§6.4 PyTorch DataLoader

import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader

class NISDataset(Dataset):
    """HCUP-NIS 表格数据集:院内死亡二分类。
    最小可用子集:单年 Parquet(见 §6.3),需含特征列 + DIED + DISCWT + HOSP_NIS。
    """

    def __init__(self, parquet_path: str, feature_cols: list,
                 target_col: str = "DIED", weight_col: str = "DISCWT",
                 group_col: str = "HOSP_NIS"):
        df = pd.read_parquet(parquet_path, columns=feature_cols +
                             [target_col, weight_col, group_col])
        self.X = torch.tensor(df[feature_cols].to_numpy(np.float32))
        self.y = torch.tensor(df[target_col].fillna(0).to_numpy(np.float32))
        self.w = torch.tensor(df[weight_col].to_numpy(np.float32))
        self.groups = df[group_col].to_numpy()      # 供按医院分组的划分器使用

    def __len__(self):
        return len(self.y)

    def __getitem__(self, idx):
        return self.X[idx], self.y[idx], self.w[idx]

def make_loaders(train_ds: NISDataset, val_ds: NISDataset, batch_size: int = 4096):
    # 表格 + 大样本:num_workers 按核数调;pin_memory 加速 GPU 训练
    return (DataLoader(train_ds, batch_size=batch_size, shuffle=True,
                       num_workers=4, pin_memory=True),
            DataLoader(val_ds, batch_size=batch_size, shuffle=False,
                       num_workers=4, pin_memory=True))

# 训练循环内的加权损失(要点:样本权重直接进 BCEWithLogitsLoss)
# criterion = torch.nn.BCEWithLogitsLoss(reduction="none")
# loss = (criterion(logits, y) * w).sum() / w.sum()

多年数据与按医院分组划分的完整方案(泄漏控制的最小实现):

import numpy as np
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

def build_hospital_split(df: pd.DataFrame, test_size: float = 0.2,
                         seed: int = 42) -> tuple:
    """以 HOSP_NIS 为组键做医院级划分:同一医院的所有出院记录
    只能出现在训练侧或测试侧之一,阻断医院聚类泄漏。"""
    splitter = GroupShuffleSplit(n_splits=1, test_size=test_size, random_state=seed)
    train_idx, test_idx = next(splitter.split(df, groups=df["HOSP_NIS"]))
    return train_idx, test_idx

def merge_multi_years(parquet_dir: str, years: list) -> pd.DataFrame:
    """多年合并:2012 前后字段差异在此层抹平。
    合并后 YEAR 列必须保留——它是方差计算的分层变量(坑点 6)。"""
    frames = [pd.read_parquet(f"{parquet_dir}/nis_{y}_core.parquet")
              for y in years]
    df = pd.concat(frames, ignore_index=True)
    df["YEAR"] = np.repeat(years, [len(f) for f in frames])
    return df

§6.5 坑点 8 个(真实特有失败模式)

⚠️ 坑点 1:忽略 DISCWT 权重,把样本当总体(分类:偏倚陷阱)

问题:NIS 每条记录代表其抽样层内的若干条真实出院(权重约等于层内总体出院数 ÷ 样本出院数,20% 抽样率下权重约在 5 上下)。直接对未加权记录训练并把未加权指标当作全国结论,会让所有"全国估计"系统性偏离真实总体。
症状:你报告的"全国住院总数"与 HCUPnet 官方公布值差一个量级或方向明显异常;审稿人质疑"未使用抽样权重"。
解决:

  1. 简单方法:所有总量/率估计用 DISCWT 加权求和;模型评估用加权 AUROC/加权损失。
  2. 进阶方法:统计推断走调查设计路线——Stata svyset HOSP_NIS [pw=DISCWT], strata(NIS_STRATUM) 后用 svy: 命令族;SAS 用 SURVEY 系列。
  3. SOTA 方法:深度学习场景保留普通优化,但评估层全部换成加权指标并用官方方差报告(2012 及以后按《Calculating NIS Variances for Data Years 2012 and Later》,以 HOSP_NIS 为 cluster);论文同时报告未加权与加权结果以证明稳健。
    参考:HCUP《Calculating National Inpatient Sample (NIS) Variances for Data Years 2012 and Later》(Methods Report #2015-09);NIS Introduction 各年"Getting Started"章节。

⚠️ 坑点 2:跨 2012 年趋势断裂——redesign 的一次性中断(分类:评估误用)

问题:2012 redesign 把抽样单位从"医院"换成"出院记录"、剔除 LTACH、分层细化到 9 个普查分区、总体计数从 AHA 估计改为 SID 实际数。官方量化了由此产生的一次性趋势中断:出院数约 -4.3%、平均住院日约 -1.5%、总费用约 -0.5%、院内死亡率约 -2.0%。这些"变化"是设计产物而非真实世界变化。
症状:2011→2012 的趋势图出现无法用流行病学解释的跳变;把 redesign 断点误读为政策效果,发表错误结论。
解决:

  1. 简单方法:趋势分析跨 2012 时在图中明确标出 redesign 断点,避免把 2011 与 2012 直接相连比较。
  2. 进阶方法:对 1993-2011 年改用官方 TRENDWT 趋势权重(免费下载,与 redesign 后 DISCWT 同口径),使整段趋势可比。
  3. SOTA 方法:在断点前后分别建模或使用带断点指示变量的 ITS;用官方公布的四个预期中断幅度(-4.3%/-1.5%/-0.5%/-2.0%)作为结果的合理性 sanity check。
    参考:2012 NIS Redesign Report;HCUP《Using Multiple Years of Data》官方教程(trend weights 章节)。

⚠️ 坑点 3:2015 年混合编码——ICD-9-CM 与 ICD-10-CM/PCS 同年共存(分类:预处理陷阱)

问题:美国于 2015-10-01 切换编码系统,NIS 是日历年数据,于是 2015 年前三季度是 ICD-9-CM、第四季度是 ICD-10-CM/PCS,且官方把两者拆成独立文件;诊断码总数从约 14,000 跃至 68,000+,手术码从约 4,000 跃至 72,000+;ICD-10 时代字段名统一加 I10_ 前缀(DXn → I10_DXn);官方软件工具自 Q4 2015 起不再内置于数据库。
症状:把 2015 两个文件直接 concat 后,同一疾病在不同季度的编码互斥,特征矩阵大面积稀疏错位;跨 2015 的疾病趋势出现"断崖"。
解决:

  1. 简单方法:跨 2015 分析直接使用 2014(纯 ICD-9)与 2016(纯 ICD-10)两年,跳过 2015;或只用 2015 单侧季度。
  2. 进阶方法:用 HCUP CCSR/CCS 工具(官方已提供 ICD-10 版本)把两侧编码都聚合到同一分组体系后再比较;字段名按 I10_ 前缀做统一映射层。
  3. SOTA 方法:按"年 × 季度"分别估计编码切换效应(官方建议做法);在趋势图中明确 demarcate 切换日期,并引用官方 Methods Report #2016-02 的注意事项做敏感性分析。
    参考:HCUP ICD-10-CM/PCS Resources 页;NIS 2015 Introduction(“Caution: 2015 NIS includes ICD-9-CM and ICD-10-CM/PCS”)。

⚠️ 坑点 4:把 NIS 当患者级数据库——再入院与纵向研究全部失效(分类:数据泄漏)

问题:NIS 是出院级记录,无统一患者标识;同一患者一年多次住院会以多条互不相连的记录出现。任何"患者轨迹/再入院/30 天死亡"任务在 NIS 上不仅不可行,而且如果强行用"存在相似合并症签名"的记录做配对,会把患者级信息泄漏到训练/测试两侧。
症状:尝试用 KEY_NIS 串联"同一患者"发现毫无规律;再入院率估计与官方 NRD 结果严重不符。
解决:

  1. 简单方法:再入院与纵向问题改用 HCUP-NRD(全国再入院数据库,患者级链接)或 SID + Revisit Files(州内患者级链接)。
  2. 进阶方法:在 NIS 上只做出院级任务,并把"无法排除同一患者多条记录"写入局限性;划分时按 HOSP_NIS 分组以压住医院级泄漏。
  3. SOTA 方法:需要同时覆盖住院与再入院时,采用 NIS(全国出院级)+ NRD(患者级再入院)双库互补设计,分别报告。
    参考:NIS Introduction 各年"Studying Readmissions"章节(官方明确指引改用 NRD/SID)。

⚠️ 坑点 5:亚组分析先子集化再估方差——标准误悄悄算错(分类:评估误用)

问题:NIS 是分层整群(2012 后出院聚类于医院)样本。若为分析某亚组(如囊性纤维化患者)先把其余记录删掉再算方差,部分医院会从样本中"消失",标准误的整群结构被破坏,SE 可能错误。
症状:亚组分析的置信区间异常窄/宽;同一亚组两种实现方式给出差异巨大的 p 值。
解决:

  1. 简单方法:保留全样本,用指示变量标记亚组,在 SAS DOMAIN 语句或 Stata subpop() 选项内做亚组估计。
  2. 进阶方法:若计算资源不足以在全样本(约 700 万条)上跑,官方提供了替代方案——对每个医院在子集外补一条"哑观测",诱导软件采用正确方差公式(2012 年 NIS 约增加 4,378 条,代码见官方报告附录)。
  3. SOTA 方法:机器学习评估同样遵守此规则——加权指标在全样本上计算,亚组层仅用 DOMAIN/subpop 口径比较。
    参考:HCUP Methods Report《Calculating NIS Variances》(2015_09 报告页,亚组分析章节与附录代码)。

⚠️ 坑点 6:合并多年数据时方差设计被"洗掉"(分类:工程陷阱)

问题:把 2016-2023 八个年度 concat 成一张大表后直接 svyset,统计软件会把它当作单一年份的样本;每年是独立的抽样设计,合并层的方差必须反映"年 × 层"结构。此外 2012 年后出院仍聚类于医院,cluster 不可省。
症状:合并多年后所有标准误缩小到不合理水平,显著性"全面转阳";同一模型在单年与多年数据上的置信区间严重不一致。
解决:

  1. 简单方法:把 YEAR 作为额外分层变量加入 svyset;cluster 一直保留 HOSP_NIS。
  2. 进阶方法:跨 2012 的合并数据对 1993-2011 段先 merge TRENDWT 并以其替换 DISCWT,再按 YEAR 分层。
  3. SOTA 方法:对深度学习管线,把"年"作为协变量或做按年标准化,评估方差用按年 bootstrap 或官方设计方差,不用朴素 i.i.d. 估计。
    参考:HCUP《Calculating NIS Variances》报告(Combining Multiple Years 章节);官方 Online Tutorial《Using Multiple Years of Data》。

⚠️ 坑点 7:用 NIS 做州级估计——官方明令反对(分类:标签理解)

问题:NIS 在每个抽样层内只保证全国 20% 代表性,层内各州占比不等于该州真实医院占比;2012 起州标识被整体删除。州级估计既无代表性支持,也无设计方差可用。
症状:用 2012 年前含州字段的 NIS 做"某州 vs 某州"比较,结论逐年漂移且与州官方数据对不上。
解决:

  1. 简单方法:州级问题直接购买/申请对应州 SID(州级全量)。
  2. 进阶方法:地理分析降到 NIS 官方支持的粒度——9 个普查分区(2012 起 HOSP_DIVISION;注意 2023 年起该字段也被移除,见坑点 8)。
  3. SOTA 方法:若必须做空间细分,用 NIS 做全国估计 + SID 做州级验证的双层设计,并在论文中展示两库一致性。
    参考:官方文档专页《Why the NIS should not be used to make State-level estimates》。

⚠️ 坑点 8:缺失值的"三重变脸"——负值编码、结构性缺失与字段蒸发(分类:偏倚陷阱)

问题:NIS 缺失有三副面孔:(a) 负值缺失码(-99/-98/-97 等)混在数值列里;(b) 结构性缺失——部分州因保密法不上报 HIV/AIDS、行为健康、人工流产记录,RACE 缺失率 2016-2018 年约 3-5% 且与州相关;© 字段级蒸发——2023 年 RACE 被整体移除、PL_NCHS 收缩为两类、TOTCHG 更名 TOTCHG_2023 且口径调整、HOSP_REGION/HOSP_DIVISION 消失。
症状:直接训练时负值被当合法取值(费用模型出现"负费用"预测);公平性分析在 RACE 上给出看似无偏却结构性缺样本的结论;跨 2022/2023 的模型特征矩阵列名对不齐。
解决:

  1. 简单方法:加载后立刻把负值转 NaN;对每个数据年维护一份"字段存在性 + 口径"清单,跨年合并前做 schema 对齐。
  2. 进阶方法:把州(或 NIS_STRATUM)作为缺失指示的分层因子检查缺失机制;对 RACE 类分析做敏感性分析并引用官方缺失率(2016: 5.1%、2017: 4.3%、2018: 3.3%)。
  3. SOTA 方法:特征管线按"编码系统版本(ICD-9/ICD-10)× 数据年 schema"双维度参数化;2023 年费用分析使用 TOTCHG_2023 并在与其他年合并时做口径说明(官方 HCUPnet 已对 2023 费用比较发布谨慎提示)。
    参考:NIS 2023 Overview"What’s New"章节;NIS 2015 Introduction Appendix II(州级限制);HCUPnet 2023 数据注释。

§6.6 数据增强(表格特有)

表格行政数据的"增强"与影像截然不同:任何改变字段语义的变换都会破坏与官方编码体系的对齐。判断准则只有一条——增强后的记录仍应是一个"可能真实出现的出院摘要"。

策略 判定 说明
数值特征加性噪声(LOS、年龄尾部) ❌ 危险 破坏行政数据的计数/编码语义
SMOTE 过采样少数类(DIED) ❌ 危险 合成样本无抽样含义,破坏加权估计
随机遮蔽 ICD 码(dropout 式增强) ✅ 安全(受控) 模拟编码不全的现实;遮蔽率宜 ≤10%
CCSR 分组层面的特征聚合替换原始码 ✅ 安全 官方分组体系,降维且抗编码漂移
按年份的归一化(用训练年统计量) ✅ 安全 处理 2012/2015/2023 断层的标准做法
按抽样层的重采样 ⚠️ 谨慎 与设计方差交互复杂,仅在 bootstrap 方差框架内使用

§6.7 模型推荐

模型 适用任务 理由
Logistic 回归(加权) 基线 + 可解释全国估计 与卫生服务研究传统接轨,审稿友好
XGBoost / LightGBM 死亡/费用/LOS 主力 表格 SOTA 常客,CPU 训练 700 万条可行
FT-Transformer / TabNet 表格深度学习基准 深度模型在 NIS 规模上的对照价值
两阶段 GBDT + 校准 费用长尾回归 对数变换 + 分位数校准处理右偏
ITS / 差分中的 ML 残差法 政策评估 与 TRENDWT 体系互补
Isotonic / Platt 校准层 部署前概率校准 加权训练后的概率需按全国口径重校准

§6.8 硬件需求

场景 CPU 内存 存储 说明
单年加载 + 加权统计 8 核 32 GB 500 GB SSD Parquet 化后单年核心 <1 GB
多年 GBDT 训练 16-32 核 64 GB 2 TB 10 年全量约 7,000 万条
表格深度学习 1× A100/4090 64 GB 2 TB batch 4,096 起步,混合精度
全样本调查方差(Stata/SAS) 16 核 128 GB 2 TB DOMAIN/subpop 全样本口径

两条降本经验:其一,GBDT 与调查统计管线在 CPU 上即可全速运行,GPU 只在表格深度学习对照实验时需要;其二,单年样本随机抽取 10% 做迭代开发、全量只跑最终一次,可把总计算时间压掉一个量级——但注意开发抽样也应保留权重列,最终指标必须回全量算。

§6.9 评估指标代码

指标选择的三条原则:(1) 全部加权——未加权指标只作诊断参考;(2) 总量类指标配方差——点估计不带置信区间在 NIS 语境下不可发表;(3) 排序类指标注意权重语义——加权 AUROC 回答"全国出院的排序质量",与"该医院内排序质量"是不同问题。

import numpy as np
import torch

@torch.no_grad()
def weighted_eval(model, loader):
    """设计加权评估:加权 AUROC 配件 + 加权 Brier。
    严格方差需按官方报告以 HOSP_NIS 为 cluster 计算,
    此处返回逐条记录的加权统计量供上层聚合。"""
    model.eval()
    ys, ps, ws = [], [], []
    for X, y, w in loader:
        logits = model(X.cuda()).squeeze(-1)
        ps.append(torch.sigmoid(logits).cpu())
        ys.append(y)
        ws.append(w)
    y, p, w = map(torch.cat, (ys, ps, ws))
    # 加权排序指标(简化实现):按预测排序累计正例权重 / 总正例权重
    order = torch.argsort(p)
    y_sorted, w_sorted = y[order], w[order]
    cum_pos = torch.cumsum(y_sorted * w_sorted, 0)
    total_pos = (y * w).sum()
    total_neg = ((1 - y) * w).sum()
    auroc = (cum_pos / total_pos)[:-1] @ ((1 - y_sorted) * w_sorted)[1:] / (total_pos * total_neg)
    brier = (((p - y) ** 2) * w).sum() / w.sum()
    return float(auroc), float(brier)

def design_bootstrap_se(df: pd.DataFrame, score_fn, n_boot: int = 200,
                        seed: int = 42) -> float:
    """指标标准误:按医院(HOSP_NIS)为整群做 bootstrap 重采样,
    匹配"出院聚类于医院"的设计(官方方差思路的工程近似)。
    严格的 design-based 方差请用 Stata svy/SAS SURVEY。"""
    rng = np.random.default_rng(seed)
    hospitals = df["HOSP_NIS"].unique()
    stats = []
    for _ in range(n_boot):
        picked = rng.choice(hospitals, size=len(hospitals), replace=True)
        chunks = [df[df["HOSP_NIS"] == h] for h in picked]
        boot_df = pd.concat(chunks, ignore_index=True)
        stats.append(score_fn(boot_df))
    return float(np.std(stats, ddof=1))

§6.10 MLOps 笔记

  • 数据版本化:按"数据年 × schema 版本 × 编码系统"三键管理 Parquet 快照;2012/2015/2023 三个断层年打 tag。
  • 对账测试:CI 中内置"加权总数 vs HCUPnet 官方值 ±0.5%"断言,防止加载回归。
  • 可复现性:官方 ASCII + colspecs 是唯一真相源,任何中间格式必须能从它们一键重建。
  • 合规流水线:DUA 禁止公开上传原始数据,内部仓库需访问控制;发布物只允许聚合统计(表格单元 >10 原则)。
  • 监控漂移:上线后按季度(DQTR)监控特征分布与加权率,编码系统切换视为计划内 schema 事件。
  • 特征注册表:ICD 码族特征必须登记"定义来源(CCSR v 版本号)+ 适用编码系统",CCSR 工具每年更新版本,静默升级会改变特征含义。
  • 训练/推理一致性:线上推理若拿不到训练时的字段(如 2023 起无 RACE),应在训练侧就做字段可用性矩阵,而不是在推理侧做静默填充。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
覆盖偏倚 仅覆盖参与州社区医院,早期年份(1988-1992)仅 8-11 州、<50% 出院覆盖 高(早期)/低(近期) 趋势分析从 1993 开始;报告各年参与州数
病种上报偏倚 部分州禁止上报 HIV/AIDS、行为健康、人工流产记录 中 识别相关编码的州级缺失,做敏感性分析
编码漂移 医院编码实践随政策与编码系统演变(尤其 2015 切换) 高 CCSR 聚合层比较;按季度检查不连续
设计断层 2012 redesign 一次性中断(出院数约 -4.3% 等) 高(跨 2012) TRENDWT;断点标注
人口学缺失 RACE 缺失 3-5%(2016-2018),2023 起移除 中 官方缺失率披露;谨慎做种族分层结论
年龄上截断 2012 起 >89 聚合为 90+ 低 90+ 作为独立类别建模
收入代理误差 收入四分位取自患者邮编中位数而非个人收入 中 解读为"社区收入"而非"个人收入"
粒度限制 无实验室/生命体征/用药/影像,疾病严重度仅由编码派生 高(临床预测任务) 与单中心 EHR 互补使用;谨慎宣称临床可用性

偏倚缓解的总原则:NIS 的每个偏倚都有官方文档背书的"已知"属性——这是它相对其他行政数据最大的优势。正确姿势不是假装偏倚不存在,而是把上表的每一行映射到分析管线的对应环节(覆盖 → 人群限定、编码漂移 → 分组层、设计断层 → 权重选择),让每个缓解措施都有出处可引。

§7.2 标注质量

原始 ICD 编码由医院病案编码员完成,覆盖率接近 100% 但精度受编码实践差异影响;HCUP 派生标签(APR-DRG、CCS/CCSR、合并症 CMR_*)由确定性软件生成,可重复性 100%。主要风险在原始码层:编码错误、漏编与跨院实践差异都会传导到派生层。官方提供 Quality Control Procedures 文档描述其清洗与校验流程,但编码员间一致性不对外发布。

实务上的三层应对:(1) 特征优先使用 CCSR/CCIR 聚合分组而非原始 ICD 码,用"分组不变性"吸收编码噪声;(2) 结局类标签(DIED/LOS)由医院运营系统直接产生,受编码实践影响小于诊断标签,优先作为主任务;(3) 对编码敏感的结论(如某并发症发生率的时间趋势),必须叠加 ICD 编码切换的敏感性分析——官方阿片案例研究已经示范了这类偏移可以大到改变趋势方向。

§7.3 泛化性

场景 失效风险 证据
从 NIS 到单中心部署 高:人群结构与编码实践不同 NIS 为全国样本,含大量小型/乡村医院
从 ICD-9 模型到 ICD-10 环境 高:编码体系结构不同 官方 ICD-10 Resources 页明确警示趋势不连续
从参与州到未参与州 低-中:加权设计已外推总体 抽样框覆盖约 97% 出院量
跨 2022→2023 特征迁移 中:RACE/地理字段移除 2023 Overview 字段变更清单
从住院摘要到床旁实时预测 极高:无时序/生理信号,季度粒度 模态边界(§3.1),应用单中心 ICU 数据补足

§7.4 伦理

NIS 是去标识化的行政数据,DUA 明令禁止再识别尝试;单元格 ≤10 的聚合结果有再识别风险警示。次级使用无需 IRB(以机构政策为准),但发表须致谢 HCUP。特殊病种(HIV/AIDS、行为健康、人工流产)在州层面的系统性缺失提醒研究者:对弱势人群的研究结论可能受上报限制扭曲。

伦理审查的两个常被忽视的点:其一,虽然 NIS 已去标识,但"尝试再识别"在 DUA 下是联邦违法行为(最高 $10,000 罚款 + 5 年监禁),这包括一切形式的链接攻击实验——即使出于"安全研究"动机也不被允许;其二,用 NIS 训练的模型若进入临床部署,公平性义务不会因训练数据"已脱敏"而消失,训练侧的代表性缺口(如种族字段缺失)会在部署侧变成对特定人群的不确定性。

§7.5 公平性

公平性分析的可用维度:性别(FEMALE)、年龄、预期支付方(PAY1)、患者邮编收入四分位(ZIPINC_QRTL)、居住地城乡(PL_NCHS/PL_NCHS2)。RACE 维度受限于 3-5% 缺失且 2023 起不可用——任何种族/民族差异结论必须披露该缺失机制(缺失与州上报要求相关,非随机)。支付方维度天然携带"保险类型 ≠ 支付能力"的语义陷阱,解读需谨慎。

公平性建模的两个技术提醒:其一,ZIPINC_QRTL 是邮编层面代理变量,用它做个体收入分层会犯生态学谬误,正确表述是"社区收入层";其二,公平性指标同样需要加权与方差——未加权分组差异可能只是抽样构成波动,只有设计加权后的组间差异及其置信区间才具备全国证据资格。

§7.6 数据漂移

NIS 有三次计划内漂移事件:2012 redesign(设计层)、2015-10 编码切换(语义层)、2023 字段调整(schema 层)。此外还有持续性的慢漂移:参与州变化、编码实践演进、支付方结构变化。健康 ML 系统应把这三个年份当作"受控 schema 事件"管理,并在监控面板上标注。

慢漂移的监测建议:对每个数据年计算一组"锚定统计量"(按 CCSR 分组的住院份额、按 PAY1 的支付方构成、按 HOSP_BEDSIZE 的医院构成),任何下游模型的输入分布漂移都应先与这组锚定量对照——如果锚定量本身在动,那是全国真实变化,不是管线故障;如果锚定量稳定而模型输入分布动了,那才是本地数据管线的回归。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ 单表出院记录,100+ 变量一行齐备
2 唯一标识 ✅ KEY_NIS 记录级唯一(患者级不可得,见 #16)
3 特殊字符 ✅ 固定宽度 ASCII 无分隔符歧义;官方 formats 程序提供标签
4 重复行 ⚠️ 记录级无重复;患者级重复入院不可识别
5 缺失编码 ✅ 统一负值缺失码 + 官方加载/格式程序说明
6 标签标识 ✅ DIED/LOS/TOTCHG/APRDRG 等标签定义清晰
7 罕见类分组 ✅ 官方 frequencies 与 CCSR/CCIR 分组抑制长尾编码问题
8 偏倚评估 ✅ 官方 Methods 系列、redesign 报告、NIS Comparison Report
9 数据字典 ✅ 逐年 Description of Data Elements + File Specifications
10 信息性缺失解释 ⚠️ 州级限制与 RACE 缺失有披露,但无字段级缺失机制专章
11 设备记录 ❌ 无任何设备/检查原始数据
12 共线性 ⚠️ APR-DRG/CCS 派生字段与原始码强共线,需特征纪律
13 编码映射 ✅ ICD↔CCSR/CCIR 官方映射与工具齐全
14 时间戳处理 ⚠️ 仅季度(DQTR)与 LOS,无具体日期
15 划分建议 ⚠️ 无官方 ML 划分,需按医院分组自建
16 泄漏讨论 ⚠️ 无患者 ID 使患者级泄漏不可验证;医院聚类泄漏需自行处理
17 标签分布 ✅ HCUPnet + 官方 Summary Statistics 免费核对
18 测量偏倚 ⚠️ 州级上报限制与编码实践差异已披露但难完全校正
19 外部验证建议 ✅ 官方 NIS Comparison Report + 建议与外部数据源对账
20 版本记录 ✅ 36 个数据年逐年文档 + Known Data Issues 专页
21 预处理脚本 ✅ 官方 SAS/SPSS/Stata 加载程序(Python 需自行转译 colspecs)
22 合规要求 ✅ DUA 培训 + 签署 + 发表致谢要求明确
23 多模态对齐 ❌ 单模态表格数据
24 去标识化 ✅ 无直接标识符;DUA 禁止再识别;90+ 截断

DAIMS 评分:18.5 / 24

计分方法:✅ 记 1 分、⚠️ 记 0.5 分、❌ 记 0 分,15 个 ✅ + 7 个 ⚠️ + 2 个 ❌ = 18.5。

评分解读:18.5 分处于"行政健康数据库的第一梯队"水平。NIS 在数据字典、缺失编码、版本记录、合规与官方工具链上的完备性接近教科书级;扣分集中在结构性限制而非管理疏漏——无患者级标识(#16)、无时间戳(#14)、无多模态(#23)、无设备数据(#11)是其"出院摘要"模态的固有边界,无官方 ML 划分(#15)则是调查型数据集的共性。纵向对比看,NIS 的 DAIMS 得分随官方文档完善逐年走高(2023 年字段变更虽有短期阵痛,但官方披露的完整度反而提高了透明度项得分)。

对你意味着什么:如果你的任务是"全国级表格预测或政策估计",NIS 的 18.5 分意味着开工即有高质量地基——但必须自建三件事:(1) 按 HOSP_NIS 分组的划分器;(2) 跨 2012/2015/2023 的 schema 参数化层;(3) 加权评估与官方方差管线。如果你的任务需要患者轨迹、波形、影像或文本,18.5 分明确告诉你:换 NRD(再入院)或单中心 EHR(深度模态),不要逆着模态边界硬做。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
NIS Comparison Report(对照国家级统计) AHRQ HCUP 全国住院量/费用/结局估计一致性 官方对照报告 — AHRQ 周期性发布 NIS 与外部基准的对照,建议每次大版本更新后查阅
HCUPnet 官方加权统计 AHRQ HCUP 加权估计对账 交叉核对 — 官方免费查询系统,是加载正确性的第一道外部校验
阿片相关住院趋势(ICD-10 切换前后) HCUP Statistical Brief(Med Care 2017;55(11):918-923) 编码切换趋势敏感性 趋势变化方向 切换后趋势口径改变 官方案例研究显示 ICD-10 切换使阿片相关趋势的解读发生偏移,需按编码系统分段报告

这张矩阵刻意做小:NIS 的外部验证文化建立在"官方对照 + 官方案例"之上,任何一行新结论都应先问"官方对照报告是否覆盖了这个问题"。团队自建的外部验证(如与州医院协会统计对照)可以作为附加证据,但不能替代官方对照渠道的核查义务。


§8 基准性能与生态

§8.1 代表性研究与方法基准

NIS 不是竞赛型基准数据集,不存在 Kaggle 式排行榜;下表收录的是方法学上被官方与社区反复引用的"基准级"研究。注意:以下数值服务于各自的研究问题(设计、口径、年份、权重体系不同),不可直接横向比较。

为什么这张表看起来"不像排行榜"——因为 NIS 的核心交付物是估计量而非预测分数:同一份 NIS 2019,用不同权重版本(DISCWT vs TRENDWT)、不同方差口径、不同编码分组层得到的数字都可以合法地不同。把表内各项研究理解为"NIS 正确用法的参考实现",比把它们理解为"成绩单"更接近本意。

排名 研究/报告 任务与结果 年份 关键方法 完整引用 代码
1 NIS 方差计算(2012+ 设计) 全国估计的方差/标准误规范 2015 分层整群方差、DOMAIN 亚组口径 Houchens R, Ross D, Elixhauser A, Jiang J. Final Report on Calculating National Inpatient Sample (NIS) Variances for Data Years 2012 and Later. HCUP Methods Series Report #2015-09. AHRQ. https://www.hcup-us.ahrq.gov/reports/methods/2015_09.jsp 官方附录提供 SAS/Stata 代码
2 2012 NIS Redesign Report 量化 redesign 对估计的影响(出院数约 -4.3% 等) 2012 设计比较、双权重对照 Agency for Healthcare Research and Quality. 2012 NIS Redesign Report. HCUP. https://hcup-us.ahrq.gov/db/nation/nis/nisredesignrept.jsp 权重文件免费下载
3 趋势估计方法报告 1988-2004 跨年趋势的正确估计 2006 TRENDWT 思想来源 Houchens RL, Elixhauser A. Using the HCUP Nationwide Inpatient Sample to Estimate Trends. HCUP Methods Series Report #2006-05. AHRQ. https://hcup-us.ahrq.gov/reports/methods/methods_topic.jsp —
4 阿片趋势与 ICD-10 切换案例 切换导致阿片住院趋势口径偏移 2017 编码切换敏感性分析 Stock EM, et al. Trends in Opioid-related Inpatient Stays Shifted After the US Transitioned to ICD-10-CM Diagnosis Coding in 2015. Med Care. 2017;55(11):918-923. —
5 NIS 2005 Design Report 旧设计(医院抽样)完整设计文档 2005 分层单阶段整群抽样 Agency for Healthcare Research and Quality. 2005 HCUP Nationwide Inpatient Sample Design Report. https://hcup-ts.ahrq.gov/db/nation/nis/reports/NIS_2005_Design_Report.jsp —
6 NIS Comparison Report 与外部基准的估计一致性对照 周期更新 官方对照 Agency for Healthcare Research and Quality. NIS Comparison Report. HCUP. 见 NIS Database Documentation 页 —

§8.2 SOTA 总结与选型建议

在 NIS 上不存在"刷榜"意义上的 SOTA。务实的选型逻辑:估计型问题(全国率/总量/差异)用加权调查方法为主、ML 为辅;预测型问题(死亡/费用/LOS)用 GBDT 打底、深度表格模型对照;政策型问题用 ITS/断点设计与加权 ML 残差法结合。所有路线共享同一套前置要求:权重、方差、断层处理。

一个实用的成熟度阶梯:第一级,能正确加权复现官方统计(加载无误、权重无误);第二级,能给出设计正确的不确定度(方差/聚类/分层设置无误);第三级,能把 ML 嵌入调查框架(加权训练、分层评估、跨断层稳健)。绝大多数已发表的"NIS + 机器学习"论文停留在第二级——把第三级做扎实本身就是方法的差异化贡献。

§8.3 评测协议建议

  1. 报告加权与未加权双套指标;2. 方差按官方规范(HOSP_NIS cluster、YEAR 分层、DOMAIN/subpop 口径);3. 划分按医院分组并声明;4. 跨断层年的结论必须分段或用 TRENDWT;5. 与 HCUPnet 官方值对账作为结果可信度声明。

补充两条工程协议:其一,随机种子与划分键应连同"官方对账通过"的快照哈希一起记录,保证任何结果可以三重定位(数据版本 → 划分 → 代码提交);其二,凡引用其他论文的 NIS 数值做对比时,先核对其数据年、权重版本与编码系统——不同协议下的 NIS 数值差异可能比模型间差异大得多,这是本领域论文对比最常见的翻车点。

数据集 机构 关系 适用差异
HCUP-NRD AHRQ 同族再入院库 患者级链接,2013 起
HCUP-KID AHRQ 同族儿科库 三年一版,儿童出院样本
HCUP-NEDS AHRQ 同族急诊库 急诊出院样本
HCUP-SASD AHRQ 同族门诊手术库 覆盖门诊手术场景
HCUP-SID/SASD/SEDD AHRQ 州级全量库 州级估计与州内链接

跨库选型的决策树:研究问题落在"全国 + 住院 + 一次住院"→ NIS;“全国 + 再入院/纵向”→ NRD;“全国 + 儿童”→ KID;“全国 + 急诊”→ NEDS;“州级或州内患者链接”→ SID 系。先把问题映射到库,再考虑建模——NIS 论文最常见的选题错误就是把纵向问题硬塞进出院级数据。
| CDC NHDS | CDC | 历史对照 | 已停收的全美出院调查,曾用于交叉校验 |
| HCUP-NASS | AHRQ | 同族急诊/门诊手术样本库(Ambulatory Surgery Sample) | 门诊手术全国样本 |
| MIMIC-III | MIT LCP/BIDMC | 模态互补 | 单中心 ICU 深度 EHR |

§8.5 关键论文 Top 5

  1. Houchens R, Ross D, Elixhauser A, Jiang J. Final Report on Calculating National Inpatient Sample (NIS) Variances for Data Years 2012 and Later. HCUP Methods Series Report #2015-09. AHRQ. — 一切 NIS 统计推断的方差权威。
  2. Agency for Healthcare Research and Quality. 2012 NIS Redesign Report. — 理解 2012 前后估计差异的必读文档。
  3. Houchens RL, Elixhauser A. Using the HCUP Nationwide Inpatient Sample to Estimate Trends. HCUP Methods Series Report #2006-05. — 跨年趋势权重方法学的源头。
  4. Agency for Healthcare Research and Quality. Overview of the National (Nationwide) Inpatient Sample (NIS). https://hcup-us.ahrq.gov/nisoverview.jsp — 官方总览,字段变更与版本状态的单一入口。
  5. Stock EM, et al. Trends in Opioid-related Inpatient Stays Shifted After the US Transitioned to ICD-10-CM Diagnosis Coding in 2015. Med Care. 2017;55(11):918-923. — 编码切换如何扭曲疾病趋势的官方案例研究。
  6. Agency for Healthcare Research and Quality. HCUP Using Multiple Years of Data(官方 Online Tutorial,多年数据合并与 TRENDWT 使用). https://hcup-us.ahrq.gov/tech_assist/trends/508/508course_2019.jsp — 官方一手操作教程,坑点 2/6 的操作性出处。

§8.6 社区活跃度

NIS 的"社区"是高度制度化的官方体系:HCUP-US 网站的 User Support(邮箱 hcup@ahrq.gov、电话 866-290-HCUP)、免费 Online Tutorial Series、DUA Training Tool,以及持续更新的 Statistical Brief 系列与 Known Data Issues 专页。卫生服务研究社区(健康服务研究会议、Health Services Research / Med Care 等期刊)构成其学术生态。对 AI 社区,NIS 更多作为"数据源"而非"竞赛平台"出现——遇到问题的第一站永远是官方文档而非 Stack Overflow。

活跃度的三个可观察指标:(1) 官方文档持续更新——2026 年仍在发布新的州数据库与软件工具年度更新;(2) HCUPnet/Fast Stats 等免费工具持续迭代;(3) Statistical Brief 系列以数百计的规模持续产出,覆盖从阿片危机到孕产妇健康的所有热点。对研究者而言,这意味着"新数据年 + 新工具版本 + 新官方分析"的供给是持续可预期的。

§8.7 生态快照

资源 类型 链接 状态(截至 2026-09) 推荐理由
HCUPnet 免费在线查询 https://datatools.ahrq.gov/hcupnet 官方持续运营 加权估计对账的第一工具
HCUP Fast Stats 免费统计面板 https://datatools.ahrq.gov/hcup-fast-stats 官方持续运营 快速趋势参照,含 ICD-10 断层标注
TRENDWT 权重文件(1993-2011) 免费下载 https://hcup-us.ahrq.gov/db/nation/nis/trendwghts.jsp 官方提供 SAS/SPSS/Stata 加载程序 跨 2012 趋势的必需品
CCSR / CCS / 合并症软件 免费软件工具 https://hcup-us.ahrq.gov/toolssoftware.jsp 2026 年度更新(v2026.1 服务/手术工具) ICD → 特征分组的标准层
Cost-to-Charge Ratio Files 补充文件 HCUP-US 补充文件页 持续提供 费用(cost)研究必需
HCUP Formats / DRG Formats 程序 免费格式程序 NIS Database Documentation 页 持续提供 给分类字段挂官方标签,避免手写映射
HCUP Online Tutorial Series 免费教程 HCUP-US 网站 持续运营 官方培训,覆盖权重与趋势

生态使用的推荐顺序:Tutorial Series 打底(半天)→ HCUPnet 对账(半天)→ Trend Weights/CCSR 工具接入(按需)→ 购买数据开工。这一顺序让团队在花钱之前就掌握权重体系,避免"买完数据才发现不会用"的沉没成本。


§9 相关资源与引用

§9.2 BibTeX 引用

@misc{hcup_nis_2026,
  author       = {{Agency for Healthcare Research and Quality}},
  title        = {{HCUP National (Nationwide) Inpatient Sample (NIS)}},
  year         = {2026},
  publisher    = {{AHRQ Healthcare Cost and Utilization Project}},
  address      = {Rockville, MD},
  url          = {https://hcup-us.ahrq.gov/db/nation/nis/},
  note         = {Database documentation, data years 1988-2023}
}

@techreport{hcup_nis_variances_2015,
  author      = {Houchens, Robert and Ross, Dennis and Elixhauser, Anne and Jiang, Jun},
  title       = {Final Report on Calculating National Inpatient Sample (NIS) Variances for Data Years 2012 and Later},
  institution = {{Agency for Healthcare Research and Quality}},
  type        = {{HCUP Methods Series Report}},
  number      = {2015-09},
  year        = {2015},
  address     = {Rockville, MD},
  url         = {https://www.hcup-us.ahrq.gov/reports/methods/2015_09.jsp}
}

@techreport{hcup_nis_trends_2006,
  author      = {Houchens, Robert L. and Elixhauser, Anne},
  title       = {Using the {HCUP} Nationwide Inpatient Sample to Estimate Trends},
  institution = {{Agency for Healthcare Research and Quality}},
  type        = {{HCUP Methods Series Report}},
  number      = {2006-05},
  year        = {2006},
  address     = {Rockville, MD}
}

@article{stock_2017_opioid_icd10,
  author  = {Stock, Elna M. and others},
  title   = {Trends in Opioid-related Inpatient Stays Shifted After the {US} Transitioned to {ICD-10-CM} Diagnosis Coding in 2015},
  journal = {Medical Care},
  volume  = {55},
  number  = {11},
  pages   = {918--923},
  year    = {2017}
}

@techreport{hcup_nis_intro_2023,
  author      = {{Agency for Healthcare Research and Quality}},
  title       = {Introduction to the {HCUP} National Inpatient Sample ({NIS}), 2023},
  institution = {{Healthcare Cost and Utilization Project (HCUP)}},
  year        = {2025},
  address     = {Rockville, MD},
  url         = {https://hcup-us.ahrq.gov/db/nation/nis/NISIntroduction2023.pdf}
}

§9.3 引用指南

按 DUA 与官方《Requirements for Publishing with HCUP Data》要求:任何基于 NIS 的发表必须在正文致谢中注明"Healthcare Cost and Utilization Project (HCUP)"及具体所用数据库(NIS)、数据年份与 AHRQ 归属;建议同时引用当年度 NIS Introduction 与上方方法学报告。引用本 Wiki 条目时请同时给出 HCUP 官方文档引用,以原始官方文档为最终事实依据。

三条实操提醒:其一,致谢格式官方有固定建议模板,投稿前到 NIS Database Documentation 页下载最新版本核对;其二,DUA 要求在发表前给 HCUP 发送/登记文献信息(具体以当期 DUA 条款为准);其三,若同时使用了 HCUP 免费工具(CCSR、Trend Weights 等),致谢中应一并注明工具名称与版本——官方将这些工具视为独立产品分别跟踪引用。


§10 AI 使用声明卡

§10.1 本页面使用的 AI 模型

  • 起草模型:fast-model(大语言模型,CodeBuddy Code 平台)
  • 用途:初稿撰写、代码示例组织、表格结构化

模型选择说明:本页面为纯文本/表格/代码内容,未调用任何生成式图像、语音或多模态模型;封面图像由独立文生图模型按 §frontmatter cover_image_prompt 生成,不属于本声明的文本生成范畴。

§10.2 AI 参与范围

AI 负责初稿生成与结构化整理;全部关键数字经由 2026-09 对 AHRQ/HCUP 官方来源的实时检索核实并记录于 FACTS.md;医学背景、偏倚分析与合规声明的最终准确性由人工编辑负责。AI 未访问任何 HCUP 受控数据本体——本文所有数字均来自官方公开文档。

范围边界的三条声明:(1) AI 未编造任何统计数字——种子信息与检索结果冲突时以检索为准(两处种子纠错已记录于 FACTS.md);(2) 代码示例为教学用途骨架,未经真实数据运行验证,DUA 限制下也不得公开运行日志;(3) 对官方文档的任何转述如与原文冲突,以 HCUP 官方文档为准。

§10.3 输入来源列表

  1. Agency for Healthcare Research and Quality. Overview of the National (Nationwide) Inpatient Sample (NIS). https://hcup-us.ahrq.gov/nisoverview.jsp
  2. AHRQ HCUP. NIS Database Documentation. https://hcup-us.ahrq.gov/db/nation/nis/nisdbdocumentation.jsp
  3. AHRQ HCUP. Introduction to the HCUP National Inpatient Sample (NIS), 2016. https://hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2016.jsp
  4. AHRQ HCUP. Introduction to the HCUP National Inpatient Sample (NIS) 2012(PDF). http://www.hcup-us.ahrq.gov/db/nation/nis/NISIntroduction2012.pdf
  5. AHRQ HCUP. Introduction to the HCUP National Inpatient Sample (NIS), 2015. https://www.hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2015.jsp
  6. AHRQ HCUP. Introduction to the HCUP Nationwide Inpatient Sample (NIS), 2000. https://hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2000.jsp
  7. AHRQ HCUP. Introduction to the HCUP Nationwide Inpatient Sample (NIS), 2002(DUA 限制章节). http://www.hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2002.jsp
  8. AHRQ HCUP. Introduction to the HCUP Nationwide Inpatient Sample (NIS), 2006(州级估计限制). https://www.hcup-us.ahrq.gov/db/nation/nis/NIS_Introduction_2006.jsp
  9. AHRQ HCUP. 2005 HCUP Nationwide Inpatient Sample (NIS) Design Report. https://hcup-ts.ahrq.gov/db/nation/nis/reports/NIS_2005_Design_Report.jsp
  10. Houchens R, Ross D, Elixhauser A, Jiang J. Calculating NIS Variances for Data Years 2012 and Later(Report #2015-09). https://www.hcup-us.ahrq.gov/reports/methods/2015_09.jsp
  11. AHRQ HCUP. HCUP Using Multiple Years of Data Tutorial(2015 与 2019 版,508 无障碍版). https://hcup-us.ahrq.gov/tech_assist/trends/508/508course_2015.jsp ;https://hcup-us.ahrq.gov/tech_assist/trends/508/508course_2019.jsp
  12. AHRQ HCUP. ICD-10-CM/PCS Resources. https://hcup-us.ahrq.gov/datainnovations/icd10_resources.jsp
  13. AHRQ HCUP. NIS/KID/NEDS/NRD Application Kit(2018-10-23,含价目表与产品文件大小). https://hcup-us.ahrq.gov/db/nation/NISNEDSKIDNRDAppKit.pdf
  14. AHRQ HCUP. Nationwide Application for NIS/KID/NASS/NEDS/NRD(2021-08-04,含学生折扣与 DUA 条款). https://hcup-us.ahrq.gov/tech_assist/centdist/HCUP-Nationwide-Data-Application-Kit-2021-08-04.pdf
  15. AHRQ HCUP. Overview of the HCUP Databases(购买流程 Webinar PDF). https://hcup-us.ahrq.gov/news/HCUPOverviewWebinar.pdf
  16. AHRQ HCUP. National (Nationwide) Inpatient Sample (NIS) 展板手册. https://hcup-us.ahrq.gov/news/exhibit_booth/nis_brochure.jsp
  17. Weiss AJ, Head MA, Reid LD. Mental Health Disorders Among Delivery Inpatient Stays by Patient Race and Ethnicity, 2020. HCUP Statistical Brief #302. https://hcup-ts.ahrq.gov/reports/statbriefs/sb302-Deliveries-Mental-Health-Disorders-Race-2020.jsp
  18. AHRQ HCUP. Statistical Brief #149(NIS 抽样框说明). https://hcup-ts.ahrq.gov/reports/statbriefs/sb149.jsp
  19. NIAAA Surveillance Report #112(NIS 设计与诊断字段演变引用). https://www.niaaa.nih.gov/sites/default/files/HDS15.pdf
  20. AHRQ HCUP. NIS 2023 DX_PR_GRPS Summary Statistics(MaskedStats). https://hcup-us.ahrq.gov/db/nation/nis/tools/stats/MaskedStats_NIS_2023_DX_PR_GRPS.PDF
  21. AHRQ HCUPnet 在线查询系统(2023 费用字段注释). https://datatools.ahrq.gov/hcupnet
  22. AHRQ HCUP-US 主页(2025 州数据库发布公告等). https://hcup-us.ahrq.gov/

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、流行病学叙述) 千方病案医学编辑部 逐条对照 ICD-11 浏览器与 NLM 映射文件抽查 ✅ 已通过/已验证
§3-§4 规格与数据字典(全部规模/价格/文件数字) 千方病案医学编辑部 逐条核对 FACTS.md 检索来源 URL ✅ 已通过/已验证
§6 坑点与代码(8 个坑点、可运行性) 千方病案医学编辑部(数据工程) 代码逻辑走查 + 官方方法报告对照 ✅ 已通过/已验证
§7 DAIMS 24 项与偏倚分析 千方病案医学编辑部(数据工程) 逐项核对官方文档披露 ✅ 已通过/已验证
§9-§10 引用与合规声明 千方病案医学编辑部 引用格式与 DUA 条款复核 ✅ 已通过/已验证
FACTS.md 检索档案(种子纠错记录) 千方病案医学编辑部 逐条核对来源 URL 可访问性 ✅ 已通过/已验证

§10.5 AI 生成章节标注

以下章节由 AI 起草、人工复核后发布:§1.0-§1.5、§3、§4、§5、§6(含 8 坑点)、§8.1-§8.7。§0、§2、§7.4-§7.5、§9.3、§10 由人工主导撰写与定稿。

标注原则:凡涉及数字核实的章节,AI 起草内容仅允许使用 FACTS.md 已登记的来源数字;FACTS.md 未覆盖的表述一律在人工审核时改写或删除。这使每个章节都能定位到"AI 生成 → 来源登记 → 人工放行"的完整证据链。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

动态数据时效声明:本页所有带"截至 2026-09"标注的数字(最新数据年、参与州数、工具版本)以官方页面实时状态为准,官方更新后本页将随年度审核流程同步修订。

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • meps — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
  • nhis-nhid — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
  • cms-de-synpuf — 共享标签:卫生服务研究 / 医保理赔
  • komodo-healthcare-map — 共享标签:电子健康记录 / 医保理赔
  • marketscan — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
  • seer-medicare — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
  • premier-pinc-ai — 共享标签:电子健康记录 / 卫生服务研究 / 医保理赔
  • mdv — 共享标签:电子健康记录 / 医保理赔
  • gemini — 共享标签:电子健康记录 / 卫生服务研究
  • nhird — 共享标签:电子健康记录 / 医保理赔

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集