信息速览

PINC AI Healthcare Database — 美国全支付方医院真实世界数据 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PINC AI Healthcare Database |
| 英文全称 | PINC AI™ Healthcare Database(前称 Premier Healthcare Database,简称 PHD) |
| 别名/简称 | PHD、Premier Healthcare Database、PINC AI™ Healthcare Data、Premier 数据库 |
| 疾病分类 | 全疾病谱住院+门诊人群(ICD-11:1G4Z 脓毒症 / RA01 COVID-19 / CB4Z 心力衰竭 / 8B6Z 急性肾损伤 / 5B80 肥胖症 / 2A50.0 多发性骨髓瘤等多系统覆盖) |
| SNOMED CT | 32485007 Hospital admission (procedure) / 91302008 Sepsis (disorder) / 84114007 Heart failure / 840539006 COVID-19 / 15220000 Laboratory test (procedure) / 373873007 Pharmaceutical / biologic product(概念级示例,详见 §2.1b) |
| 数据模态 | 结构化出院账单(UB-04)、逐条药品/器械/耗材计费、微生物检验结果、院内实验室结果、生命体征、成本与费用数据 |
| AI 任务类型 | 药物警戒与安全性信号、真实世界疗效评估、住院死亡率预测、再入院预测、患者表型识别(phenotyping)、成本与资源利用预测、疾病负担与流行病学建模、监管级 RWE 生成 |
| 样本总数 | 2.6 亿+ 独立患者 / 1.35 亿+ 住院 / 10 亿+ 门诊就诊(截至 2021-09 白皮书);15 亿+ encounters(截至 2025-09 ISPOR 报道口径) |
| 数据大小 | 未公开(服务级明细按项目定制交付;联动 closed claims 约 2,400 万 covered lives,截至 2021-08) |
| 数据格式 | 项目制定制交付(关系型服务级数据;官方未公开标准交付文件格式) |
| 许可证 | Premier Inc. 专有商业许可(项目制谈判,未公开标准条款) |
| 访问级别 | 商业许可(与 PINC AI™ Applied Sciences 签署协议;支持 Datavant token 链接外部数据) |
| DUO 标签 | GRU(通用研究使用;实际使用范围以商业许可协议为准) |
| 语言 | 英文 |
| 首发日期 | 2000-01(数据起点;PINC AI™ 品牌于 2021 年启用,前称 Premier Healthcare Database) |
| 最后更新 | 持续每周更新(数据库服务状态截至 2026-09 仍处于运营状态) |
| 发布机构 | PINC AI™ Applied Sciences(PAS)— Premier Inc. 技术与服务平台 PINC AI™ 旗下研究部门(NASDAQ: PINC,总部美国北卡罗来纳州夏洛特) |
| 官方主页 | https://offers.pinc-ai.com/PINC-AI-Healthcare-Database-White-Paper-LP.html |
| 下载地址 | 无公开下载;商务联系入口 https://premierinc.com/real-world-evidence |
| 引用次数 | 1,200+ 篇基于 PHD 的同行评审论文(ISPOR Value Outcomes Spotlight 报道,截至 2025-09);截至 2021-07 累计 779 篇发表于 264 种期刊(官方白皮书口径) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 服务级数据元素丰富、派生算法齐全(APR-DRG/Elixhauser/Charlson/Cunningham),监管级应用成熟;扣分项:商业许可门槛高、无公开快照与公开数据字典、交付结构随项目定制、需自行实现划分与预处理 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、真实世界研究任务定义、金标准对照)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 数据元素字典(服务级账单/药品/微生物检验元素)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 Premier Inc.、PINC AI™ Applied Sciences、Datavant 及其关联机构无任何商业利益关联。本页面不销售 PHD 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PHD 为专有商业数据库,需与 Premier Inc. 旗下 PINC AI™ Applied Sciences 签署许可协议,项目交付范围(数据表、字段、时间窗、医院子集)随项目定制。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
PINC AI™ Healthcare Database(PHD) 是美国医疗改善联盟企业 Premier Inc.(NASDAQ: PINC)旗下研究部门 PINC AI™ Applied Sciences(PAS)运营的医院基础真实世界数据库。联盟成员医院以 UB-04 出院账单为骨架提交行政、利用与财务数据:每条记录服务级(service-level)明细——用了什么药、做了什么检验、植入了哪个厂商的器械、每一项计了多少钱——都带服务日期。截至 2021-09 官方白皮书口径,它已积累 1,164+ 家贡献医院、1.35 亿+ 次住院(约占全美住院 25%)、10 亿+ 次门诊就诊、2.6 亿+ 名独立患者;截至 2025-09 的报道口径更达 15 亿+ encounters。
它为什么重要?因为这是美国被监管机构和产业界使用最广的医院级 RWD 之一:CDC、NIH、CMS、FDA 都曾许可使用其数据(官方白皮书),基于 PHD 的同行评审论文超过 1,200 篇(截至 2025-09,ISPOR 报道)。2021 年 Peregrin(tacrolimus 肺移植适应症扩展)等监管案例所代表的"真实世界证据支持药品审批"浪潮,PHD 正是这一浪潮中最常用的美国医院数据底座之一。
你能用它做什么?如果你是药物流行病学家,可以用逐条药品计费明细做药物利用与安全性研究;如果你是卫生经济学家,可以用 CDM 计费与 RCC/MCCR 校准成本做疾病经济负担分析;如果你是 ML 研究者,可以在千万级年度住院上构建死亡率、再入院、脓毒症识别等预测模型;如果你在药企或器械公司,PHD 经 Datavant token 化后可与理赔、死亡、临床试验数据链接,支撑监管级证据链。
§1.1 技术摘要
PHD 是一个动态更新的美国医院基础、服务级、全支付方(all-payer)电子医疗数据库。数据自 2000 年 1 月起累计、每周更新,医院侧提交源自 UB-04 标准账单的行政、利用与财务数据,经 PINC AI 标准定义与专有 Data Dictionary 标准化,并在入库前与医院源数据在就诊与总额层面核对验证(白皮书)。核心数据元素包括:住院与出院诊断(ICD-9 于 2015-10-01 前过渡至 ICD-10,数量不限)、CPT 与 HCPCS 操作编码、逐条药品计费(品牌/通用名、剂量强度、给药途径、服务日、数量)、器械与耗材利用(可识别厂商/品牌级 charge code)、微生物检验结果(400+ 家医院,2009 年起累计,含标本来源与药敏)、院内实验室结果(2017 年起 365+ 家医院)、生命体征(身高、体重、血压、心率、体温),以及两种口径的成本:医院成本核算系统的固定+变动成本,与经 Medicare 成本收费比(MCCR)转换的 RCC 口径成本。患者经唯一掩码标识在同院内跨住院/门诊追踪。全部数据按 HIPAA Privacy Rule 45 CFR 164.514(b)(1) 的 Expert Determination 方法脱敏,因此常规研究可豁免 IRB 审查。交付为商业项目制:外部机构许可后可自行分析,亦可由 PAS 提供研究服务,或经 Datavant Switchboard/Privacy Hub 以 token 链接理赔、死亡与临床试验等外部数据源。
§1.2 战略价值
维度一:规模与全国代表性(美国医院侧)。PHD 每年捕获 1,300 万+ 次住院(2012 年起),约占全美住院的 25%,加上每年 1.15 亿+ 次门诊就诊,使罕见结局研究、亚组分析与多中心趋势研究具备了统计学功效。与单中心 ICU 数据库(如 MIMIC 系列)相比,PHD 的价值在于"全国医院网络的真实临床实践横切面":覆盖四个人口普查区、城市与农村、教学与非教学医院(2019 年 860 家特征医院中教学占 29.3%)。白皮书将其与 AHA Annual Survey 对比,显示医院规模、地域与教学状态分布相似(小医院占比略低),这为"以 PHD 推断全国住院人群"提供了可核查的代表性依据。
维度二:服务级深度与成本双口径。美国大多数理赔数据库只有"理赔行",PHD 则同时拥有:逐条药品计费(含剂量、途径、服务日——可重建住院期间用药时间线)、品牌/厂商级器械 charge code(可做器械比较研究,如关节置换假体)、微生物药敏数据(抗菌药物管理研究的稀缺资源),以及 charge 与 cost 双口径费用数据——后者是卫生经济学研究的核心竞争力,多数公开数据库不提供医院级成本。对 AI 而言,这意味着可以在同一数据底座上同时建模"临床结局"与"经济结局"。
维度三:监管级证据基础设施。PHD 是 FDA、CDC、NIH、CMS 长期使用的商业 RWD 来源(2001 年即有支持 FDA 药品安全监测的记录);2021 年 COVID-19 期间贡献了 100 万+ 确诊患者的住院/门诊证据(覆盖 896 家医院,截至 2021-02);与 Datavant 的 token 链接合作(2022-09 起)使其成为"PHD + 理赔 + 死亡 + 试验数据"证据链的枢纽。对需要生成监管级 RWE 的团队,这是 PHD 相对学术开放数据库的差异化优势。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态/深度 | 访问方式 | 差异化要点 |
|---|---|---|---|---|
| PINC AI Healthcare Database (PHD) | 1,164+ 医院;1.35 亿+ 住院;10 亿+ 门诊;2.6 亿+ 患者(截至 2021-09) | 服务级账单+药品明细+微生物+检验+成本双口径 | 商业许可(项目制) | 全国医院网络、监管级 RWE 基础设施、成本数据、Datavant 可链接 |
| MIMIC-IV(BIDMC/MIT) | 单中心;约 25.7 万成人+5 万新生儿住院 | ICU 高频时序+检验+文本+影像子集 | PhysioNet 凭证化免费申请 | ICU 粒度极深但单中心;适合深度学习建模教学与研究 |
| HCUP NIS(AHRQ) | 全美抽样;约 700 万住院/年 | 出院摘要(无服务级明细) | 学生/学术低价购买 | 国家代表性强,但无逐条药品/器械/成本数据 |
| Merative MarketScan | 数千万商业保险人 | 纵向理赔(门诊+住院+药品) | 商业许可 | 纵向跨机构追踪强,但缺临床服务细节与院内成本 |
| Premier closed claims(PHD 联动源) | 约 2,400 万 covered lives(截至 2021-08) | 商业/Medicaid/MA 理赔+处方理赔 | 随 PHD 项目联动 | 补充 PHD 院外视角(约 90 天滞后,月更) |
| Optum/Truven 等理赔库 | 亿级 lives | 理赔为主 | 商业许可 | 人口覆盖广,但院内服务级临床细节弱于 PHD |
§1.4 版本与里程碑时间轴
| 时间 | 里程碑 | 来源 |
|---|---|---|
| 1997 | Premier 与 American Healthcare Systems、SunHealth 合并,创建当时最大医疗网络,联盟决定投资建设质量数据库 | 白皮书 |
| 2000-01 | PHD 数据积累起点;此后每周更新 | 白皮书 |
| 2001 | Premier 数据库开始支持 FDA 药品安全监测 | 白皮书参考文献(Health Care Strateg Manage. 2001;19(11):10) |
| 2012 | 年住院量突破 1,300 万+/年,约占全美 25%(此后持续) | 白皮书 |
| 2016-2021 | 每年 829+ 家医院贡献数据;PAS 团队累计 130+ 篇自著论文(2000 年起) | 白皮书 |
| 2020-2021 | COVID-19 研究:截至 2021-02 捕获 896 家医院 100 万+ 确诊患者;PHD-SR(特殊发布版)将数据滞后从约 5 个月缩至 2 周 | Premier 官方博客 |
| 2021-09 | 品牌更名:Premier Healthcare Database → PINC AI™ Healthcare Database;发布官方白皮书 | 白皮书 |
| 2022-09 | 与 Datavant 合作,经 Switchboard/Privacy Hub 实现 token 化外部链接 | Datavant 新闻稿 |
| 2023-02 | 与 University Hospitals 合作:NLP 挖掘非结构化临床笔记/病理/基因组;引入 SKU 级采购数据 | UH 新闻稿 |
| 2024-02 | Datavant 合作扩展至临床试验 token 化与试验运营 | Datavant 新闻稿 |
| 2025-09 | ISPOR 报道口径:15 亿+ encounters、覆盖约 25% 全美住院与 40%+ 医院门诊;累计 1,200+ 篇论文 | ISPOR VOS |
§1.5 典型应用场景
- 药物利用与安全性( pharmacoepidemiology ):以逐条药品计费重建住院用药时间线,研究超适应症使用(如 COVID-19 期间药物重定位的院内使用模式,发表于 Open Forum Infectious Diseases)、剂量-结局关系与安全性信号。
- 真实世界疗效与监管 RWE:构建观察性队列比较治疗效果,支持药品/器械审批与标签扩展的证据包(21 世纪治愈法案后 FDA 鼓励的 RWE 路径)。
- 疾病经济负担与成本分析:以 charge master 与 RCC/MCCR 成本口径量化手术、并发症、共病的增量成本(如九类常见手术出血相关成本的数据库分析,发表于 Journal of Comparative Effectiveness Research/Dovepress)。
- 住院结局预测建模(ML):在千万级年度住院上训练死亡率、再入院、AKI/脓毒症识别模型——官方曾用检验数据算法识别 40 万+ 未确诊慢性肾病患者的真实案例(ISPOR 访谈)。
- 卫生服务与政策研究:教学状态/城乡/支付方维度下的服务模式差异、COVID-19 对医疗服务的冲击、再入院与出院去向分析(CDC MMWR 同院再入院研究)。
§2 医学背景
§2.1 ICD-11 映射表
PHD 原生编码为 ICD-9-CM(2015-10-01 前出院)与 ICD-10-CM/PCS(其后),另有 CPT 与 HCPCS。下表列出基于 PHD 的代表性研究方向所涉及的高频疾病及其 ICD-11 对照(供跨库映射与 AI 标签定义使用):
| 研究方向 | 代表疾病 | ICD-11 编码 | ICD-11 中文名 |
|---|---|---|---|
| 感染与脓毒症(PHD 微生物数据优势领域) | 脓毒症 | 1G40/1G41 | 脓毒症 / 感染性休克 |
| COVID-19 住院队列(截至 2021-02 覆盖 896 家医院 100 万+ 患者) | COVID-19 | RA01 | 2019 冠状病毒病(对应旧编码 U07.1,JAMA 编码准确性研究主题) |
| 心血管结局 | 心力衰竭 | CB41 | 慢性心力衰竭 |
| 急性器官损伤(PINC AI 官方 AKI-COVID 成本研究) | 急性肾损伤 | GB60 | 急性肾损伤 |
| 代谢手术与肥胖( powered stapler 比较研究场景) | 肥胖症 | 5B80 | 成人肥胖症 |
| 血液肿瘤(teclistamab 真世界研究,JMCP 2025) | 多发性骨髓瘤 | 2A50.0 | 浆细胞骨髓瘤(多发性骨髓瘤) |
说明:ICD-11 细分码以 WHO ICD-11 浏览器为准;脓毒症在 ICD-11 中为 1G40(未特指情形用 1G4Z),心衰细分为 CB41(慢性心力衰竭)等,AKI 为 GB60 系。跨库映射时请以出院日期选择 ICD-9-CM 或 ICD-10-CM/PCS 原生码后,再经映射工具(如 WHO 提供的 ICD-10↔ICD-11 映射表)转换。
§2.1b SNOMED CT 映射表
| 概念 | ICD-11 参考 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 住院就诊 | 1G40 等 | 32485007 | Hospital admission (procedure) |
| 脓毒症 | 1G40/1G41 | 91302008 | Sepsis (disorder) |
| 心力衰竭 | CB41 | 84114007 | Heart failure (disorder) |
| COVID-19 | RA01 | 840539006 | Disease caused by SARS-CoV-2 (disorder) |
| 实验室检验 | — | 15220000 | Laboratory test (procedure) |
| 药品/生物制品 | — | 373873007 | Pharmaceutical / biologic product (product) |
| 院内死亡 | — | 419099009 | Dead (finding)(对应出院状态 EXPIRED) |
PHD 本身不发布官方 SNOMED CT 映射表;上表为研究者在 AI 标签定义与跨术语标准对齐时常用的概念级示例。实际项目中应以官方 Data Dictionary(随许可交付)的字段定义为准。
§2.2 疾病背景与流行病学
PHD 是全疾病谱数据库,其"医学背景"的本质是美国住院与医院门诊人群的流行病学底座。理解三点即可定位它:
- 人群 = 美国非联邦医院的 1/4 住院。PHD 每年 1,300 万+ 住院约占全美 25%(2012 年起),支付方构成(白皮书全库口径):Medicare 32.47%、管理式医疗 27.48%、Medicaid 19.18%、商业实付 8%、自费 6.85%、其他 6%。这决定了它在老年病、慢性病急性加重、肿瘤住院、手术结局研究上的天然优势。
- 感染性疾病研究的独特资产。微生物检验结果(标本、菌种、药敏,2009 年起累计)使其成为抗菌药物管理(AMS)、脓毒症诊断算法、耐药趋势研究的稀缺数据源——多数理赔库完全没有药敏数据。PAS 与 NIH 重症医学团队合作发表于 JAMA 的研究证实了 COVID-19 ICD-10 代码(U07.1)在 PHD 行政数据中的高准确性,为感染队列编码定义提供了质量背书。
- 手术与器械研究的账单级真实世界。器械 charge code 可识别厂商/品牌,使 PHD 能够做器械比较(如两种动力吻合器在腹腔镜袖状胃切除术中的真实世界比较、关节置换中氨甲环酸安全性——76.5 万+ 例髋/膝关节置换研究)。药监级器械 RWE 正是 FDA 21 世纪治愈法案框架下的重点方向。
§2.3 临床任务定义
PHD 支持的任务以回顾性队列与结局预测为主(全部基于出院后可得信息):
| 任务类型 | 定义 | 输入窗口 | 标签(示例) |
|---|---|---|---|
| 住院死亡率预测 | 以入院早期可计费/检验信息预测院内死亡 | 入院首日至预测时点 | 出院状态=Expired(SNOMED 419099009) |
| 同院再入院预测 | 出院后 30 天内返回同一医院住院 | 指数住院全量 | 同院再入院标志(MMWR 口径约 1/11 COVID 患者发生) |
| 脓毒症/感染表型识别 | ICD 编码+微生物药敏+抗菌药物计费组合定义队列 | 住院全窗口 | 脓毒症编码/阳性血培养+药敏 |
| 成本预测 | 预测住院总成本( RCC/MCCR 校准后) | 入院早期 | 住院 episode 总成本(连续变量) |
| 药物利用评价 | 适应症、剂量、时程的真实世界模式 | 住院全窗口 | 逐条药品计费时间线 |
注意:PHD 缺少出院后随访与院外死亡,因此不适合作长期生存分析的主数据源;再入院仅限"同院"口径,跨院再入院不可见。
§2.4 患者人群画像
| 维度 | 描述 | 来源 |
|---|---|---|
| 来源医院 | 1,164+ 家贡献医院/医疗系统(2021-09 白皮书);2016 年起每年 829+ 家;2019 年特征统计 860 家(南部 379 家/44.1%、中西部 225、东北 127、西部 129) | 白皮书 |
| 城乡 | 城市 70.7% / 农村 29.3%(2019) | 白皮书 |
| 教学状态 | 非教学 70.7% / 教学 29.3%(2019);另一论文口径约 69% 非教学 / 31% 教学(JMCP 2025) | 白皮书 + JMCP |
| 床位规模 | ≤99 床 31.3%、100-199 床 23%、200-299 床 15.7%、300-399 床 11.7%、400-499 床 6.5%、500+ 床 11.7%(2019) | 白皮书 |
| 年龄 | 全年龄(含新生儿至老年);成人研究为主(多篇代表性研究限定 ≥18 岁) | 白皮书+JMCP |
| 性别/种族 | 年龄、性别、种族(白/黑/其他三分类)、民族(西语裔/非西语裔) | 白皮书 |
| 支付方 | Medicare 32.47% / 管理式医疗 27.48% / Medicaid 19.18% / 商业实付 8% / 自费 6.85% / 其他 6% | 白皮书 |
| 排除 | 联邦医院(VA 等)不在联盟样本内 | Dovepress 出血成本研究 |
§2.5 临床价值
对临床与卫生决策者,PHD 的价值链条是"真实实践 → 可量化 → 可行动":联盟医院以质量改进为初心提交数据(QUEST 等合作项目即源于此),研究结论可直接回流到联盟内的实践改进。三个已被同行评审证明的价值实例:其一,CDC 基于 PHD 的 MMWR 分析发现约 1/11 的 COVID-19 住院患者在两个月内同院再入院,直接指导了出院规划与随访资源配置;其二,PAS 检验数据算法找出 40 万+ 未确诊慢性肾病患者,推动联盟内早诊早治(ISPOR 访谈);其三,JAMA Network Open 的 COVID 死亡危险因素研究为他汀/ACEI/CCB 使用与死亡风险的负关联提供了真实世界证据。对 AI 团队,PHD 的临床价值在于"模型训练所用的分布=医院真实运行分布",比 ICU 单中心数据更接近全美服务线运营场景。
§2.6 金标准对照
| 属性 | 前瞻性 RCT(金标准) | PHD 服务级真实世界数据 |
|---|---|---|
| 因果推断 | 随机化,混杂最小化 | 观察性,需倾向评分/工具变量等调整 |
| 内部效度 | 高 | 中(编码误差、适应症混杂、信息性缺失) |
| 外部效度 | 低(严格入选排除标准) | 高(全支付方、全年龄、真实处方与成本) |
| 样本量 | 数百至数千 | 亿级 encounters |
| 干预记录 | 方案化、受控 | 服务级账单(真实给药/植入,但剂量依从性弱于试验) |
| 成本数据 | 少数收集 | charge + RCC/MCCR 成本双口径,原生支持 |
| 长期随访 | 常见 | 无院外随访(需链接理赔/死亡数据补充) |
| 适用角色 | 确证疗效 | 效果(effectiveness)、安全性信号、成本、实践模式、假设生成 |
§3 数据集规格
§3.0 版本/交付形态抉择矩阵
PHD 没有公开编号的"版本"(动态周更库),选择发生在交付形态与数据源组合层面:
| 你的需求 | 推荐形态 | 规模/滞后 | 理由 |
|---|---|---|---|
| 大多数回顾性临床/经济研究 | PHD 标准提取(定制项目) | 2000 年至今;约 5 个月常规滞后(历史口径) | 服务级全元素;成熟论文生态可借鉴队列定义 |
| 快速演进的公共卫生监测(如疫情) | PHD-SR(特殊发布版) | 滞后缩至约 2 周;COVID 期含 240 万+ COVID 就诊 | 以滞后换时效,供紧急监测 |
| 院外用药/门诊随访补充 | PHD + closed claims 联动 | 约 2,400 万 covered lives;月更、约 90 天滞后 | 商业/Medicaid/MA 理赔+处方理赔补充院外视角 |
| 跨数据源完整患者旅程(死亡、肿瘤登记等) | PHD + Datavant token 链接 | 经 Switchboard/Privacy Hub 认证 | 合规 token 化,支持 license 或研究服务两种模式 |
| 试验方案设计与站点选择 | PAS 研究合作(2024 起含试验 token 化) | 项目制 | 用 PHD 估算可入组人群并识别多样化试验站点 |
| 供应商/采购视角(SKU 级) | PHD + SKU 级采购数据(UH 合作模式) | zip/州/全国层级 | 产品成本、库存与利用分析 |
§3.1 数据模态详情
| 模态 | 内容 | 覆盖 | AI 用途 |
|---|---|---|---|
| 出院账单(UB-04 衍生) | 人口学、入院/出院诊断、来源/去向、支付方、医院特征 | 全部医院、2000 年起 | 队列定义、结局标签、风险调整 |
| 诊断/操作编码 | ICD-9-CM(<2015-10-01)/ ICD-10-CM/PCS(≥2015-10-01),数量不限;CPT、HCPCS | 全部就诊 | 表型识别(phenotyping)、手术定义 |
| 逐条药品计费 | 品牌/通用名、剂量强度、给药途径、服务日、数量 | 全部医院 | 用药时间线重建、暴露定义、DDI 研究 |
| 器械/耗材计费 | 厂商/品牌级 charge code、服务日 | 全部医院 | 器械比较研究、植入物结局 |
| 微生物结果 | 标本 ID、检测名、服务日+时间、标本来源、结果、药敏、观察状态 | 400+ 家医院,2009 年起 | 感染队列、耐药趋势、AMS 研究 |
| 院内实验室结果 | 常规检验数值 | 365+ 家医院(2017 起) | AKI/脓毒症算法、时序建模 |
| 生命体征 | 身高、体重、血压、心率、体温;少数医院含呼吸功能 | 子集医院 | BMI/生理储备变量、恶化预警 |
| 成本/费用 | CDM 逐项定价(charge);医院成本核算系统成本;RCC/MCCR 成本 | 全部医院(成本口径子集) | 经济结局、成本预测、CEA |
| 派生字段 | 3M APR-DRG/APR-SOI/APR-ROM、Elixhauser、Charlson、Cunningham Bleeding Score | 出院时计算 | 风险调整与共病控制(直接可用特征) |
§3.2 按子集样本数
| 子集 | 规模 | 口径时间 |
|---|---|---|
| 贡献医院/医疗系统 | 1,164+ 家;2016 年起每年 829+ 家 | 2021-09 白皮书 |
| 住院就诊 | 1.35 亿+ 次;每年 1,300 万+(2012 起,约全美 25%) | 2021-09 白皮书 |
| 门诊就诊 | 10 亿+ 次;每年 1.15 亿+(2012 起,含急诊、门诊手术中心等) | 2021-09 白皮书 |
| 独立患者 | 2.6 亿+ | 2021-09 白皮书 |
| encounters 总量(住院+门诊合并口径) | 15 亿+;另有"10 亿+(2023-02 UH 口径)" | ISPOR 2025 / UH 2023-02 |
| 微生物结果医院 | 400+ 家(2009 年起累计) | 2021-09 白皮书 |
| 院内实验室医院 | 365+ 家(2017 年起) | 2021-09 白皮书 |
| COVID-19 确诊患者 | 100 万+(覆盖 896 家医院) | 截至 2021-02 |
| closed claims 联动 | 约 2,400 万 covered lives(2016-07 起) | 截至 2021-08 |
§3.3 数据格式
| 项目 | 格式 | 说明 |
|---|---|---|
| 交付形态 | 项目制定制提取 | 官方未公开标准交付格式;常见为关系型表集(概念结构见 §4.0) |
| 数据字典 | PINC AI 标准定义 + 专有 Data Dictionary | 随许可交付;UB-04 元素经 PINC AI 标准定义归类 |
| 字段语义 | 编码体系:ICD-9/10-CM/PCS、CPT、HCPCS、CDM charge code、AHA Annual Survey 医院属性 | 跨库映射的基础 |
| 链接数据 | closed claims(月更);Datavant token 化外部源 | 链接需额外审批 |
| 建议分析环境 | PostgreSQL/Spark 等关系型引擎 + Python/R | 服务级明细量大,建议列式或分医院分片 |
§3.4 存储大小
官方未公开数据总量。可参考的量级锚点:15 亿+ encounters(2025 报道口径)、1.35 亿+ 住院、每年 1,300 万+ 住院与 1.15 亿+ 门诊增量。对规划用途:一次多年期、限定医院数与时间窗的定制提取,工程上建议预留 500 GB - 2 TB 级存储与列式查询能力(经验规划值,非官方数字,实际以许可提取的表与字段范围为准)。
§3.5 标注方式
PHD 无人工研究标注层。其"标签"有三类来源:
- 原生结局字段:出院状态(含院内死亡 EXPIRED)、出院去向(家/SNF/康复机构等 UB-04 状态)、住院时长、同院再入院(可由患者掩码标识+住院记录推导)。
- 编码派生标签:ICD/CPT/HCPCS 组合定义的疾病与操作(如脓毒症、AKI、肥胖手术),以及官方预计算的 3M APR-DRG(含 SOI/ROM)、Elixhauser、Charlson、Cunningham Bleeding Score。
- 计费行为派生:药品/器械/检验 charge 行构成的暴露与过程标签(如"首剂抗菌药物服务日")。
§3.6 标注者资质与一致性
标签的原始生产者是医院编码与账单团队(编码员按 ICD/CPT 规范编码),而非研究标注员。质量证据来自间接研究:PAS+NIH 的 JAMA 研究验证了 COVID-19 U07.1 编码在 PHD 中的高准确性;多篇综述指出跨机构编码差异是行政数据库的系统性风险(见 §7.1)。无公开的标注者间一致性(κ)指标——行政数据库场景下该指标不适用。
§3.7 采集周期
| 数据流 | 更新频率 | 滞后 |
|---|---|---|
| PHD 主库 | 每周更新(2000-01 起累计) | 常规约 5 个月(历史口径);PHD-SR 约 2 周 |
| COVID-19 专题 | 每两周发布病例数与患者特征更新 | 短(2020-2021 疫情期) |
| closed claims | 月更 | 约 90 天 |
| 微生物结果 | 累计自 2009 年起 | 随主库 |
| 院内检验 | 2017 年起 | 随主库 |
§3.8 地域覆盖
覆盖美国人口普查四大区(2019 年 860 家特征医院分布):南部 379 家(44.1%)、中西部 225 家(26.2%)、东北 127 家(14.8%)、西部 129 家(15.0%);城市医院 70.7%。与 AHA 2019 年全美医院对比显示分布相似、但 PHD 中小医院(≤99 床)占比明显更低(31.3% vs AHA 51.1%)。联邦医院(含 VA)不在样本内。使用提示:南部权重显著高于其人口占比,外推全国率时需权重校正或敏感性分析(见坑点 1)。
§3.9 采集设施规格
PHD 为行政账单数据库,无"采集设备"概念;等价的设施描述维度为医院属性:床位规模(6 档)、城乡(美国人口普查定义)、教学状态(AMA 医学院附属或 LCME 认可附属协议、且需在至少 4 个活跃住院医师项目中实质性参与),医院统计数据经自报与 AHA Annual Survey Database™ 组合补全。设施级特征以字段形式随每条 encounter 交付,是风险调整与分层分析的直接输入。
§3.10 深度溯源链
医院 HIS/账单系统(UB-04 标准账单)
│ 医院/医疗系统按月提交行政+利用+财务数据
▼
PINC AI 标准定义 + 专有 Data Dictionary(元素归类与清洗规则)
│ 入库前校验:与医院源数据在就诊层与总额层核对(限方差内)
▼
PHD 主库(每周增量,2000-01 起;服务级,all-payer)
│
├─ 成本校准链:医院成本核算系统(固定+变动成本)
│ 或 charge × MCCR(RCC 口径)→ 双口径成本
├─ 派生算法链:3M APR-DRG/SOI/ROM、Elixhauser、Charlson、Cunningham
├─ 脱敏链:HIPAA Expert Determination(45 CFR 164.514(b)(1))→ 掩码患者 ID
└─ 链接链:closed claims(月更)|Datavant Switchboard token(claims/死亡/试验)
溯源要点:任何分析都应记录(1)提取快照日期(周更库的"版本"即快照日)、(2)医院子集范围(微生物/检验数据医院集合不同)、(3)成本口径(charge vs 核算成本 vs MCCR)——这三者决定了结论的可复现边界。
§4 数据结构
§4.0 概念目录树
PHD 交付结构随项目定制,官方未公开标准文件目录。以下为按白皮书数据元素整理的概念层级结构(字段名为示意性概念名,实际交付字段名以许可方提供的官方 Data Dictionary 为准):
phd_extract_YYYYMM/ # 一次项目制交付(快照日期必须记录)
├── HOSPITALS/ # 医院维度:特征、床位数、城乡、教学状态、地区
│ └── hospital attributes (AHA Annual Survey 补全)
├── PATIENTS/ # 患者维度:唯一掩码标识(仅同院内可跨就诊追踪)
│ └── patient_key (masked)
├── ENCOUNTERS/ # 就诊核心表:住院 + 医院基础门诊
│ ├── 人口学:年龄、性别、种族(白/黑/其他)、民族
│ ├── 入院信息:来源(point of origin)、类型(急诊/急诊住院/择期/创伤等)
│ ├── 编码:ICD-9/10-CM 诊断(数量不限)、ICD-9/10-PCS、CPT、HCPCS
│ ├── 支付方:Medicare/Medicaid/管理式医疗/商业/自费…
│ ├── 结局:出院状态(含死亡)、去向、住院时长
│ └── 派生:APR-DRG / APR-SOI / APR-ROM、Elixhauser、Charlson、Cunningham
├── CHARGE_LINES/ # 服务级计费明细(CDM):逐条 charge code + 定价
│ ├── 药品行:品牌/通用名、剂量强度、给药途径、服务日、数量
│ ├── 器械/耗材行:厂商/品牌级 charge code、服务日
│ ├── 检验/影像/治疗行
│ └── 成本字段:核算成本(固定+变动)/ RCC-MCCR 成本
├── MICROBIOLOGY/ # 微生物结果(400+ 家医院,2009 年起累计)
│ └── 标本 ID、检测名、服务日+时间、标本来源、结果、药敏、观察状态
├── LAB_RESULTS/ # 院内实验室结果(365+ 家医院,2017 年起)
└── VITALS/ # 生命体征:身高、体重、血压、心率、体温(子集医院)
[可选联动] CLOSED_CLAIMS/ # 约 2,400 万 covered lives 理赔+处方理赔(月更)
[可选联动] TOKEN_LINKED/ # Datavant token 化外部源(claims、死亡、试验数据)
§4.1 核心数据元素字典(DAIMS)
下表按白皮书描述的核心元素整理(8 列 DAIMS 规范)。交付字段名以官方 Data Dictionary 为准,本表用于 AI 团队理解语义与用途:
| 字段(概念名) | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失 | 取值范围 |
|---|---|---|---|---|---|---|---|
| patient_key | Text | 唯一掩码患者标识,仅同院内可跨住院/门诊追踪 | 8F3A-…-MASK |
患者级聚合、同院再入院 | 无(脱敏产物) | — | 不透明标识 |
| encounter_id | Text | 一次住院或医院基础门诊就诊 | E-2023-7712… |
分析单元主键 | 无 | — | 不透明标识 |
| adm_source / adm_type | Categorical | 来源(家/诊所/转院/SNF 等)与类型(急诊/择期/创伤等),UB-04 定义 | ELECTIVE |
入径定义、风险调整 | 机构填写差异 | Other/unknown 类别 | UB-04 枚举 |
| dx_codes | Array[Text] | ICD-9-CM(<2015-10-01)或 ICD-10-CM(≥)诊断,数量不限 | A41.9; N17.9 |
表型识别、标签 | 编码误差、机构差异 | — | ICD 码表 |
| proc_codes | Array[Text] | ICD-PCS、CPT、HCPCS 操作与处理 | 0W9G3ZZ; C9148 |
手术/干预定义 | 编码误差 | — | 对应码表 |
| pharmacy_lines | 关联表 | 逐条药品计费:品牌/通用名、强度、途径、服务日、数量 | vancomycin 1g IV day2 |
暴露时间线、剂量-反应 | 计费≈给药(时点误差) | 非计费给药不可见 | CDM 枚举 |
| device_lines | 关联表 | 器械/耗材 charge code(可含厂商/品牌) | ECHELON FLEX… |
器械比较 | 型号映射需人工校验 | 通用码难以细分 | CDM 枚举 |
| micro_results | 关联表 | 标本、菌种、药敏、服务日+时间、观察状态 | MRSA; oxacillin R |
感染队列、耐药 | 报告延迟、周转差异 | 仅 400+ 家医院 | 自由文本+码表 |
| lab_results | 关联表 | 院内检验数值结果 | SCr 2.1 mg/dL |
时序建模、AKI 算法 | 检验体系差异 | 仅 365+ 家医院 | 检验项目码表 |
| vitals | 关联表 | 身高、体重、血压、心率、体温 | BP 132/78 |
生理特征 | 测量与录入变异 | 子集医院 | 连续值 |
| cost / charge | Float | charge(CDM 定价)与成本(核算系统或 RCC-MCCR) | charge $42,113 / cost $12,982 |
经济结局、成本预测 | CDM 异质性、MCCR 校准误差 | 报销数据不可得 | ≥0 |
| discharge_status | Categorical | UB-04 出院状态:家/SNF/康复/死亡/违反医嘱离院等 | EXPIRED |
死亡标签、去向分析 | 编码误差 | Other/unknown | UB-04 枚举 |
§4.2 结局标签定义与可得性
| 结局标签 | 定义路径 | 可得性 | 已知质量证据 |
|---|---|---|---|
| 院内死亡 | 出院状态=EXPIRED | 全部医院 | UB-04 标准字段;编码准确性研究支持 COVID 场景(JAMA U07.1 研究同类方法论) |
| 30 天同院再入院 | 患者掩码 ID 同院再住院(含间隔定义自定义) | 全部医院 | CDC MMWR COVID 再入院研究即用此口径(约 1/11);跨院再入院不可见 |
| 住院时长 | 入院-出院日期差 | 全部医院 | 白皮书明确支持 LOS 与同院再入院分析 |
| 感染/脓毒症 | ICD 编码 + 微生物结果 + 抗菌药物计费组合 | 编码全量;微生物 400+ 家 | 多篇 PHD 感染研究;机构编码差异需敏感性分析 |
| 成本结局 | 核算成本或 charge×MCCR | 成本口径子集 | 白皮书:入库前与医院数据核对(visit/总额层) |
§4.3 关键统计
- 年住院 1,300 万+(2012 年起)≈ 全美 25%;年门诊 1.15 亿+(2012 年起)≈ 全美医院门诊 40%+(2025 ISPOR 口径)。
- 医院结构(2019,n=860):南部 44.1%、城市 70.7%、教学 29.3%、≤99 床 31.3%。
- 支付方:Medicare 32.47%、管理式医疗 27.48%、Medicaid 19.18%、商业 8%、自费 6.85%、其他 6%。
- 缺失率:多数元素 <1% 患者记录缺失;人口学与诊断等关键元素 <0.01%(白皮书)。
- 数据活力:每周更新、2000-01 起累计 26 年+;2020-2021 疫情期双周发布 COVID 专题更新。
§4.4 数据层级
医院(hospital)
└── 患者(patient,掩码 ID;仅院内有效)
└── 就诊(encounter:住院 admission / 门诊 visit)
├── 诊断与操作编码(N 条,数量不限)
├── 服务行(charge lines:药品/器械/检验/治疗,逐条含服务日)
│ └── 成本口径(核算成本 或 charge×MCCR)
├── 微生物结果(可选;400+ 家医院)
├── 院内检验(可选;365+ 家医院)
└── 生命体征(可选;子集医院)
层级含义对 AI 的直接影响:以 encounter 为分析单元时注意患者级聚类(同一患者多条 encounter 违反独立性假设);以患者为单元时注意"同院"边界(掩码 ID 跨院失效,患者在不同联盟医院的数据无法合并)。
§4.5 缺失值与信息性缺失
| 缺失模式 | 范围 | 是否信息性 | 处理建议 |
|---|---|---|---|
| 常规元素缺失 | 多数元素 <1%;关键元素(人口学/诊断)<0.01% | 基本随机 | 常规缺失处理即可 |
| 种族三分类 | 白/黑/其他+民族二分类 | 是——粒度不足,非缺失 | 公平性分析需声明局限(§7.5) |
| 微生物/检验数据 | 仅 400+/365+ 家医院提供 | 强信息性——医院子集非随机 | 按医院分层或做敏感性分析;勿将子集率外推全库 |
| 生命体征 | 子集医院 | 是 | 同上 |
| 报销数据 | 全库不可得 | 结构性 | 经济研究用成本/charge 口径替代 |
| 院外结局 | 全库不可得 | 结构性 | 链接 closed claims / Datavant 死亡源 |
§5 数据划分与使用建议
§5.1 官方划分
PHD 没有官方训练/验证/测试划分——它不是 ML 竞赛数据集,而是研究基础设施。所有划分均由研究者自定义。
§5.2 社区惯例与推荐划分
| 策略 | 做法 | 适用 |
|---|---|---|
| 按患者划分 | 以 patient_key 哈希分组(如 70/15/15),杜绝同一患者跨集 | 一切含患者级结局的建模(默认首选) |
| 按时间划分 | 以出院日期切分(如训练 2015-2019、验证 2020、测试 2021-2022) | 模拟前瞻部署;COVID 冲击期建议单列 |
| 按医院划分 | 训练与测试医院集合不相交 | 检验"新医院外推"(机构编码差异场景) |
| 混合(患者×时间) | 患者划分内再按时间锁定 | 最严格;大型研究推荐 |
§5.3 泄漏风险(重点)
- 患者级泄漏:同一患者的多次住院共享体质与慢病背景,按 encounter 随机划分会把"同患者"拆进训练与测试——指标虚高。解决:一切划分以 patient_key 为最小单元。
- 结局后置信息泄漏:服务级账单在出院后落库,charge 行、APR-DRG(出院时计算)、住院总成本都包含"结局发生后"的信息。预测入院早期结局的模型若使用全住院 charge 行,等于用未来预测过去。解决:以预测时点截断输入窗口(如入院首日 charge/首 24-48h 检验)。
- 标签构造泄漏:用"出院诊断"做早期预测特征(如以出院 ICD 脓毒症码为特征预测死亡),而该诊断部分依赖结局信息。解决:区分入院诊断 vs 出院诊断 vs 编码全量,仅用入院时点可得诊断。
- 成本预测的双重泄漏:总成本 = Σcharge 行(事后才完整);用 charge 明细预测总成本是恒等式泄漏。解决:以入院早期窗口成本预测 episode 总成本,或改做成本"解释"而非"预测"。
§5.4 交叉验证建议
- 大样本下 5 折患者级 CV 已足够稳定;医院级 CV 用于评估编码异质性鲁棒性。
- 时间跨度大的任务(≥5 年)至少包含一个"留出年份"测试,覆盖 ICD-10 过渡(2015-10-01)与疫情(2020+)等结构断点。
- 指标差异分析:报告总体 AUC + 按地区/教学状态/床位分层的 AUC,量化外推衰减。
§5.5 外部验证建议
- 与 MIMIC-IV(同任务、单中心 ICU)对比方向性一致性;与 NIS(全国抽样)对比率类估计的合理性。
- 药物流行病学研究推荐对照 MarketScan 等理赔库做负对照与阳性对照校验。
- 跨库映射统一用 ICD-10-CM 原生码后再转 ICD-11/SNOMED,避免二次映射误差。
§6 AI 就绪指南
§6.0 云端快速启动(如适用)
PHD 无公开云端镜像(商业许可)。可行路径:许可交付通常为私有安全环境(SFTP/安全传输+本地或 VPC 内分析),不建议将原始数据上传至任何第三方云 AI 服务——商业许可协议一般对数据驻留与去标识化转用有明确限制。推荐在许可方允许的私有环境内搭建 PostgreSQL/Spark + Python 工作区。
§6.1 快速上手
以下代码假设:你已与 Premier Inc. 签署许可、拿到一次定制交付(关系型表集)。
data_root指向交付根目录,其下表名以实际 Data Dictionary 为准;最小可用子集为encounters(就诊核心表)+charge_lines(计费明细)。
# 目录结构预期(示意——实际以交付为准):
# data_root/
# ├── encounters.csv # 就诊核心表:每行一次住院/门诊就诊
# ├── charge_lines.csv # 服务级计费明细:encounter_id 外键
# ├── micro_results.csv # 微生物结果(若项目包含;仅 400+ 家医院)
# └── hospitals.csv # 医院属性
# data_root 拼接关系:data_root / "<table>.csv"
# 最小可用子集:encounters + charge_lines 即可做用药-结局类研究
import pandas as pd
from pathlib import Path
DATA_ROOT = Path("data_root") # ← 改为你的交付根目录
# 就诊核心表:限定成人住院、明确出院状态
enc = pd.read_csv(DATA_ROOT / "encounters.csv", low_memory=False)
enc = enc[
(enc["age"] >= 18)
& (enc["encounter_type"] == "inpatient") # 概念字段名,以 Data Dictionary 为准
& enc["discharge_status"].notna()
]
print(f"住院就诊数: {len(enc):,}")
# 计费明细:重建某次住院的用药时间线
lines = pd.read_csv(DATA_ROOT / "charge_lines.csv", low_memory=False)
drug_lines = lines[lines["charge_category"] == "pharmacy"] # 概念字段名
demo = (
drug_lines[drug_lines["encounter_id"] == enc["encounter_id"].iloc[0]]
.sort_values("day_of_service")[["day_of_service", "drug_name", "strength", "route", "quantity"]]
)
print(demo.head(10))
§6.2 数据获取
| 步骤 | 内容 | 要点 |
|---|---|---|
| 1. 需求定义 | 明确研究问题、目标队列、时间窗、所需表/字段(账单/药品/微生物/检验/成本)、是否需要外部链接 | 交付范围与报价直接由范围决定 |
| 2. 商务联系 | 经 https://premierinc.com/real-world-evidence 或 PAS 商务团队(Chief Commercial Officer / Life Sciences GVP 团队)发起 | 学术、药企、器械、支付方均受理(白皮书列明的用户群) |
| 3. 协议签署 | 签署商业许可/研究服务协议;HIPAA 脱敏数据,通常无需 IRB(45 CFR 46.104(d)(4)(ii) 豁免依据),但以协议与所在机构政策为准 | 费用项目制(SGIM 目录标注 $$$$ 级) |
| 4. 交付与环境 | 定制提取交付(安全传输);在协议允许的环境内分析 | 记录快照日期;不可转售/转用 |
| 5. 可选增强 | closed claims 联动(月更);Datavant token 链接(claims/死亡/试验);PHD-SR 快速通道 | 链接需额外审批 |
| 6. 合规义务 | 引用官方白皮书与协议条款;发表前部分项目需 PAS 审阅(按协议) | PUB/MOR 类 DUO 条款是否适用以协议为准 |
§6.3 预处理全流程
# 三步核心预处理:ICD 过渡映射 → 成本口径统一 → 同院再入院标签
import numpy as np
import pandas as pd
# ── 1. ICD-9 → ICD-10 过渡统一(2015-10-01 切换)──────────────
# 跨年队列必须统一编码体系:通用做法是把 ICD-9 映射到 ICD-10(GEM),
# 或把 ICD-10 映射回 ICD-9(后向 GEM),并以出院日期判定原生体系。
CUTOFF = pd.Timestamp("2015-10-01")
enc["dc_date"] = pd.to_datetime(enc["discharge_date"])
enc["coding_system"] = np.where(enc["dc_date"] < CUTOFF, "ICD-9", "ICD-10")
# 概念示意:dx 用通用医学术语集(如 CCS/HSN/PheCode)折叠两套编码
# dx_codes 列为分号拼接 → 展开为长表
dx = (
enc[["encounter_id", "dx_codes", "coding_system"]]
.assign(dx=lambda d: d["dx_codes"].str.split(";"))
.explode("dx")
)
# dx_map: PheCode/CCS 映射表(外部资源,此处概念示意)
# dx["phecode"] = dx.apply(map_to_phecode, axis=1)
# ── 2. 成本口径统一:charge → cost ──────────────────────────
# 官方口径:cost = 医院成本核算系统成本(部分医院)
# 或 charge × Medicare Cost-to-Charge Ratio(MCCR,RCC 法)
# 关键:不要把 charge 当 cost 用(坑点 2)
if "mccr" in enc.columns: # 交付若含院级 MCCR
enc["cost_est"] = enc["total_charge"] * enc["mccr"]
else: # 否则使用交付的核算成本字段
enc["cost_est"] = enc["total_cost"]
# ── 3. 同院再入院标签(30 天)────────────────────────────────
enc = enc.sort_values(["patient_key", "dc_date"])
enc["prev_dc_same_hosp"] = enc.groupby(["patient_key", "hospital_id"])["dc_date"].shift(1)
enc["readmit30_same_hosp"] = (
(enc["adm_date"] - enc["prev_dc_same_hosp"]).dt.days.between(0, 30)
).astype(int)
# 注意:跨院再入院不可见 → 标签语义是"同院 30 天再入院",论文表述必须写明
§6.4 PyTorch Dataset(住院死亡率预测示例)
# 任务:以入院首日窗口(人口学+共病+首日药品/检验计数)预测院内死亡
# 数据假设:encounters(患者级划分后)、charge_lines、lab_results 已按 encounter_id 关联
import torch
from torch.utils.data import Dataset, DataLoader
class MortalityDataset(Dataset):
"""enc 与特征矩阵按 encounter_id 对齐;标签=discharge_status==EXPIRED。
划分已在 DataFrame 层按 patient_key 完成(70/15/15),此处仅接收划分切片。"""
def __init__(self, enc_df, feat_cols, day1_feats):
self.feat = torch.tensor(
day1_feats.loc[enc_df["encounter_id"], feat_cols].values,
dtype=torch.float32,
)
self.label = torch.tensor(
(enc_df["discharge_status"] == "EXPIRED").astype("float32").values
).unsqueeze(1)
def __len__(self):
return len(self.label)
def __getitem__(self, idx):
return self.feat[idx], self.label[idx]
# 变量说明:feat_cols 为首日窗口特征列(如首日 charge 数、首日检验数、
# Elixhauser 分项、年龄、性别编码、支付方 one-hot…)——均为入院首日可得
train_ds = MortalityDataset(enc_train, FEAT_COLS, day1_feats)
val_ds = MortalityDataset(enc_val, FEAT_COLS, day1_feats)
train_loader = DataLoader(train_ds, batch_size=2048, shuffle=True,
num_workers=4, pin_memory=True)
val_loader = DataLoader(val_ds, batch_size=4096, shuffle=False,
num_workers=4, pin_memory=True)
§6.5 坑点 8 个
⚠️ 坑点 1:把"覆盖 25% 住院"当"随机抽样的 25%"(分类:偏倚陷阱)
问题:PHD 是 Premier 联盟的便利样本(南部 44.1%、城市非营利为主、排除联邦医院),医院参与与否与联盟 membership 相关。直接把 PHD 内的率外推为全国率会引入选择偏倚。
症状:PHD 估计的全国发病率/死亡率与 NIS/AHA 口径系统性偏离;审稿人以"generalizability"为由质疑。
解决:
- 简单方法:所有"全国"表述限定为"PHD 覆盖医院内";与 AHA 特征分布对比表放进论文附录。
- 进阶方法:按床位/地区/教学状态对齐 AHA 分布做后分层加权(post-stratification),率类估计给加权与非加权双结果。
- SOTA 方法:与 NIS 重叠年份做率校准回归;以医院级协变量做逆概率加权(IPW)估计"若联盟覆盖全国"的目标参数,并做 E-value 敏感性分析。
参考:数据库方法学综述(PMC36302209);白皮书 AHA 对比章节
⚠️ 坑点 2:charges 当 costs 用(分类:标签理解)
问题:CDM charge 是医院定价表金额(每院自定),成本(cost)才是资源消耗。两者差异可达 3 倍以上且医院间 CDM 完全异质;直接用 charge 做成本结论或成本预测标签会得到荒谬的"成本"分布。
症状:不同医院的同一操作"成本"相差数倍;成本预测模型实际上学到了"哪家医院定价高"。
解决:
- 简单方法:只用交付的核算成本字段;无成本字段的医院从成本分析中剔除。
- 进阶方法:charge × 院级 MCCR(RCC 法)估算成本,分固定/变动成本建模;官方即用此校准路径并在入库前与医院数据核对。
- SOTA 方法:成本用广义线性模型(gamma/log link)+ bootstrap CI(真实研究惯例);报告 charge 与 cost 双口径敏感性分析,并声明报销(reimbursement)数据不可得。
参考:白皮书 Billing and Financial Data 章节;TKA 成本研究(gamma+bootstrap 惯例)
⚠️ 坑点 3:误以为掩码患者 ID 可跨医院追踪(分类:工程陷阱)
问题:PHD 的唯一掩码标识只在同一医院内可跨住院/门诊追踪;同一患者在联盟内两家医院的数据无法关联。把它当跨网络 ID 使用会静默丢失大量"转院/跨院就诊"。
症状:再入院率远低于文献(跨院再入院漏计);纵向"患者旅程"分析里患者凭空消失。
解决:
- 简单方法:论文与模型文档明确写"同院再入院(same-hospital readmission)"口径;CDC MMWR 的 COVID 再入院研究即为此口径。
- 进阶方法:需要跨院/院外视角时,购买 closed claims 联动或 Datavant token 链接,把院外理赔/死亡补进分析。
- SOTA 方法:以"同院再入院 + 院外理赔再入院"双口径分别建模,量化跨院漏计的上界(bound)作为敏感性分析。
参考:白皮书患者追踪描述;SGIM 数据库目录 Caveats
⚠️ 坑点 4:ICD-9→ICD-10 断点与机构间编码差异(分类:预处理陷阱)
问题:PHD 原生编码在 2015-10-01 从 ICD-9-CM 切换到 ICD-10-CM/PCS,两套体系不是一一映射;同时不同机构的编码实践(granularity、并发症上报倾向)不同。跨年队列若直接拼接编码会制造伪时间趋势。
症状:某诊断率在 2015-10 前后"断崖";跨医院比较时同一表型的发生率差异巨大。
解决:
- 简单方法:分析窗口限制在单侧(只用 ICD-10 时代);过渡点前后各留 6 个月缓冲不进分析。
- 进阶方法:用 GEM/CCS/PheCode 把两套编码折叠到同一术语体系,并加"编码体系"指示变量。
- SOTA 方法:医院级随机截距(混合效应模型)吸收编码实践差异;对目标表型做机构内时间序列中断分析(ITS)检验断点。
参考:JBJS 数据库研究方法学综述;PMC36302209
⚠️ 坑点 5:encounter 级随机划分造成患者级泄漏(分类:数据泄漏)
问题:同一患者多次住院共享慢病背景与体质;按 encounter 随机划分训练/测试集会把同患者拆进两个集合,指标虚高数个百分点。
症状:AUC 在"部署到新患者"时显著低于离线评估;重复别人论文时数字对不上。
解决:
- 简单方法:按 patient_key 哈希划分(70/15/15),一行代码杜绝泄漏。
- 进阶方法:患者×时间双维划分(先患者划分,再时间锁定),并检查划分后两组的患者零重叠断言。
- SOTA 方法:额外做医院级留出(leave-hospital-out)评估编码异质性下的迁移性;报告分层 AUC(地区/教学/床位)。
参考:本文 §5.2/§5.3;EHR 深度学习评估惯例(Rhearthstone 等 EHR 建模综述方法论)
⚠️ 坑点 6:实验室/微生物子集医院的选择偏差(分类:预处理陷阱)
问题:微生物结果仅 400+ 家医院、院内检验仅 365+ 家医院(2017 起)提供,且哪些医院提供与医院信息化水平相关——这是典型的信息性缺失(MNAR by hospital)。直接在"有检验数据的 encounter"上建模会把"信息化好的医院"的分布当成全库分布。
症状:检验特征重要性异常高;把模型迁移到无检验数据的医院时性能崩塌。
解决:
- 简单方法:分析限定在子集医院并在论文明确声明;比较子集 vs 全库的医院特征表。
- 进阶方法:缺失指示变量 + 分医院敏感性分析;按提供/不提供检验的医院分层报告主要结局。
- SOTA 方法:多重插补(MICE)或缺失机制建模(pattern-mixture);对"医院是否提供检验数据"建倾向模型做 IPW。
参考:白皮书微生物/检验章节;LLMpedia PHD 条目 limitations 汇编
⚠️ 坑点 7:以行政数据库率当临床发生率,忽略编码验证(分类:评估误用)
问题:PHD 的疾病率=编码率。编码有误差(漏编、错编、上报激励),且 ICD-10 U07.1 这类新码需要验证研究背书才能当"金标签"用。直接把编码率当临床率做结论是行政数据库研究的经典错误。
症状:不同编码定义(仅主诊断 vs 任意诊断位)的同一疾病率差数倍;外部读者质疑"真的这么多吗"。
解决:
- 简单方法:同时报告"主诊断"与"任意诊断位"两种定义的结果。
- 进阶方法:编码+计费/检验复合定义(如脓毒症=编码+抗菌药物+微生物),并引用已有验证研究(如 JAMA U07.1 准确性研究)。
3. SOTA 方法:抽样病历核对(在许可医院内做 chart review 子样本)估计 PPV/NPV,再校正全库率。
参考:Premier 博客:PHD 支撑的 COVID 研究(含 JAMA 编码准确性研究)
⚠️ 坑点 8:周更动态库的快照漂移与可复现性(分类:工程陷阱)
问题:PHD 每周更新、无公开版本号;医院事后补交/修订数据(账单重编、late charge)意味着同一"2019 年队列"在不同快照日提取结果不同。跨团队复现或论文返修时数字对不上。
症状:返修时 cohort 数与原文不一致;合作方用自己提取得到不同 AUC。
解决:
- 简单方法:在论文/代码库记录提取快照日期与交付范围(表、字段、医院集合),作为"版本"。
- 进阶方法:交付后把提取固化为只读快照(parquet/数据库 dump),所有分析引用快照而非再提取。
- SOTA 方法:CI 化的数据验收(行数/分布断言)+ 数据快照哈希登记;多人项目统一经同一提取层访问。
参考:白皮书"dynamically updated weekly"表述;本文 §3.10
§6.6 数据增强:安全与危险操作
| 操作 | 判定 | 说明 |
|---|---|---|
| 特征级噪声注入(如生命体征高斯抖动) | ✅ 安全 | 模拟测量变异,标签不变 |
| 同患者时间窗滑动采样 | ✅ 安全 | 多次住院患者可生成窗口实例,注意仍按患者划分 |
| 医院级 Mixup(特征插值) | ⚠️ 谨慎 | 可能制造临床不可能组合,需领域约束 |
| SMOTE 少数类过采样(死亡标签) | ⚠️ 谨慎 | 大样本下通常不需要;先调整损失权重 |
| 随机交换诊断码"增强" | ❌ 危险 | 编码语义强约束,交换产生非真实患者 |
| 打乱药品-服务日配对 | ❌ 危险 | 破坏用药时间线因果结构 |
| 跨医院复制 encounter 改人口学"平衡" | ❌ 危险 | 伪造数据+破坏标签分布 |
§6.7 模型推荐
| 任务 | 推荐起点 | 进阶 | 说明 |
|---|---|---|---|
| 住院死亡率/再入院 | XGBoost/LightGBM(表格特征) | Transformer 时序(检验/药品序列) | PHD 规模下 GBDT 仍是强基线 |
| 感染/脓毒症表型 | 编码+计费规则 → 逻辑回归 | 序列模型融合微生物+药敏 | 用验证过的复合定义当标签 |
| 成本预测 | 两部模型(发生概率×金额,gamma GLM) | 深度分位回归 | 报告 charge/cost 双口径 |
| 药物流行病学队列 | 精细化倾向评分(PS 匹配/加权) | 双重稳健估计(TMLE/AIPW) | 参照 RECORD-PE 等药物流行病学报告规范 |
| 医院级政策评估 | DiD/ITS | 混合效应+区域固定效应 | 注意南部权重(坑点 1) |
§6.8 硬件需求
| 场景 | 配置建议 |
|---|---|
| 单研究项目(百万级 encounter 切片) | 32-64 GB 内存工作站 + PostgreSQL/parquet;无需 GPU(GBDT/回归) |
| 全库级提取处理(千万级/年) | 128 GB+ 内存服务器或 Spark 集群;列式存储(parquet/DuckDB) |
| 深度时序模型 | 单张 24 GB GPU 起步(A100 级加速大型 Transformer);特征预计算离线完成 |
§6.9 评估指标代码
# 患者级划分下的评估:AUC + 按医院特征分层 + 校准
import numpy as np
from sklearn.metrics import roc_auc_score, brier_score_loss
def evaluate(y_true, y_prob, groups):
"""groups: pandas Series(医院地区/教学状态等分层键)"""
overall = roc_auc_score(y_true, y_prob)
calib = brier_score_loss(y_true, y_prob)
print(f"Overall AUC: {overall:.4f} | Brier: {calib:.4f}")
for g, idx in groups.groupby(groups).groups.items():
mask = np.isin(np.arange(len(y_true)), idx)
if y_true[mask].nunique() > 1:
print(f" [{g}] AUC = {roc_auc_score(y_true[mask], y_prob[mask]):.4f}")
return overall, calib
§6.10 MLOps 笔记
- 数据快照即版本:交付快照日期写入模型 registry 的 data card(对应坑点 8)。
- 漂移监控:周更库 → 监控季度级编码率漂移(ICD/charge 构成)与人群构成漂移(支付方/地区);ICD 过渡与疫情是已知断点。
- 复现包:cohort 定义脚本(SQL/pandas)+ 特征字典 + 快照哈希 + 划分种子,四位一体入库。
- 合规护栏:分析环境与数据驻留须符合许可协议;模型训练日志与特征不外传;发表遵循协议审阅条款。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择/地理偏倚 | 联盟便利样本:南部 44.1%(2019)、城市非营利为主、排除联邦医院、小医院占比低于 AHA | 高 | 后分层加权对齐 AHA;率类结论限定"联盟医院内"(坑点 1) |
| 编码偏倚 | 机构间编码实践差异;ICD-9→ICD-10(2015-10-01)过渡断点;编码误差风险 | 高 | 统一术语折叠(GEM/CCS/PheCode)+ 医院随机效应;引用编码验证研究(坑点 4/7) |
| 成本口径偏倚 | 各院 CDM 异质;charge≠cost;MCCR 校准误差;报销数据缺失 | 高 | 双口径报告(charge/cost);gamma GLM+bootstrap(坑点 2) |
| 信息性缺失 | 微生物(400+ 家)、检验(365+ 家)、生命体征为医院子集且非随机 | 中高 | 分层/缺失机制建模(坑点 6) |
| 追踪范围偏倚 | 患者掩码 ID 仅同院有效;无院外死亡与出院后随访 | 中高 | 同院口径明确化;claims/Datavant 链接补充(坑点 3) |
| 粒度偏倚 | 种族仅白/黑/其他三分类;缺肿瘤分期/组织学等登记级字段 | 中 | 公平性分析声明局限;登记库交叉验证 |
| 时间粒度偏倚 | 账单服务日粒度(药品有服务日,时点≈计费日非给药时刻);微生物含时分 | 中 | 暴露时间窗设缓冲;关键时序用微生物/检验的细粒度时间戳 |
§7.2 标注质量
- 原生标签由医院编码/账单流程产生(UB-04 标准),非研究标注;无标注者间一致性指标(不适用场景)。
- 编码准确性证据:PAS+NIH 团队发表于 JAMA 的研究证实 COVID-19 U07.1 编码在 PHD 行政数据中的准确性,支撑"编码可用于出院与成本追踪"的结论;CDC MMWR 的同院再入院分析(约 1/11)展示了再入院标签的可用口径。
- 间接质量信号:白皮书报告关键元素缺失 <0.01%;成本数据入库前与医院源数据在就诊与总额层核对。
- 风险:编码的适应症混杂(confounding by indication)与上报激励无法从数据内部排除——观察性研究必须以设计应对。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 外推全国疾病率 | 高——南部权重+小医院欠代表 | 白皮书 AHA 对比(≤99 床:31.3% vs 51.1%);PMC36302209 明确"skews towards the American South" |
| 外推农村/营利性医院 | 高——城市非营利为主 | SGIM 目录 Caveats;白皮书城乡 70.7/29.3 |
| 外推联邦医院(VA/军队) | 高——不在样本 | Dovepress 出血成本研究样本描述 |
| 跨院患者旅程 | 结构性失效——ID 不跨院 | 白皮书同院追踪描述;SGIM Caveats |
| 长期生存/肿瘤全程管理 | 高——无出院后随访、缺分期/组织学 | JAD 妇科肿瘤二次数据库综述 |
| 跨库模型迁移(→欧洲/亚洲) | 高——支付方结构、编码实践、人群不同 | 行政数据库通用局限(PMC36302209) |
| 同类任务跨库迁移(→MIMIC-IV) | 中——编码标签可迁移,服务级时序粒度不同 | 任务与标签定义可复用,特征分布不同 |
§7.4 伦理
- 数据经 HIPAA Privacy Rule 45 CFR 164.514(b)(1) Expert Determination 方法脱敏,不含个体直接标识;据此,使用 PHD 的研究通常豁免 IRB 审查(45 CFR 46.104(d)(4)(ii) / 46.101(b)(4) 依据,见已发表论文方法学章节)。
- 商业许可协议约束数据使用范围、驻留环境与再识别禁止条款;发表与署名规则随协议(部分项目需 PAS 审阅)。
- 联盟医院在"质量改进"使命下提交数据;研究目标与其原始收集目的的相容性由许可协议与 Expert Determination 判定把关。
§7.5 公平性
- 种族粒度限制:白/黑/其他三分类+民族二分类,使细致的种族/族裔健康差异研究受限(如亚裔、原住民不可分);结论应声明"三分类口径"。
- 支付方多样性是相对优势:all-payer 构成(Medicare/Medicaid/商业/自费)支持支付方维度的公平性分析——比单一商业理赔库更全面。
- 地理公平性:南部高覆盖有利于南部差异研究,但北部/西部低覆盖地区的结论不确定性更大。
- 无家可归/自费人群:自费 6.85% 的存在使其可被研究——这在 Medicare/Medicaid 专属库中不可见。
§7.6 数据漂移
| 漂移源 | 时点/形态 | 影响 | 应对 |
|---|---|---|---|
| ICD-9→ICD-10 | 2015-10-01 阶跃 | 编码定义的率断崖 | 术语折叠+断点前后分窗 |
| COVID-19 冲击 | 2020-2021 | 人群构成、服务模式、死亡率剧变 | 疫情期单列或加期指标 |
| 编码实践演化 | 渐进 | 并发症/慢病上报趋势变化 | 医院随机效应+年度固定效应 |
| 周更快照漂移 | 持续 | 事后修订使历史数字微变 | 快照固化与哈希登记(坑点 8) |
| 品牌与交付演化 | 2021 更名 PINC AI™;PHD-SR、Datavant、SKU 数据等新交付形态 | 同名不同交付范围 | 论文明确交付形态与范围 |
§7.7 DAIMS 质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式/规范化结构 | ✅ | 服务级关系型结构,encounter 中心化,白皮书元素定义清晰 |
| 2 | 唯一标识 | ⚠️ | 掩码患者 ID+就诊 ID 完备,但患者 ID 仅同院内有效(跨院失效) |
| 3 | 特殊字符处理 | ⚠️ | 编码字段规范化;自由文本字段(微生物结果)质量依赖医院,无公开清洗规范 |
| 4 | 重复行检查 | ⚠️ | 事后修订/late charge 可能产生重复计费;无公开去重规范,需自行按 charge code+服务日核查 |
| 5 | 缺失编码 | ✅ | 官方量化:多数元素 <1%、关键元素 <0.01% |
| 6 | 标签标识 | ⚠️ | 出院状态/去向等结局字段完备,但无面向 ML 的官方标签集,需自定义构造 |
| 7 | 罕见类分组 | ⚠️ | 规模支撑罕见结局研究,但无公开稀有结局分层规范;小医院子组样本不稳 |
| 8 | 偏倚评估 | ✅ | 官方 AHA 对比 + 大量同行评审 limitations 文献可供参照 |
| 9 | 数据字典 | ⚠️ | 官方 Data Dictionary 存在但仅随许可交付,未公开 |
| 10 | 信息性缺失解释 | ⚠️ | 微生物/检验医院子集为强信息性缺失;官方未提供缺失机制文档 |
| 11 | 设备/器械记录 | ✅ | 器械 charge code 可识别厂商/品牌(器械比较研究已验证) |
| 12 | 共线性检查 | ❌ | 无公开预处理脚本;APR-DRG/Elixhauser/Charlson 等派生特征间共线需自行检验 |
| 13 | 编码映射 | ✅ | ICD-9/10-CM/PCS、CPT、HCPCS 体系完备,过渡时点明确(2015-10-01) |
| 14 | 时间戳处理 | ⚠️ | 药品/器械含服务日,微生物含日+时间;给药时刻≈计费日的粒度误差需注意 |
| 15 | 划分建议 | ⚠️ | 无官方划分;本文提供患者/时间/医院三维划分策略(§5.2) |
| 16 | 泄漏讨论 | ✅ | 本文 §5.3+坑点 5 系统覆盖结局后置信息、标签构造与划分泄漏 |
| 17 | 标签分布 | ❌ | 无公开结局/标签分布统计,许可交付前无法预审 |
| 18 | 测量偏倚 | ⚠️ | 检验/生命体征覆盖与医院信息化相关;编码=测量过程本身有机构差异 |
| 19 | 外部验证建议 | ✅ | 本文 §7.8 提供与 AHA/NIS/JAMA 验证研究对照的验证矩阵 |
| 20 | 版本记录 | ⚠️ | 动态周更、无公开版本号;需以快照日期自管版本(坑点 8) |
| 21 | 预处理脚本 | ❌ | 无公开官方脚本;成本转换(MCCR)、再入院定义等需自行实现 |
| 22 | 合规要求 | ✅ | HIPAA Expert Determination(45 CFR 164.514(b)(1))明确;许可协议约束使用 |
| 23 | 多模态对齐 | ✅ | 同 encounter 内账单/药品/微生物/检验/生命体征天然以就诊键对齐 |
| 24 | 去标识化 | ✅ | Expert Determination 全库脱敏;研究常规豁免 IRB |
DAIMS 评分:15.5 / 24
评分解读:结构完备性与合规性是强项(元素定义、编码体系、多模态对齐、脱敏合规均为 ✅),扣分集中在"可复现性资产"(❌ 无公开预处理脚本/标签分布,⚠️ 字典与版本不公开)与"追踪边界"(同院 ID、子集医院信息性缺失)。这不是数据"脏",而是商业许可研究基础设施的典型形态:质量高但开放度低。
对你意味着什么:
- 立项前:把 3 个 ❌(脚本/分布/共线性)当作自建工作量预算——数据分析层需完全自建,排期时预留编码映射与 DAIMS 验收环节。
- 申请许可时:将 Data Dictionary、样本提取(sanity-check 用的小样本)与成本口径说明写入合同附件——这是把 ⚠️ 变 ✅ 的唯一机会。
- 建模中:默认患者级划分+首日窗口截断(防坑点 5/泄漏),微生物/检验子集医院单列敏感性分析(坑点 6)。
- 发表时:登记快照日期+交付范围+医院特征表,主动回应外推性质疑(坑点 1),复审时数字才对得上。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| AHA Annual Survey Database(2019) | 美国医院协会 | 医院特征分布(地区/城乡/床位/教学) | 分布对比 | PHD 小医院占比低(≤99 床 31.3% vs 51.1%),其余分布相似 | 白皮书官方对比;支撑"区域代表性"论证 |
| COVID-19 U07.1 编码验证 | PAS+NIH 重症医学部(JAMA research letter) | 诊断编码准确性 | 编码准确率(定性"高准确性") | 行政编码可靠用于出院/成本追踪 | PHD 编码质量的直接同行评审证据 |
| CDC MMWR 同院再入院研究 | CDC | COVID 住院 30/60 天同院再入院 | 约 1/11 患者再入院 | 标签口径=同院,跨院不计 | 展示 PHD 再入院标签的标准用法 |
| NIS(HCUP,AHRQ) | AHRQ | 全国住院率类估计对照 | 率差(文献级) | PHD 率需加权后才可对标全国 | 选择偏倚校正的基准参照(PMC36302209) |
| 多篇 PHD 药物/器械研究跨研究对照 | 学术/产业团队 | 治疗效应方向性(如氨甲环酸、他汀-死亡负关联) | 效应方向一致 | 与临床预期及 RCT 方向一致 | PHD 效应估计的可信度信号 |
§8 基准性能与生态
§8.1 代表性同行评审研究(PHD 无公开排行榜,本表替代)
PHD 为商业许可数据库,不存在 Kaggle/PhysioNet 式公开排行榜。下表列出经官方博客与检索确认、基于 PHD 完成的代表性研究(性能不可直接互比——队列、年代、定义各异):
| 排名 | 研究 | 场景 | 关键结果 | 完整引用 | 代码 |
|---|---|---|---|---|---|
| 1 | COVID-19 诊断编码准确性(PAS+NIH) | 编码验证 | U07.1 编码准确性高,可支撑出院/成本追踪 | Uptake and Accuracy of the Diagnosis Code for COVID-19 Among U.S. Hospitalizations. JAMA(PAS 与 NIH 重症医学部合作,2021;官方博客列举) | 无公开 |
| 2 | COVID 死亡危险因素 | 预测/病因学 | 他汀、ACEI、CCB 使用与死亡负相关;脓毒症/AKI 等与死亡正相关 | Risk Factors Associated with In-Hospital Mortality in a U.S. National Sample of Patients with COVID-19. JAMA Network Open(官方博客列举) | 无公开 |
| 3 | COVID 同院再入院 | 卫生服务 | 约 1/11 患者 2 个月内同院再入院 | Characteristics of Hospitalized COVID-19 Patients Discharged and Experiencing Same-Hospital Readmission. MMWR(CDC,官方博客列举) | 无公开 |
| 4 | 年龄×种族与 COVID 严重度 | 健康差异 | 部分少数族裔严重度更高的年龄调节证据 | Risk of Clinical Severity by Age and Race/Ethnicity Among Adults Hospitalized for COVID-19. Open Forum Infectious Diseases(官方博客列举) | 无公开 |
| 5 | 药物重定位院内使用 | 药物流行病学 | 疫情首三月重定位药物使用模式与演变 | Real-World Inpatient Use of Medications Repurposed for COVID-19 in U.S. Hospitals. Open Forum Infectious Diseases(官方博客列举) | 无公开 |
| 6 | teclistamab 真实世界 step-up 给药 | 肿瘤 RWE | 多发性骨髓瘤早期起始者的真实给药与 CRS 处理画像 | Real-world patient profile and step-up dosing process of early initiators of teclistamab… J Manag Care Spec Pharm. 2025;31(8):772. DOI: 10.18553/jmcp.2025.31.8.772 | 无公开 |
| 7 | 九类手术出血经济负担 | 卫生经济 | Elixhauser 指数递增与出血相关增量成本 | Increasing Incremental Burden of Surgical Bleeding… A Retrospective Database Analysis. Dovepress(Journal of Comparative Effectiveness Research 系) | 无公开 |
| 8 | 动力吻合器比较 | 器械 RWE | 腹腔镜袖状胃切除中两种动力吻合器结局比较 | Comparative Effectiveness Assessment of Two Powered Surgical Stapling Technologies. Dovepress(MDER) | 无公开 |
| 9 | 数据库方法学综述 | 方法学 | PHD 定位、规模与局限的系统评述("偏向美国南部"等) | Development and implementation of databases to track patient and safety outcomes. 2022. PMID 36302209 | 无公开 |
数值不可直接比较的原因:各研究的编码定义、时间窗、医院子集、结局窗口与风险调整策略均不同;且 PHD 为动态库,不同提取快照的结果本身不可复现比对。
§8.2 SOTA 总结与选型建议
- 若目标是发表药物流行病学/卫生经济研究:SOTA = 设计学(倾向评分/双重稳健)而非模型学;PHD 的竞争力来自规模+成本+药品明细组合。
- 若目标是ML 建模研究:GBDT 首日窗口基线 → 检验/药品序列深度模型;评估必须患者级划分+分层 AUC(§5)。
- 若目标是监管级 RWE:遵循 FDA RWE 框架(21 世纪治愈法案后指南),使用验证过的编码定义+敏感性分析包,必要时 Datavant 链接死亡/理赔补证据链。
- 若目标是教学/方法学研究:无公开快照使 PHD 不适合开放方法学基准;教学场景建议改用 MIMIC-IV/eICU 等开放库。
§8.3 评测协议建议
- 预注册 cohort 定义(编码+计费复合定义)与统计计划;2. 冻结提取快照(日期+范围+哈希);3. 患者级 70/15/15 划分(或时间留出);4. 主指标+分层指标(地区/教学/床位);5. 敏感性分析三件套(编码定义/成本口径/子集医院);6. 按 RECORD-PE 报告。
§8.4 相关数据集
| 数据集 | 关系 | 何时叠加使用 |
|---|---|---|
| MIMIC-IV(PhysioNet) | 单中心 ICU 深粒度开放库 | 方法开发与教学;PHD 做全国规模验证 |
| HCUP NIS/SID/NRD(AHRQ) | 全国抽样出院摘要 | 全国率对照与再入院(NRD 跨院口径)验证 |
| Merative MarketScan | 商业理赔纵向库 | 院外用药/随访补充;跨库效应方向校验 |
| Premier closed claims | PHD 原生联动理赔源(约 2,400 万 lives) | 院外处方/随访衔接 |
| Datavant token 化生态 | 链接基础设施 | 死亡、肿瘤登记、试验数据对接 |
| All of Us | 前瞻队列+可穿戴 | 患者报告与院外健康行为维度补充 |
| Vizient/Cerner 等院内库 | 同类商业院内数据 | 跨供应商稳健性检查 |
§8.5 关键论文 Top 9
- PINC AI Applied Sciences. PINC AI Healthcare Data White Paper: Data that informs and performs. Premier Inc., 2021-09-14. — 数据元素、覆盖、成本口径、脱敏与许可的官方权威描述(本页第一来源)。
- Sherman RE, Anderson SA, Dal Pan GJ, et al. Real-world evidence — What is it and what can it tell us? N Engl J Med. 2016;375(23):2293-2297. — RWE 监管框架奠基(白皮书引证 #4),PHD 监管应用的方法学背景。
- Elixhauser A, Steiner C, Harris DR, Coffey RM. Comorbidity measures for use with administrative data. Med Care. 1998;36(1):8-27. — PHD 内置 Elixhauser 共病指数的原初文献。
- Quan H, Sundararajan V, Halfon P, et al. Coding algorithms for defining comorbidities in ICD-9-CM and ICD-10 administrative databases. Med Care. 2005;43(11):1130-1139. — ICD-9/10 双体系共病编码算法(应对坑点 4 的直接工具)。
- Cunningham A, Stein CM, Chung CP, et al. An automated database case definition for serious bleeding related to oral anticoagulant use. Pharmacoepidemiol Drug Saf. 2011;20(6):560-566. — PHD 内置 Cunningham Bleeding Score 的出处(编码+计费复合定义范例)。
- Uptake and Accuracy of the Diagnosis Code for COVID-19 Among U.S. Hospitalizations. JAMA. 2021(PAS+NIH). — PHD 编码准确性的直接验证(官方博客列举)。
- Real-world patient profile and step-up dosing process of early initiators of teclistamab for multiple myeloma in US hospitals. J Manag Care Spec Pharm. 2025;31(8):772. DOI: 10.18553/jmcp.2025.31.8.772. — 2025 年最新 PHD 肿瘤 RWE 范例(含 vial 级给药验证算法)。
- Development and implementation of databases to track patient and safety outcomes. 2022. PMID: 36302209. — 将 PHD 与 NRD/NIS 对比评述的独立方法学视角。
- Database and Registry Research in Orthopaedic Surgery. J Bone Joint Surg Am. 2014. DOI: 10.2106/JBJS.N.01260. — 早期独立评述 PHD 优势(器械 charge code、药品与成本信息)与局限的文献。
§8.6 社区活跃度
- 无公开 GitHub/论坛生态(商业许可);技术支持走 PAS 研究团队与许可协议内服务。
- 学术活跃度以论文产出衡量:截至 2021-07 累计 779 篇/264 种期刊(PAS 自著 136 篇+外部 643 篇);截至 2025-09 报道 1,200+ 篇。用户群含 FDA/CDC/NIH/CMS 与全部头部药企器械商(白皮书/ISPOR)。
- 学界入口:SGIM 数据库目录收录条目(面向内科学术用户);ISPOR 等 HEOR 会议常见 PHD 研究。
§8.7 生态快照
§9 相关资源与引用
§9.1 官方资源
- 官方白皮书(PDF,2021-09-14):https://offers.premierinc.com/rs/381-NBB-525/images/Premier-HealthcareDatabase-Whitepaper-Final.pdf
- 白皮书获取页:https://offers.pinc-ai.com/PINC-AI-Healthcare-Database-White-Paper-LP.html
- Real-World Evidence(商务入口):https://premierinc.com/real-world-evidence
- Premier Newsroom:https://premierinc.com/newsroom
- COVID-19 研究汇总博客:https://premierinc.com/newsroom/blog/eight-ways-the-premier-healthcare-database-has-fueled-leading-covid-19-research
§9.2 学术与第三方资源
- ISPOR Value Outcomes Spotlight(2025):RWE in HEOR 访谈(含 PAS 研究负责人 Ning Rosenthal 观点与 15 亿 encounters 口径)
- JMCP 2025 teclistamab 研究:https://www.jmcp.org/doi/10.18553/jmcp.2025.31.8.772
- 数据库方法学综述(2022):https://pmc.ncbi.nlm.nih.gov/articles/pmid/36302209/
- SGIM 数据库目录条目:https://www.sgim.org/resource/premier-healthcare-database-phd/
- Datavant 新闻稿(2024-02-13):https://www.datavant.com/press-release/premier-incs-pinc-ai-applied-sciences-datavant-collaborate-enable-next-generation-clinical-trials
- University Hospitals 新闻稿(2023-02):https://news.uhhospitals.org/news-releases/articles/2023/02/uh-and-premier-incs-pinc-ai-applied-sciences-collaborate
§9.3 BibTeX 引用块
@techreport{pinc_ai_phd_2021,
title = {PINC AI Healthcare Data White Paper: Data that informs and performs},
author = {{PINC AI Applied Sciences}},
institution = {Premier Inc.},
year = {2021},
month = {9},
url = {https://offers.premierinc.com/rs/381-NBB-525/images/Premier-HealthcareDatabase-Whitepaper-Final.pdf}
}
@article{sherman2016rwe,
title = {Real-World Evidence --- What Is It and What Can It Tell Us?},
author = {Sherman, Rachel E and Anderson, Scott A and Dal Pan, Gerald J and others},
journal = {New England Journal of Medicine},
volume = {375},
number = {23},
pages = {2293--2297},
year = {2016}
}
@article{jmcp2025teclistamab,
title = {Real-world patient profile and step-up dosing process of early initiators of teclistamab for multiple myeloma in US hospitals: An analysis using the Premier Healthcare Database},
journal = {Journal of Managed Care \& Specialty Pharmacy},
volume = {31},
number = {8},
pages = {772},
year = {2025},
doi = {10.18553/jmcp.2025.31.8.772}
}
@misc{ispor2025rwe,
title = {Setting a New Pace: Real-World Evidence is Finding Its Footing in HEOR},
howpublished = {ISPOR Value Outcomes Spotlight},
year = {2025},
url = {https://www.ispor.org/publications/journals/value-outcomes-spotlight/vos-archives/issue/view/real-world-evidence-in-healthcare-decisions/setting-a-new-pace--real-world-evidence-is-finding-its-footing-in-heor}
}
@article{jbjs2014databases,
title = {Database and Registry Research in Orthopaedic Surgery},
journal = {Journal of Bone and Joint Surgery},
year = {2014},
doi = {10.2106/JBJS.N.01260}
}
§9.4 引用指南
- 研究引用:首选白皮书(techreport 条目)+ 具体研究的原始论文;PHD 无 DOI,勿为其编造 DOI/版本号。
- 口径标注:所有规模数字带口径与日期(“1,164+ 家医院,2021-09 白皮书”;“15 亿+ encounters,2025-09 ISPOR 报道”)。
- 数据本身:论文数据来源声明写法惯例:“data from the PINC AI Healthcare Database (Premier Inc.)”,并注明提取快照日期与许可路径。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型列表
| 用途 | 模型 | 使用方 |
|---|---|---|
| 资料检索与事实核验 | WebSearch 联网检索 | 千方病案医学编辑部 |
| 正文起草与结构化 | 大语言模型(CodeBuddy Code agent) | 千方病案医学编辑部 |
§10.2 AI 参与范围
AI 参与资料检索、结构组织、初稿撰写与格式自检;全部事实性内容经编辑对官方白皮书与同行评审文献逐条核对;临床与统计判断由人工审核者负责。
§10.3 输入来源列表(完整引用)
- PINC AI Applied Sciences. PINC AI Healthcare Data White Paper: Data that informs and performs. Premier Inc., 2021-09-14. https://offers.premierinc.com/rs/381-NBB-525/images/Premier-HealthcareDatabase-Whitepaper-Final.pdf
- Premier Inc. Eight Ways the Premier Healthcare Database Has Fueled Leading COVID-19 Research. Premier Newsroom Blog. https://premierinc.com/newsroom/blog/eight-ways-the-premier-healthcare-database-has-fueled-leading-covid-19-research
- ISPOR Value Outcomes Spotlight (2025). Setting a New Pace: Real-World Evidence is Finding Its Footing in HEOR. https://www.ispor.org/publications/journals/value-outcomes-spotlight/vos-archives/issue/view/real-world-evidence-in-healthcare-decisions/setting-a-new-pace--real-world-evidence-is-finding-its-footing-in-heor
- J Manag Care Spec Pharm. 2025;31(8):772. DOI: 10.18553/jmcp.2025.31.8.772(teclistamab 真实世界研究)
- Comparative Effectiveness Assessment of Two Powered Surgical Stapling Technologies. Dovepress (MDER). https://www.dovepress.com/comparative-effectiveness-assessment-of-two-powered-surgical-stapling--peer-reviewed-fulltext-article-MDER
- Increasing Incremental Burden of Surgical Bleeding Associated with Multiple Comorbidities as Measured by the Elixhauser Comorbidity Index. Dovepress. https://www.dovepress.com/increasing-incremental-burden-of-surgical-bleeding-associated-with-mul-peer-reviewed-fulltext-article-MDER
- University Hospitals & Premier Inc. PAS Collaboration Press Release. 2023-02. https://news.uhhospitals.org/news-releases/articles/2023/02/uh-and-premier-incs-pinc-ai-applied-sciences-collaborate
- Datavant Press Release. 2024-02-13. https://www.datavant.com/press-release/premier-incs-pinc-ai-applied-sciences-datavant-collaborate-enable-next-generation-clinical-trials
- Healthcare Tech Outlook APAC. Datavant And PINC AI Applied Sciences Division Together…. https://www.healthcaretechoutlookapac.com/news/datavant-and-pinc-ai-applied-sciences-division-together-to-provide-meaningful-insights-to-improve-care-quality--nid-3222.html
- Development and implementation of databases to track patient and safety outcomes. 2022. PMID: 36302209. https://pmc.ncbi.nlm.nih.gov/articles/pmid/36302209/
- Secondary databases in gynecologic cancer research. Journal of Affective Disorders (2024). https://www.jad-journal.com/science/article/pii/S1048891X24035849
- Database and Registry Research in Orthopaedic Surgery. J Bone Joint Surg Am. 2014. DOI: 10.2106/JBJS.N.01260
- Society of General Internal Medicine. Premier Healthcare Database (PHD) Resource Page. https://www.sgim.org/resource/premier-healthcare-database-phd/
- Premier Inc. Newsroom — Publications. https://premierinc.com/newsroom?categories=publications&selectedTab=all
- Sherman RE, et al. Real-World Evidence — What Is It and What Can It Tell Us? N Engl J Med. 2016;375(23):2293-2297(白皮书参考文献转引)
- Premier databases to support FDA surveillance related to drug safety. Health Care Strateg Manage. 2001;19(11):10(白皮书参考文献转引)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 对照白皮书/ISPOR/官方博客逐条核对 | ✅ 已通过 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED 对照 WHO 术语浏览器抽查 | ✅ 已通过 |
| §3-§4 数据规格与数据结构 | 千方病案医学编辑部 | 对照白皮书全文(PDF 提取)逐节核对 | ✅ 已通过 |
| §5-§6 划分/代码/坑点 | 千方病案医学编辑部 | 代码静态走查+坑点与文献一一对应核验 | ✅ 已通过 |
| §7-§8 质量/局限/研究表 | 千方病案医学编辑部 | 对照同行评审 limitations 与官方对比表 | ✅ 已通过 |
| §9-§10 引用与声明卡 | 千方病案医学编辑部 | 引用逐条回链核验 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页面全部章节由 AI 辅助起草(见 §10.1),经人工逐条事实核验与交叉审核后发布;三段免责声明(§0)为人工固定文本。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
§C 结构化数据(JSON-LD)
---
## 相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- [marketscan](https://www.qianfanghub.com/ai-ready-dataset/marketscan/356) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔 / 真实世界数据 / 药物安全
- [snds](https://www.qianfanghub.com/ai-ready-dataset/snds/306) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 医保理赔 / 真实世界数据 / 药物安全
- [nhis-nhid](https://www.qianfanghub.com/ai-ready-dataset/nhis-nhid/286) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔 / 药物安全
- [optum-clinformatics](https://www.qianfanghub.com/ai-ready-dataset/optum-clinformatics/366) — 共享标签:公共卫生与流行病学 / 卫生服务研究 / 医保理赔 / 真实世界数据 / 药物安全
- [seer-medicare](https://www.qianfanghub.com/ai-ready-dataset/seer-medicare/368) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔 / 真实世界数据
- [openfda](https://www.qianfanghub.com/ai-ready-dataset/openfda/420) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 真实世界数据 / 药物安全
- [GEMINI](https://www.qianfanghub.com/ai-ready-dataset/gemini/8) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 真实世界数据
- [meps](https://www.qianfanghub.com/ai-ready-dataset/meps/365) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 医保理赔
- [cms-medicare-lds](https://www.qianfanghub.com/ai-ready-dataset/cms-medicare-lds/421) — 共享标签:公共卫生与流行病学 / 卫生服务研究 / 医保理赔 / 真实世界数据
- [nhs-hes](https://www.qianfanghub.com/ai-ready-dataset/nhs-hes/474) — 共享标签:公共卫生与流行病学 / 电子健康记录 / 卫生服务研究 / 真实世界数据
> 导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
