MIMIC-IV-ED — 急诊科临床数据库 AI-Ready Wikipedia | 千方病案医数集

全球最大公开急诊科 EHR 数据库 · 42.5 万就诊 · MIMIC-IV 官方急诊模块

来源 MIT 计算生理学实验室 & 贝斯以色列女执事医疗中心 url: https://physionet.org/content/mimic-iv-ed/发布时间: 2026-09-06最后更新: 2026-09-06 阅读 9

信息速览

数据集名称MIMIC-IV-ED — 急诊科临床数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型约 0.5GB CSV,42.5 万次急诊就诊,2011-2019 年数据,星型 6 表结构,需 CITI 培训,Demo 免认证
规模21 万名患者
接入方式MIT 计算生理学实验室 & 贝斯以色列女执事医疗中心 url: https://physionet.org/content/mimic-iv-ed/
AI 就绪度

数据集封面

MIMIC-IV-ED — 急诊科临床数据库 AI-Ready Wikipedia


INFOBOX

数据集名称 MIMIC-IV-ED
英文全称 MIMIC-IV Emergency Department Module
别名/简称 MIMIC-IV-ED、MIMIC-ED、MIMIC-IV 急诊模块
疾病分类 急诊全疾病谱(ICD-11:1G40–1G4Z 脓毒症 / CA40–CA4Z 肺炎 / BA41 急性心肌梗死 / GB60 急性肾衰竭 / 第 21 章 症状与体征 / 第 22 章 损伤与中毒等)
SNOMED CT 4525004 Emergency department patient visit / 22539008 Triage / 91302008 Sepsis / 233604007 Pneumonia(详见 §2.2)
数据模态 结构化 EHR(分诊/生命体征/用药/诊断/处置)、短文本(主诉)
AI 任务类型 住院预测、危重结局预警(死亡/ICU 转入)、72h 急诊复诊预测、ESI 分诊级别预测、急诊停留时长预测、脓毒症早期识别、主诉 NLP
样本总数 425,087 次急诊就诊 / 约 21 万名患者 / 6 张关系表约 789 万行
数据大小 ~0.5 GB(CSV 压缩包)/ 解压后约 2 GB
数据格式 CSV(gzip)/ PostgreSQL / Google BigQuery
许可证 PhysioNet Credentialed Health Data License 1.5.0
访问级别 申请审核(注册 PhysioNet + 完成 CITI 培训 + 签署 DUA);100 患者 Demo 免认证
DUO 标签 HMB, NPUNCU, PUB
语言 英文
首发日期 2021-06-03(v1.0)
最后更新 2023-01-05(v2.2,当前版本)
发布机构 MIT 计算生理学实验室(LCP) & 贝斯以色列女执事医疗中心(BIDMC)
官方主页 https://physionet.org/content/mimic-iv-ed/
下载地址 https://physionet.org/content/mimic-iv-ed/2.2/
DOI 10.13026/5ntk-km72(v2.2)/ 10.13026/77z6-9w59(v1.0)/ 10.1038/s41597-022-01899-x(MIMIC-IV 主论文)
引用次数 数据集 DOI 29 次 + MIMIC-IV 主论文 3,186 次(OpenAlex,截至 2026-08)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 星型 6 表极简、Demo 免认证、Xie 社区基准成熟;扣分项:无官方划分、无年龄列(须链主库)、用药双表口径复杂、无官方派生概念层
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ESI 分诊体系、ICD-9/10 与 ICD-11/SNOMED CT 映射、急诊临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(星型模式、三键链接体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 MIT LCP、BIDMC、PhysioNet 无任何商业利益关联。本页面不销售 MIMIC-IV-ED 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 MIT、BIDMC 或 PhysioNet 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MIMIC-IV-ED 要求用户完成 CITI Program 的 “Data or Specimens Only Research” 培训并通过 PhysioNet 凭证化申请、签署数据使用协议(DUA)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

MIMIC-IV-ED 是 MIT 计算生理学实验室与波士顿贝斯以色列女执事医疗中心(BIDMC)发布的急诊科公开数据库,也是 MIMIC-IV 生态的官方急诊模块。它包含 2011-2019 年间 425,087 次急诊就诊、约 21 万名患者的脱敏数据——从到院方式、ESI 分诊、生命体征、用药到 ICD-9/10 出院诊断,一次急诊的完整链路都在里面,一共只有 6 张表。

它的不可替代性在于两点:第一,这是全球规模最大、且唯一能与 ICU/住院/影像数据无缝联动的公开急诊数据库——通过 subject_id / hadm_id / stay_id 三个键,你可以把一次急诊直接接到 MIMIC-IV 的住院、ICU、检验、胸片和心电图上;第二,它足够"轻",0.5 GB 下载、星型结构、笔记本就能跑,是进入医疗 AI 的最佳入口之一。

你可以用它来:在分诊时点预测患者是否需要住院或会转危重(Xie 基准三任务)、训练 ESI 分诊辅助模型、研究急诊拥挤与流程瓶颈、或者把它当作 ICU 研究的"前哨站"——用急诊数据预测谁会在 12 小时内进 ICU。

§1.1 摘要

MIMIC-IV-ED 从 BIDMC 急诊信息系统以 XML 抽取、转换为非规范化关系数据库发布,全部数据经 HIPAA Safe Harbor 脱敏,日期按患者偏移至 2100-2200 年。数据库采用教科书式的星型模式:中心表 edstays(425,087 行,一次就诊一行,含入/出急诊时间、到院方式、离院去向)通过 stay_id 辐射五张数据表——triage(分诊生命体征 + ESI 级别 + 主诉,425,087 行)、vitalsign(就诊期间每 1-4 小时生命体征,1,564,610 行)、medrecon(到院前居家用药核对,2,987,342 行)、pyxis(自动发药柜配药记录,1,586,053 行)、diagnosis(急诊计费诊断,899,050 行,ICD-9/10 混合)。约 37% 的就诊以住院收场(disposition = ADMITTED),这部分就诊带有 hadm_id,可直接对接 MIMIC-IV 主库的检验、处方、ICU 与结局数据。v2.2(2023-01-05)为当前版本,官方另提供 100 名患者的免认证 Demo。

§1.2 战略价值分析

填补空白维度:急诊是全球医疗体系压力最大的入口——美国每年约 1.3 亿次急诊就诊,分诊错误与急诊拥挤直接关联死亡率。然而在 MIMIC-IV-ED 之前,公开急诊数据几乎为零:MIMIC-III 只有急诊挂号时间字段,eICU 不含急诊,各医院的急诊 EHR 全部锁在院内。MIMIC-IV-ED 是第一个大规模、可自由申请、覆盖"分诊 → 监测 → 用药 → 诊断 → 去向"完整急诊链路的公开数据库,直接催生了 Xie et al. 2022 的急诊预测基准,结束了急诊 AI"无公共标尺"的历史。

生态枢纽维度:MIMIC-IV-ED 的最大杠杆不在自身,而在它是 MIMIC 模块化宇宙的"前门"。急诊是 37% 患者进入住院、约 6% 进入危重路径的入口——把 ED 模块与 hosp/icu/CXR/ECG 模块链接后,"急诊分诊时的 10 个变量 → 住院 7 天后的结局"这类纵向研究第一次可以在公开数据上闭环。82,907 名 ED 患者在就诊期间有至少一次心电图(MIMIC-IV-ECG),MIMIC-CXR 患者全部是 ED 患者的子集——多模态急诊研究的底座已经搭好。

方法学价值维度:与 ICU 数据相比,急诊数据更"脏"也更真实——自由文本主诉、自由文本疼痛评分、华氏/摄氏混录的体温、患者自报的用药清单、机器日志式的 Pyxis 记录。这种多样性使 MIMIC-IV-ED 成为训练"真实世界数据工程能力"的绝佳样本:Xie 基准证明简单模型(MLP/GBDT)即可显著超越 MEWS/NEWS 等临床评分,而 Med2Vec/LSTM 等复杂模型反而无增益——这是低维表格数据建模的经典教案。

§1.3 横向对比

数据集 急诊就诊 患者数 模态 时间跨度 核心差异化
MIMIC-IV-ED 425,087 约 21 万 结构化 EHR + 主诉文本 2011-2019 唯一可无缝联动住院/ICU/CXR/ECG 的公开急诊库;星型 6 表极简
MC-MED(Stanford) 约 11.8 万就诊 约 7.4 万 结构化 + 波形 + 文本 2020-2022 含连续生理波形与临床笔记,多模态急诊新标杆
MIMIC-IV(主库) 364,627 全院 EHR + 文本 + CXR + ECG 2008-2022 ED 模块的"下游",含检验/处方/ICU/结局
MIMIC-III 无独立模块 46,520 ICU EHR + 文本 2001-2012 仅有 EDREGTIME/EDOUTTIME 两个急诊时间字段
eICU-CRD 200,859 ICU EHR 2014-2015 多中心 ICU,无急诊环节

MIMIC-IV-ED 的独特定位:规模上它是公开急诊 EHR 的最大单中心库;链接上它是唯一能与下游住院/ICU/影像/心电闭环的急诊库;门槛上它 0.5 GB 的体量与星型结构是 MIMIC 家族中最易上手的模块。若需要波形级生理监测,请关注 Stanford 的 MC-MED(Sci Data 2025)。

§1.4 版本演进时间轴

时间 事件
2021-06-03 MIMIC-IV-ED v1.0 首发(448,972 次就诊,6 张表,DOI: 10.13026/77z6-9w59)
2022-05 v2.0:edstays 新增 gender/race/arrival_transport/disposition 四列;修复 outtime bug(hadm_id 为 NULL 的就诊此前表观停留仅数分钟);triage.pain 改为自由文本
2022-10-27 Xie et al. 急诊预测基准发表(Scientific Data 9:658,基于 v1.0,三任务 + 固定 80/20 划分)
2022 年底 v2.1:race 归并为 33 个取值等维护性更新
2023-01-05 v2.2(当前版本):删除 22,625 个 stay_id——对应患者子集由官方内部保留为测试集,未来版本将一致排除(DOI: 10.13026/5ntk-km72)
2023 MIMIC-IV-ED Demo v2.2 发布(100 名患者,免认证,DOI: 10.13026/jzz5-vs76)
2025 MIMICEL 急诊事件日志(流程挖掘派生集)与 MC-MED(Stanford 多模态急诊库)相继发布,急诊公开数据生态成形

§1.5 典型 AI 应用场景

  1. 分诊时点住院预测:用分诊生命体征 + ESI + 主诉预测患者是否需要住院——Xie 基准第一任务,MLP AUROC 0.822,远超 ESI 本身的 0.711。
  2. 危重结局早期预警:预测院内死亡或 12 小时内 ICU 转入(阳性率 5.93%),MLP AUROC 0.883——急诊最硬核的临床任务。
  3. 72 小时急诊复诊预测:出院后 72h 内重返急诊(阳性率 3.47%),是医疗质量与患者安全的国际通用指标;也是三任务中最难的(AUROC 约 0.70)。
  4. 急诊运营与流程挖掘:以 MIMICEL 事件日志研究急诊拥挤、停留时长、资源瓶颈与离院去向分布。
  5. 多模态急诊研究:联动 MIMIC-CXR(胸片)与 MIMIC-IV-ECG(心电)做"分诊结构化数据 + 影像/波形"的急诊多模态模型。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

MIMIC-IV-ED 覆盖急诊全疾病谱——从轻微擦伤到心跳骤停。急诊计费诊断(diagnosis 表,ICD-9/10 混合编码)按 ICD-11 章节归并后的高频分布(成人子集口径,见 medRxiv 2025 可避免就诊研究)与核心诊断映射如下:

ICD-11 章节/编码 中文名称 急诊语境
第 21 章 症状、体征与临床所见 非特异性诊断(胸痛、腹痛、头晕等) 急诊第一大类,约占成人就诊计费诊断的 23%
第 22 章 损伤、中毒与外因后果 创伤、跌倒、车祸、药物过量 约占 21%,急诊特色病种群
1G40–1G4Z 脓毒症 急诊最关键的时效性诊断,早期识别是 AI 热点
CA40–CA4Z 肺炎 高频感染诊断
BA41 急性心肌梗死 胸痛主诉的核心鉴别诊断
GB60 急性肾衰竭 高频危重共病
CB41 呼吸衰竭 高频危重共病
BD10–BD1Z 心力衰竭 呼吸困难主诉的核心鉴别
GC08 尿路感染 高频感染(老年女性尤为常见)

编码体系要点:diagnosis 表为 ICD-9 与 ICD-10 混合编码,须以 icd_version 列区分——BIDMC 于 2015 年 10 月切换 ICD-10,库内数据横跨切换点。与 MIMIC-III(纯 ICD-9)不同,这里两套编码并存;跨文献复现队列定义时务必先按 icd_version 过滤(见 §6.5 坑点 1)。每次急诊就诊最多 9 个计费诊断码,seq_num = 1 通常为主诊断。

§2.2 SNOMED CT 映射

临床场景 ICD-9/10(库内) ICD-11 对应 SNOMED CT SNOMED CT 术语
急诊就诊 4525004 Emergency department patient visit (procedure)
分诊评估 22539008 Triage (procedure)
脓毒症 038.9 / A41.9 1G4Z 91302008 Sepsis (disorder)
肺炎 486 / J18.9 CA40–CA4Z 233604007 Pneumonia (disorder)
急性心肌梗死 410.71 / I21.x BA41 22298006 Myocardial infarction (disorder)
急性肾损伤 584.9 / N17.9 GB60 14669001 Acute renal failure syndrome (disorder)
急性呼吸衰竭 518.81 / J96.00 CB41 65710008 Acute respiratory failure (disorder)
心力衰竭 428.0 / I50.9 BD10–BD1Z 84114007 Heart failure (disorder)

§2.3 疾病简介

急诊科是医疗体系的前哨与减压阀:患者未经预约、未经筛选地涌入,病情谱从轻微擦伤延伸到心跳骤停,而急诊团队必须在信息极度不完备的数分钟内完成分诊——决定谁先得到最稀缺的资源:医护的注意力。美国每年约 1.3 亿次急诊就诊,其中约 12-15% 收入住院;急诊拥挤(crowding)与分诊不足(under-triage)已被反复证明与死亡率和延误治疗相关。BIDMC 作为波士顿三级学术转诊中心,年急诊量约 5 万人次,其 2011-2019 年的 42.5 万次就诊构成研究这一高压环境的超大规模真实世界样本:56.8% 的患者看完回家,37.2% 收入住院,1.7% 转院,0.09% 在急诊内死亡。

§2.4 临床任务定义

AI 任务 临床定义 标准参考 在 MIMIC-IV-ED 中的操作化
住院预测 急诊就诊后随即收入住院病房 Xie et al. 2022 基准任务 1 disposition = ‘ADMITTED’(v2.2 官方口径,37.2%);Xie 口径经 MIMIC-IV 联动确认(47.34%,v1.0)
危重结局预警 院内死亡 或 12 小时内转入 ICU Xie et al. 2022 基准任务 2 disposition = ‘EXPIRED’ ∪ 经 hadm_id 联动 MIMIC-IV 的 ICU 转入时间与院内死亡(5.93%)
72h 急诊复诊 自急诊出院后 72 小时内再次到诊 Xie et al. 2022 基准任务 3;医疗质量通用指标 同一 subject_id 相邻就诊 intime 差 ≤ 72h(3.47%)
ESI 分诊级别预测 复现/辅助护士的 ESI 1-5 级判断 ESI Implementation Handbook triage.acuity(缺失 6,987 例)
急诊停留时长预测 intime → outtime 时长回归/分档 急诊拥挤研究惯例 outtime − intime(成人子集均值约 6.5 小时)
脓毒症早期识别 分诊时疑似感染 + 器官功能障碍 Sepsis-3(Singer et al. 2016, JAMA) 主诉/诊断筛查感染 + 生命体征异常;确诊须联动 MIMIC-IV 检验与培养数据

预测时点纪律(急诊建模第一原则):声称"分诊时点可用"的模型只能使用 triage 表 + edstays 的静态列(到院方式、性别、种族);vitalsign 的 charttime、pyxis 的给药、diagnosis 的出院计费编码全部发生在分诊之后,混入即构成结局泄漏(见 §6.5 坑点 1)。

§2.5 患者人群特征

维度 特征
数据来源 单中心:贝斯以色列女执事医疗中心(BIDMC)急诊科,美国马萨诸塞州波士顿,哈佛医学院附属三级教学医院(700+ 床位),年急诊量约 5 万人次
采集时间 2011-2019(9 年;注意全部早于 COVID-19 疫情)
规模 425,087 次急诊就诊 / 约 21 万名患者(v2.2);人均约 2 次就诊
年龄 均值 52.8 岁(SD 20.6);住院者显著更老(60.1 vs 46.3 岁);以成人为主,儿童占比极低
性别 女性 54.3% / 男性 45.7%
种族 White 58.0% / Black 22.0% / Hispanic 8.2% / Asian 4.4% / 其他 7.4%(自报,33 个原始取值)
到院方式 步行 59.2% / 救护车 36.6% / 未知 3.6% / 直升机 0.2% / 其他 0.3%
ESI 分诊 高危(ESI 1-2)39.1% / 中低危(ESI 3-5)60.9%;中位数 3 级(IQR 2-3)
离院去向 回家 56.8% / 住院 37.2% / 转院 1.7% / 未就诊即离开 1.4% / 擅自离院 1.3% + 0.4% / 急诊内死亡 0.09%
急诊停留时长 成人子集均值约 392 分钟(约 6.5 小时)

以上人口学统计引自基于 v2.2 的两项队列研究(arXiv:2403.05235 附表 1,n=418,100;medRxiv 2025 成人子集,n=201,106);到院方式与离院去向为 v2.2 官方精确计数(mimic.mit.edu 表文档)。

§2.6 金标准/参考标准

数据来源 记录方式 产生者 金标准性质
ESI 分诊级别(triage.acuity) 分诊护士单人评估后手工录入 BIDMC 急诊注册护士(RN) 主观分级——文献报告 ESI 评定者间一致性 Cohen’s κ 约 0.68-0.82,属"参考标准"而非金标准
生命体征(triage / vitalsign) 床旁测量后录入急诊信息系统;原为自由文本,发布时正则化仅保留数值 BIDMC 急诊护理团队 临床常规记录,存在录入误差与单位混录(华氏/摄氏)
离院去向(edstays.disposition) 急诊信息系统自动/行政记录 BIDMC 急诊信息系统 客观事件,高度可靠(8 类取值)
计费诊断(diagnosis) 急诊出院后由编码员回顾性分配 BIDMC 健康信息管理部门认证编码员 行政编码,反映计费需求,存在主诊断选择偏误;绝不等同"到院时已知诊断"
用药核对(medrecon) 到院时工作人员询问患者当前用药 BIDMC 急诊医护 + 患者自报 依赖患者回忆,存在回忆偏倚与遗漏
发药记录(pyxis) BD Pyxis MedStation 自动发药柜机器日志 自动化设备 机器记录,可靠性高;但仅覆盖经药柜发放的药品(不含大袋复苏液体等)

脱敏规则(所有下游分析的前提):移除全部 18 类 HIPAA 标识符;所有日期按患者随机偏移至 2100-2200 年区间,同一患者偏移量一致(患者内时序保真、事件顺序真实),跨患者的真实日历对齐不可恢复;自由文本(主诉、疼痛备注)经混合去标识算法处理(Johnson, Bulgarelli & Pollard, CHIL 2020,BERT 系),识别出的 PHI 实体替换为三个下划线(___);triage/vitalsign 的数值列原为自由文本,无法琐碎转换为数值者被删除——这两张表的 NULL 因此有"脱敏删除"与"未记录"双重含义(见 §6.5 坑点 6)。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
一切新研究的标准选择 v2.2(当前版本) ~0.5 GB 含 gender/race/arrival_transport/disposition 完整人口学列;outtime bug 已修复;与官方未来版本患者集合一致(已排除内部测试集)
精确复现 Xie et al. 2022 基准 v1.0 ~0.5 GB 该基准队列(441,437 次就诊)与 80/20 划分均基于 v1.0 的 448,972 次就诊;v2.2 删除 22,625 个 stay 后无法逐行对齐
教学/管道调试/免认证体验 Demo v2.2 数 MB 100 名患者全 6 表,开放下载,BigQuery physionet-demo.mimiciv_ed 免凭证查询

版本差异速查

维度 v1.0(2021-06) v2.0(2022-05) v2.2(2023-01)
就诊数 448,972 ~448,972 425,087(删除 22,625 stay)
edstays 列 无人口学列 +gender/race/arrival_transport/disposition 同 v2.0
outtime hadm_id 为 NULL 者表观停留仅数分钟(bug) 已修复 已修复
triage.pain 仅数值 自由文本(含非数值条目) 自由文本
患者集合 全量 全量 排除官方内部测试集患者(未来版本一致)

§3.1 模态详细说明

MIMIC-IV-ED 包含两大模态:

  1. 结构化急诊 EHR:一次急诊的完整结构化链路——edstays 的到院方式/离院去向/出入急诊时间,triage 的六参数生命体征 + ESI 级别,vitalsign 的每 1-4 小时复测生命体征(含心律、疼痛),medrecon 的到院前居家用药(GSN/NDC/ETC 三层药物本体),pyxis 的自动发药柜配药日志(GSN 本体),diagnosis 的 ICD-9/10 计费诊断(每次就诊最多 9 码)。
  2. 短文本:triage.chiefcomplaint(主诉)为脱敏自由文本,常以逗号分隔多个条目,PHI 已替换为 ___;这是急诊 NLP(主诉分类、症状抽取、LLM 问诊建模)的核心资产。注意本模块不含医师病程记录——临床长文本在 MIMIC-IV-Note 模块(需另行申请)。

§3.2 样本量拆分(6 张表完整清单,v2.2 精确行数)

表名 行数 内容 粒度
edstays 425,087 就诊追踪:intime/outtime、gender、race、arrival_transport、disposition、hadm_id 一次就诊一行(星型中心)
triage 425,087 分诊:体温/心率/呼吸/血氧/血压、疼痛、ESI acuity、主诉 一次就诊一行(无时间戳)
vitalsign 1,564,610 就诊期间生命体征复测:+charttime、rhythm、pain 每次测量一行,人均约 3.7 次
medrecon 2,987,342 到院前居家用药核对:name、gsn、ndc、ETC 本体 一药多行(ETC 多分组)
pyxis 1,586,053 Pyxis 发药柜配药:charttime、med_rn、name、gsn 一行 ≠ 一次配药事件
diagnosis 899,050 急诊计费诊断:seq_num、icd_code、icd_version(9/10)、icd_title 每次就诊最多 9 码

合计约 789 万行。v1.0 为 448,972 次就诊;v2.2 删除 22,625 个 stay_id(内部测试集患者),各表行数同步缩减,最终行数以 mimic-code 仓库随附的验证脚本为准。

§3.3 数据格式详情

形态 格式 说明
发布文件 6 个 .csv.gz + 校验和 PhysioNet 官方 zip,扁平目录
本地数据库 PostgreSQL(官方建库脚本) MIT-LCP/mimic-code 的 mimic-iv-ed/buildmimic
云端 Google BigQuery 全库:physionet-data.mimiciv_ed;Demo:physionet-demo.mimiciv_ed
试用版 MIMIC-IV-ED Demo v2.2 100 名患者,免认证开放下载,患者集合与 MIMIC-IV demo 一致(可与 MIMIC-CXR demo 联动)

§3.4 存储大小

形态 大小 备注
CSV 压缩包(6 个 .csv.gz) ~0.5 GB PhysioNet 官方 zip
解压后 CSV ~2 GB medrecon 为最大单表(约 300 万行)
PostgreSQL 导入后 ~4 GB 含索引建议预留 10 GB 磁盘
BigQuery 免下载 每月 1 TB 免费查询额度足够全部原型开发

§3.5 标注方式

MIMIC-IV-ED 无传统 ML 意义的手工标注,标签来源四层:

  1. 客观事件(最可靠):离院去向(disposition)、出入急诊时间——急诊信息系统行政记录。
  2. 主观分级(参考标准):ESI 分诊级别——分诊护士单人判断,存在评定者间差异(文献 κ 约 0.68-0.82)。
  3. 定量测量(需清洗):生命体征——床旁测量 + 自由文本录入后经正则数值化,含单位混录与离群值。
  4. 行政编码(有噪声):ICD-9/10 计费诊断——出院后编码员按计费需求回顾性分配。

§3.6 标注者资质

不适用传统标注者概念。分诊由 BIDMC 急诊注册护士执行(ESI 体系要求经过专门培训);生命体征由急诊护理团队床旁测量录入;ICD 编码由健康信息管理部门的认证编码专业人员分配;文本去标识由 Johnson et al. 2020(CHIL,DOI: 10.1145/3368555.3384451)的混合自动算法完成,人工抽检后发布。

§3.7 数据采集时间范围

2011 年至 2019 年,共 9 年。全部数据早于 COVID-19 疫情——这既是无疫情混杂的"干净基线",也意味着当代急诊实践(分诊流程、就诊量、病种谱)已发生漂移。注意所有日期已脱敏偏移至 2100-2200 年,真实年份不可恢复(见 §6.5 坑点 7)。

§3.8 地理覆盖

单中心——贝斯以色列女执事医疗中心(BIDMC)急诊科,美国马萨诸塞州波士顿。单中心 + 美国医疗体系(保险驱动、转诊模式、急诊文化)是泛化到中国急诊场景的核心限制(详见 §7.3)。

§3.9 采集设备规格

系统/设备 型号/版本 覆盖时段 说明
急诊信息系统 官方未披露厂商(XML 导出) 2011-2019 全部 6 表的源系统
自动发药柜 BD Pyxis MedStation 2011-2019 pyxis 表来源;仅覆盖经柜发放药品
分诊体系 Emergency Severity Index(ESI)v 五级 2011-2019 triage.acuity 的分级框架
药物本体 GSN / NDC / ETC medrecon 三层编码;pyxis 用 GSN
文本去标识 Johnson et al. 2020 混合算法(BERT 系) 处理全部自由文本字段

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 数据源系统 BIDMC 急诊科日常诊疗:分诊台、床旁监护、Pyxis 药柜、计费系统 临床数据实时产生于急诊诊疗过程;研究用途从属于临床用途
2. 原始抽取 BIDMC 急诊信息系统 XML 导出 MIT LCP 与 BIDMC Information Systems 协作(致谢 Carolyn Conti、Alvin Gayles、Ayad Shammout、Lu Shen)
3. 结构转换 XML → 非规范化关系数据库 星型模式设计:edstays 为中心、五表以 stay_id 辐射;按表主键(stay_id + charttime + 属性列)插入时去重
4. 去标识化 HIPAA Safe Harbor + 混合文本去标识算法 标识符随机化;日期按患者偏移至 2100-2200;自由文本 PHI → ___;数值列正则化仅留数值(引入"双关 NULL")
5. 质量过滤 数值型生命体征正则过滤;删除就诊窗口外 >1 年的记录(多为录入时间笔误) 这是官方仅做的两步清洗——其余脏数据(单位混录、离群值)刻意保留给研究者
6. 标识符协同 与 MIMIC-IV / MIMIC-CXR 统一生成 subject_id / hadm_id / stay_id 三键跨库联动;MIMIC-IV-ED 全部 stay 存在于 MIMIC-IV transfers 表
7. 公开发布 PhysioNet 平台 v1.0(2021-06)→ v2.0(2022-05)→ v2.1 → v2.2(2023-01,删除内部测试集患者);凭证化访问 + DUA

§4 数据结构详解

§4.0 目录结构预览

mimic-iv-ed/2.2/
├── edstays.csv.gz       # 就诊追踪主表(425,087 行;星型模式中心)
├── triage.csv.gz        # 分诊评估(425,087 行;ESI + 主诉 + 首次生命体征)
├── vitalsign.csv.gz     # 就诊期间生命体征(1,564,610 行;含 charttime)
├── medrecon.csv.gz      # 到院前用药核对(2,987,342 行;最大表)
├── pyxis.csv.gz         # Pyxis 发药柜记录(1,586,053 行)
└── diagnosis.csv.gz     # 急诊计费诊断(899,050 行;ICD-9/10 混合)

# Demo(免认证)目录结构相同:mimic-iv-ed-demo/2.2/ 下同样 6 个 CSV
# 本地建库:git clone MIT-LCP/mimic-code 后使用 mimic-iv-ed/buildmimic 脚本

§4.1 DAIMS 标准化字段描述表

核心表:edstays(一次就诊一行)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
subject_id INTEGER 患者唯一标识符 10000032 三级链接键之根(链 MIMIC-IV) 不允许缺失 正整数
hadm_id INTEGER 住院标识符(仅住院者) 29079034 链 MIMIC-IV admissions 未住院者为 NULL(非缺失,是结局信息) 2000000-2999999 或 NULL
stay_id INTEGER 急诊就诊唯一标识符 30000012 星型模式中心键 不允许缺失 正整数
intime / outtime TIMESTAMP 入/出急诊时间(已偏移) 2164-10-23 21:09:00 ED 停留时长、时序锚点 整体偏移,间隔保持 不允许缺失 2100-2200 区间
gender VARCHAR(1) 行政性别 “F” 协变量/公平性分析 系统记录 不允许缺失 “M” / “F”
race VARCHAR(60) 自报种族(33 类) “WHITE” 公平性分析 自报且取值不规整 部分为 NULL / “UNKNOWN” 33 个取值
arrival_transport VARCHAR(50) 到院方式 “AMBULANCE” 强预测特征(病情严重度代理) 系统记录 “UNKNOWN” 即信息性缺失 WALK IN / AMBULANCE / HELICOPTER / UNKNOWN / OTHER
disposition VARCHAR(255) 离院去向 “ADMITTED” 最常用靶标 行政记录,极可靠 少数为 NULL HOME / ADMITTED / TRANSFER / EXPIRED / ELOPED / LEFT WITHOUT BEING SEEN / LEFT AGAINST MEDICAL ADVICE / OTHER

核心表:triage(一次就诊一行,无时间戳)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
temperature NUMERIC 体温(华氏度 98.6 分诊特征 部分疑误录为摄氏;自由文本来源 NULL = 脱敏删除或未记录(双关) 含离群值,需生理范围过滤
heartrate NUMERIC 心率(bpm) 85.0 分诊特征 录入误差 同上双关 NULL(17,090 例) 需过滤非生理值
resprate NUMERIC 呼吸频率(次/分) 17.6 分诊特征 录入误差 双关 NULL(20,353 例) 需过滤
o2sat NUMERIC 血氧饱和度(%) 98.4 分诊特征 录入误差 双关 NULL(20,596 例) 0-100
sbp / dbp NUMERIC 收缩/舒张压(mmHg) 134.9 / 77.5 分诊特征 录入误差 双关 NULL(约 18,291/19,091 例) 需过滤
pain TEXT 自报疼痛 0-10(自由文本 “3-5”、“4/6”、“five” 分诊特征 非数值条目极多 空值 = 未记录 需自定义解析器
acuity NUMERIC ESI 分诊级别 1-5 3.0 标签/强特征(注意使用边界) 护士主观判断 缺失 6,987 例 1(最高危)- 5(最低危)
chiefcomplaint VARCHAR(255) 主诉(脱敏自由文本) “chest pain, ___” 急诊 NLP 核心资产 书写不规范、PHI 替换为 ___ 部分为空 自由文本

核心表:vitalsign(每次测量一行)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
charttime TIMESTAMP 测量录入时间 2164-10-24 02:15:00 时序对齐;预测时点纪律的关键 录入延迟 部分为 NULL 2100-2200 区间
temperature NUMERIC 体温(华氏度) 99.1 时序特征 单位混录;缺失率 36%(564,968 例,其中 11,048 为脱敏删除) 双关 NULL 需过滤
o2sat NUMERIC 血氧(%) 97.0 时序特征 缺失 135,836 例中 46,620(34%)为脱敏删除——删除本身含信息 双关 NULL 0-100
sbp / dbp INTEGER 血压(mmHg) 128 / 76 时序特征 录入误差 双关 NULL(81,256 例) 需过滤
rhythm TEXT 心律 “Sinus” 心脏事件特征 自由文本 常为 NULL 自由文本
pain TEXT 疼痛 0-10(自由文本) “7” 症状轨迹 非数值条目 常为 NULL 需解析

核心表:medrecon(到院前用药,一药多行)与 pyxis(急诊配药)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
medrecon.name VARCHAR(255) 居家用药名 “Lisinopril” 既往病史代理特征 患者回忆偏倚 空 = 未记录/无用药 自由文本
medrecon.gsn / ndc VARCHAR GSN / NDC 药编 “00603xxxx” 药物标准化 0 = 缺失哨兵值 0 即缺失 本体编码
medrecon.etccode / etcdescription VARCHAR ETC 治疗分类 “ACE INHIBITORS” 药物类别特征 一药多分组 → 一药多行 etc_rn 仅区分行序,无含义 ETC 本体
pyxis.charttime TIMESTAMP 配药记录时间 2164-10-23 23:41:00 给药时序 配药时间 ≈ 给药时间 部分为 NULL 2100-2200 区间
pyxis.med_rn SMALLINT 配药事件行号 1 聚合单次配药事件的键 同事件多 gsn 行 不允许缺失 正整数
pyxis.gsn VARCHAR(10) GSN 药编 “004560” 药物标准化 0 = 缺失;一药多 gsn → 行数 ≠ 药数 0 即缺失 本体编码

核心表:diagnosis(急诊计费诊断)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
seq_num INTEGER 诊断伪优先级 1 主诊断识别 seq_num=1 通常为主诊断,但多诊断排序不严格 不允许缺失 1-9
icd_code VARCHAR(10) ICD 编码 “R079” / “78650” 队列定义/表型 计费导向 不允许缺失 ICD-9 或 ICD-10
icd_version INTEGER 编码版本 10 过滤编码体系的开关 2015-10 切换点 不允许缺失 9 / 10
icd_title TEXT 诊断文本 “Chest pain, unspecified” 快速筛读 与编码偶有不一致 不允许缺失 自由文本

§4.2 标签分布统计

临床任务/标签 阳性率/分布 口径说明
住院(disposition = ADMITTED) 37.2%(158,010 / 425,087) v2.2 官方精确计数
Xie 基准"住院"任务 47.34%(208,976 / 441,437) v1.0 + 经 MIMIC-IV 联动确认的口径——与上者不可混用(见 §6.5 坑点 7)
危重结局(院内死亡或 12h 内 ICU 转入) 5.93%(26,174 / 441,437) Xie 基准;其中 ICU 转入 5.57%、院内死亡 0.93%
72h 急诊复诊 3.47%(15,299 / 441,437) Xie 基准
急诊内死亡(disposition = EXPIRED) 0.089%(377 / 425,087) v2.2 官方精确计数;极度不平衡
ESI 分诊 高危 1-2 级 39.1% / 3-5 级 60.9%;中位数 3 基于 v2.2 队列研究(arXiv:2403.05235);另 6,987 例 acuity 缺失
到院方式 步行 59.2% / 救护车 36.6% / 未知 3.6% / 直升机 0.2% v2.2 官方精确计数
高频主诉群 伤口评估、腹痛、车祸+意识改变、腰背痛、胸痛+呼吸困难、腿/膝痛 成人子集聚类分析(medRxiv 2025)

§4.3 关键字段描述性统计

  • 每次就诊平均:约 3.7 条 vitalsign + 7.0 条 medrecon + 3.7 条 pyxis + 2.1 条 diagnosis。
  • 分诊生命体征完整度:heartrate 最完整(缺失 17,090 / 425,087 ≈ 4.0%),temperature 缺失最多(23,415 ≈ 5.5%);acuity 缺失 6,987 ≈ 1.6%。
  • vitalsign 完整度:heartrate 缺失 4.5%、o2sat 缺失 8.7%(其中脱敏删除占 34%)、temperature 缺失高达 36.1%——体温是就诊期间最少复测的指标。
  • 急诊停留时长:成人子集均值约 392 分钟;住院者显著长于回家者。
  • 诊断编码:每次就诊最多 9 码;seq_num=1 为主诊断;ICD-9/10 混合,以 icd_version 区分。

§4.4 数据层级关系(星型模式 + 三键体系)

                    ┌──────────────┐
                    │   edstays    │  425,087 行(stay_id 唯一)
                    │ (星型中心)  │
                    └──────┬───────┘
        ┌──────────┬───────┼───────┬──────────┐
        │          │       │       │          │
     triage   vitalsign  medrecon  pyxis   diagnosis
     1:1       1:N        1:N       1:N      1:N(≤9)
   (无时间戳)(charttime)(一药多行)(med_rn)(seq_num)

三键链接体系:
subject_id ──┬─→ MIMIC-IV patients(anchor_age / anchor_year_group)
             ├─→ MIMIC-CXR(PatientID DICOM 属性)
             └─→ MIMIC-IV-ED 内所有表
hadm_id ───────→ MIMIC-IV admissions(仅住院者,2000000-2999999;NULL = 未住院)
stay_id ───────→ MIMIC-IV transfers(ED 模块全部 stay 可追溯至主库转移记录)
  • 无年龄列:年龄不在 ED 模块中,必须经 subject_id 链接 MIMIC-IV patients 的 anchor_age 获得(社区惯例:按 anchor_year_group 近似,假设生日为 1 月 1 日)。
  • 无 icustay 链接:急诊 → ICU 的路径须先经 hadm_id 链接 admissions,再链接 MIMIC-IV-ICU 的 icustays。
  • 高频踩坑:medrecon 与 pyxis 的行数都不能当"药数"用——前者一药多行(ETC 分组),后者一次配药多行(多 gsn),见 §6.5 坑点 2、3。

§4.5 缺失值情况与信息性缺失编码

缺失类型 指标示例 缺失原因 信息性缺失编码 对 AI 的影响
双关 NULL(脱敏 vs 未记录) triage/vitalsign 全部数值列 原为自由文本,脱敏时无法数值化者被删 NULL 无法区分"脱敏删除"与"未测量" 官方公布删除计数(如 triage.temperature 680 例);占比小但不可无视
脱敏高比例删除 vitalsign.o2sat 非数值条目(如 “>100”、“on room air”)被删 缺失 135,836 例中 46,620(34%)为删除 o2sat 缺失标识本身可作特征
MAR(工作流程驱动) vitalsign 复测频率 病情重者测得勤 测量次数 ≈ 病情严重度代理 建议保留"测量次数"特征
自报缺失 medrecon 患者不知/不愿报告用药 无记录 ≠ 无用药 居家用药特征须谨慎解释
设备覆盖缺失 pyxis 大袋复苏液体不经药柜 无记录 ≠ 未给药 液体复苏暴露不可从 pyxis 重建
主观评估缺失 triage.acuity 未分诊/记录失败(6,987 例) 缺失机制未知 ESI 相关分析须声明缺失处理

§5 数据划分与使用建议

§5.1 官方数据划分

MIMIC-IV-ED 官方不提供 train/validation/test 划分,且 v2.2 刻意删除了一批患者(22,625 个 stay_id)作为官方内部保留测试集——这意味着公开数据上不存在"全量真值",任何论文的测试集都是作者自行切分的。社区的事实标准解法是 Xie et al. 2022 基准的固定 80/20 划分(基于 v1.0:train 353,150 次就诊 / test 88,287 次就诊,覆盖 65,169 名患者),随 nliulab/mimic4ed-benchmark 仓库公开。若目标是与该基准比较,请直接使用其划分与 v1.0 数据;否则按 §5.2 自行划分。

§5.2 推荐划分策略

  1. 按 subject_id 分组随机划分(必须):人均约 2 次就诊,按 stay 随机划分必然泄漏同一患者。scikit-learn 用 GroupShuffleSplit(groups=subject_id)
  2. 不能按真实年份划分:日期已偏移至 2100-2200,真实年份不可恢复;anchor_year_group(经 MIMIC-IV patients 链接)仅提供三年区间的粗粒度时代代理。
  3. 按 ESI 分层:ESI 1-2 与 3-5 的患者严重度差异巨大,分层抽样保证两端都有足够样本。
  4. Xie 基准队列定义:成人(≥18 岁)+ acuity 非缺失,v1.0 下为 441,437 次就诊——复现基准时严格遵循其过滤流程。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

edstays = pd.read_csv("edstays.csv.gz")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(edstays, groups=edstays["subject_id"]))
train_subjects = set(edstays.iloc[train_idx]["subject_id"])
test_subjects = set(edstays.iloc[test_idx]["subject_id"])
assert len(train_subjects & test_subjects) == 0  # 患者级零泄漏验证

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按 stay_id 而非 subject_id 划分(人均约 2 次就诊) GroupShuffleSplit(groups=subject_id),划分后验证患者集合零交集
2 用出院后计费 diagnosis 预测"分诊时点的住院/危重" 预测时点纪律:分诊模型只用 triage + edstays 静态列
3 用就诊后期的 vitalsign / pyxis 预测分诊时点结局 特征时间窗硬过滤:charttime ≤ 预测时点
4 用 hadm_id 是否为空作特征 hadm_id 非空 = 已住院,本身就是结局——严禁入模
5 多次就诊的历史信息穿越:用"未来"就诊统计作特征 历史特征仅用 intime 早于本次就诊的记录

§5.4 交叉验证建议

  • 标准:5 折按 subject_id 分组交叉验证。
  • 稳健性:按 ESI 高危/低危分层报告子群性能;按 anchor_year_group 粗粒度时代分层报告漂移敏感性。

§5.5 外部验证

在 MIMIC-IV-ED 上训练的模型,可行的外部验证路径为:MC-MED(Stanford 多模态急诊库,Sci Data 2025,美国西海岸对照)、SGH-ED(新加坡中央医院急诊队列,170 万+ 就诊,亚洲对照,见 arXiv:2403.05235 的双队列设计)、以及本地医院急诊数据。Xie 基准论文明确将"单中心、无外部验证"列为首要局限——在你的研究中补上这一环即是增量贡献。


§6 AI 就绪指南

§6.0 云端快速启动

零门槛试用(免认证):MIMIC-IV-ED Demo(https://physionet.org/content/mimic-iv-ed-demo/2.2/)含 100 名患者全量 6 表,无需 CITI 培训即可下载;患者集合与 MIMIC-IV demo / MIMIC-CXR demo 一致,可练习三库联动。

BigQuery 免下载查询:完成 PhysioNet 认证并绑定 GCP 后,直接查询 physionet-data.mimiciv_ed(Demo 则无需认证:physionet-demo.mimiciv_ed)。每月 1 TB 免费查询额度足够全部原型开发。

-- BigQuery 首个查询:分诊时点住院预测的最小特征集
SELECT e.stay_id, e.subject_id, e.arrival_transport,
       t.temperature, t.heartrate, t.resprate, t.o2sat, t.sbp, t.dbp,
       t.acuity, t.chiefcomplaint,
       (e.disposition = 'ADMITTED') AS label_admitted
FROM `physionet-data.mimiciv_ed.edstays` e
JOIN `physionet-data.mimiciv_ed.triage` t USING (stay_id)
WHERE t.acuity IS NOT NULL

§6.1 快速上手(pandas 本地版)

# ========================================
# MIMIC-IV-ED 快速上手 — 分诊时点住院预测基线
# 环境要求: pandas>=2.0, scikit-learn>=1.3
#
# ⚠️ 目录结构预期:
#   请将下载的数据解压至 ./data/mimic-iv-ed/2.2/ 目录,确保以下结构:
#   ./data/mimic-iv-ed/2.2/
#   ├── edstays.csv.gz     # 就诊追踪(含标签 disposition)
#   ├── triage.csv.gz      # 分诊特征(生命体征 + acuity + 主诉)
#   └── ...(vitalsign / medrecon / pyxis / diagnosis)
#
#   标签构造:disposition == 'ADMITTED' → 1(v2.2 官方口径,37.2%)
#   ⚠️ 与 Xie 基准的 47.34% 口径不同,详见 §6.5 坑点 7
# ========================================
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import roc_auc_score

DATA = "./data/mimic-iv-ed/2.2/"
ed = pd.read_csv(DATA + "edstays.csv.gz", parse_dates=["intime", "outtime"])
tr = pd.read_csv(DATA + "triage.csv.gz")

df = ed.merge(tr, on=["subject_id", "stay_id"], how="inner")
df = df[df["acuity"].notna()].copy()

# 分诊时点合法特征:triage 生命体征 + acuity + 到院方式(静态列)
VITALS = ["temperature", "heartrate", "resprate", "o2sat", "sbp", "dbp"]
for c in VITALS:
    df[c] = pd.to_numeric(df[c], errors="coerce")
df[VITALS] = df[VITALS].fillna(df[VITALS].median())
df["pain_num"] = pd.to_numeric(df["pain"], errors="coerce").fillna(-1)  # 自由文本暂以 -1 标记
X = pd.get_dummies(df[VITALS + ["acuity", "pain_num", "arrival_transport"]],
                   columns=["arrival_transport"], dummy_na=True)
y = (df["disposition"] == "ADMITTED").astype(int)

# 患者级分组划分(人均约 2 次就诊,防止同患者泄漏)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr_idx, te_idx = next(gss.split(X, y, groups=df["subject_id"]))

clf = LogisticRegression(max_iter=1000).fit(X.iloc[tr_idx], y.iloc[tr_idx])
auc = roc_auc_score(y.iloc[te_idx], clf.predict_proba(X.iloc[te_idx])[:, 1])
print(f"分诊时点住院预测 AUROC: {auc:.3f}")  # 逻辑回归基线约 0.78-0.80

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
CSV 全库下载 https://physionet.org/content/mimic-iv-ed/2.2/ ~0.5 GB ① 注册 PhysioNet 账号;② 完成 CITI Program 的 Data or Specimens Only Research 课程(约 2-4 小时,须提交 Completion Report);③ 提交凭证化申请(学生/博士后须提供导师作为推荐人);④ 审核通过后签署 DUA 下载
Demo 数据集 https://physionet.org/content/mimic-iv-ed-demo/2.2/ 数 MB 免认证开放下载,100 名患者
BigQuery 全库 physionet-data.mimiciv_ed 免下载 PhysioNet 账号绑定 GCP 后申请云访问
BigQuery Demo physionet-demo.mimiciv_ed 免下载免认证 任何 GCP 账号可直接查询

DUA 核心义务:不得尝试重识别、不得分享给未签 DUA 者、安全存储、发表时按规范引用(三件套,见 §9)。MIMIC-IV-ED 与 MIMIC-IV 的 DUA 需分别签署;派生数据集/模型须以相同协议在 PhysioNet 分享,命名须含 “Ext”(如 MIMIC-IV-Ext-XXX)。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(Python 版,含联动 MIMIC-IV 取年龄)</b></summary>

# 步骤 1:成人队列(年龄须从 MIMIC-IV patients 链接获得)
import pandas as pd

DATA_ED = "./data/mimic-iv-ed/2.2/"
DATA_IV = "./data/mimic-iv/3.1/hosp/"   # 需另行申请 MIMIC-IV
ed = pd.read_csv(DATA_ED + "edstays.csv.gz", parse_dates=["intime", "outtime"])
tr = pd.read_csv(DATA_ED + "triage.csv.gz")
patients = pd.read_csv(DATA_IV + "patients.csv.gz")

df = ed.merge(tr, on=["subject_id", "stay_id"]).merge(
    patients[["subject_id", "anchor_age", "anchor_year_group"]],
    on="subject_id", how="left")
# anchor_age 为患者 anchor_year 时点的年龄;跨年就诊有 ±数年误差(社区接受口径)
df = df[df["anchor_age"] >= 18]

# 步骤 2:体温单位清洗(华氏/摄氏混录:37 上下判为摄氏并转华氏)
import numpy as np
for col in ["temperature"]:
    df[col] = pd.to_numeric(df[col], errors="coerce")
    celsius_mask = df[col].between(30, 45)          # 30-45 几乎必为摄氏
    df.loc[celsius_mask, col] = df.loc[celsius_mask, col] * 9 / 5 + 32
    df.loc[~df[col].between(90, 110), col] = np.nan  # 生理合理窗

# 步骤 3:pain 自由文本解析("3-5"取均值、"4/6"取前者、"five"映射、去符号)
WORD2NUM = {"zero":0,"one":1,"two":2,"three":3,"four":4,"five":5,
            "six":6,"seven":7,"eight":8,"nine":9,"ten":10}
def parse_pain(s):
    if pd.isna(s): return np.nan
    s = str(s).lower().strip().replace("+", "")
    if s in WORD2NUM: return float(WORD2NUM[s])
    for sep in ["-", "/"]:
        if sep in s:
            parts = [p for p in s.split(sep) if p.strip().isdigit()]
            if parts: return np.mean([float(p) for p in parts])
    return pd.to_numeric(s, errors="coerce")
df["pain_score"] = df["pain"].apply(parse_pain).clip(0, 10)

# 步骤 4:生命体征生理范围过滤(Xie 基准口径)
RANGES = {"temperature": (90, 110), "heartrate": (20, 220),
          "resprate": (4, 60), "o2sat": (50, 100),
          "sbp": (50, 260), "dbp": (20, 160)}
for col, (lo, hi) in RANGES.items():
    df.loc[~df[col].between(lo, hi), col] = np.nan

# 步骤 5:患者内首次就诊 + 信息性缺失标识 + 分组划分
df = df.sort_values("intime").groupby("subject_id").first().reset_index()
for col in RANGES:
    df[f"{col}_missing"] = df[col].isna().astype(int)
    df[col] = df[col].fillna(df[col].median())
print(f"成人首次就诊队列: {df.shape}")

</details>

推荐直接使用社区成熟管道替代手写:nliulab/mimic4ed-benchmark(Xie 基准全流程,含三任务构建与 80/20 划分)、cavalab/mimic-iv-ed-epi(主诉 → 54 个手工策展二值指标 + 人口学联动)、MIMICEL(急诊事件日志抽取,流程挖掘)、mimic-code 的 mimic-iv-ed 建库与验证脚本。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class EDStayDataset(Dataset):
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(EDStayDataset(X_train, y_train), batch_size=256, shuffle=True)
import xgboost as xgb  # XGBoost 基线:Xie 基准证明 GBDT 系与 MLP 相当
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "auc",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
          "max_depth": 6, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=500)

§6.5 常见坑点

⚠️ 坑点 1:预测时点失守——出院后信息渗入"分诊模型"(分类:数据泄漏)

问题:diagnosis 是急诊出院后才分配的计费编码;vitalsign 的 charttime、pyxis 的配药都发生在分诊之后。用这些字段预测"分诊时点的住院/危重",本质是用答案预测答案。

症状:住院预测 AUROC 异常高(>0.90);上线/换时点复现后性能崩塌。

解决:明确声明预测时点(t=0 为分诊完成);分诊模型仅用 triage 全表 + edstays 的静态列(gender/race/arrival_transport);其余表一律加时间窗硬过滤 charttime <= 预测时点;论文中画出"特征可用性时间轴"。

参考:Xie et al. 2022(特征全部限定在分诊时点);§2.4 预测时点纪律。

⚠️ 坑点 2:pyxis 行 ≠ 给药事件,且大袋复苏液体不在表内(分类:标签理解)

问题:pyxis 表同一药物可有多个 gsn 取值,每种药一次配药会展开成多行——直接按行数统计"给药次数"会高估数倍;且 Pyxis 药柜不发放大袋液体(如复苏用晶体液),这类关键急诊干预在表内系统性缺失。

症状:某药"给药频次"异常高;液体复苏队列暴露量接近零,得出"未予液体"的错误结论。

解决:按 med_rn 聚合还原单次配药事件(同一 med_rn 的多行取其一);gsn=0 视为缺失;液体暴露须联动 MIMIC-IV 的 inputevents(住院后)或在论文中声明该数据缺口;牢记官方 Limitations:“气管插管等重大干预未被明确记录”。

参考mimic.mit.edu pyxis 表文档;PhysioNet MIMIC-IV-ED 页 Limitations。

⚠️ 坑点 3:medrecon 一药多行 + gsn/ndc=0 是缺失哨兵(分类:预处理陷阱)

问题:medrecon 按 ETC 本体分组展开——Adderall 会占 3 行(中枢兴奋剂/多动症治疗/发作性睡病治疗),行数(2,987,342)远大于实际药数;gsn 或 ndc = 0 表示缺失而非合法编码。

症状:患者"用药数"中位数异常高(约 7);按 gsn 联表时 0 值匹配出垃圾行。

解决:统计药数前先按 stay_id + name 去重;用药类别特征用 etc_rn 分组内任一 etccode 即可,或保留全部 ETC 多标签;联表前过滤 gsn != '0'ndc != '0';解释时牢记这是患者自报的居家用药,存在回忆偏倚。

参考mimic.mit.edu medrecon 表文档;PhysioNet 页面 Methods(Adderall 示例)。

⚠️ 坑点 4:体温华氏/摄氏混录(分类:预处理陷阱)

问题:temperature 官方口径为华氏度,但部分记录实际按摄氏度录入——37 与 98.6 并存于同一列;官方表文档明确提示"Some temperatures may be incorrectly documented as Celsius"。

症状:体温直方图在 37 附近出现诡异尖峰;按华氏范围过滤会误杀全部摄氏记录。

解决:30-45 区间的值判定为摄氏并换算(×9/5+32),再按 90-110°F 生理窗过滤离群值;vitalsign 表同样处理;复现 Xie 基准时用其公开的范围表(§6.3 步骤 2、4 已给出参考实现)。

参考mimic.mit.edu triage/vitalsign 表文档(temperature 条目);cavalab/mimic-iv-ed-epi 清洗脚本。

⚠️ 坑点 5:pain 是自由文本,不是 0-10 数值(分类:预处理陷阱)

问题:triage.pain 与 vitalsign.pain 均为自由文本:区间式(“3-5”)、分形式(“4/6”)、英文单词(“five”)、修饰符(“7+”)、“unable to answer” 并存。v2.0 起 triage.pain 从纯数值改为自由文本,老代码直接 astype(float) 会崩或静默产出 NaN。

症状:pain 列解析后缺失率异常高;或模型悄悄丢掉全部非标准条目造成选择偏倚。

解决:编写规则解析器(§6.3 步骤 3 给出参考实现:区间取均值、分式取前者、单词映射、去符号、越界置 NaN);保留"无法回答"作为独立类别而非 NaN——它本身与患者状态相关。

参考:PhysioNet v2.0 release notes(pain 列变更说明);arXiv:2503.22781 的 pain 处理附录。

⚠️ 坑点 6:triage 无时间戳,数值 NULL 含义双关(分类:标签理解)

问题:triage 表没有 charttime——分诊时间只能用 edstays.intime 近似;且 triage/vitalsign 的数值列原为自由文本,脱敏时无法数值化者被删,NULL 同时表示"脱敏删除"与"未记录"两种含义,无法区分。

症状:试图计算"分诊到医师评估时长"时发现无锚点;缺失值分析时无法解释 NULL 机制;少数研究的缺失率统计把两种 NULL 混为一谈。

解决:分诊时点统一以 intime 代理并在论文中声明;缺失处理采用"缺失标识 + 中位数填充"(§6.3 步骤 5),把缺失本身作特征;引用官方删除计数表(如 triage.temperature 缺失 23,415 例中仅 680 例为脱敏删除,约 3%)说明删除占比小。

参考mimic.mit.edu triage 表文档(Important considerations 与官方删除计数表)。

⚠️ 坑点 7:版本错配——v1.0 的 outtime bug 与 v2.2 的删人(分类:评估误用)

问题:v1.0 中 hadm_id 为 NULL 的就诊 outtime 错误(表观停留仅数分钟,v2.0 已修复);v2.2 又删除了 22,625 个 stay_id(官方内部测试集患者)。Xie 基准基于 v1.0 的 448,972 次就诊,其 47.34% 住院率口径与 v2.2 disposition=ADMITTED 的 37.2% 不可直接比较。

症状:用 v1.0 算 ED 停留时长得到大量接近 0 的荒谬值;在 v2.2 上"复现"Xie 基准时队列规模与阳性率对不上;跨论文比较 AUROC 时鸡同鸭讲。

解决:新研究一律用 v2.2 并在方法学注明 DOI(10.13026/5ntk-km72);精确复现 Xie 基准才用 v1.0 + 其官方划分;住院标签声明口径(disposition 字段 vs 经 MIMIC-IV 联动确认);ED 停留时长分析前过滤 outtime ≤ intime 的残余异常行。

参考:PhysioNet release notes(v2.0 bug 修复、v2.2 删人说明);Xie et al. 2022 数据描述。

⚠️ 坑点 8:同一患者多次就诊——按 stay 随机划分必然泄漏(分类:数据泄漏)

问题:约 21 万患者贡献 425,087 次就诊(人均约 2 次),同一患者的主诉风格、基础生命体征、用药史高度相关。按 stay_id 随机划分会让同一患者的不同就诊同时出现在训练集与测试集。

症状:测试集 AUROC 虚高 2-5%;按患者重划分后性能"莫名其妙"下降。

解决GroupShuffleSplit(groups=subject_id),划分后断言患者集合零交集(§5.2 代码);若研究设计允许,只取每患者首次就诊(§6.3 步骤 5)——这也是多数急诊文献的惯例;72h 复诊任务需额外确认"前次就诊"未被划到训练集。

参考:Xie et al. 2022(test 集 65,169 名患者与 train 不重叠);§5.3 泄漏模式表。

版本提示:2021-2022 年间发表的论文基于 v1.0(无 gender/race/arrival_transport/disposition 列);引用这些论文的特征集时,注意它们可能用 MIMIC-IV 联动补齐了人口学变量——v2.0 起这些列已内置,无需再联。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
对生命体征添加生理约束内的小幅高斯噪声(心率 ±2 bpm) 对 ICD 诊断编码做"同义替换"式增强
随机遮蔽 10-20% vitalsign 复测模拟录入缺失 打乱 charttime 或跨患者拼接时序
主诉文本的回译/同义改写(保留临床实体) ___(PHI 掩码)当作可学习 token 填充虚构内容
SMOTE 类方法处理危重结局(5.93%)不平衡(仅训练集内) 对 disposition 做多数类过采样到 1:1 后报告原始口径指标
掩蔽式表格自监督预训练(如 TabPFN/SAINT 风格) 对患者 ID 做任何变换或合并不同 subject_id 的就诊

§6.7 模型推荐

任务 推荐 backbone 特征方案 预期性能(Xie 基准口径)
快速基线 Logistic Regression 分诊生命体征 + acuity + 到院方式 住院 AUROC 约 0.78-0.80
标准方案 XGBoost / Random Forest 同上 + 主诉 TF-IDF + 历史就诊统计 住院 0.819 / 危重 0.880
基准最优 MLP(2-3 层) 同上全套 住院 0.822 / 危重 0.883 / 72h 复诊 0.700(GB)
可解释临床版 AutoScore(Xie 基准内置) 7-10 个变量的积分卡 住院 0.793 / 危重 0.846
主诉 NLP Bio_ClinicalBERT / LLM 嵌入 chiefcomplaint + 结构化特征 因任务而异,主诉增益约 +1-3% AUROC
多模态扩展 结构化 + CXR/ECG 融合 联动 MIMIC-CXR / MIMIC-IV-ECG 见 JMIR Res Protoc 2025(心脏主诉住院预测)

反直觉结论(Xie 基准的核心发现):Med2Vec、LSTM 等复杂序列模型在三任务上均未超越 GBDT/MLP——低维、单次就诊的急诊表格数据上,树模型与浅层 MLP 仍是性价比之王;复杂模型的收益要到联动 MIMIC-IV 的纵向数据后才显现。

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 3 GB(CSV 解压) 10 GB(PostgreSQL + 索引)
内存 8 GB(全量 pandas 可行) 16 GB(联动 MIMIC-IV 大表时)
GPU 不需要(LR/XGBoost/MLP 均可在 CPU 完成) 1 × 8 GB(主诉 BERT 嵌入、多模态融合)
训练时间 XGBoost 基线约 5-15 分钟(CPU) Xie 基准全流程约 1-2 小时
云端替代 BigQuery 免费 1 TB/月查询额度 Colab + BigQuery 零本地环境

§6.9 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             brier_score_loss, confusion_matrix)

def evaluate_binary(y_true, y_prob, threshold=0.5):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")  # 危重结局(5.93%)必报
    print(f"Brier: {brier_score_loss(y_true, y_prob):.4f}")         # 分诊部署重校准
    tn, fp, fn, tp = confusion_matrix(y_true, y_prob > threshold).ravel()
    print(f"Sensitivity: {tp/(tp+fn):.3f}  Specificity: {tn/(tn+fp):.3f}")

社区共识(Xie 基准协议):三任务主指标均为 AUROC + AUPRC;危重结局与 72h 复诊等低阳性率任务必须同时报 AUPRC(AUROC 在不平衡下过于乐观);面向分诊部署的模型须报告校准(Brier / calibration curve)——分诊决策对阈值敏感,未校准的概率比错误的排序更危险;与传统评分(ESI/MEWS/NEWS/NEWS2/REMS/CART)的对比是该领域的发表惯例。

§6.10 MLOps 笔记

  • 版本锁定:论文方法部分必须注明 “MIMIC-IV-ED v2.2”(DOI: 10.13026/5ntk-km72)与访问日期;v1.0 与 v2.2 的队列规模、可用列、outtime 正确性均不同。
  • 引用三件套:数据集本体(10.13026/5ntk-km72)+ MIMIC-IV 主论文(10.1038/s41597-022-01899-x)+ PhysioNet 平台(Goldberger 2000)——DUA 硬性要求,缺一不可(见 §9)。
  • 口径声明:住院标签(disposition vs 联动确认)、年龄口径(anchor_age ± 误差)、队列版本必须在方法学写清,否则无法与他人结果比较。
  • 日期偏移:2100-2200 的伪年份不可用于任何日历趋势分析;星期/季节保真度未官方承诺,时间特征仅用一天内时刻与相对间隔。
  • 派生分享:发布派生数据集/模型须挂 PhysioNet 相同协议,命名含 “Ext”(MIMIC-IV-Ext-XXX),并在 Discovery 页关联 Parent Projects。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 BIDMC 单中心,波士顿三级学术转诊中心急诊科,不代表社区医院、乡村医院与国际急诊 用 MC-MED(Stanford)/本地数据外部验证
体系偏倚 美国保险驱动医疗体系:就诊决策、住院门槛、72h 复诊含义与中国/欧洲完全不同 结论外推前做体系差异分析;流程类结论尤其谨慎
时代偏倚 2011-2019 年数据:脓毒症集束化、阿片危机应对等实践在期内演变;全部早于 COVID-19——疫情后急诊量与病种谱已显著改变 中高 时代分层(anchor_year_group);部署前用当代数据重校准
记录方式偏倚 数值字段原为自由文本录入,存在单位混录、离群值与录入延迟 生理范围过滤 + 官方删除计数表核对
编码偏倚 计费诊断反映计费需求;seq_num 主诊断存在选择偏误;ICD-9/10 混合 用全部 9 个编码位而非仅主诊断;按 icd_version 分层
测量频率偏倚 vitalsign 每 1-4 小时复测,病重测得勤(信息性测量) 保留测量次数特征;勿假设 MAR
自报偏倚 race 自报且 33 类不规整;medrecon 依赖患者回忆 公平性分析先归并种族;居家用药特征降权解释
分诊主观偏倚 ESI 由护士单人判断,评定者间 κ 约 0.68-0.82;存在人口学差异(见 §7.5) 把 acuity 当"参考标准"而非金标准;报告子群一致性
选择偏倚 仅覆盖到院患者:到院前死亡、被分流至其他院区者不覆盖 明确研究适用人群为"到诊患者"

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
离院去向(disposition) >99% 行政系统自动生成 8 类粒度;ELOPED/LEFT 类含义需文献确认
ESI 分诊(acuity) 主观分级 评定者间 κ 约 0.68-0.82(文献) 缺失 6,987 例;存在人口学分配差异
计费诊断(diagnosis) 编码员回顾性分配 编码员间一致性中等 计费导向;出院后分配(不可作分诊特征)
生命体征 护理床旁测量 自由文本录入后正则化 单位混录 + 双关 NULL + 离群值
用药核对(medrecon) 患者自报 无一致性保障 回忆偏倚;一药多行结构
发药记录(pyxis) 机器日志,高可靠 设备自动生成 覆盖不全(无大袋液体);行 ≠ 事件
主诉文本 分诊录入 书写不规范 PHI 掩码 ___ 破坏部分语义

§7.3 泛化性讨论

场景 失效风险 证据
跨机构(BIDMC → 其他美国医院) 中高 急诊流程、分诊实践、人群构成差异大;MC-MED 提供 Stanford 对照队列(Sci Data 2025)
跨体系(美国 → 亚洲/欧洲) arXiv:2403.05235 双队列(MIMIC-IV-ED vs 新加坡 SGH-ED,170 万就诊)显示种族构成、分诊体系(ESI vs PACS)、住院率差异显著
跨时间(2011-2019 → 疫情后) COVID-19 永久改变急诊就诊量、病种谱与防护流程;数据无一例疫情期患者
跨亚群体(儿童/高龄/少数族裔) 儿童占比极低(Xie 排除 <18 岁仅减少约 1.7%);少数族裔子群样本量尚可但置信区间宽
跨任务(住院预测 → 危重预警) 同一特征体系在不同任务的迁移性未系统验证;72h 复诊至今无高性能模型(约 0.70)

§7.4 伦理考量

  1. 数据来自真实急诊患者,包含 377 例急诊内死亡记录;研究者应保持对患者与家属的尊重。
  2. BIDMC 与 MIT 的 IRB 豁免了个体知情同意(IRB #2001P001699),前提是数据仅用于研究且已完成充分脱敏;DUA 禁止任何重识别尝试。
  3. 分诊 AI 直接决定"谁先得到救治"——这是医疗 AI 中伦理权重最高的场景之一。任何分诊辅助模型部署前必须完成公平性审计(§7.5)与前瞻性验证。
  4. race 字段为自报且 33 类不规整,精细公平性分析前必须先归并;不要在极小种族亚群上单独下结论。
  5. 派生数据集与模型须以相同凭证化协议在 PhysioNet 分享(官方 MIMIC-Ext 命名与挂载指南),不得在外部平台公开托管。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=test_df["race_group"]  # 先将 33 个取值归并为 5-6 组
)
print(frame.by_group)

已知公平性差异:Coggan et al. 2025(arXiv:2503.22781,基于 v2.2)系统分析了人口学因素与分诊级别、住院决定、停留时长的关联,发现种族、性别、语言与保险状态均与分诊严重度判定和住院率存在独立关联——分诊场景的差异不只是数据噪声,而是真实存在于诊疗流程中。使用 acuity 作为特征或标签时,这些差异会被模型继承;arXiv:2403.05235 的双队列研究进一步提示,美国人群上训练的模型直接迁移到亚洲人群时,种族变量的语义完全改变。

§7.6 数据漂移提示

  • 部署任何 MIMIC-IV-ED 训练模型前,必须认识到其训练分布停留在 2011-2019:无 COVID-19、无疫情期间就诊行为改变、无近年脓毒症与阿片管理更新。
  • 监控信号:主诉分布 PSI > 0.2、ESI 分布变化、生命体征分布 PSI > 0.1、72h 复诊基线率变化。
  • 库内漂移:2011-2019 跨度 9 年,anchor_year_group(三年区间)是唯一可用的时代代理变量;ICD-9 → ICD-10 切换点(2015-10)是编码层面的内源漂移点。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 星型 6 表均以唯一事件 ID 为行;edstays/triage 一次就诊一行
2 有唯一标识符列 subject_id / stay_id / hadm_id 三键体系
3 无 Unicode 或特殊字符 ⚠️ 结构化字段为 ASCII;chiefcomplaint 含 ___ 掩码与自由文本符号,需清洗
4 无重复行 官方按表主键(stay_id + charttime + 属性列)插入时去重;pyxis/medrecon 的"貌似重复行"为本体展开,非错误
5 缺失值已识别并编码 官方公布 triage/vitalsign 逐列缺失与脱敏删除计数表
6 标签列被明确标识 disposition / acuity 为明确靶标
7 已对罕见类别(<3%)进行分组 ⚠️ race 33 个原始取值需自行归并;ICD 长尾未分组;主诉需自行聚类
8 偏倚评估已完成 §7.1 列出 9 类偏倚与缓解措施;官方 Limitations 明确
9 有完整的数据字典 mimic.mit.edu 六表逐字段文档
10 对"信息性缺失"有明确编码解释 ⚠️ 数值列 NULL 双关(脱敏删除 vs 未记录)由设计决定,仅公布删除计数
11 数据采集设备和设置已记录 §3.9 急诊信息系统、Pyxis MedStation、ESI 体系记录完整
12 已移除完全共线性变量 ⚠️ 未执行,发布数据保留全部原始列
13 对编码的映射标准已说明 ICD-9/10(icd_version 区分)+ GSN/NDC/ETC 药物本体完整记录
14 对时间戳的处理已明确说明 日期偏移策略、triage 无时间戳、charttime 口径均有官方说明
15 训练/验证/测试划分建议已给出 ⚠️ 官方无划分且 v2.2 删除内部测试集患者;Xie 基准固定 80/20 划分社区补位
16 数据泄漏风险已被讨论 ⚠️ 官方未系统讨论;本百科 §5.3 与 §6.5 坑点 1/8 汇总社区共识
17 标签分布已被分析 §4.2 disposition/acuity 精确分布
18 选择性测量偏倚已被讨论 ⚠️ vitalsign 1-4h 信息性测量官方未讨论,社区文献有涉及
19 外部验证建议已给出 ⚠️ 官方未给出;Xie 基准明确呼吁,MC-MED/SGH-ED 为可用验证场
20 数据更新和版本信息已记录 v1.0→v2.2 release notes 完整(outtime 修复、删人说明)
21 最小必要预处理脚本已提供 ⚠️ 有官方建库与行数验证脚本,但无官方派生概念层;依赖 Xie/cavalab 社区管道
22 合规使用要求已明确 CITI 培训 + 凭证化申请 + DUA + MIMIC-Ext 派生规范
23 多模态对齐方法已说明 ⚠️ 与 CXR/ECG/主库的链接键有官方说明,但时间对齐须自行处理
24 去标识化方法已被记录 Safe Harbor + CHIL 2020 混合算法 + ___ 惯例 + 数值正则化完整记录

DAIMS 评分:19.0 / 24

评分解读良好偏上——结构与文档优秀,生态补位及时;失分集中在官方未做的派生层与划分、以及刻意保留的原始脏数据。

对你意味着什么:MIMIC-IV-ED 的 14 个 ✅ 来自其教科书级的星型设计(三键体系、六表逐字段文档、完整的 release notes 与去标识化记录),在急诊数据领域无出其右。扣分项几乎全部是"官方刻意留给研究者的自由度":无官方划分(直接用 Xie 基准的固定 80/20)、无派生概念层(用 nliulab/mimic4ed-benchmark 或 cavalab/mimic-iv-ed-epi 管道补位)、原始脏数据不代为清洗(按 §6.3 五步管道处理)。建议训练前固定执行三件事:(1) 用 Xie 固定划分或按 subject_id 分组划分;(2) 按 §6.3 管道清洗体温/疼痛/单位;(3) 经 subject_id 链接 MIMIC-IV patients 补年龄。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
SGH-ED(新加坡中央医院急诊队列,170 万+ 就诊) Singapore General Hospital 急诊住院预测与队列表型(双队列设计) AUROC + 校准 亚洲队列按独立口径报告,非直接迁移 arXiv:2403.05235 将 MIMIC-IV-ED v2.2 与 SGH-ED 并列分析,是目前最完整的跨洲对照;两大队列在年龄结构、住院率与 ESI 分布上差异显著,提示直接迁移必须重新校准
MC-MED(Stanford 多模态急诊监护库,2025) Stanford University 急诊危重预警(波形 + 结构化 + 文本多模态) AUROC 尚无公开发表的 MIMIC-IV-ED → MC-MED 迁移结果 Sci Data 12:1039(2025)发布后成为最可行的美国本土跨机构验证场;分诊、生命体征、处置字段口径与 MIMIC-IV-ED 高度对齐
MIMIC-IV 主库住院模块(库内"准外部") BIDMC 2008-2022 住院预测标签质量与下游结局一致性核查 标签一致率 N/A 经 hadm_id 链接 admissions 可交叉验证 disposition=ADMITTED 标签;住院期间诊断在 hosp 模块,ICD-9/10 混合编码需按 icd_version 分组处理
v1.0 → v2.2 版本间迁移(时代外推) BIDMC 2011-2019 Xie 基准三任务复现 AUROC 不可直接比较 Xie 固定划分基于 v1.0(448,972 就诊);v2.2 删除 22,625 个内部测试集就诊后无法 1:1 复现原划分,官方建议以 v2.2 重建队列并重新划分

诚实的空白:截至 2026-09,尚无公开发表的"在 MIMIC-IV-ED 训练、在完全独立急诊系统端到端验证"的结果——Xie et al. 2022 明确将"单中心、无外部验证"列为首要局限。这与 MIMIC-III 时代 AI Clinician → eICU 的经典案例形成鲜明对比,是急诊 AI 文献当前最大的待补缺口;对你的研究而言,这正是最容易产出增量贡献的位置。


§8 基准性能与生态

§8.1 排行榜(Xie Benchmark)

MIMIC-IV-ED 的评测事实标准由 Xie et al. 2022(Scientific Data 9:658)确立:基于 v1.0 的成人队列(441,437 次就诊)、固定 80/20 患者级划分、三任务 AUROC。官方不设排行榜,本节呈现该论文同一固定划分下的可比组数值——这是急诊 AI 领域引用最广的对照基线。

三大标准任务定义(Xie et al. 2022;代码 nliulab/mimic4ed-benchmark):

任务 定义 队列/阳性率 主指标
住院预测(Hospitalization) 分诊时点预测本次急诊后是否住院 441,437 次成人就诊,47.34% AUROC
危重结局(Critical Outcome) 院内死亡或 12 小时内转入 ICU 同队列,5.93% AUROC
72h 急诊复诊(ED Reattendance) 急诊出院后 72 小时内再次急诊就诊 同队列,3.47% AUROC

可比组排行榜(同一固定 80/20 划分,数值可直接比较)

排名 模型/评分 住院预测 AUROC 危重结局 AUROC 类型 完整引用 代码
1 MLP(多层感知机,分诊特征宽表) 0.822 0.883 机器学习 Xie F, Zhou J, Lee JW, et al. “Benchmarking emergency department prediction models with machine learning and public electronic health records.” Scientific Data 9:658 (2022). DOI: 10.1038/s41597-022-01782-9 https://github.com/nliulab/mimic4ed-benchmark
2 Gradient Boosting / Random Forest 0.819 —(原文报告与 MLP 同档) 机器学习 同上 同上
3 AutoScore(机器学习临床评分) 0.793 0.846 混合 同上 同上
4 ESI 分诊等级 0.711 0.804 临床评分 同上
5 CART 0.675 0.707 临床评分 同上
6 REMS 0.672 0.686 临床评分 同上
7 NEWS 0.581 0.634 临床评分 同上
8 NEWS2 0.563 0.616 临床评分 同上
9 MEWS 0.559 0.613 临床评分 同上

第三任务(72h 急诊复诊):最佳模型为 Gradient Boosting,AUROC 0.700——三任务中最难,也是与临床评分差距最大的方向。

读表前的三条纪律:(1) Xie 基准基于 v1.0,其"住院"口径阳性率 47.34%,与 v2.2 官方 disposition=ADMITTED 的 37.2% 口径不同(详见 §6.5 坑点 7),跨口径数值不可直接比较;(2) Xie 原文结论:Med2Vec、LSTM 等复杂模型未超过 MLP/GB 等简单模型——在急诊分诊宽表上,深度时序模型的优势并不成立;(3) 上表所有数值出自同一篇论文的同一划分,引用时请以 DOI: 10.1038/s41597-022-01782-9 为准。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
复现文献/与 Xie 基准比较 nliulab/mimic4ed-benchmark 固定划分 + 三任务 AUROC 74 次引用的可比基线,审稿人最认可的口径
快速出基线(CPU) §6.1 pandas 管道 + Logistic Regression / XGBoost 0.5 GB 全量 CSV 单机可跑,1 小时内出结果
验证新时序方法 vitalsign 1-4h 序列 + 分诊时点标签,按 stay_id 组织 急诊场景唯一的大规模公开时序评测台
做主诉 NLP chiefcomplaint + cavalab/mimic-iv-ed-epi 的 54 个策展指标 省去手工标注,直接对接已发表口径
做教学演示 MIMIC-IV-ED Demo(100 患者,免认证) 课堂全流程可完成,无需 CITI 培训

§8.3 官方评测协议

无官方协议。社区事实标准(Xie 体系):成人队列(≥18 岁且有 acuity 记录);分诊时点合法特征(triage 生命体征 + acuity + 到院方式,禁用 diagnosis 与就诊后期 vitalsign);固定 80/20 患者级划分;三任务统一报告 AUROC,建议附 AUPRC(危重与复诊任务阳性率低)。

数据集 关系 说明
MIMIC-IV 主库 hosp/icu 模块;经 subject_id / hadm_id / stay_id 三键联动,补年龄、住院诊断与 ICU 结局
MIMIC-CXR 姊妹模块 胸部 X 光影像库;其患者全集是 MIMIC-IV-ED 患者的子集
MIMIC-IV-ECG 姊妹模块 82,907 名 ED 患者有 ≥1 次 ED 期间心电图(JMIR Res Protoc 2025)
MIMIC-IV-ED Demo 试用版 100 名患者,免认证,v2.2 同构
MIMIC-III 前代 无独立急诊模块(急诊信息散落于主库),ED 研究应直接用本库
MC-MED 同类/验证场 Stanford 多模态急诊监护库(Sci Data 2025),跨机构外部验证首选
MIMICEL 派生 MIMIC-IV 急诊事件日志(XES 格式),流程挖掘专用

§8.5 关键论文 Top 10

  1. Johnson AEW et al. (2023), Scientific Data 10:1. “MIMIC-IV, a freely accessible electronic health record dataset.” — 主库论文,ED 模块的官方伴随引用。DOI: 10.1038/s41597-022-01899-x
  2. Xie F et al. (2022), Scientific Data 9:658. “Benchmarking emergency department prediction models with machine learning and public electronic health records.” — 三任务基准,急诊 AI 评测事实标准。DOI: 10.1038/s41597-022-01782-9
  3. Johnson A, Bulgarelli L, Pollard T, Celi LA, Mark R, Horng S (2023), PhysioNet. “MIMIC-IV-ED” (version 2.2) — 数据集本体,版本引用入口。DOI: 10.13026/5ntk-km72
  4. Johnson A, Bulgarelli L, Pollard T, et al. (2020), CHIL. “Deidentification of free-text medical records using pre-trained bidirectional transformers.” — 主诉文本去标识算法。DOI: 10.1145/3368555.3384451
  5. Horng S et al. (2017), PLOS ONE 12(4):e0174708. “Creating an automated trigger for sepsis clinical decision support at emergency department triage using machine learning.” — BIDMC 急诊分诊脓毒症预警,本库数据源的临床研究前史(末位作者 Horng 即 MIMIC-IV-ED 临床 PI)。
  6. Coggan J et al. (2025), arXiv:2503.22781. 人口学因素与分诊/住院/急诊停留时长关联分析;配套 cavalab/mimic-iv-ed-epi 管道(主诉 → 54 个策展二值指标)。
  7. Kansal A et al. (2025), Scientific Data 12:1039. MC-MED — Stanford 多模态急诊监护库,外部验证对照。DOI: 10.1038/s41597-025-01039-y
  8. MIMIC-IV-ECG 模块论文 (2025), JMIR Research Protocols, e80569. — 确立 82,907 名 ED 患者的心电联动子集,多模态急诊研究入口。
  9. arXiv:2403.05235(MIMIC-IV-ED v2.2 + SGH-ED 双队列表型分析). — 跨洲急诊队列对照与 v2.2 人口统计基准值(eTable 1)来源。
  10. Goldberger AL et al. (2000), Circulation 101(23):e215-e220. PhysioNet 平台论文——DUA 硬性要求的伴随引用。

§8.6 社区活跃度

维度 数据
OpenAlex 引用(Xie 基准论文) 74 次(截至 2026-08 快照)
OpenAlex 引用(MIMIC-IV 主论文) 3,186 次(截至 2026-08 快照;ED 模块使用多经主论文归集)
数据集 DOI 引用(DataCite 口径) 29 次(截至 2026-08 快照)
PhysioNet 认证用户 30,000+(全平台口径,截至 2026-09,估算)
基准代码仓库 nliulab/mimic4ed-benchmark(含三任务全流程与固定划分)
教学采用 MIMIC 官方 workshop、MIT HST 系列课程、多所高校医疗 AI 课程
云端可用性 BigQuery physionet-data.mimiciv_ed(全库)与 physionet-demo.mimiciv_ed(Demo)

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09,约) 为什么值得关注
MIT-LCP/mimic-code 官方代码 https://github.com/MIT-LCP/mimic-code 2,600+ / 800+ 官方社区仓库:mimic-iv-ed 建库脚本 + 行数验证脚本 + BigQuery 视图
nliulab/mimic4ed-benchmark 基准套件 https://github.com/nliulab/mimic4ed-benchmark 活跃 Xie 基准全流程:队列构建、特征工程、三任务训练与固定 80/20 划分
cavalab/mimic-iv-ed-epi 工具库 https://github.com/cavalab/mimic-iv-ed-epi 活跃 主诉 → 54 个策展二值指标 + 人口学联动分析(Coggan et al. 2025)
MIMICEL 派生数据 https://physionet.org/ (PhysioNet 检索 MIMICEL) 急诊事件日志(XES),流程挖掘与运营研究的现成入口
MIMIC-IV-ED Demo 教学数据 https://physionet.org/content/mimic-iv-ed-demo/2.2/ 100 患者免认证,管道调试与课程首选
BigQuery mimiciv_ed 云端数据 physionet-data.mimiciv_ed 免下载全库查询,与 MIMIC-IV 主库同项目联动
MC-MED 同类数据 https://physionet.org/ (DOI: 10.13026/jz99-4j81) Stanford 多模态急诊库,外部验证对照场

§9 相关资源与引用

官方资源

BibTeX 引用(三件套 + 基准,DUA 硬性要求)

% 1) 数据集本体(PhysioNet 版本引用,按实际使用版本替换 note)
@article{PhysioNet-mimicived-2.2,
  author={Johnson, Alistair and Bulgarelli, Lucas and Pollard, Tom and Celi, Leo Anthony and Mark, Roger and Horng, Steven},
  title={{MIMIC-IV-ED}},
  journal={{PhysioNet}},
  year={2023},
  note={Version 2.2},
  doi={10.13026/5ntk-km72}
}

% 2) MIMIC-IV 主库论文(ED 模块的官方伴随引用)
@article{johnson2023mimic,
  title={MIMIC-IV, a freely accessible electronic health record dataset},
  author={Johnson, Alistair EW and Bulgarelli, Lucas and Shen, Lu and others},
  journal={Scientific Data},
  volume={10},
  pages={1},
  year={2023},
  doi={10.1038/s41597-022-01899-x}
}

% 3) PhysioNet 平台(官方要求同时引用)
@article{goldberger2000physionet,
  title={PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals},
  author={Goldberger, Ary L and Amaral, Luis AN and Glass, Leon and Hausdorff, Jeffrey M and Ivanov, Plamen Ch and Mark, Roger G and Mietus, Joseph E and Moody, George B and Peng, Chung-Kang and Stanley, H Eugene},
  journal={Circulation},
  volume={101},
  number={23},
  pages={e215--e220},
  year={2000}
}

% 4) 如使用 Xie 基准的三任务/固定划分
@article{xie2022benchmarking,
  title={Benchmarking emergency department prediction models with machine learning and public electronic health records},
  author={Xie, Feng and Zhou, Jun and Lee, Jin Wee and others},
  journal={Scientific Data},
  volume={9},
  pages={658},
  year={2022},
  doi={10.1038/s41597-022-01782-9}
}

% 5) 如使用 chiefcomplaint 自由文本(去标识算法)
@inproceedings{johnson2020deidentification,
  title={Deidentification of free-text medical records using pre-trained bidirectional transformers},
  author={Johnson, Alistair EW and Bulgarelli, Lucas and Pollard, Tom J and others},
  booktitle={Proceedings of the ACM Conference on Health, Inference, and Learning (CHIL)},
  year={2020},
  doi={10.1145/3368555.3384451}
}

许多论文漏引第 1、3 条——这违反 DUA。MIMIC-IV-ED 无独立期刊论文,数据集 DOI(第 1 条)+ 主库论文(第 2 条)+ 平台(第 3 条)缺一不可;投稿前请逐项核对。

教程与学习资源

原始论文

  1. Johnson AEW et al. (2023). “MIMIC-IV, a freely accessible electronic health record dataset.” Scientific Data 10:1. DOI: 10.1038/s41597-022-01899-x.
  2. Xie F et al. (2022). “Benchmarking emergency department prediction models with machine learning and public electronic health records.” Scientific Data 9:658. DOI: 10.1038/s41597-022-01782-9. PMID: 36302776. PMCID: PMC9610299.
  3. Johnson A, Bulgarelli L, Pollard T, et al. (2020). “Deidentification of free-text medical records using pre-trained bidirectional transformers.” CHIL 2020. DOI: 10.1145/3368555.3384451.
  4. Goldberger AL et al. (2000). “PhysioBank, PhysioToolkit, and PhysioNet.” Circulation 101(23):e215-e220.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索 + 7 次官方页面抓取:行数逐表复核、版本史、Xie 基准数值、人口统计、OpenAlex 引用快照

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 PhysioNet 官方页面、mimic.mit.edu 官方文档、Xie 2022 基准论文与社区资源中整理结构化信息;(2) 生成 §6 的 SQL/Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. PhysioNet MIMIC-IV-ED v2.2 官方页面与 release notes(v1.0/v2.0/v2.2)
  2. mimic.mit.edu 官方文档(MIMIC-IV ED 模块六表逐字段说明与缺失统计表)
  3. Xie F et al. (2022), Scientific Data 9:658(DOI: 10.1038/s41597-022-01782-9;PMC9610299 全文镜像)
  4. Johnson AEW et al. (2023), Scientific Data 10:1(DOI: 10.1038/s41597-022-01899-x)
  5. Johnson A, Bulgarelli L, Pollard T, et al. (2020), CHIL(DOI: 10.1145/3368555.3384451)
  6. MIT-LCP/mimic-code GitHub 仓库(mimic-iv-ed 建库与行数验证脚本)
  7. nliulab/mimic4ed-benchmark GitHub 仓库(三任务与固定划分)
  8. cavalab/mimic-iv-ed-epi(Coggan et al. 2025, arXiv:2503.22781)
  9. arXiv:2403.05235 eTable 1(v2.2 人口统计双队列基准值)
  10. medRxiv 2025.11.12.25340098(成人队列停留时长与 ESI 分布复核)
  11. MIMIC-IV-ECG 模块论文(JMIR Research Protocols 2025, e80569;ED 心电联动 82,907 人)
  12. Kansal A et al. (2025), MC-MED, Scientific Data 12:1039(DOI: 10.1038/s41597-025-01039-y)
  13. MIMICEL PhysioNet 页面(急诊事件日志派生集)
  14. OpenAlex 引用快照(数据集 DOI / 主论文 / Xie 基准,截至 2026-08)
  15. PhysioNet Credentialed Health Data License 1.5.0 全文

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、人群统计、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(六表行数、版本矩阵) 千方病案医学编辑部 与 PhysioNet 官方页面及 mimic.mit.edu 文档交叉比对 ✅ 已验证
§4 数据结构(星型三键、DAIMS 字段字典) 千方病案医学编辑部 mimic.mit.edu 官方表文档交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与 mimic-code、nliulab 基准管道比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与 Xie 2022 原文及 OpenAlex 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集