MIMIC-IV — 重症监护医疗数据库 AI-Ready Wikipedia

MIMIC-IV:36.5 万患者 × 2008-2022 年的急诊与 ICU 全景——重构 schema 时代的医疗 AI 主力语料库

来源 https://physionet.org/content/mimiciv/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 34
MIMIC-IV — 重症监护医疗数据库 AI-Ready Wikipedia

信息速览

数据集名称MIMIC-IV — 重症监护医疗数据库 AI-Ready Wikipedia
数据类型364,627 患者,546,028 住院,94,458 ICU 停留,2008-2022,hosp+icu 双模块
规模364,627 名患者(v3.1;其中 223,452 名有住院记录)
接入方式https://physionet.org/content/mimiciv/
AI 就绪度

INFOBOX

属性 内容
名称 MIMIC-IV(Medical Information Mart for Intensive Care IV)
维护方 MIT Laboratory for Computational Physiology(MIT-LCP)/ PhysioNet
发布 v1.0(2020)→ v2.0(2022-06)→ v2.1(2022-11)→ v2.2(2023-01)→ v3.0(2024-07)→ v3.1(2024-10,现行)
数据时段 2008-2022(v3.x;v2.x 为 2008-2019)
规模 364,627 患者 / 546,028 住院 / 94,458 ICU 停留(v3.x;223,452 人有住院,141,175 人仅 ED)
模块 hosp(医院级 22 表)+ icu(床旁 9 表);Note/ED/CXR 为独立关联项目
结构演进 三范式(III)→ 少表非规范化+模块化+星型 schema
关键新数据 eMAR 给药记录、参考区间、poe 医嘱、omr、ICD-10、院外死亡 1 年
格式 CSV(gzip)+ PostgreSQL/MySQL/BigQuery 脚本(mimic-code)
访问 Credentialed Access(CITI + DUA 1.5.0)
DOI 10.13026/kpb9-mt58(v3.1);10.13026/hxp0-hg59(v3.0)
论文 Johnson et al., Scientific Data 10:1 (2023),DOI 10.1038/s41597-022-01899-x
Demo MIMIC-IV Demo v2.2(100 患者,ODbL,10.13026/dp1f-ex47)
平台 PhysioNet / mimic.mit.edu 文档

§0 E-E-A-T 信任声明与免责声明

  • 核查路径:本文数字取自 PhysioNet 官方条目页(mimiciv 主页 release notes 链 v1.0→v3.1)与官方论文(Scientific Data 10:1, 2023)双源交叉;表级变更以 mimic.mit.edu 官方 whatsnew 为准;LLM 合规条款以 PhysioNet 2025-09-24 官方公告为准。
  • 版本纪律:MIMIC-IV 是持续更新的活数据库(对比 III 的冻结)——本文所有行数严格绑定版本号;引用任何 MIMIC-IV 数字前先问"哪个版本"。
  • 口径纪律:36.5 万"患者"中仅 22.3 万有住院——ED-only 人群占近四成;任何"队列规模"声明必须先声明入组口径(本条目 §1.7 口径速记)。
  • 免责:本条目面向 AI 工程师与临床信息学家,不构成临床建议;访问与使用须遵守 PhysioNet Credentialed Health Data License 1.5.0 及 DUA(含 2025-09 LLM 使用条款)。
  • 哀悼声明:MIMIC 系列奠基人 Roger G. Mark 教授于 2026-07-16 逝世(享年 87 岁);其"数据应为全球研究社群所用"的理念是包括本条目在内的一切 MIMIC 生态工作的精神源头。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:MIMIC-III 的继任者与现任"记录视角主库"——2008-2022 年 BIDMC 急诊+ICU 的去标识化 EHR,hosp/icu 双模块现代 schema。
  • 关键数字:364,627 患者 / 546,028 住院 / 94,458 ICU 停留;ICU 患者院内死亡率 11.6%、1 年死亡率 38.6%。
  • 与 III 的三大差异:schema 现代化(少表+模块化+ICD-10)、无新生儿无双码(CareVue 时代结束)、持续更新(数据推进到 2022)。
  • 入口代价:与 III 相同的 CITI+DUA 流程;但表更少、文档更新、mimic-code 迁移完毕——上手实际更快。
  • 一句话:新研究默认从 MIMIC-IV 开始;MIMIC-III 保留给历史可比性与 2001-2007 年代研究。

§1.1 摘要

MIMIC-IV 是 MIT 实验计算生理学实验室维护的第四代公开急危重症数据库,收录 2008-2022 年波士顿 BIDMC 医院急诊科与 ICU 的去标识化临床数据。现行版本 v3.1(2024-10)包含 364,627 名患者、546,028 次住院、94,458 次 ICU 停留;患者构成是"急诊+ICU"混合总体——223,452 人有住院记录,141,175 人仅在急诊就诊。数据库采用 hosp(医院级)+ icu(床旁 MetaVision 系统) 双模块架构:hosp 承载实验室(含参考区间)、微生物、给药(处方+pharmacy+eMAR 条码记录)、医嘱(poe)、计费编码(ICD-9/10 双版本)与患者流转;icu 以星型 schema 承载床旁观测、输液与操作。相较 MIMIC-III 的三大进化——schema 现代化(去审计字段、去 CareVue 双码、I→ICD-10)、anchor 年龄/年份去标识机制、持续数据更新——使它成为当前医疗 AI 研究的默认主战场。

§1.2 战略价值

  1. schema 现代化的红利:26 表(III)→ 模块化 31 表但心智负担更低——无双码映射、无双系统分叉、ICD-9/10 并轨、实验室自带参考区间、给药有 eMAR 条码级真值。迁移 III 老项目的第一个体感是"WHERE 条件变短了"。
  2. ED+ICU 的连续谱:III 只收 ICU 患者的住院;IV 收 ED 总体(含未住院者)——ED 分诊、急门诊衔接、院前-院内过渡研究第一次有了大规模公开数据。
  3. 给药数据的代际跨越:eMAR(2014-2016 年部署的条码扫描系统)提供"给药执行"的条码级真值,配合 prescriptions(医嘱)、pharmacy(配方)、poe(医嘱录入)构成四表药物证据链——药物流行病学的测量误差比 III 时代低一个量级。
  4. 持续更新的活资产:数据推进到 2022(含 COVID 疫情年段)、provider 标识、1 年院外死亡——每 1-2 年一次版本升级的节奏使其保持"当代诊疗惯例"的代表性。
  5. 生态迁移完成:mimic-code 概念 SQL 大部分已迁移至 IV、BigQuery 云路径、OMOP 转换工具——从 III 迁移或从零开始的总成本都处于历史最低点。

§1.3 同类数据集横向对比

数据集 时段 患者规模 模块结构 相对优势
MIMIC-III(490 条) 2001-2012 46,520(成人 38,597) 26 表单层 历史可比性、benchmark 生态
MIMIC-IV(本条) 2008-2022 364,627 hosp+icu 模块化 现代 schema、eMAR、ICD-10、持续更新
eICU-CRD 2014-2015 ~139,367 多中心星型 多中心外推
AmsterdamUMCdb 2003-2016 ~23,106 欧洲概念体系 欧洲诊疗惯例
HiRID 2013-2015 ~33,749 停留 高频参数 2 分钟级床旁粒度

结论:MIMIC-IV 是"默认起点";III 是"历史纵深";eICU 是"外推验证"——三者构成现代 ICU 数据研究的基础设施三角。

§1.4 版本时间轴

版本 发布 关键变化 患者数
v1.0 2020 初版:core+hosp+icu 三模块;2008-2019 —
v2.0 2022-06-12 core 移除(并入 hosp);新生儿移除;院外死亡/omr/输液细节加入 315,460
v2.1 2022-11-16 移除内部测试集(永久 holdout) 299,712
v2.2 2023-01 provider 标识(caregiver/provider);emar hadm 修复(~2.5%) 299,712
v3.0 2024-07 +2020-2022 数据;语言/保险标准化;院外死亡延至 1 年 364,627
v3.1(现行) 2024-10 修复 itemid 回归 bug(labevents 对齐 v2.2);孤儿 ID 清理 364,627

⚠️ v3.0 发布日期存在两处官方文本(July 19 与 July 23),以主页 release notes 的 July 23 为主(存照 §10.1-A)。
⚠️ v2.1 起有永久保留测试集——你下载的版本已剔除该子集;跨版本对比行数时先对齐这一变更。

§1.5 应用场景矩阵

场景 推荐度 用到的资源 关键注意
ICU 死亡/恶化预测 ★★★★★ icustays/chartevents/labevents anchor_age 口径;>89 截断
脓毒症/AKI 队列 ★★★★★ mimic-code 已迁移 SQL Sepsis-3 定义可直接复用
药物流行病学 ★★★★★ prescriptions+pharmacy+emar+poe 四链 eMAR 2016 后全覆盖
ED 研究/拥挤/分诊 ★★★★★ ed 模块(MIMIC-IV-ED)+仅 ED 人群 ED-only 人群 14.1 万
临床 NLP/LLM ★★★★ MIMIC-IV-Note(独立项目) 同 shift 对齐;DUA 下本地 LLM
影像关联 ★★★★ MIMIC-CXR(2011-2016 ED 患者子集) 选择偏差显式声明
住院再入院/LOS ★★★★ admissions/transfers 计划性 vs 紧急再入
跨库联用(III/波形) ★★★ 无患者级键接 概念级对齐(见 490 条 §4.6)

§1.6 组件全景:双模块 31 表

  • hosp 模块(医院级 EHR,22 表):患者追踪(patients/admissions/transfers/services);实验室(labevents/d_labitems——含参考区间与标本优先级);微生物(microbiologyevents);药物四链(prescriptions 医嘱 → pharmacy 配方 → emar/emar_detail 条码给药 → poe/poe_detail 医嘱录入);计费(diagnoses_icd/procedures_icd 双 ICD 版本、drgcodes、hcpcsevents/d_hcpcs);在线病历(omr——身高体重等);医护标识(provider)。
  • icu 模块(MetaVision 床旁,9 表):星型 schema——icustays(94,458 停留)+d_items(概念字典)居中,六个 events 表(chartevents/datetimeevents/inputevents/ingredientevents/outputevents/procedureevents)+caregiver(床旁记录者)环绕。
  • 独立关联项目:MIMIC-IV-Note(出院小结+放射报告)、MIMIC-IV-ED(急诊,本系列 489 的 MIMICEL 上游)、MIMIC-CXR(胸片,2011-2016)——经 subject_id + 同 date shift 关联。
  • 非规范化哲学:官方明确"不做数据清洗以反映真实临床数据"——MIMIC-IV 是"原始但结构清晰"的数据库,清洗是研究者的责任。

§1.7 四层口径速记

遇到 MIMIC-IV 数字先问"哪层口径":

  • 364,627:patients 表总人数(v3.x)=ED∪ICU 全体。
  • 223,452:有住院记录者(admissions 至少一行)——"住院队列"的天然边界。
  • 141,175:仅 ED 未住院者——ED-only 研究的人群。
  • 94,458 / 50,920:ICU 停留数(v3.x)/ ICU unique patients(v2.2 口径 50,920,v3.x 约相应增长)。
  • 版本乘数:v2.0→v2.1(holdout 移除)→v2.2→v3.0(+3 年数据)每次行数都变——引用不带版本号的 MIMIC-IV 行数是硬伤。
  • 90 岁陷阱:anchor_age=91 是 HIPAA 归并值——“91 岁"实为”>89 岁"全体(§6.5 坑点 2)。

§1.8 访问方式速记

  1. PhysioNet 账号 → CITI “Data or Specimens Only Research” → DUA 1.5.0 → 审批(约 1 周)。
  2. 下载:PhysioNet 网页(hosp/icu 两个 gzip CSV 包)或 AWS S3;BigQuery 云路径(v2.2 起)。
  3. 导入:mimic-code 官方脚本(PostgreSQL 首选);mimic-iv 建库约束脚本同步发布。
  4. 最小验证:SELECT COUNT(*) FROM mimiciv_hosp.patients;(v3.x 应为 364,627)。
  5. 想先试手:MIMIC-IV Demo(100 患者,开放访问,本系列后续条目)或 mimic-code 的 demo 路径。

§1.9 独特视角:医疗数据的"操作系统升级"

如果说 MIMIC-III 是医疗 AI 的 DOS(奠定一切但架构古老),MIMIC-IV 就是 Windows 时代的重装:不是修修补补,而是保留数据资产、重构系统内核——表收敛、模块化、键名规范化(icustay_id→stay_id)、概念现代化(ICD-10)、双系统归一(去 CareVue)。这次重装的战略意义常被低估:它让"复制粘贴研究代码"从 III 到 IV 变成低成本的语法迁移而非考古工程——mimic-code 迁移+官方对照文档(whatsnew)+Demo 沙盒,三代同构的学习链路在开源数据世界里几乎是教科书级的迁移管理范例。理解 IV 的 schema 设计(为什么模块化、为什么 star schema、为什么 anchor 机制),就是在学习"临床数据仓库应该怎么设计"——这比任何一门数据建模课都具体。

§1.10 用户画像:谁在使用 MIMIC-IV

  • 医疗 AI 研究者:默认主战场——死亡/恶化/LOS/再入院/表型的基准实验都在 IV 上做现代化重做(III 基准的迁移阵地)。
  • 临床信息学家:schema 设计范本——模块化+星型 schema+anchor 去标识是"临床数据仓库怎么建"的教科书答案。
  • 数据工程师:建库/血缘/版本治理的实战认知(mimic-code 建库脚本+公告订阅+DUA 流程工程化)。
  • 药物流行病学家:四链药物数据+参考区间——暴露测量误差可控的真实世界证据源。
  • LLM 工程师:Note 模块+本地部署合规栈——临床文本任务的合规训练/评估场(§7.3/§7.14)。
  • 政策与治理研究者:LLM 条款(2025-09)、Ext 规范(2024-04)、holdout 制度——数据治理的活教材。

§2 医学与科学背景

§2.1 从 III 到 IV:为什么必须重构

MIMIC-III 的十年成功暴露了三处架构债:①26 表单层无模块区分——新用户难以判断"哪张表来自哪个系统、覆盖哪个时段";②CareVue/MetaVision 双系统并存——itemid 双码映射是全社区重复支付的"税";③单一年份窗(2001-2012)随时间流逝失去当代性。MIMIC-IV 的重构逐一回应:模块化标注数据血缘、CareVue 退役(2008 后本就不存在)、持续吸收新年份。官方"acquisition→preparation→deidentify"三步构建框架(v1.0 页面原文)——制备(非规范化+去审计)而非清洗——是理解其数据哲学的钥匙:数据库负责"结构诚实",研究负责"内容质检"。

§2.2 模块化的数据血缘语义

hosp/icu 的划分不是任意的文件夹整理,而是数据源声明:hosp 表来自医院级 EHR(覆盖整个住院时段),icu 表来自 ICU 临床信息系统(仅覆盖 ICU 停留时段)。官方文档的示例:chartevents 只在 ICU 内有数据,labevents 覆盖整个住院——研究"住院期间某指标"却只查 icu 模块是新手最常见的覆盖性错误。推论:任何变量选择都先问"这个表的数据在哪个时段存在"——这决定了特征窗口的设计空间。

§2.3 ED+ICU 混合总体的研究语义

MIMIC-IV 的患者构成是三次抽样的叠加:ED 总体(36.5 万)⊇ 住院总体(22.3 万)⊇ ICU 总体(9.4 万停留)。三个研究设计后果:①ED 研究(分诊/拥挤/离院)有了大样本,但必须显式排除或包含"后来住院"的患者;②住院研究自动包含"ED 转入"的入院(admission_type 可辨);③ICU 研究与 III 时代的口径可比性需要重新校准(入组规则不同:III 是 ICU 停留驱动,IV 是 ED/ICU 双入口)。"患者是谁"在 MIMIC-IV 里是研究者自己定义的——这既是自由也是责任。

§2.4 anchor 机制:去标识化与可用性的平衡术

日期偏移破坏绝对时间后,"患者多大年纪/哪年看的病"如何回答?MIMIC-IV 的答案是一组锚点:anchor_year(去标识后的某年,如 2158)+anchor_year_group(该去标识年对应的真实三年窗,如 2011-2013)+anchor_age(anchor 年的年龄)。三件套让研究者可以:算出任何时刻的年龄(anchor_age+年差)、把就诊序列映射到真实日历窗(3 年精度——足够流行病学分层,不足以泄露身份)。>89 岁归并为 91 是 HIPAA 的年龄上限要求——高龄研究的分辨率天花板由此而来。这套机制在学术发表中被称为"可用的去标识化"的典范折中。

§2.5 药物四链:从医嘱到条码的证据阶梯

MIMIC-IV 的药物数据是四层证据链,每一层回答不同的问题:

层 表 回答的问题 语义
医嘱 prescriptions 医生开了什么? 意图
配方 pharmacy 药房如何调配? 制剂细节(浓度/途径/频次)
录入 poe/poe_detail 医嘱何时录入系统? 流程时刻
执行 emar/emar_detail 药是否真的给了患者? 条码级真值

eMAR(2014-2016 部署)要求护士扫描患者腕带与药品条码——2016 年后全部住院应有 emar 记录;emar_detail 把一次给药拆到每个剂次扫描(200mg 给药=2×100mg 剂次+1 主记录三行)。药物暴露研究(尤其剂量-反应)应尽量用 emar 而非 prescriptions——"开了"与"给了"之间的差距正是 III 时代无法测量的误差源。

§2.6 参考区间列:实验室数据的隐性升级

labevents 新增 ref_range_lower/ref_range_upper 列——每条检验结果附带当时、该医院、该项目的参考区间。三个研究价值:①异常判定不再依赖外部指南(“该医院该时刻认为什么是正常”);②区间漂移本身可研究(检验方法学变化的历史痕迹);③与 flag 类指标(III 时代的 abnormal 标记)相比粒度更细。用法提醒:参考区间随年龄性别方法学变化——跨时间合并"异常率"时先检查区间一致性。

§2.7 ICD-10 双版本并轨

diagnoses_icd/procedures_icd 同时含 ICD-9 与 ICD-10(icd_version 列区分)——BIDMC 于 2015 年末-2016 年初随美国全国要求切换 ICD-10。研究设计三选一:①icd_version=9/10 分层分析;②用映射表(如 CCS 聚类)统一;③只研究切换后年段。直接把 icd_code 当字符串全量统计是新手错误——9/10 编码体系不兼容(414.01 vs I25.10 描述同一疾病但字符串无关)。mimic-code 的概念定义 SQL 已处理双版本——优先复用。

§2.8 provider 标识:医护维度的打开

v2.2 新增两层医护标识:icu 模块 caregiver_id(MetaVision 记录者)与 hosp 模块 provider(admit_provider_id/enter_provider_id/order_provider_id 等情境化字段)。与 III 的 caregivers 表(仅 ICU)相比,覆盖面扩展到医院级医嘱流。研究语义:医嘱-执行-记录的行为链可解析(谁下的医嘱、谁录的给药);组织挖掘/工作流研究第一次在 hosp 侧可行。伦理边界同 III:脱敏 ID 只可做角色/行为聚合分析,禁止任何形式的个体识别。

§2.9 院外死亡窗口的扩展语义

v3.0 把院外死亡(SSA 数据源)跟踪窗口延至出院/离院后 1 年——30 天/90 天/1 年死亡率成为可直接计算的官方口径(v2.x 时代的窗口更短)。Sci Data 论文 Table 1 的 1 年死亡率:住院患者 24.6%、ICU 患者 38.6%——与院内死亡率(2.1%/11.6%)的巨大落差提示:重症研究的长期随访价值(出院≠脱离危险)。生存分析中该窗口的删失处理:1 年窗口外死亡不可见——研究设计时把随访截止写成显式参数。

§2.10 LLM 时代的第一合规数据集

PhysioNet 2025-09-24 官方公告确立了 MIMIC 数据与 LLM/在线服务的使用边界:DUA 禁止把受控数据传输给第三方服务(含 API 调用)——要求零数据保留、不用于训练、无人工审核;服务策略"不明或无法验证时不得使用";强烈推荐本地部署 LLM。这份公告把模糊地带(“我就发一条匿名片段问一下 GPT”)明确划为违规。对研究设计的实际影响:临床 NLP/LLM 研究的算力预算必须包含本地部署(8B-70B 级模型+推理卡);云端 API 路线只剩"已签 BAA+零保留验证"的窄门。MIMIC-IV 由此成为"LLM 时代第一合规数据集"——它的合规文档密度本身就是数据治理的教学样本。

§2.11 从数据到证据:MIMIC-IV 研究的证据层级

把 MIMIC-IV 上能产出的研究按证据强度排序:①描述性流行病学(官方 Table 1 层面——基线刻画与队列画像);②关联研究(暴露-结局回归——四链药物数据让暴露测量接近前瞻级);③预测建模(死亡/恶化/LOS——基准生态核心地带,holdout 制度提升可信度);④因果推断(时间精度支持目标试验模拟,混杂控制仍靠研究设计);⑤方法学基础设施研究(基准协议/公平性审计/LLM 评估集)。每一层消费同一份数据,但对版本纪律与口径纪律的要求递增——研究设计第一步是选对层级,再选口径。

§3 数据集规格

§3.1 规格总表

维度 规格
全称 MIMIC-IV(Medical Information Mart for Intensive Care IV)
版本 v3.1(2024-10,现行);数据时段 2008-2022
中心 单中心:BIDMC(波士顿)
患者构成 364,627 总患者 = 223,452 有住院 + 141,175 仅 ED
住院/停留 546,028 住院;94,458 ICU 停留
模块 hosp(22 表)+ icu(9 表);Note/ED/CXR 独立关联
ICU 人口学 mean 年龄 64.7 (16.9);女性 44.2%;院内死亡 11.6%;1 年死亡 38.6%(v2.2 论文口径)
药物数据 prescriptions + pharmacy + emar/emar_detail + poe 四链;eMAR 2016 后全覆盖
编码 ICD-9+ICD-10 双版本(icd_version);DRG;HCPCS
实验室 labevents 含参考区间(ref_range_lower/upper)、标本优先级
死亡随访 院外死亡至出院/离院后 1 年(v3.0 起)
访问 Credentialed(CITI+DUA 1.5.0)
DOI 10.13026/kpb9-mt58(v3.1)
Demo MIMIC-IV Demo v2.2(100 患者,ODbL)

§3.2 数据发布口径地图

版本行数对照表(patients/admissions/icustays):

版本 patients admissions icustays 说明
v2.0 315,460 454,324 76,943 含后续被 holdout 的患者
v2.1/v2.2 299,712 431,231 73,181 移除永久测试集后
v3.0/v3.1 364,627 546,028 94,458 +2020-2022 年数据

患者构成(v3.0,官方原文数字):364,627 总;223,452 有住院;141,175 仅 ED(transfers 可验证)。版本不一致是 MIMIC-IV 文献数字冲突的第一大来源——引用前先对齐版本。

§3.3 DAIMS 数据AI就绪度评估

维度 评分 说明
机器可读性 9/10 模块化+星型 schema+无双码;CSV/云双路径
文档完备性 9.5/10 mimic.mit.edu 持续更新;官方 whatsnew 逐表对照;mimic-code 迁移完成
数据质量 7/10 不清洗原则保留真实噪声;但 eMAR/参考区间/poe 提升了关键子域的测量质量
语义标准化 7.5/10 ICD-10 并轨+LOINC 对齐+保险分类标准化(v3.0);私有字典仍在
时间语义 6.5/10 date shift 依然破坏绝对时间;anchor 三件套部分补偿;同 shift 跨模块对齐是亮点
可复现性 9/10 Demo 沙盒+官方校验脚本+holdout 永久化(防测试集污染)
合规摩擦 中 获取同 III;LLM/API 条款收紧(2025-09 公告)需纳入流程
综合 8.1/10 当前公开临床 EHR 数据库中 AI-Ready 综合分最高梯队

§3.4 存储与计算需求

  • 磁盘:CSV 压缩包约 10-15 GB;PostgreSQL 导入后约 100-150 GB 级(v3.x,含索引)——比 III 的 47 GB 翻倍以上,预留 200 GB 稳妥。
  • 导入:mimic-code 官方脚本;单机 4-8 小时(hosp 大表为主);并行化脚本社区有成熟方案。
  • 云路径:BigQuery(mimiciv_hosp/mimiciv_icu 数据集——注意升级节奏,2024 年秋曾停留在 v2.2);AWS Open Data。
  • 内存:常规分析 16 GB 起;chartevents 全表扫描型查询建议 32 GB 或走 SQL 下推。
  • CI 集成:MIMIC-IV Demo(100 患者)承担冒烟测试角色(参照 491 条目的切换协议)。

§3.5 获取通道

  1. PhysioNet 官方:CITI+DUA 后网页下载 hosp/icu 两个压缩包(gzip CSV,RFC 4180)。
  2. AWS S3:ARN 授权模式(同 III 流程);适合云原生工作流。
  3. BigQuery:官方数据集(mimiciv_hosp/mimiciv_icu)——版本升级有滞后,正式研究核对版本。
  4. MIMIC-IV Demo:100 患者开放子集(ODbL,10.13026/dp1f-ex47)——管线预演/教学。
  5. MEDS 格式:MIMIC-IV-Ext-MEDS(官方转换的 Medical Event Data Standard 版本)——时序基础模型训练的现代格式入口。

§3.6 口径对齐表

想回答的问题 用的口径 数字
总共多少人? patients 表(v3.x) 364,627
多少人住过院? admissions 非空 223,452
多少人只看了急诊? transfers 验证 ED-only 141,175
多少 ICU 停留? icustays(v3.x) 94,458
ICU 死亡率? 院内口径(v2.2 论文) 11.6%
ICU 患者 1 年死亡率? 院外窗口(v3.0 起官方 1 年) 38.6%
"MIMIC-IV 有 30 万人"对吗? 版本模糊语 v2.x≈30 万;v3.x≈36.5 万

§3.7 版本选择纪律

  • 新研究默认 v3.1:最大窗口(2008-2022)+bug 修复(itemid 回归)+1 年死亡窗口。
  • 与旧版对比研究:注意三处断裂——v2.1 的 holdout 移除(跨版本患者集不同)、v3.0 的 itemid 波动(v3.1 已修复但 v3.0 数据有污染)、v3.0 的字段标准化(语言/保险分类变了,跨版本字段统计不可直接比)。
  • 引用格式:“MIMIC-IV (version 3.1)” + DOI 10.13026/kpb9-mt58 + Johnson et al. 2023 Sci Data 论文 + PhysioNet 标准引用。
  • 升级公告订阅:PhysioNet 条目页顶部会挂 BigQuery 升级/bug 修复公告——每次升级后重跑行数验证。

§3.8 hosp 模块逐表清单

表 职能 关键字段/说明
patients 患者主表 anchor_age/anchor_year/anchor_year_group/gender/dod
admissions 住院 admittime/dischtime/admission_type/insurance/language/hospital_expire_flag
transfers 院内流转 transfer_id/careunit/eventtype
services 医疗 team curr_service
labevents 实验室 itemid/ref_range_lower/upper/priority/comments
d_labitems 检验字典 label/loinc_code
microbiologyevents 微生物 micro_specimen_id/test_name/org_name
prescriptions 药嘱 drug/starttime/stoptime/doses_per_24_hrs
pharmacy 配方 浓度/途径/频次细节
emar / emar_detail 给药执行 条码扫描记录;detail 一行一剂次
poe / poe_detail 医嘱录入 order_provider_id
diagnoses_icd 诊断编码 icd_code+icd_version(9/10)
procedures_icd 操作编码 同上
drgcodes DRG 分组 结算语义
hcpcsevents / d_hcpcs HCPCS 替代 III 的 cptevents
omr 在线病历 身高体重等门诊测量
provider 医护标识 provider_id(医院级脱敏)

§3.9 icu 模块逐表清单

表 职能 关键字段/说明
icustays ICU 停留主表 stay_id/intime/outtime/los/first_careunit
d_items 概念字典 itemid/label/linksto(无双系统,无 <220000 旧码)
chartevents 床旁观测 stay_id/itemid/charttime/valuenum
datetimeevents 日期型观测 透析时刻等
inputevents 输液 starttime/endtime/rate/amount(原 inputevents_mv)
ingredientevents 输液成分 药物成分级拆分(IV 新增)
outputevents 出量 尿量等
procedureevents 床旁操作 patientweight/totalamount(原 procedureevents_mv)
caregiver 记录者 caregiver_id(MetaVision 侧脱敏)

§3.10 版本验证协议与公告订阅

团队级的版本纪律流程:①入库即验证——建库脚本后置行数校验(patients=364,627/icustays=94,458,v3.1);②版本戳进代码——队列 SQL 头部注释版本号+DOI+下载日期;③公告订阅——PhysioNet 条目页公告(版本升级/云同步/bug 修复)纳入团队周会检查项;④升级即回归——新版本发布后重跑全部验证脚本与关键队列行数,差异逐条归因(新增年份/holdout/bug 修复);⑤双源对账——关键数字与官方文档/论文 Table 1 对账,对不上的写存照。这套流程把"活数据库"的维护责任从个人记忆变成工程制度。

§4 数据结构

§4.1 对象模型与键名体系

patients (subject_id, 364,627)                    # hosp 模块
  └─ admissions (hadm_id, 546,028)                # 住院(ED 转入或直接入院)
       └─ icustays (stay_id, 94,458)              # icu 模块;位置级停留
            ├─ chartevents / datetimeevents       # 床旁观测流
            ├─ inputevents / ingredientevents     # 输液(药品级/成分级)
            ├─ outputevents / procedureevents     # 出量/操作
       ├─ labevents / microbiologyevents          # 全住院覆盖(hosp 侧)
       ├─ emar / pharmacy / prescriptions / poe   # 药物四链
       └─ diagnoses_icd / procedures_icd / drgcodes

键名迁移对照(III→IV):icustay_id→stay_id;cgid→caregiver_id;row_id 审计列全面移除(IV 无 row_id)。stay_id 的"位置停留"语义:由 transfers 派生,ICU 内转科合并为同一 stay_id,转出 ICU 再回来则生成新 stay_id——与 III 的 icustay_id 概念基本一致但派生规则更透明。

§4.2 PostgreSQL 导入(实战)

createdb mimiciv
git clone https://github.com/MIT-LCP/mimic-code.git
cd mimic-code/mimic-iv/buildmimic/postgres
# 1) 建表(hosp+icu 全部)
psql -d mimiciv -f create_tables.sql
# 2) 导入(编辑 load_gz.sql 指向解压 CSV 路径后执行;约 4-8 小时)
psql -d mimiciv -v ON_ERROR_STOP=1 -f load_gz.sql
# 3) 约束与索引
psql -d mimiciv -f add_constraints.sql
# 4) 验证
psql -d mimiciv -c "SELECT COUNT(*) FROM mimiciv_hosp.patients;"  # v3.x: 364,627
psql -d mimiciv -c "SELECT COUNT(*) FROM mimiciv_icu.icustays;"   # v3.x: 94,458

§4.3 anchor 年龄与时间线还原(实战核心)

-- anchor 三件套的用法:还原"真实年份窗"与任意时刻年龄
SELECT subject_id, anchor_age, anchor_year, anchor_year_group,
       -- 入院时的年龄 = anchor_age + (入院去标识年 - anchor_year)
       anchor_age + EXTRACT(YEAR FROM admittime) - anchor_year AS age_at_admission
FROM mimiciv_hosp.patients p
JOIN mimiciv_hosp.admissions a USING (subject_id)
LIMIT 5;
-- anchor_year_group 给出该 anchor_year 对应的真实 3 年窗(如 2011-2013)
-- 注意:age_at_admission 对 anchor_age=91 的患者(>89 岁归并)不再准确——分层时单列 90+

要点:①同一患者内时间差恒真(date shift 保留间隔);②年龄增长按去标识年推算(与 anchor 机制自洽);③>89 岁患者的年龄语义冻结在"91+“——死亡率研究的最高龄段只能报告”≥90"。

§4.4 药物四链关联(实战)

-- 例:某住院的肝素暴露——从医嘱到条码执行的证据阶梯
SELECT p.drug, p.starttime AS ordered_at,        -- 医嘱层
       e.charttime AS administered_at,           -- 执行层(eMAR)
       e.dose_given, e.dose_unit
FROM mimiciv_hosp.prescriptions p
LEFT JOIN mimiciv_hosp.emar e
  ON p.pharmacy_id = e.pharmacy_id               -- 经 pharmacy_id 关联
WHERE p.hadm_id = 28503629
  AND p.drug ILIKE '%heparin%'
ORDER BY e.charttime;

-- emar_detail 的剂次拆分(一次给药多行扫描)
SELECT emar_id, parent_field_ordinal, dose_given, product_description
FROM mimiciv_hosp.emar_detail
WHERE emar_id = (SELECT emar_id FROM mimiciv_hosp.emar LIMIT 1);
-- parent_field_ordinal 为空 = 给药主记录;非空 = 单剂次扫描行

要点:①2016 年前的住院 emar 覆盖不完整(系统 2014-2016 渐进部署)——药物暴露研究按年份分段报告覆盖率;②prescriptions→emar 经 pharmacy_id 桥接,直接按 drug 名 join 会产生语义漂移。

§4.5 与 MIMIC-IV-Note / ED / CXR 的关联协议

# 关联三步(官方指引):
# 1) subject_id 匹配(注意:MIMIC-IV 是超集——Note/CXR 人群是其子集,反向关联无偏差,
#    正向"从 IV 出发找 CXR 患者"则引入 2011-2016+ED 选择偏差)
# 2) 同 date shift → 日期可直接对齐:
#    患者入院 2105-01-01(去标识)、CXR 在 2105-01-02 → 影像确在住院期间拍摄
# 3) 各模块独立授权(Note/ED/CXR 在 PhysioNet 是独立项目,各签 DUA)

记忆口诀:“同一个人,同一把日期钥匙,多扇数据门”——这是 MIMIC 家族在多模态时代最重要的基础设施设计。

§4.6 与 MIMIC-III 的对照迁移

III 概念 IV 对应 迁移注意
icustay_id stay_id 键名改;派生规则更透明
inputevents_cv / _mv inputevents 双表合一;CV 时代(2001-2008)数据在 IV 不存在
cgid caregiver_id ICU 记录者
cptevents hcpcsevents 编码体系升级
dob anchor 三件套 年龄算法换锚点制
labevents.abnormal ref_range_lower/upper 参考区间自带
itemid 211/220045 双码 单码(MetaVision only) 双码视图直接退役
ICD-9 only ICD-9+10 双版本 概念定义 SQL 选 icd_version
新生儿(7,870) 已移除 儿科研究走其他库

mimic-code 的 III→IV 概念迁移已完成——多数疾病定义(Sepsis-3/AKI/机械通气)直接可用;自定义 SQL 按 whatsnew 官方对照表逐表改名即可。

§4.7 数据血缘

BIDMC 医院 EHR(全院)─┐
BIDMC MetaVision(ICU)┼→ Acquisition(主患者名单:2008-2022 ED/ICU 入组)
SSA Death Master File ─┘        │
                                ▼
              Preparation(非规范化/去审计/模块化;不清洗)
                                ▼
              Deidentify(HIPAA Safe Harbor:随机密码 ID+患者级日期偏移+文本 PHI 双算法)
                                ▼
   MIMIC-IV v1.0 (2020) → v2.0/2.1/2.2 (2022-2023) → v3.0 (2024-07) → v3.1 (2024-10)
                                │
        ┌───────────────┬───────┴────────┬─────────────────┐
   MIMIC-IV-Note   MIMIC-IV-ED      MIMIC-CXR         MIMIC-IV-Ext-*(衍生规范)
 (同 shift 关联) (489 MIMICEL 上游)(2011-2016 ED)  (MEDS/OMOP 等格式)

§4.8 完整性清单

  • [x] hosp/icu 全部表有官方建库脚本与文档页
  • [x] itemid 与 v2.2 一致性(v3.1 修复 v3.0 回归)
  • [x] holdout 测试集永久移除(防基准污染的制度设计)
  • [x] 跨模块同 date shift(多模态对齐可行)
  • [ ] 无清洗保证(真实噪声)
  • [ ] eMAR 2016 前覆盖不全
  • [ ] 绝对时间不可得(anchor 三件套仅 3 年精度)

§4.9 星型 schema 查询模式库

icu 模块的六个 events 表共享同一查询骨架——字典表过滤 + icustays 时窗 join + 聚合:

-- 模式 1:单一概念的全停留聚合(心率首 24h 均值/最大值)
SELECT i.stay_id,
       AVG(c.valuenum) AS hr_mean_24h,
       MAX(c.valuenum) AS hr_max_24h
FROM mimiciv_icu.icustays i
JOIN mimiciv_icu.chartevents c
  ON c.stay_id = i.stay_id
 AND c.charttime BETWEEN i.intime AND i.intime + INTERVAL '24 hours'
WHERE c.itemid = 220045          -- d_items 校验:Heart Rate
GROUP BY i.stay_id;

-- 模式 2:多概念透视(stay 级宽表快照)
-- SELECT stay_id, bucket,
--        AVG(CASE WHEN itemid = 220045 THEN valuenum END) AS hr,
--        AVG(CASE WHEN itemid = 220277 THEN valuenum END) AS spo2
-- FROM (SELECT *, WIDTH_BUCKET(EXTRACT(EPOCH FROM charttime - intime)/14400, 0, 6, 6) AS bucket
--       FROM chartevents WHERE itemid IN (220045, 220277)) t
-- GROUP BY stay_id, bucket;

模式 3:输液时间线(inputevents+ingredientevents 成分级拆分);模式 4:跨模块时窗(icu 事件 ∩ hosp 实验室——hadm_id 桥接后按时窗对齐)。所有模式的公共前缀是"白名单表":项目级维护一张 concept_map(itemid→标准名→单位→正常范围),代替散落在查询里的魔法数字——这张表本身就是复现包的一部分。

§4.10 DuckDB 轻量探索与 Parquet 路线

不建库的快速路线:DuckDB 直接读 gzip CSV——

-- 单文件探索(无需导入)
SELECT COUNT(*) FROM read_csv_auto('icustays.csv.gz');
-- 队列级探索:语法与 PostgreSQL 几乎一致
SELECT p.anchor_age, COUNT(*)
FROM read_csv_auto('hosp/patients.csv.gz') p
JOIN read_csv_auto('icu/icustays.csv.gz') i USING (subject_id)
GROUP BY 1 ORDER BY 1;

适用边界:亿行级 chartevents 的重复扫描仍是 PG+索引快;但 schema 探索、字典检索(d_items/d_labitems)、小队列构建、导出 Parquet 供下游训练——DuckDB 是半天级加速器。团队管线建议:DuckDB 做"探索与验收",PostgreSQL 做"生产与复现"——复现包里仍写 PG 脚本(审稿人环境一致性优先)。

§4.11 BigQuery 方言对照与成本控制

云端路线的方言差异:数据集名 mimiciv_hosp/mimiciv_icu(对应 PG 双 schema);日期函数换 BigQuery 语法(DATETIME_SUB/DATETIME_DIFF);INTERVAL 写法不同。成本控制三招:①避免 SELECT *——chartevents 全表扫描是费用大头,白名单 itemid 谓词下推;②结果物化(目标表暂存)代替反复子查询;③版本核对放最前(§6.6 坑点 4)——云端跑出与论文不符的行数先查版本再查 SQL。引用语义不变:云端数据集同样带版本号,方法学段落写清"BigQuery mirror of MIMIC-IV vX.Y"。

§5 下游分析协议

§5.1 任务×资源速查表

你要做的 直接用 说明
死亡/恶化预测 icustays+chartevents+labevents anchor_age 口径;>89 单列
疾病队列 mimic-code IV 版概念 SQL Sepsis-3/AKI/通气已迁移
药物暴露 emar(执行)优先 2016 前分段报告覆盖
ED 研究 MIMIC-IV-ED 模块 425,028 ED 停留(489 条目上游)
文本任务 MIMIC-IV-Note 同 shift 对齐结构数据
长期结局 patients.dod(1 年窗) v3.0 起官方口径
多模态 +MIMIC-CXR/波形库 选择偏差显式声明

§5.2 死亡预测协议(IV 版标准口径)

  1. 队列:成人(anchor_age≥16;90+ 归并段单独处理)首次 ICU 停留、LOS≥12h。
  2. 输入:首 48h chartevents+labevents(IV 无需双码视图——直接 itemid 白名单)。
  3. 标签:hospital_expire_flag(住院口径)或 1 年死亡(dod 窗口,v3.0 起官方)。
  4. 基线:LR+channel-wise LSTM(延续 benchmark 传统);mimic-code 官方队列 SQL。
  5. 报告:版本号(v3.1)、holdout 声明(你手里没有被移除的测试集——这是制度性防污染)、anchor 归并说明。
  6. 与 III 时代数字比较:原则上不直接比(入组规则不同:IV 含 ED 入口);如必须,写明队列映射。

§5.3 药物流行病学协议

  1. 暴露定义:优先 emar(执行真值);处方(prescriptions)做敏感性分析;报告两口径差异。
  2. 时间零点:给药执行时刻(emar.charttime)而非医嘱时刻——暴露起点的影响时效研究必选。
  3. 剂量精度:emar_detail 剂次拆分支持精确剂量-反应;ingredientevents 把输液拆到成分级(如"某输液含肝素 X 单位/h")。
  4. 混杂控制:poe 提供 time-zero 前的医嘱上下文(适应证混杂的控制变量源)。
  5. 覆盖声明:按年份报告 emar 覆盖率(2014-2016 渐进部署期必须分层)。

§5.4 多模态对齐协议

  1. 结构+文本:chartevents/labevents 时序 + Note 出院小结——同 shift 直接对齐;文本时间戳用 Note 内记录时间。
  2. 结构+影像:MIMIC-CXR 的 study 时间戳 + ICU 停留窗——检查影像是否落在 stay 内(同 shift 使判定可靠)。
  3. 选择偏差三声明:CXR 仅 2011-2016;CXR 人群是 ED 入院者;Note 覆盖率按类别统计(放射>出院小结)。
  4. 切分:一切多模态研究按 subject_id 分组切分——模块再多,患者是唯一的泄漏单元。

§5.5 方法学段落骨架(直接套用)

本研究使用 MIMIC-IV v3.1(DOI 10.13026/kpb9-mt58;Johnson et al., Sci Data 2023),经 PhysioNet Credentialed Access(CITI 与 DUA 1.5.0)获取,PostgreSQL 16 导入(mimic-code 官方脚本;patients 364,627 行验证通过)。队列:2008-2022 年成人(anchor_age≥16,≥90 岁段单列)首次 ICU 停留且停留≥12 小时,共 N 例。结局:院内死亡(hospital_expire_flag)[或 1 年死亡,v3.0 官方窗口]。特征:首 48h chartevents/labevents(itemid 白名单见附录),4h 桶聚合。合规声明:本研究未将数据传输至第三方在线服务(PhysioNet 2025-09 LLM 条款),全部计算于本地环境完成。代码与版本哈希:[repo]。

§5.6 概念定义复用协议(Sepsis-3/AKI 等)

队列定义的第一原则:官方概念 SQL 优先。mimic-code 的 mimic-iv/concepts 目录覆盖 Sepsis-3、AKI(KDIGO)、机械通气、尿量、血管活性药、SOFA/qSOFA 评分等——每棵 SQL 有注释、可追溯。复用协议四步:①原样运行并记录行数(与官方 README 对账);②需要修改时 fork 出项目内版本+改注释(不直接改上游文件);③自定义概念必须写"检测逻辑文档"(定义来源+阈值+双 ICD 处理);④发表时引用概念定义的版本(mimic-code commit hash)——概念定义的版本漂移与数据版本漂移同等重要。III 时代"各自定义脓毒症"造成的文献不可比,就是这个协议要终结的历史。

§5.7 时间语义工程:桶聚合与 anchor 的配合

特征窗工程的三层时间语义:①相对时间(stay 内第 N 小时)——时序模型主轴:intime 锚定,4h 桶聚合;②绝对时间(去标识日历)——跨模块对齐与"住院第几天"计算:date shift 保序,anchor_year_group 给 3 年真实窗;③过程时间(医嘱-执行-结局链)——poe/emar 的时刻差本身就是特征(给药延迟、医嘱响应时间)。三者各管一段:模型特征用①,队列分层用②,因果/流程研究用③。常见错误是三层混用——比如用去标识日历算"星期几"做特征:绝对日期已失真,星期信息不可信。

§6 实证结果与方法学分析

§6.1 规模实证:患者构成金字塔与死亡率的落差

把官方数字摆成金字塔,MIMIC-IV 的总体结构一目了然:

层级 人数/次数 占比 研究语义
ED∪ICU 全体(patients) 364,627 100% 最宽口径,ED 研究
有住院记录(admissions≥1) 223,452 61.3% 住院研究的天然边界
仅 ED 未住院 141,175 38.7% ED-only 专研人群
ICU 停留(icustays) 94,458 住院的 42.3% 重症研究主战场
ICU 唯一患者 50,920(v2.2 口径) — 人均约 1.9 次停留

死亡率的层级落差是本库最重要的"直觉校准"数字(Sci Data Table 1,v2.2 口径):住院口径院内死亡率 2.1%、ICU 患者口径 11.6%——差 5 倍;1 年死亡率分别为 24.6% 与 38.6%——ICU 幸存者出院后一年内再失去近三分之一。这组数字的解释力在于:"进没进 ICU"本身就是最强的不良结局分层变量,任何跨层级混合队列都会把两种截然不同的基线风险搅在一起。

人口学基线(同表):住院患者平均年龄 58.8 岁(SD 19.2)、女性 52.2%;ICU 患者平均 64.7 岁(SD 16.9)、女性 44.2%——ICU 人群更老、男性占比更高,符合重症流行病学常识。保险构成(住院口径):Medicare 37.2%、Medicaid 9.6%、Other 53.2%(含商业保险/self-pay)。住院时长:全住院平均 4.5 天(SD 6.6),ICU 患者的住院平均 11.0 天(SD 13.3)——标准差是均值的 2-3 倍,提示长尾分布,LOS 研究应考虑对数变换或分位数回归。

§6.2 holdout 制度实证:永久测试集的防污染设计

v2.1(2022-11-16)做了一件开源数据集史上罕见的操作:从公开版本中永久移除一个内部测试集——15,748 名患者、23,093 次住院、3,762 次 ICU 停留(与 v2.0→v2.1 行数差完全吻合:315,460−299,712=15,748;454,324−431,231=23,093;76,943−73,181=3,762)。这批数据保留在 MIT-LCP 手中,专用于官方基准竞赛。

制度设计的三层意图:①防测试集污染——公开数据被社区反复"偷看"多年后,基准分数的泛化意义持续贬值(MIMIC-III 的 210 模型后验是前车之鉴);②保留裁决权——新方法是否真有进步,需要一个从未被公开优化过的金标准集;③校准社区预期——你下载的 MIMIC-IV 不是"全部数据",写论文时引用行数必须意识到这个制度性缺口。

对研究者的实际影响:本地报告的 AUROC 与官方竞赛榜单不可直接比较(队列不同);但反过来,本地结果不存在"被提前污染"的问题,自建切分+本地 holdout 仍是主流做法。理解 holdout 的存在,是解读 MIMIC-IV 时代文献数字的第一课。

§6.3 版本治理实证:itemid 回归事件的修复档案

v3.0(2024-07)加入 2020-2022 年数据时,d_labitems 与 labevents 的部分 itemid 发生了意外变更(v2.2→v3.0 迁移过程中回归 bug);v3.1(2024-10)将其恢复为与 v2.2 一致,同时移除 2 个孤儿 subject_id。官方 release notes 明确列出受影响表:d_labitems、diagnoses_icd、drgcodes、labevents、microbiologyevents、omr、transfers、icustays。

这次事件的实证价值在于它展示了活数据库的版本治理模式:①问题被官方承认并逐表列出(而非静默修复);②修复方向是"恢复 v2.2 兼容"而非"重新发明"——itemid 的稳定性被显式承认为数据契约;③孤儿记录清理与 bug 修复同版本发布,变更日志可追溯。对研究者的教训浓缩为一条:任何使用 v3.0 的实验室纵向研究都可能踩到 itemid 漂移——用 v3.1(或 v2.2),并在方法学段落写明版本与 DOI。这也是本条目 DAIMS 评估中"可复现性 9/10"的扣分背景之一:活数据库的代价就是版本管理责任转移给了使用者。

§6.4 anchor_age=91 的实证语义

在 patients 表按 anchor_age 做直方图,会在 91 处看到一根突兀的高峰——这不是 BIDMC 的老年患者突然暴增,而是 HIPAA Safe Harbor 对 90 岁以上年龄的归并规则:所有 >89 岁患者的 anchor_age 统一记为 91。三个连锁后果:

  1. 年龄特征的截断:91 不是一个点而是一个区间 [90, +∞)——把 anchor_age 当连续变量喂给模型,等于让模型相信"91 岁和 105 岁风险相同"。正确姿势:≥90 岁单独分层或做二值特征。
  2. 死亡率研究的分辨率上限:最高龄段的剂量-反应关系不可分辨;报告时写"≥90 岁"而非"91 岁"。
  3. 与 MIMIC-III 的口径差异:III 用真实 dob(+date shift),年龄可出 300+ 岁的负伪影但高龄段连续;IV 用 anchor 三件套,年龄干净但高龄截断——跨库比较高龄段时这是系统性差异,不是 bug。

§6.5 eMAR 覆盖实证

eMAR(电子给药记录)来自 BIDMC 2014-2016 年渐进部署的条码扫描系统:护士给药前扫描患者腕带与药品条码,扫描事件落库。官方口径的表述需要精确理解:2016 年后的住院"应有"emar 记录——这是部署完成后的预期,不是逐行验证的承诺;2014-2016 年间的覆盖随部署进度递增。三个实证要点:

  1. v2.2 的 hadm_id 补录:713,117 行 emar 记录(约 2.5%)在 v2.2 中补上了 hadm_id——此前部分给药记录无法关联到住院,药物-结局分析会静默丢样本。
  2. emar 与 prescriptions 的体量差:两者行数不可互相推导——一条医嘱可对应多次给药执行,一次给药可拆多行剂次扫描(emar_detail);把 emar 行数当"用药人次"是新手错误。
  3. 研究设计的分段纪律:药物暴露研究按年份分层报告(<2014 无 emar / 2014-2016 渐进 / ≥2016 稳定期);跨全时段的暴露定义必须声明 fallback 逻辑(如 emar 缺失时回退 prescriptions)。

§6.6 八个真实坑点

  • 坑点 1 ED-only 混入:从 patients 出发不过滤就建"住院队列"——36.5 万人里 14.1 万从未住院,join admissions 后静默消失或被误计入分母。一切队列从 admissions 或 icustays 出发,而非 patients。
  • 坑点 2 anchor_age=91 误当真实年龄:把 91 当观测值做年龄-结局曲线——那条"91 岁高峰"是 HIPAA 归并伪影(§6.4)。≥90 单列。
  • 坑点 3 v3.0 itemid 污染:用 v3.0 做检验指标纵向分析——v2.2→v3.0 的 itemid 意外变更让同一 lab 指标分叉成两个 itemid(§6.3)。用 v3.1。
  • 坑点 4 BigQuery 版本滞后:云端直接跑——2024 年秋 BigQuery 数据集曾停留在 v2.2,跑出 299,712 行 patients 与论文 364,627 对不上,排查半天发现是云端版本没升级。云端研究先 SELECT COUNT(*) 对版本。
  • 坑点 5 III 迁移键名硬套:III 的 SQL 直接改库名在 IV 上跑——icustay_id→stay_id、cgid→caregiver_id、inputevents_cv 已删除、cptevents→hcpcsevents。旧脚本报错算幸运,语义错位(如把 hosp.transfers 当 III 的 transfers)才是灾难。
  • 坑点 6 icd_version 忽略:全量统计 diagnoses_icd 的 icd_code 字符串——ICD-9(414.01)与 ICD-10(I25.10)是两套不兼容的编码体系,混合统计出的"Top 10 诊断"是伪分布。先选 icd_version 或用映射统一。
  • 坑点 7 LLM API 违规:“我就发一段匿名化验单给在线 LLM 翻译一下”——违反 DUA(PhysioNet 2025-09 条款明确禁止向第三方在线服务传输数据)。本地部署是唯一合规路径(§7.3)。
  • 坑点 8 跨版本行数混比:把 v2.0 的 315,460、v2.1/v2.2 的 299,712、v3.x 的 364,627 混在一张表里比增长率——三个数字对应三个不同患者集(holdout 移除/+3 年数据)。引用行数必须带版本号。

§6.7 审稿人自查清单

  • [ ] 明确写出版本号(MIMIC-IV v3.1)与 DOI(10.13026/kpb9-mt58)
  • [ ] 队列定义给出 SQL 或等价伪码:成人判定方法(anchor_age)、首住/全部停留、LOS 门槛——每个过滤条件的行数漏斗
  • [ ] ≥90 岁段的处理方式显式声明(单列/排除/二值化)
  • [ ] 患者构成口径声明(是 22.3 万住院队列还是 9.4 万 ICU 停留队列;ED-only 是否排除)
  • [ ] 用到药物数据时声明暴露定义层级(emar/prescriptions)与 2014-2016 覆盖分段
  • [ ] 用到诊断编码时声明 icd_version 策略(单版本/映射统一/分层)
  • [ ] 死亡结局口径(院内 hospital_expire_flag vs 1 年 dod 窗口)与删失规则
  • [ ] 切分按 subject_id 分组;声明 holdout 制度认知(本地无官方测试集)
  • [ ] 基线含 logistic regression;指标含置信区间
  • [ ] 合规声明:CITI+DUA;未向第三方在线服务传输数据(2025-09 条款)
  • [ ] 局限性段含单中心、ED+ICU 混合总体、无清洗原则三个必选项

§6.8 与 MIMIC 家族的分工治理

MIMIC 家族现在的分工格局:MIMIC-IV 是现任"记录视角主库"(结构化 EHR,持续更新);MIMIC-III 是"历史纵深库"(2001-2012,冻结但基准生态最厚);MIMIC-IV-ED 是急诊专研视图(425,028 ED 停留,489 条目的上游);MIMIC-IV-Note 是文本模块;MIMIC-CXR 是影像支库(2011-2016);MIMIC-IV Demo 是教学沙盒。治理特征有三:

  1. 独立项目、独立授权:Note/ED/CXR 在 PhysioNet 是独立条目,各签各的 DUA——“拿到 MIMIC-IV"不等于"拿到全家桶”。
  2. 同偏移对齐语义:家族内关联靠 subject_id + 同一患者级 date shift——这是官方文档反复强调的关联基础设施,多模态研究的可行性由此而来。
  3. 超集选择偏差:MIMIC-IV 是各关联模块的超集;从模块反查主库无偏,从主库出发"找有影像的人"则引入模块的入选条件(如 CXR 的 2011-2016+ED 限制)作为选择偏差。

§6.9 许可与派生语义(Ext 命名规范)

MIMIC-IV 本体采用 PhysioNet Credentialed Health Data License 1.5.0 + DUA:获取免费、使用受控、禁止再分发原始数据。衍生数据的规则在 2024-04-24 官方指南中细化:衍生品(提取子集/转换格式/加标签)视为同样敏感,须在 PhysioNet 以相同协议分享;命名必须含 “Ext” 标记(MIMIC-IV-Ext-xxx,extracted/extended 之意)。两个生态实例:MIMIC-IV-Ext-MEDS(时序基础模型格式转换)走的就是这套规范;本系列后续的 MIMIC-IV-Ext 系条目亦然。对工程团队的含义:企业内部"加工后的 MIMIC-IV 精简版"不能放进自家数据平台对外提供——那构成再分发;对外发布走 PhysioNet+Ext 命名是唯一正道。

§6.10 口径存照

  • 存照 A:v3.0 发布日期两处官方文本(July 19 / July 23)并存,本条目以主页 release notes 的 July 23 为主口径(§10.1-A 详注)。
  • 存照 B:ICU 唯一患者数 50,920 为 v2.2 论文口径;v3.0/3.1 官方页面未给出对应的 ICU 唯一患者数更新值——引用 ICU 患者数时注明"v2.2 口径"。
  • 存照 C:anchor_age=91 是归并值(>89 全体),官方文档明确该语义;任何"91 岁患者的特征分布"结论都须改写为"≥90 岁段"。
  • 存照 D:"MIMIC-IV 有 30 万患者"的模糊语属于 v2.x 时代表述(299,712-315,460);v3.x 时代应为 36.5 万——文献引用时按论文发表时间归因版本。
  • 存照 E:eMAR "2016 年后全覆盖"是官方对部署完成态的描述(“应有记录”),非逐行完整性验证结论——覆盖率实测因研究而异。
  • 存照 F:ICU 停留占住院比例 42.3%(94,458/546,028)为本条目推算值,官方文档未直接给出该比值。

§6.11 静态数据×活跃工具生态

MIMIC-IV 的"活性"有一半在数据外的工具层:mimic-code 仓库(建库/概念定义/基准 SQL,PostgreSQL/MySQL/BigQuery 三方言)、mimic.mit.edu 文档站(whatsnew 逐表对照)、BigQuery 云数据集(同步有滞后)、MIMIC-IV-Ext 衍生格式(MEDS/OMOP)、Demo 沙盒(100 患者冒烟测试)。与 MIMIC-III"数据冻结、社区工具长尾维护"的静态生态相比,IV 呈现**"数据定期滚动、官方工具高频跟进"的活基础设施形态**——这改变了使用姿势:订阅 PhysioNet 条目页公告(升级/bug/云同步状态)应成为团队流程的一部分,每次版本升级后重跑行数验证脚本(§4.2 的 364,627/94,458 校验)再继续生产任务。

§6.12 与文献数字冲突的诊断树

复现文献时数字对不上,按序排查:

1) 版本一致吗?
   |- 否 -> 对齐版本(§3.2 对照表);v3.0 数据 + v3.1 文献 = itemid 类差异
   `- 是 |
2) 口径一致吗?(患者构成/队列定义)
   |- 36.5 万 vs 22.3 万 vs ICU 停留——三层总体别混
   `- 是 |
3) 过滤条件顺序一致吗?(先成人后首住 vs 先首住后成人——边界患者归属不同)
   `- 一致 |
4) 概念定义一致吗?(Sepsis-3 的 mimic-code 版 vs 论文自定义版)
   `- 一致 |
5) 切分/标签一致吗?(patient-level split vs random split)
   `- 全一致仍不符 -> 写存照并联系作者;差异 >1% 时把复现差异写进自己论文的讨论段

§7 AI 就绪指南与应用场景

§7.1 四种喂法

喂法 形态 适用 关键工程
关系库直连 PostgreSQL/DuckDB 查询 队列构建、特征工程、流行病学 mimic-code 建库脚本+约束
事件流序列化 患者级时间线(MEDS 格式) 时序基础模型、自回归预训练 MIMIC-IV-Ext-MEDS 转换
文本+结构混合 Note 模块 join 结构表 出院小结摘要、编码映射、RAG 同 shift 对齐+本地 LLM
表格快照 stay 级宽表(首 24/48h 聚合) 经典 ML 基线、表格深度模型 pivot+桶聚合+前向填充

四种喂法共享同一套键(subject_id/hadm_id/stay_id)与同一套合规约束——工程上可以先做"喂法 1"的队列 SQL,再按需序列化到其他形态。

§7.2 死亡预测最小配方(可跑通版)

队列构建(IV 版,无双码视图是最大简化):

-- 首次 ICU 停留 + 成人 + LOS≥12h + 院内死亡标签
WITH first_stay AS (
  SELECT subject_id, stay_id, hadm_id, intime, los,
         ROW_NUMBER() OVER (PARTITION BY subject_id ORDER BY intime) AS rn
  FROM mimiciv_icu.icustays
)
SELECT f.subject_id, f.stay_id, f.hadm_id, f.intime,
       p.anchor_age,
       CASE WHEN p.anchor_age >= 90 THEN 1 ELSE 0 END AS is_90plus,
       CASE WHEN p.anchor_age + EXTRACT(YEAR FROM f.intime) - p.anchor_year >= 16
            THEN 1 ELSE 0 END AS is_adult,
       a.hospital_expire_flag AS label
FROM first_stay f
JOIN mimiciv_hosp.patients p USING (subject_id)
JOIN mimiciv_hosp.admissions a USING (hadm_id)
WHERE f.rn = 1 AND f.los >= 0.5;

特征流水线(Python 侧):

# 床旁特征白名单(MetaVision 单码——III 时代双码映射在此退役)
VITALS = {220045: "heart_rate", 220179: "sbp_nbp", 220210: "resp_rate",
          220277: "spo2", 223761: "temperature"}
# 实验室特征经 d_labitems 按 label 匹配(示例:肌酐/血钾/白细胞/血红蛋白/乳酸)
# 1) 拉 chartevents 前 48h → 4h 桶聚合(mean/min/max)
# 2) 拉 labevents 前 48h → 同桶聚合
# 3) 前向填充 + 缺失指示符 + anchor_age(90+ 二值化)
# 4) 逻辑回归基线 → 梯度提升/LSTM 对比;subject_id 分组切分;报告 AUROC 95% CI

要点:①is_adult 判定用 anchor 推算而非 anchor_age 直接比较(anchor_year 参与年差);②90+ 二值化后删除原 anchor_age 列,防泄漏伪特征;③标签用 hospital_expire_flag(住院口径)——想预测"ICU 内死亡"需另用 outtime 与 dod 联合判定。

§7.3 LLM 本地部署配方

合规前提(2025-09 条款下的标准动作):

  1. 离线环境:推理机不联外网;DUA 文本+2025-09 公告存档进项目合规目录。
  2. 模型栈:8B-30B 级开源模型(医疗微调版优先)+vLLM/llama.cpp 本地推理;单卡 24GB 起步,70B 需多卡或量化。
  3. 数据入口:MIMIC-IV-Note(独立授权)的 discharge/radiology 文本;传输只走内网挂载,禁止任何 SDK 上云。
  4. 零保留验证:若确需任何第三方组件(嵌入模型、标注平台),逐项核验其数据保留政策并存证——"无法验证即不用"是条款原文语义。
  5. 审计日志:本地 API 网关记录每次请求的表级范围(哪些 hadm_id 进过 prompt),供合规复查。

典型任务栈:出院小结结构化抽取(诊断/用药/随访计划→JSON)、ICD 编码辅助(icd_version 分别的 prompt 模板)、临床问答评估集构建。任务评价用人工抽检+规则双轨——LLM 输出本身不得回流为"事实"写回数据库。

§7.4 时序基础模型适配配方(MEDS)

时序基础模型(TSFM)时代,MIMIC-IV 的现代入口是事件流:

  1. 格式:MIMIC-IV-Ext-MEDS——把 hosp/icu 表拍平成(subject_id, time, code, value)事件流;观测/给药/入转出统一编码。
  2. 分词:code 做 vocab(数值走分桶嵌入);时间差单独编码(MIMIC-IV 的时间粒度支持到分钟级事件)。
  3. 预训练目标:掩码重建/下一事件预测;队列切分仍按 subject_id。
  4. 下游探针:院内死亡、30 天再入院、LOS 分位——探针协议与 §7.2/§7.12 的口径对齐,保证与传统方法可比。
  5. 算力现实:事件流全量在亿行级——预训练是 GPU 集群任务;单卡团队从"冻结底座+探针"模式起步。

§7.5 成本与排期模板

阶段 事项 耗时 硬件
合规 CITI(2-4h)+DUA+审批 约 1-2 周 —
获取 hosp+icu 包下载(约 10-15 GB 压缩) 数小时 200 GB 磁盘
建库 mimic-code 导入+约束+验证 4-8 小时机器时 16 GB 内存起
队列 概念 SQL 移植+行数漏斗校验 1-2 周 —
建模 基线+主模型+消融 数周-数月 单卡起步;LLM/TSFM 需多卡
发表 复现包+合规声明 1 周 —

排期建议:把"审批等待周"用于 Demo 沙盒上的管线预演(491 条目的切换协议直接复用)——审批下来当天即可在全库重跑同一套代码。

§7.6 泄漏防控专项

  • 切分泄漏:一切切分按 subject_id 分组(同一患者多住院/多模块)——patient-level split 是 MIMIC 家族研究的第一铁律。
  • 时序泄漏:特征窗与标签窗不重叠;院内死亡标签的观测窗止于出院;用药特征只取暴露判定时刻之前(poe 的录入时刻是天然的"信息可用"锚点)。
  • 变量泄漏:hospital_expire_flag、dod、drgcodes(结算后才有)、dischtime 都是事后变量——出现在特征里就是灾难级泄漏。
  • anchor 侧信道:anchor_year_group 泄露真实年窗(3 年粒度)——疫情年段的模型可能学到"2020-2022 = 高死亡风险"的年代伪信号;跨年代泛化声明应包含该变量敏感性。
  • holdout 心态:本地无官方测试集(§6.2)——不要因为"官方 holdout 拿不到"就放松本地留出集纪律。

§7.7 公平性声明

MIMIC-IV 公平性分析的最低配置:①性别(gender 列)与年龄段(anchor 三件套推算,≥90 单列)分层指标;②保险类型(Medicare/Medicaid/Private/Self-pay——v3.0 分类标准化后可用作社会经济代理变量,解释其局限);③语言列(v3.0 标准化,沟通障碍研究的入口)。结构性提示:单中心新英格兰学术医疗中心的支付体系构成外推性有限;ICU 人群女性占比 44.2% 的性别失衡应在重症模型中显式检查校准(calibration)而非只看判别(discrimination)。≥90 岁归并段禁止报告细分辨率年龄差异——数据层面就不存在该信息。

§7.8 复现包模板

repo/
├── README.md            # 版本(v3.1)+DOI+获取流程引用+硬件环境
├── env/requirements.txt # Python 依赖锁定
├── sql/
│   ├── 01_cohort.sql    # 队列(行数漏斗注释:每步 COUNT)
│   ├── 02_features.sql  # 特征窗聚合
│   └── 03_labels.sql    # 结局与删失
├── src/                 # 训练/评估(seed 固定,subject_id 切分)
├── checks/
│   └── validate_counts.sql  # patients=364,627 / icustays=94,458(v3.1)
├── compliance/
│   ├── dua_ack.md       # DUA 1.5.0 承诺存档;LLM 条款核查记录
│   └── data_handling.md # 本地环境声明;无第三方传输声明
└── outputs/             # 指标表(含 95% CI)+ 消融矩阵

复现包的金标准是" reviewer 用 v3.1 重跑 validate_counts 通过 + 指标表逐格一致"——版本锚定与合规存档同时在场。

§7.9 消融案例:ICD 双版本期的编码一致性

研究问题:诊断编码跨越 ICD-9→ICD-10 切换(2015 年末-2016 年初,BIDMC 随美国全国要求切换)是否使"诊断特征"的预测力出现断层?消融设计:①同一死亡预测模型分别用 icd_version=9 段与 icd_version=10 段的诊断特征训练/评估;②用 CCS 类映射把两版编码统一到同一组概念后再做一遍;③比较两版的特征重要性与 AUROC 差异。预期观察(设计层面,非承诺结果):映射统一版对切换点的敏感性应低于裸编码版——若不成立,说明模型实际依赖的是编码字符串的时代伪信号。该消融的价值:把"ICD 切换"从文献里的口头警告变成可测量的敏感性分析,方法学段落的半个章节直接到手。

§7.10 消融案例:emar 与 prescriptions 的暴露测量差异

研究问题:“开了药”(prescriptions)与"给了药"(emar)两种暴露定义差多少?消融设计:①选 2016 年后住院(emar 稳定期)某类药物(如静脉抗凝);②分别以 prescriptions.starttime 与 emar.charttime 定义暴露起点;③用 emar_detail 汇总实际剂量 vs 处方剂量;④报告两口径的暴露人数差、时间差分布与下游结局模型的系数差异。设计要点:经 pharmacy_id 桥接配对(§4.4),勿按药名 fuzzy join;对无 emar 配对的处方行单独统计(未执行医嘱 vs 漏扫描的不可分性要写进局限)。该消融直接回应药物流行病学审稿人对"暴露测量误差"的标准质询——MIMIC-IV 独有的四链结构让 III 时代做不了的敏感性分析变成常规操作。

§7.11 负结果记录协议

实验记录本里为 MIMIC-IV 项目设"负结果"专页,逐条记:假设、队列 SQL 哈希、版本号、结果、一个可能的失败解释。特别值得记录的四类:①跨版本可复现性(v2.2 训练→v3.1 评估的性能漂移——itemid 恢复后的真实迁移成本);②anchor 归并敏感性(≥90 处理方式切换前后的指标变化);③双暴露口径差(§7.10 的 emar/prescriptions 分歧幅度);④BigQuery vs 本地的引擎差异(浮点聚合/字符串排序导致的特征不一致)。负结果页在论文返修时的利用率通常高于正结果页——审稿人问"为什么不用 X"时,你已经有测过的答案。

§7.12 30 天再入院预测配方

-- 全因 30 天再入院(住院口径;IV 版)
WITH seq AS (
  SELECT subject_id, hadm_id, admittime, dischtime,
         LEAD(admittime) OVER (PARTITION BY subject_id ORDER BY admittime) AS next_admit
  FROM mimiciv_hosp.admissions
)
SELECT s.*, CASE WHEN next_admit IS NOT NULL
                 AND next_admit <= dischtime + INTERVAL '30 days'
            THEN 1 ELSE 0 END AS readmit_30d
FROM seq s;

要点:①死亡患者无下次入院——先剔除出院即死亡(hospital_expire_flag=1)者或在随访窗内做竞争风险;②admission_type 区分计划性再入院(急诊基线的再入院研究应排除 elective);③"再入院"不含 ED 回流——ED 端复发要关联 MIMIC-IV-ED(独立授权);④特征窗用前次住院全程(IV 的 hosp 模块覆盖完整住院时段,比 III 的 ICU-only 视角宽)。

§7.13 AKI 队列最小配方(KDIGO 框架)

KDIGO 的两条通路(肌酐标准+尿量标准)在 IV 上都有官方概念实现,自建最小版仅用于理解机制:

-- 肌酐通路:48h 上升 >=0.3 mg/dL 或 7 天升到基线 1.5 倍
WITH cr AS (
  SELECT l.subject_id, l.hadm_id, l.charttime, l.valuenum
  FROM mimiciv_hosp.labevents l
  JOIN mimiciv_hosp.d_labitems d USING (itemid)
  WHERE d.label ILIKE 'creatinine' AND l.valuenum > 0
)
-- 后续:每患者按时间排序,LAG 比对 48h/7d 窗(窗口函数)
-- 尿量通路:outputevents 尿量 itemid 白名单(d_items 检索 Foley/Void/Condom Cath)
--   -> 按体重归一(patientweight/omr)-> <0.5 mL/kg/h 持续 6h

要点:①优先运行 mimic-code 的 aki 概念(stage 1/2/3 完整实现),自建版仅作学习;②尿量分母体重缺失率高——体重来源三层 fallback(procedureevents.patientweight → inputevents 体重字段 → omr),fallback 率写进论文;③AKI 分期是时变状态——区分"住院期间任意时刻 AKI"与"入 ICU 后 48h 内新发 AKI"(社区获得 vs 院内获得,结局研究设计完全不同)。

§7.14 LLM 临床评估集构建协议(合规版)

用 Note 模块+结构表构建本地 LLM 评估集的标准流程:①任务定义与分层(出院小结→诊断列表/用药表/随访计划;按科室与 icd_version 分层抽样);②金标准构建——结构表交叉验证(Note 抽取的诊断 ↔ diagnoses_icd 对照),分歧样本人工仲裁;③评估指标——实体级 P/R/F1+ICD 类目级层级指标;④合规闭环——评估集仅存本地加密盘,样本溯源表与 DUA 存档同目录;⑤结果报告——模型版本、量化方案、温度、prompt 模板全列——本地 LLM 的可复现性依赖这些"部署元数据"。该协议产出的评估集本身就是 Ext 命名规范下的潜在衍生品(对外发布前逐条合规审查)。

§7.15 模型监控与离线回放

MIMIC-IV 作为"回放环境"的用法:生产模型上线前,用 v3.1 的历史停留做离线回放——把模型部署在回放器上逐 stay 处理时序事件(按 charttime 重放),验证三件事:①实时性假设(每步计算延迟是否满足床旁告警 SLA);②漂移敏感性(2008-2012 训练段 vs 2016-2022 验证段的指标衰减——按 anchor_year_group 分层报告);③告警负荷(每 100 停留的告警次数——床旁告警疲劳的临床现实约束)。回放器输出的衰减曲线是"模型需要再训练"的量化证据——比"我觉得数据老了"的直觉论证有力得多。

§8 伦理、许可与合规

  • 许可体系:PhysioNet Credentialed Health Data License 1.5.0 + DUA。获取免费;使用条件为 CITI"Data or Specimens Only Research"证书 + 签署 DUA;禁止再分发原始数据、禁止尝试或协助重识别。
  • 去标识合规:HIPAA Safe Harbor 18 项标识符移除——随机密码 ID、患者级日期偏移(同患者同 shift,2100-2200 年窗)、文本 PHI 以规则+神经网络双算法检测后替换为 “___”。anchor 三件套是 Safe Harbor 年龄/日期要求的可用性补偿设计。
  • LLM 使用条款(2025-09-24 公告):DUA 明确禁止把受控数据经 API/在线平台传输给第三方服务;要求零数据保留、不用于模型训练、无人工审核;服务方政策"不明或无法验证时不得使用";强烈推荐本地部署。把"匿名片段发在线服务"明确划入违规。
  • 衍生数据规范(2024-04-24 指南):衍生品同等敏感,须同协议在 PhysioNet 分享;命名含 “Ext”(MIMIC-IV-Ext-…)。
  • 患者构成伦理:数据库含死亡与濒死患者的全维度数据;use case 必须在 DUA 授权范围内;商业用途另有条款,逐条核对。
  • 致敬:MIMIC 计划奠基人 Roger G. Mark 教授(MIT)2026-07-16 逝世,享年 87 岁;其与 George Moody 共获 2026 IEEE Biomedical Engineering Award。"让数据为全球研究社群所用"的遗产在 MIMIC-IV 的每一次合规使用中延续。

§9 常见问题(FAQ)

Q1 MIMIC-IV 免费吗?

免费(授权后零费用),成本是 CITI 课程 2-4 小时 + 约 1 周审批 + 合规自律。与 III 同一套流程。

Q2 新研究该用 III 还是 IV?

默认 IV:时段更新(至 2022)、schema 更干净、无双码、持续维护。只有三类场景回 III:需要 2001-2007 年数据、需要与 III 基准文献直接可比、复现 III 时代方法学。

Q3 患者数到底多少?

先问版本:v3.x = 364,627(22.3 万有住院 + 14.1 万仅 ED);v2.1/v2.2 = 299,712;v2.0 = 315,460。引用不带版本号即硬伤。

Q4 为什么 36.5 万人里只有 22.3 万人住过院?

MIMIC-IV 入组含 ED 总体——近四成患者只在急诊就诊未住院。这是设计特性不是数据缺失;ED 研究正是靠这 14.1 万人。

Q5 anchor_age 是什么?

anchor 年(去标识)时的年龄。配合 anchor_year(去标识年)与 anchor_year_group(对应真实 3 年窗),可推算任意时刻年龄与真实年代窗。

Q6 为什么 91 岁的人特别多?

89 岁患者按 HIPAA 统一记 91。91 是区间 [90,∞) 的代号——分析时单列"≥90 岁",别当连续值。

Q7 能还原真实日期吗?

不能到具体日期(Safe Harbor),但同一患者的相对时间完全保真,且 anchor_year_group 给出真实 3 年窗。季节性/星期效应分析不可做。

Q8 不同模块的日期能对齐吗?

能——同一患者的 date shift 全家族一致:入院 2105-01-01、CXR 2105-01-02 即影像在住院次日。这是 MIMIC 多模态研究的核心基础设施。

Q9 stay_id 和 III 的 icustay_id 有区别吗?

键名更替+语义更透明:由 transfers 的 ICU cost center 派生;ICU 内转科合并同一 stay_id,转出再入生成新 stay_id。

Q10 row_id 去哪了?

IV 全面移除审计列 row_id。代码里依赖 row_id 排序的逻辑要改成显式 ORDER BY 业务列。

Q11 还有双码问题吗?

没有。CareVue 2008 后退役,IV 只含 MetaVision——III 时代 211/220045 的双码视图直接退休,itemid 白名单一步到位。

Q12 心率用哪个 itemid?

MetaVision 心率 220045(III 的 211 不存在于 IV)。建议建一张自己的概念白名单表,经 d_items.label 校验。

Q13 labevents 怎么找指标?

经 d_labitems 按 label/loinc_code 检索 itemid。注意 v3.1 已修复 v3.0 的 itemid 漂移——用 v3.1 或 v2.2,跳过 v3.0。

Q14 参考区间怎么用?

labevents 的 ref_range_lower/upper 是"当时该医院该项目"的区间:异常判定、区间漂移研究、flag 复现都可用;跨时间合并异常率前先检查区间一致性。

Q15 ICD-9/10 混在一起怎么办?

icd_version 列区分。三选一:单版本分析 / CCS 等映射统一 / 只用切换后年段。直接全量统计 icd_code 字符串是伪分布。

Q16 药物数据在哪几张表?

四链:prescriptions(医嘱)→ pharmacy(配方)→ emar/emar_detail(条码执行)→ poe/poe_detail(医嘱录入时刻)。研究"实际给药"以 emar 为准。

Q17 eMAR 是什么?

电子给药记录:护士给药前扫患者腕带+药品条码,扫描落库。emar 一行一次给药,emar_detail 一行一个剂次扫描。2014-2016 部署,2016 后住院应有记录。

Q18 prescriptions 和 emar 冲突听谁的?

看问题:测"治疗意图"用处方,测"实际暴露"用 emar。两者差异本身就是研究对象(§7.10 消融)——先报告配对率再下结论。

Q19 2016 年前的给药研究能做吗?

能,但要分层:2014 前无 emar(用处方)、2014-2016 渐进覆盖(按年报告)、2016 后稳定。跨全时段的暴露定义必须写 fallback 逻辑。

Q20 pharmacy_id 是关联键吗?

是——prescriptions→pharmacy→emar 经 pharmacy_id 桥接。按药名 fuzzy join 会产生语义漂移,正式分析禁用。

Q21 poe 表是干什么的?

医嘱录入记录(provider 侧流程时刻)。药物流行病学里提供处方时点的上下文(适应证混杂控制),组织研究里是医嘱行为链的节点。

Q22 omr 有什么?

在线病历测量:身高体重等门诊/住院前测量——BMI 研究的补充源;III 没有的表。

Q23 provider/caregiver 能研究什么?

脱敏 ID 支持角色/行为聚合:医嘱-执行-记录行为链、工作负荷、团队模式。禁止任何个体识别或跨库拼接身份。

Q24 死亡标签有几种?

院内死亡(hospital_expire_flag)、院外死亡日期(dod,含出院后 1 年窗 v3.0 起)、ICU 内死亡(icustays.outtime 与 dod 联合推导)。三口径不可互换。

Q25 1 年死亡率怎么算?

出院(或离院)后 1 年窗口内出现 dod 即为事件,窗口外删失。v3.0 起官方支持;论文口径 ICU 患者 38.6%。

Q26 新生儿在哪?

IV 已移除。新生儿研究回 MIMIC-III(2001-2008 段含 7,870 名新生儿)或专用儿科库。

Q27 儿科数据呢?

IV 仅 ≥18 岁成人语义(anchor_age 机制按成人设计)。儿科重症用其他公开库。

Q28 需要多少磁盘?

压缩包 10-15 GB;PostgreSQL 导入后 100-150 GB 级(含索引)。预留 200 GB 稳妥。

Q29 导入要多久?

mimic-code 官方脚本单机 4-8 小时(hosp 大表为主);社区并行化方案可压缩。导入完先跑行数验证(364,627/94,458)。

Q30 BigQuery 上是哪个版本?

官方云端数据集存在但升级有滞后(2024 年秋曾停留在 v2.2)。云端研究第一步:COUNT(*) 对版本,再动手。

Q31 v3.0 和 v3.1 用哪个?

v3.1:同样的 2008-2022 数据+itemid 回归修复+孤儿清理。唯一选 v3.0 的理由是复现一篇明确基于 v3.0 的论文。

Q32 v3.0 的 itemid bug 是什么?

v2.2→v3.0 迁移中 d_labitems/labevents 部分 itemid 意外变更,v3.1 恢复与 v2.2 一致。受影响表官方列了 8 张(§6.3)——实验室纵向研究避开 v3.0。

Q33 holdout 是什么?

v2.1 起官方从公开版永久移除的内部测试集(15,748 患者),用于官方基准竞赛。你手里的版本不是全部数据——引用行数和解读榜单时都要记住。

Q34 我的队列数和论文差几个人正常吗?

正常。版本不同(holdout/年份扩展)、过滤条件顺序、边界条件(LOS 门槛、成人判定方法)都会带来小差异。差异大时回查版本与口径。

Q35 Demo 是什么?

MIMIC-IV Demo v2.2:100 患者开放子集(ODbL,10.13026/dp1f-ex47)。管线预演/教学/CI 冒烟测试专用;不能替代全库结论。

Q36 Demo 能替代全库开发吗?

开发可以(结构同构),统计结论不可以(100 人无代表性)。最佳实践:Demo 上写管线→审批下来切全库重跑。

Q37 怎么和 MIMIC-CXR 关联?

subject_id 匹配+同 shift 日期对齐;CXR 是 2011-2016 ED 入院者子集——从 IV 出发找 CXR 患者要声明选择偏差(§6.8)。

Q38 怎么和 Note 模块关联?

同上协议;Note 覆盖出院小结+放射报告,类别间覆盖率不同,文本特征要报告缺失模式。Note 是独立 PhysioNet 项目,单独签 DUA。

Q39 和 MIMIC-IV-ED 是什么关系?

ED 是 IV 的姊妹模块(同患者同 shift):IV 收住院侧全量,ED 收 425,028 次 ED 停留(489 条目的 MIMICEL 上游)。急门诊衔接研究两库联用。

Q40 能和 MIMIC-III 做患者级联接吗?

不能(无共享标识符)。只有概念级对齐(同 BIDMC、同年代重叠 2008-2012);跨库研究是"平行分析"不是"合并队列"。

Q41 能和 eICU 联用吗?

方法论层面互补(单中心深 vs 多中心广);同样无患者级键接。eICU 用于检验 IV 结论的外推性。

Q42 MEDS 格式是什么?

Medical Event Data Standard:患者级事件流的社区标准。MIMIC-IV-Ext-MEDS 是其官方生态转换版——时序基础模型训练的现代入口(§7.4)。

Q43 有 OMOP 转换吗?

社区与官方生态均有 OMOP CDM 转换方案(Ext 规范内发布)。走 OMOP 的收益是与真实世界数据网络接轨;代价是转换层的语义决策要自己背书。

Q44 可以发数据片段给 ChatGPT/Claude 等在线服务吗?

不可以。2025-09 条款明确禁止向第三方在线服务传输受控数据;"匿名化片段"不豁免。本地部署是合规路径(§7.3)。

Q45 本地 LLM 要什么配置?

8B-30B 模型单卡 24GB 起;70B 需多卡或量化。合规栈=离线推理+零保留验证存档+审计日志(§7.3 五步)。

Q46 衍生数据集怎么发布?

PhysioNet 同协议分享+命名含 “Ext”(MIMIC-IV-Ext-…)。企业内部精简版不外流;对外发布走官方通道(§6.9)。

Q47 能重新分发原始数据吗?

不能。DUA 禁止再分发;同事用数据需各自申请。给合作方"拷一份"是最常见的违规形态。

Q48 引用怎么写?

四件套:MIMIC-IV (version 3.1) + DOI 10.13026/kpb9-mt58 + Johnson et al. Sci Data 2023 论文 + PhysioNet 标准引用。v3.0 研究用 10.13026/hxp0-hg59。

Q49 数据更新频率?

历史节奏约每 1-2 年一个大版本(v2.0 2022→v3.0 2024)。订阅 PhysioNet 条目页公告;升级后重跑验证脚本。

Q50 有现成的 Sepsis-3 SQL 吗?

有——mimic-code 的概念 SQL 已迁移到 IV(Sepsis-3/AKI/机械通气等)。优先复用官方定义;自定义概念要写检测逻辑文档。

Q51 死亡预测能到多少 AUROC?

没有"官方数字"——队列/特征窗/切分不同则不可比(III 时代 210 模型后验已证明基准混乱的代价)。正确姿势:自建 LR 基线+置信区间+复现包。

Q52 LOS 预测怎么做?

分位数回归或对数变换(LOS 长尾,SD 是均值 2-3 倍);分"剩余 LOS"任务时注意icustays.los 的右删失语义与特征窗对齐。

Q53 再入院怎么定义?

admissions 内 LEAD 窗口 30 天(§7.12);排除院内死亡;区分 elective。ED 回流不算住院再入院——要 ED 端数据另接 MIMIC-IV-ED。

Q54 时间粒度多细?

chartevents/charttime 到分钟级事件;date shift 不改时分秒。多模态对齐可到"住院第几天第几小时"精度。

Q55 时区是什么?

IV 延续 EST 单一时区约定(III v1.4 起统一)。时辰节律研究注意"当地时间"与"机构时间"的差异。

Q56 缺失怎么处理?

官方不清洗——缺失即真实临床缺失(没测/没录)。区分"结构性缺失"(icu 表只在 ICU 时段有数据)与"随机缺失";前向填充+缺失指示符是基线做法。

Q57 和真实 EHR 的差距?

无清洗保留噪声(单位错误/录入异常在库)、单中心、按 ED/ICU 入组而非全院。它是"结构诚实的科研版 EHR",不是生产级数据湖。

Q58 COVID 数据在里面吗?

v3.0 起 2020-2022 年段在库;COVID 患者经 ICD 编码/微生物培养识别(勿仅凭年份推断感染)。疫情年段的诊疗惯例漂移要作为协变量考虑。

Q59 审稿人常挑什么刺?

版本号缺失、口径不明(36.5 万 vs 22.3 万)、≥90 处理、切分方式、暴露定义层级、单中心外推。§6.7 清单逐项打勾可预防 90% 的质询。

Q60 最容易犯的一个错误?

不带版本号引用行数。其次是把 patients 表当队列起点。第三是把 91 当真实年龄。三句话记住三个坑。

Q61 需要会 PostgreSQL 吗?

强烈建议——mimic-code 主方言、社区答案、官方文档都以 PostgreSQL 为中心;MySQL/BigQuery 有官方脚本但踩坑人数少一个量级。DuckDB 读 CSV 做轻量探索是高效补充。

Q62 建议的第一周学习路径?

Day1-2 合规申请提交+Demo 沙盒跑通;Day3-4 §4.2 建库+验证行数;Day5 anchor 三件套实战(§4.3);Day6 跑一个 mimic-code 概念(如 Sepsis-3);Day7 读官方 whatsnew 对照表。一周后你应该能独立写队列 SQL。

Q63 anchor_year_group 怎么用?

把去标识时间轴映射回真实 3 年窗(如 2011-2013)。用途:年代分层(诊疗惯例漂移)、疫情年段识别(2020-2022 窗)。精度天花板 3 年——别用它做更细的年代断言。

Q64 可以发表论文时公开自己的队列 SQL 吗?

可以且应该——队列 SQL 是方法学的核心资产;其中不含原始数据(列名/阈值/漏斗数字均可公开)。确保 SQL 里没有嵌入任何患者行。

Q65 想研究"急诊拥挤"用什么?

MIMIC-IV-ED 模块(425,028 ED 停留)+ IV 的 transfers/admissions;拥挤度量与流程挖掘配方见 489 条目(MIMICEL)——其全部方法论在本库+ED 模块上可复用。

Q66 图神经网络/时序模型怎么组织数据?

事件流视角(§7.4 MEDS)或 stay 级宽表(§7.1 喂法 4)二选一起步;图结构(患者-医护-药物)可用 provider/caregiver/poe 构边——记得脱敏 ID 只做聚合级结论。

Q67 outputevents 的尿量 itemid 怎么找?

d_items 检索 Foley/Void/Condom Cath 等 label;建项目白名单表并记录来源。尿量分析注意 patientweight 缺失(体重归一分母)。

Q68 inputevents 和 prescriptions 都是药,用哪个?

不同证据链:inputevents 是 ICU 输液泵执行记录(icu 模块),prescriptions 是医嘱(hosp 模块)。ICU 内血管活性药暴露用 inputevents(精确速率),住院口径用药走四链(§2.5)。

Q69 ingredientevents 是什么?

IV 新增表:把输液拆到药物成分级(同一袋液体里的多种成分各一行)。剂量-反应研究用成分级而非液体级——测量精度的代际提升。

Q70 住院和 ICU 的时间窗怎么对齐?

hadm_id 桥接 + admittime/dischtime 定住院窗,intime/outtime 定停留窗;两窗嵌套(ICU 停留在住院内)。跨模块特征窗先画时间轴再写 SQL。

Q71 DRG 和 ICD 什么关系?

ICD 是诊断/操作编码(临床语义),DRG 是病例分组(结算语义)。drgcodes 用于疾病负担/资源利用研究;勿把 DRG 当诊断用。

Q72 hcpcsevents 是什么?

HCPCS 操作/服务编码(替代 III 的 cptevents):床旁操作、耗材、部分门诊服务。d_hcpcs 是配套字典。

Q73 services 表有什么用?

住院期间的医疗团队(service)流转记录——研究"谁在管这个患者"的 team 维度入口;与 transfers(空间流转)互补。

Q74 transfers 表怎么读?

院内单元流转(eventtype:ED/ward/icu 等);icustays 就是从它派生的。流程挖掘/拥挤研究的主战场——489 条目(MIMICEL)的全部方法论直接适用。

Q75 insurance 列在 v3.0 变了什么?

v3.0 保险分类标准化(Medicare/Medicaid/Private/Self-pay/No charge/Other,对齐 NIS 口径)——跨版本保险构成统计不可直接比(字段语义变了)。

Q76 language 列能研究什么?

v3.0 语言列标准化——沟通障碍/口译需求的代理变量。注意缺失模式与"英语默认"偏差,分层报告。

Q77 哪里查某张表的官方文档?

mimic.mit.edu 每表一页(字段/行数/语义/注意事项);whatsnew 页列版本间变更。表级问题先查官方文档再问社区。

Q78 报错 relation mimiciv_hosp.patients does not exist?

schema 没建或 search_path 未设——mimic-code 用 mimiciv_hosp/mimiciv_icu 双 schema;SET search_path 或 SQL 里显式限定 schema 名。

§10 附录

§10.1 口径存照

  • 存照 A:v3.0 发布日期官方两处表述并存——主页 release notes 记 July 23,另一官方文本记 July 19;本条目以 July 23 为主口径,引用日期时注明出处页面。
  • 存照 B:核心行数四层口径并存——v2.0(315,460/454,324/76,943)、v2.1-v2.2(299,712/431,231/73,181)、v3.x(364,627/546,028/94,458);ICU 唯一患者 50,920 为 v2.2 论文口径。任何行数引用必须携带版本。
  • 存照 C:anchor_age=91 为 HIPAA 归并值(>89 岁全体统一记 91),官方文档明确其语义;“91 岁"在统计报告中应写作”≥90 岁"。
  • 存照 D:"MIMIC-IV 有约 30 万患者"为 v2.x 时代模糊语;v3.x 应为约 36.5 万(总)/22.3 万(有住院)。文献数字冲突时按论文版本归因。
  • 存照 E:"2016 年后全部住院应有 emar 记录"是官方对部署完成态的描述性承诺,非逐行完整性验证;2014-2016 为渐进部署期,覆盖率实测因定义而异。
  • 存照 F:LLM 条款以 PhysioNet 2025-09-24 官方公告为准(禁 API/在线平台传输、零保留、不训练、无人工审核、推荐本地部署);后续若有更新以官方最新文本为准。
  • 存照 G:ICD-10 切换时点表述为"2015 年末-2016 年初随美国全国要求"——医院级精确切换日以机构记录为准,本条目不给具体日期。
  • 存照 H:ICU 停留占住院比例 42.3%、有住院占比 61.3% 等比值为本条目推算(官方数字相除),官方页面未直接给出。

存照 I(保险分类口径的版本差异):v3.0 对齐 NIS 的六分类(Medicare/Medicaid/Private/Self-pay/No charge/Other)与 v2.x 原始保险字段语义不同——跨版本保险构成比较必须声明版本(§6.6 坑点 8 的变体)。

存照 J(AKI/尿量配方的教学定位):§7.13 为理解机制的教学框架;正式研究以 mimic-code 官方概念 SQL 为准——stage 定义与体重 fallback 的实现细节以官方仓库当前版本为准,本条目不承诺其行级等价。

存照 K(BigQuery 同步状态的时效性):"BigQuery 曾停留在 v2.2"是 2024 年秋官方公告的状态描述;后续同步进度以 PhysioNet 条目页实时公告为准(§6.11 订阅协议),本条目不追踪云端版本的未来变化。

§10.2 引文清单

  1. Johnson AEW, Bulgarelli L, Shen L, et al. MIMIC-IV, a freely accessible electronic health record dataset. Scientific Data 10:1 (2023). DOI 10.1038/s41597-022-01899-x.
  2. PhysioNet. MIMIC-IV (v3.1). https://physionet.org/content/mimiciv/ (release notes 全版本链;DOI 10.13026/kpb9-mt58)
  3. MIMIC-IV 官方文档站. https://mimic.mit.edu/ (whatsnew 逐表对照;anchor 机制;模块关联指引)
  4. MIT-LCP. mimic-code. https://github.com/MIT-LCP/mimic-code (建库/概念 SQL/基准脚本)
  5. PhysioNet. Medical Information Mart for Intensive Care IV (v3.0). DOI 10.13026/hxp0-hg59.
  6. PhysioNet. 使用政策公告(2025-09-24):生成式 AI/LLM 服务与受控数据. (DUA 第三方传输禁令与本地部署建议)
  7. PhysioNet. 衍生数据集指南(2024-04-24):Ext 命名与同协议分享要求.
  8. MIMIC-IV Demo (v2.2). DOI 10.13026/dp1f-ex47.(100 患者开放子集,ODbL 1.0)
  9. Goldberger AL, et al. PhysioBank, PhysioToolkit, and PhysioNet. Circulation 101(23):e215-e220 (2000).
  10. Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data 3:160035 (2016).(III 对照条目论文)

§10.3 与本系列其他条目的关系

  • 486-488(波形三库):信号视角支系;IV 不与其做患者级键接(波形库的 matched 子集挂 III 体系),联用为概念级对齐。
  • 489(MIMICEL):流程视角条目,基于 MIMIC-IV-ED(本库姊妹模块);拥挤/流程挖掘方法论可平移到 IV 的 ED 人群。
  • 490(MIMIC-III)/491(III Demo):前任主库与教学沙盒;§4.6 的对照迁移表是 490 条目 §4.x 的续篇——两库间无患者级键接。
  • 493(nosocomial-risk-mimic)/494(phenotype-annotations-mimic):基于 MIMIC 系临床数据的专用标注/风险数据集——本条目为其结构化上游。
  • 495(paediatric-intensive-care):儿科重症条目——恰与"IV 移除新生儿/仅成人"互补,儿科研究者从 MIMIC 家族转向独立儿科库的生态位。

§10.4 变更日志

  • 2026-09-20:初版(order 492)。三重信源核查完成(PhysioNet 官方 release notes 全版本链/Sci Data 2023 论文/2025-09 LLM 政策公告),口径存照 A-H 落档;版本行数对照、anchor 三件套实战、药物四链 SQL、holdout 制度、itemid 回归档案、LLM 合规配方纳入。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mimicel — 共享标签:电子健康记录 / 公共卫生与流行病学
  • mimiciii-demo — 共享标签:电子健康记录 / 公共卫生与流行病学
  • maternal-ultrasound-nutrition — 共享标签:电子健康记录 / 公共卫生与流行病学
  • hrs — 共享标签:电子健康记录 / 公共卫生与流行病学
  • cdsl-covid-data-shared-learning — 共享标签:电子健康记录 / 公共卫生与流行病学
  • seer-nci — 共享标签:电子健康记录 / 公共卫生与流行病学
  • openfda — 共享标签:电子健康记录 / 公共卫生与流行病学
  • gemini — 共享标签:电子健康记录 / 公共卫生与流行病学
  • framingham — 共享标签:电子健康记录 / 公共卫生与流行病学
  • charls — 共享标签:电子健康记录 / 公共卫生与流行病学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集