MIMIC-III — 经典重症监护数据库 AI-Ready Wikipedia | 千方病案医数集

医疗 AI 领域被引用最多的开放 ICU 数据集 · 4.6 万患者 · 引用 10,000+

来源 MIT 计算生理学实验室 & 贝斯以色列女执事医疗中心 url: https://physionet.org/content/mimiciii/发布时间: 2026-09-05最后更新: 2026-09-05 阅读 14

信息速览

数据集名称MIMIC-III — 经典重症监护数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型约 6.2GB CSV / 约 48GB PostgreSQL,46,520 名患者,2001-2012 年数据,ICD-9 编码,已停更 v1.4,需 CITI 培训
规模4.6 万名患者
接入方式MIT 计算生理学实验室 & 贝斯以色列女执事医疗中心 url: https://physionet.org/content/mimiciii/
AI 就绪度

数据集封面

MIMIC-III — 经典重症监护临床数据库 AI-Ready Wikipedia


INFOBOX

数据集名称 MIMIC-III Clinical Database
英文全称 Medical Information Mart for Intensive Care III
别名/简称 MIMIC-III、MIMIC3、MIMIC-III v1.4
疾病分类 重症监护全疾病谱(ICD-11:1G4Z 脓毒症 / CB4Z 心力衰竭 / CA4Z 肺炎 / 8B6Z 急性肾损伤等多系统疾病)
SNOMED CT 133834002 Critical care medicine (procedure) / 91302008 Sepsis / 84114007 Heart failure / 233604007 Pneumonia(详见 §2.2)
数据模态 结构化 EHR、时序(床旁监护)、自由文本(临床笔记)
AI 任务类型 死亡预测、失代偿预警、住院时长预测、表型分类、脓毒症早期预警、生存分析、临床文本 NLP、强化学习治疗策略
样本总数 46,520 名患者 / 58,976 次住院 / 61,532 次 ICU 入住 / 26 张关系表
数据大小 ~6.2 GB(CSV 压缩包)/ ~48 GB(PostgreSQL 导入后,建议预留 100 GB 磁盘)
数据格式 CSV(gzip)/ PostgreSQL / Google BigQuery / AWS Athena
许可证 PhysioNet Credentialed Health Data License 1.5.0
访问级别 申请审核(注册 PhysioNet + 完成 CITI 培训 + 签署 DUA)
DUO 标签 HMB, NPUNCU, PUB
语言 英文
首发日期 2015-08-25(v1.0)/ 2016-05-24(Scientific Data 论文发表)
最后更新 2016-09-04(v1.4,最终版,此后停止更新)
发布机构 MIT 计算生理学实验室(LCP) & 贝斯以色列女执事医疗中心(BIDMC)
官方主页 https://physionet.org/content/mimiciii/
下载地址 https://physionet.org/content/mimiciii/1.4/
DOI 10.1038/sdata.2016.35(论文)/ 10.13026/C2XW26(数据集 v1.4)
引用次数 10,800+(Google Scholar,截至 2025-12)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 文档与生态顶尖、社区基准成熟;扣分项:已停更、双系统结构断层、审计行未清理、无官方划分
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-9 与 ICD-11/SNOMED CT 映射、ICU 类型与临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(双系统 itemid 映射、三级主键体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 MIT LCP、BIDMC、PhysioNet 无任何商业利益关联。本页面不销售 MIMIC-III 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 MIT、BIDMC 或 PhysioNet 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MIMIC-III 要求用户完成 CITI Program 的 “Data or Specimens Only Research” 培训并通过 PhysioNet 凭证化申请、签署数据使用协议(DUA)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

MIMIC-III 是 MIT 计算生理学实验室与波士顿贝斯以色列女执事医疗中心(BIDMC)于 2016 年联合发布的经典重症监护公开数据库,包含 46,520 名患者、61,532 次 ICU 入住的脱敏临床数据(2001-2012 年),覆盖生命体征、实验室检查、用药、ICD-9 诊断编码和 208 万篇临床文本,共 26 张关系表。

它的历史地位独一无二:这是全球第一个可以自由获取的大规模 ICU 数据库,也是医疗 AI 领域被引用最多的开放 ICU 数据集——原始论文在 Google Scholar 的引用已超过 10,000 次(截至 2025-12)。一句话概括:如果你读到一篇 2016-2021 年间发表的 ICU 机器学习论文,它 90% 的概率是用 MIMIC-III 训练的

你可以用它来:复现那个时代的经典 ICU AI 论文、在 Harutyunyan 标准基准上训练死亡预测与住院时长模型、挖掘出院小结等临床文本做 NLP 研究、或者作为教学数据集带学生入门医疗数据科学。新课题若需要当代临床数据,请优先考虑其后继者 MIMIC-IV。

§1.1 摘要

MIMIC-III 是 MIMIC 系列的第三代数据库,也是让整个医疗 AI 领域"破圈"的版本。它在 MIMIC-II(2011,约 32,000 名患者)基础上新增约 20,000 次 ICU 入住、医师病程记录、用药管理记录、CPT 与 DRG 计费编码,将数据延伸到 2012 年,最终形成 46,520 名患者、58,976 次住院、61,532 次 ICU 入住的规模。数据来自 BIDMC 的两代 ICU 信息系统——2001-2008 年的 Philips CareVue 与 2008-2012 年的 iMDSoft MetaVision——这一"双系统"结构是理解全库一切怪癖的钥匙。数据库以关系型结构发布(26 张表,PostgreSQL 或 CSV),全部诊断采用 ICD-9-CM 编码。v1.4(2016-09-04)为最终版本,此后永久冻结,由 MIMIC-IV(2020 起)接棒维护。

§1.2 战略价值分析

范式开创维度:MIMIC-III 之前,重症监护研究被锁在各医院的专有数据孤岛里,单次数据获取的伦理审批与清洗周期以年计。MIMIC-III 首次证明了一条可行路径:将单中心 ICU 数据彻底脱敏、以"CITI 培训 + 数据使用协议"的凭证化方式向全球开放。这套模式后来被 MIMIC-IV、eICU、AmsterdamUMCdb 等几乎所有开放重症数据库沿用,可以说 MIMIC-III 定义了"公开 EHR 研究"这一学术范式本身。

生态推动维度:围绕 MIMIC-III 生长出了医疗 AI 领域最成熟的工具生态——MIT-LCP 官方的 mimic-code 概念仓库(SOFA、SAPS-II、Sepsis-3 等标准化定义)、YerevaNN 的 mimic3-benchmarks 四大任务基准、MLforHealth 的 MIMIC-Extract 特征管道。Harutyunyan 等人 2019 年发布的固定 train/test 划分让不同论文的结果第一次可以严格比较,McDermott 等人 2020 年基于 19 篇复现论文的元分析又成为"基准是否饱和"讨论的经典案例。这套"数据—基准—元分析"的完整闭环,至今仍是评估任何新医疗数据集的参照系。

临床影响维度:MIMIC-III 上诞生了一批具有真实临床想象力的工作,最具代表性的是 Komorowski 等人 2018 年发表于 Nature Medicine 的 “AI Clinician”——用强化学习从 MIMIC-III 中学习脓毒症的液体与血管活性药剂量策略,并在 eICU 上完成外部验证。这类工作把 ICU AI 从"预测风险"推进到"建议治疗",其影响延续至今。

§1.3 横向对比

数据集 患者数 ICU 入住 模态 时间跨度 核心差异化
MIMIC-III 46,520 61,532 结构化 EHR + 临床文本 2001-2012 被引最多的经典版;含 CareVue 时代数据与 NICU 新生儿;已冻结
MIMIC-IV 364,627 94,458 结构化 EHR + 文本 + CXR + ECG 2008-2022 四模态模块化,活跃维护,新课题首选
eICU-CRD 200,859 200,000+ 结构化 EHR 2014-2015 多中心(208 家美国医院),无文本
AmsterdamUMCdb 23,106 23,106 结构化 EHR 2003-2016 欧洲首个大规模 ICU 公开库,GDPR 合规
HiRID 33,905 33,905 结构化 EHR 2008-2016 2 分钟采样率,超高时间分辨率

MIMIC-III 的不可替代性不在规模,而在三点:文献引用密度最高(复现研究几乎绕不开它)、覆盖 CareVue 时代(2001-2008)这一 MIMIC-IV 不含的历史窗口、以及内置 208 万篇临床文本(MIMIC-IV 的文本模块需单独申请)。

§1.4 版本演进时间轴

时间 事件
1996 Moody & Mark 发表 MIMIC 项目雏形(波士顿 Beth Israel Hospital 监护仪数据)
2003 最早的 MIMIC 数据库发布(约 100 名患者,1992-1999 年 MICU/SICU/CCU 数据)
2011-05 MIMIC-II v2.6 发布(Saeed et al., Critical Care Medicine;约 32,000 名患者)
2015-08-25 MIMIC-III v1.0 首发(内部测试性质)
2015-11-20 v1.2 数据修复迭代(v1.1 为约 2015 年底的小版本修复)
2015-12-10 v1.3 数据修复迭代
2016-05-24 Scientific Data 论文在线发表(Johnson et al., DOI: 10.1038/sdata.2016.35)
2016-09-04 v1.4 最终版:修复 IO 单位错误(#121)、DBSOURCE 标注错误(#122)、IO 精度问题(#123),此后永久冻结
2017-03 Harutyunyan 基准 arXiv 首发,定义四任务标准划分
2019-06 Harutyunyan et al. 期刊版发表(Scientific Data 6:96),基准成为社区事实标准
2020-08 MIMIC-IV v1.0 发布,MIMIC-III 停止更新
2023 MIMIC-III CareVue subset 发布(仅含不在 MIMIC-IV 中的患者,支持无重叠联合分析)

§1.5 典型 AI 应用场景

  1. 经典论文复现与方法学研究:2016-2021 年间 ICU 机器学习文献的事实训练场,是复现性研究、方法学对比、教学的唯一标准选择。
  2. ICU 死亡风险预测:以 Harutyunyan 基准的 48 小时窗口院内死亡预测为代表任务,队列 21,000+ 次 ICU 入住、死亡率 13.23%。
  3. 脓毒症研究与强化学习治疗策略:从 Sepsis-3 队列定义到 Komorowski 的 AI Clinician 剂量策略,MIMIC-III 是脓毒症 AI 文献的主战场。
  4. 临床文本 NLP:NOTEEVENTS 内置 208 万篇护理记录、医师病程、出院小结与放射学报告,支撑临床命名实体识别、去标识化与主题模型研究。
  5. 新生儿重症监护研究:含 7,870 名 NICU 新生儿(2001-2008),是公开数据集中罕见的 NICU 资源(MIMIC-IV 已不含)。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

MIMIC-III 覆盖 ICU 全疾病谱。其核心高频诊断(ICD-9)到 ICD-11 的映射如下:

ICD-9-CM(库内编码) 中文名称 ICD-11 对应 住院占比(Johnson 2016 Table 2)
414.01 冠状动脉粥样硬化(本国人造冠状动脉) BA52.Z 冠状动脉粥样硬化性心脏病 约 7.1%(全库第一高频诊断)
038.9 未特指败血症 1G4Z 脓毒症,未特指 约 4.2%(第二高频)
410.71 急性前壁心肌梗死 BA41 急性心肌梗死 第三高频(急性心梗相关编码群)
428.0 充血性心力衰竭 CB4Z 心力衰竭,未特指 高频共病
584.9 急性肾衰竭 8B6Z 急性肾损伤,未特指 高频共病
518.81 急性呼吸衰竭 CB41 呼吸衰竭 高频
599.0 尿路感染 GC08 尿路感染 高频感染
250.00 2 型糖尿病 5B55.Z 2 型糖尿病 高频共病

为什么 ICD-9 是历史资产也是历史包袱:MIMIC-III 全库为纯 ICD-9-CM 编码——BIDMC 直到 2015 年 10 月才切换 ICD-10,而库内数据止于 2012 年。这意味着:与 2015 年前的计费、流行病学文献完全兼容(资产);但与 MIMIC-IV、eICU 等当代数据集对接时必须经 CMS GEMs 或 AHRQ CCS 映射表转换(包袱)。D_ICD_DIAGNOSES 字典含 14,567 个 ICD-9 诊断码,D_ICD_PROCEDURES 含 3,882 个 ICD-9 操作码。

§2.2 SNOMED CT 映射

临床场景 ICD-9-CM ICD-10-CM 桥接 SNOMED CT SNOMED CT 术语
脓毒症 038.9 / 995.91 A41.9 91302008 Sepsis (disorder)
冠状动脉粥样硬化 414.01 I25.10 53741008 Coronary arteriosclerosis (disorder)
急性心力衰竭 428.0 I50.9 84114007 Heart failure (disorder)
肺炎 486 J18.9 233604007 Pneumonia (disorder)
急性肾损伤 584.9 N17.9 14669001 Acute renal failure syndrome (disorder)
急性呼吸衰竭 518.81 J96.00 65710008 Acute respiratory failure (disorder)
重症监护 Z51.89 133834002 Critical care medicine (procedure)
机械通气 96.70-96.72(操作码) 5A1935Z 243141005 Mechanical ventilation (regime/therapy)

§2.3 疾病简介

MIMIC-III 面向重症监护室内全部疾病谱。ICU 患者以多器官功能障碍为特征,成人队列中最常见的入院诊断为冠心病、脓毒症、急性心肌梗死、心力衰竭与呼吸衰竭。成人口径(≥16 岁,38,597 名患者 / 53,423 次 ICU 入住)的 ICU 死亡率为 8.5%、院内死亡率为 11.5%,是普通病房的数倍。ICU 资源消耗约占医院总支出的 15%-20%,任何能提升 ICU 决策质量的工具都具有显著的临床与经济价值——这正是过去十年间一万余篇论文选择在此数据上训练模型的根本动因。

§2.4 临床任务定义

AI 任务 临床定义 标准参考 在 MIMIC-III 中的操作化
院内死亡预测 住院期间全因死亡 出院处置记录 ADMISSIONS.HOSPITAL_EXPIRE_FLAG = 1
ICU 死亡预测 ICU 期间全因死亡 ICU 系统记录 ICUSTAYS 时间窗 ∩ ADMISSIONS.DEATHTIME
脓毒症队列定义 Sepsis-3:疑似感染 + SOFA ≥ 2 Singer et al. (2016), JAMA mimic-code concepts 的 sepsis3 物化视图(MIMIC-III 专用 SQL)
住院时长预测 ICU 入科到出科天数 Harutyunyan 基准 10 档分类 ICUSTAYS.LOS(浮点天数)
表型分类 25 种急性照护表型多标签 Harutyunyan 基准(基于 ICD-9 分组) mimic3-benchmarks 的 phenotype 任务定义
AKI 分期 KDIGO 2012 肌酐标准 KDIGO (2012) mimic-code concepts 的 kdigo 脚本

§2.5 患者人群特征

维度 特征
数据来源 单中心:贝斯以色列女执事医疗中心(BIDMC),美国马萨诸塞州波士顿,哈佛医学院附属三级教学医院(700+ 床位)
采集时间 2001-06-01 至 2012-10-31(约 11.4 年)
规模(全库口径) 46,520 名患者 / 58,976 次住院 / 61,532 次 ICU 入住
规模(成人口径,≥16 岁) 38,597 名患者 / 49,785 次住院 / 53,423 次 ICU 入住
新生儿 7,870 名 NICU 新生儿(仅 2001-2008 年,CareVue 时代)
年龄(成人) 中位数 65.8 岁(Q1-Q3:52.8-77.8)
性别(成人) 男性 55.9% / 女性 44.1%
种族 白人为主(BIDMC 人群特征);ADMISSIONS.ETHNICITY 字段约 40 种取值,含 “UNABLE TO OBTAIN”/“DECLINED”
入院类型 EMERGENCY / ELECTIVE / URGENT / NEWBORN
保险类型 Medicare / Private / Medicaid / Government / Self Pay
ICU 入住时长 中位数 2.1 天(Q1-Q3:1.2-4.6)
住院时长 中位数 6.9 天(Q1-Q3:4.1-11.9)
每次住院平均数据量 约 4,579 条床旁观察(CHARTEVENTS)+ 380 条实验室测量(LABEVENTS)

覆盖的 ICU 类型(成人 5 类 + 新生儿 1 类,基于 53,423 次成人 ICU 入住)

ICU 类型 中文 入住次数 占比
MICU 内科监护室 21,087 39.5%
CSRU 心脏外科术后恢复室 9,854 18.4%
SICU 外科监护室 8,891 16.6%
CCU 冠心病监护室 7,726 14.5%
TSICU 创伤外科监护室 5,865 11.1%
NICU 新生儿监护室(另计 7,870 名新生儿) 2001-2008

§2.6 金标准/参考标准

数据来源 记录方式 产生者 金标准性质
床旁生命体征(CHARTEVENTS) 约每小时 1 个数据点,护士验证(nurse-verified)后写入 ICU 信息系统 BIDMC ICU 护理团队;Philips CareVue(2001-2008)/ iMDSoft MetaVision(2008-2012) 临床常规记录,存在录入误差与整点偏好
实验室检查(LABEVENTS) 医院检验科系统定量测定 BIDMC 检验科(CLIA 认证体系) 定量标准,覆盖全住院期
ICD-9 诊断/操作编码 出院后由编码员回顾性分配 BIDMC 健康信息管理部门认证编码员 行政编码,反映计费需求,存在主诊断选择偏误
院内死亡 住院系统自动记录 BIDMC 住院系统 客观事件,高度可靠(DOD_HOSP / HOSPITAL_EXPIRE_FLAG)
院外死亡 美国社会安全局死亡主文件匹配 SSA Death Master File 覆盖不全且滞后(2011 年后 DMF 政策变更致覆盖率进一步下降)
临床文本(NOTEEVENTS) 护理/医师/放射科常规书写,共 2,083,180 篇、15 类 BIDMC 临床团队 自由文本,经 Neamatullah et al. 2008 自动去标识算法处理

脱敏规则(所有下游分析的前提):移除全部 18 类 HIPAA 标识符;所有日期向未来随机偏移至 2100-2200 年区间,同一患者偏移量一致(间隔保持),保留一天内时刻、星期几与大致季节,不保留真实年份;>89 岁患者 DOB 被极端前移,表观年龄约 300 岁,计算年龄时必须做封顶处理(见 §6.5 坑点 6)。


§3 数据集规格

§3.0 版本抉择矩阵

MIMIC-III 与 MIMIC-IV 不是新旧替换关系,而是适用场景不同的两个数据集。30 秒选型:

你的需求 推荐数据集 大小 理由
复现 2016-2021 年经典 ICU AI 论文;需要 CareVue 时代(2001-2008)数据;需要内置护理文本或 NICU 新生儿 MIMIC-III v1.4 ~6.2 GB(CSV zip) 唯一含 CareVue 系统数据与 7,870 名新生儿的版本;NOTEEVENTS 208 万篇文本内置无需单独申请;历史论文队列定义均基于 III
开新课题;需要当代临床实践、最大样本量、多模态扩展 MIMIC-IV v3.1 ~7 GB(CSV zip) 364,627 名患者、活跃维护、模块化架构,可联动 CXR/ECG 扩展
临床文本 NLP(出院小结、放射报告)为主 MIMIC-IV-Note 随 note 模块 50.6 万篇出院小结 + 放射报告,结构更干净(需单独 DUA);若需护理记录原文则回选 MIMIC-III
急诊流程/分诊研究 MIMIC-IV-ED ~0.5 GB 50 万次急诊就诊专门模块;MIMIC-III 仅有急诊挂号时间字段(EDREGTIME/EDOUTTIME),无独立急诊模块

一句话结论:复现老论文、要 CareVue 时代数据或护理文本、要新生儿 → 选 MIMIC-III;其余一律选 MIMIC-IV。

MIMIC-III vs MIMIC-IV 关键差异速查

维度 MIMIC-III v1.4 MIMIC-IV v3.1
时间跨度 2001-2012 2008-2022
患者数 46,520 364,627
表结构 26 张扁平大表(字段全大写) 模块化 hosp/icu/ed/note(字段全小写)
诊断编码 纯 ICD-9-CM ICD-9 + ICD-10(icd_version 列区分)
ICU 信息系统 CareVue + MetaVision 双系统 仅 MetaVision
入量表 INPUTEVENTS_CV + INPUTEVENTS_MV 两张 inputevents 单表
ICU 主键 ICUSTAY_ID stay_id(改名)
年龄 DOB 自算,>89 岁表观约 300 岁需封顶 anchor_age 直接可用(已封顶 91)
日期偏移 偏移至 2100-2200,保留星期/季节,丢失真实年份 保留 anchor_year_group 三年区间
审计行 含 ERROR=1 等审计行,需自行过滤 已移除
临床文本 NOTEEVENTS 208 万篇内置 note 模块(需单独 DUA)
新生儿 含 7,870 名 NICU 不含
跨库链接 subject_id 各自独立随机化,无法跨库链接同一患者 同左
维护状态 已冻结(2016-09-04) 活跃维护

§3.1 模态详细说明

MIMIC-III 包含三大数据模态:

  1. 结构化 ICU 床旁时序数据:CHARTEVENTS(3.31 亿行,全库最大表)收录生命体征、呼吸机参数、GCS、神志与护理观察;INPUTEVENTS(CareVue/MetaVision 两张表)收录静脉输液与血管活性药;OUTPUTEVENTS 收录尿量与引流。生命体征为护士验证的约每小时 1 个数据点。
  2. 医院系统数据:LABEVENTS(2,785 万行实验室检查,覆盖全住院期)、PRESCRIPTIONS(416 万行处方)、MICROBIOLOGYEVENTS(63 万行微生物培养药敏)、DIAGNOSES_ICD / PROCEDURES_ICD(ICD-9 编码)、DRGCODES / CPTEVENTS(计费编码)。
  3. 自由文本:NOTEEVENTS 2,083,180 篇,含 Discharge summary / Nursing / Physician / Radiology / ECG / Echo / Respiratory 等 15 个类别,TEXT 列约 4.0 GB。

§3.2 样本量拆分(26 张表完整清单,v1.4 精确行数)

A. 患者追踪与住院管理(6 张)

表名 行数 内容
ADMISSIONS 58,976 住院记录:入出院/死亡时间、入院类型、保险、种族、HOSPITAL_EXPIRE_FLAG
PATIENTS 46,520 患者:GENDER、DOB、DOD、DOD_HOSP、DOD_SSN、EXPIRE_FLAG
ICUSTAYS 61,532 ICU 入住:DBSOURCE(carevue/metavision)、FIRST/LAST_CAREUNIT、INTIME/OUTTIME、LOS
CALLOUT 34,499 ICU 出科申请与床位调度
SERVICES 73,343 诊疗服务变更(PREV/CURR_SERVICE)
TRANSFERS 261,897 病区/床位转移全程记录

B. ICU 床旁数据(8 张)

表名 行数 内容
CHARTEVENTS 330,712,483 最大表:全部床旁观察/监护数值(CSV 解压约 35.5 GB)
INPUTEVENTS_CV 17,527,935 CareVue 系统入量(累计量制)
INPUTEVENTS_MV 3,618,991 MetaVision 系统入量(速率制,结构更优)
OUTPUTEVENTS 4,349,218 尿量、引流等出量
DATETIMEEVENTS 4,485,937 日期型事件
PROCEDUREEVENTS_MV 258,066 MetaVision 操作事件(仅 MV 系统)
NOTEEVENTS 2,083,180 全部自由文本(约 4.0 GB)
CAREGIVERS 7,567 医护人员(CGID、LABEL、DESCRIPTION)

C. 医院系统数据(7 张)

表名 行数 内容
LABEVENTS 27,854,055 实验室检查(覆盖全住院期,不限 ICU)
PRESCRIPTIONS 4,156,450 处方:DRUG、DOSE、ROUTE、STARTDATE/ENDDATE(日期粒度,非时间戳)
MICROBIOLOGYEVENTS 631,726 微生物培养与药敏
DIAGNOSES_ICD 651,047 ICD-9 诊断(SEQ_NUM 主次排序,每次住院最多 39 个)
PROCEDURES_ICD 240,095 ICD-9 操作
CPTEVENTS 573,146 CPT 计费操作记录
DRGCODES 125,557 DRG 分组(含 multiple DRG 类型)

D. 字典表(5 张,前缀 D_)

表名 行数 内容
D_ITEMS 12,487 CHARTEVENTS/IO 项目字典;9,059 条为 CareVue 旧项(itemid < 220000),其余为 MetaVision
D_LABITEMS 753 实验室项目字典(itemid 50000+ 段,如 50820 = 血气 pH)
D_ICD_DIAGNOSES 14,567 ICD-9 诊断码 → 名称
D_ICD_PROCEDURES 3,882 ICD-9 操作码 → 名称
D_CPT 134 CPT 编码分类

§3.3 数据格式详情

形态 格式 说明
发布文件 26 个 .csv.gz + 校验和 PhysioNet 官方 zip,扁平目录
本地数据库 PostgreSQL(官方建库脚本) MIT-LCP/mimic-code 的 buildmimic/postgres;也支持 MySQL/MonetDB 社区脚本
云端 Google BigQuery / AWS Athena BigQuery 项目:physionet-data.mimiciii_clinical(+ mimiciii_derived / mimiciii_notes
试用版 MIMIC-III demo 100 名患者,免认证开放下载,适合调试管道

§3.4 存储大小

形态 大小 备注
CSV 压缩包(26 个 .csv.gz) ~6.2 GB PhysioNet 官方 zip
解压后 CSV ~46-50 GB CHARTEVENTS 单表约 35.5 GB
PostgreSQL 导入后 ~48 GB 含索引更大,建议预留 100 GB 磁盘
NOTEEVENTS(TEXT 列) ~4.0 GB 全库最大的文本资产

§3.5 标注方式

MIMIC-III 无传统手工标注,标签来源三层:

  1. 客观事件(最可靠):院内死亡、ICU 出入科时间——EHR 系统自动记录。
  2. 定量测量(需自定义阈值):实验室检查与床旁监护值——由检验系统与护士验证记录产生,"异常"需按临床标准(KDIGO、Sepsis-3 等)自行定义。
  3. 行政编码(有噪声):ICD-9/DRG/CPT 编码——由编码员按计费需求回顾性分配,存在主诊断选择偏误。

§3.6 标注者资质

不适用传统标注者概念。床旁数据的产生者是 BIDMC ICU 注册护士(每条 CHARTEVENTS 经护士验证后入库);检验数据来自 CLIA 认证实验室;ICD-9 编码由健康信息管理部门的认证编码专业人员分配。文本去标识由 Neamatullah et al. 2008 的自动算法完成(BMC Medical Informatics and Decision Making,DOI: 10.1186/1472-6947-8-32)。

§3.7 数据采集时间范围

2001-06-01 至 2012-10-31。其中 2001-2008 年约 38,000 次 ICU 入住经 Philips CareVue 系统采集,2008-2012 年经 iMDSoft MetaVision 采集。注意:所有日期已脱敏偏移至 2100-2200 年,真实年份不可恢复(见 §6.5 坑点 5)。

§3.8 地理覆盖

单中心——贝斯以色列女执事医疗中心(BIDMC),美国马萨诸塞州波士顿。单中心来源是 MIMIC-III 最核心的泛化性限制因素(详见 §7.3)。

§3.9 采集设备规格

系统/设备 型号/版本 覆盖时段 说明
ICU 信息系统 1 Philips CareVue(M2331A / M1215A) 2001-2008 约 38,000 次 ICU 入住;itemid < 220000
ICU 信息系统 2 iMDSoft MetaVision ICU 2008-2012 itemid ≥ 220000;入量为速率制,结构更优
院外死亡登记 美国社会安全局死亡主文件(SSA Death Master File) 生成 PATIENTS.DOD_SSN
文本去标识 Neamatullah et al. 2008 自动算法 处理全部 NOTEEVENTS 自由文本

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 数据源系统 BIDMC 住院系统、检验科系统、计费系统 + ICU 床旁设备 临床数据实时产生于诊疗与监护过程
2. ICU 中间层 Philips CareVue(2001-2008)→ iMDSoft MetaVision(2008-2012) 床旁数值经 ICU 信息系统归档;两系统 itemid 完全不同,构成 2008 年数据断层
3. 提取与整合 MIT LCP 与 BIDMC Information Systems 联合 ETL 跨系统抽取、按患者对齐;液体入量因两系统口径差异拆分为 INPUTEVENTS_CV / INPUTEVENTS_MV 两张表
4. 去标识化 MIT LCP 脱敏管道 + Neamatullah 2008 文本算法 移除 18 类 HIPAA 标识符;日期整体偏移至 2100-2200(保留时刻/星期/季节);>89 岁 DOB 前移
5. 外部链接 SSA Death Master File 匹配院外死亡,生成 DOD_SSN
6. 公开发布 PhysioNet 平台 2015-08 v1.0 首发 → 2016-09-04 v1.4 最终版冻结;凭证化访问 + DUA

§4 数据结构详解

§4.0 目录结构预览

mimic-iii-clinical-database-1.4/
├── ADMISSIONS.csv.gz            # 住院记录(58,976 行,约 2.4 MB 压缩)
├── CALLOUT.csv.gz               # ICU 出科申请与床位调度(34,499 行)
├── CAREGIVERS.csv.gz            # 医护人员(7,567 行)
├── CHARTEVENTS.csv.gz           # 床旁观察主表(3.31 亿行,约 4 GB 压缩 / 35.5 GB 解压——最大文件)
├── CPTEVENTS.csv.gz             # CPT 计费操作(573,146 行)
├── DATETIMEEVENTS.csv.gz        # 日期型事件(449 万行)
├── DIAGNOSES_ICD.csv.gz         # ICD-9 诊断(651,047 行)
├── DRGCODES.csv.gz              # DRG 分组(125,557 行)
├── D_CPT.csv.gz                 # CPT 字典(134 行)
├── D_ICD_DIAGNOSES.csv.gz       # ICD-9 诊断字典(14,567 行)
├── D_ICD_PROCEDURES.csv.gz      # ICD-9 操作字典(3,882 行)
├── D_ITEMS.csv.gz               # 床旁项目字典(12,487 行,CareVue/MetaVision 双套 itemid)
├── D_LABITEMS.csv.gz            # 检验项目字典(753 行)
├── ICUSTAYS.csv.gz              # ICU 入住(61,532 行)
├── INPUTEVENTS_CV.csv.gz        # CareVue 入量(1,753 万行,约 2.5 GB 解压)
├── INPUTEVENTS_MV.csv.gz        # MetaVision 入量(362 万行)
├── LABEVENTS.csv.gz             # 实验室检查(2,785 万行,约 1.9 GB 解压)
├── MICROBIOLOGYEVENTS.csv.gz    # 微生物培养药敏(631,726 行)
├── NOTEEVENTS.csv.gz            # 临床文本(208 万篇,约 4 GB 解压,含 TEXT 全文列)
├── OUTPUTEVENTS.csv.gz          # 出量(435 万行)
├── PATIENTS.csv.gz              # 患者(46,520 行)
├── PRESCRIPTIONS.csv.gz         # 处方(416 万行,日期粒度)
├── PROCEDUREEVENTS_MV.csv.gz    # MetaVision 操作事件(258,066 行)
├── PROCEDURES_ICD.csv.gz        # ICD-9 操作(240,095 行)
├── SERVICES.csv.gz              # 诊疗服务变更(73,343 行)
└── TRANSFERS.csv.gz             # 病区转移(261,897 行)

§4.1 DAIMS 标准化字段描述表

核心表:PATIENTS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SUBJECT_ID INTEGER 患者唯一标识符 10006 三级主键之根 不允许缺失 正整数
GENDER VARCHAR(1) 患者性别 “M” 人口学协变量/公平性分析 偶有记录不一致 不允许缺失 “M” / “F”
DOB TIMESTAMP 出生日期(已偏移) 2080-03-15 00:00:00 年龄计算(须配合封顶) >89 岁患者被前移,表观年龄约 300 不允许缺失 偏移后时间戳
DOD TIMESTAMP 死亡日期(DOD_HOSP 与 DOD_SSN 合并值) 2148-06-30 00:00:00 生存分析终点 院外死亡依赖 SSA 匹配,覆盖不全 生存患者为 NULL(右删失) 时间戳或 NULL
DOD_SSN TIMESTAMP 社保死亡主文件死亡日期 2149-01-01 00:00:00 院外死亡/长期生存终点 2011 年后 DMF 覆盖率下降 无匹配者为 NULL 时间戳或 NULL
EXPIRE_FLAG INTEGER 是否死亡(任一来源) 1 粗粒度标签 合并口径 不允许缺失 0 / 1

核心表:ADMISSIONS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
HADM_ID INTEGER 住院唯一标识符 142345 二级主键 不允许缺失 正整数
ADMITTIME TIMESTAMP 入院时间(已偏移) 2164-10-23 21:09:00 时序锚点 整体偏移,间隔保持 不允许缺失 2100-2200 区间
ADMISSION_TYPE VARCHAR(50) 入院类型 “EMERGENCY” 分层变量;过滤新生儿 编码员分类 不允许缺失 EMERGENCY / ELECTIVE / URGENT / NEWBORN
ETHNICITY VARCHAR(200) 自报种族 “WHITE” 公平性分析 自报且约 40 种取值不规整 “UNABLE TO OBTAIN”/“DECLINED” 即信息性缺失 约 40 种取值
DIAGNOSIS TEXT 自由文本初步诊断 “SEPSIS;PNEUMONIA” 快速队列粗筛(非 ICD 金标准) 书写不规范 部分缺失 自由文本
HOSPITAL_EXPIRE_FLAG INTEGER 院内死亡标识 0 最常用靶标 极可靠 不允许缺失 0 / 1
HAS_CHARTEVENTS_DATA INTEGER 是否有床旁数据 1 队列过滤 极少数住院无床旁记录 不允许缺失 0 / 1

核心表:ICUSTAYS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ICUSTAY_ID INTEGER ICU 入住唯一标识符 206504 三级主键 不允许缺失 正整数
DBSOURCE VARCHAR(20) 来源 ICU 系统 “metavision” 区分双系统/选择 itemid v1.4 修复了早期版本错标 不允许缺失 “carevue” / “metavision”
FIRST_CAREUNIT VARCHAR(20) 首个 ICU 单元 “MICU” 亚群分层 系统记录 不允许缺失 MICU/SICU/CCU/CSRU/TSICU/NICU
INTIME TIMESTAMP ICU 入科时间 2164-10-23 23:16:00 预测窗口起点(t=0) 系统记录 不允许缺失 偏移后时间戳
OUTTIME TIMESTAMP ICU 出科时间 2164-10-27 12:05:00 LOS 计算;时间窗过滤 系统记录 不允许缺失 偏移后时间戳
LOS DOUBLE ICU 入住天数 3.54 回归/分档靶标 由 INTIME/OUTTIME 派生 不允许缺失 ≥0 浮点

核心表:CHARTEVENTS(3.31 亿行)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ITEMID INTEGER 测量项目(外键 D_ITEMS) 220045 指标选择(注意双轨) 不允许缺失 <220000 为 CareVue,≥220000 为 MetaVision
CHARTTIME TIMESTAMP 图表时间(护士录入的观察时间) 2164-10-24 05:00:00 时序对齐 存在整点偏好 不允许缺失 偏移后时间戳
STORETIME TIMESTAMP 入库时间 2164-10-24 05:38:00 审计/录入延迟分析 晚于 CHARTTIME 部分为 NULL 偏移后时间戳
VALUE TEXT 原始文本值 “98” 定性观察保留 自由录入 定性项目无 VALUENUM 文本
VALUENUM DOUBLE 数值化结果 98.0 时序特征 无创血压 ±5 mmHg 等测量误差;含离群值 定性项目为 NULL(MNAR) 因 itemid 而异
ERROR INTEGER 审计标记 0 过滤脏数据(=1 为错误/作废行) 未清理的审计行 常为 NULL 或 0 0 / 1 / NULL
WARNING INTEGER 仪器告警标记 0 数据质量过滤 系统产生 常为 0 0 / 1

§4.2 标签分布统计

临床任务 阳性率/分布 说明
院内死亡(成人口径) 11.5%(49,785 次住院) 类别不平衡约 1:7.7
ICU 死亡(成人口径) 8.5%(53,423 次 ICU 入住) 部分死亡发生在转出 ICU 后
Harutyunyan 基准队列院内死亡 13.23% 首次 ICU 入住 + 成人 + LOS ≥ 48h 等过滤后约 21,000+ 次入住
脓毒症(Sepsis-3) 发生率约 6-8%(因定义口径而异) mimic-code sepsis3 物化视图
高频诊断 414.01 冠心病 7.1% / 038.9 败血症 4.2% 按住院占比(Johnson 2016 Table 2)
新生儿占比 7,870 / 46,520 ≈ 16.9% 患者 仅 2001-2008 年,研究成人时须过滤

§4.3 关键字段描述性统计

  • 每次住院平均:约 4,579 条 CHARTEVENTS + 380 条 LABEVENTS。
  • CHARTEVENTS 覆盖 12,487 个 D_ITEMS 项目(9,059 个 CareVue 旧项 + 其余 MetaVision 项)。
  • LABEVENTS 覆盖 753 个 D_LABITEMS 项目(如 50820 = 血气 pH)。
  • 完整度最高指标(>90% ICU 入住有记录):心率、SpO₂、呼吸频率、无创血压、体温。
  • 完整度低但有临床价值指标(<30% 入住有记录):CVP、肺动脉压等有创指标(仅在置管患者中测量)。
  • NOTEEVENTS 15 类文本共 2,083,180 篇,其中 Discharge summary、Nursing、Physician、Radiology 为大头。

§4.4 数据层级关系(三级主键体系)

PATIENTS(SUBJECT_ID,46,520 人)
  └─ ADMISSIONS(HADM_ID,58,976 次住院;一名患者可多次住院)
      └─ ICUSTAYS(ICUSTAY_ID,61,532 次 ICU 入住;一次住院可多次进 ICU)
      │   ├─ CHARTEVENTS / INPUTEVENTS_CV / INPUTEVENTS_MV / OUTPUTEVENTS
      │   ├─ PROCEDUREEVENTS_MV / DATETIMEEVENTS(均有 ICUSTAY_ID)
      ├─ LABEVENTS / NOTEEVENTS(⚠️ 只有 HADM_ID,无 ICUSTAY_ID——覆盖全住院期)
      ├─ DIAGNOSES_ICD / PROCEDURES_ICD / DRGCODES / CPTEVENTS(住院级编码)
      └─ PRESCRIPTIONS / MICROBIOLOGYEVENTS / SERVICES / TRANSFERS
  • 附加 ID:ROW_ID(每表自增行号,无业务含义,MIMIC-IV 已全部删除)、CGID(医护人员)、ITEMID(项目)。
  • 高频踩坑:LABEVENTS 与 NOTEEVENTS 无 ICUSTAY_ID 列——想取"ICU 期间的化验"必须经 ICUSTAYS.INTIME/OUTTIME 时间窗二次过滤(见 §6.5 坑点 2)。

CHARTEVENTS vs LABEVENTS vs INPUTEVENTS(三表区别必答)

维度 CHARTEVENTS LABEVENTS INPUTEVENTS_CV / _MV
数据源 ICU 信息系统(双系统) 医院检验科系统 ICU 信息系统(拆两张)
覆盖时段 仅 ICU 期间 全住院期 仅 ICU 期间
内容 生命体征、呼吸机参数、GCS、护理观察 血气、生化、血液学定量结果 静脉输液、血管活性药、肠外营养
时间粒度 CHARTTIME(分钟)+ STORETIME CHARTTIME(分钟/天) CV:CHARTTIME 累计量;MV:STARTTIME/ENDTIME 速率
字典 D_ITEMS(12,487 项) D_LABITEMS(753 项) D_ITEMS
行数 3.31 亿 2,785 万 1,753 万 + 362 万

itemid 双轨制(结构性知识点):心率在 CareVue 是 itemid=211、在 MetaVision 是 itemid=220045;NIBP 收缩压为 51/455 vs 220179;SpO₂ 为 646 vs 220277。同一临床概念需同时查两套 itemid,或用 ICUSTAYS.DBSOURCE 判断该入住用哪套。D_ITEMS.DBSOURCE 列标识归属,LINKSTO 列指明该 itemid 用于哪张事件表。

§4.5 缺失值情况与信息性缺失编码

缺失类型 指标示例 缺失原因 信息性缺失编码 对 AI 的影响
MAR(工作流程驱动) 乳酸 仅在怀疑感染/休克时检查 缺失 ≈ 病情不危重 均值填充会系统性低估健康者乳酸
MNAR_clinician GCS 镇静/插管患者不评估或被设最低值 缺失 = 镇静状态 需分"镇静 vs 非镇静"子群建模
MNAR_device CVP、肺动脉压 仅在置管患者中测量 缺失 = 无导管 不可填充,缺失本身即严重度代理
MNAR_censoring DOD_SSN 院外死亡 需 SSA 匹配 生存 = 右删失 用 Kaplan-Meier/Cox 正确处理删失
记录频率信息性 生命体征 病重测得勤 测量频率本身预测死亡 建议保留"测量次数"特征

§5 数据划分与使用建议

§5.1 官方数据划分

MIMIC-III 官方不提供 train/validation/test 划分。 这是双刃剑:灵活,但导致早期论文间结果不可比。社区的事实标准解法是 YerevaNN/mimic3-benchmarks 提供的固定 train/test split(按 SUBJECT_ID 划分、四任务共用,存于 Zenodo,DOI: 10.5281/zenodo.1306527)——Harutyunyan 2019 之后约 19 篇论文、210 个模型在同一划分上报告结果。若你的目标是与文献比较,请直接使用该划分

§5.2 推荐划分策略

  1. 按 SUBJECT_ID 分组随机划分(主流):同一患者的多次住院必须落在同一侧。scikit-learn 用 GroupShuffleSplit(groups=subject_id)
  2. ⚠️ 不能按真实年份划分:MIMIC-III 的真实年份已被脱敏抹除(这是它与 MIMIC-IV 的 anchor_year_group 最大的差异)。只能用 ADMITTIME 的相对顺序或 2100-2200 伪年份做"顺序划分",其临床含义有限。
  3. 按 DBSOURCE 分层:CareVue(2001-2008)vs MetaVision(2008-2012)天然构成"前后两个时代",可用于跨系统泛化评估(注意 itemid 双轨,见 §6.5 坑点 3)。
  4. 按 ICU 类型分层:MICU / SICU / CCU / CSRU / TSICU 分层抽样,用于亚群评估。
  5. Harutyunyan 队列定义:首次 ICU 入住 + 成人 + LOS ≥ 48h,过滤后约 21,000+ 次入住(死亡率 13.23%)——复现基准时严格遵循其 extract_subjects 流程。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

patients = pd.read_csv("PATIENTS.csv.gz")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(patients, groups=patients["SUBJECT_ID"]))
train_subjects = set(patients.iloc[train_idx]["SUBJECT_ID"])
test_subjects = set(patients.iloc[test_idx]["SUBJECT_ID"])
assert len(train_subjects & test_subjects) == 0  # 患者级零泄漏验证

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按 HADM_ID 而非 SUBJECT_ID 划分(人均 1.27 次住院) GroupShuffleSplit(groups=SUBJECT_ID)
2 用全住院期 LABEVENTS 预测 ICU 早期结局(LABEVENTS 无 ICUSTAY_ID) 必须经 ICUSTAYS.INTIME/OUTTIME 时间窗过滤
3 用 DOD / DOD_HOSP / DOD_SSN 衍生特征 死亡字段只作标签与终点,严禁入模
4 NOTEEVENTS 中 discharge summary 含结局总结 文本任务排除出院小结,或严格按 CHARTTIME ≤ 预测时点过滤

§5.4 交叉验证建议

  • 标准:5 折或 10 折按 SUBJECT_ID 分组交叉验证。
  • 跨系统稳健性:以 DBSOURCE 为折叠轴做留一系统验证(train on CareVue → test on MetaVision,或反向),是 MIMIC-III 特有的"准时间外验证"。

§5.5 外部验证

在 MIMIC-III 上训练的模型,经典外部验证路径为:eICU-CRD(多中心,Komorowski AI Clinician 即在此验证)、MIMIC-IV(注意 subject_id 无法互链,只能作队列级迁移)、AmsterdamUMCdb / HiRID(跨洲泛化)。


§6 AI 就绪指南

§6.0 云端快速启动

零门槛试用(免认证):MIMIC-III demo(https://physionet.org/content/mimiciii-demo/1.4/)含 100 名患者全量 26 表,无需 CITI 培训即可下载,适合先跑通管道再申请全库。

BigQuery 免下载查询:完成 PhysioNet 认证并在账号中绑定 GCP 后,直接查询 physionet-data.mimiciii_clinical(另有 mimiciii_derived 派生概念集与 mimiciii_notes)。在 Google Colab 中配合 google.cloud.bigquery 即可 5 分钟跑通首个队列查询,每月 1 TB 免费查询额度足够原型开发。

-- BigQuery 首个查询:成人首次 ICU 入住队列(Harutyunyan 风格)
SELECT ie.SUBJECT_ID, ie.HADM_ID, ie.ICUSTAY_ID,
       ie.FIRST_CAREUNIT, ie.DBSOURCE, ie.LOS
FROM `physionet-data.mimiciii_clinical.icustays` ie
JOIN `physionet-data.mimiciii_clinical.admissions` a
  ON ie.HADM_ID = a.HADM_ID
WHERE a.ADMISSION_TYPE != 'NEWBORN'
  AND DATETIME_DIFF(a.ADMITTIME, (
        SELECT DOB FROM `physionet-data.mimiciii_clinical.patients` p
        WHERE p.SUBJECT_ID = ie.SUBJECT_ID), YEAR) >= 16
QUALIFY ROW_NUMBER() OVER (PARTITION BY ie.SUBJECT_ID ORDER BY ie.INTIME) = 1

§6.1 快速上手(PostgreSQL 本地版)

-- ========================================
-- MIMIC-III 快速上手 — PostgreSQL 本地查询版
-- 环境要求:已按 MIT-LCP/mimic-code 的 mimic-iii/buildmimic/postgres
--           脚本完成建库(磁盘 ≥100 GB,导入 CHARTEVENTS 耗时最长)
--
-- 目录结构预期(建库前):
--   ./mimic-iii-clinical-database-1.4/
--   ├── PATIENTS.csv.gz / ADMISSIONS.csv.gz / ICUSTAYS.csv.gz
--   ├── CHARTEVENTS.csv.gz ...(共 26 个 .csv.gz)
--   建库命令:make mimic-gz datadir="./mimic-iii-clinical-database-1.4/"
--
-- 以下查询:成人 + 首次 ICU 入住 + 提取 24h 窗口内心率(双 itemid 合并)
-- ========================================

-- 步骤 1:成人首次 ICU 入住队列(年龄按官方约定封顶 90)
WITH first_icu AS (
  SELECT ie.subject_id, ie.hadm_id, ie.icustay_id, ie.intime, ie.outtime,
         ie.dbsource, ie.first_careunit, ie.los,
         LEAST(DATE_PART('year', AGE(ie.intime, p.dob)), 90) AS age,
         a.hospital_expire_flag
  FROM icustays ie
  JOIN patients p ON ie.subject_id = p.subject_id
  JOIN admissions a ON ie.hadm_id = a.hadm_id
  WHERE a.admission_type != 'NEWBORN'
    AND DATE_PART('year', AGE(a.admittime, p.dob)) >= 16
    AND ROW_NUMBER() OVER (PARTITION BY ie.subject_id ORDER BY ie.intime) = 1
)
SELECT * FROM first_icu;

-- 步骤 2:24h 窗口内心率(CareVue 211 与 MetaVision 220045 双 itemid 合并)
SELECT f.icustay_id,
       AVG(c.valuenum)  AS hr_mean,
       MIN(c.valuenum)  AS hr_min,
       MAX(c.valuenum)  AS hr_max,
       COUNT(*)         AS hr_count
FROM first_icu f
JOIN chartevents c ON c.icustay_id = f.icustay_id
WHERE c.itemid IN (211, 220045)          -- 双系统 itemid 一并纳入
  AND c.charttime BETWEEN f.intime AND f.intime + INTERVAL '24 hours'
  AND (c.error IS NULL OR c.error = 0)   -- 过滤审计错误行
  AND c.valuenum BETWEEN 20 AND 300      -- 生理合理范围
GROUP BY f.icustay_id;

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
CSV 全库下载 https://physionet.org/content/mimiciii/1.4/ ~6.2 GB ① 注册 PhysioNet 账号;② 完成 CITI Program 的 Data or Specimens Only Research 课程(约 2-4 小时,须提交 Completion Report);③ 提交凭证化申请(学生/博士后须提供导师作为推荐人,不能自荐);④ 审核通过(数个工作日至 1-2 周)后签署 DUA 下载
Demo 数据集 https://physionet.org/content/mimiciii-demo/1.4/ 免认证开放下载,100 名患者
BigQuery physionet-data.mimiciii_clinical 免下载 PhysioNet 账号绑定 GCP 后即可查询
AWS Athena PhysioNet → MIMIC-III → Cloud 免下载 CloudFormation 一键部署,需绑定 AWS account ID

DUA 核心义务:不得尝试重识别、不得分享给未签 DUA 者、安全存储、发表时按规范引用(三件套,见 §9)。注意 MIMIC-III 与 MIMIC-IV 的 DUA 不通用,需分别签署。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(Python 版,读本地 CSV)</b></summary>

# 步骤 1:三级主键关联 + 成人首次 ICU 队列
import pandas as pd

patients = pd.read_csv("PATIENTS.csv.gz", parse_dates=["DOB", "DOD"])
admissions = pd.read_csv("ADMISSIONS.csv.gz",
                         parse_dates=["ADMITTIME", "DISCHTIME", "DEATHTIME"])
icustays = pd.read_csv("ICUSTAYS.csv.gz", parse_dates=["INTIME", "OUTTIME"])

df = (icustays
      .merge(patients, on="SUBJECT_ID")
      .merge(admissions[["SUBJECT_ID", "HADM_ID", "ADMISSION_TYPE",
                         "HOSPITAL_EXPIRE_FLAG"]],
             on=["SUBJECT_ID", "HADM_ID"]))

df["AGE"] = ((df["INTIME"] - df["DOB"]).dt.days / 365.25).clip(upper=90)
df = df[(df["ADMISSION_TYPE"] != "NEWBORN") & (df["AGE"] >= 16)]
df = (df.sort_values("INTIME")
        .groupby("SUBJECT_ID").first().reset_index())  # 首次 ICU 入住

# 步骤 2:双 itemid 映射(核心变量两套编码合并)
VITAL_ITEMIDS = {
    "heart_rate": [211, 220045],
    "sbp_nibp":  [51, 455, 220179],
    "sbp_abp":   [52, 220050],
    "resp_rate": [618, 615, 220210],
    "spo2":      [646, 220277],
    "temp_c":    [676, 223762],
}
all_ids = {i for ids in VITAL_ITEMIDS.values() for i in ids}

# 步骤 3:24h 窗口过滤(建议分块读 CHARTEVENTS,35.5 GB 无法一次入内存)
chunks = []
for chunk in pd.read_csv("CHARTEVENTS.csv.gz", chunksize=5_000_000,
                         parse_dates=["CHARTTIME"]):
    sub = chunk[chunk["ITEMID"].isin(all_ids)]
    sub = sub.merge(df[["ICUSTAY_ID", "INTIME"]], on="ICUSTAY_ID")
    sub = sub[(sub["CHARTTIME"] >= sub["INTIME"]) &
              (sub["CHARTTIME"] <= sub["INTIME"] + pd.Timedelta(hours=24))]
    sub = sub[(sub["ERROR"].isna()) | (sub["ERROR"] == 0)]
    chunks.append(sub)
vitals = pd.concat(chunks)

# 步骤 4:映射变量名并按 ICUSTAY_ID 聚合
id2name = {i: n for n, ids in VITAL_ITEMIDS.items() for i in ids}
vitals["item"] = vitals["ITEMID"].map(id2name)
feat = (vitals.groupby(["ICUSTAY_ID", "item"])["VALUENUM"]
              .agg(["mean", "min", "max", "count"])
              .unstack("item"))
feat.columns = [f"{v}_{s}" for s, v in feat.columns]

# 步骤 5:信息性缺失处理——缺失率 >50% 的变量生成缺失标识,其余中位数填充
missing = feat.isna().mean()
for col in missing[missing > 0.5].index:
    feat[f"{col}_missing"] = feat[col].isna().astype(int)
feat = feat.fillna(feat.median(numeric_only=True))
print(f"特征矩阵: {feat.shape}")

</details>

推荐直接使用社区成熟管道替代手写:mimic-code concepts(官方 SQL 物化视图:SOFA/SAPS-II/OASIS/Sepsis-3/通气时长等)、MIMIC-Extract(104 个临床聚合变量,内置单位标准化与生理范围离群值处理)、mimic3-benchmarks(基准四任务构建)、ricu(R 生态,统一 MIMIC-III/eICU/HiRID/AUMCdb 查询)。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class ICUDataset(Dataset):
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(ICUDataset(X_train, y_train), batch_size=128, shuffle=True)
import xgboost as xgb  # XGBoost 基线:MIMIC-Extract 特征 + 梯度提升
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "auc",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
          "max_depth": 6, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=500)

§6.5 常见坑点

⚠️ 坑点 1:ICD-9 不是 ICD-10——跨文献复现时编码体系错配(分类:标签理解)

问题:MIMIC-III 全库纯 ICD-9-CM(BIDMC 2015 年 10 月才切换 ICD-10,而库内数据止于 2012 年)。直接套用基于 MIMIC-IV/eICU(含 ICD-10)的队列定义 SQL,会查不到任何患者或静默漏掉一半。

症状:脓毒症、心衰等队列提取结果为 0 行或明显偏少;复现 MIMIC-IV 论文时队列规模对不上。

解决:确认目标编码表(D_ICD_DIAGNOSES 只有 ICD-9);跨库映射用 CMS GEMs 或 AHRQ CCS 归类表;优先使用 mimic-code concepts 中已验证的 MIMIC-III 专用 SQL,不要照搬 MIMIC-IV 版本。

参考https://mimic.mit.edu/docs/iii/ ;CMS GEMs 映射表。

⚠️ 坑点 2:SUBJECT_ID / HADM_ID / ICUSTAY_ID 三级 ID 混淆(分类:数据泄漏)

问题:一名患者(SUBJECT_ID)可有多个 HADM_ID(人均 1.27 次住院),一次住院可有多个 ICUSTAY_ID。按 HADM_ID 划分训练/测试集导致同一患者泄漏;按 ICUSTAY_ID 关联 LABEVENTS 直接失败——该表无此列。

症状:测试集 AUROC 虚高 3-8%;JOIN 结果为空或行数爆炸。

解决:始终以 SUBJECT_ID 做分组划分(GroupShuffleSplit),划分后验证患者集合零交集;LABEVENTS/NOTEEVENTS 须先关联 HADM_ID,再经 ICUSTAYS.INTIME/OUTTIME 时间窗过滤出"ICU 期间"部分。

参考:Johnson 2016 论文 Figure 1(三级结构图)。

⚠️ 坑点 3:itemid 双轨制——CareVue 与 MetaVision 两套编码(分类:工程陷阱)

问题:心率在 CareVue 是 itemid=211、在 MetaVision 是 itemid=220045;只查一套会丢失约一半患者(以 2008 年为界)。

症状:2001-2008 年患者特征大面积缺失;某变量"突然在 2008 年消失/出现"。

解决:按 ICUSTAYS.DBSOURCE 区分系统;在 D_ITEMS 中按 LABEL 模糊匹配两套 itemid 并合并(§6.3 步骤 2 已给出核心变量双 itemid 表);或直接用 mimic-code concepts / MIMIC-Extract 的已验证映射。

参考:ricu vignette §3.1;MIMIC-Extract(arXiv:1907.08322)。

⚠️ 坑点 4:INPUTEVENTS 拆成两张表且结构不同(分类:预处理陷阱)

问题:液体/血管活性药入量被拆为 INPUTEVENTS_CV(CareVue:CHARTTIME + “自上次记录以来累计量”)与 INPUTEVENTS_MV(MetaVision:STARTTIME/ENDTIME + RATE 速率制),必须分别处理再合并,口径完全不同。

症状:只查一张表 → 血管活性药暴露量低估约 50%;直接拼接 → 速率与累计量混算,剂量错误数倍。

解决:CV 需对相邻记录按时间差分得到速率;MV 用 RATE × 时长积分;强烈建议直接用 mimic-code 的 vasopressor durations / inputevents 物化视图。

参考:PhysioNet MIMIC-III 页 Methods;MIMIC-IV whatsnew(IV 已合并为单表 inputevents)。

⚠️ 坑点 5:日期偏移——无法做绝对时间/年份分析(分类:评估误用)

问题:所有日期偏移至 2100-2200 年,真实年份被抹除(保留星期与季节);NOTEEVENTS.CHARTDATE 只有日期粒度。无法研究"某年指南更新的影响"这类问题。

症状:按"年份"分组统计得到的是伪年份;跨患者真实时间对齐不可能。

解决:只做相对时间分析(以 ICU 入科为 t=0);需要真实年份维度的研究改用 MIMIC-IV(anchor_year_group);DBSOURCE(carevue/metavision)可作为"2008 年前后"的二分时代代理变量。

参考:MIMIC-III CareVue subset 页 Background(日期偏移策略对比)。

⚠️ 坑点 6:年龄计算——>89 岁显示为约 300 岁(分类:预处理陷阱)

问题:脱敏将 >89 岁患者 DOB 极端前移,直接 ADMITTIME − DOB 会得到约 300 岁的表观年龄。

症状:年龄分布图在 300 处出现诡异尖峰;以年龄为特征的模型学到伪信号。

解决:官方约定 age = LEAST(DATETIME_DIFF(admittime, dob, YEAR), 90),或将 ≥89 岁合并为分组变量;新生儿(NICU)另行处理。

参考:mimic-code concepts/demographics;MIMIC-Extract 明确保留 300 作为 sentinel 交由下游处理。

⚠️ 坑点 7:新生儿(NICU)与成人混合(分类:偏倚陷阱)

问题:库内含 7,870 名新生儿(ADMISSION_TYPE = “NEWBORN”,仅 2001-2008 年),其生理范围(心率 120-160 等)与成人完全不同。

症状:全库生命体征"正常值"过滤误杀新生儿或引入噪声;平均年龄被拉低约 10 岁。

解决:成人研究统一过滤 ADMISSION_TYPE != 'NEWBORN' 且年龄 ≥16/18;新生儿研究单独成文并声明其仅覆盖 CareVue 时代。

参考:Johnson 2016(成人口径 53,423 次入住与全库 61,532 次入住的差值即新生儿)。

⚠️ 坑点 8:死亡日期三选一——DOD / DOD_HOSP / DOD_SSN(分类:标签理解)

问题:PATIENTS 表有三个死亡字段:DOD(合并值)、DOD_HOSP(院内记录)、DOD_SSN(社保死亡主文件)。DOD_SSN 覆盖不全且滞后(2011 年后 DMF 政策变更覆盖率进一步下降);误把 DEATHTIME 当特征会标签泄漏;28 天死亡率终点必须明确口径。

症状:院外死亡率异常低;生存分析删失处理错误;评分模型 AUC 异常高(泄漏)。

解决:院内死亡用 ADMISSIONS.HOSPITAL_EXPIRE_FLAG / DEATHTIME;院外死亡用 DOD_SSN 并在方法学注明其局限;特征工程中禁止任何死亡字段入模。

参考:mimic-code concepts(mortality 定义);PhysioNet MIMIC-III 页(SSA Death Master File 来源说明)。

版本提示:2015-2016 年间发表的论文可能基于 v1.0-v1.3;v1.4 修复了 DBSOURCE 错标(#122)与 IO 单位错误(#121)等问题,复现旧论文时请以 v1.4 为准并注明版本,队列规模可能略有出入。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
添加服从生理学约束的小幅高斯噪声(心率 ±1 bpm) 对 ICD-9 诊断编码做任何"同义替换"式增强
随机删除 10-20% 床旁记录模拟录入缺失 对时间戳随机偏移(破坏时序依赖与双系统结构)
特征空间 Mixup 合并 CareVue 与 MetaVision 后打乱 DBSOURCE 标记
掩蔽时序自监督预训练 对患者级 ID 做任何变换

§6.7 模型推荐

任务 推荐 backbone 特征方案 预期性能(48h 死亡预测口径)
快速基线 Logistic Regression / XGBoost MIMIC-Extract 104 变量 AUROC 0.85-0.86
标准时序 LSTM / GRU-D Harutyunyan 17 变量逐小时序列 AUROC 0.86-0.88
历史最优 Channel-wise LSTM + 多任务 Harutyunyan 四任务联合 AUROC 约 0.88
临床文本 Bio_ClinicalBERT NOTEEVENTS(排除出院小结) 因任务而异
教学演示 逻辑回归 + §6.3 手工特征 24h 聚合统计 AUROC 0.82-0.85

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 60 GB(CSV 解压) 120 GB(PostgreSQL + 索引 + 派生表)
内存 16 GB(分块处理 CHARTEVENTS) 64 GB(全量聚合操作)
GPU CPU 足够(XGBoost/LR 基线) 1 × 16 GB 显存(LSTM 四任务基准)
训练时间 XGBoost 基线约 30-60 分钟(CPU) Channel-wise LSTM 约 6-12 小时
云端替代 BigQuery 免费 1 TB/月查询额度 Colab + BigQuery 免本地建库

§6.9 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             brier_score_loss, confusion_matrix)

def evaluate_binary(y_true, y_prob, threshold=0.5):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")  # 不平衡数据必报
    print(f"Brier: {brier_score_loss(y_true, y_prob):.4f}")
    tn, fp, fn, tp = confusion_matrix(y_true, y_prob > threshold).ravel()
    print(f"Sensitivity: {tp/(tp+fn):.3f}  Specificity: {tn/(tn+fp):.3f}")

社区共识:死亡/失代偿任务报 AUROC + AUPRC;LOS 任务报 Cohen’s linear weighted kappa 与 MAD;表型任务报 Macro-AUROC;所有结果应在 Harutyunyan 固定划分上报告以保证可比。

§6.10 MLOps 笔记

  • 版本锁定:论文方法部分必须注明 “MIMIC-III v1.4”(DOI: 10.13026/C2XW26)与访问日期;v1.0-v1.3 与 v1.4 的队列规模存在差异。
  • 引用三件套:数据集论文(10.1038/sdata.2016.35)+ PhysioNet 数据集本体(10.13026/C2XW26)+ PhysioNet 平台(Goldberger 2000)——DUA 硬性要求,缺一不可(见 §9)。
  • 审计行过滤:CHARTEVENTS 等表的 ERROR=1 行为作废/错误记录,任何聚合前必须过滤。
  • BigQuery 项目名physionet-data.mimiciii_clinical(III 代)与 physionet-data.mimiciv_icu(IV 代)命名风格不同,写跨版本教程时注意区分。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 BIDMC 单中心,波士顿三级学术转诊中心,不代表社区医院与国际 ICU 用 eICU-CRD / AmsterdamUMCdb 外部验证
时代偏倚 2001-2012 年数据:脓毒症集束化治疗(2004 SSC 指南)、ARDSnet 低潮气量通气等实践在期内演变;与当代 ICU 实践差距更大 高(以 2026 年视角) 新课题改用 MIMIC-IV;方法学研究声明时代局限
系统切换偏倚 2008 年 CareVue→MetaVision:测量方式、记录频率、itemid 全变,形成人为数据断层 中高 DBSOURCE 作为协变量或分层轴
记录方式偏倚 生命体征约 1 点/小时且为护士手动录入 + 验证,存在录入误差与整点偏好(CHARTTIME vs STORETIME 偏移) 聚合窗口取整点容忍;报告 STORETIME 检查
编码偏倚 ICD-9 反映计费需求;SEQ_NUM 主诊断存在选择偏误 用全部编码位(最多 39 个)而非仅主诊断
幸存者/选择偏倚 仅 ICU 入住者在 ICU 表内;急诊死亡、普通病房死亡不覆盖 明确研究适用人群为 ICU 患者
种族构成偏倚 白人占比显著高于美国平均;ETHNICITY 自报且约 40 种取值不规整 公平性分析先归并种族取值
院外死亡覆盖偏倚 DOD_SSN 依赖 SSA Death Master File,存在遗漏与滞后(2011 年后 DMF 覆盖下降) 院外死亡终点注明覆盖局限

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
院内死亡(HOSPITAL_EXPIRE_FLAG) >99.9% 系统自动生成 不含院外死亡
院外死亡(DOD_SSN) 覆盖不全、滞后 SSA 匹配 2011 年后覆盖率下降
实验室检查值 CLIA 体系,定量准确 批间质控 无参考区间列,需查 D_LABITEMS 与文献
ICD-9 诊断编码 主诊断准确率因病种而异(心梗高、谵妄低) 编码员间一致性中等 计费导向,共病覆盖不全
床旁生命体征 护士验证,约 1 点/小时 双人录入可矛盾 手动录入误差 + 整点偏好 + 审计行未清理
自由文本 临床常规书写 自动去标识存在残余 PHI 风险(官方已披露)

§7.3 泛化性讨论

场景 失效风险 证据
跨机构(BIDMC → 其他美国 ICU) 中高 MIMIC-III 训练的死亡预测模型在 eICU-CRD 上 AUROC 通常下降 3-6%(eICU 论文及后续迁移研究)
跨地域(美国 → 欧洲/亚洲) 编码体系(ICD-9 vs 本地编码)、治疗模式与人群差异显著;AmsterdamUMCdb/HiRID 提供欧洲对照
跨系统(CareVue → MetaVision) itemid 与记录频率全变;同库内即存在"分布外"测试,可用 DBSOURCE 分层评估
跨时间(2001-2012 → 当代) 脓毒症管理、机械通气策略已多轮迭代;2026 年的当代验证必须改用 MIMIC-IV
跨亚群体(新生儿/高龄/少数族裔) 中高 新生儿仅见于 2001-2008;>89 岁年龄封顶;少数族裔样本稀疏

§7.4 伦理考量

  1. 数据来自真实 ICU 患者,其中相当部分在数据使用时已去世;研究者应保持对患者与家属的尊重。
  2. BIDMC 与 MIT 的 IRB 豁免了个体知情同意,前提是数据仅用于研究且已完成充分脱敏;DUA 禁止任何重识别尝试。
  3. ETHNICITY 字段为自报且取值不规整(约 40 种),混合了种族与族裔概念,精细公平性分析前必须先归并。
  4. 不要在 >89 岁(年龄已封顶)或极小种族亚群上单独建模,统计上不可靠且可能放大偏误。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=test_df["ETHNICITY_GROUP"]  # 先归并约 40 种取值
)
print(frame.by_group)

已知公平性差异(MIMIC 系列文献):少数族裔亚群样本量小导致子群 AUROC 置信区间极宽;自报种族缺失(“UNABLE TO OBTAIN”/“DECLINED”)本身与病情严重度相关,不可简单丢弃。

§7.6 数据漂移提示

  • 部署任何 MIMIC-III 训练模型前,必须认识到其训练分布停留在 2001-2012 年:脓毒症 bundle、镇静策略、机械通气参数均与当代实践不同。
  • 监控信号:生命体征分布 PSI > 0.1、诊断编码流行率 PSI > 0.3(尤其 ICD-9 → ICD-10 映射后的语义漂移)、CareVue/MetaVision 断层导致的测量频率差异。
  • 2008 年系统切换是库内最强的"内源漂移点",跨 DBSOURCE 的模型评估应作为常规步骤。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 26 张关系表均以唯一事件 ID 为行
2 有唯一标识符列 SUBJECT_ID / HADM_ID / ICUSTAY_ID 三级主键
3 无 Unicode 或特殊字符 ⚠️ 结构化字段为 ASCII;NOTEEVENTS 文本含换行与特殊符号,需清洗
4 无重复行 CHARTEVENTS 存在同 ITEMID+CHARTTIME 重复与 ERROR=1 审计行,未清理
5 缺失值已识别并编码 §4.5 信息性缺失编码表
6 标签列被明确标识 HOSPITAL_EXPIRE_FLAG / EXPIRE_FLAG 为明确靶标
7 已对罕见类别(<3%)进行分组 ⚠️ 14,567 个 ICD-9 码中大量低频类别未分组,需自行 CCS 归类
8 偏倚评估已完成 §7.1 列出 8 类偏倚与缓解措施
9 有完整的数据字典 D_ 五字典表 + mimic.mit.edu 官方表文档
10 对"信息性缺失"有明确编码解释 §4.5 MAR/MNAR 分类
11 数据采集设备和设置已记录 §3.9 双信息系统型号与时段完整记录
12 已移除完全共线性变量 ⚠️ 未执行,发布数据保留全部原始列
13 对编码的映射标准已说明 纯 ICD-9-CM + GEMs/CCS 桥接路径已注明
14 对时间戳的处理已明确说明 ⚠️ 日期偏移策略已记录,但真实年份维度永久丢失
15 训练/验证/测试划分建议已给出 官方无划分;社区 mimic3-benchmarks 固定划分补位
16 数据泄漏风险已被讨论 §5.3 四种 MIMIC-III 特有泄漏模式
17 标签分布已被分析 §4.2 主要任务阳性率
18 选择性测量偏倚已被讨论 §4.5 + §6.5 坑点
19 外部验证建议已给出 §5.5 eICU-CRD / MIMIC-IV / AUMCdb / HiRID
20 数据更新和版本信息已记录 v1.0-v1.4 release notes 完整(#121/#122/#123)
21 最小必要预处理脚本已提供 ⚠️ 无官方派生概念层(IV 有 mimic_derived);依赖社区 mimic-code concepts
22 合规使用要求已明确 CITI 培训 + 凭证化申请 + DUA
23 多模态对齐方法已说明 ⚠️ 波形 matched subset 独立发布;文本与结构化数据时间对齐需自行处理
24 去标识化方法已被记录 ⚠️ 18 类 HIPAA 移除 + Neamatullah 2008 完整记录;但文本自动去标识存在已知残余 PHI 风险且不再更新修复

DAIMS 评分:18.5 / 24

评分解读良好——文档化与生态顶尖,但因年代久远存在结构性陈旧(双系统、审计行、无年份、无官方划分)。

对你意味着什么:MIMIC-III 的 15 个 ✅ 项几乎全部来自其教科书级的文档与社区生态——三级主键、五张字典表、完整的采集系统记录与去标识化文档,在同时代数据集中无出其右。扣分集中在不可修复的历史遗留:ERROR 审计行未清理(任何聚合前自行过滤)、无官方划分(直接用 mimic3-benchmarks 固定划分)、真实年份丢失(年份研究请改用 MIMIC-IV)、无官方派生概念层(用 mimic-code concepts 替代)。与 MIMIC-IV 的 19.5/24 相比,1 分的差距几乎全部来自"年代性陈旧"而非"文档质量"——这份数据集在其时代做到了工程上能做到的一切。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
eICU-CRD(208 家美国医院) MIT LCP / Philips 脓毒症强化学习剂量策略(AI Clinician) 模型建议与实际剂量吻合度 ↔ 死亡率剂量反应曲线 非 AUROC 任务 MIMIC-III 训练的 RL 策略在 eICU 独立队列复现了"吻合度越高死亡率越低"的剂量反应关系——MIMIC-III 最高影响力的外部验证案例
eICU-CRD MIT LCP / Philips 院内死亡预测迁移 AUROC 约 0.77-0.82 下降约 3-6% 跨机构泛化损失与医院规模、治疗强度相关;小型社区医院子集最差
MetaVision 时代子集(库内"准外部") BIDMC 2008-2012 48h 死亡预测 AUROC 下降约 2-5% 相对 CareVue 训练集 用 DBSOURCE 做时代外验证是评估模型稳健性的零成本方案
MIMIC-IV(队列级迁移) BIDMC 2008-2022 队列定义与基准复现 不可直接合并 N/A subject_id 无法互链,只能在队列定义层面迁移;ICD-9→10 需 GEMs 桥接

MIMIC-III 在 2026 年还值得用吗? 值得——但要看用途。复现性研究、方法学基准、教学与 NICU 新生儿研究:MIMIC-III 仍不可替代(一万余篇引用论文的队列定义都以它为锚)。全新课题、需要当代临床实践或与 ICD-10 生态对接:首选 MIMIC-IV。这不是"过时产品",而是一座已完成历史使命、仍供人瞻仰与使用的学术基础设施。


§8 基准性能与生态

§8.1 排行榜(Harutyunyan Benchmark)

MIMIC-III 的"排行榜"已历史性冻结:2017-2019 年是刷榜高峰期,2020 年后新工作多转向 MIMIC-IV。因此本节呈现的是历史经典基线而非当前竞争——这本身就是最有信息量的叙事。

四大标准任务定义(Harutyunyan et al. 2019;同一固定 train/test 划分,Zenodo DOI: 10.5281/zenodo.1306527):

任务 定义 队列/实例 主指标
院内死亡预测 入 ICU 后 48 小时窗口,二分类 约 21,000+ 次 ICU 入住,死亡率 13.23% AUROC
失代偿(decompensation)预测 每小时预测未来 24h 内死亡 300 万+ 预测实例 AUROC
住院时长(LOS)预测 剩余 ICU 时长 10 档分类 同死亡队列 Cohen’s linear weighted kappa + MAD
表型分类 25 种急性照护表型多标签(基于 ICD-9 分组) 同死亡队列 Macro-AUROC

注:第四任务"失代偿(decompensation)“常被中文社区误记为"去标识化”;文本去标识化的社区基准另见 Neamatullah et al. 2008(§2.6),其算法评测对象正是 MIMIC 文本。

可比组排行榜(同一固定划分,数值可直接比较,48h 死亡预测)

排名 模型 AUROC 年份 关键技术 完整引用 代码
1 Multitask channel-wise LSTM + deep supervision 约 0.88 2019 通道分离 LSTM + 深度监督 + 四任务多任务学习 Harutyunyan H, Khachatrian H, Kale DC, Ver Steeg G, Galstyan A. “Multitask learning and benchmarking with clinical time series data.” Scientific Data 6:96 (2019). DOI: 10.1038/s41597-019-0103-9 https://github.com/YerevaNN/mimic3-benchmarks
2 Channel-wise LSTM 约 0.87 2019 每个变量独立通道后融合 同上 同上
3 Standard LSTM 约 0.86 2019 单层 LSTM,逐小时 17 变量序列 同上 同上
4 Logistic Regression 约 0.85 2019 手工聚合特征 同上 同上

其他口径的代表工作(队列定义不同,数值不可与上表直接比较)

模型 性能指标 年份 关键技术 完整引用 代码
GRU-D AUC 约 0.85(48h 死亡,自定义队列) 2018 GRU 衰减门控建模不规则时序 Che Z, Purushotham S, Cho K, Sontag D, Liu Y. “Recurrent neural networks for multivariate time series with missing values.” Scientific Reports 8:6085 (2018) https://github.com/zhiyongc/GRU-D
MIMIC-Extract + XGBoost/LR AUROC 约 0.86-0.89(24h 窗口口径) 2020 104 个临床聚合变量 + 单位标准化 Wang S, McDermott MBA, et al. “MIMIC-Extract: A data extraction, preprocessing, and representation pipeline for MIMIC-III.” CHIL 2020. arXiv:1907.08322 https://github.com/MLforHealth/MIMIC_Extract
Purushotham et al. 深度学习基准 AUROC 约 0.90(136 特征宽表口径) 2018 多模型系统对比(含度量学习) Purushotham S, Meng C, Che Z, Liu Y. “Benchmarking deep learning models on large healthcare datasets.” JBI 83:112-134 (2018)

基准饱和的经典论据:McDermott et al. 2020(“Evaluating Progress on ML for Longitudinal EHR”,ML4H / arXiv:2010.01149)对 19 篇复现论文、210 个模型的元分析发现——2017-2020 年间 Harutyunyan 基准上性能无显著进步,深度学习相对逻辑回归在死亡与 LOS 任务上无显著优势。阅读任何声称在 MIMIC-III 上"刷新 SOTA"的论文时,请先对照这一结论。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
复现文献/与历史结果比较 Harutyunyan 固定划分 + 报告其四任务指标 19 篇论文 210 个模型的可比基线
快速出基线(CPU) MIMIC-Extract + XGBoost AUROC 约 0.86,1 小时内出结果
验证新时序方法 mimic3-benchmarks 管道 + 自定义模型接入 接入成本最低的时序 EHR 评测台
做教学演示 demo 数据集 + §6.3 手工特征 + LR 免认证、可在课堂完成全流程

§8.3 官方评测协议

无官方协议。社区事实标准(Harutyunyan 体系):首次 ICU 入住 + 成人队列;48h 窗口死亡预测 / 逐小时失代偿 / LOS 10 档 / 25 表型四任务;固定 train/test 划分;AUROC(死亡、失代偿)、kappa + MAD(LOS)、Macro-AUROC(表型)。

数据集 关系 说明
MIMIC-II v2.6 前身 Saeed et al. 2011;MIMIC-III 新增约 2 万次入住、医师病程、MAR、CPT/DRG
MIMIC-IV 后继 模块化重构 + ICD-10 混合编码 + 多模态扩展,活跃维护
MIMIC-III CareVue subset 子集 2023 年发布,仅含不在 MIMIC-IV 中的患者,支持两库无重叠联合分析
MIMIC-III demo 试用版 100 名患者,免认证
MIMIC-III waveform matched subset 波形扩展 与波形数据库匹配的 ICU 子集,独立发布
eICU-CRD 同类/验证集 多中心,AI Clinician 的外部验证场

§8.5 关键论文 Top 10

  1. Johnson AEW et al. (2016), Scientific Data 3:160035. “MIMIC-III, a freely accessible critical care database.” — 数据集本体,权威引用入口。DOI: 10.1038/sdata.2016.35
  2. Harutyunyan H et al. (2019), Scientific Data 6:96. “Multitask learning and benchmarking with clinical time series data.” — 四任务基准,定义了一个时代的评测标准。DOI: 10.1038/s41597-019-0103-9
  3. Komorowski M et al. (2018), Nature Medicine 24:1716-1720. “The Artificial Intelligence Clinician learns optimal treatment strategies for sepsis in intensive care.” — MIMIC-III 训练 + eICU 验证的强化学习脓毒症剂量策略,临床应用影响力天花板。
  4. Johnson AEW, Stone DJ, Celi LA, Pollard TJ (2018), JAMIA 25(1):32-39. “The MIMIC Code Repository: enabling reproducibility in critical care research.” — mimic-code 官方论文。DOI: 10.1093/jamia/ocx084
  5. Wang S et al. (2020), CHIL. “MIMIC-Extract: A data extraction, preprocessing, and representation pipeline for MIMIC-III.” — 104 临床聚合变量标准管道。arXiv:1907.08322
  6. Che Z et al. (2018), Scientific Reports 8:6085. GRU-D — 不规则时序衰减建模的经典方法。
  7. Purushotham S et al. (2018), JBI 83:112-134. “Benchmarking deep learning models on large healthcare datasets.” — 136 特征深度学习系统对比。
  8. McDermott MBA et al. (2020), ML4H. “Evaluating Progress on ML for Longitudinal EHR.” — 19 篇论文 210 模型元分析,"基准饱和"经典论据。arXiv:2010.01149
  9. Desautels T et al. (2016), JMIR Medical Informatics 4(3):e28. InSight 脓毒症预测——用最少 EHR 变量实现早期预警。DOI: 10.2196/medinform.5909
  10. Saeed M et al. (2011), Critical Care Medicine 39:952-960. MIMIC-II 论文——理解 MIMIC-III 演进起点的必读前史。

§8.6 社区活跃度

维度 数据
Google Scholar 引用(MIMIC-III 论文) 10,800+(截至 2025-12;单篇论文口径,非合并统计)
OpenAlex 引用 8,286 次(截至 2025-12 快照)
引用者领域分布 AI 约 2.8k、流行病学约 1.2k、分子生物学约 0.8k(OpenAlex/Rankless)
Harutyunyan 2019 引用 约 1,000+(截至 2025-12)
PhysioNet 认证用户 30,000+(全平台口径,截至 2026-09,估算)
教学采用 MIT 6.871/HST.956、WUSTL CSE4109、Pitt CS3750 等公开课
期刊地位 Scientific Data 期刊被引最高论文之一;全球被引最多的开放 ICU 数据集论文

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09,约) 为什么值得关注
MIT-LCP/mimic-code 官方代码 https://github.com/MIT-LCP/mimic-code 2,600+ / 800+ 官方社区仓库:建库脚本 + concepts 物化视图(SOFA/SAPS-II/Sepsis-3 等)+ 教程;Zenodo DOI: 10.5281/zenodo.821872
YerevaNN/mimic3-benchmarks 基准套件 https://github.com/YerevaNN/mimic3-benchmarks 880+ / 345+ Harutyunyan 基准构建全流程;仓库已归档态维护但仍是复现标准
MLforHealth/MIMIC_Extract 工具库 https://github.com/MLforHealth/MIMIC_Extract 500+ / 150+ 104 变量特征管道,内置单位标准化与生理范围过滤
MLD3/FIDDLE 工具库 https://github.com/MLD3/FIDDLE 活跃 结构化 EHR → ML 张量的通用管道(Tang et al. 2020)
ricu(CRAN) R 包 https://cran.r-project.org/package=ricu R 生态统一接口,一套代码查询 MIMIC-III/eICU/HiRID/AUMCdb
BigQuery mimiciii_derived 云端派生集 physionet-data.mimiciii_derived mimic-code concepts 的云端物化版,免本地建库
MIMIC-III demo 教学数据 https://physionet.org/content/mimiciii-demo/1.4/ 100 患者免认证,课程与管道调试首选

§9 相关资源与引用

官方资源

BibTeX 引用(三件套,DUA 硬性要求)

% 1) 数据集论文(期刊引用首选)
@article{johnson2016mimic,
  title={MIMIC-III, a freely accessible critical care database},
  author={Johnson, Alistair EW and Pollard, Tom J and Shen, Lu and Lehman, Li-wei H and Feng, Mengling and Ghassemi, Mohammad and Moody, Benjamin and Szolovits, Peter and Celi, Leo Anthony and Mark, Roger G},
  journal={Scientific Data},
  volume={3},
  pages={160035},
  year={2016},
  publisher={Nature Publishing Group},
  doi={10.1038/sdata.2016.35}
}

% 2) 数据集本体(PhysioNet 版本引用)
@article{PhysioNet-mimiciii-1.4,
  author={Johnson, Alistair and Pollard, Tom and Mark, Roger},
  title={{MIMIC-III Clinical Database}},
  journal={{PhysioNet}},
  year={2016},
  month=sep,
  note={Version 1.4},
  doi={10.13026/C2XW26}
}

% 3) PhysioNet 平台(官方要求同时引用)
@article{goldberger2000physionet,
  title={PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals},
  author={Goldberger, Ary L and Amaral, Luis AN and Glass, Leon and Hausdorff, Jeffrey M and Ivanov, Plamen Ch and Mark, Roger G and Mietus, Joseph E and Moody, George B and Peng, Chung-Kang and Stanley, H Eugene},
  journal={Circulation},
  volume={101},
  number={23},
  pages={e215--e220},
  year={2000}
}

% 4) 如使用 mimic-code 概念代码
@article{johnson2018mimic,
  title={The MIMIC Code Repository: enabling reproducibility in critical care research},
  author={Johnson, Alistair EW and Stone, David J and Celi, Leo A and Pollard, Tom J},
  journal={Journal of the American Medical Informatics Association},
  volume={25}, number={1}, pages={32--39}, year={2018}
}

许多论文漏引第 2、3 条——这违反 DUA。投稿前请逐项核对。

教程与学习资源

原始论文

  1. Johnson AEW et al. (2016). “MIMIC-III, a freely accessible critical care database.” Scientific Data 3:160035. DOI: 10.1038/sdata.2016.35. PMID: 27219127. PMCID: PMC4878278.
  2. Saeed M et al. (2011). “Multiparameter Intelligent Monitoring in Intensive Care II (MIMIC-II): A public-access intensive care unit database.” Critical Care Medicine 39:952-960.
  3. Neamatullah I et al. (2008). “Automated de-identification of free-text medical records.” BMC Medical Informatics and Decision Making 8:32. DOI: 10.1186/1472-6947-8-32.
  4. Goldberger AL et al. (2000). “PhysioBank, PhysioToolkit, and PhysioNet.” Circulation 101(23):e215-e220.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 8 组检索:官方页面、引用数快照、行数复核、star 数、版本历史交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 PhysioNet 官方页面、Johnson 2016 原始论文、mimic.mit.edu 官方文档与社区资源中整理结构化信息;(2) 生成 §6 的 SQL/Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Johnson et al. (2016), Scientific Data 3:160035 — MIMIC-III 原始论文(DOI: 10.1038/sdata.2016.35)
  2. PhysioNet MIMIC-III v1.4 页面(含 release notes #121/#122/#123)
  3. mimic.mit.edu 官方文档(MIMIC-III 表文档 / MIMIC-IV whatsnew / getting started)
  4. PhysioNet 归档页 MIMIC-II → III 更新清单(archive.physionet.org/physiobank/database/mimic3cdb)
  5. MIT-LCP/mimic-code GitHub 仓库(建库脚本、concepts、教程)
  6. Harutyunyan et al. (2019), Scientific Data 6:96(DOI: 10.1038/s41597-019-0103-9)
  7. YerevaNN/mimic3-benchmarks README 与 Zenodo 固定划分(DOI: 10.5281/zenodo.1306527)
  8. Wang et al. (2020), MIMIC-Extract(arXiv:1907.08322)
  9. McDermott et al. (2020), 基准元分析(arXiv:2010.01149)
  10. ricu vignette(CRAN,双系统 itemid 与行数复核)
  11. MDPI Data 2021 Appendix A1(26 表行数双源复核)
  12. Neamatullah et al. (2008), BMC Med Inform Decis Mak 8:32(文本去标识)
  13. Saeed et al. (2011), Critical Care Medicine 39:952-960(MIMIC-II 前史)
  14. Komorowski et al. (2018), Nature Medicine 24:1716-1720(AI Clinician 外部验证)
  15. Google Scholar / OpenAlex 引用快照(截至 2025-12 与 2026-09-05)
  16. PMC9222812(成人 ICU 分布复核)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-9 映射、人群统计、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(26 表行数、版本矩阵) 千方病案医学编辑部 与 PhysioNet 官方页面及 MDPI Appendix 交叉比对 ✅ 已验证
§4 数据结构(三级主键、DAIMS 字段字典) 千方病案医学编辑部 mimic.mit.edu 官方表文档交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与 mimic-code 官方概念比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及 Scholar 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集