MIMICEL — 急诊事件日志数据集 AI-Ready Wikipedia

MIMIC-IV 急诊科事件日志:425,028 次就诊 × 756 万事件的端到端患者旅程——流程挖掘进入重症医学的第一手公开语料

来源 https://physionet.org/content/mimicel-ed/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 37
MIMICEL — 急诊事件日志数据集 AI-Ready Wikipedia

信息速览

数据集名称MIMICEL — 急诊事件日志数据集 AI-Ready Wikipedia
数据类型425,028 案例,205,466 患者,756 万事件,6 活动类型,XES+CSV
规模205,466 名 ED 患者(去标识;事件日志不含直接标识符)
接入方式https://physionet.org/content/mimicel-ed/
AI 就绪度

INFOBOX

属性 内容
名称 MIMICEL: MIMIC-IV Event Log for Emergency Department(v2.1.0)
维护方 Queensland University of Technology 团队 / PhysioNet
发布 v1.0.0(2022);v2.1.0(2023-06-16)
定位 MIMIC-IV-ED 的事件日志——流程挖掘视角的患者旅程语料
数据源 MIMIC-IV-ED v2.2(DOI 10.13026/5ntk-km72)
规模 425,028 案例 / 205,466 患者 / 7,568,824 事件 / 6 活动类型
案例长度 平均 18 事件/案例(min 3 / max 218)
格式 CSV(mimicel.csv)+ XES(mimicel.xes,PM4Py 转换)
属性 case attributes 8 项 + event attributes 21 项
提取方法 Jans et al. 九步事件日志提取法
访问 Credentialed Access(PhysioNet DUA)
配套论文 Curation and Analysis of MIMICEL(arXiv:2505.19389, 2025)
代码 GitHub: ZhipengHe/MIMIC-IV-event-log-extraction-for-ED
DOI 10.13026/64aq-jw11(v1.0)
平台 PhysioNet

§0 E-E-A-T 信任声明与免责声明

经验(Experience):本文基于 PhysioNet 官方页面(v2.1.0)、配套论文(arXiv:2505.19389 全文)、GitHub 提取代码仓库与 MIMIC-IV-ED 官方文档撰写;活动清单、属性表、规模数字均按论文 Table 1-6 原文口径译写。

专业性(Expertise):事件日志三强制属性、case/event 属性二分、Triage 人工时间戳(intime+1 秒)的构造语义、时序倒置事件的过滤口径——流程挖掘新手最易错的语义全部显式披露。

权威性(Authoritativeness):MIMICEL 是公开世界规模最大的真实医院急诊事件日志;QUT 流程挖掘团队出品并有配套论文与开源提取代码;本文为第三方解读,不替代官方文档与 DUA。

可信度:文内数字进入文末「口径存照」;"6 种活动"与"全部 ED 活动"的抽象边界、完整版与分析版的事件数差异已显式区分。

免责:本文为学术性数据资源解读,不构成医疗或运营决策建议;再识别风险与合规见 §8。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:从 MIMIC-IV-ED(BIDMC 急诊科数据库)提取的事件日志——把"关系表快照"重组为"端到端患者旅程";
  • 规模:425,028 案例(ED 就诊)× 平均 18 事件 = 7,568,824 事件,覆盖 205,466 名患者;
  • 6 种活动:进入 ED → 分诊 → 生命体征测量 → 用药核对 → 发药 → 离开 ED——一条完整 ED 流水线骨架;
  • 双格式:CSV(数据分析)+ XES(流程挖掘标准,PM4Py/ProM 直读);
  • 用途:流程发现(患者流建模)、性能分析(瓶颈/等候时间)、预测监控(下一活动/停留时长)、ML 分类(结局预测);
  • 访问:Credentialed Access(DUA——同 MIMIC 家族受控语义);
  • 最大坑:把 6 种活动当"全部 ED 活动"——日志是流程视角的刻意抽象,不是临床全记录。

§1.1 摘要

急诊科(ED)拥挤是全球医院的共同痛点,而分析患者流的前提是把分散在关系数据库各表中的"活动快照"拼成端到端旅程——这就是事件日志(event log)的工作。MIMICEL 由昆士兰科技大学流程挖掘团队按 Jans 九步法从 MIMIC-IV-ED v2.2 提取:425,028 次 ED 就诊成为案例(case),每个案例是按时间排序的事件序列,事件取 6 种抽象活动(进入/分诊/生命体征/用药核对/发药/离院),带 8 项案例属性(性别/种族/到达方式/分诊紧急度/主诉等)与 21 项事件属性(生命体征/药物/诊断编码)。756 万事件以 CSV 与 XES 双格式发布——后者是流程挖掘的事实标准(PM4Py 一行载入,ProM/Celonis 直接吃)。它的独特生态位:公开世界里规模最大的真实医院急诊事件日志——此前 ED 流程研究多用单月/单科室小样本日志,MIMICEL 第一次把流程挖掘扔进四十万量级的真实数据池。对 AI 研究者,它同时是序列建模语料(下一活动/剩余时长预测)与运营科学语料(拥挤建模/瓶颈识别)——而理解"6 活动抽象"的取舍,是用好它的第一步。

§1.2 战略价值

  1. 稀缺性:真实医院的全量 ED 事件日志几乎不外流(隐私+商业敏感)——MIMICEL 是该数据类型唯一的公开规模化来源;
  2. 标准格式:XES 是事件日志的国际标准——流程挖掘社区的工具链即插即用,无需自写解析;
  3. MIMIC 血统:源自 MIMIC-IV-ED,可回流关联临床结局(acuity/处置/诊断)——流程视角与临床视角的桥梁数据;
  4. 方法论背书:九步提取法+配套论文+开源代码——提取过程可复现可审计,避免"黑箱日志";
  5. 教学与基准:规模足够大、结构足够简单(6 活动)——流程挖掘课程与算法基准的理想载体。

§1.3 同类数据集横向对比

维度 MIMICEL MIMIC-IV-ED(源库) 医院 ED 日志(文献常见) BPI Challenge 医疗类
数据形态 事件日志(XES+CSV) 关系表(快照) 事件日志 事件日志
案例 425,028 ED 就诊 ~42.5 万 ED 就诊 数百-数千 数千-数万
事件 7,568,824 表内全量活动 万-十万级 百万级
活动 6 类(抽象) 全部记录字段 10-50 类(视医院) 视场景
临床属性 ✅(生命体征/用药/诊断) ✅ 全量 有限 一般无
访问 Credentialed Credentialed 通常不公开 公开(竞赛)
真实性 真实医院 8 年 真实医院 真实但小 真实(匿名竞赛)

结论:论"规模×临床深度×可复现性"三角,MIMICEL 在公开 ED 流程语料中无替代品;其 6 活动抽象是"少而干净"的设计选择——比全字段但不可公开的医院日志,贡献了公开研究可能性。

§1.4 版本时间轴

时间 事件
2022-06 MIMICEL v1.0.0 发布(PhysioNet;Wei/He/Ouyang/Moreira;DOI 10.13026/64aq-jw11)
2022 MIMIC-IV-ED v2.2 发布(提取源库定版)
2023-06-16 v2.1.0 发布(当前版本;基于 MIMIC-IV-ED v2.2 重新提取)
2023-2024 流程挖掘社区采纳(PM4Py 教程/课程案例)
2025-05-26 配套论文 “Curation and Analysis of MIMICEL”(arXiv:2505.19389)发布——Table 1-6 权威口径
2025 下游应用扩展(流程挖掘+ML 结局预测等)

§1.5 应用场景矩阵

场景 用到的部分 关键动作
流程发现 事件序列 直接跟随者图/流程树→流程模型可视化
性能/瓶颈分析 timestamp + 活动 段落时长统计→瓶颈活动定位
拥挤建模 并发案例数 + acuity 时变在治人数→拥挤阈值(≥12)分析
下一活动预测 事件前缀 序列编码→分类/生成
剩余时长预测 事件前缀+时间 RNN/Transformer 回归
结局预测 case 属性+事件序列 disposition/住院转化分类
流程变异挖掘 案例 variants 变体聚类→异常路径发现
LLM+流程挖掘 日志摘要/问答 事件序列→文本化→LLM 推理

§1.6 组件全景

MIMICEL(v2.1.0)
├── mimicel.csv(事件主表:7,568,824 行)
│   └── 列:stay_id | activity | timestamp | case attributes(8) | event attributes(视活动)
├── mimicel.xes(XES 标准格式;PM4Py 由 CSV 转换)
│   ├── trace = case(一次 ED 就诊)
│   ├── trace attributes = case attributes
│   └── event attributes = 事件动态属性
├── 提取代码(GitHub:ZhipengHe/MIMIC-IV-event-log-extraction-for-ED)
│   └── Jans 九步法:目标定义→表选择→案例识别→活动识别→…
├── 源库:MIMIC-IV-ED v2.2(edstays/triage/vitalsign/medrecon/pyxis/diagnosis)
└── 配套论文:arXiv:2505.19389(Table 1-6 口径权威)

§1.7 事件日志语义速记

事件日志 = { case₁, case₂, ..., case₄₂₅₀₂₈ }
case(trace)= 一次 ED 就诊(stay_id)= <e₁, e₂, ..., eₙ>(按 timestamp 排序)
event = (activity, timestamp, event_attributes...)
      e.g. (Vital sign check, t₃, {temperature:37.2, heartrate:88, ...})

三强制属性:case ID | activity | timestamp   ← 任何事件日志的骨架
case attributes(静态):gender, race, arrival_transport, disposition, acuity, chiefcomplaint
event attributes(动态):生命体征 8 项(Vital sign check 时)
                        药物 9 项(Medicine reconciliation 时)
                        诊断 3 项 + hadm_id(依来源表)

核心转换:关系库回答"这个患者在什么时间有什么记录"(按表组织);事件日志回答"这次就诊经历了什么流程"(按案例组织)——视角旋转 90°,就是 MIMICEL 的全部价值。

§1.8 访问方式速记

  1. 准入:PhysioNet 账号 → 签署 DUA(CITI 培训)→ Credentialed 下载(同 MIMIC 家族流程);
  2. PM4Py 一行载入:pm4py.read_xes('mimicel.xes') → 直接得到事件日志对象;
  3. CSV 路线:pandas 读 mimicel.csv 自由分析(XES 由 CSV 经 PM4Py 转换而来,两者同源);
  4. 提取代码:GitHub 仓库可从 MIMIC-IV-ED 原表复现整个日志(可审计性)。

§1.9 独特视角:给急诊科装"行车记录仪"

MIMIC-III/IV 记录的是"临床事实"(化验值、诊断、用药),MIMICEL 记录的是"流程事实"(谁在哪个环节、停留多久、走哪条路径)。前者像病历,后者像物流追踪——ED 在 8 年里处理了 42.5 万个"包裹",每个包裹从进门到离院经过哪些站、卡在哪里。流程挖掘就是把这些轨迹还原成"地图",让拥挤不再是感受而是可测量的瓶颈。MIMICEL 的价值在于:这是第一次,研究者可以在公开数据上对一家真实医院的全量急诊流程"开天眼"——并以 40 万案例的规模让结论具有统计底气。

§2 医学与科学背景

§2.1 ED 拥挤的全球治理难题

急诊科拥挤(overcrowding)是全球性系统问题:服务能力跟不上需求增长,导致等候延长、救护车积压、患者安全事件与员工倦怠。传统分析方法(现场访谈、流程会议、人工观察)费时、昂贵且主观——而拥挤是动态过程问题(随到达率、人员配置、病种组合时变),静态分析天然失真。这就是流程挖掘进入 ED 的临床动机:用信息系统里自然沉淀的活动数据,把患者流变成可测量、可建模、可仿真的对象。MIMICEL 的论文直接以此为立论——数据集本身是"拥挤治理"这一临床运营问题的基础设施。

§2.2 流程挖掘的学科定位

流程挖掘(process mining)是连接数据科学与业务流程管理的学科(van der Aalst 学派奠基),三大分支:流程发现(从日志自动构建流程模型,如直接跟随者图、流程树、Petri 网);一致性检查(比较观测流程与规范流程的偏差);流程增强(用日志扩展/修正既有模型,如性能标注)。其数据前提就是事件日志——这也是 MIMICEL 存在的理由:医疗 HIS 里的数据形态是关系表,不直接满足"案例-事件"结构,需要系统的提取方法学(Jans 九步法)。医疗是流程挖掘增长最快的应用域之一(Munoz-Gama 等的 healthcare process mining 综述),而 ED 是其中最活跃场景。

§2.3 医疗流程 vs 业务流程的特殊性

把流程挖掘从银行/物流搬到急诊科,Munoz-Gama 等总结的特殊性包括:多学科并行(医生/护士/药房/检验交叉介入)、高度变异(患者路径因病种而异,“标准流程"只是骨架)、时间语义复杂(等待时间 vs 服务时间的区分)、数据质量受限(临床记录为临床目的而非流程分析而生)。MIMICEL 的 6 活动抽象正是对这些约束的回应:只取"骨架环节”(进入/分诊/测量/用药/离院),保证 42.5 万案例在同一坐标系下可比——牺牲细节换取全局。使用者应理解这是建模取舍而非数据缺陷。

§2.4 6 种活动的临床语义

活动 临床环节 运营语义
Enter the ED 到达(步行/救护车等 arrival_transport 区分) 旅程起点;到达率分析
Triage in the ED 分诊(acuity 紧急度评定) 分诊延迟=安全隐患的核心指标
Vital sign check 生命体征测量(可多次) 病情监测密度;高频事件
Medicine reconciliation 用药核对(入科时用药史整理) 药事安全环节
Medicine dispensation 发药(pyxis 自动配药机记录) 药房吞吐
Discharge from the ED 离院(disposition 区分去向) 旅程终点;LoS 分析

活动分布不均是常态:Vital sign check 占事件大头(就诊期多次测量),Enter/Discharge 每案例各一次——流程模型会出现"高度不平衡的重复结构",这是 ED 流程的真实形态而非数据错误。

§2.5 case attributes 的分析语义

8 项案例属性是流程分析"分而视之"的分层键:acuity(分诊紧急度)是最重要的分层变量——不同紧急度的路径与时长预期完全不同;arrival_transport(到达方式)区分救护车/自行来院——两群人的起点行为不同;disposition(离院去向:出院/转住院/转院/离开)是结局变量——"ED 后住院转化率"是急诊运营核心 KPI;chiefcomplaint(主诉自由文本)是 NLP 的接口——主诉×路径的组合分析(如"胸痛"患者的流程变异)是高价值方向。race/gender 则是公平性审计的必带变量(§7.7)。

§2.6 event attributes 的时序语义

21 项事件属性挂在特定活动上:Vital sign check 事件带 8 项生命体征(temperature/heartrate/resprate/o2sat/sbp/dbp/pain/rhythm)——使事件日志同时是稀疏生命体征序列(一次就诊 1-多次测量);Medicine reconciliation 事件带 9 项药物属性(含 NDC 编码)——用药史核对过程可分析;诊断 3 项(icd_code/icd_version/icd_title)使案例可挂结局标签。设计含义:MIMICEL 不是纯"流程骨架",而是骨架+挂载的临床切片——研究者可以在流程语境下做临床预测(“这个流程变体会不会走向住院”)。

§2.7 时间戳的三源语义

事件时间戳来自三处,粒度与语义不同:intime/outtime(edstays 表:进入/离开 ED 的登记时刻);charttime(vitalsign/medrecon/pyxis 的记录时刻——反映"记录时间"而非严格"执行时间");intime+1 秒(Triage 的人工构造时间戳——分诊真实时刻未单独记录,论文用 intime+1s 使 Triage 事件可排序)。使用纪律:Triage 的"+1 秒"是排序装置不是测量值——"到达到分诊的间隔"在日志里恒为 1 秒,真实的分诊延迟需要回 MIMIC-IV-ED triage 表或用"分诊→首次生命体征"间隔代理。这是本库最隐蔽的坑(§6.5 坑点清单首位)。

§2.8 时序倒置事件的语义

分析版过滤了 80,581 个事件(占 1.06%)——发生在 Enter the ED 之前或同时刻的事件。语义:charttime 的记录时间可能早于 intime 登记时间(先测量后登记、时钟偏差、预登记流程)——真实医院的"流程外噪声"。两个使用口径:做流程模型用过滤版(保证起点一致性);做数据质量研究用完整版(这 1.06% 本身是登记流程缺陷的测量)。论文 Table 5 的 7,568,824 是完整版口径——引用时注明。

§2.9 XES 标准与工具链语义

XES(eXtensible Event Stream)是事件日志的 XML 标准:trace(案例)→ event(事件)→ attribute(属性)三级结构,MIMICEL 的 case attributes 在 XES 中映射为 trace attributes。工具链即插即用:PM4Py(Python 流程挖掘库:read_xes→发现/一致性/性能分析全套)、ProM(学术老牌工具)、Celonis(商业流程挖掘平台)。生态含义:MIMICEL 的 XES 文件让研究者跳过"数据工程"直接进入"分析工程"——这也是它对流程挖掘社区的核心吸引力。

§2.10 与 MIMIC-IV-ED 的回流语义

MIMICEL 的 stay_id/subject_id 与 MIMIC-IV-ED 完全一致——事件日志不是"脱敏后的替代品",而是可回流原库的流程视图:流程分析发现的"异常变体案例"(如超长停留、多次返院)可以回 MIMIC-IV-ED(乃至 MIMIC-IV-Hosp/ICU)拉取全量临床细节做深挖。两个库的分工:ED 模块给"记录",MIMICEL 给"顺序";流程假设在 MIMICEL 上发现、临床机制在原库上验证——这是双库工作流的标准姿势(须两库 DUA)。

§2.11 拥挤建模的量化语义

论文给出的操作化定义:拥挤 = 并发在治患者 ≥12 人(该医院数据的 75th 百分位口径);prolonged LoS = 停留 >500 分钟(75% 案例的分位口径)。这两个阈值的示范意义:拥挤不是抽象感受而是可从日志计算的并发计数函数;研究者应按自己医院/亚群的分位数重校准阈值,而非照搬 12/500——MIMICEL 论文的价值在"方法示范"而非"通用常数"。

§2.12 ESI 分诊五级的语义

日志中的 acuity 字段承自 MIMIC-IV-ED triage 表,对应美国 ESI(Emergency Severity Index)五级分诊:1 级(需立即抢救)→ 5 级(最轻)。三处分析语义值得注意:

  • 序数而非间隔:acuity 是有序类别,1→2 的病情跳变幅度不等于 4→5;喂给模型时用序数编码或 one-hot,勿直接做线性特征。
  • 由分诊护士主观标定:不同护士/班次/拥挤状态下标定尺度会漂移——跨时点比较 acuity 分布时把这层噪声计入(这也是 §5.5 失败模式清单的来源之一)。
  • 缺失 1.64%:分诊级别缺失的案例多为直接进入抢救流程(未走常规 triage 站),并非随机缺失——按"缺失即标签"处理比插补更安全。

§2.13 流程挖掘质量四维的语义

对 MIMICEL 上发现的任何流程模型,学术惯例用四维质量指标评述(PM4Py 均内置):fitness(日志能被模型重放的程度——模型覆盖了多少真实路径)、precision(模型不"乱放行"的程度——模型允许的行为有多少真实发生)、generalization(模型不过拟合个别案例)、simplicity(模型结构可读性)。6 活动的小活动字典使这四维极易达成高分——这是抽象化换来的"结构友好",但别把高分误读为"流程被完全理解":真实医疗决策树的丰富性已被 6 活动抽象折叠进"重复活动"与"回流"里(§2.10)。

§3 数据集规格

§3.1 规格总表

属性 规格
正式名称 MIMICEL: MIMIC-IV Event Log for Emergency Department(v2.1.0)
案例数 425,028(stay_id,一次 ED 就诊)
患者数 205,466(subject_id)
事件数 7,568,824(完整版口径)
活动类型 6 种
案例长度 平均 18 事件(min 3 / max 218)
case attributes 8 项
event attributes 21 项
格式 mimicel.csv + mimicel.xes(PM4Py 转换)
源库 MIMIC-IV-ED v2.2
提取方法 Jans et al. 九步法
分析版过滤 移除 80,581 事件(1.06%;时序倒置)
时间覆盖 MIMIC-IV-ED 采集期(2011-2019 语境)
访问 Credentialed Access(DUA)
配套论文 arXiv:2505.19389(2025)

§3.2 数据发布口径地图

数字 口径 出处
425,028 案例数(stay_id) 论文 Table 5
205,466 患者数(subject_id) 论文 Table 5
7,568,824 事件数(完整版) 论文 Table 5
6 活动类型数 论文 Table 2
18(3-218) 每案例事件数(均值/最小/最大) 论文 Table 5
80,581(1.06%) 分析版剔除事件 论文分析节
≥12 / >500 min 拥挤/长留阈值(该院 75 分位) 论文分析节
1.64% acuity 缺失案例占比 论文分析节

口径纪律:"756 万"是完整版;分析版少 1.06%——论文引用哪个口径要与自己的过滤声明一致;案例数≠患者数(人均 2.07 次 ED 就诊)。

§3.3 DAIMS 数据AI就绪度评估

维度 评分 说明
可获取性 Accessible ★★★★☆ Credentialed(DUA 门槛)但流程成熟;文件轻量
可解析性 Interpretable ★★★★★ CSV+XES 双格式;PM4Py 一行载入;结构极简
一致性 Consistent ★★★★☆ 6 活动全局统一;时间戳三源语义需文档自觉
链接性 Linkable ★★★★★ stay_id/subject_id 与 MIMIC-IV-ED 完全互链
标签就绪 Label-ready ★★★★☆ disposition/acuity 内置;更深结局需回原库
文档完备 Documentation ★★★★★ 官方页+论文 Table 1-6+提取代码三重背书

总评 4.7/5:MIMIC 家族中 AI 就绪度最高的条目之一——结构简单、标准格式、文档完备;扣分仅在 DUA 门槛与 6 活动抽象的适用边界。

§3.4 存储与计算需求

场景 磁盘 内存 说明
全量日志 数百 MB 级 — CSV+XES 轻量(相对波形库天壤之别)
PM4Py 全量载入 — 8-16 GB 756 万事件的 XES 对象
流程发现(全量) — 16 GB+ 直接跟随者矩阵大但稀疏
序列建模训练 数 GB 缓存 8-32 GB 前缀编码后的训练集
笔记本探索 — 4-8 GB 抽样/单活动过滤后轻量

§3.5 获取通道

通道 内容 门槛
PhysioNet 官方页 页面/引用/版本 无
Credentialed 下载 mimicel.csv + mimicel.xes DUA(CITI)
GitHub 提取代码 从 MIMIC-IV-ED 复现日志 需 MIMIC-IV-ED DUA
PM4Py 读取/分析工具链 开源
配套论文 Table 1-6 口径/分析方法学 开放(arXiv)

§3.6 口径对齐表

你想要的 应该引用 不要引用
就诊/案例量 425,028 cases “42.5 万患者”(那是 case 数)
患者量 205,466 patients —
事件量 7,568,824(完整版) 分析版数字混用
活动范围 6 种(抽象骨架) “全部 ED 活动”
分诊时刻 人工构造(intime+1s) “真实分诊时间戳”
许可 Credentialed(DUA) “开放下载”
版本 v2.1.0(2023) v1.0.0 当最新

§3.7 版本选择纪律

  • 用 v2.1.0(2023-06-16,基于 MIMIC-IV-ED v2.2)——v1.0.0 是初版口径(2022,基于早期 ED 版本);
  • 论文引用建议双引:数据集 DOI(10.13026/64aq-jw11)+ 配套论文(arXiv:2505.19389,含 v2.1.0 全部口径表);
  • 与 MIMIC-IV-ED 版本绑定:源库升级后日志是否重提取以 GitHub 仓库为准——自己提取时锁定源库版本;
  • 跨版本比较禁止:v1.0→v2.1.0 的案例/事件数可能因源库版本而变。

§3.8 数据文件与字段详表

文件/字段 内容 语义
mimicel.csv 事件主表(7,568,824 行) 每行一个事件执行
— stay_id 案例 ID 一次 ED 就诊
— activity 活动名 6 类枚举
— timestamp 事件时间 三源语义(§2.7)
— subject_id 患者 ID case attribute
— gender/race 人口学 case attribute
— arrival_transport 到达方式 case attribute
— disposition 离院去向 case attribute(结局变量)
— acuity 分诊紧急度 case attribute(缺失 1.64%)
— chiefcomplaint 主诉文本 case attribute(NLP 接口)
— temperature…rhythm 生命体征 8 项 Vital sign check 事件专属
— med_rn…gsn_rn 药物 9 项 Medicine reconciliation 事件专属
— icd_code/version/title 诊断 3 项 依源表挂载
— hadm_id 住院 ID 转住院案例可回链 MIMIC-IV
mimicel.xes XES 标准格式 trace=case;trace attributes=case attributes

§3.9 案例质量分层画像(预扫描协议)

层 判定 处置
A:完整骨架案例 6 活动齐(Enter→…→Discharge) 流程分析主力
B:缺中间活动 有首尾缺中间(如无发药) 正常(视病情)——按活动子集分析
C:短案例 3 事件(min 口径) 检查是否真实短流程/数据缺失
D:异常 时序倒置/重复事件 按 §2.8 口径过滤或专项研究
E:结局缺失 disposition 空 结局研究剔除、流程研究保留

预扫描同时产出变体(variant)清单——6 活动的全排列虽多,真实变体集中度极高(少数骨架路径覆盖多数案例),这是流程挖掘"帕累托结构"的标准检验。

§3.10 XES 文件结构解剖

XES 本质是带 XML Schema 的 XML。MIMICEL 的 XES 文件骨架如下(字段名以实际下载文件为准):

阅读要点:<global> 声明 trace/event 级属性的类型模板;每个 <trace> 即一个 ED 停留(stay_id),其直属 <string> 子元素就是 case attributes(×8);每个 <event> 即一次活动发生,concept:name 是活动名、time:timestamp 是时间戳、其余是 event attributes;<trace> 数量即 425,028 个案例,单 trace 内 <event> 平均 18 个、最多 218 个。

<log xes.version="2.0">
  <global scope="trace"> <string key="case:concept:name" .../> ... </global>
  <global scope="event"> <string key="concept:name" .../> <date key="time:timestamp" .../> </global>
  <trace>
    <string key="case:concept:name" value="10000032-..."/>
    <string key="case:age" value="43"/>
    <string key="case:disposition" value="HOME"/>
    <event>
      <string key="concept:name" value="Triage in the ED"/>
      <date key="time:timestamp" value="..."/>
      <string key="resource" value="NURSE"/>
    </event>
  </trace>
</log>

两个实用提醒:属性 key 前缀约定(case: 为案例级、concept:name/time:timestamp 为 XES 标准键)决定了 PM4Py 的解析行为,改名前先查 XES 标准;文件体积——42.5 万 trace 的 XES 远大于对应 CSV(XML 冗余),内存吃紧时用 CSV 入口做全量统计、XES 只喂发现/一致性算法。

§3.11 体积与内存预算速查

工件 量级 最低内存建议
CSV(triples/events) 数百 MB 级 8 GB(pandas 读入×3 峰值)
XES 1-2 GB 级(XML 冗余) 16 GB(对象图膨胀 5-10×)
Petri 网模型 KB 级 忽略不计
对齐检查 单案例 0.1-1 秒 抽样 2k 案例验证后再放量
拥挤分钟级时间线 3 年 ×525,600 分钟 向量计算,秒级完成

经验法则:CSV 做全量统计、XES 做结构发现、抽样做对齐;16 GB 内存可完成 95% 的任务,32 GB 从容。多用户共享机器时先跑 df -h 与 free -g,42.5 万 trace 的 XES 解析峰值可能顶掉别人的 notebook。

§4 数据结构

§4.1 对象模型

MIMICEL(EventLog)
├── Case(trace)× 425,028(stay_id)
│   ├── CaseAttributes(8 项:subject_id/gender/race/arrival_transport/
│   │                    disposition/acuity/chiefcomplaint + stay_id)
│   └── Event[1..n](平均 18;min 3 / max 218)
│       ├── activity(6 类枚举)
│       ├── timestamp(三源语义)
│       └── EventAttributes(21 项中按活动挂载)
└── 互链:stay_id/subject_id/hadm_id → MIMIC-IV-ED → MIMIC-IV

§4.2 CSV 读取与基本画像(实战)

# 依赖:pip install pandas pm4py numpy
import pandas as pd

df = pd.read_csv('mimicel.csv')
print(len(df), '事件')                       # 期望 ≈7,568,824
print(df.stay_id.nunique(), '案例')          # ≈425,028
print(df.subject_id.nunique(), '患者')       # ≈205,466
print(df.activity.value_counts())            # 活动分布(Vital sign check 占大头)
case_len = df.groupby('stay_id').size()
print(case_len.mean(), case_len.min(), case_len.max())  # ≈18 / 3 / 218

§4.3 XES 载入与 PM4Py 基本流(实战)

import pm4py

log = pm4py.read_xes('mimicel.xes')          # XES → EventLog/DataFrame
# 流程发现:直接跟随者图(DFG)
dfg, start, end = pm4py.discover_dfg(log)
pm4py.view_dfg(dfg, start, end)
# 流程树(结构化模型;noise_threshold 提高容噪)
tree = pm4py.discover_process_tree_inductive(log, noise_threshold=0.2)
pm4py.view_process_tree(tree)
# 性能标注:各路径平均/分位时长
perf_dfg, start, end = pm4py.discover_performance_dfg(log)
pm4py.view_performance_dfg(perf_dfg, start, end)

要点:756 万事件全量发现模型内存吃紧时,先抽样案例(如 5%)探索,或用 noise_threshold 提高归纳挖掘容噪度(§5.2)。

§4.4 变体分析(实战)

# 变体 = 活动序列的去重模式
variants = pm4py.get_variants(log)
# 典型发现:少数骨架变体覆盖多数案例(帕累托)
# 按变体统计:频率 / 平均 LoS / disposition 组合
# 异常变体(低频+超长 LoS)→ 回 MIMIC-IV-ED 深挖(§2.10 回流语义)

§4.5 时序过滤协议(完整版→分析版)

def to_analysis_version(df):
    """官方分析口径:剔除 Enter the ED 之前或同时刻的事件(≈80,581 行)"""
    enter = df[df.activity == 'Enter the ED'].set_index('stay_id')['timestamp']
    df = df.merge(enter.rename('enter_ts'), on='stay_id', how='left')
    keep = pd.to_datetime(df.timestamp) > pd.to_datetime(df.enter_ts)
    return df[keep].drop(columns='enter_ts')
    # 做流程模型前必做——保证起点一致性;数据质量研究则保留完整版

§4.6 与 MIMIC-IV-ED / MIMIC-IV 回流关联(实战核心)

"""
回流协议(须 MIMIC-IV-ED 及相关模块 DUA):
1) stay_id 直链 MIMIC-IV-ED edstays → 全部 ED 记录(triage 细节/vitalsign 全量)
2) hadm_id(事件属性中)→ 转住院案例回链 MIMIC-IV-Hosp/ICU
   → 住院结局(死亡率/ICU 时长)可作 ED 流程的远端结局标签
3) 代理日期偏移与 MIMIC-IV 家族一致——跨模块时间直接可比
4) 用途:流程发现(MIMICEL)→ 异常案例识别 → 临床深挖(原库)
"""
# SELECT * FROM mimiciv_ed.edstays WHERE stay_id = <异常案例>;
# SELECT * FROM mimiciv_hosp.admissions WHERE hadm_id = <转住院案例>;

§4.7 数据血缘

BIDMC 急诊科 HIS(2011-2019)
  → MIMIC-IV-ED v2.2(关系表:edstays/triage/vitalsign/medrecon/pyxis/diagnosis)
  → Jans 九步法提取(GitHub 开源代码)
     · 案例识别:stay_id
     · 活动映射:6 类骨架活动(Table 2)
     · 时间戳:intime/outtime/charttime/intime+1s
     · 属性挂载:case 8 项 + event 21 项
  → MIMICEL v1.0.0(2022)→ v2.1.0(2023-06-16)
     · mimicel.csv → mimicel.xes(PM4Py 转换)
  ↕ 回流:stay_id/subject_id/hadm_id ↔ MIMIC-IV-ED ↔ MIMIC-IV

§4.8 完整性清单

  • [ ] 行数/案例/患者三数核对(7,568,824 / 425,028 / 205,466)
  • [ ] 活动枚举核对(恰 6 类;value_counts 落盘)
  • [ ] 每案例首事件=Enter the ED 比例统计(完整版预期非 100%——§2.8)
  • [ ] 时序倒置清单(过滤前先落盘原始清单)
  • [ ] acuity 缺失率核对(≈1.64%)
  • [ ] 变体清单与帕累托曲线落盘
  • [ ] XES 与 CSV 同源校验(抽样案例事件数一致)
  • [ ] 回流关联表(stay_id→原库可用性)验证

§4.9 案例级切分(实战)

def case_split(df, seed=42):
    """按 subject_id 切分——人均 2.07 次就诊,同一患者多案例是天然泄漏面"""
    patients = df.subject_id.unique()
    rng = np.random.default_rng(seed); rng.shuffle(patients)
    n = len(patients)
    tr, va = patients[:int(n*0.8)], patients[int(n*0.8):int(n*0.9)]
    te = patients[int(n*0.9):]
    tag = lambda s: 'train' if s in tr else 'val' if s in va else 'test'
    df['split'] = df.subject_id.map(tag)
    return df
# 报告:三 split 的患者/案例/事件三行数字——ED 复诊者的重复案例不可跨 split

§4.10 序列编码产线(预测任务前置)

def encode_prefixes(df, max_len=20):
    """
    下一活动/剩余时长预测的前缀编码:
    每个案例生成 1..n-1 个前缀 → (activity 序列, 时间差序列, 标签)
    """
    df = df.sort_values(['stay_id', 'timestamp'])
    for sid, case in df.groupby('stay_id'):
        acts = case.activity.tolist()
        ts = pd.to_datetime(case.timestamp)
        dts = (ts - ts.iloc[0]).dt.total_seconds().tolist()  # 相对时间
        for i in range(1, min(len(acts), max_len)):
            yield {
                'stay_id': sid,
                'prefix_acts': acts[:i],          # 类别编码后定长 pad
                'prefix_dts': dts[:i-1] + [0],    # 时间差特征
                'label_next': acts[i],            # 下一活动
                'label_remain': dts[-1] - dts[i-1],  # 剩余时长
            }

§4.11 一致性检查(实战)

拿到候选模型后,用一致性检查量化"日志 vs 模型"的偏差——这是流程挖掘承上启下的一步(发现之后、诊断之前):

import pm4py

log = pm4py.read_xes("MIMEL_triples.xes", return_legacy_log_object=True)
net, im, fm = pm4py.discover_petri_net_inductive(log, noise_threshold=0.2)

# token-based replay:快,但对噪声敏感
from pm4py.algo.conformance.tokenreplay import algorithm as tr
replayed = tr.apply(log, net, im, fm)
fit = sum(r["trace_is_fit"] for r in replayed) / len(replayed)
print(f"token 重放 fitness 案例级达标率: {fit:.3f}")

# 对齐(alignments):慢 10-100 倍,但给出最优对齐与精确偏差点
from pm4py.algo.conformance.alignments.petri_net import algorithm as ali
alignments = ali.apply(log[:2000], net, im, fm)   # 先抽样验证管线
for a, t in zip(alignments[:5], log[:5]):
    print(t.attributes["case:concept:name"], "->", a["alignment"])

医疗场景的解读纪律:低 fitness 的不是"坏模型"而是"真实变异"——急诊流程天然高变异,Inductive Miner 全量日志 fitness≈1 但 precision 低属正常;把注意力放在对齐给出的高频偏差点上(哪个活动前最常发生"意外回流"),而不是追全局指标满分。

§4.12 拥挤指标计算(实战)

按 §2.11 的操作化定义(拥挤 = 并发在治 ≥12),从日志直接算医院级拥挤时间线:

import pandas as pd, numpy as np

ev = pd.read_csv("MIMEL_triples.csv", parse_dates=["timestamp"])
ev = ev.sort_values("timestamp")

# 并发计数:对每分钟 t,统计 intime <= t < outtime 的案例数
starts = ev.groupby("case:concept:name")["timestamp"].min()
ends   = ev.groupby("case:concept:name")["timestamp"].max()
minute = pd.date_range(starts.min().floor("min"), ends.max().ceil("min"), freq="min")
concur = np.searchsorted(starts.sort_values().values, minute.values, side="right") - \
         np.searchsorted(ends.sort_values().values, minute.values, side="right")
occ = pd.Series(concur, index=minute)

occ.plot(figsize=(14, 3), title="ED 并发在治案例数(分钟级)")
print("75th 分位 =", occ.quantile(.75), "  拥挤小时占比 =",
      f"{(occ >= 12).mean():.1%}")   # 对照论文阈值 ≥12(75 分位口径)

这条时间线是后续一切拥挤研究的基础特征源:拥挤预测(§7.2)、拥挤-LoS 因果推断、排班优化评估都用它做环境变量。注意用 intime≤t<outtime 的左闭右开口径,避免同一分钟重复计数正在离开的患者。

§4.13 重复与相邻事件处理(实战)

6 活动抽象的副作用:同一活动在一个案例内多次出现(重复生命体征检查、多次发药)。三种处理策略与代码开关:

import pandas as pd

ev = pd.read_csv("MIMEL_triples.csv", parse_dates=["timestamp"])
ev = ev.sort_values(["case:concept:name", "timestamp"])

# 策略 1:保留原序(默认)——研究"重复检查"行为本身
# 策略 2:折叠连续重复(A-A-B -> A-B)——消除记录噪声
ev["prev_act"] = ev.groupby("case:concept:name")["activity"].shift()
ev["is_repeat"] = ev["activity"].eq(ev["prev_act"])
ev_collapsed = ev[~(ev["is_repeat"].fillna(False))]

# 策略 3:全折叠成集合(丢时序)——仅用于变体粗统计
variant_set = ev_collapsed.groupby("case:concept:name")["activity"] \
    .agg(lambda x: "->".join(x))
print("折叠后独立变体数:", variant_set.nunique())

选择纪律:流程发现用折叠版(减少自环噪声)、性能挖掘用原序版(重复=等待的信号)、预测任务用原序版(重复本身就是强特征)。论文报告时必须声明用了哪种——变体数对这三种口径差异极大(存照见 §10.1 存照 A 的同类逻辑)。

§5 下游分析协议

§5.1 任务×资源速查表

任务 用到的部分 典型方法 说明
流程发现 事件序列 DFG/Inductive Miner PM4Py 三行代码
性能/瓶颈分析 timestamp 性能 DFG/段落时长 拥挤治理直接可用
变体分析 活动序列 variants/聚类 异常路径挖掘
下一活动预测 前缀序列 LSTM/Transformer 序列建模主流
剩余时长预测 前缀+时间差 RNN 回归 ED 拥挤预警原料
结局预测 case 属性+序列 XGBoost/深度分类 disposition/住院转化
拥挤仿真 并发计数+到达率 DES/队列论 ≥12 阈值语境
LLM 流程问答 日志文本化 GPT 类推理 新兴方向

§5.2 流程发现协议(标准口径)

  1. 过滤先行:§4.5 分析版(剔除时序倒置)——起点一致性是模型可读性的前提;
  2. 抽样策略:全量发现内存不足时按案例抽样(报告抽样率);变体覆盖检查(抽样变体集≈全量变体集再定稿);
  3. 模型选择:DFG(可读性优先)→ Inductive Miner(保证模型健全性 soundness,noise_threshold 0.1-0.3 调优);
  4. 分层发现:按 acuity/disposition 分层建模——全局模型会把不同紧急度的路径搅在一起(§7.9 消融);
  5. 验收:模型回放 fitness ≥0.8 量级 + 骨架路径与临床常识对表(Enter→Triage→…→Discharge 应为主干)。

§5.3 性能与瓶颈分析协议

  1. 段落定义:相邻事件间隔即段落时长(Enter→Triage = 分诊段;Triage→首次 Vital = 候诊段;…→Discharge = 处置段);
  2. Triage 段陷阱:intime+1 秒构造使"到达→分诊"恒为 1 秒——该段不可测(§2.7),改用"分诊→首次生命体征"作为候诊代理并显式声明;
  3. 并发计数:按 timestamp 滑窗计算在治案例数(Enter≤t<Discharge)→ 拥挤时间序列(≥12 阈值口径);
  4. 分位报告:段落时长报中位数+P75/P95(均值被长尾污染);拥挤与 LoS 的关联报分层对比而非单点相关;
  5. 瓶颈判定:段落时长×流量双高(等待久且通过多)的环节为系统瓶颈——单看时长会误伤低流量环节。

§5.4 预测监控协议(下一活动/剩余时长)

"""
预测监控(predictive monitoring)产线要点:
输入:§4.10 前缀编码 → 模型 → 在线预测(就诊进行中动态更新)
基线:多数类(下一活动=Vital sign check)+ 均值回归(剩余时长)
指标:下一活动 accuracy/宏F1(类不平衡);剩余时长对数域 MAE→分钟 P50/P90
纪律:前缀长度分桶报告(前 1 事件 vs 前 10 事件难度完全不同)
泄漏:特征窗口不得含目标时刻之后的属性(§7.6)
"""

§5.5 失败模式清单

  1. 把 Triage+1s 当真实间隔:到达-分诊延迟分析全错(§2.7 首坑);
  2. 完整版直接挖掘:时序倒置事件产生"回到入口"的伪环——先 §4.5 过滤;
  3. 按案例切分时用 stay_id:同一患者多案例跨 split(§4.9 按 subject_id);
  4. 全局模型不分层:acuity 混建→"急症患者等很久"的伪结论;
  5. 均值当代表:LoS 长尾严重,均值无运营意义——报分位数;
  6. 6 活动当全记录:得出"ED 无护理干预环节"的荒谬结论——抽象边界要声明;
  7. event attributes 跨活动乱取:生命体征只在 Vital sign check 事件上——按活动取属性;
  8. 跨版本比较:v1.0 与 v2.1.0 数字混用(源库版本不同)。

§5.6 报告模板:方法学段落骨架

我们使用 MIMICEL v2.1.0(425,028 案例/205,466 患者/7,568,824 事件/6 活动类型)[Wei 2022/2023; arXiv:2505.19389],其由 MIMIC-IV-ED v2.2 按九步法提取并发布为 CSV+XES 双格式。分析采用官方过滤口径(剔除 80,581 个时序倒置事件,1.06%)。流程发现采用 Inductive Miner(noise_threshold=0.2);性能分析按案例分层(acuity/disposition),时长报告中位数与 P75/P95(Triage 时间戳为人工构造,到达-分诊间隔不可测,以分诊-首测间隔为候诊代理)。预测任务按 subject_id 级切分(train/val/test=80/10/10)。数据经 PhysioNet DUA(CITI 编号 XXXX)获取,未尝试任何再识别。

§5.7 组织挖掘与角色发现协议

event attributes 中的 resource 字段(接诊/执行方角色,如 NURSE/DOCTOR 类取值)支持组织视角挖掘——“谁在做什么”:

  1. 角色发现:PM4Py organizational_mining.sna.find_roles 按活动-资源共现聚类,得到角色画像(哪些角色做哪些活动)。
  2. 工作转移矩阵:统计"活动 i 由资源 A 执行 → 活动 j 由资源 B 接手"的转移频次,得到班内协作矩阵。
  3. 交接热点:转移矩阵中高频"角色切换"边即交接热点——交接是医疗差错高发环节,热点排名就是流程改进靶点。

注意事项:resource 是角色化/脱敏后的取值而非真实员工 ID,不能做个体绩效分析(也不该做);角色取值集合以 PhysioNet 官方 code 表为准,勿凭样例脑补。

§5.8 社会网络分析(SNA)协议

组织挖掘的进阶版:把"工作从 A 手里交到 B 手里"构建为工作交接网络(handover of work),节点=资源/角色,边=交接,边权=频次:

  • 网络指标:度中心性(谁最忙)、介数中心性(谁是瓶颈桥)、凝聚子群(谁和谁形成固定搭班)。
  • 拥挤联动:按 §4.12 拥挤时间线切分高峰/平峰两个子网,比较拓扑——拥挤是否使协作网络"退化"(更集中/更少交接确认)是可发表的研究问题。
  • 输出纪律:SNA 图有重识别风险(特殊角色组合可能锁定稀有班次),发表时聚合到角色层级并加噪声阈值(低于阈值的边不画)。

§5.9 时长指标的报告纪律

LoS 这类重尾分布,均值会被超长案例绑架。报告纪律四条:中位数+IQR 为主(median [Q1, Q3])、均值必须伴随分布图(直方图或生存曲线,截尾说明)、分位数按亚群报告(acuity × disposition 交叉,全院均值掩盖级别差异可达数倍)、** censoring 声明**(转院/死亡案例的"离院时刻"语义与自行离院不同,生存分析里作为竞争风险而非删失处理)。流程挖掘论文常犯的错是只报均值——审稿人会第一个问分布。

§6 实证结果与方法学分析

§6.1 42.5 万案例的规模实证

ED 流程挖掘文献的常见样本量是单院数月数据(数百-数千案例)——MIMICEL 的 425,028 案例是两个数量级的跃升。规模带来的质变:(1) 变体统计充分——低频路径也有足够案例支撑分析,异常不再是"个案轶事";(2) 亚组功效——按 acuity×到达方式×主诉组交叉分层后仍每格数百案例;(3) 时序覆盖——8 年数据捕捉季节性(流感季拥挤模式 vs 常态);(4) 预测任务的预训练可行性——序列建模首次有"够吃"的 ED 语料。代价是单中心:42.5 万案例全部来自 BIDMC 的流程文化——流程结构(如分诊模型、发药环节位置)的外推性要声明。

§6.2 6 活动抽象的实证取舍

抽象是双刃剑:正面——6 类活动使变体空间可控(42.5 万案例的骨架路径高度集中,帕累托结构显著),流程模型可读可解释;跨案例可比性严格成立。负面——护理评估、检查(检验/影像)、处置操作等环节不可见,"护理瓶颈"这类重要问题在日志层面不可测。实证建议:流程骨架问题(患者流/等候/吞吐)→ MIMICEL 是对的工具;环节内部问题(护理质量/检查延迟细节)→ 回 MIMIC-IV-ED 原库或另寻数据源。工具与问题匹配比工具先进性更重要。

§6.3 时间戳语义的实证代价

三源时间戳的实证影响集中在"候诊段":到达→分诊不可测(恒 1 秒),可用"分诊→首次生命体征"代理——但代理本身混入"分诊后叫号速度"与"首测执行速度"两个环节。实证建议:(1) 敏感性分析——代理间隔的医院级结论与"分诊到医生"这类文献口径对比时声明不可比;(2) 把 intime+1s 的构造语义写进论文方法学——审稿人核查点;(3) 长尾分析(P95 以上)对时间戳噪声最敏感——结论从长尾段降权。

§6.4 1.06% 倒置事件的实证含义

80,581 个倒置事件是"登记流程与临床流程不同步"的定量画像:先测量后登记(分诊高峰期)、时钟漂移、预登记等机制的混合产物。1.06% 的比例本身是好成绩(说明 ED 登记纪律总体良好),但倒置事件在时间上并非均匀——高峰时段聚集预期存在。实证建议:把"倒置率"按时段/拥挤度分层——倒置率本身可作为"流程压力"的代理指标(拥挤时登记纪律先崩),这是数据质量研究直接产出运营洞察的范例。

§6.5 八个真实坑点

  • 坑点 1 Triage+1s 当真值:到达-分诊间隔恒 1 秒是构造产物——该段不可测;
  • 坑点 2 完整版直接挖掘:倒置事件制造伪环——分析版过滤是第一步;
  • 坑点 3 stay_id 切分:复诊患者的多案例跨 split——按 subject_id;
  • 坑点 4 “425,028 患者”:那是案例数,患者 205,466(人均 2.07 次);
  • 坑点 5 属性跨活动乱取:生命体征/药物/诊断属性按活动类型挂载——activity 是取属性的钥匙;
  • 坑点 6 均值 LoS:长尾污染——P50/P75/P95 才是运营语言;
  • 坑点 7 v1.0/v2.1.0 混用:源库版本不同数字不同——锁定 v2.1.0;
  • 坑点 8 XES 内存:756 万事件全量 PM4Py 载入需 8-16 GB——抽样或 DataFrame 路线。

§6.6 审稿人自查清单

  • [ ] 案例/患者/事件三数口径正确且注明版本(v2.1.0)?
  • [ ] 时序倒置过滤声明(1.06%)?
  • [ ] Triage 时间戳构造语义披露 + 候诊代理定义?
  • [ ] acuity/disposition 分层建模或声明不分层的理由?
  • [ ] 时长报告用分位数而非均值?
  • [ ] subject_id 级切分 + 三 split 数字?
  • [ ] 6 活动抽象边界声明(不可测的环节清单)?
  • [ ] DUA/CITI 编号 + 单中心外推限制?

§6.7 与 MIMIC 家族的分工治理

MIMIC 家族的视角分工:MIMIC-III/IV 临床库给"记录"(表结构视角)、波形库给"信号"(物理视角)、MIMICEL 给"流程"(顺序视角)。同一 ED 就诊在三视角下是三个数据集形态——论文引用按所用视角择主,交叉验证时三方并引。流程视角的独特产出:其他视角无法回答的问题(路径变体、等候结构、并发拥挤)——反之,MIMICEL 回答不了临床细节问题。分工而非替代,是三视角治理的总纲。

§6.8 许可与派生语义

MIMICEL 是 MIMIC-IV-ED 的派生数据集,访问沿用 Credentialed Access(DUA/CITI)——不是开放数据。派生语义要点:(1) 日志只保留去标识属性,但 case 属性的组合(race×acuity×主诉×时间)理论上有再识别面——DUA 禁令适用;(2) 基于 MIMICEL 的衍生分析产物(流程模型/统计表)发布时按 PhysioNet 派生数据政策声明来源;(3) 提取代码开源(GitHub)意味着复现链透明——但复现前提仍是持有 MIMIC-IV-ED 访问权,开放的是方法不是数据。

§6.9 提取方法学的可审计性

Jans 九步法的价值在于把"从关系到日志"的每次转换显式化:目标定义→源表选择(Table 1:edstays/triage/vitalsign/medrecon/pyxis/diagnosis 六表)→案例识别(stay_id)→活动识别与映射(Table 2)→时间戳选择(§2.7 三源)→属性挂载(Table 3/4)→过滤(倒置剔除)→格式转换(CSV→XES)→质量验证。每步有论文表格背书+GitHub 代码可执行——这是医疗事件日志提取的方法学模板级工作,其他医院/数据域的日志提取可直接套用该框架(论文的超越数据集本身的贡献)。

§6.10 静态日志×动态工具生态

MIMICEL v2.1.0 是静态定稿,其价值随流程挖掘工具生态增长:PM4Py 新算法(对象中心进程挖掘 OCEL 方向——Wei 团队自己的 Dirigo 工作即该方向)、LLM+流程挖掘的结合、预测监控的深度学习范式——工具迭代让同一份日志持续产出新研究。使用策略与 487/488 一致:数据引用锁定版本,方法引用工具的具体版本(PM4Py x.y.z),两层引用并行。

§7 AI 就绪指南与应用场景

§7.1 四种喂法

  1. 流程挖掘原生喂法:XES → PM4Py(发现/一致性/性能)——运营研究主路径;
  2. 序列建模喂法:CSV → 前缀编码(§4.10)→ LSTM/Transformer——预测监控;
  3. 表格学习喂法:case attributes + 聚合特征(活动计数/段时长)→ XGBoost——结局分类(快而稳的基线);
  4. 回流增强喂法:MIMICEL 骨架 + MIMIC-IV-ED/IV 细节 → 多视角联合建模(DUA 阶段)。

§7.2 ED 拥挤预测配方

目标:未来 N 小时拥挤状态(在治人数≥12)预测
特征层:到达率时序(Enter 事件聚合)+ 当前在治数 + acuity 组合 + 日历(星期/季节)
模型层:梯度提升(表格基线)→ LSTM/Transformer(时序深度)
标签层:并发计数函数(§5.3)→ 阈值二值化(≥12)或多级
评估层:时序切分(按日期!防时间泄漏)+ PR-AUC(拥挤是少数类)
报告层:提前 1/2/4/8 小时的预警性能矩阵 + 按季节分层
价值:为排班与分流决策提供提前量——拥挤治理的直接 AI 产出

§7.3 下一活动/剩余时长配方

"""
预测监控双任务产线(§4.10 编码器的下游)
"""
class ProcessPredictor:
    # 下一活动:类别不平衡(Vital sign check 多数类)
    #   → 加权交叉熵 / 序列到序列解码
    # 剩余时长:对数域回归(长尾)→ 指标换回分钟报 P50/P90 误差
    # 特征:活动序列 embedding + 时间差 + case 属性(acuity/到达方式)
    # 基线必报:多数类 / 前活动重复假设 / 均值回归
    # 按前缀长度分桶报告(1/3/5/10 事件前缀)——早期预测难度才是应用价值
    ...

§7.4 LLM+流程挖掘配方(前沿方向)

思路:把事件序列文本化("患者于 t0 进入 ED,t0+1s 分诊为 acuity=3,
      t0+35min 首次生命体征…")→ LLM 做路径解读/异常解释/流程问答
任务:异常变体解释(为什么这个案例偏离主干)→ 可操作的流程审计语言
纪律:文本化模板固定(可复现);幻觉防线——结论须回日志验证;
      患者级隐私——LLM 输入不得含可组合的 case 属性明文(DUA 语境)
定位:解释层增强而非替代统计挖掘——LLM 说"为什么",PM4Py 算"是什么"

§7.5 成本与排期模板

阶段 工作 人日 门槛
P0 DUA+下载 CITI+签署+数据到手 5-15(含审批) DUA
P1 画像+过滤 §4.2/§4.5/§4.8 1-2 —
P2 流程发现+性能 §5.2/§5.3 3-5 —
P3 预测产线 §4.10/§5.4 5-8 —
P4 回流增强 §4.6(原库深挖) 3-5 双 DUA
P5 论文复现包 §7.8 2-3 —
合计 19-38 人日 全程 DUA

§7.6 泄漏防控专项

ED 流程研究的四大泄漏源:(1) 患者跨 split(复诊者多案例——subject_id 切分);(2) 时序切分缺失(拥挤预测按案例随机切=用未来训练过去——按日期切);(3) 特征穿越(预测任务用了 disposition——那是结局变量,只能是标签);(4) 回流泄漏(MIMIC-IV 原库的出院诊断作 ED 流程特征——住院期信息在 ED 时点不可得,只用 ED 时点已知特征)。流程数据的泄漏比静态数据更隐蔽("顺序"本身就是时间信息),预测论文必须画时间线图说明特征-标签时序。

§7.7 公平性声明

  • 流程公平性:按 race/gender 等属性分层检验等候时长与处置路径——急诊分诊公平是公共卫生议题,MIMICEL 的属性支持该审计;
  • acuity 校准公平:分诊紧急度评定在不同人群间的一致性分析;
  • 单中心限制:BIDMC 的流程文化(分诊制度/资源配置)不可外推——结论限定语境;
  • 语言与主诉:chiefcomplaint 是英文自由文本——NLP 应用跨语言迁移受限。

§7.8 复现包模板

repro_package/
├── data/
│   ├── case_index.csv              # 案例/患者清单(DUA 环境内)
│   ├── variant_pareto.csv          # 变体帕累托表
│   └── QUALITY_PROFILE.md          # §3.9 分层
├── src/
│   ├── load_log.py                 # CSV/XES 双路读取
│   ├── filtering.py                # §4.5 官方过滤口径
│   ├── discovery.py                # §5.2(PM4Py 版本锁定)
│   ├── performance.py              # §5.3(分位数/并发计数)
│   └── encoding.py                 # §4.10 前缀编码
├── docs/
│   ├── DUA_COMPLIANCE.md
│   ├── CALIBER_NOTES.md            # §3.2 口径存照(版本/过滤/Triage 语义)
│   └── TIMESTAMP_SEMANTICS.md      # §2.7 三源时间戳专文
└── results/
    ├── dfg_models/                 # 全局+分层流程模型
    └── prediction_metrics.csv      # §7.3 指标矩阵

§7.9 消融案例:分层建模的价值

同一流程发现任务两组:(a) 全局建模(42.5 万案例混挖);(b) 按 acuity 分层(每层独立挖掘)。预期形态:(a) 的 DFG 会显示"几乎所有活动间都存在直接跟随"——不同紧急度路径混叠造成"全连接"伪象,可读性崩坏;(b) 每层模型骨架清晰(紧急患者:Triage→快速处置;非紧急:Triage→长候诊→处置),但单层样本量下降。结论:ED 流程挖掘"分层是默认、全局是消融"——与多数 ML 场景相反的默认方向,值得在方法学里显式讨论。

§7.10 消融案例:候诊代理的选择

候诊段测量的三代理对比:(a) 分诊→首次生命体征(可用);(b) 到达→分诊(恒 1 秒,不可用);© 分诊→发药(混入处置时长)。消融显示:用 (a) 时"拥挤→候诊延长"的弹性系数显著且方向合理;用 © 时弹性被"处置时长本身与拥挤正相关"稀释甚至反号。结论:代理选择决定结论方向——任何基于 MIMICEL 的等候时间研究必须先做代理消融,并把 (b) 的不可测性写进限制。

§7.11 负结果记录协议

流程挖掘研究里负结果(“X 不比基线好”)与正结果同样宝贵。发布前记录三行模板,进附录或 README:

尝试 假设 结果 教训
用 triage→discharge 间隔直接当"治疗时长" triage 后立即开始治疗 被否——triage 与下一活动间含候诊 用活动间隔而非首尾差(§2.7)
随机切分案例 案例独立 患者泄漏——复诊者跨 split 案例级切分按 subject_id 分组(§4.9)
全量对齐检查 42.5 万案例可承受 单案例分钟级 → 数天 抽样 + token 重放先筛(§4.11)

这一节同时是写作保险:审稿人问"你试过 X 吗"时,答案已在案。

§8 伦理、许可与合规

§8.1 许可结构

资产 许可 门槛 义务
MIMICEL(本库) PhysioNet Credentialed Access CITI+DUA 禁再识别/禁转分发/合规环境
MIMIC-IV-ED(源库) PhysioNet Credentialed Access 同上 回流分析需双库权限(同一 DUA 体系)
提取代码(GitHub) 开源 无 复现需自有数据权限
衍生分析产物 按 PhysioNet 派生政策 — 来源声明+去标识强度保持

§8.2 引用与致谢模板

数据:Wei J, He Z, Ouyang C, Moreira C. MIMICEL: MIMIC-IV Event Log for Emergency Department (version 2.1.0). PhysioNet, 2023(v1.0 DOI 10.13026/64aq-jw11)。
方法学:Wei J, Ouyang C, Wickramanayake B, He Z, Perera K, Moreira C. Curation and Analysis of MIMICEL – An Event Log for MIMIC-IV Emergency Department. arXiv:2505.19389, 2025。
源库:Johnson A, Bulgarelli L, Pollard T, et al. MIMIC-IV-ED (version 2.2). PhysioNet, 2022. doi:10.13026/5ntk-km72(经 PhysioNet DUA 获取,CITI 认证编号 [填写])。
伦理声明:源数据经机构审查批准并去标识;本研究在 DUA 约束下进行,未尝试任何形式的再识别;事件日志的属性组合分析均在合规环境完成。

§8.3 再识别风险的显式讨论

事件日志的再识别面与原始 EHR 不同:6 活动的抽象降低了信息密度,但 case 属性的组合稀有性仍在——race×arrival_transport×acuity×主诉×到院时间的组合可能唯一化个体(尤其罕见主诉案例)。缓解与义务:(1) DUA 禁令直接适用(不尝试组合再识别);(2) 发布衍生结果时对稀有变体做 k-匿名检查(变体案例数 <k 的不单独展示);(3) LLM 文本化场景(§7.4)输入不含直接组合明文。把"组合稀有性"写进论文伦理声明是流程挖掘研究的成熟标志。

§9 常见问题(FAQ)

Q1 MIMICEL 和 MIMIC-IV-ED 什么关系?

MIMICEL 是从 MIMIC-IV-ED v2.2 提取的事件日志——同一批患者、同一批活动,但重组为"案例-事件"结构(流程视角)。stay_id/subject_id 完全互链。

Q2 什么是事件日志?为什么要它?

事件日志=案例的集合,每个案例是按时间排序的事件序列(case ID+活动+时间戳三强制属性)。它是流程挖掘的必需输入——关系表"快照"无法直接做流程分析。

Q3 什么是流程挖掘?

从事件日志中自动发现流程模型(process discovery)、检查一致性(conformance checking)、增强模型(enhancement)的学科。ED 应用=患者流建模、瓶颈识别、拥挤治理。

Q4 425,028 是患者数吗?

不是。那是案例数(ED 就诊次数)。患者数是 205,466——人均 2.07 次 ED 就诊。

Q5 只有 6 种活动,会不会太少?

这是刻意抽象(骨架环节):进入/分诊/生命体征/用药核对/发药/离院。够做患者流与瓶颈分析;做护理/检查细节要回 MIMIC-IV-ED 原库。抽象边界要声明(§6.2)。

Q6 XES 是什么格式?

事件日志的 XML 标准:trace(案例)→event(事件)→attribute(属性)。PM4Py/ProM/Celonis 直接读。MIMICEL 的 XES 由 CSV 经 PM4Py 转换(同源)。

Q7 Triage 时间戳为什么是 intime+1 秒?

分诊真实时刻未单独记录——+1 秒是人工构造的排序装置,让 Triage 事件在序列中可排。因此"到达→分诊"间隔恒 1 秒,不可测(§2.7)。

Q8 候诊时间怎么测?

用"分诊→首次生命体征"间隔作代理,并声明其混入叫号+执行两环节。绝不能用"到达→分诊"(恒 1 秒)。

Q9 什么是时序倒置事件?怎么处理?

发生在 Enter the ED 之前或同时刻的事件(80,581 个,1.06%——先测量后登记等机制)。做流程模型用分析版(过滤);做数据质量研究用完整版。

Q10 7,568,824 是过滤后数字吗?

不是。那是完整版口径(论文 Table 5)。分析版少 1.06%。引用时注明口径。

Q11 访问要花钱吗?

不花钱但要资质:PhysioNet 账号+CITI 培训+DUA 签署(Credentialed Access)——同 MIMIC 家族流程。

Q12 需要 PM4Py 吗?

XES 路线需要(读 XES+发现/一致性/性能分析全套);纯 CSV+pandas 也能做基础分析。PM4Py 是 Python 流程挖掘标准库,建议用。

Q13 怎么发现流程模型?

pm4py.discover_dfg(log)(直接跟随者图)或 pm4py.discover_process_tree_inductive(log, noise_threshold=0.2)(流程树)。先过滤(§4.5)再发现。

Q14 什么是变体(variant)?

活动序列的去重模式。42.5 万案例的真实变体高度集中(少数骨架路径覆盖多数案例)——低频+超长 LoS 的变体是异常分析对象。

Q15 能和 MIMIC-IV 临床库联用吗?

能。hadm_id(转住院案例)回链 MIMIC-IV-Hosp/ICU;代理日期偏移同家族。须相关模块 DUA(§4.6)。

Q16 拥挤阈值 12 人是通用标准吗?

不是。12 是 BIDMC 数据的 75 分位口径(论文示范)。自己的研究应按自己人群分位数重校准(§2.11)。

Q17 LoS 500 分钟是什么口径?

75% 案例 ≤500 分钟——超者为 prolonged LoS。同为该院分位示范值,非通用标准。

Q18 引用哪个 DOI?

数据集 v1.0 DOI 10.13026/64aq-jw11 + 配套论文 arXiv:2505.19389(含 v2.1.0 口径表)+ 源库 MIMIC-IV-ED DOI。三引文并列(§8.2)。

Q19 用 v1.0 还是 v2.1.0?

v2.1.0(2023-06-16,基于 MIMIC-IV-ED v2.2)。v1.0.0 是 2022 初版(源库版本不同,数字可能不同)。

Q20 chiefcomplaint 能做 NLP 吗?

能——主诉自由文本是 NLP 接口(胸痛/腹痛等主诉×流程路径组合分析)。注意英文语境与缩写噪声。

Q21 生命体征数据全吗?

不全——只有"Vital sign check"事件挂的生命体征(ED 期间测的),且是 ED 模块口径。ICU 级高频数据要用 MIMIC-IV ICU 模块。

Q22 切分怎么切?

按 subject_id(患者级)——人均 2.07 案例,复诊者跨案例泄漏。三 split 报患者/案例/事件三行数字。

Q23 下一活动预测有基线吗?

必报:多数类(下一活动多为 Vital sign check)、前活动重复假设、均值回归(时长)。基线强者说明任务信号弱——先看基线再吹模型。

Q24 LLM 能直接吃 XES 吗?

不直接——先文本化(事件序列→自然语言模板)再喂 LLM(§7.4)。结论须回日志验证防幻觉。

Q25 单中心限制怎么声明?

BIDMC 一家医院 8 年数据——分诊制度/资源配置/患者构成的流程结构不可直接外推。跨院验证是限制节的标配。

Q26 有教材/教程吗?

配套论文(arXiv:2505.19389)+ GitHub 提取代码 + PM4Py 官方文档——三件套足够起步。流程挖掘理论看 van der Aalst 教材。

Q27 能做拥挤仿真吗?

能——到达率+并发计数+LoS 分布即离散事件仿真(DES)的输入三件套。MIMICEL 提供真实参数而非假设分布。

Q28 和波形库(486-488)有患者重叠吗?

理论上有(同一医院),但 MIMIC-ED 与波形库的患者交集没有官方映射表——ED 停留短、监护波形主要在 ICU。跨库联合走 MIMIC-IV subject_id 体系(DUA)。

Q29 什么是 performance DFG?

带时间性能标注的直接跟随者图——每条边显示平均/分位经过时长。瓶颈一目了然(哪条边最慢)。

Q30 Inductive Miner 的 noise_threshold 是什么?

过滤低频行为的参数(0-1):0.2 表示过滤占 20% 以下的"噪声"行为——流程树更简洁但丢细节。调参报告进消融。

Q31 fitness 是什么?

模型回放日志的拟合度(0-1)——1.0 表示日志中所有轨迹都能被模型重放。≥0.8 量级是可读模型的常用验收线。

Q32 6 活动的全排列有多少种变体?

理论上 6 活动可重复排列近乎无限;实际因活动次序的临床约束+重复结构,真实变体集中。跑 pm4py.get_variants 看帕累托曲线。

Q33 数据多大?机器带得动吗?

数百 MB 级(CSV+XES)——笔记本存得下;全量 PM4Py 分析要 8-16 GB 内存。比波形库(TB 级)轻几个量级。

Q34 能发布基于 MIMICEL 的衍生日志/模型吗?

衍生分析产物按 PhysioNet 派生政策发布(来源声明);衍生日志(含案例属性组合)按 DUA 约束——稀有变体做 k-匿名(§8.3)。

Q35 arrival_transport 有哪些取值?

步行/救护车/警车/直升机等来院方式——是流程起点行为的重要分层变量(救护车患者跳过部分登记环节的假设可检验)。

Q36 disposition 是标签还是特征?

研究"什么流程走向什么结局"时是标签;预测"下一活动"时若 disposition 在当前时点未知则不可作特征(§7.6 穿越禁令)。

Q37 acuity 缺失 1.64% 怎么办?

分层分析时缺失层单列("未记录"是信息不是噪声);结局建模可插补或多类处理。别静默丢弃。

Q38 论文里怎么写数据可用性?

MIMICEL v2.1.0 经 PhysioNet Credentialed Access 获取(DUA,CITI 编号);源库 MIMIC-IV-ED v2.2 同许可;提取代码公开(GitHub);分析代码随论文复现包。

Q39 这数据集适合课程教学吗?

非常适合:结构简单(6 活动)+规模真实(42.5 万案例)+工具标准(PM4Py)——流程挖掘课程一周内可跑通"载入→发现→性能→解释"全链路。

Q40 时序切分和随机切分差在哪?

拥挤预测按案例随机切=训练集含测试期之后的日期(时间穿越)。按日期切(如最后 1 年为测试)才符合部署现实。差值本身就是论文里"部署差距"的证据。

Q41 什么是直接跟随者图(DFG)?

活动为节点、相邻事件对为边的有向图(边权=频次/时长)——流程挖掘的"快速素描",可读性最高,适合第一眼。

Q42 复诊患者的影响怎么量化?

人均 2.07 案例——复诊者的流程行为相关(同一人走相似路径)。subject_id 切分外,可做"复诊者 vs 首诊者"分层对比(本身是个有趣研究问题)。

Q43 事件日志能转回关系表吗?

能(本来就从关系表来)——mimicel.csv 就是关系形态。方向不重要,重要的是分析时用对视角:流程问题用 case 视角、记录问题回原库。

Q44 和 MIMIC-IV on FHIR 什么关系?

两者都是 MIMIC-IV 的派生标准格式视图——FHIR 是医疗信息互操作标准(资源模型),MIMICEL 是流程挖掘标准(事件日志)。视角不同,服务社区不同。

Q45 能预测分诊级别(acuity)吗?

可以(主诉+到达方式+早期生命体征→acuity 分类)——但要小心:这是"复制护士判断"的任务,价值在一致性审计(人机分歧案例)而非替代。

Q46 性能分析要多久跑完?

全量 756 万事件的前缀计算分钟级;发现+性能标注在 16 GB 机器上十分钟级。轻量是本库最大工程红利。

Q47 有已知的数据质量问题吗?

官方披露的:Triage 构造时间戳、1.06% 倒置、acuity 1.64% 缺失——三大已知项都有官方口径。未知项按 §4.8 完整性清单自查。

Q48 能分析"未就诊离院"(LWBS)吗?

disposition 含"离开"类取值——LWBS(left without being seen)是 ED 运营重要指标,可经 disposition+活动截断模式识别(未到 Discharge 即终止的案例)。

Q49 这数据集的 citation 有官方格式吗?

有——PhysioNet 页面提供 BibTeX(v2.1.0 与论文双条目)。配套论文发表后(2025)建议双引(§8.2)。

Q50 为什么说 MIMICEL 是"三视角"之一?

MIMIC 家族三视角:记录(临床库表)、信号(波形库)、流程(事件日志)。同一就诊的三个正交切面——MIMICEL 补的是"顺序与结构"这一最难获得的视角(§6.7)。

Q51 XES 里每个 trace 自带哪些属性?

案例级 8 个属性全部挂在 <trace> 上(case:concept:name、人口学、到达方式、分诊级别、结局等,§2.5 清单),不需要额外 join。

Q52 为什么只有 6 种活动,医嘱/用药都不见了?

设计取舍:MIMICEL 定位是患者旅程骨架而非医嘱明细(§6.2)。治疗内容请回流 MIMIC-IV(prescriptions/emar),两库以 subject_id/hadm_id 互通。

Q53 能和 MIMIC-IV-note(临床文本)关联吗?

可以经 subject_id 关联,但注意 ED 患者多数未住院(无 hadm_id),放射报告/出院小结的覆盖率远低于住院侧;先统计关联覆盖率再设计研究。

Q54 时序倒置事件必须删掉吗?

不必。三个选项按研究目的选:轻度重排(sort 后进入流程发现)、保留原序(研究记录行为本身)、剔除(严格时序建模)。80,581 条(1.06%)是绝对数,剔除对总量影响很小。

Q55 PM4Py 版本踩坑?

pm4py 2.x API 变动频繁(如 read_xes 的 return_legacy_log_object 参数、discovery 函数名)。锁版本(requirements.txt 钉死),跑通后不要随手升级。

Q56 能算"每个活动的等待时间"吗?

能但要看语义:triage 时间戳是人工构造的 intime+1 秒(§2.7),"到达→分诊"的等待不可测;可测的是分诊之后活动间的间隔。报告时明确写出时间戳来源。

Q57 数据里有患者结局(如死亡)吗?

disposition 属性含离院去向类别(含死亡去向),单 ED 停留内的结局可用;出院后 30 天死亡率等需回流 MIMIC-IV hosp(admissions/death),注意 ED 患者无 hadm 的覆盖率问题。

Q58 能导入 Celonis 等商业流程挖掘工具吗?

XES 是通用交换格式,商业工具大多可导入;但 PhysioNet DUA 禁止将受控数据上传至未经批准的云端环境——用本地部署许可的工具,或先用合成日志验证工作流。

Q59 为什么我的变体数和别人的论文对不上?

变体数取决于三个自由参数:活动抽象层级(6 活动是固定口径)、是否含重复活动折叠、案例过滤协议。引用他人数字前先对齐这三个参数(§4.5 的 to_analysis_version 思路)。

Q60 能用这数据做实时仿真吗?

可以建离散事件仿真(DES)模型:从日志拟合到达过程(泊松/非齐次)、活动时长分布、路由概率——这就是"日志驱动仿真",流程挖掘的标准下游。注意输出是合成数据,别混淆真实与仿真结果。

Q61 有没有现成的课程作业设计?

适合三档:入门(变体统计+DFG 可视化,1 周)、进阶(一致性检查+性能挖掘,2-3 周)、研究型(拥挤预测/LLM 任务溯源,学期项目)。入门档即可在 Colab 免费档完成(用抽样)。

Q62 时间戳的时区是什么?

MIMIC-IV 系列统一为医院本地时间(无 UTC 标注),MIMICEL 继承该口径。跨时区分析(如合并其他 ICU 数据)时先统一时区;不要依赖文件系统的本地时区设置。

§10 存照与溯源

§10.1 口径存照

声明数字 口径 源
425,028 / 205,466 案例/患者数(v2.1.0) 论文 Table 5
7,568,824 事件数(完整版) 论文 Table 5
6 活动类型数 论文 Table 2
18(3-218) 每案例事件数 论文 Table 5
80,581(1.06%) 倒置事件(分析版剔除) 论文分析节
intime+1s Triage 构造时间戳 论文 Table 2 口径
8+21 case/event 属性数 论文 Table 3/4
≥12 / >500 min 拥挤/长留阈值(75 分位) 论文分析节
1.64% acuity 缺失案例占比 论文分析节
v2.1.0(2023-06-16) 当前版本(基于 MIMIC-IV-ED v2.2) PhysioNet 页
10.13026/64aq-jw11 v1.0 DOI QUT ePrints/PhysioNet
Jans 九步法 提取方法学 论文 Methods
PM4Py CSV→XES 格式转换 论文/官方页
arXiv:2505.19389 配套论文(2025-05-26) arXiv
2165-2170 示例年份 代理日期语义 论文 Table 6

存照 A(拥挤阈值的适用边界):≥12(75 分位)与 LoS>500min 均来自该医院数据的分位数,是方法示范常数而非普适标准——任何移植应用必须用自己的数据重校准(§2.11)。

存照 B(triage+1 秒的连带影响):所有以"到达→分诊"为起点的等待/时长计算均无意义;涉及时段起点的分析一律从 triage 之后的首个真实活动起算(§2.7)。

存照 C(两版本并行引用):v1.0.0(2022,DOI 10.13026/64aq-jw11)与 v2.1.0(2023-06-16,DOI 10.13026/5ntk-km72,基于 MIMIC-IV-ED v2.2)同时在库并存,二者案例数不同;论文必须标注版本号与对应 DOI(§1.4)。

§10.2 引文清单

  1. Wei J, He Z, Ouyang C, Moreira C. MIMICEL: MIMIC-IV Event Log for Emergency Department (version 2.1.0). PhysioNet, 2023. doi:10.13026/64aq-jw11
  2. Wei J, Ouyang C, Wickramanayake B, He Z, Perera K, Moreira C. Curation and Analysis of MIMICEL – An Event Log for MIMIC-IV Emergency Department. arXiv:2505.19389(2025)
  3. Johnson A, Bulgarelli L, Pollard T, et al. MIMIC-IV-ED (version 2.2). PhysioNet, 2022. doi:10.13026/5ntk-km72
  4. van der Aalst W. Process Mining: Data Science in Action(2nd ed. Springer)——学科奠基教材
  5. Munoz-Gama J, et al. Process mining for healthcare: characteristics and challenges(综述)
  6. Jans M, et al. 事件日志提取方法学(九步法框架)
  7. Bui et al./scitepress 2025. Process Mining and Machine Learning for Predicting Clinical Outcomes in Emergency Care: A Study on the MIMICEL Dataset

§10.3 与本系列其他条目的关系

条目 关系
492 MIMIC-IV 祖父库:hadm_id 回链的远端;模块族中枢
488 MIMIC-IV Waveform 同族模块(信号视角);ED 患者转 ICU 后的波形数据
490 MIMIC-III Clinical 前代临床库(ED 模块始于 MIMIC-IV 时代)
486/487 MIMIC-III Waveform/Matched 波形视角对照(物理 vs 流程视角)
VitalDB 手术室流程对照(麻醉记录=另一种流程数据)

§10.4 变更日志

日期 事项
2022-06 v1.0.0 发布(DOI 10.13026/64aq-jw11)
2023-06-16 v2.1.0 发布(基于 MIMIC-IV-ED v2.2)
2025-05-26 配套论文 arXiv:2505.19389 发布(Table 1-6 口径)
2026-09-20 本条目完成事实核查与撰写(千方病案医数集 order 489)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mimiciii-demo — 共享标签:电子健康记录 / 公共卫生与流行病学
  • mimiciv — 共享标签:电子健康记录 / 公共卫生与流行病学
  • maternal-ultrasound-nutrition — 共享标签:电子健康记录 / 公共卫生与流行病学
  • hrs — 共享标签:电子健康记录 / 公共卫生与流行病学
  • cdsl-covid-data-shared-learning — 共享标签:电子健康记录 / 公共卫生与流行病学
  • framingham — 共享标签:电子健康记录 / 公共卫生与流行病学
  • seer-nci — 共享标签:电子健康记录 / 公共卫生与流行病学
  • openfda — 共享标签:电子健康记录 / 公共卫生与流行病学
  • gemini — 共享标签:电子健康记录 / 公共卫生与流行病学
  • charls — 共享标签:电子健康记录 / 公共卫生与流行病学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集