信息速览
INFOBOX
| 属性 | 内容 |
|---|---|
| 名称 | MIMIC-IV Waveform Database(v0.1.0) |
| 维护方 | MIT Laboratory for Computational Physiology / PhysioNet |
| 发布 | 2022-07-10(v0.1.0 技术预览版) |
| 定位 | MIMIC-IV 模块族的波形模块——新一代 ICU 波形架构的技术预览 |
| 规模 | 200 records / 198 patients / 12.8 GB(未压缩) |
| 路线图 | 官方预告 v1.0.0 将含约 10,000 记录 |
| 采样率 | 多采样率:ECG 250 Hz / PPG·ABP 125 Hz / Resp 62.5 Hz;numerics 不规则 |
| 压缩 | 信号 FLAC(-8 -r8 -e);numerics dictzip CSV |
| 时间语义 | counter ticks(1/999.52 s)+ header base_datetime(代理) |
| 关键改进 | 代理日期偏移与 MIMIC-IV 共享(波形-临床直接可比) |
| 互链键 | subject_id + hadm_id(MIMIC-IV 全模块族通用) |
| 许可 | ODbL v1.0(开放下载) |
| 合规 | BIDMC + MIT IRB 批准,豁免个人知情同意 |
| DOI | v0.1.0 = 10.13026/a2mw-f949(latest 概念 10.13026/6269-ws81) |
| 主引文 | Moody 2022(波形);Johnson 2022(MIMIC-IV v2.0) |
| 平台 | PhysioNet |
一句话定位:MIMIC-IV 模块族的波形模块,以 v0.1.0 技术预览版(200 记录/198 患者/12.8 GB)先行发布——它是三代 MIMIC 波形库中架构最先进、体量最小的一个;读它是为读懂 MIMIC 波形生态的未来,而不是替代当下的训练主力(486/487)。
§0 E-E-A-T 信任声明与免责声明
经验(Experience):本文基于 PhysioNet 官方页面(v0.1.0)、wfdb.io 官方教程(formatting/structure)、mimic.mit.edu 模块文档与 TransfoRhythm 应用论文撰写;多采样率、counter ticks、FLAC 压缩等工程语义按官方原文口径译写。
专业性(Expertise):预览版定位(200 记录≠大样本)、与 MIMIC-III 波形家族的格式断裂(numerics CSV/FLAC/多采样率)、共享 date shift 的对齐含义——三大易错语义全部显式披露;全部数字标注口径。
权威性(Authoritativeness):MIMIC 家族是重症医学 AI 的事实标准数据底座;MIMIC-IV 是官方推荐的新项目起点(mimic.mit.edu 明示);本文为第三方解读,不替代官方文档与 LICENSE。
可信度:文内数字进入文末「口径存照」;"200 records/198 patients"与"约 10,000 记录(预告)"两口径已显式区分;v0.1.0 与 latest DOI 并列存照。
免责:本文为学术性数据资源解读,不构成医疗建议;再识别风险与伦理合规见 §8。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:MIMIC-IV 模块族的波形模块——BIDMC ICU 床旁监护仪的高分辨率波形+数值,与 MIMIC-IV 临床库经 subject_id/hadm_id 直接互链;
- 规模:v0.1.0 技术预览版 = 200 记录 / 198 患者 / 12.8 GB(官方预告 v1.0.0 约 10,000 记录);
- 多采样率:ECG 250 Hz / PPG·ABP 125 Hz / Resp 62.5 Hz——比 MIMIC-III 波形库的统一 125 Hz 更高保真;
- 格式升级:信号 FLAC 压缩、numerics 改 gzip CSV(列跨患者不同)、时间用 counter ticks;
- 对齐改进:代理日期偏移与 MIMIC-IV 共享同一偏移量——波形-临床时间直接可比(MIMIC-III 家族做不到);
- 许可:ODbL v1.0 开放下载;
- 最大坑:把它当大样本库用——200 记录是技术预览体量,功效声明必须先算后训。
§1.1 摘要
MIMIC-IV Waveform Database 是 MIMIC-IV 模块化战略的信号侧落子:mimic.mit.edu 把 MIMIC-IV 拆成 Hosp/ICU/ED/CXR/Note/ECG/Waveform 等模块,经 subject_id+hadm_id 统一互链——波形模块于 2022 年 7 月以 v0.1.0 技术预览版上线(200 记录/198 患者/12.8 GB),为预告中约 10,000 记录的 v1.0.0 探路。它与 MIMIC-III Waveform Database(67,830 组)不是简单的"新版本",而是一次架构重设计:多采样率体系(ECG 提升到 250 Hz、呼吸 62.5 Hz 按信号物理特性分别定率)、信号 FLAC 无损压缩、numerics 从 WFDB 改为 gzip CSV(承认其"不规则采样表"的本质)、时间戳改用 counter ticks(毫秒粒度)。最关键的方法学改进是代理日期偏移与 MIMIC-IV 临床库共享——MIMIC-III 家族里波形侧与临床侧偏移不同、需要还原层才能对齐(见 487 号条目 §4.6),MIMIC-IV 家族直接可比,多模态研究的前置工程被砍掉一大块。对 AI 研究者:今天用 v0.1.0 做方法学原型与流水线校准,等 v1.0 放量后无缝切换——这是官方"technical preview"语义的正确打开方式。
§1.2 战略价值
- 架构风向标:MIMIC-IV 波形模块定义了下一代 ICU 波形库的工程标准(多采样率/FLAC/CSV numerics/共享偏移)——提前适配即提前锁定迁移红利;
- 对齐即插即用:与 MIMIC-IV 共享偏移意味着 subject_id 关联后时间轴直接可用——多模态产线少一个还原层、少一类错误源;
- 模块族入口:波形经 hadm_id 挂接 MIMIC-IV 全族(Hosp 化验/ICU 护理/ED 急诊/CXR 影像/Note 文本/ECG 心电图)——跨模态组合空间是 MIMIC-III 时代不可比的;
- 技术预览的先手价值:200 记录足够校准流水线、验证解析代码、试跑端到端训练——v1.0 放量时团队已就位;
- 官方教程齐备:IEEE EMBC 2022 workshop 可执行笔记本(Peter Charlton 领讲)+ wfdb.io 教程站——入门曲线被官方铺平。
§1.3 同类数据集横向对比
| 维度 | MIMIC-IV Waveform v0.1.0 | MIMIC-III Waveform v1.0 | MIMIC-III Matched | VitalDB |
|---|---|---|---|---|
| 规模 | 200 记录/198 患者(预览) | 67,830 组/30,000 患者 | 22,317 记录/10,282 患者 | 6,388 手术 |
| 体量 | 12.8 GB | 6.7 TB | 主库 1/3 量级 | 数百 GB |
| ECG 采样 | 250 Hz | 125 Hz | 125 Hz(同主库) | 500 Hz |
| numerics 格式 | gzip CSV(不规则) | WFDB 1 Hz | WFDB 1 Hz | 内置表 |
| 压缩 | FLAC+dictzip | 无(原始) | 无(同主库) | 自有格式 |
| date shift | 与 MIMIC-IV 共享 | 与临床库不同 | 与临床库不同 | —(同一系统) |
| 临床互链 | subject_id+hadm_id 直接 | 需映射(matched 才有) | subject_id+偏移还原 | 手术记录内置 |
| 版本状态 | 预览(v1.0 预告中) | 定稿 v1.0 | 定稿 v1.0 | 持续更新 |
结论:三代库不是替代关系而是分工——今天跑大规模训练用 MIMIC-III 波形(486/487),今天定架构/写产线/做方法学用 MIMIC-IV Waveform(488),v1.0 放量后迁移。
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 2021-03 | MIMIC-IV v1.0 临床库发布(10.13026/6269-ws81 之前的主模块节点) |
| 2022-07-06 | WFDB 工具链引用基线(WFDB Software Package 10.7.0;wfdb-python 3.4.1) |
| 2022-07-10 | MIMIC-IV Waveform v0.1.0 发布(200 记录技术预览;DOI 10.13026/a2mw-f949;parent=MIMIC-IV v2.0) |
| 2022-07 | IEEE EMBC workshop(Peter Charlton 领讲;可执行笔记本公开) |
| 2022-2024 | TransfoRhythm 等首批应用论文(PPG 独立血压估计) |
| 2026-09 | 核查时点:PhysioNet 版本列表仍为 0.1.0;v1.0.0(约 10,000 记录)官方预告中 |
§1.5 应用场景矩阵
| 场景 | 用到的部分 | 关键动作 |
|---|---|---|
| 产线架构预演 | 全库(小体量全量跑) | 解析→对齐→训练端到端校准 |
| PPG-BP 方法学迁移 | PPG+ABP 配对段 | 250 Hz ECG 语义下重验特征 |
| 多模态原型(波形+临床) | subject_id/hadm_id 互链 | 共享偏移直接对齐 |
| 高保真 ECG 分析 | 250 Hz ECG 通道 | 125 Hz 库做不了的细节(起搏脉冲/高频形态) |
| 呼吸力学 | 62.5 Hz Resp | 呼吸率/机械通气同步分析 |
| 教学入门 | EMBC 笔记本 | 官方教程零门槛起步 |
| 工具链适配测试 | FLAC/CSV 解析 | WFDB 10.7+/libFLAC 环境验证 |
§1.6 组件全景
MIMIC-IV Waveform Database(v0.1.0, 12.8 GB 未压缩)
├── waves/(100 个顶层目录 pXXX 按 subject_id 前三位)
│ └── p100/p10014354/81739927/
│ ├── 81739927.hea ← master header(base_datetime 等)
│ ├── 81739927_000N.hea ← segment header
│ ├── 81739927_000Ne.dat ← 信号(FLAC 压缩;e/r/p 后缀=类型)
│ └── 81739927n.csv.gz ← numerics(gzip CSV;列跨患者不同)
├── 工具生态
│ ├── WFDB Software Package 10.7.0+(需 libFLAC)
│ ├── wfdb-python 3.4.1+(FLAC 支持)
│ └── EMBC 2022 教程笔记本(mimic.mit.edu)
└── 互链:subject_id + hadm_id → MIMIC-IV(Hosp/ICU/ED/CXR/Note)
§1.7 命名与目录速记
waves/p100/p10014354/81739927/ ← pXXX(前三位分桶)/p100XXXXXX(患者)/8 位记录号
waves/p100/p10039708/83411188/ ← 同患者可有多记录(83411188 与 85583557)
waves/p100/p10039708/83411188n.csv.gz ← numerics = 记录号 + n
与 MIMIC-III 家族命名对照:主库按记录号分桶(30-39)、matched 按患者前两位分桶(p00-p09)+ 代理日期命名;MIMIC-IV Waveform 按患者前三位分桶(p100-p199)+ 独立 8 位记录号——三套命名体系并存,跨库脚本必须各自适配。
§1.8 访问方式速记
- 零下载起步:PhysioBank ATM 在线可视化 + EMBC 笔记本(Colab 可跑);
- 全量下载:
wget -r -N -c -np https://physionet.org/files/mimic4wdb/0.1.0/(12.8 GB,一台笔记本装得下)或 AWS S3 镜像; - Python 读取:wfdb-python 3.4.1+(rdrecord 自动解 FLAC)+ gzip/csv 标准库读 numerics;
- 环境前置:WFDB Software Package 路线需先装 libFLAC——纯 Python 路线(wfdb-python 新版)可绕过。
§1.9 独特视角:一份"蓝图"而非一座"矿山"
MIMIC-III Waveform 是一座已开采十六年的矿山(6.7 TB、67,830 组),MIMIC-IV Waveform v0.1.0 则是一份公开的施工蓝图——200 个"样板间"展示了新架构的每个细节:多采样率怎么定、压缩怎么选、numerics 怎么改表、时间戳怎么统一、偏移怎么共享。聪明的团队用它做什么?把产线、解析器、对齐协议、训练框架全部在 12.8 GB 上调通,等 v1.0 放量当天全量切换。矿山看储量,蓝图看未来——本文的价值在于帮你把蓝图读成施工图。
§1.10 阅读路线图
| 你是 | 建议路径 |
|---|---|
| 第一次接触 ICU 波形 | §1 全部 → §2.1/§2.6 → §4.2-4.5(跑通) |
| 从 MIMIC-III 波形迁移 | §2.1/§2.3/§2.5(三大差异)→ §6.11 迁移表 → §5.2 |
| 做多模态/临床关联 | §2.3 共享偏移 → §4.6 → §5.7(DUA 后) |
| 评审多模态论文 | §6.6 清单 → §6.1 预览版功效 → §7.6 泄漏 |
| 决策是否现在入坑 | §1.3 对比 → §6.2 规模实证 → §7.2 两段式 |
§2 医学与科学背景
§2.1 多采样率体系的工程语义
MIMIC-III 波形库统一 125 Hz 是"存储效率优先"的产物;MIMIC-IV Waveform 按信号物理特性分别定率——ECG 250 Hz(心电形态学细节:起搏脉冲、ST 段高频成分、QRS 切迹需要 >200 Hz 才不失真)、PPG/ABP 125 Hz(脉搏波主要能量 <20 Hz,125 Hz 已超采样)、Resp 62.5 Hz(呼吸阻抗是慢信号,62.5 Hz 绰绰有余)。这体现了"按需分配带宽"的现代数据工程观:把比特花在信息密度高的通道上。对研究者的直接后果:跨通道分析前必须统一时间轴与采样率(重采样协议见 §5.2)——"所有通道同频"的旧假设在新库不成立。
§2.2 counter ticks 时间语义
numerics 的 time 列不是秒、不是 ISO 时间戳,而是 counter ticks——监护仪内部计数器的滴答,频率 counter_freq=999.52 Hz(即 1 tick ≈ 1.00048 ms)。官方换算:seconds = t / header.counter_freq,再 dt = header.base_datetime + delta 得到挂钟时间。设计意图:监护仪内部时钟以自由计数器运行,避免墙钟跳变(NTP 校时/夏令时)破坏时序单调性——ticks 是单调时间,base_datetime 是墙钟锚点,两者相加才得业务时间。工程纪律:一切"时间差"计算用 ticks(无损单调),一切"日历对齐"用换算后的 datetime(挂钟语义)——混用两类时间轴是新版库最常见的 bug 源。
§2.3 共享 date shift 的方法学突破
MIMIC-III 家族的隐性成本:波形侧与临床库侧各自随机偏移(date shift 种子不同),多模态对齐前必须先建"偏移还原层"(487 号条目 §4.6 的整章工程)。MIMIC-IV Waveform 官方明示:“a surrogate date is generated by adding a randomly-assigned offset (which matches the offset used in MIMIC-IV)”——同一患者的波形与临床数据共享同一偏移。三个直接收益:(1) 波形样本 t → base_datetime + t 即得与 CHARTEVENTS 同轴的 datetime,直接 join;(2) 患者内跨记录、跨模块时序天然一致;(3) 偏移还原层从"必建工程"降级为"无需存在"。方法学论文里的对齐消融(487 号 §7.7)在新库不再需要——这个消融的消失本身就是架构进步的度量。
§2.4 FLAC 压缩的取舍语义
信号文件用 FLAC(-8 -r8 -e:最高压缩级别+自适应块分割+穷举搜索)——无损压缩,解压后与原始采样逐样本一致。收益:12.8 GB 体量(若不压缩预计 3-4 倍);传输与存储成本大幅下降。代价:读取链路多一层解码依赖(libFLAC 或支持 FLAC 的 wfdb-python)。工程语义:FLAC 是对研究者透明的优化——wfdb-python 新版 rdrecord 自动处理;只有直接解析 .dat 字节或用旧版工具链的团队会踩坑(§6.5 坑点)。与有损压缩(降采样/量化)的本质区别:FLAC 不改变任何科研结论,只是门槛更高的门把手。
§2.5 numerics 从 WFDB 到 CSV 的语义转变
MIMIC-III 的 numerics 是 1 Hz 网格化 WFDB 记录(监护仪每秒产出一行);MIMIC-IV Waveform 承认了临床现实——监护仪测值是不规则采样的(NIBP 每 5-60 分钟一次、SpO2 每 1.024 秒、体温小时级),强行网格化意味着大量空值或插值污染。新版改用 gzip CSV:每行一个真实测量事件(time ticks + 列名 + 值),无测量则无行。三个后果:(1) 列名跨患者不同(83411188n.csv.gz 的列集 ≠ 85583557n.csv.gz)——统一 schema 需自建列映射表;(2) 时间粒度精细到 ticks(毫秒级);(3) 分析时必须先 resample/聚合到统一网格——“读进来就是矩阵"的旧workflow 改为"读进来是事件流”。这不是退化,是把选择权交还研究者(网格化策略自己定)。
§2.6 信号清单与临床语义
| 信号 | 采样率 | 派生 numerics | 临床语义 |
|---|---|---|---|
| ECG(2-3 通道) | 250 Hz | HR(每 1.024 s)、逐拍 HR、ST、QT | 节律/缺血/电解质 |
| PPG(Pleth) | 125 Hz | SpO2、灌注指数、脉率 | 氧合/灌注 |
| ABP(有创) | 125 Hz | ABP s/d/m、脉率 | 连续血压真值 |
| NIBP(袖带) | 间歇 | NBP s/d/m | 间歇血压 |
| Resp(阻抗) | 62.5 Hz | RR | 通气节律 |
| 其他 | 视配置 | 体温/CVP/ICP | 视监护配置 |
与 MIMIC-III 波形库的信号语义一脉相承(ECG/PPG/ABP/Resp 四大类),但派生测值的时间基准统一为 1.024 秒节拍(监护仪内部钟)而非 1 秒整——跨库比较 numerics 时间粒度时注意这个 2.4% 的节拍差。
§2.7 gap 拆分与跨患者风险(继承语义)
监护系统需要护士手工 admit/discharge 患者,患者离开 ICU 后监护仪可能未停机——同一 PatientId 可能先后属于两名患者。新版沿用 MIMIC-III 波形库的防线:gap >1 小时自动拆分为独立记录。风险语义同样继承:短 gap 内换患者的情形理论存在,"记录≠确诊患者"的谨慎语义保留。与 487 号 matched 库的差异:MIMIC-IV Waveform 经 subject_id 与临床库官方互链——匹配是原生的(采集系统已与 MIMIC-IV 身份对齐),不需要 MIMIC-III 时代的事后匹配工程——这正是"两套系统时代断层"被弥合后的架构红利。
§2.8 预览版的科学定位
官方 release notes 原文:“This release contains just 200 records from 198 patients, and is intended as a technical preview for the community in advance of version 1.0.0”。科学语义:预览版的价值在架构验证而非统计功效——用它发"大规模实证"论文是误用(198 患者的 CI 宽到无法辩护);用它发"方法学/管线/架构"论文完全正当(TransfoRhythm 即先例:在 198 人上清洗出 360 条纯净记录做方法学贡献)。正确姿势是 §7.2 的"预览版校准、v1.0 放量"两段式。
§2.9 EMBC 2022 教程的方法学地位
IEEE EMBC 2022-07 workshop(Peter Charlton 领讲)是官方认证的入门路径:可执行笔记本覆盖 WFDB-Python 读取、特征提取(HRV/PPG 形态/呼吸率)、与 MIMIC-IV 临床数据联合——笔记本公开在 mimic.mit.edu。方法学语义:官方教程定义了"标准读取路径",偏离该路径的解析代码应在论文中自证正确性(尤其 FLAC/CSV/ticks 三个新语义点)。教程 notebook 同时是回归测试基准:你的产线对教程样例记录的输出与 notebook 一致,则解析层可信。
§2.10 与 MIMIC-IV-ECG 的分工
MIMIC-IV 家族内两个"心电"资产的分工:MIMIC-IV-ECG 是独立采集的 10 秒 12 导诊断级静息心电图(数百万条,500 Hz);MIMIC-IV Waveform 是床旁连续监护波形(持续数小时-数周、2-3 导监护级 250 Hz)。前者胜在标准化与诊断标签,后者胜在连续性与多参数同步(ECG+PPG+ABP+Resp 同轴)。ECG 深度学习(节律分类/诊断)用 ECG 模块,血流动力学/多模态/预警用 Waveform 模块——引用与选型勿混。
§2.11 迁移成本的现实评估
从 MIMIC-III 波形产线迁移到 MIMIC-IV Waveform 的实际工作量分布:解析层重写(FLAC/CSV/ticks)约占一半、命名适配(三套分桶)约占两成、对齐层简化(共享偏移)反而省掉还原工程、模型层基本不动。净评估:一次性成本 2-4 人日,换来 250 Hz ECG + 直接对齐 + 模块族互链——对计划长期投入 ICU 多模态的团队是正期望值迁移;对一次性研究则留在了 MIMIC-III 生态(486/487)更经济。
§2.12 共享偏移 vs 还原层:两代对齐工程对照
| 工程项 | MIMIC-III 家族(486/487) | MIMIC-IV 家族(488+492) |
|---|---|---|
| 偏移量 | 波形侧≠临床侧(各自随机) | 同一偏移量 |
| 对齐前置工程 | 偏移还原层(487 §4.6 整章) | 无(直接比 datetime) |
| 正确性验证 | numerics vs CHARTEVENTS 交叉校验(§4.7) | 抽样自洽检查(§6.3) |
| 失败模式 | 偏移处理错误→全错且难察觉 | 几乎不存在该类错误 |
| 论文审查项 | 偏移协议有无(强制) | 偏移共享验证报告(加分) |
| 教学语义 | date shift 是"必学陷阱" | date shift 是"透明基础设施" |
这一对照是多模态 ICU 研究方法学演进的缩影:把易错的人肉工程固化为数据架构。引用 487 条目学习对齐陷阱、引用本条目理解目标状态——两代文献合读才是完整叙事。
§2.13 中央站采集架构的科研语义
官方 Methods 章披露的采集链路值得细读:床旁监护仪→局域网→中央护理站→专有关系库(固定天数后自动丢弃)→每 24 小时横截面切片→归档。三个科研语义:(1) "24 小时切片"意味着归档粒度是天级批次——理论上存在批次边界的记录切缝(工程上已由解析整合,但跨批次拼接的边界核查值得列入完整性清单);(2) "固定天数丢弃"解释了为什么不早做归档就永远失去数据——MIMIC 波形项目本质是与数据蒸发赛跑的抢救性采集;(3) 中央站视角=全院 ICU 监护仪全覆盖——采集覆盖率高于床旁单机方案,这是 486 与本库共享的采集优势(对比手术室单机记录的 VitalDB)。
§3 数据集规格
§3.1 规格总表
| 属性 | 规格 |
|---|---|
| 正式名称 | MIMIC-IV Waveform Database(v0.1.0) |
| 记录数 | 200 |
| 患者数 | 198 |
| 总容量 | 12.8 GB(未压缩) |
| 发布日期 | 2022-07-10 |
| ECG 采样 | 250 Hz(2-3 通道) |
| PPG/ABP 采样 | 125 Hz |
| Resp 采样 | 62.5 Hz |
| numerics | 不规则采样;gzip CSV;time=counter ticks(counter_freq=999.52 Hz) |
| 压缩 | 信号 FLAC(-8 -r8 -e);numerics dictzip |
| 目录结构 | waves/pXXX(100 桶,前三位)/p100XXXXXX(患者)/8 位记录号 |
| 时间去标识 | 代理日期(与 MIMIC-IV 共享偏移)+ elapsed time 计时 |
| 互链键 | subject_id + hadm_id → MIMIC-IV 全模块 |
| 许可 | ODbL v1.0 |
| DOI | 10.13026/a2mw-f949(v0.1.0) |
| 路线图 | v1.0.0 约 10,000 记录(官方预告) |
| 教程 | IEEE EMBC 2022 笔记本 + wfdb.io 教程站 |
§3.2 数据发布口径地图
| 数字 | 口径 | 出处 |
|---|---|---|
| 200 | v0.1.0 记录数 | 官方页面 + release notes |
| 198 | v0.1.0 患者数 | 官方页面 |
| 12.8 GB | v0.1.0 未压缩总量 | PhysioNet Files 页 |
| 约 10,000 | v1.0.0 预告规模(勿当现状引用) | 官方 release notes |
| 250/125/62.5 Hz | ECG/PPG·ABP/Resp 采样率 | wfdb.io 官方教程 |
| 999.52 Hz | counter_freq(1 tick≈1 ms) | 官方 numerics 文档 |
| 1.024 s | 派生测值节拍(HR/SpO2 等) | wfdb.io 教程 |
口径纪律:"200 records/198 patients"是现状;"10,000"是预告——论文引用现状、报告里写预告必须带"in preparation/preview"限定。
口径事故成本对比:写错一个数字(预告当现状)的代价是审稿一轮返工;口径表(本节)的维护成本是十分钟——这是全系列条目坚持口径存照的原因。
§3.3 DAIMS 数据AI就绪度评估
| 维度 | 评分 | 说明 |
|---|---|---|
| 可获取性 Accessible | ★★★★★ | ODbL 开放;12.8 GB 笔记本级体量;AWS 镜像 |
| 可解析性 Interpretable | ★★★☆☆ | 新格式(FLAC/CSV/ticks)学习曲线;官方教程补位 |
| 一致性 Consistent | ★★★☆☆ | numerics 列跨患者不同;统一 schema 自建 |
| 链接性 Linkable | ★★★★★ | subject_id+hadm_id 原生互链 + 共享偏移——MIMIC 家族最佳 |
| 标签就绪 Label-ready | ★★★★☆ | 随 MIMIC-IV DUA 即得全模块标签;无还原层 |
| 文档完备 Documentation | ★★★★★ | 官方页面+教程站+EMBC 笔记本三层齐备 |
总评 4.2/5:链接性与文档满分,扣分在预览版体量与格式迁移成本——定位是"未来的主力、今天的实验室"。
§3.4 存储与计算需求
| 场景 | 磁盘 | 内存 | 说明 |
|---|---|---|---|
| 全量本地 | 13-15 GB | — | 12.8 GB+解压余量——单机全量可行 |
| 流式远程读取 | <1 GB | 2 GB | pn_dir 按需拉取 |
| 解析普查(头文件+CSV 清单) | <2 GB | 4 GB | §4.9 索引构建 |
| 端到端原型训练 | 15-20 GB | 8-16 GB | 全量+特征缓存 |
| 大规模预训练 | 不适用 | — | 等 v1.0(预览版体量不支持) |
§3.5 获取通道
| 通道 | 内容 | 门槛 |
|---|---|---|
| PhysioNet 官方页 | 页面/引用/许可 | 无 |
physionet.org/files/mimic4wdb/0.1.0/ |
全量数据(ODbL) | 无 |
| AWS Open Data S3 | 按需拉取 | 无 |
| PhysioBank ATM | 在线可视化 | 无 |
| EMBC 2022 笔记本 | 官方教程(可执行) | 无 |
| MIMIC-IV(Hosp/ICU 等模块) | 临床互链数据 | DUA(CITI+签署) |
| wfdb.io/mimic_wfdb_tutorials | 格式/结构文档 | 无 |
§3.6 口径对齐表
| 你想要的 | 应该引用 | 不要引用 |
|---|---|---|
| 现有规模 | 200 记录/198 患者(v0.1.0) | “约 10,000 记录”(预告当现状) |
| ECG 采样率 | 250 Hz(本库) | 125 Hz(那是 MIMIC-III 波形) |
| numerics 格式 | gzip CSV 不规则采样 | “1 Hz WFDB”(那是 486/487) |
| 对齐语义 | 共享偏移(与 MIMIC-IV) | “需还原层”(那是 MIMIC-III 家族) |
| DOI | 10.13026/a2mw-f949 | MIMIC-IV 临床库 10.13026/7vcr-e114 |
| parent project | MIMIC-IV v2.0 | MIMIC-III v1.4 |
§3.7 版本选择纪律
- 引用 v0.1.0 DOI(10.13026/a2mw-f949)——它是实际发布版本;latest 概念 DOI(10.13026/6269-ws81)用于"无论版本引用该项目"的泛指;
- v1.0.0 发布后:历史论文不必重跑(预览版方法学结论独立成立),新项目直接用 v1.0;
- 三代波形库(MIMIC-III Waveform/Matched/MIMIC-IV Waveform)选型:大样本训练→486;临床关联大样本→487;架构预演+250 Hz→488;
- 跨库研究必须声明各自版本与命名体系差异(三套分桶互不兼容)。
§3.8 数据文件与字段详表
| 文件/路径 | 内容 | 关键字段/语义 |
|---|---|---|
waves/pXXX/ |
顶层分桶(subject_id 前三位;p100-p199) | 100 个桶 |
pXXX/p100XXXXXX/ |
患者目录(subject_id 8 位) | 同患者多记录同居一目录 |
XXXXXXXX.hea |
master header | base_datetime(代理锚点);segment 清单 |
XXXXXXXX_000N.hea |
segment header | fs(该段采样率)/gain/baseline |
XXXXXXXX_000Ne.dat |
信号数据 | FLAC 压缩;e/r/p 等后缀为信号文件类型 |
XXXXXXXXn.csv.gz |
numerics 表 | time(ticks)+列名(跨患者不同)+值 |
RECORDS |
记录清单 | 遍历入口 |
§3.9 记录质量分层画像(预扫描协议)
200 记录的全量普查秒级完成——每条记录都值得人工过目(这是预览版的奢侈):
| 层 | 判定 | 处置 |
|---|---|---|
| A:多信号长记录 | ECG+PPG+ABP 齐、>10 h | 方法学主力 |
| B:信号不全 | 缺 ABP(多数)或缺 PPG | 任务定制 |
| C:短记录 | <1 h(TransfoRhythm 报告多数 <1.5 h) | 边缘样本 |
| D:异常 | 解析失败/信号断续 | 人工归档原因 |
普查同时核对每条记录的列名集合(numerics)→ 产出列映射表——这是 §4.6 统一 schema 的前置资产。
§3.10 多采样率换算速查表
| 任务对象 | 原生 fs | 目标网格 | 换算 |
|---|---|---|---|
| ECG 形态(QRS/ST/起搏脉冲) | 250 Hz | 保留 250 Hz | 不降采样 |
| ECG→血流动力学特征(HRV/PTT) | 250 Hz | 125 Hz | 抗混叠低通(<62.5 Hz)后抽取 |
| PPG/ABP 波形 | 125 Hz | 125 Hz | 原生 |
| Resp | 62.5 Hz | 125 Hz 网格 | 阶梯保持(不插值升采样) |
| HR/SpO2 numerics | 1.024 s 节拍 | 1 Hz 网格 | 就近对齐(≤0.512 s 漂移声明) |
| NIBP/体温 numerics | 分钟-小时级 | 事件流保留 | 前向保持 |
速记:波形可降不可升、numerics 只保持不插值、一切换算注明方法与漂移上界。
实操顺序建议:先定任务时窗与主网格(§5.2 第 1 步)→ 再查此表定各通道换算 → 最后把全部换算写进方法学(审稿人可复现)。三步走完,多采样率不再是坑而是特征。
§4 数据结构
§4.1 对象模型
MIMIC4Waveform
├── Patient(p100XXXXXX = subject_id 8 位;198 个)
│ └── Record[1..N](8 位记录号;gap>1h 拆分产物)
│ ├── WaveformRecord(master/segment 两层头;FLAC 信号)
│ │ ├── Segment[0..M](fs 可按段不同;多采样率通道)
│ │ └── SurrogateDatetime(base_datetime;与 MIMIC-IV 共享偏移)
│ └── NumericsTable(n.csv.gz;事件流;列跨患者不同)
└── MIMIC4Linkage(subject_id+hadm_id → Hosp/ICU/ED/CXR/Note;DUA)
└── SharedDateShift(偏移量与临床库一致——直接对齐)
§4.2 记录枚举与索引构建(实战)
# 依赖:pip install wfdb pandas
import wfdb, pandas as pd, re
RECORDS = wfdb.get_record_list('mimic4wdb') # 顶层清单
rows = []
for rec_path in RECORDS:
# rec_path 形如 'waves/p100/p10014354/81739927'
m = re.match(r'waves/p(\d{3})/p(\d{8})/(\d{8})$', rec_path)
if m:
bucket, subject_id, record_id = m.groups()
rows.append({'record_path': rec_path,
'subject_id': int(subject_id),
'record_id': record_id,
'bucket': bucket})
df = pd.DataFrame(rows)
print(len(df), '记录;', df.subject_id.nunique(), '患者') # 期望 ≈200 / 198
df.to_csv('mimic4wdb_index.csv', index=False)
§4.3 头文件与时间锚点(实战)
import wfdb, datetime
hdr = wfdb.rdheader('83411188', pn_dir='mimic4wdb/0.1.0/waves/p100/p10039708')
print('base_datetime:', hdr.base_datetime) # 代理日期时间(与 MIMIC-IV 同偏移)
print('counter_freq:', hdr.counter_freq) # 999.52 Hz
print('segments:', hdr.seg_name) # segment 清单
print('sig_names:', hdr.sig_name) # 全部可能信号
# 各 segment 采样率可能不同(多采样率体系)——逐段读 .hea 确认
§4.4 波形流式读取(实战)
import numpy as np, wfdb
def read_segment(pn_dir_path, segment, seconds=60):
seg = wfdb.rdrecord(segment, pn_dir=pn_dir_path,
sampfrom=0, sampto=seconds * 250) # 先按 ECG 250 Hz 上界取
return seg.p_signal, seg.sig_name, seg.fs
data, ch, fs = read_segment('mimic4wdb/0.1.0/waves/p100/p10039708',
'83411188_0001')
# 注意:多采样率体系下同一 segment 内各通道 fs 一致(WFDB 约束),
# 通道级采样率差异通过"信号不参与"或内部重采样解决——读 .hea 的 fs 逐段确认
要点:FLAC 解码由 wfdb-python 自动处理(3.4.1+);老版本会报"unknown format"——升级而非手解。
§4.5 numerics 事件流读取(实战)
import csv, gzip, datetime, wfdb
def read_numerics_local(record, cols=('SpO2 [%]', 'HR')):
"""本地读法(全量下载后):gzip CSV 事件流 → (ticks, 值) 列表"""
out = {c: [] for c in cols}
with gzip.open(f'{record}n.csv.gz', 'rt') as gzf:
for row in csv.DictReader(gzf):
t = int(row['time']) # counter ticks
for c in cols:
v = row.get(c, '')
if v:
out[c].append((t, float(v)))
return out
def ticks_to_datetime(ticks, hdr):
"""官方换算:ticks → 秒 → base_datetime 偏移"""
seconds = ticks / hdr.counter_freq # 999.52 Hz
return hdr.base_datetime + datetime.timedelta(0, seconds)
要点:CSV 是事件流(无测量=无行)——下游统一网格(§5.2)由你选策略(前向保持/区间聚合),库不做隐式插值;远程读法可先 wfdb.dl_database 拉单患者目录或用 urllib 打开同路径。
§4.6 与 MIMIC-IV 临床库关联(实战核心)
"""
关联协议(须 MIMIC-IV DUA)——比 MIMIC-III 家族少一个还原层:
1) subject_id 硬关联:波形目录名 p10014354 → MIMIC-IV SUBJECT_ID = 10014354
2) hadm_id:经 MIMIC-IV admissions 表判记录所属住院
(波形 base_datetime 与 admittime/dischargtime 直接可比——共享偏移!)
3) 时间对齐:波形样本 t → base_datetime + t/counter_freq → 与
charttime/labtime 直接 join——无需任何偏移还原
4) 验证:numerics 的 HR vs MIMIC-IV icu chartevents 的 HR
重叠时段相关抽检(同 487 号 §4.7 纪律,但期望"直接就对")
"""
# SELECT subject_id, hadm_id, admittime, dischtime
# FROM mimiciv_hosp.admissions WHERE subject_id = 10014354;
# 波形 base_datetime 落在 [admittime, dischtime] 内 → hadm 归属
方法学红利:487 号条目的 §4.6/§4.7 整套偏移还原+交叉校验协议在本库默认通过——这不是省了一次代码,是消灭了一整类错位 bug。
§4.7 数据血缘
BIDMC ICU 床旁 Philips 监护仪(MIMIC-IV 采集期 2008-2019)
→ 中央站局域网 → 专有关系库(固定天数后丢弃)
→ 每 24 小时横截面切片 → 文本/二进制归档
→ 解析/按患者整理 → WFDB + CSV → 去标识
· subject_id/hadm_id(与 MIMIC-IV 同一代理 ID 体系)
· 代理日期(与 MIMIC-IV 同一偏移)
· FLAC 压缩 + dictzip
→ MIMIC-IV Waveform v0.1.0(2022-07-10;DOI a2mw-f949)
↕ parent:MIMIC-IV v2.0(10.13026/7vcr-e114)
§4.8 完整性清单
- [ ] RECORDS 解析 → 记录/患者数核对(≈200/198)
- [ ] 记录名正则覆盖率 100%(异常单列)
- [ ] 每记录 master header:base_datetime/counter_freq/segment 清单
- [ ] 各 segment fs 清点(多采样率矩阵:记录×通道×fs)
- [ ] numerics 列名并集/交集统计 → 列映射表落盘
- [ ] 环境验证:wfdb-python 解 FLAC 成功 + gzip CSV 读通
- [ ] 患者级切分表(198 患者按 subject_id 切——预览版也要按患者切)
- [ ] 若做临床关联:DUA 环境 + 共享偏移验证(抽 3 患者对时轴)
§4.9 列映射表构建(numerics 统一 schema)
def build_column_map(df_index, pn_dir_base='mimic4wdb/0.1.0/waves'):
"""200 条 numerics 的列名普查 → 统一 schema 映射表"""
from collections import Counter
col_counter = Counter()
per_record = {}
for _, r in df_index.iterrows():
with gzip.open(f'{r.record_id}n.csv.gz', 'rt') as gzf:
cols = next(csv.DictReader(gzf)).keys()
per_record[r.record_id] = set(cols)
col_counter.update(cols)
# 统一 schema:高频列作标准列;低频列映射到语义等价类(如 ABPs/ABPm/ABPd)
standard = [c for c, n in col_counter.items() if n >= 100] # 阈值按需调
return standard, per_record, col_counter
§4.10 患者级切分(实战)
def patient_split(df, seed=42):
patients = df.subject_id.unique() # 198 个
rng = np.random.default_rng(seed); rng.shuffle(patients)
n = len(patients)
tr, va = patients[:int(n*0.8)], patients[int(n*0.8):int(n*0.9)]
te = patients[int(n*0.9):]
tag = lambda s: 'train' if s in tr else 'val' if s in va else 'test'
df['split'] = df.subject_id.map(tag)
return df
# 预览版纪律:198 患者切分后 test 仅约 20 人——报告必须给绝对数
# ("test AUROC 0.83(n=20 患者)"而非只给指标)
§4.11 PPG-ABP 配对段抽取(实战)
def extract_ppg_abp_pairs(record_path, win_s=10):
"""抽取 PPG+ABP 同段共存窗口(PPG-BP 产线原料;TransfoRhythm 清洗口径)"""
hdr = wfdb.rdheader(record_path)
rec_name = record_path.rsplit('/', 1)[1]
pn_dir = '/'.join(record_path.split('/')[:-1])
pairs = []
for seg_name, seg_len in zip(hdr.seg_name, hdr.seg_len):
if seg_name == '~':
continue
seg = wfdb.rdrecord(f'{rec_name}_{seg_name}', pn_dir=pn_dir,
sampfrom=0, sampto=seg_len)
ch = {n: i for i, n in enumerate(seg.sig_name)}
if 'PLETH' in ch and 'ABP' in ch:
step = win_s * seg.fs
for start in range(0, seg_len - step, step):
w = seg.p_signal[start:start+step]
if np.isnan(w).any() or w.std(axis=0)[[ch['PLETH'], ch['ABP']]].min() < 1e-3:
continue # 平线/饱和/NaN 段剔除
pairs.append({'seg': seg_name, 'start': start,
'ppg': w[:, ch['PLETH']], 'abp': w[:, ch['ABP']]})
return pairs
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 本库可完成度 | 说明 |
|---|---|---|
| 产线架构预演 | ★★★★★ | 12.8 GB 全量本地,端到端调通 |
| PPG-BP 方法学 | ★★★☆☆ | 198 人功效有限;方法学论文可行(TransfoRhythm 先例) |
| 250 Hz ECG 细节分析 | ★★★★☆ | 本库独有优势(MIMIC-III 波形 125 Hz 做不了) |
| 多模态原型(+MIMIC-IV) | ★★★★★ | 共享偏移+DUA=最顺滑对齐链路 |
| 大规模预训练 | ★☆☆☆☆ | 等 v1.0;当前用 486 主库 |
| 工具链回归测试 | ★★★★★ | 教程样例+200 记录=解析层测试床 |
§5.2 多采样率对齐协议(本库特有)
- 统一目标网格:按任务选主网格(血流动力学任务 125 Hz;ECG 形态任务 250 Hz);
- 重采样纪律:降采样先抗混叠滤波(250→125 Hz 用低通截止 <62.5 Hz);升采样不增信息、避免(用插值仅限可视化);
- 时间轴:一切以 master header base_datetime + elapsed ticks 为唯一真源——禁止"按样本数对齐"跨段拼接(段间可能有 gap);
- numerics 网格化策略:事件流→目标网格用前向保持(临床测值语义)而非线性插值(化验值不可插);HR/SpO2 类连续测值可用 1.024 s 节拍直接对齐;
- 验收:同源双口径抽检(PPG 派生脉率 vs SpO2 列 pulse rate)相关抽检。
§5.3 PPG-BP 迁移协议(从 486/487 到本库)
"""
把 MIMIC-III 波形产线的 PPG-BP 协议迁移到本库的增量清单:
1) 采样率声明:PPG/ABP 仍 125 Hz——特征层不变
2) ECG 250 Hz:PTT 特征的 R 波定位精度提升——可复算旧结果验证增益
3) numerics:ABPs/ABPm/ABPd 从 CSV 取(不再从 WFDB numerics)——替代监督真值
4) 配对段筛选:ABP+PPG 同段共存记录(§3.9 A 层)——TransfoRhythm 口径
(<15 分钟记录剔除、平线/高噪段剔除、Butterworth 0.7-10 Hz + MAF)
5) 功效声明:198 人 → 方法学论文 OK;基准排行榜论文等 v1.0
"""
§5.4 失败模式清单
- “10,000 当现状”:预告规模当实际规模引用——审稿必抓;
- 旧 WFDB 读 FLAC:unknown format 报错——升级工具链而非手写解码;
- 跨患者列名假设一致:CSV 列集不同→KeyError 或静默 NaN——列映射表(§4.9)前置;
- ticks 当秒用:时间差 999.52 倍缩放错误——一切换算走 counter_freq;
- 跨段按样本数拼接:段间 gap 被压缩成连续——按 base_datetime 对齐;
- 把 125 Hz 经验套到 250 Hz:ECG 通道超采样,特征窗口长度按 Hz 换算;
- 按记录切分:同患者多记录泄漏(83411188 与 85583557 即同患者双记录实例);
- 混用三代库命名分桶:30-39 / p00-p09 / p100-p199 三套体系脚本互串。
§5.5 报告模板:方法学段落骨架
我们使用 MIMIC-IV Waveform Database v0.1.0(200 记录/198 患者;12.8 GB)[Moody 2022, doi:10.13026/a2mw-f949],其波形经 subject_id/hadm_id 与 MIMIC-IV v2.0 [Johnson 2022] 互链,且共享代理日期偏移(波形与临床时间直接可比)。多采样率信号(ECG 250 Hz、PPG/ABP 125 Hz、Resp 62.5 Hz)经统一网格重采样对齐;numerics 事件流(counter ticks,999.52 Hz)按前向保持策略网格化。患者级切分(train/val/test,按 subject_id)。波形侧数据依 ODbL v1.0 获取;临床模块经 PhysioNet DUA(CITI 编号 XXXX)在合规环境处理。本库为技术预览版,本文结论限于方法学验证,统计功效声明见限制节。
§5.6 250 Hz ECG 特征协议(本库专项)
| 特征族 | 250 Hz 增益点 | 提取要点 |
|---|---|---|
| QRS 形态(宽度/切迹) | 定位精度 8→4 ms | 逐拍窗口按 R 峰±100 ms |
| ST 段偏移 | J 点定位更稳 | R 峰+60~80 ms 基线回归 |
| 起搏脉冲检测 | 0.5-2 ms 窄脉冲可分辨 | 高通后阈值+不应期 |
| QT/QTc | T 波终末定位误差减半 | 逐拍+质量掩码 |
| HRV(时域/频域) | RR 间期量化更细 | 逐拍 HR 校验异常间期 |
声明纪律:报告 250 Hz 增益时给出对应特征的消融(§7.7 框架),不笼统写"更高精度"。
§5.7 队列注释产线(DUA 环境)
"""
为 198 患者构建临床注释层(论文 Table 1 自动化;经 MIMIC-IV 直连)
"""
def annotate_cohort(df_index, mimiciv):
demo = mimiciv.patients.merge(mimiciv.admissions, on='subject_id')
dx = mimiciv.hosp_diagnoses_icd.assign(
dx_group=lambda d: d.icd_code.map(ICD_TO_GROUP)) # ICD-9/10 统一分组
dx_agg = dx.groupby(['subject_id', 'hadm_id']).dx_group.apply(set)
cohort = df_index.merge(demo, on='subject_id').join(dx_agg,
on=['subject_id', 'hadm_id'])
# 共享偏移红利:anchor_year/anchor_age(MIMIC-IV 口径)直接可用
return cohort
# 产出:subject_id | hadm_id | anchor_age | gender | dx_groups |
# admittime(代理) | care_unit ——§7.5 分层与 Table 1 唯一真源
§6 实证结果与方法学分析
§6.1 预览版规模的实证含义
198 患者对统计功效意味着什么?以 PPG-BP 为例:TransfoRhythm 在清洗后 360 条记录上报告方法学结果——可行;但按 MIMIC-III 波形库经验(约 1/3 记录有可用 PPG+ABP 对),198 患者约产出 60-100 条可用配对记录(TransfoRhythm 清洗前 200 条口径),亚组分析(按年龄/用药)会迅速塌缩到个位数。预览版的正确贡献类型:解析协议、对齐验证、特征可重复性、模型架构调试——全部"方法学资本";把预览版当训练集刷指标,是用 198 人的噪声去赌 v1.0 的信用。
§6.2 三代库规模×体量的实证换算
| 库 | 记录 | 患者 | 体量 | 人均记录 | 人均体量 |
|---|---|---|---|---|---|
| MIMIC-III Waveform | 67,830 组 | ~30,000 | 6.7 TB | 2.26 组 | 235 MB |
| MIMIC-III Matched | 22,317 | 10,282 | ~1/3 库 | 2.17 | ~230 MB |
| MIMIC-IV Waveform v0.1.0 | 200 | 198 | 12.8 GB | 1.01 | 66 MB |
人均体量下降的解读:v0.1.0 记录偏短(TransfoRhythm:多数 <1.5 h,MIMIC-III 波形多为数天)——预览版选择了"广撒少量"的发布策略(先覆盖架构语义而非时长深度),这也预示 v1.0 的数据分布可能与 MIMIC-III 波形显著不同——迁移研究要重做分布假设,不能默认继承。
§6.3 共享偏移的实证验证协议
“与 MIMIC-IV 共享偏移"是官方声明,使用前应抽样验证(DUA 环境):抽 3-5 名患者,取波形 base_datetime 与 MIMIC-IV admissions 的 admittime,检查"波形开始时刻是否落在住院期内且时分与 CHARTEVENTS 首条记录顺序自洽”。验证通过→对齐层直接上线;验证失败→检查是否读错 header(base_date vs base_datetime)或跨版本临床库(v2.0 vs 3.0 的偏移语义一致性)。把官方声明变成已验证事实,是多模态论文审稿的加分项。
§6.4 FLAC 与体量的实证账
12.8 GB 对应"200 记录×人均 1 记录×66 MB"——对比 MIMIC-III 波形人均 235 MB(125 Hz 统一)与 ECG 250 Hz 的翻倍采样,FLAC -8 级别的压缩率(生理信号典型 2-3:1)是 12.8 GB(而非 30-40 GB)的关键。实证结论:FLAC 让"笔记本全量"成为可能——预览版的可及性策略(零门槛下载+全量本地)直接受益于压缩选型,这反过来塑造了"技术预览传遍社区"的传播效率。
§6.5 八个真实坑点
- 坑点 1 预览当全量:200 记录是技术预览,"10,000"是预告——两个数字进论文要分别标注状态;
- 坑点 2 旧工具读 FLAC:WFDB 10.7.0+/wfdb-python 3.4.1+ 是硬门槛,libFLAC 先装;
- 坑点 3 列名跨患者不同:numerics 无统一 schema——列映射表是必建资产;
- 坑点 4 ticks 当秒:999.52 Hz 的 counter_freq 不除,时间全部缩放错 1.00048 倍(累积误差分钟级);
- 坑点 5 base_date 与 base_datetime:新版头文件是完整 datetime 锚点,别沿用旧库"日期+时分分离"假设;
- 坑点 6 250 Hz 当 125 Hz 用:ECG 通道特征窗口长度不减半的话,时间常数错一倍;
- 坑点 7 同患者多记录:p10039708 下 83411188 与 85583557 是同一人的两次监护——按患者切分;
- 坑点 8 偏移语义跨家族混用:本库与 MIMIC-IV 共享偏移 ≠ 与 MIMIC-III 共享——跨家族对齐仍需各自还原;
- 坑点 9 "24 小时切片"边界想当然:归档按天批次、解析已重组——但边界核查(§6.13)是完备性加分项,勿默认无切缝。
§6.6 审稿人自查清单
- [ ] 规模口径:200/198 现状 vs 10,000 预告分开陈述?
- [ ] 版本与 DOI:v0.1.0(a2mw-f949)而非泛引?
- [ ] 多采样率处理:统一网格协议(§5.2)显式描述?
- [ ] ticks 换算:counter_freq 出现在方法学?
- [ ] numerics schema:列映射/网格化策略可复现?
- [ ] 患者级切分 + test 绝对数(约 20 患者)?
- [ ] 共享偏移验证:§6.3 抽检报告?
- [ ] 功效声明:预览版限定语(technical preview)出现?
§6.7 与 486/487 的关系治理
三代库在论文中的引用分工:信号方法学溯源引 486(主库);临床关联协议溯源引 487(matched);架构与前瞻引 488(本库)。跨库比较的公平性纪律:比较模型性能时声明各库版本与预处理差异(125 vs 250 Hz、1 Hz numerics vs 事件流);不要把 486 上的训练结果直接说成"MIMIC 波形结果"——三代库是三个数据集,不是三个版本号。
§6.8 许可的复利语义
ODbL v1.0 与 MIMIC 家族一脉相承:波形侧开放(本库全量零门槛)、临床模块 DUA 受控。本库的复利形态:12.8 GB 体量使"ODbL 阶段完成 95% 工程量"成为现实——连全量下载都能在一杯咖啡时间内完成,产线调试、课程教学、工具开发全部在开放侧闭环;DUA 只为最终的临床标签接入而开。这是 PhysioNet 用许可+体量双杠杆推动生态前置化的又一实例。
§6.9 教程驱动的社区校准
EMBC 2022 笔记本+wfdb.io 教程站构成了"官方参照实现"——社区产线与之逐字节对拍(教程样例记录的解析输出一致)即可自证正确。这一机制的实证价值:新格式(FLAC/CSV/ticks)的早期采纳期,错误解析极易悄悄发生(比如 ticks 缩放、列名遗漏)——参照实现的存在把"悄悄错误"变成"对拍失败",是预览版发布策略中容易被低估的质量基建。
§6.10 静态预览×动态路线的组合语义
v0.1.0 静态定稿 + v1.0 路线图预告,构成"当下可复现+未来可迁移"的组合:论文引用 v0.1.0 DOI 保证可复现;产线代码按 v1.0 兼容性编写(记录枚举/列映射写成数据驱动而非硬编码 200 条)——v1.0 上线日即迁移日。工程建议:所有"200"字样的断言集中在配置层(规模断言/记录清单哈希),核心代码零硬编码。
§6.11 从 487 号条目到本库:协议迁移映射表
| 487 协议(MIMIC-III Matched) | 本库对应(MIMIC-IV Waveform) | 状态 |
|---|---|---|
| 命名正则 pXXNNNN-日期-时分 | pXXX/p100XXXXXX/8 位号 | 重写(更简单) |
| 偏移还原层(SurrogateShiftResolver) | 删除 | 架构性简化 |
| numerics 交叉校验(§4.7) | 抽样自洽检查(§6.3) | 降级为验证 |
| WFDB numerics 1 Hz 读取 | gzip CSV 事件流+列映射 | 重写 |
| 患者级切分 | 同(subject_id) | 直接复用 |
| 阻尼伪影掩码/事件标注 | 同(ABP 语义不变) | 直接复用 |
| 分层评估矩阵 | 同(经 MIMIC-IV 注释) | 直接复用 |
迁移语义:产线代码中"还原层"与"交叉校验"两个模块被归档而非删除——v1.0 后若出现偏移语义变化(版本治理),它们是现成的保险。
§6.12 记录时长分布的实证影响
预览版记录偏短(多数 <1.5 h;部分 >15 h)对三类研究的影响:短时窗任务(PPG-BP 片段抽取/心律检测)——完全够用甚至更高效(少下载);中时窗任务(1-4 h 预警)——勉强,需精选长记录;长时程任务(24 h 轨迹/日节律)——不可行,等 v1.0 或回 486。论文选题前的第一件事:按 §3.9 普查时长分布,对照任务时窗——分布不匹配的任务换库,不硬做。
§6.13 "24 小时切片"边界的实证核查
§2.13 提到的天级批次切缝可用数据自检:对每记录首尾各 60 秒检查信号是否存在"人为截断特征"(信号在整日时刻附近骤断且无配置变更证据)。若切缝比例显著,长记录重建协议需加"跨批次边界拼接核查"步骤。预览版 200 记录的人工核查成本近乎为零——这正是预览版作为"架构验证场"的价值:把此类边界问题在 200 记录上穷尽,v1.0 的万级记录才能自动处理。
§7 AI 就绪指南与应用场景
§7.1 四种喂法
- 全量本地小库快跑:12.8 GB 全量入盘,快速迭代解析/对齐/训练全链路;
- 波形+MIMIC-IV 直连(DUA):subject_id+共享偏移,最顺滑多模态原型;
- 250 Hz ECG 专项:高频形态/起搏脉冲/ST 细节——MIMIC-III 波形做不了的题;
- 测试床模式:200 记录当解析层回归测试集(对拍 EMBC 笔记本),产线 CI 集成。
§7.2 两段式迁移配方(预览版校准→v1.0 放量)
阶段 A(今天,v0.1.0):
数据层:200 记录全量本地 → §4.2 索引 → §4.9 列映射表
解析层:wfdb-python(FLAC) + gzip CSV + ticks 换算——全部通过 §6.9 对拍
对齐层:§5.2 多采样率协议 + §4.6 共享偏移直连(DUA)
模型层:小规模端到端验证(过拟合 10 记录的自检→200 记录完整轮)
阶段 B(v1.0 发布日):
换索引(枚举代码零改动)→ 分布重检(§6.2 提示的时长分布差异)
→ 功效重算 → 全量训练
验收闸门:阶段 A 的解析层在 v1.0 抽样记录上零修改通过
§7.3 TransfoRhythm 案例复盘
首个使用 MIMIC-IV Waveform 的公开方法学研究(arXiv 2404.15352)路径复盘:PPG 独立(无 ECG)血压估计 Transformer——数据清洗(<15 分钟剔除/平线高噪段剔除→360 条纯净记录)→ 滤波(Butterworth 0.7-10 Hz + 滑动平均)→ SDPPG 二阶导 12 特征 → 类平衡(低/高血压事件增广)。可借鉴点:预览版体量上的严谨清洗声明(200→360 条的口径演化全程公开);需注意点:其"v2.0"指 MIMIC-IV 临床库版本语境(波形库本身 v0.1.0)——跨论文引用版本号时校对语义。该案例证明:预览版+方法学创新=可发表贡献,不必等 v1.0。
§7.4 成本与排期模板
| 阶段 | 工作 | 人日 | 门槛 |
|---|---|---|---|
| P0 环境与下载 | libFLAC/wfdb-python + 12.8 GB | 0.5 | 无 |
| P1 解析层+对拍 | §4.2-4.5 + EMBC 对拍 | 2-3 | 无 |
| P2 列映射+普查 | §4.9/§3.9 | 1-2 | 无 |
| P3 对齐协议 | §5.2 多采样率 | 2-3 | 无 |
| P4 DUA+直连验证 | §4.6/§6.3 | 5-15(含审批) | DUA |
| P5 端到端原型 | §7.2 阶段 A | 5-8 | — |
| 合计 | 16-32 人日 | 双轨 |
§7.5 公平性与域偏差声明
- 单中心:BIDMC 一家(与 MIMIC-IV 同域)——跨中心外推声明必写;
- 预览版选择偏倚:200 记录的入选机制未公开细节——按"非随机样本"保守声明;
- 记录偏短:多数 <1.5 h(TransfoRhythm 报告)——长时程任务(24 h 预警)在预览版上不可评估;
- 成人 ICU:无新生儿子集声明(MIMIC-III 波形含 NICU)——儿科结论不可迁移;
- 时代:2008-2019 采集期——设备代际偏倚与 486 相同量级。
§7.6 泄漏防控专项
198 患者的切分泄漏风险与 487 同构(人均 1.01 记录——泄漏面小于 matched,但同患者多记录实例确凿存在:p10039708 双记录)。专项规则:(1) 患者级切分强制;(2) 报告三 split 的患者绝对数(test≈20);(3) DUA 阶段的标签穿越同 487 §7.6(出院诊断不可作输入);(4) 与 MIMIC-IV 模块联合时,同一 subject_id 的一切模块数据只能落在该患者的单一 split——模块族互链越顺滑,跨模块泄漏越隐蔽。
§7.7 消融案例:250 Hz 的真实增益
PTT 特征(ECG R 波→PPG 波足时延)在本库的可检验优势:ECG 从 125→250 Hz 使 R 波定位时间分辨率从 8 ms→4 ms。消融设计:同一配对段、同一 PPG 通道,双采样率 ECG 版本各算 PTT→血压估计误差对比。预期:误差差值在 1-2 mmHg 量级(R 波定位误差占比小的任务)到显著(高心率/宽 QRS 场景)。方法学结论:250 Hz 的增益是"通道依赖"的——论文声明采样率优势时应给出对应通道的消融,而非笼统"更高更准"。
§7.8 多模态产线骨架(代码)
"""
MIMIC-IV Waveform 多模态产线骨架
设计原则:规模无关(200→10,000 零改码)+ 三代库可插拔
"""
class WaveformPipeline:
def __init__(self, index_csv, column_map):
self.index = pd.read_csv(index_csv) # §4.2(规模无关)
self.colmap = column_map # §4.9(列名语义层)
def stream(self, subject_ids):
for _, r in self.index[self.index.subject_id.isin(subject_ids)].iterrows():
hdr = wfdb.rdheader(r.record_id, pn_dir=r.pn_dir)
yield {'meta': r, 'hdr': hdr} # base_datetime/counter_freq
def to_grid(self, wave, numerics, grid_hz=125):
# §5.2:多采样率→统一网格;numerics 事件流→前向保持
...
def attach_clinical(self, sample, mimici4):
# §4.6:subject_id 直连 + base_datetime 直比(共享偏移,无还原层)
...
§7.9 消融案例:numerics 网格化策略
同一预警模型两组输入:(a) numerics 事件流前向保持(保留测量时刻语义);(b) 线性插值到 1 Hz 网格(“看起来整齐”)。预期:低频测值(NIBP 每 15-60 分钟)在 (b) 下产生大量插值伪测值——模型把"插值平台"当真实血压平台学习,验证集虚假稳健、外部数据崩溃。结论:事件流网格化策略是多模态论文的新审查点(MIMIC-III 时代"1 Hz 网格"是库级默认,MIMIC-IV 时代它是一个研究者的选择——选择就要辩护)。
§7.10 报告与复现包模板
repro_package/
├── data/
│ ├── mimic4wdb_index.csv # §4.2 索引(可公开)
│ ├── column_map.json # §4.9 列映射(可公开)
│ └── QUALITY_PROFILE.md # §3.9 分层
├── src/
│ ├── enumerate_records.py # 规模无关枚举
│ ├── ticks_time.py # counter_freq 换算(唯一时间真源)
│ ├── multirate_align.py # §5.2
│ └── mimic4_join.py # §4.6(DUA 环境专属)
├── tests/
│ └── test_embc_parity.py # §6.9 教程对拍(CI 强制)
├── docs/
│ ├── DUA_COMPLIANCE.md
│ └── CALIBER_NOTES.md # §3.2 口径存照(200 vs 10,000)
└── results/
└── ablation_250hz.csv # §7.7
§7.11 教程对拍测试(解析层 CI)
def test_embc_parity():
"""解析层回归测试:与 EMBC 笔记本同记录同输出(CI 强制)"""
# 用官方教程引用的样例记录(如 p10039708/83411188)
hdr = wfdb.rdheader('83411188', pn_dir=TEST_PN_DIR)
assert hdr.counter_freq == 999.52
assert hdr.base_datetime is not None
n = read_numerics_local('83411188', cols=('SpO2 [%]',))
# 笔记本首行输出对拍(示例语义):首个 SpO2 事件时间/值一致
t0, v0 = n['SpO2 [%]'][0]
assert t0 == EXPECTED_T0 and v0 == EXPECTED_V0
# FLAC 解码对拍:波形首 1000 样本与笔记本缓存逐字节一致
...
# 任何解析层改动必须过此测试——预览版新格式的"悄悄错误"防线(§6.9)
§7.12 v1.0 兼容性编码规范
规模断言集中化:所有 "200"/"198" 只出现在 config.py(记录数断言/清单哈希)
枚举数据驱动:record 列表来自 RECORDS 文件解析,不硬编码
列映射外置:column_map.json 版本化(v1.0 后重普查即可)
时间真源唯一:ticks 换算函数全局单点(禁止散落 timedelta)
命名适配器化:enumerate/parse 按库类型注入(三代库可插拔)
切分函数复用:patient_split(subject_id) 与库无关
验收:v1.0 抽样 20 记录 → 解析层零修改通过 → 全量切换
§8 伦理、许可与合规
§8.1 许可结构
| 资产 | 许可 | 门槛 | 义务 |
|---|---|---|---|
| 波形+numerics(本库) | ODbL v1.0 | 无 | 署名引用;ODbL 传染性 |
| MIMIC-IV 临床模块 | PhysioNet DUA | CITI+机构协议 | 禁再识别/禁转分发 |
| 联合产物 | 双许可叠加 | — | 按数据来源分别遵守 |
§8.2 引用与致谢模板
波形数据:Moody B, Hao S, Gow B, Pollard T, Zong W, Mark R. MIMIC-IV Waveform Database (version 0.1.0). PhysioNet, 2022. doi:10.13026/a2mw-f949。
临床数据:Johnson A, Bulgarelli L, Pollard T, Horng S, Celi LA, Mark R. MIMIC-IV (version 2.0). PhysioNet, 2022. doi:10.13026/7vcr-e114(经 PhysioNet DUA 获取,CITI 认证编号 [填写])。
工具:WFDB Software Package 10.7.0(doi:10.13026/gjvw-1m31);wfdb-python 3.4.1(doi:10.13026/egpf-2788)。
伦理声明:数据收集经 BIDMC 与 MIT IRB 批准并豁免个人知情同意;本研究未尝试任何再识别。
§8.3 再识别风险的显式讨论
本库去标识三件套:subject_id/hadm_id 代理体系(与 MIMIC-IV 共享)、代理日期(共享偏移)、记录内 elapsed time 计时。与 487 相同的侧信道风险结构(公开波形+受控临床的拼接风险),缓解亦同(DUA 门禁+再识别禁令)。新增风险点:共享偏移意味着"从临床库的偏移量可推波形代理日期"(同患者)——但两库都在 DUA/去标识体系内,该一致性恰是设计目标;风险边界在于禁止把偏移量本身用于库外身份关联。使用者义务与 487 §8.3 一致:不发布缩小个体范围的衍生索引。
§8.4 合规环境核查清单(DUA 阶段)
- [ ] CITI 人体受试者保护培训证书在有效期内(全员)
- [ ] 机构 DUA 已签署并归档(覆盖 MIMIC-IV 全模块)
- [ ] 临床模块数据(Hosp/ICU 等)仅存于隔离环境(与公开波形侧物理/逻辑分离)
- [ ] 共享偏移验证报告(§6.3)已存档——作为"直接对齐"的合规依据
- [ ] 衍生产物分级:仅波形衍生→ODbL 可公开;含临床数据→DUA 约束、不外传
- [ ] 论文数据可用性声明含 CITI 编号与访问途径(§8.2 模板)
- [ ] 团队成员变动时的访问回收流程
- [ ] 禁止再识别与禁止转分发的培训记录
双轨纪律:波形侧(ODbL)环境与临床侧(DUA)环境的分离不是形式主义——它是"教学在开放侧、科研在受控侧"生态分工的技术保障;一旦两侧数据在同一环境混合,整个环境的合规等级按最高约束计算。
§9 常见问题(FAQ)
Q1 MIMIC-IV Waveform 和 MIMIC-III Waveform 什么关系?
不是简单升级,是架构重设计(多采样率/FLAC/CSV numerics/共享偏移/模块化互链)。数据采集期也不同(MIMIC-IV 期 2008-2019 vs MIMIC-III 期 2001-2012)。
Q2 为什么只有 200 条记录?
v0.1.0 是技术预览版(官方原文 technical preview),先让社区验证架构,v1.0.0 预告约 10,000 记录。
Q3 v1.0 什么时候发布?
官方仅说"shortly"(2022 年口径);截至本文核查(2026-09)PhysioNet 版本列表仍为 0.1.0。以官方页面为准,勿引用预告当现状。
Q4 250 Hz 和 125 Hz 差在哪?
本库按信号物理特性分率:ECG 250 Hz(形态细节)、PPG/ABP 125 Hz、Resp 62.5 Hz。MIMIC-III 波形统一 125 Hz。
Q5 counter ticks 是什么?
监护仪内部计数器时间(999.52 Hz≈1 ms/tick)。换算:seconds=t/counter_freq,再加 base_datetime 得挂钟时间。单调、无墙钟跳变。
Q6 numerics 为什么改成 CSV?
承认测值的不规则采样本质(NIBP 每 5-60 分钟、SpO2 每 1.024 秒)——事件流比假网格更诚实。代价是列名跨患者不同、需自建映射。
Q7 FLAC 压缩会损失数据吗?
不会。FLAC 是无损压缩(-8 -r8 -e 参数),解压逐样本一致。只是读取工具需支持(wfdb-python 3.4.1+ 自动处理)。
Q8 代理日期和 MIMIC-IV 一致是什么意思?
同一患者加同一随机偏移——波形 base_datetime 与临床 charttime 直接可比,无需还原层(MIMIC-III 家族需要)。
Q9 记录名怎么解读?
waves/p100/p10014354/81739927:p100=subject_id 前三位分桶;p10014354=8 位 subject_id;81739927=8 位记录号。同患者多记录同居一目录。
Q10 numerics 的时间怎么换算?
官方示例:t=int(row['time']); seconds=t/header.counter_freq; dt=header.base_datetime+timedelta(0,seconds)。
Q11 能和 MIMIC-III 波形库混用脚本吗?
解析层不行(FLAC/CSV/ticks/命名三套体系);模型层可以。分库适配器+统一内部 schema 是正解。
Q12 需要下载全量吗?
12.8 GB——预览版的奢侈:全量本地可行。也可 pn_dir 流式按需读。
Q13 有官方教程吗?
IEEE EMBC 2022 workshop 笔记本(mimic.mit.edu)+ wfdb.io/mimic_wfdb_tutorials。笔记本可执行、可当回归测试基准。
Q14 DUA 是给谁的?
波形侧 ODbL 不需要;MIMIC-IV 临床模块(Hosp/ICU 等)需要(CITI+签署)。联合分析才用 DUA。
Q15 同一患者有多条记录吗?
有。p10039708 有 83411188 与 85583557 两条——多次监护会话。切分按 subject_id。
Q16 TransfoRhythm 是什么?
首个用本库的公开方法学研究(arXiv 2404.15352):PPG 独立血压估计 Transformer,198 人清洗后 360 条纯净记录。证明预览版可发方法学论文。
Q17 和 MIMIC-IV-ECG 什么分工?
MIMIC-IV-ECG=独立 10 秒 12 导诊断级静息 ECG(数百万条);本库=床旁连续多参数监护波形。诊断任务用前者,血流动力学/多模态用后者。
Q18 gap 拆分规则还在吗?
在。gap>1 小时自动拆分(防跨患者混入),与 MIMIC-III 波形同逻辑。
Q19 引用 DOI 用哪个?
本库 10.13026/a2mw-f949(v0.1.0);MIMIC-IV 10.13026/7vcr-e114(v2.0);工具链 DOI 见 §8.2。
Q20 采样率 1.024 秒节拍是什么?
HR/SpO2 等派生测值按监护仪内部 1.024 秒节拍产出(非整 1 秒)——跨库对齐 numerics 时间粒度时注意 2.4% 节拍差。
Q21 可以做新生儿研究吗?
本库无新生儿子集声明(MIMIC-III 波形含 NICU)。儿科结论不可迁移。
Q22 记录一般多长?
预览版记录偏短:多数 <1.5 小时、部分多记录 >15 小时(TransfoRhythm 报告)。长时程任务等 v1.0。
Q23 怎么验证解析代码正确?
与 EMBC 笔记本对拍(同一记录同一输出)——官方参照实现即回归测试基准(§6.9)。
Q24 偏移量能从波形侧反推吗?
禁止尝试(再识别禁令)。共享偏移的设计目标是库内对齐,不是库外身份关联(§8.3)。
Q25 和 VitalDB 比怎么选?
手术室人群/VitalDB;ICU 人群+MIMIC-IV 生态互链/本库。多中心比较两者都进。
Q26 训练集怎么切?
按 subject_id(198 人 80/10/10)——test 约 20 人,报告必须给绝对数。
Q27 250 Hz ECG 能分析起搏脉冲吗?
可以——250 Hz 是本库相对 MIMIC-III 波形(125 Hz)的核心优势之一(高频形态细节)。但注意部分起搏脉冲更宽,需逐案验证。
Q28 能跑大规模预训练吗?
预览版体量不支持(200 记录)。预训练用 486 主库(67,830 组),本库做架构校准。
Q29 患者级泄漏怎么防?
同患者多记录+DUA 模块联合是两大泄漏面——subject_id 全域一致性切分(§7.6)。
Q30 base_datetime 是真实时间吗?
是代理时间(随机偏移后)。真实日期被抹除;患者内相对时序完整(共享偏移保证与 MIMIC-IV 一致)。
Q31 12.8 GB 是压缩前还是后?
官方口径"Total uncompressed size: 12.8 GB"——未压缩总量(FLAC 文件解压后)。下载体积更小。
Q32 segment 之间有 gap 吗?
可能有(监护中断/配置变更)。按 master header 样本坐标遍历(含空档 segment),禁止按文件顺序连字节。
Q33 能和 MIMIC-CXR 联用吗?
经 subject_id/hadm_id 理论可联(模块族设计)——但时间对齐(胸片时刻 vs 波形时刻)需自行验证覆盖度,无官方联合协议。
Q34 论文数据可用性声明怎么写?
波形:公开(ODbL,DOI);MIMIC-IV 模块:受控(DUA+CITI 编号);代码:复现包+EMBC 对拍测试。三段式。
Q35 为什么说本库是"蓝图"?
200 记录=样板间,展示新架构全部语义(多采样率/FLAC/CSV/ticks/共享偏移)——今天在 12.8 GB 上调通产线,v1.0 放量日即切换日(§1.9/§7.2)。
Q36 工具链最低版本?
WFDB Software Package 10.7.0(libFLAC 前置);wfdb-python 3.4.1+。旧版读 FLAC 报 unknown format。
Q37 列映射表怎么做?
普查 200 条 numerics 的列名并集/频次→标准列+语义等价类(§4.9)。这是 v1.0 前的一次性资产。
Q38 段内采样率一致吗?
WFDB 约束单 segment 内各通道同 fs;跨 segment 可不同(多采样率体系)——逐段读 .hea 的 fs。
Q39 能复现 MIMIC-III 波形上的模型结果吗?
数据分布不同(时长/人群期/采样率)——同架构重训可、结果数值不可期待一致。跨库比较需显式声明(§6.7)。
Q40 有 AWS 镜像吗?
有(PhysioNet Open Data)。按需拉取比 wget 全量更省带宽。
Q41 记录时长怎么算?
master header 的 seg_len 累加/fs。注意段间空档(~ segment)计入时间轴。
Q42 QRS/ST/QT 派生值在波形里吗?
不在波形文件里——那些是监护仪派生 numerics(CSV 列)。波形里只有原始信号;派生值可作交叉校验。
Q43 怎么统计人均记录数?
索引表 groupby subject_id。v0.1.0 人均 1.01(200/198)——v1.0 预计上升。
Q44 预览版会撤下吗?
PhysioNet 版本页保留所有版本——v1.0 上线后 0.1.0 仍可引用(历史论文可复现)。
Q45 和 MIMIC-III 波形库的记录能配对吗?
不能。采集期不同(2001-2012 vs 2008-2019)、患者 ID 体系不同——两库无患者重叠映射。跨库是"方法学比较"不是"样本合并"。
Q46 共享偏移下波形和临床的时刻完全一致吗?
同一偏移量意味着可比,但监护仪内部时钟与病历系统时钟存在设备级偏差(分钟级)——联合分析仍建议保留 §6.3 的自洽抽检,设备时钟漂移是物理现实。
Q47 1.024 秒节拍怎么对齐到 1 秒网格?
就近对齐(最近邻),最大漂移 0.512 秒——在方法学里声明漂移上界即可;需要亚秒精度的任务直接用 ticks 原生时间轴。
Q48 为什么 numerics 列名各不相同?
监护仪按实际配置输出测值(有的患者有 CVP/ICP,有的没有)——事件流如实反映配置差异。列映射表(§4.9)+ 语义等价类是标准解。
Q49 v1.0 发布后本文协议还有效吗?
有效——协议按"规模无关+适配器化"编写(§7.12),v1.0 主要是记录数增加与可能的列名扩展;核心语义(多采样率/FLAC/CSV/ticks/共享偏移)预计稳定。
Q50 预览版论文的审稿风险点?
功效质疑(198 人)——用"方法学论文"定位+§6.1 语境防御;版本时效(v1.0 未出)——用 DOI 精确引用+复现包防御。两者都有先例(TransfoRhythm)可引。
Q51 天级切片会切断我的记录吗?
解析整合后的记录是连续时间轴的(切片发生在归档层,解析时已按 PatientId+时间重组);边界核查(§6.13)是完备性加分项而非必需项。
Q52 这个库适合课程教学吗?
非常适合:12.8 GB 单机全量+官方笔记本+ODbL 零门槛——数据工程/生理信号课程的理想教材;学生可完整经历"下载→解析→对齐→建模"全链路而不碰任何合规红线(教学阶段不出波形侧)。
Q53 波形侧能发衍生可视化/基准网站吗?
能(ODbL 允许衍生与再分发,同许可传染)——但不得附加缩小个体范围的信息(§8.3),并保留 PhysioNet 署名与 DOI 链接;基准网站建议同时发布评测脚本保证可复现。
Q54 报告里写"MIMIC-IV Waveform 包含约 10,000 条记录"对吗?
不对——这是预告值。正确表述:“v0.1.0 技术预览版包含 200 条记录(198 名患者);官方预告 v1.0.0 将扩展至约 10,000 条记录”。现状与预告分开陈述(§3.2 口径纪律)。
Q55 怎么快速看一条记录里有什么信号?
读 master header 的 sig_name(全部可能信号)+ 逐 segment 的 sig_name(实际出现的)——两者差异即"声明但未启用"的通道。PhysioBank ATM 网页版可直接可视化,零代码快速目检;脚本化清点用 §4.2 索引+§4.3 header 读取,200 条记录秒级完成。
§10 存照与溯源
§10.1 口径存照
| 声明数字 | 口径 | 源 |
|---|---|---|
| 200 / 198 | v0.1.0 记录/患者数 | 官方页面+release notes |
| 12.8 GB | 未压缩总量 | PhysioNet Files 页 |
| 2022-07-10 | v0.1.0 发布日 | PhysioNet Versions |
| 约 10,000 | v1.0.0 预告规模(非现状) | 官方 release notes 原文 |
| 10.13026/a2mw-f949 | v0.1.0 DOI | 官方页面 |
| 10.13026/6269-ws81 | latest 概念 DOI | 官方页面 |
| 250/125/62.5 Hz | ECG/PPG·ABP/Resp | wfdb.io 教程 |
| 999.52 Hz / 1.024 s | counter_freq / 派生节拍 | wfdb.io 教程 |
| FLAC -8 -r8 -e / dictzip | 压缩参数 | 官方页面 |
| 共享偏移(matches MIMIC-IV) | 去标识语义 | 官方页面原文 |
| ODbL v1.0 / IRB 豁免 | 许可/合规 | 官方页面 |
| MIMIC-IV v2.0 parent | 上游(7vcr-e114) | 官方 Parent Projects |
| 多数 <1.5 h / 360 条纯净记录 | TransfoRhythm 口径 | arXiv:2404.15352 |
| p10039708 双记录示例 | 命名/多次会话实例 | wfdb.io formatting 页 |
| counter_freq=999.52 Hz 实测断言 | §7.11 对拍测试基线 | EMBC 笔记本 |
| 无新生儿子集 | 人群范围声明 | 官方页面(成人 ICU 语境) |
§10.2 引文清单
- Moody B, Hao S, Gow B, Pollard T, Zong W, Mark R. MIMIC-IV Waveform Database (version 0.1.0). PhysioNet, 2022. doi:10.13026/a2mw-f949
- Johnson A, Bulgarelli L, Pollard T, Horng S, Celi LA, Mark R. MIMIC-IV (version 2.0). PhysioNet, 2022. doi:10.13026/7vcr-e114
- Xie C, McCullum L, Johnson A, Pollard T, Gow B, Moody B. Waveform Database Software Package (WFDB) for Python (version 3.4.1). PhysioNet, 2021. doi:10.13026/egpf-2788
- Moody G, Pollard T, Moody B. WFDB Software Package (version 10.7.0). PhysioNet, 2022. doi:10.13026/gjvw-1m31
- Goldberger AL, et al. PhysioBank, PhysioToolkit, and PhysioNet. Circulation 2000;101(23):e215-e220
- TransfoRhythm: A Transformer Architecture Conductive to Blood Pressure Estimation via Solo PPG Signal Capturing. arXiv:2404.15352(2024)
- Charlton P, et al. MIMIC-IV Waveform IEEE EMBC Workshop tutorial materials. mimic.mit.edu, 2022
- wfdb.io. MIMIC Waveform tutorials: Database Structure / Waveform Data Formats(访问日期 2026-09-20)
§10.3 与本系列其他条目的关系
| 条目 | 关系 |
|---|---|
| 486 MIMIC-III Waveform Database | 前代波形主库:大样本训练主力;本库是架构继任者 |
| 487 MIMIC-III Waveform Matched | 前代匹配桥:偏移还原协议在本库被共享偏移取代 |
| 490 MIMIC-III Clinical Database | 前代临床库(与本库无互链) |
| 492 MIMIC-IV | parent project:subject_id/hadm_id/偏移的上游;模块族中枢 |
| VitalDB | 横向对照:手术室人群;多中心比较素材 |
| MIMIC-IV-ECG | 同族分工:诊断级静息 ECG vs 本库连续监护波形 |
| MIMIC-IV-ED / MIMIC-CXR / Note | 模块族延伸:经 subject_id/hadm_id 可联(覆盖度自验) |
§10.4 变更日志
| 日期 | 事项 |
|---|---|
| 2022-07-10 | v0.1.0 发布(DOI 10.13026/a2mw-f949;200 记录技术预览) |
| 2022-07 | IEEE EMBC workshop 教程发布 |
| 2026-09-20 | 本条目完成事实核查与撰写(千方病案医数集 order 488);核查时点版本列表仍为 0.1.0 |
| 持续 | v1.0.0 路线图跟踪(约 10,000 记录);发布后按 §7.2 两段式迁移 |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimic3wdb — 共享标签:生理信号 / 电子健康记录
- mimic3wdb-matched — 共享标签:生理信号 / 电子健康记录
- shhs — 共享标签:生理信号 / 电子健康记录
- mros-sleep — 共享标签:生理信号 / 电子健康记录
- nsrr — 共享标签:生理信号 / 电子健康记录
- pulsedb — 共享标签:生理信号 / 电子健康记录
- sicdb — 共享标签:生理信号 / 电子健康记录
- mc-med — 共享标签:生理信号 / 电子健康记录
- cinc-2015 — 共享标签:生理信号 / 电子健康记录
- mover — 共享标签:生理信号 / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

