MIMIC-IV Waveform Database — 重症监护波形数据库 AI-Ready Wikipedia

MIMIC-IV 生态的波形模块:ECG 250 Hz 多采样率体系 · FLAC 压缩 · 共享 date shift——新一代 ICU 波形的技术预览与路线图

来源 https://physionet.org/content/mimic4wdb/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 28
MIMIC-IV Waveform Database — 重症监护波形数据库 AI-Ready Wikipedia

信息速览

数据集名称MIMIC-IV Waveform Database — 重症监护波形数据库 AI-Ready Wikipedia
数据类型200 记录,198 患者,12.8 GB,ECG 250 Hz,v0.1.0 预览版
规模198 名 ICU 患者(v0.1.0 技术预览版;代理 subject_id + 与 MIMIC-IV 共享的代理日期)
接入方式https://physionet.org/content/mimic4wdb/
AI 就绪度

INFOBOX

属性 内容
名称 MIMIC-IV Waveform Database(v0.1.0)
维护方 MIT Laboratory for Computational Physiology / PhysioNet
发布 2022-07-10(v0.1.0 技术预览版)
定位 MIMIC-IV 模块族的波形模块——新一代 ICU 波形架构的技术预览
规模 200 records / 198 patients / 12.8 GB(未压缩)
路线图 官方预告 v1.0.0 将含约 10,000 记录
采样率 多采样率:ECG 250 Hz / PPG·ABP 125 Hz / Resp 62.5 Hz;numerics 不规则
压缩 信号 FLAC(-8 -r8 -e);numerics dictzip CSV
时间语义 counter ticks(1/999.52 s)+ header base_datetime(代理)
关键改进 代理日期偏移与 MIMIC-IV 共享(波形-临床直接可比)
互链键 subject_id + hadm_id(MIMIC-IV 全模块族通用)
许可 ODbL v1.0(开放下载)
合规 BIDMC + MIT IRB 批准,豁免个人知情同意
DOI v0.1.0 = 10.13026/a2mw-f949(latest 概念 10.13026/6269-ws81)
主引文 Moody 2022(波形);Johnson 2022(MIMIC-IV v2.0)
平台 PhysioNet

一句话定位:MIMIC-IV 模块族的波形模块,以 v0.1.0 技术预览版(200 记录/198 患者/12.8 GB)先行发布——它是三代 MIMIC 波形库中架构最先进、体量最小的一个;读它是为读懂 MIMIC 波形生态的未来,而不是替代当下的训练主力(486/487)。

§0 E-E-A-T 信任声明与免责声明

经验(Experience):本文基于 PhysioNet 官方页面(v0.1.0)、wfdb.io 官方教程(formatting/structure)、mimic.mit.edu 模块文档与 TransfoRhythm 应用论文撰写;多采样率、counter ticks、FLAC 压缩等工程语义按官方原文口径译写。

专业性(Expertise):预览版定位(200 记录≠大样本)、与 MIMIC-III 波形家族的格式断裂(numerics CSV/FLAC/多采样率)、共享 date shift 的对齐含义——三大易错语义全部显式披露;全部数字标注口径。

权威性(Authoritativeness):MIMIC 家族是重症医学 AI 的事实标准数据底座;MIMIC-IV 是官方推荐的新项目起点(mimic.mit.edu 明示);本文为第三方解读,不替代官方文档与 LICENSE。

可信度:文内数字进入文末「口径存照」;"200 records/198 patients"与"约 10,000 记录(预告)"两口径已显式区分;v0.1.0 与 latest DOI 并列存照。

免责:本文为学术性数据资源解读,不构成医疗建议;再识别风险与伦理合规见 §8。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:MIMIC-IV 模块族的波形模块——BIDMC ICU 床旁监护仪的高分辨率波形+数值,与 MIMIC-IV 临床库经 subject_id/hadm_id 直接互链;
  • 规模:v0.1.0 技术预览版 = 200 记录 / 198 患者 / 12.8 GB(官方预告 v1.0.0 约 10,000 记录);
  • 多采样率:ECG 250 Hz / PPG·ABP 125 Hz / Resp 62.5 Hz——比 MIMIC-III 波形库的统一 125 Hz 更高保真;
  • 格式升级:信号 FLAC 压缩、numerics 改 gzip CSV(列跨患者不同)、时间用 counter ticks;
  • 对齐改进:代理日期偏移与 MIMIC-IV 共享同一偏移量——波形-临床时间直接可比(MIMIC-III 家族做不到);
  • 许可:ODbL v1.0 开放下载;
  • 最大坑:把它当大样本库用——200 记录是技术预览体量,功效声明必须先算后训。

§1.1 摘要

MIMIC-IV Waveform Database 是 MIMIC-IV 模块化战略的信号侧落子:mimic.mit.edu 把 MIMIC-IV 拆成 Hosp/ICU/ED/CXR/Note/ECG/Waveform 等模块,经 subject_id+hadm_id 统一互链——波形模块于 2022 年 7 月以 v0.1.0 技术预览版上线(200 记录/198 患者/12.8 GB),为预告中约 10,000 记录的 v1.0.0 探路。它与 MIMIC-III Waveform Database(67,830 组)不是简单的"新版本",而是一次架构重设计:多采样率体系(ECG 提升到 250 Hz、呼吸 62.5 Hz 按信号物理特性分别定率)、信号 FLAC 无损压缩、numerics 从 WFDB 改为 gzip CSV(承认其"不规则采样表"的本质)、时间戳改用 counter ticks(毫秒粒度)。最关键的方法学改进是代理日期偏移与 MIMIC-IV 临床库共享——MIMIC-III 家族里波形侧与临床侧偏移不同、需要还原层才能对齐(见 487 号条目 §4.6),MIMIC-IV 家族直接可比,多模态研究的前置工程被砍掉一大块。对 AI 研究者:今天用 v0.1.0 做方法学原型与流水线校准,等 v1.0 放量后无缝切换——这是官方"technical preview"语义的正确打开方式。

§1.2 战略价值

  1. 架构风向标:MIMIC-IV 波形模块定义了下一代 ICU 波形库的工程标准(多采样率/FLAC/CSV numerics/共享偏移)——提前适配即提前锁定迁移红利;
  2. 对齐即插即用:与 MIMIC-IV 共享偏移意味着 subject_id 关联后时间轴直接可用——多模态产线少一个还原层、少一类错误源;
  3. 模块族入口:波形经 hadm_id 挂接 MIMIC-IV 全族(Hosp 化验/ICU 护理/ED 急诊/CXR 影像/Note 文本/ECG 心电图)——跨模态组合空间是 MIMIC-III 时代不可比的;
  4. 技术预览的先手价值:200 记录足够校准流水线、验证解析代码、试跑端到端训练——v1.0 放量时团队已就位;
  5. 官方教程齐备:IEEE EMBC 2022 workshop 可执行笔记本(Peter Charlton 领讲)+ wfdb.io 教程站——入门曲线被官方铺平。

§1.3 同类数据集横向对比

维度 MIMIC-IV Waveform v0.1.0 MIMIC-III Waveform v1.0 MIMIC-III Matched VitalDB
规模 200 记录/198 患者(预览) 67,830 组/30,000 患者 22,317 记录/10,282 患者 6,388 手术
体量 12.8 GB 6.7 TB 主库 1/3 量级 数百 GB
ECG 采样 250 Hz 125 Hz 125 Hz(同主库) 500 Hz
numerics 格式 gzip CSV(不规则) WFDB 1 Hz WFDB 1 Hz 内置表
压缩 FLAC+dictzip 无(原始) 无(同主库) 自有格式
date shift 与 MIMIC-IV 共享 与临床库不同 与临床库不同 —(同一系统)
临床互链 subject_id+hadm_id 直接 需映射(matched 才有) subject_id+偏移还原 手术记录内置
版本状态 预览(v1.0 预告中) 定稿 v1.0 定稿 v1.0 持续更新

结论:三代库不是替代关系而是分工——今天跑大规模训练用 MIMIC-III 波形(486/487),今天定架构/写产线/做方法学用 MIMIC-IV Waveform(488),v1.0 放量后迁移。

§1.4 版本时间轴

时间 事件
2021-03 MIMIC-IV v1.0 临床库发布(10.13026/6269-ws81 之前的主模块节点)
2022-07-06 WFDB 工具链引用基线(WFDB Software Package 10.7.0;wfdb-python 3.4.1)
2022-07-10 MIMIC-IV Waveform v0.1.0 发布(200 记录技术预览;DOI 10.13026/a2mw-f949;parent=MIMIC-IV v2.0)
2022-07 IEEE EMBC workshop(Peter Charlton 领讲;可执行笔记本公开)
2022-2024 TransfoRhythm 等首批应用论文(PPG 独立血压估计)
2026-09 核查时点:PhysioNet 版本列表仍为 0.1.0;v1.0.0(约 10,000 记录)官方预告中

§1.5 应用场景矩阵

场景 用到的部分 关键动作
产线架构预演 全库(小体量全量跑) 解析→对齐→训练端到端校准
PPG-BP 方法学迁移 PPG+ABP 配对段 250 Hz ECG 语义下重验特征
多模态原型(波形+临床) subject_id/hadm_id 互链 共享偏移直接对齐
高保真 ECG 分析 250 Hz ECG 通道 125 Hz 库做不了的细节(起搏脉冲/高频形态)
呼吸力学 62.5 Hz Resp 呼吸率/机械通气同步分析
教学入门 EMBC 笔记本 官方教程零门槛起步
工具链适配测试 FLAC/CSV 解析 WFDB 10.7+/libFLAC 环境验证

§1.6 组件全景

MIMIC-IV Waveform Database(v0.1.0, 12.8 GB 未压缩)
├── waves/(100 个顶层目录 pXXX 按 subject_id 前三位)
│   └── p100/p10014354/81739927/
│       ├── 81739927.hea          ← master header(base_datetime 等)
│       ├── 81739927_000N.hea     ← segment header
│       ├── 81739927_000Ne.dat    ← 信号(FLAC 压缩;e/r/p 后缀=类型)
│       └── 81739927n.csv.gz      ← numerics(gzip CSV;列跨患者不同)
├── 工具生态
│   ├── WFDB Software Package 10.7.0+(需 libFLAC)
│   ├── wfdb-python 3.4.1+(FLAC 支持)
│   └── EMBC 2022 教程笔记本(mimic.mit.edu)
└── 互链:subject_id + hadm_id → MIMIC-IV(Hosp/ICU/ED/CXR/Note)

§1.7 命名与目录速记

waves/p100/p10014354/81739927/        ← pXXX(前三位分桶)/p100XXXXXX(患者)/8 位记录号
waves/p100/p10039708/83411188/        ← 同患者可有多记录(83411188 与 85583557)
waves/p100/p10039708/83411188n.csv.gz ← numerics = 记录号 + n

与 MIMIC-III 家族命名对照:主库按记录号分桶(30-39)、matched 按患者前两位分桶(p00-p09)+ 代理日期命名;MIMIC-IV Waveform 按患者前三位分桶(p100-p199)+ 独立 8 位记录号——三套命名体系并存,跨库脚本必须各自适配。

§1.8 访问方式速记

  1. 零下载起步:PhysioBank ATM 在线可视化 + EMBC 笔记本(Colab 可跑);
  2. 全量下载:wget -r -N -c -np https://physionet.org/files/mimic4wdb/0.1.0/(12.8 GB,一台笔记本装得下)或 AWS S3 镜像;
  3. Python 读取:wfdb-python 3.4.1+(rdrecord 自动解 FLAC)+ gzip/csv 标准库读 numerics;
  4. 环境前置:WFDB Software Package 路线需先装 libFLAC——纯 Python 路线(wfdb-python 新版)可绕过。

§1.9 独特视角:一份"蓝图"而非一座"矿山"

MIMIC-III Waveform 是一座已开采十六年的矿山(6.7 TB、67,830 组),MIMIC-IV Waveform v0.1.0 则是一份公开的施工蓝图——200 个"样板间"展示了新架构的每个细节:多采样率怎么定、压缩怎么选、numerics 怎么改表、时间戳怎么统一、偏移怎么共享。聪明的团队用它做什么?把产线、解析器、对齐协议、训练框架全部在 12.8 GB 上调通,等 v1.0 放量当天全量切换。矿山看储量,蓝图看未来——本文的价值在于帮你把蓝图读成施工图。

§1.10 阅读路线图

你是 建议路径
第一次接触 ICU 波形 §1 全部 → §2.1/§2.6 → §4.2-4.5(跑通)
从 MIMIC-III 波形迁移 §2.1/§2.3/§2.5(三大差异)→ §6.11 迁移表 → §5.2
做多模态/临床关联 §2.3 共享偏移 → §4.6 → §5.7(DUA 后)
评审多模态论文 §6.6 清单 → §6.1 预览版功效 → §7.6 泄漏
决策是否现在入坑 §1.3 对比 → §6.2 规模实证 → §7.2 两段式

§2 医学与科学背景

§2.1 多采样率体系的工程语义

MIMIC-III 波形库统一 125 Hz 是"存储效率优先"的产物;MIMIC-IV Waveform 按信号物理特性分别定率——ECG 250 Hz(心电形态学细节:起搏脉冲、ST 段高频成分、QRS 切迹需要 >200 Hz 才不失真)、PPG/ABP 125 Hz(脉搏波主要能量 <20 Hz,125 Hz 已超采样)、Resp 62.5 Hz(呼吸阻抗是慢信号,62.5 Hz 绰绰有余)。这体现了"按需分配带宽"的现代数据工程观:把比特花在信息密度高的通道上。对研究者的直接后果:跨通道分析前必须统一时间轴与采样率(重采样协议见 §5.2)——"所有通道同频"的旧假设在新库不成立。

§2.2 counter ticks 时间语义

numerics 的 time 列不是秒、不是 ISO 时间戳,而是 counter ticks——监护仪内部计数器的滴答,频率 counter_freq=999.52 Hz(即 1 tick ≈ 1.00048 ms)。官方换算:seconds = t / header.counter_freq,再 dt = header.base_datetime + delta 得到挂钟时间。设计意图:监护仪内部时钟以自由计数器运行,避免墙钟跳变(NTP 校时/夏令时)破坏时序单调性——ticks 是单调时间,base_datetime 是墙钟锚点,两者相加才得业务时间。工程纪律:一切"时间差"计算用 ticks(无损单调),一切"日历对齐"用换算后的 datetime(挂钟语义)——混用两类时间轴是新版库最常见的 bug 源。

§2.3 共享 date shift 的方法学突破

MIMIC-III 家族的隐性成本:波形侧与临床库侧各自随机偏移(date shift 种子不同),多模态对齐前必须先建"偏移还原层"(487 号条目 §4.6 的整章工程)。MIMIC-IV Waveform 官方明示:“a surrogate date is generated by adding a randomly-assigned offset (which matches the offset used in MIMIC-IV)”——同一患者的波形与临床数据共享同一偏移。三个直接收益:(1) 波形样本 t → base_datetime + t 即得与 CHARTEVENTS 同轴的 datetime,直接 join;(2) 患者内跨记录、跨模块时序天然一致;(3) 偏移还原层从"必建工程"降级为"无需存在"。方法学论文里的对齐消融(487 号 §7.7)在新库不再需要——这个消融的消失本身就是架构进步的度量。

§2.4 FLAC 压缩的取舍语义

信号文件用 FLAC(-8 -r8 -e:最高压缩级别+自适应块分割+穷举搜索)——无损压缩,解压后与原始采样逐样本一致。收益:12.8 GB 体量(若不压缩预计 3-4 倍);传输与存储成本大幅下降。代价:读取链路多一层解码依赖(libFLAC 或支持 FLAC 的 wfdb-python)。工程语义:FLAC 是对研究者透明的优化——wfdb-python 新版 rdrecord 自动处理;只有直接解析 .dat 字节或用旧版工具链的团队会踩坑(§6.5 坑点)。与有损压缩(降采样/量化)的本质区别:FLAC 不改变任何科研结论,只是门槛更高的门把手。

§2.5 numerics 从 WFDB 到 CSV 的语义转变

MIMIC-III 的 numerics 是 1 Hz 网格化 WFDB 记录(监护仪每秒产出一行);MIMIC-IV Waveform 承认了临床现实——监护仪测值是不规则采样的(NIBP 每 5-60 分钟一次、SpO2 每 1.024 秒、体温小时级),强行网格化意味着大量空值或插值污染。新版改用 gzip CSV:每行一个真实测量事件(time ticks + 列名 + 值),无测量则无行。三个后果:(1) 列名跨患者不同(83411188n.csv.gz 的列集 ≠ 85583557n.csv.gz)——统一 schema 需自建列映射表;(2) 时间粒度精细到 ticks(毫秒级);(3) 分析时必须先 resample/聚合到统一网格——“读进来就是矩阵"的旧workflow 改为"读进来是事件流”。这不是退化,是把选择权交还研究者(网格化策略自己定)。

§2.6 信号清单与临床语义

信号 采样率 派生 numerics 临床语义
ECG(2-3 通道) 250 Hz HR(每 1.024 s)、逐拍 HR、ST、QT 节律/缺血/电解质
PPG(Pleth) 125 Hz SpO2、灌注指数、脉率 氧合/灌注
ABP(有创) 125 Hz ABP s/d/m、脉率 连续血压真值
NIBP(袖带) 间歇 NBP s/d/m 间歇血压
Resp(阻抗) 62.5 Hz RR 通气节律
其他 视配置 体温/CVP/ICP 视监护配置

与 MIMIC-III 波形库的信号语义一脉相承(ECG/PPG/ABP/Resp 四大类),但派生测值的时间基准统一为 1.024 秒节拍(监护仪内部钟)而非 1 秒整——跨库比较 numerics 时间粒度时注意这个 2.4% 的节拍差。

§2.7 gap 拆分与跨患者风险(继承语义)

监护系统需要护士手工 admit/discharge 患者,患者离开 ICU 后监护仪可能未停机——同一 PatientId 可能先后属于两名患者。新版沿用 MIMIC-III 波形库的防线:gap >1 小时自动拆分为独立记录。风险语义同样继承:短 gap 内换患者的情形理论存在,"记录≠确诊患者"的谨慎语义保留。与 487 号 matched 库的差异:MIMIC-IV Waveform 经 subject_id 与临床库官方互链——匹配是原生的(采集系统已与 MIMIC-IV 身份对齐),不需要 MIMIC-III 时代的事后匹配工程——这正是"两套系统时代断层"被弥合后的架构红利。

§2.8 预览版的科学定位

官方 release notes 原文:“This release contains just 200 records from 198 patients, and is intended as a technical preview for the community in advance of version 1.0.0”。科学语义:预览版的价值在架构验证而非统计功效——用它发"大规模实证"论文是误用(198 患者的 CI 宽到无法辩护);用它发"方法学/管线/架构"论文完全正当(TransfoRhythm 即先例:在 198 人上清洗出 360 条纯净记录做方法学贡献)。正确姿势是 §7.2 的"预览版校准、v1.0 放量"两段式。

§2.9 EMBC 2022 教程的方法学地位

IEEE EMBC 2022-07 workshop(Peter Charlton 领讲)是官方认证的入门路径:可执行笔记本覆盖 WFDB-Python 读取、特征提取(HRV/PPG 形态/呼吸率)、与 MIMIC-IV 临床数据联合——笔记本公开在 mimic.mit.edu。方法学语义:官方教程定义了"标准读取路径",偏离该路径的解析代码应在论文中自证正确性(尤其 FLAC/CSV/ticks 三个新语义点)。教程 notebook 同时是回归测试基准:你的产线对教程样例记录的输出与 notebook 一致,则解析层可信。

§2.10 与 MIMIC-IV-ECG 的分工

MIMIC-IV 家族内两个"心电"资产的分工:MIMIC-IV-ECG 是独立采集的 10 秒 12 导诊断级静息心电图(数百万条,500 Hz);MIMIC-IV Waveform 是床旁连续监护波形(持续数小时-数周、2-3 导监护级 250 Hz)。前者胜在标准化与诊断标签,后者胜在连续性与多参数同步(ECG+PPG+ABP+Resp 同轴)。ECG 深度学习(节律分类/诊断)用 ECG 模块,血流动力学/多模态/预警用 Waveform 模块——引用与选型勿混。

§2.11 迁移成本的现实评估

从 MIMIC-III 波形产线迁移到 MIMIC-IV Waveform 的实际工作量分布:解析层重写(FLAC/CSV/ticks)约占一半、命名适配(三套分桶)约占两成、对齐层简化(共享偏移)反而省掉还原工程、模型层基本不动。净评估:一次性成本 2-4 人日,换来 250 Hz ECG + 直接对齐 + 模块族互链——对计划长期投入 ICU 多模态的团队是正期望值迁移;对一次性研究则留在了 MIMIC-III 生态(486/487)更经济。

§2.12 共享偏移 vs 还原层:两代对齐工程对照

工程项 MIMIC-III 家族(486/487) MIMIC-IV 家族(488+492)
偏移量 波形侧≠临床侧(各自随机) 同一偏移量
对齐前置工程 偏移还原层(487 §4.6 整章) 无(直接比 datetime)
正确性验证 numerics vs CHARTEVENTS 交叉校验(§4.7) 抽样自洽检查(§6.3)
失败模式 偏移处理错误→全错且难察觉 几乎不存在该类错误
论文审查项 偏移协议有无(强制) 偏移共享验证报告(加分)
教学语义 date shift 是"必学陷阱" date shift 是"透明基础设施"

这一对照是多模态 ICU 研究方法学演进的缩影:把易错的人肉工程固化为数据架构。引用 487 条目学习对齐陷阱、引用本条目理解目标状态——两代文献合读才是完整叙事。

§2.13 中央站采集架构的科研语义

官方 Methods 章披露的采集链路值得细读:床旁监护仪→局域网→中央护理站→专有关系库(固定天数后自动丢弃)→每 24 小时横截面切片→归档。三个科研语义:(1) "24 小时切片"意味着归档粒度是天级批次——理论上存在批次边界的记录切缝(工程上已由解析整合,但跨批次拼接的边界核查值得列入完整性清单);(2) "固定天数丢弃"解释了为什么不早做归档就永远失去数据——MIMIC 波形项目本质是与数据蒸发赛跑的抢救性采集;(3) 中央站视角=全院 ICU 监护仪全覆盖——采集覆盖率高于床旁单机方案,这是 486 与本库共享的采集优势(对比手术室单机记录的 VitalDB)。

§3 数据集规格

§3.1 规格总表

属性 规格
正式名称 MIMIC-IV Waveform Database(v0.1.0)
记录数 200
患者数 198
总容量 12.8 GB(未压缩)
发布日期 2022-07-10
ECG 采样 250 Hz(2-3 通道)
PPG/ABP 采样 125 Hz
Resp 采样 62.5 Hz
numerics 不规则采样;gzip CSV;time=counter ticks(counter_freq=999.52 Hz)
压缩 信号 FLAC(-8 -r8 -e);numerics dictzip
目录结构 waves/pXXX(100 桶,前三位)/p100XXXXXX(患者)/8 位记录号
时间去标识 代理日期(与 MIMIC-IV 共享偏移)+ elapsed time 计时
互链键 subject_id + hadm_id → MIMIC-IV 全模块
许可 ODbL v1.0
DOI 10.13026/a2mw-f949(v0.1.0)
路线图 v1.0.0 约 10,000 记录(官方预告)
教程 IEEE EMBC 2022 笔记本 + wfdb.io 教程站

§3.2 数据发布口径地图

数字 口径 出处
200 v0.1.0 记录数 官方页面 + release notes
198 v0.1.0 患者数 官方页面
12.8 GB v0.1.0 未压缩总量 PhysioNet Files 页
约 10,000 v1.0.0 预告规模(勿当现状引用) 官方 release notes
250/125/62.5 Hz ECG/PPG·ABP/Resp 采样率 wfdb.io 官方教程
999.52 Hz counter_freq(1 tick≈1 ms) 官方 numerics 文档
1.024 s 派生测值节拍(HR/SpO2 等) wfdb.io 教程

口径纪律:"200 records/198 patients"是现状;"10,000"是预告——论文引用现状、报告里写预告必须带"in preparation/preview"限定。

口径事故成本对比:写错一个数字(预告当现状)的代价是审稿一轮返工;口径表(本节)的维护成本是十分钟——这是全系列条目坚持口径存照的原因。

§3.3 DAIMS 数据AI就绪度评估

维度 评分 说明
可获取性 Accessible ★★★★★ ODbL 开放;12.8 GB 笔记本级体量;AWS 镜像
可解析性 Interpretable ★★★☆☆ 新格式(FLAC/CSV/ticks)学习曲线;官方教程补位
一致性 Consistent ★★★☆☆ numerics 列跨患者不同;统一 schema 自建
链接性 Linkable ★★★★★ subject_id+hadm_id 原生互链 + 共享偏移——MIMIC 家族最佳
标签就绪 Label-ready ★★★★☆ 随 MIMIC-IV DUA 即得全模块标签;无还原层
文档完备 Documentation ★★★★★ 官方页面+教程站+EMBC 笔记本三层齐备

总评 4.2/5:链接性与文档满分,扣分在预览版体量与格式迁移成本——定位是"未来的主力、今天的实验室"。

§3.4 存储与计算需求

场景 磁盘 内存 说明
全量本地 13-15 GB — 12.8 GB+解压余量——单机全量可行
流式远程读取 <1 GB 2 GB pn_dir 按需拉取
解析普查(头文件+CSV 清单) <2 GB 4 GB §4.9 索引构建
端到端原型训练 15-20 GB 8-16 GB 全量+特征缓存
大规模预训练 不适用 — 等 v1.0(预览版体量不支持)

§3.5 获取通道

通道 内容 门槛
PhysioNet 官方页 页面/引用/许可 无
physionet.org/files/mimic4wdb/0.1.0/ 全量数据(ODbL) 无
AWS Open Data S3 按需拉取 无
PhysioBank ATM 在线可视化 无
EMBC 2022 笔记本 官方教程(可执行) 无
MIMIC-IV(Hosp/ICU 等模块) 临床互链数据 DUA(CITI+签署)
wfdb.io/mimic_wfdb_tutorials 格式/结构文档 无

§3.6 口径对齐表

你想要的 应该引用 不要引用
现有规模 200 记录/198 患者(v0.1.0) “约 10,000 记录”(预告当现状)
ECG 采样率 250 Hz(本库) 125 Hz(那是 MIMIC-III 波形)
numerics 格式 gzip CSV 不规则采样 “1 Hz WFDB”(那是 486/487)
对齐语义 共享偏移(与 MIMIC-IV) “需还原层”(那是 MIMIC-III 家族)
DOI 10.13026/a2mw-f949 MIMIC-IV 临床库 10.13026/7vcr-e114
parent project MIMIC-IV v2.0 MIMIC-III v1.4

§3.7 版本选择纪律

  • 引用 v0.1.0 DOI(10.13026/a2mw-f949)——它是实际发布版本;latest 概念 DOI(10.13026/6269-ws81)用于"无论版本引用该项目"的泛指;
  • v1.0.0 发布后:历史论文不必重跑(预览版方法学结论独立成立),新项目直接用 v1.0;
  • 三代波形库(MIMIC-III Waveform/Matched/MIMIC-IV Waveform)选型:大样本训练→486;临床关联大样本→487;架构预演+250 Hz→488;
  • 跨库研究必须声明各自版本与命名体系差异(三套分桶互不兼容)。

§3.8 数据文件与字段详表

文件/路径 内容 关键字段/语义
waves/pXXX/ 顶层分桶(subject_id 前三位;p100-p199) 100 个桶
pXXX/p100XXXXXX/ 患者目录(subject_id 8 位) 同患者多记录同居一目录
XXXXXXXX.hea master header base_datetime(代理锚点);segment 清单
XXXXXXXX_000N.hea segment header fs(该段采样率)/gain/baseline
XXXXXXXX_000Ne.dat 信号数据 FLAC 压缩;e/r/p 等后缀为信号文件类型
XXXXXXXXn.csv.gz numerics 表 time(ticks)+列名(跨患者不同)+值
RECORDS 记录清单 遍历入口

§3.9 记录质量分层画像(预扫描协议)

200 记录的全量普查秒级完成——每条记录都值得人工过目(这是预览版的奢侈):

层 判定 处置
A:多信号长记录 ECG+PPG+ABP 齐、>10 h 方法学主力
B:信号不全 缺 ABP(多数)或缺 PPG 任务定制
C:短记录 <1 h(TransfoRhythm 报告多数 <1.5 h) 边缘样本
D:异常 解析失败/信号断续 人工归档原因

普查同时核对每条记录的列名集合(numerics)→ 产出列映射表——这是 §4.6 统一 schema 的前置资产。

§3.10 多采样率换算速查表

任务对象 原生 fs 目标网格 换算
ECG 形态(QRS/ST/起搏脉冲) 250 Hz 保留 250 Hz 不降采样
ECG→血流动力学特征(HRV/PTT) 250 Hz 125 Hz 抗混叠低通(<62.5 Hz)后抽取
PPG/ABP 波形 125 Hz 125 Hz 原生
Resp 62.5 Hz 125 Hz 网格 阶梯保持(不插值升采样)
HR/SpO2 numerics 1.024 s 节拍 1 Hz 网格 就近对齐(≤0.512 s 漂移声明)
NIBP/体温 numerics 分钟-小时级 事件流保留 前向保持

速记:波形可降不可升、numerics 只保持不插值、一切换算注明方法与漂移上界。

实操顺序建议:先定任务时窗与主网格(§5.2 第 1 步)→ 再查此表定各通道换算 → 最后把全部换算写进方法学(审稿人可复现)。三步走完,多采样率不再是坑而是特征。

§4 数据结构

§4.1 对象模型

MIMIC4Waveform
├── Patient(p100XXXXXX = subject_id 8 位;198 个)
│   └── Record[1..N](8 位记录号;gap>1h 拆分产物)
│       ├── WaveformRecord(master/segment 两层头;FLAC 信号)
│       │   ├── Segment[0..M](fs 可按段不同;多采样率通道)
│       │   └── SurrogateDatetime(base_datetime;与 MIMIC-IV 共享偏移)
│       └── NumericsTable(n.csv.gz;事件流;列跨患者不同)
└── MIMIC4Linkage(subject_id+hadm_id → Hosp/ICU/ED/CXR/Note;DUA)
    └── SharedDateShift(偏移量与临床库一致——直接对齐)

§4.2 记录枚举与索引构建(实战)

# 依赖:pip install wfdb pandas
import wfdb, pandas as pd, re

RECORDS = wfdb.get_record_list('mimic4wdb')   # 顶层清单
rows = []
for rec_path in RECORDS:
    # rec_path 形如 'waves/p100/p10014354/81739927'
    m = re.match(r'waves/p(\d{3})/p(\d{8})/(\d{8})$', rec_path)
    if m:
        bucket, subject_id, record_id = m.groups()
        rows.append({'record_path': rec_path,
                     'subject_id': int(subject_id),
                     'record_id': record_id,
                     'bucket': bucket})
df = pd.DataFrame(rows)
print(len(df), '记录;', df.subject_id.nunique(), '患者')  # 期望 ≈200 / 198
df.to_csv('mimic4wdb_index.csv', index=False)

§4.3 头文件与时间锚点(实战)

import wfdb, datetime

hdr = wfdb.rdheader('83411188', pn_dir='mimic4wdb/0.1.0/waves/p100/p10039708')
print('base_datetime:', hdr.base_datetime)   # 代理日期时间(与 MIMIC-IV 同偏移)
print('counter_freq:', hdr.counter_freq)     # 999.52 Hz
print('segments:', hdr.seg_name)             # segment 清单
print('sig_names:', hdr.sig_name)            # 全部可能信号
# 各 segment 采样率可能不同(多采样率体系)——逐段读 .hea 确认

§4.4 波形流式读取(实战)

import numpy as np, wfdb

def read_segment(pn_dir_path, segment, seconds=60):
    seg = wfdb.rdrecord(segment, pn_dir=pn_dir_path,
                        sampfrom=0, sampto=seconds * 250)  # 先按 ECG 250 Hz 上界取
    return seg.p_signal, seg.sig_name, seg.fs

data, ch, fs = read_segment('mimic4wdb/0.1.0/waves/p100/p10039708',
                            '83411188_0001')
# 注意:多采样率体系下同一 segment 内各通道 fs 一致(WFDB 约束),
# 通道级采样率差异通过"信号不参与"或内部重采样解决——读 .hea 的 fs 逐段确认

要点:FLAC 解码由 wfdb-python 自动处理(3.4.1+);老版本会报"unknown format"——升级而非手解。

§4.5 numerics 事件流读取(实战)

import csv, gzip, datetime, wfdb

def read_numerics_local(record, cols=('SpO2 [%]', 'HR')):
    """本地读法(全量下载后):gzip CSV 事件流 → (ticks, 值) 列表"""
    out = {c: [] for c in cols}
    with gzip.open(f'{record}n.csv.gz', 'rt') as gzf:
        for row in csv.DictReader(gzf):
            t = int(row['time'])                       # counter ticks
            for c in cols:
                v = row.get(c, '')
                if v:
                    out[c].append((t, float(v)))
    return out

def ticks_to_datetime(ticks, hdr):
    """官方换算:ticks → 秒 → base_datetime 偏移"""
    seconds = ticks / hdr.counter_freq                 # 999.52 Hz
    return hdr.base_datetime + datetime.timedelta(0, seconds)

要点:CSV 是事件流(无测量=无行)——下游统一网格(§5.2)由你选策略(前向保持/区间聚合),库不做隐式插值;远程读法可先 wfdb.dl_database 拉单患者目录或用 urllib 打开同路径。

§4.6 与 MIMIC-IV 临床库关联(实战核心)

"""
关联协议(须 MIMIC-IV DUA)——比 MIMIC-III 家族少一个还原层:
1) subject_id 硬关联:波形目录名 p10014354 → MIMIC-IV SUBJECT_ID = 10014354
2) hadm_id:经 MIMIC-IV admissions 表判记录所属住院
   (波形 base_datetime 与 admittime/dischargtime 直接可比——共享偏移!)
3) 时间对齐:波形样本 t → base_datetime + t/counter_freq → 与
   charttime/labtime 直接 join——无需任何偏移还原
4) 验证:numerics 的 HR vs MIMIC-IV icu chartevents 的 HR
   重叠时段相关抽检(同 487 号 §4.7 纪律,但期望"直接就对")
"""
# SELECT subject_id, hadm_id, admittime, dischtime
# FROM mimiciv_hosp.admissions WHERE subject_id = 10014354;
# 波形 base_datetime 落在 [admittime, dischtime] 内 → hadm 归属

方法学红利:487 号条目的 §4.6/§4.7 整套偏移还原+交叉校验协议在本库默认通过——这不是省了一次代码,是消灭了一整类错位 bug。

§4.7 数据血缘

BIDMC ICU 床旁 Philips 监护仪(MIMIC-IV 采集期 2008-2019)
  → 中央站局域网 → 专有关系库(固定天数后丢弃)
  → 每 24 小时横截面切片 → 文本/二进制归档
  → 解析/按患者整理 → WFDB + CSV → 去标识
     · subject_id/hadm_id(与 MIMIC-IV 同一代理 ID 体系)
     · 代理日期(与 MIMIC-IV 同一偏移)
     · FLAC 压缩 + dictzip
  → MIMIC-IV Waveform v0.1.0(2022-07-10;DOI a2mw-f949)
  ↕ parent:MIMIC-IV v2.0(10.13026/7vcr-e114)

§4.8 完整性清单

  • [ ] RECORDS 解析 → 记录/患者数核对(≈200/198)
  • [ ] 记录名正则覆盖率 100%(异常单列)
  • [ ] 每记录 master header:base_datetime/counter_freq/segment 清单
  • [ ] 各 segment fs 清点(多采样率矩阵:记录×通道×fs)
  • [ ] numerics 列名并集/交集统计 → 列映射表落盘
  • [ ] 环境验证:wfdb-python 解 FLAC 成功 + gzip CSV 读通
  • [ ] 患者级切分表(198 患者按 subject_id 切——预览版也要按患者切)
  • [ ] 若做临床关联:DUA 环境 + 共享偏移验证(抽 3 患者对时轴)

§4.9 列映射表构建(numerics 统一 schema)

def build_column_map(df_index, pn_dir_base='mimic4wdb/0.1.0/waves'):
    """200 条 numerics 的列名普查 → 统一 schema 映射表"""
    from collections import Counter
    col_counter = Counter()
    per_record = {}
    for _, r in df_index.iterrows():
        with gzip.open(f'{r.record_id}n.csv.gz', 'rt') as gzf:
            cols = next(csv.DictReader(gzf)).keys()
        per_record[r.record_id] = set(cols)
        col_counter.update(cols)
    # 统一 schema:高频列作标准列;低频列映射到语义等价类(如 ABPs/ABPm/ABPd)
    standard = [c for c, n in col_counter.items() if n >= 100]  # 阈值按需调
    return standard, per_record, col_counter

§4.10 患者级切分(实战)

def patient_split(df, seed=42):
    patients = df.subject_id.unique()          # 198 个
    rng = np.random.default_rng(seed); rng.shuffle(patients)
    n = len(patients)
    tr, va = patients[:int(n*0.8)], patients[int(n*0.8):int(n*0.9)]
    te = patients[int(n*0.9):]
    tag = lambda s: 'train' if s in tr else 'val' if s in va else 'test'
    df['split'] = df.subject_id.map(tag)
    return df
# 预览版纪律:198 患者切分后 test 仅约 20 人——报告必须给绝对数
# ("test AUROC 0.83(n=20 患者)"而非只给指标)

§4.11 PPG-ABP 配对段抽取(实战)

def extract_ppg_abp_pairs(record_path, win_s=10):
    """抽取 PPG+ABP 同段共存窗口(PPG-BP 产线原料;TransfoRhythm 清洗口径)"""
    hdr = wfdb.rdheader(record_path)
    rec_name = record_path.rsplit('/', 1)[1]
    pn_dir = '/'.join(record_path.split('/')[:-1])
    pairs = []
    for seg_name, seg_len in zip(hdr.seg_name, hdr.seg_len):
        if seg_name == '~':
            continue
        seg = wfdb.rdrecord(f'{rec_name}_{seg_name}', pn_dir=pn_dir,
                            sampfrom=0, sampto=seg_len)
        ch = {n: i for i, n in enumerate(seg.sig_name)}
        if 'PLETH' in ch and 'ABP' in ch:
            step = win_s * seg.fs
            for start in range(0, seg_len - step, step):
                w = seg.p_signal[start:start+step]
                if np.isnan(w).any() or w.std(axis=0)[[ch['PLETH'], ch['ABP']]].min() < 1e-3:
                    continue   # 平线/饱和/NaN 段剔除
                pairs.append({'seg': seg_name, 'start': start,
                              'ppg': w[:, ch['PLETH']], 'abp': w[:, ch['ABP']]})
    return pairs

§5 下游分析协议

§5.1 任务×资源速查表

任务 本库可完成度 说明
产线架构预演 ★★★★★ 12.8 GB 全量本地,端到端调通
PPG-BP 方法学 ★★★☆☆ 198 人功效有限;方法学论文可行(TransfoRhythm 先例)
250 Hz ECG 细节分析 ★★★★☆ 本库独有优势(MIMIC-III 波形 125 Hz 做不了)
多模态原型(+MIMIC-IV) ★★★★★ 共享偏移+DUA=最顺滑对齐链路
大规模预训练 ★☆☆☆☆ 等 v1.0;当前用 486 主库
工具链回归测试 ★★★★★ 教程样例+200 记录=解析层测试床

§5.2 多采样率对齐协议(本库特有)

  1. 统一目标网格:按任务选主网格(血流动力学任务 125 Hz;ECG 形态任务 250 Hz);
  2. 重采样纪律:降采样先抗混叠滤波(250→125 Hz 用低通截止 <62.5 Hz);升采样不增信息、避免(用插值仅限可视化);
  3. 时间轴:一切以 master header base_datetime + elapsed ticks 为唯一真源——禁止"按样本数对齐"跨段拼接(段间可能有 gap);
  4. numerics 网格化策略:事件流→目标网格用前向保持(临床测值语义)而非线性插值(化验值不可插);HR/SpO2 类连续测值可用 1.024 s 节拍直接对齐;
  5. 验收:同源双口径抽检(PPG 派生脉率 vs SpO2 列 pulse rate)相关抽检。

§5.3 PPG-BP 迁移协议(从 486/487 到本库)

"""
把 MIMIC-III 波形产线的 PPG-BP 协议迁移到本库的增量清单:
1) 采样率声明:PPG/ABP 仍 125 Hz——特征层不变
2) ECG 250 Hz:PTT 特征的 R 波定位精度提升——可复算旧结果验证增益
3) numerics:ABPs/ABPm/ABPd 从 CSV 取(不再从 WFDB numerics)——替代监督真值
4) 配对段筛选:ABP+PPG 同段共存记录(§3.9 A 层)——TransfoRhythm 口径
   (<15 分钟记录剔除、平线/高噪段剔除、Butterworth 0.7-10 Hz + MAF)
5) 功效声明:198 人 → 方法学论文 OK;基准排行榜论文等 v1.0
"""

§5.4 失败模式清单

  1. “10,000 当现状”:预告规模当实际规模引用——审稿必抓;
  2. 旧 WFDB 读 FLAC:unknown format 报错——升级工具链而非手写解码;
  3. 跨患者列名假设一致:CSV 列集不同→KeyError 或静默 NaN——列映射表(§4.9)前置;
  4. ticks 当秒用:时间差 999.52 倍缩放错误——一切换算走 counter_freq;
  5. 跨段按样本数拼接:段间 gap 被压缩成连续——按 base_datetime 对齐;
  6. 把 125 Hz 经验套到 250 Hz:ECG 通道超采样,特征窗口长度按 Hz 换算;
  7. 按记录切分:同患者多记录泄漏(83411188 与 85583557 即同患者双记录实例);
  8. 混用三代库命名分桶:30-39 / p00-p09 / p100-p199 三套体系脚本互串。

§5.5 报告模板:方法学段落骨架

我们使用 MIMIC-IV Waveform Database v0.1.0(200 记录/198 患者;12.8 GB)[Moody 2022, doi:10.13026/a2mw-f949],其波形经 subject_id/hadm_id 与 MIMIC-IV v2.0 [Johnson 2022] 互链,且共享代理日期偏移(波形与临床时间直接可比)。多采样率信号(ECG 250 Hz、PPG/ABP 125 Hz、Resp 62.5 Hz)经统一网格重采样对齐;numerics 事件流(counter ticks,999.52 Hz)按前向保持策略网格化。患者级切分(train/val/test,按 subject_id)。波形侧数据依 ODbL v1.0 获取;临床模块经 PhysioNet DUA(CITI 编号 XXXX)在合规环境处理。本库为技术预览版,本文结论限于方法学验证,统计功效声明见限制节。

§5.6 250 Hz ECG 特征协议(本库专项)

特征族 250 Hz 增益点 提取要点
QRS 形态(宽度/切迹) 定位精度 8→4 ms 逐拍窗口按 R 峰±100 ms
ST 段偏移 J 点定位更稳 R 峰+60~80 ms 基线回归
起搏脉冲检测 0.5-2 ms 窄脉冲可分辨 高通后阈值+不应期
QT/QTc T 波终末定位误差减半 逐拍+质量掩码
HRV(时域/频域) RR 间期量化更细 逐拍 HR 校验异常间期

声明纪律:报告 250 Hz 增益时给出对应特征的消融(§7.7 框架),不笼统写"更高精度"。

§5.7 队列注释产线(DUA 环境)

"""
为 198 患者构建临床注释层(论文 Table 1 自动化;经 MIMIC-IV 直连)
"""
def annotate_cohort(df_index, mimiciv):
    demo = mimiciv.patients.merge(mimiciv.admissions, on='subject_id')
    dx = mimiciv.hosp_diagnoses_icd.assign(
        dx_group=lambda d: d.icd_code.map(ICD_TO_GROUP))   # ICD-9/10 统一分组
    dx_agg = dx.groupby(['subject_id', 'hadm_id']).dx_group.apply(set)
    cohort = df_index.merge(demo, on='subject_id').join(dx_agg,
                    on=['subject_id', 'hadm_id'])
    # 共享偏移红利:anchor_year/anchor_age(MIMIC-IV 口径)直接可用
    return cohort
# 产出:subject_id | hadm_id | anchor_age | gender | dx_groups |
#       admittime(代理) | care_unit ——§7.5 分层与 Table 1 唯一真源

§6 实证结果与方法学分析

§6.1 预览版规模的实证含义

198 患者对统计功效意味着什么?以 PPG-BP 为例:TransfoRhythm 在清洗后 360 条记录上报告方法学结果——可行;但按 MIMIC-III 波形库经验(约 1/3 记录有可用 PPG+ABP 对),198 患者约产出 60-100 条可用配对记录(TransfoRhythm 清洗前 200 条口径),亚组分析(按年龄/用药)会迅速塌缩到个位数。预览版的正确贡献类型:解析协议、对齐验证、特征可重复性、模型架构调试——全部"方法学资本";把预览版当训练集刷指标,是用 198 人的噪声去赌 v1.0 的信用。

§6.2 三代库规模×体量的实证换算

库 记录 患者 体量 人均记录 人均体量
MIMIC-III Waveform 67,830 组 ~30,000 6.7 TB 2.26 组 235 MB
MIMIC-III Matched 22,317 10,282 ~1/3 库 2.17 ~230 MB
MIMIC-IV Waveform v0.1.0 200 198 12.8 GB 1.01 66 MB

人均体量下降的解读:v0.1.0 记录偏短(TransfoRhythm:多数 <1.5 h,MIMIC-III 波形多为数天)——预览版选择了"广撒少量"的发布策略(先覆盖架构语义而非时长深度),这也预示 v1.0 的数据分布可能与 MIMIC-III 波形显著不同——迁移研究要重做分布假设,不能默认继承。

§6.3 共享偏移的实证验证协议

“与 MIMIC-IV 共享偏移"是官方声明,使用前应抽样验证(DUA 环境):抽 3-5 名患者,取波形 base_datetime 与 MIMIC-IV admissions 的 admittime,检查"波形开始时刻是否落在住院期内且时分与 CHARTEVENTS 首条记录顺序自洽”。验证通过→对齐层直接上线;验证失败→检查是否读错 header(base_date vs base_datetime)或跨版本临床库(v2.0 vs 3.0 的偏移语义一致性)。把官方声明变成已验证事实,是多模态论文审稿的加分项。

§6.4 FLAC 与体量的实证账

12.8 GB 对应"200 记录×人均 1 记录×66 MB"——对比 MIMIC-III 波形人均 235 MB(125 Hz 统一)与 ECG 250 Hz 的翻倍采样,FLAC -8 级别的压缩率(生理信号典型 2-3:1)是 12.8 GB(而非 30-40 GB)的关键。实证结论:FLAC 让"笔记本全量"成为可能——预览版的可及性策略(零门槛下载+全量本地)直接受益于压缩选型,这反过来塑造了"技术预览传遍社区"的传播效率。

§6.5 八个真实坑点

  • 坑点 1 预览当全量:200 记录是技术预览,"10,000"是预告——两个数字进论文要分别标注状态;
  • 坑点 2 旧工具读 FLAC:WFDB 10.7.0+/wfdb-python 3.4.1+ 是硬门槛,libFLAC 先装;
  • 坑点 3 列名跨患者不同:numerics 无统一 schema——列映射表是必建资产;
  • 坑点 4 ticks 当秒:999.52 Hz 的 counter_freq 不除,时间全部缩放错 1.00048 倍(累积误差分钟级);
  • 坑点 5 base_date 与 base_datetime:新版头文件是完整 datetime 锚点,别沿用旧库"日期+时分分离"假设;
  • 坑点 6 250 Hz 当 125 Hz 用:ECG 通道特征窗口长度不减半的话,时间常数错一倍;
  • 坑点 7 同患者多记录:p10039708 下 83411188 与 85583557 是同一人的两次监护——按患者切分;
  • 坑点 8 偏移语义跨家族混用:本库与 MIMIC-IV 共享偏移 ≠ 与 MIMIC-III 共享——跨家族对齐仍需各自还原;
  • 坑点 9 "24 小时切片"边界想当然:归档按天批次、解析已重组——但边界核查(§6.13)是完备性加分项,勿默认无切缝。

§6.6 审稿人自查清单

  • [ ] 规模口径:200/198 现状 vs 10,000 预告分开陈述?
  • [ ] 版本与 DOI:v0.1.0(a2mw-f949)而非泛引?
  • [ ] 多采样率处理:统一网格协议(§5.2)显式描述?
  • [ ] ticks 换算:counter_freq 出现在方法学?
  • [ ] numerics schema:列映射/网格化策略可复现?
  • [ ] 患者级切分 + test 绝对数(约 20 患者)?
  • [ ] 共享偏移验证:§6.3 抽检报告?
  • [ ] 功效声明:预览版限定语(technical preview)出现?

§6.7 与 486/487 的关系治理

三代库在论文中的引用分工:信号方法学溯源引 486(主库);临床关联协议溯源引 487(matched);架构与前瞻引 488(本库)。跨库比较的公平性纪律:比较模型性能时声明各库版本与预处理差异(125 vs 250 Hz、1 Hz numerics vs 事件流);不要把 486 上的训练结果直接说成"MIMIC 波形结果"——三代库是三个数据集,不是三个版本号。

§6.8 许可的复利语义

ODbL v1.0 与 MIMIC 家族一脉相承:波形侧开放(本库全量零门槛)、临床模块 DUA 受控。本库的复利形态:12.8 GB 体量使"ODbL 阶段完成 95% 工程量"成为现实——连全量下载都能在一杯咖啡时间内完成,产线调试、课程教学、工具开发全部在开放侧闭环;DUA 只为最终的临床标签接入而开。这是 PhysioNet 用许可+体量双杠杆推动生态前置化的又一实例。

§6.9 教程驱动的社区校准

EMBC 2022 笔记本+wfdb.io 教程站构成了"官方参照实现"——社区产线与之逐字节对拍(教程样例记录的解析输出一致)即可自证正确。这一机制的实证价值:新格式(FLAC/CSV/ticks)的早期采纳期,错误解析极易悄悄发生(比如 ticks 缩放、列名遗漏)——参照实现的存在把"悄悄错误"变成"对拍失败",是预览版发布策略中容易被低估的质量基建。

§6.10 静态预览×动态路线的组合语义

v0.1.0 静态定稿 + v1.0 路线图预告,构成"当下可复现+未来可迁移"的组合:论文引用 v0.1.0 DOI 保证可复现;产线代码按 v1.0 兼容性编写(记录枚举/列映射写成数据驱动而非硬编码 200 条)——v1.0 上线日即迁移日。工程建议:所有"200"字样的断言集中在配置层(规模断言/记录清单哈希),核心代码零硬编码。

§6.11 从 487 号条目到本库:协议迁移映射表

487 协议(MIMIC-III Matched) 本库对应(MIMIC-IV Waveform) 状态
命名正则 pXXNNNN-日期-时分 pXXX/p100XXXXXX/8 位号 重写(更简单)
偏移还原层(SurrogateShiftResolver) 删除 架构性简化
numerics 交叉校验(§4.7) 抽样自洽检查(§6.3) 降级为验证
WFDB numerics 1 Hz 读取 gzip CSV 事件流+列映射 重写
患者级切分 同(subject_id) 直接复用
阻尼伪影掩码/事件标注 同(ABP 语义不变) 直接复用
分层评估矩阵 同(经 MIMIC-IV 注释) 直接复用

迁移语义:产线代码中"还原层"与"交叉校验"两个模块被归档而非删除——v1.0 后若出现偏移语义变化(版本治理),它们是现成的保险。

§6.12 记录时长分布的实证影响

预览版记录偏短(多数 <1.5 h;部分 >15 h)对三类研究的影响:短时窗任务(PPG-BP 片段抽取/心律检测)——完全够用甚至更高效(少下载);中时窗任务(1-4 h 预警)——勉强,需精选长记录;长时程任务(24 h 轨迹/日节律)——不可行,等 v1.0 或回 486。论文选题前的第一件事:按 §3.9 普查时长分布,对照任务时窗——分布不匹配的任务换库,不硬做。

§6.13 "24 小时切片"边界的实证核查

§2.13 提到的天级批次切缝可用数据自检:对每记录首尾各 60 秒检查信号是否存在"人为截断特征"(信号在整日时刻附近骤断且无配置变更证据)。若切缝比例显著,长记录重建协议需加"跨批次边界拼接核查"步骤。预览版 200 记录的人工核查成本近乎为零——这正是预览版作为"架构验证场"的价值:把此类边界问题在 200 记录上穷尽,v1.0 的万级记录才能自动处理。

§7 AI 就绪指南与应用场景

§7.1 四种喂法

  1. 全量本地小库快跑:12.8 GB 全量入盘,快速迭代解析/对齐/训练全链路;
  2. 波形+MIMIC-IV 直连(DUA):subject_id+共享偏移,最顺滑多模态原型;
  3. 250 Hz ECG 专项:高频形态/起搏脉冲/ST 细节——MIMIC-III 波形做不了的题;
  4. 测试床模式:200 记录当解析层回归测试集(对拍 EMBC 笔记本),产线 CI 集成。

§7.2 两段式迁移配方(预览版校准→v1.0 放量)

阶段 A(今天,v0.1.0):
  数据层:200 记录全量本地 → §4.2 索引 → §4.9 列映射表
  解析层:wfdb-python(FLAC) + gzip CSV + ticks 换算——全部通过 §6.9 对拍
  对齐层:§5.2 多采样率协议 + §4.6 共享偏移直连(DUA)
  模型层:小规模端到端验证(过拟合 10 记录的自检→200 记录完整轮)
阶段 B(v1.0 发布日):
  换索引(枚举代码零改动)→ 分布重检(§6.2 提示的时长分布差异)
  → 功效重算 → 全量训练
验收闸门:阶段 A 的解析层在 v1.0 抽样记录上零修改通过

§7.3 TransfoRhythm 案例复盘

首个使用 MIMIC-IV Waveform 的公开方法学研究(arXiv 2404.15352)路径复盘:PPG 独立(无 ECG)血压估计 Transformer——数据清洗(<15 分钟剔除/平线高噪段剔除→360 条纯净记录)→ 滤波(Butterworth 0.7-10 Hz + 滑动平均)→ SDPPG 二阶导 12 特征 → 类平衡(低/高血压事件增广)。可借鉴点:预览版体量上的严谨清洗声明(200→360 条的口径演化全程公开);需注意点:其"v2.0"指 MIMIC-IV 临床库版本语境(波形库本身 v0.1.0)——跨论文引用版本号时校对语义。该案例证明:预览版+方法学创新=可发表贡献,不必等 v1.0。

§7.4 成本与排期模板

阶段 工作 人日 门槛
P0 环境与下载 libFLAC/wfdb-python + 12.8 GB 0.5 无
P1 解析层+对拍 §4.2-4.5 + EMBC 对拍 2-3 无
P2 列映射+普查 §4.9/§3.9 1-2 无
P3 对齐协议 §5.2 多采样率 2-3 无
P4 DUA+直连验证 §4.6/§6.3 5-15(含审批) DUA
P5 端到端原型 §7.2 阶段 A 5-8 —
合计 16-32 人日 双轨

§7.5 公平性与域偏差声明

  • 单中心:BIDMC 一家(与 MIMIC-IV 同域)——跨中心外推声明必写;
  • 预览版选择偏倚:200 记录的入选机制未公开细节——按"非随机样本"保守声明;
  • 记录偏短:多数 <1.5 h(TransfoRhythm 报告)——长时程任务(24 h 预警)在预览版上不可评估;
  • 成人 ICU:无新生儿子集声明(MIMIC-III 波形含 NICU)——儿科结论不可迁移;
  • 时代:2008-2019 采集期——设备代际偏倚与 486 相同量级。

§7.6 泄漏防控专项

198 患者的切分泄漏风险与 487 同构(人均 1.01 记录——泄漏面小于 matched,但同患者多记录实例确凿存在:p10039708 双记录)。专项规则:(1) 患者级切分强制;(2) 报告三 split 的患者绝对数(test≈20);(3) DUA 阶段的标签穿越同 487 §7.6(出院诊断不可作输入);(4) 与 MIMIC-IV 模块联合时,同一 subject_id 的一切模块数据只能落在该患者的单一 split——模块族互链越顺滑,跨模块泄漏越隐蔽。

§7.7 消融案例:250 Hz 的真实增益

PTT 特征(ECG R 波→PPG 波足时延)在本库的可检验优势:ECG 从 125→250 Hz 使 R 波定位时间分辨率从 8 ms→4 ms。消融设计:同一配对段、同一 PPG 通道,双采样率 ECG 版本各算 PTT→血压估计误差对比。预期:误差差值在 1-2 mmHg 量级(R 波定位误差占比小的任务)到显著(高心率/宽 QRS 场景)。方法学结论:250 Hz 的增益是"通道依赖"的——论文声明采样率优势时应给出对应通道的消融,而非笼统"更高更准"。

§7.8 多模态产线骨架(代码)

"""
MIMIC-IV Waveform 多模态产线骨架
设计原则:规模无关(200→10,000 零改码)+ 三代库可插拔
"""
class WaveformPipeline:
    def __init__(self, index_csv, column_map):
        self.index = pd.read_csv(index_csv)       # §4.2(规模无关)
        self.colmap = column_map                   # §4.9(列名语义层)

    def stream(self, subject_ids):
        for _, r in self.index[self.index.subject_id.isin(subject_ids)].iterrows():
            hdr = wfdb.rdheader(r.record_id, pn_dir=r.pn_dir)
            yield {'meta': r, 'hdr': hdr}          # base_datetime/counter_freq

    def to_grid(self, wave, numerics, grid_hz=125):
        # §5.2:多采样率→统一网格;numerics 事件流→前向保持
        ...

    def attach_clinical(self, sample, mimici4):
        # §4.6:subject_id 直连 + base_datetime 直比(共享偏移,无还原层)
        ...

§7.9 消融案例:numerics 网格化策略

同一预警模型两组输入:(a) numerics 事件流前向保持(保留测量时刻语义);(b) 线性插值到 1 Hz 网格(“看起来整齐”)。预期:低频测值(NIBP 每 15-60 分钟)在 (b) 下产生大量插值伪测值——模型把"插值平台"当真实血压平台学习,验证集虚假稳健、外部数据崩溃。结论:事件流网格化策略是多模态论文的新审查点(MIMIC-III 时代"1 Hz 网格"是库级默认,MIMIC-IV 时代它是一个研究者的选择——选择就要辩护)。

§7.10 报告与复现包模板

repro_package/
├── data/
│   ├── mimic4wdb_index.csv          # §4.2 索引(可公开)
│   ├── column_map.json              # §4.9 列映射(可公开)
│   └── QUALITY_PROFILE.md           # §3.9 分层
├── src/
│   ├── enumerate_records.py         # 规模无关枚举
│   ├── ticks_time.py                # counter_freq 换算(唯一时间真源)
│   ├── multirate_align.py           # §5.2
│   └── mimic4_join.py               # §4.6(DUA 环境专属)
├── tests/
│   └── test_embc_parity.py          # §6.9 教程对拍(CI 强制)
├── docs/
│   ├── DUA_COMPLIANCE.md
│   └── CALIBER_NOTES.md             # §3.2 口径存照(200 vs 10,000)
└── results/
    └── ablation_250hz.csv           # §7.7

§7.11 教程对拍测试(解析层 CI)

def test_embc_parity():
    """解析层回归测试:与 EMBC 笔记本同记录同输出(CI 强制)"""
    # 用官方教程引用的样例记录(如 p10039708/83411188)
    hdr = wfdb.rdheader('83411188', pn_dir=TEST_PN_DIR)
    assert hdr.counter_freq == 999.52
    assert hdr.base_datetime is not None
    n = read_numerics_local('83411188', cols=('SpO2 [%]',))
    # 笔记本首行输出对拍(示例语义):首个 SpO2 事件时间/值一致
    t0, v0 = n['SpO2 [%]'][0]
    assert t0 == EXPECTED_T0 and v0 == EXPECTED_V0
    # FLAC 解码对拍:波形首 1000 样本与笔记本缓存逐字节一致
    ...
# 任何解析层改动必须过此测试——预览版新格式的"悄悄错误"防线(§6.9)

§7.12 v1.0 兼容性编码规范

规模断言集中化:所有 "200"/"198" 只出现在 config.py(记录数断言/清单哈希)
枚举数据驱动:record 列表来自 RECORDS 文件解析,不硬编码
列映射外置:column_map.json 版本化(v1.0 后重普查即可)
时间真源唯一:ticks 换算函数全局单点(禁止散落 timedelta)
命名适配器化:enumerate/parse 按库类型注入(三代库可插拔)
切分函数复用:patient_split(subject_id) 与库无关
验收:v1.0 抽样 20 记录 → 解析层零修改通过 → 全量切换

§8 伦理、许可与合规

§8.1 许可结构

资产 许可 门槛 义务
波形+numerics(本库) ODbL v1.0 无 署名引用;ODbL 传染性
MIMIC-IV 临床模块 PhysioNet DUA CITI+机构协议 禁再识别/禁转分发
联合产物 双许可叠加 — 按数据来源分别遵守

§8.2 引用与致谢模板

波形数据:Moody B, Hao S, Gow B, Pollard T, Zong W, Mark R. MIMIC-IV Waveform Database (version 0.1.0). PhysioNet, 2022. doi:10.13026/a2mw-f949。
临床数据:Johnson A, Bulgarelli L, Pollard T, Horng S, Celi LA, Mark R. MIMIC-IV (version 2.0). PhysioNet, 2022. doi:10.13026/7vcr-e114(经 PhysioNet DUA 获取,CITI 认证编号 [填写])。
工具:WFDB Software Package 10.7.0(doi:10.13026/gjvw-1m31);wfdb-python 3.4.1(doi:10.13026/egpf-2788)。
伦理声明:数据收集经 BIDMC 与 MIT IRB 批准并豁免个人知情同意;本研究未尝试任何再识别。

§8.3 再识别风险的显式讨论

本库去标识三件套:subject_id/hadm_id 代理体系(与 MIMIC-IV 共享)、代理日期(共享偏移)、记录内 elapsed time 计时。与 487 相同的侧信道风险结构(公开波形+受控临床的拼接风险),缓解亦同(DUA 门禁+再识别禁令)。新增风险点:共享偏移意味着"从临床库的偏移量可推波形代理日期"(同患者)——但两库都在 DUA/去标识体系内,该一致性恰是设计目标;风险边界在于禁止把偏移量本身用于库外身份关联。使用者义务与 487 §8.3 一致:不发布缩小个体范围的衍生索引。

§8.4 合规环境核查清单(DUA 阶段)

  • [ ] CITI 人体受试者保护培训证书在有效期内(全员)
  • [ ] 机构 DUA 已签署并归档(覆盖 MIMIC-IV 全模块)
  • [ ] 临床模块数据(Hosp/ICU 等)仅存于隔离环境(与公开波形侧物理/逻辑分离)
  • [ ] 共享偏移验证报告(§6.3)已存档——作为"直接对齐"的合规依据
  • [ ] 衍生产物分级:仅波形衍生→ODbL 可公开;含临床数据→DUA 约束、不外传
  • [ ] 论文数据可用性声明含 CITI 编号与访问途径(§8.2 模板)
  • [ ] 团队成员变动时的访问回收流程
  • [ ] 禁止再识别与禁止转分发的培训记录

双轨纪律:波形侧(ODbL)环境与临床侧(DUA)环境的分离不是形式主义——它是"教学在开放侧、科研在受控侧"生态分工的技术保障;一旦两侧数据在同一环境混合,整个环境的合规等级按最高约束计算。

§9 常见问题(FAQ)

Q1 MIMIC-IV Waveform 和 MIMIC-III Waveform 什么关系?

不是简单升级,是架构重设计(多采样率/FLAC/CSV numerics/共享偏移/模块化互链)。数据采集期也不同(MIMIC-IV 期 2008-2019 vs MIMIC-III 期 2001-2012)。

Q2 为什么只有 200 条记录?

v0.1.0 是技术预览版(官方原文 technical preview),先让社区验证架构,v1.0.0 预告约 10,000 记录。

Q3 v1.0 什么时候发布?

官方仅说"shortly"(2022 年口径);截至本文核查(2026-09)PhysioNet 版本列表仍为 0.1.0。以官方页面为准,勿引用预告当现状。

Q4 250 Hz 和 125 Hz 差在哪?

本库按信号物理特性分率:ECG 250 Hz(形态细节)、PPG/ABP 125 Hz、Resp 62.5 Hz。MIMIC-III 波形统一 125 Hz。

Q5 counter ticks 是什么?

监护仪内部计数器时间(999.52 Hz≈1 ms/tick)。换算:seconds=t/counter_freq,再加 base_datetime 得挂钟时间。单调、无墙钟跳变。

Q6 numerics 为什么改成 CSV?

承认测值的不规则采样本质(NIBP 每 5-60 分钟、SpO2 每 1.024 秒)——事件流比假网格更诚实。代价是列名跨患者不同、需自建映射。

Q7 FLAC 压缩会损失数据吗?

不会。FLAC 是无损压缩(-8 -r8 -e 参数),解压逐样本一致。只是读取工具需支持(wfdb-python 3.4.1+ 自动处理)。

Q8 代理日期和 MIMIC-IV 一致是什么意思?

同一患者加同一随机偏移——波形 base_datetime 与临床 charttime 直接可比,无需还原层(MIMIC-III 家族需要)。

Q9 记录名怎么解读?

waves/p100/p10014354/81739927:p100=subject_id 前三位分桶;p10014354=8 位 subject_id;81739927=8 位记录号。同患者多记录同居一目录。

Q10 numerics 的时间怎么换算?

官方示例:t=int(row['time']); seconds=t/header.counter_freq; dt=header.base_datetime+timedelta(0,seconds)。

Q11 能和 MIMIC-III 波形库混用脚本吗?

解析层不行(FLAC/CSV/ticks/命名三套体系);模型层可以。分库适配器+统一内部 schema 是正解。

Q12 需要下载全量吗?

12.8 GB——预览版的奢侈:全量本地可行。也可 pn_dir 流式按需读。

Q13 有官方教程吗?

IEEE EMBC 2022 workshop 笔记本(mimic.mit.edu)+ wfdb.io/mimic_wfdb_tutorials。笔记本可执行、可当回归测试基准。

Q14 DUA 是给谁的?

波形侧 ODbL 不需要;MIMIC-IV 临床模块(Hosp/ICU 等)需要(CITI+签署)。联合分析才用 DUA。

Q15 同一患者有多条记录吗?

有。p10039708 有 83411188 与 85583557 两条——多次监护会话。切分按 subject_id。

Q16 TransfoRhythm 是什么?

首个用本库的公开方法学研究(arXiv 2404.15352):PPG 独立血压估计 Transformer,198 人清洗后 360 条纯净记录。证明预览版可发方法学论文。

Q17 和 MIMIC-IV-ECG 什么分工?

MIMIC-IV-ECG=独立 10 秒 12 导诊断级静息 ECG(数百万条);本库=床旁连续多参数监护波形。诊断任务用前者,血流动力学/多模态用后者。

Q18 gap 拆分规则还在吗?

在。gap>1 小时自动拆分(防跨患者混入),与 MIMIC-III 波形同逻辑。

Q19 引用 DOI 用哪个?

本库 10.13026/a2mw-f949(v0.1.0);MIMIC-IV 10.13026/7vcr-e114(v2.0);工具链 DOI 见 §8.2。

Q20 采样率 1.024 秒节拍是什么?

HR/SpO2 等派生测值按监护仪内部 1.024 秒节拍产出(非整 1 秒)——跨库对齐 numerics 时间粒度时注意 2.4% 节拍差。

Q21 可以做新生儿研究吗?

本库无新生儿子集声明(MIMIC-III 波形含 NICU)。儿科结论不可迁移。

Q22 记录一般多长?

预览版记录偏短:多数 <1.5 小时、部分多记录 >15 小时(TransfoRhythm 报告)。长时程任务等 v1.0。

Q23 怎么验证解析代码正确?

与 EMBC 笔记本对拍(同一记录同一输出)——官方参照实现即回归测试基准(§6.9)。

Q24 偏移量能从波形侧反推吗?

禁止尝试(再识别禁令)。共享偏移的设计目标是库内对齐,不是库外身份关联(§8.3)。

Q25 和 VitalDB 比怎么选?

手术室人群/VitalDB;ICU 人群+MIMIC-IV 生态互链/本库。多中心比较两者都进。

Q26 训练集怎么切?

按 subject_id(198 人 80/10/10)——test 约 20 人,报告必须给绝对数。

Q27 250 Hz ECG 能分析起搏脉冲吗?

可以——250 Hz 是本库相对 MIMIC-III 波形(125 Hz)的核心优势之一(高频形态细节)。但注意部分起搏脉冲更宽,需逐案验证。

Q28 能跑大规模预训练吗?

预览版体量不支持(200 记录)。预训练用 486 主库(67,830 组),本库做架构校准。

Q29 患者级泄漏怎么防?

同患者多记录+DUA 模块联合是两大泄漏面——subject_id 全域一致性切分(§7.6)。

Q30 base_datetime 是真实时间吗?

是代理时间(随机偏移后)。真实日期被抹除;患者内相对时序完整(共享偏移保证与 MIMIC-IV 一致)。

Q31 12.8 GB 是压缩前还是后?

官方口径"Total uncompressed size: 12.8 GB"——未压缩总量(FLAC 文件解压后)。下载体积更小。

Q32 segment 之间有 gap 吗?

可能有(监护中断/配置变更)。按 master header 样本坐标遍历(含空档 segment),禁止按文件顺序连字节。

Q33 能和 MIMIC-CXR 联用吗?

经 subject_id/hadm_id 理论可联(模块族设计)——但时间对齐(胸片时刻 vs 波形时刻)需自行验证覆盖度,无官方联合协议。

Q34 论文数据可用性声明怎么写?

波形:公开(ODbL,DOI);MIMIC-IV 模块:受控(DUA+CITI 编号);代码:复现包+EMBC 对拍测试。三段式。

Q35 为什么说本库是"蓝图"?

200 记录=样板间,展示新架构全部语义(多采样率/FLAC/CSV/ticks/共享偏移)——今天在 12.8 GB 上调通产线,v1.0 放量日即切换日(§1.9/§7.2)。

Q36 工具链最低版本?

WFDB Software Package 10.7.0(libFLAC 前置);wfdb-python 3.4.1+。旧版读 FLAC 报 unknown format。

Q37 列映射表怎么做?

普查 200 条 numerics 的列名并集/频次→标准列+语义等价类(§4.9)。这是 v1.0 前的一次性资产。

Q38 段内采样率一致吗?

WFDB 约束单 segment 内各通道同 fs;跨 segment 可不同(多采样率体系)——逐段读 .hea 的 fs。

Q39 能复现 MIMIC-III 波形上的模型结果吗?

数据分布不同(时长/人群期/采样率)——同架构重训可、结果数值不可期待一致。跨库比较需显式声明(§6.7)。

Q40 有 AWS 镜像吗?

有(PhysioNet Open Data)。按需拉取比 wget 全量更省带宽。

Q41 记录时长怎么算?

master header 的 seg_len 累加/fs。注意段间空档(~ segment)计入时间轴。

Q42 QRS/ST/QT 派生值在波形里吗?

不在波形文件里——那些是监护仪派生 numerics(CSV 列)。波形里只有原始信号;派生值可作交叉校验。

Q43 怎么统计人均记录数?

索引表 groupby subject_id。v0.1.0 人均 1.01(200/198)——v1.0 预计上升。

Q44 预览版会撤下吗?

PhysioNet 版本页保留所有版本——v1.0 上线后 0.1.0 仍可引用(历史论文可复现)。

Q45 和 MIMIC-III 波形库的记录能配对吗?

不能。采集期不同(2001-2012 vs 2008-2019)、患者 ID 体系不同——两库无患者重叠映射。跨库是"方法学比较"不是"样本合并"。

Q46 共享偏移下波形和临床的时刻完全一致吗?

同一偏移量意味着可比,但监护仪内部时钟与病历系统时钟存在设备级偏差(分钟级)——联合分析仍建议保留 §6.3 的自洽抽检,设备时钟漂移是物理现实。

Q47 1.024 秒节拍怎么对齐到 1 秒网格?

就近对齐(最近邻),最大漂移 0.512 秒——在方法学里声明漂移上界即可;需要亚秒精度的任务直接用 ticks 原生时间轴。

Q48 为什么 numerics 列名各不相同?

监护仪按实际配置输出测值(有的患者有 CVP/ICP,有的没有)——事件流如实反映配置差异。列映射表(§4.9)+ 语义等价类是标准解。

Q49 v1.0 发布后本文协议还有效吗?

有效——协议按"规模无关+适配器化"编写(§7.12),v1.0 主要是记录数增加与可能的列名扩展;核心语义(多采样率/FLAC/CSV/ticks/共享偏移)预计稳定。

Q50 预览版论文的审稿风险点?

功效质疑(198 人)——用"方法学论文"定位+§6.1 语境防御;版本时效(v1.0 未出)——用 DOI 精确引用+复现包防御。两者都有先例(TransfoRhythm)可引。

Q51 天级切片会切断我的记录吗?

解析整合后的记录是连续时间轴的(切片发生在归档层,解析时已按 PatientId+时间重组);边界核查(§6.13)是完备性加分项而非必需项。

Q52 这个库适合课程教学吗?

非常适合:12.8 GB 单机全量+官方笔记本+ODbL 零门槛——数据工程/生理信号课程的理想教材;学生可完整经历"下载→解析→对齐→建模"全链路而不碰任何合规红线(教学阶段不出波形侧)。

Q53 波形侧能发衍生可视化/基准网站吗?

能(ODbL 允许衍生与再分发,同许可传染)——但不得附加缩小个体范围的信息(§8.3),并保留 PhysioNet 署名与 DOI 链接;基准网站建议同时发布评测脚本保证可复现。

Q54 报告里写"MIMIC-IV Waveform 包含约 10,000 条记录"对吗?

不对——这是预告值。正确表述:“v0.1.0 技术预览版包含 200 条记录(198 名患者);官方预告 v1.0.0 将扩展至约 10,000 条记录”。现状与预告分开陈述(§3.2 口径纪律)。

Q55 怎么快速看一条记录里有什么信号?

读 master header 的 sig_name(全部可能信号)+ 逐 segment 的 sig_name(实际出现的)——两者差异即"声明但未启用"的通道。PhysioBank ATM 网页版可直接可视化,零代码快速目检;脚本化清点用 §4.2 索引+§4.3 header 读取,200 条记录秒级完成。

§10 存照与溯源

§10.1 口径存照

声明数字 口径 源
200 / 198 v0.1.0 记录/患者数 官方页面+release notes
12.8 GB 未压缩总量 PhysioNet Files 页
2022-07-10 v0.1.0 发布日 PhysioNet Versions
约 10,000 v1.0.0 预告规模(非现状) 官方 release notes 原文
10.13026/a2mw-f949 v0.1.0 DOI 官方页面
10.13026/6269-ws81 latest 概念 DOI 官方页面
250/125/62.5 Hz ECG/PPG·ABP/Resp wfdb.io 教程
999.52 Hz / 1.024 s counter_freq / 派生节拍 wfdb.io 教程
FLAC -8 -r8 -e / dictzip 压缩参数 官方页面
共享偏移(matches MIMIC-IV) 去标识语义 官方页面原文
ODbL v1.0 / IRB 豁免 许可/合规 官方页面
MIMIC-IV v2.0 parent 上游(7vcr-e114) 官方 Parent Projects
多数 <1.5 h / 360 条纯净记录 TransfoRhythm 口径 arXiv:2404.15352
p10039708 双记录示例 命名/多次会话实例 wfdb.io formatting 页
counter_freq=999.52 Hz 实测断言 §7.11 对拍测试基线 EMBC 笔记本
无新生儿子集 人群范围声明 官方页面(成人 ICU 语境)

§10.2 引文清单

  1. Moody B, Hao S, Gow B, Pollard T, Zong W, Mark R. MIMIC-IV Waveform Database (version 0.1.0). PhysioNet, 2022. doi:10.13026/a2mw-f949
  2. Johnson A, Bulgarelli L, Pollard T, Horng S, Celi LA, Mark R. MIMIC-IV (version 2.0). PhysioNet, 2022. doi:10.13026/7vcr-e114
  3. Xie C, McCullum L, Johnson A, Pollard T, Gow B, Moody B. Waveform Database Software Package (WFDB) for Python (version 3.4.1). PhysioNet, 2021. doi:10.13026/egpf-2788
  4. Moody G, Pollard T, Moody B. WFDB Software Package (version 10.7.0). PhysioNet, 2022. doi:10.13026/gjvw-1m31
  5. Goldberger AL, et al. PhysioBank, PhysioToolkit, and PhysioNet. Circulation 2000;101(23):e215-e220
  6. TransfoRhythm: A Transformer Architecture Conductive to Blood Pressure Estimation via Solo PPG Signal Capturing. arXiv:2404.15352(2024)
  7. Charlton P, et al. MIMIC-IV Waveform IEEE EMBC Workshop tutorial materials. mimic.mit.edu, 2022
  8. wfdb.io. MIMIC Waveform tutorials: Database Structure / Waveform Data Formats(访问日期 2026-09-20)

§10.3 与本系列其他条目的关系

条目 关系
486 MIMIC-III Waveform Database 前代波形主库:大样本训练主力;本库是架构继任者
487 MIMIC-III Waveform Matched 前代匹配桥:偏移还原协议在本库被共享偏移取代
490 MIMIC-III Clinical Database 前代临床库(与本库无互链)
492 MIMIC-IV parent project:subject_id/hadm_id/偏移的上游;模块族中枢
VitalDB 横向对照:手术室人群;多中心比较素材
MIMIC-IV-ECG 同族分工:诊断级静息 ECG vs 本库连续监护波形
MIMIC-IV-ED / MIMIC-CXR / Note 模块族延伸:经 subject_id/hadm_id 可联(覆盖度自验)

§10.4 变更日志

日期 事项
2022-07-10 v0.1.0 发布(DOI 10.13026/a2mw-f949;200 记录技术预览)
2022-07 IEEE EMBC workshop 教程发布
2026-09-20 本条目完成事实核查与撰写(千方病案医数集 order 488);核查时点版本列表仍为 0.1.0
持续 v1.0.0 路线图跟踪(约 10,000 记录);发布后按 §7.2 两段式迁移

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mimic3wdb — 共享标签:生理信号 / 电子健康记录
  • mimic3wdb-matched — 共享标签:生理信号 / 电子健康记录
  • shhs — 共享标签:生理信号 / 电子健康记录
  • mros-sleep — 共享标签:生理信号 / 电子健康记录
  • nsrr — 共享标签:生理信号 / 电子健康记录
  • pulsedb — 共享标签:生理信号 / 电子健康记录
  • sicdb — 共享标签:生理信号 / 电子健康记录
  • mc-med — 共享标签:生理信号 / 电子健康记录
  • cinc-2015 — 共享标签:生理信号 / 电子健康记录
  • mover — 共享标签:生理信号 / 电子健康记录

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集