浙江重症监护数据库 — 省人民医院 EHR 数据集 AI-Ready Wikipedia

浙江重症 EHR 库:7,638 名患者 × 8,180 次住院 × 11,082,482 条检验记录——中国三级医院十年重症数据,3.22 GB 全开放下载

来源 https://physionet.org/content/zhejiang-ehr-critical-care/1.0/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 37
浙江重症监护数据库 — 省人民医院 EHR 数据集 AI-Ready Wikipedia

信息速览

数据集名称浙江重症监护数据库 — 省人民医院 EHR 数据集 AI-Ready Wikipedia
数据类型7,638 名患者,8,180 次住院,11,082,482 条检验记录,214 种检验项目,3.22 GB 全开放下载
规模7,638 名独立患者 / 8,180 次住院
接入方式https://physionet.org/content/zhejiang-ehr-critical-care/1.0/
AI 就绪度

Chinese Critical Care Database (Zhejiang Provincial People’s Hospital) — AI-Ready 数据集百科

一句话:这是中国三级医院重症数据里少见的全开放样本——浙江省人民医院 2012 年 1 月至 2022 年 5 月间的 7,638 名 ICU 患者、8,180 次住院,拆成 10 张关系表,含 1,108 万条检验记录 与一张罕见的独立抗菌药物敏感性表(带 MIC 值)。它不需要 DUA,能直接下载。

INFOBOX

属性 值
官方名称 Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center
发布方 PhysioNet
版本 v1.0(初版,2023-01-19 发布)
DOI 10.13026/901c-yv54
RRID SCR_007345
数据来源医院 浙江省人民医院(Zhejiang Provincial People’s Hospital)
页面作者 Senjun Jin, Lin Chen, Kun Chen, Zhongheng Zhang
论文作者 Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z(6 人)
关联论文 Scientific Data (2023),DOI 10.1038/s41597-023-01952-3
患者数 7,638
住院数 8,180
时间跨度 2012-01 至 2022-05(约 10 年 4 个月)
数据表 10 张(官方摘要另称 11 张,存照 A)
检验记录 11,082,482 条 / 214 种项目
总大小 约 3.22 GB
ICU 2 个(综合中心 ICU + 急诊 ICU/EICU)
性别构成 男 5,215(63.8%)/ 女 2,965(36.2%)
住院日中位 17 天(Q1-Q3:10-28)
出院状态 治愈 73% / 未治愈 16% / 死亡 6% / 未知 6%
去标识化 HIPAA 标准;patient_SN 随机分配,不可回溯
访问级别 开放获取(无需 DUA)
许可 页面未明确具体协议名(存照 D)
伦理审批 浙江省人民医院伦理委员会 QT2022185
代码 github.com/zh-zhang1984/ZhejiangProvinceICU
资助 浙江省卫健委青年人才 2019323925;医路革新-液体治疗 YLGX-ZZ-2020005;浙江省健康科技 2021KY745
适合任务 重症预测建模、模型外部验证、抗菌药耐药研究、因果推断、成本效益分析

§0 速览与信任声明:为什么这座 3.22 GB 的宝库值得认真对待

中国的重症医学数据长期面临一个两难:数据量大但未开放,或开放但规模极小。临床医生手里的信息系统里睡着海量真实数据,但受限于法规、伦理、机构意愿,几乎没有一条通路能让外部研究者用上。这导致一个尴尬的局面——中国重症研究在国际上的可复现性一直偏弱,因为没有人能拿到能复现的数据。

498 这组数据是一个明确的突破:它是中国三级医院的重症数据库,而且完全开放。

三条速览结论:

  1. 它的开放程度在中国重症数据里是罕见的。同系列的 495(Paediatric Intensive Care database,浙江大学医学院附属儿童医院)虽然是"首个免费英汉双语临床数据库",但仍需完成人体受试者培训或 GCP 认证并签署 DUA,审批约 3 个工作日。而 498 是 Openly accessible——打开即下载,没有审批流程。这个差别对研究的可达性影响极大。
  2. 它有一张别的库都没有的表:抗菌药物敏感性(DrugSens)。这张表不只记录"该菌对某药敏感还是耐药",还带 MIC(最小抑菌浓度)值。这意味着它可以直接支撑抗菌药物耐药性(AMR)研究——这是全球公共卫生的头号威胁之一,而公开数据极少。MIMIC 系列没有独立的药敏表,495 也没有。
  3. 它的设计有清晰的重症语义。10 张表里,HospitalTransfer(院内转科)是识别 ICU 住院的机制,MedOrder(医嘱)与 Medication(用药)被分开——前者是"医生开立",后者是"实际执行"。这种细分体现了对临床工作流的深入理解。

必须立刻说清的边界:

  • 它是单中心数据(浙江省人民医院),外推性有其固有局限;
  • 它明示存在缺失值与错误——官方自己写在页面上,使用者不能假设数据干净;
  • 日历日期被移除,官方明示无法做时间趋势研究;
  • 表数量在官方页面内部矛盾(摘要 11 张 vs 表 2 的 10 张)。

0.1 名称、作者与范围勘误

三点必须说清:

  • 名称:官方全称很长(“Establishment of a Chinese critical care database…”),实际引用时通常简称为 Zhejiang ICU database 或 Zhejiang Province ICU。代码仓库名即 ZhejiangProvinceICU。
  • 作者名单不一致:PhysioNet 页面署名 4 人(Jin S, Chen L, Chen K, Zhang Z),原始 Sci Data 论文署名 6 人(多 Hu C、Hu S)。引用时以你实际使用的来源为准(存照 B)。
  • 表数量矛盾:摘要写 11 张,正文与表 2 列 10 张。本条目采用 10 张(以表 2 实证为准,存照 A)。

0.2 一分钟版本(给赶时间的管理者)

  • 这是什么:中国浙江省人民医院的开放获取重症 EHR 数据库;
  • 覆盖多久:2012 年 1 月至 2022 年 5 月,跨十年;
  • 规模多大:7,638 名患者、8,180 次住院、1,108 万条检验、3.22 GB;
  • 数据在哪:PhysioNet(DOI 10.13026/901c-yv54);
  • 门槛多高:没有门槛——开放获取,下载即用;
  • 最亮的点:独立的抗菌药物敏感性表(含 MIC 值),这是 MIMIC 与 PIC 都没有的;
  • 最大的坑:官方明示数据有缺失与错误;日历日期被移除,不能做时间趋势研究;单中心。

0.3 与本系列既有条目的关系

条目 关系
495 Paediatric Intensive Care (PIC) 最直接的对照:同为中国重症库,PIC 是儿科(ZUCH)+ 需 DUA + 双语;498 是成人为主(浙江省人民医院)+ 开放获取
490/491 MIMIC-III 均为重症 EHR 关系型库;MIMIC-III 是美国单中心(BIDMC),498 是中国单中心
492 MIMIC-IV 同为 EHR 库,但 MIMIC-IV 是当前主流版本、受控访问;498 是开放获取
493/494/496 那些是 MIMIC 上的派生标注层;498 无对应标注层,是原始库
497 Health Gym 497 是从 MIMIC-III 生成的合成数据;498 是真实的开放数据——"开放"的两条不同路径

§1 背景:中国重症数据开放的一次具体尝试

1.1 中国重症数据的三重困局

要理解 498 的意义,需要先理解它突破了什么。中国重症医学数据长期面临三重困局:

第一重:法规与伦理的谨慎
《个人信息保护法》《数据安全法》确立了对医疗健康数据的严格保护框架。这本身是正确且必要的,但客观上提高了数据对外共享的合规成本。研究者想做数据开放,往往面临"合规路径不清"的困境。

第二重:机构的动力不足
医院的真实数据是资产,但开放它并不直接带来收益,反而带来风险(隐私、舆情、合规)。这使得"开放"在机构决策中天然处于劣势。

第三重:技术门槛
即使有意愿开放,把院内异构信息系统(HIS、LIS、PACS、EMR)的数据导出、清洗、对齐、去标识化、结构化,本身就是一项大工程。

498 的价值在于:它证明这三重困局是可以突破的。浙江省人民医院团队完成了一次完整的"从院内信息系统到 PhysioNet 公开数据集"的路径。

1.2 为什么选"开放获取"而不是"受控访问"

这是一个值得琢磨的设计选择。对比同系列的两个中国库:

495 PIC 498 浙江 EHR
访问模式 受控(培训 + DUA) 开放获取
是否需审批 需要(约 3 个工作日) 不需要
可否自由再分发 受限 更宽松

从隐私保护角度,"受控"更安全;从研究可达性角度,"开放"更高效。498 选择开放,说明团队对去标识化的充分性有足够信心——他们依据 HIPAA 标准完成去标识化,移除了地址、出生/入院/出院/医嘱日期、个人号码、入院确切年龄,患者标识符随机分配且不可回溯。

这个选择是有意识的权衡:用"充分的去标识化"换取"零门槛的可达性"。

1.3 数据来源机构:浙江省人民医院

  • 机构:浙江省人民医院(Zhejiang Provincial People’s Hospital)
  • 位置:中国浙江
  • 级别:三级医疗中心(tertiary care medical center)
  • ICU 设置:两个——综合中心 ICU 与急诊 ICU(EICU)
  • 纳入标准:所有入住该院 ICU 的患者,无排除标准

"无排除标准"这一点值得注意。许多重症数据库会排除某些人群(如住院时间过短、年龄过小),以获得"更干净"的队列。498 选择全纳,好处是保留了临床真实谱系的完整性(包括住院时间短的、病情轻的),代价是数据中会混入更多噪声。这是一个"保真 vs 干净"的取舍,与 497 的合成数据设计思路形成对照。

1.4 时间跨度:十年零四个月

2012 年 1 月至 2022 年 5 月——这个跨度在中国开放重症数据里相当可观:

  • 覆盖了医疗信息化的快速演进期;
  • 覆盖了 2018 年的 ICU 床位扩张(官方明确提到该年住院数显著增加);
  • 覆盖了 COVID-19 疫情的前两年多(2020 年 1 月至 2022 年 5 月),这对研究疫情对重症医疗的影响有直接价值。

但一个关键限制随之而来:日历日期被移除。官方明示因此"无法进行时间趋势相关研究"。这里的逻辑是:细粒度日期(含月日)被移除以防再识别,但粗粒度年份信息(如"2018 年后住院增加")可能仍以某种形式保留。这是去标识化中的一个经典权衡——如何在保护隐私的同时保留时间趋势分析能力。498 选择了保护优先(存照 F)。

1.5 团队与资助

  • 通讯/资深作者:Zhongheng Zhang(张忠恒)——重症医学领域的活跃研究者,长期从事脓毒症、液体治疗、重症数据研究;
  • 资助构成:
    • 浙江省卫生健康委员会青年人才项目(2019323925);
    • 医路"革新"-液体治疗研究基金项目(YLGX-ZZ-2020005);
    • 浙江省健康科技计划(2021KY745)。
  • 这三个资助来源都指向临床应用导向的重症研究,与数据集"支持预测分析、外部验证、因果推断、成本效益分析"的定位一致。

1.6 伦理与合规路径

498 的伦理合规路径清晰且可借鉴:

环节 内容
伦理审批 浙江省人民医院伦理委员会,批准号 QT2022185
知情同意 因回顾性设计被豁免
伦理准则 遵循《赫尔辛基宣言》
去标识化标准 HIPAA
移除内容 地址、出生/入院/出院/医嘱日期、电话/社保/医院编号、入院确切年龄
标识符处理 patient_SN 与 hospital_ID 随机分配,原始标识符未保留
人员标识 医生/护士/药剂师标识符全部移除
自由文本 日期以星号替换,姓名/ID/地址/电话被移除或替换

这条路径的完整性说明:中国机构完全有能力在合规框架内完成数据开放。它为其他有兴趣的机构提供了一份可参照的模板。

1.7 数据的临床语义深度

498 的表设计体现了对重症临床工作流的理解。举三个例子:

例一:HospitalTransfer 表作为 ICU 识别机制
MIMIC 用独立的 ICUSTAYS 表标记 ICU 住院;498 没有这样的表,而是通过 院内转科事件(TransferIn/TransferOut 时间 + TransferTo/From_Dept_Eng)来推断 ICU 停留。这更贴近真实系统——很多医院的信息系统并不单独维护"ICU stay"实体,而是通过床位流转记录来体现。代价是使用者的推断逻辑需要自己写。

例二:MedOrder 与 Medication 分离

  • MedOrder(医嘱):医生开立了什么,含开立/停止时间;
  • Medication(用药):实际执行了什么,含单次剂量、频次、单位、给药途径。

这两者在临床上是不同的事件(医嘱可能被取消、可能执行了但剂量调整)。分开建表使研究者能区分"开立"与"执行",这对研究医嘱依从性、用药偏差等问题至关重要。

例三:DrugSens 表带 MIC
抗菌药物敏感性表不只记录分类结果(S/I/R),还记录 MIC 值。MIC 是定量指标,比分类结果蕴含更多信息——它支持耐药趋势分析、PK/PD 建模、断点漂移研究。

1.8 与 MIMIC 的设计哲学对照

维度 MIMIC-III/IV 498 浙江 EHR
表组织 按事件类型细分(数十张) 综合成 10 张宽表
字典表 有(D_ITEMS 等) 无独立字典表(项目名内嵌)
ICU 标记 独立 ICUSTAYS 表 通过 HospitalTransfer 推断
项目编码 ITEMID 数字编码 项目英文名(Lab_itemName_Eng)
药敏 无独立表 有(DrugSens + MIC)
医嘱 有(PRESCRIPTIONS/EMAR) 有(MedOrder,独立)
语言 英文 主要为英文(字段名 _Eng)

两者的差异反映了不同的设计取舍:MIMIC 追求规范化与可扩展(大量细表 + 字典),498 追求紧凑与易用(10 张宽表,项目名直接可读)。对使用者而言,498 的上手门槛更低(不需要查字典表),但灵活性也略低。

1.9 这份数据的四个高价值使用场景

场景一:模型外部验证
在 MIMIC 上训练的死亡率预测、AKI 预测、脓毒症识别模型,可以在 498 上做跨人群、跨机构的外部验证。这是当前医疗 AI 最缺的一环——多数论文只有内部验证,因为拿不到第二个数据集。498 的开放获取使这件事变得可行。

场景二:抗菌药物耐药研究
DrugSens 表的 MIC 值支持:耐药率的时间演变、不同菌种的耐药谱、经验性用药的合理性评估、耐药与结局的关联分析。

场景三:液体治疗与血流动力学研究
资助来源里直接有"液体治疗研究基金",团队在这方面的积累可以支撑:液体复苏量与结局的关系、升压药使用模式、血流动力学不稳定预测。

场景四:中国重症临床特征刻画
与 MIMIC(美国)对比,可研究中国 ICU 患者的病种谱、住院时长、死亡率差异及其制度性原因。

1.10 用户画像

用户类型 典型诉求 本数据集能提供
重症医学研究者 需要中国人群的真实重症数据 7,638 患者的十年数据
医疗 AI 工程师 需要外部验证数据集 开放下载、无需审批
抗菌药研究者 需要药敏与 MIC 数据 独立 DrugSens 表
临床流行病学者 需要中国 ICU 人群特征 8,180 次住院的人口学统计
建模方法研究者 需要真实世界的脏数据 官方明示含缺失与错误
教学者 需要真实 EHR 教学案例 3.22 GB 完整关系型数据

1.11 一条使用前的必要提醒

虽然是开放获取,仍有三条纪律:

  1. 不要尝试再识别——即使技术上可能(如通过罕见病 + 时间推断),也严禁尝试;
  2. 引用要完整——数据集 + 原始论文 + PhysioNet 平台论文(2026 年新要求);
  3. 不要声称临床有效性——基于单中心回顾数据得出的模型,不能直接声称可用于临床。

1.12 阅读本条的路线建议

  • 想判断能不能用:读 §0.2 + §1.9 使用场景 + §3 规格;
  • 想装载数据:读 §5 装载协议(含 R/Python 路径);
  • 想了解 ICU 识别:读 §4.5 HospitalTransfer 机制;
  • 想研究耐药:读 §6.7 DrugSens 深读;
  • 想做外部验证:读 §7.5 + §5.9;
  • 想找数字:读 INFOBOX、§6 实证、§10 存照。

§2 领域概念:中国重症数据、AMR 与电子病历二次利用

2.1 什么是"重症监护数据库"

重症监护数据库是把 ICU(Intensive Care Unit,重症监护病房)患者的高频监测数据、治疗干预、检验结果结构化为可分析格式的数据集合。它的特点:

特点 说明
时间粒度细 生命体征常为小时级甚至分钟级
数据密度高 一个 ICU 患者一天可产生数千条记录
干预密集 用药、液体、机械通气、CRRT 等
结局明确 死亡、转出、住院时长
多模态 LIS(检验)、HIS(医嘱)、PACS(影像报告)、EMR(病历)

498 覆盖了上述所有方面(除 PACS 影像本体外,有 ExamReport 报告文本)。

2.2 中国重症数据的三种"可及性层级"

层级 特征 代表
完全封闭 仅机构内部使用 绝大多数医院数据
受控开放 需审批 + DUA 495 PIC
完全开放 下载即用 498 浙江 EHR

498 处在第三层——这一层在中国重症数据里目前仍属少数。这个分层很重要:它意味着研究者的可达性成本从"数周审批"降到"零"。

2.3 抗菌药物耐药(AMR):为什么 DrugSens 表重要

AMR(Antimicrobial Resistance,抗菌药物耐药) 是全球公共卫生的头号威胁之一。世界卫生组织将其列为十大全球健康威胁。而 AMR 研究的基础是药敏数据。

药敏检测的两种报告形式:

形式 含义 信息量
分类结果(S/I/R) 敏感 / 中介 / 耐药 定性,三分类
MIC 最小抑菌浓度(μg/mL 或 mg/L) 定量,连续值

MIC 的价值在于:

  • 支持趋势分析:即使分类结果不变,MIC 的漂移也能提前预警耐药演化;
  • 支持 PK/PD 建模:药代/药效学分析需要定量值;
  • 支持断点研究:CLSI/EUCAST 的判定断点会修订,MIC 原始值使历史数据可重新判定。

498 的 DrugSens 表同时含 DrugSens_result(分类)与 MIC(定量),两者互补。

2.4 MIC 与"最小抑菌浓度"的临床含义

MIC(Minimal Inhibitory Concentration):抑制细菌可见生长的最低抗菌药物浓度。读法:

MIC 值 通常含义
低(如 0.5 μg/mL) 细菌对该药敏感
高(如 64 μg/mL) 细菌耐药
中间 需结合断点判定

关键概念是断点(breakpoint):由 CLSI(美国)或 EUCAST(欧洲)设定,规定"MIC ≤ X 为敏感、≥ Y 为耐药"。断点会随耐药演化而修订,因此保存 MIC 原始值比只存分类结果更有长期价值——历史数据可以在新断点下重新解读。

2.5 电子病历二次利用的三种范式

498 支持的是回顾性电子病历二次利用,其三种典型范式:

范式 研究问题 498 支持度
预测建模 能否预测死亡率/AKI/脓毒症? ✅ 强支持
因果推断 某治疗是否改善了结局? ✅ 支持(有干预数据)
描述性研究 中国 ICU 患者是什么样? ✅ 支持(有人口学与结局)

三者的共同前提是:数据要能被拼成一个"患者级"的分析表。这正是使用 498 的第一项工程工作——通过 patient_SN 与 Hospital_ID 把 10 张表 join 起来。

2.6 去标识化中的"效用-隐私"权衡

HIPAA 去标识化有两种方法:

方法 做法 影响
Expert Determination 专家评估再识别风险 灵活但主观
Safe Harbor 移除 18 类标识符 标准明确但可能移除过多

498 更接近 Safe Harbor——移除了地址、日期、号码等。其后果:

  • 隐私保护强(这是开放获取的前提);
  • 时间信息损失大(无法做时间趋势,官方明示);
  • 年龄被粗化("入院确切年龄"被移除,但有 Age_cut 字段)。

这个权衡是不可回避的:要开放,就必须牺牲一部分分析能力。498 选择了开放优先。

2.7 关系型 EHR 的"长表-宽表"设计

498 采用的是**长表(long format)**设计——每行一个事件,而非每行一个患者:

VitalSign 表(长表)
patient_SN | Hospital_ID | VitalSign_DESC | VitalSign_value | VitalSign_time
P001       | ZY|123      | 心率            | 88              | ...
P001       | ZY|123      | 收缩压          | 120             | ...

长表的优点:结构统一(所有生命体征一张表)、易于扩展(新增项目不需改表结构)。代价:需要 pivot 才能得到"一行一患者"的分析表,且不同医院的项目命名可能有差异。

这与 MIMIC 的设计思路一致(MIMIC 也是长表 + ITEMID 编码),但 498 用项目英文名而非数字编码,可读性更好。

2.8 住院(admission)与患者(patient)的区别

一个容易混淆的要点:498 有 7,638 名患者但 8,180 次住院。差异 542 意味着部分患者多次入院(约 7.1% 的住院属于重复入院患者)。

这个区别在研究中至关重要:

  • 患者级分析:需要考虑同一患者的多次入院的非独立性;
  • 住院级分析:每次住院视为独立观察;
  • 划分数据集时:必须按患者而非按住院划分,否则同一患者的多次住院跨越训练/测试集会导致患者级泄漏(存照)。

2.9 重症数据的关键结局指标

指标 定义 498 中的可得性
院内死亡 住院期间死亡 ✅ StatusOnDischarge = Dead
住院时长 DaysHospitalStay ✅
ICU 停留时长 需从 HospitalTransfer 推断 ⚠️ 需自建逻辑
出院去向 治愈/未治愈/死亡/未知 ✅ StatusOnDischarge
死亡诊断 DiagnosisOnDeath ✅

出院状态的四分类(治愈 73% / 未治愈 16% / 死亡 6% / 未知 6%)是 498 的一个有用特性——它比二分类(死/活)提供更细的信息。

2.10 名词速查表

缩写/术语 全称 含义
ICU Intensive Care Unit 重症监护病房
EICU Emergency Intensive Care Unit 急诊重症监护病房
EHR Electronic Health Record 电子健康记录
HIS Hospital Information System 医院信息系统
LIS Laboratory Information System 实验室信息系统
PACS Picture Archiving and Communication System 影像归档与通信系统
AMR Antimicrobial Resistance 抗菌药物耐药
MIC Minimal Inhibitory Concentration 最小抑菌浓度
CLSI Clinical and Laboratory Standards Institute 临床与实验室标准研究所
EUCAST European Committee on Antimicrobial Susceptibility Testing 欧洲抗菌药物敏感性试验委员会
LOS Length of Stay 住院时长
HIPAA Health Insurance Portability and Accountability Act 美国健康保险流通与责任法案
DUA Data Use Agreement 数据使用协议
ICD-10 International Classification of Diseases, 10th revision 国际疾病分类第十版
CRRT Continuous Renal Replacement Therapy 连续性肾脏替代治疗
SOFA Sequential Organ Failure Assessment 序贯器官衰竭评分

2.11 中国 vs 美国重症数据的差异

498(中国)与 MIMIC(美国)的差异不只在语言:

维度 MIMIC (BIDMC) 498 (浙江省人民医院)
医疗体系 美国商业+保险混合 中国公立三级
住院时长 较短(美国 ICU 平均 3-4 天) 较长(中位 17 天,但含全院住院)
病种谱 美国 ICU 谱 中国 ICU 谱
抗菌药使用 相对节制(有管理政策) 使用强度可能更高
数据结构 高度规范化 相对紧凑
记录习惯 英文临床书写 中英混合(字段 _Eng,自由文本去标识)

注意:住院日中位 17 天是全院住院而非 ICU 停留(DaysHospitalStay 字段)。这与 MIMIC 的 ICU LOS 不是同一口径,直接比较会误导——这是一个必须警惕的口径陷阱。

2.12 为什么"无排除标准"是一个重要设计

498 明确"无排除标准",这意味着数据集包含:

  • 住院时间极短的患者(可能数据很少);
  • 病情很轻的患者(可能未真正需要 ICU);
  • 数据缺失严重的患者。

好处:保留了真实临床谱系的完整性,使研究者可以做"真实世界"的分析。
代价:数据噪声更大,需要更多清洗工作。

对比 495 PIC 与 MIMIC 系列,多数库会有若干排除标准(如住院 >24 小时、年龄 >18 岁)。498 的全纳是有意识的选择,反映了团队"保留真实"的取向。

§3 数据规格与获取:10 张表、3.22 GB 与一条零门槛的下载路径

3.1 文件清单与体量分布

表 文件 大小 占比
实验室检查 Lab.csv 1,828,953,993 B(1.83 GB) 56.8%
生命体征 VitalSign.csv 607,364,251 B(607 MB) 18.9%
用药事件 Medication.csv 277,782,777 B(278 MB) 8.6%
医嘱 MedOrder.csv 207,348,204 B(207 MB) 6.4%
药敏 DrugSens.csv 136,436,217 B(136 MB) 4.2%
检查报告 ExamReport.csv 52,649,246 B(52.6 MB) 1.6%
微生物培养 MicrobiologyCulture.csv 39,362,619 B(39.4 MB) 1.2%
诊断 Diagnosis.csv 25,582,236 B(25.6 MB) 0.8%
电子病历 EMR.csv 13,730,602 B(13.7 MB) 0.4%
院内转科 HospitalTransfer.csv 1,441,407 B(1.4 MB) 0.04%
合计 约 3.22 GB 100%

Lab 表一张就占了 56.8%——1,828 万字节,约 1.83 GB。这提醒使用者:下载与处理的主要成本在 Lab 表,其他表相对轻量。

3.2 官方提供的完整性校验

每个表都附 MD5 哈希(见 FACTS)。这在开放数据集中是一个值得赞赏的细节——它使使用者能验证下载完整性:

md5sum Lab.csv
# 应输出 4939ebb2155bbcfaff37da8e78f8cc4a

MD5 的存在说明:官方预期数据会被谨慎对待。这是"开放但严谨"的态度。

3.3 十张表与重症语义的对应

表 对应的临床环节 关键用途
EMR 入院与出院的最基本信息 人口学、主诉、病史、结局
Diagnosis 诊断(ICD-10) 病种刻画、合并症、表型定义
HospitalTransfer 院内流转 识别 ICU 住院、转科路径
VitalSign 床旁监测 生理状态、SOFA 计算
Lab 检验 生化、血气、血液学
MicrobiologyCulture 微生物培养 感染诊断、菌种分布
DrugSens 药敏 耐药分析(含 MIC)
Medication 用药执行 治疗强度、药物暴露
MedOrder 医嘱开立 医嘱行为、依从性
ExamReport 检查报告 影像/超声/MRI 文本

这十张表覆盖了 “识别-监测-干预-检查-结局” 的完整链条。

3.4 主键与关联机制

字段 含义 作用
patient_SN 患者唯一标识(随机字母数字串) 跨住院识别同一患者
Hospital_ID 住院标识 一次住院内的所有事件

关联逻辑:

EMR (patient_SN, Hospital_ID)  ← 主表
   ├── Diagnosis       (patient_SN, Hospital_ID)
   ├── HospitalTransfer(patient_SN, Hospital_ID)
   ├── VitalSign       (patient_SN, Hospital_ID)
   ├── Lab             (patient_SN, Hospital_ID)
   ├── MicrobiologyCulture (patient_SN, Hospital_ID)
   ├── DrugSens        (patient_SN, Hospital_ID)
   ├── Medication      (patient_SN, Hospital_ID)
   ├── MedOrder        (patient_SN, Hospital_ID)
   └── ExamReport      (patient_SN, Hospital_ID)

两条键的必要性:单用 patient_SN 会把同一患者不同住院的数据混在一起;单用 Hospital_ID 无法跨住院追踪患者。两者结合才能正确定位"某患者某次住院"。

Hospital_ID 的格式有两种前缀:

  • ZY|360812(ZY 可能对应"住院")
  • IP|20190500469(IP 可能对应 inpatient,含年份)

两个前缀的存在说明系统在十年间发生过迁移(不同时期使用不同的编码体系)。

3.5 访问路径:三步走

步骤 动作
1 访问 PhysioNet 页面 https://physionet.org/content/zhejiang-ehr-critical-care/1.0/
2 阅读使用条款与引用要求
3 下载数据(开放获取,无需 DUA 审批)

这是 498 最大的优势——从决定使用到拿到数据的时间成本接近零(仅受下载带宽限制)。

3.6 下载与存储的现实考量

项 估算
下载体积 约 3.22 GB(压缩包可能更小)
解压后体积 约 3.22 GB(CSV 本身)
载入内存 Lab 表 1.83 GB,建议分段读取或使用 data.table
推荐存储 ≥ 20 GB 可用空间(含中间文件)

Lab 表的处理提示:1.83 GB 的 CSV 一次性读入 pandas 通常需要 5-8 GB 内存。建议:

# 方案一:分块读取
chunks = pd.read_csv('Lab.csv', chunksize=1_000_000)
for chunk in chunks:
    process(chunk)

# 方案二:只读需要的列与项目
cols = ['patient_SN','Hospital_ID','Lab_itemName_Eng','Lab_results','Lab_time']
lab = pd.read_csv('Lab.csv', usecols=cols)

# 方案三:R data.table(官方推荐大文件)
library(data.table)
lab <- fread('Lab.csv')

官方明确推荐 R 的 data.table 包处理大文件,tidyverse 用于关系数据库管理,icd 包处理 ICD 编码。

3.7 官方推荐的 R 工具链

包 用途
tidyverse 关系数据库管理与数据处理
data.table 大文件(尤其 Lab 表)的高效读取
icd ICD 编码的解析、分组、合并

这个推荐本身透露了官方的预期使用方式:R 为主要语言。当然,Python 完全可行(pandas + pyarrow)。

3.8 引用要求

层级 引用对象
数据集 Jin S, Chen L, Chen K, Zhang Z. PhysioNet. 2023. DOI 10.13026/901c-yv54
原始论文 Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z. Sci Data. 2023. DOI 10.1038/s41597-023-01952-3
平台 Pollard T, et al. Nature Health. 2026. DOI 10.1038/s44360-026-00096-z

BibTeX(官方提供):

@article{PhysioNet-zhejiang-ehr-critical-care-1.0,
  author = {Jin, Senjun and Chen, Lin and Chen, Kun and Zhang, Zhongheng},
  title = {{Establishment of a Chinese critical care database from electronic
            healthcare records in a tertiary care medical center}},
  journal = {{PhysioNet}},
  year = {2023},
  month = jan,
  note = {Version 1.0},
  doi = {10.13026/901c-yv54},
  url = {https://doi.org/10.13026/901c-yv54}
}

3.9 版本锚定

锚点 值
数据集版本 v1.0
数据集 DOI 10.13026/901c-yv54
关联论文 DOI 10.1038/s41597-023-01952-3
代码仓库 github.com/zh-zhang1984/ZhejiangProvinceICU
机构 浙江省人民医院

3.10 数据对账清单

下载后逐项验证:

  • [ ] 10 个 CSV 文件齐全;
  • [ ] MD5 与官方表 2 一致(尤其 Lab 表 4939ebb…);
  • [ ] Lab.csv 大小约 1.83 GB;
  • [ ] EMR.csv 中 Hospital_ID 唯一值数为 8,180;
  • [ ] EMR.csv 中 patient_SN 唯一值数为 7,638;
  • [ ] Diagnosis 表中 ICD10_code 字段有值;
  • [ ] DrugSens 表中 MIC 字段有值(非全空);
  • [ ] VitalSign 表含 VitalSign_time 时间戳;
  • [ ] HospitalTransfer 表含 TransferIn/TransferOut 时间。

第 4、5 条是最关键的对账——它们验证了核心规模数字。

3.11 DAIMS 评估:6.7 / 8

维度 评分 依据
文档完备性 0.9 官方页面给足表结构、变量、MD5、人口学统计、伦理与资助;但表数量与作者名单存在矛盾,许可未明确
机器可读性 1.0 标准 CSV + MD5 校验,开箱即用
标签质量透明度 0.6 无人工标注;有 ICD-10 编码(半自动);数据质量由官方明示存在缺失与错误
可访问性 1.0 开放获取,无需 DUA,零门槛
许可清晰度 0.4 页面称"开放获取"但未列具体协议名,是全条目最大短板
格式标准化 1.0 标准 CSV、统一主键命名(patient_SN/Hospital_ID)、字段名清晰(_Eng 后缀)
评测协议完备性 0.5 未有官方划分、基线模型或评测指标;仅提供数据与用途建议
生态可持续性 1.0 有 GitHub 代码 + 同行评议论文 + 十年数据跨度 + 开放许可
合计 6.7 / 8 可访问性、格式、生态三项满分;许可清晰度与评测协议是短板

与同系列对比:498(6.7)> 496(6.4)> 497(6.3)。498 得分最高的原因正是它的开放性 + 规范性组合——既能自由下载,又有标准格式与 MD5 校验。

3.12 元数据速查

字段 值
Title Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center
Version 1.0
Published 2023-01-19
DOI 10.13026/901c-yv54
RRID SCR_007345
Access Openly accessible
Authors Senjun Jin; Lin Chen; Kun Chen; Zhongheng Zhang
Institution Zhejiang Provincial People’s Hospital
Code github.com/zh-zhang1984/ZhejiangProvinceICU

§4 数据结构与 10 张表逐一解剖

4.1 组织拓扑

                       EMR.csv(主表,8,180 行)
              patient_SN | Hospital_ID | Sex | Age_cut | ChiefComplain ...
                            │
        ┌───────────────────┼────────────────────┬──────────────────┐
        ▼                   ▼                    ▼                  ▼
  Diagnosis.csv    HospitalTransfer.csv    VitalSign.csv      Lab.csv
  (ICD-10 诊断)      (院内转科,识别 ICU)     (生命体征)      (11,082,482 条)
        │                   │                    │                  │
        └───────────────────┴────────────────────┴──────────────────┘
                            │
        ┌───────────────────┼────────────────────┬──────────────────┐
        ▼                   ▼                    ▼                  ▼
  MicrobiologyCulture  DrugSens.csv       Medication.csv      MedOrder.csv
   (微生物培养)        (药敏 + MIC)          (用药执行)          (医嘱开立)
                            │
                            ▼
                      ExamReport.csv
                      (CT/超声/MRI 报告)

4.2 EMR 表(主表)逐字段解剖

字段 类型 语义
patient_SN string 患者唯一标识(随机)
Hospital_ID string 住院标识
Sex category 性别
ChiefComplain_24hr text 入院 24 小时内主诉
AdmissionStatus_24hr text 入院 24 小时状态
ChiefComplain_24hr_dead text 死亡患者入院 24 小时主诉
AdmissionStatus_24hr_dead text 死亡患者入院 24 小时状态
ChiefComplain text 主诉
Med_history text 既往用药史
PastHistory text 既往病史
StatusOnDischarge category 出院状态(治愈/未治愈/死亡/未知)
DiagnosisOnDeath text 死亡诊断
StatusOnDischarge_Desc text 出院状态描述
DischargeTime datetime 出院时间
DaysHospitalStay numeric 住院天数
ChiefComplain_Eng text 主诉英文版
Age_cut category 年龄分档(粗化)

四个值得注意的设计:

  1. 死亡专项字段(_dead 后缀)——为死亡患者单独保留 24 小时内的主诉与状态,说明团队关注"临终阶段的临床表现",这是重症研究的一个重要视角;
  2. 主诉有中英两版(ChiefComplain 与 ChiefComplain_Eng)——说明数据经过翻译或双语录入,这是去标识化中为国外研究者可用性做的额外工作;
  3. Age_cut 而非精确年龄——去标识化的体现("入院确切年龄"被移除),但保留分档以支持年龄分层分析;
  4. StatusOnDischarge 四分类——比"死/活"二分类信息更丰富。

4.3 Diagnosis 表:ICD-10 是金矿

字段 语义
patient_SN / Hospital_ID 关联键
Diagnosis_Desc 诊断描述(原文)
ICD10_code ICD-10 编码
ICD10_name ICD-10 名称
Diagnosis_DateTime 诊断时间

为什么 ICD-10 是关键:

  • 表型定义:可精确筛出特定病种(如脓毒症、AKI、心衰);
  • 合并症量化:可用 Charlson 指数、Elixhauser 指数计算共病负担;
  • 跨库可比:ICD-10 是国际标准,可与 MIMIC(ICD-9/10)、PIC(ICD-10)对齐;
  • 统计报告:可做病种谱分布。

这是 498 中最具二次利用价值的表之一。

4.4 VitalSign 表:高频监测

字段 语义
VitalSign_DESC 项目名称(如心率、血压、体温)
VitalSign_value 数值
VitalSign_unit 单位
VitalSign_time 时间戳

长表设计的含义:所有生命体征混在一张表里,用 VitalSign_DESC 区分。使用时需要 pivot:

vitals = (vital.groupby(['patient_SN','Hospital_ID','VitalSign_time'])
                .apply(lambda g: dict(zip(g.VitalSign_DESC, g.VitalSign_value)))
                .apply(pd.Series))

注意 VitalSign_unit 的存在——同一项目可能有不同单位(如体温 ℃ 与 ℉),清洗时必须处理单位一致性,否则会把 37℃ 与 98.6℉ 当成两个不同量级的值。

4.5 HospitalTransfer 表:ICU 识别的核心机制

字段 语义
TransferIn_dateTime 转入时间
TransferOut_dateTime 转出时间
TransferTo_Dept_Eng 转入科室(英文)
TransferFrom_Dept_Eng 转出科室(英文)

这是 498 最需要理解的设计。MIMIC 有独立的 ICUSTAYS 表直接标记 ICU 住院,498 没有——必须从转科事件推断。

推断 ICU 停留的 SQL 思路:

-- 识别进入 ICU 的转科事件
SELECT patient_SN, Hospital_ID, TransferIn_dateTime, TransferOut_dateTime
FROM HospitalTransfer
WHERE TransferTo_Dept_Eng LIKE '%ICU%'
   OR TransferTo_Dept_Eng LIKE '%Intensive Care%'
   OR TransferTo_Dept_Eng IN ('Comprehensive ICU', 'Emergency ICU')

关键陷阱(存照 H、I):

  1. 科室英文名称的具体写法需先从数据中枚举确认,不能猜;
  2. 急诊 ICU 在部门名称中标注为 “Emergency medical department” 或 “Emergency Department”——这不是含 ICU 字样的名称,如果只用 LIKE ‘%ICU%’ 会漏掉 EICU;
  3. 同一患者可能多次进出 ICU,需要按 TransferOut 时间切分多次停留;
  4. 最后一次 TransferOut 可能为空(患者仍在 ICU 或数据截至)。

这四条使得"正确识别 ICU 住院"成为一个需要仔细处理的工程问题,而非一句 SQL 能解决。

4.6 Lab 表:1,108 万条记录的结构

字段 语义
Lab_category 检验类别
Lab_time 检验时间
Lab_results 检验结果
Unit_measure 单位
LabSampleCollect_time 样本采集时间
Lab_itemName_Eng 检验项目英文名(214 种)
Lab_Sample_Eng 样本类型(英文)

两个设计亮点:

  1. Lab_time 与 LabSampleCollect_time 分离——检验的"采集时间"与"报告/检验时间"在临床上是两个不同时刻。这个区分对时间序列建模很重要(采集时间更接近生理状态的真实时刻);
  2. Lab_itemName_Eng 而非数字编码——可读性远优于 MIMIC 的 ITEMID,但代价是名称的规范化程度依赖原始录入。

214 种检验项目覆盖了常规生化、血气、血液学、凝血、免疫等。

4.7 Medication 与 MedOrder:执行与开立的分离

表 字段要点 语义
Medication Med_category, SingleDose, Med_Freq, Med_unit, Med_startTime, Med_stopTime, Med_route_Eng, Med_DESC_Eng 实际执行的用药
MedOrder MedOrder_Type, MedOrder_DESC, MedOrder_Start_DateTime, MedOrder_Stop_DateTime 医生开立的医嘱

这个分离的临床价值:

  • Medication 有 SingleDose(单次剂量)+ Med_Freq(频次)+ Med_route_Eng(给药途径,如静脉/口服)→ 可计算药物暴露量;
  • MedOrder 只有开立/停止时间 → 反映医嘱行为;
  • 两者对比 → 可研究:医嘱被取消的比例、剂量调整模式、用药依从性。

对比 MIMIC:MIMIC 有 PRESCRIPTIONS(处方)与 EMAR(用药管理记录),思路类似但表名与粒度不同。

4.8 DrugSens 表:全库最独特的一张表

字段 语义
Drug_Code 药物编码
DrugSens_result 药敏结果(S/I/R)
MIC 最小抑菌浓度
DrugSens_time 检测时间
Drug_name_Eng 药物英文名
DrugSens_Microbiology_Eng 对应微生物
DrugSens_Category_Eng 药物类别
DrugSens_sample_Eng 样本类型

为什么这张表稀缺:

数据库 有独立药敏表? 含 MIC?
MIMIC-III ❌(在 microbiologyevents 中有部分) 部分
MIMIC-IV 部分 有限
495 PIC ❌ ❌
498 浙江 ✅ ✅

这张表使 498 成为耐药研究的少数可用数据源之一。

4.9 MicrobiologyCulture 与 DrugSens 的配对逻辑

MicrobiologyCulture.csv          DrugSens.csv
  MicrobiologyCulture_finding ──┐
  MicrobiologyCulture_sample ───┼──→ DrugSens_Microbiology_Eng
  MicrobiologyCulture_time ─────┘    DrugSens_sample_Eng
                                     DrugSens_time
                                          │
                                          ▼
                                     DrugSens_result(S/I/R)
                                     MIC

培养(发现细菌)+ 药敏(该菌对药物的反应) 构成完整的微生物学检测链条。使用时需注意:一次培养可能对应多条药敏记录(一个菌对多种药)。

4.10 ExamReport 表:影像文本的可得性

字段 语义
ExamReport_Category 检查类别(CT/超声/MRI)
ExamReport_DESC 检查描述
ExamReport_finding 检查发现(报告文本)
ExamReport_time 检查时间
ExamReport_item_Eng 检查项目英文名

这意味着 498 不只提供结构化数值,还提供影像报告文本——为多模态或 NLP 研究提供了可能(尽管不如 496 那样有标注)。

52.6 MB 的体积说明报告文本量可观。

4.11 血缘关系图

浙江省人民医院信息系统(HIS / LIS / EMR / RIS)
   2012-01 至 2022-05,全院 ICU 患者(无排除标准)
        │
        │ 导出 + 结构化 + HIPAA 去标识化
        │ (移除日期/地址/号码;patient_SN 随机化)
        ▼
   10 张 CSV 关系表(总计约 3.22 GB)
        │  MD5 校验 + 上传
        ▼
   PhysioNet 开放获取(v1.0,2023-01-19)
        │
        │  Sci Data (2023) 论文发表
        ▼
   7,638 患者 / 8,180 住院 / 11,082,482 条检验

4.12 表间关系的完整性检查

检查项 方法 预期
主表覆盖 EMR 中 Hospital_ID 唯一值数 8,180
子表外键完整 各子表的 Hospital_ID 是否都在 EMR 中 应大部分匹配
孤儿记录 子表中存在但 EMR 中不存在的 Hospital_ID 应很少
时间一致性 子表事件时间是否落在住院区间内 部分可能越界(需核查)
空值率 各关键字段的空值比例 Lab_results 等可能有空

第 4 条是一个常见的真实数据问题:事件时间可能落在入院前(如门诊检验)或出院后(如随访),处理时需明确边界。

4.13 与 495 PIC 的结构对照

维度 495 PIC 498 浙江
表数 16 10
字典表 有(D_ITEMS、D_LABITEMS、D_ICD_DIAGNOSES) 无
ICU 识别 ICUSTAYS 表 HospitalTransfer 推断
项目编码 ITEMID(字符) 英文名
药敏表 无独立表 有(DrugSens + MIC)
症状表 EMR_SYMPTOMS 无(主诉在 EMR 表中)
手术体征 SURGERY_VITAL_SIGNS 无
语言 英汉双语 主要英文(_Eng 字段)
ICU 数 5 个 2 个(综合 + 急诊)
访问 受控(DUA) 开放获取

这张表说明了两个中国库的互补性:PIC 结构更完整(有字典表、更细的表划分),498 更紧凑且更开放。

4.14 数据质量的自查要点

检查 方法 期望
单位一致性 统计 VitalSign_unit 的取值 应有限且可映射
数值范围 检查 VitalSign_value 的极值 应无荒谬值
时间格式 检查各 _time 字段格式 应统一
编码一致性 Diagnosis 的 ICD10_code 格式 应统一
重复记录 按主键去重 应无完全重复
空值模式 统计各字段空值率 官方已明示存在缺失

官方明示"数据存在缺失值和错误",因此质检是使用者的必经步骤,不能跳过。

§5 装载、ICU 识别与评测协议

5.1 最小装载路径(Python)

import pandas as pd

emr  = pd.read_csv('EMR.csv')
diag = pd.read_csv('Diagnosis.csv')
vital= pd.read_csv('VitalSign.csv')
# Lab 表 1.83 GB,建议分块或用 pyarrow
lab  = pd.read_csv('Lab.csv', usecols=['patient_SN','Hospital_ID',
                                       'Lab_itemName_Eng','Lab_results','Lab_time'])
trsf = pd.read_csv('HospitalTransfer.csv')
med  = pd.read_csv('Medication.csv')
mord = pd.read_csv('MedOrder.csv')
dsen = pd.read_csv('DrugSens.csv')
mic  = pd.read_csv('MicrobiologyCulture.csv')
exam = pd.read_csv('ExamReport.csv')

print(emr.shape)                        # (8180, ~17)
print(emr['Hospital_ID'].nunique())     # 8180
print(emr['patient_SN'].nunique())      # 7638

5.2 最小装载路径(R,官方推荐)

library(data.table)

emr   <- fread('EMR.csv')
diag  <- fread('Diagnosis.csv')
vital <- fread('VitalSign.csv')
lab   <- fread('Lab.csv')          # data.table 高效处理 1.83 GB
trsf  <- fread('HospitalTransfer.csv')
med   <- fread('Medication.csv')
dsen  <- fread('DrugSens.csv')

nrow(emr); uniqueN(emr$Hospital_ID); uniqueN(emr$patient_SN)

5.3 ICU 住院识别的完整流程

library(data.table)

trsf <- fread('HospitalTransfer.csv')

# Step 1: 先枚举所有科室名,确认 ICU 名称的实际写法
unique(trsf$TransferTo_Dept_Eng)

# Step 2: 根据实际枚举结果定义 ICU 科室集合
icu_depts <- c('Comprehensive ICU', 'Emergency ICU',
               'Emergency medical department', 'Emergency Department')

# Step 3: 提取 ICU 停留事件
icu_stays <- trsf[TransferTo_Dept_Eng %in% icu_depts,
                  .(patient_SN, Hospital_ID,
                    icu_in = TransferIn_dateTime,
                    icu_out = TransferOut_dateTime)]

# Step 4: 处理多次停留与空值
icu_stays[is.na(icu_out), icu_out := as.POSIXct(NA)]  # 保留为 NA,后续单独处理

# Step 5: 计算每次 ICU 停留时长
icu_stays[, icu_los_hours := as.numeric(difftime(icu_out, icu_in, units='hours'))]

Step 1 是不可跳过的——科室名称必须以数据中实际枚举为准,不能猜(存照 H)。

5.4 患者级分析表的构造

# 住院级聚合
adm = emr[['patient_SN','Hospital_ID','Sex','Age_cut',
           'StatusOnDischarge','DaysHospitalStay']].copy()

# 合并 ICU 停留(一个住院可能多次 ICU)
icu_agg = icu_stays.groupby(['patient_SN','Hospital_ID']).agg(
    icu_stay_count=('icu_in','count'),
    icu_total_hours=('icu_los_hours','sum'))

adm = adm.merge(icu_agg, on=['patient_SN','Hospital_ID'], how='left')

# 合并诊断数
diag_agg = diag.groupby(['patient_SN','Hospital_ID']).size().rename('n_diagnoses')
adm = adm.merge(diag_agg, on=['patient_SN','Hospital_ID'], how='left')

# 合并检验次数
lab_agg = lab.groupby(['patient_SN','Hospital_ID']).size().rename('n_lab_tests')
adm = adm.merge(lab_agg, on=['patient_SN','Hospital_ID'], how='left')

5.5 患者级划分(关键)

import numpy as np
rng = np.random.default_rng(42)

patients = emr['patient_SN'].unique()
rng.shuffle(patients)
n = len(patients)
train_p = set(patients[:int(0.7*n)])
val_p   = set(patients[int(0.7*n):int(0.8*n)])
test_p  = set(patients[int(0.8*n):])

train = adm[adm.patient_SN.isin(train_p)]
val   = adm[adm.patient_SN.isin(val_p)]
test  = adm[adm.patient_SN.isin(test_p)]

必须按 patient_SN 而非 Hospital_ID 划分——542 次住院属于重复入院患者,若按住院划分,同一患者会跨越训练/测试集,造成患者级泄漏(存照)。

5.6 评测协议:官方未提供,需自建

与 498 一样,官方未提供训练/测试划分、基线模型或评测指标。建议协议:

环节 建议
划分 按 patient_SN 做 7:1:2
主任务 院内死亡预测(StatusOnDischarge = Dead)
评价指标 AUROC + AUPRC(类别不平衡)+ 校准曲线
基线 年龄 + 性别 + 住院天数的 Logistic 回归
进阶 SOFA/LODS 等评分 → 机器学习模型
外部验证 在 MIMIC 上交叉验证

5.7 死亡率预测的标准流程

输入特征
├── 人口学:Sex, Age_cut
├── 入院状态:主诉、入院 24 小时状态
├── 生理:VitalSign(前 24 小时统计量)
├── 检验:Lab(前 24 小时统计量,214 项中的常见项)
└── 合并症:Diagnosis 的 ICD-10 派生(Charlson 指数)

预测目标
└── StatusOnDischarge == 'Dead'(6%,438 例)

注意
└── 类别不平衡(6%)→ 必须用 AUPRC 与校准,不能只看 AUROC

5.8 抗菌药耐药分析的标准流程

# 耐药率计算
dsen['resistant'] = dsen['DrugSens_result'].isin(['R','Resistant','耐药'])

# 按药物统计耐药率
res_rate = dsen.groupby('Drug_name_Eng')['resistant'].agg(['mean','count'])

# 按菌种统计
by_bug = dsen.groupby(['DrugSens_Microbiology_Eng','Drug_name_Eng'])['resistant'].mean()

# MIC 分布
dsen['MIC'] = pd.to_numeric(dsen['MIC'], errors='coerce')
mic_dist = dsen.groupby('Drug_name_Eng')['MIC'].describe()

注意:药敏结果的编码(S/I/R 还是 Sensitive/Resistant/Intermediate)需先从数据中确认,不能假设。

5.9 外部验证的设计要点

想在 MIMIC 与 498 之间做外部验证,须处理四个对齐问题:

问题 处理
编码差异 MIMIC-III 用 ICD-9,498 用 ICD-10 → 用映射表或选两者都有的病种
变量差异 取交集变量,或按临床概念映射
单位差异 统一单位(如 mg/dL)
队列定义 用同一纳排标准(如首次 ICU 住院、成人)

对齐是外部验证的核心难点,也是最有价值的工作——它决定了跨人群结论是否可信。

5.10 常见错误黑名单

  • ❌ 按 Hospital_ID 而非 patient_SN 划分(患者级泄漏);
  • ❌ 用全文日期做时间趋势(官方明示无法做);
  • ❌ 忽略单位差异直接合并 VitalSign;
  • ❌ 用 LIKE ‘%ICU%’ 识别 ICU(漏掉 EICU);
  • ❌ 把 DaysHospitalStay 当作 ICU LOS(口径不同);
  • ❌ 类别不平衡时只报 accuracy;
  • ❌ 不核查 MD5 就使用(数据损坏风险);
  • ❌ 声称模型"可用于临床"(单中心回顾数据不支持)。

5.11 与 495、492 的联合使用

联合 研究设计
498 + 495(PIC) 中国成人与儿科 ICU 的对照研究
498 + 492(MIMIC-IV) 中美 ICU 人群对照、跨机构模型外部验证
498 + 497(Health Gym) 在合成数据上开发算法、在 498 上验证
498 + 496 498 的 ExamReport 文本 + 496 的抽取方法 → 从影像报告抽结构化信息

5.12 部署与合规边界

场景 是否可行
回顾性研究 ✅
模型开发与外部验证 ✅
抗菌药耐药研究 ✅
教学 ✅
前瞻性临床决策 ❌ 需另行验证与审批
再识别尝试 ❌ 禁止

§6 实证基座:8,180 次住院告诉我们什么

6.1 人口学全景

变量 合计 (n=8,180) 女性 (n=2,965) 男性 (n=5,215)
(0,18] 岁 35 (0%) 14 (0%) 21 (0%)
(18,45] 岁 1,012 (12%) 339 (11%) 673 (13%)
(45,65] 岁 2,609 (32%) 859 (29%) 1,750 (34%)
(65,75] 岁 1,952 (24%) 709 (24%) 1,243 (24%)
(75,90] 岁 2,044 (25%) 836 (28%) 1,208 (23%)
(90,150] 岁 528 (6%) 208 (7%) 320 (6%)
住院天数中位 (Q1,Q3) 17 (10, 28) 16 (10, 26) 18 (10, 28)
治愈 5,666 (73%) 2,050 (73%) 3,616 (73%)
死亡 438 (6%) 157 (6%) 281 (6%)
未治愈 1,202 (16%) 437 (16%) 765 (15%)
未知 444 (6%) 153 (5%) 291 (6%)

6.2 四条从人口学中读出的结论

结论一:这是一个以中老年为主的成人 ICU 队列。
45 岁以上占 87%(32%+24%+25%+6%),而 18 岁以下仅 35 例(0%)。这与 495 PIC(儿科、中位年龄 0.8 岁)形成鲜明对照,也符合"综合 ICU 以成人为主"的临床现实。

结论二:性别比为男 63.8% vs 女 36.2%,男性显著偏多。
这在重症数据中是常见现象(男性心血管疾病、外伤、危重症的发生率更高),但也可能反映就医行为差异。住院日中位数男性 18 天 > 女性 16 天(p<0.001),说明男性的住院时间显著更长。

结论三:住院日中位 17 天,明显长于欧美 ICU 数据。
但要注意口径:这是全院住院(DaysHospitalStay),不是 ICU 停留时长。美国 ICU 平均停留 3-4 天,而美国医院的总住院中位也在 4-5 天量级。498 的 17 天中位意味着中国三级医院重症患者的住院时间显著更长。这个差异的可能原因:

  • 中国三级医院收治的病情更重(基层分流后);
  • 康复期仍在院内(缺少成熟的院外康复/护理机构);
  • 医保与支付制度的差异;
  • 家属陪护文化(中国医院普遍有家属陪护,出院标准可能不同)。

这是一个跨体系比较时必须谨慎的点——直接说"中国患者住院更久"可能掩盖了制度性因素。

结论四:治愈率 73%、死亡率 6%。
死亡率 6% 远低于一般 ICU 的预期(美国 ICU 死亡率常在 10-15%)。可能原因:

  • 队列是"所有入住 ICU 的患者,无排除标准"——包含了许多病情较轻、短期观察后转出的患者;
  • "治愈"的定义可能较宽(StatusOnDischarge 的判定标准由医院系统决定);
  • 中国的 ICU 收治范围可能比美国更广(包含监护性质的患者)。

6.3 出院状态的四分类价值

498 的 StatusOnDischarge 是四分类,比常见的二分类信息更丰富:

状态 例数 占比 临床含义
治愈 (Cured) 5,666 73% 病情好转出院
未治愈 (Not cured) 1,202 16% 病情未好转但出院/转院
死亡 (Dead) 438 6% 院内死亡
未知 (Unknown) 444 6% 状态未记录

"未治愈"这一类的存在很有价值:它捕捉了"病情未好转就离院"的患者(可能转院、可能放弃治疗、可能家属要求出院)。这一群体在研究中常被忽略,但它是治疗失败或治疗中断的重要信号。

建模建议:可以做三分类(治愈/未治愈/死亡)或多分类预测,比二分类更有临床信息量。但要先处理"未知"(444 例,占 6%)——是删除、还是单独建模。

6.4 性别差异的统计显著性

表 1 给出了 p 值:

变量 p 值 显著性
年龄分布 <0.001 显著
住院天数 <0.001 显著
出院状态 0.901 不显著

这组 p 值说明:

  • 年龄分布在性别间显著不同:女性在 75-90 岁档占比更高(28% vs 23%),说明女性患者年龄更大——这与女性预期寿命更长一致;
  • 住院天数在性别间显著不同:男性更长;
  • 出院状态在性别间无显著差异(p=0.901):男女的治愈/死亡比例几乎一致。

第三条尤其有意义:它说明尽管男女人口学不同、住院时长不同,但最终结局没有性别差异。这是一个值得进一步分析的发现——它可能意味着医疗处置在性别上是公平的,也可能意味着其他因素(如年龄)在起作用。

6.5 11,082,482 条检验记录的规模感

1,108 万条检验记录 / 8,180 次住院 = 平均每次住院约 1,355 条检验记录。

这个数字意味着:

  • 平均每住院每天约 80 条检验记录(按 17 天住院算);
  • 这是一份检验密集型的数据——中国三级医院 ICU 的检验强度可见一斑。

对建模的影响:

  • 优势:大量时序数据支持精细的生理轨迹建模;
  • 挑战:数据量巨大,特征工程与计算成本高;需要按临床意义筛选项目(214 种不可能都用)。

实用建议:不要一上来就用全部 214 种检验项目。先用临床知识选出 20-40 个核心项目(如肌酐、乳酸、white blood cell、血小板、胆红素、血气指标),构建基础特征集,再逐步扩展。

6.6 214 种检验项目的分析策略

策略 做法 适用
核心项精选 按临床重要性选 20-40 项 快速建模
覆盖度筛选 选覆盖率 >30% 的项目 通用模型
类别聚合 按 Lab_category 聚合 降维
全量嵌入 用所有项目做表征学习 深度学习

覆盖度筛选最实用:一个只有 5% 患者做过的检验,对预测模型几乎没有贡献(大量缺失),反而是噪声源。

6.7 DrugSens 深读:这张表能回答什么问题

这张表是 498 相对其他库的最大增量。它能支撑的研究方向:

方向一:耐药率的横断面刻画

res = dsen.groupby(['DrugSens_Microbiology_Eng','Drug_name_Eng'])
          .agg(n=('DrugSens_result','size'),
               resistance=('resistant','mean'))
# 例:某菌对某药的耐药率

方向二:耐药的时间演变
虽然有日期限制,但若年份信息可用,可做粗粒度的年度耐药率趋势。

方向三:MIC 分布与断点漂移

mic = dsen.groupby(['Drug_name_Eng','DrugSens_Microbiology_Eng'])['MIC']
     .apply(lambda s: np.percentile(s.dropna(), [50, 90, 95]))

方向四:经验性用药的合理性评估
把 Medication 表(实际用了什么药)与 DrugSens 表(病原对什么药敏感)结合,评估:

  • 经验性用药与最终药敏的一致率;
  • 不一致时的结局差异。

这个分析有直接的临床改进价值——它是抗菌药物管理(antibiotic stewardship)评估的标准方法。

6.8 微生物培养与药敏的配对分析

步骤 操作
1 从 MicrobiologyCulture 提取阳性培养(含菌种)
2 按 patient_SN/Hospital_ID/时间匹配到 DrugSens
3 统计每株菌的药敏谱(S/I/R 模式)
4 计算多重耐药(MDR)菌株比例

MDR 的定义:对 ≥3 类抗菌药物耐药。498 的 DrugSens_Category_Eng 字段(药物类别)使这个计算可行——这是表设计上的一个实用细节。

6.9 医嘱与用药的分离能回答什么

研究问题 需要的表 方法
医嘱取消率 MedOrder 有 Start 无对应执行记录
剂量调整模式 Medication SingleDose 随时间的变化
给药途径分布 Medication Med_route_Eng 统计
医嘱-执行时间差 MedOrder + Medication 按药物名匹配时间

**“医嘱取消率”**是一个容易被忽略但有意义的指标——它反映临床决策的修正频率。不过要计算它需要可靠的匹配逻辑(药物名称的规范化),这本身是一个工程挑战。

6.10 与 MIMIC 的规模对比

指标 MIMIC-III 498 浙江
患者数 ~38,000(成人) 7,638
住院数 ~50,000 8,180
时间跨度 2001-2012(12 年) 2012-2022(10 年 4 个月)
ICU 数 1(BIDMC 多个单元) 2
总表数 26+(含字典表) 10
检验记录 数千万 1,108 万
访问 受控(DUA) 开放

498 的规模约为 MIMIC-III 的六分之一到五分之一,但开放获取这一属性是 MIMIC 不具备的。

6.11 与 495 PIC 的对照

维度 495 PIC 498 浙江
医院 浙江大学医学院附属儿童医院 浙江省人民医院
人群 儿科(0-18 岁) 成人为主
患者/住院 12,881 / 13,449 7,638 / 8,180
ICU 5 个 2 个
时间 2010-2018 2012-2022
死亡率 7.1%(院内)/6.9%(ICU) 6%(院内)
访问 需 DUA 开放
双语 是 部分(_Eng 字段)

有意思的一致性:两个中国库的院内死亡率都在 6-7% 区间,显著低于欧美 ICU 的常见报告值。这可能反映中国 ICU 收治范围更宽(包含监护性入住)这一制度特征——这是一个值得专门研究的现象学问题。

6.12 静态 vs 活跃

维度 状态
498 数据集本体 静态(v1.0,2023-01-19 发布,未见更新)
上游医院数据 活跃(医院持续产生数据)
作者团队 活跃(资助到 2021,团队持续发表)

一个重要提示:数据集冻结在 2022 年 5 月,而医院数据仍在产生。若想做更新研究,需自行与团队联系。这也是所有开放数据集的共同局限——开放版本必然滞后于院内现状。

6.13 家族治理:中国重症数据谱系

数据 机构 人群 开放度
495 PIC 浙大儿院 儿科 受控
498 浙江 ICU 浙江省人民医院 成人 开放
其他院内数据 各医院 各异 封闭

在中国重症数据谱系中,498 是开放度最高的一环。它与 495 一起,构成了"中国重症数据走向国际"的两条路径。

6.14 口径诊断树

数字不符时:

数字不对?
├─ 患者数不对?
│   └─ 是否把住院数(8,180)当成了患者数(7,638)?
├─ 检验记录数不对?
│   ├─ 是否只统计了部分 Lab_category?
│   └─ 是否把空结果也计入了?
├─ 死亡率不对?
│   ├─ 分母是住院还是患者?→ 官方按住院(8,180)
│   └─ 是否把"未知"计入了非死亡?
├─ 住院天数不对?
│   └─ 是否与 ICU LOS 混淆了?→ 17 天是全院住院
└─ 表数量不对?
    └─ 官方内部即有 11 vs 10 的矛盾 → 以表 2 的 10 张为准

6.15 八个坑点

坑点 1:患者与住院的混淆。 7,638 患者 vs 8,180 住院,差 542。分析单位选错会导致结果偏差。

坑点 2:ICU 住院识别不全。 只用 LIKE '%ICU%' 会漏掉急诊 ICU(部门名为 “Emergency medical department”/“Emergency Department”)。必须先枚举科室名。

坑点 3:把 DaysHospitalStay 当 ICU LOS。 17 天是全院住院,不是 ICU 停留。跨库比较时必须换算口径。

坑点 4:忽略单位不一致。 VitalSign_unit 与 Unit_measure 存在多单位情况,不做统一会引入量级错误。

坑点 5:跳过 MD5 校验。 3.22 GB 下载可能损坏,MD5 是唯一验证手段。

坑点 6:用日期做时间趋势。 官方明示日历日期被移除,无法做时间趋势研究。

坑点 7:不处理"未知"出院状态。 444 例(6%)的状态未知,如何处理会影响死亡率估计。

坑点 8:假设数据干净。 官方明示存在缺失与错误——这是真实临床数据的本质,必须做质检。

6.16 自查清单

  • [ ] MD5 校验通过(尤其 Lab.csv);
  • [ ] 确认 EMR 表 Hospital_ID 唯一值 = 8,180,patient_SN 唯一值 = 7,638;
  • [ ] 已枚举 HospitalTransfer 的科室名称,明确定义了 ICU 科室集合;
  • [ ] 已处理同一患者多次 ICU 停留;
  • [ ] 已明确分析单位(患者级还是住院级);
  • [ ] 按 patient_SN 划分训练/测试集;
  • [ ] 已统一 VitalSign 与 Lab 的单位;
  • [ ] 已处理"未知"出院状态;
  • [ ] 未使用日历日期做时间趋势分析;
  • [ ] 类别不平衡时报告 AUPRC 与校准;
  • [ ] 已引用数据集 + 论文 + 平台三层来源;
  • [ ] 未尝试再识别。

§7 AI 实践指南:把这份中国重症数据用起来

7.1 五种用法

用法 具体做法 价值
模型外部验证 在 MIMIC 训练、在 498 验证 解决医疗 AI 最缺的一环
耐药研究 用 DrugSens + MIC AMR 研究的稀缺数据源
中国 ICU 人群刻画 用 EMR + Diagnosis 统计 填补中国数据的空白
液体治疗/血流动力学 VitalSign + Medication 与团队研究兴趣一致
教学与练手 完整关系型真实数据 3.22 GB 的真实脏数据

7.2 一个 30 分钟的最小实验

  1. (5 分钟) 下载 EMR.csv 与 Diagnosis.csv(小表,快);
  2. (10 分钟) 统计病种分布:按 ICD10_code 的前 3 位分组,画出 Top 20 病种;
  3. (10 分钟) 计算基础统计:男女比例、年龄分布、死亡率、住院天数分布;
  4. (5 分钟) 与 MIMIC 的公开统计对比,列出差异。

这个实验不需要下载 1.83 GB 的 Lab 表就能完成,是判断"这份数据是否适合你"的低成本方式。

7.3 泄漏防控

泄漏类型 防控
患者级泄漏 按 patient_SN 划分
时间泄漏 特征只用预测时点之前的数据
结局泄漏 确保特征不含出院相关信息
信息泄漏 排除 StatusOnDischarge_Desc 等结局字段

第三条特别重要:如果预测"院内死亡",那么 DiagnosisOnDeath、StatusOnDischarge、DischargeTime 都是结局信息,绝不能作为特征。

7.4 公平性与偏差

偏差来源 说明 应对
单中心 仅浙江省人民医院 报告为单中心结论
三级医院 患者病情偏重、转诊来源 不外推到基层
时代 2012-2022 年诊疗变化 说明数据期
性别 男性占 64% 做性别分层分析
年龄 以中老年为主 不用于儿科结论

7.5 外部验证的实操建议

想在 MIMIC 与 498 之间做外部验证,推荐流程:

第 1 步:选定一个临床明确的预测任务
        (如"ICU 入院 24 小时内预测院内死亡")

第 2 步:在两个数据集中分别构建尽可能一致的队列
        (成人、首次 ICU 住院、排除住院<24h)

第 3 步:定义共同特征集
        (人口学 + 生命体征 + 常见检验)

第 4 步:统一单位与编码
        (血压 mmHg、肌酐 mg/dL、乳酸 mmol/L)

第 5 步:在一个库训练,在另一个库直接测试
        (报告性能衰减幅度)

第 6 步:分析衰减原因
        (是分布差异、还是编码差异、还是真实的人群差异)

第 6 步是这项研究最有价值的部分——它揭示了"模型为什么不能跨机构泛化"。

7.6 LLM 与这份数据的结合

结合方式 做法
影像报告结构化 用 LLM 从 ExamReport 抽取结构化发现
主诉标准化 用 LLM 把 ChiefComplain 映射到标准术语
特征工程辅助 用 LLM 从诊断名生成表型规则
结果解释 用 LLM 把模型输出翻译为临床语言

ExamReport 是最有潜力的方向:52.6 MB 的影像报告文本,若用 LLM 抽取结构化发现(如"是否有胸腔积液"“心影大小”),可以为 498 增加一个文本派生层——这与 496 的思路一致(把文本转成结构化)。

7.7 弱监督与规则

在标注稀缺的场景(498 无人工标注),弱监督是有效手段:

  • 规则提取表型:用 ICD-10 + 检验阈值定义脓毒症、AKI、ARDS;
  • 相互验证:用规则的 A 定义去检验规则的 B 定义,不一致处人工复核;
  • 迭代改进:规则 → 抽样复核 → 修正 → 再运行。

MIMIC 生态已有大量成熟的表型定义代码(如 sepsis-3、AKI KDIGO),可以移植到 498 的 ICD-10 体系——这是一个高性价比的工作。

7.8 成本核算

方案 获取成本 计算成本 适合
498 单独使用 零(开放下载) 中(3.22 GB) 单中心研究
498 + MIMIC 零 + 高(DUA 数周) 高 跨机构验证
498 + 495 零 + 中(DUA 数天) 中 中国成儿对照
# Lab 表处理的内存友好写法
import pyarrow.csv as pv
lab = pv.read_csv('Lab.csv')          # 比 pandas 省内存
import pyarrow.compute as pc
lab_f = lab.filter(pc.is_in(lab['Lab_itemName_Eng'],
                            value_set=pc.cast(core_items, 'string')))

7.9 复现包清单

发表基于 498 的研究时,建议附带:

  • [ ] 数据集版本与 DOI;
  • [ ] MD5 校验记录;
  • [ ] ICU 识别的科室名集合与逻辑代码;
  • [ ] 队列纳排标准的代码;
  • [ ] 特征工程代码(含单位统一);
  • [ ] 训练/测试划分脚本与种子;
  • [ ] 模型与超参;
  • [ ] 评价指标与校准曲线;
  • [ ] 环境依赖。

特别建议公开"ICU 识别的科室名集合"——这是 498 使用中每个研究者都要重新摸索的部分,公开它能为社区节省大量时间。

7.10 三个可立即执行的建议

  1. 今天:下载 EMR + Diagnosis,跑通病种分布统计(1 小时);
  2. 本周:完成 ICU 住院识别(枚举科室名 + 构建停留表),这是最有价值的公共品——建议直接开源;
  3. 本月:选一个预测任务(如院内死亡),建立基线,并公开划分与代码。

7.11 教学用法

498 是优秀的真实 EHR 教学材料:

教学环节 内容
关系型数据入门 10 张表的 join 练习
真实数据清洗 单位统一、缺失处理、异常值
队列构建 ICU 识别、纳排标准
预测建模 死亡预测全流程
外部验证概念 为什么单中心模型难外推

相比用 MIMIC 教学需要学生自行申请权限,498 让每个学生都能在 5 分钟内开始。

7.12 与其他数据集的组合研究设计

设计一:中美 ICU 对照

498(中国)+ MIMIC-IV(美国)
→ 同一预测任务,双向外部验证
→ 结论:中国人群的模型性能衰减多少?原因是什么?

设计二:成人-儿科对照

498(成人)+ 495 PIC(儿科)
→ 同一预后任务(如死亡率预测)
→ 结论:儿科与成人的预测特征权重是否不同?

设计三:开放-受控对照

498(开放)+ MIMIC(受控)
→ 同一算法在两库上的表现
→ 结论:用开放数据开发的算法,能否直接用于受控数据?

设计四:合成-真实对照

497(合成)+ 498(真实)
→ 在合成数据上开发,在真实数据上验证
→ 结论:合成数据的效用边界在哪里?

这四个设计都不需要复杂的方法创新,但都有明确的科学价值——它们回答的是"数据可用性"这一类基础设施问题,而这恰恰是医疗 AI 领域最缺的研究类型。

7.13 监控与回归(若作为内部基准)

若机构把 498 作为算法研发的内部基准,建议:

监控项 阈值
MD5 校验 每次使用前
核心统计量 患者数/住院数/死亡率应稳定
划分一致性 固定种子,保证可比
性能基准 基线模型指标不应变化

7.14 三个可发表的研究方向

  1. “中国 ICU 队列的开放化:一份可行性与局限的评估”——以 498 为案例,讨论中国医疗数据开放的技术与制度路径;
  2. “跨中美 ICU 的死亡率预测模型外部验证”——498 + MIMIC 的双向验证;
  3. “基于 MIC 的抗菌药物耐药趋势与经验性用药合理性”——DrugSens 表的深度利用。

7.15 与 496 的方法迁移

496(NIHSS)是从文本抽取结构化数值的方法论。498 的 ExamReport 表提供了类似的场景——从影像报告文本抽取结构化发现。可以:

  • 借用 496 的"实体 + 关系"建模思路;
  • 借用其两步管线(先 NER 后 RE);
  • 建立 498 特有的标注子集。

这是"方法在库间迁移"的一个具体路径。

§8 伦理、合规与数据开放的边界

8.1 三重责任主体

主体 责任
患者 数据来自真实患者,虽已去标识化,仍须防止再识别与不当使用
医院与团队 数据开放是团队的贡献,使用时须充分引用
使用者 不得误用、不得再识别、不得声称不实结论

8.2 去标识化的强度与残余风险

498 依据 HIPAA 去标识化,移除内容清单明确(地址、日期、号码、确切年龄)。但残余风险永远存在:

  • 罕见病 + 机构特征可能缩小到唯一患者;
  • 主诉与病史的自由文本可能含间接标识(如"某地旅游史");
  • 多次住院的文本指纹可能实现跨记录匹配。

因此,尽管数据开放,再识别尝试仍被明确禁止。这是使用开放医疗数据的底线纪律。

8.3 中国法规框架下的使用

对中国研究者,使用 498 涉及:

法规 相关要求
《个人信息保护法》 数据处理须符合合法性、正当性、必要性
《数据安全法》 数据分类分级保护
《人类遗传资源管理条例》 若涉及遗传资源,需相应审批
机构伦理审查 多数机构要求数据使用走内部流程

注意:数据本身来自中国,但托管在美国的 PhysioNet。中国研究者使用它,属于"使用境外托管的中国来源数据",须经机构合规确认。

8.4 “开放获取"不等于"无约束”

498 是开放获取,但使用仍有约束:

约束 内容
引用义务 必须引用数据集 + 论文 + 平台
禁止再识别 不得尝试识别个体
不得误用 不得用于临床决策或不当商业宣传
不得声称不实 单中心结论不得推广为普适结论
质量声明 应说明数据存在缺失与错误

“开放"意味着"可达”,不意味着"免责"。

8.5 单中心结论的表述规范

使用 498 发表研究时,结论表述应遵循:

  • ✅ “在浙江省人民医院 ICU 队列中,我们观察到……”
  • ✅ “在单中心中国成人 ICU 数据中,模型 AUROC 达到……”
  • ❌ “中国 ICU 患者的死亡率是 6%”
  • ❌ “该模型可用于中国 ICU 的临床决策”

差别的核心是:从"一个中心的观察"到"一个国家的规律"之间,隔着采样代表性这道不可逾越的沟。

8.6 数据质量声明的义务

官方明示数据存在缺失与错误。使用者的责任是:

  • 报告缺失处理策略(删除/插补/建模);
  • 报告异常值处理策略;
  • 做敏感性分析(不同缺失处理是否改变结论);
  • 在局限性中说明。

这是科学诚实的要求,而非形式主义。

8.7 与 495 的合规路径对照

维度 495 PIC 498 浙江
访问模式 受控(培训 + DUA) 开放
培训要求 人体受试者培训或中国 GCP 无
审批时间 约 3 个工作日 无
去标识化 日期向未来平移 50-100 年 日期移除
引用义务 强制 强制
再识别禁令 有 有

两者的共同点:无论开放与否,引用义务与再识别禁令都不变。这是医疗数据伦理的底线。

8.8 数据开放的制度意义(一个诚实的观察)

498 的价值不应只在技术层面被理解。它也是一次制度实践:证明了中国医院在现有法规框架下,可以完成从院内数据到国际开放数据集的完整路径。

这条路径包含的每一环都有可借鉴之处:

  1. 伦理审批(QT2022185);
  2. 回顾性设计的知情同意豁免;
  3. HIPAA 标准的去标识化;
  4. 结构化与质控;
  5. 开放托管;
  6. 论文发表与代码共享。

对其他有意开放的机构,这是一份现成的路线图。

§9 FAQ:五十问

9.1 关于身份与获取

Q1:官方名称是什么?
Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center。

Q2:官方 slug?
zhejiang-ehr-critical-care。

Q3:DOI 是多少?
10.13026/901c-yv54。

Q4:几个版本?
v1.0,2023-01-19 发布,未见更新。

Q5:免费吗?
免费且开放获取,无需 DUA 审批。

Q6:需要培训吗?
不需要(与 495 PIC 不同)。

Q7:数据在哪个医院产生的?
浙江省人民医院(Zhejiang Provincial People’s Hospital)。

Q8:有几个 ICU?
2 个:综合中心 ICU 与急诊 ICU(EICU)。

Q9:伦理批号是多少?
QT2022185(浙江省人民医院伦理委员会)。

Q10:资助来自哪里?
浙江省卫健委青年人才 2019323925;医路革新-液体治疗 YLGX-ZZ-2020005;浙江省健康科技 2021KY745。

9.2 关于规模与内容

Q11:有多少患者?
7,638 名。

Q12:有多少住院?
8,180 次。

Q13:为什么患者数少于住院数?
因为部分患者多次入院(542 次差别)。

Q14:时间跨度多久?
2012-01 至 2022-05,约 10 年 4 个月。

Q15:有多少张表?
官方表 2 列 10 张(摘要另称 11 张,存照)。

Q16:总大小多大?
约 3.22 GB。

Q17:最大的表是哪个?
Lab.csv,1.83 GB。

Q18:有多少检验记录?
11,082,482 条。

Q19:有多少种检验项目?
214 种。

Q20:有药敏数据吗?
有,DrugSens 表,含 MIC 值。

Q21:有影像数据吗?
没有影像本体,但有 ExamReport 报告文本(CT/超声/MRI)。

Q22:有文本数据吗?
有,EMR 表含主诉、病史等自由文本;ExamReport 含报告文本。

Q23:包含儿科患者吗?
仅 35 例(0-18 岁),主体是成人。

Q24:包含全院还是仅 ICU 患者?
所有入住 ICU 的患者,但 EMR 表包含全院住院信息(含住院天数等)。

Q25:有排除标准吗?
官方明确"无排除标准"。

9.3 关于数据结构

Q26:主键是什么?
patient_SN(患者)+ Hospital_ID(住院)。

Q27:如何识别 ICU 住院?
通过 HospitalTransfer 表的转科事件推断。

Q28:为什么不直接用 ICU 标记字段?
原始系统未单独维护"ICU stay"实体,通过床位流转体现。

Q29:诊断用什么编码?
ICD-10(ICD10_code 字段)。

Q30:检验项目用编码还是名称?
用英文名称(Lab_itemName_Eng),比 MIMIC 的 ITEMID 更可读。

Q31:有字典表吗?
没有,项目名称内嵌在事件表中。

Q32:MedOrder 和 Medication 有什么区别?
MedOrder 是医嘱开立,Medication 是实际执行。

Q33:VitalSign 表是长表吗?
是,每行一个测量事件。

Q34:有单位字段吗?
有,VitalSign_unit 与 Unit_measure。

Q35:日期格式统一吗?
需自行核查,官方未说明格式规范。

Q36:Hospital_ID 有几种格式?
至少两种前缀(ZY|、IP|),说明系统十年间有迁移。

Q37:能跨住院追踪同一患者吗?
能,通过 patient_SN。

Q38:DaysHospitalStay 是 ICU 停留还是全院?
全院住院天数(不是 ICU LOS)。

Q39:有几类出院状态?
四类:治愈/未治愈/死亡/未知。

Q40:有 SOFA 评分的现成字段吗?
没有,需从 VitalSign + Lab 自行计算。

9.4 关于使用

Q41:能用于临床决策吗?
不能。单中心回顾数据不支持临床决策。

Q42:能做外部验证吗?
可以,这正是它最有价值的用途之一。

Q43:能和 MIMIC 联合分析吗?
可以,但需处理 ICD-9/10、单位、变量名等对齐问题。

Q44:能做时间趋势研究吗?
官方明示不能(日历日期被移除)。

Q45:数据干净吗?
不完全干净,官方明示存在缺失值与错误。

Q46:需要清洗多久?
视任务而定,基础任务约数天到数周。

Q47:用什么工具处理?
官方推荐 R(tidyverse/data.table/icd);Python 完全可行。

Q48:Lab 表太大怎么办?
分块读取、只读需要的列、或用 data.table/pyarrow。

Q49:有官方基线模型吗?
没有,需自建。

Q50:有官方划分吗?
没有,需自行划分(建议按 patient_SN)。

9.5 进阶问答

Q51:DrugSens 表的 MIC 值有什么特别价值?
MIC 是定量值,比 S/I/R 分类包含更多信息:支持趋势分析、PK/PD 建模、断点漂移研究。这是 MIMIC 与 PIC 都不具备的。

Q52:为什么死亡率只有 6%?
因为队列"无排除标准",包含较多病情较轻的患者;且"治愈"的判定标准由医院系统定义。

Q53:为什么住院日中位 17 天这么长?
这是全院住院而非 ICU 停留,且中国三级医院的重症患者住院期普遍较长(制度、康复体系、文化因素)。

Q54:如何正确处理"未知"出院状态?
444 例(6%)。可做敏感性分析:把未知并入非死亡 vs 剔除 vs 单独建模,看结论是否稳健。

Q55:为什么数据表数量有矛盾?
官方摘要写 11 张、正文与表 2 列 10 张。以表 2 为准(实证优先)。

Q56:PhysioNet 与论文的作者名单为什么不同?
PhysioNet 页面署名 4 人,论文署名 6 人。两者都是有效来源,引用时以使用的为准。

Q57:能把 ExamReport 的文本结构化吗?
可以,这是高价值方向——可借用 496 的方法论做从报告文本抽取结构化发现。

Q58:能做脓毒症研究吗?
可以。用 ICD-10 + 检验/生命体征按 Sepsis-3 定义筛队列,或用来源论文的纳排标准。

Q59:抗菌药物管理(stewardship)研究怎么做?
把 DrugSens(病原敏感性)与 Medication(实际用药)结合,评估经验性用药的合理性。

Q60:能用于药物流行病学吗?
可以,但受限于单中心与数据结构(无精确日期),需谨慎设计。

Q61:能算 Charlson 合并症指数吗?
可以,用 Diagnosis 表的 ICD-10 编码 + icd 包。

Q62:能有 SOFA/LODS 评分吗?
需自行计算:从 VitalSign(MAP、GCS)+ Lab(肌酐、胆红素、血小板、PaO2)+ Medication(升压药)派生。

Q63:单位不一致怎么处理?
先从数据中统计所有单位取值,建立单位映射表,统一到标准单位。

Q64:为什么官方强调无法做时间趋势?
因为真实日历日期被移除以防再识别。这是隐私保护的必然代价。

Q65:数据还会更新吗?
未见表态。数据集冻结在 2022-05,医院数据仍在产生。

Q66:能联系团队获取更新吗?
可以通过 GitHub 仓库或论文通讯作者联系。

Q67:这份数据与中国其他重症库的关系?
与 495 PIC 互补(成人 vs 儿科;开放 vs 受控)。

Q68:能用于多模态研究吗?
有限——有 ExamReport 文本,但无影像本体。

Q69:能做联邦学习吗?
可以,它是联邦学习中一个理想的"本地数据集"候选。

Q70:值不值得投入时间使用?
如果你做中国重症研究、模型外部验证或耐药研究,值得——它是少数开放且真实的中国重症数据。

9.8 番外:三个反问

反问一:开放数据会不会因为"太容易拿到"而被滥用?
这是真实的风险。但反向的推论——“因为怕滥用所以不开放”——代价更大:它让所有正当研究都无法进行。498 的选择是:用充分去标识化降低风险,用引用规范与再识别禁令约束使用,把"可达性"还给研究社区。

反问二:7,638 名患者够吗?
对深度学习是偏小的(尤其 438 例死亡事件);对统计建模与外部验证是够的。关键不在绝对规模,而在它能否回答你的问题——如果问题是"中国成人 ICU 的死亡预测能否外推",它足够。

反问三:这份数据最大的贡献是数据本身,还是它的示范意义?
两者都是。数据本身可以立即使用;示范意义则更长久——它证明了在中国,医疗数据开放是一条走得通的路。后者的价值可能超过前者。

§10 存照、引文与系列关系

10.1 存照(口径局限与勘误)

存照 A(表数量矛盾):官方摘要称 11 张表,正文数据描述与表 2 均列 10 张。本条目以表 2 的 10 张为准(实证优先)。

存照 B(作者名单不一致):PhysioNet 页面署名 4 人(Jin S, Chen L, Chen K, Zhang Z),原始 Sci Data 论文署名 6 人(多 Hu C、Hu S)。引用时以实际使用的来源为准。

存照 C(机构未逐人列出):页面未列各作者具体所属机构,仅知研究机构为浙江省人民医院。

存照 D(许可协议未明确):页面称"开放获取"但未列出具体协议名称(ODC/CC 等),是本条目最大的规范短板。

存照 E(PMID 缺失):关联论文未提供 PMID;其 DOI 为 10.1038/s41597-023-01952-3。

存照 F(时间信息的张力):官方明示"因日历数据移除无法做时间趋势研究",但同时又描述"2018 年后 ICU 住院数显著增加"——说明年份级信息可能以粗粒度形式保留,而月日级被移除。使用者需自行核查可用的时间粒度。

存照 G(体积与下载成本):10 表合计约 3.22 GB,Lab 表 1.83 GB。虽是开放获取,但下载与处理成本不可忽略。

存照 H(ICU 识别需自行枚举):ICU 住院须通过 HospitalTransfer 表推断,且急诊 ICU 的部门名可能不含 “ICU” 字样(“Emergency medical department”/“Emergency Department”),仅用字符串匹配会漏检。必须先枚举实际科室名。

存照 I(多次 ICU 停留的拆分规则未明):同一患者多次进出 ICU 的拆分规则官方未详述,需自行定义。

存照 J(数据质量官方警告):官方明示数据存在缺失值与错误,使用者须自行清洗并报告策略。

存照 K(口径陷阱):DaysHospitalStay 为全院住院天数(中位 17 天),非 ICU 停留时长;与 MIMIC 的 ICU LOS 不可直接比较。

存照 L(未知出院状态):444 例(6%)出院状态为"未知",处理方式会影响死亡率估计。

存照 M(平台引用义务):PhysioNet 2026 年要求一并引用平台论文(Pollard et al., Nature Health 2026, DOI 10.1038/s44360-026-00096-z)。

存照 N(DrugSens 的独特价值):该表含 MIC 定量值,是 498 相对 MIMIC 与 PIC 的显著增量能力,支撑抗菌药物耐药研究。

10.2 引文

  1. Jin S, Chen L, Chen K, Zhang Z. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center (version 1.0). PhysioNet. 2023. RRID:SCR_007345. DOI: 10.13026/901c-yv54.
  2. Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center. Scientific Data. 2023. DOI: 10.1038/s41597-023-01952-3.
  3. Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health. 2026;1(8):792-795. DOI: 10.1038/s44360-026-00096-z.
  4. Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data. 2016;3:160035.
  5. Singer M, Deutschman CS, Seymour CW, et al. The Third International Consensus Definitions for Sepsis and Septic Shock (Sepsis-3). JAMA. 2016;315(8):801-810.
  6. Vincent JL, Moreno R, Takala J, et al. The SOFA (Sepsis-related Organ Failure Assessment) score to describe organ dysfunction/failure. Intensive Care Med. 1996;22(7):707-710.
  7. Quan H, Sundararajan V, Halfon P, et al. Coding algorithms for defining comorbidities in ICD-9-CM and ICD-10 administrative data. Med Care. 2005;43(11):1130-1139.(Charlson 指数 ICD-10 实现)
  8. Charlson ME, Pompei P, Ales KL, MacKenzie CR. A new method of classifying prognostic comorbidity in longitudinal studies. J Chronic Dis. 1987;40(5):373-383.
  9. KDIGO. KDIGO Clinical Practice Guideline for Acute Kidney Injury. Kidney Int Suppl. 2012;2:1-138.(AKI 定义)
  10. 张忠恒团队重症数据相关研究(该作者团队另有脓毒症、液体治疗等多篇论文).

10.3 与既有条目的系列关系

关系 说明
中国重症双层 495 PIC(儿科,ZUCH,受控)↔ 498 浙江(成人,省人民医院,开放)
开放路径对照 497 Health Gym(合成换开放)↔ 498(去标识化换开放):两种"开放"的实现方式
外部验证配对 498 是 MIMIC(492)模型的最佳外部验证对象之一
方法迁移 496 的文本抽取方法可迁移到 498 的 ExamReport
结构对照 495 有字典表与 16 张表;498 无字典表、10 张表但更开放

10.4 变更日志

日期 变更
2026-09-20 初版发布:完成身份核查(PhysioNet v1.0)、论文核查(Sci Data 2023)、三段撰写、双检、发布、封面、DB 验证

声明:本条目为千方病案医数集 AI-Ready 数据集百科的组成部分,仅整理公开元数据与公开文献信息。本数据集为开放获取资源,但其使用仍须遵守引用义务与禁止再识别的要求。所有数字均标注来源,存疑处列入 §10 存照。单中心回顾性数据的结论不可推广为普适规律,亦不构成临床决策依据。

使用须知:本文内容用于研究与信息参考。任何临床决策应由有资质的医疗专业人员基于具体患者情况作出。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • hirid — 共享标签:电子健康记录 / 重症监护
  • eicu-collaborative — 共享标签:电子健康记录 / 重症监护
  • mimic-iv-ed — 共享标签:电子健康记录 / 重症监护
  • mimic-br — 共享标签:电子健康记录 / 重症监护
  • pcornet — 共享标签:电子健康记录 / 重症监护
  • mimic-iv-ed — 共享标签:电子健康记录 / 重症监护
  • mimic-iv-clinical-database — 共享标签:电子健康记录 / 重症监护
  • amsterdamumcdb — 共享标签:电子健康记录 / 重症监护
  • sicdb — 共享标签:电子健康记录 / 重症监护
  • pic — 共享标签:电子健康记录 / 重症监护

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集