信息速览
Chinese Critical Care Database (Zhejiang Provincial People’s Hospital) — AI-Ready 数据集百科
一句话:这是中国三级医院重症数据里少见的全开放样本——浙江省人民医院 2012 年 1 月至 2022 年 5 月间的 7,638 名 ICU 患者、8,180 次住院,拆成 10 张关系表,含 1,108 万条检验记录 与一张罕见的独立抗菌药物敏感性表(带 MIC 值)。它不需要 DUA,能直接下载。
INFOBOX
| 属性 | 值 |
|---|---|
| 官方名称 | Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center |
| 发布方 | PhysioNet |
| 版本 | v1.0(初版,2023-01-19 发布) |
| DOI | 10.13026/901c-yv54 |
| RRID | SCR_007345 |
| 数据来源医院 | 浙江省人民医院(Zhejiang Provincial People’s Hospital) |
| 页面作者 | Senjun Jin, Lin Chen, Kun Chen, Zhongheng Zhang |
| 论文作者 | Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z(6 人) |
| 关联论文 | Scientific Data (2023),DOI 10.1038/s41597-023-01952-3 |
| 患者数 | 7,638 |
| 住院数 | 8,180 |
| 时间跨度 | 2012-01 至 2022-05(约 10 年 4 个月) |
| 数据表 | 10 张(官方摘要另称 11 张,存照 A) |
| 检验记录 | 11,082,482 条 / 214 种项目 |
| 总大小 | 约 3.22 GB |
| ICU | 2 个(综合中心 ICU + 急诊 ICU/EICU) |
| 性别构成 | 男 5,215(63.8%)/ 女 2,965(36.2%) |
| 住院日中位 | 17 天(Q1-Q3:10-28) |
| 出院状态 | 治愈 73% / 未治愈 16% / 死亡 6% / 未知 6% |
| 去标识化 | HIPAA 标准;patient_SN 随机分配,不可回溯 |
| 访问级别 | 开放获取(无需 DUA) |
| 许可 | 页面未明确具体协议名(存照 D) |
| 伦理审批 | 浙江省人民医院伦理委员会 QT2022185 |
| 代码 | github.com/zh-zhang1984/ZhejiangProvinceICU |
| 资助 | 浙江省卫健委青年人才 2019323925;医路革新-液体治疗 YLGX-ZZ-2020005;浙江省健康科技 2021KY745 |
| 适合任务 | 重症预测建模、模型外部验证、抗菌药耐药研究、因果推断、成本效益分析 |
§0 速览与信任声明:为什么这座 3.22 GB 的宝库值得认真对待
中国的重症医学数据长期面临一个两难:数据量大但未开放,或开放但规模极小。临床医生手里的信息系统里睡着海量真实数据,但受限于法规、伦理、机构意愿,几乎没有一条通路能让外部研究者用上。这导致一个尴尬的局面——中国重症研究在国际上的可复现性一直偏弱,因为没有人能拿到能复现的数据。
498 这组数据是一个明确的突破:它是中国三级医院的重症数据库,而且完全开放。
三条速览结论:
- 它的开放程度在中国重症数据里是罕见的。同系列的 495(Paediatric Intensive Care database,浙江大学医学院附属儿童医院)虽然是"首个免费英汉双语临床数据库",但仍需完成人体受试者培训或 GCP 认证并签署 DUA,审批约 3 个工作日。而 498 是 Openly accessible——打开即下载,没有审批流程。这个差别对研究的可达性影响极大。
- 它有一张别的库都没有的表:抗菌药物敏感性(DrugSens)。这张表不只记录"该菌对某药敏感还是耐药",还带 MIC(最小抑菌浓度)值。这意味着它可以直接支撑抗菌药物耐药性(AMR)研究——这是全球公共卫生的头号威胁之一,而公开数据极少。MIMIC 系列没有独立的药敏表,495 也没有。
- 它的设计有清晰的重症语义。10 张表里,HospitalTransfer(院内转科)是识别 ICU 住院的机制,MedOrder(医嘱)与 Medication(用药)被分开——前者是"医生开立",后者是"实际执行"。这种细分体现了对临床工作流的深入理解。
必须立刻说清的边界:
- 它是单中心数据(浙江省人民医院),外推性有其固有局限;
- 它明示存在缺失值与错误——官方自己写在页面上,使用者不能假设数据干净;
- 日历日期被移除,官方明示无法做时间趋势研究;
- 表数量在官方页面内部矛盾(摘要 11 张 vs 表 2 的 10 张)。
0.1 名称、作者与范围勘误
三点必须说清:
- 名称:官方全称很长(“Establishment of a Chinese critical care database…”),实际引用时通常简称为 Zhejiang ICU database 或 Zhejiang Province ICU。代码仓库名即
ZhejiangProvinceICU。 - 作者名单不一致:PhysioNet 页面署名 4 人(Jin S, Chen L, Chen K, Zhang Z),原始 Sci Data 论文署名 6 人(多 Hu C、Hu S)。引用时以你实际使用的来源为准(存照 B)。
- 表数量矛盾:摘要写 11 张,正文与表 2 列 10 张。本条目采用 10 张(以表 2 实证为准,存照 A)。
0.2 一分钟版本(给赶时间的管理者)
- 这是什么:中国浙江省人民医院的开放获取重症 EHR 数据库;
- 覆盖多久:2012 年 1 月至 2022 年 5 月,跨十年;
- 规模多大:7,638 名患者、8,180 次住院、1,108 万条检验、3.22 GB;
- 数据在哪:PhysioNet(DOI 10.13026/901c-yv54);
- 门槛多高:没有门槛——开放获取,下载即用;
- 最亮的点:独立的抗菌药物敏感性表(含 MIC 值),这是 MIMIC 与 PIC 都没有的;
- 最大的坑:官方明示数据有缺失与错误;日历日期被移除,不能做时间趋势研究;单中心。
0.3 与本系列既有条目的关系
| 条目 | 关系 |
|---|---|
| 495 Paediatric Intensive Care (PIC) | 最直接的对照:同为中国重症库,PIC 是儿科(ZUCH)+ 需 DUA + 双语;498 是成人为主(浙江省人民医院)+ 开放获取 |
| 490/491 MIMIC-III | 均为重症 EHR 关系型库;MIMIC-III 是美国单中心(BIDMC),498 是中国单中心 |
| 492 MIMIC-IV | 同为 EHR 库,但 MIMIC-IV 是当前主流版本、受控访问;498 是开放获取 |
| 493/494/496 | 那些是 MIMIC 上的派生标注层;498 无对应标注层,是原始库 |
| 497 Health Gym | 497 是从 MIMIC-III 生成的合成数据;498 是真实的开放数据——"开放"的两条不同路径 |
§1 背景:中国重症数据开放的一次具体尝试
1.1 中国重症数据的三重困局
要理解 498 的意义,需要先理解它突破了什么。中国重症医学数据长期面临三重困局:
第一重:法规与伦理的谨慎
《个人信息保护法》《数据安全法》确立了对医疗健康数据的严格保护框架。这本身是正确且必要的,但客观上提高了数据对外共享的合规成本。研究者想做数据开放,往往面临"合规路径不清"的困境。
第二重:机构的动力不足
医院的真实数据是资产,但开放它并不直接带来收益,反而带来风险(隐私、舆情、合规)。这使得"开放"在机构决策中天然处于劣势。
第三重:技术门槛
即使有意愿开放,把院内异构信息系统(HIS、LIS、PACS、EMR)的数据导出、清洗、对齐、去标识化、结构化,本身就是一项大工程。
498 的价值在于:它证明这三重困局是可以突破的。浙江省人民医院团队完成了一次完整的"从院内信息系统到 PhysioNet 公开数据集"的路径。
1.2 为什么选"开放获取"而不是"受控访问"
这是一个值得琢磨的设计选择。对比同系列的两个中国库:
| 495 PIC | 498 浙江 EHR | |
|---|---|---|
| 访问模式 | 受控(培训 + DUA) | 开放获取 |
| 是否需审批 | 需要(约 3 个工作日) | 不需要 |
| 可否自由再分发 | 受限 | 更宽松 |
从隐私保护角度,"受控"更安全;从研究可达性角度,"开放"更高效。498 选择开放,说明团队对去标识化的充分性有足够信心——他们依据 HIPAA 标准完成去标识化,移除了地址、出生/入院/出院/医嘱日期、个人号码、入院确切年龄,患者标识符随机分配且不可回溯。
这个选择是有意识的权衡:用"充分的去标识化"换取"零门槛的可达性"。
1.3 数据来源机构:浙江省人民医院
- 机构:浙江省人民医院(Zhejiang Provincial People’s Hospital)
- 位置:中国浙江
- 级别:三级医疗中心(tertiary care medical center)
- ICU 设置:两个——综合中心 ICU 与急诊 ICU(EICU)
- 纳入标准:所有入住该院 ICU 的患者,无排除标准
"无排除标准"这一点值得注意。许多重症数据库会排除某些人群(如住院时间过短、年龄过小),以获得"更干净"的队列。498 选择全纳,好处是保留了临床真实谱系的完整性(包括住院时间短的、病情轻的),代价是数据中会混入更多噪声。这是一个"保真 vs 干净"的取舍,与 497 的合成数据设计思路形成对照。
1.4 时间跨度:十年零四个月
2012 年 1 月至 2022 年 5 月——这个跨度在中国开放重症数据里相当可观:
- 覆盖了医疗信息化的快速演进期;
- 覆盖了 2018 年的 ICU 床位扩张(官方明确提到该年住院数显著增加);
- 覆盖了 COVID-19 疫情的前两年多(2020 年 1 月至 2022 年 5 月),这对研究疫情对重症医疗的影响有直接价值。
但一个关键限制随之而来:日历日期被移除。官方明示因此"无法进行时间趋势相关研究"。这里的逻辑是:细粒度日期(含月日)被移除以防再识别,但粗粒度年份信息(如"2018 年后住院增加")可能仍以某种形式保留。这是去标识化中的一个经典权衡——如何在保护隐私的同时保留时间趋势分析能力。498 选择了保护优先(存照 F)。
1.5 团队与资助
- 通讯/资深作者:Zhongheng Zhang(张忠恒)——重症医学领域的活跃研究者,长期从事脓毒症、液体治疗、重症数据研究;
- 资助构成:
- 浙江省卫生健康委员会青年人才项目(2019323925);
- 医路"革新"-液体治疗研究基金项目(YLGX-ZZ-2020005);
- 浙江省健康科技计划(2021KY745)。
- 这三个资助来源都指向临床应用导向的重症研究,与数据集"支持预测分析、外部验证、因果推断、成本效益分析"的定位一致。
1.6 伦理与合规路径
498 的伦理合规路径清晰且可借鉴:
| 环节 | 内容 |
|---|---|
| 伦理审批 | 浙江省人民医院伦理委员会,批准号 QT2022185 |
| 知情同意 | 因回顾性设计被豁免 |
| 伦理准则 | 遵循《赫尔辛基宣言》 |
| 去标识化标准 | HIPAA |
| 移除内容 | 地址、出生/入院/出院/医嘱日期、电话/社保/医院编号、入院确切年龄 |
| 标识符处理 | patient_SN 与 hospital_ID 随机分配,原始标识符未保留 |
| 人员标识 | 医生/护士/药剂师标识符全部移除 |
| 自由文本 | 日期以星号替换,姓名/ID/地址/电话被移除或替换 |
这条路径的完整性说明:中国机构完全有能力在合规框架内完成数据开放。它为其他有兴趣的机构提供了一份可参照的模板。
1.7 数据的临床语义深度
498 的表设计体现了对重症临床工作流的理解。举三个例子:
例一:HospitalTransfer 表作为 ICU 识别机制
MIMIC 用独立的 ICUSTAYS 表标记 ICU 住院;498 没有这样的表,而是通过 院内转科事件(TransferIn/TransferOut 时间 + TransferTo/From_Dept_Eng)来推断 ICU 停留。这更贴近真实系统——很多医院的信息系统并不单独维护"ICU stay"实体,而是通过床位流转记录来体现。代价是使用者的推断逻辑需要自己写。
例二:MedOrder 与 Medication 分离
- MedOrder(医嘱):医生开立了什么,含开立/停止时间;
- Medication(用药):实际执行了什么,含单次剂量、频次、单位、给药途径。
这两者在临床上是不同的事件(医嘱可能被取消、可能执行了但剂量调整)。分开建表使研究者能区分"开立"与"执行",这对研究医嘱依从性、用药偏差等问题至关重要。
例三:DrugSens 表带 MIC
抗菌药物敏感性表不只记录分类结果(S/I/R),还记录 MIC 值。MIC 是定量指标,比分类结果蕴含更多信息——它支持耐药趋势分析、PK/PD 建模、断点漂移研究。
1.8 与 MIMIC 的设计哲学对照
| 维度 | MIMIC-III/IV | 498 浙江 EHR |
|---|---|---|
| 表组织 | 按事件类型细分(数十张) | 综合成 10 张宽表 |
| 字典表 | 有(D_ITEMS 等) | 无独立字典表(项目名内嵌) |
| ICU 标记 | 独立 ICUSTAYS 表 | 通过 HospitalTransfer 推断 |
| 项目编码 | ITEMID 数字编码 | 项目英文名(Lab_itemName_Eng) |
| 药敏 | 无独立表 | 有(DrugSens + MIC) |
| 医嘱 | 有(PRESCRIPTIONS/EMAR) | 有(MedOrder,独立) |
| 语言 | 英文 | 主要为英文(字段名 _Eng) |
两者的差异反映了不同的设计取舍:MIMIC 追求规范化与可扩展(大量细表 + 字典),498 追求紧凑与易用(10 张宽表,项目名直接可读)。对使用者而言,498 的上手门槛更低(不需要查字典表),但灵活性也略低。
1.9 这份数据的四个高价值使用场景
场景一:模型外部验证
在 MIMIC 上训练的死亡率预测、AKI 预测、脓毒症识别模型,可以在 498 上做跨人群、跨机构的外部验证。这是当前医疗 AI 最缺的一环——多数论文只有内部验证,因为拿不到第二个数据集。498 的开放获取使这件事变得可行。
场景二:抗菌药物耐药研究
DrugSens 表的 MIC 值支持:耐药率的时间演变、不同菌种的耐药谱、经验性用药的合理性评估、耐药与结局的关联分析。
场景三:液体治疗与血流动力学研究
资助来源里直接有"液体治疗研究基金",团队在这方面的积累可以支撑:液体复苏量与结局的关系、升压药使用模式、血流动力学不稳定预测。
场景四:中国重症临床特征刻画
与 MIMIC(美国)对比,可研究中国 ICU 患者的病种谱、住院时长、死亡率差异及其制度性原因。
1.10 用户画像
| 用户类型 | 典型诉求 | 本数据集能提供 |
|---|---|---|
| 重症医学研究者 | 需要中国人群的真实重症数据 | 7,638 患者的十年数据 |
| 医疗 AI 工程师 | 需要外部验证数据集 | 开放下载、无需审批 |
| 抗菌药研究者 | 需要药敏与 MIC 数据 | 独立 DrugSens 表 |
| 临床流行病学者 | 需要中国 ICU 人群特征 | 8,180 次住院的人口学统计 |
| 建模方法研究者 | 需要真实世界的脏数据 | 官方明示含缺失与错误 |
| 教学者 | 需要真实 EHR 教学案例 | 3.22 GB 完整关系型数据 |
1.11 一条使用前的必要提醒
虽然是开放获取,仍有三条纪律:
- 不要尝试再识别——即使技术上可能(如通过罕见病 + 时间推断),也严禁尝试;
- 引用要完整——数据集 + 原始论文 + PhysioNet 平台论文(2026 年新要求);
- 不要声称临床有效性——基于单中心回顾数据得出的模型,不能直接声称可用于临床。
1.12 阅读本条的路线建议
- 想判断能不能用:读 §0.2 + §1.9 使用场景 + §3 规格;
- 想装载数据:读 §5 装载协议(含 R/Python 路径);
- 想了解 ICU 识别:读 §4.5 HospitalTransfer 机制;
- 想研究耐药:读 §6.7 DrugSens 深读;
- 想做外部验证:读 §7.5 + §5.9;
- 想找数字:读 INFOBOX、§6 实证、§10 存照。
§2 领域概念:中国重症数据、AMR 与电子病历二次利用
2.1 什么是"重症监护数据库"
重症监护数据库是把 ICU(Intensive Care Unit,重症监护病房)患者的高频监测数据、治疗干预、检验结果结构化为可分析格式的数据集合。它的特点:
| 特点 | 说明 |
|---|---|
| 时间粒度细 | 生命体征常为小时级甚至分钟级 |
| 数据密度高 | 一个 ICU 患者一天可产生数千条记录 |
| 干预密集 | 用药、液体、机械通气、CRRT 等 |
| 结局明确 | 死亡、转出、住院时长 |
| 多模态 | LIS(检验)、HIS(医嘱)、PACS(影像报告)、EMR(病历) |
498 覆盖了上述所有方面(除 PACS 影像本体外,有 ExamReport 报告文本)。
2.2 中国重症数据的三种"可及性层级"
| 层级 | 特征 | 代表 |
|---|---|---|
| 完全封闭 | 仅机构内部使用 | 绝大多数医院数据 |
| 受控开放 | 需审批 + DUA | 495 PIC |
| 完全开放 | 下载即用 | 498 浙江 EHR |
498 处在第三层——这一层在中国重症数据里目前仍属少数。这个分层很重要:它意味着研究者的可达性成本从"数周审批"降到"零"。
2.3 抗菌药物耐药(AMR):为什么 DrugSens 表重要
AMR(Antimicrobial Resistance,抗菌药物耐药) 是全球公共卫生的头号威胁之一。世界卫生组织将其列为十大全球健康威胁。而 AMR 研究的基础是药敏数据。
药敏检测的两种报告形式:
| 形式 | 含义 | 信息量 |
|---|---|---|
| 分类结果(S/I/R) | 敏感 / 中介 / 耐药 | 定性,三分类 |
| MIC | 最小抑菌浓度(μg/mL 或 mg/L) | 定量,连续值 |
MIC 的价值在于:
- 支持趋势分析:即使分类结果不变,MIC 的漂移也能提前预警耐药演化;
- 支持 PK/PD 建模:药代/药效学分析需要定量值;
- 支持断点研究:CLSI/EUCAST 的判定断点会修订,MIC 原始值使历史数据可重新判定。
498 的 DrugSens 表同时含 DrugSens_result(分类)与 MIC(定量),两者互补。
2.4 MIC 与"最小抑菌浓度"的临床含义
MIC(Minimal Inhibitory Concentration):抑制细菌可见生长的最低抗菌药物浓度。读法:
| MIC 值 | 通常含义 |
|---|---|
| 低(如 0.5 μg/mL) | 细菌对该药敏感 |
| 高(如 64 μg/mL) | 细菌耐药 |
| 中间 | 需结合断点判定 |
关键概念是断点(breakpoint):由 CLSI(美国)或 EUCAST(欧洲)设定,规定"MIC ≤ X 为敏感、≥ Y 为耐药"。断点会随耐药演化而修订,因此保存 MIC 原始值比只存分类结果更有长期价值——历史数据可以在新断点下重新解读。
2.5 电子病历二次利用的三种范式
498 支持的是回顾性电子病历二次利用,其三种典型范式:
| 范式 | 研究问题 | 498 支持度 |
|---|---|---|
| 预测建模 | 能否预测死亡率/AKI/脓毒症? | ✅ 强支持 |
| 因果推断 | 某治疗是否改善了结局? | ✅ 支持(有干预数据) |
| 描述性研究 | 中国 ICU 患者是什么样? | ✅ 支持(有人口学与结局) |
三者的共同前提是:数据要能被拼成一个"患者级"的分析表。这正是使用 498 的第一项工程工作——通过 patient_SN 与 Hospital_ID 把 10 张表 join 起来。
2.6 去标识化中的"效用-隐私"权衡
HIPAA 去标识化有两种方法:
| 方法 | 做法 | 影响 |
|---|---|---|
| Expert Determination | 专家评估再识别风险 | 灵活但主观 |
| Safe Harbor | 移除 18 类标识符 | 标准明确但可能移除过多 |
498 更接近 Safe Harbor——移除了地址、日期、号码等。其后果:
- 隐私保护强(这是开放获取的前提);
- 时间信息损失大(无法做时间趋势,官方明示);
- 年龄被粗化("入院确切年龄"被移除,但有 Age_cut 字段)。
这个权衡是不可回避的:要开放,就必须牺牲一部分分析能力。498 选择了开放优先。
2.7 关系型 EHR 的"长表-宽表"设计
498 采用的是**长表(long format)**设计——每行一个事件,而非每行一个患者:
VitalSign 表(长表)
patient_SN | Hospital_ID | VitalSign_DESC | VitalSign_value | VitalSign_time
P001 | ZY|123 | 心率 | 88 | ...
P001 | ZY|123 | 收缩压 | 120 | ...
长表的优点:结构统一(所有生命体征一张表)、易于扩展(新增项目不需改表结构)。代价:需要 pivot 才能得到"一行一患者"的分析表,且不同医院的项目命名可能有差异。
这与 MIMIC 的设计思路一致(MIMIC 也是长表 + ITEMID 编码),但 498 用项目英文名而非数字编码,可读性更好。
2.8 住院(admission)与患者(patient)的区别
一个容易混淆的要点:498 有 7,638 名患者但 8,180 次住院。差异 542 意味着部分患者多次入院(约 7.1% 的住院属于重复入院患者)。
这个区别在研究中至关重要:
- 患者级分析:需要考虑同一患者的多次入院的非独立性;
- 住院级分析:每次住院视为独立观察;
- 划分数据集时:必须按患者而非按住院划分,否则同一患者的多次住院跨越训练/测试集会导致患者级泄漏(存照)。
2.9 重症数据的关键结局指标
| 指标 | 定义 | 498 中的可得性 |
|---|---|---|
| 院内死亡 | 住院期间死亡 | ✅ StatusOnDischarge = Dead |
| 住院时长 | DaysHospitalStay | ✅ |
| ICU 停留时长 | 需从 HospitalTransfer 推断 | ⚠️ 需自建逻辑 |
| 出院去向 | 治愈/未治愈/死亡/未知 | ✅ StatusOnDischarge |
| 死亡诊断 | DiagnosisOnDeath | ✅ |
出院状态的四分类(治愈 73% / 未治愈 16% / 死亡 6% / 未知 6%)是 498 的一个有用特性——它比二分类(死/活)提供更细的信息。
2.10 名词速查表
| 缩写/术语 | 全称 | 含义 |
|---|---|---|
| ICU | Intensive Care Unit | 重症监护病房 |
| EICU | Emergency Intensive Care Unit | 急诊重症监护病房 |
| EHR | Electronic Health Record | 电子健康记录 |
| HIS | Hospital Information System | 医院信息系统 |
| LIS | Laboratory Information System | 实验室信息系统 |
| PACS | Picture Archiving and Communication System | 影像归档与通信系统 |
| AMR | Antimicrobial Resistance | 抗菌药物耐药 |
| MIC | Minimal Inhibitory Concentration | 最小抑菌浓度 |
| CLSI | Clinical and Laboratory Standards Institute | 临床与实验室标准研究所 |
| EUCAST | European Committee on Antimicrobial Susceptibility Testing | 欧洲抗菌药物敏感性试验委员会 |
| LOS | Length of Stay | 住院时长 |
| HIPAA | Health Insurance Portability and Accountability Act | 美国健康保险流通与责任法案 |
| DUA | Data Use Agreement | 数据使用协议 |
| ICD-10 | International Classification of Diseases, 10th revision | 国际疾病分类第十版 |
| CRRT | Continuous Renal Replacement Therapy | 连续性肾脏替代治疗 |
| SOFA | Sequential Organ Failure Assessment | 序贯器官衰竭评分 |
2.11 中国 vs 美国重症数据的差异
498(中国)与 MIMIC(美国)的差异不只在语言:
| 维度 | MIMIC (BIDMC) | 498 (浙江省人民医院) |
|---|---|---|
| 医疗体系 | 美国商业+保险混合 | 中国公立三级 |
| 住院时长 | 较短(美国 ICU 平均 3-4 天) | 较长(中位 17 天,但含全院住院) |
| 病种谱 | 美国 ICU 谱 | 中国 ICU 谱 |
| 抗菌药使用 | 相对节制(有管理政策) | 使用强度可能更高 |
| 数据结构 | 高度规范化 | 相对紧凑 |
| 记录习惯 | 英文临床书写 | 中英混合(字段 _Eng,自由文本去标识) |
注意:住院日中位 17 天是全院住院而非 ICU 停留(DaysHospitalStay 字段)。这与 MIMIC 的 ICU LOS 不是同一口径,直接比较会误导——这是一个必须警惕的口径陷阱。
2.12 为什么"无排除标准"是一个重要设计
498 明确"无排除标准",这意味着数据集包含:
- 住院时间极短的患者(可能数据很少);
- 病情很轻的患者(可能未真正需要 ICU);
- 数据缺失严重的患者。
好处:保留了真实临床谱系的完整性,使研究者可以做"真实世界"的分析。
代价:数据噪声更大,需要更多清洗工作。
对比 495 PIC 与 MIMIC 系列,多数库会有若干排除标准(如住院 >24 小时、年龄 >18 岁)。498 的全纳是有意识的选择,反映了团队"保留真实"的取向。
§3 数据规格与获取:10 张表、3.22 GB 与一条零门槛的下载路径
3.1 文件清单与体量分布
| 表 | 文件 | 大小 | 占比 |
|---|---|---|---|
| 实验室检查 | Lab.csv | 1,828,953,993 B(1.83 GB) | 56.8% |
| 生命体征 | VitalSign.csv | 607,364,251 B(607 MB) | 18.9% |
| 用药事件 | Medication.csv | 277,782,777 B(278 MB) | 8.6% |
| 医嘱 | MedOrder.csv | 207,348,204 B(207 MB) | 6.4% |
| 药敏 | DrugSens.csv | 136,436,217 B(136 MB) | 4.2% |
| 检查报告 | ExamReport.csv | 52,649,246 B(52.6 MB) | 1.6% |
| 微生物培养 | MicrobiologyCulture.csv | 39,362,619 B(39.4 MB) | 1.2% |
| 诊断 | Diagnosis.csv | 25,582,236 B(25.6 MB) | 0.8% |
| 电子病历 | EMR.csv | 13,730,602 B(13.7 MB) | 0.4% |
| 院内转科 | HospitalTransfer.csv | 1,441,407 B(1.4 MB) | 0.04% |
| 合计 | 约 3.22 GB | 100% |
Lab 表一张就占了 56.8%——1,828 万字节,约 1.83 GB。这提醒使用者:下载与处理的主要成本在 Lab 表,其他表相对轻量。
3.2 官方提供的完整性校验
每个表都附 MD5 哈希(见 FACTS)。这在开放数据集中是一个值得赞赏的细节——它使使用者能验证下载完整性:
md5sum Lab.csv
# 应输出 4939ebb2155bbcfaff37da8e78f8cc4a
MD5 的存在说明:官方预期数据会被谨慎对待。这是"开放但严谨"的态度。
3.3 十张表与重症语义的对应
| 表 | 对应的临床环节 | 关键用途 |
|---|---|---|
| EMR | 入院与出院的最基本信息 | 人口学、主诉、病史、结局 |
| Diagnosis | 诊断(ICD-10) | 病种刻画、合并症、表型定义 |
| HospitalTransfer | 院内流转 | 识别 ICU 住院、转科路径 |
| VitalSign | 床旁监测 | 生理状态、SOFA 计算 |
| Lab | 检验 | 生化、血气、血液学 |
| MicrobiologyCulture | 微生物培养 | 感染诊断、菌种分布 |
| DrugSens | 药敏 | 耐药分析(含 MIC) |
| Medication | 用药执行 | 治疗强度、药物暴露 |
| MedOrder | 医嘱开立 | 医嘱行为、依从性 |
| ExamReport | 检查报告 | 影像/超声/MRI 文本 |
这十张表覆盖了 “识别-监测-干预-检查-结局” 的完整链条。
3.4 主键与关联机制
| 字段 | 含义 | 作用 |
|---|---|---|
| patient_SN | 患者唯一标识(随机字母数字串) | 跨住院识别同一患者 |
| Hospital_ID | 住院标识 | 一次住院内的所有事件 |
关联逻辑:
EMR (patient_SN, Hospital_ID) ← 主表
├── Diagnosis (patient_SN, Hospital_ID)
├── HospitalTransfer(patient_SN, Hospital_ID)
├── VitalSign (patient_SN, Hospital_ID)
├── Lab (patient_SN, Hospital_ID)
├── MicrobiologyCulture (patient_SN, Hospital_ID)
├── DrugSens (patient_SN, Hospital_ID)
├── Medication (patient_SN, Hospital_ID)
├── MedOrder (patient_SN, Hospital_ID)
└── ExamReport (patient_SN, Hospital_ID)
两条键的必要性:单用 patient_SN 会把同一患者不同住院的数据混在一起;单用 Hospital_ID 无法跨住院追踪患者。两者结合才能正确定位"某患者某次住院"。
Hospital_ID 的格式有两种前缀:
ZY|360812(ZY 可能对应"住院")IP|20190500469(IP 可能对应 inpatient,含年份)
两个前缀的存在说明系统在十年间发生过迁移(不同时期使用不同的编码体系)。
3.5 访问路径:三步走
| 步骤 | 动作 |
|---|---|
| 1 | 访问 PhysioNet 页面 https://physionet.org/content/zhejiang-ehr-critical-care/1.0/ |
| 2 | 阅读使用条款与引用要求 |
| 3 | 下载数据(开放获取,无需 DUA 审批) |
这是 498 最大的优势——从决定使用到拿到数据的时间成本接近零(仅受下载带宽限制)。
3.6 下载与存储的现实考量
| 项 | 估算 |
|---|---|
| 下载体积 | 约 3.22 GB(压缩包可能更小) |
| 解压后体积 | 约 3.22 GB(CSV 本身) |
| 载入内存 | Lab 表 1.83 GB,建议分段读取或使用 data.table |
| 推荐存储 | ≥ 20 GB 可用空间(含中间文件) |
Lab 表的处理提示:1.83 GB 的 CSV 一次性读入 pandas 通常需要 5-8 GB 内存。建议:
# 方案一:分块读取
chunks = pd.read_csv('Lab.csv', chunksize=1_000_000)
for chunk in chunks:
process(chunk)
# 方案二:只读需要的列与项目
cols = ['patient_SN','Hospital_ID','Lab_itemName_Eng','Lab_results','Lab_time']
lab = pd.read_csv('Lab.csv', usecols=cols)
# 方案三:R data.table(官方推荐大文件)
library(data.table)
lab <- fread('Lab.csv')
官方明确推荐 R 的 data.table 包处理大文件,tidyverse 用于关系数据库管理,icd 包处理 ICD 编码。
3.7 官方推荐的 R 工具链
| 包 | 用途 |
|---|---|
| tidyverse | 关系数据库管理与数据处理 |
| data.table | 大文件(尤其 Lab 表)的高效读取 |
| icd | ICD 编码的解析、分组、合并 |
这个推荐本身透露了官方的预期使用方式:R 为主要语言。当然,Python 完全可行(pandas + pyarrow)。
3.8 引用要求
| 层级 | 引用对象 |
|---|---|
| 数据集 | Jin S, Chen L, Chen K, Zhang Z. PhysioNet. 2023. DOI 10.13026/901c-yv54 |
| 原始论文 | Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z. Sci Data. 2023. DOI 10.1038/s41597-023-01952-3 |
| 平台 | Pollard T, et al. Nature Health. 2026. DOI 10.1038/s44360-026-00096-z |
BibTeX(官方提供):
@article{PhysioNet-zhejiang-ehr-critical-care-1.0,
author = {Jin, Senjun and Chen, Lin and Chen, Kun and Zhang, Zhongheng},
title = {{Establishment of a Chinese critical care database from electronic
healthcare records in a tertiary care medical center}},
journal = {{PhysioNet}},
year = {2023},
month = jan,
note = {Version 1.0},
doi = {10.13026/901c-yv54},
url = {https://doi.org/10.13026/901c-yv54}
}
3.9 版本锚定
| 锚点 | 值 |
|---|---|
| 数据集版本 | v1.0 |
| 数据集 DOI | 10.13026/901c-yv54 |
| 关联论文 DOI | 10.1038/s41597-023-01952-3 |
| 代码仓库 | github.com/zh-zhang1984/ZhejiangProvinceICU |
| 机构 | 浙江省人民医院 |
3.10 数据对账清单
下载后逐项验证:
- [ ] 10 个 CSV 文件齐全;
- [ ] MD5 与官方表 2 一致(尤其 Lab 表 4939ebb…);
- [ ] Lab.csv 大小约 1.83 GB;
- [ ] EMR.csv 中 Hospital_ID 唯一值数为 8,180;
- [ ] EMR.csv 中 patient_SN 唯一值数为 7,638;
- [ ] Diagnosis 表中 ICD10_code 字段有值;
- [ ] DrugSens 表中 MIC 字段有值(非全空);
- [ ] VitalSign 表含 VitalSign_time 时间戳;
- [ ] HospitalTransfer 表含 TransferIn/TransferOut 时间。
第 4、5 条是最关键的对账——它们验证了核心规模数字。
3.11 DAIMS 评估:6.7 / 8
| 维度 | 评分 | 依据 |
|---|---|---|
| 文档完备性 | 0.9 | 官方页面给足表结构、变量、MD5、人口学统计、伦理与资助;但表数量与作者名单存在矛盾,许可未明确 |
| 机器可读性 | 1.0 | 标准 CSV + MD5 校验,开箱即用 |
| 标签质量透明度 | 0.6 | 无人工标注;有 ICD-10 编码(半自动);数据质量由官方明示存在缺失与错误 |
| 可访问性 | 1.0 | 开放获取,无需 DUA,零门槛 |
| 许可清晰度 | 0.4 | 页面称"开放获取"但未列具体协议名,是全条目最大短板 |
| 格式标准化 | 1.0 | 标准 CSV、统一主键命名(patient_SN/Hospital_ID)、字段名清晰(_Eng 后缀) |
| 评测协议完备性 | 0.5 | 未有官方划分、基线模型或评测指标;仅提供数据与用途建议 |
| 生态可持续性 | 1.0 | 有 GitHub 代码 + 同行评议论文 + 十年数据跨度 + 开放许可 |
| 合计 | 6.7 / 8 | 可访问性、格式、生态三项满分;许可清晰度与评测协议是短板 |
与同系列对比:498(6.7)> 496(6.4)> 497(6.3)。498 得分最高的原因正是它的开放性 + 规范性组合——既能自由下载,又有标准格式与 MD5 校验。
3.12 元数据速查
| 字段 | 值 |
|---|---|
| Title | Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center |
| Version | 1.0 |
| Published | 2023-01-19 |
| DOI | 10.13026/901c-yv54 |
| RRID | SCR_007345 |
| Access | Openly accessible |
| Authors | Senjun Jin; Lin Chen; Kun Chen; Zhongheng Zhang |
| Institution | Zhejiang Provincial People’s Hospital |
| Code | github.com/zh-zhang1984/ZhejiangProvinceICU |
§4 数据结构与 10 张表逐一解剖
4.1 组织拓扑
EMR.csv(主表,8,180 行)
patient_SN | Hospital_ID | Sex | Age_cut | ChiefComplain ...
│
┌───────────────────┼────────────────────┬──────────────────┐
▼ ▼ ▼ ▼
Diagnosis.csv HospitalTransfer.csv VitalSign.csv Lab.csv
(ICD-10 诊断) (院内转科,识别 ICU) (生命体征) (11,082,482 条)
│ │ │ │
└───────────────────┴────────────────────┴──────────────────┘
│
┌───────────────────┼────────────────────┬──────────────────┐
▼ ▼ ▼ ▼
MicrobiologyCulture DrugSens.csv Medication.csv MedOrder.csv
(微生物培养) (药敏 + MIC) (用药执行) (医嘱开立)
│
▼
ExamReport.csv
(CT/超声/MRI 报告)
4.2 EMR 表(主表)逐字段解剖
| 字段 | 类型 | 语义 |
|---|---|---|
| patient_SN | string | 患者唯一标识(随机) |
| Hospital_ID | string | 住院标识 |
| Sex | category | 性别 |
| ChiefComplain_24hr | text | 入院 24 小时内主诉 |
| AdmissionStatus_24hr | text | 入院 24 小时状态 |
| ChiefComplain_24hr_dead | text | 死亡患者入院 24 小时主诉 |
| AdmissionStatus_24hr_dead | text | 死亡患者入院 24 小时状态 |
| ChiefComplain | text | 主诉 |
| Med_history | text | 既往用药史 |
| PastHistory | text | 既往病史 |
| StatusOnDischarge | category | 出院状态(治愈/未治愈/死亡/未知) |
| DiagnosisOnDeath | text | 死亡诊断 |
| StatusOnDischarge_Desc | text | 出院状态描述 |
| DischargeTime | datetime | 出院时间 |
| DaysHospitalStay | numeric | 住院天数 |
| ChiefComplain_Eng | text | 主诉英文版 |
| Age_cut | category | 年龄分档(粗化) |
四个值得注意的设计:
- 死亡专项字段(
_dead后缀)——为死亡患者单独保留 24 小时内的主诉与状态,说明团队关注"临终阶段的临床表现",这是重症研究的一个重要视角; - 主诉有中英两版(ChiefComplain 与 ChiefComplain_Eng)——说明数据经过翻译或双语录入,这是去标识化中为国外研究者可用性做的额外工作;
- Age_cut 而非精确年龄——去标识化的体现("入院确切年龄"被移除),但保留分档以支持年龄分层分析;
- StatusOnDischarge 四分类——比"死/活"二分类信息更丰富。
4.3 Diagnosis 表:ICD-10 是金矿
| 字段 | 语义 |
|---|---|
| patient_SN / Hospital_ID | 关联键 |
| Diagnosis_Desc | 诊断描述(原文) |
| ICD10_code | ICD-10 编码 |
| ICD10_name | ICD-10 名称 |
| Diagnosis_DateTime | 诊断时间 |
为什么 ICD-10 是关键:
- 表型定义:可精确筛出特定病种(如脓毒症、AKI、心衰);
- 合并症量化:可用 Charlson 指数、Elixhauser 指数计算共病负担;
- 跨库可比:ICD-10 是国际标准,可与 MIMIC(ICD-9/10)、PIC(ICD-10)对齐;
- 统计报告:可做病种谱分布。
这是 498 中最具二次利用价值的表之一。
4.4 VitalSign 表:高频监测
| 字段 | 语义 |
|---|---|
| VitalSign_DESC | 项目名称(如心率、血压、体温) |
| VitalSign_value | 数值 |
| VitalSign_unit | 单位 |
| VitalSign_time | 时间戳 |
长表设计的含义:所有生命体征混在一张表里,用 VitalSign_DESC 区分。使用时需要 pivot:
vitals = (vital.groupby(['patient_SN','Hospital_ID','VitalSign_time'])
.apply(lambda g: dict(zip(g.VitalSign_DESC, g.VitalSign_value)))
.apply(pd.Series))
注意 VitalSign_unit 的存在——同一项目可能有不同单位(如体温 ℃ 与 ℉),清洗时必须处理单位一致性,否则会把 37℃ 与 98.6℉ 当成两个不同量级的值。
4.5 HospitalTransfer 表:ICU 识别的核心机制
| 字段 | 语义 |
|---|---|
| TransferIn_dateTime | 转入时间 |
| TransferOut_dateTime | 转出时间 |
| TransferTo_Dept_Eng | 转入科室(英文) |
| TransferFrom_Dept_Eng | 转出科室(英文) |
这是 498 最需要理解的设计。MIMIC 有独立的 ICUSTAYS 表直接标记 ICU 住院,498 没有——必须从转科事件推断。
推断 ICU 停留的 SQL 思路:
-- 识别进入 ICU 的转科事件
SELECT patient_SN, Hospital_ID, TransferIn_dateTime, TransferOut_dateTime
FROM HospitalTransfer
WHERE TransferTo_Dept_Eng LIKE '%ICU%'
OR TransferTo_Dept_Eng LIKE '%Intensive Care%'
OR TransferTo_Dept_Eng IN ('Comprehensive ICU', 'Emergency ICU')
关键陷阱(存照 H、I):
- 科室英文名称的具体写法需先从数据中枚举确认,不能猜;
- 急诊 ICU 在部门名称中标注为 “Emergency medical department” 或 “Emergency Department”——这不是含 ICU 字样的名称,如果只用 LIKE ‘%ICU%’ 会漏掉 EICU;
- 同一患者可能多次进出 ICU,需要按 TransferOut 时间切分多次停留;
- 最后一次 TransferOut 可能为空(患者仍在 ICU 或数据截至)。
这四条使得"正确识别 ICU 住院"成为一个需要仔细处理的工程问题,而非一句 SQL 能解决。
4.6 Lab 表:1,108 万条记录的结构
| 字段 | 语义 |
|---|---|
| Lab_category | 检验类别 |
| Lab_time | 检验时间 |
| Lab_results | 检验结果 |
| Unit_measure | 单位 |
| LabSampleCollect_time | 样本采集时间 |
| Lab_itemName_Eng | 检验项目英文名(214 种) |
| Lab_Sample_Eng | 样本类型(英文) |
两个设计亮点:
- Lab_time 与 LabSampleCollect_time 分离——检验的"采集时间"与"报告/检验时间"在临床上是两个不同时刻。这个区分对时间序列建模很重要(采集时间更接近生理状态的真实时刻);
- Lab_itemName_Eng 而非数字编码——可读性远优于 MIMIC 的 ITEMID,但代价是名称的规范化程度依赖原始录入。
214 种检验项目覆盖了常规生化、血气、血液学、凝血、免疫等。
4.7 Medication 与 MedOrder:执行与开立的分离
| 表 | 字段要点 | 语义 |
|---|---|---|
| Medication | Med_category, SingleDose, Med_Freq, Med_unit, Med_startTime, Med_stopTime, Med_route_Eng, Med_DESC_Eng | 实际执行的用药 |
| MedOrder | MedOrder_Type, MedOrder_DESC, MedOrder_Start_DateTime, MedOrder_Stop_DateTime | 医生开立的医嘱 |
这个分离的临床价值:
- Medication 有
SingleDose(单次剂量)+Med_Freq(频次)+Med_route_Eng(给药途径,如静脉/口服)→ 可计算药物暴露量; - MedOrder 只有开立/停止时间 → 反映医嘱行为;
- 两者对比 → 可研究:医嘱被取消的比例、剂量调整模式、用药依从性。
对比 MIMIC:MIMIC 有 PRESCRIPTIONS(处方)与 EMAR(用药管理记录),思路类似但表名与粒度不同。
4.8 DrugSens 表:全库最独特的一张表
| 字段 | 语义 |
|---|---|
| Drug_Code | 药物编码 |
| DrugSens_result | 药敏结果(S/I/R) |
| MIC | 最小抑菌浓度 |
| DrugSens_time | 检测时间 |
| Drug_name_Eng | 药物英文名 |
| DrugSens_Microbiology_Eng | 对应微生物 |
| DrugSens_Category_Eng | 药物类别 |
| DrugSens_sample_Eng | 样本类型 |
为什么这张表稀缺:
| 数据库 | 有独立药敏表? | 含 MIC? |
|---|---|---|
| MIMIC-III | ❌(在 microbiologyevents 中有部分) | 部分 |
| MIMIC-IV | 部分 | 有限 |
| 495 PIC | ❌ | ❌ |
| 498 浙江 | ✅ | ✅ |
这张表使 498 成为耐药研究的少数可用数据源之一。
4.9 MicrobiologyCulture 与 DrugSens 的配对逻辑
MicrobiologyCulture.csv DrugSens.csv
MicrobiologyCulture_finding ──┐
MicrobiologyCulture_sample ───┼──→ DrugSens_Microbiology_Eng
MicrobiologyCulture_time ─────┘ DrugSens_sample_Eng
DrugSens_time
│
▼
DrugSens_result(S/I/R)
MIC
培养(发现细菌)+ 药敏(该菌对药物的反应) 构成完整的微生物学检测链条。使用时需注意:一次培养可能对应多条药敏记录(一个菌对多种药)。
4.10 ExamReport 表:影像文本的可得性
| 字段 | 语义 |
|---|---|
| ExamReport_Category | 检查类别(CT/超声/MRI) |
| ExamReport_DESC | 检查描述 |
| ExamReport_finding | 检查发现(报告文本) |
| ExamReport_time | 检查时间 |
| ExamReport_item_Eng | 检查项目英文名 |
这意味着 498 不只提供结构化数值,还提供影像报告文本——为多模态或 NLP 研究提供了可能(尽管不如 496 那样有标注)。
52.6 MB 的体积说明报告文本量可观。
4.11 血缘关系图
浙江省人民医院信息系统(HIS / LIS / EMR / RIS)
2012-01 至 2022-05,全院 ICU 患者(无排除标准)
│
│ 导出 + 结构化 + HIPAA 去标识化
│ (移除日期/地址/号码;patient_SN 随机化)
▼
10 张 CSV 关系表(总计约 3.22 GB)
│ MD5 校验 + 上传
▼
PhysioNet 开放获取(v1.0,2023-01-19)
│
│ Sci Data (2023) 论文发表
▼
7,638 患者 / 8,180 住院 / 11,082,482 条检验
4.12 表间关系的完整性检查
| 检查项 | 方法 | 预期 |
|---|---|---|
| 主表覆盖 | EMR 中 Hospital_ID 唯一值数 | 8,180 |
| 子表外键完整 | 各子表的 Hospital_ID 是否都在 EMR 中 | 应大部分匹配 |
| 孤儿记录 | 子表中存在但 EMR 中不存在的 Hospital_ID | 应很少 |
| 时间一致性 | 子表事件时间是否落在住院区间内 | 部分可能越界(需核查) |
| 空值率 | 各关键字段的空值比例 | Lab_results 等可能有空 |
第 4 条是一个常见的真实数据问题:事件时间可能落在入院前(如门诊检验)或出院后(如随访),处理时需明确边界。
4.13 与 495 PIC 的结构对照
| 维度 | 495 PIC | 498 浙江 |
|---|---|---|
| 表数 | 16 | 10 |
| 字典表 | 有(D_ITEMS、D_LABITEMS、D_ICD_DIAGNOSES) | 无 |
| ICU 识别 | ICUSTAYS 表 | HospitalTransfer 推断 |
| 项目编码 | ITEMID(字符) | 英文名 |
| 药敏表 | 无独立表 | 有(DrugSens + MIC) |
| 症状表 | EMR_SYMPTOMS | 无(主诉在 EMR 表中) |
| 手术体征 | SURGERY_VITAL_SIGNS | 无 |
| 语言 | 英汉双语 | 主要英文(_Eng 字段) |
| ICU 数 | 5 个 | 2 个(综合 + 急诊) |
| 访问 | 受控(DUA) | 开放获取 |
这张表说明了两个中国库的互补性:PIC 结构更完整(有字典表、更细的表划分),498 更紧凑且更开放。
4.14 数据质量的自查要点
| 检查 | 方法 | 期望 |
|---|---|---|
| 单位一致性 | 统计 VitalSign_unit 的取值 | 应有限且可映射 |
| 数值范围 | 检查 VitalSign_value 的极值 | 应无荒谬值 |
| 时间格式 | 检查各 _time 字段格式 | 应统一 |
| 编码一致性 | Diagnosis 的 ICD10_code 格式 | 应统一 |
| 重复记录 | 按主键去重 | 应无完全重复 |
| 空值模式 | 统计各字段空值率 | 官方已明示存在缺失 |
官方明示"数据存在缺失值和错误",因此质检是使用者的必经步骤,不能跳过。
§5 装载、ICU 识别与评测协议
5.1 最小装载路径(Python)
import pandas as pd
emr = pd.read_csv('EMR.csv')
diag = pd.read_csv('Diagnosis.csv')
vital= pd.read_csv('VitalSign.csv')
# Lab 表 1.83 GB,建议分块或用 pyarrow
lab = pd.read_csv('Lab.csv', usecols=['patient_SN','Hospital_ID',
'Lab_itemName_Eng','Lab_results','Lab_time'])
trsf = pd.read_csv('HospitalTransfer.csv')
med = pd.read_csv('Medication.csv')
mord = pd.read_csv('MedOrder.csv')
dsen = pd.read_csv('DrugSens.csv')
mic = pd.read_csv('MicrobiologyCulture.csv')
exam = pd.read_csv('ExamReport.csv')
print(emr.shape) # (8180, ~17)
print(emr['Hospital_ID'].nunique()) # 8180
print(emr['patient_SN'].nunique()) # 7638
5.2 最小装载路径(R,官方推荐)
library(data.table)
emr <- fread('EMR.csv')
diag <- fread('Diagnosis.csv')
vital <- fread('VitalSign.csv')
lab <- fread('Lab.csv') # data.table 高效处理 1.83 GB
trsf <- fread('HospitalTransfer.csv')
med <- fread('Medication.csv')
dsen <- fread('DrugSens.csv')
nrow(emr); uniqueN(emr$Hospital_ID); uniqueN(emr$patient_SN)
5.3 ICU 住院识别的完整流程
library(data.table)
trsf <- fread('HospitalTransfer.csv')
# Step 1: 先枚举所有科室名,确认 ICU 名称的实际写法
unique(trsf$TransferTo_Dept_Eng)
# Step 2: 根据实际枚举结果定义 ICU 科室集合
icu_depts <- c('Comprehensive ICU', 'Emergency ICU',
'Emergency medical department', 'Emergency Department')
# Step 3: 提取 ICU 停留事件
icu_stays <- trsf[TransferTo_Dept_Eng %in% icu_depts,
.(patient_SN, Hospital_ID,
icu_in = TransferIn_dateTime,
icu_out = TransferOut_dateTime)]
# Step 4: 处理多次停留与空值
icu_stays[is.na(icu_out), icu_out := as.POSIXct(NA)] # 保留为 NA,后续单独处理
# Step 5: 计算每次 ICU 停留时长
icu_stays[, icu_los_hours := as.numeric(difftime(icu_out, icu_in, units='hours'))]
Step 1 是不可跳过的——科室名称必须以数据中实际枚举为准,不能猜(存照 H)。
5.4 患者级分析表的构造
# 住院级聚合
adm = emr[['patient_SN','Hospital_ID','Sex','Age_cut',
'StatusOnDischarge','DaysHospitalStay']].copy()
# 合并 ICU 停留(一个住院可能多次 ICU)
icu_agg = icu_stays.groupby(['patient_SN','Hospital_ID']).agg(
icu_stay_count=('icu_in','count'),
icu_total_hours=('icu_los_hours','sum'))
adm = adm.merge(icu_agg, on=['patient_SN','Hospital_ID'], how='left')
# 合并诊断数
diag_agg = diag.groupby(['patient_SN','Hospital_ID']).size().rename('n_diagnoses')
adm = adm.merge(diag_agg, on=['patient_SN','Hospital_ID'], how='left')
# 合并检验次数
lab_agg = lab.groupby(['patient_SN','Hospital_ID']).size().rename('n_lab_tests')
adm = adm.merge(lab_agg, on=['patient_SN','Hospital_ID'], how='left')
5.5 患者级划分(关键)
import numpy as np
rng = np.random.default_rng(42)
patients = emr['patient_SN'].unique()
rng.shuffle(patients)
n = len(patients)
train_p = set(patients[:int(0.7*n)])
val_p = set(patients[int(0.7*n):int(0.8*n)])
test_p = set(patients[int(0.8*n):])
train = adm[adm.patient_SN.isin(train_p)]
val = adm[adm.patient_SN.isin(val_p)]
test = adm[adm.patient_SN.isin(test_p)]
必须按 patient_SN 而非 Hospital_ID 划分——542 次住院属于重复入院患者,若按住院划分,同一患者会跨越训练/测试集,造成患者级泄漏(存照)。
5.6 评测协议:官方未提供,需自建
与 498 一样,官方未提供训练/测试划分、基线模型或评测指标。建议协议:
| 环节 | 建议 |
|---|---|
| 划分 | 按 patient_SN 做 7:1:2 |
| 主任务 | 院内死亡预测(StatusOnDischarge = Dead) |
| 评价指标 | AUROC + AUPRC(类别不平衡)+ 校准曲线 |
| 基线 | 年龄 + 性别 + 住院天数的 Logistic 回归 |
| 进阶 | SOFA/LODS 等评分 → 机器学习模型 |
| 外部验证 | 在 MIMIC 上交叉验证 |
5.7 死亡率预测的标准流程
输入特征
├── 人口学:Sex, Age_cut
├── 入院状态:主诉、入院 24 小时状态
├── 生理:VitalSign(前 24 小时统计量)
├── 检验:Lab(前 24 小时统计量,214 项中的常见项)
└── 合并症:Diagnosis 的 ICD-10 派生(Charlson 指数)
预测目标
└── StatusOnDischarge == 'Dead'(6%,438 例)
注意
└── 类别不平衡(6%)→ 必须用 AUPRC 与校准,不能只看 AUROC
5.8 抗菌药耐药分析的标准流程
# 耐药率计算
dsen['resistant'] = dsen['DrugSens_result'].isin(['R','Resistant','耐药'])
# 按药物统计耐药率
res_rate = dsen.groupby('Drug_name_Eng')['resistant'].agg(['mean','count'])
# 按菌种统计
by_bug = dsen.groupby(['DrugSens_Microbiology_Eng','Drug_name_Eng'])['resistant'].mean()
# MIC 分布
dsen['MIC'] = pd.to_numeric(dsen['MIC'], errors='coerce')
mic_dist = dsen.groupby('Drug_name_Eng')['MIC'].describe()
注意:药敏结果的编码(S/I/R 还是 Sensitive/Resistant/Intermediate)需先从数据中确认,不能假设。
5.9 外部验证的设计要点
想在 MIMIC 与 498 之间做外部验证,须处理四个对齐问题:
| 问题 | 处理 |
|---|---|
| 编码差异 | MIMIC-III 用 ICD-9,498 用 ICD-10 → 用映射表或选两者都有的病种 |
| 变量差异 | 取交集变量,或按临床概念映射 |
| 单位差异 | 统一单位(如 mg/dL) |
| 队列定义 | 用同一纳排标准(如首次 ICU 住院、成人) |
对齐是外部验证的核心难点,也是最有价值的工作——它决定了跨人群结论是否可信。
5.10 常见错误黑名单
- ❌ 按 Hospital_ID 而非 patient_SN 划分(患者级泄漏);
- ❌ 用全文日期做时间趋势(官方明示无法做);
- ❌ 忽略单位差异直接合并 VitalSign;
- ❌ 用 LIKE ‘%ICU%’ 识别 ICU(漏掉 EICU);
- ❌ 把 DaysHospitalStay 当作 ICU LOS(口径不同);
- ❌ 类别不平衡时只报 accuracy;
- ❌ 不核查 MD5 就使用(数据损坏风险);
- ❌ 声称模型"可用于临床"(单中心回顾数据不支持)。
5.11 与 495、492 的联合使用
| 联合 | 研究设计 |
|---|---|
| 498 + 495(PIC) | 中国成人与儿科 ICU 的对照研究 |
| 498 + 492(MIMIC-IV) | 中美 ICU 人群对照、跨机构模型外部验证 |
| 498 + 497(Health Gym) | 在合成数据上开发算法、在 498 上验证 |
| 498 + 496 | 498 的 ExamReport 文本 + 496 的抽取方法 → 从影像报告抽结构化信息 |
5.12 部署与合规边界
| 场景 | 是否可行 |
|---|---|
| 回顾性研究 | ✅ |
| 模型开发与外部验证 | ✅ |
| 抗菌药耐药研究 | ✅ |
| 教学 | ✅ |
| 前瞻性临床决策 | ❌ 需另行验证与审批 |
| 再识别尝试 | ❌ 禁止 |
§6 实证基座:8,180 次住院告诉我们什么
6.1 人口学全景
| 变量 | 合计 (n=8,180) | 女性 (n=2,965) | 男性 (n=5,215) |
|---|---|---|---|
| (0,18] 岁 | 35 (0%) | 14 (0%) | 21 (0%) |
| (18,45] 岁 | 1,012 (12%) | 339 (11%) | 673 (13%) |
| (45,65] 岁 | 2,609 (32%) | 859 (29%) | 1,750 (34%) |
| (65,75] 岁 | 1,952 (24%) | 709 (24%) | 1,243 (24%) |
| (75,90] 岁 | 2,044 (25%) | 836 (28%) | 1,208 (23%) |
| (90,150] 岁 | 528 (6%) | 208 (7%) | 320 (6%) |
| 住院天数中位 (Q1,Q3) | 17 (10, 28) | 16 (10, 26) | 18 (10, 28) |
| 治愈 | 5,666 (73%) | 2,050 (73%) | 3,616 (73%) |
| 死亡 | 438 (6%) | 157 (6%) | 281 (6%) |
| 未治愈 | 1,202 (16%) | 437 (16%) | 765 (15%) |
| 未知 | 444 (6%) | 153 (5%) | 291 (6%) |
6.2 四条从人口学中读出的结论
结论一:这是一个以中老年为主的成人 ICU 队列。
45 岁以上占 87%(32%+24%+25%+6%),而 18 岁以下仅 35 例(0%)。这与 495 PIC(儿科、中位年龄 0.8 岁)形成鲜明对照,也符合"综合 ICU 以成人为主"的临床现实。
结论二:性别比为男 63.8% vs 女 36.2%,男性显著偏多。
这在重症数据中是常见现象(男性心血管疾病、外伤、危重症的发生率更高),但也可能反映就医行为差异。住院日中位数男性 18 天 > 女性 16 天(p<0.001),说明男性的住院时间显著更长。
结论三:住院日中位 17 天,明显长于欧美 ICU 数据。
但要注意口径:这是全院住院(DaysHospitalStay),不是 ICU 停留时长。美国 ICU 平均停留 3-4 天,而美国医院的总住院中位也在 4-5 天量级。498 的 17 天中位意味着中国三级医院重症患者的住院时间显著更长。这个差异的可能原因:
- 中国三级医院收治的病情更重(基层分流后);
- 康复期仍在院内(缺少成熟的院外康复/护理机构);
- 医保与支付制度的差异;
- 家属陪护文化(中国医院普遍有家属陪护,出院标准可能不同)。
这是一个跨体系比较时必须谨慎的点——直接说"中国患者住院更久"可能掩盖了制度性因素。
结论四:治愈率 73%、死亡率 6%。
死亡率 6% 远低于一般 ICU 的预期(美国 ICU 死亡率常在 10-15%)。可能原因:
- 队列是"所有入住 ICU 的患者,无排除标准"——包含了许多病情较轻、短期观察后转出的患者;
- "治愈"的定义可能较宽(StatusOnDischarge 的判定标准由医院系统决定);
- 中国的 ICU 收治范围可能比美国更广(包含监护性质的患者)。
6.3 出院状态的四分类价值
498 的 StatusOnDischarge 是四分类,比常见的二分类信息更丰富:
| 状态 | 例数 | 占比 | 临床含义 |
|---|---|---|---|
| 治愈 (Cured) | 5,666 | 73% | 病情好转出院 |
| 未治愈 (Not cured) | 1,202 | 16% | 病情未好转但出院/转院 |
| 死亡 (Dead) | 438 | 6% | 院内死亡 |
| 未知 (Unknown) | 444 | 6% | 状态未记录 |
"未治愈"这一类的存在很有价值:它捕捉了"病情未好转就离院"的患者(可能转院、可能放弃治疗、可能家属要求出院)。这一群体在研究中常被忽略,但它是治疗失败或治疗中断的重要信号。
建模建议:可以做三分类(治愈/未治愈/死亡)或多分类预测,比二分类更有临床信息量。但要先处理"未知"(444 例,占 6%)——是删除、还是单独建模。
6.4 性别差异的统计显著性
表 1 给出了 p 值:
| 变量 | p 值 | 显著性 |
|---|---|---|
| 年龄分布 | <0.001 | 显著 |
| 住院天数 | <0.001 | 显著 |
| 出院状态 | 0.901 | 不显著 |
这组 p 值说明:
- 年龄分布在性别间显著不同:女性在 75-90 岁档占比更高(28% vs 23%),说明女性患者年龄更大——这与女性预期寿命更长一致;
- 住院天数在性别间显著不同:男性更长;
- 出院状态在性别间无显著差异(p=0.901):男女的治愈/死亡比例几乎一致。
第三条尤其有意义:它说明尽管男女人口学不同、住院时长不同,但最终结局没有性别差异。这是一个值得进一步分析的发现——它可能意味着医疗处置在性别上是公平的,也可能意味着其他因素(如年龄)在起作用。
6.5 11,082,482 条检验记录的规模感
1,108 万条检验记录 / 8,180 次住院 = 平均每次住院约 1,355 条检验记录。
这个数字意味着:
- 平均每住院每天约 80 条检验记录(按 17 天住院算);
- 这是一份检验密集型的数据——中国三级医院 ICU 的检验强度可见一斑。
对建模的影响:
- 优势:大量时序数据支持精细的生理轨迹建模;
- 挑战:数据量巨大,特征工程与计算成本高;需要按临床意义筛选项目(214 种不可能都用)。
实用建议:不要一上来就用全部 214 种检验项目。先用临床知识选出 20-40 个核心项目(如肌酐、乳酸、white blood cell、血小板、胆红素、血气指标),构建基础特征集,再逐步扩展。
6.6 214 种检验项目的分析策略
| 策略 | 做法 | 适用 |
|---|---|---|
| 核心项精选 | 按临床重要性选 20-40 项 | 快速建模 |
| 覆盖度筛选 | 选覆盖率 >30% 的项目 | 通用模型 |
| 类别聚合 | 按 Lab_category 聚合 | 降维 |
| 全量嵌入 | 用所有项目做表征学习 | 深度学习 |
覆盖度筛选最实用:一个只有 5% 患者做过的检验,对预测模型几乎没有贡献(大量缺失),反而是噪声源。
6.7 DrugSens 深读:这张表能回答什么问题
这张表是 498 相对其他库的最大增量。它能支撑的研究方向:
方向一:耐药率的横断面刻画
res = dsen.groupby(['DrugSens_Microbiology_Eng','Drug_name_Eng'])
.agg(n=('DrugSens_result','size'),
resistance=('resistant','mean'))
# 例:某菌对某药的耐药率
方向二:耐药的时间演变
虽然有日期限制,但若年份信息可用,可做粗粒度的年度耐药率趋势。
方向三:MIC 分布与断点漂移
mic = dsen.groupby(['Drug_name_Eng','DrugSens_Microbiology_Eng'])['MIC']
.apply(lambda s: np.percentile(s.dropna(), [50, 90, 95]))
方向四:经验性用药的合理性评估
把 Medication 表(实际用了什么药)与 DrugSens 表(病原对什么药敏感)结合,评估:
- 经验性用药与最终药敏的一致率;
- 不一致时的结局差异。
这个分析有直接的临床改进价值——它是抗菌药物管理(antibiotic stewardship)评估的标准方法。
6.8 微生物培养与药敏的配对分析
| 步骤 | 操作 |
|---|---|
| 1 | 从 MicrobiologyCulture 提取阳性培养(含菌种) |
| 2 | 按 patient_SN/Hospital_ID/时间匹配到 DrugSens |
| 3 | 统计每株菌的药敏谱(S/I/R 模式) |
| 4 | 计算多重耐药(MDR)菌株比例 |
MDR 的定义:对 ≥3 类抗菌药物耐药。498 的 DrugSens_Category_Eng 字段(药物类别)使这个计算可行——这是表设计上的一个实用细节。
6.9 医嘱与用药的分离能回答什么
| 研究问题 | 需要的表 | 方法 |
|---|---|---|
| 医嘱取消率 | MedOrder | 有 Start 无对应执行记录 |
| 剂量调整模式 | Medication | SingleDose 随时间的变化 |
| 给药途径分布 | Medication | Med_route_Eng 统计 |
| 医嘱-执行时间差 | MedOrder + Medication | 按药物名匹配时间 |
**“医嘱取消率”**是一个容易被忽略但有意义的指标——它反映临床决策的修正频率。不过要计算它需要可靠的匹配逻辑(药物名称的规范化),这本身是一个工程挑战。
6.10 与 MIMIC 的规模对比
| 指标 | MIMIC-III | 498 浙江 |
|---|---|---|
| 患者数 | ~38,000(成人) | 7,638 |
| 住院数 | ~50,000 | 8,180 |
| 时间跨度 | 2001-2012(12 年) | 2012-2022(10 年 4 个月) |
| ICU 数 | 1(BIDMC 多个单元) | 2 |
| 总表数 | 26+(含字典表) | 10 |
| 检验记录 | 数千万 | 1,108 万 |
| 访问 | 受控(DUA) | 开放 |
498 的规模约为 MIMIC-III 的六分之一到五分之一,但开放获取这一属性是 MIMIC 不具备的。
6.11 与 495 PIC 的对照
| 维度 | 495 PIC | 498 浙江 |
|---|---|---|
| 医院 | 浙江大学医学院附属儿童医院 | 浙江省人民医院 |
| 人群 | 儿科(0-18 岁) | 成人为主 |
| 患者/住院 | 12,881 / 13,449 | 7,638 / 8,180 |
| ICU | 5 个 | 2 个 |
| 时间 | 2010-2018 | 2012-2022 |
| 死亡率 | 7.1%(院内)/6.9%(ICU) | 6%(院内) |
| 访问 | 需 DUA | 开放 |
| 双语 | 是 | 部分(_Eng 字段) |
有意思的一致性:两个中国库的院内死亡率都在 6-7% 区间,显著低于欧美 ICU 的常见报告值。这可能反映中国 ICU 收治范围更宽(包含监护性入住)这一制度特征——这是一个值得专门研究的现象学问题。
6.12 静态 vs 活跃
| 维度 | 状态 |
|---|---|
| 498 数据集本体 | 静态(v1.0,2023-01-19 发布,未见更新) |
| 上游医院数据 | 活跃(医院持续产生数据) |
| 作者团队 | 活跃(资助到 2021,团队持续发表) |
一个重要提示:数据集冻结在 2022 年 5 月,而医院数据仍在产生。若想做更新研究,需自行与团队联系。这也是所有开放数据集的共同局限——开放版本必然滞后于院内现状。
6.13 家族治理:中国重症数据谱系
| 数据 | 机构 | 人群 | 开放度 |
|---|---|---|---|
| 495 PIC | 浙大儿院 | 儿科 | 受控 |
| 498 浙江 ICU | 浙江省人民医院 | 成人 | 开放 |
| 其他院内数据 | 各医院 | 各异 | 封闭 |
在中国重症数据谱系中,498 是开放度最高的一环。它与 495 一起,构成了"中国重症数据走向国际"的两条路径。
6.14 口径诊断树
数字不符时:
数字不对?
├─ 患者数不对?
│ └─ 是否把住院数(8,180)当成了患者数(7,638)?
├─ 检验记录数不对?
│ ├─ 是否只统计了部分 Lab_category?
│ └─ 是否把空结果也计入了?
├─ 死亡率不对?
│ ├─ 分母是住院还是患者?→ 官方按住院(8,180)
│ └─ 是否把"未知"计入了非死亡?
├─ 住院天数不对?
│ └─ 是否与 ICU LOS 混淆了?→ 17 天是全院住院
└─ 表数量不对?
└─ 官方内部即有 11 vs 10 的矛盾 → 以表 2 的 10 张为准
6.15 八个坑点
坑点 1:患者与住院的混淆。 7,638 患者 vs 8,180 住院,差 542。分析单位选错会导致结果偏差。
坑点 2:ICU 住院识别不全。 只用 LIKE '%ICU%' 会漏掉急诊 ICU(部门名为 “Emergency medical department”/“Emergency Department”)。必须先枚举科室名。
坑点 3:把 DaysHospitalStay 当 ICU LOS。 17 天是全院住院,不是 ICU 停留。跨库比较时必须换算口径。
坑点 4:忽略单位不一致。 VitalSign_unit 与 Unit_measure 存在多单位情况,不做统一会引入量级错误。
坑点 5:跳过 MD5 校验。 3.22 GB 下载可能损坏,MD5 是唯一验证手段。
坑点 6:用日期做时间趋势。 官方明示日历日期被移除,无法做时间趋势研究。
坑点 7:不处理"未知"出院状态。 444 例(6%)的状态未知,如何处理会影响死亡率估计。
坑点 8:假设数据干净。 官方明示存在缺失与错误——这是真实临床数据的本质,必须做质检。
6.16 自查清单
- [ ] MD5 校验通过(尤其 Lab.csv);
- [ ] 确认 EMR 表 Hospital_ID 唯一值 = 8,180,patient_SN 唯一值 = 7,638;
- [ ] 已枚举 HospitalTransfer 的科室名称,明确定义了 ICU 科室集合;
- [ ] 已处理同一患者多次 ICU 停留;
- [ ] 已明确分析单位(患者级还是住院级);
- [ ] 按 patient_SN 划分训练/测试集;
- [ ] 已统一 VitalSign 与 Lab 的单位;
- [ ] 已处理"未知"出院状态;
- [ ] 未使用日历日期做时间趋势分析;
- [ ] 类别不平衡时报告 AUPRC 与校准;
- [ ] 已引用数据集 + 论文 + 平台三层来源;
- [ ] 未尝试再识别。
§7 AI 实践指南:把这份中国重症数据用起来
7.1 五种用法
| 用法 | 具体做法 | 价值 |
|---|---|---|
| 模型外部验证 | 在 MIMIC 训练、在 498 验证 | 解决医疗 AI 最缺的一环 |
| 耐药研究 | 用 DrugSens + MIC | AMR 研究的稀缺数据源 |
| 中国 ICU 人群刻画 | 用 EMR + Diagnosis 统计 | 填补中国数据的空白 |
| 液体治疗/血流动力学 | VitalSign + Medication | 与团队研究兴趣一致 |
| 教学与练手 | 完整关系型真实数据 | 3.22 GB 的真实脏数据 |
7.2 一个 30 分钟的最小实验
- (5 分钟) 下载 EMR.csv 与 Diagnosis.csv(小表,快);
- (10 分钟) 统计病种分布:按 ICD10_code 的前 3 位分组,画出 Top 20 病种;
- (10 分钟) 计算基础统计:男女比例、年龄分布、死亡率、住院天数分布;
- (5 分钟) 与 MIMIC 的公开统计对比,列出差异。
这个实验不需要下载 1.83 GB 的 Lab 表就能完成,是判断"这份数据是否适合你"的低成本方式。
7.3 泄漏防控
| 泄漏类型 | 防控 |
|---|---|
| 患者级泄漏 | 按 patient_SN 划分 |
| 时间泄漏 | 特征只用预测时点之前的数据 |
| 结局泄漏 | 确保特征不含出院相关信息 |
| 信息泄漏 | 排除 StatusOnDischarge_Desc 等结局字段 |
第三条特别重要:如果预测"院内死亡",那么 DiagnosisOnDeath、StatusOnDischarge、DischargeTime 都是结局信息,绝不能作为特征。
7.4 公平性与偏差
| 偏差来源 | 说明 | 应对 |
|---|---|---|
| 单中心 | 仅浙江省人民医院 | 报告为单中心结论 |
| 三级医院 | 患者病情偏重、转诊来源 | 不外推到基层 |
| 时代 | 2012-2022 年诊疗变化 | 说明数据期 |
| 性别 | 男性占 64% | 做性别分层分析 |
| 年龄 | 以中老年为主 | 不用于儿科结论 |
7.5 外部验证的实操建议
想在 MIMIC 与 498 之间做外部验证,推荐流程:
第 1 步:选定一个临床明确的预测任务
(如"ICU 入院 24 小时内预测院内死亡")
第 2 步:在两个数据集中分别构建尽可能一致的队列
(成人、首次 ICU 住院、排除住院<24h)
第 3 步:定义共同特征集
(人口学 + 生命体征 + 常见检验)
第 4 步:统一单位与编码
(血压 mmHg、肌酐 mg/dL、乳酸 mmol/L)
第 5 步:在一个库训练,在另一个库直接测试
(报告性能衰减幅度)
第 6 步:分析衰减原因
(是分布差异、还是编码差异、还是真实的人群差异)
第 6 步是这项研究最有价值的部分——它揭示了"模型为什么不能跨机构泛化"。
7.6 LLM 与这份数据的结合
| 结合方式 | 做法 |
|---|---|
| 影像报告结构化 | 用 LLM 从 ExamReport 抽取结构化发现 |
| 主诉标准化 | 用 LLM 把 ChiefComplain 映射到标准术语 |
| 特征工程辅助 | 用 LLM 从诊断名生成表型规则 |
| 结果解释 | 用 LLM 把模型输出翻译为临床语言 |
ExamReport 是最有潜力的方向:52.6 MB 的影像报告文本,若用 LLM 抽取结构化发现(如"是否有胸腔积液"“心影大小”),可以为 498 增加一个文本派生层——这与 496 的思路一致(把文本转成结构化)。
7.7 弱监督与规则
在标注稀缺的场景(498 无人工标注),弱监督是有效手段:
- 规则提取表型:用 ICD-10 + 检验阈值定义脓毒症、AKI、ARDS;
- 相互验证:用规则的 A 定义去检验规则的 B 定义,不一致处人工复核;
- 迭代改进:规则 → 抽样复核 → 修正 → 再运行。
MIMIC 生态已有大量成熟的表型定义代码(如 sepsis-3、AKI KDIGO),可以移植到 498 的 ICD-10 体系——这是一个高性价比的工作。
7.8 成本核算
| 方案 | 获取成本 | 计算成本 | 适合 |
|---|---|---|---|
| 498 单独使用 | 零(开放下载) | 中(3.22 GB) | 单中心研究 |
| 498 + MIMIC | 零 + 高(DUA 数周) | 高 | 跨机构验证 |
| 498 + 495 | 零 + 中(DUA 数天) | 中 | 中国成儿对照 |
# Lab 表处理的内存友好写法
import pyarrow.csv as pv
lab = pv.read_csv('Lab.csv') # 比 pandas 省内存
import pyarrow.compute as pc
lab_f = lab.filter(pc.is_in(lab['Lab_itemName_Eng'],
value_set=pc.cast(core_items, 'string')))
7.9 复现包清单
发表基于 498 的研究时,建议附带:
- [ ] 数据集版本与 DOI;
- [ ] MD5 校验记录;
- [ ] ICU 识别的科室名集合与逻辑代码;
- [ ] 队列纳排标准的代码;
- [ ] 特征工程代码(含单位统一);
- [ ] 训练/测试划分脚本与种子;
- [ ] 模型与超参;
- [ ] 评价指标与校准曲线;
- [ ] 环境依赖。
特别建议公开"ICU 识别的科室名集合"——这是 498 使用中每个研究者都要重新摸索的部分,公开它能为社区节省大量时间。
7.10 三个可立即执行的建议
- 今天:下载 EMR + Diagnosis,跑通病种分布统计(1 小时);
- 本周:完成 ICU 住院识别(枚举科室名 + 构建停留表),这是最有价值的公共品——建议直接开源;
- 本月:选一个预测任务(如院内死亡),建立基线,并公开划分与代码。
7.11 教学用法
498 是优秀的真实 EHR 教学材料:
| 教学环节 | 内容 |
|---|---|
| 关系型数据入门 | 10 张表的 join 练习 |
| 真实数据清洗 | 单位统一、缺失处理、异常值 |
| 队列构建 | ICU 识别、纳排标准 |
| 预测建模 | 死亡预测全流程 |
| 外部验证概念 | 为什么单中心模型难外推 |
相比用 MIMIC 教学需要学生自行申请权限,498 让每个学生都能在 5 分钟内开始。
7.12 与其他数据集的组合研究设计
设计一:中美 ICU 对照
498(中国)+ MIMIC-IV(美国)
→ 同一预测任务,双向外部验证
→ 结论:中国人群的模型性能衰减多少?原因是什么?
设计二:成人-儿科对照
498(成人)+ 495 PIC(儿科)
→ 同一预后任务(如死亡率预测)
→ 结论:儿科与成人的预测特征权重是否不同?
设计三:开放-受控对照
498(开放)+ MIMIC(受控)
→ 同一算法在两库上的表现
→ 结论:用开放数据开发的算法,能否直接用于受控数据?
设计四:合成-真实对照
497(合成)+ 498(真实)
→ 在合成数据上开发,在真实数据上验证
→ 结论:合成数据的效用边界在哪里?
这四个设计都不需要复杂的方法创新,但都有明确的科学价值——它们回答的是"数据可用性"这一类基础设施问题,而这恰恰是医疗 AI 领域最缺的研究类型。
7.13 监控与回归(若作为内部基准)
若机构把 498 作为算法研发的内部基准,建议:
| 监控项 | 阈值 |
|---|---|
| MD5 校验 | 每次使用前 |
| 核心统计量 | 患者数/住院数/死亡率应稳定 |
| 划分一致性 | 固定种子,保证可比 |
| 性能基准 | 基线模型指标不应变化 |
7.14 三个可发表的研究方向
- “中国 ICU 队列的开放化:一份可行性与局限的评估”——以 498 为案例,讨论中国医疗数据开放的技术与制度路径;
- “跨中美 ICU 的死亡率预测模型外部验证”——498 + MIMIC 的双向验证;
- “基于 MIC 的抗菌药物耐药趋势与经验性用药合理性”——DrugSens 表的深度利用。
7.15 与 496 的方法迁移
496(NIHSS)是从文本抽取结构化数值的方法论。498 的 ExamReport 表提供了类似的场景——从影像报告文本抽取结构化发现。可以:
- 借用 496 的"实体 + 关系"建模思路;
- 借用其两步管线(先 NER 后 RE);
- 建立 498 特有的标注子集。
这是"方法在库间迁移"的一个具体路径。
§8 伦理、合规与数据开放的边界
8.1 三重责任主体
| 主体 | 责任 |
|---|---|
| 患者 | 数据来自真实患者,虽已去标识化,仍须防止再识别与不当使用 |
| 医院与团队 | 数据开放是团队的贡献,使用时须充分引用 |
| 使用者 | 不得误用、不得再识别、不得声称不实结论 |
8.2 去标识化的强度与残余风险
498 依据 HIPAA 去标识化,移除内容清单明确(地址、日期、号码、确切年龄)。但残余风险永远存在:
- 罕见病 + 机构特征可能缩小到唯一患者;
- 主诉与病史的自由文本可能含间接标识(如"某地旅游史");
- 多次住院的文本指纹可能实现跨记录匹配。
因此,尽管数据开放,再识别尝试仍被明确禁止。这是使用开放医疗数据的底线纪律。
8.3 中国法规框架下的使用
对中国研究者,使用 498 涉及:
| 法规 | 相关要求 |
|---|---|
| 《个人信息保护法》 | 数据处理须符合合法性、正当性、必要性 |
| 《数据安全法》 | 数据分类分级保护 |
| 《人类遗传资源管理条例》 | 若涉及遗传资源,需相应审批 |
| 机构伦理审查 | 多数机构要求数据使用走内部流程 |
注意:数据本身来自中国,但托管在美国的 PhysioNet。中国研究者使用它,属于"使用境外托管的中国来源数据",须经机构合规确认。
8.4 “开放获取"不等于"无约束”
498 是开放获取,但使用仍有约束:
| 约束 | 内容 |
|---|---|
| 引用义务 | 必须引用数据集 + 论文 + 平台 |
| 禁止再识别 | 不得尝试识别个体 |
| 不得误用 | 不得用于临床决策或不当商业宣传 |
| 不得声称不实 | 单中心结论不得推广为普适结论 |
| 质量声明 | 应说明数据存在缺失与错误 |
“开放"意味着"可达”,不意味着"免责"。
8.5 单中心结论的表述规范
使用 498 发表研究时,结论表述应遵循:
- ✅ “在浙江省人民医院 ICU 队列中,我们观察到……”
- ✅ “在单中心中国成人 ICU 数据中,模型 AUROC 达到……”
- ❌ “中国 ICU 患者的死亡率是 6%”
- ❌ “该模型可用于中国 ICU 的临床决策”
差别的核心是:从"一个中心的观察"到"一个国家的规律"之间,隔着采样代表性这道不可逾越的沟。
8.6 数据质量声明的义务
官方明示数据存在缺失与错误。使用者的责任是:
- 报告缺失处理策略(删除/插补/建模);
- 报告异常值处理策略;
- 做敏感性分析(不同缺失处理是否改变结论);
- 在局限性中说明。
这是科学诚实的要求,而非形式主义。
8.7 与 495 的合规路径对照
| 维度 | 495 PIC | 498 浙江 |
|---|---|---|
| 访问模式 | 受控(培训 + DUA) | 开放 |
| 培训要求 | 人体受试者培训或中国 GCP | 无 |
| 审批时间 | 约 3 个工作日 | 无 |
| 去标识化 | 日期向未来平移 50-100 年 | 日期移除 |
| 引用义务 | 强制 | 强制 |
| 再识别禁令 | 有 | 有 |
两者的共同点:无论开放与否,引用义务与再识别禁令都不变。这是医疗数据伦理的底线。
8.8 数据开放的制度意义(一个诚实的观察)
498 的价值不应只在技术层面被理解。它也是一次制度实践:证明了中国医院在现有法规框架下,可以完成从院内数据到国际开放数据集的完整路径。
这条路径包含的每一环都有可借鉴之处:
- 伦理审批(QT2022185);
- 回顾性设计的知情同意豁免;
- HIPAA 标准的去标识化;
- 结构化与质控;
- 开放托管;
- 论文发表与代码共享。
对其他有意开放的机构,这是一份现成的路线图。
§9 FAQ:五十问
9.1 关于身份与获取
Q1:官方名称是什么?
Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center。
Q2:官方 slug?
zhejiang-ehr-critical-care。
Q3:DOI 是多少?
10.13026/901c-yv54。
Q4:几个版本?
v1.0,2023-01-19 发布,未见更新。
Q5:免费吗?
免费且开放获取,无需 DUA 审批。
Q6:需要培训吗?
不需要(与 495 PIC 不同)。
Q7:数据在哪个医院产生的?
浙江省人民医院(Zhejiang Provincial People’s Hospital)。
Q8:有几个 ICU?
2 个:综合中心 ICU 与急诊 ICU(EICU)。
Q9:伦理批号是多少?
QT2022185(浙江省人民医院伦理委员会)。
Q10:资助来自哪里?
浙江省卫健委青年人才 2019323925;医路革新-液体治疗 YLGX-ZZ-2020005;浙江省健康科技 2021KY745。
9.2 关于规模与内容
Q11:有多少患者?
7,638 名。
Q12:有多少住院?
8,180 次。
Q13:为什么患者数少于住院数?
因为部分患者多次入院(542 次差别)。
Q14:时间跨度多久?
2012-01 至 2022-05,约 10 年 4 个月。
Q15:有多少张表?
官方表 2 列 10 张(摘要另称 11 张,存照)。
Q16:总大小多大?
约 3.22 GB。
Q17:最大的表是哪个?
Lab.csv,1.83 GB。
Q18:有多少检验记录?
11,082,482 条。
Q19:有多少种检验项目?
214 种。
Q20:有药敏数据吗?
有,DrugSens 表,含 MIC 值。
Q21:有影像数据吗?
没有影像本体,但有 ExamReport 报告文本(CT/超声/MRI)。
Q22:有文本数据吗?
有,EMR 表含主诉、病史等自由文本;ExamReport 含报告文本。
Q23:包含儿科患者吗?
仅 35 例(0-18 岁),主体是成人。
Q24:包含全院还是仅 ICU 患者?
所有入住 ICU 的患者,但 EMR 表包含全院住院信息(含住院天数等)。
Q25:有排除标准吗?
官方明确"无排除标准"。
9.3 关于数据结构
Q26:主键是什么?
patient_SN(患者)+ Hospital_ID(住院)。
Q27:如何识别 ICU 住院?
通过 HospitalTransfer 表的转科事件推断。
Q28:为什么不直接用 ICU 标记字段?
原始系统未单独维护"ICU stay"实体,通过床位流转体现。
Q29:诊断用什么编码?
ICD-10(ICD10_code 字段)。
Q30:检验项目用编码还是名称?
用英文名称(Lab_itemName_Eng),比 MIMIC 的 ITEMID 更可读。
Q31:有字典表吗?
没有,项目名称内嵌在事件表中。
Q32:MedOrder 和 Medication 有什么区别?
MedOrder 是医嘱开立,Medication 是实际执行。
Q33:VitalSign 表是长表吗?
是,每行一个测量事件。
Q34:有单位字段吗?
有,VitalSign_unit 与 Unit_measure。
Q35:日期格式统一吗?
需自行核查,官方未说明格式规范。
Q36:Hospital_ID 有几种格式?
至少两种前缀(ZY|、IP|),说明系统十年间有迁移。
Q37:能跨住院追踪同一患者吗?
能,通过 patient_SN。
Q38:DaysHospitalStay 是 ICU 停留还是全院?
全院住院天数(不是 ICU LOS)。
Q39:有几类出院状态?
四类:治愈/未治愈/死亡/未知。
Q40:有 SOFA 评分的现成字段吗?
没有,需从 VitalSign + Lab 自行计算。
9.4 关于使用
Q41:能用于临床决策吗?
不能。单中心回顾数据不支持临床决策。
Q42:能做外部验证吗?
可以,这正是它最有价值的用途之一。
Q43:能和 MIMIC 联合分析吗?
可以,但需处理 ICD-9/10、单位、变量名等对齐问题。
Q44:能做时间趋势研究吗?
官方明示不能(日历日期被移除)。
Q45:数据干净吗?
不完全干净,官方明示存在缺失值与错误。
Q46:需要清洗多久?
视任务而定,基础任务约数天到数周。
Q47:用什么工具处理?
官方推荐 R(tidyverse/data.table/icd);Python 完全可行。
Q48:Lab 表太大怎么办?
分块读取、只读需要的列、或用 data.table/pyarrow。
Q49:有官方基线模型吗?
没有,需自建。
Q50:有官方划分吗?
没有,需自行划分(建议按 patient_SN)。
9.5 进阶问答
Q51:DrugSens 表的 MIC 值有什么特别价值?
MIC 是定量值,比 S/I/R 分类包含更多信息:支持趋势分析、PK/PD 建模、断点漂移研究。这是 MIMIC 与 PIC 都不具备的。
Q52:为什么死亡率只有 6%?
因为队列"无排除标准",包含较多病情较轻的患者;且"治愈"的判定标准由医院系统定义。
Q53:为什么住院日中位 17 天这么长?
这是全院住院而非 ICU 停留,且中国三级医院的重症患者住院期普遍较长(制度、康复体系、文化因素)。
Q54:如何正确处理"未知"出院状态?
444 例(6%)。可做敏感性分析:把未知并入非死亡 vs 剔除 vs 单独建模,看结论是否稳健。
Q55:为什么数据表数量有矛盾?
官方摘要写 11 张、正文与表 2 列 10 张。以表 2 为准(实证优先)。
Q56:PhysioNet 与论文的作者名单为什么不同?
PhysioNet 页面署名 4 人,论文署名 6 人。两者都是有效来源,引用时以使用的为准。
Q57:能把 ExamReport 的文本结构化吗?
可以,这是高价值方向——可借用 496 的方法论做从报告文本抽取结构化发现。
Q58:能做脓毒症研究吗?
可以。用 ICD-10 + 检验/生命体征按 Sepsis-3 定义筛队列,或用来源论文的纳排标准。
Q59:抗菌药物管理(stewardship)研究怎么做?
把 DrugSens(病原敏感性)与 Medication(实际用药)结合,评估经验性用药的合理性。
Q60:能用于药物流行病学吗?
可以,但受限于单中心与数据结构(无精确日期),需谨慎设计。
Q61:能算 Charlson 合并症指数吗?
可以,用 Diagnosis 表的 ICD-10 编码 + icd 包。
Q62:能有 SOFA/LODS 评分吗?
需自行计算:从 VitalSign(MAP、GCS)+ Lab(肌酐、胆红素、血小板、PaO2)+ Medication(升压药)派生。
Q63:单位不一致怎么处理?
先从数据中统计所有单位取值,建立单位映射表,统一到标准单位。
Q64:为什么官方强调无法做时间趋势?
因为真实日历日期被移除以防再识别。这是隐私保护的必然代价。
Q65:数据还会更新吗?
未见表态。数据集冻结在 2022-05,医院数据仍在产生。
Q66:能联系团队获取更新吗?
可以通过 GitHub 仓库或论文通讯作者联系。
Q67:这份数据与中国其他重症库的关系?
与 495 PIC 互补(成人 vs 儿科;开放 vs 受控)。
Q68:能用于多模态研究吗?
有限——有 ExamReport 文本,但无影像本体。
Q69:能做联邦学习吗?
可以,它是联邦学习中一个理想的"本地数据集"候选。
Q70:值不值得投入时间使用?
如果你做中国重症研究、模型外部验证或耐药研究,值得——它是少数开放且真实的中国重症数据。
9.8 番外:三个反问
反问一:开放数据会不会因为"太容易拿到"而被滥用?
这是真实的风险。但反向的推论——“因为怕滥用所以不开放”——代价更大:它让所有正当研究都无法进行。498 的选择是:用充分去标识化降低风险,用引用规范与再识别禁令约束使用,把"可达性"还给研究社区。
反问二:7,638 名患者够吗?
对深度学习是偏小的(尤其 438 例死亡事件);对统计建模与外部验证是够的。关键不在绝对规模,而在它能否回答你的问题——如果问题是"中国成人 ICU 的死亡预测能否外推",它足够。
反问三:这份数据最大的贡献是数据本身,还是它的示范意义?
两者都是。数据本身可以立即使用;示范意义则更长久——它证明了在中国,医疗数据开放是一条走得通的路。后者的价值可能超过前者。
§10 存照、引文与系列关系
10.1 存照(口径局限与勘误)
存照 A(表数量矛盾):官方摘要称 11 张表,正文数据描述与表 2 均列 10 张。本条目以表 2 的 10 张为准(实证优先)。
存照 B(作者名单不一致):PhysioNet 页面署名 4 人(Jin S, Chen L, Chen K, Zhang Z),原始 Sci Data 论文署名 6 人(多 Hu C、Hu S)。引用时以实际使用的来源为准。
存照 C(机构未逐人列出):页面未列各作者具体所属机构,仅知研究机构为浙江省人民医院。
存照 D(许可协议未明确):页面称"开放获取"但未列出具体协议名称(ODC/CC 等),是本条目最大的规范短板。
存照 E(PMID 缺失):关联论文未提供 PMID;其 DOI 为 10.1038/s41597-023-01952-3。
存照 F(时间信息的张力):官方明示"因日历数据移除无法做时间趋势研究",但同时又描述"2018 年后 ICU 住院数显著增加"——说明年份级信息可能以粗粒度形式保留,而月日级被移除。使用者需自行核查可用的时间粒度。
存照 G(体积与下载成本):10 表合计约 3.22 GB,Lab 表 1.83 GB。虽是开放获取,但下载与处理成本不可忽略。
存照 H(ICU 识别需自行枚举):ICU 住院须通过 HospitalTransfer 表推断,且急诊 ICU 的部门名可能不含 “ICU” 字样(“Emergency medical department”/“Emergency Department”),仅用字符串匹配会漏检。必须先枚举实际科室名。
存照 I(多次 ICU 停留的拆分规则未明):同一患者多次进出 ICU 的拆分规则官方未详述,需自行定义。
存照 J(数据质量官方警告):官方明示数据存在缺失值与错误,使用者须自行清洗并报告策略。
存照 K(口径陷阱):DaysHospitalStay 为全院住院天数(中位 17 天),非 ICU 停留时长;与 MIMIC 的 ICU LOS 不可直接比较。
存照 L(未知出院状态):444 例(6%)出院状态为"未知",处理方式会影响死亡率估计。
存照 M(平台引用义务):PhysioNet 2026 年要求一并引用平台论文(Pollard et al., Nature Health 2026, DOI 10.1038/s44360-026-00096-z)。
存照 N(DrugSens 的独特价值):该表含 MIC 定量值,是 498 相对 MIMIC 与 PIC 的显著增量能力,支撑抗菌药物耐药研究。
10.2 引文
- Jin S, Chen L, Chen K, Zhang Z. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center (version 1.0). PhysioNet. 2023. RRID:SCR_007345. DOI: 10.13026/901c-yv54.
- Senjun J, Lin C, Kun C, Hu C, Hu S, Zhongheng Z. Establishment of a Chinese critical care database from electronic healthcare records in a tertiary care medical center. Scientific Data. 2023. DOI: 10.1038/s41597-023-01952-3.
- Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health. 2026;1(8):792-795. DOI: 10.1038/s44360-026-00096-z.
- Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data. 2016;3:160035.
- Singer M, Deutschman CS, Seymour CW, et al. The Third International Consensus Definitions for Sepsis and Septic Shock (Sepsis-3). JAMA. 2016;315(8):801-810.
- Vincent JL, Moreno R, Takala J, et al. The SOFA (Sepsis-related Organ Failure Assessment) score to describe organ dysfunction/failure. Intensive Care Med. 1996;22(7):707-710.
- Quan H, Sundararajan V, Halfon P, et al. Coding algorithms for defining comorbidities in ICD-9-CM and ICD-10 administrative data. Med Care. 2005;43(11):1130-1139.(Charlson 指数 ICD-10 实现)
- Charlson ME, Pompei P, Ales KL, MacKenzie CR. A new method of classifying prognostic comorbidity in longitudinal studies. J Chronic Dis. 1987;40(5):373-383.
- KDIGO. KDIGO Clinical Practice Guideline for Acute Kidney Injury. Kidney Int Suppl. 2012;2:1-138.(AKI 定义)
- 张忠恒团队重症数据相关研究(该作者团队另有脓毒症、液体治疗等多篇论文).
10.3 与既有条目的系列关系
| 关系 | 说明 |
|---|---|
| 中国重症双层 | 495 PIC(儿科,ZUCH,受控)↔ 498 浙江(成人,省人民医院,开放) |
| 开放路径对照 | 497 Health Gym(合成换开放)↔ 498(去标识化换开放):两种"开放"的实现方式 |
| 外部验证配对 | 498 是 MIMIC(492)模型的最佳外部验证对象之一 |
| 方法迁移 | 496 的文本抽取方法可迁移到 498 的 ExamReport |
| 结构对照 | 495 有字典表与 16 张表;498 无字典表、10 张表但更开放 |
10.4 变更日志
| 日期 | 变更 |
|---|---|
| 2026-09-20 | 初版发布:完成身份核查(PhysioNet v1.0)、论文核查(Sci Data 2023)、三段撰写、双检、发布、封面、DB 验证 |
声明:本条目为千方病案医数集 AI-Ready 数据集百科的组成部分,仅整理公开元数据与公开文献信息。本数据集为开放获取资源,但其使用仍须遵守引用义务与禁止再识别的要求。所有数字均标注来源,存疑处列入 §10 存照。单中心回顾性数据的结论不可推广为普适规律,亦不构成临床决策依据。
使用须知:本文内容用于研究与信息参考。任何临床决策应由有资质的医疗专业人员基于具体患者情况作出。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- hirid — 共享标签:电子健康记录 / 重症监护
- eicu-collaborative — 共享标签:电子健康记录 / 重症监护
- mimic-iv-ed — 共享标签:电子健康记录 / 重症监护
- mimic-br — 共享标签:电子健康记录 / 重症监护
- pcornet — 共享标签:电子健康记录 / 重症监护
- mimic-iv-ed — 共享标签:电子健康记录 / 重症监护
- mimic-iv-clinical-database — 共享标签:电子健康记录 / 重症监护
- amsterdamumcdb — 共享标签:电子健康记录 / 重症监护
- sicdb — 共享标签:电子健康记录 / 重症监护
- pic — 共享标签:电子健康记录 / 重症监护
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

