PIC — 儿科重症监护数据库 AI-Ready Wikipedia | 千方病案医数集

全球首个大规模儿科重症公开数据库 · 1.3 万患儿 · MIMIC 儿科版

来源 浙江大学医学院附属儿童医院 & 国家儿童健康与疾病临床医学研究中心 url: https://physionet.org/content/picdb/发布时间: 2026-09-07最后更新: 2026-09-07 阅读 4

信息速览

数据集名称PIC — 儿科重症监护数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型12,881 名患儿,13,941 次 ICU 入住,2010-2018 年数据,ICD-10CN 编码,中英双语字典,需 CITI/GCP 培训
规模1.3 万名患儿
接入方式浙江大学医学院附属儿童医院 & 国家儿童健康与疾病临床医学研究中心 url: https://physionet.org/content/picdb/
AI 就绪度

数据集封面

PIC — 儿科重症监护数据库 AI-Ready Wikipedia


INFOBOX

数据集名称 PIC(Paediatric Intensive Care database)
英文全称 Paediatric Intensive Care database
别名/简称 PIC、PICDB、picdb
疾病分类 儿科重症监护全疾病谱——先天性畸形(ICD-10 Q00-Q99,25.4%)、围生期疾病(P00-P96,14.1%)、呼吸系统疾病(J00-J99,10.3%)为前三出院诊断(ICD-11:MA00-MC8Z 先天异常 / KA00-KD6Z 围生期疾病 / CA40-CB7Z 呼吸系统疾病等)
SNOMED CT 133834002 Critical care medicine (procedure) / 91302008 Sepsis / 233604007 Pneumonia / 14669001 Acute renal failure syndrome(详见 §2.2)
数据模态 结构化 EHR(检验、处方、微生物、诊断编码)、床旁观察时序(护士手工记录)、术中生命体征时序(5 分钟)、NLP 结构化症状;无自由文本、无波形
AI 任务类型 院内死亡预测、脓毒症表型(Phoenix 标准)、心脏术后 AKI 预测、住院时长预测、疾病分层聚类、跨库泛化(OOD)基准
样本总数 12,881 名患儿 / 13,449 次住院 / 13,941 次 ICU 入住 / 17 张关系表(住院数原文另有 13,499 口径,见坑点 1)
数据大小 17 个 CSV(gzip)表、约 1,570 万行事件记录;官方未公布压缩包体积(单机可处理,无需分布式)
数据格式 CSV(gzip)/ MySQL / PostgreSQL(官方建库脚本)
许可证 PhysioNet Credentialed Health Data License 1.5.0
访问级别 申请审核(注册 PhysioNet + CITI 人类受试者保护课程或中国 GCP 认证 + 签署 DUA,审批约 3 个工作日);⚠️ 2025-07 起美国 DOJ DSP 限制中国大陆等六国 IP/机构归属用户访问(见 §6.2)
DUO 标签 HMB, NPUNCU, PUB
语言 中英双语(字典与术语;原始中文病历文本未发布)
首发日期 2019-11-26(v1.0.0)/ 2020-01-13(Scientific Data 论文发表)
最后更新 2020-11-12(v1.1.0,此后停止更新)
发布机构 浙江大学医学院附属儿童医院 & 国家儿童健康与疾病临床医学研究中心
官方主页 https://physionet.org/content/picdb/
下载地址 https://physionet.org/content/picdb/1.1.0/
DOI 10.1038/s41597-020-0355-4(论文)/ 10.13026/32x9-wv38(数据集 v1.1.0)
引用次数 140+(Google Scholar / ResearchGate,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— MIMIC 兼容 schema + 官方建库脚本 + 中英双语字典;扣分项:无官方划分、基准生态薄、无自由文本、v1.1.0 后停更
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-10CN 与 ICD-11/SNOMED CT 映射、5 个儿科 ICU 单元定义、Phoenix 儿童脓毒症标准与 PRISM III 临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(17 表结构、三级主键体系、字符型 ITEMID)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与浙江大学医学院附属儿童医院、国家儿童健康与疾病临床医学研究中心、PhysioNet 无任何商业利益关联。本页面不销售 PIC 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批——儿科人群的模型准入门槛高于成人,尤须谨慎。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PIC 要求用户完成受认可的人类受试者保护培训(CITI Program 课程或中国本地机构的 GCP 认证)并通过 PhysioNet 凭证化申请、签署数据使用协议(DUA)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

PIC(Paediatric Intensive Care database)是浙江大学医学院附属儿童医院于 2019 年发布、托管于 PhysioNet 的全球首个大规模儿科重症监护公开数据库,包含 12,881 名患儿、13,941 次 ICU 入住的脱敏临床数据(2010-2018 年),覆盖检验、处方、微生物、床旁观察、术中生命体征与 NLP 结构化症状,共 17 张关系表,表结构兼容 MIMIC-III。

它的历史地位由三个"第一"奠定:全球第一个可自由申请的大规模儿科 ICU 数据库(MIMIC、eICU 均以成人为主);中国第一个登陆 PhysioNet 的重症监护数据库;以及 2024 年 Phoenix 儿童脓毒症与脓毒性休克国际共识标准(JAMA)开发队列中的中国站点数据来源。一句话概括:如果你要做儿科重症 AI 研究,PIC 是你几乎绕不开的公开数据起点

你可以用它来:训练儿科 ICU 死亡风险模型、复现 Phoenix 脓毒症标准的中国站点分析、预测心脏术后急性肾损伤、做 MIMIC ↔ PIC 跨库泛化(OOD)基准、研究新生儿与婴幼儿亚群、或作为教学数据集讲解儿科 EHR 的特殊性。若研究对象为成人 ICU,请改用 MIMIC-IV。

§1.1 摘要

PIC 由浙江大学医学院附属儿童医院(国家儿童健康与疾病临床医学研究中心,全院 >1,900 张床位、119 张重症床位,浙江省最大综合性儿科医疗中心)联合浙江大学生物医学工程与仪器科学学院构建,通讯作者为舒强与李昊旻。数据覆盖 2010-2018 年该院 5 个 ICU 单元——综合 ICU(GICU)、儿科 ICU(PICU)、外科 ICU(SICU)、心脏 ICU(CICU)与新生儿 ICU(NICU)——共 12,881 名患儿、13,449 次住院、13,941 次 ICU 入住。人群以婴幼儿为主(平均年龄 2.5 岁,Q1-Q3:0.1-3.3),男性 57.5%,院内死亡率 7.1%,468 名患儿(3.6%)有多次住院。

数据库刻意沿用 MIMIC-III 的关系型 schema(SUBJECT_ID → HADM_ID → ICUSTAY_ID 三级主键),诊断采用中国版 ICD-10 扩展编码(ICD-10CN,7 位)并附中英双语字典,症状经 NLP 从中文病历抽取为结构化标签(双人校验准确率 91.9%)。v1.0.0(2019-11-26,16 张表)首发于 PhysioNet,论文 2020-01-13 发表于 Scientific Data;v1.1.0(2020-11-12,17 张表)新增 SURGERY_INFO 表并扩充术中生命体征字段,此后冻结。与 MIMIC 的关键差异:无自由文本、无床旁监护仪趋势数据、CHARTEVENTS 仅 19 类护士手工记录事件、ITEMID 为字符型。

§1.2 战略价值分析

儿科维度:重症医学公开数据长期是"成人俱乐部"——MIMIC-III/IV、eICU-CRD、AmsterdamUMCdb、HiRID 全部以成人 ICU 为主体。儿童不是缩小版成人:新生儿、婴儿、儿童的生理参考区间、病因谱(先天畸形与围生期疾病主导,而非冠心病与慢阻肺)、用药剂量逻辑完全不同,成人模型无法直接迁移。PIC 填补了这一空白,使儿科重症 AI 第一次拥有了与成人研究同等规格的公开基础设施——这也是 ehrapy(Nature Methods 2024)等 EHR 分析框架选择 PIC 做演示的原因。

中国与多中心维度:PIC 是中国第一个登陆 PhysioNet 的重症监护数据库,证明了"中国三甲医院数据经 HIPAA 标准脱敏后向全球开放"这条路径可行。其最高规格的制度性认可来自 2024 年:SCCM 主导的 Phoenix 儿童脓毒症与脓毒性休克国际共识标准(JAMA 2024)在开发队列中纳入了 10 个站点(美国、哥伦比亚、孟加拉国、中国、肯尼亚),PIC 论文被列入参考文献——中国站点即 PIC。一个发展中国家的单中心儿科数据进入国际诊断标准的开发队列,这在公开 EHR 历史上是第一次。

方法学维度:PIC 与 MIMIC-III 刻意同构的 schema 催生了跨库泛化研究的标准试验台。BEDS-Bench(2021)直接以 MIMIC-III ↔ PICDB 构建分布外(OOD)基准;中英双语字典、ICD-10CN 本地扩展编码与 NCCD 药品编码又为"编码体系迁移"这一老大难问题提供了真实世界的研究素材。

§1.3 横向对比

数据集 患者数 ICU 入住 人群 时间跨度 核心差异化
PIC 12,881 13,941 全儿科 0-18 岁 2010-2018 唯一大规模儿科公开 ICU 库;中英双语;Phoenix 标准中国站点
MIMIC-III 46,520 61,532 成人为主(含 7,870 NICU 新生儿) 2001-2012 被引最多的经典版;含 208 万篇文本;已冻结
MIMIC-IV 364,627 94,458 成人 2008-2022 四模态模块化,活跃维护,成人新课题首选
eICU-CRD 200,859 200,000+ 成人 2014-2015 多中心(208 家美国医院),无文本
HiRID 33,905 33,905 成人 2008-2016 2 分钟采样率,超高时间分辨率

PIC 的不可替代性在三点:全儿科年龄谱(0-18 岁,含 2,968 次新生儿 ICU 入住);中英双语术语体系(字典表双语,ICD-10CN 中文诊断比英文更精细);以及与 MIMIC 同构 schema 带来的跨库可比性。短板同样清晰:单中心、无自由文本、无床旁监护趋势、2020 年后停更。

§1.4 版本演进时间轴

时间 事件
2010-2018 数据采集期:浙大儿院 5 个 ICU 单元 119 张床位的全部入住患儿
2019-09-24 论文投稿 Scientific Data
2019-11-26 v1.0.0 首发(PhysioNet,16 张表)
2019-12-20 论文接收
2020-01-13 Scientific Data 论文在线发表(Zeng et al., DOI: 10.1038/s41597-020-0355-4)
2020-11-12 v1.1.0 发布(17 张表):新增 SURGERY_INFO;DIAGNOSES_ICD 区分主/次诊断;SURGERY_VITAL_SIGNS 增加 SpO₂、呼气末 CO₂、ECG ST 改变;随附 update_to_v1.1.0 增量包与示例 SQL
2021-06 Hong et al. 死亡预测集成特征选择研究发表(Health Data Science,代码公开)
2021-07 BEDS-Bench arXiv 发布,以 MIMIC-III ↔ PICDB 构建跨库 OOD 基准
2023-01 Zeng et al. 心脏术后 AKI 时间感知模型发表(JAMIA,代码公开)
2024-02 Phoenix 儿童脓毒症标准发表(JAMA 双文),PIC 为开发队列中国站点
2024-12 ehrapy 框架论文发表(Nature Methods),以 PIC v1.1.0 做肺炎患儿分层演示
2025-04 美国 DOJ 数据安全计划(DSP,行政令 14117)生效,PhysioNet 开始对受控数据集实施地域访问限制
2025-07 DSP 全面执行:中国(含港澳)等六国 IP/机构归属用户被阻止访问 PhysioNet 受控数据集,PIC 获取流程对中国大陆研究者实质受限(见 §6.2)
2025-09 MDPI Bioengineering 发表 PIC 机器学习研究系统综述(10 项研究)
2020-11 至今 数据集冻结于 v1.1.0,无进一步更新(截至 2026-09)

§1.5 典型 AI 应用场景

  1. 儿科 ICU 死亡风险预测:Hong et al. 2021 的范式——397 个手工特征经集成逐步筛选至 11 个,逻辑回归 AUROC 0.7531,超越 PRISM III 基线(0.6895);代码开源,是入门 PIC 的最佳复现对象。
  2. 心脏术后急性肾损伤(AKI)预测:Zeng et al. 2023(JAMIA)在 3,386 名心脏术后患儿上以 time-aware attention LSTM 达 ROC AUC 0.908,捕获 91% 的 AKI 事件;AKI 发生率 9.8%。
  3. 脓毒症表型与标准研究:PIC 是 Phoenix 标准(JAMA 2024)开发队列的中国站点,库内可复现 Phoenix Sepsis Score ≥2 的队列定义与死亡率分层分析。
  4. 跨库泛化(OOD)基准:BEDS-Bench 以 MIMIC-III ↔ PICDB 为配对,测试模型跨编码体系(ICD-9 ↔ ICD-10CN)、跨人群(成人 ↔ 儿童)、跨地域(美国 ↔ 中国)的迁移能力。
  5. 新生儿与婴幼儿亚群研究:2,968 次 NICU 入住支持新生儿专病建模(如 2026 年 Sci Rep 的 LSTM autoencoder,AUROC 0.92);年龄分层(新生儿/婴儿/幼儿及以上)是儿科建模的基本功。
  6. EHR 分析框架演示与教学:ehrapy 官方教程以 PIC 做端到端演示(KNN 填补、log 归一化、Leiden 聚类);17 张表、1,570 万行的体量单机即可处理,适合课堂全流程演练。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

PIC 库内诊断为 ICD-10CN(中国版 ICD-10,扩展至 7 位码,比国际标准 5 位更细)。出院诊断前三位 ICD-10 章(Zeng 2020 原文)到 ICD-11 的映射如下:

ICD-10 章(库内编码体系) 中文名称 出院诊断占比 ICD-11 对应
Q00-Q99 先天性畸形、变形和染色体异常 25.4%(全库第一) MA00-MC8Z 多发性先天异常综合征 / LA00-LB9Z 神经系统先天异常 / LA80-LD2Z 循环系统先天异常等
P00-P96 起源于围生期的某些情况 14.1%(第二) KA00-KD6Z 围生期及新生儿疾病(KA20 新生儿呼吸窘迫 / KB20 新生儿黄疸等)
J00-J99 呼吸系统疾病 10.3%(第三) CA40-CB7Z 呼吸系统疾病(CA40 肺炎 / CB41 呼吸衰竭等)
A00-B99 某些传染病和寄生虫病(含脓毒症相关) 高频共病 1G40-1G4Z 脓毒症(1G40 脓毒性休克)
N00-N99 泌尿生殖系统疾病(含急性肾损伤 N17) 高频共病 GB60-GB6Z 急性肾衰竭(GB60.Z)

为什么 ICD-10CN 是双刃剑:与 2015 年后中国医院的计费与病案体系直接兼容(资产);但 7 位本地扩展码与国际 5 位码不对齐,中文诊断术语比英文更精细,跨库(MIMIC、eICU)队列定义必须经 UMLS 一对多映射(BEDS-Bench 已趟过这条路),无标准码的术语由论文作者人工翻译并复核(包袱)。字典表 D_ICD_DIAGNOSES 含 25,378 行(ICD-10CN + ICD-O-3 肿瘤形态学编码)。详见坑点 3。

§2.2 SNOMED CT 映射

临床场景 ICD-10CN 锚点 ICD-10 国际标准 SNOMED CT SNOMED CT 术语
脓毒症 A41.x(扩展码更细) A41.9 91302008 Sepsis (disorder)
脓毒性休克 A41.9 / R57.2 A41.9 / R57.2 76542007 Septic shock (disorder)
肺炎 J18.x J18.9 233604007 Pneumonia (disorder)
急性肾损伤 N17.x N17.9 14669001 Acute renal failure syndrome (disorder)
先天性心脏病 Q20-Q26 Q20-Q26 13213009 Congenital heart disease (disorder)
新生儿呼吸窘迫综合征 P22.0 P22.0 46775006 Respiratory distress syndrome in newborn (disorder)
早产儿 P07.3 P07.3 59403008 Premature infant (finding)
重症监护 Z51.89 133834002 Critical care medicine (procedure)
机械通气 操作相关术语 5A1935Z(ICD-10-PCS) 243141005 Mechanical ventilation (regime/therapy)

§2.3 疾病简介

PIC 面向儿科重症监护室内全部疾病谱,其病因结构与成人 ICU 根本不同:出院诊断第一位是先天性畸形(25.4%,以先天性心脏病为代表——CICU 的存在直接服务于此),第二位是围生期疾病(14.1%,与 NICU 新生儿对应),第三位是呼吸系统疾病(10.3%,儿童重症感染的主要受累系统)。全院 ICU 院内死亡率 7.1%,其中 NICU 平均 ICU 入住时长最长(21.6 天,Q1-Q3:2.5-32.8),SICU 最短(2.3 天)。脓毒症是儿科重症死亡的首要可干预病因——2024 年 Phoenix 国际共识标准的发布统一了此前 18 种儿童脓毒症定义并存的混乱局面,而 PIC 正是该标准开发队列的中国站点数据来源。儿童重症资源在中国分布极不均衡,浙大儿院承接浙江省 11 个城市的下级医院转诊,其数据天然带有"疑难重症富集"的转诊中心特征。

§2.4 临床任务定义

AI 任务 临床定义 标准参考 在 PIC 中的操作化
院内死亡预测 住院期间全因死亡 出院处置记录 ADMISSIONS 死亡标识字段(全库 7.1%)
儿童脓毒症(Phoenix 标准) 疑似感染 + Phoenix Sepsis Score ≥ 2(呼吸/心血管/凝血/神经四系统) Schlapbach/Sanchez-Pinto et al. (2024), JAMA 呼吸支持 + 乳酸/血压/血管活性药 + 血小板/凝血 + GCS 等床旁与检验字段组合
心脏术后 AKI KDIGO 肌酐标准(心脏外科亚组) KDIGO (2012);Zeng et al. (2023), JAMIA SURGERY_INFO 筛选心脏手术 + LABEVENTS 肌酐时序(队列 3,386 人,发生率 9.8%)
PRISM III 评分对照 儿科死亡风险传统评分(17 项生理指标) Pollack et al. (1996) CHARTEVENTS + LABEVENTS 首 24h 提取;Hong 2021 以其为基线(AUROC 0.6895)
新生儿疾病分层 NICU 亚群表型 ehrapy / Sci Rep 2026 NICU 入住过滤(2,968 次)+ 聚类/autoencoder
住院时长预测 ICU 入科到出科天数 文献惯例 ICUSTAYS 出入科时间派生(全库均值 9.3 天)

§2.5 患者人群特征

维度 特征
数据来源 单中心:浙江大学医学院附属儿童医院(中国杭州),国家儿童健康与疾病临床医学研究中心,全院 >1,900 张床位,年门急诊 >300 万人次,浙江省最大综合性儿科医疗中心
采集时间 2010-2018(全部日期已偏移至 2060-2120 伪年份区间)
规模 12,881 名患儿 / 13,449 次住院 / 13,941 次 ICU 入住
年龄 平均 2.5 岁(Q1-Q3:0.1-3.3);新生儿 0-28 天 2,968 次、婴儿 1-12 月 4,876 次、幼儿及以上 13 月-18 岁 6,097 次(ICU 入住口径)
性别 男性 57.5% / 女性 42.5%
院内死亡率 7.1%
住院时长 平均 17.6 天(Q1-Q3:7.0-21.0)
ICU 入住时长 平均 9.3 天(Q1-Q3:0.9-9.2);NICU 最长 21.6 天,SICU 最短 2.3 天
多次住院 468 名患儿(3.6%)有多次住院记录
转诊特征 承接浙江省 11 个城市下级医院转诊,疑难重症富集
民族 人口过少的民族取值已归并为 “Other”(脱敏措施)

覆盖的 ICU 类型(5 个单元,119 张重症床位)

ICU 类型 中文 定位
GICU 综合监护室 全院综合重症
PICU 儿科监护室 内科系统重症
SICU 外科监护室 外科术后与创伤(ICU 时长最短,2.3 天)
CICU 心脏监护室 先心病围术期(AKI 研究主战场)
NICU 新生儿监护室 0-28 天新生儿(ICU 时长最长,21.6 天)

§2.6 金标准/参考标准

数据来源 记录方式 产生者 金标准性质
实验室检查(LABEVENTS,1,009 万行) 医院检验信息系统(LIS)定量测定 浙大儿院检验科 定量标准,822 个 unique 项目,118 个带 LOINC 映射
床旁观察(CHARTEVENTS,228 万行) 护士手工记录(非监护仪自动采集),仅 19 类事件 ICU 护理团队(NIS 护理信息系统) 临床常规记录,粒度粗于 MIMIC,存在录入误差
术中生命体征(SURGERY_VITAL_SIGNS,122 万行) 麻醉信息管理系统(AIM)每 5 分钟自动记录 麻醉科 全库时间分辨率最高的时序数据(仅术中窗口)
诊断编码(DIAGNOSES_ICD) 出院后编码员按 ICD-10CN 回顾性分配;v1.1 起区分主/次诊断 病案室编码员 行政编码,反映计费与病案需求,存在主诊断选择偏误
结构化症状(EMR_SYMPTOMS,40 万行) NLP 从中文病历文本自动抽取 研究团队 NLP 管道 双人独立校验平均准确率 91.9%(91.3% / 92.4%);已知三类错误:长短语分词、阳性/阴性误判、家属症状误归患者——应作弱标签使用
处方(PRESCRIPTIONS,126 万行) CPOE 医嘱系统记录 临床医师 药品采 NCCD 编码(657 unique),非国际通用编码
院内死亡 住院系统自动记录 住院系统 客观事件,高度可靠(全库 7.1%)

脱敏规则(所有下游分析的前提):移除全部 HIPAA 标识符;因中文自由文本自动脱敏工具不可用,原始病历文本未发布(改以 NLP 结构化症状替代);SUBJECT_ID/HADM_ID/ICUSTAY_ID 随机重编号不可回链;所有日期按患者随机偏移 50-100 年至未来(记录落在 2060-2120 区间),同一患者偏移量一致,保留一天内时刻、星期几与四季季节(3-5 春/6-8 夏/9-11 秋/12-2 冬),不保留真实年份;人口过少民族的 ethnicity 归并为 “Other”。官方明示该偏移"may limit utilization in time-sensitive studies"。


§3 数据集规格

§3.0 版本抉择矩阵

30 秒选型——PIC 不是 MIMIC 的替代品,而是儿科场景的专用答案:

你的需求 推荐数据集 体量 理由
儿科 ICU 任何研究(死亡/AKI/脓毒症/新生儿) PIC v1.1.0 17 表,单机可处理 全球唯一大规模儿科公开 ICU 库;中英双语字典;Phoenix 标准中国站点
复现 Phoenix 脓毒症标准中国站点分析 PIC v1.1.0 同上 JAMA 2024 开发队列参考文献直接指向 Zeng 2020
成人 ICU 研究、需要临床文本/波形 MIMIC-IV v3.1 ~7 GB(CSV zip) 成人新课题首选,活跃维护,多模态
跨库泛化(OOD)方法学研究 PIC + MIMIC-III 配对 两库合计 BEDS-Bench 已建好评测协议,schema 同构
成人多中心外部验证 eICU-CRD 208 家美国医院;注意与 PIC 人群不可比

PIC v1.0.0 vs v1.1.0 关键差异速查(复现旧论文必读):

维度 v1.0.0(2019-11-26) v1.1.0(2020-11-12)
表数量 16 张 17 张(新增 SURGERY_INFO)
诊断编码 DIAGNOSES_ICD 无主/次区分 DIAGNOSES_ICD 区分主诊断/其他诊断;D_ICD_DIAGNOSES 字典更新
术中生命体征 基础字段 SURGERY_VITAL_SIGNS 增加 SpO₂、呼气末 CO₂(EtCO₂)、ECG ST 改变
项目字典 D_ITEMS 旧版 D_ITEMS 更新
升级路径 官方提供 update_to_v1.1.0 增量包 + 示例 SQL

一句话结论:一律使用 v1.1.0;只有复现 2020 年 11 月前投稿的论文时才需要核对 v1.0.0 的表结构差异。

§3.1 模态详细说明

PIC 包含四大数据模态(注意"无自由文本、无波形"两条边界):

  1. 结构化医院系统数据:LABEVENTS(1,009 万行检验,覆盖全住院期)、PRESCRIPTIONS(126 万行处方,NCCD 编码)、MICROBIOLOGYEVENTS(18.4 万行微生物培养药敏)、DIAGNOSES_ICD(ICD-10CN + ICD-O-3)、OR_EXAM_REPORTS(18.4 万行检查事件,仅事件记录无报告内容)。
  2. 床旁观察时序(护士手工):CHARTEVENTS(228 万行,仅 19 类事件)——这是 PIC 与 MIMIC 最大的模态差异:没有监护仪自动趋势,全部是护士手工录入的床旁观察,时间粒度与完整性均粗于 MIMIC。
  3. 术中生命体征时序(自动):SURGERY_VITAL_SIGNS(122 万行,每 5 分钟,来自麻醉信息管理系统 AIM)——全库唯一的高频自动时序,v1.1 起含 SpO₂、EtCO₂、ECG ST。
  4. NLP 结构化症状:EMR_SYMPTOMS(42 万行)——中文病历经 NLP 抽取的症状标签(阳性/阴性/部位),是"无自由文本"约束下的替代性文本资产。

§3.2 样本量拆分(17 张表完整清单,v1.1.0 精确行数)

A. 患者追踪与住院管理(3 张)

表名 行数 内容
PATIENTS 12,881 患者:SUBJECT_ID、性别、出生日期(已偏移)
ADMISSIONS 13,449 住院记录:HADM_ID、入出院时间、院内死亡标识(原文另有 13,499 口径,见坑点 1)
ICUSTAYS 13,941 ICU 入住:ICUSTAY_ID、5 个 ICU 单元、入出科时间

B. ICU 床旁与术中数据(4 张)

表名 行数 内容
CHARTEVENTS 2,278,978 护士手工床旁观察,仅 19 类事件;不含监护仪趋势与检验
INPUTEVENTS 26,884 液体入量,每日晨间汇总(日粒度,非速率制)
OUTPUTEVENTS 39,891 出量(尿量、引流等)
SURGERY_VITAL_SIGNS 1,216,011 术中生命体征,每 5 分钟,AIM 系统自动记录

C. 医院系统数据(6 张)

表名 行数 内容
LABEVENTS 10,094,117 实验室检查(全库最大表;822 unique 项目,118 个带 LOINC)
PRESCRIPTIONS 1,256,591 处方(NCCD 药品编码,657 unique)
EMR_SYMPTOMS 402,142 NLP 结构化症状(双人校验准确率 91.9%)
MICROBIOLOGYEVENTS 183,869 微生物培养与药敏(43 unique)
OR_EXAM_REPORTS 183,809 检查事件(放射/超声/心电/病理,仅事件记录无报告内容)
DIAGNOSES_ICD 13,365 住院诊断(ICD-10CN + ICD-O-3;v1.1 区分主/次诊断;行数 < ADMISSIONS)

D. 手术与字典表(4 张)

表名 行数 内容
SURGERY_INFO v1.1 新增 手术名称、时间、麻醉方式
D_ITEMS 466 非检验项目字典(中英双语)
D_LABITEMS 832 检验项目字典(中英双语)
D_ICD_DIAGNOSES 25,378 ICD-10CN 诊断字典 + ICD-O-3 肿瘤形态学编码(中英双语)

§3.3 数据格式详情

形态 格式 说明
发布文件 17 个 .csv.gz + 官方建库脚本 PhysioNet 凭证化下载;schema 名 “pic”
本地数据库 MySQL(define.sql / index.sql / constraints.sql)或 PostgreSQL(1-create-tables-load-data-gzip.sql 或 csv.sql / 2-index.sql / 3-constraints.sql) 官方脚本随包发布,开箱即用
增量升级 update_to_v1.1.0 文件夹 v1.0 → v1.1 增量 + 示例 SQL
Python 直读 pandas read_csv 体量小(最大表 1,009 万行),单机可行,无需 BigQuery

§3.4 存储大小

形态 大小 备注
压缩包(17 个 .csv.gz) 官方未公布 本百科不编造体积数字;以行数计约 1,570 万行事件记录
最大单表 LABEVENTS 10,094,117 行 对比 MIMIC-III CHARTEVENTS 3.31 亿行,PIC 全库体量约为其 1/20
内存需求 8-16 GB 即可全量处理 pandas 单机可读全部表;无需分布式与云端数仓

§3.5 标注方式

PIC 无传统手工标注,标签来源四层:

  1. 客观事件(最可靠):院内死亡、ICU/住院出入时间——EHR 系统自动记录。
  2. 定量测量(需自定义阈值):检验值与床旁观察值——"异常"需按年龄段分层的儿科参考区间自行定义(见坑点 7)。
  3. 行政编码(有噪声):ICD-10CN 诊断与 NCCD 药品编码——编码员按病案/计费需求分配。
  4. NLP 抽取(弱标签):EMR_SYMPTOMS 症状标签——91.9% 准确率 + 三类已知错误,训练时需按噪声标签处理。

§3.6 标注者资质

不适用传统标注者概念。检验数据来自医院检验科 LIS 系统;床旁观察由 ICU 注册护士手工录入;诊断编码由病案室编码员按 ICD-10CN 分配;EMR_SYMPTOMS 的 NLP 结果经双人独立校验(准确率 91.3% / 92.4%,均值 91.9%);无标准英文译名的 ICD-10CN 术语由论文作者(X.Z.、Y.L.、H.L.)人工翻译并交叉复核。

§3.7 数据采集时间范围

2010 年至 2018 年(约 9 年)。注意:所有日期已按患者随机偏移 50-100 年至 2060-2120 伪年份区间,真实年份不可恢复(见坑点 6)。

§3.8 地理覆盖

单中心——浙江大学医学院附属儿童医院,中国浙江省杭州市。该院承接浙江省 11 个城市下级医院转诊,人群代表"中国东部经济发达地区三级儿科转诊中心",单中心来源是 PIC 最核心的泛化性限制因素(详见 §7.3)。

§3.9 采集设备规格

系统 覆盖内容 说明
EMR 电子病历系统 病历文本(NLP 抽取源)、诊断 原始文本未发布
LIS 检验信息系统 LABEVENTS 822 项检验,118 项带 LOINC
CPOE 医嘱系统 PRESCRIPTIONS NCCD 药品编码
NIS 护理信息系统 CHARTEVENTS、INPUTEVENTS、OUTPUTEVENTS 护士手工记录
AIM 麻醉信息管理系统 SURGERY_VITAL_SIGNS(5 分钟)、SURGERY_INFO 全库唯一自动高频时序
RS 科室报告系统 OR_EXAM_REPORTS 放射/超声/心电/病理检查事件

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 数据源系统 浙大儿院六大临床信息系统(EMR/LIS/CPOE/NIS/AIM/RS) 临床数据实时产生于诊疗、护理与麻醉过程
2. 提取与整合 浙大儿院 + 浙大一院生物医学工程团队联合 ETL 跨系统抽取、按患者对齐;遵循 MIMIC-III schema 设计三级主键
3. 数据清洗 规则过滤 剔除不可能条目(如就诊年份 1900)、错误字符(中文混入数值字段)、极端离群值
4. NLP 症状抽取 中文病历 NLP 管道 + 双人独立校验 40 万条结构化症状,准确率 91.9%
5. 去标识化 HIPAA 标准 + 日期偏移 50-100 年 + ID 随机重编号 + 民族归并 中文自由文本因无可靠脱敏工具未发布
6. 公开发布 PhysioNet 平台(凭证化) 2019-11 v1.0.0 首发 → 2020-11 v1.1.0 冻结;浙大儿院 IRB 批准并豁免个体知情同意

§4 数据结构详解

§4.0 目录结构预览

picdb-1.1.0/
├── PATIENTS.csv.gz                # 患者(12,881 行)
├── ADMISSIONS.csv.gz              # 住院(13,449 行)
├── ICUSTAYS.csv.gz                # ICU 入住(13,941 行)
├── CHARTEVENTS.csv.gz             # 床旁观察(2,278,978 行,仅 19 类事件)
├── INPUTEVENTS.csv.gz             # 入量(26,884 行,日粒度)
├── OUTPUTEVENTS.csv.gz            # 出量(39,891 行)
├── LABEVENTS.csv.gz               # 检验(10,094,117 行——全库最大表)
├── PRESCRIPTIONS.csv.gz           # 处方(1,256,591 行,NCCD 编码)
├── MICROBIOLOGYEVENTS.csv.gz      # 微生物(183,869 行)
├── OR_EXAM_REPORTS.csv.gz         # 检查事件(183,809 行,无报告内容)
├── DIAGNOSES_ICD.csv.gz           # 诊断(13,365 行,ICD-10CN,v1.1 区分主/次)
├── EMR_SYMPTOMS.csv.gz            # NLP 症状(402,142 行)
├── SURGERY_INFO.csv.gz            # 手术信息(v1.1 新增)
├── SURGERY_VITAL_SIGNS.csv.gz     # 术中生命体征(1,216,011 行,5 分钟粒度)
├── D_ITEMS.csv.gz                 # 非检验项目字典(466 行,中英双语)
├── D_LABITEMS.csv.gz              # 检验项目字典(832 行,中英双语)
├── D_ICD_DIAGNOSES.csv.gz         # ICD-10CN 字典(25,378 行,中英双语)
├── update_to_v1.1.0/              # v1.0 → v1.1 增量包 + 示例 SQL
└── build scripts/                 # MySQL 与 PostgreSQL 官方建库脚本

§4.1 DAIMS 标准化字段描述表

核心表:PATIENTS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
SUBJECT_ID INTEGER 患者唯一标识符(随机重编号) 100234 三级主键之根 不允许缺失 正整数
GENDER VARCHAR 患者性别 “M” 人口学协变量/公平性分析 偶有记录不一致 不允许缺失 “M” / “F”
DOB DATETIME 出生日期(已偏移 50-100 年) 2115-03-15 年龄计算(儿科需精确到月/日) 整体偏移,间隔保持 不允许缺失 2060-2120 区间

核心表:ADMISSIONS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
HADM_ID INTEGER 住院唯一标识符 200123 二级主键 不允许缺失 正整数
SUBJECT_ID INTEGER 患者标识(外键) 100234 关联 PATIENTS 不允许缺失 正整数
入出院时间 DATETIME 入院/出院时间(已偏移) 2115-04-01 09:30 时序锚点、LOS 计算 整体偏移 不允许缺失 2060-2120 区间
院内死亡标识 INTEGER 院内死亡(全库 7.1%) 0 最常用靶标 系统自动记录,极可靠 不允许缺失 0 / 1

核心表:ICUSTAYS

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ICUSTAY_ID INTEGER ICU 入住唯一标识符 300456 三级主键 不允许缺失 正整数
ICU 单元 VARCHAR 5 个 ICU 类型 “NICU” 亚群分层 系统记录 不允许缺失 GICU/PICU/SICU/CICU/NICU
入出科时间 DATETIME ICU 入科/出科(已偏移) 2115-04-01 14:20 预测窗口起点(t=0)、LOS 系统记录 不允许缺失 2060-2120 区间

核心表:CHARTEVENTS(228 万行)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ITEMID VARCHAR(字符型) 测量项目(外键 D_ITEMS) “HR” 指标选择——⚠️ 与 MIMIC 整数型不同 不允许缺失 466 个 D_ITEMS 项目中的床旁子集(仅 19 类事件有记录)
CHARTTIME DATETIME 护士录入的观察时间 2115-04-02 08:00 时序对齐 手工录入误差、整点偏好 不允许缺失 偏移后时间戳
VALUE / VALUENUM TEXT / DOUBLE 观察值 128.0 时序特征 手工录入误差;儿科参考区间随年龄剧变 定性项目无 VALUENUM 因项目而异

核心表:LABEVENTS(1,009 万行,全库最大表)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ITEMID VARCHAR 检验项目(外键 D_LABITEMS) “CRE” 指标选择 不允许缺失 832 个 D_LABITEMS 项目(822 有记录,118 带 LOINC)
HADM_ID INTEGER 住院标识 200123 ⚠️ 只有 HADM_ID,无 ICUSTAY_ID 不允许缺失 正整数
CHARTTIME DATETIME 采样时间 2115-04-03 06:00 时序对齐 检验科系统记录 不允许缺失 偏移后时间戳
VALUENUM / VALUEUOM DOUBLE / VARCHAR 定量结果与单位 45.2 时序特征 批间质控差异 定性项目为 NULL 因项目而异

核心表:EMR_SYMPTOMS(40 万行,NLP 弱标签)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
症状字段 VARCHAR NLP 抽取的症状名称(中英双语) “发热/Fever” 表型特征、NLP 任务 准确率 91.9%;三类典型错误 未提及症状即缺失(非阴性) 症状术语集合
阴阳性标识 VARCHAR 阳性/阴性/部位 “阳性” 区分"发热"与"无发热" 阳性/阴性误判为已知错误类型 不确定时按缺失处理 阳性/阴性等

§4.2 标签分布统计

临床任务 阳性率/分布 说明
院内死亡(全库) 7.1% 类别不平衡约 1:13;儿科 ICU 典型水平
心脏术后 AKI(亚组) 9.8%(331/3,386) Zeng 2023 JAMIA 队列(KDIGO 肌酐标准)
Phoenix 脓毒症(参考值) 高资源站点死亡率 7.1% / 低资源 28.5% Phoenix 标准论文多站点口径,非 PIC 单库值
呼吸系统疾病亚组死亡 约 9.5%(n=1,188) Prithula 2024 队列
出院诊断 Top 3 先天畸形 25.4% / 围生期疾病 14.1% / 呼吸系统 10.3% Zeng 2020 原文
多次住院患儿 3.6%(468/12,881) 划分时必须按 SUBJECT_ID 分组(见坑点 8)
年龄分层(ICU 入住口径) 新生儿 2,968 / 婴儿 4,876 / 幼儿及以上 6,097 ehrapy 论文口径

§4.3 关键字段描述性统计

  • 每次 ICU 入住平均:约 724 条 LABEVENTS(10,094,117 / 13,941)+ 约 164 条 CHARTEVENTS(2,278,978 / 13,941)——检验密度高、床旁观察稀疏,与 MIMIC 恰好相反。
  • LABEVENTS 覆盖 822 个实际有记录的检验项目,其中 118 个带 LOINC 映射(国际化比例仅 14.4%)。
  • CHARTEVENTS 仅 19 类事件(BEDS-Bench 统计口径),生命体征完整度远低于 MIMIC。
  • PRESCRIPTIONS 覆盖 657 个 NCCD 药品编码(BEDS-Bench 口径)。
  • MICROBIOLOGYEVENTS 覆盖 43 个 unique 微生物项目。
  • D_ICD_DIAGNOSES 25,378 行含 ICD-10CN 全量 + ICD-O-3 肿瘤形态学编码;实际住院使用到的 ICD-10CN 为 1,122 个 unique(BEDS-Bench 口径),长尾极重。

§4.4 数据层级关系(三级主键体系)

PATIENTS(SUBJECT_ID,12,881 人)
  └─ ADMISSIONS(HADM_ID,13,449 次住院;468 名患儿多次住院)
      └─ ICUSTAYS(ICUSTAY_ID,13,941 次 ICU 入住)
      │   ├─ CHARTEVENTS / INPUTEVENTS / OUTPUTEVENTS(床旁,带 ICUSTAY_ID)
      │   └─ SURGERY_VITAL_SIGNS(术中,经手术关联)
      ├─ LABEVENTS / EMR_SYMPTOMS(⚠️ 只有 HADM_ID,无 ICUSTAY_ID——覆盖全住院期)
      ├─ DIAGNOSES_ICD(住院级编码;13,365 行 < ADMISSIONS 13,449 行)
      ├─ PRESCRIPTIONS / MICROBIOLOGYEVENTS / OR_EXAM_REPORTS(住院级)
      └─ SURGERY_INFO(住院级手术,v1.1 新增)
  • 附加 ID:ROW_ID(自增行号)、ITEMID(字符型,MIMIC 为整数——官方原文明确,见坑点 2)。
  • 高频踩坑:LABEVENTS 与 EMR_SYMPTOMS 无 ICUSTAY_ID 列——"ICU 期间的化验"必须经 ICUSTAYS 入出科时间窗二次过滤;DIAGNOSES_ICD 行数少于 ADMISSIONS,约 84 次住院无诊断编码,inner join 会静默丢失。

§4.5 缺失值情况与信息性缺失编码

缺失类型 指标示例 缺失原因 信息性缺失编码 对 AI 的影响
MAR(工作流程驱动) 乳酸、特殊检验 仅在怀疑特定病情时检查 缺失 ≈ 临床未怀疑该病情 均值填充会系统性低估健康者异常值
MNAR_clinician GCS 等床旁观察 镇静/插管患儿不评估 缺失 = 镇静/插管状态 需分"镇静 vs 非镇静"子群建模
MNAR_device 有创监测指标 仅在置管患儿中测量 缺失 = 无导管 缺失本身即严重度代理
结构性缺失 CHARTEVENTS 仅 19 类 无监护仪自动采集 整类指标全库缺失 无法做小时级血流动力学分析(见坑点 5)
文本缺失 原始病历文本 中文脱敏工具不可用未发布 全库无自由文本 NLP 任务只能用 EMR_SYMPTOMS 弱标签(见坑点 4)
记录频率信息性 床旁观察频次 病重测得勤 测量频率本身预测死亡 建议保留"测量次数"特征

§5 数据划分与使用建议

§5.1 官方数据划分

PIC 官方不提供 train/validation/test 划分。 MDPI Bioengineering 2025 综述指出:在其统计的 10 项 PIC 机器学习研究中,无一项使用库外时间外验证划分,仅 2 项公开代码——这意味着 PIC 文献间的性能数字普遍不可直接比较。写作论文时请自行固定划分并公开,Hong 2021(github.com/hsd1503/PIC_mortality)与 Zeng 2023(github.com/Healthink/AKIPrediction)是两个可复现的正面案例。

§5.2 推荐划分策略

  1. 按 SUBJECT_ID 分组随机划分(必须):468 名患儿(3.6%)有多次住院,按 HADM_ID 划分必然泄漏。scikit-learn 用 GroupShuffleSplit(groups=SUBJECT_ID)
  2. ⚠️ 不能按真实年份划分:所有日期已偏移至 2060-2120 伪年份,真实年份维度被永久抹除。只能按患者内相对顺序做"顺序划分",临床含义有限。
  3. 按年龄段分层:新生儿(0-28 天)/ 婴儿(1-12 月)/ 幼儿及以上(13 月-18 岁)三层生理参考区间完全不同,建议分层抽样并分别报告子群性能(见坑点 7)。
  4. 按 ICU 单元分层:GICU/PICU/SICU/CICU/NICU 病因谱差异巨大(CICU 以先心围术期为主、NICU 为新生儿),可用于亚群评估与留一单元验证。
  5. 亚组建模惯例:心脏术后 AKI(Zeng 2023)、呼吸系统亚组(Prithula 2024)、NICU 新生儿(Sci Rep 2026)均采用"先按临床路径圈定亚组再建模"的儿科特色范式。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

patients = pd.read_csv("PATIENTS.csv.gz")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(patients, groups=patients["SUBJECT_ID"]))
train_subjects = set(patients.iloc[train_idx]["SUBJECT_ID"])
test_subjects = set(patients.iloc[test_idx]["SUBJECT_ID"])
assert len(train_subjects & test_subjects) == 0  # 患者级零泄漏验证(468 名多次住院患儿的关键防线)

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按 HADM_ID 而非 SUBJECT_ID 划分(3.6% 患儿多次住院) GroupShuffleSplit(groups=SUBJECT_ID),划分后验证患者集合零交集
2 用全住院期 LABEVENTS/EMR_SYMPTOMS 预测 ICU 早期结局(两表无 ICUSTAY_ID) 必须经 ICUSTAYS 入出科时间窗过滤
3 用院内死亡标识/出院时间衍生特征 结局字段只作标签,严禁入模
4 EMR_SYMPTOMS 含出院前全病程症状 中高 严格按预测时点截断,入院后症状才可用
5 年龄计算用偏移后日期直接减(未意识到 50-100 年偏移) 患者内偏移量一致,DOB 与事件时间的差值仍为真实年龄,可安全计算

§5.4 交叉验证建议

  • 标准:5 折或 10 折按 SUBJECT_ID 分组交叉验证。
  • 亚群稳健性:以 ICU 单元为折叠轴做留一单元验证(train on 4 个 ICU → test on 剩余 1 个),检验跨单元泛化。
  • 年龄段稳健性:新生儿/婴儿/幼儿三层的分层报告应作为论文标配。

§5.5 外部验证

PIC 上训练的模型,可行的外部验证路径为:MIMIC-III / MIMIC-IV(跨人群成人侧验证,需 ICD-10CN ↔ ICD-9/10 经 UMLS 映射,BEDS-Bench 已建立协议;注意 subject_id 无法互链,只能队列级迁移)、eICU-CRD(成人多中心,仅适合方法学迁移研究)、本院新时间窗数据(若能与浙大儿院合作,2018 年后数据是真正的外部验证)。跨年龄(儿科 → 成人)迁移预期性能下降显著,BEDS-Bench 的 OOD 结果应作为心理基准。


§6 AI 就绪指南

§6.0 本地快速启动

体量友好是 PIC 最大的工程优势:全库 17 张表约 1,570 万行,最大表 LABEVENTS 仅 1,009 万行——16 GB 内存的笔记本即可用 pandas 全量处理,无需 BigQuery、无需分布式集群。官方未提供云端托管(与 MIMIC 不同),标准路径是"PhysioNet 下载 CSV → 本地建库或直接 pandas 读取"。

官方建库脚本二选一:MySQL(define.sql / index.sql / constraints.sql)或 PostgreSQL(1-create-tables-load-data-gzip.sql 或 csv.sql / 2-index.sql / 3-constraints.sql),schema 名 “pic”,随数据包发布。

# 5 分钟跑通首个队列统计(无需建库)
import pandas as pd

patients = pd.read_csv("PATIENTS.csv.gz")
icustays = pd.read_csv("ICUSTAYS.csv.gz")
print(f"患儿数: {patients['SUBJECT_ID'].nunique():,}")
print(f"ICU 入住数: {len(icustays):,}")
print(icustays.iloc[:, 0].head())

§6.1 快速上手(PostgreSQL 本地版)

-- ========================================
-- PIC 快速上手 — PostgreSQL 本地查询版
-- 环境要求:已按官方脚本完成建库(schema 名 pic)
-- 数据特性提醒:
--   1) ITEMID 为字符型(与 MIMIC 整数型不同,join 时注意类型)
--   2) 日期已偏移至 2060-2120;患者内偏移量一致,日期差仍是真实年龄
--   3) LABEVENTS 只有 HADM_ID,无 ICUSTAY_ID
-- 以下查询:首次 ICU 入住队列 + 入科 24h 内检验次数统计
-- ========================================

-- 步骤 1:首次 ICU 入住队列(含年龄计算——差值为真实年龄,无需封顶)
WITH first_icu AS (
  SELECT ie.subject_id, ie.hadm_id, ie.icustay_id,
         AGE(ie.intime, p.dob) AS true_age
  FROM icustays ie
  JOIN patients p ON ie.subject_id = p.subject_id
  WHERE ROW_NUMBER() OVER (PARTITION BY ie.subject_id
                           ORDER BY ie.intime) = 1
)
SELECT * FROM first_icu;

-- 步骤 2:入科 24h 窗口内检验(LABEVENTS 必须经时间窗二次过滤)
SELECT f.icustay_id, COUNT(*) AS lab_count_24h
FROM first_icu f
JOIN icustays ie ON ie.icustay_id = f.icustay_id
JOIN labevents l ON l.hadm_id = f.hadm_id
WHERE l.charttime BETWEEN ie.intime AND ie.intime + INTERVAL '24 hours'
GROUP BY f.icustay_id;

§6.2 数据获取流程

步骤 内容 周期
① 注册 PhysioNet 账号 https://physionet.org/ 即时
② 完成培训 CITI Program 人类受试者保护课程(含 HIPAA),或中国本地机构的 GCP 认证——PIC 对中国用户的差异化便利 1 天-1 周
③ 提交凭证化申请 PIC 项目页提交申请
④ 审核 约 3 个工作日,获批后邮件发送下载说明 ~3 个工作日
⑤ 签署 DUA 并下载 https://physionet.org/content/picdb/1.1.0/ 即时

DUA 核心义务:不得尝试重识别、不得分享给未签 DUA 者、安全存储、发表时按规范引用(三件套,见 §9)。伦理基础:浙大儿院 IRB 批准,豁免个体知情同意。

2025 年重大变化——DOJ 数据安全计划(DSP)地域限制:为遵守美国司法部依据行政令 14117 发布的数据安全计划(2025-04-08 生效、2025-07-08 全面执行),PhysioNet 已阻止来自中国(含香港、澳门)、古巴、伊朗、朝鲜、俄罗斯、委内瑞拉 IP 地址或机构归属的用户访问其受控数据集。这造成一个罕见局面:PIC 是浙大儿院的中国数据,托管在美国平台后,中国大陆研究者自 2025 年 7 月起可能无法直接申请下载。可行路径:由非受限国家/地区的合作者申请并签署 DUA(注意 DUA 禁止向受限方二次分发);或关注官方站 http://pic.nbscn.org/ 的境内申请入口(2026-09 实测主站不可达,恢复情况不明)。涉及受限数据出境与二次使用的合规问题,请务必咨询本机构法务与伦理委员会,并以 PhysioNet 最新公告为准。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(Python 版,读本地 CSV)</b></summary>

# 步骤 1:三级主键关联 + 首次 ICU 入住队列(保留全部年龄段——这是儿科库)
import pandas as pd

patients = pd.read_csv("PATIENTS.csv.gz", parse_dates=["DOB"])
admissions = pd.read_csv("ADMISSIONS.csv.gz")
icustays = pd.read_csv("ICUSTAYS.csv.gz", parse_dates=["INTIME", "OUTTIME"])

df = (icustays
      .merge(patients, on="SUBJECT_ID")
      .merge(admissions, on=["SUBJECT_ID", "HADM_ID"]))
# 患者内日期偏移量一致,差值 = 真实年龄(精确到天,儿科必须按月龄分层)
df["AGE_DAYS"] = (df["INTIME"] - df["DOB"]).dt.days
df["AGE_GROUP"] = pd.cut(df["AGE_DAYS"],
                         bins=[-1, 28, 365, 365*18],
                         labels=["neonate", "infant", "child"])
df = (df.sort_values("INTIME")
        .groupby("SUBJECT_ID").first().reset_index())  # 首次 ICU 入住

# 步骤 2:字符型 ITEMID 映射(坑点 2 防御——不要假设整数)
d_labitems = pd.read_csv("D_LABITEMS.csv.gz")
creat_ids = d_labitems.loc[d_labitems.iloc[:, 1].str.contains("肌酐|Creatinine",
                            case=False, na=False), "ITEMID"].tolist()
creat_ids = [str(i) for i in creat_ids]  # 显式字符串化

# 步骤 3:24h 窗口过滤检验(LABEVENTS 无 ICUSTAY_ID,必须时间窗过滤)
lab = pd.read_csv("LABEVENTS.csv.gz", parse_dates=["CHARTTIME"])
lab["ITEMID"] = lab["ITEMID"].astype(str)
lab = lab[lab["ITEMID"].isin(creat_ids)]
lab = lab.merge(df[["HADM_ID", "ICUSTAY_ID", "INTIME"]], on="HADM_ID")
lab = lab[(lab["CHARTTIME"] >= lab["INTIME"]) &
          (lab["CHARTTIME"] <= lab["INTIME"] + pd.Timedelta(hours=24))]

# 步骤 4:按 ICUSTAY_ID 聚合 + 年龄分层交互特征
feat = (lab.groupby("ICUSTAY_ID")["VALUENUM"]
           .agg(["mean", "min", "max", "count"]))
feat = feat.join(df.set_index("ICUSTAY_ID")[["AGE_GROUP", "AGE_DAYS"]])

# 步骤 5:EMR_SYMPTOMS 弱标签处理(坑点 4 防御——作为噪声标签使用)
sym = pd.read_csv("EMR_SYMPTOMS.csv.gz")
sym = sym.merge(df[["HADM_ID", "INTIME"]], on="HADM_ID")
# 仅保留入科后症状;症状缺失按"未提及"处理,不与"阴性"混淆
print(f"特征矩阵: {feat.shape}")

</details>

推荐直接参考社区已验证管道替代手写:Hong 2021 的 PIC_mortality(397 手工特征 + 集成逐步选择,github.com/hsd1503/PIC_mortality)、Zeng 2023 的 AKIPrediction(time-aware 时序特征,github.com/Healthink/AKIPrediction)、ehrapy 官方 PIC 教程(KNN 填补 k=20、log 归一化、winsorize、Leiden 聚类的完整演示)。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class PICDataset(Dataset):
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(PICDataset(X_train, y_train), batch_size=64, shuffle=True)
import xgboost as xgb  # XGBoost 基线:手工聚合特征 + 类别不平衡加权
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "auc",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),  # 死亡率 7.1%,约 1:13
          "max_depth": 5, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=400)

§6.5 常见坑点

⚠️ 坑点 1:住院数 13,449 vs 13,499——原始论文自身口径不一致(分类:数据理解)

问题:Zeng 2020 论文 Table 1 中 ADMISSIONS 为 13,449 行,但同一论文 Technical Validation 段落写"13,499 distinct hospital admissions"。下游文献随之分裂:ehrapy(Nature Methods 2024)沿用 13,499,Frontiers 系列论文沿用 13,449,BEDS-Bench 写 13,450。

症状:论文间的队列规模统计对不上;审稿人质疑样本量数字。ICU 入住数亦有笔误变体——MDPI Bioengineering 2025 综述两处方写"13,944 ICU stays",与原文 Table 1 的 13,941 不符。同源的口径漂移还有死亡率:原文正文写"in-hospital mortality was 7.1%",而 Table 2 合计行为 971(7.2%)——本百科随原文正文采用 7.1%。

解决:以实际数据表的行数(13,449 次住院 / 13,941 次 ICU 入住)为准,写作时注明原文两处口径不一致;引用他人数字前先核对其实际使用的表版本。本百科统一采用 13,449 / 13,941。

参考:Zeng 2020 原文 Table 1 与 Technical Validation 段落;ehrapy 论文(PMC11564094)。

⚠️ 坑点 2:ITEMID 是字符型,不是 MIMIC 的整数型(分类:工程陷阱)

问题:PIC 官方文档明确说明其 ITEMID 为字符型(string),而 MIMIC-III/IV 的 itemid 为整数。从 MIMIC 迁移代码时,所有 itemid IN (211, 220045) 式硬编码、整数比较与数值排序全部失效或静默错配。

症状:join 结果为空;WHERE itemid = 211 查不到任何行;pandas 读入后 dtype 混乱导致 merge 失败。

解决:读入即 astype(str) 统一类型;按 D_ITEMS / D_LABITEMS 的中英双语 LABEL 模糊匹配取 ITEMID 列表,绝不硬编码;跨库代码移植时把 ITEMID 类型检查列为第一步。

参考:PIC 官方文档(pic.nbscn.org 文档站,2026-09 实测主站不可达,以论文与数据字典为准)。

⚠️ 坑点 3:ICD-10CN 是 7 位本地扩展码,不是国际标准 ICD-10(分类:标签理解)

问题:PIC 诊断采用中国版 ICD-10 扩展编码(7 位,国际标准为 5 位),中文诊断术语比英文更精细;无标准码的术语由作者人工翻译。直接套用基于 ICD-9(MIMIC-III)或国际 ICD-10 的队列定义会错配。

症状:跨库复现时队列规模为 0 或明显偏少;同一疾病在 ICD-10CN 中被拆成多个 7 位细码,按 5 位前缀聚合才可见。

解决:跨库映射走 UMLS 一对多映射(BEDS-Bench 已验证路径:ICD-10CN → UMLS → ICD-9);库内队列定义优先用 D_ICD_DIAGNOSES 中文术语模糊匹配再人工核对;报告队列规模时注明编码口径。

参考:BEDS-Bench(arXiv:2107.08189);Zeng 2020 原文编码说明段落。

⚠️ 坑点 4:没有自由文本——EMR_SYMPTOMS 是 91.9% 准确率的弱标签(分类:标签理解)

问题:因中文自动脱敏工具不可用,PIC 未发布任何原始病历文本(MIMIC 的 NOTEEVENTS 在 PIC 中不存在)。EMR_SYMPTOMS 是 NLP 抽取的结构化症状(402,142 行),双人校验平均准确率 91.9%,且有三类已知系统性错误:长短语分词错误、阳性/阴性误判、家属症状误归到患儿。

症状:把症状标签当金标准训练,模型天花板被标签噪声锁死;“未提及"被误当"阴性”,引入系统性假阴性。

解决:症状标签按噪声标签/弱标签范式处理(置信学习、噪声鲁棒损失);阴阳性字段必须显式使用;重要结论用检验/用药等硬数据交叉验证。

参考:Zeng 2020 原文 EMR_SYMPTOMS 校验段落(91.3% / 92.4% 双人口径)。

⚠️ 坑点 5:CHARTEVENTS 只有 19 类护士手工记录,INPUTEVENTS 是日粒度(分类:预处理陷阱)

问题:PIC 没有床旁监护仪趋势数据——CHARTEVENTS(228 万行)仅含 19 类护士手工记录事件;INPUTEVENTS 为每日晨间汇总的液体入量(26,884 行,日粒度,非 MIMIC 的速率制)。全库唯一的高频时序是 SURGERY_VITAL_SIGNS(5 分钟),但只覆盖术中窗口。

症状:按 MIMIC 范式构建"入科 24h 逐小时生命体征矩阵"时发现大量时段无值;血管活性药剂量-时程曲线无法重建;液体平衡的小时级特征不可得。

解决:特征工程改为"窗口聚合统计"(24h 均值/最值/测量次数)而非逐小时序列;血流动力学精细研究改用 SURGERY_VITAL_SIGNS 限定术中亚组;不要试图从日粒度入量反推速率。

参考:BEDS-Bench Table 1(19 类事件、43 微生物项统计);Zeng 2020 原文数据描述。

⚠️ 坑点 6:日期偏移 50-100 年——伪年份 2060-2120,真实年份不可恢复(分类:评估误用)

问题:所有日期按患者随机偏移 50-100 年至未来(住院落在 2060-2120 区间),保留时刻、星期与季节,不保留真实年份。官方明示"may limit utilization in time-sensitive studies"。

症状:按"年份"分组统计得到伪年份;指南演进、季节多年趋势、流行病年份(如 2016-2018 流感季)分析不可行。

解决:只做相对时间分析(以 ICU 入科为 t=0);患者内偏移量一致,日期差值(年龄、LOS、时间间隔)完全可靠;需要真实年份维度的研究改用其他数据。

参考:Zeng 2020 原文脱敏段落;PhysioNet PIC 页面说明。

⚠️ 坑点 7:0-18 岁全年龄谱——生理参考区间随年龄剧变,统一过滤会误伤(分类:偏倚陷阱)

问题:PIC 平均年龄 2.5 岁,含新生儿(0-28 天,2,968 次入住)、婴儿(1-12 月,4,876 次)、幼儿及以上(13 月-18 岁,6,097 次)。新生儿心率正常值 120-160 次/分、血压 60-90 mmHg,与学龄儿童完全不同——全库统一的"生理合理范围"过滤必然误杀。

症状:新生儿数据被"离群值清洗"大量误删;年龄与特征强共线,模型学到伪信号;全库汇总的"正常值"对任何年龄段都是错的。

解决:按三层年龄段(新生儿/婴儿/幼儿及以上)分层建模与过滤,参考区间查儿科标准(如 PRISM III 的年龄分层阈值);年龄以天为单位精确计算(日期差值可靠,见坑点 6);报告性能必须分年龄子群。

参考:ehrapy 论文的年龄分组口径(2,968/4,876/6,097);PRISM III 评分标准。

⚠️ 坑点 8:468 名患儿多次住院 + 84 次住院无诊断编码(分类:数据泄漏)

问题:468 名患儿(3.6%)有多次住院,按 HADM_ID 随机划分会把同一患儿拆进训练与测试两侧。同时 DIAGNOSES_ICD(13,365 行)< ADMISSIONS(13,449 行),约 84 次住院无诊断编码——inner join 会静默丢失这部分样本。

症状:测试集 AUROC 虚高;队列规模比预期少约 0.6% 且丢失机制非随机。

解决:划分一律 GroupShuffleSplit(groups=SUBJECT_ID) 并断言患者零交集;诊断关联用 left join 并显式统计无编码住院的占比与特征;"首次 ICU 入住"队列定义需 PARTITION BY SUBJECT_ID 而非 HADM_ID。

参考:Zeng 2020 原文 Table 1(两表行数差);§5.3 泄漏防御表。

版本提示:2020 年 11 月前投稿的论文可能基于 v1.0.0(16 表,无 SURGERY_INFO、无主/次诊断区分);复现请以 v1.1.0 为准并注明版本,队列规模可能略有出入。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
添加服从儿科年龄分层生理约束的小幅噪声 对 ICD-10CN 诊断编码做任何"同义替换"式增强
随机删除 10-20% 床旁记录模拟录入缺失 对时间戳随机偏移(破坏患者内一致偏移结构)
特征空间 Mixup(同年龄亚组内) 跨年龄亚组 Mixup(新生儿与学龄儿童不可混合)
掩蔽时序自监督预训练(检验序列) 对 EMR_SYMPTOMS 症状标签做回译式增强(噪声叠加噪声)
类别不平衡用 scale_pos_weight / SMOTE(亚组内) 对患者级 ID 做任何变换

§6.7 模型推荐

任务 推荐 backbone 特征方案 预期性能(文献口径,队列不同不可直接比)
快速基线 Logistic Regression Hong 2021:397 手工特征 → 集成逐步筛选 11 个 AUROC 0.7531(11 特征)/ 0.7610(397 特征);PRISM III 基线 0.6895
死亡预测进阶 XGBoost / CatBoost 手工聚合 + 亚组分层 MDPI 2025 综述口径 0.789(59 特征 LR)至更高
心脏术后 AKI Time-aware attention LSTM Zeng 2023:术后 24h 时序 + 时间间隔编码 ROC AUC 0.908 / PR AUC 0.898,捕获 91% AKI 事件
呼吸系统亚组死亡 CatBoost + subset-SMOTE Prithula 2024:105 → 16 特征 AUROC 0.852(n=1,188)
新生儿风险分层 LSTM autoencoder NICU 专病(Sci Rep 2026,n>2,000 入住) AUROC 0.92 / 敏感度 88.1% / 特异度 89.5%
教学演示 逻辑回归 + §6.3 手工特征 24h 聚合统计 课堂上可复现 Hong 2021 数量级

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 20 GB(CSV 解压 + 建库) 50 GB(含索引与派生表)
内存 8 GB(分块处理 LABEVENTS) 16-32 GB(全量聚合)
GPU CPU 足够(LR/XGBoost/CatBoost 基线) 1 × 8 GB 显存(time-aware LSTM 量级)
训练时间 XGBoost 基线数分钟(CPU) Zeng 2023 级 LSTM 约 1-3 小时
云端替代 无官方 BigQuery 托管 Colab 免费档即可全流程

§6.9 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             brier_score_loss, confusion_matrix)

def evaluate_binary(y_true, y_prob, threshold=0.5):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")  # 死亡率 7.1%,不平衡数据必报
    print(f"Brier: {brier_score_loss(y_true, y_prob):.4f}")
    tn, fp, fn, tp = confusion_matrix(y_true, y_prob > threshold).ravel()
    print(f"Sensitivity: {tp/(tp+fn):.3f}  Specificity: {tn/(tn+fp):.3f}")

社区共识(MDPI 2025 综述的批评性总结):PIC 文献普遍存在三缺——仅 3/10 报告校准度、仅 2/10 公开代码、0/10 使用库外时间外验证。你的论文应同时报告 AUROC + AUPRC + Brier/校准曲线 + 分年龄子群指标 + 公开划分与代码,这本身就是超越 90% 现有文献的方法学贡献。

§6.10 MLOps 笔记

  • 版本锁定:论文方法部分必须注明 “PIC v1.1.0”(DOI: 10.13026/32x9-wv38)与访问日期;v1.0.0 与 v1.1.0 表结构不同(16 vs 17 表)。
  • 引用三件套:数据集论文(10.1038/s41597-020-0355-4)+ PhysioNet 数据集本体(10.13026/32x9-wv38)+ PhysioNet 平台(Goldberger 2000)——DUA 硬性要求,缺一不可(见 §9)。
  • 官方文档站状态pic.nbscn.org(含 chartsview 可视化与申请入口)2026-09-05 实测不可达;以 PhysioNet 页面与 Scientific Data 论文为唯一权威文档来源。
  • 字符型 ITEMID:任何自动化管道入口处加 astype(str) 断言,防止跨库代码静默错配(坑点 2)。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 浙大儿院单中心,中国东部三级儿科转诊中心,不代表基层医院与其他国家儿科 ICU 用 MIMIC/eICU 做跨库方法学验证;结论限定"三级转诊中心儿科"
转诊选择偏倚 承接浙江省 11 城市下级医院转诊,疑难重症富集(先天畸形 25.4%) 病因构成不能外推至普通儿科人群;报告时声明转诊中心属性
时代偏倚 2010-2018 年数据:中国儿科重症实践(镇痛镇静、通气策略、脓毒症集束化)期内持续演变 中高 真实年份已抹除无法分层;以 2026 年视角部署需当代再校准
记录方式偏倚 床旁数据为护士手工记录且仅 19 类,无监护仪趋势 特征工程用窗口聚合而非逐小时序列;勿与 MIMIC 密度直接对比
编码偏倚 ICD-10CN 为本地扩展码,反映病案/计费需求;LOINC 覆盖率仅 14.4%(118/822) 跨库经 UMLS 映射;检验项按双语 LABEL 核对
NLP 标签偏倚 EMR_SYMPTOMS 91.9% 准确率 + 三类系统性错误 按弱标签范式建模;硬结论用检验数据交叉验证
民族构成偏倚 人口过少民族已归并 “Other”,民族粒度公平性分析不可行 公平性分析改用性别/年龄段维度
年龄分布偏倚 婴幼儿主导(均值 2.5 岁),学龄儿童与青少年样本相对稀疏 三层年龄分层报告;青少年亚群注意置信区间

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
院内死亡 >99.9% 系统自动生成 不含院外死亡(无 DOD_SSN 式长期随访)
实验室检查值 检验科 LIS 定量 批间质控 参考区间需按年龄自查,库内无参考区间列
ICD-10CN 诊断编码 编码员分配,主/次诊断 v1.1 起区分 编码员间一致性未报告 病案/计费导向,共病覆盖不全
床旁观察值 护士手工录入 录入误差与整点偏好 仅 19 类事件,密度远低于 MIMIC
NLP 症状标签 91.9%(双人校验 91.3%/92.4%) 已知三类错误模式 弱标签;“未提及 ≠ 阴性”
术中生命体征 AIM 系统自动记录(5 分钟) 设备级一致性 仅覆盖术中窗口

§7.3 泛化性讨论

场景 失效风险 证据
跨机构(浙大儿院 → 中国其他儿科中心) 中高 转诊中心病因富集 + 单中心;中国儿科 ICU 间资源差异大
跨地域(中国 → 欧美儿科) 病因谱(先天畸形占比)、编码体系(ICD-10CN vs ICD-10)、治疗模式差异显著
跨年龄(儿科 → 成人 ICU) 病因谱与生理区间根本不同;BEDS-Bench 即以此为 OOD 场景
跨编码体系(ICD-10CN → ICD-9/国际 ICD-10) 中高 BEDS-Bench 验证需 UMLS 一对多映射,存在信息损失
跨时间(2010-2018 → 当代) 中高 中国儿科重症实践快速演变;Phoenix 标准(2024)本身即例证
跨亚群体(青少年/罕见民族) 婴幼儿主导;民族已归并 Other

§7.4 伦理考量

  1. 数据来自真实儿科 ICU 患儿——儿童是无法自主同意的脆弱人群,研究者应保持对患儿与家属的加倍尊重,成果传播避免任何可指向个体的表述。
  2. 浙大儿院 IRB 批准本数据库构建并豁免个体知情同意,前提是数据仅用于研究且已完成充分脱敏;DUA 禁止任何重识别尝试。
  3. 原始中文病历文本未发布(中文自动脱敏工具不可用),这是儿童隐私保护约束下的保守选择——不要试图从 EMR_SYMPTOMS 反推原文。
  4. 民族字段已做人口保护性归并(Other),不要在小亚群上单独建模,统计上不可靠且可能放大偏误。
  5. 日期偏移 50-100 年意味着数据使用时部分患儿可能已成年或去世;儿科数据的二次使用尤其需要审慎的目的限制。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=test_df["AGE_GROUP"]  # 新生儿/婴儿/幼儿三层——儿科公平性的第一维度
)
print(frame.by_group)

已知公平性差异:婴幼儿主导的年龄结构使青少年亚群样本稀疏、子群 AUROC 置信区间宽;性别(57.5% 男性)差异应作为常规分层报告;民族维度因保护性归并不可做细粒度分析。儿科模型的"公平性"首先是年龄公平性——一个在新生儿上训练的模型直接用于学龄儿童,本身就是公平性事故。

§7.6 数据漂移提示

  • 部署任何 PIC 训练模型前,必须认识到其训练分布停留在 2010-2018 年的中国单中心儿科实践:脓毒症定义本身已从 pSCC/SIRS 体系切换到 Phoenix(2024),这是"标签定义级"漂移的罕见实例。
  • 监控信号:检验分布 PSI > 0.1、ICD-10CN 编码流行率漂移、床旁记录频率变化。
  • 真实年份已被抹除,库内无法做时代分层——库外当代再校准是部署前不可省略的一步。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 17 张关系表均以唯一事件 ID 为行
2 有唯一标识符列 SUBJECT_ID / HADM_ID / ICUSTAY_ID 三级主键
3 无 Unicode 或特殊字符 ⚠️ 中英双语字典与中文值字段需 UTF-8 正确处理
4 无重复行 ⚠️ 未正式记录重复行审计情况
5 缺失值已识别并编码 ⚠️ 缺失普遍存在但未系统化编码(§4.5 为本百科整理)
6 标签列被明确标识 院内死亡标识为明确靶标;主/次诊断 v1.1 区分
7 已对罕见类别(<3%)进行分组 1,122 个在用 ICD-10CN 长尾未分组,需自行归类
8 偏倚评估已完成 §7.1 列出 8 类偏倚与缓解措施
9 有完整的数据字典 D_ITEMS / D_LABITEMS / D_ICD_DIAGNOSES 三字典(中英双语)
10 对"信息性缺失"有明确编码解释 ⚠️ 官方未正式讨论(§4.5 为本百科整理)
11 数据采集设备和设置已记录 §3.9 六大信息系统完整记录
12 已移除完全共线性变量 未执行,发布数据保留全部原始列
13 对编码的映射标准已说明 ⚠️ ICD-10CN 本地扩展、LOINC 仅 118/822、NCCD 本地药品码,跨库需 UMLS
14 对时间戳的处理已明确说明 ⚠️ 偏移策略完整记录,但真实年份维度永久丢失
15 训练/验证/测试划分建议已给出 官方无划分;社区亦无公认固定划分(综述:0/10 研究用时间外验证)
16 数据泄漏风险已被讨论 §5.3 五种 PIC 特有泄漏模式(本 Wiki)
17 标签分布已被分析 §4.2 主要任务阳性率
18 选择性测量偏倚已被讨论 §4.5 + §6.5 坑点
19 外部验证建议已给出 §5.5 MIMIC / eICU / 本院时间外验证路径
20 数据更新和版本信息已记录 v1.0.0 → v1.1.0 release notes 完整(含增量包)
21 最小必要预处理脚本已提供 官方 MySQL/PostgreSQL 建库脚本 + update_to_v1.1.0 示例 SQL
22 合规使用要求已明确 CITI 或中国 GCP 培训 + 凭证化申请 + DUA
23 多模态对齐方法已说明 ⚠️ 5 分钟术中 vs 日粒度入量 vs 无文本,跨模态时间对齐需自行处理
24 去标识化方法已被记录 HIPAA 标识符移除 + 50-100 年偏移 + ID 随机化 + 民族归并完整记录

DAIMS 评分:17.5 / 24

评分解读良好——工程规范与文档化扎实(MIMIC 兼容 schema、官方建库脚本、双语字典、完整脱敏记录),但因基准生态薄弱与发布策略取舍(无官方划分、无自由文本、本地编码体系)扣分。

对你意味着什么:PIC 的 14 个 ✅ 项集中在"拿来即用"的工程面——三级主键、官方双数据库建库脚本、中英双语三字典、完整的版本记录与脱敏文档,一个小型团队一周内即可完成从申请到建库的全流程。扣分集中在三块不可回避的短板:无官方划分(必须自制并公开你的划分,这是 PIC 论文的第一方法学义务)、编码国际化程度低(LOINC 14.4%、NCCD 本地码、ICD-10CN 7 位扩展,跨库研究先学 BEDS-Bench 的 UMLS 路径)、无自由文本与高频床旁时序(模态边界必须在选题阶段就接受)。与 MIMIC-III 的 18.5/24 相比,1 分差距不在工程质量,而在生态成熟度——PIC 等待的是它的"Harutyunyan 基准时刻",而那个基准可能就出自你的下一篇论文。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
Phoenix 多站点队列(美/哥伦比亚/孟加拉/肯尼亚等 9 站) SCCM Task Force(JAMA 2024) 儿童脓毒症标准开发 AUPRC 0.23-0.38,AUROC 0.71-0.92 站点间差异显著(高资源死亡率 7.1% vs 低资源 28.5%) PIC 作为中国站点进入国际标准开发队列——单中心中国儿科数据参与全球标准制定的首例
MIMIC-III(跨库 OOD) BEDS-Bench(arXiv:2107.08189) 死亡预测跨库迁移 OOD 性能显著下降 相对库内测试明显下降 ICD-10CN ↔ ICD-9 经 UMLS 一对多映射 + 成人↔儿科人群鸿沟是双重 OOD 来源
本院时间外验证(理论最优) 浙大儿院 2018 年后 真实年份抹除使库内无法做时代外验证;与本院合作获取 2018 年后数据是唯一真正的时间外验证
ehrapy 框架复现(工具链验证) Nature Methods 2024 肺炎患儿分层聚类 Leiden 聚类可分性 N/A PIC 作为 EHR 框架标准演示数据,工具链兼容性获独立验证

PIC 在 2026 年还值得用吗? 值得——儿科重症公开数据它没有竞争者。但要带着清醒认识使用:它是单中心、已冻结、模态有边界的 2010 年代数据。死亡/AKI/脓毒症预测、跨库 OOD 方法学、新生儿研究、教学演示:首选 PIC。成人 ICU、需要自由文本或高频床旁时序、需要真实年份维度:改用 MIMIC-IV 或其他成人库。


§8 基准性能与生态

§8.1 排行榜(代表性研究,队列口径不同不可直接比较)

PIC 没有官方排行榜。 这是它与 MIMIC-III 最大的生态差距,也是新研究者最大的机会窗口。以下为代表性研究的性能快照——各队列定义、亚组、时间窗均不同,数值仅供量级参考:

研究 任务/队列 模型 性能 关键对照 代码
Hong et al. 2021 (Health Data Science) 院内死亡 / 全库 LR + 集成逐步特征选择(397→11) AUROC 0.7531(11 特征)/ 0.7610(397 特征) PRISM III 基线 0.6895 https://github.com/hsd1503/PIC_mortality
Zeng et al. 2023 (JAMIA) 术后 AKI / 心脏手术亚组 n=3,386 Time-aware attention LSTM(术后 24h) ROC AUC 0.908 / PR AUC 0.898,捕获 91% AKI 168h→6h 提前量 0.862→0.902 https://github.com/Healthink/AKIPrediction
Prithula et al. 2024 (Respiratory Research) 死亡 / 呼吸系统亚组 n=1,188 CatBoost + subset-SMOTE(105→16 特征) AUROC 0.852 stacking 对照 0.606
Shen et al. 2025 7/14/28 天死亡 / AKI 亚组 n=3,624 CatBoost AUROC 0.871 / 0.871 / 0.867,Brier 0.052
Zhou et al. 2025 DIC / n=6,093(11.2%) XGBoost “Alfalfa-PICU-DIC” 高性能(详见原文)
Sci Rep 2026 风险分层 / NICU n>2,000 入住 LSTM autoencoder AUROC 0.92 / 敏感度 88.1% / 特异度 89.5%
Jia et al. 2025(反面教材) 死亡 / 肺炎亚组 n=543 训练 0.890 / 测试 0.698 过拟合典型,小样本警示

方法学警示(MDPI Bioengineering 2025 综述,10 项 PIC ML 研究系统评价):测试集 AUROC 分布 0.70-0.91;仅 3 项报告校准度、仅 2 项公开代码、无一项使用库外时间外验证。阅读任何 PIC 性能数字时先问三个问题:划分公开了吗?校准报告了吗?子群分层了吗?

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
快速出基线(CPU) Hong 2021 管道复现 + XGBoost 代码公开,1 小时内复现 AUROC 0.75 量级
做时序深度学习 Zeng 2023 AKIPrediction 架构 PIC 上验证过的 time-aware 设计,代码公开
发方法学论文 固定并公开你的 SUBJECT_ID 划分 + 报校准 + 年龄分层 直接超越 90% 现有文献的报告规范
做跨库/OOD 研究 BEDS-Bench 协议(MIMIC-III ↔ PIC) 已有标准化的映射与评测路径
教学演示 ehrapy 官方 PIC 教程 端到端 notebook,课堂可直接用

§8.3 官方评测协议

无官方协议。社区惯例:首次 ICU 入住队列;院内死亡二分类(AUROC + AUPRC);按 SUBJECT_ID 分组划分;年龄三层(新生儿/婴儿/幼儿及以上)分层报告。Phoenix 脓毒症队列研究遵循 JAMA 2024 标准定义(疑似感染 + Phoenix Sepsis Score ≥ 2)。

数据集 关系 说明
MIMIC-III 模板/对照 PIC schema 的蓝本;BEDS-Bench 跨库配对之一
MIMIC-IV 成人侧对照 成人新课题首选;与 PIC 无法患者级互链
eICU-CRD 成人多中心对照 仅适合方法学迁移研究
HiRID 高频时序对照 2 分钟采样——PIC 所无的模态
Phoenix 多站点队列 标准开发母体 PIC 为其中国站点(JAMA 2024)

§8.5 关键论文 Top 10

  1. Zeng X, Yu G, Lu Y, et al. (2020), Scientific Data 7:14. “PIC, a paediatric-specific intensive care database.” — 数据集本体,权威引用入口。DOI: 10.1038/s41597-020-0355-4。PMCID: PMC6957490。
  2. Sanchez-Pinto LN et al. (2024), JAMA 331(8):675-686. “Development and Validation of the Phoenix Criteria for Pediatric Sepsis and Septic Shock.” — Phoenix 标准开发与验证,PIC 为中国站点。DOI: 10.1001/jama.2024.0196。
  3. Schlapbach LJ et al. (2024), JAMA 331(8):665-674. “International Consensus Criteria for Pediatric Sepsis and Septic Shock.” — Phoenix 共识标准正文(SCCM 35 人 Task Force)。DOI: 10.1001/jama.2024.0179。
  4. Hong S, Hou X, Jing J, Ge W, Zhang L (2021), Health Data Science 2021:9365125. “Predicting Risk of Mortality in Pediatric ICU Based on Ensemble Step-Wise Feature Selection.” — PIC 死亡预测入门范式,代码公开。DOI: 10.34133/2021/9365125。
  5. Zeng X et al. (2023), JAMIA 30(1):94-102. “A time-aware attention model for prediction of acute kidney injury after pediatric cardiac surgery.” — PIC 深度学习最佳实践(AUROC 0.908),代码公开。DOI: 10.1093/jamia/ocac202。
  6. Heinz et al. (2024), Nature Methods. “ehrapy: An open-source framework for end-to-end analysis of electronic health record data.” — 以 PIC v1.1.0 做端到端演示的框架论文。PMCID: PMC11564094。
  7. BEDS-Bench (2021), arXiv:2107.08189. MIMIC-III ↔ PICDB 跨库 OOD 基准——跨编码体系迁移的评测协议奠基之作。
  8. MDPI Bioengineering 2025;13(9):978. “Machine Learning on the Pediatric Intensive Care (PIC) Database.” — 10 项 PIC ML 研究系统综述,方法学缺陷权威清单。DOI: 10.3390/bioengineering13090978。
  9. Prithula J et al. (2024), Respiratory Research. 呼吸系统亚组 CatBoost + subset-SMOTE 死亡预测(AUROC 0.852)。DOI: 10.1186/s12931-024-02753-x。
  10. 血镁 U 型关联研究(PMC8899661)与血磷 30 天死亡研究(BMJ Paediatrics Open, e003171) — PIC 临床流行病学用法代表:n=10,033,阈值 0.93 mmol/L;校正 OR 1.27。

§8.6 社区活跃度

维度 数据
Google Scholar / ResearchGate 引用(Zeng 2020 论文) 140+(截至 2026-09 快照)
公开代码的 PIC 研究 2 项(Hong 2021 / Zeng 2023,MDPI 2025 综述口径)
国际标准采用 Phoenix 儿童脓毒症标准(JAMA 2024)开发队列中国站点
框架集成 ehrapy(Nature Methods 2024)官方演示数据集
维护状态 v1.1.0(2020-11-12)后冻结;官方文档站 pic.nbscn.org 2026-09 实测不可达;2025-07 起受美国 DOJ DSP 地域访问限制(§6.2)

§8.7 生态快照

资源 类型 链接 为什么值得关注
hsd1503/PIC_mortality 复现代码 https://github.com/hsd1503/PIC_mortality Hong 2021 完整管道:397 特征工程 + 集成逐步选择——PIC 入门第一仓库
Healthink/AKIPrediction 复现代码 https://github.com/Healthink/AKIPrediction Zeng 2023 time-aware LSTM 官方实现,含校准(Platt/isotonic)
ehrapy 工具库 https://ehrapy.readthedocs.io/ Nature Methods 2024 框架,内置 PIC 演示数据集与教程
BEDS-Bench 基准 arXiv:2107.08189 MIMIC ↔ PIC 跨库 OOD 评测协议与 UMLS 映射路径
PhysioNet PIC 页面 官方 https://physionet.org/content/picdb/ 唯一权威下载与文档入口(原官方文档站 pic.nbscn.org 已不可达)

§9 相关资源与引用

官方资源

BibTeX 引用(三件套,DUA 硬性要求)

% 1) 数据集论文(期刊引用首选)
@article{zeng2020pic,
  title={PIC, a paediatric-specific intensive care database},
  author={Zeng, Xian and Yu, Gang and Lu, Yifan and Tan, Luzhu and Wu, Xiujing and Shi, Shanshan and Duan, Huilong and Shu, Qiang and Li, Haomin},
  journal={Scientific Data},
  volume={7},
  pages={14},
  year={2020},
  publisher={Nature Publishing Group},
  doi={10.1038/s41597-020-0355-4}
}

% 2) 数据集本体(PhysioNet 版本引用)
@article{PhysioNet-picdb-1.1.0,
  author={Li, Haomin and Zeng, Xian and Yu, Gang},
  title={{Paediatric Intensive Care database}},
  journal={{PhysioNet}},
  year={2020},
  note={Version 1.1.0},
  doi={10.13026/32x9-wv38}
}

% 3) PhysioNet 平台(官方要求同时引用)
@article{goldberger2000physionet,
  title={PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals},
  author={Goldberger, Ary L and Amaral, Luis AN and Glass, Leon and Hausdorff, Jeffrey M and Ivanov, Plamen Ch and Mark, Roger G and Mietus, Joseph E and Moody, George B and Peng, Chung-Kang and Stanley, H Eugene},
  journal={Circulation},
  volume={101},
  number={23},
  pages={e215--e220},
  year={2000}
}

许多论文漏引第 2、3 条——这违反 DUA。投稿前请逐项核对。

教程与学习资源

原始论文

  1. Zeng X, Yu G, Lu Y, Tan L, Wu X, Shi S, Duan H, Shu Q, Li H (2020). “PIC, a paediatric-specific intensive care database.” Scientific Data 7:14. DOI: 10.1038/s41597-020-0355-4. PMCID: PMC6957490.(收稿 2019-09-24,接收 2019-12-20,发表 2020-01-13)
  2. Li H, Zeng X, Yu G (2020). “Paediatric Intensive Care database (version 1.1.0).” PhysioNet. DOI: 10.13026/32x9-wv38.
  3. Goldberger AL et al. (2000). “PhysioBank, PhysioToolkit, and PhysioNet.” Circulation 101(23):e215-e220.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 10+ 组检索:原始论文事实、PhysioNet 页面、版本历史、引用数快照、Phoenix 标准溯源、发表生态、表行数交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 Zeng 2020 原始论文、PhysioNet 官方页面、Phoenix JAMA 双文、ehrapy/BEDS-Bench/MDPI 综述等公开资料中整理结构化信息;(2) 生成 §6 的 SQL/Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Zeng X et al. (2020), Scientific Data 7:14 — PIC 原始论文(DOI: 10.1038/s41597-020-0355-4,PMC6957490)
  2. PhysioNet PIC 页面与 v1.1.0 release notes(DOI: 10.13026/32x9-wv38)
  3. Sanchez-Pinto LN et al. (2024), JAMA 331(8):675-686 — Phoenix 标准开发验证(DOI: 10.1001/jama.2024.0196)
  4. Schlapbach LJ et al. (2024), JAMA 331(8):665-674 — Phoenix 共识标准(DOI: 10.1001/jama.2024.0179)
  5. Hong S et al. (2021), Health Data Science 2021:9365125(DOI: 10.34133/2021/9365125)
  6. Zeng X et al. (2023), JAMIA 30(1):94-102(DOI: 10.1093/jamia/ocac202)
  7. Heinz et al. (2024), Nature Methods — ehrapy 框架论文(PMC11564094)
  8. BEDS-Bench (2021), arXiv:2107.08189 — 跨库 OOD 基准
  9. MDPI Bioengineering 2025;13(9):978 — PIC ML 研究系统综述(DOI: 10.3390/bioengineering13090978)
  10. Prithula J et al. (2024), Respiratory Research(DOI: 10.1186/s12931-024-02753-x)
  11. 血镁/血磷临床研究(PMC8899661;BMJ Paediatrics Open e003171)
  12. Google Scholar 引用快照(截至 2026-09)
  13. hsd1503/PIC_mortality 与 Healthink/AKIPrediction GitHub 仓库

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-10CN 映射、人群统计、Phoenix 标准、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(17 表行数、版本矩阵) 千方病案医学编辑部 与 Zeng 2020 原文 Table 1 及 BEDS-Bench 交叉比对 ✅ 已验证
§4 数据结构(三级主键、字符型 ITEMID、DAIMS 字段字典) 千方病案医学编辑部 与原文及官方文档交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与原文及社区仓库比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 研究生态与引用数表述 千方病案医学编辑部 与原文及 Scholar 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集