PIC — 浙大儿院儿童重症监护数据库 AI-Ready Wikipedia

Paediatric Intensive Care database:12,881 患儿 × 13,941 ICU 住留 × 双语 16 表——MIMIC 方法从波士顿到杭州的出口

来源 https://physionet.org/content/picdb/1.1.0/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 27
PIC — 浙大儿院儿童重症监护数据库 AI-Ready Wikipedia

信息速览

数据集名称PIC — 浙大儿院儿童重症监护数据库 AI-Ready Wikipedia
数据类型12,881 患儿,13,941 ICU 住留,LABEVENTS 1,009 万行,英汉双语字典表,术中 5 分钟生命体征
规模12,881 患者 / 13,449 住院 / 13,941 ICU 住留(2010-2018)
接入方式https://physionet.org/content/picdb/1.1.0/
AI 就绪度

Paediatric Intensive Care database — AI-Ready 数据集百科

一句话:这是 MIMIC 方法论第一次成建制走出波士顿的成果——浙江大学医学院附属儿童医院把 2010-2018 年五个 ICU、12,881 名危重患儿、约 1,900 万行临床记录,按 MIMIC-III 的表结构做成了首个免费开放的英汉双语临床数据库。它证明了一件事:重症数据开放这件事不分国界、不分语种、不分成人还是儿童。

INFOBOX

属性 值
官方名称 Paediatric Intensive Care database(PIC)
发布方 PhysioNet(与 ZUCH 团队联合)
版本 v1.0.0(2019-11-26)→ v1.1.0(2020-11-12,当前)
DOI 10.13026/32x9-wv38
RRID SCR_007345
官方论文 Zeng, Yu, Lu et al., Scientific Data 7:14 (2020), DOI 10.1038/s41597-020-0355-4
数据来源 浙江大学医学院附属儿童医院(ZUCH,杭州)——1900+ 床、年门急诊 300 万+
ICU 构成 GICU / PICU / SICU / CICU / NICU 共 119 张重症床
数据期 2010-2018
规模 12,881 患者 / 13,449 住院 / 13,941 ICU 住留
核心表 CHARTEVENTS 228 万行;LABEVENTS 1,009 万行;PRESCRIPTIONS 126 万行
特色表 SURGERY_VITAL_SIGNS(术中每 5 分钟);EMR_SYMPTOMS(NLP 症状 +/−)
双语工程 首个免费英汉双语临床数据库;字典表 + _cn 后缀;ICD-10 7 位本地扩展
年龄 0-18 岁(中位 0.8 岁;NICU 以天计)
死亡率 院内 7.1%(971 例);ICU 内 6.9%(955 例)
访问级别 Credentialed(培训/GCP + DUA;审批约 3 个工作日)
文档站 pic.nbscn.org(截至 2025-05 引用超 100 篇)
适合任务 儿科 ML(死亡/脓毒症/器官功能障碍)、双语 NLP、跨国方法学对照

§0 E-E-A-T 信任声明与速览

条目名勘误(重要):本条目在生产排期表中的中文名被写成"英国儿科重症监护数据库 (PICU)"——这是错的。官方 Paediatric Intensive Care database 来自中国的浙江大学医学院附属儿童医院(Children’s Hospital, Zhejiang University School of Medicine),而非英国。英国的 PICU 数据生态(如 PICANet 审计网络)是另一套体系,且非 PhysioNet 开放数据。本条目一律以官方名称与事实为准,勘误记录见存照 A。

信任声明:本条目所有数字经两处一手来源交叉核查——PhysioNet 官方条目页(v1.1.0)与 Zeng et al. Scientific Data 2020 论文(PMID 31932583)。论文正文与表格间的口径差异(住院数 13,499 vs 13,449)不做掩盖,如实存照。二手引用(2026 年 MDPI 综述)单独标注,不与一手数字混排。

0.1 一分钟版本

  • 这是什么:全球首个免费开放的英汉双语临床数据库;MIMIC-III 结构的儿科专属移植;
  • 多大:12,881 患儿、13,941 次 ICU 住留、LABEVENTS 一千零九万行、16 张关系表(v1.1.0 再增手术信息表);
  • 哪来的:浙江大学医学院附属儿童医院五个 ICU(综合/儿科/外科/心脏/新生儿),2010-2018;
  • 在哪拿:PhysioNet(DOI 10.13026/32x9-wv38),Credentialed 访问,审批约 3 个工作日;
  • 最独特的三件事:双语字典工程、术中 5 分钟生命体征独立表、NLP 症状表(91.9% 准确率且方法学公开);
  • 最大的坑:日期被平移 50-100 年(住院发生在"2060-2120 年");ITEMID 是字符不是整数。

0.2 十个数字记住它

# 数字 含义
1 12,881 去重患儿数
2 13,941 ICU 住留次数
3 0.8 岁 年龄中位数(成人库 MIMIC-III 是 60.6 岁)
4 10,094,117 LABEVENTS 行数(最大表)
5 2,278,978 CHARTEVENTS 行数
6 5 分钟 术中生命体征采样间隔(SURGERY_VITAL_SIGNS)
7 7.1% 院内死亡率(971 例)
8 91.9% NLP 症状抽取准确率(3,410 症状双人核对)
9 50-100 年 日期向未来平移的年数
10 3 个工作日 访问审批周期

0.3 与同门条目的关系图谱

  • mimiciv(rid 592)/ MIMIC-III(491):PIC 的 schema 师承 MIMIC-III(官方原话:“follows the structure of MIMIC-III”)。PATIENTS/ADMISSIONS/ICUSTAYS 三表骨架、CHARTEVENTS/LABEVENTS 命名一一对应——会查 MIMIC-III 的人几乎零成本上手 PIC;
  • phenotype-annotations-mimic(rid 594):临床文本标签的两种路线对照。494 是人工双人金标准标注;PIC 是 NLP 自动症状抽取(91.9% 准确率、错误类型公开)——两份数据集合起来是"标注经济学"的完整教材;
  • nosocomial-risk-mimic(rid 593):同为 MIMIC-III 派生的下游工程,那边做标签工厂,这边做全库双语化——MIMIC 生态的三种"衍生姿势";
  • MIMIC-III 的 NICU 新生儿子集是 PIC 最接近的对照区——但 PIC 是全库儿科(0-18),且新生儿占比与病种谱完全不同。

0.4 里程碑定位:中国开放重症数据的先声

PIC 于 2019-11-26 上线 PhysioNet(v1.0.0),是中国大型三甲医院第一次把整库 ICU 数据按国际开放标准发布。它之后,中国中心的 PhysioNet 数据集陆续出现(如 2022 年自贡四院感染重症库、2023 年某三级医疗中心 Chinese critical care database 等)——PIC 是这条路上的先行者。截至 2025 年 5 月,官方文档站显示引用已超 100 篇。2026 年 MDPI Bioengineering 的叙事综述把它称为"儿科 ICU 机器学习研究的事实基底(de facto substrate)"。

0.5 证据等级声明

规模与表行数:论文 Table 1/2 一手口径;年龄/死亡率/性别:论文 Table 2/3 与正文;访问流程与双语工程:PhysioNet 页面与论文 Methods 互核;二手综述结论明确标注"MDPI 2026 综述";凡官方未给数字处(如表级完整度之外的缺失机制细节)注明缺口,不做估算。

0.6 谁该用、谁不该用

该用:做儿科 ML 的人(死亡预测、脓毒症、器官功能障碍——现有 10 项研究已趟过路);做双语/跨语言临床 NLP 的人(唯一的英汉双语 ICU 语料);做方法学迁移研究的人(成人模型→儿科校准的天然试验田);医工交叉课程(MIMIC 结构教学的最佳第二例)。

不该用:想要高频床旁监护波形的人(术中之外没有逐分钟数据——用 vitaldb 或 HiRID);想要英文自由文本的人(中文原文未发布,只有症状结构表);想做成人-儿童直接迁移而不管校准的人(请先读 §7.6 的失败方向);只认 ICD-9 的老管线(这里是 ICD-10 + ICD-O-3)。

§1 数据集概览

1.1 出身:一次跨洋的 schema 移植

PIC 的立项逻辑写在论文 Background 里,三段论非常清晰:其一,MIMIC 系列十余年证明了开放重症数据的价值;其二,eICU 补上了多中心成人数据,但所有这些库都缺 0-18 岁的完整儿科数据——MIMIC-III 只有 NICU 新生儿,因为 BIDMC 根本没有儿科 ICU;其三,“儿童不是缩小版成人”(Children are not just small adults)——疾病谱、发育阶段、药代动力学、治疗反应全部不同,成人证据不能直接搬用,儿科证据需要儿科数据。于是 ZUCH 团队(临床信息学团队 + 国家儿童健康与疾病临床研究中心)按 MIMIC-III 的表结构重造了整个提取管线。

1.2 数据来源医院:为什么是浙大儿院

ZUCH 的三个硬指标解释了为什么它能做成这件事:规模——1900+ 床、年门急诊超 300 万人次、浙江省最大综合性儿科中心;网络——接收全省 11 个地市转诊的危重患儿,病例谱覆盖完整;设施——5 个 ICU 共 119 张重症床(GICU 综合/PICU 儿科/SICU 外科/CICU 心脏/NICU 新生儿),且院级信息系统已运行十年以上,数据连续性有保障。它同时是中国国家儿童健康与疾病临床研究中心——"临床研究中心"的制度身份让数据治理与 IRB 流程有落点。

1.3 六大信息系统的数据汇聚

官方 Methods 列出了数据提取的六个来源系统:医院电子病历(EMR)、实验室信息系统(LIS)、计算机化医嘱录入(CPOE)、护理信息系统、麻醉信息管理系统(AIMS)、各检查科室报告系统(放射/超声/心电图/病理等)。这个清单就是 PIC 的数据血缘地图——SURGERY_VITAL_SIGNS 表的 5 分钟高频数据正是来自 AIMS,这是 PIC 相对 MIMIC-III 的一个反向优势(MIMIC-III 的床旁监护是约 1 小时粒度)。

1.4 时间覆盖与规模叙事

2010-2018 约九年的窗口,产出 12,881 患儿 / 13,449 住院 / 13,941 ICU 住留。与 MIMIC-III(约 5 万患者/4.5 万+ 住院)比,规模差约 4 倍——论文自述局限第一条就是这个。但注意结构差异:PIC 的 13,941 次 ICU 住里 NICU 占比可观(新生儿),而多次住院患者只有 468 人(3.6%)——这是一个"一次住院为主"的人群,与成人 ICU 的再入院模式不同,建模时的患者级聚类修正压力更小。

1.5 五个 ICU 的画像

论文 Table 2/3 给出的分单元画像(平均年龄/院内死亡率):

单元 平均年龄 院内死亡率 特色
GICU 综合ICU 3.8 岁(0.4-6.3) 15.3% 全院最高死亡率的综合兜底单元
PICU 儿科ICU 3.6 岁(0.5-5.7) 9.8% 儿科专属重症
SICU 外科ICU 3.2 岁(0.4-4.9) 2.0% 围术期为主
CICU 心脏ICU 2.5 岁(0.5-3.1) 2.0% 先心病围术期
NICU 新生儿ICU 14.5 天 7.5% 以"天"计龄的特殊单元

两个直接推论:其一,GICU 15.3% vs SICU 2.0% 的 7 倍差提示单元分层是任何死亡模型的必做项;其二,NICU 的"年龄 14.5 天"宣告了儿科数据的独特时间语义——在 MIMIC-III 里 anchor_age=91 是老人归并,在 PIC 里年龄字段要有小数甚至天数,标准成人管线的年龄特征工程必须重写。

1.6 病种谱:先天性疾病是第一主角

诊断编码的 ICD-10 章节分布前三:Q00-Q99 先天畸形/变形/染色体异常 25.4%;P00-P96 围产期特有情况 14.1%;J00-J99 呼吸系统疾病 10.3%。这个谱与成人 ICU(循环/呼吸/感染为主)几乎不重叠。对 ML 建模的含义:诊断编码在儿科数据里是强特征(先天畸形的结构性强信号),而成人库里 ICD 常常只是"弱标签"。CICU 2.0% 的低死亡率背后是先心病手术的成熟,而 GICU 的高死亡率对应的是兜底收治的复杂病例——病种谱直接写在了单元画像里。

1.7 双语:为什么这是里程碑而非便利贴

官方强调 PIC 是首个免费开放的英汉双语临床数据库。理解它的分量需要知道背景:中文临床术语没有像 LOINC/ICD 那样与国际对齐的通用翻译层,国际研究者用不了中文库。PIC 的解法(§3.4 详述)是分层翻译策略:有国际标准编码的术语(ICD-10、LOINC)按标准英文版对齐;没有的由三位作者人工翻译并复核;所有表保留中文原文 + 英文对应,中文列加 _cn 后缀。原文永远在场——这是双语工程区别于"翻译覆盖"的关键设计,也保留了研究中文临床语言学的原始材料。

1.8 版本简史

  • v1.0.0(2019-11-26):首发 16 表;
  • v1.1.0(2020-11-12):基于用户反馈的升级——DIAGNOSES_ICD 增加主要诊断 vs 其他诊断的区分;SURGERY_VITAL_SIGNS 增加 SpO2、EtCO2、ECG ST 段;新增 SURGERY_INFO 表(手术名称/时间/麻醉方式);字典表更新;
  • 发布物包含 v1.1.0 全量文件夹 + update_to_v1.1.0 增量文件夹(含迁移 SQL 示例)——老用户不用重下全库。

注意一个口径细节:论文 Table 1 的 16 表清单是 v1.0 口径(不含 SURGERY_INFO),v1.1.0 之后实际表数 +1(存照 C)。

1.9 团队与资助

论文作者 9 人:共同一作 Zeng X / Yu G / Lu Y(临床信息学 + 生物医学工程),通讯作者 Shu Q(Qiang Shu,临床)与 Li H(Haomin Li,信息学,PhysioNet 页面第一署名)。资助三项:国家自然科学基金 81871456;国家科技支撑计划 2016YFC0901905 与 2016YFC0901703;浙江省高层次创新型卫生人才培养工程 2016-6。COI:无。论文图代码开源在 github.com/Healthink/PIC。特别致谢 MIMIC 项目团队——“本项目许多协议基于其制定”。

1.10 用户画像:四类人各取所需

  • 儿科 ML 研究者:直接上手死亡/脓毒症/器官功能障碍建模,10 项已发表研究提供了标签构造与特征工程的参照系(§6.5);
  • 双语 NLP 研究者:EMR_SYMPTOMS 表 + 双语字典是研究中文临床术语对齐的唯一开放资源;
  • 成人 ICU 研究者:把 PIC 当"分布外测试集",检验成人模型的儿科泛化(先读 §7.6 的校准警告);
  • 数据工程教学者:MIMIC-III schema 的第二实现是最好的"同构异源"教学案例——表结构相同、语义全变(年龄、ITEMID 类型、日期偏移)。

§1.11 名词速查表:十秒扫懂本章术语

术语 一句话解释
PIC Paediatric Intensive Care database,本条目主体
ZUCH 浙江大学医学院附属儿童医院,数据来源单中心
GICU/PICU/SICU/CICU/NICU 综合/儿科/外科/心脏/新生儿五个 ICU
AIMS 麻醉信息管理系统——术中 5 分钟体征的来源系统
ITEMID 项目标识符;PIC 中为字符型(MIMIC 为整数)
_cn 后缀 中文数据列的命名约定(保留中文原文的双语设计)
ICD-10 7 位扩展 本地诊断编码比标准 5 位更细,中文诊断更具体
ICD-O-3 肿瘤形态学编码,与 ICD-10 并行使用
EMR_SYMPTOMS NLP 抽取的症状表(+/− 极性 + 时间)
SURGERY_VITAL_SIGNS 术中每 5 分钟生命体征表(v1.1.0 增 SpO2/EtCO2/ST)
日期平移 50-100 年 去标识化设计:住院时间显示为 2060-2120 年
GCP 认证 中国《药物临床试验质量管理规范》培训——访问认证的双轨之一
DUA 数据使用协议:禁再识别 + 协作研究原则
phoenix / pSOFA 儿科脓毒症/器官功能障碍评分体系(勿用成人 Sepsis-3)
z 分数化 检验值按年龄分段参考范围标准化——儿科特征工程核心动作

§2 医学与科学背景

2.1 "儿童不是缩小版成人"的数据含义

论文引用 Czaja 2016(“Children Are Not Just Little Adults”)作为方法学宣言。这句话落到数据上有四层含义:生理参数不同——生命体征正常范围随年龄漂移(新生儿心率 100-180 vs 学龄儿童 60-100),报警阈值与异常检测不能复用成人规则;药代动力学不同——剂量按体重/体表面积计算,PRESCRIPTIONS 表里的剂量字段必须结合体重/年龄解读;疾病谱不同——先天性疾病 25.4% 当主角,成人库的第一主角(冠心病)在儿科几乎退场;发育时间性——年龄不是协变量而是"发育阶段的代理变量",且以月/天为单位变化。

2.2 NICU 的时间语义:以天计龄

NICU 患儿平均年龄 14.5 天——这个数字意味着 PIC 的年龄字段在 NICU 段的有效粒度是"天"甚至"周(孕周)"。三条工程纪律:任何"年龄 ≥ x 岁"的过滤规则在 NICU 段会漏掉整群患儿;孕周/出生体重相关的围产期特征(P 章 ICD)在 NICU 分析里权重最高;生长曲线(百分位)是儿科特有的纵向特征类型——身高体重不是静态协变量而是发育轨迹。

2.3 围术期数据流:AIMS 的 5 分钟世界

SURGERY_VITAL_SIGNS 表(121.6 万行)来自麻醉信息系统,术中每 5 分钟一测,v1.1.0 又加入 SpO2 与 EtCO2 和 ST 段。这是 PIC 里唯一的高频生理流,三个用法:围术期低血压/缺氧事件的预测与回放(MDPI 综述里已有研究做围术期并发症);把术中队列(SICU/CICU)与非术中队列的生理基线对齐;作为"高频对照"评估 CHARTEVENTS 里护士记录的稀疏性。注意它的完整度只有 47.7%(Table 4)——只有手术患者的手术时段才有,别当全库背景流用。

2.4 液体平衡:儿科剂量学的命门

INPUTEVENTS(26,884 行,每日晨计算入量)与 OUTPUTEVENTS(39,891 行,出量)加起来不足 7 万行,完整度 41.1%/11.7%——但别因行数小而忽视:液体管理是儿科重症的核心命题(儿童液体耐受窗窄,脱水与过载都是生死线)。官方论文把 fluid balance 写进摘要清单,说明这是设计内特性而非残留。使用时的纪律:低完整度 + 非随机缺失(外科患者更可能记录)= 缺失机制分析必须先行。

2.5 微生物学与抗菌药物:感控研究面

MICROBIOLOGYEVENTS(183,869 行,完整度 89.7%)含培养与药敏。儿科感控研究的富矿:新生儿败血症的病原谱、ICU 耐药谱的时间演化、抗菌药物(PRESCRIPTIONS 126 万行)与药敏的匹配分析。注意中文药名的翻译层——抗菌药物的中英文对照在字典表里,跨语言合并药物类别时以 ATC 分类的思路自建映射更稳。

2.6 死亡数据的口径

PIC 只有院内死亡记录(hospital mortality 7.1%),没有 MIMIC-III 那样的社保死亡链接(MIMIC 可做出院后长期生存)。三条纪律:论文间比较"死亡率"时先分清院内 vs ICU 内 vs 全因;出院后生存分析在 PIC 上不可做;死亡是"出院状态"字段的一部分,与出院类型(自行离院/转院)编码在同一张表,建模时注意互斥性检查。

2.7 ICD-10 + ICD-O-3 的编码体系

PIC 用 ICD-10(诊断)+ ICD-O-3(肿瘤形态学),不是 MIMIC-III 的 ICD-9。三层含义:跨库映射需要 9→10 的转换表(有现成工具但儿科章节映射有坑——P 章与 Q 章在 ICD-9 里结构不同);本地 7 位扩展(§3.4)让"中文诊断更具体"——做表型提取时中文列的信息量更大;ICD-O-3 的存在提示肿瘤病例可用形态学轴做更细的队列划分。

2.8 与成人库的年龄对照:一张图两个世界

论文 Fig. 2 是 PIC 与 MIMIC-III 的年龄分布对比:MIMIC-III 中位 60.6 岁(Q1-Q3 42.1-74.1),PIC 中位 0.8 岁(Q1-Q3 0.1-3.5)。两个分布几乎不重叠——这就是"证据不能直接互搬"的统计注脚。方法学上这张图也是绝佳的教学素材:同样的 ICU 数据概念,年龄这一个变量就能让跨库迁移变成分布外问题。

2.9 儿科质量改进与国际共享的立项初衷

官方摘要列了四类支持用途:机器学习算法、临床决策支持工具、质量改进、国际数据共享。第三类(质量改进)在中国语境里最稀缺——单中心库的最大价值恰恰是院内纵向对照:同一个 ICU 十年间的死亡率/住院日/用药模式漂移(MDPI 综述称其为 single-center temporal drift,把它当风险,其实也是质量改进的天然实验设计)。第四类(国际共享)则由双语工程承载。

2.10 概念小结:PIC 的五张面孔

  1. MIMIC 的儿科镜像:结构同源、语义异构;
  2. 双语数据库:翻译工程的教科书;
  3. 围术期高频库:AIMS 5 分钟流是其独有的时间维度;
  4. NLP 症状库:中文临床文本的结构化出口(91.9% 准确率的诚实基准);
  5. 单中心九年纵向库:质量改进与时间漂移研究的天然设计。

§2.11 本条目的证据层级

本条目信息的分级与使用建议:

层级 来源 用于
L1 一手-官方页面 PhysioNet v1.1.0 条目页(DOI/版本/访问/双语方案/去标识) 引用、合规决策
L1 一手-论文 Zeng et al. Sci Data 2020(Table 1-4 全部数字、NLP 审计、Methods) 规模引用、方法学
L1 一手-文档站 pic.nbscn.org(引用统计、临床资源介绍) 生态状态描述
L2 二手-综述 MDPI Bioengineering 2026(10 项研究综合、基质特性) 趋势讨论(标注二手)
L3 推断 本条目的工程建议、成本核算、课程设计 操作参考(标注为本条目立场)

冲突裁决规则:L1 内部冲突如实存照(住院数 13,449/13,499、表名两写法、死亡率四舍五入);L2 与 L1 冲突时从 L1(如 13,944 vs 13,941);L3 不与 L1/L2 混排。

§3 数据集规格

3.1 16 表全家福(v1.0 口径)与行数总账

论文 Table 1 的完整行数(这是全库的身家清单,直接背下来):

表 行数 语义 完整度
PATIENTS 12,881 患者主档 —
ADMISSIONS 13,449 住院主档 —
ICUSTAYS 13,941 ICU 住留 —
CHARTEVENTS 2,278,978 生命体征/护理观察 79.7%
LABEVENTS 10,094,117 检验结果 93.9%
PRESCRIPTIONS 1,256,591 医嘱用药 51.5%
SURGERY_VITAL_SIGNS 1,216,011 术中每 5 分钟生命体征 47.7%
EMR_SYMPTOMS 402,142 NLP 症状(+/−) 6.7%
MICROBIOLOGYEVENTS 183,869 微生物培养与药敏 89.7%
OR_EXAM_REPORTS 183,809 检查报告事件 91.9%
OUTPUTEVENTS 39,891 出量 11.7%
INPUTEVENTS 26,884 每日晨计算入量 41.1%
DIAGNOSES_ICD 13,365 ICD-10/ICD-O-3 诊断 99.4%
D_ICD_DIAGNOSES 25,378 诊断字典 —
D_LABITEMS 832 化验项目字典 —
D_ITEMS 466 项目字典 —

合计约 1,870 万行。v1.1.0 再加 SURGERY_INFO(手术名称/时间/麻醉方式)。三条速读:LABEVENTS 一表独大(占一半以上行数)——儿科的检验密度远高于体征记录密度;DIAGNOSES_ICD 完整度 99.4% 是全库最可靠的强特征源;EMR_SYMPTOMS 完整度 6.7% 最低——它只覆盖有病程记录的子集,千万别当全库背景表。

3.2 三表骨架与 MIMIC-III 的同构性

PATIENTS / ADMISSIONS / ICUSTAYS 三表均含 SUBJECT_ID、HADM_ID、ICUSTAY_ID,与 MIMIC-III 的三键体系完全同构。数据整合与清洗也按同一套逻辑:官方 Methods 明确"使用 SUBJECT_ID 和 HADM_ID(出现在 ADMISSIONS、PATIENTS、ICUSTAYS 表中)进行数据整合与过滤",并清理了"就诊年份为 1900"这类不可能值与中文字符显示为数字的错误。对 MIMIC-III 老手的心智迁移成本接近零——这正是 PIC 立项时明确的设计目标(官方:“allowing researchers to leverage their experience with MIMIC-III”)。

3.3 DAIMS 数据AI就绪度评估

按本系列 DAIMS 八维度打分(每项 0-1,总 8):

维度 得分 评语
文档完备性 0.9 PhysioNet 页面 + Sci Data 论文 + pic.nbscn.org 文档站三层文档;扣分项:文档站部分内容偏旧
机器可读性 0.8 标准关系 schema + SQL 装载脚本(MySQL/PostgreSQL 双方言);ITEMID 字符类型需适配
标签质量透明度 0.8 NLP 症状表给了双人核对的准确率区间与错误分类;日期偏移规则透明
可访问性 0.9 Credentialed 但流程轻(3 个工作日)、支持 GCP 认证(对中国研究者友好)
许可清晰度 0.8 DUA 明确禁再识别;具体许可证名称页面未列明
格式标准化 0.8 CSV + 标准 SQL;双语双列方案是对标准化的补充而非破坏
评测协议完备性 0.6 无官方基准任务与划分;社区 10 项研究提供了事实参照
生态可持续性 0.8 永久 DOI + RRID + 文档站;更新止于 v1.1.0(2020-11),活跃度下降
合计 6.4 / 8 结构与文档的"移民红利"型选手——师承 MIMIC 让它开箱即用;短板在评测协议与更新停滞

对照同批:mimiciv 492 约 7.2、nosocomial 493 7.8、phenotype-annotations 494 6.5。PIC 的 6.4 里含"翻译工程"的隐性加分——若按纯技术维度它可能更低,但双语创新值得单列。

3.4 双语工程的完整解剖

官方双语方案的四层结构:

  1. 有国际编码的术语走标准:ICD-10 诊断的英文直接用标准编码英文版;化验项目有 LOINC 码的用 LOINC 英文版——这类翻译零人工、零争议;
  2. 无编码术语人工翻译:由三位作者(X.Z.、Y.L.、H.L.)翻译并相互复核——覆盖率与术语表规模官方未给出,但从 D_LABITEMS(832 项)/ D_ITEMS(466 项)的字典规模看,人工翻译的量级是可控的;
  3. 原文保留原则:所有表保留原始中文术语 + 英文对应——中文列统一加 _cn 后缀。这条"原文在场"原则让翻译层可审计、可替换(未来若有更好的翻译可以重做而不破坏原始数据);
  4. 编码粒度的不对称:本地 ICD-10 是 7 位扩展(标准 5 位),中文诊断比英文诊断更具体——例如 7 位码可携带更细的解剖部位/形态学信息。这对表型定义是增益(中文列信息量大),对跨语言对齐是挑战(英文侧丢失精度)。

工程提醒:ITEMID 是字符字段(MIMIC-III 是整数)——从 MIMIC 迁移过来的脚本里所有 ITEMID 的类型断言、JOIN 条件、索引定义都要改。

3.5 访问流程:全球研究者的最低门槛设计

PIC 的访问设计有三处体贴:认证双轨——完成国际通行的人体受试者培训(含 HIPAA)或中国的 GCP 认证(Good Clinical Practice)——后者让中国临床研究者不用先去考 CITI;审批快速——官方明示约 3 个工作日;MIMIC 老手无缝——“已获准访问 MIMIC-III 的研究者对此流程熟悉”。DUA 的两条硬约束:禁止任何再识别尝试;遵循"协作研究原则"(collaborative research)——后者为跨国合作提供了正当性框架,也是许多中国数据集 DUA 的特色条款。

3.6 装载手册(MySQL 与 PostgreSQL 双方言)

官方提供两种数据库的完整装载脚本:

# PostgreSQL(推荐路径,免解压)
# 1. 下载全部 gzip CSV + SQL 脚本
# 2. 创建 schema 并设搜索路径
psql -c "CREATE SCHEMA pic; SET search_path TO pic;"
# 3. 建表并直读 gzip 装载
psql -f 1-create-tables-load-data-gzip.sql
# 4. 索引与约束
psql -f 2-index.sql
psql -f 3-constraints.sql

MySQL 路径:解压(gzip/7zip)→ 建 schema “pic” → define.sql(建表+装载)→ index.sql + constraints.sql。装载后第一小时:跑行数对账(对照 §3.1 的 Table)、检查日期字段的"未来年份"分布(§3.7)、抽样验证双语列的完整性。

3.7 去标识化的三条规则(每条都是工程参数)

  1. 日期平移 50-100 年:所有日期向未来平移随机患者特异性偏移,住院时间落在约 2060-2120 年。同患者同一常量 → 患者内时序、住院间隔、治疗时间线全部保留;跨患者时序不可比(两条线无法对齐到同一"真实年份")。保留项:一天中的时刻、星期几、大致季节(春 3-5 月/夏 6-8/秋 9-11/冬 12-2)。工程纪律:任何按年份过滤的代码都是 bug;季节分析用月份而非日期;"住院年份"字段只能用于偏移后空间的相对排序;
  2. ID 随机重编号:SUBJECT_ID/HADM_ID/ICUSTAY_ID 均为随机唯一编号,原始标识符不留存,不可逆——官方定性为匿名化(而非仅去标识);
  3. 种族的小样本归并:人口极少数民族替换为 “Other”——做种族分层分析时把它当"剩余类"而非真实类别。

另有第四条儿科专属:全部患者 <18 岁,不存在 MIMIC-III 的 anchor_age=91 归并问题——年龄字段可用原值(但注意 NICU 的天级粒度,§2.2)。

3.8 机器可读元数据速查(AI-Ready 属性)

属性 值
语言 英汉双语(字典 + _cn 列方案)
中心 单中心(ZUCH,杭州)
时间覆盖 2010-2018(平移后 2060-2120)
年龄 0-18 岁(中位 0.8 岁)
表数 16(v1.0)→ 17(v1.1.0 含 SURGERY_INFO)
总行数 约 1,870 万
ID 体系 SUBJECT_ID / HADM_ID / ICUSTAY_ID(MIMIC-III 同构)
诊断编码 ICD-10(7 位本地扩展)+ ICD-O-3
文本形态 中文原文未发布;NLP 症状表(+/−)替代
高频生理 仅术中(5 分钟);病房为护士间歇记录
死亡口径 院内死亡(无出院后随访)
分发格式 gzip CSV + SQL 脚本(MySQL/PostgreSQL)

3.9 文件导航与装载陷阱

PhysioNet 文件区:v1.1.0 全量文件夹、update_to_v1.1.0 增量文件夹(含迁移 SQL)、装载脚本、许可证文件。三个装载陷阱:其一,v1.0 老用户若只跑增量文件夹,注意 DIAGNOSES_ICD 的"主要诊断"字段是新增列——旧查询里按全表 JOIN 的逻辑要适配;其二,gzip 直读装载在 Windows 上不可用(需先 7zip 解压走 -csv 版脚本);其三,字符型 ITEMID 在导入时若被工具"智能"转成数字,会与字典表 JOIN 失败——关闭自动类型推断。

3.10 与论文口径的对照表(防混用)

概念 论文口径 本条目采用 备注
住院数 13,449(Table 1/2) 13,449 正文另有 13,499 写法(存照 B)
ICU 住留 13,941 13,941 MDPI 综述写 13,944,弃用
患者数 12,881 12,881 各来源一致
院内死亡率 7.1%(正文)/7.2%-971 例(Table 2) 7.1% 并注明 差异来自四舍五入口径
表数 16(Table 1) 16 + SURGERY_INFO v1.1.0 增表
死亡率对比 ICU 内 6.9%(955 例) 另列 与院内死亡 971 例差 16 例=出院后死亡

§3.11 跨库对齐协议:PIC ↔ MIMIC-III/IV 的映射细则

跨库研究的对齐清单(结合 §4.9 逐表差异展开为操作规程):

对齐项 方法 风险
ID 体系 三键同构,直接映射 无——这是同构红利
单元类型 GICU→MICU 类比、NICU→NICU、SICU→SICU CICU/GICU 无 MIMIC 对应物,映射表要显式留空
诊断编码 ICD-10↔ICD-9 用通用映射 + 儿科章节人工核对 P/Q 章映射质量差,需人工抽检
检验项目 LOINC 为桥(PIC 走 LOINC,MIMIC 需 itemid→LOINC 补链) MIMIC 侧 LOINC 覆盖不全
药物 中英文名→ATC 双边归一 中文药名多音译,ATC 映射需人工
生命体征 概念对齐(心率/血压/呼吸)按 D_ITEMS 双语名 护士记录习惯差异导致分布差
时间 只对齐相对时间(入 ICU 后 h),绝对日期禁止对齐 偏移量不可逆

发布跨库研究时的声明模板:“对齐基于 schema 同构与 LOINC/ATC 桥接;单元映射存在无对应项;诊断映射经人工抽检 N 条、一致率 x%;所有时间分析仅使用 ICU 内相对时间。”

§4 数据结构

4.1 实体关系图:五类临床事件围绕三键

PATIENTS ──1:N── ADMISSIONS ──1:N── ICUSTAYS
    │                │                │
    │           DIAGNOSES_ICD    CHARTEVENTS(病房体征)
    │           (ICD-10/10-O)   SURGERY_VITAL_SIGNS(术中5min)
    │                │           LABEVENTS(检验)
    │           OR_EXAM_REPORTS  PRESCRIPTIONS(医嘱)
    │           (检查报告事件)   INPUTEVENTS/OUTPUTEVENTS(液体)
    │                │           MICROBIOLOGYEVENTS(微生物)
    └──── 字典表 D_ITEMS / D_LABITEMS / D_ICD_DIAGNOSES ────┘
                        (双语:中文原文 + 英文对应)

4.2 字符型 ITEMID:一处类型差异的全局影响

PIC 与 MIMIC-III 最隐蔽的结构差异:PIC 的 ITEMID 是字符字段。全局影响四处:JOIN 类型必须显式一致(字符 vs 整数的 JOIN 是隐式转换 bug 温床);字典表的排序语义变了(字符排序 ‘10’ < ‘2’);从 MIMIC 迁移的特征抽取脚本要过一遍类型断言;CSV 导入工具的自动类型推断会把它转成整数——必须关闭。这条差异官方在页面里专门加粗提示,说明踩坑的人不少。

4.3 EMR_SYMPTOMS 表:中文临床文本的结构化出口

这是 PIC 最具原创性的表。背景:中文自由文本(入院记录、出院小结、病程记录、转科记录)因中文临床 NLP 去标识工具不可用而无法直接发布——团队选择用 NLP 把最常见的临床单元(症状及其否定状态)抽出来发布:

  • schema:症状术语(双语)+ 极性标记("+"存在 / "—"否定)+ 文档记录时间 + 患者三键;
  • 质量档案:随机 100 份笔记 → 3,410 个症状 → 两位作者独立核对 → 平均准确率 91.9% [91.3%, 92.4%];
  • 三类错误公开:中文长短语无自然词边界导致分词错误;阳性/阴性判定错误;家庭成员症状被误判为患者症状("其母诉患儿近日……"类句式);
  • 官方态度:明确提醒研究者"谨慎使用这些提取数据"。

方法学价值:这是中文临床 NLP 少见的"系统 + 准确率区间 + 错误分类学"三件套公开。91.9% 意味着约 8% 的噪声是有结构的——做下游建模时可以把这三类错误模式当先验(如对含家庭成员指代的句子降权)。

4.4 双时间轴:CHARTEVENTS 的稀疏与 SURGERY_VITAL_SIGNS 的密

PIC 有两条生命体征轴:CHARTEVENTS(护士间歇记录,2,278,978 行/13,941 住留 ≈ 每住留 164 条)与 SURGERY_VITAL_SIGNS(术中 5 分钟,1,216,011 行——分母只有手术患者)。对照 MIMIC-III(床旁监护约 1 小时粒度)与 eICU(也约 1 小时),PIC 的病房轴其实更稀疏,但术中轴更密。建模启示:围术期队列(SICU/CICU)可用高频特征,内科队列(GICU/PICU)只能用稀疏特征——同一个模型在两类队列上的特征工程策略应该不同。

4.5 检验表:千万行的主战场

LABEVENTS 1,009 万行、完整度 93.9%,是 PIC 的数据主战场。儿科检验的特殊性:参考范围随年龄剧烈变化(同一个"白细胞 15×10⁹/L"在新生儿是正常、在学龄儿是感染信号)——D_LABITEMS 只有 832 个项目(MIMIC-III 是 700+),但每个项目的正常范围解析需要年龄分段函数。工程配方:把年龄分段(新生儿/婴儿/幼儿/学龄/青春期)做成公共维度表,检验值先归一化为"相对参考范围的 z 分数"再进模型——这是儿科 ML 与成人 ML 最重要的一处差异。

4.6 用药表:体重剂量的世界

PRESCRIPTIONS 1,256,591 行、完整度 51.5%。儿科用药三大特征:剂量按体重/体表面积计算(mg/kg 类字段的解析需要体重数据——注意 PATIENTS/ADMISSIONS 里的体重字段或 CHARTEVENTS 里的体重测量);药物名以中文为主(双语字典对齐英文名);完整度 51.5% 的非随机性(门诊带药 vs 院内医嘱的记录渠道差异)。与 492 条目(MIMIC-IV)的药物四链(prescriptions→pharmacy→emar→poe)相比,PIC 只有 prescriptions 单链——用药执行的闭环不可验证,药效分析要声明这个缺口。

4.7 微生物表与药敏结构

MICROBIOLOGYEVENTS 183,869 行:培养事件 + 病原 + 药敏结果。结构上近似 MIMIC-III 的 microbiologyevents(specimen/organism/antibiotic 三层),中文药名经字典表对齐英文。儿科感控研究的使用姿势:新生儿败血症的病原谱(B 族链球菌、大肠杆菌的时间分布)、ICU 耐药率漂移(十年窗口正好覆盖抗菌药物管理政策期)、药敏-用药匹配的回顾审计(与 PRESCRIPTIONS 关联)。

4.8 血缘与漂移:单中心九年的两面

PIC 的血缘一跳到底:六个院内系统 → 提取清洗(MIMIC-III 规则)→ 去标识(日期平移/ID 重编号)→ 16 表 → PhysioNet。单中心九年的两面性:研究面——设备更换、诊疗规范更新、人员轮班制度的漂移都发生在同一空间内,时间漂移研究(MDPI 综述称之为 single-center temporal drift)可控性最好的素材;局限面——没有跨中心方差,模型泛化结论只能声明"ZUCH 内有效"。

4.9 与 MIMIC-III 的逐表对照速查

PIC 表 MIMIC-III 对应 关键差异
PATIENTS patients 无 anchor_age=91 问题;性别字段同构
ADMISSIONS admissions 无社保死亡链接;出院类型字段核对
ICUSTAYS icustays 5 单元命名不同(GICU/PICU/SICU/CICU/NICU)
CHARTEVENTS chartevents 更稀疏(护士记录);ITEMID 字符型
LABEVENTS labevents 参考范围需年龄分段
PRESCRIPTIONS prescriptions 无 emar/pharmacy 执行链
DIAGNOSES_ICD diagnoses_icd ICD-10+O-3 vs ICD-9;7 位本地扩展
SURGERY_VITAL_SIGNS (无) PIC 独有:术中 5 分钟
EMR_SYMPTOMS (无) PIC 独有:NLP 症状

4.10 数据质量总评

论文 Table 4 的完整度分档就是官方自评:高/优档 DIAGNOSES_ICD 99.4%、LABEVENTS 93.9%、OR_EXAM_REPORTS 91.9%、MICROBIOLOGYEVENTS 89.7%、CHARTEVENTS 79.7%;中档 PRESCRIPTIONS 51.5%、SURGERY_VITAL_SIGNS 47.7%、INPUTEVENTS 41.1%;低档 OUTPUTEVENTS 11.7%、EMR_SYMPTOMS 6.7%。使用总纪律:诊断与检验是主粮,液体与症状是配菜——主粮可直接建模,配菜必须先做缺失机制分析(它们缺在"哪类患者"上,比缺多少更重要)。

§4.11 儿科分析 SQL 速查:五个高频查询

-- 1. 年龄分段分布(月龄段)
SELECT CASE WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 1 THEN '0: <1y'
            WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 4 THEN '1: 1-3y'
            WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 12 THEN '2: 4-11y'
            ELSE '3: 12-18y' END AS age_band,
       COUNT(*)
FROM pic.admissions GROUP BY 1 ORDER BY 1;

-- 2. 检验 z 分数化的分母:各项目的年龄中位数参考
SELECT l.itemid, d.label, d.label_cn,
       PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY l.valuenum) AS median_val
FROM pic.labevents l
JOIN pic.d_labitems d USING (itemid)
JOIN pic.admissions a USING (subject_id, hadm_id)
WHERE l.valuenum IS NOT NULL
GROUP BY 1, 2, 3 HAVING COUNT(*) > 1000;

-- 3. 术中高频窗口:手术患者的 SpO2 轨迹抽样
SELECT s.subject_id, s.vital_time, s.spo2
FROM pic.surgery_vital_signs s
WHERE s.spo2 IS NOT NULL
ORDER BY s.subject_id, s.vital_time LIMIT 50;

-- 4. 症状表利用:某症状的阳性/阴性比
SELECT symptom, polarity, COUNT(*) FROM pic.emr_symptoms
GROUP BY 1, 2 ORDER BY 1, 2;

-- 5. 诊断章节画像(ICD-10 首字母)
SELECT SUBSTRING(icd_code FROM 1 FOR 1) AS chapter, COUNT(*),
       ROUND(AVG(hospital_expire_flag)::numeric, 3) AS mortality
FROM pic.diagnoses_icd di JOIN pic.admissions a USING (subject_id, hadm_id)
GROUP BY 1 ORDER BY 2 DESC;

五个查询覆盖了儿科建模最常用的底表操作;注意查询 2 的"年龄中位数参考"只是粗参考——真正的参考范围要按临床手册分段,不要用数据分布替代临床规范。

§5 下游分析协议

5.1 环境准备与首次对账

-- PostgreSQL 装载后第一组对账查询
SELECT COUNT(*) FROM pic.patients;     -- 12,881
SELECT COUNT(*) FROM pic.admissions;   -- 13,449
SELECT COUNT(*) FROM pic.icustays;     -- 13,941
SELECT COUNT(*) FROM pic.labevents;    -- 10,094,117
-- 双语列抽查
SELECT itemid, label, label_cn FROM pic.d_labitems LIMIT 10;
-- 未来年份确认(去标识化特征,不是 bug)
SELECT MIN(charttime), MAX(charttime) FROM pic.chartevents;

四组查询全对上再开工。未来年份看到 2060-2120 属预期行为(§3.7)。

5.2 评测协议建议:没有官方基准,自己立规矩

PIC 无官方 train/test 划分与基准任务。参照社区 10 项研究(MDPI 综述)的事实惯例,推荐协议:患者级划分(SUBJECT_ID 分组,468 名多次住院患者全部留在单侧);时间锚点前置——预测任务从 ICU 入住后固定窗口(如 6h/12h/24h)开始,避免治疗信息倒灌;单元分层报告——GICU 15.3% vs SICU 2.0% 的死亡率差 7 倍,混合评估无意义;多种子方差——13,941 住留的体量对种子敏感;校准必报——判别力(AUC)之外必须报校准曲线/Brier 分数(MDPI 综述的三条主张之一)。

5.3 院内死亡预测:基线配方

最常用任务的参考实现:

-- 标签:住院结局(院内死亡 7.1%)
SELECT a.subject_id, a.hadm_id,
       CASE WHEN a.expire_flag = 1 THEN 1 ELSE 0 END AS label
FROM pic.admissions a
JOIN pic.icustays i USING (subject_id, hadm_id)
GROUP BY 1, 2, 3;

特征三板斧:人口学(年龄用小数、性别、单元类型);检验 z 分数(§4.5 的年龄分段归一化);稀疏体征聚合(CHARTEVENTS 入住后 24h 窗口的 min/max/mean/趋势)。模型起点用逻辑回归 + XGBoost,报 AUC + 校准;对照水位参考 MDPI 综述汇总的既往研究(注意各家标签定义不同,只比相对结论不比绝对数字)。

5.4 脓毒症与器官功能障碍:标签构造的坑

MDPI 综述汇总的研究方向之一是脓毒症早期识别。PIC 上构造脓毒症标签的三个坑:感染证据用 MICROBIOLOGYEVENTS 培养阳性 + 抗菌药物暴露(PRESCRIPTIONS)双条件——培养污染与预防性用药都是噪声源;儿童脓毒症标准与成人 Sepsis-3 不同(儿科用的是 Phoenix/旧版 pSOFA 体系),直接套 Sepsis-3 会被审稿人打回;年龄分段阈值再次生效——心率/血压的异常判据按年龄查表。器官功能障碍表型(AKI 等)同理:儿科肌酐参考范围的年龄依赖性比成人更强。

5.5 双语字典的利用协议

双语 NLP 或跨国协作的三种用法:术语对齐研究——用 D_LABITEMS/D_ITEMS 的中英对照研究中文临床术语的翻译等价性(832 + 466 个对照对是现成语料);跨库映射——把 PIC 的 ICD-10 与 MIMIC-III 的 ICD-9 做章节级映射(Q/P 章在 ICD-9 中结构不同,别用通用映射表硬套);symptom 表的下游利用——EMR_SYMPTOMS 的双语症状词表可服务中文临床 NER/极性检测的弱监督。

5.6 成人模型→儿科迁移的校准协议

把 MIMIC 上训练的模型搬到 PIC(或反向)的正确姿势:先做分布对账(年龄分布 §2.8 的两世界图,特征语义逐个审计);重估参考范围(所有用到成人正常值的特征重新按儿科标准计算);只迁移表示不迁移决策——预训练编码器可用,输出层与校准层必须重训;温度缩放/等回归校准在儿科子集上重做;报告单元分层与年龄分层性能。直接迁移不校准的失败模式见 §7.6。

5.7 质量改进研究协议:把单中心当纵向实验

PIC 的单中心九年窗口适合回答"同一个 ICU 随时间如何变化":按入住年份切片,追踪死亡率/住院日/检验组合/用药模式的漂移;对照期内的政策事件(如抗菌药物管理)做前后对照;用控制图(p-chart/CUSUM)处理 7.1% 基线率的自然波动。这类研究不必 ML,但恰恰是临床团队最认的产出形态。

5.8 常见错误用法黑名单

  1. 按真实年份过滤——日期平移后所有"年份"都是假的(§3.7);
  2. 把 ITEMID 当整数——字符型,JOIN 失败或字典错配(§4.2);
  3. 把 EMR_SYMPTOMS 当全库背景——完整度 6.7%,只覆盖有病程记录的子集;
  4. 套用成人参考范围——检验 z 分数必须年龄分段(§4.5);
  5. 跨患者时间对齐——日期平移使跨患者时序不可比;
  6. 用 SURGERY_VITAL_SIGNS 做全库生理背景——它只属于手术患者的手术时段;
  7. 套 Sepsis-3 成人标准——儿科用儿科标准(§5.4);
  8. 声称出院后生存分析——没有出院后死亡数据。

5.9 复现包最小清单

发布基于 PIC 的研究时附带:装载脚本版本(v1.1.0)与装载日期;行数对账输出;划分文件(SUBJECT_ID 列表);年龄分段函数源码(z 分数化的公共实现);单元/年龄分层报告模板;多种子配置;环境锁定文件;双语字段的引用声明(字典表是团队翻译劳动,注明)。

5.10 与 492/494 条目的联合路线

  • PIC + MIMIC-IV(492):同构 schema 的跨库迁移研究——结构对齐零成本,语义对齐(年龄/参考范围/编码)是全部工作量,天然的"schema 同构 ≠ 分布同构"教学实验;
  • PIC + phenotype-annotations(494):临床文本标签路线对照——494 的人工金标准 vs PIC 的 NLP 症状表(91.9% 且错误分类公开),合成"标注质量谱系"的完整两端;
  • 三者:成人库 + 儿科库 + 金标准标注的完整矩阵,足够撑起一门"医疗数据工程"研究生课。

§6 实证结果与方法学分析

6.1 论文给出的实证基座

Sci Data 论文本身是数据描述论文,它的"实证"是三张表:Table 1(16 表行数与语义)、Table 2(单元级人口学与结局:性别、年龄、死亡率)、Table 3(与 MIMIC-III 的特征对照)。从这三张表能提炼的硬结论:单元间死亡率梯度(GICU 15.3% → CICU/SICU 2.0%);年龄中位 0.8 岁 vs MIMIC-III 的 60.6 岁的两世界分布;双语与 ICD-10 是结构性差异而非表面包装。数据完整度表(Table 4)则是官方自评的质量地图——99.4% 的诊断 vs 6.7% 的症状表,这张"贫富分化"图本身就是使用指南。

6.2 NLP 症状抽取的质量审计:91.9% 的含金量

EMR_SYMPTOMS 的质量审计设计值得逐字读:随机 100 份笔记(覆盖入院/出院/病程/转科四类)、抽出 3,410 个症状、两位作者独立核对、报平均准确率 91.9% [91.3%, 92.4%]。三点评注:其一,报区间而非单点——样本量 3,410 下区间的宽度是诚实的;其二,错误三分类(分词错误/极性错误/家属症状混淆)给了下游"噪声结构图"——不是随机 8% 噪声,而是可预测的错误模式;其三,混淆来源第三条(家庭成员症状)是中文家庭中心叙事文化的直接产物——"其母诉患儿……"句式在英文病历里罕见,这是双语数据集才暴露得出的错误类型。

6.3 完整度的非随机缺失地图

Table 4 的完整度数字必须配"谁被记录"的解读:PRESCRIPTIONS 51.5%——住院全程的医嘱覆盖约一半,缺口集中在非 ICU 住院时段;INPUTEVENTS 41.1%——"每日晨计算"的机制本身就是抽样;OUTPUTEVENTS 11.7%——出量记录依赖护理执行率;EMR_SYMPTOMS 6.7%——只有病程记录存在的子集。四者共同点:缺失与临床场景强相关(外科 vs 内科、ICU 段 vs 普通段),MCAR 假设全不成立。任何用到这四张表的模型,缺失指示器本身会成为最强特征之一——这是警告也是提示:显式建模缺失机制比假装完整更好。

6.4 死亡率的单元分层真相

院内死亡率 7.1% 是全库粗率,拆开是五个世界:GICU 15.3%、PICU 9.8%、NICU 7.5%、CICU 2.0%、SICU 2.0%。三层解读:其一,GICU 是兜底单元(各科复杂病例汇入),高死亡率反映的是病例谱而非医疗质量——跨院比较时若不分层会得出荒谬结论;其二,CICU/SICU 的 2.0% 是围术期队列,其死亡风险分布在手术时段(SURGERY_VITAL_SIGNS 的时间窗),与 GICU 的"全住留风险"语义不同;其三,任何死亡预测模型必须报单元分层 AUC——混合模型大概率学到的是"单元类型"这个捷径特征。

6.5 社区研究图谱:10 项 ML 研究的合成结论

MDPI Bioengineering 2026 综述(二手来源,存照 E)对截至当时的 10 项 PIC-based ML 研究做了叙事综合:方向覆盖导管相关血栓、脓毒症、院内死亡、器官功能障碍表型。综述的三条主张值得全录:**其一,上游设计选择(标签卫生、时间锚点与预测间隙、不规则时间序列的特征窗口、缺失的原理性处理)对性能/可复现性/临床效用的驱动至少与分类器选择同等重要;其二,单点判别指标不足,必须配校准、决策曲线分析与贴近部署的验证;其三,PIC 应被视作协作性儿科 ICU 数据生态的种子。**第三条是定位性判断——与官方"国际数据共享"的立项初衷呼应。

6.6 四大基质特性:综述的方法学抽象

该综述把 PIC 的建模难点抽象为四个基质(substrate)特性,直接采纳为建模纪律:不规则时间序列(病房轴护士记录的稀疏与不规律采样——时间序列模型需处理任意间隔);构造标签(死亡/脓毒症/血栓都是研究者构造的标签,定义敏感性高——做敏感性分析);单中心时间漂移(九年设备/规范/流程漂移——时间外推验证必不可少);双语标识符语义(ITEMID 字符型 + 中英双轨——特征工程中的语义对齐成本)。这四条加 §5.8 黑名单构成本条目的"防坑体系"。

6.7 时间漂移的量化建议

九年窗口的漂移检验配方:按入住年份切十层,对每个特征画年均值/分布带;死亡率控制图(年死亡率 7.1% 基线的 p-chart);设备迁移断点(监护仪/信息系统更换的年份若可知,做断点分析)。漂移研究的最小结论格式:“特征 X 的分布漂移幅度超过模型输入容差,故时间外推需重校准”——把漂移从模糊担忧变成可测对象。

6.8 八个必知的坑(坑点 1-8)

坑点 1:未来日期不是 bug。住院时间 2060-2120 是 50-100 年偏移的去标识化设计;按真实年份过滤、跨患者时间对齐都是错误用法(§3.7)。

坑点 2:ITEMID 是字符。从 MIMIC 迁移的脚本里所有整数假设都会翻车;CSV 导入时关掉自动类型推断(§4.2)。

坑点 3:中文原文不在库里。自由文本未发布;EMR_SYMPTOMS 是替代品且完整度 6.7%——想要文本做 LLM 的人请换目标(§4.3)。

坑点 4:成人参考范围失效。检验值必须年龄分段归一化;生命体征阈值查儿科表(§4.5、§5.4)。

坑点 5:单元混训学捷径。GICU 15.3% vs SICU 2.0%,混合训练的模型学到单元类型而非病理;分层报告是底线(§6.4)。

坑点 6:Sepsis-3 不可用。儿科脓毒症标准不同(Phoenix/pSOFA 体系);成人标签管线直接套用会被打回(§5.4)。

坑点 7:高频数据的错觉。5 分钟生命体征只属于手术时段;病房轴比 MIMIC-III 还稀疏——"PIC 有高频数据"是半句话(§4.4)。

坑点 8:版本口径。论文 Table 1 是 v1.0 的 16 表;v1.1.0 有 SURGERY_INFO 与主要诊断字段;MDPI 综述的 13,944 与论文 13,941 差 3——引用一律以论文 Table 口径(§3.10)。

6.9 使用者自查清单

  • [ ] 已通过 PhysioNet 认证(培训/GCP)+ 签 DUA
  • [ ] 装载后行数对账五连通过(§5.1)
  • [ ] 代码里无"真实年份"过滤逻辑
  • [ ] ITEMID 全链路字符型处理
  • [ ] 检验特征做了年龄分段归一化
  • [ ] 模型报告含单元分层 + 年龄分层 + 校准
  • [ ] EMR_SYMPTOMS 使用处声明了 6.7% 完整度与 91.9% 抽取准确率
  • [ ] 脓毒症类标签用了儿科标准
  • [ ] 版本口径声明为 v1.1.0(或 v1.0 并注明)
  • [ ] 复现包含划分文件与年龄分段函数(§5.9)

6.10 家族治理定位:MIMIC 出口的第一站

PIC 在 MIMIC 家族治理图谱上的位置:它是 MIMIC-III schema 的第一个完整国际移植,证明了"表结构 + 治理协议 + DUA 文化"整套方法的可出口性。之后的中国中心 PhysioNet 数据集(自贡四院感染库、Chinese critical care database 等)走的都是 PIC 踩出来的路。治理层面的三个可复制件:认证双轨制(国际培训/GCP);增量版本发布(v1.0 → v1.1 的 update 文件夹模式——老用户零成本升级);质量自评表(Table 4 完整度分档——把数据缺陷当元数据发布)。

6.11 冲突口径诊断树

数字不符?
├─ 住院数 13,449 vs 13,499 → 论文 Table 1/2 vs 正文自相矛盾(存照 B);本条目用 13,449
├─ ICU 住留 13,941 vs 13,944 → 论文 vs MDPI 综述;用论文 13,941
├─ 死亡率 7.1% vs 7.2% → 正文四舍五入 vs Table 2 合计(971 例);报 7.1% 并注明
├─ 表数 16 vs 17 → v1.0 论文口径 vs v1.1.0 实际(+SURGERY_INFO)
├─ 字典表名 D_ICD_DIAGNOSES vs D_DIAGNOSES_ICD → 论文 vs PhysioNet 页面写法不一(存照 C);装载后以实际文件为准
└─ "英国"来源 → 批次元数据笔误;官方为中国 ZUCH(存照 A)

6.12 冻结生态与更新预期

PIC 的最后更新停在 v1.1.0(2020-11),论文措辞里"未来将标准化并发布"的检查报告内容(OR_EXAM_REPORTS 的文本部分)至今未见下文。文档站仍在线、引用持续增长(超 100 篇),但库本体进入冻结维护态。使用策略:把它当稳定基础设施(冻结是可复现性的朋友);关注官方渠道是否发布 v1.2 或扩展文本资源;任何"最新数据"的期待都应收敛到"2010-2018 窗口"这个事实。

6.13 与同类儿科数据资产的横向定位

资产 类型 儿科覆盖 开放度 与 PIC 关系
PIC EHR 关系库 0-18 全谱 + NICU PhysioNet Credentialed 本体
MIMIC-III NICU 子集 EHR 关系库 仅新生儿(美国) Credentialed 新生儿段的国际对照
VPS / PICANet 行政审计注册库 多中心 受限/审计用途 有广度无深度(无时序检验用药)
Philips/其他院内库 院内数据 各院自定 不开放 PIC 提供了它们的开放化模板
494 表型标注 文本标注 成人 Credentialed 标签路线对照

综述原话:PIC 是"唯一同时具备关系型 EHR 深度与国际可及性的开放资源"——它在这个生态位上没有对手。

6.14 静态库 × 活跃文献:增量价值策略

库冻结但文献活跃(超 100 引用且持续),增量价值的三条路:方法学——把新方法(LLM 特征抽取、基础模型微调)在冻结库上做受控评测,文献价值反而因库稳定而更高;再分析——对 10 项已有研究做系统综述/meta 层面的方法学审计(MDPI 综述开了头);生态位补全——PIC 缺的(出院后随访、多中心、文本)由其他资源补,做"PIC + X"的联合研究设计而不是等 PIC 自己补全。

§6.15 十条常见反对意见与回应

论坛与审稿中反复出现的质疑,逐一回应:

  1. “单中心数据没价值”——单中心的纵向一致性恰是方法学研究的优势;多中心的方差控制是另一类研究设计,两者互补而非替代;
  2. “1.2 万患者太小”——对表型明确的儿科亚组研究足够;且儿科人群本就稀缺,PIC 是该生态位的最大开放资源;
  3. “没有文本不能做 NLP”——症状表 + 双语字典就是中文临床 NLP 的结构化语料;文本发布受去标识技术限制,不是保守;
  4. “中国数据国际可比性差”——双语工程与 ICD-10/LOINC 对齐就是为可比性设计的;对比研究(如 §2.8 年龄分布)正是可比性的操作化;
  5. “数据太旧(2010-2018)”——冻结是可复现性的朋友;诊疗规范漂移本身是研究对象(§6.7);
  6. “为什么没有波形数据”——术中 5 分钟是 AIMS 系统的能力边界;床旁波形研究者请用 vitaldb/HiRID,人群定位不同;
  7. “死亡率 7.1% 太低/太高”——单元间 2.0%-15.3% 的梯度才是真相;混合基线率只是分层结构压缩后的投影;
  8. “MIMIC 脚本直接跑就行”——§5.8 黑名单八条里六条都是"MIMIC 脚本直接跑"引发的;同构是起点不是终点;
  9. “官方更新停了所以弃用”——冻结库的引用仍在增长(超 100 篇);基础设施的成熟度不看更新频率看可复现性;
  10. “中文术语我看不懂”——字典表 + _cn 列方案正是为此设计;三位作者的人工翻译是给国际研究者的桥,不是障碍。

§6.16 静态库 × 活跃文献的增量策略

库冻结(v1.1.0,2020-11)而引用活跃(超 100 篇,2025-05 官方统计)的组合,指向三条增量路线:再分析层——对已发表研究做方法学审计(标签定义、校准报告率、划分卫生),MDPI 综述已开先例;组合层——PIC+MIMIC 的跨库、PIC+494 的标签谱系、PIC+VitalDB 的术中延伸,冻结库在组合研究里是稳定的"锚点资产";工具层——把装载脚本、对账清单、年龄分段函数做成开源工具包(mimic-code 模式),工具引用反哺数据引用。三条路的共同前提:引用版本口径(v1.1.0)与日期偏移事实,这是冻结库的"版本纪律"。

§7 AI 就绪指南与应用场景

7.1 五种标准喂法

  1. 院内死亡预测:最热任务;单元分层 + 校准为底线(§5.3 配方);
  2. 儿科脓毒症/器官功能障碍早期识别:标签构造按 §5.4;PIC 的微生物+用药双证据链是优势;
  3. 围术期风险预测:SURGERY_VITAL_SIGNS 的高频窗口做术中低血压/缺氧预警——PIC 独有赛道;
  4. 双语术语对齐:字典表 + 症状表服务中文临床 NLP(§5.5);
  5. 跨库迁移研究:与 MIMIC-IV 的同构异源实验(§5.10)——成人与儿科两个分布的方法学对照。

7.2 死亡线:30 分钟跑通第一个实验

# 前提:pic schema 已装载(§3.6)
# 步骤 1:单元分布与死亡率画像(5 分钟)
psql -c "SELECT first_careunit, COUNT(*),
  ROUND(AVG(hospital_expire_flag)::numeric,3) AS mortality
  FROM pic.icustays i JOIN pic.admissions a USING (subject_id, hadm_id)
  GROUP BY 1 ORDER BY 2 DESC;"
# 步骤 2:抽一个患儿的时间线全景(10 分钟)
psql -c "SELECT subject_id, hadm_id FROM pic.icustays LIMIT 1;"  # 取样例
# 按样例 id 查 labs/vitals/prescriptions 各取最近 20 条
# 步骤 3:Death 标签 + 人口学特征导出(15 分钟,走 §5.3 配方)

第一个实验先看单元画像(死亡率梯度本身就是最重要的发现之一),再进入建模。

7.3 泄漏防控专项

PIC 的泄漏面:患者级泄漏(468 名多次住院患者跨集——SUBJECT_ID 分组划分堵住);时间泄漏(预测窗开始后的记录倒灌——锚点前置 + 预测间隙);单元泄漏(单元类型作为特征是捷径——报告分层性能或干脆从特征中移除做消融);标签构造泄漏(脓毒症标签若用了"抗生素暴露"而特征里也有用药记录,需做标签-特征互斥审查);日期偏移泄漏(偏移量若与结局相关——官方按患者随机,正常无虞,但别自己构造"绝对日期"特征)。2,102 篇小语料的种子敏感性在 PIC 同样存在——13,941 住留报多种子方差。

7.4 公平性与人群分层

PIC 的公平性分析维度:年龄(儿科的核心分层变量——按月龄段分层而非岁);地域(转诊来源 11 市——可构造地域可达性代理变量,但注意 DUA 对地区字段的使用限制);保险与支付方式字段(若表内可得——中国语境下是新农合/城镇居民/城镇职工的结构差异);性别(57.5% 男性——先天心脏病男童比例高是临床事实而非采样偏差,解读分层差异时要有临床对照)。特别提醒:少数民族已归并为 “Other”(§3.7),种族公平性分析在 PIC 上不可做——这是去标识化的代价,论文里不要硬做。

7.5 LLM 时代的用法与克制

PIC 与 LLM 的三种安全关系:LLM 做特征工程助手——把 CHARTEVENTS/LABEVENTS 序列文本化后让 LLM 做摘要特征(受控环境内);LLM 做双语术语对齐——用字典表的中英对照做术语翻译质量的自动评测集;克制项:不要用 LLM 幻觉文本——库里没有自由文本,让 LLM "补写"临床叙述等于伪造数据。合规提醒沿用 PhysioNet 2025-09 LLM 政策:credentialed 数据不得上传第三方在线服务;本地部署为官方强烈推荐(§8.3)。

7.6 负结果也值钱:成人→儿科迁移的已知失败模式

综述与文献共识的失败方向:直接迁移不校准——成人死亡模型的判别力在儿科可能尚可,但校准崩溃(儿科 7.1% 基线 vs 成人 ~11% 且风险结构完全不同);成人生理阈值报警——心率 140 在新生儿是正常,在成人是极限,直接套用产生海量假警报;体重盲区——成人模型忽略体重的剂量/容量逻辑在儿科全错;ICD 映射硬套——ICD-9→10 通用映射表丢失 P/Q 章的儿科结构。这四条是审稿人最熟悉的儿科 ML 批评点——预防性声明比事后辩护便宜得多。

7.7 不规则时间序列建模配方

病房轴的不规则采样处理三种范式:归并重采样(按 1h/4h 网格聚合,丢时序信息换简单性——基线做法);不规则感知模型(GRU-D/SeFT/时间感知 attention 类——把间隔当输入);分段建模(术中高频段与病房稀疏段分开建模再融合——PIC 特有机会)。推荐路线:先用归并基线建立水位,再上不规则感知模型报告增量,最后用分段模型吃 SURGERY_VITAL_SIGNS 的独有红利。每一步都报校准。

7.8 特征工程备忘:儿科专属特征清单

成人管线之外必须加的儿科特征:体重/体表面积(剂量与容量计算的基准, CHARTEVENTS 里测得);年龄分段交互项(所有生理特征的 z 分数化都要 × 年龄段);发育代理(月龄/矫正月龄 for NICU);生长轨迹(多次测量的身高体重百分位变化——单中心九年可以算个体轨迹);围产期史(P 章 ICD 的孕周/出生体重代理);手术暴露标志(SURGERY_INFO 的存在本身就是风险分层变量)。这套清单 = 儿科 ML 与成人 ML 的最小差异集。

7.9 复现包与工程化

§5.9 清单之外的工程化补充:数据版本钉死 v1.1.0(CSV 文件哈希入库);SQL 与 Python 特征管道分离(SQL 做抽取、Python 做特征——z 分数函数的单元测试用文献参考值);CI 里跑行数对账 + 未来年份断言(防止有人"修复"日期偏移);分层评估脚本模板开源。这份库的工程红利是 schema 与 MIMIC-III 同构——mimic-code 社区资源的大部分 SQL 改名即可用,但语义审查不可省(§4.9 对照表逐条过)。

7.10 成本核算:用 PIC 研究的真实预算

与成人库对照的研究成本账:数据获取——认证 3 个工作日 + DUA(零成本);计算——1,870 万行规模在单机 PostgreSQL 完全可控(无云成本);翻译对齐是隐性大头——跨语言研究里术语对齐的人工审查时间约占总工时 20-30%(若做中文侧研究);伦理——已由 ZUCH IRB 覆盖数据层,研究者本地 IRB 通常走豁免或快速通道(以本机构为准)。对比自建儿科队列(伦理 + 采集周期以年计),PIC 的经济学意义一目了然。

7.11 教学场景:双语 ICU 数据课程包

基于 PIC 的四周课程:第 1 周——MIMIC-III/PIC schema 同构对照(§4.9 表逐行讲),装库对账;第 2 周——儿科时间语义(NICU 天龄、日期偏移、不规则采样),完成死亡基线;第 3 周——双语工程(字典表审计 + 症状表质量评估),写一份"翻译错误报告";第 4 周——迁移实验(成人模型→儿科校准,§5.6 协议),对比校准前后。结课产物即一份可投 short paper 的对照研究。选它的教学理由:规模适中(单机可跑)、语义差异丰富(年龄/双语/偏移三主题)、失败方向已知。

7.12 多任务与联合建模

13,941 住留上做多任务联合(死亡 + 住院日 + 再入 ICU)的权衡:多任务正则对 468 名多次住院患者的子任务有帮助,但对单次住院的 96.4% 主群增益有限;单元异质性(5 ICU)比任务异质性更大——先分层后多任务(每单元内多任务)的顺序更稳。标签相关性先验:死亡与住院日的共享表示需要小心(长住院与高死亡率的非线性关系在儿科呈 U 型——过短过长都危险)。

7.13 监控与回归:把 PIC 搬进 CI

工程团队把 PIC 用作回归基准:固定 1,000 住留的冻结子集作为服务回归集(每次模型更新跑一遍分层 AUC + 校准,容差 -2%);数据管道的 CI 断言(行数、ITEMID 类型、日期范围 2060-2120);季度性全库重跑对照漂移。1,870 万行的体量让全库回归在小时级完成——这是它作为工程基准的隐藏价值。

7.14 与 494 条目的"标注质量谱系"实验

把 494(人工双人金标准)与 PIC 的 EMR_SYMPTOMS(NLP 自动抽取)放在同一坐标系:494 的 Cohen’s Kappa 0.56-0.95 是人工上限区间;PIC 的 91.9% 是自动系统的实测水平。实验设计:在 PIC 症状表的覆盖子集上抽样人工复核,比较"你的标注 - PIC 自动"与"494 的标注员间分歧"——若自动-人工差距落在人工-人工分歧区间内,说明该症状的自动抽取已达人工一致性上限。这个实验的设计完全复用 §5.2 的评测协议。

7.15 从 PIC 出发的三个研究提案模板

  1. 儿科生理 z 分数图谱:全库检验/体征按年龄分段归一化,发布"中国儿科 ICU 参考范围数据集"——PIC 最大的再利用增值;
  2. 双语术语对齐基准:以字典表为种子,构建中文临床术语翻译评测集,服务医疗 NLP 国际化;
  3. 十年质量改进白皮书:按 §5.7 协议做单元级纵向质量画像,与 PICANet 等国际注册库对标——临床团队最认的产出。

§7.16 从研究到床边:部署差距清单

儿科 ML 的研究-部署落差在此库上的具体形态与对策:警报疲劳(儿科生理范围宽,成人式阈值系统产生海量假阳性——对策:z 分数特征 + 时段自适应阈值);数据接口(研究用 SQL 全表扫描,床边系统是流式 HL7/FHIR——对策:部署前做特征计算的时间预算测试);人群漂移(ZUCH 转诊网络与目标医院的人群差——对策:校准层本地重训 + 前三个月 shadow mode);伦理审批(研究 IRB 豁免不等于临床部署许可——对策:医疗器械软件分级评估);解释性需求(临床团队要"为什么",黑盒模型的生存空间在儿科更小——对策:证据句/特征归因输出为默认配置)。这份清单来自 §6.5 综述第三条主张(“贴近部署的验证”)的操作化。

§7.17 监控回放:用历史数据做警报审计

PIC 的九年窗口支持"回放式审计":把新的预警算法跑在历史 ICU 住留上,对照实际结局统计每住留警报数、警报提前量、假警报率。三个指标的定义公式:警报敏感度 = 命中真实事件的警报 / 真实事件数;提前量分布 = 警报时刻 - 事件时刻的中位/IQR;每住留警报负荷 = 警报总数 / 住留数(临床可容忍度通常 <1-2/天)。回放审计是部署前(§7.16)的最后一道关卡,也是论文里"临床效用"一节的图表来源。

§8 伦理、许可与合规

8.1 IRB 与知情同意

数据层伦理由 ZUCH IRB 批准(杭州),豁免个体知情同意——理由是项目不影响临床护理且全部 PHI 已去标识。使用者侧的伦理义务由 DUA 承接:禁止再识别、负责任处理、遵循协作研究原则。中国研究者的本地伦理流程通常仍需走一遍(即使数据已开放)——以各机构 IRB 要求为准。

8.2 去标识化的强度与残余风险

官方定性:ID 随机重编号不可逆 + HIPAA 标识符全移除 + 日期平移 → 匿名化。残余风险两点:罕见病再识别——25.4% 先天性疾病中存在罕见综合征病例组合,"诊断组合 + 时间线 + 转诊地"理论上可缩小范围(DUA 的禁止条款针对的就是这种拼接);日期平移的族谱效应——同一家庭多名患儿的偏移量是否一致官方未说明(若同家庭同偏移,家庭结构可被推断;若不同,家庭关联不可达)。使用者在发表时对罕见病例应做案例级模糊化。

8.3 LLM 与第三方服务红线

PhysioNet 2025-09-24 官方政策(对 MIMIC 系与 credentialed 数据一体适用):数据不得通过 API 发送给第三方 LLM 服务(零留存要求极难核实);推荐本地部署 LLM;研究者对合规负全责。落地纪律:评测用本地开源模型;任何云端处理前先过机构合规审查;论文里披露处理路径。这条政策对双语研究者尤其重要——中文翻译类云端 API 调用同样落入"发送数据给第三方"的范畴。

8.4 跨境数据合规的扩展提醒

与 493/494 条目相同的背景:美国 DSP(EO 14117)对批量获取美国敏感健康数据设限——PIC 是中国数据,方向相反,但跨境协作的双边合规都要核:中国侧《数据安全法》《个人信息保护法》对健康数据出境的框架(PIC 走的是"已公开+匿名化"路径,风险低但流程要留痕);欧美合作者的机构侧 DUA 承接。本条目不构成法律意见,跨境团队请走机构合规部门。

8.5 引用与致谢义务

三层引用链(官方要求):数据集 DOI(10.13026/32x9-wv38,Li/Zeng/Yu 2020 版本引用)+ 原始论文(Zeng et al. Sci Data 7:14, 2020)+ PhysioNet 平台论文(Pollard et al. 2026 Nature Health)。双语字典与 NLP 症状表凝结了团队的人工翻译与核对劳动——使用这两个组件时在正文明确说明其来源与准确率(91.9%),是最基本的学术礼节。

§9 常见问题(FAQ)

9.1 基础身份

Q1 PIC 是什么? Paediatric Intensive Care database:中国浙江大学医学院附属儿童医院五个 ICU(2010-2018)的 MIMIC-III 结构儿科数据库,首个免费英汉双语临床数据库,PhysioNet v1.1.0。

Q2 谁做的? ZUCH 团队(Zeng/Yu/Lu 共同一作,Shu 与 Li 通讯);PhysioNet 页面署名 Haomin Li, Xian Zeng, Gang Yu。

Q3 是英国的数据吗? 不是——生产排期元数据把来源写成"英国"是笔误;官方为中国杭州 ZUCH(存照 A)。

Q4 多大规模? 12,881 患儿 / 13,449 住院 / 13,941 ICU 住留;约 1,870 万行。

Q5 版本历史? v1.0.0(2019-11-26)→ v1.1.0(2020-11-12):主要诊断字段、SpO2/EtCO2/ST、新增 SURGERY_INFO 表。

Q6 DOI 和论文? DOI 10.13026/32x9-wv38;论文 Zeng et al., Scientific Data 7:14 (2020), DOI 10.1038/s41597-020-0355-4(PMID 31932583)。

Q7 时间覆盖? 2010-2018 真实收治期;去标识后日期平移至约 2060-2120 年。

Q8 访问要什么条件? 人体受试者培训(CITI 类)或中国 GCP 认证 + 签 DUA;审批约 3 个工作日。

Q9 装载支持哪些数据库? 官方脚本覆盖 MySQL 与 PostgreSQL;CSV 可进任意关系库。

Q10 在线文档在哪? pic.nbscn.org(含引用统计与临床资源介绍)。

9.2 数据内容

Q11 五个 ICU 怎么分? GICU 综合 / PICU 儿科 / SICU 外科 / CICU 心脏 / NICU 新生儿,共 119 床。

Q12 年龄范围? 0-18 岁;中位 0.8 岁(Q1-Q3 0.1-3.5);NICU 平均 14.5 天。

Q13 最大表是哪张? LABEVENTS 1,009 万行(检验);CHARTEVENTS 229 万行(病房体征)。

Q14 高频生命体征有哪些? 仅手术时段:SURGERY_VITAL_SIGNS 每 5 分钟(含 SpO2/EtCO2/ST,v1.1.0);病房段只有护士间歇记录。

Q15 有自由文本吗? 没有——中文临床文档未发布;替代品是 NLP 症状表 EMR_SYMPTOMS(402,142 行)。

Q16 症状表可信吗? 平均准确率 91.9% [91.3%, 92.4%](3,410 症状双人核对);三类错误公开;官方提醒谨慎使用。

Q17 诊断编码体系? ICD-10 本地 7 位扩展 + ICD-O-3;中文诊断比英文更具体。

Q18 死亡数据口径? 院内死亡(7.1%,971 例);无出院后随访。

Q19 病种谱? 先天畸形/染色体异常 25.4% 居首,围产期 14.1%,呼吸 10.3%。

Q20 液体平衡数据如何? INPUTEVENTS 41.1% / OUTPUTEVENTS 11.7% 完整度——用前先做缺失机制分析。

Q21 微生物数据? 183,869 行,培养+药敏,完整度 89.7%——感控研究的富矿。

Q22 ITEMID 是什么类型? 字符字段(MIMIC-III 是整数)——迁移脚本必查(坑点 2)。

Q23 双语怎么实现的? 分层策略:标准编码走国际英文版、其余人工翻译复核、原文保留 + _cn 后缀(§3.4)。

Q24 有体重数据吗? 有(CHARTEVENTS 测量 + 人口学),儿科剂量计算的基础——但注意非随机缺失。

9.3 工程与装载

Q25 装载脚本在哪? PhysioNet 文件区:PostgreSQL 用 1-create-tables-load-data-gzip.sql(或 -csv 版)+ 2-index.sql + 3-constraints.sql;MySQL 用 define.sql + index.sql + constraints.sql。

Q26 为什么日期是 2060 年? 去标识化日期平移 50-100 年(患者内一致、保留时刻/星期/季节)——不是 bug,别"修"它。

Q27 能跨患者对齐时间吗? 不能——偏移量患者特异,跨患者时序不可比。

Q28 CSV 导入后 JOIN 失败? 八成是 ITEMID 被自动转成整数——关闭类型推断或显式 CAST(§4.2)。

Q29 v1.0 用户怎么升级? 下载 update_to_v1.1.0 增量文件夹(含迁移 SQL),不必重下全库。

Q30 表数到底 16 还是 17? 论文 Table 1 是 v1.0 口径 16 表;v1.1.0 加 SURGERY_INFO 后为 17(存照 C)。

Q31 数据质量总评? 诊断 99.4%/检验 93.9%/微生物 89.7% 高;处方 51.5%/术中体征 47.7% 中;出入量与症状表低(§4.10)。

9.4 建模与评测

Q32 有官方基准吗? 没有。社区 10 项研究(MDPI 综述)提供了事实参照;划分自建、患者级、开源(§5.2)。

Q33 死亡预测怎么做? §5.3 配方:标签 expire_flag、单元分层、检验 z 分数、稀疏体征聚合、报校准。

Q34 脓毒症标签怎么定? 儿科标准(Phoenix/pSOFA),不是 Sepsis-3;感染证据用培养+用药双条件(§5.4)。

Q35 能用 MIMIC 模型直接迁移吗? 表示可迁移,决策与校准必须重训(§5.6);四类已知失败见 §7.6。

Q36 生命体征特征怎么处理不规则采样? 归并基线 → 不规则感知模型 → 高低频分段融合三步走(§7.7)。

Q37 需要哪些儿科专属特征? 体重/体表面积、年龄分段交互、矫正月龄、生长轨迹、围产期史、手术暴露标志(§7.8)。

Q38 种族公平性分析能做吗? 不能——少数民族已归并 “Other”(§3.7);年龄/性别/地域维度可做。

Q39 评估时最容易被拒稿的点? 缺单元分层、缺校准、用成人参考范围、套成人脓毒症标准——四连击(§6.5 综述主张)。

9.5 与 MIMIC 家族

Q40 和 MIMIC-III 什么关系? Schema 师承(官方原话 follow the structure of MIMIC-III);三键同构、表名对应、语义异构(§4.9)。

Q41 和 MIMIC-IV 什么关系? 无直接版本关系;MIMIC-IV 是成人库的现代续作,PIC 独立走 v1.0→v1.1。

Q42 和 494(表型标注)什么关系? 文本标签路线对照:那边人工金标准、这边 NLP 自动抽取——联合实验见 §7.14。

Q43 MIMIC 老手上手要多久? schema 同构,半天熟悉双语列与类型差异即可开工——这正是立项设计目标。

9.6 LLM 时代

Q44 能用 ChatGPT 处理数据吗? 不能上传——PhysioNet LLM 政策禁止第三方服务(§8.3);本地部署开源模型。

Q45 LLM 能补写临床文本吗? 不能——库里没文本,用 LLM 生成叙述等于伪造数据。

Q46 LLM 有什么正当用法? 双语术语对齐评测、序列特征摘要(受控环境)、特征工程辅助(§7.5)。

9.7 收尾杂项

Q47 最常见的三个新手错误? 按真实年份过滤、把 ITEMID 当整数、把 EMR_SYMPTOMS 当全库背景(§5.8)。

Q48 引用格式? 三层:数据集 DOI + Zeng 2020 Sci Data + Pollard 2026 平台论文(§8.5)。

Q49 一句话推荐给谁? 给所有想在真实儿科重症数据上做点事、又被"没有开放儿科库"困住的人——这扇门已经开了六年。

9.7b 进阶问答

Q53 能做再入院预测吗? 部分能——468 名(3.6%)多次住院者有院内再住院;出院后再入院无数据。样本量小,结论谨慎。

Q54 住院日预测怎么做? 回归任务(均值 17.6 天、长尾分布)——对数变换或分位数回归;注意住院日是"管理变量"(受出院流程影响),临床语义弱于死亡率。

Q55 先心病队列怎么划? CICU 单元 + Q 章 ICD 交叉筛选;围术期分析配 SURGERY_INFO 的手术类型。

Q56 新生儿亚组怎么处理矫正月龄? NICU 段用"实际日龄 + 孕周"双变量;矫正月龄 = 实际月龄 - (40-孕周)/4,需孕周字段支持(P 章 ICD 或产史字段核实可得性)。

Q57 检验 z 分数的参考范围哪来? 优先临床手册/指南的年龄分段表;数据分布只做 sanity check——不要用本库分布当参考(循环论证)。

Q58 能和 eICU 联合吗? 可以但注意 eICU 是美国成人多中心——与 PIC 的人群差异比 MIMIC 更大;联合价值主要在"成人-儿童"方法学对照而非合并建模。

Q59 用药剂量分析的前提? 体重数据可得性核查(存照 H)+ 给药途径字段清洗 + 中文药名 ATC 归一;三步都过再做 mg/kg 逻辑。

Q60 SURGERY_INFO 怎么用? 手术类型/时间/麻醉方式三字段:围术期队列定义、术中窗口锚定、麻醉方式分层——v1.1.0 用户的专属红利。

Q61 检查报告事件(OR_EXAM_REPORTS)能拿到报告内容吗? 只有事件记录(91.9% 完整度);报告文本官方"未来将标准化并发布",尚未落地(存照 C)。

Q62 怎么引用本数据集最规范? 三层链(§8.5):数据集 DOI + Zeng 2020 + Pollard 2026 平台论文;用了症状表/字典表再加一句来源说明。

Q63 装载后行数对不上怎么办? 先查版本(v1.0 vs v1.1.0 文件夹混用是最常见原因),再查 CSV 解压完整性,最后对照论文 Table 1 的 v1.0 口径——DIAGNOSES_ICD 在 v1.1.0 因主要诊断字段拆分可能行数有异动。

Q64 能发布基于 PIC 的衍生数据吗? 衍生的聚合统计/模型可发布;行级再分发受 DUA 约束——参照 MIMIC 社区惯例:发布 ID 列表与代码,不发布数据本体。

Q65 中文 NLP 研究的伦理审查注意什么? 数据层已 ZUCH IRB 覆盖;本地 IRB 通常快速通道;发表时避免罕见病例可识别细节(§8.2)。

Q66 有现成的社区代码吗? 论文图代码在 github.com/Healthink/PIC;mimic-code 社区资源改名可用但需语义审查(§4.9);PIC 专属的成熟开源管线尚未形成。

Q67 十年跨度里信息系统换过吗? 官方未披露系统迁移史(与漂移研究相关的元信息缺口)——漂移分析时把无法归因的断点如实报告。

Q68 能做因果推断吗? 观察性数据的标准限制:用药-结局的因果声明需谨慎;倾向得分/工具变量方法可用但单元异质性强,建议在单元内做。

Q69 数据里有钱/保险字段吗? 支付方式类字段的存在性以实际表结构为准;中国医保结构(新农合/城镇职工等)与美国的 payer 语义不同,跨库对齐时另建映射。

Q70 想要"最新的"中国儿科 ICU 数据怎么办? PIC 冻结于 2018 收治窗口;更新的中国中心数据可关注 PhysioNet 后续发布(自贡感染库 2019-2020 等),或按 PIC 模板推动本院数据开放——后者是这条路线的终极意义。

9.8 番外:三个常见误解

Q50 “PIC 是英国 PICU 审计数据”? 混淆了 PICANet(英国审计网络,非开放 EHR)与 PIC(中国开放数据库)。排期元数据的"英国"笔误助长了这个误解(存照 A)。

Q51 “PIC 是 MIMIC-III 的子集”? 不是——两库患者零重叠(波士顿 vs 杭州),同构的是 schema 不是数据。

Q52 “双语=每行都有英文翻译”? 字典层全双语;数据行的翻译覆盖以术语在字典中的登记为准——未登记术语的行可能只有中文,装载后抽查(§3.4)。
Q71 装 MySQL 还是 PostgreSQL? 都官方支持;PostgreSQL 可 gzip 直读免解压,Linux 服务器首选;Windows 用 MySQL 路径(7zip 解压 + define.sql)。

Q72 数据集会闭库吗? PhysioNet 永久 DOI 机制下不会;文档站持续在线;"冻结"指内容不再增长,不是下线。

Q73 最后一条建议? 把 §3.7 的三条去标识化规则当作"这个库的世界观"——先接受它(未来日期、字符 ITEMID、天级年龄),再写第一行代码。
Q74 本库与 PICANet/VPS 注册库最大的互补点? 注册库有广度(多中心)无深度(无时序检验用药);PIC 有深度无广度(单中心全细节)——多中心验证用注册库队列定义、机制研究用 PIC,是标准的两级研究设计。
Q75 想研究中文临床语言学,从哪张表开始? 双语字典表(832 化验项 + 466 项目对照)是最干净的起点——人工翻译已核对;进阶再用 EMR_SYMPTOMS 的症状双语词表(含极性标注),最后是"家庭成员症状混淆"这类句式研究——那是中文家庭叙事文化的语言学样本(§4.3)。

§10 附录:存照、引文与档案

§8.6 与同门条目的合规协议对照

PIC 与同批三份数据集的伦理/合规协议并排,可看出 MIMIC 家族的"治理方言":

维度 PIC MIMIC-IV(492) Nosocomial(493) Phenotype(494)
数据层 IRB ZUCH,豁免知情同意 BIDMC/MIT,豁免 派生(上游覆盖) 派生(上游覆盖)
访问认证 培训 或 GCP(双轨) CITI 课程 MIMIC-III 资格复用 MIMIC-III 资格复用
审批周期 约 3 个工作日 数日-数周 随 MIMIC-III 随 MIMIC-III
身份重编号 随机不可逆(匿名化) 随机不可逆 沿用 MIMIC-III ID 沿用 MIMIC-III ID
日期策略 向前平移 50-100 年 向后随机偏移(保留间隔) 无独立日期(快照序列) 无日期(索引表)
文本处理 中文文本不发布(NLP 替代) 英文文本直接发布 结构化快照 文本不发布(标注索引)

PIC 的"向前平移"(2060-2120)与 MIMIC 的"向后偏移"方向相反但逻辑同源——都保留患者内时序、抹除真实日历。把四份协议放在一起读,是理解"去标识化没有唯一正确答案、只有透明声明的设计选择"的最快方式。

10.1 口径存照

存照 A(来源勘误):生产排期元数据将本数据集中文名写为"英国儿科重症监护数据库 (PICU)";官方来源为浙江大学医学院附属儿童医院(中国杭州)。英国 PICANet 为另一体系(审计注册库,非开放 EHR)。本条目全篇以官方为准。

存照 B(住院数口径):论文正文"Paediatric-specific data features"段写 13,499 distinct hospital admissions,Table 1/2 均为 13,449——原文自相矛盾。本条目采用 Table 口径 13,449。

存照 C(表名与表数):诊断字典表名论文写 D_ICD_DIAGNOSES、PhysioNet 页面写 D_DIAGNOSES_ICD——以实际装载文件为准;论文 Table 1 的 16 表为 v1.0 口径,v1.1.0 新增 SURGERY_INFO(官方 Release Notes 确认),实际表数 17;OR_EXAM_REPORTS 的报告文本"未来将标准化并发布"截至本条目撰写未见发布。

存照 D(ICU 死亡 vs 院内死亡):正文院内死亡率 7.1%、Table 2 合计 7.2%(971 例)——四舍五入差异;ICU 内死亡 6.9%(955 例)另计;两者差 16 例 = 出院后院内其他单元死亡。

存照 E(二手综述):MDPI Bioengineering 13(9):978(2026)的"10 项研究、四大基质特性、三条主张"与本条目 §6.5-6.6 的转述为二手综合;其 13,944 ICU stays 与论文 13,941 不一致,弃用。综述原文结论请以其 DOI 为准引用。

存照 F(翻译覆盖):双语字典的人工翻译覆盖规模(术语总数、复核轮次)官方未公布;数据行层面的翻译覆盖率未见统计——使用前抽查。

存照 G(家庭偏移):同一家庭多名患儿的日期偏移量是否一致官方未说明(§8.2 残余风险)。

存照 H(体重字段):体重数据的字段位置与测量频率官方未单独说明;本条目"体重可从 CHARTEVENTS 获得"的表述基于儿科 ICU 常规记录实践与论文 fluid balance 上下文,使用前以实际表结构核实。

存照 I(多次住院口径):468 人(3.6%)多次住院为论文正文口径;其"多次"的阈值定义(≥2 次)官方未逐字说明,本条目按上下文理解为 >1 次住院。

存照 J(系统迁移史):2010-2018 间 ZUCH 信息系统(EMR/LIS/AIMS)的版本迁移与设备更换记录官方未公布——时间漂移研究的归因分析存在元信息缺口。

存照 K(保险字段):支付方式/保险类型字段的存在性与编码官方页面与论文均未列明——公平性分析的前提核查项。

10.2 引文清单

  1. Li, H., Zeng, X., & Yu, G. (2020). Paediatric Intensive Care database (version 1.1.0). PhysioNet. https://doi.org/10.13026/32x9-wv38. RRID: SCR_007345
  2. Zeng, X., Yu, G., Lu, Y., Tan, L., Wu, X., Shi, S., Duan, H., Shu, Q., & Li, H. (2020). PIC, a paediatric-specific intensive care database. Scientific Data, 7, 14. https://doi.org/10.1038/s41597-020-0355-4(PMID 31932583, PMCID PMC6957490)
  3. Johnson, A. E. W., Pollard, T. J., Shen, L., et al. (2016). MIMIC-III, a freely accessible critical care database. Scientific Data, 3, 160035. https://doi.org/10.1038/sdata.2016.35
  4. Pollard, T. J., et al. (2018). The eICU Collaborative Research Database. Scientific Data. https://doi.org/10.1038/sdata.2018.178
  5. Czaja, A. S. (2016). Children Are Not Just Little Adults. Pediatric Critical Care Medicine. https://doi.org/10.1097/PCC.0000000000000597
  6. Pollard, T., Moody, B. E., Lehman, L., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health. https://doi.org/10.1038/s44360-026-00096-z
  7. MDPI Bioengineering (2026). Machine Learning on the Pediatric Intensive Care (PIC) Database: PIC-Powered Prediction. Bioengineering, 13(9), 978.(二手综述,存照 E)
  8. ZUCH PIC 官方文档站. http://pic.nbscn.org(引用统计截至 2025-05)
  9. PIC 论文图与代码. https://github.com/Healthink/PIC
  10. PhysioNet (2025-09-24). Use of MIMIC Data with Large Language Models and Online Services.(官方政策公告)

10.3 系列条目关系

  • 上游师承:mimiciv(rid 592)/ MIMIC-III(491)——PIC 的 schema 与治理协议模板;
  • 平行对照:phenotype-annotations-mimic(rid 594)——人工金标准 vs NLP 自动抽取的标签谱系两端;nosocomial-risk-mimic(rid 593)——MIMIC 派生工程的第三种姿势;
  • 生态位:全球唯一"0-18 岁全谱 + 关系型 EHR 深度 + 国际开放"的儿科 ICU 数据资产;
  • 待续:若官方发布 v1.2(检查报告文本标准化)或 PIC-MIMIC 联合对齐资源,本条目需增补。

10.4 变更日志

  • 2026-09-20:初版发布(v1.1.0 口径;基于 PhysioNet 官方页 + Scientific Data 2020 论文(Europe PMC 全文)+ 官方文档站三方交叉核查;8 条存照落档;批次元数据"英国"笔误已勘误入 §0/存照 A)。本篇为批次 4(order 486-495,EHR/ICU 主题)收官第 10 篇。

本条目为千方病案医数集 AI-Ready 系列第 495 号条目,批次 4(EHR/ICU 主题,order 486-495)收官篇。
欢迎对照同门条目(mimiciv / nosocomial-risk-mimic / phenotype-annotations-mimic)阅读,构成 MIMIC 生态的完整方法学光谱。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集