信息速览
Paediatric Intensive Care database — AI-Ready 数据集百科
一句话:这是 MIMIC 方法论第一次成建制走出波士顿的成果——浙江大学医学院附属儿童医院把 2010-2018 年五个 ICU、12,881 名危重患儿、约 1,900 万行临床记录,按 MIMIC-III 的表结构做成了首个免费开放的英汉双语临床数据库。它证明了一件事:重症数据开放这件事不分国界、不分语种、不分成人还是儿童。
INFOBOX
| 属性 | 值 |
|---|---|
| 官方名称 | Paediatric Intensive Care database(PIC) |
| 发布方 | PhysioNet(与 ZUCH 团队联合) |
| 版本 | v1.0.0(2019-11-26)→ v1.1.0(2020-11-12,当前) |
| DOI | 10.13026/32x9-wv38 |
| RRID | SCR_007345 |
| 官方论文 | Zeng, Yu, Lu et al., Scientific Data 7:14 (2020), DOI 10.1038/s41597-020-0355-4 |
| 数据来源 | 浙江大学医学院附属儿童医院(ZUCH,杭州)——1900+ 床、年门急诊 300 万+ |
| ICU 构成 | GICU / PICU / SICU / CICU / NICU 共 119 张重症床 |
| 数据期 | 2010-2018 |
| 规模 | 12,881 患者 / 13,449 住院 / 13,941 ICU 住留 |
| 核心表 | CHARTEVENTS 228 万行;LABEVENTS 1,009 万行;PRESCRIPTIONS 126 万行 |
| 特色表 | SURGERY_VITAL_SIGNS(术中每 5 分钟);EMR_SYMPTOMS(NLP 症状 +/−) |
| 双语工程 | 首个免费英汉双语临床数据库;字典表 + _cn 后缀;ICD-10 7 位本地扩展 |
| 年龄 | 0-18 岁(中位 0.8 岁;NICU 以天计) |
| 死亡率 | 院内 7.1%(971 例);ICU 内 6.9%(955 例) |
| 访问级别 | Credentialed(培训/GCP + DUA;审批约 3 个工作日) |
| 文档站 | pic.nbscn.org(截至 2025-05 引用超 100 篇) |
| 适合任务 | 儿科 ML(死亡/脓毒症/器官功能障碍)、双语 NLP、跨国方法学对照 |
§0 E-E-A-T 信任声明与速览
条目名勘误(重要):本条目在生产排期表中的中文名被写成"英国儿科重症监护数据库 (PICU)"——这是错的。官方 Paediatric Intensive Care database 来自中国的浙江大学医学院附属儿童医院(Children’s Hospital, Zhejiang University School of Medicine),而非英国。英国的 PICU 数据生态(如 PICANet 审计网络)是另一套体系,且非 PhysioNet 开放数据。本条目一律以官方名称与事实为准,勘误记录见存照 A。
信任声明:本条目所有数字经两处一手来源交叉核查——PhysioNet 官方条目页(v1.1.0)与 Zeng et al. Scientific Data 2020 论文(PMID 31932583)。论文正文与表格间的口径差异(住院数 13,499 vs 13,449)不做掩盖,如实存照。二手引用(2026 年 MDPI 综述)单独标注,不与一手数字混排。
0.1 一分钟版本
- 这是什么:全球首个免费开放的英汉双语临床数据库;MIMIC-III 结构的儿科专属移植;
- 多大:12,881 患儿、13,941 次 ICU 住留、LABEVENTS 一千零九万行、16 张关系表(v1.1.0 再增手术信息表);
- 哪来的:浙江大学医学院附属儿童医院五个 ICU(综合/儿科/外科/心脏/新生儿),2010-2018;
- 在哪拿:PhysioNet(DOI 10.13026/32x9-wv38),Credentialed 访问,审批约 3 个工作日;
- 最独特的三件事:双语字典工程、术中 5 分钟生命体征独立表、NLP 症状表(91.9% 准确率且方法学公开);
- 最大的坑:日期被平移 50-100 年(住院发生在"2060-2120 年");ITEMID 是字符不是整数。
0.2 十个数字记住它
| # | 数字 | 含义 |
|---|---|---|
| 1 | 12,881 | 去重患儿数 |
| 2 | 13,941 | ICU 住留次数 |
| 3 | 0.8 岁 | 年龄中位数(成人库 MIMIC-III 是 60.6 岁) |
| 4 | 10,094,117 | LABEVENTS 行数(最大表) |
| 5 | 2,278,978 | CHARTEVENTS 行数 |
| 6 | 5 分钟 | 术中生命体征采样间隔(SURGERY_VITAL_SIGNS) |
| 7 | 7.1% | 院内死亡率(971 例) |
| 8 | 91.9% | NLP 症状抽取准确率(3,410 症状双人核对) |
| 9 | 50-100 年 | 日期向未来平移的年数 |
| 10 | 3 个工作日 | 访问审批周期 |
0.3 与同门条目的关系图谱
- mimiciv(rid 592)/ MIMIC-III(491):PIC 的 schema 师承 MIMIC-III(官方原话:“follows the structure of MIMIC-III”)。PATIENTS/ADMISSIONS/ICUSTAYS 三表骨架、CHARTEVENTS/LABEVENTS 命名一一对应——会查 MIMIC-III 的人几乎零成本上手 PIC;
- phenotype-annotations-mimic(rid 594):临床文本标签的两种路线对照。494 是人工双人金标准标注;PIC 是 NLP 自动症状抽取(91.9% 准确率、错误类型公开)——两份数据集合起来是"标注经济学"的完整教材;
- nosocomial-risk-mimic(rid 593):同为 MIMIC-III 派生的下游工程,那边做标签工厂,这边做全库双语化——MIMIC 生态的三种"衍生姿势";
- MIMIC-III 的 NICU 新生儿子集是 PIC 最接近的对照区——但 PIC 是全库儿科(0-18),且新生儿占比与病种谱完全不同。
0.4 里程碑定位:中国开放重症数据的先声
PIC 于 2019-11-26 上线 PhysioNet(v1.0.0),是中国大型三甲医院第一次把整库 ICU 数据按国际开放标准发布。它之后,中国中心的 PhysioNet 数据集陆续出现(如 2022 年自贡四院感染重症库、2023 年某三级医疗中心 Chinese critical care database 等)——PIC 是这条路上的先行者。截至 2025 年 5 月,官方文档站显示引用已超 100 篇。2026 年 MDPI Bioengineering 的叙事综述把它称为"儿科 ICU 机器学习研究的事实基底(de facto substrate)"。
0.5 证据等级声明
规模与表行数:论文 Table 1/2 一手口径;年龄/死亡率/性别:论文 Table 2/3 与正文;访问流程与双语工程:PhysioNet 页面与论文 Methods 互核;二手综述结论明确标注"MDPI 2026 综述";凡官方未给数字处(如表级完整度之外的缺失机制细节)注明缺口,不做估算。
0.6 谁该用、谁不该用
该用:做儿科 ML 的人(死亡预测、脓毒症、器官功能障碍——现有 10 项研究已趟过路);做双语/跨语言临床 NLP 的人(唯一的英汉双语 ICU 语料);做方法学迁移研究的人(成人模型→儿科校准的天然试验田);医工交叉课程(MIMIC 结构教学的最佳第二例)。
不该用:想要高频床旁监护波形的人(术中之外没有逐分钟数据——用 vitaldb 或 HiRID);想要英文自由文本的人(中文原文未发布,只有症状结构表);想做成人-儿童直接迁移而不管校准的人(请先读 §7.6 的失败方向);只认 ICD-9 的老管线(这里是 ICD-10 + ICD-O-3)。
§1 数据集概览
1.1 出身:一次跨洋的 schema 移植
PIC 的立项逻辑写在论文 Background 里,三段论非常清晰:其一,MIMIC 系列十余年证明了开放重症数据的价值;其二,eICU 补上了多中心成人数据,但所有这些库都缺 0-18 岁的完整儿科数据——MIMIC-III 只有 NICU 新生儿,因为 BIDMC 根本没有儿科 ICU;其三,“儿童不是缩小版成人”(Children are not just small adults)——疾病谱、发育阶段、药代动力学、治疗反应全部不同,成人证据不能直接搬用,儿科证据需要儿科数据。于是 ZUCH 团队(临床信息学团队 + 国家儿童健康与疾病临床研究中心)按 MIMIC-III 的表结构重造了整个提取管线。
1.2 数据来源医院:为什么是浙大儿院
ZUCH 的三个硬指标解释了为什么它能做成这件事:规模——1900+ 床、年门急诊超 300 万人次、浙江省最大综合性儿科中心;网络——接收全省 11 个地市转诊的危重患儿,病例谱覆盖完整;设施——5 个 ICU 共 119 张重症床(GICU 综合/PICU 儿科/SICU 外科/CICU 心脏/NICU 新生儿),且院级信息系统已运行十年以上,数据连续性有保障。它同时是中国国家儿童健康与疾病临床研究中心——"临床研究中心"的制度身份让数据治理与 IRB 流程有落点。
1.3 六大信息系统的数据汇聚
官方 Methods 列出了数据提取的六个来源系统:医院电子病历(EMR)、实验室信息系统(LIS)、计算机化医嘱录入(CPOE)、护理信息系统、麻醉信息管理系统(AIMS)、各检查科室报告系统(放射/超声/心电图/病理等)。这个清单就是 PIC 的数据血缘地图——SURGERY_VITAL_SIGNS 表的 5 分钟高频数据正是来自 AIMS,这是 PIC 相对 MIMIC-III 的一个反向优势(MIMIC-III 的床旁监护是约 1 小时粒度)。
1.4 时间覆盖与规模叙事
2010-2018 约九年的窗口,产出 12,881 患儿 / 13,449 住院 / 13,941 ICU 住留。与 MIMIC-III(约 5 万患者/4.5 万+ 住院)比,规模差约 4 倍——论文自述局限第一条就是这个。但注意结构差异:PIC 的 13,941 次 ICU 住里 NICU 占比可观(新生儿),而多次住院患者只有 468 人(3.6%)——这是一个"一次住院为主"的人群,与成人 ICU 的再入院模式不同,建模时的患者级聚类修正压力更小。
1.5 五个 ICU 的画像
论文 Table 2/3 给出的分单元画像(平均年龄/院内死亡率):
| 单元 | 平均年龄 | 院内死亡率 | 特色 |
|---|---|---|---|
| GICU 综合ICU | 3.8 岁(0.4-6.3) | 15.3% | 全院最高死亡率的综合兜底单元 |
| PICU 儿科ICU | 3.6 岁(0.5-5.7) | 9.8% | 儿科专属重症 |
| SICU 外科ICU | 3.2 岁(0.4-4.9) | 2.0% | 围术期为主 |
| CICU 心脏ICU | 2.5 岁(0.5-3.1) | 2.0% | 先心病围术期 |
| NICU 新生儿ICU | 14.5 天 | 7.5% | 以"天"计龄的特殊单元 |
两个直接推论:其一,GICU 15.3% vs SICU 2.0% 的 7 倍差提示单元分层是任何死亡模型的必做项;其二,NICU 的"年龄 14.5 天"宣告了儿科数据的独特时间语义——在 MIMIC-III 里 anchor_age=91 是老人归并,在 PIC 里年龄字段要有小数甚至天数,标准成人管线的年龄特征工程必须重写。
1.6 病种谱:先天性疾病是第一主角
诊断编码的 ICD-10 章节分布前三:Q00-Q99 先天畸形/变形/染色体异常 25.4%;P00-P96 围产期特有情况 14.1%;J00-J99 呼吸系统疾病 10.3%。这个谱与成人 ICU(循环/呼吸/感染为主)几乎不重叠。对 ML 建模的含义:诊断编码在儿科数据里是强特征(先天畸形的结构性强信号),而成人库里 ICD 常常只是"弱标签"。CICU 2.0% 的低死亡率背后是先心病手术的成熟,而 GICU 的高死亡率对应的是兜底收治的复杂病例——病种谱直接写在了单元画像里。
1.7 双语:为什么这是里程碑而非便利贴
官方强调 PIC 是首个免费开放的英汉双语临床数据库。理解它的分量需要知道背景:中文临床术语没有像 LOINC/ICD 那样与国际对齐的通用翻译层,国际研究者用不了中文库。PIC 的解法(§3.4 详述)是分层翻译策略:有国际标准编码的术语(ICD-10、LOINC)按标准英文版对齐;没有的由三位作者人工翻译并复核;所有表保留中文原文 + 英文对应,中文列加 _cn 后缀。原文永远在场——这是双语工程区别于"翻译覆盖"的关键设计,也保留了研究中文临床语言学的原始材料。
1.8 版本简史
- v1.0.0(2019-11-26):首发 16 表;
- v1.1.0(2020-11-12):基于用户反馈的升级——DIAGNOSES_ICD 增加主要诊断 vs 其他诊断的区分;SURGERY_VITAL_SIGNS 增加 SpO2、EtCO2、ECG ST 段;新增 SURGERY_INFO 表(手术名称/时间/麻醉方式);字典表更新;
- 发布物包含 v1.1.0 全量文件夹 + update_to_v1.1.0 增量文件夹(含迁移 SQL 示例)——老用户不用重下全库。
注意一个口径细节:论文 Table 1 的 16 表清单是 v1.0 口径(不含 SURGERY_INFO),v1.1.0 之后实际表数 +1(存照 C)。
1.9 团队与资助
论文作者 9 人:共同一作 Zeng X / Yu G / Lu Y(临床信息学 + 生物医学工程),通讯作者 Shu Q(Qiang Shu,临床)与 Li H(Haomin Li,信息学,PhysioNet 页面第一署名)。资助三项:国家自然科学基金 81871456;国家科技支撑计划 2016YFC0901905 与 2016YFC0901703;浙江省高层次创新型卫生人才培养工程 2016-6。COI:无。论文图代码开源在 github.com/Healthink/PIC。特别致谢 MIMIC 项目团队——“本项目许多协议基于其制定”。
1.10 用户画像:四类人各取所需
- 儿科 ML 研究者:直接上手死亡/脓毒症/器官功能障碍建模,10 项已发表研究提供了标签构造与特征工程的参照系(§6.5);
- 双语 NLP 研究者:EMR_SYMPTOMS 表 + 双语字典是研究中文临床术语对齐的唯一开放资源;
- 成人 ICU 研究者:把 PIC 当"分布外测试集",检验成人模型的儿科泛化(先读 §7.6 的校准警告);
- 数据工程教学者:MIMIC-III schema 的第二实现是最好的"同构异源"教学案例——表结构相同、语义全变(年龄、ITEMID 类型、日期偏移)。
§1.11 名词速查表:十秒扫懂本章术语
| 术语 | 一句话解释 |
|---|---|
| PIC | Paediatric Intensive Care database,本条目主体 |
| ZUCH | 浙江大学医学院附属儿童医院,数据来源单中心 |
| GICU/PICU/SICU/CICU/NICU | 综合/儿科/外科/心脏/新生儿五个 ICU |
| AIMS | 麻醉信息管理系统——术中 5 分钟体征的来源系统 |
| ITEMID | 项目标识符;PIC 中为字符型(MIMIC 为整数) |
_cn 后缀 |
中文数据列的命名约定(保留中文原文的双语设计) |
| ICD-10 7 位扩展 | 本地诊断编码比标准 5 位更细,中文诊断更具体 |
| ICD-O-3 | 肿瘤形态学编码,与 ICD-10 并行使用 |
| EMR_SYMPTOMS | NLP 抽取的症状表(+/− 极性 + 时间) |
| SURGERY_VITAL_SIGNS | 术中每 5 分钟生命体征表(v1.1.0 增 SpO2/EtCO2/ST) |
| 日期平移 50-100 年 | 去标识化设计:住院时间显示为 2060-2120 年 |
| GCP 认证 | 中国《药物临床试验质量管理规范》培训——访问认证的双轨之一 |
| DUA | 数据使用协议:禁再识别 + 协作研究原则 |
| phoenix / pSOFA | 儿科脓毒症/器官功能障碍评分体系(勿用成人 Sepsis-3) |
| z 分数化 | 检验值按年龄分段参考范围标准化——儿科特征工程核心动作 |
§2 医学与科学背景
2.1 "儿童不是缩小版成人"的数据含义
论文引用 Czaja 2016(“Children Are Not Just Little Adults”)作为方法学宣言。这句话落到数据上有四层含义:生理参数不同——生命体征正常范围随年龄漂移(新生儿心率 100-180 vs 学龄儿童 60-100),报警阈值与异常检测不能复用成人规则;药代动力学不同——剂量按体重/体表面积计算,PRESCRIPTIONS 表里的剂量字段必须结合体重/年龄解读;疾病谱不同——先天性疾病 25.4% 当主角,成人库的第一主角(冠心病)在儿科几乎退场;发育时间性——年龄不是协变量而是"发育阶段的代理变量",且以月/天为单位变化。
2.2 NICU 的时间语义:以天计龄
NICU 患儿平均年龄 14.5 天——这个数字意味着 PIC 的年龄字段在 NICU 段的有效粒度是"天"甚至"周(孕周)"。三条工程纪律:任何"年龄 ≥ x 岁"的过滤规则在 NICU 段会漏掉整群患儿;孕周/出生体重相关的围产期特征(P 章 ICD)在 NICU 分析里权重最高;生长曲线(百分位)是儿科特有的纵向特征类型——身高体重不是静态协变量而是发育轨迹。
2.3 围术期数据流:AIMS 的 5 分钟世界
SURGERY_VITAL_SIGNS 表(121.6 万行)来自麻醉信息系统,术中每 5 分钟一测,v1.1.0 又加入 SpO2 与 EtCO2 和 ST 段。这是 PIC 里唯一的高频生理流,三个用法:围术期低血压/缺氧事件的预测与回放(MDPI 综述里已有研究做围术期并发症);把术中队列(SICU/CICU)与非术中队列的生理基线对齐;作为"高频对照"评估 CHARTEVENTS 里护士记录的稀疏性。注意它的完整度只有 47.7%(Table 4)——只有手术患者的手术时段才有,别当全库背景流用。
2.4 液体平衡:儿科剂量学的命门
INPUTEVENTS(26,884 行,每日晨计算入量)与 OUTPUTEVENTS(39,891 行,出量)加起来不足 7 万行,完整度 41.1%/11.7%——但别因行数小而忽视:液体管理是儿科重症的核心命题(儿童液体耐受窗窄,脱水与过载都是生死线)。官方论文把 fluid balance 写进摘要清单,说明这是设计内特性而非残留。使用时的纪律:低完整度 + 非随机缺失(外科患者更可能记录)= 缺失机制分析必须先行。
2.5 微生物学与抗菌药物:感控研究面
MICROBIOLOGYEVENTS(183,869 行,完整度 89.7%)含培养与药敏。儿科感控研究的富矿:新生儿败血症的病原谱、ICU 耐药谱的时间演化、抗菌药物(PRESCRIPTIONS 126 万行)与药敏的匹配分析。注意中文药名的翻译层——抗菌药物的中英文对照在字典表里,跨语言合并药物类别时以 ATC 分类的思路自建映射更稳。
2.6 死亡数据的口径
PIC 只有院内死亡记录(hospital mortality 7.1%),没有 MIMIC-III 那样的社保死亡链接(MIMIC 可做出院后长期生存)。三条纪律:论文间比较"死亡率"时先分清院内 vs ICU 内 vs 全因;出院后生存分析在 PIC 上不可做;死亡是"出院状态"字段的一部分,与出院类型(自行离院/转院)编码在同一张表,建模时注意互斥性检查。
2.7 ICD-10 + ICD-O-3 的编码体系
PIC 用 ICD-10(诊断)+ ICD-O-3(肿瘤形态学),不是 MIMIC-III 的 ICD-9。三层含义:跨库映射需要 9→10 的转换表(有现成工具但儿科章节映射有坑——P 章与 Q 章在 ICD-9 里结构不同);本地 7 位扩展(§3.4)让"中文诊断更具体"——做表型提取时中文列的信息量更大;ICD-O-3 的存在提示肿瘤病例可用形态学轴做更细的队列划分。
2.8 与成人库的年龄对照:一张图两个世界
论文 Fig. 2 是 PIC 与 MIMIC-III 的年龄分布对比:MIMIC-III 中位 60.6 岁(Q1-Q3 42.1-74.1),PIC 中位 0.8 岁(Q1-Q3 0.1-3.5)。两个分布几乎不重叠——这就是"证据不能直接互搬"的统计注脚。方法学上这张图也是绝佳的教学素材:同样的 ICU 数据概念,年龄这一个变量就能让跨库迁移变成分布外问题。
2.9 儿科质量改进与国际共享的立项初衷
官方摘要列了四类支持用途:机器学习算法、临床决策支持工具、质量改进、国际数据共享。第三类(质量改进)在中国语境里最稀缺——单中心库的最大价值恰恰是院内纵向对照:同一个 ICU 十年间的死亡率/住院日/用药模式漂移(MDPI 综述称其为 single-center temporal drift,把它当风险,其实也是质量改进的天然实验设计)。第四类(国际共享)则由双语工程承载。
2.10 概念小结:PIC 的五张面孔
- MIMIC 的儿科镜像:结构同源、语义异构;
- 双语数据库:翻译工程的教科书;
- 围术期高频库:AIMS 5 分钟流是其独有的时间维度;
- NLP 症状库:中文临床文本的结构化出口(91.9% 准确率的诚实基准);
- 单中心九年纵向库:质量改进与时间漂移研究的天然设计。
§2.11 本条目的证据层级
本条目信息的分级与使用建议:
| 层级 | 来源 | 用于 |
|---|---|---|
| L1 一手-官方页面 | PhysioNet v1.1.0 条目页(DOI/版本/访问/双语方案/去标识) | 引用、合规决策 |
| L1 一手-论文 | Zeng et al. Sci Data 2020(Table 1-4 全部数字、NLP 审计、Methods) | 规模引用、方法学 |
| L1 一手-文档站 | pic.nbscn.org(引用统计、临床资源介绍) | 生态状态描述 |
| L2 二手-综述 | MDPI Bioengineering 2026(10 项研究综合、基质特性) | 趋势讨论(标注二手) |
| L3 推断 | 本条目的工程建议、成本核算、课程设计 | 操作参考(标注为本条目立场) |
冲突裁决规则:L1 内部冲突如实存照(住院数 13,449/13,499、表名两写法、死亡率四舍五入);L2 与 L1 冲突时从 L1(如 13,944 vs 13,941);L3 不与 L1/L2 混排。
§3 数据集规格
3.1 16 表全家福(v1.0 口径)与行数总账
论文 Table 1 的完整行数(这是全库的身家清单,直接背下来):
| 表 | 行数 | 语义 | 完整度 |
|---|---|---|---|
| PATIENTS | 12,881 | 患者主档 | — |
| ADMISSIONS | 13,449 | 住院主档 | — |
| ICUSTAYS | 13,941 | ICU 住留 | — |
| CHARTEVENTS | 2,278,978 | 生命体征/护理观察 | 79.7% |
| LABEVENTS | 10,094,117 | 检验结果 | 93.9% |
| PRESCRIPTIONS | 1,256,591 | 医嘱用药 | 51.5% |
| SURGERY_VITAL_SIGNS | 1,216,011 | 术中每 5 分钟生命体征 | 47.7% |
| EMR_SYMPTOMS | 402,142 | NLP 症状(+/−) | 6.7% |
| MICROBIOLOGYEVENTS | 183,869 | 微生物培养与药敏 | 89.7% |
| OR_EXAM_REPORTS | 183,809 | 检查报告事件 | 91.9% |
| OUTPUTEVENTS | 39,891 | 出量 | 11.7% |
| INPUTEVENTS | 26,884 | 每日晨计算入量 | 41.1% |
| DIAGNOSES_ICD | 13,365 | ICD-10/ICD-O-3 诊断 | 99.4% |
| D_ICD_DIAGNOSES | 25,378 | 诊断字典 | — |
| D_LABITEMS | 832 | 化验项目字典 | — |
| D_ITEMS | 466 | 项目字典 | — |
合计约 1,870 万行。v1.1.0 再加 SURGERY_INFO(手术名称/时间/麻醉方式)。三条速读:LABEVENTS 一表独大(占一半以上行数)——儿科的检验密度远高于体征记录密度;DIAGNOSES_ICD 完整度 99.4% 是全库最可靠的强特征源;EMR_SYMPTOMS 完整度 6.7% 最低——它只覆盖有病程记录的子集,千万别当全库背景表。
3.2 三表骨架与 MIMIC-III 的同构性
PATIENTS / ADMISSIONS / ICUSTAYS 三表均含 SUBJECT_ID、HADM_ID、ICUSTAY_ID,与 MIMIC-III 的三键体系完全同构。数据整合与清洗也按同一套逻辑:官方 Methods 明确"使用 SUBJECT_ID 和 HADM_ID(出现在 ADMISSIONS、PATIENTS、ICUSTAYS 表中)进行数据整合与过滤",并清理了"就诊年份为 1900"这类不可能值与中文字符显示为数字的错误。对 MIMIC-III 老手的心智迁移成本接近零——这正是 PIC 立项时明确的设计目标(官方:“allowing researchers to leverage their experience with MIMIC-III”)。
3.3 DAIMS 数据AI就绪度评估
按本系列 DAIMS 八维度打分(每项 0-1,总 8):
| 维度 | 得分 | 评语 |
|---|---|---|
| 文档完备性 | 0.9 | PhysioNet 页面 + Sci Data 论文 + pic.nbscn.org 文档站三层文档;扣分项:文档站部分内容偏旧 |
| 机器可读性 | 0.8 | 标准关系 schema + SQL 装载脚本(MySQL/PostgreSQL 双方言);ITEMID 字符类型需适配 |
| 标签质量透明度 | 0.8 | NLP 症状表给了双人核对的准确率区间与错误分类;日期偏移规则透明 |
| 可访问性 | 0.9 | Credentialed 但流程轻(3 个工作日)、支持 GCP 认证(对中国研究者友好) |
| 许可清晰度 | 0.8 | DUA 明确禁再识别;具体许可证名称页面未列明 |
| 格式标准化 | 0.8 | CSV + 标准 SQL;双语双列方案是对标准化的补充而非破坏 |
| 评测协议完备性 | 0.6 | 无官方基准任务与划分;社区 10 项研究提供了事实参照 |
| 生态可持续性 | 0.8 | 永久 DOI + RRID + 文档站;更新止于 v1.1.0(2020-11),活跃度下降 |
| 合计 | 6.4 / 8 | 结构与文档的"移民红利"型选手——师承 MIMIC 让它开箱即用;短板在评测协议与更新停滞 |
对照同批:mimiciv 492 约 7.2、nosocomial 493 7.8、phenotype-annotations 494 6.5。PIC 的 6.4 里含"翻译工程"的隐性加分——若按纯技术维度它可能更低,但双语创新值得单列。
3.4 双语工程的完整解剖
官方双语方案的四层结构:
- 有国际编码的术语走标准:ICD-10 诊断的英文直接用标准编码英文版;化验项目有 LOINC 码的用 LOINC 英文版——这类翻译零人工、零争议;
- 无编码术语人工翻译:由三位作者(X.Z.、Y.L.、H.L.)翻译并相互复核——覆盖率与术语表规模官方未给出,但从 D_LABITEMS(832 项)/ D_ITEMS(466 项)的字典规模看,人工翻译的量级是可控的;
- 原文保留原则:所有表保留原始中文术语 + 英文对应——中文列统一加
_cn后缀。这条"原文在场"原则让翻译层可审计、可替换(未来若有更好的翻译可以重做而不破坏原始数据); - 编码粒度的不对称:本地 ICD-10 是 7 位扩展(标准 5 位),中文诊断比英文诊断更具体——例如 7 位码可携带更细的解剖部位/形态学信息。这对表型定义是增益(中文列信息量大),对跨语言对齐是挑战(英文侧丢失精度)。
工程提醒:ITEMID 是字符字段(MIMIC-III 是整数)——从 MIMIC 迁移过来的脚本里所有 ITEMID 的类型断言、JOIN 条件、索引定义都要改。
3.5 访问流程:全球研究者的最低门槛设计
PIC 的访问设计有三处体贴:认证双轨——完成国际通行的人体受试者培训(含 HIPAA)或中国的 GCP 认证(Good Clinical Practice)——后者让中国临床研究者不用先去考 CITI;审批快速——官方明示约 3 个工作日;MIMIC 老手无缝——“已获准访问 MIMIC-III 的研究者对此流程熟悉”。DUA 的两条硬约束:禁止任何再识别尝试;遵循"协作研究原则"(collaborative research)——后者为跨国合作提供了正当性框架,也是许多中国数据集 DUA 的特色条款。
3.6 装载手册(MySQL 与 PostgreSQL 双方言)
官方提供两种数据库的完整装载脚本:
# PostgreSQL(推荐路径,免解压)
# 1. 下载全部 gzip CSV + SQL 脚本
# 2. 创建 schema 并设搜索路径
psql -c "CREATE SCHEMA pic; SET search_path TO pic;"
# 3. 建表并直读 gzip 装载
psql -f 1-create-tables-load-data-gzip.sql
# 4. 索引与约束
psql -f 2-index.sql
psql -f 3-constraints.sql
MySQL 路径:解压(gzip/7zip)→ 建 schema “pic” → define.sql(建表+装载)→ index.sql + constraints.sql。装载后第一小时:跑行数对账(对照 §3.1 的 Table)、检查日期字段的"未来年份"分布(§3.7)、抽样验证双语列的完整性。
3.7 去标识化的三条规则(每条都是工程参数)
- 日期平移 50-100 年:所有日期向未来平移随机患者特异性偏移,住院时间落在约 2060-2120 年。同患者同一常量 → 患者内时序、住院间隔、治疗时间线全部保留;跨患者时序不可比(两条线无法对齐到同一"真实年份")。保留项:一天中的时刻、星期几、大致季节(春 3-5 月/夏 6-8/秋 9-11/冬 12-2)。工程纪律:任何按年份过滤的代码都是 bug;季节分析用月份而非日期;"住院年份"字段只能用于偏移后空间的相对排序;
- ID 随机重编号:SUBJECT_ID/HADM_ID/ICUSTAY_ID 均为随机唯一编号,原始标识符不留存,不可逆——官方定性为匿名化(而非仅去标识);
- 种族的小样本归并:人口极少数民族替换为 “Other”——做种族分层分析时把它当"剩余类"而非真实类别。
另有第四条儿科专属:全部患者 <18 岁,不存在 MIMIC-III 的 anchor_age=91 归并问题——年龄字段可用原值(但注意 NICU 的天级粒度,§2.2)。
3.8 机器可读元数据速查(AI-Ready 属性)
| 属性 | 值 |
|---|---|
| 语言 | 英汉双语(字典 + _cn 列方案) |
| 中心 | 单中心(ZUCH,杭州) |
| 时间覆盖 | 2010-2018(平移后 2060-2120) |
| 年龄 | 0-18 岁(中位 0.8 岁) |
| 表数 | 16(v1.0)→ 17(v1.1.0 含 SURGERY_INFO) |
| 总行数 | 约 1,870 万 |
| ID 体系 | SUBJECT_ID / HADM_ID / ICUSTAY_ID(MIMIC-III 同构) |
| 诊断编码 | ICD-10(7 位本地扩展)+ ICD-O-3 |
| 文本形态 | 中文原文未发布;NLP 症状表(+/−)替代 |
| 高频生理 | 仅术中(5 分钟);病房为护士间歇记录 |
| 死亡口径 | 院内死亡(无出院后随访) |
| 分发格式 | gzip CSV + SQL 脚本(MySQL/PostgreSQL) |
3.9 文件导航与装载陷阱
PhysioNet 文件区:v1.1.0 全量文件夹、update_to_v1.1.0 增量文件夹(含迁移 SQL)、装载脚本、许可证文件。三个装载陷阱:其一,v1.0 老用户若只跑增量文件夹,注意 DIAGNOSES_ICD 的"主要诊断"字段是新增列——旧查询里按全表 JOIN 的逻辑要适配;其二,gzip 直读装载在 Windows 上不可用(需先 7zip 解压走 -csv 版脚本);其三,字符型 ITEMID 在导入时若被工具"智能"转成数字,会与字典表 JOIN 失败——关闭自动类型推断。
3.10 与论文口径的对照表(防混用)
| 概念 | 论文口径 | 本条目采用 | 备注 |
|---|---|---|---|
| 住院数 | 13,449(Table 1/2) | 13,449 | 正文另有 13,499 写法(存照 B) |
| ICU 住留 | 13,941 | 13,941 | MDPI 综述写 13,944,弃用 |
| 患者数 | 12,881 | 12,881 | 各来源一致 |
| 院内死亡率 | 7.1%(正文)/7.2%-971 例(Table 2) | 7.1% 并注明 | 差异来自四舍五入口径 |
| 表数 | 16(Table 1) | 16 + SURGERY_INFO | v1.1.0 增表 |
| 死亡率对比 | ICU 内 6.9%(955 例) | 另列 | 与院内死亡 971 例差 16 例=出院后死亡 |
§3.11 跨库对齐协议:PIC ↔ MIMIC-III/IV 的映射细则
跨库研究的对齐清单(结合 §4.9 逐表差异展开为操作规程):
| 对齐项 | 方法 | 风险 |
|---|---|---|
| ID 体系 | 三键同构,直接映射 | 无——这是同构红利 |
| 单元类型 | GICU→MICU 类比、NICU→NICU、SICU→SICU | CICU/GICU 无 MIMIC 对应物,映射表要显式留空 |
| 诊断编码 | ICD-10↔ICD-9 用通用映射 + 儿科章节人工核对 | P/Q 章映射质量差,需人工抽检 |
| 检验项目 | LOINC 为桥(PIC 走 LOINC,MIMIC 需 itemid→LOINC 补链) | MIMIC 侧 LOINC 覆盖不全 |
| 药物 | 中英文名→ATC 双边归一 | 中文药名多音译,ATC 映射需人工 |
| 生命体征 | 概念对齐(心率/血压/呼吸)按 D_ITEMS 双语名 | 护士记录习惯差异导致分布差 |
| 时间 | 只对齐相对时间(入 ICU 后 h),绝对日期禁止对齐 | 偏移量不可逆 |
发布跨库研究时的声明模板:“对齐基于 schema 同构与 LOINC/ATC 桥接;单元映射存在无对应项;诊断映射经人工抽检 N 条、一致率 x%;所有时间分析仅使用 ICU 内相对时间。”
§4 数据结构
4.1 实体关系图:五类临床事件围绕三键
PATIENTS ──1:N── ADMISSIONS ──1:N── ICUSTAYS
│ │ │
│ DIAGNOSES_ICD CHARTEVENTS(病房体征)
│ (ICD-10/10-O) SURGERY_VITAL_SIGNS(术中5min)
│ │ LABEVENTS(检验)
│ OR_EXAM_REPORTS PRESCRIPTIONS(医嘱)
│ (检查报告事件) INPUTEVENTS/OUTPUTEVENTS(液体)
│ │ MICROBIOLOGYEVENTS(微生物)
└──── 字典表 D_ITEMS / D_LABITEMS / D_ICD_DIAGNOSES ────┘
(双语:中文原文 + 英文对应)
4.2 字符型 ITEMID:一处类型差异的全局影响
PIC 与 MIMIC-III 最隐蔽的结构差异:PIC 的 ITEMID 是字符字段。全局影响四处:JOIN 类型必须显式一致(字符 vs 整数的 JOIN 是隐式转换 bug 温床);字典表的排序语义变了(字符排序 ‘10’ < ‘2’);从 MIMIC 迁移的特征抽取脚本要过一遍类型断言;CSV 导入工具的自动类型推断会把它转成整数——必须关闭。这条差异官方在页面里专门加粗提示,说明踩坑的人不少。
4.3 EMR_SYMPTOMS 表:中文临床文本的结构化出口
这是 PIC 最具原创性的表。背景:中文自由文本(入院记录、出院小结、病程记录、转科记录)因中文临床 NLP 去标识工具不可用而无法直接发布——团队选择用 NLP 把最常见的临床单元(症状及其否定状态)抽出来发布:
- schema:症状术语(双语)+ 极性标记("+"存在 / "—"否定)+ 文档记录时间 + 患者三键;
- 质量档案:随机 100 份笔记 → 3,410 个症状 → 两位作者独立核对 → 平均准确率 91.9% [91.3%, 92.4%];
- 三类错误公开:中文长短语无自然词边界导致分词错误;阳性/阴性判定错误;家庭成员症状被误判为患者症状("其母诉患儿近日……"类句式);
- 官方态度:明确提醒研究者"谨慎使用这些提取数据"。
方法学价值:这是中文临床 NLP 少见的"系统 + 准确率区间 + 错误分类学"三件套公开。91.9% 意味着约 8% 的噪声是有结构的——做下游建模时可以把这三类错误模式当先验(如对含家庭成员指代的句子降权)。
4.4 双时间轴:CHARTEVENTS 的稀疏与 SURGERY_VITAL_SIGNS 的密
PIC 有两条生命体征轴:CHARTEVENTS(护士间歇记录,2,278,978 行/13,941 住留 ≈ 每住留 164 条)与 SURGERY_VITAL_SIGNS(术中 5 分钟,1,216,011 行——分母只有手术患者)。对照 MIMIC-III(床旁监护约 1 小时粒度)与 eICU(也约 1 小时),PIC 的病房轴其实更稀疏,但术中轴更密。建模启示:围术期队列(SICU/CICU)可用高频特征,内科队列(GICU/PICU)只能用稀疏特征——同一个模型在两类队列上的特征工程策略应该不同。
4.5 检验表:千万行的主战场
LABEVENTS 1,009 万行、完整度 93.9%,是 PIC 的数据主战场。儿科检验的特殊性:参考范围随年龄剧烈变化(同一个"白细胞 15×10⁹/L"在新生儿是正常、在学龄儿是感染信号)——D_LABITEMS 只有 832 个项目(MIMIC-III 是 700+),但每个项目的正常范围解析需要年龄分段函数。工程配方:把年龄分段(新生儿/婴儿/幼儿/学龄/青春期)做成公共维度表,检验值先归一化为"相对参考范围的 z 分数"再进模型——这是儿科 ML 与成人 ML 最重要的一处差异。
4.6 用药表:体重剂量的世界
PRESCRIPTIONS 1,256,591 行、完整度 51.5%。儿科用药三大特征:剂量按体重/体表面积计算(mg/kg 类字段的解析需要体重数据——注意 PATIENTS/ADMISSIONS 里的体重字段或 CHARTEVENTS 里的体重测量);药物名以中文为主(双语字典对齐英文名);完整度 51.5% 的非随机性(门诊带药 vs 院内医嘱的记录渠道差异)。与 492 条目(MIMIC-IV)的药物四链(prescriptions→pharmacy→emar→poe)相比,PIC 只有 prescriptions 单链——用药执行的闭环不可验证,药效分析要声明这个缺口。
4.7 微生物表与药敏结构
MICROBIOLOGYEVENTS 183,869 行:培养事件 + 病原 + 药敏结果。结构上近似 MIMIC-III 的 microbiologyevents(specimen/organism/antibiotic 三层),中文药名经字典表对齐英文。儿科感控研究的使用姿势:新生儿败血症的病原谱(B 族链球菌、大肠杆菌的时间分布)、ICU 耐药率漂移(十年窗口正好覆盖抗菌药物管理政策期)、药敏-用药匹配的回顾审计(与 PRESCRIPTIONS 关联)。
4.8 血缘与漂移:单中心九年的两面
PIC 的血缘一跳到底:六个院内系统 → 提取清洗(MIMIC-III 规则)→ 去标识(日期平移/ID 重编号)→ 16 表 → PhysioNet。单中心九年的两面性:研究面——设备更换、诊疗规范更新、人员轮班制度的漂移都发生在同一空间内,时间漂移研究(MDPI 综述称之为 single-center temporal drift)可控性最好的素材;局限面——没有跨中心方差,模型泛化结论只能声明"ZUCH 内有效"。
4.9 与 MIMIC-III 的逐表对照速查
| PIC 表 | MIMIC-III 对应 | 关键差异 |
|---|---|---|
| PATIENTS | patients | 无 anchor_age=91 问题;性别字段同构 |
| ADMISSIONS | admissions | 无社保死亡链接;出院类型字段核对 |
| ICUSTAYS | icustays | 5 单元命名不同(GICU/PICU/SICU/CICU/NICU) |
| CHARTEVENTS | chartevents | 更稀疏(护士记录);ITEMID 字符型 |
| LABEVENTS | labevents | 参考范围需年龄分段 |
| PRESCRIPTIONS | prescriptions | 无 emar/pharmacy 执行链 |
| DIAGNOSES_ICD | diagnoses_icd | ICD-10+O-3 vs ICD-9;7 位本地扩展 |
| SURGERY_VITAL_SIGNS | (无) | PIC 独有:术中 5 分钟 |
| EMR_SYMPTOMS | (无) | PIC 独有:NLP 症状 |
4.10 数据质量总评
论文 Table 4 的完整度分档就是官方自评:高/优档 DIAGNOSES_ICD 99.4%、LABEVENTS 93.9%、OR_EXAM_REPORTS 91.9%、MICROBIOLOGYEVENTS 89.7%、CHARTEVENTS 79.7%;中档 PRESCRIPTIONS 51.5%、SURGERY_VITAL_SIGNS 47.7%、INPUTEVENTS 41.1%;低档 OUTPUTEVENTS 11.7%、EMR_SYMPTOMS 6.7%。使用总纪律:诊断与检验是主粮,液体与症状是配菜——主粮可直接建模,配菜必须先做缺失机制分析(它们缺在"哪类患者"上,比缺多少更重要)。
§4.11 儿科分析 SQL 速查:五个高频查询
-- 1. 年龄分段分布(月龄段)
SELECT CASE WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 1 THEN '0: <1y'
WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 4 THEN '1: 1-3y'
WHEN EXTRACT(YEAR FROM AGE(admittime, dob)) < 12 THEN '2: 4-11y'
ELSE '3: 12-18y' END AS age_band,
COUNT(*)
FROM pic.admissions GROUP BY 1 ORDER BY 1;
-- 2. 检验 z 分数化的分母:各项目的年龄中位数参考
SELECT l.itemid, d.label, d.label_cn,
PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY l.valuenum) AS median_val
FROM pic.labevents l
JOIN pic.d_labitems d USING (itemid)
JOIN pic.admissions a USING (subject_id, hadm_id)
WHERE l.valuenum IS NOT NULL
GROUP BY 1, 2, 3 HAVING COUNT(*) > 1000;
-- 3. 术中高频窗口:手术患者的 SpO2 轨迹抽样
SELECT s.subject_id, s.vital_time, s.spo2
FROM pic.surgery_vital_signs s
WHERE s.spo2 IS NOT NULL
ORDER BY s.subject_id, s.vital_time LIMIT 50;
-- 4. 症状表利用:某症状的阳性/阴性比
SELECT symptom, polarity, COUNT(*) FROM pic.emr_symptoms
GROUP BY 1, 2 ORDER BY 1, 2;
-- 5. 诊断章节画像(ICD-10 首字母)
SELECT SUBSTRING(icd_code FROM 1 FOR 1) AS chapter, COUNT(*),
ROUND(AVG(hospital_expire_flag)::numeric, 3) AS mortality
FROM pic.diagnoses_icd di JOIN pic.admissions a USING (subject_id, hadm_id)
GROUP BY 1 ORDER BY 2 DESC;
五个查询覆盖了儿科建模最常用的底表操作;注意查询 2 的"年龄中位数参考"只是粗参考——真正的参考范围要按临床手册分段,不要用数据分布替代临床规范。
§5 下游分析协议
5.1 环境准备与首次对账
-- PostgreSQL 装载后第一组对账查询
SELECT COUNT(*) FROM pic.patients; -- 12,881
SELECT COUNT(*) FROM pic.admissions; -- 13,449
SELECT COUNT(*) FROM pic.icustays; -- 13,941
SELECT COUNT(*) FROM pic.labevents; -- 10,094,117
-- 双语列抽查
SELECT itemid, label, label_cn FROM pic.d_labitems LIMIT 10;
-- 未来年份确认(去标识化特征,不是 bug)
SELECT MIN(charttime), MAX(charttime) FROM pic.chartevents;
四组查询全对上再开工。未来年份看到 2060-2120 属预期行为(§3.7)。
5.2 评测协议建议:没有官方基准,自己立规矩
PIC 无官方 train/test 划分与基准任务。参照社区 10 项研究(MDPI 综述)的事实惯例,推荐协议:患者级划分(SUBJECT_ID 分组,468 名多次住院患者全部留在单侧);时间锚点前置——预测任务从 ICU 入住后固定窗口(如 6h/12h/24h)开始,避免治疗信息倒灌;单元分层报告——GICU 15.3% vs SICU 2.0% 的死亡率差 7 倍,混合评估无意义;多种子方差——13,941 住留的体量对种子敏感;校准必报——判别力(AUC)之外必须报校准曲线/Brier 分数(MDPI 综述的三条主张之一)。
5.3 院内死亡预测:基线配方
最常用任务的参考实现:
-- 标签:住院结局(院内死亡 7.1%)
SELECT a.subject_id, a.hadm_id,
CASE WHEN a.expire_flag = 1 THEN 1 ELSE 0 END AS label
FROM pic.admissions a
JOIN pic.icustays i USING (subject_id, hadm_id)
GROUP BY 1, 2, 3;
特征三板斧:人口学(年龄用小数、性别、单元类型);检验 z 分数(§4.5 的年龄分段归一化);稀疏体征聚合(CHARTEVENTS 入住后 24h 窗口的 min/max/mean/趋势)。模型起点用逻辑回归 + XGBoost,报 AUC + 校准;对照水位参考 MDPI 综述汇总的既往研究(注意各家标签定义不同,只比相对结论不比绝对数字)。
5.4 脓毒症与器官功能障碍:标签构造的坑
MDPI 综述汇总的研究方向之一是脓毒症早期识别。PIC 上构造脓毒症标签的三个坑:感染证据用 MICROBIOLOGYEVENTS 培养阳性 + 抗菌药物暴露(PRESCRIPTIONS)双条件——培养污染与预防性用药都是噪声源;儿童脓毒症标准与成人 Sepsis-3 不同(儿科用的是 Phoenix/旧版 pSOFA 体系),直接套 Sepsis-3 会被审稿人打回;年龄分段阈值再次生效——心率/血压的异常判据按年龄查表。器官功能障碍表型(AKI 等)同理:儿科肌酐参考范围的年龄依赖性比成人更强。
5.5 双语字典的利用协议
双语 NLP 或跨国协作的三种用法:术语对齐研究——用 D_LABITEMS/D_ITEMS 的中英对照研究中文临床术语的翻译等价性(832 + 466 个对照对是现成语料);跨库映射——把 PIC 的 ICD-10 与 MIMIC-III 的 ICD-9 做章节级映射(Q/P 章在 ICD-9 中结构不同,别用通用映射表硬套);symptom 表的下游利用——EMR_SYMPTOMS 的双语症状词表可服务中文临床 NER/极性检测的弱监督。
5.6 成人模型→儿科迁移的校准协议
把 MIMIC 上训练的模型搬到 PIC(或反向)的正确姿势:先做分布对账(年龄分布 §2.8 的两世界图,特征语义逐个审计);重估参考范围(所有用到成人正常值的特征重新按儿科标准计算);只迁移表示不迁移决策——预训练编码器可用,输出层与校准层必须重训;温度缩放/等回归校准在儿科子集上重做;报告单元分层与年龄分层性能。直接迁移不校准的失败模式见 §7.6。
5.7 质量改进研究协议:把单中心当纵向实验
PIC 的单中心九年窗口适合回答"同一个 ICU 随时间如何变化":按入住年份切片,追踪死亡率/住院日/检验组合/用药模式的漂移;对照期内的政策事件(如抗菌药物管理)做前后对照;用控制图(p-chart/CUSUM)处理 7.1% 基线率的自然波动。这类研究不必 ML,但恰恰是临床团队最认的产出形态。
5.8 常见错误用法黑名单
- 按真实年份过滤——日期平移后所有"年份"都是假的(§3.7);
- 把 ITEMID 当整数——字符型,JOIN 失败或字典错配(§4.2);
- 把 EMR_SYMPTOMS 当全库背景——完整度 6.7%,只覆盖有病程记录的子集;
- 套用成人参考范围——检验 z 分数必须年龄分段(§4.5);
- 跨患者时间对齐——日期平移使跨患者时序不可比;
- 用 SURGERY_VITAL_SIGNS 做全库生理背景——它只属于手术患者的手术时段;
- 套 Sepsis-3 成人标准——儿科用儿科标准(§5.4);
- 声称出院后生存分析——没有出院后死亡数据。
5.9 复现包最小清单
发布基于 PIC 的研究时附带:装载脚本版本(v1.1.0)与装载日期;行数对账输出;划分文件(SUBJECT_ID 列表);年龄分段函数源码(z 分数化的公共实现);单元/年龄分层报告模板;多种子配置;环境锁定文件;双语字段的引用声明(字典表是团队翻译劳动,注明)。
5.10 与 492/494 条目的联合路线
- PIC + MIMIC-IV(492):同构 schema 的跨库迁移研究——结构对齐零成本,语义对齐(年龄/参考范围/编码)是全部工作量,天然的"schema 同构 ≠ 分布同构"教学实验;
- PIC + phenotype-annotations(494):临床文本标签路线对照——494 的人工金标准 vs PIC 的 NLP 症状表(91.9% 且错误分类公开),合成"标注质量谱系"的完整两端;
- 三者:成人库 + 儿科库 + 金标准标注的完整矩阵,足够撑起一门"医疗数据工程"研究生课。
§6 实证结果与方法学分析
6.1 论文给出的实证基座
Sci Data 论文本身是数据描述论文,它的"实证"是三张表:Table 1(16 表行数与语义)、Table 2(单元级人口学与结局:性别、年龄、死亡率)、Table 3(与 MIMIC-III 的特征对照)。从这三张表能提炼的硬结论:单元间死亡率梯度(GICU 15.3% → CICU/SICU 2.0%);年龄中位 0.8 岁 vs MIMIC-III 的 60.6 岁的两世界分布;双语与 ICD-10 是结构性差异而非表面包装。数据完整度表(Table 4)则是官方自评的质量地图——99.4% 的诊断 vs 6.7% 的症状表,这张"贫富分化"图本身就是使用指南。
6.2 NLP 症状抽取的质量审计:91.9% 的含金量
EMR_SYMPTOMS 的质量审计设计值得逐字读:随机 100 份笔记(覆盖入院/出院/病程/转科四类)、抽出 3,410 个症状、两位作者独立核对、报平均准确率 91.9% [91.3%, 92.4%]。三点评注:其一,报区间而非单点——样本量 3,410 下区间的宽度是诚实的;其二,错误三分类(分词错误/极性错误/家属症状混淆)给了下游"噪声结构图"——不是随机 8% 噪声,而是可预测的错误模式;其三,混淆来源第三条(家庭成员症状)是中文家庭中心叙事文化的直接产物——"其母诉患儿……"句式在英文病历里罕见,这是双语数据集才暴露得出的错误类型。
6.3 完整度的非随机缺失地图
Table 4 的完整度数字必须配"谁被记录"的解读:PRESCRIPTIONS 51.5%——住院全程的医嘱覆盖约一半,缺口集中在非 ICU 住院时段;INPUTEVENTS 41.1%——"每日晨计算"的机制本身就是抽样;OUTPUTEVENTS 11.7%——出量记录依赖护理执行率;EMR_SYMPTOMS 6.7%——只有病程记录存在的子集。四者共同点:缺失与临床场景强相关(外科 vs 内科、ICU 段 vs 普通段),MCAR 假设全不成立。任何用到这四张表的模型,缺失指示器本身会成为最强特征之一——这是警告也是提示:显式建模缺失机制比假装完整更好。
6.4 死亡率的单元分层真相
院内死亡率 7.1% 是全库粗率,拆开是五个世界:GICU 15.3%、PICU 9.8%、NICU 7.5%、CICU 2.0%、SICU 2.0%。三层解读:其一,GICU 是兜底单元(各科复杂病例汇入),高死亡率反映的是病例谱而非医疗质量——跨院比较时若不分层会得出荒谬结论;其二,CICU/SICU 的 2.0% 是围术期队列,其死亡风险分布在手术时段(SURGERY_VITAL_SIGNS 的时间窗),与 GICU 的"全住留风险"语义不同;其三,任何死亡预测模型必须报单元分层 AUC——混合模型大概率学到的是"单元类型"这个捷径特征。
6.5 社区研究图谱:10 项 ML 研究的合成结论
MDPI Bioengineering 2026 综述(二手来源,存照 E)对截至当时的 10 项 PIC-based ML 研究做了叙事综合:方向覆盖导管相关血栓、脓毒症、院内死亡、器官功能障碍表型。综述的三条主张值得全录:**其一,上游设计选择(标签卫生、时间锚点与预测间隙、不规则时间序列的特征窗口、缺失的原理性处理)对性能/可复现性/临床效用的驱动至少与分类器选择同等重要;其二,单点判别指标不足,必须配校准、决策曲线分析与贴近部署的验证;其三,PIC 应被视作协作性儿科 ICU 数据生态的种子。**第三条是定位性判断——与官方"国际数据共享"的立项初衷呼应。
6.6 四大基质特性:综述的方法学抽象
该综述把 PIC 的建模难点抽象为四个基质(substrate)特性,直接采纳为建模纪律:不规则时间序列(病房轴护士记录的稀疏与不规律采样——时间序列模型需处理任意间隔);构造标签(死亡/脓毒症/血栓都是研究者构造的标签,定义敏感性高——做敏感性分析);单中心时间漂移(九年设备/规范/流程漂移——时间外推验证必不可少);双语标识符语义(ITEMID 字符型 + 中英双轨——特征工程中的语义对齐成本)。这四条加 §5.8 黑名单构成本条目的"防坑体系"。
6.7 时间漂移的量化建议
九年窗口的漂移检验配方:按入住年份切十层,对每个特征画年均值/分布带;死亡率控制图(年死亡率 7.1% 基线的 p-chart);设备迁移断点(监护仪/信息系统更换的年份若可知,做断点分析)。漂移研究的最小结论格式:“特征 X 的分布漂移幅度超过模型输入容差,故时间外推需重校准”——把漂移从模糊担忧变成可测对象。
6.8 八个必知的坑(坑点 1-8)
坑点 1:未来日期不是 bug。住院时间 2060-2120 是 50-100 年偏移的去标识化设计;按真实年份过滤、跨患者时间对齐都是错误用法(§3.7)。
坑点 2:ITEMID 是字符。从 MIMIC 迁移的脚本里所有整数假设都会翻车;CSV 导入时关掉自动类型推断(§4.2)。
坑点 3:中文原文不在库里。自由文本未发布;EMR_SYMPTOMS 是替代品且完整度 6.7%——想要文本做 LLM 的人请换目标(§4.3)。
坑点 4:成人参考范围失效。检验值必须年龄分段归一化;生命体征阈值查儿科表(§4.5、§5.4)。
坑点 5:单元混训学捷径。GICU 15.3% vs SICU 2.0%,混合训练的模型学到单元类型而非病理;分层报告是底线(§6.4)。
坑点 6:Sepsis-3 不可用。儿科脓毒症标准不同(Phoenix/pSOFA 体系);成人标签管线直接套用会被打回(§5.4)。
坑点 7:高频数据的错觉。5 分钟生命体征只属于手术时段;病房轴比 MIMIC-III 还稀疏——"PIC 有高频数据"是半句话(§4.4)。
坑点 8:版本口径。论文 Table 1 是 v1.0 的 16 表;v1.1.0 有 SURGERY_INFO 与主要诊断字段;MDPI 综述的 13,944 与论文 13,941 差 3——引用一律以论文 Table 口径(§3.10)。
6.9 使用者自查清单
- [ ] 已通过 PhysioNet 认证(培训/GCP)+ 签 DUA
- [ ] 装载后行数对账五连通过(§5.1)
- [ ] 代码里无"真实年份"过滤逻辑
- [ ] ITEMID 全链路字符型处理
- [ ] 检验特征做了年龄分段归一化
- [ ] 模型报告含单元分层 + 年龄分层 + 校准
- [ ] EMR_SYMPTOMS 使用处声明了 6.7% 完整度与 91.9% 抽取准确率
- [ ] 脓毒症类标签用了儿科标准
- [ ] 版本口径声明为 v1.1.0(或 v1.0 并注明)
- [ ] 复现包含划分文件与年龄分段函数(§5.9)
6.10 家族治理定位:MIMIC 出口的第一站
PIC 在 MIMIC 家族治理图谱上的位置:它是 MIMIC-III schema 的第一个完整国际移植,证明了"表结构 + 治理协议 + DUA 文化"整套方法的可出口性。之后的中国中心 PhysioNet 数据集(自贡四院感染库、Chinese critical care database 等)走的都是 PIC 踩出来的路。治理层面的三个可复制件:认证双轨制(国际培训/GCP);增量版本发布(v1.0 → v1.1 的 update 文件夹模式——老用户零成本升级);质量自评表(Table 4 完整度分档——把数据缺陷当元数据发布)。
6.11 冲突口径诊断树
数字不符?
├─ 住院数 13,449 vs 13,499 → 论文 Table 1/2 vs 正文自相矛盾(存照 B);本条目用 13,449
├─ ICU 住留 13,941 vs 13,944 → 论文 vs MDPI 综述;用论文 13,941
├─ 死亡率 7.1% vs 7.2% → 正文四舍五入 vs Table 2 合计(971 例);报 7.1% 并注明
├─ 表数 16 vs 17 → v1.0 论文口径 vs v1.1.0 实际(+SURGERY_INFO)
├─ 字典表名 D_ICD_DIAGNOSES vs D_DIAGNOSES_ICD → 论文 vs PhysioNet 页面写法不一(存照 C);装载后以实际文件为准
└─ "英国"来源 → 批次元数据笔误;官方为中国 ZUCH(存照 A)
6.12 冻结生态与更新预期
PIC 的最后更新停在 v1.1.0(2020-11),论文措辞里"未来将标准化并发布"的检查报告内容(OR_EXAM_REPORTS 的文本部分)至今未见下文。文档站仍在线、引用持续增长(超 100 篇),但库本体进入冻结维护态。使用策略:把它当稳定基础设施(冻结是可复现性的朋友);关注官方渠道是否发布 v1.2 或扩展文本资源;任何"最新数据"的期待都应收敛到"2010-2018 窗口"这个事实。
6.13 与同类儿科数据资产的横向定位
| 资产 | 类型 | 儿科覆盖 | 开放度 | 与 PIC 关系 |
|---|---|---|---|---|
| PIC | EHR 关系库 | 0-18 全谱 + NICU | PhysioNet Credentialed | 本体 |
| MIMIC-III NICU 子集 | EHR 关系库 | 仅新生儿(美国) | Credentialed | 新生儿段的国际对照 |
| VPS / PICANet | 行政审计注册库 | 多中心 | 受限/审计用途 | 有广度无深度(无时序检验用药) |
| Philips/其他院内库 | 院内数据 | 各院自定 | 不开放 | PIC 提供了它们的开放化模板 |
| 494 表型标注 | 文本标注 | 成人 | Credentialed | 标签路线对照 |
综述原话:PIC 是"唯一同时具备关系型 EHR 深度与国际可及性的开放资源"——它在这个生态位上没有对手。
6.14 静态库 × 活跃文献:增量价值策略
库冻结但文献活跃(超 100 引用且持续),增量价值的三条路:方法学——把新方法(LLM 特征抽取、基础模型微调)在冻结库上做受控评测,文献价值反而因库稳定而更高;再分析——对 10 项已有研究做系统综述/meta 层面的方法学审计(MDPI 综述开了头);生态位补全——PIC 缺的(出院后随访、多中心、文本)由其他资源补,做"PIC + X"的联合研究设计而不是等 PIC 自己补全。
§6.15 十条常见反对意见与回应
论坛与审稿中反复出现的质疑,逐一回应:
- “单中心数据没价值”——单中心的纵向一致性恰是方法学研究的优势;多中心的方差控制是另一类研究设计,两者互补而非替代;
- “1.2 万患者太小”——对表型明确的儿科亚组研究足够;且儿科人群本就稀缺,PIC 是该生态位的最大开放资源;
- “没有文本不能做 NLP”——症状表 + 双语字典就是中文临床 NLP 的结构化语料;文本发布受去标识技术限制,不是保守;
- “中国数据国际可比性差”——双语工程与 ICD-10/LOINC 对齐就是为可比性设计的;对比研究(如 §2.8 年龄分布)正是可比性的操作化;
- “数据太旧(2010-2018)”——冻结是可复现性的朋友;诊疗规范漂移本身是研究对象(§6.7);
- “为什么没有波形数据”——术中 5 分钟是 AIMS 系统的能力边界;床旁波形研究者请用 vitaldb/HiRID,人群定位不同;
- “死亡率 7.1% 太低/太高”——单元间 2.0%-15.3% 的梯度才是真相;混合基线率只是分层结构压缩后的投影;
- “MIMIC 脚本直接跑就行”——§5.8 黑名单八条里六条都是"MIMIC 脚本直接跑"引发的;同构是起点不是终点;
- “官方更新停了所以弃用”——冻结库的引用仍在增长(超 100 篇);基础设施的成熟度不看更新频率看可复现性;
- “中文术语我看不懂”——字典表 +
_cn列方案正是为此设计;三位作者的人工翻译是给国际研究者的桥,不是障碍。
§6.16 静态库 × 活跃文献的增量策略
库冻结(v1.1.0,2020-11)而引用活跃(超 100 篇,2025-05 官方统计)的组合,指向三条增量路线:再分析层——对已发表研究做方法学审计(标签定义、校准报告率、划分卫生),MDPI 综述已开先例;组合层——PIC+MIMIC 的跨库、PIC+494 的标签谱系、PIC+VitalDB 的术中延伸,冻结库在组合研究里是稳定的"锚点资产";工具层——把装载脚本、对账清单、年龄分段函数做成开源工具包(mimic-code 模式),工具引用反哺数据引用。三条路的共同前提:引用版本口径(v1.1.0)与日期偏移事实,这是冻结库的"版本纪律"。
§7 AI 就绪指南与应用场景
7.1 五种标准喂法
- 院内死亡预测:最热任务;单元分层 + 校准为底线(§5.3 配方);
- 儿科脓毒症/器官功能障碍早期识别:标签构造按 §5.4;PIC 的微生物+用药双证据链是优势;
- 围术期风险预测:SURGERY_VITAL_SIGNS 的高频窗口做术中低血压/缺氧预警——PIC 独有赛道;
- 双语术语对齐:字典表 + 症状表服务中文临床 NLP(§5.5);
- 跨库迁移研究:与 MIMIC-IV 的同构异源实验(§5.10)——成人与儿科两个分布的方法学对照。
7.2 死亡线:30 分钟跑通第一个实验
# 前提:pic schema 已装载(§3.6)
# 步骤 1:单元分布与死亡率画像(5 分钟)
psql -c "SELECT first_careunit, COUNT(*),
ROUND(AVG(hospital_expire_flag)::numeric,3) AS mortality
FROM pic.icustays i JOIN pic.admissions a USING (subject_id, hadm_id)
GROUP BY 1 ORDER BY 2 DESC;"
# 步骤 2:抽一个患儿的时间线全景(10 分钟)
psql -c "SELECT subject_id, hadm_id FROM pic.icustays LIMIT 1;" # 取样例
# 按样例 id 查 labs/vitals/prescriptions 各取最近 20 条
# 步骤 3:Death 标签 + 人口学特征导出(15 分钟,走 §5.3 配方)
第一个实验先看单元画像(死亡率梯度本身就是最重要的发现之一),再进入建模。
7.3 泄漏防控专项
PIC 的泄漏面:患者级泄漏(468 名多次住院患者跨集——SUBJECT_ID 分组划分堵住);时间泄漏(预测窗开始后的记录倒灌——锚点前置 + 预测间隙);单元泄漏(单元类型作为特征是捷径——报告分层性能或干脆从特征中移除做消融);标签构造泄漏(脓毒症标签若用了"抗生素暴露"而特征里也有用药记录,需做标签-特征互斥审查);日期偏移泄漏(偏移量若与结局相关——官方按患者随机,正常无虞,但别自己构造"绝对日期"特征)。2,102 篇小语料的种子敏感性在 PIC 同样存在——13,941 住留报多种子方差。
7.4 公平性与人群分层
PIC 的公平性分析维度:年龄(儿科的核心分层变量——按月龄段分层而非岁);地域(转诊来源 11 市——可构造地域可达性代理变量,但注意 DUA 对地区字段的使用限制);保险与支付方式字段(若表内可得——中国语境下是新农合/城镇居民/城镇职工的结构差异);性别(57.5% 男性——先天心脏病男童比例高是临床事实而非采样偏差,解读分层差异时要有临床对照)。特别提醒:少数民族已归并为 “Other”(§3.7),种族公平性分析在 PIC 上不可做——这是去标识化的代价,论文里不要硬做。
7.5 LLM 时代的用法与克制
PIC 与 LLM 的三种安全关系:LLM 做特征工程助手——把 CHARTEVENTS/LABEVENTS 序列文本化后让 LLM 做摘要特征(受控环境内);LLM 做双语术语对齐——用字典表的中英对照做术语翻译质量的自动评测集;克制项:不要用 LLM 幻觉文本——库里没有自由文本,让 LLM "补写"临床叙述等于伪造数据。合规提醒沿用 PhysioNet 2025-09 LLM 政策:credentialed 数据不得上传第三方在线服务;本地部署为官方强烈推荐(§8.3)。
7.6 负结果也值钱:成人→儿科迁移的已知失败模式
综述与文献共识的失败方向:直接迁移不校准——成人死亡模型的判别力在儿科可能尚可,但校准崩溃(儿科 7.1% 基线 vs 成人 ~11% 且风险结构完全不同);成人生理阈值报警——心率 140 在新生儿是正常,在成人是极限,直接套用产生海量假警报;体重盲区——成人模型忽略体重的剂量/容量逻辑在儿科全错;ICD 映射硬套——ICD-9→10 通用映射表丢失 P/Q 章的儿科结构。这四条是审稿人最熟悉的儿科 ML 批评点——预防性声明比事后辩护便宜得多。
7.7 不规则时间序列建模配方
病房轴的不规则采样处理三种范式:归并重采样(按 1h/4h 网格聚合,丢时序信息换简单性——基线做法);不规则感知模型(GRU-D/SeFT/时间感知 attention 类——把间隔当输入);分段建模(术中高频段与病房稀疏段分开建模再融合——PIC 特有机会)。推荐路线:先用归并基线建立水位,再上不规则感知模型报告增量,最后用分段模型吃 SURGERY_VITAL_SIGNS 的独有红利。每一步都报校准。
7.8 特征工程备忘:儿科专属特征清单
成人管线之外必须加的儿科特征:体重/体表面积(剂量与容量计算的基准, CHARTEVENTS 里测得);年龄分段交互项(所有生理特征的 z 分数化都要 × 年龄段);发育代理(月龄/矫正月龄 for NICU);生长轨迹(多次测量的身高体重百分位变化——单中心九年可以算个体轨迹);围产期史(P 章 ICD 的孕周/出生体重代理);手术暴露标志(SURGERY_INFO 的存在本身就是风险分层变量)。这套清单 = 儿科 ML 与成人 ML 的最小差异集。
7.9 复现包与工程化
§5.9 清单之外的工程化补充:数据版本钉死 v1.1.0(CSV 文件哈希入库);SQL 与 Python 特征管道分离(SQL 做抽取、Python 做特征——z 分数函数的单元测试用文献参考值);CI 里跑行数对账 + 未来年份断言(防止有人"修复"日期偏移);分层评估脚本模板开源。这份库的工程红利是 schema 与 MIMIC-III 同构——mimic-code 社区资源的大部分 SQL 改名即可用,但语义审查不可省(§4.9 对照表逐条过)。
7.10 成本核算:用 PIC 研究的真实预算
与成人库对照的研究成本账:数据获取——认证 3 个工作日 + DUA(零成本);计算——1,870 万行规模在单机 PostgreSQL 完全可控(无云成本);翻译对齐是隐性大头——跨语言研究里术语对齐的人工审查时间约占总工时 20-30%(若做中文侧研究);伦理——已由 ZUCH IRB 覆盖数据层,研究者本地 IRB 通常走豁免或快速通道(以本机构为准)。对比自建儿科队列(伦理 + 采集周期以年计),PIC 的经济学意义一目了然。
7.11 教学场景:双语 ICU 数据课程包
基于 PIC 的四周课程:第 1 周——MIMIC-III/PIC schema 同构对照(§4.9 表逐行讲),装库对账;第 2 周——儿科时间语义(NICU 天龄、日期偏移、不规则采样),完成死亡基线;第 3 周——双语工程(字典表审计 + 症状表质量评估),写一份"翻译错误报告";第 4 周——迁移实验(成人模型→儿科校准,§5.6 协议),对比校准前后。结课产物即一份可投 short paper 的对照研究。选它的教学理由:规模适中(单机可跑)、语义差异丰富(年龄/双语/偏移三主题)、失败方向已知。
7.12 多任务与联合建模
13,941 住留上做多任务联合(死亡 + 住院日 + 再入 ICU)的权衡:多任务正则对 468 名多次住院患者的子任务有帮助,但对单次住院的 96.4% 主群增益有限;单元异质性(5 ICU)比任务异质性更大——先分层后多任务(每单元内多任务)的顺序更稳。标签相关性先验:死亡与住院日的共享表示需要小心(长住院与高死亡率的非线性关系在儿科呈 U 型——过短过长都危险)。
7.13 监控与回归:把 PIC 搬进 CI
工程团队把 PIC 用作回归基准:固定 1,000 住留的冻结子集作为服务回归集(每次模型更新跑一遍分层 AUC + 校准,容差 -2%);数据管道的 CI 断言(行数、ITEMID 类型、日期范围 2060-2120);季度性全库重跑对照漂移。1,870 万行的体量让全库回归在小时级完成——这是它作为工程基准的隐藏价值。
7.14 与 494 条目的"标注质量谱系"实验
把 494(人工双人金标准)与 PIC 的 EMR_SYMPTOMS(NLP 自动抽取)放在同一坐标系:494 的 Cohen’s Kappa 0.56-0.95 是人工上限区间;PIC 的 91.9% 是自动系统的实测水平。实验设计:在 PIC 症状表的覆盖子集上抽样人工复核,比较"你的标注 - PIC 自动"与"494 的标注员间分歧"——若自动-人工差距落在人工-人工分歧区间内,说明该症状的自动抽取已达人工一致性上限。这个实验的设计完全复用 §5.2 的评测协议。
7.15 从 PIC 出发的三个研究提案模板
- 儿科生理 z 分数图谱:全库检验/体征按年龄分段归一化,发布"中国儿科 ICU 参考范围数据集"——PIC 最大的再利用增值;
- 双语术语对齐基准:以字典表为种子,构建中文临床术语翻译评测集,服务医疗 NLP 国际化;
- 十年质量改进白皮书:按 §5.7 协议做单元级纵向质量画像,与 PICANet 等国际注册库对标——临床团队最认的产出。
§7.16 从研究到床边:部署差距清单
儿科 ML 的研究-部署落差在此库上的具体形态与对策:警报疲劳(儿科生理范围宽,成人式阈值系统产生海量假阳性——对策:z 分数特征 + 时段自适应阈值);数据接口(研究用 SQL 全表扫描,床边系统是流式 HL7/FHIR——对策:部署前做特征计算的时间预算测试);人群漂移(ZUCH 转诊网络与目标医院的人群差——对策:校准层本地重训 + 前三个月 shadow mode);伦理审批(研究 IRB 豁免不等于临床部署许可——对策:医疗器械软件分级评估);解释性需求(临床团队要"为什么",黑盒模型的生存空间在儿科更小——对策:证据句/特征归因输出为默认配置)。这份清单来自 §6.5 综述第三条主张(“贴近部署的验证”)的操作化。
§7.17 监控回放:用历史数据做警报审计
PIC 的九年窗口支持"回放式审计":把新的预警算法跑在历史 ICU 住留上,对照实际结局统计每住留警报数、警报提前量、假警报率。三个指标的定义公式:警报敏感度 = 命中真实事件的警报 / 真实事件数;提前量分布 = 警报时刻 - 事件时刻的中位/IQR;每住留警报负荷 = 警报总数 / 住留数(临床可容忍度通常 <1-2/天)。回放审计是部署前(§7.16)的最后一道关卡,也是论文里"临床效用"一节的图表来源。
§8 伦理、许可与合规
8.1 IRB 与知情同意
数据层伦理由 ZUCH IRB 批准(杭州),豁免个体知情同意——理由是项目不影响临床护理且全部 PHI 已去标识。使用者侧的伦理义务由 DUA 承接:禁止再识别、负责任处理、遵循协作研究原则。中国研究者的本地伦理流程通常仍需走一遍(即使数据已开放)——以各机构 IRB 要求为准。
8.2 去标识化的强度与残余风险
官方定性:ID 随机重编号不可逆 + HIPAA 标识符全移除 + 日期平移 → 匿名化。残余风险两点:罕见病再识别——25.4% 先天性疾病中存在罕见综合征病例组合,"诊断组合 + 时间线 + 转诊地"理论上可缩小范围(DUA 的禁止条款针对的就是这种拼接);日期平移的族谱效应——同一家庭多名患儿的偏移量是否一致官方未说明(若同家庭同偏移,家庭结构可被推断;若不同,家庭关联不可达)。使用者在发表时对罕见病例应做案例级模糊化。
8.3 LLM 与第三方服务红线
PhysioNet 2025-09-24 官方政策(对 MIMIC 系与 credentialed 数据一体适用):数据不得通过 API 发送给第三方 LLM 服务(零留存要求极难核实);推荐本地部署 LLM;研究者对合规负全责。落地纪律:评测用本地开源模型;任何云端处理前先过机构合规审查;论文里披露处理路径。这条政策对双语研究者尤其重要——中文翻译类云端 API 调用同样落入"发送数据给第三方"的范畴。
8.4 跨境数据合规的扩展提醒
与 493/494 条目相同的背景:美国 DSP(EO 14117)对批量获取美国敏感健康数据设限——PIC 是中国数据,方向相反,但跨境协作的双边合规都要核:中国侧《数据安全法》《个人信息保护法》对健康数据出境的框架(PIC 走的是"已公开+匿名化"路径,风险低但流程要留痕);欧美合作者的机构侧 DUA 承接。本条目不构成法律意见,跨境团队请走机构合规部门。
8.5 引用与致谢义务
三层引用链(官方要求):数据集 DOI(10.13026/32x9-wv38,Li/Zeng/Yu 2020 版本引用)+ 原始论文(Zeng et al. Sci Data 7:14, 2020)+ PhysioNet 平台论文(Pollard et al. 2026 Nature Health)。双语字典与 NLP 症状表凝结了团队的人工翻译与核对劳动——使用这两个组件时在正文明确说明其来源与准确率(91.9%),是最基本的学术礼节。
§9 常见问题(FAQ)
9.1 基础身份
Q1 PIC 是什么? Paediatric Intensive Care database:中国浙江大学医学院附属儿童医院五个 ICU(2010-2018)的 MIMIC-III 结构儿科数据库,首个免费英汉双语临床数据库,PhysioNet v1.1.0。
Q2 谁做的? ZUCH 团队(Zeng/Yu/Lu 共同一作,Shu 与 Li 通讯);PhysioNet 页面署名 Haomin Li, Xian Zeng, Gang Yu。
Q3 是英国的数据吗? 不是——生产排期元数据把来源写成"英国"是笔误;官方为中国杭州 ZUCH(存照 A)。
Q4 多大规模? 12,881 患儿 / 13,449 住院 / 13,941 ICU 住留;约 1,870 万行。
Q5 版本历史? v1.0.0(2019-11-26)→ v1.1.0(2020-11-12):主要诊断字段、SpO2/EtCO2/ST、新增 SURGERY_INFO 表。
Q6 DOI 和论文? DOI 10.13026/32x9-wv38;论文 Zeng et al., Scientific Data 7:14 (2020), DOI 10.1038/s41597-020-0355-4(PMID 31932583)。
Q7 时间覆盖? 2010-2018 真实收治期;去标识后日期平移至约 2060-2120 年。
Q8 访问要什么条件? 人体受试者培训(CITI 类)或中国 GCP 认证 + 签 DUA;审批约 3 个工作日。
Q9 装载支持哪些数据库? 官方脚本覆盖 MySQL 与 PostgreSQL;CSV 可进任意关系库。
Q10 在线文档在哪? pic.nbscn.org(含引用统计与临床资源介绍)。
9.2 数据内容
Q11 五个 ICU 怎么分? GICU 综合 / PICU 儿科 / SICU 外科 / CICU 心脏 / NICU 新生儿,共 119 床。
Q12 年龄范围? 0-18 岁;中位 0.8 岁(Q1-Q3 0.1-3.5);NICU 平均 14.5 天。
Q13 最大表是哪张? LABEVENTS 1,009 万行(检验);CHARTEVENTS 229 万行(病房体征)。
Q14 高频生命体征有哪些? 仅手术时段:SURGERY_VITAL_SIGNS 每 5 分钟(含 SpO2/EtCO2/ST,v1.1.0);病房段只有护士间歇记录。
Q15 有自由文本吗? 没有——中文临床文档未发布;替代品是 NLP 症状表 EMR_SYMPTOMS(402,142 行)。
Q16 症状表可信吗? 平均准确率 91.9% [91.3%, 92.4%](3,410 症状双人核对);三类错误公开;官方提醒谨慎使用。
Q17 诊断编码体系? ICD-10 本地 7 位扩展 + ICD-O-3;中文诊断比英文更具体。
Q18 死亡数据口径? 院内死亡(7.1%,971 例);无出院后随访。
Q19 病种谱? 先天畸形/染色体异常 25.4% 居首,围产期 14.1%,呼吸 10.3%。
Q20 液体平衡数据如何? INPUTEVENTS 41.1% / OUTPUTEVENTS 11.7% 完整度——用前先做缺失机制分析。
Q21 微生物数据? 183,869 行,培养+药敏,完整度 89.7%——感控研究的富矿。
Q22 ITEMID 是什么类型? 字符字段(MIMIC-III 是整数)——迁移脚本必查(坑点 2)。
Q23 双语怎么实现的? 分层策略:标准编码走国际英文版、其余人工翻译复核、原文保留 + _cn 后缀(§3.4)。
Q24 有体重数据吗? 有(CHARTEVENTS 测量 + 人口学),儿科剂量计算的基础——但注意非随机缺失。
9.3 工程与装载
Q25 装载脚本在哪? PhysioNet 文件区:PostgreSQL 用 1-create-tables-load-data-gzip.sql(或 -csv 版)+ 2-index.sql + 3-constraints.sql;MySQL 用 define.sql + index.sql + constraints.sql。
Q26 为什么日期是 2060 年? 去标识化日期平移 50-100 年(患者内一致、保留时刻/星期/季节)——不是 bug,别"修"它。
Q27 能跨患者对齐时间吗? 不能——偏移量患者特异,跨患者时序不可比。
Q28 CSV 导入后 JOIN 失败? 八成是 ITEMID 被自动转成整数——关闭类型推断或显式 CAST(§4.2)。
Q29 v1.0 用户怎么升级? 下载 update_to_v1.1.0 增量文件夹(含迁移 SQL),不必重下全库。
Q30 表数到底 16 还是 17? 论文 Table 1 是 v1.0 口径 16 表;v1.1.0 加 SURGERY_INFO 后为 17(存照 C)。
Q31 数据质量总评? 诊断 99.4%/检验 93.9%/微生物 89.7% 高;处方 51.5%/术中体征 47.7% 中;出入量与症状表低(§4.10)。
9.4 建模与评测
Q32 有官方基准吗? 没有。社区 10 项研究(MDPI 综述)提供了事实参照;划分自建、患者级、开源(§5.2)。
Q33 死亡预测怎么做? §5.3 配方:标签 expire_flag、单元分层、检验 z 分数、稀疏体征聚合、报校准。
Q34 脓毒症标签怎么定? 儿科标准(Phoenix/pSOFA),不是 Sepsis-3;感染证据用培养+用药双条件(§5.4)。
Q35 能用 MIMIC 模型直接迁移吗? 表示可迁移,决策与校准必须重训(§5.6);四类已知失败见 §7.6。
Q36 生命体征特征怎么处理不规则采样? 归并基线 → 不规则感知模型 → 高低频分段融合三步走(§7.7)。
Q37 需要哪些儿科专属特征? 体重/体表面积、年龄分段交互、矫正月龄、生长轨迹、围产期史、手术暴露标志(§7.8)。
Q38 种族公平性分析能做吗? 不能——少数民族已归并 “Other”(§3.7);年龄/性别/地域维度可做。
Q39 评估时最容易被拒稿的点? 缺单元分层、缺校准、用成人参考范围、套成人脓毒症标准——四连击(§6.5 综述主张)。
9.5 与 MIMIC 家族
Q40 和 MIMIC-III 什么关系? Schema 师承(官方原话 follow the structure of MIMIC-III);三键同构、表名对应、语义异构(§4.9)。
Q41 和 MIMIC-IV 什么关系? 无直接版本关系;MIMIC-IV 是成人库的现代续作,PIC 独立走 v1.0→v1.1。
Q42 和 494(表型标注)什么关系? 文本标签路线对照:那边人工金标准、这边 NLP 自动抽取——联合实验见 §7.14。
Q43 MIMIC 老手上手要多久? schema 同构,半天熟悉双语列与类型差异即可开工——这正是立项设计目标。
9.6 LLM 时代
Q44 能用 ChatGPT 处理数据吗? 不能上传——PhysioNet LLM 政策禁止第三方服务(§8.3);本地部署开源模型。
Q45 LLM 能补写临床文本吗? 不能——库里没文本,用 LLM 生成叙述等于伪造数据。
Q46 LLM 有什么正当用法? 双语术语对齐评测、序列特征摘要(受控环境)、特征工程辅助(§7.5)。
9.7 收尾杂项
Q47 最常见的三个新手错误? 按真实年份过滤、把 ITEMID 当整数、把 EMR_SYMPTOMS 当全库背景(§5.8)。
Q48 引用格式? 三层:数据集 DOI + Zeng 2020 Sci Data + Pollard 2026 平台论文(§8.5)。
Q49 一句话推荐给谁? 给所有想在真实儿科重症数据上做点事、又被"没有开放儿科库"困住的人——这扇门已经开了六年。
9.7b 进阶问答
Q53 能做再入院预测吗? 部分能——468 名(3.6%)多次住院者有院内再住院;出院后再入院无数据。样本量小,结论谨慎。
Q54 住院日预测怎么做? 回归任务(均值 17.6 天、长尾分布)——对数变换或分位数回归;注意住院日是"管理变量"(受出院流程影响),临床语义弱于死亡率。
Q55 先心病队列怎么划? CICU 单元 + Q 章 ICD 交叉筛选;围术期分析配 SURGERY_INFO 的手术类型。
Q56 新生儿亚组怎么处理矫正月龄? NICU 段用"实际日龄 + 孕周"双变量;矫正月龄 = 实际月龄 - (40-孕周)/4,需孕周字段支持(P 章 ICD 或产史字段核实可得性)。
Q57 检验 z 分数的参考范围哪来? 优先临床手册/指南的年龄分段表;数据分布只做 sanity check——不要用本库分布当参考(循环论证)。
Q58 能和 eICU 联合吗? 可以但注意 eICU 是美国成人多中心——与 PIC 的人群差异比 MIMIC 更大;联合价值主要在"成人-儿童"方法学对照而非合并建模。
Q59 用药剂量分析的前提? 体重数据可得性核查(存照 H)+ 给药途径字段清洗 + 中文药名 ATC 归一;三步都过再做 mg/kg 逻辑。
Q60 SURGERY_INFO 怎么用? 手术类型/时间/麻醉方式三字段:围术期队列定义、术中窗口锚定、麻醉方式分层——v1.1.0 用户的专属红利。
Q61 检查报告事件(OR_EXAM_REPORTS)能拿到报告内容吗? 只有事件记录(91.9% 完整度);报告文本官方"未来将标准化并发布",尚未落地(存照 C)。
Q62 怎么引用本数据集最规范? 三层链(§8.5):数据集 DOI + Zeng 2020 + Pollard 2026 平台论文;用了症状表/字典表再加一句来源说明。
Q63 装载后行数对不上怎么办? 先查版本(v1.0 vs v1.1.0 文件夹混用是最常见原因),再查 CSV 解压完整性,最后对照论文 Table 1 的 v1.0 口径——DIAGNOSES_ICD 在 v1.1.0 因主要诊断字段拆分可能行数有异动。
Q64 能发布基于 PIC 的衍生数据吗? 衍生的聚合统计/模型可发布;行级再分发受 DUA 约束——参照 MIMIC 社区惯例:发布 ID 列表与代码,不发布数据本体。
Q65 中文 NLP 研究的伦理审查注意什么? 数据层已 ZUCH IRB 覆盖;本地 IRB 通常快速通道;发表时避免罕见病例可识别细节(§8.2)。
Q66 有现成的社区代码吗? 论文图代码在 github.com/Healthink/PIC;mimic-code 社区资源改名可用但需语义审查(§4.9);PIC 专属的成熟开源管线尚未形成。
Q67 十年跨度里信息系统换过吗? 官方未披露系统迁移史(与漂移研究相关的元信息缺口)——漂移分析时把无法归因的断点如实报告。
Q68 能做因果推断吗? 观察性数据的标准限制:用药-结局的因果声明需谨慎;倾向得分/工具变量方法可用但单元异质性强,建议在单元内做。
Q69 数据里有钱/保险字段吗? 支付方式类字段的存在性以实际表结构为准;中国医保结构(新农合/城镇职工等)与美国的 payer 语义不同,跨库对齐时另建映射。
Q70 想要"最新的"中国儿科 ICU 数据怎么办? PIC 冻结于 2018 收治窗口;更新的中国中心数据可关注 PhysioNet 后续发布(自贡感染库 2019-2020 等),或按 PIC 模板推动本院数据开放——后者是这条路线的终极意义。
9.8 番外:三个常见误解
Q50 “PIC 是英国 PICU 审计数据”? 混淆了 PICANet(英国审计网络,非开放 EHR)与 PIC(中国开放数据库)。排期元数据的"英国"笔误助长了这个误解(存照 A)。
Q51 “PIC 是 MIMIC-III 的子集”? 不是——两库患者零重叠(波士顿 vs 杭州),同构的是 schema 不是数据。
Q52 “双语=每行都有英文翻译”? 字典层全双语;数据行的翻译覆盖以术语在字典中的登记为准——未登记术语的行可能只有中文,装载后抽查(§3.4)。
Q71 装 MySQL 还是 PostgreSQL? 都官方支持;PostgreSQL 可 gzip 直读免解压,Linux 服务器首选;Windows 用 MySQL 路径(7zip 解压 + define.sql)。
Q72 数据集会闭库吗? PhysioNet 永久 DOI 机制下不会;文档站持续在线;"冻结"指内容不再增长,不是下线。
Q73 最后一条建议? 把 §3.7 的三条去标识化规则当作"这个库的世界观"——先接受它(未来日期、字符 ITEMID、天级年龄),再写第一行代码。
Q74 本库与 PICANet/VPS 注册库最大的互补点? 注册库有广度(多中心)无深度(无时序检验用药);PIC 有深度无广度(单中心全细节)——多中心验证用注册库队列定义、机制研究用 PIC,是标准的两级研究设计。
Q75 想研究中文临床语言学,从哪张表开始? 双语字典表(832 化验项 + 466 项目对照)是最干净的起点——人工翻译已核对;进阶再用 EMR_SYMPTOMS 的症状双语词表(含极性标注),最后是"家庭成员症状混淆"这类句式研究——那是中文家庭叙事文化的语言学样本(§4.3)。
§10 附录:存照、引文与档案
§8.6 与同门条目的合规协议对照
PIC 与同批三份数据集的伦理/合规协议并排,可看出 MIMIC 家族的"治理方言":
| 维度 | PIC | MIMIC-IV(492) | Nosocomial(493) | Phenotype(494) |
|---|---|---|---|---|
| 数据层 IRB | ZUCH,豁免知情同意 | BIDMC/MIT,豁免 | 派生(上游覆盖) | 派生(上游覆盖) |
| 访问认证 | 培训 或 GCP(双轨) | CITI 课程 | MIMIC-III 资格复用 | MIMIC-III 资格复用 |
| 审批周期 | 约 3 个工作日 | 数日-数周 | 随 MIMIC-III | 随 MIMIC-III |
| 身份重编号 | 随机不可逆(匿名化) | 随机不可逆 | 沿用 MIMIC-III ID | 沿用 MIMIC-III ID |
| 日期策略 | 向前平移 50-100 年 | 向后随机偏移(保留间隔) | 无独立日期(快照序列) | 无日期(索引表) |
| 文本处理 | 中文文本不发布(NLP 替代) | 英文文本直接发布 | 结构化快照 | 文本不发布(标注索引) |
PIC 的"向前平移"(2060-2120)与 MIMIC 的"向后偏移"方向相反但逻辑同源——都保留患者内时序、抹除真实日历。把四份协议放在一起读,是理解"去标识化没有唯一正确答案、只有透明声明的设计选择"的最快方式。
10.1 口径存照
存照 A(来源勘误):生产排期元数据将本数据集中文名写为"英国儿科重症监护数据库 (PICU)";官方来源为浙江大学医学院附属儿童医院(中国杭州)。英国 PICANet 为另一体系(审计注册库,非开放 EHR)。本条目全篇以官方为准。
存照 B(住院数口径):论文正文"Paediatric-specific data features"段写 13,499 distinct hospital admissions,Table 1/2 均为 13,449——原文自相矛盾。本条目采用 Table 口径 13,449。
存照 C(表名与表数):诊断字典表名论文写 D_ICD_DIAGNOSES、PhysioNet 页面写 D_DIAGNOSES_ICD——以实际装载文件为准;论文 Table 1 的 16 表为 v1.0 口径,v1.1.0 新增 SURGERY_INFO(官方 Release Notes 确认),实际表数 17;OR_EXAM_REPORTS 的报告文本"未来将标准化并发布"截至本条目撰写未见发布。
存照 D(ICU 死亡 vs 院内死亡):正文院内死亡率 7.1%、Table 2 合计 7.2%(971 例)——四舍五入差异;ICU 内死亡 6.9%(955 例)另计;两者差 16 例 = 出院后院内其他单元死亡。
存照 E(二手综述):MDPI Bioengineering 13(9):978(2026)的"10 项研究、四大基质特性、三条主张"与本条目 §6.5-6.6 的转述为二手综合;其 13,944 ICU stays 与论文 13,941 不一致,弃用。综述原文结论请以其 DOI 为准引用。
存照 F(翻译覆盖):双语字典的人工翻译覆盖规模(术语总数、复核轮次)官方未公布;数据行层面的翻译覆盖率未见统计——使用前抽查。
存照 G(家庭偏移):同一家庭多名患儿的日期偏移量是否一致官方未说明(§8.2 残余风险)。
存照 H(体重字段):体重数据的字段位置与测量频率官方未单独说明;本条目"体重可从 CHARTEVENTS 获得"的表述基于儿科 ICU 常规记录实践与论文 fluid balance 上下文,使用前以实际表结构核实。
存照 I(多次住院口径):468 人(3.6%)多次住院为论文正文口径;其"多次"的阈值定义(≥2 次)官方未逐字说明,本条目按上下文理解为 >1 次住院。
存照 J(系统迁移史):2010-2018 间 ZUCH 信息系统(EMR/LIS/AIMS)的版本迁移与设备更换记录官方未公布——时间漂移研究的归因分析存在元信息缺口。
存照 K(保险字段):支付方式/保险类型字段的存在性与编码官方页面与论文均未列明——公平性分析的前提核查项。
10.2 引文清单
- Li, H., Zeng, X., & Yu, G. (2020). Paediatric Intensive Care database (version 1.1.0). PhysioNet. https://doi.org/10.13026/32x9-wv38. RRID: SCR_007345
- Zeng, X., Yu, G., Lu, Y., Tan, L., Wu, X., Shi, S., Duan, H., Shu, Q., & Li, H. (2020). PIC, a paediatric-specific intensive care database. Scientific Data, 7, 14. https://doi.org/10.1038/s41597-020-0355-4(PMID 31932583, PMCID PMC6957490)
- Johnson, A. E. W., Pollard, T. J., Shen, L., et al. (2016). MIMIC-III, a freely accessible critical care database. Scientific Data, 3, 160035. https://doi.org/10.1038/sdata.2016.35
- Pollard, T. J., et al. (2018). The eICU Collaborative Research Database. Scientific Data. https://doi.org/10.1038/sdata.2018.178
- Czaja, A. S. (2016). Children Are Not Just Little Adults. Pediatric Critical Care Medicine. https://doi.org/10.1097/PCC.0000000000000597
- Pollard, T., Moody, B. E., Lehman, L., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health. https://doi.org/10.1038/s44360-026-00096-z
- MDPI Bioengineering (2026). Machine Learning on the Pediatric Intensive Care (PIC) Database: PIC-Powered Prediction. Bioengineering, 13(9), 978.(二手综述,存照 E)
- ZUCH PIC 官方文档站. http://pic.nbscn.org(引用统计截至 2025-05)
- PIC 论文图与代码. https://github.com/Healthink/PIC
- PhysioNet (2025-09-24). Use of MIMIC Data with Large Language Models and Online Services.(官方政策公告)
10.3 系列条目关系
- 上游师承:mimiciv(rid 592)/ MIMIC-III(491)——PIC 的 schema 与治理协议模板;
- 平行对照:phenotype-annotations-mimic(rid 594)——人工金标准 vs NLP 自动抽取的标签谱系两端;nosocomial-risk-mimic(rid 593)——MIMIC 派生工程的第三种姿势;
- 生态位:全球唯一"0-18 岁全谱 + 关系型 EHR 深度 + 国际开放"的儿科 ICU 数据资产;
- 待续:若官方发布 v1.2(检查报告文本标准化)或 PIC-MIMIC 联合对齐资源,本条目需增补。
10.4 变更日志
- 2026-09-20:初版发布(v1.1.0 口径;基于 PhysioNet 官方页 + Scientific Data 2020 论文(Europe PMC 全文)+ 官方文档站三方交叉核查;8 条存照落档;批次元数据"英国"笔误已勘误入 §0/存照 A)。本篇为批次 4(order 486-495,EHR/ICU 主题)收官第 10 篇。
本条目为千方病案医数集 AI-Ready 系列第 495 号条目,批次 4(EHR/ICU 主题,order 486-495)收官篇。
欢迎对照同门条目(mimiciv / nosocomial-risk-mimic / phenotype-annotations-mimic)阅读,构成 MIMIC 生态的完整方法学光谱。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimiciii — 共享标签:电子健康记录 / 医疗NLP
- nosocomial-risk-mimic — 共享标签:电子健康记录 / 医疗NLP
- phenotype-annotations-mimic — 共享标签:电子健康记录 / 医疗NLP
- stroke-scale-mimic-iii — 共享标签:电子健康记录 / 医疗NLP
- synthetic-mimic-iii-health-gym — 共享标签:电子健康记录 / 医疗NLP
- trec-pm — 共享标签:电子健康记录 / 医疗NLP
- emrqa — 共享标签:电子健康记录 / 医疗NLP
- aact — 共享标签:电子健康记录 / 医疗NLP
- loinc — 共享标签:电子健康记录 / 医疗NLP
- chinese-critical-care-database — 共享标签:电子健康记录 / 医疗NLP
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

