GOSSIS-1 — 全球重症时序 AI-Ready Wikipedia

三国 366 家医院 380,280 例重症住院的死亡率预测基准

来源 MIT Laboratory for Computational Physiology(PhysioNet 托管,GOSSIS 联盟) url: https://physionet.org/content/gossis-1-eicu/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 25
GOSSIS-1 — 全球重症时序 AI-Ready Wikipedia

信息速览

数据集名称GOSSIS-1 — 全球重症时序 AI-Ready Wikipedia
数据类型131,051 例 ICU 住院,204 家美国医院,216 列原始特征,3 个 CSV.gz 文件,PhysioNet 凭证化获取
规模131,051 例 ICU 住院(PhysioNet 公开子集);GOSSIS-1 总训练池约 380,280 例
接入方式MIT Laboratory for Computational Physiology(PhysioNet 托管,GOSSIS 联盟) url: https://physionet.org/content/gossis-1-eicu/
AI 就绪度

GOSSIS-1 全球重症时序 — 三国重症死亡率预测基准数据集 AI-Ready Wikipedia

INFOBOX

字段 内容
数据集名称 GOSSIS-1 全球重症时序(公开版本:GOSSIS-1-eICU)
英文全称 GOSSIS-1-eICU, the
英文全称 GOSSIS-1-eICU, the eICU-CRD subset of the Global Open Sou subset of the Global Open Source Severity of Illness Score (GOSSIS-1) dataset
别名/简称 GOSSIS-1;GOSSIS-1-eICU;Global Open Source Severity of Illness Score
疾病分类(ICD-11 编码+中文名) 危重症谱系(近似映射):脓毒症 1G40、感染性休克 1G41、急性呼吸衰竭 NB20、急性肾损伤 GB60
SNOMED CT Sepsis(disorder)91302008 等危重症概念(近似映射,以官方术语浏览器为准)
数据模态 EHR/ICU 重症电子病历聚合特征(24 小时极值宽表)
AI 任务类型 院内死亡率预测(二分类)、严重程度评分校准、缺失数据方法研究
样本总数 131,051 例 ICU 住院、204 家医院(公开子集);GOSSIS-1 训练池合计约 380,280 例、366 家医院、3 个国家
数据格式 CSV.gz 宽表 × 3 + variable-definitions.yaml + apache_diagnosis_map.csv
许可证 PhysioNet Credentialed Health Data License 1.5.0(按 eICU-CRD 同等使用条款)
访问级别 申请审核(PhysioNet Credentialed Access,签署 DUA)
DUO 标签 GRU(通用研究使用)
语言 英语
首发日期 2022-07-20
最后更新 2022-07-20(v1.0.0,随论文发表同步发布)
发布机构 MIT Laboratory for Computational Physiology(GOSSIS 联盟;Philips 与 ANZICS 支持)
官方主页 https://physionet.org/content/gossis-1-eicu/
下载地址 https://physionet.org/content/gossis-1-eicu/1.0.0/(凭证用户登录后下载)
DOI 10.13026/gbmg-a531
引用次数 44+(Google Scholar,截至 2026-09,对应 GOSSIS-1 论文)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方 70/30 划分、model-ready 插补版、variable-definitions.yaml 与 R 语言复现包齐备;扣分项:需凭证化申请、复现代码为 R 生态、公开子集仅覆盖美国
页面状态 published

§0 E-E-A-T 声明与免责

医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(危重症谱系 ICD-11 与 SNOMED CT 近似映射、重症评分临床任务定义)、§7 偏倚分析(跨注册库病例组合差异、时代漂移与公平性讨论)。

数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典(216 列原始宽表与 model-ready 版本字段语义)、§5 数据划分策略(官方 partition 与医院分组交叉验证)、§6 预处理 Pipeline 和坑点(缺失插补、APACHE 派生列泄漏防护、回链 eICU-CRD 的复现约束)。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。GOSSIS-1-eICU 要求用户通过 PhysioNet 凭证化(Credentialed)审核、签署数据使用协议(DUA),并按 eICU-CRD 同等使用条款处理数据,不得与未授权用户共享。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§1 数据集概览

§1.0 📌 30 秒速览

这是什么? GOSSIS-1 是全球首个开源、免费的 ICU 严重程度评分算法家族的第一代版本,由 MIT 计算生理学实验室联合澳大利亚与新西兰重症医学会(ANZICS)开发。它的公开数据载体 GOSSIS-1-eICU 收录了 2014-2015 年 204 家美国医院的 131,051 例 ICU 住院,把每位患者入住前 24 小时的心率、血压、化验、GCS 等信息汇总成一张 216 列的宽表,并附带院内死亡结局标签与官方训练测试划分。

为什么重要? 严重程度评分是 ICU 资源配置、临床研究与质量控制的基础标尺,但传统评分(APACHE 系列)闭源且校准逐年漂移。GOSSIS-1 用跨越澳、新、美三国 366 家医院、约 380,280 例住院的数据训练,在测试集上取得 AUROC 0.918、SMR 0.986 的表现,同时公开了从数据提取、缺失插补到预测生成的全部代码,让「评分黑箱」第一次可以被任何人复现和审计。

我能用它做什么? 你可以把它当作死亡率预测的即插即用基准(直接与你的模型对比 AUROC/Brier/SMR),也可以利用它的 model-ready 插补版本研究缺失数据方法、类别不平衡与跨医院泛化,还能通过 patientunitstayid 回链 eICU-CRD 扩展出时序、文本等更丰富的下游任务。

§1.1 技术摘要

GOSSIS-1 的开发管线可分为四步:第一步,合并两个异构多中心重症数据库——澳大利亚与新西兰的 第一步,合并两个异构多中心重症数据库——澳大利亚与新西兰的 ANZICS-APD 注册库(249,229 例住院、162 家医院)与美国的 注册库(249,229 例住院、162 家医院)与美国的 eICU-CRD 电子病历数据库(131,051 例住院、204 家医院),两者统一为 2014-2015 年出院、住院时长大于 6 小时、年龄不低于 16 岁的首次 ICU 住院队列(Raffa et al. 2022)。第二步,对 ICU 前 24 小时内的生命体征与化验值提取极值特征,与 GCS、慢性合并症、入院诊断和人口学变量一起构成统一特征空间,并开发了一套客观的缺失插补方法以弥合两个数据库在采集变量上的差异。第三步,以 70%/30% 划分训练集与测试集,以可解释性为优先训练院内死亡率预测模型,诊断变量采用嵌套随机效应建模。第四步,在三个国家的测试集上评估:总体 AUROC 0.918(95% CI 0.915-0.921)、SMR 0.986(95% CI 0.966-1.005)、Brier 分数 0.050,优于 APACHE-IIIj 与 APACHE-IVa。PhysioNet 上的 GOSSIS-1-eICU 项目公开发布了原始宽表、插补后的 model-ready 版本、GOSSIS-1 预测概率,以及全部提取与建模代码(PhysioNet 官方页面)。

§1.2 战略价值

维度一:开源替代闭源商业评分。 APACHE-IV 等主流严重程度评分受商业许可保护,其变量权重从不公开,研究者只能拿到预测概率而无法审计模型内部。GOSSIS-1 反其道而行:模型代码(GitHub 上的 MIT-LCP/gossis 仓库与 jraffa/rGOSSIS1 R 包)、特征定义(variable-definitions.yaml)、诊断码映射(apache_diagnosis_map.csv)全部开源,权重可查、管线可跑、结果可复现。对需要校准外部死亡率模型的中国研究者而言,这是少有的「能看懂每一行」的三国级参考实现,其插补与跨库协调方法论(如诊断变量的嵌套随机效应)可直接迁移到国内 ICU 注册库建设。

维度二:跨医疗系统泛化的设计样板。 大多数 ICU 数据集诞生于单一医院或单一国家,模型在出口之外的表现常断崖式下跌。GOSSIS 联盟从第一天就把「跨系统泛化」作为设计目标:两个源数据库在病例组合、入院变量与平均生理状态上差异显著,论文系统性报告了合并与分库两种口径下的性能,并证明统一模型在三国内部均保持校准。这种「先协调、再合并、分层验证」的范式,为多国、多中心 AI 医疗数据工程提供了一个完整的工作样例。

§1.3 同类数据集横向对比

数据集 规模 地域/时间 数据形态 死亡标签 差异化定位
GOSSIS-1-eICU 131,051 例住院 / 204 院 美国,2014-15 24 小时极值宽表(一行一住院) 院内死亡 附官方插补版 + 开源评分预测概率
eICU-CRD 约 200,000 例住院 / 200+ 院 美国,2014-15 关系型数据库(时序明细) 院内死亡 GOSSIS-1-eICU 的上游源库
内死亡 GOSSIS-1-eICU 的上游源库
MIMIC-III 40,000+ 患者 美国单中心,2001-12 40,000+ 患者 美国单中心,2001-12 关系型数据库(含文本)
HiRID 约 3.4 万例住院 瑞士单中心,2008-16 2 分钟粒度时序 出院结局 时序分辨率最高的公开 ICU 库
出院结局 时序分辨率最高的公开 ICU 库
AmsterdamUMCdb 欧洲多概念单中心 荷兰,2003-16 关系型 欧洲多概念单中心 荷兰,2003-16
ANZICS-APD(GOSSIS 部分) 249,229 例住院 / 162 院 澳+新,2014-15 注册库级聚合 院内死亡 未随 GOSSIS-1-eICU 公开再分发

§1.4 版本时间轴

版本 日期 关键变化 来源
1.0.0 2022-07-20 初始发布:三个数据文件 + 变量定义 + 诊断映射,与 Critical Care Medicine 论文同步 PhysioNet Release Notes

§1.5 典型应用场景

  1. 死亡率模型基准测试:以官方 partition 划分复现 GOSSIS-1(测试集 AUROC 0.904,eICU 子集口径),作为新模型的强基线。
  2. 缺失数据方法研究:源库化验按医嘱执行、缺失比例高且非随机,是检验 MNAR 插补与「是否测量」指示变量方法的天然试验场。
  3. 跨医院泛化与公平性评估:hospitalid 支持按院分层评估,ethnicity 列支持子集公平性审计(论文明示该列未参与建模、仅供评估)。
  4. 严重程度评分工程:对照 APACHE 诊断体系(apache_3j_bodysystem 等)研究评分变量选择、极值特征构造与校准指标(SMR、Brier)。
  5. 回链扩展研究:凭 eICU-CRD 访问权限将宽表回链至时序明细、护理记录与实验室原始时间戳,扩展为多模态任务。

§2 医学背景

§2.1 疾病与任务概念的 ICD-11 编码表

GOSSIS-1 覆盖 ICU 全病种谱系,其诊断轴心是 APACHE-II/IIIj 诊断编码与体系统计(bodysystem)。下表给出与 GOSSIS 数据高频相关的危重症概念在 ICD-11 中的近似映射,编码仅供检索对齐使用,临床编码请以 WHO ICD-11 官方浏览器的最新版本为准。

标签/概念 ICD-11 编码 ICD-11 中文名 备注
Sepsis 1G40 脓毒症 ICU 死亡率贡献最高的病种之一
Septic shock 1G41 感染性休克 常与 1G40 连用编码
Acute respiratory failure NB20 急性呼吸衰竭 机械通气队列核心结局相关诊断
Acute kidney injury GB60 急性肾损伤 与化验极值特征(肌酐、尿素)强关联
Cardiac arrhythmias(节段) BC70-BC8Z 心律失常 对应 apache_3j_bodysystem 的心血管类

§2.1b SNOMED CT 映射表

标签/概念 ICD-11 SNOMED CT 码 SNOMED 术语
Sepsis 1G40 91302008 Sepsis (disorder)
Acute respiratory failure NB20 405410006 Acute respiratory failure (disorder)
In-hospital death(结局标签) — 397861000 Death in hospital (event)(近似概念,映射仅供参考)
Glasgow Coma Scale(评估轴) — 248242004 Glasgow coma scale observable

§2.2 疾病背景与流行病学

重症医学的 Severity of Illness(SOI)评分起源于 1980 年代,核心思想是用入院初期可观测的生理紊乱程度预测院内死亡概率,从而在不依赖医生主观判断的情况下校准不同 ICU、不同患者群体之间的风险比较。APACHE-II/III/IV 是这一谱系中最著名的商业实现:APACHE-IIIj 在澳新注册库、APACHE-IVa 在美国 eICU 体系中分别负责「预期死亡率」的计算,SMR(实际死亡数与预期死亡数之比)由此成为 ICU 质量审计的核心指标。然而这些模型变量权重闭源、训练数据年代久远,校准随时间与医疗实践变迁持续漂移——这正是 GOSSIS 项目的立题动机:用现代、开源、跨国的数据与代码重建这一基础标尺。

从流行病学视角,ICU 住院人群的院内死亡率通常在个位数百分比量级并随病例组合波动,脓毒症、呼吸衰竭与心源性危象是最常见的致死通路。GOSSIS-1 的训练池覆盖三国 366 家医院、约 380,280 例住院,病例组合在入院变量与平均生理状态上呈现显著异质性(Raffa et al. 2022),这既是建模难点,也是其泛化能力的价值来源。

§2.3 临床任务定义

任务 类型 输入 输出 GOSSIS-1 中的实现
院内死亡率预测 二分类(预后) 前 24 小时极值、GCS、合并症、诊断、人口学 院内死亡概率 gossis1_ihm_pred 概率列
严重程度校准 概率校准 同上 预期死亡率(供 SMR 计算) SMR 0.986(总体测试集)
跨库风险协调 数据工程 ANZICS-APD + eICU-CRD 统一特征空间 插补算法 + 嵌套随机效应诊断建模

与筛查/诊断类任务不同,SOI 评分是回顾性、全人群的预后任务:它不追求在个体层面指导治疗决策,而是追求群体层面的概率校准——这决定了其评估指标体系以 AUROC、Brier 分数与 SMR 为三支柱,而非精确率/召回率。

§2.4 患者人群表

属性 描述
数据来源 eICU-CRD(美国远程 ICU 协作数据库)+ ANZICS-APD(澳新成人患者数据库)
时间窗口 2014-2015 年出院的 ICU 住院
年龄 ≥16 岁(89 岁以上按 eICU 惯例归入年龄上限箱体)
住院时长 ICU 住院 > 6 小时
复住 排除前序 ICU 住院(仅首次住院入组)
结局完整性 排除结局缺失或全程无心率记录者
种族/性别分布 官方文献未公布汇总分布,可通过原始文件的 ethnicity、gender 列自行统计(ethnicity 仅供子集评估、未参与建模)
医院 公开子集 204 家美国医院;训练池合计 366 家医院、3 个国家

§2.5 临床价值

对临床研究者,GOSSIS-1 提供了可审计的「预期死亡率」参照系:任何科室、任何队列的 SMR 审计都需要一个校准良好的期望值来源,GOSSIS-1 在三国数据上的 SMR 0.986 表明其群体校准达到标杆水平。对数据科学家,它是极少数同时给出「原始特征 + 插补特征 + 官方预测概率」三层数据的临床数据集,允许你在任意一层介入并与官方结果对表。对政策与运营研究者,其医院级标识(hospitalid)支持按院分层分析,为 ICU 资源配置与质量改进提供了低门槛的实验田。

§2.6 金标准对照表

维度 内容
划分 官方 partition 变量:训练 70% / 测试 30%(eICU 子集测试集 39,318 例)
标注方式 自动抽取:hospital_death 直接取自 eICU-CRD 结局字段,无人工标注环节
标注者资质 不适用(结构化结局字段,非人工判读)
标注性质 回顾性、全量、无抽样偏差(除纳入排除标准外)
参照基线 APACHE-IIIj(ANZICS 子集)与 APACHE-IVa(eICU 子集)官方预测概率

§2.7 APACHE 评分体系谱系与 GOSSIS 的位置

理解 GOSSIS 必须先理解它挑战的对象——APACHE(Acute Physiology And Chronic Health Evaluation)评分体系:

世代 年份 要点 与本数据集的关系
APACHE II 1985(Knaus 等) 12 项生理指标 + 年龄 + 慢性健康,手工计分 raw 表 apache_2_diagnosis / apache_2_bodysystem 列的来源
APACHE III 1991 加入更多生理变量与诊断权重,配 proprietary 权重 apache_3j_diagnosis 码与 11 诊断组的来源
APACHE IIIj / APACHE IV 2006 前后(Zimmerman 等) 澳新(j 版)与美国版本分化,回归式死亡概率 apache_4a_hospital_death_prob / apache_4a_icu_death_prob 两列的来源
GOSSIS-1 2017 年发起,2022 发表 开源、跨注册库训练、以公开方法对标商业评分 本条目主角:随机森林等机器学习替代 APACHE 回归

GOSSIS 的方法学立场:APACHE 的权重绑定特定注册库与年代,跨库迁移需重新拟合且公式不公开;GOSSIS 用三国注册库训练开源模型,把「评分系统」本身变成可审查、可复现、可本地重校准的软件工件。这正是 §8.1 中校准对比(SMR 0.986 vs 0.594)的方法学意义所在。

§3 数据集规格

§3.0 版本抉择矩阵

GOSSIS-1-eICU 为单版本发布(v1.0.0),但三个数据文件面向不同需求,选用哪个文件是使用本数据集的第一个决策点。

你的需求 推荐文件 特征规模 理由
复现 GOSSIS-1 论文 / 研究特征工程 gossis-1-eicu-only.csv.gz 216 列(原始,最少清洗) 保留原始极值、结局与评估用人口学变量,配合 rGOSSIS1 可完整复现管线
快速训练自己的死亡率模型 gossis-1-eicu-only-model-ready.csv.gz 约 68 个建模特征 官方已完成插补与极值转换(d1_avg/d1_diff),含 partition 划分,可直接入模
与 GOSSIS-1 对比性能 / 做校准研究 gossis-1-eicu-predictions.csv.gz 2 列 官方预测概率 gossis1_ihm_pred,可直接计算 AUROC/Brier/SMR

§3.1 模态详情

GOSSIS-1-eICU 属于聚合型表格模态,而非逐小时时序:每个 ICU 住院压缩为一行,特征来自三个时间与来源维度。其一是 ICU 前 24 小时内的生理极值——心率、血压、呼吸频率、体温、血氧等约十余个生命体征通道各自提取最小值(d1_min)与最大值(d1max),model-ready 版本再转置为中点(d1avg)与波动幅度(d1_diff);其二是同窗口内的实验室检验极值(尿素、肌酐、血糖、白细胞、血气等);其三是入院静态信息——年龄、性别、种族、入院诊断(APACHE-II 与 APACHE-IIIj 双体系编码 + 体系统计)、GCS、机械通气与插管状态、以及糖尿病等慢性合并症。需要特别注意:原始文件保留约 216 列,其中既包含建模特征,也包含用于子集评估的结局与人口学列(如 ethnicity),第三方索引统计 model-ready 版本的建模特征约为 68 个(Sefnet 索引)。

§3.2 按子集样本数表

子集 样本数 医院数 国家/地区 公开状态
GOSSIS-1-eICU(PhysioNet) 131,051 例住院 204 美国 凭证化公开
GOSSIS-1-ANZICS(ANZICS-APD 部分) 249,229 例住院 162 澳大利亚 + 新西兰 未在 PhysioNet 公开再分发
GOSSIS-1 训练池合计 约 380,280 例住院 366 3 个国家 —
eICU 测试集(partition=Test) 39,318 例 — 美国 随 partition 列公开

§3.3 格式表

文件 格式 结构 附注
gossis-1-eicu-only.csv.gz gzip 压缩 CSV 131,051 行 × 216 列,表头含变量名 原始特征 + 结局 + 评估用变量,最少清洗
gossis-1-eicu-only-model-ready.csv.gz gzip 压缩 CSV 131,051 行,建模特征列 插补完成,d1_*_min/max 已转置为 avg/diff,含 partition 列
gossis-1-eicu-predictions.csv.gz gzip 压缩 CSV 131,051 行 × 2 列 patientunitstayid + gossis1_ihm_pred
variable-definitions.yaml YAML 每变量:有效值、取值范围、简述 与论文补充材料表 1/2 对应
apache_diagnosis_map.csv CSV 诊断码映射 覆盖 apache_3j_diagnosis、apache_2_diagnosis 及两个 bodysystem 列

§3.4 存储大小

官方页面未公布各文件解压前后的精确字节数。可参考的量级估算:131,051 行 × 216 列的数值/类别混合宽表经 gzip 压缩后通常在数十 MB 量级,解压后内存占用约数百 MB,普通笔记本(16 GB 内存)用 pandas 可整表加载,无需分布式设施。以实际下载页列出的文件大小为准。

§3.5 标注方式

本数据集不存在人工标注环节。核心标签 hospital_death 是 eICU-CRD 中随出院自动沉淀的结构化结局字段;诊断标签来自医院编码工作流的 APACHE-II/IIIj 结构化诊断码;GCS、机械通气等状态变量来自床旁信息系统录入。换言之,这是典型的「临床过程数据即标注」弱监督形态:标签覆盖率 100%,但语义质量受制于上游录入质量。

§3.6 标注者资质与一致性

不适用人工一致性统计(无标注者)。间接质量证据有二:其一,eICU-CRD 的去标识化流程经 Privacert 认证符合 HIPAA Safe Harbor(认证编号 1031219-2),说明上游治理达到规范水平;其二,GOSSIS-1 论文以 SMR 0.986(95% CI 0.966-1.005)的校准间接验证了结局字段的完整性与一致性——若死亡结局存在系统性漏登,SMR 将显著偏离 1。

§3.7 采集周期

源数据采集于 2014-2015 年(eICU-CRD 的完整覆盖期);数据集发布于 2022-07-20。特征窗口为每次 ICU 住院的前 24 小时,标签窗口为直至出院的完整院内病程。

§3.8 地域覆盖

公开子集覆盖美国 204 家医院的 ICU(隶属 eICU 远程重症监护项目的医院体系);GOSSIS-1 模型训练池另含澳大利亚与新西兰的 162 家注册医院。三国覆盖是 GOSSIS 的核心卖点,但研究者须牢记:PhysioNet 公开文件仅含美国部分,跨国泛化结论无法仅凭公开数据复现。

§3.9 设备规格

数据来源于 ICU 标准监护与信息系统,包括床旁监护仪(心率、血压、血氧等通道)、呼吸机状态参数、实验室信息系统(LIS)的检验结果与护理信息系统的 GCS/出入量记录。设备型号、采样频率与各院信息系统品牌等元数据未随数据集发布——这也是它被视为「聚合表格」而非「设备时序」的原因。

§3.10 深度溯源链

层级 内容 可追溯性
L0 源库 eICU-CRD 关系型数据库(约 200,000 例住院、200+ 医院) 凭证化申请 eICU-CRD 可回链(patientunitstayid、hospitalid)
L1 提取 MIT-LCP/gossis 仓库中的提取代码按纳入排除标准生成 GOSSIS-1-eICU 代码开源,可复跑
L2 发布 PhysioNet GOSSIS-1-eICU v1.0.0(2022-07-20,DOI 10.13026/gbmg-a531) 版本快照固定
L3 建模 rGOSSIS1 包的 preprocess_data → impute_data(算法 3)→ prepare_fit → gpredict 生成 model-ready 与预测概率 R 代码开源
L4 论文 Raffa et al., Crit Care Med 2022;50(7):1040-1050 PMID 35354159

§4 数据结构详解

§4.0 三个文件全景与目录树

GOSSIS-1-eICU v1.0.0 的发布物极简:三个 CSV(gzip 压缩)加两份元数据文档,没有关系表、没有嵌套结构。理解「raw 与 model-ready 是同一批患者的两种视图」是上手的第一步:

physionet.org/files/gossis-1-eicu/1.0.0/
├── gossis-1-eicu-only.csv.gz              # 原始宽表:131,051 例住院 × 216 列(含目标与 partition)
├── gossis-1-eicu-only-model-ready.csv.gz  # 建模宽表:同批住院,插补后约 68 特征 + 标签 + partition
├── gossis-1-eicu-predictions.csv.gz       # 论文模型输出:patientunitstayid + gossis1_ihm_pred 两列
├── variable-definitions.yaml              # 三份 CSV 全部字段的机器可读定义(名称/类型/描述)
├── apache_diagnosis_map.csv               # APACHE IIIj / APACHE II 诊断码 → 诊断组映射
└── SHA256SUMS.txt                         # 完整性校验

三份 CSV 的关系:

文件 行 列 用途
gossis-1-eicu-only.csv.gz 131,051 216 保留原始缺失语义与全部口径,适合方法学研究与自定义插补
gossis-1-eicu-only-model-ready.csv.gz 131,051 约 68 特征 官方插补后、可直接喂给分类器的版本,适合快速基线与复现
gossis-1-eicu-predictions.csv.gz 131,051 2 论文随机森林模型对每例住院的院内死亡概率,供再校准与元分析

§4.1 主键与连接关系

键 位置 说明
patientunitstayid 三份 CSV 均有 eICU-CRD 主键,一次 ICU 入住一行;本数据集粒度为「每住院一行」
patientHealthcareYear / patient_id raw 表(eICU 侧) 同一患者多次入住的分组线索;患者级划分时需用它聚合
hospitalid raw 表 204 家医院的机构标识,医院级 GroupKFold 的分组键
apache_3j_diagnosis / apache_2_diagnosis raw 表 与 apache_diagnosis_map.csv 连接得到诊断组
gossis1_ihm_pred predictions 表 经 patientunitstayid 左连接到任意一张宽表

与上游 eICU-CRD 的回链:持有效 eICU-CRD 凭证者可用 patientunitstayid / hospitalid 连接 eICU-CRD 的 patient、lab、vitalPeriodic 等关系表,还原住院级时序细节(见坑点 8)。

§4.2 raw 表 216 列分组字典

216 列按前缀天然分为六组(列名以 variable-definitions.yaml 为准):

组 代表列(前缀) 说明
标识与场景(约 9 列) encounter_id, patient_id, hospital_id, hospital_admit_source, icu_admit_source, icu_stay_type, icu_type, pre_icu_los_days, readmission_status 住院/患者/医院三级标识与入住上下文;pre_icu_los_days 为入 ICU 前住院时长(天)
人口学(5 列) age, gender, ethnicity, height, weight age 为表观年龄,91 以上统一记录为 91(HIPAA 委托箱处理);height/weight 缺失率均超过两成
APACHE 派生(约 30 列) apache_4a_hospital_death_prob, apache_4a_icu_death_prob, apache_3j_diagnosis, apache_2_diagnosis, apache_3j_bodysystem, apache_2_bodysystem 官方评分系统输出的死亡概率、诊断码与诊断组(Cardiovascular / Respiratory / Sepsis / Trauma 等 11 类)
第一小时极值(d1_ 前缀,约 140 列中的大半) d1_heart_rate_min/max/mean, d1_mbp_invasive_, d1_spo2_, d1_temp_, d1_glucose_, d1_creatinine_, d1_wbc_, d1_bilirubin_, d1_inr_, d1_lactate_* 入 ICU 后第一个 24 小时的每项测量的最小/最大/(部分有)均值;invasive / noninvasive 后缀区分有创与无创血压
第二个 24 小时(h1_ 前缀) h1_heart_rate_, h1_mbp_, h1_spo2_, h1_temp_, h1_glucose_, h1_creatinine_ 等 与 d1_ 同构;h1 覆盖时间窗更短、列缺失率更高
慢性病与既往史(9 列 0/1) aids, cirrhosis, diabetes_mellitus, hepatic_failure, immunosuppression, leukemia, lymphoma, solid_tumor_with_metastatic_event, elective_surgery APACHE III/IV 定义的慢性健康评分条目,二值标志位

另有两个特殊列:gcs_eyes_apache / gcs_motor_apache / gcs_verbal_apache(GCS 分项,取值 1-4 / 1-6 / 1-5,「无法评估 un trainable」单独编码),以及目标列 hospital_death(0/1,院内死亡)与划分列 partition(train / test)。

§4.2b model-ready 代表性字段字典

下表列出 model-ready 版本中最常用的代表字段(完整清单以随附 variable-definitions.yaml 为准):

字段 类型 语义 建模提示
patientunitstayid int eICU 住院主键 连接键,勿作特征
hospital_death int (0/1) 院内死亡标签 官方任务靶标
partition str train / test 评估口径开关(坑点 1)
age float 表观年龄(岁) 91 为委托箱顶格值
gender str M / F 少量空白
ethnicity str 2014-2015 抽象口径 低频类先归组再评估(公平性)
height / weight float cm / kg 缺失率均超两成
apache_4a_hospital_death_prob float APACHE IV 院内死亡概率 泄漏敏感列(坑点 3)
apache_4a_icu_death_prob float APACHE IV ICU 死亡概率 同上
apache_3j_bodysystem str 11 类诊断组 分层评估的分组列
elective_surgery int (0/1) 择期手术标志 后验信息,慎作入科特征
d1_heartrate_avg float 首个 24h 心率 (min+max)/2 插补后语义(坑点 2)
d1_heartrate_diff float 首个 24h 心率 max−min 波动代理,非真实轨迹
d1_mbp_noninvasive_avg float 无创平均动脉压均值 invasive / noninvasive 双通道并存
d1_spo2_avg float 血氧饱和度均值 监护仪采样极值聚合
d1_temp_avg float 体温(℃)均值 跨院测量部位差异未标注
d1_glucose_avg float 血糖(mg/dL) 部分来自床旁快测
d1_creatinine_avg float 肌酐 MNAR 缺失代表列
d1_wbc_max float 白细胞上限 感染分层常用
h1_* 同构列 float 第二个 24h 同构统计量 覆盖窗更短、缺失更高
gcs_eyes_apache 等 int GCS 分项(1-4/1-6/1-5) un trainable 单独编码
aids, cirrhosis, …(9 列) int (0/1) 慢性合并症标志 APACHE 慢性健康条目

§4.3 model-ready 表的转换规则

model-ready 版本不是 raw 的简单子集,rGOSSIS1 的预处理应用了三条确定性规则:

规则 raw 形态 model-ready 形态 动机
极值收缩 d1_x_min / d1_x_max d1_x_avg = (min+max)/2,d1_x_diff = max−min 把区间信息压成两个统计量,避免宽表爆炸
缺失插补 空白(未测量) 分位数/中位数插补(算法 3,按医院与诊断组分层) 分类器无法直接吃 NaN
列筛选 216 列 约 68 特征 + hospital_death + partition 去掉标识列、低信息列与冗余分箱

语义警告:插补后的 d1_x_avg 已经不再是「真实测量均值」——当 min/max 均缺失时它来自分层中位数;d1_x_diff 也因此与真实波动幅度解耦。做缺失机制研究或校准分析必须回到 raw 表(见坑点 6)。

§4.3b 标签与诊断组分布

标签为二值院内死亡,整体呈中等不平衡(院内死亡率约在 8-10% 量级);官方按注册库(澳新 vs 美国)分层报告分布与性能,精确分层比例以论文表 1 为准,本条目不转引中间精度数字以免口径漂移。

APACHE IIIj 诊断组(apache_3j_bodysystem,11 类):

诊断组 中文 典型场景
Cardiovascular 心血管 心源性休克、心律失常、心衰
Respiratory 呼吸 呼吸衰竭、ARDS、COPD 急性加重
Neurological 神经 脑卒中、颅内出血、癫痫持续状态
Gastrointestinal 消化 消化道出血、急性胰腺炎、肠梗阻
Genitourinary 泌尿生殖 急性肾损伤、尿源性脓毒症
Metabolic 代谢 糖尿病酮症酸中毒、严重电解质紊乱
Haematologic 血液 溶血、凝血病
Sepsis 脓毒症 感染性休克(对应 ICD-11 1G40/1G41 谱系)
Trauma 创伤 多发伤、术后创伤监护
Musculoskeletal & skin 肌肉骨骼与皮肤 软组织感染等
Miscellaneous 其他 未归入上述组别

分层评估建议:Sepsis 与 Respiratory 两组样本量最大、死亡阳性率最高,是「模型在哪类病人身上失效」的第一排查现场;Haematologic 等小组仅报规模不报点估计(参见 §7.5 公平性代码的同款逻辑)。

§4.4 缺失值语义

类型 典型列 机制 处理建议
结构性缺失 h1_lactate_max(多数医院 ICU 第二个 24h 不常规采血) MNAR(与病情相关才测) 视「缺失本身」为信息:加 has_lactate 指示位或用 raw 表缺失模式特征
低频检验缺失 d1_bilirubin_, d1_inr_, d1_paco2_* MNAR 官方插补已处理;自定义模型可做缺失指示位
记录缺失 height, weight, ethnicity 的少量空白 MAR 中位数/众数插补足够
委托箱 age = 91 人为截断 见坑点 1 之外的统一约定:≥91 岁分箱或直接保留 91

§4.5 编码与单位

  • 年龄:整数岁;>89 岁统一为 91(HIPAA Safe Harbor 的年龄委托箱规则,Privacert 认证 no. 1031219-2)。
  • 性别:M / F(少量空白)。
  • 族裔:eICU 原始字符串(Caucasian / African American / Hispanic / Native American / Asian / Other / Unknown 等),无层级编码。
  • 诊断码:apache_3j_diagnosis 为 APACHE IIIj 数值诊断码,apache_2_diagnosis 为 APACHE II 码;两者经 apache_diagnosis_map.csv 归入 11 个 bodysystem 组。
  • 布尔列:0/1 整数,无字符串 True/False。
  • 单位:温度 ℃、血糖 mg/dL、体重 kg、身高 cm、pre_icu_los_days 天——全库单位统一,无混单位陷阱。

§4.6 与 DAIMS 字段规范的对照

按 DAIMS(Dataset Assessment for Immediate Machine-learning Suitability)字段规范核对:

DAIMS 字段 GOSSIS-1-eICU 现状
RecordSet 行粒度 每行 = 一次 ICU 入住(patientunitstayid 唯一)
字段类型声明 variable-definitions.yaml 提供 YAML 类型与描述,机器可读
标签字段 hospital_death 显式二值
划分字段 partition 列显式 train/test
数据限制声明 论文 Limitations 章节 + PhysioNet 页面注释(非 RCRI 评审版数据)
抽样策略 全体成年 ICU 入住,按各国注册库纳入规则过滤,无随机抽样

§5 数据划分与使用建议

§5.1 官方 partition 列

model-ready 表自带 partition 列(约 70% train / 30% test,按住院随机划分)。论文口径的官方基准数字——总测试集 AUROC 0.918、Brier 0.050、SMR 0.986,以及 eICU 子集测试 39,318 例上 AUROC 0.904(95% CI 0.900-0.909)——都定义在这条 30% 测试带上。复现论文数字的第一步永远是 df[df.partition == 'Test'](见坑点 1:predictions 文件里没有 partition 列,必须自己连回来过滤)。

§5.2 划分策略建议

策略 适用场景 做法
官方 partition 复现论文、与 0.918/0.904 对标 直接用 partition 列,不再动
医院级 GroupKFold 评估跨机构泛化(推荐主指标) 按 hospitalid 分 5-10 折,验证 AUROC 会比随机划分低 2-5 个点
患者级分组 多次入住患者泄漏防护 raw 表按 patient 标识聚合后分组划分
时间外推 部署模拟 eICU-CRD 回链后按入住年份切 2014 train / 2015 test

§5.2b 分组划分代码示例

import numpy as np
from sklearn.model_selection import GroupKFold
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import roc_auc_score

groups = mr["patientunitstayid"].map(
    raw.set_index("patientunitstayid")["hospitalid"]
)
X = mr.drop(columns=["hospital_death", "partition"])
y = mr["hospital_death"]

gkf = GroupKFold(n_splits=5)
scores = []
for tr, te in gkf.split(X, y, groups=groups):
    clf = RandomForestClassifier(n_estimators=300, n_jobs=8, random_state=42)
    clf.fit(X.iloc[tr], y.iloc[tr])
    scores.append(roc_auc_score(y.iloc[te], clf.predict_proba(X.iloc[te])[:, 1]))

print(f"hospital-level AUROC: {np.mean(scores):.4f} ± {np.std(scores):.4f}")

预期观察结果:医院级分数系统性地低于官方随机划分口径(0.904),差值本身就是「模型对未见医院的泛化能力」的量化,应随主结果一并报告。

§5.3 泄漏防护清单

  1. APACHE 死亡概率列(apache_4a_hospital_death_prob / apache_4a_icu_death_prob)是评分系统在入 ICU 24-48 小时后计算的预测值,作为特征会构成「用别的模型的预测当真值」的循环——做纯数据驱动模型时要么剔除,要么单独报告「含 APACHE 概率」与「不含」两组结果(见坑点 3)。
  2. elective_surgery 与 pre_icu_los_days 属于入 ICU 后才能确定的后验信息,入科即时预测场景慎用。
  3. 同一医院同一医生的行高度相关:随机划分下测试集会出现同院患者,虚高泛化表现;用 GroupKFold by hospitalid 交叉检验。
  4. predictions 文件的 gossis1_ihm_pred 不得作为特征再训练「预测预测值」的套娃模型并宣称 SOTA。

§5.4 任务设计建议

任务 标签 基线
院内死亡预测(官方任务) hospital_death 官方随机森林 AUROC 0.918(总)/ 0.904(eICU 测试带)
校准与 SMR 研究 hospital_death 分院聚合 官方 SMR 0.986;APACHE-IIIj 校准 SMR 0.594 对照
诊断组分层评估 apache_3j_bodysystem 分层 论文表 3 按诊断组报告
跨国泛化模拟 训练 162 院 ANZICS 模拟数据 vs eICU 需申请 ANZICS-APD,公开数据无法完成

§5.5 外部验证建议

  • 同源回链:eICU-CRD(约 200,000 例住院、200+ 院)提供 24 小时以外的时序与结局细节,是最自然的外部/扩展验证场。
  • 跨注册库:MIMIC-IV / MIMIC-III(BIDMC 单中心)可做机构迁移测试,但标签口径(院内死亡)与 APACHE 版本需重新对齐(见坑点 5)。
  • 地理外推:HiRID(瑞士,约 3.4 万住院、681 变量、2 分钟粒度)可测试跨国泛化,需将 GOSSIS 宽表特征反推映射到 HiRID 变量。
  • ANZICS-APD:GOSSIS 真正的另一半训练池,但受澳新注册库条款限制不能公开再分发,需自行申请。

§6 AI 就绪指南

§6.0 云端快速启动(BigQuery)

PhysioNet 把三份 CSV 同步镜像到 BigQuery 公共数据集 physionet-data,免下载、免环境:

from google.cloud import bigquery

client = bigquery.Client(project="your-gcp-project")

# 三张表:gossis1_eicu_raw(216 列原始)、
# gossis1_eicu_predvar(建模变量表)、gossis1_eicu_ihmp_pred(预测概率)
sql = """
SELECT partition, COUNT(*) AS n, AVG(hospital_death) AS ihm_rate
FROM `physionet-data.gossis1_eicu_predvar`
GROUP BY partition
"""
print(client.query(sql).to_dataframe())

test_df = client.query(
    "SELECT * FROM `physionet-data.gossis1_eicu_predvar` "
    "WHERE partition = 'Test'"
).to_dataframe()

GCP 免费层每月 1 TB 查询额度远超本数据集全部表扫描需求;与 eICU-CRD / MIMIC-IV 的 BigQuery 镜像同处一个项目,跨库 JOIN 做迁移研究时无需本地拼接。

§6.1 获取流程

1. 注册 PhysioNet 账号并完成 CITI「Data or Specimens Only Research」培训
   (证书上传后通常 1 个工作日内生效)
2. 在 PhysioNet 搜索 GOSSIS-1-eICU,签署/接受 eICU-CRD 同款 DUA
3. 等待 Credentialing(个人凭证化,非机构代理)
4. wget -r -N -c -np --user=<username> --ask-password \
     https://physionet.org/files/gossis-1-eicu/1.0.0/
5. 校验:sha256sum -c SHA256SUMS.txt
6. BigQuery 快速通道:physionet-data.gossis1_eicu_raw / gossis1_eicu_predvar /
   gossis1_eicu_ihmp_pred(免下载,GCP 计费)

许可要点:PhysioNet Credentialed Health Data License 1.5.0——与 eICU-CRD 同条款;数据不得与未授权用户共享;发表时必须引用数据集论文 + DOI + PhysioNet 平台论文三件套。去标识化经 HIPAA Safe Harbor 认证(Privacert no. 1031219-2),属「非人类受试者数据」,多数机构 IRB 可豁免。

§6.2 环境与数据读取

import pandas as pd

raw = pd.read_csv(
    "gossis-1-eicu-only.csv.gz",
    low_memory=False,
)
mr = pd.read_csv("gossis-1-eicu-only-model-ready.csv.gz")
pred = pd.read_csv("gossis-1-eicu-predictions.csv.gz")

print(raw.shape, mr.shape, pred.shape)
# 期望:(131051, 216) (131051, ~70) (131051, 2)

# 复现官方测试集口径
test = mr[mr["partition"] == "Test"]
test_pred = pred.merge(
    mr[["patientunitstayid", "partition"]], on="patientunitstayid"
)
official_test = test_pred[test_pred["partition"] == "Test"]

硬件参考:三份 CSV 压缩包合计不到 100 MB,8 GB 内存的笔记本即可全量载入;无需 GPU 也可复现论文随机森林基线。这正是「预聚合宽表」路线相比 eICU-CRD 全库(数百 GB)的门槛优势。

§6.3 预处理 Pipeline:从 raw 对齐到 model-ready

如果你想用 raw 表自建特征(保留缺失信息),需要实现 rGOSSIS1 的三条转换规则:

import numpy as np

def align_model_ready(df_raw: pd.DataFrame) -> pd.DataFrame:
    """把 raw 表的 d1_/h1_ 极值列转换为 model-ready 的 avg/diff 形态."""
    out = pd.DataFrame(index=df_raw.index)
    for prefix in ("d1", "h1"):
        cols = [c for c in df_raw.columns if c.startswith(f"{prefix}_")
                and (c.endswith("_min") or c.endswith("_max"))]
        bases = {c.rsplit("_", 1)[0] for c in cols}
        for base in bases:
            lo = df_raw[f"{base}_min"]
            hi = df_raw[f"{base}_max"]
            out[f"{base}_avg"] = (lo + hi) / 2
            out[f"{base}_diff"] = hi - lo
            out[f"has_{base}"] = lo.notna() | hi.notna()  # 缺失指示位(可选增强)
    return out

再接官方插补的近似版(按 apache_3j_bodysystem 分组取中位数)即可对齐 model-ready 精度;追求逐位复现请直接调用 rGOSSIS1 包。

§6.4 PyTorch DataLoader 参考

宽表虽无时序,仍给出一个可直接运行的表格 DataLoader 骨架(医疗 AI 入门最常用入口):

import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.preprocessing import StandardScaler


class GossisTabular(Dataset):
    def __init__(self, df: pd.DataFrame, target: str = "hospital_death"):
        self.y = torch.tensor(df[target].values, dtype=torch.float32)
        feats = df.drop(columns=[target, "partition"], errors="ignore")
        self.cols = feats.columns.tolist()
        self.scaler = StandardScaler().fit(feats.fillna(0.0))
        self.X = torch.tensor(
            self.scaler.transform(feats.fillna(0.0)), dtype=torch.float32
        )

    def __len__(self):
        return len(self.y)

    def __getitem__(self, i):
        return self.X[i], self.y[i]


train_ds = GossisTabular(mr[mr["partition"] == "Train"])
test_ds = GossisTabular(mr[mr["partition"] == "Test"], target="hospital_death")
train_loader = DataLoader(train_ds, batch_size=1024, shuffle=True,
                          num_workers=2, pin_memory=True)
test_loader = DataLoader(test_ds, batch_size=4096, shuffle=False)

进阶时序玩家请回链 eICU-CRD:vitalPeriodic(5 分钟粒度)+ vitalAperiodic + lab 关系表可重建逐小时序列,把 GOSSIS-1 当作「标签池 + 队列定义」使用。

§6.5 基线复现与 rGOSSIS1

官方基线是 R 生态的随机森林 + 逻辑回归:install.packages 不可得,需 remotes::install_github("jraffa/rGOSSIS1")。四步流程 preprocess_data() → impute_data() → prepare_fit() → gpredict() 对应论文全流程;不熟悉 R 的团队可用 §6.3 的 Python 近似,在 eICU 测试带上通常能到 AUROC 0.89-0.90,与官方 0.904 的差距来自插补细节与特征筛选的逐位差异。

§6.6 八个坑点

⚠️ 坑点 1:predictions 文件混入训练集行——直接算 AUROC 会虚高(分类:评估误用)

问题:gossis-1-eicu-predictions.csv.gz 覆盖全部 131,051 例住院(训练 + 测试),本身不带 partition 列。论文报告的 AUROC 0.904 只定义在 39,318 例测试带上;不看划分直接对全表算指标,等于「在训练集上报成绩」。

症状:复现报告写出 AUROC ≈ 0.92+,高于论文的 0.904,且分布形态「好得可疑」;审稿人一句「你用的是训练集吧」直接击穿。

解决:predictions 与 model-ready 表按 patientunitstayid 连接取 partition 列,只用 partition == ‘Test’ 的子集计算指标;报告时注明子集规模 39,318 与 95% CI (0.900, 0.909)。简单法是两行 pandas merge;进阶法在评估脚本里断言测试集行数,防止未来版本变动;SOTA 级实践是把「官方测试带」与「医院级 GroupKFold」两组指标并排报告。参考:PhysioNet GOSSIS-1-eICU 页面文件说明;Raffa et al. 2022 论文表 2。

⚠️ 坑点 2:raw 216 列与 model-ready 68 特征的列名陷阱——d1_x_min/max 变成了 avg/diff(分类:预处理陷阱)

问题:raw 表每个测量有 _min/_max(部分 _mean)三列,model-ready 把同一 base 名压成 _avg 与 _diff 两列。以为「model-ready 是 raw 的子集、列名一致」的假设完全不成立;且 _avg 在 min/max 双缺失时来自分层中位数插补,不是真实测量。

症状:特征选择脚本在 raw 上跑通、在 model-ready 上 KeyError;或反向移植时把插补值当真实值做校准研究,得到失真的 Brier 分解。

解决:用 variable-definitions.yaml 作为列字典做映射层,手写转换时按 §6.3 的 avg/diff 公式对齐;凡涉及缺失机制、校准、可解释性分析一律回 raw 表。简单法是维护一张 raw↔model-ready 列名对照表;进阶法用 §6.3 代码自动生成并断言列集一致;SOTA 级实践是双轨制——建模走 model-ready、机制研究走 raw,并在论文里分开声明。参考:PhysioNet 页 variable-definitions.yaml;jraffa/rGOSSIS1 源码 preprocess_data 与 impute_data。

⚠️ 坑点 3:APACHE 死亡概率列是「别家模型的输出」——当特征即循环泄漏(分类:数据泄漏)

问题:apache_4a_hospital_death_prob 与 apache_4a_icu_death_prob 是 APACHE IV 评分系统在收集完首个 24 小时数据后算出的死亡预测值。把它们与原始测量并列喂进你的模型,实际是在「蒸馏一个已有的强基线」,既无法证明你模型的增量价值,也让「纯数据驱动打败评分系统」的叙事失效。论文对照基线 APACHE-IVa AUROC 0.869、APACHE-IIIj 0.904 就是这两个评分系统的成绩。

症状:模型 AUROC 与 APACHE 概率的 AUROC 几乎一样;SHAP 分析中 apache_4a_* 独占半壁特征重要性;宣称「超越 APACHE」却在剔除该列后性能崩塌。

解决:主实验剔除 apache_4a_* 概率列,只用原始测量与人口学;把「含/不含 APACHE 概率」作为消融组分别报告;评估「模型 vs 评分系统」时将 APACHE 作为对照基线而非特征。简单法是 drop 两列;进阶法保留 apache_3j_bodysystem 诊断组等定性列做分层;SOTA 级实践是三组设计——纯数据 / 纯 APACHE / 融合,并做增量价值(NRI、校准曲线)分析。参考:Raffa et al. 2022 Methods 与 Table 2;APACHE IV 概率定义见 ICU 注册库手册。

⚠️ 坑点 4:hospitalid 医院聚类——随机划分下的「伪多中心」(分类:偏倚陷阱)

问题:131,051 例来自 204 家医院,行间呈强层级相关(同一医院的病例共享医生、流程、编码习惯)。官方 partition 按住院随机划分,测试集里天然含训练院的病人——用随机划分宣称「跨中心泛化」在方法学上站不住。

症状:随机划分 AUROC 0.90+,医院级 GroupKFold 掉到 0.85-0.88;小型医院子集上的 SMR 偏离 1 显著;外部 reviewer 要求补「leave-hospital-out」。

解决:主泛化结论用按 hospitalid 的 GroupKFold(5-10 折)或 leave-large-hospital-out;报告分医院性能分布(中位数 + IQR)而非只报合并 AUROC。简单法是 sklearn 的 GroupKFold;进阶法用 eICU-CRD 回链拿医院属性(教学/社区、床位数)做亚组分析;SOTA 级实践是混和效应模型或分层校准(per-hospital Platt scaling)后再聚合。参考:Raffa et al. 2022(模型按国别/注册库分层训练的动机即医院异质性);eICU-CRD hospital 表。

⚠️ 坑点 5:hospital_death 的口径——院内死亡不等于 ICU 死亡也不等于 90 天死亡(分类:标签理解)

问题:官方标签是「本次住院期间死亡」(hospital mortality),覆盖 ICU 之后转到普通病房的死亡;与 ICU 死亡(eICU unitdischargestatus)、住院后 28/90 天死亡(需 MIMIC 类 Social Security 联动或 ANZICS 随访字段)是三个不同终点。跨库对标时口径不齐是文献中数字打架的头号来源。

症状:把 GOSSIS 的 0.904 与某篇「ICU 死亡预测」论文直接列表对比,结论荒谬;在 eICU-CRD 回链时用 unitdischargestatus 重造标签后「官方标签错了」的冤案。

解决:所有对比实验前先写标签口径对照表(定义时点:出院/出 ICU/随访窗);复现官方数字必须用自带 hospital_death 列;自定义终点在 eICU-CRD 里从 patient 表的 hospitaldischargestatus 重建并做一致性检验。简单法是只用官方标签;进阶法报告双终点(院内 + ICU);SOTA 级实践是生存分析框架(以出院为删失)同时给出不同窗口的 C-index。参考:Raffa et al. 2022 Outcome 定义;eICU-CRD 表文档 patient/hospitalDx。

⚠️ 坑点 6:MNAR 缺失与算法 3 插补——「没有值」本身就是病情信号(分类:工程陷阱)

问题:乳酸、胆红素、INR 等只在怀疑相应器官问题时才检验,缺失与病情强相关(MNAR)。官方插补(rGOSSIS1 的 impute_data,论文称算法 3)按医院与诊断组分层填补,保住了模型性能,但把缺失语义从数据里抹掉了;model-ready 表里「插补值」与「真实值」外观完全一致、无法区分。

症状:在 model-ready 上做缺失机制研究会得出「数据几乎无缺失」的错误结论;自建模型忘了缺失指示位,性能比论文差一截;可解释性分析把插补中位数当成「该患者实测值」误导临床解读。

解决:缺失研究回 raw 表;自建模型为每个高缺失特征加 has_x 指示位或用原生支持 NaN 的模型(LightGBM/XGBoost);需要复现官方数字时直接用 rGOSSIS1 的 impute_data 而非近似。简单法是 LightGBM 吃 NaN;进阶法加指示位 + 分层中位数;SOTA 级实践是缺失感知的多模态编码(把缺失模式本身作为 tokens,参考 Transformer 系表格模型)。参考:rGOSSIS1 源码;Raffa et al. 2022 补充材料插补算法;MNAR 机制经典文献 Sterne et al. 2009。

⚠️ 坑点 7:2014-2015 时代快照—— COVID 与现代 ICU 的有效性未知(分类:偏倚陷阱)

问题:eICU 部分病例采集于 2014-2015 年,APACHE 派生列与临床流程反映的是当时实践。此后 ICU 领域经历 COVID 冲击、镇静策略演进、电子病历普及与检验频率变化,把 GOSSIS-1 模型直接套到 2020 年后的本中心数据上没有经过任何验证。

症状:部署试点发现特征分布漂移(如 d1_spo2 平均值升高、某些检验缺失率剧变);SMR 在新数据上偏离 1;审稿人质疑「2014 年的模型在 2026 年还有效吗」。

解决:论文中把「时代局限」写进 Limitations;迁移应用前做特征漂移审计(PSI、KS 检验)与小样本本地校准;教学与基准用途不受影响,部署导向研究必须加本地验证层。简单法是声明数据年份并只做基准研究;进阶法做时间外推实验(eICU-CRD 回链后按年份切分);SOTA 级实践是定期再校准(recalibration)+ 漂移监控的 MLOps 流水线。参考:Raffa et al. 2022 Limitations;eICU-CRD 论文(Sheppard et al. 2020)数据年份说明。

⚠️ 坑点 8:跨国故事与公开数据的错位——ANZICS 半边拿不到,R 复现绑版本(分类:工程陷阱)

问题:GOSSIS 的核心叙事(380,280 例、366 院、3 国)中,ANZICS-APD 的 249,229 例受澳新注册库条款约束不在 PhysioNet 公开范围内;公开的 131,051 例只是 eICU 美国半边。「复现 GOSSIS」因此有两种含义——复现论文级三国模型(需申请 ANZICS-APD)与复现 eICU 子集模型(rGOSSIS1 即可),混淆两者会浪费数周。

症状:按论文写预算与 IRB,却发现公开数据做不出「三国」表;rGOSSIS1 装不上新版本 R 或依赖冲突;复现的插补结果与 model-ready 逐位不一致。

解决:先明确目标——基准对标用公开子集 + partition 测试带即可;三国研究另行向 ANZICS APD 委员会申请并注明用途;R 环境锁定与 rGOSSIS1 依赖兼容的版本(建议 renv),或退而求其次用 §6.3 的 Python 近似并声明差异。简单法是只用公开子集并在文中如实写明「eICU 半边」;进阶法申请 ANZICS 走正式流程;SOTA 级实践是双轨复现报告——Python 近似 vs R 官方的性能差异表。参考:PhysioNet GOSSIS-1-eICU 页面 Scope 说明;Raffa et al. 2022 Data Sources;gossis.mit.edu 项目页;ANZICS APD 数据访问政策。

§6.7 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
对连续测量添加小幅生理学噪声(±1 bpm / ±1 mmHg) 对 hospital_death 做任何重采样后仍宣称官方口径
SMOTE/ADASYN 类少数类过采样(仅在训练折内) 在测试带上做过采样后报指标
特征空间 Mixup(同一诊断组内插值) 跨 bodysystem 混合插值(破坏诊断语义)
缺失模式随机化(训练时随机遮蔽已测量值) 对 age=91 委托箱样本做「年龄回归」式增强

§6.8 模型推荐

任务 推荐 backbone 特征方案 预期性能(官方测试带口径)
快速基线 Logistic Regression model-ready 68 特征 AUROC 0.85-0.88
复现官方 随机森林(rGOSSIS1) model-ready AUROC 0.904(95% CI 0.900-0.909)
表格 SOTA XGBoost / LightGBM / CatBoost model-ready + 缺失指示位 AUROC 0.90-0.92
评分对照 APACHE-IIIj / APACHE-IVa 概率 apache_4a_* 0.904 / 0.869
时序进阶 回链 eICU-CRD + LSTM/Transformer 自建小时级序列 无官方锚点,需自报

§6.9 计算资源需求

硬件 最小配置 推荐配置
磁盘 2 GB(压缩包 + 解压) 20 GB(回链 eICU-CRD 全库)
内存 8 GB(宽表全量载入) 32 GB(GroupKFold × 并行插补)
GPU 完全不需要(表格基线 CPU 即可) 1 × 8 GB(时序进阶实验)
训练时间 逻辑回归 < 5 分钟 随机森林 10-30 分钟(8 核)
云端替代 BigQuery 免费层查询 gossis1_eicu_* 三表 Colab + BigQuery 免本地环境

§6.10 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             brier_score_loss, confusion_matrix)

def evaluate_official_style(y_true, y_prob, threshold=0.5):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")   # 官方主指标
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")
    print(f"Brier: {brier_score_loss(y_true, y_prob):.4f}")  # 官方 0.050
    tn, fp, fn, tp = confusion_matrix(y_true, y_prob > threshold).ravel()
    print(f"Sensitivity: {tp/(tp+fn):.3f}  Specificity: {tn/(tn+fp):.3f}")
    # SMR:按医院聚合 observed/expected 死亡比,期望值用模型或 APACHE 概率

社区口径:主指标 AUROC + Brier(校准);分层报告必附 SMR 与校准曲线;与 APACHE 对照时同带(同测试集)比较才有意义。

§6.11 MLOps 笔记

  • 版本锁定:方法学部分必须写明「GOSSIS-1-eICU v1.0.0(2022-07-20,DOI: 10.13026/gbmg-a531)」与访问日期;目前仅此一个版本,未来更新时旧实验不可混用。
  • 引用三件套:Raffa et al. 2022 论文 + PhysioNet DOI + Goldberger 2000 平台论文,DUA 硬性要求。
  • partition 即契约:任何脚手架都应在读取后立刻断言 partition 值域与测试集行数,坑点 1 的自动化防线。
  • BigQuery 表名:physionet-data.gossis1_eicu_raw / gossis1_eicu_predvar / gossis1_eicu_ihmp_pred,与本地 CSV 列名一致,可无缝切换。
  • R/Python 双轨:rGOSSIS1 是逐位复现的正解,Python 近似用于迭代速度;两者差异写进附录而非装作不存在。

§7 质量评估与局限性

§7.1 八类已知偏倚与缓解

偏倚 在 GOSSIS-1-eICU 中的表现 缓解措施
入选偏倚 仅纳入住院 >6 小时、首次 ICU 入住、结局已知且至少有一条心率记录者 建模前明确队列口径;外推时重定义纳入排除
机构偏倚 eICU-CRD 来自远程 ICU 项目的 204 院,社区医院与 tele-ICU 成员占比高于全美 ICU 总体 按 hospitalid 分层评估;引用论文 SMR 分院分布
测量偏倚(MNAR) 检验按临床指征下单,乳酸/胆红素/INR 缺失与病情强相关 缺失指示位或原生支持 NaN 的模型(坑点 6)
时代偏倚 2014-2015 年实践;COVID 后有效性未知 漂移审计 + 本地再校准(坑点 7)
标签偏倚 hospital_death 依赖出院记录抽象,跨国(ANZICS vs eICU)结局定义存在表述差异 标签口径对照表(坑点 5)
诊断组偏倚 apache_3j_bodysystem 反映 2014-2015 编码习惯,糖皮质激素等支持治疗归类随年代变化 用 apache_diagnosis_map.csv 复核高频码
患者级重复 同一患者多次住院各自成行 患者级分组划分(§5.2)
模型选择偏倚 论文超参在开发集搜索后固定,测试带仅用一次 复现时同样只在测试带上评估一次

§7.2 代表性问题样本

亚组 表现与风险
age = 91(委托箱) 全部 ≥91 岁患者压入单点,无法分辨 91 与 105 岁;占老年重症较大比例
elective_surgery = 1 择期术后人群基线死亡风险远低于急诊入科,混入训练会拉低整体校准斜率
pre_icu_los_days > 0 ICU 前已住院者病情进程不同,首次入 ICU 24 小时聚合特征含「院前处理」效应
长住院(开发时排除,发布版包含的行) 论文说明开发时排除超长住院与再入院以稳定 APACHE 口径,但公开子集按纳入规则保留了 eligible 行——single model covers all patients 是官方声明的数据限制(rai:dataLimitations)之一

§7.2b 泛化性讨论

泛化轴 覆盖情况 风险
跨机构 204 院,社区医院与 tele-ICU 成员占比偏高 对大型学术中心的代表性与全美 ICU 拓扑不完全一致
跨国 训练池覆盖 3 国,但公开子集仅美国 跨国验证需 ANZICS-APD,公开层面不可完成
跨年代 2014-2015 快照 2020 年后临床实践(含 COVID)有效性未知
跨人群 ≥16 岁首次 ICU 入住 儿科、非首次入住、非 ICU 住院均不在适用域

§7.3 标签质量

hospital_death 来自 eICU-CRD 出院状态抽象(hospitaldischargestatus),与医院账单/出院记录交叉核对;在 GOSSIS 管线中再经「结局已知」过滤。优势是无 SSN 联动缺口(对比 MIMIC-III 的院外死亡);局限是仅覆盖本次住院,无随访窗。标签不平衡比例(院内死亡约占全部住院的 8-10% 量级)在论文表 1 按注册库分别报告,复现时以官方表格为准,勿凭记忆引用。

§7.4 已知错误与勘误

问题 影响 处理
v1.0.0 为唯一版本,尚无 v1.x 修订记录 早期使用者的反馈(如个别列定义歧义)散落在 PhysioNet 讨论区,未进 release notes 提问前先搜 PhysioNet 页面讨论区;以 variable-definitions.yaml 为准
apache_2_bodysystem 与 apache_3j_bodysystem 分类粒度不同 两个诊断组列不可互换 用 apache_diagnosis_map.csv 对齐
R 与 Python 读 gz 时的列类型推断差异 age/height 等被误读为字符串 显式 dtype 声明或 low_memory=False

§7.4b 伦理考量

  • 二次利用审查:去标识化数据为「非人类受试者」,多数机构 IRB 可豁免知情同意,但研究者所在机构政策优先——投稿前先拿 IRB 决定函。
  • 再识别红线:DUA 明令禁止再识别与未授权共享;hospitalid 属于敏感准标识符(结合年份与病例组合可反推机构),任何图表不得直接暴露单院小样本亚组。
  • 部署公平性:死亡率预测模型历史上存在「自我实现」风险——按预测分配 ICU 资源会使高危患者更早放弃积极治疗;引用 SMR 做医院排名时,务必配合病例组合调整的完整披露。
  • 族裔与代表:ethnicity 抽象口径来自 2014-2015 记录习惯,任何跨族裔结论都需先过 §7.5 的样本量检查。

§7.5 公平性评估代码

from sklearn.metrics import roc_auc_score

def group_auroc(df, group_col="ethnicity"):
    rows = []
    for g, sub in df[df["partition"] == "Test"].groupby(group_col):
        if len(sub) < 500:  # 小样本亚组仅报告规模,不报点估计
            rows.append((g, len(sub), None))
            continue
        auc = roc_auc_score(sub["hospital_death"], sub["gossis1_ihm_pred"])
        rows.append((g, len(sub), round(auc, 4)))
    return rows

for g, n, auc in group_auroc(test_pred):
    print(f"{g:>20s}  n={n:>6d}  AUROC={auc}")

注意:ethnicity 为 2014-2015 抽象口径(Caucasian 占绝对多数),跨族裔亚组样本量极不均衡,点估计不稳定——先报 n 再报指标。

§7.6 版本演进

版本 日期 变更
1.0.0 2022-07-20 首版:3 个 CSV.gz + variable-definitions.yaml + apache_diagnosis_map.csv,DOI 10.13026/gbmg-a531

§7.6b 数据漂移提示

漂移源 监控对象 缓解
检验策略变化 d1_lactate_、d1_paco2_ 等缺失率 缺失率漂移是 MNAR 结构变化的前哨信号
监护与编码实践 d1_spo2_avg、GCS 分项分布 PSI(Population Stability Index)> 0.1 触发复核
出入院流程 pre_icu_los_days、elective_surgery 占比 手术模式变化直接影响基线风险结构
重大公卫事件 全特征联合分布(2020 年起) 官方声明 COVID 期间有效性未知(rai:dataLimitations)

eICU-CRD 回链后按入住年份滚动评估(2014 train / 2015 test 的 §5.2 时间外推方案)是零成本的漂移预演。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) ✅ 每行 = 一次 ICU 住院,开箱即用
2 有唯一标识符列 ✅ patientunitstayid 三份 CSV 全局唯一
3 无 Unicode 或特殊字符 ✅ 全部结构化字段为 ASCII
4 无重复行 ✅ 键约束成立;论文与 PhysioNet 页面未见重复报告
5 缺失值已识别并编码 ⚠️ raw 表以空白表示缺失、无 sentinel;官方以插补「消除」而非编码缺失
6 标签列被明确标识 ✅ hospital_death 二值显式列
7 已对罕见类别(<3%)进行分组 ⚠️ 诊断组 11 类已给出,但 ethnicity 低频类与 APACHE 细码未归组
8 偏倚评估已完成 ✅ 论文 Limitations + 本条目 §7.1 八类偏倚表
9 有完整的数据字典 ✅ variable-definitions.yaml(机器可读)+ apache_diagnosis_map.csv
10 对「信息性缺失」有明确编码解释 ⚠️ MNAR 机制论文有述,但 model-ready 插补后缺失指示不可见
11 数据采集设备和设置已记录 ⚠️ 来源系统类型有述,设备型号与采样频率未随发布
12 已移除完全共线性变量 ❌ 发布版保留全部原始列,未做共线性筛查
13 对编码的映射标准已说明 ✅ APACHE IIIj/II 码 → 11 诊断组,映射表随附
14 对时间戳的处理已明确说明 ⚠️ 仅保留 24h 聚合窗口语义,绝对日期与真实时间线全部缺失
15 训练/验证/测试划分建议已给出 ✅ partition 列显式 train/test(70/30)
16 数据泄漏风险已被讨论 ✅ 论文讨论 APACHE 时序口径;本条目 §5.3 四条清单
17 标签分布已被分析 ✅ 论文表 1 按注册库报告结局分布
18 选择性测量偏倚已被讨论 ✅ 检验由指征驱动的 MNAR 问题论文明示
19 外部验证建议已给出 ⚠️ 论文内部完成三国互验,但公开子集用户无 ANZICS 外验路径
20 数据更新和版本信息已记录 ✅ v1.0.0 + DOI + PhysioNet 版本页
21 最小必要预处理脚本已提供 ✅ rGOSSIS1 四步管线开源(MIT-LCP 生态)
22 合规使用要求已明确 ✅ CITI 培训 + 凭证化 + DUA + License 1.5.0 全链路
23 多模态对齐方法已说明 ⚠️ 单一模态发布;文本/波形/时序须回链 eICU-CRD 自行对齐
24 去标识化方法已被记录 ✅ HIPAA Safe Harbor + Privacert 认证 no. 1031219-2 全文档

DAIMS 评分:19.5 / 24

评分解读:良好偏上——官方划分列、开源预处理管线与经认证的去标识化三件套,在 ICU 宽表类数据集中属于第一梯队;扣分点集中在「聚合模态的原罪」而非文档质量。

对你意味着什么:16 个 ✅ 项里最值钱的是三件:partition 列让你与官方数字可比、variable-definitions.yaml 让你的 ETL 不用猜列、Privacert 认证让 IRB 审查大幅简化——这三点很多更大的数据集都做不到。7 个 ⚠️ 与 1 个 ❌ 大多不可在公开层面修复:缺失语义被插补抹除(研究缺失机制请回 raw 表)、绝对时间缺失(时间序列研究请回链 eICU-CRD)、共线性未筛查(入模前自行 VIF/相关矩阵)。与 MIMIC-III 的 18.5/24 相比,GOSSIS-1-eICU 赢在「为建模而生的发布形态」,输在「研究纵深」——前者是开箱即用的宽表,后者是值得造轮子的整座仓库。

§7.8 外部验证矩阵

外部数据集/场景 来源 评估任务 相对内部测试带变化 关键发现
ANZICS-APD(162 澳新医院) GOSSIS 论文内 GOSSIS-1 vs APACHE 对照 论文内完成:三国合并测试 AUROC 0.918、SMR 0.986 唯一「官方外部验证」,但数据本身不可公开获取
eICU-CRD 全库 PhysioNet 时序重建 + 结局扩展 需自建特征,无官方锚点 GOSSIS-1 的天然扩展验证场(同源同条款)
MIMIC-IV / MIMIC-III BIDMC 机构迁移 预期下降,文献约 2-6 个 AUROC 点 标签口径与 APACHE 版本须先对齐(坑点 5)
HiRID 瑞士伯尔尼 跨国泛化 特征映射成本高(681 变量) 2 分钟粒度可下采样聚合至 24h 窗口近似复现

GOSSIS-1-eICU 在 2026 年还值得用吗? 值得,但定位要准。它是「可复现死亡率预测基准」的首选——官方划分、官方预测、官方性能数字三者齐备, teaching 与方法学研究几乎零摩擦;但它不是时序建模的原材料,也不承载 2015 年之后的临床现实。做时序、做部署、做文本,回链 eICU-CRD 或转投 MIMIC-IV;做基准、做校准方法学、做缺失数据教学,GOSSIS-1-eICU 依旧锋利。

§8 基准性能与生态

§8.1 官方基准(论文口径)

模型 测试集 AUROC SMR Brier
GOSSIS-1 三国合并测试集 0.918 0.986 0.050
GOSSIS-1 eICU 子集测试带(39,318 例) 0.904(95% CI 0.900-0.909) — —
APACHE-IIIj 三国合并测试集 0.904 0.594 —
APACHE-IVa 三国合并测试集 0.869 0.770 —

解读要点:区分度上 GOSSIS-1 与 APACHE-IIIj 接近(0.918 vs 0.904),真正的差距在校准——SMR 0.986 意味着预测死亡数与观测死亡数几乎重合,而 APACHE-IIIj 的 0.594 表示严重高估死亡(预测 100 例实际只发生约 59 例水平),APACHE-IVa 的 0.770 同样系统性高估。对资源分配与质量比较应用而言,校准失效比区分度低更致命。

口径提示:0.918 / 0.986 / 0.050 是三国合并测试集数字;0.904(CI 0.900-0.909)是 eICU 子集 39,318 例测试带数字。两者不可混排进同一列,对标时先声明自己站在哪条测试带上——这正是坑点 1 的数字层版本。

§8.2 排行榜现状

GOSSIS-1 没有持续的公开排行榜(区别于 PhysioNet Challenges);论文数字即事实基准。社区后续工作(校准方法、缺失数据方法、跨库迁移)多以「eICU 测试带 AUROC + Brier + SMR」三件套报告,对标时锁定 partition = Test 与 v1.0.0 即可比。

§8.2b SOTA 总结与选型建议

目标 建议路线 对标数字
复现官方 rGOSSIS1 全流程 + partition 测试带 AUROC 0.904(39,318 例,CI 0.900-0.909)
轻量基线 model-ready + 逻辑回归 AUROC 0.85-0.88
现代表格 SOTA LightGBM/CatBoost + 缺失指示位 + GroupKFold AUROC 0.90-0.92(医院级)
校准研究 同带对比 APACHE-IIIj/IVa 概率 + Brier/SMR Brier 0.050、SMR 0.986 为官方锚点

选型口诀:先看校准再看区分度;先医院级再随机划分;先官方标签再自定义终点。

§8.3 生态快照

资源 位置 状态(2026-09)
数据本体 PhysioNet gossis-1-eicu v1.0.0 在线,凭证化访问
官方模型与提取代码 GitHub MIT-LCP/gossis 公开
R 复现包 GitHub jraffa/rGOSSIS1 公开,四步管线
项目主页 gossis.mit.edu 在线
论文 Raffa et al., Crit Care Med 2022;50(7):1040-1050(PMID 35354159) Google Scholar 被引 44+(截至 2026-09 快照)
BigQuery 镜像 physionet-data.gossis1_eicu_raw / predvar / ihmp_pred 可查询

§8.4 与同类数据集对比

维度 GOSSIS-1-eICU eICU-CRD MIMIC-III HiRID ANZICS-APD(GOSSIS 用例)
规模 131,051 住院 / 204 院 约 200,000 住院 / 200+ 院 46,520 患者 / 61,532 ICU 入住 约 3.4 万住院 249,229 患者 / 162 院
地域 美国 美国 美国(BIDMC 单中心) 瑞士(单中心) 澳大利亚 + 新西兰
时间 2014-2015 2014-2015 2001-2012 2009-2016 2014-2015(GOSSIS 提取窗)
模态 24h 聚合宽表(216 列) 关系型 100+ 表(小时级以下时序) 关系型 26 表(小时级时序 + 文本) 681 变量、2 分钟粒度时序 注册库汇总 + 时序要素
标签 hospital_death + APACHE 全套 需自建 明确多终点 需自建 注册库结局
官方划分 ✅ partition 列 ❌ ❌ ❌ ❌
获取 PhysioNet 凭证化 PhysioNet 凭证化 PhysioNet 凭证化 公开申请表 委员会审批,不可再分发

一句话选型:要快(教学/基准/复现)选 GOSSIS-1-eICU;要全(时序/文本/派生概念)选 eICU-CRD 或 MIMIC;要细(分钟级波形化时序)选 HiRID;要跨国注册库视角且能走完审批,联系 ANZICS。

§8.5 关键论文 Top 8

# 论文 期刊/年份 价值
1 Raffa et al., The Global Open Source Severity of Illness Score (GOSSIS) Crit Care Med 2022 数据集 + 模型主论文(PMID 35354159)
2 Sheppard et al., The
2 Sheppard et al., The eICU Collaborative Research Database Crit Care Research Database Crit Care Med 2020
3 Zimmerman et al., APACHE IV / IIIj 更新 Crit Care Med 2006 对照基线评分体系的方法学源头
4 Knaus et al., APACHE II Crit Care Med 1985 评分谱系起点,理解 apache_2_* 列
5 Goldberger et al., PhysioNet 平台 Circulation 2000 引用三件套之一(DUA 硬性要求)
6 Johnson et al., MIMIC-III Scientific Data 2016 同代 ICU 数据集生态锚点
7 Johnson et al., MIMIC-IV Scientific Data 2023 迁移验证目标与派生概念生态
8 Hyland et al., Early prediction of circulatory failure Nature Medicine 2020 ICU 时序建模范式与 HiRID 数据集论文(对比生态)

§8.6 社区活跃度与可维护性

  • 仓库:MIT-LCP/gossis(提取与建模材料)与 jraffa/rGOSSIS1(R 包)均为开源仓库,issue 区可见作者本人回复;MIT-LCP 是 MIMIC/eICU 生态同一维护方,长期性有保障。
  • 讨论区:PhysioNet 每个数据集页面自带讨论区,列定义歧义(如个别 d1_* 列的测量口径)优先去那里检索与提问。
  • 引用走势:论文 2022 年发表,Google Scholar 被引 44+(2026-09 快照)——属于「基准基础设施型」引用曲线:起步平缓、随复现文化增长,适合作为方法学论文的稳定引用对象而非热点数据集。

§9 相关资源与引用

§9.1 数据集本体引用(DUA 要求三件套)

@dataset{gossis1eicu2022,
  title        = {GOSSIS-1-eICU, the eICU-CRD subset of the Global Open Source
                  Severity of Illness Score (GOSSIS-1) dataset},
  author       = {Raffa, Jesse D. and Johnson, Alistair E.W. and O'Brien, Zachary
                  and Pollard, Tom J. and Mark, Roger G. and Celi, Leo A.
                  and Pilcher, David and Badawi, Omar},
  year         = {2022},
  publisher    = {PhysioNet},
  version      = {1.0.0},
  doi          = {10.13026/gbmg-a531},
  url          = {https://physionet.org/content/gossis-1-eicu/1.0.0/}
}

§9.2 方法论文引用

@article{raffa2022gossis,
  title   = {The Global Open Source Severity of Illness Score (GOSSIS)},
  author  = {Raffa, Jesse D. and Johnson, Alistair E.W. and O'Brien, Zachary
             and Pollard, Tom J. and Mark, Roger G. and Celi, Leo A.
             and Pilcher, David and Badawi, Omar},
  journal = {Critical Care Medicine},
  volume  = {50},
  number  = {7},
  pages   = {1040--1050},
  year    = {2022},
  doi     = {10.1097/CCM.0000000000005457},
  pmid    = {35354159}
}
@article{goldberger2000physiobank,
  title   = {PhysioBank, PhysioToolkit, and PhysioNet: components of a new
             research resource for complex physiologic signals},
  author  = {Goldberger, Ary L. and Amaral, Luis A. N. and Glass, Leon
             and Hausdorff, Jeffrey M. and Ivanov, Plamen Ch. and Mark, Roger G.
             and Mietus, Joseph E. and Moody, George B. and Peng, Chung-Kang
             and Stanley, H. Eugene},
  journal = {Circulation},
  volume  = {101},
  number  = {23},
  pages   = {e215--e220},
  year    = {2000}
}

§9.3 工具与代码资源

资源 链接 说明
rGOSSIS1 R 包 github.com/jraffa/rGOSSIS1 preprocess → impute → prepare_fit → gpredict 全流程
GOSSIS 仓库 github.com/MIT-LCP/gossis 提取代码与模型开发材料
项目主页 gossis.mit.edu GOSSIS 联盟与版本公告
eICU-CRD physionet.org/content/eicu-crd/ 回链上游(需单独凭证化)
variable-definitions.yaml 随数据发布 全字段机器可读定义

§9.5 术语速查表

术语 全称/含义 在本条目中的位置
GOSSIS Global Open Source Severity of Illness Score,开源重症严重程度评分 全篇主角
eICU-CRD eICU Collaborative Research Database,美国多中心远程 ICU 数据库 上游源库
ANZICS-APD 澳大利亚与新西兰 ICU 注册库(Adult Patient Database) GOSSIS 另一半训练池
APACHE IIIj / IVa APACHE 第三代澳新版 / 第四代美国版评分 对照基线与特征列
hospital_death 本次住院期间死亡(二值标签) 官方任务靶标
SMR Standardized Mortality Ratio,标准化死亡比(观测/期望),越接近 1 校准越好 §8.1 校准论证
partition 官方 train/test 划分列 §5.1 评估口径
MNAR Missing Not At Random,缺失与未观测值本身相关 §4.4 / 坑点 6
d1_* / h1_* ICU 首 24h / 第二个 24h 聚合特征前缀 §4.2 分组字典
DAIMS Dataset Assessment for Immediate Machine-learning Suitability §7.7 24 项评估
DUA Data Use Agreement,数据使用协议 §6.1 获取流程
Privacert 认证 HIPAA Safe Harbor 再识别风险第三方认证(no. 1031219-2) §4.5 / DAIMS #24
条目 关系
eICU Collaborative Research Database({slug}/0) 上游源库,GOSSIS-1-eICU 的美国半边
MIMIC-III({slug}/0) 同代 ICU 数据集,单中心对照
MIMIC-IV({slug}/0) 接代 ICU 数据库,迁移验证目标

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
fast-model(CodeBuddy) 2026-09 初稿生成:INFOBOX 汇编、§1-§9 结构化写作、§6 代码示例生成、§C JSON-LD 构建
WebSearch(多源检索) 2026-09 4 组检索 + 1 次页面抓取:PhysioNet 官方页面、论文规模与性能数字、许可条款、生态资源交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 PhysioNet GOSSIS-1-eICU 官方页面、Raffa et al. 2022 论文摘要与公开索引、MIT-LCP/gossis 与 jraffa/rGOSSIS1 仓库说明中整理结构化信息;(2) 生成 §6 的 Python/R 代码示例;(3) 系统化组织 §6.6 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查;(5) 构建 §C 统一 JSON-LD @graph 并与 frontmatter schema_org 保持序列化一致。

§10.3 输入来源

  1. PhysioNet GOSSIS-1-eICU v1.0.0 官方页面(physionet.org/content/gossis-1-eicu/,含文件清单与 Credentialed Access 说明)
  2. Raffa et al. (2022), Critical Care Medicine 50(7):1040-1050(DOI: 10.1097/CCM.0000000000005457,PMID 35354159)
  3. gossis.mit.edu 项目主页(GOSSIS 联盟与三国注册库说明)
  4. GitHub MIT-LCP/gossis 仓库(提取与建模代码)
  5. GitHub jraffa/rGOSSIS1 仓库(R 四步管线与插补算法说明)
  6. eICU-CRD 官方页面与 Sheppard et al. (2020) 论文(上游库规模与年份口径)
  7. ANZICS APD 数据访问政策公开页(再分发限制)
  8. Privacert HIPAA 认证说明(no. 1031219-2,PhysioNet 页面转述)
  9. Hyland et al. (2020), Nature Medicine 26:1444-1451(循环衰竭时序建模背景;HiRID 数据集关联论文,非 GOSSIS 直接关联)
  10. HiRID 官方页面(hirid.ch / PhysioNet,对比数据集口径)
  11. Google Scholar / OpenAlex 引用快照(截至 2026-09)
  12. BigQuery physionet-data 公共项目表清单(gossis1_eicu_* 三表)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览与规模口径(双口径声明) 千方病案医学编辑部 与 PhysioNet 页面及论文摘要交叉比对 ✅ 已验证
§2 医学背景(ICD-11 近似映射、SNOMED) 千方病案医学编辑部 官方术语浏览器复核,全部标注近似映射 ✅ 已通过
§3 数据集规格(三文件、216 列分组) 千方病案医学编辑部 与 variable-definitions.yaml 结构交叉比对 ✅ 已验证
§4 数据结构(DAIMS 字段字典、转换规则) 千方病案医学编辑部 与 rGOSSIS1 源码比对 ✅ 已验证
§5 划分与泄漏清单 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与 8 个坑点 千方病案医学编辑部 逻辑审查 + 与官方仓库比对 ✅ 已通过
§7 DAIMS 24 项与评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 基准数字与引用数表述 千方病案医学编辑部 与论文及 Scholar 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.1-§6.5 代码示例、§6.6 八个坑点、§6.10 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.3 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-19

页面状态:published(全部内容已完成审核并发布)



相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • truveta — 共享标签:电子健康记录 / 重症监护 / 临床电子病历 / 真实世界数据
  • eicu-crd — 共享标签:电子健康记录 / 重症监护 / 临床电子病历 / 时序数据
  • n3c — 共享标签:电子健康记录 / 重症监护 / 临床电子病历 / 真实世界数据
  • thin — 共享标签:电子健康记录 / 重症监护 / 临床电子病历 / 真实世界数据
  • mover — 共享标签:电子健康记录 / 重症监护 / 临床电子病历 / 时序数据
  • mdv — 共享标签:电子健康记录 / 时序数据 / 真实世界数据
  • hirid — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • eicu-collaborative — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • mimic-iv-ed — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • mimic-br — 共享标签:电子健康记录 / 重症监护 / 临床电子病历

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集