SICdb — 欧洲分钟级重症监护数据库 AI-Ready Wikipedia | 千方病案医数集

全球粒度最高的公开 ICU 数据集之一 · 2.7 万次入院 · 分钟级信号

来源 帕拉塞尔苏斯医科大学萨尔茨堡分校 & 萨尔茨堡大学医院(SALK) url: https://physionet.org/content/sicdb/发布时间: 2026-09-06最后更新: 2026-09-06 阅读 10

信息速览

数据集名称SICdb — 欧洲分钟级重症监护数据库 AI-Ready Wikipedia | 千方病案医数集
数据类型约 10GB 压缩 / 分钟级解压约 240GB,27,386 次 ICU 入院,分钟级床旁信号,GDPR 合规,需 CITI 培训 + 逐案审批
规模2.16 万名患者
接入方式帕拉塞尔苏斯医科大学萨尔茨堡分校 & 萨尔茨堡大学医院(SALK) url: https://physionet.org/content/sicdb/
AI 就绪度

数据集封面

SICdb — 欧洲分钟级重症监护数据库 AI-Ready Wikipedia


INFOBOX

数据集名称 SICdb(Salzburg Intensive Care database)
英文全称 Salzburg Intensive Care database
别名/简称 SICdb、SICdb v1.0.8、萨尔茨堡重症监护数据库
疾病分类 重症监护全疾病谱 + 围手术期监护(ICD-11:1G4Z 脓毒症 / 8B6Z 急性肾损伤 / BA41 急性心肌梗死 / CB4Z 心力衰竭 / CB41 呼吸衰竭;心脏外科体外循环术后为特色亚群)
SNOMED CT 133834002 Critical care medicine (procedure) / 91302008 Sepsis / 14669001 Acute renal failure syndrome / 243141005 Mechanical ventilation(详见 §2.2)
数据模态 结构化 EHR、高频时序(分钟级床旁监护信号 + 小时级聚合)
AI 任务类型 死亡预测(ICU/院内/28 天/1 年)、AKI 分期预测(内置 KDIGO 标签)、脓毒症识别、住院时长预测、围手术期风险建模、不规则时序建模、生存分析
样本总数 27,386 次 ICU 入院 / 21,583 名患者(v1.0.6 口径;v1.0.7 起移除 36 个无效病例后为 27,350+ 次)/ 8 张表
数据大小 <10 GB(gzip CSV 压缩包)/ 分钟级全解压约 240 GB
数据格式 CSV(gzip,RFC 4180)/ PostgreSQL / MySQL / SQLite / R(ricu)/ Parquet(YAIB 管道)
许可证 PhysioNet Contributor Review Health Data License 1.5.0
访问级别 申请审核(注册 PhysioNet + 完成 CITI 培训 + 提交具体研究问题 + 贡献者逐案审批 + 签署 DUA)
DUO 标签 HMB, NPUNCU, PUB
语言 英文(编码字典与部分药品名为德语/英语混合)
首发日期 2023-02-14(PhysioNet v1.0.5)/ 2023-04(Intensive Care Medicine 发布信)
最后更新 2024-09-10(v1.0.8,实验室项目映射 LOINC)
发布机构 帕拉塞尔苏斯医科大学萨尔茨堡分校(PMU)麻醉、围手术期与重症监护医学部 & 萨尔茨堡大学医院(SALK)
官方主页 https://www.sicdb.com/
下载地址 https://physionet.org/content/sicdb/1.0.8/
DOI 10.13026/8m72-6j83(v1.0.8)/ 10.1038/s41597-024-03164-9(数据论文)/ 10.1007/s00134-023-07046-3(发布信)
引用次数 60+(Google Scholar,三篇核心文献合计,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 分钟级粒度全球稀缺、官方解包脚本与 ricu/YAIB 生态就绪;扣分项:无官方划分、rawdata 需自行解包、绝对日历时间缺失、单中心
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-10 与 ICD-11/SNOMED CT 映射、SAPS III 与 EuroSCORE II 评分体系、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(CaseID/PatientID 主键体系、d_references 编码机制、rawdata 序列化结构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与帕拉塞尔苏斯医科大学、萨尔茨堡大学医院、PhysioNet 无任何商业利益关联。本页面不销售 SICdb 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 PMU、SALK 或 PhysioNet 的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。SICdb 采用 PhysioNet Contributor Review Health Data License——除 CITI 培训与凭证化申请外,每个研究项目还需提交具体研究问题并经数据集贡献者逐案审批,审批强度高于 MIMIC 系列的标准凭证化流程。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

SICdb(Salzburg Intensive Care database,萨尔茨堡重症监护数据库)是奥地利萨尔茨堡大学医院(SALK)与帕拉塞尔苏斯医科大学(PMU)于 2023 年联合发布的欧洲单中心重症监护公开数据库,包含 27,386 次 ICU 入院、21,583 名患者的脱敏临床数据(2013-2021 年),覆盖麻醉与重症监护医学部的 4 个监护室、41 张床位,共 8 张表。

它的独特价值在于粒度:这是目前全球公开 ICU 数据集中时间分辨率最高的数据集之一——床旁监护信号达到分钟级(once-per-minute),仅 8 个最高频生命体征就包含 884,714,655 个数据点;作为对照,MIMIC-III/IV 的床旁记录约为每小时 1 个点。同时它打破了开放重症数据的"美国垄断":欧洲人群、GDPR 合规脱敏、围手术期(尤其心脏外科体外循环)全程细节,并附带含院外死亡的 1 年生存终点——这在 MIMIC 系列中需要自行链接社保死亡档案才能获得。

你可以用它来:训练分钟级时序的 ICU 死亡/AKI/脓毒症预测模型、在 YAIB 多中心框架下做美欧跨洲泛化验证、研究围手术期患者的全程生理轨迹(从切皮到拔管)、或者通过 ricu 生态用 64 个标准化临床概念一键提取特征。

§1.1 摘要

SICdb 由 PMU 麻醉、围手术期与重症监护医学部全额资助建设(官方承诺维护资金至 2028 年)。原始数据采集自 iMDSoft MetaVision 患者数据管理系统(PDMS)的床旁监护与呼吸机信号,并与 ORBIS(Dedalus)医院信息系统的 ICD-10 编码、出入院记录及奥地利政府死亡登记数据经非公开 lookup 数据库匹配合并。数据集以 8 个 gzip 压缩的 RFC 4180 CSV 文件发布:主表 cases 每次 ICU 入院一行(含 SAPS III、EuroSCORE II、ICD-10 主诊断、内置 KDIGO AKI 分期与 1 年死亡 offset),data_float_h 承载全部浮点信号(小时级聚合 + rawdata 字段内以 IEEE 754 浮点流序列化的分钟级原始数据),另有实验室、用药、起止型事件、标称数据、转运日志与 d_references 编码字典(v1.0.8 起实验室项目已映射 LOINC)。脱敏策略为 GDPR 第 4(5) 条假名化 + HIPAA 合规:仅保留入院年份,其余时间一律转为秒级 offset,年龄/体重/身高按 5 单位分箱,地理信息删除。当前版本 v1.0.8(2024-09-10)。

§1.2 战略价值分析

粒度维度:开放 ICU 数据的"分辨率天花板"长期由 MIMIC 系列(约 1 点/小时)定义,HiRID(2 分钟)首次打破,SICdb 则直接推进到分钟级。官方测算分钟级中间数据约 240 GB——这个体量解释了为什么此前无人发布:SICdb 的解法是把 60 个分钟值序列化为 240 字节的 IEEE 754 浮点流嵌入 rawdata 字段,将全库压到 10 GB 以内。对 AI 研究而言,分钟级粒度让机械通气的逐次调整、血管活性药的滴定过程、体外循环开始/主动脉阻断等瞬时事件第一次成为可建模对象,而非被小时均值抹平。

地缘与合规范式维度:2023 年之前,开放重症数据几乎全部来自美国(MIMIC、eICU),欧洲仅有 HiRID(瑞士)与 AmsterdamUMCdb(荷兰)两个单中心库。SICdb 是第三个欧洲库,也是首个奥地利来源——中央欧洲人群、德语区医疗实践、GDPR 第 4(5) 条假名化路径(与 HIPAA 双重合规声明),为"美国训练的模型在欧洲是否成立"这一核心问题提供了新的对照组。YAIB(ICLR 2024)的跨库实验已反复证明美欧之间存在显著泛化落差,SICdb 的加入使这类研究的证据链更完整。

生态与验证维度:SICdb 发布仅一年即被 ricu(R 生态统一 ICU 接口,数据源名 sic,64 个临床概念)与 YAIB(五大 ICU 库基准框架)原生支持,并被 Sadeghi 等人(Scientific Reports 2024)系统对比 MIMIC-IV——结论是其信号数据的时间分辨率与可用性显著优于后者。一个 2023 年才发布的数据集能如此快速进入主流工具链,说明它精准命中了社区痛点:需要第二个、第三个独立数据源来验证"在 MIMIC 上发现的规律是不是 MIMIC 的偏误"。

§1.3 横向对比

数据集 ICU 入院数 国家/中心 时间跨度 时序分辨率 核心差异化
SICdb 27,386 奥地利/单中心 2013-2021 分钟级 + 小时聚合 分钟级粒度、GDPR、围手术期/心外科细节、内置 KDIGO 与 1 年死亡终点
MIMIC-IV 94,458 美国/单中心 2008-2022 约小时级 规模最大、四模态(EHR+文本+CXR+ECG)、生态最成熟
eICU-CRD 200,000+ 美国/208 家医院 2014-2015 5 分钟(vitalsPeriodic) 唯一多中心公开库,无文本
HiRID 33,905 瑞士/单中心 2008-2016 2 分钟 此前分辨率纪录保持者
AmsterdamUMCdb 23,106 荷兰/单中心 2003-2016 最高 1 分钟 欧洲首个大规模 ICU 公开库,GDPR 合规先驱

SICdb 的不可替代性在三点:分钟级且自带官方解包方案的信号数据(HiRID 虽为 2 分钟但不含用药滴定速率的完整分钟流);围手术期全链路(前置手术时间、体外循环时间、EuroSCORE II——MIMIC 无对应字段);以及含院外死亡的 1 年终点(eICU 无院外随访,MIMIC 需自行链接)。

§1.4 版本演进时间轴

时间 事件
2013-2021 数据采集期(萨尔茨堡大学医院 4 个 ICU)
2021 获 Land Salzburg 伦理委员会批准(EK Nr: 1115/2021),豁免个体知情同意
2022-11 v1.0.4(官方文档首次公开版本口径)
2023-02-14 PhysioNet v1.0.5 发布(首次公开上线)
2023-04 Intensive Care Medicine 发布信(Rodemund et al., 49:700-702, DOI: 10.1007/s00134-023-07046-3)
2023-06-12 v1.0.6:修复 ECG 心率映射(DataID=707)与身高体重异常;新增 KDIGO_AKI_168、cases.ICUOffset、data_ref.FieldID;扩充信号数据
2023-12 ricu 0.6.0 原生支持 SICdb v1.0.6(数据源名 sic,64 个临床概念)
2024-03-28 Scientific Data 数据论文(Rodemund et al., 11:320, DOI: 10.1038/s41597-024-03164-9)
2024-04 v1.0.7:新增 SOFA、RASS、NRS-11、HFNC 高流量氧疗、AdmissionUrgency、HospitalDischargeDay/HospitalStayDays;移除 36 个无效病例;重算 OffsetAfterFirstAdmission
2024-05 YAIB 于 ICLR 2024 发表并收录 SICdb;Sadeghi et al. 对比 MIMIC-IV 论文(Sci Rep 14:11438)
2024-09-10 v1.0.8(当前版):实验室参考项映射 LOINC(LOINC_code/short/long)
2028 PMU 官方资金保障截止年(官方承诺持续维护与扩充至 2028)

§1.5 典型 AI 应用场景

  1. 分钟级时序建模:利用 rawdata 分钟流训练 Transformer/TCN 等需要高频输入的模型,研究小时级数据无法捕捉的瞬时生理事件(插管、阻断、滴定)。
  2. 跨洲外部验证:在 MIMIC-IV/eICU 上训练、在 SICdb 上验证(或反向),量化美欧 ICU 人群与实践差异导致的模型衰减——YAIB 框架原生支持。
  3. AKI 预测与分期研究:官方内置 KDIGO_AKI_48 / KDIGO_AKI_168 标签(算法开源),免去自行实现 KDIGO 肌酐/尿量规则的工程负担。
  4. 围手术期与心脏外科研究:体外循环时间、EuroSCORE II、手术部位等字段支持从切皮到 ICU 出科的全程风险建模。
  5. 生存分析:OffsetOfDeath 提供含院外死亡的 1 年终点(多源匹配,含政府死亡登记),适合 Cox/DeepSurv 等长期预后模型。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

SICdb 库内诊断为 ICD-10(由 ORBIS 医院信息系统导出),且为单主诊断ICD10Main + ICD10MainText)——与 MIMIC 系列每次住院最多数十个编码位不同,这是 SICdb 结构化程度上的一个重要简化(也意味着共病信息需从 data_ref 的 Precondition* 字段补充)。有效 ICD-10 主诊断是病例入选 SICdb 的前提条件,因此每例必有。高频主诊断群到 ICD-11 的映射如下:

ICD-10(库内编码族) 中文名称 ICD-11 对应 备注
I21.x 急性心肌梗死 BA41 急性心肌梗死 心内科高频主诊断
I50.x 心力衰竭 CB4Z 心力衰竭 高频共病
A41.x 脓毒症 1G4Z 脓毒症 AdmissionFormHasSepsis 入院表字段互证
J96.x 呼吸衰竭 CB41 呼吸衰竭 机械通气人群
N17.x 急性肾衰竭 8B6Z 急性肾损伤 与内置 KDIGO 分期呼应
J18.x 肺炎 CA4Z 肺炎 感染高频
I25.x 慢性缺血性心脏病 BA52 缺血性心脏病 心外科(CABG)术前主要人群
Z 编码/外科操作相关 术后监护 (围手术期监护场景) 全库最主要入院原因:术后治疗

注意 ICD-10-GM 问题:编码源自德国医院信息系统 ORBIS,德国临床计费实际采用 ICD-10-GM(德国修订版),与 WHO 版 ICD-10 存在少量扩展码差异。跨国队列定义(尤其与美国 ICD-10-CM 或 ICD-9 数据集对齐)时,建议核对目标码是否为 GM 扩展码,必要时通过 DIMDI/BfArM 官方交叉表映射。

§2.2 SNOMED CT 映射

临床场景 ICD-10 SNOMED CT SNOMED CT 术语
脓毒症 A41.9 91302008 Sepsis (disorder)
急性心肌梗死 I21.9 22298006 Myocardial infarction (disorder)
心力衰竭 I50.9 84114007 Heart failure (disorder)
急性肾损伤 N17.9 14669001 Acute renal failure syndrome (disorder)
呼吸衰竭 J96.00 65710008 Acute respiratory failure (disorder)
重症监护 133834002 Critical care medicine (procedure)
机械通气 243141005 Mechanical ventilation (regime/therapy)
体外循环 182744009 Cardiopulmonary bypass (procedure)
肾脏替代治疗 265764000 Renal dialysis (procedure)

§2.3 疾病简介

SICdb 面向重症监护与围手术期监护的全部疾病谱。与 MIMIC 系列以内科/综合 ICU 为主不同,SICdb 的最主要入院原因是术后治疗——其中心脏外科体外循环(CPB)患者构成细节最完整的特色亚群(含体外循环时间、EuroSCORE II 术前风险评分)。全库 SAPS III 均值 44.67(SD 14.81),机械通气超过 24 小时者占 8.79%(2,406 例),接受肾脏替代治疗者占 3.75%(1,027 例)。由于仅覆盖 58 张床位中的 41 张(大部分内科监护床位未纳入),围手术期病例相对过多,全库死亡率显著低于典型综合 ICU:ICU 出院存活率 96.55%,院内出院存活率 92.2%,28 天死亡率 9.9%,1 年死亡率约 18.8%(24,243 例有 1 年随访数据者中 19,689 例存活)。理解这一人群构成是正确使用 SICdb 训练任何结局模型的前提(详见 §7.1)。

§2.4 临床任务定义

AI 任务 临床定义 标准参考 在 SICdb 中的操作化
ICU 死亡预测 ICU 期间全因死亡 MetaVision 出科表单 cases.DischargeState(ref 编码)
院内死亡预测 住院期间全因死亡 ORBIS 临床信息系统 cases.HospitalDischargeType(ref 编码)
1 年死亡/生存分析 入院后 365 天内全因死亡(含院外) 政府死亡登记多源匹配 cases.OffsetOfDeath(秒,1 年封顶,NULL=1 年后仍存活或失访)
28 天死亡预测 入院后 28 天内死亡 流行病学惯例 OffsetOfDeath ≤ 28×86400
AKI 分期 KDIGO 2012 肌酐/尿量标准 KDIGO (2012) cases.KDIGO_AKI_48 / cases.KDIGO_AKI_168(官方内置,算法开源)
脓毒症识别 Sepsis-3:疑似感染 + SOFA ≥ 2 Singer et al. (2016), JAMA ricu sep3 概念;v1.0.7 起内置 SOFA 评分
住院时长预测 ICU 入科到出科 YAIB 任务定义 cases.TimeOfStay − ICUOffset(秒;注意含手术时间,见 §6.5 坑点 3)
心外科风险预测 术后死亡/并发症 EuroSCORE II cases 心外科附加字段(CPB 时间等)

§2.5 患者人群特征

维度 特征
数据来源 单中心:萨尔茨堡大学医院(SALK)/ 帕拉塞尔苏斯医科大学(PMU)麻醉与重症监护医学部,奥地利萨尔茨堡,三级转诊中心
采集时间 2013-2021(9 年,年均约 3,043 次入院,2017 年峰值 3,586 次)
规模 27,386 次 ICU 入院 / 21,583 名患者(v1.0.6)
ICU 覆盖 4 个监护室,58 张床位中的 41 张(技术原因未含 17 张,主要为内科监护床位)
年龄 均值 65.67 岁(SD 16.16);按 5 岁分箱发布,>90 岁统一入末箱
性别 男性 13,371(62.0%)/ 女性 8,212(38.0%);7 例未知性别已于 v1.0.4 人工查档修正
入院构成 单次入院 17,597(81.5%);多次入院 3,986 人(最多 12 次);主因:术后治疗(围手术期主导)
ICU 入住时长 均值 3.50 天(SD 6.49),分布左偏长尾,最长约 207 天
病情严重度 SAPS III 均值 44.67(SD 14.81);通气 >24h 占 8.79%;RRT 占 3.75%
死亡终点 1 年随访数据覆盖 24,243 次入院(88.5%);部分患者观测期仅 6 个月(EstimatedSurvivalObservationTime 标识)
数据总量 约 270 患者年;全库 >26 亿条记录;8 个高频生命体征合计 8.85 亿个数据点

§2.6 金标准/参考标准

数据来源 记录方式 产生者 金标准性质
床旁监护信号(data_float_h) MetaVision PDMS 自动采集,分钟级原始 + 小时聚合 iMDSoft MetaVision 系统 + ICU 设备 自动采集,含真实世界噪声(官方刻意不做清洗)
实验室检查(laboratory) 医院检验系统定量测定 SALK 检验科 定量标准;v1.0.8 起项目映射 LOINC
ICD-10 主诊断 出院后编码 SALK 病案编码流程(ORBIS 系统) 行政编码,每例必有(入选前提),单主诊断
院内死亡 临床信息系统自动记录 MetaVision 出科表单 + ORBIS 客观事件,高度可靠
院外死亡(1 年) 政府死亡登记多源匹配 奥地利政府死亡登记 + lookup 数据库 覆盖院外,外籍患者死亡信息可能稀缺(官方已声明)
SAPS III / EuroSCORE II 临床常规评分 ICU 医师团队 常规临床评估,前瞻性录入
KDIGO AKI 分期 官方算法派生 SICdb 团队(代码公开于 GitHub) 算法化金标准,版本化、可复现

脱敏规则(所有下游分析的前提):GDPR 第 4(5) 条假名化 + HIPAA 合规双重声明;仅保留入院年份(AdmissionYear),其余全部时间转为距入院的秒级 offset;年龄/体重/身高按 5 单位分箱(>90 岁入末箱);地理信息删除;重识别尝试为欧洲法律明文禁止。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本/路径 大小 理由
开新课题、需要 LOINC 标准化检验项、最全字段 v1.0.8(当前版) <10 GB 最新版:实验室项目映射 LOINC,含 v1.0.7 的 SOFA/RASS/NRS-11/HFNC/AdmissionUrgency
复现 Scientific Data 2024 论文 / 使用 ricu / 使用 YAIB v1.0.6 <10 GB 文献与 ricu 生态的锚定版本(ricu 的 sic 数据源针对 v1.0.6 构建)
不建关系库、快速做 ML 实验 ricu / YAIB 管道 视任务 64 个标准化临床概念 + 五任务(死亡/AKI/脓毒症/肾功能/LOS)开箱即用
免认证调试管道 SICdb 无 demo 版 先用 MIMIC-III demo 或 eICU demo(YAIB 内置)跑通,再申请 SICdb 全库
与 MIMIC-IV 头对头对比 v1.0.6 + Sadeghi 2024 口径 Sadeghi et al.(Sci Rep 2024)已发布系统对比,直接引用其队列定义

SICdb vs MIMIC-IV 关键差异速查(Sadeghi et al. 2024 Table 1 + 官方文档):

维度 SICdb v1.0.6 MIMIC-IV v2.x
时间跨度 2013-2021(9 年) 2008-2022(12 年,7 年重叠)
患者数 / ICU 入院 21,583 / 27,386 50,934 / 73,000+(ICU 模块口径)
覆盖范围 纯 ICU(含前置手术) ICU + 全院住院 + 急诊 + 文本 + CXR + ECG
信号分辨率 分钟级(rawdata)+ 小时聚合 约小时级(chartevents)
诊断编码 ICD-10 单主诊断(每例必有) ICD-9 + ICD-10 多编码位
绝对时间 仅入院年份 anchor_year_group(三年区间)
年龄 5 岁分箱,>90 封顶 anchor_age 整数,91 封顶
院外死亡 内置(政府登记,1 年封顶) 需自行链接(SSA 已于 IV 移除)
内置评分 SAPS III、EuroSCORE II、SOFA(1.0.7+) 无(社区 concepts 派生)
平均 LOS 3.50 天 3.46 天
平均年龄 / 男性占比 66 岁 / 62% 65 岁 / 56%
访问审批 凭证化 + 逐案审批(Contributor Review) 凭证化(Credentialed)
临床文本 note 模块(需单独 DUA)

一句话结论:要分钟级信号、围手术期/心外科细节、1 年死亡终点、欧洲人群 → 选 SICdb;要文本/影像/最大样本量/最成熟生态 → 选 MIMIC-IV;多中心 → eICU。

§3.1 模态详细说明

SICdb 为单模态(结构化)数据集,但内部包含五种信息形态:

  1. 分钟级床旁信号data_float_h.rawdata 内序列化存储——每行对应一个信号项的一小时,rawdata 为 240 字节 = 60 个小端 IEEE 754 float32(每分钟 1 个值,0x00000000 表示该分钟无值)。8 个最高频生命体征合计 884,714,655 个数据点,平均每个观察小时 48.06 条记录。
  2. 小时级聚合信号data_float_hVal(聚合值)与 cnt(被聚合的原始值个数)列,无需解包即可直接做小时级建模。
  3. 实验室与用药laboratory(定量检验值 + 检验类型如动脉血气)与 medication(DrugID、起止 offset、单剂/持续区分、总量与每分钟速率)。
  4. 起止型与标称数据data_range(中心静脉导管、引流等有起止时间的事件)与 data_ref(每次入院的分类属性,如 PreconditionDiabetes、PreconditionArtHypertension 等既往症)。
  5. 病例级汇总cases 主表(人口学、SAPS III、EuroSCORE II、ICD-10 主诊断、KDIGO 分期、死亡 offset)+ unitlog(床位/转运日志)。

§3.2 样本量拆分(8 张表完整清单)

表名 内容 量级
cases.csv.gz 主表:每次 ICU 入院一行(人口学、评分、ICD-10、死亡 offset、KDIGO) 27,386 行(v1.0.6)
data_float_h.csv.gz 浮点信号:小时聚合 + rawdata 分钟流(生命体征、呼吸机参数等) 全库最大文件;8 个高频项即 8.85 亿数据点
laboratory.csv.gz 实验室检查(检验值、检验类型如动脉血气) 数十万-百万级行(官方未公布精确行数)
medication.csv.gz 给药(药品、起止、速率、单剂/持续) 同上
data_range.csv.gz 起止型事件(中心静脉导管、引流等) 同上
data_ref.csv.gz 标称/分类数据(每次入院一行:既往症等) 与 cases 一一对应
unitlog.csv.gz 床位/转运日志 每次入院多行
d_references.csv.gz 编码字典(ReferenceGlobalID → 名称/单位;v1.0.8 起含 LOINC) 数千条目

官方口径的总量表述:全库由 26 亿+ 数据库条目构成(sicdb.com);原始信号数据 15 亿+ 数据点(v1.0.8 PhysioNet Methods);累计约 270 患者年(Sci Data 2024)。

§3.3 数据格式详情

形态 格式 说明
发布文件 8 个 .csv.gz(RFC 4180)+ Documentation.pdf + 校验和 PhysioNet 官方 zip,扁平目录
rawdata 字段 二进制字节流(60 × 小端 IEEE 754 float32 = 240 字节/行) CSV 内以转义文本形式存储,需按官方脚本解包(见 §6.1)
本地数据库 PostgreSQL / MySQL / SQLite 官方 GitHub 提供 Python 导入脚本(Import/Python)
R 生态 ricu ≥ 0.6.0 数据源名 sic,64 个临床概念,v1.0.6 锚定
ML 管道 YAIB(Apache Parquet) DYNAMIC/STATIC/OUTCOME 三文件范式

§3.4 存储大小

形态 大小 备注
gzip CSV 压缩包(8 文件) <10 GB 官方设计目标(序列化核心动机)
分钟级中间数据(全解压) 约 240 GB 官方文档明示;2023 年后预计再增约 15%
关系库导入(小时级口径) 建议预留 ≥50 GB 含索引的工程建议值(非官方数字)
全量分钟级建库 建议预留 ≥300 GB 含 rawdata 全解压 + 索引的工程建议值(非官方数字)

§3.5 标注方式

SICdb 无传统手工标注,标签来源四层:

  1. 客观事件(最可靠):ICU/院内死亡(系统自动记录)、院外死亡(政府登记匹配)。
  2. 定量测量:检验值与监护信号——自动采集,"异常"需按临床标准自行定义。
  3. 官方算法派生:KDIGO_AKI_48 / KDIGO_AKI_168——由 SICdb 团队按 KDIGO 2012 指南实现,算法版本化并公开于 GitHub,等同"算法化金标准"。
  4. 行政编码(有噪声):ICD-10 主诊断——编码员按计费流程分配,单主诊断制。

官方明确声明:刻意不对大部分真实世界数据做清洗(保留 implausible values),仅修正了三类"对回顾性分析绝对关键"的字段——性别(7 例未知,人工修正)、身高/体重(207 例不合常理值,人工查医疗档案修正,多为身高体重颠倒或漏零;v1.0.6 起同时保留修正前原始值供对照实验)。

§3.6 标注者资质

不适用传统标注者概念。信号数据由 MetaVision PDMS 自动采集;表单类数据(既往症、术前用药)由护理与医师团队常规录入;检验数据来自医院检验科;ICD-10 由病案编码专业人员分配;SAPS III/EuroSCORE II 由 ICU 医师按临床常规评估。数据质量经 MetaVision 与 ORBIS 双系统交叉验证,导出管道含行级版本控制与单元测试(Sci Data 2024 Technical Validation)。

§3.7 数据采集时间范围

2013-2021 年,共 9 年。年均约 3,043 次入院,2017 年为峰值(3,586 次)。注意 2020-2021 年处于 COVID-19 疫情期,该时段病例构成可能受疫情影响(官方未单独标注新冠队列)。绝对日历日期已脱敏删除,仅 AdmissionYear 可用作时代分层轴。

§3.8 地理覆盖

单中心——萨尔茨堡大学医院(SALK),奥地利萨尔茨堡州。地理信息在脱敏阶段已删除(邮编等不发布)。单中心 + 围手术期主导是 SICdb 最核心的两个泛化性限制因素(详见 §7.3)。

§3.9 采集设备规格

系统/设备 型号/版本 覆盖范围 说明
ICU 患者数据管理系统 iMDSoft MetaVision(Tel Aviv, Israel) 4 个 ICU、41 张床位 床旁监护信号、呼吸机参数、表单
医院信息系统 ORBIS(Dedalus Healthcare GmbH, Bonn, Germany) 全院 ICD-10 编码、出入院记录
院外死亡登记 奥地利政府死亡登记 全国 经非公开 lookup 数据库匹配
导出/处理软件 SICdb 自研导出软件 ACID 事务特性;支持增量更新

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 数据源系统 MetaVision PDMS(床旁)+ ORBIS HIS(全院)+ 检验系统 临床数据实时产生于诊疗、监护与检验过程
2. 数据导出 SICdb 自研导出软件(ACID 事务) MSSQL 数据库 + Excel 导出;全部可用电子数据完整导出(除 PHI 不省略)
3. 初级脱敏 非公开 lookup 数据库 分配 CaseID/PatientID 随机标识;映射关系留存供后续验证与外部数据合并(不公开)
4. 交叉验证 MetaVision × ORBIS 双系统比对 保证病例身份准确;剔除测试数据、开发数据、重复与无效条目;行级版本控制 + 单元测试
5. 结构化重组 分析友好的 8 表结构 分钟级信号序列化为 IEEE 754 流嵌入 rawdata;标称数据统一经 d_references 编码
6. 终末脱敏 GDPR Art. 4(5) + HIPAA 时间转秒级 offset(仅留入院年份);人口学 5 单位分箱;地理信息删除
7. 公开发布 PhysioNet 2023-02 v1.0.5 首发 → 2024-09-10 v1.0.8 当前版;凭证化 + 逐案审批 + DUA

§4 数据结构详解

§4.0 目录结构预览

sicdb-1.0.8/
├── cases.csv.gz           # 主表:每次 ICU 入院一行(27,350+ 行,约 30+ 列)
├── data_float_h.csv.gz    # 浮点信号主表(小时聚合 Val/cnt + rawdata 分钟流)——最大文件
├── data_range.csv.gz      # 起止型事件(中心静脉导管、引流等)
├── data_ref.csv.gz        # 每次入院的标称/分类数据(既往症等,FieldID 关联字典)
├── laboratory.csv.gz      # 实验室检查(含 PatientID 便于跨次查询)
├── medication.csv.gz      # 给药记录(速率、起止、单剂/持续)
├── unitlog.csv.gz         # 床位/转运日志
├── d_references.csv.gz    # 编码字典:ReferenceGlobalID → 名称/单位(v1.0.8 起含 LOINC 三列)
├── Documentation.pdf      # 离线版官方文档(表结构 + 解包说明)
├── SHA256SUMS.txt         # 文件校验和
└── LICENSE.txt            # PhysioNet Contributor Review Health Data License 1.5.0

§4.1 DAIMS 标准化字段描述表

核心表:cases

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
CaseID INTEGER ICU 入院唯一标识(随机分配) 15234 全库主键 不允许缺失 正整数
PatientID INTEGER 患者唯一标识 8934 再入院识别/划分分组 不允许缺失 正整数
AdmissionYear INTEGER 入院年份(唯一绝对时间) 2017 时代分层/漂移分析 不允许缺失 2013-2021
TimeOfStay INTEGER 停留秒数(MetaVision 入院→结案,含前置手术 302400 LOS 靶标(须配合 ICUOffset) 含手术时间 不允许缺失 ≥0 秒
ICUOffset INTEGER 首次实际 ICU 床位分配(秒) 21600 真实 ICU 起点(v1.0.6 新增) 系统记录 无手术期病例可为 0/NULL ≥0 秒
AgeOnAdmission INTEGER 年龄(5 岁分箱,>90 记 90) 70 协变量(精度受限) 分箱 ±2.5 岁 不允许缺失 分箱整数
saps3 FLOAT SAPS III 评分 45.0 严重度协变量/基线 临床评估 部分缺失 约 0-120
ICD10Main TEXT ICD-10 主诊断码 “I21.0” 队列定义 编码员分配 不允许缺失(入选前提) ICD-10(-GM)
HospitalDischargeType REFERENCE 出院类型(指示院内生存) ref → d_references 院内死亡靶标 系统记录 不允许缺失 字典编码
DischargeState REFERENCE ICU 出科状态(指示 ICU 生存) ref → d_references ICU 死亡靶标 出科表单 不允许缺失 字典编码
OffsetOfDeath INTEGER 入院至死亡秒数(1 年封顶,含院外) 7776000 生存分析终点 政府登记匹配,外籍患者或稀缺 1 年后死亡/存活为 NULL(右删失) >0 秒或 NULL
EstimatedSurvivalObservationTime REFERENCE 生存观测期(1 年或 6 个月) ref → d_references 删失机制协变量 技术原因部分仅 6 个月 不允许缺失 字典编码
KDIGO_AKI_48 / KDIGO_AKI_168 INTEGER 48h/168h 内 AKI 分期(官方算法) 2 AKI 标签 算法派生 无足够数据时规则定义 0-3

核心表:data_float_h

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
CaseID INTEGER 入院标识(外键) 15234 关联主表 不允许缺失 正整数
DataID REFERENCE 信号项标识(→ d_references) 707 指标选择 v1.0.6 修复 ECG 心率错映 不允许缺失 字典编码
Offset INTEGER 距入院秒数(该小时起点) 3600 时序对齐 小时对齐 不允许缺失 ≥0 秒
Val FLOAT 小时聚合值 78.5 小时级特征 真实世界噪声未清洗 无数据小时无行(MNAR) 因 DataID 而异
cnt INTEGER 该小时被聚合的原始值个数 58 采样密度/缺失代理 系统产生 不允许缺失 0-60
rawdata BLOB 60×小端 float32 分钟流(240 字节) 二进制 分钟级建模 0x00000000 = 该分钟无值 全零四字节为 NULL(MNAR) 二进制

核心表:laboratory

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
id INTEGER 行主键 500001 行标识 不允许缺失 正整数
CaseID / PatientID INTEGER 入院/患者标识 15234 / 8934 关联;跨次住院检验查询 不允许缺失 正整数
LaboratoryID REFERENCE 检验项(→ d_references;v1.0.8 起映射 LOINC) 3001 指标选择 不允许缺失 字典编码
Offset INTEGER 距入院秒数 7200 时序对齐 分钟级精度 不允许缺失 ≥0 秒
LaboratoryValue FLOAT 检验值(单位查字典) 1.2 时序特征 检验体系定量 未测即无行(MAR 工作流驱动) 因项目而异
LaboratoryType REFERENCE 特殊检验类型(如动脉血气) ref → d_references 样本类型分层 系统记录 常规检验为 NULL 字典编码

核心表:medication

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
id INTEGER 行主键 700001 行标识 不允许缺失 正整数
CaseID INTEGER 入院标识 15234 关联主表 不允许缺失 正整数
DrugID REFERENCE 药品(→ d_references,德语/英语药名混合) 4001 暴露定义 人工录入误差 不允许缺失 字典编码
Offset / OffsetDrugEnd INTEGER 开始/结束秒数 3600 / 86400 暴露时间窗 单剂推注 OffsetDrugEnd 设为 60 秒 不允许缺失 ≥0 秒
IsSingleDose INTEGER 是否单剂推注 0 暴露类型区分 系统记录 不允许缺失 0 / 1
Amount / AmountPerMinute FLOAT 总量 / 每分钟速率 50.0 / 0.08 剂量特征 人工录入 视给药方式 ≥0

§4.2 标签分布统计

临床任务 阳性率/分布 口径说明
ICU 死亡 3.45%(ICU 出院存活 96.55%,26,446/27,386) 按入院(ICM 2023 letter)
住院期间死亡 约 5.2%(1,139 例住院期间死亡 / 21,583 患者) 按患者(Sadeghi 2024)
院内死亡 7.8%(院内出院存活 92.2%,25,252/27,386) 按入院(ICM 2023 letter)
28 天死亡 9.9% Sadeghi 2024
1 年死亡 约 18.8%(24,243 例随访者中 19,689 存活) 含院外(ICM 2023 letter)
机械通气 >24h 8.79%(2,406 例) ICM 2023 letter
肾脏替代治疗 3.75%(1,027 例) ICM 2023 letter
AKI(KDIGO 分期) 按 KDIGO_AKI_48/168 字段分布 官方算法派生,v1.0.6 起
SAPS III 均值 44.67(SD 14.81) ICM 2023 letter

全库死亡率显著低于典型综合 ICU 是设计事实而非数据错误——官方明确归因于围手术期病例占比高(见 §7.1)。任何在 SICdb 上训练的死亡模型都不应直接与 MIMIC(院内死亡 11.5%)比较绝对指标。

§4.3 关键字段描述性统计

  • 8 个最高频生命体征合计 884,714,655 个分钟级数据点;平均每个观察小时 48.06 条记录(Sci Data 2024)。
  • 全库累计约 270 患者年的监护数据;全库 >26 亿条数据库条目(sicdb.com)。
  • 年入院量约 3,043 次,2017 年峰值 3,586 次(Sadeghi 2024)。
  • 多次入院患者 3,986 人(18.5%),最多 12 次入院;OffsetAfterFirstAdmission 记录距首次入院秒数(v1.0.7 重算修复)。
  • 追踪到死亡事件 5,093 例(含院外 1 年内),其中 1,139 例(21.85%)发生于住院期间(Sadeghi 2024)。
  • 身高/体重 207 例不合常理值已人工修正,v1.0.6 起保留修正前原始值——可用于"清洗对模型影响"的对照实验。

§4.4 数据层级关系

PatientID(21,583 名患者)
  └─ CaseID(27,386 次 ICU 入院;cases 主表)
      ├─ data_float_h(信号:小时聚合 + rawdata 分钟流)
      ├─ laboratory(检验;⚠️ 同时带 PatientID,可查既往住院检验)
      ├─ medication(给药)
      ├─ data_range(起止型事件:导管、引流)
      ├─ data_ref(标称属性:既往症等,每次入院一行)
      └─ unitlog(床位/转运)

d_references(编码字典:ReferenceGlobalID → ReferenceValue/ReferenceUnit[/LOINC])
  └─ 被各表的 DataID / LaboratoryID / DrugID / DischargeState / Sex 等 REFERENCE 列引用
  • 时间体系三要素:AdmissionYear(绝对,年仅粒度)+ Offset(秒,距 MetaVision 入院)+ ICUOffset(秒,实际 ICU 起点)。跨表对齐全部用 Offset 算术,不存在 timestamp 列
  • 高频踩坑laboratory 的检验项外键名是 LaboratoryID,官方文档字段表中一度误写为 DrugID(SQL 示例中为正确名);OffsetOfDeath 以 NULL 同时表达"1 年后死亡"与"存活"两种语义(右删失)。

§4.5 缺失值情况与信息性缺失编码

缺失类型 指标示例 缺失原因 信息性缺失编码 对 AI 的影响
rawdata 分钟 NULL 任意分钟级信号 该分钟无采集(断开、转运、手术中) 0x00000000 四字节全零 解包时必须跳过,不可当 0 值(见 §6.5 坑点 1)
MAR(工作流程驱动) 乳酸等非常规检验 仅在怀疑病理状态时检查 无行 = 未检查 均值填充系统性低估健康者
MNAR_device 有创血压、CVP 仅在置管患者中采集 缺失 = 无导管 缺失本身即严重度代理
小时级无行 data_float_h 无数据小时 无记录小时不产生行 cnt 列可反推采样密度 前向填充需限时长
右删失 OffsetOfDeath 1 年封顶 + 部分仅 6 个月观测期 NULL + EstimatedSurvivalObservationTime 生存分析必须按删失处理
分箱信息损失 AgeOnAdmission 脱敏 5 岁分箱、>90 封顶 精度损失非随机缺失 亚群分析粒度受限

§5 数据划分与使用建议

§5.1 官方数据划分

SICdb 官方不提供 train/validation/test 划分。 社区的事实标准解法是 YAIB(Yet Another ICU Benchmark, ICLR 2024)框架:其队列生成代码(YAIB-cohorts)内置 SICdb 支持,提供死亡、AKI、脓毒症、肾功能、LOS 五个任务的统一定义与划分流程;底层依赖 ricu 的 sic 数据源(64 个标准化临床概念)。若你的目标是与已发表文献比较,请直接使用 YAIB 管道而非自建划分。

§5.2 推荐划分策略

  1. 按 PatientID 分组随机划分(唯一正确做法):18.5% 患者有多次入院(最多 12 次),按 CaseID 随机划分必然泄漏。
  2. 按 AdmissionYear 时间外验证:2013-2018 训练、2019-2021 测试——SICdb 保留了真实入院年份,这是它相对 MIMIC-III(真实年份被抹除)的一个独特优势,可做真正的时序外验证。
  3. 按 AdmissionUrgency / SurgicalSite 分层:区分择期手术、急诊手术与非手术病例(v1.0.7 起 AdmissionUrgency 可用)。
  4. 首入院 vs 再入院:用 OffsetAfterFirstAdmission = 0(或首条记录)圈定首入院队列,与 Harutyunyan 式"首次 ICU 入住"文献口径对齐。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

cases = pd.read_csv("cases.csv.gz")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
train_idx, test_idx = next(gss.split(cases, groups=cases["PatientID"]))
train_pats = set(cases.iloc[train_idx]["PatientID"])
test_pats = set(cases.iloc[test_idx]["PatientID"])
assert len(train_pats & test_pats) == 0  # 患者级零泄漏验证

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按 CaseID 而非 PatientID 划分(18.5% 多次入院) GroupShuffleSplit(groups=PatientID)
2 用 TimeOfStay 全长计算 LOS 特征(含前置手术时间) 用 ICUOffset 锚定真实 ICU 起点;预测窗口从 ICUOffset 起算
3 用 DischargeState / HospitalDischargeType / DischargeUnit 衍生特征 出院类字段只作标签,严禁入模
4 用 OffsetOfDeath / EstimatedSurvivalObservationTime 衍生特征 死亡字段只作终点
5 预测窗口越过 ICUOffset 之前(手术期)数据未声明 明确声明特征窗口是否含手术期,并与文献口径对齐

§5.4 交叉验证建议

  • 标准:5 折或 10 折按 PatientID 分组交叉验证(GroupKFold)。
  • 时间外稳健性:以 AdmissionYear 为折叠轴做留一年验证,检验对临床实践演变的稳健性。
  • 跨库稳健性:用 ricu/YAIB 在 MIMIC-IV/eICU/HiRID/AUMCdb 上训练、SICdb 上测试(或反向),复现 YAIB 的跨库矩阵。

§5.5 外部验证

在 SICdb 上训练的模型,经典外部验证路径为:MIMIC-IV(美国单中心,Sadeghi 2024 已建立数据集级对比口径)、eICU-CRD(美国多中心)、HiRID(瑞士,同为欧洲高分辨率库)、AmsterdamUMCdb(荷兰)。ricu 的 64 概念跨库统一定义使这些验证的工程成本大幅降低。


§6 AI 就绪指南

§6.0 云端快速启动

SICdb 无官方 demo 数据集与官方 Colab(截至 2026-09)。零门槛替代路径:

路径 1 — YAIB demo 先行:YAIB 仓库内置 MIMIC-III 与 eICU 的 demo 队列(Apache 许可,免认证),先用 icu-benchmarks 跑通五任务全流程,申请到 SICdb 后仅更换数据源即可复用整条管道。

路径 2 — ricu 一键概念提取(R 用户):完成 PhysioNet 认证并下载 v1.0.6 后,library(ricu) + load_concepts(c("hr", "map", "crea", "sofa_score"), "sic") 即可按 64 个标准化概念提取时序,无需手写解包代码。

路径 3 — 官方导入脚本建库:官方 GitHub 的 Import/Python 提供 PostgreSQL / MySQL / SQLite 导入脚本,适合需要 SQL 分析的团队。

§6.1 快速上手(Python 版:读 cases + 解包 rawdata)

# ========================================
# SICdb 快速上手 — Python 版
# 环境要求: pandas, numpy(解包仅需标准库 struct)
#
# ⚠️ 目录结构预期:
#   请将下载的数据解压至 ./sicdb-1.0.8/ 目录,确保以下结构:
#   ./sicdb-1.0.8/
#   ├── cases.csv.gz          # 主表
#   ├── data_float_h.csv.gz   # 信号表(含 rawdata 分钟流)
#   ├── laboratory.csv.gz / medication.csv.gz
#   ├── data_ref.csv.gz / data_range.csv.gz / unitlog.csv.gz
#   └── d_references.csv.gz   # 编码字典(所有 REFERENCE 列都要 join 它)
#
# 关键约定:
#   - 所有 Offset 列 = 距 MetaVision 入院的秒数
#   - rawdata = 60 个小端 IEEE 754 float32(240 字节),
#     四字节全零 (0x00000000) = 该分钟无值,必须跳过
# ========================================
import struct
import numpy as np
import pandas as pd

# 步骤 1:读主表并构造 1 年死亡标签
cases = pd.read_csv("./sicdb-1.0.8/cases.csv.gz")
ONE_YEAR = 365 * 24 * 3600
cases["died_1y"] = cases["OffsetOfDeath"].notna() & (cases["OffsetOfDeath"] <= ONE_YEAR)
print(cases[["CaseID", "PatientID", "AdmissionYear", "saps3", "died_1y"]].head())

# 步骤 2:编码字典——所有 REFERENCE 列的翻译表
refs = pd.read_csv("./sicdb-1.0.8/d_references.csv.gz")
id2name = dict(zip(refs["ReferenceGlobalID"], refs["ReferenceValue"]))
hr_id = refs.loc[refs["ReferenceValue"].str.contains("heart rate", case=False, na=False),
                 "ReferenceGlobalID"].iloc[0]

# 步骤 3:官方解包函数(sicdb.com 文档 Raw data 一节)
def get_raw_values(data: bytes) -> list[float]:
    """解包 rawdata:60 个小端 float32,全零四字节为 NULL(跳过)"""
    ret = []
    for i in range(len(data) // 4):
        chunk = data[i*4:(i+1)*4]
        if chunk == b"\x00\x00\x00\x00":
            continue  # NULL:该分钟无值,不是数值 0!
        ret.append(struct.unpack("<f", chunk)[0])
    return ret

# numpy 向量化等价版(推荐生产用):
def unpack_minutes(data: bytes) -> np.ndarray:
    arr = np.frombuffer(data, dtype="<f4")          # 小端 float32
    return arr[arr != 0.0]                          # 全零为 NULL

# 步骤 4:取某 CaseID 的心率分钟流(rawdata 在 CSV 中为转义字节串,
# 读入后需按官方 GitHub「Scripts/Unpack raw data」脚本转为 bytes 再解包)
sig = pd.read_csv("./sicdb-1.0.8/data_float_h.csv.gz",
                  usecols=["CaseID", "DataID", "Offset", "Val", "cnt"])
hr_hourly = sig[(sig["DataID"] == hr_id) & (sig["CaseID"] == 15234)]
print(hr_hourly.head())  # 小时级建模到此即可,无需解包

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
CSV 全库下载(v1.0.8) https://physionet.org/content/sicdb/1.0.8/ <10 GB ① 注册 PhysioNet 账号;② 完成 CITI Program 的 Data or Specimens Only Research 课程(约 2-4 小时);③ 提交凭证化申请;④ 向贡献者提交具体研究问题并获逐案批准(Contributor Review,比 MIMIC 多一步);⑤ 签署 DUA 下载
历史版本 https://physionet.org/content/sicdb/1.0.6/ <10 GB 同上;ricu 生态锚定版本
官方代码 https://github.com/nrodemund/sicdb 导入脚本、rawdata 解包脚本、KDIGO 算法、SQL 示例
ricu(R) CRAN/GitHub: eth-mds/ricu 免下载概念层 需已获 SICdb 访问权限并配置数据目录

DUA 核心义务:不得尝试重识别(欧洲法律明文禁止)、不得分享给未授权者、安全存储、发表时按规范引用(PhysioNet 数据集 + Sci Data 2024 论文 + PhysioNet 平台;ICM 发布信页面注明其为强制引用,建议一并引用,见 §9)。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(Python 版,小时级特征口径)</b></summary>

import pandas as pd
import numpy as np

ROOT = "./sicdb-1.0.8"

# 步骤 1:成人首次入院队列 + 标签
cases = pd.read_csv(f"{ROOT}/cases.csv.gz")
cohort = cases[cases["AgeOnAdmission"] >= 18].copy()
cohort = cohort.sort_values(["PatientID", "AdmissionYear", "OffsetAfterFirstAdmission"])
cohort = cohort.groupby("PatientID").first().reset_index()      # 首次入院
cohort["died_hosp"] = cohort["OffsetOfDeath"].notna() & (
    cohort["OffsetOfDeath"] <= cohort["HospitalStayDays"] * 86400)

# 步骤 2:字典解析 + 目标变量 DataID 定位
refs = pd.read_csv(f"{ROOT}/d_references.csv.gz")
def ref_id(pattern):
    hits = refs.loc[refs["ReferenceValue"].str.contains(pattern, case=False, na=False),
                    "ReferenceGlobalID"]
    return hits.tolist()
VITALS = {  # 按字典 ReferenceValue 模糊匹配(正式项目请打印核对后再固化 ID)
    "hr":   ref_id("heart rate"),
    "map":  ref_id("mean arterial"),
    "spo2": ref_id("oxygen saturation"),
    "rr":   ref_id("respiratory rate"),
}
all_ids = [i for ids in VITALS.values() for i in ids]

# 步骤 3:ICU 起点后 24h 窗口的小时级信号(分块读大表)
chunks = []
for chunk in pd.read_csv(f"{ROOT}/data_float_h.csv.gz", chunksize=5_000_000):
    sub = chunk[chunk["DataID"].isin(all_ids)]
    sub = sub.merge(cohort[["CaseID", "ICUOffset"]], on="CaseID")
    sub = sub[(sub["Offset"] >= sub["ICUOffset"]) &
              (sub["Offset"] < sub["ICUOffset"] + 24 * 3600)]
    chunks.append(sub)
vitals = pd.concat(chunks)

# 步骤 4:映射变量名并聚合(mean/min/max/cnt 覆盖度)
id2name = {i: n for n, ids in VITALS.items() for i in ids}
vitals["item"] = vitals["DataID"].map(id2name)
feat = (vitals.groupby(["CaseID", "item"])["Val"]
              .agg(["mean", "min", "max", "count"])
              .unstack("item"))
feat.columns = [f"{v}_{s}" for s, v in feat.columns]

# 步骤 5:信息性缺失处理——count=0 视为未测量,缺失率 >50% 生成标识列
missing = feat.isna().mean()
for col in missing[missing > 0.5].index:
    feat[f"{col}_missing"] = feat[col].isna().astype(int)
feat = feat.fillna(feat.median(numeric_only=True))
X = feat.merge(cohort[["CaseID", "died_hosp", "saps3", "AgeOnAdmission"]],
               left_index=True, right_on="CaseID")
print(f"特征矩阵: {X.shape}")

</details>

推荐直接使用成熟管道替代手写:ricu(R,load_concepts(..., "sic"),64 概念)、YAIB(Python,五任务端到端)、官方 SICdb 软件(可导出多种统计软件格式、一键导出分钟值)。分钟级研究请复用官方 GitHub 的「Unpack raw data」脚本而非自行解析字节偏移。

§6.4 框架加载

import torch
from torch.utils.data import Dataset, DataLoader

class ICUDataset(Dataset):
    def __init__(self, X, y):
        self.X = torch.FloatTensor(X)
        self.y = torch.FloatTensor(y)
    def __len__(self):
        return len(self.y)
    def __getitem__(self, i):
        return self.X[i], self.y[i]

loader = DataLoader(ICUDataset(X_train, y_train), batch_size=128, shuffle=True)
import lightgbm as lgb  # LightGBM 基线:YAIB 论文中表格式特征上常与深度学习打平
dtrain = lgb.Dataset(X_train, label=y_train)
params = {"objective": "binary", "metric": "auc",
          "scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
          "num_leaves": 63, "learning_rate": 0.05}
model = lgb.train(params, dtrain, num_boost_round=500)

§6.5 常见坑点

⚠️ 坑点 1:rawdata 的全零四字节是 NULL,不是数值 0(分类:工程陷阱)

问题:分钟级数据序列化为 60 个小端 IEEE 754 float32(240 字节/行),官方规定 0x00000000 表示"该分钟无值"。float32 的全零位模式恰好等于数值 0.0——不解语义直接 np.frombuffer 会把"无数据"全部当成 0 值。

症状:分钟级心率/血压序列出现大量诡异的 0 值;模型学到"半夜心率归零"伪模式;分钟级统计的均值被大幅拉低。

解决:解包时显式剔除全零四字节(§6.1 的 get_raw_values / unpack_minutes 已处理);生产环境用官方 GitHub「Scripts/Unpack raw data」脚本,它同时计算每个分钟值对应的正确 Offset。

参考sicdb.com 官方文档 “Raw data” 一节;https://github.com/nrodemund/sicdb

⚠️ 坑点 2:只有 AdmissionYear 是绝对时间,其余全是秒级 offset(分类:评估误用)

问题:脱敏删除了全部日历时间——没有入月、星期、季节,只有入院年份 + 距入院的秒数。任何需要"冬季 vs 夏季"“周末效应”"节假日效应"的研究在 SICdb 上原理上不可行

症状:试图做季节性分析时发现无字段可用;跨病例的"同时段对照"无法按日历对齐。

解决:只做相对时间分析(以 Offset=0 为 t=0);时代分层用 AdmissionYear(2013-2021,这是相对 MIMIC-III 的优势,可做时序外验证);需要日历维度的研究改用 MIMIC-IV(anchor_year_group)或 HiRID。

参考:PhysioNet SICdb Methods(脱敏策略)。

⚠️ 坑点 3:TimeOfStay 包含前置手术时间,ICUOffset 才是真实 ICU 起点(分类:标签理解)

问题:SICdb 的"入院"是 MetaVision 系统登记的起点,对术后转入的患者,这个起点早于实际 ICU 床位分配——TimeOfStay 因此包含手术时间。直接用它当 ICU LOS 会系统性高估。

症状:LOS 均值与文献不符;手术时长成为 LOS 模型的"作弊特征";与其他 ICU 数据集(MIMIC 的 ICUSTAYS.LOS)对比时对不上。

解决:用 ICUOffset(v1.0.6 新增,首次 ICU 床位分配秒数)锚定真实 ICU 起点:icu_los = TimeOfStay - ICUOffset;预测窗口从 ICUOffset 起算。Sadeghi 2024 实测:扣除 ICUOffset 对均值影响小但不可忽视。

参考:Sadeghi et al. (2024), Sci Rep 14:11438;官方文档 cases 表 ICUOffset 字段说明。

⚠️ 坑点 4:CaseID vs PatientID——18.5% 再入院患者(分类:数据泄漏)

问题:每次 ICU 入院一个 CaseID,但 3,986 名患者(18.5%)有多次入院(最多 12 次)。按 CaseID 随机划分会让同一患者的不同入院落在训练与测试两侧。

症状:测试集 AUROC 虚高;用 laboratory 表(含 PatientID,可查既往住院检验)时无意间把"未来入院"的信息引入。

解决:始终 GroupShuffleSplit(groups=PatientID) 并断言患者集合零交集(§5.2 代码);OffsetAfterFirstAdmission 可识别再入院次序;特征窗口禁止跨 CaseID 取"未来"数据。

参考:Sadeghi et al. (2024) Figure 2c(再入院分布)。

⚠️ 坑点 5:年龄/体重/身高是 5 单位分箱,>90 岁封顶(分类:预处理陷阱)

问题:脱敏将 AgeOnAdmission 按 5 岁分箱(如 70 表示 68-72 区间)、>90 岁统一记为 90,体重身高同样 ±5 分箱。BMI、精确年龄亚群、剂量按体重换算等计算存在 ±2.5 单位系统性舍入。

症状:按体重计算的血管活性药剂量(mcg/kg/min)出现阶梯状伪分布;年龄-死亡率曲线呈阶梯而非平滑。

解决:把年龄/体重当区间变量而非点值(可取区间中点并声明);剂量分析优先用 medication 表的 AmountPerMinute 原始速率;需要精确年龄的研究改用 MIMIC-IV(anchor_age)。

参考:PhysioNet SICdb Data Description(分箱规则)。

⚠️ 坑点 6:围手术期偏倚与低死亡率——41/58 张床位的覆盖边界(分类:偏倚陷阱)

问题:技术原因仅纳入 58 张床位中的 41 张,大部分内科监护床位被排除,围手术期病例相对过多,全库 ICU 出院存活率高达 96.55%。这不是数据错误,而是覆盖边界。

症状:死亡预测模型阳性率仅 3-8%,AUPRC 极低;与 MIMIC(院内死亡 11.5%)直接比较指标时"SICdb 模型看起来更好";内科 ICU 表型(如 COPD 急性加重)样本稀少。

解决:论文中必须声明队列构成;按 AdmissionUrgency / SurgicalSite 分层报告;与 MIMIC 比较时用重加权或限定手术亚队列;阳性率过低任务改用 AUPRC 与校准曲线评估。

参考:PhysioNet SICdb “Additional Notes”(官方明确归因);Sci Data 2024 Limitations。

⚠️ 坑点 7:REFERENCE 列不 join d_references 就是无意义整数(分类:工程陷阱)

问题:Sex、DischargeState、DrugID、DataID、LaboratoryID 等全部是字典编码,语义在 d_references(ReferenceGlobalID → ReferenceValue + ReferenceUnit)里。不连接字典直接分析,得到的只是整数 ID;漏看 ReferenceUnit 还会混淆单位(如血压 mmHg vs cmH₂O)。

症状:“性别全是 2001/2002 这种整数”;检验值量级混乱;按名称模糊匹配 DataID 时匹配到德语同义项。

解决:第一步就构建 id2name 映射(§6.1 步骤 2);v1.0.8 起检验项可直接用 LOINC_code 标准化;注意官方文档 laboratory 字段表中 DrugID 为笔误,实际列名是 LaboratoryID(SQL 示例可证)。

参考sicdb.com 官方文档 Reference Table 一节与 SQL 示例。

⚠️ 坑点 8:OffsetOfDeath 的 NULL 是右删失,且部分患者观测期仅 6 个月(分类:标签理解)

问题OffsetOfDeath 以 1 年封顶——NULL 同时表示"1 年内未死亡"与"1 年后才死亡";更隐蔽的是部分患者因技术原因观测期只有 6 个月(EstimatedSurvivalObservationTime 标识),他们的"6 个月-1 年"区间实际无观测。

症状:1 年死亡率被低估;把 NULL 当"存活"做二分类,相当于把删失当阴性,生存分析偏倚;外籍患者院外死亡信息稀缺(官方已声明)。

解决:二分类任务限定"观测期满 1 年"的病例(EstimatedSurvivalObservationTime 过滤);生存分析用 Kaplan-Meier/Cox 并按观测期设置删失时点;报告结局时声明院外死亡依赖政府登记的覆盖局限。

参考:官方文档 cases 表 OffsetOfDeath 字段说明;PhysioNet Data Description。

版本提示treatment.csv.gz 为早期版本表名,现由 data_range.csv.gz(起止事件)与 unitlog.csv.gz(转运日志)替代;复现 2023 年早期教程时注意表名差异。另有少量 cases 字段(HoursOfCRRT、AdmissionFormHasSepsis、HeartSurgeryCPBTime 等)官方规划在 v1.1.0 迁移至数据表,引用字段前请核对所下载版本的 Documentation.pdf。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
对小时级聚合值加生理范围内小幅噪声(心率 ±1 bpm) 对 rawdata 字节流直接加噪(破坏 float32 位模式与 NULL 语义)
随机掩蔽 10-20% 小时级记录模拟未测量 对 Offset 时间戳随机抖动(破坏分钟对齐与 ICUOffset 锚定)
特征空间 Mixup(同队列内) 对 ICD-10 编码做"同义替换"式增强
掩蔽时序自监督预训练(分钟级) 合并多个 CaseID 的信号后打乱 PatientID 归属

§6.7 模型推荐

任务 推荐方案 特征方案 依据
快速基线(CPU) LightGBM / 逻辑回归 24h 小时级聚合统计(§6.3) YAIB:表格式特征上 LightGBM 常与深度学习打平
标准时序 GRU / LSTM ricu 64 概念逐小时序列 YAIB 默认配置,跨库可比
分钟级优势场景 Transformer / TCN rawdata 全解压分钟流 YAIB:Transformer 在 LOS 任务有稳定优势(长程依赖)
心外科风险 梯度提升 + EuroSCORE II 对照 cases 心外科字段 + 围手术期信号 EuroSCORE II 为现成强基线
生存分析 Cox PH / DeepSurv OffsetOfDeath 终点 + 静态特征 1 年含院外终点是 SICdb 特色

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 30 GB(压缩包 + 小时级工作区) 300 GB(分钟级全解压 + 关系库 + 索引)
内存 16 GB(分块读 data_float_h) 64 GB(全量聚合)
GPU CPU 足够(LightGBM/LR 基线) 1 × 16 GB 显存(分钟级 Transformer)
训练时间 LightGBM 基线约 10-30 分钟(CPU) 分钟级深度模型约数小时-1 天
云端替代 YAIB 本地 demo 先行 无官方托管;自建 PostgreSQL + ricu

§6.9 评估指标

from sklearn.metrics import (roc_auc_score, average_precision_score,
                             brier_score_loss, confusion_matrix)

def evaluate_binary(y_true, y_prob, threshold=0.5):
    print(f"AUROC: {roc_auc_score(y_true, y_prob):.4f}")
    print(f"AUPRC: {average_precision_score(y_true, y_prob):.4f}")  # 低阳性率必报
    print(f"Brier: {brier_score_loss(y_true, y_prob):.4f}")
    tn, fp, fn, tp = confusion_matrix(y_true, y_prob > threshold).ravel()
    print(f"Sensitivity: {tp/(tp+fn):.3f}  Specificity: {tn/(tn+fp):.3f}")

社区共识(YAIB 口径):死亡/AKI/脓毒症报 AUROC + AUPRC;LOS 回归报 MAE/MAD;肾功能回归报 MAE;SICdb 阳性率普遍偏低,AUPRC 与校准曲线不可省略;跨库比较必须同队列定义(ricu/YAIB 概念)。

§6.10 MLOps 笔记

  • 版本锁定:论文方法部分必须注明 “SICdb v1.0.8”(DOI: 10.13026/8m72-6j83)与访问日期;v1.0.6 与 v1.0.7+ 病例数不同(36 个无效病例被移除),复现 Sci Data 2024 请用 v1.0.6(DOI: 10.13026/dm9f-dm56)。
  • 引用四件套:PhysioNet 数据集本体 + Scientific Data 2024 论文 + ICM 2023 发布信(官方页面注明强制)+ PhysioNet 平台——缺一可能被审稿人质疑(见 §9)。
  • 逐案审批留痕:Contributor Review 要求每个项目单独获批,论文方法部分建议注明获批日期与研究问题编号。
  • rawdata 解析留档:解包代码版本(官方脚本 commit hash)应入方法学附录;全零=NULL 的约定不可被下游管道覆盖。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 SALK 单中心,奥地利三级转诊中心,不代表社区医院与其他国家 ICU 用 YAIB 跨库框架在 MIMIC-IV/eICU/HiRID/AUMCdb 外部验证
围手术期偏倚(覆盖边界) 仅 41/58 张床位,大部分内科监护床位未纳入;围手术期病例相对过多 高(官方明示) 分层报告;声明队列构成;内科表型研究慎用
低死亡率/病例组合偏倚 ICU 出院存活 96.55%,死亡任务阳性率极低 AUPRC + 校准评估;与 MIMIC 比较时重加权或限亚队列
性别构成偏倚 男性 62.0%(高于 MIMIC-IV 的约 56%) 性别分层评估(§7.5)
时代偏倚 2013-2021 年数据;2020-2021 受 COVID-19 影响(未单独标注) AdmissionYear 分层;疫情年敏感性分析
分箱粒度偏倚 年龄/体重/身高 5 单位分箱,>90 封顶 区间化处理;精确人口学研究改用他库
院外死亡覆盖偏倚 依赖奥地利政府死亡登记;外籍患者死亡信息可能稀缺;部分患者观测期仅 6 个月 EstimatedSurvivalObservationTime 过滤 + 声明局限
真实世界噪声(刻意保留) 官方不做大部分清洗,含 implausible values 生理范围过滤自行实现;利用保留的修正前原始值做对照
测量频率信息性 病重测得勤(cnt 列可见) 保留采样密度特征

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
院内死亡(DischargeState/HospitalDischargeType) 双系统交叉验证(MetaVision × ORBIS) 口径在两个字段间略有差异,须先定义
院外死亡(OffsetOfDeath) 高(多源匹配) 政府登记 外籍患者稀缺;1 年封顶;部分仅 6 个月观测
实验室检查值 CLIA 体系定量 批间质控 单位依赖 d_references;v1.0.8 才有 LOINC
ICD-10 主诊断 编码员分配 行政编码一致性 单主诊断,共病需从 data_ref 既往症补充
床旁信号 设备自动采集 分钟级连续 真实世界噪声未清洗(官方刻意保留)
SAPS III / EuroSCORE II 医师常规评估 临床常规 评分缺失机制未文档化
KDIGO AKI 分期 官方算法 算法化、版本化 依赖肌酐/尿量数据完整度

§7.3 泛化性讨论

场景 失效风险 证据
跨洲(欧洲 → 美国 ICU) YAIB(ICLR 2024):美国数据训练的模型在欧洲数据集上显著掉点,反向同样成立——临床实践与人群差异是主因
跨机构(SALK → 其他欧洲 ICU) 中高 SICdb 为麻醉学部主导的围手术期队列,与 HiRID(伯尔尼综合 ICU)、AUMCdb(阿姆斯特丹)病例组合差异大
跨时间(2013-2021 → 当代) 数据止于 2021;AdmissionYear 可做时序外验证(相对 MIMIC-III 的独特优势)
跨亚群体(内科 ICU 患者) 内科监护床位大部分未纳入,内科主导表型上模型可靠性低
跨任务(围手术期 → 脓毒症等内科任务) 中高 脓毒症等内科表型样本占比低于综合 ICU 数据集

§7.4 伦理考量

  1. 数据来自真实 ICU 患者(相当部分已去世),研究者应保持对患者与家属的尊重。
  2. Land Salzburg 伦理委员会批准(EK Nr: 1115/2021),因项目不影响临床照护且 PHI 已充分脱敏,豁免个体知情同意。
  3. GDPR 第 4(5) 条假名化 + HIPAA 合规双重声明;重识别尝试在欧洲法律下属违法(官方明示 “illegal by European law”)。
  4. 地理信息已删除、人口学分箱——这些限制本身就是隐私保护设计,绕过或反推分箱属于违背脱敏意图。
  5. 院外死亡数据来自政府登记,使用时需注意其行政数据来源属性。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=test_df["Sex"]  # d_references 解码后使用;亦可按 AgeOnAdmission 分箱
)
print(frame.by_group)

已知公平性考量:男性占 62%,女性亚群置信区间相对较宽;年龄分箱使"90+"人群无法单独分析;奥地利人群种族同质性高且数据集不发布种族字段——种族公平性分析在 SICdb 上原理上不可行,这是与 MIMIC(含 ETHNICITY)的重要差异。

§7.6 数据漂移提示

  • 训练分布停留在 2013-2021 年:脓毒症管理、通气策略与术后路径在此期间持续演变;2020-2021 年含 COVID-19 扰动(无单独队列标注,建议 AdmissionYear ≥ 2020 做敏感性分析)。
  • 监控信号:生命体征分布 PSI > 0.1、ICD-10 主诊断流行率漂移、围手术期占比变化。
  • SICdb 保留真实入院年份,做年份切片的漂移分析是可行的(相对 MIMIC-III 的优势)。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 8 张表均以唯一事件 ID/CaseID+Offset 为行
2 有唯一标识符列 CaseID / PatientID 两级主键
3 无 Unicode 或特殊字符 ⚠️ 结构化字段基本 ASCII;药品名等含德语特殊字符,需编码检查
4 无重复行 导出管道含行级版本控制与单元测试;无效/重复条目已在构建期剔除
5 缺失值已识别并编码 rawdata 全零=NULL 明确定义;§4.5 信息性缺失表
6 标签列被明确标识 DischargeState / HospitalDischargeType / OffsetOfDeath / KDIGO_AKI_*
7 已对罕见类别(<3%)进行分组 ⚠️ ICD-10 主诊断长尾未分组,需自行归类
8 偏倚评估已完成 §7.1 九类偏倚;官方 Additional Notes 明示围手术期偏倚
9 有完整的数据字典 d_references + 在线文档 + Documentation.pdf;v1.0.8 检验项映射 LOINC
10 对"信息性缺失"有明确编码解释 ⚠️ 官方未系统文档化缺失机制,本 Wiki §4.5 补充
11 数据采集设备和设置已记录 §3.9 MetaVision + ORBIS 完整记录
12 已移除完全共线性变量 ⚠️ 未执行,保留全部原始列(含修正前后身高体重双份)
13 对编码的映射标准已说明 ICD-10(注意 GM 变体)+ v1.0.8 LOINC
14 对时间戳的处理已明确说明 ⚠️ 秒级 offset 策略已记录,但日历维度(季节/星期)永久丢失
15 训练/验证/测试划分建议已给出 官方无划分;YAIB/ricu 社区管道补位
16 数据泄漏风险已被讨论 §5.3 五种 SICdb 特有泄漏模式
17 标签分布已被分析 §4.2 多口径死亡率分布
18 选择性测量偏倚已被讨论 ⚠️ cnt 采样密度列可用,但官方未正式讨论
19 外部验证建议已给出 §5.5 四库路径;YAIB 跨库矩阵
20 数据更新和版本信息已记录 v1.0.4-v1.0.8 release notes 完整
21 最小必要预处理脚本已提供 官方 GitHub:导入脚本 + rawdata 解包 + KDIGO 算法 + SQL 示例
22 合规使用要求已明确 CITI 培训 + 凭证化 + 逐案审批 + DUA
23 多模态对齐方法已说明 ⚠️ 单模态数据集;分钟流与小时聚合的对齐需自行处理
24 去标识化方法已被记录 GDPR Art. 4(5) + HIPAA + EK 1115/2021 完整记录

DAIMS 评分:19.5 / 24

评分解读良好偏优——文档、合规与派生标签质量接近顶尖;扣分集中在结构妥协(无官方划分、日历维度丢失、分箱人口学)与年轻化生态。

对你意味着什么:SICdb 的 16 个 ✅ 项中,合规文档(GDPR+HIPAA+伦理批件齐备)、派生标签(KDIGO 算法开源)、预处理脚本(官方解包/导入/KDIGO 三件套)三项在同类数据集中属于第一梯队。扣分项全部有明确绕行方案:无官方划分 → 用 YAIB 管道;日历维度丢失 → 用 AdmissionYear 做时序外验证,日历研究换库;分箱人口学 → 区间化处理;分钟流对齐 → 复用官方解包脚本。建议训练前执行:(1) 用 ricu/YAIB 统一队列定义,不要自建划分;(2) 按 AdmissionUrgency 分层后再看死亡模型指标;(3) EstimatedSurvivalObservationTime 过滤后再做 1 年终点;(4) 检验项直接用 v1.0.8 的 LOINC 列对齐其他数据集。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
MIMIC-IV ↔ SICdb(数据集级对比) SALK vs BIDMC 队列特征与数据可用性对比 非模型指标 N/A Sadeghi 2024(同行评审):SICdb 信号分辨率与可用性显著优于 MIMIC-IV;LOS/年龄可比,男性 +6%
YAIB 五库互验(MIMIC-III/IV、eICU、HiRID、AUMCdb + SICdb) 美欧 5 国 死亡/AKI/脓毒症/肾功能/LOS AUROC/AUPRC 矩阵 跨库普遍显著下降 YAIB(ICLR 2024):美国 ↔ 欧洲迁移掉点最大;预处理与队列定义对性能的影响超过模型架构
eICU 预训练 → 小样本本地微调 美国多中心 → 欧洲单中心 死亡预测 AUROC 优于从头训练 YAIB:大库预训练 + 目标库小样本微调,优于在小库上从头训练——SICdb 类中等规模库的最佳利用范式
HiRID / AUMCdb(欧洲高分辨率对照) 瑞士/荷兰 跨库概念一致性 ricu 64 概念 N/A ricu 统一概念层使 SICdb 与两大欧洲库可直接互操作(同一概念定义)

SICdb 专属外部验证证据现状(截至 2026-09):作为一个 2023 年发布的数据集,以 SICdb 为训练集或验证集的同行评审模型级外部验证研究仍然有限,目前最强证据来自 YAIB 框架与 Sadeghi 数据集级对比。这既是局限也是机会——你的研究可能就是该数据集外部验证文献的早期贡献者。


§8 基准性能与生态

§8.1 排行榜(YAIB 框架基准)

SICdb 没有独立刷榜 leaderboard——它的基准语境是 YAIB 多中心框架(van de Water et al., ICLR 2024)。阅读本节数值前请注意:不同论文的队列定义、预测窗口与划分不同,绝对数值不可跨论文直接比较。

YAIB 五任务定义(对 SICdb 同样适用,经 ricu sic 数据源提取):

任务 定义 类型 主指标
ICU 死亡预测 入 ICU 24h 后,每次入院预测一次 二分类 AUROC / AUPRC
急性肾损伤(AKI) 每小时预测未来 6h 内 AKI 二分类 AUROC / AUPRC
脓毒症 每小时预测未来 6h 内 Sepsis-3 二分类 AUROC / AUPRC
肾功能 每次入院预测(回归) 回归 MAE
住院时长(LOS) 每小时预测剩余 LOS(7 天内) 回归 MAE

已发表的代表性结论(同一框架内可比):

排名 模型 结论 年份 关键技术 完整引用 代码
1 LightGBM 表格式特征上与深度模型基本持平(多任务) 2024 梯度提升 + 统一预处理 van de Water R, Schmidt H, Elbers PWG, Thoral P, Arnrich B, Rockenschaub P. “Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical ML.” ICLR 2024. arXiv:2306.05109 https://github.com/rvandewater/YAIB
2 Transformer LOS 任务稳定优势 2024 长程时序依赖建模 同上 同上
3 GRU / LSTM / TCN 与 LR/LightGBM 多数任务无显著差距 2024 逐小时序列 同上 同上
基线 SAPS III(分数本身) 死亡预测的临床参考线 2005 入院 24h 生理评分 Moreno RP et al. “SAPS 3—From evaluation of the patient to evaluation of the ICU.” Intensive Care Med 31:1345-1355

核心警示(YAIB 原话级结论):预处理选择与队列定义对最终 AUROC 的影响大于模型架构选择。在 SICdb 上"刷新 SOTA"之前,请先固定 YAIB 队列定义——否则你的提升可能只来自更宽松的队列。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
与文献可比地报告结果 YAIB 管道 + 其队列定义 + 报告 AUROC/AUPRC 五库统一,结果可直接进跨库矩阵
快速出基线(CPU) §6.3 小时级聚合 + LightGBM YAIB 验证过的性价比最优路径
验证分钟级新架构 rawdata 全解压 + Transformer/TCN SICdb 独有卖点;HiRID(2min)为最近对照
心外科专项 EuroSCORE II 为基线 + cases 心外科字段 现成的临床强基线与完整围手术期数据
教学演示 ricu + sic 数据源 + 64 概念 概念层屏蔽解包细节,课堂可完成

§8.3 官方评测协议

无官方协议。社区事实标准(YAIB 体系):PatientID 分组划分;五任务统一定义;死亡/AKI/脓毒症报 AUROC + AUPRC,回归任务报 MAE;跨库比较使用 ricu 概念层对齐变量定义。

数据集 关系 说明
MIMIC-IV 对照/验证集 Sadeghi 2024 官方级对比对象;美国单中心最大库
eICU-CRD 对照/验证集 美国多中心;YAIB 预训练-微调范式的源库
HiRID 同类最近邻 瑞士,2 分钟分辨率,欧洲高分辨率对照
AmsterdamUMCdb 同类 荷兰,欧洲首个 GDPR 合规 ICU 库
MIMIC-III 对照(历史) 经典基准库;注意其真实年份已抹除
PIC(中国儿童 ICU) 互补 儿童人群,SICdb 为成人主导
BlendedICU 派生管道 OMOP 标准化管道(含多库融合)

§8.5 关键论文 Top 10

  1. Rodemund N, Wernly B, Jung C, Cozowicz C, Koköfer A (2023), Intensive Care Medicine 49:700-702. “The Salzburg Intensive Care database (SICdb): an openly available critical care dataset.” — 数据集发布信,官方注明强制引用。DOI: 10.1007/s00134-023-07046-3
  2. Rodemund N et al. (2024), Scientific Data 11:320. “Harnessing Big Data in Critical Care: Exploring a new European Dataset.” — 权威数据论文(技术实现 + 验证)。DOI: 10.1038/s41597-024-03164-9
  3. Sadeghi S, Hempel L, Rodemund N, Kirsten T (2024), Scientific Reports 14:11438. “SICdb: a detailed exploration and comparative analysis with MIMIC-IV.” — 与 MIMIC-IV 的系统对比,引用人口学统计的标准来源。DOI: 10.1038/s41598-024-61380-0
  4. van de Water R et al. (2024), ICLR. “Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical ML.” — SICdb 的基准化入口;"数据重于模型"的标志性论文。arXiv:2306.05109
  5. Faltys M et al. (2021), PhysioNet / HiRID. “HiRID, a high time-resolution ICU dataset (version 1.1.1).” — 高分辨率 ICU 数据的先声,SICdb 的直接前身语境。DOI: 10.13026/nkwc-js72
  6. Thoral PJ et al. (2021), Critical Care Medicine 49(6):e563-77. AmsterdamUMCdb — 欧洲 GDPR 合规共享范式的奠基论文。
  7. Johnson AEW et al. (2023), Scientific Data 10:1. “MIMIC-IV, a freely accessible electronic health record dataset.” — 跨库研究的必备对照。DOI: 10.1038/s41597-022-01899-x
  8. Pollard TJ et al. (2018), Scientific Data 5:180178. eICU-CRD — 多中心对照。
  9. Sauer CM et al. (2022), Critical Care Medicine 50. “Systematic Review and Comparison of Publicly Available ICU Data Sets—A Decision Guide.” — ICU 公开数据集选型框架。
  10. Khwaja A (2012), Nephron Clin Pract 120(4):c179-84. KDIGO AKI 指南——SICdb 内置 AKI 标签的临床定义来源。

§8.6 社区活跃度

维度 数据
Google Scholar 引用(三篇核心文献合计) 60+(截至 2026-09,保守口径;其中 Sci Data 2024 约 19 次、Sadeghi 2024 约 8 次有据可查)
ricu 集成 数据源 sic,64 个临床概念(2023-12 起,v0.6.0+)
YAIB 集成 五大支持库之外的第六个示范库(框架灵活性案例)
官方 GitHub nrodemund/sicdb:19 stars / 4 forks(截至 2026-09),2026 年仍在更新
资金保障 PMU 麻醉学部全额资助,官方承诺至 2028 年
数据更新 2023-2024 年发布 4 个版本(1.0.5→1.0.8),官方明示持续扩充计划

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09) 为什么值得关注
nrodemund/sicdb 官方代码 https://github.com/nrodemund/sicdb 19 / 4 官方唯一仓库:导入脚本(PostgreSQL/MySQL/SQLite)+ rawdata 解包 + KDIGO 算法 + SQL 示例
eth-mds/ricu 工具库(R) https://github.com/eth-mds/ricu 60+ / 18+ 一套代码查询 SICdb/MIMIC/eICU/HiRID/AUMCdb;sic 数据源 64 概念
rvandewater/YAIB 基准框架 https://github.com/rvandewater/YAIB 约 100 / 24 ICLR 2024 多中心基准;五任务端到端;SICdb 队列生成内置
sicdb.com 官方文档 官方文档 https://www.sicdb.com/Documentation/ 表结构、SQL 示例、rawdata 编码规格的权威来源(比 PhysioNet 页更新快)
PhysioNet 项目页 数据托管 https://physionet.org/content/sicdb/ 版本归档、DOI、release notes、访问申请入口

§9 相关资源与引用

官方资源

BibTeX 引用(四件套,发表前逐项核对)

% 1) 数据集本体(PhysioNet 版本引用,按所用版本替换)
@misc{rodemund2024sicdb108,
  author = {Rodemund, Niklas and Kokoefer, Andreas and Wernly, Bernhard and Cozowicz, Crispiana},
  title  = {{Salzburg Intensive Care database (SICdb), a freely accessible intensive care database}},
  year   = {2024},
  note   = {Version 1.0.8, PhysioNet},
  doi    = {10.13026/8m72-6j83}
}

% 2) 数据论文(Scientific Data 2024)
@article{rodemund2024sicdb,
  author  = {Rodemund, Niklas and Wernly, Bernhard and Jung, Christian and Cozowicz, Crispiana and Kok{\"o}fer, Andreas},
  title   = {Harnessing Big Data in Critical Care: Exploring a new European Dataset},
  journal = {Scientific Data},
  volume  = {11},
  pages   = {320},
  year    = {2024},
  doi     = {10.1038/s41597-024-03164-9}
}

% 3) 发布信(Intensive Care Medicine 2023,官方页面注明强制引用)
@article{rodemund2023sicdb,
  author  = {Rodemund, Niklas and Wernly, Bernhard and Jung, Christian and Cozowicz, Crispiana and Kok{\"o}fer, Andreas},
  title   = {The Salzburg Intensive Care database (SICdb): an openly available critical care dataset},
  journal = {Intensive Care Medicine},
  volume  = {49},
  pages   = {700--702},
  year    = {2023},
  doi     = {10.1007/s00134-023-07046-3}
}

% 4) PhysioNet 平台(官方要求同时引用)
@article{goldberger2000physionet,
  author  = {Goldberger, Ary L and Amaral, Luis AN and Glass, Leon and Hausdorff, Jeffrey M and Ivanov, Plamen Ch and Mark, Roger G and Mietus, Joseph E and Moody, George B and Peng, Chung-Kang and Stanley, H Eugene},
  title   = {PhysioBank, PhysioToolkit, and PhysioNet: Components of a new research resource for complex physiologic signals},
  journal = {Circulation},
  volume  = {101},
  number  = {23},
  pages   = {e215--e220},
  year    = {2000}
}

% 5) 如使用 YAIB 管道
@inproceedings{vandewater2024yaib,
  author    = {van de Water, Robin and Schmidt, Hendrik Nils Aurel and Elbers, Paul and Thoral, Patrick and Arnrich, Bert and Rockenschaub, Patrick},
  title     = {Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical ML},
  booktitle = {The Twelfth International Conference on Learning Representations},
  year      = {2024}
}

注意:ICM 发布信页面明确写着 “It is mandatory to cite this paper in subsequent analyses of the database”——许多论文漏引第 3 条,投稿前请核对。

教程与学习资源

原始论文

  1. Rodemund N, Wernly B, Jung C, Cozowicz C, Koköfer A (2023). “The Salzburg Intensive Care database (SICdb): an openly available critical care dataset.” Intensive Care Medicine 49:700-702. DOI: 10.1007/s00134-023-07046-3.
  2. Rodemund N, Wernly B, Jung C, Cozowicz C, Koköfer A (2024). “Harnessing Big Data in Critical Care: Exploring a new European Dataset.” Scientific Data 11:320. DOI: 10.1038/s41597-024-03164-9. PMID: 38548745. PMCID: PMC10978926.
  3. Sadeghi S, Hempel L, Rodemund N, Kirsten T (2024). “Salzburg Intensive Care database (SICdb): a detailed exploration and comparative analysis with MIMIC-IV.” Scientific Reports 14:11438. DOI: 10.1038/s41598-024-61380-0.
  4. van de Water R, Schmidt H, Elbers PWG, Thoral P, Arnrich B, Rockenschaub P (2024). “Yet Another ICU Benchmark: A Flexible Multi-Center Framework for Clinical ML.” ICLR 2024. arXiv:2306.05109.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch / WebFetch(多源检索) 2026-09-05 6 组检索 + 2 次页面抓取:官方主页、PhysioNet 页、官方文档(rawdata 编码)、论文与引用快照、社区生态交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 PhysioNet 官方页面、sicdb.com 官方文档、Rodemund 2023/2024 原始论文、Sadeghi 2024 对比论文与 YAIB/ricu 社区资源中整理结构化信息;(2) 生成 §6 的 Python 代码示例(含官方解包函数的文档忠实复现);(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Rodemund et al. (2023), Intensive Care Medicine 49:700-702 — 发布信(DOI: 10.1007/s00134-023-07046-3)
  2. Rodemund et al. (2024), Scientific Data 11:320 — 数据论文(DOI: 10.1038/s41597-024-03164-9)
  3. PhysioNet SICdb v1.0.8 页面(release notes / Methods / Additional Notes / Access Policy)
  4. PhysioNet SICdb v1.0.6 页面(v1.0.6 release notes、DOI、版本列表)
  5. sicdb.com 项目主页(26 亿条目口径)
  6. sicdb.com 官方文档(cases/laboratory/medication/data_float_h 字段表、rawdata 编码规格、SQL 示例、版本信息)
  7. Sadeghi et al. (2024), Scientific Reports 14:11438 — 人口学统计与 MIMIC-IV 对比(DOI: 10.1038/s41598-024-61380-0)
  8. van de Water et al. (2024), YAIB, ICLR — arXiv:2306.05109 与 rvandewater/YAIB 仓库
  9. eth-mds/ricu GitHub issue #31/#32(SICdb 集成、64 概念、IEEE float 预处理讨论)
  10. nrodemund/sicdb GitHub 仓库(导入脚本、解包脚本、star/fork 快照)
  11. PubMed PMID 38548745 / PMC10978926(Sci Data 2024 全文与数据可用性声明)
  12. Google Scholar / CoLab 引用快照(Sci Data 2024 约 19 次、Sadeghi 2024 约 8 次,截至 2026-09)
  13. Khwaja (2012) KDIGO 指南(AKI 分期定义来源)
  14. Moreno et al. (2005) SAPS III 原始论文(评分基线)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-10/ICD-11 映射、评分体系、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(8 表结构、版本矩阵、存储大小) 千方病案医学编辑部 与 PhysioNet 官方页面及 sicdb.com 文档交叉比对 ✅ 已验证
§4 数据结构(主键体系、DAIMS 字段字典、rawdata 结构) 千方病案医学编辑部 sicdb.com 官方文档字段表交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与官方解包示例及 GitHub 脚本比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及 Scholar/CoLab 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集