OUTCOMEREA — 法国多中心 ICU 队列 AI-Ready Wikipedia | 千方病案医数集

24,298 次 ICU 住院的法国多中心前瞻研究队列

来源 OUTCOMEREA Study Group(Inserm UMR 1137 IAME / Université Paris Cité) url: https://www.outcomerea.org/发布时间: 2026-09-08最后更新: 2026-09-08 阅读 5

信息速览

数据集名称OUTCOMEREA — 法国多中心 ICU 队列 AI-Ready Wikipedia | 千方病案医数集
数据类型24,298 次 ICU 住院,12-23 家法国 ICU,1997-2020 持续采集,每日 SOFA 严重度,ICD-10/CCAM 编码,合作申请获取
规模约 2.4 万名患者(24,298 次 ICU 住院,1997-2020)
接入方式OUTCOMEREA Study Group(Inserm UMR 1137 IAME / Université Paris Cité) url: https://www.outcomerea.org/
AI 就绪度

数据集封面

OUTCOMEREA — 法国多中心 ICU 前瞻队列 AI-Ready Wikipedia

INFOBOX

数据集名称 OUTCOMEREA™ Database(法国多中心 ICU 研究数据库)
英文全称 OUTCOMEREA™ multicentre ICU research database(OUTCOMEREA Study Group cohort database)
别名/简称 OutcomeRea™、OUTCOMEREA network、OUTCOMEREA Study Group
疾病分类 重症监护全疾病谱(ICD-11:1G40 脓毒症 / NB62 急性呼吸窘迫综合征 / CA4Z 肺炎(含呼吸机相关性肺炎)/ CB4Z 心力衰竭等多系统危重症)
SNOMED CT 133834002 Critical care medicine (procedure) / 91302008 Sepsis / 312012004 Acute respiratory distress syndrome / 233604007 Pneumonia(详见 §2.1b)
数据模态 前瞻性 ICU 登记结构化数据(每日床旁采集)、ICD-10 诊断与 CCAM 操作编码、定量微生物学感染确认结果
AI 任务类型 死亡风险预测、器官衰竭动态建模、VAP/血流感染风险建模、竞争风险与多状态建模、严重度规则外部验证、医疗质量与 DFLST 研究
样本总数 24,298 次 ICU 住院(1997-2020,核心 12 家 ICU;全网络累计 23 家中心)
数据大小 按研究方案定制提取,无固定公开数据包
数据格式 SAS 数据集 / CSV(协作定制提取)
许可证 协作研究协议(无公开下载许可,受法国 CNIL 备案与 CCTIRS 合规框架约束)
访问级别 申请审核(研究者向 OUTCOMEREA 科学委员会提交方案,审批后协作使用)
语言 数据字段编码与文档为法语/英语双语,发表文献为英语
首发日期 1997 年(数据采集启动,数据库 1998 年正式建制)
最后更新 持续运行中(已发表研究数据覆盖至 2020 年住院,截至 2026-09 仍持续产出论文)
发布机构 OUTCOMEREA 协作组(科学委员会与统计中心依托 Inserm UMR 1137 IAME / Université Paris Cité)
官方主页 https://www.outcomerea.org/
下载地址 无公开下载(经科学委员会方案审批后定制提取)
DOI 数据库无独立 DOI;推荐引用描述文献 doi:10.1186/s13054-023-04325-9
AI 就绪度评分 ⭐⭐(2/5)— 每日采集协议与数据质量优异(2% 交叉审计、自动一致性校验),但无公开下载、无标准格式包、无公开预处理脚本,提取与清洗全定制
页面状态 published

§0 E-E-A-T 审核声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、ICU 临床任务与金标准定义)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 OUTCOMEREA 协作组、Inserm、Université Paris Cité 无任何商业利益关联。本页面不销售 OUTCOMEREA 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 OUTCOMEREA 协作组的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。OUTCOMEREA 数据不公开分发,使用者须向 OUTCOMEREA 科学委员会提交研究方案并通过审批,且遵守法国 CNIL(备案号 8,999,262)与 CCTIRS 合规框架。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

§1 数据集概览

§1.0 📌 30 秒速览

这是什么? OUTCOMEREA(OutcomeRea™)是法国一个自 1997 年运行至今的多中心前瞻性 ICU 登记研究数据库。由分布在法国的大学医院与非大学医院 ICU 组成的协作网络(核心 12 家,全网络累计 23 家)按统一协议,每年至少前瞻采集 50 例连续住院超过 2 天患者的完整 ICU 住院数据:从入院诊断、慢性基础病,到每天的器官功能评分、呼吸机与透析等器官支持,再到院内感染、医疗差错事件,直至出院与死亡结局。截至 2020 年,数据库累计收录 24,298 次 ICU 住院。

为什么重要? ICU 是医院里数据密度最高、干预最密集的场所,但绝大多数 ICU 数据库要么只有单中心(如 MIMIC-III),要么缺少每日床旁随访与感染事件细节。OUTCOMEREA 的独特价值在于:多中心设计支撑中心效应分析;每日前瞻采集的 SOFA 评分与器官支持记录支撑动态病程建模;院内感染与医源性事件由 1997 年起预定义的协议口径记录,是呼吸机相关性肺炎(VAP)、导管相关血流感染等"患者安全"研究的金矿;生命支持限制决策(DFLST)的系统记录则让"放弃治疗导致的死亡"这一竞争风险可以被显式建模。

我能用它做什么? 如果你所在团队获得了 OUTCOMEREA 科学委员会的方案审批,你可以构建死亡风险预测与器官衰竭动态模型、复现或挑战 VAP 与血流感染的危险因素结论、对通用人群的 COVID-19 预测规则做 ICU 特异的外部验证(一个著名的失败案例见 §8.1)、开展因果推断与多状态建模研究。注意:该数据库不提供公开下载,所有使用都以协作申请为前提——本页面的预处理与建模范式按"协作提取的 CSV/SAS 文件"组织,可直接迁移到你的提取件上。

§1.1 摘要

OUTCOMEREA 由法国重症医学研究者于 1997 年发起(数据库 1998 年正式建制),隶属 OUTCOMEREA 协作组,科学委员会由 Jean-François Timsit、Elie Azoulay、Maïté Garrouste-Orgeas、Michael Darmon 等重症医学与流行病学专家组成,统计与数据管理长期依托 Inserm UMR 1137 IAME(Inserm / Université Paris Cité)团队,网络协调中心位于法国 Drancy。参与 ICU 按统一协议执行两种抽样之一:全年在预定数量床位上的连续入组,或某一个月内的全部连续入组,每年至少覆盖 50 例住院超过 2 天的患者。数据由各 ICU 资深医师与研究监测员经 VIGIREA® 与 RHEA® 电子病例报告表录入,软件在录入时自动做多变量内部一致性检查,产生的疑问回溯源 ICU 解决后入库;另由其他参与 ICU 的资深医师审计 2% 随机样本,并每年举办编码培训课程。诊断按法国重症医学会(SRLF)与麻醉重症医学会(SFAR)1999 年指南以 ICD-10 编码,操作以 CCAM 编码;院内感染(如 VAP)须定量微生物学确认。1997-2020 研究期累计 24,298 次 ICU 住院(其中 1998-2004 年即达 29,393 例入组),产出了 VAP 归因死亡、医源性事件干预(IATROREF)、COVID-19 多状态建模等数百项同行评审研究。

§1.2 战略价值

维度一:患者安全与感染事件研究的事实标准。 OUTCOMEREA 自 1997 年建库起就由指导委员会预定义院内感染与医源性不良事件的采集口径,VAP 定义要求持续性肺浸润影加脓性气道分泌物或体温/白细胞异常,且必须经保护性毛刷(>10³ CFU/mL)、支气管肺泡灌洗(>10⁴ CFU/mL)或气管吸引(>10⁵ CFU/mL)等定量培养确认。这使得基于该库的 VAP 归因死亡(Bekaert 等 2011 因果分析)、铜绿假单胞菌 VAP 治疗失败(Planquette 等 2013)与 COVID-19 时代血流感染风险(Buetti 等 2021)研究能够在统一事件定义上跨 20 余年比较——这是行政数据或只含生命体征的 ICU 库无法提供的。

维度二:欧洲多中心 ICU 对照与外部验证的战略支点。 主流开放 ICU 数据库(MIMIC-III/IV、eICU-CRD)全部来自美国,诊断编码为 ICD-9-CM/ICD-10-CM,医疗实践与临终决策文化与美国高度绑定。OUTCOMEREA 提供了法语区欧洲重症医疗体系下的前瞻队列:每日 SOFA 采集、CCAM 操作编码、法国式 DFLST 决策记录。它已成为检验"通用预测规则能否迁移到 ICU 场景"的经典试验场——Yan 等提出的三变量 COVID-19 死亡规则在此 178 例 ICU 队列上精确度骤降至 37%(Nature Machine Intelligence, 2020),这一案例已被广泛引用于论证队列谱系对模型外部效度的影响。

维度三:长时程 secular trends 与政策评估平台。 数据库连续运行近 30 年(1997 年至今),横跨整合酶抑制剂进入 HIV 治疗(2007)、Sepsis-2 到 Sepsis-3 的定义演变、法国医疗质量改进政策(IATROREF 交叉对照试验)与 COVID-19 大流行。对研究"医疗实践如何随时间与政策变化"的学者,这种长时程、协议不变式的前瞻采集比任何回顾性行政数据都更具因果可解释性。

§1.3 同类数据集横向对比

数据集 规模 模态与粒度 标注/事件 获取方式 与 OUTCOMEREA 的差异化
OUTCOMEREA 24,298 次 ICU 住院(1997-2020,12-23 家法国 ICU) 每日床旁结构化采集;日粒度时序 协议预定义院内感染/医源性事件、定量微生物确认、DFLST 科学委员会方案审批,定制提取 多中心前瞻 + 每日随访 + 感染事件专长;欧洲谱系
MIMIC-III/IV 约 4-5 万次住院(美国 BIDMC 单中心) 高频监护波形 + 实验室 + 自由文本 ICD-9-CM/ICD-10-CM 编码;无前瞻感染协议 PhysioNet 凭证化培训后开放 秒级粒度远胜,但单中心且无前瞻事件采集
eICU-CRD 约 20 万次住院(美国 200+ ICU) 远程监护结构化数据 行政编码为主 PhysioNet 开放申请 多中心但回溯汇聚,无每日前瞻严重度协议
SIC / HiRID 等 千至万级(欧洲单/少中心) 高频时序 + 参数化 部分含丰富参数映射 开放或注册 粒度近 MIMIC,但中心数与事件协议不及 OUTCOMEREA

§1.4 版本时间轴

时间 版本/里程碑 关键内容
1997 网络启动 指导委员会成立,院内感染与医源性事件采集口径预定义;9 月起入组
1998 数据库建制 12 家法国 ICU 接入,VIGIREA/RHEA 采集软件上线
2004 规模累积 1998-2004 年累计 29,393 例入组;编码可靠性专项研究启动
2013 队列扩展 80 岁以上高龄亚队列达 2,419 例(1997-09 至 2013-09)
2016 VAP 专题 MV≥48 小时患者累计 7,784 例(1997-2016),支撑早发/晚发 VAP 研究
2020 COVID 前瞻模块 新增新冠特异临床与生物学变量;研究期累计 24,298 次 ICU 住院(23 家中心)
2023 全谱分析 HIV 危重患者 1997-2020 全期分析发表(Crit Care
2026 持续产出 延迟插管模拟靶标试验(Sci Rep)发表,数据库仍在运行

§1.5 典型应用场景

场景 关键输入 标签/终点 库内支撑
1. VAP 与院内感染风险建模 每日通气参数、抗生素变更、MDRPA/MRSA 定植 协议定义 VAP/BSI 事件(定量微生物确认) 7,784 例 MV≥48h 队列(1997-2016)
2. 死亡风险预测与外部验证 SAPS II、每日 SOFA、器官支持序列 ICU/院内/60 天死亡 24,298 次住院全谱 + Yan 规则失效案例
3. 竞争风险与多状态建模 DFLST 决策与时间、通气/透析路径 状态转移概率、原因别死亡 DFLST 系统记录(法国法律环境)
4. 医疗质量与患者安全研究 医源性事件、预防策略实施状态 事件发生率、可预防比例 1997 年预定义事件口径 + IATROREF 干预试验
5. 比较效果研究与模拟靶标试验 治疗时序(插管、皮质类固醇等) 60 天死亡等 2026 年延迟插管 emulated target trial
6. 长时程 secular trends 分析 admission_year、定义版本 发生率/结局趋势 1997-2020 连续采集、三段年代划分惯例

场景 1 的典型做法:以 MV≥48 小时为进入条件,把 VAP 首发事件作为生存分析终点,用 Fine-Gray 模型处理"拔管存活 >48 小时"与"事件前死亡"两个竞争事件(Ibn Saied 2017 的做法)。场景 2 的关键不是刷高 AUROC,而是像 Nat Mach Intell 2020 那样给出"规则在哪个谱系失效"的可迁移结论。场景 3 是本库区别于所有美国开放库的独有赛道:DFLST 的日期与类型(放弃/撤除)被系统记录,使"临终决策→死亡"路径首次可以被显式估计。场景 4-5 要求与协作组深度合作以获取策略实施变量,适合已入网络的研究者。

§2 医学背景

§2.1 ICD-11 编码映射表

OUTCOMEREA 原始诊断采用 ICD-10(法国 SRLF/SFAR 1999 年编码指南,662 个推荐编码)采集。下表给出其核心疾病谱到 ICD-11 的对照,供跨库映射使用。

核心疾病/场景 ICD-11 编码 ICD-11 中文名 说明
脓毒症/感染性休克 1G40 脓毒症 库内按 Sepsis-2 标准入组(SIRS+感染+器官衰竭),跨期分析多沿用旧定义
急性呼吸窘迫综合征 NB62 急性呼吸窘迫综合征 以 PaO2/FiO2 与 PEEP 每日记录支撑 Berlin 标准重分级
呼吸机相关性肺炎(VAP) CA4Z 肺炎(其他特指的细菌性肺炎归入 CA40-CA4Z 谱系) 协议定义要求定量微生物学确认
心源性休克/心力衰竭 CB4Z 心力衰竭 Knaus 心血管慢性衰竭分层 + 每日血管活性药记录
急性肾损伤 5C81 急性肾损伤(急性肾衰竭) 每日 RRT 记录;Knaus 慢性肾衰竭为既往状态
谵妄/脓毒症相关脑病 6D73 谵妄 GCS 每日最差值采集,SAE 研究以 GCS≤13 定义重度脑病

§2.1b SNOMED CT 映射表

标签/概念 ICD-11 SNOMED CT 术语
ICU 住院 133834002 Critical care medicine (procedure)
脓毒症 1G40 91302008 Sepsis (disorder)
急性呼吸窘迫综合征 NB62 312012004 Acute respiratory distress syndrome (disorder)
肺炎(含 VAP 父概念) CA4Z 233604007 Pneumonia (disorder)
有创机械通气 40617009? 见注 Mechanical ventilation(多同义词,具体概念 ID 应以 SNOMED 浏览器核准为准)

注:SNOMED CT 概念 ID 会随版本修订,使用前请在 SNOMED International 浏览器中核准;OUTCOMEREA 原始库不做 SNOMED 标注,上表仅为互操作映射建议。

§2.2 疾病与场景简介

OUTCOMEREA 覆盖法国 ICU 的全疾病谱危重症,其发表研究最集中的三个临床域是:脓毒症与感染性休克(入 ICU 时脓毒症/感染性休克患者约 4,799 例,占 24,605 次入院的 19.5%)、呼吸机相关性肺炎与其他院内感染(1997-2016 年 MV≥48 小时患者 7,784 例,是欧洲最大的协议化 VAP 队列之一)、以及重症临终决策(DFLST)——法国法律环境下放弃/撤除生命支持决策的系统记录使其成为该领域引用最多的数据来源之一。流行病学背景:脓毒症全球每年导致数百万死亡,ICU 内医院获得性感染发生率长期徘徊在 5-15%,VAP 是机械通气患者最常见的感染并发症;这些疾病谱在法国与欧洲的构成与美国 ICU 存在系统性差异(如抗生素选择压力、MRSA 与产碳青霉烯酶肠杆菌流行率不同),直接影响从美国库训练的模型在欧洲的外推表现。

从建模视角理解这三个临床域的数据形态:

临床域 数据形态特点 对 AI 的含义
脓毒症/感染性休克 入院层定义(Sepsis-2 协议)+ 每日 SOFA 分量恶化轨迹 适合"恶化预警"而非"首发识别";定义版本必须声明
VAP/院内感染 事件层记录 + 定量微生物阈值 + 通气时窗(≥48h 入组、5 天早/晚发切点) 标签质量高但事件稀疏,适合精确率优先的评估
DFLST/临终决策 决策标志与日期 + 支持强度变化 死亡终点不可独立建模,须竞争风险/多状态框架

此外,库内 HIV(630 次首住留)、高龄(80 岁以上 2,419 例)与 COVID-19(178 例首波 ICU)三个专项亚队列各有一套完整的方案内变量清单,构成"库中库"结构——申请提取时按亚队列方案交付,变量可用性随亚队列而变。

§2.3 临床任务定义

任务类型 输入 标签 时序结构
筛查/预警 入院基线(SAPS II、Knaus、McCabe、感染来源) ICU/院内死亡、60 天死亡 单时点或每日更新
诊断/事件检测 每日 SOFA、GCS、PaO2/FiO2、通气参数、抗生素变更 协议定义 VAP/BSI/医源性事件(定量微生物确认) 日粒度时序,事件日为标签日
分级 每日 SOFA 分量 器官衰竭轨迹/恢复 多状态模型状态转移
预后 全住院动态特征 28/60/90 天死亡率、苏醒(脑病研究) 生存分析 + 竞争风险(DFLST)

§2.4 患者人群特征

维度 数值 来源与说明
入院来源 急诊 49%、院内病房 40%、其他 ICU 6%、其他/未知 5% 7,380 例成人首住留分析(doi:10.3402/jchimp.v6.33478
年龄 中位 62 岁(IQR 49-75) 同上
性别 男性 61%(4,481/7,380) 同上;COVID-19 亚组男性 80.4%
病情严重度 中位 SAPS II 40(IQR 28-56) 同上
收治类别 内科/择期手术/非计划手术三类 全库统一采集字段
中心类型 大学医院 + 非大学医院(含海外省圭亚那卡宴) 全网络 23 家(1997-2020)
高龄亚组 80 岁以上 2,419 例(其中 90 岁以上 179 例,1997-2013) Ann Intensive Care 2016;6:31
COVID-19 亚组 178 例 ICU 确诊患者(2020-03-01 至 2020-06-01),60 天死亡 34.8% Nat Mach Intell 2020

§2.5 临床价值

对临床 AI 而言,OUTCOMEREA 的价值集中在三点:其一,事件标签的临床可信度——VAP/BSI 等标签不是行政编码推断,而是协议定义加定量微生物确认,训练出的感染预警模型避免"行政假阳性"污染;其二,每日严重度轨迹——SOFA 逐日分量采集使模型能学习器官衰竭的动态恢复/恶化模式,而非仅依赖入院静态快照;其三,决策情境的完整性——DFLST 与医源性事件记录让"预测死亡"能区分"死于疾病"与"死于放弃",这是任何把死亡当作单一终点的 ICU 库做不到的。

§2.6 金标准与标注方式

维度 内容
划分 无官方 ML 划分;分析按研究方案定义亚组(如 MV≥48h、SAE、HIV、COVID-19),训练/验证由研究者自定
标注方式 前瞻性采集(非回溯标注);诊断由治疗医师按 SRLF/SFAR 指南以 ICD-10 编码;感染事件按 1997 年预定义协议确认
标注者 各 ICU 资深医师 + 受训研究监测员;数据入库前自动一致性校验 + 回源问询
一致性保证 他院资深医师审计 2% 随机样本;每年 1 天编码培训;生理数据半年审计(可靠性良好);编码可靠性专项研究(100 份病历双人重编码 ICD-10)
性质 观察性前瞻登记;无干预分配;质量改进研究(IATROREF)为库上叠加的交叉对照试验

§3 数据集规格

§3.0 版本抉择矩阵

OUTCOMEREA 无公开版本号;"版本"体现为研究方案对应的数据冻结期。下表按需求推荐提取时窗。

你的需求 推荐提取时窗 大小(估) 理由
VAP/院内感染研究 1997-2016 或更长 数百 MB 级定制提取 MV≥48h 主队列 7,784 例在此窗口;预防策略变量最全
COVID-19 研究 2020-03 至 2020-06(首波)及后续波次 百 MB 级 新冠特异变量自 2020-03 起前瞻采集
通用重症结局/死亡预测 1997-2020 全窗 GB 级定制提取 24,298 次住院全谱覆盖,长时程趋势分析需全窗
长时程政策/实践演变 分 1997-2006 / 2007-2015 / 2016-2020 三段 同上 HIV 研究采用的三段划分与关键实践节点对齐

§3.1 模态详情

  • 前瞻登记结构化数据(主模态):每住留一条的入院层记录(年龄、性别、BMI、收治类别、入院诊断、Knaus 慢性衰竭、McCabe 预后分级)+ 每住留每日一条的 ICU 日层记录(SOFA 分量、GCS 每日最差值、FiO2、PEEP 阈值档位 ≥6/≥10/≥16 cmH2O、有创/无创通气、血管活性药、RRT、转运与液体复苏等每日干预)。
  • 编码层:主诊断与伴随诊断按 ICD-10(SRLF/SFAR 1999 指南,662 码,84% 为 4 位码);器官替代与操作按法国 CCAM 分类。
  • 感染与事件层:1997 年预定义的院内感染(VAP、血流感染等)与医源性不良事件,含定量微生物学确认字段与每日抗生素变更。
  • 结局层:ICU 死亡、院内死亡、DFLST(放弃/撤除生命支持的决策与时间)、住留时长。
  • 不包含:波形与秒级监护数据、影像、自由文本临床笔记、出院后长期随访(部分研究随访至 60 天)。

§3.2 按子集样本数表

子集/分析队列 样本数 时间窗 来源
全库(SAE 研究报告口径) 24,605 次入院 1997-2020 Ann Intensive Care 2024
全库(HIV 研究报告口径) 24,298 次 ICU 住院 1997-2020 Crit Care 2023
早期累积 29,393 例 1998-2004 编码可靠性研究(Crit Care 2008
MV≥48 小时(VAP 研究) 7,784 例 1997-2016 PLoS ONE 2017
入 ICU 时脓毒症/感染性休克 4,799 例 1997-2020 SAE 研究(同上 Ann Intensive Care)
重度脓毒症相关脑病(GCS≤13) 995 例 1997-2020 同上
成人首住留(入院时机研究) 7,380 例 1997-2013 区间 doi:10.3402/jchimp.v6.33478
80 岁以上高龄亚组 2,419 例 1997-09 至 2013-09 Ann Intensive Care 2016;6:31
COVID-19 ICU 确诊 178 例 2020-03-01 至 2020-06-01 Nat Mach Intell 2020

§3.3 数据格式表

典型交付格式 结构 主键
住留层 SAS 数据集 / CSV 每住留一行 stay_id
ICU 日层 SAS / CSV 每住留每日一行 stay_id + icu_day
感染/事件层 SAS / CSV 每事件一行 event_id(外键 stay_id)
抗生素/干预层 SAS / CSV 每次变更一行 stay_id + 起始日

§3.4 存储大小

数据库无固定公开包;按方案定制的提取通常为数百 MB 至数 GB 量级的 SAS/CSV 文件集(24,298 次住院、每住院约 5-10 个 ICU 日的日层数百万行级记录)。实际大小随方案纳入变量数与时间窗而变,申请阶段由协作统计中心评估。

§3.5 标注方式

OUTCOMEREA 的"标注"本质是前瞻性结构化采集而非回溯标注:入院诊断由治疗医师在住院期间及出院即刻按 ICD-10 编码;每日严重度与器官支持由床旁采集;感染事件按协议定义确认。这种方式的优点是标签与临床过程同步产生、无回溯偏倚,缺点是编码质量依赖编码者训练——这也是 §6.5 坑点 6 的来源。

§3.6 标注者资质与一致性

数据录入者为各 ICU 资深医师(按法国法律认证重症执业资格)与专职研究监测员;审计由其他参与 ICU 的资深医师执行(2% 随机样本);每年与监查员合办 1 天编码课程。专项研究对 1998-2004 年 29,393 例中随机抽取 100 份病历做双人 ICD-10 重编码一致性检验(脓毒症与休克诊断),结果显示研究数据库亦存在编码可重复性问题——该结果公开可查,建议建模时优先使用研究定义而非纯编码标签。

§3.7 采集周期

1997 年 9 月启动连续采集至今(截至 2026-09 已发表研究数据覆盖 1997-2020)。每个参与 ICU 每年须完成至少 50 例住院 >2 天患者的完整住院采集,方式为全年预设床位连续入组或单月全连续入组。COVID-19 特异变量自 2020 年 3 月起前瞻加入。

采集周期要素 规格 分析影响
入组节奏 全年连续(预设床位)或单月连续(每年一段) 单月抽样中心的季节代表性受限
最短住院 >2 天(48 小时以上) ≤2 天极短住留缺席,早期死亡分析受限
每中心每年配额 ≥50 例完整住院 年度样本量下限保证;中心间密度仍不均
数据更新节奏 每日床旁录入 + 随访至出院/60 天 日粒度时序;无亚日事件排序
定义版本 1997 年协议为基线,2020 年起叠加 COVID 模块 跨 1997-2020 主协议稳定,COVID 变量仅后段存在

§3.8 地域覆盖

法国本土多区域(巴黎大区、里昂、格勒诺布尔、克莱蒙费朗、南特、马赛、圣埃蒂安、鲁昂、凡尔赛等)及海外省(圭亚那卡宴),覆盖大学医院与非大学医院;早期核心为 12 家 ICU,研究期内累计 23 家中心参与(含 HIV 分析纳入的全部中心)。网络协调中心位于 Drancy,统计中心位于巴黎(Inserm UMR 1137 IAME)。

§3.9 设备与参数规格

OUTCOMEREA 采集临床参数档位而非原始设备输出:通气记录为有创/无创状态、FiO2、PEEP 档位(≥6/≥10/≥16 cmH2O)等每日变量;无呼吸机波形、监护仪信号、影像或设备型号层数据。需要秒级时序的建模任务应配合 MIMIC-III/IV 或 HiRID 等开放库使用(见 §8.4)。

§3.10 深度溯源链

原始床旁记录 → 治疗 ICD-10/CCAM 编码(SRLF/SFAR 指南)→ VIGIREA/RHEA 电子病例报告表(自动一致性校验、回源问询)→ OUTCOMEREA 数据仓库(中心随机 2% 审计 + 年度编码培训)→ 协作统计中心(UMR 1137 IAME)质量核查 → 研究方案定制提取(脱敏)→ 分析数据集。全链条在发表文献的 Methods 节有公开描述,审计制度跨 20 余年保持一致。

§4 数据结构

§4.0 目录树(协作提取的典型研究组织形态)

OUTCOMEREA 无统一公开目录结构;以下为按其发表文献的数据层划分、重组协作提取文件的典型研究工程形态(示意,字段名以实际提取件为准):

outcomerea_extract/
├── README.txt                      # 提取说明:时窗、中心、变量字典版本
├── stays.csv                       # 住留层:每住留一行
│   ├── stay_id                     #   住留唯一 ID(int)
│   ├── center_id                   #   中心 ID(建模须聚类)
│   ├── admission_year              #   入院年份(secular trend 分层)
│   ├── age / sex / bmi             #   基线人口学
│   ├── adm_category                #   内科/择期手术/非计划手术
│   ├── icd10_principal             #   主诊断(ICD-10)
│   ├── knaus_*                     #   慢性器官衰竭(呼吸/心/肝/肾/免疫)
│   ├── mccabe_class                #   快速致死/最终致死/非致死
│   ├── sapsii_adm                  #   入院 SAPS II
│   ├── sofa_adm                    #   入院 SOFA
│   ├── dflst_flag / dflst_day      #   生命支持限制决策与日期
│   ├── los_icu / los_hosp          #   ICU/院内住院时长
│   ├── icu_death / hosp_death      #   ICU/院内死亡
│   └── death_day60                 #   60 天生存状态(部分方案)
├── daily.csv                       # ICU 日层:每住留每日一行
│   ├── stay_id + icu_day           #   复合键
│   ├── sofa_total / sofa_*         #   SOFA 总分与分量(呼吸/凝血/肝/循环/神经/肾)
│   ├── gcs_daily                   #   当日最差 GCS
│   ├── pao2_fio2_ratio             #   氧合比
│   ├── fiO2 / peep_band            #   吸氧浓度与 PEEP 档位
│   ├── mv_invasive / mv_niv        #   有创/无创通气状态
│   ├── vasopressor_flag            #   血管活性药
│   ├── rrt_flag                    #   肾脏替代治疗
│   └── transport / fluid_resus     #   转运、液体复苏等每日干预
├── infections.csv                  # 感染层:每事件一行
│   ├── event_id / stay_id
│   ├── event_type                  #   VAP / BSI / 其他院内感染
│   ├── onset_icu_day               #   发生日(早发 ≤5 天 / 晚发 >5 天)
│   ├── micro_method                #   PSB/BAL/气管吸引 + 定量阈值
│   ├── pathogen                    #   病原体(含 MDRPA/MRSA 定植关联)
│   └── antimicrobial_change        #   关联抗生素变更
├── adverse_events.csv              # 医源性事件层(1997 协议预定义)
├── antibiotics.csv                 # 每日抗生素变更
└── dict_variables.pdf              # 变量字典与协议定义引用(提取件随附)

§4.1 DAIMS 字段字典(8 列,核心 14 字段)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
stay_id Integer 住留唯一标识 100042 样本聚合键;同患者多次住留须归组 正整数
center_id Integer 中心标识 7 聚类稳健标准误/混合效应 1-23
admission_year Integer 入院年份 2014 secular trend 分层、漂移监测 1997-2020
adm_category Text 收治类别 medical 手术/内科分层建模 分类口径跨期一致 medical / scheduled_surgery / unscheduled_surgery
icd10_principal Text 主诊断 ICD-10 A41.9 诊断分层;注意编码可靠性问题 编码者间不一致(见坑点 6) SRLF/SFAR 662 码表
mccabe_class Text 基础病预后分级 ultimately_fatal 严重混杂调整 主观分级 nonfatal / ultimately_fatal / rapidly_fatal
sapsii_adm Float 入院 SAPS II 40 严重度调整基线 生理变量录入误差受审计控制 缺失时按方案处理 0-163
sofa_total(日层) Integer 每日 SOFA 总分 7 动态轨迹/恶化预测 分量合并误差 缺失分量需按分量重算 0-24
gcs_daily(日层) Integer 当日最差 GCS 11 神经功能轨迹;SAE 定义 镇静患者取镇静前末值 3-15
mv_invasive(日层) Integer 当日有创通气状态 1 VAP 风险时窗、通气时长 日粒度无起始时刻 0/1
event_type(感染层) Text 事件类型 VAP 感染预警标签 协议定义跨期一致 VAP / BSI / …
onset_icu_day(感染层) Integer 事件发生 ICU 日 6 早发/晚发分层(5 天切点) 日粒度 ≥1
dflst_flag Integer 生命支持限制决策 1 竞争风险建模必需 决策执行有时间差 0/1
hosp_death Integer 院内死亡标签 0 主结局;受 DFLST 影响 0/1

§4.2 标签分布

标签 队列 数值 来源
院内死亡(首住留) 7,380 例成人首住留 以住院死亡为主结局( Logistic 回归建模) doi:10.3402/jchimp.v6.33478
ICU 死亡(COVID-19) 178 例 32.6%(58 例) Nat Mach Intell 2020
60 天死亡(COVID-19) 178 例 34.8%(62 例) 同上
入 ICU 时脓毒症/感染性休克 24,605 次入院 4,799 例(19.5%) Ann Intensive Care 2024
VAP(MV≥48h 队列内早发/晚发) 7,784 例 早发与晚发危险因素显著不同(性别为唯一共同因素) PLoS ONE 2017
ICU 获得性血流感染 COVID-19 vs 非 COVID 病例队列 COVID-19 在 ICU 第 7 天后风险更高 ICM 2021;47:180-187

§4.3 关键统计

  • 全期规模:24,298 次 ICU 住院 / 24,605 次入院(两篇 2023-2024 论文口径,差异源于入院 vs 住院的计数边界)。
  • 中心规模:核心 12 家 ICU(多数研究);全网络累计 23 家(含海外省)。
  • 高龄占比:80 岁以上患者 2,419 例中 90 岁以上 179 例(7.9%,1997-2013)。
  • HIV 谱系:24,298 次住院中 677 次(2.8%)涉及 HIV 患者,纳入 630 次首住留(中位年龄 46.7 岁,男性 69.8%)。
  • COVID-19 首波:178 例 ICU 患者,中位 ICU 住院 11 天,有创通气 64.6%,院内感染 33.8%。
  • 入院严重度:首住留研究中位 SAPS II 40(IQR 28-56);COVID-19 亚组中位 SOFA 5(IQR 4-8)、中位 SAPS II 33.6。
  • 病程时序:COVID-19 亚组症状起始至 ICU 入院中位 10 天,入院至插管窗口(延迟插管研究 2026)以日为单位记录。
  • 事件负担:ICU 获得性血流感染在 COVID-19 患者中于 ICU 第 7 天后风险显著升高(配对病例队列);VAE/VAP 事件以每 1,000 通气日发生率报告。
统计口径 数值 说明
每住院平均 ICU 日(近似) 约 5-10 日 由 ICU 死亡率与住留时长分布推算,实际以提取件为准
VAP 事件时点分界 5 天(早发 ≤5 / 晚发 >5) EOP/LOP 分析惯例切点
事件发生率分母 1,000 通气日/住院日 VAE/VAP/BSI 发表口径

§4.4 数据层级

患者(patient,隐式键:无公开患者跨住留 ID 时按 stay_id 归组)
└── ICU 住留(stay,主键 stay_id)
    ├── ICU 日(icu_day,日粒度时序:SOFA、GCS、通气、RRT…)
    ├── 感染/事件(event_id:VAP/BSI/医源性事件,外键 stay_id)
    └── 抗生素/干预变更(stay_id + 日期)

注意:多数公开分析只取每患者首住留;若你的提取件含重复入院,须在患者层聚合后再划分(坑点 3)。

§4.5 缺失值与信息性缺失

  • 缺失机制:日层变量在住留早期(如转科当日)与方案外变量上自然缺失;HIV 研究明确采用"缺失 >30% 的变量不再插补"的策略并报告缩减样本量。
  • 信息性缺失:GCS 在镇静患者取镇静前末次已知值(设计性替代而非缺失);DFLST 后的器官支持强度骤降属信息性干预,其"缺失"与死亡高度相关,必须建模而非删除。
  • 无哨兵值传统:库内不使用 999/-1 类信息性缺失哨兵;提取件中缺失以空值呈现,加载时显式区分 NaN 与 0(坑点 1 相关)。
缺失场景 机制 处理建议
日层 SOFA 分量缺日 短住留/采集起始日 按"可观测日"重算聚合,勿默认为 0
GCS 镇静患者 设计性替代(镇静前末值) 保留替代值并加镇静标志,勿视为缺失
体重/BMI 方案内可选 多重插补或按中心-年份中位数分层填充
COVID 特异指标(2020 前) 结构性不存在 时间窗限定;不得跨期插补
DFLST 后支持强度下降 信息性干预 建模为状态转移,勿当作数据缺失
60 天生存(出院存活者) 结局窗口约定(出院视为存活) 复现发表口径时保留该约定并声明

§5 数据划分与使用建议

§5.1 官方划分

无。OUTCOMEREA 是研究登记库而非 ML 基准,官方仅按研究方案定义分析队列(MV≥48h、SAE、HIV、COVID-19 等)。

§5.2 社区惯例划分

以库为基础的发表研究普遍采用:全队列描述 → 按暴露/事件定义亚组 → 多变量回归或多状态模型;近期模拟靶标试验(如延迟插管研究)采用倾向评分加权的靶标试验近似。ML 视角的惯例是按入院年份分训练/测试(如 1997-2015 训练、2016-2020 测试),同时保证同一患者的住留不跨集。

# 划分范式:时间外推(训练早期、测试晚期)+ 患者不跨集
import numpy as np

def temporal_split(stays, train_until=2015):
    train = stays[stays["admission_year"] <= train_until]
    test = stays[stays["admission_year"] > train_until]
    # 若含 patient_id,再确认患者不跨集(同一患者整体归训练侧)
    if "patient_id" in stays.columns:
        overlap = set(train["patient_id"]) & set(test["patient_id"])
        test = test[~test["patient_id"].isin(overlap)]
    return train, test

def group_cv_indices(stays, group_col="center_id", n_splits=None):
    """按中心分组的交叉验证索引(GroupKFold 语义)。"""
    groups = stays[group_col].to_numpy()
    uniq = np.unique(groups)
    folds = []
    for g in uniq:                       # leave-one-center-out 语义
        folds.append(np.where(groups == g)[0])
    return folds

选择建议:评估"部署到陌生 ICU"的泛化用 leave-one-center-out;评估"未来年份"的稳健用时间外推;两者结论都报告时,泛化性证据最完整。

§5.3 泄漏风险(重点)

  • 中心泄漏:同一 ICU 的患者高度相关,随机划分会让模型记住中心风格(病例组合、实践模式);应按 center_id 聚类评估或按中心外推(leave-one-center-out)。
  • 患者泄漏:重复入院患者若跨训练/测试集,直接虚高指标。
  • 时间泄漏:入院当日即采集的 SAPS II/SOFA 不得作为"入院前"特征的预测因子;日层特征必须严格滞后于预测时点。
  • DFLST 泄漏:把"是否有 DFLST"作为死亡预测特征等于用结局预测结局——DFLST 本身是死亡路径的强信息性标记,只能作为竞争风险建模的一部分。

§5.4 交叉验证建议

推荐嵌套交叉验证 + 按中心分组的 GroupKFold(组=center_id 或患者 ID);报告跨中心的指标离散度(IQR)而非仅均值,以暴露中心效应。

验证方案 组键 适用问题 报告重点
Leave-one-center-out center_id 部署到陌生 ICU 每折 AUROC 的中位数与最差折
时间外推 admission_year 分段 跨年代稳健性 训练窗 vs 测试窗性能衰减
时间 × 中心双重 两者组合 严格复现条件 折数多、方差大,须报告全分布
患者级 GroupKFold patient_id 含重复住留的提取件 防患者跨集泄漏

§5.5 外部验证建议

优先在跨体系库上验证:美国 MIMIC-IV / eICU-CRD(ICD-9-CM/ICD-10-CM 编码体系,需术语映射)、荷兰 AmsterdamUMAdb、其他法国队列。反向亦然——在 OUTCOMEREA 上训练的模型进入美国库前,须核查 Sepsis 定义版本(Sepsis-2 vs 3)与操作编码体系差异(CCAM vs ICD-10-CM-PCS)。

外部验证的三步清单:① 术语层——ICD-10(SRLF/SFAR)↔ ICD-9/10-CM 映射表先行,映射不到的码落盘人工复核;② 协议层——对齐队列定义(MV≥48h、首住留、48h DFLST 排除等发表惯例),确保两端"同一种患者";③ 评估层——除 AUROC 外必报校准曲线与 PPV/NPV,Yan 规则案例(§8.1)证明跨谱系失效首先是校准失效而非区分度失效。

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

OUTCOMEREA 不提供公开下载或云端托管版本,数据只能经科学委员会方案审批后由协作统计中心定向交付,因此本节无 Colab/Kaggle 一键启动入口。最接近"快速启动"的路径:在 outcomerea.org 获取协作联系信息 → 准备 2-3 页研究方案(队列定义、变量清单、统计分析计划)→ 由合作法国团队提交科学委员会 → 审批后接收定制提取件。等待期间可用 MIMIC-IV/eICU-CRD(公开)按本页 §6 的数据形态搭建管道,提取件到位后仅替换加载层即可。

等待审批期间的工程准备清单(全部可公开环境完成):

准备项 做法 对接收益
管道骨架 用 MIMIC-IV 造出 stays/daily/events 三层同构数据 提取件到货后只改加载函数
字段契约 按 §4.1 字典写好 schema 校验(pandera/pydantic) 提取规格谈判时逐字段确认
评估骨架 §6.9 指标 + leave-one-center-out 框架先跑通 到货即出基线
方法学预演 在 MIMIC-IV 上预演 DFLST 等价的竞争风险建模 方案中写清统计计划,提高审批通过率

§6.1 快速上手

以下代码假设你已获得协作提取件,目录结构与 §4.0 一致。

# ============================================================
# 目录结构预期(data_root 下):
#   data_root/
#   ├── stays.csv      # 住留层,主键 stay_id
#   ├── daily.csv      # ICU 日层,复合键 stay_id + icu_day
#   ├── infections.csv # 感染事件层,主键 event_id,外键 stay_id
#   └── adverse_events.csv
# data_root 拼接关系:所有文件路径 = data_root / 文件名,不做子目录嵌套
# 最小可用子集:stays.csv + daily.csv 即可跑通死亡预测基线
# ============================================================
import pandas as pd
from pathlib import Path

data_root = Path("data_root")  # 改为你的提取件目录

stays = pd.read_csv(
    data_root / "stays.csv",
    low_memory=False,
)
daily = pd.read_csv(
    data_root / "daily.csv",
    parse_dates=[],          # 日层为相对 ICU 日(icu_day 整数),非绝对时间戳
)

# 关键第一步:只保留每患者首住留(多数发表研究惯例;若提取件含
# patient_id 则按其取 min(admission_date),否则按 stay_id 逐层确认)
first_stay = stays.sort_values("admission_year").drop_duplicates(
    subset=["patient_id"], keep="first"
)
daily = daily[daily["stay_id"].isin(first_stay["stay_id"])]

print(first_stay.shape, daily.shape)

§6.2 数据获取

步骤 内容
1 访问官方主页 outcomerea.org,获取协作联系方式与不良事件定义文档(adverse-events-definitions.pdf
2 撰写研究方案:队列定义(如 MV≥48h)、变量清单、统计分析计划、伦理说明
3 经法国合作团队提交 OUTCOMEREA 科学委员会审议(数据库依法国法律运行于 CCTIRS 申报 + CNIL 备案 #8,999,262 框架下)
4 审批后由协作统计中心(UMR 1137 IAME / Drancy 协调中心)执行脱敏定制提取并交付
5 成果发表须经协作组署名规范(OUTCOMEREA Study Group 署名),数据原则上不二次分发
# 无公开 API/下载;申请阶段的变量清单建议直接映射到本页 §4.1 字段字典,
# 与统计中心的提取规格逐字段确认(避免到货后字段名/单位对不上)。

申请方案文件清单(按协作组发表惯例归纳):

文件 内容要点 常见退回原因
研究方案(2-5 页) 队列定义、纳入/排除、暴露与终点定义 终点未处理 DFLST 竞争风险
变量清单 映射到协议字段的逐项列表 + 年代可用性 申请 1997-2020 不存在的变量(如 COVID 前段)
统计分析计划 模型、中心效应处理、敏感性分析 未声明 Sepsis 定义版本
伦理材料 本地 IRB 批件 + 法国合规依赖说明(CCTIRS/CNIL 框架) 缺本地伦理批准
数据安全承诺 存储访问控制、不可再分发声明 未说明数据存放位置与访问者名单
署名意向 OUTCOMEREA Study Group 集体署名与作者贡献 署名安排未沟通

§6.3 预处理全流程

import numpy as np
import pandas as pd

# ---------- 步骤 1:日层长表 -> 按预测时点截断的宽快照 ----------
# OUTCOMEREA 日层是"每住留每日一行"的长表;死亡预测需要构造
# "入住后第 D 天时模型可见的特征快照"。核心原则:只用 icu_day <= D 的行。
def snapshot(daily: pd.DataFrame, day: int) -> pd.DataFrame:
    """构造每住留在 ICU 第 day 天时的特征快照(仅用 <= day 的信息)。"""
    upto = daily[daily["icu_day"] <= day]
    agg = upto.groupby("stay_id").agg(
        sofa_max=("sofa_total", "max"),          # 截至当日最差 SOFA
        sofa_last=("sofa_total", "last"),        # 最新 SOFA
        sofa_slope=("sofa_total",
                    lambda s: np.polyfit(range(len(s)), s, 1)[0]
                    if len(s) >= 2 else 0.0),    # 48h 趋势斜率
        gcs_min=("gcs_daily", "min"),
        mv_days=("mv_invasive", "sum"),
        rrt_any=("rrt_flag", "max"),
    ).reset_index()
    return agg

# ---------- 步骤 2:与住留层基线拼接 ----------
def build_matrix(stays: pd.DataFrame, daily: pd.DataFrame, day: int):
    base = stays[[
        "stay_id", "age", "sex", "adm_category",
        "mccabe_class", "sapsii_adm",
    ]].copy()
    mat = base.merge(snapshot(daily, day), on="stay_id", how="left")
    # 分类变量 one-hot(mccabe/ adm_category 为有序或名义文本)
    mat = pd.get_dummies(
        mat, columns=["adm_category", "mccabe_class"], dummy_na=True
    )
    return mat

# ---------- 步骤 3:标签(区分终点与删失) ----------
def outcome_frame(stays: pd.DataFrame) -> pd.DataFrame:
    y = stays[["stay_id", "hosp_death", "dflst_flag", "los_hosp"]].copy()
    # 竞争风险视角:DFLST 后的死亡路径需单独标记(详见坑点 2)
    y["event"] = np.where(y["hosp_death"] == 1, 1, 0)
    y["time"] = y["los_hosp"].clip(lower=0.5)  # 天;防 0 报错
    return y

§6.4 PyTorch DataLoader(日层序列死亡预测)

# 每住留的日层 SOFA/支持治疗序列 -> GRU 二分类(院内死亡)
# 输入:daily.csv(stay_id, icu_day, sofa_total, gcs_daily,
#        pao2_fio2_ratio, mv_invasive, vasopressor_flag, rrt_flag)
# 输出:stays.csv 的 hosp_death 作为住留级标签
import numpy as np
import pandas as pd
import torch
from torch import nn
from torch.utils.data import Dataset, DataLoader

FEATURES = ["sofa_total", "gcs_daily", "pao2_fio2_ratio",
            "mv_invasive", "vasopressor_flag", "rrt_flag"]
MAX_DAYS = 14          # 截断前 14 个 ICU 日(覆盖多数事件窗口)
PAD_VALUE = 0.0

class OutcomereaDailyDataset(Dataset):
    def __init__(self, daily: pd.DataFrame, stays: pd.DataFrame):
        # 数值稳定:氧合比压缩、GCS 归一化
        d = daily[["stay_id", "icu_day"] + FEATURES].copy()
        d["pao2_fio2_ratio"] = d["pao2_fio2_ratio"] / 300.0
        d["gcs_daily"] = d["gcs_daily"] / 15.0
        self.seqs, self.labels = [], []
        for sid, g in d.groupby("stay_id"):
            g = g.sort_values("icu_day").head(MAX_DAYS)
            arr = g[FEATURES].to_numpy(dtype=np.float32)
            out = np.full((MAX_DAYS, len(FEATURES)), PAD_VALUE, dtype=np.float32)
            out[: len(arr)] = arr
            self.seqs.append(out)
        label_map = dict(zip(stays["stay_id"], stays["hosp_death"]))
        # 序列顺序与 stays 对齐(此处假设 daily 已按首住留过滤)
        self.labels = [
            float(label_map.get(sid, 0.0))
            for sid in d.groupby("stay_id").groups.keys()
        ]

    def __len__(self):
        return len(self.seqs)

    def __getitem__(self, idx):
        x = torch.from_numpy(self.seqs[idx])
        mask = (x.abs().sum(dim=1) > 0).float()   # 非填充帧掩码
        return x, mask, torch.tensor(self.labels[idx], dtype=torch.float32)

class GRUPredictor(nn.Module):
    def __init__(self, n_feat=len(FEATURES), hidden=64):
        super().__init__()
        self.gru = nn.GRU(n_feat, hidden, batch_first=True)
        self.head = nn.Sequential(
            nn.Linear(hidden, 32), nn.ReLU(), nn.Linear(32, 1)
        )

    def forward(self, x, mask):
        out, _ = self.gru(x)
        masked = (out * mask.unsqueeze(-1)).sum(1) / mask.sum(1, keepdim=True).clamp(min=1)
        return self.head(masked).squeeze(-1)

ds = OutcomereaDailyDataset(daily, first_stay)
loader = DataLoader(ds, batch_size=64, shuffle=True,
                    collate_fn=lambda b: tuple(torch.stack(t) for t in zip(*b)))
model = GRUPredictor()
crit = nn.BCEWithLogitsLoss()
opt = torch.optim.AdamW(model.parameters(), lr=1e-3)

model.train()
for x, mask, y in loader:            # 省略 epoch 外层与验证集循环
    opt.zero_grad()
    loss = crit(model(x, mask), y)
    loss.backward()
    opt.step()

§6.5 坑点 8 个

⚠️ 坑点 1:把日层"最差值/当日值"当及时值用,造成标签时点错位(分类:数据泄漏)

问题:OUTCOMEREA 的 GCS 等变量记录为"当日最差值",SOFA 为当日评分。若在"入住第 3 天预测死亡"的设定里混入 icu_day=3 当天的值甚至之后的聚合值,模型实际使用了未来信息,离线 AUC 虚高而上线失效。
症状:训练集 AUC 0.85+,按预测时点严格重切后骤降 10-20 个点;或模型对"死亡前 1 天的 SOFA 峰值"权重异常大。
解决

  1. 简单方法:所有日层特征只允许 icu_day < D(严格滞后一天),聚合用 icu_day <= D-1
  2. 进阶方法:构造患者-时点级长表(每住留 × 每预测日一行),每个时点独立重算滚动窗口特征(§6.3 的 snapshot 函数按 day 逐次调用),杜绝跨时点共享聚合。
  3. SOTA 方法:按landmarking 或动态预测框架(joint models / dynamic deep learning)训练,在验证时按预测时点分层报告 AUC,检查随 horizon 增大的性能衰减曲线。
    参考Nature Machine Intelligence 2020 外部验证案例;OUTCOMEREA 发表论文统一采用"入院时/每日"两类时点的显式划分(如 PLoS ONE 2017)。

⚠️ 坑点 2:忽视 DFLST,把"放弃治疗后的死亡"当作普通死亡事件(分类:标签理解)

问题:法国 ICU 的生命支持限制决策(DFLST)系统记录于库中。DFLST 与死亡强相关且具有信息性——"DFLST 后撤除呼吸机导致的死亡"与"疾病恶化导致的死亡"在因果与预测上完全不同。把 DFLST 当普通协变量等于用结局预测结局,而忽略它则把信息性删失当随机删失。
症状:Cox/KM 分析中 DFLST 的 HR 极大且置信区间跨多个数量级;预测模型对 DFLST 特征赋予病态高权重;比较"治疗强度"与结局时得出"多治疗反而更差"的伪结论。
解决

  1. 简单方法:按 OUTCOMEREA 发表惯例,排除入 ICU 48 小时内实施 DFLST 的患者(SAE 研究即如此处理),减少早期决策污染。
  2. 进阶方法:Fine-Gray 竞争风险模型或原因别风险(cause-specific hazards)建模,把"DFLST 后死亡"与"全支持下的死亡"区分开;生存曲线用累积发生率函数替代 1-KM。
  3. SOTA 方法:多状态模型显式建模"住院→DFLST→死亡/出院"路径(Ursino 等 2021 在 COVID 队列的做法),或边际结构模型处理时变混杂。
    参考:Ursino M, et al. J Clin Med 2021;10:544. doi:10.3390/jcm10030544Ann Intensive Care 2024 SAE 研究

⚠️ 坑点 3:重复入院与首住留惯例不一致,样本被隐性重复计数(分类:预处理陷阱)

问题:同一患者可有多次 ICU 住院。发表文献普遍只取"同次住院期间的首住留",但提取件是否提供跨住留患者 ID 取决于方案。未归组时,同一患者既在训练集又在测试集,或回归中有效样本量被高估。
症状:随机划分下测试集指标偏乐观;去重复化后标准误明显变大;HIV 研究中 677 次 HIV 相关住院归并为 630 次首住留即为典型案例(47 次重复被剔除)。
解决

  1. 简单方法:申请提取时显式要求 patient_id 字段;拿到后 drop_duplicates(subset=["patient_id"], keep="first")
  2. 进阶方法:若无法获得患者级 ID,用 GEE/脆弱性混合效应(frailty term 以 patient 为簇)建模重复住留。
  3. SOTA 方法:保留全部住留,采用以患者为随机效应的联合模型,同时评估住留间携带效应。
    参考Crit Care 2023 HIV 队列流程图(24,298 → 677 → 630 的三步筛减)。

⚠️ 坑点 4:把普通人群/急诊谱系的预测规则直接搬进 ICU 队列(分类:评估误用)

问题:ICU 队列的疾病谱被"收治决策"剧烈截断:轻症患者不在 ICU(好结局缺失),极重者在 ICU 外放弃入院或 48h 内 DFLST(坏结局缺失)。在普通人群拟合的规则进入 ICU 后特异性崩塌。
症状:Yan 等三变量 COVID-19 死亡规则(LDH/淋巴细胞/hs-CRP)在武汉 485 例普通住院队列表现良好,移植到 OUTCOMEREA 178 例 ICU 患者后 day-28 精确度仅 37%、准确度 43%——虽召回 93% 但几乎无阳性预测价值。
解决

  1. 简单方法:任何外部规则先在目标队列做校准曲线(calibration)而非只看 AUC/召回。
  2. 进阶方法:报告 PPV/NPV 与决策曲线分析(DCA),按 ICU 收治截断明确模型的适用人群域。
  3. SOTA 方法:按 transportability 框架做域适应(重加权目标队列谱系),或以 ICU 收治决策为选择变量建模 selection bias。
    参考Limited applicability of a COVID-19 specific mortality prediction rule to the intensive care setting. Nat Mach Intell 2020

⚠️ 坑点 5:中心抽样设计不均衡,被误当作全纳登记(分类:偏倚陷阱)

问题:各参与 ICU 自选抽样方式——全年预设床位连续入组,或单月全连续入组——且仅覆盖住院 >2 天患者。不同中心、不同年份的样本密度与病例构成系统性不同;住院 ≤2 天的极短住留整体缺席。
症状:按年度/中心汇总时发生率跳变;短住留相关结局(如 48h 死亡)不可估计;把季度波动当流行病学趋势。
解决

  1. 简单方法:所有率类指标按中心-年份分层报告,不做跨中心直接相加的粗率。
  2. 进阶方法:在模型中纳入 center 随机效应 + 年份样条;对"仅单月抽样"的中心做入组月份校正。
  3. SOTA 方法:以抽样设计为权重的逆概率加权(IPW),模拟"全纳登记"目标人群;敏感性分析限定全年连续抽样中心。
    参考Timing of admission to and discharge from ICU 研究对两种抽样模式的显式描述;Ann Intensive Care 2016;6:31 的"每年 ≥50 例、住院 >2 天"协议。

⚠️ 坑点 6:ICD-10 诊断编码不是金标准标签(分类:标签理解)

问题:库内诊断由治疗医师按 SRLF/SFAR 指南以 ICD-10 编码。专项可靠性研究对 100 份随机病历(取自 1998-2004 年 29,393 例)做双人重编码,显示脓毒症与休克等诊断的编码可重复性存在实质问题——研究数据库同样如此。
症状:以 ICD-10 码定义的"脓毒症队列"在敏感性分析中人数漂移;跨中心用同一码表比较发生率时结论不稳。
解决

  1. 简单方法:优先使用库内协议定义的临床变量(感染 episode、SOFA 分量)而非纯编码标签定义队列。
  2. 进阶方法:双标签敏感性分析——同一分析分别用编码定义与协议定义各跑一遍,报告结论稳健性。
  3. SOTA 方法:按编码可靠性研究的一致率构造测量误差模型,对标签误分类做纠偏(misclassification-adjusted regression)。
    参考Reliability of diagnostic coding in intensive care patients(Crit Care)

⚠️ 坑点 7:法国编码体系与定义版本的时间断层(ICD-10/CCAM、Sepsis-2 vs 3)(分类:工程陷阱)

问题:OUTCOMEREA 用法国本土体系——诊断 ICD-10(SRLF/SFAR 码表)、操作 CCAM——且部分分析显式沿用 Sepsis-2 标准(SAE 研究即注明"为便于跨年比较而沿用 Sepsis 2.0")。从美国库(ICD-9-CM/ICD-10-CM-PCS、Sepsis-3)迁移字典时会静默错配。
症状:操作/暴露变量映射后出现大量无法匹配码;跨 2016 年前后的 Sepsis 相关发生率出现人为台阶;把 CCAM 透析码对到 ICD-10-CM-PCS 时漏检。
解决

  1. 简单方法:建立显式映射表(CCAM ↔ ICD-10-CM-PCS、SRLF/SFAR 码 ↔ ICD-11),映射不到的码落盘人工复核。
  2. 进阶方法:用临床变量(RRT flag、血管活性药、感染 episode)构建"定义无关"的暴露层,再与编码层交叉验证。
  3. SOTA 方法:按 OMOP CDM 统一概念化(concept_id 映射),让 OUTCOMEREA 与 MIMIC-IV/eICU 在同一词汇层可比。
    参考PLoS ONE 2017(协议化 VAP 定义跨期一致);Ann Intensive Care 2024(Sepsis-2 显式沿用)。

⚠️ 坑点 8:忽略患者嵌套于中心的聚类结构,标准误被低估(分类:评估误用)

问题:12-23 家中心、每中心数千例,同一 ICU 内患者的结局共享病例组合、 staffing 与实践风格。普通 Logistic/Cox 假设独立同分布,会把中心相关性当作有效信息,置信区间过窄、p 值过小。
症状:简单模型里"显著"的中心级协变量(如 PEEP 档位、抗生素策略)在稳健标准误下不再显著;交叉验证的组间方差远大于二项方差。
解决

  1. 简单方法:所有回归加 cluster-robust SE(簇 = center_id);ML 评估按中心分组的 GroupKFold。
  2. 进阶方法:混合效应模型(center 随机截距,必要时随机斜率);发表时报告 ICC。
  3. SOTA 方法:leave-one-center-out 外推评估,直接度量模型到"未见 ICU"的泛化——这是多中心库相对单中心库(MIMIC)最独特的验证红利。
    参考:Bekaert M, et al. Am J Respir Crit Care Med 2011;184:1133-1139(OUTCOMEREA 上 VAP 归因死亡的因果分析处理中心结构);PLoS ONE 2017 多中心模型分层。

§6.6 数据增强(安全 ✅ / 危险 ❌)

类别 操作 说明
✅ 安全 时间窗抖动(±1 ICU 日)用于标签延迟鲁棒性 仅在日粒度噪声范围内
✅ 安全 SOFA 分量级 dropout(训练时随机遮蔽 1 个分量) 模拟临床缺项
✅ 安全 跨中心重加权/重采样 校正中心密度不均
❌ 危险 对器官支持标记(通气/RRT/血管活性药)做随机翻转 改变即伪造治疗过程,破坏事件-暴露一致性
❌ 危险 对 DFLST 时间做扰动或插值 DFLST 日期是决策事实,扰动即制造假结局路径
❌ 危险 用 SMOTE 在住留级生成合成"死亡"样本 忽略中心聚类与时序结构,制造临床不可能的个案

§6.7 模型推荐表

任务 推荐模型 理由
住留级死亡风险 Logistic(可解释基线)→ XGBoost/LightGBM 表格样本量适中;发表文献多采用回归,树模型易增量
日层动态预测 GRU/LSTM 或 landmarking 逻辑回归 日粒度短序列;序列长 ≤14 天
VAP/BSI 事件检测 时变 Cox + 竞争风险;梯度提升生存模型 事件日显式、时变暴露丰富
轨迹/多状态 多状态 Markov 模型(msm 类) DFLST/死亡/出院路径显式
跨库泛化 先 OMOP 概念化再训练;域适应 编码体系差异必须先消解

§6.8 硬件需求表

配置 规格 适用场景
最低 8 GB 内存笔记本 住留级回归/树模型(数万行住留层)
推荐 32 GB 内存工作站 日层数百万行聚合 + GRU 训练
加速 单张消费级 GPU(8 GB+) 序列模型批量训练;数据量不足以需要多卡

§6.9 评估指标代码

import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss
from lifelines.utils import concordance_index

def evaluate(y_true, y_prob, centers=None, times=None):
    """分类指标 + 分中心离散度 + 生存模型 C-index。"""
    out = {
        "auroc": roc_auc_score(y_true, y_prob),
        "auprc": average_precision_score(y_true, y_prob),  # 类别失衡下更诚实
        "brier": brier_score_loss(y_true, y_prob),
    }
    if centers is not None:
        per = [roc_auc_score(y_true[centers == c], y_prob[centers == c])
               for c in np.unique(centers)
               if len(np.unique(y_true[centers == c])) == 2]
        out["auroc_center_iqr"] = (np.percentile(per, 75) - np.percentile(per, 25))
    if times is not None:
        out["c_index"] = concordance_index(times, -y_prob, y_true)
    return out

§6.10 MLOps 笔记

  • 数据不可再分发:提取件受协作协议约束,任何 CI 数据副本须置于访问受控存储;训练产物(模型权重)发表前与协作组确认是否含再识别风险。
  • 版本对齐:在实验元数据中记录提取冻结日期、时窗(如 1997-2020)与中心集合——同一"OUTCOMEREA"在不同方案下是不同的数据集。
  • 漂移监控:以 admission_year 与 center_id 作为天然漂移轴,上线前先做跨年与跨中心的性能衰减分析。
  • 协议一致性:评估流程复现 OUTCOMEREA 发表惯例(首住留、48h DFLST 排除、Sepsis 定义版本),使结论可与文献直接对话。

交付前检查清单:

# 检查项 通过标准
1 提取冻结元数据 冻结日期/时窗/中心数写入实验配置
2 首住留过滤 每患者仅 1 条住留进入住留级分析
3 时点纪律 所有日层特征严格滞后于预测时点
4 DFLST 处理 竞争风险建模或 48h 排除(二选一并记录)
5 定义版本声明 Sepsis 定义与编码体系写入报告
6 中心结构 聚类稳健 SE 或 GroupKFold 已启用
7 复现物 划分种子 + 预处理脚本随代码库归档(数据本体除外)

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
选择偏倚 各 ICU 自选抽样(单月连续或床位连续),仅覆盖住院 >2 天患者;≤2 天极短住留缺席 按中心-年份分层报告;IPW 校正;敏感性分析限定连续抽样中心
信息偏倚(编码) ICD-10 诊断编码存在可重复性问题(双人重编码研究证实) 中-高 用协议定义临床变量定义队列;双标签敏感性分析
信息性删失 DFLST 与死亡强相关;DFLST 后支持强度骤降扭曲时变暴露 Fine-Gray/多状态建模;排除 48h 内 DFLST(发表惯例)
中心效应 病例组合与实践风格跨 12-23 家中心差异大 随机效应/聚类稳健 SE;leave-one-center-out 评估
时间偏倚 1997-2020 跨 Sepsis-2/3、预防策略与治疗实践演变 按年代段分层(1997-2006/2007-2015/2016-2020);定义版本显式声明
谱系截断 ICU 收治决策截断疾病谱(轻症与极重者缺席) 外部规则须先做 ICU 特异校准(坑点 4 案例)

§7.2 标注质量

维度 状态 证据
感染事件定义一致性 1997 年预定义协议 + 定量微生物确认阈值(PSB/BAL/气管吸引),跨期沿用
生理/严重度数据 半年审计证明计算严重度评分的生理数据可靠性良好
诊断编码(ICD-10) 中-弱 双人重编码研究(100 份病历)证实脓毒症/休克编码存在可重复性问题
过程质控 2% 他院交叉审计 + 年度 1 天编码培训 + 录入端自动一致性校验
事件时序分辨率 受限 日粒度(icu_day),事件先后在同日内不可排序
跨期变量可比性 分段 主协议 1997-2020 稳定;COVID 变量仅 2020-03 起;派生变量(compliance、precariousness)为方案内二次构建

亮点:感染事件采用 1997 年起预定义协议 + 定量微生物学确认(PSB/BAL/气管吸引阈值明确),跨期一致性强;生理与严重度数据经半年审计证明可靠性良好;2% 交叉审计与年度编码培训构成持续质控。短板:诊断编码(ICD-10)可重复性有实证问题;日粒度采集无法支持亚日事件排序;部分研究期变量(如 COVID 特异生物学指标)仅在 2020 年后存在。

§7.3 泛化性表

场景 失效风险 证据
法语区欧洲 ICU 内部复用 低(同体系内) 库内 12-23 家中心跨大学/非大学医院设计
迁移到美国 ICU 库 中-高:编码体系(ICD-9/10-CM-PCS vs CCAM)、临终决策文化差异 Yan 规则跨谱系失效案例;DFLST 的法国法律背景
迁移到普通病房/急诊 高:谱系截断方向相反 Nat Mach Intell 2020
高频时序任务 不可行:无亚日数据 §3.9 设备规格
COVID 之后的医疗实践 中:首波治疗模式已过时 2020-03 至 2020-06 首波队列构成

§7.4 伦理与合规

数据库依法国法律运行:向 CCTIRS(法国健康信息研究咨询委员会)申报,CNIL 备案号 8,999,262;法国重症医学会(SRLF)伦理委员会批准;因不改变患者诊疗且匿名采集而获知情同意豁免。数据使用须经科学委员会方案审批;发表须遵循协作组署名规范。使用者应确认自身项目获得本地伦理批准并签署协作条款。

§7.5 公平性

库内记录年龄、性别与基础病(Knaus/McCabe),但不系统采集种族/族裔与社会经济地位变量(HIV 研究中的"不稳定状态"(precariousness)为方案内派生变量)。已知公平性相关发现:高龄患者 ICU 收治与治疗强度受医师主观判断影响(90 岁以上 vs 80-90 岁配对研究);性别作为 VAP 早发/晚发的共同风险因素被识别。建模时应对年龄-治疗强度-结局通路做公平性审计,避免把收治决策偏差学进模型。

§7.6 数据漂移

三个漂移轴需要监控:时间(1997-2020:预防集束化、抗生素策略、Sepsis 定义、COVID 冲击);中心(12 家核心 → 23 家累计,中心进出网络改变病例组合);定义(协议变量本身跨期稳定,是库的强项,但方案间变量清单不同)。建议任何跨期模型都报告按年代段分层的性能,并把 2020 年(COVID)单独敏感性分析。

§7.7 DAIMS 数据集管理评估清单(24 项)

# 检查项 状态 说明
1 宽格式可用性 ⚠️ 日层为长表(每住留每日一行),需自行透视宽表;提供快照构造范式(§6.3)
2 唯一标识 stay_id + icu_day 复合键清晰;患者级 ID 视方案而定(坑点 3)
3 特殊字符处理 编码字段为标准码表;录入端自动一致性校验
4 重复行处理 ⚠️ 重复入院需患者级归组;发表惯例为首住留
5 缺失编码 空值即缺失,无哨兵值混杂数值域
6 标签标识 结局字段(ICU/院内死亡、事件类型)语义明确、跨期一致
7 罕见类分组 长时程队列支撑稀有暴露(HIV 630 例、90 岁以上 179 例)专项分析
8 偏倚评估 抽样设计、DFLST、编码可靠性均有公开发表的量化评估
9 数据字典 协议定义跨 20 余年稳定,随提取件提供变量字典
10 信息性缺失解释 GCS 镇静替代规则、DFLST 信息性删失均有明文
11 设备记录 无设备型号层与波形/亚日数据
12 共线性处理 ⚠️ SAPS II 与 SOFA 分量、器官支持标记间存在结构共线,需建模者自行处理
13 编码映射 ICD-10(SRLF/SFAR)+ CCAM 双编码体系,可映射 ICD-11/OMOP
14 时间戳处理 ⚠️ 日粒度(icu_day 相对日),无亚日时间戳,事件排序受限
15 划分建议 首住留 + 按年份/中心划分的社区惯例明确(§5)
16 泄漏讨论 DFLST 泄漏、时点错位、中心/患者泄漏均有显式处理范式(坑点 1/2/8)
17 标签分布 主要亚组事件率有发表数值(§4.2)
18 测量偏倚 ⚠️ 治疗医师同时编码,暴露与结局测量存在操作者绑定风险
19 外部验证建议 库自身即外部验证支点;跨体系验证路径明确(§5.5/§7.8)
20 版本记录 ⚠️ 无公开版本号;版本体现为方案提取冻结期
21 预处理脚本 无公开官方预处理脚本;本页 §6.3/§6.4 提供可运行范式
22 合规要求 CCTIRS/CNIL #8,999,262/SRLF 伦理/科学委员会审批链完整
23 多模态对齐 单模态结构化登记;无影像/波形/文本可对齐
24 去标识化 匿名采集 + 相对日粒度 + CNIL 框架下的脱敏交付

DAIMS 评分:17.5 / 24

评分解读:该库的强项集中在协议一致性(事件定义、字典、合规、去标识化)与分析指导(划分、泄漏、外部验证均有发表惯例可循),弱项在机器学习工程化(无宽表、无脚本、无版本号)与数据物理形态(日粒度、单模态)。17.5/24 在"非公开研究登记库"中属上游水平,但与开放 ML 基准库(自带脚本与固定划分)相比仍需大量工程投入。

对你意味着什么:第一,预算中至少 30-40% 的时间给"提取规格谈判 + 字段核对",这比模型调参更影响最终结论;第二,把本页 §6.3/§6.4 的快照构造与序列加载代码作为起点,避免重复踩日层长表与时点错位的坑;第三,任何结局分析先问"DFLST 在哪里"——这是该库与其他 ICU 库最大的分析分叉点;第四,利用多中心结构做 leave-one-center-out,这是只有 OUTCOMEREA 这类库才能免费提供的泛化性证据。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
OUTCOMEREA 178 例 ICU COVID 队列(验证 Wuhan 普通住院规则) OUTCOMEREA 协作组 Yan 等三变量死亡规则 day-10/14/28 死亡预测 day-28 PPV 37%、准确度 43%、召回 93% 特异性在 ICU 谱系上崩塌 普通人群规则未经 ICU 校准不可用(Nat Mach Intell 2020
OUTCOMEREA COVID 多状态队列 协作组(JCM 2021) 入 ICU→通气→死亡/出院多状态转移 转移概率估计(无单一 SOTA 值) 与单状态 KM 对比路径更细 DFLST 与通气时序必须显式建模(doi:10.3390/jcm10030544
COVID vs 非 COVID 血流感染配对病例队列 协作组(ICM 2021) ICU 获得性 BSI 风险 ICU 第 7 天后 COVID 组风险显著更高 大流行期感染防控须按谱系分层(doi:10.1007/s00134-021-06346-w

§8 基准性能与生态

§8.1 排行榜与代表性建模结果

OUTCOMEREA 不是固定测试集基准,不存在官方排行榜。下表汇总基于该库的代表性建模/验证结果;数值来自不同队列定义与年代,不可直接比较,仅作能力边界参考。

排名 模型/研究 任务与队列 性能 年份 关键技术 完整引用 代码
1 Yan 规则外部验证 178 例 ICU COVID 死亡(day-28) PPV 37% / 准确度 43% / 召回 93% 2020 三变量决策树规则(LDH/淋巴细胞/hs-CRP)在 ICU 谱系的移植测试 Meyer P, et al., Nature Machine Intelligence, 2020. doi:10.1038/s42256-020-00252-4 无公开
2 COVID 多状态模型 首波 COVID ICU 转移概率 转移概率估计(无单一标量) 2021 多状态 Markov、时变暴露 Ursino M, Dupuis C, Buetti N, et al., Journal of Clinical Medicine, 2021;10:544. doi:10.3390/jcm10030544 无公开
3 VAP 归因死亡因果分析 1997-2004 VAP 队列 VAP 归因死亡分数(causal) 2011 边际结构模型/因果分析重估计 Bekaert M, Timsit JF, Vansteelandt S, et al., Am J Respir Crit Care Med, 2011;184:1133-1139. doi:10.1164/rccm.201103-0526OC 无公开
4 早发/晚发 VAP 危险因素 7,784 例 MV≥48h EOP 与 LOP 危险因素谱分离 2017 时变 Cox、竞争事件 Fine-Gray Ibn Saied W, Souweine B, Garrouste-Orgeas M, et al., PLoS ONE, 2017;12(11):e0187791. doi:10.1371/journal.pone.0187791 无公开

标注:以上数值的队列定义(COVID ICU / MV≥48h / 1997-2004 VAP)与结局(day-28 / 归因死亡 / 事件发生)互不相同;排行榜式的数值直接比较在本库语境下无意义,比较前请回到原论文核对队列与协议。

§8.2 SOTA 总结与选型建议

该库文献传统以流行病学与因果建模为主流:竞争风险、多状态、边际结构模型是"高分"方法;纯预测性 ML(树模型、深度学习)近年才开始进入。若目标是方法学发表,建议把重心放在 DFLST 竞争风险与中心效应的严谨处理上;若目标是 ML 工程验证,把它当作"欧洲多中心外部验证集"使用价值最高——先在 MIMIC-IV 上开发,再经映射在 OUTCOMEREA 上检验谱系外推。

三条选型路径的适用性对比:

路径 典型方法 优势 风险
流行病学/因果 Fine-Gray、多状态、MSM、emulated target trial 与库传统兼容、审稿接受度高 需要 DFLST 与时变暴露的精细提取
预测建模 LR 基线 → GBDT → GRU 直接对标 ML 社区 需自行处理划分/泄漏/聚类,可复现性依赖自建管道
外部验证 冻结外部规则/模型 → ICU 校准 成本低、结论可迁移 谱系截断使"失效"结论须谨慎表述为域边界而非模型缺陷

方法学上最稳健的组合拳是:同一预测问题同时给出"留一中心外推 + 时间外推 + 竞争风险敏感性"三组结果——这恰好把 §7.1 中三类主要偏倚全部纳入证据链,也是 OUTCOMEREA 多中心长时程设计相对单中心库(MIMIC-III/IV)能提供的独特增量。

§8.3 评测协议

库内研究通用协议要素:首住留分析;暴露/事件按 1997 协议定义;严重度调整用 SAPS II + SOFA;中心作为分层/随机效应;Sepsis 定义版本显式声明;发表须经协作组方法学审议。ML 复现时建议沿用:§6.9 指标(AUROC + AUPRC + Brier + 中心离散度)+ leave-one-center-out。

数据集 关系 互补点
MIMIC-IV 开放对照库 秒级时序 + 波形 + 文本;单中心美国
eICU-CRD 开放多中心对照 200+ 美国 ICU;行政编码事件
AmsterdamUMAdb 欧洲开放 ICU 荷兰单中心高频数据;与 OUTCOMEREA 同为欧洲谱系
HiRID / SIC 欧洲开放 ICU 参数化重映射好;事件协议弱于 OUTCOMEREA
RENALCO / 其他法国队列 同体系队列 法国 ICU 体系内补充

§8.5 关键论文 Top 8

  1. Gaillet A, Azoulay E, de Montmollin E, et al. Outcomes in critically ill HIV-infected patients between 1997 and 2020: analysis of the OUTCOMEREA multicenter cohort. Critical Care, 2023;27. doi:10.1186/s13054-023-04325-9 — 最新全期队列描述与 HIV 谱系分析(24,298 次住院口径)。
  2. Ibn Saied W, Souweine B, Garrouste-Orgeas M, et al. Respective impact of prevention strategies, colonization with multiresistant bacteria and antimicrobial use on the risk of early- and late-onset VAP. PLoS ONE, 2017;12(11):e0187791. doi:10.1371/journal.pone.0187791 — 7,784 例 MV≥48h;早发/晚发危险因素分离的协议化范本。
  3. Ursino M, Dupuis C, Buetti N, et al. Multistate Modeling of COVID-19 Patients Using a Large Multicentric Prospective Cohort. J Clin Med, 2021;10:544. doi:10.3390/jcm10030544 — 多状态建模范式与 DFLST 路径处理。
  4. Buetti N, Ruckly S, de Montmollin E, et al. COVID-19 increased the risk of ICU-acquired bloodstream infections: a case-cohort study from the multicentric OUTCOMEREA network. Intensive Care Med, 2021;47(2):180-187. doi:10.1007/s00134-021-06346-w — 配对病例队列设计与感染风险量化。
  5. Meyer P(通信作者团队). Limited applicability of a COVID-19 specific mortality prediction rule to the intensive care setting. Nature Machine Intelligence, 2020. doi:10.1038/s42256-020-00252-4 — 外部验证失效的经典案例。
  6. Bekaert M, Timsit JF, Vansteelandt S, et al. Attributable mortality of ventilator-associated pneumonia: a reappraisal using causal analysis. Am J Respir Crit Care Med, 2011;184:1133-1139. doi:10.1164/rccm.201103-0526OC — VAP 归因死亡因果分析标准。
  7. Garrouste-Orgeas M, Soufir L, Tabah A, et al. A multifaceted program for improving quality of care in intensive care units: IATROREF study. Crit Care Med, 2012;40(2):468-476. doi:10.1097/CCM.0b013e318232d94d — 医源性事件干预试验(配套 Am J Respir Crit Care Med 2010;181:134-142 医疗差错谱系)。
  8. Planquette B, Timsit JF, Misset BY, et al. Pseudomonas aeruginosa ventilator-associated pneumonia: predictive factors of treatment failure. Am J Respir Crit Care Med, 2013;188:69-76. — 病原特异治疗失败预测。

§8.6 社区活跃度

OUTCOMEREA 是协作组驱动而非开源社区驱动:没有公开代码仓库或 issue 追踪,社区活动形态为协作组内研究提案、年度编码培训、科学委员会审议与以 OUTCOMEREA Study Group 集体署名的连续发表(1997 年至今,覆盖 Crit Care Med、ICM、AJRCCM、Crit Care、Ann Intensive Care 等主要重症期刊)。对外研究者进入该生态的现实路径是与协作组建立合作并提交方案(§6.2)。

活跃度信号(截至 2026-09):

信号 状态 证据
发表节奏 持续(年均多篇,含 2024/2026 新论文) Ann Intensive Care 2024Sci Rep 2026
科学委员会 活跃(Timsit、Azoulay、Darmon 等长期在列) 各论文署名与致谢名单
协调中心 实体运营(Drancy,专职研究监测员团队) 2026 论文致谢中协调中心人员列名
公开代码仓库 检索未见官方 GitHub/GitLab
会议存在 以法国/欧洲重症学术会议圈为主 协作组发表渠道推断,无公开 meetup

与开源 ICU 生态(MIMIC 社区的 GitHub + PhysioNet 论坛)相比,OUTCOMEREA 的"社区"更像一个长期运行的研究联盟:进入门槛高,但数据协议一致性与方法学监督远高于自助式开放库。

§8.7 生态快照表

资源 类型 链接 推荐理由
OUTCOMEREA 官方主页 官方网站 outcomerea.org 联系入口与协议信息(截至 2026-09)
不良事件定义文档 官方协议 PDF adverse-events-definitions.pdf 医源性事件/感染定义权威口径
IATROREF 试验注册页 ClinicalTrials.gov NCT00461461 库上叠加干预研究的方法学样例
Inserm UMR 1137 IAME 统计方法学团队 team 5 DeSCID 页面(PLOS 论文署名) 库的方法学归属(DeSCID 团队)
2026 延迟插管靶标试验 最新发表 Sci Rep 2026 证明库仍在活跃产出(Drancy 协调中心列名)

§9 相关资源与引用

§9.1 官方资源

资源 类型 链接 说明
OUTCOMEREA 官方主页 官方网站 outcomerea.org 协作联系入口、网络与协议信息
不良事件定义文档 官方协议 PDF adverse-events-definitions.pdf 医源性事件/院内感染权威口径
数据申请入口 协作流程 经官方主页联系科学委员会 无公开表单(§6.2 流程与文件清单)
合规框架说明 法律文件 各论文 Ethics 声明(CCTIRS/CNIL #8,999,262) 伦理批准与知情同意豁免依据
IATROREF 注册页 试验注册 NCT00461461 库上叠加干预研究的方法学样例

§9.2 BibTeX 完整引用块

@article{gaillet2023outcomes,
  title   = {Outcomes in critically ill HIV-infected patients between 1997 and 2020:
             analysis of the OUTCOMEREA multicenter cohort},
  author  = {Gaillet, Antoine and Azoulay, Elie and de Montmollin, Etienne and
             Garrouste-Orgeas, Maite and Cohen, Yves and Dupuis, Claire and
             Schwebel, Carole and Reignier, Jean and Siami, Shidasp and
             Argaud, Laurent and Adrie, Christophe and Mourvillier, Bruno and
             Ruckly, Stephane and Forel, Jean-Marie and Timsit, Jean-Francois},
  journal = {Critical Care},
  volume  = {27},
  year    = {2023},
  doi     = {10.1186/s13054-023-04325-9}
}

@article{ibnsaied2017vap,
  title   = {Respective impact of implementation of prevention strategies,
             colonization with multiresistant bacteria and antimicrobial use on the
             risk of early- and late-onset VAP: an analysis of the OUTCOMEREA network},
  author  = {Ibn Saied, Wafa and Souweine, Bertrand and Garrouste-Orgeas, Maite and
             Ruckly, Stephane and Darmon, Michael and Bailly, Sebastien and
             Cohen, Yves and Azoulay, Elie and Schwebel, Carole and
             Timsit, Jean-Francois},
  journal = {PLoS ONE},
  volume  = {12},
  number  = {11},
  pages   = {e0187791},
  year    = {2017},
  doi     = {10.1371/journal.pone.0187791}
}

@article{ursino2021multistate,
  title   = {Multistate Modeling of COVID-19 Patients Using a Large Multicentric
             Prospective Cohort of Critically Ill Patients},
  author  = {Ursino, Moreno and Dupuis, Claire and Buetti, Niccolo and
             de Montmollin, Etienne and Bouadma, Lila and Golgran-Toledano, Dany and
             Ruckly, Stephane and Neuville, Mathilde and Cohen, Yves and
             Mourvillier, Bruno and Souweine, Bertrand and Gainnier, Marc and
             Laurent, Virginie and Terzi, Nicolas and Siami, Shidasp and
             Reignier, Jean and Alberti, Corinne and Timsit, Jean-Francois},
  journal = {Journal of Clinical Medicine},
  volume  = {10},
  number  = {3},
  pages   = {544},
  year    = {2021},
  doi     = {10.3390/jcm10030544}
}

@article{buetti2021covid,
  title   = {COVID-19 increased the risk of ICU-acquired bloodstream infections:
             a case-cohort study from the multicentric OUTCOMEREA network},
  author  = {Buetti, Niccolo and Ruckly, Stephane and de Montmollin, Etienne and
             Reignier, Jean and Terzi, Nicolas and Cohen, Yves and Siami, Shidasp and
             Dupuis, Claire and Timsit, Jean-Francois},
  journal = {Intensive Care Medicine},
  volume  = {47},
  number  = {2},
  pages   = {180--187},
  year    = {2021},
  doi     = {10.1007/s00134-021-06346-w}
}

@article{meyer2020limited,
  title   = {Limited applicability of a COVID-19 specific mortality prediction rule
             to the intensive care setting},
  author  = {Meyer, Philippe and others},
  journal = {Nature Machine Intelligence},
  volume  = {2},
  year    = {2020},
  doi     = {10.1038/s42256-020-00252-4}
}

@article{bekaert2011attributable,
  title   = {Attributable mortality of ventilator-associated pneumonia:
             a reappraisal using causal analysis},
  author  = {Bekaert, Mathias and Timsit, Jean-Francois and Vansteelandt, Stijn and
             Depuydt, Pierre and Vesin, Aurelien and Garrouste-Orgeas, Maite and
             Decruyenaere, Johan and Clec'h, Christophe and Azoulay, Elie and
             Benoit, Didier},
  journal = {American Journal of Respiratory and Critical Care Medicine},
  volume  = {184},
  number  = {10},
  pages   = {1133--1139},
  year    = {2011},
  doi     = {10.1164/rccm.201103-0526OC}
}

@article{garrousteorgeas2012iatroref,
  title   = {A multifaceted program for improving quality of care in intensive care
             units: IATROREF study},
  author  = {Garrouste-Orgeas, Maite and Soufir, Lilia and Tabah, Ariel and
             Schwebel, Carole and Vesin, Aurelien and Adrie, Christophe and
             Thuong, Marie and Timsit, Jean-Francois},
  journal = {Critical Care Medicine},
  volume  = {40},
  number  = {2},
  pages   = {468--476},
  year    = {2012},
  doi     = {10.1097/CCM.0b013e318232d94d}
}

@article{planquette2013pseudomonas,
  title   = {Pseudomonas aeruginosa ventilator-associated pneumonia:
             predictive factors of treatment failure},
  author  = {Planquette, Benjamin and Timsit, Jean-Francois and Misset, Benoit Y and
             Schwebel, Carole and Azoulay, Elie and Adrie, Christophe and
             Vesin, Aurelien and Jamali, Samir and Schaedeli, Frederic and
             Goldgran-Toledano, Dany and others},
  journal = {American Journal of Respiratory and Critical Care Medicine},
  volume  = {188},
  number  = {1},
  pages   = {69--76},
  year    = {2013},
  doi     = {10.1164/rccm.201212-2245OC}
}

§9.3 引用指南

使用 OUTCOMEREA 数据的研究,请同时引用:① 对应数据时段的队列描述文献(如上 gaillet2023outcomes);② 你的具体研究协议所依赖的定义文献(如 VAP 定义用 ibnsaied2017vap);③ 协作组署名规范要求的 OUTCOMEREA Study Group 集体署名。转载本页面的表结构或代码时,请署名本百科页面并注明协议原文出处。

§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途 版本
大型语言模型(对话式 AI 助手) 资料归纳、初稿撰写、代码示例生成 2026-09 可用的通用 LLM
千方病案医学编辑部内部校验流程 事实核查触发 内部规范

§10.2 AI 参与范围

本页面的文献检索归纳、结构组织、正文初稿与代码示例由 AI 辅助生成;所有临床事实、数字与结论均要求以 §9 与 FACTS 来源文献为锚,由人工逐条核对后方可发布。

§10.3 输入来源列表

  1. Gaillet A, et al. Outcomes in critically ill HIV-infected patients between 1997 and 2020. Critical Care, 2023. doi:10.1186/s13054-023-04325-9
  2. Ibn Saied W, et al. Early- and late-onset VAP analysis. PLoS ONE, 2017;12(11):e0187791. doi:10.1371/journal.pone.0187791
  3. Ursino M, et al. Multistate modeling of COVID-19 patients. J Clin Med, 2021;10:544. doi:10.3390/jcm10030544
  4. Buetti N, et al. COVID-19 and ICU-acquired bloodstream infections. Intensive Care Med, 2021;47(2):180-187. doi:10.1007/s00134-021-06346-w
  5. Meyer P, et al. Limited applicability of a COVID-19 specific mortality prediction rule. Nat Mach Intell, 2020. doi:10.1038/s42256-020-00252-4
  6. Bekaert M, et al. Attributable mortality of VAP. Am J Respir Crit Care Med, 2011;184:1133-1139. doi:10.1164/rccm.201103-0526OC
  7. Garrouste-Orgeas M, et al. IATROREF study. Crit Care Med, 2012;40(2):468-476. doi:10.1097/CCM.0b013e318232d94d
  8. Planquette B, et al. Pseudomonas aeruginosa VAP treatment failure. Am J Respir Crit Care Med, 2013;188:69-76. doi:10.1164/rccm.201212-2245OC
  9. Garrouste-Orgeas M, et al. Treatment intensity and outcome of nonagenarians. Ann Intensive Care, 2016;6:31. doi:10.1186/s13613-016-0133-9
  10. Mortality associated with timing of admission to and discharge from ICU. J Health Popul Nutr? 见 doi:10.3402/jchimp.v6.33478
  11. Severe sepsis-associated encephalopathy systemic insults analysis. Ann Intensive Care, 2024. PMC11730477
  12. Reliability of diagnostic coding in intensive care patients. Critical Care. ResearchGate 检索页
  13. Phillips-Houlbracq M, et al. Delayed intubation and 60-day mortality in severe COVID-19. Sci Rep, 2026. doi:10.1038/s41598-026-47102-8
  14. Ventilator-Associated Events: Prevalence, Outcome, and Relationship With VAP. Crit Care Med, 2015(协议描述转引)
  15. IATROREF ClinicalTrials 注册页 NCT00461461
  16. OUTCOMEREA 官方主页与不良事件定义文档 outcomerea.org
  17. Increased nonbeneficial care in patients spending their birthday in the ICU. Intensive Care Med, 2012;38:1169-1176. doi:10.1007/s00134-012-2510-7
  18. Outcomes in severe sepsis and septic shock: pathogen species and infection sites. Crit Care Med, 2011;39(8)(研究组与方法描述)

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
§0 E-E-A-T 与免责声明 千方病案医学编辑部 逐句比对金标准文本 ✅ 已通过/已验证
§1 概览与规模数字(24,298/24,605/12-23 中心) 千方病案医学编辑部 与 PMC/期刊原文逐条核对 ✅ 已通过/已验证
§2 ICD-11/SNOMED 映射 千方病案医学编辑部 编码表人工复核 ✅ 已通过/已验证
§3-§4 规格与数据结构 千方病案医学编辑部 与协议描述文献核对 ✅ 已通过/已验证
§6 坑点与代码示例 千方病案医学编辑部 代码本地试运行 + 坑点溯源文献核对 ✅ 已通过/已验证
§7 DAIMS 与外部验证矩阵 千方病案医学编辑部 24 项逐项核查 ✅ 已通过/已验证
§8-§9 基准与引用 千方病案医学编辑部 DOI 逐条解析验证 ✅ 已通过/已验证
§C JSON-LD 与 frontmatter 千方病案医学编辑部 结构化校验脚本 + 人工复核 ✅ 已通过/已验证

§10.5 AI 生成章节标注

正文结构性叙述与代码示例由 AI 辅助起草(见 §10.1/§10.2);全部数字、日期、DOI、协议定义均锚定 §10.3 来源文献,经人工核验后定稿。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-05(与 §0 审核声明一致)

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集