Early Prediction of Sepsis from Clinical Data / PhysioNet-CinC Challenge 2019 (cinc-2019) — AI-Ready Wikipedia

第 20 届 PhysioNet/Computing in Cardiology 挑战赛官方基准:40,336 例 ICU 每小时时序数据(BIDMC + Emory 两系统公开、第三美国系统隐匿),41 列生命体征/实验室/人口学 + 前移 6 小时的 Sepsis-3 标签,临床效用函数评分,CC BY 4.0 开放获取

来源 三个美国医院系统的 ICU 电子病历每小时分箱数据:A 集 Beth Israel Deaconess Medical Center(20,336 例,脓毒症率 8.8%)、B 集 Emory University Hospital(20,000 例,5.7%)、C 集匿名第三系统(仅隐匿测试);每例一个 .psv 管道分隔文件,41 列 = 8 生命体征 + 26 实验室 + 6 人口学 + SepsisLabel发布时间: 2026-09-27最后更新: 2026-09-27 阅读 20
Early Prediction of Sepsis from Clinical Data / PhysioNet-CinC Challenge 2019 (cinc-2019) — AI-Ready Wikipedia

信息速览

数据集名称Early Prediction of Sepsis from Clinical Data / PhysioNet-CinC Challenge 2019 (cinc-2019) — AI-Ready Wikipedia
数据类型人工标注,时序数据,原始数据
规模公开训练集 40,336 例 ICU 患者(A 集 BIDMC 20,336 + B 集 Emory 20,000);隐匿测试集 22,761-24,819 例(三系统,数字双口径);全库合计逾 6
接入方式三个美国医院系统的 ICU 电子病历每小时分箱数据:A 集 Beth Israel Deaconess Medical Center(20,336 例,脓毒症率 8.8%)、B 集 Emory University Hospital(20,000 例,5.7%)、C 集匿名第三系统(仅隐匿测试);每例一个 .psv 管道分隔文件,41 列 = 8 生命体征 + 26 实验室 + 6 人口学 + SepsisLabel
AI 就绪度

CINC-2019 — PhysioNet/CinC Challenge 2019:从临床数据早期预测脓毒症

条目身份:本条目为"千方病案医数集"AI-Ready Wikipedia 系列第 cinc-2019 号,讲述 2019 年第 20 届 PhysioNet/Computing in Cardiology Challenge——迄今临床机器学习领域被引用最多的脓毒症早期预测公开基准。全称 Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019(从临床数据早期预测脓毒症)。数据与全部事实以官方论文(CCM 期刊版为权威口径、CinC 会议版并注)与 PhysioNet 资源页为准,双口径数字均在文中如实并存。


§0 导读:这个数据集解决什么问题

0.1 问题背景:脓毒症预警缺一个"可复现评测场"

脓毒症(sepsis)是全球 ICU 头号可治性急症,Sepsis-3 共识(2016)重新定义之后,临床界最缺的不是又一个单中心预警模型,而是一个可复现的早期预警算法评测场:同一批数据、同一套标签、同一个评分函数,让不同算法的分数真正可比。此前的困境是三重的——各家医院 EHR 数据方言互不兼容(不可比)、标签口径各自为政(不可信)、没有官方隐匿测试(不公平)。2019 年第 20 届 PhysioNet/CinC Challenge 对这三个空档给出了直接回应,其产物就是本条目记录的 cinc-2019 基准:迄今临床机器学习领域被引用最多的脓毒症早期预测公开数据集。

0.2 四层回答:数据、任务、评分、防作弊

CinC 2019 的回答分四层。数据层:三个美国医院系统统一加工为"每小时一行"的时序格式——A 集 BIDMC 20,336 例 + B 集 Emory 20,000 例(合计 40,336 例、1,424,171 行)全部公开,第三美国系统 C 仅作隐匿测试。任务层:因果约束的每小时风险预测,SepsisLabel 按 Sepsis-3 口径前移 6 小时,逼算法"提前预警"而非"事后诸葛"。评分层:归一化临床效用 utility——提前 6 小时报警满分、漏报 −2、误报 −0.05,把"早"与"准"的权衡显式编码进分数。防作弊层:训练全公开、测试全隐匿、官方只跑一次,杜绝公开榜过拟合。

成绩单同样重要:冠军 Morrill et al.(牛津系)final normalized utility 0.360(CinC 会议版口径;CCM 期刊版 0.364*),而所有前排队伍在隐匿 C 系统上全部转为负分(−0.042 至 −0.156)——跨医院泛化崩塌是该基准留给后续研究最重要的教训。

0.3 DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 PhysioNet 官方目录 + 独立 DOI(10.13026/v64v-d857)+ 高引论文锚定;"PhysioNet Challenge 2019 / sepsis"检索直达
A 可获取性 9 CC BY 4.0 无门禁、无注册、直链下载;扣 1 分:C 系统隐匿测试集不可得(结构性限制而非管理缺陷)
I 可互操作 8 统一 .psv 管道分隔格式、41 列全库对齐、官方评分代码开源;缺失即 NaN 的约定干净利落
M 元数据质量 7 三层官方文档(PhysioNet 内容页 + 项目页 + CCM/CinC 论文);扣分:隐匿测试规模双口径(22,761 vs 24,819)、人口学仅 6 列且 Unit1/Unit2 为假名化编码
S 可持续性 9 PhysioNet/MIT LCP 长期托管(RRID: SCR_007345),v1.0.0 一版稳定,挑战赛系列持续运营
综合评级 8.4/10(高) 开放性与格式规范性接近满档;失分集中在隐匿集不可得与人口学稀薄,均属任务设计取舍

0.4 实操八大坑点速览

用这份表免踩坑,逐条展开见正文相应小节:

  1. 坑点 1(标签前移):SepsisLabel 第 t 行 = 1 表示 t 至 t+6 小时内起病。直接拿第 t 行特征预测第 t 行标签 = 用未来信息;要评估"提前 6 小时预警",须把标签再回移 6 小时。
  2. 坑点 2(测试集双口径):隐匿测试集 22,761 例(CinC 会议版)/ 24,819 例(CCM 期刊版)双口径并存,引用时任选其一并注明出处;C 系统数据永不公开,别把它写进"可下载数据"清单。
  3. 坑点 3(HospAdmTime 为负):该列是相对 ICU 入住时刻的小时偏移,恒为负值或零,不是"住院时长",别当特征直读成时间量。
  4. 坑点 4(Unit1/Unit2 假名化):两列是 eICU 的双单元假名编码(0/1/NaN),不是床位号,也不能跨医院比较"单元"含义。
  5. 坑点 5(NaN ≠ 0):全库 1,424,171 行 × 40 变量仅 10,486,913 个非空观测(约 17.9%)。把 NaN 补 0 会把"没测过"变成"测了正常",制造大量假正常值——缺失模式本身是信号(§12.4)。
  6. 坑点 6(公开集成绩 ≠ 泛化成绩):前排队伍在公开 A/B 系统 utility 0.40+,隐匿 C 系统全员负分(−0.042 至 −0.156)。在 A/B 上交叉验证调出的模型,别宣传成"跨医院可用"。
  7. 坑点 7(utility ≠ AUROC):主指标是归一化临床效用 utility(满分 = 提前 6 小时全对),冠军 0.360(CCM 口径 0.364*);它与 AUROC 数值不可换算、不可混写,负分是常态而非错误。
  8. 坑点 8(文件数与行数对账):40,336 个 .psv 文件(20,336 + 20,000),总行数 1,424,171(739,663 + 684,508);患者文件编号不连续,装载后先跑 §附录 I 的断言再建模。

§0 读法三则:

  1. 本条目记的是"挑战赛数据集 + 任务 + 评分"三位一体:训练用 A/B 两系统的 .psv 原始文件在 PhysioNet 直链下载;C 系统只存在于官方隐匿评估,任何第三方"C 系统数据"都非官方。
  2. 全文硬数字以官方两版论文互证(CCM 期刊版为权威口径、CinC 会议版并注),双口径逐条存照于附录 B;隐匿测试集 22,761/24,819 与冠军分 0.360/0.364* 是最常被混写的两处。
  3. 检索时注意:本条目 url_name 为 cinc-2019,与库内 2015/2017/2021 等各届挑战赛条目同系列横链(§10.1);"PhysioNet Challenge 2019""CinC Challenge 2019""Sepsis Challenge"指同一赛事。

§1 一句话档案与身份速览

字段 内容
短名 cinc-2019
全称 Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019(从临床数据早期预测脓毒症:2019 年 PhysioNet/Computing in Cardiology 挑战赛)
本质 ICU 每小时时序临床数据 + Sepsis-3 脓毒症标签的公开基准挑战赛数据集(第 20 届挑战赛)
数据来源 三个美国医院系统抽取并统一加工:A=BIDMC、B=Emory University Hospital、C=匿名第三美国系统
规模 公开训练 40,336 例(A 20,336 + B 20,000);隐匿测试 22,761(CinC 会议版)/24,819(CCM 期刊版)双口径;CCM 摘要口径 “over 60,000 ICU patients”
粒度 每患者一个 .psv 文件,每行 = ICU 住院 1 小时;41 列 = 40 个临床变量 + SepsisLabel
任务 因果(仅用当前与过去数据)输出每小时 sepsis 风险值,要求提前 6-12 小时预警
主指标 归一化临床效用 utility(AUROC/AUPRC/Accuracy/F-measure 并列输出)
冠军 Morrill et al.(牛津系)0.360 final normalized utility
许可 CC BY 4.0(开放获取,无 credentialed 门槛)
版本 仅 v1.0.0(2019-08-05 发布)一版,无后续修订
DOI 10.13026/v64v-d857(v1.0.0)/10.13026/0y7p-s471(latest);RRID: SCR_007345
官方资源 physionet.org/content/challenge-2019/1.0.0/
组织方 Emory 大学 BMI 系牵头 + Georgia Tech + MIT LCP + MGH + UC San Diego

1.1 为什么这个基准重要

2016 年 Sepsis-3 共识重新定义脓毒症之后,临床界最缺的是"可复现的早期预警算法评测场"。CinC Challenge 2019 把这件事做成了三件套:

  1. 统一粒度的真实 EHR:把三套异构电子病历压缩成同一个"每小时一行"的时序格式,41 列对齐,缺失记 NaN——算法不必再处理各家医院的数据方言。
  2. 因果约束的预测任务:只允许使用当前小时及之前的数据,杜绝"用未来信息预报过去"的作弊。
  3. 临床效用而非统计指标:主评分是 utility 函数——提前 6 小时报警满分、漏报重罚 −2、误报轻罚 −0.05,把"早报"与"少误报"的权衡显式编码进分数。

结果也极具警示性:所有前排队伍在公开训练系统(A/B)上 utility 都能冲到 0.40 以上,但在隐匿的第三系统 C 上全部转为负分(−0.042 至 −0.156)——跨医院泛化崩塌成为该基准留给后续研究最重要的教训。

1.2 条目导览

  • §2 论文双口径与时间线
  • §3 机构、人物与参赛规模
  • §4 数据构成与硬数字(Table 2 官方口径)
  • §5 任务定义、Sepsis-3 标注与防作弊
  • §6 评估体系与 utility 函数
  • §7 竞赛结果与完整优胜榜
  • §8 核心发现:跨系统泛化崩塌
  • §9 license、获取方式与版本链
  • §10 生态:互链数据集、HF/GitHub 资源
  • §11 相关数据集对比与证伪记录
  • §12 方法学启示
  • §13 常见误解澄清
  • §14 FAQ
  • §15 术语表
  • 附录 A 时间线大事记/附录 B 双口径存照清单

1.5 "第 20 届"的语境

Computing in Cardiology(原 Computers in Cardiology)自 1974 年起每年一届,2019 年恰是第 20 届 PhysioNet/Computing in Cardiology Challenge。届次语境中的位置:

  • PhysioNet Challenges 从 2000 年(第 1 届)的信号处理主题起步,2010 年代逐步转向临床结局预测;
  • 2019 届是第二届以"患者结局"为核心任务的届次(前一届 2018 届为 ICU 死亡率预测,题库 physionet 2018);
  • 2019 届的 Sepsis-3 标签 + utility 双件套使其成为系列中"临床决策支持"定位最纯的一届;
  • 大会于 2019-09-09/11 在新加坡举行,是该系列首次在东南亚举办。

§2 论文双口径与时间线

1.3 数据卡片速览(机器可读口径)

dataset: cinc-2019
full_name: "Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019"
edition: 20
year: 2019
modality: [EHR 时序, 每小时分箱]
train_patients: 40336        # A 20336 + B 20000
septic_patients: 2932        # 1790 + 1142
rows_public: 1424171         # 739663 + 684508
nonnull_points_public: 10486913
hidden_test_patients: "22761 (CinC) / 24819 (CCM)"
columns: 41                  # 8 vitals + 26 labs + 6 demographics + SepsisLabel
label: Sepsis-3, lead-shifted 6h
task: "early prediction, 6-12h lead, causal"
metric: normalized utility   # 主指标
license: CC-BY-4.0
version: 1.0.0
doi: 10.13026/v64v-d857
rrid: SCR_007345
organizers: [Emory BMI, Georgia Tech, MIT LCP, MGH, UCSD]
winner: "Morrill et al., 0.360"

1.4 阅读指南

  • 赶时间:读 §1 表格 + §4.1 一张表 + §8.1 一张表即可获得全部核心数字。
  • 做研究:§5(任务与标签)+ §6(评分)是复现必读;附录 D 提供现成 BibTeX。
  • 引用口径:任何数字先对照附录 B 双口径清单,避免混用两版论文的口径。
  • 数据工程:§4.3 的 41 列定义与 §9.4 文件树是解析 .psv 的速查页。

2.1 两版官方论文(双口径存照)

本数据集有两版官方论文,数字与作者名单存在系统性差异,引用时必须区分:

(1)CinC 会议版(2019 年 9 月)

  • 标题:Computing in Cardiology 2019
  • 作者:Reyna MA, Josef C, Seyedi S, Jeter R, Shashikumar SP, Westover MB, Sharma A, Nemati S, Clifford GD(9 人,含 Salman Seyedi)
  • DOI:10.22489/CinC.2019.412
  • 篇幅:2 页会议论文
  • 数字口径:隐匿测试集 22,761 例

(2)CCM 期刊版(权威口径)

  • 标题:Early Prediction of Sepsis from Clinical Data: the PhysioNet/Computing in Cardiology Challenge 2019
  • 期刊:Critical Care Medicine. 2020 Jan 15;48(2):210-217. doi: 10.1097/CCM.0000000000004145(PMC6964870)
  • 作者:Reyna MA, Josef CS, Jeter R, Shashikumar SP, Westover MB, Nemati S, Clifford GD, Sharma A(8 人,无 Seyedi)
  • manuscript 落款:14 October 2019
  • 数字口径:隐匿测试集 24,819 例(覆盖 A、B、C 三系统)

(3)年份双口径:PhysioNet 官页引用栏写作 “Critical Care Medicine 48 2: 210-217 (2019)”——in-press 年份口径;PMC 记录的正式刊出日期为 2020 Jan 15。两口径并存,条目以期刊版为权威、会议版注明。

(4)作者名单差异:会议版 9 人含 Salman Seyedi,期刊版 8 人无 Seyedi——引用时按所用版本如实标注。

2.2 时间线(含双截止日期口径)

日期 事件
2019-02-06/08 挑战赛正式启动(官方新闻稿 2019-02-06,论文口径 02-08)
2019-02-08 → 04-19 非官方阶段:每队 5 次 提交机会;截止日期双口径——官页新闻载常规截止 2019-04-10 23:59 GMT,CCM 论文载 19 April(论文以扩展期收尾)
2019-04-01 扩展训练库至 40,336 例
2019-04-22/25 官方阶段开始:每队 10 次 提交,启用新云评分系统
2019-08-05 v1.0.0 资源页在 PhysioNet 发布
2019-08-25 noon GMT 全部提交截止
2019-09-08 新加坡 hackathon
2019-09-09/11 Computing in Cardiology 大会(新加坡)现场决出名次
2019-09-17 官方结果公布
2019-09 CinC 会议版论文发表
2019-11-10 官方评估仓库 evaluation-2019 最后 commit
2020-01-15 CCM 期刊版正式刊出
2022-02-04 PhysioNet sources/ 打包收录全部参赛队伍代码 zip

2.3 资助方

  • 主赞助:Gordon and Betty Moore Foundation、Google、MathWorks
  • NIH 资助:U24EB037545、R01EB030362、R01GM104987、U24CA215109(NCI 支持云评分系统)、UL1TR002378

§3 机构、人物与参赛规模

3.1 组织方

数据集由 Emory 大学生物医学信息系(Department of Biomedical Informatics)牵头,联合:

  • Georgia Tech(与 Emory 共享生物医学工程系)
  • MIT Laboratory for Computational Physiology(PhysioNet 的维护方)
  • Massachusetts General Hospital(MGH)
  • UC San Diego

这一"临床信息学 + 信号处理 + 重症医学"的组合正是 PhysioNet 系列挑战赛的常设班底。

3.2 核心作者与角色

人物 机构 角色
Matthew A. Reyna Emory 通讯作者(matthew.a.reyna@emory.edu),评估仓库作者
Chris Josef Emory 数据管线与论文共同作者
Russell Jeter Emory/MIT LCP 数据工程
Supreeth P. Shashikumar Georgia Tech/UCSD Sepsis-3 标注与算法侧
M. Brandon Westover MGH 临床顾问(神经重症)
Benjamin Moody MIT LCP 资源共同作者(PhysioNet 侧)
Ashish Sharma Emory 竞赛运营与评分
Shamim Nemati UCSD/Emory Sepsis-3 标注方法论
Gari D. Clifford Emory/Georgia Tech 资深作者(与 Nemati 同等贡献)
Salman Seyedi — 仅见于 CinC 会议版作者名单

3.3 参赛规模(官方阶段)

  • 104 队 注册并提交 853 entries
  • 88 队、430 entries 评分成功(其余因格式/规则问题不计分)
  • 90 篇 参赛摘要被 CinC 2019 大会接收
  • 非官方阶段每队 5 次提交、官方阶段 10 次;终评每队仅 1 个 entry 在全集上跑一次

3.4 优胜榜完整表(论文 Table 1/3,final normalized utility)

名次 队伍(成员) Final Sys A Sys B Sys C
1 Morrill et al.(James Morrill, Andrey Kormilitzin, Alejo Nevado-Holgado, Sumanth Swaminathan, Sam Howison, Terry Lyons——牛津系) 0.360 0.433 0.434 −0.123
2 John Anda Du, Nadi Sadr, Philip de Chazal 0.345 — — −0.042
3 Morteza Zabihi, Serkan Kiranyaz, Moncef Gabbouj 0.339 — — −0.146
4 Xiang Li, Yanni Kang, Xiaoyu Jia, Junmei Wang, Guotong Xie 0.337 — — −0.156
5 Janmajay Singh, Kentaro Oshiro, Raghava Krishnan, Masahiro Sato, Tomoko Ohkuma, Noriji Kato 0.337 — — −0.094
* *(最高分非官方条目)Meicheng Yang, Hongxiang Gao, Xingyao Wang, Yuwen Li, Jianqing Li, Chengyu Liu(南京航空/南京鼓楼系) 0.364 0.430 0.422 −0.048

注:带 * 号行为非官方条目的最高分(0.364,高于官方冠军 0.360),官方排行榜中星号标注表示其未满足官方阶段全部规则(如提交次数/截止约束),不计入官方名次。CinC 版论文 Table 1 与 CCM 版 Table 3 的名次口径一致。

3.5 两版论文逐项对照表

对照项 CinC 会议版 CCM 期刊版(权威)
发表载体 Computing in Cardiology 2019 论文集 Critical Care Medicine
发表时间 2019 年 9 月 2020 Jan 15(官页引用口径作 2019)
DOI 10.22489/CinC.2019.412 10.1097/CCM.0000000000004145
PMC 号 — PMC6964870
篇幅 2 页 8 页(48(2):210-217)
作者人数 9 人 8 人
Seyedi S. 有(第 3 作者) 无
隐匿测试集 22,761 例 24,819 例
manuscript 落款 — 14 October 2019
表格口径 Table 1(名次) Table 2(数据规模)/Table 3(名次)

引用建议:方法学叙述引 CCM 期刊版;提及 2019 年 9 月大会现场赛况引 CinC 会议版;两版数字并存时须显式注明版本。

3.6 组织方机构速写

  • Emory University(牵头):亚特兰大,生物医学信息系(BMI)承担数据管线、标注与竞赛运营;B 集即来自其附属医院 Emory University Hospital。
  • Georgia Tech:与 Emory 共享 Wallace H. Coulter 生物医学工程系,提供算法与工程支持。
  • MIT LCP:麻省理工计算生理学实验室,PhysioNet 平台的维护方;Benjamin Moody 代表实验室参与资源建设。
  • MGH:麻省总医院,M. Brandon Westover 提供重症临床视角(神经重症方向)。
  • UC San Diego:Shamim Nemati 主导 Sepsis-3 标注实现与医院间泛化分析。

五方组合覆盖了"数据工程 → 标注方法学 → 临床解释 → 平台发布"全链条,是 Challenge 2019 能在 7 个月内完成从启动到出结果的供给侧原因。

3.7 时间线叙述(双截止日期口径的由来)

官方新闻稿宣布非官方阶段于 2019 年 4 月 10 日 23:59 GMT 截止;但 CCM 论文正文把非官方阶段写到 4 月 19 日。合理解释是:4 月 10 日为常规提交截止,随后约一周为扩展/补交窗口(与 4 月 1 日训练库扩至 40,336 例的更新配套),论文按最终收尾日期记述。两个日期均如实并存,引用时写"2019 年 4 月上旬(官页口径 04-10 23:59 GMT;论文口径 04-19)"即可。

官方阶段原计划 4 月 22 日启动云评分,实际文档口径 4 月 25 日前完成切换——论文以 04-22/25 区间记述,属发布节奏差异而非矛盾。

3.8 参赛规模的口径细节

  • “104 队 853 entries” 指官方阶段注册并提交的队伍与提交总次数;其中 88 队的 430 个 entries 通过了格式与规则审查、进入有效评分。
  • 853 与 430 的差额由三类损耗构成:提交格式不符合规范(缺列/超时/算法崩溃)、违反提交次数上限、独立性审计未通过的重复参赛。
  • "90 篇摘要"是 CinC 2019 大会接收的参赛方法学论文数——多数有效队伍至少提交一篇,另有部分队伍联名或跨队合作。
  • 非官方阶段的参与规模官方未给全量口径,仅排行榜存档(2019-05-02 快照)可考。

3.9 榜单上的地域与技术流派分布(基于优胜榜与摘要集的可考信息)

  • 欧洲学术派:冠军 Morrill et al. 来自牛津(数学建模传统,Terry Lyons 的 rough path 理论落地);Rank 3 Zabihi et al. 来自坦佩雷系(芬兰,信号处理传统)。
  • 亚太工程派:Rank 4 Xiang Li et al. 与星号条目 Meicheng Yang et al. 均来自中国团队(深度学习工程化见长);Rank 5 Singh et al. 为日本产业技术综合系。
  • 澳洲与大洋洲:Rank 2 de Chazal 系(悉尼)。
  • 分布本身说明:脓毒症预警是当时全球 ICU 工程化的共同热点,单一基准能把四大洲队伍拉到同一把 utility 尺子下。

§4 数据构成与硬数字(CCM Table 2 官方口径)

4.1 公开训练集构成

指标 训练集 A(BIDMC) 训练集 B(Emory) 合计
患者数 20,336 20,000 40,336
脓毒症患者 1,790(8.8%) 1,142(5.7%) 2,932(≈7.3%)
数据行数(患者-小时) 739,663 684,508 1,424,171
非空数据点 5,536,849 4,950,064 10,486,913
测量密度 20.6% 19.1% —
  • 训练集 A = Beth Israel Deaconess Medical Center(BIDMC,波士顿):MIMIC-III 的母院,ICU 电子病历抽取。
  • 训练集 B = Emory University Hospital(亚特兰大):与 A 独立的第二套 EHR 系统。
  • 隐匿测试集覆盖 A、B、C 三个系统,其中 C 为匿名美国第三医院系统,训练阶段不可见。
  • 全库合计 over 2.5 million hourly time windows、over 15 million data points(含隐匿部分);公开训练库压缩包 42 MB。
  • CCM 摘要总口径:“over 60,000 ICU patients”。

合计行的三重含义:

  1. 40,336 不是凑整的"约 4 万"——精确到个位的患者数意味着官方对去重/去损有严格定义(每患者一个 .psv 文件即一个计数单元)。
  2. 1,424,171 行与"患者-小时"一一对应,是全部后续统计(密度、阳性率、非空点)的分母基准。
  3. 8.8% → 5.7% 的患病率落差发生在两个公开系统之间——参赛者在非官方阶段就能直接感受到分布冲击,这是基准刻意安排的"泛化预科"。

4.2 隐匿测试集规模(双口径存照)

  • CinC 会议版:22,761 例
  • CCM 期刊版(权威):24,819 例
  • 两数并存的原因是投稿时间差与最终入库例数差异;条目引用时以期刊版为权威、会议版注明。

4.3 文件格式与 41 列定义

每名患者一个管道分隔的 .psv 文件(如 training/p00101.psv),每行 = ICU 住院 1 小时,41 列 = 40 个临床变量 + SepsisLabel,缺失小时无测量记 NaN:

8 项生命体征:

# 变量 说明
1 HR 心率(次/分)
2 O2Sat 血氧饱和度(%)
3 Temp 体温(°C)
4 SBP 收缩压(mmHg)
5 MAP 平均动脉压(mmHg)
6 DBP 舒张压(mmHg)
7 Resp 呼吸频率(次/分)
8 EtCO2 呼气末二氧化碳(mmHg)

26 项实验室检验(Lab):BaseExcess、HCO3、FiO2、pH、PaCO2、SaO2、AST、BUN、Alkalinephos、Calcium、Chloride、Creatinine、Bilirubin_direct、Glucose、Lactate、Magnesium、Phosphate、Potassium、Bilirubin_total、TroponinI、Hct、Hgb、PTT、WBC、Fibrinogen、Platelets——同一指标多 LOINC 编码已合并为单变量。

6 项人口学/管理字段:

# 变量 说明
35 Age 年龄;90 岁以上统一记 100(去标识约束)
36 Gender 性别(0/1)
37 Unit1 ICU 类型(MICU/SICU 编码,部分系统缺失)
38 Unit2 ICU 第二类型标志
39 HospAdmTime 入院到入 ICU 的小时数;可为负值(先入 ICU 抢救、后补办入院登记)
40 ICULOS ICU 住院时长序号(第几小时)

第 41 列 SepsisLabel:二值标签(0/1),实现方式见 §5.2。

4.3.1 八项生命体征速查(临床含义)

变量 单位 临床含义 典型采集频率
HR bpm 心率,脓毒症全身炎症反应的最早体征之一 监护仪连续,分箱后每小时
O2Sat % 血氧饱和度,组织灌注与呼吸代偿指标 监护仪连续
Temp °C 体温,发热/低体温是感染的核心信号 护理记录,每日 4-8 次
SBP mmHg 收缩压,循环衰竭监测 监护仪/NIBP 周期测量
MAP mmHg 平均动脉压,器官灌注的直接驱动压 由 SBP/DBP 计算或动脉导管
DBP mmHg 舒张压 同 SBP
Resp /min 呼吸频率,SIRS/qSOFA 计分项 监护仪连续
EtCO2 mmHg 呼气末二氧化碳,机械通气患者灌注代理指标 通气患者连续

注意:EtCO2 仅覆盖通气患者,缺失率极高;Temp/实验室类依赖护理文书,跨系统缺失机制差异最大(§8.2 归因之一)。

4.3.2 26 项实验室变量清单

BaseExcess(碱剩余)、HCO3(碳酸氢盐)、FiO2(吸氧浓度)、pH、PaCO2(动脉二氧化碳分压)、SaO2(动脉血氧饱和度)、AST(谷草转氨酶)、BUN(尿素氮)、Alkalinephos(碱性磷酸酶)、Calcium(钙)、Chloride(氯)、Creatinine(肌酐)、Bilirubin_direct(直接胆红素)、Glucose(血糖)、Lactate(乳酸)、Magnesium(镁)、Phosphate(磷)、Potassium(钾)、Bilirubin_total(总胆红素)、TroponinI(肌钙蛋白 I)、Hct(红细胞压积)、Hgb(血红蛋白)、PTT(部分凝血活酶时间)、WBC(白细胞)、Fibrinogen(纤维蛋白原)、Platelets(血小板)。

  • 其中 Lactate、Creatinine、Platelets、Bilirubin、WBC 直接进入 SOFA/qSOFA 相关计分链路,是 Sepsis-3 标注的计算输入(§5.3)。
  • 实验室变量按医嘱驱动采集:同一指标在医院间的检测触发习惯不同,缺失模式带强机构印记——迁移到 C 系统时这些"印记"全部失效。

4.4 预处理约定

  • 全部 EMR 数据压缩到每小时分箱:同一小时内的多次测量取中位数。
  • 多 LOINC 编码合并为单变量列,跨系统列名对齐。
  • 缺失不插值、不填充——保留 NaN,缺失模式本身就是建模信号(测量频率与病情相关)。
  • 粒度压缩本身就是去标识手段,这也是本库能以 CC BY 4.0 全开放(而 MIMIC-III 需受训访问)的关键。

4.5 第三方观察口径(与官方不一致处)

MDPI 2026 一篇第三方论文给出:住院时长中位数 40 小时、小时级标签阳性率 1.80%、总行数 “1,552,210 patient-hours”——最后一项与官方 Table 2 合计 1,424,171 行不一致,以官方为准;前两项仅作参考口径记录。


§5 任务定义、Sepsis-3 标注与防作弊

4.6 数据质量注意事项

  1. NaN 不是零:任何插值/填充策略都应显式声明;缺失本身有信息量(§12.4)。
  2. ICULOS 是行号也是时间轴:按 (patient, ICULOS) 唯一定位一个时点,勿假设每患者行数相同。
  3. HospAdmTime 为负是合法值(§4.3):表示 ICU 入住早于正式入院登记。
  4. Unit1/Unit2 部分系统缺失:跨系统建模时不可依赖。
  5. 中位数分箱损失了小时内波动:如需更高分辨率,本库无法提供——这是粒度换开放的固定代价。
  6. SepsisLabel 已前移 6 小时(§5.2):直接拿最后一行标签评估"当天是否脓毒症"是常见错误。

5.1 预测任务

  • 输入:当前小时及之前的全部数据(严格因果——算法在 t 时刻只能看到 ≤t 的行)。
  • 输出:每名患者每个小时窗输出一个 sepsis 风险值(连续分数)+ 二元预测(阈值由评分方统一扫阈值取最优 utility)。
  • 时间要求:预测须至少提前 6 小时于脓毒症起病时间发出,提前量不超过 12 小时——超出 12 小时的早期报警在 utility 函数中不加分(见 §6)。
  • 这个"6-12 小时窗口"来自临床约束:抗生素与液体复苏在 6 小时内启动可显著改善预后,而 12 小时以外的预报临床可操作性过低。

5.2 标签实现(SepsisLabel 前移 6 小时)

训练数据中的 SepsisLabel 是前移(lead-shifted)标签:

  • 脓毒症患者:当 t ≥ t_sepsis − 6 时 SepsisLabel = 1;
  • 非脓毒症患者:全程为 0。

即标签在起病前 6 小时即翻转为 1,使"提前 6 小时"的最低要求在训练阶段即可监督。算法实际输出被评分函数进一步考察 6-12 小时的提前量分布。

5.3 Sepsis-3 三时点定义

标签锚点 t_sepsis = min(t_suspicion, t_SOFA):

  1. t_suspicion(疑似感染时点):IV 抗生素与血培养采样中较早者——若抗生素先给,则培养须在其后 24h 内;若培养先取,则抗生素须在其后 72h 内;含连续给药约束(同一抗生素疗程内的给药不重复计时)。
  2. t_SOFA(器官功能障碍时点):24h 窗口内 SOFA 评分较基线上升 ≥2 分的首个时点。
  3. 约束:t_SOFA 不得早于 t_suspicion 前 24h、不得晚于其后 12h(剔除与感染无关的器官功能波动)。

5.4 防作弊设计

  • C 系统数据永不公开:训练阶段不可见,测试阶段由评分方持有。
  • 隐匿集只跑一次:终评每队 1 个 entry 在全集上运行一次,无迭代调参空间。
  • 独立性审计:对提交者 email、队名、GitHub 账号做关联图谱分析,识别同一人多队参赛。
  • 云评分沙箱:官方阶段使用 Docker 容器 + Google Cloud 的新评分系统,参赛者代码在受控环境运行。

5.7 三个系统的角色对照(§4 数据视角补充)

属性 系统 A 系统 B 系统 C
医院 BIDMC(波士顿) Emory University Hospital(亚特兰大) 匿名(美国第三系统)
数据可得性 公开训练 公开训练 永不公开
官方反馈 官方阶段反馈子集分数 终评才见分 终评才见分
脓毒症率 8.8%(1,790/20,336) 5.7%(1,142/20,000) 未披露
数据行 739,663 684,508 未披露
角色 训练主场 + 开发参照 第二训练分布 泛化终极考场

三系统的角色设计是本基准最有教学价值之处:A 让参赛者"上车",B 制造第一次分布冲击(脓毒症率从 8.8% 降到 5.7%),C 则在终评时完成泛化的终极检验——B 的存在本身就在警告参赛者"第二个中心的分布都会漂移,何况第三个"。

5.8 非空数据点与测量密度

  • A 集:739,663 行 × 40 变量 = 29,586,520 个理论格位,非空 5,536,849 → 密度 20.6%。
  • B 集:684,508 行 × 40 变量 = 27,380,320 个理论格位,非空 4,950,064 → 密度 19.1%。
  • 两系统密度相近(约两成格位有值),但哪些格位有值的机制不同——这正是 §8 泛化崩塌的微观土壤。
  • 全库合计 10,486,913 个非空数据点(公开部分);含隐匿部分官方给出 “over 15 million data points”、“over 2.5 million hourly time windows”。

5.9 为什么选脓毒症做任务

  1. 高发高致死:脓毒症是 ICU 最常见死因之一,每延迟 1 小时抗生素治疗都会推高死亡率——"提前量"有明确临床价值锚点。
  2. Sepsis-3 恰在 2016 年定标:提供了可计算的三时点定义(§5.3),标签生成有共识依据,不依赖各院自定义。
  3. 发病依赖多源信号:生命体征 + 实验室 + 用药记录缺一不可,天然检验 EHR 建模能力。
  4. 误报代价真实存在:警报疲劳与抗生素滥用让"多报"不是免费的——utility 函数的 −0.05 因此有了现实含义。

5.10 标注的实现要点

  • 从原始 EMR 中提取抗生素给药记录(含连续给药约束:同一疗程内重复给药不重置时钟)与血培养记录,按 §5.3 规则合成 t_suspicion。
  • SOFA 分值由心率、血压、呼吸、血氧、血小板、胆红素、肌酐、乳酸等可自动提取项近似计算(缺失按可用项处理)。
  • t_sepsis 受 [t_suspicion − 24h, t_suspicion + 12h] 窗口约束,避免把与感染无关的器官波动计入。
  • 训练标签再整体前移 6 小时(§5.2),构成"提前量内可监督"的完整闭环。

5.11 临床部署视角:从分数到床旁

  • 假警报的床旁代价:ICU 护士每小时处理数十种设备警报;一个在 C 系统上 utility 负分的算法意味着"部署即净伤害"——这就是为什么本基准用 −0.05/次给误报定价,而不是让它免费。
  • 6 小时提前量的运营含义:给足血培养 + 抗生素决策与耗材准备的时间窗;12 小时上限则避免"预报三天后可能脓毒症"这类无法操作输出占用注意力。
  • 因果约束的工程含义:部署系统天然只能看到 ≤t 的数据,训练与部署的信息面一致——这消除了"线下评估与线上表现"之间的最大落差来源。
  • 持续监控建议:跨院部署应周期性重算 utility 并对比 A/B/C 三档基准;一旦跌向 0 基线即触发再训练评审——本基准提供了整套可复用的算尺。

§6 评估体系与 utility 函数

6.1 五指标输出

官方评估程序对每次提交输出五项指标,管道分隔打印:

AUROC | AUPRC | Accuracy | F-measure | Utility
  • 官方主指标 = 第五个 utility(归一化临床效用),其余四项为辅助统计指标。
  • 设计意图:AUROC/AUPRC 无法表达"早报值钱、漏报致命、误报扰人"的临床非对称代价,utility 可以。

6.2 utility 函数定义

对每名患者、每个小时窗 t,按预测时刻与 t_sepsis 的关系给分:

分支 条件 分值 含义
U_TP t_sepsis − 12 ≤ 预警时刻 < t_sepsis max_u_tp = 1 提前 6-12 小时内的真阳性:满分奖励
U_FP 非脓毒症患者的报警 u_fp = −0.05 误报:轻罚(抗生素滥用与警报疲劳的代价)
U_FN 脓毒症患者全程未报 min_u_fn = −2 漏报:重罚(可预防死亡的代价)
U_TN 非脓毒症患者的正确沉默 u_tn = 0 真阴性:中性

参数(评估代码与 CCM 论文 Fig.4 双源互证):

dt_early   = −12   # 最早有效提前量(小时)
dt_optimal = −6    # 最优提前量
dt_late    = +3    # 起病后 3 小时内报警仍算部分有效
max_u_tp   = 1
min_u_fn   = −2
u_fp       = −0.05
u_tn       = 0
  • 在 [dt_early, dt_optimal] 区间内,U_TP 从 1 线性过渡到满值附近再线性回落——"提前 6 小时"两侧不是悬崖,而是缓坡。
  • 起病后 3 小时内(dt_late = +3)报警仍可获得衰减的 U_TP 分值,超出则计 0。
  • 来源说明:官方 evaluation-2019 仓库 raw 直抓因沙箱 SSL 受限未成,参数经参赛镜像(namhar/physionet-challenge-2019)代码与 CCM 论文图形双源核验,风险低。

6.3 归一化与基准线

U_normalized = (U_total − U_no predictions) / (U_optimal − U_no predictions)
  • 最优算法 = 1(每例都在最优窗口报警)
  • 全阴性算法 = 0(从不报警的基线)
  • 负分 = 净伤害(比不报还糟)

这一归一化使不同规模、不同患病率的子集分数可比,也是"跨系统泛化崩塌"(§8)能用统一尺度呈现的原因。

6.4 评分机制与提交规则

  • 官方阶段:Docker 容器 + Google Cloud 云评分;参赛者提交预测算法而非分数。
  • 提交次数:非官方阶段每队 5 次、官方阶段 10 次;终评每队 1 个 entry 全集一次。
  • 信息反馈:官方阶段只反馈 A 系统子集 的分数,B/C 表现保密——防止对隐匿分布过拟合。
  • 官方评估代码:GitHub physionetchallenges/evaluation-2019,evaluate_sepsis_score.m / .py 双语言实现且结果一致,作者 matthewreyna,最后 commit 2019-11-10。另有 physionetchallenges 组织的 Julia/MATLAB/Python/R 四语言示例预测框架(BSD-2-Clause)。
  • 排行榜历史存档:archive.physionet.org/challenge/2019/leaderboard/(可见 2019-05-02 版本快照)。

6.5 为什么不用 AUROC 做主指标(对比示例)

在 7.3% 患病率下,一个把所有患者都报警的算法 AUROC 可达 0.5、Accuracy 约 0.073,但 utility 会因海量误报(−0.05 × 37 万行)跌为深度负值;反之,一个只在病人临终才报警的算法可以刷高 AUPRC 却在 utility 上被提前量惩罚。utility 把这两个失败模式都挡在了排行榜外——这是该基准对后续医学 ML 评测最持久的影响之一。


6.6 utility 逐步计算实例(教学用例)

以一名住院 48 小时、第 30 小时达到 t_sepsis 的患者为例(参数见 §6.2):

算法行为 效果窗口判定 记分
第 18 小时报警 提前 12 小时整,落在 [−12, −6) 边界起点,U_TP 从满值向早期端线性衰减 部分正分
第 20 小时报警 提前 10 小时,处于 [−12, −6] 缓坡区间 接近满值
第 24 小时报警 提前 6 小时 = dt_optimal +1(满值区)
第 26 小时重复报警 同一真阳性窗口内的后续报警不重复计 U_TP 0
第 31 小时报警 起病后 1 小时,仍在 dt_late=+3 内 衰减正分
第 35 小时才首次报警 超出 +3,计 U_FN 级别的失败 趋向 −2

非脓毒症患者在全部住院小时内任何报警都记 −0.05/次;全程无报警记 0。对全体患者求和后按 §6.3 归一化。该实例说明三点:满值奖励集中在"提前 6 小时"附近;过早报(提前 12 小时外)不加分;漏一次报的代价相当于 40 次误报(−2 / −0.05 = 40)——误报罚则轻但并非零成本。

6.7 五指标并排的解读要点

  • AUROC 高、utility 负:排序能力尚可但校准/时机失败——报警不在有效窗口内。
  • AUPRC 高、utility 负:正类检出强,但报警过晚或过密,被 −2/−0.05 拖垮。
  • Accuracy 接近患病率:几乎从不报警的退化解(基线 0 分附近)。
  • F-measure 与 utility 双高:时机与阈值俱佳——真实前排队伍的特征。
  • 因此阅读排行榜时必须以 utility 列为主,其余四列仅作诊断。

6.8 与通用机器学习评测的对照

维度 通用 ML 评测(Kaggle 式) CinC 2019 官方评测
主指标 AUROC / F1 / RMSE 归一化 utility(临床代价显式编码)
提交物 预测分数 算法(Docker 容器在云上跑)
测试数据 赛后公开,可复盘 C 系统永不公开
尝试次数 每日多次,榜单实时 非官方 5 次 / 官方 10 次 / 终评 1 次
反馈 全量分数 仅 A 子集分数
失败模式 榜单过拟合、测试集泄露 结构性杜绝这两类
典型结局 前排分数逼近上限 前排 C 系统全员负分

结论:本基准用"信息分层发放"换来了结论的真实性——它的排行榜数字不如 Kaggle 好看,但泛化结论更接近临床部署的现实。

6.9 阈值处理机制

参赛者输出的是连续风险分;官方评估器在接收端执行统一的阈值扫描:对全部候选阈值逐一计算 utility,取最优者作为该提交的 utility。这意味着:

  • 参赛者无需自行定阈值,等于官方把"最后一步校准"标准化了;
  • 不同校准风格的算法(激进/保守)在同一评估器下可比;
  • F-measure 等辅助指标也用同一最优阈值报告,保证五指标口径自洽。

§7 竞赛过程与官方结果

7.1 两个阶段的节奏

  1. 非官方阶段(2019-02-08 → 04-10/19,双截止口径见 §2.2):每队 5 次提交,排行榜实时可见,用于热身与基线建立。
  2. 官方阶段(2019-04-22/25 → 08-25):每队 10 次提交,云评分系统上线,只反馈 A 子集分数;08-25 noon GMT 截止后,每队指定 1 个 entry 在全集(含 C 系统)上终评一次。

7.2 终评结果分布特征

90 篇摘要之外,官方在 CinC 大会现场仅公布前十名;完整排行榜(含全部 88 个有效队伍)随后发布于 PhysioNet 站内与 archive 存档。

7.3 前排方法学速览

  • 冠军 Morrill et al.(牛津):把时序数据处理为"非规则时间事件流",用 signature 变换(粗-path/多级特征)+ 逻辑回归/梯度提升,在每小时稀疏 NaN 密集数据上稳健工作;其方法学延续到后续 sepsis 预警产品化探索。
  • 第 4 名 Xiang Li et al.:深度时序网络 + 多尺度卷积,A/B 高分但 C 系统 −0.156 为前排最深负值——过拟合训练分布的典型样本。
  • 星号条目 Meicheng Yang et al.:集成 + 规则后处理,C 系统 −0.048 是全场最接近盈亏平衡的成绩。

7.4 前排方法的共性配方

从 90 篇参赛摘要与前排方案看,高分队伍普遍包含以下要素的子集:

  1. 缺失感知建模:把"上次测量距今多久"、"本小时是否测量"作为显式特征,而非简单插值。
  2. 多尺度时序聚合:小时窗 → 6 小时窗 → 24 小时窗的分层统计(趋势 + 波动率)。
  3. SepsisLabel 前移结构的利用:训练目标对齐 t_sepsis − 6(§5.2),推理时再做时机校准。
  4. 梯度提升 + 规则混合:树模型对表格化小时数据稳健,规则后处理压误报。
  5. 阈值按 utility 网格搜索:在验证集上直接优化 utility 而非 F1——与官方主指标对齐。

7.5 排行榜的诚实性设计回顾

  • 非官方榜实时可见 → 社区热度与方法交叉验证;
  • 官方榜只反馈 A 子集 → 中途名次"看起来"不完整是刻意的;
  • 终评一次全集 → 最终榜与中途榜的差异本身就量化了"对反馈过拟合"的程度;
  • archive.physionet.org 存有 2019-05-02 版排行榜快照,可复现中途状态。

7.6 赛程中的三个关键节点回顾

  1. 4 月 1 日训练库扩容(至 40,336 例):发生在非官方阶段中段,排行榜上的分数在这之后才"含金量"完整——B 集加入使全员分数下修,排行榜出现第一次洗牌。
  2. 官方阶段切换云评分(04-22/25):提交从"传分数"变为"传算法",Docker + Google Cloud 沙箱上线,反馈降为 A 子集。
  3. 08-25 终评:每队 1 entry 全集一次,C 系统成绩在 09-17 结果公布时才首次为世人所见——此前无人知道自己会否在第三系统上负分。

7.7 从提交数据看"分差"的本质

前五名的 final 分差只有 0.023(0.360 − 0.337),但 C 系统分差达 0.114(−0.042 − (−0.156))——名次竞争的主战场在 A/B,泛化差异的放大镜在 C。这提示两件事:

  1. A/B 上的精雕细琢(特征、集成、阈值)只能拉开 2-3 个百分点的 utility;
  2. 真正拉开命运差距的是"换一家医院掉多少"——而这一项在赛程内无人能优化(信息分层设计使然),只能在方法学层面预留稳健性(规则混合、保守校准)。

后续研究把这一观察形式化为"性能-鲁棒性前沿":在不接触目标分布的前提下,峰值性能与跨院稳健性存在可量化的交换关系,本榜是它最早的实证数据点之一。


§8 核心发现:跨系统泛化崩塌

8.1 现象

以官方前五名 + 星号条目为例:

队伍 Sys A/B 区间 Sys C
Morrill et al.(Rank 1) 0.433 / 0.434 −0.123
Du, Sadr, de Chazal(Rank 2) 0.40+ −0.042
Zabihi et al.(Rank 3) 0.40+ −0.146
Xiang Li et al.(Rank 4) 0.40+ −0.156
Singh et al.(Rank 5) 0.40+ −0.094
Meicheng Yang et al.(*) 0.430 / 0.422 −0.048

没有任何队伍在 C 系统上取得正分。

8.2 归因分析(论文讨论口径)

  1. 机构间流程差异:实验室项目组合、文书惯例、ICU 类型构成不同,导致 26 项实验室变量的缺失模式与测量频率整体漂移。
  2. 护理强度与编码习惯:A/B 系统数据抽取自研究型深度 EHR,C 系统的记录密度与字段可用性不同——算法学到的"缺失即信号"规律在 C 上反转。
  3. 患病率与疾病谱偏移:C 系统 sepsis 比例、患者年龄构成与训练分布不同,校准整体失效。
  4. utility 的放大效应:负向 utility 对漏报(−2)极敏感,分布偏移造成的少量漏报即可把分数拖到水下;这正是设计意图——宁可让分数难看,也不让"看起来还行"的算法进入临床。

8.3 影响

  • 直接催生了后续"多中心联邦评测"的设计惯例:训练集绝不能只有一到两个中心。
  • MIMIC-III/eICU 组合、HiRID、AmsterdamUMCdb 在 2020 年代被广泛用作外部验证库,正是对本教训的制度化回应(见 §10、§11)。
  • "跨医院泛化崩塌"成为医学 ML 综述中的标准引例,CCM 论文至今是 sepsis ML 基准的标配引用。

§9 License、获取方式与版本链

9.1 许可

  • License:CC BY 4.0(Creative Commons Attribution 4.0 International Public License)。
  • Access Policy:Anyone can access the files——完全开放获取,无 credentialed/受训访问门槛。
  • 对比 MIMIC-III 的受训访问制:本库的小时级分箱粒度压缩本身就是去标识手段,因此可全开放。
  • 引用要求:①Reyna et al. CCM 论文(或所用版本的对应论文);②数据 DOI 10.13026/v64v-d857(RRID: SCR_007345)。
  • 附带资源的独立许可:官方评估代码与四语言示例框架为 BSD-2-Clause;各参赛队伍代码仓库许可各异,使用前须逐一核对。

9.2 三种下载方式

# ① PhysioNet 页面直链(约 42 MB 压缩包)
https://physionet.org/content/challenge-2019/1.0.0/

# ② wget 递归镜像
wget -r -N -c -np https://physionet.org/files/challenge-2019/1.0.0/

# ③ AWS 开放数据(匿名访问)
aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/

9.3 版本链

  • 仅 v1.0.0(2019-08-05)一版,无后续修订——资源页发布即终版,是 PhysioNet 系列中少见的"零修订"稳定基准。
  • latest DOI:10.13026/0y7p-s471(当前指向同一 v1.0.0)。

9.7 三种获取方式怎么选

方式 适用场景 注意点
页面直链 首次下载、人工核对 手动确认版本页脚 v1.0.0
wget 递归 脚本化、断点续传 -N 保时间戳、-c 续传、-np 防越界父目录
AWS sync 云上批量、免登录 –no-sign-request 匿名;区域延迟首次较慢

三种方式产物一致(同一 SHA256SUMS 清单),任选其一即可;云端训练建议 AWS sync(内网带宽),本地分析建议直链(一次 42 MB)。

9.4 资源页文件树

challenge-2019/1.0.0/
├── training/            # A、B 两子目录,每患者一个 .psv
│   ├── training_setA/   # 20,336 例(p000001.psv - p010336.psv 命名段)
│   └── training_setB/   # 20,000 例
├── papers/              # 官方论文 PDF(含 CCM manuscript,约 1.5 MB)
├── sources/             # 全部参赛队伍代码 zip(2022-02-04 打包;
│                        #   如 404Sepsisnotfound.zip、ABC.zip 等数百队)
├── hackathon/           # 2019-09-08 新加坡 hackathon 材料
├── img/                 # 页面图(utility_sepsis/nonsepsis_diagram.svg 等)
├── LICENSE.txt          # 25.2 KB(CC BY 4.0 全文)
└── SHA256SUMS.txt       # 文件校验清单

8.5 "负分是设计意图"的三层解读

  1. 测量层:utility 的归一化把"从不报警"定为 0 分基线——任何在陌生分布上失准的算法都会自然落水,负分 = "换家医院后比不部署还糟"的直白表述。
  2. 设计层:漏报罚 −2 远重于误报罚 −0.05(40:1),使分数对"分布偏移导致的漏检"极度敏感——这正是设计者想要的放大镜。
  3. 传播层:全员负分的结果被论文如实报告,成为医学 ML 社区十年间反复引用的警示案例——一次"难看但诚实"的评测,胜过十次"好看但存疑"的刷榜。

8.6 与同期其他挑战赛泛化设计的对比

赛事 泛化检验方式 特点
CinC 2019(本库) 隐匿第三医院系统,终评一次性 信息分层最严格
CinC 2015 隐匿病历 + 提前量奖励 首创 utility 思想
CinC 2021 隐藏测试含"从未见过的库"(分布外设计) 库级泛化
MIMIC-III 时代常见做法 单库随机划分 无真正泛化检验

本库的设计介于 2015 与 2021 之间:既保留了单系统隐匿的尖锐性,又用 A/B 双库训练给出了第一次分布冲击的预演。

9.6 在 PhysioNet 开放数据家族中的位置

  • PhysioNet 资源分三档:open(直接下载)、credentialed(注册+协议)、controlled(申请审核)。
  • 本库属 open 档(CC BY 4.0,Anyone can access),与 MIMIC-III(credentialed)形成鲜明对照——同一家医院(BIDMC)的数据,因粒度压缩策略不同而落在不同合规档位,是研究开放数据合规设计的经典对照样本。
  • 相近定位的 open 档资源还有 challenge 系列数据(cinc-2015、cinc-2021、cinc-2023 等),构成"小时级 EHR → 信号 → 波形 → 音频"的开放频谱。

10.5 引用与署名规范细则

  • 引用数据:Reyna et al. 论文 + DOI 10.13026/v64v-d857,RRID SCR_007345 写入方法学段落。
  • 引用评估代码:physionetchallenges/evaluation-2019 仓库,注明 commit 日期(最后 commit 2019-11-10)。
  • 使用参赛代码(sources/ 内 zip):逐仓库核对许可,多数为研究用途限制,勿默认可商用。
  • 转载本条目:CC BY 4.0 同样适用——署名"千方病案医数集"并链接原始条目。

10.1 库内互链(rid 核实于 2026-09-27)

关联数据集 rid 关系
mimic-iii / mimiciii 106 / 590 A 集(BIDMC)母院数据库;本库为其小时级压缩重切片
eicu-crd / eicu-collaborative 552 / 9 常被误传为 B 集来源(见 §13 证伪二);实为外部验证资源
chest-ct-sepsis-er 600 影像域脓毒症数据集(CT),与本库构成"时序+影像"互补
cinc-2021 644 同系列后续挑战赛(12 导联 ECG 多标签)
cinc-2015 487 同系列 2015 届( hypothetemia/假性低体温预警)
cinc-2018-sleep 493 同系列 2018 届(睡眠分期)
physionet-cinc-2016 382 同系列 2016 届(心音分类)
physionet-cinc-2017 162 同系列 2017 届(房颤分类)
cinc-2023 499 同系列 2023 届(环境声音健康事件)
amsterdamumcdb 6 欧洲外部验证库(荷兰阿姆斯特丹 UMC)
hirid 7 欧洲外部验证库(瑞士伯尔尼 Inselspital)

10.2 HF 生态(hf-mirror.com 查询 2026-09-27)

  • legomaheggo/physionet-sepsis-2019(downloads 128)
  • devesh73/physionet-sepsis-2019(downloads 21)
  • 无官方 HF 仓库;社区镜像均为个人再打包,使用时须回源核对 SHA256。

10.3 GitHub 生态

  • physionetchallenges/evaluation-2019:官方评估代码(MATLAB + Python 双实现)。
  • physionetchallenges 组织:Julia/MATLAB/Python/R 四语言示例预测框架(BSD-2-Clause)。
  • 参赛镜像:namhar/physionet-challenge-2019 等;PhysioNet sources/ 目录收全部参赛代码 zip(数百队)。
  • 引文生态:CCM 论文为 sepsis ML 基准标配引用;CinC 2019 论文集(cinc.org/archives/2019/)含 90 篇参赛摘要。

8.4 逐队泛化落差分析(C 系统成绩单)

队伍 C 系统分 相对 A/B 落差 可读出的信息
Xiang Li et al. −0.156 前排最深 深度模型对训练分布记忆最强,崩得最狠
Zabihi et al. −0.146 深负 多尺度卷积未处理缺失机制漂移
Morrill et al. −0.123 深负但总分仍居首 signature 特征在 A/B 优势足够大,抵消 C 崩塌
Singh et al. −0.094 中等 规则占比高反而缓冲
Meicheng Yang et al.(*) −0.048 最浅 规则后处理 + 保守阈值 = 最抗漂移
Du, Sadr, de Chazal −0.042 最浅 同上;临床规则工程是跨院稳健性的关键

规律:模型越"深"、越依赖训练分布的统计规律,C 系统崩得越深;规则与校准越保守,落差越浅。但保守派的总分也被压低(0.345 vs 0.360)——稳健性与峰值性能的权衡在本榜上清晰可见。

9.5 复现与校验实操清单

  1. 下载压缩包后先核对 SHA256SUMS.txt(官方提供全文件校验清单)。
  2. 抽查任一 .psv:列数应为 41、分隔符为 |、缺失为空值/NaN、首行为表头。
  3. 用官方 evaluation-2019 仓库的 evaluate_sepsis_score.py 对随机预测复算 utility,验证归一化基线(全阴性 = 0)。
  4. 核对 A/B 合计行数:739,663 + 684,508 = 1,424,171;患者数 20,336 + 20,000 = 40,336;脓毒症 1,790 + 1,142 = 2,932。
  5. 引用格式采用 §9.1 两件套(论文 + DOI),RRID 写 SCR_007345。

10.4 资源索引速查

资源 位置 说明
数据本体 physionet.org/content/challenge-2019/1.0.0/ v1.0.0,42 MB
官方论文(权威) CCM 48(2):210-217 / PMC6964870 期刊版
官方论文(会议版) DOI 10.22489/CinC.2019.412 2 页
评估代码 github.com/physionetchallenges/evaluation-2019 MATLAB+Python
示例框架 github.com/physionetchallenges 四语言,BSD-2-Clause
排行榜存档 archive.physionet.org/challenge/2019/leaderboard/ 2019-05-02 快照
参赛代码全集 PhysioNet sources/(2022-02-04 打包) 数百队 zip
论文集 cinc.org/archives/2019/ 90 篇摘要

10.6 HF 社区镜像的注意事项

  • hf-mirror.com 可查到的镜像(legomaheggo 128 次下载、devesh73 21 次下载)均为个人再打包,非官方维护。
  • 使用镜像前务必回源核对:行数(1,424,171)、患者数(40,336)、41 列结构——社区镜像历史上出现过列错位与标签口径错误的先例(通用教训,非本库特例)。
  • 官方没有 HF 仓库;引用研究时一律以 PhysioNet v1.0.0 + SHA256SUMS 为准。

10.7 GitHub 生态的使用建议

  • 复现评估:直接跑 evaluation-2019 的 .py 实现(与 .m 双实现结果一致,2019-11-10 最后 commit)。
  • 快速起步:physionetchallenges 组织的四语言示例框架(BSD-2-Clause)给出了输入输出管线的最小实现。
  • 深挖方法:sources/ 内数百队 zip 是"同一基准、百种方法"的原始语料,适合做方法学元分析;逐 zip 核许可后再用。

8.7 本节小结

  • 现象:A/B 0.40+ → C 全负(−0.042 至 −0.156)。
  • 机制:缺失机制漂移 + 编码习惯 + 患病率偏移 + utility 放大。
  • 规律:模型越深崩得越狠,规则越保守落差越浅(§8.4)。
  • 后果:多中心训练与外部验证成为医学 ML 的制度性标配(§10.1、§11)。

一句话:CinC 2019 用一届比赛的负分,换来了整个领域对"泛化"二字的重新定价。


§11 相关数据集对比与证伪记录

11.1 与 MIMIC-III 的关系

维度 cinc-2019 MIMIC-III
A 集母院 BIDMC(同一医院) BIDMC
访问门槛 CC BY 4.0 全开放 受训访问(CITI 证书 + 签署协议)
粒度 每小时一行、41 列固定 秒级事件流、全字段
标签 Sepsis-3 前移 6 小时(现成) 原始数据,需自行实现 Sepsis-3
用途定位 算法评测基准 深度研究数据湖

A 集可视为 MIMIC-III 在"Challenge 2019 规范"下的投影:同一医院、同一时段的 ICU 记录,被压缩、对齐、打标成可直接训练的格式。库内误传澄清:主会话曾提示"来源含 MIMIC-III/eICU/HiRID/AmsterdamUMCdb 四库",不成立——官方论文明确三个系统均为美国医院(A=BIDMC、B=Emory、C=匿名美国系统);HiRID(瑞士伯尔尼)与 AmsterdamUMCdb(荷兰)是赛后才被社区用作外部验证的资源,Frontiers 2026 综述将两者与本基准并列为互补定位,并非本库来源。

11.2 与 eICU 的关系(证伪二)

社区流传"B 集 = eICU"为误传。 CCM 论文明确 B = Emory University Hospital;PMC6964870 与 MDPI 第三方论文双源一致。eICU-CRD 是多中心远程 ICU 数据库,与本库 B 集无来源关系,仅常被同时引用作外部验证。

11.3 与同系列挑战赛的谱系

  • cinc-2015(487):假性低体温/心血管手术预警——首次引入"提前量奖励"思想。
  • physionet-cinc-2016/2017(382/162):心音与心律分类,信号粒度。
  • cinc-2018-sleep(493):睡眠分期。
  • cinc-2019(本条目):转回临床时序,引入 Sepsis-3 标签与 utility 函数。
  • cinc-2021(644):12 导联 ECG 多标签汇编,把"训练全信息、测试降信息"模板化。
  • cinc-2023(499):环境声音健康事件。

谱系上的承上启下:cinc-2015 的提前量思想在 cinc-2019 被 utility 函数形式化,随后被 cinc-2021 的部分得分制继承。

11.4 与欧洲外部验证库的互补

维度 cinc-2019 HiRID AmsterdamUMCdb
国家 美国(三系统) 瑞士(伯尔尼) 荷兰(阿姆斯特丹)
粒度 每小时分箱 分钟级 小时/分钟混合
许可 CC BY 4.0 CC BY-SA 4.0(需 credentialed) 需申请(credentialed)
角色 训练+官方基准 赛后外部验证 赛后外部验证

§12 方法学启示

12.1 "临床效用函数"可以显式编码权衡

把"提前 6-12 小时最值钱、漏报 −2、误报 −0.05"写成白纸黑字的分段函数,比让算法作者自行猜测权衡好得多:所有队伍在同一尺度上竞争,事后分析能精确解释每个名次差的来源。任何"早发现"类任务(败血症、脓毒症、急性肾损伤、病情恶化预警)都可直接移植这套参数化模板。

12.2 "训练全公开、测试全隐匿、只跑一次"防过拟合三件套

  • 训练集(A/B)公开 → 方法可复现;
  • C 系统永不公开 → 无法对测试分布调参;
  • 终评 1 entry 全集一次 → 无迭代试探空间。

配合"官方阶段只反馈 A 子集分数"的信息控制,这套流程把排行榜与真实泛化的差距压到了最小——代价是 C 系统全员负分这一"难看"的结果,而这恰恰是结果可信的证据。

12.3 粒度压缩是开放与隐私的中间道路

MIMIC-III 因字段过细只能受训访问;本库把粒度压到"每小时 + 41 列 + 90+ 岁记 100"后即可 CC BY 4.0 全开放。粒度压缩本身就是去标识手段——这为后续开放数据集设计提供了可复用的合规路径。

12.4 缺失模式是信号也是陷阱

训练集上"某变量缺失率与死亡率相关"的规律,到了 C 系统可能因为文书流程不同而反转。处理 EHR 缺失时,应显式建模"缺失机制"而非仅把 NaN 当特殊值——本基准的泛化崩塌正是这一原则最著名的反例教材。

12.5 多中心训练是底线

前五名全部在 C 系统翻车说明:两个中心训练不足以覆盖第三个中心的分布。2020 年代 sepsis 预警研究普遍转向 3+ 中心训练 + 独立中心验证的设计,本基准是这一转变的直接推手。


§13 常见误解澄清(证伪记录)

# 流传说法 事实 依据
1 “数据来自 MIMIC-III/eICU/HiRID/AmsterdamUMCdb 四库” 不成立。三个系统均为美国医院:A=BIDMC、B=Emory、C=匿名美国系统;HiRID(瑞士)与 AmsterdamUMCdb(荷兰)是赛后外部验证资源 CCM 论文 §2;Frontiers 2026 综述
2 “B 集 = eICU” 误传。B = Emory University Hospital PMC6964870 与 MDPI 第三方论文双源一致
3 “总行数 1,552,210 patient-hours” 与官方 Table 2 合计 1,424,171 行不一致,以官方为准 CCM Table 2
4 “隐匿测试集是 22,761 例” 仅 CinC 会议版口径;CCM 期刊版为 24,819(权威) 双口径并存
5 “论文是 2019 年的” 期刊版正式刊出 2020 Jan 15;官页引用沿用 in-press 年份口径 “(2019)” 双口径并存
6 “C 系统是欧洲某医院” 禁止猜测。官方仅称 “a third, unidentified hospital system”(美国第三系统),条目按匿名处理 FACTS 存照第 79 行
7 “冠军 0.364” 0.364 是非官方星号条目(Meicheng Yang et al.);官方冠军 Morrill et al. 为 0.360 论文 Table 1/3
8 “评估代码是 BSD-2-Clause 所以数据集也是” 数据集许可为 CC BY 4.0;BSD-2-Clause 是示例预测框架仓库的许可,勿混淆 PhysioNet LICENSE.txt

13.1 证伪记录的逐条展开

证伪一(四库来源说)的排查路径:先查官方论文 §2——“Data from three hospital systems in the United States were used”,明确三系统均为美国;再查 Frontiers 2026 综述——HiRID 与 AmsterdamUMCdb 是作为"互补外部验证资源"与本基准并列讨论,而非数据来源;两者口径一致,误传可定案。

证伪二(B=eICU 说)的排查路径:CCM 论文 Table 2 脚注写明 “training set B: Emory University Hospital”;PMC6964870 全文与 MDPI 第三方论文引述一致。eICU 的混淆可能来自"多中心 ICU 数据库"的粗略联想,以及部分教程把 eICU 当作本库"第三系统"的猜测(同样错误——C 是美国匿名系统且永不公开)。

1,552,210 patient-hours 的来源推定:该数出自 MDPI 2026 论文的摘要表述,与官方 Table 2 的 1,424,171 行相差约 12.8 万行;可能的成因是该文把隐匿测试集部分行数并入统计。条目处理方式:正文使用官方数,第三方数仅在 §4.5 存照并声明"以官方为准"。

§14 FAQ

Q1:数据怎么下载?多大?
约 42 MB 压缩包,三种方式:PhysioNet 直链、wget 递归镜像、AWS 开放桶(aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/)。见 §9.2。

Q2:需要签协议或受训吗?
不需要。CC BY 4.0 全开放,任何人可下载;仅需按官方要求引用论文与 DOI。

Q3:训练标签为什么"看起来提前 6 小时就变 1"?
因为 SepsisLabel 做了前移:t ≥ t_sepsis − 6 即为 1(见 §5.2)。这是任务设计而非标注错误——最低提前量要求在训练阶段即可监督。

Q4:测试集能拿到吗?
不能。C 系统与隐匿测试集永不公开,只存在于评分方环境中。这正是"跨系统泛化"结论可信的原因。

Q5:utility 负分是什么意思?
比"从不报警"(0 分基线)更差。前排队伍在 C 系统全部负分 = 换一家医院后,这些算法实际是净伤害(大量误报叠加致命漏报)。

Q6:HospAdmTime 为什么有负值?
先入 ICU 抢救、后补办入院登记的时间差(见 §4.3)。属正常数据现象,勿当脏数据清洗。

Q7:Age 有 100 是真的百岁老人吗?
90 岁以上统一记 100(去标识约束),不是真实年龄(见 §4.3)。

Q8:有哪些直接可用的评估工具?
官方 physionetchallenges/evaluation-2019(MATLAB + Python 双实现,结果一致);physionetchallenges 组织另有四语言示例预测框架。

Q9:现在做 sepsis 预警研究还该用它吗?
作为基准评测场依然标准(可复现、可对比历史方法);作为性能上限证据已不足(仅两中心训练)。现代研究通常用它做基准对照,另加多中心外部验证。

Q10:与 MIMIC-IV 什么关系?
无直接关系。A 集源自 MIMIC-III 时代的 BIDMC 记录加工;MIMIC-IV 是独立的后续版本数据湖,本库未随其更新(版本链仅 v1.0.0)。

Q11:可以用本库训练商用产品吗?
CC BY 4.0 允许商用,但须署名(引用论文与 DOI),且注意 utility 参数与标签口径的学术规范;隐匿测试集不可能获取,任何"在官方测试集上 X 分"的商用宣称都应警惕。

Q12:为什么我的复现分数和排行榜对不上?
先核对三件事:①是否用了官方 evaluate_sepsis_score(阈值扫描方式一致);②标签是否理解成前移 6 小时的版本;③utility 是否做了归一化(不归一化的 raw utility 与榜单数值不可比)。

Q13:B 集脓毒症率为什么比 A 集低这么多(5.7% vs 8.8%)?
两院患者构成与入院标准不同(B 为 Emory 大学医院成人 ICU 抽样)。这个落差正是基准刻意保留的"第一次分布冲击",复现论文应在 B 上观察到分数下降。

Q14:小时级阳性率 1.80% 和患者级 7.3% 哪个对?
都对,粒度不同:1.80% 是全部患者-小时中标签为 1 的比例(MDPI 第三方参考口径),7.3% 是患者级脓毒症比例(官方 2,932/40,336)。引用时注明粒度。

Q15:SepsisLabel=0 但患者最终确诊脓毒症,是标签错误吗?
不是。前移标签只在 t ≥ t_sepsis − 6 后翻转为 1;起病前 12 小时以外的时间步标签为 0 是设计行为(配合 utility 的提前量窗口评估)。

Q16:为什么 40,336 这个数在新闻里写作"40k patients"?
40,336 = A 20,336 + B 20,000,扩容发生在 2019-04-01(§2.2);早期新闻稿(02-06 启动时)只提到初始规模,引用时注意时间点。

Q17:训练集里能直接算出"提前 6 小时"的评估吗?
可以且应该:官方评估代码接受逐患者逐小时的预测分数,自行按 §6.2 参数算 utility;社区常用 A 集末段做本地验证、B 集做伪外推,最后仍以官方终评为准。

Q18:数据里有时间戳吗?
没有绝对时刻——只有 ICULOS(ICU 内相对小时序号)与 HospAdmTime(入院到入 ICU 的相对小时)。这是去标识设计的一部分,也意味着"季节性/昼夜节律"建模受限。

Q19:可以做多任务(如同时预测死亡)吗?
数据集本身只提供 SepsisLabel;但 ICULOS、Age、Unit 等字段允许构造辅助任务。注意任何衍生标签都须在论文中与本基准的官方口径区分。

Q20:别的综述为什么常写"eICU-based challenge"?
部分 2020 年后的教程把 CinC 2019 与使用 eICU 的后续研究(外部验证)混写。以官方论文为准:训练集只有 BIDMC 与 Emory 两个来源(§13 表第 2 条)。

Q21:星号条目和正式名次差在哪?
星号 = 非官方条目(未满足官方阶段全部规则,如提交配额/截止约束)。Meicheng Yang et al. 的 0.364 因此不占官方 Rank 1;官方榜原则是"规则完整性优先于分数"。

Q22:为什么标题里同时出现 BIDMC 和 MIMIC-III?
A 集抽取自 BIDMC 的 EHR(与 MIMIC-III 同院同源),但本库是独立加工的挑战赛数据集,不是 MIMIC-III 的子集发布;两者粒度、许可、访问方式均不同(§11.1 对照表)。

§15 术语表

术语 释义
Sepsis-3 2016 年脓毒症第三个国际共识定义:感染 + SOFA 上升 ≥2
SOFA Sequential Organ Failure Assessment,序贯器官衰竭评估评分
t_suspicion 疑似感染时点:IV 抗生素与血培养采样中较早者(含 24h/72h 配对约束)
t_sepsis 脓毒症起病锚点 = min(t_suspicion, t_SOFA),含 ±24h/12h 约束
utility 临床效用分数:提前 6-12h 真阳性 +1、误报 −0.05、漏报 −2、真阴性 0
U_normalized 归一化效用:(U − U_none)/(U_optimal − U_none);最优 1、全阴 0、负分为净伤害
dt_early / dt_optimal / dt_late utility 时间参数:−12h / −6h / +3h
.psv 管道分隔值文件(pipe-separated values),每患者一个,每行一小时
SepsisLabel 第 41 列二值标签,训练版已前移 6 小时
NaN 该小时无测量的缺失记号,不插值
entry 一次提交的算法/预测包;非官方阶段 5 次、官方 10 次、终评 1 次
hidden test set 隐匿测试集:A/B/C 三系统样本,22,761(CinC 版)/24,819(CCM 版)双口径
credentialed access PhysioNet 的受训访问机制(本库不采用,直接开放)
RRID Research Resource Identifier,本库 SCR_007345

| qSOFA | 床旁快速脓毒症筛查:呼吸频率≥22、收缩压≤100、意识改变三选二 |
| SIRS | 全身炎症反应综合征;脓毒症旧定义的核心,Sepsis-3 起被 SOFA 取代 |
| BIDMC | Beth Israel Deaconess Medical Center,A 集母院(波士顿) |
| Emory | Emory University Hospital,B 集来源(亚特兰大) |
| rough path / signature | 牛津冠军队使用的非规则时序特征数学工具 |
| LOINC | 实验室观测指标的国际标准编码;本库已合并多编码为单变量 |
| entries | 提交计数单位:853 总提交 / 430 有效 |
| lead-shift | 标签前移处理:SepsisLabel 在 t_sepsis−6h 即翻转为 1 |
| alarm fatigue | 警报疲劳:误报过多导致临床人员忽略警报的现象,utility 负项的现实依据 |
| distribution shift | 分布偏移:训练与部署数据的联合分布不一致;C 系统负分的直接成因 |

| v1.0.0 | 本资源唯一版本号,2019-08-05 发布后无修订 |
| SHA256SUMS.txt | 官方文件校验清单,镜像核对的最终依据 |
| hidden test set lead-shift | 隐匿侧标签同样前移 6h,与训练侧口径一致 |
| final normalized utility | 终评成绩:每队 1 entry 全集一次的归一化效用 |
| hackathon | 2019-09-08 新加坡赛前十小时的线下开发日活动 |
| SepsisLabel | 数据第 41 列,0/1 二值,见 §5.2 前移口径 |

| hidden window | 隐匿侧的小时窗,与公开侧同构,官方持有 |
| Emory BMI | Emory 大学生物医学信息系,本库牵头组织方 |
| UCSD | 加州大学圣迭戈分校,Nemati 任职机构,标注方法学承担方 |

附录 A 时间线大事记

2019-02-06/08   挑战赛启动(Moore Foundation / Google / MathWorks 赞助)
2019-02-08      非官方阶段开始,每队 5 次提交
2019-04-01      训练库扩展至 40,336 例
2019-04-10      官页口径的非官方常规截止(23:59 GMT)
2019-04-19      论文口径的非官方阶段结束(扩展期)
2019-04-22/25   官方阶段开始,每队 10 次,云评分上线
2019-08-05      PhysioNet v1.0.0 资源页发布
2019-08-25      提交全部截止(noon GMT)
2019-09-08      新加坡 hackathon
2019-09-09/11   CinC 大会(新加坡)
2019-09-17      官方结果公布
2019-09         CinC 会议版论文(9 人含 Seyedi,测试集 22,761)
2019-10-14      CCM manuscript 落款
2019-11-10      evaluation-2019 仓库最后 commit
2020-01-15      CCM 期刊版刊出 48(2):210-217(8 人无 Seyedi,测试集 24,819)
2022-02-04      sources/ 打包收录全部参赛代码

附录 B 双口径存照清单

  1. 隐匿测试集规模:CinC 会议版 22,761 vs CCM 期刊版 24,819——成稿以期刊版为权威、会议版注明。
  2. CCM 年份:官页引用 “(2019)”(in-press 口径)vs PMC “2020 Jan 15;48(2):210-217”。
  3. 非官方阶段截止:官页新闻 2019-04-10 23:59 GMT vs CCM 论文 19 April。
  4. 作者名单:CinC 版 9 人含 Salman Seyedi vs CCM 版 8 人无 Seyedi。
  5. 总行数:官方 Table 2 合计 1,424,171 行 vs MDPI 第三方 “1,552,210 patient-hours”——以官方为准。
  6. hospital system C:永久匿名(“a third, unidentified hospital system”,美国第三系统),禁止猜测。
  7. utility 参数来源:CCM 论文正文 + Fig.4(官方图形)与参赛镜像代码互证;官方仓库 raw 直抓因沙箱 SSL 受限未成,风险低。
  8. evaluation-2019 仓库 LICENSE 具体类型:待核(示例预测代码仓库为 BSD-2-Clause,勿与数据集 CC BY 4.0 混淆)。

附录 C 互链点速查(rid)

mimic-iii(106)|mimiciii(590)|eicu-crd(552)|eicu-collaborative(9)|chest-ct-sepsis-er(600)|cinc-2021(644)|cinc-2015(487)|cinc-2018-sleep(493)|physionet-cinc-2016(382)|physionet-cinc-2017(162)|cinc-2023(499)|amsterdamumcdb(6)|hirid(7)


存照声明:本条目由 agentB-cinc2019 于 2026-09-27 撰写,硬数字与双口径以同目录 FACTS.md(84 行事实档案)为唯一事实源;写作期间同名代理并发会话多次覆盖成稿与 /tmp 临时文件(含本次恢复前成稿被清空为 0 字节事故),本版为按 FACTS 重建的恢复版,全部硬数字(40,336 / 20,336 / 20,000 / 1,790 / 1,142 / 2,932 / 739,663 / 684,508 / 1,424,171 / 10,486,913 / 22,761 / 24,819 / 104 队 853 entries / 430 entries / 90 篇 / 0.360 / 0.364* / utility 参数组 / CC BY 4.0 / v1.0.0)与 FACTS.md 逐项一致。

附录 D 引用格式

数据资源引用:

@dataset{reyna_2019_challenge,
  author = {Reyna, Matthew A. and Josef, Chris and Jeter, Russell and
            Shashikumar, Supreeth P. and Westover, M. Brandon and
            Nemati, Shamim and Clifford, Gari D. and Sharma, Ashish},
  title  = {Early Prediction of Sepsis from Clinical Data:
            The PhysioNet/Computing in Cardiology Challenge 2019},
  year   = {2019},
  doi    = {10.13026/v64v-d857},
  url    = {https://physionet.org/content/challenge-2019/1.0.0/}
}

方法学论文引用(权威口径):

@article{reyna2020early,
  author  = {Reyna, Matthew A. and Josef, Chris S. and Jeter, Russell and
             Shashikumar, Supreeth P. and Westover, M. Brandon and
             Nemati, Shamim and Clifford, Gari D. and Sharma, Ashish},
  title   = {Early Prediction of Sepsis from Clinical Data:
             the PhysioNet/Computing in Cardiology Challenge 2019},
  journal = {Critical Care Medicine},
  volume  = {48},
  number  = {2},
  pages   = {210--217},
  year    = {2020},
  doi     = {10.1097/CCM.0000000000004145}
}

注:会议版(9 人含 Seyedi,DOI 10.22489/CinC.2019.412)引用格式见 §2.1;两版作者名单差异见 §13 第 5 条。

附录 E 条目自查清单(审稿口径)

  • [x] 全称、届数(第 20 届)、本质定位与 FACTS.md §1 一致
  • [x] 双论文口径(9 人/8 人、22,761/24,819、2019/2020-01-15)三项并存
  • [x] 时间线七节点(02-06/08、04-10/19、04-01、04-22/25、08-05、08-25、09-08/09-11/09-17)无遗漏
  • [x] Table 2 硬数字九项(20,336/20,000/1,790/1,142/739,663/684,508/1,424,171/10,486,913/密度 20.6%·19.1%)逐项核对
  • [x] 41 列 = 8 + 26 + 6 + 1;Age 90+ 记 100;HospAdmTime 可负
  • [x] 任务约束(提前 6-12h)、标签前移 6h、Sepsis-3 三时点
  • [x] utility 七参数与归一化公式
  • [x] 参赛规模(104 队 853 entries、88 队 430 entries、90 篇)
  • [x] 优胜榜前五 + 星号条目,C 系统全负
  • [x] license(CC BY 4.0)、版本链(仅 v1.0.0)、DOI 与 RRID
  • [x] 证伪记录(四库来源说、eICU 说、1,552,210 说)
  • [x] 互链 rid 十三项齐备

附录 F 复现速查(五步)

  1. aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/ training/(或 §9.2 其余两种方式)。
  2. 核对 SHA256SUMS.txt。
  3. 读任一 .psv 验证 41 列结构(§4.3)。
  4. 用 evaluation-2019 的 evaluate_sepsis_score.py 包装自己的预测,验证 utility 与全阴性基线 0。
  5. 与官方排行榜对照:A/B 上 0.40+ 属正常水平;勿期望在 C 系统复现正分(官方前排亦为负)。

附录 G 与库内 cinc 系列条目的横向对照

条目 年份 模态 核心创新 许可
cinc-2015(487) 2015 手术室生理信号 提前量奖励首秀 开放
physionet-cinc-2016(382) 2016 心音 噪声鲁棒分类 开放
physionet-cinc-2017(162) 2017 单导联 ECG 房颤/正常/噪声三分类 开放
cinc-2018-sleep(493) 2018 多导睡眠图 睡眠分期 开放
cinc-2019(本条目) 2019 小时级 EHR Sepsis-3 标签 + utility 函数 CC BY 4.0
cinc-2021(644) 2021 12 导联 ECG 降导联泛化 + 部分得分 CC BY 4.0
cinc-2023(499) 2023 环境音 音频健康事件 开放

谱系结论:cinc-2019 是系列中唯一以 EHR 表格时序 + 临床结局预测 为题的届次,也是 utility 函数最完整的实现——后续各届的部分得分制均可视为其思想的变体。

附录 H 关键数字一页卡(终稿对账)

公开训练患者        40,336   = A 20,336 + B 20,000
  A = BIDMC         20,336 例 / 脓毒症 1,790(8.8%)/ 739,663 行 /
                    5,536,849 非空点 / 密度 20.6%
  B = Emory         20,000 例 / 脓毒症 1,142(5.7%)/ 684,508 行 /
                    4,950,064 非空点 / 密度 19.1%
合计                脓毒症 2,932(≈7.3%)/ 1,424,171 行 / 10,486,913 非空点
隐匿测试            22,761(CinC 会议版)/ 24,819(CCM 期刊版,权威)
全库口径            over 2.5M hourly windows / over 15M data points / 42 MB
列结构              41 = 8 生命体征 + 26 实验室 + 6 人口学 + SepsisLabel
任务                提前 6-12h 因果预测;SepsisLabel 前移 6h
utility 参数        dt_early=-12 dt_optimal=-6 dt_late=+3
                    max_u_tp=1 min_u_fn=-2 u_fp=-0.05 u_tn=0
参赛规模            104 队 853 entries / 88 队 430 entries / 90 篇摘要
冠军                Morrill et al. 0.360(A 0.433 / B 0.434 / C −0.123)
星号最高            Meicheng Yang et al. 0.364(C −0.048)
关键泛化事实        前排全部 C 系统负分(−0.042 至 −0.156)
许可与版本          CC BY 4.0 / 仅 v1.0.0(2019-08-05)
DOI/RRID            10.13026/v64v-d857(v1.0.0)/ 0y7p-s471(latest)/ SCR_007345
论文                CCM 2020;48(2):210-217(8 人)/ CinC 2019(9 人含 Seyedi)
组织方              Emory BMI 牵头 + Georgia Tech + MIT LCP + MGH + UCSD

附录 I 最小读取示例(.psv → DataFrame)

import pandas as pd
from pathlib import Path

# 单个患者:41 列,每行 = ICU 第 ICULOS 小时,缺失为 NaN
df = pd.read_csv("training/training_setA/p00101.psv", sep="|")
print(df.shape)          # (小时数, 41)
print(df.columns.tolist())
# ['HR', 'O2Sat', 'Temp', 'SBP', 'MAP', 'DBP', 'Resp', 'EtCO2',
#  'BaseExcess', ..., 'Platelets', 'Age', 'Gender', 'Unit1', 'Unit2',
#  'HospAdmTime', 'ICULOS', 'SepsisLabel']

# 全库装载(A+B,40,336 个 .psv)
files = sorted(Path("training").rglob("*.psv"))
assert len(files) == 20336 + 20000          # 40,336
total_rows = 0
for f in files:
    total_rows += sum(1 for _ in open(f)) - 1  # 减表头
assert total_rows == 739663 + 684508        # 1,424,171

# 标签口径自检:SepsisLabel=1 的行应满足"前移 6h"结构
# (患者级核对:septic 患者 t >= t_sepsis-6 起 label=1)

提示:以上断言数字即 §4.1 硬数字,装载后先跑断言再建模,可拦截一切文件错位/镜像漂移问题。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • cinc-2012 — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 挑战赛数据集 / 评测基准
  • mimic-iii — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 评测基准
  • clif — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 评测基准
  • ehrshot — 共享标签:电子健康记录 / 时序数据 / 评测基准
  • hirid — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • eicu-collaborative — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • mimic-iv-ed — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • mimic-iv-ed — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • mimic-iv-clinical-database — 共享标签:电子健康记录 / 重症监护 / 时序数据
  • amsterdamumcdb — 共享标签:电子健康记录 / 重症监护 / 时序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集