信息速览
CINC-2019 — PhysioNet/CinC Challenge 2019:从临床数据早期预测脓毒症
条目身份:本条目为"千方病案医数集"AI-Ready Wikipedia 系列第 cinc-2019 号,讲述 2019 年第 20 届 PhysioNet/Computing in Cardiology Challenge——迄今临床机器学习领域被引用最多的脓毒症早期预测公开基准。全称 Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019(从临床数据早期预测脓毒症)。数据与全部事实以官方论文(CCM 期刊版为权威口径、CinC 会议版并注)与 PhysioNet 资源页为准,双口径数字均在文中如实并存。
§0 导读:这个数据集解决什么问题
0.1 问题背景:脓毒症预警缺一个"可复现评测场"
脓毒症(sepsis)是全球 ICU 头号可治性急症,Sepsis-3 共识(2016)重新定义之后,临床界最缺的不是又一个单中心预警模型,而是一个可复现的早期预警算法评测场:同一批数据、同一套标签、同一个评分函数,让不同算法的分数真正可比。此前的困境是三重的——各家医院 EHR 数据方言互不兼容(不可比)、标签口径各自为政(不可信)、没有官方隐匿测试(不公平)。2019 年第 20 届 PhysioNet/CinC Challenge 对这三个空档给出了直接回应,其产物就是本条目记录的 cinc-2019 基准:迄今临床机器学习领域被引用最多的脓毒症早期预测公开数据集。
0.2 四层回答:数据、任务、评分、防作弊
CinC 2019 的回答分四层。数据层:三个美国医院系统统一加工为"每小时一行"的时序格式——A 集 BIDMC 20,336 例 + B 集 Emory 20,000 例(合计 40,336 例、1,424,171 行)全部公开,第三美国系统 C 仅作隐匿测试。任务层:因果约束的每小时风险预测,SepsisLabel 按 Sepsis-3 口径前移 6 小时,逼算法"提前预警"而非"事后诸葛"。评分层:归一化临床效用 utility——提前 6 小时报警满分、漏报 −2、误报 −0.05,把"早"与"准"的权衡显式编码进分数。防作弊层:训练全公开、测试全隐匿、官方只跑一次,杜绝公开榜过拟合。
成绩单同样重要:冠军 Morrill et al.(牛津系)final normalized utility 0.360(CinC 会议版口径;CCM 期刊版 0.364*),而所有前排队伍在隐匿 C 系统上全部转为负分(−0.042 至 −0.156)——跨医院泛化崩塌是该基准留给后续研究最重要的教训。
0.3 DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 9 | PhysioNet 官方目录 + 独立 DOI(10.13026/v64v-d857)+ 高引论文锚定;"PhysioNet Challenge 2019 / sepsis"检索直达 |
| A 可获取性 | 9 | CC BY 4.0 无门禁、无注册、直链下载;扣 1 分:C 系统隐匿测试集不可得(结构性限制而非管理缺陷) |
| I 可互操作 | 8 | 统一 .psv 管道分隔格式、41 列全库对齐、官方评分代码开源;缺失即 NaN 的约定干净利落 |
| M 元数据质量 | 7 | 三层官方文档(PhysioNet 内容页 + 项目页 + CCM/CinC 论文);扣分:隐匿测试规模双口径(22,761 vs 24,819)、人口学仅 6 列且 Unit1/Unit2 为假名化编码 |
| S 可持续性 | 9 | PhysioNet/MIT LCP 长期托管(RRID: SCR_007345),v1.0.0 一版稳定,挑战赛系列持续运营 |
| 综合评级 | 8.4/10(高) | 开放性与格式规范性接近满档;失分集中在隐匿集不可得与人口学稀薄,均属任务设计取舍 |
0.4 实操八大坑点速览
用这份表免踩坑,逐条展开见正文相应小节:
- 坑点 1(标签前移):SepsisLabel 第 t 行 = 1 表示 t 至 t+6 小时内起病。直接拿第 t 行特征预测第 t 行标签 = 用未来信息;要评估"提前 6 小时预警",须把标签再回移 6 小时。
- 坑点 2(测试集双口径):隐匿测试集 22,761 例(CinC 会议版)/ 24,819 例(CCM 期刊版)双口径并存,引用时任选其一并注明出处;C 系统数据永不公开,别把它写进"可下载数据"清单。
- 坑点 3(HospAdmTime 为负):该列是相对 ICU 入住时刻的小时偏移,恒为负值或零,不是"住院时长",别当特征直读成时间量。
- 坑点 4(Unit1/Unit2 假名化):两列是 eICU 的双单元假名编码(0/1/NaN),不是床位号,也不能跨医院比较"单元"含义。
- 坑点 5(NaN ≠ 0):全库 1,424,171 行 × 40 变量仅 10,486,913 个非空观测(约 17.9%)。把 NaN 补 0 会把"没测过"变成"测了正常",制造大量假正常值——缺失模式本身是信号(§12.4)。
- 坑点 6(公开集成绩 ≠ 泛化成绩):前排队伍在公开 A/B 系统 utility 0.40+,隐匿 C 系统全员负分(−0.042 至 −0.156)。在 A/B 上交叉验证调出的模型,别宣传成"跨医院可用"。
- 坑点 7(utility ≠ AUROC):主指标是归一化临床效用 utility(满分 = 提前 6 小时全对),冠军 0.360(CCM 口径 0.364*);它与 AUROC 数值不可换算、不可混写,负分是常态而非错误。
- 坑点 8(文件数与行数对账):40,336 个 .psv 文件(20,336 + 20,000),总行数 1,424,171(739,663 + 684,508);患者文件编号不连续,装载后先跑 §附录 I 的断言再建模。
§0 读法三则:
- 本条目记的是"挑战赛数据集 + 任务 + 评分"三位一体:训练用 A/B 两系统的 .psv 原始文件在 PhysioNet 直链下载;C 系统只存在于官方隐匿评估,任何第三方"C 系统数据"都非官方。
- 全文硬数字以官方两版论文互证(CCM 期刊版为权威口径、CinC 会议版并注),双口径逐条存照于附录 B;隐匿测试集 22,761/24,819 与冠军分 0.360/0.364* 是最常被混写的两处。
- 检索时注意:本条目 url_name 为
cinc-2019,与库内 2015/2017/2021 等各届挑战赛条目同系列横链(§10.1);"PhysioNet Challenge 2019""CinC Challenge 2019""Sepsis Challenge"指同一赛事。
§1 一句话档案与身份速览
| 字段 | 内容 |
|---|---|
| 短名 | cinc-2019 |
| 全称 | Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019(从临床数据早期预测脓毒症:2019 年 PhysioNet/Computing in Cardiology 挑战赛) |
| 本质 | ICU 每小时时序临床数据 + Sepsis-3 脓毒症标签的公开基准挑战赛数据集(第 20 届挑战赛) |
| 数据来源 | 三个美国医院系统抽取并统一加工:A=BIDMC、B=Emory University Hospital、C=匿名第三美国系统 |
| 规模 | 公开训练 40,336 例(A 20,336 + B 20,000);隐匿测试 22,761(CinC 会议版)/24,819(CCM 期刊版)双口径;CCM 摘要口径 “over 60,000 ICU patients” |
| 粒度 | 每患者一个 .psv 文件,每行 = ICU 住院 1 小时;41 列 = 40 个临床变量 + SepsisLabel |
| 任务 | 因果(仅用当前与过去数据)输出每小时 sepsis 风险值,要求提前 6-12 小时预警 |
| 主指标 | 归一化临床效用 utility(AUROC/AUPRC/Accuracy/F-measure 并列输出) |
| 冠军 | Morrill et al.(牛津系)0.360 final normalized utility |
| 许可 | CC BY 4.0(开放获取,无 credentialed 门槛) |
| 版本 | 仅 v1.0.0(2019-08-05 发布)一版,无后续修订 |
| DOI | 10.13026/v64v-d857(v1.0.0)/10.13026/0y7p-s471(latest);RRID: SCR_007345 |
| 官方资源 | physionet.org/content/challenge-2019/1.0.0/ |
| 组织方 | Emory 大学 BMI 系牵头 + Georgia Tech + MIT LCP + MGH + UC San Diego |
1.1 为什么这个基准重要
2016 年 Sepsis-3 共识重新定义脓毒症之后,临床界最缺的是"可复现的早期预警算法评测场"。CinC Challenge 2019 把这件事做成了三件套:
- 统一粒度的真实 EHR:把三套异构电子病历压缩成同一个"每小时一行"的时序格式,41 列对齐,缺失记 NaN——算法不必再处理各家医院的数据方言。
- 因果约束的预测任务:只允许使用当前小时及之前的数据,杜绝"用未来信息预报过去"的作弊。
- 临床效用而非统计指标:主评分是 utility 函数——提前 6 小时报警满分、漏报重罚 −2、误报轻罚 −0.05,把"早报"与"少误报"的权衡显式编码进分数。
结果也极具警示性:所有前排队伍在公开训练系统(A/B)上 utility 都能冲到 0.40 以上,但在隐匿的第三系统 C 上全部转为负分(−0.042 至 −0.156)——跨医院泛化崩塌成为该基准留给后续研究最重要的教训。
1.2 条目导览
- §2 论文双口径与时间线
- §3 机构、人物与参赛规模
- §4 数据构成与硬数字(Table 2 官方口径)
- §5 任务定义、Sepsis-3 标注与防作弊
- §6 评估体系与 utility 函数
- §7 竞赛结果与完整优胜榜
- §8 核心发现:跨系统泛化崩塌
- §9 license、获取方式与版本链
- §10 生态:互链数据集、HF/GitHub 资源
- §11 相关数据集对比与证伪记录
- §12 方法学启示
- §13 常见误解澄清
- §14 FAQ
- §15 术语表
- 附录 A 时间线大事记/附录 B 双口径存照清单
1.5 "第 20 届"的语境
Computing in Cardiology(原 Computers in Cardiology)自 1974 年起每年一届,2019 年恰是第 20 届 PhysioNet/Computing in Cardiology Challenge。届次语境中的位置:
- PhysioNet Challenges 从 2000 年(第 1 届)的信号处理主题起步,2010 年代逐步转向临床结局预测;
- 2019 届是第二届以"患者结局"为核心任务的届次(前一届 2018 届为 ICU 死亡率预测,题库 physionet 2018);
- 2019 届的 Sepsis-3 标签 + utility 双件套使其成为系列中"临床决策支持"定位最纯的一届;
- 大会于 2019-09-09/11 在新加坡举行,是该系列首次在东南亚举办。
§2 论文双口径与时间线
1.3 数据卡片速览(机器可读口径)
dataset: cinc-2019
full_name: "Early Prediction of Sepsis from Clinical Data: The PhysioNet/Computing in Cardiology Challenge 2019"
edition: 20
year: 2019
modality: [EHR 时序, 每小时分箱]
train_patients: 40336 # A 20336 + B 20000
septic_patients: 2932 # 1790 + 1142
rows_public: 1424171 # 739663 + 684508
nonnull_points_public: 10486913
hidden_test_patients: "22761 (CinC) / 24819 (CCM)"
columns: 41 # 8 vitals + 26 labs + 6 demographics + SepsisLabel
label: Sepsis-3, lead-shifted 6h
task: "early prediction, 6-12h lead, causal"
metric: normalized utility # 主指标
license: CC-BY-4.0
version: 1.0.0
doi: 10.13026/v64v-d857
rrid: SCR_007345
organizers: [Emory BMI, Georgia Tech, MIT LCP, MGH, UCSD]
winner: "Morrill et al., 0.360"
1.4 阅读指南
- 赶时间:读 §1 表格 + §4.1 一张表 + §8.1 一张表即可获得全部核心数字。
- 做研究:§5(任务与标签)+ §6(评分)是复现必读;附录 D 提供现成 BibTeX。
- 引用口径:任何数字先对照附录 B 双口径清单,避免混用两版论文的口径。
- 数据工程:§4.3 的 41 列定义与 §9.4 文件树是解析 .psv 的速查页。
2.1 两版官方论文(双口径存照)
本数据集有两版官方论文,数字与作者名单存在系统性差异,引用时必须区分:
(1)CinC 会议版(2019 年 9 月)
- 标题:Computing in Cardiology 2019
- 作者:Reyna MA, Josef C, Seyedi S, Jeter R, Shashikumar SP, Westover MB, Sharma A, Nemati S, Clifford GD(9 人,含 Salman Seyedi)
- DOI:10.22489/CinC.2019.412
- 篇幅:2 页会议论文
- 数字口径:隐匿测试集 22,761 例
(2)CCM 期刊版(权威口径)
- 标题:Early Prediction of Sepsis from Clinical Data: the PhysioNet/Computing in Cardiology Challenge 2019
- 期刊:Critical Care Medicine. 2020 Jan 15;48(2):210-217. doi: 10.1097/CCM.0000000000004145(PMC6964870)
- 作者:Reyna MA, Josef CS, Jeter R, Shashikumar SP, Westover MB, Nemati S, Clifford GD, Sharma A(8 人,无 Seyedi)
- manuscript 落款:14 October 2019
- 数字口径:隐匿测试集 24,819 例(覆盖 A、B、C 三系统)
(3)年份双口径:PhysioNet 官页引用栏写作 “Critical Care Medicine 48 2: 210-217 (2019)”——in-press 年份口径;PMC 记录的正式刊出日期为 2020 Jan 15。两口径并存,条目以期刊版为权威、会议版注明。
(4)作者名单差异:会议版 9 人含 Salman Seyedi,期刊版 8 人无 Seyedi——引用时按所用版本如实标注。
2.2 时间线(含双截止日期口径)
| 日期 | 事件 |
|---|---|
| 2019-02-06/08 | 挑战赛正式启动(官方新闻稿 2019-02-06,论文口径 02-08) |
| 2019-02-08 → 04-19 | 非官方阶段:每队 5 次 提交机会;截止日期双口径——官页新闻载常规截止 2019-04-10 23:59 GMT,CCM 论文载 19 April(论文以扩展期收尾) |
| 2019-04-01 | 扩展训练库至 40,336 例 |
| 2019-04-22/25 | 官方阶段开始:每队 10 次 提交,启用新云评分系统 |
| 2019-08-05 | v1.0.0 资源页在 PhysioNet 发布 |
| 2019-08-25 noon GMT | 全部提交截止 |
| 2019-09-08 | 新加坡 hackathon |
| 2019-09-09/11 | Computing in Cardiology 大会(新加坡)现场决出名次 |
| 2019-09-17 | 官方结果公布 |
| 2019-09 | CinC 会议版论文发表 |
| 2019-11-10 | 官方评估仓库 evaluation-2019 最后 commit |
| 2020-01-15 | CCM 期刊版正式刊出 |
| 2022-02-04 | PhysioNet sources/ 打包收录全部参赛队伍代码 zip |
2.3 资助方
- 主赞助:Gordon and Betty Moore Foundation、Google、MathWorks
- NIH 资助:U24EB037545、R01EB030362、R01GM104987、U24CA215109(NCI 支持云评分系统)、UL1TR002378
§3 机构、人物与参赛规模
3.1 组织方
数据集由 Emory 大学生物医学信息系(Department of Biomedical Informatics)牵头,联合:
- Georgia Tech(与 Emory 共享生物医学工程系)
- MIT Laboratory for Computational Physiology(PhysioNet 的维护方)
- Massachusetts General Hospital(MGH)
- UC San Diego
这一"临床信息学 + 信号处理 + 重症医学"的组合正是 PhysioNet 系列挑战赛的常设班底。
3.2 核心作者与角色
| 人物 | 机构 | 角色 |
|---|---|---|
| Matthew A. Reyna | Emory | 通讯作者(matthew.a.reyna@emory.edu),评估仓库作者 |
| Chris Josef | Emory | 数据管线与论文共同作者 |
| Russell Jeter | Emory/MIT LCP | 数据工程 |
| Supreeth P. Shashikumar | Georgia Tech/UCSD | Sepsis-3 标注与算法侧 |
| M. Brandon Westover | MGH | 临床顾问(神经重症) |
| Benjamin Moody | MIT LCP | 资源共同作者(PhysioNet 侧) |
| Ashish Sharma | Emory | 竞赛运营与评分 |
| Shamim Nemati | UCSD/Emory | Sepsis-3 标注方法论 |
| Gari D. Clifford | Emory/Georgia Tech | 资深作者(与 Nemati 同等贡献) |
| Salman Seyedi | — | 仅见于 CinC 会议版作者名单 |
3.3 参赛规模(官方阶段)
- 104 队 注册并提交 853 entries
- 88 队、430 entries 评分成功(其余因格式/规则问题不计分)
- 90 篇 参赛摘要被 CinC 2019 大会接收
- 非官方阶段每队 5 次提交、官方阶段 10 次;终评每队仅 1 个 entry 在全集上跑一次
3.4 优胜榜完整表(论文 Table 1/3,final normalized utility)
| 名次 | 队伍(成员) | Final | Sys A | Sys B | Sys C |
|---|---|---|---|---|---|
| 1 | Morrill et al.(James Morrill, Andrey Kormilitzin, Alejo Nevado-Holgado, Sumanth Swaminathan, Sam Howison, Terry Lyons——牛津系) | 0.360 | 0.433 | 0.434 | −0.123 |
| 2 | John Anda Du, Nadi Sadr, Philip de Chazal | 0.345 | — | — | −0.042 |
| 3 | Morteza Zabihi, Serkan Kiranyaz, Moncef Gabbouj | 0.339 | — | — | −0.146 |
| 4 | Xiang Li, Yanni Kang, Xiaoyu Jia, Junmei Wang, Guotong Xie | 0.337 | — | — | −0.156 |
| 5 | Janmajay Singh, Kentaro Oshiro, Raghava Krishnan, Masahiro Sato, Tomoko Ohkuma, Noriji Kato | 0.337 | — | — | −0.094 |
| * | *(最高分非官方条目)Meicheng Yang, Hongxiang Gao, Xingyao Wang, Yuwen Li, Jianqing Li, Chengyu Liu(南京航空/南京鼓楼系) | 0.364 | 0.430 | 0.422 | −0.048 |
注:带 * 号行为非官方条目的最高分(0.364,高于官方冠军 0.360),官方排行榜中星号标注表示其未满足官方阶段全部规则(如提交次数/截止约束),不计入官方名次。CinC 版论文 Table 1 与 CCM 版 Table 3 的名次口径一致。
3.5 两版论文逐项对照表
| 对照项 | CinC 会议版 | CCM 期刊版(权威) |
|---|---|---|
| 发表载体 | Computing in Cardiology 2019 论文集 | Critical Care Medicine |
| 发表时间 | 2019 年 9 月 | 2020 Jan 15(官页引用口径作 2019) |
| DOI | 10.22489/CinC.2019.412 | 10.1097/CCM.0000000000004145 |
| PMC 号 | — | PMC6964870 |
| 篇幅 | 2 页 | 8 页(48(2):210-217) |
| 作者人数 | 9 人 | 8 人 |
| Seyedi S. | 有(第 3 作者) | 无 |
| 隐匿测试集 | 22,761 例 | 24,819 例 |
| manuscript 落款 | — | 14 October 2019 |
| 表格口径 | Table 1(名次) | Table 2(数据规模)/Table 3(名次) |
引用建议:方法学叙述引 CCM 期刊版;提及 2019 年 9 月大会现场赛况引 CinC 会议版;两版数字并存时须显式注明版本。
3.6 组织方机构速写
- Emory University(牵头):亚特兰大,生物医学信息系(BMI)承担数据管线、标注与竞赛运营;B 集即来自其附属医院 Emory University Hospital。
- Georgia Tech:与 Emory 共享 Wallace H. Coulter 生物医学工程系,提供算法与工程支持。
- MIT LCP:麻省理工计算生理学实验室,PhysioNet 平台的维护方;Benjamin Moody 代表实验室参与资源建设。
- MGH:麻省总医院,M. Brandon Westover 提供重症临床视角(神经重症方向)。
- UC San Diego:Shamim Nemati 主导 Sepsis-3 标注实现与医院间泛化分析。
五方组合覆盖了"数据工程 → 标注方法学 → 临床解释 → 平台发布"全链条,是 Challenge 2019 能在 7 个月内完成从启动到出结果的供给侧原因。
3.7 时间线叙述(双截止日期口径的由来)
官方新闻稿宣布非官方阶段于 2019 年 4 月 10 日 23:59 GMT 截止;但 CCM 论文正文把非官方阶段写到 4 月 19 日。合理解释是:4 月 10 日为常规提交截止,随后约一周为扩展/补交窗口(与 4 月 1 日训练库扩至 40,336 例的更新配套),论文按最终收尾日期记述。两个日期均如实并存,引用时写"2019 年 4 月上旬(官页口径 04-10 23:59 GMT;论文口径 04-19)"即可。
官方阶段原计划 4 月 22 日启动云评分,实际文档口径 4 月 25 日前完成切换——论文以 04-22/25 区间记述,属发布节奏差异而非矛盾。
3.8 参赛规模的口径细节
- “104 队 853 entries” 指官方阶段注册并提交的队伍与提交总次数;其中 88 队的 430 个 entries 通过了格式与规则审查、进入有效评分。
- 853 与 430 的差额由三类损耗构成:提交格式不符合规范(缺列/超时/算法崩溃)、违反提交次数上限、独立性审计未通过的重复参赛。
- "90 篇摘要"是 CinC 2019 大会接收的参赛方法学论文数——多数有效队伍至少提交一篇,另有部分队伍联名或跨队合作。
- 非官方阶段的参与规模官方未给全量口径,仅排行榜存档(2019-05-02 快照)可考。
3.9 榜单上的地域与技术流派分布(基于优胜榜与摘要集的可考信息)
- 欧洲学术派:冠军 Morrill et al. 来自牛津(数学建模传统,Terry Lyons 的 rough path 理论落地);Rank 3 Zabihi et al. 来自坦佩雷系(芬兰,信号处理传统)。
- 亚太工程派:Rank 4 Xiang Li et al. 与星号条目 Meicheng Yang et al. 均来自中国团队(深度学习工程化见长);Rank 5 Singh et al. 为日本产业技术综合系。
- 澳洲与大洋洲:Rank 2 de Chazal 系(悉尼)。
- 分布本身说明:脓毒症预警是当时全球 ICU 工程化的共同热点,单一基准能把四大洲队伍拉到同一把 utility 尺子下。
§4 数据构成与硬数字(CCM Table 2 官方口径)
4.1 公开训练集构成
| 指标 | 训练集 A(BIDMC) | 训练集 B(Emory) | 合计 |
|---|---|---|---|
| 患者数 | 20,336 | 20,000 | 40,336 |
| 脓毒症患者 | 1,790(8.8%) | 1,142(5.7%) | 2,932(≈7.3%) |
| 数据行数(患者-小时) | 739,663 | 684,508 | 1,424,171 |
| 非空数据点 | 5,536,849 | 4,950,064 | 10,486,913 |
| 测量密度 | 20.6% | 19.1% | — |
- 训练集 A = Beth Israel Deaconess Medical Center(BIDMC,波士顿):MIMIC-III 的母院,ICU 电子病历抽取。
- 训练集 B = Emory University Hospital(亚特兰大):与 A 独立的第二套 EHR 系统。
- 隐匿测试集覆盖 A、B、C 三个系统,其中 C 为匿名美国第三医院系统,训练阶段不可见。
- 全库合计 over 2.5 million hourly time windows、over 15 million data points(含隐匿部分);公开训练库压缩包 42 MB。
- CCM 摘要总口径:“over 60,000 ICU patients”。
合计行的三重含义:
- 40,336 不是凑整的"约 4 万"——精确到个位的患者数意味着官方对去重/去损有严格定义(每患者一个 .psv 文件即一个计数单元)。
- 1,424,171 行与"患者-小时"一一对应,是全部后续统计(密度、阳性率、非空点)的分母基准。
- 8.8% → 5.7% 的患病率落差发生在两个公开系统之间——参赛者在非官方阶段就能直接感受到分布冲击,这是基准刻意安排的"泛化预科"。
4.2 隐匿测试集规模(双口径存照)
- CinC 会议版:22,761 例
- CCM 期刊版(权威):24,819 例
- 两数并存的原因是投稿时间差与最终入库例数差异;条目引用时以期刊版为权威、会议版注明。
4.3 文件格式与 41 列定义
每名患者一个管道分隔的 .psv 文件(如 training/p00101.psv),每行 = ICU 住院 1 小时,41 列 = 40 个临床变量 + SepsisLabel,缺失小时无测量记 NaN:
8 项生命体征:
| # | 变量 | 说明 |
|---|---|---|
| 1 | HR | 心率(次/分) |
| 2 | O2Sat | 血氧饱和度(%) |
| 3 | Temp | 体温(°C) |
| 4 | SBP | 收缩压(mmHg) |
| 5 | MAP | 平均动脉压(mmHg) |
| 6 | DBP | 舒张压(mmHg) |
| 7 | Resp | 呼吸频率(次/分) |
| 8 | EtCO2 | 呼气末二氧化碳(mmHg) |
26 项实验室检验(Lab):BaseExcess、HCO3、FiO2、pH、PaCO2、SaO2、AST、BUN、Alkalinephos、Calcium、Chloride、Creatinine、Bilirubin_direct、Glucose、Lactate、Magnesium、Phosphate、Potassium、Bilirubin_total、TroponinI、Hct、Hgb、PTT、WBC、Fibrinogen、Platelets——同一指标多 LOINC 编码已合并为单变量。
6 项人口学/管理字段:
| # | 变量 | 说明 |
|---|---|---|
| 35 | Age | 年龄;90 岁以上统一记 100(去标识约束) |
| 36 | Gender | 性别(0/1) |
| 37 | Unit1 | ICU 类型(MICU/SICU 编码,部分系统缺失) |
| 38 | Unit2 | ICU 第二类型标志 |
| 39 | HospAdmTime | 入院到入 ICU 的小时数;可为负值(先入 ICU 抢救、后补办入院登记) |
| 40 | ICULOS | ICU 住院时长序号(第几小时) |
第 41 列 SepsisLabel:二值标签(0/1),实现方式见 §5.2。
4.3.1 八项生命体征速查(临床含义)
| 变量 | 单位 | 临床含义 | 典型采集频率 |
|---|---|---|---|
| HR | bpm | 心率,脓毒症全身炎症反应的最早体征之一 | 监护仪连续,分箱后每小时 |
| O2Sat | % | 血氧饱和度,组织灌注与呼吸代偿指标 | 监护仪连续 |
| Temp | °C | 体温,发热/低体温是感染的核心信号 | 护理记录,每日 4-8 次 |
| SBP | mmHg | 收缩压,循环衰竭监测 | 监护仪/NIBP 周期测量 |
| MAP | mmHg | 平均动脉压,器官灌注的直接驱动压 | 由 SBP/DBP 计算或动脉导管 |
| DBP | mmHg | 舒张压 | 同 SBP |
| Resp | /min | 呼吸频率,SIRS/qSOFA 计分项 | 监护仪连续 |
| EtCO2 | mmHg | 呼气末二氧化碳,机械通气患者灌注代理指标 | 通气患者连续 |
注意:EtCO2 仅覆盖通气患者,缺失率极高;Temp/实验室类依赖护理文书,跨系统缺失机制差异最大(§8.2 归因之一)。
4.3.2 26 项实验室变量清单
BaseExcess(碱剩余)、HCO3(碳酸氢盐)、FiO2(吸氧浓度)、pH、PaCO2(动脉二氧化碳分压)、SaO2(动脉血氧饱和度)、AST(谷草转氨酶)、BUN(尿素氮)、Alkalinephos(碱性磷酸酶)、Calcium(钙)、Chloride(氯)、Creatinine(肌酐)、Bilirubin_direct(直接胆红素)、Glucose(血糖)、Lactate(乳酸)、Magnesium(镁)、Phosphate(磷)、Potassium(钾)、Bilirubin_total(总胆红素)、TroponinI(肌钙蛋白 I)、Hct(红细胞压积)、Hgb(血红蛋白)、PTT(部分凝血活酶时间)、WBC(白细胞)、Fibrinogen(纤维蛋白原)、Platelets(血小板)。
- 其中 Lactate、Creatinine、Platelets、Bilirubin、WBC 直接进入 SOFA/qSOFA 相关计分链路,是 Sepsis-3 标注的计算输入(§5.3)。
- 实验室变量按医嘱驱动采集:同一指标在医院间的检测触发习惯不同,缺失模式带强机构印记——迁移到 C 系统时这些"印记"全部失效。
4.4 预处理约定
- 全部 EMR 数据压缩到每小时分箱:同一小时内的多次测量取中位数。
- 多 LOINC 编码合并为单变量列,跨系统列名对齐。
- 缺失不插值、不填充——保留 NaN,缺失模式本身就是建模信号(测量频率与病情相关)。
- 粒度压缩本身就是去标识手段,这也是本库能以 CC BY 4.0 全开放(而 MIMIC-III 需受训访问)的关键。
4.5 第三方观察口径(与官方不一致处)
MDPI 2026 一篇第三方论文给出:住院时长中位数 40 小时、小时级标签阳性率 1.80%、总行数 “1,552,210 patient-hours”——最后一项与官方 Table 2 合计 1,424,171 行不一致,以官方为准;前两项仅作参考口径记录。
§5 任务定义、Sepsis-3 标注与防作弊
4.6 数据质量注意事项
- NaN 不是零:任何插值/填充策略都应显式声明;缺失本身有信息量(§12.4)。
- ICULOS 是行号也是时间轴:按 (patient, ICULOS) 唯一定位一个时点,勿假设每患者行数相同。
- HospAdmTime 为负是合法值(§4.3):表示 ICU 入住早于正式入院登记。
- Unit1/Unit2 部分系统缺失:跨系统建模时不可依赖。
- 中位数分箱损失了小时内波动:如需更高分辨率,本库无法提供——这是粒度换开放的固定代价。
- SepsisLabel 已前移 6 小时(§5.2):直接拿最后一行标签评估"当天是否脓毒症"是常见错误。
5.1 预测任务
- 输入:当前小时及之前的全部数据(严格因果——算法在 t 时刻只能看到 ≤t 的行)。
- 输出:每名患者每个小时窗输出一个 sepsis 风险值(连续分数)+ 二元预测(阈值由评分方统一扫阈值取最优 utility)。
- 时间要求:预测须至少提前 6 小时于脓毒症起病时间发出,提前量不超过 12 小时——超出 12 小时的早期报警在 utility 函数中不加分(见 §6)。
- 这个"6-12 小时窗口"来自临床约束:抗生素与液体复苏在 6 小时内启动可显著改善预后,而 12 小时以外的预报临床可操作性过低。
5.2 标签实现(SepsisLabel 前移 6 小时)
训练数据中的 SepsisLabel 是前移(lead-shifted)标签:
- 脓毒症患者:当 t ≥ t_sepsis − 6 时 SepsisLabel = 1;
- 非脓毒症患者:全程为 0。
即标签在起病前 6 小时即翻转为 1,使"提前 6 小时"的最低要求在训练阶段即可监督。算法实际输出被评分函数进一步考察 6-12 小时的提前量分布。
5.3 Sepsis-3 三时点定义
标签锚点 t_sepsis = min(t_suspicion, t_SOFA):
- t_suspicion(疑似感染时点):IV 抗生素与血培养采样中较早者——若抗生素先给,则培养须在其后 24h 内;若培养先取,则抗生素须在其后 72h 内;含连续给药约束(同一抗生素疗程内的给药不重复计时)。
- t_SOFA(器官功能障碍时点):24h 窗口内 SOFA 评分较基线上升 ≥2 分的首个时点。
- 约束:t_SOFA 不得早于 t_suspicion 前 24h、不得晚于其后 12h(剔除与感染无关的器官功能波动)。
5.4 防作弊设计
- C 系统数据永不公开:训练阶段不可见,测试阶段由评分方持有。
- 隐匿集只跑一次:终评每队 1 个 entry 在全集上运行一次,无迭代调参空间。
- 独立性审计:对提交者 email、队名、GitHub 账号做关联图谱分析,识别同一人多队参赛。
- 云评分沙箱:官方阶段使用 Docker 容器 + Google Cloud 的新评分系统,参赛者代码在受控环境运行。
5.7 三个系统的角色对照(§4 数据视角补充)
| 属性 | 系统 A | 系统 B | 系统 C |
|---|---|---|---|
| 医院 | BIDMC(波士顿) | Emory University Hospital(亚特兰大) | 匿名(美国第三系统) |
| 数据可得性 | 公开训练 | 公开训练 | 永不公开 |
| 官方反馈 | 官方阶段反馈子集分数 | 终评才见分 | 终评才见分 |
| 脓毒症率 | 8.8%(1,790/20,336) | 5.7%(1,142/20,000) | 未披露 |
| 数据行 | 739,663 | 684,508 | 未披露 |
| 角色 | 训练主场 + 开发参照 | 第二训练分布 | 泛化终极考场 |
三系统的角色设计是本基准最有教学价值之处:A 让参赛者"上车",B 制造第一次分布冲击(脓毒症率从 8.8% 降到 5.7%),C 则在终评时完成泛化的终极检验——B 的存在本身就在警告参赛者"第二个中心的分布都会漂移,何况第三个"。
5.8 非空数据点与测量密度
- A 集:739,663 行 × 40 变量 = 29,586,520 个理论格位,非空 5,536,849 → 密度 20.6%。
- B 集:684,508 行 × 40 变量 = 27,380,320 个理论格位,非空 4,950,064 → 密度 19.1%。
- 两系统密度相近(约两成格位有值),但哪些格位有值的机制不同——这正是 §8 泛化崩塌的微观土壤。
- 全库合计 10,486,913 个非空数据点(公开部分);含隐匿部分官方给出 “over 15 million data points”、“over 2.5 million hourly time windows”。
5.9 为什么选脓毒症做任务
- 高发高致死:脓毒症是 ICU 最常见死因之一,每延迟 1 小时抗生素治疗都会推高死亡率——"提前量"有明确临床价值锚点。
- Sepsis-3 恰在 2016 年定标:提供了可计算的三时点定义(§5.3),标签生成有共识依据,不依赖各院自定义。
- 发病依赖多源信号:生命体征 + 实验室 + 用药记录缺一不可,天然检验 EHR 建模能力。
- 误报代价真实存在:警报疲劳与抗生素滥用让"多报"不是免费的——utility 函数的 −0.05 因此有了现实含义。
5.10 标注的实现要点
- 从原始 EMR 中提取抗生素给药记录(含连续给药约束:同一疗程内重复给药不重置时钟)与血培养记录,按 §5.3 规则合成 t_suspicion。
- SOFA 分值由心率、血压、呼吸、血氧、血小板、胆红素、肌酐、乳酸等可自动提取项近似计算(缺失按可用项处理)。
- t_sepsis 受 [t_suspicion − 24h, t_suspicion + 12h] 窗口约束,避免把与感染无关的器官波动计入。
- 训练标签再整体前移 6 小时(§5.2),构成"提前量内可监督"的完整闭环。
5.11 临床部署视角:从分数到床旁
- 假警报的床旁代价:ICU 护士每小时处理数十种设备警报;一个在 C 系统上 utility 负分的算法意味着"部署即净伤害"——这就是为什么本基准用 −0.05/次给误报定价,而不是让它免费。
- 6 小时提前量的运营含义:给足血培养 + 抗生素决策与耗材准备的时间窗;12 小时上限则避免"预报三天后可能脓毒症"这类无法操作输出占用注意力。
- 因果约束的工程含义:部署系统天然只能看到 ≤t 的数据,训练与部署的信息面一致——这消除了"线下评估与线上表现"之间的最大落差来源。
- 持续监控建议:跨院部署应周期性重算 utility 并对比 A/B/C 三档基准;一旦跌向 0 基线即触发再训练评审——本基准提供了整套可复用的算尺。
§6 评估体系与 utility 函数
6.1 五指标输出
官方评估程序对每次提交输出五项指标,管道分隔打印:
AUROC | AUPRC | Accuracy | F-measure | Utility
- 官方主指标 = 第五个 utility(归一化临床效用),其余四项为辅助统计指标。
- 设计意图:AUROC/AUPRC 无法表达"早报值钱、漏报致命、误报扰人"的临床非对称代价,utility 可以。
6.2 utility 函数定义
对每名患者、每个小时窗 t,按预测时刻与 t_sepsis 的关系给分:
| 分支 | 条件 | 分值 | 含义 |
|---|---|---|---|
| U_TP | t_sepsis − 12 ≤ 预警时刻 < t_sepsis | max_u_tp = 1 | 提前 6-12 小时内的真阳性:满分奖励 |
| U_FP | 非脓毒症患者的报警 | u_fp = −0.05 | 误报:轻罚(抗生素滥用与警报疲劳的代价) |
| U_FN | 脓毒症患者全程未报 | min_u_fn = −2 | 漏报:重罚(可预防死亡的代价) |
| U_TN | 非脓毒症患者的正确沉默 | u_tn = 0 | 真阴性:中性 |
参数(评估代码与 CCM 论文 Fig.4 双源互证):
dt_early = −12 # 最早有效提前量(小时)
dt_optimal = −6 # 最优提前量
dt_late = +3 # 起病后 3 小时内报警仍算部分有效
max_u_tp = 1
min_u_fn = −2
u_fp = −0.05
u_tn = 0
- 在 [dt_early, dt_optimal] 区间内,U_TP 从 1 线性过渡到满值附近再线性回落——"提前 6 小时"两侧不是悬崖,而是缓坡。
- 起病后 3 小时内(dt_late = +3)报警仍可获得衰减的 U_TP 分值,超出则计 0。
- 来源说明:官方 evaluation-2019 仓库 raw 直抓因沙箱 SSL 受限未成,参数经参赛镜像(namhar/physionet-challenge-2019)代码与 CCM 论文图形双源核验,风险低。
6.3 归一化与基准线
U_normalized = (U_total − U_no predictions) / (U_optimal − U_no predictions)
- 最优算法 = 1(每例都在最优窗口报警)
- 全阴性算法 = 0(从不报警的基线)
- 负分 = 净伤害(比不报还糟)
这一归一化使不同规模、不同患病率的子集分数可比,也是"跨系统泛化崩塌"(§8)能用统一尺度呈现的原因。
6.4 评分机制与提交规则
- 官方阶段:Docker 容器 + Google Cloud 云评分;参赛者提交预测算法而非分数。
- 提交次数:非官方阶段每队 5 次、官方阶段 10 次;终评每队 1 个 entry 全集一次。
- 信息反馈:官方阶段只反馈 A 系统子集 的分数,B/C 表现保密——防止对隐匿分布过拟合。
- 官方评估代码:GitHub physionetchallenges/evaluation-2019,
evaluate_sepsis_score.m/.py双语言实现且结果一致,作者 matthewreyna,最后 commit 2019-11-10。另有 physionetchallenges 组织的 Julia/MATLAB/Python/R 四语言示例预测框架(BSD-2-Clause)。 - 排行榜历史存档:archive.physionet.org/challenge/2019/leaderboard/(可见 2019-05-02 版本快照)。
6.5 为什么不用 AUROC 做主指标(对比示例)
在 7.3% 患病率下,一个把所有患者都报警的算法 AUROC 可达 0.5、Accuracy 约 0.073,但 utility 会因海量误报(−0.05 × 37 万行)跌为深度负值;反之,一个只在病人临终才报警的算法可以刷高 AUPRC 却在 utility 上被提前量惩罚。utility 把这两个失败模式都挡在了排行榜外——这是该基准对后续医学 ML 评测最持久的影响之一。
6.6 utility 逐步计算实例(教学用例)
以一名住院 48 小时、第 30 小时达到 t_sepsis 的患者为例(参数见 §6.2):
| 算法行为 | 效果窗口判定 | 记分 |
|---|---|---|
| 第 18 小时报警 | 提前 12 小时整,落在 [−12, −6) 边界起点,U_TP 从满值向早期端线性衰减 | 部分正分 |
| 第 20 小时报警 | 提前 10 小时,处于 [−12, −6] 缓坡区间 | 接近满值 |
| 第 24 小时报警 | 提前 6 小时 = dt_optimal | +1(满值区) |
| 第 26 小时重复报警 | 同一真阳性窗口内的后续报警不重复计 U_TP | 0 |
| 第 31 小时报警 | 起病后 1 小时,仍在 dt_late=+3 内 | 衰减正分 |
| 第 35 小时才首次报警 | 超出 +3,计 U_FN 级别的失败 | 趋向 −2 |
非脓毒症患者在全部住院小时内任何报警都记 −0.05/次;全程无报警记 0。对全体患者求和后按 §6.3 归一化。该实例说明三点:满值奖励集中在"提前 6 小时"附近;过早报(提前 12 小时外)不加分;漏一次报的代价相当于 40 次误报(−2 / −0.05 = 40)——误报罚则轻但并非零成本。
6.7 五指标并排的解读要点
- AUROC 高、utility 负:排序能力尚可但校准/时机失败——报警不在有效窗口内。
- AUPRC 高、utility 负:正类检出强,但报警过晚或过密,被 −2/−0.05 拖垮。
- Accuracy 接近患病率:几乎从不报警的退化解(基线 0 分附近)。
- F-measure 与 utility 双高:时机与阈值俱佳——真实前排队伍的特征。
- 因此阅读排行榜时必须以 utility 列为主,其余四列仅作诊断。
6.8 与通用机器学习评测的对照
| 维度 | 通用 ML 评测(Kaggle 式) | CinC 2019 官方评测 |
|---|---|---|
| 主指标 | AUROC / F1 / RMSE | 归一化 utility(临床代价显式编码) |
| 提交物 | 预测分数 | 算法(Docker 容器在云上跑) |
| 测试数据 | 赛后公开,可复盘 | C 系统永不公开 |
| 尝试次数 | 每日多次,榜单实时 | 非官方 5 次 / 官方 10 次 / 终评 1 次 |
| 反馈 | 全量分数 | 仅 A 子集分数 |
| 失败模式 | 榜单过拟合、测试集泄露 | 结构性杜绝这两类 |
| 典型结局 | 前排分数逼近上限 | 前排 C 系统全员负分 |
结论:本基准用"信息分层发放"换来了结论的真实性——它的排行榜数字不如 Kaggle 好看,但泛化结论更接近临床部署的现实。
6.9 阈值处理机制
参赛者输出的是连续风险分;官方评估器在接收端执行统一的阈值扫描:对全部候选阈值逐一计算 utility,取最优者作为该提交的 utility。这意味着:
- 参赛者无需自行定阈值,等于官方把"最后一步校准"标准化了;
- 不同校准风格的算法(激进/保守)在同一评估器下可比;
- F-measure 等辅助指标也用同一最优阈值报告,保证五指标口径自洽。
§7 竞赛过程与官方结果
7.1 两个阶段的节奏
- 非官方阶段(2019-02-08 → 04-10/19,双截止口径见 §2.2):每队 5 次提交,排行榜实时可见,用于热身与基线建立。
- 官方阶段(2019-04-22/25 → 08-25):每队 10 次提交,云评分系统上线,只反馈 A 子集分数;08-25 noon GMT 截止后,每队指定 1 个 entry 在全集(含 C 系统)上终评一次。
7.2 终评结果分布特征
- 官方前五名 final normalized utility 挤在 0.337-0.360 的窄带内——第一名并未显著拉开差距。
- 全部前排队伍在 A/B 系统上 0.40+,在 C 系统上全部为负(−0.042 至 −0.156)。
- 非官方星号条目(Meicheng Yang 等)0.364 高于官方冠军,但其规则约束不同(详见 §3.4 注)。
- 90 篇参赛摘要构成 CinC 2019 论文集的主体(cinc.org/archives/2019/),形成该领域罕见的"同一基准、百队方法"横向对比文献群。
90 篇摘要之外,官方在 CinC 大会现场仅公布前十名;完整排行榜(含全部 88 个有效队伍)随后发布于 PhysioNet 站内与 archive 存档。
7.3 前排方法学速览
- 冠军 Morrill et al.(牛津):把时序数据处理为"非规则时间事件流",用 signature 变换(粗-path/多级特征)+ 逻辑回归/梯度提升,在每小时稀疏 NaN 密集数据上稳健工作;其方法学延续到后续 sepsis 预警产品化探索。
- 第 4 名 Xiang Li et al.:深度时序网络 + 多尺度卷积,A/B 高分但 C 系统 −0.156 为前排最深负值——过拟合训练分布的典型样本。
- 星号条目 Meicheng Yang et al.:集成 + 规则后处理,C 系统 −0.048 是全场最接近盈亏平衡的成绩。
7.4 前排方法的共性配方
从 90 篇参赛摘要与前排方案看,高分队伍普遍包含以下要素的子集:
- 缺失感知建模:把"上次测量距今多久"、"本小时是否测量"作为显式特征,而非简单插值。
- 多尺度时序聚合:小时窗 → 6 小时窗 → 24 小时窗的分层统计(趋势 + 波动率)。
- SepsisLabel 前移结构的利用:训练目标对齐 t_sepsis − 6(§5.2),推理时再做时机校准。
- 梯度提升 + 规则混合:树模型对表格化小时数据稳健,规则后处理压误报。
- 阈值按 utility 网格搜索:在验证集上直接优化 utility 而非 F1——与官方主指标对齐。
7.5 排行榜的诚实性设计回顾
- 非官方榜实时可见 → 社区热度与方法交叉验证;
- 官方榜只反馈 A 子集 → 中途名次"看起来"不完整是刻意的;
- 终评一次全集 → 最终榜与中途榜的差异本身就量化了"对反馈过拟合"的程度;
- archive.physionet.org 存有 2019-05-02 版排行榜快照,可复现中途状态。
7.6 赛程中的三个关键节点回顾
- 4 月 1 日训练库扩容(至 40,336 例):发生在非官方阶段中段,排行榜上的分数在这之后才"含金量"完整——B 集加入使全员分数下修,排行榜出现第一次洗牌。
- 官方阶段切换云评分(04-22/25):提交从"传分数"变为"传算法",Docker + Google Cloud 沙箱上线,反馈降为 A 子集。
- 08-25 终评:每队 1 entry 全集一次,C 系统成绩在 09-17 结果公布时才首次为世人所见——此前无人知道自己会否在第三系统上负分。
7.7 从提交数据看"分差"的本质
前五名的 final 分差只有 0.023(0.360 − 0.337),但 C 系统分差达 0.114(−0.042 − (−0.156))——名次竞争的主战场在 A/B,泛化差异的放大镜在 C。这提示两件事:
- A/B 上的精雕细琢(特征、集成、阈值)只能拉开 2-3 个百分点的 utility;
- 真正拉开命运差距的是"换一家医院掉多少"——而这一项在赛程内无人能优化(信息分层设计使然),只能在方法学层面预留稳健性(规则混合、保守校准)。
后续研究把这一观察形式化为"性能-鲁棒性前沿":在不接触目标分布的前提下,峰值性能与跨院稳健性存在可量化的交换关系,本榜是它最早的实证数据点之一。
§8 核心发现:跨系统泛化崩塌
8.1 现象
以官方前五名 + 星号条目为例:
| 队伍 | Sys A/B 区间 | Sys C |
|---|---|---|
| Morrill et al.(Rank 1) | 0.433 / 0.434 | −0.123 |
| Du, Sadr, de Chazal(Rank 2) | 0.40+ | −0.042 |
| Zabihi et al.(Rank 3) | 0.40+ | −0.146 |
| Xiang Li et al.(Rank 4) | 0.40+ | −0.156 |
| Singh et al.(Rank 5) | 0.40+ | −0.094 |
| Meicheng Yang et al.(*) | 0.430 / 0.422 | −0.048 |
没有任何队伍在 C 系统上取得正分。
8.2 归因分析(论文讨论口径)
- 机构间流程差异:实验室项目组合、文书惯例、ICU 类型构成不同,导致 26 项实验室变量的缺失模式与测量频率整体漂移。
- 护理强度与编码习惯:A/B 系统数据抽取自研究型深度 EHR,C 系统的记录密度与字段可用性不同——算法学到的"缺失即信号"规律在 C 上反转。
- 患病率与疾病谱偏移:C 系统 sepsis 比例、患者年龄构成与训练分布不同,校准整体失效。
- utility 的放大效应:负向 utility 对漏报(−2)极敏感,分布偏移造成的少量漏报即可把分数拖到水下;这正是设计意图——宁可让分数难看,也不让"看起来还行"的算法进入临床。
8.3 影响
- 直接催生了后续"多中心联邦评测"的设计惯例:训练集绝不能只有一到两个中心。
- MIMIC-III/eICU 组合、HiRID、AmsterdamUMCdb 在 2020 年代被广泛用作外部验证库,正是对本教训的制度化回应(见 §10、§11)。
- "跨医院泛化崩塌"成为医学 ML 综述中的标准引例,CCM 论文至今是 sepsis ML 基准的标配引用。
§9 License、获取方式与版本链
9.1 许可
- License:CC BY 4.0(Creative Commons Attribution 4.0 International Public License)。
- Access Policy:Anyone can access the files——完全开放获取,无 credentialed/受训访问门槛。
- 对比 MIMIC-III 的受训访问制:本库的小时级分箱粒度压缩本身就是去标识手段,因此可全开放。
- 引用要求:①Reyna et al. CCM 论文(或所用版本的对应论文);②数据 DOI 10.13026/v64v-d857(RRID: SCR_007345)。
- 附带资源的独立许可:官方评估代码与四语言示例框架为 BSD-2-Clause;各参赛队伍代码仓库许可各异,使用前须逐一核对。
9.2 三种下载方式
# ① PhysioNet 页面直链(约 42 MB 压缩包)
https://physionet.org/content/challenge-2019/1.0.0/
# ② wget 递归镜像
wget -r -N -c -np https://physionet.org/files/challenge-2019/1.0.0/
# ③ AWS 开放数据(匿名访问)
aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/
9.3 版本链
- 仅 v1.0.0(2019-08-05)一版,无后续修订——资源页发布即终版,是 PhysioNet 系列中少见的"零修订"稳定基准。
- latest DOI:10.13026/0y7p-s471(当前指向同一 v1.0.0)。
9.7 三种获取方式怎么选
| 方式 | 适用场景 | 注意点 |
|---|---|---|
| 页面直链 | 首次下载、人工核对 | 手动确认版本页脚 v1.0.0 |
| wget 递归 | 脚本化、断点续传 | -N 保时间戳、-c 续传、-np 防越界父目录 |
| AWS sync | 云上批量、免登录 | –no-sign-request 匿名;区域延迟首次较慢 |
三种方式产物一致(同一 SHA256SUMS 清单),任选其一即可;云端训练建议 AWS sync(内网带宽),本地分析建议直链(一次 42 MB)。
9.4 资源页文件树
challenge-2019/1.0.0/
├── training/ # A、B 两子目录,每患者一个 .psv
│ ├── training_setA/ # 20,336 例(p000001.psv - p010336.psv 命名段)
│ └── training_setB/ # 20,000 例
├── papers/ # 官方论文 PDF(含 CCM manuscript,约 1.5 MB)
├── sources/ # 全部参赛队伍代码 zip(2022-02-04 打包;
│ # 如 404Sepsisnotfound.zip、ABC.zip 等数百队)
├── hackathon/ # 2019-09-08 新加坡 hackathon 材料
├── img/ # 页面图(utility_sepsis/nonsepsis_diagram.svg 等)
├── LICENSE.txt # 25.2 KB(CC BY 4.0 全文)
└── SHA256SUMS.txt # 文件校验清单
8.5 "负分是设计意图"的三层解读
- 测量层:utility 的归一化把"从不报警"定为 0 分基线——任何在陌生分布上失准的算法都会自然落水,负分 = "换家医院后比不部署还糟"的直白表述。
- 设计层:漏报罚 −2 远重于误报罚 −0.05(40:1),使分数对"分布偏移导致的漏检"极度敏感——这正是设计者想要的放大镜。
- 传播层:全员负分的结果被论文如实报告,成为医学 ML 社区十年间反复引用的警示案例——一次"难看但诚实"的评测,胜过十次"好看但存疑"的刷榜。
8.6 与同期其他挑战赛泛化设计的对比
| 赛事 | 泛化检验方式 | 特点 |
|---|---|---|
| CinC 2019(本库) | 隐匿第三医院系统,终评一次性 | 信息分层最严格 |
| CinC 2015 | 隐匿病历 + 提前量奖励 | 首创 utility 思想 |
| CinC 2021 | 隐藏测试含"从未见过的库"(分布外设计) | 库级泛化 |
| MIMIC-III 时代常见做法 | 单库随机划分 | 无真正泛化检验 |
本库的设计介于 2015 与 2021 之间:既保留了单系统隐匿的尖锐性,又用 A/B 双库训练给出了第一次分布冲击的预演。
9.6 在 PhysioNet 开放数据家族中的位置
- PhysioNet 资源分三档:open(直接下载)、credentialed(注册+协议)、controlled(申请审核)。
- 本库属 open 档(CC BY 4.0,Anyone can access),与 MIMIC-III(credentialed)形成鲜明对照——同一家医院(BIDMC)的数据,因粒度压缩策略不同而落在不同合规档位,是研究开放数据合规设计的经典对照样本。
- 相近定位的 open 档资源还有 challenge 系列数据(cinc-2015、cinc-2021、cinc-2023 等),构成"小时级 EHR → 信号 → 波形 → 音频"的开放频谱。
10.5 引用与署名规范细则
- 引用数据:Reyna et al. 论文 + DOI 10.13026/v64v-d857,RRID SCR_007345 写入方法学段落。
- 引用评估代码:physionetchallenges/evaluation-2019 仓库,注明 commit 日期(最后 commit 2019-11-10)。
- 使用参赛代码(sources/ 内 zip):逐仓库核对许可,多数为研究用途限制,勿默认可商用。
- 转载本条目:CC BY 4.0 同样适用——署名"千方病案医数集"并链接原始条目。
10.1 库内互链(rid 核实于 2026-09-27)
| 关联数据集 | rid | 关系 |
|---|---|---|
| mimic-iii / mimiciii | 106 / 590 | A 集(BIDMC)母院数据库;本库为其小时级压缩重切片 |
| eicu-crd / eicu-collaborative | 552 / 9 | 常被误传为 B 集来源(见 §13 证伪二);实为外部验证资源 |
| chest-ct-sepsis-er | 600 | 影像域脓毒症数据集(CT),与本库构成"时序+影像"互补 |
| cinc-2021 | 644 | 同系列后续挑战赛(12 导联 ECG 多标签) |
| cinc-2015 | 487 | 同系列 2015 届( hypothetemia/假性低体温预警) |
| cinc-2018-sleep | 493 | 同系列 2018 届(睡眠分期) |
| physionet-cinc-2016 | 382 | 同系列 2016 届(心音分类) |
| physionet-cinc-2017 | 162 | 同系列 2017 届(房颤分类) |
| cinc-2023 | 499 | 同系列 2023 届(环境声音健康事件) |
| amsterdamumcdb | 6 | 欧洲外部验证库(荷兰阿姆斯特丹 UMC) |
| hirid | 7 | 欧洲外部验证库(瑞士伯尔尼 Inselspital) |
10.2 HF 生态(hf-mirror.com 查询 2026-09-27)
- legomaheggo/physionet-sepsis-2019(downloads 128)
- devesh73/physionet-sepsis-2019(downloads 21)
- 无官方 HF 仓库;社区镜像均为个人再打包,使用时须回源核对 SHA256。
10.3 GitHub 生态
- physionetchallenges/evaluation-2019:官方评估代码(MATLAB + Python 双实现)。
- physionetchallenges 组织:Julia/MATLAB/Python/R 四语言示例预测框架(BSD-2-Clause)。
- 参赛镜像:namhar/physionet-challenge-2019 等;PhysioNet sources/ 目录收全部参赛代码 zip(数百队)。
- 引文生态:CCM 论文为 sepsis ML 基准标配引用;CinC 2019 论文集(cinc.org/archives/2019/)含 90 篇参赛摘要。
8.4 逐队泛化落差分析(C 系统成绩单)
| 队伍 | C 系统分 | 相对 A/B 落差 | 可读出的信息 |
|---|---|---|---|
| Xiang Li et al. | −0.156 | 前排最深 | 深度模型对训练分布记忆最强,崩得最狠 |
| Zabihi et al. | −0.146 | 深负 | 多尺度卷积未处理缺失机制漂移 |
| Morrill et al. | −0.123 | 深负但总分仍居首 | signature 特征在 A/B 优势足够大,抵消 C 崩塌 |
| Singh et al. | −0.094 | 中等 | 规则占比高反而缓冲 |
| Meicheng Yang et al.(*) | −0.048 | 最浅 | 规则后处理 + 保守阈值 = 最抗漂移 |
| Du, Sadr, de Chazal | −0.042 | 最浅 | 同上;临床规则工程是跨院稳健性的关键 |
规律:模型越"深"、越依赖训练分布的统计规律,C 系统崩得越深;规则与校准越保守,落差越浅。但保守派的总分也被压低(0.345 vs 0.360)——稳健性与峰值性能的权衡在本榜上清晰可见。
9.5 复现与校验实操清单
- 下载压缩包后先核对
SHA256SUMS.txt(官方提供全文件校验清单)。 - 抽查任一 .psv:列数应为 41、分隔符为
|、缺失为空值/NaN、首行为表头。 - 用官方 evaluation-2019 仓库的
evaluate_sepsis_score.py对随机预测复算 utility,验证归一化基线(全阴性 = 0)。 - 核对 A/B 合计行数:739,663 + 684,508 = 1,424,171;患者数 20,336 + 20,000 = 40,336;脓毒症 1,790 + 1,142 = 2,932。
- 引用格式采用 §9.1 两件套(论文 + DOI),RRID 写 SCR_007345。
10.4 资源索引速查
| 资源 | 位置 | 说明 |
|---|---|---|
| 数据本体 | physionet.org/content/challenge-2019/1.0.0/ | v1.0.0,42 MB |
| 官方论文(权威) | CCM 48(2):210-217 / PMC6964870 | 期刊版 |
| 官方论文(会议版) | DOI 10.22489/CinC.2019.412 | 2 页 |
| 评估代码 | github.com/physionetchallenges/evaluation-2019 | MATLAB+Python |
| 示例框架 | github.com/physionetchallenges | 四语言,BSD-2-Clause |
| 排行榜存档 | archive.physionet.org/challenge/2019/leaderboard/ | 2019-05-02 快照 |
| 参赛代码全集 | PhysioNet sources/(2022-02-04 打包) | 数百队 zip |
| 论文集 | cinc.org/archives/2019/ | 90 篇摘要 |
10.6 HF 社区镜像的注意事项
- hf-mirror.com 可查到的镜像(legomaheggo 128 次下载、devesh73 21 次下载)均为个人再打包,非官方维护。
- 使用镜像前务必回源核对:行数(1,424,171)、患者数(40,336)、41 列结构——社区镜像历史上出现过列错位与标签口径错误的先例(通用教训,非本库特例)。
- 官方没有 HF 仓库;引用研究时一律以 PhysioNet v1.0.0 + SHA256SUMS 为准。
10.7 GitHub 生态的使用建议
- 复现评估:直接跑 evaluation-2019 的 .py 实现(与 .m 双实现结果一致,2019-11-10 最后 commit)。
- 快速起步:physionetchallenges 组织的四语言示例框架(BSD-2-Clause)给出了输入输出管线的最小实现。
- 深挖方法:sources/ 内数百队 zip 是"同一基准、百种方法"的原始语料,适合做方法学元分析;逐 zip 核许可后再用。
8.7 本节小结
- 现象:A/B 0.40+ → C 全负(−0.042 至 −0.156)。
- 机制:缺失机制漂移 + 编码习惯 + 患病率偏移 + utility 放大。
- 规律:模型越深崩得越狠,规则越保守落差越浅(§8.4)。
- 后果:多中心训练与外部验证成为医学 ML 的制度性标配(§10.1、§11)。
一句话:CinC 2019 用一届比赛的负分,换来了整个领域对"泛化"二字的重新定价。
§11 相关数据集对比与证伪记录
11.1 与 MIMIC-III 的关系
| 维度 | cinc-2019 | MIMIC-III |
|---|---|---|
| A 集母院 | BIDMC(同一医院) | BIDMC |
| 访问门槛 | CC BY 4.0 全开放 | 受训访问(CITI 证书 + 签署协议) |
| 粒度 | 每小时一行、41 列固定 | 秒级事件流、全字段 |
| 标签 | Sepsis-3 前移 6 小时(现成) | 原始数据,需自行实现 Sepsis-3 |
| 用途定位 | 算法评测基准 | 深度研究数据湖 |
A 集可视为 MIMIC-III 在"Challenge 2019 规范"下的投影:同一医院、同一时段的 ICU 记录,被压缩、对齐、打标成可直接训练的格式。库内误传澄清:主会话曾提示"来源含 MIMIC-III/eICU/HiRID/AmsterdamUMCdb 四库",不成立——官方论文明确三个系统均为美国医院(A=BIDMC、B=Emory、C=匿名美国系统);HiRID(瑞士伯尔尼)与 AmsterdamUMCdb(荷兰)是赛后才被社区用作外部验证的资源,Frontiers 2026 综述将两者与本基准并列为互补定位,并非本库来源。
11.2 与 eICU 的关系(证伪二)
社区流传"B 集 = eICU"为误传。 CCM 论文明确 B = Emory University Hospital;PMC6964870 与 MDPI 第三方论文双源一致。eICU-CRD 是多中心远程 ICU 数据库,与本库 B 集无来源关系,仅常被同时引用作外部验证。
11.3 与同系列挑战赛的谱系
- cinc-2015(487):假性低体温/心血管手术预警——首次引入"提前量奖励"思想。
- physionet-cinc-2016/2017(382/162):心音与心律分类,信号粒度。
- cinc-2018-sleep(493):睡眠分期。
- cinc-2019(本条目):转回临床时序,引入 Sepsis-3 标签与 utility 函数。
- cinc-2021(644):12 导联 ECG 多标签汇编,把"训练全信息、测试降信息"模板化。
- cinc-2023(499):环境声音健康事件。
谱系上的承上启下:cinc-2015 的提前量思想在 cinc-2019 被 utility 函数形式化,随后被 cinc-2021 的部分得分制继承。
11.4 与欧洲外部验证库的互补
| 维度 | cinc-2019 | HiRID | AmsterdamUMCdb |
|---|---|---|---|
| 国家 | 美国(三系统) | 瑞士(伯尔尼) | 荷兰(阿姆斯特丹) |
| 粒度 | 每小时分箱 | 分钟级 | 小时/分钟混合 |
| 许可 | CC BY 4.0 | CC BY-SA 4.0(需 credentialed) | 需申请(credentialed) |
| 角色 | 训练+官方基准 | 赛后外部验证 | 赛后外部验证 |
§12 方法学启示
12.1 "临床效用函数"可以显式编码权衡
把"提前 6-12 小时最值钱、漏报 −2、误报 −0.05"写成白纸黑字的分段函数,比让算法作者自行猜测权衡好得多:所有队伍在同一尺度上竞争,事后分析能精确解释每个名次差的来源。任何"早发现"类任务(败血症、脓毒症、急性肾损伤、病情恶化预警)都可直接移植这套参数化模板。
12.2 "训练全公开、测试全隐匿、只跑一次"防过拟合三件套
- 训练集(A/B)公开 → 方法可复现;
- C 系统永不公开 → 无法对测试分布调参;
- 终评 1 entry 全集一次 → 无迭代试探空间。
配合"官方阶段只反馈 A 子集分数"的信息控制,这套流程把排行榜与真实泛化的差距压到了最小——代价是 C 系统全员负分这一"难看"的结果,而这恰恰是结果可信的证据。
12.3 粒度压缩是开放与隐私的中间道路
MIMIC-III 因字段过细只能受训访问;本库把粒度压到"每小时 + 41 列 + 90+ 岁记 100"后即可 CC BY 4.0 全开放。粒度压缩本身就是去标识手段——这为后续开放数据集设计提供了可复用的合规路径。
12.4 缺失模式是信号也是陷阱
训练集上"某变量缺失率与死亡率相关"的规律,到了 C 系统可能因为文书流程不同而反转。处理 EHR 缺失时,应显式建模"缺失机制"而非仅把 NaN 当特殊值——本基准的泛化崩塌正是这一原则最著名的反例教材。
12.5 多中心训练是底线
前五名全部在 C 系统翻车说明:两个中心训练不足以覆盖第三个中心的分布。2020 年代 sepsis 预警研究普遍转向 3+ 中心训练 + 独立中心验证的设计,本基准是这一转变的直接推手。
§13 常见误解澄清(证伪记录)
| # | 流传说法 | 事实 | 依据 |
|---|---|---|---|
| 1 | “数据来自 MIMIC-III/eICU/HiRID/AmsterdamUMCdb 四库” | 不成立。三个系统均为美国医院:A=BIDMC、B=Emory、C=匿名美国系统;HiRID(瑞士)与 AmsterdamUMCdb(荷兰)是赛后外部验证资源 | CCM 论文 §2;Frontiers 2026 综述 |
| 2 | “B 集 = eICU” | 误传。B = Emory University Hospital | PMC6964870 与 MDPI 第三方论文双源一致 |
| 3 | “总行数 1,552,210 patient-hours” | 与官方 Table 2 合计 1,424,171 行不一致,以官方为准 | CCM Table 2 |
| 4 | “隐匿测试集是 22,761 例” | 仅 CinC 会议版口径;CCM 期刊版为 24,819(权威) | 双口径并存 |
| 5 | “论文是 2019 年的” | 期刊版正式刊出 2020 Jan 15;官页引用沿用 in-press 年份口径 “(2019)” | 双口径并存 |
| 6 | “C 系统是欧洲某医院” | 禁止猜测。官方仅称 “a third, unidentified hospital system”(美国第三系统),条目按匿名处理 | FACTS 存照第 79 行 |
| 7 | “冠军 0.364” | 0.364 是非官方星号条目(Meicheng Yang et al.);官方冠军 Morrill et al. 为 0.360 | 论文 Table 1/3 |
| 8 | “评估代码是 BSD-2-Clause 所以数据集也是” | 数据集许可为 CC BY 4.0;BSD-2-Clause 是示例预测框架仓库的许可,勿混淆 | PhysioNet LICENSE.txt |
13.1 证伪记录的逐条展开
证伪一(四库来源说)的排查路径:先查官方论文 §2——“Data from three hospital systems in the United States were used”,明确三系统均为美国;再查 Frontiers 2026 综述——HiRID 与 AmsterdamUMCdb 是作为"互补外部验证资源"与本基准并列讨论,而非数据来源;两者口径一致,误传可定案。
证伪二(B=eICU 说)的排查路径:CCM 论文 Table 2 脚注写明 “training set B: Emory University Hospital”;PMC6964870 全文与 MDPI 第三方论文引述一致。eICU 的混淆可能来自"多中心 ICU 数据库"的粗略联想,以及部分教程把 eICU 当作本库"第三系统"的猜测(同样错误——C 是美国匿名系统且永不公开)。
1,552,210 patient-hours 的来源推定:该数出自 MDPI 2026 论文的摘要表述,与官方 Table 2 的 1,424,171 行相差约 12.8 万行;可能的成因是该文把隐匿测试集部分行数并入统计。条目处理方式:正文使用官方数,第三方数仅在 §4.5 存照并声明"以官方为准"。
§14 FAQ
Q1:数据怎么下载?多大?
约 42 MB 压缩包,三种方式:PhysioNet 直链、wget 递归镜像、AWS 开放桶(aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/)。见 §9.2。
Q2:需要签协议或受训吗?
不需要。CC BY 4.0 全开放,任何人可下载;仅需按官方要求引用论文与 DOI。
Q3:训练标签为什么"看起来提前 6 小时就变 1"?
因为 SepsisLabel 做了前移:t ≥ t_sepsis − 6 即为 1(见 §5.2)。这是任务设计而非标注错误——最低提前量要求在训练阶段即可监督。
Q4:测试集能拿到吗?
不能。C 系统与隐匿测试集永不公开,只存在于评分方环境中。这正是"跨系统泛化"结论可信的原因。
Q5:utility 负分是什么意思?
比"从不报警"(0 分基线)更差。前排队伍在 C 系统全部负分 = 换一家医院后,这些算法实际是净伤害(大量误报叠加致命漏报)。
Q6:HospAdmTime 为什么有负值?
先入 ICU 抢救、后补办入院登记的时间差(见 §4.3)。属正常数据现象,勿当脏数据清洗。
Q7:Age 有 100 是真的百岁老人吗?
90 岁以上统一记 100(去标识约束),不是真实年龄(见 §4.3)。
Q8:有哪些直接可用的评估工具?
官方 physionetchallenges/evaluation-2019(MATLAB + Python 双实现,结果一致);physionetchallenges 组织另有四语言示例预测框架。
Q9:现在做 sepsis 预警研究还该用它吗?
作为基准评测场依然标准(可复现、可对比历史方法);作为性能上限证据已不足(仅两中心训练)。现代研究通常用它做基准对照,另加多中心外部验证。
Q10:与 MIMIC-IV 什么关系?
无直接关系。A 集源自 MIMIC-III 时代的 BIDMC 记录加工;MIMIC-IV 是独立的后续版本数据湖,本库未随其更新(版本链仅 v1.0.0)。
Q11:可以用本库训练商用产品吗?
CC BY 4.0 允许商用,但须署名(引用论文与 DOI),且注意 utility 参数与标签口径的学术规范;隐匿测试集不可能获取,任何"在官方测试集上 X 分"的商用宣称都应警惕。
Q12:为什么我的复现分数和排行榜对不上?
先核对三件事:①是否用了官方 evaluate_sepsis_score(阈值扫描方式一致);②标签是否理解成前移 6 小时的版本;③utility 是否做了归一化(不归一化的 raw utility 与榜单数值不可比)。
Q13:B 集脓毒症率为什么比 A 集低这么多(5.7% vs 8.8%)?
两院患者构成与入院标准不同(B 为 Emory 大学医院成人 ICU 抽样)。这个落差正是基准刻意保留的"第一次分布冲击",复现论文应在 B 上观察到分数下降。
Q14:小时级阳性率 1.80% 和患者级 7.3% 哪个对?
都对,粒度不同:1.80% 是全部患者-小时中标签为 1 的比例(MDPI 第三方参考口径),7.3% 是患者级脓毒症比例(官方 2,932/40,336)。引用时注明粒度。
Q15:SepsisLabel=0 但患者最终确诊脓毒症,是标签错误吗?
不是。前移标签只在 t ≥ t_sepsis − 6 后翻转为 1;起病前 12 小时以外的时间步标签为 0 是设计行为(配合 utility 的提前量窗口评估)。
Q16:为什么 40,336 这个数在新闻里写作"40k patients"?
40,336 = A 20,336 + B 20,000,扩容发生在 2019-04-01(§2.2);早期新闻稿(02-06 启动时)只提到初始规模,引用时注意时间点。
Q17:训练集里能直接算出"提前 6 小时"的评估吗?
可以且应该:官方评估代码接受逐患者逐小时的预测分数,自行按 §6.2 参数算 utility;社区常用 A 集末段做本地验证、B 集做伪外推,最后仍以官方终评为准。
Q18:数据里有时间戳吗?
没有绝对时刻——只有 ICULOS(ICU 内相对小时序号)与 HospAdmTime(入院到入 ICU 的相对小时)。这是去标识设计的一部分,也意味着"季节性/昼夜节律"建模受限。
Q19:可以做多任务(如同时预测死亡)吗?
数据集本身只提供 SepsisLabel;但 ICULOS、Age、Unit 等字段允许构造辅助任务。注意任何衍生标签都须在论文中与本基准的官方口径区分。
Q20:别的综述为什么常写"eICU-based challenge"?
部分 2020 年后的教程把 CinC 2019 与使用 eICU 的后续研究(外部验证)混写。以官方论文为准:训练集只有 BIDMC 与 Emory 两个来源(§13 表第 2 条)。
Q21:星号条目和正式名次差在哪?
星号 = 非官方条目(未满足官方阶段全部规则,如提交配额/截止约束)。Meicheng Yang et al. 的 0.364 因此不占官方 Rank 1;官方榜原则是"规则完整性优先于分数"。
Q22:为什么标题里同时出现 BIDMC 和 MIMIC-III?
A 集抽取自 BIDMC 的 EHR(与 MIMIC-III 同院同源),但本库是独立加工的挑战赛数据集,不是 MIMIC-III 的子集发布;两者粒度、许可、访问方式均不同(§11.1 对照表)。
§15 术语表
| 术语 | 释义 |
|---|---|
| Sepsis-3 | 2016 年脓毒症第三个国际共识定义:感染 + SOFA 上升 ≥2 |
| SOFA | Sequential Organ Failure Assessment,序贯器官衰竭评估评分 |
| t_suspicion | 疑似感染时点:IV 抗生素与血培养采样中较早者(含 24h/72h 配对约束) |
| t_sepsis | 脓毒症起病锚点 = min(t_suspicion, t_SOFA),含 ±24h/12h 约束 |
| utility | 临床效用分数:提前 6-12h 真阳性 +1、误报 −0.05、漏报 −2、真阴性 0 |
| U_normalized | 归一化效用:(U − U_none)/(U_optimal − U_none);最优 1、全阴 0、负分为净伤害 |
| dt_early / dt_optimal / dt_late | utility 时间参数:−12h / −6h / +3h |
| .psv | 管道分隔值文件(pipe-separated values),每患者一个,每行一小时 |
| SepsisLabel | 第 41 列二值标签,训练版已前移 6 小时 |
| NaN | 该小时无测量的缺失记号,不插值 |
| entry | 一次提交的算法/预测包;非官方阶段 5 次、官方 10 次、终评 1 次 |
| hidden test set | 隐匿测试集:A/B/C 三系统样本,22,761(CinC 版)/24,819(CCM 版)双口径 |
| credentialed access | PhysioNet 的受训访问机制(本库不采用,直接开放) |
| RRID | Research Resource Identifier,本库 SCR_007345 |
| qSOFA | 床旁快速脓毒症筛查:呼吸频率≥22、收缩压≤100、意识改变三选二 |
| SIRS | 全身炎症反应综合征;脓毒症旧定义的核心,Sepsis-3 起被 SOFA 取代 |
| BIDMC | Beth Israel Deaconess Medical Center,A 集母院(波士顿) |
| Emory | Emory University Hospital,B 集来源(亚特兰大) |
| rough path / signature | 牛津冠军队使用的非规则时序特征数学工具 |
| LOINC | 实验室观测指标的国际标准编码;本库已合并多编码为单变量 |
| entries | 提交计数单位:853 总提交 / 430 有效 |
| lead-shift | 标签前移处理:SepsisLabel 在 t_sepsis−6h 即翻转为 1 |
| alarm fatigue | 警报疲劳:误报过多导致临床人员忽略警报的现象,utility 负项的现实依据 |
| distribution shift | 分布偏移:训练与部署数据的联合分布不一致;C 系统负分的直接成因 |
| v1.0.0 | 本资源唯一版本号,2019-08-05 发布后无修订 |
| SHA256SUMS.txt | 官方文件校验清单,镜像核对的最终依据 |
| hidden test set lead-shift | 隐匿侧标签同样前移 6h,与训练侧口径一致 |
| final normalized utility | 终评成绩:每队 1 entry 全集一次的归一化效用 |
| hackathon | 2019-09-08 新加坡赛前十小时的线下开发日活动 |
| SepsisLabel | 数据第 41 列,0/1 二值,见 §5.2 前移口径 |
| hidden window | 隐匿侧的小时窗,与公开侧同构,官方持有 |
| Emory BMI | Emory 大学生物医学信息系,本库牵头组织方 |
| UCSD | 加州大学圣迭戈分校,Nemati 任职机构,标注方法学承担方 |
附录 A 时间线大事记
2019-02-06/08 挑战赛启动(Moore Foundation / Google / MathWorks 赞助)
2019-02-08 非官方阶段开始,每队 5 次提交
2019-04-01 训练库扩展至 40,336 例
2019-04-10 官页口径的非官方常规截止(23:59 GMT)
2019-04-19 论文口径的非官方阶段结束(扩展期)
2019-04-22/25 官方阶段开始,每队 10 次,云评分上线
2019-08-05 PhysioNet v1.0.0 资源页发布
2019-08-25 提交全部截止(noon GMT)
2019-09-08 新加坡 hackathon
2019-09-09/11 CinC 大会(新加坡)
2019-09-17 官方结果公布
2019-09 CinC 会议版论文(9 人含 Seyedi,测试集 22,761)
2019-10-14 CCM manuscript 落款
2019-11-10 evaluation-2019 仓库最后 commit
2020-01-15 CCM 期刊版刊出 48(2):210-217(8 人无 Seyedi,测试集 24,819)
2022-02-04 sources/ 打包收录全部参赛代码
附录 B 双口径存照清单
- 隐匿测试集规模:CinC 会议版 22,761 vs CCM 期刊版 24,819——成稿以期刊版为权威、会议版注明。
- CCM 年份:官页引用 “(2019)”(in-press 口径)vs PMC “2020 Jan 15;48(2):210-217”。
- 非官方阶段截止:官页新闻 2019-04-10 23:59 GMT vs CCM 论文 19 April。
- 作者名单:CinC 版 9 人含 Salman Seyedi vs CCM 版 8 人无 Seyedi。
- 总行数:官方 Table 2 合计 1,424,171 行 vs MDPI 第三方 “1,552,210 patient-hours”——以官方为准。
- hospital system C:永久匿名(“a third, unidentified hospital system”,美国第三系统),禁止猜测。
- utility 参数来源:CCM 论文正文 + Fig.4(官方图形)与参赛镜像代码互证;官方仓库 raw 直抓因沙箱 SSL 受限未成,风险低。
- evaluation-2019 仓库 LICENSE 具体类型:待核(示例预测代码仓库为 BSD-2-Clause,勿与数据集 CC BY 4.0 混淆)。
附录 C 互链点速查(rid)
mimic-iii(106)|mimiciii(590)|eicu-crd(552)|eicu-collaborative(9)|chest-ct-sepsis-er(600)|cinc-2021(644)|cinc-2015(487)|cinc-2018-sleep(493)|physionet-cinc-2016(382)|physionet-cinc-2017(162)|cinc-2023(499)|amsterdamumcdb(6)|hirid(7)
存照声明:本条目由 agentB-cinc2019 于 2026-09-27 撰写,硬数字与双口径以同目录 FACTS.md(84 行事实档案)为唯一事实源;写作期间同名代理并发会话多次覆盖成稿与 /tmp 临时文件(含本次恢复前成稿被清空为 0 字节事故),本版为按 FACTS 重建的恢复版,全部硬数字(40,336 / 20,336 / 20,000 / 1,790 / 1,142 / 2,932 / 739,663 / 684,508 / 1,424,171 / 10,486,913 / 22,761 / 24,819 / 104 队 853 entries / 430 entries / 90 篇 / 0.360 / 0.364* / utility 参数组 / CC BY 4.0 / v1.0.0)与 FACTS.md 逐项一致。
附录 D 引用格式
数据资源引用:
@dataset{reyna_2019_challenge,
author = {Reyna, Matthew A. and Josef, Chris and Jeter, Russell and
Shashikumar, Supreeth P. and Westover, M. Brandon and
Nemati, Shamim and Clifford, Gari D. and Sharma, Ashish},
title = {Early Prediction of Sepsis from Clinical Data:
The PhysioNet/Computing in Cardiology Challenge 2019},
year = {2019},
doi = {10.13026/v64v-d857},
url = {https://physionet.org/content/challenge-2019/1.0.0/}
}
方法学论文引用(权威口径):
@article{reyna2020early,
author = {Reyna, Matthew A. and Josef, Chris S. and Jeter, Russell and
Shashikumar, Supreeth P. and Westover, M. Brandon and
Nemati, Shamim and Clifford, Gari D. and Sharma, Ashish},
title = {Early Prediction of Sepsis from Clinical Data:
the PhysioNet/Computing in Cardiology Challenge 2019},
journal = {Critical Care Medicine},
volume = {48},
number = {2},
pages = {210--217},
year = {2020},
doi = {10.1097/CCM.0000000000004145}
}
注:会议版(9 人含 Seyedi,DOI 10.22489/CinC.2019.412)引用格式见 §2.1;两版作者名单差异见 §13 第 5 条。
附录 E 条目自查清单(审稿口径)
- [x] 全称、届数(第 20 届)、本质定位与 FACTS.md §1 一致
- [x] 双论文口径(9 人/8 人、22,761/24,819、2019/2020-01-15)三项并存
- [x] 时间线七节点(02-06/08、04-10/19、04-01、04-22/25、08-05、08-25、09-08/09-11/09-17)无遗漏
- [x] Table 2 硬数字九项(20,336/20,000/1,790/1,142/739,663/684,508/1,424,171/10,486,913/密度 20.6%·19.1%)逐项核对
- [x] 41 列 = 8 + 26 + 6 + 1;Age 90+ 记 100;HospAdmTime 可负
- [x] 任务约束(提前 6-12h)、标签前移 6h、Sepsis-3 三时点
- [x] utility 七参数与归一化公式
- [x] 参赛规模(104 队 853 entries、88 队 430 entries、90 篇)
- [x] 优胜榜前五 + 星号条目,C 系统全负
- [x] license(CC BY 4.0)、版本链(仅 v1.0.0)、DOI 与 RRID
- [x] 证伪记录(四库来源说、eICU 说、1,552,210 说)
- [x] 互链 rid 十三项齐备
附录 F 复现速查(五步)
aws s3 sync --no-sign-request s3://physionet-open/challenge-2019/1.0.0/ training/(或 §9.2 其余两种方式)。- 核对 SHA256SUMS.txt。
- 读任一 .psv 验证 41 列结构(§4.3)。
- 用 evaluation-2019 的 evaluate_sepsis_score.py 包装自己的预测,验证 utility 与全阴性基线 0。
- 与官方排行榜对照:A/B 上 0.40+ 属正常水平;勿期望在 C 系统复现正分(官方前排亦为负)。
附录 G 与库内 cinc 系列条目的横向对照
| 条目 | 年份 | 模态 | 核心创新 | 许可 |
|---|---|---|---|---|
| cinc-2015(487) | 2015 | 手术室生理信号 | 提前量奖励首秀 | 开放 |
| physionet-cinc-2016(382) | 2016 | 心音 | 噪声鲁棒分类 | 开放 |
| physionet-cinc-2017(162) | 2017 | 单导联 ECG | 房颤/正常/噪声三分类 | 开放 |
| cinc-2018-sleep(493) | 2018 | 多导睡眠图 | 睡眠分期 | 开放 |
| cinc-2019(本条目) | 2019 | 小时级 EHR | Sepsis-3 标签 + utility 函数 | CC BY 4.0 |
| cinc-2021(644) | 2021 | 12 导联 ECG | 降导联泛化 + 部分得分 | CC BY 4.0 |
| cinc-2023(499) | 2023 | 环境音 | 音频健康事件 | 开放 |
谱系结论:cinc-2019 是系列中唯一以 EHR 表格时序 + 临床结局预测 为题的届次,也是 utility 函数最完整的实现——后续各届的部分得分制均可视为其思想的变体。
附录 H 关键数字一页卡(终稿对账)
公开训练患者 40,336 = A 20,336 + B 20,000
A = BIDMC 20,336 例 / 脓毒症 1,790(8.8%)/ 739,663 行 /
5,536,849 非空点 / 密度 20.6%
B = Emory 20,000 例 / 脓毒症 1,142(5.7%)/ 684,508 行 /
4,950,064 非空点 / 密度 19.1%
合计 脓毒症 2,932(≈7.3%)/ 1,424,171 行 / 10,486,913 非空点
隐匿测试 22,761(CinC 会议版)/ 24,819(CCM 期刊版,权威)
全库口径 over 2.5M hourly windows / over 15M data points / 42 MB
列结构 41 = 8 生命体征 + 26 实验室 + 6 人口学 + SepsisLabel
任务 提前 6-12h 因果预测;SepsisLabel 前移 6h
utility 参数 dt_early=-12 dt_optimal=-6 dt_late=+3
max_u_tp=1 min_u_fn=-2 u_fp=-0.05 u_tn=0
参赛规模 104 队 853 entries / 88 队 430 entries / 90 篇摘要
冠军 Morrill et al. 0.360(A 0.433 / B 0.434 / C −0.123)
星号最高 Meicheng Yang et al. 0.364(C −0.048)
关键泛化事实 前排全部 C 系统负分(−0.042 至 −0.156)
许可与版本 CC BY 4.0 / 仅 v1.0.0(2019-08-05)
DOI/RRID 10.13026/v64v-d857(v1.0.0)/ 0y7p-s471(latest)/ SCR_007345
论文 CCM 2020;48(2):210-217(8 人)/ CinC 2019(9 人含 Seyedi)
组织方 Emory BMI 牵头 + Georgia Tech + MIT LCP + MGH + UCSD
附录 I 最小读取示例(.psv → DataFrame)
import pandas as pd
from pathlib import Path
# 单个患者:41 列,每行 = ICU 第 ICULOS 小时,缺失为 NaN
df = pd.read_csv("training/training_setA/p00101.psv", sep="|")
print(df.shape) # (小时数, 41)
print(df.columns.tolist())
# ['HR', 'O2Sat', 'Temp', 'SBP', 'MAP', 'DBP', 'Resp', 'EtCO2',
# 'BaseExcess', ..., 'Platelets', 'Age', 'Gender', 'Unit1', 'Unit2',
# 'HospAdmTime', 'ICULOS', 'SepsisLabel']
# 全库装载(A+B,40,336 个 .psv)
files = sorted(Path("training").rglob("*.psv"))
assert len(files) == 20336 + 20000 # 40,336
total_rows = 0
for f in files:
total_rows += sum(1 for _ in open(f)) - 1 # 减表头
assert total_rows == 739663 + 684508 # 1,424,171
# 标签口径自检:SepsisLabel=1 的行应满足"前移 6h"结构
# (患者级核对:septic 患者 t >= t_sepsis-6 起 label=1)
提示:以上断言数字即 §4.1 硬数字,装载后先跑断言再建模,可拦截一切文件错位/镜像漂移问题。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cinc-2012 — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 挑战赛数据集 / 评测基准
- mimic-iii — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 评测基准
- clif — 共享标签:电子健康记录 / 重症监护 / 时序数据 / 评测基准
- ehrshot — 共享标签:电子健康记录 / 时序数据 / 评测基准
- hirid — 共享标签:电子健康记录 / 重症监护 / 时序数据
- eicu-collaborative — 共享标签:电子健康记录 / 重症监护 / 时序数据
- mimic-iv-ed — 共享标签:电子健康记录 / 重症监护 / 时序数据
- mimic-iv-ed — 共享标签:电子健康记录 / 重症监护 / 时序数据
- mimic-iv-clinical-database — 共享标签:电子健康记录 / 重症监护 / 时序数据
- amsterdamumcdb — 共享标签:电子健康记录 / 重症监护 / 时序数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

