Nosocomial Risk Datasets — MIMIC-III 院内感染风险队列 AI-Ready Wikipedia

Nosocomial Risk Datasets:34,878+35,218+38,385 住院 × 临床文本的间接监督标签工厂——用规则造标签、用文本学风险的院感预测基准

来源 https://physionet.org/content/nosocomialriskdata/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 34
Nosocomial Risk Datasets — MIMIC-III 院内感染风险队列 AI-Ready Wikipedia

信息速览

数据集名称Nosocomial Risk Datasets — MIMIC-III 院内感染风险队列 AI-Ready Wikipedia
数据类型HAAKI 34,878 住院,HAPI 35,218 住院,HAA 38,385 住院,24-96h 预测窗,UMLS CUI 快照序列
规模来自 MIMIC-III 46,520 患者的三疾病住院队列(HAAKI 34,878 / HAPI 35,218 / HAA 38,385)
接入方式https://physionet.org/content/nosocomialriskdata/
AI 就绪度

INFOBOX

属性 内容
名称 Nosocomial Risk Datasets from MIMIC-III(医院获得性疾病风险数据集)
维护方 Travis Goodwin(NIH NLM Lister Hill National Center for Biomedical Communications)/ PhysioNet
发布 v1.0(2022-09-15,initial release,无后续版本)
上游 MIMIC-III v1.4(46,520 患者;2001-2012 BIDMC)
规模 HAAKI 34,878 住院(34.2%)/ HAPI 35,218 住院(11.1%)/ HAA 38,385 住院(39.8%)(排除 <2 天住院)
任务 医院获得性疾病风险预测:入院 ≥48h 后发生、提前 24-96h 预报(§1.7 时间窗口径)
三疾病 HAAKI(KDIGO)/ HAPI(NPUAP)/ HAA(WHO)——UMLS 种子+词汇模式+结构化标准三判据
数据形态 chronologies(UMLS CUI 快照序列)+ admittimes + labels 三 CSV × train/devel/test × 三疾病
标签方法 间接监督:DOE 截断造正例 + Gamma 先验采样造负例(无逐快照人工标注)
基准 CANTRIP(JAMIA 2020):纯文本 AUC 74.61-87.05%,对比 LR/SVM/biLSTM
格式 CSV(gzip)+ GitHub 工具链(h4ste/cantrip,TensorFlow)
访问 PhysioNet 受控(基于 MIMIC-III 衍生;CITI + DUA)
DOI 10.13026/pm60-0g49(v1.0);论文 DOI 10.1093/jamia/ocaa004
平台 PhysioNet / CANTRIP GitHub

§0 E-E-A-T 信任声明与免责声明

  • 核查路径:本文数字取自 PhysioNet 官方条目页(v1.0,2022-09-15 发布)与官方论文(JAMIA 27(4):567-576, 2020,PMID 32065628)双源交叉;模型配置与文件格式以 GitHub h4ste/cantrip 官方仓库为准;合规环境以 PhysioNet 站内政策公告(DSP 2025 / LLM 2025-09-24)为准。
  • 名称勘误:该数据集为 MIMIC-III 的衍生数据集(官方标题即如此)——检索与引用时注意与"MIMIC-IV 系院感研究"区分;本条目以官方命名为准。
  • 口径纪律:34.2%/11.1%/39.8% 是构造队列内的患病率(正例占比,队列经抽样构造),不是 BIDMC 全院流行率——两者混用是本数据集文献最常见的硬伤。
  • 免责:本条目面向 AI 工程师与临床 NLP 研究者,不构成临床建议;标签由算法规则自动生成(间接监督),任何临床决策支持用途须先经前瞻验证。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:MIMIC-III 上派生的医院获得性疾病风险预测基准——三个疾病(HAAKI/HAPI/HAA)各一套文本派生时序特征(chronology)+ 间接监督标签,配套 CANTRIP 模型与 JAMIA 论文。
  • 关键数字:34,878/35,218/38,385 住院(三疾病队列);24-96h 预测窗;CANTRIP 纯文本 AUC 74.61%-87.05%。
  • 独特之处:标签是规则自动生成的——DOE(事件日期)三判据判定 + 时间窗截断 + Gamma 采样负例,零人工逐例标注。
  • 适合谁:临床 NLP(文本时序建模)、弱监督/间接监督方法研究、患者安全预警系统原型。
  • 一句话:它是"用规则造标签、用文本学风险"的方法学样板——模型可替换,标签工程思想长存。

§1.1 摘要

Nosocomial Risk Datasets from MIMIC-III 是 NIH 国家医学图书馆(NLM)Lister Hill 中心发布的医院获得性疾病风险预测数据集(PhysioNet v1.0,2022-09-15)。它从 MIMIC-III(46,520 患者)中排除住院记录不足 2 天者后,为三种常见医院获得性疾病构建了独立队列:医院获得性急性肾损伤(HAAKI,34,878 住院)、医院获得性压力性损伤(HAPI,35,218 住院)、医院获得性贫血(HAA,38,385 住院)。每个住院的"临床时间线"被抽象为 chronology——离散不连续的快照序列,每个快照编码同一天全部临床笔记经 MetaMap Lite 抽取的 UMLS CUI 观测。标签采用间接监督:先以三判据(UMLS 种子概念/词汇模式/结构化标准)回顾性确定事件日期(DOE),正例截断至 DOE 前 24-96 小时,负例按人口学与入院特征分桶后以 Gamma 先验采样模拟"本应发生而未发生"的时间线。官方 CANTRIP 模型(reCurrent Additive Network)证明纯文本即可获得 74.61%-87.05% 的 AUC,与结构化特征模型文献报告相当——临床文本作为预测信号的竞争力由此奠定。

§1.2 战略价值

  1. 标签工程的教科书:医疗 AI 最稀缺的不是数据而是标签——本数据集示范了"规则判定事件日期→时间窗截断→分布匹配负例"的完整自动标签流水线,任何"标注贵"的院内预测任务都能借鉴这套思路。
  2. 文本时序的基准地位:在 MIMIC-III notes 上做时序建模的标准对比点(CANTRIP + 三浅层基线 + 完整指标表)——临床 NLP 方法论文的可复现锚点。
  3. 患者安全视角的独特任务族:AKI/压疮/贫血是"住院期间获得"的疾病——预测它们的提前量直接换算为干预窗口,与死亡预测等"结局预测"任务形成互补的任务生态。
  4. 纯文本信号的存在性证明:CANTRIP 不用任何实验室值/生命体征即达 AUC 74-87%——为"文本里有多少结构化数据之外的信息"这一根本问题提供了量化证据。
  5. 低门槛的弱监督教学样本:数据形态轻量(三个 CSV)、工具链开源、论文方法学透明——是学习"间接监督/弱标签"范式成本最低的真实临床数据集。

§1.3 同类数据集横向对比

数据集 任务 特征形态 标签来源 相对定位
Nosocomial Risk(本条) 院感三疾病 24-96h 预测 文本派生 CUI 快照 规则间接监督 标签工厂样板
MIMIC-III benchmark(490 条) 死亡/LOS/表型/恶化 结构化 76 维 结算编码/临床定义 结构化基准
MIMIC-IV(492 条) 通用 ICU 研究 双模块结构化+文本模块 无预置标签 上游原材料
eICU 预警研究 多中心恶化 结构化 临床定义 外推验证
单疾病公开集(如 sepsis 竞赛数据) 单疾病早筛 混合 竞赛标注 单点深挖

结论:本数据集的生态位不是"更大更全",而是**“标签方法论可复制”**——在所有公开 ICU 数据集里,它把"如何在不标注的情况下得到可用的风险标签"回答得最完整。

§1.4 版本与方法学时间轴

时间 事件
2018-2019 CANTRIP 仓库开发(GitHub 最后 commit 2019-10,JAMIA 初稿期;TensorFlow 1.x 生态)
2020-04 JAMIA 论文发表(27(4):567-576;DOI 10.1093/jamia/ocaa004)
2022-09-15 PhysioNet 上架 v1.0(DOI 10.13026/pm60-0g49;initial release)
2022 至今 无版本更新——数据冻结,标签/划分长期稳定(对基准复现是优点)

⚠️ 单版本数据集的"版本纪律"简单得多:所有文献数字都基于 v1.0——但仍要核对论文正文与补充材料(Supplementary)的口径差异(§1.7)。
⚠️ 工具链是 TF 1.x 时代产物——新环境复现要么搭旧环境,要么迁移模型代码(标签 CSV 本身与框架无关,可直接用)。

§1.5 应用场景矩阵

场景 推荐度 用到的资源 关键注意
文本时序模型研究 ★★★★★ chronologies + 官方划分 与 Table 2 四基线对比
弱监督/间接监督方法学 ★★★★★ 全套标签 CSV + 论文方法节 负例采样假设的敏感性分析
患者安全预警原型 ★★★★ 三疾病任一队列 提前量-精度权衡曲线
NLP 特征工程教学 ★★★★ MetaMap Lite 管线复现 过滤规则四条逐条实现
与 MIMIC-III 上游联用 ★★★ subject_id/hadm_id 反查结构化数据 需上游 MIMIC-III 独立授权
临床落地 ★★ 全部 标签噪声+单中心,须前瞻验证

§1.6 组件全景:三疾病 × 三文件 × 三划分

  • 数据组织:HAAKI/HAPI/HAA 三疾病各自独立——每疾病 9 个 CSV(train/devel/test × chronologies/admittimes/labels),共 27 个文件的矩阵结构。
  • chronologies CSV:[subject_id],[hadm_id],[timestamp],[observations]——observations 是空格分隔的 UMLS CUI 序列(一个快照=同一天全部笔记的观测并集);这是"文本的结构化压缩"——保留语义、去除原文。
  • admittimes CSV:[subject_id],[hadm_id],[timestamp]——入院时刻(Δ 计算的起点)。
  • labels CSV:[subject_id],[hadm_id],[timestamp],[label]——label=1 的行标记 DOE 日;工具链据此自动截断与剔除 present-on-admission。
  • 官方工具链:h4ste/cantrip(TF 1.x)——run_experiment.py 一条命令完成截断/训练/评估(–min_pred_window 24 --max_pred_window 96)。
  • 不在数据里的:原始笔记文本、结构化化验值、人口学表——都要回 MIMIC-III 上游取(本数据集只发"加工品")。

§1.7 口径速记:五个必背口径

  • 队列规模三口径:HAAKI 34,878 / HAPI 35,218 / HAA 38,385 住院——引用必须带疾病名;三者不是同一批住院(正负例构成不同)。
  • 患病率语义:34.2%/11.1%/39.8% 是构造队列内正例占比——HAPI 的 11.1% 接近临床流行率直觉,HAA 的 39.8% 远高于流行率(队列构造所致)。
  • 时间窗双表述:摘要/方法节"24-96h 提前量",Usage Notes"48-96h"——并存(存照 §10.1-A);训练参数以 --min_pred_window 24 --max_pred_window 96 为准。
  • 疾病定义口径:“医院获得”=入院 ≥48h 后被 chart/labs/notes 证实(implicated)——不是 ICD 出院编码口径(仅 ICD 命中者被排除)。
  • 性能口径:Table 2 的 50% 阈值指标——AUC 是阈值无关的,Sensitivity/Specificity/Precision 不是;引用必须注明阈值。

§1.8 访问方式速记

  1. PhysioNet 账号 → CITI 证书 → 签署受控数据 DUA(与 MIMIC-III 同一信用体系)→ 条目页签署该项目协议。
  2. 下载:三个疾病目录下的 CSV 压缩包(体量小——文本派生 CUI 序列,远小于 MIMIC-III 本体)。
  3. 上游联用:如需原始文本/结构化数据反查,另签 MIMIC-III DUA(独立项目)。
  4. 工具链:git clone h4ste/cantrip;TF 1.x 环境(python ≥3.6, tensorflow ≥1.14)或自行迁移。
  5. 最小验证:各 chronologies CSV 的唯一 hadm_id 计数应与论文队列数一致(HAAKI 34,878 等——以官方文件实际行数为准,先跑对账脚本)。

§1.9 独特视角:一座"标签工厂"的方法学解剖

把本数据集看成一座工厂最准确:原料是 MIMIC-III 的原始临床笔记;加工流水线是"NLP 抽取(MetaMap Lite+四层过滤)→ chronology 快照化 → DOE 三判据判定 → 时间窗截断 → 分桶 Gamma 采样负例";产品是三疾病×三划分的标准 CSV。这座工厂的教学价值在于它公开了全部工艺图纸——医疗 AI 领域绝大多数"带标签"数据集只给产品不给图纸,研究者只能把标签当黑盒信任;而这里每个标签都可追溯到一条可复现的规则链。更深的启示是**“监督信号的设计空间”**:CANTRIP 论文证明这套自动标签训出的模型能逼近文献中疾病专用模型——这说明标注预算紧张时,"把临床知识编码成规则、让规则生成标签"是一条被验证过的路。理解这座工厂,等于掌握了弱监督医疗 NLP 的完整思维模板。

§1.10 用户画像:谁在使用这个数据集

  • 临床 NLP 研究者:文本时序建模的标准弱监督基准——方法论文的可复现锚点。
  • 弱监督方法学者:间接监督/标签聚合/分布匹配负例的完整教学样本——"标签工厂"全图纸公开。
  • 患者安全工程团队:HAAKI/HAPI/HAA 三预警任务的原型数据——提前量即干预窗口。
  • 数据科学课程教师:轻量 CSV+开源工具链+论文透明——研究生弱监督专题的理想教材。
  • 医院信息科工程师:把"规则造标签"的工艺迁移回院内 EHR 的参考实现。

§1.11 名词速查表

缩写/术语 全称与含义
HAAKI Hospital-Acquired Acute Kidney Injury——医院获得性急性肾损伤(KDIGO)
HAPI Hospital-Acquired Pressure Injury——医院获得性压力性损伤(NPUAP)
HAA Hospital-Acquired Anemia——医院获得性贫血(WHO)
DOE Date-of-Event——事件日期(三判据首次命中日,间接监督的锚点)
chronology 临床时间线的快照序列抽象(日粒度快照+间隔 δ)
CUI Concept Unique Identifier——UMLS 概念唯一标识符
OASIS Oxford Acute Severity of Illness Score——负例分桶的病情匹配键
ECE Estimated Calibration Error——期望校准误差
CANTRIP reCurrent Additive Network for Temporal RIsk Prediction——官方模型
MetaMap Lite UMLS 驱动的轻量医学实体抽取工具(官方管线第一环)

§2 医学与科学背景

§2.1 为什么"提前量"是患者安全的硬通货

医院获得性疾病的临床悲剧在于"发现时已成定局":AKI 的现行标准(KDIGO)本质上是肾损伤已发生的标记物,压疮的肉眼确认意味着组织损伤已存在,贫血常在化验单上"意外"现身。患者安全工程的破局思路是把发现转化为预报——而预报的价值由两个参数决定:提前量(多早知道)与精度(多准)。本数据集把这两个参数直接编码进任务定义:住院 ≥48h 后证实为"医院获得",预测窗 24-96h——提前 1 天以上的预报才有干预意义(停肾毒性药/翻身减压方案/小容量采血管),提前 1 小时的预报只是提前的坏消息。这个"提前量即价值"的任务设计哲学,与 486-488 波形库的报警研究一脉相承,是临床预测建模区别于一般 ML 竞赛的核心。

§2.2 三疾病的临床负担图谱

三个疾病不是随手挑的——它们是"住院获得、可预防、负担可量化"的代表:

  • HAAKI:AKI 影响多达 20% 的住院,与死亡率升高、终末期肾病、慢性肾病相关(论文引 Silver 2017/Chertow 2005);现行标准是"损伤标记物"而非"预报器"——这是数据集声称"首个用临床笔记预测 AKI/HAAKI 的数据集"的动因。
  • HAA:入院血红蛋白正常的患者住院期间转为贫血,住院时长、费用与院内死亡风险(依严重程度 +51%-228%,Henderson 2013)显著上升;ICU 患者日均采血 40-70mL,每多采 50mL 中重度 HAA 风险 +18%——医源性色彩最强的目标,干预手段明确(小容量管/减少化验)。
  • HAPI:压疮引发脓毒症、蜂窝织炎、骨髓炎等并发症,老年住院期间发生压疮者出院后 1 年死亡率高达 60%(论文引文献);ICU 缺少公认的专用风险量表(Braden 量表在 ICU 特异性低)——数据驱动检测的价值主张清晰。

三疾病覆盖"器官功能/医源性血液损耗/皮肤完整性"三条患者安全主线,构成一个最小但完整的预警任务组合。

§2.3 间接监督范式:无标注的监督学习

逐快照标注"该患者此刻 48h 内发生 AKI 的风险"在成本上不可行(每个住院数百快照×数万住院)。本数据集的答案是间接监督(indirect supervision):不标注"每个时刻的风险",只标注"事件在哪天发生"(DOE),再让时间窗截断自动生成训练信号——DOE 前最后快照 y=1,负例用分布匹配模拟。这在弱监督谱系中属于"标签聚合+时间约束"的组合:DOE 本身由规则生成(三判据),而规则的可信度由临床标准(KDIGO/NPUAP/WHO)背书。理解这一范式的关键是接受标签噪声的系统性:DOE 判定误差(NLP 抽取漏检/规则边界)会以结构化方式传入训练信号——研究者的职责不是假装无噪声,而是测量并报告噪声结构(§5 泄漏与消融)。

§2.4 chronology 抽象:不规则间隙的时序解决方案

临床笔记的产出由临床流程驱动——记录密度极不均匀(住院首日十余条,周末可能整天空白)。直接把笔记当等间隔时序是伪命题。chronology 的解法是双序列抽象:L 个快照(每天一条,观测并集)+ 间隔序列 δ(相邻快照间的小时数,δ0 为入院到首条笔记)——时间信息不丢失但不强加均匀网格。这个抽象让模型自己学习"间隔多久的两次观测意味着状态变化",CANTRIP 的 δ 编码选项(–delta_enc sinusoid,正弦编码)正是消费这一设计的接口。对迁移者的启示:处理不规则临床事件流时,"快照+间隔"是最小可行的中间表示——比等间隔插值保留更多信息,比原始事件流更易批处理。

§2.5 纯文本信号的竞争力论证

“文本里到底有多少信息"是临床 NLP 的根本问题。本数据集给出了一个干净的存在性证明:CANTRIP 只消费 CUI 快照(无任何化验值/生命体征),AUC 达 74.61%(HAA)-87.05%(HAPI)-79.10%(HAAKI),论文结论"与文献报告的疾病专用模型性能相当”。注意论证的边界:①"相当"是文献对齐而非同队列头对头——严格比较需在同一队列跑结构化基线(数据集未提供,研究者可用上游 MIMIC-III 自建);②文本信号的部分来源是结构化数据的文本投影(化验值常以文字出现于笔记)——“纯文本"不等于"独立于化验数据的信息”。这个论证的真正价值是为多模态融合研究设定了"文本单模态下限"——任何文本+结构的融合模型应显著超过此线。

§2.6 NLP 管线的知识工程

从原始笔记到 CUI 快照的管线是四层漏斗:①MetaMap Lite 抽取全部候选观测;②否定/不确定/家族关联过滤(非肯定、非确定、非现患、非患者本身的观测剔除——“其母亲有糖尿病"不能算患者观测);③章节过滤(consults/family history/past medical history/social history 章节的观测剔除——历史与会诊信息不构成本次住院的现患证据);④语义类型过滤+停用词(UMLS 语义类型限医学问题/干预/药物/解剖部位;InfoBot 医学停用词表)。这套规则的每一层都是"临床认识论"的编码:什么算证据、什么算关联、什么算现患。复现者最容易低估的是第②③层——它们决定了"住院期间新出现”(nosocomial 语义)与"入院时已存在"(present-on-admission)的分界,正是任务定义的命门。

§2.7 DOE 三判据的三角验证

DOE 判定用三判据取最早命中:①本体判据(UMLS 种子概念后代——语义泛化,"renal failure"及其下位概念都算);②词汇判据(正则模式——捕捉本体漏掉的表述,且排除冒号后缀的结构化模板如 “bed sore: none”——后者是阴性陈述);③结构化判据(KDIGO/NPUAP/WHO 标准直接查化验/chart——文本完全沉默时的兜底)。三角设计的意义:任何单判据都有系统性盲区(本体覆盖不全/正则过拟合/结构化标准滞后于临床文本),三判据并集最大化召回,而"最早命中日"的一致性由论文 Figure 1 的分层统计透明呈现(各判据贡献的比例逐疾病给出)。移植到其他疾病时,这套"本体+词汇+结构化"三判据模板可直接套用——先选种子 CUI,再写领域正则(记得处理阴性模板),最后接临床标准的结构化定义。

§2.8 负例构造的分布匹配哲学

随机挑"没得病的住院"当负例会引入选择偏差(谁进负例池由结局决定)。本数据集的负例构造走"分布匹配"路线:把正例按 8 个协变量(年龄/性别/种族/ICU/入院来源/入院类型/OASIS/保险)分桶,每桶内用 MLE 拟合正例 TTE(入院到 DOE 的小时数)的 Gamma 分布,然后给负例采样一个模拟 DOE’(min(入院+TTE’, 出院日))——负例与正例在"何时会得病"的分布上对齐,负例时间线截断到 DOE’ 前 24-96h。这保证模型学的是"即将发生 vs 尚未到点"而非"病得重 vs 病得轻"。代价是负标签带上了分布假设的烙印(Gamma 形状选择/分桶稀疏区的估计不稳)——敏感性分析(换分布/换分桶)是使用本数据集的必修消融。

§2.9 与医院感染监测体系的关系

医院获得性疾病的"官方监测"由 CDC NHSN 等体系承担(点患病率调查如 Magill NEJM 2014:全美多州调查确立 HAI 负担基线)。本数据集与之的分工:监测体系回答"有多少"(流行病学计数,依赖人工病历回顾与统一标准),本数据集回答"谁能提前知道"(预测建模,依赖自动化标签)。两者的标准族不同(NHSN 的感染标准 vs KDIGO/NPUAP/WHO 的疾病标准)——本数据集的三疾病刻意避开"感染"定义的复杂性(HAAKI/HAPI/HAA 都非感染类),恰是绕开 NHSN 标准争议、选择有明确临床标准的疾病的务实选择。理解这层分工,才能准确定位论文标题里 “nosocomial” 一词的边界:它是"医院获得"的广义用法,不是"医院感染"(HAI)的狭义用法。

§2.10 单中心标签的可迁移性边界

标签工厂的全部工艺都打上了 BIDMC 的烙印:笔记模板(章节结构决定第③层过滤的有效性)、临床惯例(化验频次决定结构化判据的灵敏度)、MetaMap 对该院文本风格的适配度。迁到另一家医院,三层都要重检:章节名不同则过滤规则失效;采血惯例不同则 HAA 的结构化判据漂移;文本风格不同则 CUI 抽取误差结构改变。可迁移的是工艺流程(四层漏斗+三判据+Gamma 采样),不可直接迁移的是工艺参数。这正是本数据集把自己定位为"方法学样板"而非"即用预警器"的深层原因——它的 GitHub 可以 fork,它的标签不能直接照抄。

§2.11 从数据到证据:弱监督研究的证据层级

本数据集上能产出的研究按证据强度排序:①方法学基准研究(新模型 vs Table 2——证据强度依赖官方划分的严格遵守);②标签协议研究(消融判据/负例策略——产出可迁移的工程知识);③模态价值研究(文本 vs 结构化 vs 融合——需上游自建对照);④跨库协议迁移(向 MIMIC-IV 复刻——增量最大但需重建全部判定器);⑤部署前瞻研究(超出数据集边界——本数据集只能提供回放级验证)。层级每上一级,对"标签噪声结构"的测量义务递增——这是弱监督数据与金标注数据的本质区别。

§2.12 OASIS 评分与分桶工程

分桶变量里的 OASIS(Oxford Acute Severity of Illness Score,Johnson 2013)值得单独一节:它是从 MIMIC 的急性生理数据子集计算的严重度评分——与 SAPS II/APACHE 同族但设计目标是"最小数据可获得"。在本数据集的角色是负例采样的病情匹配键:没有它,负例会系统性地比正例"健康"(进 ICU 的轻症患者占比失真),模型学到的将是严重度而非疾病前兆。复现分桶时的工程细节:OASIS 需从上游 MIMIC-III 计算(官方概念 SQL 可用)——这是"本数据集+上游"联用的刚需场景之一;桶键缺 OASIS 的简化实现会在 HAAKI(严重度依赖最强的疾病)上出现可测量的性能假象。

§2.13 双窗语义:48h 获得线与 24h 提前线

任务定义里的两个时间常数承担不同角色:48h 线是"医院获得"的资格线——入院 48h 内证实者属 present-on-admission(入院已带病),被工具链自动剔除;24h 线是预测的底线——截断点不得晚于 DOE 前 24h(更近的截断无干预价值)。两线相夹出预测窗的工作区,96h 上限则封顶"远期模糊区"。三线齐读:48h 剔除→96h 封顶→24h 兜底,构成 24-96h 训练窗的全部边界逻辑。混淆三者的角色(比如把 48h 当预测窗下限)会让复现偏差伪装成"数据集噪声"——先画时间轴再写代码是本数据集工程的起手式。

§3 数据集规格

§3.1 规格总表

维度 规格
全称 Nosocomial Risk Datasets from MIMIC-III
版本 v1.0(2022-09-15 发布;initial release,无后续版本)
上游 MIMIC-III v1.4(46,520 患者;2001-2012 BIDMC;Credentialed)
任务 医院获得性疾病(入院 ≥48h 后证实)风险预测,预测窗 24-96h
队列 HAAKI 34,878 住院(prevalence 34.2%)/ HAPI 35,218(11.1%)/ HAA 38,385(39.8%)
划分 每疾病 8:1:1 分层随机(train/devel/test)
特征 chronology 快照序列(MetaMap Lite→UMLS CUI,四层过滤)
标签 间接监督(DOE 三判据+截断+Gamma 采样负例)
文件 三疾病 × 三划分 × 三 CSV(chronologies/admittimes/labels)
基准 CANTRIP(AUC 74.61/87.05/79.10%)vs LR/SVM/biLSTM
格式 CSV(gzip)+ GitHub 工具链(TF 1.x)
访问 PhysioNet 受控(CITI+DUA)
DOI 10.13026/pm60-0g49;论文 10.1093/jamia/ocaa004

§3.2 队列构造漏斗与口径地图

从 MIMIC-III 到三疾病队列的构造路径(论文正文口径):

MIMIC-III 46,520 患者
  └→ 全部住院(admissions)
       └→ 排除住院记录 <2 天者( chronology 无法形成有效快照窗)
            └→ 按疾病分别构造:
                 HAAKI:34,878 住院(正例占比 34.2%)
                 HAPI :35,218 住院(正例占比 11.1%)
                 HAA  :38,385 住院(正例占比 39.8%)
                     ├→ 正例:DOE 三判据命中(note 本体/词汇/结构化标准)
                     └→ 负例:分桶 Gamma 采样模拟 DOE'
                          (仅满足出院 ICD-9/CCS 编码、无 DOE 依据者被排除)

三个队列是三次独立构造(各自抽样、各自划分)——不是同一批住院的三种标签。跨疾病比较模型性能时,记住队列构成不同(HAPI 正例率最低、任务最难,其 AUC 87.05% 的含金量因此更高)。每个队列内部 8:1:1 分层随机切分(分层键=标签),患者级防泄漏需自查(§5.3)。

§3.3 DAIMS 数据AI就绪度评估

维度 评分 说明
机器可读性 8.5/10 纯 CSV、格式简单、体量小;CUI 序列需 UMLS 词典解码
文档完备性 8/10 官方条目页+JAMIA 论文+GitHub 工具链三源一致;正负例绝对数藏在补充材料
数据质量 7/10 标签为规则生成(可追溯但带系统性噪声);文本派生特征受 MetaMap 误差传递
语义标准化 8.5/10 全量 UMLS CUI——语义互操作性好;三判据与临床标准(KDIGO 等)显式对齐
时间语义 7.5/10 快照+间隔序列保留不规则时间结构;上游 MIMIC-III date shift 继承
可复现性 8.5/10 官方划分+官方指标表+开源工具链;TF 1.x 环境折旧是主要摩擦
合规摩擦 中 受控访问同 MIMIC-III;衍生品发布须守 PhysioNet Ext 规范
综合 7.8/10 方法论透明度顶级、任务专精型数据集的 AI-Ready 标杆

§3.4 存储与计算需求

  • 磁盘:全套 CSV 压缩包体量小(文本派生 CUI 序列远轻于 MIMIC-III 本体;GB 级以内)——任何笔记本可承载。
  • 内存:单疾病队列全量载入 pandas 完全可行;三个疾病全量+中间特征 <16 GB。
  • 训练:CANTRIP 时代硬件(2019)即可复现官方基准——现代单卡轻松覆盖;TF 1.x 环境建议 docker 固定(或迁移到 PyTorch,标签 CSV 与框架无关)。
  • UMLS 解码:需 UMLS 词典(免费但需 UTS 账号)——CUI→概念名的映射表;只做建模可不解码(CUI 即 token)。
  • 无需:PostgreSQL/BigQuery——本数据集无关系库形态;如需反查上游结构化数据才涉及 MIMIC-III 数据库。

§3.5 获取通道

  1. PhysioNet 官方(唯一正式渠道):CITI 证书+受控 DUA→条目页签署项目协议→下载三疾病 CSV 包(DOI 10.13026/pm60-0g49)。
  2. 工具链:GitHub h4ste/cantrip(模型代码/评估脚本/参数示例)——数据与代码分离下载。
  3. 上游 MIMIC-III(可选):反查原始文本/结构化数据时另签 MIMIC-III DUA——subject_id/hadm_id 双键对齐。
  4. UMLS 词典:(可选)UTS 账号下载 Metathesaurus——CUI 解码与语义类型过滤复现必需。
  5. 合规提示:2025 年起 PhysioNet 受控数据访问受美国 DSP 政策(EO 14117)地域限制约束(§8);数据与派生品不得上传第三方在线服务(LLM 条款同适用)。

§3.6 口径对齐表

想回答的问题 用的口径 数值/规则
某疾病队列多大? 该疾病住院数 HAAKI 34,878 / HAPI 35,218 / HAA 38,385
某疾病多常见? 构造队列 prevalence 34.2% / 11.1% / 39.8%(非全院流行率)
提前多久预测? 训练窗口参数 min 24h / max 96h(摘要口径 24-96h;Usage Notes 48-96h——存照)
"医院获得"怎么算? 入院 ≥48h 后被证实 chart/labs/notes 证据;非 ICD 出院编码口径
模型该多好? Table 2(50% 阈值) CANTRIP AUC 74.61-87.05%;指标带阈值声明
数据多大? CSV 压缩包 GB 级以内(轻量;无官方精确值——存照)

§3.7 文件格式规范(逐字段)

<split>.chronologies.csv   # split ∈ {train, devel, test}
  subject_id, hadm_id, timestamp, observations
  # observations = 空格分隔 UMLS CUI 串(如 "C0022660 C0002871 ...")
  # 一个 timestamp = 一个快照 = 同一日历日全部笔记的观测并集
  # 间隔信息(δ)由相邻 timestamp 差值隐式携带

<split>.admittimes.csv
  subject_id, hadm_id, timestamp
  # timestamp = 该住院的入院时刻(δ0 与 TTE 的计算起点)

<split>.labels.csv
  subject_id, hadm_id, timestamp, label
  # label=1 行的 timestamp 标示 DOE(事件日期);label=0 为其余快照
  # run_experiment.py 据此自动截断 chronology 并剔除 present-on-admission

解析要点:①三文件以 (subject_id, hadm_id) 双键关联;②chronologies 无表头假设需以官方文件实际格式为准(先 head 对账再写解析器);③时间均为上游 MIMIC-III 去标识时间(date shift 后)——绝对年份无意义,相对间隔恒真;④CUI 是"最小语义单元"——任何特征工程先问"这个 CUI 在 UMLS 里是什么语义类型"。

§3.8 DOE 判定标准速查表

疾病 UMLS 种子 CUI 词汇模式(正则族) 结构化标准
HAAKI C0022660(Kidney Failure, Acute) kidney failure / renal failure / kidney injury / renal injury / AKI KDIGO
HAPI C0011127(Pressure Ulcer) bed sore / bed ulcer / pressure sore / pressure ulcer / decub* sore / decub* ulcer NPUAP
HAA C0002871(Anemia) anemia / anaemia / HAA WHO

判定规则:DOE=三判据最早命中日;词汇匹配排除"冒号后缀"结构化模板(“bed sore: none” 是阴性);仅 ICD-9/CCS 出院编码命中者不产生 DOE(住院被排除)。三判据各自贡献比例见论文 Figure 1——复现判定器时按疾病逐条对账。

§3.9 官方文档导航

四份一手材料的分工:①PhysioNet 条目页——任务定义/队列规模/文件格式/伦理(本文 §3 的主要来源);②JAMIA 论文——方法学细节(判据命中比例/负例协议/完整实验)+Table 2 基准;③GitHub h4ste/cantrip——唯一权威实现(截断逻辑/参数默认值/指标计算);④Supplementary 材料——正负例绝对数等正文未载细节。检索顺序建议:条目页(是什么)→论文(为什么)→仓库(怎么做)→补充材料(数字细节)。社区二手博客与教程仅作导航用,数字一律回一手材料对账——本数据集文献里 prevalence 误用率高(§6.5 坑点 1),二手转述是重灾区。

§3.10 三疾病临床背景深读

三个疾病的选择逻辑可以在"可预防性-证据可计算性"平面上细读:HAAKI——KDIGO 标准完全实验室驱动(肌酐/尿量),结构化判据最可靠,但"标准即晚期标记"的悖论使文本提前量最有价值;HAPI——纯临床观察型疾病(无化验金标准),三判据中词汇/本体判据权重最大,标签质量最依赖 NLP 管线,也是唯一有 NPUAP 分期体系可引用的目标;HAA——机制最明确(采血丢失+急性病消耗),结构化判据(HgB 序列)最直接,干预窗口的经济价值最可量化(小容量管成本 vs 输血风险)。三疾病合起来恰好覆盖"实验室驱动/观察驱动/机制驱动"三种标签生成模式——这就是为什么"扩展到新疾病"时三判据配比要重新设计。

§3.11 轻量数据集的 CI 集成

GB 级以内的体量使本数据集成为 MIMIC 系中唯一适合进 CI 的基准:①数据一致性检查(hadm_id 计数/三 CSV 双键一致/DOE 行数)入 pre-merge 检查;②LR 基线冒烟测试(AUC 偏差 <2%)入 nightly——防止管线静默劣化;③截断协议的单元测试(边界 24h/96h 整点/48h 排除规则)——照 run_experiment.py 写断言。这套 CI 让"复现包"从静态承诺变成活资产——每次依赖升级/代码重构后基准自动对账。教学价值同样直接:数据工程课上"为弱监督数据集搭 CI"是绝佳的实战题目。

§4 数据结构

§4.1 chronology 对象模型

住院(hadm_id)
  ├─ admittime ──────────────── δ0 ──┐
  │                                  ▼
  │   s1 ──δ1── s2 ──δ2── s3 ─ ⋯ ─ sL
  │   │          │          │          │
  │ 快照=当日全部笔记的观测并集(UMLS CUI 集合)
  │
  └─ DOE(label=1 的 timestamp)
       └─ 正例:截断至 DOE 前 24-96h 的最后快照 s_k → y=1,Δ=t(s_k)→DOE
       └─ 负例:DOE' ~ min( admittime + TTE', dischtime ),TTE'~Γ(k_b,θ_b)
                 截断方式同正例 → y=0

三个工程语义:①快照是日粒度(同日多笔记合并)——小时级预测窗是"截断点选择"而非"快照粒度";②间隔 δ 是一等公民——模型的时序感知(正弦编码)消费的是它;③标签只锚定日期——同一天内的时刻语义由快照机制吸收。

§4.2 标签文件解剖与自动截断协议

labels CSV 的巧妙处在于用一个 0/1 列编码了完整的监督协议:label=1 行=DOE 日。官方工具链的处理流程(可直接复用):①对正例,找 DOE 前最后一个落在 [DOE-96h, DOE-24h] 窗内的快照作为预测点;②对负例,用采样 DOE’ 做同样截断;③present-on-admission 剔除——DOE 落在入院 48h 内者不属于"医院获得",工具链自动丢弃。自己实现时最容易错的三处:窗口边界(含不含 24h 整点)、负例 DOE’ 与出院日取 min、48h 排除规则先于截断执行。建议直接读 run_experiment.py 的截断函数逐行对照——它是唯一权威实现。

§4.3 NLP 管线复现(四层漏斗)

从原始 MIMIC-III 笔记重建 chronology(仅当需要扩展标签到新疾病时才必须;日常使用直接用官方 CSV):

# 伪代码框架(论文 Methods + 补充材料口径)
# 1) MetaMap Lite 抽取:每条笔记 → [(cui, semantics, span, section), ...]
# 2) 层过滤(伪码):
#    keep = affirmed and certain and patient_related      # 否定/家族关联剔除
#    keep &= section not in {consults, family_history,
#                            past_medical_history, social_history}   # 章节剔除
#    keep &= semantic_type in {problem, intervention, drug, anatomy} # 语义类型
#    keep &= cui not in InfoBot_STOPWORDS                 # 停用词
# 3) 按日历日聚合 → 快照;按时间排序 → chronology(δ 显式导出)
# 4) 对账:抽样 hadm_id 与官方 chronologies CSV 逐快照比对(覆盖率/一致率报告)

复现的现实预期:因 MetaMap 版本/参数漂移,逐 CUI 完全一致不现实——对账目标是快照级 Jaccard 相似度的分布而非逐项相等;差异分布本身写进方法学附录。

§4.4 负例采样复现(Gamma 分桶协议)

# 每疾病独立执行(论文 Methods 口径):
# bucket_keys = [age, sex, race, icu_type, admission_source,
#                admission_type, OASIS, insurance]
# for b in buckets:                      # 桶内仅用正例拟合
#     TTE_b = [hours(admittime -> DOE) for positives in b]
#     (k_b, theta_b) = MLE_Gamma(TTE_b)
# for neg in negatives:
#     b = bucket_of(neg)
#     tte = sample(Gamma(k_b, theta_b))
#     DOE_neg = min(neg.admittime + tte, neg.dischtime)
#     truncate_chronology(neg, DOE_neg)   # 与正例同窗截断

工程提醒:①稀疏桶(某协变量组合下正例过少)的 Gamma 拟合不稳——论文未给桶大小下限(存照),复现时报告桶分布与拟合并敛性;②采样随机性要固定种子并写进复现包——负例集合不同=数据集不同;③自行扩标签到新疾病时,整个分桶/拟合/采样协议照搬,桶键按可得协变量裁剪。

§4.5 与 MIMIC-III 上游的关联协议

本数据集(CUI 快照+标签) ←─ subject_id/hadm_id ─→ MIMIC-III 上游
                                                    ├─ NOTEEVENTS:原始文本(做 LLM/细粒度 NLP)
                                                    ├─ LABEVENTS/CHARTEVENTS:结构化基线特征
                                                    ├─ ADMISSIONS:人口学/保险/出入院
                                                    └─ patients:anchor 年龄等

三步协议:①双键 join(subject_id+hadm_id——两库标识符体系完全一致);②注意时间同源(同 date shift)——快照 timestamp 可直接与上游 charttime 对齐;③授权独立(MIMIC-III 单独 DUA)。典型联用场景:结构化 vs 文本的模态对比实验(§5.3)、特征级融合(CUI 序列+化验时序)、把 DOE 标签反向应用到上游结构化数据(构造"结构化版 Nosocomial 基准"——论文没做、社区有空白的增量工作)。

§4.6 数据血缘

MIMIC-III v1.4(NOTEEVENTS + 结构化表)
        │  MetaMap Lite + 四层过滤
        ▼
chronology 快照序列(UMLS CUI)
        │  DOE 三判据(本体/词汇/结构化标准)
        ▼
DOE 判定(每正例住院)
        │  正例截断 + 负例 Gamma 采样
        ▼
三疾病 × 8:1:1 标准划分(v1.0,2022-09-15 PhysioNet 上架)
        │
        ├→ CANTRIP 基准(JAMIA 2020 Table 2)
        └→ 社区复现/扩展(新疾病/新模型/新负例策略)

§4.7 完整性清单

  • [x] 三疾病队列规模官方公开(34,878/35,218/38,385)
  • [x] 标签生成规则完全公开(三判据+截断+Gamma 采样)
  • [x] 官方划分与官方指标表(Table 2)可对账
  • [x] 工具链开源(h4ste/cantrip)
  • [ ] 正/负例绝对数未在正文公开(Supplementary B)——自查时用文件实际行数
  • [ ] 原始笔记/结构化数据不含在内——须回上游 MIMIC-III
  • [ ] 工具链 TF 1.x 冻结(2019)——新环境需迁移
  • [ ] 桶级 Gamma 参数未公开——负例精确复现不可行(分布协议可复现)

§4.8 CUI 词典工程(UMLS 解码实战)

# UMLS Metathesaurus(UTS 账号免费下载)的最小消费模式
import csv
# MRCONSO.RRF → CUI -> 首选名/语义类型映射(只取 ENG 且 pref 状态行)
cui2name = {}
with open("MRCONSO.RRF", encoding="utf-8") as f:
    for row in csv.reader(f, delimiter="|"):
        if row[1] == "ENG" and row[6] == "Y":      # 英文+首选
            cui2name.setdefault(row[0], row[14])
# 快照解码示例:"C0022660 C0002871" -> ["Acute Kidney Failure", "Anemia"]
# 语义类型过滤需 MRSTY.RRF(TUI -> 语义类型名)

三个工程判断:①不解码也能建模——CUI 直接作 token,词表即 UMLS 子集(嵌入随机初始化,官方口径);②解码为解释性服务——注意力权重/重要特征归因时才需要 CUI→名称;③语义类型是过滤的词典侧镜像——管线第③层用 MRSTY 实现。磁盘预算:Metathesaurus 全量数 GB,只取 ENG 子集后可控;更新节奏跟随 UMLS 年度版本并在复现包记录版本号(CUI 覆盖率随版本微变)。

§4.9 与 phenotype-annotations 的标签方法学对照

同属"标签增强层"的 494 条目(phenotype-annotations-mimic)与本数据集构成方法学两极:表型标注以人工判读为锚(标注指南+一致性统计——标签贵但语义直白);本数据集以规则间接监督为锚(判据公开+零人工——标签廉价但语义是"规则判定结果")。对照研究的价值:同一上游上两种标签哲学的性能-成本曲线(可用表型标注做弱标签的验证集)——这是弱监督文献里少有的"同一患者群、两种标签体系"的天然对照实验场。使用建议:把表型标注集当"外部验证锚点"评估 DOE 标签的 precision(重叠疾病的阳性一致率),能把"规则准不准"从自说自话变成有参照的测量。

§3.12 与 MIMIC-III Demo 的教学分工

同为教学友好资产,491 条目(MIMIC-III Demo,100 患者开放子集)与本数据集的分工:Demo 教"数据库长什么样"(关系表/SQL/去标识机制),本数据集教"标签怎么造、弱监督怎么跑"(判据/截断/采样/评估)——前者是数据库课的沙盒,后者是方法学课的沙盒。组合用法:先 Demo 摸熟上游结构,再进本数据集跑弱监督闭环;两者都免 GPU、轻量、合规路径单一(Demo 开放、本集受控)。课程设计的含义:弱监督专题可以把两者打包成"上游认知→标签工程→建模评估"三段式,一段一个数据资产。

§5 下游分析协议

§5.1 任务×资源速查表

你要做的 直接用 说明
文本时序模型研究 chronologies+官方划分 对标 Table 2 四基线
弱监督方法学实验 全套标签 CSV+论文方法节 负例策略消融
提前量-精度曲线 labels+截断协议 Δ 分层报告
模态对比(文本 vs 结构) +上游 MIMIC-III 同队列双模态自建基线
标签扩展到新疾病 §4.3/§4.4 复现协议 种子 CUI+正则+标准三件套
教学/课程设计 三 CSV+工具链 弱监督范式最小教学样本

§5.2 官方基准复现协议

  1. 环境:TF 1.x(≥1.14)docker 固定,或迁移至现代框架(迁移后先跑通 LR 基线对齐)。
  2. 参数:论文/仓库口径——--delta_enc sinusoid --delta_combine add --dropout 0.3 --observational_dropout 0.3 --correct_imbalance weighted --num_epochs 10 --min_pred_window 24 --max_pred_window 96。
  3. 对账目标:Table 2 数值(HAA AUC 74.61% 等)——允许小偏差(TF 版本/随机种子),偏差方向与幅度要报告;四个模型(LR/SVM/biLSTM/CANTRIP)×三疾病全矩阵跑完。
  4. 指标:Accuracy/AUC/Sensitivity/Specificity/Precision/F1/MCC 七指标+校准误差(ECE)——只报 AUC 是不合格的复现。
  5. 阈值声明:官方 50% 阈值;补充 33%-50% 区间的阈值扫描(论文 Figure 5 口径)。

§5.3 新模型评估协议

  1. 划分不可动摇:官方 8:1:1——自建划分即放弃与 Table 2 的可比性;如确需患者级切分(防泄漏自查),在官方划分基础上报告泄漏审计结果(同一 subject 跨 split 的比例——8:1:1 随机切分下非零,论文口径如此,须声明而非隐瞒)。
  2. 指标集:七指标+ECE 全套;类不平衡(HAPI 11.1%)下 MCC 与 PR 曲线优先于 Accuracy。
  3. 阈值协议:主表 50%;附阈值扫描(ROC/PR 曲线+操作点标注)。
  4. 显著性:多随机种子(≥5)报告均值±标准差;与 Table 2 对比给差值区间而非单点。
  5. 消融矩阵(推荐三行):δ 编码开/关(时序感知的贡献)、负例采样策略(Gamma vs 随机 vs 全体负例)、NLP 过滤层逐层开启(②③层的贡献)。

§5.4 提前量-精度权衡协议

提前量是本数据集独有的性能轴:①把预测窗按 Δ 分桶(24-48h/48-72h/72-96h)分层评估——预期精度随提前量增大而衰减,衰减曲线就是"临床可用窗口"的量化;②报告每个提前量档位的 Precision@固定 Recall(临床部署关心的是"报警后可确化的精度");③与"诊断确认时刻"(DOE)对比模型最早报警时刻的中位数分布——"实际提前了多少"比"设计提前多少"更接近部署语义。该协议把 Table 2 的单点指标升级为临床决策曲线——患者安全预警系统论文的标配图。

§5.5 方法学段落骨架(直接套用)

本研究使用 Nosocomial Risk Datasets from MIMIC-III v1.0(DOI 10.13026/pm60-0g49;Goodwin & Demner-Fushman, JAMIA 2020),经 PhysioNet 受控协议获取。任务定义遵循官方口径:预测入院 ≥48h 后经 chart/实验室/笔记证实的医院获得性疾病,预测窗 24-96 小时。特征为 chronology 快照序列(MetaMap Lite 抽取的 UMLS CUI,经肯定性/章节/语义类型/停用词四层过滤);标签采用官方间接监督协议(DOE 三判据判定、时间窗截断、按人口学与 OASIS 分桶的 Gamma 先验负例采样)。队列:HAAKI 34,878 / HAPI 35,218 / HAA 38,385 住院,官方 8:1:1 划分。评估:50% 决策阈值下 Accuracy/AUC/Sensitivity/Specificity/Precision/F1/MCC 与 ECE,5 种子均值±标准差;与官方 CANTRIP 及三基线(LR/SVM/biLSTM)对齐比较。合规声明:数据于本地环境使用,未传输至第三方在线服务;派生模型不用于临床决策。

§5.6 扩展标签到新疾病的完整配方

以"医院获得性谵妄"为例走通全流程(示例性说明,非官方队列):①选种子 CUI——UMLS 检索 Delirium(C0011206),确认后代概念覆盖(急性意识模糊/ICU 谵妄亚型);②写词汇正则——delirium/confusion/encephalopathy 变体族+阴性模板(“no delirium”/“denies confusion”);③接结构化标准——CAM-ICU 评分记录或 ICD 触发后回溯(注意住院获得 ≥48h 约束);④跑四层过滤管线——章节过滤对谵妄特别关键(既往痴呆史章节必须剔除);⑤分桶+Gamma 采样——桶键沿用八变量;⑥人工抽检——按判据来源分层抽 50 例核对 DOE(规则标签的最低限度的face validity 检查)。预期工作量 2-4 周——远低于人工标注队列,且产出物是可公开的方法学资产(Ext 规范下)。

§5.7 与疾病专用模型的文献对齐协议

论文声称"与疾病专用模型文献相当"——引用与复检该声明的方法:①收集目标疾病(如 AKI)的 MIMIC 文献性能区间(注意各家队列定义差异);②把比较限制在"同上游+同结局语义"的文献(KDIGO 结构化预测);③声明本数据集的差异项(文本模态/队列构造/48h 定义)——任何"超过文献"的声明必须附队列不可比性的说明。审稿人视角:这类比较的诚实写法是"文献对齐(literature alignment)“而非"性能比较”——论文用词严谨(similar performance),复现者更容易在这里过度声称。

§5.8 模型选择决策树

目标是什么?
|- 复现官方基准 -> CANTRIP(TF 1.x docker);对账 Table 2
|- 发方法论文(新时序架构)-> PyTorch 迁移+LR 对齐验收;主表对官方划分
|- 发 NLP 论文(预训练/LLM)-> 上游 NOTEEVENTS+本地部署合规栈;CUI 视图做对照
|- 做预警原型 -> 先 HAPI(价值最清晰);提前量分层评估(§7.12)为主图
|- 教学课程 -> 三 CSV+LR 基线一周闭环;消融选负例策略(最易讲清)
|- 标签扩展研究 -> §5.6 配方;产出 Ext 规范新队列

§5.9 单疾病深挖 vs 三疾病横评的选择

研究策略的分叉点:单疾病深挖(选一个疾病做透——方法学论文常见,队列表述简单、消融集中、审稿聚焦)vs 三疾病横评(通用性论证——"模型跨疾病泛化"的声明必须三疾病全表支持)。决策依据:贡献主张落在哪——主张"新架构更强"至少两疾病+全指标;主张"标签协议可扩展"可以单疾病+扩展实验;主张"患者安全系统"则按临床价值选 HAPI 深挖(§5.8)。反模式:三疾病各跑一个单点指标就下通用性结论——Table 2 的七指标×三疾病矩阵是通用性声明的最低证据标准。

§6 实证结果与方法学分析

§6.1 规模实证:三队列的构成与患病率语义

三疾病队列的规模与患病率(论文正文口径,排除住院记录 <2 天后):

疾病 住院数 队列内 prevalence 任务难度语义
HAAKI 34,878 34.2% 类平衡较好;KDIGO 结构化判据灵敏
HAPI 35,218 11.1% 类不平衡最重;Precision 提升空间最大
HAA 38,385 39.8% 正例最多;医源性机制明确(采血驱动)

三个数字的解读纪律:①prevalence 是构造队列内正例占比——负例由分桶采样构造,比例是设计出来的而非观察出来的;②三队列彼此独立(非同批住院的三个标签),跨疾病比较性能时构成差异必须在场;③HAA 的 39.8% 远超任何全院流行率直觉——这正是"队列构造 ≠ 流行病学调查"的活教材。另一个结构性事实:三队列都源于同一上游(MIMIC-III 46,520 患者),所以患者级重叠必然存在——三疾病联合建模(多任务)时切分必须患者级对齐,否则三任务间的泄漏隐蔽而致命。

§6.2 基准实证:Table 2 全景与四基线格局

官方基准矩阵(50% 阈值,JAMIA 2020 Table 2):

疾病 系统 Accuracy AUC Sensitivity Specificity Precision F1 MCC
HAA LR 64.58% 65.55% 47.55% 74.51% 52.09% 49.72% 0.2252
HAA SVM 57.03% 55.23% 37.46% 69.21% 43.09% 40.08% 0.0687
HAA biLSTM 62.78% 70.01% 72.03% 57.34% 49.85% 58.92% 0.2844
HAA CANTRIP 69.64% 74.61% 57.56% 76.75% 59.30% 58.42% 0.3453
HAPI LR 76.87% 74.34% 57.91% 79.64% 29.37% 38.98% 0.2887
HAPI SVM 78.32% 62.78% 24.05% 86.26% 20.38% 22.06% 0.0961
HAPI biLSTM 78.77% 80.84% 70.57% 79.99% 34.41% 46.27% 0.3844
HAPI CANTRIP 83.61% 87.05% 71.83% 85.36% 42.19% 53.16% 0.4632
HAAKI LR 64.84% 64.49% 44.99% 77.20% 55.12% 49.55% 0.2327
HAAKI SVM 57.07% 55.24% 37.69% 69.13% 43.18% 40.25% 0.0703
HAAKI biLSTM 67.50% 74.04% 71.97% 64.69% 56.16% 63.09% 0.3569
HAAKI CANTRIP 73.68% 79.10% 61.72% 81.20% 67.35% 64.40% 0.4370

格局解读三句话:①浅层基线(LR/SVM)全面落后——SVM 在三疾病上 AUC 均 ~55%,几乎退化到随机线附近,说明 CUI 快照的线性可分性有限;②biLSTM 高灵敏低精确——biLSTM 在 Sensitivity 上常压 CANTRIP(HAA 72.03% vs 57.56%),代价是 Specificity/Precision 崩落——"什么都报警"的模型在预警场景无部署价值;③CANTRIP 的优势是均衡——七指标全面领先或并列,MCC(不平衡敏感的综合指标)三疾病最高(0.3453/0.4632/0.4370)。摘要的浓缩口径:纯文本 AUC 74%-87%、Specificity 77%-85%。

§6.3 校准实证:ECE 的临床含义

Table 2 之外的隐性亮点是校准:Estimated Calibration Error——HAA 2.69%、HAPI 1.66%、HAAKI 2.36%(均为低个位数)。风险预测的临床可用性有一半在校准——"风险 70%"必须真的对应七成发生率,阈值化的报警策略才有统计学基础。CANTRIP 的低 ECE 使其输出概率可直接喂给决策阈值分析(论文 Figure 5 的 33%-50% 最优阈值区间即建立在校准之上)。对比阅读:许多高 AUC 的深度模型在 ECE 上惨不忍睹(过自信),引用本基准时"低 ECE"是 CANTRIP 相对新模型最难被击败的属性之一——复现新模型时把 ECE 列为必报指标,经常是翻车点。

§6.4 判据贡献与 ICD-only 排除的实证语义

论文 Figure 1 的队列选择图披露了两个关键结构性事实:①各判据的命中比例逐疾病给出——正例住院中满足 note 本体/词汇/结构化标准的不同组合比例被显式统计(图内标注),这是标签系统透明度的罕见范例;②仅满足出院 ICD-9(HCUP CCS)编码者被排除——因为 ICD 编码是结算产物,无法定位 DOE(事件日期),排除是"保标签质量"的主动选择而非数据缺陷。这两点的合并启示:本数据集的"医院获得"口径比 ICD 挖掘类研究窄而准——宁缺毋滥。复现者注意:任何"把 ICD-only 案例加回队列"的扩展都会污染 DOE 语义,属结构性改造而非增量扩充,必须重新声明任务定义。

§6.5 八个真实坑点

  • 坑点 1 prevalence 当流行率:把 39.8%(HAA 队列内正例占比)写成"MIMIC-III 近四成患者住院贫血"——队列构造产物与流行病学事实是两回事。
  • 坑点 2 三队列当同一批患者:对 34,878/35,218/38,385 做跨疾病配对比较——三者独立构造、患者级重叠但住院集不同,任何"逐患者跨疾病"分析须先反查上游确认重叠结构。
  • 坑点 3 快照当小时级:把快照 timestamp 当小时级观测做"每小时风险曲线"——快照是日粒度合并,小时级语义只存在于截断点的选择。
  • 坑点 4 时间窗口径混用:方法节写 24-96h、实验却按 48-96h 复现(或反之)——两口径并存(存照 A),引用训练配置以 --min_pred_window 24 --max_pred_window 96 为准。
  • 坑点 5 负例当真实无病:把 Gamma 采样 DOE’ 当真实事件日做流行病学计算——负例标签是分布假设的产物,只能用于训练监督,不能当结局数据。
  • 坑点 6 官方划分再随机化:丢弃 8:1:1 划分自己随机切然后与 Table 2 比较——划分不同则不可比(且随机切分下 subject 跨 split 泄漏官方划分本身就存在,须声明处理方式)。
  • 坑点 7 CUI 序列当自由文本:把 chronology 的 CUI 串直接喂给语言模型当"文本"——它是词表受限的语义 ID 序列,预训练语言模型的价值要从上游 NOTEEVENTS(独立授权)取原文实现。
  • 坑点 8 TF 1.x 时代穿越:在新 TensorFlow 上直接跑 run_experiment.py——仓库冻结于 2019(TF ≥1.14 API),报错不是数据问题;要么 docker 固定旧环境,要么迁移并先对齐 LR 基线。

§6.6 审稿人自查清单

  • [ ] 数据集版本(v1.0)与 DOI(10.13026/pm60-0g49)写明;上游 MIMIC-III v1.4 引用同步给出
  • [ ] 疾病队列口径写明(HAAKI/HAPI/HAA 各自住院数+队列内 prevalence,声明非流行率)
  • [ ] 时间窗口径写明(24-96h 训练参数;与 Usage Notes 48-96h 表述的差异已声明)
  • [ ] 使用官方 8:1:1 划分;若重切分,声明理由与不可比性
  • [ ] subject 级泄漏审计(跨 split 患者重叠的处理策略)
  • [ ] 七指标+ECE 全套报告;阈值(50%)与阈值扫描曲线在场
  • [ ] 与 Table 2 四基线的对齐比较(差值区间而非单点)
  • [ ] 负例采样假设的敏感性分析(或声明沿用官方负例)
  • [ ] 多随机种子(≥5)均值±标准差
  • [ ] 合规声明:受控数据本地使用、未传第三方在线服务、派生品不构成临床建议
  • [ ] 局限性段:单中心、标签系统性噪声(NLP 误差传递)、Gamma 负例分布假设三必选

§6.7 与 MIMIC 家族的分工治理

本数据集在 MIMIC 生态中的位置很特殊:它不是"原始数据家族"成员,而是**“加工品支系"的代表**。家族分工:MIMIC-III(490 条)是上游原材料(结构化+文本全量);MIMIC-III Demo(491 条)是教学沙盒;MIMIC-IV(492 条)是现任主库;本条目(493)与 494(phenotype-annotations)同属**“标签增强层”**——在原材料上注入任务语义(DOE 标签/表型标注),把"通用数据库"变成"任务基准”。治理特征:①标识符沿用上游(subject_id/hadm_id 直通);②授权叠加(本项目协议+上游 MIMIC-III 各自签署);③冻结语义(v1.0 永不更新,上游 MIMIC-III v1.4 同样冻结——双重冻结保证了基准的长期稳定性,这是活数据库 MIMIC-IV 上不可能有的属性)。这个"加工品支系"的存在本身就说明:公开数据生态的成熟标志不是只有原料,而是原料→半成品→基准的分层完备。

§6.8 许可与派生语义

访问沿 PhysioNet 受控体系(CITI+DUA;上游 MIMIC-III 衍生物同治理)。三个工程后果:①不可再分发——CSV 包不能放入自家数据平台或论文附件;②派生品合规——基于本数据集训练的模型权重、扩展标签集属衍生品,按 PhysioNet 2024-04 指南应同协议分享并按 Ext 规范命名;③在线服务禁令(2025-09 LLM 条款)与 DSP 地域限制(2025-07 全面执法)叠加——跨境团队与云端 LLM 路线都要先过合规审查。NIH IRB 批准与 NLM 政府雇员作品的背景让"研究使用"的伦理框架清晰,但不改变受控访问的技术约束——许可的宽松(论文 public domain)与数据的受控(DUA)并行不悖,是 NIH 数据治理的典型组合。

§6.9 口径存照

  • 存照 A:时间窗双表述并存——摘要/方法节"24-96 小时提前量"与 Usage Notes"48-96 hours in advance";训练参数 --min_pred_window 24/–max_pred_window 96 为技术口径。
  • 存照 B:正/负例绝对数未在论文正文公开(指向 Supplementary Appendix B)——本文全部规模数字以正文队列总住院数+prevalence 为准。
  • 存照 C:队列内 prevalence(34.2%/11.1%/39.8%)为构造统计,官方未给对应全院流行率——两者不可互换。
  • 存照 D:访问级别徽标(Credentialed/Open)未在本文核查快照的页面转写中出现——按 MIMIC-III 衍生物治理惯例与官方伦理声明(de-identified MIMIC-3+NIH IRB)记为受控访问;以 PhysioNet 条目页实时标注为准。
  • 存照 E:分桶 Gamma 参数(k/θ)与桶大小下限未公开——负例精确逐例复现不可行,分布级协议可复现。
  • 存照 F:CSV 压缩包体量官方页面未标精确值——"GB 级以内"为据数据形态(CUI 序列)的推断。

§6.10 快照与序列长度的实证形态

官方 CSV 的结构性形态(据上游 MIMIC-III 住院时长分布推演):①住院时长长尾(Sci Data 2016:住院时长均值 ~4.5 天 SD 6.6 量级)→快照序列长度同样长尾——中位数个位数、右尾数十+;②短住院大量被 <2 天排除规则截去——存活的 chronology 已经过"最小长度"隐式筛选;③间隔 δ 的分布双峰(密集期 <24h 与记录空窗 >48h)——正弦编码在双峰输入下的表现是 δ 编码消融的看点。使用纪律:序列长度长尾决定 padding/截断策略(尾部截断会系统性丢长住院——分层采样评估);任何"平均序列长度"的引用要写分布而非单点。

§6.11 与文献数字冲突的诊断树

数字对不上?
1) 版本一致吗?(v1.0 冻结——不一致概率低但上游 MIMIC-III v1.4 口径要查)
2) 口径一致吗?
   |- prevalence(队列内)vs 流行率(全院)——最大混淆源
   |- 预测窗(24-96 vs 48-96)——双表述并存
   `- 阈值(50% 固定 vs 扫描)——指标带阈值语义
3) 队列一致吗?(三疾病独立构造——跨疾病数字不可互推)
4) 实现一致吗?(截断边界/负例种子/类不平衡处理)
5) 划分一致吗?(官方 8:1:1 vs 自切)
`- 全一致仍不符 -> 记录并联系作者(GitHub issue);差异写进自己论文的复现节

§6.12 冻结生态的价值

MIMIC-III(2016 冻结)+v1.0(2022 冻结)+工具链(2019 冻结)构成罕见的三重冻结生态。冻结的代价(数据止于 2012、TF 1.x 老化)换来的红利是基准的考古学稳定性:2019 年跑的 Table 2 与 2026 年的复现指向同一组数字——跨年文献对比无需版本对账,这正是 MIMIC-IV 这类活数据库做不到的。战略结论:方法学研究(要稳定基准)选本数据集;临床时效研究(要当代惯例)选 MIMIC-IV——"冻结 vs 活跃"是任务性质决定的选择,不是数据集优劣的判断。

§6.13 CANTRIP 架构的方法学评述

CANTRIP 的设计哲学是把"时间感知"做进加性更新(additive update)而非标准 RNN 门控:快照嵌入按 δ 的正弦编码调节更新幅度——记录空窗(大 δ)自动提高后续更新的"信息增益权重"。以 2026 年视角评述:架构本身已被 Transformer 时代超越,但它留下的三个设计决策仍然有效——①间隔显式编码(等价于今天时序 Transformer 的时间偏置);②类不平衡用损失加权而非重采样(保持时间线完整性);③校准作为一等公民指标(ECE 进主表)。复现者把这三条当"可迁移的设计遗产",而非把整个架构当文物——新架构+旧设计原则的组合是性价比最高的研究路线。

§7 AI 就绪指南与应用场景

§7.1 四种喂法

喂法 形态 适用 关键工程
CUI 序列直喂 快照 ID 序列(CUI=token) 官方基准复现、新时序模型 δ 编码(正弦/查表)+截断协议
解码重建 CUI→概念名→嵌入 可解释特征、知识注入 UMLS Metathesaurus 映射
原文回填 上游 NOTEEVENTS 文本 预训练语言模型/LLM 需 MIMIC-III 独立授权+本地 LLM 合规
结构化对照 上游 LABEVENTS 等 模态对比/融合 同队列结构化基线自建

四种喂法共享官方划分与标签——模态对比实验的公平性由此保证。

§7.2 CANTRIP 官方复现配方(命令级)

git clone https://github.com/h4ste/cantrip && cd cantrip
# 环境:python>=3.6, tensorflow>=1.14(建议 docker 固定 TF 1.x)
export DATA_DIR=/path/to/data     # 含 <split>.chronologies/admittimes/labels.csv
export OUTPUT_DIR=/path/to/out
python run_experiment.py \
  --data_dir=$DATA_DIR --output_dir=$OUTPUT_DIR \
  --do_train --do_test --do_predict --print_performance \
  --time_repr both --delta_enc sinusoid --delta_combine add \
  --augment_negatives=0 --dropout 0.3 --observational_dropout 0.3 \
  --correct_imbalance weighted --num_epochs 10 \
  --min_pred_window 24 --max_pred_window 96 \
  --save_tabbed_results
# 工具链自动完成:chronology 截断 + present-on-admission 剔除 + 七指标输出

对账清单:①三疾病各跑一遍(DATA_DIR 换目录);②输出与 Table 2 逐格比对(允许种子/TF 版本小偏差,报告差值);③ECE 也在对账范围(2.69%/1.66%/2.36%)。

§7.3 现代框架迁移配方(PyTorch)

迁移路线四步:①数据层——CSV 解析为 (patient, hadm)→快照 CUI 列表+间隔 δ 序列+截断后标签(截断逻辑照抄 run_experiment.py,勿自造);②嵌入层——CUI→可训练嵌入(vocab=UMLS 概念子集)或用 UMLS 语义类型+SGNS 预训练嵌入初始化;③模型层——GRU/LSTM/Transformer 均可,δ 注入建议先复刻正弦编码(对齐官方)再做注意力化改进;④评估层——七指标+ECE+50% 阈值照抄,随机种子 5 个。迁移的验收标准不是"跑通"而是"LR 基线对齐":先用自家管线复现 LR 的 AUC(±1% 内),再上深度模型——否则管线 bug 会伪装成"新 SOTA"。

§7.4 预训练语言模型/LLM 配方(合规版)

CUI 快照喂不饱现代语言模型——要释放上游文本需三步:①授权:另签 MIMIC-III DUA,取 NOTEEVENTS 原文;②对齐:按 (subject_id, hadm_id, charttime 日) 把原文组织成与官方快照同构的"日粒度文档";标签仍用官方 labels CSV(保持基准可比);③合规栈:本地部署 LLM(8B-30B 起步;离线推理+零保留验证+审计日志,§8)——2025-09 条款下云端 API 路线对 MIMIC 系数据是违规项。任务形态建议:快照级风险打分(结构化 prompt→概率输出,注意温度=0 与校准重估)、原文+官方 CUI 的双视图对比(量化 NLP 管线的信息损失)。评价时把 LLM 输出概率过一遍 ECE——大模型的概率校准在本任务上通常是主要短板。

§7.5 成本与排期模板

阶段 事项 耗时 硬件
合规 CITI+DUA+项目协议 约 1-2 周 —
获取 CSV 下载+UMLS 账号 数小时 磁盘 <10 GB
复现 TF 1.x 环境+官方基准对账 1-2 周(环境折腾为主) CPU 即可/单卡
建模 新模型+消融矩阵 数周 单卡(现代 GPU 远超需求)
扩展 上游联用/新疾病标签 数周-数月 +MIMIC-III 本体 47 GB

本数据集是 MIMIC 生态里算力门槛最低的基准——轻量到可以进研究生课程作业;工程成本的大头在"旧环境复现"与"合规流程"而非计算。

§7.6 泄漏防控专项

  • subject 跨 split:官方 8:1:1 是住院级随机切分——同一患者的多次住院可跨 train/test(MIMIC-III 人均 1.6 住院)。这不是数据集的 bug 而是官方口径,但研究者必须:①声明该口径;②补充患者级分组重切分的敏感性结果(预期 AUC 略降——降幅本身就是贡献)。
  • DOE 信息泄漏:labels CSV 的 label=1 行只该用于截断与监督——把 DOE 距离(Δ)当特征喂模型是泄漏(预测"还有多久发病"≠“是否将发病”);特征窗止于截断点。
  • 负例采样泄漏:负例 DOE’ 的采样用了桶统计(来自正例)——跨 train/test 的桶参数拟合要只用 train 正例(官方工具链已处理;自实现时易错)。
  • 三疾病交叉:多任务学习时三队列合并,同一患者跨任务的标签对齐须患者级切分。
  • 上游回填的时序:从 NOTEEVENTS 回填原文时,只能取截断点之前的笔记——DOE 日的"确诊性文本"是最毒的泄漏源。

§7.7 公平性声明

本数据集与公平性有双重关系:工具面——分桶变量(年龄/性别/种族/保险/OASIS/ICU/入院来源/类型)天然构成公平性审计的分层框架——按桶报告模型性能差异是零成本的对齐动作(Gamma 采样本身已按桶匹配分布,训练层面的群体均衡被制度化);风险面——分桶采样把历史诊疗模式固化进负例结构(某群体获得性事件"应该"更早/更晚的先验),模型可能习得" demographic → 时序风险"的伪相关。审计建议:①逐桶 AUC/校准表;②移除敏感桶键(种族/保险)的采样敏感性实验;③上游 MIMIC-III 已知的护理差异文献对照。结论措辞:本数据集的标签协议提高了群体均衡的可控性,但没有免除使用者的公平性审计责任。

§7.8 复现包模板

repo/
├── README.md            # v1.0 + DOI 10.13026/pm60-0g49 + 上游 MIMIC-III v1.4 引用
├── env/                 # TF 1.x docker(复现官方)或 PyTorch 锁定(迁移路线)
├── data_checks/
│   └── count_verify.py  # 三疾病 hadm_id 计数 vs 34,878/35,218/38,385 对账
├── src/
│   ├── truncation.py    # 截断协议(对照 run_experiment.py 逐行注释)
│   ├── negative_sampling.py  # Gamma 分桶(train 正例拟合+种子固定)
│   └── model.py
├── eval/
│   ├── metrics.py       # 七指标+ECE;50% 阈值+扫描
│   └── leadtime.py      # Δ 分层(24-48/48-72/72-96h)
├── compliance/
│   ├── dua_ack.md       # PhysioNet 受控协议+LLM 条款核查记录
│   └── local_only.md    # 本地环境声明(无第三方传输)
└── outputs/             # 对 Table 2 的对账表 + 新结果(均值±std)

§7.9 消融案例:负例采样策略敏感性

研究问题:CANTRIP 的性能有多少来自 Gamma 分布匹配负例(相对朴素负例)?设计:①基线=官方负例(Gamma 分桶);②随机 DOE’(均匀采样 TTE);③出院前截断(负例用全时间线);④不用采样负例、只用正例+加权损失。三疾病×四策略全矩阵,观察 AUC/MCC/ECE 三轴。预期解读框架(设计层面):策略③④会引入"病得重的负例"偏差(负例时间线里其实藏着正例样式的晚期征兆),模型学习信号被稀释;策略②破坏时间分布匹配,Δ 分层评估的提前量精度失真。若实验发现各策略差异 <1%——那本身是重要负结果:说明任务信号强到对监督协议鲁棒,标签工程的边际价值要重新表述。

§7.10 消融案例:NLP 过滤层逐层贡献

研究问题:四层过滤(肯定性/章节/语义类型/停用词)各贡献多少?设计:从上游 NOTEEVENTS 重建 chronology(§4.3 协议),逐层开启(1→2→3→4 层累积),三疾病全跑,报告:①序列长度分布变化(每层剔除多少 CUI);②下游 AUC/MCC 变化;③DOE 判定一致率(与官方标签对比——过滤越弱,“历史章节提及"造成的假阳性 DOE 越多)。该消融的教学价值在于把"NLP 管线是黑盒"变成"每一层都是可测量的信息取舍”——预期最大跳变出现在第②层(否定/家族关联),因为那是"谁生病了"的语义边界;第④层(停用词)大概率接近零贡献——也是值得记录的负结果。扩展标签到新疾病(§4.4)前,这个消融是必做的管线体检。

§7.11 负结果记录协议

本数据集特别适合记录三类负结果:①标签协议鲁棒性(§7.9/§7.10 中差异不显著的情形——“协议不敏感"对后续使用者是重要情报);②模态增量(结构化特征叠加文本后 AUC 提升不足 1%——直接回答"还值不值得做文本抽取”);③迁移衰减(把三疾病模型按年份外推到 MIMIC-III 晚期数据/迁移到 MIMIC-IV 复刻队列的性能衰减曲线——单中心标签的可迁移性边界被定量刻画)。记录格式沿用家族规范:假设/配置哈希/种子/结果/一个解释。负结果页在这里的价值密度特别高——因为本数据集的方法学透明度允许负结果被精确归因(协议哪一环导致),这是黑盒标签数据集做不到的。

§7.12 提前量分层评估配方(Δ 分桶)

# 把测试集按 Δ(截断点到 DOE 的小时数)分三桶
buckets = [(24, 48), (48, 72), (72, 96)]
for lo, hi in buckets:
    subset = test[(test.delta >= lo) & (test.delta < hi)]
    report_metrics(subset)   # AUC/Precision@Recall=0.6/ECE 逐桶
# 附加:模型最早报警时刻 vs DOE 的中位提前量分布(Kaplan-Meier 式曲线)

解读框架:①近窗(24-48h)精度预期最高——离事件越近征兆越显;②远窗衰减的斜率是"预警系统的战术价值半径"——斜率平缓的模型才能支撑 96h 级的资源配置决策;③若远窗精度反超近窗——先查泄漏(§7.6)再庆祝。该配方产出的曲线组与 Table 2 单点指标合成完整的评估叙事,是本数据集区别于静态基准的核心评估资产。

§7.13 特征工程配方(CUI 序列的统计侧写)

深度模型之外,统计特征仍是强基线:①快照级——CUI 计数/新增 CUI 数(语义新颖度)/重复 CUI 率(临床惯性);②住院级——观测总量/活跃天数占比/最大记录间隔(护理强度代理);③疾病感知——到种子 CUI 的 UMLS 图距离(语义接近度,KD 种子已给锚点);④时序感知——近窗(48h)特征占比加权。这些特征喂 LR/GBDT 的意义不止"便宜基线":它们与深度模型的误差结构不同(可解释、单调、对长尾稳健),融合后常在 HAPI 类不平衡场景补 Precision 短板。特征表+贡献度分析是复现包的加分项。

§7.14 校准专项配方

官方 ECE 已经很低(1.66-2.69%),但新模型(尤其深度/LLM 概率输出)需要主动校准:①数据划分——校准集独立于训练/测试(用 train 内部再切或用 devel);②方法选择——温度缩放(单参数,首选)/Platt/isotonic(数据充足时);③评估——ECE+可靠性图(10 桶)+按 Δ 分桶的校准漂移(提前量越远校准越难);④报告纪律——校准后的指标表单独列出(阈值决策用校准后概率)。校准与判别(AUC)的独立报告是本数据集论文的重要方法论遗产——Table 2 七指标+ECE 的呈现方式本身就值得方法学论文引用。

§7.15 多疾病联合建模配方

三疾病标签的联合利用有三条路线:①多任务头——共享编码器+三疾病分类头(队列合并须患者级切分;类不平衡逐头处理);②标签并集单任务——任一疾病 DOE 截断(任务语义变为"任一预警"——临床上像组合预警面板);③跨疾病迁移——HAA(最大队列)预训练→HAPI(最难)微调。设计要点:三疾病 prevalence 不同(39.8%/11.1%/34.2%),损失加权要逐头归一;评估保持"逐疾病 vs 官方单任务基线"的可比口径——多任务的增益若以牺牲单任务可比性为代价,论文叙事会失焦。

§7.16 四周弱监督工作坊(课程设计)

面向研究生的完整闭环设计:W1 数据与协议——CSV 解析/对账脚本/截断协议复刻(验收:LR 基线对齐 ±2%);W2 模型与编码——GRU+δ 正弦编码 vs 简单均值池化(验收:七指标完整报告);W3 消融与公平——负例策略三选一对比+分桶性能表(验收:一个可讲故事的发现);W4 扩展与合规——为自选疾病生成 50 例 DOE 抽检+合规声明撰写(验收:Ext 规范风格的方法学附录)。课程亮点:全程无需 GPU 集群与全量 MIMIC-III——弱监督全栈的最小平价教学路径;期末把最佳复现包整理成 GitHub 仓库(学生直接获得可展示工程资产)。

§7.17 从基准到床边:差距清单

本数据集的预警器与临床部署之间隔五道坎:①前瞻性——retrospective 标签+历史队列,无前验证证;②时延真实性——快照按天合并,部署系统的实时数据流(分钟级)更密也更噪;③NLP 管线可移植性——MetaMap 管线在本院文本上的抽取质量未知;④行动闭环——预警后谁响应、响应协议是什么,数据集不含任何工作流信息;⑤再验证义务——迁移到任何新机构都要重建 DOE 判定器的本地参数(§2.10)。诚实的定位:本数据集产出的模型是"研究原型"——它的价值在于把"文本能不能预警"回答到值得做前瞻研究的程度,而不是替代前瞻研究本身。

§8 伦理、许可与合规

  • 许可体系:PhysioNet 受控访问(CITI 证书+受控 DUA+本项目协议);数据为 MIMIC-III 衍生,上游 Credentialed Health Data License 1.5.0 语义继承;禁止再分发、禁止重识别尝试。
  • 伦理批准:项目依赖去标识 MIMIC-III 数据,经 NIH IRB 批准;生产于 NIH HPC Biowulf 集群;论文为美国政府雇员作品(美国境内 public domain)——论文开放与数据受控并行,引用时勿混淆。
  • LLM 条款(2025-09-24):MIMIC 系衍生物同受约束——禁止经 API/在线平台向第三方传输数据;零数据保留、不训练、无人工审核;本地部署 LLM 是合规路径(§7.4)。
  • DSP 地域限制(2025-07-08 全面执法):美国司法部 Data Security Program(EO 14117)对特定国家/地区 IP 或所属机构实施出口管制式访问限制——跨境团队访问受控数据前先核对最新政策与合规路径。
  • 派生品义务(2024-04-24 指南):扩展标签集/模型权重/重建管线输出属衍生品——同协议分享+Ext 命名规范。
  • 标签伦理的特别提醒:DOE 与负例 DOE’ 均为算法产物——任何下游系统把标签当"医学事实"对外解释(如"该患者 39.8% 概率贫血")都属误用;标签的正确语义是"按公开规则的判定结果"。

§9 常见问题(FAQ)

Q1 这个数据集免费吗?

数据免费但受控——CITI+DUA 后零费用;成本是合规流程约 1-2 周与本地化自律。

Q2 它到底是 MIMIC-III 还是 MIMIC-IV 的?

MIMIC-III——官方标题即 “Nosocomial Risk Datasets from MIMIC-III”;检索时别被"MIMIC-IV 院感"类文献带偏。

Q3 三个疾病是哪三个?

医院获得性急性肾损伤(HAAKI)、医院获得性压力性损伤(HAPI)、医院获得性贫血(HAA)——均为入院 ≥48h 后证实。

Q4 每个队列多大?

HAAKI 34,878 住院、HAPI 35,218、HAA 38,385(排除 <2 天住院后;8:1:1 划分)。

Q5 34.2%/11.1%/39.8% 是患病率吗?

是构造队列内正例占比——队列经负例采样构造,比例是设计产物;全院流行率请另查文献。

Q6 为什么 HAA 占比近四成?

队列构造使然(负例按分布匹配采样)+贫血在 ICU 高发(医源性采血驱动)双因素;不能据此推断"MIMIC-III 四成患者住院贫血"。

Q7 预测窗到底 24-96 还是 48-96 小时?

两种官方表述并存(摘要/方法 24-96h;Usage Notes 48-96h)——技术口径以训练参数 --min_pred_window 24 --max_pred_window 96 为准。

Q8 "医院获得"怎么定义?

入院 ≥48 小时后经 chart/实验室/临床笔记证实——不是出院 ICD 编码口径;仅 ICD 命中而无 DOE 依据者被排除。

Q9 标签是怎么来的?

间接监督:三判据(UMLS 种子概念/词汇正则/结构化标准 KDIGO-NPUAP-WHO)确定事件日期 DOE→正例截断至 DOE 前 24-96h→负例按分桶 Gamma 采样模拟 DOE’——全程无人工逐例标注。

Q10 DOE 是准确的诊断日期吗?

是"按公开规则的首次证据日"——受 NLP 抽取与规则边界影响;语义是"算法判定结果"而非金标准诊断。

Q11 负例的标签可信吗?

负例 DOE’ 是分布假设(Gamma 采样)的产物——负例只保证"截断点前未到事件",用于训练监督合法;把它当真实无病结局做流行病学计算是误用。

Q12 特征为什么是 CUI 而不是原文?

官方发布的是文本的结构化压缩(MetaMap Lite 抽取+四层过滤)——保留语义、控制体量、规避 PHI;要原文需回上游 NOTEEVENTS(另签 MIMIC-III DUA)。

Q13 UMLS CUI 怎么理解?

统一医学语言系统的概念唯一标识符——每个 CUI 对应一个标准化医学概念(如 C0022660=急性肾衰)。建模可当 token;解释需 UMLS 词典解码。

Q14 快照的粒度是什么?

日粒度——同一日历日全部笔记的观测合并为一个快照;快照间的间隔 δ(小时)单独编码。

Q15 为什么按天合并而不是按小时?

临床笔记的产出由流程驱动(首日密、周末疏)——按天合并是稳定性与信息量的折中;小时级语义只存在于截断点选择。

Q16 间隔信息 δ 重要吗?

重要——它是不规则时间结构的核心;CANTRIP 的正弦编码(–delta_enc sinusoid)直接消费它。消融 δ 编码是标准实验。

Q17 MetaMap Lite 是什么?

UMLS 驱动的轻量医学实体抽取工具——官方管线用它把笔记转成 CUI;复现管线需对齐版本与参数。

Q18 四层过滤分别是什么?

①否定/不确定/非患者关联剔除;②consults/家族史/既往史/社会史章节剔除;③UMLS 语义类型限问题/干预/药物/解剖;④InfoBot 停用词——它们编码了"什么算当前住院的现患证据"。

Q19 数据里有原始文本吗?

没有——只发 CUI 快照序列;原文在上游 MIMIC-III(NOTEEVENTS),双键关联。

Q20 数据量多大?

CSV 压缩包 GB 级以内(CUI 序列很轻)——笔记本可承载;无官方精确值。

Q21 需要装数据库吗?

不需要——纯 CSV 数据集;只有反查上游 MIMIC-III 结构化数据时才涉及数据库。

Q22 划分是官方定好的吗?

是——每疾病 train/devel/test = 8:1:1 分层随机;复现官方基准必须用官方划分。

Q23 同一患者会跨训练/测试集吗?

会——官方是住院级切分,多住院患者可跨集;这是官方口径,使用时须声明;患者级重切分可作为敏感性分析。

Q24 CANTRIP 是什么?

reCurrent Additive Network for Temporal RIsk Prediction——官方模型(TF 实现):文本快照序列+间隔编码的加性递归网络,JAMIA 2020。

Q25 官方基准多好?

50% 阈值下纯文本 AUC:HAA 74.61% / HAPI 87.05% / HAAKI 79.10%;Specificity 77-85%;ECE 1.66-2.69%。

Q26 基线有哪些?

LR、SVM、biLSTM 三个——CANTRIP 全面均衡领先;biLSTM 高灵敏低精确的教训值得细读 Table 2。

Q27 我能超过 CANTRIP 吗?

能,但对比要公平:官方划分+七指标+ECE+5 种子;现代模型(Transformer/预训练语言模型)有充分提升空间——尤其在 HAPI 的 Precision 上。

Q28 工具链还能直接跑吗?

TF 1.x 时代产物(2019 冻结)——现代环境直接跑会报错;docker 固定旧环境或迁移 PyTorch(先对齐 LR 基线验收管线)。

Q29 想用 Transformer/LLM 怎么做?

CUI 序列可直接 token 化进 Transformer;要用原文(预训练/LLM)必须回上游取 NOTEEVENTS 并走本地部署合规栈(§7.4)。

Q30 能把数据发给在线 LLM 分析吗?

不能——2025-09 条款禁止向第三方在线服务传输 MIMIC 系数据;本地部署是唯一合规路径。

Q31 和 MIMIC-III benchmark(490 条)什么关系?

互补:benchmark 是结构化四任务(死亡/LOS/表型/恶化),本数据集是文本三疾病弱监督任务——任务族、特征形态、标签方法都不同。

Q32 和 MIMIC-IV 的院感研究什么关系?

无直接数据关系(MIMIC-III 派生);方法学(DOE 判据/间接监督/负例采样)可整体平移到 MIMIC-IV 复刻——这是活跃的增量方向。

Q33 能扩展到其他疾病吗?

能且这正是数据集的设计意图——三判据+截断+Gamma 采样是通用协议;新疾病自选种子 CUI+正则+临床标准(§4.3/§4.4)。

Q34 扩展的标签算衍生品吗?

算——按 PhysioNet 2024-04 指南同协议分享+Ext 命名(MIMIC-III-Ext-…)。

Q35 DOE 判定的三个判据哪个最重要?

各疾病不同——论文 Figure 1 逐疾病给出命中比例;复现时按疾病对账,别假设统一权重。

Q36 “bed sore: none” 为什么不算阳性?

冒号后缀是结构化阴性模板——词汇判据显式排除该形态;自写正则时阴性模板处理是最常见翻车点。

Q37 KDIGO/NPUAP/WHO 在数据里怎么用?

作为结构化判据的标准源——labs/chart/vitals 满足标准即判定 DOE;具体实现细节在论文与补充材料。

Q38 排除 <2 天住院为什么?

住院过短无法形成有效快照窗(且 48h"医院获得"下限挤压预测空间)——队列构建的基本卫生条件。

Q39 正负例的确切数量在哪查?

论文正文只给队列总住院数+prevalence;正负例绝对数在补充材料(Supplementary B);自查以文件实际行数为准。

Q40 怎么验证我下载的数据完整?

对账脚本:各 chronologies 的唯一 hadm_id 计数、labels 的 DOE 行数、三 CSV 双键一致性;规模应与论文口径一致(先跑对账再开工)。

Q41 时间是真实时间吗?

上游 date shift 后的时间——绝对年份无意义;同一住院内相对间隔恒真(训练时序不受影响)。

Q42 阈值 50% 是怎么选的?

论文 Figure 5 的阈值扫描显示最优区间 33%-50%;实验取 50%——复现新模型建议附扫描曲线而非单点。

Q43 MCC 为什么重要?

三疾病尤其 HAPI(11.1% 正例)类不平衡显著——Accuracy 会骗人,MCC/F1/PR 曲线是诚实的指标;Table 2 的 MCC 全场最高正是 CANTRIP 均衡性的证据。

Q44 ECE 是什么?

期望校准误差——预测概率与实际频率的偏差;CANTRIP 的低 ECE(1.66-2.69%)让概率输出可直接做决策阈值分析;新模型常在此翻车。

Q45 提前量怎么评估?

Δ 分桶(24-48/48-72/72-96h)分层报告精度衰减曲线(§7.12)——比单点 AUC 更接近部署语义。

Q46 和真实的报警系统差距多大?

差距=前瞻性:单中心 retrospective 标签+分布假设负例+无部署时延模拟——本数据集是方法学基准,不是部署验收环境。

Q47 想做患者安全预警原型,从哪个疾病入手?

HAPI:不平衡最重、Precision 提升空间最大、干预手段明确(翻身/减压)——挑战与价值都最清晰;入门则 HAA 类平衡最友好。

Q48 能做多任务学习(三疾病一起)吗?

能——注意三队列患者级重叠,合并时切分必须患者级对齐(防跨任务泄漏);多任务与 DOEmulti-label 化是开放问题。

Q49 数据有更新计划吗?

v1.0(2022-09-15)至今无更新且上游 MIMIC-III 冻结——双冻结=基准长期稳定;别等新版本,直接用。

Q50 上游 MIMIC-III 的哪些表最常配合使用?

NOTEEVENTS(原文)、LABEVENTS/CHARTEVENTS(结构化对照)、ADMISSIONS(人口学/出入院)——双键 subject_id+hadm_id 直通。

Q51 能用本数据集的标签反哺 MIMIC-IV 研究吗?

标签不能跨库迁移(患者级无键接);能迁移的是标签协议(判据+截断+采样)——在 MIMIC-IV 上重跑协议生成 IV 版标签。

Q52 引用怎么写?

三件套:数据集(Goodwin 2022, PhysioNet, DOI 10.13026/pm60-0g49)+论文(JAMIA 2020, 10.1093/jamia/ocaa004)+PhysioNet 标准引用;上游 MIMIC-III 论文视使用同步引用。

Q53 RRID 是什么?

SCR_007345——科研资源标识符,用于论文方法节的资源引用规范化。

Q54 谁做的这个数据集?

Travis Goodwin 与 Dina Demner-Fushman(NIH NLM Lister Hill 中心);NIH 院内研究计划资助。

Q55 为什么是 NLM 来做院感预测?

NLM 的定位是医学信息学方法学引擎——用临床文本解决临床信息问题正是其使命;院感三疾病是"文本价值"的理想展示场。

Q56 数据的生产计算资源是什么?

NIH HPC Biowulf 集群——官方致谢明确;复现不需要同级算力(笔记本级即可)。

Q57 类不平衡怎么处理?

官方 CANTRIP 用 --correct_imbalance weighted(加权损失);自行实验可对比重采样/ focal loss——但注意与官方口径的可比性声明。

Q58 快照序列最长多长?

随住院时长分布(MIMIC-III 住院天数长尾)——超长序列的截断/采样策略是工程决策点,官方参数未特调此处。

Q59 CUI 嵌入怎么初始化?

可选:随机初始化(CANTRIP 口径)/UMLS 语义类型 one-hot 拼接/外部 SGNS 预训练嵌入——嵌入策略消融是有文献空间的增量。

Q60 能与波形库联用吗?

无患者级键接(波形 matched 子集挂 III 体系但独立偏移)——概念级对齐;文本+波形的多模态需经上游 MIMIC-III 中转。

Q61 教学场景怎么设计实验?

一周课:D1 数据解析+对账脚本;D2 截断协议复刻;D3 LR 基线对齐;D4 时序模型(GRU+δ 编码);D5 消融(负例策略或过滤层)——弱监督全链路的最小完整闭环。

Q62 常见的复现偏差来源?

TF 版本 API 差异、截断边界实现、负例种子、类不平衡处理细节——逐项写进复现包;先 LR 后深度是排错纪律。

Q63 与 sepsis 预测数据集什么关系?

任务互补:sepsis 数据集通常结构化+小时级+感染定义;本数据集文本+日级+非感染三疾病——"nosocomial"在这里指医院获得性疾病的广义。

Q64 为什么不叫 HAI(医院感染)数据集?

刻意避开:三疾病均非感染类(感染定义的监测标准争议大)——标题 nosocomial 取"医院获得"广义;与 CDC NHSN 的 HAI 监测是两个体系。

Q65 Magill 2014(NEJM)在论文里的角色?

HAI 负担的流行病学背景引用(多州点患病率调查)——提供"医院获得性疾病是重大负担"的证据基础,非数据来源。

Q66 数据里有人口学字段吗?

没有直接给——分桶变量(年龄/性别/种族/保险等)在上游 ADMISSIONS/patients;公平性审计需上游 join。

Q67 负例采样用了哪些协变量?

八个:年龄/性别/种族/收治 ICU/入院来源/入院类型/OASIS 评分/保险类型——OASIS(Johnson 2013)是疾病严重度的标准化分桶键。

Q68 OASIS 是什么?

Oxford Acute Severity of Illness Score——MIMIC-III 可计算的疾病严重度评分(Johnson et al. 2013);本数据集用它做分桶以匹配病情分布。

Q69 模型输出怎么临床解释?

输出=规则标签语义下的风险概率(校准良好)——“按官方 DOE 规则 48h 内将被证实的概率”;不是诊断、不是流行率、不是预后。

Q70 这个数据集最大的局限一句话?

标签的系统性噪声:NLP 抽取误差→DOE 判定→训练信号全链传递,且负例带分布假设——它是方法学透明的弱监督基准,不是金标准标注集。

Q71 快照序列怎么 padding?

按 batch 内最长截断或全局上限(如 64 快照)+尾部丢弃;长住院的系统性截断偏差要分层评估(§6.10)。

Q72 δ 编码有哪些选择?

官方正弦编码(对齐基准);替代方案:查表分桶/对数变换/注意力偏置——消融 δ 编码是标准实验点。

Q73 CUI 词表多大?

取官方 chronologies 的去重 CUI 集合(万级概念量级,UMLS 子集)——以实际文件统计为准;嵌入矩阵相应配置。

Q74 怎么处理未见 CUI?

UMLS 版本差/罕见概念导致 dev/test 出现 train 没有的 CUI——<unk> 兜底+OOV 率报告;语义类型回退(用 TUI 嵌入替代)是进阶方案。

Q75 能做半监督/自训练吗?

能且契合:上游未入队住院(被排除/负例)的快照可做无标签池;自训练要防确认偏差(伪标签阈值保守+迭代监控)。

Q76 主动学习怎么设计?

弱标签框架下的主动学习对象是"DOE 判定不确定"的住院(判据冲突/边界 48h)——人工复核预算花在刀刃上;与 494 的人工标注资源天然互补。

Q77 模型可解释性怎么做?

注意力/归因到 CUI 后经 UMLS 解码成概念名(§4.8);逐快照归因对齐时间轴讲"哪天的哪个概念触发预警"——临床可解释性的最小可行故事。

Q78 报警疲劳怎么量化?

固定 Sensitivity 下的报警频率(每住院报警次数)+Precision@Recall 曲线——biLSTM 的高灵敏低精确正是反例;临床部署的硬约束。

Q79 能预测"会发生哪一种并发症"吗?

三疾病并集建模(§7.15 路线②)给"任一预警";区分疾病需多任务头——本数据集标签支持,但队列构成差异要显式处理。

Q80 测试集可以重复看吗?

官方 devel 调参/test 报告一次的纪律同样适用;test 反复看+按结果调模型=变相训练(基准污染的老问题,holdout 精神同样适用)。

Q81 复现偏差多大算正常?

LR 基线 ±2% AUC 内;深度模型 ±3-5%(种子/框架敏感);超出先查截断实现与类不平衡处理,不是先怀疑论文。

Q82 为什么我的 LR 比 SVM 好很多?

正常——Table 2 里 SVM 在本任务表现异常弱(AUC ~55%);SVM 对稀疏高维 CUI 特征+类不平衡的组合敏感,复现对比以 LR 为锚。

Q83 能用 XGBoost 吗?

能——CUI 统计特征(§7.13)喂 GBDT 是被低估的强基线;与官方 LR 口径对齐后纳入对比表反而加分。

Q84 数据能进 Kaggle 式竞赛吗?

技术上可以(体量小),合规上不行——受控 DUA 禁止再分发,任何第三方平台托管即违规;校内课程竞赛以各自签署 DUA 为前提。

Q85 论文方法节怎么引用官方工具链?

引用仓库+commit hash+参数清单(§7.2 命令);截断逻辑声明"按 run_experiment.py 实现"——工具链版本是复现声明的一部分。

Q86 上游 NOTEEVENTS 的授权怎么走?

PhysioNet MIMIC-III 独立项目页 CITI+DUA——与本数据集项目协议分开签;拿到后按 (subject_id,hadm_id,日期) 与快照对齐。

Q87 想跳过 CITI 直接用数据行吗?

不行——受控访问是数据集的生命线;违规使用(含"朋友传我一份")破坏整个受控生态的信任基础。

Q88 数据用完能删别人的副本吗?

不能替别人删——但你有义务不复制、不转传;发现泄露渠道应向 PhysioNet 报告。

Q89 商业产品能用这个数据集训练吗?

受控 DUA 对使用目的有限制条款(研究用途为默认语义);商业落地前逐条核对 DUA 与 PhysioNet 政策,必要时联系许可方。

Q90 发论文时数据可用性声明怎么写?

“基于 PhysioNet Nosocomial Risk Datasets from MIMIC-III v1.0(DOI),经 CITI+DUA 获取;受 DUA 约束不可再分发;代码见 [repo](不含数据)。”

Q91 审稿人质疑"标签是机器生成的"怎么回应?

三段式:规则完全公开可审计(不是黑盒)→临床标准背书(KDIGO/NPUAP/WHO)→附录附人工抽检一致率(§5.6 第⑥步)。这个质疑是本数据集论文与生俱来的,标准答案早就写好了。

Q92 一句话总结这个数据集的方法论贡献?

“证明了用可公开审计的规则链(判据+截断+分布采样)可以替代昂贵的人工标注,在临床文本上训出接近疾病专用模型的预警器。”

Q93 数据里的时间是 2100-2200 年怎么办?

上游 date shift 的去标识时间——相对间隔恒真;绝对时间分析(季节/星期)不可做,与本系列 492 条目的 anchor 语义同源。

Q94 想对比文本和结构化模态,怎么开始?

从上游 MIMIC-III 拉同队列的 LABEVENTS/CHARTEVENTS,按同一截断协议造结构化版特征,跑同一套划分与指标——双模态同协议对比是干净的设计。

Q95 融合模型比单模态好多少才算"真提升"?

对齐官方划分+5 种子后,提升幅度超种子间标准差且逐疾病方向一致——单点 0.5% 的"提升"在本任务噪声水平内。

Q96 能把标签当 sql 标注教学生写病历 NER 吗?

不能直接用——标签是住院级 DOE 不是 token 级 NER 标注;NER 教学回上游 NOTEEVENTS 自标注。

Q97 快照里 CUI 排序有语义吗?

无官方语义(集合语义);建模前固定排序(字典序/首现序)即可,排序本身不携带信号。

Q98 想引用 Figure 1 的判据比例数字,去哪拿?

论文原文 Figure 1(图内标注)——PMC7075529 全文图;本条目未转录图内数字(存照纪律:不转手转载图内数值)。

Q99 数据集的"负例增强"参数(–augment_negatives)是什么?

官方工具链参数(默认 0=不增强)——负例不足时的再采样开关;复现官方基准保持默认,增强实验单独声明。

Q100 用这个数据集发第一篇论文,最稳的切口?

标签协议消融(§7.9/§7.10 任一)+提前量分层曲线(§7.12)——方法学透明度是本数据集的最大护城河,切口选在它的强项上。

Q101 三疾病能合并成一个"患者恶化"数据集用吗?

语义会漂移(“任一并发症”≠“恶化”)——建议保留疾病维度做多任务或并集面板(§7.15),不要重命名成新任务。

Q102 官方划分文件是单独发的还是隐含在 CSV 名里?

隐含在文件命名(train/devel/test 前缀)——拿到数据即拿到划分;无需自己再切。

Q103 Δ(预测窗)值存在数据里吗?

不在 CSV 里显式存——由 DOE 与截断点推算(工具链内部计算);做 Δ 分层评估(§7.12)时自行导出。

Q104 数据集有 DOI 版本页吗?

有——PhysioNet /content/nosocomialriskdata/1.0/ 页面挂 10.13026/pm60-0g49;引用永远带版本号 v1.0。

§10 附录

§10.1 口径存照

  • 存照 A:预测时间窗官方双表述并存——摘要/方法节"24-96 小时"、Usage Notes"48-96 小时";技术口径以官方工具链参数(–min_pred_window 24 --max_pred_window 96)为准。
  • 存照 B:正/负例绝对数未在论文正文公开(指向 Supplementary Appendix B)——本条目规模数字一律采用正文队列住院总数+prevalence 口径。
  • 存照 C:prevalence(34.2%/11.1%/39.8%)为构造队列内统计;官方未发布对应全院流行率——两类数字不可互换。
  • 存照 D:PhysioNet 条目页访问级别徽标未在本条目核查快照中转写;本条目按 MIMIC-III 衍生物治理惯例与官方伦理声明(de-identified MIMIC-3、NIH IRB)记为受控访问,实际以条目页实时标注为准。
  • 存照 E:Gamma 分桶参数(k/θ)与桶大小未公开——负例的逐例精确复现不可行,分布级协议可复现;自实现时固定种子并报告桶分布。
  • 存照 F:CSV 包体量无官方精确值——"GB 级以内"系据数据形态(CUI 序列)的推断。
  • 存照 G:批次元数据(本系列生产档案)曾将该数据集记为"MIMIC-IV"系——官方标题与内容均为 MIMIC-III 派生,以官方为准。
  • 存照 H:"纯文本性能与疾病专用模型相当"为论文作者的文献对齐式论证——非同队列头对头比较;严格的模态对比需自建结构化基线。

存照 I(三队列患者级重叠的开放性):三疾病队列均源于同一上游患者群,患者级重叠必然存在但官方未公布重叠统计——多疾病联合研究的切分设计以自查为准(§6.1)。

存照 J(快照/序列分布的推演属性):§6.10 的序列长度与间隔形态基于上游 MIMIC-III 已知统计的推演,非官方发布统计——引用时以自数据实测为准。

存照 K( 示例扩展疾病的教学属性):§5.6 以"医院获得性谵妄"为例演示扩展配方——该示例不代表官方存在对应队列,种子 CUI 与正则族仅为教学示意。

存照 L(示例参数的教学属性):§7.13 特征工程与 §7.15 联合建模配方为本条目设计的工程方案,非官方基准组成——复现官方数字以 §7.2 命令为准。

存照 M(架构评述的时代视角):§6.13 对 CANTRIP 的评述含本条目的 2026 年视角判断——官方论文不含该评价;架构优劣以复现实验为准。

存照 N(FAQ 增补的口径归属):Q93-Q104 为本条目编写的使用指南性问答(依官方文档与工具链行为归纳),官方 FAQ 不存在——与官方材料冲突时以官方为准。

§10.2 引文清单

  1. Goodwin T. Nosocomial Risk Datasets from MIMIC-III (version 1.0). PhysioNet (2022). DOI 10.13026/pm60-0g49. RRID SCR_007345.
  2. Goodwin TR, Demner-Fushman D. A customizable deep learning model for nosocomial risk prediction from critical care notes with indirect supervision. J Am Med Inform Assoc 27(4):567-576 (2020). DOI 10.1093/jamia/ocaa004. PMID 32065628.
  3. Goodwin, T. R. CANTRIP (Version 1.0). GitHub. https://github.com/h4ste/cantrip
  4. Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data 3:160035 (2016).(上游)
  5. Goldberger AL, et al. PhysioBank, PhysioToolkit, and PhysioNet. Circulation 101(23):e215-e220 (2000).
  6. Magill SS, Edwards JR, Bamberg W, et al. Multistate point-prevalence survey of health care–associated infections. N Engl J Med 370(13):1198-208 (2014).(HAI 负担背景)
  7. Henderson JM, Blackstone EH, Hixson ED, et al. Hospital-acquired anemia: prevalence, outcomes, and healthcare implications. J Hosp Med 8(9):506-12 (2013).(HAA 背景)
  8. Silver SA, Long J, Zheng Y, et al. Cost of acute kidney injury in hospitalized patients. J Hosp Med 12(2):70-6 (2017);Chertow GM, et al. J Am Soc Nephrol 16(11):3365-70 (2005).(AKI 背景)
  9. Johnson AEW, Kramer AA, Clifford GD. A new severity of illness scale using a subset of Acute Physiology and Chronic Health Evaluation data elements. Crit Care Med 41(7):1711-8 (2013).(OASIS)
  10. Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health (2026). DOI 10.1038/s44360-026-00096-z.(平台引用)

§10.3 与本系列其他条目的关系

  • 490(MIMIC-III)/491(III Demo):直接上游——NOTEEVENTS 与结构化表经四层管线变成本数据集的 chronology;双键 subject_id/hadm_id 直通。
  • 492(MIMIC-IV):无数据键接的前任/现任主库关系;本条目的标签协议(判据+截断+采样)是向 IV 复刻院感基准的现成模板。
  • 494(phenotype-annotations-mimic):同属"标签增强层"——表型标注(人工/结算衍生)与本条目的规则间接监督构成标签方法学的两极对照。
  • 486-488(波形三库):无键接;"报警提前量"的任务哲学同源。
  • 489(MIMICEL):无键接;但其流程挖掘叙事与本条目的"事件日期"语义共享"从记录推断事件"的方法论内核。

§10.4 变更日志

  • 2026-09-20:初版(order 493)。双源核查完成(PhysioNet v1.0 条目页+JAMIA 2020 论文/PMC7075529),口径存照 A-H 落档;三队列规模、DOE 三判据、间接监督协议、Table 2 全景基准、DSP/LLM 合规环境纳入;名称勘误(MIMIC-III 非 MIMIC-IV)记入存照 G。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集