信息速览
INFOBOX
| 属性 | 内容 |
|---|---|
| 名称 | Nosocomial Risk Datasets from MIMIC-III(医院获得性疾病风险数据集) |
| 维护方 | Travis Goodwin(NIH NLM Lister Hill National Center for Biomedical Communications)/ PhysioNet |
| 发布 | v1.0(2022-09-15,initial release,无后续版本) |
| 上游 | MIMIC-III v1.4(46,520 患者;2001-2012 BIDMC) |
| 规模 | HAAKI 34,878 住院(34.2%)/ HAPI 35,218 住院(11.1%)/ HAA 38,385 住院(39.8%)(排除 <2 天住院) |
| 任务 | 医院获得性疾病风险预测:入院 ≥48h 后发生、提前 24-96h 预报(§1.7 时间窗口径) |
| 三疾病 | HAAKI(KDIGO)/ HAPI(NPUAP)/ HAA(WHO)——UMLS 种子+词汇模式+结构化标准三判据 |
| 数据形态 | chronologies(UMLS CUI 快照序列)+ admittimes + labels 三 CSV × train/devel/test × 三疾病 |
| 标签方法 | 间接监督:DOE 截断造正例 + Gamma 先验采样造负例(无逐快照人工标注) |
| 基准 | CANTRIP(JAMIA 2020):纯文本 AUC 74.61-87.05%,对比 LR/SVM/biLSTM |
| 格式 | CSV(gzip)+ GitHub 工具链(h4ste/cantrip,TensorFlow) |
| 访问 | PhysioNet 受控(基于 MIMIC-III 衍生;CITI + DUA) |
| DOI | 10.13026/pm60-0g49(v1.0);论文 DOI 10.1093/jamia/ocaa004 |
| 平台 | PhysioNet / CANTRIP GitHub |
§0 E-E-A-T 信任声明与免责声明
- 核查路径:本文数字取自 PhysioNet 官方条目页(v1.0,2022-09-15 发布)与官方论文(JAMIA 27(4):567-576, 2020,PMID 32065628)双源交叉;模型配置与文件格式以 GitHub h4ste/cantrip 官方仓库为准;合规环境以 PhysioNet 站内政策公告(DSP 2025 / LLM 2025-09-24)为准。
- 名称勘误:该数据集为 MIMIC-III 的衍生数据集(官方标题即如此)——检索与引用时注意与"MIMIC-IV 系院感研究"区分;本条目以官方命名为准。
- 口径纪律:34.2%/11.1%/39.8% 是构造队列内的患病率(正例占比,队列经抽样构造),不是 BIDMC 全院流行率——两者混用是本数据集文献最常见的硬伤。
- 免责:本条目面向 AI 工程师与临床 NLP 研究者,不构成临床建议;标签由算法规则自动生成(间接监督),任何临床决策支持用途须先经前瞻验证。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:MIMIC-III 上派生的医院获得性疾病风险预测基准——三个疾病(HAAKI/HAPI/HAA)各一套文本派生时序特征(chronology)+ 间接监督标签,配套 CANTRIP 模型与 JAMIA 论文。
- 关键数字:34,878/35,218/38,385 住院(三疾病队列);24-96h 预测窗;CANTRIP 纯文本 AUC 74.61%-87.05%。
- 独特之处:标签是规则自动生成的——DOE(事件日期)三判据判定 + 时间窗截断 + Gamma 采样负例,零人工逐例标注。
- 适合谁:临床 NLP(文本时序建模)、弱监督/间接监督方法研究、患者安全预警系统原型。
- 一句话:它是"用规则造标签、用文本学风险"的方法学样板——模型可替换,标签工程思想长存。
§1.1 摘要
Nosocomial Risk Datasets from MIMIC-III 是 NIH 国家医学图书馆(NLM)Lister Hill 中心发布的医院获得性疾病风险预测数据集(PhysioNet v1.0,2022-09-15)。它从 MIMIC-III(46,520 患者)中排除住院记录不足 2 天者后,为三种常见医院获得性疾病构建了独立队列:医院获得性急性肾损伤(HAAKI,34,878 住院)、医院获得性压力性损伤(HAPI,35,218 住院)、医院获得性贫血(HAA,38,385 住院)。每个住院的"临床时间线"被抽象为 chronology——离散不连续的快照序列,每个快照编码同一天全部临床笔记经 MetaMap Lite 抽取的 UMLS CUI 观测。标签采用间接监督:先以三判据(UMLS 种子概念/词汇模式/结构化标准)回顾性确定事件日期(DOE),正例截断至 DOE 前 24-96 小时,负例按人口学与入院特征分桶后以 Gamma 先验采样模拟"本应发生而未发生"的时间线。官方 CANTRIP 模型(reCurrent Additive Network)证明纯文本即可获得 74.61%-87.05% 的 AUC,与结构化特征模型文献报告相当——临床文本作为预测信号的竞争力由此奠定。
§1.2 战略价值
- 标签工程的教科书:医疗 AI 最稀缺的不是数据而是标签——本数据集示范了"规则判定事件日期→时间窗截断→分布匹配负例"的完整自动标签流水线,任何"标注贵"的院内预测任务都能借鉴这套思路。
- 文本时序的基准地位:在 MIMIC-III notes 上做时序建模的标准对比点(CANTRIP + 三浅层基线 + 完整指标表)——临床 NLP 方法论文的可复现锚点。
- 患者安全视角的独特任务族:AKI/压疮/贫血是"住院期间获得"的疾病——预测它们的提前量直接换算为干预窗口,与死亡预测等"结局预测"任务形成互补的任务生态。
- 纯文本信号的存在性证明:CANTRIP 不用任何实验室值/生命体征即达 AUC 74-87%——为"文本里有多少结构化数据之外的信息"这一根本问题提供了量化证据。
- 低门槛的弱监督教学样本:数据形态轻量(三个 CSV)、工具链开源、论文方法学透明——是学习"间接监督/弱标签"范式成本最低的真实临床数据集。
§1.3 同类数据集横向对比
| 数据集 | 任务 | 特征形态 | 标签来源 | 相对定位 |
|---|---|---|---|---|
| Nosocomial Risk(本条) | 院感三疾病 24-96h 预测 | 文本派生 CUI 快照 | 规则间接监督 | 标签工厂样板 |
| MIMIC-III benchmark(490 条) | 死亡/LOS/表型/恶化 | 结构化 76 维 | 结算编码/临床定义 | 结构化基准 |
| MIMIC-IV(492 条) | 通用 ICU 研究 | 双模块结构化+文本模块 | 无预置标签 | 上游原材料 |
| eICU 预警研究 | 多中心恶化 | 结构化 | 临床定义 | 外推验证 |
| 单疾病公开集(如 sepsis 竞赛数据) | 单疾病早筛 | 混合 | 竞赛标注 | 单点深挖 |
结论:本数据集的生态位不是"更大更全",而是**“标签方法论可复制”**——在所有公开 ICU 数据集里,它把"如何在不标注的情况下得到可用的风险标签"回答得最完整。
§1.4 版本与方法学时间轴
| 时间 | 事件 |
|---|---|
| 2018-2019 | CANTRIP 仓库开发(GitHub 最后 commit 2019-10,JAMIA 初稿期;TensorFlow 1.x 生态) |
| 2020-04 | JAMIA 论文发表(27(4):567-576;DOI 10.1093/jamia/ocaa004) |
| 2022-09-15 | PhysioNet 上架 v1.0(DOI 10.13026/pm60-0g49;initial release) |
| 2022 至今 | 无版本更新——数据冻结,标签/划分长期稳定(对基准复现是优点) |
⚠️ 单版本数据集的"版本纪律"简单得多:所有文献数字都基于 v1.0——但仍要核对论文正文与补充材料(Supplementary)的口径差异(§1.7)。
⚠️ 工具链是 TF 1.x 时代产物——新环境复现要么搭旧环境,要么迁移模型代码(标签 CSV 本身与框架无关,可直接用)。
§1.5 应用场景矩阵
| 场景 | 推荐度 | 用到的资源 | 关键注意 |
|---|---|---|---|
| 文本时序模型研究 | ★★★★★ | chronologies + 官方划分 | 与 Table 2 四基线对比 |
| 弱监督/间接监督方法学 | ★★★★★ | 全套标签 CSV + 论文方法节 | 负例采样假设的敏感性分析 |
| 患者安全预警原型 | ★★★★ | 三疾病任一队列 | 提前量-精度权衡曲线 |
| NLP 特征工程教学 | ★★★★ | MetaMap Lite 管线复现 | 过滤规则四条逐条实现 |
| 与 MIMIC-III 上游联用 | ★★★ | subject_id/hadm_id 反查结构化数据 | 需上游 MIMIC-III 独立授权 |
| 临床落地 | ★★ | 全部 | 标签噪声+单中心,须前瞻验证 |
§1.6 组件全景:三疾病 × 三文件 × 三划分
- 数据组织:HAAKI/HAPI/HAA 三疾病各自独立——每疾病 9 个 CSV(train/devel/test × chronologies/admittimes/labels),共 27 个文件的矩阵结构。
- chronologies CSV:
[subject_id],[hadm_id],[timestamp],[observations]——observations 是空格分隔的 UMLS CUI 序列(一个快照=同一天全部笔记的观测并集);这是"文本的结构化压缩"——保留语义、去除原文。 - admittimes CSV:
[subject_id],[hadm_id],[timestamp]——入院时刻(Δ 计算的起点)。 - labels CSV:
[subject_id],[hadm_id],[timestamp],[label]——label=1 的行标记 DOE 日;工具链据此自动截断与剔除 present-on-admission。 - 官方工具链:h4ste/cantrip(TF 1.x)——run_experiment.py 一条命令完成截断/训练/评估(–min_pred_window 24 --max_pred_window 96)。
- 不在数据里的:原始笔记文本、结构化化验值、人口学表——都要回 MIMIC-III 上游取(本数据集只发"加工品")。
§1.7 口径速记:五个必背口径
- 队列规模三口径:HAAKI 34,878 / HAPI 35,218 / HAA 38,385 住院——引用必须带疾病名;三者不是同一批住院(正负例构成不同)。
- 患病率语义:34.2%/11.1%/39.8% 是构造队列内正例占比——HAPI 的 11.1% 接近临床流行率直觉,HAA 的 39.8% 远高于流行率(队列构造所致)。
- 时间窗双表述:摘要/方法节"24-96h 提前量",Usage Notes"48-96h"——并存(存照 §10.1-A);训练参数以 --min_pred_window 24 --max_pred_window 96 为准。
- 疾病定义口径:“医院获得”=入院 ≥48h 后被 chart/labs/notes 证实(implicated)——不是 ICD 出院编码口径(仅 ICD 命中者被排除)。
- 性能口径:Table 2 的 50% 阈值指标——AUC 是阈值无关的,Sensitivity/Specificity/Precision 不是;引用必须注明阈值。
§1.8 访问方式速记
- PhysioNet 账号 → CITI 证书 → 签署受控数据 DUA(与 MIMIC-III 同一信用体系)→ 条目页签署该项目协议。
- 下载:三个疾病目录下的 CSV 压缩包(体量小——文本派生 CUI 序列,远小于 MIMIC-III 本体)。
- 上游联用:如需原始文本/结构化数据反查,另签 MIMIC-III DUA(独立项目)。
- 工具链:git clone h4ste/cantrip;TF 1.x 环境(python ≥3.6, tensorflow ≥1.14)或自行迁移。
- 最小验证:各 chronologies CSV 的唯一 hadm_id 计数应与论文队列数一致(HAAKI 34,878 等——以官方文件实际行数为准,先跑对账脚本)。
§1.9 独特视角:一座"标签工厂"的方法学解剖
把本数据集看成一座工厂最准确:原料是 MIMIC-III 的原始临床笔记;加工流水线是"NLP 抽取(MetaMap Lite+四层过滤)→ chronology 快照化 → DOE 三判据判定 → 时间窗截断 → 分桶 Gamma 采样负例";产品是三疾病×三划分的标准 CSV。这座工厂的教学价值在于它公开了全部工艺图纸——医疗 AI 领域绝大多数"带标签"数据集只给产品不给图纸,研究者只能把标签当黑盒信任;而这里每个标签都可追溯到一条可复现的规则链。更深的启示是**“监督信号的设计空间”**:CANTRIP 论文证明这套自动标签训出的模型能逼近文献中疾病专用模型——这说明标注预算紧张时,"把临床知识编码成规则、让规则生成标签"是一条被验证过的路。理解这座工厂,等于掌握了弱监督医疗 NLP 的完整思维模板。
§1.10 用户画像:谁在使用这个数据集
- 临床 NLP 研究者:文本时序建模的标准弱监督基准——方法论文的可复现锚点。
- 弱监督方法学者:间接监督/标签聚合/分布匹配负例的完整教学样本——"标签工厂"全图纸公开。
- 患者安全工程团队:HAAKI/HAPI/HAA 三预警任务的原型数据——提前量即干预窗口。
- 数据科学课程教师:轻量 CSV+开源工具链+论文透明——研究生弱监督专题的理想教材。
- 医院信息科工程师:把"规则造标签"的工艺迁移回院内 EHR 的参考实现。
§1.11 名词速查表
| 缩写/术语 | 全称与含义 |
|---|---|
| HAAKI | Hospital-Acquired Acute Kidney Injury——医院获得性急性肾损伤(KDIGO) |
| HAPI | Hospital-Acquired Pressure Injury——医院获得性压力性损伤(NPUAP) |
| HAA | Hospital-Acquired Anemia——医院获得性贫血(WHO) |
| DOE | Date-of-Event——事件日期(三判据首次命中日,间接监督的锚点) |
| chronology | 临床时间线的快照序列抽象(日粒度快照+间隔 δ) |
| CUI | Concept Unique Identifier——UMLS 概念唯一标识符 |
| OASIS | Oxford Acute Severity of Illness Score——负例分桶的病情匹配键 |
| ECE | Estimated Calibration Error——期望校准误差 |
| CANTRIP | reCurrent Additive Network for Temporal RIsk Prediction——官方模型 |
| MetaMap Lite | UMLS 驱动的轻量医学实体抽取工具(官方管线第一环) |
§2 医学与科学背景
§2.1 为什么"提前量"是患者安全的硬通货
医院获得性疾病的临床悲剧在于"发现时已成定局":AKI 的现行标准(KDIGO)本质上是肾损伤已发生的标记物,压疮的肉眼确认意味着组织损伤已存在,贫血常在化验单上"意外"现身。患者安全工程的破局思路是把发现转化为预报——而预报的价值由两个参数决定:提前量(多早知道)与精度(多准)。本数据集把这两个参数直接编码进任务定义:住院 ≥48h 后证实为"医院获得",预测窗 24-96h——提前 1 天以上的预报才有干预意义(停肾毒性药/翻身减压方案/小容量采血管),提前 1 小时的预报只是提前的坏消息。这个"提前量即价值"的任务设计哲学,与 486-488 波形库的报警研究一脉相承,是临床预测建模区别于一般 ML 竞赛的核心。
§2.2 三疾病的临床负担图谱
三个疾病不是随手挑的——它们是"住院获得、可预防、负担可量化"的代表:
- HAAKI:AKI 影响多达 20% 的住院,与死亡率升高、终末期肾病、慢性肾病相关(论文引 Silver 2017/Chertow 2005);现行标准是"损伤标记物"而非"预报器"——这是数据集声称"首个用临床笔记预测 AKI/HAAKI 的数据集"的动因。
- HAA:入院血红蛋白正常的患者住院期间转为贫血,住院时长、费用与院内死亡风险(依严重程度 +51%-228%,Henderson 2013)显著上升;ICU 患者日均采血 40-70mL,每多采 50mL 中重度 HAA 风险 +18%——医源性色彩最强的目标,干预手段明确(小容量管/减少化验)。
- HAPI:压疮引发脓毒症、蜂窝织炎、骨髓炎等并发症,老年住院期间发生压疮者出院后 1 年死亡率高达 60%(论文引文献);ICU 缺少公认的专用风险量表(Braden 量表在 ICU 特异性低)——数据驱动检测的价值主张清晰。
三疾病覆盖"器官功能/医源性血液损耗/皮肤完整性"三条患者安全主线,构成一个最小但完整的预警任务组合。
§2.3 间接监督范式:无标注的监督学习
逐快照标注"该患者此刻 48h 内发生 AKI 的风险"在成本上不可行(每个住院数百快照×数万住院)。本数据集的答案是间接监督(indirect supervision):不标注"每个时刻的风险",只标注"事件在哪天发生"(DOE),再让时间窗截断自动生成训练信号——DOE 前最后快照 y=1,负例用分布匹配模拟。这在弱监督谱系中属于"标签聚合+时间约束"的组合:DOE 本身由规则生成(三判据),而规则的可信度由临床标准(KDIGO/NPUAP/WHO)背书。理解这一范式的关键是接受标签噪声的系统性:DOE 判定误差(NLP 抽取漏检/规则边界)会以结构化方式传入训练信号——研究者的职责不是假装无噪声,而是测量并报告噪声结构(§5 泄漏与消融)。
§2.4 chronology 抽象:不规则间隙的时序解决方案
临床笔记的产出由临床流程驱动——记录密度极不均匀(住院首日十余条,周末可能整天空白)。直接把笔记当等间隔时序是伪命题。chronology 的解法是双序列抽象:L 个快照(每天一条,观测并集)+ 间隔序列 δ(相邻快照间的小时数,δ0 为入院到首条笔记)——时间信息不丢失但不强加均匀网格。这个抽象让模型自己学习"间隔多久的两次观测意味着状态变化",CANTRIP 的 δ 编码选项(–delta_enc sinusoid,正弦编码)正是消费这一设计的接口。对迁移者的启示:处理不规则临床事件流时,"快照+间隔"是最小可行的中间表示——比等间隔插值保留更多信息,比原始事件流更易批处理。
§2.5 纯文本信号的竞争力论证
“文本里到底有多少信息"是临床 NLP 的根本问题。本数据集给出了一个干净的存在性证明:CANTRIP 只消费 CUI 快照(无任何化验值/生命体征),AUC 达 74.61%(HAA)-87.05%(HAPI)-79.10%(HAAKI),论文结论"与文献报告的疾病专用模型性能相当”。注意论证的边界:①"相当"是文献对齐而非同队列头对头——严格比较需在同一队列跑结构化基线(数据集未提供,研究者可用上游 MIMIC-III 自建);②文本信号的部分来源是结构化数据的文本投影(化验值常以文字出现于笔记)——“纯文本"不等于"独立于化验数据的信息”。这个论证的真正价值是为多模态融合研究设定了"文本单模态下限"——任何文本+结构的融合模型应显著超过此线。
§2.6 NLP 管线的知识工程
从原始笔记到 CUI 快照的管线是四层漏斗:①MetaMap Lite 抽取全部候选观测;②否定/不确定/家族关联过滤(非肯定、非确定、非现患、非患者本身的观测剔除——“其母亲有糖尿病"不能算患者观测);③章节过滤(consults/family history/past medical history/social history 章节的观测剔除——历史与会诊信息不构成本次住院的现患证据);④语义类型过滤+停用词(UMLS 语义类型限医学问题/干预/药物/解剖部位;InfoBot 医学停用词表)。这套规则的每一层都是"临床认识论"的编码:什么算证据、什么算关联、什么算现患。复现者最容易低估的是第②③层——它们决定了"住院期间新出现”(nosocomial 语义)与"入院时已存在"(present-on-admission)的分界,正是任务定义的命门。
§2.7 DOE 三判据的三角验证
DOE 判定用三判据取最早命中:①本体判据(UMLS 种子概念后代——语义泛化,"renal failure"及其下位概念都算);②词汇判据(正则模式——捕捉本体漏掉的表述,且排除冒号后缀的结构化模板如 “bed sore: none”——后者是阴性陈述);③结构化判据(KDIGO/NPUAP/WHO 标准直接查化验/chart——文本完全沉默时的兜底)。三角设计的意义:任何单判据都有系统性盲区(本体覆盖不全/正则过拟合/结构化标准滞后于临床文本),三判据并集最大化召回,而"最早命中日"的一致性由论文 Figure 1 的分层统计透明呈现(各判据贡献的比例逐疾病给出)。移植到其他疾病时,这套"本体+词汇+结构化"三判据模板可直接套用——先选种子 CUI,再写领域正则(记得处理阴性模板),最后接临床标准的结构化定义。
§2.8 负例构造的分布匹配哲学
随机挑"没得病的住院"当负例会引入选择偏差(谁进负例池由结局决定)。本数据集的负例构造走"分布匹配"路线:把正例按 8 个协变量(年龄/性别/种族/ICU/入院来源/入院类型/OASIS/保险)分桶,每桶内用 MLE 拟合正例 TTE(入院到 DOE 的小时数)的 Gamma 分布,然后给负例采样一个模拟 DOE’(min(入院+TTE’, 出院日))——负例与正例在"何时会得病"的分布上对齐,负例时间线截断到 DOE’ 前 24-96h。这保证模型学的是"即将发生 vs 尚未到点"而非"病得重 vs 病得轻"。代价是负标签带上了分布假设的烙印(Gamma 形状选择/分桶稀疏区的估计不稳)——敏感性分析(换分布/换分桶)是使用本数据集的必修消融。
§2.9 与医院感染监测体系的关系
医院获得性疾病的"官方监测"由 CDC NHSN 等体系承担(点患病率调查如 Magill NEJM 2014:全美多州调查确立 HAI 负担基线)。本数据集与之的分工:监测体系回答"有多少"(流行病学计数,依赖人工病历回顾与统一标准),本数据集回答"谁能提前知道"(预测建模,依赖自动化标签)。两者的标准族不同(NHSN 的感染标准 vs KDIGO/NPUAP/WHO 的疾病标准)——本数据集的三疾病刻意避开"感染"定义的复杂性(HAAKI/HAPI/HAA 都非感染类),恰是绕开 NHSN 标准争议、选择有明确临床标准的疾病的务实选择。理解这层分工,才能准确定位论文标题里 “nosocomial” 一词的边界:它是"医院获得"的广义用法,不是"医院感染"(HAI)的狭义用法。
§2.10 单中心标签的可迁移性边界
标签工厂的全部工艺都打上了 BIDMC 的烙印:笔记模板(章节结构决定第③层过滤的有效性)、临床惯例(化验频次决定结构化判据的灵敏度)、MetaMap 对该院文本风格的适配度。迁到另一家医院,三层都要重检:章节名不同则过滤规则失效;采血惯例不同则 HAA 的结构化判据漂移;文本风格不同则 CUI 抽取误差结构改变。可迁移的是工艺流程(四层漏斗+三判据+Gamma 采样),不可直接迁移的是工艺参数。这正是本数据集把自己定位为"方法学样板"而非"即用预警器"的深层原因——它的 GitHub 可以 fork,它的标签不能直接照抄。
§2.11 从数据到证据:弱监督研究的证据层级
本数据集上能产出的研究按证据强度排序:①方法学基准研究(新模型 vs Table 2——证据强度依赖官方划分的严格遵守);②标签协议研究(消融判据/负例策略——产出可迁移的工程知识);③模态价值研究(文本 vs 结构化 vs 融合——需上游自建对照);④跨库协议迁移(向 MIMIC-IV 复刻——增量最大但需重建全部判定器);⑤部署前瞻研究(超出数据集边界——本数据集只能提供回放级验证)。层级每上一级,对"标签噪声结构"的测量义务递增——这是弱监督数据与金标注数据的本质区别。
§2.12 OASIS 评分与分桶工程
分桶变量里的 OASIS(Oxford Acute Severity of Illness Score,Johnson 2013)值得单独一节:它是从 MIMIC 的急性生理数据子集计算的严重度评分——与 SAPS II/APACHE 同族但设计目标是"最小数据可获得"。在本数据集的角色是负例采样的病情匹配键:没有它,负例会系统性地比正例"健康"(进 ICU 的轻症患者占比失真),模型学到的将是严重度而非疾病前兆。复现分桶时的工程细节:OASIS 需从上游 MIMIC-III 计算(官方概念 SQL 可用)——这是"本数据集+上游"联用的刚需场景之一;桶键缺 OASIS 的简化实现会在 HAAKI(严重度依赖最强的疾病)上出现可测量的性能假象。
§2.13 双窗语义:48h 获得线与 24h 提前线
任务定义里的两个时间常数承担不同角色:48h 线是"医院获得"的资格线——入院 48h 内证实者属 present-on-admission(入院已带病),被工具链自动剔除;24h 线是预测的底线——截断点不得晚于 DOE 前 24h(更近的截断无干预价值)。两线相夹出预测窗的工作区,96h 上限则封顶"远期模糊区"。三线齐读:48h 剔除→96h 封顶→24h 兜底,构成 24-96h 训练窗的全部边界逻辑。混淆三者的角色(比如把 48h 当预测窗下限)会让复现偏差伪装成"数据集噪声"——先画时间轴再写代码是本数据集工程的起手式。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格 |
|---|---|
| 全称 | Nosocomial Risk Datasets from MIMIC-III |
| 版本 | v1.0(2022-09-15 发布;initial release,无后续版本) |
| 上游 | MIMIC-III v1.4(46,520 患者;2001-2012 BIDMC;Credentialed) |
| 任务 | 医院获得性疾病(入院 ≥48h 后证实)风险预测,预测窗 24-96h |
| 队列 | HAAKI 34,878 住院(prevalence 34.2%)/ HAPI 35,218(11.1%)/ HAA 38,385(39.8%) |
| 划分 | 每疾病 8:1:1 分层随机(train/devel/test) |
| 特征 | chronology 快照序列(MetaMap Lite→UMLS CUI,四层过滤) |
| 标签 | 间接监督(DOE 三判据+截断+Gamma 采样负例) |
| 文件 | 三疾病 × 三划分 × 三 CSV(chronologies/admittimes/labels) |
| 基准 | CANTRIP(AUC 74.61/87.05/79.10%)vs LR/SVM/biLSTM |
| 格式 | CSV(gzip)+ GitHub 工具链(TF 1.x) |
| 访问 | PhysioNet 受控(CITI+DUA) |
| DOI | 10.13026/pm60-0g49;论文 10.1093/jamia/ocaa004 |
§3.2 队列构造漏斗与口径地图
从 MIMIC-III 到三疾病队列的构造路径(论文正文口径):
MIMIC-III 46,520 患者
└→ 全部住院(admissions)
└→ 排除住院记录 <2 天者( chronology 无法形成有效快照窗)
└→ 按疾病分别构造:
HAAKI:34,878 住院(正例占比 34.2%)
HAPI :35,218 住院(正例占比 11.1%)
HAA :38,385 住院(正例占比 39.8%)
├→ 正例:DOE 三判据命中(note 本体/词汇/结构化标准)
└→ 负例:分桶 Gamma 采样模拟 DOE'
(仅满足出院 ICD-9/CCS 编码、无 DOE 依据者被排除)
三个队列是三次独立构造(各自抽样、各自划分)——不是同一批住院的三种标签。跨疾病比较模型性能时,记住队列构成不同(HAPI 正例率最低、任务最难,其 AUC 87.05% 的含金量因此更高)。每个队列内部 8:1:1 分层随机切分(分层键=标签),患者级防泄漏需自查(§5.3)。
§3.3 DAIMS 数据AI就绪度评估
| 维度 | 评分 | 说明 |
|---|---|---|
| 机器可读性 | 8.5/10 | 纯 CSV、格式简单、体量小;CUI 序列需 UMLS 词典解码 |
| 文档完备性 | 8/10 | 官方条目页+JAMIA 论文+GitHub 工具链三源一致;正负例绝对数藏在补充材料 |
| 数据质量 | 7/10 | 标签为规则生成(可追溯但带系统性噪声);文本派生特征受 MetaMap 误差传递 |
| 语义标准化 | 8.5/10 | 全量 UMLS CUI——语义互操作性好;三判据与临床标准(KDIGO 等)显式对齐 |
| 时间语义 | 7.5/10 | 快照+间隔序列保留不规则时间结构;上游 MIMIC-III date shift 继承 |
| 可复现性 | 8.5/10 | 官方划分+官方指标表+开源工具链;TF 1.x 环境折旧是主要摩擦 |
| 合规摩擦 | 中 | 受控访问同 MIMIC-III;衍生品发布须守 PhysioNet Ext 规范 |
| 综合 | 7.8/10 | 方法论透明度顶级、任务专精型数据集的 AI-Ready 标杆 |
§3.4 存储与计算需求
- 磁盘:全套 CSV 压缩包体量小(文本派生 CUI 序列远轻于 MIMIC-III 本体;GB 级以内)——任何笔记本可承载。
- 内存:单疾病队列全量载入 pandas 完全可行;三个疾病全量+中间特征 <16 GB。
- 训练:CANTRIP 时代硬件(2019)即可复现官方基准——现代单卡轻松覆盖;TF 1.x 环境建议 docker 固定(或迁移到 PyTorch,标签 CSV 与框架无关)。
- UMLS 解码:需 UMLS 词典(免费但需 UTS 账号)——CUI→概念名的映射表;只做建模可不解码(CUI 即 token)。
- 无需:PostgreSQL/BigQuery——本数据集无关系库形态;如需反查上游结构化数据才涉及 MIMIC-III 数据库。
§3.5 获取通道
- PhysioNet 官方(唯一正式渠道):CITI 证书+受控 DUA→条目页签署项目协议→下载三疾病 CSV 包(DOI 10.13026/pm60-0g49)。
- 工具链:GitHub h4ste/cantrip(模型代码/评估脚本/参数示例)——数据与代码分离下载。
- 上游 MIMIC-III(可选):反查原始文本/结构化数据时另签 MIMIC-III DUA——subject_id/hadm_id 双键对齐。
- UMLS 词典:(可选)UTS 账号下载 Metathesaurus——CUI 解码与语义类型过滤复现必需。
- 合规提示:2025 年起 PhysioNet 受控数据访问受美国 DSP 政策(EO 14117)地域限制约束(§8);数据与派生品不得上传第三方在线服务(LLM 条款同适用)。
§3.6 口径对齐表
| 想回答的问题 | 用的口径 | 数值/规则 |
|---|---|---|
| 某疾病队列多大? | 该疾病住院数 | HAAKI 34,878 / HAPI 35,218 / HAA 38,385 |
| 某疾病多常见? | 构造队列 prevalence | 34.2% / 11.1% / 39.8%(非全院流行率) |
| 提前多久预测? | 训练窗口参数 | min 24h / max 96h(摘要口径 24-96h;Usage Notes 48-96h——存照) |
| "医院获得"怎么算? | 入院 ≥48h 后被证实 | chart/labs/notes 证据;非 ICD 出院编码口径 |
| 模型该多好? | Table 2(50% 阈值) | CANTRIP AUC 74.61-87.05%;指标带阈值声明 |
| 数据多大? | CSV 压缩包 | GB 级以内(轻量;无官方精确值——存照) |
§3.7 文件格式规范(逐字段)
<split>.chronologies.csv # split ∈ {train, devel, test}
subject_id, hadm_id, timestamp, observations
# observations = 空格分隔 UMLS CUI 串(如 "C0022660 C0002871 ...")
# 一个 timestamp = 一个快照 = 同一日历日全部笔记的观测并集
# 间隔信息(δ)由相邻 timestamp 差值隐式携带
<split>.admittimes.csv
subject_id, hadm_id, timestamp
# timestamp = 该住院的入院时刻(δ0 与 TTE 的计算起点)
<split>.labels.csv
subject_id, hadm_id, timestamp, label
# label=1 行的 timestamp 标示 DOE(事件日期);label=0 为其余快照
# run_experiment.py 据此自动截断 chronology 并剔除 present-on-admission
解析要点:①三文件以 (subject_id, hadm_id) 双键关联;②chronologies 无表头假设需以官方文件实际格式为准(先 head 对账再写解析器);③时间均为上游 MIMIC-III 去标识时间(date shift 后)——绝对年份无意义,相对间隔恒真;④CUI 是"最小语义单元"——任何特征工程先问"这个 CUI 在 UMLS 里是什么语义类型"。
§3.8 DOE 判定标准速查表
| 疾病 | UMLS 种子 CUI | 词汇模式(正则族) | 结构化标准 |
|---|---|---|---|
| HAAKI | C0022660(Kidney Failure, Acute) | kidney failure / renal failure / kidney injury / renal injury / AKI | KDIGO |
| HAPI | C0011127(Pressure Ulcer) | bed sore / bed ulcer / pressure sore / pressure ulcer / decub* sore / decub* ulcer | NPUAP |
| HAA | C0002871(Anemia) | anemia / anaemia / HAA | WHO |
判定规则:DOE=三判据最早命中日;词汇匹配排除"冒号后缀"结构化模板(“bed sore: none” 是阴性);仅 ICD-9/CCS 出院编码命中者不产生 DOE(住院被排除)。三判据各自贡献比例见论文 Figure 1——复现判定器时按疾病逐条对账。
§3.9 官方文档导航
四份一手材料的分工:①PhysioNet 条目页——任务定义/队列规模/文件格式/伦理(本文 §3 的主要来源);②JAMIA 论文——方法学细节(判据命中比例/负例协议/完整实验)+Table 2 基准;③GitHub h4ste/cantrip——唯一权威实现(截断逻辑/参数默认值/指标计算);④Supplementary 材料——正负例绝对数等正文未载细节。检索顺序建议:条目页(是什么)→论文(为什么)→仓库(怎么做)→补充材料(数字细节)。社区二手博客与教程仅作导航用,数字一律回一手材料对账——本数据集文献里 prevalence 误用率高(§6.5 坑点 1),二手转述是重灾区。
§3.10 三疾病临床背景深读
三个疾病的选择逻辑可以在"可预防性-证据可计算性"平面上细读:HAAKI——KDIGO 标准完全实验室驱动(肌酐/尿量),结构化判据最可靠,但"标准即晚期标记"的悖论使文本提前量最有价值;HAPI——纯临床观察型疾病(无化验金标准),三判据中词汇/本体判据权重最大,标签质量最依赖 NLP 管线,也是唯一有 NPUAP 分期体系可引用的目标;HAA——机制最明确(采血丢失+急性病消耗),结构化判据(HgB 序列)最直接,干预窗口的经济价值最可量化(小容量管成本 vs 输血风险)。三疾病合起来恰好覆盖"实验室驱动/观察驱动/机制驱动"三种标签生成模式——这就是为什么"扩展到新疾病"时三判据配比要重新设计。
§3.11 轻量数据集的 CI 集成
GB 级以内的体量使本数据集成为 MIMIC 系中唯一适合进 CI 的基准:①数据一致性检查(hadm_id 计数/三 CSV 双键一致/DOE 行数)入 pre-merge 检查;②LR 基线冒烟测试(AUC 偏差 <2%)入 nightly——防止管线静默劣化;③截断协议的单元测试(边界 24h/96h 整点/48h 排除规则)——照 run_experiment.py 写断言。这套 CI 让"复现包"从静态承诺变成活资产——每次依赖升级/代码重构后基准自动对账。教学价值同样直接:数据工程课上"为弱监督数据集搭 CI"是绝佳的实战题目。
§4 数据结构
§4.1 chronology 对象模型
住院(hadm_id)
├─ admittime ──────────────── δ0 ──┐
│ ▼
│ s1 ──δ1── s2 ──δ2── s3 ─ ⋯ ─ sL
│ │ │ │ │
│ 快照=当日全部笔记的观测并集(UMLS CUI 集合)
│
└─ DOE(label=1 的 timestamp)
└─ 正例:截断至 DOE 前 24-96h 的最后快照 s_k → y=1,Δ=t(s_k)→DOE
└─ 负例:DOE' ~ min( admittime + TTE', dischtime ),TTE'~Γ(k_b,θ_b)
截断方式同正例 → y=0
三个工程语义:①快照是日粒度(同日多笔记合并)——小时级预测窗是"截断点选择"而非"快照粒度";②间隔 δ 是一等公民——模型的时序感知(正弦编码)消费的是它;③标签只锚定日期——同一天内的时刻语义由快照机制吸收。
§4.2 标签文件解剖与自动截断协议
labels CSV 的巧妙处在于用一个 0/1 列编码了完整的监督协议:label=1 行=DOE 日。官方工具链的处理流程(可直接复用):①对正例,找 DOE 前最后一个落在 [DOE-96h, DOE-24h] 窗内的快照作为预测点;②对负例,用采样 DOE’ 做同样截断;③present-on-admission 剔除——DOE 落在入院 48h 内者不属于"医院获得",工具链自动丢弃。自己实现时最容易错的三处:窗口边界(含不含 24h 整点)、负例 DOE’ 与出院日取 min、48h 排除规则先于截断执行。建议直接读 run_experiment.py 的截断函数逐行对照——它是唯一权威实现。
§4.3 NLP 管线复现(四层漏斗)
从原始 MIMIC-III 笔记重建 chronology(仅当需要扩展标签到新疾病时才必须;日常使用直接用官方 CSV):
# 伪代码框架(论文 Methods + 补充材料口径)
# 1) MetaMap Lite 抽取:每条笔记 → [(cui, semantics, span, section), ...]
# 2) 层过滤(伪码):
# keep = affirmed and certain and patient_related # 否定/家族关联剔除
# keep &= section not in {consults, family_history,
# past_medical_history, social_history} # 章节剔除
# keep &= semantic_type in {problem, intervention, drug, anatomy} # 语义类型
# keep &= cui not in InfoBot_STOPWORDS # 停用词
# 3) 按日历日聚合 → 快照;按时间排序 → chronology(δ 显式导出)
# 4) 对账:抽样 hadm_id 与官方 chronologies CSV 逐快照比对(覆盖率/一致率报告)
复现的现实预期:因 MetaMap 版本/参数漂移,逐 CUI 完全一致不现实——对账目标是快照级 Jaccard 相似度的分布而非逐项相等;差异分布本身写进方法学附录。
§4.4 负例采样复现(Gamma 分桶协议)
# 每疾病独立执行(论文 Methods 口径):
# bucket_keys = [age, sex, race, icu_type, admission_source,
# admission_type, OASIS, insurance]
# for b in buckets: # 桶内仅用正例拟合
# TTE_b = [hours(admittime -> DOE) for positives in b]
# (k_b, theta_b) = MLE_Gamma(TTE_b)
# for neg in negatives:
# b = bucket_of(neg)
# tte = sample(Gamma(k_b, theta_b))
# DOE_neg = min(neg.admittime + tte, neg.dischtime)
# truncate_chronology(neg, DOE_neg) # 与正例同窗截断
工程提醒:①稀疏桶(某协变量组合下正例过少)的 Gamma 拟合不稳——论文未给桶大小下限(存照),复现时报告桶分布与拟合并敛性;②采样随机性要固定种子并写进复现包——负例集合不同=数据集不同;③自行扩标签到新疾病时,整个分桶/拟合/采样协议照搬,桶键按可得协变量裁剪。
§4.5 与 MIMIC-III 上游的关联协议
本数据集(CUI 快照+标签) ←─ subject_id/hadm_id ─→ MIMIC-III 上游
├─ NOTEEVENTS:原始文本(做 LLM/细粒度 NLP)
├─ LABEVENTS/CHARTEVENTS:结构化基线特征
├─ ADMISSIONS:人口学/保险/出入院
└─ patients:anchor 年龄等
三步协议:①双键 join(subject_id+hadm_id——两库标识符体系完全一致);②注意时间同源(同 date shift)——快照 timestamp 可直接与上游 charttime 对齐;③授权独立(MIMIC-III 单独 DUA)。典型联用场景:结构化 vs 文本的模态对比实验(§5.3)、特征级融合(CUI 序列+化验时序)、把 DOE 标签反向应用到上游结构化数据(构造"结构化版 Nosocomial 基准"——论文没做、社区有空白的增量工作)。
§4.6 数据血缘
MIMIC-III v1.4(NOTEEVENTS + 结构化表)
│ MetaMap Lite + 四层过滤
▼
chronology 快照序列(UMLS CUI)
│ DOE 三判据(本体/词汇/结构化标准)
▼
DOE 判定(每正例住院)
│ 正例截断 + 负例 Gamma 采样
▼
三疾病 × 8:1:1 标准划分(v1.0,2022-09-15 PhysioNet 上架)
│
├→ CANTRIP 基准(JAMIA 2020 Table 2)
└→ 社区复现/扩展(新疾病/新模型/新负例策略)
§4.7 完整性清单
- [x] 三疾病队列规模官方公开(34,878/35,218/38,385)
- [x] 标签生成规则完全公开(三判据+截断+Gamma 采样)
- [x] 官方划分与官方指标表(Table 2)可对账
- [x] 工具链开源(h4ste/cantrip)
- [ ] 正/负例绝对数未在正文公开(Supplementary B)——自查时用文件实际行数
- [ ] 原始笔记/结构化数据不含在内——须回上游 MIMIC-III
- [ ] 工具链 TF 1.x 冻结(2019)——新环境需迁移
- [ ] 桶级 Gamma 参数未公开——负例精确复现不可行(分布协议可复现)
§4.8 CUI 词典工程(UMLS 解码实战)
# UMLS Metathesaurus(UTS 账号免费下载)的最小消费模式
import csv
# MRCONSO.RRF → CUI -> 首选名/语义类型映射(只取 ENG 且 pref 状态行)
cui2name = {}
with open("MRCONSO.RRF", encoding="utf-8") as f:
for row in csv.reader(f, delimiter="|"):
if row[1] == "ENG" and row[6] == "Y": # 英文+首选
cui2name.setdefault(row[0], row[14])
# 快照解码示例:"C0022660 C0002871" -> ["Acute Kidney Failure", "Anemia"]
# 语义类型过滤需 MRSTY.RRF(TUI -> 语义类型名)
三个工程判断:①不解码也能建模——CUI 直接作 token,词表即 UMLS 子集(嵌入随机初始化,官方口径);②解码为解释性服务——注意力权重/重要特征归因时才需要 CUI→名称;③语义类型是过滤的词典侧镜像——管线第③层用 MRSTY 实现。磁盘预算:Metathesaurus 全量数 GB,只取 ENG 子集后可控;更新节奏跟随 UMLS 年度版本并在复现包记录版本号(CUI 覆盖率随版本微变)。
§4.9 与 phenotype-annotations 的标签方法学对照
同属"标签增强层"的 494 条目(phenotype-annotations-mimic)与本数据集构成方法学两极:表型标注以人工判读为锚(标注指南+一致性统计——标签贵但语义直白);本数据集以规则间接监督为锚(判据公开+零人工——标签廉价但语义是"规则判定结果")。对照研究的价值:同一上游上两种标签哲学的性能-成本曲线(可用表型标注做弱标签的验证集)——这是弱监督文献里少有的"同一患者群、两种标签体系"的天然对照实验场。使用建议:把表型标注集当"外部验证锚点"评估 DOE 标签的 precision(重叠疾病的阳性一致率),能把"规则准不准"从自说自话变成有参照的测量。
§3.12 与 MIMIC-III Demo 的教学分工
同为教学友好资产,491 条目(MIMIC-III Demo,100 患者开放子集)与本数据集的分工:Demo 教"数据库长什么样"(关系表/SQL/去标识机制),本数据集教"标签怎么造、弱监督怎么跑"(判据/截断/采样/评估)——前者是数据库课的沙盒,后者是方法学课的沙盒。组合用法:先 Demo 摸熟上游结构,再进本数据集跑弱监督闭环;两者都免 GPU、轻量、合规路径单一(Demo 开放、本集受控)。课程设计的含义:弱监督专题可以把两者打包成"上游认知→标签工程→建模评估"三段式,一段一个数据资产。
§5 下游分析协议
§5.1 任务×资源速查表
| 你要做的 | 直接用 | 说明 |
|---|---|---|
| 文本时序模型研究 | chronologies+官方划分 | 对标 Table 2 四基线 |
| 弱监督方法学实验 | 全套标签 CSV+论文方法节 | 负例策略消融 |
| 提前量-精度曲线 | labels+截断协议 | Δ 分层报告 |
| 模态对比(文本 vs 结构) | +上游 MIMIC-III | 同队列双模态自建基线 |
| 标签扩展到新疾病 | §4.3/§4.4 复现协议 | 种子 CUI+正则+标准三件套 |
| 教学/课程设计 | 三 CSV+工具链 | 弱监督范式最小教学样本 |
§5.2 官方基准复现协议
- 环境:TF 1.x(≥1.14)docker 固定,或迁移至现代框架(迁移后先跑通 LR 基线对齐)。
- 参数:论文/仓库口径——
--delta_enc sinusoid --delta_combine add --dropout 0.3 --observational_dropout 0.3 --correct_imbalance weighted --num_epochs 10 --min_pred_window 24 --max_pred_window 96。 - 对账目标:Table 2 数值(HAA AUC 74.61% 等)——允许小偏差(TF 版本/随机种子),偏差方向与幅度要报告;四个模型(LR/SVM/biLSTM/CANTRIP)×三疾病全矩阵跑完。
- 指标:Accuracy/AUC/Sensitivity/Specificity/Precision/F1/MCC 七指标+校准误差(ECE)——只报 AUC 是不合格的复现。
- 阈值声明:官方 50% 阈值;补充 33%-50% 区间的阈值扫描(论文 Figure 5 口径)。
§5.3 新模型评估协议
- 划分不可动摇:官方 8:1:1——自建划分即放弃与 Table 2 的可比性;如确需患者级切分(防泄漏自查),在官方划分基础上报告泄漏审计结果(同一 subject 跨 split 的比例——8:1:1 随机切分下非零,论文口径如此,须声明而非隐瞒)。
- 指标集:七指标+ECE 全套;类不平衡(HAPI 11.1%)下 MCC 与 PR 曲线优先于 Accuracy。
- 阈值协议:主表 50%;附阈值扫描(ROC/PR 曲线+操作点标注)。
- 显著性:多随机种子(≥5)报告均值±标准差;与 Table 2 对比给差值区间而非单点。
- 消融矩阵(推荐三行):δ 编码开/关(时序感知的贡献)、负例采样策略(Gamma vs 随机 vs 全体负例)、NLP 过滤层逐层开启(②③层的贡献)。
§5.4 提前量-精度权衡协议
提前量是本数据集独有的性能轴:①把预测窗按 Δ 分桶(24-48h/48-72h/72-96h)分层评估——预期精度随提前量增大而衰减,衰减曲线就是"临床可用窗口"的量化;②报告每个提前量档位的 Precision@固定 Recall(临床部署关心的是"报警后可确化的精度");③与"诊断确认时刻"(DOE)对比模型最早报警时刻的中位数分布——"实际提前了多少"比"设计提前多少"更接近部署语义。该协议把 Table 2 的单点指标升级为临床决策曲线——患者安全预警系统论文的标配图。
§5.5 方法学段落骨架(直接套用)
本研究使用 Nosocomial Risk Datasets from MIMIC-III v1.0(DOI 10.13026/pm60-0g49;Goodwin & Demner-Fushman, JAMIA 2020),经 PhysioNet 受控协议获取。任务定义遵循官方口径:预测入院 ≥48h 后经 chart/实验室/笔记证实的医院获得性疾病,预测窗 24-96 小时。特征为 chronology 快照序列(MetaMap Lite 抽取的 UMLS CUI,经肯定性/章节/语义类型/停用词四层过滤);标签采用官方间接监督协议(DOE 三判据判定、时间窗截断、按人口学与 OASIS 分桶的 Gamma 先验负例采样)。队列:HAAKI 34,878 / HAPI 35,218 / HAA 38,385 住院,官方 8:1:1 划分。评估:50% 决策阈值下 Accuracy/AUC/Sensitivity/Specificity/Precision/F1/MCC 与 ECE,5 种子均值±标准差;与官方 CANTRIP 及三基线(LR/SVM/biLSTM)对齐比较。合规声明:数据于本地环境使用,未传输至第三方在线服务;派生模型不用于临床决策。
§5.6 扩展标签到新疾病的完整配方
以"医院获得性谵妄"为例走通全流程(示例性说明,非官方队列):①选种子 CUI——UMLS 检索 Delirium(C0011206),确认后代概念覆盖(急性意识模糊/ICU 谵妄亚型);②写词汇正则——delirium/confusion/encephalopathy 变体族+阴性模板(“no delirium”/“denies confusion”);③接结构化标准——CAM-ICU 评分记录或 ICD 触发后回溯(注意住院获得 ≥48h 约束);④跑四层过滤管线——章节过滤对谵妄特别关键(既往痴呆史章节必须剔除);⑤分桶+Gamma 采样——桶键沿用八变量;⑥人工抽检——按判据来源分层抽 50 例核对 DOE(规则标签的最低限度的face validity 检查)。预期工作量 2-4 周——远低于人工标注队列,且产出物是可公开的方法学资产(Ext 规范下)。
§5.7 与疾病专用模型的文献对齐协议
论文声称"与疾病专用模型文献相当"——引用与复检该声明的方法:①收集目标疾病(如 AKI)的 MIMIC 文献性能区间(注意各家队列定义差异);②把比较限制在"同上游+同结局语义"的文献(KDIGO 结构化预测);③声明本数据集的差异项(文本模态/队列构造/48h 定义)——任何"超过文献"的声明必须附队列不可比性的说明。审稿人视角:这类比较的诚实写法是"文献对齐(literature alignment)“而非"性能比较”——论文用词严谨(similar performance),复现者更容易在这里过度声称。
§5.8 模型选择决策树
目标是什么?
|- 复现官方基准 -> CANTRIP(TF 1.x docker);对账 Table 2
|- 发方法论文(新时序架构)-> PyTorch 迁移+LR 对齐验收;主表对官方划分
|- 发 NLP 论文(预训练/LLM)-> 上游 NOTEEVENTS+本地部署合规栈;CUI 视图做对照
|- 做预警原型 -> 先 HAPI(价值最清晰);提前量分层评估(§7.12)为主图
|- 教学课程 -> 三 CSV+LR 基线一周闭环;消融选负例策略(最易讲清)
|- 标签扩展研究 -> §5.6 配方;产出 Ext 规范新队列
§5.9 单疾病深挖 vs 三疾病横评的选择
研究策略的分叉点:单疾病深挖(选一个疾病做透——方法学论文常见,队列表述简单、消融集中、审稿聚焦)vs 三疾病横评(通用性论证——"模型跨疾病泛化"的声明必须三疾病全表支持)。决策依据:贡献主张落在哪——主张"新架构更强"至少两疾病+全指标;主张"标签协议可扩展"可以单疾病+扩展实验;主张"患者安全系统"则按临床价值选 HAPI 深挖(§5.8)。反模式:三疾病各跑一个单点指标就下通用性结论——Table 2 的七指标×三疾病矩阵是通用性声明的最低证据标准。
§6 实证结果与方法学分析
§6.1 规模实证:三队列的构成与患病率语义
三疾病队列的规模与患病率(论文正文口径,排除住院记录 <2 天后):
| 疾病 | 住院数 | 队列内 prevalence | 任务难度语义 |
|---|---|---|---|
| HAAKI | 34,878 | 34.2% | 类平衡较好;KDIGO 结构化判据灵敏 |
| HAPI | 35,218 | 11.1% | 类不平衡最重;Precision 提升空间最大 |
| HAA | 38,385 | 39.8% | 正例最多;医源性机制明确(采血驱动) |
三个数字的解读纪律:①prevalence 是构造队列内正例占比——负例由分桶采样构造,比例是设计出来的而非观察出来的;②三队列彼此独立(非同批住院的三个标签),跨疾病比较性能时构成差异必须在场;③HAA 的 39.8% 远超任何全院流行率直觉——这正是"队列构造 ≠ 流行病学调查"的活教材。另一个结构性事实:三队列都源于同一上游(MIMIC-III 46,520 患者),所以患者级重叠必然存在——三疾病联合建模(多任务)时切分必须患者级对齐,否则三任务间的泄漏隐蔽而致命。
§6.2 基准实证:Table 2 全景与四基线格局
官方基准矩阵(50% 阈值,JAMIA 2020 Table 2):
| 疾病 | 系统 | Accuracy | AUC | Sensitivity | Specificity | Precision | F1 | MCC |
|---|---|---|---|---|---|---|---|---|
| HAA | LR | 64.58% | 65.55% | 47.55% | 74.51% | 52.09% | 49.72% | 0.2252 |
| HAA | SVM | 57.03% | 55.23% | 37.46% | 69.21% | 43.09% | 40.08% | 0.0687 |
| HAA | biLSTM | 62.78% | 70.01% | 72.03% | 57.34% | 49.85% | 58.92% | 0.2844 |
| HAA | CANTRIP | 69.64% | 74.61% | 57.56% | 76.75% | 59.30% | 58.42% | 0.3453 |
| HAPI | LR | 76.87% | 74.34% | 57.91% | 79.64% | 29.37% | 38.98% | 0.2887 |
| HAPI | SVM | 78.32% | 62.78% | 24.05% | 86.26% | 20.38% | 22.06% | 0.0961 |
| HAPI | biLSTM | 78.77% | 80.84% | 70.57% | 79.99% | 34.41% | 46.27% | 0.3844 |
| HAPI | CANTRIP | 83.61% | 87.05% | 71.83% | 85.36% | 42.19% | 53.16% | 0.4632 |
| HAAKI | LR | 64.84% | 64.49% | 44.99% | 77.20% | 55.12% | 49.55% | 0.2327 |
| HAAKI | SVM | 57.07% | 55.24% | 37.69% | 69.13% | 43.18% | 40.25% | 0.0703 |
| HAAKI | biLSTM | 67.50% | 74.04% | 71.97% | 64.69% | 56.16% | 63.09% | 0.3569 |
| HAAKI | CANTRIP | 73.68% | 79.10% | 61.72% | 81.20% | 67.35% | 64.40% | 0.4370 |
格局解读三句话:①浅层基线(LR/SVM)全面落后——SVM 在三疾病上 AUC 均 ~55%,几乎退化到随机线附近,说明 CUI 快照的线性可分性有限;②biLSTM 高灵敏低精确——biLSTM 在 Sensitivity 上常压 CANTRIP(HAA 72.03% vs 57.56%),代价是 Specificity/Precision 崩落——"什么都报警"的模型在预警场景无部署价值;③CANTRIP 的优势是均衡——七指标全面领先或并列,MCC(不平衡敏感的综合指标)三疾病最高(0.3453/0.4632/0.4370)。摘要的浓缩口径:纯文本 AUC 74%-87%、Specificity 77%-85%。
§6.3 校准实证:ECE 的临床含义
Table 2 之外的隐性亮点是校准:Estimated Calibration Error——HAA 2.69%、HAPI 1.66%、HAAKI 2.36%(均为低个位数)。风险预测的临床可用性有一半在校准——"风险 70%"必须真的对应七成发生率,阈值化的报警策略才有统计学基础。CANTRIP 的低 ECE 使其输出概率可直接喂给决策阈值分析(论文 Figure 5 的 33%-50% 最优阈值区间即建立在校准之上)。对比阅读:许多高 AUC 的深度模型在 ECE 上惨不忍睹(过自信),引用本基准时"低 ECE"是 CANTRIP 相对新模型最难被击败的属性之一——复现新模型时把 ECE 列为必报指标,经常是翻车点。
§6.4 判据贡献与 ICD-only 排除的实证语义
论文 Figure 1 的队列选择图披露了两个关键结构性事实:①各判据的命中比例逐疾病给出——正例住院中满足 note 本体/词汇/结构化标准的不同组合比例被显式统计(图内标注),这是标签系统透明度的罕见范例;②仅满足出院 ICD-9(HCUP CCS)编码者被排除——因为 ICD 编码是结算产物,无法定位 DOE(事件日期),排除是"保标签质量"的主动选择而非数据缺陷。这两点的合并启示:本数据集的"医院获得"口径比 ICD 挖掘类研究窄而准——宁缺毋滥。复现者注意:任何"把 ICD-only 案例加回队列"的扩展都会污染 DOE 语义,属结构性改造而非增量扩充,必须重新声明任务定义。
§6.5 八个真实坑点
- 坑点 1 prevalence 当流行率:把 39.8%(HAA 队列内正例占比)写成"MIMIC-III 近四成患者住院贫血"——队列构造产物与流行病学事实是两回事。
- 坑点 2 三队列当同一批患者:对 34,878/35,218/38,385 做跨疾病配对比较——三者独立构造、患者级重叠但住院集不同,任何"逐患者跨疾病"分析须先反查上游确认重叠结构。
- 坑点 3 快照当小时级:把快照 timestamp 当小时级观测做"每小时风险曲线"——快照是日粒度合并,小时级语义只存在于截断点的选择。
- 坑点 4 时间窗口径混用:方法节写 24-96h、实验却按 48-96h 复现(或反之)——两口径并存(存照 A),引用训练配置以 --min_pred_window 24 --max_pred_window 96 为准。
- 坑点 5 负例当真实无病:把 Gamma 采样 DOE’ 当真实事件日做流行病学计算——负例标签是分布假设的产物,只能用于训练监督,不能当结局数据。
- 坑点 6 官方划分再随机化:丢弃 8:1:1 划分自己随机切然后与 Table 2 比较——划分不同则不可比(且随机切分下 subject 跨 split 泄漏官方划分本身就存在,须声明处理方式)。
- 坑点 7 CUI 序列当自由文本:把 chronology 的 CUI 串直接喂给语言模型当"文本"——它是词表受限的语义 ID 序列,预训练语言模型的价值要从上游 NOTEEVENTS(独立授权)取原文实现。
- 坑点 8 TF 1.x 时代穿越:在新 TensorFlow 上直接跑 run_experiment.py——仓库冻结于 2019(TF ≥1.14 API),报错不是数据问题;要么 docker 固定旧环境,要么迁移并先对齐 LR 基线。
§6.6 审稿人自查清单
- [ ] 数据集版本(v1.0)与 DOI(10.13026/pm60-0g49)写明;上游 MIMIC-III v1.4 引用同步给出
- [ ] 疾病队列口径写明(HAAKI/HAPI/HAA 各自住院数+队列内 prevalence,声明非流行率)
- [ ] 时间窗口径写明(24-96h 训练参数;与 Usage Notes 48-96h 表述的差异已声明)
- [ ] 使用官方 8:1:1 划分;若重切分,声明理由与不可比性
- [ ] subject 级泄漏审计(跨 split 患者重叠的处理策略)
- [ ] 七指标+ECE 全套报告;阈值(50%)与阈值扫描曲线在场
- [ ] 与 Table 2 四基线的对齐比较(差值区间而非单点)
- [ ] 负例采样假设的敏感性分析(或声明沿用官方负例)
- [ ] 多随机种子(≥5)均值±标准差
- [ ] 合规声明:受控数据本地使用、未传第三方在线服务、派生品不构成临床建议
- [ ] 局限性段:单中心、标签系统性噪声(NLP 误差传递)、Gamma 负例分布假设三必选
§6.7 与 MIMIC 家族的分工治理
本数据集在 MIMIC 生态中的位置很特殊:它不是"原始数据家族"成员,而是**“加工品支系"的代表**。家族分工:MIMIC-III(490 条)是上游原材料(结构化+文本全量);MIMIC-III Demo(491 条)是教学沙盒;MIMIC-IV(492 条)是现任主库;本条目(493)与 494(phenotype-annotations)同属**“标签增强层”**——在原材料上注入任务语义(DOE 标签/表型标注),把"通用数据库"变成"任务基准”。治理特征:①标识符沿用上游(subject_id/hadm_id 直通);②授权叠加(本项目协议+上游 MIMIC-III 各自签署);③冻结语义(v1.0 永不更新,上游 MIMIC-III v1.4 同样冻结——双重冻结保证了基准的长期稳定性,这是活数据库 MIMIC-IV 上不可能有的属性)。这个"加工品支系"的存在本身就说明:公开数据生态的成熟标志不是只有原料,而是原料→半成品→基准的分层完备。
§6.8 许可与派生语义
访问沿 PhysioNet 受控体系(CITI+DUA;上游 MIMIC-III 衍生物同治理)。三个工程后果:①不可再分发——CSV 包不能放入自家数据平台或论文附件;②派生品合规——基于本数据集训练的模型权重、扩展标签集属衍生品,按 PhysioNet 2024-04 指南应同协议分享并按 Ext 规范命名;③在线服务禁令(2025-09 LLM 条款)与 DSP 地域限制(2025-07 全面执法)叠加——跨境团队与云端 LLM 路线都要先过合规审查。NIH IRB 批准与 NLM 政府雇员作品的背景让"研究使用"的伦理框架清晰,但不改变受控访问的技术约束——许可的宽松(论文 public domain)与数据的受控(DUA)并行不悖,是 NIH 数据治理的典型组合。
§6.9 口径存照
- 存照 A:时间窗双表述并存——摘要/方法节"24-96 小时提前量"与 Usage Notes"48-96 hours in advance";训练参数 --min_pred_window 24/–max_pred_window 96 为技术口径。
- 存照 B:正/负例绝对数未在论文正文公开(指向 Supplementary Appendix B)——本文全部规模数字以正文队列总住院数+prevalence 为准。
- 存照 C:队列内 prevalence(34.2%/11.1%/39.8%)为构造统计,官方未给对应全院流行率——两者不可互换。
- 存照 D:访问级别徽标(Credentialed/Open)未在本文核查快照的页面转写中出现——按 MIMIC-III 衍生物治理惯例与官方伦理声明(de-identified MIMIC-3+NIH IRB)记为受控访问;以 PhysioNet 条目页实时标注为准。
- 存照 E:分桶 Gamma 参数(k/θ)与桶大小下限未公开——负例精确逐例复现不可行,分布级协议可复现。
- 存照 F:CSV 压缩包体量官方页面未标精确值——"GB 级以内"为据数据形态(CUI 序列)的推断。
§6.10 快照与序列长度的实证形态
官方 CSV 的结构性形态(据上游 MIMIC-III 住院时长分布推演):①住院时长长尾(Sci Data 2016:住院时长均值 ~4.5 天 SD 6.6 量级)→快照序列长度同样长尾——中位数个位数、右尾数十+;②短住院大量被 <2 天排除规则截去——存活的 chronology 已经过"最小长度"隐式筛选;③间隔 δ 的分布双峰(密集期 <24h 与记录空窗 >48h)——正弦编码在双峰输入下的表现是 δ 编码消融的看点。使用纪律:序列长度长尾决定 padding/截断策略(尾部截断会系统性丢长住院——分层采样评估);任何"平均序列长度"的引用要写分布而非单点。
§6.11 与文献数字冲突的诊断树
数字对不上?
1) 版本一致吗?(v1.0 冻结——不一致概率低但上游 MIMIC-III v1.4 口径要查)
2) 口径一致吗?
|- prevalence(队列内)vs 流行率(全院)——最大混淆源
|- 预测窗(24-96 vs 48-96)——双表述并存
`- 阈值(50% 固定 vs 扫描)——指标带阈值语义
3) 队列一致吗?(三疾病独立构造——跨疾病数字不可互推)
4) 实现一致吗?(截断边界/负例种子/类不平衡处理)
5) 划分一致吗?(官方 8:1:1 vs 自切)
`- 全一致仍不符 -> 记录并联系作者(GitHub issue);差异写进自己论文的复现节
§6.12 冻结生态的价值
MIMIC-III(2016 冻结)+v1.0(2022 冻结)+工具链(2019 冻结)构成罕见的三重冻结生态。冻结的代价(数据止于 2012、TF 1.x 老化)换来的红利是基准的考古学稳定性:2019 年跑的 Table 2 与 2026 年的复现指向同一组数字——跨年文献对比无需版本对账,这正是 MIMIC-IV 这类活数据库做不到的。战略结论:方法学研究(要稳定基准)选本数据集;临床时效研究(要当代惯例)选 MIMIC-IV——"冻结 vs 活跃"是任务性质决定的选择,不是数据集优劣的判断。
§6.13 CANTRIP 架构的方法学评述
CANTRIP 的设计哲学是把"时间感知"做进加性更新(additive update)而非标准 RNN 门控:快照嵌入按 δ 的正弦编码调节更新幅度——记录空窗(大 δ)自动提高后续更新的"信息增益权重"。以 2026 年视角评述:架构本身已被 Transformer 时代超越,但它留下的三个设计决策仍然有效——①间隔显式编码(等价于今天时序 Transformer 的时间偏置);②类不平衡用损失加权而非重采样(保持时间线完整性);③校准作为一等公民指标(ECE 进主表)。复现者把这三条当"可迁移的设计遗产",而非把整个架构当文物——新架构+旧设计原则的组合是性价比最高的研究路线。
§7 AI 就绪指南与应用场景
§7.1 四种喂法
| 喂法 | 形态 | 适用 | 关键工程 |
|---|---|---|---|
| CUI 序列直喂 | 快照 ID 序列(CUI=token) | 官方基准复现、新时序模型 | δ 编码(正弦/查表)+截断协议 |
| 解码重建 | CUI→概念名→嵌入 | 可解释特征、知识注入 | UMLS Metathesaurus 映射 |
| 原文回填 | 上游 NOTEEVENTS 文本 | 预训练语言模型/LLM | 需 MIMIC-III 独立授权+本地 LLM 合规 |
| 结构化对照 | 上游 LABEVENTS 等 | 模态对比/融合 | 同队列结构化基线自建 |
四种喂法共享官方划分与标签——模态对比实验的公平性由此保证。
§7.2 CANTRIP 官方复现配方(命令级)
git clone https://github.com/h4ste/cantrip && cd cantrip
# 环境:python>=3.6, tensorflow>=1.14(建议 docker 固定 TF 1.x)
export DATA_DIR=/path/to/data # 含 <split>.chronologies/admittimes/labels.csv
export OUTPUT_DIR=/path/to/out
python run_experiment.py \
--data_dir=$DATA_DIR --output_dir=$OUTPUT_DIR \
--do_train --do_test --do_predict --print_performance \
--time_repr both --delta_enc sinusoid --delta_combine add \
--augment_negatives=0 --dropout 0.3 --observational_dropout 0.3 \
--correct_imbalance weighted --num_epochs 10 \
--min_pred_window 24 --max_pred_window 96 \
--save_tabbed_results
# 工具链自动完成:chronology 截断 + present-on-admission 剔除 + 七指标输出
对账清单:①三疾病各跑一遍(DATA_DIR 换目录);②输出与 Table 2 逐格比对(允许种子/TF 版本小偏差,报告差值);③ECE 也在对账范围(2.69%/1.66%/2.36%)。
§7.3 现代框架迁移配方(PyTorch)
迁移路线四步:①数据层——CSV 解析为 (patient, hadm)→快照 CUI 列表+间隔 δ 序列+截断后标签(截断逻辑照抄 run_experiment.py,勿自造);②嵌入层——CUI→可训练嵌入(vocab=UMLS 概念子集)或用 UMLS 语义类型+SGNS 预训练嵌入初始化;③模型层——GRU/LSTM/Transformer 均可,δ 注入建议先复刻正弦编码(对齐官方)再做注意力化改进;④评估层——七指标+ECE+50% 阈值照抄,随机种子 5 个。迁移的验收标准不是"跑通"而是"LR 基线对齐":先用自家管线复现 LR 的 AUC(±1% 内),再上深度模型——否则管线 bug 会伪装成"新 SOTA"。
§7.4 预训练语言模型/LLM 配方(合规版)
CUI 快照喂不饱现代语言模型——要释放上游文本需三步:①授权:另签 MIMIC-III DUA,取 NOTEEVENTS 原文;②对齐:按 (subject_id, hadm_id, charttime 日) 把原文组织成与官方快照同构的"日粒度文档";标签仍用官方 labels CSV(保持基准可比);③合规栈:本地部署 LLM(8B-30B 起步;离线推理+零保留验证+审计日志,§8)——2025-09 条款下云端 API 路线对 MIMIC 系数据是违规项。任务形态建议:快照级风险打分(结构化 prompt→概率输出,注意温度=0 与校准重估)、原文+官方 CUI 的双视图对比(量化 NLP 管线的信息损失)。评价时把 LLM 输出概率过一遍 ECE——大模型的概率校准在本任务上通常是主要短板。
§7.5 成本与排期模板
| 阶段 | 事项 | 耗时 | 硬件 |
|---|---|---|---|
| 合规 | CITI+DUA+项目协议 | 约 1-2 周 | — |
| 获取 | CSV 下载+UMLS 账号 | 数小时 | 磁盘 <10 GB |
| 复现 | TF 1.x 环境+官方基准对账 | 1-2 周(环境折腾为主) | CPU 即可/单卡 |
| 建模 | 新模型+消融矩阵 | 数周 | 单卡(现代 GPU 远超需求) |
| 扩展 | 上游联用/新疾病标签 | 数周-数月 | +MIMIC-III 本体 47 GB |
本数据集是 MIMIC 生态里算力门槛最低的基准——轻量到可以进研究生课程作业;工程成本的大头在"旧环境复现"与"合规流程"而非计算。
§7.6 泄漏防控专项
- subject 跨 split:官方 8:1:1 是住院级随机切分——同一患者的多次住院可跨 train/test(MIMIC-III 人均 1.6 住院)。这不是数据集的 bug 而是官方口径,但研究者必须:①声明该口径;②补充患者级分组重切分的敏感性结果(预期 AUC 略降——降幅本身就是贡献)。
- DOE 信息泄漏:labels CSV 的 label=1 行只该用于截断与监督——把 DOE 距离(Δ)当特征喂模型是泄漏(预测"还有多久发病"≠“是否将发病”);特征窗止于截断点。
- 负例采样泄漏:负例 DOE’ 的采样用了桶统计(来自正例)——跨 train/test 的桶参数拟合要只用 train 正例(官方工具链已处理;自实现时易错)。
- 三疾病交叉:多任务学习时三队列合并,同一患者跨任务的标签对齐须患者级切分。
- 上游回填的时序:从 NOTEEVENTS 回填原文时,只能取截断点之前的笔记——DOE 日的"确诊性文本"是最毒的泄漏源。
§7.7 公平性声明
本数据集与公平性有双重关系:工具面——分桶变量(年龄/性别/种族/保险/OASIS/ICU/入院来源/类型)天然构成公平性审计的分层框架——按桶报告模型性能差异是零成本的对齐动作(Gamma 采样本身已按桶匹配分布,训练层面的群体均衡被制度化);风险面——分桶采样把历史诊疗模式固化进负例结构(某群体获得性事件"应该"更早/更晚的先验),模型可能习得" demographic → 时序风险"的伪相关。审计建议:①逐桶 AUC/校准表;②移除敏感桶键(种族/保险)的采样敏感性实验;③上游 MIMIC-III 已知的护理差异文献对照。结论措辞:本数据集的标签协议提高了群体均衡的可控性,但没有免除使用者的公平性审计责任。
§7.8 复现包模板
repo/
├── README.md # v1.0 + DOI 10.13026/pm60-0g49 + 上游 MIMIC-III v1.4 引用
├── env/ # TF 1.x docker(复现官方)或 PyTorch 锁定(迁移路线)
├── data_checks/
│ └── count_verify.py # 三疾病 hadm_id 计数 vs 34,878/35,218/38,385 对账
├── src/
│ ├── truncation.py # 截断协议(对照 run_experiment.py 逐行注释)
│ ├── negative_sampling.py # Gamma 分桶(train 正例拟合+种子固定)
│ └── model.py
├── eval/
│ ├── metrics.py # 七指标+ECE;50% 阈值+扫描
│ └── leadtime.py # Δ 分层(24-48/48-72/72-96h)
├── compliance/
│ ├── dua_ack.md # PhysioNet 受控协议+LLM 条款核查记录
│ └── local_only.md # 本地环境声明(无第三方传输)
└── outputs/ # 对 Table 2 的对账表 + 新结果(均值±std)
§7.9 消融案例:负例采样策略敏感性
研究问题:CANTRIP 的性能有多少来自 Gamma 分布匹配负例(相对朴素负例)?设计:①基线=官方负例(Gamma 分桶);②随机 DOE’(均匀采样 TTE);③出院前截断(负例用全时间线);④不用采样负例、只用正例+加权损失。三疾病×四策略全矩阵,观察 AUC/MCC/ECE 三轴。预期解读框架(设计层面):策略③④会引入"病得重的负例"偏差(负例时间线里其实藏着正例样式的晚期征兆),模型学习信号被稀释;策略②破坏时间分布匹配,Δ 分层评估的提前量精度失真。若实验发现各策略差异 <1%——那本身是重要负结果:说明任务信号强到对监督协议鲁棒,标签工程的边际价值要重新表述。
§7.10 消融案例:NLP 过滤层逐层贡献
研究问题:四层过滤(肯定性/章节/语义类型/停用词)各贡献多少?设计:从上游 NOTEEVENTS 重建 chronology(§4.3 协议),逐层开启(1→2→3→4 层累积),三疾病全跑,报告:①序列长度分布变化(每层剔除多少 CUI);②下游 AUC/MCC 变化;③DOE 判定一致率(与官方标签对比——过滤越弱,“历史章节提及"造成的假阳性 DOE 越多)。该消融的教学价值在于把"NLP 管线是黑盒"变成"每一层都是可测量的信息取舍”——预期最大跳变出现在第②层(否定/家族关联),因为那是"谁生病了"的语义边界;第④层(停用词)大概率接近零贡献——也是值得记录的负结果。扩展标签到新疾病(§4.4)前,这个消融是必做的管线体检。
§7.11 负结果记录协议
本数据集特别适合记录三类负结果:①标签协议鲁棒性(§7.9/§7.10 中差异不显著的情形——“协议不敏感"对后续使用者是重要情报);②模态增量(结构化特征叠加文本后 AUC 提升不足 1%——直接回答"还值不值得做文本抽取”);③迁移衰减(把三疾病模型按年份外推到 MIMIC-III 晚期数据/迁移到 MIMIC-IV 复刻队列的性能衰减曲线——单中心标签的可迁移性边界被定量刻画)。记录格式沿用家族规范:假设/配置哈希/种子/结果/一个解释。负结果页在这里的价值密度特别高——因为本数据集的方法学透明度允许负结果被精确归因(协议哪一环导致),这是黑盒标签数据集做不到的。
§7.12 提前量分层评估配方(Δ 分桶)
# 把测试集按 Δ(截断点到 DOE 的小时数)分三桶
buckets = [(24, 48), (48, 72), (72, 96)]
for lo, hi in buckets:
subset = test[(test.delta >= lo) & (test.delta < hi)]
report_metrics(subset) # AUC/Precision@Recall=0.6/ECE 逐桶
# 附加:模型最早报警时刻 vs DOE 的中位提前量分布(Kaplan-Meier 式曲线)
解读框架:①近窗(24-48h)精度预期最高——离事件越近征兆越显;②远窗衰减的斜率是"预警系统的战术价值半径"——斜率平缓的模型才能支撑 96h 级的资源配置决策;③若远窗精度反超近窗——先查泄漏(§7.6)再庆祝。该配方产出的曲线组与 Table 2 单点指标合成完整的评估叙事,是本数据集区别于静态基准的核心评估资产。
§7.13 特征工程配方(CUI 序列的统计侧写)
深度模型之外,统计特征仍是强基线:①快照级——CUI 计数/新增 CUI 数(语义新颖度)/重复 CUI 率(临床惯性);②住院级——观测总量/活跃天数占比/最大记录间隔(护理强度代理);③疾病感知——到种子 CUI 的 UMLS 图距离(语义接近度,KD 种子已给锚点);④时序感知——近窗(48h)特征占比加权。这些特征喂 LR/GBDT 的意义不止"便宜基线":它们与深度模型的误差结构不同(可解释、单调、对长尾稳健),融合后常在 HAPI 类不平衡场景补 Precision 短板。特征表+贡献度分析是复现包的加分项。
§7.14 校准专项配方
官方 ECE 已经很低(1.66-2.69%),但新模型(尤其深度/LLM 概率输出)需要主动校准:①数据划分——校准集独立于训练/测试(用 train 内部再切或用 devel);②方法选择——温度缩放(单参数,首选)/Platt/isotonic(数据充足时);③评估——ECE+可靠性图(10 桶)+按 Δ 分桶的校准漂移(提前量越远校准越难);④报告纪律——校准后的指标表单独列出(阈值决策用校准后概率)。校准与判别(AUC)的独立报告是本数据集论文的重要方法论遗产——Table 2 七指标+ECE 的呈现方式本身就值得方法学论文引用。
§7.15 多疾病联合建模配方
三疾病标签的联合利用有三条路线:①多任务头——共享编码器+三疾病分类头(队列合并须患者级切分;类不平衡逐头处理);②标签并集单任务——任一疾病 DOE 截断(任务语义变为"任一预警"——临床上像组合预警面板);③跨疾病迁移——HAA(最大队列)预训练→HAPI(最难)微调。设计要点:三疾病 prevalence 不同(39.8%/11.1%/34.2%),损失加权要逐头归一;评估保持"逐疾病 vs 官方单任务基线"的可比口径——多任务的增益若以牺牲单任务可比性为代价,论文叙事会失焦。
§7.16 四周弱监督工作坊(课程设计)
面向研究生的完整闭环设计:W1 数据与协议——CSV 解析/对账脚本/截断协议复刻(验收:LR 基线对齐 ±2%);W2 模型与编码——GRU+δ 正弦编码 vs 简单均值池化(验收:七指标完整报告);W3 消融与公平——负例策略三选一对比+分桶性能表(验收:一个可讲故事的发现);W4 扩展与合规——为自选疾病生成 50 例 DOE 抽检+合规声明撰写(验收:Ext 规范风格的方法学附录)。课程亮点:全程无需 GPU 集群与全量 MIMIC-III——弱监督全栈的最小平价教学路径;期末把最佳复现包整理成 GitHub 仓库(学生直接获得可展示工程资产)。
§7.17 从基准到床边:差距清单
本数据集的预警器与临床部署之间隔五道坎:①前瞻性——retrospective 标签+历史队列,无前验证证;②时延真实性——快照按天合并,部署系统的实时数据流(分钟级)更密也更噪;③NLP 管线可移植性——MetaMap 管线在本院文本上的抽取质量未知;④行动闭环——预警后谁响应、响应协议是什么,数据集不含任何工作流信息;⑤再验证义务——迁移到任何新机构都要重建 DOE 判定器的本地参数(§2.10)。诚实的定位:本数据集产出的模型是"研究原型"——它的价值在于把"文本能不能预警"回答到值得做前瞻研究的程度,而不是替代前瞻研究本身。
§8 伦理、许可与合规
- 许可体系:PhysioNet 受控访问(CITI 证书+受控 DUA+本项目协议);数据为 MIMIC-III 衍生,上游 Credentialed Health Data License 1.5.0 语义继承;禁止再分发、禁止重识别尝试。
- 伦理批准:项目依赖去标识 MIMIC-III 数据,经 NIH IRB 批准;生产于 NIH HPC Biowulf 集群;论文为美国政府雇员作品(美国境内 public domain)——论文开放与数据受控并行,引用时勿混淆。
- LLM 条款(2025-09-24):MIMIC 系衍生物同受约束——禁止经 API/在线平台向第三方传输数据;零数据保留、不训练、无人工审核;本地部署 LLM 是合规路径(§7.4)。
- DSP 地域限制(2025-07-08 全面执法):美国司法部 Data Security Program(EO 14117)对特定国家/地区 IP 或所属机构实施出口管制式访问限制——跨境团队访问受控数据前先核对最新政策与合规路径。
- 派生品义务(2024-04-24 指南):扩展标签集/模型权重/重建管线输出属衍生品——同协议分享+Ext 命名规范。
- 标签伦理的特别提醒:DOE 与负例 DOE’ 均为算法产物——任何下游系统把标签当"医学事实"对外解释(如"该患者 39.8% 概率贫血")都属误用;标签的正确语义是"按公开规则的判定结果"。
§9 常见问题(FAQ)
Q1 这个数据集免费吗?
数据免费但受控——CITI+DUA 后零费用;成本是合规流程约 1-2 周与本地化自律。
Q2 它到底是 MIMIC-III 还是 MIMIC-IV 的?
MIMIC-III——官方标题即 “Nosocomial Risk Datasets from MIMIC-III”;检索时别被"MIMIC-IV 院感"类文献带偏。
Q3 三个疾病是哪三个?
医院获得性急性肾损伤(HAAKI)、医院获得性压力性损伤(HAPI)、医院获得性贫血(HAA)——均为入院 ≥48h 后证实。
Q4 每个队列多大?
HAAKI 34,878 住院、HAPI 35,218、HAA 38,385(排除 <2 天住院后;8:1:1 划分)。
Q5 34.2%/11.1%/39.8% 是患病率吗?
是构造队列内正例占比——队列经负例采样构造,比例是设计产物;全院流行率请另查文献。
Q6 为什么 HAA 占比近四成?
队列构造使然(负例按分布匹配采样)+贫血在 ICU 高发(医源性采血驱动)双因素;不能据此推断"MIMIC-III 四成患者住院贫血"。
Q7 预测窗到底 24-96 还是 48-96 小时?
两种官方表述并存(摘要/方法 24-96h;Usage Notes 48-96h)——技术口径以训练参数 --min_pred_window 24 --max_pred_window 96 为准。
Q8 "医院获得"怎么定义?
入院 ≥48 小时后经 chart/实验室/临床笔记证实——不是出院 ICD 编码口径;仅 ICD 命中而无 DOE 依据者被排除。
Q9 标签是怎么来的?
间接监督:三判据(UMLS 种子概念/词汇正则/结构化标准 KDIGO-NPUAP-WHO)确定事件日期 DOE→正例截断至 DOE 前 24-96h→负例按分桶 Gamma 采样模拟 DOE’——全程无人工逐例标注。
Q10 DOE 是准确的诊断日期吗?
是"按公开规则的首次证据日"——受 NLP 抽取与规则边界影响;语义是"算法判定结果"而非金标准诊断。
Q11 负例的标签可信吗?
负例 DOE’ 是分布假设(Gamma 采样)的产物——负例只保证"截断点前未到事件",用于训练监督合法;把它当真实无病结局做流行病学计算是误用。
Q12 特征为什么是 CUI 而不是原文?
官方发布的是文本的结构化压缩(MetaMap Lite 抽取+四层过滤)——保留语义、控制体量、规避 PHI;要原文需回上游 NOTEEVENTS(另签 MIMIC-III DUA)。
Q13 UMLS CUI 怎么理解?
统一医学语言系统的概念唯一标识符——每个 CUI 对应一个标准化医学概念(如 C0022660=急性肾衰)。建模可当 token;解释需 UMLS 词典解码。
Q14 快照的粒度是什么?
日粒度——同一日历日全部笔记的观测合并为一个快照;快照间的间隔 δ(小时)单独编码。
Q15 为什么按天合并而不是按小时?
临床笔记的产出由流程驱动(首日密、周末疏)——按天合并是稳定性与信息量的折中;小时级语义只存在于截断点选择。
Q16 间隔信息 δ 重要吗?
重要——它是不规则时间结构的核心;CANTRIP 的正弦编码(–delta_enc sinusoid)直接消费它。消融 δ 编码是标准实验。
Q17 MetaMap Lite 是什么?
UMLS 驱动的轻量医学实体抽取工具——官方管线用它把笔记转成 CUI;复现管线需对齐版本与参数。
Q18 四层过滤分别是什么?
①否定/不确定/非患者关联剔除;②consults/家族史/既往史/社会史章节剔除;③UMLS 语义类型限问题/干预/药物/解剖;④InfoBot 停用词——它们编码了"什么算当前住院的现患证据"。
Q19 数据里有原始文本吗?
没有——只发 CUI 快照序列;原文在上游 MIMIC-III(NOTEEVENTS),双键关联。
Q20 数据量多大?
CSV 压缩包 GB 级以内(CUI 序列很轻)——笔记本可承载;无官方精确值。
Q21 需要装数据库吗?
不需要——纯 CSV 数据集;只有反查上游 MIMIC-III 结构化数据时才涉及数据库。
Q22 划分是官方定好的吗?
是——每疾病 train/devel/test = 8:1:1 分层随机;复现官方基准必须用官方划分。
Q23 同一患者会跨训练/测试集吗?
会——官方是住院级切分,多住院患者可跨集;这是官方口径,使用时须声明;患者级重切分可作为敏感性分析。
Q24 CANTRIP 是什么?
reCurrent Additive Network for Temporal RIsk Prediction——官方模型(TF 实现):文本快照序列+间隔编码的加性递归网络,JAMIA 2020。
Q25 官方基准多好?
50% 阈值下纯文本 AUC:HAA 74.61% / HAPI 87.05% / HAAKI 79.10%;Specificity 77-85%;ECE 1.66-2.69%。
Q26 基线有哪些?
LR、SVM、biLSTM 三个——CANTRIP 全面均衡领先;biLSTM 高灵敏低精确的教训值得细读 Table 2。
Q27 我能超过 CANTRIP 吗?
能,但对比要公平:官方划分+七指标+ECE+5 种子;现代模型(Transformer/预训练语言模型)有充分提升空间——尤其在 HAPI 的 Precision 上。
Q28 工具链还能直接跑吗?
TF 1.x 时代产物(2019 冻结)——现代环境直接跑会报错;docker 固定旧环境或迁移 PyTorch(先对齐 LR 基线验收管线)。
Q29 想用 Transformer/LLM 怎么做?
CUI 序列可直接 token 化进 Transformer;要用原文(预训练/LLM)必须回上游取 NOTEEVENTS 并走本地部署合规栈(§7.4)。
Q30 能把数据发给在线 LLM 分析吗?
不能——2025-09 条款禁止向第三方在线服务传输 MIMIC 系数据;本地部署是唯一合规路径。
Q31 和 MIMIC-III benchmark(490 条)什么关系?
互补:benchmark 是结构化四任务(死亡/LOS/表型/恶化),本数据集是文本三疾病弱监督任务——任务族、特征形态、标签方法都不同。
Q32 和 MIMIC-IV 的院感研究什么关系?
无直接数据关系(MIMIC-III 派生);方法学(DOE 判据/间接监督/负例采样)可整体平移到 MIMIC-IV 复刻——这是活跃的增量方向。
Q33 能扩展到其他疾病吗?
能且这正是数据集的设计意图——三判据+截断+Gamma 采样是通用协议;新疾病自选种子 CUI+正则+临床标准(§4.3/§4.4)。
Q34 扩展的标签算衍生品吗?
算——按 PhysioNet 2024-04 指南同协议分享+Ext 命名(MIMIC-III-Ext-…)。
Q35 DOE 判定的三个判据哪个最重要?
各疾病不同——论文 Figure 1 逐疾病给出命中比例;复现时按疾病对账,别假设统一权重。
Q36 “bed sore: none” 为什么不算阳性?
冒号后缀是结构化阴性模板——词汇判据显式排除该形态;自写正则时阴性模板处理是最常见翻车点。
Q37 KDIGO/NPUAP/WHO 在数据里怎么用?
作为结构化判据的标准源——labs/chart/vitals 满足标准即判定 DOE;具体实现细节在论文与补充材料。
Q38 排除 <2 天住院为什么?
住院过短无法形成有效快照窗(且 48h"医院获得"下限挤压预测空间)——队列构建的基本卫生条件。
Q39 正负例的确切数量在哪查?
论文正文只给队列总住院数+prevalence;正负例绝对数在补充材料(Supplementary B);自查以文件实际行数为准。
Q40 怎么验证我下载的数据完整?
对账脚本:各 chronologies 的唯一 hadm_id 计数、labels 的 DOE 行数、三 CSV 双键一致性;规模应与论文口径一致(先跑对账再开工)。
Q41 时间是真实时间吗?
上游 date shift 后的时间——绝对年份无意义;同一住院内相对间隔恒真(训练时序不受影响)。
Q42 阈值 50% 是怎么选的?
论文 Figure 5 的阈值扫描显示最优区间 33%-50%;实验取 50%——复现新模型建议附扫描曲线而非单点。
Q43 MCC 为什么重要?
三疾病尤其 HAPI(11.1% 正例)类不平衡显著——Accuracy 会骗人,MCC/F1/PR 曲线是诚实的指标;Table 2 的 MCC 全场最高正是 CANTRIP 均衡性的证据。
Q44 ECE 是什么?
期望校准误差——预测概率与实际频率的偏差;CANTRIP 的低 ECE(1.66-2.69%)让概率输出可直接做决策阈值分析;新模型常在此翻车。
Q45 提前量怎么评估?
Δ 分桶(24-48/48-72/72-96h)分层报告精度衰减曲线(§7.12)——比单点 AUC 更接近部署语义。
Q46 和真实的报警系统差距多大?
差距=前瞻性:单中心 retrospective 标签+分布假设负例+无部署时延模拟——本数据集是方法学基准,不是部署验收环境。
Q47 想做患者安全预警原型,从哪个疾病入手?
HAPI:不平衡最重、Precision 提升空间最大、干预手段明确(翻身/减压)——挑战与价值都最清晰;入门则 HAA 类平衡最友好。
Q48 能做多任务学习(三疾病一起)吗?
能——注意三队列患者级重叠,合并时切分必须患者级对齐(防跨任务泄漏);多任务与 DOEmulti-label 化是开放问题。
Q49 数据有更新计划吗?
v1.0(2022-09-15)至今无更新且上游 MIMIC-III 冻结——双冻结=基准长期稳定;别等新版本,直接用。
Q50 上游 MIMIC-III 的哪些表最常配合使用?
NOTEEVENTS(原文)、LABEVENTS/CHARTEVENTS(结构化对照)、ADMISSIONS(人口学/出入院)——双键 subject_id+hadm_id 直通。
Q51 能用本数据集的标签反哺 MIMIC-IV 研究吗?
标签不能跨库迁移(患者级无键接);能迁移的是标签协议(判据+截断+采样)——在 MIMIC-IV 上重跑协议生成 IV 版标签。
Q52 引用怎么写?
三件套:数据集(Goodwin 2022, PhysioNet, DOI 10.13026/pm60-0g49)+论文(JAMIA 2020, 10.1093/jamia/ocaa004)+PhysioNet 标准引用;上游 MIMIC-III 论文视使用同步引用。
Q53 RRID 是什么?
SCR_007345——科研资源标识符,用于论文方法节的资源引用规范化。
Q54 谁做的这个数据集?
Travis Goodwin 与 Dina Demner-Fushman(NIH NLM Lister Hill 中心);NIH 院内研究计划资助。
Q55 为什么是 NLM 来做院感预测?
NLM 的定位是医学信息学方法学引擎——用临床文本解决临床信息问题正是其使命;院感三疾病是"文本价值"的理想展示场。
Q56 数据的生产计算资源是什么?
NIH HPC Biowulf 集群——官方致谢明确;复现不需要同级算力(笔记本级即可)。
Q57 类不平衡怎么处理?
官方 CANTRIP 用 --correct_imbalance weighted(加权损失);自行实验可对比重采样/ focal loss——但注意与官方口径的可比性声明。
Q58 快照序列最长多长?
随住院时长分布(MIMIC-III 住院天数长尾)——超长序列的截断/采样策略是工程决策点,官方参数未特调此处。
Q59 CUI 嵌入怎么初始化?
可选:随机初始化(CANTRIP 口径)/UMLS 语义类型 one-hot 拼接/外部 SGNS 预训练嵌入——嵌入策略消融是有文献空间的增量。
Q60 能与波形库联用吗?
无患者级键接(波形 matched 子集挂 III 体系但独立偏移)——概念级对齐;文本+波形的多模态需经上游 MIMIC-III 中转。
Q61 教学场景怎么设计实验?
一周课:D1 数据解析+对账脚本;D2 截断协议复刻;D3 LR 基线对齐;D4 时序模型(GRU+δ 编码);D5 消融(负例策略或过滤层)——弱监督全链路的最小完整闭环。
Q62 常见的复现偏差来源?
TF 版本 API 差异、截断边界实现、负例种子、类不平衡处理细节——逐项写进复现包;先 LR 后深度是排错纪律。
Q63 与 sepsis 预测数据集什么关系?
任务互补:sepsis 数据集通常结构化+小时级+感染定义;本数据集文本+日级+非感染三疾病——"nosocomial"在这里指医院获得性疾病的广义。
Q64 为什么不叫 HAI(医院感染)数据集?
刻意避开:三疾病均非感染类(感染定义的监测标准争议大)——标题 nosocomial 取"医院获得"广义;与 CDC NHSN 的 HAI 监测是两个体系。
Q65 Magill 2014(NEJM)在论文里的角色?
HAI 负担的流行病学背景引用(多州点患病率调查)——提供"医院获得性疾病是重大负担"的证据基础,非数据来源。
Q66 数据里有人口学字段吗?
没有直接给——分桶变量(年龄/性别/种族/保险等)在上游 ADMISSIONS/patients;公平性审计需上游 join。
Q67 负例采样用了哪些协变量?
八个:年龄/性别/种族/收治 ICU/入院来源/入院类型/OASIS 评分/保险类型——OASIS(Johnson 2013)是疾病严重度的标准化分桶键。
Q68 OASIS 是什么?
Oxford Acute Severity of Illness Score——MIMIC-III 可计算的疾病严重度评分(Johnson et al. 2013);本数据集用它做分桶以匹配病情分布。
Q69 模型输出怎么临床解释?
输出=规则标签语义下的风险概率(校准良好)——“按官方 DOE 规则 48h 内将被证实的概率”;不是诊断、不是流行率、不是预后。
Q70 这个数据集最大的局限一句话?
标签的系统性噪声:NLP 抽取误差→DOE 判定→训练信号全链传递,且负例带分布假设——它是方法学透明的弱监督基准,不是金标准标注集。
Q71 快照序列怎么 padding?
按 batch 内最长截断或全局上限(如 64 快照)+尾部丢弃;长住院的系统性截断偏差要分层评估(§6.10)。
Q72 δ 编码有哪些选择?
官方正弦编码(对齐基准);替代方案:查表分桶/对数变换/注意力偏置——消融 δ 编码是标准实验点。
Q73 CUI 词表多大?
取官方 chronologies 的去重 CUI 集合(万级概念量级,UMLS 子集)——以实际文件统计为准;嵌入矩阵相应配置。
Q74 怎么处理未见 CUI?
UMLS 版本差/罕见概念导致 dev/test 出现 train 没有的 CUI——<unk> 兜底+OOV 率报告;语义类型回退(用 TUI 嵌入替代)是进阶方案。
Q75 能做半监督/自训练吗?
能且契合:上游未入队住院(被排除/负例)的快照可做无标签池;自训练要防确认偏差(伪标签阈值保守+迭代监控)。
Q76 主动学习怎么设计?
弱标签框架下的主动学习对象是"DOE 判定不确定"的住院(判据冲突/边界 48h)——人工复核预算花在刀刃上;与 494 的人工标注资源天然互补。
Q77 模型可解释性怎么做?
注意力/归因到 CUI 后经 UMLS 解码成概念名(§4.8);逐快照归因对齐时间轴讲"哪天的哪个概念触发预警"——临床可解释性的最小可行故事。
Q78 报警疲劳怎么量化?
固定 Sensitivity 下的报警频率(每住院报警次数)+Precision@Recall 曲线——biLSTM 的高灵敏低精确正是反例;临床部署的硬约束。
Q79 能预测"会发生哪一种并发症"吗?
三疾病并集建模(§7.15 路线②)给"任一预警";区分疾病需多任务头——本数据集标签支持,但队列构成差异要显式处理。
Q80 测试集可以重复看吗?
官方 devel 调参/test 报告一次的纪律同样适用;test 反复看+按结果调模型=变相训练(基准污染的老问题,holdout 精神同样适用)。
Q81 复现偏差多大算正常?
LR 基线 ±2% AUC 内;深度模型 ±3-5%(种子/框架敏感);超出先查截断实现与类不平衡处理,不是先怀疑论文。
Q82 为什么我的 LR 比 SVM 好很多?
正常——Table 2 里 SVM 在本任务表现异常弱(AUC ~55%);SVM 对稀疏高维 CUI 特征+类不平衡的组合敏感,复现对比以 LR 为锚。
Q83 能用 XGBoost 吗?
能——CUI 统计特征(§7.13)喂 GBDT 是被低估的强基线;与官方 LR 口径对齐后纳入对比表反而加分。
Q84 数据能进 Kaggle 式竞赛吗?
技术上可以(体量小),合规上不行——受控 DUA 禁止再分发,任何第三方平台托管即违规;校内课程竞赛以各自签署 DUA 为前提。
Q85 论文方法节怎么引用官方工具链?
引用仓库+commit hash+参数清单(§7.2 命令);截断逻辑声明"按 run_experiment.py 实现"——工具链版本是复现声明的一部分。
Q86 上游 NOTEEVENTS 的授权怎么走?
PhysioNet MIMIC-III 独立项目页 CITI+DUA——与本数据集项目协议分开签;拿到后按 (subject_id,hadm_id,日期) 与快照对齐。
Q87 想跳过 CITI 直接用数据行吗?
不行——受控访问是数据集的生命线;违规使用(含"朋友传我一份")破坏整个受控生态的信任基础。
Q88 数据用完能删别人的副本吗?
不能替别人删——但你有义务不复制、不转传;发现泄露渠道应向 PhysioNet 报告。
Q89 商业产品能用这个数据集训练吗?
受控 DUA 对使用目的有限制条款(研究用途为默认语义);商业落地前逐条核对 DUA 与 PhysioNet 政策,必要时联系许可方。
Q90 发论文时数据可用性声明怎么写?
“基于 PhysioNet Nosocomial Risk Datasets from MIMIC-III v1.0(DOI),经 CITI+DUA 获取;受 DUA 约束不可再分发;代码见 [repo](不含数据)。”
Q91 审稿人质疑"标签是机器生成的"怎么回应?
三段式:规则完全公开可审计(不是黑盒)→临床标准背书(KDIGO/NPUAP/WHO)→附录附人工抽检一致率(§5.6 第⑥步)。这个质疑是本数据集论文与生俱来的,标准答案早就写好了。
Q92 一句话总结这个数据集的方法论贡献?
“证明了用可公开审计的规则链(判据+截断+分布采样)可以替代昂贵的人工标注,在临床文本上训出接近疾病专用模型的预警器。”
Q93 数据里的时间是 2100-2200 年怎么办?
上游 date shift 的去标识时间——相对间隔恒真;绝对时间分析(季节/星期)不可做,与本系列 492 条目的 anchor 语义同源。
Q94 想对比文本和结构化模态,怎么开始?
从上游 MIMIC-III 拉同队列的 LABEVENTS/CHARTEVENTS,按同一截断协议造结构化版特征,跑同一套划分与指标——双模态同协议对比是干净的设计。
Q95 融合模型比单模态好多少才算"真提升"?
对齐官方划分+5 种子后,提升幅度超种子间标准差且逐疾病方向一致——单点 0.5% 的"提升"在本任务噪声水平内。
Q96 能把标签当 sql 标注教学生写病历 NER 吗?
不能直接用——标签是住院级 DOE 不是 token 级 NER 标注;NER 教学回上游 NOTEEVENTS 自标注。
Q97 快照里 CUI 排序有语义吗?
无官方语义(集合语义);建模前固定排序(字典序/首现序)即可,排序本身不携带信号。
Q98 想引用 Figure 1 的判据比例数字,去哪拿?
论文原文 Figure 1(图内标注)——PMC7075529 全文图;本条目未转录图内数字(存照纪律:不转手转载图内数值)。
Q99 数据集的"负例增强"参数(–augment_negatives)是什么?
官方工具链参数(默认 0=不增强)——负例不足时的再采样开关;复现官方基准保持默认,增强实验单独声明。
Q100 用这个数据集发第一篇论文,最稳的切口?
标签协议消融(§7.9/§7.10 任一)+提前量分层曲线(§7.12)——方法学透明度是本数据集的最大护城河,切口选在它的强项上。
Q101 三疾病能合并成一个"患者恶化"数据集用吗?
语义会漂移(“任一并发症”≠“恶化”)——建议保留疾病维度做多任务或并集面板(§7.15),不要重命名成新任务。
Q102 官方划分文件是单独发的还是隐含在 CSV 名里?
隐含在文件命名(train/devel/test 前缀)——拿到数据即拿到划分;无需自己再切。
Q103 Δ(预测窗)值存在数据里吗?
不在 CSV 里显式存——由 DOE 与截断点推算(工具链内部计算);做 Δ 分层评估(§7.12)时自行导出。
Q104 数据集有 DOI 版本页吗?
有——PhysioNet /content/nosocomialriskdata/1.0/ 页面挂 10.13026/pm60-0g49;引用永远带版本号 v1.0。
§10 附录
§10.1 口径存照
- 存照 A:预测时间窗官方双表述并存——摘要/方法节"24-96 小时"、Usage Notes"48-96 小时";技术口径以官方工具链参数(–min_pred_window 24 --max_pred_window 96)为准。
- 存照 B:正/负例绝对数未在论文正文公开(指向 Supplementary Appendix B)——本条目规模数字一律采用正文队列住院总数+prevalence 口径。
- 存照 C:prevalence(34.2%/11.1%/39.8%)为构造队列内统计;官方未发布对应全院流行率——两类数字不可互换。
- 存照 D:PhysioNet 条目页访问级别徽标未在本条目核查快照中转写;本条目按 MIMIC-III 衍生物治理惯例与官方伦理声明(de-identified MIMIC-3、NIH IRB)记为受控访问,实际以条目页实时标注为准。
- 存照 E:Gamma 分桶参数(k/θ)与桶大小未公开——负例的逐例精确复现不可行,分布级协议可复现;自实现时固定种子并报告桶分布。
- 存照 F:CSV 包体量无官方精确值——"GB 级以内"系据数据形态(CUI 序列)的推断。
- 存照 G:批次元数据(本系列生产档案)曾将该数据集记为"MIMIC-IV"系——官方标题与内容均为 MIMIC-III 派生,以官方为准。
- 存照 H:"纯文本性能与疾病专用模型相当"为论文作者的文献对齐式论证——非同队列头对头比较;严格的模态对比需自建结构化基线。
存照 I(三队列患者级重叠的开放性):三疾病队列均源于同一上游患者群,患者级重叠必然存在但官方未公布重叠统计——多疾病联合研究的切分设计以自查为准(§6.1)。
存照 J(快照/序列分布的推演属性):§6.10 的序列长度与间隔形态基于上游 MIMIC-III 已知统计的推演,非官方发布统计——引用时以自数据实测为准。
存照 K( 示例扩展疾病的教学属性):§5.6 以"医院获得性谵妄"为例演示扩展配方——该示例不代表官方存在对应队列,种子 CUI 与正则族仅为教学示意。
存照 L(示例参数的教学属性):§7.13 特征工程与 §7.15 联合建模配方为本条目设计的工程方案,非官方基准组成——复现官方数字以 §7.2 命令为准。
存照 M(架构评述的时代视角):§6.13 对 CANTRIP 的评述含本条目的 2026 年视角判断——官方论文不含该评价;架构优劣以复现实验为准。
存照 N(FAQ 增补的口径归属):Q93-Q104 为本条目编写的使用指南性问答(依官方文档与工具链行为归纳),官方 FAQ 不存在——与官方材料冲突时以官方为准。
§10.2 引文清单
- Goodwin T. Nosocomial Risk Datasets from MIMIC-III (version 1.0). PhysioNet (2022). DOI 10.13026/pm60-0g49. RRID SCR_007345.
- Goodwin TR, Demner-Fushman D. A customizable deep learning model for nosocomial risk prediction from critical care notes with indirect supervision. J Am Med Inform Assoc 27(4):567-576 (2020). DOI 10.1093/jamia/ocaa004. PMID 32065628.
- Goodwin, T. R. CANTRIP (Version 1.0). GitHub. https://github.com/h4ste/cantrip
- Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data 3:160035 (2016).(上游)
- Goldberger AL, et al. PhysioBank, PhysioToolkit, and PhysioNet. Circulation 101(23):e215-e220 (2000).
- Magill SS, Edwards JR, Bamberg W, et al. Multistate point-prevalence survey of health care–associated infections. N Engl J Med 370(13):1198-208 (2014).(HAI 负担背景)
- Henderson JM, Blackstone EH, Hixson ED, et al. Hospital-acquired anemia: prevalence, outcomes, and healthcare implications. J Hosp Med 8(9):506-12 (2013).(HAA 背景)
- Silver SA, Long J, Zheng Y, et al. Cost of acute kidney injury in hospitalized patients. J Hosp Med 12(2):70-6 (2017);Chertow GM, et al. J Am Soc Nephrol 16(11):3365-70 (2005).(AKI 背景)
- Johnson AEW, Kramer AA, Clifford GD. A new severity of illness scale using a subset of Acute Physiology and Chronic Health Evaluation data elements. Crit Care Med 41(7):1711-8 (2013).(OASIS)
- Pollard T, Moody BE, Lehman L, et al. PhysioNet as a global platform for biomedical research. Nature Health (2026). DOI 10.1038/s44360-026-00096-z.(平台引用)
§10.3 与本系列其他条目的关系
- 490(MIMIC-III)/491(III Demo):直接上游——NOTEEVENTS 与结构化表经四层管线变成本数据集的 chronology;双键 subject_id/hadm_id 直通。
- 492(MIMIC-IV):无数据键接的前任/现任主库关系;本条目的标签协议(判据+截断+采样)是向 IV 复刻院感基准的现成模板。
- 494(phenotype-annotations-mimic):同属"标签增强层"——表型标注(人工/结算衍生)与本条目的规则间接监督构成标签方法学的两极对照。
- 486-488(波形三库):无键接;"报警提前量"的任务哲学同源。
- 489(MIMICEL):无键接;但其流程挖掘叙事与本条目的"事件日期"语义共享"从记录推断事件"的方法论内核。
§10.4 变更日志
- 2026-09-20:初版(order 493)。双源核查完成(PhysioNet v1.0 条目页+JAMIA 2020 论文/PMC7075529),口径存照 A-H 落档;三队列规模、DOE 三判据、间接监督协议、Table 2 全景基准、DSP/LLM 合规环境纳入;名称勘误(MIMIC-III 非 MIMIC-IV)记入存照 G。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimiciii — 共享标签:医疗NLP / 电子健康记录
- phenotype-annotations-mimic — 共享标签:医疗NLP / 电子健康记录
- paediatric-intensive-care — 共享标签:医疗NLP / 电子健康记录
- stroke-scale-mimic-iii — 共享标签:医疗NLP / 电子健康记录
- synthetic-mimic-iii-health-gym — 共享标签:医疗NLP / 电子健康记录
- trec-pm — 共享标签:医疗NLP / 电子健康记录
- emrqa — 共享标签:医疗NLP / 电子健康记录
- aact — 共享标签:医疗NLP / 电子健康记录
- loinc — 共享标签:医疗NLP / 电子健康记录
- chinese-critical-care-database — 共享标签:医疗NLP / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

