MIMIC-III 表型标注集 — 出院小结表型标签 AI-Ready Wikipedia

Phenotype Annotations:2,102 篇临床笔记 × 13 高上下文表型 × 双人金标准标注——临床 NLP 表型识别的最小可信金标准

来源 https://physionet.org/content/phenotype-annotations-mimic/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 28
MIMIC-III 表型标注集 — 出院小结表型标签 AI-Ready Wikipedia

信息速览

数据集名称MIMIC-III 表型标注集 — 出院小结表型标签 AI-Ready Wikipedia
数据类型1,102 出院小结,1,000 护理进展记录,13 高上下文表型,双人 Cohen's Kappa,MIMIC-III NOTEEVENTS ROW_ID 锚定
规模1,102 出院小结 + 1,000 护理进展记录 = 2,102 篇标注笔记(患者总数官方未公布)
接入方式https://physionet.org/content/phenotype-annotations-mimic/
AI 就绪度

Phenotype Annotations for Patient Notes in the MIMIC-III Database — AI-Ready 数据集百科

一句话:这是 MIMIC-III 生态中唯一一份双人金标准表型标注语料——1,102 篇出院小结与 1,000 篇护理进展记录,来自单年入住 ICU 超过 3 次的频繁再入院患者,由两组"临床研究员 + 住院医师"配对独立标注 13 个高上下文表型(外加 None/Unsure 两枚元标签),Cohen’s Kappa 逐表型公开。它以 2,102 篇的"小"体量,定义了临床 NLP 表型识别任务的可信度下限。

INFOBOX

属性 值
官方名称 Phenotype Annotations for Patient Notes in the MIMIC-III Database
发布方 PhysioNet(MIT Laboratory for Computational Physiology 生态)
版本 v1.20.3(2020-03-05 发布)
DOI 10.13026/txmt-8m40
RRID SCR_007345
官方论文 Moseley et al., LREC 2020(ACL Anthology 2020.lrec-1.170, pp. 1362-1367)
前身研究 Gehrmann et al., PLoS ONE 13(2): e0192360 (2018)
语料规模 1,102 Discharge Summaries + 1,000 Nursing Progress Notes = 2,102 篇
队列 MIMIC-III 中单年入住 ICU >3 次的频繁再入院患者
标签体系 13 高上下文表型 + None + Unsure(15 列二元标签)
标注协议 4 操作员 2 组;每组 1 临床研究员 + 1 住院医;组内独立重复标注
标注周期 2015-08 至 2016-10(约 15 个月)
关联机制 SUBJECT_ID / HADM_ID / ROW_ID(MIMIC-III v1.4 NOTEEVENTS) / Operator
访问级别 受控访问(须满足 MIMIC-III 全部访问要求;页面元数据归类为 Database Open Access,见存照 D)
患者总数 官方未公布(存照 E)
上游数据源 MIMIC-III v1.4(NOTEEVENTS 表)
任务定位 患者表型识别(patient phenotyping):多标签文本分类
基线 BoW+Logistic Regression 与 CNN(F1 全表见 §6)
适合任务 表型识别、标注协议研究、LLM 临床文本评测集构建、弱监督验证

§0 速览与信任声明:为什么一份 2,102 篇的小语料能撑起一篇 AI-Ready 百科条目

在动辄数十万住院、上亿数据行的 MIMIC 宇宙里,这份语料小得像个异类:2,102 篇笔记、13 个表型、4 位标注员、15 个月工期。但它的稀缺性恰恰来自"小"——因为它是这条赛道上少有的每一枚标签都能追溯到"哪两个人、按什么定义、在什么协议下打上去"的金标准语料。

三条速览结论:

  1. 它是"高上下文表型"这个概念的教科书示范。晚期癌症、治疗不依从、慢性疼痛这类状态,在 ICD 编码、实验室检验、用药记录里系统性缺位或失真—— diabetic ketoacidosis(糖尿病酮症酸中毒)入院的患者,结构化数据只会告诉你他"DKA 入院",不会告诉你那次入院的真实起点是停用胰岛素三周。要识别这类状态,只能读文本;要评估"读文本的算法",只能先有人工金标准。
  2. 它是临床 NLP 少数公开标注者间一致性全表的语料。13 个表型 × 2 组标注对的 Cohen’s Kappa 全部写在论文 Table 4 里——从 Dementia 的 0.952 到组 2 的 Adv. Heart Disease 0.561,一致性的"好"与"坏"都摆在你面前。多数临床 NLP 数据集只公布聚合一致率,这份语料把不可靠之处也公开了,这正是它作为评测基准的价值。
  3. 它的标签不是笔记全文,而是可 join 的索引。每行记录 SUBJECT_ID / HADM_ID / ROW_ID / 15 列二元标签 / Operator,其中 ROW_ID 直接指向 MIMIC-III v1.4 的 NOTEEVENTS 表——文本本体留在 MIMIC-III 里,标注表像一块可插拔的"金标准印章"。官方明确说:多数场景下,这张表可以像 NOTEEVENTS 表一样与 MIMIC-III 其他表 join。

0.1 条目名勘误与命名史

本条目在生产排期表中的中文名被截断为"Phenotype Annotations for Patient",官方全称为 Phenotype Annotations for Patient Notes in the MIMIC-III Database,本条目一律以官方全称为准。命名史上有三个名字:

  • ACTdb / “Annotated Clinical Texts from MIMIC”:项目早期内部名,GitHub 仓库 EdwardMoseley/ACTdb 与 PhysioNet works 页面 “Annotated Clinical Texts (ACT) from MIMIC” 沿用此名——Gehrmann et al. 2018 论文的数据可用性声明指向的就是这个 works 页面;
  • Phenotype Annotations for Patient Notes in the MIMIC-III Database:2020-03-05 正式入驻 PhysioNet 主站的官方名;
  • LREC 2020 论文标题 “A Corpus for Detecting High-Context Medical Conditions in Intensive Care Patient Notes Focusing on Frequently Readmitted Patients”——注意论文标题与数据集官方名不一致,检索文献时两套名字都要查。

0.2 一分钟版本(给赶时间的管理者)

  • 这是什么:一份人工双人标注的临床文本表型语料,2,102 篇笔记 × 13 表型,锚定 MIMIC-III;
  • 谁做的:MIT Critical Data 社群,Edward T. Moseley 牵头,Leo Anthony Celi(MIMIC 系列创始人之一)与 Franck Dernoncourt(NLP 老兵)共同署名;
  • 花了多久:2015 年 8 月至 2016 年 10 月,约 15 个月;
  • 数据在哪:PhysioNet(DOI 10.13026/txmt-8m40),访问资格与 MIMIC-III 完全一致;
  • 与 MIMIC-III 什么关系:不是独立数据库,是 MIMIC-III NOTEEVENTS 的标注覆盖层;
  • 最大的坑:只有标注索引没有文本——你必须先拿到 MIMIC-III 资格才能用;
  • 最亮的点:Cohen’s Kappa 全表公开 + 标注协议(批次/双人/独立/Unsure 语义)完整发表。

0.3 十个数字记住它

# 数字 含义
1 2,102 标注笔记总数
2 1,102 出院小结(Discharge Summaries)
3 1,000 护理进展记录(Nursing Progress Notes)
4 13 真表型数量
5 15 标签列数(13 表型 + None + Unsure)
6 >3 次/年 队列入选门槛(单年 ICU 入住次数)
7 2 每篇笔记的独立标注人数
8 0.952 Kappa 峰值(Dementia,ETM & JTW 组)
9 0.561 Kappa 谷值(Adv. Heart Disease,JF & JW 组)
10 15 个月 标注工期(2015-08 ~ 2016-10)

0.4 与同门条目的关系图谱

本条目属于 MIMIC 宇宙的"文本标注"分支,与已上线条目的互链关系:

  • mimiciv(rid 592):MIMIC-III 的现代继任者。本语料锚定 MIMIC-III v1.4 的 NOTEEVENTS;MIMIC-IV 时代的对应物是 DISCHARGE 表(MIMIC-IV-Note 模块),但官方尚未发布针对 MIMIC-IV 的等效金标准表型标注——这既是迁移研究的空白,也是机会;
  • nosocomial-risk-mimic(rid 593):标签谱系的另一端。493 的标签由 NLP 管线(MetaMap Lite + UMLS 判据)自动生成(间接监督),本条目的标签由人类专家逐篇判定(直接监督金标准)。两份数据集合起来正好构成"自动标签工厂 ↔ 人工金标准"的完整光谱,适合做弱监督 vs 强监督的对照实验;
  • Gehrmann et al. 2018(PLoS ONE)是本语料的前身研究:用旧版 ACT 语料(1,610 篇出院小结、10 表型)证明了 CNN 优于概念抽取管线——本语料把语料扩到 2,102 篇并加入护理记录,是那次验证的"正式化续作"。

0.5 谁该用、谁不该用

该用:做表型识别模型的人(这是评测集);做标注工程的人(这是协议范本);做 LLM 临床推理评测的人(这是天然少样本评测集);做弱监督/远程监督研究的人(这是校准自动标签的金标准锚点)。

不该用:想直接下载文本跑模型的人(文本在 MIMIC-III 里,本数据集只有索引);想做大规模预训练的人(2,102 篇太小);想要 2020 年后数据的人(上游 MIMIC-III 止于 2012);不需要高上下文表型、只关心 ICD 编码能覆盖的疾病的人。

0.6 本条目的证据等级声明

本条目核心数字全部来自两处一手来源:PhysioNet 官方条目页(v1.20.3)与 Moseley et al. LREC 2020 论文(arXiv 2003.03044 与 ACL Anthology 版互核)。凡官方未公布的数字(患者总数、各表型阴性绝对数、训练/测试划分),本条目不做估算填补,一律标注"官方未公布"并写入文末存照。二手引用(如 JAMIA 2024 selective prediction 论文的再统计数字)单独标注来源等级,不与一手数字混排。

§1 背景与动机:高上下文表型为什么必须"读文本"

1.1 官方开场的那位 DKA 患者

官方 Background 用了一个精准的临床叙事:一位糖尿病患者自行停用胰岛素数周,以糖尿病酮症酸中毒(DKA)急诊入院。在结构化 EHR 里,这次入院被编码为"DKA"——诊断、检验(血糖、血气)、治疗(胰岛素滴注)一应俱全。但"入院的原因是不依从"这个信息,只存在于出院小结的叙述里。任何只基于结构化数据的回顾性研究,都会系统性地低估治疗不依从对再入院的贡献——不是轻微低估,而是结构性归零:这些事件在结构化字段里根本不存在。

这个例子定义了整份数据集的问题意识:EHR 的结构化层是为了计费与管理而生,不是为了临床叙事而生。计费字段覆盖"发生了什么",叙事文本才覆盖"为什么发生"。高上下文表型(high-context phenotypes)指的正是那批"为什么"层面的临床状态。

1.2 "高上下文"的准确定义

论文与 PhysioNet 页面反复使用 high-context 一词,其可操作定义有三层:

  1. 判定依赖叙述性证据:状态的存在与否需要从自由文本的措辞、时序、语境中推断,而非查一个编码;
  2. 无固定术语词典:论文明确"不设固定术语词典、不规定术语出现顺序"——同一状态可能有数十种表达方式,且不同作者风格迥异;
  3. 需要显式文本证据:标注规则要求表型存在必须有 explicit text,不允许标注员凭临床常识脑补——这是金标准语料与"印象打标"的分界线。

1.3 政策背景:再入院减免与 HRRP

官方 Background 提到"前述降低不必要再入院的倡议"(aforementioned policy initiatives),指的就是美国 2012 年 10 月启动的 Hospital Readmissions Reduction Program(HRRP)——Medicare 对再入院率超标医院实施罚款。这条政策在 2010 年代催生了整个"再入院预测"研究浪潮(官方参考文献第 3 条正是 Kansagara et al. 2011 的再入院预测系统综述)。选择"频繁再入院"人群作为标注对象,正是要把 NLP 研究对准政策最关心的患者群。

1.4 队列定义:单年 ICU 入住 >3 次

队列选择非常克制,只有一条判据:一年内入住 ICU 超过 3 次。这个定义的三重含义:

  • 信息密度高:反复入 ICU 的患者,笔记数量多、病情线索密集,单位标注工时的信息产出高;
  • 干预价值高:频繁再入院者正是 HRRP 政策下最需要识别干预的人群——官方原话是"以期产生可行动的情报"(actionable intelligence);
  • 表型谱富集:这类患者更可能携带晚期癌症、慢性疼痛、物质滥用等高上下文状态,标注表型的阳性率更高,小语料也能撑起足够的正例。

注意:患者总数官方未公布。2,102 篇笔记来自多少位频繁再入院患者,官方语料与论文均未给出,任何二手来源的数字都应视为估算(存照 E)。

1.5 两类文本:出院小结与护理进展记录

语料的两个文类有意形成对照:

维度 Discharge Summaries(1,102 篇) Nursing Progress Notes(1,000 篇)
中位字符数 10,156(IQR 7,443–13,831) 1,232(IQR 723–1,810)
中位 token 数 1,417.5(IQR 1,047–1,926) 208(IQR 120–312)
唯一 token 数(合计) 26,454 12,865
信息形态 一次性全景叙述(病史/病程/出院医嘱) 高频碎片化观察(班次级进展)
表型阳性率 系统性更高(如 Depression 24.23%) 系统性更低(如 Depression 5.40%)

这个对照本身就是一份天然的方法学测试床:同一个模型在长文档与短文档上的表现差、同一套特征在两类文本上的迁移差,都能用这份语料量化。论文 Table 2 显示出院小结的表型阳性率普遍是护理记录的 2-5 倍——因为出院小结是医生对整个住院的总结,而护理记录只覆盖当班窗口。

1.6 为什么选这 13 个表型

官方说明表型由领域专家(共同作者 LAC、PAT、DAG)结合文献选定(论文参考文献 5-7)。选择逻辑可以归纳为四条:

  1. 与再入院风险相关:每一条都被认为与 ICU 再入院风险有临床关联;
  2. 结构化数据盲区:ICD 编码覆盖不了或覆盖得很差——治疗不依从、慢性疼痛在计费数据里几乎不可见;
  3. 社会与行为维度:酒精滥用、其他物质滥用、肥胖、抑郁、精神障碍——这些"社会决定因素"类表型恰恰是预测模型最难从检验单里读出的;
  4. 疾病晚期状态:晚期癌症、晚期心脏病、晚期肺病、痴呆——这些状态决定的是"下一次住院是否还有意义"的临床决策,而非单次住院的病程。

1.7 前身研究:Gehrmann et al. 2018 的验证链条

本语料不是凭空出现的。时间线是:

  1. 2015-2016:标注工程启动(与本语料同期,ACT 语料的早期版本先行);
  2. 2017:Gehrmann et al. 预印本(arXiv 1703.08705,“Comparing Rule-Based and Deep Learning Models for Patient Phenotyping”);
  3. 2018-02:PLoS ONE 正式版(13(2): e0192360)——用 1,610 篇出院小结、10 个表型比较 CNN 与概念抽取(MetaMap 类)管线:CNN 在几乎所有任务上胜出,F1 提升最高 26 个百分点、AUC 最高 7 个百分点;
  4. 2020-03:扩展语料(加护理记录至 2,102 篇、13 表型)以 Phenotype Annotations for Patient Notes in the MIMIC-III Database 之名正式入驻 PhysioNet;
  5. 2020-05:LREC 2020 论文发布(马赛,pp. 1362-1367),完整发表标注协议、Kappa 表与基线。

换句话说:PLoS ONE 2018 是"模型侧"的先行验证,LREC 2020 是"数据侧"的正式发表,PhysioNet v1.20.3 是数据的正式归档。三者构成完整证据链,引用时应各归其位。

1.8 团队与治理

PhysioNet 页面署名 4 人(Moseley、Celi、Wu、Dernoncourt),论文全名单 10 人。组织结构值得注意:

  • MIT Critical Data 社群:Celi 领导的学生社群,MIMIC 系列衍生研究的主力军;
  • 标注执行层:4 位操作员 = 2 位临床研究员 + 2 位住院医师(即论文中的 ETM、JTW、JW、JF);
  • 表型定义层:LAC(Celi)、PAT(Tyler)、DAG(Grant)三位资深医生定义表型;
  • 工程支持:Kai-ou Tang 与 William Labadie-Moseley 开发了标注 GUI;
  • 资助:PLoS ONE 前身研究披露 Dernoncourt 受 Philips Research 资助、Celi 持 NIH R01 EB017205-01A1;LREC 论文与 PhysioNet 页面声明无利益冲突。

这套"资深医生定标准 → 双人配对标注 → 独立判定 → 公开一致性"的治理结构,是本语料最重要的可复用资产——比数据本身更值得抄。

1.9 为什么 2020 年的语料在 LLM 时代没有过时

三 个理由:其一,评测集的价值与模型能力正相关——模型越强,越需要难而干净的金标准来区分"背过"与"会了",2,102 篇的规模恰好适合做少样本评测而不至于被训练污染耗尽;其二,人工标签是弱监督的裁判——493 条目那类自动标签工厂,其标签质量的最终裁决者只能是人工金标准;其三,协议的可复用性——在 MIMIC-IV 时代复制这套双人标注协议的成本已经被论文完整记账,后人不必重新发明。

1.10 用户画像:四类人如何各取所需

  • 模型工程师:拿标签表 + MIMIC-III 文本,复现 BoW/CNN 基线(§6.2 有逐表型 F1),然后在上面叠自己的模型;
  • 标注工程负责人:抄协议——批次时间戳机制、双人独立判定、Unsure 求助语义、显式证据规则、Kappa 逐表型公开(§4 有完整解剖);
  • LLM 研究者:把 2,102 篇当 zero-/few-shot 评测集,重点看 BoW/CNN 的短板表型(Adv. Lung Disease F1 48%)是否被 LLM 补齐(§7.5 有配方);
  • 临床信息学家:关注"结构化数据盲区"的量化证据——13 表型在 ICD 里的系统性缺位,是论证"必须读文本"的最佳素材。

§2 医学与科学背景:13 个表型的完整解剖

2.1 标签体系的精确结构

官方标签体系是 13 真表型 + 2 元标签 = 15 列二元标签:

13 真表型(疾病/状态维度,可多选):
  晚期癌症 / 晚期心脏病 / 晚期肺病 / 酒精滥用 /
  慢性神经性肌病 / 慢性疼痛(纤维肌痛) / 痴呆 / 抑郁 /
  发育迟缓 / 治疗不依从 / 肥胖 / 其他物质滥用 / 精神分裂症及其他精神障碍
2 元标签(元信息维度):
  None(标注员未观察到任何适应证为真)
  Unsure(标注员对至少一项判定存疑,需求助资深医生)

关键理解:None 与 Unsure 不是第 14、15 个疾病,而是关于标注过程本身的元信息列。None=True 意味着"13 个表型都观察到否定证据或无证据";Unsure=True 意味着"标注员承认自己的判定不可靠"。这两列在建模时如何处理,直接决定实验的合法性(§6.6 有专门讨论)。

2.2 三个"晚期"表型:疾病严重度的文本定义

晚期癌症、晚期心脏病、晚期肺病这组表型的定义展示了"如何把临床严重度写成可操作的文本判据":

  • Advanced Cancer:极高死亡率的癌种——胰腺、食管、胃、胆道、间变性(anaplastic)。注意这是按癌种白名单定义的,不依赖分期字段;
  • Advanced Heart Disease:EF<30%、严重心肌病、严重主动脉瓣狭窄、任何心脏移植提及(被考虑中/已列入/被拒绝均算);
  • Advanced Lung Disease:FEV1<50% 正常值或 FVC<70%;重度 COPD(GOLD III-IV 期);重度间质性肺病(ILD)。

这三条定义的共同智慧:用"检验数值阈值 + 疾病白名单"双轨制,让标注员既可以在叙述里找数值(“EF 25%”),也可以直接识别病种(“transferred for transplant evaluation”)。Kappa 表显示这三条的一致性组间差异显著(Adv. Heart Disease 组 1 = 0.820 vs 组 2 = 0.561)——晚期心脏病的判定高度依赖超声报告的数值披露习惯,这正是"高上下文"的代价。

2.3 两个成瘾表型:"活跃性"的时态判定

Alcohol Abuse 与 Other Substance Abuse 的定义共用一个核心语法:时态限制。

  • 酒精滥用:须为入院时活跃(active problem at the time of admission)的近期滥用史——是否入院主因均可;
  • 其他物质滥用:静脉吸毒、违禁药物使用、精神活性/麻醉药意外过量;远期大麻使用不算(“Remote use of marijuana is not sufficient”)。

"remote(远期)不算"这条排除规则,把"病史采集里的一句陈年往事"与"当前临床问题"切分开。标注员必须做时态推理——"20 年前戒断"与"本次入院前仍在用"在文本上只差几个词,但判定完全相反。这是 13 个表型里语言学家最感兴趣的部分。

2.4 Non Adherence:定义最精细的一条

Non Adherence 的官方定义是 13 条里最长的,因为它必须处理大量边界情形:

  • 核心定义:未经医生事先沟通,暂时或永久停止治疗(药物或就诊预约);
  • 明确纳入:跳过透析预约、违反医嘱自行离院(against medical advice, AMA);
  • 边界情形:患者因不良事件就诊咨询——是否构成不依从,取决于是否未经咨询就停了药:看了医生再停药 = 不是;自己直接停 = 是。

注意定义的对称性:它同时覆盖药物依从性与就诊依从性(appointments)。这个表型后来单独长出了应用论文——Wu et al. 在 AMIA 2019 发表了专门从临床笔记识别 documented medical non-adherence 的 NLP 工作,本语料就是训练/评测来源之一。

2.5 Chronic Pain Fibromyalgia:一个复合名里的临床现实

标签名是"Chronic Pain Fibromyalgia",定义却是"任何病因的慢性疼痛,需长期阿片/麻醉药物控制(含纤维肌痛)“。名字与定义的不对称是故意的:纤维肌痛是最典型的慢性疼痛标签,但临床现实里慢性疼痛的病因谱远比它宽。"需长期阿片类药物控制"是这个表型的操作性锚点——它把主观的"疼痛"转译为可验证的"长期麻醉处方”,这是把软状态写硬的典范。

2.6 精神谱系的三分法:Depression / Schizophrenia+ / 其他

13 个表型里有三条精神健康相关,边界划分非常明确:

  • Depression:抑郁症的诊断、治疗、以抑郁症状(含自伤、自杀行为)入 ICU——自杀/自伤明确算入 Depression 而非精神障碍;
  • Schizophrenia and other Psychiatric Disorders:DSM-5 分类下的精神障碍(精神分裂症、双相、焦虑障碍)——明文排除抑郁症;
  • 没有第三个"焦虑症"独立标签——焦虑被并入 Schizophrenia and other Psychiatric Disorders。

Kappa 表显示 Depression 是一致性最好的表型之一(组 2 达 0.945),而它也是阳性率最高的表型(出院小结 24.23%)——定义清晰 + 正例充足,是金标准表型的理想形态。

2.7 Chronic Neurological Dystrophies:一张神经科白名单

定义采用白名单枚举:多发性硬化(MS)、肌萎缩侧索硬化(ALS)、肌营养不良、重症肌无力、帕金森病、癫痫、卒中/CVA 伴残留缺损、各种神经肌肉病或肌病。注意两个细节:

  • “with residual deficits”——卒中本身不算,遗留神经功能缺损的卒中才算("慢性"的判据落在功能残留上);
  • “Dystrophies"这个词在医学术语上并不精确(dystrophy 通常指肌营养不良),官方用它泛指"慢性神经系统的退行/损伤状态”。检索文献时不要被标签名误导。

2.8 Obesity 与 Developmental Delay:两个"提及即算"与"白名单外"的表型

  • Obesity:任何把肥胖作为就诊考量提及的情况即算——但单纯腹部肥胖不算(abdominal obesity is not sufficient)。"提及即算"的低门槛 + "腹型肥胖不算"的排除,把 BMI 数值、减肥计划、麻醉风险评估里的肥胖备注都纳入了判定范围;
  • Developmental Delay:先天性、遗传性、特发性发育障碍——这是 13 条里唯一面向发育而非疾病的表型,在成人 ICU 语料里阳性率最低(出院小结 1.27%,14 篇;护理记录 0.50%,5 篇)。极低阳性率使它成为极不平衡学习与 Kappa 在稀有类别下失真的天然教学案例(Developmental Delay 组 1 Kappa = 1.000——两人全一致,但正例极少时 Kappa 的解读要非常小心,§6.4 展开)。

2.9 13 表型 × 两类文本的阳性分布全景

论文 Table 2 的完整分布(阳性篇数 / 占比):

表型 Discharge(/1,102) Nursing(/1,000)
Adv. / Metastatic Cancer 74 / 6.72% 24 / 2.40%
Adv. Heart Disease 172 / 15.61% 35 / 3.50%
Adv. Lung Disease 88 / 7.99% 35 / 3.50%
Alcohol Abuse 127 / 11.52% 48 / 4.80%
Chronic Neurologic Dystrophies 187 / 16.97% 53 / 5.30%
Chronic Pain Fibromyalgia 150 / 13.61% 39 / 3.90%
Dementia 43 / 3.90% 22 / 2.20%
Depression 267 / 24.23% 54 / 5.40%
Developmental Delay 14 / 1.27% 5 / 0.50%
Non Adherence 78 / 7.08% 35 / 3.50%
Obesity 72 / 6.53% 12 / 1.20%
Psychiatric disorders 167 / 15.15% 39 / 3.90%
Substance Abuse 92 / 8.35% 20 / 2.00%

三个可立即使用的观察:最稀有(Developmental Delay,19 篇合计)与最常见(Depression,321 篇合计)相差约 17 倍;护理记录的阳性率整体在出院小结的 1/3 左右;每篇笔记平均携带约 1.3 个真表型阳性(粗算),多标签假设成立。

2.10 表型语义学小结:三种定义模式

回看 13 条定义,全部落进三种可复用的定义模式:

  1. 白名单模式(Advanced Cancer / Chronic Neurological Dystrophies / Schizophrenia+):枚举判定对象,标注员做的是"匹配";
  2. 阈值模式(Advanced Heart Disease / Advanced Lung Disease):给出数值判据(EF<30%、FEV1<50%),标注员做的是"读数";
  3. 状态+时态模式(Alcohol Abuse / Other Substance Abuse / Non Adherence / Depression):定义行为状态及其时间窗,标注员做的是叙事推理。

第三种模式最难(对应 Kappa 的低值区),也是机器最难的——这正好解释了为什么 LLM 时代的评测要从这里入手。

§3 数据集规格:表结构、版本、获取

3.1 数据形态:一张"标注覆盖层"表,不是语料库本体

拿到数据后你会发现它比想象中小得多:这不是一个装满文本的语料库,而是一张索引表。每一行的官方 schema:

字段 类型 含义
SUBJECT_ID integer MIMIC-III 患者标识
HADM_ID integer MIMIC-III 住院标识
ROW_ID integer 指向 MIMIC-III v1.4 NOTEEVENTS 表的行索引
15 个表型列 binary 13 真表型 + None + Unsure,各取 0/1
Operator string 标注员标识(对应论文中的 ETM/JTW/JW/JF)

官方原话:“For most purposes, this table can be joined to other tables in MIMIC-III as if it were the NOTEEVENTS table.”(多数场景下,这张表可以像 NOTEEVENTS 表一样与 MIMIC-III 其他表 join。)这个设计哲学后来被整个 MIMIC 衍生数据集家族继承——493 条目的 chronology 表、各种派生基准,都在用"索引层 + 上游本体"的解耦架构。

3.2 文本本体的获取路径

完整的使用闭环需要两份数据:

本数据集(标注表)          MIMIC-III v1.4(NOTEEVENTS 表)
┌─────────────────┐        ┌──────────────────────────┐
│ ROW_ID | 15 标签 │  join  │ ROW_ID | TEXT | CATEGORY │
│        | Operator│ ─────► │        | CHARTDATE/...   │
└─────────────────┘        └──────────────────────────┘
         ▲                            ▲
         └──── 同一个 ROW_ID 命名空间 ────┘

NOTEEVENTS 表里按 CATEGORY 字段可过滤出 Discharge summary 与 Nursing/ Nursing/other 两类文本。注意一个易错点:MIMIC-III 的护理类笔记在 CATEGORY 里有 Nursing 与 Nursing/other 两个值,语料的 1,000 篇护理记录具体覆盖哪一类,官方页面未细化说明(存照 F)——用 COUNT 对账是你的第一道工序。

3.3 版本号 1.20.3 的非常规语义

PhysioNet 数据集的版本号一般是 1.0.0 → 2.0.0 式的整数递进,本数据集的 1.20.3 显得非常突兀。官方未解释版本号语义;第三方镜像(selectdataset)显示版本路径甚至被写作 1.20.03。可确认的事实只有三条:发布日期 2020-03-05;PhysioNet 页面当前唯一列出的版本即 1.20.3;发布时点与 LREC 2020 同步(官方 Release Notes 原文:“This release coincides with presentation of this data set at the Language Resources and Evaluation Conference”)。版本号的内部编码规则属于无官方解释的历史遗迹,引用时写全 1.20.3 即可(存照 G)。

3.4 获取流程:与 MIMIC-III 完全同门槛

获取步骤与 MIMIC-III 主库一致:

  1. 注册 PhysioNet 账号;
  2. 完成 CITI 课程(“Data or Specimens Only Research”);
  3. 签署数据使用协议(DUA);
  4. 提交 MIMIC-III 访问申请并通过;
  5. 在同一账号下访问本数据集页面下载标注表。

官方 Usage Notes 的原话逻辑:数据包含 PHI(HIPAA 1996 定义),且可关联回 MIMIC-III,因此访问者必须满足 MIMIC-III 的全部要求。不存在"只要这份标注表、不要 MIMIC-III"的快捷通道——这也再次印证它是上游数据库的衍生覆盖层。

3.5 页面元数据 “Database Open Access” 与实际受控访问的落差

一个需要存照的细节:PhysioNet 页面横幅把该资源归类为 “Database Open Access”(第三方资源列表同样显示此分类),但 Usage Notes 明确要求 MIMIC-III 访问资格。两者的合理解释:横幅分类描述的是资源类型学(Database 类别、开放获取数据集家族的登记属性),而实际文件访问受 PhysioNet credentialed 机制保护。给使用者的结论只有一个:把它当受控数据对待——不要在论文里贴笔记原文,不要在公开仓库分发 join 出来的文本(存照 D)。

3.6 引用方式与引用链

官方要求的三层引用链:

  1. 数据集本体:Moseley, E., Celi, L. A., Wu, J., & Dernoncourt, F. (2020). Phenotype Annotations for Patient Notes in the MIMIC-III Database (version 1.20.3). PhysioNet. DOI 10.13026/txmt-8m40. RRID: SCR_007345;
  2. 原始论文:Gehrmann S, Dernoncourt F, Li Y, et al. (2018) Comparing deep learning and concept extraction based methods for patient phenotyping from clinical narratives. PLoS ONE 13(2): e0192360;
  3. PhysioNet 平台:Pollard, T., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health. DOI 10.1038/s44360-026-00096-z。

补充建议(本条目立场):如果你使用标注协议或 Kappa 数据,还应引用 Moseley et al. LREC 2020(ACL Anthology 2020.lrec-1.170, pp. 1362-1367)——那是标注工程的正式方法学出处。

3.7 与上游 MIMIC-III 的版本锚定细节

标注表锚定 MIMIC-III v1.4 的 NOTEEVENTS。这意味着:

  • ROW_ID 在 v1.4 内稳定;若你使用的是 v1.4 之前的旧版快照,ROW_ID 对不上是常态而非 bug;
  • MIMIC-III 于 2012 年患者截止后进入维护态(mimic.physionet.org 官方建议新研究转向 MIMIC-IV),本数据集的上游文本池不会再增长;
  • MIMIC-IV 的 NOTEEVENTS 被 DISCHARGE / RADIOLOGY / 输入输出的新表结构取代,ROW_ID 语义不复存在——把本标注表映射到 MIMIC-IV 需要经过 SUBJECT_ID × 时间的模糊对齐(有损,需自担方法学风险,§7.8 展开)。

3.8 数据完整性对账清单

下载后第一小时应该做的五件对账事:

  1. 行数:Discharge 与 Nursing 两类合计应为 2,102 行(按 Operator 分组统计可看到 4 位标注员的分布);
  2. 标签列数:应为 15 列二元 + 1 列 Operator + 3 列 ID = 19 列左右(以实际文件头为准);
  3. ROW_ID 有效性:抽样 join MIMIC-III NOTEEVENTS,验证文本类别字段与预期文类一致;
  4. None 列语义抽查:None=1 的行,13 个表型列应全为 0(如不一致,先查 None 的确切语义再建模);
  5. Unsure 覆盖率:统计 Unsure=1 的行占比——它决定你的"可用金标准"规模(§6.6)。

3.9 官方文件导航

PhysioNet 页面文件区的组织较为简洁:核心就是标注表(CSV 式结构),另附许可证、引用文件、版本说明。没有单独的"代码包"或"基线脚本"——基线模型的实现细节在 LREC 论文 §7 里,代码层面的前身资源在 GitHub sebastianGehrmann/phenotyping(PLoS ONE 2018 论文的配套代码)与 EdwardMoseley/ACTdb(项目早期仓库,需满足同样访问资格)。不排除部分历史仓库已不活跃——以论文文本为准,仓库仅作参考。

3.10 机器可读元数据速查(AI-Ready 属性)

属性 值
文本语言 英语(官方:all in the English language)
单位/医院 Beth Israel Deaconess Medical Center(波士顿三级医院)
时间覆盖 上游 MIMIC-III:2001-2012
标注覆盖 2015-08 ~ 2016-10(标注行为的时间)
任务类型 多标签文本分类(multi-label, multi-class)
标签粒度 笔记级(note-level),非跨度级(无 span/mention 标注)
每篇标注人数 2(组内独立)
标签格式 每表型一列二元值
文本本体位置 MIMIC-III v1.4 NOTEEVENTS(通过 ROW_ID)
官方评测协议 无官方 train/test 划分(论文未发布划分文件)

§3.11 DAIMS 数据AI就绪度评估

按本系列 DAIMS(Data AI-Readiness Maturity Score)八个维度打分(每项 0-1 分,总分 8):

维度 得分 评语
文档完备性 1.0 官方页面 + LREC 论文把定义、协议、一致性全部写透
机器可读性 0.8 结构化标注表 + 稳定 schema;扣 0.2 因列名非自描述(15 列二元需对照文档)
标签质量透明度 1.0 Cohen’s Kappa 全表公开——医疗 NLP 语料里的满分样本
可访问性 0.6 受控访问合理但门槛完整套用 MIMIC-III 流程;无文本本体(需 join)
许可清晰度 0.8 PhysioNet DUA 明确;"Database Open Access"分类与实际受控的表述落差扣分
格式标准化 0.9 CSV 式索引表 + 外键锚定上游,标准关系型范式;无官方 JSON Schema 扣分
评测协议完备性 0.5 官方基线给了水位,但无 train/test 划分文件、无评测脚本发布
生态可持续性 0.9 PhysioNet 永久 DOI + RRID;上游 MIMIC-III 进入维护态扣分
合计 6.5 / 8 协议与透明度满分型选手;可访问性与评测协议是主要失分点

与同批条目对照:mimiciv(492)约 7.2(体量与模块化满分,但标注稀缺)、nosocomial-risk-mimic(493)7.8(评测协议完备)。本条目的画像相反——不是靠规模与管线取胜,而是靠"每一枚标签可追溯"的审计级透明度取胜。6.5 分的短板(无划分、需 join)恰好都是"金标准语料"这一物种的天性,而非工程疏漏。

最后一条值得停留三秒:官方没有发布 train/dev/test 划分。PLoS ONE 与 LREC 论文都未给出划分细节。这意味着所有论文间的 F1 数字严格来说不可直接比较——除非划分协议一致。你若要发布基准结果,必须自报划分并开源(§5.2 的协议建议)。

§4 数据结构:标注工程的全链路

4.1 组织拓扑:两组、四人、两职业

标注力量的组织拓扑:

表型定义层:LAC (Celi) + PAT (Tyler) + DAG (Grant)   ← 资深医生定标准
                      │
        ┌─────────────┴─────────────┐
   Group 1                      Group 2
   ETM (临床研究员) ↔ JTW        JW ↔ JF (住院医)
   [Edward T. Moseley]          [Joy Wu] [John Foote Jr.]
                      │
              各自独立标注同批笔记
                      │
        Cohen's Kappa 双组全表公开

组 1(PhysioNet 页面写法:ETM & JTW)与组 2(JW & JF)各自内部配对;论文 Kappa 表的列名则写作 “ETM & JTW” 与 “JF & JW”——没有跨组标注同一篇笔记(一篇笔记由本组两人重复标注),因此 Kappa 是组内一致性,两组之间不可直接比较样本集合(存照 H)。

4.2 职业配对的设计意图

每组固定为"1 临床研究员 + 1 住院医"的跨职业配对,官方给出的理由是让分歧可见(facilitate annotation of notes in duplicate, allowing for cases of disagreement between operators)。这背后是一个标注工程的老命题:同职业配对(两个住院医)会共享训练偏见,分歧被系统性压低,Kappa 虚高;跨职业配对暴露的是"职业视角差",Kappa 更真实但偏低。本语料选择了后者——Kappa 表里那些 0.56-0.70 的中低值,部分就是职业视角差的诚实记录。

4.3 批次流水线:时间戳同步机制

标注按批次推进,机制是论文原话可以完全复原的:

  1. 临床文本被切成批次(batches),每个批次创建当日打时间戳;
  2. 批次分发给组内两人;
  3. 两人独立标注(“instructed to work independently”)——不交流、不互相看结果;
  4. 两人都完成当前批次后,系统才创建并下发新批次(“when both operators in a team completed annotation of a batch, a new batch was created and transferred to them”)。

第 4 条是这个流水线最精妙的一环:它保证了同一批次的两人标注在时间上贴近,防止"三个月前的我"与"今天 的我"因标准漂移产生伪分歧;同时批次粒度的一致性让 Kappa 的计算窗口均匀。这个机制对任何要做双人标注的团队都值得照抄。

4.4 Unsure 标签:求助机制而非弃权机制

Unsure 的官方语义:标注员希望向更资深的医生寻求帮助以判定某表型是否存在(“the label ‘unsure’ was used to indicate that an operator would like to seek assistance determining the presence of a phenotype from a more senior physician”)。

两个推论:

  1. Unsure 是流程信号而非数据缺陷——它把"我不确定"变成一条可管理的工单;
  2. 官方未公布裁决流程的细节:资深医生的仲裁结果是否回写、Unsure 行最终如何落定,论文与 PhysioNet 页面都没有说明(存照 I)。二手研究(如 JAMIA 2024 selective prediction 工作)的做法是直接剔除分歧与不确定的行——depression 分析从全量里保留 563 篇可用(其中 136 篇阳性)。这是当前文献里的主流处理,但你必须在自己的论文里明示处理方式。

4.5 判定规则的三条硬约束

从论文 Methods 与数据描述里提炼的标注硬约束:

  1. 显式文本证据:表型为真的前提是笔记中有 explicit text 支持,不允许基于临床常识的推断打标;
  2. 无词典约束:不存在"出现某词即判阳"的固定词典,也不规定术语出现顺序——标注员面对的是语义而非字面;
  3. 定义优先:13 条官方定义(§2.2-2.8 逐条解剖)是唯一判定依据,标注培训就是集体过笔记学习这些定义。

这三条约束共同保证了标注的可辩护性:任何一枚阳性标签都能指回一段文本证据 + 一条定义条款。

4.6 Kappa 全表:一致性的诚实档案

论文 Table 4 的 Cohen’s Kappa(组 1 = ETM & JTW;组 2 = JF & JW):

表型 组 1 组 2
Adv. / Metastatic Cancer 0.834 0.869
Adv. Heart Disease 0.820 0.561
Adv. Lung Disease 0.805 0.654
Alcohol Abuse 0.856 0.842
Chronic Neurologic Dystrophies 0.714 0.700
Chronic Pain Fibromyalgia 0.833 0.731
Dementia 0.952 0.947
Depression 0.853 0.945
Developmental Delay 1.000 0.869
Non Adherence 0.778 0.694
Obesity 0.941 0.968
Psychiatric disorders 0.908 0.940
Substance Abuse 0.862 0.882

读表四法:

  • 天花板:Dementia 双组 0.94+——诊断性词汇在文本里高度显式,两人几乎没有分歧空间;
  • 地板:组 2 的 Adv. Heart Disease 0.561、Adv. Lung Disease 0.654——"晚期"的判定依赖检验数值在文本中的披露习惯,主观空间大;
  • 双组差异:Developmental Delay(1.000 vs 0.869)与 Depression(0.853 vs 0.945)方向相反——组间差异既可能来自样本子集不同,也可能来自职业配对的视角差,不可归因于单因素;
  • 均值水平:双组 26 个 Kappa 值绝大多数落在 0.7-0.9 区间,按 Landis-Koch 标准属"substantial to almost perfect"——作为金标准语料是合格的,但不是完美的。

4.7 Kappa 在稀有类别下的失真:Developmental Delay 的 1.000

组 1 的 Developmental Delay Kappa = 1.000 需要特别小心地读:该表型在出院小结里只有 14 篇阳性(1.27%)。当正例极稀少时,两位标注员"全对齐"很可能只是"都判了否定"——Kappa 的偶然一致性校正在这种情况下可能给出反直觉的高值(或低值)。这是一个教科书级的方法学提醒:看到 Kappa = 1.0,第一反应应是查混淆矩阵,而不是庆祝。

4.8 数据血缘:从床旁到标注表的五跳

完整血缘链:

病床旁叙述(BIDMC ICU,2001-2012)
  → EHR 文本系统(护理记录 + 出院小结)
  → MIMIC-III v1.4 NOTEEVENTS(去标识化,ROW_ID 分配)
  → 频繁再入院队列筛选(单年 ICU 入住 >3 次)
  → 2,102 篇笔记批次化
  → 双人独立标注(2015-08 ~ 2016-10)
  → 标注表(本数据集 v1.20.3,2020-03-05 归档)

每一跳都有可核查的锚点:上游是 MIMIC-III 官方论文(Johnson et al. 2016, Scientific Data 3:160035),队列判据是官方 Background 原文,标注协议是 LREC 论文 Methods,归档是 PhysioNet DOI。没有一跳是黑箱——这是它区别于多数"标注数据集"的结构性优势。

4.9 标注 GUI 与工具链

论文致谢记录了工具链的存在:Kai-ou Tang 与 William Labadie-Moseley 开发了文本标注图形界面(graphical user interface for text annotation)。GUI 的截图与实现细节未公开,但可以推断批次时间戳同步机制(§4.3)正是由这套工具承载的。对今天 的标注平台(Label Studio、doccano 等)使用者,值得抄的不是 GUI 本身,而是三个功能需求:批次时间戳、双人完成度门控、Unsure 一键求助。

4.10 与 493 条目自动标签工厂的结构对照

把本条目与 nosocomial-risk-mimic(493)并排,可以看到标签生产的两种工业形态:

维度 本条目(人工金标准) 493(自动标签工厂)
标签来源 4 位人类专家逐篇判定 NLP 管线 + UMLS 判据自动生成
规模 2,102 篇笔记 数万住院的快照序列
成本 15 个月 × 4 人 + GUI 开发 算力 + 管线调参
一致性度量 Cohen’s Kappa 全表公开 管线确定性可复现
偏差类型 标注员主观性、职业视角差 判据覆盖偏差、NLP 抽取误差
适用 评测、校准、少样本 大规模弱监督训练

两者的正确关系不是替代而是级联:自动工厂产训练标签,人工金标准做裁判与校准锚点。这条级联路线是当前医疗 NLP 的主流工程实践。

§5 下游分析协议:从获取到发布结果的完整规程

5.1 环境准备与数据装载

最小可用环境:

# 前提:已获 MIMIC-III 访问资格,已下载 MIMIC-III v1.4 与本标注表
# 场景 A:PostgreSQL(与 MIMIC-III 官方装载一致)
psql -U postgres -d mimiciii -c "
CREATE TABLE phenotype_annotations (
  subject_id INT, hadm_id INT, row_id INT PRIMARY KEY,
  advanced_cancer INT, advanced_heart_disease INT, advanced_lung_disease INT,
  alcohol_abuse INT, chronic_neurological_dystrophies INT,
  chronic_pain_fibromyalgia INT, dementia INT, depression INT,
  developmental_delay INT, non_adherence INT, obesity INT,
  other_substance_abuse INT, schizophrenia_psychiatric INT,
  none_label INT, unsure_label INT,
  operator TEXT);"
# 实际列名以官方文件头为准——上列为语义示意

装载后先跑 §3.8 的五项对账,再进入建模。

5.2 评测协议建议:把"无官方划分"变成你的加分项

官方未发布 train/dev/test 划分,你的实验设计应该主动补上这个空档:

  1. 划分单元用 ROW_ID(笔记级),不要用 SUBJECT_ID 混划——同一患者的多篇笔记若跨 train/test,会造成患者级泄漏;
  2. 更稳妥:患者级划分(按 SUBJECT_ID 分组抽样),并报告患者数;
  3. 处理 Unsure 与分歧行时三选一并明示:剔除(文献主流)/ 当负例(危险,会引入标注噪声)/ 当独立类别(只用于标注研究);
  4. 每表型报 AUC + F1 + 灵敏度/特异度全组,参照 LREC 论文 Table 5 的逐表型格式;
  5. 开源你的划分文件(受控数据下开源"ID 列表"通常合规,需查 DUA)——这是对这个基准最大的社区贡献。

5.3 复现官方基线:BoW + Logistic Regression

LREC 论文基线一:词袋 + 逻辑回归。复现配方:

from sklearn.feature_extraction.text import CountVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import f1_score, roc_auc_score

vec = CountVectorizer(max_features=30000, stop_words=None, lowercase=True)
X_tr = vec.fit_transform(texts_train)   # texts 来自 NOTEEVENTS join
clf = LogisticRegression(max_iter=1000, C=1.0)
clf.fit(X_tr, labels_train["depression"])
pred = clf.predict(X_te); proba = clf.predict_proba(X_te)[:, 1]
print(f1_score(labels_test["depression"], pred), roc_auc_score(labels_test["depression"], proba))
# 参照水位:Depression F1≈58(BoW),划分不同会有出入——务必自报划分

要点:论文未详述正则与词表上限(存照 J),上面的超参是工程默认值——你的目标是方法学复现而非数字复刻,逐表型的相对难度排序才是可迁移的结论。

5.4 复现官方基线:CNN

LREC 论文基线二:CNN 文本分类器(Kim 式架构的医学版)。论文披露的配置:每卷积宽度 100 个 filter、dropout 0.5、adadelta 优化、word2vec 词向量预训练于 MIMIC-III 全量笔记、任务按"每表型一个独立二元分类器"组织。注意 arXiv/ar5iv 页面显示的卷积宽度 “11 to 44” 是排版转换错误,原始合理值为 1-4(存照 K)。PyTorch 骨架:

import torch, torch.nn as nn
class TextCNN(nn.Module):
    def __init__(self, vocab, emb_dim=300, n_filters=100, ks=(1,2,3,4)):
        super().__init__()
        self.emb = nn.Embedding(vocab, emb_dim)          # 可换预训练 word2vec
        self.convs = nn.ModuleList(
            [nn.Conv1d(emb_dim, n_filters, k) for k in ks])
        self.drop = nn.Dropout(0.5)                      # 论文值
        self.fc  = nn.Linear(n_filters * len(ks), 1)
    def forward(self, x):
        e = self.emb(x).transpose(1, 2)
        h = [torch.relu(c(e)).max(dim=2).values for c in self.convs]
        return self.fc(self.drop(torch.cat(h, dim=1))).squeeze(1)
# 优化器 adadelta;每表型独立训练;护理/出院小结分层报告

5.5 前身论文(PLoS ONE 2018)的实验设计要点

若要引用"CNN 优于概念抽取"的结论,需引用 Gehrmann et al. 2018 并注意其实验设定:

  • 语料:旧版 ACT 语料,1,610 篇出院小结、10 个表型(比本语料少护理记录、少 3 个表型);
  • 对照:概念抽取(医学概念词典/抽取管线特征)vs CNN;
  • 结论强度:CNN 在几乎所有任务上胜出,F1 最高提升 26 个百分点、AUC 最高提升 7 个百分点;
  • 配套:代码开源在 github.com/sebastianGehrmann/phenotyping;
  • 可解释性:论文同时给出了从 CNN 提取"最显著短语"(salient phrases)的方法与评估——这是医疗 CNN 可解释性的早期代表作。

注意:PLoS ONE 论文的 10 表型与本语料的 13 表型不一一对应,跨论文比较表型数字时要核对表型清单。

5.6 与 MIMIC-III 的 join 实操

三个高频 join 场景:

-- 场景 1:取回标注笔记全文(核心场景)
SELECT pa.row_id, ne.category, ne.chartdate, ne.text,
       pa.depression, pa.non_adherence, pa.operator
FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id)
WHERE pa.depression = 1;

-- 场景 2:补患者人口学(公平性分析用)
SELECT pa.*, pat.gender, pat.anchor_age
FROM phenotype_annotations pa
JOIN patients pat USING (subject_id);   -- MIMIC-III 为 dob/性别字段,语义自查文档

-- 场景 3:核查文类分布
SELECT ne.category, COUNT(*) FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id) GROUP BY ne.category;

场景 3 是对账关键:输出应能对上 1,102 出院小结 / 1,000 护理记录的规模——若护理类分裂成 Nursing 与 Nursing/other 两行,合计仍应为 1,000。

5.7 标注协议复用规程:把这套方法搬到你的数据

若你要在 MIMIC-IV 或本院数据上复制这套标注协议,按此清单执行:

  1. 定义先行:把每个表型写成"白名单/阈值/状态+时态"三模式之一(§2.10),每条定义附正例反例;
  2. 配对:跨职业配对(临床研究员 × 住院医),每组 2 人,组内独立;
  3. 批次门控:批次创建打时间戳,双人完成后才发新批;
  4. Unsure 通道:允许一键求助,但预先公布仲裁规则(这是官方协议未公开的部分,你必须补上,存照 I);
  5. 一致性公开:逐表型、逐配对报 Cohen’s Kappa,稀有类别附混淆矩阵;
  6. 样本量核算:2,102 篇 × 15 个月 × 4 人 ≈ 每人每小时约 0.5-1 篇出院小结的节奏(含培训与质检)——用它反推你的工期。

5.8 常见错误用法黑名单

  1. 把 2,102 当训练集上限抱怨——它从来不是为大规模训练设计的,训练请回 493 式自动标签或弱监督;
  2. 把 None 列当"健康"标签——None 只表示"本笔记无任何表型阳性证据",患者仍可能病情危重;
  3. 把 Unsure 行静默混入负例——这是把标注员的不确定性伪装成临床事实;
  4. 跨论文直接比 F1——官方无统一划分,先核对划分协议;
  5. 用本语料训练、用同一语料调参再报结果——2,102 篇经不起这种过拟合,评测集必须与调参集分离;
  6. 在公开渠道分发 join 出的文本——受控数据红线,见 §8。

5.9 LLM 时代的评测集转换规程

把本语料改造成 LLM zero-/few-shot 评测集的步骤:

  1. 构造任务模板:输入笔记全文(受控环境内),输出 13 个表型的二元判断(可加 None/Unsure 通道观察模型自校准);
  2. 抽样策略:全量 2,102 篇若成本过高,建议分层抽样——按表型 × 文类 × Operator 分层,保住稀有表型(Developmental Delay 全量仅 19 篇,别再抽了,全上);
  3. 评测指标:逐表型 F1/AUC 对齐 BoW/CNN 基线水位(§6.2),重点考察基线短板(Adv. Lung Disease F1 48%)是否被补齐;
  4. 报告规范:标注数据版本(1.20.3)、文本抽取日期、prompt 全文、解码参数——LLM 评测的可复现性全靠这些细节;
  5. 合规:全程在受控环境内运行,笔记原文与输出中含 PH信息的内容不得外泄(§8.3)。

5.10 与 492/493 条目的联合使用路线

三条已验证的联合路线:

  • 492 + 本条目:MIMIC-IV 时代做"结构化 vs 文本"的表型识别对照——结构化侧用 MIMIC-IV 四链数据,文本侧用本标注表(需解决 MIMIC-III→IV 患者对齐问题,§7.8);
  • 493 + 本条目:弱监督校准——用 493 的自动标签大规模训练,用本语料的金标准子集校准阈值与过滤层;
  • 三者:完整的"训练(493)→ 评测(本条目)→ 扩展(492 结构化侧)"流水线,是 MIMIC 宇宙内最经济的完整实验矩阵。

§6 实证结果与方法学分析

6.1 基线性能全景:BoW vs CNN

LREC 2020 论文 Table 5 的完整基线(F1,%):

表型 BoW + LR CNN 差值
Adv. / Metastatic Cancer 56 74 +18
Adv. Heart Disease 44 75 +31
Adv. Lung Disease 24 48 +24
Alcohol Abuse 67 76 +9
Chronic Neurologic Dystrophies 46 69 +23
Chronic Pain Fibromyalgia 41 49 +8
Depression 58 84 +26
Obesity 30 95 +65
Psychiatric disorders 50 83 +33
Substance Abuse 56 75 +19

三段式解读:

  1. CNN 全面胜出,10 个表型无一例外——这与前身 PLoS ONE 2018 论文(CNN 胜概念抽取)的结论在更严格的 BoW 对照下复现;
  2. Obesity 的 +65 是全表最戏剧性的一格:BoW 只有 30,CNN 到 95。合理解释是肥胖的文本信号高度词汇化(“obesity”、“BMI 45”、“morbidly obese”),但词面与标签的映射需要组合特征(提及语境),线性模型抓不住组合性;
  3. Adv. Lung Disease 双双垫底(24/48):FEV1/FVC 数值散落在肺功能报告的碎片行文里,且"晚期"阈值判定要求读数比较——这是纯粹的数值叙事推理,也是今天 LLM 最值得挑战的一格。

6.2 基线的两个技术细节

论文披露的 CNN 配置(§5.4 已给复现码)之外,两个容易被忽略的细节:其一,任务组织是每表型一个独立二元分类器——不是 13 头多任务单模型;这意味着 13 个模型各自训练、各自调参,表型间的性能差部分来自训练动态差而非任务难度差。其二,词向量预训练语料是 MIMIC-III 全量笔记(论文写 “all the notes of MIMIC III v3”)——基线享受了上游语料库的红利,这点在解读"小语料大性能"时必须记得。

6.3 一致性 × 难度的联合矩阵

把 Kappa(§4.6)与基线 F1(§6.1)并排,得到一张罕见的"标注质量 × 模型难度"联合视图:

象限 表型例 解读
高 Kappa + 高 F1 Obesity、Dementia、Depression 定义清晰 + 信号显式——金标准区的"舒适表型"
高 Kappa + 低 F1 Chronic Neurologic Dystrophies(0.714/0.700,BoW 46) 人能稳定判,词袋判不动——语义组合性的价值区
低 Kappa + 高 F1 Adv. Heart Disease 组 2(0.561,CNN 75) 令人警惕:模型在不太一致的标签上跑出高 F1——过拟合标注员偏见的可能
低 Kappa + 低 F1 Adv. Lung Disease 定义模糊 + 信号隐性——真正的硬骨头

第四象限才是未来工作的主战场;第三象限是方法学论文最爱讨论的"模型 vs 标注员谁更稳"的哲学区。

6.4 分布失衡与指标的适配

阳性分布(§2.9)决定了指标选择的纪律:

  • Developmental Delay(合计 19 篇阳性)上任何单点指标都是统计噪声——请报全混淆矩阵或干脆并入"稀有组"讨论;
  • Nursing 子集的阳性率普遍 <6%,Accuracy 在这里毫无意义(全判负即可 94%+)——AUC 与 PR-AUC 是底线配置;
  • 与 493 条目的 HAPI/HAAKI 队列对照:那边是"人卫工程造平衡",这边是"自然人群分布"——两份数据集合起来正好教学生"分布偏移对表型模型的影响"。

6.5 文类效应:同一表型在两类文本上的性能差

论文未按文类分层报告基线(官方只有聚合数字),但分布表已经预示:出院小结的阳性率是护理记录的 2-5 倍,且出院小结篇幅是护理记录的 7 倍(1,417 vs 208 token)。可以预期:

  • 长文本里信号更全(医生写总结时会回顾整个病程),单篇判定更容易;
  • 护理记录的碎片化要求模型从"当日观察"里推断"持续状态"——时态推理压力更大;
  • 混合训练时若不按文类分层抽样,模型会向出院小结的分布倾斜。

这是本语料作为方法学测试床最独特的资产:同一患者群、同一标注协议、两类文本——文类效应的对照实验条件天然成立。

6.6 None 与 Unsure 的建模语义学

官方未给建模指令,主流处理及其代价:

  1. 剔除分歧行(双人标签冲突的行)与 Unsure 行:JAMIA 2024 selective prediction 研究对 depression 任务剔除后剩 563 篇(136 阳性)。代价:样本缩水 + 引入"难例被系统性移除"的选择偏差——恰好是 selective prediction 研究想研究的现象,普通建模要警惕;
  2. None 当全负例:合法,但要记得 None=1 的患者未必健康(§5.8);
  3. 把"标注员间分歧"当不确定性标签:这是本语料独有的机会——双人标签 + 独立标注给了你天然的 aleatoric uncertainty 度量,可以做"标签噪声感知"的学习(confident learning、noise-robust loss 的天然试验田)。

6.7 二手引用的再统计:JAMIA 2024 selective prediction 论文

一篇 JAMIA 2024 的 selective prediction 研究对本语料做了再统计:1,138 unique notes / 1,138 unique patients(筛选自 59,652 篇笔记池),depression 任务剔除分歧/不确定后 563 篇可用、136 篇阳性(24%),自行划分为 112 dev / 451 test。这组数字的用途与警告:它展示了社区实际使用本语料的方式(大幅筛选 + 自建划分),但该论文身份与口径本条目未做一手核验(存照 L),引用时请以原文为准,不要从本条目转引具体数字。

6.8 八个必知的坑(坑点 1-8)

坑点 1:只有索引没有文本。本数据集不含笔记正文——必须先拿 MIMIC-III 资格、装 NOTEEVENTS 表才能用。把它当独立语料下载是新手第一大坑。

坑点 2:ROW_ID 锚定 MIMIC-III v1.4。旧版 MIMIC-III 快照的 ROW_ID 对不上;MIMIC-IV 根本没有 ROW_ID 语义。跨版本使用先查 §7.8 的对齐方案。

坑点 3:官方无 train/test 划分。所有跨论文 F1 比较都隐含划分协议风险——自建划分并开源,别沿用他人未公开的划分。

坑点 4:Kappa = 1.000 的陷阱。稀有表型(Developmental Delay)的全一致可能是"都判负"的假象,先看混淆矩阵再解读。

坑点 5:None ≠ 健康。None 只表示本篇笔记无表型阳性证据。用 None 行做"健康对照"会引入严重的选择偏差。

坑点 6:Unsure 的裁决规则未公开。官方没说 Unsure 行最终如何落定——别假设 Unsure=负例,也别假设它已仲裁。自己定规则、写明、开源。

坑点 7:组间 Kappa 不可直接比。两组标注的笔记子集不同、职业配对不同,组 1 与组 2 的 Kappa 差异没有单一解释因子。

坑点 8:受控数据红线。笔记文本含 PHI,join 出的原文不可公开分发——评测代码开源时用 ID 引用,别贴文本样例。

6.9 使用者自查清单

开工前逐项打勾:

  • [ ] 已获 PhysioNet credentialed + MIMIC-III 资格(与 DUA 条款核对过"衍生索引表"的合规性)
  • [ ] MIMIC-III v1.4 已装载且 ROW_ID 对账通过(§3.8 五项对账)
  • [ ] 文类分布对上 1,102 / 1,000(§5.6 场景 3)
  • [ ] None 列语义抽查无矛盾
  • [ ] Unsure 行的处理规则已写入实验计划
  • [ ] 划分单元是患者级(或至少报告了患者级泄漏检查)
  • [ ] 指标配置:AUC + F1(+PR-AUC),稀有表型报混淆矩阵
  • [ ] 引用链三层齐全:数据集 DOI + 论文 + 平台(§3.6)
  • [ ] 公开物不含笔记原文(§8.3)

6.10 家族治理定位:ACT → PhysioNet 的"转正"样本

本数据集的归档路径在 MIMIC 家族里有方法论意义:它先以 works 页面(“Annotated Clinical Texts from MIMIC”)+ GitHub(ACTdb)的非正式形态服务了 PLoS ONE 2018 研究,再以正式 DOI + 完整条目页的形态入驻 PhysioNet 主站(v1.20.3)。这是"研究副产品 → 可引用基础设施"的转正样本。今天 各机构生产数据集时值得抄这个路径:先让数据在论文里产生价值,再补齐归档手续——而不是反过来等"完美归档"拖死发布。

6.11 冲突口径诊断树

当你发现不同来源的数字对不上:

数字不符?
├─ 规模类(2,102 vs 其他)
│   ├─ 对方在说 1,610?→ 那是前身 ACT 语料(PLoS ONE 2018),不是本数据集
│   ├─ 对方在说 1,138?→ 那是二手再统计的筛选结果(§6.7),非全集
│   └─ 对方在说 2,102 但文类拆分不同?→ 核对 Nursing/Nursing/other 归并口径
├─ 表型数(13 vs 15 vs 10)
│   ├─ 13 = 真表型数(官方 Methods 口径)
│   ├─ 15 = 标签列数(含 None/Unsure,官方 Data Description 口径)
│   └─ 10 = PLoS ONE 2018 前身研究的表型数(另一个语料)
├─ 版本(1.20.3 vs 1.20.03)→ 以 PhysioNet 官方 1.20.3 为准
└─ Kappa 表列名(ETM & JTW vs JW & JF 顺序)→ 以 LREC 论文 Table 4 为准

6.12 静态语料 × 活跃上游:时效性策略

本语料是静态的(2,102 篇不会再长),但上游 MIMIC 生态活跃(MIMIC-IV 迭代、LLM 评测需求增长)。三个时效性策略:其一,把它当冻结金标准——冻结正是评测集的美德,别试图"更新"它;其二,把迁移到 MIMIC-IV 的对齐研究当增量工作(有损对齐,谨慎发表);其三,关注 PhysioNet 是否发布 MIMIC-IV 版表型标注——一旦发布,本条目的"迁移空白"论述即需更新(本条目以 v1.20.3 时点为准)。

6.13 与同类标注语料的横向定位

临床 NLP 表型标注语料的多维定位:

语料 规模 标注者 表型风格 特点
本语料 2,102 笔记 双人×2 组 13 高上下文状态 Kappa 全表公开;可 join MIMIC-III
i2b2/n2c2 系列任务集 数百-上千报告 多人 任务特定(吸烟、肥胖共病等) 竞赛制、跨度标注
前身 ACT(PLoS ONE 2018) 1,610 出院小结 双人 10 表型 本语料的直系前身
493 Nosocomial 数万住院 自动管线 3 疾病 规模换质量

本语料的差异化生态位:MIMIC 生态内唯一同时具备"双人金标准 + Kappa 全表 + 与结构化数据库无缝 join"三个属性的表型标注集。

§7 AI 就绪指南与应用场景

7.1 四种标准喂法

  1. 表型分类基准(最主流):join 出文本 → 患者级划分 → 逐表型训练 → 对齐 BoW/CNN 水位;
  2. LLM 零样本/少样本评测:受控环境内 prompt 模型输出 13 表型判断,对照人工标签(§5.9 规程);
  3. 标注工程教学:拿 Kappa 表 + 协议章节做课程案例——"为什么 Obesity 的 Kappa 0.941 而 Heart Disease 组 2 只有 0.561"是最好的课堂讨论题;
  4. 弱监督校准锚点:用 493 式自动标签大规模训练,本语料子集校准(§7.6 配方)。

7.2 死亡线:30 分钟跑通第一个实验

# 前提:mimiciii 库已装载,phenotype_annotations 表已建
# 步骤 1:取回文本与标签(5 分钟)
psql -U postgres -d mimiciii -c "
CREATE VIEW pa_text AS
SELECT pa.*, ne.text, ne.category
FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id);"
# 步骤 2:导出 Depression 二分类最小集(5 分钟)
psql -U postgres -d mimiciii -c "
COPY (
  SELECT subject_id, row_id, category, depression
  FROM pa_text WHERE unsure_label = 0
) TO '/tmp/depression_min.csv' CSV HEADER;"
# 步骤 3:Python 侧 BoW+LR 基线(20 分钟,患者级划分)

第一个实验别碰全部 13 表型——先跑 Depression(正例最多、Kappa 最高),打通全链路再横向铺开。

7.3 泄漏防控专项

本语料的泄漏面有三处:患者级泄漏(同患者多篇笔记跨集——按 SUBJECT_ID 分组划分即可堵住);时间泄漏(2012 年前的 MIMIC-III 数据在时间上先于 2015-2016 的标注行为,但这不构成机器学习意义上的泄漏——标签是后验知识,文本是历史数据,注意别把"标注期"误当数据期即可);划分泄漏(沿用他人未公开划分并反复调参——2,102 篇的小体量会放大这一风险,评测集必须冻结)。另有一处隐性陷阱:基线词向量预训练于 MIMIC-III 全量笔记(含你的测试笔记文本)——严格做法是重训词向量排除测试集,或至少在论文里声明。

7.4 公平性分析路线

13 表型天然适合做公平性审计:join MIMIC-III PATIENTS/ADMISSIONS 表可得性别、年龄、种族、保险,逐表型跑分组性能。三个预注册级的假设:其一,语言密集型表型(Non Adherence、Chronic Pain)在不同英语水平/文化背景患者的笔记里表达方式不同,跨种族组性能差可能放大——这正是"文本标签继承临床叙事偏见"的直接检验;其二,频繁再入院队列本身是社会经济选择的结果(有保险者更可能反复入住同院),公平性结论的外推要声明队列偏差;其三,开发性迟滞(Developmental Delay)在成人 ICU 里的阳性与残疾标识的社会编码习惯相关,分组解读需临床专家参与。

7.5 LLM 评测配方:挑战基线短板

LLM 评测的靶心选三格:Adv. Lung Disease(BoW 24 / CNN 48——数值叙事推理)、Adv. Heart Disease(BoW 44——阈值+白名单双轨判定)、Non Adherence(BoW 78 逻辑虽好但定义边界多)。Prompt 骨架:

You are annotating a clinical note using official definitions.
[DEFINITIONS]
Advanced Lung Disease: FEV1 < 50% predicted, or FVC < 70%,
severe COPD (GOLD III-IV), or severe ILD.
[NOTE]
{note_text}
[TASK] For each phenotype, answer PRESENT / ABSENT / UNSURE,
and quote the exact evidence sentence. If no explicit textual
evidence exists, answer ABSENT (never infer from context).

三个设计要点来自官方协议本身:要求引用证据句(对应"显式文本证据"规则);明示"无证据即 ABSENT"(防止模型脑补);保留 UNSURE 通道(对齐标注员的求助语义,可顺便测模型自校准能力)。评分时把模型的 UNSURE 率与标注员 Kappa 低值区对照——若模型恰在人工分歧大的表型上更频繁 UNSURE,这是自校准的强证据。

7.6 弱监督校准配方(与 493 的级联)

用本语料校准自动标签工厂的三步:

  1. 构造对照集:在本语料 2,102 篇上跑你的自动标注管线(如 MetaMap + 判据),得到机器标签;
  2. 量化一致:逐表型算机器 vs 人工的混淆矩阵与 Cohen’s Kappa——Kappa 高的表型放心用自动标签,Kappa 低的表型要么修管线要么降权重;
  3. 传导修正:把对照集上学到的"机器错误模式"(如把"remote marijuana use"误判为 Substance Abuse)写成后处理过滤规则,回灌大规模自动标注流程。

这个配方的经济学意义:2,102 篇的金标准投资,撬动的是数万住院规模的弱监督语料质量提升——与 493 条目 Gamma 采样负例的逻辑互补(那边管分布,这边管正确性)。

7.7 成本与工期核算模板

如果你要在别的语料上复制这套标注,官方数据反推的账本:2,102 篇笔记 / 4 位标注员 / 约 15 个月(含培训、GUI 开发、批次等待)≈ 每人每月 35 篇的保守节奏(出院小结中位 1,417 token,精读标注)。换算你的项目:预计 N 篇笔记 → 工期 ≈ N / (35 × 标注员数) 个月,再乘 1.5 的管理系数。GUI 开发与培训各预留 1-2 个月。这个账本直接反驳"标注很便宜"的幻觉——也是为什么 493 那样的自动标签工厂在规模上不可替代。

7.8 MIMIC-III → MIMIC-IV 对齐:可行性与有损声明

MIMIC-IV 没有保留 NOTEEVENTS 的 ROW_ID,直接迁移不可能。可行路径按损耗排序:

  1. SUBJECT_ID 直连:MIMIC-III 与 MIMIC-IV 共享部分患者标识体系——同一 SUBJECT_ID 在两库中指向同一去标识患者的假设大体成立但官方未背书(需查官方文档与社区验证),文本可通过 MIMIC-IV DISCHARGE 表按患者+时间模糊匹配;
  2. 文本指纹匹配:对出院小结做归一化指纹(去空白/日期归零后的 hash),跨库匹配重复出现的文本——损耗来自文本在库间重处理的微差;
  3. 放弃文本、只迁移标签:把 2,102 篇的标签当"患者-住院级表型事实"注入 MIMIC-IV 结构化侧做弱监督。

任何一条路径都要在论文里声明损耗率与匹配失败率——这是方法学诚实性的底线。

7.9 复现包的最小内容清单

发布基于本语料的研究时,复现包应含:

  1. 划分文件(ROW_ID 或 SUBJECT_ID 列表 + 划分逻辑脚本);
  2. Unsure/分歧行处理规则的一行式声明 + 对应过滤代码;
  3. 全部超参(含随机种子)——2,102 篇的小数据对种子敏感,报多种子均值±方差;
  4. 文本抽取日期与 MIMIC-III 版本号(v1.4);
  5. 环境锁定(requirements.txt / conda env);
  6. 受控合规声明:不含任何笔记原文的样例或哈希泄漏。

7.10 特征工程备忘:从 BoW 短板反推特征设计

BoW 基线的短板表型给出了特征工程路线图:Adv. Lung Disease(F1 24)需要数值比较特征(正则抽 FEV1/FVC 百分比 + 阈值判断);Chronic Neurologic Dystrophies(F1 46)需要疾病白名单词典(MS/ALS/Parkinson…的同义词表);Non Adherence 需要否定+时态组合特征("discontinued…without consulting"的模式对);Obesity 需要语境组合(BMI 数值 + 评价性措辞)。这些特征在 transformer 时代部分内化,但作为可解释基线仍值得保留——临床落地最认的恰恰是"能指出证据句"的模型。

7.11 负结果也值钱:三条已知的失败方向

社区公开讨论与论文暗示的失败方向,帮你绕路:其一,纯规则系统在精神谱系表型上崩溃——Depression 的"症状描述 vs 诊断陈述"区分靠词面无法完成(PLoS ONE 2018 概念抽取管线的系统性劣势区);其二,护理记录上直接套出院小结模型——文类效应(§6.5)导致分布漂移,不做文类适配的迁移损失巨大;其三,把 Unsure 当负例训练——标注员的犹豫被模型学成"表型的反证",在难例上性能虚高而实际泛化崩坏。这三条都可复现、可引用,是你的消融实验的现成对照组。

7.12 多表型联合建模:多任务 vs 独立分类器

官方基线用独立二元分类器(每表型一模型),这为多任务联合建模留出了明确的改进空间:13 个表型共享"叙事理解"底座(精神谱系三表型、成瘾两表型内部相关性强),多头架构 + 任务权重调优在 2,102 篇上可能比 13 个独立模型更省数据。但注意反面:小数据上多任务共享层也可能传播噪声(Kappa 低的表型拖累共享表示)——建议以独立分类器为基线、多任务为消融,逐表型报告增减。

7.13 与 492 条目的结构化侧对照实验设计

利用 492(MIMIC-IV)与本语料做"结构化 vs 文本"的表型识别对照:选结构化可覆盖的表型代理(如 Obesity ← BMI 记录、Substance Abuse ← ICD 物质相关编码)与文本才能覆盖的表型(Non Adherence、Chronic Pain),分别用结构化特征与文本特征建模,报告"结构化侧召回率"在两类表型上的落差——这是对官方 Background 那位 DKA 患者叙事的定量复刻,也是论证"NLP 不可替代"最干净的一页图表。

7.14 教学场景:四周课程包

基于本语料的研究生小课设计:第 1 周读官方 Background + 表型定义,做"定义改写练习"(把 13 条定义改写成你自己团队可执行的判据);第 2 周复现 BoW 基线(§7.2),观察文类效应;第 3 周上 CNN/LLM,挑战基线短板三格(§7.5);第 4 周做标注工程工作坊——用 Kappa 表设计"你自己的双人标注协议"并互评。结课作业即一份可投会议的方法学短文素材。选它的理由:小而完整、协议公开、失败方向已知——教学的最高境界是让学生在已知答案的地方练习提问。

7.15 监控与回归测试:把金标准搬进 CI

工程团队可以把本语料改造成部署流水线的回归测试集:每次更新文本分类服务,跑一遍 2,102 篇的表型预测,逐表型 F1 不得低于上版 -2%(或你设定的容差)。两个工程细节:笔记文本在受控环境内缓存为本地特征化结果(避免每次 join);回归报告按"表型 × 文类"二维展开,任何一格的骤降都要人工复核。这份语料 2,102 篇的体量恰好是 CI 友好的——足够覆盖行为,又能在分钟级跑完。

§8 伦理、许可与合规

8.1 PHI 与双重受控

数据含 HIPAA 定义的受保护健康信息(官方 Usage Notes 明示),且可关联回 MIMIC-III,因此受双重约束:PhysioNet credentialed 机制(CITI 课程 + DUA)+ MIMIC-III 使用条款。实操红线:文本原文不得进入公开论文、公开仓库、公开演示;衍生的 embedding、特征文件若可逆至文本,同受管制。

8.2 标注员与患者:双重伦理主体

容易被忽略的两层:患者侧——频繁再入院患者的精神健康、成瘾、社会处境被逐篇精读标注,其敏感度高于一般 EHR 二次利用,DUA 的最小必要原则在此尤其实用;标注员侧——4 位标注员 15 个月内精读数千篇 ICU 文本(含自伤、晚期癌症叙事),职业性心理负荷是现代标注工程的正式议题,官方未披露心理支持安排(当时未成惯例),今天 复制协议时应补上轮换与支持机制。

8.3 LLM 时代的合规新面

把临床文本喂给云端 LLM 是一个 DUA 合规灰色地带:PhysioNet 数据政策一般要求数据处理在受控环境内。安全做法:本地部署开源模型跑评测(vLLM + 本地权重);若必须用 API,先核 DUA 条款并优先选择有 BAA / 数据不留存承诺的服务,且在论文里披露处理路径。这条对 2026 年的 LLM 评测者是常态功课,对 2020 年的数据生产者是不可预见的——不要因此苛责协议,但要自己补齐。

8.4 地域合规的扩展提醒

与 493 条目相同的背景:美国司法部 Data Security Program(DSP,EO 14117)对"受关注国家"批量获取美国敏感个人数据(含健康数据)设定了限制,2025-04-08 起生效、2025-07-08 起执法。基于 MIMIC-III 生态的数据同样落入敏感健康数据范畴,跨境团队(含中国团队成员)参与研究时应核查机构合规部门的最新指引。本条目不构成法律意见。

8.5 引用伦理:给标注员署名

最后一条朴素伦理:这份语料的每一枚标签背后是两位临床人员 15 个月的精读劳动。引用时除了数据集 DOI,请引用 LREC 论文(标注工程的正式出处)——方法学劳动的可引用性与数据本身同等重要。

§9 常见问题(FAQ)

9.1 基础身份

Q1 这是什么数据集? MIMIC-III 临床笔记的人工表型标注语料:2,102 篇笔记 × 13 高上下文表型,双人独立标注,PhysioNet 归档(v1.20.3,DOI 10.13026/txmt-8m40)。

Q2 谁生产的? MIT Critical Data 社群,Edward T. Moseley 牵头;PhysioNet 页面署名 Moseley、Celi、Wu、Dernoncourt,LREC 论文全名单 10 人。

Q3 什么时候发布的? 2020-03-05 入驻 PhysioNet;2020-05 在 LREC 2020(马赛)正式发表方法学论文。

Q4 版本号为什么是 1.20.3? 官方未解释版本编码语义(存照 G);确认的事实:发布日期 2020-03-05,当前唯一版本 1.20.3,与 LREC 2020 同步发布。

Q5 数据集名称和论文标题为什么不一样? 数据集官方名 “Phenotype Annotations for Patient Notes in the MIMIC-III Database”,论文标题 “A Corpus for Detecting High-Context Medical Conditions…”——文献检索两套名字都要查(§0.1)。

Q6 旧名 ACTdb 是什么? 项目早期名 Annotated Clinical Texts (ACT) from MIMIC / ACTdb:works 页面 + GitHub 仓库的历史名,PLoS ONE 2018 论文的数据声明指向它。

Q7 语料规模到底多大? 1,102 出院小结 + 1,000 护理进展记录 = 2,102 篇。

Q8 患者总数是多少? 官方未公布(存照 E)。队列判据只有"单年入住 ICU >3 次"。

Q9 是开放数据吗? 页面元数据归类 Database Open Access,但实际文件访问需满足 MIMIC-III 全部访问要求——按受控数据对待(存照 D)。

Q10 有 DOI 吗? 有:10.13026/txmt-8m40;另 RRID: SCR_007345。

9.2 数据内容

Q11 每行数据长什么样? SUBJECT_ID / HADM_ID / ROW_ID / 15 列二元标签 / Operator。不含文本。

Q12 文本在哪里? MIMIC-III v1.4 NOTEEVENTS 表,用 ROW_ID join 回去(§3.2)。

Q13 13 个表型是什么? 晚期癌症、晚期心脏病、晚期肺病、酒精滥用、慢性神经性肌病、慢性疼痛(纤维肌痛)、痴呆、抑郁、发育迟缓、治疗不依从、肥胖、其他物质滥用、精神分裂症及其他精神障碍。

Q14 为什么说 15 标签又 说 13 表型? 13 真表型 + None + Unsure 两枚元标签 = 15 列。两个数都对,口径不同(§2.1、§6.11)。

Q15 None 标签是什么意思? 标注员在本篇笔记未观察到任何表型阳性证据。它不等于"患者健康"。

Q16 Unsure 标签是什么意思? 标注员对某项判定存疑、需求助资深医生的流程信号。官方未公开其最终仲裁规则(存照 I)。

Q17 两类文本的比例和长度? 出院小结 1,102 篇(中位 1,417.5 token)、护理记录 1,000 篇(中位 208 token)——篇幅差约 7 倍。

Q18 表型阳性率最高和最低的是? 最高 Depression(出院小结 24.23%,267 篇);最低 Developmental Delay(出院小结 1.27%,14 篇;护理 0.50%,5 篇)。

Q19 每篇笔记最多能标几个表型? 官方未公布各表型共现矩阵;标签是多标签设计(一笔记可多表型同时为真)。

Q20 有跨度级(span)标注吗? 没有。只有笔记级二元标签,没有 mention/span 标注。

Q21 有时间戳吗? 标注表本身不含笔记时间——NOTEEVENTS 的 CHARTDATE/CHARTTIME 需 join 获得。批次时间戳是标注流程信息,未随数据发布。

Q22 Operator 列有什么用? 记录标注员身份(4 人),可用于按标注员分析、组间对照、以及构造"分歧检测"特征。

Q23 护理记录覆盖 Nursing 还是 Nursing/other? 官方未细化(存照 F),自行 join 后用 COUNT 对账。

Q24 语言? 全部英语。

Q25 时间覆盖? 上游 MIMIC-III 患者数据 2001-2012;标注行为发生在 2015-08 至 2016-10。

9.3 标注协议

Q26 谁标注的? 4 位操作员两组:组 1 = ETM(临床研究员)& JTW;组 2 = JW & JF(住院医);资深医生 LAC/PAT/DAG 定表型定义。

Q27 每篇几人标注? 每篇由本组两人独立标注(duplicate annotation),无跨组标注。

Q28 标注员怎么培训? 先集体过若干篇笔记学习表型定义,之后独立作业。

Q29 批次机制是什么? 文本按批次分发,批次创建打时间戳,组内两人都完成后才发新批——保证同一批的两人标注时间贴近(§4.3)。

Q30 标注要什么证据? 必须有显式文本证据(explicit text),不允许凭临床常识推断;不设固定术语词典。

Q31 Kappa 全表在哪? LREC 2020 论文 Table 4:13 表型 × 2 组的 Cohen’s Kappa 全部公开(§4.6 有完整转写)。

Q32 Kappa 最高和最低是? 最高 Dementia(0.952/0.947);最低 Adv. Heart Disease 组 2(0.561)。

Q33 Kappa=1.000 的 Developmental Delay 怎么理解? 组 1 全一致,但正例极少(14 篇)——先看混淆矩阵再庆祝(§4.7)。

Q34 标注分歧怎么解决? Unsure 通道设计上指向资深医生求助,但仲裁流程细节官方未公开;二手研究主流做法是剔除分歧行(§4.4、§6.6)。

Q35 标注花了多久? 2015-08 至 2016-10,约 15 个月。

Q36 标注 GUI 是谁做的? Kai-ou Tang 与 William Labadie-Moseley(论文致谢);实现细节未公开。

Q37 可以复制这套协议吗? 可以,官方协议要素齐备;唯一必须自行补上的是 Unsure 仲裁规则(§5.7 六条清单)。

9.4 访问与获取

Q38 怎么获取? PhysioNet 注册 → CITI 课程 → 签 DUA → 申请 MIMIC-III 访问 → 同账号下载本数据集(§3.4)。

Q39 能只下标注表不要 MIMIC-III 吗? 技术上能下载,但只有文本资格者才用得起来——文本在 NOTEEVENTS 里。

Q40 MIMIC-IV 用户能直接用吗? 不能直接 join(无 ROW_ID);对齐路径与损耗见 §7.8。

Q41 AWS/BigQuery 镜像里有它吗? 官方主渠道是 PhysioNet 页面下载;第三方镜像(如 opendatalab)不提供受控标注表——别用非官方渠道。

Q42 下载后怎么验证数据完整? 五项对账:行数、列数、ROW_ID join 有效、None 语义、Unsure 占比(§3.8)。

Q43 引用格式? 三层引用链:数据集 DOI + Gehrmann 2018(官方指定)+ PhysioNet 平台(§3.6);建议补引 LREC 2020。

Q44 商业使用可以吗? 以 PhysioNet DUA 条款为准——MIMIC-III 系 DUA 一般允许研究用途并禁止再识别,商业场景请读原文并咨询合规。

9.5 建模与评测

Q45 官方有 train/test 划分吗? 没有(存照 J)。自行按患者级划分并开源(§5.2)。

Q46 官方基线是多少分? BoW+LR 与 CNN 的逐表型 F1 全表见 §6.1(CNN 全面胜出,Obesity +65 最戏剧性)。

Q47 CNN 基线的配置? 每宽度 100 filter、dropout 0.5、adadelta、word2vec(MIMIC-III 预训练)、每表型独立二元分类器(§5.4 复现码)。

Q48 卷积宽度是多少? 论文合理值为 1-4;arXiv HTML 版显示的 “11 to 44” 是排版转换错误(存照 K)。

Q49 为什么 Obesity 的 CNN F1 高达 95? 文本信号高度词汇化且组合性强——线性模型抓不住组合性,CNN 可以(§6.1)。

Q50 为什么 Adv. Lung Disease 最难? FEV1/FVC 数值散落 + 阈值读数 + "晚期"判定——纯粹的数值叙事推理(§6.1)。

Q51 Unsure 行怎么处理? 三选一并明示:剔除(主流)/ 当独立类别 / 谨慎当负例——最后一种会引入标注噪声(§6.6)。

Q52 None 行能当健康对照吗? 不能——None 只表示本笔记无表型阳性证据(§5.8 坑点 5)。

Q53 划分用什么单元? 患者级(SUBJECT_ID)最稳;笔记级会患者泄漏(§5.2)。

Q54 能做多标签单模型吗? 能,且是合理的消融方向——官方基线是每表型独立分类器(§7.12)。

Q55 词向量预训练语料包括测试笔记吗? 包括(MIMIC-III 全量)——严格做法是重训排除测试文本,或至少声明(§7.3)。

Q56 指标怎么选? AUC + F1 底线,护理子集加 PR-AUC,稀有表型报混淆矩阵(§6.4)。

Q57 可以跨论文比 F1 吗? 慎重——官方无统一划分,先核对划分协议(§6.11)。

9.6 与 MIMIC 家族的关系

Q58 和 MIMIC-III 什么关系? 衍生标注覆盖层:锚定 v1.4 NOTEEVENTS,可如 NOTEEVENTS 般 join。

Q59 和 MIMIC-IV 什么关系? 无官方对应物;MIMIC-IV-Note 的 DISCHARGE 表是文本侧现代继任,但无等效金标准表型标注(§7.8)。

Q60 和 Nosocomial Risk(493)什么关系? 标签谱系两端:这边人工金标准,那边自动标签工厂——级联使用配方见 §7.6。

Q61 和 PLoS ONE 2018 论文什么关系? 前身研究:ACT 语料(1,610 出院小结、10 表型)上的 CNN vs 概念抽取验证(§1.7)。

Q62 还有其他关联论文吗? Wu et al. 2018 IJMI “Behind the scenes”(项目幕后)、Wu et al. AMIA 2019(non-adherence 应用)(§1.7、§2.4)。

Q63 上游 MIMIC-III 还在更新吗? 进入维护态,官方建议新研究用 MIMIC-IV;本语料为静态冻结版(§6.12)。

9.7 LLM 时代专题

Q64 LLM 时代这数据集还有用吗? 更有用了:模型越强越需要干净金标准;2,102 篇恰好适合评测而非训练(§1.9)。

Q65 怎么把它变成 LLM 评测集? §5.9 五步规程:任务模板、分层抽样、对齐基线水位、报告规范、合规。

Q66 LLM 的 UNSURE 输出有意义吗? 有——对照人工 Kappa 低值区可检验模型自校准(§7.5)。

Q67 能用云端 API 跑吗? 合规灰色地带;安全做法是本地部署开源模型(§8.3)。

Q68 用它微调模型可以吗? 技术可行但浪费金标准——评测集被训练污染后价值归零;训练请回弱监督路线。

9.8 收尾杂项

Q69 最常见的三个新手错误? 把它当独立语料下载(没文本)、把 None 当健康、把 Unsure 静默当负例(§5.8)。

Q70 一句话推荐给谁? 给所有要在临床文本上做表型识别、且关心"我的模型到底有多可信"的人——这是 MIMIC 宇宙里那把最诚实的尺子。

§10 附录:存照、引文与档案

10.1 口径存照

存照 A(版本号):官方仅写 “version 1.20.3”(2020-03-05),版本编码语义无官方解释;第三方镜像出现 “1.20.03” 写法,以 PhysioNet 官方为准。

存照 B(标题双轨):数据集官方名与 LREC 论文标题不同——本条目正文以数据集官方名为纲,论文标题在引文区保留原文。

存照 C(作者双名单):PhysioNet 页面署名 4 人,LREC 论文 10 人;本条目在 INFOBOX 用页面口径,在 §1.8 给全名单。两组四操作员的缩写(ETM/JTW/JW/JF)来自论文 Methods;PhysioNet 页面把组 2 写作 “JW & JF”,论文 Kappa 表列名为 “JF & JW”——顺序差异不改变配对事实。

存照 D(访问级别):页面横幅 “Database Open Access” 与 Usage Notes 的 MIMIC-III 资格要求并存;本条目按"受控访问"执行并记录表述差异。未能直接核验 PhysioNet 侧边栏访问徽标(与 493 条目同样的抓取局限)。

存照 E(患者总数):官方数据集页面与 LREC 论文均未公布患者数;本条目不给估算。

存照 F(护理文类细分):1,000 篇护理记录在 NOTEEVENTS 的 CATEGORY 归属(Nursing vs Nursing/other)官方未细化说明。

存照 G(Unsure 仲裁):资深医生求助机制的最终裁决流程(结果是否回写、如何落定)官方未公开。

存照 H(Kappa 分组语义):Kappa 为组内配对一致性;两组标注的笔记子集不同,组间不可直接比较。

存照 I(官方划分):论文未发布 train/dev/test 划分文件;PLoS ONE 2018 亦未详述划分。

存照 J(BoW 超参):论文未详述 BoW 基线的正则与词表上限;§5.3 配方为工程默认值,注明方法学复现立场。

存照 K(卷积宽度排版疑误):ar5iv HTML 版显示 “convolution widths from 11 to 44” 与 “number of filters to 100100”;结合 Kim(2014) 架构惯例与上下文,判定为下标渲染错误(原始应为 1-4 与 100)。本条目按 1-4/100 表述并在此存照。

存照 L(二手再统计):JAMIA 2024 selective prediction 论文的 1,138 notes/563 depression 子集等数字来自搜索结果摘录,本条目未核验原文全文;引用者请以原文为准。

存照 M(共现矩阵):表型间共现统计官方未发布;"平均约 1.3 阳性/篇"为 §2.9 标注的粗算(由分布表加总推得),非官方口径。

存照 N(前身规模):PLoS ONE 2018 的 1,610 篇/10 表型为其独立语料(ACT),与本数据集(2,102 篇/13 表型)是两个规模口径,勿混用。

10.2 引文清单

  1. Moseley, E., Celi, L. A., Wu, J., & Dernoncourt, F. (2020). Phenotype Annotations for Patient Notes in the MIMIC-III Database (version 1.20.3). PhysioNet. https://doi.org/10.13026/txmt-8m40
  2. Moseley, E. T., Wu, J. T., Welt, J., Foote, J., Tyler, P. D., Grant, D. W., Carlson, E. T., Gehrmann, S., Dernoncourt, F., & Celi, L. A. (2020). A Corpus for Detecting High-Context Medical Conditions in Intensive Care Patient Notes Focusing on Frequently Readmitted Patients. Proceedings of the Twelfth Language Resources and Evaluation Conference (LREC 2020), 1362-1367. ELRA. https://aclanthology.org/2020.lrec-1.170/ (arXiv:2003.03044)
  3. Gehrmann, S., Dernoncourt, F., Li, Y., Carlson, E. T., Wu, J. T., Welt, J., Foote, J., Moseley, E. T., Grant, D. W., Tyler, P. D., & Celi, L. A. (2018). Comparing deep learning and concept extraction based methods for patient phenotyping from clinical narratives. PLoS ONE, 13(2), e0192360. https://doi.org/10.1371/journal.pone.0192360
  4. Wu, J. T., Dernoncourt, F., Gehrmann, S., Tyler, P. D., Moseley, E. T., Carlson, E. T., Grant, D. W., Li, Y., Welt, J., & Celi, L. A. (2018). Behind the scenes: A medical natural language processing project. International Journal of Medical Informatics, 112, 68-73. https://doi.org/10.1016/j.ijmedinf.2017.12.003
  5. Wu, J. T., Grant, D. W., Lakhotia, S., Tyler, P. D., Gruhl, D. F., Shivade, C., Gehrmann, S., & Celi, L. A. (2019). Identifying documented medical non-adherence from clinical notes using natural language processing. AMIA Annual Symposium Proceedings.
  6. Johnson, A. E. W., Pollard, T. J., Shen, L., Lehman, L.-w. H., Feng, M., Ghassemi, M., Moody, B., Szolovits, P., Celi, L. A., & Mark, R. G. (2016). MIMIC-III, a freely accessible critical care database. Scientific Data, 3, 160035.
  7. Pollard, T., Moody, B. E., Lehman, L., Gow, B., Fernandes, C., Xie, C., Johnson, A., Mark, R. G., & Heldt, T. (2026). PhysioNet as a global platform for biomedical research. Nature Health. https://doi.org/10.1038/s44360-026-00096-z
  8. Kansagara, D., Englander, H., Salanitro, A., et al. (2011). Risk prediction models for hospital readmission: a systematic review. JAMA, 306(15), 1688-1698.
  9. Chan, A., Chien, I., Moseley, E., et al. (2019). Deep learning algorithms to identify documentation of serious illness conversations during intensive care unit admissions. Palliative Medicine, 33(2), 187-196.
  10. Landis, J. R., & Koch, G. G. (1977). The measurement of observer agreement for categorical data. Biometrics, 33(1), 159-174.(Kappa 解释标尺的方法学参照)

10.3 系列条目关系

  • 上游:mimiciv(rid 592)——MIMIC 宇宙现代主库;本语料锚定的是其前身 MIMIC-III v1.4;
  • 平行:nosocomial-risk-mimic(rid 593)——自动标签工厂端;与本条目构成人工金标准 ↔ 自动弱监督的完整标签谱系;
  • 前身研究:PLoS ONE 2018(ACT 语料)——本条目 §1.7 的验证链条第一环;
  • 待续:MIMIC-IV 版表型标注(若官方发布,本条目需增补"现代继任"章节)。

10.4 变更日志

  • 2026-09-20:初版发布(v1.20.3 口径;基于 PhysioNet 官方页 + LREC 2020 论文 + PLoS ONE 2018 三方交叉核查;14 条存照落档)。

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集