信息速览
Phenotype Annotations for Patient Notes in the MIMIC-III Database — AI-Ready 数据集百科
一句话:这是 MIMIC-III 生态中唯一一份双人金标准表型标注语料——1,102 篇出院小结与 1,000 篇护理进展记录,来自单年入住 ICU 超过 3 次的频繁再入院患者,由两组"临床研究员 + 住院医师"配对独立标注 13 个高上下文表型(外加 None/Unsure 两枚元标签),Cohen’s Kappa 逐表型公开。它以 2,102 篇的"小"体量,定义了临床 NLP 表型识别任务的可信度下限。
INFOBOX
| 属性 | 值 |
|---|---|
| 官方名称 | Phenotype Annotations for Patient Notes in the MIMIC-III Database |
| 发布方 | PhysioNet(MIT Laboratory for Computational Physiology 生态) |
| 版本 | v1.20.3(2020-03-05 发布) |
| DOI | 10.13026/txmt-8m40 |
| RRID | SCR_007345 |
| 官方论文 | Moseley et al., LREC 2020(ACL Anthology 2020.lrec-1.170, pp. 1362-1367) |
| 前身研究 | Gehrmann et al., PLoS ONE 13(2): e0192360 (2018) |
| 语料规模 | 1,102 Discharge Summaries + 1,000 Nursing Progress Notes = 2,102 篇 |
| 队列 | MIMIC-III 中单年入住 ICU >3 次的频繁再入院患者 |
| 标签体系 | 13 高上下文表型 + None + Unsure(15 列二元标签) |
| 标注协议 | 4 操作员 2 组;每组 1 临床研究员 + 1 住院医;组内独立重复标注 |
| 标注周期 | 2015-08 至 2016-10(约 15 个月) |
| 关联机制 | SUBJECT_ID / HADM_ID / ROW_ID(MIMIC-III v1.4 NOTEEVENTS) / Operator |
| 访问级别 | 受控访问(须满足 MIMIC-III 全部访问要求;页面元数据归类为 Database Open Access,见存照 D) |
| 患者总数 | 官方未公布(存照 E) |
| 上游数据源 | MIMIC-III v1.4(NOTEEVENTS 表) |
| 任务定位 | 患者表型识别(patient phenotyping):多标签文本分类 |
| 基线 | BoW+Logistic Regression 与 CNN(F1 全表见 §6) |
| 适合任务 | 表型识别、标注协议研究、LLM 临床文本评测集构建、弱监督验证 |
§0 速览与信任声明:为什么一份 2,102 篇的小语料能撑起一篇 AI-Ready 百科条目
在动辄数十万住院、上亿数据行的 MIMIC 宇宙里,这份语料小得像个异类:2,102 篇笔记、13 个表型、4 位标注员、15 个月工期。但它的稀缺性恰恰来自"小"——因为它是这条赛道上少有的每一枚标签都能追溯到"哪两个人、按什么定义、在什么协议下打上去"的金标准语料。
三条速览结论:
- 它是"高上下文表型"这个概念的教科书示范。晚期癌症、治疗不依从、慢性疼痛这类状态,在 ICD 编码、实验室检验、用药记录里系统性缺位或失真—— diabetic ketoacidosis(糖尿病酮症酸中毒)入院的患者,结构化数据只会告诉你他"DKA 入院",不会告诉你那次入院的真实起点是停用胰岛素三周。要识别这类状态,只能读文本;要评估"读文本的算法",只能先有人工金标准。
- 它是临床 NLP 少数公开标注者间一致性全表的语料。13 个表型 × 2 组标注对的 Cohen’s Kappa 全部写在论文 Table 4 里——从 Dementia 的 0.952 到组 2 的 Adv. Heart Disease 0.561,一致性的"好"与"坏"都摆在你面前。多数临床 NLP 数据集只公布聚合一致率,这份语料把不可靠之处也公开了,这正是它作为评测基准的价值。
- 它的标签不是笔记全文,而是可 join 的索引。每行记录 SUBJECT_ID / HADM_ID / ROW_ID / 15 列二元标签 / Operator,其中 ROW_ID 直接指向 MIMIC-III v1.4 的 NOTEEVENTS 表——文本本体留在 MIMIC-III 里,标注表像一块可插拔的"金标准印章"。官方明确说:多数场景下,这张表可以像 NOTEEVENTS 表一样与 MIMIC-III 其他表 join。
0.1 条目名勘误与命名史
本条目在生产排期表中的中文名被截断为"Phenotype Annotations for Patient",官方全称为 Phenotype Annotations for Patient Notes in the MIMIC-III Database,本条目一律以官方全称为准。命名史上有三个名字:
- ACTdb / “Annotated Clinical Texts from MIMIC”:项目早期内部名,GitHub 仓库
EdwardMoseley/ACTdb与 PhysioNet works 页面 “Annotated Clinical Texts (ACT) from MIMIC” 沿用此名——Gehrmann et al. 2018 论文的数据可用性声明指向的就是这个 works 页面; - Phenotype Annotations for Patient Notes in the MIMIC-III Database:2020-03-05 正式入驻 PhysioNet 主站的官方名;
- LREC 2020 论文标题 “A Corpus for Detecting High-Context Medical Conditions in Intensive Care Patient Notes Focusing on Frequently Readmitted Patients”——注意论文标题与数据集官方名不一致,检索文献时两套名字都要查。
0.2 一分钟版本(给赶时间的管理者)
- 这是什么:一份人工双人标注的临床文本表型语料,2,102 篇笔记 × 13 表型,锚定 MIMIC-III;
- 谁做的:MIT Critical Data 社群,Edward T. Moseley 牵头,Leo Anthony Celi(MIMIC 系列创始人之一)与 Franck Dernoncourt(NLP 老兵)共同署名;
- 花了多久:2015 年 8 月至 2016 年 10 月,约 15 个月;
- 数据在哪:PhysioNet(DOI 10.13026/txmt-8m40),访问资格与 MIMIC-III 完全一致;
- 与 MIMIC-III 什么关系:不是独立数据库,是 MIMIC-III NOTEEVENTS 的标注覆盖层;
- 最大的坑:只有标注索引没有文本——你必须先拿到 MIMIC-III 资格才能用;
- 最亮的点:Cohen’s Kappa 全表公开 + 标注协议(批次/双人/独立/Unsure 语义)完整发表。
0.3 十个数字记住它
| # | 数字 | 含义 |
|---|---|---|
| 1 | 2,102 | 标注笔记总数 |
| 2 | 1,102 | 出院小结(Discharge Summaries) |
| 3 | 1,000 | 护理进展记录(Nursing Progress Notes) |
| 4 | 13 | 真表型数量 |
| 5 | 15 | 标签列数(13 表型 + None + Unsure) |
| 6 | >3 次/年 | 队列入选门槛(单年 ICU 入住次数) |
| 7 | 2 | 每篇笔记的独立标注人数 |
| 8 | 0.952 | Kappa 峰值(Dementia,ETM & JTW 组) |
| 9 | 0.561 | Kappa 谷值(Adv. Heart Disease,JF & JW 组) |
| 10 | 15 个月 | 标注工期(2015-08 ~ 2016-10) |
0.4 与同门条目的关系图谱
本条目属于 MIMIC 宇宙的"文本标注"分支,与已上线条目的互链关系:
- mimiciv(rid 592):MIMIC-III 的现代继任者。本语料锚定 MIMIC-III v1.4 的 NOTEEVENTS;MIMIC-IV 时代的对应物是 DISCHARGE 表(MIMIC-IV-Note 模块),但官方尚未发布针对 MIMIC-IV 的等效金标准表型标注——这既是迁移研究的空白,也是机会;
- nosocomial-risk-mimic(rid 593):标签谱系的另一端。493 的标签由 NLP 管线(MetaMap Lite + UMLS 判据)自动生成(间接监督),本条目的标签由人类专家逐篇判定(直接监督金标准)。两份数据集合起来正好构成"自动标签工厂 ↔ 人工金标准"的完整光谱,适合做弱监督 vs 强监督的对照实验;
- Gehrmann et al. 2018(PLoS ONE)是本语料的前身研究:用旧版 ACT 语料(1,610 篇出院小结、10 表型)证明了 CNN 优于概念抽取管线——本语料把语料扩到 2,102 篇并加入护理记录,是那次验证的"正式化续作"。
0.5 谁该用、谁不该用
该用:做表型识别模型的人(这是评测集);做标注工程的人(这是协议范本);做 LLM 临床推理评测的人(这是天然少样本评测集);做弱监督/远程监督研究的人(这是校准自动标签的金标准锚点)。
不该用:想直接下载文本跑模型的人(文本在 MIMIC-III 里,本数据集只有索引);想做大规模预训练的人(2,102 篇太小);想要 2020 年后数据的人(上游 MIMIC-III 止于 2012);不需要高上下文表型、只关心 ICD 编码能覆盖的疾病的人。
0.6 本条目的证据等级声明
本条目核心数字全部来自两处一手来源:PhysioNet 官方条目页(v1.20.3)与 Moseley et al. LREC 2020 论文(arXiv 2003.03044 与 ACL Anthology 版互核)。凡官方未公布的数字(患者总数、各表型阴性绝对数、训练/测试划分),本条目不做估算填补,一律标注"官方未公布"并写入文末存照。二手引用(如 JAMIA 2024 selective prediction 论文的再统计数字)单独标注来源等级,不与一手数字混排。
§1 背景与动机:高上下文表型为什么必须"读文本"
1.1 官方开场的那位 DKA 患者
官方 Background 用了一个精准的临床叙事:一位糖尿病患者自行停用胰岛素数周,以糖尿病酮症酸中毒(DKA)急诊入院。在结构化 EHR 里,这次入院被编码为"DKA"——诊断、检验(血糖、血气)、治疗(胰岛素滴注)一应俱全。但"入院的原因是不依从"这个信息,只存在于出院小结的叙述里。任何只基于结构化数据的回顾性研究,都会系统性地低估治疗不依从对再入院的贡献——不是轻微低估,而是结构性归零:这些事件在结构化字段里根本不存在。
这个例子定义了整份数据集的问题意识:EHR 的结构化层是为了计费与管理而生,不是为了临床叙事而生。计费字段覆盖"发生了什么",叙事文本才覆盖"为什么发生"。高上下文表型(high-context phenotypes)指的正是那批"为什么"层面的临床状态。
1.2 "高上下文"的准确定义
论文与 PhysioNet 页面反复使用 high-context 一词,其可操作定义有三层:
- 判定依赖叙述性证据:状态的存在与否需要从自由文本的措辞、时序、语境中推断,而非查一个编码;
- 无固定术语词典:论文明确"不设固定术语词典、不规定术语出现顺序"——同一状态可能有数十种表达方式,且不同作者风格迥异;
- 需要显式文本证据:标注规则要求表型存在必须有 explicit text,不允许标注员凭临床常识脑补——这是金标准语料与"印象打标"的分界线。
1.3 政策背景:再入院减免与 HRRP
官方 Background 提到"前述降低不必要再入院的倡议"(aforementioned policy initiatives),指的就是美国 2012 年 10 月启动的 Hospital Readmissions Reduction Program(HRRP)——Medicare 对再入院率超标医院实施罚款。这条政策在 2010 年代催生了整个"再入院预测"研究浪潮(官方参考文献第 3 条正是 Kansagara et al. 2011 的再入院预测系统综述)。选择"频繁再入院"人群作为标注对象,正是要把 NLP 研究对准政策最关心的患者群。
1.4 队列定义:单年 ICU 入住 >3 次
队列选择非常克制,只有一条判据:一年内入住 ICU 超过 3 次。这个定义的三重含义:
- 信息密度高:反复入 ICU 的患者,笔记数量多、病情线索密集,单位标注工时的信息产出高;
- 干预价值高:频繁再入院者正是 HRRP 政策下最需要识别干预的人群——官方原话是"以期产生可行动的情报"(actionable intelligence);
- 表型谱富集:这类患者更可能携带晚期癌症、慢性疼痛、物质滥用等高上下文状态,标注表型的阳性率更高,小语料也能撑起足够的正例。
注意:患者总数官方未公布。2,102 篇笔记来自多少位频繁再入院患者,官方语料与论文均未给出,任何二手来源的数字都应视为估算(存照 E)。
1.5 两类文本:出院小结与护理进展记录
语料的两个文类有意形成对照:
| 维度 | Discharge Summaries(1,102 篇) | Nursing Progress Notes(1,000 篇) |
|---|---|---|
| 中位字符数 | 10,156(IQR 7,443–13,831) | 1,232(IQR 723–1,810) |
| 中位 token 数 | 1,417.5(IQR 1,047–1,926) | 208(IQR 120–312) |
| 唯一 token 数(合计) | 26,454 | 12,865 |
| 信息形态 | 一次性全景叙述(病史/病程/出院医嘱) | 高频碎片化观察(班次级进展) |
| 表型阳性率 | 系统性更高(如 Depression 24.23%) | 系统性更低(如 Depression 5.40%) |
这个对照本身就是一份天然的方法学测试床:同一个模型在长文档与短文档上的表现差、同一套特征在两类文本上的迁移差,都能用这份语料量化。论文 Table 2 显示出院小结的表型阳性率普遍是护理记录的 2-5 倍——因为出院小结是医生对整个住院的总结,而护理记录只覆盖当班窗口。
1.6 为什么选这 13 个表型
官方说明表型由领域专家(共同作者 LAC、PAT、DAG)结合文献选定(论文参考文献 5-7)。选择逻辑可以归纳为四条:
- 与再入院风险相关:每一条都被认为与 ICU 再入院风险有临床关联;
- 结构化数据盲区:ICD 编码覆盖不了或覆盖得很差——治疗不依从、慢性疼痛在计费数据里几乎不可见;
- 社会与行为维度:酒精滥用、其他物质滥用、肥胖、抑郁、精神障碍——这些"社会决定因素"类表型恰恰是预测模型最难从检验单里读出的;
- 疾病晚期状态:晚期癌症、晚期心脏病、晚期肺病、痴呆——这些状态决定的是"下一次住院是否还有意义"的临床决策,而非单次住院的病程。
1.7 前身研究:Gehrmann et al. 2018 的验证链条
本语料不是凭空出现的。时间线是:
- 2015-2016:标注工程启动(与本语料同期,ACT 语料的早期版本先行);
- 2017:Gehrmann et al. 预印本(arXiv 1703.08705,“Comparing Rule-Based and Deep Learning Models for Patient Phenotyping”);
- 2018-02:PLoS ONE 正式版(13(2): e0192360)——用 1,610 篇出院小结、10 个表型比较 CNN 与概念抽取(MetaMap 类)管线:CNN 在几乎所有任务上胜出,F1 提升最高 26 个百分点、AUC 最高 7 个百分点;
- 2020-03:扩展语料(加护理记录至 2,102 篇、13 表型)以 Phenotype Annotations for Patient Notes in the MIMIC-III Database 之名正式入驻 PhysioNet;
- 2020-05:LREC 2020 论文发布(马赛,pp. 1362-1367),完整发表标注协议、Kappa 表与基线。
换句话说:PLoS ONE 2018 是"模型侧"的先行验证,LREC 2020 是"数据侧"的正式发表,PhysioNet v1.20.3 是数据的正式归档。三者构成完整证据链,引用时应各归其位。
1.8 团队与治理
PhysioNet 页面署名 4 人(Moseley、Celi、Wu、Dernoncourt),论文全名单 10 人。组织结构值得注意:
- MIT Critical Data 社群:Celi 领导的学生社群,MIMIC 系列衍生研究的主力军;
- 标注执行层:4 位操作员 = 2 位临床研究员 + 2 位住院医师(即论文中的 ETM、JTW、JW、JF);
- 表型定义层:LAC(Celi)、PAT(Tyler)、DAG(Grant)三位资深医生定义表型;
- 工程支持:Kai-ou Tang 与 William Labadie-Moseley 开发了标注 GUI;
- 资助:PLoS ONE 前身研究披露 Dernoncourt 受 Philips Research 资助、Celi 持 NIH R01 EB017205-01A1;LREC 论文与 PhysioNet 页面声明无利益冲突。
这套"资深医生定标准 → 双人配对标注 → 独立判定 → 公开一致性"的治理结构,是本语料最重要的可复用资产——比数据本身更值得抄。
1.9 为什么 2020 年的语料在 LLM 时代没有过时
三 个理由:其一,评测集的价值与模型能力正相关——模型越强,越需要难而干净的金标准来区分"背过"与"会了",2,102 篇的规模恰好适合做少样本评测而不至于被训练污染耗尽;其二,人工标签是弱监督的裁判——493 条目那类自动标签工厂,其标签质量的最终裁决者只能是人工金标准;其三,协议的可复用性——在 MIMIC-IV 时代复制这套双人标注协议的成本已经被论文完整记账,后人不必重新发明。
1.10 用户画像:四类人如何各取所需
- 模型工程师:拿标签表 + MIMIC-III 文本,复现 BoW/CNN 基线(§6.2 有逐表型 F1),然后在上面叠自己的模型;
- 标注工程负责人:抄协议——批次时间戳机制、双人独立判定、Unsure 求助语义、显式证据规则、Kappa 逐表型公开(§4 有完整解剖);
- LLM 研究者:把 2,102 篇当 zero-/few-shot 评测集,重点看 BoW/CNN 的短板表型(Adv. Lung Disease F1 48%)是否被 LLM 补齐(§7.5 有配方);
- 临床信息学家:关注"结构化数据盲区"的量化证据——13 表型在 ICD 里的系统性缺位,是论证"必须读文本"的最佳素材。
§2 医学与科学背景:13 个表型的完整解剖
2.1 标签体系的精确结构
官方标签体系是 13 真表型 + 2 元标签 = 15 列二元标签:
13 真表型(疾病/状态维度,可多选):
晚期癌症 / 晚期心脏病 / 晚期肺病 / 酒精滥用 /
慢性神经性肌病 / 慢性疼痛(纤维肌痛) / 痴呆 / 抑郁 /
发育迟缓 / 治疗不依从 / 肥胖 / 其他物质滥用 / 精神分裂症及其他精神障碍
2 元标签(元信息维度):
None(标注员未观察到任何适应证为真)
Unsure(标注员对至少一项判定存疑,需求助资深医生)
关键理解:None 与 Unsure 不是第 14、15 个疾病,而是关于标注过程本身的元信息列。None=True 意味着"13 个表型都观察到否定证据或无证据";Unsure=True 意味着"标注员承认自己的判定不可靠"。这两列在建模时如何处理,直接决定实验的合法性(§6.6 有专门讨论)。
2.2 三个"晚期"表型:疾病严重度的文本定义
晚期癌症、晚期心脏病、晚期肺病这组表型的定义展示了"如何把临床严重度写成可操作的文本判据":
- Advanced Cancer:极高死亡率的癌种——胰腺、食管、胃、胆道、间变性(anaplastic)。注意这是按癌种白名单定义的,不依赖分期字段;
- Advanced Heart Disease:EF<30%、严重心肌病、严重主动脉瓣狭窄、任何心脏移植提及(被考虑中/已列入/被拒绝均算);
- Advanced Lung Disease:FEV1<50% 正常值或 FVC<70%;重度 COPD(GOLD III-IV 期);重度间质性肺病(ILD)。
这三条定义的共同智慧:用"检验数值阈值 + 疾病白名单"双轨制,让标注员既可以在叙述里找数值(“EF 25%”),也可以直接识别病种(“transferred for transplant evaluation”)。Kappa 表显示这三条的一致性组间差异显著(Adv. Heart Disease 组 1 = 0.820 vs 组 2 = 0.561)——晚期心脏病的判定高度依赖超声报告的数值披露习惯,这正是"高上下文"的代价。
2.3 两个成瘾表型:"活跃性"的时态判定
Alcohol Abuse 与 Other Substance Abuse 的定义共用一个核心语法:时态限制。
- 酒精滥用:须为入院时活跃(active problem at the time of admission)的近期滥用史——是否入院主因均可;
- 其他物质滥用:静脉吸毒、违禁药物使用、精神活性/麻醉药意外过量;远期大麻使用不算(“Remote use of marijuana is not sufficient”)。
"remote(远期)不算"这条排除规则,把"病史采集里的一句陈年往事"与"当前临床问题"切分开。标注员必须做时态推理——"20 年前戒断"与"本次入院前仍在用"在文本上只差几个词,但判定完全相反。这是 13 个表型里语言学家最感兴趣的部分。
2.4 Non Adherence:定义最精细的一条
Non Adherence 的官方定义是 13 条里最长的,因为它必须处理大量边界情形:
- 核心定义:未经医生事先沟通,暂时或永久停止治疗(药物或就诊预约);
- 明确纳入:跳过透析预约、违反医嘱自行离院(against medical advice, AMA);
- 边界情形:患者因不良事件就诊咨询——是否构成不依从,取决于是否未经咨询就停了药:看了医生再停药 = 不是;自己直接停 = 是。
注意定义的对称性:它同时覆盖药物依从性与就诊依从性(appointments)。这个表型后来单独长出了应用论文——Wu et al. 在 AMIA 2019 发表了专门从临床笔记识别 documented medical non-adherence 的 NLP 工作,本语料就是训练/评测来源之一。
2.5 Chronic Pain Fibromyalgia:一个复合名里的临床现实
标签名是"Chronic Pain Fibromyalgia",定义却是"任何病因的慢性疼痛,需长期阿片/麻醉药物控制(含纤维肌痛)“。名字与定义的不对称是故意的:纤维肌痛是最典型的慢性疼痛标签,但临床现实里慢性疼痛的病因谱远比它宽。"需长期阿片类药物控制"是这个表型的操作性锚点——它把主观的"疼痛"转译为可验证的"长期麻醉处方”,这是把软状态写硬的典范。
2.6 精神谱系的三分法:Depression / Schizophrenia+ / 其他
13 个表型里有三条精神健康相关,边界划分非常明确:
- Depression:抑郁症的诊断、治疗、以抑郁症状(含自伤、自杀行为)入 ICU——自杀/自伤明确算入 Depression 而非精神障碍;
- Schizophrenia and other Psychiatric Disorders:DSM-5 分类下的精神障碍(精神分裂症、双相、焦虑障碍)——明文排除抑郁症;
- 没有第三个"焦虑症"独立标签——焦虑被并入 Schizophrenia and other Psychiatric Disorders。
Kappa 表显示 Depression 是一致性最好的表型之一(组 2 达 0.945),而它也是阳性率最高的表型(出院小结 24.23%)——定义清晰 + 正例充足,是金标准表型的理想形态。
2.7 Chronic Neurological Dystrophies:一张神经科白名单
定义采用白名单枚举:多发性硬化(MS)、肌萎缩侧索硬化(ALS)、肌营养不良、重症肌无力、帕金森病、癫痫、卒中/CVA 伴残留缺损、各种神经肌肉病或肌病。注意两个细节:
- “with residual deficits”——卒中本身不算,遗留神经功能缺损的卒中才算("慢性"的判据落在功能残留上);
- “Dystrophies"这个词在医学术语上并不精确(dystrophy 通常指肌营养不良),官方用它泛指"慢性神经系统的退行/损伤状态”。检索文献时不要被标签名误导。
2.8 Obesity 与 Developmental Delay:两个"提及即算"与"白名单外"的表型
- Obesity:任何把肥胖作为就诊考量提及的情况即算——但单纯腹部肥胖不算(abdominal obesity is not sufficient)。"提及即算"的低门槛 + "腹型肥胖不算"的排除,把 BMI 数值、减肥计划、麻醉风险评估里的肥胖备注都纳入了判定范围;
- Developmental Delay:先天性、遗传性、特发性发育障碍——这是 13 条里唯一面向发育而非疾病的表型,在成人 ICU 语料里阳性率最低(出院小结 1.27%,14 篇;护理记录 0.50%,5 篇)。极低阳性率使它成为极不平衡学习与 Kappa 在稀有类别下失真的天然教学案例(Developmental Delay 组 1 Kappa = 1.000——两人全一致,但正例极少时 Kappa 的解读要非常小心,§6.4 展开)。
2.9 13 表型 × 两类文本的阳性分布全景
论文 Table 2 的完整分布(阳性篇数 / 占比):
| 表型 | Discharge(/1,102) | Nursing(/1,000) |
|---|---|---|
| Adv. / Metastatic Cancer | 74 / 6.72% | 24 / 2.40% |
| Adv. Heart Disease | 172 / 15.61% | 35 / 3.50% |
| Adv. Lung Disease | 88 / 7.99% | 35 / 3.50% |
| Alcohol Abuse | 127 / 11.52% | 48 / 4.80% |
| Chronic Neurologic Dystrophies | 187 / 16.97% | 53 / 5.30% |
| Chronic Pain Fibromyalgia | 150 / 13.61% | 39 / 3.90% |
| Dementia | 43 / 3.90% | 22 / 2.20% |
| Depression | 267 / 24.23% | 54 / 5.40% |
| Developmental Delay | 14 / 1.27% | 5 / 0.50% |
| Non Adherence | 78 / 7.08% | 35 / 3.50% |
| Obesity | 72 / 6.53% | 12 / 1.20% |
| Psychiatric disorders | 167 / 15.15% | 39 / 3.90% |
| Substance Abuse | 92 / 8.35% | 20 / 2.00% |
三个可立即使用的观察:最稀有(Developmental Delay,19 篇合计)与最常见(Depression,321 篇合计)相差约 17 倍;护理记录的阳性率整体在出院小结的 1/3 左右;每篇笔记平均携带约 1.3 个真表型阳性(粗算),多标签假设成立。
2.10 表型语义学小结:三种定义模式
回看 13 条定义,全部落进三种可复用的定义模式:
- 白名单模式(Advanced Cancer / Chronic Neurological Dystrophies / Schizophrenia+):枚举判定对象,标注员做的是"匹配";
- 阈值模式(Advanced Heart Disease / Advanced Lung Disease):给出数值判据(EF<30%、FEV1<50%),标注员做的是"读数";
- 状态+时态模式(Alcohol Abuse / Other Substance Abuse / Non Adherence / Depression):定义行为状态及其时间窗,标注员做的是叙事推理。
第三种模式最难(对应 Kappa 的低值区),也是机器最难的——这正好解释了为什么 LLM 时代的评测要从这里入手。
§3 数据集规格:表结构、版本、获取
3.1 数据形态:一张"标注覆盖层"表,不是语料库本体
拿到数据后你会发现它比想象中小得多:这不是一个装满文本的语料库,而是一张索引表。每一行的官方 schema:
| 字段 | 类型 | 含义 |
|---|---|---|
| SUBJECT_ID | integer | MIMIC-III 患者标识 |
| HADM_ID | integer | MIMIC-III 住院标识 |
| ROW_ID | integer | 指向 MIMIC-III v1.4 NOTEEVENTS 表的行索引 |
| 15 个表型列 | binary | 13 真表型 + None + Unsure,各取 0/1 |
| Operator | string | 标注员标识(对应论文中的 ETM/JTW/JW/JF) |
官方原话:“For most purposes, this table can be joined to other tables in MIMIC-III as if it were the NOTEEVENTS table.”(多数场景下,这张表可以像 NOTEEVENTS 表一样与 MIMIC-III 其他表 join。)这个设计哲学后来被整个 MIMIC 衍生数据集家族继承——493 条目的 chronology 表、各种派生基准,都在用"索引层 + 上游本体"的解耦架构。
3.2 文本本体的获取路径
完整的使用闭环需要两份数据:
本数据集(标注表) MIMIC-III v1.4(NOTEEVENTS 表)
┌─────────────────┐ ┌──────────────────────────┐
│ ROW_ID | 15 标签 │ join │ ROW_ID | TEXT | CATEGORY │
│ | Operator│ ─────► │ | CHARTDATE/... │
└─────────────────┘ └──────────────────────────┘
▲ ▲
└──── 同一个 ROW_ID 命名空间 ────┘
NOTEEVENTS 表里按 CATEGORY 字段可过滤出 Discharge summary 与 Nursing/ Nursing/other 两类文本。注意一个易错点:MIMIC-III 的护理类笔记在 CATEGORY 里有 Nursing 与 Nursing/other 两个值,语料的 1,000 篇护理记录具体覆盖哪一类,官方页面未细化说明(存照 F)——用 COUNT 对账是你的第一道工序。
3.3 版本号 1.20.3 的非常规语义
PhysioNet 数据集的版本号一般是 1.0.0 → 2.0.0 式的整数递进,本数据集的 1.20.3 显得非常突兀。官方未解释版本号语义;第三方镜像(selectdataset)显示版本路径甚至被写作 1.20.03。可确认的事实只有三条:发布日期 2020-03-05;PhysioNet 页面当前唯一列出的版本即 1.20.3;发布时点与 LREC 2020 同步(官方 Release Notes 原文:“This release coincides with presentation of this data set at the Language Resources and Evaluation Conference”)。版本号的内部编码规则属于无官方解释的历史遗迹,引用时写全 1.20.3 即可(存照 G)。
3.4 获取流程:与 MIMIC-III 完全同门槛
获取步骤与 MIMIC-III 主库一致:
- 注册 PhysioNet 账号;
- 完成 CITI 课程(“Data or Specimens Only Research”);
- 签署数据使用协议(DUA);
- 提交 MIMIC-III 访问申请并通过;
- 在同一账号下访问本数据集页面下载标注表。
官方 Usage Notes 的原话逻辑:数据包含 PHI(HIPAA 1996 定义),且可关联回 MIMIC-III,因此访问者必须满足 MIMIC-III 的全部要求。不存在"只要这份标注表、不要 MIMIC-III"的快捷通道——这也再次印证它是上游数据库的衍生覆盖层。
3.5 页面元数据 “Database Open Access” 与实际受控访问的落差
一个需要存照的细节:PhysioNet 页面横幅把该资源归类为 “Database Open Access”(第三方资源列表同样显示此分类),但 Usage Notes 明确要求 MIMIC-III 访问资格。两者的合理解释:横幅分类描述的是资源类型学(Database 类别、开放获取数据集家族的登记属性),而实际文件访问受 PhysioNet credentialed 机制保护。给使用者的结论只有一个:把它当受控数据对待——不要在论文里贴笔记原文,不要在公开仓库分发 join 出来的文本(存照 D)。
3.6 引用方式与引用链
官方要求的三层引用链:
- 数据集本体:Moseley, E., Celi, L. A., Wu, J., & Dernoncourt, F. (2020). Phenotype Annotations for Patient Notes in the MIMIC-III Database (version 1.20.3). PhysioNet. DOI 10.13026/txmt-8m40. RRID: SCR_007345;
- 原始论文:Gehrmann S, Dernoncourt F, Li Y, et al. (2018) Comparing deep learning and concept extraction based methods for patient phenotyping from clinical narratives. PLoS ONE 13(2): e0192360;
- PhysioNet 平台:Pollard, T., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health. DOI 10.1038/s44360-026-00096-z。
补充建议(本条目立场):如果你使用标注协议或 Kappa 数据,还应引用 Moseley et al. LREC 2020(ACL Anthology 2020.lrec-1.170, pp. 1362-1367)——那是标注工程的正式方法学出处。
3.7 与上游 MIMIC-III 的版本锚定细节
标注表锚定 MIMIC-III v1.4 的 NOTEEVENTS。这意味着:
- ROW_ID 在 v1.4 内稳定;若你使用的是 v1.4 之前的旧版快照,ROW_ID 对不上是常态而非 bug;
- MIMIC-III 于 2012 年患者截止后进入维护态(mimic.physionet.org 官方建议新研究转向 MIMIC-IV),本数据集的上游文本池不会再增长;
- MIMIC-IV 的 NOTEEVENTS 被 DISCHARGE / RADIOLOGY / 输入输出的新表结构取代,ROW_ID 语义不复存在——把本标注表映射到 MIMIC-IV 需要经过 SUBJECT_ID × 时间的模糊对齐(有损,需自担方法学风险,§7.8 展开)。
3.8 数据完整性对账清单
下载后第一小时应该做的五件对账事:
- 行数:Discharge 与 Nursing 两类合计应为 2,102 行(按 Operator 分组统计可看到 4 位标注员的分布);
- 标签列数:应为 15 列二元 + 1 列 Operator + 3 列 ID = 19 列左右(以实际文件头为准);
- ROW_ID 有效性:抽样 join MIMIC-III NOTEEVENTS,验证文本类别字段与预期文类一致;
- None 列语义抽查:None=1 的行,13 个表型列应全为 0(如不一致,先查 None 的确切语义再建模);
- Unsure 覆盖率:统计 Unsure=1 的行占比——它决定你的"可用金标准"规模(§6.6)。
3.9 官方文件导航
PhysioNet 页面文件区的组织较为简洁:核心就是标注表(CSV 式结构),另附许可证、引用文件、版本说明。没有单独的"代码包"或"基线脚本"——基线模型的实现细节在 LREC 论文 §7 里,代码层面的前身资源在 GitHub sebastianGehrmann/phenotyping(PLoS ONE 2018 论文的配套代码)与 EdwardMoseley/ACTdb(项目早期仓库,需满足同样访问资格)。不排除部分历史仓库已不活跃——以论文文本为准,仓库仅作参考。
3.10 机器可读元数据速查(AI-Ready 属性)
| 属性 | 值 |
|---|---|
| 文本语言 | 英语(官方:all in the English language) |
| 单位/医院 | Beth Israel Deaconess Medical Center(波士顿三级医院) |
| 时间覆盖 | 上游 MIMIC-III:2001-2012 |
| 标注覆盖 | 2015-08 ~ 2016-10(标注行为的时间) |
| 任务类型 | 多标签文本分类(multi-label, multi-class) |
| 标签粒度 | 笔记级(note-level),非跨度级(无 span/mention 标注) |
| 每篇标注人数 | 2(组内独立) |
| 标签格式 | 每表型一列二元值 |
| 文本本体位置 | MIMIC-III v1.4 NOTEEVENTS(通过 ROW_ID) |
| 官方评测协议 | 无官方 train/test 划分(论文未发布划分文件) |
§3.11 DAIMS 数据AI就绪度评估
按本系列 DAIMS(Data AI-Readiness Maturity Score)八个维度打分(每项 0-1 分,总分 8):
| 维度 | 得分 | 评语 |
|---|---|---|
| 文档完备性 | 1.0 | 官方页面 + LREC 论文把定义、协议、一致性全部写透 |
| 机器可读性 | 0.8 | 结构化标注表 + 稳定 schema;扣 0.2 因列名非自描述(15 列二元需对照文档) |
| 标签质量透明度 | 1.0 | Cohen’s Kappa 全表公开——医疗 NLP 语料里的满分样本 |
| 可访问性 | 0.6 | 受控访问合理但门槛完整套用 MIMIC-III 流程;无文本本体(需 join) |
| 许可清晰度 | 0.8 | PhysioNet DUA 明确;"Database Open Access"分类与实际受控的表述落差扣分 |
| 格式标准化 | 0.9 | CSV 式索引表 + 外键锚定上游,标准关系型范式;无官方 JSON Schema 扣分 |
| 评测协议完备性 | 0.5 | 官方基线给了水位,但无 train/test 划分文件、无评测脚本发布 |
| 生态可持续性 | 0.9 | PhysioNet 永久 DOI + RRID;上游 MIMIC-III 进入维护态扣分 |
| 合计 | 6.5 / 8 | 协议与透明度满分型选手;可访问性与评测协议是主要失分点 |
与同批条目对照:mimiciv(492)约 7.2(体量与模块化满分,但标注稀缺)、nosocomial-risk-mimic(493)7.8(评测协议完备)。本条目的画像相反——不是靠规模与管线取胜,而是靠"每一枚标签可追溯"的审计级透明度取胜。6.5 分的短板(无划分、需 join)恰好都是"金标准语料"这一物种的天性,而非工程疏漏。
最后一条值得停留三秒:官方没有发布 train/dev/test 划分。PLoS ONE 与 LREC 论文都未给出划分细节。这意味着所有论文间的 F1 数字严格来说不可直接比较——除非划分协议一致。你若要发布基准结果,必须自报划分并开源(§5.2 的协议建议)。
§4 数据结构:标注工程的全链路
4.1 组织拓扑:两组、四人、两职业
标注力量的组织拓扑:
表型定义层:LAC (Celi) + PAT (Tyler) + DAG (Grant) ← 资深医生定标准
│
┌─────────────┴─────────────┐
Group 1 Group 2
ETM (临床研究员) ↔ JTW JW ↔ JF (住院医)
[Edward T. Moseley] [Joy Wu] [John Foote Jr.]
│
各自独立标注同批笔记
│
Cohen's Kappa 双组全表公开
组 1(PhysioNet 页面写法:ETM & JTW)与组 2(JW & JF)各自内部配对;论文 Kappa 表的列名则写作 “ETM & JTW” 与 “JF & JW”——没有跨组标注同一篇笔记(一篇笔记由本组两人重复标注),因此 Kappa 是组内一致性,两组之间不可直接比较样本集合(存照 H)。
4.2 职业配对的设计意图
每组固定为"1 临床研究员 + 1 住院医"的跨职业配对,官方给出的理由是让分歧可见(facilitate annotation of notes in duplicate, allowing for cases of disagreement between operators)。这背后是一个标注工程的老命题:同职业配对(两个住院医)会共享训练偏见,分歧被系统性压低,Kappa 虚高;跨职业配对暴露的是"职业视角差",Kappa 更真实但偏低。本语料选择了后者——Kappa 表里那些 0.56-0.70 的中低值,部分就是职业视角差的诚实记录。
4.3 批次流水线:时间戳同步机制
标注按批次推进,机制是论文原话可以完全复原的:
- 临床文本被切成批次(batches),每个批次创建当日打时间戳;
- 批次分发给组内两人;
- 两人独立标注(“instructed to work independently”)——不交流、不互相看结果;
- 两人都完成当前批次后,系统才创建并下发新批次(“when both operators in a team completed annotation of a batch, a new batch was created and transferred to them”)。
第 4 条是这个流水线最精妙的一环:它保证了同一批次的两人标注在时间上贴近,防止"三个月前的我"与"今天 的我"因标准漂移产生伪分歧;同时批次粒度的一致性让 Kappa 的计算窗口均匀。这个机制对任何要做双人标注的团队都值得照抄。
4.4 Unsure 标签:求助机制而非弃权机制
Unsure 的官方语义:标注员希望向更资深的医生寻求帮助以判定某表型是否存在(“the label ‘unsure’ was used to indicate that an operator would like to seek assistance determining the presence of a phenotype from a more senior physician”)。
两个推论:
- Unsure 是流程信号而非数据缺陷——它把"我不确定"变成一条可管理的工单;
- 官方未公布裁决流程的细节:资深医生的仲裁结果是否回写、Unsure 行最终如何落定,论文与 PhysioNet 页面都没有说明(存照 I)。二手研究(如 JAMIA 2024 selective prediction 工作)的做法是直接剔除分歧与不确定的行——depression 分析从全量里保留 563 篇可用(其中 136 篇阳性)。这是当前文献里的主流处理,但你必须在自己的论文里明示处理方式。
4.5 判定规则的三条硬约束
从论文 Methods 与数据描述里提炼的标注硬约束:
- 显式文本证据:表型为真的前提是笔记中有 explicit text 支持,不允许基于临床常识的推断打标;
- 无词典约束:不存在"出现某词即判阳"的固定词典,也不规定术语出现顺序——标注员面对的是语义而非字面;
- 定义优先:13 条官方定义(§2.2-2.8 逐条解剖)是唯一判定依据,标注培训就是集体过笔记学习这些定义。
这三条约束共同保证了标注的可辩护性:任何一枚阳性标签都能指回一段文本证据 + 一条定义条款。
4.6 Kappa 全表:一致性的诚实档案
论文 Table 4 的 Cohen’s Kappa(组 1 = ETM & JTW;组 2 = JF & JW):
| 表型 | 组 1 | 组 2 |
|---|---|---|
| Adv. / Metastatic Cancer | 0.834 | 0.869 |
| Adv. Heart Disease | 0.820 | 0.561 |
| Adv. Lung Disease | 0.805 | 0.654 |
| Alcohol Abuse | 0.856 | 0.842 |
| Chronic Neurologic Dystrophies | 0.714 | 0.700 |
| Chronic Pain Fibromyalgia | 0.833 | 0.731 |
| Dementia | 0.952 | 0.947 |
| Depression | 0.853 | 0.945 |
| Developmental Delay | 1.000 | 0.869 |
| Non Adherence | 0.778 | 0.694 |
| Obesity | 0.941 | 0.968 |
| Psychiatric disorders | 0.908 | 0.940 |
| Substance Abuse | 0.862 | 0.882 |
读表四法:
- 天花板:Dementia 双组 0.94+——诊断性词汇在文本里高度显式,两人几乎没有分歧空间;
- 地板:组 2 的 Adv. Heart Disease 0.561、Adv. Lung Disease 0.654——"晚期"的判定依赖检验数值在文本中的披露习惯,主观空间大;
- 双组差异:Developmental Delay(1.000 vs 0.869)与 Depression(0.853 vs 0.945)方向相反——组间差异既可能来自样本子集不同,也可能来自职业配对的视角差,不可归因于单因素;
- 均值水平:双组 26 个 Kappa 值绝大多数落在 0.7-0.9 区间,按 Landis-Koch 标准属"substantial to almost perfect"——作为金标准语料是合格的,但不是完美的。
4.7 Kappa 在稀有类别下的失真:Developmental Delay 的 1.000
组 1 的 Developmental Delay Kappa = 1.000 需要特别小心地读:该表型在出院小结里只有 14 篇阳性(1.27%)。当正例极稀少时,两位标注员"全对齐"很可能只是"都判了否定"——Kappa 的偶然一致性校正在这种情况下可能给出反直觉的高值(或低值)。这是一个教科书级的方法学提醒:看到 Kappa = 1.0,第一反应应是查混淆矩阵,而不是庆祝。
4.8 数据血缘:从床旁到标注表的五跳
完整血缘链:
病床旁叙述(BIDMC ICU,2001-2012)
→ EHR 文本系统(护理记录 + 出院小结)
→ MIMIC-III v1.4 NOTEEVENTS(去标识化,ROW_ID 分配)
→ 频繁再入院队列筛选(单年 ICU 入住 >3 次)
→ 2,102 篇笔记批次化
→ 双人独立标注(2015-08 ~ 2016-10)
→ 标注表(本数据集 v1.20.3,2020-03-05 归档)
每一跳都有可核查的锚点:上游是 MIMIC-III 官方论文(Johnson et al. 2016, Scientific Data 3:160035),队列判据是官方 Background 原文,标注协议是 LREC 论文 Methods,归档是 PhysioNet DOI。没有一跳是黑箱——这是它区别于多数"标注数据集"的结构性优势。
4.9 标注 GUI 与工具链
论文致谢记录了工具链的存在:Kai-ou Tang 与 William Labadie-Moseley 开发了文本标注图形界面(graphical user interface for text annotation)。GUI 的截图与实现细节未公开,但可以推断批次时间戳同步机制(§4.3)正是由这套工具承载的。对今天 的标注平台(Label Studio、doccano 等)使用者,值得抄的不是 GUI 本身,而是三个功能需求:批次时间戳、双人完成度门控、Unsure 一键求助。
4.10 与 493 条目自动标签工厂的结构对照
把本条目与 nosocomial-risk-mimic(493)并排,可以看到标签生产的两种工业形态:
| 维度 | 本条目(人工金标准) | 493(自动标签工厂) |
|---|---|---|
| 标签来源 | 4 位人类专家逐篇判定 | NLP 管线 + UMLS 判据自动生成 |
| 规模 | 2,102 篇笔记 | 数万住院的快照序列 |
| 成本 | 15 个月 × 4 人 + GUI 开发 | 算力 + 管线调参 |
| 一致性度量 | Cohen’s Kappa 全表公开 | 管线确定性可复现 |
| 偏差类型 | 标注员主观性、职业视角差 | 判据覆盖偏差、NLP 抽取误差 |
| 适用 | 评测、校准、少样本 | 大规模弱监督训练 |
两者的正确关系不是替代而是级联:自动工厂产训练标签,人工金标准做裁判与校准锚点。这条级联路线是当前医疗 NLP 的主流工程实践。
§5 下游分析协议:从获取到发布结果的完整规程
5.1 环境准备与数据装载
最小可用环境:
# 前提:已获 MIMIC-III 访问资格,已下载 MIMIC-III v1.4 与本标注表
# 场景 A:PostgreSQL(与 MIMIC-III 官方装载一致)
psql -U postgres -d mimiciii -c "
CREATE TABLE phenotype_annotations (
subject_id INT, hadm_id INT, row_id INT PRIMARY KEY,
advanced_cancer INT, advanced_heart_disease INT, advanced_lung_disease INT,
alcohol_abuse INT, chronic_neurological_dystrophies INT,
chronic_pain_fibromyalgia INT, dementia INT, depression INT,
developmental_delay INT, non_adherence INT, obesity INT,
other_substance_abuse INT, schizophrenia_psychiatric INT,
none_label INT, unsure_label INT,
operator TEXT);"
# 实际列名以官方文件头为准——上列为语义示意
装载后先跑 §3.8 的五项对账,再进入建模。
5.2 评测协议建议:把"无官方划分"变成你的加分项
官方未发布 train/dev/test 划分,你的实验设计应该主动补上这个空档:
- 划分单元用 ROW_ID(笔记级),不要用 SUBJECT_ID 混划——同一患者的多篇笔记若跨 train/test,会造成患者级泄漏;
- 更稳妥:患者级划分(按 SUBJECT_ID 分组抽样),并报告患者数;
- 处理 Unsure 与分歧行时三选一并明示:剔除(文献主流)/ 当负例(危险,会引入标注噪声)/ 当独立类别(只用于标注研究);
- 每表型报 AUC + F1 + 灵敏度/特异度全组,参照 LREC 论文 Table 5 的逐表型格式;
- 开源你的划分文件(受控数据下开源"ID 列表"通常合规,需查 DUA)——这是对这个基准最大的社区贡献。
5.3 复现官方基线:BoW + Logistic Regression
LREC 论文基线一:词袋 + 逻辑回归。复现配方:
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import f1_score, roc_auc_score
vec = CountVectorizer(max_features=30000, stop_words=None, lowercase=True)
X_tr = vec.fit_transform(texts_train) # texts 来自 NOTEEVENTS join
clf = LogisticRegression(max_iter=1000, C=1.0)
clf.fit(X_tr, labels_train["depression"])
pred = clf.predict(X_te); proba = clf.predict_proba(X_te)[:, 1]
print(f1_score(labels_test["depression"], pred), roc_auc_score(labels_test["depression"], proba))
# 参照水位:Depression F1≈58(BoW),划分不同会有出入——务必自报划分
要点:论文未详述正则与词表上限(存照 J),上面的超参是工程默认值——你的目标是方法学复现而非数字复刻,逐表型的相对难度排序才是可迁移的结论。
5.4 复现官方基线:CNN
LREC 论文基线二:CNN 文本分类器(Kim 式架构的医学版)。论文披露的配置:每卷积宽度 100 个 filter、dropout 0.5、adadelta 优化、word2vec 词向量预训练于 MIMIC-III 全量笔记、任务按"每表型一个独立二元分类器"组织。注意 arXiv/ar5iv 页面显示的卷积宽度 “11 to 44” 是排版转换错误,原始合理值为 1-4(存照 K)。PyTorch 骨架:
import torch, torch.nn as nn
class TextCNN(nn.Module):
def __init__(self, vocab, emb_dim=300, n_filters=100, ks=(1,2,3,4)):
super().__init__()
self.emb = nn.Embedding(vocab, emb_dim) # 可换预训练 word2vec
self.convs = nn.ModuleList(
[nn.Conv1d(emb_dim, n_filters, k) for k in ks])
self.drop = nn.Dropout(0.5) # 论文值
self.fc = nn.Linear(n_filters * len(ks), 1)
def forward(self, x):
e = self.emb(x).transpose(1, 2)
h = [torch.relu(c(e)).max(dim=2).values for c in self.convs]
return self.fc(self.drop(torch.cat(h, dim=1))).squeeze(1)
# 优化器 adadelta;每表型独立训练;护理/出院小结分层报告
5.5 前身论文(PLoS ONE 2018)的实验设计要点
若要引用"CNN 优于概念抽取"的结论,需引用 Gehrmann et al. 2018 并注意其实验设定:
- 语料:旧版 ACT 语料,1,610 篇出院小结、10 个表型(比本语料少护理记录、少 3 个表型);
- 对照:概念抽取(医学概念词典/抽取管线特征)vs CNN;
- 结论强度:CNN 在几乎所有任务上胜出,F1 最高提升 26 个百分点、AUC 最高提升 7 个百分点;
- 配套:代码开源在 github.com/sebastianGehrmann/phenotyping;
- 可解释性:论文同时给出了从 CNN 提取"最显著短语"(salient phrases)的方法与评估——这是医疗 CNN 可解释性的早期代表作。
注意:PLoS ONE 论文的 10 表型与本语料的 13 表型不一一对应,跨论文比较表型数字时要核对表型清单。
5.6 与 MIMIC-III 的 join 实操
三个高频 join 场景:
-- 场景 1:取回标注笔记全文(核心场景)
SELECT pa.row_id, ne.category, ne.chartdate, ne.text,
pa.depression, pa.non_adherence, pa.operator
FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id)
WHERE pa.depression = 1;
-- 场景 2:补患者人口学(公平性分析用)
SELECT pa.*, pat.gender, pat.anchor_age
FROM phenotype_annotations pa
JOIN patients pat USING (subject_id); -- MIMIC-III 为 dob/性别字段,语义自查文档
-- 场景 3:核查文类分布
SELECT ne.category, COUNT(*) FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id) GROUP BY ne.category;
场景 3 是对账关键:输出应能对上 1,102 出院小结 / 1,000 护理记录的规模——若护理类分裂成 Nursing 与 Nursing/other 两行,合计仍应为 1,000。
5.7 标注协议复用规程:把这套方法搬到你的数据
若你要在 MIMIC-IV 或本院数据上复制这套标注协议,按此清单执行:
- 定义先行:把每个表型写成"白名单/阈值/状态+时态"三模式之一(§2.10),每条定义附正例反例;
- 配对:跨职业配对(临床研究员 × 住院医),每组 2 人,组内独立;
- 批次门控:批次创建打时间戳,双人完成后才发新批;
- Unsure 通道:允许一键求助,但预先公布仲裁规则(这是官方协议未公开的部分,你必须补上,存照 I);
- 一致性公开:逐表型、逐配对报 Cohen’s Kappa,稀有类别附混淆矩阵;
- 样本量核算:2,102 篇 × 15 个月 × 4 人 ≈ 每人每小时约 0.5-1 篇出院小结的节奏(含培训与质检)——用它反推你的工期。
5.8 常见错误用法黑名单
- 把 2,102 当训练集上限抱怨——它从来不是为大规模训练设计的,训练请回 493 式自动标签或弱监督;
- 把 None 列当"健康"标签——None 只表示"本笔记无任何表型阳性证据",患者仍可能病情危重;
- 把 Unsure 行静默混入负例——这是把标注员的不确定性伪装成临床事实;
- 跨论文直接比 F1——官方无统一划分,先核对划分协议;
- 用本语料训练、用同一语料调参再报结果——2,102 篇经不起这种过拟合,评测集必须与调参集分离;
- 在公开渠道分发 join 出的文本——受控数据红线,见 §8。
5.9 LLM 时代的评测集转换规程
把本语料改造成 LLM zero-/few-shot 评测集的步骤:
- 构造任务模板:输入笔记全文(受控环境内),输出 13 个表型的二元判断(可加 None/Unsure 通道观察模型自校准);
- 抽样策略:全量 2,102 篇若成本过高,建议分层抽样——按表型 × 文类 × Operator 分层,保住稀有表型(Developmental Delay 全量仅 19 篇,别再抽了,全上);
- 评测指标:逐表型 F1/AUC 对齐 BoW/CNN 基线水位(§6.2),重点考察基线短板(Adv. Lung Disease F1 48%)是否被补齐;
- 报告规范:标注数据版本(1.20.3)、文本抽取日期、prompt 全文、解码参数——LLM 评测的可复现性全靠这些细节;
- 合规:全程在受控环境内运行,笔记原文与输出中含 PH信息的内容不得外泄(§8.3)。
5.10 与 492/493 条目的联合使用路线
三条已验证的联合路线:
- 492 + 本条目:MIMIC-IV 时代做"结构化 vs 文本"的表型识别对照——结构化侧用 MIMIC-IV 四链数据,文本侧用本标注表(需解决 MIMIC-III→IV 患者对齐问题,§7.8);
- 493 + 本条目:弱监督校准——用 493 的自动标签大规模训练,用本语料的金标准子集校准阈值与过滤层;
- 三者:完整的"训练(493)→ 评测(本条目)→ 扩展(492 结构化侧)"流水线,是 MIMIC 宇宙内最经济的完整实验矩阵。
§6 实证结果与方法学分析
6.1 基线性能全景:BoW vs CNN
LREC 2020 论文 Table 5 的完整基线(F1,%):
| 表型 | BoW + LR | CNN | 差值 |
|---|---|---|---|
| Adv. / Metastatic Cancer | 56 | 74 | +18 |
| Adv. Heart Disease | 44 | 75 | +31 |
| Adv. Lung Disease | 24 | 48 | +24 |
| Alcohol Abuse | 67 | 76 | +9 |
| Chronic Neurologic Dystrophies | 46 | 69 | +23 |
| Chronic Pain Fibromyalgia | 41 | 49 | +8 |
| Depression | 58 | 84 | +26 |
| Obesity | 30 | 95 | +65 |
| Psychiatric disorders | 50 | 83 | +33 |
| Substance Abuse | 56 | 75 | +19 |
三段式解读:
- CNN 全面胜出,10 个表型无一例外——这与前身 PLoS ONE 2018 论文(CNN 胜概念抽取)的结论在更严格的 BoW 对照下复现;
- Obesity 的 +65 是全表最戏剧性的一格:BoW 只有 30,CNN 到 95。合理解释是肥胖的文本信号高度词汇化(“obesity”、“BMI 45”、“morbidly obese”),但词面与标签的映射需要组合特征(提及语境),线性模型抓不住组合性;
- Adv. Lung Disease 双双垫底(24/48):FEV1/FVC 数值散落在肺功能报告的碎片行文里,且"晚期"阈值判定要求读数比较——这是纯粹的数值叙事推理,也是今天 LLM 最值得挑战的一格。
6.2 基线的两个技术细节
论文披露的 CNN 配置(§5.4 已给复现码)之外,两个容易被忽略的细节:其一,任务组织是每表型一个独立二元分类器——不是 13 头多任务单模型;这意味着 13 个模型各自训练、各自调参,表型间的性能差部分来自训练动态差而非任务难度差。其二,词向量预训练语料是 MIMIC-III 全量笔记(论文写 “all the notes of MIMIC III v3”)——基线享受了上游语料库的红利,这点在解读"小语料大性能"时必须记得。
6.3 一致性 × 难度的联合矩阵
把 Kappa(§4.6)与基线 F1(§6.1)并排,得到一张罕见的"标注质量 × 模型难度"联合视图:
| 象限 | 表型例 | 解读 |
|---|---|---|
| 高 Kappa + 高 F1 | Obesity、Dementia、Depression | 定义清晰 + 信号显式——金标准区的"舒适表型" |
| 高 Kappa + 低 F1 | Chronic Neurologic Dystrophies(0.714/0.700,BoW 46) | 人能稳定判,词袋判不动——语义组合性的价值区 |
| 低 Kappa + 高 F1 | Adv. Heart Disease 组 2(0.561,CNN 75) | 令人警惕:模型在不太一致的标签上跑出高 F1——过拟合标注员偏见的可能 |
| 低 Kappa + 低 F1 | Adv. Lung Disease | 定义模糊 + 信号隐性——真正的硬骨头 |
第四象限才是未来工作的主战场;第三象限是方法学论文最爱讨论的"模型 vs 标注员谁更稳"的哲学区。
6.4 分布失衡与指标的适配
阳性分布(§2.9)决定了指标选择的纪律:
- Developmental Delay(合计 19 篇阳性)上任何单点指标都是统计噪声——请报全混淆矩阵或干脆并入"稀有组"讨论;
- Nursing 子集的阳性率普遍 <6%,Accuracy 在这里毫无意义(全判负即可 94%+)——AUC 与 PR-AUC 是底线配置;
- 与 493 条目的 HAPI/HAAKI 队列对照:那边是"人卫工程造平衡",这边是"自然人群分布"——两份数据集合起来正好教学生"分布偏移对表型模型的影响"。
6.5 文类效应:同一表型在两类文本上的性能差
论文未按文类分层报告基线(官方只有聚合数字),但分布表已经预示:出院小结的阳性率是护理记录的 2-5 倍,且出院小结篇幅是护理记录的 7 倍(1,417 vs 208 token)。可以预期:
- 长文本里信号更全(医生写总结时会回顾整个病程),单篇判定更容易;
- 护理记录的碎片化要求模型从"当日观察"里推断"持续状态"——时态推理压力更大;
- 混合训练时若不按文类分层抽样,模型会向出院小结的分布倾斜。
这是本语料作为方法学测试床最独特的资产:同一患者群、同一标注协议、两类文本——文类效应的对照实验条件天然成立。
6.6 None 与 Unsure 的建模语义学
官方未给建模指令,主流处理及其代价:
- 剔除分歧行(双人标签冲突的行)与 Unsure 行:JAMIA 2024 selective prediction 研究对 depression 任务剔除后剩 563 篇(136 阳性)。代价:样本缩水 + 引入"难例被系统性移除"的选择偏差——恰好是 selective prediction 研究想研究的现象,普通建模要警惕;
- None 当全负例:合法,但要记得 None=1 的患者未必健康(§5.8);
- 把"标注员间分歧"当不确定性标签:这是本语料独有的机会——双人标签 + 独立标注给了你天然的 aleatoric uncertainty 度量,可以做"标签噪声感知"的学习(confident learning、noise-robust loss 的天然试验田)。
6.7 二手引用的再统计:JAMIA 2024 selective prediction 论文
一篇 JAMIA 2024 的 selective prediction 研究对本语料做了再统计:1,138 unique notes / 1,138 unique patients(筛选自 59,652 篇笔记池),depression 任务剔除分歧/不确定后 563 篇可用、136 篇阳性(24%),自行划分为 112 dev / 451 test。这组数字的用途与警告:它展示了社区实际使用本语料的方式(大幅筛选 + 自建划分),但该论文身份与口径本条目未做一手核验(存照 L),引用时请以原文为准,不要从本条目转引具体数字。
6.8 八个必知的坑(坑点 1-8)
坑点 1:只有索引没有文本。本数据集不含笔记正文——必须先拿 MIMIC-III 资格、装 NOTEEVENTS 表才能用。把它当独立语料下载是新手第一大坑。
坑点 2:ROW_ID 锚定 MIMIC-III v1.4。旧版 MIMIC-III 快照的 ROW_ID 对不上;MIMIC-IV 根本没有 ROW_ID 语义。跨版本使用先查 §7.8 的对齐方案。
坑点 3:官方无 train/test 划分。所有跨论文 F1 比较都隐含划分协议风险——自建划分并开源,别沿用他人未公开的划分。
坑点 4:Kappa = 1.000 的陷阱。稀有表型(Developmental Delay)的全一致可能是"都判负"的假象,先看混淆矩阵再解读。
坑点 5:None ≠ 健康。None 只表示本篇笔记无表型阳性证据。用 None 行做"健康对照"会引入严重的选择偏差。
坑点 6:Unsure 的裁决规则未公开。官方没说 Unsure 行最终如何落定——别假设 Unsure=负例,也别假设它已仲裁。自己定规则、写明、开源。
坑点 7:组间 Kappa 不可直接比。两组标注的笔记子集不同、职业配对不同,组 1 与组 2 的 Kappa 差异没有单一解释因子。
坑点 8:受控数据红线。笔记文本含 PHI,join 出的原文不可公开分发——评测代码开源时用 ID 引用,别贴文本样例。
6.9 使用者自查清单
开工前逐项打勾:
- [ ] 已获 PhysioNet credentialed + MIMIC-III 资格(与 DUA 条款核对过"衍生索引表"的合规性)
- [ ] MIMIC-III v1.4 已装载且 ROW_ID 对账通过(§3.8 五项对账)
- [ ] 文类分布对上 1,102 / 1,000(§5.6 场景 3)
- [ ] None 列语义抽查无矛盾
- [ ] Unsure 行的处理规则已写入实验计划
- [ ] 划分单元是患者级(或至少报告了患者级泄漏检查)
- [ ] 指标配置:AUC + F1(+PR-AUC),稀有表型报混淆矩阵
- [ ] 引用链三层齐全:数据集 DOI + 论文 + 平台(§3.6)
- [ ] 公开物不含笔记原文(§8.3)
6.10 家族治理定位:ACT → PhysioNet 的"转正"样本
本数据集的归档路径在 MIMIC 家族里有方法论意义:它先以 works 页面(“Annotated Clinical Texts from MIMIC”)+ GitHub(ACTdb)的非正式形态服务了 PLoS ONE 2018 研究,再以正式 DOI + 完整条目页的形态入驻 PhysioNet 主站(v1.20.3)。这是"研究副产品 → 可引用基础设施"的转正样本。今天 各机构生产数据集时值得抄这个路径:先让数据在论文里产生价值,再补齐归档手续——而不是反过来等"完美归档"拖死发布。
6.11 冲突口径诊断树
当你发现不同来源的数字对不上:
数字不符?
├─ 规模类(2,102 vs 其他)
│ ├─ 对方在说 1,610?→ 那是前身 ACT 语料(PLoS ONE 2018),不是本数据集
│ ├─ 对方在说 1,138?→ 那是二手再统计的筛选结果(§6.7),非全集
│ └─ 对方在说 2,102 但文类拆分不同?→ 核对 Nursing/Nursing/other 归并口径
├─ 表型数(13 vs 15 vs 10)
│ ├─ 13 = 真表型数(官方 Methods 口径)
│ ├─ 15 = 标签列数(含 None/Unsure,官方 Data Description 口径)
│ └─ 10 = PLoS ONE 2018 前身研究的表型数(另一个语料)
├─ 版本(1.20.3 vs 1.20.03)→ 以 PhysioNet 官方 1.20.3 为准
└─ Kappa 表列名(ETM & JTW vs JW & JF 顺序)→ 以 LREC 论文 Table 4 为准
6.12 静态语料 × 活跃上游:时效性策略
本语料是静态的(2,102 篇不会再长),但上游 MIMIC 生态活跃(MIMIC-IV 迭代、LLM 评测需求增长)。三个时效性策略:其一,把它当冻结金标准——冻结正是评测集的美德,别试图"更新"它;其二,把迁移到 MIMIC-IV 的对齐研究当增量工作(有损对齐,谨慎发表);其三,关注 PhysioNet 是否发布 MIMIC-IV 版表型标注——一旦发布,本条目的"迁移空白"论述即需更新(本条目以 v1.20.3 时点为准)。
6.13 与同类标注语料的横向定位
临床 NLP 表型标注语料的多维定位:
| 语料 | 规模 | 标注者 | 表型风格 | 特点 |
|---|---|---|---|---|
| 本语料 | 2,102 笔记 | 双人×2 组 | 13 高上下文状态 | Kappa 全表公开;可 join MIMIC-III |
| i2b2/n2c2 系列任务集 | 数百-上千报告 | 多人 | 任务特定(吸烟、肥胖共病等) | 竞赛制、跨度标注 |
| 前身 ACT(PLoS ONE 2018) | 1,610 出院小结 | 双人 | 10 表型 | 本语料的直系前身 |
| 493 Nosocomial | 数万住院 | 自动管线 | 3 疾病 | 规模换质量 |
本语料的差异化生态位:MIMIC 生态内唯一同时具备"双人金标准 + Kappa 全表 + 与结构化数据库无缝 join"三个属性的表型标注集。
§7 AI 就绪指南与应用场景
7.1 四种标准喂法
- 表型分类基准(最主流):join 出文本 → 患者级划分 → 逐表型训练 → 对齐 BoW/CNN 水位;
- LLM 零样本/少样本评测:受控环境内 prompt 模型输出 13 表型判断,对照人工标签(§5.9 规程);
- 标注工程教学:拿 Kappa 表 + 协议章节做课程案例——"为什么 Obesity 的 Kappa 0.941 而 Heart Disease 组 2 只有 0.561"是最好的课堂讨论题;
- 弱监督校准锚点:用 493 式自动标签大规模训练,本语料子集校准(§7.6 配方)。
7.2 死亡线:30 分钟跑通第一个实验
# 前提:mimiciii 库已装载,phenotype_annotations 表已建
# 步骤 1:取回文本与标签(5 分钟)
psql -U postgres -d mimiciii -c "
CREATE VIEW pa_text AS
SELECT pa.*, ne.text, ne.category
FROM phenotype_annotations pa
JOIN noteevents ne USING (row_id);"
# 步骤 2:导出 Depression 二分类最小集(5 分钟)
psql -U postgres -d mimiciii -c "
COPY (
SELECT subject_id, row_id, category, depression
FROM pa_text WHERE unsure_label = 0
) TO '/tmp/depression_min.csv' CSV HEADER;"
# 步骤 3:Python 侧 BoW+LR 基线(20 分钟,患者级划分)
第一个实验别碰全部 13 表型——先跑 Depression(正例最多、Kappa 最高),打通全链路再横向铺开。
7.3 泄漏防控专项
本语料的泄漏面有三处:患者级泄漏(同患者多篇笔记跨集——按 SUBJECT_ID 分组划分即可堵住);时间泄漏(2012 年前的 MIMIC-III 数据在时间上先于 2015-2016 的标注行为,但这不构成机器学习意义上的泄漏——标签是后验知识,文本是历史数据,注意别把"标注期"误当数据期即可);划分泄漏(沿用他人未公开划分并反复调参——2,102 篇的小体量会放大这一风险,评测集必须冻结)。另有一处隐性陷阱:基线词向量预训练于 MIMIC-III 全量笔记(含你的测试笔记文本)——严格做法是重训词向量排除测试集,或至少在论文里声明。
7.4 公平性分析路线
13 表型天然适合做公平性审计:join MIMIC-III PATIENTS/ADMISSIONS 表可得性别、年龄、种族、保险,逐表型跑分组性能。三个预注册级的假设:其一,语言密集型表型(Non Adherence、Chronic Pain)在不同英语水平/文化背景患者的笔记里表达方式不同,跨种族组性能差可能放大——这正是"文本标签继承临床叙事偏见"的直接检验;其二,频繁再入院队列本身是社会经济选择的结果(有保险者更可能反复入住同院),公平性结论的外推要声明队列偏差;其三,开发性迟滞(Developmental Delay)在成人 ICU 里的阳性与残疾标识的社会编码习惯相关,分组解读需临床专家参与。
7.5 LLM 评测配方:挑战基线短板
LLM 评测的靶心选三格:Adv. Lung Disease(BoW 24 / CNN 48——数值叙事推理)、Adv. Heart Disease(BoW 44——阈值+白名单双轨判定)、Non Adherence(BoW 78 逻辑虽好但定义边界多)。Prompt 骨架:
You are annotating a clinical note using official definitions.
[DEFINITIONS]
Advanced Lung Disease: FEV1 < 50% predicted, or FVC < 70%,
severe COPD (GOLD III-IV), or severe ILD.
[NOTE]
{note_text}
[TASK] For each phenotype, answer PRESENT / ABSENT / UNSURE,
and quote the exact evidence sentence. If no explicit textual
evidence exists, answer ABSENT (never infer from context).
三个设计要点来自官方协议本身:要求引用证据句(对应"显式文本证据"规则);明示"无证据即 ABSENT"(防止模型脑补);保留 UNSURE 通道(对齐标注员的求助语义,可顺便测模型自校准能力)。评分时把模型的 UNSURE 率与标注员 Kappa 低值区对照——若模型恰在人工分歧大的表型上更频繁 UNSURE,这是自校准的强证据。
7.6 弱监督校准配方(与 493 的级联)
用本语料校准自动标签工厂的三步:
- 构造对照集:在本语料 2,102 篇上跑你的自动标注管线(如 MetaMap + 判据),得到机器标签;
- 量化一致:逐表型算机器 vs 人工的混淆矩阵与 Cohen’s Kappa——Kappa 高的表型放心用自动标签,Kappa 低的表型要么修管线要么降权重;
- 传导修正:把对照集上学到的"机器错误模式"(如把"remote marijuana use"误判为 Substance Abuse)写成后处理过滤规则,回灌大规模自动标注流程。
这个配方的经济学意义:2,102 篇的金标准投资,撬动的是数万住院规模的弱监督语料质量提升——与 493 条目 Gamma 采样负例的逻辑互补(那边管分布,这边管正确性)。
7.7 成本与工期核算模板
如果你要在别的语料上复制这套标注,官方数据反推的账本:2,102 篇笔记 / 4 位标注员 / 约 15 个月(含培训、GUI 开发、批次等待)≈ 每人每月 35 篇的保守节奏(出院小结中位 1,417 token,精读标注)。换算你的项目:预计 N 篇笔记 → 工期 ≈ N / (35 × 标注员数) 个月,再乘 1.5 的管理系数。GUI 开发与培训各预留 1-2 个月。这个账本直接反驳"标注很便宜"的幻觉——也是为什么 493 那样的自动标签工厂在规模上不可替代。
7.8 MIMIC-III → MIMIC-IV 对齐:可行性与有损声明
MIMIC-IV 没有保留 NOTEEVENTS 的 ROW_ID,直接迁移不可能。可行路径按损耗排序:
- SUBJECT_ID 直连:MIMIC-III 与 MIMIC-IV 共享部分患者标识体系——同一 SUBJECT_ID 在两库中指向同一去标识患者的假设大体成立但官方未背书(需查官方文档与社区验证),文本可通过 MIMIC-IV DISCHARGE 表按患者+时间模糊匹配;
- 文本指纹匹配:对出院小结做归一化指纹(去空白/日期归零后的 hash),跨库匹配重复出现的文本——损耗来自文本在库间重处理的微差;
- 放弃文本、只迁移标签:把 2,102 篇的标签当"患者-住院级表型事实"注入 MIMIC-IV 结构化侧做弱监督。
任何一条路径都要在论文里声明损耗率与匹配失败率——这是方法学诚实性的底线。
7.9 复现包的最小内容清单
发布基于本语料的研究时,复现包应含:
- 划分文件(ROW_ID 或 SUBJECT_ID 列表 + 划分逻辑脚本);
- Unsure/分歧行处理规则的一行式声明 + 对应过滤代码;
- 全部超参(含随机种子)——2,102 篇的小数据对种子敏感,报多种子均值±方差;
- 文本抽取日期与 MIMIC-III 版本号(v1.4);
- 环境锁定(requirements.txt / conda env);
- 受控合规声明:不含任何笔记原文的样例或哈希泄漏。
7.10 特征工程备忘:从 BoW 短板反推特征设计
BoW 基线的短板表型给出了特征工程路线图:Adv. Lung Disease(F1 24)需要数值比较特征(正则抽 FEV1/FVC 百分比 + 阈值判断);Chronic Neurologic Dystrophies(F1 46)需要疾病白名单词典(MS/ALS/Parkinson…的同义词表);Non Adherence 需要否定+时态组合特征("discontinued…without consulting"的模式对);Obesity 需要语境组合(BMI 数值 + 评价性措辞)。这些特征在 transformer 时代部分内化,但作为可解释基线仍值得保留——临床落地最认的恰恰是"能指出证据句"的模型。
7.11 负结果也值钱:三条已知的失败方向
社区公开讨论与论文暗示的失败方向,帮你绕路:其一,纯规则系统在精神谱系表型上崩溃——Depression 的"症状描述 vs 诊断陈述"区分靠词面无法完成(PLoS ONE 2018 概念抽取管线的系统性劣势区);其二,护理记录上直接套出院小结模型——文类效应(§6.5)导致分布漂移,不做文类适配的迁移损失巨大;其三,把 Unsure 当负例训练——标注员的犹豫被模型学成"表型的反证",在难例上性能虚高而实际泛化崩坏。这三条都可复现、可引用,是你的消融实验的现成对照组。
7.12 多表型联合建模:多任务 vs 独立分类器
官方基线用独立二元分类器(每表型一模型),这为多任务联合建模留出了明确的改进空间:13 个表型共享"叙事理解"底座(精神谱系三表型、成瘾两表型内部相关性强),多头架构 + 任务权重调优在 2,102 篇上可能比 13 个独立模型更省数据。但注意反面:小数据上多任务共享层也可能传播噪声(Kappa 低的表型拖累共享表示)——建议以独立分类器为基线、多任务为消融,逐表型报告增减。
7.13 与 492 条目的结构化侧对照实验设计
利用 492(MIMIC-IV)与本语料做"结构化 vs 文本"的表型识别对照:选结构化可覆盖的表型代理(如 Obesity ← BMI 记录、Substance Abuse ← ICD 物质相关编码)与文本才能覆盖的表型(Non Adherence、Chronic Pain),分别用结构化特征与文本特征建模,报告"结构化侧召回率"在两类表型上的落差——这是对官方 Background 那位 DKA 患者叙事的定量复刻,也是论证"NLP 不可替代"最干净的一页图表。
7.14 教学场景:四周课程包
基于本语料的研究生小课设计:第 1 周读官方 Background + 表型定义,做"定义改写练习"(把 13 条定义改写成你自己团队可执行的判据);第 2 周复现 BoW 基线(§7.2),观察文类效应;第 3 周上 CNN/LLM,挑战基线短板三格(§7.5);第 4 周做标注工程工作坊——用 Kappa 表设计"你自己的双人标注协议"并互评。结课作业即一份可投会议的方法学短文素材。选它的理由:小而完整、协议公开、失败方向已知——教学的最高境界是让学生在已知答案的地方练习提问。
7.15 监控与回归测试:把金标准搬进 CI
工程团队可以把本语料改造成部署流水线的回归测试集:每次更新文本分类服务,跑一遍 2,102 篇的表型预测,逐表型 F1 不得低于上版 -2%(或你设定的容差)。两个工程细节:笔记文本在受控环境内缓存为本地特征化结果(避免每次 join);回归报告按"表型 × 文类"二维展开,任何一格的骤降都要人工复核。这份语料 2,102 篇的体量恰好是 CI 友好的——足够覆盖行为,又能在分钟级跑完。
§8 伦理、许可与合规
8.1 PHI 与双重受控
数据含 HIPAA 定义的受保护健康信息(官方 Usage Notes 明示),且可关联回 MIMIC-III,因此受双重约束:PhysioNet credentialed 机制(CITI 课程 + DUA)+ MIMIC-III 使用条款。实操红线:文本原文不得进入公开论文、公开仓库、公开演示;衍生的 embedding、特征文件若可逆至文本,同受管制。
8.2 标注员与患者:双重伦理主体
容易被忽略的两层:患者侧——频繁再入院患者的精神健康、成瘾、社会处境被逐篇精读标注,其敏感度高于一般 EHR 二次利用,DUA 的最小必要原则在此尤其实用;标注员侧——4 位标注员 15 个月内精读数千篇 ICU 文本(含自伤、晚期癌症叙事),职业性心理负荷是现代标注工程的正式议题,官方未披露心理支持安排(当时未成惯例),今天 复制协议时应补上轮换与支持机制。
8.3 LLM 时代的合规新面
把临床文本喂给云端 LLM 是一个 DUA 合规灰色地带:PhysioNet 数据政策一般要求数据处理在受控环境内。安全做法:本地部署开源模型跑评测(vLLM + 本地权重);若必须用 API,先核 DUA 条款并优先选择有 BAA / 数据不留存承诺的服务,且在论文里披露处理路径。这条对 2026 年的 LLM 评测者是常态功课,对 2020 年的数据生产者是不可预见的——不要因此苛责协议,但要自己补齐。
8.4 地域合规的扩展提醒
与 493 条目相同的背景:美国司法部 Data Security Program(DSP,EO 14117)对"受关注国家"批量获取美国敏感个人数据(含健康数据)设定了限制,2025-04-08 起生效、2025-07-08 起执法。基于 MIMIC-III 生态的数据同样落入敏感健康数据范畴,跨境团队(含中国团队成员)参与研究时应核查机构合规部门的最新指引。本条目不构成法律意见。
8.5 引用伦理:给标注员署名
最后一条朴素伦理:这份语料的每一枚标签背后是两位临床人员 15 个月的精读劳动。引用时除了数据集 DOI,请引用 LREC 论文(标注工程的正式出处)——方法学劳动的可引用性与数据本身同等重要。
§9 常见问题(FAQ)
9.1 基础身份
Q1 这是什么数据集? MIMIC-III 临床笔记的人工表型标注语料:2,102 篇笔记 × 13 高上下文表型,双人独立标注,PhysioNet 归档(v1.20.3,DOI 10.13026/txmt-8m40)。
Q2 谁生产的? MIT Critical Data 社群,Edward T. Moseley 牵头;PhysioNet 页面署名 Moseley、Celi、Wu、Dernoncourt,LREC 论文全名单 10 人。
Q3 什么时候发布的? 2020-03-05 入驻 PhysioNet;2020-05 在 LREC 2020(马赛)正式发表方法学论文。
Q4 版本号为什么是 1.20.3? 官方未解释版本编码语义(存照 G);确认的事实:发布日期 2020-03-05,当前唯一版本 1.20.3,与 LREC 2020 同步发布。
Q5 数据集名称和论文标题为什么不一样? 数据集官方名 “Phenotype Annotations for Patient Notes in the MIMIC-III Database”,论文标题 “A Corpus for Detecting High-Context Medical Conditions…”——文献检索两套名字都要查(§0.1)。
Q6 旧名 ACTdb 是什么? 项目早期名 Annotated Clinical Texts (ACT) from MIMIC / ACTdb:works 页面 + GitHub 仓库的历史名,PLoS ONE 2018 论文的数据声明指向它。
Q7 语料规模到底多大? 1,102 出院小结 + 1,000 护理进展记录 = 2,102 篇。
Q8 患者总数是多少? 官方未公布(存照 E)。队列判据只有"单年入住 ICU >3 次"。
Q9 是开放数据吗? 页面元数据归类 Database Open Access,但实际文件访问需满足 MIMIC-III 全部访问要求——按受控数据对待(存照 D)。
Q10 有 DOI 吗? 有:10.13026/txmt-8m40;另 RRID: SCR_007345。
9.2 数据内容
Q11 每行数据长什么样? SUBJECT_ID / HADM_ID / ROW_ID / 15 列二元标签 / Operator。不含文本。
Q12 文本在哪里? MIMIC-III v1.4 NOTEEVENTS 表,用 ROW_ID join 回去(§3.2)。
Q13 13 个表型是什么? 晚期癌症、晚期心脏病、晚期肺病、酒精滥用、慢性神经性肌病、慢性疼痛(纤维肌痛)、痴呆、抑郁、发育迟缓、治疗不依从、肥胖、其他物质滥用、精神分裂症及其他精神障碍。
Q14 为什么说 15 标签又 说 13 表型? 13 真表型 + None + Unsure 两枚元标签 = 15 列。两个数都对,口径不同(§2.1、§6.11)。
Q15 None 标签是什么意思? 标注员在本篇笔记未观察到任何表型阳性证据。它不等于"患者健康"。
Q16 Unsure 标签是什么意思? 标注员对某项判定存疑、需求助资深医生的流程信号。官方未公开其最终仲裁规则(存照 I)。
Q17 两类文本的比例和长度? 出院小结 1,102 篇(中位 1,417.5 token)、护理记录 1,000 篇(中位 208 token)——篇幅差约 7 倍。
Q18 表型阳性率最高和最低的是? 最高 Depression(出院小结 24.23%,267 篇);最低 Developmental Delay(出院小结 1.27%,14 篇;护理 0.50%,5 篇)。
Q19 每篇笔记最多能标几个表型? 官方未公布各表型共现矩阵;标签是多标签设计(一笔记可多表型同时为真)。
Q20 有跨度级(span)标注吗? 没有。只有笔记级二元标签,没有 mention/span 标注。
Q21 有时间戳吗? 标注表本身不含笔记时间——NOTEEVENTS 的 CHARTDATE/CHARTTIME 需 join 获得。批次时间戳是标注流程信息,未随数据发布。
Q22 Operator 列有什么用? 记录标注员身份(4 人),可用于按标注员分析、组间对照、以及构造"分歧检测"特征。
Q23 护理记录覆盖 Nursing 还是 Nursing/other? 官方未细化(存照 F),自行 join 后用 COUNT 对账。
Q24 语言? 全部英语。
Q25 时间覆盖? 上游 MIMIC-III 患者数据 2001-2012;标注行为发生在 2015-08 至 2016-10。
9.3 标注协议
Q26 谁标注的? 4 位操作员两组:组 1 = ETM(临床研究员)& JTW;组 2 = JW & JF(住院医);资深医生 LAC/PAT/DAG 定表型定义。
Q27 每篇几人标注? 每篇由本组两人独立标注(duplicate annotation),无跨组标注。
Q28 标注员怎么培训? 先集体过若干篇笔记学习表型定义,之后独立作业。
Q29 批次机制是什么? 文本按批次分发,批次创建打时间戳,组内两人都完成后才发新批——保证同一批的两人标注时间贴近(§4.3)。
Q30 标注要什么证据? 必须有显式文本证据(explicit text),不允许凭临床常识推断;不设固定术语词典。
Q31 Kappa 全表在哪? LREC 2020 论文 Table 4:13 表型 × 2 组的 Cohen’s Kappa 全部公开(§4.6 有完整转写)。
Q32 Kappa 最高和最低是? 最高 Dementia(0.952/0.947);最低 Adv. Heart Disease 组 2(0.561)。
Q33 Kappa=1.000 的 Developmental Delay 怎么理解? 组 1 全一致,但正例极少(14 篇)——先看混淆矩阵再庆祝(§4.7)。
Q34 标注分歧怎么解决? Unsure 通道设计上指向资深医生求助,但仲裁流程细节官方未公开;二手研究主流做法是剔除分歧行(§4.4、§6.6)。
Q35 标注花了多久? 2015-08 至 2016-10,约 15 个月。
Q36 标注 GUI 是谁做的? Kai-ou Tang 与 William Labadie-Moseley(论文致谢);实现细节未公开。
Q37 可以复制这套协议吗? 可以,官方协议要素齐备;唯一必须自行补上的是 Unsure 仲裁规则(§5.7 六条清单)。
9.4 访问与获取
Q38 怎么获取? PhysioNet 注册 → CITI 课程 → 签 DUA → 申请 MIMIC-III 访问 → 同账号下载本数据集(§3.4)。
Q39 能只下标注表不要 MIMIC-III 吗? 技术上能下载,但只有文本资格者才用得起来——文本在 NOTEEVENTS 里。
Q40 MIMIC-IV 用户能直接用吗? 不能直接 join(无 ROW_ID);对齐路径与损耗见 §7.8。
Q41 AWS/BigQuery 镜像里有它吗? 官方主渠道是 PhysioNet 页面下载;第三方镜像(如 opendatalab)不提供受控标注表——别用非官方渠道。
Q42 下载后怎么验证数据完整? 五项对账:行数、列数、ROW_ID join 有效、None 语义、Unsure 占比(§3.8)。
Q43 引用格式? 三层引用链:数据集 DOI + Gehrmann 2018(官方指定)+ PhysioNet 平台(§3.6);建议补引 LREC 2020。
Q44 商业使用可以吗? 以 PhysioNet DUA 条款为准——MIMIC-III 系 DUA 一般允许研究用途并禁止再识别,商业场景请读原文并咨询合规。
9.5 建模与评测
Q45 官方有 train/test 划分吗? 没有(存照 J)。自行按患者级划分并开源(§5.2)。
Q46 官方基线是多少分? BoW+LR 与 CNN 的逐表型 F1 全表见 §6.1(CNN 全面胜出,Obesity +65 最戏剧性)。
Q47 CNN 基线的配置? 每宽度 100 filter、dropout 0.5、adadelta、word2vec(MIMIC-III 预训练)、每表型独立二元分类器(§5.4 复现码)。
Q48 卷积宽度是多少? 论文合理值为 1-4;arXiv HTML 版显示的 “11 to 44” 是排版转换错误(存照 K)。
Q49 为什么 Obesity 的 CNN F1 高达 95? 文本信号高度词汇化且组合性强——线性模型抓不住组合性,CNN 可以(§6.1)。
Q50 为什么 Adv. Lung Disease 最难? FEV1/FVC 数值散落 + 阈值读数 + "晚期"判定——纯粹的数值叙事推理(§6.1)。
Q51 Unsure 行怎么处理? 三选一并明示:剔除(主流)/ 当独立类别 / 谨慎当负例——最后一种会引入标注噪声(§6.6)。
Q52 None 行能当健康对照吗? 不能——None 只表示本笔记无表型阳性证据(§5.8 坑点 5)。
Q53 划分用什么单元? 患者级(SUBJECT_ID)最稳;笔记级会患者泄漏(§5.2)。
Q54 能做多标签单模型吗? 能,且是合理的消融方向——官方基线是每表型独立分类器(§7.12)。
Q55 词向量预训练语料包括测试笔记吗? 包括(MIMIC-III 全量)——严格做法是重训排除测试文本,或至少声明(§7.3)。
Q56 指标怎么选? AUC + F1 底线,护理子集加 PR-AUC,稀有表型报混淆矩阵(§6.4)。
Q57 可以跨论文比 F1 吗? 慎重——官方无统一划分,先核对划分协议(§6.11)。
9.6 与 MIMIC 家族的关系
Q58 和 MIMIC-III 什么关系? 衍生标注覆盖层:锚定 v1.4 NOTEEVENTS,可如 NOTEEVENTS 般 join。
Q59 和 MIMIC-IV 什么关系? 无官方对应物;MIMIC-IV-Note 的 DISCHARGE 表是文本侧现代继任,但无等效金标准表型标注(§7.8)。
Q60 和 Nosocomial Risk(493)什么关系? 标签谱系两端:这边人工金标准,那边自动标签工厂——级联使用配方见 §7.6。
Q61 和 PLoS ONE 2018 论文什么关系? 前身研究:ACT 语料(1,610 出院小结、10 表型)上的 CNN vs 概念抽取验证(§1.7)。
Q62 还有其他关联论文吗? Wu et al. 2018 IJMI “Behind the scenes”(项目幕后)、Wu et al. AMIA 2019(non-adherence 应用)(§1.7、§2.4)。
Q63 上游 MIMIC-III 还在更新吗? 进入维护态,官方建议新研究用 MIMIC-IV;本语料为静态冻结版(§6.12)。
9.7 LLM 时代专题
Q64 LLM 时代这数据集还有用吗? 更有用了:模型越强越需要干净金标准;2,102 篇恰好适合评测而非训练(§1.9)。
Q65 怎么把它变成 LLM 评测集? §5.9 五步规程:任务模板、分层抽样、对齐基线水位、报告规范、合规。
Q66 LLM 的 UNSURE 输出有意义吗? 有——对照人工 Kappa 低值区可检验模型自校准(§7.5)。
Q67 能用云端 API 跑吗? 合规灰色地带;安全做法是本地部署开源模型(§8.3)。
Q68 用它微调模型可以吗? 技术可行但浪费金标准——评测集被训练污染后价值归零;训练请回弱监督路线。
9.8 收尾杂项
Q69 最常见的三个新手错误? 把它当独立语料下载(没文本)、把 None 当健康、把 Unsure 静默当负例(§5.8)。
Q70 一句话推荐给谁? 给所有要在临床文本上做表型识别、且关心"我的模型到底有多可信"的人——这是 MIMIC 宇宙里那把最诚实的尺子。
§10 附录:存照、引文与档案
10.1 口径存照
存照 A(版本号):官方仅写 “version 1.20.3”(2020-03-05),版本编码语义无官方解释;第三方镜像出现 “1.20.03” 写法,以 PhysioNet 官方为准。
存照 B(标题双轨):数据集官方名与 LREC 论文标题不同——本条目正文以数据集官方名为纲,论文标题在引文区保留原文。
存照 C(作者双名单):PhysioNet 页面署名 4 人,LREC 论文 10 人;本条目在 INFOBOX 用页面口径,在 §1.8 给全名单。两组四操作员的缩写(ETM/JTW/JW/JF)来自论文 Methods;PhysioNet 页面把组 2 写作 “JW & JF”,论文 Kappa 表列名为 “JF & JW”——顺序差异不改变配对事实。
存照 D(访问级别):页面横幅 “Database Open Access” 与 Usage Notes 的 MIMIC-III 资格要求并存;本条目按"受控访问"执行并记录表述差异。未能直接核验 PhysioNet 侧边栏访问徽标(与 493 条目同样的抓取局限)。
存照 E(患者总数):官方数据集页面与 LREC 论文均未公布患者数;本条目不给估算。
存照 F(护理文类细分):1,000 篇护理记录在 NOTEEVENTS 的 CATEGORY 归属(Nursing vs Nursing/other)官方未细化说明。
存照 G(Unsure 仲裁):资深医生求助机制的最终裁决流程(结果是否回写、如何落定)官方未公开。
存照 H(Kappa 分组语义):Kappa 为组内配对一致性;两组标注的笔记子集不同,组间不可直接比较。
存照 I(官方划分):论文未发布 train/dev/test 划分文件;PLoS ONE 2018 亦未详述划分。
存照 J(BoW 超参):论文未详述 BoW 基线的正则与词表上限;§5.3 配方为工程默认值,注明方法学复现立场。
存照 K(卷积宽度排版疑误):ar5iv HTML 版显示 “convolution widths from 11 to 44” 与 “number of filters to 100100”;结合 Kim(2014) 架构惯例与上下文,判定为下标渲染错误(原始应为 1-4 与 100)。本条目按 1-4/100 表述并在此存照。
存照 L(二手再统计):JAMIA 2024 selective prediction 论文的 1,138 notes/563 depression 子集等数字来自搜索结果摘录,本条目未核验原文全文;引用者请以原文为准。
存照 M(共现矩阵):表型间共现统计官方未发布;"平均约 1.3 阳性/篇"为 §2.9 标注的粗算(由分布表加总推得),非官方口径。
存照 N(前身规模):PLoS ONE 2018 的 1,610 篇/10 表型为其独立语料(ACT),与本数据集(2,102 篇/13 表型)是两个规模口径,勿混用。
10.2 引文清单
- Moseley, E., Celi, L. A., Wu, J., & Dernoncourt, F. (2020). Phenotype Annotations for Patient Notes in the MIMIC-III Database (version 1.20.3). PhysioNet. https://doi.org/10.13026/txmt-8m40
- Moseley, E. T., Wu, J. T., Welt, J., Foote, J., Tyler, P. D., Grant, D. W., Carlson, E. T., Gehrmann, S., Dernoncourt, F., & Celi, L. A. (2020). A Corpus for Detecting High-Context Medical Conditions in Intensive Care Patient Notes Focusing on Frequently Readmitted Patients. Proceedings of the Twelfth Language Resources and Evaluation Conference (LREC 2020), 1362-1367. ELRA. https://aclanthology.org/2020.lrec-1.170/ (arXiv:2003.03044)
- Gehrmann, S., Dernoncourt, F., Li, Y., Carlson, E. T., Wu, J. T., Welt, J., Foote, J., Moseley, E. T., Grant, D. W., Tyler, P. D., & Celi, L. A. (2018). Comparing deep learning and concept extraction based methods for patient phenotyping from clinical narratives. PLoS ONE, 13(2), e0192360. https://doi.org/10.1371/journal.pone.0192360
- Wu, J. T., Dernoncourt, F., Gehrmann, S., Tyler, P. D., Moseley, E. T., Carlson, E. T., Grant, D. W., Li, Y., Welt, J., & Celi, L. A. (2018). Behind the scenes: A medical natural language processing project. International Journal of Medical Informatics, 112, 68-73. https://doi.org/10.1016/j.ijmedinf.2017.12.003
- Wu, J. T., Grant, D. W., Lakhotia, S., Tyler, P. D., Gruhl, D. F., Shivade, C., Gehrmann, S., & Celi, L. A. (2019). Identifying documented medical non-adherence from clinical notes using natural language processing. AMIA Annual Symposium Proceedings.
- Johnson, A. E. W., Pollard, T. J., Shen, L., Lehman, L.-w. H., Feng, M., Ghassemi, M., Moody, B., Szolovits, P., Celi, L. A., & Mark, R. G. (2016). MIMIC-III, a freely accessible critical care database. Scientific Data, 3, 160035.
- Pollard, T., Moody, B. E., Lehman, L., Gow, B., Fernandes, C., Xie, C., Johnson, A., Mark, R. G., & Heldt, T. (2026). PhysioNet as a global platform for biomedical research. Nature Health. https://doi.org/10.1038/s44360-026-00096-z
- Kansagara, D., Englander, H., Salanitro, A., et al. (2011). Risk prediction models for hospital readmission: a systematic review. JAMA, 306(15), 1688-1698.
- Chan, A., Chien, I., Moseley, E., et al. (2019). Deep learning algorithms to identify documentation of serious illness conversations during intensive care unit admissions. Palliative Medicine, 33(2), 187-196.
- Landis, J. R., & Koch, G. G. (1977). The measurement of observer agreement for categorical data. Biometrics, 33(1), 159-174.(Kappa 解释标尺的方法学参照)
10.3 系列条目关系
- 上游:mimiciv(rid 592)——MIMIC 宇宙现代主库;本语料锚定的是其前身 MIMIC-III v1.4;
- 平行:nosocomial-risk-mimic(rid 593)——自动标签工厂端;与本条目构成人工金标准 ↔ 自动弱监督的完整标签谱系;
- 前身研究:PLoS ONE 2018(ACT 语料)——本条目 §1.7 的验证链条第一环;
- 待续:MIMIC-IV 版表型标注(若官方发布,本条目需增补"现代继任"章节)。
10.4 变更日志
- 2026-09-20:初版发布(v1.20.3 口径;基于 PhysioNet 官方页 + LREC 2020 论文 + PLoS ONE 2018 三方交叉核查;14 条存照落档)。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimiciii — 共享标签:医疗NLP / 电子健康记录
- nosocomial-risk-mimic — 共享标签:医疗NLP / 电子健康记录
- paediatric-intensive-care — 共享标签:医疗NLP / 电子健康记录
- stroke-scale-mimic-iii — 共享标签:医疗NLP / 电子健康记录
- synthetic-mimic-iii-health-gym — 共享标签:医疗NLP / 电子健康记录
- trec-pm — 共享标签:医疗NLP / 电子健康记录
- emrqa — 共享标签:医疗NLP / 电子健康记录
- aact — 共享标签:医疗NLP / 电子健康记录
- loinc — 共享标签:医疗NLP / 电子健康记录
- chinese-critical-care-database — 共享标签:医疗NLP / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

