信息速览
INFOBOX:mimic-iv-ext-pe 速览
| 字段 | 值 |
|---|---|
| 数据集 | MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CTPA Radiology Reports v1.0.0 |
| slug | mimic-iv-ext-pe |
| 发布 | 2026-03-23|PhysioNet(全库次新,比 516 早两天) |
| DOI | 10.13026/5qq1-zv65(v1.0.0)/ 10.13026/f77d-vr35(latest) |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程) |
| 母项目 | MIMIC-IV v3.1 |
| 规模 | 19,942 份 CTPA 报告 / 15,875 患者(232 万份报告中筛出) |
| 标签 | 五类:Acute 1,358 / Subsegmental 233 / Chronic 345 / Equivocal 104 / Negative 17,902 |
| 标注 | 双人共识制(一人看模型预测+一人盲审)|κ=0.82|504 分歧全解决 |
| 对垒 | VTE-BERT(Sens 92.4%/PPV 87.8%)vs ICD 编码(Sens 95.4%/PPV 83.8%) |
| 团队 | BIDMC 血液科/信息科 + Baylor + UPMC + MIT CSAIL 七人(Lam/Horng 等) |
| 论文 | RPTH 2025;9(4):102896(2025-05-21)+ arXiv 2411.00044 |
| 一句话 | 血液科医生给 MIMIC-IV 装的 PE 开关:双人共识金标准 + 两条自动路的诚实对照 |
§0 摘要卡:从"232 万份报告"到"2 万个 PE 开关"
§0.1 名称与口径声明
本条目记录 PhysioNet 数据集 MIMIC-IV-Ext-PE(slug:mimic-iv-ext-pe),v1.0.0,2026-03-23 发布,DOI 10.13026/5qq1-zv65,Credentialed。形态口径存照:批次清单标 modality=CT,实测为 CTPA 放射报告的文本层标签集——CT 图像本体不在库,"CTPA"是报告的检查类型。标题口径存照:arXiv 版标题称 “large language model”,实际模型是微调 BERT(VTE-BERT)——论文正文自纠。
§0.2 读者收益清单
- 血栓研究团队:1,591 例急性 PE(含 233 亚段)的即开即用队列——subject_id/hadm_id 直通 MIMIC-IV 全生态(EHR/超声/胸片/心电图)
- 医学 NLP 工程师:双人共识金标准(κ=0.82)+ 五类分级标签——比弱监督标签高一个可靠性的标注参照
- 方法学研究者:VTE-BERT vs ICD 的同金标准对垒——"自动标注 vs 编码标注谁更准"的公开教案
- 急危重症数据科学家:38% 仅急诊报告——ICD 覆盖盲区的实证样本
- MIMIC 生态用户:本库 617(MIMIC-CXR-JPG)之外的第二条报告加工层路径——临床文本侧的姊妹篇
§0.3 本条目与其他条目的阅读组合
- 617 mimic-cxr-jpg:同为报告加工层——617 是双 labeler 弱监督 14 类(规模换精度),518 是双人共识五类(精度换规模);两种标注工程的正面参照系
- MIMIC-IV 主线(ED/ECG 等在库条目):hadm_id/subject_id 直连——PE 队列的结局变量在 MIMIC-IV 临床表
- 616 mimic-cxr-ext-ils:同属 MIMIC-Ext 派生系列——616 指令分割(影像),518 PE 标签(文本);Ext 家族的两种"增值标注"
- RSNA PE CT / INSPECT(未单列):PE 领域影像层与多模态先例——本集是 MIMIC 生态文本层补位
§0.4 身份卡:一条命令背下这个数据集
名称 MIMIC-IV-Ext-PE: PE Labels for CTPA Radiology Reports
版本 v1.0.0(2026-03-23,唯一版本)
DOI 10.13026/5qq1-zv65(latest f77d-vr35)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI)
规模 19,942 CTPA 报告|15,875 患者|232 万报告中筛出
标签 五类(Acute/Subsegmental/Chronic/Equivocal/Negative)
标注 双人共识|κ=0.82|504 分歧全讨论解决
对垒 VTE-BERT 92.4/87.8 vs ICD 95.4/83.8(Sens/PPV%)
论文 RPTH 2025;9(4):102896(早于数据集 10 个月)
它的故事一句话:血液科医生受够了 ICD 编码的不靠谱,于是双人盲审了 2 万份报告装上"PE 开关"——顺手证明了机器和编码都还需要这个金标准当裁判。
§1 身份卡:一张速览
MIMIC-IV-Ext-PE 是 MIMIC-IV 的第一个血液科主导的扩展数据集:把 232 万份放射报告中经五步管线确认的 19,942 份 CTPA(CT 肺动脉造影)报告,由两位医生按共识协议标注为五类 PE(肺栓塞)标签,并附上 VTE-BERT 模型与 ICD 编码两条自动路径的对照成绩单。
| 字段 | 值 |
|---|---|
| 完整标题 | MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CT Pulmonary Angiography Radiology Reports |
| 版本 | v1.0.0(2026-03-23,唯一版本;latest DOI 10.13026/f77d-vr35) |
| 版本 DOI | 10.13026/5qq1-zv65 |
| 母项目 | MIMIC-IV v3.1(BIDMC 2008-2019) |
| 发布方 | PhysioNet(MIT LCP 维护) |
| 访问级别 | Credentialed(License 1.5.0 + DUA 1.5.0) |
| 训练门槛 | CITI “Data or Specimens Only Research” |
| 规模 | 19,942 份 CTPA 报告 / 15,875 名患者(住院关联 62% / 仅急诊 38%) |
| 标签 | 五类:Acute 1,358 / Subsegmental 233 / Chronic 345 / Equivocal 104 / Negative 17,902 |
| 标注协议 | 双人共识:BDL(看句子+模型预测)+ IK(盲审句子);κ=0.82;504 份分歧全员讨论解决 |
| 人口学 | 中位 63 岁;女 56.7%;White 58.8% |
| 自动对照 | VTE-BERT(Sens 92.4%/PPV 87.8%)vs ICD(Sens 95.4%/PPV 83.8%,仅住院子集) |
| 团队 | 7 人:Lam(BIDMC 血液+信息)/ Kovalenko(UPMC)/ Horng(BIDMC 信息+急诊)/ Ma+Li(Baylor,共同通讯)/ Jafari(Baylor ICTR)/ Wang(MIT CSAIL) |
| 论文 | RPTH 2025;9(4):102896(2025-05-21)+ arXiv 2411.00044(2024-11) |
| Ethics | 派生自 MIMIC-IV,无新患者数据采集 |
| COI | 无(作者声明);资助 Google Cloud Research Credits(GCP19980904) |
| Views | 121(2026-03 挂牌,新集) |
§2 背景:血液科为什么要自己动手做数据集
§2.1 PE:可预防院内死亡的头部原因
肺栓塞是院内可预防死亡的主要原因——页面开篇即引用 VTE 公共卫生综述(Beckman 2010,Am J Prev Med)与急性 VTE 治疗综述(Becattini & Agnelli,Blood 2020)。典型症状(心动过速、呼吸困难、胸痛)不特异,诊断依赖 CTPA 影像;而 PE 的发病率报告已成为医院质量指标——识别病历中的 PE 病例不仅是研究问题,也是公共卫生监测问题。
§2.2 金标准荒:血栓领域的公开数据集缺口
论文说得直白:止血与血栓领域"缺少大型公开数据集"。此前领域内只有两个:RSNA PE CT Dataset(12,000+ CT study,DICOM 影像+PE 类型标签)与 INSPECT(23,248 CT+报告+纵向 EHR)。两者都不与 MIMIC 生态互通——而 MIMIC 的独特价值恰是 EHR/超声/胸片/心电图的纵向链接。本集的定位就是补上 MIMIC 生态的 PE 文本层,让 PE 队列研究可以直接 join 出多模态画像。
§2.3 为什么不用 ICD 编码?——被伤过的血液科
历史上 PE 病例识别靠人工病历审查(劳动密集不可规模化);用 ICD 编码替代则在门诊与急诊场景暴露出 poor predictive value(论文引用 [6][7])。团队此前做的 VTE AI 系统综述(Chiasakul 2023,Eur J Haematol——本集作者 Lam/Rosovsky 参与的先导工作)发现:极少有团队做过外部验证,更没有人用 transformer 从非结构化病历里识别 PE。于是血液科自己上手:先构建金标准,再量化两条自动路(模型/编码)与金标准的差距。
§2.4 团队构成的临床意义
七人团队里,第一作者与第二位标注医生来自 BIDMC 血液科/临床信息科,通讯作者在 Baylor 血液肿瘤科与 BIDMC 信息/急诊科——没有一位"纯 ML 背景"的第一作者(唯一的 CSAIL 作者 Peiqi Wang 排第五)。这与 KAIST 班底的 516(工程主导全自动管线)形成方法论光谱的两端:临床科室自产数据集,标注协议与临床工作流(双人阅片+意见分歧讨论制)直接同构。
§3 管线解剖:232 万份报告怎么变成 2 万个标签
§3.1 五步 CTPA 识别
- 取材:MIMIC-IV 全部 2,321,355 份影像报告中取 subtype=“RR”(radiology report)的note;
- 分段:把报告切成 History / Indication / Procedure / Examination / Study / Technique 六类节;
- 操作段筛:Procedure/Examination/Study/Technique 段含 CTPA 相关术语;
- 病史段筛:History/Indication 段含 PE 相关术语(临床开单理由);
- 标题段筛:存在以 CTPA 为标题的独立段落。
候选 21,948 份 → 两位医生逐份人工确认 → 19,942 份真 CTPA(15,875 患者)。
纳入边界细节:混合检查只要有胸部 CT 血管造影即纳入(全身 CTA、心血管 CTA 都算);核医学的 V/Q(通气/灌注)扫描明确排除——影像模态边界与临床习惯一致。
§3.2 RegEx 句子隔离
对确认的 CTPA 报告,用 RegEx 算法找含 PE 关键词的句子,隔离出来合并成"snippet note"(术语表见补充材料 Table 1/Table 2)。这一步的成绩:19,942 份中 18,748 份(94.1%)成功隔离出至少一句;剩下 1,194 份无句可提——人工核查发现其中只有 1 份是真急性 PE。也就是说,"句子隔离"这个看似粗暴的预处理,召回率是 1,590/1,591 = 99.94%——规则式预处理在高度模板化的放射报告上依然很强。
§3.3 VTE-BERT:一个"外来"的分类器
VTE-BERT 不是为本集重新训练的:它是 Maghsoudi 等人先前用 800 名癌症患者的 3,000 份临床笔记(progress notes/出院小结/影像报告,来自 Harris Health System)微调 Bio_ClinicalBERT 得到的 VTE(DVT+PE)识别模型,已在 VA 癌症队列外部验证过。本集直接拿来用——模型训练语料与本集 CTPA 报告零重叠,因此 VTE-BERT 在本集的成绩是真外部验证而非同分布测试。这在 NLP 标注工具的文献里是少见的老实做法。
无句即阴的约定:预处理没隔离出任何句子的报告,直接标为阴性(no PE)——由上面的召回数字背书(1,194 份里只漏了 1 个真阳性)。
§3.4 双人共识裁决:一明一盲
- 医生 1(BDL,Lam):看隔离句子 + VTE-BERT 的预测结果(模型辅助阅片);
- 医生 2(IK,Kovalenko):只看隔离句子,对模型预测全盲;
- 无句可提的报告两人都看全文;
- 五类标准(详见 §4):Positive(Acute/Subsegmental)与 Negative(Chronic/Equivocal/Negative);
- 冲突处理:504 份(2.5%)存在不一致,全部通过两人讨论达成一致(讨论至共识,无仲裁第三人);
- 一致性:五类并成二值(阳/阴)后算 Cohen’s κ = 0.82——"substantial agreement"上缘。
一明一盲的设计哲学:医生 1 看得到模型预测,模拟的是"人机协同阅片"的未来工作流;医生 2 全盲,保住的是"纯人类金标准"的独立性。κ=0.82 是在盲侧可计算的独立性指标——这比两个都看模型的"共识"更有说服力。
§4 五类标签体系:比"阳/阴"多想三步
§4.1 为什么是五类而不是二类
两位医生的裁决手册把 PE 发现切成五类——每类都对应一个真实的临床决策分歧点:
| 类 | 定义 | n | 临床含义 |
|---|---|---|---|
| Acute | 急性 PE,或急慢性混合 | 1,358 | 需要抗凝治疗 |
| Subsegmental | 仅亚段动脉的急性 PE | 233 | 治疗存在争议的灰色地带 |
| Chronic | 慢性 PE/病程不明/与既往扫描相似 | 345 | 不是新事件——抗凝决策不同 |
| Equivocal | 存疑发现(如运动伪影 vs PE) | 104 | 需进一步检查或临床判断 |
| Negative | 无 PE/影像质量不足以判断/未描述肺动脉 | 17,902 | 阴性对照池 |
阳性合计 1,591(7.98%),阴性 18,351。"仅慢性"与"存疑"没有被塞进阴性而各自成类——这是本集比多数 ICD/弱监督标签精细的地方:研究者可以按研究问题自行决定"慢性算不算暴露"“存疑进不进训练集”。
§4.2 亚段(subsegmental)为何单列
亚段 PE 的临床处理是血液学的经典争议(是否抗凝因人而异)。金标准专门单列了 233 份仅亚段受累的急性 PE;ICD 对照里 1,276 份正确阳性中 169 份实为亚段——而 ICD 码里只有 4 份用了亚段专用编码。编码粒度跟不上临床粒度,这是五类设计给出的隐含批评。
§4.3 κ=0.82 的读法
504 份(2.5%)初始不一致在五类并二值后计算 κ=0.82。三点读法:其一,分歧主要发生在类间细界(慢性 vs 阴性、存疑 vs 阳性)而非阳/阴主轴;其二,全部 504 份经讨论达成一致——共识制没有"留白"样本(对照 517 五值里 disagreement 类的存在);其三,κ 是二值化的,五类原始一致性只会更低——引用时别把 0.82 说成"五类 κ"。
§5 对垒结果:模型、编码与人工的三角
§5.1 VTE-BERT 的成绩单
| 指标 | VTE-BERT | 95% CI |
|---|---|---|
| 灵敏度 Sensitivity | 92.4% | 0.91-0.94 |
| 阳性预测值 PPV | 87.8% | 0.86-0.89 |
| 特异度 Specificity | 98.9% | —(emergentmind 口径) |
最常见错误:把仅描述慢性 PE 的报告判为阳性——恰好是五类设计里单列 Chronic 的原因:自动模型分不清"急"与"慢",而这对治疗决策是天壤之别。
覆盖面:全部 19,942 份(含急诊 38%)。
§5.2 ICD 编码的成绩单
住院子集(12,355 份报告/11,990 次住院;365 份同住院多图只计一次)上:Sens 95.4%(0.94-0.96)/ PPV 83.8%(0.82-0.86)。
错误账本(308 份错标):61 份急性 PE 无任何相关 ICD 码(漏报);有急性 PE 码的里面,108 份实为慢性、115 份根本阴性、24 份存疑——假阳性 247 份。亚段粒度:1,276 份正确阳性中 169 份亚段,仅 4 份有亚段专用码。
§5.3 三角关系的读法
| 维度 | VTE-BERT | ICD 编码 | 人工共识 |
|---|---|---|---|
| 灵敏度 | 92.4% | 95.4% | 金标准 |
| 精确率 PPV | 87.8% | 83.8% | 金标准 |
| 覆盖 | 全部(含急诊) | 仅住院 | 全部 |
| 粒度 | 二值(阳/阴) | 二值+4 个亚段码 | 五类 |
| 成本 | 零边际 | 零边际 | 2 医生×2 万份 |
三个结论:其一,ICD 查全略优但假阳性多 247 份——流行病学发病率统计若基于 ICD 会系统性虚高;其二,VTE-BERT 精确率优势换来的是急诊覆盖(ICD 在急诊没有对应 discharge 编码);其三,两条自动路都在"急 vs 慢"上翻车——这正是人工五类金标准不可替代的部分。
§5.4 局限声明(页面原文精神)
标签仅基于影像报告——报告上写 equivocal 的病例,临床可能已按急性 PE 抗凝(“报告≠处置”);ICD 对照无法覆盖急诊 38%;VTE-BERT 的跨域误差(癌症语料→一般人群)未在集内进一步拆解。
§6 生态位:PE 数据集三件套与 MIMIC 链接权
§6.1 三件套对照
| 维度 | RSNA PE CT(2021) | INSPECT(2023) | 本集(2026) |
|---|---|---|---|
| 规模 | 12,000+ CT studies | 23,248 CT | 19,942 报告 |
| 模态 | DICOM 影像 | CT+报告+EHR | 报告文本+标签 |
| 标签 | PE 类型(影像层) | PE 类型 | 五类(双人共识) |
| 生态 | 独立竞赛集 | 独立 | MIMIC-IV 全生态 |
| 访问 | 需协议 | 需协议 | Credentialed |
§6.2 MIMIC 链接权:本集的真正卖点
note_id/subject_id/hadm_id 三键直通 MIMIC-IV 的全部临床表——一条 join 就能拉出 PE 患者的纵向 EHR、用药(抗凝处方)、超声心动、胸片(本库 617)、心电图。Usage Notes 把这个卖点说得明确:支持"多模态 PE 管理"研究与"模型外推验证"。对 MIMIC 生态内的团队,这是最快的一条 PE 队列组装路径。
§6.3 与 617 的方法论对照
同是"放射报告加工层",两条路线值得并排看:
| 617 MIMIC-CXR-JPG | 518 本集 | |
|---|---|---|
| 标注引擎 | CheXpert+NegBio 规则 NLP | 双人医生共识(+VTE-BERT 基准) |
| 标签性质 | 弱监督(验证集 687 份) | 金标准(全量 19,942 份) |
| 粒度 | 14 类五值 | 五类单值 |
| 规模哲学 | 全库 37.7 万图全标 | 精筛 2 万份全标 |
| 不确定性处理 | uncertain/disagreement 显式值 | Equivocal 独立成类 |
| 发表 | arXiv(工程叙事) | RPTH 期刊(临床叙事) |
规模换精度 vs 精度换规模——两条路线没有优劣,取决于下游任务要的是训练信号量还是评估可信度。
§7 AI-Ready 十问
一问:什么格式? 单个 CSV(MIMIC-IV-Ext-PE.csv):note_id/subject_id/hadm_id/text 报告全文/Type_of_PE/charttime/storetime——零解析成本。
二问:多大规模? 19,942 份 CTPA 报告/15,875 患者;1,591 阳性(7.98%)/18,351 阴性;单文件即全库。
三问:标注是什么性质? 双人医生共识金标准(一明一盲协议,κ=0.82,全量标注非抽样)——比弱监督高一级;另有 VTE-BERT 自动预测可对照。
四问:许可与门槛? Credentialed:License 1.5.0+DUA 1.5.0+CITI 课程;发表必须开源代码。
五问:伦理完备度? 派生自 MIMIC-IV(其 BIDMC IRB 免知情同意框架),无新患者数据;COI 无;资助(Google Cloud Credits)披露。
六问:可复现性? 五步识别管线+RegEx 术语表+代码(GitHub+Supplementary)全公开;VTE-BERT 外部验证设计避免了同分布作弊。
七问:标签的可信边界? 共识制消除了标注者间分歧,但"报告≠处置"——Equivocal 104 份与慢性 345 份的治疗语义要研究者自行裁定;亚段类 233 份样本量有限。
八问:适合什么任务? PE 队列组装(join MIMIC-IV 全生态)、医学 NLP 微调/评估(报告→标签)、NLP 算法基准(对垒 VTE-BERT/ICD 成绩单)、流行病学修正(ICD 虚高量化)。
九问:不适合什么? 影像模型训练(无 CT 图像——影像需求走 RSNA PE CT/INSPECT);抗凝结局研究需另 join 处方与随访表;儿科不适用(MIMIC-IV 为成人)。
十问:一句话定位? 血液科亲手做的 PE 金标准——用 2 万份双人共识报告,给"编码不靠谱、模型待验证"两个老问题立了一面公开的镜子。
§8 误解与反直觉
误解一:“这是 CT 影像数据集。” 不是——影像本体不在库,这是 CTPA 报告的文本层标签集。要影像走 RSNA PE CT(12,000 studies DICOM)或 INSPECT(23,248 CT)。
误解二:“arXiv 标题说 large language model,所以用的是 GPT 类模型。” 标题党存照:实际是微调的 Bio_ClinicalBERT(VTE-BERT,1.1 亿参数级),论文正文自我纠正为 “transformer language model”。
误解三:“VTE-BERT 是为这个数据集训练的。” 恰相反——它训练于 800 名癌症患者的 3,000 份笔记(Harris Health System),与本集 CTPA 语料零重叠,成绩是真外部验证。这是本集方法上最老实的一笔。
误解四:“ICD 灵敏度 95.4% 比 VTE-BERT 92.4% 高,所以编码更好。” 灵敏度只是半张成绩单:ICD 的 PPV 只有 83.8%(308 份错标,假阳性 247),且只能覆盖住院 62%——急诊 38% 的报告编码无从谈起。
误解五:“7.98% 的阳性率代表 MIMIC-IV 的 PE 患病率。” 这是"CTPA 检查"中的阳性率(临床开单已有选择性偏倚),不是人群或住院人群患病率——引用时注意分母是"做了 CTPA 的人"。
误解六:“κ=0.82 是五类一致性。” 五类并成二值(阳/阴)后才算的 κ——类间细界(慢性/存疑/亚段)的一致性没有单独报告,五类原始 κ 必然更低。
误解七:“Equivocal 是标注错误。” 不是——104 份存疑是报告本身的模糊(如运动伪影 vs PE),独立成类是给研究者的自由度:抗凝结局研究可排除,鲁棒性研究可保留。
误解八:“数据集 2026 年发布,所以是 2026 年的研究。” 正式论文 2025 年 5 月已在 RPTH 发表——先论文后数据,数据集挂牌是研究的"出厂后置"。
误解九:“双人共识就没有不确定。” 共识制消除的是标注者间分歧;报告文本本身的模糊(报告≠处置)依然存在——Usage Notes 明确承认 equivocal 可能被临床按急性 PE 处理。
误解十:“RegEx 句子隔离会漏掉很多阳性。” 1,194 份无句可提的报告里只有 1 份真急性 PE——预处理召回 99.94%。在高度模板化的放射报告上,规则式预处理的召回远比想象可靠(代价在精度端,由人工把守)。
误解十一:“可以用它研究儿童 PE。” MIMIC-IV 是成人库——儿科 PE 研究需要其他数据源。
误解十二:“拿到 CSV 就能直接发表临床结论。” DUA 条款照旧:发表必须开源代码;且标签是报告层——任何"治疗-结局"结论都需要 join MIMIC-IV 处方/随访表自行验证。
§9 工作实例:从 CSV 到 PE 队列
§9.1 加载与分布盘点(纯 pandas)
import pandas as pd
pe = pd.read_csv('MIMIC-IV-Ext-PE.csv')
print(pe['Type_of_PE'].value_counts())
# Acute 1358
# Negative 17902 (按 final 页面口径换算)
# Chronic 345
# Subsegmental 233
# Equivocal 104
print(pe['subject_id'].nunique()) # 15,875
# 阳性队列(急性含亚段)
acute = pe[pe['Type_of_PE'].isin(['Acute', 'Subsegmental'])] # 1,591 份报告
§9.2 join 出多模态 PE 画像(MIMIC 生态)
# hadm_id -> MIMIC-IV hospitalizations(用药/实验室/结局)
# subject_id -> MIMIC-CXR-JPG 图像(本库 rid 617,键 dicom_id 经 metadata)
# 急性 PE 患者的抗凝处方:join prescriptions 表筛抗凝药
# 超声/心电图:echoecg 表与 MIMIC-IV-ECG(本库在册条目)
§9.3 复现"模型 vs 编码"对垒
# VTE-BERT:github 开源权重(Maghsoudi et al.),输入 text 列
# 预处理按 Supplementary Table 2 的 RegEx 隔离句子;无句 -> 阴性
# ICD 对比:join MIMIC-IV diagnoses_icd,筛 I26 系列(肺栓塞)
# 分母 = 住院子集 11,990 stays(急诊报告无 discharge 编码)
# 目标:复现 Sens 92.4/PPV 87.8 vs Sens 95.4/PPV 83.8
§9.4 标注工程的三课
- 一明一盲:如果想既有独立性又有人机协同的真实感,复制本集的双评审设计——盲侧保 κ 可算,明侧模拟真实工作流;
- 无句即阴要背书:本集用"1,194 份无句仅 1 阳性"给默认阴性兜底——你的规则式预处理也要给出等价的召回证据;
- 五类比二值值钱:Chronic/Equivocal 单列后,"自动模型分不清急慢"这个发现才成为可能——粒度设计决定能发现什么。
实操提醒:text 列是报告全文(含模板段落),直接拿去训分类器会引入模板噪声——本集管线已示范"先隔离相关句再喂模型"的正确姿势。
§5.6 常见踩坑清单
| 坑 | 后果 | 避法 |
|---|---|---|
| 坑点1:当影像数据集用 | 找不到 CT 文件 | 文本层标签集;影像走 RSNA PE/INSPECT |
| 坑点2:阳性率当患病率 | 流行病学推断错误 | 分母是 CTPA 检查(选择性偏倚) |
| 坑点3:ICD 数字外推到急诊 | 覆盖虚高 | ICD 仅住院 62%;急诊 38% 无编码 |
| 坑点4:κ=0.82 当五类一致性 | 高估类间一致 | 二值化后计算;类间细界未单独报告 |
| 坑点5:Equivocal 直接丢 | 白白放弃鲁棒性素材 | 按研究问题裁定(§4.1 表) |
| 坑点6:VTE-BERT 当同分布基线 | 复现不出论文数字 | 外部验证设计;重训后数字不可比 |
| 坑点7:全文直训分类器 | 模板噪声进模型 | 先句子隔离(§3.2)再喂模型 |
| 坑点8:忽略"报告≠处置" | 治疗-结局结论失真 | join 处方/随访表自行验证(§5.4) |
DAIMS 评估:数据可得性 6(Credentialed 标准流程)/ 标注 9(双人共识全量金标准 κ=0.82,全库标注最高档)/ 方法 8(管线全开源+外部验证设计+双基准对照)/ 影响力 6(2026 新集,RPTH 期刊影响力待累积)/ 规模 6(2 万份报告,单文件)——DAIMS:7.0(对照:617 弱监督全量 7.8、616 全自动指令分割 7.0、510 人工掩码 8.0)。
§10 FAQ:九十问速查
§10.1 身份与获取(10 问)
Q1:MIMIC-IV-Ext-PE 是什么?
A:MIMIC-IV 的 PE 标签扩展:19,942 份 CTPA 放射报告(15,875 患者)由两位医生共识标注五类肺栓塞标签。
Q2:它和 MIMIC-IV 是什么关系?
A:wholly derived 派生——报告全文与键(note_id/subject_id/hadm_id)都来自母库 MIMIC-IV v3.1,本集只加标签层。
Q3:包含 CT 影像吗?
A:不包含——这是报告的文本层标签集;CT 影像需求走 RSNA PE CT Dataset 或 INSPECT。
Q4:最新版本?
A:v1.0.0(2026-03-23,唯一版本)。
Q5:DOI 怎么引?
A:版本 DOI 10.13026/5qq1-zv65;latest DOI 10.13026/f77d-vr35;论文 DOI 10.1016/j.rpth.2025.102896。
Q6:在哪里下载?
A:PhysioNet:physionet.org/content/mimic-iv-ext-pe/,Credentialed 档位。
Q7:申请门槛?
A:CITI ‘Data or Specimens Only Research’ 课程(每位合作者)+ 签署 DUA 1.5.0 + MIT LCP 审核。
Q8:要花钱吗?
A:免费——Credentialed 是身份与用途门槛,非付费墙。
Q9:论文是哪篇?
A:Lam et al. Res Pract Thromb Haemost 2025;9(4):102896(2025-05-21);另有 arXiv 2411.00044(2024-11 预印本)。
Q10:团队是谁?
A:七人:BIDMC 血液科/信息科(Lam、Horng)+ Baylor 血液肿瘤(Ma、Li,共同通讯)+ UPMC Harrisburg(Kovalenko)+ Baylor ICTR(Jafari)+ MIT CSAIL(Wang)。
§10.2 规模与口径(10 问)
Q11:母库报告总量多少?
A:2,321,355 份(MIMIC-IV 全部影像报告)。
Q12:候选与确认多少?
A:RegEx+query 候选 21,948 份 → 双医生人工确认 19,942 份真 CTPA。
Q13:多少名患者?
A:15,875 名(成人)。
Q14:住院与急诊比例?
A:住院关联 12,355 份(62%);仅急诊 7,587 份(38%)——后者无 ICD 对照。
Q15:阳性多少?
A:急性 PE 1,591 份(Acute 1,358 + Subsegmental 233),阳性率 7.98%(以 CTPA 检查为分母)。
Q16:阴性细类?
A:Negative 17,902 / Chronic 345 / Equivocal 104(合计 18,351)。
Q17:人口学?
A:中位 63 岁;女 56.7%;White 58.8%(final 页面口径——arXiv 早期版数字不同,以 final 为准)。
Q18:CSV 有哪些列?
A:note_id / subject_id / hadm_id / text(报告全文)/ Type_of_PE(五类)/ charttime / storetime。
Q19:时间跨度?
A:母库 MIMIC-IV 的 2008-2019(BIDMC)。
Q20:V/Q 扫描在库里吗?
A:不在——明确排除(仅 CTPA 及含胸部 CTA 的混合检查)。
§10.3 管线与标注(12 问)
Q21:CTPA 怎么识别的?
A:五步:RR subtype 报告→六段切分→操作段含 CTPA 术语→病史段含 PE 术语→含 CTPA 标题段→人工确认。
Q22:两个人怎么分工?
A:医生 1(Lam)看隔离句子+VTE-BERT 预测(明);医生 2(Kovalenko)只看句子(盲);无句看全文。
Q23:为什么一明一盲?
A:盲侧保金标准独立性与 κ 可算;明侧模拟人机协同工作流——两种真实性都要。
Q24:分歧怎么处理?
A:504 份(2.5%)不一致全部两人讨论达成共识——无仲裁第三人、无留白样本。
Q25:κ 是多少?
A:0.82(五类并二值后计算)——substantial agreement 上缘。
Q26:句子隔离是什么?
A:RegEx 找含 PE 关键词的句子合并成 snippet——19,942 份中 18,748 份命中(94.1%)。
Q27:无句可提的报告怎么办?
A:1,194 份默认标阴性——人工核查其中仅 1 份真急性 PE,预处理召回 99.94%。
Q28:VTE-BERT 是什么?
A:Maghsoudi 等用 800 癌症患者 3,000 笔记微调的 Bio_ClinicalBERT(识别 DVT+PE),已在 VA 癌症队列外部验证。
Q29:VTE-BERT 是为本集训练的吗?
A:不是——训练语料与本集零重叠,本集成绩是真外部验证(方法上的老实设计)。
Q30:标签的舍入路径?
A:先五类(Acute/Subsegmental/Chronic/Equivocal/Negative)——研究问题决定并类方式。
Q31:混合检查怎么处理?
A:含胸部 CTA 即纳入(全身 CTA/心血管 CTA 算);一个住院多图取一份(急性优先)。
Q32:用的什么 Python?
A:全部分析 Python 3.11(页面明示);代码开源在 GitHub。
§10.4 对垒与性能(10 问)
Q33:VTE-BERT 的成绩?
A:Sens 92.4%(0.91-0.94)/ PPV 87.8%(0.86-0.89)/ Spec 98.9%(emergentmind 口径)——覆盖全部 19,942 份。
Q34:VTE-BERT 最常见错误?
A:把仅慢性 PE 的报告判为阳性——急慢不分是规则/模型的共同短板。
Q35:ICD 的成绩?
A:Sens 95.4%(0.94-0.96)/ PPV 83.8%(0.82-0.86)——仅住院子集 11,990 stays。
Q36:ICD 错在哪?
A:308 份错标:61 漏标(急性无码)+108 慢性误急性+115 阴性误阳性+24 存疑误阳性——假阳性 247。
Q37:亚段在 ICD 里什么地位?
A:1,276 正确阳性中 169 份亚段——只有 4 份用了亚段专用码,编码粒度跟不上临床。
Q38:谁更好?
A:各赢一半:ICD 查全、VTE-BERT 精确+急诊覆盖——都到不了人工共识的可靠性。
Q39:能复现对垒吗?
A:能——VTE-BERT 权重开源、RegEx 表公开、ICD join 逻辑在论文 Table 2。
Q40:特异度是多少?
A:VTE-BERT 98.9%(emergentmind 引论文口径;页面给 Sens/PPV 为主)。
Q41:为什么 ICD 查全更高?
A:住院 discharge 编码由编码员按病历全貌填写,不只看影像报告——信息源更宽(但更不准)。
Q42:这个对垒的普适教训?
A:编码(宽信息源+低粒度+覆盖缺口)vs NLP(窄信息源+高速度+跨域误差)——任何 phenotyping 研究都该像本集一样给两者同台。
§10.5 标签语义与研究设计(10 问)
Q43:7.98% 是患病率吗?
A:不是——是 CTPA 检查中的阳性率(临床开单已有选择偏倚),非人群/住院患病率。
Q44:Equivocal 104 份怎么用?
A:按研究问题裁定:抗凝结局研究可排除;鲁棒性/不确定性研究可保留或单独建模。
Q45:Chronic 345 份算暴露吗?
A:看研究定义——慢性 PE 不是急性事件,但与慢性血栓栓塞性肺高压(CTEPH)研究相关。
Q46:Subsegmental 为什么值得单列?
A:抗凝决策的临床争议地带;ICD 仅 4/169 有专用码——粒度鸿沟的实证。
Q47:'报告≠处置’什么意思?
A:报告写 equivocal 的病例可能已被按急性 PE 抗凝——标签是报告层,治疗语义要 join 处方表自行验证。
Q48:能研究儿童吗?
A:不能——MIMIC-IV 是成人库。
Q49:能直接下治疗结论吗?
A:不能——需要 join MIMIC-IV prescriptions/随访表;标签只描述报告说了什么。
Q50:阳性率与其他库可比吗?
A:谨慎——RSNA/INSPECT 的分母与纳入标准不同;本集是’临床怀疑 PE 而做 CTPA’的真实流。
Q51:急诊报告的特殊价值?
A:38% 仅急诊——这是 ICD 编码无法覆盖的人群,NLP 标签是唯一选择。
Q52:纵向研究怎么设计?
A:charttime/storetime 支持同一患者多次 CTPA 的时间排序——急转慢、复发研究的入口。
§10.6 伦理与合规(8 问)
Q53:伦理审查情况?
A:派生自 MIMIC-IV(BIDMC IRB 免知情同意框架),无新患者数据采集。
Q54:COI?
A:作者声明无利益冲突。
Q55:资助方?
A:Google Cloud Research Credits(GCP19980904);PhysioNet 基建由 NIBIB/NHLBI/NIH-OD 支持(U24EB037545+R01EB030362)。
Q56:DUA 义务?
A:不共享/不再识别/发表必须公开代码——MIMIC 家族标准三条。
Q57:能再分发吗?
A:不能直接再分发报告全文;派生统计与模型共享以 DUA 1.5.0 为准。
Q58:患者隐私怎么保护?
A:继承 MIMIC-IV 的 Safe Harbor 去标识;text 列为已去标识报告。
Q59:商用可以吗?
A:限研究用途;商用需另行授权。
Q60:撤回风险?
A:2026-03 挂牌至今稳定;PhysioNet 有标准撤回政策。
§10.7 与家族和同类(10 问)
Q61:本库有哪些 MIMIC-IV 系条目?
A:MIMIC-IV-ED、mimic-iv-ecg 等已在库——本集(518)是 PE 侧翼;hadm_id/subject_id 可直连。
Q62:与 617 MIMIC-CXR-JPG 什么关系?
A:同为报告加工层——617 弱监督 14 类(规模),518 双人共识五类(精度);方法论光谱两端。
Q63:与 616 Ext-ILS 什么关系?
A:同属 MIMIC-Ext 系列——616 影像侧指令分割,518 文本侧 PE 标签;Ext 家族的两种增值标注。
Q64:Steven Horng 是谁?
A:BIDMC 临床信息科+急诊科——517 MIMIC-CXR-JPG 论文共同作者,MIMIC 生态 NLP 线的常客。
Q65:RSNA PE CT 是什么?
A:12,000+ CT studies 的 DICOM 影像+PE 标签基准(Colak 2021)——影像层互补。
Q66:INSPECT 是什么?
A:23,248 CT+报告+纵向 EHR 的多模态 PE 数据集(arXiv 2311.10798)——先例与对照。
Q67:PE 三件套怎么选?
A:影像训练选 RSNA;多模态独立研究选 INSPECT;MIMIC 生态队列选本集。
Q68:和 VTE-BERT 原论文什么关系?
A:Maghsoudi et al. 训练(癌症队列),本集是它的第二个外部验证场景(一般人群急诊+住院)。
Q69:与其他 MIMIC-Ext 家族(pe/ils)的共性?
A:都是’给母库加一层专家/自动标注’——Ext = extension 语义。
Q70:引用时最容易犯的错?
A:把 arXiv 早期人口学数字当 final(以 PhysioNet 页面为准);把’LLM’当真(实为微调 BERT)。
§10.8 生产与版本(10 问)
Q71:发布时间线?
A:arXiv 2024-11 → RPTH 正式发表 2025-05 → PhysioNet 挂牌 2026-03——先论文后数据。
Q72:Views 多少?
A:121(新集时间效应)。
Q73:版本只有 1.0.0 吗?
A:是——首发即唯一版本;latest DOI(f77d-vr35)与版本 DOI 并存是 PhysioNet 惯例。
Q74:代码在哪?
A:GitHub(页面引用 [14])+ Supplementary File 1——五步管线与 RegEx 术语表全公开。
Q75:补充材料有什么?
A:Table 1(CTPA 术语)/Table 2(PE 关键词 RegEx)/Figure 1(筛选漏斗)/Supp File 1(代码)。
Q76:批次七排位?
A:3/10(order 518,预期 rid 618)——继 516(指令分割)、517(JPG 枢纽)之后。
Q77:类目怎么定?
A:批次清单标 CT——实测为报告文本层,条目按医疗NLP(临床文本)归类,条目内说明形态。
Q78:核查了几轮?
A:3 轮——页面全量、论文链(RPTH+arXiv)、多源交叉(emergentmind/Scholar)。
Q79:预判修正了什么?
A:modality CT→文本层;发现先论文后数据的发布顺序;arXiv 早期数字与 final 的演化。
Q80:一句话总结?
A:血液科医生亲手做的 PE 金标准:2 万份双人共识报告+两条自动路的诚实成绩单。
§11 事实清单:核查记录
§11.1 身份与版本(15 条)
- 完整挂牌名:MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CT Pulmonary Angiography Radiology Reports v1.0.0
- 发布日:2026-03-23(全库次新——比 516 的 3-25 早两天)
- 版本 DOI:10.13026/5qq1-zv65;latest DOI:10.13026/f77d-vr35
- 母项目:MIMIC-IV v3.1(BIDMC 2008-2019)
- 访问:Credentialed(License 1.5.0 + DUA 1.5.0 + CITI ‘Data or Specimens Only Research’)
- 类型:报告文本层标签集(CT 影像本体不在库)
- Views:121(新集)
- 维护:MIT LCP;基建资助 NIBIB/NHLBI/NIH-OD(U24EB037545 + R01EB030362)
- Ethics:派生自 MIMIC-IV,无新患者数据采集
- COI:作者声明无
- 资助:Google Cloud Research Credits(GCP19980904)
- 代码开源:GitHub([14])+ Supplementary File 1
- 分析环境:Python 3.11(页面明示)
- 形态预判修正:批次清单 modality=CT,实测为报告文本层——按医疗NLP 归类
- 标题口径存照:arXiv 版称 ‘large language model’,实为微调 BERT
§11.2 规模与人群(15 条)
- 母库报告总量:2,321,355 份
- RegEx+query 候选:21,948 份
- 人工确认 CTPA:19,942 份
- 患者数:15,875
- 住院关联:12,355 份(62%)
- 仅急诊:7,587 份(38%)
- 中位年龄:63 岁
- 女性:56.7%
- White:58.8%
- 阳性率:7.98%(Acute+Subsegmental 1,591 / 19,942,分母为 CTPA 检查)
- arXiv 早期数字与 final 不同(median 58/51.3% female/v3.0)——以 PhysioNet final 为准(版本演化存照)
- V/Q 扫描明确排除
- 混合检查含胸部 CTA 即纳入(全身 CTA/心血管 CTA)
- 同住院多图取一份(急性优先)——365 份为此情形
- CSV 七列:note_id/subject_id/hadm_id/text/Type_of_PE/charttime/storetime
§11.3 标签体系(14 条)
- 五类:Acute / Subsegmental / Chronic / Equivocal / Negative
- Acute(急性或急慢性混合):1,358
- Subsegmental(仅亚段急性):233
- Chronic(慢性/病程不明/与既往相似):345
- Equivocal(存疑如运动伪影 vs PE):104
- Negative(无 PE/影像不佳/未描述肺动脉):17,902
- 阳性合计 1,591;阴性合计 18,351
- 双人共识制:一明(Lam 看句子+模型预测)一盲(Kovalenko 只看句子)
- 无句可提时两人审全文
- 504 份初始分歧(2.5%)全员讨论解决——无仲裁第三人
- κ=0.82(五类并二值计算)
- 共识制无留白样本——对照 517 的 disagreement 显式值
- 标签仅基于影像报告——'报告≠处置’局限明示
- Equivocal 的临床现实:可能已被按急性 PE 抗凝
§11.4 管线与模型(11 条)
- 五步识别:RR subtype→六段切分→操作段 CTPA 术语→病史段 PE 术语→CTPA 标题段→人工确认
- RegEx 句子隔离:19,942 中 18,748 份命中(94.1%)
- 无句可提 1,194 份——其中仅 1 份真急性 PE(预处理召回 1,590/1,591=99.94%)
- 无句默认标阴性(由召回数字背书)
- VTE-BERT:Bio_ClinicalBERT 微调(Maghsoudi et al.)
- 训练语料:800 癌症患者 3,000 笔记(Harris Health System)
- 原设计识别 DVT+PE;已在 VA 癌症队列外部验证
- 本集成绩=真外部验证(训练语料与本集零重叠)
- 术语表:Supplementary Table 1(CTPA)/Table 2(PE 关键词 RegEx)
- 筛选漏斗:Figure 1
- 代码:GitHub + Supplementary File 1
§11.5 对垒结果(13 条)
- VTE-BERT Sens 92.4%(95%CI 0.91-0.94)
- VTE-BERT PPV 87.8%(0.86-0.89)
- VTE-BERT Spec 98.9%(emergentmind 口径)
- VTE-BERT 最常见错误:仅慢性 PE 误判阳性
- VTE-BERT 覆盖:全部 19,942 份(含急诊 38%)
- ICD Sens 95.4%(0.94-0.96)
- ICD PPV 83.8%(0.82-0.86)
- ICD 覆盖:仅住院子集(11,990 stays)
- ICD 错误 308 份:61 漏标+108 慢性误急性+115 阴性误阳性+24 存疑误阳性
- 假阳性 247 份——基于 ICD 的发病率统计系统性虚高
- ICD 正确阳性 1,276 份中 169 亚段——仅 4 份有亚段专用码
- 结论模式:编码查全优/精确劣;模型精确优/查全略逊——都到不了人工共识可靠性
- 对垒设计价值:同金标准同台——phenotyping 研究的方法学范本
§11.6 论文与发表(12 条)
- 正式版:Lam BD, Ma S, Kovalenko I, Wang P, Jafari O, Li A, Horng S. Res Pract Thromb Haemost 2025;9(4):102896
- 正式版 DOI:10.1016/j.rpth.2025.102896;PMID 40606764;PMCID PMC12213262
- 发表日:2025-05-21(RPTH,ISTH 旗下期刊)
- arXiv 版:2411.00044(2024-11)
- 发布顺序:先论文(2025-05)后数据(2026-03)——存照
- 一作 Barbara D. Lam:BIDMC 血液科+临床信息科双科(第一位标注医生 BDL)
- 第二位标注医生:Iuliia Kovalenko(UPMC Harrisburg,IK)
- 共同通讯:Shengling Ma + Ang Li(Baylor 血液肿瘤)+ Steven Horng(BIDMC 信息+急诊)
- Steven Horng 同时是 517 MIMIC-CXR-JPG 论文共同作者——MIMIC NLP 线常客
- Peiqi Wang:MIT CSAIL(团队唯一纯 CS 机构作者,排第五)
- 团队无’纯 ML 一作’——临床科室自产数据集范本
- 团队先导工作:Chiasakul 2023 Eur J Haematol VTE AI 系统综述(Lam 参与)
§11.7 对照系(10 条)
- RSNA PE CT Dataset(Colak 2021,Radiol AI):12,000+ CT studies DICOM+PE 标签——影像层基准
- INSPECT(arXiv 2311.10798):23,248 CT+报告+纵向 EHR——多模态先例
- 本集定位:MIMIC 生态的 PE 文本层——三件套互补
- MIMIC 链接权:subject_id/hadm_id 直通 EHR/超声/胸片/心电图
- 胸片链接:本库 617(MIMIC-CXR-JPG)同患者可 join
- 与 617 对照:弱监督 14 类 vs 共识五类——规模与精度的方法论光谱
- 与 616 对照:同属 MIMIC-Ext 家族的两种增值标注
- VTE 公共卫生背景:Beckman 2010(Am J Prev Med)
- 急性 VTE 治疗背景:Becattini & Agnelli 2020(Blood)
- PE 发病率报告=医院质量指标——识别不止是研究问题
§11.8 伦理与合规(10 条)
- DUA 三条款:不共享/不再识别/发表必须公开代码
- CITI 课程覆盖每位合作者
- 研究用途限定——商用另授权
- 报告全文不可直接再分发
- 去标识:继承 MIMIC-IV Safe Harbor
- IRB:母库 BIDMC 框架,无新数据
- COI:无
- 资助披露:Google Cloud Credits + NIH 基建
- PhysioNet 撤回政策适用
- 2026-03 挂牌至今无撤回事件
§11.9 生产与版本(15 条)
- 批次七 3/10(order 518,预期 rid 618)
- FACTS.md:writing/mimic-iv-ext-pe/FACTS.md(三轮核查全录)
- 核查快照:/tmp/518_page.html(59,296 B)
- 核查轮次:页面全量→论文链(RPTH+arXiv)→多源交叉(Scholar/emergentmind)
- 预判修正一:modality CT→报告文本层
- 预判修正二:发现先论文后数据发布顺序
- 存照一:arXiv 早期数字 vs final 演化
- 存照二:LLM 标题党(实为微调 BERT)
- 存照三:先论文后数据
- 类目:医疗NLP(临床文本)
- 双检:check_md + preflight_check
- 查重:url_name=‘mimic-iv-ext-pe’ 精确匹配
- 互链计划:617/616/MIMIC-IV 系在库条目
- DAIMS:7.0(标注 9/方法 8/规模 6)
- 一句话:血液科亲手做的 PE 金标准+两条自动路的诚实成绩单
§12 术语表:五十条
1. MIMIC-IV-Ext-PE —— 本条目:MIMIC-IV 的 CTPA 报告 PE 五类标签扩展
2. MIMIC-IV v3.1 —— 母库:BIDMC 2008-2019 成人急危重症 EHR(含全部影像报告)
3. CTPA —— CT 肺动脉造影——PE 诊断的标准影像检查
4. 肺栓塞(PE) —— 血栓阻塞肺动脉——院内可预防死亡主因之一
5. VTE —— 静脉血栓栓塞(DVT+PE 的总称)——VTE-BERT 的识别目标
6. Subsegmental —— 亚段肺动脉——PE 抗凝决策的临床争议地带,本集单列 233 份
7. Equivocal —— 存疑发现(如运动伪影 vs PE)——本集独立成类的第四值
8. Chronic PE —— 慢性 PE——非急性事件,与 CTEPH 相关,本集单列 345 份
9. 金标准(gold standard) —— 双人共识全量标注——本集的标签性质定位
10. 一明一盲 —— 本集双评审协议:一人看模型预测、一人盲审——独立性与真实工作流兼顾
11. Cohen’s kappa —— 标注者间一致性系数——本集 κ=0.82(二值化后)
12. 共识裁决 —— 504 份分歧全讨论解决——无仲裁第三人的二人制
13. VTE-BERT —— Maghsoudi 等微调的 Bio_ClinicalBERT(DVT+PE 识别)——本集的自动基准
14. Bio_ClinicalBERT —— 在 MIMIC-III 临床笔记上续训的 BERT——VTE-BERT 的底座
15. 外部验证 —— 训练语料与评估数据零重叠——本集 VTE-BERT 成绩的性质
16. RegEx —— 正则表达式——CTPA 识别与 PE 句子隔离的引擎
17. snippet —— 隔离出的 PE 相关句子集——人工与模型评审的输入单元
18. ICD 编码 —— 国际疾病分类——本集对垒的’传统 phenotyping’路径(I26=PE)
19. PPV —— 阳性预测值——对垒的核心指标之一(编码 83.8% vs 模型 87.8%)
20. Sensitivity —— 灵敏度——对垒的另一核心(编码 95.4% vs 模型 92.4%)
21. 假阳性 —— 编码误标阳性的代价——本集量化 247 份
22. phenotyping —— 从病历数据识别疾病状态——本集是 PE phenotyping 的方法学教案
23. hadm_id —— MIMIC-IV 住院标识——join 临床表的钥匙
24. subject_id —— MIMIC 患者标识——跨库(含 617 胸片)join 的钥匙
25. note_id —— MIMIC-IV 笔记标识——本集 CSV 的主键
26. charttime/storetime —— 记录时间/入库时间——纵向排序的依据
27. RSNA PE CT Dataset —— 12,000+ CT 的影像层 PE 基准(Colak 2021)——三件套之一
28. INSPECT —— 23,248 CT+报告+EHR 的多模态 PE 集(2023)——三件套之二
29. RPTH —— Research and Practice in Thrombosis and Haemostasis——ISTH 旗下期刊,正式论文发表处
30. BIDMC —— Beth Israel Deaconess Medical Center——母库数据源与本集主力团队所在
31. Baylor College of Medicine —— 共同通讯(Ma/Li)所在机构
32. MIT CSAIL —— Peiqi Wang 所在——团队唯一纯 CS 机构
33. Steven Horng —— BIDMC 信息+急诊——517/518 双论文共同作者,MIMIC NLP 线常客
34. 弱监督 —— 自动生成的标签(如 617 双 labeler)——本集共识制的高一档对照
35. 双人共识制 —— 两位医生讨论达成一致的标注协议——标注工程的精度档
36. 无句即阴 —— 预处理无句可提时默认阴性的约定——由 99.94% 召回背书
37. 选择性偏倚 —— CTPA 开单已含临床怀疑——7.98% 不能当患病率的学理
38. ‘报告≠处置’ —— 影像报告结论与最终治疗决策的落差——本集明示的局限
39. CTEPH —— 慢性血栓栓塞性肺高压——Chronic 类标签的下游研究价值
40. MIMIC-Ext 家族 —— MIMIC 母库+专家/自动增值标注的派生系列(pe/ils 等)
41. DAIMS —— 本库条目评估体系(数据/标注/方法/影响力/规模)——本集 7.0
42. 标注工程光谱 —— 本库方法论叙事:全自动(616)—弱监督(617)—共识金标准(518)
43. 外部验证设计 —— 不重训、直接拿来用——本集方法上最老实的一笔
44. 编码粒度 —— ICD 无法表达亚段级(169 份中仅 4 份专用码)——五类设计的隐含批评
45. 急诊覆盖缺口 —— ICD 只覆盖住院 62%——急诊 38% 是 NLP 的独占领地
46. 发病率虚高 —— 基于 ICD 的 PE 发病统计因假阳性系统性偏高——公共卫生监测的含义
47. 一作双科 —— Lam 同属血液科与临床信息科——临床-信息复合型作者的样本
48. 半结构化报告 —— 放射报告的模板化文体——RegEx 高召回(99.94%)的文体基础
49. 先论文后数据 —— 正式发表(2025-05)先于数据挂牌(2026-03)——发布顺序存照
§10.9 研究设计实战(20 问)
Q81:想做 PE 抗凝结局研究,怎么起步?
A:Acute 类 1,358 份报告取 subject_id/hadm_id → join MIMIC-IV prescriptions 筛抗凝药 → join 结局表;Equivocal/Chronic 按排除标准处理;务必报告"报告≠处置"的局限。
Q82:想训练自己的报告分类器,怎么用这个金标准?
A:text 列先按 Supp Table 2 RegEx 隔离句子再喂模型(照抄管线);五类可并二值或保留五类;留出集按患者切分防泄漏。
Q83:想复现 VTE-BERT 的成绩?
A:权重与代码开源(GitHub);预处理照抄(无句即阴);对照 Table 2 的 92.4/87.8——注意它是外部验证口径,不要在本集重训后再比。
Q84:想量化 ICD 的虚高?
A:join diagnoses_icd 的 I26 码 vs 金标准——308 份错标账本(61/108/115/24)可直接复算;假阳性 247 份是"发病率虚高"的实证素材。
Q85:想研究亚段 PE 的管理争议?
A:Subsegmental 233 份单列可取;样本量有限(169 份住院可 ICD 对照但仅 4 份有专用码)——适合作为亚组分析而非主研究。
Q86:想建多模态 PE 模型?
A:本集给文本标签与队列键 → 影像走 RSNA PE CT/INSPECT(或 MIMIC-CXR 家族本库 606-617 的胸片)→ EHR/用药/超声经 hadm_id join——三源对齐靠 subject_id。
Q87:急诊 PE 研究为什么只能用本集?
A:38% 仅急诊报告无 discharge 编码——ICD 路径结构性缺位;这是 NLP 标签的独占领地。
Q88:想做不确定性建模?
A:Equivocal 104 份是现成的"报告层模糊"样本;对照 617 的 uncertain/disagreement 五值设计,两种不确定性语义(报告模糊 vs 模型冲突)可对比研究。
Q89:想做复发/慢性化纵向研究?
A:charttime 排序同一患者多次 CTPA;Chronic 345 份中"与既往相似"的表述本身含纵向信息;CTEPH 队列可从慢性反复者起步。
Q90:样本量够做深度学习吗?
A:文本分类够(2 万份/1,591 阳性——BERT 级微调常规量级);图像深度学习不适用(无影像);亚段级细粒度研究(233 份)建议经典 ML 或迁移学习。
Q91:标注协议能搬到我的科室吗?
A:能——一明一盲+分歧讨论制+二值化 κ 是通用协议;本集的裁决手册五类划分展示了"类=临床决策点"的设计思路。
Q92:怎么向伦理委员会论证使用合规?
A:Credentialed 框架(CITI+DUA)+ 派生数据无新采集 + 发表开源承诺——MIMIC 家族的标准论证路径,本集无新增风险点。
Q93:引用格式?
A:数据集 DOI(10.13026/5qq1-zv65)+ RPTH 论文(10.1016/j.rpth.2025.102896)+ MIMIC-IV 母库三件套。
Q94:与 RSNA PE CT 竞赛标签兼容吗?
A:不直接兼容——RSNA 是影像层 binary/类型标签,本集是报告层五类;跨库研究需自建映射并在论文中披露映射规则。
Q95:负面清单里"影像不理想"占了多少?
A:页面未单独给出 Negative 内部构成(17,902 的细分未披露)——引用时把 Negative 当黑箱,别脑补构成。
Q96:能拿到 VTE-BERT 的逐份预测吗?
A:页面/CSV 未包含模型预测列——只有金标准标签;要对照需自己跑开源权重。
Q97:外部验证为什么重要到被反复强调?
A:团队系统综述发现 VTE AI 几乎无人做外部验证——本集把"外来模型直接考试"设为设计原则,是给领域的方法论示范。
Q98:中文研究者使用有什么特别注意?
A:报告为英文(BIDMC 文体);RegEx 术语表是英文的——中文语境复用需重建术语表;其余流程(共识制/对垒设计)语言无关。
Q99:能用它教课吗?
A:极适合——管线漏斗/对垒设计/κ 读法/偏倚辨析(阳性率≠患病率)都是现成教案;Credentialed 门槛下课堂使用需每位学生过 CITI。
Q100:一句话记住这个数据集?
A:2 万份 CTPA 报告、五位数的共识 κ、两条自动路的诚实成绩单——PE 研究的"标尺"由此立起。
§11.7 研究设计与复现指南(40 条)
- 队列组装起点:Acute+Subsegmental=1,591 份报告(15,875 患者中的急性 PE 者)
- 结局变量来源:MIMIC-IV hospitals/prescriptions/labevents/ICU 表(经 hadm_id/subject_id)
- 影像侧补全:MIMIC-CXR 家族(本库 606-617)——胸片;CT 影像需 RSNA PE/INSPECT
- 心电侧补全:MIMIC-IV-ECG(本库在册)——PE 的 ECG 表型研究入口
- 超声侧补全:MIMIC-IV echo 表——右心负荷研究的经典搭配
- 复现对垒一:VTE-BERT 开源权重+Supp Table 2 RegEx+无句即阴 → 对照 92.4/87.8
- 复现对垒二:diagnoses_icd I26 码 vs 金标准(住院子集)→ 对照 95.4/83.8
- 错误账本复算:308=61+108+115+24;假阳性 247=108+115+24
- κ 复算:五类并二值(阳=Acute+Subsegmental)→ Cohen’s κ 应≈0.82
- 患者级去重:15,875 患者<19,942 报告——患者级 split 防泄漏
- 住院 stay 去重:12,355 报告→11,990 stays(365 同 stay 多图)
- 亚段研究注意:233 份总量/169 份住院/4 份 ICD 专用码——三级粒度损耗
- Equivocal 处置策略 A:排除(结局研究)
- Equivocal 处置策略 B:单列建模(不确定性/鲁棒性研究)
- Equivocal 处置策略 C:并入阳性(敏感性分析——模拟"临床按 PE 治疗")
- Chronic 处置:CTEPH 研究的入口队列;急性研究中的"既往史"协变量
- 时间窗:charttime 排序支持治疗前基线锁定
- 负样本利用:17,902 份 Negative 是"临床怀疑但除外"的高质量阴对照——非健康人群
- 偏倚三层:开单偏倚(谁做 CTPA)→阳性率≠患病率;编码偏倚(ICD 误标);报告偏倚(报告≠处置)
- 外推边界:BIDMC 单中心 2008-2019 成人——外推需在目标域重新验证
- 英文报告文体:模板化程度高是 RegEx 高召回的文体基础——跨机构复用先估文体差
- 术语表复用:Supp Table 1/2 可直接搬用——英文语境免费资产
- 中文语境:需重建术语表+重估"无句即阴"的召回——语言无关的只有协议骨架
- 与 617 联动:MIMIC-CXR-JPG 的 view position/metadata 可为 PE 患者拉胸片子集(subject_id 对齐)
- 与 616 联动:指令分割语料不含 PE 标签——本集补上文本层后多模态指令研究可行
- 与 MIMIC-IV-ED 联动:急诊 PE 的分诊-影像- disposition 链路可拼
- 与 mimic-iv-ecg 联动:PE 的 ECG 征象(S1Q3T3 等)研究入口
- 方法论引用:外部验证设计/一明一盲/分歧讨论制均可作为独立方法贡献引用
- 教学用法:漏斗图+对垒表+κ 读法三件套是 NLP 医学课程现成教案
- 评审应对:被问"标签可信吗"→κ=0.82+共识制+全量非抽样三层作答
- 被问"为什么不用 LLM"→论文正文本已自纠(BERT 够用+外部验证优先)
- 被问"为什么不只用 ICD"→247 假阳性+38% 急诊盲区双杀
- 样本量对照:1,591 阳性 vs RSNA 影像级标签量级相当——文本层成本低一个数量级
- 成本结构:2 医生×19,942 份 vs 影像像素级标注——临床班底的性价比路线
- 发布顺序启示:先论文后数据让金标准先获同行评议背书——数据集工程的新时序
- 版本风险:唯一版本(v1.0.0)——无版本碎片化困扰;latest DOI 跟踪未来更新
- 补充材料清单:Table 1 术语/Table 2 RegEx/Figure 1 漏斗/File 1 代码
- DUA 红线:报告全文不可再分发——派生嵌入/统计可共享(以 DUA 为准)
- 团队合作启示:临床科室+信息科+CS 的三方构成(血液科主导)值得复制
- 一句话方法论:金标准先行,自动路同台,局限自曝——phenotyping 的完整公开课
附录 A:发布时间线与版本对照
研究-数据双轨时间线
| 时间 | 事件 | 载体 |
|---|---|---|
| 2024-11 | arXiv 预印本(2411.00044) | “large language model” 标题(后被自纠),早期人口学数字 |
| 2025-05-21 | 正式发表 | RPTH 2025;9(4):102896(ISTH 旗下;PMID 40606764) |
| 2026-03-23 | PhysioNet 挂牌 | v1.0.0,DOI 10.13026/5qq1-zv65 |
版本口径演化对照(arXiv 2024 vs PhysioNet final 2026)
| 项 | arXiv 版 | final 版(本条目采用) |
|---|---|---|
| 母库版本 | MIMIC-IV v3.0 | v3.1 |
| 中位年龄 | 58 | 63 |
| 女性 | 51.3% | 56.7% |
| White | 59.8% | 58.8% |
| 标题用词 | large language model | transformer(正文自纠为微调 BERT) |
存照纪律:引用一律以 PhysioNet final 页面为准;arXiv 数字只作演化痕迹。
附录 B:五类标签全定义(裁决手册精神)
| 类 | 纳入(原文精神) | 排除/边界 | n | 研究含义 |
|---|---|---|---|---|
| Acute | 急性 PE;急慢性混合(按急性计) | 亚段-only 另立 | 1,358 | 抗凝指征 |
| Subsegmental | 仅亚段动脉急性 PE | 混合段归 Acute | 233 | 争议决策带 |
| Chronic | 慢性 PE;病程不明;“与既往相似” | — | 345 | 非新事件 |
| Equivocal | 运动伪影 vs PE 等存疑 | — | 104 | 灰区自由度 |
| Negative | 无 PE;影像不理想;未描述肺动脉 | — | 17,902 | 阴性池 |
二值化口径(κ 计算用):阳 = Acute+Subsegmental(1,591);阴 = 其余(18,351)。
附录 C:对垒成绩单全录(Table 2 精神)
VTE-BERT(全量 19,942)
- Sensitivity 92.4%(95%CI 0.91-0.94)
- PPV 87.8%(0.86-0.89)
- Specificity 98.9%(emergentmind 引论文口径)
- 错误模式 Top1:慢性-only → 判阳
- 覆盖:住院+急诊全量
ICD 编码(住院子集 12,355 报告/11,990 stays)
- Sensitivity 95.4%(0.94-0.96)
- PPV 83.8%(0.82-0.86)
- 错误 308 份 = 漏标 61 + 误阳 247(慢性 108/阴性 115/存疑 24)
- 亚段粒度:正确阳性 1,276 中亚段 169,专用码仅 4
读法:两者主轴都是"急慢不分"——五类金标准正是为此设计;自动路的价值在覆盖与成本,人工共识的价值在粒度与可信。
附录 D:页面与论文的口径差异存照
- 母库版本:emergentmind/早期版本称 v3.0——PhysioNet 页面 Parent Projects 明确 v3.1
- 人口学漂移:arXiv(median 58/51.3%/59.8%)vs final(63/56.7%/58.8%)——final 为准
- LLM 标题党:arXiv 标题 “large language model”——实为 1.1 亿参数微调 BERT
- ** specificity 数字**:页面只给 Sens/PPV;98.9% 来自 emergentmind 引论文——引用注明出处
- 阳性率分母:7.98% 是 CTPA 检查口径——不可外推为患病率
附录 E:五步识别管线步骤表(复现用)
| 步 | 操作 | 关键术语表 |
|---|---|---|
| 1 | 取 subtype=“RR” 的 note | — |
| 2 | 切六段:History/Indication/Procedure/Examination/Study/Technique | — |
| 3 | 操作四段含 CTPA 术语 | Supp Table 1 |
| 4 | 病史两段含 PE 术语 | Supp Table 1 |
| 5 | 存在 CTPA 标题段 | — |
| 6 | 双医生逐份确认 | 人工 |
| 7 | RegEx 隔离 PE 句 | Supp Table 2 |
| 8 | VTE-BERT 分类(无句→阴) | github 权重 |
| 9 | 双人共识裁决 | κ=0.82 |
漏斗:2,321,355 → 21,948 → 19,942(15,875 患者)。
附录 F:PE 数据集三件套对照
| 维度 | RSNA PE CT(2021) | INSPECT(2023) | MIMIC-IV-Ext-PE(本集 2026) |
|---|---|---|---|
| 规模 | 12,000+ studies | 23,248 CT | 19,942 报告 |
| 模态 | DICOM | CT+报告+EHR | 报告文本 |
| 标签 | PE 类型 | PE 类型 | 五类双人共识 |
| 生态 | 独立 | 独立 | MIMIC-IV 全生态 |
| NLP 基准 | 无 | 有(报告) | 有(+VTE-BERT 对垒) |
| 急诊覆盖 | — | — | 38%(独家) |
| 团队性质 | 学会+业界 | Stanford 系 | 血液科临床班底 |
选型:影像模型训练→RSNA;多模态独立研究→INSPECT;生态内队列+NLP→本集。
附录 G:本库 MIMIC 谱系与互链
| 本库 rid | slug | 关系 |
|---|---|---|
| 16 | mimic-cxr | MIMIC-CXR 母库(不同分册) |
| 606-616 | CXR 家族九条目 | 图像侧(617 为其枢纽) |
| 617 | mimic-cxr-jpg | 报告加工层姊妹篇:弱监督 vs 共识 |
| MIMIC-IV 系在库条目 | MIMIC-IV-ED / mimic-iv-ecg 等 | hadm_id/subject_id 直连 |
| 618 | mimic-iv-ext-pe(本条目) | PE 文本层 |
| 616 | mimic-cxr-ext-ils | Ext 家族影像侧 |
方法论光谱:全自动管线(616)→ 双 labeler 弱监督(617)→ 双人共识金标准(本集)——标注可信度的三级阶梯在 MIMIC 家族内齐了。
附录 H:批次七生产存照(518 号)
- 生产序号:批次七 3/10(order 518,预期 rid 618)
- 事实核查:3 轮——curl 页面全量(59,296 B)→ 论文链(RPTH 102896+arXiv 2411.00044)→ 多源交叉(Scholar 引用卡/emergentmind)
- 预判修正:modality CT→报告文本层(类目改医疗NLP);发布顺序先论文后数据
- 三大存照:版本演化(v3.0→v3.1/人口学漂移)、LLM 标题党、先论文后数据
- 方法论贡献条目:标注工程三级阶梯(全自动/弱监督/共识)在 MIMIC 家族内集齐
- 双检:check_md + preflight_check(发布前)
- 查重:url_name=‘mimic-iv-ext-pe’ 精确匹配(发布前)
- 下一发:519 MS-CXR-T(批次七 4/10)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rad-coreference-resolution — 共享标签:医疗NLP / 临床文本
- radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
- imcs-21 — 共享标签:医疗NLP / 临床文本
- pmc-oa-subset — 共享标签:医疗NLP / 临床文本
- pharmaconer — 共享标签:医疗NLP / 临床文本
- cxr-pro — 共享标签:医疗NLP / 临床文本
- lunguage — 共享标签:医疗NLP / 临床文本
- deap — 共享标签:医疗NLP / 临床文本
- drug-reviews-uci — 共享标签:医疗NLP / 临床文本
- meddoprof — 共享标签:医疗NLP / 临床文本
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

