MIMIC-IV-Ext-PE — 肺栓塞 CTPA 报告标签集 AI-Ready Wikipedia

2 万份 CTPA 报告的双人共识金标准:血液科医生亲手给 MIMIC-IV 装上 PE 开关

来源 MIMIC-IV v3.1 影像报告经五步 RegEx 识别+双人医生共识标注(VTE-BERT 与 ICD 编码双自动基准对照)发布时间: 2026-09-24最后更新: 2026-09-25 阅读 27
MIMIC-IV-Ext-PE — 肺栓塞 CTPA 报告标签集 AI-Ready Wikipedia

信息速览

数据集名称MIMIC-IV-Ext-PE — 肺栓塞 CTPA 报告标签集 AI-Ready Wikipedia
数据类型结构化标签,临床文本,人工标注
规模19,942 份 CTPA 报告 / 15,875 名患者(MIMIC-IV v3.1 派生,双人共识五类标签)
接入方式MIMIC-IV v3.1 影像报告经五步 RegEx 识别+双人医生共识标注(VTE-BERT 与 ICD 编码双自动基准对照)
AI 就绪度

INFOBOX:mimic-iv-ext-pe 速览

字段 值
数据集 MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CTPA Radiology Reports v1.0.0
slug mimic-iv-ext-pe
发布 2026-03-23|PhysioNet(全库次新,比 516 早两天)
DOI 10.13026/5qq1-zv65(v1.0.0)/ 10.13026/f77d-vr35(latest)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程)
母项目 MIMIC-IV v3.1
规模 19,942 份 CTPA 报告 / 15,875 患者(232 万份报告中筛出)
标签 五类:Acute 1,358 / Subsegmental 233 / Chronic 345 / Equivocal 104 / Negative 17,902
标注 双人共识制(一人看模型预测+一人盲审)|κ=0.82|504 分歧全解决
对垒 VTE-BERT(Sens 92.4%/PPV 87.8%)vs ICD 编码(Sens 95.4%/PPV 83.8%)
团队 BIDMC 血液科/信息科 + Baylor + UPMC + MIT CSAIL 七人(Lam/Horng 等)
论文 RPTH 2025;9(4):102896(2025-05-21)+ arXiv 2411.00044
一句话 血液科医生给 MIMIC-IV 装的 PE 开关:双人共识金标准 + 两条自动路的诚实对照

§0 摘要卡:从"232 万份报告"到"2 万个 PE 开关"

§0.1 名称与口径声明

本条目记录 PhysioNet 数据集 MIMIC-IV-Ext-PE(slug:mimic-iv-ext-pe),v1.0.0,2026-03-23 发布,DOI 10.13026/5qq1-zv65,Credentialed。形态口径存照:批次清单标 modality=CT,实测为 CTPA 放射报告的文本层标签集——CT 图像本体不在库,"CTPA"是报告的检查类型。标题口径存照:arXiv 版标题称 “large language model”,实际模型是微调 BERT(VTE-BERT)——论文正文自纠。

§0.2 读者收益清单

  • 血栓研究团队:1,591 例急性 PE(含 233 亚段)的即开即用队列——subject_id/hadm_id 直通 MIMIC-IV 全生态(EHR/超声/胸片/心电图)
  • 医学 NLP 工程师:双人共识金标准(κ=0.82)+ 五类分级标签——比弱监督标签高一个可靠性的标注参照
  • 方法学研究者:VTE-BERT vs ICD 的同金标准对垒——"自动标注 vs 编码标注谁更准"的公开教案
  • 急危重症数据科学家:38% 仅急诊报告——ICD 覆盖盲区的实证样本
  • MIMIC 生态用户:本库 617(MIMIC-CXR-JPG)之外的第二条报告加工层路径——临床文本侧的姊妹篇

§0.3 本条目与其他条目的阅读组合

  • 617 mimic-cxr-jpg:同为报告加工层——617 是双 labeler 弱监督 14 类(规模换精度),518 是双人共识五类(精度换规模);两种标注工程的正面参照系
  • MIMIC-IV 主线(ED/ECG 等在库条目):hadm_id/subject_id 直连——PE 队列的结局变量在 MIMIC-IV 临床表
  • 616 mimic-cxr-ext-ils:同属 MIMIC-Ext 派生系列——616 指令分割(影像),518 PE 标签(文本);Ext 家族的两种"增值标注"
  • RSNA PE CT / INSPECT(未单列):PE 领域影像层与多模态先例——本集是 MIMIC 生态文本层补位

§0.4 身份卡:一条命令背下这个数据集

名称   MIMIC-IV-Ext-PE: PE Labels for CTPA Radiology Reports
版本   v1.0.0(2026-03-23,唯一版本)
DOI    10.13026/5qq1-zv65(latest f77d-vr35)
访问   Credentialed(License 1.5.0 + DUA 1.5.0 + CITI)
规模   19,942 CTPA 报告|15,875 患者|232 万报告中筛出
标签   五类(Acute/Subsegmental/Chronic/Equivocal/Negative)
标注   双人共识|κ=0.82|504 分歧全讨论解决
对垒   VTE-BERT 92.4/87.8 vs ICD 95.4/83.8(Sens/PPV%)
论文   RPTH 2025;9(4):102896(早于数据集 10 个月)

它的故事一句话:血液科医生受够了 ICD 编码的不靠谱,于是双人盲审了 2 万份报告装上"PE 开关"——顺手证明了机器和编码都还需要这个金标准当裁判。

§1 身份卡:一张速览

MIMIC-IV-Ext-PE 是 MIMIC-IV 的第一个血液科主导的扩展数据集:把 232 万份放射报告中经五步管线确认的 19,942 份 CTPA(CT 肺动脉造影)报告,由两位医生按共识协议标注为五类 PE(肺栓塞)标签,并附上 VTE-BERT 模型与 ICD 编码两条自动路径的对照成绩单。

字段 值
完整标题 MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CT Pulmonary Angiography Radiology Reports
版本 v1.0.0(2026-03-23,唯一版本;latest DOI 10.13026/f77d-vr35)
版本 DOI 10.13026/5qq1-zv65
母项目 MIMIC-IV v3.1(BIDMC 2008-2019)
发布方 PhysioNet(MIT LCP 维护)
访问级别 Credentialed(License 1.5.0 + DUA 1.5.0)
训练门槛 CITI “Data or Specimens Only Research”
规模 19,942 份 CTPA 报告 / 15,875 名患者(住院关联 62% / 仅急诊 38%)
标签 五类:Acute 1,358 / Subsegmental 233 / Chronic 345 / Equivocal 104 / Negative 17,902
标注协议 双人共识:BDL(看句子+模型预测)+ IK(盲审句子);κ=0.82;504 份分歧全员讨论解决
人口学 中位 63 岁;女 56.7%;White 58.8%
自动对照 VTE-BERT(Sens 92.4%/PPV 87.8%)vs ICD(Sens 95.4%/PPV 83.8%,仅住院子集)
团队 7 人:Lam(BIDMC 血液+信息)/ Kovalenko(UPMC)/ Horng(BIDMC 信息+急诊)/ Ma+Li(Baylor,共同通讯)/ Jafari(Baylor ICTR)/ Wang(MIT CSAIL)
论文 RPTH 2025;9(4):102896(2025-05-21)+ arXiv 2411.00044(2024-11)
Ethics 派生自 MIMIC-IV,无新患者数据采集
COI 无(作者声明);资助 Google Cloud Research Credits(GCP19980904)
Views 121(2026-03 挂牌,新集)

§2 背景:血液科为什么要自己动手做数据集

§2.1 PE:可预防院内死亡的头部原因

肺栓塞是院内可预防死亡的主要原因——页面开篇即引用 VTE 公共卫生综述(Beckman 2010,Am J Prev Med)与急性 VTE 治疗综述(Becattini & Agnelli,Blood 2020)。典型症状(心动过速、呼吸困难、胸痛)不特异,诊断依赖 CTPA 影像;而 PE 的发病率报告已成为医院质量指标——识别病历中的 PE 病例不仅是研究问题,也是公共卫生监测问题。

§2.2 金标准荒:血栓领域的公开数据集缺口

论文说得直白:止血与血栓领域"缺少大型公开数据集"。此前领域内只有两个:RSNA PE CT Dataset(12,000+ CT study,DICOM 影像+PE 类型标签)与 INSPECT(23,248 CT+报告+纵向 EHR)。两者都不与 MIMIC 生态互通——而 MIMIC 的独特价值恰是 EHR/超声/胸片/心电图的纵向链接。本集的定位就是补上 MIMIC 生态的 PE 文本层,让 PE 队列研究可以直接 join 出多模态画像。

§2.3 为什么不用 ICD 编码?——被伤过的血液科

历史上 PE 病例识别靠人工病历审查(劳动密集不可规模化);用 ICD 编码替代则在门诊与急诊场景暴露出 poor predictive value(论文引用 [6][7])。团队此前做的 VTE AI 系统综述(Chiasakul 2023,Eur J Haematol——本集作者 Lam/Rosovsky 参与的先导工作)发现:极少有团队做过外部验证,更没有人用 transformer 从非结构化病历里识别 PE。于是血液科自己上手:先构建金标准,再量化两条自动路(模型/编码)与金标准的差距。

§2.4 团队构成的临床意义

七人团队里,第一作者与第二位标注医生来自 BIDMC 血液科/临床信息科,通讯作者在 Baylor 血液肿瘤科与 BIDMC 信息/急诊科——没有一位"纯 ML 背景"的第一作者(唯一的 CSAIL 作者 Peiqi Wang 排第五)。这与 KAIST 班底的 516(工程主导全自动管线)形成方法论光谱的两端:临床科室自产数据集,标注协议与临床工作流(双人阅片+意见分歧讨论制)直接同构。

§3 管线解剖:232 万份报告怎么变成 2 万个标签

§3.1 五步 CTPA 识别

  1. 取材:MIMIC-IV 全部 2,321,355 份影像报告中取 subtype=“RR”(radiology report)的note;
  2. 分段:把报告切成 History / Indication / Procedure / Examination / Study / Technique 六类节;
  3. 操作段筛:Procedure/Examination/Study/Technique 段含 CTPA 相关术语;
  4. 病史段筛:History/Indication 段含 PE 相关术语(临床开单理由);
  5. 标题段筛:存在以 CTPA 为标题的独立段落。
    候选 21,948 份 → 两位医生逐份人工确认 → 19,942 份真 CTPA(15,875 患者)。

纳入边界细节:混合检查只要有胸部 CT 血管造影即纳入(全身 CTA、心血管 CTA 都算);核医学的 V/Q(通气/灌注)扫描明确排除——影像模态边界与临床习惯一致。

§3.2 RegEx 句子隔离

对确认的 CTPA 报告,用 RegEx 算法找含 PE 关键词的句子,隔离出来合并成"snippet note"(术语表见补充材料 Table 1/Table 2)。这一步的成绩:19,942 份中 18,748 份(94.1%)成功隔离出至少一句;剩下 1,194 份无句可提——人工核查发现其中只有 1 份是真急性 PE。也就是说,"句子隔离"这个看似粗暴的预处理,召回率是 1,590/1,591 = 99.94%——规则式预处理在高度模板化的放射报告上依然很强。

§3.3 VTE-BERT:一个"外来"的分类器

VTE-BERT 不是为本集重新训练的:它是 Maghsoudi 等人先前用 800 名癌症患者的 3,000 份临床笔记(progress notes/出院小结/影像报告,来自 Harris Health System)微调 Bio_ClinicalBERT 得到的 VTE(DVT+PE)识别模型,已在 VA 癌症队列外部验证过。本集直接拿来用——模型训练语料与本集 CTPA 报告零重叠,因此 VTE-BERT 在本集的成绩是真外部验证而非同分布测试。这在 NLP 标注工具的文献里是少见的老实做法。

无句即阴的约定:预处理没隔离出任何句子的报告,直接标为阴性(no PE)——由上面的召回数字背书(1,194 份里只漏了 1 个真阳性)。

§3.4 双人共识裁决:一明一盲

  • 医生 1(BDL,Lam):看隔离句子 + VTE-BERT 的预测结果(模型辅助阅片);
  • 医生 2(IK,Kovalenko):只看隔离句子,对模型预测全盲;
  • 无句可提的报告两人都看全文;
  • 五类标准(详见 §4):Positive(Acute/Subsegmental)与 Negative(Chronic/Equivocal/Negative);
  • 冲突处理:504 份(2.5%)存在不一致,全部通过两人讨论达成一致(讨论至共识,无仲裁第三人);
  • 一致性:五类并成二值(阳/阴)后算 Cohen’s κ = 0.82——"substantial agreement"上缘。

一明一盲的设计哲学:医生 1 看得到模型预测,模拟的是"人机协同阅片"的未来工作流;医生 2 全盲,保住的是"纯人类金标准"的独立性。κ=0.82 是在盲侧可计算的独立性指标——这比两个都看模型的"共识"更有说服力。

§4 五类标签体系:比"阳/阴"多想三步

§4.1 为什么是五类而不是二类

两位医生的裁决手册把 PE 发现切成五类——每类都对应一个真实的临床决策分歧点:

类 定义 n 临床含义
Acute 急性 PE,或急慢性混合 1,358 需要抗凝治疗
Subsegmental 仅亚段动脉的急性 PE 233 治疗存在争议的灰色地带
Chronic 慢性 PE/病程不明/与既往扫描相似 345 不是新事件——抗凝决策不同
Equivocal 存疑发现(如运动伪影 vs PE) 104 需进一步检查或临床判断
Negative 无 PE/影像质量不足以判断/未描述肺动脉 17,902 阴性对照池

阳性合计 1,591(7.98%),阴性 18,351。"仅慢性"与"存疑"没有被塞进阴性而各自成类——这是本集比多数 ICD/弱监督标签精细的地方:研究者可以按研究问题自行决定"慢性算不算暴露"“存疑进不进训练集”。

§4.2 亚段(subsegmental)为何单列

亚段 PE 的临床处理是血液学的经典争议(是否抗凝因人而异)。金标准专门单列了 233 份仅亚段受累的急性 PE;ICD 对照里 1,276 份正确阳性中 169 份实为亚段——而 ICD 码里只有 4 份用了亚段专用编码。编码粒度跟不上临床粒度,这是五类设计给出的隐含批评。

§4.3 κ=0.82 的读法

504 份(2.5%)初始不一致在五类并二值后计算 κ=0.82。三点读法:其一,分歧主要发生在类间细界(慢性 vs 阴性、存疑 vs 阳性)而非阳/阴主轴;其二,全部 504 份经讨论达成一致——共识制没有"留白"样本(对照 517 五值里 disagreement 类的存在);其三,κ 是二值化的,五类原始一致性只会更低——引用时别把 0.82 说成"五类 κ"。

§5 对垒结果:模型、编码与人工的三角

§5.1 VTE-BERT 的成绩单

指标 VTE-BERT 95% CI
灵敏度 Sensitivity 92.4% 0.91-0.94
阳性预测值 PPV 87.8% 0.86-0.89
特异度 Specificity 98.9% —(emergentmind 口径)

最常见错误:把仅描述慢性 PE 的报告判为阳性——恰好是五类设计里单列 Chronic 的原因:自动模型分不清"急"与"慢",而这对治疗决策是天壤之别。

覆盖面:全部 19,942 份(含急诊 38%)。

§5.2 ICD 编码的成绩单

住院子集(12,355 份报告/11,990 次住院;365 份同住院多图只计一次)上:Sens 95.4%(0.94-0.96)/ PPV 83.8%(0.82-0.86)。

错误账本(308 份错标):61 份急性 PE 无任何相关 ICD 码(漏报);有急性 PE 码的里面,108 份实为慢性、115 份根本阴性、24 份存疑——假阳性 247 份。亚段粒度:1,276 份正确阳性中 169 份亚段,仅 4 份有亚段专用码。

§5.3 三角关系的读法

维度 VTE-BERT ICD 编码 人工共识
灵敏度 92.4% 95.4% 金标准
精确率 PPV 87.8% 83.8% 金标准
覆盖 全部(含急诊) 仅住院 全部
粒度 二值(阳/阴) 二值+4 个亚段码 五类
成本 零边际 零边际 2 医生×2 万份

三个结论:其一,ICD 查全略优但假阳性多 247 份——流行病学发病率统计若基于 ICD 会系统性虚高;其二,VTE-BERT 精确率优势换来的是急诊覆盖(ICD 在急诊没有对应 discharge 编码);其三,两条自动路都在"急 vs 慢"上翻车——这正是人工五类金标准不可替代的部分。

§5.4 局限声明(页面原文精神)

标签仅基于影像报告——报告上写 equivocal 的病例,临床可能已按急性 PE 抗凝(“报告≠处置”);ICD 对照无法覆盖急诊 38%;VTE-BERT 的跨域误差(癌症语料→一般人群)未在集内进一步拆解。

§6 生态位:PE 数据集三件套与 MIMIC 链接权

§6.1 三件套对照

维度 RSNA PE CT(2021) INSPECT(2023) 本集(2026)
规模 12,000+ CT studies 23,248 CT 19,942 报告
模态 DICOM 影像 CT+报告+EHR 报告文本+标签
标签 PE 类型(影像层) PE 类型 五类(双人共识)
生态 独立竞赛集 独立 MIMIC-IV 全生态
访问 需协议 需协议 Credentialed

§6.2 MIMIC 链接权:本集的真正卖点

note_id/subject_id/hadm_id 三键直通 MIMIC-IV 的全部临床表——一条 join 就能拉出 PE 患者的纵向 EHR、用药(抗凝处方)、超声心动、胸片(本库 617)、心电图。Usage Notes 把这个卖点说得明确:支持"多模态 PE 管理"研究与"模型外推验证"。对 MIMIC 生态内的团队,这是最快的一条 PE 队列组装路径。

§6.3 与 617 的方法论对照

同是"放射报告加工层",两条路线值得并排看:

617 MIMIC-CXR-JPG 518 本集
标注引擎 CheXpert+NegBio 规则 NLP 双人医生共识(+VTE-BERT 基准)
标签性质 弱监督(验证集 687 份) 金标准(全量 19,942 份)
粒度 14 类五值 五类单值
规模哲学 全库 37.7 万图全标 精筛 2 万份全标
不确定性处理 uncertain/disagreement 显式值 Equivocal 独立成类
发表 arXiv(工程叙事) RPTH 期刊(临床叙事)

规模换精度 vs 精度换规模——两条路线没有优劣,取决于下游任务要的是训练信号量还是评估可信度。

§7 AI-Ready 十问

一问:什么格式? 单个 CSV(MIMIC-IV-Ext-PE.csv):note_id/subject_id/hadm_id/text 报告全文/Type_of_PE/charttime/storetime——零解析成本。

二问:多大规模? 19,942 份 CTPA 报告/15,875 患者;1,591 阳性(7.98%)/18,351 阴性;单文件即全库。

三问:标注是什么性质? 双人医生共识金标准(一明一盲协议,κ=0.82,全量标注非抽样)——比弱监督高一级;另有 VTE-BERT 自动预测可对照。

四问:许可与门槛? Credentialed:License 1.5.0+DUA 1.5.0+CITI 课程;发表必须开源代码。

五问:伦理完备度? 派生自 MIMIC-IV(其 BIDMC IRB 免知情同意框架),无新患者数据;COI 无;资助(Google Cloud Credits)披露。

六问:可复现性? 五步识别管线+RegEx 术语表+代码(GitHub+Supplementary)全公开;VTE-BERT 外部验证设计避免了同分布作弊。

七问:标签的可信边界? 共识制消除了标注者间分歧,但"报告≠处置"——Equivocal 104 份与慢性 345 份的治疗语义要研究者自行裁定;亚段类 233 份样本量有限。

八问:适合什么任务? PE 队列组装(join MIMIC-IV 全生态)、医学 NLP 微调/评估(报告→标签)、NLP 算法基准(对垒 VTE-BERT/ICD 成绩单)、流行病学修正(ICD 虚高量化)。

九问:不适合什么? 影像模型训练(无 CT 图像——影像需求走 RSNA PE CT/INSPECT);抗凝结局研究需另 join 处方与随访表;儿科不适用(MIMIC-IV 为成人)。

十问:一句话定位? 血液科亲手做的 PE 金标准——用 2 万份双人共识报告,给"编码不靠谱、模型待验证"两个老问题立了一面公开的镜子。

§8 误解与反直觉

误解一:“这是 CT 影像数据集。” 不是——影像本体不在库,这是 CTPA 报告的文本层标签集。要影像走 RSNA PE CT(12,000 studies DICOM)或 INSPECT(23,248 CT)。

误解二:“arXiv 标题说 large language model,所以用的是 GPT 类模型。” 标题党存照:实际是微调的 Bio_ClinicalBERT(VTE-BERT,1.1 亿参数级),论文正文自我纠正为 “transformer language model”。

误解三:“VTE-BERT 是为这个数据集训练的。” 恰相反——它训练于 800 名癌症患者的 3,000 份笔记(Harris Health System),与本集 CTPA 语料零重叠,成绩是真外部验证。这是本集方法上最老实的一笔。

误解四:“ICD 灵敏度 95.4% 比 VTE-BERT 92.4% 高,所以编码更好。” 灵敏度只是半张成绩单:ICD 的 PPV 只有 83.8%(308 份错标,假阳性 247),且只能覆盖住院 62%——急诊 38% 的报告编码无从谈起。

误解五:“7.98% 的阳性率代表 MIMIC-IV 的 PE 患病率。” 这是"CTPA 检查"中的阳性率(临床开单已有选择性偏倚),不是人群或住院人群患病率——引用时注意分母是"做了 CTPA 的人"。

误解六:“κ=0.82 是五类一致性。” 五类并成二值(阳/阴)后才算的 κ——类间细界(慢性/存疑/亚段)的一致性没有单独报告,五类原始 κ 必然更低。

误解七:“Equivocal 是标注错误。” 不是——104 份存疑是报告本身的模糊(如运动伪影 vs PE),独立成类是给研究者的自由度:抗凝结局研究可排除,鲁棒性研究可保留。

误解八:“数据集 2026 年发布,所以是 2026 年的研究。” 正式论文 2025 年 5 月已在 RPTH 发表——先论文后数据,数据集挂牌是研究的"出厂后置"。

误解九:“双人共识就没有不确定。” 共识制消除的是标注者间分歧;报告文本本身的模糊(报告≠处置)依然存在——Usage Notes 明确承认 equivocal 可能被临床按急性 PE 处理。

误解十:“RegEx 句子隔离会漏掉很多阳性。” 1,194 份无句可提的报告里只有 1 份真急性 PE——预处理召回 99.94%。在高度模板化的放射报告上,规则式预处理的召回远比想象可靠(代价在精度端,由人工把守)。

误解十一:“可以用它研究儿童 PE。” MIMIC-IV 是成人库——儿科 PE 研究需要其他数据源。

误解十二:“拿到 CSV 就能直接发表临床结论。” DUA 条款照旧:发表必须开源代码;且标签是报告层——任何"治疗-结局"结论都需要 join MIMIC-IV 处方/随访表自行验证。

§9 工作实例:从 CSV 到 PE 队列

§9.1 加载与分布盘点(纯 pandas)

import pandas as pd

pe = pd.read_csv('MIMIC-IV-Ext-PE.csv')
print(pe['Type_of_PE'].value_counts())
# Acute          1358
# Negative     17902  (按 final 页面口径换算)
# Chronic         345
# Subsegmental    233
# Equivocal       104
print(pe['subject_id'].nunique())   # 15,875

# 阳性队列(急性含亚段)
acute = pe[pe['Type_of_PE'].isin(['Acute', 'Subsegmental'])]   # 1,591 份报告

§9.2 join 出多模态 PE 画像(MIMIC 生态)

# hadm_id -> MIMIC-IV hospitalizations(用药/实验室/结局)
# subject_id -> MIMIC-CXR-JPG 图像(本库 rid 617,键 dicom_id 经 metadata)
# 急性 PE 患者的抗凝处方:join prescriptions 表筛抗凝药
# 超声/心电图:echoecg 表与 MIMIC-IV-ECG(本库在册条目)

§9.3 复现"模型 vs 编码"对垒

# VTE-BERT:github 开源权重(Maghsoudi et al.),输入 text 列
#   预处理按 Supplementary Table 2 的 RegEx 隔离句子;无句 -> 阴性
# ICD 对比:join MIMIC-IV diagnoses_icd,筛 I26 系列(肺栓塞)
#   分母 = 住院子集 11,990 stays(急诊报告无 discharge 编码)
# 目标:复现 Sens 92.4/PPV 87.8 vs Sens 95.4/PPV 83.8

§9.4 标注工程的三课

  1. 一明一盲:如果想既有独立性又有人机协同的真实感,复制本集的双评审设计——盲侧保 κ 可算,明侧模拟真实工作流;
  2. 无句即阴要背书:本集用"1,194 份无句仅 1 阳性"给默认阴性兜底——你的规则式预处理也要给出等价的召回证据;
  3. 五类比二值值钱:Chronic/Equivocal 单列后,"自动模型分不清急慢"这个发现才成为可能——粒度设计决定能发现什么。

实操提醒:text 列是报告全文(含模板段落),直接拿去训分类器会引入模板噪声——本集管线已示范"先隔离相关句再喂模型"的正确姿势。

§5.6 常见踩坑清单

坑 后果 避法
坑点1:当影像数据集用 找不到 CT 文件 文本层标签集;影像走 RSNA PE/INSPECT
坑点2:阳性率当患病率 流行病学推断错误 分母是 CTPA 检查(选择性偏倚)
坑点3:ICD 数字外推到急诊 覆盖虚高 ICD 仅住院 62%;急诊 38% 无编码
坑点4:κ=0.82 当五类一致性 高估类间一致 二值化后计算;类间细界未单独报告
坑点5:Equivocal 直接丢 白白放弃鲁棒性素材 按研究问题裁定(§4.1 表)
坑点6:VTE-BERT 当同分布基线 复现不出论文数字 外部验证设计;重训后数字不可比
坑点7:全文直训分类器 模板噪声进模型 先句子隔离(§3.2)再喂模型
坑点8:忽略"报告≠处置" 治疗-结局结论失真 join 处方/随访表自行验证(§5.4)

DAIMS 评估:数据可得性 6(Credentialed 标准流程)/ 标注 9(双人共识全量金标准 κ=0.82,全库标注最高档)/ 方法 8(管线全开源+外部验证设计+双基准对照)/ 影响力 6(2026 新集,RPTH 期刊影响力待累积)/ 规模 6(2 万份报告,单文件)——DAIMS:7.0(对照:617 弱监督全量 7.8、616 全自动指令分割 7.0、510 人工掩码 8.0)。

§10 FAQ:九十问速查

§10.1 身份与获取(10 问)

Q1:MIMIC-IV-Ext-PE 是什么?

A:MIMIC-IV 的 PE 标签扩展:19,942 份 CTPA 放射报告(15,875 患者)由两位医生共识标注五类肺栓塞标签。

Q2:它和 MIMIC-IV 是什么关系?

A:wholly derived 派生——报告全文与键(note_id/subject_id/hadm_id)都来自母库 MIMIC-IV v3.1,本集只加标签层。

Q3:包含 CT 影像吗?

A:不包含——这是报告的文本层标签集;CT 影像需求走 RSNA PE CT Dataset 或 INSPECT。

Q4:最新版本?

A:v1.0.0(2026-03-23,唯一版本)。

Q5:DOI 怎么引?

A:版本 DOI 10.13026/5qq1-zv65;latest DOI 10.13026/f77d-vr35;论文 DOI 10.1016/j.rpth.2025.102896。

Q6:在哪里下载?

A:PhysioNet:physionet.org/content/mimic-iv-ext-pe/,Credentialed 档位。

Q7:申请门槛?

A:CITI ‘Data or Specimens Only Research’ 课程(每位合作者)+ 签署 DUA 1.5.0 + MIT LCP 审核。

Q8:要花钱吗?

A:免费——Credentialed 是身份与用途门槛,非付费墙。

Q9:论文是哪篇?

A:Lam et al. Res Pract Thromb Haemost 2025;9(4):102896(2025-05-21);另有 arXiv 2411.00044(2024-11 预印本)。

Q10:团队是谁?

A:七人:BIDMC 血液科/信息科(Lam、Horng)+ Baylor 血液肿瘤(Ma、Li,共同通讯)+ UPMC Harrisburg(Kovalenko)+ Baylor ICTR(Jafari)+ MIT CSAIL(Wang)。

§10.2 规模与口径(10 问)

Q11:母库报告总量多少?

A:2,321,355 份(MIMIC-IV 全部影像报告)。

Q12:候选与确认多少?

A:RegEx+query 候选 21,948 份 → 双医生人工确认 19,942 份真 CTPA。

Q13:多少名患者?

A:15,875 名(成人)。

Q14:住院与急诊比例?

A:住院关联 12,355 份(62%);仅急诊 7,587 份(38%)——后者无 ICD 对照。

Q15:阳性多少?

A:急性 PE 1,591 份(Acute 1,358 + Subsegmental 233),阳性率 7.98%(以 CTPA 检查为分母)。

Q16:阴性细类?

A:Negative 17,902 / Chronic 345 / Equivocal 104(合计 18,351)。

Q17:人口学?

A:中位 63 岁;女 56.7%;White 58.8%(final 页面口径——arXiv 早期版数字不同,以 final 为准)。

Q18:CSV 有哪些列?

A:note_id / subject_id / hadm_id / text(报告全文)/ Type_of_PE(五类)/ charttime / storetime。

Q19:时间跨度?

A:母库 MIMIC-IV 的 2008-2019(BIDMC)。

Q20:V/Q 扫描在库里吗?

A:不在——明确排除(仅 CTPA 及含胸部 CTA 的混合检查)。

§10.3 管线与标注(12 问)

Q21:CTPA 怎么识别的?

A:五步:RR subtype 报告→六段切分→操作段含 CTPA 术语→病史段含 PE 术语→含 CTPA 标题段→人工确认。

Q22:两个人怎么分工?

A:医生 1(Lam)看隔离句子+VTE-BERT 预测(明);医生 2(Kovalenko)只看句子(盲);无句看全文。

Q23:为什么一明一盲?

A:盲侧保金标准独立性与 κ 可算;明侧模拟人机协同工作流——两种真实性都要。

Q24:分歧怎么处理?

A:504 份(2.5%)不一致全部两人讨论达成共识——无仲裁第三人、无留白样本。

Q25:κ 是多少?

A:0.82(五类并二值后计算)——substantial agreement 上缘。

Q26:句子隔离是什么?

A:RegEx 找含 PE 关键词的句子合并成 snippet——19,942 份中 18,748 份命中(94.1%)。

Q27:无句可提的报告怎么办?

A:1,194 份默认标阴性——人工核查其中仅 1 份真急性 PE,预处理召回 99.94%。

Q28:VTE-BERT 是什么?

A:Maghsoudi 等用 800 癌症患者 3,000 笔记微调的 Bio_ClinicalBERT(识别 DVT+PE),已在 VA 癌症队列外部验证。

Q29:VTE-BERT 是为本集训练的吗?

A:不是——训练语料与本集零重叠,本集成绩是真外部验证(方法上的老实设计)。

Q30:标签的舍入路径?

A:先五类(Acute/Subsegmental/Chronic/Equivocal/Negative)——研究问题决定并类方式。

Q31:混合检查怎么处理?

A:含胸部 CTA 即纳入(全身 CTA/心血管 CTA 算);一个住院多图取一份(急性优先)。

Q32:用的什么 Python?

A:全部分析 Python 3.11(页面明示);代码开源在 GitHub。

§10.4 对垒与性能(10 问)

Q33:VTE-BERT 的成绩?

A:Sens 92.4%(0.91-0.94)/ PPV 87.8%(0.86-0.89)/ Spec 98.9%(emergentmind 口径)——覆盖全部 19,942 份。

Q34:VTE-BERT 最常见错误?

A:把仅慢性 PE 的报告判为阳性——急慢不分是规则/模型的共同短板。

Q35:ICD 的成绩?

A:Sens 95.4%(0.94-0.96)/ PPV 83.8%(0.82-0.86)——仅住院子集 11,990 stays。

Q36:ICD 错在哪?

A:308 份错标:61 漏标(急性无码)+108 慢性误急性+115 阴性误阳性+24 存疑误阳性——假阳性 247。

Q37:亚段在 ICD 里什么地位?

A:1,276 正确阳性中 169 份亚段——只有 4 份用了亚段专用码,编码粒度跟不上临床。

Q38:谁更好?

A:各赢一半:ICD 查全、VTE-BERT 精确+急诊覆盖——都到不了人工共识的可靠性。

Q39:能复现对垒吗?

A:能——VTE-BERT 权重开源、RegEx 表公开、ICD join 逻辑在论文 Table 2。

Q40:特异度是多少?

A:VTE-BERT 98.9%(emergentmind 引论文口径;页面给 Sens/PPV 为主)。

Q41:为什么 ICD 查全更高?

A:住院 discharge 编码由编码员按病历全貌填写,不只看影像报告——信息源更宽(但更不准)。

Q42:这个对垒的普适教训?

A:编码(宽信息源+低粒度+覆盖缺口)vs NLP(窄信息源+高速度+跨域误差)——任何 phenotyping 研究都该像本集一样给两者同台。

§10.5 标签语义与研究设计(10 问)

Q43:7.98% 是患病率吗?

A:不是——是 CTPA 检查中的阳性率(临床开单已有选择偏倚),非人群/住院患病率。

Q44:Equivocal 104 份怎么用?

A:按研究问题裁定:抗凝结局研究可排除;鲁棒性/不确定性研究可保留或单独建模。

Q45:Chronic 345 份算暴露吗?

A:看研究定义——慢性 PE 不是急性事件,但与慢性血栓栓塞性肺高压(CTEPH)研究相关。

Q46:Subsegmental 为什么值得单列?

A:抗凝决策的临床争议地带;ICD 仅 4/169 有专用码——粒度鸿沟的实证。

Q47:'报告≠处置’什么意思?

A:报告写 equivocal 的病例可能已被按急性 PE 抗凝——标签是报告层,治疗语义要 join 处方表自行验证。

Q48:能研究儿童吗?

A:不能——MIMIC-IV 是成人库。

Q49:能直接下治疗结论吗?

A:不能——需要 join MIMIC-IV prescriptions/随访表;标签只描述报告说了什么。

Q50:阳性率与其他库可比吗?

A:谨慎——RSNA/INSPECT 的分母与纳入标准不同;本集是’临床怀疑 PE 而做 CTPA’的真实流。

Q51:急诊报告的特殊价值?

A:38% 仅急诊——这是 ICD 编码无法覆盖的人群,NLP 标签是唯一选择。

Q52:纵向研究怎么设计?

A:charttime/storetime 支持同一患者多次 CTPA 的时间排序——急转慢、复发研究的入口。

§10.6 伦理与合规(8 问)

Q53:伦理审查情况?

A:派生自 MIMIC-IV(BIDMC IRB 免知情同意框架),无新患者数据采集。

Q54:COI?

A:作者声明无利益冲突。

Q55:资助方?

A:Google Cloud Research Credits(GCP19980904);PhysioNet 基建由 NIBIB/NHLBI/NIH-OD 支持(U24EB037545+R01EB030362)。

Q56:DUA 义务?

A:不共享/不再识别/发表必须公开代码——MIMIC 家族标准三条。

Q57:能再分发吗?

A:不能直接再分发报告全文;派生统计与模型共享以 DUA 1.5.0 为准。

Q58:患者隐私怎么保护?

A:继承 MIMIC-IV 的 Safe Harbor 去标识;text 列为已去标识报告。

Q59:商用可以吗?

A:限研究用途;商用需另行授权。

Q60:撤回风险?

A:2026-03 挂牌至今稳定;PhysioNet 有标准撤回政策。

§10.7 与家族和同类(10 问)

Q61:本库有哪些 MIMIC-IV 系条目?

A:MIMIC-IV-ED、mimic-iv-ecg 等已在库——本集(518)是 PE 侧翼;hadm_id/subject_id 可直连。

Q62:与 617 MIMIC-CXR-JPG 什么关系?

A:同为报告加工层——617 弱监督 14 类(规模),518 双人共识五类(精度);方法论光谱两端。

Q63:与 616 Ext-ILS 什么关系?

A:同属 MIMIC-Ext 系列——616 影像侧指令分割,518 文本侧 PE 标签;Ext 家族的两种增值标注。

Q64:Steven Horng 是谁?

A:BIDMC 临床信息科+急诊科——517 MIMIC-CXR-JPG 论文共同作者,MIMIC 生态 NLP 线的常客。

Q65:RSNA PE CT 是什么?

A:12,000+ CT studies 的 DICOM 影像+PE 标签基准(Colak 2021)——影像层互补。

Q66:INSPECT 是什么?

A:23,248 CT+报告+纵向 EHR 的多模态 PE 数据集(arXiv 2311.10798)——先例与对照。

Q67:PE 三件套怎么选?

A:影像训练选 RSNA;多模态独立研究选 INSPECT;MIMIC 生态队列选本集。

Q68:和 VTE-BERT 原论文什么关系?

A:Maghsoudi et al. 训练(癌症队列),本集是它的第二个外部验证场景(一般人群急诊+住院)。

Q69:与其他 MIMIC-Ext 家族(pe/ils)的共性?

A:都是’给母库加一层专家/自动标注’——Ext = extension 语义。

Q70:引用时最容易犯的错?

A:把 arXiv 早期人口学数字当 final(以 PhysioNet 页面为准);把’LLM’当真(实为微调 BERT)。

§10.8 生产与版本(10 问)

Q71:发布时间线?

A:arXiv 2024-11 → RPTH 正式发表 2025-05 → PhysioNet 挂牌 2026-03——先论文后数据。

Q72:Views 多少?

A:121(新集时间效应)。

Q73:版本只有 1.0.0 吗?

A:是——首发即唯一版本;latest DOI(f77d-vr35)与版本 DOI 并存是 PhysioNet 惯例。

Q74:代码在哪?

A:GitHub(页面引用 [14])+ Supplementary File 1——五步管线与 RegEx 术语表全公开。

Q75:补充材料有什么?

A:Table 1(CTPA 术语)/Table 2(PE 关键词 RegEx)/Figure 1(筛选漏斗)/Supp File 1(代码)。

Q76:批次七排位?

A:3/10(order 518,预期 rid 618)——继 516(指令分割)、517(JPG 枢纽)之后。

Q77:类目怎么定?

A:批次清单标 CT——实测为报告文本层,条目按医疗NLP(临床文本)归类,条目内说明形态。

Q78:核查了几轮?

A:3 轮——页面全量、论文链(RPTH+arXiv)、多源交叉(emergentmind/Scholar)。

Q79:预判修正了什么?

A:modality CT→文本层;发现先论文后数据的发布顺序;arXiv 早期数字与 final 的演化。

Q80:一句话总结?

A:血液科医生亲手做的 PE 金标准:2 万份双人共识报告+两条自动路的诚实成绩单。

§11 事实清单:核查记录

§11.1 身份与版本(15 条)

  1. 完整挂牌名:MIMIC-IV-Ext-PE: Pulmonary Embolism Labels for CT Pulmonary Angiography Radiology Reports v1.0.0
  2. 发布日:2026-03-23(全库次新——比 516 的 3-25 早两天)
  3. 版本 DOI:10.13026/5qq1-zv65;latest DOI:10.13026/f77d-vr35
  4. 母项目:MIMIC-IV v3.1(BIDMC 2008-2019)
  5. 访问:Credentialed(License 1.5.0 + DUA 1.5.0 + CITI ‘Data or Specimens Only Research’)
  6. 类型:报告文本层标签集(CT 影像本体不在库)
  7. Views:121(新集)
  8. 维护:MIT LCP;基建资助 NIBIB/NHLBI/NIH-OD(U24EB037545 + R01EB030362)
  9. Ethics:派生自 MIMIC-IV,无新患者数据采集
  10. COI:作者声明无
  11. 资助:Google Cloud Research Credits(GCP19980904)
  12. 代码开源:GitHub([14])+ Supplementary File 1
  13. 分析环境:Python 3.11(页面明示)
  14. 形态预判修正:批次清单 modality=CT,实测为报告文本层——按医疗NLP 归类
  15. 标题口径存照:arXiv 版称 ‘large language model’,实为微调 BERT

§11.2 规模与人群(15 条)

  1. 母库报告总量:2,321,355 份
  2. RegEx+query 候选:21,948 份
  3. 人工确认 CTPA:19,942 份
  4. 患者数:15,875
  5. 住院关联:12,355 份(62%)
  6. 仅急诊:7,587 份(38%)
  7. 中位年龄:63 岁
  8. 女性:56.7%
  9. White:58.8%
  10. 阳性率:7.98%(Acute+Subsegmental 1,591 / 19,942,分母为 CTPA 检查)
  11. arXiv 早期数字与 final 不同(median 58/51.3% female/v3.0)——以 PhysioNet final 为准(版本演化存照)
  12. V/Q 扫描明确排除
  13. 混合检查含胸部 CTA 即纳入(全身 CTA/心血管 CTA)
  14. 同住院多图取一份(急性优先)——365 份为此情形
  15. CSV 七列:note_id/subject_id/hadm_id/text/Type_of_PE/charttime/storetime

§11.3 标签体系(14 条)

  1. 五类:Acute / Subsegmental / Chronic / Equivocal / Negative
  2. Acute(急性或急慢性混合):1,358
  3. Subsegmental(仅亚段急性):233
  4. Chronic(慢性/病程不明/与既往相似):345
  5. Equivocal(存疑如运动伪影 vs PE):104
  6. Negative(无 PE/影像不佳/未描述肺动脉):17,902
  7. 阳性合计 1,591;阴性合计 18,351
  8. 双人共识制:一明(Lam 看句子+模型预测)一盲(Kovalenko 只看句子)
  9. 无句可提时两人审全文
  10. 504 份初始分歧(2.5%)全员讨论解决——无仲裁第三人
  11. κ=0.82(五类并二值计算)
  12. 共识制无留白样本——对照 517 的 disagreement 显式值
  13. 标签仅基于影像报告——'报告≠处置’局限明示
  14. Equivocal 的临床现实:可能已被按急性 PE 抗凝

§11.4 管线与模型(11 条)

  1. 五步识别:RR subtype→六段切分→操作段 CTPA 术语→病史段 PE 术语→CTPA 标题段→人工确认
  2. RegEx 句子隔离:19,942 中 18,748 份命中(94.1%)
  3. 无句可提 1,194 份——其中仅 1 份真急性 PE(预处理召回 1,590/1,591=99.94%)
  4. 无句默认标阴性(由召回数字背书)
  5. VTE-BERT:Bio_ClinicalBERT 微调(Maghsoudi et al.)
  6. 训练语料:800 癌症患者 3,000 笔记(Harris Health System)
  7. 原设计识别 DVT+PE;已在 VA 癌症队列外部验证
  8. 本集成绩=真外部验证(训练语料与本集零重叠)
  9. 术语表:Supplementary Table 1(CTPA)/Table 2(PE 关键词 RegEx)
  10. 筛选漏斗:Figure 1
  11. 代码:GitHub + Supplementary File 1

§11.5 对垒结果(13 条)

  1. VTE-BERT Sens 92.4%(95%CI 0.91-0.94)
  2. VTE-BERT PPV 87.8%(0.86-0.89)
  3. VTE-BERT Spec 98.9%(emergentmind 口径)
  4. VTE-BERT 最常见错误:仅慢性 PE 误判阳性
  5. VTE-BERT 覆盖:全部 19,942 份(含急诊 38%)
  6. ICD Sens 95.4%(0.94-0.96)
  7. ICD PPV 83.8%(0.82-0.86)
  8. ICD 覆盖:仅住院子集(11,990 stays)
  9. ICD 错误 308 份:61 漏标+108 慢性误急性+115 阴性误阳性+24 存疑误阳性
  10. 假阳性 247 份——基于 ICD 的发病率统计系统性虚高
  11. ICD 正确阳性 1,276 份中 169 亚段——仅 4 份有亚段专用码
  12. 结论模式:编码查全优/精确劣;模型精确优/查全略逊——都到不了人工共识可靠性
  13. 对垒设计价值:同金标准同台——phenotyping 研究的方法学范本

§11.6 论文与发表(12 条)

  1. 正式版:Lam BD, Ma S, Kovalenko I, Wang P, Jafari O, Li A, Horng S. Res Pract Thromb Haemost 2025;9(4):102896
  2. 正式版 DOI:10.1016/j.rpth.2025.102896;PMID 40606764;PMCID PMC12213262
  3. 发表日:2025-05-21(RPTH,ISTH 旗下期刊)
  4. arXiv 版:2411.00044(2024-11)
  5. 发布顺序:先论文(2025-05)后数据(2026-03)——存照
  6. 一作 Barbara D. Lam:BIDMC 血液科+临床信息科双科(第一位标注医生 BDL)
  7. 第二位标注医生:Iuliia Kovalenko(UPMC Harrisburg,IK)
  8. 共同通讯:Shengling Ma + Ang Li(Baylor 血液肿瘤)+ Steven Horng(BIDMC 信息+急诊)
  9. Steven Horng 同时是 517 MIMIC-CXR-JPG 论文共同作者——MIMIC NLP 线常客
  10. Peiqi Wang:MIT CSAIL(团队唯一纯 CS 机构作者,排第五)
  11. 团队无’纯 ML 一作’——临床科室自产数据集范本
  12. 团队先导工作:Chiasakul 2023 Eur J Haematol VTE AI 系统综述(Lam 参与)

§11.7 对照系(10 条)

  1. RSNA PE CT Dataset(Colak 2021,Radiol AI):12,000+ CT studies DICOM+PE 标签——影像层基准
  2. INSPECT(arXiv 2311.10798):23,248 CT+报告+纵向 EHR——多模态先例
  3. 本集定位:MIMIC 生态的 PE 文本层——三件套互补
  4. MIMIC 链接权:subject_id/hadm_id 直通 EHR/超声/胸片/心电图
  5. 胸片链接:本库 617(MIMIC-CXR-JPG)同患者可 join
  6. 与 617 对照:弱监督 14 类 vs 共识五类——规模与精度的方法论光谱
  7. 与 616 对照:同属 MIMIC-Ext 家族的两种增值标注
  8. VTE 公共卫生背景:Beckman 2010(Am J Prev Med)
  9. 急性 VTE 治疗背景:Becattini & Agnelli 2020(Blood)
  10. PE 发病率报告=医院质量指标——识别不止是研究问题

§11.8 伦理与合规(10 条)

  1. DUA 三条款:不共享/不再识别/发表必须公开代码
  2. CITI 课程覆盖每位合作者
  3. 研究用途限定——商用另授权
  4. 报告全文不可直接再分发
  5. 去标识:继承 MIMIC-IV Safe Harbor
  6. IRB:母库 BIDMC 框架,无新数据
  7. COI:无
  8. 资助披露:Google Cloud Credits + NIH 基建
  9. PhysioNet 撤回政策适用
  10. 2026-03 挂牌至今无撤回事件

§11.9 生产与版本(15 条)

  1. 批次七 3/10(order 518,预期 rid 618)
  2. FACTS.md:writing/mimic-iv-ext-pe/FACTS.md(三轮核查全录)
  3. 核查快照:/tmp/518_page.html(59,296 B)
  4. 核查轮次:页面全量→论文链(RPTH+arXiv)→多源交叉(Scholar/emergentmind)
  5. 预判修正一:modality CT→报告文本层
  6. 预判修正二:发现先论文后数据发布顺序
  7. 存照一:arXiv 早期数字 vs final 演化
  8. 存照二:LLM 标题党(实为微调 BERT)
  9. 存照三:先论文后数据
  10. 类目:医疗NLP(临床文本)
  11. 双检:check_md + preflight_check
  12. 查重:url_name=‘mimic-iv-ext-pe’ 精确匹配
  13. 互链计划:617/616/MIMIC-IV 系在库条目
  14. DAIMS:7.0(标注 9/方法 8/规模 6)
  15. 一句话:血液科亲手做的 PE 金标准+两条自动路的诚实成绩单

§12 术语表:五十条

1. MIMIC-IV-Ext-PE —— 本条目:MIMIC-IV 的 CTPA 报告 PE 五类标签扩展

2. MIMIC-IV v3.1 —— 母库:BIDMC 2008-2019 成人急危重症 EHR(含全部影像报告)

3. CTPA —— CT 肺动脉造影——PE 诊断的标准影像检查

4. 肺栓塞(PE) —— 血栓阻塞肺动脉——院内可预防死亡主因之一

5. VTE —— 静脉血栓栓塞(DVT+PE 的总称)——VTE-BERT 的识别目标

6. Subsegmental —— 亚段肺动脉——PE 抗凝决策的临床争议地带,本集单列 233 份

7. Equivocal —— 存疑发现(如运动伪影 vs PE)——本集独立成类的第四值

8. Chronic PE —— 慢性 PE——非急性事件,与 CTEPH 相关,本集单列 345 份

9. 金标准(gold standard) —— 双人共识全量标注——本集的标签性质定位

10. 一明一盲 —— 本集双评审协议:一人看模型预测、一人盲审——独立性与真实工作流兼顾

11. Cohen’s kappa —— 标注者间一致性系数——本集 κ=0.82(二值化后)

12. 共识裁决 —— 504 份分歧全讨论解决——无仲裁第三人的二人制

13. VTE-BERT —— Maghsoudi 等微调的 Bio_ClinicalBERT(DVT+PE 识别)——本集的自动基准

14. Bio_ClinicalBERT —— 在 MIMIC-III 临床笔记上续训的 BERT——VTE-BERT 的底座

15. 外部验证 —— 训练语料与评估数据零重叠——本集 VTE-BERT 成绩的性质

16. RegEx —— 正则表达式——CTPA 识别与 PE 句子隔离的引擎

17. snippet —— 隔离出的 PE 相关句子集——人工与模型评审的输入单元

18. ICD 编码 —— 国际疾病分类——本集对垒的’传统 phenotyping’路径(I26=PE)

19. PPV —— 阳性预测值——对垒的核心指标之一(编码 83.8% vs 模型 87.8%)

20. Sensitivity —— 灵敏度——对垒的另一核心(编码 95.4% vs 模型 92.4%)

21. 假阳性 —— 编码误标阳性的代价——本集量化 247 份

22. phenotyping —— 从病历数据识别疾病状态——本集是 PE phenotyping 的方法学教案

23. hadm_id —— MIMIC-IV 住院标识——join 临床表的钥匙

24. subject_id —— MIMIC 患者标识——跨库(含 617 胸片)join 的钥匙

25. note_id —— MIMIC-IV 笔记标识——本集 CSV 的主键

26. charttime/storetime —— 记录时间/入库时间——纵向排序的依据

27. RSNA PE CT Dataset —— 12,000+ CT 的影像层 PE 基准(Colak 2021)——三件套之一

28. INSPECT —— 23,248 CT+报告+EHR 的多模态 PE 集(2023)——三件套之二

29. RPTH —— Research and Practice in Thrombosis and Haemostasis——ISTH 旗下期刊,正式论文发表处

30. BIDMC —— Beth Israel Deaconess Medical Center——母库数据源与本集主力团队所在

31. Baylor College of Medicine —— 共同通讯(Ma/Li)所在机构

32. MIT CSAIL —— Peiqi Wang 所在——团队唯一纯 CS 机构

33. Steven Horng —— BIDMC 信息+急诊——517/518 双论文共同作者,MIMIC NLP 线常客

34. 弱监督 —— 自动生成的标签(如 617 双 labeler)——本集共识制的高一档对照

35. 双人共识制 —— 两位医生讨论达成一致的标注协议——标注工程的精度档

36. 无句即阴 —— 预处理无句可提时默认阴性的约定——由 99.94% 召回背书

37. 选择性偏倚 —— CTPA 开单已含临床怀疑——7.98% 不能当患病率的学理

38. ‘报告≠处置’ —— 影像报告结论与最终治疗决策的落差——本集明示的局限

39. CTEPH —— 慢性血栓栓塞性肺高压——Chronic 类标签的下游研究价值

40. MIMIC-Ext 家族 —— MIMIC 母库+专家/自动增值标注的派生系列(pe/ils 等)

41. DAIMS —— 本库条目评估体系(数据/标注/方法/影响力/规模)——本集 7.0

42. 标注工程光谱 —— 本库方法论叙事:全自动(616)—弱监督(617)—共识金标准(518)

43. 外部验证设计 —— 不重训、直接拿来用——本集方法上最老实的一笔

44. 编码粒度 —— ICD 无法表达亚段级(169 份中仅 4 份专用码)——五类设计的隐含批评

45. 急诊覆盖缺口 —— ICD 只覆盖住院 62%——急诊 38% 是 NLP 的独占领地

46. 发病率虚高 —— 基于 ICD 的 PE 发病统计因假阳性系统性偏高——公共卫生监测的含义

47. 一作双科 —— Lam 同属血液科与临床信息科——临床-信息复合型作者的样本

48. 半结构化报告 —— 放射报告的模板化文体——RegEx 高召回(99.94%)的文体基础

49. 先论文后数据 —— 正式发表(2025-05)先于数据挂牌(2026-03)——发布顺序存照

§10.9 研究设计实战(20 问)

Q81:想做 PE 抗凝结局研究,怎么起步?

A:Acute 类 1,358 份报告取 subject_id/hadm_id → join MIMIC-IV prescriptions 筛抗凝药 → join 结局表;Equivocal/Chronic 按排除标准处理;务必报告"报告≠处置"的局限。

Q82:想训练自己的报告分类器,怎么用这个金标准?

A:text 列先按 Supp Table 2 RegEx 隔离句子再喂模型(照抄管线);五类可并二值或保留五类;留出集按患者切分防泄漏。

Q83:想复现 VTE-BERT 的成绩?

A:权重与代码开源(GitHub);预处理照抄(无句即阴);对照 Table 2 的 92.4/87.8——注意它是外部验证口径,不要在本集重训后再比。

Q84:想量化 ICD 的虚高?

A:join diagnoses_icd 的 I26 码 vs 金标准——308 份错标账本(61/108/115/24)可直接复算;假阳性 247 份是"发病率虚高"的实证素材。

Q85:想研究亚段 PE 的管理争议?

A:Subsegmental 233 份单列可取;样本量有限(169 份住院可 ICD 对照但仅 4 份有专用码)——适合作为亚组分析而非主研究。

Q86:想建多模态 PE 模型?

A:本集给文本标签与队列键 → 影像走 RSNA PE CT/INSPECT(或 MIMIC-CXR 家族本库 606-617 的胸片)→ EHR/用药/超声经 hadm_id join——三源对齐靠 subject_id。

Q87:急诊 PE 研究为什么只能用本集?

A:38% 仅急诊报告无 discharge 编码——ICD 路径结构性缺位;这是 NLP 标签的独占领地。

Q88:想做不确定性建模?

A:Equivocal 104 份是现成的"报告层模糊"样本;对照 617 的 uncertain/disagreement 五值设计,两种不确定性语义(报告模糊 vs 模型冲突)可对比研究。

Q89:想做复发/慢性化纵向研究?

A:charttime 排序同一患者多次 CTPA;Chronic 345 份中"与既往相似"的表述本身含纵向信息;CTEPH 队列可从慢性反复者起步。

Q90:样本量够做深度学习吗?

A:文本分类够(2 万份/1,591 阳性——BERT 级微调常规量级);图像深度学习不适用(无影像);亚段级细粒度研究(233 份)建议经典 ML 或迁移学习。

Q91:标注协议能搬到我的科室吗?

A:能——一明一盲+分歧讨论制+二值化 κ 是通用协议;本集的裁决手册五类划分展示了"类=临床决策点"的设计思路。

Q92:怎么向伦理委员会论证使用合规?

A:Credentialed 框架(CITI+DUA)+ 派生数据无新采集 + 发表开源承诺——MIMIC 家族的标准论证路径,本集无新增风险点。

Q93:引用格式?

A:数据集 DOI(10.13026/5qq1-zv65)+ RPTH 论文(10.1016/j.rpth.2025.102896)+ MIMIC-IV 母库三件套。

Q94:与 RSNA PE CT 竞赛标签兼容吗?

A:不直接兼容——RSNA 是影像层 binary/类型标签,本集是报告层五类;跨库研究需自建映射并在论文中披露映射规则。

Q95:负面清单里"影像不理想"占了多少?

A:页面未单独给出 Negative 内部构成(17,902 的细分未披露)——引用时把 Negative 当黑箱,别脑补构成。

Q96:能拿到 VTE-BERT 的逐份预测吗?

A:页面/CSV 未包含模型预测列——只有金标准标签;要对照需自己跑开源权重。

Q97:外部验证为什么重要到被反复强调?

A:团队系统综述发现 VTE AI 几乎无人做外部验证——本集把"外来模型直接考试"设为设计原则,是给领域的方法论示范。

Q98:中文研究者使用有什么特别注意?

A:报告为英文(BIDMC 文体);RegEx 术语表是英文的——中文语境复用需重建术语表;其余流程(共识制/对垒设计)语言无关。

Q99:能用它教课吗?

A:极适合——管线漏斗/对垒设计/κ 读法/偏倚辨析(阳性率≠患病率)都是现成教案;Credentialed 门槛下课堂使用需每位学生过 CITI。

Q100:一句话记住这个数据集?

A:2 万份 CTPA 报告、五位数的共识 κ、两条自动路的诚实成绩单——PE 研究的"标尺"由此立起。

§11.7 研究设计与复现指南(40 条)

  1. 队列组装起点:Acute+Subsegmental=1,591 份报告(15,875 患者中的急性 PE 者)
  2. 结局变量来源:MIMIC-IV hospitals/prescriptions/labevents/ICU 表(经 hadm_id/subject_id)
  3. 影像侧补全:MIMIC-CXR 家族(本库 606-617)——胸片;CT 影像需 RSNA PE/INSPECT
  4. 心电侧补全:MIMIC-IV-ECG(本库在册)——PE 的 ECG 表型研究入口
  5. 超声侧补全:MIMIC-IV echo 表——右心负荷研究的经典搭配
  6. 复现对垒一:VTE-BERT 开源权重+Supp Table 2 RegEx+无句即阴 → 对照 92.4/87.8
  7. 复现对垒二:diagnoses_icd I26 码 vs 金标准(住院子集)→ 对照 95.4/83.8
  8. 错误账本复算:308=61+108+115+24;假阳性 247=108+115+24
  9. κ 复算:五类并二值(阳=Acute+Subsegmental)→ Cohen’s κ 应≈0.82
  10. 患者级去重:15,875 患者<19,942 报告——患者级 split 防泄漏
  11. 住院 stay 去重:12,355 报告→11,990 stays(365 同 stay 多图)
  12. 亚段研究注意:233 份总量/169 份住院/4 份 ICD 专用码——三级粒度损耗
  13. Equivocal 处置策略 A:排除(结局研究)
  14. Equivocal 处置策略 B:单列建模(不确定性/鲁棒性研究)
  15. Equivocal 处置策略 C:并入阳性(敏感性分析——模拟"临床按 PE 治疗")
  16. Chronic 处置:CTEPH 研究的入口队列;急性研究中的"既往史"协变量
  17. 时间窗:charttime 排序支持治疗前基线锁定
  18. 负样本利用:17,902 份 Negative 是"临床怀疑但除外"的高质量阴对照——非健康人群
  19. 偏倚三层:开单偏倚(谁做 CTPA)→阳性率≠患病率;编码偏倚(ICD 误标);报告偏倚(报告≠处置)
  20. 外推边界:BIDMC 单中心 2008-2019 成人——外推需在目标域重新验证
  21. 英文报告文体:模板化程度高是 RegEx 高召回的文体基础——跨机构复用先估文体差
  22. 术语表复用:Supp Table 1/2 可直接搬用——英文语境免费资产
  23. 中文语境:需重建术语表+重估"无句即阴"的召回——语言无关的只有协议骨架
  24. 与 617 联动:MIMIC-CXR-JPG 的 view position/metadata 可为 PE 患者拉胸片子集(subject_id 对齐)
  25. 与 616 联动:指令分割语料不含 PE 标签——本集补上文本层后多模态指令研究可行
  26. 与 MIMIC-IV-ED 联动:急诊 PE 的分诊-影像- disposition 链路可拼
  27. 与 mimic-iv-ecg 联动:PE 的 ECG 征象(S1Q3T3 等)研究入口
  28. 方法论引用:外部验证设计/一明一盲/分歧讨论制均可作为独立方法贡献引用
  29. 教学用法:漏斗图+对垒表+κ 读法三件套是 NLP 医学课程现成教案
  30. 评审应对:被问"标签可信吗"→κ=0.82+共识制+全量非抽样三层作答
  31. 被问"为什么不用 LLM"→论文正文本已自纠(BERT 够用+外部验证优先)
  32. 被问"为什么不只用 ICD"→247 假阳性+38% 急诊盲区双杀
  33. 样本量对照:1,591 阳性 vs RSNA 影像级标签量级相当——文本层成本低一个数量级
  34. 成本结构:2 医生×19,942 份 vs 影像像素级标注——临床班底的性价比路线
  35. 发布顺序启示:先论文后数据让金标准先获同行评议背书——数据集工程的新时序
  36. 版本风险:唯一版本(v1.0.0)——无版本碎片化困扰;latest DOI 跟踪未来更新
  37. 补充材料清单:Table 1 术语/Table 2 RegEx/Figure 1 漏斗/File 1 代码
  38. DUA 红线:报告全文不可再分发——派生嵌入/统计可共享(以 DUA 为准)
  39. 团队合作启示:临床科室+信息科+CS 的三方构成(血液科主导)值得复制
  40. 一句话方法论:金标准先行,自动路同台,局限自曝——phenotyping 的完整公开课

附录 A:发布时间线与版本对照

研究-数据双轨时间线

时间 事件 载体
2024-11 arXiv 预印本(2411.00044) “large language model” 标题(后被自纠),早期人口学数字
2025-05-21 正式发表 RPTH 2025;9(4):102896(ISTH 旗下;PMID 40606764)
2026-03-23 PhysioNet 挂牌 v1.0.0,DOI 10.13026/5qq1-zv65

版本口径演化对照(arXiv 2024 vs PhysioNet final 2026)

项 arXiv 版 final 版(本条目采用)
母库版本 MIMIC-IV v3.0 v3.1
中位年龄 58 63
女性 51.3% 56.7%
White 59.8% 58.8%
标题用词 large language model transformer(正文自纠为微调 BERT)

存照纪律:引用一律以 PhysioNet final 页面为准;arXiv 数字只作演化痕迹。

附录 B:五类标签全定义(裁决手册精神)

类 纳入(原文精神) 排除/边界 n 研究含义
Acute 急性 PE;急慢性混合(按急性计) 亚段-only 另立 1,358 抗凝指征
Subsegmental 仅亚段动脉急性 PE 混合段归 Acute 233 争议决策带
Chronic 慢性 PE;病程不明;“与既往相似” — 345 非新事件
Equivocal 运动伪影 vs PE 等存疑 — 104 灰区自由度
Negative 无 PE;影像不理想;未描述肺动脉 — 17,902 阴性池

二值化口径(κ 计算用):阳 = Acute+Subsegmental(1,591);阴 = 其余(18,351)。

附录 C:对垒成绩单全录(Table 2 精神)

VTE-BERT(全量 19,942)

  • Sensitivity 92.4%(95%CI 0.91-0.94)
  • PPV 87.8%(0.86-0.89)
  • Specificity 98.9%(emergentmind 引论文口径)
  • 错误模式 Top1:慢性-only → 判阳
  • 覆盖:住院+急诊全量

ICD 编码(住院子集 12,355 报告/11,990 stays)

  • Sensitivity 95.4%(0.94-0.96)
  • PPV 83.8%(0.82-0.86)
  • 错误 308 份 = 漏标 61 + 误阳 247(慢性 108/阴性 115/存疑 24)
  • 亚段粒度:正确阳性 1,276 中亚段 169,专用码仅 4

读法:两者主轴都是"急慢不分"——五类金标准正是为此设计;自动路的价值在覆盖与成本,人工共识的价值在粒度与可信。

附录 D:页面与论文的口径差异存照

  1. 母库版本:emergentmind/早期版本称 v3.0——PhysioNet 页面 Parent Projects 明确 v3.1
  2. 人口学漂移:arXiv(median 58/51.3%/59.8%)vs final(63/56.7%/58.8%)——final 为准
  3. LLM 标题党:arXiv 标题 “large language model”——实为 1.1 亿参数微调 BERT
  4. ** specificity 数字**:页面只给 Sens/PPV;98.9% 来自 emergentmind 引论文——引用注明出处
  5. 阳性率分母:7.98% 是 CTPA 检查口径——不可外推为患病率

附录 E:五步识别管线步骤表(复现用)

步 操作 关键术语表
1 取 subtype=“RR” 的 note —
2 切六段:History/Indication/Procedure/Examination/Study/Technique —
3 操作四段含 CTPA 术语 Supp Table 1
4 病史两段含 PE 术语 Supp Table 1
5 存在 CTPA 标题段 —
6 双医生逐份确认 人工
7 RegEx 隔离 PE 句 Supp Table 2
8 VTE-BERT 分类(无句→阴) github 权重
9 双人共识裁决 κ=0.82

漏斗:2,321,355 → 21,948 → 19,942(15,875 患者)。

附录 F:PE 数据集三件套对照

维度 RSNA PE CT(2021) INSPECT(2023) MIMIC-IV-Ext-PE(本集 2026)
规模 12,000+ studies 23,248 CT 19,942 报告
模态 DICOM CT+报告+EHR 报告文本
标签 PE 类型 PE 类型 五类双人共识
生态 独立 独立 MIMIC-IV 全生态
NLP 基准 无 有(报告) 有(+VTE-BERT 对垒)
急诊覆盖 — — 38%(独家)
团队性质 学会+业界 Stanford 系 血液科临床班底

选型:影像模型训练→RSNA;多模态独立研究→INSPECT;生态内队列+NLP→本集。

附录 G:本库 MIMIC 谱系与互链

本库 rid slug 关系
16 mimic-cxr MIMIC-CXR 母库(不同分册)
606-616 CXR 家族九条目 图像侧(617 为其枢纽)
617 mimic-cxr-jpg 报告加工层姊妹篇:弱监督 vs 共识
MIMIC-IV 系在库条目 MIMIC-IV-ED / mimic-iv-ecg 等 hadm_id/subject_id 直连
618 mimic-iv-ext-pe(本条目) PE 文本层
616 mimic-cxr-ext-ils Ext 家族影像侧

方法论光谱:全自动管线(616)→ 双 labeler 弱监督(617)→ 双人共识金标准(本集)——标注可信度的三级阶梯在 MIMIC 家族内齐了。

附录 H:批次七生产存照(518 号)

  • 生产序号:批次七 3/10(order 518,预期 rid 618)
  • 事实核查:3 轮——curl 页面全量(59,296 B)→ 论文链(RPTH 102896+arXiv 2411.00044)→ 多源交叉(Scholar 引用卡/emergentmind)
  • 预判修正:modality CT→报告文本层(类目改医疗NLP);发布顺序先论文后数据
  • 三大存照:版本演化(v3.0→v3.1/人口学漂移)、LLM 标题党、先论文后数据
  • 方法论贡献条目:标注工程三级阶梯(全自动/弱监督/共识)在 MIMIC 家族内集齐
  • 双检:check_md + preflight_check(发布前)
  • 查重:url_name=‘mimic-iv-ext-pe’ 精确匹配(发布前)
  • 下一发:519 MS-CXR-T(批次七 4/10)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集