INFOBOX
| 数据集名称 | MIMIC-CXR(MIMIC Chest X-ray Database) |
| 英文全称 | MIMIC-CXR: A De-identified Publicly Available Database of Chest Radiographs with Free-text Reports |
| 别名 / 简称 | MIMIC-CXR、MIMIC-CXR-JPG、MIMIC Chest X-ray |
| 疾病分类 | 多疾病覆盖。核心映射:CA40–CA4Z 呼吸系统疾病 / CB24 心脏肥大 / DB90–DB98 胸膜与胸腔疾病 / CA40.1 肺实变 / CA41 肺炎 / MB21–MB25 骨折 |
| SNOMED CT | 111895007 Atelectasis / 8186001 Cardiomegaly / 233604007 Pneumonia / 60046008 Pleural Effusion / 233605005 Consolidation / 17373005 Edema / 187252007 Support Device / 36118001 Pneumothorax 等 14 类映射(详见 §2.2) |
| 数据模态 | 影像(胸部 X 光片,DICOM 16-bit 灰阶 / JPG 8-bit)+ 文本(自由文本放射学报告)+ 结构化标签(CSV) |
| AI 任务类型 | 图像多标签分类、视觉-语言多模态学习、放射学报告生成、自然语言推理、图像-文本检索、图像分割、长尾学习 |
| 样本总数 | 377,110 张胸部 X 光片(来自 65,379 名患者的 227,835 次放射学检查) |
| 数据大小 | ~470 GB(DICOM 原始格式)/ ~120 GB(MIMIC-CXR-JPG 压缩版) |
| 数据格式 | DICOM(原始影像,16-bit 深度)/ JPG(MIMIC-CXR-JPG 衍生版,8-bit 灰阶,原分辨率)/ TXT(放射学报告,14 个分段文件)/ CSV(CheXpert 标签 + NegBio 标签 + 元数据 + 数据划分) |
| 许可证 | PhysioNet Credentialed Health Data License 1.5.0(需完成 CITI 人体受试者研究培训并通过 PhysioNet 认证) |
| 访问级别 | 申请审核(PhysioNet 认证:完成 CITI Training → 提交机构信息与推荐人 → 签署 DUA → 约 1-2 周审核) |
| DUO 标签 | HMB, NPUNCU, IRB, PUB |
| 语言 | 英文(放射学报告文本 + CSV 标签文件) |
| 首发日期 | 2019-01-21(arXiv 预印本:MIMIC-CXR-JPG);2019-12-12(Scientific Data 正式发表) |
| 最后更新 | 2024(v2.1.0 发布,MIMIC-CXR-JPG v2.1.0 同步更新) |
| 发布机构 | MIT Laboratory for Computational Physiology(MIT 计算生理学实验室)& Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心,BIDMC) |
| 官方主页 | https://physionet.org/content/mimic-cxr/ |
| 下载地址 | https://physionet.org/content/mimic-cxr/2.1.0/(DICOM 版)/ https://physionet.org/content/mimic-cxr-jpg/2.1.0/(JPG 版) |
| DOI | 10.1038/s41597-019-0322-0(论文)/ 10.13026/4jqj-jw95(数据集)/ 10.13026/jsn5-t979(JPG 版数据集) |
| 引用次数 | 1,700+(Google Scholar,Johnson et al. 2019 Sci Data,截至 2026-07) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 患者级官方训练/验证/测试划分 + 放射学报告原文 + 双重 NLP 标注器 + 与 MIMIC-IV 临床数据库可联动;扣分项:NLP 标签噪声、单中心来源、测试集标签未公开、无病灶边界框标注 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
权威来源:本条目所有医学事实、统计数字与标签定义均直接溯源至以下一手权威来源:
- 原始论文:Alistair E. W. Johnson, Tom J. Pollard, Seth J. Berkowitz, Nathaniel R. Greenbaum, Matthew P. Lungren, Chih-Ying Deng, Roger G. Mark, Steven Horng. MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports. Scientific Data, 6:317, 2019. DOI: 10.1038/s41597-019-0322-0.
- JPG 版论文:Alistair E. W. Johnson, Tom J. Pollard, Seth J. Berkowitz, Nathaniel R. Greenbaum, Matthew P. Lungren, Chih-Ying Deng, Roger G. Mark, Steven Horng. MIMIC-CXR-JPG: A Large Publicly Available Database of Labeled Chest Radiographs. arXiv:1901.07042, 2019.
- NegBio 论文:Yifan Peng, Xiaosong Wang, Le Lu 等. NegBio: a high-performance tool for negation and uncertainty detection in radiology reports. AMIA Summits on Translational Science Proceedings, 2018:188-196, 2018.
- CheXpert 标注器论文:Jeremy Irvin, Pranav Rajpurkar 等. CheXpert: A Large Chest Radiograph Dataset with Uncertainty Labels and Expert Comparison. AAAI, 33(1):590-597, 2019. DOI: 10.1609/aaai.v33i01.3301590.
- 官方发布与协议:PhysioNet 官方数据页面(https://physionet.org/content/mimic-cxr/)与 PhysioNet Credentialed Health Data License 1.5.0。
作者团队核心成员来自 MIT 计算生理学实验室(Alistair E. W. Johnson, Tom J. Pollard, Roger G. Mark)与 BIDMC 急诊科/放射科(Seth J. Berkowitz, Nathaniel R. Greenbaum, Matthew P. Lungren, Steven Horng),数据集的人工审核由一名 8 年经验的执业放射科医生执行(687 份报告标注)。
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-07-29
利益冲突声明:千方病案医数集与 MIT 计算生理学实验室、BIDMC 或 PhysioNet 无商业利益关联。本页面不销售 MIMIC-CXR 数据集本身,仅提供 AI 就绪指南与学术信息服务。MIMIC-CXR 的开发与发布曾获得 Philips Healthcare 对 MIT 计算生理学实验室的资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用 MIMIC-CXR 前,必须完成 PhysioNet 认证流程(包括 CITI 人体受试者研究培训),并签署具有法律约束力的数据使用协议(DUA)。DUA 要求:(1) 不得分享数据;(2) 不得尝试重新识别患者身份;(3) 任何使用该数据的发表须同时公开相关代码。DUO 标签仅供参考,具体使用限制以 PhysioNet 官方协议为准。
§1 数据集概览
§1.0 30 秒速览
MIMIC-CXR 是 MIT 计算生理学实验室与贝斯以色列女执事医疗中心 (BIDMC) 于 2019 年在 Scientific Data 发布的全球最大公开胸片-放射报告配对数据集,包含 377,110 张胸部 X 光片(DICOM 格式)和对应的 227,835 份自由文本放射学报告,来自 2011 至 2016 年间 65,379 名急诊患者。
MIMIC-CXR 最独特的价值在于其图像-文本多模态完整性——每份影像都配有执业放射科医生在常规临床诊疗中书写的完整报告原文,而非仅提供结构化的检查结论。这使 MIMIC-CXR 成为胸片视觉-语言 (vision-language) AI 研究的事实标准平台。同时,数据集通过 CheXpert 和 NegBio 两款 NLP 标注器对报告进行双重自动化标注,提供 14 类放射学发现的结构化标签,并标记两个标注器的"分歧" (Disagreement) 状态。由于所有患者同时存在于 MIMIC-IV 临床数据库中,研究者还可以将胸片与 ICU 病历、实验室检查、用药记录等结构化 EHR 数据联动。原始论文已被引用 1,700 余次(Google Scholar,截至 2026-07)。
你可以用它来:训练胸片多标签分类模型并在标准的患者级测试集上公平比较性能、研究放射学报告自动生成或图像-文本跨模态检索、利用 CheXpert/NegBio 双重标注对比研究 NLP 标签噪声特性、将胸片与 MIMIC-IV 中的 EHR 数据联动做临床多模态预测(如心衰分型、住院时长预测)、或在 CXR-LT 长尾学习基准(MICCAI 2023/2024)上验证稀有疾病检测算法。
§1.1 摘要
MIMIC-CXR 的创建涉及三种数据模态的独立处理:电子健康记录(EHR)数据、影像(胸部 X 光片)和自由文本(放射学报告)。首先,从 BIDMC 的 EHR/RIS 系统中筛选 2011-2016 年间急诊科胸片检查的患者队列,随后追溯提取该队列在此 6 年间的全部胸片和报告。DICOM 影像经自动 OCR 算法去除烧录标注中的受保护健康信息 (PHI),报告文本经自动去标识化处理。结构化标签由 CheXpert 标注器(三阶段:提取 → 分类 → 聚合)和 NegBio(基于依存模式规则)分别生成,输出正性 (1.0)、不确定性 (-1.0)、阴性 (0.0)、未提及 (缺失) 和分歧 (Disagreement) 五种标签状态。MIMIC-CXR-JPG 衍生版将 DICOM 转为 8-bit JPG 格式(直方图均衡化 + JPEG quality=95),保留原始分辨率。
§1.2 战略价值分析
多模态基础设施维度:MIMIC-CXR 是胸片 AI 从"纯图像分类"到"图像-文本多模态理解"转型的核心推动者。CheXpert/NIH ChestX-ray14 等数据集仅提供图像和结构化标签,而 MIMIC-CXR 提供的 227,835 份完整放射学报告使研究者可以直接训练图像到报告的生成模型(如 R2Gen、MAIRA-2)、图像-文本对比学习模型(如 ConVIRT、CheXzero)以及基于 LLM 的视觉-语言对齐(如 Med-PaLM M、Med-Gemini)。这直接催生了放射学报告自动生成这一繁荣的研究子领域。
生态系统互操作维度:MIMIC-CXR 与 MIMIC-IV 临床数据库的患者标识符可直接关联 (subject_id),等于为 37.7 万张胸片"附加"了完整的 ICU 住院记录——包括生命体征、实验室检验、药物处方、诊断编码、甚至出院小结文本。这种"影像 + EHR"的联动能力是任何其他公开胸片数据集都不具备的,使 MIMIC-CXR 成为临床多模态融合研究的独特平台。衍生数据集 CXR-LT(MICCAI 2023/2024 挑战赛)和 REFLACX(含眼动追踪数据)进一步扩展了其研究广度。
方法论严谨性维度:与 NIH ChestX-ray14 不同,MIMIC-CXR 的官方训练/验证/测试划分是患者级 (patient-level) 的——同一患者的所有胸片只出现在一个划分中,从根本上避免数据泄漏。此外,双重 NLP 标注器设计带来的"分歧"标签状态为研究 NLP 标签不确定性提供了天然素材。
§1.3 横向对比
| 数据集 | 影像数 / 患者数 | 模态 | 标注方式 | 放射学报告 | 核心差异化 |
|---|---|---|---|---|---|
| MIMIC-CXR | 377,110 / 65,379 | X 光 (DICOM) + 文本 | CheXpert + NegBio 双重 NLP + 放射科医生 | ✅ 227,835 份完整报告 | 全球最大胸片-报告配对 + EHR 联动 + 视觉-语言多模态平台 |
| CheXpert | 224,316 / 65,240 | X 光 (JPEG) | NLP + 放射科医生 | 仅 CheXpert Plus 含报告 | 不确定性标签体系 + Kaggle 竞赛隐藏测试集 |
| NIH ChestX-ray14 | 112,120 / 30,805 | X 光 (PNG) | NLP | ❌ 无 | 最早大规模胸片,零门槛免费下载 |
| PadChest | 160,868 / 67,625 | X 光 + 报告 | 放射科医生 + 双语 | ✅ 含西班牙语报告 | 192 类细粒度标签 + 双语 |
| VinDr-CXR | 18,000 / 18,000 | X 光 (DICOM) | 17 名放射科医生 | ❌ 无 | 病灶级边界框标注,优化异常检测 |
MIMIC-CXR 的独特壁垒在于图像-文本配对 + 与 EHR (MIMIC-IV) 的跨数据库联动——没有任何其他公开胸片数据集同时具备这两项能力。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2019-01 | MIMIC-CXR-JPG 预印本发布(arXiv:1901.07042),首次公开 JPG 版与结构化标签 |
| 2019-12 | MIMIC-CXR 正式论文发表于 Scientific Data(Johnson et al., 6:317),DICOM 版在 PhysioNet 上线 |
| 2020-2022 | 社区生态快速发展:TorchXRayVision 支持 MIMIC-CXR 加载,ConVIRT/GLoRIA 等对比学习模型以 MIMIC-CXR 为核心基准 |
| 2023 | CXR-LT 长尾学习挑战赛(MICCAI 2023)发布,基于 MIMIC-CXR 构建 26 类长尾标注 |
| 2024 | MIMIC-CXR v2.1.0 发布;CXR-LT 2024 扩展至 45 类标签(含零样本学习);Med-PaLM M 实现 SOTA 报告生成 |
| 2025 | CaMCheX (OpenReview 2025) 融合多视角胸片+临床结构化数据,达成新 SOTA |
§1.5 典型 AI 应用场景
- 胸片多标签分类:利用 MIMIC-CXR-JPG 的 CheXpert 标签训练 14 类疾病检测模型,在患者级测试集上公平比较性能——这是 MIMIC-CXR 上被研究最广泛的任务。
- 放射学报告自动生成:输入一张或多视角胸片,输出结构化的放射学发现描述(Findings)和印象(Impression)段落——医疗图像到文本生成的核心应用。
- 视觉-语言对比学习:利用 227,835 对图像-报告配对,通过对比损失(如 CLIP/ConVIRT)学习图像与文本的联合嵌入空间——在下游分类、检索、零样本推理中表现优异。
- 临床多模态融合:将 MIMIC-CXR 影像与 MIMIC-IV 中的 EHR 数据通过
subject_id联动,预测临床结局(如死亡率、心衰分型、30 天再入院)。 - NLP 标签噪声研究:分析 CheXpert 与 NegBio 在 14 类发现上的分歧模式,评估 NLP 自动标注对下游模型训练的影响,设计标签融合/去噪策略。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
MIMIC-CXR 的 14 类结构化标注覆盖急诊科胸片最常见的放射学发现。
| MIMIC-CXR 标签 | 中文 | ICD-11 编码 | ICD-11 术语 |
|---|---|---|---|
| Atelectasis | 肺不张 | CA40.0 | Atelectasis |
| Cardiomegaly | 心脏肥大 | CB24 | Cardiomegaly |
| Consolidation | 肺实变 | CA40.1 | Pulmonary consolidation |
| Edema | 肺水肿 | CB01 | Pulmonary oedema |
| Enlarged Cardiomediastinum | 纵隔增宽 | CB20.0 | Enlarged cardiac silhouette |
| Fracture | 骨折 | 多编码 | 视骨折位置而定(肋骨 MB21、锁骨 MB23 等) |
| Lung Lesion | 肺部病变 | CA4Y | Other specified diseases of the respiratory system |
| Lung Opacity | 肺不透光影 | CA4Z | Respiratory system disease, unspecified |
| No Finding | 无影像学异常 | QA0Z | No abnormality detected |
| Pleural Effusion | 胸腔积液 | DB98.Z | Pleural effusion, unspecified |
| Pleural Other | 其他胸膜异常 | DB9Y | Other specified pleural disease |
| Pneumonia | 肺炎 | CA41 | Pneumonia |
| Pneumothorax | 气胸 | DB92 | Pneumothorax |
| Support Devices | 支持装置 | N/A | 临床设备而非疾病——包括气管插管、中心静脉导管、胸管、鼻胃管等 |
§2.2 SNOMED CT 补充映射
| 数据集标签 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| Atelectasis | CA40.0 | 111895007 | Atelectasis (finding) |
| Cardiomegaly | CB24 | 8186001 | Cardiomegaly (finding) |
| Consolidation | CA40.1 | 233605005 | Consolidation of lung (finding) |
| Edema | CB01 | 17373005 | Edema (morphologic abnormality) |
| Enlarged Cardiomediastinum | CB20.0 | 253271005 | Mediastinal widening (finding) |
| Lung Lesion | CA4Y | 401230002 | Pulmonary lesion (finding) |
| Pleural Effusion | DB98.Z | 60046008 | Pleural effusion (disorder) |
| Pneumonia | CA41 | 233604007 | Pneumonia (disorder) |
| Pneumothorax | DB92 | 36118001 | Pneumothorax (disorder) |
| Fracture | 多编码 | 125605004 | Fracture of bone (morphologic abnormality) |
| Support Devices | N/A | 187252007 | Support device (physical object) |
§2.3 临床任务定义
MIMIC-CXR 覆盖的核心临床任务为急诊科胸部放射学筛查——快速识别需要紧急处理的急性心肺异常(如气胸、大量胸腔积液、肺炎),同时确认支持装置(气管插管、中心静脉导管等)位置是否正常。数据集的设计初衷明确提出:缓解放射科医生人力资源短缺与地域分布不均问题,赋能资源匮乏地区的自动化胸片解读。
§2.4 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 美国马萨诸塞州波士顿 Beth Israel Deaconess Medical Center(BIDMC),单一三级学术医疗中心 |
| 采集时间 | 2011-2016 年(6 年跨度),起始队列筛选自急诊科胸片检查 |
| 就医类型 | 急诊科 (Emergency Department),含部分住院期间胸片(同一患者队列全量回溯) |
| 年龄分布 | 成人为主(MIMIC 体系限定 16 岁以上患者);中位年龄约 60-65 岁 |
| 性别比例 | 约 54% 女性 / 46% 男性(基于衍生子集统计) |
| 种族分布 | 种族/族裔信息需通过 MIMIC-IV 跨库联动获取——心衰子集统计:White 60% / Black 19.4% / Hispanic/Latino 5.4% / Asian 3% |
§2.5 金标准参考
| 数据划分 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| Train | CheXpert + NegBio NLP 自动标注(14 类,含分歧状态) | 机器 (规则型 NLP) | 弱监督标签——有系统性噪声 |
| Valid | 同 Train | 机器 (规则型 NLP) | 弱监督标签——用于模型选择 |
| Test | CheXpert + NegBio NLP + 放射科医生手动标注(官方不公开) | 1 名执业放射科医生 (8 年经验),687 份报告手动标注 | 混合金标准——测试集标签私有,社区通过论文提交获取反馈 |
关键理解:MIMIC-CXR 的测试集标签是私有的—���与研究者本地见到的 NLP 自动标签不同,官方测试集标签经过了放射科医生手动校对。社区基准性能须通过论文发表或 CXR-LT 挑战赛提交获取。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 快速复现图像分类论文 / 资源有限 | MIMIC-CXR-JPG v2.1.0 | ~120 GB | JPG 格式直接可用,含 CheXpert + NegBio 标签 + 官方划分文件,无需处理 DICOM |
| 视觉-语言多模态研究(报告生成/图像-文本检索) | MIMIC-CXR DICOM v2.1.0 | ~470 GB | 含完整放射学报告原文(14 个分段 .txt 文件),适合从报告文本中提取更丰富的标注 |
| 临床多模态融合(胸片 + EHR) | MIMIC-CXR-JPG + MIMIC-IV | ~120 GB + ~7 GB | 通过 subject_id 联动 ICU 病历(生命体征/实验室/药物/出院小结) |
| 长尾学习 / 零样本疾病检测 | CXR-LT 2024 (基于 MIMIC-CXR-JPG 构建) | ~120 GB | 45 ����标签(含 5 类零样本疾病),406 份金标准手工标注评估集 |
| 研究 NLP 标签噪声 / 标签融合策略 | MIMIC-CXR-JPG v2.1.0 | ~120 GB | 同时提供 CheXpert 和 NegBio 标注的 CSV,含分歧 (Disagreement) 状态列 |
§3.1 模态详细说明
MIMIC-CXR 是典型的影像-文本多模态数据集。影像模态为胸部 X 光片(正位 + 侧位),以 DICOM 格式存储(16-bit 灰阶,保留原始空间分辨率),MIMIC-CXR-JPG 衍生版提供 8-bit JPG(经线性归一化 + 直方图均衡化 + JPEG quality=95 压缩)。文本模态为自由文本放射学报告,包含"检查发现" (Findings) 和"印象" (Impression) 等半结构化段落,以 .txt 文件存储。结构化标签以 CSV 格式提供。
§3.2 样本量按子集拆分
| 子集 | 影像数 | 检查数 (Studies) | 患者数 | 含阳性发现比例 |
|---|---|---|---|---|
| 训练集 (Train) | 368,960 | 222,758 | 64,586 | 66.9% |
| 验证集 (Valid) | 2,991 | 1,808 | 500 | 62.9% |
| 测试集 (Test) | 5,159 | 3,269 | 293 | 82.8% (病理富集) |
| 合计 | 377,110 | 227,835 | 65,379 | — |
§3.3 数据格式详情
| 文件类型 | 格式 | 尺寸/深度 | 说明 |
|---|---|---|---|
| 胸部 X 光片(DICOM 版) | DICOM | 16-bit 灰阶,原始空间分辨率 | 从 BIDMC PACS 直接导出,保留 DICOM 标准元数据(已去 PHI) |
| 胸部 X 光片(JPG 版) | JPEG | 8-bit 灰阶,原始空间分辨率,quality=95 | 经归一化 + 直方图均衡化转换 |
| 放射学报告 | TXT | 14 个分段文件(按检查编号分段) | 含完整的 Findings/Impression/Indication 等段落 |
| CheXpert 标签 | CSV (gzip) | 每行一个检查 (study_id),列为 14 个标签 | 值:1.0 / -1.0 / 0.0 / 缺失 |
| NegBio 标签 | CSV (gzip) | 同上 | 值同上,另含与 CheXpert 的分歧列 |
| 元数据 | CSV (gzip) | 每行一张影像 (dicom_id) | 列含:subject_id / study_id / ViewPosition / 匿名化采集日期 |
| 数据划分 | CSV (gzip) | 每行一张影像 | 列含:dicom_id / subject_id / study_id / split |
§3.4 存储大小
| 版本 | 大小 | 说明 |
|---|---|---|
| MIMIC-CXR DICOM v2.1.0 | ~470 GB | DICOM 格式原始影像 + 报告文本 + CSV 元数据 |
| MIMIC-CXR-JPG v2.1.0 | ~120 GB | JPG 格式影像 + CheXpert/NegBio 标签 + CSV 元数据 + 划分文件 |
§3.5 标注流程
MIMIC-CXR 的结构化标签通过两套独立的规则型 NLP 管道从放射学报告中自动提取:
CheXpert 标注器(三阶段):
- 提取 (Extraction):在报告文本中识别 14 类观察的所有提及,包括同义词、缩写和拼写变体
- 分类 (Classification):利用局部上下文将每条提及分类为阳性、不确定性或阴性
- 聚合 (Aggregation):按"阳性 > 不确定性 > 阴性"优先级将同一观察的多条提及聚合为最终标签
NegBio 标注器:基于依存句法模式的规则引擎,输入预标注的医学发现提及,判断是否存在否定或不确定性修饰。两种标注器使用 CheXpert 定义的统一提及模式(与 NIH ChestX-ray14 的模式不同)。"No Finding"标签仅在除"Support Devices"外的所有标签均为阴性或未提及时设为阳性。
§3.6 标注者资质
| 标注角色 | 人数 | 资质 | 任务 |
|---|---|---|---|
| NLP 自动标注 (CheXpert) | N/A | 规则型系统 | 227,835 份报告的 14 类标签提取 |
| NLP 自动标注 (NegBio) | N/A | 规则型系统 | 同上 |
| 放射科医生手动审核 | 1 名 | 执业放射科医生,8 年临床经验 | 687 份报告手动标注(用于验证 NLP 标注器性能与测试集金标准) |
NLP 标注器性���(对 687 份人工标注报告的 F1 分数,提及提取):
| 发现 | CheXpert F1 | NegBio F1 | 不确定性检测 F1(最佳) |
|---|---|---|---|
| Atelectasis | 0.998 | 0.930 | 0.835 (CheXpert) |
| Cardiomegaly | 0.954 | 0.596 | 0.333 (CheXpert) |
| Consolidation | 0.986 | 0.966 | 0.486 (CheXpert) |
| Edema | 0.996 | 0.855 | 0.742 (CheXpert) |
| Pleural Effusion | 0.987 | 0.971 | 0.500 (CheXpert) |
| Pneumonia | 0.981 | 0.836 | 0.674 (CheXpert) |
| Pneumothorax | 0.998 | 0.983 | 0.286 (CheXpert) |
| Enlarged Cardiomediastinum | 0.679 | 0.761 | — |
| Lung Lesion | 0.500 | 0.855 | — |
| Lung Opacity | 0.421 | 0.802 | — |
| Pleural Other | 0.000 | 0.592 | — |
| Fracture | 0.000 | 0.904 | — |
| Support Devices | — | 0.880 | — |
| No Finding | — | 0.543 | — |
§3.7 数据采集时间范围
2011 年至 2016 年。患者队列筛选自急诊科胸片检查,随后回溯提取该队列在此 6 年间在 BIDMC 的全部胸片及报告。匿名化日期偏移将每位患者首次入院年份映射至 2100-2200 年间的随机年份,保留了时间先后顺序,但抹除了季节性和星期效应。
§3.8 地理覆盖
单一地点:美国马萨诸塞州波士顿 Beth Israel Deaconess Medical Center(哈佛医学院教学医院,三级学术医疗中心)。覆盖波士顿都市区急诊就诊人群,不包含农村或多中心数据。
§3.9 采集设备规格
影像来源于 BIDMC 医院 PACS,以 DICOM 格式导出。由于涉及多种 X 光设备且 DICOM 头文件中的设备型号信息已作为 PHI 脱敏,无法获取具体的设备品牌和型号。DICOM 符合 DICOM Standard version 2017e。
§3.10 深度溯源链
BIDMC 急诊科就诊 (2011-2016)
│
├── EHR/RIS 系统查询:急诊胸片检查 → 患者 ID 队列
│ └── 患者 ID 匿名化:subject_id (10M-19.9M) + 日期偏移
│
├── PACS 系统:DICOM 影像导出
│ ├── DICOM 元数据去 PHI
│ ├── 烧录标注 (burned-in annotations) OCR 检测 + 去标识化
│ │ └── ~6,900 张人工复审,0 张残留 PHI
│ └── 文件名替换为随机 40 字符哈希 → dicom_id
│
├── RIS/病历系统:放射学报告文本导出
│ ├── 自动去标识化
│ └── 报告 ID 匿名化:study_id (50M-59.9M)
│
├── NLP 标注管道
│ ├── CheXpert 标注器(三阶段:提取 → 分类 → 聚合)
│ ├── NegBio 标注器(依存模式规则引擎)
│ └── 输出:chexpert.csv / negbio.csv(含分歧状态)
│
├── 放射科医生人工审核
│ ├── 687 份报告手动标注(NLP 性能验证)
��� └── 测���集 293 名患者报告金标准标注(不公开)
│
├── 数据划分
│ ├── 患者级划分(训练/验证/测试互斥)
│ └── 测试集按患者筛选:至少含 1 份人工标注报告
│
└── PhysioNet 发布
├── MIMIC-CXR DICOM v2.1.0
└── MIMIC-CXR-JPG v2.1.0(DICOM → 8-bit JPG 转换)
§4 数据结构详解
§4.0 目录结构预览
MIMIC-CXR-JPG v2.1.0 结构(推荐):
mimic-cxr-jpg/
├── files/ # JPG 影像文件
│ ├── p10/ # 第 1 个分段文件夹(共 10 个)
│ │ ├─��� p10000032/ # 患者子文件夹 (subject_id)
│ │ │ ├── s50414267/ # 检查子文件夹 (study_id)
│ │ │ │ ├── 02aa804e-...jpg # 单张影像 (dicom_id hash)
│ │ │ │ └── 174413ec-...jpg
│ │ │ └── s53189527/
│ │ │ ├── 2a2277a9-...jpg
│ │ │ └── e084de3b-...jpg
│ │ └── ...
│ ├── p11/ ... p19/ # 共 10 个分段 (p10-p19)
├── mimic-cxr-2.0.0-metadata.csv.gz # 影像元数据
├── mimic-cxr-2.0.0-split.csv.gz # 数据划分 (train/valid/test)
├── mimic-cxr-2.0.0-chexpert.csv.gz # CheXpert 标签 (public)
├── mimic-cxr-2.0.0-negbio.csv.gz # NegBio 标签 (public)
└── IMAGE_FILENAMES # 全部 JPG 文件相对路径列表
§4.1 DAIMS 标准化字段描述表
CheXpert 标签文件核心字段:
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 取值范围 |
|---|---|---|---|---|---|
subject_id |
Integer | 匿名化患者标识符 | 10000032 |
患者级划分、多检查聚合 | 10,000,000–19,999,999 |
study_id |
Integer | 匿名化检查标识符 | 50000001 |
检查级标签关联 | 50,000,000–59,999,999 |
Atelectasis |
Float | 肺不张标签 | 1.0 |
多标签分类目标 | 1.0 / -1.0 / 0.0 / 空 |
Cardiomegaly |
Float | 心脏肥大标签 | 0.0 |
同上 | 同上 |
Pleural Effusion |
Float | 胸腔积液标签 | 1.0 |
同上 | 同上 |
Pneumonia |
Float | 肺炎标签 | 0.0 |
同上 | 同上 |
Pneumothorax |
Float | 气胸标签 | 0.0 |
同上 | 同上 |
Support Devices |
Float | 支持装置标签 | 1.0 |
同上 | 同上 |
No Finding |
Float | 无异常发现标签 | 0.0 |
同上 | 同上 |
影像元数据文件核心字段:
| 字段名 | 数据类型 | 说明 | AI 用途 |
|---|---|---|---|
dicom_id |
String (40-char hash) | 影像唯一标识符 | 文件名匹配、影像定位 |
subject_id |
Integer | 患者标识符 | 患者级划分、与 MIMIC-IV 关联 |
study_id |
Integer | 检查标识符 | 与标签/报告关联 |
ViewPosition |
String | 投照体位 (PA / AP / LATERAL) |
视图筛选 |
StudyDate |
Integer | 匿名化检查日期(天数偏移) | 时间序列排列 |
§4.2 标签分布统计
基于 MIMIC-CXR-JPG 训练集 222,750 次检查的标签频率(8 次检查未标注,不含):
| 发现 | 训练集阳性率 | NLP 标注质量 | 不确定性比例 |
|---|---|---|---|
| No Finding | 33.0% | 低 (F1 0.543) | N/A |
| Support Devices | ~23% | 中 (F1 0.880) | 低 |
| Pleural Effusion | ~11% | 高 (F1 >0.97) | 中 |
| Atelectasis | ~10% | 高 (F1 >0.99) | 中 |
| Cardiomegaly | ~9% | 高 (F1 0.954 CheXpert) | 低 |
| Edema | ~5% | 高 (F1 0.996 CheXpert) | 高(不确定性常见) |
| Lung Opacity | ~5% | 中 | 高 |
| Consolidation | ~2% | 高 (F1 0.986 CheXpert) | 中 |
| Pneumonia | ~2% | 高 (F1 0.981 CheXpert) | 中 |
| Pneumothorax | ~1.3% | 最高 (F1 >0.98) | 低 |
| Enlarged Cardiomediastinum | <1% | 低 (F1 <0.78) | 高 |
| Lung Lesion | <0.5% | 低-中 | 高 |
| Fracture | <0.4% | 低-中(NegBio 0.904 / CheXpert 0.000) | 低 |
| Pleural Other | <0.3% | 最低 (F1 <0.60) | 高 |
§4.3 数据层级关系
患者 (subject_id, N=65,379)
└── 检查 (study_id, N=227,835)
├── 报告 (TXT, 1 份/检查)
│ └── 标签 (CSV, 14 类/检查: CheXpert + NegBio)
└── 影像 (dicom_id, 1-N 张/检查)
├── ViewPosition = PA/AP (正位, ~66.8%)
└── ViewPosition = LATERAL (侧位, ~32.5%)
§4.4 缺失数据说明
| 缺失类型 | 范围 | 说明 |
|---|---|---|
| 标签缺失(报告未提及) | 常见于低频发现 | CSV 中空值表示该标签在原始报告中未被提及。不同于 0.0(明确阴性),空值意味着报告没有讨论该发现。 |
| CheXpert 标签缺失 (CSV) | 约 2,414 次检查 (1.1%) | CheXpert 无法对该检查生成任何标签(无行记录),原因是报告文本不足以触发任何提及模式。 |
| 报告 Impression 段落缺失 | ~27,684 份报告 (12.2%) | 部分报告仅含 Findings 段落(含等效未标注段落 10,514 份),约 8 份报告无可用文本。 |
| 种族/族裔数据 | JPG 版未直接提供 | 需通过 subject_id 与 MIMIC-IV 数据库联动获取。 |
§5 数据划分与使用建议
§5.1 官方划分策略
MIMIC-CXR 采用患者级 (patient-level) 互斥划分——同一患者的所有检查只能出现在一个子集中:
- 训练集 (Train):64,586 名患者的 222,758 次检查(368,960 张影像)
- 验证集 (Valid):500 名患者的 1,808 次检查(2,991 张影像)
- 测试集 (Test):293 名患者的 3,269 次检查(5,159 张影像)— 不公开金标准标签
官方强烈建议通过划分文件 (mimic-cxr-2.0.0-split.csv.gz) 使用官方划分,以确保不同论文间的性能可比性。
§5.2 数据泄漏风险
患者级 vs 检查级划分:MIMIC-CXR 的官方划分保证患者互斥——同一患者的正位和侧位胸片不会分别进入训练集和测试集。如果研究者自行重新划分时使用检查级 (study-level) 而非患者级划分,将导致数据泄漏。
MIMIC-IV 联动泄漏:当研究者通过 subject_id 将 MIMIC-CXR 与 MIMIC-IV 联动时,需要注意 MIMIC-IV 的患者划分与 MIMIC-CXR 的划分不一定一致——应始终以 MIMIC-CXR 的划分为主。
§5.3 标签不确定性处理策略
| 策略名称 | 处理方式 | 优点 | 缺点 |
|---|---|---|---|
| U-Zeros | -1.0 → 0.0 |
简单,适合快速实验 | 将不确定性样本强行归为阴性,丢失信息 |
| U-Ones | -1.0 → 1.0 |
召回率优先,Irvin et al. 推荐 | 可能引入假阳性噪声 |
| U-Ignore | 忽略 -1.0 样本 |
训练数据更干净 | 训练集规模缩小,信息损失 |
| U-SelfTrained | 先 U-Ones 训练基模型,再对 -1.0 重新预测软标签 |
SOTA | 计算成本高 |
§5.4 跨数据集验证建议
MIMIC-CXR 是跨数据集泛化研究的理想"源域"——在 MIMIC-CXR 上训练 → 在 CheXpert/PadChest 上测试,或反之。注意:MIMIC-CXR 的 NLP 标签风格 (CheXpert labeler) 与 CheXpert 一致但与 NIH/PadChest 不同;BIDMC 急诊人群的人口特征与斯坦福的住院+门诊人群存在系统差异。
§6 AI 就绪指南
§6.1 快速上手
# ========================================
# MIMIC-CXR 快速上手 — PyTorch 版
# 环境要求: torch>=2.0, torchvision, pandas, PIL
#
# ⚠️ 目录结构预期:
# 请从 PhysioNet 下载 MIMIC-CXR-JPG v2.1.0 后,解压至 ./data/mimic-cxr-jpg/
# ./data/mimic-cxr-jpg/
# ├── files/p10/ ... p19/ # JPG 影像文件
# ├── mimic-cxr-2.0.0-split.csv.gz # 数据划分
# ├── mimic-cxr-2.0.0-chexpert.csv.gz # CheXpert 标签
# ├── mimic-cxr-2.0.0-metadata.csv.gz # 元数据
# └── IMAGE_FILENAMES # 全部文件路径列表
#
# 推荐只加载正位 (PA/AP) 视图(占总影像 66.8%)
# ========================================
import pandas as pd
import numpy as np
from pathlib import Path
from PIL import Image
import torch
from torch.utils.data import Dataset, DataLoader
import torchvision.transforms as T
# 配置路径
DATA_ROOT = Path("./data/mimic-cxr-jpg")
# ��载元数据和标签(正位视图)
metadata = pd.read_csv(DATA_ROOT / "mimic-cxr-2.0.0-metadata.csv.gz")
split_df = pd.read_csv(DATA_ROOT / "mimic-cxr-2.0.0-split.csv.gz")
labels_df = pd.read_csv(DATA_ROOT / "mimic-cxr-2.0.0-chexpert.csv.gz")
# 筛选正位视图 + 训练集
fronevent-blocked= metadata[metadata["ViewPosition"].isin(["PA", "AP"])]
train_ids = set(split_df[split_df["split"] == "train"]["dicom_id"])
fronevent-blocked= frontal_views[frontal_views["dicom_id"].isin(train_ids)]
fronevent-blocked= frontal_train.merge(
labels_df, on=["subject_id", "study_id"], how="left"
)
# 5 种竞争病种是最常用的评估子集
TARGET_LABELS = [
"Atelectasis", "Cardiomegaly", "Consolidation",
"Edema", "Pleural Effusion"
]
# U-Ones 策略:不确定性 → 1.0,缺失 → 0.0
label_matrix = frontal_train[TARGET_LABELS].fillna(0.0).replace(-1.0, 1.0).values
print(f"训练样本数(正位视图): {len(frontal_train)}")
§6.2 数据获取
| 步骤 | 操作 | 预计时间 |
|---|---|---|
| 1 | 在 PhysioNet 注册账户 (https://physionet.org/register/) | 5 分钟 |
| 2 | 在 CITI Program 完成"Data or Specimens Only Research"培训:选择 “Massachusetts Institute of Technology Affiliates” 作为机构;完成约 9 个模块的学习和考试(≥80 分通过) | 2-4 小时 |
| 3 | 在 PhysioNet 提交认证申请:上传 CITI 证书;填写机构信息与推荐人信息(学生/博后须提供导师信息) | 约 1-2 周审核 |
| 4 | 认证通过后,访问数据页面签署数据使用协议 (DUA) | 即时 |
| 5 | 推荐通过 Google Cloud Storage 直接访问(关联 PhysioNet 账户与 Google Cloud 账号),或本地下载 | 取决于网络速度 |
⚠️ 常见被拒原因:CITI 培训选择了错误的课程、学生未提供导师推荐人信息、CITI 证书提交的是课程列表而非完成报告。
§6.3 预处理管道
import pydicom
import numpy as np
def load_dicom_as_tensor(dicom_path, target_size=224):
"""加载 DICOM 文件并转为归一化 PyTorch Tensor"""
ds = pydicom.dcmread(dicom_path)
img = ds.pixel_array.astype(np.float32)
# 归一化到 [0, 1]
img = (img - img.min()) / (img.max() - img.min() + 1e-8)
# ⚠️ 检查 PhotometricInterpretation:MONOCHROME1 需反转
if getattr(ds, "PhotometricInterpretation", "") == "MONOCHROME1":
img = 1.0 - img
# Resize + 转 3 通道以适配 ImageNet 预训练模型
img = T.functional.resize(torch.from_numpy(img).unsqueeze(0), target_size)
img = img.repeat(3, 1, 1) # 灰度转伪 RGB
# ImageNet 标准化
img = T.functional.normalize(
img, mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]
)
return img
def load_jpg_as_tensor(jpg_path, target_size=224):
"""加载 JPG 胸片并转为归一化 PyTorch Tensor"""
img = Image.open(jpg_path).convert("L") # 灰度模式
img = T.functional.resize(T.functional.to_tensor(img), target_size)
img = img.repeat(3, 1, 1) # 转伪 RGB
img = T.functional.normalize(
img, mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]
)
return img
§6.4 PyTorch Dataset 完整实现
class MIMICCXRDataset(Dataset):
"""MIMIC-CXR-JPG PyTorch Dataset — 多标签分类"""
def __init__(self, data_root, labels_df, metadata_df, split_df,
split="train", view="frontal", target_labels=None,
label_strategy="u_ones", transform=None):
self.data_root = Path(data_root)
self.transform = transform
# 筛选视图 + 数据划分
if view == "frontal":
meta = metadata_df[metadata_df["ViewPosition"].isin(["PA", "AP"])]
elif view == "lateral":
meta = metadata_df[metadata_df["ViewPosition"] == "LATERAL"]
else:
meta = metadata_df
split_ids = set(split_df[split_df["split"] == split]["dicom_id"])
meta = meta[meta["dicom_id"].isin(split_ids)]
# 合并标签
self.df = meta.merge(labels_df, on=["subject_id", "study_id"], how="left")
self.target_labels = target_labels or [
"Atelectasis", "Cardiomegaly", "Consolidation",
"Edema", "Pleural Effusion", "Pneumonia",
"Pneumothorax", "No Finding"
]
# 标签处理策略
label_data = self.df[self.target_labels].fillna(0.0)
if label_strategy == "u_ones":
label_data = label_data.replace(-1.0, 1.0)
elif label_strategy == "u_zeros":
label_data = label_data.replace(-1.0, 0.0)
self.labels = label_data.values.astype(np.float32)
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
jpg_path = self.data_root / row["path"]
img = Image.open(str(jpg_path)).convert("L")
img = T.functional.to_tensor(img).repeat(3, 1, 1)
if self.transform:
img = self.transform(img)
label = torch.from_numpy(self.labels[idx])
return img, label, row["subject_id"]
§6.5 常见坑点
⚠️ 坑点 1:DICOM PhotometricInterpretation 反转(分类:预处理陷阱)
问题:DICOM 文件的
PhotometricInterpretation可能为MONOCHROME1(亮=低像素值)或MONOCHROME2(亮=高像素值)。如果忽略此字段直接归一化,部分影像会呈现反色——肺野变白、骨骼变黑——严重影响模型判断。症状:训练早期 loss 异常高且不稳定,可视化影像时发现部分胸片呈"负片"效���。
解决:在加载 DICOM 像素后检查
PhotometricInterpretation字段,若为MONOCHROME1则用1.0 - img_normalized反转。参考:MIMIC-CXR 论文 Methods 章节;pydicom 官方文档。
⚠️ 坑点 2:标签 CSV 的 subject_id + study_id 组合重复(分类:标签理解)
问题:CheXpert/NegBio 标签 CSV 以
(subject_id, study_id)为键,但多张影像(如正位+侧位)共享同一个study_id。直接用影像文件名 join 标签时可能导致同一检查的多张影像获得完全相同的一组标签。症状:按影像统计的标签分布与论文报告不一致。
解决:通过 metadata 文件将标签 join 到单张影像时,确保理解一对多关系。建议先用 metadata 筛选视图再 merge 标签。
⚠️ 坑点 3:No Finding 评估的对称性问题(分类:评估误用)
问题:
No Finding标签的 NLP 标注逻辑是"当且仅当所有其他发现(Support Devices 除外)为阴性时才为阳性"。这导致 NLP 提及提取 F1 仅为 0.543——远低于其他发现。如果直接将 NLP 标注的No Finding作为目标,模型会在大量有异常的报告上被错误地训练为"正常"。症状:
No Finding类的 AUROC 显著低于其他发现,且放射科医生标注的测试集性能远低于验证集性能。解决:在训练中将
No Finding优化为一个派生标签——仅当 14 类中除 Support Devices 外的其他发现全部预测为阴性时,才判为 No Finding。
⚠️ 坑点 4:路径拼接中的 hash 文件名(分类:工程陷阱)
问题:MIMIC-CXR 的 DICOM/JPG 文件名是一个 40 字符的 hash,而 metadata 文件的
dicom_id列不含扩展名。症状:
FileNotFoundError。解决:JPG 版需在
dicom_id后添加.jpg;DICOM 版文件名无扩展名,需遍历子目录匹配。推荐使用 MIMIC-CXR-JPG 版的IMAGE_FILENAMES文件获取全部相对路径映射。
⚠️ 坑点 5:MIMIC-IV 联动时的 subject_id 泄漏(分类:数据泄漏)
问题:MIMIC-CXR 和 MIMIC-IV 的数据划分是独立的。如果使用 MIMIC-IV 中的模块提取特征并在 MIMIC-CXR 的测试集上评估,需要确保 MIMIC-IV 数据中不含 MIMIC-CXR 测试集患者的住院信息。
症状:测试集性能异常高(>0.95 AUROC),但实际泛化到新患者时性能骤降。
解决:始终以 MIMIC-CXR 的划分为主——联动 MIMIC-IV 数据前,先排除 MIMIC-CXR 测试集中 293 名患者的所有 MIMIC-IV 记录。
⚠️ 坑点 6:CheXpert 与 NegBio 分歧作为伪金标准(分类:标签理解)
问题:一些研究将 CheXpert 和 NegBio 一致同意的标签视为"伪金标准"用于筛选训练样本。但分歧不一定意味着错误——有时一方正确而另一方误判,有时双方都错。
症状:过滤后训练集样本量显著减少,但验证集性能未见提升。
解决:不建议盲目使用分歧过滤。如果资源允许,使用报告原文通过 LLM 或 CheXbert(BERT-based 标注器,性能优于 CheXpert)重新标注。
⚠️ 坑点 7:JPEG 质量损失的临床影响(分类:预处理陷阱)
问题:DICOM → JPG 的直方图均衡化转换会不可逆地改变图像对比度分布。quality=95 的 JPEG 压缩导致的信息损失在大部分分类任务上可忽略(<0.5% AUROC 差异),但在病灶分割和异常检测任务中影响更大。
症状:在 DICOM 版上训好的分割模型,迁移到 JPG 版后 Dice 系数下降 1-2%。
解决:对于需要精确像素值重建的任务(分割、图像重建、自监督预训练),优先使用 MIMIC-CXR DICOM 版并自定义归一化策略。
§6.6 数据增强建议
安全增强 ✅:
- 随机水平翻转(胸片的左右解剖对称性确保不会引入伪影)
- 随机旋转 ±10°(模拟患者体位偏移)
- 随机缩放裁剪(模拟不同投照距离)
- 亮度/对比度调整(模拟不同曝光条件)
危险增强 ❌:
- 垂直翻转——胸片的方向性(心尖在下、肺尖在上)不可颠倒
- 大角度旋转(>15°)——不符合胸片投照规范
- 色彩抖动(Hue/Saturation)——胸片是灰阶影像,引入色相会破坏预训练权重
- Elastic deformation——可能导致肋骨断裂的伪影
§6.7 推荐模型与超参数
| 场景 | 推荐模型 | 预训练权重 | 典型超参数 | 预期 AUROC (5 病种) |
|---|---|---|---|---|
| 快速基线 | DenseNet-121 | ImageNet | Adam, lr=1e-4, bs=64, epoch 20 | ~0.80-0.82 |
| 标准 SOTA | ConvNeXt-B | ImageNet-22K | AdamW, lr=1e-4, cosine schedule, bs=128 | ~0.84-0.86 |
| 视觉-语言 | ViT-B/32 (BiomedCLIP) | CLIP/PMC-CLIP | AdamW, lr=5e-5, warmup 500 step | ~0.83-0.85 |
| 多视图 (正+侧位) | CaMCheX | ImageNet | AdamW, lr=1e-4 | ~0.86+ (SOTA) |
§6.8 计算资源需求
| 场景 | GPU 显存 | 磁盘 | 训练时间 (A100 80GB) |
|---|---|---|---|
| 5-label 分类(正位,224×224) | ≥12 GB | ~50 GB (JPG) / ~150 GB (DICOM) | ~8-12 小时 |
| 14-label 全分类(224×224) | ≥16 GB | 同上 | ~12-16 小时 |
| 视觉-语言预训练(224×224) | ≥40 GB | ~120 GB (JPG + 报告文本) | ~48-72 小时 |
§6.9 官方评估指标
from sklearn.metrics import roc_auc_score
def evaluate_mimic_cxr(y_true, y_pred, labels):
"""MIMIC-CXR 多标签分类标准评估"""
per_label_auc = {}
for i, label in enumerate(labels):
mask = ~np.isnan(y_true[:, i])
if mask.sum() > 0 and len(np.unique(y_true[mask, i])) > 1:
per_label_auc[label] = roc_auc_score(
y_true[mask, i], y_pred[mask, i]
)
macro_auc = np.mean(list(per_label_auc.values()))
print(f"Macro AUROC: {macro_auc:.4f}")
for label, auc in per_label_auc.items():
print(f" {label}: {auc:.4f}")
return macro_auc, per_label_auc
推荐报告:(1) 逐标签 AUROC;(2) 5 种竞争病种子集 Macro AUROC;(3) 全 14 类 Macro AUROC;(4) 在官方验证集上超参调优,但仅以官方测试集的放射科医生标注为最终金标准报告性能。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 选择偏倚 | 急诊科就诊人群(急性表现、病情较重)——不代表社区或门诊筛查人群 | 高 | 在外部验证中涵盖社区/门诊来源的数据集(CheXpert、PadChest) |
| 单中心偏倚 | 单一医院(BIDMC 波士顿)——影像采集协议、人口分布无法泛化 | 高 | 外部验证矩阵(§7.8)覆盖多中心性能差异 |
| NLP 标注偏倚 | CheXpert/NegBio 标签器的系统性误差在低频/罕见发现上放大 | 中 | 使用 Co-Teaching/DivideMix 噪声鲁棒训练 |
| 不确定性标签偏倚 | NLP 不确定性检测能力显著弱于提及提取 | 中 | 将不确定性样本作为半监督学习的无标签数据 |
| 人口统计偏斜 | 种族/族裔/保险信息需通过 MIMIC-IV 联动获取 | 低 | 使用公平性审计工具(Fairlearn)联动分析 |
§7.2 标注质量评估
| 标注类型 | 样本量 | F1 范围 | 核心局限 |
|---|---|---|---|
| CheXpert NLP(训练+验证) | 227,835 份报告 | 0.00-0.998 | 不确定性检测弱;对"Pleural Other"完全无法检测 |
| NegBio NLP(训练+验证) | 227,835 份报告 | 0.543-0.983 | 在某些发现上优于 CheXpert,但不确定性检测更弱 |
| 放射科医��手动(NLP 验证) | 687 份报告,1 名放射科医生 | N/A(单人标准) | 无多评分者一致性 (κ) 系数 |
| 放射科医生手动(测试集) | 293 名患者,不公开 | N/A | 单一标注者,无外部验证 |
§7.3 泛化性讨论
| 泛化场景 | 失效风险 | 证据 |
|---|---|---|
| 机构间泛化 (BIDMC → 其他医院) | 中-高 | 在 CheXpert 上微调的 MIMIC-CXR 模型 AUROC 下降 3-5% |
| 人群泛化 (波士顿 → 非美国人群) | 高 | 在亚洲/非洲数据集上的外部验证数据有限 |
| 时间泛化 (2011-2016 → 2020+) | 中 | 成像技术、临床实践、疾病流行病学随时间漂移 |
| 就诊类型泛化 (急诊 → 门诊/住院) | 中 | 急诊人群的急性表现与门诊筛查有本质差异 |
| 模型架构泛化 (CNN → Transformer) | 低 | ConvNeXt/ViT/DenseNet 在 MIMIC-CXR 上的相对排序与 CheXpert 一致 |
| 任务泛化 (分类 → 分割/生成) | 中 | 无金标准分割掩码(需依赖 CheXmask 等衍生标注) |
§7.4 伦理考量
- 患者隐私:数据已按 HIPAA Safe Harbor 标准脱敏,并经人工抽样复审(~6,900 张影像,0 张检出 PHI)。但深度学习模型被证明能从胸片中提取种族和性别等敏感属性,使用时须警惕。
- 二次使用同意:原始患者数据的采集未征求用于 AI 研究的具体知情同意(IRB 批准豁免),使用者应遵守 PhysioNet DUA。
- 临床部署风险:任何基于 MIMIC-CXR 训练的模型在临床部署前必须经过前瞻性外部验证——急诊场景下的假阴性可能导致灾难性后果。
- 公平性:亚洲和西班牙裔欠代表。训练出的模型在这些群体中可能表现更差。
- 数据共享禁令:DUA 明确禁止分享 MIMIC-CXR 数据。发布预训练模型时须确保模型不包含训练数据。
§7.5 公平性评估
MIMIC-CXR 的公平性研究依赖于与 MIMIC-IV 的跨库联动(种族/族裔/保险类型信息仅在 MIMIC-IV 中提供)。
| 人口统计维度 | 分布 (心衰子集) | 已知性能差异 |
|---|---|---|
| 性别 | 54% 女性 / 46% 男性 | 女性胸片中的 Cardiomegaly 被系统性漏检(心脏投影受乳房覆盖影响) |
| 种族/族裔 | White 60% / Black 19.4% / Hispanic 5.4% / Asian 3% | Black 亚组在 Pleural Effusion 的 AUROC 低于 White 亚组约 2-3% |
| 年龄 | 中位 60-65 岁 | 老年患者 (>75) 的影像质量较差,但分类性能差异不显著 |
§7.6 数据漂移提示
- 设备升级漂移:2011-2016 年间 BIDMC 可能更换或升级了 X 光设备,导致影像质量分布的时间漂移。
- 临床实践漂移:放射学报告写作风格、术语习惯随时间演变。
- COVID-19 冲击:MIMIC-CXR 不含 COVID-19 期间数据(截止 2016 年),无法用于训练或评估 COVID-19 相关模型。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据集明确描述了创建目的和预期用途 | ✅ | 论文中明确阐述:支持胸片自动分析、NLP 和临床决策支持 |
| 2 | 提供了数据收集方法的完整描述 | ✅ | Methods 章节详述了三阶段提取流程(EHR → PACS → 报告) |
| 3 | 数据采集时间范围和地理位置明确 | ✅ | 2011-2016 / BIDMC Boston, MA |
| 4 | 样本量、数据格式和文件结构清晰 | ✅ | DICOM/JPG + TXT + CSV,目录结构文档完备 |
| 5 | 标注过程和方法有详细记录 | ✅ | CheXpert/NegBio 标注器论文 + MIMIC-CXR-JPG 论文双重引用 |
| 6 | 标注者资质和标注一致性被报告 | ⚠️ | 人工标注者资质报告了(1 名放射科医生),但无多标注者 κ 系数 |
| 7 | 标签分布统计被提供 | ✅ | 训练集 14 类标签频率表(Johnson et al., 2019 Table 2) |
| 8 | 数据划分策略被明确定义 | ✅ | 患者级划分,明确公布,划分文件可下载 |
| 9 | 训练/验证/测试集的样本量和统计信息被提供 | ✅ | 论文 Table 4 详列样本/患者/视图分布 |
| 10 | 数据集包含详细的字段/变量文档 | ✅ | 每列 CSV 的含义在 PhysioNet 页面和论文中描述 |
| 11 | 已知的标签噪声或偏差被讨论 | ✅ | 论文报告了 NLP 标注器 F1 分数和局限性 |
| 12 | 数据缺失的模式和原因有说明 | ⚠️ | 仅简述 NLP 标注器无法标注的报告数量,未系统描述缺失值分布 |
| 13 | 数据集有版本号和持久标识符 | ✅ | v2.1.0 + PhysioNet DOI (10.13026/4jqj-jw95) |
| 14 | 明确的使用许可和数据使用协议 | ✅ | PhysioNet Credentialed Health Data License 1.5.0 + DUA |
| 15 | 有伦理审批声明 | ✅ | BIDMC IRB 批准,患者知情同意豁免 |
| 16 | 讨论了隐私保护和去标识化措施 | ✅ | HIPAA Safe Harbor + ~6,900 张人工 PHI 复审 |
| 17 | 讨论了数据代表性(人群、机构、地域) | ⚠️ | 讨论了单中心/急诊局限性,但未定量描述人口统计分布(需联动 MIMIC-IV) |
| 18 | 提供了数据的预期外使用警告 | ✅ | DUA 明确禁止重新识别患者和商业用途 |
| 19 | 讨论了潜在的社会和伦理影响 | ⚠️ | 简要提及放射科医生短缺背景,未系统讨论模型偏倚 |
| 20 | 有已发布的标准基准结果 | ✅ | 社区已产出大量 SOTA 基准(见 §8.1) |
| 21 | 数据格式遵循通用标准 | ✅ | DICOM (医学影像国际标准) / CSV / TXT |
| 22 | 提供了数据加载和预处理代码 | ✅ | JPG 转换代码仓库 + TorchXRayVision 等社区工具 |
| 23 | 数据更新计划有说明 | ⚠️ | v2.1.0 已更新,但无公开的版本路线图 |
| 24 | 数据集的可复现性 | ⚠️ | NLP 标注器确定性的,但 DICOM→JPG 转换可能因库版本产生微小差异 |
DAIMS 评分:17.0 / 24
评分解读:良好——接近优秀,少数可改进点。
对你意味着什么:MIMIC-CXR 的数据就绪度在公开胸片数据集中属于第一梯队。主要扣分项集中在:(1) 人工标注为单人执行,无多标注者一致性度量(κ 系数);(2) 人口统计分布未在数据集论文中直接量化——需要额外联动 MIMIC-IV 获取种族/族裔信息;(3) 缺失数据机制未做深入的统计建模。建议:(1) 在联动 MIMIC-IV 后补充公平性审计;(2) 利用 CheXpert/NegBio 的"分歧"状态作为标签噪声的信号;(3) 对于面向临床部署的研究,务必在多个外部数据集上做泛化性验证。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 样本量 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关��发现 |
|---|---|---|---|---|---|---|
| CheXpert | Stanford (美国) | 224,316 | 5-label 分类 | AUROC 0.82-0.86 | -2% ~ -5% | 使用相同 CheXpert 标注词汇,性能下降主要归因于人群差异(住院+门诊 vs 急诊) |
| NIH ChestX-ray14 | NIH (美国) | 112,120 | 5-label 分类 | AUROC ~0.79-0.81 | -3% ~ -6% | 跨 NLP 标注系统泛化:NIH 使用不同的标注模式,降幅大于 CheXpert |
| PadChest | Alicante (西班牙) | 160,868 | 多标签分类 | AUROC (macro) ~0.84 | -4% ~ -7% | 跨洲际泛化:西班牙语报告 + 192 类标签 |
| VinDr-CXR | 越南 | 18,000 | 病灶检测 | AUC 0.68-0.81 | 显著下降 | 亚洲人群+不同设备,泛化性存在实质缺口 |
§8 基准性能与生态
§8.1 排行榜
注意:MIMIC-CXR 的测试集标签为私有,以下性能数据来源于已发表论文。不同论文可能使用不同的标签处理策略(U-Ones/U-Zeros)、视图选择(正位/多视图)、评估标签子集(5 病种/14 全类),绝对数值不可直接比较。
| 排名 | 模型 | 性能指标 | 年份 | 关键技术 | 完整引用 |
|---|---|---|---|---|---|
| 1 | CheXzero | AUROC 89.22 (zero-shot, 5-class) | 2022 | CLIP 架构,零样本学习 | Tiu, E. et al. “Expert-level detection of pathologies from unannotated chest X-ray images via self-supervised learning.” Nature Biomedical Engineering, 2022. |
| 2 | CaMCheX | AUROC 86.3+ (5-class, CXR-LT SOTA) | 2025 | 多视角 ConvNeXt + Transformer + 结构化临床数据融合 | Tsai, C. et al. “Clinically-aligned Multi-modal Chest X-ray Classification.” OpenReview, 2025. |
| 3 | TorchXRayVision | AUROC 86.3 (14-class) | 2025 | DenseNet-121 多数据集预训练 | Cohen, J.P. et al. “TorchXRayVision.” MIDL, 2022. |
| 4 | ConVIRT | AUROC 85.7 (5-class) | 2021 | 图像-报告对比学习 | Zhang, Y. et al. “Contrastive learning of medical visual representations from paired images and text.” MLHC, 2021. |
| 5 | Med-Gemini | Macro F1 90.7 (报告生成) | 2024 | Google 多模态 LLM | Saab, K. et al. “Capabilities of Gemini Models in Medicine.” arXiv:2404.18416, 2024. |
§8.2 SOTA 总结与选型建议
| 你的目标 | 推荐方法 | 说明 |
|---|---|---|
| 纯图像分类最高精度 | CaMCheX / ConvNeXt-B | 利用多视角信息(正位+侧位) |
| 无标签训练 / 零样本推理 | CheXzero / BiomedCLIP | 利用放射报告文本实现零样本疾病检测 |
| 快速论文复现 | TorchXRayVision (DenseNet-121) | 开箱即用,预训练权重直接可用 |
| 报告生成 SOTA | Med-Gemini / MAIRA-2 | 多模态 LLM 路线,需大量 GPU |
| 长尾疾病检测 | CXR-LT 2024 冠军方案 + CaMCheX | 45 类标签场景 |
§8.3 相关数据集
| 数据集 | 关系 | 联动方式 |
|---|---|---|
| MIMIC-IV | 互补——同一患者队列的结构化 EHR | 通过 subject_id 关联 |
| CheXpert | 同类——同词汇的胸片数据集 | 跨数据集泛化研究 |
| CXR-LT (2023/2024) | 衍生——长尾多标签挑战赛 | 基于 MIMIC-CXR-JPG 构建 |
| CheXmask | 衍生——解剖分割掩码 | >243,000 张影像的心/肺掩码 |
| REFLACX | 衍生——眼动追踪数据 | >2,500 张胸片的眼动凝视序列 (1000 Hz) |
§8.4 关键论文
- Johnson, A.E.W. et al. (2019). “MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports.” Scientific Data, 6:317. — 原始数据集论文。DOI: 10.1038/s41597-019-0322-0.
- Johnson, A.E.W. et al. (2019). “MIMIC-CXR-JPG: A Large Publicly Available Database of Labeled Chest Radiographs.” arXiv:1901.07042. — JPG 衍生版论文。
- Irvin, J. et al. (2019). “CheXpert.” AAAI, 33(1):590-597. — CheXpert 标注器的核心论文,MIMIC-CXR 使用的 14 类标签词汇来源。
- Peng, Y. et al. (2018). “NegBio.” AMIA Summits, 188-196. — NegBio 标注器论文。
- Tiu, E. et al. (2022). “Expert-level detection of pathologies from unannotated chest X-ray images via self-supervised learning.” Nature Biomedical Engineering, 6:1399-1410. — CheXzero 论文,零样本 AUROC 89.22。
- Zhang, Y. et al. (2021). “Contrastive learning of medical visual representations from paired images and text.” MLHC, 2021. — ConVIRT 对比学习框架。
- Cohen, J.P. et al. (2022). “TorchXRayVision.” MIDL, 2022. — 多数据集统一加载工具库。
- Tsai, C. et al. (2025). “Clinically-aligned Multi-modal Chest X-ray Classification.” OpenReview, 2025. — CaMCheX 最新 SOTA。
§8.5 生态快照
| 资源 | 类型 | 链接 | 为什么值得关注 |
|---|---|---|---|
| TorchXRayVision | 工具库 | GitHub | 多数据集统一加载,含 MIMIC-CXR 预训练模型 |
| MIMIC-CXR Code Repository | 官方工具 | GitHub | DICOM→JPG 转换 + 标签生成官方实现 |
| MIMIC Code Repository | 通用工具 | GitHub | MIMIC 系列 SQL 查询与数据提取教程 |
| CXR-LT Challenge | 竞赛平台 | CodaLab | MICCAI 2023/2024 长尾学习挑战赛 |
| CheXmask | 衍生标注 | HuggingFace | >243,000 张 MIMIC-CXR 胸片的心肺分割掩码 |
| CodeSOTA MIMIC-CXR | 排行榜 | CodeSOTA | 持续更新的分类 SOTA 排行 |
§9 相关资源与引用
§9.1 官方资源
| 资源 | 链接 | 说明 |
|---|---|---|
| MIMIC-CXR 数据集主页 | https://physionet.org/content/mimic-cxr/ | DICOM 版下载、文档与 DUA 签署 |
| MIMIC-CXR-JPG 数据集主页 | https://physionet.org/content/mimic-cxr-jpg/ | JPG 版下载、结构化标签与划分文件 |
| MIMIC 官方网站 | https://mimic.mit.edu/ | MIMIC 系列数据库的统一入口 |
| PhysioNet 认证 | https://physionet.org/settings/credentialing/ | 认证流程与状态查询 |
| CITI 培训 | https://about.citiprogram.org/ | 人体受试者研究培训(数据获取前提) |
§9.2 教程与入门
- MIMIC-CXR 入门:https://mimic.mit.edu/docs/gettingstarted/ — 认证→下载→云端访问完整流程
- TorchXRayVision 教程:https://github.com/mlmed/torchxrayvision — “5 分钟加载 MIMIC-CXR + 运行 DenseNet-121”
§9.3 BibTeX 引用
数据集论文(首选):
@article{johnson2019mimic,
title={MIMIC-CXR, a de-identified publicly available database of
chest radiographs with free-text reports},
author={Johnson, Alistair EW and Pollard, Tom J and Berkowitz, Seth J
and Greenbaum, Nathaniel R and Lungren, Matthew P and
Deng, Chih-ying and Mark, Roger G and Horng, Steven},
journal={Scientific Data},
volume={6},
number={1},
pages={317},
year={2019},
publisher={Nature Publishing Group},
doi={10.1038/s41597-019-0322-0}
}
JPG 版论文:
@article{johnson2019mimicjpg,
title={MIMIC-CXR-JPG: A large publicly available database of
labeled chest radiographs},
author={Johnson, Alistair EW and Pollard, Tom J and Berkowitz, Seth
and Greenbaum, Nathaniel R and Lungren, Matthew P and
Deng, Chih-ying and Mark, Roger G and Horng, Steven},
journal={arXiv preprint arXiv:1901.07042},
year={2019}
}
PhysioNet 数据集本身:
@misc{johnson2024mimiccxr,
title={MIMIC-CXR Database (version 2.1.0)},
author={Johnson, Alistair and Pollard, Tom and Mark, Roger
and Berkowitz, Seth and Horng, Steven},
year={2024},
publisher={PhysioNet},
doi={10.13026/4jqj-jw95}
}
§10 AI 使用声明卡
AI 模型参与声明:
| 维度 | 说明 |
|---|---|
| 使用的 AI 模型 | Claude 4 Sonnet(Anthropic),2026-07-29 |
| AI 参与范围 | 初稿生成:全部章节的文字撰写、数据表格填充、代码示例编写、DAIMS 评分估算、JSON-LD 组装 |
| 输入文档 | Johnson et al. (2019) Scientific Data 论文;Johnson et al. (2019) arXiv:1901.07042 预印本;PhysioNet MIMIC-CXR/JPG 官方页面;Irvin et al. (2019) CheXpert 论文;Peng et al. (2018) NegBio 论文;CodeSOTA MIMIC-CXR Leaderboard;EmergentMind MIMIC-CXR 综述;MIMIC 官方文档;Nature s41598-023-49956-8 跨数据集验证论文;千方病案医数集 v3.9 模板 |
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据规格 | 千方病案医学编辑部 | 与官方文档交叉比对 | ✅ 已验证 |
| §4 数据结构 | 千方病案医学编辑部 | DAIMS 字段定义一致性 | ✅ 已通过 |
| §5 数据划分 | 千方病案医学编辑部 | 与官方划分文件比对 | ✅ 已验证 |
| §6 AI 就绪指南 | 千方病案医学编辑部 | 代码逻辑审查 + 坑点技术验证 | ✅ 已通过 |
| §7 质量评估 | 千方病案医学编辑部 | DAIMS 24 项逐项审查 | ✅ 已通过 |
页面状态:published(全部内容已完成审核并发布)
