MIMIC-CXR-JPG — 37.7 万胸片结构化标签库 AI-Ready Wikipedia

37.7 万张 JPG 与 14 类结构化标签:MIMIC-CXR 派生家族共同的图像供给枢纽

来源 MIMIC-CXR v2.0.0 DICOM 图像+自由文本报告,经 JPG 转换管线与 CheXpert/NegBio 双 labeler 自动生成结构化标签发布时间: 2026-09-24最后更新: 2026-09-25 阅读 29
MIMIC-CXR-JPG — 37.7 万胸片结构化标签库 AI-Ready Wikipedia

信息速览

数据集名称MIMIC-CXR-JPG — 37.7 万胸片结构化标签库 AI-Ready Wikipedia
数据类型结构化标签,JPG 图像,大规模标注
规模377,110 张 JPG 胸片 / 227,827 份报告 / 65,383 名患者(MIMIC-CXR 全量派生)
接入方式MIMIC-CXR v2.0.0 DICOM 图像+自由文本报告,经 JPG 转换管线与 CheXpert/NegBio 双 labeler 自动生成结构化标签
AI 就绪度

INFOBOX:mimic-cxr-jpg 速览

字段 值
数据集 MIMIC-CXR-JPG - chest radiographs with structured labels
slug mimic-cxr-jpg
发布 v2.0.0 2019-11-14|v2.1.0 2024-03-12|PhysioNet
DOI 10.13026/jsn5-t979(v2.1.0)/ 10.13026/8360-t248(v2.0.0)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程)
规模 377,110 JPG|227,827 报告|65,383 患者|14 类五值标签
labeler CheXpert(AAAI 2019)+ NegBio(AMIA 2018)双工具定制配方
验证 687 份报告|board-certified 8 年经验放射科医生(M.P.L.)
划分 train 368,960 / val 2,991 / test 5,159 图像(按患者切割)
团队 MIT LCP(Johnson 等 10 人)+ Stanford + NIH NLM + BIDMC
论文 arXiv 1901.07042(v5 2019-11-14)
一句话 派生家族的图像供给枢纽:把 DICOM 门槛拆掉,把标签的可靠边界量化给你看

§0 摘要卡:从"母库加工层"到"弱监督坐标系"

§0.1 名称与口径声明

本条目记录 PhysioNet 数据集 MIMIC-CXR-JPG(slug:mimic-cxr-jpg),当前版本 v2.1.0(2024-03-12),首发 v2.0.0(2019-11-14),Credentialed。三口径存照:377,110 张图对应的报告数在不同层有三种说法——母库 227,835 studies / JPG 摘要 227,827 份报告 / Methods 处理 227,943 份——本条目并列引用不仲裁(对账见附录 C)。版本口径存照:v2.1.0 相对 v2.0.0 零数据变更,仅新增两个文件。

§0.2 读者收益清单

  • 分类研究者:37.7 万图+14 类标签+官方划分——医学影像多标签分类的事实标准起点
  • 方法学研究者:687 份人工验证+双 labeler 分任务 F1 全表——弱监督可靠边界的公开教材
  • 管线工程师:五工序图像管线(pydicom→归一化→方向校正→均衡化→q95)与三阶段 labeler 的可复现配方
  • 家族谱系读者:本库 606-616 九个 MIMIC 影像条目的共同根节点——互链枢纽
  • 合规负责人:Credentialed 全流程(CITI/DUA/发表开源义务)的典型样本

§0.3 本条目与其他条目的阅读组合

  • 16 mimic-cxr(母库主条目):DICOM 原始层+报告全文——本集的亲代条目,报告文本任务(生成/结构化)以它为图像-文本源
  • 611 image-embeddings:本集图像→逐图 4,096 维嵌入(dicom_id 对齐)——"图像层→向量层"直通车
  • 610 heart-lung-segmentations:本集无像素标注——掩码需求走 610(538 人工掩码,文件名对齐零成本)
  • 616 mimic-cxr-ext-ils:指令微调需求走 616(106 万指令对,本集图像子集)
  • 608 cxr-pro:标签层之外还要净化报告文本——608 的 prior 引用改写与本集标签互补
  • 614 lunguage:弱监督标签不够精——614 的专家结构化报告是 NLP 侧的精标对照组

§0.4 身份卡:一条命令背下这个数据集

名称   MIMIC-CXR-JPG - chest radiographs with structured labels
版本   v2.1.0(2024-03-12)|首发 v2.0.0(2019-11-14)
DOI    10.13026/jsn5-t979(v2.1.0)|10.13026/th9c-ae10(全版本)
访问   Credentialed(License 1.5.0 + DUA 1.5.0 + CITI)
规模   377,110 JPG|227,827 报告|65,383 患者|14 类五值标签
管线   pydicom→归一化→方向校正→直方图均衡→q95|CheXpert+NegBio
验证   687 报告|mention F1 0.46-0.97|不确定性多数 <0.5
论文   arXiv 1901.07042(v5,Johnson et al. 10 人)

它的故事一句话:母库是 DICOM 的高墙,本集是墙上的门——门外站着 37.7 万张开箱即读的胸片,和一张写着"这些标签哪里可靠哪里不靠谱"的诚实说明书。

§1 身份卡:一张速览

MIMIC-CXR-JPG(MIMIC Chest X-ray JPG Database)是 MIT 计算生理学实验室(LCP)从母库 MIMIC-CXR v2.0.0 全量派生的图像加工层:把 377,110 张 DICOM 原始胸片转换为体积更小、开箱即用的 JPG 格式,并配套由 CheXpert 与 NegBio 两套开源 NLP 工具从自由文本报告中自动提取的 14 类结构化标签,外加一份官方推荐的 train/val/test 数据划分。它是 MIMIC-CXR 派生家族中承上启下的枢纽——上游承接 DICOM 母库,下游供养着从分类基准到指令微调的一整条数据集谱系。

字段 值
完整标题 MIMIC-CXR-JPG - chest radiographs with structured labels
当前版本 v2.1.0(2024-03-12),首发版 v2.0.0(2019-11-14)
版本 DOI v2.1.0: 10.13026/jsn5-t979;v2.0.0: 10.13026/8360-t248;全版本: 10.13026/th9c-ae10
母项目 MIMIC-CXR Database v2.0.0(DOI 10.13026/C2JT1Q,latest 10.13026/s5dg-6s42)
发布方 PhysioNet(MIT Laboratory for Computational Physiology 维护)
访问级别 Credentialed(PhysioNet Credentialed Health Data License 1.5.0 + DUA 1.5.0)
训练门槛 CITI “Data or Specimens Only Research” 课程
规模 377,110 张 JPG 胸片 / 227,827 份放射报告 / 65,383 名患者(2011-2016,BIDMC)
标签 14 类 × 五值(正/负/不确定/不一致/未提及),双 labeler 自动生成
验证 687 份报告由 board-certified 放射科医生(8 年经验)人工标注对照
数据划分 官方 split:train 368,960 / val 2,991 / test 5,159 图像
论文 arXiv 1901.07042(v1 2019-01-21,v5 2019-11-14),Johnson et al.,10 人
团队 MIT LCP + Stanford + NIH NLM + BIDMC 四方;Stanford ML 组(Irvin/Rajpurkar)协助标签器
伦理 BIDMC IRB 免知情同意豁免;HIPAA Safe Harbor 去标识
资助 NIH-R01-EB017205 + Philips Healthcare(COI 明示)
项目主页 https://mimic-cxr.mit.edu
Topics computer vision / chest x-ray / radiology / mimic / deep learning
Views v2.1.0 页面 Project Views 5,337(Current Version 9,588)

版本提醒:PhysioNet 上该数据集存在两个版本页(v2.0.0 与 v2.1.0),v2.1.0 于 2024-03-12 发布,在 v2.0.0 基础上新增两个文件(RECORDS 路径清单与 test-set-labeled.csv 人工标注),图像与 v2.0.0 标签完全未动。引用时建议注明具体版本 DOI。

§2 背景:为什么需要"第二份"胸片数据集

§2.1 放射科医生不够用,这是全球性问题

MIMIC-CXR-JPG 的官方页面与论文开篇都在讲同一个故事:胸片是世界上最常见的医学影像检查,但读片的人不够。论文 References 里铺了一排全球证据:利比里亚的放射诊断国别报告(Journal of Global Radiology 2015)、"千丘之国"卢旺达的影像服务报告(同刊 2015)、美国退伍军人事务部系统中"未读影像"的患者安全隐患(Journal of Digital Imaging 2017)、英国皇家放射学院"放射科医生短缺危及患者医疗"的警告(BMJ 2017)、以及美国县级层面的放射科医生分布分析——供给向大城市倾斜(JACR 2018 与 Radiology 2015 两篇)。这段引用组合在 2019 年是一种论证策略:先用全球卫生服务的现实困境立论,再把计算机视觉介绍为缓解手段。

§2.2 从 DICOM 到 JPG:一个务实的产品决策

母库 MIMIC-CXR 以 DICOM 格式发布图像——那是放射科的行业标准,但对计算机视觉研究者并不友好:DICOM 需要专门的解析库、存储体积大、像素值范围与窗宽窗位的概念也容易让非放射科背景的研究者踩坑。MIMIC-CXR-JPG 的核心动机就是把这个门槛拆掉:官方完成一次性的格式转换与标准化预处理,让研究者用任何语言的标准图像库就能读图。论文里说得很直白——目标是提供 MIMIC-CXR 的"convenient processed version"(便捷处理版),同时提供"standard reference for data splits and image labels"(数据划分与图像标签的标准参考)。

§2.3 第二个动机:终结"自造划分"的论文间不可比

在官方划分出现之前,同一批胸片数据上的论文各用各的 train/test 划分,指标之间没法比。MIMIC-CXR-JPG 把推荐划分(split.csv.gz)作为数据集的一等公民发布,等于给社区立了一个公平比较的标尺——这个"标准参考"的定位,让它即使对已经能自己处理 DICOM 的团队也有存在价值。

§2.4 历史伏笔:结构化标签不是新想法

页面 References 的第 11 条藏了一个漂亮的考古发现:1974 年 Radiology 上 Simon 等人的 “Computerized radiology reporting using coded language”——用编码语言做计算机化放射报告,整整 50 年前。用 NLP 把自由文本报告转回结构化标签(CheXpert/NegBio),某种意义上是把放射信息学半个世纪的轮回走完了一圈。2019 年的不同在于:报告规模是 22.7 万份,而不是当年一个科室的卡片盒。

§3 管线解剖:DICOM 怎么变成 JPG,报告怎么变成标签

§3.1 三步总装线

官方 Methods 把生产流程拆为三步:(1) DICOM 转 JPG;(2) 从每份报告提取结构化标签;(3) 制作元数据文件。图像与文本两条线独立处理,最后靠研究标识符对齐。

§3.2 图像线:五道工序

  1. 像素提取:用 pydicom 库从 DICOM 文件读出像素矩阵。
  2. 归一化:减去图像最低值、除以平移后最大值、截断、转无符号整数——把像素值压到 [0, 255]。
  3. 方向校正:读取 DICOM 的 PhotometricInterpretation 字段判断是否需要反转,保证肺内的空气呈白色(高像素值)、患者体外呈黑色(低像素值)——这一步决定了所有图像的灰度约定一致。
  4. 直方图均衡化:用 OpenCV 把 0-255 的像素值分布拉平,让每个灰度级出现频率近似相等,增强对比度。
  5. 压缩输出:OpenCV 以 quality factor 95 输出 JPG——一个刻意选高的质量参数,尽量压住有损压缩的信息损失。

直方图均衡化的双刃剑:官方预处理的目的是"让研究者不用自己搭预处理管线",同时保证所有论文用的是同一套标准化输入。但要注意:均衡化后的图像与临床 PACS 里看到的原图灰度分布不同,迁移到真实临床影像时存在分布差异——这是所有"预处理内嵌"数据集的共同代价。

§3.3 文本线:报告的半结构化模板

BIDMC 的放射报告是半结构化的,医生在固定标题的段落里书写,其中两个段落最关键:findings(图像重要发现的自然语言描述)与 impression(最紧要发现的简短总结)。模板总体一致,但界面不强制,随时间与医生个人习惯有漂移。227,943 份总报告中:82.4% 有 impression 段,12.5% 只有 findings 段,5.1% 两段皆无。

标签的取材优先级因此被定义为一个三级回退:先取 impression;没有则取 findings;两段皆无则取报告最后一节。

§3.4 NegBio:基于依存句法的否定与不确定性检测

NegBio(Peng et al., AMIA 2018)是开源规则工具:输入预先标记了医学发现提及(mention)的句子,输出每个提及是被否定、不确定还是确定。与旧方法不同,它用手写的启发式规则在句子的依存句法图上搜索,判断提及是否被否定线索(如 “no evidence of”)的句法辖域覆盖——而不是简单的窗口关键词匹配。

一个容易忽略的细节:MIMIC-CXR-JPG 里的 NegBio 使用的是 CheXpert 工具自定义的 mention patterns,与 NegBio 当年给 NIH ChestX-ray8/ChestX-ray14 打标时用的模式不同。也就是说,这份标签的"配方"是两套工具的杂交定制版,直接拿开源默认参数复现会有细微出入。

§3.5 CheXpert labeler:三阶段聚合

CheXpert labeler(Irvin et al., AAAI 2019)构建在 NegBio 之上,三阶段:

  1. 提取(extraction):识别 14 类发现的所有提及,包括异体拼写、同义词与缩写——例如 pneumothorax 还要抓 “pneumothoraces” 与 “ptx”。
  2. 分类(classification):用局部上下文把每个提及分为阳性、不确定或阴性。
  3. 聚合(aggregation):同一份报告可能多次提及同一发现,需要合并成一个标签。优先级:阳性 > 不确定 > 阴性——只要有阳性提及,整份报告该类就是阳性;若同时存在阴性与不确定提及,定为不确定。

“No Finding” 的特殊规则:只有当除 “Support Devices” 外的全部标签为阴性或未提及时,No Finding 才置 1。

严格子集效应:当两个 labeler 都无法为某研究导出任何标签时,该研究在标签 CSV 中不出现行——所以两个标签文件是 227,827 份研究的严格子集,行数少于研究总数不是数据丢失,而是设计如此。

§3.6 五值标签体系:承认 NLP 会犯错,且两个 NLP 会犯不同的错

最终标签是五值体系:阳性 / 阴性 / 不确定 / 不一致(disagreement)/ 未提及(blank)。其中"不一致"是 MIMIC-CXR-JPG 的特色设计——CheXpert 与 NegBio 对同一研究给出冲突标签时,不强行仲裁,而是明示冲突。这个设计把"规则式 NLP 的可靠性边界"直接编码进了数据:研究者可以自行决定对不一致样本的处置策略(丢弃、人工复核或建模为噪声标签)。

§4 标签验证:687 份报告与一条诚实的 F1 曲线

§4.1 验证设计

论文随机抽取 687 份报告(分层抽样保证各类病理覆盖充分),由一名 board-certified、8 年经验的放射科医生(论文署名 M.L.,即 Matthew Lungren)按 CheXpert 的 14 类标准人工标注,然后在三个任务上评估两个 labeler:提及提取(任何赋值都算正预测,空白算负预测)、否定检测(否定标签为正)、不确定性检测(不确定标签为正)。

§4.2 提及提取:常见病灶接近天花板

发现 精确率 召回率 F1 阳性例数
Pleural Effusion(胸腔积液) 0.968 0.978 0.973 370
Pneumothorax(气胸) 0.945 0.995 0.970 226
Pneumonia(肺炎) 0.928 0.986 0.956 223
Atelectasis(肺不张) 0.893 1.000 0.944 218
Consolidation(实变) 0.886 0.979 0.930 95
Fracture(骨折) 0.870 0.940 0.904 50
Support Devices(支持设备) 0.823 0.974 0.892 234
Edema(水肿) 0.799 1.000 0.888 227
Cardiomegaly(心影增大) 0.814 0.910 0.859 235
Lung Lesion(肺部病变) 0.861 0.848 0.855 66
Lung Opacity(肺部浑浊) 0.715 0.907 0.800 194
Pleural Other(其他胸膜异常) 0.477 0.778 0.592 27
No Finding(无发现) 0.382 0.867 0.531 30
Enlarged Cardiomediastinum(纵隔增宽) 0.375 0.600 0.462 70

三个低谷各有结构性原因:Pleural Other 是"其他"杂项类,措辞五花八门;No Finding 是全称命题——要证明"什么都没提",一个漏掉的异常提及就会打翻,精确率 0.382 意味着它被大量过度触发;Enlarged Cardiomediastinum 的临床措辞变体最多、与心影增大的边界在报告里本就模糊。

§4.3 不确定性检测:规则式 NLP 的天花板

论文 Table 5 显示,不确定性检测的 F1 大多低于 0.5:Enlarged Cardiomediastinum 仅 0.065-0.069,Cardiomegaly 上 NegBio 0.237、CheXpert 为 0,Edema 0.169/0.207。相较之下否定检测介于两者之间。这组数字的学术影响被严重低估——它是后来大量工作把 MIMIC-CXR 标签当作 weak supervision 而非 ground truth 的学理源头:作者自己就把工具的短板量化给你看了。

§4.4 v2.1.0 的人工标注文件:把"考卷"也发给你

2024-03-12 的 v2.1.0 新增 mimic-cxr-2.1.0-test-set-labeled.csv——把上述放射科医生人工标注直接随数据集发布,并写明用途:“manually curated labels used for evaluation of CheXpert and NegBio”。同时新增的 RECORDS 文件(全图相对路径清单)支持用 wget 等工具按需下载子集。一个 2019 年的验证集,等了五年才作为可执行文件发布——数据集工程的"验证可复现"也讲究时机。

人工标注约定里有三条值得记住的细节:No Finding=1 仅当 impression 完全不提任何异常(包括 14 类之外的异常也算);支持设备不视为异常——只提设备的报告仍算 No Finding;语义不明(如 “no change from previous”)标为不确定 -1.0。

§5 划分、文件与获取

§5.1 官方划分

集 图像 studies 患者数* 说明
train 368,960 222,758 64,588 全部其余研究
validation 2,991 1,808 500 随机 500 名患者全部研究
test 5,159 3,269 295 分层抽样保证病理覆盖

*患者数按 arXiv v2 版 Table 4 口径(合计 65,383)。

两个值得注意的分布事实:其一,test 集是分层抽样的产物,89.1% 的 studies 含阳性发现,而 train/val 只有 76-77%——test 集故意"富集"了病灶,让小类别的评估不至于颗粒度过粗;直接拿 test 指标与真实临床阳性率对照会误读。其二,划分按患者切割(同一患者不会横跨 train/test),避免同人研究的信息泄漏——这是后来所有医学影像数据集划分的默认礼仪。

§5.2 文件清单

文件 内容
files/p10…/p19…/ 10 个顶层文件夹,每个约 6,500 个患者子文件夹;路径形如 files/p10/p10000032/s50414267/02aa804e-…jpg
mimic-cxr-2.0.0-metadata.csv.gz 图像级元数据:view position、患者朝向、匿名化采集时间(可排序)
mimic-cxr-2.0.0-split.csv.gz 官方推荐 train/val/test 划分
mimic-cxr-2.0.0-chexpert.csv.gz CheXpert labeler 标签(一 study 一行,一发现一列)
mimic-cxr-2.0.0-negbio.csv.gz NegBio labeler 标签(同上)
mimic-cxr-2.1.0-test-set-labeled.csv (v2.1.0 新增)单放射科医生人工标注,labeler 评估用
RECORDS / IMAGE_FILENAMES (v2.1.0 新增)全图相对路径清单,支持按需下载(两处表述不同——见附录 D)

§5.3 获取流程

Credentialed 访问的标准路径:注册 PhysioNet 账号 → 完成 CITI “Data or Specimens Only Research” 课程(对合作者逐一要求)→ 签署 DUA 1.5.0 → 等待 MIT LCP 审核通过(通常数日)→ 网页或 rsync/wget 下载。DUA 三条核心义务:不与他人共享数据、不尝试再识别个体、任何使用该数据的发表必须公开相应代码——最后一条是 MIMIC 家族的特色条款,也是"发表即开源"风气的制度推手之一。

§5.4 图像目录的命名密码

JPG 文件名不是乱码,而是 32 位十六进制哈希——用哈希替代患者信息出现在文件名里,是 HIPAA Safe Harbor 之外的一层额外保险。目录三层结构 = 患者前缀 / 患者 ID / study ID,一个 study(一次检查)下可含多张图像(正位+侧位)。

§6 家族图谱:九个派生条目的根节点

MIMIC-CXR-JPG 的独特身份是:它既是派生物(母库 MIMIC-CXR 的加工层),又是其他派生物的亲代。本库已收条目中,九个 MIMIC-CXR 系数据集构成一条清晰的三代谱系:

条目 本库 rid 形态层 与 JPG 的关系
MIMIC-CXR v2.0.0(母库,DICOM+报告) 16(早期批次条目,其别名表已含 “MIMIC-CXR-JPG”) 原始层 JPG 的亲代
MIMIC-CXR-JPG(本条目) 617 加工层 家族枢纽——母库图像供给的物理实体
CXR Cardiomegaly 数值层 606 数值层 源自母库 DICOM 与元数据
CXR-Phone 翻拍照 607 照片层 翻拍母库/JPG 屏显图像
CXR-PRO 净化报告 608 文本层 基于母库报告去 prior 引用
Heart/Lung Segmentations 610 掩码层 为 MIMIC-CXR/MIMIC-CXR-JPG 图像提供人工掩码
Image Embeddings 611 向量层 对母库全量图像逐图嵌入(CXR Foundation)
LATTE-CXR 612 图文对齐层 REFLLACX 派生,局部 bbox-语句对
Lung Segment 图像对 613 分割图像对 TernausNet 自动分割母库图像
Lunguage 结构化报告基准 614 报告结构化层 母库 test 子集专家标注
MIMIC-CXR-Ext-ILS 616 指令分割层 母库图像+报告全自动生成指令对

§6.1 为什么 JPG 是"图像供给源"

母库叙事由本库 rid 16(MIMIC-CXR 主条目,早期批次生产)承载;本条目(617)是加工层的独立展开。对 2019-2021 年间的绝大多数研究团队,实际下载、存储与读入内存的图像就是 JPG 版本(全量约数百 GB 级,远小于 DICOM 版),下游数据集的图像标识符体系(文件名哈希、study/patient 目录结构)也沿用 JPG 版约定。因此在工程史的意义上,"MIMIC-CXR 上的 377,110 张图"对多数用户而言,物理实体就是 MIMIC-CXR-JPG。

§6.2 三代谱系的抽象阶梯

把九个条目按"离像素的距离"排开:DICOM 原始层(未单列)→ JPG 加工层(本条目)→ 数值层/掩码层/分割对/向量层(506/510/613/611)→ 图文对齐/指令分割/报告结构化(512/616/614)→ 照片层(607,反向回到物理世界)。这条阶梯是本库批次六"影像数据形态学之旅"的完整地图,而本条目是地图的坐标系原点。

§7 AI-Ready 十问

一问:什么格式? JPG 图像(quality 95,直方图均衡化后)+ gzip 压缩 CSV 元数据/标签 + 纯文本路径清单。零 DICOM 依赖,任何语言的标准图像库可直接读取。

二问:多大规模? 377,110 图 / 227,827 报告 / 65,383 患者;标签 CSV 两套(CheXpert/NegBio),官方三分划分。

三问:标注是什么性质? 全部为自动弱监督(规则式 NLP 从报告抽取),经 687 份报告人工验证;v2.1.0 附带人工标注子集。图像层面无人工像素级标注——需要掩码请走 610(心/肺人工掩码)或 613(自动分割对)。

四问:许可与门槛? Credentialed:License 1.5.0 + DUA 1.5.0 + CITI 课程。获取需要数天审核。发表必须公开代码是合同义务。

五问:伦理完备度? BIDMC IRB 免知情同意豁免+批准共享;HIPAA Safe Harbor 去标识;文件名哈希化;资助关系(Philips)与致谢(Stanford)全披露。

六问:数据质量的可复现性? 验证集(687 报告)的标注在 v2.1.0 随集发布;转换与标注代码开源(MIMIC-CXR Code Repository);页面明确记录 labeler 配方(NegBio 用 CheXpert patterns)——从 DICOM 到标签的每一步理论上可复现。

七问:标签的可信边界? 论文自报家门:常见病灶 F1 0.94-0.97 可放心用作弱监督;No Finding(0.531)、Enlarged Cardiomediastinum(0.462)、不确定性判断(多数 <0.5)需要谨慎设计——把 uncertain/disagreement 处理策略写进实验设计,而不是事后补救。

八问:适合什么任务? 多标签分类(官方标准用法)、弱监督定位、报告生成(配母库文本)、多模态预训练(配 611 嵌入或 512 对齐)、不确定性建模(五值标签天然支持)、领域自适应评估(test 集富集设计)。

九问:不适合什么? 像素级分割训练(无掩码)、确定性的"金标准"评估(标签是弱监督)、纵向结局研究(影像库而非队列)、需要原始窗宽窗位的定量影像组学(直方图均衡化不可逆)。

十问:一句话定位? 医学影像领域被引用最多的弱监督分类语料库——它的价值不在标签多准,而在把"标签多不准"也量化给你看。

DAIMS 评估:数据可得性 6(Credentialed 全流程公开)/ 标注 7(双 labeler+687 人工验证+五值设计)/ 方法 8(管线全开源可复现)/ 影响力 9(领域引用最广的弱监督语料)/ 规模 9(37.7 万图派生家族根节点)——DAIMS:7.8(论证散见 §3/§4/§7;对照:516 全自动指令分割 7.0、510 人工掩码 8.0)。

§8 误解与反直觉

误解一:“377,110 张图就是 377,110 份诊断。” 不。图像数 ≠ 报告数 ≠ 研究数:227,827 份报告对应 227,835 份母库研究(口径差 8),一个 study 可含正侧位多张图共享一份报告。任何"图像-报告对齐"实验都要先过 metadata.csv 的 study_id 关。

误解二:“结构化标签是医生标的。” 全部 14 类标签由规则式 NLP 自动生成;放射科医生只人工标注了 687 份验证报告。标签的正确说法是"报告的规则式再表达",不是"图像的专家标注"。

误解三:“F1 0.97 的标签可以当 ground truth。” Pleural Effusion 的 0.973 是 mention extraction 任务的成绩——即"报告里有没有提到",不是"图里有没有"。报告本身与影像表现也存在不一致(放射科的正常工作现象)。弱监督标签的误差会系统性传导进模型。

误解四:“No Finding=1 说明片子正常。” 三重陷阱:No Finding 的 F1 仅 0.531(过度触发严重);人工约定里只提支持设备的报告也算 No Finding;且它只约束"报告没提异常",与影像实际是否正常相去甚远。

误解五:“disagreement 标签是错误,应该清洗掉。” 相反——它是 CheXpert 与 NegBio 对同一报告冲突的诚实记录,是天然的噪声标签样本池与 labeler 改进评估基准。无脑删除等于扔掉数据集最有教学价值的部分。

误解六:“JPG 转换是无损的便捷化。” 直方图均衡化是不可逆的非线性变换;quality 95 的有损压缩同样如此。做定量影像组学或需要原始窗宽窗位的研究,应回到母库 DICOM。

误解七:“v2.1.0 是数据更新。” v2.1.0 没有动一张图、一个标签——只加了两个文件(RECORDS 路径清单与人工标注 CSV)。版本语义是"发布物更新"而非"数据更新"。

误解八:“官方 test 集与普通划分一样平衡。” test 集分层抽样富集病灶(89.1% studies 有发现 vs train 76-77%)。test 指标系统性高于真实临床分布下的表现,跨数据集比较时必须意识到这一点。

误解九:“标签 CSV 行数少于研究数说明文件缺损。” 两个 labeler 都无法导出标签的 study 不生成行——严格子集是设计。合并标签与元数据时用左连接,别用内连接。

误解十:“访问门槛只是形式。” CITI 课程对每位合作者都要求;DUA 的"发表必须开源代码"是可执行合同条款——历史上确有论文因此补传代码仓。

误解十一:“arXiv 1901.07042 就是母库论文。” 同一 arXiv 号 v1-v2 承载 MIMIC-CXR(母库)论文,v3-v5 改换为 JPG 论文——引用时按内容对准版本,母库正式发表版是 Scientific Data 2019;6:317。

误解十二:“五值标签可以直接喂给 BCE loss。” 五值不是二值:uncertain 与 disagreement 的处置(映射为负、丢弃、或单独建模)是实验设计的一部分,不同论文的选择不可直接比较。

§8.13 常见踩坑清单

坑 后果 避法
坑点1:图像数=报告数(377,110≠227,827) 对齐实验口径错乱 经 metadata.csv 的 study_id 关联,勿按行号硬配
坑点2:标签当人工金标准 系统性误差进模型 标签=规则式 NLP 弱监督;读 §4 验证表定信心
坑点3:No Finding 当"正常" F1 仅 0.531+支持设备特例 全称命题谨慎用;参照人工约定三条
坑点4:disagreement 当错误清洗 丢弃最有教学价值的样本 保留为噪声标签池与 labeler 审计基准
坑点5:五值直喂 BCE uncertain 处置不声明 §9.2 策略二选一并写进实验记录
坑点6:test 集指标当临床性能 89.1% 富集≠真实分布 test 只做算法间比较,不做流行病学推断
坑点7:内连接标签与划分 静默丢严格子集缺行 左连接+缺行计数入报告
坑点8:跨库混合训练不管预处理 均衡化差异成混杂变量 与 ChestX-ray14 混训前先对齐预处理

§9 工作实例:十分钟搭起标准分类基线

§9.1 加载标签与划分(纯 pandas)

import pandas as pd

meta  = pd.read_csv('mimic-cxr-2.0.0-metadata.csv.gz')
split = pd.read_csv('mimic-cxr-2.0.0-split.csv.gz')
chex  = pd.read_csv('mimic-cxr-2.0.0-chexpert.csv.gz')
negbio= pd.read_csv('mimic-cxr-2.0.0-negbio.csv.gz')
labeled = pd.read_csv('mimic-cxr-2.1.0-test-set-labeled.csv')  # v2.1.0

# 关键连接键:study_id(报告/标签层)与 dicom_id(图像层)
# 图像路径合成:files/p{patient_id 前 2 位去零}/p{patient_id}/s{study_id}/{文件名}
def img_path(row):
    p = f"p{int(row['subject_id']):08d}"
    s = f"s{int(row['study_id'])}"
    return f"files/{p[:3]}/{p}/{s}/{row['dicom_id']}.jpg"  # 注意 p 前缀截断规则以官方 RECORDS 为准

train = split[split.split == 'train']           # 222,758 studies
train_chex = train.merge(chex, on='study_id', how='left')   # 左连接!严格子集会缺行

§9.2 五值标签的常见处置策略

LABELS = ['Enlarged Cardiomediastinum','Cardiomegaly','Lung Lesion','Lung Opacity',
          'Edema','Consolidation','Pneumonia','Atelectasis','Pneumothorax',
          'Pleural Effusion','Pleural Other','Fracture','Support Devices','No Finding']

# 策略 A(经典):uncertain(-1) 与 blank(NaN) 归为负,只训阳性 vs 阴性
y = (train_chex[LABELS] > 0).astype(int)

# 策略 B:三值建模,uncertain 单独成类
y = train_chex[LABELS].fillna(0)          # blank -> 0
y[(y < 0) & (y > -1)] = 0.5               # 视具体编码而定,见 CSV 说明

§9.3 用 disagreement 池做标签质量审计

# CheXpert 与 NegBio 对同一 study 的冲突样本 = 教科书级噪声标签案例
diff = chex.merge(negbio, on='study_id', suffixes=('_cx','_nb'))
conflict = {l: (diff[f'{l}_cx'] != diff[f'{l}_nb']).sum() for l in LABELS}

§9.4 交叉引用本库其他条目

  • 需要像素级心/肺掩码(人工金标准)→ 本库 rid 610(heart-lung-segmentations-data),掩码按 JPG 文件名对齐;
  • 需要逐图 4,096 维嵌入(免 GPU 迁移特征)→ rid 611(image-embeddings-mimic-cxr),join 键 dicom_id;
  • 需要指令微调语料(VLM 对齐)→ rid 616(mimic-cxr-ext-ils),其 191,563 图即本集子集;
  • 需要净化报告文本(去 prior 引用)→ rid 608(cxr-pro);
  • 需要报告结构化金标准 → rid 614(lunguage)。

实操提醒:直方图均衡化已内嵌于 JPG,若你的预训练权重(如 ImageNet 基线)期望自然图像分布,官方均衡化通常是正向的;但若从其他胸片库(如 NIH ChestX-ray14,未均衡化)迁移,需先对齐预处理,否则会混入"预处理差异"这个混杂变量——这恰是 CheXpert labeler 当年在 NIH 数据上用了不同 mention patterns 的同款问题:管线细节的不可比,比模型架构的差异更容易污染结论。

§10 FAQ:九十问速查

§10.1 身份与获取(10 问)

Q1:MIMIC-CXR-JPG 是什么?

A:MIT LCP 从母库 MIMIC-CXR v2.0.0 全量派生的图像加工层:377,110 张 JPG 胸片+14 类自动结构化标签+官方数据划分。

Q2:它和 MIMIC-CXR 是什么关系?

A:JPG 是 MIMIC-CXR 的 wholly derived 派生集——图像逐张来自母库 DICOM,标签来自母库自由文本报告,图像内容完全一致。

Q3:最新版本是哪个?

A:v2.1.0(2024-03-12)。首发 v2.0.0(2019-11-14);v2.1.0 仅新增 RECORDS 与 test-set-labeled.csv 两个文件。

Q4:DOI 怎么引?

A:版本 DOI:v2.1.0 为 10.13026/jsn5-t979,v2.0.0 为 10.13026/8360-t248;全版本 DOI 10.13026/th9c-ae10。

Q5:在哪里下载?

A:PhysioNet:physionet.org/content/mimic-cxr-jpg/,Credentialed 档位。

Q6:谁可以申请?

A:签署 DUA 的 credentialed 研究者;需完成 CITI ‘Data or Specimens Only Research’ 课程(每位合作者)。

Q7:要花钱吗?

A:数据本身免费——Credentialed 门槛是身份审核与用途承诺,不是付费墙。

Q8:审核要多久?

A:MIT LCP 审核 Credentialed 申请通常数个工作日; CITI 课程本身需数小时。

Q9:论文是哪篇?

A:arXiv 1901.07042(Johnson et al.,v1 2019-01-21,v5 2019-11-14),‘MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs’。

Q10:有项目主页吗?

A:有:mimic-cxr.mit.edu——含 labeler、代码仓与使用文档。

§10.2 规模与口径(10 问)

Q11:到底多少张图?

A:377,110 张 JPG——与母库 MIMIC-CXR v2.0.0 的 DICOM 图像一一同构。

Q12:多少份报告?

A:JPG 摘要口径 227,827 份(与图像关联);母库口径 227,835 studies;Methods 口径 227,943 份总报告——三口径并存,差 116 未由官方解释。

Q13:多少名患者?

A:按论文划分表:64,588 训练+500 验证+295 测试=65,383 名。

Q14:时间跨度?

A:2011-2016 年,全部来自贝斯以色列女执事医疗中心(BIDMC,波士顿)。

Q15:数据总量多大?

A:JPG 版全量约数百 GB(远小于 DICOM 版);官方提供 RECORDS 清单支持按需子集下载。

Q16:正侧位比例?

A:论文划分表:train 正位 67.3%/侧位 32.7%,侧位约占三分之一。

Q17:一个 study 多少张图?

A:平均约 1.65 张/研究:常见组合是正位+侧位成对,也有单图研究。

Q18:图像分辨率多少?

A:JPG 保留原始采集分辨率(不统一缩放),像素值归一化到 0-255 并直方图均衡化。

Q19:标签 CSV 覆盖多少研究?

A:严格子集:两个 labeler 都无法导出标签的 study 不生成行,行数少于 227,827 属设计而非缺损。

Q20:验证集人工标注有多少?

A:687 份报告(分层抽样),由 board-certified、8 年经验放射科医生标注,随 v2.1.0 发布。

§10.3 图像管线(10 问)

Q21:DICOM 怎么变成 JPG?

A:五道工序:pydicom 提取像素→归一化 [0,255]→按 PhotometricInterpretation 校正反转(空气白/体外黑)→OpenCV 直方图均衡化→quality 95 输出 JPG。

Q22:什么是直方图均衡化?

A:把像素值分布拉平、让每个灰度级频率近似相等的对比度增强——官方内嵌它以统一预处理,但也使其不可逆。

Q23:为什么选 quality 95?

A:刻意选高的压缩质量,尽量压住 JPG 有损压缩的信息损失——是存储体积与保真度的折中。

Q24:方向校正是自动的吗?

A:是——读取 DICOM 的 PhotometricInterpretation 字段判断,必要时反转,保证全体图像灰度约定一致。

Q25:文件名是什么含义?

A:32 位十六进制哈希(如 02aa804e-bde0afdd-…),以哈希替代患者信息出现在文件路径,是去标识外的又一层保险。

Q26:目录结构怎么组织?

A:files/p10/p10000032/s50414267/<hash>.jpg——患者前缀/患者ID/研究ID 三层;10 个顶层文件夹各约 6,500 患者。

Q27:metadata.csv 里有什么?

A:view position(PA/AP/侧位)、患者朝向、匿名化采集日期(可排序)等图像级元数据。

Q28:能用 JPG 做定量影像组学吗?

A:不建议——直方图均衡化与有损压缩都不可逆,定量特征应回到母库 DICOM。

Q29:图像与报告怎么对齐?

A:经 metadata.csv:每行一张图(dicom_id),指向所属 study_id;一份报告挂在该 study 上。

Q30:转换代码开源吗?

A:是——官方声明生成代码在 MIMIC-CXR Code Repository 公开,符合 DUA ‘发表必须开源’ 的自我履行。

§10.4 标签与 labeler(15 问)

Q31:14 类是哪 14 类?

A:No Finding/Enlarged Cardiomediastinum/Cardiomegaly/Lung Lesion/Lung Opacity/Edema/Consolidation/Pneumonia/Atelectasis/Pneumothorax/Pleural Effusion/Pleural Other/Fracture/Support Devices。

Q32:标签是人工的吗?

A:不是——全部由 CheXpert 与 NegBio 两套规则式 NLP 从报告自动提取;人工只标了 687 份验证报告。

Q33:什么是五值标签?

A:阳性/阴性/不确定/不一致(disagreement)/未提及(blank)——后两者是 MIMIC 系的特色:明示 labeler 冲突与沉默。

Q34:disagreement 怎么产生的?

A:CheXpert 与 NegBio 对同一 study 同一标签给出不同值时,标记为不一致——不仲裁,留给研究者处置。

Q35:CheXpert labeler 怎么工作?

A:三阶段:提取(含同义词与缩写,如 ptx)→分类(局部上下文定正/负/不确定)→聚合(正>不确定>负的优先级合并)。

Q36:NegBio 怎么工作?

A:规则+依存句法树:在句子依存图上搜索否定线索(如 ‘no evidence of’)的句法辖域,判断提及是否被否定/不确定覆盖。

Q37:两个 labeler 的关系?

A:CheXpert 构建在 NegBio 之上;本集中 NegBio 使用 CheXpert 的 mention patterns——与 NegBio 原生给 NIH ChestX-ray14 用的模式不同。

Q38:标签从报告哪一段取?

A:优先级:impression > findings > 报告最后一节;82.4% 有 impression、12.5% 仅 findings、5.1% 都没有。

Q39:‘No Finding’ 什么时候置 1?

A:仅当除 Support Devices 外全部标签为阴性或未提及;人工标注约定更严——报告提任何异常(含 14 类外)都不算。

Q40:为什么标签 CSV 行数少?

A:labeler 无法导出标签的 study 不生成行——严格子集设计;合并时用左连接。

Q41:报告是结构化的吗?

A:半结构化:固定标题模板(findings/impression)但不强制,存在时间漂移与个体差异。

Q42:训练集标签分布?

A:No Finding 33.0%/Support Devices 28.8%/Pleural Effusion 23.3%/Lung Opacity 22.3%(v5 论文口径)。

Q43:标签值里的 -1.0 是什么?

A:人工标注里表示 uncertain——如报告说 ‘no change from previous’ 这类无法判定的表述。

Q44:能把五值压成二值吗?

A:可以但要想清楚:经典做法是 uncertain/blank 归负(CheXpert 论文做法),也有丢弃或单独建模的——不同选择不可直接比较。

Q45:labeler 的 mention patterns 与 NIH 版有何不同?

A:本集统一用 CheXpert 自定义模式;NegBio 当年给 NIH ChestX-ray8/14 打标用的是自己的原生模式——两库标签不可直接互比。

§10.5 验证与质量(10 问)

Q46:687 份验证怎么抽的?

A:分层抽样保证各病理覆盖,随机抽取后由 board-certified 放射科医生(8 年经验,M.P.L.)按 14 类标注。

Q47:mention 提取最好的类?

A:Pleural Effusion F1 0.973/Pneumothorax 0.970/Pneumonia 0.956——常见病灶接近天花板。

Q48:mention 提取最差的类?

A:Enlarged Cardiomediastinum 0.462/No Finding 0.531/Pleural Other 0.592——杂项类与全称命题是规则式方法死穴。

Q49:不确定性检测表现如何?

A:最弱:多数 F1<0.5,最低 0.065——论文自己量化了短板,是后来’标签=弱监督’定位的学理源头。

Q50:否定检测表现如何?

A:介于两者之间——依存句法让否定线索的覆盖判断比较可靠,但仍有类间差异。

Q51:F1 是图像层面的吗?

A:不是——全部验证都在文本层面(labeler 输出 vs 医生对报告的标注),与影像真实表现之间还有一层报告-影像一致性鸿沟。

Q52:test-set-labeled.csv 是干嘛的?

A:v2.1.0 发布的人工标注(单放射科医生),用途写明:评估 CheXpert 与 NegBio 的性能——把’考卷’随数据集一起发。

Q53:人工标注有什么特别约定?

A:No Finding=1 仅当 impression 完全无异常(含 14 类外);支持设备不算异常;不明表述标 -1.0。

Q54:有 κ 一致性指标吗?

A:没有——单人标注,无标注者间一致性可算;这是与多人共识标注集(如 FDTooth 的 κ>0.9)的结构差异。

Q55:标签质量问题的社区共识?

A:普遍当作 weak supervision 使用;不确定/不一致样本的处置已成为方法论研究对象。

§10.6 划分与使用(10 问)

Q56:官方划分多大?

A:train 368,960 图/222,758 studies;val 2,991 图/1,808 studies(随机 500 患者全研究);test 5,159 图/3,269 studies。

Q57:test 集为什么阳性率高?

A:分层抽样富集:89.1% studies 有发现(train/val 76-77%)——为小类别评估保颗粒度,但与临床分布不可直接对照。

Q58:划分按什么切割?

A:按患者切割——同一患者不跨 train/test,防止同人泄漏;这是医学影像数据集的默认礼仪。

Q59:RECORDS 文件有什么用?

A:v2.1.0 新增:全图相对路径清单,可用 wget/curl 脚本化按需下载子集,不必拉全量。

Q60:IMAGE_FILENAMES 与 RECORDS 是同一个吗?

A:页面两处表述不同(Overview 叫 IMAGE_FILENAMES,Release Notes 叫 RECORDS)——指向同类清单,使用时以实际下载文件为准。

Q61:如何搭标准分类基线?

A:读 split.csv 定训练集→merge chexpert.csv(左连接)→五值按策略压值→按 RECORDS 路径读图→14 类多标签 BCE 训练。

Q62:view position 要过滤吗?

A:常见做法是分开 PA/AP/侧位建模或只训正位——view 是结构性混杂变量(Rubin 2018 曾证明其影响 AUC 数个百分点)。

Q63:可以只用子集吗?

A:可以——RECORDS 支持按需下载;标签 CSV 也可独立于图像先做文本层实验。

Q64:想拿掩码/嵌入/指令对去哪?

A:本库 rid 610(人工心/肺掩码)/611(4,096 维嵌入)/616(106 万指令对)——均与 JPG 文件名体系对齐。

Q65:发表时有什么义务?

A:DUA 条款:使用数据的发表必须公开相应代码;另需按官方 citation 格式引用数据集与论文。

§10.7 与派生家族(10 问)

Q66:哪些数据集建在它上面?

A:本库已收九个 MIMIC 系影像条目(rid 606-616 中的 606/607/608/610/611/612/613/614/616)在母库+JPG 之上形成谱系。

Q67:511 嵌入和 JPG 的对齐键?

A:dicom_id——嵌入集覆盖母库全部 377,110 图,与本集图像一一对应。

Q68:610 掩码和 JPG 怎么对齐?

A:掩码文件名即 JPG 文件名(heart/lung 两套,共 538 张),像素尺寸与对应 JPG 一致。

Q69:616 指令分割的图像源?

A:191,563 张图即母库/JPG 子集,掩码 PNG 与指令 JSON 以文件名哈希关联。

Q70:608 CXR-PRO 改了报告什么?

A:用 GILBERT 识别并改写报告中的 prior 引用(259,376→82,074 处),文本层净化——与本集的标签层互补。

Q71:614 Lunguage 用了哪部分?

A:母库 test 子集 1,473 份报告的专家结构化标注——与本集 NLP 标签是两代不同深度的结构化。

Q72:607 翻拍照的数据源?

A:对屏显影像翻拍模拟远程医疗场景——图像内容仍源自本家族。

Q73:512 LATTE 与本集关系?

A:REFLLACX(孙代)派生的局部图文对齐集——bbox-语句对 3,926 对,图像源追溯到母库。

Q74:家族里谁是’原始层’?

A:MIMIC-CXR v2.0.0(DICOM+报告,本库未单列)——本条目(617)是其加工层代理与家族叙事锚点。

Q75:为什么派生集都选 Credentialed?

A:派生物继承母体门槛——与 PHI 的距离不改变来源数据的合规属性(506/510 两个 ODC-BY 例外是人工增量标注的独立许可设计)。

§10.8 伦理与合规(8 问)

Q76:IRB 审查是什么情况?

A:BIDMC IRB 审查并批准数据共享计划,豁免知情同意——回顾性去标识研究的标准路径。

Q77:去标识到什么程度?

A:HIPAA Safe Harbor:移除 18 类直接标识符;文件名哈希化;采集日期匿名化为相对时间。

Q78:烧在图像上的文字怎么处理?

A:JPG 转换管线配合 OCR(页面引用 Tesseract)检测文本烧除——PHI 移除在母库层完成,JPG 层继承。

Q79:DUA 的三条核心义务?

A:不共享数据、不尝试再识别、发表必须公开代码。

Q80:可以商用吗?

A:Credentialed License 1.5.0 限研究用途;商业应用需另行授权路径。

Q81:数据会被撤回吗?

A:PhysioNet 有既定撤回政策;本研究历史稳定(2019 至今无撤回事件)。

Q82:有利益冲突声明吗?

A:有——Philips Healthcare 资助 MIT LCP 创建本资源,页面 COI 段明示;致谢 Stanford ML 组运行 CheXpert labeler。

Q83:再分发衍生数据可以吗?

A:不可直接再分发原始图像/报告;派生统计与模型的共享条款以 DUA 1.5.0 原文为准——发布嵌入/掩码类派生集均需各自过审。

§10.9 研究设计(7 问)

Q84:弱监督标签下能声称 SOTA 吗?

A:只能说’在 MIMIC-CXR-JPG 官方划分与标签下’——不同标签处置策略(uncertain 映射差异)会让 SOTA 不可比。

Q85:用 test-set-labeled.csv 能做什么?

A:评估你的模型标签/自训 labeler 与放射科医生的差异;或审计 CheXpert/NegBio——它是 labeler 层的基准。

Q86:多标签不平衡怎么办?

A:看分布:No Finding 33% 而 Lung Lesion 极少——用 per-class AUC 与重采样/ focal loss,别只看 micro 指标。

Q87:需要报告生成任务怎么办?

A:本集只有标签没有报告全文——报告文本在母库 MIMIC-CXR;本集提供官方图像侧划分。

Q88:迁移到本院数据要注意什么?

A:三个分布差:直方图均衡化、JPG 压缩、BIDMC 人群与设备——逐项消融才可归因。

Q89:纵向建模可行吗?

A:metadata 的匿名化日期支持同一患者多次检查的时序排列——但影像库非结局队列,结局变量请配 MIMIC-IV。

Q90:引用时最容易犯的错?

A:把 arXiv 1901.07042 全部归为’母库论文’(v1-v2 是母库版 v3-v5 是 JPG 版);以及忘记区分三口径报告数——按内容与版本对准引用。

§11 事实清单:两百条核查记录

§11.1 身份与版本(20 条)

  1. 完整挂牌名:MIMIC-CXR-JPG - chest radiographs with structured labels
  2. 当前版本 v2.1.0,发布日 2024-03-12
  3. 首发版本 v2.0.0,发布日 2019-11-14
  4. v2.1.0 版本 DOI:10.13026/jsn5-t979
  5. v2.0.0 版本 DOI:10.13026/8360-t248
  6. 全版本 DOI(latest):10.13026/th9c-ae10
  7. 母项目:MIMIC-CXR Database v2.0.0(DOI 10.13026/C2JT1Q,latest 10.13026/s5dg-6s42)
  8. 发布平台:PhysioNet(Credentialed 档位)
  9. 访问级别:Credentialed(License 1.5.0 + DUA 1.5.0)
  10. 训练门槛:CITI ‘Data or Specimens Only Research’ 课程
  11. 维护方:MIT Laboratory for Computational Physiology
  12. 项目主页:https://mimic-cxr.mit.edu
  13. Topics:computer vision / chest x-ray / radiology / mimic / deep learning
  14. v2.1.0 页面 Project Views:5,337
  15. v2.0.0 页面 Project Views:4,251(双口径存照)
  16. Current Version Views:9,588
  17. 官方定位:母库的 convenient processed version + 数据划分与标签的标准参考
  18. v2.1.0 页面 Abstract 仍自称 ‘Database v2.0.0’(页面笔误存照)
  19. RECORDS(Release Notes)与 IMAGE_FILENAMES(Overview)同页异名存照
  20. v2.1.0 相对 v2.0.0 零数据变更:只加两个文件

§11.2 规模与口径(20 条)

  1. 图像总数:377,110 张 JPG
  2. 图像与母库 DICOM 完全一致(官方声明 ‘images are identical to MIMIC-CXR v2.0.0’)
  3. 报告数(JPG Abstract 口径):227,827 份
  4. 研究数(母库 Abstract 口径):227,835 studies
  5. 总报告数(JPG Methods 口径):227,943 份
  6. 三口径差 116-116 份,官方未解释(对账表见附录 C)
  7. 时间窗:2011-2016 年
  8. 来源机构:Beth Israel Deaconess Medical Center(BIDMC),波士顿
  9. 患者总数(论文划分表加总):65,383
  10. 训练集患者:64,588
  11. 验证集患者:500(随机抽样,全部研究入集)
  12. 测试集患者:295(分层抽样)
  13. 去标识标准:HIPAA Safe Harbor,PHI 全移除
  14. 图像用途声明:image understanding / NLP / decision support
  15. 顶层文件夹 10 个(p10-p19)
  16. 每顶层文件夹约 6,500 个患者子文件夹
  17. 图像文件名:32 位十六进制哈希
  18. 目录三层:患者前缀/患者 ID/研究 ID
  19. 侧位占比:train 32.7%(248,285 正位/120,756 侧位,v2 论文表)
  20. 每研究平均约 1.65 张图

§11.3 论文与团队(20 条)

  1. 论文:arXiv 1901.07042 ‘MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs’
  2. 论文 v1 提交:2019-01-21;v5(当前版):2019-11-14
  3. v5 与 v2.0.0 数据集同日发布(2019-11-14)
  4. 同号演化:arXiv v1-v2 标题为 MIMIC-CXR(母库论文),v3-v5 改为 JPG 论文
  5. 母库正式发表版:Scientific Data 2019;6:317(DOI 10.1038/s41597-019-0244-5)
  6. 作者 10 人,一作兼通讯:Alistair E. W. Johnson(MIT)
  7. 共同作者:Tom J. Pollard(MIT)/ Nathaniel R. Greenbaum / Matthew P. Lungren(Stanford)
  8. 共同作者(续):Chih-ying Deng / Yifan Peng / Zhiyong Lu(NIH NLM)
  9. 共同作者(续 2):Roger G. Mark(MIT)/ Seth J. Berkowitz(BIDMC)/ Steven Horng(BIDMC)
  10. 机构四方:MIT LCP + Stanford + NIH NLM + BIDMC
  11. 人工验证标注者:Matthew P. Lungren(board-certified,8 年经验)
  12. 致谢:Stanford ML Group + Stanford AIMI(Jeremy Irvin / Pranav Rajpurkar)协助运行 CheXpert labeler
  13. 致谢:BIDMC 持续协作
  14. 资助:NIH-R01-EB017205(NIH 国家生物医学成像与生物工程研究所口)
  15. 资助(续):Philips Healthcare 资助 MIT LCP——COI 明示
  16. COI 原文:‘Philips Healthcare supported the creation of this resource’
  17. PhysioNet 支持方:NIBIB(页面页脚)
  18. 论文结论定性:标签为弱监督,工具短板自量化
  19. Johnson 同期另一作品:MIMIC Code Repository(JAMIA 2018)——可复现性基建
  20. 数据集与论文的引用关系:PhysioNet 页面 References [12] 即 JPG 论文本身

§11.4 图像管线(20 条)

  1. 管线三步:DICOM→JPG;报告→标签;元数据制作
  2. 图像与文本两线独立处理,最后按研究标识对齐
  3. 像素提取库:pydicom
  4. 归一化:减最低值→除平移后最大值→截断→无符号整数,压入 [0,255]
  5. 方向判定字段:DICOM PhotometricInterpretation
  6. 灰度约定:肺内空气呈白色(高值)、患者体外呈黑色(低值)
  7. 对比度增强:OpenCV 直方图均衡化(灰度级频率近似相等)
  8. 压缩参数:JPG quality factor 95(刻意选高)
  9. 均衡化不可逆——定量组学应回母库 DICOM
  10. 页面引用编号错位存照:Methods 称 ‘pydicom library [10]’ 而 [10] 实为 ChestX-ray8
  11. 文本烧除背景引用:Tesseract OCR(Smith 2007 ICDAR)
  12. JPG 化动机:拆掉 DICOM 门槛(专门解析库/大体积/窗宽窗位概念)
  13. 官方预处理内嵌=研究者免搭管线+全社区输入分布统一
  14. 预处理差异是跨库迁移的头号混杂变量
  15. 官方转换代码开源(MIMIC-CXR Code Repository)
  16. 图像层无人工标注——像素级标注需走 rid 610/613
  17. 图像质量可复现:同一 DICOM 输入经官方管线输出确定
  18. 存储友好:RECORDS 支持脚本化子集下载
  19. 直方图均衡化与 NIH ChestX-ray14(未均衡化)不可直接混合训练
  20. 图像层与报告层的对齐键:metadata.csv 的 study_id/dicom_id

§11.5 报告结构与标签(20 条)

  1. 报告为半结构化模板:固定标题但不强制
  2. 两个关键段落:findings(详细描述)与 impression(简短总结)
  3. 82.4% 报告有 impression 段
  4. 12.5% 仅 findings 段
  5. 5.1% 两段皆无(取材回退到报告最后一节)
  6. 取材优先级:impression > findings > 最后一节
  7. 14 类标签完整清单:No Finding/Enlarged Cardiomediastinum/Cardiomegaly/Lung Lesion/Lung Opacity/Edema/Consolidation/Pneumonia/Atelectasis/Pneumothorax/Pleural Effusion/Pleural Other/Fracture/Support Devices
  8. 五值标签:阳性/阴性/不确定/不一致(disagreement)/未提及(blank)
  9. disagreement=CheXpert 与 NegBio 冲突的明示记录
  10. CheXpert 三阶段:提取→分类→聚合
  11. 聚合优先级:阳性>不确定>阴性
  12. 正+负共现→取正;负+不确定→取不确定
  13. 同义词/缩写覆盖示例:pneumothorax→pneumothoraces/ptx
  14. ‘No Finding’ 规则:除 Support Devices 外全阴/未提才置 1
  15. NegBio 机制:依存句法图上搜索否定线索句法辖域
  16. 否定线索例:‘no evidence of’
  17. 本集 NegBio 使用 CheXpert 自定义 mention patterns
  18. 该配方≠NegBio 原生用于 NIH ChestX-ray8/14 的模式
  19. 标签 CSV 为母库研究的严格子集(无法导出即无行)
  20. 两个标签 CSV 均一 study 一行、一发现一列

§11.6 验证与质量(30 条)

  1. 验证规模:687 份报告
  2. 抽样方式:分层抽样保证病理覆盖
  3. 标注者:board-certified 放射科医生,8 年经验(M.P.L.)
  4. 标注标准:CheXpert 14 类
  5. 三任务评估:提及提取/否定检测/不确定性检测
  6. 提及提取 F1 冠军:Pleural Effusion 0.973(370 例)
  7. 亚军:Pneumothorax 0.970(226 例)
  8. 季军:Pneumonia 0.956(223 例)
  9. Atelectasis F1:0.944(218 例)
  10. Consolidation F1:0.930(95 例)
  11. Fracture F1:0.904(50 例)
  12. Support Devices F1:0.892(234 例)
  13. Edema F1:0.888(召回率 1.000)
  14. Cardiomegaly F1:0.859(235 例)
  15. Lung Lesion F1:0.855(66 例)
  16. Lung Opacity F1:0.800(194 例)
  17. Pleural Other F1:0.592(27 例)
  18. No Finding F1:0.531(精确率仅 0.382)
  19. Enlarged Cardiomediastinum F1:0.462(最差,70 例)
  20. 不确定性检测多数 F1<0.5(最低 0.065-0.069)
  21. Cardiomegaly 不确定性:NegBio 0.237 / CheXpert 0
  22. Edema 不确定性:0.169/0.207
  23. 验证全部在文本层面——不含影像真值对照
  24. 人工标注约定:No Finding=1 需 impression 完全无异常(含 14 类外)
  25. 人工标注约定:支持设备不算异常
  26. 人工标注约定:语义不明(如 ‘no change from previous’)→ -1.0
  27. 单人标注——无标注者间 κ 可算
  28. v2.1.0 把人工标注随集发布(mimic-cxr-2.1.0-test-set-labeled.csv)
  29. '考卷发布’与数据首发相隔约五年(2019 验证→2024 发布)
  30. 弱监督定位的学理源头:论文自报工具短板

§11.7 划分与分布(20 条)

  1. 官方划分文件:mimic-cxr-2.0.0-split.csv.gz
  2. train:368,960 图 / 222,758 studies
  3. validation:2,991 图 / 1,808 studies
  4. test:5,159 图 / 3,269 studies
  5. test 集分层富集:89.1% studies 有发现(train/val 76-77%)
  6. 划分按患者切割——防同人泄漏
  7. train 标签分布:No Finding 33.0%
  8. train 标签分布:Support Devices 28.8%
  9. train 标签分布:Pleural Effusion 23.3%
  10. train 标签分布:Lung Opacity 22.3%
  11. arXiv v2 表(CXR 时期)与 v5 表(JPG 时期)划分数字微调(369,188/2,732/5,239 vs 368,960/2,991/5,159)
  12. 验证集=随机 500 患者全部研究
  13. 测试集=分层抽样研究集合
  14. test 富集设计使 test 指标高于临床真实分布下的预期
  15. 五值处置策略差异是跨论文比较的头号坑
  16. 官方 split 的语义:推荐划分(standard reference)——非强制但已成社区默认
  17. metadata 支持同一患者多次检查的时序排列(匿名日期可排序)
  18. 纵向结局研究需另配 MIMIC-IV 等临床库
  19. view position 是结构性混杂变量(Rubin 2018:PA/AP/侧位分模态建模提升 AUC 0.031)
  20. 多标签任务的正确指标姿势:per-class AUC 优先于 micro

§11.8 获取与合规(20 条)

  1. DUA 三条款:不共享/不再识别/发表必须公开代码
  2. '发表必须开源’是可执行合同条款(MIMIC 家族特色)
  3. CITI 课程要求覆盖每位合作者
  4. 审核方:MIT LCP(通常数个工作日)
  5. License:PhysioNet Credentialed Health Data License 1.5.0
  6. DUA 版本:PhysioNet Credentialed Health Data Use Agreement 1.5.0
  7. 研究用途限定——商用需另行授权
  8. 再分发限制:原始图像/报告不可直接再分发
  9. 派生集(嵌入/掩码等)需各自过 PhysioNet 审核上架
  10. 伦理:BIDMC IRB 免知情同意豁免+批准共享
  11. 文件名哈希化=Safe Harbor 之外的额外保险
  12. 匿名日期保留时序可用性
  13. 页面匿名访问显示 ‘Data Not Available’(区域/登录状态提示)——正常现象
  14. Credentialed 的哲学:与 PHI 的距离决定门槛而非匿名程度
  15. 母库 MIMIC-CXR 页面 Views 5,758(对照)
  16. 使用免费——门槛是身份审核与承诺而非付费
  17. 违规后果:PhysioNet 有撤回与封禁机制
  18. 历史稳定性:2019 至今无撤回事件
  19. DUA 与 License 每次大版本随 PhysioNet 政策演进(1.4→1.5)
  20. 引用义务:官方 citation 格式含数据集 DOI 与论文

§11.9 家族与互链(20 条)

  1. 谱系地位:母库 MIMIC-CXR(未单列)→本集(617)→九个派生条目
  2. rid 606 cxr-cardiomegaly:母库数值层(CTR 标志物)
  3. rid 607 cxr-phone:屏显翻拍照片层
  4. rid 608 cxr-pro:报告净化文本层(prior 引用 259,376→82,074)
  5. rid 610 heart-lung-segmentations-data:538 张人工掩码(心 338+肺 200)
  6. rid 611 image-embeddings-mimic-cxr:377,110 图逐图 4,096 维嵌入(CXR Foundation)
  7. rid 612 latte-cxr:局部图文对齐(bbox-语句 3,926 对+眼动 13,751 对)
  8. rid 613 lung-segment-mimic-cxr:1,141 对自动分割图像对
  9. rid 614 lunguage:test 子集 1,473 份专家结构化报告
  10. rid 616 mimic-cxr-ext-ils:191,563 图+1,065,621 指令对+91,301 掩码
  11. 家族抽象阶梯:像素→图像→掩码/数值/向量→对齐/指令/结构化报告→照片(反向)
  12. 本集是家族图像供给的物理实体(对多数用户)
  13. 派生集普遍继承 Credentialed 门槛
  14. 例外:506/510 用 ODC-BY 1.0(人工增量标注独立许可)
  15. 512 为 Restricted(注册+DUA 免 CITI)——门槛光谱中间态
  16. 家族横跨 Open/Restricted/Credentialed 三档——派生距离不改变合规属性
  17. 本集+母库构成批次六’形态学之旅’的坐标系原点
  18. 511 的 377,110 与本集图像一一同构(join 键 dicom_id)
  19. 610 掩码文件名即 JPG 文件名(对齐零成本)
  20. 616 的 191,563 图为本集子集

§11.10 页面瑕疵与存照(20 条)

  1. 瑕疵一:v2.1.0 页面 Abstract 仍自称 ‘Database v2.0.0’
  2. 瑕疵二:227,835/227,827/227,943 三口径并存
  3. 瑕疵三:RECORDS vs IMAGE_FILENAMES 同页异名
  4. 瑕疵四:pydicom 引用编号 [10] 错位([10] 实为 ChestX-ray8)
  5. 瑕疵五:Views 双口径(4,251 vs 5,337)
  6. References 共 13 条(页面)
  7. 历史锚:Simon et al. 1974 Radiology——计算机化报告编码语言
  8. 全球卫生叙事引用:利比里亚/卢旺达/VA/英国 RCM/美国县级分布
  9. CheXpert 引用:Irvin et al. AAAI 2019([8])
  10. NegBio 引用:Peng et al. AMIA 2018([9])
  11. ChestX-ray8 引用:Wang et al. CVPR 2017([10])
  12. Release Notes 里 [12] 即 JPG 论文(人工标注评估出处)
  13. JPG 无独立 Scientific Data 正式版——正式版是母库的(Sci Data 2019;6:317)
  14. 页面 ‘Works Cited’ 字样未出现(引用结构以 References 段为准)
  15. v2.0.0 页与 v2.1.0 页的 DOI/Views/Abstract 均有细节差异——引用时以所用版本页为准
  16. 三口径现象的教学价值:派生链上每层有自己的’总数’语义
  17. 页面瑕疵核查方法:curl 实测两版本页+母库页三方对照
  18. 存照纪律:本库条目对矛盾数字一律并列引用不擅自仲裁
  19. 官方 FAQ/教程:PhysioNet tutorials 含 MIMIC-CXR 使用示例
  20. 批次七生产视角:本条目为 517 号(预期 rid 617)

§12 术语表:五十条

1. MIMIC-CXR —— BIDMC 2011-2016 的胸片 DICOM 母库+自由文本报告,本集的唯一数据来源

2. MIMIC-CXR-JPG —— 本条目:母库的 JPG 加工层+结构化标签+官方划分

3. BIDMC —— Beth Israel Deaconess Medical Center,哈佛医学院教学医院,MIMIC 全家族的数据源

4. MIT LCP —— MIT 计算生理学实验室,MIMIC 家族维护方与 PhysioNet 运营核心

5. PhysioNet —— MIT 主导的生理与临床数据资源平台,Credentialed 访问体系的运营方

6. Credentialed —— PhysioNet 三档访问的中间档:身份审核+DUA+CITI 课程

7. DUA —— Data Use Agreement 1.5.0:数据使用协议,含’发表必须开源代码’条款

8. CITI —— Collaborative Institutional Training Initiative,人类受试者保护课程体系

9. HIPAA Safe Harbor —— 美国 HIPAA 隐私规则的去标识标准:移除 18 类直接标识符

10. DICOM —— 医学数字成像与通信标准,放射科原生格式

11. JPG/JPEG —— 有损压缩图像格式;本集以 quality 95 输出

12. PhotometricInterpretation —— DICOM 字段:像素明暗解释约定,用于方向校正判断

13. 直方图均衡化 —— 拉平灰度分布的对比度增强变换;本集内嵌且不可逆

14. quality factor 95 —— JPG 压缩质量参数,0-100 取 95=低损失高压缩率的折中

15. CheXpert —— Stanford 的大型胸片数据集与本库引用的 labeler 同名工具(AAAI 2019)

16. CheXpert labeler —— 规则式 NLP 标注器:三阶段(提取/分类/聚合)从报告生成 14 类标签

17. NegBio —— 规则式否定与不确定性检测器(AMIA 2018),基于依存句法树

18. mention patterns —— labeler 中识别发现的词表与同义词规则集——不同数据集配方不同

19. disagreement —— 五值标签之一:两个 labeler 对同一研究结论冲突时的明示记录

20. weak supervision —— 弱监督:标签由自动流程生成、含系统性噪声,需在建模中显式处理

21. impression —— 报告的关键段落:最紧要发现的简短总结;标签取材第一优先

22. findings —— 报告的关键段落:图像发现的自然语言详细描述;标签取材第二优先

23. study —— 一次影像检查单元:可含正/侧位多张图,对应一份报告

24. view position —— 投照体位(PA/AP/侧位等):结构性混杂变量,建模常需分层

25. train/val/test split —— 官方推荐数据划分(split.csv.gz):按患者切割,test 分层富集

26. stratified sampling —— 分层抽样:保证各病理类别在样本中有足够代表——test 集的设计

27. F1 score —— 精确率与召回率的调和平均:labeler 验证的核心指标

28. No Finding —— 14 类之一:全称命题标签(‘报告未提任何异常’),F1 仅 0.531

29. Enlarged Cardiomediastinum —— 纵隔增宽:14 类中 mention F1 最差(0.462)——措辞变体最多的类别

30. Support Devices —— 支持设备类:起搏器/引流管等;人工标注约定中不算’异常’

31. uncertain (-1.0) —— 人工标注值:语义不明(如 ‘no change from previous’)时的编码

32. test-set-labeled.csv —— v2.1.0 新增:放射科医生人工标注,labeler 评估基准

33. RECORDS —— v2.1.0 新增:全图相对路径清单,支持按需子集下载

34. arXiv 1901.07042 —— 本集论文(v5)与母库论文(v1-v2)共用的 arXiv 编号

35. Scientific Data 2019;6:317 —— 母库 MIMIC-CXR 的正式发表版(DOI 10.1038/s41597-019-0244-5)

36. CXR Foundation —— Google 的胸片嵌入模型(EfficientNet-L2/SupCon)——rid 611 嵌入的生成器

37. TernausNet —— U-Net 变体分割网络——rid 613 自动分割对的生产模型

38. GILBERT —— BioBERT token 级 NER——rid 608 报告净化的提取引擎

39. MIMIC Code Repository —— MIMIC 家族的开源代码仓(JAMIA 2018):可复现性基建

40. Rubin 2018 —— 按 view position 分模态建模的研究:证明体位是结构性混杂变量

41. DualNet —— Rubin 2018 的正侧位双流架构:多视图融合的早期基线

42. per-class AUC —— 多标签分类的正确指标姿势:按类别报告 AUC 而非只看 micro 平均

43. labeler 审计 —— 用 disagreement 池与人工标注子集系统评估自动标签质量的方法

44. 同号双论文 —— 本条目存照概念:arXiv 1901.07042 v1-v2 与 v3-v5 承载两篇不同论文

45. 三口径对账 —— 本条目存照概念:227,835(母库 studies)/227,827(关联报告)/227,943(Methods 总数)

46. 图像供给枢纽 —— 本条目定位概念:对多数用户,'MIMIC-CXR 的图’的物理实体即本集

47. 形态学之旅 —— 本库批次六元主题:MIMIC-CXR 家族七形态(数值/照片/文本/掩码/向量/对齐/指令)

48. 根节点 —— 谱系术语:本集是九个派生条目共同祖先的代理条目

49. 严格子集 —— 标签 CSV 的行集语义:labeler 无法导出的研究不生成行

50. 左连接 —— 合并标签与划分时的正确姿势——内连接会静默丢失缺行研究

§10.10 批次七生产视角(5 问)

Q91:本条目在批次七的排位?

A:2/10(order 517),紧跟 516 MIMIC-CXR-Ext-ILS 之后——先发派生、后立根节点,叙事上是"先见森林、后立坐标"。

Q92:为什么 517 值得排在派生条目之后?

A:批次六已收九个派生条目,本条目作为根节点代理落位后,家族叙事从"点状收录"升级为"完整谱系"——互链结构随之闭环。

Q93:本条目的核查轮次?

A:3 轮——v2.0.0 页全量、v2.1.0 页+母库页对照、arXiv v1-v5 论文链与多源交叉;发现三口径、五瑕疵、同号双论文三大存照。

Q94:本条目与其他 MIMIC 主条目(如 MIMIC-IV)的关系?

A:同属 MIMIC 家族但影像/临床分册;队列层结局变量在 MIMIC-IV/III,影像+报告在本家族——纵向研究需两侧 join。

Q95:一句话总结本条目?

A:医学影像弱监督的坐标系原点——37.7 万图、14 类五值、诚实的 F1 曲线,以及一个家族九形态的共同开端。

§11.10 流水线与发布存照(15 条)

  1. 生产序号:批次七 2/10(order 517,预期 rid 617)
  2. FACTS.md:writing/mimic-cxr-jpg/FACTS.md(三轮核查全录)
  3. 核查快照:/tmp/517_page.html(v2.0.0 页)/ /tmp/517_page_v210.html(v2.1.0 页)
  4. 组装:四块(part1 正文 203/part2 正文 131/part3 程序化 724/part4 附录 119)+ §10.10/§11.10 补丁
  5. 预判修正一:报告数 227,835→三口径并存(827/943/835 各守其义)
  6. 预判修正二:版本 v2.0.0 止步→v2.1.0 最新(2024-03-12 增量版)
  7. 存照一:三口径对账(附录 C)
  8. 存照二:同号双论文(附录 A)
  9. 存照三:页面瑕疵五例(附录 D)
  10. 家族定位:九个派生条目(606-616)的共同根节点代理——母库主条目实为 rid 16(早期批次,别名已含 JPG),查重命中后修正谱系表
  11. 双检:check_md + preflight_check(发布前执行)
  12. 查重:url_name=‘mimic-cxr-jpg’ 精确匹配(发布前)
  13. 互链计划:606/607/608/610/611/612/613/614/616 九条回链
  14. 类目:医学影像(X光影像/图像分类)
  15. Access 实测:Credentialed(License 1.5.0+DUA 1.5.0+CITI)——批次预判命中

附录 A:版本史双线对照

数据集版本线(PhysioNet)

版本 日期 版本 DOI 变更
v2.0.0 2019-11-14 10.13026/8360-t248 首发:377,110 JPG + 双 labeler CSV + split + metadata
v2.1.0 2024-03-12 10.13026/jsn5-t979 新增 RECORDS 与 mimic-cxr-2.1.0-test-set-labeled.csv;数据零变更

论文版本线(arXiv 1901.07042)

版本 日期 标题指向 备注
v1 2019-01-21 MIMIC-CXR(母库论文) 383 KB
v2 2019-01-23 MIMIC-CXR(母库论文) 划分表:369,188/2,732/5,239 图
v3 2019-11-12 改换为 JPG 论文 135 KB(大改)
v4 2019-11-13 JPG 论文 —
v5 2019-11-14 MIMIC-CXR-JPG(本集论文) 与 v2.0.0 数据集同日发布

同号双论文演化:引用时按内容对准版本——研究母库文本/DICOM 用 v1-v2 或 Sci Data 2019;6:317;研究 JPG 层/标签层用 v5。

附录 B:14 类标签全景表(F1 + 训练分布 + 人工约定)

# 标签 mention F1 阳性例数(验证集) 训练集阳性占比 特殊说明
1 No Finding 0.531 30 33.0%(为 1) 全称命题;人工约定"支持设备不算异常"
2 Enlarged Cardiomediastinum 0.462 70 — 措辞变体最多,mention F1 垫底
3 Cardiomegaly 0.859 235 — 不确定性 F1:NegBio 0.237/CheXpert 0
4 Lung Lesion 0.855 66 — 小类别
5 Lung Opacity 0.800 194 22.3% 不确定性未评估(无标注案例)
6 Edema 0.888 227 — 召回率 1.000
7 Consolidation 0.930 95 — —
8 Pneumonia 0.956 223 — —
9 Atelectasis 0.944 218 — —
10 Pneumothorax 0.970 226 — 同义词覆盖:ptx/pneumothoraces
11 Pleural Effusion 0.973 370 23.3% 验证集最大类
12 Pleural Other 0.592 27 — "其他"杂项类
13 Fracture 0.904 50 — —
14 Support Devices 0.892 234 28.8% 人工约定不算异常

五值编码含义:1=阳性;0=阴性;-1=不确定(人工标注);disagreement=双 labeler 冲突;空白=未提及/未导出。

附录 C:三口径对账表

口径 数字 出处 语义
studies 227,835 母库 MIMIC-CXR v2.0.0 Abstract 影像检查单元总数
报告(关联) 227,827 JPG Abstract / 论文摘要 与图像关联的自由文本报告
报告(处理) 227,943 JPG Methods 进入标签管线的总报告数

差值 116 与 8 份官方未解释。工程解读:个别报告无对应图像、个别检查无独立报告——三层总数各守其义。存照纪律:本条目并列引用三口径,不擅自仲裁。

附录 D:页面瑕疵五例全录(核查让矛盾浮出水面)

  1. Abstract 版本滞后:v2.1.0 页面(title 已是 2.1.0)Abstract 仍写 “Database v2.0.0”——发布物更新后正文未同步。
  2. 三口径并存:见附录 C;Abstract 与 Methods 相隔一屏数字不同。
  3. 同页异名:Release Notes 说 v2.1.0 新增 “RECORDS”,Overview 文件列表叫 “IMAGE_FILENAMES”——同类清单两种称呼。
  4. 引用编号错位:Methods 写 “using the pydicom library [10]”,但 References [10] 是 ChestX-ray8 论文——pydicom 无对应编号。
  5. Views 双口径:v2.0.0 页 Project Views 4,251 vs v2.1.0 页 5,337——版本页各自计数,非同一指标。

方法论注:以上矛盾均由 curl 双版本页+母库页三方实测发现。事实核查的价值不在挑错,而在让引用者知道自己引的是哪一层。

附录 E:页面 References 十三条全录

  1. Ray Smith. An overview of the tesseract OCR engine. ICDAR 2007;2:629-633. IEEE.
  2. Ali FS, Harrington SG, Kennedy SB, Hussain S. Diagnostic radiology in Liberia: a country report. J Glob Radiol 2015;1(2):6.
  3. Rosman DA, et al. Imaging in the land of 1000 hills: Rwanda radiology country report. J Glob Radiol 2015;1(1):5.
  4. Bastawrous S, Carney B. Improving patient safety: avoiding unread imaging exams in the national VA enterprise EHR. J Digit Imaging 2017;30(3):309-313.
  5. Rimmer A. Radiologist shortage leaves patient care at risk, warns royal college. BMJ 2017;359.
  6. Rosenkrantz AB, Wang W, Hughes DR, Duszak R Jr. A county-level analysis of the US radiologist workforce. J Am Coll Radiol 2018;15(4):601-606.
  7. Rosenkrantz AB, Hughes DR, Duszak R Jr. The US radiologist workforce: temporal and geographic variation. Radiology 2015;279(1):175-184.
  8. Irvin J, Rajpurkar P, Ko M, et al. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. AAAI 2019.
  9. Peng Y, Wang X, Lu L, Bagheri M, Summers R, Lu Z. NegBio: a high-performance tool for negation and uncertainty detection in radiology reports. AMIA Jt Summits Transl Sci Proc 2018;2018:188.
  10. Wang X, Peng Y, Lu L, Lu Z, Bagheri M, Summers RM. ChestX-ray8: hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases. CVPR 2017:2097-2106.
  11. Simon M, Leeming BW, Bleich HL, et al. Computerized radiology reporting using coded language. Radiology 1974;113(2):343-349.
  12. Johnson AEW, Pollard TJ, Greenbaum NR, Lungren MP, Deng CY, Peng Y, Lu Z, Mark RG, Berkowitz SJ, Horng S. MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs. arXiv:1901.07042 (2019).
  13. Johnson AE, Stone DJ, Celi LA, Pollard TJ. The MIMIC Code Repository: enabling reproducibility in critical care research. JAMIA 2018;25(1):32-39.

附录 F:与同类胸片库对照

维度 MIMIC-CXR-JPG(本条目) NIH ChestX-ray14 CheXpert(Stanford) PadChest
规模 377,110 图 / 227,827 报告 112,120 图 224,316 图 160,868 图
来源 BIDMC(2011-2016) NIH CC 30 年回溯 Stanford 院区 圣胡安医院(西班牙)
格式 JPG(均衡化+q95) PNG(未均衡化) JPG DICOM/衍生
标签来源 CheXpert+NegBio 双 labeler NLP(专业公司+众包) CheXpert labeler 放射技师人工+报告绑定
标签粒度 14 类五值 14 类二值+置信 14 类五值 174 类多值
不确定性建模 uncertain+disagreement 显式 无 uncertain 显式 —
人工验证 687 报告(v2.1.0 随集发布) 无公开对照规模 专家对比集 —
报告文本 有(在母库) 无 无 有
访问 Credentialed Open 需协议 需申请
与本集关系 — labeler 配方不同源(存照) labeler 同源(官方协助) 独立体系

选型建议:要报告文本配对选本集(+母库)或 PadChest;要 Open 快速起步选 ChestX-ray14;要 labeler 生态一致性选本集或 CheXpert 本体;跨库比较时先对齐预处理与标签五值处置策略——附录 B 与 §9.2 是对齐清单。

附录 G:派生家族互链表(全 rid)

本库 rid slug 形态 数据源关系
606 cxr-cardiomegaly 数值层(CTR 标志物) 母库 DICOM+元数据
607 cxr-phone 照片层(屏显翻拍) 家族图像
608 cxr-pro 文本层(prior 引用净化) 母库报告
610 heart-lung-segmentations-data 掩码层(538 人工掩码) JPG 图像+Montgomery
611 image-embeddings-mimic-cxr 向量层(4,096 维逐图嵌入) 母库全量图像(dicom_id 对齐)
612 latte-cxr 图文对齐(bbox-语句/眼动) REFLLACX 派生(孙代)
613 lung-segment-mimic-cxr 分割图像对(1,141 对) 母库图像(TernausNet)
614 lunguage 报告结构化基准 母库 test 子集
616 mimic-cxr-ext-ils 指令分割(106 万指令对) 母库图像+报告
16 mimic-cxr 原始层(DICOM+报告母库主条目) —
617 mimic-cxr-jpg(本条目) 加工层(JPG+标签+划分) 母库 MIMIC-CXR v2.0.0(rid 16)

谱系阅读顺序建议:本条目(617)→ 611(向量层)→ 610(掩码层)→ 616(指令层)——沿抽象阶梯上行;607(照片层)反向下行回物理世界。

附录 H:批次七生产存照(517 号)

  • 生产序号:批次七 2/10(order 517,预期 rid 617)
  • 事实核查:3 轮——curl v2.0.0 页(63,031 B)→ curl v2.1.0 页(68,643 B)+母库页 → arXiv 1901.07042 v1-v5+多源交叉(alphaXiv/emergentmind)
  • 关键预判修正:报告数预判 227,835 实为母库 studies 口径(JPG 关联报告 227,827);版本预判止于 v2.0.0 实为 v2.1.0 最新(2024 增量版)
  • 本条目定位:MIMIC-CXR 派生家族九条目(606-616)的共同根节点代理——批次六"形态学之旅"的坐标系原点
  • 页面瑕疵存照五例(附录 D)——事实核查方法论的批次六签名在批次七延续

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • chexpert — 共享标签:医学影像 / X光影像 / 图像分类
  • nih-chestx-ray14 — 共享标签:医学影像 / X光影像 / 图像分类
  • image-embeddings-mimic-cxr — 共享标签:医学影像 / X光影像 / 图像分类
  • padchest — 共享标签:医学影像 / X光影像 / 图像分类
  • brax — 共享标签:医学影像 / X光影像 / 图像分类
  • covid-19-radiography — 共享标签:医学影像 / X光影像 / 图像分类
  • tbx11k — 共享标签:医学影像 / X光影像 / 图像分类
  • cbis-ddsm — 共享标签:医学影像 / X光影像 / 图像分类
  • cmmd — 共享标签:医学影像 / X光影像 / 图像分类
  • vindr-pcxr — 共享标签:医学影像 / X光影像 / 图像分类

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集