信息速览
INFOBOX:mimic-cxr-jpg 速览
| 字段 | 值 |
|---|---|
| 数据集 | MIMIC-CXR-JPG - chest radiographs with structured labels |
| slug | mimic-cxr-jpg |
| 发布 | v2.0.0 2019-11-14|v2.1.0 2024-03-12|PhysioNet |
| DOI | 10.13026/jsn5-t979(v2.1.0)/ 10.13026/8360-t248(v2.0.0) |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程) |
| 规模 | 377,110 JPG|227,827 报告|65,383 患者|14 类五值标签 |
| labeler | CheXpert(AAAI 2019)+ NegBio(AMIA 2018)双工具定制配方 |
| 验证 | 687 份报告|board-certified 8 年经验放射科医生(M.P.L.) |
| 划分 | train 368,960 / val 2,991 / test 5,159 图像(按患者切割) |
| 团队 | MIT LCP(Johnson 等 10 人)+ Stanford + NIH NLM + BIDMC |
| 论文 | arXiv 1901.07042(v5 2019-11-14) |
| 一句话 | 派生家族的图像供给枢纽:把 DICOM 门槛拆掉,把标签的可靠边界量化给你看 |
§0 摘要卡:从"母库加工层"到"弱监督坐标系"
§0.1 名称与口径声明
本条目记录 PhysioNet 数据集 MIMIC-CXR-JPG(slug:mimic-cxr-jpg),当前版本 v2.1.0(2024-03-12),首发 v2.0.0(2019-11-14),Credentialed。三口径存照:377,110 张图对应的报告数在不同层有三种说法——母库 227,835 studies / JPG 摘要 227,827 份报告 / Methods 处理 227,943 份——本条目并列引用不仲裁(对账见附录 C)。版本口径存照:v2.1.0 相对 v2.0.0 零数据变更,仅新增两个文件。
§0.2 读者收益清单
- 分类研究者:37.7 万图+14 类标签+官方划分——医学影像多标签分类的事实标准起点
- 方法学研究者:687 份人工验证+双 labeler 分任务 F1 全表——弱监督可靠边界的公开教材
- 管线工程师:五工序图像管线(pydicom→归一化→方向校正→均衡化→q95)与三阶段 labeler 的可复现配方
- 家族谱系读者:本库 606-616 九个 MIMIC 影像条目的共同根节点——互链枢纽
- 合规负责人:Credentialed 全流程(CITI/DUA/发表开源义务)的典型样本
§0.3 本条目与其他条目的阅读组合
- 16 mimic-cxr(母库主条目):DICOM 原始层+报告全文——本集的亲代条目,报告文本任务(生成/结构化)以它为图像-文本源
- 611 image-embeddings:本集图像→逐图 4,096 维嵌入(dicom_id 对齐)——"图像层→向量层"直通车
- 610 heart-lung-segmentations:本集无像素标注——掩码需求走 610(538 人工掩码,文件名对齐零成本)
- 616 mimic-cxr-ext-ils:指令微调需求走 616(106 万指令对,本集图像子集)
- 608 cxr-pro:标签层之外还要净化报告文本——608 的 prior 引用改写与本集标签互补
- 614 lunguage:弱监督标签不够精——614 的专家结构化报告是 NLP 侧的精标对照组
§0.4 身份卡:一条命令背下这个数据集
名称 MIMIC-CXR-JPG - chest radiographs with structured labels
版本 v2.1.0(2024-03-12)|首发 v2.0.0(2019-11-14)
DOI 10.13026/jsn5-t979(v2.1.0)|10.13026/th9c-ae10(全版本)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI)
规模 377,110 JPG|227,827 报告|65,383 患者|14 类五值标签
管线 pydicom→归一化→方向校正→直方图均衡→q95|CheXpert+NegBio
验证 687 报告|mention F1 0.46-0.97|不确定性多数 <0.5
论文 arXiv 1901.07042(v5,Johnson et al. 10 人)
它的故事一句话:母库是 DICOM 的高墙,本集是墙上的门——门外站着 37.7 万张开箱即读的胸片,和一张写着"这些标签哪里可靠哪里不靠谱"的诚实说明书。
§1 身份卡:一张速览
MIMIC-CXR-JPG(MIMIC Chest X-ray JPG Database)是 MIT 计算生理学实验室(LCP)从母库 MIMIC-CXR v2.0.0 全量派生的图像加工层:把 377,110 张 DICOM 原始胸片转换为体积更小、开箱即用的 JPG 格式,并配套由 CheXpert 与 NegBio 两套开源 NLP 工具从自由文本报告中自动提取的 14 类结构化标签,外加一份官方推荐的 train/val/test 数据划分。它是 MIMIC-CXR 派生家族中承上启下的枢纽——上游承接 DICOM 母库,下游供养着从分类基准到指令微调的一整条数据集谱系。
| 字段 | 值 |
|---|---|
| 完整标题 | MIMIC-CXR-JPG - chest radiographs with structured labels |
| 当前版本 | v2.1.0(2024-03-12),首发版 v2.0.0(2019-11-14) |
| 版本 DOI | v2.1.0: 10.13026/jsn5-t979;v2.0.0: 10.13026/8360-t248;全版本: 10.13026/th9c-ae10 |
| 母项目 | MIMIC-CXR Database v2.0.0(DOI 10.13026/C2JT1Q,latest 10.13026/s5dg-6s42) |
| 发布方 | PhysioNet(MIT Laboratory for Computational Physiology 维护) |
| 访问级别 | Credentialed(PhysioNet Credentialed Health Data License 1.5.0 + DUA 1.5.0) |
| 训练门槛 | CITI “Data or Specimens Only Research” 课程 |
| 规模 | 377,110 张 JPG 胸片 / 227,827 份放射报告 / 65,383 名患者(2011-2016,BIDMC) |
| 标签 | 14 类 × 五值(正/负/不确定/不一致/未提及),双 labeler 自动生成 |
| 验证 | 687 份报告由 board-certified 放射科医生(8 年经验)人工标注对照 |
| 数据划分 | 官方 split:train 368,960 / val 2,991 / test 5,159 图像 |
| 论文 | arXiv 1901.07042(v1 2019-01-21,v5 2019-11-14),Johnson et al.,10 人 |
| 团队 | MIT LCP + Stanford + NIH NLM + BIDMC 四方;Stanford ML 组(Irvin/Rajpurkar)协助标签器 |
| 伦理 | BIDMC IRB 免知情同意豁免;HIPAA Safe Harbor 去标识 |
| 资助 | NIH-R01-EB017205 + Philips Healthcare(COI 明示) |
| 项目主页 | https://mimic-cxr.mit.edu |
| Topics | computer vision / chest x-ray / radiology / mimic / deep learning |
| Views | v2.1.0 页面 Project Views 5,337(Current Version 9,588) |
版本提醒:PhysioNet 上该数据集存在两个版本页(v2.0.0 与 v2.1.0),v2.1.0 于 2024-03-12 发布,在 v2.0.0 基础上新增两个文件(RECORDS 路径清单与 test-set-labeled.csv 人工标注),图像与 v2.0.0 标签完全未动。引用时建议注明具体版本 DOI。
§2 背景:为什么需要"第二份"胸片数据集
§2.1 放射科医生不够用,这是全球性问题
MIMIC-CXR-JPG 的官方页面与论文开篇都在讲同一个故事:胸片是世界上最常见的医学影像检查,但读片的人不够。论文 References 里铺了一排全球证据:利比里亚的放射诊断国别报告(Journal of Global Radiology 2015)、"千丘之国"卢旺达的影像服务报告(同刊 2015)、美国退伍军人事务部系统中"未读影像"的患者安全隐患(Journal of Digital Imaging 2017)、英国皇家放射学院"放射科医生短缺危及患者医疗"的警告(BMJ 2017)、以及美国县级层面的放射科医生分布分析——供给向大城市倾斜(JACR 2018 与 Radiology 2015 两篇)。这段引用组合在 2019 年是一种论证策略:先用全球卫生服务的现实困境立论,再把计算机视觉介绍为缓解手段。
§2.2 从 DICOM 到 JPG:一个务实的产品决策
母库 MIMIC-CXR 以 DICOM 格式发布图像——那是放射科的行业标准,但对计算机视觉研究者并不友好:DICOM 需要专门的解析库、存储体积大、像素值范围与窗宽窗位的概念也容易让非放射科背景的研究者踩坑。MIMIC-CXR-JPG 的核心动机就是把这个门槛拆掉:官方完成一次性的格式转换与标准化预处理,让研究者用任何语言的标准图像库就能读图。论文里说得很直白——目标是提供 MIMIC-CXR 的"convenient processed version"(便捷处理版),同时提供"standard reference for data splits and image labels"(数据划分与图像标签的标准参考)。
§2.3 第二个动机:终结"自造划分"的论文间不可比
在官方划分出现之前,同一批胸片数据上的论文各用各的 train/test 划分,指标之间没法比。MIMIC-CXR-JPG 把推荐划分(split.csv.gz)作为数据集的一等公民发布,等于给社区立了一个公平比较的标尺——这个"标准参考"的定位,让它即使对已经能自己处理 DICOM 的团队也有存在价值。
§2.4 历史伏笔:结构化标签不是新想法
页面 References 的第 11 条藏了一个漂亮的考古发现:1974 年 Radiology 上 Simon 等人的 “Computerized radiology reporting using coded language”——用编码语言做计算机化放射报告,整整 50 年前。用 NLP 把自由文本报告转回结构化标签(CheXpert/NegBio),某种意义上是把放射信息学半个世纪的轮回走完了一圈。2019 年的不同在于:报告规模是 22.7 万份,而不是当年一个科室的卡片盒。
§3 管线解剖:DICOM 怎么变成 JPG,报告怎么变成标签
§3.1 三步总装线
官方 Methods 把生产流程拆为三步:(1) DICOM 转 JPG;(2) 从每份报告提取结构化标签;(3) 制作元数据文件。图像与文本两条线独立处理,最后靠研究标识符对齐。
§3.2 图像线:五道工序
- 像素提取:用 pydicom 库从 DICOM 文件读出像素矩阵。
- 归一化:减去图像最低值、除以平移后最大值、截断、转无符号整数——把像素值压到 [0, 255]。
- 方向校正:读取 DICOM 的 PhotometricInterpretation 字段判断是否需要反转,保证肺内的空气呈白色(高像素值)、患者体外呈黑色(低像素值)——这一步决定了所有图像的灰度约定一致。
- 直方图均衡化:用 OpenCV 把 0-255 的像素值分布拉平,让每个灰度级出现频率近似相等,增强对比度。
- 压缩输出:OpenCV 以 quality factor 95 输出 JPG——一个刻意选高的质量参数,尽量压住有损压缩的信息损失。
直方图均衡化的双刃剑:官方预处理的目的是"让研究者不用自己搭预处理管线",同时保证所有论文用的是同一套标准化输入。但要注意:均衡化后的图像与临床 PACS 里看到的原图灰度分布不同,迁移到真实临床影像时存在分布差异——这是所有"预处理内嵌"数据集的共同代价。
§3.3 文本线:报告的半结构化模板
BIDMC 的放射报告是半结构化的,医生在固定标题的段落里书写,其中两个段落最关键:findings(图像重要发现的自然语言描述)与 impression(最紧要发现的简短总结)。模板总体一致,但界面不强制,随时间与医生个人习惯有漂移。227,943 份总报告中:82.4% 有 impression 段,12.5% 只有 findings 段,5.1% 两段皆无。
标签的取材优先级因此被定义为一个三级回退:先取 impression;没有则取 findings;两段皆无则取报告最后一节。
§3.4 NegBio:基于依存句法的否定与不确定性检测
NegBio(Peng et al., AMIA 2018)是开源规则工具:输入预先标记了医学发现提及(mention)的句子,输出每个提及是被否定、不确定还是确定。与旧方法不同,它用手写的启发式规则在句子的依存句法图上搜索,判断提及是否被否定线索(如 “no evidence of”)的句法辖域覆盖——而不是简单的窗口关键词匹配。
一个容易忽略的细节:MIMIC-CXR-JPG 里的 NegBio 使用的是 CheXpert 工具自定义的 mention patterns,与 NegBio 当年给 NIH ChestX-ray8/ChestX-ray14 打标时用的模式不同。也就是说,这份标签的"配方"是两套工具的杂交定制版,直接拿开源默认参数复现会有细微出入。
§3.5 CheXpert labeler:三阶段聚合
CheXpert labeler(Irvin et al., AAAI 2019)构建在 NegBio 之上,三阶段:
- 提取(extraction):识别 14 类发现的所有提及,包括异体拼写、同义词与缩写——例如 pneumothorax 还要抓 “pneumothoraces” 与 “ptx”。
- 分类(classification):用局部上下文把每个提及分为阳性、不确定或阴性。
- 聚合(aggregation):同一份报告可能多次提及同一发现,需要合并成一个标签。优先级:阳性 > 不确定 > 阴性——只要有阳性提及,整份报告该类就是阳性;若同时存在阴性与不确定提及,定为不确定。
“No Finding” 的特殊规则:只有当除 “Support Devices” 外的全部标签为阴性或未提及时,No Finding 才置 1。
严格子集效应:当两个 labeler 都无法为某研究导出任何标签时,该研究在标签 CSV 中不出现行——所以两个标签文件是 227,827 份研究的严格子集,行数少于研究总数不是数据丢失,而是设计如此。
§3.6 五值标签体系:承认 NLP 会犯错,且两个 NLP 会犯不同的错
最终标签是五值体系:阳性 / 阴性 / 不确定 / 不一致(disagreement)/ 未提及(blank)。其中"不一致"是 MIMIC-CXR-JPG 的特色设计——CheXpert 与 NegBio 对同一研究给出冲突标签时,不强行仲裁,而是明示冲突。这个设计把"规则式 NLP 的可靠性边界"直接编码进了数据:研究者可以自行决定对不一致样本的处置策略(丢弃、人工复核或建模为噪声标签)。
§4 标签验证:687 份报告与一条诚实的 F1 曲线
§4.1 验证设计
论文随机抽取 687 份报告(分层抽样保证各类病理覆盖充分),由一名 board-certified、8 年经验的放射科医生(论文署名 M.L.,即 Matthew Lungren)按 CheXpert 的 14 类标准人工标注,然后在三个任务上评估两个 labeler:提及提取(任何赋值都算正预测,空白算负预测)、否定检测(否定标签为正)、不确定性检测(不确定标签为正)。
§4.2 提及提取:常见病灶接近天花板
| 发现 | 精确率 | 召回率 | F1 | 阳性例数 |
|---|---|---|---|---|
| Pleural Effusion(胸腔积液) | 0.968 | 0.978 | 0.973 | 370 |
| Pneumothorax(气胸) | 0.945 | 0.995 | 0.970 | 226 |
| Pneumonia(肺炎) | 0.928 | 0.986 | 0.956 | 223 |
| Atelectasis(肺不张) | 0.893 | 1.000 | 0.944 | 218 |
| Consolidation(实变) | 0.886 | 0.979 | 0.930 | 95 |
| Fracture(骨折) | 0.870 | 0.940 | 0.904 | 50 |
| Support Devices(支持设备) | 0.823 | 0.974 | 0.892 | 234 |
| Edema(水肿) | 0.799 | 1.000 | 0.888 | 227 |
| Cardiomegaly(心影增大) | 0.814 | 0.910 | 0.859 | 235 |
| Lung Lesion(肺部病变) | 0.861 | 0.848 | 0.855 | 66 |
| Lung Opacity(肺部浑浊) | 0.715 | 0.907 | 0.800 | 194 |
| Pleural Other(其他胸膜异常) | 0.477 | 0.778 | 0.592 | 27 |
| No Finding(无发现) | 0.382 | 0.867 | 0.531 | 30 |
| Enlarged Cardiomediastinum(纵隔增宽) | 0.375 | 0.600 | 0.462 | 70 |
三个低谷各有结构性原因:Pleural Other 是"其他"杂项类,措辞五花八门;No Finding 是全称命题——要证明"什么都没提",一个漏掉的异常提及就会打翻,精确率 0.382 意味着它被大量过度触发;Enlarged Cardiomediastinum 的临床措辞变体最多、与心影增大的边界在报告里本就模糊。
§4.3 不确定性检测:规则式 NLP 的天花板
论文 Table 5 显示,不确定性检测的 F1 大多低于 0.5:Enlarged Cardiomediastinum 仅 0.065-0.069,Cardiomegaly 上 NegBio 0.237、CheXpert 为 0,Edema 0.169/0.207。相较之下否定检测介于两者之间。这组数字的学术影响被严重低估——它是后来大量工作把 MIMIC-CXR 标签当作 weak supervision 而非 ground truth 的学理源头:作者自己就把工具的短板量化给你看了。
§4.4 v2.1.0 的人工标注文件:把"考卷"也发给你
2024-03-12 的 v2.1.0 新增 mimic-cxr-2.1.0-test-set-labeled.csv——把上述放射科医生人工标注直接随数据集发布,并写明用途:“manually curated labels used for evaluation of CheXpert and NegBio”。同时新增的 RECORDS 文件(全图相对路径清单)支持用 wget 等工具按需下载子集。一个 2019 年的验证集,等了五年才作为可执行文件发布——数据集工程的"验证可复现"也讲究时机。
人工标注约定里有三条值得记住的细节:No Finding=1 仅当 impression 完全不提任何异常(包括 14 类之外的异常也算);支持设备不视为异常——只提设备的报告仍算 No Finding;语义不明(如 “no change from previous”)标为不确定 -1.0。
§5 划分、文件与获取
§5.1 官方划分
| 集 | 图像 | studies | 患者数* | 说明 |
|---|---|---|---|---|
| train | 368,960 | 222,758 | 64,588 | 全部其余研究 |
| validation | 2,991 | 1,808 | 500 | 随机 500 名患者全部研究 |
| test | 5,159 | 3,269 | 295 | 分层抽样保证病理覆盖 |
*患者数按 arXiv v2 版 Table 4 口径(合计 65,383)。
两个值得注意的分布事实:其一,test 集是分层抽样的产物,89.1% 的 studies 含阳性发现,而 train/val 只有 76-77%——test 集故意"富集"了病灶,让小类别的评估不至于颗粒度过粗;直接拿 test 指标与真实临床阳性率对照会误读。其二,划分按患者切割(同一患者不会横跨 train/test),避免同人研究的信息泄漏——这是后来所有医学影像数据集划分的默认礼仪。
§5.2 文件清单
| 文件 | 内容 |
|---|---|
| files/p10…/p19…/ | 10 个顶层文件夹,每个约 6,500 个患者子文件夹;路径形如 files/p10/p10000032/s50414267/02aa804e-…jpg |
| mimic-cxr-2.0.0-metadata.csv.gz | 图像级元数据:view position、患者朝向、匿名化采集时间(可排序) |
| mimic-cxr-2.0.0-split.csv.gz | 官方推荐 train/val/test 划分 |
| mimic-cxr-2.0.0-chexpert.csv.gz | CheXpert labeler 标签(一 study 一行,一发现一列) |
| mimic-cxr-2.0.0-negbio.csv.gz | NegBio labeler 标签(同上) |
| mimic-cxr-2.1.0-test-set-labeled.csv | (v2.1.0 新增)单放射科医生人工标注,labeler 评估用 |
| RECORDS / IMAGE_FILENAMES | (v2.1.0 新增)全图相对路径清单,支持按需下载(两处表述不同——见附录 D) |
§5.3 获取流程
Credentialed 访问的标准路径:注册 PhysioNet 账号 → 完成 CITI “Data or Specimens Only Research” 课程(对合作者逐一要求)→ 签署 DUA 1.5.0 → 等待 MIT LCP 审核通过(通常数日)→ 网页或 rsync/wget 下载。DUA 三条核心义务:不与他人共享数据、不尝试再识别个体、任何使用该数据的发表必须公开相应代码——最后一条是 MIMIC 家族的特色条款,也是"发表即开源"风气的制度推手之一。
§5.4 图像目录的命名密码
JPG 文件名不是乱码,而是 32 位十六进制哈希——用哈希替代患者信息出现在文件名里,是 HIPAA Safe Harbor 之外的一层额外保险。目录三层结构 = 患者前缀 / 患者 ID / study ID,一个 study(一次检查)下可含多张图像(正位+侧位)。
§6 家族图谱:九个派生条目的根节点
MIMIC-CXR-JPG 的独特身份是:它既是派生物(母库 MIMIC-CXR 的加工层),又是其他派生物的亲代。本库已收条目中,九个 MIMIC-CXR 系数据集构成一条清晰的三代谱系:
| 条目 | 本库 rid | 形态层 | 与 JPG 的关系 |
|---|---|---|---|
| MIMIC-CXR v2.0.0(母库,DICOM+报告) | 16(早期批次条目,其别名表已含 “MIMIC-CXR-JPG”) | 原始层 | JPG 的亲代 |
| MIMIC-CXR-JPG(本条目) | 617 | 加工层 | 家族枢纽——母库图像供给的物理实体 |
| CXR Cardiomegaly 数值层 | 606 | 数值层 | 源自母库 DICOM 与元数据 |
| CXR-Phone 翻拍照 | 607 | 照片层 | 翻拍母库/JPG 屏显图像 |
| CXR-PRO 净化报告 | 608 | 文本层 | 基于母库报告去 prior 引用 |
| Heart/Lung Segmentations | 610 | 掩码层 | 为 MIMIC-CXR/MIMIC-CXR-JPG 图像提供人工掩码 |
| Image Embeddings | 611 | 向量层 | 对母库全量图像逐图嵌入(CXR Foundation) |
| LATTE-CXR | 612 | 图文对齐层 | REFLLACX 派生,局部 bbox-语句对 |
| Lung Segment 图像对 | 613 | 分割图像对 | TernausNet 自动分割母库图像 |
| Lunguage 结构化报告基准 | 614 | 报告结构化层 | 母库 test 子集专家标注 |
| MIMIC-CXR-Ext-ILS | 616 | 指令分割层 | 母库图像+报告全自动生成指令对 |
§6.1 为什么 JPG 是"图像供给源"
母库叙事由本库 rid 16(MIMIC-CXR 主条目,早期批次生产)承载;本条目(617)是加工层的独立展开。对 2019-2021 年间的绝大多数研究团队,实际下载、存储与读入内存的图像就是 JPG 版本(全量约数百 GB 级,远小于 DICOM 版),下游数据集的图像标识符体系(文件名哈希、study/patient 目录结构)也沿用 JPG 版约定。因此在工程史的意义上,"MIMIC-CXR 上的 377,110 张图"对多数用户而言,物理实体就是 MIMIC-CXR-JPG。
§6.2 三代谱系的抽象阶梯
把九个条目按"离像素的距离"排开:DICOM 原始层(未单列)→ JPG 加工层(本条目)→ 数值层/掩码层/分割对/向量层(506/510/613/611)→ 图文对齐/指令分割/报告结构化(512/616/614)→ 照片层(607,反向回到物理世界)。这条阶梯是本库批次六"影像数据形态学之旅"的完整地图,而本条目是地图的坐标系原点。
§7 AI-Ready 十问
一问:什么格式? JPG 图像(quality 95,直方图均衡化后)+ gzip 压缩 CSV 元数据/标签 + 纯文本路径清单。零 DICOM 依赖,任何语言的标准图像库可直接读取。
二问:多大规模? 377,110 图 / 227,827 报告 / 65,383 患者;标签 CSV 两套(CheXpert/NegBio),官方三分划分。
三问:标注是什么性质? 全部为自动弱监督(规则式 NLP 从报告抽取),经 687 份报告人工验证;v2.1.0 附带人工标注子集。图像层面无人工像素级标注——需要掩码请走 610(心/肺人工掩码)或 613(自动分割对)。
四问:许可与门槛? Credentialed:License 1.5.0 + DUA 1.5.0 + CITI 课程。获取需要数天审核。发表必须公开代码是合同义务。
五问:伦理完备度? BIDMC IRB 免知情同意豁免+批准共享;HIPAA Safe Harbor 去标识;文件名哈希化;资助关系(Philips)与致谢(Stanford)全披露。
六问:数据质量的可复现性? 验证集(687 报告)的标注在 v2.1.0 随集发布;转换与标注代码开源(MIMIC-CXR Code Repository);页面明确记录 labeler 配方(NegBio 用 CheXpert patterns)——从 DICOM 到标签的每一步理论上可复现。
七问:标签的可信边界? 论文自报家门:常见病灶 F1 0.94-0.97 可放心用作弱监督;No Finding(0.531)、Enlarged Cardiomediastinum(0.462)、不确定性判断(多数 <0.5)需要谨慎设计——把 uncertain/disagreement 处理策略写进实验设计,而不是事后补救。
八问:适合什么任务? 多标签分类(官方标准用法)、弱监督定位、报告生成(配母库文本)、多模态预训练(配 611 嵌入或 512 对齐)、不确定性建模(五值标签天然支持)、领域自适应评估(test 集富集设计)。
九问:不适合什么? 像素级分割训练(无掩码)、确定性的"金标准"评估(标签是弱监督)、纵向结局研究(影像库而非队列)、需要原始窗宽窗位的定量影像组学(直方图均衡化不可逆)。
十问:一句话定位? 医学影像领域被引用最多的弱监督分类语料库——它的价值不在标签多准,而在把"标签多不准"也量化给你看。
DAIMS 评估:数据可得性 6(Credentialed 全流程公开)/ 标注 7(双 labeler+687 人工验证+五值设计)/ 方法 8(管线全开源可复现)/ 影响力 9(领域引用最广的弱监督语料)/ 规模 9(37.7 万图派生家族根节点)——DAIMS:7.8(论证散见 §3/§4/§7;对照:516 全自动指令分割 7.0、510 人工掩码 8.0)。
§8 误解与反直觉
误解一:“377,110 张图就是 377,110 份诊断。” 不。图像数 ≠ 报告数 ≠ 研究数:227,827 份报告对应 227,835 份母库研究(口径差 8),一个 study 可含正侧位多张图共享一份报告。任何"图像-报告对齐"实验都要先过 metadata.csv 的 study_id 关。
误解二:“结构化标签是医生标的。” 全部 14 类标签由规则式 NLP 自动生成;放射科医生只人工标注了 687 份验证报告。标签的正确说法是"报告的规则式再表达",不是"图像的专家标注"。
误解三:“F1 0.97 的标签可以当 ground truth。” Pleural Effusion 的 0.973 是 mention extraction 任务的成绩——即"报告里有没有提到",不是"图里有没有"。报告本身与影像表现也存在不一致(放射科的正常工作现象)。弱监督标签的误差会系统性传导进模型。
误解四:“No Finding=1 说明片子正常。” 三重陷阱:No Finding 的 F1 仅 0.531(过度触发严重);人工约定里只提支持设备的报告也算 No Finding;且它只约束"报告没提异常",与影像实际是否正常相去甚远。
误解五:“disagreement 标签是错误,应该清洗掉。” 相反——它是 CheXpert 与 NegBio 对同一报告冲突的诚实记录,是天然的噪声标签样本池与 labeler 改进评估基准。无脑删除等于扔掉数据集最有教学价值的部分。
误解六:“JPG 转换是无损的便捷化。” 直方图均衡化是不可逆的非线性变换;quality 95 的有损压缩同样如此。做定量影像组学或需要原始窗宽窗位的研究,应回到母库 DICOM。
误解七:“v2.1.0 是数据更新。” v2.1.0 没有动一张图、一个标签——只加了两个文件(RECORDS 路径清单与人工标注 CSV)。版本语义是"发布物更新"而非"数据更新"。
误解八:“官方 test 集与普通划分一样平衡。” test 集分层抽样富集病灶(89.1% studies 有发现 vs train 76-77%)。test 指标系统性高于真实临床分布下的表现,跨数据集比较时必须意识到这一点。
误解九:“标签 CSV 行数少于研究数说明文件缺损。” 两个 labeler 都无法导出标签的 study 不生成行——严格子集是设计。合并标签与元数据时用左连接,别用内连接。
误解十:“访问门槛只是形式。” CITI 课程对每位合作者都要求;DUA 的"发表必须开源代码"是可执行合同条款——历史上确有论文因此补传代码仓。
误解十一:“arXiv 1901.07042 就是母库论文。” 同一 arXiv 号 v1-v2 承载 MIMIC-CXR(母库)论文,v3-v5 改换为 JPG 论文——引用时按内容对准版本,母库正式发表版是 Scientific Data 2019;6:317。
误解十二:“五值标签可以直接喂给 BCE loss。” 五值不是二值:uncertain 与 disagreement 的处置(映射为负、丢弃、或单独建模)是实验设计的一部分,不同论文的选择不可直接比较。
§8.13 常见踩坑清单
| 坑 | 后果 | 避法 |
|---|---|---|
| 坑点1:图像数=报告数(377,110≠227,827) | 对齐实验口径错乱 | 经 metadata.csv 的 study_id 关联,勿按行号硬配 |
| 坑点2:标签当人工金标准 | 系统性误差进模型 | 标签=规则式 NLP 弱监督;读 §4 验证表定信心 |
| 坑点3:No Finding 当"正常" | F1 仅 0.531+支持设备特例 | 全称命题谨慎用;参照人工约定三条 |
| 坑点4:disagreement 当错误清洗 | 丢弃最有教学价值的样本 | 保留为噪声标签池与 labeler 审计基准 |
| 坑点5:五值直喂 BCE | uncertain 处置不声明 | §9.2 策略二选一并写进实验记录 |
| 坑点6:test 集指标当临床性能 | 89.1% 富集≠真实分布 | test 只做算法间比较,不做流行病学推断 |
| 坑点7:内连接标签与划分 | 静默丢严格子集缺行 | 左连接+缺行计数入报告 |
| 坑点8:跨库混合训练不管预处理 | 均衡化差异成混杂变量 | 与 ChestX-ray14 混训前先对齐预处理 |
§9 工作实例:十分钟搭起标准分类基线
§9.1 加载标签与划分(纯 pandas)
import pandas as pd
meta = pd.read_csv('mimic-cxr-2.0.0-metadata.csv.gz')
split = pd.read_csv('mimic-cxr-2.0.0-split.csv.gz')
chex = pd.read_csv('mimic-cxr-2.0.0-chexpert.csv.gz')
negbio= pd.read_csv('mimic-cxr-2.0.0-negbio.csv.gz')
labeled = pd.read_csv('mimic-cxr-2.1.0-test-set-labeled.csv') # v2.1.0
# 关键连接键:study_id(报告/标签层)与 dicom_id(图像层)
# 图像路径合成:files/p{patient_id 前 2 位去零}/p{patient_id}/s{study_id}/{文件名}
def img_path(row):
p = f"p{int(row['subject_id']):08d}"
s = f"s{int(row['study_id'])}"
return f"files/{p[:3]}/{p}/{s}/{row['dicom_id']}.jpg" # 注意 p 前缀截断规则以官方 RECORDS 为准
train = split[split.split == 'train'] # 222,758 studies
train_chex = train.merge(chex, on='study_id', how='left') # 左连接!严格子集会缺行
§9.2 五值标签的常见处置策略
LABELS = ['Enlarged Cardiomediastinum','Cardiomegaly','Lung Lesion','Lung Opacity',
'Edema','Consolidation','Pneumonia','Atelectasis','Pneumothorax',
'Pleural Effusion','Pleural Other','Fracture','Support Devices','No Finding']
# 策略 A(经典):uncertain(-1) 与 blank(NaN) 归为负,只训阳性 vs 阴性
y = (train_chex[LABELS] > 0).astype(int)
# 策略 B:三值建模,uncertain 单独成类
y = train_chex[LABELS].fillna(0) # blank -> 0
y[(y < 0) & (y > -1)] = 0.5 # 视具体编码而定,见 CSV 说明
§9.3 用 disagreement 池做标签质量审计
# CheXpert 与 NegBio 对同一 study 的冲突样本 = 教科书级噪声标签案例
diff = chex.merge(negbio, on='study_id', suffixes=('_cx','_nb'))
conflict = {l: (diff[f'{l}_cx'] != diff[f'{l}_nb']).sum() for l in LABELS}
§9.4 交叉引用本库其他条目
- 需要像素级心/肺掩码(人工金标准)→ 本库 rid 610(heart-lung-segmentations-data),掩码按 JPG 文件名对齐;
- 需要逐图 4,096 维嵌入(免 GPU 迁移特征)→ rid 611(image-embeddings-mimic-cxr),join 键 dicom_id;
- 需要指令微调语料(VLM 对齐)→ rid 616(mimic-cxr-ext-ils),其 191,563 图即本集子集;
- 需要净化报告文本(去 prior 引用)→ rid 608(cxr-pro);
- 需要报告结构化金标准 → rid 614(lunguage)。
实操提醒:直方图均衡化已内嵌于 JPG,若你的预训练权重(如 ImageNet 基线)期望自然图像分布,官方均衡化通常是正向的;但若从其他胸片库(如 NIH ChestX-ray14,未均衡化)迁移,需先对齐预处理,否则会混入"预处理差异"这个混杂变量——这恰是 CheXpert labeler 当年在 NIH 数据上用了不同 mention patterns 的同款问题:管线细节的不可比,比模型架构的差异更容易污染结论。
§10 FAQ:九十问速查
§10.1 身份与获取(10 问)
Q1:MIMIC-CXR-JPG 是什么?
A:MIT LCP 从母库 MIMIC-CXR v2.0.0 全量派生的图像加工层:377,110 张 JPG 胸片+14 类自动结构化标签+官方数据划分。
Q2:它和 MIMIC-CXR 是什么关系?
A:JPG 是 MIMIC-CXR 的 wholly derived 派生集——图像逐张来自母库 DICOM,标签来自母库自由文本报告,图像内容完全一致。
Q3:最新版本是哪个?
A:v2.1.0(2024-03-12)。首发 v2.0.0(2019-11-14);v2.1.0 仅新增 RECORDS 与 test-set-labeled.csv 两个文件。
Q4:DOI 怎么引?
A:版本 DOI:v2.1.0 为 10.13026/jsn5-t979,v2.0.0 为 10.13026/8360-t248;全版本 DOI 10.13026/th9c-ae10。
Q5:在哪里下载?
A:PhysioNet:physionet.org/content/mimic-cxr-jpg/,Credentialed 档位。
Q6:谁可以申请?
A:签署 DUA 的 credentialed 研究者;需完成 CITI ‘Data or Specimens Only Research’ 课程(每位合作者)。
Q7:要花钱吗?
A:数据本身免费——Credentialed 门槛是身份审核与用途承诺,不是付费墙。
Q8:审核要多久?
A:MIT LCP 审核 Credentialed 申请通常数个工作日; CITI 课程本身需数小时。
Q9:论文是哪篇?
A:arXiv 1901.07042(Johnson et al.,v1 2019-01-21,v5 2019-11-14),‘MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs’。
Q10:有项目主页吗?
A:有:mimic-cxr.mit.edu——含 labeler、代码仓与使用文档。
§10.2 规模与口径(10 问)
Q11:到底多少张图?
A:377,110 张 JPG——与母库 MIMIC-CXR v2.0.0 的 DICOM 图像一一同构。
Q12:多少份报告?
A:JPG 摘要口径 227,827 份(与图像关联);母库口径 227,835 studies;Methods 口径 227,943 份总报告——三口径并存,差 116 未由官方解释。
Q13:多少名患者?
A:按论文划分表:64,588 训练+500 验证+295 测试=65,383 名。
Q14:时间跨度?
A:2011-2016 年,全部来自贝斯以色列女执事医疗中心(BIDMC,波士顿)。
Q15:数据总量多大?
A:JPG 版全量约数百 GB(远小于 DICOM 版);官方提供 RECORDS 清单支持按需子集下载。
Q16:正侧位比例?
A:论文划分表:train 正位 67.3%/侧位 32.7%,侧位约占三分之一。
Q17:一个 study 多少张图?
A:平均约 1.65 张/研究:常见组合是正位+侧位成对,也有单图研究。
Q18:图像分辨率多少?
A:JPG 保留原始采集分辨率(不统一缩放),像素值归一化到 0-255 并直方图均衡化。
Q19:标签 CSV 覆盖多少研究?
A:严格子集:两个 labeler 都无法导出标签的 study 不生成行,行数少于 227,827 属设计而非缺损。
Q20:验证集人工标注有多少?
A:687 份报告(分层抽样),由 board-certified、8 年经验放射科医生标注,随 v2.1.0 发布。
§10.3 图像管线(10 问)
Q21:DICOM 怎么变成 JPG?
A:五道工序:pydicom 提取像素→归一化 [0,255]→按 PhotometricInterpretation 校正反转(空气白/体外黑)→OpenCV 直方图均衡化→quality 95 输出 JPG。
Q22:什么是直方图均衡化?
A:把像素值分布拉平、让每个灰度级频率近似相等的对比度增强——官方内嵌它以统一预处理,但也使其不可逆。
Q23:为什么选 quality 95?
A:刻意选高的压缩质量,尽量压住 JPG 有损压缩的信息损失——是存储体积与保真度的折中。
Q24:方向校正是自动的吗?
A:是——读取 DICOM 的 PhotometricInterpretation 字段判断,必要时反转,保证全体图像灰度约定一致。
Q25:文件名是什么含义?
A:32 位十六进制哈希(如 02aa804e-bde0afdd-…),以哈希替代患者信息出现在文件路径,是去标识外的又一层保险。
Q26:目录结构怎么组织?
A:files/p10/p10000032/s50414267/<hash>.jpg——患者前缀/患者ID/研究ID 三层;10 个顶层文件夹各约 6,500 患者。
Q27:metadata.csv 里有什么?
A:view position(PA/AP/侧位)、患者朝向、匿名化采集日期(可排序)等图像级元数据。
Q28:能用 JPG 做定量影像组学吗?
A:不建议——直方图均衡化与有损压缩都不可逆,定量特征应回到母库 DICOM。
Q29:图像与报告怎么对齐?
A:经 metadata.csv:每行一张图(dicom_id),指向所属 study_id;一份报告挂在该 study 上。
Q30:转换代码开源吗?
A:是——官方声明生成代码在 MIMIC-CXR Code Repository 公开,符合 DUA ‘发表必须开源’ 的自我履行。
§10.4 标签与 labeler(15 问)
Q31:14 类是哪 14 类?
A:No Finding/Enlarged Cardiomediastinum/Cardiomegaly/Lung Lesion/Lung Opacity/Edema/Consolidation/Pneumonia/Atelectasis/Pneumothorax/Pleural Effusion/Pleural Other/Fracture/Support Devices。
Q32:标签是人工的吗?
A:不是——全部由 CheXpert 与 NegBio 两套规则式 NLP 从报告自动提取;人工只标了 687 份验证报告。
Q33:什么是五值标签?
A:阳性/阴性/不确定/不一致(disagreement)/未提及(blank)——后两者是 MIMIC 系的特色:明示 labeler 冲突与沉默。
Q34:disagreement 怎么产生的?
A:CheXpert 与 NegBio 对同一 study 同一标签给出不同值时,标记为不一致——不仲裁,留给研究者处置。
Q35:CheXpert labeler 怎么工作?
A:三阶段:提取(含同义词与缩写,如 ptx)→分类(局部上下文定正/负/不确定)→聚合(正>不确定>负的优先级合并)。
Q36:NegBio 怎么工作?
A:规则+依存句法树:在句子依存图上搜索否定线索(如 ‘no evidence of’)的句法辖域,判断提及是否被否定/不确定覆盖。
Q37:两个 labeler 的关系?
A:CheXpert 构建在 NegBio 之上;本集中 NegBio 使用 CheXpert 的 mention patterns——与 NegBio 原生给 NIH ChestX-ray14 用的模式不同。
Q38:标签从报告哪一段取?
A:优先级:impression > findings > 报告最后一节;82.4% 有 impression、12.5% 仅 findings、5.1% 都没有。
Q39:‘No Finding’ 什么时候置 1?
A:仅当除 Support Devices 外全部标签为阴性或未提及;人工标注约定更严——报告提任何异常(含 14 类外)都不算。
Q40:为什么标签 CSV 行数少?
A:labeler 无法导出标签的 study 不生成行——严格子集设计;合并时用左连接。
Q41:报告是结构化的吗?
A:半结构化:固定标题模板(findings/impression)但不强制,存在时间漂移与个体差异。
Q42:训练集标签分布?
A:No Finding 33.0%/Support Devices 28.8%/Pleural Effusion 23.3%/Lung Opacity 22.3%(v5 论文口径)。
Q43:标签值里的 -1.0 是什么?
A:人工标注里表示 uncertain——如报告说 ‘no change from previous’ 这类无法判定的表述。
Q44:能把五值压成二值吗?
A:可以但要想清楚:经典做法是 uncertain/blank 归负(CheXpert 论文做法),也有丢弃或单独建模的——不同选择不可直接比较。
Q45:labeler 的 mention patterns 与 NIH 版有何不同?
A:本集统一用 CheXpert 自定义模式;NegBio 当年给 NIH ChestX-ray8/14 打标用的是自己的原生模式——两库标签不可直接互比。
§10.5 验证与质量(10 问)
Q46:687 份验证怎么抽的?
A:分层抽样保证各病理覆盖,随机抽取后由 board-certified 放射科医生(8 年经验,M.P.L.)按 14 类标注。
Q47:mention 提取最好的类?
A:Pleural Effusion F1 0.973/Pneumothorax 0.970/Pneumonia 0.956——常见病灶接近天花板。
Q48:mention 提取最差的类?
A:Enlarged Cardiomediastinum 0.462/No Finding 0.531/Pleural Other 0.592——杂项类与全称命题是规则式方法死穴。
Q49:不确定性检测表现如何?
A:最弱:多数 F1<0.5,最低 0.065——论文自己量化了短板,是后来’标签=弱监督’定位的学理源头。
Q50:否定检测表现如何?
A:介于两者之间——依存句法让否定线索的覆盖判断比较可靠,但仍有类间差异。
Q51:F1 是图像层面的吗?
A:不是——全部验证都在文本层面(labeler 输出 vs 医生对报告的标注),与影像真实表现之间还有一层报告-影像一致性鸿沟。
Q52:test-set-labeled.csv 是干嘛的?
A:v2.1.0 发布的人工标注(单放射科医生),用途写明:评估 CheXpert 与 NegBio 的性能——把’考卷’随数据集一起发。
Q53:人工标注有什么特别约定?
A:No Finding=1 仅当 impression 完全无异常(含 14 类外);支持设备不算异常;不明表述标 -1.0。
Q54:有 κ 一致性指标吗?
A:没有——单人标注,无标注者间一致性可算;这是与多人共识标注集(如 FDTooth 的 κ>0.9)的结构差异。
Q55:标签质量问题的社区共识?
A:普遍当作 weak supervision 使用;不确定/不一致样本的处置已成为方法论研究对象。
§10.6 划分与使用(10 问)
Q56:官方划分多大?
A:train 368,960 图/222,758 studies;val 2,991 图/1,808 studies(随机 500 患者全研究);test 5,159 图/3,269 studies。
Q57:test 集为什么阳性率高?
A:分层抽样富集:89.1% studies 有发现(train/val 76-77%)——为小类别评估保颗粒度,但与临床分布不可直接对照。
Q58:划分按什么切割?
A:按患者切割——同一患者不跨 train/test,防止同人泄漏;这是医学影像数据集的默认礼仪。
Q59:RECORDS 文件有什么用?
A:v2.1.0 新增:全图相对路径清单,可用 wget/curl 脚本化按需下载子集,不必拉全量。
Q60:IMAGE_FILENAMES 与 RECORDS 是同一个吗?
A:页面两处表述不同(Overview 叫 IMAGE_FILENAMES,Release Notes 叫 RECORDS)——指向同类清单,使用时以实际下载文件为准。
Q61:如何搭标准分类基线?
A:读 split.csv 定训练集→merge chexpert.csv(左连接)→五值按策略压值→按 RECORDS 路径读图→14 类多标签 BCE 训练。
Q62:view position 要过滤吗?
A:常见做法是分开 PA/AP/侧位建模或只训正位——view 是结构性混杂变量(Rubin 2018 曾证明其影响 AUC 数个百分点)。
Q63:可以只用子集吗?
A:可以——RECORDS 支持按需下载;标签 CSV 也可独立于图像先做文本层实验。
Q64:想拿掩码/嵌入/指令对去哪?
A:本库 rid 610(人工心/肺掩码)/611(4,096 维嵌入)/616(106 万指令对)——均与 JPG 文件名体系对齐。
Q65:发表时有什么义务?
A:DUA 条款:使用数据的发表必须公开相应代码;另需按官方 citation 格式引用数据集与论文。
§10.7 与派生家族(10 问)
Q66:哪些数据集建在它上面?
A:本库已收九个 MIMIC 系影像条目(rid 606-616 中的 606/607/608/610/611/612/613/614/616)在母库+JPG 之上形成谱系。
Q67:511 嵌入和 JPG 的对齐键?
A:dicom_id——嵌入集覆盖母库全部 377,110 图,与本集图像一一对应。
Q68:610 掩码和 JPG 怎么对齐?
A:掩码文件名即 JPG 文件名(heart/lung 两套,共 538 张),像素尺寸与对应 JPG 一致。
Q69:616 指令分割的图像源?
A:191,563 张图即母库/JPG 子集,掩码 PNG 与指令 JSON 以文件名哈希关联。
Q70:608 CXR-PRO 改了报告什么?
A:用 GILBERT 识别并改写报告中的 prior 引用(259,376→82,074 处),文本层净化——与本集的标签层互补。
Q71:614 Lunguage 用了哪部分?
A:母库 test 子集 1,473 份报告的专家结构化标注——与本集 NLP 标签是两代不同深度的结构化。
Q72:607 翻拍照的数据源?
A:对屏显影像翻拍模拟远程医疗场景——图像内容仍源自本家族。
Q73:512 LATTE 与本集关系?
A:REFLLACX(孙代)派生的局部图文对齐集——bbox-语句对 3,926 对,图像源追溯到母库。
Q74:家族里谁是’原始层’?
A:MIMIC-CXR v2.0.0(DICOM+报告,本库未单列)——本条目(617)是其加工层代理与家族叙事锚点。
Q75:为什么派生集都选 Credentialed?
A:派生物继承母体门槛——与 PHI 的距离不改变来源数据的合规属性(506/510 两个 ODC-BY 例外是人工增量标注的独立许可设计)。
§10.8 伦理与合规(8 问)
Q76:IRB 审查是什么情况?
A:BIDMC IRB 审查并批准数据共享计划,豁免知情同意——回顾性去标识研究的标准路径。
Q77:去标识到什么程度?
A:HIPAA Safe Harbor:移除 18 类直接标识符;文件名哈希化;采集日期匿名化为相对时间。
Q78:烧在图像上的文字怎么处理?
A:JPG 转换管线配合 OCR(页面引用 Tesseract)检测文本烧除——PHI 移除在母库层完成,JPG 层继承。
Q79:DUA 的三条核心义务?
A:不共享数据、不尝试再识别、发表必须公开代码。
Q80:可以商用吗?
A:Credentialed License 1.5.0 限研究用途;商业应用需另行授权路径。
Q81:数据会被撤回吗?
A:PhysioNet 有既定撤回政策;本研究历史稳定(2019 至今无撤回事件)。
Q82:有利益冲突声明吗?
A:有——Philips Healthcare 资助 MIT LCP 创建本资源,页面 COI 段明示;致谢 Stanford ML 组运行 CheXpert labeler。
Q83:再分发衍生数据可以吗?
A:不可直接再分发原始图像/报告;派生统计与模型的共享条款以 DUA 1.5.0 原文为准——发布嵌入/掩码类派生集均需各自过审。
§10.9 研究设计(7 问)
Q84:弱监督标签下能声称 SOTA 吗?
A:只能说’在 MIMIC-CXR-JPG 官方划分与标签下’——不同标签处置策略(uncertain 映射差异)会让 SOTA 不可比。
Q85:用 test-set-labeled.csv 能做什么?
A:评估你的模型标签/自训 labeler 与放射科医生的差异;或审计 CheXpert/NegBio——它是 labeler 层的基准。
Q86:多标签不平衡怎么办?
A:看分布:No Finding 33% 而 Lung Lesion 极少——用 per-class AUC 与重采样/ focal loss,别只看 micro 指标。
Q87:需要报告生成任务怎么办?
A:本集只有标签没有报告全文——报告文本在母库 MIMIC-CXR;本集提供官方图像侧划分。
Q88:迁移到本院数据要注意什么?
A:三个分布差:直方图均衡化、JPG 压缩、BIDMC 人群与设备——逐项消融才可归因。
Q89:纵向建模可行吗?
A:metadata 的匿名化日期支持同一患者多次检查的时序排列——但影像库非结局队列,结局变量请配 MIMIC-IV。
Q90:引用时最容易犯的错?
A:把 arXiv 1901.07042 全部归为’母库论文’(v1-v2 是母库版 v3-v5 是 JPG 版);以及忘记区分三口径报告数——按内容与版本对准引用。
§11 事实清单:两百条核查记录
§11.1 身份与版本(20 条)
- 完整挂牌名:MIMIC-CXR-JPG - chest radiographs with structured labels
- 当前版本 v2.1.0,发布日 2024-03-12
- 首发版本 v2.0.0,发布日 2019-11-14
- v2.1.0 版本 DOI:10.13026/jsn5-t979
- v2.0.0 版本 DOI:10.13026/8360-t248
- 全版本 DOI(latest):10.13026/th9c-ae10
- 母项目:MIMIC-CXR Database v2.0.0(DOI 10.13026/C2JT1Q,latest 10.13026/s5dg-6s42)
- 发布平台:PhysioNet(Credentialed 档位)
- 访问级别:Credentialed(License 1.5.0 + DUA 1.5.0)
- 训练门槛:CITI ‘Data or Specimens Only Research’ 课程
- 维护方:MIT Laboratory for Computational Physiology
- 项目主页:https://mimic-cxr.mit.edu
- Topics:computer vision / chest x-ray / radiology / mimic / deep learning
- v2.1.0 页面 Project Views:5,337
- v2.0.0 页面 Project Views:4,251(双口径存照)
- Current Version Views:9,588
- 官方定位:母库的 convenient processed version + 数据划分与标签的标准参考
- v2.1.0 页面 Abstract 仍自称 ‘Database v2.0.0’(页面笔误存照)
- RECORDS(Release Notes)与 IMAGE_FILENAMES(Overview)同页异名存照
- v2.1.0 相对 v2.0.0 零数据变更:只加两个文件
§11.2 规模与口径(20 条)
- 图像总数:377,110 张 JPG
- 图像与母库 DICOM 完全一致(官方声明 ‘images are identical to MIMIC-CXR v2.0.0’)
- 报告数(JPG Abstract 口径):227,827 份
- 研究数(母库 Abstract 口径):227,835 studies
- 总报告数(JPG Methods 口径):227,943 份
- 三口径差 116-116 份,官方未解释(对账表见附录 C)
- 时间窗:2011-2016 年
- 来源机构:Beth Israel Deaconess Medical Center(BIDMC),波士顿
- 患者总数(论文划分表加总):65,383
- 训练集患者:64,588
- 验证集患者:500(随机抽样,全部研究入集)
- 测试集患者:295(分层抽样)
- 去标识标准:HIPAA Safe Harbor,PHI 全移除
- 图像用途声明:image understanding / NLP / decision support
- 顶层文件夹 10 个(p10-p19)
- 每顶层文件夹约 6,500 个患者子文件夹
- 图像文件名:32 位十六进制哈希
- 目录三层:患者前缀/患者 ID/研究 ID
- 侧位占比:train 32.7%(248,285 正位/120,756 侧位,v2 论文表)
- 每研究平均约 1.65 张图
§11.3 论文与团队(20 条)
- 论文:arXiv 1901.07042 ‘MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs’
- 论文 v1 提交:2019-01-21;v5(当前版):2019-11-14
- v5 与 v2.0.0 数据集同日发布(2019-11-14)
- 同号演化:arXiv v1-v2 标题为 MIMIC-CXR(母库论文),v3-v5 改为 JPG 论文
- 母库正式发表版:Scientific Data 2019;6:317(DOI 10.1038/s41597-019-0244-5)
- 作者 10 人,一作兼通讯:Alistair E. W. Johnson(MIT)
- 共同作者:Tom J. Pollard(MIT)/ Nathaniel R. Greenbaum / Matthew P. Lungren(Stanford)
- 共同作者(续):Chih-ying Deng / Yifan Peng / Zhiyong Lu(NIH NLM)
- 共同作者(续 2):Roger G. Mark(MIT)/ Seth J. Berkowitz(BIDMC)/ Steven Horng(BIDMC)
- 机构四方:MIT LCP + Stanford + NIH NLM + BIDMC
- 人工验证标注者:Matthew P. Lungren(board-certified,8 年经验)
- 致谢:Stanford ML Group + Stanford AIMI(Jeremy Irvin / Pranav Rajpurkar)协助运行 CheXpert labeler
- 致谢:BIDMC 持续协作
- 资助:NIH-R01-EB017205(NIH 国家生物医学成像与生物工程研究所口)
- 资助(续):Philips Healthcare 资助 MIT LCP——COI 明示
- COI 原文:‘Philips Healthcare supported the creation of this resource’
- PhysioNet 支持方:NIBIB(页面页脚)
- 论文结论定性:标签为弱监督,工具短板自量化
- Johnson 同期另一作品:MIMIC Code Repository(JAMIA 2018)——可复现性基建
- 数据集与论文的引用关系:PhysioNet 页面 References [12] 即 JPG 论文本身
§11.4 图像管线(20 条)
- 管线三步:DICOM→JPG;报告→标签;元数据制作
- 图像与文本两线独立处理,最后按研究标识对齐
- 像素提取库:pydicom
- 归一化:减最低值→除平移后最大值→截断→无符号整数,压入 [0,255]
- 方向判定字段:DICOM PhotometricInterpretation
- 灰度约定:肺内空气呈白色(高值)、患者体外呈黑色(低值)
- 对比度增强:OpenCV 直方图均衡化(灰度级频率近似相等)
- 压缩参数:JPG quality factor 95(刻意选高)
- 均衡化不可逆——定量组学应回母库 DICOM
- 页面引用编号错位存照:Methods 称 ‘pydicom library [10]’ 而 [10] 实为 ChestX-ray8
- 文本烧除背景引用:Tesseract OCR(Smith 2007 ICDAR)
- JPG 化动机:拆掉 DICOM 门槛(专门解析库/大体积/窗宽窗位概念)
- 官方预处理内嵌=研究者免搭管线+全社区输入分布统一
- 预处理差异是跨库迁移的头号混杂变量
- 官方转换代码开源(MIMIC-CXR Code Repository)
- 图像层无人工标注——像素级标注需走 rid 610/613
- 图像质量可复现:同一 DICOM 输入经官方管线输出确定
- 存储友好:RECORDS 支持脚本化子集下载
- 直方图均衡化与 NIH ChestX-ray14(未均衡化)不可直接混合训练
- 图像层与报告层的对齐键:metadata.csv 的 study_id/dicom_id
§11.5 报告结构与标签(20 条)
- 报告为半结构化模板:固定标题但不强制
- 两个关键段落:findings(详细描述)与 impression(简短总结)
- 82.4% 报告有 impression 段
- 12.5% 仅 findings 段
- 5.1% 两段皆无(取材回退到报告最后一节)
- 取材优先级:impression > findings > 最后一节
- 14 类标签完整清单:No Finding/Enlarged Cardiomediastinum/Cardiomegaly/Lung Lesion/Lung Opacity/Edema/Consolidation/Pneumonia/Atelectasis/Pneumothorax/Pleural Effusion/Pleural Other/Fracture/Support Devices
- 五值标签:阳性/阴性/不确定/不一致(disagreement)/未提及(blank)
- disagreement=CheXpert 与 NegBio 冲突的明示记录
- CheXpert 三阶段:提取→分类→聚合
- 聚合优先级:阳性>不确定>阴性
- 正+负共现→取正;负+不确定→取不确定
- 同义词/缩写覆盖示例:pneumothorax→pneumothoraces/ptx
- ‘No Finding’ 规则:除 Support Devices 外全阴/未提才置 1
- NegBio 机制:依存句法图上搜索否定线索句法辖域
- 否定线索例:‘no evidence of’
- 本集 NegBio 使用 CheXpert 自定义 mention patterns
- 该配方≠NegBio 原生用于 NIH ChestX-ray8/14 的模式
- 标签 CSV 为母库研究的严格子集(无法导出即无行)
- 两个标签 CSV 均一 study 一行、一发现一列
§11.6 验证与质量(30 条)
- 验证规模:687 份报告
- 抽样方式:分层抽样保证病理覆盖
- 标注者:board-certified 放射科医生,8 年经验(M.P.L.)
- 标注标准:CheXpert 14 类
- 三任务评估:提及提取/否定检测/不确定性检测
- 提及提取 F1 冠军:Pleural Effusion 0.973(370 例)
- 亚军:Pneumothorax 0.970(226 例)
- 季军:Pneumonia 0.956(223 例)
- Atelectasis F1:0.944(218 例)
- Consolidation F1:0.930(95 例)
- Fracture F1:0.904(50 例)
- Support Devices F1:0.892(234 例)
- Edema F1:0.888(召回率 1.000)
- Cardiomegaly F1:0.859(235 例)
- Lung Lesion F1:0.855(66 例)
- Lung Opacity F1:0.800(194 例)
- Pleural Other F1:0.592(27 例)
- No Finding F1:0.531(精确率仅 0.382)
- Enlarged Cardiomediastinum F1:0.462(最差,70 例)
- 不确定性检测多数 F1<0.5(最低 0.065-0.069)
- Cardiomegaly 不确定性:NegBio 0.237 / CheXpert 0
- Edema 不确定性:0.169/0.207
- 验证全部在文本层面——不含影像真值对照
- 人工标注约定:No Finding=1 需 impression 完全无异常(含 14 类外)
- 人工标注约定:支持设备不算异常
- 人工标注约定:语义不明(如 ‘no change from previous’)→ -1.0
- 单人标注——无标注者间 κ 可算
- v2.1.0 把人工标注随集发布(mimic-cxr-2.1.0-test-set-labeled.csv)
- '考卷发布’与数据首发相隔约五年(2019 验证→2024 发布)
- 弱监督定位的学理源头:论文自报工具短板
§11.7 划分与分布(20 条)
- 官方划分文件:mimic-cxr-2.0.0-split.csv.gz
- train:368,960 图 / 222,758 studies
- validation:2,991 图 / 1,808 studies
- test:5,159 图 / 3,269 studies
- test 集分层富集:89.1% studies 有发现(train/val 76-77%)
- 划分按患者切割——防同人泄漏
- train 标签分布:No Finding 33.0%
- train 标签分布:Support Devices 28.8%
- train 标签分布:Pleural Effusion 23.3%
- train 标签分布:Lung Opacity 22.3%
- arXiv v2 表(CXR 时期)与 v5 表(JPG 时期)划分数字微调(369,188/2,732/5,239 vs 368,960/2,991/5,159)
- 验证集=随机 500 患者全部研究
- 测试集=分层抽样研究集合
- test 富集设计使 test 指标高于临床真实分布下的预期
- 五值处置策略差异是跨论文比较的头号坑
- 官方 split 的语义:推荐划分(standard reference)——非强制但已成社区默认
- metadata 支持同一患者多次检查的时序排列(匿名日期可排序)
- 纵向结局研究需另配 MIMIC-IV 等临床库
- view position 是结构性混杂变量(Rubin 2018:PA/AP/侧位分模态建模提升 AUC 0.031)
- 多标签任务的正确指标姿势:per-class AUC 优先于 micro
§11.8 获取与合规(20 条)
- DUA 三条款:不共享/不再识别/发表必须公开代码
- '发表必须开源’是可执行合同条款(MIMIC 家族特色)
- CITI 课程要求覆盖每位合作者
- 审核方:MIT LCP(通常数个工作日)
- License:PhysioNet Credentialed Health Data License 1.5.0
- DUA 版本:PhysioNet Credentialed Health Data Use Agreement 1.5.0
- 研究用途限定——商用需另行授权
- 再分发限制:原始图像/报告不可直接再分发
- 派生集(嵌入/掩码等)需各自过 PhysioNet 审核上架
- 伦理:BIDMC IRB 免知情同意豁免+批准共享
- 文件名哈希化=Safe Harbor 之外的额外保险
- 匿名日期保留时序可用性
- 页面匿名访问显示 ‘Data Not Available’(区域/登录状态提示)——正常现象
- Credentialed 的哲学:与 PHI 的距离决定门槛而非匿名程度
- 母库 MIMIC-CXR 页面 Views 5,758(对照)
- 使用免费——门槛是身份审核与承诺而非付费
- 违规后果:PhysioNet 有撤回与封禁机制
- 历史稳定性:2019 至今无撤回事件
- DUA 与 License 每次大版本随 PhysioNet 政策演进(1.4→1.5)
- 引用义务:官方 citation 格式含数据集 DOI 与论文
§11.9 家族与互链(20 条)
- 谱系地位:母库 MIMIC-CXR(未单列)→本集(617)→九个派生条目
- rid 606 cxr-cardiomegaly:母库数值层(CTR 标志物)
- rid 607 cxr-phone:屏显翻拍照片层
- rid 608 cxr-pro:报告净化文本层(prior 引用 259,376→82,074)
- rid 610 heart-lung-segmentations-data:538 张人工掩码(心 338+肺 200)
- rid 611 image-embeddings-mimic-cxr:377,110 图逐图 4,096 维嵌入(CXR Foundation)
- rid 612 latte-cxr:局部图文对齐(bbox-语句 3,926 对+眼动 13,751 对)
- rid 613 lung-segment-mimic-cxr:1,141 对自动分割图像对
- rid 614 lunguage:test 子集 1,473 份专家结构化报告
- rid 616 mimic-cxr-ext-ils:191,563 图+1,065,621 指令对+91,301 掩码
- 家族抽象阶梯:像素→图像→掩码/数值/向量→对齐/指令/结构化报告→照片(反向)
- 本集是家族图像供给的物理实体(对多数用户)
- 派生集普遍继承 Credentialed 门槛
- 例外:506/510 用 ODC-BY 1.0(人工增量标注独立许可)
- 512 为 Restricted(注册+DUA 免 CITI)——门槛光谱中间态
- 家族横跨 Open/Restricted/Credentialed 三档——派生距离不改变合规属性
- 本集+母库构成批次六’形态学之旅’的坐标系原点
- 511 的 377,110 与本集图像一一同构(join 键 dicom_id)
- 610 掩码文件名即 JPG 文件名(对齐零成本)
- 616 的 191,563 图为本集子集
§11.10 页面瑕疵与存照(20 条)
- 瑕疵一:v2.1.0 页面 Abstract 仍自称 ‘Database v2.0.0’
- 瑕疵二:227,835/227,827/227,943 三口径并存
- 瑕疵三:RECORDS vs IMAGE_FILENAMES 同页异名
- 瑕疵四:pydicom 引用编号 [10] 错位([10] 实为 ChestX-ray8)
- 瑕疵五:Views 双口径(4,251 vs 5,337)
- References 共 13 条(页面)
- 历史锚:Simon et al. 1974 Radiology——计算机化报告编码语言
- 全球卫生叙事引用:利比里亚/卢旺达/VA/英国 RCM/美国县级分布
- CheXpert 引用:Irvin et al. AAAI 2019([8])
- NegBio 引用:Peng et al. AMIA 2018([9])
- ChestX-ray8 引用:Wang et al. CVPR 2017([10])
- Release Notes 里 [12] 即 JPG 论文(人工标注评估出处)
- JPG 无独立 Scientific Data 正式版——正式版是母库的(Sci Data 2019;6:317)
- 页面 ‘Works Cited’ 字样未出现(引用结构以 References 段为准)
- v2.0.0 页与 v2.1.0 页的 DOI/Views/Abstract 均有细节差异——引用时以所用版本页为准
- 三口径现象的教学价值:派生链上每层有自己的’总数’语义
- 页面瑕疵核查方法:curl 实测两版本页+母库页三方对照
- 存照纪律:本库条目对矛盾数字一律并列引用不擅自仲裁
- 官方 FAQ/教程:PhysioNet tutorials 含 MIMIC-CXR 使用示例
- 批次七生产视角:本条目为 517 号(预期 rid 617)
§12 术语表:五十条
1. MIMIC-CXR —— BIDMC 2011-2016 的胸片 DICOM 母库+自由文本报告,本集的唯一数据来源
2. MIMIC-CXR-JPG —— 本条目:母库的 JPG 加工层+结构化标签+官方划分
3. BIDMC —— Beth Israel Deaconess Medical Center,哈佛医学院教学医院,MIMIC 全家族的数据源
4. MIT LCP —— MIT 计算生理学实验室,MIMIC 家族维护方与 PhysioNet 运营核心
5. PhysioNet —— MIT 主导的生理与临床数据资源平台,Credentialed 访问体系的运营方
6. Credentialed —— PhysioNet 三档访问的中间档:身份审核+DUA+CITI 课程
7. DUA —— Data Use Agreement 1.5.0:数据使用协议,含’发表必须开源代码’条款
8. CITI —— Collaborative Institutional Training Initiative,人类受试者保护课程体系
9. HIPAA Safe Harbor —— 美国 HIPAA 隐私规则的去标识标准:移除 18 类直接标识符
10. DICOM —— 医学数字成像与通信标准,放射科原生格式
11. JPG/JPEG —— 有损压缩图像格式;本集以 quality 95 输出
12. PhotometricInterpretation —— DICOM 字段:像素明暗解释约定,用于方向校正判断
13. 直方图均衡化 —— 拉平灰度分布的对比度增强变换;本集内嵌且不可逆
14. quality factor 95 —— JPG 压缩质量参数,0-100 取 95=低损失高压缩率的折中
15. CheXpert —— Stanford 的大型胸片数据集与本库引用的 labeler 同名工具(AAAI 2019)
16. CheXpert labeler —— 规则式 NLP 标注器:三阶段(提取/分类/聚合)从报告生成 14 类标签
17. NegBio —— 规则式否定与不确定性检测器(AMIA 2018),基于依存句法树
18. mention patterns —— labeler 中识别发现的词表与同义词规则集——不同数据集配方不同
19. disagreement —— 五值标签之一:两个 labeler 对同一研究结论冲突时的明示记录
20. weak supervision —— 弱监督:标签由自动流程生成、含系统性噪声,需在建模中显式处理
21. impression —— 报告的关键段落:最紧要发现的简短总结;标签取材第一优先
22. findings —— 报告的关键段落:图像发现的自然语言详细描述;标签取材第二优先
23. study —— 一次影像检查单元:可含正/侧位多张图,对应一份报告
24. view position —— 投照体位(PA/AP/侧位等):结构性混杂变量,建模常需分层
25. train/val/test split —— 官方推荐数据划分(split.csv.gz):按患者切割,test 分层富集
26. stratified sampling —— 分层抽样:保证各病理类别在样本中有足够代表——test 集的设计
27. F1 score —— 精确率与召回率的调和平均:labeler 验证的核心指标
28. No Finding —— 14 类之一:全称命题标签(‘报告未提任何异常’),F1 仅 0.531
29. Enlarged Cardiomediastinum —— 纵隔增宽:14 类中 mention F1 最差(0.462)——措辞变体最多的类别
30. Support Devices —— 支持设备类:起搏器/引流管等;人工标注约定中不算’异常’
31. uncertain (-1.0) —— 人工标注值:语义不明(如 ‘no change from previous’)时的编码
32. test-set-labeled.csv —— v2.1.0 新增:放射科医生人工标注,labeler 评估基准
33. RECORDS —— v2.1.0 新增:全图相对路径清单,支持按需子集下载
34. arXiv 1901.07042 —— 本集论文(v5)与母库论文(v1-v2)共用的 arXiv 编号
35. Scientific Data 2019;6:317 —— 母库 MIMIC-CXR 的正式发表版(DOI 10.1038/s41597-019-0244-5)
36. CXR Foundation —— Google 的胸片嵌入模型(EfficientNet-L2/SupCon)——rid 611 嵌入的生成器
37. TernausNet —— U-Net 变体分割网络——rid 613 自动分割对的生产模型
38. GILBERT —— BioBERT token 级 NER——rid 608 报告净化的提取引擎
39. MIMIC Code Repository —— MIMIC 家族的开源代码仓(JAMIA 2018):可复现性基建
40. Rubin 2018 —— 按 view position 分模态建模的研究:证明体位是结构性混杂变量
41. DualNet —— Rubin 2018 的正侧位双流架构:多视图融合的早期基线
42. per-class AUC —— 多标签分类的正确指标姿势:按类别报告 AUC 而非只看 micro 平均
43. labeler 审计 —— 用 disagreement 池与人工标注子集系统评估自动标签质量的方法
44. 同号双论文 —— 本条目存照概念:arXiv 1901.07042 v1-v2 与 v3-v5 承载两篇不同论文
45. 三口径对账 —— 本条目存照概念:227,835(母库 studies)/227,827(关联报告)/227,943(Methods 总数)
46. 图像供给枢纽 —— 本条目定位概念:对多数用户,'MIMIC-CXR 的图’的物理实体即本集
47. 形态学之旅 —— 本库批次六元主题:MIMIC-CXR 家族七形态(数值/照片/文本/掩码/向量/对齐/指令)
48. 根节点 —— 谱系术语:本集是九个派生条目共同祖先的代理条目
49. 严格子集 —— 标签 CSV 的行集语义:labeler 无法导出的研究不生成行
50. 左连接 —— 合并标签与划分时的正确姿势——内连接会静默丢失缺行研究
§10.10 批次七生产视角(5 问)
Q91:本条目在批次七的排位?
A:2/10(order 517),紧跟 516 MIMIC-CXR-Ext-ILS 之后——先发派生、后立根节点,叙事上是"先见森林、后立坐标"。
Q92:为什么 517 值得排在派生条目之后?
A:批次六已收九个派生条目,本条目作为根节点代理落位后,家族叙事从"点状收录"升级为"完整谱系"——互链结构随之闭环。
Q93:本条目的核查轮次?
A:3 轮——v2.0.0 页全量、v2.1.0 页+母库页对照、arXiv v1-v5 论文链与多源交叉;发现三口径、五瑕疵、同号双论文三大存照。
Q94:本条目与其他 MIMIC 主条目(如 MIMIC-IV)的关系?
A:同属 MIMIC 家族但影像/临床分册;队列层结局变量在 MIMIC-IV/III,影像+报告在本家族——纵向研究需两侧 join。
Q95:一句话总结本条目?
A:医学影像弱监督的坐标系原点——37.7 万图、14 类五值、诚实的 F1 曲线,以及一个家族九形态的共同开端。
§11.10 流水线与发布存照(15 条)
- 生产序号:批次七 2/10(order 517,预期 rid 617)
- FACTS.md:writing/mimic-cxr-jpg/FACTS.md(三轮核查全录)
- 核查快照:/tmp/517_page.html(v2.0.0 页)/ /tmp/517_page_v210.html(v2.1.0 页)
- 组装:四块(part1 正文 203/part2 正文 131/part3 程序化 724/part4 附录 119)+ §10.10/§11.10 补丁
- 预判修正一:报告数 227,835→三口径并存(827/943/835 各守其义)
- 预判修正二:版本 v2.0.0 止步→v2.1.0 最新(2024-03-12 增量版)
- 存照一:三口径对账(附录 C)
- 存照二:同号双论文(附录 A)
- 存照三:页面瑕疵五例(附录 D)
- 家族定位:九个派生条目(606-616)的共同根节点代理——母库主条目实为 rid 16(早期批次,别名已含 JPG),查重命中后修正谱系表
- 双检:check_md + preflight_check(发布前执行)
- 查重:url_name=‘mimic-cxr-jpg’ 精确匹配(发布前)
- 互链计划:606/607/608/610/611/612/613/614/616 九条回链
- 类目:医学影像(X光影像/图像分类)
- Access 实测:Credentialed(License 1.5.0+DUA 1.5.0+CITI)——批次预判命中
附录 A:版本史双线对照
数据集版本线(PhysioNet)
| 版本 | 日期 | 版本 DOI | 变更 |
|---|---|---|---|
| v2.0.0 | 2019-11-14 | 10.13026/8360-t248 | 首发:377,110 JPG + 双 labeler CSV + split + metadata |
| v2.1.0 | 2024-03-12 | 10.13026/jsn5-t979 | 新增 RECORDS 与 mimic-cxr-2.1.0-test-set-labeled.csv;数据零变更 |
论文版本线(arXiv 1901.07042)
| 版本 | 日期 | 标题指向 | 备注 |
|---|---|---|---|
| v1 | 2019-01-21 | MIMIC-CXR(母库论文) | 383 KB |
| v2 | 2019-01-23 | MIMIC-CXR(母库论文) | 划分表:369,188/2,732/5,239 图 |
| v3 | 2019-11-12 | 改换为 JPG 论文 | 135 KB(大改) |
| v4 | 2019-11-13 | JPG 论文 | — |
| v5 | 2019-11-14 | MIMIC-CXR-JPG(本集论文) | 与 v2.0.0 数据集同日发布 |
同号双论文演化:引用时按内容对准版本——研究母库文本/DICOM 用 v1-v2 或 Sci Data 2019;6:317;研究 JPG 层/标签层用 v5。
附录 B:14 类标签全景表(F1 + 训练分布 + 人工约定)
| # | 标签 | mention F1 | 阳性例数(验证集) | 训练集阳性占比 | 特殊说明 |
|---|---|---|---|---|---|
| 1 | No Finding | 0.531 | 30 | 33.0%(为 1) | 全称命题;人工约定"支持设备不算异常" |
| 2 | Enlarged Cardiomediastinum | 0.462 | 70 | — | 措辞变体最多,mention F1 垫底 |
| 3 | Cardiomegaly | 0.859 | 235 | — | 不确定性 F1:NegBio 0.237/CheXpert 0 |
| 4 | Lung Lesion | 0.855 | 66 | — | 小类别 |
| 5 | Lung Opacity | 0.800 | 194 | 22.3% | 不确定性未评估(无标注案例) |
| 6 | Edema | 0.888 | 227 | — | 召回率 1.000 |
| 7 | Consolidation | 0.930 | 95 | — | — |
| 8 | Pneumonia | 0.956 | 223 | — | — |
| 9 | Atelectasis | 0.944 | 218 | — | — |
| 10 | Pneumothorax | 0.970 | 226 | — | 同义词覆盖:ptx/pneumothoraces |
| 11 | Pleural Effusion | 0.973 | 370 | 23.3% | 验证集最大类 |
| 12 | Pleural Other | 0.592 | 27 | — | "其他"杂项类 |
| 13 | Fracture | 0.904 | 50 | — | — |
| 14 | Support Devices | 0.892 | 234 | 28.8% | 人工约定不算异常 |
五值编码含义:1=阳性;0=阴性;-1=不确定(人工标注);disagreement=双 labeler 冲突;空白=未提及/未导出。
附录 C:三口径对账表
| 口径 | 数字 | 出处 | 语义 |
|---|---|---|---|
| studies | 227,835 | 母库 MIMIC-CXR v2.0.0 Abstract | 影像检查单元总数 |
| 报告(关联) | 227,827 | JPG Abstract / 论文摘要 | 与图像关联的自由文本报告 |
| 报告(处理) | 227,943 | JPG Methods | 进入标签管线的总报告数 |
差值 116 与 8 份官方未解释。工程解读:个别报告无对应图像、个别检查无独立报告——三层总数各守其义。存照纪律:本条目并列引用三口径,不擅自仲裁。
附录 D:页面瑕疵五例全录(核查让矛盾浮出水面)
- Abstract 版本滞后:v2.1.0 页面(title 已是 2.1.0)Abstract 仍写 “Database v2.0.0”——发布物更新后正文未同步。
- 三口径并存:见附录 C;Abstract 与 Methods 相隔一屏数字不同。
- 同页异名:Release Notes 说 v2.1.0 新增 “RECORDS”,Overview 文件列表叫 “IMAGE_FILENAMES”——同类清单两种称呼。
- 引用编号错位:Methods 写 “using the pydicom library [10]”,但 References [10] 是 ChestX-ray8 论文——pydicom 无对应编号。
- Views 双口径:v2.0.0 页 Project Views 4,251 vs v2.1.0 页 5,337——版本页各自计数,非同一指标。
方法论注:以上矛盾均由 curl 双版本页+母库页三方实测发现。事实核查的价值不在挑错,而在让引用者知道自己引的是哪一层。
附录 E:页面 References 十三条全录
- Ray Smith. An overview of the tesseract OCR engine. ICDAR 2007;2:629-633. IEEE.
- Ali FS, Harrington SG, Kennedy SB, Hussain S. Diagnostic radiology in Liberia: a country report. J Glob Radiol 2015;1(2):6.
- Rosman DA, et al. Imaging in the land of 1000 hills: Rwanda radiology country report. J Glob Radiol 2015;1(1):5.
- Bastawrous S, Carney B. Improving patient safety: avoiding unread imaging exams in the national VA enterprise EHR. J Digit Imaging 2017;30(3):309-313.
- Rimmer A. Radiologist shortage leaves patient care at risk, warns royal college. BMJ 2017;359.
- Rosenkrantz AB, Wang W, Hughes DR, Duszak R Jr. A county-level analysis of the US radiologist workforce. J Am Coll Radiol 2018;15(4):601-606.
- Rosenkrantz AB, Hughes DR, Duszak R Jr. The US radiologist workforce: temporal and geographic variation. Radiology 2015;279(1):175-184.
- Irvin J, Rajpurkar P, Ko M, et al. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. AAAI 2019.
- Peng Y, Wang X, Lu L, Bagheri M, Summers R, Lu Z. NegBio: a high-performance tool for negation and uncertainty detection in radiology reports. AMIA Jt Summits Transl Sci Proc 2018;2018:188.
- Wang X, Peng Y, Lu L, Lu Z, Bagheri M, Summers RM. ChestX-ray8: hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases. CVPR 2017:2097-2106.
- Simon M, Leeming BW, Bleich HL, et al. Computerized radiology reporting using coded language. Radiology 1974;113(2):343-349.
- Johnson AEW, Pollard TJ, Greenbaum NR, Lungren MP, Deng CY, Peng Y, Lu Z, Mark RG, Berkowitz SJ, Horng S. MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs. arXiv:1901.07042 (2019).
- Johnson AE, Stone DJ, Celi LA, Pollard TJ. The MIMIC Code Repository: enabling reproducibility in critical care research. JAMIA 2018;25(1):32-39.
附录 F:与同类胸片库对照
| 维度 | MIMIC-CXR-JPG(本条目) | NIH ChestX-ray14 | CheXpert(Stanford) | PadChest |
|---|---|---|---|---|
| 规模 | 377,110 图 / 227,827 报告 | 112,120 图 | 224,316 图 | 160,868 图 |
| 来源 | BIDMC(2011-2016) | NIH CC 30 年回溯 | Stanford 院区 | 圣胡安医院(西班牙) |
| 格式 | JPG(均衡化+q95) | PNG(未均衡化) | JPG | DICOM/衍生 |
| 标签来源 | CheXpert+NegBio 双 labeler | NLP(专业公司+众包) | CheXpert labeler | 放射技师人工+报告绑定 |
| 标签粒度 | 14 类五值 | 14 类二值+置信 | 14 类五值 | 174 类多值 |
| 不确定性建模 | uncertain+disagreement 显式 | 无 | uncertain 显式 | — |
| 人工验证 | 687 报告(v2.1.0 随集发布) | 无公开对照规模 | 专家对比集 | — |
| 报告文本 | 有(在母库) | 无 | 无 | 有 |
| 访问 | Credentialed | Open | 需协议 | 需申请 |
| 与本集关系 | — | labeler 配方不同源(存照) | labeler 同源(官方协助) | 独立体系 |
选型建议:要报告文本配对选本集(+母库)或 PadChest;要 Open 快速起步选 ChestX-ray14;要 labeler 生态一致性选本集或 CheXpert 本体;跨库比较时先对齐预处理与标签五值处置策略——附录 B 与 §9.2 是对齐清单。
附录 G:派生家族互链表(全 rid)
| 本库 rid | slug | 形态 | 数据源关系 |
|---|---|---|---|
| 606 | cxr-cardiomegaly | 数值层(CTR 标志物) | 母库 DICOM+元数据 |
| 607 | cxr-phone | 照片层(屏显翻拍) | 家族图像 |
| 608 | cxr-pro | 文本层(prior 引用净化) | 母库报告 |
| 610 | heart-lung-segmentations-data | 掩码层(538 人工掩码) | JPG 图像+Montgomery |
| 611 | image-embeddings-mimic-cxr | 向量层(4,096 维逐图嵌入) | 母库全量图像(dicom_id 对齐) |
| 612 | latte-cxr | 图文对齐(bbox-语句/眼动) | REFLLACX 派生(孙代) |
| 613 | lung-segment-mimic-cxr | 分割图像对(1,141 对) | 母库图像(TernausNet) |
| 614 | lunguage | 报告结构化基准 | 母库 test 子集 |
| 616 | mimic-cxr-ext-ils | 指令分割(106 万指令对) | 母库图像+报告 |
| 16 | mimic-cxr | 原始层(DICOM+报告母库主条目) | — |
| 617 | mimic-cxr-jpg(本条目) | 加工层(JPG+标签+划分) | 母库 MIMIC-CXR v2.0.0(rid 16) |
谱系阅读顺序建议:本条目(617)→ 611(向量层)→ 610(掩码层)→ 616(指令层)——沿抽象阶梯上行;607(照片层)反向下行回物理世界。
附录 H:批次七生产存照(517 号)
- 生产序号:批次七 2/10(order 517,预期 rid 617)
- 事实核查:3 轮——curl v2.0.0 页(63,031 B)→ curl v2.1.0 页(68,643 B)+母库页 → arXiv 1901.07042 v1-v5+多源交叉(alphaXiv/emergentmind)
- 关键预判修正:报告数预判 227,835 实为母库 studies 口径(JPG 关联报告 227,827);版本预判止于 v2.0.0 实为 v2.1.0 最新(2024 增量版)
- 本条目定位:MIMIC-CXR 派生家族九条目(606-616)的共同根节点代理——批次六"形态学之旅"的坐标系原点
- 页面瑕疵存照五例(附录 D)——事实核查方法论的批次六签名在批次七延续
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- chexpert — 共享标签:医学影像 / X光影像 / 图像分类
- nih-chestx-ray14 — 共享标签:医学影像 / X光影像 / 图像分类
- image-embeddings-mimic-cxr — 共享标签:医学影像 / X光影像 / 图像分类
- padchest — 共享标签:医学影像 / X光影像 / 图像分类
- brax — 共享标签:医学影像 / X光影像 / 图像分类
- covid-19-radiography — 共享标签:医学影像 / X光影像 / 图像分类
- tbx11k — 共享标签:医学影像 / X光影像 / 图像分类
- cbis-ddsm — 共享标签:医学影像 / X光影像 / 图像分类
- cmmd — 共享标签:医学影像 / X光影像 / 图像分类
- vindr-pcxr — 共享标签:医学影像 / X光影像 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

