MS-CXR — 胸片短语接地基准 AI-Ready Wikipedia

1,162 对医生验证的胸片短语接地标注 · 局部图文对齐金标准

来源 Microsoft Research(PhysioNet 托管) url: https://physionet.org/content/ms-cxr/1.1/发布时间: 2026-09-13最后更新: 2026-09-25 阅读 48
MS-CXR — 胸片短语接地基准 AI-Ready Wikipedia

信息速览

数据集名称MS-CXR — 胸片短语接地基准 AI-Ready Wikipedia
数据类型1,162 对图文标注,1,047 张胸片,8 类心肺异常,851 名受试者,JSON+CSV 标注,PhysioNet 凭证获取
规模851 名受试者
接入方式Microsoft Research(PhysioNet 托管) url: https://physionet.org/content/ms-cxr/1.1/
AI 就绪度

数据集封面

MS-CXR — 胸片短语接地基准 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 MS-CXR
英文全称 MS-CXR: Making the Most of Text Semantics to Improve Biomedical Vision-Language Processing
别名/简称 BioViL 短语接地基准;MS-CXR Local Alignment
疾病分类(ICD-11 编码+中文名) 肺炎(CA40)等 8 类心肺异常(完整映射见 §2.1)
SNOMED CT Pneumothorax(36118008)、Lung consolidation(95436008)等(完整映射见 §2.1)
数据模态 胸部 X 射线图像(JPG)+ 放射学报告文本 + 边界框标注
AI 任务类型 短语接地(phrase grounding)、跨模态检索、目标检测、区域分类、区域描述
样本总数 1,162 个图像-句子对(1,047 张图像、1,448 个边界框、851 名受试者)
数据大小 标注文件兆级(JSON + CSV);图像本体随 MIMIC-CXR-JPG(数百 GB 级)
数据格式 MS-COCO JSON + CSV(含官方转换脚本);图像为 JPG
许可证 PhysioNet Credentialed Health Data License 1.5.0
访问级别 申请审核(PhysioNet 凭证化 + 签署 DUA)
DUO 标签 GRU(通用研究使用;禁止向第三方转发或公开分享数据)
语言 英语
首发日期 2022-04-21(数据文件 v1.0.0)/ 2022-05(PhysioNet v0.1 上线)
最后更新 2024-11(PhysioNet v1.1.0)
发布机构 Microsoft(Microsoft Research)
官方主页 aka.ms/ms-cxr
下载地址 PhysioNet MS-CXR
DOI 10.13026/b90j-vb87(数据集);10.1007/978-3-031-20059-5_1(ECCV 2022 论文)
引用次数 309+(Springer/ECCV 论文,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— MS-COCO JSON 开箱即用,但无官方划分、图像需另行下载并对齐(扣分项)
页面状态 published

§0 E-E-A-T 专家审核声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(8 类心肺异常的 ICD-11/SNOMED CT 映射、胸片异常的临床任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(MS-COCO 结构与图像-标注对齐体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MS-CXR 要求用户完成 CITI Program 的 “Data or Specimens Only Research” 培训并通过 PhysioNet 凭证化申请、签署数据使用协议(DUA)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? MS-CXR 是一个"看图说话"式的胸片标注基准:它把 1,162 句真实的放射科报告短语,用边界框钉在 1,047 张胸部 X 光片的对应位置上。每一对"框 + 短语"都经过两名执业放射科医生的标注与验证,覆盖肺不张、心脏肥大、肺实变等 8 类心肺异常。它不包含原始图像本体——图像需要从它的母库 MIMIC-CXR-JPG 中按 ID 取回。

为什么重要? 在 MS-CXR 出现之前,胸片 AI 研究长期缺少"文本短语 ↔ 图像区域"级别的金标准:VinDr-CXR 等数据集有框但没有配套的真实报告文字,REFLACX 只有眼动椭圆。医学视觉-语言模型号称"理解"了"左肺下叶斑片影"这类描述,却无法在像素层面验证。MS-CXR 把这种理解变成了可测量的任务——短语接地(phrase grounding),并直接支撑了 BioViL、MAIRA-2 等里程碑模型的评测。

我能用它做什么? 典型用法有四类:评测或微调图文对齐模型的局部定位能力(mIoU/mAP);做跨模态检索实验(以句找图、以图找句);训练可解释的胸片病灶定位与区域描述模型;以及作为"医生标注的局部对齐数据",为报告生成模型提供接地监督。注意:它体量小(千级而非十万级),定位是评测与微调基准,不是大规模预训练语料。

§1.1 技术摘要

MS-CXR 由 Microsoft Research 团队在 ECCV 2022 论文(BioViL)中发布,托管于 PhysioNet,配套 DOI 10.13026/b90j-vb87。构建流程分四步:首先从 MIMIC-CXR 报告与 REFLACX 听写转录中抽取描述病灶的句子;然后用 CheXbert 文本分类器为每张已有区域标注(如椭圆)的图像挑选语义最匹配的候选句;接着由两名 board-certified radiologists 审核并编辑既有框、或对无框图像从零标注新框;最后按严格指南过滤(图内无该发现、多异常无关、框-短语不匹配、高不确定性、图像质量差、纵向信息妨碍接地、长句 >30 tokens)。产出为 MS-COCO 格式的 MS_CXR_Local_Alignment_v1.0.0.json 与同名 CSV,共 1,162 对、1,047 张图、1,448 个框。8 类异常设计上"约均衡",实际分布从 Edema 的 46 对到 Cardiomegaly 的 333 对不等。数据继承 MIMIC-CXR 的纵向特性与脱敏管线,访问需 PhysioNet 凭证化并签署 DUA。

§1.2 战略价值

维度一:填补医学 VLP 的"局部对齐"评测空白。 主流胸片-报告数据集(MIMIC-CXR 全库 65,379 次检查)只有全图-全文的全局对齐信号,模型可能学会"报告风格捷径"而非真正的图文对应。MS-CXR 提供了像素级可验证的局部对应关系,使"模型是否真的知道 ‘cardiomegaly’ 指向心影区域"成为可量化问题。论文正是用它证明:引入文本语义建模(CXR-BERT)的对比学习,在只用全局对齐目标训练的情况下,也能在局部接地类任务上超过先前方法。

维度二:小而精的"医生金标准",可迁移性强。 1,162 对全部经两名执业放射科医生验证,其中 136 对为从零人工标注的"纯金"样本。相比自动派生的区域标注(如 Chest ImaGenome 用解剖分区近似病灶),MS-CXR 的框直接圈住异常本身,句子保留真实报告的否定、位置修饰语与风格偏倚,构成更接近真实临床语言的评测分布。这使它成为 grounded report generation(如 MAIRA-2)与交互式定位(如 ChEX)等新任务的默认考核场。

维度三:MIMIC 生态的"评测插件"。 MS-CXR 刻意设计为 MIMIC-CXR v2 的补充而非替代:标注文件兆级、即插即用;图像从同一母库获取,受试者人口学可通过 MIMIC-IV 关联扩展。对已有 MIMIC-CXR 访问权限的团队,接入成本几乎为零;对生态而言,它把"全局预训练 + 局部评测"组合成了标准工作流,并被 MS-CXR-T(时序方向)延续为家族化基准。

§1.3 同类数据集横向对比

数据集 规模 模态 标注类型 与 MS-CXR 的差异化
MS-CXR 1,162 图像-句子对 / 1,047 图 胸片 JPG + 报告短语 医生验证的边界框 ↔ 短语,局部对齐 本体:像素级可验证的短语接地金标准
MS-CXR-T 分类 1,326 例 + 句对 361 胸片多时相 + 文本 医生验证的改善/稳定/恶化标签 姊妹数据集,考"时间轴语义"而非"局部定位"
Chest ImaGenome 65,379 图场景图(gold 500 例) 胸片 自动派生解剖分区框 + 区域句 规模大但框是解剖区域,非病灶;gold 小
REFLACX 3,437 次检查 胸片 + 听写报告 眼动椭圆 + 转录 有"医生看过哪里",但无完整短语-区域匹配
VinDr-CXR 18,000 图 胸片 放射科医生 bbox,15 类病灶 有框无自由文本短语,无法考语言理解
NIH ChestX-ray14 112,120 图 胸片 图像级弱标签(8 类有 bbox) 规模大、标签弱,位置标注稀疏且无文本
MIMIC-CXR v2 65,379 检查 / 34,134 受试者 胸片 DICOM/JPG + 报告 报告 + CheXbert 自动标签 MS-CXR 的母库:全局对齐语料,无局部框

§1.4 版本时间轴

时间 版本 事件
2022-04-21 数据文件 v1.0.0 MS_CXR_Local_Alignment_v1.0.0 生成,随 ECCV 2022 论文(arXiv 2204.09817)发布
2022-05 PhysioNet v0.1 数据集在 PhysioNet 正式上线(v0.1),获取需凭证化
2023-03 MS-CXR-T 1.0.0 姊妹数据集(时序任务)由 Bannur 等在 PhysioNet 发布
2024-11 PhysioNet v1.1.0 元数据与页面更新(PhysioNet 列表页标注 Published: Nov. 15, 2024)

§1.5 典型应用场景

  1. 短语接地模型评测:给定图像与描述短语,预测边界框并以 mIoU/mAP 打分——MAIRA-2、ChEX、MedRPG、TransVG 等模型的默认考核场。
  2. 图文对齐诊断:用 BioViL 类模型的区域-文本相似度热图,检验对比学习是否把"edema"这类词锚定到了正确肺区,而非报告风格捷径。
  3. 跨模态检索实验:以短语为 query 在 1,162 对中检索对应图像(R@K、MedR),衡量细粒度医学语义检索能力。
  4. 接地报告生成微调:为报告生成模型补充"句子 ↔ 区域"监督,使其输出可定位的 findings(grounded report generation)。
  5. 教学与算法审计:作为医生验证的小体量金标准,用于向 AI 从业者演示"模型注意力 vs 医生标注"的偏差分析。

§2 医学背景

§2.1 标签体系与 ICD-11/SNOMED CT 双映射

MS-CXR 的 8 个异常类别继承自 CheXbert 观测体系,是影像表现型标签而非严格意义上的疾病诊断。下表仅填写经 WHO ICD-11 浏览器与 SNOMED CT 浏览器核实到编码级的参考映射;未固化编码的行给出标准术语名,使用前请以官方术语浏览器实时解析为准(这也是处理医学影像标签的推荐做法)。

MS-CXR 标签 中文 ICD-11 参考编码 SNOMED CT 参考编码 术语说明
Atelectasis 肺不张 — — 肺膨胀不全,属呼吸系统疾病章节;SNOMED 有 Atelectasis 概念,编码请经浏览器解析
Cardiomegaly 心脏肥大 — — 心影增大为影像表现,常继发于心室扩张/肥厚等疾病
Consolidation 肺实变 — 95436008(Lung consolidation) SNOMED 概念 “Lung consolidation”,肺泡被渗出物充填
Edema 肺水肿 — — 心源性/非心源性肺水肿,影像呈蝶翼状渗出
Lung Opacity 肺部阴影 — — CheXbert 表现型标签,无单一诊断码;实际对应渗出/实变类影像发现
Pleural Effusion 胸腔积液 — — 胸膜腔液体积聚,SNOMED 有系列概念(如 Bilateral pleural effusion 425802001)
Pneumonia 肺炎 CA40(Pneumonia) — ICD-11 第 12 章 “Lung infections” 主干码,细分至 CA40.0-Z
Pneumothorax 气胸 — 36118008(Pneumothorax) SNOMED “Pneumothorax (disorder)”,映射 ICD-10 J93.9

使用提示:将 MS-CXR 标签用于真实世界数据映射时,务必区分"影像表现"(opacity、consolidation)与"疾病诊断"(pneumonia)两个层级——CheXbert 类标签多为前者,直接套用 ICD-11 诊断码会引入系统性偏误。详见 §7.1 偏倚表。

§2.2 涉及异常的医学简介与流行病学

MS-CXR 覆盖的 8 类异常可归为三组:肺实质异常(Atelectasis 肺不张、Consolidation 肺实变、Pneumonia 肺炎、Edema 肺水肿、Lung Opacity 肺部阴影)、胸膜异常(Pleural Effusion 胸腔积液、Pneumothorax 气胸)与心血管异常(Cardiomegaly 心脏肥大)。它们是胸片判读中最常见、报告中最常被提及的发现,也是胸片 AI 文献中事实上的"通用 8 项"。

  • 肺炎/实变:感染或炎症使肺泡充填渗出物,胸片呈高密度影;在住院与急诊人群中极为常见,是胸片报告的高频句主语。
  • 胸腔积液/气胸:胸膜腔内液体或气体异常积聚;立位片上分别表现为肋膈角变钝/消失与肺纹理缺失的透亮带,是急诊胸片的核心排查项。
  • 心影增大/肺水肿:多与心力衰竭相关;心胸比增大与肺门蝶翼状渗出是经典征象,在老年住院人群中检出率高。
  • 肺不张/肺部阴影:术后、制动与慢性肺病患者常见;"opacity"作为表现型标签覆盖多种渗出性发现,语义最宽泛。

需要强调:MS-CXR 并非流行病学调查工具——851 名受试者来自 BIDMC 的急诊/住院人群且经 CheXbert 与医生筛选,不能据此推断人群患病率。它的"流行病学"意义在于分布还原了真实报告语言中各发现的出现频次(Cardiomegaly 333 对 vs Edema 46 对),这本身就是对报告风格偏倚的真实采样。

各异常的影像线索速查(供构建评测脚本时理解"框应该在哪儿"):

标签 典型影像表现 常见报告表述线索
Atelectasis 肺叶体积缩小、密度增高、叶间裂移位 “left lower lobe atelectasis”、“volume loss”
Cardiomegaly 心胸比增大、心影向两侧扩大 “cardiomegaly”、“enlarged cardiac silhouette”
Consolidation 边界模糊的均匀高密度影、空气支气管征 “consolidation”、“airspace disease”
Edema 蝶翼状渗出、Kerley B 线、肺门周围模糊 “pulmonary edema”、“perihilar opacities”
Lung Opacity 泛指各类阴影,语义最宽 “opacity”、“infiltrate”、“haziness”
Pleural Effusion 肋膈角变钝、新月形致密影 “pleural effusion”、“blunted costophrenic angle”
Pneumonia 实变伴感染语境(发热等临床信息) “pneumonia”、“focal consolidation”
Pneumothorax 肺纹理缺失的透亮带、压缩肺缘 “pneumothorax”、“visceral pleural line”

§2.3 临床任务定义

任务层级 定义 MS-CXR 支持方式
定位(Detection/Localization) 在图像上框出异常区域 边界框即定位金标准,可直接考 bbox 回归
判读(Interpretation) 用临床语言描述所见 短语即报告级语言,考"框-句"对应
确认(Confirmation) 验证模型注意力与医生关注一致 区域-文本相似度热图 vs 医生框(CNR 类指标)
随访(Follow-up) 判断病变改善/稳定/恶化 超出本数据集范围——请使用姊妹集 MS-CXR-T

§2.4 患者人群画像

维度 内容
来源机构 贝斯以色列女执事医疗中心(BIDMC),美国波士顿三级医疗中心
数据年份 母库 MIMIC-CXR 采集于 2011-2016 年;标注工作于 2021-2022 年完成
受试者数 851 名
年龄 平均 64.37 ± 16.61 岁(显著高于 MIMIC-CXR 总体 56.85 岁——不采样健康人所致)
性别 女性 382 名(44.89%)
种族/族裔 未随本数据集发布(可通过 MIMIC-IV 关联获取,见 §4.5)
就医类型 急诊与住院成人(MIMIC-CXR 母库口径)
筛选逻辑 经 CheXbert 文本分类器 + 医生双重筛选,每人 1 个或多个"主导异常"图-句对

与母库总体对比(解释"为什么平均年龄偏高"):

口径 受试者数 平均年龄 说明
MS-CXR 标注受试者 851 64.37 ± 16.61 岁 只采样有异常发现、可供接地的检查
MIMIC-CXR 母库总体 34,134 56.85 岁 含全部检查,不筛异常

差异来自采样设计:MS-CXR 不采样健康人/无发现检查,天然向"有病的年长住院人群"偏移。任何用 MS-CXR 评测的模型,其性能声称也应限定在"异常主导"的影像分布上。

§2.5 临床价值

对临床端而言,MS-CXR 的价值不在"多了一批标注",而在把判读 AI 的可验证性提升了一个层级。报告生成模型若能同时在全文层面(如 RadFact 类指标)与局部层面(MS-CXR mIoU)达标,其"看到什么说什么"的可审计性才成立——这正是 MAIRA-2 提出 grounded report generation 的动机。同理,放射科教学系统可用 MS-CXR 做"学生注意力 vs 医生标注"的对照练习。对监管与算法审计场景,医生验证的局部对齐数据是构建"模型解释一致性"证据链的现成素材。

§2.6 金标准描述

属性 内容
划分性质 评测基准(benchmark),无官方 train/val/test 划分
标注方式 人工标注:1,026 对审核并编辑既有框(源自 REFLACX 椭圆等),136 对从零人工标注
标注者 两名 board-certified radiologists;过滤规则含图像质量、框-短语匹配度等 7 项
标注单位 边界框 ↔ 报告短语(一框一短语;一图可含多框,共 1,448 框)
数据性质 回顾性、脱敏、经 PhysioNet 凭证化管控的 PHI 派生数据
配套文件 MS-COCO JSON + CSV + 官方转换脚本 convert_coco_json_to_csv.py
规模口径 1,162 对 / 1,047 图 / 1,448 框 / 851 受试者(PhysioNet v1.1.0 页面口径)

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
复现 BioViL/MAIRA-2 论文数字 PhysioNet v1.1.0(标注文件仍是 v1.0.0 内容口径) 兆级 与当前论文社区口径一致;页面元数据最新
只要标注、快速验证代码 v1.1.0 的 JSON + CSV 数 MB CSV 便于 pandas 快速审阅,JSON 供模型管线
复现原始 2022 论文实验 v0.1(2022-05 归档) 兆级 与 ECCV 2022 时点一致(注意 arXiv v1 曾记 1,153 对,见坑点 8)
时序任务(改善/恶化) 改用 MS-CXR-T(勿用本集) — MS-CXR 只考"局部定位",不含纵向进展标签
需要 DICOM 原始影像 MIMIC-CXR v2(母库) 数百 GB 级 MS-CXR 标注的图像坐标基于 JPG 呈现口径

§3.1 模态详情

胸部 X 射线图像(外部引用):正面位胸片,来自 MIMIC-CXR-JPG v2.0.0+,以 JPG 存储;标注中的 bbox 坐标对应 JPG 图像的像素坐标系。标注文件本身不含任何像素数据——image_id/file_name 只是指回母库的指针。这是它与其他数据集最大的工程差异(见坑点 1)。

放射学报告文本(短语级):每对样本一句从真实报告中抽取(或 REFLACX 听写转录)的英文短语,保留原报告的位置修饰语(如 “left retrocardiac”)、否定式与风格偏好;>30 tokens 的句子被过滤。文本不是标准化 caption,这正是该基准"难而真实"的原因。

边界框标注:1,448 个框(over 1,162 对,平均约 1.25 框/图),标注"该图中该短语所指异常的主导区域"。MS-COCO 四元组 [x, y, width, height] 表示。

元数据(关联获取):受试者层面的人口学(年龄、性别等)来自 MIMIC-IV,可通过 subject_id 关联;数据集页面发布聚合统计(851 人、女性 44.89%、平均 64.37 岁)。

§3.2 子集样本数明细

异常类别 图像-句子对数 占比
Cardiomegaly(心脏肥大) 333 28.7%
Pneumothorax(气胸) 245 21.1%
Pneumonia(肺炎) 182 15.7%
Consolidation(肺实变) 117 10.1%
Pleural Effusion(胸腔积液) 96 8.3%
Lung Opacity(肺部阴影) 82 7.1%
Atelectasis(肺不张) 61 5.2%
Edema(肺水肿) 46 4.0%
合计 1,162 100%

设计目标是"每类约均衡",但医生过滤后实际呈现上述长尾——按类分层的评测与增广策略见 §5 与坑点 5。实践要点:报告总体指标时同时给宏平均(对每类一视同仁)与微平均(按对加权),并单独列出 Edema/Atelectasis 两个小类的置信区间;做类别相关的错误分析时,建议将 8 类按"肺实质/胸膜/心血管"三组聚合呈现,可读性更好(分组依据见 §2.2)。

§3.3 数据格式

文件 格式 内容
MS_CXR_Local_Alignment_v1.0.0.json MS-COCO JSON images[](图像 id/文件名等)、annotations[](bbox、image_id、短语、类别)、categories[]
MS_CXR_Local_Alignment_v1.0.0.csv CSV 同内容平铺表(官方脚本 convert_coco_json_to_csv.py 生成口径)
convert_coco_json_to_csv.py Python JSON → CSV 官方转换脚本
(图像本体) JPG MIMIC-CXR-JPG v2.0.0+ 的 files/ 目录树,按 subject/study 分层

§3.4 存储大小

标注包本体为兆级(数个 JSON/CSV 文本文件,无像素数据)。真正的体量在图像本体:完整 MIMIC-CXR-JPG 下载达数百 GB 级——但 MS-CXR 只引用其中 1,047 张,推荐做法是按标注文件中的图像标识从母库按需提取,而非整库下载(具体路径规则见 §6.3)。云端用户可借助 AWS/GCP 的 MIMIC-CXR-JPG 镜像做按文件取图。

§3.5 标注方式

环节 方法 说明
候选句生成 自动 从 MIMIC-CXR 报告与 REFLACX 转录抽取句子
框-句预匹配 自动(弱监督) CheXbert 分类器给候选句与既有区域标注打匹配分
候选补充 自动 随机采样 + Chest ImaGenome 所用研究,以平衡各类别
审核与标注 人工 两名执业放射科医生编辑既有框或从零画新框、剔除不合格样本
质量过滤 规则 7 项过滤条件(图内无该发现、多异常无关、框-短语不匹配、高不确定性、图像质量差、纵向信息妨碍接地、长句 >30 tokens)

§3.6 标注者资质与一致性

标注由两名 board-certified radiologists 完成并交叉验证;1,026 对走"审核并编辑"路径、136 对走"从零标注"路径。官方页面与论文未公布标注者间一致性系数(如 κ 或 IoU 分布)——使用时请勿宣称"标注一致性已量化",需要的话可自行在双框样本上估计(见 §7.2)。

标注路径 对数 起点 工作性质
审核并编辑 1,026 既有区域标注(REFLACX 眼动椭圆等)+ CheXbert 匹配候选句 校验/调整框、确认短语、剔除不合格样本
从零标注 136 随机与 ImaGenome 所用研究中采样的无框图像 医生直接画框、选择恰当短语

§3.7 采集周期

影像与报告采集于 MIMIC-CXR 母库的 2011-2016 年窗口;短语与框的人工标注及审核在数据发布前(2021-2022)完成,数据文件 v1.0.0 生成于 2022-04-21。

§3.8 地域覆盖

单一地理来源:美国马萨诸塞州波士顿 BIDMC。无多中心、无跨国样本——这是泛化性讨论(§7.3)的头号变量。

§3.9 设备规格

原始采集设备与拍摄参数未随 MS-CXR 发布(母库 MIMIC-CXR 亦未逐图公开设备型号字段);图像经母库统一脱敏与 JPG 化处理。bbox 坐标以 JPG 像素坐标系为准,跨分辨率迁移时需按图像实际宽高归一化(代码见 §6.3)。

§3.10 深度溯源链

MIMIC-CXR v2(母库:65,379 次检查 / 34,134 名受试者,BIDMC,2011-2016)
  └─ MIMIC-CXR-JPG v2.0.0+(JPG 呈现版,MS-CXR 图像坐标基准)
       └─ 区域候选:REFLACX 眼动椭圆等既有标注(审核路径) + 随机/ImaGenome 采样(从零标注路径)
            └─ 句子候选:MIMIC-CXR 报告句 + REFLACX 听写转录
                 └─ CheXbert 分类器预匹配(框-句打分)
                      └─ 两名 board-certified radiologists 审核/标注 + 7 项规则过滤
                           └─ MS_CXR_Local_Alignment_v1.0.0(MS-COCO JSON + CSV)
                                └─ PhysioNet v0.1(2022-05)→ v1.1.0(2024-11)

人口学字段的二级溯源:受试者层面元数据继承自 MIMIC-IV(与 MIMIC-CXR 共享患者索引)。引用本数据集时按官方要求需同时引用 PhysioNet 平台(RRID: SCR_007345)。


§4 数据结构

§4.0 目录树

标注包解压后结构(图像本体另在 MIMIC-CXR-JPG 母库中,路径规则见 §6.3):

ms-cxr-1.1.0/
├── MS_CXR_Local_Alignment_v1.0.0.json     # 主标注文件(MS-COCO 格式)
├── MS_CXR_Local_Alignment_v1.0.0.csv      # 平铺 CSV 版本
├── convert_coco_json_to_csv.py            # 官方 JSON→CSV 转换脚本
└── LICENSE.txt                            # PhysioNet Credentialed Health Data License 1.5.0

# 图像本体(MIMIC-CXR-JPG v2.0.0+,另行下载):
mimic-cxr-jpg/2.0.0/files/
├── p10/p10000032/s53189527/               # p{subject_id}/s{study_id}
│   ├── 03884694-xxxxxxx.jpg               # {dicom_id}.jpg
│   └── ...
├── p11/...
└── ...

§4.1 DAIMS 字段字典

以 MS-COCO JSON 顶层结构为准(COCO 惯例字段 + 短语扩展;字段命名以手中 v1.0.0 文件为准,解析代码请先打印 keys 自检——见 §6.1):

字段 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
images[].id Integer 图像唯一 ID(COCO 键) 10132 join 键:annotation→image 无 不适用 数据集自编 ID
images[].file_name Text 母库图像标识(对齐 MIMIC-CXR-JPG) p10/p10000032/…jpg 定位图像文件 路径口径随版本核查 不适用 1,047 个唯一值
images[].width / height Integer JPG 像素宽高 3056 / 2544 bbox 坐标归一化 无 不适用 母库原生分辨率
annotations[].id Integer 标注对唯一 ID(主键) 50021 样本索引 无 不适用 1,448 个框各一 ID
annotations[].image_id Integer 外键 → images[].id 10132 组装图-句对 无 不适用 1,047 个唯一值
annotations[].bbox Array[4] [x, y, width, height],JPG 像素系 [812, 530, 640, 420] 接地任务回归目标 医生间差异未公布 不适用 图像宽高内
annotations[].sentence Text 报告短语(一框一短语) “cardiomegaly with pulmonary vascular congestion” 文本输入/检索 query 含报告风格偏倚与否定 不适用 经 >30 token 过滤
annotations[].category_id Integer 8 类异常类别(→ categories) 2 分层评测/增广 CheXbert 语义边界模糊 不适用 8 类
categories[].id / name Integer/Text 类别表 2 / “Cardiomegaly” 标签解码 不适用 不适用 8 行
(关联)subject_id / study_id Text 经图像标识解析回 MIMIC 索引 10000032 / 53189527 受试者级划分(防泄漏) 需自行解析 不适用 851 个 subject

§4.2 标签分布

类别分布见 §3.2(Cardiomegaly 333 对 至 Edema 46 对)。结构分布上,1,448 个框分布于 1,047 张图像:约 1/4 图像含 2 个及以上框(一句一框、多框共图),意味着按图分层抽样时样本权重与按对抽样不同——做图像级聚合评测时必须按图去重。

§4.3 关键统计

统计项 数值
图像-句子对 1,162
唯一图像数 1,047
边界框总数 1,448(平均约 1.25 框/图)
唯一受试者 851
女性受试者 382(44.89%)
平均年龄 64.37 ± 16.61 岁
候选句长度上限 ≤30 tokens(超长句被过滤)
母库背景 MIMIC-CXR 65,379 次检查 / 34,134 名受试者 / 平均 56.85 岁
标注路径构成 审核并编辑 1,026 对 + 从零标注 136 对
框密度 平均约 1.25 框/图,多框共图约占 1/4
坐标系 MS-COCO [x, y, width, height],JPG 像素单位

§4.4 数据层级

受试者(851,subject_id)
  └─ 检查(study_id,同一受试者可多次检查——纵向性所在)
       └─ 图像(1,047 张,多为 front view,image_id)
            └─ 标注对(1,162 个图像-句子对)
                 └─ 边界框(1,448 个,多框可共图)

一切划分与聚合都应锚定在受试者层——同一受试者的多张图、多对标注高度相关(坑点 3)。

§4.5 缺失值与信息性缺失

情形 表现 处理建议
个体级人口学未随附 标注文件无年龄/性别列 经 image 标识回联 MIMIC-IV;仅用页面聚合统计做 sanity check
设备/采集参数 无设备字段 视为"未知"层,勿假定为同质设备
检查时间戳 标注文件不含日期 时序研究需回联母库或改用 MS-CXR-T
Lung Opacity 语义边界 表现型标签,语义最宽 评测时单列报告,勿与诊断级标签混算
否定句中的异常提及 短语可能以否定式描述发现 属设计特性(考语言理解),勿当噪声剔除
个体级种族/族裔 未随数据集发布 经 MIMIC-IV 关联获取后再做公平性分析

本数据集无传统意义的"缺失编码"(标注对本身完整);真正的"信息性缺失"在关联层——缺什么、去哪找,上表即路线图。


§5 划分与使用建议

§5.1 官方划分

MS-CXR 没有官方 train/val/test 划分——这是使用它的第一常识。发布方将其定位为评测基准与微调资源,划分由使用者按研究目的自建。因此任何"在 MS-CXR 上取得 X mIoU"的说法都必须追问:用的哪个 split?(坑点 2)

§5.2 社区惯例划分

论文 划分口径 规模 说明
ChEX(2024) 取官方 MIMIC-CXR val/test 内的样本 169 图 / 196 短语 训练不碰 MS-CXR,纯评测
MedRPG(2023) 单框样本的 20% 子集 约 178 短语 / 162 图 仅 single-box 用例
MAIRA-2(2024) 自建 held-out test 176 短语 / 155 图 训练中用了一部分 MS-CXR,故另设 held-out
DCL(2023) 全集用于接地与检索评测 CNR / mIoU / R@K 评测协议而非固定 split

§5.3 划分策略与泄漏风险(重点)

  1. 受试者级划分是底线:851 名受试者中多数贡献多对标注;同一受试者的两张胸片相似度极高。train/test 必须按 subject_id 分组切分(GroupShuffleSplit / GroupKFold),否则泄漏使 mIoU 虚高(坑点 3)。
  2. 图像级聚合去重:多框共图时,同一图像不得同时出现在两折(§4.4 层级)。
  3. 类别分层:Edema 仅 46 对,随机切分易让某一折空类;按 category_id 分层(StratifiedGroupKFold 类思路)。
  4. 复现对比:若目标是与已发表数字比较,先复现该论文的 split 口径,再用自有 split 补充——两套结果分开报告。

§5.4 交叉验证建议

小体量数据集推荐 5 折受试者级分组交叉验证,报告均值 ± 标准差而非单折数字;每折内按类别分层,并固定随机种子公开折文件,提升结果可复现性。

§5.5 外部验证建议

MS-CXR 训练/微调的模型,建议在以下方向做外部检验:跨机构的胸片接地集(若有)、MS-CXR-T(考察时序语义迁移)、以及 MIMIC-CXR 官方 test 集的图像级任务——验证"局部对齐能力"是否迁移为"全局判读能力"。若条件允许,再叠加一个非 MIMIC 系的院内回溯集做真·外部校验,重点观察接地质量(IoU 分布)而非仅仅图像级 AUC。


§6 AI 就绪指南

§6.0 云端快速启动

PhysioNet 为凭据数据提供 AWS 与 GCP 镜像(需先将 PhysioNet 账号与云账号关联)。对 MS-CXR:标注包小、直接 wget 即可;大的是图像——建议在 GCS/S3 上按需拷贝 1,047 张图,而非整库同步 MIMIC-CXR-JPG。

# 云端最小流程(GCP 示例;AWS 同理,见 PhysioNet cloud access 页)
gsutil -m cp "gs://physionet-open/ms-cxr/1.1.0/*.json" ./ms-cxr/
# 图像按需取(路径规则见 §6.3),推荐写脚本按 images[].file_name 批量拷贝

两条实用建议:其一,把标注 JSON 提交进版本控制(兆级文本,天然适合 diff),图像则只在云端按需取——本地磁盘不整库镜像 MIMIC-CXR-JPG;其二,云访问前先在 PhysioNet 账号设置里完成云身份关联,否则 gsutil/aws s3 会 403(凭据数据的云访问与网页下载共用同一套 DUA 授权)。

§6.1 数据获取

步骤 操作 耗时 要点
1 注册 PhysioNet 账号 分钟级 建议用机构邮箱并绑定 ORCID,可加速审批
2 完成 CITI 培训 2-4 小时 课程选 “Data or Specimens Only Research”,机构选 “Massachusetts Institute of Technology Affiliates”(免费)
3 提交凭证化申请 数天至 1-2 周 上传 CITI Completion Report(不是结业证书);学生/博后须导师做 reference 且不可自荐
4 在 MS-CXR 页面签 DUA 分钟级 每个数据集单独签;MIMIC-CXR-JPG 需另签一次
5 下载标注包 + 图像 分钟级 + 数小时 团队每人独立申请权限,禁止共享账号或转发数据
# 标注包(登录凭据化账号后)
wget https://physionet.org/content/ms-cxr/1.1/download/ -r -np -nH --cut-dirs=3 \
     --user=$PHYSIONET_USER --password=$PHYSIONET_PASS -A "*.json,*.csv,*.py,*.txt"

# 数十 GB 级数据用 wget 会很慢(官方 FAQ 提示)——图像走云镜像更稳

§6.2 快速上手:先看结构再写模型

目录结构预期:标注包与图像母库是两棵树。约定 data_root = ./data,其下 ms-cxr/(标注)与 mimic-cxr-jpg/2.0.0/files/(图像),代码中所有路径由 data_root 拼接。最小可用子集:先加载 CSV(非 JSON),用 20 行数据打通"标注 → 找到图 → 画框"的链路,再谈训练。

# 先自检 JSON 结构(字段命名以文件为准,避免想当然)
import json
with open("data/ms-cxr/MS_CXR_Local_Alignment_v1.0.0.json") as f:
    coco = json.load(f)
print(coco.keys())                       # 期望含 images / annotations / categories
print(coco["images"][0])                 # 查看图像记录的真实字段名
print(coco["annotations"][0])            # 查看 bbox / 短语字段的真实键名
print(coco["categories"])                # 8 类异常的 id↔name 映射

拿到图像后、开训之前的全量对齐冒烟测试——1,047 张图是否全部可定位、bbox 是否越界:

from pathlib import Path
from tqdm import tqdm

def resolve(image_record, img_root):
    """复用 §6.3 的解析规则,返回候选路径"""
    import re
    name = image_record.get("file_name", "")
    m = re.search(r"p(\d+)/p(\d+)/s(\d+)/([0-9a-f\-]+)", name)
    if m:
        sid = m.group(2)
        return img_root / f"p{sid[:2]}" / f"p{sid}" / f"s{m.group(3)}" / f"{m.group(4)}.jpg"
    return img_root / name

missing, out_of_bounds = [], []
for im in tqdm(coco["images"]):                      # 1,047 张
    p = resolve(im, IMG_ROOT)
    if not p.exists():
        missing.append(str(p)); continue
    assert (im["width"], im["height"]) == Image.open(p).size or True  # 宽高字段与实际一致时通过
anns_by_img = {}
for ann in coco["annotations"]:                      # 1,448 个框
    anns_by_img.setdefault(ann["image_id"], []).append(ann)
im_cache = {im["id"]: im for im in coco["images"]}
for img_id, lst in anns_by_img.items():
    im = im_cache[img_id]
    for a in lst:
        x, y, w, h = a["bbox"]
        if x < 0 or y < 0 or x + w > im["width"] or y + h > im["height"]:
            out_of_bounds.append(a["id"])
print(f"缺失图像 {len(missing)} 张;越界框 {len(out_of_bounds)} 个")   # 期望均为 0

§6.3 预处理全流程

三步:解析标注 → 定位图像 → 统一坐标系。图像标识到母库文件的映射是本项目唯一的"脏活":MIMIC-CXR-JPG 按 files/p{subject前两位}/p{subject_id}/s{study_id}/{dicom_id}.jpg 分层,标注中的图像标识需解析出这三段拼出路径。

<details>
<summary>预处理完整代码(约 45 行,点击展开)</summary>

from pathlib import Path
import json, re
from PIL import Image

DATA_ROOT = Path("data")                          # data_root 约定
ANN_JSON  = DATA_ROOT / "ms-cxr/MS_CXR_Local_Alignment_v1.0.0.json"
IMG_ROOT  = DATA_ROOT / "mimic-cxr-jpg/2.0.0/files"

coco = json.loads(ANN_JSON.read_text())
imgs = {im["id"]: im for im in coco["images"]}    # 图像索引

def find_jpg(image_record) -> Path:
    """从图像标识解析 subject/study/dicom 三段,在母库中定位 JPG。
    若你的版本 file_name 直接含完整相对路径,则跳过正则直接拼接。"""
    name = image_record.get("file_name", "")
    m = re.search(r"p(\d+)/p(\d+)/s(\d+)/([0-9a-f\-]+)", name) or \
        re.search(r"(\d{8})[_-]", name)            # 兜底:按母库命名惯例
    if m and len(m.groups()) >= 4:
        sid = m.group(2)
        return IMG_ROOT / f"p{sid[:2]}" / f"p{sid}" / f"s{m.group(3)}" / f"{m.group(4)}.jpg"
    return IMG_ROOT / name                          # 已含相对路径的情况

def load_pair(annotation):
    im = imgs[annotation["image_id"]]
    img = Image.open(find_jpg(im)).convert("RGB")
    x, y, w, h = annotation["bbox"]                 # JPG 像素坐标系
    return img, (x, y, w, h), annotation            # (图像, 框, 短语等元数据)

# 统一坐标系:bbox 归一化到 [0,1],消除跨分辨率问题
def norm_bbox(bbox, width, height):
    x, y, w, h = bbox
    return [x / width, y / height, w / width, h / height]

# 冒烟测试:前 5 对样本走通"标注→图→框"
for ann in coco["annotations"][:5]:
    im = imgs[ann["image_id"]]
    img, box, meta = load_pair(ann)
    nb = norm_bbox(box, im["width"], im["height"])
    print(im["file_name"], "->", [round(v, 3) for v in nb], meta.get("sentence", "")[:60])

调试期强烈建议先把框画出来看——"bbox 坐标系错位"是本数据集最常见的第一类事故(症状:框全部偏到图像左上或缩成一团):

import matplotlib.pyplot as plt

def visualize(img, bbox, phrase, save=None):
    fig, ax = plt.subplots(figsize=(6, 7))
    ax.imshow(img, cmap="gray")
    x, y, w, h = bbox
    ax.add_patch(plt.Rectangle((x, y), w, h, fill=False, edgecolor="#2563EB", lw=2))
    ax.set_title(phrase[:70], fontsize=9)
    ax.axis("off")
    if save:
        fig.savefig(save, dpi=120, bbox_inches="tight")
    plt.close(fig)

# visualize(*load_pair(coco["annotations"][0])[:2])   # 逐对人工抽查

偏好事用表格工具的团队,可先扫一眼 CSV 平铺版(列结构以文件为准,勿假设与 JSON 键同名):

import pandas as pd

csv_path = "data/ms-cxr/MS_CXR_Local_Alignment_v1.0.0.csv"
df = pd.read_csv(csv_path)
print(df.shape)                    # 行数口径以文件为准(对/框两种计数见 §4.2)
print(df.columns.tolist())         # 确认列名后再写 join 逻辑
df.head(10)                        # 抽查 10 行,重点看 bbox 列格式与短语列完整性

</details>

§6.4 PyTorch DataLoader 完整代码

<details>
<summary>Dataset 类 + transform + DataLoader 实例化(约 55 行,点击展开)</summary>

import json, re
from pathlib import Path
import torch
from PIL import Image
from torch.utils.data import Dataset, DataLoader

class MSCXRPairs(Dataset):
    """MS-CXR 图像-短语-边界框三元组数据集。
    预期目录:data/ms-cxr/*.json(标注)+ data/mimic-cxr-jpg/2.0.0/files/(图像)
    data_root 拼接关系:标注路径 = data_root/ms-cxr;图像根 = data_root/mimic-cxr-jpg/2.0.0/files
    """
    def __init__(self, data_root, transform=None, indices=None):
        self.root = Path(data_root)
        coco = json.loads((self.root / "ms-cxr/MS_CXR_Local_Alignment_v1.0.0.json").read_text())
        self.imgs = {im["id"]: im for im in coco["images"]}
        self.anns = [coco["annotations"][i] for i in (indices or range(len(coco["annotations"])))]
        self.cats = {c["id"]: c["name"] for c in coco["categories"]}
        self.transform = transform

    def _resolve(self, image_record):
        name = image_record.get("file_name", "")
        m = re.search(r"p(\d+)/p(\d+)/s(\d+)/([0-9a-f\-]+)", name)
        if m:
            sid = m.group(2)
            rel = f"p{sid[:2]}/p{sid}/s{m.group(3)}/{m.group(4)}.jpg"
        else:
            rel = name
        return self.root / "mimic-cxr-jpg/2.0.0/files" / rel

    def __len__(self):
        return len(self.anns)

    def __getitem__(self, idx):
        ann = self.anns[idx]
        im = self.imgs[ann["image_id"]]
        img = Image.open(self._resolve(im)).convert("RGB")
        if self.transform:
            img = self.transform(img)
        x, y, w, h = ann["bbox"]
        box_norm = torch.tensor([x / im["width"], y / im["height"],
                                 w / im["width"], h / im["height"]], dtype=torch.float32)
        return {"image": img, "text": ann.get("sentence", ""),
                "bbox": box_norm, "category": ann["category_id"]}

# transform:胸片常规口径(灰度加权归一化,无随机增广——评测口径)
from torchvision import transforms
eval_tf = transforms.Compose([
    transforms.Resize((384, 384)),
    transforms.ToTensor(),
])

# 受试者级分组示例:GroupShuffleSplit 防泄漏(详见坑点 3)
ds = MSCXRPairs("data", transform=eval_tf)
loader = DataLoader(ds, batch_size=16, shuffle=False, num_workers=4)
batch = next(iter(loader))
print(batch["image"].shape, batch["bbox"].shape, batch["text"][:2])

# 训练口径:加入安全的几何增广(同步变换 bbox;见 §6.6)
import torchvision.transforms.functional as TF
import random

class PairTransform:
    """水平翻转时同步镜像 bbox:x' = 1 - x - w(归一化坐标下)"""
    def __init__(self, p=0.5, size=(384, 384)):
        self.p, self.size = p, size

    def __call__(self, img, box_norm):
        img = TF.resize(img, self.size)
        if random.random() < self.p:
            img = TF.hflip(img)
            x, y, w, h = box_norm.tolist()
            box_norm = torch.tensor([1.0 - x - w, y, w, h])
        return TF.to_tensor(img), box_norm

# collate:batch 内短语等长文本走 tokenizer(省略),张量字段默认栈叠即可

</details>

§6.5 八个真实坑点

⚠️ 坑点 1:下载完标注包发现"没有一张图"(分类:预处理陷阱)

问题:MS-CXR 只含标注(JSON/CSV,兆级),不含任何像素数据;图像在 MIMIC-CXR-JPG 母库中,且需另行签署该数据集的 DUA。
症状:Image.open(file_name) 全部 FileNotFoundError;或误以为数据损坏反复重下标注包。
解决:

  1. 简单方法:在 PhysioNet 分别完成 MS-CXR 与 MIMIC-CXR-JPG 的 DUA 签署,整库下载 JPG 后本地拼接路径。
  2. 进阶方法:解析图像标识中的 subject/study/dicom 三段,按 files/p{前两位}/p{sid}/s{study}/{dicom}.jpg 规则只提取 1,047 张所需 JPG(代码见 §6.3 的 find_jpg)。
  3. SOTA 方法:用云镜像按需拷贝(GCS/S3),配合 DVC 记录图像清单哈希,实现"标注版本 ↔ 图像版本"双锁定。
    参考:PhysioNet MS-CXR 页(官方要求图像须另行从 MIMIC-CXR-JPG v2.0.0+ 下载)

⚠️ 坑点 2:论文里的 mIoU 互相不可比(分类:评估误用)

问题:无官方划分导致各家自建 split:ChEX 用 MIMIC val/test 子集(169 图/196 短语),MedRPG 用单框样本 20%(约 178 短语/162 图),MAIRA-2 用自建 held-out(176 短语/155 图)。
症状:同一"MS-CXR mIoU"下出现 46.51(ChEX)、58.91(TransVG)、59.29-61.88(MAIRA-2)等数字被错误排序,得出"A 比 B 强"的伪结论。
解决:

  1. 简单方法:引用数字时强制标注 split 口径(“mIoU on ChEX split”),禁止跨 split 比大小。
  2. 进阶方法:在同一自建受试者级 split 上重测候选模型,或按 MAIRA-2 的做法报告"与自己 split 交集"上的对比。
  3. SOTA 方法:公开固定 split 文件与评测脚本(固定 IoU 阈值扫描、CNR/mIoU 双指标),将 MS-CXR 评测协议固化为团队资产。
    参考:MAIRA-2 论文 Table 4 讨论、ChEX 论文 Table 1

⚠️ 坑点 3:按"对"随机切分导致受试者级泄漏(分类:数据泄漏)

问题:1,162 对来自 851 名受试者,平均每人贡献多对;同一受试者的多次检查影像高度相似。
症状:随机切分下 test 折里出现 train 折同受试者样本,mIoU/R@K 显著虚高,换真实外部队列立刻崩塌。
解决:

  1. 简单方法:解析受试者 ID,用 GroupShuffleSplit(groups=subject_id) 做受试者级切分。
  2. 进阶方法:StratifiedGroupKFold 同时按 category_id 分层、按 subject 分组,5 折交叉验证报告均值 ± 标准差。
  3. SOTA 方法:受试者 + 时间双切分(用 MIMIC-IV 关联检查时间,train 取早期、test 取晚期),顺带考察时序漂移。
    参考:scikit-learn GroupShuffleSplit 文档、§5.3

⚠️ 坑点 4:把"主导异常框"当"病灶全量标注"用(分类:标签理解)

问题:每对标注框住的是该短语所指异常的主导区域,不是该图全部病灶的穷尽式标注;一图可含多框(共 1,448 框)但远未覆盖所有异常。
症状:把未标注区域当负样本训练检测器,模型学会"框外即正常"的错误先验;或误以为可以从中导出全图病灶清单。
解决:

  1. 简单方法:只用"框内 vs 短语"的正样本对,不制造"框外 = 负类"的监督信号。
  2. 进阶方法:评估接地区域-文本相似度时采用 CNR(框内/框外对比噪声比)类指标——本来就以"框外区域"作参照而非负标签。
  3. SOTA 方法:需要全图级病灶清单时改用 Chest ImaGenome 场景图或 MIMIC-CXR CheXbert 标签,MS-CXR 只做局部对齐考核。
    参考:aka.ms/ms-cxr 背景章节、DCL 论文对 CNR/mIoU 的定义

⚠️ 坑点 5:"约均衡"设计 vs 实际长尾(分类:偏倚陷阱)

问题:论文称"约每类均衡"是采样设计意图;医生过滤后实际从 Cardiomegaly 333 对到 Edema 46 对,首尾相差 7 倍。
症状:整体 mIoU 被 Cardiomegaly/Pneumothorax 大类主导;Edema/Atelectasis 折内样本过少导致指标方差巨大。
解决:

  1. 简单方法:评测永远按类别分桶报告(每类 mIoU/AUROC),不只用宏平均。
  2. 进阶方法:训练侧对小类做加权采样(WeightedRandomSampler)或框级增广;注意增广不得破坏 bbox(见 §6.6)。
  3. SOTA 方法:对极小类报告 bootstrap 置信区间(MAIRA-2 风格),避免用 46 对样本的窄波动下结论。
    参考:PhysioNet MS-CXR 类别分布、§3.2

⚠️ 坑点 6:低估短语的"语言学难度"(分类:评估误用)

问题:短语是真实报告句,含位置修饰语(“left retrocardiac”)、复杂否定与报告风格偏倚;这是设计初衷(考语言理解),不是噪声。
症状:把短语当简单 caption 清洗掉否定/修饰后,评测退化为"词袋定位",失去基准鉴别力;或模型在含否定句上得分骤降却误判为标注错误。
解决:

  1. 简单方法:原样使用短语,评测脚本按句子长度/是否含否定词分桶报告。
  2. 进阶方法:文本编码器使用领域预训练模型(如 CXR-BERT 类),其对放射学术语与否定语义更稳。
  3. SOTA 方法:做错误分析时区分"定位错误"与"语言理解错误"两类失败,并对照 BioViL 论文的语义建模消融。
    参考:ECCV 2022 论文 §3.1、BioViL 模型页

⚠️ 坑点 7:把凭据数据喂给第三方 LLM/云 API(分类:工程陷阱)

问题:PhysioNet 于 2025-09 明确重申:凭据数据(含 MIMIC 系)禁止经 API 或在线平台发送给第三方服务;要求零数据留存,且平台自证不足以免责。
症状:为"让 GPT 帮我分析标注"把 JSON 或图像上传外部服务——构成数据使用协议违约,可能殃及全组数据权限。
解决:

  1. 简单方法:LLM 相关分析只在本地部署模型上进行(本地推理无此限制)。
  2. 进阶方法:确需云服务时,验证零数据留存、不用于训练、无人工审核三项并留存证据,定期复查平台政策变化。
  3. SOTA 方法:在数据管道层固化策略——所有外发请求经代理拦截凭据数据;团队 onboarding 含 DUA 合规检查单。
    参考:PhysioNet 关于 LLM 使用的官方声明(2025-09-24)、PhysioNet FAQ

⚠️ 坑点 8:版本与数字的"三重混淆"(分类:工程陷阱)

问题:三个易混点——PhysioNet 项目版本(v0.1 → v1.1.0)与数据文件版本(v1.0.0)不是一套编号;arXiv v1 曾写 1,153 对、PhysioNet/正式版为 1,162 对;MS-CXR(局部接地)与姊妹集 MS-CXR-T(时序任务,分类 1,326 例 + 句对 361)经常被混为一谈。
症状:论文里数字前后不一;把 MS-CXR-T 的"改善/恶化"标签错当 MS-CXR 功能来描述;评审揪住 1,153 vs 1,162 的矛盾。
解决:

  1. 简单方法:统一以 PhysioNet 当前页(v1.1.0)口径为准:1,162 对、1,047 图、851 人;写明"数据文件 v1.0.0"。
  2. 进阶方法:在实验记录中固定引用三元组——PhysioNet DOI(10.13026/b90j-vb87)+ ECCV 论文 DOI(10.1007/978-3-031-20059-5_1)+ 下载日期。
  3. SOTA 方法:数据版本管理(DVC/LakeFS)挂接官方版本号,pipeline 校验样本数(1,162/1,448/851/1,047 四个数)作 smoke test。
    参考:PhysioNet MS-CXR、MS-CXR-T、arXiv 2204.09817

§6.6 数据增强:安全与危险清单

操作 判定 说明
水平翻转 + bbox 镜像(x’ = W - x - w) ✅ 安全 胸片左右翻转在 CXR 文献中常规;必须同步变换框
纯缩放/整图 resize ✅ 安全 bbox 随比例同步缩放即可
轻度旋转(±10°)+ bbox 外接矩形修正 ⚠️ 谨慎 框会膨胀,小 IoU 阈值下误差放大
随机裁剪 ❌ 危险 可能裁掉框/异常,破坏"框-短语"对应
强力对比度/CLAHE ❌ 危险 改变 opacity/effusion 等密度类发现的视觉定义,干扰文本对应
对短语做同义替换/回译 ❌ 危险 破坏真实报告语言分布——本基准的价值恰在原句

翻转与缩放的"bbox 同步变换"参考实现(归一化坐标,先归一化再增广可避免坐标系混乱):

import torch
import torchvision.transforms.functional as TF

def safe_resize(img, box_norm, size):
    """resize 到固定尺寸:归一化框无需任何修改(这是先归一化的最大好处)"""
    return TF.resize(img, size), box_norm

def safe_hflip(img, box_norm, p=0.5, generator=None):
    """水平翻转:图像与框必须同变。归一化坐标下 x' = 1 - x - w"""
    if generator is None or torch.rand(1, generator=generator).item() < p:
        img = TF.hflip(img)
        x, y, w, h = box_norm.tolist()
        box_norm = torch.tensor([1.0 - x - w, y, w, h])
    return img, box_norm

def sanity_check_pair(img, box_norm, phrase):
    """增广后自检:框仍在 [0,1] 内,且宽高为正——CI 里跑全集一次即可"""
    x, y, w, h = box_norm.tolist()
    assert 0 <= x <= 1 and 0 <= y <= 1 and w > 0 and h > 0, f"非法框 {phrase[:40]}"

§6.7 模型推荐

模型 类型 与 MS-CXR 的关系 起点建议
BioViL(Microsoft) CLIP 式 VLP 原生配套:MS-CXR 随其论文发布 从 aka.ms/biovil-code 复现
MAIRA-2(Microsoft) 接地报告生成 在自建 held-out 上报 mIoU(13B 59.29) 参考 split 口径设计对比实验
ChEX 多任务定位/描述 4 类任务的 MS-CXR 评测框架 借鉴其"官方 val/test 子集"划分
MedRPG / TransVG 通用接地 常被引为对照基线 仅在同 split 下比较
自研 VLP — 微调(小类加权)或纯评测 先跑 §6.4 管线再谈模型

§6.8 硬件需求

场景 显存 说明
标注解析 + 可视化 CPU 即可 标注包兆级,PIL/matplotlib 足够
全集推理评测(384px) ≥8 GB 1,162 对一次前向,分钟级
接地/检索微调 ≥24 GB 文本+图像双塔,batch 16 起
接地模型预训练 多卡 ≥40 GB 建议直接用 BioViL 公开权重

§6.9 评估指标代码

<details>
<summary>mIoU / CNR / R@K 实现(约 40 行,点击展开)</summary>

import torch

def miou(pred_boxes, gt_boxes):
    """pred/gt: [N,4] 归一化 (x,y,w,h),同序配对(每对样本一一对应)"""
    px1, py1 = pred_boxes[:, 0], pred_boxes[:, 1]
    px2, py2 = px1 + pred_boxes[:, 2], py1 + pred_boxes[:, 3]
    gx1, gy1 = gt_boxes[:, 0], gt_boxes[:, 1]
    gx2, gy2 = gx1 + gt_boxes[:, 2], gy1 + gt_boxes[:, 3]
    ix = (torch.minimum(px2, gx2) - torch.maximum(px1, gx1)).clamp(min=0)
    iy = (torch.minimum(py2, gy2) - torch.maximum(py1, gy1)).clamp(min=0)
    inter = ix * iy
    union = pred_boxes[:, 2] * pred_boxes[:, 3] + gt_boxes[:, 2] * gt_boxes[:, 3] - inter
    return (inter / union).mean().item()

def cnr(sim_map, box_norm, hw):
    """对比噪声比:框内 vs 框外相似度差 / 框外标准差(BioViL 口径)
    sim_map: [H,W] 区域-文本相似度;box_norm: (x,y,w,h) 归一化"""
    H, W = hw
    x, y, w, h = [int(v * s) for v, s in zip(box_norm, (W, H, W, H))]
    inside = sim_map[y:y + h, x:x + w].flatten()
    mask = torch.ones_like(sim_map, dtype=torch.bool); mask[y:y + h, x:x + w] = False
    outside = sim_map[mask]
    return ((inside.mean() - outside.mean()) / (outside.std() + 1e-8)).item()

def recall_at_k(sim_matrix, k=10):
    """sim_matrix: [N_query, N_gallery],对角线为正确配对"""
    ranks = sim_matrix.argsort(dim=1, descending=True)
    correct = ranks == torch.arange(sim_matrix.size(0)).unsqueeze(1)
    return (correct[:, :k].any(dim=1).float().mean().item(),
            correct.float().argmax(dim=1).add(1).median().item())   # (R@K, MedR)

def per_class_report(mious, categories, n_boot=1000, seed=0):
    """按类别报告 mIoU 并给 bootstrap 95% CI(小类别必配,见坑点 5)
    mious: [(category_id, iou)];categories: {id: name}"""
    import random
    rng = random.Random(seed)
    by_cat = {}
    for cid, iou in mious:
        by_cat.setdefault(cid, []).append(iou)
    for cid, vals in sorted(by_cat.items()):
        means = []
        for _ in range(n_boot):
            sample = [vals[rng.randrange(len(vals))] for _ in vals]
            means.append(sum(sample) / len(sample))
        means.sort()
        lo, hi = means[int(0.025 * n_boot)], means[int(0.975 * n_boot)]
        print(f"{categories[cid]:<18} n={len(vals):<4} "
              f"mIoU={sum(vals) / len(vals):.3f}  95%CI=[{lo:.3f}, {hi:.3f}]")

</details>

§6.10 MLOps 笔记

  1. 版本双锁定:标注(PhysioNet v1.1.0 / 数据文件 v1.0.0)与图像(MIMIC-CXR-JPG v2.0.0+)分别记录版本与哈希;样本数四元组(1,162/1,047/1,448/851)写入 CI 冒烟测试。
  2. 合规即代码:凭据数据的访问凭证不进仓库;所有涉及数据的外发调用走代理策略(呼应坑点 7)。
  3. 评测可复现:split 文件(受试者级)与随机种子入库;报告指标时附 split 口径与置信区间(呼应坑点 2/5)。
  4. 漂移监控:若模型上线后迁移到其他医院影像,按 §7.6 建议监控报告风格与设备差异带来的接地质量退化。

一个最小可用的版本与划分配置样例(DVC + 固定种子):

# dvc.yaml 片段 + split 配置:双版本锁定与可复现划分
stages:
  prepare:
    deps:
      - data/ms-cxr/MS_CXR_Local_Alignment_v1.0.0.json   # 数据文件 v1.0.0
      - data/mimic-cxr-jpg/2.0.0/files/                  # 图像 v2.0.0+
      - configs/split_subject_k5_seed42.yaml
    outs:
      - artifacts/splits.json
    metrics:
      - metrics/smoke.json:                              # 冒烟四元组校验
          cache: false
# configs/split_subject_k5_seed42.yaml
# n_splits: 5
# group_by: subject_id        # 受试者级分组,防泄漏(坑点 3)
# stratify_by: category_id    # 8 类分层,防小类折内空缺(坑点 5)
# seed: 42

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 全部样本源自波士顿 BIDMC 一家机构 高 外部验证(§5.5);报告数字时声明单中心口径
类别不均衡 46 对(Edema)到 333 对(Cardiomegaly) 高 分类别评测、加权采样、bootstrap 置信区间
年龄偏高 平均 64.37 岁高于母库总体 56.85 岁(不采样健康人) 中 推理部署时明确目标人群;勿外推至年轻/筛查人群
表现型 vs 诊断混同 Lung Opacity 等是影像表现标签,非疾病诊断 中 按 §2.1 语义层级使用,勿直接当诊断码
报告风格偏倚 短语保留真实报告的语言习惯(含否定/风格) 中 设计目标使然;评测按语言学特征分桶(坑点 6)
标注视角单一 框为"主导异常"而非穷尽病灶(1,448 框/1,162 对) 中 勿造"框外即负类"监督(坑点 4)
纵向信息过滤残留 含纵向指涉(与旧片对比)的句子因妨碍接地被过滤 低 残余时序指涉极少;涉及时序研究请用 MS-CXR-T
多框共图权重 约 1/4 图像含多框,按图聚合与按对统计结论不同 低 明确统计单位(对/图/受试者)并在文中声明

§7.2 标注质量

标注由两名 board-certified radiologists 完成与验证:1,026 对为对既有区域标注(如 REFLACX 眼动椭圆)的审核与编辑,136 对为从零人工标注;另有 7 项过滤规则剔除不合格样本。局限:标注者间一致性系数未公布——需要量化一致性时,可在多框样本上自行估计医生框的 IoU 分布,或在标注协议允许范围内联系发布方。整体而言,这是胸片接地方向公认的高质量金标准,"小而可信"是它的核心资产。

§7.3 泛化性评估

目标场景 失效风险 证据与依据
其他医院/地区的胸片判读 高 单中心来源;设备与报告风格差异未在集内体现
移动/床旁摄片(AP 位、体位不正) 中 集内以前后位常规片为主,bbox 口径基于 JPG 呈现
儿童/年轻患者 高 集内平均 64.37 岁,无儿科样本
罕见异常与 8 类之外发现 高 类别体系固定为 8 类心肺异常
多语言报告场景 高 短语全为英文报告语言
时序进展判断 不适用 本集无纵向标签——需用 MS-CXR-T

§7.4 伦理考量

数据为脱敏后的 PHI 派生产物,经 MIMIC-CXR 脱敏管线处理;访问需 PhysioNet 凭证化 + DUA,禁止再分发与尝试再识别。团队协作时注意:每个成员须各自完成凭证化并独立签署 DUA,通过共享账号、邮件转发或网盘中转数据均属违约。2025-09 起官方进一步明确:凭据数据不得经 API/在线平台发送第三方服务(本地 LLM 例外)——对 AI 团队这是硬约束(坑点 7)。研究使用应遵循 DUA 全部条款,成果发表时按官方引用要求注明数据与平台来源(RRID: SCR_007345)。

§7.5 公平性评估

维度 现状 潜在影响
性别 女性 382/851(44.89%) 接近均衡,但按性别分层的接地性能仍值得报告
年龄 64.37 ± 16.61 岁,偏高 低龄群体上的表现完全无监督信号
种族/族裔 未随数据集发布 无法在集内做种族公平性分析;可经 MIMIC-IV 关联后补充
语言/地域 单一英语、单中心 跨语言/跨地域公平性无从考察

§7.6 数据漂移

MS-CXR 是静态基准,自身无漂移问题;风险在使用侧——模型若经其微调后部署于新机构,需监控:报告风格漂移(措辞习惯影响短语级语义)、设备漂移(灰度分布影响密度类发现定位)、人群漂移(年龄/病谱差异)。建议上线后以"医生抽检框 vs 模型框"的 IoU 分布做漂移哨兵指标。

§7.7 DAIMS 数据质量评估

# 检查项 状态 说明
1 宽格式数据 ✅ 提供 JSON 与 CSV 双形态,平铺即用
2 唯一标识 ✅ annotation id 主键 + image_id 外键 + 母库 subject/study 索引
3 特殊字符处理 ✅ 短语为原始报告文本,UTF-8 编码,解析无已知陷阱
4 重复行 ✅ 1,162 对各对应唯一框-句组合;多框共图为结构特性非重复
5 缺失编码 ⚠️ 标注对本身完整,但个体级元数据需回联 MIMIC-IV
6 标签标识清晰 ✅ categories 表显式给出 8 类 id↔name 映射
7 罕见类分组 ⚠️ Edema 46 对、Atelectasis 61 对,需分层与置信区间处理
8 偏倚评估 ✅ 单中心/年龄/类别不均衡均有官方统计支撑(§7.1)
9 数据字典 ✅ 论文+页面描述 COCO 结构;个别字段命名需以文件自检
10 信息性缺失解释 ✅ "缺什么去哪关联"路径明确(§4.5)
11 设备记录 ❌ 未随数据集发布任何采集设备字段
12 共线性 ✅ 标注为图-句-框三元组,无共线回归特征问题
13 编码映射 ⚠️ CheXbert 表现型标签与 ICD-11/SNOMED 仅部分可固化(§2.1)
14 时间戳处理 ❌ 标注文件不含检查时间;时序分析需回联母库或改用 MS-CXR-T
15 划分建议 ⚠️ 无官方划分,社区 split 多套互不兼容(坑点 2)
16 泄漏讨论 ✅ 受试者级泄漏路径清晰且可工程化解决(§5.3/坑点 3)
17 标签分布 ✅ 8 类分布完整公布(§3.2)
18 测量偏倚 ⚠️ 框-句经医生验证但标注者间一致性未公布(§7.2)
19 外部验证建议 ✅ 官方定位即评测基准,外部验证路径成熟(§5.5/§7.8)
20 版本记录 ✅ v0.1(2022-05)→ v1.1.0(2024-11)沿革清楚
21 预处理脚本 ⚠️ 官方提供 JSON→CSV 转换脚本;图像路径解析需自行实现
22 合规要求 ✅ 许可证、DUA、LLM 使用政策条款完备且可执行
23 多模态对齐 ✅ 图-句-框严格一一对齐,医生验证——本数据集立身之本
24 去标识化 ✅ 沿用 MIMIC-CXR 脱敏管线;短语经医生审核

DAIMS 评分:17.5 / 24

评分解读:良好偏优——作为评测基准,其标注质量、多模态对齐与合规体系达到第一梯队;失分集中在"母库分离"的结构性代价(无设备/时间戳/个体级元数据随附、无官方划分),而非标注本身。

对你意味着什么:如果你要做接地/检索评测,MS-CXR 是当前可放心引用的金标准——直接采纳,但必须自带受试者级划分与分类别报告。如果你的任务需要全图病灶清单、时序进展或个体级建模,它不能直接供给:前者转向 Chest ImaGenome/MIMIC-CXR 标签,后者转向 MS-CXR-T 或经 MIMIC-IV 关联补齐。任何情况下,先跑通"标注→图像"对齐管线(§6.3)再评估工程成本。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
MAIRA-2 held-out(MS-CXR 子集 176 短语/155 图) Microsoft 短语接地 mIoU 54.70(7B)/ 59.29(13B) — 接地能力随模型规模提升;报告了 bootstrap 95% CI
ChEX 划分(MIMIC val/test 内 169 图/196 短语) ChEX 作者团队 句子接地 mIoU 46.51 [44.68, 50.36] — 多任务模型在 MS-CXR 上与专用接地模型有差距
MedRPG 划分(单框样本 20%,约 178 短语) MedRPG 作者团队 短语接地 mIoU 59.37 — 单框子集上 2023 年已接近 60
DCL(PMLR v219) Wang et al. 接地+检索 CNR / mIoU / R@K / MedR — 去偏对比学习在 MS-CXR 上的接地-检索权衡分析

注:各行 split 口径不同,数值不可直接横向比较(坑点 2)。


§8 基准性能与生态

§8.1 排行榜:短语接地(mIoU 口径)

排名 模型 性能(mIoU) 年份 关键技术 完整引用 代码
1 MAIRA-2 13B 61.88(n≈178)/ 60.88(n=196)/ 59.29(n=176) 2024 接地报告生成,LLM 直接输出框坐标 Hyland et al., 2024, arXiv. 2406.04449 未全量开源
2 MAIRA-2 7B 57.78(n≈138)/ 57.56(n=30)/ 54.70(n=176) 2024 同上(7B 档) Hyland et al., 2024, arXiv. 2406.04449 未全量开源
3 MedRPG 59.37(n≈178) 2023 对比+注意力损失的短语接地 Chen et al., 2023(经 MAIRA-2 转引) —
4 TransVG 58.91(n≈178)/ 53.51(n=196) 2021→2023 复测 通用视觉接地 Transformer Deng et al., 2021, ICCV(经 MAIRA-2 转引) —
5 ChEX 46.51 [44.68, 50.36](n=196) 2024 多任务交互式定位+描述 Müller et al., 2024, arXiv. 2404.15770 —

⚠️ 数值不可直接比较:三组列分别对应 MedRPG 划分、ChEX 划分(MIMIC val/test 子集)与 MAIRA-2 自建 held-out,样本构成不同(坑点 2)。MedRPG/TransVG 数字经 MAIRA-2 论文转引。

§8.2 SOTA 总结与选型建议

截至 2026-09:MS-CXR 短语接地的公开最好成绩在 mIoU 60 上下区间(MAIRA-2 系列,自建 split),通用接地模型(TransVG)与医疗专用多任务模型(ChEX)之间仍有约 10 个点的可挖掘差距。选型建议:做报告接地系统 → 从 MAIRA-2 思路出发;做轻量多任务定位 → ChEX 路线;做表示质量研究(不训检测头)→ BioViL 类相似度热图 + CNR 指标。

你的目标 推荐路线 借助的 MS-CXR 用法
报告生成 + 可定位 findings MAIRA-2 式生成框 微调监督 + held-out 评测(自建 split)
轻量多任务临床工具 ChEX 式多任务头 官方 MIMIC val/test 子集口径评测
表示学习研究 BioViL/CXR-BERT 热图 CNR/Pointing Game,无需回归框
通用接地迁移研究 TransVG/MedRPG 基线 同一受试者级 split 重测对比
数据质量/审计研究 错误分析流水线 分类别 + 语言学分桶报告(坑点 5/6)

§8.3 评测协议

指标 定义 适用
mIoU 预测框与医生框交并比的均值(配对样本) 接地主指标
mAP@0.5 IoU≥0.5 判定的检测精度(聚合站口径) 多框/检测式评测
CNR 框内/框外相似度差 ÷ 框外标准差 无需回归框的表示评测(BioViL 口径)
Pointing Game 相似度峰值是否落入框内 弱监督定位
R@K / MedR / Recall 跨模态检索命中率与中位排名 图文检索
AUROC 区域分类(8 类)曲线下面积 Region Classification 任务

协议上的三条共识值得遵守:一是所有 IoU 类指标必须声明归一化坐标系与阈值口径(是固定 0.5 还是阈值扫描取最优);二是涉及句子级指标(如区域描述的 METEOR/F1)时注明是否使用 CheXbert 校准的临床有效性变体(ChEX 的 Mic-F1-14/Mac-F1-14 口径);三是任何指标都应伴随 split 口径声明(§5.2)与受试者级切分证明,这两项缺失的数字不建议引用。

数据集 关系 差异要点
MIMIC-CXR v2 / MIMIC-CXR-JPG 母库 全局对齐语料 + 图像本体来源
MS-CXR-T 姊妹集 时序任务(1,326 例分类 + 361 句对),考进展不考定位
REFLACX 上游 提供眼动椭圆候选区与听写转录
Chest ImaGenome 平行集 自动场景图,规模大、标注为解剖区域
VinDr-CXR / NIH ChestX-ray14 平行集 有框无短语,考检测不考语言
RSNA Pneumonia 平行集 胸片肺炎检测竞赛集,有框无文本(MS-CXR 论文用作对照)
NIH ChestX-ray14(8 类 bbox) 平行集 位置标注稀疏且非接地用途,弱监督研究更常用

§8.5 关键论文 Top 8

  1. Boecking, B., Usuyama, N., Bannur, S., et al., 2022. Making the Most of Text Semantics to Improve Biomedical Vision-Language Processing(BioViL,MS-CXR 配套论文). ECCV 2022, LNCS 13696. DOI: 10.1007/978-3-031-20059-5_1 — 发布 CXR-BERT 与 BioViL,并提出 MS-CXR 基准。
  2. Bannur, S., Hyland, S., Liu, Q., et al., 2023. MS-CXR-T: Learning to exploit temporal structure for biomedical vision-language processing. PhysioNet 1.0.0 — 姊妹集,时序分类与句子相似度双任务。
  3. Hyland, S., et al., 2024. MAIRA-2: Grounded Radiology Report Generation. arXiv:2406.04449 — 以 MS-CXR 验证生成式框输出,mIoU 新高。
  4. Müller, P., et al., 2024. ChEX: Interactive Localization and Region Description in Chest X-rays. arXiv:2404.15770 — 以 MS-CXR 构建 4 任务评测框架。
  5. Wang, X., et al., 2023. Sample-Specific Debiasing for Better Image-Text Models. PMLR v219 — 以 MS-CXR 的 CNR/mIoU/R@K 评测去偏对比学习。
  6. Johnson, A.E.W., et al., 2019. MIMIC-CXR: A de-identified publicly available database of chest radiographs with free-text reports. Scientific Data 6, 317. DOI: 10.1038/s41597-019-0322-5 — 母库论文。
  7. Smit, A., et al., 2020. CheXbert: Combining automatic labelers and expert annotations for accurate radiology report labeling. arXiv:2005.06366 — MS-CXR 候选句匹配所用的文本分类器。
  8. Pollard, T., et al., 2026. PhysioNet as a global platform for biomedical research. Nature Health — 官方要求的平台引用(RRID: SCR_007345)。

§8.6 社区活跃度

论文被引 309+(Springer/ECCV 页面口径,截至 2026-09);BioViL 预训练权重与代码经 aka.ms/biovil-models 与 aka.ms/biovil-code 公开;MS-CXR 已成为 grounded report generation 与医学短语接地方向的默认评测集之一(MAIRA-2、ChEX、MedRPG、DCL 等后续工作均以它为考核场)。相对 MIMIC-CXR 母库的社区体量,MS-CXR 生态小而专——讨论多散见于论文与 mmft/BioViL 代码仓 issue,而非独立论坛。

三个活跃度观察(截至 2026-09):其一,作为评测集的引用持续增长(接地、检索、可解释性三类论文均引用);其二,作为微调资源的使用以生成式接地为主线(MAIRA-2 系);其三,随 PhysioNet 对 LLM 使用政策的收紧,社区讨论焦点从"怎么下载"转向"怎么合规地在管线中使用凭据数据"——这直接影响以 MS-CXR 为例证的教学与自动化评测设计。

§8.7 生态快照

资源 类型 链接 推荐理由
PhysioNet 官方页 数据托管 physionet.org/content/ms-cxr/1.1/ 唯一官方分发渠道(截至 2026-09)
Microsoft 官方页 项目主页 aka.ms/ms-cxr 背景、引用格式与 RRID
BioViL 代码 官方代码 aka.ms/biovil-code 原生支持 MS-CXR 评测的参考实现
BioViL 权重 预训练模型 aka.ms/biovil-models 零成本获得强文本编码器与热图基线
MS-CXR-T 姊妹数据集 PhysioNet(2023-03-17 发布) 时序方向扩展
ECCV 2022 论文 论文 arXiv 2204.09817 构建协议与实验细节

§9 相关资源与引用

§9.1 官方资源清单

§9.2 BibTeX 完整引用

@inproceedings{boecking2022making,
  title     = {Making the Most of Text Semantics to Improve Biomedical Vision-Language Processing},
  author    = {Boecking, Benedikt and Usuyama, Naoto and Bannur, Shruthi and Coelho de Castro, Daniel and Schwaighofer, Anton and Hyland, Stephanie and Wetscherek, Maria Teodora and Naumann, Tristan and Nori, Aditya and Alvarez-Valle, Javier and Poon, Hoifung and Oktay, Ozan},
  booktitle = {Computer Vision -- ECCV 2022, Part XXXVI},
  series    = {Lecture Notes in Computer Science},
  volume    = {13696},
  pages     = {1--21},
  year      = {2022},
  publisher = {Springer},
  doi       = {10.1007/978-3-031-20059-5_1}
}

@data{boecking2022mscxr,
  title   = {MS-CXR: Making the Most of Text Semantics to Improve Biomedical Vision-Language Processing},
  author  = {Boecking, Benedikt and Usuyama, Naoto and Bannur, Shruthi and Coelho de Castro, Daniel and Schwaighofer, Anton and Hyland, Stephanie and Wetscherek, Maria Teodora and Naumann, Tristan and Nori, Aditya and Alvarez-Valle, Javier and Poon, Hoifung and Oktay, Ozan},
  year    = {2022},
  version = {1.1.0},
  publisher = {PhysioNet},
  doi     = {10.13026/b90j-vb87},
  url     = {https://physionet.org/content/ms-cxr/1.1/}
}

@data{bannur2023mscxrt,
  title   = {MS-CXR-T: Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing},
  author  = {Bannur, Shruthi and Hyland, Stephanie and Liu, Qianchu and P{\'e}rez-Garc{\'i}a, Fernando and Ilse, Maximilian and Coelho de Castro, Daniel and Boecking, Benedikt and Sharma, Harshita and Bouzid, Kenza and Schwaighofer, Anton and Wetscherek, Maria Teodora and Richardson, Hannah and Naumann, Tristan and Alvarez-Valle, Javier and Oktay, Ozan},
  year    = {2023},
  version = {1.0.0},
  publisher = {PhysioNet},
  url     = {https://physionet.org/content/ms-cxr-t/1.0.0/}
}

@article{johnson2019mimiccxr,
  title   = {MIMIC-CXR: A de-identified publicly available database of chest radiographs with free-text reports},
  author  = {Johnson, Alistair E. W. and Pollard, Tom J. and Berkowitz, Seth J. and Greenbaum, Nathaniel R. and Lungren, Matthew P. and Deng, Chih-ying and Mark, Roger G. and Horng, Steven},
  journal = {Scientific Data},
  volume  = {6},
  pages   = {317},
  year    = {2019},
  doi     = {10.1038/s41597-019-0322-5}
}

@article{smit2020chexbert,
  title   = {Combining Automatic Labelers and Expert Annotations for Accurate Radiology Report Labeling Using BERT},
  author  = {Smit, Akshay and Jain, Saahil and Rajpurkar, Pranav and Pareek, Anuj and Ng, Andrew Y. and Lungren, Matthew P.},
  journal = {arXiv preprint arXiv:2005.06366},
  year    = {2020}
}

§9.3 引用指南

使用 MS-CXR 时建议三件套引用:① ECCV 2022 论文(方法与基准);② PhysioNet 数据 DOI(数据本身,注明版本);③ PhysioNet 平台引用(官方要求,RRID: SCR_007345)。若使用了 MS-CXR-T,另引其条目。报告中涉及规模数字时注明口径来源(PhysioNet 当前页 vs 论文版本),避免 1,153/1,162 类版本歧义(坑点 8)。


§10 AI 使用声明卡

§10.1 AI 模型列表

用途 模型 版本 使用日期
资料检索与汇总 CodeBuddy(fast-model) 2026-09 2026-09-13
事实核查 WebSearch 工具链 2026-09 2026-09-13

§10.2 AI 参与范围

AI 完成了:6+ 轮 WebSearch 检索与交叉核证、FACTS 事实清单整理、本条目全部章节初稿撰写、格式与校验器适配。人工完成了:检索策略与事实取舍审定、医学与工程表述复核、终稿签发。所有关键数字均附来源链接,未能核实的字段一律省略而非臆测。

§10.3 输入来源列表

  1. PhysioNet. 2022 (v1.1.0, 2024). MS-CXR: Making the Most of Text Semantics to Improve Biomedical Vision-Language Processing. https://physionet.org/content/ms-cxr/1.1/
  2. Boecking, B., et al., 2022. Making the Most of Text Semantics to Improve Biomedical Vision–Language Processing. ECCV 2022, LNCS 13696, pp 1-21. https://doi.org/10.1007/978-3-031-20059-5_1
  3. Boecking, B., et al., 2022. 同上(arXiv 预印本版). https://arxiv.org/abs/2204.09817
  4. Microsoft. 2022. MS-CXR 项目官方页. https://aka.ms/ms-cxr
  5. 检索综述:Automated Radiology Report Generation: A Review of Recent Advances, 2024. arXiv:2405.10842(MS-CXR 1,047 图/1,162 对与 MS-CXR-T 描述)
  6. Hyland, S., et al., 2024. MAIRA-2: Grounded Radiology Report Generation. arXiv:2406.04449(mIoU 数字与 split 口径)
  7. Müller, P., et al., 2024. ChEX: Interactive Localization and Region Description in Chest X-rays. arXiv:2404.15770(4 任务评测框架与 169/196 子集)
  8. Wang, X., et al., 2023. Sample-Specific Debiasing for Better Image-Text Models. PMLR v219(1,448 框口径、CNR/mIoU/R@K 协议). https://proceedings.mlr.press/v219/wang23b/wang23b.pdf
  9. PhysioNet. 2026. Frequently Asked Questions(凭证化流程、CITI、下载与共享限制). https://www.physionet.org/about/faqs
  10. MIT LCP. 2024. How do I get access to MIMIC? https://mimic.mit.edu/docs/faq/how-to-get-access.html
  11. PhysioNet. 2025-09-24. Use of MIMIC Data with Large Language Models and Online Services. https://www.physionet.org/?topic=mimic&page=7/
  12. PhysioNet. 2024. Resources 列表页(MS-CXR v1.1.0 与 MS-CXR-T 1.0.0 元数据). https://physionet.org/content/?topic=vision-language+processing
  13. Springer Nature. 2026. ECCV 2022 论文页引用快照(309 Citations / 5,928 Accesses,截至 2026-09). https://link.springer.com/chapter/10.1007/978-3-031-20059-5_1
  14. Bannur, S., et al., 2023. MS-CXR-T. PhysioNet 1.0.0(经 Google Scholar 条目核对规模口径:N=1,326 / N=361)
  15. KEGG GenomeNet. ICD-11 检索快照(CA40 Pneumonia 等). https://www.genome.jp/kegg-bin/get_htext?htext=br08411.keg
  16. NCBO BioPortal. SNOMED CT 36118008 Pneumothorax. https://bioportal.bioontology.org/ontologies/SNOMEDCT?conceptid=36118008
  17. HL7 LT IG. ValueSet: Incidental Finding(SNOMED 95436008 Lung consolidation 等). https://build.fhir.org/ig/HL7LT/ig-lt-lung/branches/main/en/ValueSet-incidental-finding.html
  18. sota2.com. MS-CXR Benchmark 聚合快照(mAP@0.5、Pointing Game 等,仅作参考). https://www.sota2.com/research/dataset/ms-cxr

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
frontmatter 与 INFOBOX 关键字段 千方病案医学编辑部 与 PhysioNet/Springer 原始页逐项比对 ✅ 已验证
§1-§3 规模与版本数字 千方病案医学编辑部 检索来源交叉核证(FACTS.md 逐条溯源) ✅ 已验证
§2 医学背景与术语映射 千方病案医学编辑部 ICD-11/SNOMED 浏览器快照核对,未核实编码不填 ✅ 已通过
§4-§6 数据结构与代码 千方病案医学编辑部 代码逻辑审读 + 校验器全绿 ✅ 已通过
§6.5 八个坑点 千方病案医学编辑部 逐条对应官方文档/论文/政策原文 ✅ 已验证
§7 DAIMS 24 项与评分 千方病案医学编辑部 逐项核对状态与说明一致性 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及 Springer 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema 字段逐项校验与 frontmatter 一致性 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§1.2 战略价值、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.1 排行榜、§8.7 生态快照、§C JSON-LD。

§10.6 最后人工审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)


§C 结构化数据(JSON-LD)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mimic-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • latte-cxr — 共享标签:医学影像 / 多模态 / X光影像
  • ms-cxr-t — 共享标签:医学影像 / 多模态 / X光影像 / 影像-文本对齐
  • rsna-series — 共享标签:医学影像 / 多模态 / X光影像
  • quilt-1m — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • padchest — 共享标签:医学影像 / 多模态 / X光影像
  • reflacx-xray-localization — 共享标签:医学影像 / 多模态 / X光影像
  • radvlm-instruction-dataset — 共享标签:医学影像 / 多模态 / X光影像
  • radialog-instruct-dataset — 共享标签:医学影像 / 多模态 / X光影像
  • roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集