MS-CXR-T — 胸片时序视觉语言基准 AI-Ready Wikipedia

1,326 对胸片 + 361 对报告句的时序双任务基准:给医学 VLP 模型装上'时间之眼'

来源 MIMIC-CXR v2 图像对与报告句:Chest ImaGenome silver 标签 gold 提升 + RadGraph/CXR-BERT-Specialized 句对构建,全部经板证放射科医生人工裁决发布时间: 2026-09-24最后更新: 2026-09-25 阅读 28
MS-CXR-T — 胸片时序视觉语言基准 AI-Ready Wikipedia

信息速览

数据集名称MS-CXR-T — 胸片时序视觉语言基准 AI-Ready Wikipedia
数据类型时序标注,人工标注,基准评估集
规模800 名患者(1,326 图像对)+ 361 报告句对(MIMIC-CXR v2 派生,板证放射科医生金标准)
接入方式MIMIC-CXR v2 图像对与报告句:Chest ImaGenome silver 标签 gold 提升 + RadGraph/CXR-BERT-Specialized 句对构建,全部经板证放射科医生人工裁决
AI 就绪度

INFOBOX:ms-cxr-t 速览

字段 值
数据集 MS-CXR-T: Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing v1.0.0
slug ms-cxr-t
发布 2023-03-17(单版本至今)|PhysioNet
DOI 10.13026/pg10-j984(v1.0.0)/ 10.13026/ga7g-1614(latest)
访问 Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程)
母项目 MIMIC-CXR Database v2.0.0(本库 rid 16)
任务一 时序图像分类:1,326 图像对 / 800 患者,五病理三态
任务二 时序句子相似度:361 句对(RadGraph 117 + Swaps 244)
标注 板证放射科医生逐条裁决|gold 提升 + 盲审复标|label_quality 三值
类分布 全库 improving 18% / stable 40% / worsening 42%(不均衡是设计内的临床现实)
论文 BioViL-T,CVPR 2023(arXiv 2301.04558,v1 2023-01-11)
榜首 BioViL-T Top-1 81.1 / AUC 0.883(vs BioViL 0.831);句子任务 87.77/.933
团队 Microsoft Research 15 人(Bannur/Oktay/Wetscherek/Lungren 论文版等)
一句话 微软给医学 VLP 出的"时间科目"考卷:图要会看前后片,句要会辨恶化与好转

§0 摘要卡:当模型只看一张片子,它错过了什么

§0.1 它是什么

MS-CXR-T 是微软研究院 2023 年挂在 PhysioNet 上的时序双任务基准,配套 CVPR 2023 论文 BioViL-T(“Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing”)。它考模型两门课:看图(1,326 对前后胸片,判断五个病理是好转、稳定还是恶化)和读句(361 对放射报告句,判断两句是同义改写还是时序矛盾)。数据全部派生自 MIMIC-CXR v2(本库 rid 16),全部标签经 board-certified 放射科医生人工裁决。

§0.2 三个数字

  • 1,326:时序图像分类的样本数(五 finding × 三态,横跨 800 名患者)——每个样本是一对图(当前片 + 最近先片),不是一张图。
  • 361:句子相似度的句对数(paraphrase 141 / contradiction 220)——RadGraph 实体匹配造了 117 对,CXR-BERT-Specialized 关键词交换造了 244 对。
  • 81.1 / 0.883:BioViL-T 在分类任务上的 Top-1 / AUC(vs 静态版 BioViL 的 0.831)——宏口径下同模型只有 60.2,类不均衡把两个口径拉开 21 个百分点。

§0.3 谁在用、怎么接

模型作者用它当考卷(论文 Table 3/6 的成绩单都建在它上面);基准工程师用它纵向追踪文本编码器的时序敏感度(PubMedBERT 60.39 → CXR-BERT-S 78.12 → BioViL-T 87.77 的爬坡线);数据集考古用它补全 MIMIC-CXR 家族谱系(母库 rid 16 → 加工层 rid 617 → 静态接地 rid 340 → 本集时序双任务)。获取走 PhysioNet Credentialed(License 1.5.0 + DUA 1.5.0 + CITI),拿到两个 CSV 后用自己的 MIMIC-CXR 图像池按 DICOM ID 提片子。

§0.4 本条目怎么读

§1 身份卡 → §2 时序为何被忽视 → §3/§4 双任务构建解剖(gold 提升与句对工程)→ §5 成绩单多口径存照 → §6 生态位与标注三级阶梯 → §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 九十问 → 附录 A-H(含 Table 1-3 全录与口径差异存照)。

§1 身份卡:一张速览

字段 值
全称 MS-CXR-T: Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
slug / 本库编号 ms-cxr-t / 519
挂牌 2023-03-17(PhysioNet,版本 v1.0.0 唯一)
DOI v1.0.0:10.13026/pg10-j984;latest:10.13026/ga7g-1614
访问 Credentialed——仅签署 DUA 的认证用户可取文件
License PhysioNet Credentialed Health Data License 1.5.0
DUA PhysioNet Credentialed Health Data Use Agreement 1.5.0
必修课程 CITI “Data or Specimens Only Research”
Topics disease progression / cxr / vision-language processing / chest x-ray / radiology / multimodal
项目主页 microsoft.com/.../learning-to-exploit-temporal-structure-for-biomedical-vision-language-processing/
文件 2 个 CSV(时序分类标签表 + 句子相似度表)
Views 407(2026-09 快照,四年累计)
RRID SCR_007345
母库 MIMIC-CXR Database v2.0.0(页面 Parent Projects 段明示)

身份卡三行补注:

版本史:单版本 v1.0.0 挂牌至今无修订——2023-03-17 之后 PhysioNet 上没有任何 v1.0.1 或 v2。对照 517 MIMIC-CXR-JPG 的 v2.0.0→v2.1.0 演化,本集是"一次发布即终版"的基准型数据集(考卷不换题)。

双 DOI 语义:pg10-j984 锁 v1.0.0,ga7g-1614 是 latest 占位——基准引用应固定 pg10-j984(论文 BibTeX 也是这个),ga7g-1614 只在跟踪未来修订时使用。

"数据工件"自我定位:页面 Ethics 原话 “MS-CXR-T is a research artifact of the corresponding work”——它不遮掩自己是论文附件的身份,复现性与基准评估是它存在的全部理由。

§2 背景:时序为什么被忽视了三年

§2.1 "静态考试"的一代基准

页面 Background 段的判断:生物医学 VLP(vision-language processing)的主流基准都在考"静态"任务——单张图的疾病检测(如 CheXpert,本库 rid 5)、短语接地(如 MS-CXR,本库 rid 340)。病灶在哪、是什么,一张片就够。但临床读片的真实动作是对比:"与 prior 片相比,左肺积液增多。"报告里的 interval/enlarged/unchanged/resolution 这些词全在指涉一张不存在的图——训练时模型只拿到当前那一张。

论文 Abstract 的表述更狠:把报告里的时序内容对齐到单图,“does not only introduce poor alignment between the modalities but also a missed opportunity”——既有错位,又有浪费:MIMIC-CXR 患者动辄十几份检查,纵向自监督信号就躺在那里没人用。

§2.2 私有数据的复现困境

页面 Background 还点名了一个生态问题:时序方向的先行工作(引 Shamout et al. 2021 npj Digital Medicine 的 COVID 恶化预测系统)建立在私有数据上,“lack of publicly available multi-modal benchmark datasets”——学界连量化"模型会不会看时间"的考卷都没有。MS-CXR-T 的立项动机就是把这张考卷公开。

§2.3 BioViL-T:考卷背后的答案

数据集与 BioViL-T 框架同源同发(CVPR 2023):CNN-Transformer 混合多图编码器,联合文本模型训练,显式吃进先图与先报告;设计上正面处理两个临床现实——位姿错位(不用显式配准)与先图缺失(单图输入优雅降级)。三大 SOTA:进展分类、短语接地、报告生成;句子相似度与疾病分类同步增益。本集就是这套框架的"官方考试卷"——作者自己出题,自己先答(81.1/0.883),把题本留给后人。

§2.4 命名学术圈谱系

一条线看 Microsoft 的 Chest X-ray VLP 系列命名:BioViL(2022 ECCV,Boecking et al.,静态预训练)→ CXR-BERT(同文文本模型,General/Specialized 两版)→ MS-CXR(本库 rid 340,静态短语接地基准)→ MS-CXR-T(本集,时序双任务基准,T = Temporal)→ BioViL-T(时序版框架)。字母后缀全部有语义:T 不是涡轮增压,是 temporal——拿到这批条目名先拆后缀,是读 Microsoft 系数据集的家规。

§2.5 读片工作流里的时序真相:报告的写法就是证据

一个常被忽略的侧写:放射报告的结构本身就为时序而生。报告的 Impression 段几乎每句都在做对比——“interval enlargement”(间隔增大)、“unchanged”(无变化)、“compared to prior”(与前片相比)。论文预训练时专门只取 Impression 段(MLM 额外用 Findings 段),因为"关键发现已经被 Impression 捕获"。换句话说:报告语言是时序语言,VLP 模型却长期只拿单图去对齐——模态错位的根源不在数据,在建模假设。本集的句子任务(361 对)正是把这个观察变成了可量化的考题:模型若读得懂报告的时序语言,就应在 Swaps/RadGraph 两子集上同时及格。

§3 任务一解剖:1,326 对图像的 gold 提升工程

§3.1 数据结构

字段 含义
study_id / previous_study_id 当前/先片对应的报告标识
dicom_id / previous_dicom_id 当前/先片的 DICOM 标识
subject_id 患者标识(直通 MIMIC-CXR)
{FINDING}_progression 三态:improving / stable / worsening(按 finding 分列)
{FINDING}_label_quality 三值:multiple_experts / disagreement / one_expert

每个样本 = 同一 subject 的图像对(当前片 + 按采集时间戳确定的最近先片)× 五病理各自的进展标签。影像本体不在库——CSV 只存 ID 与标签,图像从 MIMIC-CXR v2 自取。

§3.2 silver→gold 五步提升法

构建起点是 Chest ImaGenome(本库 rid 330)的 silver 进展标签(由报告自动规则导出),MS-CXR-T 的做法是人工把 silver 提升为 gold:

  1. 抽样:随机抽 silver 集内的候选 study,排除已被 ImaGenome gold 验证过的;
  2. 去歧义:滤掉同一病理存在多个矛盾进展标签的 study(如"左胸腔积液增多 + 右胸腔积液稳定"——病理级标签无法单值化);
  3. 专家裁决:board-certified 放射科医生逐条 accept/reject;裁决时给两样材料——当前片的完整报告 + 自动标签的来源句(刻意模仿 ImaGenome gold 的构建方法,保证提升不引入方法断裂);
  4. 盲审复标:子集交第二位放射科医生盲标(不看已有标签)以测 inter-observer agreement;
  5. 图像 QC:一 study 多张 frontal 片时,由放射科医生选出最佳片,保证入集影像的诊断质量。

这五步里藏着本库"标注工程三级阶梯"的又一级:616 是全自动指令分割,617 是双规则引擎弱监督(687 份人工验证),518 是双人共识全量金标准,而 519 是"机器预标 + 板证金标 + 盲审一致性"的混合制——规则引擎省力、专家把关、盲审出质量指标。

§3.3 属性映射:一句话的口径迁移

Chest ImaGenome 用 “Pulmonary edema/hazy opacity”,CheXbert/CheXpert 生态用 “Edema”——MS-CXR-T 显式声明前者映射为后者,其余四病理直接对应。映射只有一句话,但它是两个数据集标签体系互操作的唯一官方说明——跨集合并标签时先对齐这一条。

§3.4 分布全录与不均衡的现实

Finding 样本数 类分布(I/S/W) 患者数
Consolidation 201 14% / 42% / 44% 187
Edema 266 31% / 26% / 43% 241
Pleural effusion 411 19% / 49% / 32% 370
Pneumonia 237 8% / 25% / 67% 218
Pneumothorax 211 15% / 55% / 30% 148
Total 1,326 18% / 40% / 42% 800

页面给出的人口学解释:患者更可能在病情稳定或恶化时拍片(复查或急诊),好转时反而不来拍——improving 类天然稀缺。Pneumonia 最极端:improving 只占 8%(约 19 例),而 worsening 占 67%。这不是标注缺陷,是"拍片行为"本身的选择机制——考卷出题人把这个现实原样留在了题里,并把"该用宏口径"写进了 Usage Notes(§5.3)。

§3.5 双标一致性:披露边界

label_quality 三值(multiple_experts / disagreement / one_expert)是页面给的全部质量信号;盲审子集的规模与一致率(κ 或百分比)页面未披露数字——协议细节在论文 Appendix C。引用时如实写"双标子集存在、质量标签三值、具体一致率未在数据集页面披露",不要替它编一个 κ。

§4 任务二解剖:361 对句子的时序语义工程

§4.1 数据结构

字段 含义
sentence_1 premise(前提句)
sentence_2 hypothesis(假设句)
category paraphrase(同义改写)/ contradiction(时序矛盾)
subset_name Swaps(关键词交换)/ RadGraph(实体匹配)

§4.2 三步构建管线

第一步:收集与过滤候选句。 从 MIMIC-CXR 报告出发,用 Stanza constituency parser(Zhang et al. 2021 JAMIA,参考文献 [8])切出单句;用 CheXbert(Smit et al. 2020 EMNLP,[6])过滤出提及五个目标病理(Consolidation / Edema / Pleural Effusion / Pneumonia / Pneumothorax)的句子;再保留至少含一个时序关键词的句子——页面明说这个过滤是"high sensitivity"(高召回优先,宁滥勿缺,把精度留给后面的人工关)。

第二步:造对,两条路线并行。

  • RadGraph 路线:把句池里的句子解析成 RadGraph(本库 rid 561)实体图,按实体匹配配对——唯一放宽的匹配约束是时序关键词与病理提及。这条路造出来的对允许措辞与句法的自由变化(“slight increase in left basal consolidation” ↔ “slight interval progression of left basal consolidation”),考的是真语义理解。
  • Swaps 路线:在单句内把时序关键词换成 CXR-BERT-Specialized 的 top-5 masked token 预测(限定候选为时序词)。这条路造出来的对只差少数几个词(“Unchanged small-to-moderate right pleural effusion” ↔ “Stable small-to-moderate right pleural effusion”),考的是模型对个别触发词的敏感度——近义的 Unchanged/Stable 是 paraphrase,方向相反的 worsening/resolution 就是 contradiction。

第三步:人工过滤与裁决。 板证放射科医生逐对验证,标注 paraphrase 或 contradiction。三类直接剔除:语义差异不清晰的、差异存在但与时序无关的、语法错误的。

§4.3 分布与例句全录

子集 Paraphrase Contradiction 合计
RadGraph 42 75 117
Swaps 99 145 244
Total 141 220 361

页面 Table 2 四个例句原样:

子集 标签 句 1 句 2
Swaps Paraphrase Unchanged small-to-moderate right pleural effusion Stable small-to-moderate right pleural effusion.
Swaps Contradiction Interval worsening of the right-sided pneumothorax. Interval resolution of the right-sided pneumothorax.
RadGraph Paraphrase There has also been a slight increase in left basal consolidation. There is slight interval progression of left basal consolidation.
RadGraph Contradiction Right mid and lower lung consolidations are unchanged. There has been worsening of the consolidation involving the right mid and lower lung fields.

§4.4 为什么两条路都要有

只看 Swaps 子集,模型可以靠"个别词不同"的捷径得分;只看 RadGraph 子集,措辞自由度又让弱模型把语义错误归咎于句法噪声。两子集并存给出了捷径对照:一个模型若 Swaps 上强、RadGraph 上弱,说明它在靠表面词汇匹配而非真时序语义。PubMedBERT 与 CXR-BERT-G 在 MS-CXR-T 上的崩溃(60.39/62.60)对照它们在句法更像的 RadNLI 上的体面成绩(81.38/87.59),正是这种"捷径依赖"的证据(§5.2)。

§4.5 二分类的评估姿势

Usage Notes 给出的推荐玩法:对句对算 embedding 余弦相似度,选阈值后报 accuracy 或 AUROC。这是个零样本任务——不微调,直接测文本编码器的时序敏感度。四个模型的成绩单(§5.2)正是这么测出来的。

§5 成绩单:两个口径,四个模型,一份榜单

§5.1 时序分类:81.1 的正面与背面

论文主口径:BioViL-T 在 MS-CXR-T 分类任务 Top-1 81.1 / AUC 0.883,静态版 BioViL AUC 0.831,时序预训练带来 5.2 个 AUC 点的爬升。同场对比:CheXRelNet(图卷积跨 ROI)、CNN+Transformer 基线、BioViL+affine 配准(4 DoF)变体。

第三方聚合(sota2.com)按宏口径重列的每病理 Macro Acc:BioViL-T 平均 60.2(Pleural effusion 67 / Edema 61.9 / Pneumothorax 42.6 / Consolidation 61.1 / Pneumonia 68.5)vs BioViL 57.8。81.1 与 60.2 的 21 点落差不是谁算错了——前者吃到了 stable/worsening 多数类的红利,后者对 improving 少数类公平计价。数据集自己的 Usage Notes 站在宏口径一边:明文推荐 macro-F1 / macro-accuracy,且建议按病理分列报告(有的病理就是比别的难)。

引用纪律由此立起来:引 81.1 必须注明是 plain Top-1(不均衡类下的加权体感),引 60.2 必须注明是宏平均(第三方聚合口径)——两者并存是本集最重要的口径存照。

§5.2 句子相似度:文本编码器的时序爬坡线

模型 MS-CXR-T Acc MS-CXR-T AUC RadNLI Acc RadNLI AUC
PubMedBERT 60.39 .542 81.38 .727
CXR-BERT-General 62.60 .601 87.59 .902
CXR-BERT-Specialized 78.12 .837 89.66 .932
BioViL-T 87.77±0.5 .933±.003 90.52±1.0 .947±.003

这张表的信息密度在两列对照上:MS-CXR-T 考时序语义,RadNLI(145 对)考静态 NLI。CXR-BERT-Specialized 从 CXR-BERT-G 微调而来(同一基座、单图监督),静态只涨 2 分,时序却从 62.60 暴涨到 78.12;BioViL-T 再靠时序预训练爬到 87.77,同时静态不掉反涨(90.52)——论文结论"temporal pre-training helps static tasks too"的数据支柱就在这两列。

§5.3 其余战场(BioViL-T 全面战绩)

任务 BioViL-T BioViL 增益
Report generation ROUGE-L 0.276 0.268 +0.008
Report generation BLEU-4 0.116 0.097 +0.019
CheXpert 肺炎 AUC 0.882 0.870 +0.012
MS-CXR grounding CNR 1.33±0.04 1.07±0.04 +0.26
MS-CXR grounding mIoU 0.240±0.005 0.229±0.005 +0.011
MS-CXR grounding accuracy 72.4 71.0 +1.4

静态任务不掉点、时序任务大涨——这是论文把"时序学习"卖成通用增益而非专项技巧的底气。

§5.4 预训练与评测的底账

BioViL-T 预训练吃 MIMIC-CXR v2 的 frontal 片 + 有 Impression 段的报告:174.1k 训练对 / 4.9k 验证对,其中多图对 118.8k + 单图对 55.3k(多数样本带先图);下游共享测试集 2,971 样本;微调用 Chest ImaGenome 标签。消融三连:静态/时序特征分解是单图任务不崩的关键;位置编码是时序任务分辨先后顺序的关键;局部对比损失是语言监督有意义的关键。数据 curation(即本集 gold 提升那批标注回流微调)再贡献 0.68pp。

§5.5 模型卡自认的边界

HF 模型卡 Limitations 三条:英语 only;ICU 时距短(数小时至数天),跨年长间隔扫描上性能可能降级(解剖变化大);不用于自动诊断或医疗器械。第三条是所有 PhysioNet 医学 AI 工件的标准姿势,前两条是时序建模者真正要防的坑——拿 MS-CXR-T 调好的模型直接用于慢病年度复查对比,超出了训练分布。

§5.6 数据效率视角:时序预训练的少样本红利

论文用 sota2 收录的标签比例消融给出了另一条证据线:把微调标签砍到 10%,BioViL-T 的各病理 Macro Acc 仍有 59.7/62.4/35.3/62.6(Effusion/Pneumonia/PTX/Edema 量级),而全量标签的 BioViL 是 56.1/62.3/41.7/67.5——时序预训练让模型在十分之一的标注下就逼近静态版全量水平。对标注预算紧张的团队,这是本集与 ImaGenome 分流的又一层含义:先在时序预训练上买"数据效率",再用金标签把最后几个点买回来。

同场的零样本提示线(labels=0%):BioViL-T prompt 版 Macro Acc 53.6/59.7/34.9/64.2——不训练也有三分之二类过半的正确率,说明时序语义确实被预训练吸收进了表示层,而非全靠微调灌注。

§6 生态位:时序基准的稀缺与家族谱系

§6.1 四兄弟对照:MIMIC-CXR 派生的标注层

16 母库 617 JPG 340 MS-CXR 519 本集
内容 227,835 studies + 报告 377,110 JPG + 14 类标签 712 图局部对齐框 1,326 图对 + 361 句对
时间观 纵向原始库 静态逐图 静态接地 时序双任务
标注引擎 医生书写报告 CheXpert+NegBio 规则 放射科医生画框 板证医生裁决 + 盲审
规模哲学 全量 全量弱监督 小而精 小而金
主任务 底座 分类预训练 短语接地 进展分类 + 句子相似度

MS-CXR(340)与 MS-CXR-T(519)是同门姊妹:前者考"病灶在图上对应哪个短语"(静态空间对齐),后者考"两个时间点之间发生了什么"(时序语义)。BioViL-T 在两份考卷上都是第一名。

§6.2 上游工具链的四条供货线

  • Chest ImaGenome(rid 330):silver 进展标签供货商——本集 1,326 对的标签起点,映射规则见 §3.3;
  • RadGraph(rid 561):句对 RadGraph 子集的实体图引擎——117 对的骨架;
  • CheXbert / CheXpert(rid 5):句子过滤的病理分类口径 + Edema 映射的命名规范;
  • Stanza(Zhang 2021):报告切句的句法解析器。

一个基准集,四条上游供货线——它不是孤岛,是 MIMIC-CXR 生态工具链的集成测试床。

§6.3 标注工程三级阶梯(本库叙事补全)

梯级 条目 标注制式 人参与量
全自动 616 mimic-cxr-ext-ils 指令模板分割 0
弱监督 617 mimic-cxr-jpg 规则引擎 + 687 份人工验证 验证级
双人共识 518 mimic-iv-ext-pe 一明一盲全量金标 κ=0.82 全量双标
金标混合 519 本集 机器预标(silver/句对)+ 板证裁决 + 子集盲审 全量裁决 + 子集双标

519 的位置在 518 与 617 之间:全量标签有专家逐条把关(高于 617 的弱监督),但起点是机器预标(不同于 518 的"医生从零读报告")。四种制式四条条目,标注工程的选项空间在本库集齐。

§6.4 基准型数据集的"低流量高引用"形态

Views 407(四年)——对照 617 挂牌四年数千的浏览量,本集流量小一个量级。但它是 CVPR 2023 论文的官方 benchmark,论文引用随时间累积,考卷的下载量天然小于教材(MIMIC-CXR)。基准型数据集的生态位评估要跟论文引用走,不能只看 PhysioNet 计数器。

§6.5 三条"机器预标"路线的对照:本库加工层方法论横评

616 ext-ils 617 jpg 519 本集
机器预标 指令模板分割 CheXpert+NegBio 规则 ImaGenome silver / RadGraph 配对
人工介入 0(全自动发布) 687 份验证集 全量裁决 + 子集盲审
标签空间 分割指令 14 类五值 五病理三态 + 句对二分类
输出形态 指令微调对 训练级弱标签 评测级金标
适用场景 指令模型微调 大规模预训练 模型能力横评

三条路线回答三个不同的问题:616 回答"指令数据怎么零人工扩产",617 回答"全库标签怎么自动化",519 回答"模型能力怎么被可信地量化"。机器预标在三处的角色也不同——616 里它就是全部,617 里它是主体(人工只验质量),519 里它是候选生成器(人工全量收口)。同一段"自动化+人工"光谱上,三个条目把三个站位都占齐了。

§7 AI-Ready 十问

一问:什么格式? 两个 CSV:MS_CXR_T_temporal_image_classification_v1.0.0.csv(1,326 对标签)+ MS_CXR_T_temporal_sentence_similarity_v1.0.0.csv(361 对标注)——零解析成本,pandas 直接吃。

二问:多大规模? 分类 1,326 图像对/800 患者;句子 361 对(141 paraphrase/220 contradiction)。注意这是基准评估集的体量——考卷不厚,题题金标。

三问:标注是什么性质? 板证放射科医生逐条裁决:图像对走 silver→gold 提升 + 子集盲审复标,句对逐对验证分类。质量信号是 label_quality 三值(multiple_experts/disagreement/one_expert);具体双标一致率未在页面披露。

四问:许可与门槛? Credentialed:License 1.5.0 + DUA 1.5.0 + CITI “Data or Specimens Only Research”——与全部 MIMIC 派生集同一套流程,认证过 MIMIC-CXR 的团队可无缝接。

五问:伦理完备度? 双重披露制:母库 MIMIC-CXR 的全部伦理考量继承 + 自身偏移明示(平均 64.99 vs 56.85 岁、女性 45.88% vs 52.39%,引 Weber 2017 “complete data” 筛选偏倚框架);COI 无。

六问:可复现性? 论文(CVPR 2023)+ 模型(HF microsoft/BiomedVLP-BioViL-T)+ 代码(HI-ML GitHub)+ 考卷(本集)四件套齐发,aka.ms/ms-cxr-t 一键到 PhysioNet——复现链路是本集存在的全部意义。

七问:标签的可信边界? improving 类稀缺是拍片行为的选择机制(Pneumonia improving 仅 8%);ICU 短时距(HF 卡明示跨年扫描可能失效);单 finding 多标签的 study 已被剔除——病理级单值标签,区域级进展不在集内。

八问:适合什么任务? VLP 模型的时序能力评测(分类+句子双科目)、文本编码器时序敏感度追踪、类不均衡评测方法论教学(双口径存照)、MIMIC-CXR 家族谱系研究。

九问:不适合什么? 训练语料(1,326 对喂不饱深度模型——论文微调用的是 ImaGenome 全量标签而非本集);影像获取(本体不在库,需另申 MIMIC-CXR v2);跨年慢病时序(ICU 时距限制);区域级(解剖区)进展标注(ImaGenome 的 22 区域场景图才做这个)。

十问:一句话定位? 微软给医学 VLP 出的"时间科目"考卷——1,326 道看图题加 361 道读句题,题题放射科医生把关,公开了一场"模型到底会不会看时间"的标准化考试。

DAIMS 评估:数据可得性 6(Credentialed 标准流程,图像需另接母库)/ 标注 9(板证金标 + 盲审复标,全量人工裁决)/ 方法 8(双任务构建管线在论文+页面双披露,四件套开源)/ 影响力 7(CVPR 2023 官方基准 + HF 生态挂载,四年稳定引用)/ 规模 5(1,687 个评估单元,基准型体量)——DAIMS:7.0(对照:617 弱监督全量 7.8、518 双人共识 7.0、340 静态接地 7.2)。

§8 误解与反直觉

误解一:“1,326 个样本是不是太少了?” 这是考卷不是教材——基准评估集的体量标准是"题题金标 + 每格分布可解释",不是训练集的"多多益善"。对照:GLUE 也只有几千到几万句,没人嫌它小。

误解二:“数据集叫 MS-CXR-T,就是 MS-CXR 加了个 T。” 字母后缀有语义但内容不同源——MS-CXR(340)是短语接地的边界框(712 图),MS-CXR-T 是时序双任务(1,326 对 + 361 句对)。两者唯一的交集是团队、母库和 BioViL 生态。

误解三:“Top-1 81.1 说明模型已经 80 分了。” 宏口径下 BioViL-T 是 60.2——Pneumothorax 的 Macro Acc 只有 42.6(近乎瞎猜的三类基线是 33)。81.1 是多数类红利下的体感分数,页面 Usage Notes 明文劝你用宏口径。

误解四:“improving 类少是标注事故。” 是临床现实:好转的患者不来复查。Pneumonia 的 improving 8%(约 19 例)直接反映了"肺炎好转后拍片动机骤降"的就诊行为——考卷故意保留这个偏倚并要求考生用宏口径应对。

误解五:“Swaps 和 RadGraph 是两种标签。” 是两种造对方法,标签都是 paraphrase/contradiction 二分类。RadGraph 允许措辞自由变化,Swaps 只动时序关键词——子集名是"出题方式"的元信息,也是捷径检测的分组变量。

误解六:“句子对是报告原文对。” 不全是——Swaps 子集的 hypothesis 句是生成的(时序关键词被 CXR-BERT-Specialized 的 masked 预测替换),RadGraph 子集从真实报告句池配对但经过实体对齐筛选。premise 句是真实报告句,hypothesis 未必。

误解七:“图像数据集所以图像也在 PhysioNet 上。” 不在——本集只有两个 CSV(ID + 标签)。图像要从 MIMIC-CXR v2(rid 16)按 dicom_id 自取,等于又一道 Credentialed 门槛(同一套认证可复用)。

误解八:“数据集作者就是论文作者。” 两份名单不一致:PhysioNet 挂 15 人(含 Richardson/Naumann,无 Thieme/Lungren/Nori),arXiv 论文 16 人(反之)。合规审查与标注贡献者进了数据集署名,NLP 大牛进了论文署名——引用时看清你引的是哪个工件。

误解九:“时序基准所以时间跨度大。” ICU 数据的现实:先片与当前片间隔常为数小时至数天。HF 模型卡明示跨年扫描性能可能降级——这批考题测的是"住院期间的纵向变化",不是慢病管理的年度随访。

误解十:“盲审就是双人共识。” 盲审(第二位医生不看已有标签复标)是质量测量手段,不是全量双标——多数样本只有 one_expert 单标,盲审只覆盖子集。518 的"双人共识全量"比这里重一档。

误解十一:“Chest ImaGenome 标签拿来就能用,何必再标。” silver 标签是规则引擎从报告自动导出的——正是其噪声促使 MS-CXR-T 造 gold 提升。ImaGenome gold 已有验证(约 2.9%),本集的增量是"排歧 + 板证裁决 + 盲审测质量"的第三层加工。

误解十二:“基准集数字直接写进论文就行。” 三个口径纪律:分类引 81.1 注明 plain Top-1、宏口径注明第三方聚合 60.2、句子任务引用固定 v1.0.0 DOI(pg10-j984)。口径不注明,审稿人第一个来教你。

§8.13 坑点表(八坑)

坑点 典型翻车 绕行姿势
坑点1:当训练集用 1,326 对喂深度模型直接过拟合 只做评测;微调走 ImaGenome 全量标签(§5.4)
坑点2:只报 plain Top-1 81.1 的虚高被审稿人拆穿 并报宏口径(BioViL-T 60.2),按病理分列(§5.1)
坑点3:图像随 CSV 一起下载 找不到图像文件 图像在 MIMIC-CXR v2(rid 16),按 dicom_id 自取(§1)
坑点4:跨年扫描上直接部署 模型在长间隔对上崩 HF 卡明示 ICU 短时距边界;慢病随访需另验(§5.5)
坑点5:盲审当全量共识 高估标注冗余 盲审仅子集;多数 one_expert 单标(§8 误解十)
坑点6:Swaps/RadGraph 混报 捷径效应被平均掉 分子集报告;对照两线成绩识别表面匹配(§4.4)
坑点7:引用 latest DOI 版本漂移 基准引用固定 pg10-j984(v1.0.0)(§1)
坑点8:把 Edema 映射当等价 跨集合并标签错位 映射是单向声明:ImaGenome “Pulmonary edema/hazy opacity”→CheXbert “Edema”(§3.3)

§9 工作实例:从两个 CSV 到一次时序评测

§9.1 加载与盘点(纯 pandas)

import pandas as pd

# 任务一:时序图像分类
img = pd.read_csv('MS_CXR_T_temporal_image_classification_v1.0.0.csv')
print(img.shape)  # 逐 finding 宽表:每行一个图像对
# 五病理的标签列:{FINDING}_progression / {FINDING}_label_quality
for f in ['Consolidation', 'Edema', 'Pleural Effusion', 'Pneumonia', 'Pneumothorax']:
    col = f'{f}_progression'
    if col in img.columns:
        print(f, img[col].value_counts().to_dict())
# 目标分布(Table 1):Total 1326 对 / 800 subjects
#   Consolidation 201 | Edema 266 | Pleural effusion 411 | Pneumonia 237 | Pneumothorax 211

# 任务二:时序句子相似度
txt = pd.read_csv('MS_CXR_T_temporal_sentence_similarity_v1.0.0.csv')
print(txt['category'].value_counts())
# contradiction    220
# paraphrase       141
print(txt['subset_name'].value_counts())
# Swaps       244
# RadGraph    117

§9.2 图像对的取片路径(MIMIC-CXR v2)

# 图像本体不在本集——按 ID 从母库取(需 MIMIC-CXR v2 Credentialed 认证)
#   dicom_id / previous_dicom_id -> files/p10/p1xxxxxxx/sxxxxxxxx-xxxxxxxx/xxx.jpg
#   (或经 617 MIMIC-CXR-JPG 的 JPG 池,ID 同源)
# 每个样本 = [当前片, 先片] 两张 frontal 图 -> 多图编码器
# label_quality 过滤建议:
gold_multi = img[img['Pneumothorax_label_quality'] == 'multiple_experts']
#   multiple_experts = 双标一致的最强子集;disagreement = 分歧保留样本

§9.3 句子相似度的零样本评测(HF 模型卡姿势)

import torch
from transformers import AutoModel, AutoTokenizer

url = "microsoft/BiomedVLP-BioViL-T"
tokenizer = AutoTokenizer.from_pretrained(url, trust_remote_code=True)
model = AutoModel.from_pretrained(url, trust_remote_code=True)

pairs = list(zip(txt['sentence_1'], txt['sentence_2']))
sims = []
for s1, s2 in pairs:
    out = tokenizer.batch_encode_plus([s1, s2], add_special_tokens=True,
                                      padding='longest', return_tensors='pt')
    emb = model.get_projected_text_embeddings(input_ids=out.input_ids,
                                              attention_mask=out.attention_mask)
    sims.append(torch.cosine_similarity(emb[0:1], emb[1:2]).item())

# 余弦相似度当 logits -> 扫阈值 -> 报 accuracy / AUROC
# 论文口径:BioViL-T 87.77 acc / .933 AUC(361 对)
# 分子集对照:Swaps 244 vs RadGraph 117(§4.4 捷径检测)

§9.4 分类评测的宏口径清单

from sklearn.metrics import balanced_accuracy_score, f1_score

# 1. 全局 Top-1(plain accuracy)——引用时注明口径
# 2. 宏平均(macro-F1 / balanced accuracy)——页面 Usage Notes 推荐
# 3. 按病理分列——Pneumothorax 的 42.6 与 Pleural effusion 的 67 要分开看
# 4. 类分布表(Table 1)随结果一起报告——improving 18% 的背景必须交代

§9.5 一个研究问题的最小闭环

“我的时序模型比 BioViL-T 强吗?”——取本集两个 CSV → 句子任务零样本测(阈值扫描)→ 分类任务微调后宏口径五病理分列 → 与 87.77/60.2 两条线对表 → 双标子集(multiple_experts)上复测稳定性 → 报告口径按 §8 坑点 2 的清单来。全程不需要碰 MIMIC-CXR 图像(句子任务),分类任务图像获取走 rid 16/617 的认证链。

§9.6 常见报错速查

  • KeyError: ‘Edema_progression’——CSV 列名可能是 ‘Pleural Effusion’ 带空格的病理全名:先 print(img.columns.tolist()) 再拼列名;
  • 图像路径 404——dicom_id 要经 MIMIC-CXR 的 metadata 文件映射到 p10/p1xxxxxxx/sxxxxxxx/ 两级目录,直接拼 patient id 会错;
  • HF 加载超时——BioViL-T 卡要求 trust_remote_code=True,漏掉会直接抛 ValueError 而不是 404;
  • 阈值取 0.5——余弦相似度不是概率,0.5 附近没意义:论文协议是扫描后取验证集最优,评测脚本照抄官方仓。

§10 FAQ:九十问速查

§10.1 身份与获取(9 问)

Q1:MS-CXR-T 是什么?

A:微软研究院 2023 年发布的时序双任务基准:1,326 对胸片图像的进展分类标签 + 361 对报告句的相似度标注,配套 CVPR 2023 论文 BioViL-T。

Q2:slug 为什么是 ms-cxr-t?

A:PhysioNet 官方 URL slug;批次队列登记名 ‘MS’ 是截断——本库按官方 slug 入册(rid 619)。

Q3:版本情况?

A:单版本 v1.0.0(2023-03-17 挂牌至今唯一版本)——基准考卷不换题。

Q4:DOI 引哪个?

A:基准引用固定 v1.0.0 的 10.13026/pg10-j984;latest 的 10.13026/ga7g-1614 只在跟踪未来修订时用。

Q5:怎么获取?

A:PhysioNet Credentialed:注册认证 + 签 DUA 1.5.0 + 完成 CITI ‘Data or Specimens Only Research’ 课程,然后下载两个 CSV。

Q6:图像文件在哪?

A:不在本集——本集只有 CSV(ID+标签)。图像按 dicom_id 从 MIMIC-CXR v2(本库 rid 16)取,同一认证可复用。

Q7:访问要花多少钱?

A:PhysioNet Credentialed 免费——成本是认证流程时间与 CITI 课程,不是钱。

Q8:文件多大?

A:页面未披露 Total Size(抓取时文件区显示地区限制提示)——两个 CSV 是纯表格,体量以 MB 计。

Q9:项目和论文的对应关系?

A:页面 Project Website 指向微软研究院的论文页;数据集是论文的官方研究工件(research artifact)。

§10.2 任务一:时序图像分类(9 问)

Q10:分类任务考什么?

A:给一对前后胸片,判断五个病理(实变/水肿/胸腔积液/肺炎/气胸)各自是好转、稳定还是恶化——五科独立的三分类题。

Q11:1,326 是什么数?

A:图像对总数:每对含当前片与最近先片(同一患者,按采集时间戳就近取)。

Q12:800 是什么数?

A:去重后的患者数(subject_id 去重)——有患者贡献多对。

Q13:三态标签怎么定义?

A:improving / stable / worsening——从先片到当前片的病情走向,由放射科医生对照报告裁决。

Q14:每类的分布?

A:全库 improving 18% / stable 40% / worsening 42%;最极端的 Pneumonia 是 8%/25%/67%。

Q15:为什么 improving 这么少?

A:患者好转时不来拍片——就诊行为的选择机制,页面原文给了这个解释,不是标注事故。

Q16:先片怎么选的?

A:同一 subject 内按采集时间戳取最近的前一次——‘nearest prior image’,页面 Methods 明示。

Q17:label_quality 三值什么意思?

A:multiple_experts(双标一致)/ disagreement(双标分歧,保留)/ one_expert(单人单标)——标签可信度的元信息。

Q18:能用来训练吗?

A:不建议——1,326 对喂不饱深度模型;论文微调用的是 Chest ImaGenome 全量标签,本集定位是评测。

§10.3 任务二:句子相似度(9 问)

Q19:句子任务考什么?

A:两句话是 paraphrase(同义改写)还是 contradiction(时序矛盾)——测文本编码器的时序语义敏感度。

Q20:361 对怎么构成?

A:RadGraph 子集 117 对(paraphrase 42/contradiction 75)+ Swaps 子集 244 对(99/145)。

Q21:RadGraph 造对法?

A:把句子解析成 RadGraph 实体图按实体匹配配对,只放宽时序关键词与病理提及的匹配约束——允许措辞与句法变化。

Q22:Swaps 造对法?

A:句内替换时序关键词,候选来自 CXR-BERT-Specialized 的 top-5 masked token 预测——句间只差几个词。

Q23:句子从哪来?

A:MIMIC-CXR 报告:Stanza constituency parser 切句 → CheXbert 过滤出五病理相关句 → 保留含时序关键词的(高召回过滤)。

Q24:什么叫 contradiction?

A:两句在病情走向上矛盾:‘Interval worsening of the right-sided pneumothorax’ vs ‘Interval resolution of…’——一处恶化一处好转。

Q25:人工把关在哪一步?

A:最后一步:板证放射科医生逐对裁决分类;语义不清、与时序无关、语法错误的直接剔除。

Q26:premise/hypothesis 都是原文吗?

A:premise 是真实报告句;Swaps 的 hypothesis 是关键词替换后的生成句——引用例句时注意来源差异。

Q27:怎么评估?

A:零样本:算句对 embedding 余弦相似度当 logits,扫阈值报 accuracy/AUROC——Usage Notes 给的官方姿势。

§10.4 标注与质量(9 问)

Q28:谁做的标注?

A:board-certified 放射科医生——页面致谢段点名 Dr Maria Teodora Wetscherek 承担临床输入与数据标注。

Q29:图像标签的来源链条?

A:Chest ImaGenome silver 标签 → 排歧 → 板证医生逐条 accept/reject(给报告+来源句)→ gold。

Q30:盲审是怎么做的?

A:子集交第二位放射科医生盲标(不看已有标签)以测 inter-observer agreement——质量测量手段,非全量双标。

Q31:双标一致率多少?

A:数据集页面未披露具体 κ/百分比——只有 label_quality 三值间接承载;协议细节在论文 Appendix C。

Q32:silver→gold 提升排除了什么?

A:同一病理有多个矛盾进展标签的 study(如左积液增多+右积液稳定)——病理级单值标签无法成立的直接排除。

Q33:图像有质量控制吗?

A:有——一 study 多张 frontal 片时由放射科医生选最佳片,保证入集影像诊断质量。

Q34:‘Pulmonary edema/hazy opacity’ 映射?

A:Chest ImaGenome 的这个属性映射为 CheXbert 口径的 ‘Edema’——两个标签体系互操作的唯一官方说明。

Q35:一共有多少人工裁决?

A:全量 1,326 对图像标签 + 361 对句子标注都经板证医生裁决——‘manually annotated and reviewed’ 是 Abstract 的原话。

Q36:标注和 MS-CXR(340)的标注是一回事吗?

A:不是——340 是放射科医生在图上画病理边界框(空间对齐),本集是进展三态与句子分类(时序语义)。

§10.5 成绩单与口径(9 问)

Q37:BioViL-T 的成绩?

A:分类 Top-1 81.1 / AUC 0.883;句子任务 87.77±0.5 / AUC .933±.003——两个科目都是榜首。

Q38:宏口径下多少?

A:第三方聚合的每病理 Macro Acc 平均 60.2(BioViL 57.8)——与 Top-1 的 21 点落差是类不均衡所致。

Q39:为什么两个口径都要报?

A:页面 Usage Notes 明文推荐 macro-F1/macro-accuracy 并按病理分列——plain Top-1 吃多数类红利,宏口径对 improving 公平。

Q40:PubMedBERT 成绩?

A:句子任务 60.39 / .542——比 CXR-BERT-G 还低,接近抛硬币;它在 RadNLI 上有 81.38,静态强时序崩。

Q41:CXR-BERT 两个版本差在哪?

A:General 62.60 / .601,Specialized 78.12 / .837——同一基座、单图监督微调,时序语义大涨而静态(RadNLI)只涨 2 分。

Q42:时序预训练伤静态任务吗?

A:不伤——BioViL-T 在 RadNLI 90.52 / .947 反超所有对照;phrase grounding、报告生成、CheXpert 分类同步增益。

Q43:对比基线有哪些?

A:CheXRelNet(图卷积跨 ROI)、CNN+Transformer、BioViL(含 affine 4-DoF 配准变体)——论文 Table 3/4 全列。

Q44:数据 curation 值多少分?

A:+0.68pp(聚合口径)——gold 标注回流微调的净增益,论文 A.4 的消融结论。

Q45:消融的三个关键?

A:静态/时序特征分解(单图任务不崩)、位置编码(分辨先后顺序)、局部对比损失(语言监督有意义)。

§10.6 生态与家族(9 问)

Q46:母库是什么?

A:MIMIC-CXR Database v2.0.0(本库 rid 16)——图像对与句子都取自它的 227,835 studies。

Q47:和 MS-CXR(rid 340)什么关系?

A:同门姊妹:340 考静态短语接地(712 图边界框),本集考时序双任务——BioViL-T 在两份考卷上都第一。

Q48:和 Chest ImaGenome(rid 330)什么关系?

A:上游供货商:本集分类标签从其 silver 进展标签提升而来;ImaGenome 本体是 22 区域场景图+进展标签。

Q49:和 RadGraph(rid 561)什么关系?

A:工具依赖:句对 RadGraph 子集用其实体图引擎配对——117 对的骨架。

Q50:和 MIMIC-CXR-JPG(rid 617)什么关系?

A:平行加工层:617 是全库 37.7 万图的 14 类静态弱监督标签,本集是小而金的时序标签——规模换精度 vs 精度换规模。

Q51:BioViL/BioViL-T 是数据集吗?

A:是模型框架(HF microsoft/BiomedVLP-BioViL-T),不是数据集——本集是它们的官方评测基准。

Q52:代码在哪?

A:HI-ML GitHub(aka.ms/biovil-t-code);模型卡在 HF——四件套(论文/模型/代码/考卷)齐发。

Q53:aka.ms/ms-cxr-t 是什么?

A:论文脚注 4 的官方短链,直指 PhysioNet 本集页面。

Q54:RSNA Pneumonia 在论文里干嘛?

A:零样本/微调分类的对照考场(Shih 2019,参考文献 [1])——与本集无隶属关系,只是同场竞技。

§10.7 许可与合规(9 问)

Q55:License 是什么?

A:PhysioNet Credentialed Health Data License 1.5.0——Credentialed 档最严的文件许可。

Q56:DUA 是什么?

A:PhysioNet Credentialed Health Data Use Agreement 1.5.0——使用协议,签署后才能下载。

Q57:要上什么课?

A:CITI ‘Data or Specimens Only Research’——PhysioNet 认证的标准必修。

Q58:能商用吗?

A:License 1.5.0 框架下以研究为主;任何用途先读 DUA 条款——与全部 MIMIC 派生集同一套规则。

Q59:再分发可以吗?

A:不可以随意再分发——用户各自走 PhysioNet 认证,数据不出 Credentialed 围栏。

Q60:伦理审查谁背书?

A:母库 MIMIC-CXR 的伦理框架全部继承;本集自身做筛选偏移披露(§7 五问)——双重披露制。

Q61:COI 声明?

A:页面明示 ‘The authors have no conflicts of interest to declare’。

Q62:合规审查有谁?

A:致谢段点名 Hannah Richardson 指导数据集合规审查(compliance review)——数据集署名含她而论文不含。

Q63:和 PhysioNet 2026 平台什么关系?

A:页面底部引 Pollard et al. 2026(Nature Health, doi:10.1038/s44360-026-00096-z)——PhysioNet 平台的新官方引用,与本集内容无关但引用格式要带。

§10.8 偏移与伦理(9 问)

Q64:年龄偏移多少?

A:平均 64.99 岁 vs 母库 56.85 岁——本集偏老约 8 岁。

Q65:性别偏移多少?

A:女性 45.88% vs 母库 52.39%——偏少约 6.5 个百分点。

Q66:为什么偏移?

A:纳入条件是’两连续片上可见 finding’——老年与病情变化者更可能满足;页面原文用了 ‘could potentially explain’ 的审慎措辞。

Q67:偏移是谁披露的?

A:页面 Ethics 段自我披露 + 论文同步披露——‘we have disclosed this both alongside the dataset and in the corresponding work’。

Q68:引用了什么偏倚框架?

A:Weber et al. 2017 JAMIA——'按 complete data 筛选 EHR 引入偏倚’的方法论经典(References [10])。

Q69:这个偏移致命吗?

A:页面自评 relatively small shifts;本集主要用途是基准复现而非流行病学推断——用途不同,偏移的杀伤力不同。

Q70:有 IRB 信息吗?

A:本集是派生工件,无新患者数据——伦理重心在母库 MIMIC-CXR(其 BIDMC 框架),页面不重复。

Q71:能用于临床决策吗?

A:不能——HF 模型卡明示不用于自动诊断或医疗器械;本集是研究基准。

Q72:儿科能用吗?

A:不能——MIMIC-CXR 是成人 ICU 库,本集继承;儿科时序需另找数据。

§10.9 工程与复现(9 问)

Q73:CSV 键怎么接 MIMIC?

A:subject_id/study_id/dicom_id 直通 MIMIC-CXR 生态——join metadata 文件定位图像路径,join reports 拿原文。

Q74:分类任务怎么算分?

A:三态三分类:plain Top-1 + 宏口径(balanced acc / macro-F1)+ 按病理分列——三件一起报(§9.4 清单)。

Q75:句子任务怎么算分?

A:embedding 余弦相似度 → 阈值扫描 → accuracy/AUROC;RadGraph/Swaps 分子集报(§4.4 捷径检测)。

Q76:模型权重怎么拿?

A:HF microsoft/BiomedVLP-BioViL-T,AutoModel + trust_remote_code=True——模型卡有 get_projected_text_embeddings 的官方用法。

Q77:能只测文本模型吗?

A:能——句子任务与图像无关,361 对直接测任意文本编码器(PubMedBERT 等就是这么上表的)。

Q78:预处理有什么坑?

A:句子按 CheXbert 五病理过滤的口径要与训练时一致;图像对取片时 DICOM 路径大小写与 meta 文件严格对应。

Q79:怎么复现 87.77?

A:用 BioViL-T 官方权重 + get_projected_text_embeddings + 阈值扫描;细节差在 pool 策略——模型卡与论文附录 E 是两份说明书。

Q80:图像 QC 的’最佳片’在哪标记?

A:不在 CSV 里——QC 是入集前的筛选步骤,入集即每 study 一张最佳片;CSV 不含 QC 元信息。

Q81:评估代码有官方版吗?

A:论文代码仓(HI-ML)含评测管线;社区亦有多套复现——以官方仓为准,第三方实现注意阈值协议差异。

§10.10 对比与选型(9 问)

Q82:要时序图像标签,选它还是 ImaGenome?

A:要全量训练信号选 ImaGenome(silver 全库);要金标评测选本集(1,326 对板证裁决)——训练与考试分开。

Q83:要句子级 NLI,选它还是 RadNLI?

A:时序语义选本集(361 对,两子集捷径检测);静态 NLI 选 RadNLI(145 对,论文用作静态对照)——两份考卷互补。

Q84:要短语接地,选它还是 MS-CXR?

A:静态接地选 340;时序能力选本集——BioViL-T 论文把两者都当考场。

Q85:要弱监督大规模标签,选什么?

A:617 MIMIC-CXR-JPG(37.7 万图 14 类五值)——规模优先的经典选择。

Q86:要报告层病种金标,选什么?

A:518 MIMIC-IV-Ext-PE(19,942 份双人共识五类)——文本层全量金标的参照系。

Q87:519 在标注三级阶梯里的位置?

A:金标混合级:机器预标(silver/句对)+ 板证全量裁决 + 子集盲审——介于 617 弱监督与 518 双人共识之间。

Q88:同类时序基准还有谁?

A:胸片时序方向公开基准稀缺正是本集立项理由(页面 Background 点名私有数据困境)——直连竞品少。

Q89:CheXpert 在论文里干嘛?

A:肺炎分类的对照考场(AUC 0.882 vs 0.870)——rid 5 的另一个出场方式。

Q90:一句话总结选型?

A:考时序语义:图像对 + 句对本集全包;要训练语料去 ImaGenome/617;要静态对齐去 340。

Q90:一句话总结选型?

A:考时序语义:图像对 + 句对本集全包;要训练语料去 ImaGenome/617;要静态对齐去 340。

Q91:数据集会更新吗?

A:四年无修订(单版本 v1.0.0)——基准考卷的稳定是特性不是缺陷;latest DOI(ga7g-1614)用于跟踪未来可能的修订,日常引用固定 pg10-j984。

Q92:和 RadNLI 是什么关系?

A:互补考卷——RadNLI(145 对)考静态 NLI,本集考时序语义;论文用两者对照证明"时序预训练静态不掉点"(§5.2 双列表)。RadNLI 不在 PhysioNet 本集页面的 Parent Projects 里,是论文层面的对照集。

Q93:为什么叫"基准"而不是"数据集"?

A:两者都是——PhysioNet 收录其为 project(数据集身份),论文定位其为 benchmark(评测身份)。本条目按"基准型数据集"处理:体量小、金标、考卷不换题、跟论文引用走。

Q94:拿到数据第一步做什么?

A:读两个 CSV 的 schema(§3.1/§4.1 表)→ 盘分布(§9.1 脚本)→ 决定评测协议(宏口径/分子集)→ 最后才去申请 MIMIC-CXR 图像(句子任务完全不需要图像)。

(FAQ 实际 94 问——九十问速查为栏目名,按组覆盖身份/任务/标注/成绩/生态/合规/伦理/工程/选型九域)

§11 事实清单:核查记录

  1. slug ms-cxr-t(批次队列登记 ‘MS’ 为截断;官方 slug 为准)
  2. 挂牌 2023-03-17(页面 Published 字段)
  3. 版本 v1.0.0 单版本(Versions 段仅一条记录)
  4. DOI v1.0.0 = 10.13026/pg10-j984(页面 DOI (version 1.0.0) 字段)
  5. DOI latest = 10.13026/ga7g-1614(页面 DOI (latest version) 字段)
  6. Access Policy:仅签署 DUA 的认证用户(页面原话)
  7. License 1.5.0(PhysioNet Credentialed Health Data License)
  8. DUA 1.5.0(PhysioNet Credentialed Health Data Use Agreement)
  9. 必修 CITI ‘Data or Specimens Only Research’
  10. RRID:SCR_007345(citation 块内)
  11. Topics 六个:disease progression/cxr/vision-language processing/chest x-ray/radiology/multimodal
  12. Project Views 407(2026-09 快照)
  13. Current Version Views = All Versions Views = 407
  14. 文件两个 CSV:image_classification + sentence_similarity(Folder structure 段)
  15. 页面文件区显示 ‘Data Not Available’(地区/登录限制)
  16. 页面无 Total Size 字段
  17. Parent Projects:MIMIC-CXR Database v2.0.0
  18. PhysioNet 作者 15 人(页面作者列表逐一核对)
  19. arXiv 论文作者 16 人(abs 页逐一核对)——两名单不一致
  20. 论文独有:Anja Thieme / Matthew P. Lungren / Aditya Nori
  21. 数据集独有:Hannah Richardson / Tristan Naumann
  22. Boecking 挂 CMU+MSR 双机构(页面 data-content)
  23. Naumann 挂 MSR+MIT CSAIL 双机构(页面 data-content)
  24. COI:作者声明无利益冲突(页面原话)
  25. 致谢:Richardson 合规审查 + Wetscherek 临床输入与标注
  26. 论文 arXiv 2301.04558,v1 2023-01-11,v2 2023-03-16
  27. 论文正式发表 CVPR 2023(openaccess PDF + ‘To appear in CVPR 2023’)
  28. 论文提交人 Ozan Oktay(arXiv submission history)
  29. 框架名 BioViL-T:CNN-Transformer 混合多图编码器
  30. Abstract 定位:two distinct temporal tasks in radiology
  31. 任务一 N=1326 图像对(Abstract 原文)
  32. 任务二 N=361 句对(Abstract 原文)
  33. 三态:Improving/Stable/Worsening(Abstract 原文)
  34. 800 subjects(Table 1 Total 行)
  35. Consolidation 201(14%/42%/44%)/ 187 subjects
  36. Edema 266(31%/26%/43%)/ 241 subjects
  37. Pleural effusion 411(19%/49%/32%)/ 370 subjects
  38. Pneumonia 237(8%/25%/67%)/ 218 subjects
  39. Pneumothorax 211(15%/55%/30%)/ 148 subjects
  40. 全库类分布 18%/40%/42%
  41. 类不均衡解释:患者好转时不拍片(页面原话)
  42. 先片规则:nearest prior by acquisition timestamps
  43. silver→gold 提升:随机抽 ImaGenome silver 候选(排除 gold 已验证)
  44. 排歧:滤掉同一病理多矛盾标签的 study(左增右稳例)
  45. 裁决材料:当前报告 + 自动标签来源句(模仿 ImaGenome gold 构建法)
  46. 盲审:第二位放射科医生盲标子集测一致性
  47. QC:多 frontal 片 study 由医生选最佳片
  48. 映射声明:ImaGenome ‘Pulmonary edema/hazy opacity’ → CheXbert ‘Edema’
  49. label_quality 三值:multiple_experts/disagreement/one_expert
  50. 页面未披露双标一致率具体数值
  51. 句子构建第一步:Stanza 切句(Zhang 2021 JAMIA [8])
  52. 句子过滤:CheXbert 五病理 + 时序关键词(high sensitivity)
  53. RadGraph 法:实体图匹配,放宽时序词与病理提及约束
  54. Swaps 法:CXR-BERT-Specialized top-5 masked 预测换时序词
  55. 剔除三类:语义不清/与时序无关/语法错误
  56. RadGraph 117 = 42 paraphrase + 75 contradiction
  57. Swaps 244 = 99 + 145
  58. Total 361 = 141 paraphrase + 220 contradiction
  59. Table 2 四例句全录(Swaps/RadGraph × paraphrase/contradiction)
  60. Schema 表:sentence_1/sentence_2/category/subset_name
  61. 评估姿势:余弦相似度 + 阈值 → accuracy/AUROC(Usage Notes)
  62. BioViL-T 分类 Top-1 81.1 / AUC 0.883(论文多源交叉)
  63. BioViL 分类 AUC 0.831(对照)
  64. sota2 宏口径:BioViL-T 平均 60.2 vs BioViL 57.8
  65. BioViL-T 分病理:PE 67/Edema 61.9/PTX 42.6/Consol 61.1/Pneu 68.5
  66. Usage Notes 推荐 macro-F1/macro-accuracy + 按病理分列
  67. 句子榜:PubMedBERT 60.39/.542
  68. 句子榜:CXR-BERT-G 62.60/.601
  69. 句子榜:CXR-BERT-S 78.12/.837
  70. 句子榜:BioViL-T 87.77±0.5/.933±.003
  71. RadNLI 对照:BioViL-T 90.52±1.0/.947±.003(静态不掉点)
  72. RadNLI 145 对(论文对照集,与本集不同)
  73. phrase grounding:BioViL-T CNR 1.33/mIoU 0.240 vs BioViL 1.07/0.229
  74. grounding accuracy 72.4 vs 71.0
  75. report gen:ROUGE-L 0.276 vs 0.268;BLEU-4 0.116 vs 0.097
  76. CheXpert 肺炎 AUC 0.882 vs 0.870
  77. 预训练:174.1k 训练对/4.9k 验证对(多图 118.8k+单图 55.3k)
  78. 下游共享测试集 2,971
  79. curation 回流增益 +0.68pp(论文 A.4)
  80. HF Limitations:英语 only/ICU 短时距(跨年可能降级)/不用于医疗器械
  81. 代码 HI-ML GitHub(aka.ms/biovil-t-code)
  82. 模型 HF microsoft/BiomedVLP-BioViL-T
  83. 短链 aka.ms/ms-cxr-t(论文脚注 4)
  84. Ethics:母库伦理全部继承
  85. 年龄偏移:64.99 vs 56.85 岁(页面原话)
  86. 性别偏移:45.88% vs 52.39% 女(页面原话)
  87. 偏移解释:仅纳入两连续片有 finding 的 subject
  88. 偏倚框架引用:Weber 2017 JAMIA complete-data 筛选偏倚([10])
  89. References 共 10 条(编号完整无错位)
  90. [1] Shih 2019 RSNA 肺炎专家标注
  91. [2] Boecking 2022 ECCV(BioViL/CXR-BERT/MS-CXR)
  92. [3] Shamout 2021 npj(私有数据集例证)
  93. [4] Johnson 2019 MIMIC-CXR
  94. [5] Wu 2021 Chest ImaGenome(arXiv 2108.00316)
  95. [6] Smit 2020 EMNLP CheXbert
  96. [7] Jain RadGraph(页面此条无年份卷期——瑕疵存照)
  97. [8] Zhang 2021 JAMIA Stanza
  98. [9] Bannur 2023 arXiv 2301.04558(本文)
  99. [10] Weber 2017 JAMIA 偏倚框架
  100. 页面底部平台引用:Pollard 2026 Nature Health(doi:10.1038/s44360-026-00096-z)
  101. 查重:ms-cxr 主条目 rid 340 在库;本条为时序姊妹版(url_name=‘ms-cxr-t’ 精确区分)
  102. 互链目标:rid 16/330/340/5/561/617
  103. 发布前 MAX(record_id)=618 → 本条预期 rid 619

§12 术语表:五十条

1. MS-CXR-T —— 本条目:MIMIC-CXR 派生的时序双任务基准(1,326 图对 + 361 句对)

2. BioViL-T —— 微软的时序 VLP 预训练框架(CVPR 2023)——本集官方榜首

3. BioViL —— 时序版之前的静态预训练框架(ECCV 2022)——本集主要对照

4. CXR-BERT —— 放射文本编码器(General/Specialized 两版)——句子任务对照

5. 时序基准(temporal benchmark) —— 考’跨时间点变化’而非’单时点状态’的评测集

6. 疾病进展(disease progression) —— 病情随时间的走向——本集三态化的核心语义

7. 三态标签 —— improving/stable/worsening——进展分类的类空间

8. 图像对(image pair) —— 当前片+最近先片的组合——本集分类任务的基本单元

9. 最近先片(nearest prior) —— 按采集时间戳取的同患者前一次检查

10. silver 标准 —— 规则引擎自动导出的标签(ImaGenome 进展标签)

11. gold 提升 —— silver 候选经专家逐条 accept/reject 转为金标的过程

12. 排歧(de-ambiguation) —— 滤掉同一病理多矛盾标签的 study

13. 盲审复标 —— 第二位医生不看已有标签复标子集以测一致性

14. label_quality —— 三值质量标签:multiple_experts/disagreement/one_expert

15. board-certified radiologist —— 板证放射科医生——本集全部标签的裁决者

16. Wetscherek —— Maria Teodora Wetscherek——本集临床输入与标注的致谢对象

17. paraphrase —— 同义改写——句子任务的二类之一

18. contradiction —— 时序矛盾——句子任务的二类之二

19. premise/hypothesis —— 句子对的句 1/句 2(NLI 术语)

20. RadGraph 法 —— 按实体图匹配造句对——允许措辞自由

21. Swaps 法 —— 替换时序关键词造句对——句间只差几词

22. masked token 预测 —— CXR-BERT-Specialized 的完形填空输出——Swaps 的换词来源

23. 时序关键词 —— interval/unchanged/resolution/worsening 等进展触发词

24. Stanza —— Stanford 的句法解析库——本集切句工具

25. CheXbert —— 五病理自动标注器——句子过滤与 Edema 口径来源

26. CheXpert —— 斯坦福 22.4 万胸片数据集(rid 5)——论文肺炎分类对照场

27. Chest ImaGenome —— MIMIC-CXR 派生场景图数据集(rid 330)——silver 供货商

28. RadGraph —— 放射报告实体关系抽取数据集(rid 561)——句子配对引擎

29. RadNLI —— 放射 NLI 基准(145 对)——论文静态对照集

30. MIMIC-CXR —— 母库:BIDMC 227,835 studies(rid 16)

31. MIMIC-CXR-JPG —— 母库加工层:377,110 JPG+14 类标签(rid 617)

32. MS-CXR —— 同门姊妹集:静态短语接地基准(rid 340)

33. 短语接地(phrase grounding) —— 把文本短语定位到图像区域的任务——340 的科目

34. VLP(vision-language processing) —— 视觉-语言处理——本集所属领域

35. 零样本评测 —— 不微调直接测——句子任务的官方姿势

36. 余弦相似度 —— 句对 embedding 的相似度量——本集的类 logits

37. Top-1 准确率 —— plain accuracy——81.1 的口径(多数类红利大)

38. 宏口径(macro) —— 类平均准确率——60.2 的口径(Usage Notes 推荐)

39. 类不均衡 —— improving 18% 的分布现实——双口径落差的根源

40. 筛选偏倚 —— Weber 2017 的 complete-data 框架——本集偏移披露的理论出处

41. Credentialed —— PhysioNet 认证访问档——License+DUA+CITI 三件套

42. DUA 1.5.0 —— PhysioNet 认证健康数据使用协议

43. CITI —— 伦理培训课程平台——‘Data or Specimens Only Research’ 必修

44. cr:RecordSet —— Croissant 模式的记录集节点——本条目 frontmatter 双 CSV 各一

45. rai:dataLimitations —— AI 就绪披露节点——本条目七条限制

46. CVPR —— IEEE 计算机视觉与模式识别会议——论文正式发表地(2023)

47. HI-ML —— 微软医疗 AI 工具箱——BioViL-T 代码仓所在

48. HF 模型卡 —— HuggingFace microsoft/BiomedVLP-BioViL-T——权重+用法+限制

49. 基准型数据集 —— 小而金、考卷不换题的评估集——本集的物种属性

50. 标注三级阶梯 —— 全自动(616)→弱监督(617)→共识金标(518)→金标混合(519)

附录 A:发布时间线与版本对照

日期 事件
2019-12 母库 MIMIC-CXR(Johnson et al.)发表于 Scientific Data
2021-07 Chest ImaGenome 挂 arXiv 2108.00316(silver 进展标签的源头)
2022-10 BioViL/CXR-BERT 论文(Boecking et al.)发表于 ECCV 2022;MS-CXR 基准同步公开
2023-01-11 论文 arXiv 2301.04558 v1 提交
2023-03-16 论文 v2 修订(CVPR camera-ready 周期)
2023-03-17 MS-CXR-T v1.0.0 挂牌 PhysioNet(单版本至今)
2023-06 CVPR 2023 正式收录(openaccess 全文可见)
2026-09 页面 Views 407;数据集无任何修订——考卷四年不换题

对照注:本集"先论文(01-11)后数据(03-17)“间隔 65 天,属"论文与考卷同步出厂"型;对照 518 的"先论文后数据 10 个月”,节奏完全不同——基准工件要跟 CVPR 的评审周期走,临床标签集要跟临床验证走。

附录 B:Table 1 全录(分类任务分布)

Finding 样本数 improving / stable / worsening subjects
Consolidation 201 14% / 42% / 44% 187
Edema 266 31% / 26% / 43% 241
Pleural effusion 411 19% / 49% / 32% 370
Pneumonia 237 8% / 25% / 67% 218
Pneumothorax 211 15% / 55% / 30% 148
Total 1,326 18% / 40% / 42% 800

三点读法:一,Pleural effusion 样本最多(411)但 improving 占比(19%)并不最高——Edema 的 31% 才是 improving 最多的病理(复查行为在水肿患者中最常见);二,Pneumothorax 的 stable 占比最高(55%),与气胸"稳定观察"的临床处置习惯一致;三,Pneumonia 的 worsening 67% 最极端,与"肺炎恶化才复查"的 ICU 现实对表。分布本身就是临床行为学的抽样。

附录 C:Table 3 全录(句子任务分布)

子集 Paraphrase Contradiction Total
RadGraph 42 75 117
Swaps 99 145 244
Total 141 220 361

两个子集都是 contradiction 偏多(RadGraph 75:42、Swaps 145:99)——Swaps 用同义时序词替换造 paraphrase 的成功率高,但造出"方向词反转"的 contradiction 更容易;RadGraph 配对在放宽约束后更多落进"语义相反"格。引用时若按子集分层评估,这个 2:3 的类比也要一并交代。

附录 D:口径差异存照(并列引用,不仲裁)

项 口径 A 口径 B 处置
分类成绩 Top-1 81.1 / AUC 0.883(论文主口径) Macro Acc 60.2(第三方聚合,Usage Notes 推荐宏口径) 并列引用并注明口径
作者名单 PhysioNet 15 人(含 Richardson/Naumann) arXiv 论文 16 人(含 Thieme/Lungren/Nori) 按所引工件对表
DOI pg10-j984(v1.0.0) ga7g-1614(latest) 基准引用固定前者
双标一致率 页面未披露数字 label_quality 三值标签 如实写"页面未披露"
RadGraph 引用 页面 [7] 无年份卷期 Jain et al. 2022 JAMIA(外部核对) 本条目补全但注明页面瑕疵
进展标签来源 本集 gold(板证裁决) ImaGenome silver(规则引擎) 训练/评测分流(附录 F)

附录 E:silver→gold 提升步骤表(复现用)

步骤 动作 输入 输出
1 随机抽样 ImaGenome silver study 池(排除 gold 已验证) 候选 study 集
2 排歧过滤 候选集 单值化 study(剔除一病理多标签者)
3 专家裁决 study + 当前报告 + 标签来源句 accept/reject 逐条判定
4 盲审复标 accept 子集 双标数据 → label_quality 三值
5 图像 QC 多 frontal 片 study 每 study 一张最佳片

附录 F:训练信号与考试卷分流表

需求 该用哪套 原因
微调/预训练时序分类器 Chest ImaGenome silver 全量 体量;论文微调同款
评测时序分类器 本集 1,326 对 题题板证金标
评测文本编码器时序敏感度 本集 361 句对 零样本协议 + 捷径检测
全库弱监督 14 类标签 617 MIMIC-CXR-JPG 37.7 万图规模
区域级场景图推理 330 Chest ImaGenome 本体 22 区域格式
静态短语接地 340 MS-CXR 712 图边界框

附录 G:本库 MIMIC-CXR 谱系与本条互链

本库条目 关系 链接语义
rid 16 mimic-cxr 母库 图像对与句子的原始来源(227,835 studies)
rid 340 ms-cxr 同门姊妹 静态接地 vs 时序双任务——后缀 T 的对照条目
rid 330 chest-imagenome 上游 silver 进展标签供货商 + 训练信号全量来源
rid 561 radgraph 工具依赖 RadGraph 子集的实体图引擎
rid 5 chexpert 口径来源 CheXbert 过滤口径 + 肺炎分类对照场
rid 617 mimic-cxr-jpg 平行加工层 全量弱监督 vs 小而金(规模/精度分流)

附录 H:批次七生产存照(519 号)

  • 生产序号:批次七 3/10(数据集总序 519;发布后 record_id 619)
  • 核查轮次:4 轮——①PhysioNet 页面全段提取(70,225 B 快照);②arXiv abs 页(作者名单/版本史/CVPR 归属);③CVPR openaccess + ar5iv + HF 模型卡(预训练底账/成绩/局限);④sota2.com(宏口径聚合)+ DB 互链目标实测
  • 关键修正:批次队列 name_en=‘MS’ → 实测 slug ms-cxr-t;sota2 宏口径 60.2 与论文 Top-1 81.1 并存(双口径存照进 §5.1/§8 坑点 2)
  • 意外收获:论文 16 人 vs 数据集 15 人名单差异;RadNLI 145 对的静态对照价值;Pneumonia improving 8% 的极端类不均衡
  • 成品行数:见发布记录(目标 ≥1200)
  • 下一发:520 myocardial-perfusion-spect(批次七 4/10)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ms-cxr — 共享标签:医学影像 / 多模态 / X光影像 / 影像-文本对齐
  • reflacx-xray-localization — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • radvlm-instruction-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • radialog-instruct-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
  • rexgradient-160k — 共享标签:医学影像 / X光影像 / 影像-文本对齐 / 评测基准
  • chexpert-plus — 共享标签:医学影像 / 医疗NLP / X光影像 / 影像-文本对齐
  • reg2026 — 共享标签:医学影像 / 医疗NLP / 多模态 / 影像-文本对齐
  • vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
  • rexvqa — 共享标签:医学影像 / 多模态 / X光影像 / 评测基准
  • biomedica — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集