信息速览
INFOBOX:ms-cxr-t 速览
| 字段 | 值 |
|---|---|
| 数据集 | MS-CXR-T: Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing v1.0.0 |
| slug | ms-cxr-t |
| 发布 | 2023-03-17(单版本至今)|PhysioNet |
| DOI | 10.13026/pg10-j984(v1.0.0)/ 10.13026/ga7g-1614(latest) |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程) |
| 母项目 | MIMIC-CXR Database v2.0.0(本库 rid 16) |
| 任务一 | 时序图像分类:1,326 图像对 / 800 患者,五病理三态 |
| 任务二 | 时序句子相似度:361 句对(RadGraph 117 + Swaps 244) |
| 标注 | 板证放射科医生逐条裁决|gold 提升 + 盲审复标|label_quality 三值 |
| 类分布 | 全库 improving 18% / stable 40% / worsening 42%(不均衡是设计内的临床现实) |
| 论文 | BioViL-T,CVPR 2023(arXiv 2301.04558,v1 2023-01-11) |
| 榜首 | BioViL-T Top-1 81.1 / AUC 0.883(vs BioViL 0.831);句子任务 87.77/.933 |
| 团队 | Microsoft Research 15 人(Bannur/Oktay/Wetscherek/Lungren 论文版等) |
| 一句话 | 微软给医学 VLP 出的"时间科目"考卷:图要会看前后片,句要会辨恶化与好转 |
§0 摘要卡:当模型只看一张片子,它错过了什么
§0.1 它是什么
MS-CXR-T 是微软研究院 2023 年挂在 PhysioNet 上的时序双任务基准,配套 CVPR 2023 论文 BioViL-T(“Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing”)。它考模型两门课:看图(1,326 对前后胸片,判断五个病理是好转、稳定还是恶化)和读句(361 对放射报告句,判断两句是同义改写还是时序矛盾)。数据全部派生自 MIMIC-CXR v2(本库 rid 16),全部标签经 board-certified 放射科医生人工裁决。
§0.2 三个数字
- 1,326:时序图像分类的样本数(五 finding × 三态,横跨 800 名患者)——每个样本是一对图(当前片 + 最近先片),不是一张图。
- 361:句子相似度的句对数(paraphrase 141 / contradiction 220)——RadGraph 实体匹配造了 117 对,CXR-BERT-Specialized 关键词交换造了 244 对。
- 81.1 / 0.883:BioViL-T 在分类任务上的 Top-1 / AUC(vs 静态版 BioViL 的 0.831)——宏口径下同模型只有 60.2,类不均衡把两个口径拉开 21 个百分点。
§0.3 谁在用、怎么接
模型作者用它当考卷(论文 Table 3/6 的成绩单都建在它上面);基准工程师用它纵向追踪文本编码器的时序敏感度(PubMedBERT 60.39 → CXR-BERT-S 78.12 → BioViL-T 87.77 的爬坡线);数据集考古用它补全 MIMIC-CXR 家族谱系(母库 rid 16 → 加工层 rid 617 → 静态接地 rid 340 → 本集时序双任务)。获取走 PhysioNet Credentialed(License 1.5.0 + DUA 1.5.0 + CITI),拿到两个 CSV 后用自己的 MIMIC-CXR 图像池按 DICOM ID 提片子。
§0.4 本条目怎么读
§1 身份卡 → §2 时序为何被忽视 → §3/§4 双任务构建解剖(gold 提升与句对工程)→ §5 成绩单多口径存照 → §6 生态位与标注三级阶梯 → §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 九十问 → 附录 A-H(含 Table 1-3 全录与口径差异存照)。
§1 身份卡:一张速览
| 字段 | 值 |
|---|---|
| 全称 | MS-CXR-T: Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing |
| slug / 本库编号 | ms-cxr-t / 519 |
| 挂牌 | 2023-03-17(PhysioNet,版本 v1.0.0 唯一) |
| DOI | v1.0.0:10.13026/pg10-j984;latest:10.13026/ga7g-1614 |
| 访问 | Credentialed——仅签署 DUA 的认证用户可取文件 |
| License | PhysioNet Credentialed Health Data License 1.5.0 |
| DUA | PhysioNet Credentialed Health Data Use Agreement 1.5.0 |
| 必修课程 | CITI “Data or Specimens Only Research” |
| Topics | disease progression / cxr / vision-language processing / chest x-ray / radiology / multimodal |
| 项目主页 | microsoft.com/.../learning-to-exploit-temporal-structure-for-biomedical-vision-language-processing/ |
| 文件 | 2 个 CSV(时序分类标签表 + 句子相似度表) |
| Views | 407(2026-09 快照,四年累计) |
| RRID | SCR_007345 |
| 母库 | MIMIC-CXR Database v2.0.0(页面 Parent Projects 段明示) |
身份卡三行补注:
版本史:单版本 v1.0.0 挂牌至今无修订——2023-03-17 之后 PhysioNet 上没有任何 v1.0.1 或 v2。对照 517 MIMIC-CXR-JPG 的 v2.0.0→v2.1.0 演化,本集是"一次发布即终版"的基准型数据集(考卷不换题)。
双 DOI 语义:pg10-j984 锁 v1.0.0,ga7g-1614 是 latest 占位——基准引用应固定 pg10-j984(论文 BibTeX 也是这个),ga7g-1614 只在跟踪未来修订时使用。
"数据工件"自我定位:页面 Ethics 原话 “MS-CXR-T is a research artifact of the corresponding work”——它不遮掩自己是论文附件的身份,复现性与基准评估是它存在的全部理由。
§2 背景:时序为什么被忽视了三年
§2.1 "静态考试"的一代基准
页面 Background 段的判断:生物医学 VLP(vision-language processing)的主流基准都在考"静态"任务——单张图的疾病检测(如 CheXpert,本库 rid 5)、短语接地(如 MS-CXR,本库 rid 340)。病灶在哪、是什么,一张片就够。但临床读片的真实动作是对比:"与 prior 片相比,左肺积液增多。"报告里的 interval/enlarged/unchanged/resolution 这些词全在指涉一张不存在的图——训练时模型只拿到当前那一张。
论文 Abstract 的表述更狠:把报告里的时序内容对齐到单图,“does not only introduce poor alignment between the modalities but also a missed opportunity”——既有错位,又有浪费:MIMIC-CXR 患者动辄十几份检查,纵向自监督信号就躺在那里没人用。
§2.2 私有数据的复现困境
页面 Background 还点名了一个生态问题:时序方向的先行工作(引 Shamout et al. 2021 npj Digital Medicine 的 COVID 恶化预测系统)建立在私有数据上,“lack of publicly available multi-modal benchmark datasets”——学界连量化"模型会不会看时间"的考卷都没有。MS-CXR-T 的立项动机就是把这张考卷公开。
§2.3 BioViL-T:考卷背后的答案
数据集与 BioViL-T 框架同源同发(CVPR 2023):CNN-Transformer 混合多图编码器,联合文本模型训练,显式吃进先图与先报告;设计上正面处理两个临床现实——位姿错位(不用显式配准)与先图缺失(单图输入优雅降级)。三大 SOTA:进展分类、短语接地、报告生成;句子相似度与疾病分类同步增益。本集就是这套框架的"官方考试卷"——作者自己出题,自己先答(81.1/0.883),把题本留给后人。
§2.4 命名学术圈谱系
一条线看 Microsoft 的 Chest X-ray VLP 系列命名:BioViL(2022 ECCV,Boecking et al.,静态预训练)→ CXR-BERT(同文文本模型,General/Specialized 两版)→ MS-CXR(本库 rid 340,静态短语接地基准)→ MS-CXR-T(本集,时序双任务基准,T = Temporal)→ BioViL-T(时序版框架)。字母后缀全部有语义:T 不是涡轮增压,是 temporal——拿到这批条目名先拆后缀,是读 Microsoft 系数据集的家规。
§2.5 读片工作流里的时序真相:报告的写法就是证据
一个常被忽略的侧写:放射报告的结构本身就为时序而生。报告的 Impression 段几乎每句都在做对比——“interval enlargement”(间隔增大)、“unchanged”(无变化)、“compared to prior”(与前片相比)。论文预训练时专门只取 Impression 段(MLM 额外用 Findings 段),因为"关键发现已经被 Impression 捕获"。换句话说:报告语言是时序语言,VLP 模型却长期只拿单图去对齐——模态错位的根源不在数据,在建模假设。本集的句子任务(361 对)正是把这个观察变成了可量化的考题:模型若读得懂报告的时序语言,就应在 Swaps/RadGraph 两子集上同时及格。
§3 任务一解剖:1,326 对图像的 gold 提升工程
§3.1 数据结构
| 字段 | 含义 |
|---|---|
| study_id / previous_study_id | 当前/先片对应的报告标识 |
| dicom_id / previous_dicom_id | 当前/先片的 DICOM 标识 |
| subject_id | 患者标识(直通 MIMIC-CXR) |
| {FINDING}_progression | 三态:improving / stable / worsening(按 finding 分列) |
| {FINDING}_label_quality | 三值:multiple_experts / disagreement / one_expert |
每个样本 = 同一 subject 的图像对(当前片 + 按采集时间戳确定的最近先片)× 五病理各自的进展标签。影像本体不在库——CSV 只存 ID 与标签,图像从 MIMIC-CXR v2 自取。
§3.2 silver→gold 五步提升法
构建起点是 Chest ImaGenome(本库 rid 330)的 silver 进展标签(由报告自动规则导出),MS-CXR-T 的做法是人工把 silver 提升为 gold:
- 抽样:随机抽 silver 集内的候选 study,排除已被 ImaGenome gold 验证过的;
- 去歧义:滤掉同一病理存在多个矛盾进展标签的 study(如"左胸腔积液增多 + 右胸腔积液稳定"——病理级标签无法单值化);
- 专家裁决:board-certified 放射科医生逐条 accept/reject;裁决时给两样材料——当前片的完整报告 + 自动标签的来源句(刻意模仿 ImaGenome gold 的构建方法,保证提升不引入方法断裂);
- 盲审复标:子集交第二位放射科医生盲标(不看已有标签)以测 inter-observer agreement;
- 图像 QC:一 study 多张 frontal 片时,由放射科医生选出最佳片,保证入集影像的诊断质量。
这五步里藏着本库"标注工程三级阶梯"的又一级:616 是全自动指令分割,617 是双规则引擎弱监督(687 份人工验证),518 是双人共识全量金标准,而 519 是"机器预标 + 板证金标 + 盲审一致性"的混合制——规则引擎省力、专家把关、盲审出质量指标。
§3.3 属性映射:一句话的口径迁移
Chest ImaGenome 用 “Pulmonary edema/hazy opacity”,CheXbert/CheXpert 生态用 “Edema”——MS-CXR-T 显式声明前者映射为后者,其余四病理直接对应。映射只有一句话,但它是两个数据集标签体系互操作的唯一官方说明——跨集合并标签时先对齐这一条。
§3.4 分布全录与不均衡的现实
| Finding | 样本数 | 类分布(I/S/W) | 患者数 |
|---|---|---|---|
| Consolidation | 201 | 14% / 42% / 44% | 187 |
| Edema | 266 | 31% / 26% / 43% | 241 |
| Pleural effusion | 411 | 19% / 49% / 32% | 370 |
| Pneumonia | 237 | 8% / 25% / 67% | 218 |
| Pneumothorax | 211 | 15% / 55% / 30% | 148 |
| Total | 1,326 | 18% / 40% / 42% | 800 |
页面给出的人口学解释:患者更可能在病情稳定或恶化时拍片(复查或急诊),好转时反而不来拍——improving 类天然稀缺。Pneumonia 最极端:improving 只占 8%(约 19 例),而 worsening 占 67%。这不是标注缺陷,是"拍片行为"本身的选择机制——考卷出题人把这个现实原样留在了题里,并把"该用宏口径"写进了 Usage Notes(§5.3)。
§3.5 双标一致性:披露边界
label_quality 三值(multiple_experts / disagreement / one_expert)是页面给的全部质量信号;盲审子集的规模与一致率(κ 或百分比)页面未披露数字——协议细节在论文 Appendix C。引用时如实写"双标子集存在、质量标签三值、具体一致率未在数据集页面披露",不要替它编一个 κ。
§4 任务二解剖:361 对句子的时序语义工程
§4.1 数据结构
| 字段 | 含义 |
|---|---|
| sentence_1 | premise(前提句) |
| sentence_2 | hypothesis(假设句) |
| category | paraphrase(同义改写)/ contradiction(时序矛盾) |
| subset_name | Swaps(关键词交换)/ RadGraph(实体匹配) |
§4.2 三步构建管线
第一步:收集与过滤候选句。 从 MIMIC-CXR 报告出发,用 Stanza constituency parser(Zhang et al. 2021 JAMIA,参考文献 [8])切出单句;用 CheXbert(Smit et al. 2020 EMNLP,[6])过滤出提及五个目标病理(Consolidation / Edema / Pleural Effusion / Pneumonia / Pneumothorax)的句子;再保留至少含一个时序关键词的句子——页面明说这个过滤是"high sensitivity"(高召回优先,宁滥勿缺,把精度留给后面的人工关)。
第二步:造对,两条路线并行。
- RadGraph 路线:把句池里的句子解析成 RadGraph(本库 rid 561)实体图,按实体匹配配对——唯一放宽的匹配约束是时序关键词与病理提及。这条路造出来的对允许措辞与句法的自由变化(“slight increase in left basal consolidation” ↔ “slight interval progression of left basal consolidation”),考的是真语义理解。
- Swaps 路线:在单句内把时序关键词换成 CXR-BERT-Specialized 的 top-5 masked token 预测(限定候选为时序词)。这条路造出来的对只差少数几个词(“Unchanged small-to-moderate right pleural effusion” ↔ “Stable small-to-moderate right pleural effusion”),考的是模型对个别触发词的敏感度——近义的 Unchanged/Stable 是 paraphrase,方向相反的 worsening/resolution 就是 contradiction。
第三步:人工过滤与裁决。 板证放射科医生逐对验证,标注 paraphrase 或 contradiction。三类直接剔除:语义差异不清晰的、差异存在但与时序无关的、语法错误的。
§4.3 分布与例句全录
| 子集 | Paraphrase | Contradiction | 合计 |
|---|---|---|---|
| RadGraph | 42 | 75 | 117 |
| Swaps | 99 | 145 | 244 |
| Total | 141 | 220 | 361 |
页面 Table 2 四个例句原样:
| 子集 | 标签 | 句 1 | 句 2 |
|---|---|---|---|
| Swaps | Paraphrase | Unchanged small-to-moderate right pleural effusion | Stable small-to-moderate right pleural effusion. |
| Swaps | Contradiction | Interval worsening of the right-sided pneumothorax. | Interval resolution of the right-sided pneumothorax. |
| RadGraph | Paraphrase | There has also been a slight increase in left basal consolidation. | There is slight interval progression of left basal consolidation. |
| RadGraph | Contradiction | Right mid and lower lung consolidations are unchanged. | There has been worsening of the consolidation involving the right mid and lower lung fields. |
§4.4 为什么两条路都要有
只看 Swaps 子集,模型可以靠"个别词不同"的捷径得分;只看 RadGraph 子集,措辞自由度又让弱模型把语义错误归咎于句法噪声。两子集并存给出了捷径对照:一个模型若 Swaps 上强、RadGraph 上弱,说明它在靠表面词汇匹配而非真时序语义。PubMedBERT 与 CXR-BERT-G 在 MS-CXR-T 上的崩溃(60.39/62.60)对照它们在句法更像的 RadNLI 上的体面成绩(81.38/87.59),正是这种"捷径依赖"的证据(§5.2)。
§4.5 二分类的评估姿势
Usage Notes 给出的推荐玩法:对句对算 embedding 余弦相似度,选阈值后报 accuracy 或 AUROC。这是个零样本任务——不微调,直接测文本编码器的时序敏感度。四个模型的成绩单(§5.2)正是这么测出来的。
§5 成绩单:两个口径,四个模型,一份榜单
§5.1 时序分类:81.1 的正面与背面
论文主口径:BioViL-T 在 MS-CXR-T 分类任务 Top-1 81.1 / AUC 0.883,静态版 BioViL AUC 0.831,时序预训练带来 5.2 个 AUC 点的爬升。同场对比:CheXRelNet(图卷积跨 ROI)、CNN+Transformer 基线、BioViL+affine 配准(4 DoF)变体。
第三方聚合(sota2.com)按宏口径重列的每病理 Macro Acc:BioViL-T 平均 60.2(Pleural effusion 67 / Edema 61.9 / Pneumothorax 42.6 / Consolidation 61.1 / Pneumonia 68.5)vs BioViL 57.8。81.1 与 60.2 的 21 点落差不是谁算错了——前者吃到了 stable/worsening 多数类的红利,后者对 improving 少数类公平计价。数据集自己的 Usage Notes 站在宏口径一边:明文推荐 macro-F1 / macro-accuracy,且建议按病理分列报告(有的病理就是比别的难)。
引用纪律由此立起来:引 81.1 必须注明是 plain Top-1(不均衡类下的加权体感),引 60.2 必须注明是宏平均(第三方聚合口径)——两者并存是本集最重要的口径存照。
§5.2 句子相似度:文本编码器的时序爬坡线
| 模型 | MS-CXR-T Acc | MS-CXR-T AUC | RadNLI Acc | RadNLI AUC |
|---|---|---|---|---|
| PubMedBERT | 60.39 | .542 | 81.38 | .727 |
| CXR-BERT-General | 62.60 | .601 | 87.59 | .902 |
| CXR-BERT-Specialized | 78.12 | .837 | 89.66 | .932 |
| BioViL-T | 87.77±0.5 | .933±.003 | 90.52±1.0 | .947±.003 |
这张表的信息密度在两列对照上:MS-CXR-T 考时序语义,RadNLI(145 对)考静态 NLI。CXR-BERT-Specialized 从 CXR-BERT-G 微调而来(同一基座、单图监督),静态只涨 2 分,时序却从 62.60 暴涨到 78.12;BioViL-T 再靠时序预训练爬到 87.77,同时静态不掉反涨(90.52)——论文结论"temporal pre-training helps static tasks too"的数据支柱就在这两列。
§5.3 其余战场(BioViL-T 全面战绩)
| 任务 | BioViL-T | BioViL | 增益 |
|---|---|---|---|
| Report generation ROUGE-L | 0.276 | 0.268 | +0.008 |
| Report generation BLEU-4 | 0.116 | 0.097 | +0.019 |
| CheXpert 肺炎 AUC | 0.882 | 0.870 | +0.012 |
| MS-CXR grounding CNR | 1.33±0.04 | 1.07±0.04 | +0.26 |
| MS-CXR grounding mIoU | 0.240±0.005 | 0.229±0.005 | +0.011 |
| MS-CXR grounding accuracy | 72.4 | 71.0 | +1.4 |
静态任务不掉点、时序任务大涨——这是论文把"时序学习"卖成通用增益而非专项技巧的底气。
§5.4 预训练与评测的底账
BioViL-T 预训练吃 MIMIC-CXR v2 的 frontal 片 + 有 Impression 段的报告:174.1k 训练对 / 4.9k 验证对,其中多图对 118.8k + 单图对 55.3k(多数样本带先图);下游共享测试集 2,971 样本;微调用 Chest ImaGenome 标签。消融三连:静态/时序特征分解是单图任务不崩的关键;位置编码是时序任务分辨先后顺序的关键;局部对比损失是语言监督有意义的关键。数据 curation(即本集 gold 提升那批标注回流微调)再贡献 0.68pp。
§5.5 模型卡自认的边界
HF 模型卡 Limitations 三条:英语 only;ICU 时距短(数小时至数天),跨年长间隔扫描上性能可能降级(解剖变化大);不用于自动诊断或医疗器械。第三条是所有 PhysioNet 医学 AI 工件的标准姿势,前两条是时序建模者真正要防的坑——拿 MS-CXR-T 调好的模型直接用于慢病年度复查对比,超出了训练分布。
§5.6 数据效率视角:时序预训练的少样本红利
论文用 sota2 收录的标签比例消融给出了另一条证据线:把微调标签砍到 10%,BioViL-T 的各病理 Macro Acc 仍有 59.7/62.4/35.3/62.6(Effusion/Pneumonia/PTX/Edema 量级),而全量标签的 BioViL 是 56.1/62.3/41.7/67.5——时序预训练让模型在十分之一的标注下就逼近静态版全量水平。对标注预算紧张的团队,这是本集与 ImaGenome 分流的又一层含义:先在时序预训练上买"数据效率",再用金标签把最后几个点买回来。
同场的零样本提示线(labels=0%):BioViL-T prompt 版 Macro Acc 53.6/59.7/34.9/64.2——不训练也有三分之二类过半的正确率,说明时序语义确实被预训练吸收进了表示层,而非全靠微调灌注。
§6 生态位:时序基准的稀缺与家族谱系
§6.1 四兄弟对照:MIMIC-CXR 派生的标注层
| 16 母库 | 617 JPG | 340 MS-CXR | 519 本集 | |
|---|---|---|---|---|
| 内容 | 227,835 studies + 报告 | 377,110 JPG + 14 类标签 | 712 图局部对齐框 | 1,326 图对 + 361 句对 |
| 时间观 | 纵向原始库 | 静态逐图 | 静态接地 | 时序双任务 |
| 标注引擎 | 医生书写报告 | CheXpert+NegBio 规则 | 放射科医生画框 | 板证医生裁决 + 盲审 |
| 规模哲学 | 全量 | 全量弱监督 | 小而精 | 小而金 |
| 主任务 | 底座 | 分类预训练 | 短语接地 | 进展分类 + 句子相似度 |
MS-CXR(340)与 MS-CXR-T(519)是同门姊妹:前者考"病灶在图上对应哪个短语"(静态空间对齐),后者考"两个时间点之间发生了什么"(时序语义)。BioViL-T 在两份考卷上都是第一名。
§6.2 上游工具链的四条供货线
- Chest ImaGenome(rid 330):silver 进展标签供货商——本集 1,326 对的标签起点,映射规则见 §3.3;
- RadGraph(rid 561):句对 RadGraph 子集的实体图引擎——117 对的骨架;
- CheXbert / CheXpert(rid 5):句子过滤的病理分类口径 + Edema 映射的命名规范;
- Stanza(Zhang 2021):报告切句的句法解析器。
一个基准集,四条上游供货线——它不是孤岛,是 MIMIC-CXR 生态工具链的集成测试床。
§6.3 标注工程三级阶梯(本库叙事补全)
| 梯级 | 条目 | 标注制式 | 人参与量 |
|---|---|---|---|
| 全自动 | 616 mimic-cxr-ext-ils | 指令模板分割 | 0 |
| 弱监督 | 617 mimic-cxr-jpg | 规则引擎 + 687 份人工验证 | 验证级 |
| 双人共识 | 518 mimic-iv-ext-pe | 一明一盲全量金标 κ=0.82 | 全量双标 |
| 金标混合 | 519 本集 | 机器预标(silver/句对)+ 板证裁决 + 子集盲审 | 全量裁决 + 子集双标 |
519 的位置在 518 与 617 之间:全量标签有专家逐条把关(高于 617 的弱监督),但起点是机器预标(不同于 518 的"医生从零读报告")。四种制式四条条目,标注工程的选项空间在本库集齐。
§6.4 基准型数据集的"低流量高引用"形态
Views 407(四年)——对照 617 挂牌四年数千的浏览量,本集流量小一个量级。但它是 CVPR 2023 论文的官方 benchmark,论文引用随时间累积,考卷的下载量天然小于教材(MIMIC-CXR)。基准型数据集的生态位评估要跟论文引用走,不能只看 PhysioNet 计数器。
§6.5 三条"机器预标"路线的对照:本库加工层方法论横评
| 616 ext-ils | 617 jpg | 519 本集 | |
|---|---|---|---|
| 机器预标 | 指令模板分割 | CheXpert+NegBio 规则 | ImaGenome silver / RadGraph 配对 |
| 人工介入 | 0(全自动发布) | 687 份验证集 | 全量裁决 + 子集盲审 |
| 标签空间 | 分割指令 | 14 类五值 | 五病理三态 + 句对二分类 |
| 输出形态 | 指令微调对 | 训练级弱标签 | 评测级金标 |
| 适用场景 | 指令模型微调 | 大规模预训练 | 模型能力横评 |
三条路线回答三个不同的问题:616 回答"指令数据怎么零人工扩产",617 回答"全库标签怎么自动化",519 回答"模型能力怎么被可信地量化"。机器预标在三处的角色也不同——616 里它就是全部,617 里它是主体(人工只验质量),519 里它是候选生成器(人工全量收口)。同一段"自动化+人工"光谱上,三个条目把三个站位都占齐了。
§7 AI-Ready 十问
一问:什么格式? 两个 CSV:MS_CXR_T_temporal_image_classification_v1.0.0.csv(1,326 对标签)+ MS_CXR_T_temporal_sentence_similarity_v1.0.0.csv(361 对标注)——零解析成本,pandas 直接吃。
二问:多大规模? 分类 1,326 图像对/800 患者;句子 361 对(141 paraphrase/220 contradiction)。注意这是基准评估集的体量——考卷不厚,题题金标。
三问:标注是什么性质? 板证放射科医生逐条裁决:图像对走 silver→gold 提升 + 子集盲审复标,句对逐对验证分类。质量信号是 label_quality 三值(multiple_experts/disagreement/one_expert);具体双标一致率未在页面披露。
四问:许可与门槛? Credentialed:License 1.5.0 + DUA 1.5.0 + CITI “Data or Specimens Only Research”——与全部 MIMIC 派生集同一套流程,认证过 MIMIC-CXR 的团队可无缝接。
五问:伦理完备度? 双重披露制:母库 MIMIC-CXR 的全部伦理考量继承 + 自身偏移明示(平均 64.99 vs 56.85 岁、女性 45.88% vs 52.39%,引 Weber 2017 “complete data” 筛选偏倚框架);COI 无。
六问:可复现性? 论文(CVPR 2023)+ 模型(HF microsoft/BiomedVLP-BioViL-T)+ 代码(HI-ML GitHub)+ 考卷(本集)四件套齐发,aka.ms/ms-cxr-t 一键到 PhysioNet——复现链路是本集存在的全部意义。
七问:标签的可信边界? improving 类稀缺是拍片行为的选择机制(Pneumonia improving 仅 8%);ICU 短时距(HF 卡明示跨年扫描可能失效);单 finding 多标签的 study 已被剔除——病理级单值标签,区域级进展不在集内。
八问:适合什么任务? VLP 模型的时序能力评测(分类+句子双科目)、文本编码器时序敏感度追踪、类不均衡评测方法论教学(双口径存照)、MIMIC-CXR 家族谱系研究。
九问:不适合什么? 训练语料(1,326 对喂不饱深度模型——论文微调用的是 ImaGenome 全量标签而非本集);影像获取(本体不在库,需另申 MIMIC-CXR v2);跨年慢病时序(ICU 时距限制);区域级(解剖区)进展标注(ImaGenome 的 22 区域场景图才做这个)。
十问:一句话定位? 微软给医学 VLP 出的"时间科目"考卷——1,326 道看图题加 361 道读句题,题题放射科医生把关,公开了一场"模型到底会不会看时间"的标准化考试。
DAIMS 评估:数据可得性 6(Credentialed 标准流程,图像需另接母库)/ 标注 9(板证金标 + 盲审复标,全量人工裁决)/ 方法 8(双任务构建管线在论文+页面双披露,四件套开源)/ 影响力 7(CVPR 2023 官方基准 + HF 生态挂载,四年稳定引用)/ 规模 5(1,687 个评估单元,基准型体量)——DAIMS:7.0(对照:617 弱监督全量 7.8、518 双人共识 7.0、340 静态接地 7.2)。
§8 误解与反直觉
误解一:“1,326 个样本是不是太少了?” 这是考卷不是教材——基准评估集的体量标准是"题题金标 + 每格分布可解释",不是训练集的"多多益善"。对照:GLUE 也只有几千到几万句,没人嫌它小。
误解二:“数据集叫 MS-CXR-T,就是 MS-CXR 加了个 T。” 字母后缀有语义但内容不同源——MS-CXR(340)是短语接地的边界框(712 图),MS-CXR-T 是时序双任务(1,326 对 + 361 句对)。两者唯一的交集是团队、母库和 BioViL 生态。
误解三:“Top-1 81.1 说明模型已经 80 分了。” 宏口径下 BioViL-T 是 60.2——Pneumothorax 的 Macro Acc 只有 42.6(近乎瞎猜的三类基线是 33)。81.1 是多数类红利下的体感分数,页面 Usage Notes 明文劝你用宏口径。
误解四:“improving 类少是标注事故。” 是临床现实:好转的患者不来复查。Pneumonia 的 improving 8%(约 19 例)直接反映了"肺炎好转后拍片动机骤降"的就诊行为——考卷故意保留这个偏倚并要求考生用宏口径应对。
误解五:“Swaps 和 RadGraph 是两种标签。” 是两种造对方法,标签都是 paraphrase/contradiction 二分类。RadGraph 允许措辞自由变化,Swaps 只动时序关键词——子集名是"出题方式"的元信息,也是捷径检测的分组变量。
误解六:“句子对是报告原文对。” 不全是——Swaps 子集的 hypothesis 句是生成的(时序关键词被 CXR-BERT-Specialized 的 masked 预测替换),RadGraph 子集从真实报告句池配对但经过实体对齐筛选。premise 句是真实报告句,hypothesis 未必。
误解七:“图像数据集所以图像也在 PhysioNet 上。” 不在——本集只有两个 CSV(ID + 标签)。图像要从 MIMIC-CXR v2(rid 16)按 dicom_id 自取,等于又一道 Credentialed 门槛(同一套认证可复用)。
误解八:“数据集作者就是论文作者。” 两份名单不一致:PhysioNet 挂 15 人(含 Richardson/Naumann,无 Thieme/Lungren/Nori),arXiv 论文 16 人(反之)。合规审查与标注贡献者进了数据集署名,NLP 大牛进了论文署名——引用时看清你引的是哪个工件。
误解九:“时序基准所以时间跨度大。” ICU 数据的现实:先片与当前片间隔常为数小时至数天。HF 模型卡明示跨年扫描性能可能降级——这批考题测的是"住院期间的纵向变化",不是慢病管理的年度随访。
误解十:“盲审就是双人共识。” 盲审(第二位医生不看已有标签复标)是质量测量手段,不是全量双标——多数样本只有 one_expert 单标,盲审只覆盖子集。518 的"双人共识全量"比这里重一档。
误解十一:“Chest ImaGenome 标签拿来就能用,何必再标。” silver 标签是规则引擎从报告自动导出的——正是其噪声促使 MS-CXR-T 造 gold 提升。ImaGenome gold 已有验证(约 2.9%),本集的增量是"排歧 + 板证裁决 + 盲审测质量"的第三层加工。
误解十二:“基准集数字直接写进论文就行。” 三个口径纪律:分类引 81.1 注明 plain Top-1、宏口径注明第三方聚合 60.2、句子任务引用固定 v1.0.0 DOI(pg10-j984)。口径不注明,审稿人第一个来教你。
§8.13 坑点表(八坑)
| 坑点 | 典型翻车 | 绕行姿势 |
|---|---|---|
| 坑点1:当训练集用 | 1,326 对喂深度模型直接过拟合 | 只做评测;微调走 ImaGenome 全量标签(§5.4) |
| 坑点2:只报 plain Top-1 | 81.1 的虚高被审稿人拆穿 | 并报宏口径(BioViL-T 60.2),按病理分列(§5.1) |
| 坑点3:图像随 CSV 一起下载 | 找不到图像文件 | 图像在 MIMIC-CXR v2(rid 16),按 dicom_id 自取(§1) |
| 坑点4:跨年扫描上直接部署 | 模型在长间隔对上崩 | HF 卡明示 ICU 短时距边界;慢病随访需另验(§5.5) |
| 坑点5:盲审当全量共识 | 高估标注冗余 | 盲审仅子集;多数 one_expert 单标(§8 误解十) |
| 坑点6:Swaps/RadGraph 混报 | 捷径效应被平均掉 | 分子集报告;对照两线成绩识别表面匹配(§4.4) |
| 坑点7:引用 latest DOI | 版本漂移 | 基准引用固定 pg10-j984(v1.0.0)(§1) |
| 坑点8:把 Edema 映射当等价 | 跨集合并标签错位 | 映射是单向声明:ImaGenome “Pulmonary edema/hazy opacity”→CheXbert “Edema”(§3.3) |
§9 工作实例:从两个 CSV 到一次时序评测
§9.1 加载与盘点(纯 pandas)
import pandas as pd
# 任务一:时序图像分类
img = pd.read_csv('MS_CXR_T_temporal_image_classification_v1.0.0.csv')
print(img.shape) # 逐 finding 宽表:每行一个图像对
# 五病理的标签列:{FINDING}_progression / {FINDING}_label_quality
for f in ['Consolidation', 'Edema', 'Pleural Effusion', 'Pneumonia', 'Pneumothorax']:
col = f'{f}_progression'
if col in img.columns:
print(f, img[col].value_counts().to_dict())
# 目标分布(Table 1):Total 1326 对 / 800 subjects
# Consolidation 201 | Edema 266 | Pleural effusion 411 | Pneumonia 237 | Pneumothorax 211
# 任务二:时序句子相似度
txt = pd.read_csv('MS_CXR_T_temporal_sentence_similarity_v1.0.0.csv')
print(txt['category'].value_counts())
# contradiction 220
# paraphrase 141
print(txt['subset_name'].value_counts())
# Swaps 244
# RadGraph 117
§9.2 图像对的取片路径(MIMIC-CXR v2)
# 图像本体不在本集——按 ID 从母库取(需 MIMIC-CXR v2 Credentialed 认证)
# dicom_id / previous_dicom_id -> files/p10/p1xxxxxxx/sxxxxxxxx-xxxxxxxx/xxx.jpg
# (或经 617 MIMIC-CXR-JPG 的 JPG 池,ID 同源)
# 每个样本 = [当前片, 先片] 两张 frontal 图 -> 多图编码器
# label_quality 过滤建议:
gold_multi = img[img['Pneumothorax_label_quality'] == 'multiple_experts']
# multiple_experts = 双标一致的最强子集;disagreement = 分歧保留样本
§9.3 句子相似度的零样本评测(HF 模型卡姿势)
import torch
from transformers import AutoModel, AutoTokenizer
url = "microsoft/BiomedVLP-BioViL-T"
tokenizer = AutoTokenizer.from_pretrained(url, trust_remote_code=True)
model = AutoModel.from_pretrained(url, trust_remote_code=True)
pairs = list(zip(txt['sentence_1'], txt['sentence_2']))
sims = []
for s1, s2 in pairs:
out = tokenizer.batch_encode_plus([s1, s2], add_special_tokens=True,
padding='longest', return_tensors='pt')
emb = model.get_projected_text_embeddings(input_ids=out.input_ids,
attention_mask=out.attention_mask)
sims.append(torch.cosine_similarity(emb[0:1], emb[1:2]).item())
# 余弦相似度当 logits -> 扫阈值 -> 报 accuracy / AUROC
# 论文口径:BioViL-T 87.77 acc / .933 AUC(361 对)
# 分子集对照:Swaps 244 vs RadGraph 117(§4.4 捷径检测)
§9.4 分类评测的宏口径清单
from sklearn.metrics import balanced_accuracy_score, f1_score
# 1. 全局 Top-1(plain accuracy)——引用时注明口径
# 2. 宏平均(macro-F1 / balanced accuracy)——页面 Usage Notes 推荐
# 3. 按病理分列——Pneumothorax 的 42.6 与 Pleural effusion 的 67 要分开看
# 4. 类分布表(Table 1)随结果一起报告——improving 18% 的背景必须交代
§9.5 一个研究问题的最小闭环
“我的时序模型比 BioViL-T 强吗?”——取本集两个 CSV → 句子任务零样本测(阈值扫描)→ 分类任务微调后宏口径五病理分列 → 与 87.77/60.2 两条线对表 → 双标子集(multiple_experts)上复测稳定性 → 报告口径按 §8 坑点 2 的清单来。全程不需要碰 MIMIC-CXR 图像(句子任务),分类任务图像获取走 rid 16/617 的认证链。
§9.6 常见报错速查
- KeyError: ‘Edema_progression’——CSV 列名可能是 ‘Pleural Effusion’ 带空格的病理全名:先
print(img.columns.tolist())再拼列名; - 图像路径 404——dicom_id 要经 MIMIC-CXR 的 metadata 文件映射到
p10/p1xxxxxxx/sxxxxxxx/两级目录,直接拼 patient id 会错; - HF 加载超时——BioViL-T 卡要求
trust_remote_code=True,漏掉会直接抛 ValueError 而不是 404; - 阈值取 0.5——余弦相似度不是概率,0.5 附近没意义:论文协议是扫描后取验证集最优,评测脚本照抄官方仓。
§10 FAQ:九十问速查
§10.1 身份与获取(9 问)
Q1:MS-CXR-T 是什么?
A:微软研究院 2023 年发布的时序双任务基准:1,326 对胸片图像的进展分类标签 + 361 对报告句的相似度标注,配套 CVPR 2023 论文 BioViL-T。
Q2:slug 为什么是 ms-cxr-t?
A:PhysioNet 官方 URL slug;批次队列登记名 ‘MS’ 是截断——本库按官方 slug 入册(rid 619)。
Q3:版本情况?
A:单版本 v1.0.0(2023-03-17 挂牌至今唯一版本)——基准考卷不换题。
Q4:DOI 引哪个?
A:基准引用固定 v1.0.0 的 10.13026/pg10-j984;latest 的 10.13026/ga7g-1614 只在跟踪未来修订时用。
Q5:怎么获取?
A:PhysioNet Credentialed:注册认证 + 签 DUA 1.5.0 + 完成 CITI ‘Data or Specimens Only Research’ 课程,然后下载两个 CSV。
Q6:图像文件在哪?
A:不在本集——本集只有 CSV(ID+标签)。图像按 dicom_id 从 MIMIC-CXR v2(本库 rid 16)取,同一认证可复用。
Q7:访问要花多少钱?
A:PhysioNet Credentialed 免费——成本是认证流程时间与 CITI 课程,不是钱。
Q8:文件多大?
A:页面未披露 Total Size(抓取时文件区显示地区限制提示)——两个 CSV 是纯表格,体量以 MB 计。
Q9:项目和论文的对应关系?
A:页面 Project Website 指向微软研究院的论文页;数据集是论文的官方研究工件(research artifact)。
§10.2 任务一:时序图像分类(9 问)
Q10:分类任务考什么?
A:给一对前后胸片,判断五个病理(实变/水肿/胸腔积液/肺炎/气胸)各自是好转、稳定还是恶化——五科独立的三分类题。
Q11:1,326 是什么数?
A:图像对总数:每对含当前片与最近先片(同一患者,按采集时间戳就近取)。
Q12:800 是什么数?
A:去重后的患者数(subject_id 去重)——有患者贡献多对。
Q13:三态标签怎么定义?
A:improving / stable / worsening——从先片到当前片的病情走向,由放射科医生对照报告裁决。
Q14:每类的分布?
A:全库 improving 18% / stable 40% / worsening 42%;最极端的 Pneumonia 是 8%/25%/67%。
Q15:为什么 improving 这么少?
A:患者好转时不来拍片——就诊行为的选择机制,页面原文给了这个解释,不是标注事故。
Q16:先片怎么选的?
A:同一 subject 内按采集时间戳取最近的前一次——‘nearest prior image’,页面 Methods 明示。
Q17:label_quality 三值什么意思?
A:multiple_experts(双标一致)/ disagreement(双标分歧,保留)/ one_expert(单人单标)——标签可信度的元信息。
Q18:能用来训练吗?
A:不建议——1,326 对喂不饱深度模型;论文微调用的是 Chest ImaGenome 全量标签,本集定位是评测。
§10.3 任务二:句子相似度(9 问)
Q19:句子任务考什么?
A:两句话是 paraphrase(同义改写)还是 contradiction(时序矛盾)——测文本编码器的时序语义敏感度。
Q20:361 对怎么构成?
A:RadGraph 子集 117 对(paraphrase 42/contradiction 75)+ Swaps 子集 244 对(99/145)。
Q21:RadGraph 造对法?
A:把句子解析成 RadGraph 实体图按实体匹配配对,只放宽时序关键词与病理提及的匹配约束——允许措辞与句法变化。
Q22:Swaps 造对法?
A:句内替换时序关键词,候选来自 CXR-BERT-Specialized 的 top-5 masked token 预测——句间只差几个词。
Q23:句子从哪来?
A:MIMIC-CXR 报告:Stanza constituency parser 切句 → CheXbert 过滤出五病理相关句 → 保留含时序关键词的(高召回过滤)。
Q24:什么叫 contradiction?
A:两句在病情走向上矛盾:‘Interval worsening of the right-sided pneumothorax’ vs ‘Interval resolution of…’——一处恶化一处好转。
Q25:人工把关在哪一步?
A:最后一步:板证放射科医生逐对裁决分类;语义不清、与时序无关、语法错误的直接剔除。
Q26:premise/hypothesis 都是原文吗?
A:premise 是真实报告句;Swaps 的 hypothesis 是关键词替换后的生成句——引用例句时注意来源差异。
Q27:怎么评估?
A:零样本:算句对 embedding 余弦相似度当 logits,扫阈值报 accuracy/AUROC——Usage Notes 给的官方姿势。
§10.4 标注与质量(9 问)
Q28:谁做的标注?
A:board-certified 放射科医生——页面致谢段点名 Dr Maria Teodora Wetscherek 承担临床输入与数据标注。
Q29:图像标签的来源链条?
A:Chest ImaGenome silver 标签 → 排歧 → 板证医生逐条 accept/reject(给报告+来源句)→ gold。
Q30:盲审是怎么做的?
A:子集交第二位放射科医生盲标(不看已有标签)以测 inter-observer agreement——质量测量手段,非全量双标。
Q31:双标一致率多少?
A:数据集页面未披露具体 κ/百分比——只有 label_quality 三值间接承载;协议细节在论文 Appendix C。
Q32:silver→gold 提升排除了什么?
A:同一病理有多个矛盾进展标签的 study(如左积液增多+右积液稳定)——病理级单值标签无法成立的直接排除。
Q33:图像有质量控制吗?
A:有——一 study 多张 frontal 片时由放射科医生选最佳片,保证入集影像诊断质量。
Q34:‘Pulmonary edema/hazy opacity’ 映射?
A:Chest ImaGenome 的这个属性映射为 CheXbert 口径的 ‘Edema’——两个标签体系互操作的唯一官方说明。
Q35:一共有多少人工裁决?
A:全量 1,326 对图像标签 + 361 对句子标注都经板证医生裁决——‘manually annotated and reviewed’ 是 Abstract 的原话。
Q36:标注和 MS-CXR(340)的标注是一回事吗?
A:不是——340 是放射科医生在图上画病理边界框(空间对齐),本集是进展三态与句子分类(时序语义)。
§10.5 成绩单与口径(9 问)
Q37:BioViL-T 的成绩?
A:分类 Top-1 81.1 / AUC 0.883;句子任务 87.77±0.5 / AUC .933±.003——两个科目都是榜首。
Q38:宏口径下多少?
A:第三方聚合的每病理 Macro Acc 平均 60.2(BioViL 57.8)——与 Top-1 的 21 点落差是类不均衡所致。
Q39:为什么两个口径都要报?
A:页面 Usage Notes 明文推荐 macro-F1/macro-accuracy 并按病理分列——plain Top-1 吃多数类红利,宏口径对 improving 公平。
Q40:PubMedBERT 成绩?
A:句子任务 60.39 / .542——比 CXR-BERT-G 还低,接近抛硬币;它在 RadNLI 上有 81.38,静态强时序崩。
Q41:CXR-BERT 两个版本差在哪?
A:General 62.60 / .601,Specialized 78.12 / .837——同一基座、单图监督微调,时序语义大涨而静态(RadNLI)只涨 2 分。
Q42:时序预训练伤静态任务吗?
A:不伤——BioViL-T 在 RadNLI 90.52 / .947 反超所有对照;phrase grounding、报告生成、CheXpert 分类同步增益。
Q43:对比基线有哪些?
A:CheXRelNet(图卷积跨 ROI)、CNN+Transformer、BioViL(含 affine 4-DoF 配准变体)——论文 Table 3/4 全列。
Q44:数据 curation 值多少分?
A:+0.68pp(聚合口径)——gold 标注回流微调的净增益,论文 A.4 的消融结论。
Q45:消融的三个关键?
A:静态/时序特征分解(单图任务不崩)、位置编码(分辨先后顺序)、局部对比损失(语言监督有意义)。
§10.6 生态与家族(9 问)
Q46:母库是什么?
A:MIMIC-CXR Database v2.0.0(本库 rid 16)——图像对与句子都取自它的 227,835 studies。
Q47:和 MS-CXR(rid 340)什么关系?
A:同门姊妹:340 考静态短语接地(712 图边界框),本集考时序双任务——BioViL-T 在两份考卷上都第一。
Q48:和 Chest ImaGenome(rid 330)什么关系?
A:上游供货商:本集分类标签从其 silver 进展标签提升而来;ImaGenome 本体是 22 区域场景图+进展标签。
Q49:和 RadGraph(rid 561)什么关系?
A:工具依赖:句对 RadGraph 子集用其实体图引擎配对——117 对的骨架。
Q50:和 MIMIC-CXR-JPG(rid 617)什么关系?
A:平行加工层:617 是全库 37.7 万图的 14 类静态弱监督标签,本集是小而金的时序标签——规模换精度 vs 精度换规模。
Q51:BioViL/BioViL-T 是数据集吗?
A:是模型框架(HF microsoft/BiomedVLP-BioViL-T),不是数据集——本集是它们的官方评测基准。
Q52:代码在哪?
A:HI-ML GitHub(aka.ms/biovil-t-code);模型卡在 HF——四件套(论文/模型/代码/考卷)齐发。
Q53:aka.ms/ms-cxr-t 是什么?
A:论文脚注 4 的官方短链,直指 PhysioNet 本集页面。
Q54:RSNA Pneumonia 在论文里干嘛?
A:零样本/微调分类的对照考场(Shih 2019,参考文献 [1])——与本集无隶属关系,只是同场竞技。
§10.7 许可与合规(9 问)
Q55:License 是什么?
A:PhysioNet Credentialed Health Data License 1.5.0——Credentialed 档最严的文件许可。
Q56:DUA 是什么?
A:PhysioNet Credentialed Health Data Use Agreement 1.5.0——使用协议,签署后才能下载。
Q57:要上什么课?
A:CITI ‘Data or Specimens Only Research’——PhysioNet 认证的标准必修。
Q58:能商用吗?
A:License 1.5.0 框架下以研究为主;任何用途先读 DUA 条款——与全部 MIMIC 派生集同一套规则。
Q59:再分发可以吗?
A:不可以随意再分发——用户各自走 PhysioNet 认证,数据不出 Credentialed 围栏。
Q60:伦理审查谁背书?
A:母库 MIMIC-CXR 的伦理框架全部继承;本集自身做筛选偏移披露(§7 五问)——双重披露制。
Q61:COI 声明?
A:页面明示 ‘The authors have no conflicts of interest to declare’。
Q62:合规审查有谁?
A:致谢段点名 Hannah Richardson 指导数据集合规审查(compliance review)——数据集署名含她而论文不含。
Q63:和 PhysioNet 2026 平台什么关系?
A:页面底部引 Pollard et al. 2026(Nature Health, doi:10.1038/s44360-026-00096-z)——PhysioNet 平台的新官方引用,与本集内容无关但引用格式要带。
§10.8 偏移与伦理(9 问)
Q64:年龄偏移多少?
A:平均 64.99 岁 vs 母库 56.85 岁——本集偏老约 8 岁。
Q65:性别偏移多少?
A:女性 45.88% vs 母库 52.39%——偏少约 6.5 个百分点。
Q66:为什么偏移?
A:纳入条件是’两连续片上可见 finding’——老年与病情变化者更可能满足;页面原文用了 ‘could potentially explain’ 的审慎措辞。
Q67:偏移是谁披露的?
A:页面 Ethics 段自我披露 + 论文同步披露——‘we have disclosed this both alongside the dataset and in the corresponding work’。
Q68:引用了什么偏倚框架?
A:Weber et al. 2017 JAMIA——'按 complete data 筛选 EHR 引入偏倚’的方法论经典(References [10])。
Q69:这个偏移致命吗?
A:页面自评 relatively small shifts;本集主要用途是基准复现而非流行病学推断——用途不同,偏移的杀伤力不同。
Q70:有 IRB 信息吗?
A:本集是派生工件,无新患者数据——伦理重心在母库 MIMIC-CXR(其 BIDMC 框架),页面不重复。
Q71:能用于临床决策吗?
A:不能——HF 模型卡明示不用于自动诊断或医疗器械;本集是研究基准。
Q72:儿科能用吗?
A:不能——MIMIC-CXR 是成人 ICU 库,本集继承;儿科时序需另找数据。
§10.9 工程与复现(9 问)
Q73:CSV 键怎么接 MIMIC?
A:subject_id/study_id/dicom_id 直通 MIMIC-CXR 生态——join metadata 文件定位图像路径,join reports 拿原文。
Q74:分类任务怎么算分?
A:三态三分类:plain Top-1 + 宏口径(balanced acc / macro-F1)+ 按病理分列——三件一起报(§9.4 清单)。
Q75:句子任务怎么算分?
A:embedding 余弦相似度 → 阈值扫描 → accuracy/AUROC;RadGraph/Swaps 分子集报(§4.4 捷径检测)。
Q76:模型权重怎么拿?
A:HF microsoft/BiomedVLP-BioViL-T,AutoModel + trust_remote_code=True——模型卡有 get_projected_text_embeddings 的官方用法。
Q77:能只测文本模型吗?
A:能——句子任务与图像无关,361 对直接测任意文本编码器(PubMedBERT 等就是这么上表的)。
Q78:预处理有什么坑?
A:句子按 CheXbert 五病理过滤的口径要与训练时一致;图像对取片时 DICOM 路径大小写与 meta 文件严格对应。
Q79:怎么复现 87.77?
A:用 BioViL-T 官方权重 + get_projected_text_embeddings + 阈值扫描;细节差在 pool 策略——模型卡与论文附录 E 是两份说明书。
Q80:图像 QC 的’最佳片’在哪标记?
A:不在 CSV 里——QC 是入集前的筛选步骤,入集即每 study 一张最佳片;CSV 不含 QC 元信息。
Q81:评估代码有官方版吗?
A:论文代码仓(HI-ML)含评测管线;社区亦有多套复现——以官方仓为准,第三方实现注意阈值协议差异。
§10.10 对比与选型(9 问)
Q82:要时序图像标签,选它还是 ImaGenome?
A:要全量训练信号选 ImaGenome(silver 全库);要金标评测选本集(1,326 对板证裁决)——训练与考试分开。
Q83:要句子级 NLI,选它还是 RadNLI?
A:时序语义选本集(361 对,两子集捷径检测);静态 NLI 选 RadNLI(145 对,论文用作静态对照)——两份考卷互补。
Q84:要短语接地,选它还是 MS-CXR?
A:静态接地选 340;时序能力选本集——BioViL-T 论文把两者都当考场。
Q85:要弱监督大规模标签,选什么?
A:617 MIMIC-CXR-JPG(37.7 万图 14 类五值)——规模优先的经典选择。
Q86:要报告层病种金标,选什么?
A:518 MIMIC-IV-Ext-PE(19,942 份双人共识五类)——文本层全量金标的参照系。
Q87:519 在标注三级阶梯里的位置?
A:金标混合级:机器预标(silver/句对)+ 板证全量裁决 + 子集盲审——介于 617 弱监督与 518 双人共识之间。
Q88:同类时序基准还有谁?
A:胸片时序方向公开基准稀缺正是本集立项理由(页面 Background 点名私有数据困境)——直连竞品少。
Q89:CheXpert 在论文里干嘛?
A:肺炎分类的对照考场(AUC 0.882 vs 0.870)——rid 5 的另一个出场方式。
Q90:一句话总结选型?
A:考时序语义:图像对 + 句对本集全包;要训练语料去 ImaGenome/617;要静态对齐去 340。
Q90:一句话总结选型?
A:考时序语义:图像对 + 句对本集全包;要训练语料去 ImaGenome/617;要静态对齐去 340。
Q91:数据集会更新吗?
A:四年无修订(单版本 v1.0.0)——基准考卷的稳定是特性不是缺陷;latest DOI(ga7g-1614)用于跟踪未来可能的修订,日常引用固定 pg10-j984。
Q92:和 RadNLI 是什么关系?
A:互补考卷——RadNLI(145 对)考静态 NLI,本集考时序语义;论文用两者对照证明"时序预训练静态不掉点"(§5.2 双列表)。RadNLI 不在 PhysioNet 本集页面的 Parent Projects 里,是论文层面的对照集。
Q93:为什么叫"基准"而不是"数据集"?
A:两者都是——PhysioNet 收录其为 project(数据集身份),论文定位其为 benchmark(评测身份)。本条目按"基准型数据集"处理:体量小、金标、考卷不换题、跟论文引用走。
Q94:拿到数据第一步做什么?
A:读两个 CSV 的 schema(§3.1/§4.1 表)→ 盘分布(§9.1 脚本)→ 决定评测协议(宏口径/分子集)→ 最后才去申请 MIMIC-CXR 图像(句子任务完全不需要图像)。
(FAQ 实际 94 问——九十问速查为栏目名,按组覆盖身份/任务/标注/成绩/生态/合规/伦理/工程/选型九域)
§11 事实清单:核查记录
- slug ms-cxr-t(批次队列登记 ‘MS’ 为截断;官方 slug 为准)
- 挂牌 2023-03-17(页面 Published 字段)
- 版本 v1.0.0 单版本(Versions 段仅一条记录)
- DOI v1.0.0 = 10.13026/pg10-j984(页面 DOI (version 1.0.0) 字段)
- DOI latest = 10.13026/ga7g-1614(页面 DOI (latest version) 字段)
- Access Policy:仅签署 DUA 的认证用户(页面原话)
- License 1.5.0(PhysioNet Credentialed Health Data License)
- DUA 1.5.0(PhysioNet Credentialed Health Data Use Agreement)
- 必修 CITI ‘Data or Specimens Only Research’
- RRID:SCR_007345(citation 块内)
- Topics 六个:disease progression/cxr/vision-language processing/chest x-ray/radiology/multimodal
- Project Views 407(2026-09 快照)
- Current Version Views = All Versions Views = 407
- 文件两个 CSV:image_classification + sentence_similarity(Folder structure 段)
- 页面文件区显示 ‘Data Not Available’(地区/登录限制)
- 页面无 Total Size 字段
- Parent Projects:MIMIC-CXR Database v2.0.0
- PhysioNet 作者 15 人(页面作者列表逐一核对)
- arXiv 论文作者 16 人(abs 页逐一核对)——两名单不一致
- 论文独有:Anja Thieme / Matthew P. Lungren / Aditya Nori
- 数据集独有:Hannah Richardson / Tristan Naumann
- Boecking 挂 CMU+MSR 双机构(页面 data-content)
- Naumann 挂 MSR+MIT CSAIL 双机构(页面 data-content)
- COI:作者声明无利益冲突(页面原话)
- 致谢:Richardson 合规审查 + Wetscherek 临床输入与标注
- 论文 arXiv 2301.04558,v1 2023-01-11,v2 2023-03-16
- 论文正式发表 CVPR 2023(openaccess PDF + ‘To appear in CVPR 2023’)
- 论文提交人 Ozan Oktay(arXiv submission history)
- 框架名 BioViL-T:CNN-Transformer 混合多图编码器
- Abstract 定位:two distinct temporal tasks in radiology
- 任务一 N=1326 图像对(Abstract 原文)
- 任务二 N=361 句对(Abstract 原文)
- 三态:Improving/Stable/Worsening(Abstract 原文)
- 800 subjects(Table 1 Total 行)
- Consolidation 201(14%/42%/44%)/ 187 subjects
- Edema 266(31%/26%/43%)/ 241 subjects
- Pleural effusion 411(19%/49%/32%)/ 370 subjects
- Pneumonia 237(8%/25%/67%)/ 218 subjects
- Pneumothorax 211(15%/55%/30%)/ 148 subjects
- 全库类分布 18%/40%/42%
- 类不均衡解释:患者好转时不拍片(页面原话)
- 先片规则:nearest prior by acquisition timestamps
- silver→gold 提升:随机抽 ImaGenome silver 候选(排除 gold 已验证)
- 排歧:滤掉同一病理多矛盾标签的 study(左增右稳例)
- 裁决材料:当前报告 + 自动标签来源句(模仿 ImaGenome gold 构建法)
- 盲审:第二位放射科医生盲标子集测一致性
- QC:多 frontal 片 study 由医生选最佳片
- 映射声明:ImaGenome ‘Pulmonary edema/hazy opacity’ → CheXbert ‘Edema’
- label_quality 三值:multiple_experts/disagreement/one_expert
- 页面未披露双标一致率具体数值
- 句子构建第一步:Stanza 切句(Zhang 2021 JAMIA [8])
- 句子过滤:CheXbert 五病理 + 时序关键词(high sensitivity)
- RadGraph 法:实体图匹配,放宽时序词与病理提及约束
- Swaps 法:CXR-BERT-Specialized top-5 masked 预测换时序词
- 剔除三类:语义不清/与时序无关/语法错误
- RadGraph 117 = 42 paraphrase + 75 contradiction
- Swaps 244 = 99 + 145
- Total 361 = 141 paraphrase + 220 contradiction
- Table 2 四例句全录(Swaps/RadGraph × paraphrase/contradiction)
- Schema 表:sentence_1/sentence_2/category/subset_name
- 评估姿势:余弦相似度 + 阈值 → accuracy/AUROC(Usage Notes)
- BioViL-T 分类 Top-1 81.1 / AUC 0.883(论文多源交叉)
- BioViL 分类 AUC 0.831(对照)
- sota2 宏口径:BioViL-T 平均 60.2 vs BioViL 57.8
- BioViL-T 分病理:PE 67/Edema 61.9/PTX 42.6/Consol 61.1/Pneu 68.5
- Usage Notes 推荐 macro-F1/macro-accuracy + 按病理分列
- 句子榜:PubMedBERT 60.39/.542
- 句子榜:CXR-BERT-G 62.60/.601
- 句子榜:CXR-BERT-S 78.12/.837
- 句子榜:BioViL-T 87.77±0.5/.933±.003
- RadNLI 对照:BioViL-T 90.52±1.0/.947±.003(静态不掉点)
- RadNLI 145 对(论文对照集,与本集不同)
- phrase grounding:BioViL-T CNR 1.33/mIoU 0.240 vs BioViL 1.07/0.229
- grounding accuracy 72.4 vs 71.0
- report gen:ROUGE-L 0.276 vs 0.268;BLEU-4 0.116 vs 0.097
- CheXpert 肺炎 AUC 0.882 vs 0.870
- 预训练:174.1k 训练对/4.9k 验证对(多图 118.8k+单图 55.3k)
- 下游共享测试集 2,971
- curation 回流增益 +0.68pp(论文 A.4)
- HF Limitations:英语 only/ICU 短时距(跨年可能降级)/不用于医疗器械
- 代码 HI-ML GitHub(aka.ms/biovil-t-code)
- 模型 HF microsoft/BiomedVLP-BioViL-T
- 短链 aka.ms/ms-cxr-t(论文脚注 4)
- Ethics:母库伦理全部继承
- 年龄偏移:64.99 vs 56.85 岁(页面原话)
- 性别偏移:45.88% vs 52.39% 女(页面原话)
- 偏移解释:仅纳入两连续片有 finding 的 subject
- 偏倚框架引用:Weber 2017 JAMIA complete-data 筛选偏倚([10])
- References 共 10 条(编号完整无错位)
- [1] Shih 2019 RSNA 肺炎专家标注
- [2] Boecking 2022 ECCV(BioViL/CXR-BERT/MS-CXR)
- [3] Shamout 2021 npj(私有数据集例证)
- [4] Johnson 2019 MIMIC-CXR
- [5] Wu 2021 Chest ImaGenome(arXiv 2108.00316)
- [6] Smit 2020 EMNLP CheXbert
- [7] Jain RadGraph(页面此条无年份卷期——瑕疵存照)
- [8] Zhang 2021 JAMIA Stanza
- [9] Bannur 2023 arXiv 2301.04558(本文)
- [10] Weber 2017 JAMIA 偏倚框架
- 页面底部平台引用:Pollard 2026 Nature Health(doi:10.1038/s44360-026-00096-z)
- 查重:ms-cxr 主条目 rid 340 在库;本条为时序姊妹版(url_name=‘ms-cxr-t’ 精确区分)
- 互链目标:rid 16/330/340/5/561/617
- 发布前 MAX(record_id)=618 → 本条预期 rid 619
§12 术语表:五十条
1. MS-CXR-T —— 本条目:MIMIC-CXR 派生的时序双任务基准(1,326 图对 + 361 句对)
2. BioViL-T —— 微软的时序 VLP 预训练框架(CVPR 2023)——本集官方榜首
3. BioViL —— 时序版之前的静态预训练框架(ECCV 2022)——本集主要对照
4. CXR-BERT —— 放射文本编码器(General/Specialized 两版)——句子任务对照
5. 时序基准(temporal benchmark) —— 考’跨时间点变化’而非’单时点状态’的评测集
6. 疾病进展(disease progression) —— 病情随时间的走向——本集三态化的核心语义
7. 三态标签 —— improving/stable/worsening——进展分类的类空间
8. 图像对(image pair) —— 当前片+最近先片的组合——本集分类任务的基本单元
9. 最近先片(nearest prior) —— 按采集时间戳取的同患者前一次检查
10. silver 标准 —— 规则引擎自动导出的标签(ImaGenome 进展标签)
11. gold 提升 —— silver 候选经专家逐条 accept/reject 转为金标的过程
12. 排歧(de-ambiguation) —— 滤掉同一病理多矛盾标签的 study
13. 盲审复标 —— 第二位医生不看已有标签复标子集以测一致性
14. label_quality —— 三值质量标签:multiple_experts/disagreement/one_expert
15. board-certified radiologist —— 板证放射科医生——本集全部标签的裁决者
16. Wetscherek —— Maria Teodora Wetscherek——本集临床输入与标注的致谢对象
17. paraphrase —— 同义改写——句子任务的二类之一
18. contradiction —— 时序矛盾——句子任务的二类之二
19. premise/hypothesis —— 句子对的句 1/句 2(NLI 术语)
20. RadGraph 法 —— 按实体图匹配造句对——允许措辞自由
21. Swaps 法 —— 替换时序关键词造句对——句间只差几词
22. masked token 预测 —— CXR-BERT-Specialized 的完形填空输出——Swaps 的换词来源
23. 时序关键词 —— interval/unchanged/resolution/worsening 等进展触发词
24. Stanza —— Stanford 的句法解析库——本集切句工具
25. CheXbert —— 五病理自动标注器——句子过滤与 Edema 口径来源
26. CheXpert —— 斯坦福 22.4 万胸片数据集(rid 5)——论文肺炎分类对照场
27. Chest ImaGenome —— MIMIC-CXR 派生场景图数据集(rid 330)——silver 供货商
28. RadGraph —— 放射报告实体关系抽取数据集(rid 561)——句子配对引擎
29. RadNLI —— 放射 NLI 基准(145 对)——论文静态对照集
30. MIMIC-CXR —— 母库:BIDMC 227,835 studies(rid 16)
31. MIMIC-CXR-JPG —— 母库加工层:377,110 JPG+14 类标签(rid 617)
32. MS-CXR —— 同门姊妹集:静态短语接地基准(rid 340)
33. 短语接地(phrase grounding) —— 把文本短语定位到图像区域的任务——340 的科目
34. VLP(vision-language processing) —— 视觉-语言处理——本集所属领域
35. 零样本评测 —— 不微调直接测——句子任务的官方姿势
36. 余弦相似度 —— 句对 embedding 的相似度量——本集的类 logits
37. Top-1 准确率 —— plain accuracy——81.1 的口径(多数类红利大)
38. 宏口径(macro) —— 类平均准确率——60.2 的口径(Usage Notes 推荐)
39. 类不均衡 —— improving 18% 的分布现实——双口径落差的根源
40. 筛选偏倚 —— Weber 2017 的 complete-data 框架——本集偏移披露的理论出处
41. Credentialed —— PhysioNet 认证访问档——License+DUA+CITI 三件套
42. DUA 1.5.0 —— PhysioNet 认证健康数据使用协议
43. CITI —— 伦理培训课程平台——‘Data or Specimens Only Research’ 必修
44. cr:RecordSet —— Croissant 模式的记录集节点——本条目 frontmatter 双 CSV 各一
45. rai:dataLimitations —— AI 就绪披露节点——本条目七条限制
46. CVPR —— IEEE 计算机视觉与模式识别会议——论文正式发表地(2023)
47. HI-ML —— 微软医疗 AI 工具箱——BioViL-T 代码仓所在
48. HF 模型卡 —— HuggingFace microsoft/BiomedVLP-BioViL-T——权重+用法+限制
49. 基准型数据集 —— 小而金、考卷不换题的评估集——本集的物种属性
50. 标注三级阶梯 —— 全自动(616)→弱监督(617)→共识金标(518)→金标混合(519)
附录 A:发布时间线与版本对照
| 日期 | 事件 |
|---|---|
| 2019-12 | 母库 MIMIC-CXR(Johnson et al.)发表于 Scientific Data |
| 2021-07 | Chest ImaGenome 挂 arXiv 2108.00316(silver 进展标签的源头) |
| 2022-10 | BioViL/CXR-BERT 论文(Boecking et al.)发表于 ECCV 2022;MS-CXR 基准同步公开 |
| 2023-01-11 | 论文 arXiv 2301.04558 v1 提交 |
| 2023-03-16 | 论文 v2 修订(CVPR camera-ready 周期) |
| 2023-03-17 | MS-CXR-T v1.0.0 挂牌 PhysioNet(单版本至今) |
| 2023-06 | CVPR 2023 正式收录(openaccess 全文可见) |
| 2026-09 | 页面 Views 407;数据集无任何修订——考卷四年不换题 |
对照注:本集"先论文(01-11)后数据(03-17)“间隔 65 天,属"论文与考卷同步出厂"型;对照 518 的"先论文后数据 10 个月”,节奏完全不同——基准工件要跟 CVPR 的评审周期走,临床标签集要跟临床验证走。
附录 B:Table 1 全录(分类任务分布)
| Finding | 样本数 | improving / stable / worsening | subjects |
|---|---|---|---|
| Consolidation | 201 | 14% / 42% / 44% | 187 |
| Edema | 266 | 31% / 26% / 43% | 241 |
| Pleural effusion | 411 | 19% / 49% / 32% | 370 |
| Pneumonia | 237 | 8% / 25% / 67% | 218 |
| Pneumothorax | 211 | 15% / 55% / 30% | 148 |
| Total | 1,326 | 18% / 40% / 42% | 800 |
三点读法:一,Pleural effusion 样本最多(411)但 improving 占比(19%)并不最高——Edema 的 31% 才是 improving 最多的病理(复查行为在水肿患者中最常见);二,Pneumothorax 的 stable 占比最高(55%),与气胸"稳定观察"的临床处置习惯一致;三,Pneumonia 的 worsening 67% 最极端,与"肺炎恶化才复查"的 ICU 现实对表。分布本身就是临床行为学的抽样。
附录 C:Table 3 全录(句子任务分布)
| 子集 | Paraphrase | Contradiction | Total |
|---|---|---|---|
| RadGraph | 42 | 75 | 117 |
| Swaps | 99 | 145 | 244 |
| Total | 141 | 220 | 361 |
两个子集都是 contradiction 偏多(RadGraph 75:42、Swaps 145:99)——Swaps 用同义时序词替换造 paraphrase 的成功率高,但造出"方向词反转"的 contradiction 更容易;RadGraph 配对在放宽约束后更多落进"语义相反"格。引用时若按子集分层评估,这个 2:3 的类比也要一并交代。
附录 D:口径差异存照(并列引用,不仲裁)
| 项 | 口径 A | 口径 B | 处置 |
|---|---|---|---|
| 分类成绩 | Top-1 81.1 / AUC 0.883(论文主口径) | Macro Acc 60.2(第三方聚合,Usage Notes 推荐宏口径) | 并列引用并注明口径 |
| 作者名单 | PhysioNet 15 人(含 Richardson/Naumann) | arXiv 论文 16 人(含 Thieme/Lungren/Nori) | 按所引工件对表 |
| DOI | pg10-j984(v1.0.0) | ga7g-1614(latest) | 基准引用固定前者 |
| 双标一致率 | 页面未披露数字 | label_quality 三值标签 | 如实写"页面未披露" |
| RadGraph 引用 | 页面 [7] 无年份卷期 | Jain et al. 2022 JAMIA(外部核对) | 本条目补全但注明页面瑕疵 |
| 进展标签来源 | 本集 gold(板证裁决) | ImaGenome silver(规则引擎) | 训练/评测分流(附录 F) |
附录 E:silver→gold 提升步骤表(复现用)
| 步骤 | 动作 | 输入 | 输出 |
|---|---|---|---|
| 1 | 随机抽样 | ImaGenome silver study 池(排除 gold 已验证) | 候选 study 集 |
| 2 | 排歧过滤 | 候选集 | 单值化 study(剔除一病理多标签者) |
| 3 | 专家裁决 | study + 当前报告 + 标签来源句 | accept/reject 逐条判定 |
| 4 | 盲审复标 | accept 子集 | 双标数据 → label_quality 三值 |
| 5 | 图像 QC | 多 frontal 片 study | 每 study 一张最佳片 |
附录 F:训练信号与考试卷分流表
| 需求 | 该用哪套 | 原因 |
|---|---|---|
| 微调/预训练时序分类器 | Chest ImaGenome silver 全量 | 体量;论文微调同款 |
| 评测时序分类器 | 本集 1,326 对 | 题题板证金标 |
| 评测文本编码器时序敏感度 | 本集 361 句对 | 零样本协议 + 捷径检测 |
| 全库弱监督 14 类标签 | 617 MIMIC-CXR-JPG | 37.7 万图规模 |
| 区域级场景图推理 | 330 Chest ImaGenome 本体 | 22 区域格式 |
| 静态短语接地 | 340 MS-CXR | 712 图边界框 |
附录 G:本库 MIMIC-CXR 谱系与本条互链
| 本库条目 | 关系 | 链接语义 |
|---|---|---|
| rid 16 mimic-cxr | 母库 | 图像对与句子的原始来源(227,835 studies) |
| rid 340 ms-cxr | 同门姊妹 | 静态接地 vs 时序双任务——后缀 T 的对照条目 |
| rid 330 chest-imagenome | 上游 silver | 进展标签供货商 + 训练信号全量来源 |
| rid 561 radgraph | 工具依赖 | RadGraph 子集的实体图引擎 |
| rid 5 chexpert | 口径来源 | CheXbert 过滤口径 + 肺炎分类对照场 |
| rid 617 mimic-cxr-jpg | 平行加工层 | 全量弱监督 vs 小而金(规模/精度分流) |
附录 H:批次七生产存照(519 号)
- 生产序号:批次七 3/10(数据集总序 519;发布后 record_id 619)
- 核查轮次:4 轮——①PhysioNet 页面全段提取(70,225 B 快照);②arXiv abs 页(作者名单/版本史/CVPR 归属);③CVPR openaccess + ar5iv + HF 模型卡(预训练底账/成绩/局限);④sota2.com(宏口径聚合)+ DB 互链目标实测
- 关键修正:批次队列 name_en=‘MS’ → 实测 slug ms-cxr-t;sota2 宏口径 60.2 与论文 Top-1 81.1 并存(双口径存照进 §5.1/§8 坑点 2)
- 意外收获:论文 16 人 vs 数据集 15 人名单差异;RadNLI 145 对的静态对照价值;Pneumonia improving 8% 的极端类不均衡
- 成品行数:见发布记录(目标 ≥1200)
- 下一发:520 myocardial-perfusion-spect(批次七 4/10)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- ms-cxr — 共享标签:医学影像 / 多模态 / X光影像 / 影像-文本对齐
- reflacx-xray-localization — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
- radvlm-instruction-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
- radialog-instruct-dataset — 共享标签:医学影像 / 医疗NLP / 多模态 / X光影像
- rexgradient-160k — 共享标签:医学影像 / X光影像 / 影像-文本对齐 / 评测基准
- chexpert-plus — 共享标签:医学影像 / 医疗NLP / X光影像 / 影像-文本对齐
- reg2026 — 共享标签:医学影像 / 医疗NLP / 多模态 / 影像-文本对齐
- vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
- rexvqa — 共享标签:医学影像 / 多模态 / X光影像 / 评测基准
- biomedica — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

