信息速览
INFOBOX — CXR-LT 2024 一屏速览
维度 内容 本质 MIMIC-CXR-JPG v2.0.0 全量 377,110 张胸片的长尾多标签扩展重标注版(图像沿用本体,CXR-LT 只发标签层) 挑战赛 2023 第一届 = ICCV 2023 CVAMD Shared Task(26 类);2024 第二届 = MICCAI 2024 challenge(45 类 + zero-shot 赛道) 标签代数 45 = 14(MIMIC-CXR 原始)+ 12(2023 新增 rare)+ 19(2024 新增 rare),规则法从放射报告自动解析 三切分 Train 258,871 / Dev 39,293 / Test 78,946(40 标签)+ gold standard 406 张(26 标签,6 人共识)+ 5 个 zero-shot 未见类 参与规模 2024:96 队申请→61 获批→29 队开发阶段(1,374 次提交)→17 队测试阶段→top 9 受邀 MICCAI;2023:209 申请→59 获批 评估 主指标 mAP(macro AP);mAUC 决 tie;mAUC/mF1/mECE 上板不排名 冠军成绩 Task 1:ASU ChexFusion+ mAP 0.281;Task 2:Yale 0.526;Task 3(zero-shot):U Penn 0.129 获取 PhysioNet credentialed access(DOI 10.13026/ryj9-x506,v2.0.0,2025-03-19 发布)+ 签 DUA;前置条件 MIMIC-CXR-JPG v2.0.0 凭据 许可 PhysioNet Credentialed Health Data License 1.5.0(非 CC 开放许可;无 HF 公开镜像) 核心主张 真实影像所见长尾超 4,500 种,唯有多模态基础模型 + zero-shot 才能触达尾部——两届冠军方案已转向生成式合成与视觉-语言学习 库内互链 mimic-cxr-jpg(617)、mimic-cxr(16)、nih-chestx-ray14(15)、padchest(117)、vindr-cxr(125)、chexstruct-cxreasonbench(604)
CXR-LT 是一个"把最大胸片库重新数一遍病"的系列工程:图像一张不新增,标签却从 14 类扩到 26 类再扩到 45 类——每一轮都从放射报告里"挖"出一批教科书上常见、基准数据集里却没有的罕见病。它的数据集本身平淡无奇(377,110 张图全部来自 MIMIC-CXR-JPG),它的价值在两届挑战赛把全球长尾学习社区拉到同一个起点上互相校准:2023 届冠军 0.372 mAP,2024 届加了 19 个罕见类后冠军掉到 0.281——这个"倒退"恰恰是数据集要暴露的临床真相:罕见病的自动标注与识别仍然远未解决,而 zero-shot 赛道最优 0.129 mAP 说明"未见疾病"几乎是空白区。
对千方病案医数集的读者,CXR-LT 的三重身份决定了它的检索价值:
- 作为数据集,它是库内 mimic-cxr-jpg(617) 条目的标签增量层——图像完全同源,标签多出 31 个罕见类,是胸片域目前标签谱系最长的公开资源;
- 作为挑战赛档案,它记录了 2023/2024 两届共 305 支申请队伍、约 1,900 次提交、18 个公开方案的方法论快照,是长尾分类方法的天然综述素材;
- 作为评测协议,它沉淀了"mAP 主指标 + 噪声/干净双测试集 + zero-shot 扣类赛道"的设计范式,可移植到任何医学影像评测。
导语读法三则:
- 只想下数据:直奔 §5 获取与许可——credentialed + DUA 双门槛、双包配合(标签包 + 图像包),没有 HF 镜像,别白跑。
- 关心长尾与零样本:直奔 §4 两届成绩对照——26 类共有类的跨届可比性分析与 zero-shot 0.129 的含义。
- 做挑战赛复盘或方法研究:直奔 §3 赛制设计 + §4.4 获胜方案主题——mAP 主指标的选择理由与 top 9 方案的技术公约数。
在库内条目类型学里,本条目属于"事件驱动型数据集"——与"采集驱动型"(如 padchest:为一个研究问题独立采集)和"加工驱动型"(如 panda-plus:为修正标签质量而重标注子集)不同,事件驱动型的核心资产是协议与基线,数据本体反而是继承来的。三类条目的阅读重心不同:采集驱动型看采集规范,加工驱动型看加工流水线与质量对照,事件驱动型(本条目)看赛制、指标与成绩档案——这也是本条目把 §3/§4 写得比一般数据集条目更重的原因。
§0 导读:这个数据集解决什么问题
0.1 长尾:胸片 AI 的第一性困难
胸片是医学影像里最大众化的检查,也是标签体系最"头轻脚重"的模态:肺炎、积液、心脏肥大这些常见所见构成了数据集的头部,而肺栓塞、结核、肋骨骨折这些临床上的重要诊断沉在尾部。现有公开胸片基准的标签集普遍只有个位数到十几类(NIH ChestX-ray14 14 类、CheXpert 14 类、MIMIC-CXR 14 类),而 Radiology Gamuts Ontology 收录的影像学所见超过 4,500 种——CXR-LT 团队的判断是:真实临床所见分布比任何现有基准长两个数量级以上,靠不断扩大封闭标签集永远追不上,终局方案是能对未见类别做 zero-shot 泛化的模型。
长尾在胸片上不是理论假设而是可测量的日常:一家三甲医院的年度胸片报告里,“肺纹理增重”“主动脉钙化”“脊柱侧弯"这类所见出现的频率与"肺栓塞”"纵隔气肿"相差几个数量级。监督学习的经典困境在尾部类上以最尖锐的形式出现——模型在 40 个类上平均表现再好,只要肺栓塞这种"漏诊即临床事故"的类别分数不行,系统就无法进入真实工作流。
0.2 CXR-LT 的三层回答
CXR-LT 的回答分三层。第一层是数据:把 MIMIC-CXR-JPG 的 377,110 张图,用规则法从自由文本放射报告里解析出两轮新标签——2023 届加 12 个罕见类(26 类),2024 届再加 19 个(45 类),让"尾部"从象征性存在变成可训练、可评测的实体。第二层是赛事:两届挑战赛(ICCV 2023 CVAMD → MICCAI 2024)提供公开排行榜与统一评估口径(mAP 为主指标),把长尾多标签学习的社区最优解沉淀成可引用的基线。第三层是路线批判:2024 届专门设置 zero-shot 赛道,把 5 个疾病类别完全扣下不发给参赛者,用"训练时从未见过"的设定逼社区回答"封闭标签集之外怎么办"——结果是全场 mAP 不过 0.129,这个数字本身就是对领域现状最诚实的测量。
这三层不是并列关系而是递进关系:数据层证明"尾部可以标注出来",赛事层证明"尾部可以评测起来",协议层证明"封闭标签集之外还有测试"。理解这个递进,才能理解为什么一个"没有一张新图"的数据集能撑起两届国际赛事。
0.3 与库内相邻条目的分工
千方库胸片域 23 条,与本条目最相关的四个"邻居"各有分工:
- mimic-cxr-jpg(617):图像本体与原生 14 类标签的权威记载——CXR-LT 的一切图像工程问题在那里解决;
- nih-chestx-ray14(15):14 类长尾评测的历史起点——CXR-LT 的"代际对话"对象;
- padchest(117):174 类标签广度的另一极——西班牙单中心、报告挖掘+人工核验路线;
- chexstruct-cxreasonbench(604):同出 MIMIC 报告挖掘家族的结构化推理基准——任务面不同、方法论同源。
§0 读法三则:
- 这个条目是"数据集+两届挑战赛+方法论路线图"三合一:本体是标签扩展层(依附 MIMIC-CXR-JPG),事件是两届赛事,副产品是一套"长尾+多标签+零样本"的评估协议——三者获取方式与许可同一(PhysioNet credentialed)但使用姿势不同(§5)。
- 全文硬数字均出自 PhysioNet v2.0.0 页面、arXiv 2506.07984 全文(后刊 Medical Image Analysis 2025;106:103739)与 Zenodo challenge design 文档三处互证;唯一实质冲突(gold standard 406 vs 409)已在坑 1 存照。
- 检索时若按"HuggingFace CXR-LT"去找数据会一无所获——数据托管在 PhysioNet 且为 credentialed 访问(坑 4)。
§1 数据集速览:十五问十五答
Q1:377,110 张这个数字从哪来?
这是 MIMIC-CXR-JPG v2.0.0 的全部图像数。CXR-LT 不新增图像,而是给同一批图打上扩展标签——PhysioNet 页面、arXiv 论文摘要与 Table 1 三处一致:Train 258,871 + Development 39,293 + Test 78,946 = 377,110,精确闭合。换句话说,库内 mimic-cxr-jpg(617) 条目记载的每一张图,都能在本条目的标签表中找到对应行。
Q2:45 类怎么构成的?
三层叠加:MIMIC-CXR-JPG 原始 14 类(13 个疾病所见 + No Finding)→ 2023 届从报告解析新增 12 个罕见所见(如 Hernia、Fibrosis、Tortuous Aorta)→ 2024 届再加 19 个更罕见的(如 Tuberculosis、Pulmonary Embolism、Rib Fracture)。45 类中含一个 “Normal” 类(无心肺疾病)。完整的两层新增清单与逐类注释见 §2.2 与附录 E。
Q3:标签是谁标的、可信吗?
自动标签由规则法(rule-based)从 MIMIC-CXR 自由文本放射报告解析生成——没有人工逐张标注,因此训练集与 Task 1 大测试集都带噪声。质量锚点是 406 张 gold standard 子集(6 名标注者对 26 类人工共识):在这 406 张上,规则法标签的 micro-precision 为 0.711;作为对照,GPT-4o 解析同批报告能到 0.786。标签噪声不是被隐瞒的缺陷,而是被测量、被写入任务名称(“large, noisy test set”)的设计参数。
Q4:三个任务的区别是什么?
Task 1 在 78,946 张自动标注大测试集上评 40 类长尾分类(“大而噪”);Task 2 在 406 张人工共识子集上评 26 类(“小而净”,可视为低噪声版);Task 3 在同一大测试集上只评 5 个训练中从未出现的类别(zero-shot)。三任务共用同一训练集(258,871 张 / 40 标签)。任务间的关系与设计动机见 §3.2。
Q5:哪 5 类被扣下做 zero-shot?
Bulla(肺大疱)、Cardiomyopathy(心肌病)、Hilum(肺门异常)、Osteopenia(骨量减少)、Scoliosis(脊柱侧弯)。参赛者训练时完全不知道这 5 类的存在,测试阶段才揭晓。这 5 类全部出自 2024 届新增的 19 类,且都属于形态学描述性标签而非经典疾病实体——这使 Task 3 测的不只是"罕见",而是"语义上无先例"。
Q6:2023 届和 2024 届什么关系?
同一系列的上下两届:2023 届挂靠 ICCV 2023 CVAMD workshop(26 类、单任务、59 队);2024 届升级为 MICCAI 2024 官方 challenge(45 类、三任务、61 队)。数据是同一条 377,110 张图,标签是同一套流水线的两次增量扩展——PhysioNet 包里两届标签并存,跨届对照实验因此可行。
Q7:成绩为什么 2024 比 2023 “倒退”?
不是模型退步,是考卷变难:19 个新罕见类把 mAP 从 0.372(2023 冠军)拉到 0.281(2024 冠军)。在 26 个两届共有类上对齐比较,2024 top 4 达 0.370-0.373,反而略超 2023 亚军的 0.354——长尾的尾巴变长后,整体指标下滑恰恰说明新类确实难。这个跨届对齐实验是本系列最有信息量的方法论产出之一(§4.3)。
Q8:我现在能拿到什么、怎么拿?
PhysioNet 的 cxr-lt-iccv-workshop-cvamd v2.0.0 包(2025-03-19 发布):标签 CSV(两届三目录)+ 划分表。前提是 PhysioNet credentialed access 并签 DUA,且图像需另持 MIMIC-CXR-JPG v2.0.0 凭据下载——标签包里没有一张图。获取流程的逐步操作见 §5 与附录 I。
Q9:license 是什么、能商用吗?
PhysioNet Credentialed Health Data License 1.5.0——与 MIMIC 系列同框架:research use、禁止再标识、再分发受限。不是 CC 开放许可,任何商用与模型发布前需对照 DUA 条款。注意 Zenodo 设计文档里出现的 CC BY 字样是挑战赛设计模板的示例文字,不是实际许可(坑 5)。
Q10:为什么它对 AI-Ready 重要?
它是"标签层与图像层分离发布"的教科书样本:AI-Ready 的瓶颈不在格式(CSV 极其干净),而在获取门槛的叠加——PhysioNet 凭据 + DUA + MIMIC 凭据三道门。它同时演示了"挑战赛作为数据集分发机制"的得失:赛事把数据质量与基线推到高处,但赛后数据回归 credentialed 门后,可复现性依赖社区长期持有凭据。这个组合在库内 mimic-cxr(16)/mimic-cxr-jpg(617) 家族中具有代表性,本条目把它推到了"协议完备度最高"的位置。
Q11:2023 届的标签和 2024 届的标签在包里怎么共存?会不会混?
物理上分目录(cxr-lt-2023/ 与 cxr-lt-2024/),逻辑上靠 dicom_id 关联——同一张图在两个目录里各有一行、两套列。混淆风险主要发生在自写 ETL 时:用 dicom_id join 两个目录的标签表而不加代际列,就会得到"一张图 71 列标签"的脏表。规范做法:任何跨届合并表必须带一列 source(2023/2024)。
Q12:规则法 0.711 的噪声意味着"三成标签是错的"吗?
不意味着。0.711 是 26 类 micro-precision 的均值,且按类计算——头部高频类的 precision 远高于均值(Support Devices 0.948、Tortuous Aorta 0.958、Subcutaneous Emphysema 0.955),拖后腿的主要是语义模糊类(Infiltration 0.261、Lung Lesion 0.161、Pneumonia 0.191)。另外 precision 只度量"报了的是否对",不含召回侧的漏报。用噪声数字时必须带上这两个限定。
Q13:可以直接用 2024 冠军代码起步吗?
可以但注意版本:CheXFusion(2023 冠军)有官方 PyTorch 开源实现;ChexFusion+(2024 冠军)的方法细节在论文与 top 9 slides(GitHub)里,代码公开程度以其仓库为准。复现时的工程门槛主要是多分辨率 ensemble 的显存与训练时长,单卡复现冠军全套不现实,建议先复现单模型基线再谈 ensemble。
Q14:这个数据集能用来训练"放射报告生成"或"视觉问答"模型吗?
不建议。CXR-LT 只有图像级二元标签,没有文本-图像对(那是 ms-cxr(340) 的领地)也没有区域级定位(chest-imagenome(330) 的领地)。它的产出物是"分类监督信号",强行用于生成/VQA 任务会丢失其协议价值。
Q15:两届赛事后,CXR-LT 的基准还有效吗?
有效且仍在被引用——2024 概览论文刊于 Medical Image Analysis 正刊(2025;106:103739),Task 3 的 zero-shot 协议在多模态基础模型评测语境下反而更重要。但要注意它的"赛事时效性":top 方案是 2024 年 9 月前的技术,此后基础模型(尤其是医学 VLM)进步很快,用 2025+ 模型刷 CXR-LT 时,Task 1/2 成绩可能大幅超越 0.281/0.526,而 Task 3 仍是稀疏区——这恰是数据集持续活着的证据。
§2 数据构成与规格
2.1 规模、三切分与精确闭合
CXR-LT 2024 的全部规模数字可用一张表闭合(arXiv 2506.07984 Table 1,与 PhysioNet 页面互证):
| 切分 | Task 1 样本 | Task 1 标签 | Task 2 样本 | Task 2 标签 | Task 3 样本 | Task 3 标签 |
|---|---|---|---|---|---|---|
| Train | 258,871 | 40 | 258,871 | 40 | 258,871 | 40 |
| Development | 39,293 | 40 | 39,293 | 40 | 39,293 | 5 |
| Test | 78,946 | 40 | 406 | 26 | 78,946 | 5 |
三行相加:258,871 + 39,293 + 78,946 = 377,110,与总量精确一致。这张表还藏着任务间的结构关系:
- 三任务共用同一训练集(258,871 行)——参赛者只需训练一次,三线作战;
- Task 1 与 Task 3 共享同一测试集(78,946 行)——Task 3 只看其中 5 个未见类的预测列;
- Task 2 的 406 张是 Task 1 测试集的人工重标注子集——两套测试集是"同一分布、两种标签质量"的关系;
- Development 集 39,293 行约占全量 10%,Task 3 口径下只带 5 列未见类标签——主办方在开发阶段就把未见类集合公开给参赛者(便于设计策略),但训练集中不出现它们的样本。
论文行文常用 “over 250,000 CXR images with 40 binary disease labels” 描述训练集——与精确值 258,871 一致,前者是摘要口径、后者是表格口径,引用时按需选择但不要混写。
2.2 标签代数:14 → 26 → 45 的两轮扩展
CXR-LT 的标签体系是逐届生长的,这个"代际"结构是理解一切数字的前提:
| 代际 | 标签数 | 构成 | 载体 |
|---|---|---|---|
| 原始层 | 14 | MIMIC-CXR-JPG 自带 13 个所见 + No Finding | 库内 mimic-cxr-jpg(617) 条目 |
| 2023 届 | 26 | 14 + 12 个规则法新增 rare 所见 | ICCV 2023 CVAMD Shared Task |
| 2024 届 | 45 | 26 + 19 个规则法新增 rare 所见 | MICCAI 2024 challenge |
2023 届新增的 12 个 rare 所见:
| 类别 | 中文 | 影像/临床注记 |
|---|---|---|
| Calcification of the Aorta | 主动脉钙化 | 动脉粥样硬化与老龄的常见胸片线索 |
| Emphysema | 肺气肿 | 肺过度充气、纹理稀疏 |
| Fibrosis | 纤维化 | 间质改变的纤维性终末期表现 |
| Hernia | 疝 | 膈疝/食管裂孔疝,腹腔内容物入胸 |
| Infiltration | 浸润 | 非特异肺实质阴影;规则法与 GPT-4o 分歧最大的类之一(0.261→0.889) |
| Mass | 肿块 | 较大(通常 >3cm)致密影,肿瘤学意义 |
| Nodule | 结节 | 较小圆形致密影 |
| Pleural Thickening | 胸膜增厚 | 慢性胸膜病变 |
| Pneumomediastinum | 纵隔气肿 | 纵隔内异常气体 |
| Pneumoperitoneum | 气腹 | 腹腔游离气体在膈下的投影 |
| Subcutaneous Emphysema | 皮下气肿 | 胸壁软组织内气体 |
| Tortuous Aorta | 主动脉迂曲 | 高血压/老龄相关的大血管形态改变 |
2024 届新增的 19 个 rare 所见:
| 类别 | 中文 | 影像/临床注记 |
|---|---|---|
| Adenopathy | 淋巴结肿大 | 纵隔/肺门淋巴结增大 |
| Azygos Lobe | 奇静脉叶 | 先天解剖变异 |
| Bulla | 肺大疱 | 肺内含气腔隙;zero-shot held-out |
| Cardiomyopathy | 心肌病 | 心影/心功能异常线索;zero-shot held-out |
| Clavicle Fracture | 锁骨骨折 | 外伤征象 |
| Fissure | 叶间裂异常 | 叶间裂增厚/积液 |
| Hilum | 肺门异常 | 肺门增大/移位;zero-shot held-out |
| Hydropneumothorax | 液气胸 | 胸腔同时积气积液 |
| Infarction | 梗死 | 肺梗死楔形实变 |
| Kyphosis | 脊柱后凸 | 胸椎弯曲畸形 |
| Lobar Atelectasis | 肺叶不张 | 叶级肺容积丧失 |
| Osteopenia | 骨量减少 | 骨密度降低线索;zero-shot held-out |
| Pleural Other | 其他胸膜异常 | 无法归类的胸膜所见 |
| Pulmonary Embolism | 肺栓塞 | 漏诊即临床事故的尾部代表类 |
| Pulmonary Hypertension | 肺动脉高压 | 肺动脉段突出等间接征象 |
| Rib Fracture | 肋骨骨折 | 外伤征象 |
| Round Atelectasis | 圆形肺不张 | 易误诊为肿瘤的胸膜相关不张 |
| Scoliosis | 脊柱侧弯 | zero-shot held-out |
| Tuberculosis | 结核 | 全球负担最重的传染病之一,公开胸片库长期缺位类 |
两轮新增清单的阅读价值在于病种跨度:从心血管(主动脉钙化、肺动脉高压)到胸膜(液气胸)、从骨骼(肋骨/锁骨骨折、脊柱侧弯)到感染(结核)——胸片"顺便看见"的全身性线索被系统性纳入,这正是报告挖掘相对人工标注的独特优势:放射科医生写进报告的一切所见都可以被规则或语言模型提取,而人工标注团队通常只盯预先定义的疾病清单。
45 类中有一个 Normal 类(无心肺疾病),与其他所见类并存;竞赛口径下每张图至少带一个标签。zero-shot 赛道扣下的 5 类——Bulla、Cardiomyopathy、Hilum、Osteopenia、Scoliosis——全部出自 2024 届新增的 19 类,且都属"影像上可见但常为继发/偶发所见"的形态学描述性标签,这使 Task 3 测的不只是"罕见",而是"语义上无先例"。
2.3 标注机制:规则法流水线与噪声属性
CXR-LT 的标签不是人工标的,而是从 MIMIC-CXR 的自由文本放射报告中用**规则法(rule-based)**自动解析的——先在报告中匹配疾病术语与否定/不确定修饰,再映射到受控标签集。这个选择是双刃剑:
- 规模可行:377,110 张图 × 45 类的人工标注成本不可承受,报告解析让"每个 rare 类都有标签"成为可能;
- 一致性可控:同一规则作用于全部报告,标签标准至少是"全局一致"的(尽管可能一致地错);
- 噪声内生:规则法对否定、假设、既往史等语言现象的处理有限,标签精度有天花板。
2024 论文专门做了对照实验(3.6 节):在 406 张 gold standard 上按类计算 micro-precision,规则法 0.711 vs GPT-4o 0.786——LLM 报告解析整体优于规则法,且在语义模糊类上提升最大:
| 类别 | 规则法 | GPT-4o | 解读 |
|---|---|---|---|
| Infiltration | 0.261 | 0.889 | 规则法对"浸润"的措辞覆盖严重不足 |
| Lung Opacity | 0.853 | 0.984 | 语义模糊类上 LLM 优势明显 |
| Enlarged Cardiomediastinum | 0.583 | 1.000 | 小样本类(gold standard 内阳性少),LLM 反而全对 |
| Lung Lesion | 0.161 | 0.000 | 两个方法都失败的类——报告本身很少显式陈述 |
| Calcification of the Aorta | 1.000 | 0.857 | 规则法在措辞刻板的类上反而更稳 |
因此 CXR-LT 的 Task 1 在名称里就自带 “large, noisy test set”——这不是缺陷披露,而是设计立场:临床现实中的自动标注就是有噪声的,评测应该在"标签生成流水线质量"与"模型长尾学习质量"两个维度上分别测量。Task 2 的存在正是为了把两个维度切开:同样的模型在 406 张人工共识子集上分数普遍高出一大截(冠军 0.526 vs Task 1 的 0.281),差值即可粗略视为噪声对评测的压低效应。
2.4 gold standard 子集:406 张、6 人、26 类
人工标注子集(“gold standard”)的技术规格:从挑战赛测试集中抽取 406 份 MIMIC-CXR 放射报告,由 6 名标注者逐一审阅,对 26 个 2023 届标签给出存在/缺失的共识标注(consensus labels)。它制作于 2023 届(Holste et al. 2024 概览论文详述流程),2024 届原样沿用——这也是它只覆盖 26 类而非 45 类的原因。
三点使用注意:
- 规模有限:406 张对 26 类意味着多数罕见类只有个位数到十几位阳性样本,per-class 结论不稳定,适合总体趋势判断而非逐类基准;
- 版本对齐:gold standard 的 26 类是 2023 届口径,与 2024 届 40 类训练标签是子集关系——把 Task 2 成绩直接与 Task 1 的 40 类 mAP 混比是常见错误(坑 6);
- 双口径存照:Zenodo challenge design 文档写 “409 CXRs”,PhysioNet 与论文正文/Table 1 均为 406——条目取 406(两源一致),409 记入坑点档案(坑 1)。
2.5 与 MIMIC-CXR-JPG 的关系边界:标签层与图像层
理解 CXR-LT 最重要的一条边界:它不包含图像。PhysioNet v2.0.0 包的自我描述是 “This project contains labels from the CXR-LT 2024 and CXR-LT 2023 challenges, as well as a related subset used in the MICCAI 2023 paper”——三块内容全是标签与划分表:
| 目录 | 内容 | 格式 |
|---|---|---|
cxr-lt-2024/ |
labels.csv(全量 45 类);train_labeled.csv(官方训练集,三任务同一);development_labeled_task1/2/3.csv;test_labeled_task1/2/3.csv | CSV |
cxr-lt-2023/ |
train.csv、development.csv、test.csv(26 类体系) | CSV |
miccai-2023_mimic-cxr-lt/ |
PruneCXR 论文子集 257,018 张 19 类的 train/val/test 标签 | CSV |
图像本体需持 MIMIC-CXR-JPG v2.0.0 凭据从其 PhysioNet 页面另行下载,用 dicom_id 与 CXR-LT 标签表关联。这个"标签层/图像层分离"结构有三个后果:
- 许可继承:CXR-LT 的标签派生自 MIMIC-CXR 报告,因此整个包落入同一 credentialed 框架(PhysioNet Credentialed Health Data License 1.5.0),不存在"标签开放、图像受限"的分层机会;
- 参赛即双认证:2024 届参赛硬性要求提交 MIMIC-CXR-JPG credentialed access 证明(Google Form),96 份申请中 35 份(96→61)正是卡在这一步;
- 组装工程:使用者要做一次双包 join(dicom_id 对齐 + JPEG 路径重建),库内 mimic-cxr-jpg(617) 条目记载的目录结构可直接复用。
这个结构在库内没有先例:其余数据集条目都是"数据即包",而本条目是"包是索引、数据在别处"——附录 G 的组装骨架因此是本条目使用者的必读件,也是 DAIMS 互操作性维度(7 分而非 9 分)的主要扣分来源。
2.6 长尾分布特性:尾部有多长
CXR-LT 没有在正文公布逐类样本数表(45 类的完整计数需从 labels.csv 自行统计),但其长尾属性可以从三个已证实的事实锚定:
- 零样本类彻底缺席:5 个 held-out 类在 258,871 张训练集中样本数为 0——这是设计使然,也是"长尾之外还有长尾"的极端演示;
- 跨届成绩落差:加入 19 个 rare 类后,最优 mAP 从 0.372(26 类)跌到 0.281(45 类),跌幅近 9 个点全由尾部拉低;
- 背景宣称的量级差:Radiology Gamuts Ontology 的 4,500+ 种所见 vs 45 类标签——CXR-LT 自己把"尾部"定位为开放集合,45 类只是当前可标注的近似。
对使用者的操作含义:若你的任务关心头部 14 类(与 MIMIC-CXR 原生标签重合),CXR-LT 相对本体几乎无增量;它的价值区间在第 15-45 类的尾部增量标签,以及 zero-shot 协议本身。用 Tail 类做训练时,务必对照 gold standard 或自行抽检——规则法在罕见类上的精度无人背书。
自算逐类分布时的三个技术提醒:其一,labels.csv 的行单位是图像(dicom_id),不是 study 也不是 patient——同一 study 的正侧位两图各自计一行,类频统计口径要在文中写明;其二,“Normal” 与疾病类是否互斥要以实际行值验证(存在共存的类组合时,互斥假设会让分布表失真);其三,若需患者级分布(如按患者聚合的阳性率),要从 dicom_id 反查 MIMIC 元数据的 patient/study 映射——那一步在 MIMIC 侧而非 CXR-LT 侧完成。
2.7 与同域标签体系的对照:CXR-LT 在"标签光谱"上的位置
把库内主要胸片基准的标签体系并排,能看到四种标签生产哲学的差异:
| 数据集 | 图像量级 | 标签数 | 标签路线 | 标签粒度 | 不确定性处理 |
|---|---|---|---|---|---|
| NIH ChestX-ray14 | 112,120 | 14 | 早期 NLP 挖掘 | 图像级二元 | 无(噪声未量化) |
| CheXpert | 224,316 | 14 | 规则挖掘 | 图像级 | -1 不确定标签显式保留 |
| PadChest | 160,868 | 174 | 规则挖掘+人工核验子集 | 图像级 + 位置/级度 | 人工核验 20% 子集 |
| MIMIC-CXR(-JPG) | 377,110 | 14 | 规则挖掘(Enlarged Cardiomediastinum 等) | 图像级 | 无 |
| CXR-LT 2024 | 377,110 | 45 | 规则挖掘 + 人工共识子集 + LLM 对照 | 图像级 | 噪声量化(0.711)+ 双轨测试集 |
这张表的读法:CXR-LT 的独特性不在"标签多"(PadChest 174 类更多)而在标签质量工程的完整性——它是唯一把"自动标签的噪声水平"(0.711)、“LLM 替代方案的水平”(0.786)、“人工共识锚点”(406 张)与"干净/噪声双测试集"四件套配齐的胸片数据集。PadChest 的 174 类广度胜出但核验子集比例(约 20%)与核验口径不同;CheXpert 的不确定性标签哲学(保留 -1)与 CXR-LT 的"统一二元 + 量化噪声"哲学是两条路线,建模时不可混用。
跨库迁移标签的实用对照:NIH 14 类与 MIMIC 13 类的类名映射已是社区惯例(如 Infiltration ↔ Lung Opacity 部分重合),CXR-LT 第 1/2 层 31 类中与 PadChest 重合的约 15-20 类(如 Azygos Lobe、Tortuous Aorta 等解剖/形态类)可参考 PadChest 的西-英术语表辅助理解——此为检索建议而非官方映射,使用前需逐类核对定义边界。
§3 挑战赛设计:两届赛制与评估协议
3.1 系列谱系:从 DALI workshop 到 MICCAI challenge
CXR-LT 不是凭空出现的挑战赛,而是一条四段谱系的正名之作:
| 阶段 | 时间 | 载体 | 贡献 |
|---|---|---|---|
| 前身基准 | 2022-09 | MICCAI DALI 2022 workshop 论文(Holste et al.) | 首次提出 MIMIC-CXR 长尾扩展基准概念 |
| PruneCXR | 2023 | MICCAI 2023 论文 “How Does Pruning Impact Multi-Label Long-Tailed Learning?” | 257,018 张 / 19 类子集,研究剪枝与长尾交互 |
| 第一届 | 2023 | ICCV 2023 CVAMD Shared Task(Paris,2023-10-06 workshop;CodaLab 12599) | 26 类标签、单任务赛制、59 队参与 |
| 第二届 | 2024 | MICCAI 2024 challenge(2024-10-10 challenge event) | 45 类、三任务(含 zero-shot)、61 队参与 |
两个"挂靠"细节值得存档:
- 其一,PhysioNet 数据包的 slug 是
cxr-lt-iccv-workshop-cvamd——把 2023 届的 ICCV workshop 血统永久刻进了数据 URL,这是检索时最容易忽略的身份线索(坑 8); - 其二,2023 届的赛事页面托管在 bionlplab.github.io(NCBI 组 Zhiyong Lu 的实验室),2024 届才有独立官网 cxr-lt.github.io/CXR-LT-2024/ 与组织级 GitHub(github.com/CXR-LT/CXR-LT-2024)。
CVAMD 全称 Computer Vision for Automated Medical Diagnosis,是 ICCV 2023 的医学影像 workshop——CXR-LT 2023 就是它的官方 shared task,冠军方案与 9 篇参赛论文进入了 ICCV 2023 workshop proceedings;一年后同一批组织者把赛事升级为 MICCAI 2024 官方 challenge,赛事规格与论文出口(Medical Image Analysis 概览论文)同步提升。两届的延续性远大于差异性:同一批图像、同一条规则法标注流水线、同一个核心组委会(UT Austin 的 Atlas Wang 组 + Weill Cornell 的 Yifan Peng)、同一资助方(Artificial Intelligence Journal)。差异集中在评估哲学上:2023 届验证了"长尾多标签可以办成公开赛事",2024 届则把"噪声测试集 vs 人工子集"与"封闭集 vs 零样本"两组对立维度显式拆成三个任务。
3.1.1 组委会与治理结构
两届赛事的人力结构分三层,这一结构在 PhysioNet 页面的致谢与 2023 届 CFP 中完整可查:
| 层级 | 人员 | 职能 |
|---|---|---|
| Steering committee | Leo Anthony Celi(MIT)、Zhiyong Lu(NIH NCBI)、George Shih(Weill Cornell)、Adam Flanders、Ronald M. Summers(NIH CC) | 战略监督、学术背书 |
| Organizing committee(2023 届披露) | Atlas Wang(chair, UT Austin)、Yifan Peng(chair, Weill Cornell)、Gregory Holste、Ajay Jaiswal、Mingquan Lin、Song Wang、Yuzhe Yang | 赛事设计、数据策展、评审 |
| 概览论文作者群(2024 届 34 人) | 上述核心 + 全球 26 个单位的参赛队导师与合作者 | 方案汇总与综述撰写 |
资助与治理的两个事实:其一,两届赛事均获 **Artificial Intelligence Journal(AIJ)**资助(2023 届 CFP 与 PhysioNet Conflicts 节两处一致);其二,2023 概览论文另受 NLM R01LM014306、NSF 2145640/IIS-2212176、Amazon Research Award 与 NIH Intramural 支持——学术资助链条完整,无商业数据商介入,这与数据集最终落在 PhysioNet(非营利平台)的归属选择一致。
3.2 2024 届三任务设计
Task 1 — 大而噪的长尾分类。在 78,946 张自动标注测试图上评 40 类。这是最接近真实部署场景的设定:测试分布延续训练分布的噪声特性,mAP 上的每一个百分点都同时反映模型能力与标签噪声。2023 届的赛制本质上是它的单任务前身。设计要点:测试集与训练集同源同噪声,因此"对训练噪声过拟合"的方案在这里反而占便宜——这正是需要 Task 2 来制衡的地方。
Task 2 — 小而净的人工子集分类。同样 26 类,但测试集是 406 张 6 人共识标注。它的方法论价值在于"剥离噪声变量":同一模型在 Task 1 与 Task 2 的分数差,给出标签噪声压低评测分数的实证量级(冠军方案 0.281 vs 0.526,差近一倍)。设计要点:26 类是 2023 届口径——这保证 Task 2 成绩可与 2023 届同口径直接对照。
Task 3 — zero-shot 未见类泛化。5 个类别(Bulla/Cardiomyopathy/Hilum/Osteopenia/Scoliosis)在训练集、开发集中完全不存在,参赛者直到测试阶段才知道要检测什么。协议上 Task 3 复用 Task 1 的测试图像,只对这 5 类的预测计分。这是本系列对"Radiology Gamuts 有 4,500+ 种所见"这一现实的方法论回应:封闭标签集之外的疾病只能靠泛化能力触达。设计要点:开发阶段就公布"有 5 个未见类"的事实但不公布是哪 5 类——参赛者知道要为"未知"留出容量(如文本编码器、开放词汇头),却不知道为何物。
3.3 时间线:计划与执行的 dual 记录
2024 届时间线存在两套口径,条目按"计划 vs 实际"并列存照:
| 节点 | 官网/PhysioNet 口径(计划) | arXiv Table 2 口径(实际执行) |
|---|---|---|
| 注册 + 训练数据发布 | 05/01/2024 | 2024-05-01(61 队注册) |
| Development Phase | 05/01/2024 开始 | 2024-05-01 → 08-26(29 队提交 1,374 次) |
| Test Phase 开始 | 08/01/2024 | 08/26/2024(测试图发布) |
| 挑战结束 | 08/04/2024 | 09/06/2024(提交截止) |
| top 队受邀 | 08/15/2024 | —(top 9) |
| MICCAI challenge event | 10/10/2024 | 10/10/2024(9 队报告) |
两套口径在测试阶段上差了三周多(08/01-08/04 vs 08/26-09/06)——大概率是赛事顺延的计划/执行差异,条目主叙事采用 arXiv 执行口径。2023 届时间线无冲突记录:05/01 dev → 07/14 test → 07/17 结束 → 10/06 workshop。
另一处日期小口径:Zenodo challenge design PDF 把 MICCAI event 写作 10/06/2024,PhysioNet 与 arXiv 均为 10/10/2024——取 10/10(坑 3)。
赛程结构的两个设计细节:其一,Development Phase 长达近四个月且带公开排行榜(live public leaderboard),参赛者可以高频试错;其二,Test Phase 排行榜隐藏(hidden leaderboard),每队只保留最佳提交——公开阶段激进探索、隐藏阶段诚实交付,这是挑战赛防过拟合排行榜的标准做法。
3.4 参与漏斗:从申请到领奖台
两届的参与漏斗数字并列如下(来源:两届概览论文):
| 漏斗层 | 2023 届 | 2024 届 |
|---|---|---|
| CodaLab 申请 | 209 队 | 96 队 |
| 凭据审核通过 | 59 队 | 61 队 |
| Development Phase 活跃 | 23 队 / 525 次提交 | 29 队 / 661+349+364=1,374 次提交 |
| Test Phase 参与 | 17 队 | 17 队 |
| 论文/报告产出 | 11 队投稿,9 篇接收(ICCVW) | top 9 受邀 MICCAI 报告 |
| 冠军 mAP | 0.372(CheXFusion) | 0.281(ChexFusion+,Task 1) |
漏斗的三个观察:
- 凭据审核是最大流失环节——2023 届拦掉 72% 的申请(209→59),2024 届拦掉 36%(96→61)。这一步过滤的正是"未持有 MIMIC-CXR-JPG 凭据"的队伍:既是数据合规的必要成本,也是"AI-Ready 但非 open"的直观体现;
- 多赛道刺激提交密度——2024 届三任务把提交总量放大到 1,374 次(Task 1 独占 661 次、Task 2 349 次、Task 3 364 次),说明"同一训练集、三种计分"的设计确实让队伍的边际投入更低;
- 赛程后段是精英赛——两届坚持到 Test Phase 的都是 17 队,top 产出(9 篇/9 队)占测试阶段队伍的一半以上,头部收敛度极高。
3.5 评估协议:为什么是 mAP 而不是 AUC
CXR-LT 的指标选择是长尾多标签评测的一个方法论样本:
- 主指标 mAP(macro-averaged Average Precision,跨类平均):选择理由有二——(i) 对决策阈值不敏感(AP 积分了全阈值性能),(ii) 在类别强不平衡下不退化(AUC 的负样本主导问题使其在长尾下"虚高")。每类算 AP 再取宏平均,头部类的巨大样本量无法淹没尾部类。
- 辅助指标 mAUC、mF1(0.5 阈值逐类 F1 的宏平均):计算并上排行榜,但不参与排名——供方法论对照。
- mECE(expected calibration error):量化模型置信度校准与偏差,同样不上排名。
- 排名规则:mAP 为主,mAP 同分时以 mAUC 决出先后——2024 Task 1 的 Team C/D 同为 0.277,正是靠 mAUC 分出第三、第四。
直觉解释 AUC 为何在长尾下失真:一个只有 20 个阳性样本、20,000 个阴性样本的罕见类,模型只要把全部阴性压低,AUC 就能轻松拿到 0.95+——但这个 0.95 对"找出那 20 个阳性"几乎没贡献。AP 只按每个阳性样本的排名计分,阳性越少每个命中的权重越大,与临床"宁可多报不可漏报"的尾部诉求同向。这个论证写在两届概览论文里,也是后续长尾医学影像论文引用 mAP 时的标准出处。
这个"mAP 主 + AUC 决 tie + F1/ECE 观察"的组合后来成为长尾医学影像评测的事实标准配置,两届概览论文的指标节被后续引用者当作协议模板。
3.6 提交合规:代码强制提交
2024 届 CodaLab 提交要求 .zip 包内必须同时含预测 CSV 与 code/ 目录(训练与推理代码),缺代码目录的提交直接失败。这一机制的意图与后果:
- 意图:保证排名背后的方法可审计、可复现,为赛后概览论文的方案汇总(Table 3 的 9 支队伍档案)提供素材;
- 后果:参赛即开源的文化在头部队伍中形成——冠军 ChexFusion+ 等方案在赛后公开实现,2023 冠军 CheXFusion 的代码至今是长尾胸片分类的常用起点。
3.7 数据策展:标签是怎么"长"出来的
两届概览论文的数据策展节(2024 论文 §2.2)给出了一条可追溯的流水线,分四步:
- 基底对齐:以 MIMIC-CXR-JPG v2.0.0 的 377,110 张 JPG 图像与 13 个原生所见标签为基底——原生标签本身也是 MIMIC 团队从报告挖掘的,CXR-LT 在其上增量扩展,保持主键(dicom_id)与第 0 层列完全兼容;
- 规则解析:对每份放射报告跑术语匹配 + 否定/不确定检测的规则流水线,2023 届产出 12 个新类、2024 届再产出 19 个——新增类的选择标准是"报告中有稳定措辞、影像上有可辨识对应物、且现有基准未覆盖";
- 数据集切分:按图像级切出 Train 258,871 / Development 39,293 / Test 78,946(论文未详述患者级泄漏控制细节——按 study 切分的近似口径,使用者做患者级泛化结论时需自行核查患者重叠,这是本数据集文档的一个留白);
- gold standard 校准:406 份报告 × 6 人 × 26 类共识标注,既作为 Task 2 测试集,也反过来给规则法标签质量定标(0.711)。
策展流程的两个元数据留白需要存档:其一,逐类样本数分布表官方未发布(需从 labels.csv 自算);其二,开发集与测试集的患者级重叠情况未披露——这两点不影响赛事协议内的使用(同分布切分本就是赛事设定),但影响"泛化到新患者/新机构"的外推结论。
§4 两届成绩对照与获胜方案解剖
4.1 2023 届:CheXFusion 的 0.372
2023 届 59 队中 top 4 的 mAP 落在 0.349-0.372 区间。冠军 CheXFusion(Dongkyun Kim 等,后刊 ICCVW 2023, pp. 2702-2710)的方案要素:
- ConvNeXt-S 骨干 + Noisy Student 自训练域内预训练(NIH ChestX-ray + CheXpert + VinDr-CXR);
- 前后位/侧位双视角 Transformer 融合(self-attention + cross-attention,显式建模标签共现)——"把每张图当一个句子、把一次检查当一段话"的编码思想;
- ML-Decoder 分类头(把标签当文本做 cross-attention);
- 加权不对称损失(weighted asymmetric loss)同时处理类间不平衡与多标签负样本主导。
亚军团队(Nguyen-Mau 等)以 EfficientNetV2-S + ConvNeXt-S 集成配重度 mosaic 增强(四图拼接、标签取并集)见长;季军方案用了"头部/尾部专家"分治集成。2023 届的方法论结论(概览论文归纳):高分辨率输入(>300px)、现代 CNN(ConvNeXt/EfficientNetV2)、大规模域内预训练、强增强 + 集成、损失重加权放大尾部、多模态标签文本表征——六条公约数在 2024 届全部得到复现。值得注意的是,这六条全部是"训练配置层"的共识,没有任何一条涉及标签质量或评测协议——两届赛事对领域的真正增量恰恰在后两者。
2023 届 top 5 方案速查(据 2023 概览论文 Table 1):
| 名次 | 队伍 | 分辨率 | 骨干 | 路线要点 |
|---|---|---|---|---|
| 1 | T1(Kim,CheXFusion) | 1024 | ConvNeXt-S | 双阶段:Noisy Student 域内预训练冻结特征 + 多视角 Transformer 聚合;ML-Decoder 头;加权不对称损失 |
| 2 | T2(Nguyen-Mau 等) | 512, 768 | EfficientNetV2-S + ConvNeXt-S | 重度 mosaic 增强(四图拼接、标签取并集)+ 多级集成 + focal loss |
| 3 | T3 | 448 | ConvNeXt-B | "头部专家 + 尾部专家"分治集成 |
| 4 | T4 | 384 | ConvNeXt-B | 自定义鲁棒不对称损失(RAL) |
| 5 | T5 | 512 | ResNet50 | 视觉-语言建模(标签当文本) |
这张表与 2024 届附录 V 并排读,能看到一年间的方法迁移:vision-language 从第 5 名的尝试变成 2024 年 7/9 队的标配,域内预训练从"可选加速"变成默认动作,而集成与损失重加权从"胜负手"退化为"入场券"。
4.2 2024 届三个任务的成绩表
Task 1 top 4(40 类 / 78,946 张测试):
| 名次 | 队伍代号 | 机构 | 骨干 | mAP |
|---|---|---|---|---|
| 1 | zguo | Arizona State University | 12× ConvNeXt 多分辨率 ensemble | 0.281 |
| 2 | tianjie_dai | 上海交通大学 | EfficientNetV2-L(NIH/CheXpert/VinDr/BRAX 预训练) | 0.279 |
| 3 | XYPB | Yale University | ConvNeXt-S + EfficientNetV2-S @1024px | 0.277 |
| 4 | dongkyunk | Carnegie Mellon University | ConvNeXt-S @1024px | 0.277(mAUC 决 tie) |
Task 2 top 4(26 类 / 406 张 gold standard):
| 名次 | 队伍代号 | 机构 | mAP |
|---|---|---|---|
| 1 | XYPB | Yale University | 0.526 |
| 2 | yangz16 | Rensselaer Polytechnic Institute | 0.511 |
| 3 | zguo | Arizona State University | 0.511 |
| 4 | YYama | 东京大学 | 0.509 |
Task 3 top 3(5 个 zero-shot 未见类):
| 名次 | 队伍代号 | 机构 | 骨干 | mAP |
|---|---|---|---|---|
| 1 | yyge | University of Pennsylvania | ViT-L | 0.129 |
| 2 | ZhangRuichi | 厦门大学 | ResNet50 | 0.116 |
| 3 | pamessina | Pontificia Universidad Católica de Chile | DenseNet121 + SigLIP + Uniformer | 0.110 |
读表三则:
- Task 1 头部四人 mAP 挤在 0.277-0.281 的 0.4 个点内——方案趋同(大 ensemble + 重预训练)后的边际收益递减;
- Task 2 分数整体跳涨到 0.5+,且 Task 1 冠军(ASU)只排第三、Task 1 第三(Yale)反登顶——噪声测试集上"过拟合训练分布噪声"的方案会被人工子集打回原形;榜单交叉还显示 Task 2 的第三、四名在 Task 1 中仅列第六、五名(mAP 0.269/0.273);
- Task 3 全场不过 0.129,与 Task 2 的 0.526 相差四倍——"从没见过的疾病"在当前纯视觉范式下近乎不可解。
头中尾分解:长尾难度的定量剖面(论文 Table 5,Task 1 top 4 在按类别占比划分的三个区段上的 mAP):
| 队伍 | Overall | Head(>10%) | Medium(1-10%) | Tail(<1%) |
|---|---|---|---|---|
| A | 0.281 | 0.567 | 0.263 | 0.136 |
| B | 0.279 | 0.569 | 0.260 | 0.133 |
| C | 0.277 | 0.570 | 0.253 | 0.136 |
| D | 0.277 | 0.568 | 0.264 | 0.125 |
四支队伍的区段曲线几乎重合:头部 0.56-0.57、中型 0.25-0.26、尾部 0.125-0.136——头尾相差四倍。这个剖面比总体 mAP 更有信息量:它说明在尾部类上方法差异已被样本稀缺抹平,top 4 的排名差距全部来自头部微调;也说明"提升长尾性能"的正确报告方式是区段分解,总体 mAP 掩盖了结构。完整指标表(含 mAUC/mF1/mECE)见附录 T。
4.3 跨届可比性:26 类共有类上的真实进步
直接拿 2023 的 0.372 和 2024 的 0.281 比较会得出"领域倒退"的错误结论。2024 概览论文做了正确的对齐实验:把 2024 top 4 的模型输出限制到 2023 届的 26 个共有类上重算 mAP,得到 0.371 / 0.373 / 0.371 / 0.370——整体超过 2023 届亚军(0.354),与冠军水平(0.372)持平。
这个数字组合是 CXR-LT 系列最有信息量的方法论产出之一:
- 19 个新 rare 类"吃掉"了约 9 个 mAP 点——不是模型退步,而是尾部加长后的指标稀释;任何跨数据集的 mAP 比较都必须先对齐标签集;
- 共有类上的持平略升说明两年的方法演进(更大 ensemble、LLM 时代预训练、生成式增广)在头部类上收益有限——长尾学习的瓶颈确实在尾部;
- 它同时示范了数据集系列化发布的一个义务:保留旧标签体系,使跨届评测成为可能。PhysioNet 包里 cxr-lt-2023/ 与 cxr-lt-2024/ 并存正是这个义务的落实。
给引用者的换算口诀:先问届、再问任务、后问口径。第一届单任务成绩(0.349-0.372)只与 26 类、17 队测试期的语境绑定;第二届必须三分(Task 1 大噪 0.281 / Task 2 净测 0.526 / Task 3 zero-shot 0.129);跨届比较只有一个合法数字组——26 共有类上的 0.370-0.373。三句话能对上,引用就是安全的;对不上,回到附录 F 对照表。
4.4 top 9 队伍逐队档案
2024 概览论文 Table 3 与正文为 9 支受邀队伍留了完整档案,这是公开文献里对"长尾胸片分类怎么做"最密集的一组快照:
Team A:zguo(Arizona State University)— 冠军 ChexFusion+
Task 1/2 双线作战,最终 Task 1 第一(0.281)、Task 2 第三(0.511)。12 个多分辨率 ConvNeXt(S/B/T/V2-B)模型的 ensemble;最有辨识度的做法是为 rare 类合成数据:用条件去噪 U-Net + VAE decoder 按结构化 prompt(如 “Round(ed) Atelectasis, Pneumothorax, Pleural Effusion, Lung Opacity, and Atelectasis” 的共病组合)每个罕见类生成 100 张合成胸片,与真实 MIMIC 图像混合训练。prompt 刻意指定共病结构,使合成图带真实的放射学合并症,而非孤立病灶贴图。生成式增广第一次在长尾医学影像赛事登顶。
Team B:tianjie_dai(上海交通大学)— 亚军
Task 1 亚军。EfficientNetV2-L 骨干,预训练链 ImageNet → NIH/CheXpert/VinDr-CXR/BRAX 四库域内自训练;ensemble + loss re-weighting + 视觉-语言表征三件套齐备,代表"堆料流"的天花板(0.279,距冠军仅 0.002)。
Team C:XYPB(Yale University)— Task 2 冠军
多视角多尺度对齐路线:基于 CLEFT 与 MaMA 框架做对比式语言-图像预训练(CLIP 式)+ 图-图、图-文本跨视角对比学习;自研 Symmetric Local Cross-Attention(SLA)模块把局部 patch 与描述性文本段跨注意力对齐;ConvNeXt-S/EfficientNetV2-S 骨干经 MIMIC-CXR 的 CLIP 式预训练,语言侧用参数高效微调的 BioMedLM。在干净的人工子集(Task 2)上登顶(0.526),印证多模态对齐对"精确语义"的价值。
Team D:dongkyunk(Carnegie Mellon University)
两阶段框架:第一阶段单模型 + ML-Decoder 分类头 + Noisy Student 自训练;第二阶段引入 CheXFusion 式 Transformer 聚合多视角特征(与 2023 冠军同源的方法论——dongkyunk 正是 2023 冠军的同一作者团队),加权不对称损失处理双重不平衡。1024px 高分辨率输入。
Team E:yangz16(Rensselaer Polytechnic Institute)— Task 2 亚军
基础模型路线:DINOv2 自蒸馏 + 掩码图像建模,在 MIMIC-CXR/CheXpert/PadChest/NIH/BRAX 合计 71 万+ 胸片上自监督预训练 ViT-Large;ML-Decoder 头 + 多视角多分辨率 ensemble。是 top 9 中预训练语料最大的队伍(Task 2 第二名 0.511)。一个值得记录的细节:该队 Task 2 的 mF1 仅 0.265(top 4 中最低)、mECE 高达 0.744(最差校准)——自监督基础特征的排序能力强而阈值决策弱,"基础模型特征 + 简单阈值"组合的代价在这里被量化。
Team F:YYama(东京大学)
ConvNeXt V2 + MaxViT 混合 ensemble;MaxViT 在 NIH 胸片上二次预训练;不对称损失 + 类权重放大尾部;按视角聚合预测(正位权重高于侧位)。Task 2 第四(0.509)。
Team G:yyge(University of Pennsylvania)— Task 3 冠军
双模型 zero-shot 策略:VLM 支路用 DINOv2 图像编码器 + BERT 文本编码器(描述文本来自 ChatGPT 生成的疾病细粒度描述),域内预训练后在 CXR-LT 训练集加权 BCE 微调;MVM 支路把 zero-shot 转 few-shot——从放射报告里挖掘疾病相关样本作为提示集,DINOv2 + 轻量 Transformer 聚合多视角特征。0.129 的成绩是全场未见类最佳,方案要点"文本知识补视觉先验"与赛事结论同构。
Team H:ZhangRuichi(厦门大学)— Task 3 亚军
MedKLIP 式 VLM:ResNet50 不用 ImageNet 预训练、从零训练(规避自然图像域偏差);类别标签用 GPT-4 生成描述增广,BioClinical BERT 编码;引入 CheXpert 解剖位置数据建立疾病-解剖区域映射;交叉熵 + 对比损失双目标。测试期类级 ensemble 与多视角融合。0.116。
Team I:pamessina(Pontificia Universidad Católica de Chile)— Task 3 季军
多模态 zero-shot:文本侧 CXR Fact Encoder(CXRFE,冻结)从短事实句提取 fact embedding;图像侧 DenseNet121 + SigLIP Base + ConvNeXt-S + Uniformer 多骨干 ensemble(预训练链含 MIMIC-CXR、IU X-ray、Chest ImaGenome、CheXpert、CheXlocalize、VinDr-CXR,为 top 9 中预训练源最多样者)。其 mAUROC 0.744 为 Task 3 全场第一(排序能力最佳),但 mAP 0.110 居第三——zero-shot 场景下排序与精度再度脱节。这支队伍还贡献了 GPT-4o 标注对照实验(论文 3.6 节,rule-based 0.711 vs GPT-4o 0.786)。0.110。
4.5 获胜方案主题:六条公约数的 2024 版
2024 概览论文把 top 9 方案的共性归纳为若干主题,与 2023 届对照有明确的升级轨迹:
- 现代 CNN 仍是基本盘:ConvNeXt 家族(Team A 的 12 模型多分辨率 ensemble)与 EfficientNetV2-L(Team B)占据 Task 1 头部;
- ViT 在高分辨率与 zero-shot 上露头:RPI(Team E,ViT-L @336-512px 多尺度)与 U Penn(Team G,ViT-L)分别在 Task 2、Task 3 登顶,纯 CNN 在 Task 3 前三中缺席;
- 域内预训练成为默认动作:9 支 top 队中 8 支在 ImageNet 之后追加了 CXR 语料预训练(NIH/CheXpert/VinDr-CXR/MIMIC-CXR/BRAX/PadChest 不等)——胸片域的"ImageNet→领域预训练"两段式已经工业化;Team H 的"从零训练以避域偏"是唯一反例,且仅在 zero-shot 支路成立;
- ensemble 无一缺席:top 9 全部使用某种集成(多分辨率/多骨干/多 checkpoint);
- loss re-weighting 常态化但不再是胜负手——头部队伍的差异更多来自数据侧(增广、合成)而非损失函数;
- 视觉-语言与生成式路线进场:Team A 用条件扩散模型为 rare 类合成 100 张/类的合成胸片;Team C 的 CLIP 式对齐、Team G/H/I 的文本编码器——两届概览论文共同的结论指向:rare 类的出路在多模态基础模型与生成式数据,不在分类头工程。
4.6 zero-shot 赛道的方法论含义
0.129 的最优 mAP 需要被正确解读:它不是"模型无用",而是把"训练时从未见过的疾病"作为信息论意义上的硬边界摆上台面。纯视觉监督范式下,Bulla/Cardiomyopathy/Hilum/Osteopenia/Scoliosis 这 5 类的判别知识只能来自预训练权重的间接残留——这正是两届概览论文把"multimodal foundation models"列为路线图核心的论据:文本侧的疾病知识(命名、描述、共病关系)是视觉标签集之外唯一可扩展的信息源。
对数据集使用者的推论:CXR-LT 的 Task 3 协议可以脱离挑战赛独立复用——任何自建长尾胸片库都可以模仿"扣类测试"的设计,把"对未见类的泛化"从论文口头承诺变成可计分的实验。这也是本条目把 zero-shot 协议列为数据集核心资产(而非赛事花絮)的理由。
§5 获取与许可:三道门与双包配合
5.1 托管格局:PhysioNet 独家,HuggingFace 无官方镜像
CXR-LT 的数据托管只有一个正式入口:PhysioNet,记录 slug cxr-lt-iccv-workshop-cvamd,当前版本 v2.0.0(发布 2025-03-19),DOI 10.13026/ryj9-x506,RRID SCR_007345。与多数 MICCAI 挑战赛数据集不同,CXR-LT 没有 HuggingFace 官方镜像——hf-mirror API 以 datasets?search=cxr-lt 检索返回空列表(2026-09-27 实查),因此不存在"直接 load_dataset"的捷径。Zenodo 上的记录(DOI 10.5281/zenodo.10991412)只承载挑战赛设计文档 PDF,不是数据。
三份官方材料的分工容易混淆,列清如下:
| 材料 | DOI/URL | 内容性质 |
|---|---|---|
| PhysioNet v2.0.0 | 10.13026/ryj9-x506 | 数据本体(标签 CSV 包,credentialed 下载) |
| Zenodo 10991412/13 | 10.5281/zenodo.10991412 | 挑战赛设计文档(任务/时间线/DUA/评估设计的结构化描述) |
| arXiv 2506.07984 → Med Image Anal 2025;106:103739 | 论文 | 两届复盘、数据策展方法、top 方案汇总 |
版本链的已证实信息:PhysioNet 当前版本为 v2.0.0(2025-03-19),Release Notes 写明"本版包含 CXR-LT 2024 赛事数据(377,110 图 45 标签,较 2023 届新增 19 个 rare 标签)与人工标注 gold standard 子集(26 标签 406 图)"。2023 届时期的早期版本(v1.x)页面未在本次核验中捕获,v2.0.0 是唯一实证版本号。
5.2 三道门:凭据、DUA、再一重凭据
拿到数据要过三道门,按顺序:
- PhysioNet credentialed access:完成 PhysioNet 的凭据认证流程(GCP/AWS 协议签署 + CITI 培训证明),这是所有 MIMIC 系数据的标准前置;
- CXR-LT 数据使用协议(DUA):PhysioNet 页面上直接签署该记录的 DUA(License for files: PhysioNet Credentialed Health Data License 1.5.0),签署后标签包解锁下载;
- MIMIC-CXR-JPG v2.0.0 凭据:图像本体在另一个 PhysioNet 记录下,同样需要凭据 + DUA。参赛期间官方还要求通过 Google Form 提交持凭据证明,审核通过才算报名有效(96 份申请 → 61 份通过即卡在这里)。
实操要点:三道门里最容易漏掉的是第三道——标签 CSV 下载成功不等于能用,join 图像时才发现 MIMIC 侧也要走完整认证。建议在项目排期时把两个凭据申请并行启动(附录 I 给出了流程模板)。
5.3 包内文件与数据字典
v2.0.0 包按三届用途分三个目录(均为 CSV,UTF-8):
cxr-lt-iccv-workshop-cvamd/
├── cxr-lt-2024/ # 2024 届(45 类体系)
│ ├── labels.csv # 全量 377,110 图 × 45 类标签
│ ├── train_labeled.csv # 官方训练集划分(三任务共用)
│ ├── development_labeled_task1.csv # 开发/验证集(按任务)
│ ├── development_labeled_task2.csv
│ ├── development_labeled_task3.csv
│ ├── test_labeled_task1.csv # 测试集标签(赛后发布)
│ ├── test_labeled_task2.csv # 406 张 gold standard(26 类)
│ └── test_labeled_task3.csv # 5 个 zero-shot 未见类
├── cxr-lt-2023/ # 2023 届(26 类体系)
│ ├── train.csv
│ ├── development.csv
│ └── test.csv
└── miccai-2023_mimic-cxr-lt/ # PruneCXR 论文子集(19 类)
├── miccai2023_mimic-cxr-lt_labels_train.csv
├── miccai2023_mimic-cxr-lt_labels_val.csv
└── miccai2023_mimic-cxr-lt_labels_test.csv
使用提醒三条:
labels.csv与各 task 划分文件有包含关系,训练时以 train_labeled.csv 为准而非自行从 labels.csv 切分,否则可能混入 zero-shot 5 类的样本;- Task 3 的开发集(development_labeled_task3.csv)只有 5 列标签,是主办方刻意暴露的"未见类集合",不要误当作数据缺失;
- cxr-lt-2023/ 的 train.csv 与 cxr-lt-2024/ 的 train_labeled.csv 是同一批图像的两套标签口径,做跨届对齐研究时用 dicom_id 关联(2.5 节的组装工程在此处同样适用)。
5.4 许可条款的边界
PhysioNet Credentialed Health Data License 1.5.0 的核心条款与 MIMIC 系一致:仅限研究用途、禁止身份再识别尝试、不得再分发原始数据、下游成果(论文/模型)需自行承担合规审查。三个高频问题的条目口径:
- 能在其上训练模型并发布权重吗? 标签派生自 MIMIC-CXR 报告,权重发布不等于数据再分发,但 DUA 对"模型记忆"的条款要求谨慎——两届参赛协议都要求参赛者遵守 MIMIC-CXR-JPG 的数据使用协议原文(physionet.org/content/mimic-cxr-jpg/view-dua/2.0.0/),商用前应逐条核对;
- Zenodo design 文档里的 CC BY 字样是许可吗? 不是——那是挑战赛设计模板的示例文字(列举 CC BY/CC BY-SA 等常见选项的模板段落),实际许可只有 PhysioNet Credentialed Health Data License 1.5.0 一种(坑 5);
- 比赛结束后数据还会开放吗? 截至 v2.0.0(2025-03-19)没有开放化迹象—— credentialed 框架就是这个数据集的长期许可形态,这也是它 AI-Ready 可获取性评分的锚定事实。
Ethics 口径(PhysioNet 页面原文归纳):使用 MIMIC-CXR-JPG v2.0.0 的图像数据,标签从 MIMIC-CXR 的去标识化自由文本放射报告生成;整个链条在 PhysioNet Credentialed Health Data Use Agreement v1.5.0 框架内运行,原数据集已持有伦理审批(Johnson et al.)。
5.5 获取 FAQ(八个高频问题)
Q:数据多大、下载要多久?
官方页面未标注包体量(纯 CSV 标签,量级应为百 MB 以内);真正的时间成本在图像包(mimic-cxr-jpg 数百 GB 级,见库内 617 条目)与凭据审核周期。
Q:可以只用标签不用图像吗?
可以。长尾分布统计、评测协议复现、标注方法研究(rule-based vs LLM)都只需要标签包。但模型训练/评测必须配图像。
Q:图像怎么和标签对上?
标签表主键是 dicom_id;mimic-cxr-jpg 的目录按 patient/study 两层组织,需要一次路径重建。附录 G 给了骨架代码,目录细节以库内 mimic-cxr-jpg(617) 条目为准。
Q:训练集为什么是 40 类而不是 45 类?
45 类中 5 类是 zero-shot held-out,训练集里完全不存在,所以训练口径是 40 类、评测口径才分 40/26/5 三种。这是设计,不是缺列。
Q:能拿它做竞赛练习吗?
可以。CodaLab 18601/18603 的榜单与提交格式仍公开,附录 H 有 mAP 复现骨架;gold standard 406 张可以当本地测试集。
Q:引用格式是什么?
PhysioNet 要求双重引用:数据集本身(Holste et al. 2025, PhysioNet v2.0.0, DOI 10.13026/ryj9-x506)+ 原始出版物(Holste et al., Medical Image Analysis 2024;103224)。PhysioNet 平台自身引用 Pollard et al.(页面 BibTeX 自动给出)。
Q:和 CheXpert/MIMIC 原生标签冲突吗?
不冲突。第 0 层 14 类即 MIMIC-CXR 原生口径;CheXpert 的"不确定性标签"(-1)体系未被 CXR-LT 采用——CXR-LT 的报告解析对不确定陈述的处理内嵌在规则/LLM 流水线里,产物是二元标签。
Q:有中文资料吗?
官方材料全英文。本条目即中文语境下的完整导读;类名的中文对照见 §2.2 两张表。
Q:训练时侧位片要一起用吗?
MIMIC-CXR 检查天然含正位/侧位多视图,CXR-LT 标签是图像级的(每张图一行)。top 方案普遍做视角聚合(CheXFusion 的多视角融合、Team F 的正位加权、Team G 的 MVM 多视角聚合)——视图利用是免费涨分点,2023 概览论文把它列为成功方案共性之一。
Q:标签里"共现"信息怎么用?
多标签共现(如积液+肺不张并存)是本数据集区别于单标签长尾基准的核心结构。可用姿势:标签共现矩阵做先验(冠军方案的合成 prompt 即按共病组合构造);不可用姿势:把共现当互斥类别做 softmax——那会同时破坏多标签语义与长尾评估协议。
5.6 DAIMS 评估:挑战赛型数据集的典型画像
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 三份官方材料(PhysioNet/Zenodo/论文)互链完整,官网+GitHub 可索引;但 PhysioNet slug 保留 iccv-workshop 旧名,"CXR-LT 2024"直接搜数据可能先撞到论文而非数据页 |
| A 可获取性 | 4 | 三道门叠加(PhysioNet 凭据 + DUA + MIMIC 凭据),无 HF 镜像、无匿名下载通道——两届参赛漏斗的第一道坎(96→61)就是它 |
| I 可互操作 | 7 | 纯 CSV + dicom_id 关联,结构与 MIMIC-CXR-JPG 生态完全兼容;但双包 join 需自行组装,无官方转换脚本 |
| M 元数据质量 | 8 | 两届概览论文 + challenge design 文档 + PhysioNet 页面三层文档齐备,数字三源互证度高;扣分点在 406/409 与时间线双口径(坑 1/坑 2) |
| S 可持续性 | 7 | PhysioNet 平台级托管 + 组织级 GitHub,NIH 生态背书;但标签更新依赖团队手动发版(v2.0.0 距 2024 赛事结束半年) |
| 综合评级 | 6.8/10(中上) | 文档与协议质量是挑战赛型数据集的标杆;可获取性被三重凭据拖到及格线下,是它与"open 数据集"的分界线 |
5.7 与库内可获取性光谱的对照
在千方库的胸片家族里,CXR-LT 的获取难度处于" credentialed 梯队":与 mimic-cxr(16)/mimic-cxr-jpg(617) 同级(PhysioNet credentialed + DUA),显著高于 nih-chestx-ray14(15)(开放直下)与 padchest(117)(requests 注册制),与 vindr-cxr(125)(注册制)互有高低。它的相对优势在元数据与评测协议的完备度——两届赛事把"怎么用这批标签才算公平比较"写成了公开协议,这是库内其他胸片条目不具备的。
实操上的协同建议:若团队同时计划使用 mimic-cxr-jpg(617) 与本条目,凭据申请完全复用(同一 PhysioNet credentialed 框架、同一 DUA 签署流程),边际成本只有 CXR-LT 记录页上的一次额外签署。反过来,若只为 CXR-LT 而来,图像包的下载与存储规划应直接沿用库内 mimic-cxr-jpg 条目的容量与组织建议——两个条目在获取层的这种"主从关系"建议在项目文档里写明,避免两拨人各申请一遍凭据。
§6 生态与影响
6.1 在长尾学习研究位面中的坐标
通用长尾学习(CIFAR-LT、ImageNet-LT、iNaturalist)的方法论文献极厚,但医学影像域长期缺少一个"足够大、真多标签、社区公认"的考场——CXR-LT 补上的正是这个位置。它与通用长尾基准的差别有三:
| 维度 | 通用长尾基准(CIFAR/ImageNet-LT) | CXR-LT |
|---|---|---|
| 标签结构 | 单标签(每图一类) | 多标签(每图多所见) |
| 类间关系 | 互斥 | 共现(积液+肺不张常见并存) |
| 标签质量 | 干净(人工/官方) | 带噪(规则法自动) |
| 头尾语义 | 类别稀有度 | 类别稀有度 + 临床后果权重(漏诊肺栓塞 ≠ 漏诊钙化) |
这四行对照解释了为什么单标签长尾技术(重采样、logit adjustment、两阶段训练)不能直接搬用,也是 2024 冠军转向生成式合成数据、季军转向视觉-语言对齐的动机起点——尾部问题在医学影像上换了一个生态。
6.2 报告挖掘标注路线的里程碑
CXR-LT 的标签扩展(14→26→45)全部走"规则法报告解析"而非人工标注,这使它与 chest-imagenome(330)、chexstruct-cxreasonbench(604) 等同属"MIMIC 报告二次开发"家族,但它是第一个把扩展标签做成国际赛事标准的:报告解析不再只是数据增强手段,而成为竞赛级评测的标注基座。2024 论文 3.6 节的 rule-based 0.711 vs GPT-4o 0.786 对照,则把这个路线的下一代升级(LLM 标注)正式写进了数据集文档——后续若出 v3,"GPT 级标注替换规则标签"是最可能的增量。
对标注工程团队的额外意义:CXR-LT 公开了一条"标签质量的可审计路径"——规则法全量 + 人工共识子集 + LLM 对照三组数字同时可得,任何一环都可以被第三方复算。这种"标注流水线的可证伪性"在数据集文献里比流水线本身更稀缺。
展望一代:GPT-4o 的 0.786 也不是终点——LLM 标注同样有系统性盲区(Lung Lesion 0.000),且其错误模式(语义漂移、过度推断)与规则法不同。合理的下一代流水线是"规则法 + LLM 双通道 + 分歧样本人工仲裁"的三明治结构,CXR-LT 的 gold standard 恰好可以充当仲裁质量的裁判。对正在建设病历标注中台的团队,这个三明治结构比"全面换 LLM"更稳妥。
6.3 zero-shot 协议的辐射效应
Task 3 的"扣类测试"设计超出了单场赛事的影响范围:它提供了一个可复制的协议模板——从标签集中预留若干类作 held-out,只报告未见类性能。这与 MedMNIST 系的"held-out disease"实验、以及通用领域的 open-set recognition 文献形成呼应。对胸片基础模型评测(如库内 ms-cxr(340)、chexstruct-cxreasonbench(604) 等多模态条目)的启示:评测"模型是否记住训练集"与"模型是否理解疾病语义"需要两套协议,CXR-LT Task 3 是后者的公开样本。
协议复用时的一个已知边界:Task 3 的 held-out 类是从"2024 届新增类"中选取的,语义上偏向形态学/继发所见——若把协议移植到自己的数据集,held-out 类的选取应兼顾"语义代表性"与"临床后果权重",全扣罕见病与全扣形态描述会得到完全不同难度的考场,论文需声明选类逻辑。
6.4 下游使用与社区资产
- 赛事资产公开:top 9 队伍的报告 slides 全部挂 GitHub(github.com/CXR-LT/CXR-LT-2024),CodaLab 18601/18603 排行榜公开可查——两届合计约 1,900 次提交的方法细节是长尾分类的免费案例库;
- 论文引用面:2023 概览论文(MIA 2024;103224)与 2024 概览论文(MIA 2025;106:103739)构成系列引用对;EVA coreset selection(ACM MM 2024)等下游方法研究直接以 CXR-LT 为考场;PhysioNet 页面引用列表记录了 2023 届数据被后续研究([12]-[15])持续使用的轨迹;
- 生态位延伸:CheXFusion(2023 冠军)与 ChexFusion+(2024 冠军)都是开源实现,冠名连续性本身就是社区沉淀的证据;
- 配套子集:PruneCXR(257,018 张 / 19 类)随包发布,把"模型剪枝 × 长尾学习"的交叉研究也纳入了同一数据生态。
6.5 对库内评测体系的三点输入
以千方库的视角看,CXR-LT 有三笔可以直接搬进库内评测实践的资产:
- 区段分解报告规范(附录 T.2):任何库内胸片分类评测,都建议按 Head/Medium/Tail 三区段分别报告——CXR-LT 的实证显示总体 mAP 会完全掩盖区段结构;
- 噪声锚点制度:数据集条目记载"自动标签的已知精度锚点"(本条目为 0.711/0.786 对)——库内其他报告挖掘型条目(chest-imagenome、chexstruct-cxreasonbench)若能补上各自的锚点,跨条目的标签质量比较就有了共同语言;
- 协议可移植性标注:条目明确写出"哪些部分可以脱离数据本体独立复用"(本条目的 zero-shot 协议、mAP 协议)——这是"数据集条目"升级为"评测资产条目"的关键一步。
§7 方法学启示:四条可迁移的经验
7.1 扩标签比扩数据便宜,但噪声账要分开算
377,110 张图不动,两轮报告解析就换来 31 个新类——这是数据集工程里性价比最高的一种增量。CXR-LT 的配套设计值得照抄:自动标签 + 小规模人工共识子集(406 张)双轨发布,让"带噪全量"与"干净小集"各司其职,使用者按任务选轨。任何打算从 EHR 报告批量挖标签的团队,都应该把"gold standard 子集 + 双指标对照(Task 1 vs Task 2 式)"写进自己的发布计划。
7.2 mAP 主指标 + 噪声对照是长尾多标签的评测标配
AUC 虚高、F1 依赖阈值、accuracy 在多标签下无定义——CXR-LT 用两届赛事把 mAP(宏平均 AP)的位置坐实,并示范了"噪声测试集与人工子集双轨计分"如何把标签质量从模型性能里剥离。做医学影像评测设计时,这套协议可以直接引用。补充一条工程细节:mAUC 决 tie 的规则看似小事,但在头部队伍同分时(2024 Task 1 的 0.277 双胞胎)它就是最终排名的裁决者——评测协议的每个子句都要在榜单上"演练过"才算完备。
7.3 跨届/跨集比较必须对齐标签集
2023 的 0.372 vs 2024 的 0.281 表面是倒退、对齐 26 类后实为持平略升——这个案例值得写进任何 benchmark 论文的注意事项。推而广之:库内胸片条目间的成绩比较(NIH 14 类 vs CheXpert 14 类 vs PadChest 174 类)全部存在同构陷阱,逐类对齐后才可引用。一个实用的检查动作:任何"数据集 A 上 mAP X、数据集 B 上 mAP Y"的句子,先问两个数据集的标签集交集有多大。
7.4 挑战赛是数据集的放大器,也是获取门槛的放大器
两届赛事把 CXR-LT 的方法影响力放大到全球(96-209 队申请),但赛事的合规流程(凭据审核)同时成为数据获取的第一道漏斗。对数据集发布者的启示:赛事红利与开放性此消彼长,若目标是长期社区复用,需要在赛事结束后主动降低获取门槛(如发布衍生基准、开放子集)——PANDA-PLUS-Bench 的 CC BY-4.0 双轨(库内 panda-plus 条目)是同一问题的另一种解法,而 CXR-LT 选择的则是"协议完备化"路线:既然门打不开,就把门后的世界画得足够清楚。
7.5 把"扣类测试"写进数据集发布清单
Task 3 证明了一件事:数据集发布者只需付出极小代价(训练切分时预留 5 列),就能为社区创造一个全新的评测维度(未见类泛化)。这个动作在通用基准里叫 held-out split,但在医学影像数据集发布实践中极少被执行——多数医学数据集把全部标签一股脑放出,泛化能力全靠使用者的自觉。给数据集工程的具体建议:凡标签集 ≥30 类的医学影像数据集,发布时都应考虑预留 2-5 个语义上"有代表性"的类作 held-out 协议(不必从训练数据中删除图像,只需提供一份"扣类训练表"),成本近乎为零而协议价值巨大。
7.6 指标选择的"可辩护性"比指标本身更重要
CXR-LT 用两届论文的篇幅论证"为什么 mAP 而不是 AUC"——包括数学直觉(AUC 在强不平衡下虚高)、任务语义(多标签、阈值无关)、实证案例(同分 tie 决)。这种把指标选择的理由写成正式论证的做法,比选择哪个指标本身更有复用价值。医学影像评测的指标争议(Dice vs IoU、AUC vs F1、macro vs micro)大多不是技术问题而是"没写清楚为什么"的问题——CXR-LT 的指标节可以当作评测协议写作的范文。
§8 与库内条目的关系
8.1 胸片家族图谱
CXR-LT 在库内胸片域(23 条)中的位置是"MIMIC 系的标签扩展层 + 两届赛事协议载体":
| 库内条目 | rid | 与 CXR-LT 的关系 |
|---|---|---|
| mimic-cxr-jpg | 617 | 直接上游:CXR-LT 全部 377,110 张图像即其 v2.0.0 本体,dicom_id 直接关联 |
| mimic-cxr | 16 | 间接上游:放射报告(CXR-LT 标签的解析原料)与 DICOM 本体 |
| nih-chestx-ray14 | 15 | 同域对照:14 类长尾的鼻祖基准;CXR-LT 的"尾部扩展"叙事与它构成代际对话 |
| padchest | 117 | 同域对照:174 类标签的西班牙单中心大库,报告标注路线的另一个极端 |
| vindr-cxr | 125 | 同域对照:越南多中心、人工逐图标注的可靠性路线 |
| chexstruct-cxreasonbench | 604 | 结构化标注同胞:同出 MIMIC 报告挖掘家族,CXR-LT 管长尾分类、它管结构化推理 |
| chest-imagenome | 330 | 报告挖掘家族:解剖区域级结构化标注,与 CXR-LT 的疾病级标签互补 |
图谱的一句话读法:库内胸片条目沿两条轴分布——标注来源轴(人工标注 vs 报告挖掘)与任务轴(分类 vs 分割 vs 检测 vs 推理)。CXR-LT 坐落在"报告挖掘 × 分类"象限的最深处:它不产图、不标区域,只把疾病词汇表推到最长。需要人工高可靠标签的走 vindr-cxr(125),需要解剖结构的走 chest-imagenome(330),需要推理链的走 chexstruct-cxreasonbench(604),需要长尾疾病覆盖的走本条目。
库内胸片域 23 条的三个聚合观察:其一,报告挖掘系(mimic-cxr/mimic-cxr-jpg/chest-imagenome/chexstruct-cxreasonbench/CXR-LT)共享同一批报告源,五条目的标签彼此可关联——这使"MIMIC 生态"成为库内检索密度最高的子图;其二,标注路线呈代际分化:NIH(2017)→ MIMIC(2019)→ PadChest(2020)→ VinDr(2022)→ CXR-LT(2023-2025),标签规模与质量声明逐代增强;其三,CXR-LT 是其中唯一带"赛事协议资产"的条目——其他条目记录的是数据本身,本条目额外记录了"怎么用才算公平"。
8.2 检索路径建议
- 从"我想要胸片多标签数据"进入:nih-chestx-ray14(15) 是入门站;要更多尾部类 → mimic-cxr-jpg(617) 原生 14 类 → CXR-LT 本条目(45 类);
- 从"我要研究长尾学习"进入:直接 CXR-LT;要对照单中心/多中心差异 → padchest(117)、vindr-cxr(125);
- 从"我做报告挖掘/结构化标注"进入:chest-imagenome(330)、chexstruct-cxreasonbench(604) 与 CXR-LT 三条目并读,同源报告的三种结构化产物;
- 从"我评测多模态基础模型"进入:ms-cxr(340)、chexstruct-cxreasonbench(604) 之外,CXR-LT 的 Task 3 zero-shot 协议是"未见疾病泛化"维度的公开考场。
8.3 使用顺序建议
实际跑数据时的依赖顺序:先申请 MIMIC-CXR-JPG 凭据(图像)→ 再申请 PhysioNet credentialed + 签 CXR-LT DUA(标签)→ 下载双包 → dicom_id join → 用 train_labeled.csv 划分训练。若只做方法研究(不做图像实验),标签包单独可用(统计长尾分布、评测协议复现、合成数据研究)。
时间预算的两个经验值:凭据审核是异步人工流程,应在项目第 0 天启动;双包 join 的工程量不大(一张 37 万行的 CSV 对一张路径映射表)但容易在 MIMIC 目录结构的 patient/study 两级嵌套上出错——先跑通 100 张图的端到端小样再全量。
§9 避坑清单:九个已核实的坑
本清单的每一条都来自官方文档的实际矛盾或检索场景的真实误用,处理口径已并入条目正文;登记表见附录 M 与附录 N。使用本条目数字前,建议先速读本清单——九条里有五条(1/2/3/9 与 6 的变体)直接关系到"你引用的数字到底对不对"。
坑 1:gold standard 规模 406 vs 409 双口径。Zenodo challenge design 文档写 “409 CXRs”,PhysioNet v2.0.0 页面、论文正文与 Table 1 均为 406(6 名标注者 × 26 类共识)。条目取 406(两源对一源);自动抽取若命中 Zenodo 描述文本会拿到 409,须按本条目口径校准。数字漂移的场景在 AI 辅助文献检索里是高频错误源——同一事实在不同官方文档里不同值时,以"多数源 + 更接近数据的源"为准。
坑 2:时间线双口径——计划与执行差三周。官网/PhysioNet 口径 Test Phase 08/01-08/04/2024,arXiv Table 2 与正文执行口径 08/26-09/06/2024。引用赛程时先问自己要的是"原计划"还是"实际发生",条目主叙事用执行口径。写作与综述场景建议注明口径名,避免读者把两套日期当作两个阶段。
坑 3:MICCAI event 日期 10/06 vs 10/10。Zenodo design PDF 写 10/06/2024,PhysioNet/arXiv 均 10/10/2024——取 10/10。同文档还有 “10/06/2023 ICCV CVAMD workshop”(2023 届,Paris),两个 10/06/10 相邻年份易混淆;引用 workshop 日期时必须带年份。
坑 4:数据不在 HuggingFace 上。检索习惯会把"HF 上有没有"当作第一步——CXR-LT 无官方 HF 镜像(hf-mirror API 检索为空,2026-09-27 实查),正式入口只有 PhysioNet credentialed 下载。第三方搬运(若遇到)无许可背书,勿用;License 1.5.0 框架下第三方再分发本身也不合规。
坑 5:Zenodo 文档里的 CC 字样不是许可。challenge design 文档是按挑战赛设计模板填写的,其中 “CC BY / CC BY-SA…” 一段是模板的示例列表;实际许可为 PhysioNet Credentialed Health Data License 1.5.0。把它写成 "CC BY 数据集"是检索页面上最容易复制的错误——这类"模板文字被当成事实声明"的坑在一切按模板填写的设计文档(challenge design、dataset card 模板)中都会出现。
坑 6:26 类与 45 类是两套体系。gold standard/2023 标签是 26 类,2024 训练是 40 类(45 扣 5 未见类),Task 2 评 26 类、Task 1 评 40 类——四个数字出现在同一个包里,混比必错。跨届比较时先对齐共有类(2.4 与 4.3 节的协议)。快速自检:看到任何无上下文的 “CXR-LT mAP” 裸数字,先确认是哪一届、哪个任务、哪个测试集。
坑 7:标签包里没有图像。CXR-LT 是纯标签 CSV 包,下载完发现"没图"不是缺文件——图像在 MIMIC-CXR-JPG v2.0.0(另一份凭据)。组装顺序见 §8.3 与附录 G。这个坑的变体是反向的:以为"图像都在 MIMIC 里所以标签也能在 MIMIC 里拿"——不行,扩展标签只在 CXR-LT 包。
坑 8:PhysioNet slug 有历史包袱。数据 URL 是 physionet.org/content/cxr-lt-iccv-workshop-cvamd/2.0.0/——slug 里的 “iccv-workshop-cvamd” 是 2023 届挂靠痕迹,搜 “CXR-LT 2024” 的检索者容易在 PhysioNet 站内搜不到(slug 与届别名不一致),收藏 DOI 10.13026/ryj9-x506 最稳。
坑 9:Task 2 第二名的正文-表格漂移。论文正文写 Task 2 第二名为 Team E(0.511)、第三 Team A(0.511),但 Table 6 表格排 “2 | A | 0.519”。同一篇论文内部两处口径(附录 T.3 已并列存照)。引用 Task 2 名次时注明出处位置(正文 vs 表格),或直接引 CodaLab 18601 官方榜单。
§10 总结
10.1 三句话总结
- CXR-LT 是 MIMIC-CXR-JPG 全量 377,110 张胸片的标签增量工程:不动图像、两轮报告解析把标签从 14 类扩到 45 类,让胸片长尾从 14 个节点伸到 45 个节点,并公开了整条流水线的噪声账(rule-based 0.711 vs GPT-4o 0.786)。
- 它以两届国际赛事(ICCV 2023 CVAMD → MICCAI 2024 challenge)为发布机制,沉淀了"mAP 主指标 + 噪声/干净双测试集 + zero-shot 扣类赛道"的完整评测协议,2024 届 96 队申请、1,374 次提交、top 9 方案全部公开。
- 它的获取保持 PhysioNet credentialed 框架(License 1.5.0、三道门、双包配合)——方法开放度与获取门槛的这种组合,是 MIMIC 生态数据集的标准肖像。
10.2 适合谁
- 长尾学习研究者:45 类真实长尾 + 两届公开基线 + top 方案代码,方法论文的考场与对照库一站齐备;
- 胸片辅助诊断工程团队:若产品需要覆盖罕见所见(结核、肺栓塞、骨折),CXR-LT 是唯一提供这批尾部类训练标签的大规模公开资源;
- 报告挖掘/LLM 标注团队:规则法 vs GPT-4o 的对照实验、406 张 gold standard,是标注流水线研发的现成评测集;
- 评测协议设计者:mAP 主指标论证、双测试集设计、zero-shot 扣类协议,均可直接移植到其他数据集;
- 赛事组织者:从 2023 单任务到 2024 三任务的赛制演进,是多赛道挑战赛设计的活教材。
10.3 不适合谁
- 想快速跑通 pipeline 的入门者:三道门 + 双包 join 的获取成本,远高于 nih-chestx-ray14 这类开放直下数据集;
- 只用头部 14 类的项目:与 MIMIC-CXR 原生标签高度重合,增量有限,直接用 mimic-cxr-jpg(617) 更简单;
- 需要逐类样本数精确控制的实验:官方文档不发布逐类计数表,需自行从 labels.csv 统计;
- 商用场景:License 1.5.0 的研究用途边界与 MIMIC 系一致,商用前需独立法务评估;
- 单标签分类范式的工作:多标签共现是本数据集的底层设定,强行改造为单标签会丢失其核心价值。
10.4 30 秒决策卡
| 你的需求 | 建议动作 |
|---|---|
| 立刻要数据跑通 | 换 nih-chestx-ray14(15) 或 mimic-cxr-jpg(617);CXR-LT 排期给凭据申请 |
| 研究 45 类长尾分类 | 申请双凭据 → 下载 v2.0.0 → train_labeled.csv 训练 → 与 Task 1 基线 0.281 对照 |
| 研究 zero-shot 未见类 | 复现 Task 3 协议:训练时剔除 5 类,与 0.129 基线对照 |
| 只做统计/协议研究 | 仅申请 CXR-LT 标签包(无图像也可完成分布分析与协议复现) |
| 设计标注流水线 | 读论文 3.6 节 + 下载 gold standard 406 张做自己的对照 |
| 写综述引用成绩 | 用跨届对齐口径(26 类共有集 0.370-0.373),别直接拿 0.372 vs 0.281 对比(坑 6) |
| 复现冠军方案 | GitHub CXR-LT/CXR-LT-2024 取 top 9 slides;ChexFusion/CheXFusion 有开源实现 |
10.5 三个典型组合场景的落地路径
场景一:医院信息科想评估"胸片 AI 能不能覆盖本院报告词表"。路径:只取标签包 → 统计 45 类与本词表交集 → 用 §2.2 两张表做类名映射 → 结论落在"哪些本院常见所见连 CXR-LT 都没有标签"——这个负空间本身就是评估产出,无需图像与模型。
场景二:算法团队拿到了 MIMIC 凭据,想加训罕见病。路径:按附录 I 流程补签 CXR-LT DUA → 下载标签包 → 附录 G join → 只用第 15-45 类做增量微调 → 评测固定用 gold standard 406 张(勿用噪声测试集报进步)→ 与 Task 2 基线 0.526 对照。
场景三:研究生做"LLM 标注 vs 规则标注"的毕业论文。路径:论文 3.6 节复现(附录 U 有全表锚点)→ 自建 LLM 流水线在同一 406 张上跑逐类 precision → 与 0.711/0.786 两线对照 → 扩展讨论成本(规则法零推理成本 vs LLM token 成本/张)——这是本数据集性价比最高的学术切入点,因为 gold standard 是现成的裁判。
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | CXR-LT 2024 |
| url_name | cxr-lt |
| 类型 | 数据集(标签扩展层)+ 两届挑战赛 + 评测协议(三合一) |
| 数据论文 | Lin M et al., Med Image Anal 2025;106:103739(arXiv:2506.07984);概览前篇 Holste G et al., Med Image Anal 2024;103224(arXiv:2310.16112) |
| 设计文档 | Zenodo DOI 10.5281/zenodo.10991412(2024-04-18) |
| 数据托管 | PhysioNet cxr-lt-iccv-workshop-cvamd v2.0.0(2025-03-19),DOI 10.13026/ryj9-x506 |
| 团队 | UT Austin + Weill Cornell + U Minnesota(核心);steering:MIT/NIH/Weill Cornell |
| 规模 | 377,110 CXR / 45 类(Train 258,871 + Dev 39,293 + Test 78,946) |
| 许可 | PhysioNet Credentialed Health Data License 1.5.0(credentialed + DUA) |
| 抓取时点 | 2026-09-26/27 |
| 库内互链 | mimic-cxr-jpg(617)/mimic-cxr(16)/nih-chestx-ray14(15)/padchest(117)/vindr-cxr(125)/chexstruct-cxreasonbench(604) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | PhysioNet/Zenodo/论文/官网/GitHub 五入口互链完整、两届概览论文高被引;扣分:PhysioNet slug 与届名不一致(坑 8),HF 无镜像使常规检索习惯落空 |
| A 可获取性 | 4 | 三道门(PhysioNet 凭据 + DUA + MIMIC 凭据);无匿名通道、无 HF 镜像;2024 届 96→61 的申请流失即实证 |
| I 可互操作 | 7 | CSV + dicom_id 与 MIMIC 生态零摩擦;三任务划分文件命名清晰;扣分:双包 join 无官方脚本、逐类计数需自算 |
| M 元数据质量 | 8 | 设计文档 + 两届概览论文 + PhysioNet 页面三层文档;数字三源互证度高;扣分:406/409 漂移、时间线双口径、逐类分布未发布 |
| S 可持续性 | 7 | PhysioNet 平台级托管 + NIH 生态 + 组织 GitHub;MIMIC 系长期维护记录背书;标签发版节奏慢于赛事(半年) |
| 综合评级 | 6.8/10(中上) | 协议与文档质量为挑战赛型数据集标杆;可获取性是唯一显著短板 |
DAIMS 的两条对比性解读:其一,与库内开放数据集(如 nih-chestx-ray14)相比,CXR-LT 的 D/M/S 三维都在均值以上而 A 维显著偏低——这是 MIMIC 生态条目的共性画像;其二,与其他挑战赛型数据集相比,它的 M 维(协议文档化程度)几乎顶格,赛事总结论文(MIA 正刊)的发表让元数据有了同行评审背书,这是多数挑战赛数据集没有的待遇。
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 377,110 CXR / 45 类 | PhysioNet v2.0.0 页 + arXiv 2506.07984 摘要 + Table 1 | 三源一致 |
| Train 258,871 / Dev 39,293 / Test 78,946 | arXiv 2506.07984 Table 1 | 与总数精确闭合 |
| 406 张 gold standard / 6 标注者 / 26 类 | PhysioNet 页 + arXiv 正文 §2.2.2 | 两源一致(Zenodo 写 409,坑 1) |
| 12/19 新增类全清单 | PhysioNet 页 Data Description | 两届各列完整 |
| 5 个 zero-shot 未见类 | arXiv 正文 §2.2(Fig. 1 说明) | Bulla/Cardiomyopathy/Hilum/Osteopenia/Scoliosis |
| rule-based 0.711 vs GPT-4o 0.786 | arXiv 正文 §3.6 + Table 8 | 406 张 gold standard micro-precision |
| 96→61→29→17→9 参与漏斗 | arXiv 正文 §3.1 + Table 2 | 2024 届 |
| 209→59→23→17 参与漏斗 | arXiv 2310.16112(MIA 2024;103224)§3.1 | 2023 届 |
| Task 1 mAP 0.281/0.279/0.277/0.277 | arXiv 正文 §3.3 + Table 4 | 2024 届 |
| Task 2 mAP 0.526/0.511/0.511/0.509 | arXiv 正文 §3.4 + Table 6 | 2024 届 |
| Task 3 mAP 0.129/0.116/0.110 | arXiv 正文 §3.5 + Table 7 | 2024 届 |
| 2023 冠军 0.372(CheXFusion) | ICCVW 2023 论文 + CVF Open Access 页 | pp. 2702-2710 |
| 26 类共有类对齐成绩 0.370-0.373 | arXiv 正文 §3.3 | 跨届可比性实验 |
| License 1.5.0 / credentialed | PhysioNet 页 Access Policy 字段 | 页面直书 |
| v2.0.0 发布 2025-03-19 | PhysioNet 页版本字段 | 页面直书 |
| HF 无镜像 | hf-mirror API datasets?search=cxr-lt 返回 [] |
2026-09-27 实查 |
| 8 位数据集作者及机构 | PhysioNet 页作者字段(含 Affiliations 弹出) | 页面直书 |
| 资助方 AIJ | PhysioNet 页 Conflicts 节 + 2023 CFP 页 | 两处一致 |
附录 D:数据获取决策树
需要 CXR-LT
├── 只做统计/协议/文本侧研究(无图像)
│ └── PhysioNet credentialed + 签 CXR-LT DUA → 下载标签包即完成
├── 做图像实验(训练/评测模型)
│ ├── 已有 MIMIC-CXR-JPG v2.0.0 凭据?
│ │ ├── 是 → 补 CXR-LT DUA → 双包下载 → dicom_id join(附录 G)
│ │ └── 否 → 两个 PhysioNet 凭据申请并行提交(MIMIC-CXR-JPG + CXR-LT DUA)
│ └── 只需要尾部类演示/教学
│ └── 评估 gold standard 406 张是否够用(26 类内)→ 够则只下标签包 + 少量图
└── 做比赛复盘/方法综述
└── 无需下载数据:arXiv 2506.07984 + GitHub CXR-LT/CXR-LT-2024(slides)+ CodaLab 18601/18603 榜单
附录 E:45 类标签三层代际全表
按代际排列的 45 类完整清单(英文名照录 PhysioNet 页面;†为 zero-shot held-out 5 类;中文为本条目编译):
| # | 代际 | 英文原名 | 中文对照 |
|---|---|---|---|
| 1 | 第 0 层 | Enlarged Cardiomediastinum | 心纵隔增宽 |
| 2 | 第 0 层 | Cardiomegaly | 心脏肥大 |
| 3 | 第 0 层 | Lung Opacity | 肺部阴影 |
| 4 | 第 0 层 | Lung Lesion | 肺部病变 |
| 5 | 第 0 层 | Edema | 肺水肿 |
| 6 | 第 0 层 | Consolidation | 实变 |
| 7 | 第 0 层 | Pneumonia | 肺炎 |
| 8 | 第 0 层 | Atelectasis | 肺不张 |
| 9 | 第 0 层 | Pneumothorax | 气胸 |
| 10 | 第 0 层 | Pleural Effusion | 胸腔积液 |
| 11 | 第 0 层 | Support Devices | 支持设备(起搏器/导管等) |
| 12 | 第 0 层 | No Finding / Normal | 无异常 |
| 13 | 第 1 层(2023) | Calcification of the Aorta | 主动脉钙化 |
| 14 | 第 1 层(2023) | Emphysema | 肺气肿 |
| 15 | 第 1 层(2023) | Fibrosis | 纤维化 |
| 16 | 第 1 层(2023) | Hernia | 疝 |
| 17 | 第 1 层(2023) | Infiltration | 浸润 |
| 18 | 第 1 层(2023) | Mass | 肿块 |
| 19 | 第 1 层(2023) | Nodule | 结节 |
| 20 | 第 1 层(2023) | Pleural Thickening | 胸膜增厚 |
| 21 | 第 1 层(2023) | Pneumomediastinum | 纵隔气肿 |
| 22 | 第 1 层(2023) | Pneumoperitoneum | 气腹 |
| 23 | 第 1 层(2023) | Subcutaneous Emphysema | 皮下气肿 |
| 24 | 第 1 层(2023) | Tortuous Aorta | 主动脉迂曲 |
| 25 | 第 2 层(2024) | Adenopathy | 淋巴结肿大 |
| 26 | 第 2 层(2024) | Azygos Lobe | 奇静脉叶 |
| 27 | 第 2 层(2024) | Bulla | 肺大疱 † |
| 28 | 第 2 层(2024) | Cardiomyopathy | 心肌病 † |
| 29 | 第 2 层(2024) | Clavicle Fracture | 锁骨骨折 |
| 30 | 第 2 层(2024) | Fissure | 叶间裂异常 |
| 31 | 第 2 层(2024) | Hilum | 肺门异常 † |
| 32 | 第 2 层(2024) | Hydropneumothorax | 液气胸 |
| 33 | 第 2 层(2024) | Infarction | 梗死 |
| 34 | 第 2 层(2024) | Kyphosis | 脊柱后凸 |
| 35 | 第 2 层(2024) | Lobar Atelectasis | 肺叶不张 |
| 36 | 第 2 层(2024) | Osteopenia | 骨量减少 † |
| 37 | 第 2 层(2024) | Pleural Other | 其他胸膜异常 |
| 38 | 第 2 层(2024) | Pulmonary Embolism | 肺栓塞 |
| 39 | 第 2 层(2024) | Pulmonary Hypertension | 肺动脉高压 |
| 40 | 第 2 层(2024) | Rib Fracture | 肋骨骨折 |
| 41 | 第 2 层(2024) | Round Atelectasis | 圆形肺不张 |
| 42 | 第 2 层(2024) | Scoliosis | 脊柱侧弯 † |
| 43 | 第 2 层(2024) | Tuberculosis | 结核 |
| 44 | — | Fracture | 骨折(2023 届已在用,图表实例标注"introduced in CXR-LT 2023") |
| 45 | — | Pleural Other / Normal 归并口径 | 以 labels.csv 实际列为准 |
两点口径说明:其一,第 0 层的确切列名与 14 类口径以库内 mimic-cxr-jpg(617) 条目及 MIMIC-CXR-JPG v2.0.0 原生 labels 文件为准,上表第 12/44/45 行的归并方式在两份官方文档间的表述存在细节差异,最终事实源是 CXR-LT 的 labels.csv 表头;其二,PhysioNet 页面把 2024 新增 19 类明确列名(本表 #25-43 中除 † 外的全部),引用时可直接对照。
附录 F:2023 / 2024 两届总对照
| 维度 | CXR-LT 2023 | CXR-LT 2024 |
|---|---|---|
| 挂靠 | ICCV 2023 CVAMD workshop(Paris) | MICCAI 2024 challenge event |
| 届期 | 2023-05-01 → 10-06 | 2024-05-01 → 10-10 |
| 标签体系 | 26 类 | 45 类(训练 40 + zero-shot 5) |
| 任务数 | 1(长尾多标签分类) | 3(大噪 / gold standard / zero-shot) |
| CodaLab | 竞赛 12599 | 竞赛 18601(Task 2)/ 18603(Task 1) |
| 申请→获批 | 209 → 59 | 96 → 61 |
| 开发阶段 | 23 队 / 525 提交 | 29 队 / 1,374 提交 |
| 测试阶段 | 17 队 | 17 队 |
| 产出 | 9 篇 workshop 论文 | top 9 MICCAI 报告 + MIA 概览论文 |
| 冠军 mAP | 0.372(CheXFusion, Dongkyun Kim) | Task 1 0.281(ASU)/ Task 2 0.526(Yale)/ Task 3 0.129(U Penn) |
| gold standard | 406 张 / 26 类 / 6 人(制作于本届) | 原样沿用 |
| 数据发布 | v2.0.0 包 cxr-lt-2023/ 目录 | 同包 cxr-lt-2024/ 目录(v2.0.0,2025-03-19) |
| 评估协议 | mAP 主指标确立 | mAP + tie 决 mAUC + F1/ECE 观察项定型 |
| top 方案关键词 | ConvNeXt/EfficientNetV2、mosaic 增强、头尾专家分治 | 扩散合成数据、CLIP 式对齐、DINOv2 基础模型、LLM 描述增广 |
附录 G:双包组装与训练划分骨架(代码)
# 依赖:pandas;前提:已完成 MIMIC-CXR-JPG 与 CXR-LT 双包下载与解压
import pandas as pd
LT_DIR = "cxr-lt-iccv-workshop-cvamd" # PhysioNet 实际 slug(坑 8:与届名不一致)
# 1) 载入官方训练划分(不要从 labels.csv 自行切分!)
train = pd.read_csv(f"{LT_DIR}/cxr-lt-2024/train_labeled.csv") # 258,871 行 × 40 标签
dev_t1 = pd.read_csv(f"{LT_DIR}/cxr-lt-2024/development_labeled_task1.csv")
test_t1 = pd.read_csv(f"{LT_DIR}/cxr-lt-2024/test_labeled_task1.csv")
test_t2 = pd.read_csv(f"{LT_DIR}/cxr-lt-2024/test_labeled_task2.csv") # 406 × 26
test_t3 = pd.read_csv(f"{LT_DIR}/cxr-lt-2024/test_labeled_task3.csv") # 78,946 × 5
# 2) zero-shot 5 类硬隔离检查:训练集中不得出现这 5 列
ZS = ["Bulla", "Cardiomyopathy", "Hilum", "Osteopenia", "Scoliosis"]
assert not set(ZS) & set(train.columns), "zero-shot 类泄漏进训练集!"
# 3) 与 MIMIC-CXR-JPG 图像路径 join(示意;路径结构见库内 mimic-cxr-jpg 条目)
# train["dicom_id"] → 解析 patient/study → 拼接 jpg 路径;缺失即报告,勿静默丢弃
# 4) 自查三件事
assert len(train) == 258871 and len(test_t1) == 78946 and len(test_t2) == 406
print("rows OK;", train.shape[1] - 1, "个标签列(应为 40)")
附录 H:评测复现骨架(mAP 主指标)
# macro-averaged Average Precision:与 CodaLab 排行榜口径对齐的最小实现
import numpy as np
from sklearn.metrics import average_precision_score, roc_auc_score
def macro_ap(y_true: np.ndarray, y_prob: np.ndarray) -> float:
"""逐类 AP 再取宏平均;仅对测试集中正样本数 > 0 的类计分(与官方口径核对后固定)。
注意:官方在 tie 时用 mAUC 决胜,因此 mAUC 要一并实现。"""
aps, aucs = [], []
for c in range(y_true.shape[1]):
t, p = y_true[:, c], y_prob[:, c]
if t.sum() == 0:
continue
aps.append(average_precision_score(t, p))
aucs.append(roc_auc_score(t, p))
return float(np.mean(aps)), float(np.mean(aucs))
# 报告规范:mAP(主)+ mAUROC(tie 决)+ mF1@0.5 与 mECE(观察项,不参与排名)
# 对照锚点:Task 1 最佳 0.281 / Task 2 最佳 0.526 / Task 3 最佳 0.129
附录 I:参赛/获取流程模板(凭据→DUA→Form)
| 步骤 | 动作 | 产出/周期提示 |
|---|---|---|
| 1 | PhysioNet 注册 + CITI 人类受试者保护培训 | 证书 PDF |
| 2 | 签 PhysioNet GCP/AWS 协议(选云平台) | credentialed access 生效 |
| 3 | 在 mimic-cxr-jpg 记录页签 DUA | MIMIC-CXR-JPG v2.0.0 访问权 |
| 4 | 在 cxr-lt-iccv-workshop-cvamd 记录页签 DUA | 标签包下载权 |
| 5 | (参赛场景)Google Form 提交 MIMIC 凭据证明 | 主办方审核(96→61 的环节) |
| 6 | 下载双包 → 附录 G 组装 | 可训练数据集 |
时间预算提示:凭据审核是异步人工流程,两届赛事的申请流失大多发生于此;建议在项目启动日同时提交 MIMIC 与 CXR-LT 的所有材料,避免串行等待。
附录 J:标签使用与 zero-shot 规范(逐条)
- 标签代际不得混贴:同一实验内只用一套体系(26 或 45),对照实验显式声明对齐协议(附录 F)。
- Normal 类语义:45 类体系中 Normal=无心肺疾病;与其他类的共存关系以 labels.csv 实际行值为准,勿假设互斥。
- 尾部类抽检义务:第 15-45 类的规则法精度无逐类背书,训练前按类抽 20-50 张人工复核(gold standard 只覆盖 26 类)。
- 噪声利用:研究噪声鲁棒方法时,保留 rule-based 原始标签,勿预清洗——Task 1 的评测哲学就是"在真实噪声分布上计量"。
- GPT-4o 对照的复用:附录 C 数字(0.711/0.786)是按类 micro-precision 的总口径;复用该实验时逐类数值以论文 Table 8 为准(如 Infiltration 0.261→0.889、Lung Opacity 0.853→0.984)。
- gold standard 用途边界:406 张只够总体趋势与关键类校验,不足以支撑 26 类的 per-class 训练。
- 图像预处理:JPEG 像素值 0-255;获胜方案常用 224-1024px 输入(论文 Table 3 口径),高分辨率对尾部类增益显著。
- 提交复现:CodaLab 要求 .zip 内含预测 CSV + code/ 目录——复现官方评测时同样建议代码与预测同库管理。
- 转引成绩:引用任何一届成绩时注明任务与测试集口径(如 “Task 1, 40 类, 78,946 张, mAP”),裸引 mAP 数字无意义。
- 交叉引用库内条目:图像本体规格(分辨率/压缩/元数据表)以 mimic-cxr-jpg(617) 条目为准,本条目不重复记载。
附录 K:与库内 mimic-cxr-jpg(rid 617)条目的关系声明
| 关系维度 | 说明 |
|---|---|
| 数据血缘 | CXR-LT 377,110 张 = mimic-cxr-jpg v2.0.0 全量;dicom_id 一一对应 |
| 标签血缘 | 第 0 层 14 类 = mimic-cxr-jpg 原生标签;第 1/2 层 31 类 = CXR-LT 报告解析增量 |
| 获取血缘 | CXR-LT DUA 明文要求 MIMIC-CXR-JPG v2.0.0 凭据为前置 |
| 条目分工 | mimic-cxr-jpg 条目:图像规格/目录结构/原生标签;本条目:扩展标签/两届赛事/评测协议 |
| 检索建议 | 两条目互为"另半包":只读标签→本条目;要图像→两包都取 |
| 维度联动 | 若 617 条目未来更新 v2.1/新版本,本条目附录 K 的血缘声明需同步复核(附录 O 触发点) |
附录 L:胸片数据集景观总表(库内条目对照精选)
| 数据集 | rid | 规模量级 | 标签路线 | 与 CXR-LT 的关系 |
|---|---|---|---|---|
| NIH ChestX-ray14 | 15 | 112,120 图 / 14 类 | NLP 挖掘(早期) | 长尾评测鼻祖,CXR-LT 的代际前身 |
| MIMIC-CXR | 16 | 377,110 图(DICOM)/ 报告全量 | 原生标签 | 报告与 DICOM 本体源 |
| MIMIC-CXR-JPG | 617 | 377,110 JPG | 原生 14 类 | 直接上游本体 |
| PadChest | 117 | 160,868 图 / 174 类 | 报告挖掘+人工核 | 标签广度路线对照 |
| VinDr-CXR | 125 | 18,000 图 / 22 类 | 人工逐图 | 可靠性路线对照 |
| Chest ImaGenome | 330 | 65,379 studies / 解剖级 | 结构化规则 | 报告挖掘家族 |
| MS-CXR | 340 | 千级图-文本局部对 | 局部对应 | 多模态评测互补 |
| CheXStruct/CXReasonBench | 604 | 结构化推理基准 | 报告挖掘 | 同家族不同任务面 |
| COVIDx CXR | 197 | 多源新冠胸片 | 混合 | 疫情期尾部类的极端案例 |
| CheXMask | 602 | 分割掩码 | 模型生成 | 下游工具链 |
注:CheXpert 本体未收录库内(其在 CXR-LT 语境中主要作为 top 队预训练源出现),故列于附录 J 的预训练谱系而非本表。
附录 M:坑点档案(与 §9 对照,登记性质)
| 坑号 | 一句话 | 条目处理 |
|---|---|---|
| 坑 1 | gold standard 406(PhysioNet/论文)vs 409(Zenodo) | 取 406;Zenodo 记异文 |
| 坑 2 | Test Phase 08/01-08/04(计划)vs 08/26-09/06(执行) | 主叙事用执行口径 |
| 坑 3 | MICCAI event 10/06(design PDF)vs 10/10(PhysioNet/arXiv) | 取 10/10 |
| 坑 4 | HF 无官方镜像 | 检索直达 PhysioNet |
| 坑 5 | Zenodo CC 字样是模板示例非许可 | License 1.5.0 唯一口径 |
| 坑 6 | 26/40/45 三套类数并存 | 显式声明体系再比较 |
| 坑 7 | 标签包不含图像 | 双包组装流程(附录 G) |
| 坑 8 | PhysioNet slug 与届名不一致 | 收藏 DOI 最稳 |
| 坑 9 | Task 2 第二名正文(E 0.511)与表格(A 0.519)互异 | 正文口径主引,榜单为准 |
附录 N:双口径登记表
| 事项 | 口径 A | 口径 B | 条目取舍 |
|---|---|---|---|
| gold standard 数量 | 406(PhysioNet 页/arXiv Table 1 与正文) | 409(Zenodo 10991413 描述) | 406 |
| Test Phase | 08/01-08/04/2024(官网/PhysioNet) | 08/26-09/06/2024(arXiv Table 2/正文) | 执行口径为主,计划口径并存 |
| MICCAI event | 10/06/2024(Zenodo design PDF) | 10/10/2024(PhysioNet/arXiv) | 10/10 |
| 训练集规模表述 | “over 250,000”(摘要口径) | 258,871(Table 1) | 表格精确值,摘要口径注记 |
| 2024 数据构成 | “整合 CheXpert/PadChest/NIH/MIMIC”(任务简报方向提示,未经核验) | MIMIC-CXR-JPG 单库扩展(三源实证) | 后者;前者证伪记档 |
| 数据托管 | HuggingFace(方向提示,未核验) | PhysioNet credentialed(实抓) | 后者;前者证伪记档 |
| Mingquan Lin 机构 | Weill Cornell(2023 届口径) | University of Minnesota(2025 论文/PhysioNet 口径) | 按届别标注 |
| Task 2 第二名 | Team E 0.511(论文正文文字) | Team A 0.519(论文 Table 6 表格) | 正文口径主引,表格口径存照(坑 9) |
| 头部/尾部区段 | Task 1 Head mAP 0.567-0.570 | Tail mAP 0.125-0.136 | 两段并存引用(附录 T.2),不可只引一段 |
| gold standard 制作届别 | 2023 届制作(Holste 2024 论文详述) | 2024 届沿用(PhysioNet v2.0.0 Release Notes) | 两届同源,口径为 26 类 |
| 2023 届数据发布形态 | 赛期内经 CodaLab 分发(train/development.csv) | 赛后并入 PhysioNet v2.0.0 包 cxr-lt-2023/ 目录 | 现行以 PhysioNet 为准 |
附录 O:维护计划与触发点
| 优先级 | 触发点 | 条目动作 |
|---|---|---|
| 高 | PhysioNet 发布 v2.x(如 GPT 级标注替换/逐类分布表公开) | §2 重写标注节;DAIMS A/I 分上调 |
| 高 | CXR-LT v3 / 第三届赛事官宣 | §3 谱系表增行;附录 F 增列 |
| 中 | HF 出现官方镜像 | 坑 4 撤销;§5.1 改写;A 分上调 |
| 中 | Task 3 CodaLab 竞赛号核实(疑 18602) | 附录 F 补号;坑点相应注销 |
| 中 | MIMIC-CXR-JPG 库内条目更新(rid 617) | 附录 K 关系声明同步 |
| 低 | 2023 届 PhysioNet v1.x 历史版本页浮出 | §5.1 版本链补全 |
| 低 | 逐类样本数分布被官方或社区发布 | §2.6 补表;删除"需自算"警示 |
| 低 | 两届概览论文的引用网络出现新 SOTA 方法 | §4.4/§4.5 主题段追加 |
| 低 | CodaLab 平台迁移/下线 | 附录 I 与 §3.4 的榜单链接改指存档版本 |
| 低 | PhysioNet 页面作者 Affiliations 变更(人员流动) | §3 机构表与附录 N 的机构口径行复核 |
附录 P:基于本数据集的研究检查清单(12 项)
- 口径声明:实验用 26 类还是 45 类(训练 40+未见 5),文内首段声明。
- 划分来源:使用 train_labeled.csv 官方划分,不从 labels.csv 自切。
- zero-shot 隔离:5 个 held-out 类在特征、损失、验证全链路缺席。
- 指标口径:mAP(宏平均 AP)为主;同分场景补报 mAUC;mF1/mECE 观察项一并报告。
- 噪声披露:报告使用 rule-based 标签的事实与其 0.711 锚点;若做清洗实验,附双轨(Task 1 vs Task 2 式)对照。
- 逐类计数自算:引用类分布时注明"自行统计自 labels.csv"(官方未发布该表)。
- gold standard 限度:406 张仅作趋势/校验结论,不作 per-class 训练依据。
- 图像来源合规:图像引用同时标注 MIMIC-CXR-JPG v2.0.0 与 CXR-LT 两个来源。
- 跨届比较协议:与 2023 届成绩比较时,对齐 26 个共有类并引用 0.370-0.373 对齐结果。
- 基线锚点:报告相对基线的增益(Task 1 0.281 / Task 2 0.526 / Task 3 0.129)。
- 许可边界:模型发布与再分发前逐条核对 License 1.5.0 与 MIMIC DUA;商用单独评估。
- 时点存照:标注数据抓取/下载时点(本条目基准时点 2026-09-27)。
附录 Q:术语表(中英对照)
| 术语 | 中文 | 条目内语义 |
|---|---|---|
| long-tailed | 长尾 | 少数类样本极多、多数类极少的分布形态 |
| multi-label | 多标签 | 一张图可同时带有多个疾病所见标签 |
| zero-shot | 零样本 | 模型对训练中从未出现的类别做预测 |
| held-out | 扣留类 | 被刻意从训练集移除的 5 个类别 |
| rule-based labeling | 规则法标注 | 用术语匹配与否定检测从报告抽取标签 |
| gold standard | 金标准子集 | 406 张 6 人共识人工标注测试集 |
| mAP | 平均精度均值 | 宏平均 Average Precision,本系列主指标 |
| mAUC / mF1 / mECE | 辅助指标族 | 上板不排名;mECE 量化校准误差 |
| credentialed access | 凭据访问 | PhysioNet 的受控数据访问框架 |
| DUA | 数据使用协议 | 签署后解锁下载的法律文件 |
| CVAMD | 医学自动诊断计算机视觉 workshop | ICCV 2023 workshop,第一届的挂靠载体 |
| shared task | 共享任务 | workshop/challenge 内的统一评测赛题 |
| development phase | 开发阶段 | 带公开排行榜的试错期(2024 届 5/1-8/26) |
| test phase | 测试阶段 | 榜单隐藏的最终评测期(2024 届 8/26-9/6) |
| report mining | 报告挖掘 | 从自由文本放射报告结构化提取信息 |
| PruneCXR | 剪枝研究子集 | 包内 257,018 张 19 类的 MICCAI 2023 论文配套数据 |
| head/medium/tail | 头部/中型/尾部类 | 论文区段划分:占比 >10% / 1-10% / <1% |
| ensemble (ENS) | 集成 | 多模型/多分辨率/多 checkpoint 融合,top 9 全员使用 |
| loss re-weighting (LRW) | 损失重加权 | 放大尾部类损失权重的训练技巧 |
| asymmetric loss | 不对称损失 | 处理多标签负样本主导的长尾损失函数 |
| live/hidden leaderboard | 公开/隐藏排行榜 | 开发期试错 vs 测试期诚实交付的赛制机制 |
| mAP-tie 决胜 | 同分裁决 | mAP 同分时按 mAUC 排名(Task 1 实证:C 队 0.849 第一) |
| DICOM id | 影像标识 | MIMIC-CXR-JPG 图像主键,CXR-LT 标签表关联键 |
| Noisy Student | 噪声学生自训练 | 域内自蒸馏预训练法,多支 top 队采用 |
| DINOv2 | 自监督视觉基础模型 | ViT 系自蒸馏+掩码建模,Task 2/3 获胜方案骨干 |
| SLA | 对称局部交叉注意力 | Yale 队(Task 2 冠军)的区域-文本对齐模块 |
| CXRFE | CXR Fact Encoder | PUC Chile 队的事实句文本编码器(冻结使用) |
| micro-precision | 微平均精确率 | GPT-4o 对照实验的逐类计分口径 |
| mosaic augmentation | 马赛克增强 | 四图拼接、标签并集的强增强(2023 亚军方案核心) |
| ML-Decoder | 多标签解码头 | 把标签当文本做 cross-attention 的分类头,多支 top 队采用 |
| view aggregation | 视角聚合 | 正位/侧位多图预测融合,免费涨分点 |
| co-occurrence | 标签共现 | 多标签并存的统计结构,CXR-LT 区别于单标签长尾基准的核心 |
| held-out split | 扣类切分 | 发布时预留类别作未见类评测的协议设计 |
附录 R:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 数据本体 | CXR-LT PhysioNet / doi:10.13026/ryj9-x506 | cxr-lt-iccv-workshop-cvamd v2.0.0 |
| 2024 概览论文 | “CXR-LT 2024” MICCAI challenge / doi:10.1016/j.media.2025.103739 | MIA 2025;106:103739(arXiv:2506.07984) |
| 2023 概览论文 | “Towards long-tailed, multi-label disease classification from chest X-ray” | MIA 2024;103224(arXiv:2310.16112) |
| 设计文档 | “CXR-LT 2024” Zenodo / doi:10.5281/zenodo.10991412 | record 10991413 |
| 赛事页面 | CXR-LT 2024 grand challenge / cxr-lt.github.io | 官网 + GitHub CXR-LT/CXR-LT-2024 |
| 2023 冠军方案 | CheXFusion ICCV 2023 workshop | CVF Open Access pp.2702-2710 |
| top 队报告 | CXR-LT 2024 GitHub slides | github.com/CXR-LT/CXR-LT-2024 |
| 反例(勿用) | “CXR-LT HuggingFace dataset” | 无官方命中(坑 4) |
| 检索卫生两条:一、CXR-LT 与 CheXpert 的前缀相似度高,精确短语加引号防混;二、PhysioNet slug 含 iccv-workshop 字样,站内搜索用 DOI 或 “CXR-LT” 全词。
附录 S:参考文献清单(本条目事实源)
- Lin M, Holste G, Wang S, Zhou Y, Wei Y, et al., Peng Y. CXR-LT 2024: A MICCAI challenge on long-tailed, multi-label, and zero-shot disease classification from chest X-ray. Medical Image Analysis 2025;106:103739. doi:10.1016/j.media.2025.103739(arXiv:2506.07984)
- Holste G, Zhou Y, Wang S, Jaiswal A, Lin M, et al., Peng Y, Wang Z. Towards long-tailed, multi-label disease classification from chest X-ray: Overview of the CXR-LT challenge. Medical Image Analysis 2024;103224.(arXiv:2310.16112)
- Holste G, Lin M, Wang S, Zhou Y, Wei Y, Chen H, Wang A, Peng Y. CXR-LT: Multi-Label Long-Tailed Classification on Chest X-Rays (version 2.0.0). PhysioNet, 2025. doi:10.13026/ryj9-x506(RRID:SCR_007345)
- Peng Y, Lin M, Holste G, et al. CXR-LT 2024: Long-tailed, multi-label, and zero-shot classification on chest X-rays: Structured description of the challenge design. Zenodo, 2024. doi:10.5281/zenodo.10991412
- Kim D, et al. CheXFusion: Effective Fusion of Multi-View Features Using Transformers for Long-Tailed Chest X-Ray Classification. ICCVW 2023:2702-2710.(CVF Open Access)
- 2023 届 top 2-5 方案描述:2023 概览论文(arXiv:2310.16112)Table 1 与正文 §3.2(条目 §4.1 速查表之源)
- Task 1 头中尾分解:2024 概览论文 Table 5(条目附录 T.2 之源);GPT-4o 逐类对照:同论文 Table 8(附录 U 之源);top 9 特征矩阵:同论文 Table 3(附录 V 之源)
- CXR-LT 2024 官网:cxr-lt.github.io/CXR-LT-2024/;组织 GitHub:github.com/CXR-LT/CXR-LT-2024
- 2023 届赛事 CFP(conferences.visionbib.com 收录):ICCV 2023 CVAMD Shared Task; CodaLab 12599
- Johnson AEW, et al. MIMIC-CXR-JPG v2.0.0(PhysioNet)——图像本体与 DUA 框架源。
附录 T:两届 Task 成绩全表(论文 Table 4-7 全转)
T.1 Task 1 top 4 完整指标(40 类 / 78,946 张)
| 排名 | 队伍 | mAP | mAUROC(排名) | mF1(排名) | mECE(排名) |
|---|---|---|---|---|---|
| 1 | A | 0.281 | 0.847 (3) | 0.289 (3) | 0.589 (4) |
| 2 | B | 0.279 | 0.843 (5) | 0.286 (4) | 0.592 (6) |
| 3 | C | 0.277 | 0.849 (1) | 0.299 (1) | 0.603 (8) |
| 4 | D | 0.277 | 0.842 (6) | 0.285 (5) | 0.602 (7) |
读表注:C 与 D 同 mAP(0.277),C 的 mAUROC 0.849 为 top 4 第一,tie 决胜规则的实证案例(3.5 节);C 的 mF1 0.299 也是 top 4 第一——Yale 方案(CLIP 式对齐 + SLA 局部对齐模块)在阈值类指标上的优势与它在干净子集(Task 2)的登顶互为印证。
T.2 Task 1 头中尾分解(论文 Table 5)
| 队伍 | Overall | Head(占比 >10%) | Medium(1-10%) | Tail(<1%) | 区段均值 |
|---|---|---|---|---|---|
| A | 0.281 | 0.567 | 0.263 | 0.136 | 0.322 |
| B | 0.279 | 0.569 | 0.260 | 0.133 | 0.321 |
| C | 0.277 | 0.570 | 0.253 | 0.136 | 0.320 |
| D | 0.277 | 0.568 | 0.264 | 0.125 | 0.320 |
这张表是"长尾到底多难"的最直观数据:top 4 方案在头部类(占比 >10%)mAP 能到 0.56-0.57,中型类(1-10%)掉到 0.25-0.26,尾部类(<1%)只有 0.125-0.136——头部与尾部相差四倍,且四支队伍的区段曲线几乎重合。两条推论:其一,尾部类上方法差异被噪声与样本稀缺抹平,0.011 的整体差距全部来自头部微调;其二,任何声称"显著提升长尾性能"的方法论文,都应报告这种区段分解而非只报总体 mAP。
T.3 Task 2 top 4 完整指标(26 类 / 406 张)
| 排名 | 队伍 | mAP | mAUROC(排名) | mF1(排名) | mECE(排名) |
|---|---|---|---|---|---|
| 1 | C | 0.526 | 0.833 (3) | 0.499 (1) | 0.464 (6) |
| 2 | A | 0.519 | 0.834 (2) | 0.471 (4) | 0.457 (3) |
| 3 | E | 0.511 | 0.836 (1) | 0.265 (9) | 0.744 (10) |
| 4 | F | 0.509 | 0.829 (5) | 0.474 (3) | 0.462 (5) |
正文-表格漂移存照(坑 9):正文文字描述 Task 2 为 “C 0.526 → E 0.511(第二)→ A 0.511(第三)→ F 0.509”,而 Table 6 表格数据为 “C 0.526 → A 0.519 → E 0.511 → F 0.509”。两处对第二名的判定不一致(E vs A、0.511 vs 0.519)。条目正文采用正文文字口径并在本附录存照表格口径;自动抽取遇到此段时优先核对官方榜单(CodaLab 18601)。
T.4 Task 3 top 3 完整指标(5 未见类)
| 排名 | 队伍 | mAP | mAUROC(排名) | mF1(排名) | mECE(排名) |
|---|---|---|---|---|---|
| 1 | G | 0.129 | 0.741 (2) | 0.075 (6) | 0.817 (8) |
| 2 | H | 0.116 | 0.673 (8) | 0.035 (7) | 0.907 (9) |
| 3 | I | 0.110 | 0.744 (1) | 0.094 (4) | 0.711 (6) |
读表注:Task 3 的 mECE 普遍极高(0.7-0.9)——模型对"从未见过的疾病"的置信度几乎不可校准,这不是模型 bug 而是任务的认知边界;mAUROC(0.67-0.74)显著高于 mF1(0.035-0.094),说明排序能力尚存而阈值决策完全失效——zero-shot 输出只能当"检索候选",不能当"诊断开关"。
T.5 使用三表的两个纪律
- 指标成组引用:本附录各表为 mAP/mAUROC/mF1/mECE 四指标成组设计,只摘 mAP 一列会丢失"C 军团 mAUROC 第一"这类协议性信息;
- 测试集口径随行:T.1(78,946 张噪测)、T.3(406 张净测)、T.4(5 未见类)三张表的分数来自三种不同测试集,任何跨表比较都要先声明口径——这既是坑 6 的延伸,也是 7.3 节方法学启示的实例化。
附录 U:rule-based vs GPT-4o 逐类对照全表(论文 Table 8 全转)
在 406 张 gold standard 上的逐类 micro-precision(26 类):
| 类别 | Rule-based | GPT-4o | 差值 |
|---|---|---|---|
| Atelectasis | 0.611 | 0.590 | -0.021 |
| Calcification of the Aorta | 1.000 | 0.857 | -0.143 |
| Cardiomegaly | 0.769 | 0.938 | +0.169 |
| Consolidation | 0.816 | 0.849 | +0.033 |
| Edema | 0.638 | 0.804 | +0.166 |
| Emphysema | 0.609 | 0.639 | +0.030 |
| Enlarged Cardiomediastinum | 0.583 | 1.000 | +0.417 |
| Fibrosis | 0.667 | 0.682 | +0.015 |
| Fracture | 0.870 | 0.937 | +0.067 |
| Hernia | 0.633 | 0.810 | +0.177 |
| Infiltration | 0.261 | 0.889 | +0.628 |
| Lung Lesion | 0.161 | 0.000 | -0.161 |
| Lung Opacity | 0.853 | 0.984 | +0.131 |
| Mass | 0.513 | 0.810 | +0.297 |
| Normal | 0.917 | 0.972 | +0.055 |
| Nodule | 0.821 | 0.844 | +0.023 |
| Pleural Effusion | 0.798 | 0.812 | +0.014 |
| Pleural Other | 0.810 | 0.500 | -0.310 |
| Pleural Thickening | 1.000 | 0.815 | -0.185 |
| Pneumomediastinum | 0.875 | 0.889 | +0.014 |
| Pneumonia | 0.191 | 0.435 | +0.244 |
| Pneumoperitoneum | 0.676 | 0.840 | +0.164 |
| Pneumothorax | 0.563 | 0.865 | +0.302 |
| Subcutaneous Emphysema | 0.955 | 0.889 | -0.066 |
| Support Devices | 0.948 | 0.933 | -0.015 |
| Tortuous Aorta | 0.958 | 0.861 | -0.097 |
| 均值 | 0.711 | 0.786 | +0.075 |
四条读表结论:
- LLM 的增益集中在"语义灵活"类:Infiltration(+0.628)、Enlarged Cardiomediastinum(+0.417)、Mass(+0.297)、Pneumothorax(+0.302)、Pneumonia(+0.244)——这些类的报告表述多变,规则模板覆盖不住,语言模型的语义泛化正中要害;
- 规则法在"措辞刻板"类上反而占优:Calcification of the Aorta(1.000 vs 0.857)、Pleural Thickening(1.000 vs 0.815)、Tortuous Aorta(0.958 vs 0.861)、Subcutaneous Emphysema(0.955 vs 0.889)——名称即报告用语的类,精确匹配几乎无损;
- 两类双输:Lung Lesion(0.161/0.000)与 Pleural Other(0.810/0.500)——前者的失败在报告侧(医生很少显式写"lung lesion"),后者败在定义模糊("其他"类没有稳定语义边界),提示标签体系设计本身比标注算法更上游;
- 26 类均值差 +0.075:GPT-4o 的整体优势真实但非碾压——"换 LLM 就解决标注噪声"是过度推论,逐类成本收益分析才是正解。
附录 V:top 9 方案特征矩阵(论文 Table 3 全转)
| 队伍 | 机构 | 图像分辨率 | 骨干 | ENS | LRW | VL | 预训练 |
|---|---|---|---|---|---|---|---|
| A | Arizona State University | 224, 384 | ConvNeXt-S/B/T, ConvNeXt V2-B | ✓ | — | ✓ | ImageNet |
| B | Shanghai Jiaotong University | 512 | EfficientNetV2-L | ✓ | ✓ | ✓ | ImageNet → NIH, CheXpert, VinDr-CXR, BRAX |
| C | Yale University | 1024 | ConvNeXt-S, EfficientNetV2-S | ✓ | ✓ | ✓ | ImageNet → MIMIC-CXR |
| D | Carnegie Mellon University | 1024 | ConvNeXt-S | — | ✓ | ✓ | ImageNet → CheXpert, NIH, VinDr-CXR |
| E | Rensselaer Polytechnic Institute | 336, 448, 512 | ViT-L | ✓ | — | — | MIMIC-CXR, CheXpert, PadChest, NIH, BRAX |
| F | The University of Tokyo | 384, 512 | ConvNeXt V2-S, MaxViT-T | ✓ | ✓ | — | ImageNet → NIH |
| G | University of Pennsylvania | 224 | ViT-L | ✓ | ✓ | ✓ | ImageNet → MIMIC-CXR, CXR-Concepts, Chest ImaGenome, CXR-LT |
| H | Xiamen University | 224 | ResNet50 | ✓ | — | ✓ | None |
| I | Pontifical Catholic University of Chile | 384, 416 | DenseNet121, SigLIP Base, ConvNeXt-S, Uniformer | ✓ | ✓ | ✓ | ImageNet → MIMIC-CXR, IU X-ray, Chest ImaGenome, CheXpert, CheXlocalize, VinDr-CXR |
列说明:ENS=ensemble;LRW=loss re-weighting;VL=vision-language(视觉-语言组件);预训练链中"→“后为 ImageNet 之外的 CXR 域内语料。矩阵的三个统计事实:ENS 列 9/9 全勾(集成的普遍性);VL 列 7/9(多模态在 2024 已是主流配置,2023 届尚未过半);预训练列仅 H 一队选"None”(域内预训练的工业化程度)。Team G 是唯一把 CXR-LT 自身用作预训练语料的队伍——数据集在生态中已扮演"预训练源"角色。
附录 W:常见错误用法对照表
| 错误用法 | 后果 | 正确姿势 |
|---|---|---|
| 用 labels.csv 自行切分训练集 | zero-shot 5 类样本泄漏,Task 3 协议失效 | 用 train_labeled.csv 官方划分 |
| 拿 0.372(2023)与 0.281(2024)直接对比 | 得出"领域倒退"错误结论 | 对齐 26 共有类(0.370-0.373) |
| 引用 “CXR-LT mAP 0.526” 不注任务 | 无法对号入座 | 注明 Task 2 / 26 类 / 406 张 |
| 把 45 类当训练标签数 | 列数对不上(训练 40 类) | 45 总类 = 训练 40 + held-out 5 |
| 认为数据在 HF、直接 load_dataset | 白跑;误用第三方搬运 | PhysioNet credentialed 下载 |
| 引用许可为 CC BY | 许可声明错误 | License 1.5.0(credentialed) |
| 用 gold standard 406 张做 26 类训练 | 每类阳性个位数,无统计意义 | 只作评测/校验 |
| 对 Task 1 分数做阈值化决策 | 噪声标签污染阈值校准 | 参照 Task 2 / gold standard 校准 |
| 假设图像包里有标签扩展 | 只能拿到 14 类原生标签 | 标签只能来自 CXR-LT 包 |
| 忽略标签代际(26 vs 45)混用 CSV | 跨目录 join 后标签错位 | 显式声明所用代际与目录 |
附录 X:CXR-LT 系列关键日期年表
全部日期为本文已核验口径(含双口径者见括注):
| 日期 | 事件 |
|---|---|
| 2022-09 | DALI 2022 workshop(MICCAI 附属):长尾胸片基准前身论文发表 |
| 2023 春 | ICCV 2023 CVAMD Shared Task(CXR-LT 2023)启动招募 |
| 2023-05-01 | 第一届 Development Phase 开始(CodaLab 12599) |
| 2023-07-14 | 第一届 Testing Phase 开始(榜单隐藏) |
| 2023-07-17 | 第一届比赛结束 |
| 2023-10-06 | ICCV 2023 CVAMD workshop(Paris):9 篇参赛论文报告 |
| 2024-04-18 | CXR-LT 2024 challenge design 文档上 Zenodo(DOI 10.5281/zenodo.10991412) |
| 2024-05-01 | 第二届注册 + 训练数据发布(61 队注册) |
| 2024-05-01 → 08-26 | 第二届 Development Phase(29 队 / 1,374 次提交;官方计划口径为 08/01-08/04 结束,坑 2) |
| 2024-08-26 → 09-06 | 第二届 Test Phase(17 队;榜单隐藏,每队保留最佳提交) |
| 2024-10-10 | MICCAI 2024 CXR-LT challenge event(top 9 队报告;design PDF 写 10/06,坑 3) |
| 2025-03-19 | PhysioNet v2.0.0 数据包发布(DOI 10.13026/ryj9-x506) |
| 2025-06-09 | 2024 概览论文挂 arXiv(2506.07984) |
| 2025-12 | 2024 概览论文刊于 Medical Image Analysis 106:103739 |
年表的两个阅读线索:其一,“赛事在前、数据包正式发布在后”(2024 赛事 10 月结束,v2.0.0 次年 3 月才上 PhysioNet)——挑战赛数据的发布时滞是常态,期间数据经 CodaLab 面向参赛者分发;其二,概览论文的期刊发表(2025-12)比数据发布又晚大半年,引用时应按"赛事论文已定稿、数据 v2.0.0 已稳定"的现状引用。
附录 Y:延伸阅读顺序建议(面向不同读者)
| 读者 | 建议阅读顺序 | 理由 |
|---|---|---|
| 数据集使用者(工程向) | 本条目 §1 → §5 → 附录 I/G → §2.5 | 先知道怎么拿、再知道怎么拼 |
| 长尾方法研究者 | 本条目 §3 → §4 → 论文 2506.07984 → 附录 T/V | 先协议再成绩,逐队档案当方法综述读 |
| 评测协议设计者 | 本条目 §3.5 → §4.6 → 附录 T → 论文指标节 | mAP 论证与扣类设计是核心 |
| 医学AI学生(入门) | 本条目 §0 → §1 → §2.2 → §4.2 | 十五问与两张成绩表足够建立全景 |
| 综述作者 | 本条目 §6 → 附录 F/L → 两届概览论文 | 家族图谱 + 两届对照是综述骨架 |
| 数据集发布者 | 本条目 §7 → §5.6 DAIMS → 附录 O | 方法论启示与维护计划最相关 |
| 合规/法务评估者 | §5.4 → 附录 I → License 1.5.0 原文 | 许可边界与流程模板优先 |
| 数据标注团队 | §2.3 → §2.4 → 附录 U → 论文 3.6 节 | 噪声账与 LLM 对照是核心参照 |
无论哪条路径,附录 P 的 12 项检查清单都建议在研究定稿前过一遍——它是本条目全部坑点与口径纪律的操作化收口。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-27,抓取与核验时点见附录 A。事实陈述以 PhysioNet v2.0.0 记录页(DOI 10.13026/ryj9-x506)、两届概览论文(MIA 2024;103224 与 MIA 2025;106:103739)及 Zenodo 设计文档(DOI 10.5281/zenodo.10991412)为源,三源互证;gold standard 规模、赛程日期等原始文档双口径已在坑点与附录 N 存照。条目与库内 mimic-cxr-jpg(rid 617)、mimic-cxr(rid 16)、nih-chestx-ray14(rid 15)、padchest(rid 117)、vindr-cxr(rid 125)、chexstruct-cxreasonbench(rid 604)等条目互链,构成胸片长尾分类与报告挖掘家族的完整检索面。后续维护触发点见附录 O。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rsna-pneumonia — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
- chexlocalize — 共享标签:医学影像 / X光影像 / 评测基准 / 肺癌
- covidx-cxr — 共享标签:医学影像 / X光影像 / 图像分类 / 评测基准
- learn2reg — 共享标签:医学影像 / 挑战赛数据集 / 评测基准 / 肺癌
- rsna-intracranial-hemorrhage — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 评测基准
- heichole — 共享标签:医学影像 / 图像分类 / 挑战赛数据集 / 评测基准
- siim-acr-pneumothorax — 共享标签:医学影像 / X光影像 / 挑战赛数据集 / 评测基准
- dental-opg-xray — 共享标签:医学影像 / X光影像 / 图像分类 / 评测基准
- chexpert — 共享标签:医学影像 / X光影像 / 图像分类
- nih-chestx-ray14 — 共享标签:医学影像 / X光影像 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

