PadChest — 西班牙大规模胸片多标签数据集 AI-Ready Wikipedia | 千方病案医数集

西班牙最大胸片公开数据集 · 16 万影像 · 西班牙语报告 + UMLS 多标签

来源 name: "阿利坎特大学 & Hospital Universitario San Juan de Alicante & BIMCV" url: "https://bimcv.cipf.es/bimcv-projects/padchest/"发布时间: 2026-09-06最后更新: 2026-09-06 阅读 13

信息速览

数据集名称PadChest — 西班牙大规模胸片多标签数据集 AI-Ready Wikipedia | 千方病案医数集
数据类型- "约 1TB(DICOM 原图)" - "160,868 张影像" - "297 个 UMLS 标签" - "27% 医师人工标注" - "西班牙语报告" - "免费申请获取"
规模6.7 万名患者
接入方式name: "阿利坎特大学 & Hospital Universitario San Juan de Alicante & BIMCV" url: "https://bimcv.cipf.es/bimcv-projects/padchest/"
AI 就绪度

数据集封面

PadChest — 西班牙大规模胸片多标签数据集 AI-Ready Wikipedia


INFOBOX

数据集名称 PadChest
英文全称 PadChest: A large chest x-ray image dataset with multi-label annotated reports
别名/简称 PadChest、PadChest 160K、BIMCV PadChest
疾病分类 多疾病覆盖。核心映射:CA22 慢性阻塞性肺疾病 / CA40–CA4Z 肺炎及呼吸系统疾病 / CA71 肺不张 / CB24 心脏肥大 / DB90–DB98 胸膜与胸腔疾病(详见 §2.1)
SNOMED CT 233604007 Pneumonia / 13645005 COPD / 8186001 Cardiomegaly / 60046008 Pleural effusion / 111895007 Atelectasis(详见 §2.2)
数据模态 影像(胸部 X 光,PA/侧位/AP 等 6 种投照)+ 文本(西班牙语放射报告)+ 多标签标注
AI 任务类型 图像多标签分类、层级标签建模、影像-报告多模态、西班牙放射 NLP、报告生成(PadChest-GR)、自监督预训练
样本总数 160,868 张影像 / 67,625 名患者 / 109,931 份检查(报告)
数据大小 ~1 TB(DICOM 原图,54 个 zip)/ ~1.1 GB(标签 CSV)
数据格式 DICOM(原始分辨率,未缩放)/ CSV(33 字段标签与元数据)
许可证 PADCHEST Dataset Research Use Agreement(学术研究免费,禁止再分发、商业使用与重识别)
访问级别 申请审核(BIMCV 官网在线填写申请表 + 同意研究使用协议)
DUO 标签 HMB, NPUNCU, PUB
语言 西班牙语(放射报告;标签为英文控制的医学术语)
首发日期 2019-01-22(arXiv:1901.07441)/ 2020-12(Medical Image Analysis 正式发表)
最后更新 2019-02-01(标签 CSV 文件版本 01.02.19,此后无版本更新)
发布机构 阿利坎特大学(IUII/GRFIA)& Hospital Universitario San Juan de Alicante & BIMCV 瓦伦西亚医学影像库
官方主页 https://bimcv.cipf.es/bimcv-projects/padchest/
下载地址 https://bimcv.cipf.es/bimcv-projects/padchest/(“Download Complete Dataset” 申请表单)
DOI 10.1016/j.media.2020.101797(论文)/ arXiv:1901.07441(预印本)
引用次数 860+(Semantic Scholar,截至 2026-09);697(OpenAlex,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— UMLS 层级标签 + 27% 医师标注 + TorchXRayVision 原生支持;扣分项:无官方划分、73% 标签为 NLP 弱监督、1 TB DICOM 需自行预处理
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、影像发现与鉴别诊断的临床区分、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(33 字段 CSV 结构、层级标签体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与阿利坎特大学、Hospital Universitario San Juan de Alicante、BIMCV、Microsoft(PadChest-GR 资助方)无任何商业利益关联。本页面不销售 PadChest 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守 PADCHEST Dataset Research Use Agreement(仅限学术研究、禁止再分发、禁止商业使用、禁止重识别、发表时须规范引用)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

PadChest 是西班牙阿利坎特大学与 San Juan de Alicante 大学医院于 2019 年发布的大规模胸部 X 光数据集,包含 160,868 张高分辨率影像、67,625 名患者和 109,931 份西班牙语放射报告(2009-2017 年),每张影像带有覆盖 174 种影像发现、19 种鉴别诊断和 104 个解剖位置的多标签标注,全部映射到国际 UMLS 医学术语体系。

它的独特价值有三层:第一,它是首个包含西班牙语放射报告的大规模开放胸片数据集,打破了胸片 AI 的英语垄断;第二,它首创"27% 医师人工标注 + 73% 深度学习 NLP 自动标注"的混合标注范式,用 39,039 张人工标注影像训练出 Micro-F1 0.94 的标注器完成剩余 12 万张——这套方法论后来被 BIMCV-COVID19 等数据集直接沿用;第三,它的标签不是扁平的,而是一棵有"is-a"父子关系的层级树,并且明确区分"凭影像可断言的发现"与"需临床信息的鉴别诊断"——这是 CheXpert 等同时代数据集没有做、而临床上至关重要的区分。

你可以用它来:训练多标签胸片发现分类模型、研究层级标签与解剖定位的联合建模、做西班牙语/多语种放射 NLP、作为其他胸片数据集的预训练来源,或通过其派生集 PadChest-GR(4,555 个带 bounding box 的双语检查)训练 grounded 报告生成模型。

§1.1 摘要

PadChest 由阿利坎特大学模式识别与人工智能组(GRFIA/IUII)联合 San Juan de Alicante 大学医院卫生信息部门构建,经瓦伦西亚自治区医学影像库(BIMCV-CSUSP)去标识化并分发。数据采集自该院 2009-2017 年间 PACS 中所有可检索到报告的胸部 X 光检查,覆盖 PA、侧位、AP 等 6 种投照体位——侧位影像约占 30%,这在以正位为主的开放胸片数据集中相当突出。影像以原始 DICOM 格式发布(未缩放,平均约 2254×2299 像素,空间分辨率约 0.16 mm),54 个 zip 包共约 1 TB。标注方面,医师团队人工标注了 27,593 份报告(39,039 张影像),再以这些人工标注训练一个双向 LSTM 注意力句子分类器(RNN-ATT,FastText 100 维西班牙语词向量),为其余 82,338 份报告自动打标;自动标注器在来自 2009-2013 年的 500 句时间独立测试集上达到 Micro-F1 0.939。所有标签经三棵层级 taxonomy 组织(影像发现 / 鉴别诊断 / 解剖定位),并映射 UMLS CUI。论文发表于 Medical Image Analysis(2020 年 12 月,66:101797),Semantic Scholar 引用 860+ 次(截至 2026-09)。

§1.2 战略价值分析

标注范式维度:PadChest 回答了一个 2019 年胸片 AI 的核心难题——“人工标注太贵,规则标注太糙”。CheXpert 用规则引擎(rule-based NLP),NIH ChestX-ray14 用关键词匹配,标签噪声一直被诟病。PadChest 走了第三条路:先花钱请医师标注 27%,再训练一个带注意力机制的深度 NLP 模型去标注剩余 73%,并用时间外测试集(2009-2013,与训练集 2014-2017 不同期)验证标注器泛化性。这是"用深度学习标注深度学习训练集"的早期大规模成功案例,论文作者称之为当时"最大的成功应用深度学习方法完成自然语言标注的医学影像数据集"。这套方法学直接催生了 BIMCV-COVID19 的标注管线,也为后来 LLM 辅助标注提供了思想前驱。

标签语义维度:PadChest 的 taxonomy 设计比同时代数据集更贴近放射学实践。它把标签分成三类性质不同的实体——影像发现(radiographic findings,凭影像即可断言,如浸润、胸腔积液)、鉴别诊断(differential diagnoses,需临床信息才能成立,如肺炎、COPD)、解剖定位(anatomical locations)——并在论文中明确警告:把"预测心脏肥大"和"预测肺炎"当作同类任务是以往工作的普遍错误。标签间保留"is-a"层级(如 lung infiltrate → interstitial pattern / alveolar pattern),且解剖位置通过 LabelsLocalizationsBySentence 字段与每个发现句级绑定。这为层级分类、定位感知建模和报告级理解提供了其他数据集不具备的结构。

语言与地域多样性维度:在 PadChest 之前,大规模开放胸片数据集(NIH、CheXpert、MIMIC-CXR)全部来自美国、报告全部为英语。PadChest 是首个非英语报告的大规模开放胸片集,使"报告语言迁移"“非英语放射 NLP”"跨语言标签体系对齐(西班牙语 ↔ UMLS ↔ ICD)"成为可能。2020 年 COVID-19 爆发时,它又意外成为疫情前唯一带浸润/实变/非典型肺炎/磨玻璃影及解剖定位标签的大规模开放胸片集,被广泛用作 COVID 模型的对照与预训练数据。2025 年其派生集 PadChest-GR(NEJM AI)进一步成为首个 grounded 报告生成双语基准。

§1.3 横向对比

数据集 影像数 患者数 报告语言 标签体系 核心差异化
PadChest 160,868 67,625 西班牙语 174 findings + 19 diagnoses + 104 locations,UMLS 层级树,27% 人工 + 73% NLP 层级 taxonomy + findings/diagnoses 区分 + 侧位占 30%
CheXpert 224,316 65,240 英语(不公开) 14 类,规则 NLP + 不确定性标签 不确定性建模范式
MIMIC-CXR 377,110 65,379 英语(公开) 14 类(CheXpert 标注器) 附完整报告原文,ICU 场景
NIH ChestX-ray14 112,120 30,805 英语(不公开) 14 类,关键词匹配 最早的大规模开放集,噪声最大
VinDr-CXR 18,000 越南语(不公开) 28 findings/diagnoses,放射科医生标注 + bounding box 全人工标注 + 定位框
BIMCV-COVID19 ~13,000+ 西班牙语 沿用 PadChest 方法学(22 diagnoses / 122 locations / 189 findings) COVID-19 专病

PadChest 的不可替代性在于:层级化、定位化、双语化的标签结构 + 侧位视图的大规模覆盖 + 原始分辨率 DICOM。若只需扁平 14 类标签与英语报告,MIMIC-CXR/CheXpert 更合适;若需要 bounding box,选 PadChest-GR 或 VinDr-CXR。

§1.4 版本演进时间轴

时间 事件
2009-01 – 2017-12 San Juan de Alicante 医院 18 名放射科医生完成全部 109,931 份检查的阅片与报告
2014-2017 人工标注子集(27%)采集期;2009-2013 年数据留作标注器独立测试集
2019-01-22 arXiv 预印本发布(arXiv:1901.07441),数据集经 BIMCV 开放申请
2019-02-01 标签主文件定版:PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv
2019-2020 TorchXRayVision 集成 PC_Dataset 与 PadChest 预训练权重(weights="pc"
2020-05 标注管线代码公开(auriml/Rx-thorax-automatic-captioning)并适配 BIMCV-COVID19
2020-08-31 Medical Image Analysis 期刊版在线(66:101797,2020 年 12 月刊)
2020-2021 COVID-19 疫情期间被广泛用作疫情前对照与预训练数据
2024-11 PadChest-GR arXiv 预印本(arXiv:2411.05085)
2025-06-18 PadChest-GR 正式发表于 NEJM AI(4,555 个检查、双语 grounded 报告、bounding box)

§1.5 典型 AI 应用场景

  1. 多标签影像发现分类:174 findings + 19 diagnoses 的大规模多标签训练,适合层级分类器与标签共现建模。
  2. 跨数据集预训练与迁移:TorchXRayVision 的 pc 权重即 PadChest 预训练 DenseNet-121,常用于小数据集的迁移起点。
  3. 西班牙语/多语种放射 NLP:22,120 个人工标注唯一句 + 82,338 份自动标注报告,支撑报告分类、实体识别与跨语言对齐研究。
  4. Grounded 报告生成:经 PadChest-GR(4,555 个检查、7,037 个阳性发现句配 bounding box、西/英双语)训练带定位证据的报告生成模型。
  5. 自监督预训练与 COVID 对照研究:16 万张未缩放高分辨率影像是自监督表征学习的优质语料;疫情前时间窗使其成为 COVID 研究的标准对照。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

PadChest 覆盖胸片全疾病谱,其高频标签到 ICD-11 的映射如下(标签名为 PadChest 官方标签术语):

PadChest 标签(英文) 中文名称 标签类别 ICD-11 对应
COPD 慢性阻塞性肺疾病 鉴别诊断 CA22 慢性阻塞性肺疾病
pneumonia 肺炎 鉴别诊断 CA40–CA4Z 肺炎
heart insufficiency 心功能不全 鉴别诊断 BD10–BD1Z 心力衰竭
pulmonary emphysema 肺气肿 鉴别诊断 CA22.0 肺气肿
lung infiltrates 肺浸润 影像发现 CB40.Z 肺浸润性改变(影像)
atelectasis 肺不张 影像发现 CA71 肺不张
pleural effusion 胸腔积液 影像发现 DB98.Z 胸腔积液,未特指
cardiomegaly 心脏肥大 影像发现 CB24 心脏肥大
aortic elongations/dilations 主动脉迂曲扩张 影像发现 BD50.Z 主动脉病变(影像表现)
hilar enlargements 肺门增大 影像发现 MG30.Z 影像异常所见

影像发现 vs 鉴别诊断的本质区别:这是 PadChest taxonomy 最有临床价值的坚持。影像发现(如浸润、实变、积液)是放射科医生仅凭影像即可断言的实体;鉴别诊断(如肺炎、COPD、心衰)则必须结合临床信息才能成立——同一片"浸润"可能是肺炎、肺水肿或出血。原论文在 Advice 章节明确指出:以往文献把"预测心脏肥大"与"预测肺炎"当作同质任务是错误的,二者应使用不同的方法与评估标准(见 §6.5 坑点 2)。

§2.2 SNOMED CT 映射

PadChest 标签 标签类别 UMLS CUI 体系 ICD-11 SNOMED CT SNOMED CT 术语
pneumonia 鉴别诊断 C0032285 CA40.Z 233604007 Pneumonia (disorder)
COPD 鉴别诊断 C0024117 CA22.Z 13645005 Chronic obstructive lung disease (disorder)
heart insufficiency 鉴别诊断 C0018801 BD10.Z 84114007 Heart failure (disorder)
atelectasis 影像发现 C0004144 CA71 111895007 Atelectasis (disorder)
pleural effusion 影像发现 C0032227 DB98.Z 60046008 Pleural effusion (disorder)
cardiomegaly 影像发现 C0018800 CB24 8186001 Cardiomegaly (finding)
pulmonary emphysema 鉴别诊断 C0034067 CA22.0 49695001 Pulmonary emphysema (disorder)
pneumothorax 影像发现 C0032326 DB21.Z 36118008 Pneumothorax (disorder)

全部标签的 UMLS CUI 映射存储于标签 CSV 的 LabelCUISLocalizationsCUIS 字段;少数 UMLS 中无对应词条的实体由医师标注但未赋 CUI 码(原论文说明)。

§2.3 疾病简介

胸部 X 光是全球检查量最大的医学影像检查,用于肺部、心血管与骨性胸廓疾病的筛查与诊断。PadChest 所在人群为西班牙阿利坎特地区一家大学附属医院 9 年间的全部胸片检查者,疾病谱覆盖真实世界放射科工作流:最常见的影像发现为肺浸润(19,850 例)、主动脉迂曲扩张(10,154 例)、胸腔积液(8,593 例)、肺门增大(4,895 例);最常见的鉴别诊断为 COPD(14,557 例)与肺炎(5,934 例)。数据集中 37,871 份检查为正常(其中 9,404 份经人工标注确认),约 1.8% 为技术质量欠佳(suboptimal)检查。放射科医生日均阅片量超过 100 张,自动化分诊与辅助诊断工具具有明确的临床与经济价值——这正是该数据集构建的原始动机。

§2.4 临床任务定义

AI 任务 临床定义 在 PadChest 中的操作化
影像发现检测 凭影像可断言的异常(浸润、积液、肺不张等) Labels 字段中 findings 类标签(多标签)
鉴别诊断预测 需临床上下文的诊断实体(肺炎、COPD、心衰) Labels 字段中 diagnoses 类标签;评估应与 findings 分开
解剖定位 发现所在的解剖区域 Localizations / LabelsLocalizationsBySentence(句级绑定)
正常/异常分诊 检查级二分类 Labels 含 “normal” 特殊标签(37,871 份正常检查)
报告分类/生成 西班牙语报告的多标签分类与文本生成 Report 字段(词干化文本);PadChest-GR 提供双语句级 grounded 版本
影像质量评估 技术欠佳检查识别 Labels 含 “suboptimal study”(约 1.8%)与 “exclude”

§2.5 患者人群特征

维度 特征
数据来源 单中心:Hospital Universitario San Juan de Alicante,西班牙瓦伦西亚自治区阿利坎特,大学附属医院
采集时间 2009-01 至 2017-12(约 9 年)
规模 67,625 名患者 / 109,931 份检查 / 160,868 张影像
年龄 0-105 岁,均值 58.5(±20),中位 62;分布偏高龄,40 岁以下长尾
性别 按影像计:男性 80,923 / 女性 79,923(论文 Table 8;43-60 岁段女性影像更多,71-75 岁段男性更多)
检查频次 每患者平均 1.62 ± 1.66 份检查(1-116);每患者平均 2.37 ± 2.34 张影像;每检查平均 1.46 ± 0.53 张(1-11)
儿科 儿科协议(≤3 岁)仅 274 张影像(约 0.16%),实质为成人数据集
就医场景 门诊/住院/急诊混合(PACS 中可检索到报告的全部胸片检查)

投照体位分布(论文 Table 8)

体位 影像数 约占比 说明
PA(后前位) 96,010 ~57% 标准站立位
L(侧位) 51,124 ~30% 开放胸片集中罕见的大规模侧位
AP-horizontal(仰卧前后位) 14,355 ~8.6% 床旁/卧位,与病情严重度相关
AP-vertical(直立前后位) 5,158 ~3.1%
Costal(肋骨位) 631 ~0.4%
Pediatric(儿科协议) 274 ~0.2% ≤3 岁

注意:6 类合计 167,552 与最终影像总数 160,868 不完全吻合(原论文未解释差异);另有 20,367 张影像缺少 DICOM 体位字段,其体位由预训练 ResNet-50(chestViewSplit)自动分类,可能存在误分类(见 §6.5 坑点 8)。

§2.6 金标准/参考标准

数据来源 标注方式 标注者 金标准性质
人工标注子集(27%) 39,039 张影像 / 27,593 份报告 / 22,120 个唯一句,逐句多标签标注 经培训的医师(trained physicians;人数未披露;原始报告由 18 名放射科医生 2009-2017 年撰写;taxonomy 由 20 年临床经验的放射科医生审核) 最高质量层,MethodLabel 字段可识别
自动标注子集(73%) RNN-ATT(双向 LSTM 2×128 + label-wise attention + FastText 100d)句子级多标签分类 机器学习模型,以人工标注为训练真值 弱监督标签;独立测试集 Micro-F1 0.939 / Macro-F1 0.491(罕见类噪声大)
解剖定位 正则表达式提取 规则系统 与标签句级绑定(loc token 前缀)
体位补全 ResNet-50 图像分类(chestViewSplit) 机器学习模型 仅用于 20,367 张缺 DICOM 体位的影像
报告文本 放射科医生常规书写(西班牙语),发布前经词干化/分词预处理 San Juan 医院放射科 非原文,句子以 “.” 分隔

脱敏规则:项目经机构研究委员会批准;影像与报告由 BIMCV-CSUSP(瓦伦西亚自治区医学影像库)与 San Juan 医院卫生信息部门执行匿名化与去标识化;患者标识替换为合成键(PatientID);RUA 禁止任何重识别尝试。


§3 数据集规格

§3.0 版本抉择矩阵

PadChest 本体只有一个版本(2019-02-01 标签 CSV),但围绕它有多个衍生物。30 秒选型:

你的需求 推荐版本 大小 理由
多标签分类训练 / 预训练 / 西班牙放射 NLP PadChest 完整版(DICOM) ~1 TB(54 zips) 唯一含原始分辨率影像 + 全部 33 字段元数据 + 报告文本的版本
Grounded 报告生成 / 双语句级研究 PadChest-GR 4,555 个检查 西/英双语单发现句 + 放射科医生 bounding box + 发现进展标签(NEJM AI 2025)
快速原型 / 教学演示 TorchXRayVision PC_Dataset + pc 权重 取决于本地解压量 pip install torchxrayvision 即得统一加载接口与 PadChest 预训练 DenseNet-121,免写加载代码
COVID-19 相关研究 BIMCV-COVID19(+/- PadChest 对照) ~13,000+ 影像 同一机构、同套标注方法学的疫情期数据,PadChest 为天然疫情前对照

一句话结论:做影像分类/预训练一律用 PadChest 完整版;做报告生成用 PadChest-GR;只想快速验证想法先装 TorchXRayVision。

§3.1 模态详细说明

PadChest 包含三模态数据:

  1. 影像:160,868 张胸部 X 光 DICOM,保留原始分辨率(行 2254±739、列 2299±748、空间分辨率 0.16±0.02 mm),未做缩放以避免分辨率损失;按 DICOM 窗宽窗位重缩放动态范围。6 种投照体位,侧位约占 30%。
  2. 文本:109,931 份西班牙语放射报告的预处理片段(词干化 + 分词,句子以 “.” 分隔),存于标签 CSV 的 Report 字段。注意:这不是原始报告全文,不宜直接用于语言建模(见 §6.5 坑点 8)。
  3. 标注:每个影像的发现/诊断多标签(Labels)、解剖定位(Localizations)、句级标签-定位序列(LabelsLocalizationsBySentence)、UMLS CUI 映射(LabelCUIS/LocalizationsCUIS)与标注来源标识(MethodLabel)。

§3.2 样本量拆分

口径 患者 检查(报告) 影像
初始集 69,882 115,678 168,171
排除集(无法提取信息/质量等) 4,744 5,864 7,303
最终发布集 67,625 109,931 160,868
其中:人工标注(27%) 24,491 27,593 39,039
其中:自动标注(73%) 43,134 82,338 121,829

检查级构成:有 findings/diagnoses 的检查 68,855 份(17,513 人工);正常检查 37,871 份(9,404 人工);suboptimal 约 1.8%;无法提取信息被排除约 1.2%。

§3.3 数据格式详情

形态 格式 说明
影像 DICOM(.dcm),54 个 zip 原始分辨率,按 ImageDir 文件夹编号组织;含完整 DICOM 头
标签与元数据 CSV(单文件,33 字段) PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv
字段说明文档 随包附 README/字段说明 33 字段逐一解释(DICOM 字段后缀 _DICOM
校验清单 Verify_Zips_ImageCounts.csv.xlsx 各 zip 包影像计数,用于下载完整性核验
体位分类模型 chestViewSplit(GitHub) 补全 20,367 张无 DICOM 体位影像的预训练 ResNet-50

§3.4 存储大小

形态 大小 备注
影像 zip(54 个) ~1 TB 官方分发格式
解压后 DICOM ≥1.1 TB 建议预留 1.5 TB 磁盘(zip + 解压共存期)
标签 CSV ~1.1 GB 含报告文本与全部标注字段
降采样工作副本(自建) ~10-30 GB 224/512 px PNG/JPEG 转换后,供快速迭代

§3.5 标注方式

PadChest 的标注是一条"人工 → 训练 → 自动"的两级流水线:

109,931 份西班牙语报告(2009-2017)
        │
        ├─[人工层] 医师团队逐句标注 27,593 份报告(27%)
        │   → 22,120 个唯一句 × 193 类多标签(findings+diagnoses)
        │   → 对应 39,039 张影像
        │
        └─[自动层] 以人工标注训练 RNN-ATT 标注器
            (biLSTM 2×128 + label-wise attention + FastText 100d 西语词向量)
            → 标注剩余 82,338 份报告(121,829 张影像)
            → 时间外独立测试(500 句,2009-2013):Micro-F1 0.939 / Macro-F1 0.491

解剖定位:正则表达式从句中提取(loc token 前缀,句级绑定)
层级组织:三棵 is-a taxonomy(findings / diagnoses / locations)+ UMLS CUI 映射
特殊标签:normal / exclude / unchanged / suboptimal study

标注总量:177,628 个 findings(45,375 人工)、27,726 个 differential diagnoses(5,472 人工)、249,469 个解剖位置。

§3.6 标注者资质

角色 资质 说明
报告撰写者 18 名放射科医生(San Juan 医院) 2009-2017 年常规临床阅片
人工标注者 经培训的医师(trained physicians) 具体人数论文未披露
Taxonomy 审核 1 名 20 年临床经验的放射科医生 审核层级分类体系
自动标注器验证 时间外独立测试集(2009-2013 vs 训练期 2014-2017) Micro-F1 0.939;跨年份泛化验证了标注器对不同时期报告风格的鲁棒性
PadChest-GR 标注(派生集) 14 名放射科医生 bounding box 标注,每个阳性发现最多两套独立标注

§3.7 数据采集时间范围

2009 年 1 月至 2017 年 12 月。人工标注子集取自 2014-2017 年;NLP 标注器的独立测试集取自 2009-2013 年(时间外验证设计)。数据集整体为 COVID-19 疫情前时间窗,这使其在 2020-2021 年成为疫情研究的标准对照。

§3.8 地理覆盖

单中心——Hospital Universitario San Juan de Alicante,西班牙瓦伦西亚自治区。单中心 + 单一语言(西班牙语)来源是最主要的泛化性限制(详见 §7.3)。

§3.9 采集设备规格

项目 说明
成像设备 数字 X 线摄影(DR);具体厂商型号保留于 DICOM 头 Manufacturer_DICOM 字段(多设备混合,论文未给出分布)
空间分辨率 0.16 ± 0.02 mm/像素(0.1-0.2)
矩阵尺寸 行 2254±739(118-4280)× 列 2299±748(20-4280)
位深 BitsStored_DICOM 字段(DR 常规 12-16 bit)
曝光参数 XRayTubeCurrent_DICOM / Exposure_DICOM / ExposureTime_DICOM 等字段保留
窗宽窗位 WindowCenter_DICOM / WindowWidth_DICOM 保留,发布前已按窗重缩放动态范围
体位标注 ViewPosition_DICOM 原始字段 + 缺失部分由 ResNet-50 补全

§3.10 深度溯源链

环节 系统/方法 关键转换
1. 临床采集 San Juan 医院放射科 DR 设备 + PACS 2009-2017 年全部胸片检查;18 名放射科医生常规阅片书写西班牙语报告
2. 队列筛选 PACS 可检索报告过滤 仅纳入"能检索到报告"的检查(109,931 份)——引入选择偏倚(yes/no 型检查常无报告)
3. 去标识化 BIMCV-CSUSP + 医院卫生信息部门 影像与报告匿名化;机构研究委员会批准;患者 ID 合成化
4. 人工标注 医师团队 + 层级 taxonomy 27,593 份报告逐句多标签标注;三棵 is-a 树 + UMLS CUI 映射
5. 自动标注 RNN-ATT(biLSTM+attention+FastText) 以人工标注为真值标注其余 73%;时间外测试验证 Micro-F1 0.939
6. 字段整合 DICOM 头解析 + 标注合并 33 字段主 CSV(DICOM 元数据 + 报告 + 标签 + CUI);影像按 ImageDir 分 54 zip
7. 公开发布 BIMCV 平台 2019-01 arXiv → 2019-02 标签 CSV 定版 → 2020-12 MIA 期刊版;申请制 + RUA
8. 派生扩展 PadChest-GR(Microsoft 合作,2025) GPT-4 拆句翻译 + 14 名放射科医生 bounding box → NEJM AI 双语 grounded 子集

§4 数据结构详解

§4.0 目录结构预览

padchest_root/
├── PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv   # 主标签文件(33 字段,160,868 行)
├── Verify_Zips_ImageCounts.csv.xlsx                       # 各 zip 影像计数校验清单
├── zip_1/ ~ zip_54/                                       # 54 个影像压缩包(共约 1 TB)
└── images/                                                # 解压后建议的合并目录结构
    ├── 1/                                                 # ImageDir = 1
    │   ├── <ImageID>.dcm
    │   └── ...
    ├── 2/
    │   └── ...
    └── 54/
        └── ...

路径拼接关系:CSV 中每行由 ImageDir(文件夹编号)+ ImageID(文件名)唯一确定一张影像:

import os
img_path = os.path.join(data_root, str(row["ImageDir"]), row["ImageID"])

§4.1 DAIMS 标准化字段描述表

标识与人群字段

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ImageID string 影像文件名 “216840111366964012819207061112010001104100118_00-059-182.dcm” 影像定位主键 不允许缺失 唯一文件名
ImageDir int 所属 zip/文件夹编号 6 路径拼接 不允许缺失 1-54
StudyID string 检查标识 “66905584303276370465386546812104428462” 检查级聚合(同检查多视图) 不允许缺失 109,931 个唯一值
PatientID string 脱敏患者标识 “216840111366964012819207061112010001104100118” 分组划分主键 不允许缺失 67,625 个唯一值
PatientBirth int 出生年份 1953 年龄计算(配 StudyDate) 0-105 岁口径 部分缺失 1904-2017
PatientSex_DICOM string 性别 “M” 协变量/公平性 DICOM 录入误差 部分缺失 M / F

检查与采集字段

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
StudyDate_DICOM string 检查日期 “20170215” 时间窗/时代分析 系统记录 不允许缺失 2009-2017
ViewPosition_DICOM string DICOM 原始体位 “PA” 体位过滤 20,367 张缺失 缺失 → 由 ResNet-50 补全 PA / AP / L / …
Projection string 工作用体位分类(5 类) “PA” 体位分层(含自动推断值 自动分类存在误分 无显式标识推断来源 PA / L / AP / AP_horizontal / COSTAL
Pediatric string 儿科协议标记 “0” 儿科过滤 仅 ≤3 岁协议 0 / 1
PhotometricInterpretation_DICOM string 光度解释 “MONOCHROME2” 反色判断(MONOCHROME1 需反相) 设备相关 部分缺失 MONOCHROME1 / 2
WindowCenter_DICOM / WindowWidth_DICOM float 窗位/窗宽 “2048” / “4096” 灰度归一化 多设备不一 部分缺失 数值

报告与标注字段

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
ReportID string 报告标识 同 StudyID 派生 报告级聚合 不允许缺失
Report string 词干化预处理后的西班牙语报告片段 “sin infiltraciones pulmonar . silueta cardiaca normal .” NLP 任务(非原文!) 已经词干化/分词 少数为空 自由文本
MethodLabel string 标注来源 “Physician” 区分人工/自动标签 不允许缺失 Physician / 自动标注标识
Labels string(列表字面量) 发现/诊断多标签 “[‘lung infiltrates’, ‘atelectasis’]” 训练标签主字段 73% 为 NLP 弱标签 空列表 = 未标注/正常 193 类 + 4 特殊标签
Localizations string(列表字面量) 解剖定位 “[‘loc bilateral’, ‘loc apical’]” 定位感知建模 正则提取 可为空 104 类
LabelsLocalizationsBySentence string 句级标签-定位序列 “[‘lung infiltrates’, ‘loc bilateral’] …” 句级结构解析 顺序敏感 可为空 label 后接 0…n 个 loc
LabelCUIS / LocalizationsCUIS string UMLS CUI 映射 “[‘C0032285’]” 标准术语对齐 少数实体无 CUI 无 CUI 为空 UMLS CUI

§4.2 标签分布统计

影像发现 Top(论文 Section 4.2 计数)

标签 计数 备注
lung infiltrates(肺浸润) 19,850 其中间质型 7,001 / 肺泡型 7,637
aortic elongations/dilations 10,154 老龄化人群高频
pleural effusion 8,593
hilar enlargements 4,895
masses / nodules / pseudonodules 1,026 / 2,669 / 2,519 层级相关概念
fractures 3,367(820 人工)
tubes / catheters / electronic devices 10,776 / 6,167 / 4,286 器械类(报告常漏记,见坑点 1)

鉴别诊断 Top

标签 计数(人工标注部分)
COPD 14,557(3,017)
pneumonia 5,934(1,158)
heart insufficiency / pulmonary emphysema 高频(论文未给出计数)

检查级构成:正常 37,871 份(34.5%)/ 含 findings 或 diagnoses 68,855 份(62.6%)/ suboptimal ~1.8% / exclude ~1.2%。极端长尾:如右位心仅 14 例、Chilaiditi 征 14 例——174 个 findings 中大量类别样本 <100,罕见类别建模前必须按层级合并(见 §6.5 坑点 4)。

§4.3 关键字段描述性统计

  • 标注总量:177,628 个 findings + 27,726 个 diagnoses + 249,469 个解剖位置;人工标注部分分别为 45,375 / 5,472。
  • 每句平均 1.33 个标签(1-9);NLP 训练词表 9,691。
  • 体位:PA 96,010 / L 51,124 / AP-horizontal 14,355 / AP-vertical 5,158 / Costal 631 / Pediatric 274。
  • 年龄均值 58.5 ± 20,中位 62;每患者 1.62 ± 1.66 份检查、2.37 ± 2.34 张影像。
  • 分辨率:约 2254 × 2299 像素,0.16 mm/像素——显著高于多数降采样发布的开放胸片集。

§4.4 数据层级关系

PatientID(67,625 名患者)
  └─ StudyID / ReportID(109,931 份检查,每患者平均 1.62 份)
      ├─ ImageID(160,868 张影像,每检查平均 1.46 张,常含 PA+L 双视图)
      ├─ Report(1 份/检查,西班牙语词干化文本)
      └─ Labels(检查级标签 → 分配到该检查全部影像)
          └─ Localizations(与标签句级绑定,loc 前缀)

关键推论:标签挂在检查级而非影像级——同一次检查的 PA 与侧位影像共享同一组标签。按影像随机划分会把同一检查的正侧位拆到训练/测试两侧(见 §6.5 坑点 5)。

§4.5 缺失值情况与信息性缺失编码

缺失类型 字段示例 缺失原因 信息性缺失编码 对 AI 的影响
结构性缺失 ViewPosition_DICOM(20,367 张) DICOM 头未记录 已由 ResNet-50 推断补全(Projection 字段无推断标记) 体位标签可能含噪声
报告漏记(信息性缺失) 器械、慢性退变、术后痕迹类标签 放射科医生不系统报告此类所见 报告未描述 ≠ 影像不存在 此类标签假阴性率高;论文作者刻意保留以研究混杂
标注缺失 Labels 空值 正常检查或未标注 需区分 “normal” 特殊标签与真空值 误把正常当未标注会污染阴性池
UMLS 映射缺失 LabelCUIS 空 少数实体无 UMLS 对应词 医师标注但未赋码 术语对齐任务需过滤
文本预处理缺失 Report 为词干化片段 发布前预处理 非原文 不适合原文级语言建模

§5 数据划分与使用建议

§5.1 官方数据划分

PadChest 官方不提供 train/validation/test 划分。 论文未发布任何固定划分文件,社区也无公认的标准划分——这与 CheXpert(官方 valid/test)和 MIMIC-CXR(官方 split)不同,是使用 PadChest 与文献比较结果时的首要注意事项。TorchXRayVision 在其 PC_Dataset 中提供了加载接口,但划分仍需自行实现。

§5.2 推荐划分策略

  1. 按 PatientID 分组随机划分(必须):同一患者的全部检查、同一检查的全部视图必须落在同一侧。
  2. 可选:按 MethodLabel 分层评估——在 Physician 人工标注子集(39,039 张)上报告主指标,在自动标注子集上仅作训练或辅助评估(见 §6.5 坑点 3)。
  3. 可选:时间外验证——按 StudyDate_DICOM 以年份切分(如 2009-2015 训练 / 2016-2017 测试),模拟真实部署的时序泛化。
  4. 可选:体位分层——PA-only 训练是社区惯例(AP 与病情混杂);侧位可单列实验。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

df = pd.read_csv("PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv")
gss = GroupShuffleSplit(n_splits=1, test_size=0.1, random_state=42)
tr_idx, te_idx = next(gss.split(df, groups=df["PatientID"]))
train, test = df.iloc[tr_idx], df.iloc[te_idx]
assert set(train.PatientID).isdisjoint(test.PatientID)          # 患者级零泄漏
assert set(train.StudyID).isdisjoint(test.StudyID)              # 检查级零泄漏(推论成立)

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 按影像随机划分:同检查 PA+侧位、同患者多次检查被拆散(人均 1.62 检查、2.37 影像) GroupShuffleSplit(groups=PatientID),验证 PatientID/StudyID 双零交集
2 训练/测试混用 MethodLabel:测试集若含 NLP 弱标签,指标反映的是"标注器噪声"而非模型能力 主指标在 Physician 子集上报告
3 用 Report 文本特征训练、再用同报告派生的 Labels 评估 文本任务与影像任务分离;标签与文本同源,不得互相泄漏
4 层级标签上下泄漏:用父标签预测子标签时未阻断标签共现 层级建模时明确特征-目标依赖方向

§5.4 交叉验证建议

  • 标准:5 折按 PatientID 分组交叉验证。
  • 稳健性补充:以 StudyDate 年份为折叠轴做时间外验证(PadChest 标注器本身即采用 2014-2017 训练 / 2009-2013 测试的时间外设计,值得效仿)。

§5.5 外部验证

在 PadChest 上训练的模型,经典外部验证路径为:NIH ChestX-ray14 / CheXpert / MIMIC-CXR(跨机构、跨语言报告体系,TorchXRayVision 提供统一 18 病种标签对齐)、VinDr-CXR(越南,跨洲)、BIMCV-COVID19(同机构疫情期,概念漂移研究)。注意各数据集标签体系不同,需先映射到公共标签集(XRV 的 18 pathologies 是事实标准)。


§6 AI 就绪指南

§6.0 云端快速启动

零下载原型验证:安装 TorchXRayVision 后直接加载 PadChest 预训练 DenseNet-121(weights="pc"),对任意胸片做推理,5 分钟跑通首个预测,无需先下载 1 TB 数据。

# pip install torchxrayvision
import torchxrayvision as xrv
import skimage.io, torch, torchvision

model = xrv.models.DenseNet(weights="pc")   # PadChest 预训练,18 病种输出头
img = skimage.io.imread("any_chest_xray.png")
img = xrv.datasets.normalize(img, 255)
img = img.mean(2)[None, ...]
transform = torchvision.transforms.Compose([xrv.datasets.XRayCenterCrop(),
                                            xrv.datasets.XRayResizer(224)])
img = transform(img)
with torch.no_grad():
    out = model(torch.from_numpy(img)[None, ...])
print(dict(zip(model.pathologies, out[0].numpy())))

环境要求:CPU 可推理;训练建议 1 × 16 GB+ 显存 GPU。TorchXRayVision 的 PC_Dataset 加载器需配合官方 DICOM 解压目录使用(见 §6.1 目录约定)。

§6.1 快速上手

# ========================================
# PadChest 快速上手 — PyTorch + pydicom 版
# 环境要求: torch>=2.0, pydicom, pandas, numpy
#
# ⚠️ 目录结构预期:
#   请将 54 个 zip 解压并合并至 ./data/padchest/images/<ImageDir>/ 结构:
#   ./data/padchest/
#   ├── images/
#   │   ├── 1/*.dcm
#   │   ├── 2/*.dcm
#   │   └── ... (54 个文件夹)
#   └── PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv
#
#   影像路径 = data_root/images/{ImageDir}/{ImageID}
# ========================================
import os, ast
import numpy as np, pandas as pd, pydicom, torch
from torch.utils.data import Dataset, DataLoader

DATA_ROOT = "./data/padchest"
CSV = os.path.join(DATA_ROOT, "PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv")

df = pd.read_csv(CSV)
df = df[df["Projection"] == "PA"]                     # 惯例:先只用正位
df = df[~df["Labels"].isna()]
df["Labels"] = df["Labels"].apply(ast.literal_eval)   # Labels 是字符串化列表

# 常用做法:映射到 TorchXRayVision 18 病种公共标签集(此处以 4 类为例)
TARGET = {
    "atelectasis": ["atelectasis"],
    "pleural effusion": ["pleural effusion"],
    "cardiomegaly": ["cardiomegaly"],
    "pneumonia": ["pneumonia"],
}

def encode(labels):
    return torch.tensor([1.0 if any(k in labels for k in v) else 0.0
                         for v in TARGET.values()])

class PadChestDataset(Dataset):
    def __init__(self, frame, root, size=512):
        self.df, self.root, self.size = frame.reset_index(drop=True), root, size
    def __len__(self):
        return len(self.df)
    def __getitem__(self, i):
        r = self.df.iloc[i]
        path = os.path.join(self.root, str(r["ImageDir"]), r["ImageID"])
        ds = pydicom.dcmread(path)
        img = ds.pixel_array.astype(np.float32)
        if getattr(ds, "PhotometricInterpretation", "") == "MONOCHROME1":
            img = img.max() - img                       # 反色相校正(坑点 6)
        img = (img - img.min()) / (img.max() - img.min() + 1e-6)
        img = torch.from_numpy(img)[None]               # 1×H×W
        img = torch.nn.functional.interpolate(
            img[None], size=(self.size, self.size))[0]
        return img, encode(r["Labels"])

loader = DataLoader(PadChestDataset(df.head(2048), DATA_ROOT + "/images"),
                    batch_size=8, shuffle=True, num_workers=4)
imgs, ys = next(iter(loader))
print(imgs.shape, ys.shape)   # torch.Size([8, 1, 512, 512]) torch.Size([8, 4])

§6.2 数据获取流程

获取方式 链接/位置 大小 流程
官方完整版 https://bimcv.cipf.es/bimcv-projects/padchest/ → “Download Complete Dataset” ~1 TB(54 zips)+ 标签 CSV ① 在线填写申请表(姓名/机构/研究用途);② 同意 PADCHEST Dataset Research Use Agreement(不分享数据、不重识别、学术用途、规范引用);③ 经邮件获得下载链接;④ 下载全部 zip(社区经验:folders 1-50 与 54 等分段包,勿改原始目录名);⑤ 用 Verify_Zips_ImageCounts.csv.xlsx 核对各包影像数
PadChest-GR https://bimcv.cipf.es/bimcv-projects/padchest-gr/ 4,555 检查 同样申请制,独立 RUA
标注管线代码 https://github.com/auriml/Rx-thorax-automatic-captioning 代码 开源(report_preprocessor.ipynb 等)
TorchXRayVision pip install torchxrayvision 预训练权重 pc 权重与 PC_Dataset 加载器

RUA 核心义务:不得分享数据给未获授权者、不得尝试重识别、仅限学术研究(禁止商业用途)、发表时引用 Bustos et al. 2020。PadChest 与 PadChest-GR 协议独立,需分别申请。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开完整的 5 步预处理代码(DICOM → 训练就绪张量)</b></summary>

# 步骤 1:读 CSV、解析字符串化列表、基础过滤
import os, ast
import pandas as pd, numpy as np, pydicom, torch

df = pd.read_csv("PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv")
for col in ["Labels", "Localizations", "LabelCUIS"]:
    df[col] = df[col].apply(lambda s: ast.literal_eval(s) if isinstance(s, str) else [])

# 过滤特殊标签:exclude(无法提取信息)与 suboptimal(技术欠佳)默认剔除
df = df[~df["Labels"].apply(lambda x: "exclude" in x or "suboptimal study" in x)]

# 步骤 2:DICOM 读取 + 反色校正 + 窗位归一化(带磁盘缓存转 PNG/npy)
def load_dicom(path):
    ds = pydicom.dcmread(path)
    img = ds.pixel_array.astype(np.float32)
    if getattr(ds, "PhotometricInterpretation", "") == "MONOCHROME1":
        img = img.max() - img
    img -= img.min()
    img /= (img.max() + 1e-6)
    return img

# 步骤 3:统一分辨率(建议离线批量转换一次,缓存 512×512 float16 npy)
from pathlib import Path
def convert(row, src_root, dst_root, size=512):
    src = Path(src_root) / str(row["ImageDir"]) / row["ImageID"]
    dst = Path(dst_root) / f"{row['ImageDir']}_{row['ImageID']}.npy"
    if dst.exists():
        return
    img = load_dicom(src)
    t = torch.from_numpy(img)[None, None]
    t = torch.nn.functional.interpolate(t, size=(size, size), mode="bilinear")
    np.save(dst, t[0, 0].numpy().astype(np.float16))

# 步骤 4:标签编码(层级感知:将罕见子类合并到父类)
PARENT_MERGE = {
    "lung infiltrates": ["lung infiltrates", "interstitial pattern", "alveolar pattern"],
}
def encode_hier(labels, target_map):
    s = set(labels)
    return {k: float(any(vv in s for vv in v)) for k, v in target_map.items()}

# 步骤 5:患者级划分 + 人工标注测试集
from sklearn.model_selection import GroupShuffleSplit
phys = df[df["MethodLabel"] == "Physician"]        # 人工标注层做评估
gss = GroupShuffleSplit(n_splits=1, test_size=0.1, random_state=42)
tr, te = next(gss.split(df, groups=df["PatientID"]))
test_manual = df.iloc[te][lambda x: x["MethodLabel"] == "Physician"]

</details>

推荐直接使用社区成熟加载器替代手写:TorchXRayVision 的 xrv.datasets.PC_Dataset(统一标签映射、中心裁剪、224 resize)可省去步骤 1-4 的大部分工作。

§6.4 框架加载

# PyTorch:TorchXRayVision 官方加载器
import torchxrayvision as xrv
import torchvision

transform = torchvision.transforms.Compose([
    xrv.datasets.XRayCenterCrop(),
    xrv.datasets.XRayResizer(224),
])
d_pc = xrv.datasets.PC_Dataset(
    imgpath="./data/padchest/images",      # 解压后的 images 根目录
    csvpath="./data/padchest/PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv",
    transform=transform,
)
print(d_pc.pathologies)   # XRV 18 病种公共标签映射
# TensorFlow(经 tf.data + 预转换 npy 缓存)
import tensorflow as tf, glob, numpy as np

files = glob.glob("./cache_512/*.npy")
ds = (tf.data.Dataset.from_tensor_slices(files)
      .map(lambda f: tf.numpy_function(lambda p: np.load(p), [f], tf.float16),
           num_parallel_calls=tf.data.AUTOTUNE)
      .batch(16).prefetch(tf.data.AUTOTUNE))

§6.5 常见坑点

⚠️ 坑点 1:报告是金标准的唯一来源——“未描述"不等于"不存在”(分类:标签理解)

问题:PadChest 的标签全部从放射报告中提取。论文作者在 Limitation 中明确指出:医疗器械(起搏器、导管、假体)、慢性退变、术后痕迹等所见不会被放射科医生系统性写入报告——是否记录取决于临床上下文、申请科室甚至医生当时的工作量。

症状:器械类/慢性改变类标签的假阴性率显著高于其他标签;模型在这些类别上 AUC 虚低,且不同数据集间该类标签的流行率差异巨大。

解决:(1) 将 tubes/lines/devices/degenerative changes 等类别与临床发现类分开评估;(2) 作者刻意保留这些标签是供混杂因素研究——若你的目标是纯临床发现分类,可在标签层剔除器械类;(3) 论文结论处建议使用这些标签做混杂控制,而非当作干净的真值。

参考:Bustos et al. 2020, MIA 66:101797, Limitations 节。

⚠️ 坑点 2:把"影像发现"和"鉴别诊断"当同质标签训练与评估(分类:标签理解)

问题:cardiomegaly 凭影像即可断言,pneumonia 却需要临床信息——同一片浸润可能是肺炎、水肿或出血。PadChest 的 taxonomy 刻意区分二者(findings 树 vs diagnoses 树),但多数下游工作直接把 193 类压平成同一多标签任务。

症状:诊断类标签的 AUC 系统性低于发现类(模型只能学到影像-诊断间的统计捷径);与 CheXpert 类 14 标签数据集比较时口径混乱。

解决:(1) 训练与报告指标时分两组:findings vs diagnoses;(2) 对诊断类任务,考虑加入年龄、性别、体位等上下文输入以逼近"临床信息";(3) 遵循原论文 Advice:两类任务使用不同的方法与评估标准。

参考:Bustos et al. 2020, Conclusions/Advice 节:“the task of predicting cardiomegaly has been regarded as same type of problem as predicting pneumonia”——作者明确反对。

⚠️ 坑点 3:73% NLP 自动标签的噪声被 Macro-F1 掩盖(分类:标签理解)

问题:自动标注器独立测试 Micro-F1 高达 0.939,但 Macro-F1 仅 0.491——高频类标得准,罕见类噪声大。直接用全部 121,829 张自动标注影像评估罕见病模型,得到的主要是标注器误差。

症状:罕见标签上模型与"真值"一致性差;训练集自信学习的模型在 Physician 子集上评估指标骤降。

解决:(1) 用 MethodLabel 字段区分标注来源,测试集只用 Physician 子集(39,039 张);(2) 训练可用全量,但对罕见类考虑 Co-Teaching / DivideMix 等噪声鲁棒方法或层级合并;(3) 报告指标时注明评估子集的标注来源。

参考:Bustos et al. 2020, Table 4(RNN-ATT 独立测试:Accuracy 0.857 / MacroF1 0.491 / MicroF1 0.939)。

⚠️ 坑点 4:层级标签直接扁平化训练(分类:预处理陷阱)

问题:标签是 is-a 层级树(lung infiltrates → interstitial/alveolar pattern)。扁平化后父类与子类被当作独立类,父子标签天然共现,造成标签共线与双重惩罚;174 个 findings 又极端长尾(右位心仅 14 例)。

症状:模型对子类预测高、父类预测反而低;罕见叶类完全学不到;Macro 指标被几十个 <100 样本的类别拉垮。

解决:(1) 样本量不足的叶类向上合并到父类(§6.3 步骤 4 给出合并映射);(2) 进阶:层级损失(hierarchical BCE)、条件概率链式建模,或将层级作为评估时的距离度量;(3) 无论如何,在论文方法部分声明标签合并口径。

参考:Bustos et al. 2020, Section 3(taxonomy 设计)与 Advice 节(“explore models designed for dealing with labels having hierarchical relationships”)。

⚠️ 坑点 5:按影像随机划分导致患者/检查级泄漏(分类:数据泄漏)

问题:每患者平均 1.62 份检查、2.37 张影像;同一检查的 PA 与侧位共享同一组检查级标签。按影像随机划分会把同一患者的影像、甚至同一检查的正侧位拆到训练/测试两侧。

症状:测试集 AUC 虚高数个百分点;模型"记住"了患者而非学到病理。

解决:始终以 GroupShuffleSplit(groups=PatientID) 划分,并验证 PatientID 与 StudyID 双重零交集(§5.2 给出代码);若要评估视图泛化,可进一步按检查分组后只取单视图。

参考:Bustos et al. 2020, Table 9(每患者检查/影像频次)。

⚠️ 坑点 6:1 TB DICOM 工程陷阱——反色、位深与分辨率(分类:工程陷阱)

问题:影像为原始 DICOM:54 个 zip 共约 1 TB;PhotometricInterpretation 存在 MONOCHROME1(像素值越大越暗,不反相就是反色图);位深 12-16 bit 且各设备窗宽窗位不一;分辨率不统一(118-4280 px)。

症状:用 PIL/OpenCV 直接读 .dcm 报错;读出来图像整体反色;不同设备影像灰度分布差异巨大;解压到一半磁盘爆掉。

解决:(1) 预留 ≥1.5 TB 磁盘(zip + 解压共存);(2) 用 pydicom 读取并检查 MONOCHROME1 做反相(§6.1/§6.3 已含代码);(3) 按 DICOM 窗宽窗位或分位数归一化后离线批量转 512×512 npy/PNG 缓存;(4) 下载后用官方 Verify_Zips_ImageCounts 清单核对完整性。

参考:官方 GitHub README(54 zips / 1 TB / 校验清单);Bustos et al. 2020, Figure 1(DICOM 格式与未缩放策略)。

⚠️ 坑点 7:特殊标签与 Labels 字段解析(分类:预处理陷阱)

问题Labels 列是字符串化的 Python 列表"['atelectasis', 'pleural effusion']"),需 ast.literal_eval 解析;标签空间混有 4 个非病理特殊标签——normalexcludeunchangedsuboptimal studyLabels 为空与 normal 语义不同。

症状:直接 str.contains 匹配把 “unchanged” 误当病理标签;把空 Labels 当作"未标注"丢弃时连带丢掉大量正常片;exclude/suboptimal 影像混入训练。

解决:(1) ast.literal_eval 解析全部列表字段;(2) 训练前显式剔除 excludesuboptimal study(约 1.8% + 1.2%);(3) 正常片用 Labels == ['normal'] 显式选取,不要依赖空值;(4) unchanged 表示"与既往相比无变化",纵向任务保留、横断面分类通常剔除。

参考:Bustos et al. 2020, Section 3(四个特殊标签定义)。

⚠️ 坑点 8:Report 字段是词干化预处理文本 + 体位含模型推断值(分类:评估误用)

问题:(a)Report 字段已经词干化、分词、按 “.” 分句——不是原始西班牙语文本;(b)20,367 张影像的体位由 ResNet-50 自动分类补全,Projection 字段未标记哪些是推断值。

症状:用 Report 训练语言模型/报告生成得到的是词干碎片文本;按 PA-only 过滤时仍可能混入误分类的 AP 片(AP 与卧床/重症混杂,引入标签-体位捷径)。

解决:(1) 文本任务若需原文级语言,改用 PadChest-GR(GPT-4 拆分的完整单发现句,西/英双语);(2) 体位敏感的研究优先用 ViewPosition_DICOM 原始字段过滤,推断值单独标记或剔除;(3) 评估时按体位分层报告,警惕 AP↔病情混杂。

参考:官方 GitHub README(Report 预处理说明);Bustos et al. 2020, Section 2(ResNet-50 体位补全);Coelho de Castro et al. 2025, NEJM AI(PadChest-GR)。

版本提示:PadChest 自 2019-02-01 标签 CSV 定版后无版本更新;论文内部存在若干数字不一致(findings 数 174 vs 170、性别计数 Table 8 与正文相反、初始影像数 168,861 vs 168,171、实体总数 299 vs 297)——引用时请以论文表格数字为准,并在方法部分注明口径。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
小幅旋转(±7°)、平移、缩放 水平翻转——心脏左位是诊断先验,翻转会产生"右位心"伪标签(数据集中真实右位心仅 14 例)
亮度/对比度小幅抖动 弹性形变改变心胸比(cardiomegaly 标签直接失真)
高斯噪声 跨检查的 Mixup(正侧位混合破坏视图语义)
RandAugment(保守幅度) 对文本字段的任何"同义替换"(西班牙语文本已词干化)
按体位分组做类均衡采样 打乱 LabelsLocalizationsBySentence 的句级顺序

§6.7 模型推荐

任务 推荐 backbone 训练方案 预期性能(PadChest 口径)
快速基线 DenseNet-121(ImageNet 或 XRV pc 权重) 224 px,PA-only,加权 BCE 高频发现类 AUC 0.85-0.97(XRV 基准口径)
标准多标签 ResNet-50(512 px 输入) 层级合并标签 + 患者级划分 XRV res512-all:Effusion 0.95 / Cardiomegaly 0.94 / Hernia 0.95
层级标签建模 任意 CNN + hierarchical BCE 父子条件损失 叶类 Macro-F1 显著优于扁平基线
报告分类(西语) 复现 RNN-ATT(biLSTM+attention) FastText 100d 西语向量 Micro-F1 ~0.93(原论文口径)
Grounded 报告生成 MAIRA-2 / RadVLM 类 VLM PadChest-GR 微调 见 PadChest-GR 文献(NEJM AI 2025)
自监督预训练 ResNet/ViT + MAE/DINO 全量 16 万原图 下游小数据集迁移增益显著

§6.8 计算资源需求

硬件 最小配置 推荐配置
磁盘 1.5 TB(zip + 解压) 2 TB(含 512px 缓存副本)
内存 32 GB(流式读取) 64 GB
GPU 1 × 11 GB(224 px DenseNet) 1 × 24 GB(512 px ResNet-50 / 多任务)
训练时间 224 px 基线约 1-2 天(单卡) 512 px 全量约 3-5 天
预转换 16 万 DICOM → 512 npy 约需数小时(多进程) 一次性投入,强烈建议

§6.9 评估指标

from sklearn.metrics import roc_auc_score, average_precision_score, f1_score
import numpy as np

def multilabel_eval(y_true, y_prob, names, thr=0.5):
    aucs = {}
    for i, n in enumerate(names):
        if len(np.unique(y_true[:, i])) < 2:
            aucs[n] = np.nan                     # 长尾类可能测试集内无阳性
            continue
        aucs[n] = roc_auc_score(y_true[:, i], y_prob[:, i])
    print("Macro-AUROC:", np.nanmean(list(aucs.values())))
    print("Macro-AUPRC:", np.nanmean([
        average_precision_score(y_true[:, i], y_prob[:, i])
        for i in range(len(names)) if len(np.unique(y_true[:, i])) > 1]))
    print("Micro-F1:", f1_score(y_true, (y_prob > thr).astype(int), average="micro"))
    print("Macro-F1:", f1_score(y_true, (y_prob > thr).astype(int), average="macro"))
    return aucs

社区共识:影像分类报 per-class AUROC + Macro/Micro 平均(长尾类必须说明阳性数);文本标注任务沿用原论文 Accuracy / Macro-F1 / Micro-F1 / Weighted-F1 四指标;PadChest-GR 报告生成任务采用 RadGraph F1 / GREEN / 定位精度等 GRRG 指标。

§6.10 MLOps 笔记

  • 版本锁定:方法部分注明标签文件版本(PADCHEST_chest_x_ray_images_labels_160K_01.02.19.csv)与访问日期;该数据集无版本演进,但下载页内容可能微调。
  • 引用要求:RUA 要求引用 Bustos et al. 2020(DOI: 10.1016/j.media.2020.101797);使用 PadChest-GR 时须同时引用 Coelho de Castro et al. 2025(DOI: 10.1056/AIdbp2401120)。
  • 评估口径声明:必须注明评估子集的 MethodLabel(Physician vs 全部)、体位过滤(PA-only vs 全部)、标签合并口径——三者的差异可使绝对数值不可比。
  • 体位混杂监控:AP 片与重症相关,部署前按体位分层检查模型输出分布(PSI)。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
单中心偏倚 西班牙阿利坎特单家大学附属医院,2009-2017 跨数据集外部验证(NIH/CheXpert/MIMIC/VinDr)
语言/报告风格偏倚 全部西班牙语报告,该院 18 名放射科医生的书写风格 文本任务跨语言验证;标注器跨院泛化未经证实(论文自陈)
信息偏倚(报告金标准) 影像异常未必写入报告;器械/慢性改变系统性漏记 高(作者自陈) 分标签类别评估;见 §6.5 坑点 1
选择偏倚(PACS 可检索) 仅纳入能检索到报告的检查;yes/no 型检查常无报告 中高(作者自陈) 声明人群边界;与其他机构流行率比较时谨慎
NLP 弱标签偏倚 73% 标签来自 Macro-F1 0.49 的标注器,罕见类噪声大 中高 评估用 Physician 子集;噪声鲁棒训练
年龄偏倚 均值 58.5、中位 62 的高龄人群;儿科仅 274 张 成人任务限定;儿科勿用
体位混杂偏倚 AP-horizontal(床旁)与病情严重度相关;20,367 张体位为模型推断 PA-only 惯例 + 分层评估
时代偏倚 2009-2017 年设备与诊疗实践;疫情前时间窗 低-中 与当代数据联合训练时声明

§7.2 标注质量评估

标注层 可靠性 一致性 局限性
Physician 人工标注(39,039 张) 高(经培训医师 + taxonomy 审核) 论文未报告标注者间一致性指标 人数未披露;无双阅/仲裁流程披露
NLP 自动标注(121,829 张) Micro-F1 0.939 / Macro-F1 0.491 时间外测试验证(2009-2013) 罕见类噪声显著;跨院泛化未验证
解剖定位(正则提取) 规则系统,精度未单独报告 复杂句式的定位可能错位
体位推断(ResNet-50) 未报告该模型在 PadChest 上的精度 20,367 张可能误分类
PadChest-GR bounding box(派生) 14 名放射科医生,每发现最多两套独立框 双读设计 仅 4,555 检查

§7.3 泛化性讨论

场景 失效风险 证据
跨机构(San Juan → 美国数据集) XRV 交叉评估显示模型跨机构迁移普遍损失;PadChest 论文引用 Zech 2018 警告 CNN 会利用机构间流行率差异走捷径
跨语言(西语标注器 → 他院西语报告) 未验证 论文明示:标注器泛化性"需用其他西班牙机构报告确认"
跨标签体系(PadChest 193 类 ↔ XRV 18 类) 层级合并与语义对齐存在人工判断;不同映射口径结果不可比
跨时间(2009-2017 → 疫情后) 疫情前时间窗对 COVID 是对照优势,但设备与报告风格已演进
跨人群(成人 → 儿科) 儿科协议仅 274 张(0.16%),儿科任务不可用

§7.4 伦理考量

  1. 数据来自真实患者,项目经 San Juan 医院机构研究委员会批准,由 BIMCV-CSUSP 与医院卫生信息部门完成匿名化与去标识化。
  2. RUA 明确禁止重识别尝试与数据再分发;商用需另行授权。
  3. 报告文本虽已词干化且经去标识化,仍属临床文档,使用时应保持对患者与家属的尊重。
  4. 高龄人群占主导(中位 62 岁),在年轻人群体上部署模型前需额外验证;儿科影像极少量,不得据此训练儿科模型。

§7.5 公平性评估

from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=test_df["PatientSex_DICOM"],   # M / F
)
print(frame.by_group)

# 年龄分层(PadChest 人群显著高龄化)
test_df["age_group"] = pd.cut(test_df["age"], [0, 50, 65, 80, 106])
frame_age = MetricFrame(metrics={"AUROC": roc_auc_score},
                        y_true=y_test, y_pred=y_prob,
                        sensitive_features=test_df["age_group"])
print(frame_age.by_group)

已知公平性线索:性别按影像计基本均衡(男 80,923 / 女 79,923);但 43-60 岁段女性影像更多、71-75 岁段男性更多——年龄×性别联合分层下的标签流行率存在差异,子群 AUROC 比较时需注意阳性数是否充足。

§7.6 数据漂移提示

  • 训练分布停留在 2009-2017 年的西班牙单中心:DR 设备代际、报告模板与诊疗实践均已演进。
  • 监控信号:输入影像灰度/分辨率分布 PSI、体位构成变化(床旁 AP 比例)、标签流行率漂移(如疫情后肺炎标签构成剧变)。
  • 库内天然"时间外验证"设计(2014-2017 vs 2009-2013)可直接复用为漂移鲁棒性测试台。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 标签 CSV 每行一张影像
2 有唯一标识符列 ImageID / PatientID / StudyID / ReportID 四级标识
3 无 Unicode 或特殊字符 ⚠️ 西班牙语文本含 á/é/í/ó/ú/ñ 及分词符号,需 UTF-8 正确处理
4 无重复行 ⚠️ 同检查多视图与重复曝光未提供去重文档,需按 StudyID 自查
5 缺失值已识别并编码 ⚠️ 部分 DICOM 字段缺失(体位 20,367 张),缺失无统一编码
6 标签列被明确标识 Labels / LabelCUIS / MethodLabel 语义清晰
7 已对罕见类别(<3%)进行分组 ⚠️ 174 findings 长尾未分组(右位心等 14 例),需自行层级合并
8 偏倚评估已完成 §7.1 八类偏倚 + 原论文 Limitation 节自陈三大局限
9 有完整的数据字典 33 字段说明文件 + 论文 Table 6 逐字段定义
10 对"信息性缺失"有明确编码解释 报告漏记偏倚由作者明示并刻意保留(§4.5)
11 数据采集设备和设置已记录 DICOM 头完整保留(厂商/曝光/窗宽窗位/分辨率)
12 已移除完全共线性变量 ⚠️ 层级父子标签天然共线,未处理
13 对编码的映射标准已说明 UMLS CUI 全量映射;无对应词条者已声明
14 对时间戳的处理已明确说明 ⚠️ StudyDate 保留日期粒度;脱敏时间处理细节披露有限
15 训练/验证/测试划分建议已给出 无官方划分,社区无标准划分
16 数据泄漏风险已被讨论 §5.3 四种 PadChest 特有泄漏模式
17 标签分布已被分析 §4.2 高频标签计数与检查级构成
18 选择性测量偏倚已被讨论 PACS 可检索报告选择偏倚(作者自陈)
19 外部验证建议已给出 §5.5 + §7.8 跨数据集验证矩阵
20 数据更新和版本信息已记录 ⚠️ 2019-02 定版后无版本机制;论文内部数字不一致需注意
21 最小必要预处理脚本已提供 ⚠️ 官方仅公开标注管线代码;图像预处理依赖 TorchXRayVision 社区方案
22 合规使用要求已明确 RUA:学术用途 / 禁再分发 / 禁商用 / 禁重识别 / 引用要求
23 多模态对齐方法已说明 ⚠️ Report↔影像经 ReportID/StudyID 对齐;文本为词干化版本而非原文
24 去标识化方法已被记录 ⚠️ BIMCV 匿名化声明明确,但技术细节披露有限

DAIMS 评分:18 / 24

评分解读良好——标签语义设计与文档化出色,工程就绪度存在明显缺口(无官方划分、无官方图像预处理脚本、1 TB 原始 DICOM)。

对你意味着什么:PadChest 的 ✅ 集中在标签体系与合规文档——UMLS 全量映射、33 字段字典、作者自陈的三大局限、清晰的 RUA,这在同时代胸片数据集中属上乘。扣分集中在"开箱即用性":无官方 train/test 划分(自行按 PatientID 分组,§5.2 有代码)、无官方图像预处理(用 TorchXRayVision 的 PC_Dataset)、罕见标签未分组(按 §6.5 坑点 4 层级合并)、文本为词干化版本(原文级 NLP 请改用 PadChest-GR)。建议训练前执行:(1) 剔除 exclude/suboptimal study 并按 PatientID 划分;(2) 评估集锁定 Physician 子集;(3) 罕见叶类向上合并;(4) MONOCHROME1 反色检查与离线 512px 缓存。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
PadChest 内部(对照基线) San Juan de Alicante 15 病种多标签 ResNet512-all 平均 AUC ~0.88(XRV 基准) “-all” 权重含 PadChest 训练数据,属部分域内评估
NIH ChestX-ray14 NIH(美国) XRV 跨库评估 DenseNet121-all 平均 AUC 85.8%(CodeSOTA 口径) 相对 PadChest 约 -1 ~ -3% 跨机构、跨语言报告体系迁移损失可控但存在
CheXpert Stanford(美国) XRV 跨库评估 平均 AUC 87.4%(CodeSOTA 口径) 约持平 同为 NLP 弱标签体系,迁移性较好
7 病种 VLM 研究(2025) 多机构 zero-shot / fine-tune MacroAvg AUC:ZS 0.785 / FT 0.786 zero-shot 显著低于域内 视觉-语言模型在 PadChest 上 FT 增益有限的反直觉发现
CheXpert 模型 → PadChest(zero-shot) Stanford 模型在西班牙数据 5 共享病种 CheXpert-DenseNet121-ensemble 平均 AUC ~0.91 相对其域内下降约 2-4% 美式英语标注模型可直接迁移到 PadChest 共享病种

约束:本矩阵仅收录有公开论文/官方基准支撑的评估结果。不同行的标签集、划分与预处理口径不同,绝对数值不可横向直接比较;XRV “-all” 模型训练数据包含 PadChest,解读时请视为部分域内。


§8 基准性能与生态

§8.1 排行榜

PadChest 无官方排行榜与固定划分,社区事实基准来自 TorchXRayVision 的跨数据集评估体系(按统一预处理在 PadChest 15 个可映射病种上计算 AUC,3 个随机种子平均)。

可比组(TorchXRayVision BENCHMARKS.md 口径,15 病种平均 AUC)

排名 模型 平均 AUC(15 病种) 年份 关键技术 完整引用 代码
1 XRV-ResNet50-res512-all ~0.88 2021 512 px ResNet-50,全数据集联合训练,18 病种统一输出头 Cohen JP et al. “TorchXRayVision: A library of chest X-ray datasets and models.” arXiv:2111.00595;评估口径见 arXiv:2002.02497 https://github.com/mlmed/torchxrayvision
2 XRV-DenseNet121-res224-all ~0.85 2021 224 px DenseNet-121,全数据集联合训练 同上 同上
3 XRV-DenseNet121-pc(PadChest 单集训练) 官方未公布单集均值 2021 仅 PadChest 训练的 DenseNet-121 权重 同上 xrv.models.DenseNet(weights="pc")

外部模型 zero-shot → PadChest(BENCHMARKS.md 同口径)

模型(训练数据) 共享标签数 代表 AUC 完整引用 代码
CheXpert-DenseNet121-ensemble 5 Effusion 0.97 / Edema 0.97 / Cardiomegaly 0.92 / Consolidation 0.88 / Atelectasis 0.82 Irvin J et al. “CheXpert.” AAAI 2019(模型);评估见 arXiv:2002.02497 torchxrayvision.baselinemodels
jfhealthcare-DenseNet121 5 Effusion 0.96 / Edema 0.94 / Cardiomegaly 0.89 同上 同上

其他口径代表工作(不可与上表直接比较)

模型 性能指标 年份 关键技术 完整引用
RNN-ATT 报告标注器(原论文) 独立测试 Micro-F1 0.939 / Macro-F1 0.491 2020 biLSTM 2×128 + label-wise attention + FastText Bustos A et al. “PadChest.” Medical Image Analysis 66:101797 (2020). DOI: 10.1016/j.media.2020.101797
XRV DenseNet ZS/FT(7 病种) MacroAvg AUC:ZS 0.785 / FT 0.786 2025 多模态 VLM 泛化性研究,PadChest 为目标集之一 “Multimodal vision-language models in chest x-ray analysis.” BioMedical Engineering OnLine (2025). DOI: 10.1007/s13534-025-00535-y

不可比警告:(1) XRV “-all” 模型训练数据含 PadChest,其 PadChest 指标为部分域内;(2) 各工作病种集合(15/7/5)、划分策略(随机/患者级)、预处理(224/512px)均不同;(3) 原论文未发布图像分类基线——任何声称"PadChest 官方基线"的数字都应存疑。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
快速出基线 XRV pcall 权重 + 自己的患者级划分 免训练即有 18 病种输出;与社区结果可比
训练多标签分类器 ResNet-50 @512px + 层级合并标签 + Physician 子集评估 对齐 XRV res512 口径,标签噪声可控
报告生成研究 PadChest-GR 唯一的双语 grounded CXR 报告数据集(NEJM AI 2025)
西班牙放射 NLP 复现 RNN-ATT + FastText 西语向量 原论文完整公开超参(batch 1024 / lr 1e-2 / dropout 0.4)
方法学研究(泛化/偏倚) PadChest + NIH + CheXpert 联合(XRV 统一接口) 跨语言、跨机构、跨标签体系的三重对照

§8.3 官方评测协议

无官方图像评测协议。原论文仅定义文本标注器的评测:训练/验证取 2014-2017 年人工标注句(20,439/2,271 句),独立测试取 2009-2013 年 500 句,指标为 Accuracy / Macro-F1 / Micro-F1 / Weighted-F1。影像任务社区惯例:患者级划分 + Physician 子集评估 + per-class AUROC。

数据集 关系 说明
PadChest-GR 官方派生 4,555 检查双语 grounded 报告 + bounding box(NEJM AI 2025)
BIMCV-COVID19 / COVID19+ 同机构姊妹集 沿用 PadChest 标注方法学的疫情期数据;PadChest 为其疫情前对照
chestViewSplit 配套工具 官方用于补全体位的 ResNet-50 模型
CheXpert / MIMIC-CXR / NIH ChestX-ray14 同类对照 英语生态三大胸片集,XRV 统一标签接口
VinDr-CXR 同类(非英语) 越南语场景 + 全人工 bounding box
OpenI (Indiana) 早期小规模 3,996 份英语报告,常被用作报告生成教学集

§8.5 关键论文 Top 10

  1. Bustos A, Pertusa A, Salinas JM, de la Iglesia-Vayá M (2020), Medical Image Analysis 66:101797. “PadChest: A large chest x-ray image dataset with multi-label annotated reports.” — 数据集本体,权威引用入口。DOI: 10.1016/j.media.2020.101797
  2. Coelho de Castro D, Bustos A, Bannur S, et al. (2025), NEJM AI 2(7). “PadChest-GR: A Bilingual Chest X-Ray Dataset for Grounded Radiology Report Generation.” — 首个双语 grounded 报告数据集,14 名放射科医生 bounding box。DOI: 10.1056/AIdbp2401120
  3. Cohen JP, Viviano JD, Bertin P, et al. (2022). “TorchXRayVision: A library of chest X-ray datasets and models.” — PadChest 事实基准与预训练权重生态。arXiv:2111.00595
  4. Cohen JP, Morrison P, Dao L, et al. (2020). “Predicting COVID-19 Pneumonia Severity on Chest X-ray With Deep Learning.” — 其附录定义了 XRV 跨库 AUC 评估口径(含 PadChest 基准数)。arXiv:2002.02497
  5. Mullenbach J, Wiegreffe S, Duke J, Sun J, Eisenstein J (2018), NAACL. “Explainable Prediction of Medical Codes from Clinical Text.” — label-wise attention(CAML),PadChest RNN-ATT 标注器的直接技术源头。DOI: 10.18653/v1/N18-1100
  6. Zech JR, Badgeley MA, Liu M, Costa AB, Titano JJ, Oermann EK (2018), PLoS Medicine 15(11):e1002683. “Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs.” — PadChest 论文引用的泛化性警告经典。DOI: 10.1371/journal.pmed.1002683
  7. Vayá M de la I, Saborit JM, Montell JA, et al. (2020), IEEE Access 8:191911-191922. “BIMCV COVID-19+: a large annotated dataset of RX and CT images from COVID-19 patients.” — PadChest 方法学的疫情期延续。DOI: 10.1109/ACCESS.2020.3034318
  8. Irvin J, Rajpurkar P, Ko M, et al. (2019), AAAI 33:590-597. “CheXpert: A Large Chest Radiograph Dataset with Uncertainty Labels and Expert Comparison.” — 同时代英语对照集。DOI: 10.1609/aaai.v33i01.3301590
  9. Johnson AEW, Pollard TJ, Berkowitz SJ, et al. (2019), Scientific Data 6:317. “MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports.” — 英语报告生态对照。DOI: 10.1038/s41597-019-0322-0
  10. Bustos A (2020), 阿利坎特大学博士论文(RUA 仓储). “Extraction of medical knowledge from clinical reports and chest x-rays using machine learning techniques.” — PadChest 构建全过程的最详尽一手记录。http://hdl.handle.net/10045/102193

§8.6 社区活跃度

维度 数据
Semantic Scholar 引用(PadChest 论文) 862(截至 2026-09-05 实时查询)
OpenAlex 引用 697(截至 2026-09-05 实时查询)
Scopus/WoS 口径 527(OUCI 快照)
TorchXRayVision 集成 PC_Dataset + pc 预训练权重 + autoencoder(含 PadChest 训练)
派生数据集 PadChest-GR(2025,Microsoft 合作,NEJM AI)
标注管线开源 auriml/Rx-thorax-automatic-captioning(含 BIMCV-COVID19 适配)

§8.7 生态快照

资源 类型 链接 Star/Fork(截至 2026-09,约) 为什么值得关注
TorchXRayVision 工具库 https://github.com/mlmed/torchxrayvision 3,000+ / 700+ PC_Dataset 一行加载 + pc 预训练权重 + 跨库统一 18 标签;PadChest 上手的最短路径
auriml/Rx-thorax-automatic-captioning 官方代码 https://github.com/auriml/Rx-thorax-automatic-captioning 活跃 标注管线官方实现:report_preprocessor / multilabel_text_classifier,含 COVID 适配
xinario/chestViewSplit 官方工具 https://github.com/xinario/chestViewSplit 官方体位补全模型(ResNet-50),复现 Projection 字段必备
BIMCV PadChest 主页 官方平台 https://bimcv.cipf.es/bimcv-projects/padchest/ 申请入口、RUA、校验清单、字段说明的权威来源
PadChest-GR 主页 官方派生 https://bimcv.cipf.es/bimcv-projects/padchest-gr/ grounded 报告生成研究的唯一双语资源

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) 数据集论文(RUA 要求引用)
@article{bustos2020padchest,
  title={PadChest: A large chest x-ray image dataset with multi-label annotated reports},
  author={Bustos, Aurelia and Pertusa, Antonio and Salinas, Jose-Maria and de la Iglesia-Vay{\'a}, Maria},
  journal={Medical Image Analysis},
  volume={66},
  pages={101797},
  year={2020},
  publisher={Elsevier},
  doi={10.1016/j.media.2020.101797}
}

% 2) 如使用 PadChest-GR
@article{coelho2025padchestgr,
  title={PadChest-GR: A Bilingual Chest X-Ray Dataset for Grounded Radiology Report Generation},
  author={Coelho de Castro, Daniel and Bustos, Aurelia and Bannur, Shruthi and Hyland, Stephanie L. and Bouzid, Kenza and Wetscherek, Maria Teodora and others},
  journal={NEJM AI},
  volume={2},
  number={7},
  year={2025},
  doi={10.1056/AIdbp2401120}
}

% 3) 如使用 TorchXRayVision 加载器或预训练权重
@article{cohen2022torchxrayvision,
  title={TorchXRayVision: A library of chest X-ray datasets and models},
  author={Cohen, Joseph Paul and Viviano, Joseph D. and Bertin, Paul and Morrison, Paul and Torabian, Parsa and Guarrera, Matteo and Lungren, Matthew P. and Chaudhari, Akshay and Brooks, Rupert and Hashir, Mohammad and Bertrand, Hadrien},
  journal={Medical Imaging with Deep Learning},
  year={2022},
  note={arXiv:2111.00595}
}

教程与学习资源

原始论文

  1. Bustos A et al. (2020). “PadChest: A large chest x-ray image dataset with multi-label annotated reports.” Medical Image Analysis 66:101797. DOI: 10.1016/j.media.2020.101797. PMID: 32877839. PMCID: 见 PubMed 记录。
  2. Coelho de Castro D et al. (2025). “PadChest-GR: A Bilingual Chest X-Ray Dataset for Grounded Radiology Report Generation.” NEJM AI 2(7). DOI: 10.1056/AIdbp2401120.
  3. Vayá M de la I et al. (2020). “BIMCV COVID-19+.” IEEE Access 8:191911-191922. DOI: 10.1109/ACCESS.2020.3034318.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索:官方页面与 RUA、论文全文数字核对、Semantic Scholar/OpenAlex 引用快照、TorchXRayVision 基准、PadChest-GR 核实

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 Bustos et al. 2020 原始论文(ar5iv 全文)、BIMCV 官方页面、GitHub 官方仓库与 TorchXRayVision 基准文档中整理结构化信息;(2) 生成 §6 的 Python/PyTorch 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph;(6) 通过 Semantic Scholar 与 OpenAlex API 实时核实引用数。

§10.3 输入来源

  1. Bustos et al. (2020), Medical Image Analysis 66:101797 — PadChest 原始论文(DOI: 10.1016/j.media.2020.101797)
  2. arXiv:1901.07441 ar5iv 全文版(Table 7/8/9 精确数字、标注器超参、Limitation/Advice 节)
  3. BIMCV PadChest 官方主页与 RUA 文本
  4. auriml/Rx-thorax-automatic-captioning GitHub README(54 zips / 1 TB / 33 字段清单 / 校验文件 / 报告预处理说明)
  5. Semantic Scholar Graph API 实时引用查询(862,2026-09-05)
  6. OpenAlex API 实时引用查询(697,2026-09-05)
  7. OUCI(Scopus/WoS 引用快照 527)
  8. TorchXRayVision BENCHMARKS.md(PadChest 15 病种 AUC 矩阵)与 README(pc 权重说明)
  9. Cohen et al. (2022), TorchXRayVision(arXiv:2111.00595)
  10. Coelho de Castro et al. (2025), NEJM AI 2(7) PadChest-GR(DOI: 10.1056/AIdbp2401120;arXiv:2411.05085)
  11. BioMedical Engineering OnLine (2025) 多模态 VLM 泛化研究 Table 13(DOI: 10.1007/s13534-025-00535-y)
  12. Bustos A (2020) 博士论文 RUA 仓储记录(hdl.handle.net/10045/102193)
  13. EditGRPO(arXiv:2509.22812)对 PadChest RUA 条款的转述核实
  14. xinario/chestViewSplit(体位补全模型)
  15. 社区工程实践记录(foreign-object-anomaly-detection / DenseNet_Foreign_Object_Detection 的下载与解压流程说明)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、findings vs diagnoses 区分、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(规模数字、体位分布、版本矩阵) 千方病案医学编辑部 与原论文 Table 7/8/9 及官方页面交叉比对 ✅ 已验证
§4 数据结构(33 字段、层级标签、缺失编码) 千方病案医学编辑部 与官方 GitHub 字段清单交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与原论文及官方 README 比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与 XRV 基准文档及 API 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集