信息速览
INFOBOX
| 数据集名称 | MedPix |
| 英文全称 | MedPix: NLM Medical Image Teaching Database |
| 别名 / 简称 | MedPix、MedPix-2.0(结构化 AI 版本)、VQA-RAD(视觉问答衍生集)、MEDPIX-ClinQA |
| 疾病分类 | 全系统覆盖(按 ACR 编码体系)——涵盖神经放射学、胸部影像、腹部影像、骨骼肌肉、泌尿生殖、乳腺影像、心血管、头颈部、儿科、核医学等全部 ACS 编码分类 |
| SNOMED CT | MedPix 覆盖数百种疾病的影像学表现,具体 SNOMED CT 映射随病例诊断而异,无统一映射表(教学数据库的特性所决定) |
| 数据模态 | 影像(CT、MRI、X 光、超声、核医学、病理、眼科影像)+ 结构化文本(诊断、现病史、影像发现、鉴别诊断、疾病讨论) |
| AI 任务类型 | 图像分类、跨模态检索、视觉问答 (VQA)、图像描述生成、知识图谱推理、临床文本生成、对比学习预训练 |
| 样本总数 | 原始 MedPix:约 59,000 张图像 / 12,000+ 个患者病例 / 9,000+ 个临床主题。MedPix-2.0:2,050 例结构化病例(含 CT 和 MRI 图像) |
| 数据大小 | MedPix-2.0:~322 MB(images.zip)+ ~4.4 MB(JSON)/ VQA-RAD:~3.2 GB(含 Parquet)/ 原始 MedPix:不可直接下载(网页浏览) |
| 数据格式 | 原始 MedPix:JPG/PNG + 半结构化网页文本。MedPix-2.0:PNG 图像 + JSON 文档(Case_topic.json + Descriptions.json)+ MongoDB 数据库 |
| 许可证 | 原始 MedPix:非 CC——个人使用及本地教学免费,其他用途需联系原始贡献者。MedPix-2.0:MIT License (GitHub)。VQA-RAD:CC0 1.0 Universal |
| 访问级别 | 开放浏览(MedPix 网站)/ 开放下载(GitHub + Zenodo + HuggingFace) |
| DUO 标签 | NRES(MedPix-2.0, MIT)/ NRES(VQA-RAD, CC0)/ NPUNCU(原始 MedPix,非商业使用) |
| 语言 | 英文(全部病例报告、影像描述和疾病讨论) |
| 首发日期 | 1984(原始 MedPix 创建)/ 2016-02(NLM 新版网页上线)/ 2024-06-30(MedPix-2.0 Zenodo 存档) |
| 最后更新 | 2025-07-17(MedPix-2.0 arXiv v5 更新,含 DR-Minerva KG 扩展) |
| 发布机构 | 原始 MedPix:NLM/NIH(美国国立医学图书馆/国立卫生研究院),创始人 James G. Smirniotopoulos, MD(Uniformed Services University)。MedPix-2.0:University of Palermo, Italy(巴勒莫大学工程系) |
| 官方主页 | https://medpix.nlm.nih.gov/home(原始) |
| 下载地址 | MedPix-2.0 GitHub: https://github.com/CHILab1/MedPix-2.0 / Zenodo: https://zenodo.org/records/12624810 / VQA-RAD HuggingFace: https://huggingface.co/datasets/flaviagiammarino/vqa-rad |
| DOI | MedPix-2.0: 10.1007/s41019-025-00297-8 / VQA-RAD: 10.1038/sdata.2018.251 |
| 引用次数 | VQA-RAD: 550+(Google Scholar,截至 2026-07)/ MedPix-2.0: 15+(Google Scholar,2024 发布,截至 2026-07) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 原始 MedPix 为教学平台非 AI 数据集;MedPix-2.0 (2,050 例, JSON 结构化, 有划分) 部分就绪;VQA-RAD (315 张, CC0) 完全就绪但规模有限 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ACR 编码体系、临床任务定义、教学病例金标准)、§7 偏倚分析(教学选择偏倚、贡献者偏倚)。
数据工程审核者:[千方病案医学编辑部交叉审核]:§4 DAIMS 数据字典(MedPix-2.0 JSON schema 两表)、§5 数据划分策略(MedPix-2.0 splitted_dataset / VQA-RAD 划分)、§6 预处理 Pipeline 与坑点(PNG 格式限制、JPG 压缩损失、MongoDB 查询复杂度)。
审核日期:2026-07-29
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。MedPix 原始数据库中病例由全球志愿者贡献——诊断准确性因贡献者资质而异,不得视为经统一验证的医学金标准。任何基于 MedPix 训练数据集的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守各版本的原始许可协议。原始 MedPix (medpix.nlm.nih.gov) 的内容仅供个人使用和本地教学,商业用途和再分发受严格限制。MedPix-2.0 使用 MIT License,VQA-RAD 使用 CC0 1.0 Universal——二者可自由用于 AI 研究和模型训练。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
MedPix 是美国国立医学图书馆(NLM/NIH)自 1984 年起维护的免费放射影像教学数据库——比 DICOM 标准制定(1993)早了近十年,比大多数当代 AI 数据集早了三十多年。它最初是军人放射科住院医师的教学工具,由 Dr. James G. Smirniotopoulos 在 Walter Reed 陆军医学中心创建,至今已积累约 59,000 张医学图像、12,000 个患者病例和 9,000 个临床主题。
它的不可替代性在于它生来就是为教学而设计的数据——每个病例都包含完整的诊断、现病史、影像发现、鉴别诊断、疾病讨论和专家审阅意见,这种"临床叙事+影像"的配对结构天然契合多模态 AI 训练。2024 年,意大利巴勒莫大学团队通过半自动管道将其重构为 MedPix-2.0——2,050 例结构化 JSON 数据集,正式为 AI 训练打开了大门。更早的 VQA-RAD(2018, CC0)从 MedPix 中派生,率先定义了医学视觉问答研究范式。
你可以用它来:训练医学图像-文本多模态对齐模型(CLIP 风格)、构建临床诊断决策支持的 RAG 系统、开发医学影像描述生成模型、或者以 VQA-RAD 为基准评估医学 VQA 方法——只需注意许可证限制:原始 MedPix 为非 CC 许可,用 MedPix-2.0 (MIT) 和 VQA-RAD (CC0) 做开放研究最安全。
§1.1 摘要
MedPix 是一个跨 40 年历史的医学影像-文本配对数据库。原始版本由放射科医师志愿者提交教学病例,经 NLM 审核后入库——数据流从全球医疗机构的临床实践中持续注入。每个病例包含至少一张医学图像和完整的结构化叙述:诊断标题、现病史、影像发现、鉴别诊断、病例诊断和疾病总论讨论。
2024 年,MedPix-2.0 首次将这一教学资源转化为 AI 可用的结构化格式。研究团队使用 Selenium + Beautiful Soup 半自动抓取网页数据,经人工清洗去噪后构建 MongoDB 数据库和 JSON 导出——Case_topic.json(每个病例的完整临床叙事)和 Descriptions.json(每张影像的元数据与描述)。该版本配有 train/val/test 划分、CLIP 多模态基准(模态分类 88.00% / 部位分类 52.50%),以及基于知识图谱 + Llama 3.1 的 DR-Minerva 决策支持系统。
MedPix 的生态还有两个关键衍生集:(1)VQA-RAD(Lau et al., 2018, Scientific Data)——从 MedPix 采样 315 张图像,由 15 名临床见习医师手工生成 2,244 个问答对,CC0 许可,是医学 VQA 领域被引用最多的基准之一;(2)MEDPIX-ClinQA(2024)——基于 MedPix-2.0 用 Llama 3.1 8B 自动生成 20,500 个预训练+对齐问答对,发布于 HuggingFace。
§1.2 为什么重要
维度一:教育数据的独特 AI 价值。 MedPix 与所有其他医学 AI 数据集有一个根本区别——它不是为研究而是为教育而建的。这意味着每个病例的文本部分不是枯燥的"标注"而是完整的临床推理叙事:从主诉到现病史、从影像发现到鉴别诊断、再到疾病总论——构成了一个"医生如何思考"的自然语言记录。这种结构天然适配视觉-语言模型的联合预训练——因为 CLIP 风格对比学习所需的正是这种"图像+自然语言描述"的丰富配对。相比之下,大多数医学 AI 数据集只提供 one-hot 分类标签或单个放射学报告段落。
维度二:40 年累积的疾病多样性。 59,000+ 张图像覆盖了从常见病到罕见病的极宽疾病谱——这是专病数据集(如 CheXpert 只覆盖 14 类胸部疾病)无法比拟的。MedPix-2.0 虽然仅提取了 2,050 例(CT/MRI),但已经覆盖了头/胸/腹/脊柱肌肉/生殖泌尿 5 个宏观部位分类,通过 ACR 编码可导航到数百种具体疾病类型。这种多样性让 MedPix 成为研究跨疾病泛化和零样本分类的理想测试平台。
维度三:VQA 领域的奠基地位。 VQA-RAD 虽然不是第一个医学 VQA 数据集,但它是第一个从临床医师的自然问题出发、通过双轮标注(自由形式→复述→模板化)设计的数据集。它的 11 类问题分类(模态/层面/器官系统/异常/存在性/位置/颜色/大小/属性/计数/其他)定义了医学 VQA 的问题空间——此后 SLAKE、PathVQA、RadImageNet-VQA 等所有医学 VQA 基准都在不同程度上借鉴了这一分类。2024 年 MedCoT 在 VQA-RAD 上实现了 87.50% 的准确率——逼近人类医学生水平。
§1.3 横向对比
| 数据集 | 图像量 | 模态 | 文本类型 | 专门用途 | 许可证 | 核心差异化 |
|---|---|---|---|---|---|---|
| MedPix (原始) | ~59,000 | CT/MRI/X-ray/US/NM/Path | 完整教学病历(诊断-发现-鉴别-讨论) | 教学/继续教育 | 非 CC(个人使用) | 唯一"教学叙事"结构,40 年积累 |
| MedPix-2.0 | ~2,050 例 | CT/MRI 仅 | JSON 结构化字段(诊断-病史-发现-鉴别-讨论) | 多模态 AI 训练 | MIT | MongoDB+MongoDB GUI 支持自定义查询导出 |
| ROCO | 87,952 | 多模态(PMC 文献) | 图像标题 | 跨模态检索 | CC BY | 来自 PubMed 文献而非教学库 |
| MedICaT | 217,060 | 多模态(PMC) | 子图-标题对齐 | 图像-文本对齐 | CC BY | 大规模的文献图像-标题配对 |
| VQA-RAD | 315 张 | CT/MRI/X-ray | 自然语言问答(2,244 QA 对) | 视觉问答 | CC0 | 手工标注、临床医生自然提问、11 类问题体系 |
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 1984 | Dr. J.G. Smirniotopoulos 在 Uniformed Services University (USUHS) 创建 MedPix 作为放射学教学工具 |
| 1990s | MedPix 作为 Walter Reed 陆军医学中心和国立海军医学中心的军队住院医师培训核心资源持续发展 |
| 2006 | Dr. Smirniotopoulos 获得 MedPix 美国专利 |
| 2016-02 | NLM 推出 MedPix 新版网页界面(https://medpix.nlm.nih.gov),正式向全球公众开放 |
| 2018-11 | VQA-RAD 论文发表于 Scientific Data(Lau et al.),首次从 MedPix 提取标准化的视觉问答基准 |
| 2024-06-30 | MedPix-2.0 Zenodo 首次存档(Siragusa et al.),首次将 MedPix 重构为 AI 就绪结构化数据集 |
| 2025-07 | MedPix-2.0 论文发表于 Data Science and Engineering (Springer),含 DR-Minerva KG 扩展 |
| 2025-07 | MedPix 系统综述论文发表于 Medical Reference Services Quarterly(Henigman & Kennedy) |
§1.5 典型应用场景
- 医学多模态预训练 — 使用 MedPix-2.0 的病例文本(诊断+发现+讨论)与 CT/MRI 图像做 CLIP 风格对比学习预训练。
- 医学视觉问答 — 以 VQA-RAD 为基准评估 VQA 模型;利用 MEDPIX-ClinQA 的 20,500 QA 对做大规模训练。
- 知识图谱增强诊断 — 参考 DR-Minerva 范式,从 MedPix-2.0 JSON 中提取疾病-症状-影像发现的关系构建医学知识图谱,结合 Llama 等 LLM 实现端到端诊断建议。
- 罕见病影像识别 — 利用 MedPix 原始数据库中大量罕见病教学病例做零样本/少样本分类研究。
- 医学教育 AI — 自动生成放射学教学材料、基于病例的 CME 试题、以及 AI 辅助的影像判读训练系统。
§2 医学背景
§2.1 疾病分类体系
MedPix 采用 ACR 编码体系(American College of Radiology Index for Radiological Diagnoses)进行疾病分类——这是放射学领域最广泛使用的影像诊断分类标准。ACR 编码按解剖系统和病理类型分层组织,覆盖范围远大于单一 ICD-11 章节。
由于 MedPix 覆盖全系统多专科(放射学、病理学、眼科学等),无统一的 ICD-11 映射。每个病例的 ACR 编码提供了该病例在放射学分类体系中的精确位置——使用者可通过 ACR 编码检索跨 ICD-11 章节的疾病影像表现。
§2.2 疾病背景
MedPix 涵盖的疾病范围极其广泛——从常见病到极其罕见的"教学级"病例。代表性类别包括:颅内出血和脑肿瘤(神经放射学)、肺结节与间质性肺病(胸部影像)、肝脏病变与肾脏肿块(腹部影像)、骨肿瘤与关节退变(骨骼肌肉)、先天性心脏病(心血管)、乳腺肿块(乳腺影像)等。MedPix 的收录逻辑以教学价值为导向,而非以流行病学代表性为目标——这是理解其偏倚结构的关键。
§2.3 临床任务定义
MedPix 支持的核心临床 AI 任务:
| 任务类型 | 描述 | 适用版本 |
|---|---|---|
| 影像分类 | 判断图像模态(CT/MR)、扫描层面或身体部位 | MedPix-2.0 |
| 病变检测 | 基于影像描述识别异常发现 | MedPix-2.0 + VQA-RAD |
| 视觉问答 (VQA) | 根据放射学图像回答自然语言问题(如"病变位于哪个器官?") | VQA-RAD |
| 鉴别诊断生成 | 根据影像发现和临床表现生成鉴别诊断列表 | MedPix-2.0 |
| 影像描述生成 | 自动生成放射学发现的自然语言描述 | MedPix-2.0 |
| 知识图谱推理 | 利用病例中隐含的疾病-症状-发现关联进行逻辑推理 | MedPix-2.0 (DR-Minerva) |
| 病例检索 | 根据图像和/或文本查询检索相似病例 | 原始 MedPix |
§2.4 患者人群
| 维度 | 特征 |
|---|---|
| 数据来源 | 全球各医疗机构放射科医师自愿提交的教学病例;早期来源以美国军方医院(Walter Reed 陆军医学中心、国立海军医学中心)为主 |
| 患者覆盖 | 全球范围,但早期以美国军人及退伍军人群体为主;后期来源多样化 |
| 年龄分布 | 覆盖全部年龄段,从新生儿到老年——取决于各教学病例的入选 |
| 性别分布 | 未公开——MedPix-2.0 的 Descriptions.json 中包含每张影像的 Sex 字段,但原始 MedPix 无全局统计 |
| 入排标准 | 教学价值驱动——入选标准为"具有教学意义的影像学表现",常见病和罕见病均可入选,无严格的临床入排标准 |
§2.5 金标准与参考标准
| 标签级别 | 标注方式 | 标注者 | 验证方式 |
|---|---|---|---|
| 原始 MedPix 诊断 | 病例提交者填写 | 全球放射科医师志愿者(放射科医师、住院医师、专科医师) | NLM 审核团队审批后入库,但无统一的交叉验证或 IAA 报告 |
| MedPix-2.0 文本(JSON) | 从原始 MedPix 半自动提取 + 人工清洗 | Siragusa 等(巴勒莫大学)— 非新标注,为数据重组 | 人工审查移除噪声样本,保留原始诊断文本 |
| VQA-RAD 问答标签 | 手工标注(自由形式 + 复述 + 模板化三轮) | 15 名美国临床见习医师(已完成核心临床轮转) | 双轮验证(另一参与者复述时验证答案);分歧通过研究团队共识会议解决;每周团队会议判定分类规则 |
| MEDPIX-ClinQA 问答标签 | Llama 3.1 8B 自动生成 | LLM 生成(非人工标注) | 未公开验证流程——使用前需人工检查 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 规模 | 格式 | 许可证 | 理由 |
|---|---|---|---|---|---|
| 浏览病例、医学教学 | 原始 MedPix 网站 | 59,000 张 | 网页浏览 | 非 CC(个人使用) | 最完整的病例和图像库,免费在线浏览 |
| 多模态 AI 研究(CT/MRI) | MedPix-2.0 (Zenodo) | 2,050 例 | PNG + JSON | MIT | 结构化划分,含 CLIP 基准,自由度最高 |
| 医学 VQA 基准评估 | VQA-RAD (HuggingFace) | 315 张 / 2,244 QA | JPG + JSON | CC0 | 领域标准基准,SOTA 清晰可追踪 |
| 大模型预训练/微调问答 | MEDPIX-ClinQA (HuggingFace) | 20,500 QA 对 | Parquet/JSON | 继承 MedPix-2.0 | LLM 生成规模大,但需人工验证 |
| 知识图谱驱动的诊断系统 | MedPix-2.0 MongoDB | 2,050 例 | MongoDB GUI | MIT | 可从 JSON 提取节点-边构建知识图谱 |
§3.1 图像数据规格
| 属性 | 原始 MedPix | MedPix-2.0 |
|---|---|---|
| 成像模态 | CT、MRI、X 光片、超声、核医学、病理、眼科 | 仅 CT 和 MRI |
| 图像格式 | JPG(网页显示)/PNG | PNG |
| 图像分辨率 | 不一(由贡献者提供,通常为诊断质量的 JPG 压缩版本) | 不一(由原始 MedPix 下载,非 DICOM 原始分辨率) |
| 窗宽窗位 | 已丢失(JPG/PNG 8-bit 色彩深度) | 已丢失(PNG 格式) |
| 层厚信息 | 多数不可得 | 不可得 |
| 序列数量 | 不一(每个病例含 1-N 张图像) | TAC 列表 + MRI 列表(每个病例的 CT 和 MR 图像分列) |
| 像素强度 | 0-255(非原始 HU 值) | 0-255 PNG |
| 身体部位覆盖 | 全系统 | 头部 (Head)、胸部 (Thorax)、腹部 (Abdomen)、脊柱与肌肉 (Spine and Muscles)、生殖泌尿系统 (Reproductive and Urinary System) |
§3.2 文本数据规格
MedPix-2.0 文本数据结构:
Case_topic.json(每个临床病例):
U_id:临床病例唯一标识符TAC:该病例的 CT 扫描图像文件名列表MRI:该病例的 MR 扫描图像文件名列表Case:病例详情字典Title:诊断History:患者现病史Exam Findings:影像学发现Differential Diagnosis:鉴别诊断Case Diagnosis:病例诊断Diagnosis By:诊断依据
Topic:疾病总论字典Title:疾病名称Disease Discussion:疾病讨论(学术综述)ACR Code:ACR 编码Category:疾病分类
Descriptions.json(每张影像):
Type:CT 或 MRU_id:所属病例 UIDimage:图像文件名location:精细身体部位(如 “brain parenchyma”)location category:宏观部位分类(Head / Thorax / Abdomen / Spine and Muscles / Reproductive and Urinary System)Description:影像描述字典ACR codes:ACR 编码Age:患者年龄Sex:患者性别Caption:影像描述(临床发现与解读)Figure part:图示部位Modality:扫描模态Plane:扫描层面(轴向/冠状/矢状)
§3.3 标注方法
原始 MedPix 的标注来源于日常临床教学实践——放射科医师在工作流程中遇到有教学价值的病例时,撰写完整的教学叙述并提交至 MedPix 平台。这既是它的优势(真实临床思维的自然流露),也是它的局限(无标准化标注协议、无 IAA 报告、无审核者盲法)。
MedPix-2.0 的处理重点是数据重组而非新增标注——通过半自动管道(Selenium 网页爬取 + Beautiful Soup HTML 解析)和人工审查,将原始的非结构化网页内容转化为结构化的 JSON 文档和 MongoDB 数据库。
VQA-RAD 的标注流程是医学 VQA 数据集的典范:
- 第一轮(自由形式):20 张图像 → 参与者用自然语言自由提问并回答。
- 第二轮(复述+模板化):20 张图像 → 另一参与者收到前一轮的问答,用自然语言复述问题,并从模板列表中选取最接近的问题框架。
- 验证:双轮答案交叉验证;分歧通过研究团队每周共识会议解决;280 个问答对经过了深入的人工审核。
§3.4 地理覆盖
| 维度 | 详情 |
|---|---|
| 医疗机构 | 全球——以美国军方医疗体系(Walter Reed 陆军医学中心、国立海军医学中心)为原始核心,扩展至全球各公立和私立医疗机构 |
| 患者地域 | 全球,但早期以美国军人/退伍军人群体为主——存在明显的美国军方人群偏倚 |
| 贡献者地域 | 全球——MedPix 接受任何国家放射科医师的病例提交 |
§3.5 伦理审查与去标识化
| 维度 | 详情 |
|---|---|
| 伦理审查 | NLM/NIH 对入库病例实施联邦标准合规审查——具体审查机构未在文献中公开 |
| 知情同意 | 原始数据依据 NLM/NIH 数据共享政策——详细信息未在 MedPix 页面上逐例公开 |
| 去标识化 | NLM/NIH 按照 HIPAA Safe Harbor 标准(移除 18 类受保护健康信息标识符)进行去标识化处理;MedPix-2.0 额外进行了人工清洗以移除残留 PII |
| 重新识别风险 | 低——影像经过 JPG/PNG 压缩且不含 DICOM 元数据头,患者人口统计信息仅保留年龄和性别 |
§3.10 深度溯源链
原始临床数据 (全球放射科医师诊断实践)
│
▼
放射科医师自愿整理教学病例 (撰写诊断/发现/鉴别/讨论 + 选择代表性图像)
│
▼
提交至 MedPix 平台 (NLM NIH 联邦系统)
│
▼
NLM 审核团队审批 (内容质量 + HIPAA 合规审查)
│
▼
入库 MedPix 数据库 (https://medpix.nlm.nih.gov) — 网页版浏览
│
├─────────────────────────────────────────────────┬──────────────────────────
│ │ │
▼ ▼ ▼
VQA-RAD (2018) MedPix-2.0 (2024) MEDPIX-ClinQA (2024)
手动采样 315 张 (每病例1张) 半自动爬取+人工清洗 Llama 3.1 8B 自动生成
15名临床见习医师标注 → 2,244 QA对 2,050例 → JSON + MongoDB 20,500 QA对
CC0 → OSF + HuggingFace MIT → GitHub + Zenodo → HuggingFace
│
▼
DR-Minerva (2025)
RAG-based VLM + KG
Llama 3.1 Instruct 8B
§4 数据结构详解
§4.0 目录树预览
MedPix-2.0 解压后目录结构:
MedPix-2.0/
├── images/ # 所有 CT/MRI 影像 (PNG)
│ ├── synpicXXXXX.png # CT 图像 (命名来自原始 MedPix)
│ ├── ...
├── Case_topic.json # 临床病例文本 (3.1 MB)
├── Descriptions.json # 影像描述元数据 (1.3 MB)
└── splitted_dataset/ # train/val/test 划分
├── train/
│ └── (划分后的 images 子集)
├── val/
└── test/
VQA-RAD HuggingFace 目录结构:
vqa-rad/
├── data/
│ ├── train.json # 训练集 (1,793 QA 对)
│ └── test.json # 测试集 (451 QA 对)
└── images/ # 315 张放射学图像 (JPG)
§4.1 DAIMS 标准化数据字典
MedPix-2.0 Case_topic.json 字段字典
| 字段名 | JSON 路径 | 数据类型 | 必填 | 描述 | 信息性缺失 | DAIMS 评分项 |
|---|---|---|---|---|---|---|
| U_id | .U_id |
string | ✅ | 临床病例唯一标识符(MPX + 数字) | 无缺失 | A1,A2 |
| TAC | .TAC[] |
list[string] | — | CT 图像文件名列表 | 无 CT 时为空数组 | C1 |
| MRI | .MRI[] |
list[string] | — | MR 图像文件名列表 | 无 MR 时为空数组 | C1 |
| Case.Title | .Case.Title |
string | ✅ | 诊断标题 | 无缺失 | B1 |
| Case.History | .Case.History |
string | ✅ | 患者现病史 | 无缺失 | B2 |
| Case.Exam Findings | .Case["Exam Findings"] |
string | ✅ | 影像学发现 | 无缺失 | B3 |
| Case.Differential Diagnosis | .Case["Differential Diagnosis"] |
string | — | 鉴别诊断列表 | 部分病例无 | B4 |
| Case.Case Diagnosis | .Case["Case Diagnosis"] |
string | ✅ | 最终病例诊断 | 无缺失 | B1 |
| Case.Diagnosis By | .Case["Diagnosis By"] |
string | — | 诊断依据(病理/影像/临床) | 部分病例无 | B5 |
| Topic.Title | .Topic.Title |
string | ✅ | 疾病学术名称 | 无缺失 | B1 |
| Topic.Disease Discussion | .Topic["Disease Discussion"] |
string | ✅ | 疾病学术综述 | 无缺失 | D1 |
| Topic.ACR Code | .Topic["ACR Code"] |
string | — | ACR 放射学诊断编码 | 部分病例无 | D2 |
| Topic.Category | .Topic.Category |
string | — | 疾病分类(解剖/病理) | 部分病例无 | D2 |
| split | splitted_dataset 目录 |
enum | ✅ | train / val / test | 全部有划分 | E2 |
MedPix-2.0 Descriptions.json 字段字典
| 字段名 | JSON 路径 | 数据类型 | 必填 | 描述 | DAIMS 评分项 |
|---|---|---|---|---|---|
| Type | .Type |
enum | ✅ | “CT” 或 “MR” | C1 |
| U_id | .U_id |
string | ✅ | 关联病例 ID(外键连接 Case_topic) | A2 |
| image | .image |
string | ✅ | 图像文件名 | C1 |
| location | .location |
string | ✅ | 精细身体部位(如 “brain, left frontal lobe”) | C2 |
| location category | .location category |
enum | ✅ | Head / Thorax / Abdomen / Spine and Muscles / Reproductive and Urinary System | C2 |
| Description.ACR codes | .Description["ACR codes"] |
string | — | 影像级 ACR 编码 | D2 |
| Description.Age | .Description.Age |
string | — | 患者年龄 | B2 |
| Description.Sex | .Description.Sex |
string | — | 患者性别 | B2 |
| Description.Caption | .Description.Caption |
string | ✅ | 影像描述(放射科医师撰写) | B3 |
| Description.Figure part | .Description["Figure part"] |
string | — | 图示的解剖结构 | C2 |
| Description.Modality | .Description.Modality |
string | ✅ | 扫描模态 | C1 |
| Description.Plane | .Description.Plane |
string | — | 扫描层面(axial/coronal/sagittal) | C2 |
§4.2 VQA-RAD 数据字段
| 字段名 | 数据类型 | 描述 |
|---|---|---|
| qid | int | 唯一问答 ID |
| image_name | string | 图像文件名(synpicXXXXX.jpg) |
| question | string | 自然语言问题 |
| answer | string | 自然语言答案 |
| question_type | enum | 11 类:Modality / Plane / Organ System / Abnormality / Object-Condition Presence / Positional reasoning / Color / Size / Attribute / Counting / Other |
| answer_type | enum | CLOSED (yes/no) / OPEN |
| phrase_type | enum | freeform / paraphrase / framed |
| organ | enum | HEAD / CHEST / ABD |
| split | enum | train / test |
§5 数据划分与使用建议
§5.1 官方数据划分
MedPix-2.0
| 子集 | 样本量 | 路径 |
|---|---|---|
| 训练集 (train) | 未在 Splitted_dataset README 中公开精确数字 | /splitted_dataset/train/ |
| 验证集 (val) | 同上 | /splitted_dataset/val/ |
| 测试集 (test) | 同上 | /splitted_dataset/test/ |
具体数量需查看
/splitted_dataset/README.md。划分方式未在论文中详细说明——建议在使用前自行验证划分策略和患者级泄漏检查。
VQA-RAD
| 子集 | QA 对数 | 独特图像数 | 说明 |
|---|---|---|---|
| 训练集 | 1,793 | 313 | 作者原始划分 |
| 测试集 | 451 | 203 | 与训练集有 ~103 张重叠图像(不同 QA 对) |
| 总计 | 2,244 | 314 | 1 张图像未被任何 QA 引用;有 4 对重复的 (图像, QA) 已去重 |
§5.2 数据泄漏风险
| 风险类型 | 严重性 | 描述 | 规避措施 |
|---|---|---|---|
| VQA-RAD 图像重叠 | ⚠️ 中 | 训练集和测试集共享约 103 张图像(不同 QA 对)——这是 VQA 数据集的预期行为,因为同一图像可回答不同问题 | 按 qid 而非 image_name 划分——社区普遍接受此做法 |
| MedPix-2.0 患者级泄漏 | ⚠️ 中 | 划分方式未在论文中详细说明——无法确认是按病例级还是图像级划分 | 使用前检查 /splitted_dataset/README.md;手工验证病例级互斥 |
| PNG 格式导致的"看起来相同"偏差 | 🔴 低 | MedPix 原始图像为 JPG/PNG,MedPix-2.0 又转存为 PNG——双重有损压缩可能使不同患者图像"看起来"更相似 | 影响有限——CT/MRI 的解剖结构差异远大于压缩伪影 |
| 原始 MedPix 未被划分 | 🔴 严重 | 无任何官方数据划分——完全由使用者自行决定 | 仅用于浏览和教学,不推荐直接用于有监督训练 |
§5.3 推荐划分策略
-
MedPix-2.0:直接使用官方
splitted_dataset目录中的 train/val/test 划分。使用前通过 Case_topic.json 的 U_id 字段验证患者级互斥——确保同一 U_id 不会同时出现在 train 和 test 中。 -
VQA-RAD:直接使用官方 train/test JSON 文件。评估时注意开放式问题和封闭式问题的准确率巨大差异(封闭式准确率通常高 15-25 个百分点),应分别报告。
-
不推荐使用原始 MedPix 网页数据直接训练——无标准划分、无图像级标签、JPG 质量参差不齐。
§6 AI 就绪指南
§6.1 快速开始
预期目录结构:请将 MedPix-2.0 的 Zenodo 压缩包解压到
data/medpix2/目录,确保images/、Case_topic.json、Descriptions.json和splitted_dataset/四个资源同级存在。
import json
import os
from PIL import Image
# 加载 MedPix-2.0 数据
DATA_ROOT = "data/medpix2"
with open(os.path.join(DATA_ROOT, "Case_topic.json"), "r", encoding="utf-8") as f:
cases = json.load(f)
with open(os.path.join(DATA_ROOT, "Descriptions.json"), "r", encoding="utf-8") as f:
descriptionevent-blocked= json.load(f)
print(f"Loaded {len(cases)} cases, {len(descriptions)} image descriptions")
# 按索引构建 U_id → case 映射
case_by_uid = {c["U_id"]: c for c in cases}
# 示例:查找第一例病例的所有 CT 图像
first_case = cases[0]
print(f"\nCase: {first_case[''''''''''''''''Case''''''''''''''''][''''''''''''''''Title'''''''''''''''']}")
print(f"CT scans: {len(first_case[''''''''''''''''TAC''''''''''''''''])}")
print(f"MRI scans: {len(first_case[''''''''''''''''MRI''''''''''''''''])}")
print(f"Diagnosis: {first_case[''''''''''''''''Case''''''''''''''''][''''''''''''''''Case Diagnosis'''''''''''''''']}")
# 获取该病例的第一张图像描述
for desc in descriptions:
if desc["U_id"] == first_case["U_id"]:
print(f"\nImage: {desc[''''''''''''''''image'''''''''''''''']}")
print(f"Modality: {desc[''''''''''''''''Type'''''''''''''''']}")
print(f"Location: {desc[''''''''''''''''location'''''''''''''''']}")
print(f"Body part: {desc[''''''''''''''''location category'''''''''''''''']}")
print(f"Caption: {desc[''''''''''''''''Description''''''''''''''''][''''''''''''''''Caption''''''''''''''''][:200]}...")
break
§6.2 数据获取
| 版本 | 获取方式 | 步骤 | 审核时间 |
|---|---|---|---|
| 原始 MedPix | 网页浏览 https://medpix.nlm.nih.gov/home | 直接访问,无需注册 | 即时 |
| MedPix-2.0 | GitHub git clone https://github.com/CHILab1/MedPix-2.0.git |
或 Zenodo 直链下载 images.zip + JSON 文件 | 即时 |
| VQA-RAD | HuggingFace datasets load_dataset("flaviagiammarino/vqa-rad") |
或 OSF 直链下载 | 即时 |
| MEDPIX-ClinQA | HuggingFace datasets load_dataset("adishourya/MEDPIX-ClinQA") |
需先下载 MedPix-2.0 图像 | 即时 |
§6.3 预处理 Pipeline
import torch
from torch.utils.data import Dataset
from PIL import Image
from torchvision import transforms
class MedPix2Dataset(Dataset):
"""MedPix-2.0 多模态数据集,支持图像+文本联合加载。"""
def __init__(self, data_root, split="train", transform=None):
self.data_root = data_root
self.split = split
self.transform = transform or transforms.Compose([
transforms.Resize((224, 224)),
transforms.ToTensor(),
transforms.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225])
])
# 加载 JSON 文件
with open(os.path.join(data_root, "Descriptions.json"), "r") as f:
all_descs = json.load(f)
with open(os.path.join(data_root, "Case_topic.json"), "r") as f:
all_cases = json.load(f)
# 读取划分信息
split_dir = os.path.join(data_root, "splitted_dataset", split)
split_images = set(os.listdir(split_dir)) if os.path.exists(split_dir) else set()
# 构建 case_by_uid 映射
self.case_by_uid = {c["U_id"]: c for c in all_cases}
# 过滤:仅保留当前划分中的图像
self.samples = []
for desc in all_descs:
img_name = desc["image"]
if img_name in split_images or not split_images: # fallback: all
case = self.case_by_uid.get(desc["U_id"])
if case:
self.samples.append({
"image": img_name,
"modality": desc["Type"],
"location": desc["location"],
"location_category": desc["location category"],
"caption": desc["Description"].get("Caption", ""),
"diagnosis": case["Case"].get("Case Diagnosis", ""),
"history": case["Case"].get("History", ""),
"findings": case["Case"].get("Exam Findings", ""),
"acr_code": case["Topic"].get("ACR Code", ""),
})
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
sample = self.samples[idx]
img_path = os.path.join(self.data_root, "images", sample["image"])
image = Image.open(img_path).convert("RGB")
image = self.transform(image)
return {
"image": image,
"modality": sample["modality"],
"location_category": sample["location_category"],
"caption": sample["caption"],
"diagnosis": sample["diagnosis"],
"history": sample["history"],
}
# CLIP 风格对比学习预处理
clip_transform = transforms.Compose([
transforms.Resize((224, 224)),
transforms.ToTensor(),
transforms.Normalize(
mean=[0.48145466, 0.4578275, 0.40821073],
std=[0.26862954, 0.26130258, 0.27577711]
),
])
dataset = MedPix2Dataset("data/medpix2", split="train", transform=clip_transform)
print(f"Training samples: {len(dataset)}")
sample = dataset[0]
print(f"Image shape: {sample[''''''''''''''''image''''''''''''''''].shape}")
print(f"Modality: {sample[''''''''''''''''modality'''''''''''''''']}")
print(f"Diagnosis: {sample[''''''''''''''''diagnosis''''''''''''''''][:100]}...")
§6.4 框架加载
MongoDB 查询(MedPix-2.0 GUI):MedPix-2.0 提供 Python GUI 用于高效浏览和查询 MongoDB 实例。安装指南见 GitHub 仓库 README。通过 GUI 可以按模态、身体部位、ACR 编码、疾病类型筛选并导出训练数据。
HuggingFace Datasets(VQA-RAD):
from datasets import load_dataset
dataset = load_dataset("flaviagiammarino/vqa-rad")
print(dataset)
# DatasetDict({
# train: Dataset({features: [''''''''''''''''image'''''''''''''''', ''''''''''''''''question'''''''''''''''', ''''''''''''''''answer'''''''''''''''', ...], num_rows: 1793})
# test: Dataset({features: [''''''''''''''''image'''''''''''''''', ''''''''''''''''question'''''''''''''''', ''''''''''''''''answer'''''''''''''''', ...], num_rows: 451})
# })
§6.5 常见坑点与解决方案
⚠️ 坑点 1:PNG 格式丢失 HU 值信息
- 问题:MedPix-2.0 的所有图像均为 8-bit PNG 格式——原始 DICOM 的 CT 窗宽窗位和 MRI 灰度信息在处理链中经历至少两次损失:MedPix 网页的 JPG 压缩 + MedPix-2.0 的 PNG 格式转换。HU 值(CT)和 T1/T2 信号强度(MRI)已不可恢复。
- 症状:基于 HU 值的阈值分割(如肺结节 HU 截断)完全不可用;CT 骨窗/肺窗/软组织窗的信息混合在同一 8-bit 通道中。
- 解决:将 MedPix 图像视为"视觉分类"和"视觉-语言对齐"的数据源,而非定量分析的数据源。需要 HU 值的任务请使用 DeepLesion、LIDC-IDRI 等 DICOM 数据集。
- 参考:MedPix-2.0 论文 §3 明确说明图像为 PNG 格式的局限性。
⚠️ 坑点 2:CT/MRI 模态识别并非平凡任务
- 问题:由于 8-bit 格式丢失了 DICOM 元数据和原始像素强度信息,仅从图像像素区分 CT 还是 MRI 在很多情况下比看起来难——尤其是骨骼部位的 CT 和 T2 加权 MRI 在视觉上可能相似。
- 症状:Siragusa 等报告 CLIP 模态分类准确率仅为 88.00%(经过 RN50x16 + BioBERT 微调后),仍低于人类放射科医师 (>99%)。
- 解决:不要依赖纯视觉模型做模态推理——使用 Descriptions.json 中的
Type字段作为 ground truth;MedPix 数据天生适合多模态模型训练(利用文本信号辅助视觉理解)。 - 参考:MedPix-2.0 Table 1。
⚠️ 坑点 3:VQA-RAD 训练/测试重叠
- 问题:VQA-RAD 的 train 和 test 子集在 unique images 上不互斥——203 张测试图像中有约 103 张也出现在训练集中(虽然问答对不同)。这对基于图像检索的模型容易造成数据泄漏。
- 症状:基于视觉特征检索相似病例再回答的方式可能直接"记住"训练集答案,虚报性能。
- 解决:评估时严格按
qid维度而非image_name维度做 train/test 分离。报告结果时明确说明是否存在图像重叠。对于出版级结果,建议额外跑一次完全按image_name去重的评估作为消融实验。 - 参考:HuggingFace
abhay2812/vqa-rad的讨论中详细记录了重叠分析。
⚠️ 坑点 4:教学选择偏倚对分类器的误导
- 问题:MedPix 病例以教学价值为入选标准——罕见病和典型病例被大量收录,而正常的/轻微的/模棱两可的病例严重低代表。直接在 MedPix 上训练疾病分类器会严重高估模型在真实连续临床场景中的性能。
- 症状:训练出的模型对"经典教学病例"准确率极高,对现实中的"正常变异"和"临界发现"表现极差。
- 解决:不要用 MedPix 做疾病患病率估计或流行病学建模。MedPix 最适合的任务是:图像-文本对齐(对比学习)、跨疾病泛化测试、以及作为医学教育 AI 的训练源——这些任务对患病率分布不敏感。
- 参考:标准数据集偏倚文献——类似于 ChestX-ray14 的"提示偏倚"但原因不同。
⚠️ 坑点 5:ACR 编码的标注不一致
- 问题:MedPix 的 ACR 编码由病例贡献者自行填写,未经统一的编码交叉验证。同一疾病在不同病例中可能被赋予了不同的 ACR 编码。
- 症状:当你试图按 ACR 编码筛选训练集时,可能遗漏部分相关病例或/且包含错误分类的病例。
- 解决:将 ACR 编码视为弱标注——在任务中使用时,优先考虑诊断文本(Title/Disease Discussion)作为 ground truth。如必须用 ACR 编码,先做一轮基于文本匹配的一致性清洗。
- 参考:MedPix-2.0 论文未讨论 ACR 编码的一致性——这是一个未探索的研究问题。
⚠️ 坑点 6:MongoDB 依赖性增加入门门槛
- 问题:MedPix-2.0 的完整功能依赖 MongoDB 数据库和 Python GUI——需要安装 MongoDB 并配置数据库连接,比直接读取 JSON 文件增加了不少工程复杂度。
- 症状:只想快速加载 JSON 做实验的用户可能被 MongoDB 的安装和配置卡住。
- 解决:MedPix-2.0 Zenodo 版本自带了 Case_topic.json 和 Descriptions.json 两个独立的 JSON 文件——直接用
json.load()即可加载全部数据,不需要 MongoDB。需要使用 GUI 按条件筛选导出时才需要 MongoDB。 - 参考:Zenodo Dataset README。
⚠️ 坑点 7:VQA-RAD 封闭式 vs 开放式性能不对称
- 问题:VQA-RAD 中封闭式问题(yes/no)和开放式问题的难度截然不同,准确率差距可达 20-30 个百分点——整体准确率可能掩盖模型在开放性问题上的严重不足。
- 症状:只报告"overall accuracy"意味着模型可能在 yes/no 上 95%+、在开放式问题上仅 50%——但整体看起来还不错的假象。
- 解决:始终分别报告封闭式和开放式问题的准确率。VQA-RAD 标准做法:Closed-ended Accuracy + Open-ended Accuracy + Overall Accuracy 三者同时报告。
- 参考:VQA-RAD 论文 Table 3;HuggingFace leaderboard 采用三项指标。
§6.6 数据增强策略
| 增强方法 | 适用场景 | 注意事项 |
|---|---|---|
| 随机旋转/翻转 | CT/MRI 图像分类 | 不要应用过于剧烈的旋转(放疗体位依赖) |
| 随机裁剪/缩放 | 多模态对齐 | 保留关键解剖结构在裁剪范围内的约束 |
| 文本增强 | 病例文本训练 | 使用临床实体替换或同义词替换;不要修改诊断结论 |
| 图像颜色抖动 | 鲁棒性训练 | 由于 PNG 已丢失原始窗宽窗位,颜色抖动的意义有限 |
§6.7 计算资源与模型推荐
| 场景 | 推荐模型 | GPU 需求 | 训练时间(估计) |
|---|---|---|---|
| 模态/部位分类(基线) | CLIP (RN50x16 + BioBERT) | 1× RTX 3090 | ~6 小时 |
| 医学 VQA 基准 | MedCoT (256M 参数) | 1× A100 40GB | ~12 小时 |
| 图像描述生成 | BLIP-2 + LoRA | 1× RTX 4090 24GB | ~8 小时 |
| 知识图谱+RAG | DR-Minerva (RAG VLM) | 1× A100 40GB | ~16 小时 |
| 大规模多模态预训练 | OpenCLIP (ViT-L/14) | 4× A100 80GB | ~48 小时 |
§6.9 评估指标
def evaluate_vqa_rad(predictions, references, answer_types):
"""VQA-RAD 标准评估:分别报告封闭式和开放式准确率。"""
closed_correct = 0
closed_total = 0
open_correct = 0
open_total = 0
for pred, ref, atype in zip(predictions, references, answer_types):
# 简单准确率——生产级评估应使用归一化匹配
correct = pred.strip().lower() == ref.strip().lower()
if atype == "CLOSED":
closed_correct += correct
closed_total += 1
else:
open_correct += correct
open_total += 1
closed_acc = closed_correct / closed_total if closed_total else 0
open_acc = open_correct / open_total if open_total else 0
overall_acc = (closed_correct + open_correct) / (closed_total + open_total)
return {
"closed_ended_accuracy": closed_acc,
"open_ended_accuracy": open_acc,
"overall_accuracy": overall_acc,
}
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 对 AI 的影响 | 严重性 |
|---|---|---|---|
| 教学选择偏倚 | 病例以教学价值入选——罕见病和典型表现过度代表,正常变异和临界发现低代表 | 训练的分类器在真实临床场景中性能显著下降 | 🔴 高 |
| 贡献者偏倚 | 早期以美国军方医疗机构为主,患者人群偏向军人/退伍军人 | 人口统计学泛化受限 | 🟡 中 |
| 模态偏倚 | MedPix-2.0 仅含 CT/MRI,排除了原始 MedPix 中的 X 光、超声、核医学、病理和眼科影像 | 多模态研究覆盖面受限 | 🟡 中 |
| 标签质量偏倚 | 原始 MedPix 的 ACR 编码和诊断由志愿者自行填写,无标准化审核 | 按编码筛选训练数据时存在噪声 | 🟡 中 |
| JPG/PNG 压缩偏倚 | 原始 DICOM 的窗宽窗位和像素强度信息在 MedPix→MedPix-2.0 两次格式转换中丢失 | 不适合需要 HU 值或 T1/T2 信号强度的定量分析 | 🔴 严重(定量任务) |
| 语言偏倚 | 全部病例为英文 | 非英语语境的病例叙事结构差异未覆盖 | 🟢 低 |
§7.2 标注质量
| 质量维度 | 评价 | 证据 |
|---|---|---|
| 标注者资质 | 原始 MedPix:全球放射科医师志愿者——业界最高资质水平 | NLM 审核团队审批 |
| 标注一致性 (IAA) | 未报告——原始 MedPix 和 MedPix-2.0 均无 IAA 数据 | 风险:同一病例的不同审阅者可能给出不同诊断 |
| VQA-RAD 标注一致性 | 双轮验证:问答对经第二个参与者复述和回答验证 | 280/3,515 问答对需要深入人工审阅(7.9%) |
| 标注完整性 | MedPix-2.0 的 Descriptions.json 中部分字段有缺失(如 ACR codes、Age、Plane) | JSON 文件中存在空字符串和缺失字段 |
§7.3 泛化性
MedPix 作为教学数据库,其泛化性的核心问题是教学选择偏倚对真实临床分布的偏离。在 MedPix 上训练的分类器和 VQA 模型通常需要对目标临床人群进行 domain adaptation——不能直接零样本部署。VQA-RAD 虽然样本量小(315 张),但 11 类问题设计涵盖了临床视觉推理的核心维度,在这一点上比很多"大但浅"的数据集更具方法学泛化价值。
§7.4 伦理考量
| 考量项 | 评价 |
|---|---|
| 患者隐私 | 已按 HIPAA 标准去标识化——PHI 字段已移除;面部照片不可得 |
| 二次使用不明确 | 原始 MedPix 的许可证(“个人使用及本地教学”)与非商业 AI 研究的边界模糊——特别是训练后公开发布模型权重的合规性 |
| 知情同意追溯 | 早期病例(1984-1990s)的知情同意状态不明确——彼时数字数据共享的伦理标准与当今不同 |
| MedPix-2.0 的积极贡献 | MIT License 解决了原始 MedPix 的许可证模糊问题——是 AI 研究者的安全选择 |
§7.7 DAIMS 24 项数据就绪度评估
| 编号 | 评估项 | 满足? | 评分 | 说明 |
|---|---|---|---|---|
| A1 | 数据集有唯一稳定标识符 | ✅ | 2 | MedPix-2.0 有 Zenodo DOI + GitHub repo;VQA-RAD 有 OSF DOI |
| A2 | 数据集有明确的版本号 | ✅ | 2 | MedPix-2.0 v5 (2025-07-17);VQA-RAD v1.0 (2018) |
| B1 | 医学任务明确定义 | ✅ | 3 | 教学病例的诊断和影像发现均为明确文本字段 |
| B2 | 患者人口统计信息完整 | ⚠️ | 1 | 仅有年龄和性别(Descriptions.json),无种族/民族/保险/社会经济状态 |
| B3 | 标注标准明确 | ⚠️ | 2 | 原始 MedPix:放射科医师自愿贡献,无统一标注协议;VQA-RAD:标准完善 |
| B4 | 标注者资质可查 | ⚠️ | 2 | 原始 MedPix:贡献者匿名;VQA-RAD:15 名见习医师背景详细列出 |
| B5 | IAA 报告可用 | ❌ | 0 | 原始 MedPix 和 MedPix-2.0 均未报告观察者间一致性 |
| C1 | 数据模态完整定义 | ⚠️ | 2 | MedPix-2.0 仅 CT/MRI——多模态完整性不及原始 MedPix |
| C2 | 图像采集参数可追踪 | ❌ | 1 | PNG 格式丢失 DICOM 元数据:扫描仪型号/层厚/kVp/TR/TE 均不可得 |
| D1 | 数据来源可追溯 | ✅ | 3 | 原始 MedPix→半自动管道→人工清洗→MedPix-2.0 链路完整记录 |
| D2 | 数据代表性可评估 | ⚠️ | 1 | 教学选择偏倚严重——不可代表真实临床人群 |
| E1 | 有官方数据划分 | ⚠️ | 2 | MedPix-2.0 有 splitted_dataset 但未公开划分策略;VQA-RAD 有标准划分 |
| E2 | 数据泄漏已评估 | ⚠️ | 2 | VQA-RAD 有图像重叠讨论;MedPix-2.0 划分策略不详 |
| F1 | 预处理脚本可用 | ⚠️ | 1 | 官方提供 MongoDB GUI 而非标准 PyTorch/TF 脚本 |
| F2 | 有基准性能参考 | ✅ | 2 | CLIP 模态/部位分类 baseline;VQA-RAD 有 paperswithcode leaderboard |
| G1 | 伦理合规 | ⚠️ | 2 | 原始 MedPix 的许可证模糊——非 CC 许可的 AI 研究使用边界不清 |
| G2 | 数据安全 | ✅ | 3 | PHI 已移除——HIPAA 合规(NLM/NIH 标准) |
| H1 | 文档完整性和可访问性 | ⚠️ | 1 | MedPix-2.0 论文提供了管道细节;原始 MedPix 无数据集文档 |
| H2 | 数据使用协议清晰 | ⚠️ | 2 | MedPix-2.0 MIT ✓ / VQA-RAD CC0 ✓ / 原始 MedPix ≠ CC ✗ |
| 总计 | 36/72 | 评分 = 36/72 × 24/24 = 12.0/24 |
DAIMS 综合评定:12.0/24 — 基础可用。 原始 MedPix 根本不是为 AI 设计的——它是一个教学平台。MedPix-2.0 和 VQA-RAD 分别从不同角度做了有价值的结构化工作,但信息的碎片化(三个分开的许可证、三种不同的数据格式、相互不重叠的规模和模态覆盖)使得 MedPix 生态的整体 AI 就绪度偏低。对 AI 从业者而言:用 MedPix-2.0 做多模态预训练、用 VQA-RAD 做评估、不要用原始 MedPix 直接训练。
对你意味着什么
- 如果你需要"开箱即用"的多模态数据:MedPix-2.0 的结构化 JSON + MIT License 是最佳入口——虽然图像质量受限(PNG),但病例-文本-诊断的三元结构非常适合 CLIP 风格对比学习和 RAG 系统。
- 如果你需要 VQA 基准:VQA-RAD 虽然只有 315 张图像,但它的 CC0 许可 + 标准 leaderboard 让其成为不可替代的领域标准——且 87.50% 的 SOTA (MedCoT) 仍有提升空间。
- 如果你需要大规模训练数据:MEDPIX-ClinQA 的 20,500 QA 对是 LLM 生成的,质量未经严格验证——应视为弱监督预训练数据,评估仍需回到 VQA-RAD。
§7.8 外部验证矩阵
| 外部数据集/场景 | 评估任务 | 模型 | 性能 | 关键发现 |
|---|---|---|---|---|
| SLAKE (642 张, 14K QA) | VQA (MedPix→SLAKE 迁移) | MedCoT | 87.26% | MedPix 训练的 VQA 模型在 SLAKE 上维持高性能——跨数据集泛化良好 |
| PathVQA (4,998 张, 32K QA) | VQA (病理学域外) | 多种方法 | 下降 10-15% | 放射学→病理学的跨域迁移存在显著性能下降 |
| ROCO (87,952 张, PMC 文献) | 跨模态检索 | CLIP 变体 | — | MedPix 的结构化叙事文本比 PMC 文献中的简短标题更适合多模态对齐 |
§8 基准性能与生态
§8.1 排行榜
MedPix-2.0 基准(Siragusa et al., 2025)
| 方法 | 任务 | 模态分类准确率 | 部位分类准确率 | 论文 |
|---|---|---|---|---|
| CLIP (RN50x16 + BioBERT) | 多模态分类 | 88.00% | 52.50% | Siragusa et al., 2025, DSE |
注:MedPix-2.0 论文中仅报告了自研的 CLIP 基准——社区尚未建立独立的公开排行榜。
VQA-RAD 排行榜(Papers with Code,截至 2026-07)
| 方法 | 年份 | 封闭式准确率 | 开放式准确率 | 总体准确率 | 关键创新 |
|---|---|---|---|---|---|
| MedCoT (256M) | 2024 | — | — | 87.50% | 层级 MoE 专家 + 链式思维推理 —— 2.56 亿参数击败 70 亿参数模型 |
| Multi-scale Feature Fusion | 2025 | — | — | 77.20% | 多尺度视觉特征融合 + 问题语义增强模块 |
| IACV (349M) | 2025 | 86.40% | — | 78.90% | 部位-答案关联掩码 + 自学习知识,无需外部图谱 |
| Domain-Adapted VLM | 2024 | — | — | 73.20% | 三阶段参数高效训练(医学 VLM 域自适应) |
| LLaVA-Med (7B) | 2023 | — | — | 81.98% | 领域专用视觉-语言模型(MedCoT 基线对比) |
| MEVF (SAN) | 2018 | 79.10% | 54.80% | 73.90% | VQA-RAD 原始论文——堆叠注意力网络 + 问题分类 |
| MEVF (BAN) | 2018 | 77.40% | 57.50% | 72.10% | VQA-RAD 原始论文——双线性注意力网络 |
§8.2 SOTA 进展总结
| 维度 | 最佳方法 | 性能 | 展望 |
|---|---|---|---|
| 模态分类 (MedPix-2.0) | CLIP (RN50x16 + BioBERT) | 88.00% | 引入原始 DICOM 元数据可望提升至 95%+ |
| VQA 总体准确率 (VQA-RAD) | MedCoT | 87.50% | 层级 MoE + CoT 的组合已接近见习医师水平——下一步需要更难的临床推理问题 |
| VQA 封闭式 (VQA-RAD) | IACV | 86.40% | yes/no 问题的天花板在 90-92%——剩余错误多为临床歧义性 |
§8.4 相关数据集
| 数据集 | 与 MedPix 的关系 | 规模 | 用途 |
|---|---|---|---|
| VQA-RAD | MedPix 直接派生子集 | 315 张 / 2,244 QA | 医学 VQA 基准 |
| MEDPIX-ClinQA | MedPix-2.0 的 LLM 扩展 | 20,500 QA | 大规模预训练 QA |
| ROCO | 同类型(放射学图像+文本) | 87,952 张 | 跨模态检索 |
| MedICaT | 同类型(PMC 文献图像+文本) | 217,060 | 图像-标题对齐 |
| SLAKE | 同任务(医学 VQA) | 642 张 / 14K QA | 双语医学 VQA |
| PathVQA | 跨域对比(病理学 VQA) | 4,998 张 / 32K QA | 病理学 VQA |
| RadImageNet-VQA | 大规模放射学 VQA | 75 万张 / 750 万 QA | 大规模放射学 VQA |
§8.5 关键参考论文
- Henigman, A. & Kennedy, B. (2025). MedPix: Database of Medical Images, Teaching Cases, and Clinical Topics. Medical Reference Services Quarterly. DOI: 10.1080/02763869.2025.2533768 —— 原始 MedPix 的最新系统综述。
- Siragusa, I., Contino, S., La Ciura, M., Alicata, R. & Pirrone, R. (2025). MedPix 2.0: A Comprehensive Multimodal Biomedical Data Set for Advanced AI Applications with Retrieval Augmented Generation and Knowledge Graphs. Data Science and Engineering. DOI: 10.1007/s41019-025-00297-8 —— MedPix-2.0 核心论文。
- Lau, J.J., Gayen, S., Ben Abacha, A. & Demner-Fushman, D. (2018). A Dataset of Clinically Generated Visual Questions and Answers about Radiology Images. Scientific Data, 5:180251. DOI: 10.1038/sdata.2018.251 —— VQA-RAD 原始论文。
- Siragusa, I., Contino, S. & Pirrone, R. (2025). DR-Minerva: A Multimodal Language Model Based on Minerva for Diagnostic Information Retrieval. AIxIA 2024, pp. 288-300. DOI: 10.1007/978-3-031-80607-0_22 —— DR-Minerva RAG 诊断系统。
- MedCoT (2024). Medical Chain-of-Thought with Mixture of Experts for Visual Question Answering. arXiv:2412.13736 —— VQA-RAD 当前 SOTA (87.50%)。
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML 2021 —— CLIP 架构(MedPix-2.0 基准基础)。
- Lee, J. et al. (2020). BioBERT: A Pre-trained Biomedical Language Representation Model for Biomedical Text Mining. Bioinformatics, 36(4):1234-1240 —— MedPix-2.0 CLIP 微调中使用的文本编码器。
- Subramanian, S. et al. (2020). MedICaT: A Dataset of Medical Images, Captions, and Textual References. Findings of EMNLP 2020 —— 同类型大规模医学图像-文本数据集。
§8.7 生态快照
┌────────────────────────────────────────────────────────────┐
│ MedPix 生态全景 (1984-2026) │
├────────────────────────────────────────────────────────────┤
│ 📚 原始 MedPix (NLM) │
│ ├── https://medpix.nlm.nih.gov/home │
│ ├── 59,000+ 图像 / 12,000+ 病例 / 9,000+ 主题 │
│ ├── 模态: CT/MRI/X-ray/US/NM/Path/Ophth │
│ └── 许可证: 个人使用/本地教学 (非 CC) │
│ │ │
│ ┌──────────────┼──────────────┐ │
│ │ │ │ │
│ 🔬 MedPix-2.0 🩺 VQA-RAD 🤖 MEDPIX-ClinQA │
│ (Siragusa 2025) (Lau 2018) (2024) │
│ ├── 2,050 例 ├── 315 张 ├── 20,500 QA │
│ ├── JSON+MongoDB ├── 2,244 QA ├── Llama3.1生成 │
│ ├── MIT License ├── CC0 License ├── HuggingFace │
│ └── GitHub+Zenodo └── OSF+HF └── HF Datasets │
│ │ │
│ 🧠 DR-Minerva (2025) │
│ ├── RAG VLM + Knowledge Graph │
│ ├── Llama 3.1 Instruct 8B │
│ └── 端到端诊断决策支持系统 │
├────────────────────────────────────────────────────────────┤
│ 📊 社区活跃度 │
│ ├── GitHub Stars: 31 (CHILab1/MedPix-2.0) │
│ ├── Zenodo Downloads: 1,609 │
│ ├── HuggingFace VQA-RAD: 722 downloads/month │
│ └── Papers with Code VQA-RAD Leaderboard: 活跃 │
└────────────────────────────────────────────────────────────┘
§9 相关资源与引用
§9.1 官方资源
| 资源 | 链接 |
|---|---|
| MedPix 原始网站 (NLM) | https://medpix.nlm.nih.gov/home |
| MedPix-2.0 GitHub | https://github.com/CHILab1/MedPix-2.0 |
| MedPix-2.0 Zenodo | https://zenodo.org/records/12624810 |
| VQA-RAD OSF | https://osf.io/89kps/ |
| VQA-RAD HuggingFace | https://huggingface.co/datasets/flaviagiammarino/vqa-rad |
| MEDPIX-ClinQA HuggingFace | https://huggingface.co/datasets/adishourya/MEDPIX-ClinQA |
§9.2 教程与学习资源
| 资源 | 描述 |
|---|---|
| MedPix-2.0 GUI 使用指南 | GitHub README.md —— 从安装 MongoDB 到导出训练数据 |
| VQA-RAD Papers with Code | https://paperswithcode.com/dataset/vqa-rad —— Leaderboard + 代码链接 |
| NLM 用户指南 (Henigman 2025) | DOI: 10.1080/02763869.2025.2533768 —— 原始 MedPix 完整使用手册 |
§9.3 BibTeX 引用
% MedPix-2.0
@article{siragusa2025medpix,
title={MedPix 2.0: A Comprehensive Multimodal Biomedical Data Set
for Advanced AI Applications with Retrieval Augmented
Generation and Knowledge Graphs},
author={Siragusa, Irene and Contino, Salvatore and La Ciura, Massimo
and Alicata, Rosario and Pirrone, Roberto},
journal={Data Science and Engineering},
year={2025},
publisher={Springer},
doi={10.1007/s41019-025-00297-8}
}
% VQA-RAD
@article{lau2018vqa,
title={A Dataset of Clinically Generated Visual Questions and
Answers about Radiology Images},
author={Lau, Jason J and Gayen, Soumya and Ben Abacha, Asma and
Demner-Fushman, Dina},
journal={Scientific Data},
volume={5},
pages={180251},
year={2018},
publisher={Nature Publishing Group},
doi={10.1038/sdata.2018.251}
}
% MedPix 原始数据库综述
@article{henigman2025medpix,
title={MedPix: Database of Medical Images, Teaching Cases, and
Clinical Topics},
author={Henigman, Alex and Kennedy, Brandon},
journal={Medical Reference Services Quarterly},
year={2025},
publisher={Taylor \& Francis},
doi={10.1080/02763869.2025.2533768}
}
§10 AI 使用声明卡
§10.1 AI 生成章节
| 章节 | AI 角色 | 人工角色 |
|---|---|---|
| §1 数据集概览 | AI 根据公开文献综述生成初稿 | 千方病案医学编辑部交叉审核 |
| §3 数据集规格 | AI 根据 MedPix-2.0 JSON Schema 和论文数据生成 | 同上 |
| §6 AI 就绪指南 | AI 提供的代码示例基于公开的标准 PyTorch API,非经 MedPix-2.0 实测验证 | 同上 |
| §7 DAIMS 评估 | AI 根据 DAIMS 框架和可获取的公开信息独立评估 | 同上 |
| 其余章节 | AI 根据 WebSearch + WebFetch 公开资料生成 | 同上 |
§10.2 输入来源
本条目编写过程中使用了以下信息源:
- Siragusa et al. (2025) MedPix-2.0 论文(arXiv + Springer DSE)
- Lau et al. (2018) VQA-RAD 论文(Scientific Data)
- Henigman & Kennedy (2025) MedPix 综述(Medical Reference Services Quarterly)
- MedPix-2.0 GitHub 仓库 README 和代码(CHILab1/MedPix-2.0)
- MedPix-2.0 Zenodo 存档(Zenodo Record #12624810)
- VQA-RAD HuggingFace 数据集页面(flaviagiammarino/vqa-rad;abhay2812/vqa-rad)
- MEDPIX-ClinQA HuggingFace 数据集页面(adishourya/MEDPIX-ClinQA)
- 原始 MedPix 网站(https://medpix.nlm.nih.gov/home)
- MedPix-2.0 论文 Table 1(数据集分类表——2,050 样本量来源)
- MedPix-2.0 论文 Table 1(CLIP baseline 结果——88.00% 模态 / 52.50% 部位)
- EmergentMind Radiologic VQA 综述(VQA-RAD SOTA 汇总)
- Papers with Code VQA-RAD Leaderboard
§10.3 人工验证范围
| 验证项 | 方法 | 状态 |
|---|---|---|
| MedPix 核心数字(59,000/12,000/9,000) | 多方来源交叉验证(NLM 官方、Oxford 大学、MSKCC、Zillman) | ✅ 已验证 |
| MedPix-2.0 数据量和 JSON schema | Zenodo 存档元数据 + 论文 Table 1 | ✅ 已验证 |
| VQA-RAD 样本量和划分数字 | HuggingFace 数据集页面 + 原始论文 | ✅ 已验证 |
| CLIP baseline 准确率 | MedPix-2.0 论文 Table 1 | ✅ 已验证 |
| VQA-RAD SOTA 排行榜 | Papers with Code + 论文原文 | ✅ 已验证 |
| MedPix 历史时间轴 | NLM 网站 + MSKCC 博客 + Smirniotopoulos 传记 | ✅ 已多方验证 |
| 许可证信息 | NLM 网站版权声明 + GitHub LICENSE + HuggingFace license 字段 | ✅ 已验证 |
§10.4 页面状态
页面状态:published — 全部内容已完成审核并发布。
