VQA-Med — 医学影像视觉问答年度评测 AI-Ready Wikipedia | 千方病案医数集

ImageCLEF 年度医学 VQA 挑战系列:2018-2024,多模态影像 + QA 对评测基准

来源 ImageCLEF / CLEF url: https://www.imageclef.org/发布时间: 2026-09-09最后更新: 2026-09-09 阅读 2

信息速览

数据集名称VQA-Med — 医学影像视觉问答年度评测 AI-Ready Wikipedia | 千方病案医数集
数据类型跨 7 个年度版本,累计约 3.5 万 QA 对,放射+内镜多模态,竞赛注册后获取,逐年评测协议完整
规模匿名医学影像问答对(非患者级,约 3.5 万 QA 对/7 年版)
接入方式ImageCLEF / CLEF url: https://www.imageclef.org/
AI 就绪度

VQA-Med — 医学影像视觉问答年度评测 AI-Ready Wikipedia

INFOBOX

数据集名称 VQA-Med(2023-2024 更名 ImageCLEFmedical MedVQA-GI)
英文全称 ImageCLEFmedical Visual Question Answering in the Medical Domain
别名/简称 VQA-Med 2018/2019/2020/2021、MEDVQA-GI 2023/2024、ImageCLEFmed VQA
疾病分类 放射异常为主(ICD-11:2A00.0 胶质母细胞瘤 / 2A08 脑膜瘤 / BD44 肺栓塞 / DB13 阑尾炎);2023-2024 转向消化道(DD71 溃疡性结肠炎 / DA24 食管炎)
SNOMED CT 63689002 Glioblastoma / 126952000 Meningioma / 59282003 Pulmonary embolism / 74400008 Acute appendicitis / 64766004 Ulcerative colitis / 51249003 Oesophagitis
数据模态 放射影像(2018-2021)+ 胃肠道内镜影像(2023-2024)+ 问答案对;2023 含分割掩码、2024 含图像-提示对
AI 任务类型 医学视觉问答(VQA)、视觉问题生成(VQG)、视觉定位问答(VLQA)、医学文本-图像合成
样本总数 跨版本累计约 3.5 万 QA 对;2019 单年版 15,292 QA/4,200 图
数据大小 逐年分发;2019 版约 186 MB(图片+QA 文本)
数据格式 TXT、JPEG、ZIP、JSON(各年版不一)
许可证 CC BY 4.0(2019 数据集明确声明)
访问级别 竞赛注册后获取(需签 End-User-Agreement);2019 训练/验证/测试公开于 Zenodo
DUO 标签 NRES(CC BY 4.0 公开子集)
语言 英文(问答与标注)
首发日期 2018(ImageCLEF 2018 首版 pilot)
最后更新 2024-09-12(ImageCLEF 2024,MEDVQA-GI 第二届)
发布机构 ImageCLEF(CLEF);2018-2021 由 NLM/NIH 与 Philips Research 主导,2023-2024 由 SimulaMet/OsloMet 主导
官方主页 https://www.imageclef.org/
下载地址 https://zenodo.org/records/10499039
DOI 10.5281/zenodo.10499039(2019 数据集)
引用次数 逐年任务以 CEUR/LNCS 发表(CLEF 2021 总览章 Springer 20 引、CLEF 2022 总览章 14 引);Google Scholar 精确计数未核,此处省略
AI 就绪度评分 ⭐⭐⭐(3/5)— 官方划分与评测代码齐备、test 子集医生校验;扣分项:逐年数据集彼此不连续、需自行多版对齐、QA 多为模板半自动生成、图像需从上游公开库整合
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、放射与消化道异常类别、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(逐年 ID 体系、QA 与图像关联字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核


医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。VQA-Med 各年版数据集以 CC BY 4.0 发布,参与评测需在 ImageCLEF/AICrowd 平台注册并签署 End-User-Agreement(EUA)。图像本体源自 PubMed Central、MedPix、HyperKvasir 与 Kvasir-Instrument 等公开库,使用时请一并遵守其各自许可。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? VQA-Med 是 ImageCLEF 在 CLEF 评测体系下举办的年度"医学视觉问答"挑战系列(2018-2024)。给一张医学影像配一个自然语言问题(例如"这张 MRI 的成像平面是什么?"“图像里最值得警惕的异常是什么?”),系统要基于影像内容作答。它不是一个单一文件,而是一系列逐年发布的评测数据集与任务。

为什么重要? 它是医学多模态 AI 最早、也是时间跨度最长的年度公开基准之一,横跨"看图答问"最典型的两个临床场景:放射影像(2018-2021,回答问题)与胃肠道内镜(2023-2024,先问答后转图像生成)。围绕它发表的逐年任务综述、逐年演进的规模与评测协议,成了社区理解医学视觉语言模型能力上限的标尺。

我能用它做什么? 你可以选任意一年的子集来训练/评测自己的视觉问答模型、视觉问题生成模型(VQG)、视觉定位问答模型(VLQA),或把它当作"放射影像 + 自然语言问答"的多模态预训练/评测集合;2023 版还带分割掩码,可测"问题驱动的区域定位"。每一版都配官方划分与评测代码,入手门槛低。

三点速记(读到任何"VQA-Med 数字"前先过一遍)

# 速记 含义
1 它是"评测线",不是单一数据集 2018-2024 逐年发布,字段/规模/任务各不同
2 训练 QA 半自动、测试参考答案医生校验 别把 train 当全人工金标准
3 2023 起领域与任务都变了 放射→内镜、问答→定位→图像合成,勿跨版直接比

§1.1 摘要(技术视角)

VQA-Med 的构造哲学是"半自动生成、医生抽验"。早年版(2018-2021)从公开医学库挑选影像,再以规则/模板从影像说明(caption)或预设模式批量生成问答对,只对测试集的参考答案做医生人工校验——这样以较低成本换来"可答性问题"(只问单个要素、答案能从影像本身读出,无需额外医学推理)的规模化语料。放射阶段刻意把问题分为难度梯度的四类:模态、平面、器官系统(可作分类任务)与异常(答案需生成),以同时考察判别与生成两种能力。2020 起新增视觉问题生成(VQG)任务,把流程反转为"由影像生成问题"。2023 年组织方从 NLM/Philips 转到挪威 SimulaMet/OsloMet,任务领域也从放射切到胃肠道内镜(基于 HyperKvasir 与 Kvasir-Instrument),新增了输出分割掩码的视觉定位问答(VLQA);2024 年更进一步把任务改造成"文本到图像"的医学影像合成评测。据此,任何"单一数字代表 VQA-Med 规模"的说法都是不准确的——规模必须逐年核对。

QA 生成流水线逐年差异

版本 选图 生成问答 医生介入
2018 PMC 论文图 规则问答生成系统从 caption 拆句 → 生成候选 → 排序 两遍人工校验
2019 MedPix(仅影像确诊病例) 问题模板生成 测试集两名医生校验
2020 MedPix 模板(聚焦 330 类异常) 测试答案医生校验
2021 MedPix 模板(VQA)+ VAE/T5 自动生成(VQG) 医生筛选 VQG、校验 VQA 测试
2023 GI HyperKvasir/Kvasir-Instrument 18 个固定问题模板 LabelBox 初标 + 医生复核(部分)
2024 GI 上游内镜图 临床医生写 483 个提示 医生撰写提示

"半自动生成"与"纯人工标注"的取舍:模板/规则生成能以极低成本铺大规模、且保证"问题能从影像读出"的结构可控;代价是语言表达同质化、缺少医生逐句临床推理。这正是 VQA-Med 与 VQA-RAD(全人工)的本质差异——前者重规模与评测框架,后者重单句临床质量。实践中二者常互补使用。

§1.2 战略价值

(1)纵向演化可作为医学 VQA 能力"温度计"。 从 2018 年的 6,413 QA 对到 2019 年的 15,292 QA 对,任务难度逐届爬坡,冠军指标(2019 年 BLEU 64.4%、accuracy 62.4%)与参赛队伍数(17 队)被官方记录。把它与逐年论文结合,能看清医学视觉语言任务从"分类式问答"走向"生成式问答"再走向"图像合成"的路径。

(2)评测"生态位"的稀缺性。 与 VQA-RAD(3,515 QA,最早人工标注)这类单点数据集不同,VQA-Med 提供的是连续多届、带官方划分与评测代码的基准家族。对要做跨年对比、消融研究或评测协议复现的团队,这套逐年框架的价值超过任何单一年份的图数之和。

§1.3 同类数据集横向对比

数据集 影像规模 QA 对 模态/领域 标注方式 核心差异化
VQA-Med 2019 4,200 图 15,292 放射 半自动模板 + test 医生校验 ImageCLEF 年度基准,四类难度梯度
VQA-RAD 315 图 3,515 放射 放射科医生人工 最早的人工标注医学 VQA
PathVQA 4,998 图 32,799 病理 专家人工 病理最大公开 VQA
SLAKE 642 图 14,028 放射 医生注解 + 双语 含知识图谱与分割框
PMC-VQA 149,000 图 227,000 放射/病理/显微 自动合成 大规模但质量偏弱
MEDVQA-GI 2023 3,949 图 18 问/图 × 图 内镜 计算机科学家初标 + 医生复核 唯一胃肠道内镜 VQA+VLQA

(对比数字来源见 §8.4;病理/放射计数以相关综述为据,详见 FACTS。)

§1.4 版本时间轴

版本 年份 领域 主要变化 规模(VQA 训练) 参与
VQA-Med 2018 2018 放射 首届 pilot,自 PMC caption 半自动生成 QA 5,413 QA / 2,278 图 5 队 17 run
VQA-Med 2019 2019 放射 转向 MedPix,四类问题(Modality/Plane/Organ/Abnormality) 12,792 QA / 3,200 图 17 队
VQA-Med 2020 2020 放射 专注 Abnormality;新增 VQG 子任务 4,000 QA / 4,000 图 11+3 组
VQA-Med 2021 2021 放射 VQG 用 VAE/T5 自动生成后医生筛选 复用 2020 训练(4,500 图) 13 队 75 run
(停办) 2022 ImageCLEFmedical 仅剩 Caption 与结核任务
MEDVQA-GI 2023 2023 内镜 转到胃肠道;新增 VLQA(分割掩码) 2,000 图开发 / 1,949 图测试 参与度下降
MEDVQA-GI 2024 2024 内镜 转文本到图像合成(IS + OPG) 2,000 图像-文本对 6 run(Task1)

逐年设计逻辑补述

  • 2018:作为 ImageCLEF 医学 domain 的 pilot,用 ImageCLEF 2017 caption 任务的 PMC 图 + 规则问答生成系统搭起第一套医学 VQA 语料,评测以 BLEU + 词级/概念级语义相似(WBSS/CBSS)为主。参与度尚小(5 队),但验证了"看图答问"在医学域可行。
  • 2019:数据源切到 MedPix、规模扩到 15,292 QA,并首次把问题拆成"难度梯度"的四类——前三类作分类、Abnormality 作生成。这一"问题分类"设计成为后续反复引用的框架。
  • 2020:把焦点收窄到 Abnormality 问答(一图一问),并首创医学域的视觉问题生成(VQG)子任务,拉开"问答 + 生成"双轨。
  • 2021:VQA 训练集直接复用 2020,换新验证/测试;VQG 改由 VAE/T5 自动生成问题再经医生筛选——开始把"自动生成 QA"的主流思路引入任务构造。
  • 2022 停办:ImageCLEFmedical 当年只保留 Caption 与结核任务,VQA 线中断一年(常被论文误记为仍在进行,需留意)。
  • 2023:组织权移交 SimulaMet/OsloMet,领域整体切到胃肠道内镜并更名 MEDVQA-GI,新增输出分割掩码的 VLQA,把"多模态输出"真正纳入 VQA。
  • 2024:任务定义进一步转为"文本到图像的医学影像合成"(Image Synthesis + Optimal Prompt Generation),用 FID/Inception Score 评测,标志该任务线从"读图作答"演进到"按文本造图"。

一句话定位:VQA-Med 不是一个静态数据集,而是一条跨越八年、领域与任务定义都在演进的医学视觉问答评测线——引用与复现前务必锁死年份。

§1.5 典型应用场景

  1. 多模态视觉问答模型评测:在 2019 版上按四类问题(模态/平面/器官/异常)分别报 accuracy 与 BLEU,定位模型短板。
  2. 医学视觉语言预训练/下游微调:把 VQA-Med 多年 QA 对当作轻量预训练语料,再微调到 VQA-RAD、SLAKE 等下游(2022 前后多篇多模态模型论文复用 ImageCLEF 数据)。
  3. 问题生成(VQG)评测:用 2020/2021 VQG 子集测"看图提问"能力(BLEU/ROUGE/METEOR/CIDEr)。
  4. 问题驱动的定位(VLQA):在 2023 GI 子集上做"根据问题产出分割掩码",用 Dice/mIoU 评估。
  5. 医学图像合成评测:用 2024 版图像-提示对评测 text-to-image 扩散模型的医学真实性(FID/Inception Score)。

合适 / 不合适清单

场景 合适? 说明
训练/评测医学视觉问答模型 ✅ 合适 官方划分清晰、评测代码开源
视觉语言模型做跨库微调预训练 ✅ 合适 作为轻量语料再迁移 VQA-RAD/SLAKE
做逐年难度/指标趋势的纵向研究 ✅ 合适 2018-2021 放射阶段任务口径较连续
作为临床决策支持系统独立训练源 ❌ 不合适 训练 QA 半自动、无人口学与结局字段
证明"模型在真实患者人群上的诊断精度" ❌ 不合适 非人群样本,图像来自公开研究库
做公平性/群体差异审计 ❌ 不合适 无年龄/性别/种族等元数据

§1.6 常见疑问速答

  • VQA-Med 是一个文件吗? 不是,它是 2018-2024 逐年发布的评测系列,每年版数据、任务与领域都可能不同(放射→内镜、问答→图像合成),务必先锁年份。
  • "约 1.5 万 QA"是它的总规模吗? 那只是 2019 单年版;2020/2021 是各 5,000 图的一图一问(VQA),加上 VQG 与 2023-2024 GI,累计超 3 万 QA 对。
  • 2022 有 VQA-Med 吗? 没有,ImageCLEFmedical 2022 只剩 Caption 与结核任务,VQA 线当年停办。
  • 我能直接拿它训练诊断模型吗? 它是评测/教学基准,训练 QA 半自动生成且无患者结局字段,不宜当独立临床诊断训练源。
  • 图像本体要单独下载吗? 部分版本(尤其 GI 版)影像来自 HyperKvasir/Kvasir-Instrument 上游,需另行组装对齐。
  • 答"哪一年"最省事? 通用放射评测选 2019(QA 最丰富),快速跑通用 pipeline 选 2018(最小)。

§2 医学背景

§2.1 ICD-11 编码映射

VQA-Med 的图像标签不是 ICD 编码,而是问答对与异常名。下表把放射阶段反复出现的异常答案实体映射到 ICD-11 类别(代表数据集问答所覆盖的疾病概念,非库内自带的 ICD 标注)。

问答中的异常实体 ICD-11 类别 出现语境(源自官方示例/统计)
脑膜瘤(Meningioma) 2A08 脑膜瘤 放射影像异常问答高频答案(2019 Abnormality 统计)
胶质母细胞瘤(Glioblastoma) 2A00.0 胶质母细胞瘤 放射异常问答高频答案
肺栓塞(Pulmonary embolism) BD44 肺栓塞 异常问答示例答案
急性阑尾炎(Acute appendicitis) DB13 急性阑尾炎 2019 Abnormality 高频答案
结肠息肉(Polyp) 2E92 等结肠息肉/肿瘤前体 2023-2024 GI 主对象
溃疡性结肠炎(Ulcerative colitis) DD71 溃疡性结肠炎 2023 GI 问答示例异常
食管炎(Oesophagitis) DA24 食管炎 2023 GI 问答示例异常

§2.1b SNOMED CT 映射

概念 ICD-11 SNOMED CT SNOMED CT 术语
脑膜瘤 2A08 126952000 Meningioma (disorder)
胶质母细胞瘤 2A00.0 63689002 Glioblastoma (disorder)
肺栓塞 BD44 59282003 Pulmonary embolism (disorder)
急性阑尾炎 DB13 74400008 Acute appendicitis (disorder)
结肠息肉 2E92 79250009 Polyp of colon (disorder)
溃疡性结肠炎 DD71 64766004 Ulcerative colitis (disorder)
食管炎 DA24 51249003 Oesophagitis (disorder)

§2.2 任务对应的临床背景与流行病学

医学视觉问答的目的,是把"影像内容的理解"翻译成可查询、可教育的自然语言问答。在放射阶段,问题聚焦单要素——是什么成像设备(模态:CT/MRI/超声/X 光/平扫/增强)、在哪个切面(平面:axial/sagittal/coronal)、主要显示哪个器官系统、以及"最值得警惕的异常是什么"。官方刻意只收"答案能从图像读出、无需额外医学推理"的问题,以保证自动评测的公平性。这既贴近放射科医生读片的"第一眼"判断,也贴近患者解读自身报告时的浅层疑问。

从影像学角度看,放射阶段覆盖的器官系统统计(2019 训练集 Organ System 高频答案依次为颅骨及内容物、肌肉骨骼、消化道、肺/纵隔/胸膜、脊柱、泌尿生殖、面/鼻窦/颈、血管淋巴、心脏大血管、乳腺)几乎横跨全身断层成像的常规解读范围。高频异常(脑膜瘤、胶质母细胞瘤、肺栓塞、急性阑尾炎、动静脉畸形等)与神经、胸腹急症相关,恰好是"影像可确诊、问题可读图作答"的典型场景——这正是官方选题的取舍:只留影像本身足够回答问题、不需要病历与实验室背景的病例。

GI 阶段则落到结直肠镜检查的实操问题:息肉是否已摘除、检出难易、异常/解剖标志/器械的位置与颜色、按巴黎分型(Paris classification)报告的息肉大小与形态等。结直肠癌是全球负担极高的消化道恶性肿瘤,而内镜检出并切除腺瘤性息肉是其有效早筛路径;围绕 HyperKvasir/Kvasir-Instrument 构建的 18 问模板因此自带"结直肠早筛质量指标"(腺瘤检出率、分型报告、器械识别)的意味,使 MEDVQA-GI 比通用问答更贴近真实内镜工作流。

流行病学上需强调:VQA-Med 各年版都不是人群队列,不含年龄/性别/种族等人口学字段,也无法给出患病率。它的价值是"病种覆盖的教学与评测语料",而非疾病分布样本。

§2.2b 病种覆盖与临床相关性要点

  • 放射阶段答案实体集中在神经肿瘤(脑膜瘤、胶质母细胞瘤、髓母细胞瘤等)、血栓/血管病(肺栓塞、动静脉畸形)、急腹症(阑尾炎、憩室炎)、弥漫性肺/脑病变(结节病、多发性硬化、脑脓肿)等"影像可见异常"。
  • 这些异常在 ICD-11/SNOMED 上分属不同章节(§2.1/§2.1b),数据集内并不带编码,映射是"按语义对应"而非"标签即编码"。
  • GI 阶段答案面向内镜医生熟悉的操作词表:息肉(分型/大小/数量)、炎症(食管炎、溃疡性结肠炎)、器械(活检钳、金属夹、息肉圈套器)、解剖标志(Z 线、回盲瓣、幽门)。

§2.3 临床任务定义

AI 任务 临床定义 输入 期望输出 评估指标
视觉问答(VQA) 依据影像内容回答临床问题 影像 + 问题 文本答案(分类或生成) accuracy、BLEU(2018 另有 WBSS/CBSS)
视觉问题生成(VQG) 依据影像内容生成相关问题 影像(+参考答案) 自然语言问题 BLEU/ROUGE/METEOR/CIDEr
视觉定位问答(VLQA) 依据"哪里异常"的问题定位区域 影像 + 定位问题 分割掩码 Dice、mIoU 等
医学图像合成(2024) 依据文本提示合成逼真医学影像 文本提示 合成 GI 影像 FID、Inception Score

放射阶段问题难度梯度设计:官方有意把前三类(Modality/Plane/Organ System)设为"可当多类分类处理"的低中难度,把 Abnormality 设为"需要生成答案"的高难度。这样一套数据同时考察判别(分类)与生成两种能力,也是它在方法学上比普通"单答案词表" VQA 更贴近临床解释的原因。

各类别的典型问答对(来自官方 2019 示例)

类别 示例问题 参考答案
Modality “what is the mr weighting in this image?” t1 / t2 / flair
Plane “which plane is the image shown in?” axial
Organ System “what organ system is shown in this x-ray?” musculoskeletal
Abnormality “what is most alarming about this ultrasound?” 病变名(生成式,多词)

§2.4 患者/影像人群

阶段 影像来源 时间 覆盖 说明
2018 PubMed Central(PMC)论文图 持续积累 多科室医学影像 本质是 ImageCLEF 2017 caption 子集
2019-2021 MedPix 放射库 持续积累 放射(含 X 光/CT/MRI/US) 仅取"诊断基于影像"的病例
2023-2024 HyperKvasir + Kvasir-Instrument 持续积累 全消化道内镜(口→肛),含息肉/器械/正常 图像非患者级档案,来自公开研究库

§2.5 临床价值

VQA-Med 的临床价值主要在读片解释与教学:把"看图问答"标准化,让 AI 系统学习"用一句话回答医生/患者关于影像的直观疑问"。它不直接提供病变分割框(除 VLQA),也不含治疗结局,因此更适合作为医学影像理解能力的评测与教学脚手架,而非独立诊断工具。对临床决策支持的启示集中在"第二意见":当医生不确定某个征象名称或层面归属时,一个经 VQA-Med 训练出的解释系统能给出可读、可核对的描述。

§2.6 金标准(Ground Truth)表

划分 标注方式 标注者 性质
2018 训练/验证 规则 QG 自动生成 + 两位专家两遍校验 一名 proofreader + 一名临床医生 半自动、人工校对
2019 测试集 模板自动生成后医生人工校验 两名医生 人工校验参考答案
2020/2021 测试集 模板/模型生成后医生人工校验 医生 人工校验
2023 GI 开发/测试 LabelBox 中计算机科学家初标,医生复核 计算机科学家 + 消化科医生 部分样本未复核(官方披露)
2024 图像-提示对 医生撰写临床提示(483 个) 临床医生 用于 text-to-image 评测

§3 数据集规格

§3.0 版本抉择矩阵(多版本时务必先定版)

你的需求 推荐版本 规模 理由
通用放射 VQA 评测(图数最多) VQA-Med 2019 15,292 QA / 4,200 图 QA 对最丰富、四类问题齐全、官方划分清晰
异常/生成式问答 VQA-Med 2020/2021 各 5,000 图 + VQG 专注 Abnormality;2021 复用 2020 训练集
端到端快速起步 VQA-Med 2018 6,413 QA / 2,866 图 最小、最快,适合跑通 pipeline
内镜 VQA + 定位(掩码) MEDVQA-GI 2023 2,000 开发 / 1,949 测试 唯一带 VLQA 分割掩码版本
医学图像合成 MEDVQA-GI 2024 2,000 图像-文本对 官方即用于 text-to-image 评测

§3.1 模态详情

  • 放射影像(2018-2021):以 MedPix/PMC 为代表的 X 光、CT、MRI、超声等静态影像,带模态标签线索(T1/T2/FLAIR/contrast/non-contrast 等)。
  • 内镜影像(2023-2024):HyperKvasir 的胃肠道内镜静态图(含息肉、炎症、器械、正常黏膜等),来自结肠镜与胃镜等不同流程。
  • 问答案对(文本):逐年伴随图像给出,含问题类别与参考答案。
  • 分割掩码(2023):仅对含息肉与器械的图像提供掩码。
  • 图像-提示对(2024):文本提示描述期望生成的影像内容。

§3.2 按子集样本数(逐年表)

版本 训练(影像/QA) 验证(影像/QA) 测试(影像/QA 或问题)
2018 2,278 / 5,413 324 / 500 264 / 500 问
2019 3,200 / 12,792 500 / 2,000 500 / 500 问
2020 VQA 4,000 / 4,000 500 / 500 500 / 500 问
2020 VQG 780 / 2,156 141 / 164 80 图
2021 VQA 4,500 / 4,500(复用 2020) 500 / 500 500 / 500 问(Abnormality)
2021 VQG 85 / 200 100 / 302 问
2023 GI 2,000(开发)/ 18 问·图 1,949 / 18 问·图
2024 GI 2,000 图像-文本对 提示合成(5,000 prompts)

§3.3 格式表

版本 图像格式 问答格式 打包
2018 JPG TXT(question/answer 行) 分集 ZIP
2019 JPG TXT + 按类别目录 ZIP / Zenodo record
2020-2021 JPG 由官方 TXT/评估包管理 AICrowd + GitHub
2023 GI JPG/PNG(内镜) JSON(ImageID + question/answer) GitHub 分发
2024 GI JPG/PNG + CSV 提示 CSV GitHub 分发

§3.2b 各版任务的"输入 → 输出"形态对照

版本/任务 输入 期望输出 输出形态
2018 VQA 影像 + 问题 文本答案 短答案(分类/生成混)
2019 VQA 影像 + 问题 Modality/Plane/Organ 分类答案;Abnormality 生成 分类标签 + 生成文本
2020/2021 VQA 影像 + Abnormality 问题 异常名/描述 生成文本(一图一问)
2020/2021 VQG 影像(+参考答案) 自然语言问题 生成文本
2023 VQA/VQG 影像 + 问题(或答) 文本答案/问题 文本(含"不可答")
2023 VLQA 影像 + "哪里"问题 分割掩码 图像掩码
2024 IS/OPG 文本提示 合成 GI 影像 / 最优提示 图像 / 文本

这清楚表明:2023 起"视觉问答"输出已不只文本,而是延伸到掩码(VLQA)与整图(合成)——这是本文档反复提醒"勿把 VQA-Med 当纯问答文本库"的根本原因。

§3.4 存储大小

逐年分发的整包体积无统一数字;2019 版(图片 + QA 文本)在第三方镜像记载约 186 MB。下载整包前建议按所选取的单一版本与子集下载,避免跨版堆积(2018-2024 全量累计通常需数 GB 量级,视图像分辨率而定)。

§3.5 标注方式

整体为半自动/弱监督为主、测试子集人工校验的策略:早年版用基于规则的问答生成系统(2018)或问题模板(2019-2021)从影像说明批量产出 QA;2023 用 LabelBox 由计算机科学家初标 + 消化科医生复核;2024 图像-提示对由临床医生撰写提示(483 个唯一提示,与 2,000 图组合成约 20,000 对)。官方在多版均强调测试集参考答案由医生人工校验。

§3.6 标注者资质与一致性

放射阶段:校验医生来自 NLM/临床合作;2018 采用"一名 proofreader + 一名临床医生"两遍制;2019-2021 测试集参考答案医生人工校验。GI 阶段(2023):计算机科学家初标,具多年 GI 诊断经验的医学专家复核,但因时间所限并非所有样本都经专家复核(官方明示,后续计划发布更完整版本)。跨年版标注者不完全一致,一致性数字未公开,使用时需把"模板生成的训练 QA"与"医生校验的测试 QA"区别对待。

§3.7 采集周期

影像采集周期未逐图公开,图像源自持续更新的公开库(PMC、MedPix、HyperKvasir)。评测活动按年进行:每年数据在 2-3 月发放训练/验证、4 月前后发测试,9 月 CLEF 会议汇总(以各年版 schedule 为准)。

§3.8 地域覆盖

图像本体来自多个公开国际库(美国 PMC/MedPix、挪威 Simula 系的 HyperKvasir/Kvasir-Instrument),不构成单一地理人群档案;问答与标注语言均为英文。

§3.9 设备规格

  • 放射阶段:未统一规定采集设备,图像来自 MedPix/PMC 多源(CT/MRI/US/X 光各异)。
  • GI 阶段:来自 HyperKvasir/Kvasir-Instrument 的内镜图像,分辨率与设备随上游库而变化,无统一 DICOM 元数据。
  • VLQA 掩码:LabelBox 标注,覆盖息肉与器械区域。

§3.10 深度溯源链

环节 来源 说明
放射图像 MedPix(NLM) 2019-2021 放射版主源,只取"诊断基于影像"病例
早期图像 PubMed Central 2018 版,沿用 ImageCLEF 2017 caption 图像集
内镜图像 HyperKvasir / Kvasir-Instrument(Simula) 2023-2024 主源,公开研究库
QA 标注 官方组织方(NLM/Philips → SimulaMet) 模板/规则生成 + 医生抽验
评测 ImageCLEF CEUR/LNCS 综述 逐年公开结果与评测代码

溯源与许可提醒:VQA-Med 的"数据集本体"与"上游影像"是两层不同的许可链——组织方发布 QA/JSON(多为 CC BY 4.0 或经 EUA 授权),而图像版权/许可归属各自上游库(MedPix 学术用途、HyperKvasir/Kvasir-Instrument 开源研究许可)。发布衍生模型或重发布数据前,需分别核对:

  • QA 与评测代码:按官方 release 页声明(CC BY 4.0 或竞赛条款)。
  • 图像本体:遵守 MedPix/PMC/HyperKvasir/Kvasir-Instrument 各自许可与署名要求。
  • 参与测评:签署 EUA 后不得把开发数据用于官方授权范围之外。

这也是坑点 7 的合规延伸:任何"从公开库拉图 + 官方 QA 组装"的再分发,都要逐层确认许可。


§4 数据结构

§4.0 目录树(以 2019 版为代表)

ImageClef-2019-VQA-Med-Training/
├── All_QA_Pairs_train.txt        # 每行 image_id<TAB>question<TAB>answer
├── QAPairsByCategory/            # 按问题类别分目录
│   ├── Modality/
│   ├── Plane/
│   ├── Organ_System/
│   └── Abnormality/
├── train_ImageIDs.txt
└── Train_images/                 # 对应图像 JPG

VQAMed2019Test/
├── README-VQA-Med-2019-TestSet.txt
├── VQAMed2019_Test_Images.zip
└── VQAMed2019_Test_Questions.txt

(2020-2021 以 GitHub/AICrowd 包管理;2023 GI 以 JSON 记录每图多问答;2024 以 CSV 记录图像-提示对。)

2023 GI 的真值 JSON(示意)——Task1/VQA 每图一个文件,Labels 内为若干问题-答案项:

{
  "ImageID": "gastroscopy_001",
  "Labels": [
    {"Question": "What type of procedure is the image taken from?",
     "AnswerType": "Text",
     "Answer": "Colonoscopy"},
    {"Question": "How many polyps are in the image?",
     "AnswerType": "Number",
     "Answer": "1"}
  ]
}

2024 图像-提示对(示意 CSV)——开发集把 2,000 张图与 483 个唯一临床提示组合成约 20,000 对:

image_filename,prompt
img_0001.jpg,Generate an image containing a polyp
img_0001.jpg,Generate an image from a colonoscopy procedure
img_0002.jpg,Generate an image containing oesophagitis

§4.1 DAIMS 标准化字段描述表

以 2019 版核心 QA 记录为对象(逐年字段命名略异,含义一致):

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
image_id Text 影像标识,对应 JPG 文件名 CT_1 图像-问答关联 库内图像 ID
question_id Text/Int 问题唯一标识 Q0001 问题索引 逐年定义
question Text 自然语言问题 “which plane is the image shown in?” 语言编码输入 模板化表达 单要素问句
question_type Text 问题类别 Modality/Plane/Organ System/Abnormality 分层评测/消融 类别归属由官方定 4 类(GI 版 18 问)
answer Text 参考答案 “axial” 训练标签/评测真值 训练 QA 为模板生成 模板噪声 见 §4.2
answer_type Text 答案性质 分类短答案 / 生成长文本 选择评测方式 GI 版 text/binary/number
split Text 训练/验证/测试划分 train/val/test 泄漏控制 官方划分 3 值
mask (Image) 分割掩码(仅 VLQA) 定位训练 需专家校验 部分图像无掩码 二元掩码

§4.2 标签分布

放射阶段标签主要呈"类别 + 短答案"形态。以 2019 训练集官方统计(第三方案例库整理,频次括号为该类别内出现次数)为例:

问题类别 高频答案(频次) 形态
Modality no(554)、yes(552)、xr-plain film(456)、t2(217)、us-ultrasound(183)、t1(137)、contrast(107)、ct noncontrast(102)、cta(45) 二分类 + 模态名分类
Plane axial(1558)、sagittal(478)、coronal(389)、ap(197)、lateral(151)、frontal(120)、pa(92)、transverse(76)、oblique(50) 分类
Organ System skull and contents(1216)、musculoskeletal(436)、gastrointestinal(352)、lung/mediastinum/pleura(250)、spine(234)、genitourinary(214)、face/sinuses/neck(191)、vascular(122)、heart/great vessels(120)、breast(65) 分类
Abnormality yes(62)、no(48)、meningioma(30)、glioblastoma multiforme(28)、pulmonary embolism(16)、acute appendicitis(14)、avm(14)、arachnoid cyst(13)、schwannoma(13)、tuberous sclerosis(13) 二分类 + 生成式诊断名

可以看出:Modality/Plane/Organ System 三类强偏斜到少量高频答案(适合分类评测),而 Abnormality 是长尾诊断名(答案需生成,难度最高)。早期各年版以 yes/no 类占比显著;GI 阶段 18 个模板问题覆盖流程类型、颜色、数量、位置、大小与巴黎分型。全库标签分布随年度与领域差异巨大,官方未提供统一直方图,使用时应按所选年份单独统计。

§4.2b 问题类型在四个放射问题类别中的样例

类别 问题风格(来自官方 2019 示例) 能否归类为分类任务
Modality “was gi contrast given?” “what is the mr weighting?” “is this t1/t2 or flair?”
Plane “what is the plane of this mri?” “in what plane is this mammograph taken?”
Organ System “what organ system is shown in this x-ray?” “what is the organ principally shown?”
Abnormality “does this image look normal?” “what is most alarming about this ultrasound?” 否(生成)

§4.3 关键统计

  • 2019 版约 3-4 个问题/图像(训练集),总 15,292 QA/4,200 图。
  • 2020 版 VQA 为"一图一问"结构(4,000+500+500),问题全为 Abnormality 方向。
  • 2023 GI 每图固定 18 问(Task1/VQA),但并非每问都对给定图像可答(官方提示需处理"无正确答案")。
  • 2024 开发集 2,000 图 + 483 个唯一提示 → 约 20,000 图像-文本对(每图约 10 个描述,7-14 范围)。

§4.4 数据层级

VQA-Med 是"图像 → 问答对"的扁平多对一关系,不包含患者→检查→序列→切片的层级病历结构。2023 VLQA 才附加"图像 → 掩码"的第二张语义图。因此它的关系复杂度远低于 MIMIC 类临床库,字段字典以影像 + QA 两表为主。

§4.5 缺失值与信息性缺失编码

  • 测试集默认不公开参考答案(赛后统一评分),属"受控缺失"而非随机缺失。
  • 2023 GI 中"某些问题对某些图像无正确答案"(如无息肉图像被问息肉大小),官方明确要求模型能输出 not relevant/no correct answer,这是信息性缺失
  • VLQA 掩码只覆盖息肉与器械子集,其余图像无掩码。

§5 数据划分与使用建议

§5.1 官方划分

各年版均由官方提供训练/验证/测试三划分(2023-2024 为开发/测试)。放射阶段(2018-2021)划分按图像与问答对给出,测试集参考答案为受控公布;2021 训练集显式复用 2020 训练集。2023 GI 开发 2,000 图、测试 1,949 图;2024 开发 2,000 图像-文本对,测试以提示列表做合成评估。

§5.2 社区惯例划分

多数论文直接在官方 train 上训练、在官方 val/test 上报告。跨年复用时,研究团队常把 VQA-Med 2019-2021 训练集合并作为补充预训练语料,或用 ImageCLEF 2022 caption 数据预训练视觉语言模型后在 VQA-Med/VQA-RAD/SLAKE/PathVQA 上微调。

§5.3 泄漏风险(重点)

  • 图像级划分需自觉:同一幅 MedPix 影像在 2019/2020/2021 各年版可能以不同 QA 重复出现,跨年合并时若不做图像去重,会把"同一张图"泄进训练与测试。官方只保证当年内训练/测试图不重叠,不保证跨年版去重。
  • VQG 双向泄漏:2021 用 VAE/T5 等模型自动生成 VQG 训练问题,若你训练自己的 VQG 生成器又在同一批 VQA 图像上评测,会高估问题质量。
  • 模板化问题泄漏:训练 QA 由模板生成,测试也部分同源,模型易学到"模式记忆"而非真正读图;跨模板(跨年)泛化会显著掉点。

§5.4 交叉验证建议

  • 若要做跨图泛化估计,请以影像 ID(而非 QA 行)为分组做 GroupKFold,确保同一幅图不横跨训练与验证。
  • 跨年版堆叠做 CV 时,先按图去重再分 fold。

§5.5 外部验证建议

VQA-Med 是"训练+评测"闭环的强基基准,外部验证常以另一套人工标注数据(如 VQA-RAD)做 transfer:在 VQA-Med 上预训练/评测后,在 VQA-RAD 测试集上复核 accuracy,观察跨库掉点幅度,能暴露对模板风格的过拟合。

§5.6 泄漏安全的图像级划分代码(跨年版合并时用)

# 跨年合并(2019+2020+2021)时按 image_id 分组切分,防止同图进测试
from sklearn.model_selection import GroupKFold

# df: 长表,列 image_id / question / answer / question_type / year
# 先在全库做一次图级去重
df = df.drop_duplicates(subset=["image_id"])
gps = df.groupby("image_id")["year"].first().to_dict()

gkf = GroupKFold(n_splits=5)
X, y = df.index.values, df["answer"].values
groups = df["image_id"].values
for tr_idx, va_idx in gkf.split(X, y, groups):
    # 校验: 训练/验证图零交集
    train_imgs = set(df.iloc[tr_idx]["image_id"])
    val_imgs = set(df.iloc[va_idx]["image_id"])
    assert train_imgs.isdisjoint(val_imgs), "图像泄漏!"

§5.7 划分策略速查

你的目标 推荐划分 注意
复现官方当年结果 直接用官方 train/val/test 勿自行重划分
跨年评估模型泛化 图级去重 + 按图 GroupKFold 防同图泄漏
长期"难度演化"研究 以年为 unit 分组 报告需注明不可直接比较
迁移到 VQA-RAD VQA-Med 训练 → VQA-RAD 测试 外部校验人工标注泛化

§6 AI 就绪指南 ⭐

§6.0 云端快速启动(可选)

若仅跑通评测,可直接用官方 GitHub(abachaa/VQA-Med-2019 等)里的评测代码与已发布测试集,无需自建服务。想省下载,可用 Zenodo/官方 release 直接拉对应年份压缩包(见 §6.2)。

§6.1 快速上手

目录结构预期:下面脚本假设你把单年版解压到 data_root,其中 train/val/ 各含图像文件与 QA 文本。这里以 2019 版目录为例(All_QA_Pairs_train.txt 在训练根目录)。data_root 拼接关系os.path.join(data_root, split, image_filename)最小可用子集:直接读 All_QA_Pairs_train.txt 的前 N 行即可构建首批样本。

import os, random

DATA_ROOT = "/path/to/ImageClef-2019-VQA-Med"   # 指向解压根
MINI = 32                                        # 最小可用子集行数

# 读取 2019 训练问答
with open(os.path.join(DATA_ROOT, "ImageClef-2019-VQA-Med-Training",
                       "All_QA_Pairs_train.txt"), encoding="utf-8") as f:
    rows = [ln.rstrip("\n").split("\t") for ln in f if ln.strip()]
# 每行预期: image_id<TAB>question<TAB>answer (示例, 以官方 README 为准)

rows = rows[:MINI]   # 先跑最小子集
print("样例:", rows[0])

解析问题类别(question_type)——2019 版把 QA 按类别放目录(QAPairsByCategory/{Modality,Plane,Organ_System,Abnormality}),可从文件名反推类别:

import glob, os

base = os.path.join(DATA_ROOT, "ImageClef-2019-VQA-Med-Training", "QAPairsByCategory")
cat_rows = []
for txt in glob.glob(os.path.join(base, "**", "*.txt"), recursive=True):
    cat = os.path.basename(os.path.dirname(txt))
    with open(txt, encoding="utf-8") as f:
        for ln in f:
            if not ln.strip():
                continue
            parts = ln.rstrip("\n").split("\t")
            cat_rows.append((parts[0], cat, parts[1], parts[2]))  # img, cat, q, a
# 统计各类别规模
from collections import Counter
print(Counter(r[1] for r in cat_rows))

读取 2023 GI 开发集 JSON——每图一个 JSON,把"无正确答案"标记出来:

import json, os
d = os.path.join("/path/to/vqa2023_gi", "development")
records = []
for fn in os.listdir(d):
    if not fn.endswith(".json"):
        continue
    rec = json.load(open(os.path.join(d, fn), encoding="utf-8"))
    for lab in rec.get("Labels", []):
        ans = (lab.get("Answer") or "").strip().lower()
        records.append({
            "image_id": rec["ImageID"],
            "question": lab["Question"],
            "answer_type": lab.get("AnswerType"),
            "answer": ans if ans not in ("", "not relevant") else "<NA>",
        })
print("总记录:", len(records), "无正确答案:", sum(r["answer"]=="<NA>" for r in records))

§6.2 数据获取

版本 位置 说明
2019 训练/验证/测试 https://zenodo.org/records/10499039 官方完整集
2019 测试与参考答 GitHub abachaa/VQA-Med-2019 含 README
2020/2021 AICrowd + GitHub abachaa/VQA-Med-2020 需注册
2023 GI GitHub simula/ImageCLEFmed-MEDVQA-GI-2023 / ImageCLEF 组织仓库 需 EUA
2024 GI GitHub simula/ImageCLEFmed-MEDVQA-GI-2024 需 EUA
内镜底图 datasets.simula.no/hyper-kvasir 、 /kvasir-instrument 上游公开库

获取要点:ImageCLEF 各任务普遍要求在竞赛平台注册并签署 End-User-Agreement(EUA)后才下载开发数据;2019 完整集另以 CC BY 4.0 放于 Zenodo,可直接取用。内镜版图像需另从 HyperKvasir/Kvasir-Instrument 拉取并自行组装 QA。

拉取 2019 版(Zenodo,直接可用)示例

# 创建目录并下载 2019 完整集(按实际 ZIP 名调整,见 Zenodo record 10499039 文件列表)
mkdir -p vqamed2019 && cd vqamed2019
wget -r -np -nH --cut-dirs=1 \
     -A "*.zip,*.txt" \
     https://zenodo.org/records/10499039
# 解压训练集
unzip "ImageClef-2019-VQA-Med-Training*.zip" -d ImageClef-2019-VQA-Med-Training

注:Zenodo 文件结构随上传时间可能调整,请以该 record 当前文件列表为准;2020 版需在 AICrowd 平台登录并签署 EUA 后下载。

§6.3 预处理全流程

import os, json, re
import pandas as pd

DATA_ROOT = "/path/to/vqa2023_gi"   # 2023 GI 开发集根
out = []

for sub in ["development"]:
    d = os.path.join(DATA_ROOT, sub)
    # 2023 GI 每图一个 JSON,内含 ImageID 与 Labels(question/answer)
    for fn in os.listdir(d):
        if not fn.endswith(".json"):
            continue
        with open(os.path.join(d, fn), encoding="utf-8") as f:
            rec = json.load(f)
        img = rec.get("ImageID")
        for lab in rec.get("Labels", []):
            q = lab.get("Question", "").strip().lower()
            a = lab.get("Answer", "").strip()
            out.append({"image_id": img, "question": q, "answer": a})

df = pd.DataFrame(out)
# 处理“无正确答案”的信息性缺失:空/not relevant 保留为专门 token
df["answer"] = df["answer"].replace({"": "<NA>", "not relevant": "<NA>",
                                      "Not relevant": "<NA>"})
print(df.shape)
print(df["answer"].value_counts().head(10))

§6.4 PyTorch DataLoader(2019 版为例)

import os
import torch
from torch.utils.data import Dataset, DataLoader
from torchvision import transforms
from PIL import Image

class VQAMed2019(Dataset):
    """加载 2019 VQA-Med。image_dir 里放图像,qa_lines 为 [(img, q, a)]"""
    def __init__(self, qa_lines, image_dir, transform=None, vocab=None):
        self.qa = qa_lines
        self.image_dir = image_dir
        self.transform = transform or transforms.Compose([
            transforms.Resize((224, 224)),
            transforms.ToTensor(),
        ])
    def __len__(self):
        return len(self.qa)
    def __getitem__(self, i):
        img, q, a = self.qa[i]
        pil = Image.open(os.path.join(self.image_dir, img)).convert("RGB")
        return self.transform(pil), q, a

# 用 §6.1 解析出的 rows 前 N 行构造
img = os.path.join(DATA_ROOT, "ImageClef-2019-VQA-Med-Training", "Train_images")
dataset = VQAMed2019(rows, img)
loader = DataLoader(dataset, batch_size=8, shuffle=True)
x, q, a = next(iter(loader))
print("batch image tensor:", x.shape)

2023 GI 变体(可含 VLQA 掩码)——注意把"无正确答案"对齐成固定 token,掩码仅当存在时返回:

class MedVQAGI(Dataset):
    """2023 GI VQA/VLQA。records 含 image_id/question/answer(<NA> 表示不可答),
    masks 为 {image_id: (PIL mask)} 可选;question_ids 需全量 0-17 对齐。"""
    def __init__(self, records, image_dir, transform=None, masks=None):
        self.rec = records
        self.image_dir = image_dir
        self.masks = masks or {}
        self.transform = transform or transforms.Compose([
            transforms.Resize((224, 224)), transforms.ToTensor()])
    def __len__(self):
        return len(self.rec)
    def __getitem__(self, i):
        r = self.rec[i]
        pil = Image.open(os.path.join(self.image_dir, r["image_id"])).convert("RGB")
        x = self.transform(pil)
        ans = r["answer"]            # 已把 not relevant 归一为 "<NA>"
        mask = None
        if r["image_id"] in self.masks:
            mask = torch.as_tensor(self.masks[r["image_id"]], dtype=torch.float32)
        return x, r["question"], ans, mask

§6.5 常见坑点

⚠️ 坑点 1:跨年版是"不同数据集",不是同一数据集的多个版本(分类:数据泄漏)

问题:VQA-Med 2019(15,292 QA/4,200 图)与 2020/2021(各 5,000 图、一图一问)规模、问题类别、图像来源都不同,2021 更直接复用 2020 训练集。把多年合并或当单一 version 处理会引入重复样本与域偏移。

症状:跨年堆叠后分类 accuracy 虚高;同一幅 MedPix 影像以不同 QA 出现在 train 与 test;报告里"VQA-Med accuracy"因年份不同而不可比。

解决

  1. 简单方法:每次只明确说明用的哪一年,标题写清如"VQA-Med 2019"。
  2. 进阶方法:跨年合并前按 image_id 全库去重,保留首次出现的 QA;用 GroupKFold 按图分组。
  3. SOTA 方法:构建"多版拼接 + 图像级 dedup + 版次特征"的规范训练/评测协议并公开,作为社区可复现 baseline。

参考:ImageCLEF 各年版 overview(CEUR)。

⚠️ 坑点 2:训练 QA 是"模板/半自动生成",只有测试参考答案经医生校验(分类:标签理解)

问题:早年版训练 QA 由规则/模板从影像说明批量产出,官方只在测试集做医生人工校验;把模板 QA 当人工金标准会放大"模式记忆"假象。

症状:训练 loss 很低但换用别的库(VQA-RAD)时 accuracy 大幅跳水;能背下模板却不认识未见过的问法。

解决

  1. 简单方法:显式区分 train(半自动)与 test(医生校验),报告时以 test 为准。
  2. 进阶方法:训练期对模板问答做去噪过滤(低置信、重复、含错别词样本剔除)。
  3. SOTA 方法:混合 VQA-RAD 等人工标注集做强化,或在评测中加"泛化到人工标注集"的外部校验。

参考:VQA-Med overview papers;VQA-RAD(Sci Data 2018)人工标注做法对比。

⚠️ 坑点 3:一图多问答 vs 一图一问,结构不同导致字段字典对不上(分类:预处理陷阱)

问题:2019 是"一图约 3-4 问",2020/2021 是"一图一问",2023 GI 是"一图 18 个固定模板问题",2024 是"一图对多提示"。用同一条字段假设解析不同年版必然出错。

症状:QA 行数与图像数对不上;2020 按 2019 的按类别目录找文件失败;2023 把每图 18 答误当独立行造成图像重复计数。

解决

  1. 简单方法:逐年阅读该版 README,确认 image↔QA 是 1:N 还是 1:1。
  2. 进阶方法:解析时以 image_id 为主键做 groupby,统计每图问答数做健全性检查。
  3. SOTA 方法:封装"年度适配器",统一输出 (image_id, question, answer) 长表,供任意年份复用。

参考:2019 GitHub README;2023 GitHub 数据说明。

⚠️ 坑点 4:2023 GI 的"无正确答案"是信息性缺失,不能当普通空值丢掉(分类:偏倚陷阱)

问题:GI 版明确说不是每个问题对每张图都可答(如无息肉图被问息肉大小),官方期望模型输出 no correct answer / not relevant。删除这些样本会学出"凡问必答"的错误先验。

症状:模型对不相关问答强行给出貌似合理的答案;测试时把 normal 图误判为有病变。

解决

  1. 简单方法:把 not relevant 保留为专门类别 token 训练,不要当空值剔除。
  2. 进阶方法:在损失里对"可答/不可答"设可调权重,或加二分类 head 先判可答性。
  3. SOTA 方法:引入"可答性 gating + 答案生成"级联模型,先判断问题与图像是否相关再作答。

参考:ImageCLEFmedical 2023 GI overview(CEUR Vol-3497 paper-107)。

⚠️ 坑点 5:VLQA 掩码只覆盖息肉与器械子集,其余图像无掩码(分类:标签理解)

问题:2023 VLQA 的分割掩码仅对含息肉与器械的图像提供(来自 HyperKvasir/Kvasir-Instrument 分割子集),不覆盖正常黏膜等所有图。直接对全开发集求 Dice 会因缺掩码图像处理不当而出错。

症状:把无掩码图像当"全零掩码"参与训练使模型学会输出空掩码;评测时混入无真值图导致 mIoU 虚高或偏低。

解决

  1. 简单方法:只在带掩码子集上训练与评测 VLQA,并在论文写明子集范围。
  2. 进阶方法:对无掩码图做"此图无目标"二分类,再在有目标图上做分割。
  3. SOTA 方法:用"问题定位 + 类别条件分割"统一建模,mask 缺失与"无目标"合并处理。

参考:ImageCLEFmedical 2023 GI 数据说明(GitHub)。

⚠️ 坑点 6:早年版评测用 accuracy + BLEU,GI 版用 Dice/mIoU/F1,指标不可混报(分类:评估误用)

问题:放射阶段短答案以 accuracy(严格匹配)+ BLEU 为主(2018 另有 WBSS/CBSS),GI 版 VQA/VLQA 引入 F1/MCC/mIoU/Dice,2024 合成任务用 FID/Inception Score。不同版本指标不互通。

症状:把 2019 的 BLEU 与 2023 的 Dice 并列比较;把分类 accuracy 与分割 mIoU 混进同一排行榜。

解决

  1. 简单方法:报告时必须附版本与指标名称,绝不裸写"accuracy 85%"。
  2. 进阶方法:按官方评测代码逐版对齐,短答案走 accuracy/BLEU、掩码走 Dice/mIoU。
  3. SOTA 方法:对生成式长答案统一做"准确率 + 语义相似 + 人类评审"三轨评估。

参考:各年版 overview 评测章节。

⚠️ 坑点 7:图像需自行从上游库获取与组装,官方包不含全量影像(分类:工程陷阱)

问题:部分版本(尤其 GI 版)影像源自 HyperKvasir/Kvasir-Instrument 上游,官方给的是 QA/JSON 与组装说明,需要你从上游拉图按 ID 对齐,影像与本体的许可与下载路径各自独立。

症状:图文件缺失、ID 对不上;上游库更新后图像哈希变化导致复现困难;误以为一个 zip 就含全部影像。

解决

  1. 简单方法:先核对官方 README 明确影像是否随包提供,不提供则记录上游版本与下载时间。
  2. 进阶方法:写脚本从上游按 ImageID 下载并对齐,校验文件数,存 SHA 清单。
  3. SOTA 方法:固定所用上游 commit/版本号并随论文发布,保证他人可精确复现。

参考datasets.simula.no/hyper-kvasir 、 GitHub simula。

⚠️ 坑点 8:任务领域在 2023 年切换(放射→内镜)、2024 年转为图像合成,别把它当纯问答库用(分类:数据泄漏)

问题:2023 起组织方与领域都变了(NLM/Philips → SimulaMet,放射 → 胃肠道内镜),2024 更是把"VQA"改造成 text-to-image 合成评测。若不查年份就把 2024 当 VQA 库训练问答模型,会完全跑偏。

症状:2024 数据无"问答答案",只有图像与提示;用 2019 问答 schema 解 2024 CSV 报错;跨放射/内镜直接迁移评测严重掉点。

解决

  1. 简单方法:动笔前先确认目标年份的任务定义(问答 vs 生成 vs 合成)。
  2. 进阶方法:区分"放射问答预训练"与"内镜问答/合成"两条独立研究线,各自选对数据版本。
  3. SOTA 方法:若要跨域,采用域自适应或统一视觉语言模型,但评估须分域汇报并注明不可直接比较。

参考:ImageCLEFmedical 2023/2024 overview;ImageCLEF 2022 overview(说明当年无 VQA 任务)。

§6.6 数据增强(安全 / 危险)

操作 级别 说明
224×224 Resize / 中心裁剪 ✅ 安全 放射影像常用;保持解剖结构比例
轻度水平翻转 ⚠️ 谨慎 部分影像含左右标注(如 X 光无翻转惯例)需核实
亮度/对比度微调 ⚠️ 谨慎 影响"对比增强/非增强"这类模态判别答案
大幅旋转 / 透视扭曲 ❌ 危险 会破坏平面(axial/sagittal)语义
内镜镜面反射区域做 inpainting ⚠️ 需医生校验 去除 specular highlight 需谨慎,别引入伪影
直接拼接无标注图做"文本增强" ❌ 危险 引入与问题无关的视觉歧义

§6.7 模型推荐表

任务 推荐范式 代表做法
放射短答案 VQA CNN 视觉编码 + 序列/注意力文本融合 → 分类 SAN / MCB / 预训练 ResNet+BERT
长答案/生成式 VQA 视觉语言 encoder-decoder 预训练 VLM 微调(ALBEF 等思路)
VQG 条件文本生成 VQGR(VAE)+ T5/模板混合
VLQA(2023) 问题 + 影像 → 掩码 条件分割(question-conditioned)
图像合成(2024) text-to-image diffusion Stable Diffusion / Kandinsky / FLUX 微调

§6.8 硬件需求

环节 建议 说明
2019 短答案分类微调 单卡 16 GB(V100/A100) 预训练 CNN+文本编码,epoch 数十内收敛
长答案/生成微调 1-4× 24 GB encoder-decoder 序列生成
VLQA 分割 1× 24 GB 条件分割模型
2024 text-to-image 4× 40-80 GB diffusion 微调/推理显存占用大

§6.9 评估指标代码

# VQA-Med 短答案(分类式)官方主指标:严格 accuracy + BLEU 参考
from collections import Counter
from nltk.translate.bleu_score import sentence_bleu

def vqa_accuracy(preds, golds):
    return sum(1 for p, g in zip(preds, golds)
               if p.strip().lower() == g.strip().lower()) / max(len(preds), 1)

def vqa_bleu(preds, golds):
    # golds 需 tokenize;此处用字符级占位,正式评测请按官方代码处理
    return sum(sentence_bleu([g.split()], p.split())
               for p, g in zip(preds, golds)) / max(len(preds), 1)

# 语义相似(2018 用 WBSS/CBSS,基于 WUPS 与 UMLS 概念)
def wups_sim(a, b, threshold=0.9):
    # 需要 WordNet/本体支持;此处仅示意调用契约
    raise NotImplementedError("正式 WBSS 请复用官方评测脚本")

# 2023 GI 分割/分类指标:F1 / mIoU / Dice
import numpy as np
def dice(pred_mask, true_mask):
    inter = np.logical_and(pred_mask > 0.5, true_mask > 0.5).sum()
    return 2 * inter / (pred_mask.sum() + true_mask.sum() + 1e-6)

一个端到端的"分版本 + 分问题类别"报告函数

def report(df, preds, metric="accuracy"):
    """df 需含列 year/question_type;preds 为与 df 同序的预测答案。"""
    import pandas as pd
    out = {"year": [], "question_type": [], "acc": []}
    for year, grp in df.groupby("year"):
        idx = grp.index
        ys = [g.lower() for g in grp["answer"]]
        ps = [p.lower() for p in [preds[i] for i in idx]]
        acc = sum(1 for a, b in zip(ps, ys) if a == b) / max(len(ys), 1)
        out["year"].append(year); out["question_type"].append("ALL"); out["acc"].append(round(acc, 3))
        for qt, gg in grp.groupby("question_type"):
            i2 = gg.index
            y2 = [g.lower() for g in gg["answer"]]
            p2 = [preds[i].lower() for i in i2]
            out["year"].append(year); out["question_type"].append(qt)
            out["acc"].append(round(sum(1 for a, b in zip(p2, y2) if a == b)/max(len(y2),1), 3))
    return pd.DataFrame(out).set_index(["year", "question_type"])

# 用法: 把你的模型在多年份上推理得到 preds 列表,然后调用
# print(report(all_df, preds))   # 输出各年/各类别 accuracy,便于定位短板

§6.10 MLOps 笔记

  • 版本治理:VQA-Med 逐年不同,强烈建议在数据集注册表里把 version=2019|2020|2021|2023_gi|2024_gi 写成可枚举字段,杜绝混用。
  • 可复现:对需从上游拉的 GI 影像锁定版本/commit,存文件哈希清单。
  • 评测隔离:同一 MedPix 影像跨年版复用,训练流水线应做全库图像去重后再划分,避免测试泄漏。
  • 合规:参与评测需 EUA;公开报告标注各年版许可(CC BY 4.0 等)与来源库许可。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解
领域/器官偏倚 放射阶段集中于单一器官系统问答与"影像可确诊"病例;GI 阶段集中于息肉/器械/正常三类 分域评测;结合人工库(VQA-RAD)外部校验
模板偏倚 训练 QA 多模板生成,表达多样性有限 混合人工标注语料;测跨模板泛化
标注校验不均 训练子集自动生成,仅测试子集医生校验;2023 GI 部分样本未专家复核 报告时区分 train/test 可信度
来源库偏倚 MedPix/HyperKvasir 非真实人群普查,不具流行病学代表性 明确"评测基准"定位,不作人群推断
语言偏倚 全部英文问答 低-中 若需多语,参考 SLAKE 双语做法另建

§7.2 标注质量

放射阶段测试集参考答案由医生人工校验(2018 两遍制、2019-2021 单医生校验),是质量锚点;训练子集自动生成,质量受模板覆盖率限制。GI 阶段由计算机科学家初标 + 消化科医生复核,官方明示非全部样本完成专家复核。跨年版均未公开标注者间一致性,引用数字需谨慎。

质量控制节点小结

版本 训练子集 验证子集 测试子集
2018 规则 QG + proofreader/医生两遍 医生把关 医生把关
2019 模板(无系统人工) 模板(无系统人工) 两名医生校验
2020 模板 模板 医生校验
2021 模板 + VQG 模型生成 医生筛选(VQG) 医生校验
2023 GI LabelBox 初标 LabelBox 初标 医生复核(部分)
2024 医生撰写提示 医生撰写提示 专家评估

实操含义:做模型训练时,把训练 QA 的"自动生成噪声"当作标签噪声处理(考虑去噪/稳健损失);做能力评估时,只以医生校验过的测试子集结果作为对外宣称依据。

§7.3 泛化性

场景 失效风险 证据/推理
放射 → 内镜迁移 领域切换(2019→2023)后需全新数据
VQA-Med → VQA-RAD(人工标注) 中-高 模板化训练在人工问法上 accuracy 易掉
短答案 → 长答案生成 2019 前三类为分类,Abnormality 生成难度大
同库跨年(2019→2020) 问题口径从"多要素"变"Abnormality 一图一问"
VQG 模型跨图像域 VQG 生成受图像域强约束
2024 合成 → 真实诊断 合成影像不可直接用于诊断
VLQA → 真实内镜实时帧 静态图 → 视频流帧存在分布偏移

泛化性判断要点:VQA-Med 的官方 benchmark 角色意味着"库内结果高"并不等于"真实临床可用"。若想让你的模型证明医学普适性,应把 VQA-Med 当作可重复的训练/初筛台,再用人工标注且含真实病例的库(如 VQA-RAD 放射、真实内镜数据)做落地前验证。社区普遍认可的路径是"ImageCLEF 数据预训练/微调 → 下游人工库评测",而非直接宣称临床部署级泛化。

§7.4 伦理

数据集以评测与研究为目的,图像取自公开库,不含患者 PHI;问答对象是"图像内容理解",不触及个体诊疗记录。使用时应遵守各来源库(MedPix/PMC/HyperKvasir)许可,不得把自动答案用于临床决策。

§7.5 公平性

数据集未提供人口统计元数据,无法进行人群分层公平性审计;其"评测基准"定位决定了它不适合作为公平性评估载体。如需研究影像模型的群体差异,应选用带人口学字段的临床库。

§7.6 数据漂移

VQA-Med 是逐年静态评测快照,影像技术(分辨率、采集协议)与任务定义随年漂移;2021→2023 的领域切换是最大的"概念漂移"。跨年追踪模型指标时必须考虑任务语义与图像域的同步变化。

漂移维度 变化 影响
影像域 放射(MedPix/PMC) → 内镜(HyperKvasir/Kvasir) 特征分布完全不同,模型不可跨用
任务定义 问答 → 生成 → 定位 → 图像合成 指标与评价目标均变
标注协议 模板/规则 → LabelBox 初标+医生复核 标签噪声来源改变
问题口径 单要素放射问答 → GI 18 固定问 语义空间迁移
评测指标 accuracy/BLEU → F1/Dice/mIoU → FID/IS 结果不可并排

应对建议:做"跨年泛化"研究时把年份当作域标签进行域自适应评估,分域汇报;对放射→内镜这类跨域迁移,应预训练统一视觉语言模型并单独报告,切勿混并出单一"总分"。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 宽格式 官方多为 QA 长表(image/qa)
2 唯一标识 image_id + question_id 逐年唯一
3 特殊字符 ⚠️ 问句含标点/模板噪声,需清洗
4 重复行 ⚠️ 跨年版复用图像,需去重
5 缺失编码 ⚠️ 2023 “not relevant” 信息性缺失需专门处理
6 标签标识 question_type/answer_type 清晰
7 罕见类分组 ⚠️ Abnormality 长尾诊断,需聚合
8 偏倚评估 ⚠️ §7.1 已讨论,量化有限
9 数据字典 本页 §4.1 提供
10 信息性缺失解释 §4.5 说明
11 设备记录 无统一设备元数据
12 共线性 问题-图像扁平,关系简单
13 编码映射 ⚠️ 需自行映射答案实体到 ICD/SNOMED
14 时间戳处理 静态快照,无时序
15 划分建议 官方划分 + §5.3 泄漏提醒
16 泄漏讨论 §5.3 图像级去重
17 标签分布 ⚠️ §4.2 定性,无官方直方图
18 测量偏倚 ⚠️ 标注不均已讨论
19 外部验证建议 §5.5 以 VQA-RAD 复核
20 版本记录 §1.4 逐年时间轴
21 预处理脚本 ⚠️ §6.3 示例,官方逐年各异
22 合规要求 CC BY 4.0 + EUA 说明
23 多模态对齐 ⚠️ 影像↔QA 需逐年组装对齐
24 去标识化 取自公开研究库,无 PHI

DAIMS 评分:16.5 / 24

评分解读:作为评测基准,VQA-Med 在"明确划分、泄漏讨论、版本记录、合规说明"等数据治理项做得规范且逐年可追溯(接近满分);失分集中在数据本体属性——非人工全标注、无设备元数据、缺统一标签分布统计、需跨库组装图像与 QA。这属于"评测语料"而非"临床数据集"的典型画像:可用性强、完整治理度中等。

对你意味着什么:若你要做严谨的模型评测,VQA-Med 的官方划分与评测代码足够你快速起步并与其他论文对比;但请(1)在论文里明确年份与"test 参考答案医生校验、train 半自动"的质量差异,(2)跨年合并前做图像级去重防泄漏,(3)把 2023 的信息性缺失与 VLQA 掩码范围如实交代,(4)泛化主张用 VQA-RAD 等人工标注集做外部校验再下结论。

§7.8 外部验证矩阵

外部场景 来源 评估任务 说明
VQA-RAD(人工标注,放射) NLM/BIDMC 跨库问答泛化 用于检验 VQA-Med 训练模型在人工问法上的表现(Sci Data 2018)
ImageCLEF 2022 caption 预训练 → 下游 VQA ImageCLEF 视觉语言微调 2022 前后多篇模型用 ImageCLEF 数据预训练后在 VQA 基准报告(arXiv 2211.13594)

§8 基准性能与生态

§8.1 排行榜(逐年官方最优,指标与年份绑定,不可直接横向比较)

年份 代表成绩 指标 说明
2019 冠军 BLEU 64.4%、accuracy 62.4% BLEU / accuracy VQA-Med 2019 官方最优(17 队)
2020 多组跑分(49 run) accuracy / BLEU 11 组参与 VQA,结果逐年 CEUR 公开
2021 最高 accuracy 0.382(dua_dua) accuracy / BLEU 13 队 75 run,见 Springer 总览
2023 多 run,F1/Dice/mIoU/MCC 等 F1/Recall/Accuracy/MCC/mIoU/Dice 参与度下降
2024 Task1 最优:Team MMCP FID / Inception Score 6 run;Task2 无提交

重要提示:各年份任务定义、指标、领域均不同,上表数值不可直接比较,只能作为"当年生态内"的参考。

逐年参与度明细(反映任务线热度的客观证据)

版本 注册 签署 EUA 有效队伍/run 说明
2018 28 5 队 17 run 首届 pilot,规模尚小
2019 17 队 参与度高点之一
2020 VQA 47 30 11 组 49 run 每队上限 5 run
2020 VQG 3 组 13 run 首年 VQG
2021 48 33 13 队 75 run(VQA 68 / VQG 7) 每队上限 10 run
2023 GI 参与度下降 官方归因任务复杂度与转向
2024 GI Task1 6 run、Task2 0 run 转向文本到图像后兴趣走低

参与度表综合自各年版 overview;2023/2024 细项以官方公开数字为准。

§8.2 SOTA 总结与选型建议

放射阶段社区最优系统普遍采用"预训练 CNN 视觉特征 + 预训练语言模型(BERT/BioBERT)+ 注意力融合";生成式长答案转向 encoder-decoder 或统一视觉语言模型。GI 阶段开始出现"图像增强 + 多模态融合"与"问题条件分割"。选型建议:短答案分类 → 融合分类器;长答案/生成 → 预训练 VLM 微调;定位 → 条件分割;合成 → diffusion 微调。论文的 SOTA 数字大多绑定当年与人工库,跨年引用需自行复跑对齐协议。

你要解决的问题 任务范式 首选做法 代表组件
模态/平面/器官分类问答 多类分类 视觉编码 + 文本编码 → 全连接分类 ResNet + BioBERT
异常名短答案 有限词表分类/生成 视觉-文本融合 → 答案词表 softmax 注意力融合
长文本异常描述 序列生成 encoder-decoder / 统一 VLM 微调 T5/BioBERT-GPT 类
VQG 问题生成 条件文本生成 以影像特征为条件解码 VQGR(VAE) 或 T5
VLQA 定位 条件分割 问题编码拼接影像 → 掩码预测 条件 U-Net
2024 图像合成 text-to-image 扩散模型(LoRA 微调) Stable Diffusion / Kandinsky / FLUX

选型提醒:不同年份任务定义差异大,同一模型在 2019 与 2023 上无法用同一 head 直接评估;请在报告前明确任务阶段,再按上表挑选对应范式,勿把"跨任务 SOTA"当作连续进展。

§8.3 评测协议

  • 预处理:答案转小写、去标点、tokenize、去停用词、stem(BLEU 早期做法)。
  • VQA 主指标:accuracy(严格匹配)+ BLEU(词重叠);2018 另加 WBSS/CBSS 语义相似。
  • VQG 指标:BLEU/ROUGE/METEOR/CIDEr(语言生成相似度)。
  • GI VQA/VLQA:F1、Accuracy、Recall、MCC、mIoU、Dice。
  • 2024 合成:FID + Inception Score。
  • 各年评测脚本由官方 GitHub 提供,复现需按对应年份版本执行。

指标口径速查

指标 含义 适用版/任务 关注点
accuracy(严格匹配) 预测 == 参考(转小写后) VQA 短答案 严,长答案吃亏
BLEU n-gram 词重叠 VQA 长答案/VQG 通顺性弱相关
WBSS/CBSS WordNet/UMLS 语义相似 2018 VQA 容错更高
ROUGE/METEOR/CIDEr 摘要/召回/共识式相似 VQG 参考多样性
F1 / MCC 分类质量 2023 GI 答案类型 二分类主指标
mIoU / Dice 掩码重叠 VLQA 分割 定位质量
FID / Inception Score 分布距离/多样性 2024 合成 医学真实度有限

accuracy 与 BLEU 取舍:短答案(Modality/Plane 等)accuracy 足够;Abnormality 与 GI 的长答案/文本答案建议 accuracy + BLEU/ROUGE 并报,避免单一指标失真。VLQA 掩码只看 Dice/mIoU,勿与文本指标混报。

§8.4 相关数据集

数据集 模态/领域 QA 对 与 VQA-Med 关系
VQA-RAD 放射 3,515 更早的人工标注医学 VQA(MedPix 同源)
PathVQA 病理 32,799 病理版 VQA
SLAKE 放射 14,028 含图谱与分割框,双语
MIMIC-CXR-VQA 胸片 46,152 基于 MIMIC-CXR/EHR 的 VQA
PMC-VQA 放射/病理/显微 227,000 自动合成大规模
HyperKvasir 内镜 掩码/标注 MEDVQA-GI 底图来源

§8.5 关键论文 Top

论文(完整引用) 一句话贡献
Hasan S. A., Ling Y., Farri O., Liu J., Müller H., Lungren M. (2018). Overview of the ImageCLEF 2018 Medical Domain Visual Question Answering Task. Working Notes of CLEF 2018, CEUR Vol-2125. https://ceur-ws.org/Vol-2125/paper_212.pdf 首届 pilot:从 PMC caption 半自动建 QA,定义 BLEU/WBSS/CBSS 评测
Ben Abacha A., Hasan S. A., Datla V. V., Liu J., Demner-Fushman D., Müller H. (2019). VQA-Med: Overview of the Medical Visual Question Answering Task at ImageCLEF 2019. Working Notes of CLEF 2019, CEUR Vol-2380. https://ceur-ws.org/Vol-2380/paper_272.pdf 2019 经典版:4,200 图/15,292 QA,确立四类问题框架(主引)
Ben Abacha A., Datla V. V., Hasan S. A., Demner-Fushman D., Müller H. (2020). Overview of the VQA-Med Task at ImageCLEF 2020. Working Notes of CLEF 2020, CEUR Vol-2696, paper_106. 专注 Abnormality 问答,首创医学 VQG 子任务
Ben Abacha A., et al. (2021). Overview of the VQA-Med Task at ImageCLEF 2021. CLEF 2021 Working Notes.(Springer/LNCS 总览收录) 复用训练集、VQG 自动生成后医生筛选,综合 accuracy/BLEU
Ionescu B., Müller H., et al. (2021). Overview of the ImageCLEF 2021. LNCS vol.12880, pp.345-370. DOI 10.1007/978-3-030-85251-1_23 实验室总览,交代 VQA-Med 在当年 ImageCLEF 中的位置与数据细节
Hicks S., Storås A., Halvorsen P., Riegler M., et al. (2023). Overview of ImageCLEFmedical 2023 – Medical VQA for Gastrointestinal Tract. CEUR Vol-3497, paper-107. https://ceur-ws.org/Vol-3497/paper-107.pdf GI 首届:VQA/VQG/VLQA,新增分割掩码输出
Hicks S., Storås A., Halvorsen P., Riegler M., Thambawita V. (2024). Overview of ImageCLEFmedical 2024 – MedVQA-GI. CEUR Vol-3740, paper-131. https://ceur-ws.org/Vol-3740/paper-131.pdf GI 第二届:转为文本到图像合成评测
Kvasir 基础库论文(Borgli et al. 2020, HyperKvasir; Jha et al. 2021, Kvasir-Instrument) MEDVQA-GI 影像本体来源与标注基准
综述参考:Frontiers in AI 2024(DOI 10.3389/frai.2024.1430984) 将 VQA-Med 各年版与 VQA-RAD/PathVQA/SLAKE 横向对比

§8.6 社区活跃度

VQA-Med 在 2018-2021 放射阶段参与度高(2019 十七队、2021 十三队),是医学 VQA 论文的常引基准之一;2022 停办一年后,2023-2024 GI 版由 Simula 团队延续,转向生成式与定位方向,参与队伍数下降(官方归因于任务复杂度与方向切换)。整体上它仍是被引最多、时间跨度最长的医学视觉问答年度评测系列。

§8.7 生态快照表

资源 类型 链接 推荐理由
VQA-Med-2019 GitHub 数据+评测 https://github.com/abachaa/VQA-Med-2019 官方 2019 测试集与 README
Zenodo record 10499039 数据下载 https://zenodo.org/records/10499039 2019 完整集,CC BY 4.0
VQA-Med-2020 GitHub 数据+评测 https://github.com/abachaa/VQA-Med-2020 2020 数据与评测代码
ImageCLEFmed MEDVQA-GI 2023 任务数据 https://github.com/simula/ImageCLEFmed-MEDVQA-GI-2023 2023 GI VQA/VQG/VLQA
ImageCLEFmed MEDVQA-GI 2024 任务数据 https://github.com/simula/ImageCLEFmed-MEDVQA-GI-2024 2024 图像合成
HyperKvasir 上游图 https://datasets.simula.no/hyper-kvasir GI 底图来源
Kvasir-Instrument 上游图 https://datasets.simula.no/kvasir-instrument GI 器械图来源

§9 相关资源与引用

§9.1 官方资源

类别 资源 用途
任务主页 ImageCLEFmedical VQA(https://www.imageclef.org/2019/medical/vqahttps://www.imageclef.org/2024/medical/vqa 等) 规则、日程、官方链接
数据托管(2019) Zenodo record 10499039 完整训练/验证/测试
数据托管(2020-2021) AICrowd 竞赛项目 竞赛注册与分发
代码与评测(放射) GitHub abachaa/VQA-Med-2019、VQA-Med-2020 数据 + 评测代码
代码与评测(GI) GitHub simula/ImageCLEFmed-MEDVQA-GI-2023 / -2024 GI 数据 + 提交校验脚本
上游影像库 MedPix(https://medpix.nlm.nih.gov/)、PubMed Central 放射图像来源
上游影像库(GI) HyperKvasir、Kvasir-Instrument 内镜图像来源
逐年 Working Notes CEUR Workshop Proceedings(CEUR-WS.org 各年版任务细节与结果
实验室总览 Springer LNCS(CLEF 年会卷) 系统级总览与引用
邮件/讨论 ImageCLEF 官方 mailing / AICrowd 论坛 组织方答疑

发布渠道惯例:ImageCLEF 各任务的工作笔记(overview + participant)统一发在 CEUR-WS;实验室级总览则收入 CLEF 年会论文集(Springer LNCS)。检索时建议同时覆盖两个渠道以获取任务版细节与系统级数字。

§9.2 BibTeX 完整引用

% 2019 官方数据集引用(建议主引)
@inproceedings{benabacha2019vqamed,
  author = {Ben Abacha, Asma and Hasan, Sadid A. and Datla, Vivek V.
            and Liu, Joey and Demner-Fushman, Dina and M\"uller, Henning},
  title = {VQA-Med: Overview of the Medical Visual Question Answering Task
           at {ImageCLEF} 2019},
  booktitle = {Working Notes of {CLEF} 2019},
  series = {CEUR Workshop Proceedings},
  volume = {2380},
  year = {2019},
  publisher = {CEUR-WS.org},
  url = {https://ceur-ws.org/Vol-2380/paper_272.pdf}
}

% 2018 首届
@inproceedings{hasan2018vqamed,
  author = {Hasan, Sadid A. and Ling, Yuan and Farri, Oladimeji
            and Liu, Joey and M\"uller, Henning and Lungren, Matthew},
  title = {Overview of the {ImageCLEF} 2018 Medical Domain Visual Question
           Answering Task},
  booktitle = {Working Notes of {CLEF} 2018},
  series = {CEUR Workshop Proceedings},
  volume = {2125},
  year = {2018}
}

% 2020
@inproceedings{benabacha2020vqamed,
  author = {Ben Abacha, Asma and Datla, Vivek V. and Hasan, Sadid A.
            and Demner-Fushman, Dina and M\"uller, Henning},
  title = {Overview of the {VQA-Med} Task at {ImageCLEF} 2020: Visual Question
           Answering and Generation in the Medical Domain},
  booktitle = {Working Notes of {CLEF} 2020},
  series = {CEUR Workshop Proceedings},
  volume = {2696},
  year = {2020}
}

% 2023 GI
@inproceedings{hicks2023medvqagi,
  author = {Hicks, Steven and Stor{\aa}s, Andrea and Halvorsen, P{\aa}l
            and Riegler, Michael and de Lange, Thomas and Papachrysos, Nikolaos
            and Sch{\"o}ler, Johanna and Jha, Debesh and Thambawita, Vajira},
  title = {Overview of {ImageCLEFmedical} 2023 -- Medical Visual Question
           Answering for Gastrointestinal Tract},
  booktitle = {Working Notes of {CLEF} 2023},
  series = {CEUR Workshop Proceedings},
  volume = {3497},
  year = {2023}
}

§9.3 引用指南

  • 用哪年版数据集就引哪年版 overview(编号见 §9.2 与 §8.5)。
  • 若引用实验室总览(LNCS),注明 DOI(如 CLEF 2021 总览 DOI 10.1007/978-3-030-85251-1_23)。
  • 使用 GI 底图(HyperKvasir/Kvasir-Instrument)时,同时引用其原始论文。

§10 AI 使用声明卡

§10.1 AI 模型列表

模型 用途
WorkBuddy(deep-model) 初稿生成、结构组织、信息汇编、代码示例、排版规范检查

§10.2 AI 参与范围

AI 在本页面的工作中负责:(1)从 ImageCLEF 官方 overview、CEUR/LNCS 论文、GitHub 与 Zenodo 资源中整理逐年版本事实;(2)生成 §6 的 Python 预处理/DataLoader/评测示例;(3)组织 §6.5 八个坑点与 §7 偏倚表;(4)执行 G1/G2/G3 排版与中英文格式规范;(5)构建 §C JSON-LD @graph。所有规模与年份数字均以检索到的官方出处为准,无法核实的数字被省略。

§10.3 输入来源列表

  1. Ben Abacha et al., VQA-Med: Overview … ImageCLEF 2019, CEUR Vol-2380 — arodes.hes-so.ch/record/4214
  2. Hasan et al., Overview … ImageCLEF 2018 … VQA Task — arodes.hes-so.ch/record/2780
  3. VQA-Med 2019 GitHub(abachaa)— github.com/abachaa/VQA-Med-2019
  4. Zenodo record 10499039 — zenodo.org/records/10499039
  5. ImageCLEF 2020 VQA-Med 任务页 — imageclef.org/node/250
  6. Overview of ImageCLEF 2020(含 VQA/VQG 数据)— repository.essex.ac.uk/32082/1
  7. Overview of VQA-Med Task at ImageCLEF 2021 — link.springer.com 978-3-030-85251-1_23
  8. Overview of the ImageCLEF 2021(LNCS vol.12880)— springer.iq-technikum.de/chapter/10.1007/978-3-030-85251-1_23
  9. Overview of ImageCLEF 2022(说明当年无 VQA 任务)— link-hkg.springer.com/10.1007/978-3-031-13643-6_31
  10. Overview of ImageCLEFmedical 2023 MedVQA-GI — ceur-ws.org/Vol-3497/paper-107.pdf
  11. Overview of ImageCLEFmedical 2024 MedVQA-GI — ceur-ws.org/Vol-3740/paper-131.pdf
  12. ImageCLEFmed MEDVQA-GI-2023 GitHub(simula)— github.com/simula/ImageCLEFmed-MEDVQA-GI-2023
  13. UIT-Saviors at MEDVQA-GI 2023(arXiv 2307.02783)— arxiv.org/pdf/2307.02783.pdf
  14. Overview of the ImageCLEF 2024(HAL,MEDVQA-GI 数据/结果)— hal.science/hal-04743962v1
  15. Prompt to Polyp …(arXiv 2505.05573,2024 开发集规模)— arxiv.org/html/2505.05573
  16. Frontiers in AI 2024 review(VQA-Med 各年版对比,DOI 10.3389/frai.2024.1430984)— frontiersin.org

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览与 §1.4 版本时间轴 千方病案医学编辑部 与逐年 CEUR/LNCS overview 数字逐项比对 ✅ 已通过
§2 医学背景(ICD-11/SNOMED 映射) 千方病案医学编辑部 术语与编码交叉审核 ✅ 已通过
§3-§4 规格与数据结构 千方病案医学编辑部 对照官方 README/数据格式 ✅ 已通过
§5-§6 划分、代码与坑点 千方病案医学编辑部 逻辑审查 + 官方评测脚本核对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 基准与生态 千方病案医学编辑部 逐年结果核对 ✅ 已通过
§C JSON-LD @graph 千方病案医学编辑部 Schema 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后人工审核日期

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)


§C JSON-LD 结构化数据

返回 AI-Ready 数据集