MultiMedBench — 谷歌医学多任务多模态基准 AI-Ready Wikipedia | 千方病案医数集

Med-PaLM M 配套评测基准 · 14 任务 12 数据集 7 模态 · 超 100 万样本

来源 Google Research & Google DeepMind url: https://research.google/pubs/towards-generalist-biomedical-ai/发布时间: 2026-09-06最后更新: 2026-09-06 阅读 12

信息速览

数据集名称MultiMedBench — 谷歌医学多任务多模态基准 AI-Ready Wikipedia | 千方病案医数集
数据类型14 项任务 / 12 个数据集,超 100 万样本,7 种数据模态,许可证混合(部分需 CITI 认证),无统一打包下载,Google Research 发布
规模超 100 万样本(12 个去标识化数据集)
接入方式Google Research & Google DeepMind url: https://research.google/pubs/towards-generalist-biomedical-ai/
AI 就绪度

数据集封面

MultiMedBench — 谷歌医学多任务多模态基准 AI-Ready Wikipedia


INFOBOX

数据集名称 MultiMedBench
英文全称 MultiMedBench: A Multimodal Biomedical Benchmark
别名/简称 MultiMedBench、Med-PaLM M 基准、谷歌医学多任务基准(⚠️ 勿与姊妹基准 MultiMedQA 混淆,见 §6.5 坑点 1)
疾病分类 全科医学谱(QA);胸部疾病(CA40–CA4Z 肺炎 / CB24 心脏肥大等 14 类影像标签);皮肤肿瘤(2C3Z 恶性黑色素瘤 / 2F70 基底细胞癌);乳腺疾病(2C6Z 乳腺恶性肿瘤 / BI-RADS 分级);基因组变异(孟德尔遗传与肿瘤体细胞变异背景)
SNOMED CT 386661006 Medical evaluation (procedure) / 168537006 Chest X-ray (procedure) / 252416005 Histopathology test (procedure) / 71651007 Mammography (procedure) / 398192003 Genetic sequencing (procedure)(详见 §2.2)
数据模态 文本(QA + 放射报告)、影像(胸部 X 光、病理、皮肤、乳腺 X 光)、基因组(测序读段 pileup 图像)、多模态组合
AI 任务类型 问答(多选 + 长文本)、视觉问答(VQA)、报告生成、报告摘要、医学影像分类、基因组变异检测
样本总数 14 项任务 / 12 个数据集 / 5 种任务类型 / 7 种模态,总计超 100 万样本
数据大小 无统一打包:QA 文本约数十 MB;影像主体为 MIMIC-CXR-JPG 约 560 GB(DICOM 版约 4.7 TB);其余组件 MB–GB 级
数据格式 JSON/JSONL/CSV/XLSX(QA 与标签)/ DICOM、JPG、PNG(影像)/ pileup 张量图像(基因组)
许可证 混合许可:MedMCQA/PathVQA/MMLU 为 MIT;PubMedQA/PAD-UFES-20/HealthSearchQA 为 CC BY 4.0;MIMIC-III/MIMIC-CXR/VinDr-Mammo 为 PhysioNet Credentialed Health Data License 1.5.0;CBIS-DDSM 为 TCIA 数据使用政策;VQA-RAD/SLAKE/precisionFDA 开放获取(详见 §3.6 许可证地图)
访问级别 混合:多数组件开放下载;3 个组件(MIMIC-III、MIMIC-CXR、VinDr-Mammo)需 PhysioNet 凭证化(CITI 培训 + DUA)
DUO 标签 GRU, HMB, NPUNCU(凭证化组件叠加 IRB/DUA 约束)
语言 英文为主;SLAKE 含中文平行语料(中英双语 VQA)
首发日期 2023-07(arXiv:2307.14334 预印本)/ 2024-02-22(NEJM AI 期刊版)
最后更新 2024-02-22(NEJM AI 期刊版;基准无版本号迭代,组件数据集各自维护)
发布机构 Google Research & Google DeepMind
官方主页 https://research.google/pubs/towards-generalist-biomedical-ai/
下载地址 无统一下载——12 个组件数据集分别托管(完整获取清单见 §6.2)
DOI 10.1056/AIoa2300138(NEJM AI 论文);姊妹基准 MultiMedQA 论文 DOI: 10.1038/s41586-023-06291-2
引用次数 Tu et al. 317+(Crossref/OUCI,截至 2026-09);MultiMedQA 论文(Singhal et al., Nature 2023)5,488+(Google Scholar,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐(3/5)— 组件数据集个体成熟、文档完备;扣分项:无统一打包与官方联合预处理、许可异构(3 个组件需凭证化)、Med-PaLM M 模型与代码未开源、HealthSearchQA 无金标准答案
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 映射、影像与基因组任务临床定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(QA 字段结构、影像组件字段)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 Google Research、Google DeepMind、Alphabet 无任何商业利益关联。本页面不销售 MultiMedBench 任何组件数据集,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 Google 或其关联公司的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:MultiMedBench 是 12 个独立数据集的策展组合,每个组件适用各自的许可协议——MIMIC-III、MIMIC-CXR 与 VinDr-Mammo 要求完成 CITI Program 培训并通过 PhysioNet 凭证化申请、签署数据使用协议(DUA);其余组件分别适用 MIT、CC BY 4.0、TCIA 数据使用政策等。使用任何组件前请务必阅读其原始许可。DUO 标签仅供参考,具体使用限制以各数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

MultiMedBench 是 Google Research 与 Google DeepMind 于 2023 年发布的多模态生物医学评测基准,由 12 个去标识化开源数据集组成,覆盖 14 项任务、5 种任务类型、7 种数据模态,总计超过 100 万样本——从美国医师执照考试(USMLE)风格的选择题,到胸片报告生成、皮肤病与乳腺影像分类,再到基因组变异检测。

它的历史地位在于:这是第一个为"通用医疗 AI"设计的综合考场。在此之前,医疗 AI 模型大多是单科应试者——一个模型只会分类胸片,另一个只会回答选择题。MultiMedBench 首次提出用同一套模型权重同时应考 14 项任务,并由此催生了 Med-PaLM M 这个"全科医学生"。它的姊妹基准 MultiMedQA(7 个文本问答数据集,含新建的 HealthSearchQA)则是医疗大语言模型时代被引用最广泛的 QA 评测组合,原始论文引用已超 5,400 次(截至 2026-09)。

你可以用它来:全面体检一个医疗多模态大模型(像 Med-PaLM M、Med-Gemini 那样)、复现医疗 AI 史上的里程碑结果、或者只取其中的 QA 子集(MultiMedQA)评测你的医疗语言模型。需要单科深挖时,请直接使用对应的组件数据集。

§1.1 摘要

MultiMedBench 在 Tu et al. 的 Med-PaLM M 论文(“Towards Generalist Biomedical AI”,NEJM AI 2024,DOI: 10.1056/AIoa2300138)中首次提出。其设计思想是把医学 AI 的"单科考场"整合为"全科联考":从既有的去标识化开源数据集中精选 12 个,统一改写为开放式生成格式(连分类任务也要求模型生成答案文本而非输出 logits),构成 14 项任务的评测矩阵——3 项医学多选问答(MedQA、MedMCQA、PubMedQA)、1 项放射报告摘要(MIMIC-III)、3 项医学视觉问答(VQA-RAD、SLAKE、PathVQA)、1 项胸片报告生成(MIMIC-CXR)、5 项影像分类(MIMIC-CXR 胸片二分类、PAD-UFES-20 皮肤 6 分类、VinDr-Mammo 乳腺 BI-RADS 5 分类、CBIS-DDSM 肿块与钙化 3 分类)以及 1 项基因组变异检测(precisionFDA Truth Challenge V2,构建为 3 类图像分类)。它与早半年发布的 MultiMedQA(Singhal et al., Nature 2023)互为姊妹:MultiMedQA 管"语言",MultiMedBench 管"多模态",两者共同构成 Med-PaLM 系列模型的完整评测体系。

§1.2 战略价值分析

范式开创维度:MultiMedBench 之前,医疗 AI 的评测是碎片化的——每个子领域有自己的小基准,彼此之间没有交集,"一个模型在胸片分类上超越放射科医生"与"另一个模型通过 USMLE"之间无法对话。MultiMedBench 首次建立了跨模态的统一坐标系:同一批研究者可以用同一套协议,衡量一个模型在文本推理、影像理解、报告写作和基因组分析上的综合能力。这一"通用医疗 AI 联考"范式直接定义了此后两年的研究议程——Med-PaLM M、Med-Gemini、BiomedGPT、RadFM 等通用医疗模型几乎全部以 MultiMedBench 或其变体作为核心评测台。

评测方法论维度:MultiMedBench 与 MultiMedQA 共同引入了两个关键创新。其一是生成式统一接口:所有任务(包括传统判别式分类)都被改写为开放式文本生成,使一个 seq2seq 模型无需任何任务特定头部即可应考全部 14 项任务——这是"通用模型"得以成立的工程前提。其二是人类评估框架:MultiMedQA 配套提出的多轴人工评估体系(科学共识对齐、阅读理解、知识调用、推理、完整性、潜在伤害、偏倚)突破了"准确率唯一论",成为此后所有医疗 LLM 论文的标配评估维度。HealthSearchQA 作为其中唯一的新建数据集(3,173 条真实消费者搜索问题),填补了近患者端评测的空白。

生态影响维度:MultiMedQA 论文(Nature 2023)已被引用 5,488 次(Google Scholar,截至 2026-09),是医疗 LLM 领域被引最高的论文之一;MedQA 上的分数从 Flan-PaLM 的 67.6%(2022)一路攀升到 Med-PaLM 2 的 86.5%(2023)、Med-Gemini 的 91.1%(2024),成为医疗 AI 能力跃迁最直观的"温度计"。MultiMedBench 的 14 任务矩阵则被 Med-Gemini 系列、微软 LLaVA-Med、RAD-DINO 等后续工作广泛采用或扩展,其对"测试集污染"与"题目质量"的讨论(Med-Gemini 报告 MedQA 7.4% 题目不适于评估)也推动了整个领域对基准卫生的重视。

§1.3 横向对比

基准 任务数 模态 规模 核心差异化
MultiMedBench 14 文本 + 影像 + 基因组(7 模态) >100 万样本 唯一覆盖基因组的通用医疗联考;Med-PaLM M/Med-Gemini 原生评测台
MultiMedQA(姊妹基准) 7 纯文本 约 27 万题 医疗 LLM 语言评测事实标准;含 HealthSearchQA 消费者问题
MedQA(单数据集) 1 纯文本 12,723 题(英文 4 选项) USMLE 风格,医疗 LLM 的"高考单科"
MMLU(通用) 57 纯文本 15,908 题 通用 LLM 评测;其 6 个临床子集被 MultiMedQA 收录
GMAI-MMBench(2024) 284 文本 + 影像 26 万病例 中国主导的更大规模综合基准,不含基因组
BenchMD(2023) 19 影像 + 传感器 模态无关学习基准,无 QA 与基因组
RadBench / 单科影像基准 1-3 单一影像模态 深度单科评测,无跨模态视角

MultiMedBench 的不可替代性在于三点:与 Med-PaLM/Med-Gemini 谱系的原生绑定(复现这些里程碑结果的唯一途径)、基因组模态的独家覆盖(precisionFDA 变异检测任务在同类基准中几乎独一无二)、以及"12 个组件全部去标识化且开源"的可获取性设计。

§1.4 版本演进时间轴

时间 事件
2016-09 MIMIC-III v1.4 发布(后成为 MultiMedBench 报告摘要任务数据源)
2018-12 VQA-RAD 发布(Scientific Data 5:180251)
2019-12 PubMedQA(EMNLP-IJCNLP 2019)与 MIMIC-CXR(Scientific Data 6:317)先后发布
2020-07 PAD-UFES-20 皮肤病变数据集发布
2021-04 MedMCQA 发布(CHIL 2022,PMLR 174);MedQA 公开流行(Jin et al. 2021)
2021-05 SLAKE 双语医学 VQA 发布(ISBI 2021)
2022-12-26 Med-PaLM arXiv 预印本(2212.13138),MultiMedQA 诞生(7 个 QA 数据集 + HealthSearchQA)
2023-05-16 Med-PaLM 2 arXiv 预印本(2305.09617),MedQA 达 86.5%
2023-07-12 Med-PaLM 论文正式发表于 Nature 620:172-180
2023-07 Med-PaLM M arXiv 预印本(2307.14334),MultiMedBench 诞生(14 任务 12 数据集)
2023 VinDr-Mammo 发布(Scientific Data 10:577),补全乳腺模态
2024-02-22 Med-PaLM M 论文正式发表于 NEJM AI 1(3),DOI: 10.1056/AIoa2300138
2024-04 Med-Gemini 发布(arXiv:2404.18416),在 14 个医疗基准上 10 项 SOTA,MedQA 达 91.1%
2024-05 Med-Gemini 多模态论文(arXiv:2405.03162)扩展评测 MultiMedBench 衍生任务
2025-03 Med-PaLM 2 论文正式发表于 Nature Medicine 31:943-950

§1.5 典型 AI 应用场景

  1. 通用医疗多模态模型综合评测:以 14 任务矩阵全面体检一个医疗基础模型,是 Med-PaLM M、Med-Gemini、BiomedGPT、RadFM 等模型的标准动作。
  2. 医疗大语言模型 QA 评测:取 MultiMedQA 子集(MedQA/MedMCQA/PubMedQA/MMLU 临床子集)做选择题准确率基准,或以 HealthSearchQA 做消费者端长文本回答质量人工评估。
  3. 放射报告生成研究:MIMIC-CXR 报告生成与 MIMIC-III 报告摘要两项任务构成放射 NLP 的标准试验台,支持 BLEU/ROUGE/CheXbert/RadGraph 多指标评估。
  4. 医学视觉问答(VQA)方法研究:VQA-RAD、SLAKE、PathVQA 三个互补数据集覆盖放射与病理模态、封闭与开放题型、中英双语场景。
  5. 跨模态迁移与多任务学习研究:14 任务共享权重训练是研究任务间正迁移、灾难性遗忘与模态对齐的天然实验场(Med-PaLM M 论文的核心分析维度)。

§2 医学背景

§2.1 ICD-11 疾病分类锚定

MultiMedBench 面向全科医学谱,不锚定单一疾病。其 14 项任务对应的临床领域到 ICD-11 的映射如下:

任务/组件 临床领域 代表性疾病/状态的 ICD-11 对应
MedQA / MedMCQA / MMLU 临床子集 全科医学(内科、外科、儿科、妇产、药理、微生物等) 覆盖 ICD-11 全章节(01–26 章)
PubMedQA 生物医学研究(治疗、诊断、预后问题) 随文献主题分布
MIMIC-CXR 报告生成/分类 胸部放射学 CA40–CA4Z 呼吸系统疾病(肺炎等)/ CB24 心脏肥大 / DB90–DB98 胸膜疾病 / CB41 呼吸衰竭
MIMIC-III 报告摘要 ICU 放射学(床旁胸片为主) 1G4Z 脓毒症背景 / 各系统急重症
PAD-UFES-20 皮肤肿瘤学与癌前病变 2C3Z 恶性黑色素瘤 / 2F70 基底细胞癌 / 2C34 皮肤鳞状细胞癌 / 2E60 光化性角化病 / 5A80 脂溢性角化病(编码体系外良性病变)
VinDr-Mammo / CBIS-DDSM 乳腺影像筛查 2C6Z 乳腺恶性肿瘤 / BI-RADS 1–5 影像分级体系
基因组变异检测 临床基因组学 孟德尔遗传病变异背景(GIAB 参考样本)/ 胚系 SNV 与 Indel
LiveQA / MedicationQA / HealthSearchQA(MultiMedQA) 消费者健康与用药咨询 常见病症与 OTC/处方药主题谱

为什么这个基准的"疾病锚定"必须按任务拆解:与单病种数据集不同,MultiMedBench 的医学语义分布在 12 个组件中——QA 部分的疾病谱由考试大纲与文献主题决定(宽泛、偏常见病),影像部分由采集科室决定(胸片→心肺急症;皮肤→肿瘤;乳腺→筛查),基因组部分则由 GIAB 参考样本决定(健康供体的胚系变异)。做疾病层面的偏倚分析时,应逐组件考察而非整体论断。

§2.2 SNOMED CT 映射

临床场景/任务 ICD-11 SNOMED CT SNOMED CT 术语
医学知识评估(QA) 386661006 Medical evaluation (procedure)
胸部 X 光检查 168537006 Chest X-ray (procedure)
肺炎(影像高频标签) CA40.0 233604007 Pneumonia (disorder)
胸腔积液 DB98.Z 60046008 Pleural effusion (disorder)
恶性黑色素瘤 2C3Z 209244007 Malignant melanoma (disorder)
基底细胞癌 2F70 1337017 Basal cell carcinoma (morphologic abnormality)
乳腺恶性肿瘤 2C6Z 254837009 Malignant tumor of breast (disorder)
乳腺 X 光检查 71651007 Mammography (procedure)
组织病理学检查 252416005 Histopathology test (procedure)
基因测序 398192003 Genetic sequencing (procedure)
用药咨询(MedicationQA) 416341009 Medication education (procedure)

§2.3 疾病简介

MultiMedBench 覆盖的是"医学 AI 能力谱"而非单一疾病,但其影像与基因组任务落点高度集中在三个重大疾病负担领域:胸部急重症(肺炎、胸腔积液、心脏肥大等——胸片是全球检查量最大的医学影像,年检查量以十亿计,放射科医生缺口在低收入国家尤为严峻)、皮肤与乳腺肿瘤(皮肤癌是全球发病率最高的恶性肿瘤,乳腺癌是女性第一大癌,二者都高度依赖影像与视觉评估),以及遗传病的分子诊断(全球已知超 7,000 种罕见遗传病,二代测序变异检测是其确诊入口,变异解读的准确性直接决定诊断成立与否)。这三类场景的共同特征是"专家资源稀缺 + 视觉/文本判读密集",正是通用医疗 AI 被寄予厚望的突破口。

§2.4 临床任务定义

AI 任务 临床对应 标准参考 在 MultiMedBench 中的操作化
医学知识多选问答 医师资格考试/继续教育测评 USMLE(美国)/ AIIMS·NEET-PG(印度) MedQA 1,273 题 / MedMCQA 6,150 题测试集
文献证据问答 循证医学证据判断 PICO 框架(治疗/诊断/预后) PubMedQA yes/no/maybe 三分类(500 题测试集)
放射报告生成 放射科医生阅片写报告 ACR 报告规范 MIMIC-CXR findings+impression 生成
放射报告摘要 报告印象段撰写 临床文书摘要惯例 MIMIC-III findings → impression
医学视觉问答 影像辅助教学与阅片问答 放射/病理教学问答 VQA-RAD / SLAKE / PathVQA
影像异常筛查 胸片异常分诊 放射科分诊流程 MIMIC-CXR 二分类
皮肤病变鉴别 皮肤肿瘤初筛 皮肤科临床路径 PAD-UFES-20 六分类
乳腺影像评估 筛查乳腺 X 光分级 ACR BI-RADS 分级 VinDr-Mammo 5 分类 / CBIS-DDSM 3 分类
基因组变异检测 二代测序变异识别 GIAB 高置信变异集 precisionFDA 挑战(pileup 图像 3 分类)

§2.5 患者人群特征

MultiMedBench 为基准集合体,人群特征须按组件拆解:

组件 人群来源 关键人口学特征
MedQA / MedMCQA 无患者数据——考试题库(美国/印度医学生应试场景) 不适用;题目内容反映考试大纲人群假设
PubMedQA PubMed 文献摘要(全球研究人群) 随文献主题分布
LiveQA / MedicationQA / HealthSearchQA 美国消费者真实提问(NLM 客服与搜索引擎查询) 英语互联网用户,自我选择人群
MIMIC-III / MIMIC-CXR 美国波士顿 BIDMC 单中心 ICU/急诊患者 成人为主、白人占比高、三级学术中心重症谱
VQA-RAD MedPix 教学影像库(美国 NLM) 教学病例,非筛查人群
SLAKE 多源放射影像(中国团队构建,中英双语标注) 影像来源国际化、标注双语
PathVQA 病理教科书与电子图书插图 教学病例,非真实队列
PAD-UFES-20 巴西联邦大学(UFES)皮肤科服务人群 1,373 名患者、2,298 张智能手机照片;巴西混血人群肤色谱
VinDr-Mammo 越南河内两家医院筛查人群 5,000 例检查;亚洲女性乳腺密度谱
CBIS-DDSM 美国 DDSM 筛查乳腺 X 光精选子集 2,620 例;扫描胶片数字化
precisionFDA Truth Challenge V2 GIAB 参考样本(HG002 等阿什肯纳兹犹太裔 trio) 参考物质,非患者队列

§2.6 金标准/参考标准

数据划分 标注方式 标注者 金标准性质
MedQA / MedMCQA / MMLU 考试官方答案 考试机构 权威但非无瑕——Med-Gemini 报告 MedQA 7.4% 题目存在信息缺失或多解
PubMedQA 文献结论人工判定(yes/no/maybe) 2 名标注者 + 分歧仲裁(Jin et al. 2019) 专家标注,类间主观性集中在 maybe 类
LiveQA / MedicationQA 参考长答案 NLM 图书馆员 参考答案而非唯一标准,评估需人工
HealthSearchQA 无金标准答案(仅 3,173 个问题) 必须配合人工评估框架使用
MIMIC-CXR / MIMIC-III 报告 临床常规报告原文 BIDMC 放射科医生 真实世界文书,风格异质;14 类标签为 NLP 弱监督(CheXpert 标注器)
VQA-RAD 临床医生生成问答 放射科医师(Lau et al. 2018) 专家标注,规模小(3,515 QA)
SLAKE 语义标注 + 双语 QA 医学背景标注团队 结构化标注(器官/模态标签),中英平行
PathVQA 教科书图注自动生成 + 人工筛选 教材内容 弱监督来源,答案分布有长尾
PAD-UFES-20 临床诊断 + 部分活检证实 UFES 皮肤科医生 活检证实比例因病种而异
VinDr-Mammo / CBIS-DDSM BI-RADS 分级 + 病灶勾画 放射科医生共识 筛查场景金标准
precisionFDA 挑战 GIAB 高置信变异集 NIST/GA4GH 联盟 行业参考标准(benchmark variants)

§3 数据集规格

§3.0 版本抉择矩阵

MultiMedBench 家族有三个常被混淆的实体——MultiMedBench(14 任务多模态)、MultiMedQA(7 个文本 QA)、以及各组件单数据集。30 秒选型:

你的需求 推荐选择 规模 理由
评测医疗多模态大模型(图文混合输入) MultiMedBench 全量 14 任务 >100 万样本 唯一覆盖 QA + VQA + 报告 + 分类 + 基因组的联考矩阵,与 Med-PaLM M/Med-Gemini 结果直接可比
评测医疗语言模型(纯文本) MultiMedQA(7 个 QA 数据集) 约 27 万题 医疗 LLM 评测事实标准;含 HealthSearchQA 消费者长文本评估
快速跑通医疗 QA 基线 MedQA + PubMedQA 两个单数据集 12,723 + 1,000 题 下载即用的最小组合,30 分钟内可出准确率
放射报告生成/摘要研究 MIMIC-CXR + MIMIC-III 放射报告子集 22.8 万报告 不用拼装整个基准,直接使用组件原始数据与社区管道
消费者端回答安全性评估 HealthSearchQA 3,173 题 唯一基于真实搜索查询的消费者问题集;须配人工评估框架
中文医学 VQA SLAKE(双语) 14,028 QA MultiMedBench 中唯一含中文平行语料的组件

MultiMedBench vs MultiMedQA 关键差异速查

维度 MultiMedBench MultiMedQA
提出论文 Tu et al., NEJM AI 2024(Med-PaLM M) Singhal et al., Nature 2023(Med-PaLM)
任务数 14(含影像与基因组) 7(纯文本 QA)
模态 7 种(文本/放射/病理/皮肤/乳腺/基因组/胸片) 1 种(文本)
QA 覆盖 仅 MedQA、MedMCQA、PubMedQA 7 个:另含 LiveQA、MedicationQA、MMLU 临床子集、HealthSearchQA
新建数据 无(全部复用既有开源集) HealthSearchQA(3,173 题)
统一接口 全部改写为开放式生成 多选 + 长文本回答两类
典型评测对象 Med-PaLM M、Med-Gemini、BiomedGPT Med-PaLM、Med-PaLM 2、GPT-4、Med-Gemini

§3.1 模态详细说明

MultiMedBench 覆盖 7 种生物医学数据模态:

  1. 文本(Text):MedQA(USMLE 风格题干 + 4 选项)、MedMCQA(印度 AIIMS/NEET-PG 真题 + 4 选项 + 部分解析)、PubMedQA(问题 + PubMed 摘要上下文 + yes/no/maybe)。
  2. 放射学(Radiology,泛指影像文本与 VQA 影像):MIMIC-III 放射报告自由文本(findings → impression 摘要)、VQA-RAD 与 SLAKE 的 CT/MRI/X 光教学影像。
  3. 胸部 X 光(Chest X-ray):MIMIC-CXR 377,110 张影像与 227,835 份报告,支撑报告生成与异常二分类两项任务。
  4. 病理学(Pathology):PathVQA 4,998 张病理插图与 32,795 条问答。
  5. 皮肤科(Dermatology):PAD-UFES-20 2,298 张智能手机拍摄的皮损照片(6 类)。
  6. 乳腺 X 光(Mammography):VinDr-Mammo 20,000 张 FFDM 影像(BI-RADS 5 分类)与 CBIS-DDSM 病灶级 ROI(肿块/钙化 3 分类)。
  7. 基因组学(Genomics):precisionFDA Truth Challenge V2 测序读段数据,按 DeepVariant 思路编码为 pileup 图像,变异检测被构建为 3 类图像分类。

工程上的关键统一:Med-PaLM M 把全部 14 项任务(包括分类)都表述为"提示 → 开放式文本生成"。影像经 ViT 编码为 token 后与文本交错输入,所有任务共享同一套模型权重,无任务特定输出头。这是理解 MultiMedBench 评测协议的核心。

§3.2 样本量拆分(14 项任务完整清单)

全基准合计超 100 万样本(Tu et al., NEJM AI 2024, Table 1)。下表列出 14 项任务及组件原始划分口径(组件各自的 train/dev/test,非 Google 另行划分)。

A. 医学问答(Text,3 项任务)

# 任务 数据集 规模(组件原始口径) 输出
1 多选 QA MedQA(英文 4 选项) 10,178 train / 1,272 dev / 1,273 test 选项字母(生成式)
2 多选 QA MedMCQA 182,822 train / 4,183 dev / 6,150 test(⚠️ test 答案不公开) 选项字母
3 文献 QA PubMedQA(PQA-L) 450 train / 50 dev / 500 test;另有 61,749 未标注 + 211,269 合成 yes / no / maybe

B. 放射报告(Radiology / Chest X-ray,2 项任务)

# 任务 数据集 规模 输出
4 报告摘要 MIMIC-III 放射报告子集 数万份报告级(findings → impression) 自由文本
8 报告生成 MIMIC-CXR 227,835 份报告 / 377,110 张影像(官方 patient-wise 划分) 自由文本

C. 医学视觉问答(VQA,3 项任务)

# 任务 数据集 规模 输出
5 放射 VQA VQA-RAD 315 张影像 / 3,515 QA 封闭 yes/no + 开放短语
6 放射 VQA SLAKE 642 张影像 / 14,028 QA(中英双语) 封闭 + 开放
7 病理 VQA PathVQA 4,998 张图像 / 32,795 QA(19,755 train / 6,761 test) 封闭 + 开放

D. 医学影像分类(5 项任务)

# 任务 数据集 规模 输出
9 胸片异常二分类 MIMIC-CXR 同 #8(影像级标签) abnormal / normal
10 皮肤病变分类 PAD-UFES-20 2,298 张图像(1,373 名患者) 6 类之一
11 乳腺 BI-RADS 分类 VinDr-Mammo 5,000 例检查 / 20,000 张影像 BI-RADS 1–5
12 乳腺肿块分类 CBIS-DDSM(mass) 2,620 例检查中的肿块 ROI benign / malignant / 其他(3 类)
13 乳腺钙化分类 CBIS-DDSM(calcification) 钙化 ROI 3 类

E. 基因组(1 项任务)

# 任务 数据集 规模 输出
14 变异检测 precisionFDA Truth Challenge V2 GIAB 参考样本短/长读长测序数据 pileup 图像 → 3 类(ref / het / hom-alt)

§3.3 数据格式详情

组件 格式 说明
MedQA JSONL(question/options/answer_idx 等) GitHub jind11/MedQA,含英/简中/繁中三分支
MedMCQA JSON(question/opa-opd/cop/exp medmcqa.github.io 下载
PubMedQA JSONL(question/context/final_decision/long_answer pubmedqa.github.io
LiveQA / MedicationQA XML/TSV(问题 + 参考答案 + 主题标注) TREC-2017 / GitHub
MMLU 临床子集 CSV(无表头 6 列) huggingface.co/datasets/cais/mmlu
HealthSearchQA XLSX(补充数据)/ CSV(社区镜像) Nature 论文补充材料;HF 镜像 katielink/healthsearchqa
MIMIC-III / MIMIC-CXR CSV.gz + DICOM/JPG PhysioNet 凭证化下载;BigQuery 可查
VQA-RAD / SLAKE / PathVQA JSON(QA)+ JPG/PNG(影像) OSF / med-vqa.com / GitHub
PAD-UFES-20 CSV 元数据 + PNG 影像 Mendeley Data
VinDr-Mammo CSV 标注 + DICOM PhysioNet 凭证化
CBIS-DDSM CSV 标注 + DICOM TCIA
precisionFDA 挑战 BAM/CRAM/VCF + 参考基因组 precisionFDA 平台

§3.4 存储大小

组件类别 量级 备注
全部 QA 文本组件 < 1 GB 下载即用
VQA 三组件(影像 + QA) 数 GB SLAKE 含双语标注文件
MIMIC-CXR-JPG 约 560 GB 2992×2992 JPG;DICOM 版约 4.7 TB
MIMIC-III(全库,含报告文本) 约 6.2 GB(CSV 压缩) 摘要任务仅需放射报告子集
PAD-UFES-20 / CBIS-DDSM / VinDr-Mammo 数 GB–数十 GB VinDr-Mammo DICOM 为主项
precisionFDA 测序数据 数十 GB–数百 GB 取决于下载哪些读段集
全基准落地总量 约 0.6–5 TB 取决于 MIMIC-CXR 选用 JPG 还是 DICOM

§3.5 标注方式

MultiMedBench 自身不生产标注,其标签体系继承自 12 个组件,可归为五类:

  1. 考试官方答案(MedQA/MedMCQA/MMLU):出题机构答案,权威但存在少量争议题(Med-Gemini 报告 MedQA 7.4% 题目不适于评估)。
  2. 专家人工标注(PubMedQA/VQA-RAD/SLAKE/VinDr-Mammo/PAD-UFES-20):医学背景标注者按协议标注,部分经多人共识或仲裁。
  3. 弱监督/自动派生(MIMIC-CXR 14 类标签/PathVQA):NLP 标注器或规则从报告/图注派生,存在噪声。
  4. 临床常规记录(MIMIC-CXR/MIMIC-III 报告文本):医生真实书写,未经二次校正。
  5. 行业参考标准(precisionFDA):NIST GIAB 高置信变异集,属计量学级金标准。

§3.6 标注者资质与许可证地图

标注者资质:PubMedQA 为 2 名医学标注者 + 分歧仲裁;VQA-RAD 为放射科医师生成问答;VinDr-Mammo 为放射科医生共识读片;PAD-UFES-20 为皮肤科医师诊断(部分活检证实);precisionFDA 为 NIST/GA4GH 联盟参考流程。其余组件为考试机构或教科书内容。

许可证地图(合规使用的总开关)

组件 许可证/获取条件 商业使用 凭证化
MedMCQA MIT ✅ 允许
PathVQA MIT(GitHub UCSD-AI4H/PathVQA) ✅ 允许
MMLU(临床子集) MIT ✅ 允许
PubMedQA CC BY 4.0 ✅ 允许(署名)
PAD-UFES-20 CC BY 4.0(Mendeley Data) ✅ 允许(署名)
HealthSearchQA CC BY 4.0(随 Nature 论文补充数据发布) ✅ 允许(署名)
MedQA GitHub 开放研究使用(社区标注 MIT/CC BY 4.0 不一,建议按研究用途使用) ⚠️ 保守按研究用途
VQA-RAD OSF 开放获取(研究用途) ⚠️ 保守按研究用途
SLAKE 官网开放获取 ⚠️ 见官网条款
LiveQA / MedicationQA TREC/NLM 开放(研究用途) ⚠️ 保守按研究用途
MIMIC-III PhysioNet Credentialed Health Data License 1.5.0 ❌ 受限 是(CITI + DUA)
MIMIC-CXR 同上 ❌ 受限 是(CITI + DUA)
VinDr-Mammo 同上 ❌ 受限 是(CITI + DUA)
CBIS-DDSM TCIA 数据使用政策 ⚠️ 按 TCIA 条款 否(注册下载)
precisionFDA 挑战 precisionFDA 平台开放注册 ✅ 研究用途开放

合规警示:Med-PaLM M 论文称 MultiMedBench “全部由去标识化开源数据集组成”——这里的"开源"不等于"免认证"。3 个 PhysioNet 组件仍需完成 CITI 培训与 DUA 签署(见 §6.5 坑点 5)。

§3.7 数据采集时间范围

组件原始数据采集跨度 1990 年代(DDSM 胶片)至 2020 年代(VinDr-Mammo 2018-2020 采集、HealthSearchQA 2022 年搜索查询);MultiMedBench 本身的策展时间为 2022-2023 年,期刊版定稿 2024-02-22。基准无后续版本迭代,组件数据集各自维护(如 MIMIC-CXR-JPG 已更新至 2.1.0)。

§3.8 地理覆盖

多中心国际组合:美国(MedQA/MMLU/MIMIC 系列/VQA-RAD/CBIS-DDSM/precisionFDA/HealthSearchQA)、印度(MedMCQA)、巴西(PAD-UFES-20)、越南(VinDr-Mammo)、中国团队主导构建(SLAKE 双语集)、国际开放文献与教材(PubMedQA/PathVQA)。这一地理多样性是相对的——英语与美国医疗场景仍占主导(详见 §7.1)。

§3.9 采集设备规格

组件 设备/来源 说明
MIMIC-CXR BIDMC PACS 数字胸片(DICOM) 官方发布 JPG 降采样版(2992×2992,8-bit)
VQA-RAD / SLAKE MedPix 等教学库 CT/MRI/X 光 二手教学影像,无设备元数据
PathVQA 病理教科书电子插图 非 WSI 全切片扫描
PAD-UFES-20 多款智能手机相机 非标准化皮肤镜,含临床元数据
VinDr-Mammo 全视野数字乳腺 X 光(FFDM) 越南两院设备,DICOM 原始格式
CBIS-DDSM DDSM 胶片扫描数字化 含 ROI 裁剪与像素级勾画
precisionFDA 挑战 Illumina 短读长 + PacBio/10X 等平台 GIAB HG002 等参考样本多平台测序

§3.10 深度溯源链

环节 主体/方法 关键转换
1. 原始数据生产 考试机构(USMLE 风格题/AIIMS·NEET)、PubMed 文献、BIDMC 临床系统、TCIA、UFES 皮肤科、越南两院、NIST GIAB 各自临床/教学/计量学场景产生原始数据
2. 组件数据集发布(2016-2023) 各组件原始团队(Jin et al.、Pal et al.、Johnson et al.、Lau et al.、Liu et al.、He et al.、Pacheco et al.、Nguyen et al.、Lee et al. 等) 脱敏、标注、划分、以各自许可证独立发布
3. MultiMedQA 策展(2022-12) Google Research(Singhal et al.) 汇集 6 个 QA 数据集 + 新建 HealthSearchQA;提出人类评估框架
4. MultiMedBench 策展(2023-07) Google Research & DeepMind(Tu et al.) 从 MultiMedQA 取 3 个 QA 集 + 追加 9 个影像/基因组数据集;全部任务统一为开放式生成格式
5. 期刊固化(2024-02-22) NEJM AI 1(3) 基准清单冻结于论文 Table 1;无版本号后续迭代
6. 生态再发布 HuggingFace/BigBio、PhysioNet、BigQuery、各类镜像 bigbio 提供 MultiMedQA 统一加载器;组件各自维护更新(如 MIMIC-CXR-JPG 2.1.0)

§4 数据结构详解

§4.0 目录结构预览

MultiMedBench 无官方打包,以下为按 §6.2 获取各组件后的推荐本地组织方式(与 §6.1 代码的 data_root 约定一致):

multimedbench/
├── qa/                              # 文本 QA 组件(MultiMedQA 体系)
│   ├── medqa/
│   │   ├── data_clean/
│   │   │   ├── questions/US/train.jsonl     # 10,178 题
│   │   │   ├── questions/US/dev.jsonl       # 1,272 题
│   │   │   └── questions/US/test.jsonl      # 1,273 题
│   │   └── README.md
│   ├── medmcqa/
│   │   ├── train.json                 # 182,822 题
│   │   ├── dev.json                   # 4,183 题(⚠️ 社区以此当 test)
│   │   └── test.json                  # 6,150 题(无公开答案)
│   ├── pubmedqa/
│   │   ├── pqal_fold0/train_set.json  # 450 题
│   │   ├── pqal_fold0/dev_set.json    # 50 题
│   │   ├── pqal_fold0/test_set.json   # 500 题
│   │   ├── pqaa/                      # 211,269 合成标注
│   │   └── pqau/                      # 61,749 未标注
│   ├── mmlu_clinical/                 # 6 个临床子集 CSV(1,089 test + 123 dev)
│   ├── liveqa/                        # 634 train / 104 test(XML)
│   ├── medicationqa/                  # 674 题
│   └── healthsearchqa/
│       └── HealthSearchQA.csv         # 3,173 题(仅问题列)
├── vqa/
│   ├── vqa_rad/                       # 315 影像 + VQA_RAD Dataset Public.json
│   ├── slake/                         # 642 影像 + 中英双语 QA JSON
│   └── pathvqa/                       # 4,998 图像 + train/test QA JSON
├── radiology/
│   ├── mimic-cxr-jpg/2.1.0/           # p10-p19 患者分桶目录 + mimic-cxr-2.0.0-metadata.csv.gz
│   └── mimic-iii/NOTEEVENTS.csv.gz    # 放射报告子集用于摘要任务
├── classification/
│   ├── pad-ufes-20/                   # images/ + metadata.csv
│   ├── vindr-mammo/                   # DICOM + finding_annotations.csv
│   └── cbis-ddsm/                     # DICOM + mass/calc case CSV
└── genomics/
    └── precisionfda-v2/               # BAM/CRAM + reference FASTA + GIAB VCF

§4.1 DAIMS 标准化字段描述表

核心结构:多选 QA 记录(MedQA / MedMCQA / MMLU 通用)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
question TEXT 题干(病例描述 + 提问) “A 65-year-old man with … most likely diagnosis?” 模型输入 题干本身偶有不完整(Med-Gemini 报告 7.4% 题目不适于评估) 不允许缺失 自由文本
options DICT/TEXT 选项集合 {“A”: “…”, “B”: “…”, “C”: “…”, “D”: “…”} 候选答案 4 或 5 选项(MedQA 英文取 4 选项版) 不允许缺失 A–E
answer_idx / cop TEXT/INT 金标准答案键 “A” 标签 考试官方答案,存在争议题 不允许缺失 A–E / 0–3
exp TEXT 答案解析(仅 MedMCQA 部分题目) “The drug inhibits HMG-CoA reductase” 推理监督/CoT 蒸馏 众包质量参差 缺失为常见(非信息性) 自由文本或空
meta_info / subject TEXT 科目标签 “Anatomy” 分层评估 MMLU 按子集文件区分 部分组件无 科目枚举

核心结构:PubMedQA 记录

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
question TEXT 研究问题 “Does X improve Y?” 模型输入 从摘要标题改写 不允许缺失 自由文本
context DICT 摘要上下文(含 contexts/labels/meshes) 结构化段落列表 证据输入 摘要不等于全文 不允许缺失 文本列表
final_decision TEXT 三分类标签 “yes” 标签 标注者主观判断,maybe 类边界模糊 不允许缺失(PQA-L) yes/no/maybe
long_answer TEXT 长答案 “In this trial, X was associated with…” 生成评估参考 单一参考,生成评估需容忍变异 PQA-A/U 中缺失 自由文本

核心结构:HealthSearchQA 记录

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
question TEXT 消费者搜索问题 “How serious is atrial fibrillation?” 模型输入 口语化、偶有语法残缺(真实搜索查询特征) 不允许缺失 自由文本
(无答案字段) 数据集不含任何金标准答案 必须人工评估 结构性缺失——设计如此,非数据缺陷

核心结构:MIMIC-CXR 记录(报告生成/分类任务)

字段名 数据类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
dicom_id / path TEXT 影像文件标识/相对路径 “p10000032/s50414267/02aa804e…jpg” 影像定位 不允许缺失 路径字符串
subject_id / study_id INT 患者/检查标识 10000032 / 50414267 患者级划分键 不允许缺失 正整数
report TEXT 放射报告全文 “FINAL REPORT … FINDINGS: … IMPRESSION: …” 生成目标 文书风格异质;含脱敏占位符 少数检查无报告 自由文本
ViewPosition TEXT 投照体位 “PA” 视图过滤 元数据偶有缺失 缺失需推断 PA/AP/LATERAL 等
split TEXT 官方划分 “train” 划分字段 官方 patient-wise 划分 不允许缺失 train/validate/test
(14 类标签) INT CheXpert 式弱监督标签 1 / 0 / -1 分类标签 NLP 标注器噪声;不确定类 -1 处理口径不一 -1 即信息性不确定 1/0/-1/空

§4.2 标签分布统计

任务/组件 标签分布 说明
MedQA(test 1,273) 4 选项近似均匀 单选
MedMCQA(全库 194,441) 4 选项近似均匀;21 科目分布不均(最大科目占比 >20%) 科目长尾
PubMedQA PQA-L(1,000) yes 约 55% / no 约 33% / maybe 约 12% maybe 类最难、类间不平衡
MMLU 临床子集(1,089 test) 6 子集题量不等(professional medicine 272、clinical knowledge 265、college medicine 173、anatomy 135、college biology 144、medical genetics 100) 子集不可合并口径与单科口径混报
PAD-UFES-20(2,298) 6 类不平衡:痣(NEV)与基底细胞癌(BCC)为大类, Bowen 病等小类样本极少 长尾显著
VinDr-Mammo(20,000 影像) BI-RADS 1–5 高度不平衡,阳性(4-5)为少数类 筛查场景自然分布
MIMIC-CXR 14 类 No Finding 与 Support Devices 高频;Pneumonia 等低频;不确定标签(-1)占比可观 弱监督标签
precisionFDA(3 类 pileup) ref 类远多于 het/hom-alt 变异天然稀疏

§4.3 关键字段描述性统计

  • MedQA 英文题干平均长度约 110-130 词,为四个 MCQ 组件中最长(病例型题干);MMLU 临床子集题干最短(纯知识点)。
  • PubMedQA 上下文平均约 250-300 词(单摘要);长答案平均 1-2 句。
  • HealthSearchQA 问题平均不足 15 词(真实搜索查询特征:短、口语、无临床术语规范)。
  • VQA-RAD 封闭题(yes/no 等)约占 58%、开放题约占 42%;SLAKE 开放题答案平均 1-3 词。
  • MIMIC-CXR 报告 FINDINGS 段中位长度约 40-60 词,IMPRESSION 段约 15-25 词。
  • 全基准合计:3 个 QA 组件(MultiMedBench 口径)约 20 万题 + VQA 约 5 万 QA + 报告约 30 万份 + 影像分类约 40 万张 + 基因组样本,总样本量超 100 万(Tu et al. Table 1)。

§4.4 数据层级关系

MultiMedBench(14 任务 / 12 数据集)
├── 语言线(源自 MultiMedQA 体系,Singhal et al. 2023)
│   ├── MultiMedBench 收录:MedQA / MedMCQA / PubMedQA
│   └── 仅 MultiMedQA 收录:LiveQA / MedicationQA / MMLU 临床子集 / HealthSearchQA
├── 放射线
│   ├── MIMIC-III(患者 subject_id → 住院 hadm_id → 报告 row_id)
│   └── MIMIC-CXR(subject_id → study_id → dicom_id;1 患者 : N 检查 : N 视图)
├── VQA 线
│   ├── VQA-RAD(image_id → N 个 QA)
│   ├── SLAKE(image_id → 中英双份 QA + 语义标注)
│   └── PathVQA(image_id → N 个 QA)
├── 分类线
│   ├── PAD-UFES-20(patient_id → lesion_id → image)
│   ├── VinDr-Mammo(study_id → breast 侧别 → view)
│   └── CBIS-DDSM(patient → breast → abnormality ROI)
└── 基因组线
    └── precisionFDA(样本 → 平台读段 → pileup 位点图像)

高频踩坑:MIMIC-CXR 一个 study 含多张视图影像(PA/AP/侧位),按影像级随机划分会把同一检查的不同视图切到训练与测试两侧——必须使用官方 patient-wise split(见 §6.5 坑点 7)。PAD-UFES-20 同理需按 patient_id 分组划分。

§4.5 缺失值情况与信息性缺失编码

缺失类型 组件/字段示例 缺失原因 信息性缺失编码 对 AI 的影响
结构性缺失(设计如此) HealthSearchQA 全部答案字段 数据集设计为"仅问题"开放评测 必须人工评估,不可自动打分 误用自动指标(如对参考答案算 BLEU)将无从下手
答案不可得 MedMCQA 官方 test 的 cop 主办方防刷榜未公开 社区以 dev(4,183)替代测试 各论文 test 口径不一,结果不可直接比
不确定标签 MIMIC-CXR 14 类中的 -1 CheXpert 标注器对"不确定"的编码 -1 即"标注不确定",各家处理口径(当作阴性/丢弃/单独类)不同 分类指标可比性受损
元数据缺失 MIMIC-CXR ViewPosition 等 PACS 元数据不全 缺失非随机(床旁片更常缺) 视图过滤需容错
解析缺失 MedMCQA exp 字段 众包解析覆盖不全 缺失与题目难度相关 CoT 蒸馏样本有选择偏倚
参考文档缺失 LiveQA/MedicationQA 部分参考答案链接 NLM 页面更新失效 时间性失效 复现原始评估需存档版本

§5 数据划分与使用建议

§5.1 官方数据划分

MultiMedBench 本身不提供统一划分文件——Tu et al. 论文直接沿用各组件的原始官方划分。这正是复现时的第一个决策点:你必须逐组件确认"原论文用哪个 split 评测"。

组件 官方划分 MultiMedBench 评测口径
MedQA 10,178 / 1,272 / 1,273 test 1,273
MedMCQA 182,822 / 4,183 / 6,150(test 无答案) 论文报 6.1K test;社区普遍以 dev 4,183 评测
PubMedQA 450 / 50 / 500(PQA-L fold0) test 500
MMLU 临床子集 dev 123(作 few-shot 示例)/ test 1,089 test 1,089
VQA-RAD 官方 train/test test 集
SLAKE 官方 train/val/test(70/15/15 近似) test 集
PathVQA 19,755 / 6,761 test 6,761
MIMIC-CXR 官方 patient-wise train/validate/test test 集
PAD-UFES-20 无官方划分(需自行按 patient_id 分组) Med-PaLM M 使用其内部划分
VinDr-Mammo 官方 train/test(4,000/1,000 检查) test 集
CBIS-DDSM 官方 train/test test 集
precisionFDA 挑战主办方划分 挑战测试集

§5.2 推荐划分策略

  1. 沿用组件官方 split(与文献可比的前提):绝大多数组件有官方划分,直接采用;报告指标时注明口径。
  2. 无官方划分组件的患者级分组划分:PAD-UFES-20 必须按 patient_id 分组(同一患者的多张皮损照片不可跨侧):
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit

meta = pd.read_csv("pad-ufes-20/metadata.csv")
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(meta, groups=meta["patient_id"]))
assert not set(meta.iloc[tr]["patient_id"]) & set(meta.iloc[te]["patient_id"])
  1. 多任务联合训练的任务配比:复现 Med-PaLM M 式联合训练时,按任务样本量反比采样或使用温度采样(temperature sampling),防止 MedMCQA(18 万题)淹没 VQA-RAD(3.5K QA)。
  2. 污染审计后的重划分:若训练语料可能已见公开测试集(MedQA/MMLU 高危),建议以题面模糊匹配(8-gram overlap)剔除后再报"去污染"口径(见 §6.5 坑点 6)。

§5.3 数据泄漏风险防御

# 泄漏模式 严重程度 防御措施
1 MIMIC-CXR 按影像而非患者划分(同一 study 多视图跨侧) 使用官方 patient-wise split
2 PAD-UFES-20 按照片而非患者划分(同患者多皮损跨侧) GroupShuffleSplit(groups=patient_id)
3 SLAKE 双语平行样本:训练用英文、测试用中文时同一影像跨侧 双语实验按 image_id 对齐划分
4 PathVQA 同一教科书插图的多条 QA 跨侧 按 image_id 分组划分
5 用 PubMedQA 的 long_answer 训练后在 final_decision 上评测时的答案串味 任务头分离,评测只看 final_decision
6 预训练语料含公开测试集题面(MedQA/MMLU 广为流传) 高(基准层面) 报告污染审计结果;用未见过的私有集复核

§5.4 交叉验证建议

  • 小规模组件(VQA-RAD 315 张影像、PAD-UFES-20 2,298 张照片):5 折分组交叉验证报告均值 ± 标准差,避免单次划分的幸运/不幸偏差。
  • 大规模组件(MedMCQA、MIMIC-CXR):单次官方划分即可,方差已足够小。
  • PubMedQA PQA-L 仅 1,000 题:论文惯例使用 fold0 的 450/50/500;做方法学对比时建议 10 折交叉验证复核。

§5.5 外部验证

MultiMedBench 本身就是"跨数据集泛化"的框架性答案——14 项任务互为外部验证场。在此之外的经典路径:QA 可用 MedBullets(JAMA 风格新题)、MedXpertQA、CMB/CMExam(中文)做时代外与语言外验证;报告生成可用 CheXpert Plus、OpenI-IU 跨机构验证;乳腺任务可用 CMMD(中国乳腺 X 光)做跨洲验证;基因组可用 GIAB 其他参考样本(HG003/HG004)或 Syndip 合成二倍体做样本外验证。


§6 AI 就绪指南

§6.0 云端快速启动

QA 子集零门槛体验:MultiMedQA 的多数组件可直接经 HuggingFace datasets 加载,Colab 免费 GPU 即可完成一次 100 题的 MedQA 小样本评测。

# Colab 5 分钟体验:加载 MedQA 测试集前 100 题做 zero-shot 评测
# 环境要求:datasets>=2.14(无需 GPU 也可加载查看)
from datasets import load_dataset

medqa = load_dataset("bigbio/med_qa", "med_qa_en_source", split="test")
print(len(medqa))        # 1273
print(medqa[0]["question"])
print(medqa[0]["options"])
print(medqa[0]["answer_idx"])

BigQuery 免下载查 MIMIC-CXR 报告:完成 PhysioNet 认证并绑定 GCP 后,直接查询 physionet-data.mimic_cxr 数据集,每月 1 TB 免费查询额度足够报告文本类原型开发。

§6.1 快速上手

# ========================================
# MultiMedBench 快速上手 — MCQ 三件套(MedQA / MedMCQA / PubMedQA)统一加载与评测
# 环境要求: datasets>=2.14, pandas, tqdm
#
# ⚠️ 目录结构预期(本地文件方案):
#   ./multimedbench/qa/
#   ├── medqa/data_clean/questions/US/test.jsonl
#   ├── medmcqa/dev.json              # 注意:以 dev 当 test
#   └── pubmedqa/pqal_fold0/test_set.json
#
# 也可以直接用 HuggingFace 镜像(推荐,免下载):
#   bigbio/med_qa, bigbio/medmcqa, bigbio/pubmed_qa
# ========================================
from datasets import load_dataset

# 1) 统一加载三个 MCQ 组件(bigbio 源,字段已标准化)
medqa   = load_dataset("bigbio/med_qa", "med_qa_en_source", split="test")
medmcqa = load_dataset("bigbio/medmcqa", "medmcqa_source", split="validation")  # dev-as-test
pubmedqa = load_dataset("bigbio/pubmed_qa", "pubmed_qa_labeled_source", split="test")
print(len(medqa), len(medmcqa), len(pubmedqa))   # 1273 / 4183 / 500

# 2) 统一为 MultiMedBench 风格 prompt(开放式生成接口:连选择题也要求生成)
def to_prompt(sample, with_context=False):
    opts = "\n".join(f"{k}. {v}" for k, v in
                     zip("ABCDE", [o["value"] for o in sample["options"]]))
    ctx = f"\nContext: {' '.join(sample['context'])}\n" if with_context else "\n"
    return f"Question: {sample['question']}\n{ctx}{opts}\nAnswer:"

print(to_prompt(medqa[0]))

# 3) 评测计数器(exact match on option letter)
import re
def score_mcqa(generations, gold_letters):
    correct = 0
    for gen, gold in zip(generations, gold_letters):
        m = re.search(r"\b([A-E])\b", gen.strip())
        if m and m.group(1) == gold:
            correct += 1
    return correct / len(gold_letters)

gold = [s["answer_idx"] for s in medqa.select(range(100))]
# generations = your_model.generate([to_prompt(s) for s in medqa.select(range(100))])
# print(f"MedQA-100 accuracy: {score_mcqa(generations, gold):.3f}")

§6.2 数据获取流程

MultiMedBench 没有统一入口——按组件分别获取(与 §3.6 许可证地图一一对应):

组件 获取地址 大小 流程
MedQA github.com/jind11/MedQA 数 MB git clone 即用
MedMCQA medmcqa.github.io 数十 MB 官网注册下载
PubMedQA pubmedqa.github.io 数十 MB 官网/GitHub 直接下载
MMLU 临床子集 huggingface.co/datasets/cais/mmlu 数 MB load_dataset("cais/mmlu", "anatomy") 等 6 子集
LiveQA TREC 2017 LiveQA-Med 页面 <1 MB 填表下载
MedicationQA github.com/abachaa/MedicationQA <1 MB git clone 即用
HealthSearchQA Nature 论文补充数据(s41586-023-06291-2);HF 镜像 katielink/healthsearchqa <1 MB 直接下载
VQA-RAD osf.io/89kps 数百 MB OSF 直接下载
SLAKE med-vqa.com/slake 数 GB 官网申请下载
PathVQA github.com/UCSD-AI4H/PathVQA 数 GB 仓库内 Google Drive 链接
MIMIC-III physionet.org/content/mimiciii/1.4/ 6.2 GB CITI 培训 + 凭证化申请 + DUA(1-2 周)
MIMIC-CXR-JPG physionet.org/content/mimic-cxr-jpg/2.1.0/ 约 560 GB 同上(一次凭证化全平台通用)
PAD-UFES-20 data.mendeley.com/datasets/zr7vgbcsv2/1 数百 MB 直接下载(CC BY 4.0)
VinDr-Mammo physionet.org/content/vindr-mammo/1.0.0/ 数十 GB CITI + DUA
CBIS-DDSM cancerimagingarchive.net(CBIS-DDSM 集合) 数十 GB 注册后 NBIA Data Retriever 下载
precisionFDA Truth Challenge V2 precision.fda.gov/challenges/9 数十-数百 GB 平台注册后下载

凭证化三组件一次搞定:PhysioNet 的 CITI 培训(“Data or Specimens Only Research”,约 2-4 小时)与凭证化申请一次完成后,MIMIC-III、MIMIC-CXR-JPG、VinDr-Mammo 三个组件各自签署 DUA 即可下载,无需重复认证。

§6.3 预处理 Pipeline

<details>
<summary><b>点击展开:多模态统一预处理 4 步流程(QA → VQA → 影像 → 基因组)</b></summary>

# 步骤 1:QA 组件统一 schema(见 §6.1),并存为统一 jsonl
import json
def dump_jsonl(samples, path):
    with open(path, "w") as f:
        for s in samples:
            f.write(json.dumps(s, ensure_ascii=False) + "\n")

# 步骤 2:VQA 组件——封闭/开放题分流(评估指标不同)
import json
def split_closed_open(qa_list):
    closed = [q for q in qa_list if q["answer"].lower() in ("yes", "no")]
    open_  = [q for q in qa_list if q["answer"].lower() not in ("yes", "no")]
    return closed, open_
# VQA-RAD / SLAKE / PathVQA 的 closed 部分报 accuracy;open 部分报 BLEU/F1(见 §6.9)

# 步骤 3:影像组件——统一尺寸与归一化(Med-PaLM M 用 224/448/896 多分辨率)
from PIL import Image
import torchvision.transforms as T
cxr_transform = T.Compose([
    T.Grayscale(num_output_channels=3),   # DICOM/JPG 灰度 → 3 通道
    T.Resize((448, 448)),
    T.ToTensor(),
    T.Normalize(mean=[0.5]*3, std=[0.25]*3),
])
img = cxr_transform(Image.open("multimedbench/radiology/mimic-cxr-jpg/2.1.0/files/p10/p10000032/s50414267/02aa804e-bded0d84-4b2345c1.jpg"))

# 步骤 4:基因组——BAM → pileup 图像(DeepVariant 风格)
# 概念流程(生产环境请直接用 google/deepvariant 官方工具链):
#   samtools view -h sample.bam | deepvariant make_examples → pileup 张量 (H×W×C)
#   通道 = [read base, base quality, mapping quality, strand, supports variant, ...]
#   位点级 3 类标签:0=ref, 1=het, 2=hom-alt(对照 GIAB 高置信 VCF)

</details>

推荐直接使用社区成熟管道替代手写:HuggingFace bigbio(MultiMedQA 全组件统一加载器,字段标准化)、google/deepvariant(基因组 pileup 生成与变异检测官方工具链)、TorchXRayVision(MIMIC-CXR 加载与预训练模型)、MedVidQA/LLaVA-Med 仓库(VQA 评测脚本)。

§6.4 框架加载

# PyTorch:VQA/影像分类通用 Dataset
import torch
from torch.utils.data import Dataset, DataLoader
from PIL import Image

class MedVQADataset(Dataset):
    def __init__(self, qa_records, img_root, transform=None):
        self.qa, self.img_root, self.transform = qa_records, img_root, transform
    def __len__(self):
        return len(self.qa)
    def __getitem__(self, i):
        rec = self.qa[i]
        img = Image.open(f"{self.img_root}/{rec['image_name']}").convert("RGB")
        if self.transform:
            img = self.transform(img)
        return img, rec["question"], rec["answer"]

loader = DataLoader(MedVQADataset(records, "multimedbench/vqa/vqa_rad/imgs",
                                  transform=cxr_transform),
                    batch_size=32, shuffle=True, num_workers=4)
# 多任务联合训练的任务混合器(防止大任务淹没小任务)
from torch.utils.data import ConcatDataset
from torch.utils.data import WeightedRandomSampler

datasets = {"medqa": ds1, "vqa_rad": ds2, "cxr_cls": ds3}
weights = []
for name, ds in datasets.items():
    weights += [1.0 / len(ds)] * len(ds)      # 任务等概率采样(温度=1)
sampler = WeightedRandomSampler(weights, num_samples=100_000, replacement=True)
joint_loader = DataLoader(ConcatDataset(datasets.values()),
                          batch_size=64, sampler=sampler)

§6.5 常见坑点

⚠️ 坑点 1:MultiMedBench 与 MultiMedQA 张冠李戴(分类:标签理解)

问题:两个名字只差一个字母的基准常被混为一谈:MultiMedQA(2022,7 个纯文本 QA)≠ MultiMedBench(2023,14 任务多模态)。更隐蔽的是:MultiMedBench 只收录了 MultiMedQA 中的 3 个数据集(MedQA/MedMCQA/PubMedQA),HealthSearchQA、LiveQA、MedicationQA、MMLU 临床子集并不在 MultiMedBench 内。

症状:论文综述里写"MultiMedBench 包含 HealthSearchQA";复现实验时在 MultiMedBench 里找不到 MMLU;引用错论文(QA 结果引 Tu et al. 而非 Singhal et al.)。

解决:记忆锚点——“QA 结尾管语言(7 个 QA),Bench 结尾管多模态(14 任务)”。引用规则:纯 QA 实验引 Singhal et al. Nature 2023(DOI: 10.1038/s41586-023-06291-2);多模态实验引 Tu et al. NEJM AI 2024(DOI: 10.1056/AIoa2300138);两者都做则双引。

参考:Tu et al. NEJM AI 2024 Table 1(“three of the MultiMedQA tasks”);Singhal et al. Nature 2023 Extended Data Table 1。

⚠️ 坑点 2:HealthSearchQA 没有金标准答案,不能算 accuracy(分类:评估误用)

问题:HealthSearchQA 的 3,173 条记录只有问题列——它是为人工评估框架设计的开放评测集,不存在参考答案。任何"在 HealthSearchQA 上报告准确率"的表述都是方法论错误。

症状:找不到答案字段;试图对模型输出算 BLEU/ROUGE 时发现无参考可比;审稿人被质疑指标来源。

解决:严格按 Singhal et al. 的人类评估框架执行:临床医生沿多轴打分(科学共识对齐、阅读理解、知识调用、推理、完整性、潜在伤害、偏倚);控制成本可先评估 MultiMedQA-140 子集(论文使用的 140 题评估子集,HF 镜像含 140_question_subset 配置)。另注意口径差:Extended Data Table 写 3,375,发布文件实为 3,173 行——引用时以发布文件为准。

参考:Singhal et al. Nature 2023 正文与 Extended Data Table 2-3;HF katielink/healthsearchqa。

⚠️ 坑点 3:MedMCQA 官方测试集没有公开答案(分类:评估误用)

问题:MedMCQA 的官方 test split(6,150 题)答案未公开(防刷榜设计)。不同论文的"MedMCQA 测试准确率"口径各不相同:Med-PaLM 系报告官方 test 口径(经主办方渠道评估),而绝大多数开源复现以 dev(4,183 题)当 test。

症状:你的 4,183 题 dev 准确率比论文数字高 1-3 个点;跨论文表格对比时数字对不上。

解决:论文中必须写明评测 split("MedMCQA dev (4,183)“或"official test (6,150)”);做横向对比表时按口径分组,不要把 dev 与 test 数字排在同一列;Flan-PaLM/Med-PaLM 系列的 MedMCQA 数字为官方 test 口径。

参考:MRAG-Bench 论文(arXiv:2601.16503)对该口径问题的明确说明;medmcqa.github.io

⚠️ 坑点 4:“全部开源”≠“全部免认证”——3 个组件需 CITI 凭证化(分类:工程陷阱)

问题:Tu et al. 称 MultiMedBench “comprises de-identified datasets that are all open source”,容易让人以为 12 个组件全部点击即得。实际上 MIMIC-III、MIMIC-CXR、VinDr-Mammo 三个组件受 PhysioNet Credentialed Health Data License 约束,必须完成 CITI 培训、通过凭证化审核并签署 DUA。

症状:项目排期按"当天下载"规划,结果 MIMIC-CXR 凭证化审核花了 1-2 周;团队成员间共享下载文件违反 DUA。

解决:项目启动第一周即提交 PhysioNet 凭证化申请(培训约 2-4 小时,审核数个工作日至 2 周);团队成员每人独立签署 DUA,不得共享账号或数据副本;时间紧可先用 MIMIC-CXR 之外的 9 个开放组件开工。

参考physionet.org/content/mimic-cxr-jpg/2.1.0/;PhysioNet Credentialed Health Data License 1.5.0。

⚠️ 坑点 5:公开测试集污染——MedQA/MMLU 已广泛进入预训练语料(分类:数据泄漏)

问题:MedQA、MMLU 等公开选择题集在互联网上流传多年,已被大量 LLM 预训练语料收录。2023 年后的通用大模型在这些测试集上的分数普遍含"记忆红利",与真实泛化能力脱钩。Med-Gemini 论文更进一步指出:MedQA 中 7.4% 的题目本身不适于评估(信息缺失或多解)。

症状:未经医学微调的通用大模型 MedQA 分数高得反常;同一模型在新出的私有题集上分数骤降。

解决:(1) 对训练语料做题面 8-gram overlap 污染审计并报告剔除口径;(2) 结果解读时区分"被污染口径"与"去污染口径";(3) 用时代外新题(MedBullets、MedXpertQA、每年新发布的考试题)做复核;(4) 报告时注明评测日期与模型知识截止。

参考:Saab et al. 2024(arXiv:2404.18416)对 MedQA 题目质量的分析;Singhal et al. Nature Medicine 2025 的去污染讨论。

⚠️ 坑点 6:SLAKE 双语口径——EN-only 与全量结果不可直接比(分类:评估误用)

问题:SLAKE 是中英双语数据集(同一影像有英文与中文两套 QA)。不同论文报告的 SLAKE 数字有的只用英文子集、有的用双语全量、有的只报封闭题——三种口径数值差异可达数个百分点。

症状:你的英文子集 BLEU-1 比某论文高出 10 个点,复查发现对方用的是双语全量。

解决:论文中显式声明口径(“SLAKE-EN”、“SLAKE-bilingual”、“SLAKE closed-only”);Med-PaLM M 报告的 SLAKE 结果为其开放式生成口径(BLEU-1/F1),与传统判别式 VQA 的 accuracy 口径不同,跨方法对比前先看指标定义。

参考:Liu et al. ISBI 2021 SLAKE 原论文;Tu et al. NEJM AI 2024 附录评测协议。

⚠️ 坑点 7:MIMIC-CXR 视图级划分导致同检查泄漏(分类:数据泄漏)

问题:MIMIC-CXR 一次检查(study_id)含多张视图影像,若按影像级随机划分,同一检查的正位与侧位会分落训练/测试两侧,模型可通过"认出同一张片子"作弊。报告生成任务同样必须按患者划分。

症状:胸片分类 AUROC 异常高(>0.95),改用官方 split 后回落 3-5 个点。

解决:一律使用官方 patient-wise 划分(mimic-cxr-2.0.0-split.csv.gz);报告生成使用官方 test 集并与 CheXbert/RadGraph 指标配套;自训练划分时按 subject_id 分组。

参考:Johnson et al. Scientific Data 2019(MIMIC-CXR 论文)官方划分说明。

⚠️ 坑点 8:基因组任务不是序列任务——它被构建为图像分类(分类:标签理解)

问题:MultiMedBench 的基因组变异检测(precisionFDA Truth Challenge V2)并非直接处理 ATCG 序列,而是沿用 DeepVariant 范式:把测序读段在某位点的堆叠编码为 pileup 图像,再做 3 类图像分类(ref/het/hom-alt)。把它当"基因组 NLP 任务"准备数据会完全走偏。

症状:拿着 FASTA/VCF 试图喂给序列模型,发现基准口径对不上;复现 Med-PaLM M 基因组结果时无从下手。

解决:理解任务定义 = “BAM → pileup 图像 → 3 分类”;生产级流程直接用 google/deepvariant 的 make_examples 生成 pileup;评估口径与 precisionFDA 挑战一致(SNV/Indel 分型 F1);若你的研究是序列级变异解读,应另选 GIAB VCF 直接评测,不必套用本任务。

参考:precisionFDA Truth Challenge V2 挑战页;Poplin et al. DeepVariant(Nature Biotechnology 2018)。

版本提示:MultiMedBench 无版本号迭代,但其组件各自演进(如 MIMIC-CXR-JPG 已发布 2.1.0)。论文复现时请锁定组件版本并在方法学中注明(“MIMIC-CXR-JPG v2.0.0”),不同小版本间的样本量与元数据存在细微差异。

§6.6 数据增强

✅ 安全增强 ❌ 危险增强(禁止)
影像:小幅旋转(≤10°)、亮度/对比度抖动、随机裁剪 对胸片做水平翻转(右位心等侧别病理会被翻转成"假正常",且报告文本含左右方位词,图文失配)
QA:改写提问句式(保持选项与答案不变) 改动题干中的年龄/性别/检验数值(改变临床语义与答案)
报告:同义句改写 IMPRESSION 段做风格增广 交换 FINDINGS 与 IMPRESSION(破坏文书逻辑)
基因组:读段下采样模拟低深度测序 对 pileup 图像做旋转/翻转(读段方向有链特异性含义)
VQA:问题模板扩写 跨影像复用问答对(答案绑定具体影像内容)

§6.7 模型推荐

任务 推荐方案 参考性能(组件原生口径)
MCQ 三件套 GPT-4 级通用 LLM + CoT;或 Med-PaLM 2 级医学 LLM MedQA 86.5%(Med-PaLM 2)/ 91.1%(Med-Gemini,带搜索)
轻量 QA 基线 BioBERT/ClinicalBERT 判别式微调 MedQA 约 40-50%(远低于 LLM 时代基线,仅作历史对照)
医学 VQA LLaVA-Med / Med-Flamingo 式视觉-语言模型 VQA-RAD 封闭题约 70-80%
报告生成 影像编码器 + LLM 解码(MAIRA、RadFM 系) MIMIC-CXR CheXbert macro-F1 约 0.40-0.50
影像分类(单任务) DenseNet-121 / ViT-B 微调 MIMIC-CXR 异常二分类 AUROC 约 0.85-0.90
基因组变异检测 DeepVariant 官方模型 SNV F1 >0.99(GIAB 高置信区)
全科联考 多模态基础模型 + 多任务联合微调(Med-PaLM M 范式) 见 §8.1 排行榜

§6.8 计算资源需求

场景 磁盘 内存/显存 说明
QA 三件套评测(API 调用) <1 GB 无需 GPU 按 token 计费,100 题约数美分
QA 本地小模型微调(7B) 20 GB 1 × 24 GB(QLoRA) MedQA 单卡数小时
VQA 三组件训练 20 GB 1 × 24-40 GB LLaVA 式微调
MIMIC-CXR 报告生成 600 GB(JPG 版) 4 × 40 GB 影像编码器预训练另计
全 14 任务联合训练(Med-PaLM M 级) 约 1-5 TB TPU v4 Pod 级 仅供参照——原论文为 Google 内部算力
基因组 pileup 全流程 500 GB CPU 32 核 + 1 × 16 GB DeepVariant 单机可跑

§6.9 评估指标

# MCQ:选项字母 exact match(§6.1 已给出 score_mcqa)

# VQA 开放题:BLEU-1 + token F1(Med-PaLM M 口径)
from collections import Counter
import re

def token_f1(pred: str, gold: str) -> float:
    p, g = Counter(re.findall(r"\w+", pred.lower())), Counter(re.findall(r"\w+", gold.lower()))
    common = sum((p & g).values())
    if common == 0:
        return 0.0
    prec, rec = common / sum(p.values()), common / sum(g.values())
    return 2 * prec * rec / (prec + rec)

# 报告生成:CheXbert 标签 F1(临床效力)+ ROUGE-L(文本重叠)
# 临床效力指标推荐直接用官方 CheXbert 标注器对生成报告抽 14 类标签后算 macro/micro-F1
# pip install chexbert(或用 stanfordmlgroup 官方仓库),与 MIMIC-CXR 社区口径一致

# 分类任务:macro-F1 + AUROC(多分类报 macro;乳腺任务另报 sensitivity @ specificity)
from sklearn.metrics import f1_score, roc_auc_score
macro_f1 = f1_score(y_true, y_pred, average="macro")

社区共识口径:MCQ 报 accuracy(注明 split);VQA 封闭题报 accuracy、开放题报 BLEU-1/F1(Med-PaLM M 口径);报告生成报 CheXbert macro/micro-F1 + ROUGE-L/BLEU(多指标并列,单一 BLEU 不足以说明临床质量);影像分类报 macro-F1/AUROC;基因组报 SNV/Indel 分型 precision/recall/F1。

§6.10 MLOps 笔记

  • 版本锁定:论文方法部分必须注明组件版本(“MedQA (Jin et al. 2021, en_4options)”、“MIMIC-CXR-JPG v2.0.0”)与评测 split 口径;MultiMedBench 本身引 Tu et al. NEJM AI 2024。
  • 引用规范:使用 MultiMedBench 需同时引用 Tu et al.(NEJM AI 2024)与所用组件的原始论文;使用 MultiMedQA/HealthSearchQA 需引 Singhal et al.(Nature 2023)。
  • 评测卫生:建立"污染审计 → 去污染口径 → 时代外复核"三步流程(见 §6.5 坑点 5),并在模型卡片中披露。
  • 人工评估管理:HealthSearchQA/LiveQA/MedicationQA 的人工评估需留存评分者资质、评分轴定义与原始打分表,备审稿复查。
  • 凭证化组件的团队管理:DUA 按人签署,CI/CD 中不得缓存 PhysioNet 凭证;数据存储位置与访问日志按机构信息安全要求留档。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
考试风格偏倚 MCQ 组件反映美国/印度考试大纲与命题风格,不等同于真实临床决策 高(对"临床能力"的外推) 结论限定为"考试型知识测评";补长文本与真实病历评估
英语中心偏倚 除 SLAKE(中英双语)外全为英文组件;消费者问题集(HealthSearchQA/LiveQA/MedicationQA)来自美国英语互联网用户 中文场景用 CMB/CMExam/SLAKE-zh 补测
单中心/单国影像偏倚 MIMIC 系列来自波士顿 BIDMC;PAD-UFES-20 来自巴西单机构;VinDr-Mammo 来自越南两院 中高 跨机构外部验证(CheXpert Plus、CMMD 等)
教学库选择偏倚 VQA-RAD/PathVQA 取材教学影像与教科书插图,病例"教科书化",罕见表现型不足 结论不外推至真实阅片场景
弱监督标签噪声 MIMIC-CXR 14 类标签为 NLP 标注器派生;PathVQA 部分问答自动生成 人工复核子集评估;不确定标签口径显式化
肤色谱偏倚 PAD-UFES-20 以巴西人群为主,深肤色亚型样本有限;全球皮肤病影像普遍浅肤色偏斜 肤色分层报告(Fitzpatrick 分型)
参考样本偏倚 基因组任务基于 GIAB 阿什肯纳兹裔参考 trio,变异谱不代表全球人群 用其他祖源参考样本复核
时间漂移偏倚 题库与文献的医学知识有时效(指南迭代);影像组件采集跨越胶片到数字时代 报告评测日期;用新题集做时代外验证

§7.2 标注质量评估

标注类型 可靠性 一致性 局限性
考试官方答案(MedQA/MedMCQA/MMLU) Med-Gemini 报告 MedQA 7.4% 题目不适于评估(信息缺失/多解)
PubMedQA 专家标注 高(双人标注 + 仲裁) 高(论文报告标注者一致性高) maybe 类语义边界天然模糊
VQA-RAD 医师问答 中(开放题答案措辞多样) 规模小(3,515 QA)
SLAKE 语义标注 高(结构化器官/模态标签) 双语平行质量依赖翻译流程
PathVQA 半自动问答 教科书图注自动派生,长尾答案噪声
MIMIC-CXR 弱监督标签 中(CheXpert 标注器) 不确定标签占比高;非放射科医生金标准
放射报告文本 临床常规文书 风格异质 未经二次校正,含脱敏占位符
GIAB 参考变异 计量学级 NIST 多平台共识 仅覆盖高置信区域,难区域被排除

§7.3 泛化性讨论

场景 失效风险 证据
考试分数 → 真实临床能力 Med-PaLM 系论文反复强调"考试通过 ≠ 临床可用";人类评估框架正是为此设计
美国英语 QA → 其他语言/医疗体系 中文执业医师体系差异显著;需 CMB/CMExam 等本地基准复核
MIMIC 胸片 → 其他机构影像 中高 机构间协议/人群差异导致报告风格与标签分布漂移(CheXpert 迁移研究共识)
教科书影像 VQA → 真实阅片 教学病例的典型性与真实门诊分布差距大
公开测试集 → 未污染新题 测试集广泛进入预训练语料;Med-Gemini 用不确定性引导搜索后仍对题目质量做专项修正
GIAB 参考样本 → 临床患者测序 参考样本为高深度多平台数据,临床低深度/难区域性能下降

§7.4 伦理考量

  1. MultiMedBench 的组件均经去标识化,但 MIMIC 系列包含真实 ICU 患者(相当部分已去世)的诊疗记录,研究者应保持对患者与家属的尊重。
  2. 凭证化组件的 DUA 禁止任何重识别尝试;影像中残余的潜在标识信息(如胸片上的体外设备文字)不得用于关联攻击。
  3. 消费者问题集(HealthSearchQA/LiveQA/MedicationQA)来自真实用户的健康搜索——问题本身可能披露敏感健康关切,使用与展示示例时应避免可能的个人指向。
  4. 考试成绩不等于临床胜任力:禁止将 MultiMedBench 高分直接作为产品临床安全性声明的依据;任何临床部署须独立验证与监管审批。
  5. 基因组参考样本虽为公开参考物质,仍涉及供体家族的遗传信息伦理(GIAB 供体知情同意框架下的使用边界)。

§7.5 公平性评估

# 影像分类任务的亚组公平性(以 MIMIC-CXR 元数据为例)
from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score

frame = MetricFrame(
    metrics={"AUROC": roc_auc_score},
    y_true=y_test, y_pred=y_prob,
    sensitive_features=meta_test["sex"]   # 可替换为 age_group / insurance
)
print(frame.by_group)
print("max disparity:", frame.difference())

已知公平性问题(组件文献共识):MIMIC 系列少数族裔亚组样本稀疏导致亚组指标置信区间宽;PAD-UFES-20 深肤色亚型不足;MedMCQA 印度英语命题风格对非印度医学教育背景模型存在系统性不利;HealthSearchQA 消费者提问反映可及互联网搜索的人群,数字健康鸿沟未在评测中被代表。

§7.6 数据漂移提示

  • 知识漂移:医学指南持续迭代(如脓毒症、肿瘤分期标准更新),2022 年前题库的正确答案可能与当代指南冲突——部署系统须以当前指南为准,基准分数只反映"题库时代共识"。
  • 检索漂移:HealthSearchQA 采样于 2022 年的搜索热点(含 COVID 相关问题),疫情后消费者关切分布已变。
  • 影像协议漂移:组件跨越胶片扫描(DDSM)、早期数字(MIMIC 2008-2019 段)、当代 FFDM(VinDr-Mammo 2018-2020),设备代际差异显著。
  • 测序平台漂移:precisionFDA V2(2020)的读段平台组合与当代(HiFi/ONT 超长读长普及后)已不同。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) 各组件均为记录级结构(QA JSONL / 影像+CSV / VCF)
2 有唯一标识符列 subject_id/study_id/image_id/question id 等组件级主键完整
3 无 Unicode 或特殊字符 ⚠️ 报告与题干含特殊符号、脱敏占位符与中英混排,需清洗
4 无重复行 ⚠️ 各组件自行质控;基准层无统一去重审计
5 缺失值已识别并编码 ⚠️ 组件级部分记录(MIMIC-CXR -1 不确定编码);无统一规范
6 标签列被明确标识 answer_idx / final_decision / BI-RADS / 14 类标签字段明确
7 已对罕见类别(<3%)进行分组 PAD-UFES-20 小类、MIMIC-CXR 低频标签未做分组处理
8 偏倚评估已完成 原论文局限性章节 + §7.1 八类偏倚梳理
9 有完整的数据字典 ⚠️ 组件各有文档,但无基准级统一数据字典
10 对"信息性缺失"有明确编码解释 ⚠️ 仅部分组件(MIMIC 不确定标签、MedMCQA 无 test 答案)有说明
11 数据采集设备和设置已记录 ⚠️ VinDr-Mammo/CBIS-DDSM/precisionFDA 有记录;教学影像组件无设备元数据
12 已移除完全共线性变量 未执行(QA/影像组件不涉此处理)
13 对编码的映射标准已说明 ⚠️ 报告为自由文本,无统一 ICD/SNOMED 映射;BI-RADS 标准明确
14 对时间戳的处理已明确说明 ⚠️ MIMIC 日期偏移已记录;多数组件不含时间维度
15 训练/验证/测试划分建议已给出 组件官方划分沿用并在 §5.1 明确
16 数据泄漏风险已被讨论 ⚠️ 社区文献反复讨论污染问题;原论文未提供统一防泄漏规范
17 标签分布已被分析 §4.2 按组件列出分布与不平衡
18 选择性测量偏倚已被讨论 ⚠️ 教学库选择偏倚、筛查人群偏倚在组件文献中有讨论,无基准级汇总
19 外部验证建议已给出 §5.5 与 §7.8 提供跨机构/跨语言/时代外路径
20 数据更新和版本信息已记录 ⚠️ 基准无版本号迭代;组件版本需自行锁定
21 最小必要预处理脚本已提供 Google 未开源 Med-PaLM M 预处理与模型代码
22 合规使用要求已明确 组件许可证地图(§3.6)+ 3 个凭证化组件流程明确
23 多模态对齐方法已说明 ⚠️ 组件内图文天然配对;跨任务对齐属模型侧设计,基准未规范
24 去标识化方法已被记录 全部组件去标识化(MIMIC 系列 HIPAA 脱敏 + 日期偏移有完整文档)

DAIMS 评分:15.0 / 24

评分解读中等——组件级成熟度普遍较高,但作为"基准"的统一文档层存在结构性缺口。

对你意味着什么:MultiMedBench 的 9 个 ✅ 项来自其组件的优秀底子(主键完整、标签明确、官方划分、许可证清晰、去标识化文档完备)。扣分集中在"基准集合体"的天然短板:Google 未发布统一数据字典、统一预处理脚本与版本化发布(第 9、20、21 项),罕见类别未分组(第 7 项),以及信息性缺失与编码映射缺乏基准级规范(第 5、10、13 项)。建议在使用前执行以下操作:(1) 用本百科 §3.6 许可证地图逐组件核对合规路径,优先完成 PhysioNet 凭证化;(2) 用 §5.1 划分口径表逐组件锁定 split 并写入方法学;(3) 对 PAD-UFES-20 等长尾组件自行合并 <3% 的罕见类别或改用分层采样;(4) 建立污染审计流程(§6.5 坑点 5)后再解读任何 LLM 的 QA 分数。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
IND1(独立外部胸片集) Med-Gemini 多模态论文外部机构队列 CXR 报告生成(专家评估) 正常 96% / 异常 65% 报告被评"等于或优于"放射科医生 相对 MIMIC-CXR(57%/43%)显著上升 跨机构外部验证显示报告生成具备迁移潜力,且正常例识别更稳(Yang et al. 2024)
NEJM Image Challenge NEJM 临床病理讨论影像题 多模态诊断多选 Med-Gemini 超越 GPT-4V(多模态基准平均相对 +44.5%) 不适用(基准外新任务) MultiMedBench 训练/评测能力可迁移至基准外真实难题(Saab et al. 2024)
MedBullets / MedXpertQA(时代外新题) 各第三方 USMLE 风格 QA 通用 LLM 分数较 MedQA 下降 5-15 个点 显著下降 公开测试集污染红利的直接证据,支持"时代外复核"流程
CMB / CMExam(中文) 中国高校/医院 中文医学 QA 英文医学 LLM 普遍下降 10+ 个点 显著下降 英语中心偏倚的量化证据;中文部署必须本地基准复核
GIAB HG003/HG004(样本外) NIST 变异检测 DeepVariant 级方法 SNV F1 仍 >0.98 轻微下降 参考家系内迁移稳健;跨祖源与难区域才是主要失效面
CheXpert Plus(跨机构) Stanford CXR 报告/分类 相对 MIMIC-CXR 内部结果下降 中等下降 机构间报告风格与人群差异是放射任务的主要漂移源

MultiMedBench 在 2026 年还值得用吗? 值得,但用法已分化:作为历史坐标系(复现 Med-PaLM M/Med-Gemini 里程碑、与三年文献可比)它无可替代;作为当代唯一评测台它已不够——测试集污染、缺乏 2023 年后新模态(3D CT、全切片 WSI、EHR 长文本——后者由 Med-Gemini 系列的 14 基准扩展覆盖)要求你把它当作"主考场之一"而非"唯一考场",并与时代外新基准(MedBullets、MedXpertQA、GMAI-MMBench 等)组成评估矩阵。


§8 基准性能与生态

§8.1 排行榜

MultiMedBench 没有一个持续刷榜的官方排行榜——它的"榜"记录在 Med-PaLM 谱系的里程碑论文里。本节分两条线呈现:MedQA 分数演进线(医疗 LLM 能力温度计,数值口径为 MedQA 英文 4 选项 test 1,273 题)与 MultiMedBench 联考线(Med-PaLM M 的 14 任务综合成绩)。

MedQA 演进线(同一测试集,口径可比——但注意 2023 年后普遍存在预训练污染红利,见 §6.5 坑点 5)

排名 模型 MedQA 准确率 年份 关键技术 完整引用 代码
1 Med-Gemini(不确定性引导搜索) 91.1% 2024 Gemini 1.5 + 自训练 + 不确定时触发网络搜索 Saab K, Tu T, Weng W-H, et al. “Capabilities of Gemini Models in Medicine.” arXiv:2404.18416 (2024) 未开源
2 Med-PaLM 2 86.5% 2023 PaLM 2 医学指令微调 + 集成推理(ensemble refinement) Singhal K, Tu T, Gottweis J, et al. “Toward expert-level medical question answering with large language models.” Nature Medicine 31:943-950 (2025);arXiv:2305.09617 (2023) 未开源
3 GPT-4 系 约 80-90%(口径随提示策略差异大) 2023 通用大模型 + few-shot/CoT Nori H, et al. “Capabilities of GPT-4 on Medical Challenge Problems.” arXiv:2303.13375 (2023);各报告口径不一,勿与上行直接相减
4 Flan-PaLM 540B(CoT + 自洽性) 67.6% 2022 few-shot + 思维链 + self-consistency,超此前 SOTA 17 个百分点 Singhal K, Azizi S, Tu T, et al. “Large language models encode clinical knowledge.” Nature 620:172-180 (2023). DOI: 10.1038/s41586-023-06291-2 未开源
5 PubMedGPT 2.7B(前 LLM 时代 SOTA) 约 50% 2022 生物医学语料从头预训练 作为前 SOTA 引自 Singhal et al. 2023 的比较表

注:Med-PaLM 2 论文同口径还报告了 PubMedQA 81.8%、MedMCQA 72.3%(官方 test 口径);Flan-PaLM 的 MedMCQA/PubMedQA 分数亦为当时 SOTA(分别超越 Galactica 与 BioGPT)。

MultiMedBench 联考线(Med-PaLM M,14 任务综合,Tu et al. NEJM AI 2024)

模型 联考成绩 年份 关键技术 完整引用
Med-PaLM M 562B 全部 14 项任务接近或超越当时专科 SOTA;CXR 报告生成超此前 SOTA >8%(micro-F1 临床效力);SLAKE 超 >10%(BLEU-1/F1);246 张回顾性胸片双盲对比中临床医生最高 40.50% 偏好其报告 2023-2024 单一权重多任务联合微调(PaLM-E 架构 + ViT 视觉编码),全部任务统一为开放式生成 Tu T, Azizi S, Driess D, et al. “Towards Generalist Biomedical AI.” NEJM AI 1(3) (2024). DOI: 10.1056/AIoa2300138
PaLM-E 84B(通用对照) 多项任务显著落后于 Med-PaLM M 2023 无医学领域微调的通用多模态基座 同上(论文内对照)
Med-Gemini 多模态版 CXR 报告:MIMIC-CXR 正常 57% / 异常 43% 被评"等于或优于"放射科医生;外部 IND1 队列 96% / 65% 2024 Gemini 1.5 + 2D/3D/基因组定制编码器 Yang L, et al. “Advancing Multimodal Medical Capabilities of Gemini.” arXiv:2405.03162 (2024)

数值可比性警示:MedQA 各年度数字虽在同一测试集上,但训练语料污染程度随年份递增,跨年比较测的更多是"语料记忆 + 推理"的混合能力;MultiMedBench 各任务的专科 SOTA 基线来自不同论文的不同预处理,绝对差值(如 +8%)以原论文对照表为准。

§8.2 SOTA 总结与选型建议

如果你… 推荐方案 为什么
评测医疗 LLM 选择题能力 MedQA + MedMCQA(dev) + PubMedQA 三件套,报 accuracy 与五年文献直接可比的最小组合
评测消费者端回答质量 HealthSearchQA + 多轴人工评估框架 唯一真实搜索问题集;自动指标无法替代人工
复现 Med-PaLM M 联考 全 14 任务 + 开放式生成统一接口 + 多任务联合微调 论文原生协议
快速出多模态基线 LLaVA-Med / Med-Flamingo 在 VQA 三组件上微调 开源、单卡可复现
报告生成专项 MIMIC-CXR + CheXbert/RadGraph 指标 + 官方 split 社区口径最成熟
基因组任务 DeepVariant 官方链路与 GIAB 高置信集 计量学级金标准,避开 pileup 自建坑

§8.3 官方评测协议

MultiMedBench 无独立官方评测服务器,其协议即 Tu et al.(NEJM AI 2024)论文协议:全部任务统一为开放式生成;QA 按选项字母 exact match;VQA 封闭题报 accuracy、开放题报 BLEU-1/F1;报告生成报临床效力指标(micro/macro-F1,CheXbert 式 14 类标签抽取)+ BLEU/ROUGE;影像分类报 macro-F1 等分类指标(以生成文本匹配类别名);基因组按 precisionFDA 挑战口径报 SNV/Indel F1。MultiMedQA 侧另有 Singhal et al. 的多轴人工评估框架(科学共识、理解、推理、完整性、潜在伤害、偏倚),用于长文本答案。

数据集/基准 关系 说明
MultiMedQA 姊妹基准(语言线) Singhal et al. Nature 2023;7 个 QA 数据集,3 个被 MultiMedBench 收录
HealthSearchQA MultiMedQA 内的新建组件 3,173 条消费者搜索问题,人工评估框架配套
MedQA / MedMCQA / PubMedQA 组件(QA 三件套) 各自独立成数据集,可单独使用
MIMIC-CXR / MIMIC-III 组件(放射线) 千方另有专条百科
Med-Gemini 14 基准 后继扩展 在 MultiMedBench 基础上扩展 EHR 长文本、医疗视频、NEJM 影像挑战等
GMAI-MMBench 同类更大基准 284 任务,中国主导,不含基因组
BenchMD 同类 19 任务影像/传感器基准
MedBullets / MedXpertQA 时代外补充 抗污染新题集
GIAB / precisionFDA 系列挑战 组件上游 基因组任务的计量学来源

§8.5 关键论文 Top 10

  1. Tu T, Azizi S, Driess D, et al. (2024), NEJM AI 1(3). “Towards Generalist Biomedical AI.” — MultiMedBench 的诞生论文,Med-PaLM M 单一权重联考 14 任务。DOI: 10.1056/AIoa2300138
  2. Singhal K, Azizi S, Tu T, et al. (2023), Nature 620:172-180. “Large language models encode clinical knowledge.” — MultiMedQA 与 HealthSearchQA 的诞生论文,医疗 LLM 评测范式奠基作,引用 5,488+(截至 2026-09)。DOI: 10.1038/s41586-023-06291-2
  3. Singhal K, Tu T, Gottweis J, et al. (2025), Nature Medicine 31:943-950. “Toward expert-level medical question answering with large language models.” — Med-PaLM 2,MedQA 86.5%。DOI: 10.1038/s41591-024-03423-7
  4. Saab K, Tu T, Weng W-H, et al. (2024). “Capabilities of Gemini Models in Medicine.” — Med-Gemini,MedQA 91.1%,14 基准 10 项 SOTA。arXiv:2404.18416
  5. Yang L, et al. (2024). “Advancing Multimodal Medical Capabilities of Gemini.” — Med-Gemini 多模态版,CXR 报告跨机构专家评估。arXiv:2405.03162
  6. Jin D, Pan E, Oufattole N, et al. (2021), Applied Sciences 11(14):6421. “What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams.” — MedQA 原始论文。
  7. Pal A, Umapathi LK, Sankarasubbu M (2022), PMLR 174. “MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering.” — MedMCQA 原始论文。
  8. Jin Q, Dhingra B, Liu Z, Cohen W, Lu X (2019), EMNLP-IJCNLP. “PubMedQA: A Dataset for Biomedical Research Question Answering.” — PubMedQA 原始论文。
  9. Johnson AEW, Pollard TJ, Berkowitz SJ, et al. (2019), Scientific Data 6:317. “MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports.” — 放射线组件之源。DOI: 10.1038/s41597-019-0322-0
  10. Poplin R, Chang PC, Alexander D, et al. (2018), Nature Biotechnology 36:983-987. “A universal SNP and small-indel variant caller using deep neural networks.” — DeepVariant,基因组任务范式之源。

§8.6 社区活跃度

维度 数据
MultiMedQA 论文引用(Singhal et al. 2023) 5,488+(Google Scholar,截至 2026-09)
MultiMedBench 论文引用(Tu et al. 2024) 317+(Crossref/OUCI,截至 2026-09;Google Scholar 合并 arXiv 版本更高)
Med-PaLM 2 论文引用 2,000+ 量级(Google Scholar,截至 2026-09,arXiv 合并口径)
Med-Gemini 论文引用 1,000+ 量级(Google Scholar,截至 2026-09,arXiv 合并口径)
MedQA 组件引用(Jin et al. 2021) 1,000+(Google Scholar,截至 2026-09)
HealthSearchQA 下载 HF 镜像月度下载持续活跃(katielink/healthsearchqa)
教学采用 医疗 AI 课程普遍以 MultiMedQA/MedQA 作为 LLM 评测入门案例

§8.7 生态快照

资源 类型 链接 热度(截至 2026-09,约) 为什么值得关注
bigbio(HuggingFace) 统一加载器 huggingface.co/bigbio 覆盖 MultiMedQA 全组件 字段标准化的 MultiMedQA 一站式加载入口
google/deepvariant 工具库 github.com/google/deepvariant 3,000+ Star 基因组任务(pileup → 变异检测)官方链路
TorchXRayVision 工具库 github.com/mlmed/torchxrayvision 1,000+ Star MIMIC-CXR 加载与预训练 DenseNet
LLaVA-Med 预训练模型 github.com/microsoft/LLaVA-Med 活跃 医学 VQA 三组件的开源强基线
katielink/healthsearchqa 数据镜像 huggingface.co/datasets/katielink/healthsearchqa 持续下载 HealthSearchQA 最便捷的获取镜像(含 140 题评估子集配置)
medmcqa.github.io 官方站 medmcqa.github.io MedMCQA 下载与排行榜
PhysioNet 数据平台 physionet.org 30,000+ 认证用户 MIMIC-III / MIMIC-CXR / VinDr-Mammo 三组件的凭证化入口
GMAI-MMBench 排行榜/基准 github.com/uni-medical/GMAI-MMBench 活跃 MultiMedBench 之后更大规模的联考基准

§9 相关资源与引用

官方资源

BibTeX 引用

% 1) MultiMedBench 诞生论文(使用 MultiMedBench 必引)
@article{tu2024generalist,
  title={Towards Generalist Biomedical AI},
  author={Tu, Tao and Azizi, Shekoofeh and Driess, Danny and Schaekermann, Mike and Amin, Mohamed and Chang, Pi-Chuan and Carroll, Andrew and Lau, Charles and Tanno, Ryutaro and Ktena, Ira and others},
  journal={NEJM AI},
  volume={1},
  number={3},
  year={2024},
  doi={10.1056/AIoa2300138}
}

% 2) MultiMedQA / HealthSearchQA 诞生论文(使用 QA 组件或 HealthSearchQA 必引)
@article{singhal2023large,
  title={Large language models encode clinical knowledge},
  author={Singhal, Karan and Azizi, Shekoofeh and Tu, Tao and Mahdavi, S Sara and Wei, Jason and Chung, Hyung Won and Scales, Nathan and Tanwani, Ajay and Cole-Lewis, Heather and Pfohl, Stephen and others},
  journal={Nature},
  volume={620},
  number={7972},
  pages={172--180},
  year={2023},
  doi={10.1038/s41586-023-06291-2}
}

% 3) Med-PaLM 2(引用 MedQA 86.5% 等里程碑数字时)
@article{singhal2025toward,
  title={Toward expert-level medical question answering with large language models},
  author={Singhal, Karan and Tu, Tao and Gottweis, Juraj and Sayres, Rory and Wulczyn, Ellery and Amin, Mohamed and others},
  journal={Nature Medicine},
  volume={31},
  pages={943--950},
  year={2025},
  doi={10.1038/s41591-024-03423-7}
}

% 4) Med-Gemini(引用 MedQA 91.1% 等数字时)
@article{saab2024capabilities,
  title={Capabilities of Gemini Models in Medicine},
  author={Saab, Khaled and Tu, Tao and Weng, Wei-Hung and Tanno, Ryutaro and Stutz, David and Wulczyn, Ellery and others},
  journal={arXiv preprint arXiv:2404.18416},
  year={2024}
}

% 5) 组件原始论文示例:MedQA
@article{jin2021disease,
  title={What disease does this patient have? A large-scale open domain question answering dataset from medical exams},
  author={Jin, Di and Pan, Eileen and Oufattole, Nassim and Weng, Wei-Hung and Fang, Hanyi and Szolovits, Peter},
  journal={Applied Sciences},
  volume={11},
  number={14},
  pages={6421},
  year={2021}
}

引用纪律:使用任何组件数据集,除引用上述基准论文外,还必须引用该组件的原始论文(如用 MIMIC-CXR 引 Johnson et al. 2019,用 PubMedQA 引 Jin et al. 2019)——这是各组件许可的共同要求,也是审稿人必查项。

教程与学习资源

  • bigbio 加载示例(HuggingFace datasets 文档 + bigbio 各组件 dataset card)
  • Med-PaLM / Med-Gemini 官方博客解读(Google Research Blog,含评测框架通俗讲解)
  • LLaVA-Med / Med-Flamingo 仓库的 VQA 评测脚本(VQA-RAD/SLAKE/PathVQA 开源评测起点)
  • DeepVariant 官方 case study(基因组 pileup 全流程)
  • PhysioNet MIMIC 系列官方教程(凭证化申请与 BigQuery 使用)

原始论文

  1. Tu T et al. (2024). “Towards Generalist Biomedical AI.” NEJM AI 1(3). DOI: 10.1056/AIoa2300138.
  2. Singhal K et al. (2023). “Large language models encode clinical knowledge.” Nature 620:172-180. DOI: 10.1038/s41586-023-06291-2. PMID: 37438534.
  3. Singhal K et al. (2025). “Toward expert-level medical question answering with large language models.” Nature Medicine 31:943-950. DOI: 10.1038/s41591-024-03423-7.
  4. Saab K et al. (2024). “Capabilities of Gemini Models in Medicine.” arXiv:2404.18416.
  5. Yang L et al. (2024). “Advancing Multimodal Medical Capabilities of Gemini.” arXiv:2405.03162.

§10 AI 使用声明卡

§10.1 AI 模型使用

AI 模型 版本 用途
deep-model(WorkBuddy) 2026-09 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建
WebSearch(多源检索) 2026-09-05 6 组检索 + 1 组全文抓取:NEJM AI/Nature 论文信息、MultiMedBench Table 1 任务清单、引用数快照、许可证与组件规模交叉验证

§10.2 AI 参与范围

AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。

AI 在本页面的工作中负责:(1) 从 NEJM AI 2024 论文(arXiv:2307.14334 全文)、Nature 2023 论文、Google Research 官方页面与组件原始文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。

§10.3 输入来源

  1. Tu T et al. (2024), “Towards Generalist Biomedical AI”, NEJM AI 1(3) — MultiMedBench 原始论文(DOI: 10.1056/AIoa2300138;arXiv:2307.14334 全文抓取,Table 1 任务清单与 Data Availability 声明)
  2. Singhal K et al. (2023), “Large language models encode clinical knowledge”, Nature 620:172-180(DOI: 10.1038/s41586-023-06291-2;MultiMedQA 构成、HealthSearchQA 3,173 题、Flan-PaLM 67.6%)
  3. Singhal K et al. (2025), “Toward expert-level medical question answering with large language models”, Nature Medicine 31:943-950(DOI: 10.1038/s41591-024-03423-7)
  4. Saab K et al. (2024), “Capabilities of Gemini Models in Medicine”(arXiv:2404.18416;MedQA 91.1%、7.4% 题目质量分析)
  5. Yang L et al. (2024), “Advancing Multimodal Medical Capabilities of Gemini”(arXiv:2405.03162;MIMIC-CXR/IND1 报告评估数字)
  6. Google Research 官方页面(research.google/pubs/towards-generalist-biomedical-ai)与 Med-Gemini 博客
  7. ORCID 0000-0001-9191-7938(Tao Tu 发表记录,期刊版本与日期复核)
  8. OUCI(ouci.dntb.gov.ua,Tu et al. NEJM AI 2024 引用 317 快照)
  9. Google Scholar 快照(Singhal et al. 2023 cited by 5,488,2026-09-05 检索)
  10. MRAG-Bench 论文(arXiv:2601.16503;MedQA/MedMCQA/PubMedQA 许可证与 split 口径复核)
  11. Uni-Med 论文(arXiv:2409.17508;PathVQA/SLAKE 组件规模与许可证表复核)
  12. HuggingFace katielink/healthsearchqa 与 aisc-team-d1/healthsearchqa 数据集卡片(HealthSearchQA 文件格式与 140 题子集)
  13. openmedlab/Awesome-Medical-Dataset HealthSearchQA 条目(MultiMedQA Extended Data Table 1 规模复核)
  14. Jin D et al. (2021) MedQA;Pal A et al. (2022) MedMCQA;Jin Q et al. (2019) PubMedQA;Johnson AEW et al. (2019) MIMIC-CXR(组件原始文献)
  15. 千方病案医数集 Schema v3.9 模板与 MIMIC-III 金标准范文(结构与格式基准)

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§2 医学背景(ICD-11/SNOMED 映射、任务临床定义、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(14 任务清单、许可证地图) 千方病案医学编辑部 与 Tu et al. Table 1 及组件原始页面交叉比对 ✅ 已验证
§4 数据结构(QA 字段、MIMIC-CXR 字段) 千方病案医学编辑部 与组件官方文档交叉比对 ✅ 已验证
§5 数据划分策略 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与坑点 千方病案医学编辑部 逻辑审查 + 与组件官方文档比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数表述 千方病案医学编辑部 与原文及 Scholar/Crossref 快照交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集