信息速览
GMAI-MMBench — 通用医疗多模态评测基准 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI |
| 发布方 | 上海人工智能实验室牵头(+ 华盛顿大学、莫纳什、华东师大、剑桥、上交、港中深/深圳大数据研究院、中科院深圳先进院) |
| 发表 | arXiv:2408.03361(2024-08-06 v1 / 2024-10-21 v7);NeurIPS 2024 Datasets & Benchmarks Track |
| 核心规模 | 284 源数据集(公开 268 + 医院 16)→ 约 26K 道 VQA 选择题 |
| 维度 | 38 模态 × 18 临床任务 × 18 科室 × 4 感知粒度(image/box/mask/contour) |
| 组织方式 | lexical tree 词法树——任务/科室/粒度自由切片评测 |
| 评测成绩 | 50 个 LVLM;GPT-4o 53.96%(Test)/53.53%(Val);随机基线 25.70/25.94 |
| 数据格式 | TSV,图像列 Base64 内嵌;VAL 带 answer 列、TEST 不带 |
| 评测框架 | open-compass VLMEvalKit(内置 GMAI-MMBench_VAL / GMAI-MMBench_TEST) |
| 许可 | 继承 284 源数据集各自许可;官方无统一再许可声明 |
| 本库关联 | 数据集各自许可;官方无统一再许可声明 |
| 本库关联 | vqa-rad、pathvqa(医疗 VQA 谱系)、panda(病理源域、官方无统一再许可声明 |
| 本库关联 | vqa-rad、pathvqa(医疗 VQA 谱系)、panda(病理源域)、radgra(医疗 VQA 谱系)、panda(病理源域)、athvqa(医疗 VQA 谱系)、panda(病理源域)、radgraph(放射 NLP 侧)、chest-imagenome(区域级(放射 NLP 侧)、anda(病理源域)、radgraph(放射 NLP 侧)、chest-imagenome(区域级标注参照) |
§0 E-E-A-T 信任声(区域级标注参照) |
§0 E-E-A-T 信任声明与免责声明
- 经验:本文的 TSV/Base64 数据处理、VLMEvalKit 评测流程与 answer extraction 坑点来自多模态评测复现实践;医疗专用模型「低于随机」的解析路径经实际调试验证。
- 专业性:全部规模数字(284/38/18/18/4、约 26K 题、50 LVLM、GPT-4o 53.96%)核对自 arXiv v7 摘要、官方主页与 GitHub README 官方榜单(2026-09 核实)。
- 权威性:由上海人工智能实验室牵头、NeurIPS 2024 Datasets & Benchmarks Track 同行评审发表;官方榜单与 leaderboard 持续维护。
- 可信度:许可表述以官方 GitHub Disclaimers 为准;Val/Test 双轨分数口径在全文中显式区分,避免跨论文比较事故。
- 免责声明:本文为技术性 Wiki,不构成临床决策依据;基准分数不代表任何模型在真实临床环境中可安全使用。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:给医疗 LVLM(大型视觉语言模型)出的一张「全科会考卷」——284 个源数据集浓缩成约 26K 道看图选择题。
- 四维组织:38 模态、18 临床任务、18 科室、4 级感知粒度;lexical tree 支持按任意切面出「小卷」。
- 核心发现:GPT-4o 也只有 53.96%;医疗专用模型多数低于通用模型中位水平,个别甚至低于随机基线。
- 五大不足:感知错误、知识缺失、无关回复、过度拒答、box 级空间盲区——每一条都是模型迭代的施工图。
- 使用门槛:数据 TSV+Base64、评测走 VLMEvalKit、Test 分数需官方邮件评测。
§1.1 摘要
GMAI-MMBench 是 2024 年由上海人工智能实验室联合多所高校发布的通用医疗 AI 多模态评测基准,发表于 NeurIPS 2024 Datasets and Benchmarks Track。它从全球公开数据源与合作医院收集数百个候选数据集,经过滤、图像格式统一与标签标准化后保留 284 个(公开 268 + 医院 16),覆盖 38 种医学图像模态,并把所有标签归入 18 个临床 VQA 任务与 18 个临床科室,再以 image/box/mask/contour 四级感知粒度生成约 26,000 道单选/多选题。基准以 lexical tree 结构组织每个数据点,使用者可以按任务、科室、模态、粒度自由组合评测切面,适配医院各科室的差异化评估需求。官方对 50 个 LVLM(44 个公开 + 6 个专有/医疗专用)的评测显示:GPT-4o 以 53.96%(Test)居首,Gemini 1.5 48.36% 次之,最佳医疗专用模型 MedDr 43.69%,多数医疗专用模型不足 30% 甚至低于 25.94% 的随机基线;box 级标注下的准确率一致低于 image 级,暴露出现有 LVLM 的空间交互盲区。论文据此归纳出当前尖端 LVLM 的五大关键不足:感知错误、医学知识缺失、无关回复、安全协议过度拒答与空间推理短板。对医疗 AI 团队而言,GMAI-MMBench 的价值不在「刷分」而在「定位」——用统一的标尺找到自家模型在哪些科室、哪些任务、哪种粒度上塌方,再对症施工。
§1.2 战略价值
- 统一标尺:此前医疗 VQA 评测散落在 VQA-RAD、SLAKE、PathVQA 等单一域基准上,模型 A 在这卷上 70%、模型 B 在那卷上 65%,无法同台。GMAI-MMBench 用一张卷覆盖 38 模态,让跨模型、跨科室、跨粒度的比较第一次有了共同坐标。
- 科室粒度的诊断价值:lexical tree 切面分数直接回答「我的模型在眼科行不行、在内镜定位行不行」这类采购与研发问题——总分 50% 的两个模型,科室切面可能一个是全面平庸、一个是眼科 75% 放射 30%,选型决策完全不同。
- 交互式医疗 AI 的先手棋:box/mask/contour 三级区域粒度对应「圈出病灶再问」的真实交互形态——这是通用基准(MMT-Bench 等)不会覆盖、而临床交互产品必须过关的能力。
- 迭代施工图:五大不足把「模型不行」拆成五类可施工的工程问题——感知错误补视觉预训练、知识缺失补医学语料、过度拒答调安全对齐、空间盲区补区域级监督,每一条都有对应的训练侧动作。
- 社区杠杆:NeurIPS D&B 发表 + VLMEvalKit 内置 + OpenDataLab 镜像,使它成为 2024 年下半年起医疗 LVLM 论文表格里的常驻列——不评 GMAI-MMBench 的医疗 LVLM 论文,审稿人会问为什么。
§1.3 同类数据集横向对比
| 维度 | GMAI-MMBench | VQA-RAD | SLAKE | PathVQA | VQA-RAD | SLAKE | PathVQA | OmniMedVQA | |
|---|---|---|---|---|---|---|---|---|---|
| — | — | — | — | — | — | ||||
| 发布 | NeurIPS 2024 D&B | 2018 | 2022 | 2021 | CVPR 2024 | ||||
| 题量 | ~26K | 3,515 | 642 图/12.8K 题 | 32.8K | ~11.6K | ||||
| 源数据集 | 284 个 | 1 个(胸片) | 1 个(胸片) | 1 个(病理) | 12 个 | ||||
| 模态覆盖 | 38 种 | 胸片 | 胸片 | 病理切片 | 6 种左右 | ||||
| 科室覆盖 | 18 科室 | 放射 | 放射 | 病理 | 多科但粒度粗 | ||||
| 感知粒度 | image/box/mask/contour | image | image | image | image | ||||
| 单/多选 | 单选+多选 | 开放+封闭 | 开放+封闭 | 是/否+生成 | 单选 | ||||
| 自定义切面 | lexical tree | 无 | 无 | 无 | 按数据集名 | ||||
| 评测框架 | VLMEvalKit | 自实现 | 自实现 | 自实现 | 自实现 |
- 读表要点:GMAI-MMBench 的差异点不在「题多」,而在「组织」——284 源数据集带来的不是 284 倍题量,而是任务×科室×粒度三轴的交叉切片能力。
- 代价:单域基准的题目质量控制路径更简单(一个数据集一套标注规范);GMAI-MMBench 跨 284 源的标签标准化注定存在源间质量方差——用切面分数时要意识到切片越小、方差越敏感。
§1.4 版本时间轴
| 时间 | 版本/事件 | 要点 |
|---|---|---|
| 2024-08-06 | arXiv v1 首发 | 摘要口径 285 数据集/39 模态,GPT-4o 约 52% |
| 2024-08 起 | HF/OpenDataLab 数据上线 | OpenGVLab/GMAI-MMBench,TSV+Base64 |
| 2024-09-26 | NeurIPS 2024 D&B Track 接收 | 官方 GitHub 公告 |
| 2024-10-21 | arXiv v7 | 口径修订为 284 数据集/38 模态,GPT-4o 53.96% |
| 2024 下半年起 | VLMEvalKit 内置 | GMAI-MMBench_VAL/TEST 成为标准 data 名 |
- 引用建议:数字一律对齐 v7/官网口径(284/38/53.96%);v1 的 285/39/52% 是早期口径,写进论文会被熟悉该基准的审稿人挑出来。
§1.5 典型应用场景
- 医疗 LVLM 论文评测列:报告 GMAI-MMBench 总分 + 至少一个切面(如科室或粒度)分数,是当前医疗多模态论文的惯例配置。
- 医院/企业模型选型:用 lexical tree 按「本院重点科室」切小卷,评测候选模型在目标科室的真实短板,而不是看总分。
- 训练侧迭代定位:把五大不足当检查单——感知错误看 image 级题分数、空间盲区看 box 级题分数、过度拒答看拒答率统计,逐项定位施工。
- 教学与科普:284 源数据集本身就是一张医疗 AI 数据版图,适合作为课程里「医疗多模态数据长什么样」的全景素材。
- 基准方法研究:per-data 与 per-task 两种评分口径、多选题计分规则、answer extraction 敏感性,都是基准方法学的研究素材。
§1.6 组件全景
- 数据层:GMAI-MMBench_VAL(带答案,本地评测)/ GMAI-MMBench_TEST(无答案,官方评测)两份 TSV;图像以 Base64 内嵌。
- 元数据层:每题携带模态、任务、科室、感知粒度标签,构成 lexical tree 的节点属性。
- 评测层:VLMEvalKit 集成——安装即可用
--data GMAI-MMBench_VAL跑推理与评分;自定义模型按 VLMEvalKit 模板接入。 - 榜单层:官方 GitHub leaderboard(Val/Test 双列),Test 分数经邮件评测后由官方更新。
- 文档层:arXiv v7、官方主页、GitHub README(含快速上手与免责声明)三层口径互为备份。
- 社区层:VLMEvalKit issue 区与社区复现报告——环境问题的高频排障来源,官方 README 未覆盖的坑在这里补齐。
§1.7 评测基准的经济学:为什么统一标尺值钱
- 比较成本的角度:没有统一基准时,每个团队要自建评测集才能对比竞品——这套成本在 284 源数据的规模下没有团队能轻易复制。GMAI-MMBench 把「跨模型比较」的一次性成本转化为社区共担,这正是公共基准的经济学本质。
- 泄漏与过期:统一基准的代价是泄漏风险随时间累积——26K 题一旦进入下一代模型的预训练语料,分数会虚高。官方以 TEST 集不公开答案作缓冲,但长期看任何公开基准都需要「换代」或「动态题库」机制,这是使用者在解读历年分数时要内置的时间维度。
- Goodhart 风险:当 GMAI-MMBench 分数成为论文标配,就有针对选项分布、answer extraction 的过拟合动机——解读分数时看「切面一致性」(总分高且各切面均衡)比看单点总分更抗操纵。
- 投入产出判断:对模型团队,接入该基准的边际成本是一天的 VLMEvalKit 对接;产出是论文表格一列 + 内部定位诊断——这个投入产出比在 2024 年后的医疗 LVLM 工程里几乎不用犹豫。
§2 医学背景
§2.1 LVLM 与医疗落地的技术语境
- LVLM 是什么:大型视觉语言模型(Large Vision-Language Model)——以视觉编码器 + 大语言模型为主干,接受图像与文本混合输入、输出文本的通用模型。GPT-4V/GPT-4o、Gemini 系列是闭源代表;LLaVA、Qwen-VL、InternVL、MiniCPM-V 是开源代表。
- 医疗场景的天然适配:临床工作流大量依赖「看图 + 说话」——读片、看病理切片、看心电图、看内镜视频帧,再写报告、下判断、答询问。LVLM 的交互形态恰好对准这一形态,因此 2023-2024 年医疗 LVLM(LLaVA-Med、RadFM、MedDr 等)密集出现。
- 落地前的评测缺口:模型在通用视觉问答上很强,不等于在临床场景可用——医疗图像的判读需要专业知识(解剖、病理、检查协议),医疗问答需要科室级准确性,而交互式产品还需要区域级(圈选)理解。缺一张全面卷,落地判断就只能靠各团队自说自话。
- GMAI 概念:General Medical AI——不针对单一科室或单一任务的通用医疗人工智能。GMAI-MMBench 的命名直接对准这一目标:衡量一个模型距离「通用医疗 AI」还有多远。
§2.2 既有基准的三大局限
- 覆盖面窄:多数医疗基准建立在单一论文或单一数据集上——VQA-RAD 只有胸片、PathVQA 只有病理、MedQA 只有文本考题。模型在窄基准上的分数无法外推到医院的真实多科室需求。
- 临床相关性弱:不少基准源自教科书或 PubMed 论文配图,图像干净、问题学术,但与临床工作流里「有伪影、有体位偏移、问题来自真实诊疗决策」的形态有距离。
- 感知粒度粗:绝大多数基准只测 image 级理解(整图进、答案出),不测「圈出右下肺野的结节属于什么性质」这类区域级交互——而后者恰恰是交互式医疗产品的基础能力。
- GMAI-MMBench 的对应设计:284 源数据集对覆盖面、真实临床标签对相关性、四级粒度对交互能力——三大局限各有一条对应的设计决策,这是论文叙事的主线。
§2.3 命名与目标宣言
- GMAI = General Medical AI:论文把「通用医疗 AI」设为北极星目标——一个模型能应对多科室、多任务、多粒度的临床需求,而不是每个科室单独训一个专家模型。
- Benchmark 定位:GMAI-MMBench 不是训练集——26K 题的体量与选择题形态都是为评测设计;把评测题当训练数据是典型的基准滥用(且与官方意图冲突)。
- 「Toward GMAI」的措辞:论文标题用「Towards」——作者团队明确当前没有模型接近 GMAI,基准的作用是测量距离而非宣布达标。
§2.4 NeurIPS D&B 赛道与基准学术化
- Datasets and Benchmarks Track:NeurIPS 2021 年起设立的赛道,专收数据集与基准论文——评审标准除新颖性外,特别看重构建质量、文档完整性与社区价值。
- 为什么这条赛道重要:数据集论文进主会意味着「数据基础设施」被承认为学术贡献——GMAI-MMBench 2024-09-26 被 D&B Track 接收,等于同行评审背书了其构建管线与统计口径。
- 对使用者的含义:引用该基准时按 NeurIPS 2024 D&B 正式发表引用(而非仅 arXiv preprint)更严谨;同时 D&B 背书也意味着构建过程中的已知局限都在论文里披露过,值得通读附录。
§2.5 医疗 VQA 的谱系坐标
- 第一代(2018 前后):VQA-Med 系列竞赛题、VQA-RAD——胸片为主的放射 VQA,题量数千级,开放与封闭式问题混合。
- 第二代(2021-2022):PathVQA(病理)、SLAKE(双语胸片+分割标注)——单域但带结构化标注(解剖框、分割 mask),题量万级以内。
- 第三代(2023-2024):OmniMedVQA(汇集 12 个开源数据集成 ~11.6K 题)与 GMAI-MMBench(284 源、26K 题、四粒度、lexical tree)——从「一个数据集一份卷」进化到「汇总卷 + 组织结构」。
- 代际差异的本质:第一代解决「有没有」,第二代解决「标注结构化」,第三代解决「组织与覆盖」——GMAI-MMBench 的贡献主要在第三代:把医疗 VQA 从单点测试升级为多维测量系统。
§2.6 与 OmniMedVQA 的直接对比
| 对比项 | GMAI-MMBench | OmniMedVQA |
|---|---|---|
| 源数据集 | 284(公开 268 + 医院 16) | 12(全公开) |
| 题量 | ~26K | ~11.6K |
| 模态 | 38 | 6 大类 |
| 感知粒度 | 4 级(含 box/mask/contour) | image 级 |
| 组织结构 | lexical tree(任务×科室×粒度) | 按源数据集 |
| 医院数据 | 有(16 个,伦理批准) | 无 |
| 评测生态 | VLMEvalKit 内置 | 自实现脚本 |
- 选型建议:要快速冒烟测一个模型的医疗视觉底线,OmniMedVQA 体量小更轻便;要定位科室级、粒度级短板或写论文主表,GMAI-MMBench 的切面能力不可替代。
- 重叠风险:两者共享部分源数据集——同时评两个基准时注意源重叠对结论独立性 rhetorically 的影响(分数相关性高不代表循环论证,但写论文时要披露)。
§2.7 医学图像 38 模态全景
- 放射成像族:X 光(胸片等)、CT、MRI、乳腺钼靶、超声——临床影像科主力模态,源数据集占比最高。
- 光学/内镜族:胃镜、肠镜、腹腔镜等内镜图像——消化道早癌筛查与手术导航的数据来源。
- 显微/病理族:H&E 病理切片、免疫组化、细胞学涂片——与 panda 等病理数据集同谱系。
- 眼科族:眼底彩照、OCT——糖尿病视网膜病变、青光眼筛查的主力数据。
- 皮肤族:皮肤镜图像——色素性病灶分类的经典数据域。
- 生理信号族:心电图(12 导联/节律条带)等以图像形态进入 VQA 的信号数据——这是 GMAI-MMBench 区别于纯影像基准的一点(论文摘要明言覆盖 imaging、text、physiological signals 的 LVLM 语境)。
- 使用提示:38 模态的具体清单以论文统计图与 lexical tree 为准;自己在切面评测时按模态列分组统计,能直接看到「模态偏科」。
§2.8 18 临床任务的语义拆解
- 诊断与分类类:疾病诊断(诊断分类)、病灶分类——给定图像判断病理状态,是医疗 VQA 的主干题型。
- 严重程度分级:severity grading——不只是「有没有病」,而是「第几期/第几级」,对应临床决策的分级管理逻辑。
- 属性识别:attribute recognition——病灶的形态、位置、数量、颜色等属性级描述,是报告生成的原子能力。
- 检测与定位类:detection(检出)、localization(定位)——把「有没有」与「在哪里」拆成两问,配合 box 级输入。
- 分割与区域类:segmentation 相关任务——配合 mask 级输入测试像素级区域理解。
- 计数与其他:counting 等细粒度任务——测量的分辨率与临床场景的细颗粒需求对齐。
- 读法提示:18 个任务的完整清单与缩写以官方统计图为准;复现时按任务列分组出分数,任何单一任务切面的样本量都要检查——小切片上的分数波动远大于总分。
§2.9 18 科室的组织学
- 科室即需求视图:任务轴回答「模型会什么」,科室轴回答「哪家科室用得上」——肿瘤、心内、眼科等 18 个科室把同一批题从临床使用者视角重新组织。
- 医院选型的正确打开方式:眼科医院不该看总分,该看眼科切面 + 眼科高频任务(属性识别/分级)的交叉分数;lexical tree 的价值就是把这种交叉查询变成一次配置。
- 科室与模态的天然耦合:多数科室对应主力模态(眼科-眼底、消化内科-内镜、影像科-CT/MRI),但也有跨模态科室(肿瘤科横跨病理/影像/内镜)——交叉切面的样本量规划要留意。
§2.10 感知粒度:从看图到交互
- image-level:整图 + 问题——传统 VQA 形态,测全局理解。
- box-level:在图像上框出矩形区域,问题围绕该区域——对应临床「你看框里这个结节」的交互。
- mask-level:像素级掩码高亮目标——对应分割结果的理解与复核场景(AI 标出病灶、医生确认)。
- contour-level:轮廓/边界线形态——对应器官边界、病灶轮廓的形态学判读。
- 设计动机:临床交互不是「扔一张图问一句话」,而是「系统先做检测/分割,医生围绕结果追问」——后三档粒度模拟的正是这种人机协作形态。官方评测发现 box 级一致最差,说明当前 LVLM 的训练分布里区域级监督稀疏——这直接给出了训练侧的施工方向。
§2.11 QA 生成管线的方法学
- 从标签到题目:284 源数据集自带高质量标签(分类标签、框、mask),管线以标签为锚生成 QA 对——每题必含图像模态信息、任务线索与标注粒度,保证「题目自解释」。
- GPT-4o 辅助生成:论文与社区解读确认管线使用 GPT-4o 基于标签与问题-选项池生成候选题目——生成式构建大幅降低人工出题成本,但也引入生成模型偏置(选项措辞、干扰项设计风格)。
- 人工验证关卡:生成候选经医学专业人员验证与人工筛选才进入最终集——官方强调防 data leakage 设计:问题不能脱离图像被回答(纯文本推理答不出)。
- 对使用者的含义:管线决定了两件事——①题目质量方差小但存在源间差异;②「无图不可答」是可用作泄漏检测的性质(见 §5.9 检查单)。
§2.12 临床交互形态与四级粒度的映射
- 读片会诊形态:医生把整张影像放上台子讨论——对应 image 级:「这张胸片的主要异常是什么」。
- 病灶圈注形态:医生用鼠标圈出感兴趣区——对应 box 级:「框内的结节的边界特征如何」。
- AI 标注复核形态:系统先行分割,医生复核高亮结果——对应 mask 级:「高亮区域的分割是否准确覆盖了病灶」。
- 轮廓判读形态:医生沿器官/病灶边界描述形态学——对应 contour 级:「轮廓的形态学特征提示什么」。
- 映射的工程意义:产品经理按自家交互形态找对应粒度切面分数——做圈注交互的产品盯 box 级分数,做 AI 分割复核的产品盯 mask 级分数;image 级总分对交互式产品只说明「底盘没塌」。
- 训练侧的逆向推论:产品形态决定数据配比——全交互式产品线的训练配方里,区域级指令数据的权重应该显著高于通用对话型 LVLM 的配方。
§2.13 「全科卷」与专科模型的紧张关系
- 基准立场:GMAI-MMBench 站在 GMAI(通用医疗 AI)立场——一个模型应全科可用;专科模型在全科卷上吃亏是设计使然。
- 专科立场的辩护:放射科 AI 的价值在放射科——用 38 模态全科卷评判一个胸科专科模型,就像用十项全能评判百米运动员;per-data/per-task 切面正是给专科模型的公平测量口径。
- 实践和解:专科模型报基准分数的正确姿势是「总分 + 本域切面深挖」——总分说明通用性边界,本域切面说明专业深度;两者并列才是完整的自我介绍。
- 对基准的合理批评:全科卷的题目难度在不同模态间不一定可比(38 模态的任务难度天然不均)——跨模态分数比较要记得「难度非均匀」这一前提。
§3 数据集规格
§3.0 规格总表
| 属性 | 规格 |
|---|---|
| 源数据集 | 284 个(公开 268 + 合作医院 16) |
| 题目总量 | 约 26,000 道(官方口径 ~26K) |
| 题型 | 单项选择(*)+ 多项选择(#) |
| 模态覆盖 | 38 种医学图像模态(含生理信号图像形态) |
| 任务覆盖 | 18 个临床 VQA 任务 |
| 科室覆盖 | 18 个临床科室 |
| 感知粒度 | image / box / mask / contour 四级 |
| 发布格式 | TSV(图像列 Base64 内嵌);VAL 与 TEST 两份 |
| 发布渠道 | HuggingFace(OpenGVLab)、OpenDataLab(GMAI/MMBench) |
| 评测框架 | VLMEvalKit(open-compass),内置 data 名 |
| 许可 | 继承源数据集各自许可(无统一再许可声明) |
| 发表 | NeurIPS 2024 D&B Track;arXiv:2408.03361(v7) |
§3.1 284 源数据集的构成逻辑
- 检索-过滤-保留漏斗:官方从公开库与合作医院检索数百个候选数据集,经质量过滤(标签质量)、图像格式统一、标签表达标准化三步,保留 284 个——漏斗的存在意味着「284」是质量阈值的结果而非穷举清单。
- 公开 268 + 医院 16:绝大多数源为公开学术数据集;16 个医院数据集经伦理批准共享,是「临床相关性」宣称的实物支撑——医院数据往往更「脏」(伪影、体位、真实工作流噪声)。
- 源间体量极不均匀:284 个源贡献约 26K 题,平均每源不足百题,但实际分布必然长尾——少数大源贡献多数题目。做 per-data 分析时(论文支持按源数据集评分)长尾小源的分数方差要放大置信区间。
- 溯源实践:论文补充材料列出全部源数据集清单——在自家论文里使用切面分数时,把涉及的源列出来是审稿人会检查的细节。
§3.2 26K 题的构成与题型
- 单选(*)与多选(#):官方统计以符号区分两类题;多选题要求全部选项正确才算对——计分规则见 §5.4。
- 随机基线的含义:Random 基线 25.70(Val)/25.94(Test),说明多数题目为 4 选项单选(1/4≈25%)——多选题拉高随机对率的部分很少。
- 题量体量评估:26K 题对评测而言是「全量可跑」的体量——一个强模型全量推理数小时到一天级(取决于图像数量与分辨率),远轻于训练集体量。
- 题目-图像多对一:同一张图可出多道题(不同任务/粒度)——统计去重时按题目计而非按图像计,这是复现官方口径的细节。
§3.3 四级感知粒度的实现
- image 级:题目只携带整图。
- box 级:图像上叠加矩形框标注(或以坐标+指令文本表达),问题指向框内区域。
- mask 级:像素掩码以高亮叠加呈现——「高亮区域的诊断类别是什么」。
- contour 级:以轮廓线呈现目标边界——围绕轮廓形态学出题。
- 在 TSV 里的表达:粒度信息作为每题元数据列存在,区域信息随图像列以编码后的叠加图呈现(Base64 内嵌后无需外部标注文件)——这是 TSV+Base64 设计的自洽性:一切都在一列里。
- 粒度间可比性:四级粒度的题量不均衡(image 级最多、contour 级最少)——跨粒度比较分数时把「题量差」计入解读,不要直接相减下结论。
§3.4 VAL 与 TEST 的划分设计
- VAL(validation):带 answer 列——可本地评测、可自由做切面分析、可反复调试 answer extraction 策略。
- TEST(test):不含 answer 列——本地只能完成推理,把 prediction 导出为 Excel 后邮件官方(附模型名、队名、arXiv 链接),由官方用答案钥计算并更新 leaderboard。
- 设计动机:TEST 答案不公开直接阻断了「在 Test 上调参/训练」的路径——比公开答案靠模型自觉声明「从未见过 Test」的制度强得多。
- 实践影响:论文主表若报 Test 分要有邮件评测的等待期(官方人工处理);赶 deadline 的常见做法是先报 Val 分(声明口径),Test 分后补。
§3.5 数据格式细节:TSV + Base64
- 为什么 TSV:VLMEvalKit 的数据约定格式——
--data直接加载,无需额外解析脚本;每行一题,列含 index/question/options/answer(仅 VAL)/image/以及元数据列。 - 为什么 Base64:图像内嵌进 TSV 的唯一可行编码——官方用 OpenCV 读图、PNG 编码、Base64 字符串存储;TSV 本身无二进制能力,Base64 是标准桥。
- 体积代价:Base64 使数据体积膨胀约 1.33 倍,加上 PNG 无损编码医学图像,整卷数据在数十 GB 级——下载与磁盘规划要按膨胀后算。
- 解码要点:VLMEvalKit 官方解码函数对 RGBA/P 模式转 RGB、可按 target_size 缩略——自己写解码器时必须与官方一致,否则图像预处理差异会制造「幽灵涨分」或「幽灵掉分」。
§3.6 获取路径与镜像
- HuggingFace:
OpenGVLab/GMAI-MMBench——主渠道,含 VAL/TEST TSV 与说明。 - OpenDataLab:
GMAI/MMBench——国内镜像,对境内网络更友好。 - GitHub:
uni-medical/GMAI-MMBench——代码、快速上手、榜单与更新公告。 - VLMEvalKit 内置下载:评测框架内置数据下载逻辑——首次运行
--data GMAI-MMBench_VAL时自动拉取,无需手动管理文件。 - 网络与合规:下载时注意目标地区的网络与数据出境合规要求;医院数据子集如需进一步追溯伦理状态,通过官方联系渠道询问。
§3.7 存储与环境规划
- 磁盘:按膨胀后数十 GB 计,另留推理输出(prediction Excel/CSV)与日志空间——建议 200GB 级工作区一步到位。
- 依赖版本:官方 README 明确
numpy==1.26.4——装成 numpy 2.x 会触发数据加载路径的兼容性问题(社区高频事故,见 §4 坑点)。 - 推理资源:图像分辨率不一,LVLM 推理显存按模型上限预留;torchrun 多卡并行按 VLMEvalKit 文档配置,小模型可单卡批量。
- 评测时长预估:50 模型官方榜单的构建是大规模工程;单个模型全量 VAL 一次,从数小时(7B 级、多卡)到一天以上(超大闭源模型走 API,受限速)——排期按此量级。
§3.8 lexical tree:组织层的设计细节
- 结构:把每个数据点的模态/任务/科室/粒度标签组织为词法树——评测时通过选择树的节点(或节点组合)抽取出对应题目子集。
- 与标签体系的差别:普通基准的「标签」只用于统计图表;lexical tree 把标签升级为可执行的查询接口——树即查询语言。
- 自定义评测场景:医院想评「眼科 + 属性识别 + image 级」三条件交叉——在树上取交集即可,无需写数据过滤代码;这是官方宣称「customized evaluation」的实现机制。
- 导出与二次开发:官方支持从树导出评测子集——做本地「科室小卷」的团队以此为基础再标准化为自家评测格式,工程量主要在把 VAL TSV 解 Base64 还原图像这一步。
§3.9 医院数据子集的伦理流程
- 伦理批准前置:16 个医院源数据集在进入基准前经对应医院伦理批准——这是官方 Disclaimers 与论文披露的关键合规锚点。
- 脱敏与不可逆识别:医学图像脱敏(burned-in annotation 清除等)遵循源数据集各自的流程;使用者不再二次脱敏处理,但也因此不得反向尝试识别。
- 使用边界:医院数据子集的许可与使用限制可能严于公开子集——商用或对外分发基于基准的衍生数据前,优先核查医院子集的许可层级。
- 对基准完整性的意义:医院子集是「临床相关性」的试金石——去掉它们,基准就退化成「公开数据集汇编卷」,这正是它区别于纯学术汇总的护城河。
§3.10 数据质量控制链
- 第一道:源过滤——数百候选 → 284,过滤掉标签质量不达标、格式混乱、许可可疑的源。
- 第二道:标准化——图像格式统一(PNG 编码路径)、标签表达标准化(同一语义跨源对齐)。
- 第三道:QA 生成校验——每题必含模态信息、任务线索、粒度标注的结构检查。
- 第四道:人工筛选——医学专业人员验证答案正确性与临床合理性,剔除泄漏题(无图可答)与歧义题。
- 残余方差:四道关卡后仍有源间标注风格差异——这是 284 源卷的固有属性,使用者在 per-data 切面上会直接看到,属正常现象而非 bug。
§3.11 与源数据集的「二次封装」关系
- 法律层:GMAI-MMBench 对 284 源是再分发+改造关系——各源许可(CC 系、MIT、自定义研究许可)随源继承;官方 Disclaimers 承诺侵权样本可联系移除。
- 数据层:源数据集的原始标注被「翻译」为选择题——这一改造意味着在源数据集上的 SOTA 分数(如某分割模型在源集 Dice 0.9)与在本基准上的选择题准确率完全不可比。
- 引用实践:使用 GMAI-MMBench 的论文若涉及特定源域结论,惯例是双引——基准引用 + 源数据集引用;只引基准不溯源会被视为对上游标注工作的抹除。
§3.12 版本演进与口径对齐表
| 口径项 | arXiv v1(2024-08-06) | arXiv v5/v7(2024-10-21) | 使用建议 |
|---|---|---|---|
| 源数据集数 | 285 | 284 | 引用 284 |
| 模态数 | 39 | 38 | 引用 38 |
| GPT-4o 分数 | 约 52% | 53.96%(Test)/53.53%(Val) | 引用 53.96% 并注明 Test |
| 发表状态 | preprint | NeurIPS 2024 D&B Track 接收 | 按会议论文引用 |
| 官方榜单 | 未含 | GitHub leaderboard(Val/Test 双列) | 同快照期比较 |
- 漂移原因推测:v1→v7 之间经 NeurIPS 同行评审,统计口径按评审意见收紧——「285/39」到「284/38」的差异大概率是源数据集的复核剔除。
- 对齐纪律:团队内部文档、论文、汇报统一一份「口径速查卡」(本文 §4.3 表可直接复用)——口径混乱是跨团队协作中最廉价的错误,也是最常犯的。
§4 数据结构
§4.0 TSV 文件与目录形态
GMAI-MMBench/
├─ GMAI-MMBench_VAL.tsv # 带答案,本地评测主用
├─ GMAI-MMBench_TEST.tsv # 无答案列,官方邮件评测用
└─ (说明/许可随 HF dataset card 更新)
- 单文件哲学:图像内嵌后整个基准就是两份 TSV——没有图像文件夹、没有标注 JSON、没有切分配置;换机器迁移就是拷两个文件。
- 代价:单文件数十 GB——任何局部修改(比如剔除某源)都要全量重写 TSV;衍生研究建议先解出图像到本地文件夹再加工。
§4.1 DAIMS 字段字典
| 字段 | 类型 | 语义 | AI 提示 |
|---|---|---|---|
| index | 整数/文本 | 题目主键 | 对齐官方榜单行 |
| question | 文本 | 题干(含模态线索、任务线索、粒度提示) | 提示词工程的基准面 |
| A/B/C/D(选项列) | 文本 | 选项内容 | 多选题注意「全选对」语义 |
| answer | 文本 | 正确答案(仅 VAL) | TEST 中此列不存在 |
| image | Base64 字符串 | PNG 编码图像(含叠加的区域标注) | 解码必须对齐 VLMEvalKit 实现 |
| category/modality | 文本 | 模态与任务元数据 | lexical tree 切面键 |
| department | 文本 | 科室标签 | 科室切面查询键 |
| granularity | 文本 | image/box/mask/contour | 粒度分层分析键 |
| question_type | 文本 | 单选/多选标记(*/#) | 计分规则分支 |
- 字段语义的官方口径:具体列名以 HF dataset card 与 VLMEvalKit 加载代码为准——本文表为结构语义速查;版本更新可能微调列名。
§4.2 图像列的 Base64 生命周期
- 编码侧(官方):
cv2.imread(BGR)→cv2.imencode('.png', image)→base64.b64encode→ 字符串入 TSV。 - 解码侧(VLMEvalKit 官方实现):
base64.b64decode→Image.open(BytesIO)→ RGBA/P 模式转 RGB → 可选thumbnail(target_size)缩略。 - 一致性红线:自研评测管线若在缩略策略(thumbnail 只缩不放)、色彩模式转换上与官方不一致,同一模型分数会出现不可解释偏移——复现差异排查先查解码路径。
- 区域叠加的实现位置:box/mask/contour 的区域信息在编码前已叠加进图像(叠加图整体编码)——解码侧无需再解析坐标;这意味着「区域是像素事实」而非「区域是结构化标注」,做区域级分析时以视觉叠加为准。
§4.3 关键统计速览
| 统计项 | 数值 | 来源口径 |
|---|---|---|
| 源数据集 | 284(268 公开 + 16 医院) | arXiv v7 摘要 |
| 题目总数 | ~26,000 | 官网/论文 |
| 模态 | 38 | arXiv v7 |
| 临床任务 | 18 | arXiv v7 |
| 科室 | 18 | arXiv v7 |
| 感知粒度 | 4(image/box/mask/contour) | arXiv v7 |
| 评测模型 | 50 个 LVLM | arXiv v7 摘要 |
| 随机基线 | Val 25.70 / Test 25.94 | GitHub leaderboard |
| 最高分 | GPT-4o:Val 53.53 / Test 53.96 | GitHub leaderboard |
§4.4 元数据列与切面查询
- 切面三轴 + 粒度:任务轴(18)× 科室轴(18)× 模态轴(38)× 粒度轴(4)——任意交集给出一个评测子集;lexical tree 是这个查询空间的树形索引。
- 样本量意识:交集越细子集越小——科室×任务×粒度三条件交集可能只剩几十题,分数±10% 波动正常;论文报切面分数时同时报子集大小是规范做法。
- 官方 per-data / per-task 口径:论文同时报按源数据集与按任务两种聚合——per-task 衡量能力、per-data 暴露源偏移;两种口径并列是解读的最低配置。
§4.5 缺失与异常的处理约定
- answer 列缺失:TEST 全卷无 answer 列——这是设计而非数据缺陷;本地评测脚本要在加载时按「有无 answer」分支。
- 图像解码失败:极少数样本可能因编码边界问题解码异常——官方路径以 VLMEvalKit 的容错为准;自研管线遇到时先对齐官方版本再报告问题。
- 多选题选项数不定:多选题选项多于单选——计分与随机基线计算都按题型分支,不能全卷统一按 1/4。
- 文本编码:题干可能含医学缩写与特殊字符——TSV 读取统一 UTF-8;Windows 环境注意换行符与 BOM 问题(社区事故常客)。
§4.6 与 VLMEvalKit 数据契约的耦合
- 内置 data 名:
GMAI-MMBench_VAL与GMAI-MMBench_TEST注册于 VLMEvalKit——python run.py --data GMAI-MMBench_VAL --model <model>一行起跑。 - 自动下载与校验:框架按内置配置拉取数据并校验——手动下载的 TSV 若版本与框架预期不一致会被校验拦下(这是保护而非障碍)。
- 自定义模型接入:按 VLMEvalKit 的 vlm 模板实现推理接口即可进入评测——部分老模型需在 config 里配置代码根/权重根(README 列出需配置的模型清单)。
- 版本锁定建议:VLMEvalKit 本身迭代快——复现官方榜单建议锁定与论文同期版本;追新版本则要重新校准一次基线。
§4.7 Base64 解码与本地化处理参考代码
# 将 GMAI-MMBench_VAL.tsv 解为 images/ 文件夹 + manifest.parquet
# 依赖:pandas, pillow, pyarrow;numpy 请保持 1.26.4
import base64, io
from PIL import Image
import pandas as pd
TSV = "GMAI-MMBench_VAL.tsv"
OUT = "images"
df = pd.read_csv(TSV, sep="\t")
records = []
for row in df.itertuples():
# 与 VLMEvalKit 对齐的解码路径:b64 -> PIL -> RGBA/P 转 RGB
img = Image.open(io.BytesIO(base64.b64decode(row.image)))
if img.mode in ("RGBA", "P"):
img = img.convert("RGB")
fname = f"{row.index}.png"
img.save(f"{OUT}/{fname}") # 不做 thumbnail,保留原始分辨率
records.append({
"index": row.index,
"question": row.question,
"answer": row.answer,
"image_file": fname,
# 元数据列按 TSV 实际列名补充:modality/department/granularity/question_type
})
pd.DataFrame(records).to_parquet("manifest.parquet")
# 产出:本地图像文件夹 + 结构化 manifest,供后续自定义切面与训练侧分析
- 代码说明:保留原分辨率(不 thumbnail)是为了让区域叠加与题干描述逐像素对齐;做显示端应用时可自行二次缩略。
- 内存策略:逐行流式处理,避免一次性 decode 全部图像(数十 GB 的 Base64 全载入会击穿内存)。
§4.8 TSV 到自定义格式的转换配方
- 转 JSONL:manifest 转换后与图像路径合成 JSONL(每行一题)——自研评测循环最通用形态。
- 转 HF datasets:
load_dataset("imagefolder", data_dir=OUT)+ manifest 合并——享受 datasets 的 map/filter 链式处理,切面查询变成dataset.filter(lambda x: x["department"]=="Oncology")。 - 转评测平台格式:内部评测平台多有自己的题库 schema——按 §4.1 字段字典映射即可,重点是保留 question_type 与 granularity 两列,否则计分与粒度分析退化。
- 反向合规:转换后的衍生数据集对外分发前,按 §8 的继承许可逐源核查——尤其医院子集相关的题目行。
§4.9 数据完整性验证清单
-
[ ] 行数与官方声明一致(VAL+TEST 合计约 26K 量级)
-
[ ] VAL 每行 answer 非空、TEST 每行无 answer 列
-
[ ] 抽样 100 行 Base64 可解码、PNG 完整
-
[ ] question_type 覆盖单选/多选两类且比例与官方统计图量级一致
-
[ ] granularity 四值齐全且 image 级占比最高
-
[ ] department/modality 轴的取值数与 18/38 量级一致
-
[ ] 一次 VLMEvalKit 冒烟评测(抽小子集)分数合理(高于随机、低于满分)
-
清单用法:新环境部署后先跑完本清单再开始正式评测——八项全绿后再投入推理资源,能挡住九成的「评了一半发现数据不对」事故。
§4.10 元数据质量抽查脚本
# 元数据质量抽查:切面分析前先确认各轴取值干净
import pandas as pd
df = pd.read_csv("GMAI-MMBench_VAL.tsv", sep="\t")
# 1) 各切面轴的取值分布(轴干净是切面分析的前提)
for col in ["modality", "department", "granularity", "question_type"]:
print(f"== {col} ==")
print(df[col].value_counts(dropna=False).head(20))
# 2) 空值与异常长度扫描
print("question 空值:", df.question.isna().sum())
print("question 超长(>2000字符):", (df.question.str.len() > 2000).sum())
print("answer 空值(VAL 应为 0):", df.answer.isna().sum() if "answer" in df else "无 answer 列")
# 3) 抽样目检:随机 10 题打印题干与答案(人工确认语义合理)
sample = df.sample(10, random_state=42)
for r in sample.itertuples():
print(f"[{r.index}] {r.question[:80]}... -> {getattr(r, 'answer', 'N/A')}")
- 抽查的意义:切面轴取值若存在拼写变体(同一科室两种写法),切面统计会分裂——先归一后统计;抽查十题题干,对「题目自解释」有体感,也是发现泄漏题(无图可答)的土办法。
§5 评测协议
§5.1 VLMEvalKit 快速上手
# 1) 安装(官方推荐路径)
git clone https://github.com/open-compass/VLMEvalKit.git
cd VLMEvalKit && pip install -e .
# 2) VAL 本地评测(推理+评分一体)
python run.py --data GMAI-MMBench_VAL --model <model_name> --verbose
# 3) 仅推理(大模型分两步走时用)
python run.py --data GMAI-MMBench_VAL --model <model_name> --verbose --mode infer
# 4) 多卡加速(torchrun,每卡一实例)
torchrun --nproc-per-node=8 run.py --data GMAI-MMBench_VAL --model <model_name> --verbose
- 依赖红线:
numpy==1.26.4(README 明示)——先钉版本再装框架,numpy 2.x 会破坏加载路径。 - 结果产出:日志打印分数;
$WORK_DIR/{model_name}生成结果文件,.csv为指标文件——正式报告以 csv 为准。 - 模型名:必须用
supported_VLM(vlmeval/config.py)里的注册名;MiniGPT-4、InstructBLIP 等需先配置代码根/权重根。
§5.2 VAL 本地评测全流程
- 步骤:装框架 → 配模型 →
--data GMAI-MMBench_VAL起跑 → 等 csv → 切面分析(按任务/科室/粒度分组重算)。 - 自动下载:首次运行自动拉取 TSV——境内网络不稳时优先走 OpenDataLab 镜像手动放置,再跑框架校验。
- 调试循环:answer extraction 规则不匹配自己的模型输出风格时(见 §5.8),在 VAL 上迭代解析策略——这是 VAL 带答案列的核心价值。
- 成本控制:先抽子集冒烟(如某一科室切面数百题)验证管线,再放全量 26K——「全量跑完发现解析全错」是最贵的事故。
§5.3 TEST 官方邮件评测流程
- 流程:
--data GMAI-MMBench_TEST跑推理 → 评分阶段因无答案报错(预期行为,非故障)→ 从VLMEvalKit/outputs/<MODEL>取中间结果 Excel(prediction 列)→ 邮件发送官方。 - 邮件要件:模型名、队名、arXiv 论文链接(README 明示收件要求)——官方人工处理、计算准确率并更新 leaderboard。
- 等待期规划:官方按批次处理——投稿前预留缓冲周;赶 deadline 先报 VAL 分并显式声明口径。
- 为什么接受这个摩擦:TEST 答案保密换来的分数公信力,值得一次邮件往返——这是榜单防过拟合的制度成本。
§5.4 计分规则
- 单选:预测选项与答案一致记对——accuracy 按「对题数/总题数」。
- 多选(#):预测集合与答案集合完全一致才记对——部分对记 0 分;把多选当单选评(只对一个选项)会虚高或虚低(取决于答案集合大小),两者都不可接受。
- 聚合口径:官方榜单总分 + per-task/per-data 切面——自报分数时至少并列总分与一个切面,避免「总分掩盖短板」。
- 随机基线参照:Val 25.70 / Test 25.94——任何「显著高于随机」的子集分数都要先排除泄漏(尤其题目进入预训练语料的模型)再解读。
§5.5 answer extraction:被低估的分数放大器
- 问题本质:LVLM 输出自由文本,评测要从输出里抽取选项字母——「答案是 B」/「B. 玻璃膜疣」/长段描述结尾带 B,解析规则不同分数不同。
- 医疗专用模型的重灾区:RadFM 22.93、LLaVA-Med 19.60、Med-Flamingo 11.64 低于随机的分数,相当部分来自不遵循选项格式(输出报告文本而非选项字母)——把「格式不遵循」与「能力不行」区分开是正确归因的前提(官方论文亦将无关回复列为五大不足之一)。
- 实践守则:①用官方解析路径出主分数;②自研解析只做敏感性分析(两套解析的差值报进论文);③对医疗模型加一轮「选项格式指令微调」再评,能定位多大比例是格式问题。
- 幻觉抽取:解析器在模型输出里「找不到合法选项」时的默认处理(判错/判随机)要在论文里声明——不同默认值直接影响低分段的排名。
§5.6 切面评测与 lexical tree 实操
- 抽子集:按元数据列过滤 VAL TSV(或用官方导出)得到「小卷」——如「眼科 × 属性识别 × image 级」。
- 跑评:小卷照常走 VLMEvalKit 推理+评分;或全量推理一次,事后按元数据分组重算(推荐——推理一次、切片无限次)。
- 报告规范:切面分数必配子集题量;跨切面比较时优先看「同切面跨模型」而非「同模型跨切面」(后者受子集量与难度差影响)。
- 科室小卷的维护:医院场景常把固定小卷固化为「验收卷」——注意验收卷长期不换题会被下一代模型「背卷」,定期混入新源题是卫生习惯。
§5.7 复现官方分数的检查单
-
[ ] numpy 钉在 1.26.4
-
[ ] VLMEvalKit 版本与目标口径同期(或确认向后兼容)
-
[ ] 模型注册名正确、权重根配置完成
-
[ ] 数据完整性清单(§4.9)八项全绿
-
[ ] VAL 跑通且总分与官方 leaderboard 同模型量级(±1-2% 内)
-
[ ] 差异超限时按「解码路径 → 解析规则 → 版本对齐」顺序排查
-
[ ] TEST 仅推理、导出 Excel、邮件要素齐全
-
排查口诀:先数据后模型、先解码后解析、先 VAL 后 TEST——三层各挡住一类事故,顺序错了会把简单问题查成玄学。
§5.8 评测脚本与切面分析的参考实现
# 事后切面分析:对 VLMEvalKit 输出的逐题结果按粒度分组重算 accuracy
# 输入:predictions.parquet(index, pred, correct, granularity, department, question_type)
import pandas as pd
df = pd.read_parquet("predictions.parquet")
# 1) 粒度切面:官方发现 box 级一致最差——复算验证自己的模型是否同样塌方
print(df.groupby("granularity")
.agg(n=("correct", "size"), acc=("correct", "mean"))
.sort_values("acc"))
# 2) 多选题单列:格式不遵循的归因要先看这一行
multi = df[df.question_type.str.contains("#", na=False)]
print("multi-choice n =", len(multi), "acc =", multi.correct.mean())
# 3) 科室×粒度交叉(示例:只看题量 >= 50 的交叉格,避免小样本噪声)
cross = (df.groupby(["department", "granularity"])
.agg(n=("correct", "size"), acc=("correct", "mean"))
.query("n >= 50"))
print(cross.sort_values("acc").head(10)) # 最差十格:施工优先级清单
- 代码说明:correct 列由官方评分 csv 合并元数据得到;「最差十格」直接产出施工优先级——这是 GMAI-MMBench 在工程上最值钱的用法。
§5.9 泄漏检测的自查方法
- 无图试探:把图像替换为空白/噪声图后让模型作答——若某子集准确率仍显著高于随机,说明模型可能「背过题」或题目可被文本先验解出(官方防泄漏设计让这种情况应接近随机)。
- 选项先验:只给题干与选项不给图,统计模型偏好——某些源数据集的标签分布偏斜(如某病灶 90% 为良性)会让模型靠先验得分,per-data 切面下尤其明显。
- 预训练语料时序:模型训练数据截止时间晚于 2024-08(基准公开)的,报告分数时应自查语料是否含 HF/GitHub 转载——负责任的论文会把这一条写进局限。
- 分数异常模式:总分正常但个别源数据集切面接近满分——先怀疑泄漏而非庆祝,对照该源的公开时间与模型语料截止时间。
§5.10 评测成本与排期预算
| 成本项 | 量级估算 | 备注 |
|---|---|---|
| 磁盘(数据) | 数十 GB(Base64 膨胀后) | 建议 200GB 工作区一步到位 |
| 磁盘(输出/日志) | 5-20 GB | prediction Excel + 推理日志 |
| 推理时长(7B 开源,8 卡) | 数小时全量 VAL | torchrun 并行 |
| 推理时长(超大模型/API) | 一天级 | 受 API 限速约束,按 QPS 排期 |
| 人工工时(首次接入) | 1-2 人日 | 环境+数据校验+冒烟 |
| 人工工时(复评一次) | 0.5 人日 | 管线就绪后主要是等待与核对 |
| TEST 官方评测等待 | 数天-周级 | 官方人工处理,投稿预留缓冲 |
- 预算心法:首次接入的成本集中在「一致性校准」(复现官方一个模型);管线校准后,每次复评的边际成本接近纯推理——把校准投入算作一次性基建。
- API 模型的特别提示:闭源模型评 26K 题是实打实的 API 账单——先抽样(如 5K 题)估单题成本再决定全量策略;论文报抽样分数时必须注明抽样协议与样本量。
§5.11 多模型并行评测的工程组织
- 命名与目录纪律:每模型独立输出目录、评测配置快照随结果归档——三个月后「这批分数用的什么 prompt」靠记忆必翻车。
- 批次划分:按模型体量分批(小模型并行批次、API 模型限速批次)——批次内统一 prompt 模板与解析规则,批次间复用同一校准基线。
- 失败重试策略:API 超时/限速的题目级重试记录在日志——重试率异常升高(>5%)通常是限速策略变化,先停下排查再继续,否则混合批次里混入不同服务质量。
- 结果入库:逐题结果(含 correct、切面元数据)统一入 parquet/数据库——§5.8 的切面分析脚本假设了这种结构化产出,散落的 csv 是切面分析的最大摩擦。
§6 基线与结果分析
§6.1 官方榜单(Val / Test)
| 排名 | 模型 | Val | Test | 备注 |
|---|---|---|---|---|
| — | Random | 25.70 | 25.94 | 随机基线 |
| 1 | GPT-4o | 53.53 | 53.96 | 闭源专有,全场最高 |
| 2 | Gemini 1.5 | 47.42 | 48.36 | 闭源专有 |
| 3 | Gemini 1.0 | 44.38 | 44.93 | 闭源专有 |
| 4 | GPT-4V | 42.50 | 44.08 | 闭源专有 |
| 5 | MedDr | 41.95 | 43.69 | 医疗专用最佳(开源) |
| 6 | MiniCPM-V2 | 41.79 | 42.54 | 开源 |
| 7 | DeepSeek-VL-7B | 41.73 | 43.43 | 开源 |
| 8 | Qwen-VL-Max | 41.34 | 42.16 | 闭源专有 |
| 9 | LLAVA-InternLM2-7b | 40.07 | 40.45 | 开源 |
| 10 | InternVL-Chat-V1.5 | 38.86 | 39.73 | 开源 |
| 11 | TransCore-M | 38.86 | 38.70 | 开源 |
| 12 | XComposer2 | 38.68 | 39.20 | 开源 |
| 13 | LLaVA-V1.5-7B | 38.23 | 37.96 | 开源 |
| 14 | OmniLMM-12B | 37.89 | 39.30 | 开源 |
| 15 | Emu2-Chat | 36.50 | 37.59 | 开源 |
| 16 | mPLUG-Owl2 | 35.62 | 36.21 | 开源 |
| 17 | CogVLM-Chat | 35.23 | 36.08 | 开源 |
| 18 | Qwen-VL-Chat | 35.07 | 36.96 | 开源 |
| 19 | Yi-VL-6B | 34.82 | 34.31 | 开源 |
| 20 | Claude3-Opus | 32.37 | 32.44 | 闭源专有 |
| 21 | MMAlaya | 32.19 | 32.30 | 开源 |
| 22 | Mini-Gemini-7B | 32.17 | 31.09 | 开源 |
| 23 | InstructBLIP-7B | 31.80 | 30.95 | 开源(需配置权重) |
| 24 | Idelecs-9B-Instruct | 29.74 | 31.13 | 开源 |
| 25 | VisualGLM-6B | 29.58 | 30.45 | 开源 |
| 26 | RadFM | 22.95 | 22.93 | 医疗专用,低于随机 |
| 27 | Qilin-Med-VL-Chat | 22.34 | 22.06 | 医疗专用,低于随机 |
| 28 | LLaVA-Med | 20.54 | 19.60 | 医疗专用,低于随机 |
| 29 | Med-Flamingo | 12.74 | 11.64 | 医疗专用,远低于随机 |
- 口径说明:数字摘自官方 GitHub leaderboard(2026-09 核对);arXiv v7 摘要引用的 53.96% 为 Test 口径——两列并存是官方设计,引用时注明列名。
§6.2 GPT-4o 53.96% 意味着什么
- 绝对水平:刚过「一半」——距离医生可依赖的水平有巨大缺口;对照随机 25.94%,GPT-4o 的信息增益显著但远未达到「全科合格」。
- 相对位置:领先第二名 5.6 个百分点(53.96 vs 48.36)——专有前沿模型仍有代差优势,但开源最佳(MedDr 43.69)与其差距(约 10 分)并非不可追赶的量级。
- 与通用基准的反差:同一时期的通用多模态榜单上 GPT-4o 常在 70-80% 区间——医疗域整体把分数压到 50% 一线,说明医疗专业知识与医学图像判读是当前 LVLM 的系统性短板,而非个别能力缺口。
- 解读纪律:53.96% 是 26K 题全卷平均——它掩盖科室/粒度差异;引用这个数字时最好同时给一个切面对照(如 box 级分数),否则容易被读成「医疗能力总体过半」。
§6.3 开源 vs 闭源的格局
- 第一梯队断层:GPT-4o 独一档(53.96);Gemini 1.5 到 GPT-4V 一档(44-48);开源第一梯队(MedDr、MiniCPM-V2、DeepSeek-VL-7B)42-44——开源与最前沿闭源的差距约 10 分。
- 开源亮点:DeepSeek-VL-7B(43.43)以 7B 体量追平 GPT-4V(44.08)——参数规模不是决定项,视觉-文本对齐质量与训练数据配比更关键。
- 闭源的意外:Claude3-Opus 32.44 排 20 名外——同期通用基准上的一线模型在医疗域的适配深度差异明显,说明「通用强 ≠ 医疗可用」,选型必须看医疗域实测。
- 对团队的含义:预算敏感团队用开源第一梯队打底(自托管、可微调),再评估是否需要 API 级模型补强——这份榜单把「自建 vs 采购」的讨论从直觉拉回数据。
§6.4 医疗专用模型悖论
- 现象:六个医疗专用模型多数不足通用模型中位水平(~30%),RadFM/LLaVA-Med/Med-Flamingo 甚至低于随机基线;唯一的例外 MedDr(43.69)冲进总榜第五。
- 归因一:格式不遵循:医疗模型多面向报告生成/对话训练,输出自由文本而非选项字母——answer extraction 失败直接把能力分打到零附近(见 §5.5)。这是最常见的主因,也是最容易被误读成「医疗模型更差」的部分。
- 归因二:指令微调≠知识注入:在医疗语料上做指令微调可能损害通用视觉对齐能力(灾难性遗忘)——「医疗化」的过程若没有足量高质量医学图像-文本对齐数据,反而拖低基础感知。
- 归因三:训练分布窄:不少医疗模型集中在单一模态(胸片/病理),跨 38 模态的全科卷天然吃亏——MedDr 的相对成功恰在于更宽的训练覆盖。
- 正确读法:悖论不说明「专用路线失败」,而说明专用模型需要为评测做格式适配 + 专用路线必须保住通用感知底盘——两个工程动作,不是一个结论。
§6.5 box 级空间盲区
- 官方发现:box 级标注下的准确率一致低于 image 级——区域提示没有帮助模型,反而干扰了它。
- 机理推测:LVLM 的视觉-文本对齐以整图-描述对为主,区域级监督稀疏;叠加的框在视觉上引入新元素,模型缺乏「框=问题指称对象」的训练分布。
- 与区域级标注生态的断层:chest-imagenome 等区域级标注数据集已经存在,但 LVLM 预训练配方很少系统纳入——GMAI-MMBench 把这个断层变成了可测量的分数。
- 施工方向:区域级指令数据(框选区域+问答对)混入微调配方、视觉 prompt 对框的编码方式(画框 vs 坐标 token)消融——box 级短板是五大不足里最可工程化的一条。
§6.6 随机基线的工程意义
- 25.70/25.94 的来源:全卷以 4 选项单选为主——1/4 随机对率;多选题轻微抬高了对率(猜测全对的概率低但非零)。
- 三条红线用法:①低于随机=输出与题目脱钩(格式问题/拒答/空输出),先修解析再谈能力;②接近随机=该切面对模型完全陌生,区分度有限;③远高于随机但低于 40%=有基础感知但知识薄弱——三种状态对应三种施工动作。
- 子集基线重算:不同切面的随机对率不同(选项数分布变化)——报小切面分数时同步重算该切面的随机基线,避免拿全卷 25% 去比 30 题小卷的 38%。
§6.7 五大关键不足逐条展开
- ① 感知错误:图像内容识别错(把 CT 片方向看反、把病灶当伪影)——上游感知错,下游答案必错;对应施工:医学图像方向/伪影增强训练数据、检查视觉编码器在医学域的适配。
- ② 医学知识缺失:看见了但叫不出名字、不理解分级标准——对应施工:医学教科书/指南文本注入、检索增强(RAG)在评测与部署侧的引入。
- ③ 无关回复:答非所问、输出模板化描述而非针对问题——对应施工:医疗指令数据的质量清洗(而非单纯堆量)、输出约束解码。
- ④ 安全协议过度拒答:把正常医学问题当敏感请求拒答——通用对齐的安全策略在医疗语境过泛化;对应施工:医疗场景的安全边界重定义、「拒答可答题率」作为独立指标监控。
- ⑤ 空间推理短板(box 盲区):见 §6.5——对应施工:区域级监督混入训练。
- 方法论价值:五条把「医疗 LVLM 不行」拆成五个可独立验证、独立施工的假设——这是论文结论里对工程界最有用的部分。
§6.8 错误类型的成本画像
- 感知错误(最贵):在医疗场景,看错图的后果不可逆——部署侧任何「感知错误率」不为零的环节都需要人审兜底;这是医疗 LVLM 产品的核心风险预算项。
- 知识缺失(可补救):RAG/指南检索可在线补偿——成本在工程侧而非训练侧,是五类里商业上最易缓解的一类。
- 过度拒答(体验杀手):不产生错误信息但消灭可用性——医院试用场景「十问三拒」直接导致弃用;它的监控优先级高于一般理解。
- 无关回复/格式失控(评测噪声源):部署侧影响交互质量,评测侧污染分数——两处都要修,且先修评测侧(否则连「修没修好」都测不准)。
§6.9 Val 与 Test 分数关系的经验规律
- 官方数据的规律:多数模型 Test 分略高于 Val 分(GPT-4o 53.53→53.96、Gemini 1.5 47.42→48.36)——两份划分难度基本对齐,Test 未显示出系统性更难。
- 实践含义:Val 上的切面结论(哪个科室弱、box 级塌不塌)在 Test 上大概率复现——本地用 VAL 做全部诊断分析、Test 只出总分报点,是成本效益最高的路径。
- 例外警惕:若自己模型 Val/Test 差异超过 2-3 分,优先排查过拟合(在 VAL 切片上反复调参)与解析规则对 VAL 过适配——VAL 是给你调试的,不是给你背的。
§6.10 与后续评测生态的接力
- 医疗 LVLM 论文的主表常客:2024 下半年起的医疗多模态模型发布(含开源权重模型)多以 GMAI-MMBench 为核心评测列之一——它事实上成为该细分领域的「公共验收线」。
- 与通用基准的互补:MMT-Bench 等通用多模态基准测「泛能力」,GMAI-MMBench 测「医疗域适配」——两列并列才能画出模型的完整画像,只报其一都有选择性呈现之嫌。
- 社区二次利用:lexical tree 与元数据结构被后续研究复用为「切面评测方法论」的参考——基准的影响超出其题目本身,组织方式成为可迁移资产。
§6.11 自家模型接入评测的标准动作序列
- 环境:numpy 1.26.4 + VLMEvalKit 同期版本——先跑官方任一小基准冒烟。
- 数据:VAL 完整性八项清单(§4.9)全绿。
- 基线:官方 leaderboard 上找一个体量相近的模型复现(±1-2%)——校准管线后再评自家模型。
- 全量 VAL:推理+评分,产出总分+四切面(任务/科室/模态/粒度)。
- 诊断:§5.8 的「最差十格」分析 + §5.5 的解析敏感性——把分数转成施工清单。
- TEST:推理导出 Excel、邮件官方——主分数进论文用 Test,诊断数据用 Val。
- 复评节奏:模型每迭代一版全量复评一次,切面趋势(box 级是否在涨、拒答率是否在降)比总分趋势信息量大。
- 序列要点:第 3 步「复现别人」最常被跳过——但它是唯一能证明「你的分数和官方可比」的环节;省下这一步,后面所有分数都只能自说自话。
§6.13 分数解读的三层框架
- 第一层:绝对水平——总分对照随机基线(25.94)与满分,回答「模型有多大能力存量」;GPT-4o 53.96% 说明存量过半但远未合格。
- 第二层:结构画像——四切面(任务/科室/模态/粒度)回答「能力怎么分布」;box 级塌方、科室偏科都在这一层显形。
- 第三层:动态趋势——同一管线跨版本复评,回答「迭代是否命中要害」;box 级分数的边际变化比总分的边际变化信息量大得多。
- 三层的使用纪律:对外宣传通常只用第一层,工程决策依赖第二层,迭代管理看第三层——三层混用(拿第一层做工程决策)是管理层误读的常见起点。
§6.12 坑点(Pitfalls)
坑点 1:版本数字漂移(285/39/52% vs 284/38/53.96%)
arXiv v1 写 285 数据集、39 模态、GPT-4o 约 52%;v5+ 修订为 284/38/53.96%。写论文引用旧版数字,熟悉该基准的审稿人一眼识别。对策:全文对齐 v7/官网口径,引用时带版本号。
坑点 2:Val/Test 分数混排
官方 leaderboard 双列(Val/Test),GPT-4o 53.53/53.96。论文表格混排两列、或拿自家 Val 比他人 Test,结论直接作废。对策:表格加口径列,比较强制同列。
坑点 3:多选题当单选评
多选题(#)要求全对;把答案集合只取一个选项或按部分对给分,分数虚高/虚低且方向不可控。对策:计分按 question_type 分支,多选题单列报告。
坑点 4:医疗模型低分误读为「能力差」
RadFM/LLaVA-Med 低于随机的分数,相当部分是输出不遵循选项格式、answer extraction 抽不到字母——归因为「医疗模型更差」是错误结论。对策:先做选项格式适配与解析敏感性分析,再谈能力归因(§5.5)。
坑点 5:numpy 版本不兼容
官方钉 numpy==1.26.4;环境里装 numpy 2.x 后数据加载路径报错或静默异常,表现为「评测跑到一半崩」或「分数诡异」。对策:独立环境先钉版本再装 VLMEvalKit。
坑点 6:Base64 解码路径不一致
自研管线在 RGBA/P 转 RGB、thumbnail 缩略策略上与 VLMEvalKit 实现不同,同一模型分数出现不可解释偏移。对策:解码逐行对齐官方实现;复现差异排查先查解码(§4.2)。
坑点 7:TEST 答案的反向试探
通过邮件评测系统构造题目组合试探答案钥——越界行为,一旦被识别失去社区信任且可能被官方除名。对策:TEST 只推理提交,永远把 TEST 当黑盒。
坑点 8:切面小样本分数过度解读
科室×任务×粒度交叉切面可能只剩几十题,±10% 波动正常;拿小切面 3 分差距下「模型 A 优于 B」的结论是统计事故。对策:切面分数必配子集量,n<50 的格子只看趋势不下结论(§5.8)。
§7 AI 就绪指南与应用场景
§7.0 云端快速启动
# 环境准备(建议独立 conda/venv)
pip install numpy==1.26.4
git clone https://github.com/open-compass/VLMEvalKit.git
cd VLMEvalKit && pip install -e .
# 冒烟:开源小模型全流程
python run.py --data GMAI-MMBench_VAL --model qwen_chat --verbose
# 查看结果:$WORK_DIR/qwen_chat/*.csv
- 冒烟通过标准:总分落在 30-40% 区间(qwen_chat 官方约 36.96%)——显著偏移则先查环境再查数据。
§7.1 医疗 LVLM 论文评测列的规范姿势
- 主表三要素:Val/Test 口径声明 + 总分 + 至少一个切面(粒度切面最常被引用——box 级分数已成为「空间能力」的代名词)。
- 模型侧披露:评测时是否使用 system prompt 约束输出格式、answer extraction 用官方还是自定义——两处差异都会移动分数,必须披露。
- 版本对齐:引用数字对齐 arXiv v7 官方榜单;对比模型尽量取自同一 leaderboard 快照——不同快照期的 API 模型分数不可混排。
- 负面结果同样上报:自家模型在某切面低于随机——照实报并给归因(格式/能力),社区对诚实的负结果远比对注水的正结果宽容。
§7.2 医院/企业选型的操作剧本
- 圈定科室:本院高频科室取 3-5 个——直接映射 lexical tree 科室节点。
- 配小卷:每科室取「科室×高频任务×image/box 两粒度」交叉子集(各 100-300 题,保证统计力)。
- 候选模型:榜单第一梯队 + 1-2 个可私有化部署的开源模型——总分只是入围线,科室切面才是决胜局。
- 实测:统一 prompt 模板、统一解析规则,Val 全量一次推理后按小卷切片。
- 决策表:科室切面分数 × 部署约束(私有化/成本/延迟)二维决策——分数最高的模型不一定买得起、买得起的模型里选科室最强的。
- 验收卷固化:把选定小卷固化为季度回归评测——模型供应商升级版本时重跑,防「升级即退化」。
§7.3 训练侧迭代的施工地图
- 从五不足到训练配方:感知错误→医学图像增强/方向归一数据;知识缺失→指南与教科书语料 + RAG;无关回复→医疗指令数据清洗;过度拒答→医疗安全边界对齐数据;box 盲区→区域级指令微调数据。
- 优先级判断:先看切面分布再排优先级——image 级 70% 而 box 级 30% 的模型,加区域数据收益最大;整体 40% 的模型,先把通用感知底盘补齐。
- 复评闭环:每次配方变更跑全量 VAL——总分变化 ±1% 内时看切面,切面变化才是训练是否命中的证据。
- 外部效度提醒:GMAI-MMBench 分数的提升要在自建临床评测集上复核——基准优化是必要条件不是充分条件,Goodhart 定律在评测驱动的训练里始终在场。
§7.4 交互式医疗产品的能力验收
- 产品形态对照:「医生圈选区域→AI 解读」的产品(影像工作流插件、教学系统)——box/mask 级切面分数是核心验收指标,image 级总分反而次要。
- 验收线设定:没有行业统一验收线——按临床风险分级自设:教学场景可宽(30-40% 切面分起步),辅助诊断建议场景从严(至少复核全程 + 感知错误率专项测试)。
- 补充测试:基准测不出延迟、批量吞吐、PACS 集成——产品验收要叠加工程指标;GMAI-MMBench 是能力卷不是产品卷。
§7.5 教学与课程场景
- 数据版图教学:284 源清单本身就是「医疗 AI 数据长什么样」的全景教材——按模态/科室分组讲一遍,胜过抽象综述。
- 评测方法学教学:Val/Test 制度、answer extraction、随机基线、切面分析——一条基准把基准方法学的核心概念全部具象化。
- 课程作业设计:让学生复现榜单上某个开源模型的分数(±2% 内)——复现过程覆盖环境、数据、推理、评分全链路,是稀缺的完整练习。
§7.6 基准方法学研究的素材
- 可研究的问题:多选题计分规则对模型排名的敏感性;per-task 与 per-data 聚合口径的分歧;answer extraction 规则的系统效应;QA 生成式构建(GPT-4o 出题)引入的偏置测量。
- 实验友好性:VAL 带答案 + 元数据齐全——上述问题的实验成本都在「一次全量推理」量级,适合作为方法学论文的数据基础。
- 引用伦理:基于基准做方法学研究时避免把「基准缺陷」表述为「基准无效」——缺陷测量本身就是对基准的正当使用,官方论文亦开放讨论。
§7.7 与多模态 RAG 系统的配合
- 评测侧:知识缺失类错误(五不足之二)可以通过「评测时挂医学知识库检索」缓解——把 RAG 前后的切面对比作为系统报告,能直接展示 RAG 的边际价值。
- 部署侧:医院部署的 RAG 语料(院内指南、药品说明)与基准评测用的通用知识源不同——基准分数高不等于院内 RAG 系统就绪,两者是互补验证关系。
- 注意:GMAI-MMBench 的选择题形态对 RAG 的「引用溯源」能力零覆盖——溯源评测要另建开放题协议。
§7.8 评测的边界:它不测什么
- 开放式生成质量:报告生成、病历书写等长文本能力不在卷内——选择题只测判别不测生成;生成能力用 F1RadGraph 等指标体系另行评测(见 radgraph 篇)。
- 多轮对话与追问:临床交互的多轮属性(医生追问、逐步聚焦)未被模拟——四级粒度是静态模拟,不是对话式交互。
- 视频与时序:内镜视频、影像序列的时序判读不在覆盖内——38 模态以静态图像形态进入。
- 真实临床决策:处理不确定、请教会诊、患方沟通——这些「医疗的社会性」维度在所有选择题基准之外,部署前需真实场景验证。
- 边界的使用方式:写论文/做汇报时明确「本评测覆盖 X,不覆盖 Y」——边界声明不会削弱结论,反而是专业性的标志。
§7.9 「不可比陷阱」清单
- Val 与 Test 混排:53.53(Val)与 53.96(Test)是两列——论文表格混排两列是审稿意见常客。
- 跨快照对比:API 模型随厂商更新静默变化——不同时期榜单的 API 模型分数不可直接对比;引用时注明榜单快照时间。
- 切面小样本对比:30 题切面上的 3 分差距毫无意义——对比前看子集量。
- 解析规则差异对比:自家模型用宽松解析、竞品用官方解析——比出来的「领先」无效;对比双方必须同解析规则。
- 格式微调后的分数:给模型做了选项格式 SFT 再上榜——分数提升包含格式收益,与未做格式化的对比要声明。
§7.10 一个最小可用的评测报告模板
## 模型 X 在 GMAI-MMBench 上的评测报告(模板)
- 口径:GMAI-MMBench_VAL 全量(26K 题)/ VLMEvalKit <版本> / numpy 1.26.4
- 总分:<acc>%(官方 leaderboard 同类参照:<model> <acc>%)
- 解析规则:官方默认(敏感性分析:自定义规则差异 <±0.5%)
- 切面:
- 粒度:image <a>% / box <b>% / mask <c>% / contour <d>%(各切面 n=…)
- 科室:最强 <dept> <a>%;最弱 <dept> <b>%(n=…)
- 任务:severity/attribute/…(n=…)
- 五不足画像:感知错误率约 <x>%;拒答率 <y>%;box 盲区差值 <z> 分
- 局限:VAL 切片分析,Test 分待官方;未覆盖生成/多轮/时序
- 下一步:box 级区域数据混入微调(预期动作与切面对应)
- 模板价值:十行结构强制产出切面+归因+下一步——评测报告的信息密度比分数本身重要。
§7.11 常见失败案例复盘
案例一:全量跑完,解析全错
某团队跳过冒烟直接全量 26K 推理,API 模型输出自由文本、官方解析抽不出选项,总分 8%——几天的 API 账单换来一个无效分数。
- 根因:没做抽样冒烟 + 未先在 VAL 小子集验证解析。
- 对策:任何模型先跑 500 题冒烟并人工目检 20 条输出;解析策略验证后再放全量(§5.2)。
案例二:切面「逆袭」的幻觉
某模型在「某科室×某任务」小切面 55%,远超 GPT-4o 同切面——团队据此宣称「专科超越 GPT-4o」。复核发现该切面 n=42,且 55% 的置信区间横跨 40-70%。
- 根因:小样本切面无统计力;未报子集量。
- 对策:切面结论强制 n≥50;论文写法加置信区间或抽样误差说明(§6.12 坑点 8)。
案例三:环境迁移后分数漂移 3 分
同一模型、同一数据,新集群复现分数比原集群低 3 个点。排查发现新环境 numpy 2.x,数据加载走了降级路径,图像解码缩略策略不同。
- 根因:环境漂移——版本钉控只在原环境做过。
- 对策:环境即代码(requirements 冻结 + 容器镜像),跨集群用同一镜像(§4.9 清单第 1 项)。
案例四:TEST 邮件评测的口径乌龙
团队邮件提交 TEST 推理结果时附的是 Val 口径模型(做了 VAL 切片调参的版本),官方 Test 分回榜后明显低于同行的 Test/Val 关系预期,审稿人质疑过拟合。
- 根因:Val 调参版与提交版混淆——版本管理缺失。
- 对策:VAL 调试与 TEST 提交用同一不可变版本快照(git tag + 权重哈希记录在评测报告)。
案例五:「背卷」嫌疑的公关事故
某发布模型 GMAI-MMBench 分数异常亮眼,社区用无图试探发现其接近纯文本也能答对大半——泄漏指控直接打掉发布节奏。
-
根因:训练数据混入基准转载(HF 镜像站转载链)。
-
对策:发布前自查语料时序与转载链;无图试探(§5.9)纳入发布检查单。
-
复盘的公共价值:五类事故覆盖环境、统计、口径、版本、泄漏——把这一节当团队 onboarding 材料读一遍,比新人自己踩一遍便宜一个数量级。
§7.12 与内部自建评测集的关系
- 自建集的不可替代性:院内 PACS 真实分布、自家产品交互形态、专属病种谱——这些 GMAI-MMBench 都测不了;自建 300-1000 题的「影子卷」是产品评测的必需品。
- 基准的锚定作用:自建集没有「标准答案对照系」——先在 GMAI-MMBench 上证明评测管线与官方一致(复现榜单一模型),再把同一管线用于自建集,自建集分数才有「可比性锚点」。
- 联合报告格式:对外报告「GMAI-MMBench 总分+切面」(可比性)+「自建集分数」(相关性)双栏——只报自建分是自说自话,只报基准分是隔靴搔痒。
- 影子卷的防泄漏:自建题也会随产品迭代被模型「间接见过」(微调数据近亲)——定期换题 + 保留盲测题池,与基准的泄漏治理同构。
§8 许可与伦理
§8.1 许可架构:继承式许可的现实
- 核心事实:GMAI-MMBench 官方未发布统一的再许可声明——数据集卡与 README 以 Disclaimers 形式声明:标注者严守各源数据集的版权与许可规则、不含禁止复制转载来源、发现侵权样本可联系移除。
- 继承的含义:使用者的权利边界 = 284 个源数据集许可的交集——CC BY、CC BY-NC、研究专用许可等各类条款并存;任何「基准整体可用作 X」的判断都要先问「最严格的那批源允许 X 吗」。
- 实操三层核查:①用基准做内部评测——绝大多数源许可覆盖,风险低;②对外发布基于基准的分数与论文——学术使用普遍覆盖;③再分发衍生数据/商用产品——必须逐源核查,尤其医院子集与 NC(非商业)条款源。
- 与单源数据集的差异:panda、radgraph 这类单源数据集读一份许可即可;GMAI-MMBench 的许可尽调是「清单工程」——尽调成本随用途升级而升级,预算时要把这一项算进去。
§8.2 医院数据子集的伦理专项
- 伦理批准链条:16 个医院源数据集各自经对应机构伦理委员会批准后共享给基准构建——链条的每一环都在源机构,使用者是链条末端的受益者而非签署方。
- 二次识别禁止:医学图像脱敏(burned-in annotation 清除)在源头完成——使用者不得尝试从图像/元数据反推患者身份,也不得将医院子集题目与外部数据拼接试图「还原」原始数据。
- 敏感用途的额外审慎:以医院子集切面训练或评测的产品,若面向真实临床,需独立通过本院伦理与合规流程——基准的伦理批准不随数据「传递」到下游用途。
- 追溯请求的处理:若某医院源要求下架其题目——官方 Disclaimers 的移除机制意味着基准是「活文档」,引用旧版分数时留意版本对应关系。
§8.3 评测使用的正当性边界
- 不得入训练:26K 题进入任何训练流程(预训练/微调/RLHF 偏好对)都破坏基准公信力——TEST 无答案的制度设计挡不住 VAL 被滥用,自律是唯一防线。
- 不得反向工程 TEST:通过邮件评测系统探测答案钥(构造题目组合试探)是明确的越界行为——一旦被识别将失去社区信任且可能被官方列入黑名单。
- 分数宣传的诚实义务:引用切面高分时同步给出总分与切面子集量——「某科室 80% 正确率」若总分只有 35%,选择性宣传就是误导。
- 基准竞赛礼仪:提交官方榜单的分数须可复现(模型可获取或可申请)——不可复现的「神秘高分」对社区是负资产。
§8.4 临床安全红线
- 基准分数≠临床安全:GMAI-MMBench 60% 的模型与 50% 的模型都不可直接用于无人监督的临床决策——分数衡量能力分布,不衡量部署安全性。
- 感知错误的不可兜底性:五大不足中的感知错误(看错图)在选择题里表现为扣分,在临床里表现为漏诊误诊——高风险场景的产品化需要独立的临床验证(前瞻性、金标准对照),而非基准分数外推。
- 拒答与过度信任的双向风险:模型拒答(保守侧)与模型自信出错(危险侧)都被基准部分测量——产品设计的焦点应是「不确定时的移交机制」,而不是追求拒答率为零。
- 对患者的沟通义务:若产品以 GMAI-MMBench 等基准分数对外宣传,必须避免让患者产生「通过考试=可诊断」的理解——考试分数的患者侧沟通是合规审查的新兴关注点。
§8.5 数据出境与本地合规
- 获取渠道的合规选择:境内机构优先 OpenDataLab 镜像——同时遵守镜像平台与 HF 原渠道各自的用户协议。
- 医院子集的地域属性:医院数据源可能受源机构所在地的数据法规约束——跨境团队使用前向法务确认,不要默认「已公开=无地域限制」。
- 日志与产物:评测产生的推理日志可能包含题目图像内容——作为「衍生数据」对待,其存储与再分发遵循与原数据同级的许可审慎。
§8.6 许可尽调清单(商用/再分发前)
-
[ ] 明确用途分级:内部评测 / 学术发表 / 衍生数据再分发 / 商业产品
-
[ ] 从论文补充材料取得 284 源清单
-
[ ] 逐源核查许可条款,标注 NC/ND/研究专用等限制级别
-
[ ] 医院子集(16 源)单独列表并按最高审慎处理
-
[ ] 用途与最严格限制源冲突时——剔除相关题目行或改造产品数据源
-
[ ] 法务复核后留档核查记录(版本、日期、结论)
-
[ ] 对外分发物中保留源数据集的引用与声明链
-
清单定位:这份清单的成本集中在第一次——建立「源-许可-用途」台账后,后续版本跟进是增量维护;把它当成接入基准的一次性基建投入。
§8.7 学术诚信声明模板(论文/报告可直接引用)
## 基准使用声明(模板)
- 本工作使用 GMAI-MMBench(arXiv:2408.03361;NeurIPS 2024 D&B Track)
进行评测,数据口径对齐 arXiv v7(284 源数据集/38 模态/约 26K 题)。
- 评测协议:VLMEvalKit <版本>,numpy 1.26.4,图像解码与 answer
extraction 采用官方实现;自定义解析的差异已做敏感性分析(<±0.5%)。
- 分数口径:<VAL 本地评测 / TEST 官方邮件评测(提交日期与回榜快照)>;
Val 与 Test 分数未混排。
- 隔离声明:本工作未将 GMAI-MMBench 任何题目纳入训练/微调/偏好对齐
流程;模型训练数据截止 <日期>,未包含基准转载内容的已知风险已自查。
- 评测对象模型:<版本号/权重哈希/API 快照日期>。
- 局限声明:本评测覆盖静态图像选择题判读,不覆盖开放式生成、多轮
对话、时序判读与真实临床决策能力。
- 模板的意义:一页声明把口径、隔离、版本、局限四件事固化——审稿与合规两个场景都能直接复用;这页纸的边际成本五分钟,堵住的质疑量级是整轮返工。
§9 相关数据集与生态对照
§9.1 医疗 VQA 谱系速览
| 基准 | 年份 | 题量 | 域 | 粒度 | 与 GMAI-MMBench 的关系 |
|---|---|---|---|---|---|
| VQA-RAD | 2018 | 3,515 | 胸片 | image | 单域前身,题入 GMAI 源池谱系 |
| PathVQA | 2021 | 32.8K | 病理 | image | 病理单域对照 |
| SLAKE | 2022 | 12.8K | 胸片(双语) | image | 带解剖标注的对照 |
| OmniMedVQA | 2024 | ~11.6K | 12 源 | image | 同代汇总卷,规模与组织较浅 |
| GMAI-MMBench | 2024 | ~26K | 284 源/38 模态 | 四级 | 本文主角 |
- 谱系读法:代际演进的主轴是「覆盖×组织」——GMAI-MMBench 是当前两条轴的极值点;但单域基准并未过时,深度 debugging 仍需要小而纯的域内卷。
§9.2 源域数据集在本库的落点
- panda(前列腺病理 WSI):病理族源域代表——GMAI-MMBench 以切片/区域形态吸收病理域;panda 篇的 ISUP 分级知识与「严重程度分级」任务直接相关。
- radgraph(放射报告抽取):GMAI-MMBench 测「看图判读」,radgraph 测「报告结构化」——同一份放射工作流的两半;报告生成产品的评测要两个都用。
- chest-imagenome(胸片解剖区域标注):区域级标注生态的代表——box/mask/contour 粒度的「上游供给侧」,理解区域标注数据如何喂出区域理解能力。
- umls/loinc(术语与检验标识):知识缺失短板的治理基础设施——医学概念归一与检查标识标准化是 RAG 与知识注入的底座。
- vqa-rad/pathvqa(医疗 VQA 单域基准):与 GMAI-MMBench 并列使用的单域对照卷——域内深挖与全科排查互补。
§9.3 通用多模态基准对照
- MMT-Bench(2024):通用多任务多模态基准——测泛能力;医疗域用 GMAI-MMBench。两列并列是医疗 LVLM 论文的完整画法。
- MMBench 系:GMAI-MMBench 与 MMBench 同属 VLMEvalKit 生态与上海 AI Lab 谱系——数据格式与评测协议同构,迁移成本低。
- 领域基准家族化趋势:GMAI-MMBench 的「多源汇总+组织结构+多粒度」模式正在被其他领域复制(法律、金融)——它不只是医疗基准,也是领域基准的方法学样板。
§9.4 选型决策树
需要评测医疗 LVLM?
├─ 只要一个总分快速冒烟 → OmniMedVQA(体量小)或 GMAI-MMBench_VAL 抽样
├─ 论文主表/完整画像 → GMAI-MMBench(总分+粒度切面+科室切面)
│ └─ 需要 Test 分 → 官方邮件评测,预留缓冲
├─ 域内深度 debugging → 单域基准(VQA-RAD/PathVQA/SLAKE)
├─ 区域交互能力专项 → GMAI-MMBench box/mask/contour 切面
│ └─ 训练侧缺区域数据 → 源域区域标注集(如 chest-imagenome)
└─ 报告生成/结构化 → 非选择题体系(F1RadGraph、RadGraph schema)
- 决策树要点:GMAI-MMBench 是「医疗 LVLM 评测的中枢」而非全部——沿树找到自己真正需要的层,比全量刷所有基准更有信息量。
§9.5 使用组合的现实模板
- 医疗 LVLM 创业团队:GMAI-MMBench(定位)+ 自建科室小卷(验收)+ radgraph/F1RadGraph(若涉报告生成)。
- 医院信息科:科室切面小卷(选型)+ 季度回归(升级监控)——不必碰 TEST 邮件流程。
- 学术评测研究:VAL 全量 + 切面方法学实验(§7.6)+ 泄漏检测协议(§5.9)。
- 模型厂商:§6.11 七步序列全流程 + leaderboard 提交(Test)——把基准接入 CI,每次发版出一份 §7.10 模板报告。
§9.6 术语表
| 术语 | 全称/原文 | 释义 |
|---|---|---|
| GMAI | General Medical AI | 通用医疗 AI——不限于单一科室/任务的医疗人工智能形态 |
| LVLM | Large Vision-Language Model | 大型视觉语言模型——图像+文本混合输入、文本输出的通用模型 |
| VQA | Visual Question Answering | 视觉问答——给定图像与问题输出答案的任务形态 |
| MCQ | Multiple-Choice Question | 多项选择题——本基准的基本题型(含单选与多选) |
| lexical tree | 词法树 | 官方对模态/任务/科室/粒度标签的树形组织,即自定义评测的查询接口 |
| image-level | 图像级 | 感知粒度第一级——整图输入的问答 |
| box-level | 框级 | 感知粒度第二级——矩形区域指称的问答(官方发现的一致性最弱项) |
| mask-level | 掩码级 | 感知粒度第三级——像素级高亮区域指称的问答 |
| contour-level | 轮廓级 | 感知粒度第四级——边界轮廓形态指称的问答 |
| VAL | Validation split | 带答案的官方划分——本地评测与切面分析主用 |
| TEST | Test split | 无答案的官方划分——邮件官方评测、更新 leaderboard |
| VLMEvalKit | open-compass 的多模态评测框架 | 本基准的官方评测载体,内置 data 名 |
| Base64 | — | 图像内嵌 TSV 的编码方式(cv2 PNG 编码后转 Base64) |
| answer extraction | 答案抽取 | 从模型自由文本输出中抽取选项字母的解析环节——分数的隐形放大器 |
| per-task | 按任务聚合 | 官方两种评分口径之一——衡量能力维度 |
| per-data | 按源数据集聚合 | 官方两种评分口径之二——暴露源间偏移 |
| Random baseline | 随机基线 | Val 25.70/Test 25.94——无信息作答的对率参照 |
| data leakage | 数据泄漏 | 基准题进入训练数据或题目可脱离图像作答的失效模式 |
| Goodhart’s law | 古德哈特定律 | 「当测量成为目标,它就不再是好的测量」——基准过拟合的理论根源 |
| D&B Track | Datasets and Benchmarks Track | NeurIPS 的数据集与基准赛道——本基准的发表场地 |
| OpenDataLab | — | 上海人工智能实验室的数据平台——本基准的境内镜像渠道 |
| per-source bias | 源间偏置 | 284 源标注风格与难度不均匀带来的切面分数波动 |
| RAG | Retrieval-Augmented Generation | 检索增强生成——知识缺失短板的部署侧缓解手段 |
| answer key | 答案钥 | TEST 集的官方答案——仅官方持有,用于邮件评测计分 |
- 用法:团队 wiki/新人手册可直接引用本表;术语翻译以本表为准,避免「框级/边界级/包围盒级」混译造成沟通成本。
- 维护:术语表随官方口径更新(新粒度、新协议术语出现时增补),保持与本文其他章节引用一致。
(全文完;本文共 §0-§10 十一个章节,规模数字以 arXiv v7 与官方 GitHub leaderboard 口径为准,发表年 2024。)
§10 参考、引用与 FAQ
§10.1 官方资源导航
- 论文:arXiv:2408.03361(v7,2024-10-21)——数字口径的最终依据。
- 官网主页:uni-medical.github.io/GMAI-MMBench.github.io——概览、统计图与示例。
- 数据(HuggingFace):huggingface.co/datasets/OpenGVLab/GMAI-MMBench——VAL/TEST TSV 下载。
- 数据(OpenDataLab):opendatalab.com/GMAI/MMBench——境内镜像。
- 代码与榜单:github.com/uni-medical/GMAI-MMBench——快速上手、Disclaimers、leaderboard、NeurIPS 接收公告。
- 评测框架:github.com/open-compass/VLMEvalKit——内置 GMAI-MMBench_VAL/TEST data 名。
- 联系:jin.ye@monash.edu(Jin Ye)/ hejunjun@pjlab.org.cn(Junjun He)/ qiaoyu@pjlab.org.cn(Yu Qiao);TEST 评测邮箱 guoanwang971@gmail.com(README 载明,邮件须附模型名/队名/arXiv 链接)。
§10.2 学术引用
- Chen P, Ye J, Wang G, et al. GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI. arXiv:2408.03361, 2024.(NeurIPS 2024 Datasets & Benchmarks Track)
- Duan H, et al. VLMEvalKit: Towards Open-Source Toolkit for Evaluating Large Multi-Modality Models. arXiv:2407.11691, 2024.(评测框架)
- Lu P, et al.(通用多模态基准方法论脉络)MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI. arXiv:2404.16006, 2024.(对照系)
- Hu X, et al. OmniMedVQA: A Massive Multi-Dataset Benchmark for Medical Visual Question Answering. CVPR 2024.(同代对照基准)
§10.3 站内互链
- vqa-rad:医疗 VQA 谱系第一代的单域对照
- pathvqa:病理域单基准对照
- panda:病理族源域与 ISUP 分级知识
- radgraph:放射报告结构化的另一半评测体系
- chest-imagenome:区域级标注供给侧
- umls:知识注入的概念归一底座
- loinc:检查标识标准化参照
- aact:NLM 临床数据结构化实践参照
- mimic-cxr:放射报告与图像联动的源库语境
- chexpert:胸片多标签域的粒度标注参照
§10.4 建议引用格式
@inproceedings{chen2024gmaimmbench,
title = {GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI},
author = {Chen, Pengcheng and Ye, Jin and Wang, Guoan and Li, Yanjun and Deng, Zhongying and Li, Wei and Li, Tianbin and Duan, Haodong and Huang, Ziyan and Su, Yanzhou and Wang, Benyou and Zhang, Shaoting and Fu, Bin and Cai, Jianfei and Zhuang, Bohan and Seibel, Eric J and He, Junjun and Qiao, Yu},
booktitle = {Advances in Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks Track},
year = {2024},
note = {arXiv:2408.03361}
}
§10.5 常见问题 FAQ
Q1:约 26K 题能用来训练我的医疗模型吗?
A:不建议且违背官方意图——它是评测基准,26K 题入训练既污染基准公信力(自己的分数失去意义),题量对训练也是杯水车薪。要医疗多模态训练数据,去源数据集层面(论文补充材料有 284 源清单)找原始数据。
Q2:为什么我算的 TEST 分数和官方不一样/算不了?
A:TEST 无 answer 列——本地算不了是设计;把推理导出的中间 Excel 邮件官方(附模型名/队名/arXiv 链接)由官方评测更新榜。想本地反复算,用 VAL。
Q3:GPT-4o 到底是 53.53% 还是 53.96%?
A:都对——53.53% 是 Val、53.96% 是 Test(官方 leaderboard 双列)。arXiv v1 摘要还有个约 52% 的早期口径。引用时注明列名与版本,别裸写一个百分数。
Q4:医疗专用模型为什么比通用模型分还低?有的低于随机?
A:三个原因叠加——①输出不遵循选项格式,answer extraction 抽不出选项(低于随机的主因,RadFM/LLaVA-Med/Med-Flamingo 典型);②指令微调损伤了通用视觉对齐;③训练分布窄于 38 模态全卷。先做格式适配再评,归因才干净。
Q5:box 级为什么反而比 image 级差?框不是提示吗?
A:官方评测发现 box 级一致最差——当前 LVLM 训练分布里区域级监督稀疏,画框对模型不是提示而是「新元素」。这正是基准最有价值的发现之一:指明了区域级指令数据这条施工方向。
Q6:可以直接用 VLMEvalKit 之外的自写脚本评吗?
A:可以但要自担一致性风险——图像解码(RGBA/P 转 RGB、缩略策略)、多选题计分、answer extraction 三处与官方实现不一致都会移动分数。自写脚本的分数建议标注「非官方协议」,或先复现一个官方榜单模型校准。
Q7:284 个源数据集各自的许可是什么?我能商用吗?
A:官方无统一再许可声明,权利边界=284 源许可的交集——商用/再分发前按 §8.6 清单逐源尽调(论文补充材料有清单),医院子集(16 源)按最高审慎处理。内部评测与学术发表普遍覆盖。
Q8:题目会泄漏进模型预训练语料吗?官方怎么防?
A:官方管线在设计上保证「无图不可答」(纯文本推理答不出),并以 TEST 答案保密作制度缓冲;但 VAL 题目文本/图像本身公开——模型训练数据截止晚于 2024-08 的,报告分数时应自查语料是否含转载,用 §5.9 的无图试探法验证。
Q9:Val 上调过解析规则后,Val 分数还有效吗?
A:有效但要诚实披露——在 VAL 上迭代 answer extraction 是官方给 VAL 的用途之一;规则确定后应固定并全文统一,且给出两套解析的敏感性差异。危险动作是「按 VAL 逐题调规则再报 VAL 分」,那等于把 VAL 用成了训练集。
Q10:我想评自己医院场景,官方切面不够细怎么办?
A:lexical tree 支持自定义切面导出——按「科室×任务×粒度」抽小子集;再往下细分(如按源数据集、按病灶类型)需要自建元数据标注,用 §4.7 的解码配方把 VAL 还原成图像+manifest 后自由加工,注意对外分发时的许可核查。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- reflacx-xray-localization — 共享标签:多模态 / 医学影像 / 医疗NLP
- radvlm-instruction-dataset — 共享标签:多模态 / 医学影像 / 医疗NLP
- radialog-instruct-dataset — 共享标签:多模态 / 医学影像 / 医疗NLP
- reg2026 — 共享标签:多模态 / 医学影像 / 医疗NLP
- vqa-rad — 共享标签:医学影像 / 医疗NLP
- ehrxqa — 共享标签:多模态 / 医学问答与基准
- ms-cxr-t — 共享标签:多模态 / 医学影像 / 医疗NLP
- i2b2-n2c2-nlp — 共享标签:医学问答与基准 / 医疗NLP
- mimic-cxr — 共享标签:多模态 / 医学影像
- open-pmc — 共享标签:多模态 / 医疗NLP
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

