ReXVQA — 大规模胸片视觉问答基准 AI-Ready Wikipedia

约 69.5 万道四选一胸片 MCQ · 16 万检查 · 五技能框架

来源 Rajpurkar Lab, Harvard Medical School(合作:Saama AI Research、Seoul National University) url: https://huggingface.co/datasets/rajpurkarlab/ReXVQA发布时间: 2026-09-30最后更新: 2026-09-30 阅读 10
ReXVQA — 大规模胸片视觉问答基准 AI-Ready Wikipedia

信息速览

数据集名称ReXVQA — 大规模胸片视觉问答基准 AI-Ready Wikipedia
数据类型约 69.5 万道四选一 MCQ,160,000 项胸片检查(上游),3 个 JSON 共约 1.58GB,五技能分类标注,三级难度标注,非商业许可
规模约 10.9 万名患者(上游 ReXGradient-160K 口径 109,487)
接入方式Rajpurkar Lab, Harvard Medical School(合作:Saama AI Research、Seoul National University) url: https://huggingface.co/datasets/rajpurkarlab/ReXVQA
AI 就绪度

ReXVQA — 大规模胸片视觉问答基准 AI-Ready Wikipedia


INFOBOX

数据集名称 ReXVQA
英文全称 ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding
别名/简称 ReXVQA(注意与上游图像源 ReXGradient-160K、排行榜 ReXrank 是三个不同的东西,见 §8.1)
疾病分类 胸部影像全疾病谱(ICD-11:CA4Z 肺炎 / CB27 胸腔积液 / CB4Z 心力衰竭 / 1B2Z 肺结核等,详见 §2.1)
SNOMED CT 233604007 Pneumonia / 15485004 Pleural effusion / 84114007 Heart failure / 300936004 Ischemic heart disease(详见 §2.1)
数据模态 胸部 X 光影像(上游 PNG)+ 英文 MCQ 问答对(四选项 + 解释)
AI 任务类型 医学视觉问答(VQA)、多模态医学知识评测、读片技能画像、人类对照评测
样本总数 论文口径约 695,663 道 MCQ / 160,000 项检查(上游);HF README 口径 653,834 道(公开+私有加总 599,919,四口径存照见坑 2 与附录 I)
数据大小 约 1.58GB(3 个 JSON 实测:1,388,369,965 B + 97,501,862 B + 98,707,686 B);图像本体在上游仓库
数据格式 JSON(问答对);图像为上游 16-bit PNG(DICOM 降采样至原图 25%)
许可证 ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1(HF license: other / license_name: rexgradient)
访问级别 申请审核(HuggingFace gated:签署非商业协议;协议受马萨诸塞州法管辖)
DUO 标签 NPUNCU(非商业非营利);图像与报告本体在上游,DUO 语义由上游协议承载
语言 题干与选项为英文
首发日期 2025-06-04(arXiv v1 论文随附发布;数据卡 News 显示 2024-11-14 已有一轮样本修订,见坑 8)
最后更新 2025-06(arXiv v2 修订);正式版发表于 Biocomputing/PSB 2026(DOI 10.1142/9789819824755_0018)
发布机构 Rajpurkar Lab(哈佛医学院)× Saama AI Research × 首尔国立大学
官方主页 https://huggingface.co/datasets/rajpurkarlab/ReXVQA
下载地址 https://huggingface.co/datasets/rajpurkarlab/ReXVQA(gated,需先签署非商业协议;图像另赴 ReXGradient-160K)
DOI 10.48550/arXiv.2506.04353(预印本);正式版 10.1142/9789819824755_0018(PSB 2026,PMID 41758146)
引用次数 精确计数以 Google Scholar 页面为准(截至 2026-09 查询时点未采信具体数字;论文 2025-06 首发、PSB 2026 正式发表)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 官方 train/valid/test 三分 + 统一 JSON 格式 + 逐题难度与技能标签;扣分项:图像与问答分仓(需配合上游仓库)、gated 双重门、README 与论文数字口径分叉、无官方评测代码
页面状态 published

导语读法三则:

  1. 只想下数据:直奔 §6.2 获取流程——注意这里是"双重门"(HF 账号 + 签署协议),而且问答 JSON 里没有图像,必须同时拿上游 ReXGradient-160K 的胸片(JSON 与图像分仓,见 §3.3)。
  2. 关心数字口径:直奔坑 2(问题总数四口径,含 split 双口径)与附录 I 多口径登记表——论文说 695,663 道、README 说 653,834 道,两个都对,取决于你读哪份文档。
  3. 做模型评测:先读 §5.2 的 ReXrank 分工声明——公开测试集(40,826 或 34,889 道,视口径)与私有测试集(41,007 道)是两个集合,混用是审稿高危错误。

§0 E-E-A-T 信任声明与免责声明

审核声明:本条目由千方病案医数集编辑部于 2026-09-30 基于一手来源撰写与审核。核心事实经三源互证:arXiv 论文 HTML 正文(2506.04353v1)、HuggingFace 数据卡与仓库文件树实测(经 hf-mirror.com 镜像端点)、以及 World Scientific 会议版(Biocomputing/PSB 2026)出版记录。所有关键数字在正文标注出处;文档之间的数字冲突不在正文中强行统一,而是在坑点与附录 I 逐条存照。

医学免责声明:本条目为数据集技术文档,不构成临床建议。ReXVQA 的题目由大语言模型从放射报告中自动生成,虽经校验器与专家审阅,但不应被视为放射科医生书写的教学金标准;任何基于本数据集训练或评测的模型,其输出均不得直接用于临床诊断决策。数据许可明确禁止商业用途与临床用途。

数据免责声明:本条目所述数据以发布时点的官方仓库状态为准(抓取时点 2026-09-30)。HuggingFace 数据卡与论文存在多处数字口径差异(问题总数、split 规模、health systems 数量),本条目以"论文口径"与"README 口径"双轨陈述,检索者引用任何数字前应先核对附录 I 的口径登记表。

AI 参与声明:本条目由 AI 辅助起草并经人工校验(详见 §10 AI 使用声明卡)。

§1 数据集概览

§1.0 30 秒速览

  • 一句话:ReXVQA 把 16 万份胸片检查的真实放射报告,用 GPT-4o 转成了约 69.5 万道仿 USMLE(美国执业医师考试)风格的四选一选择题,把"胸片理解"变成了一场可以打分的大考。
  • 谁出的:哈佛医学院 Rajpurkar 实验室(Pranav Rajpurkar 组)+ Saama AI Research + 首尔国立大学,8 位作者。
  • 考什么:五类放射读片核心技能——presence(病灶存在性,36.1%)、negation(否定性,36.5%)、differential diagnosis(鉴别诊断,20.9%)、location & distribution(定位与分布,约 6%)、geometric information(几何信息,不足 0.5%)。
  • 结果如何:MedGemma-4B-it 在 8 个开源多模态模型中以 83.24% 总体准确率居首,并在 200 例人类对照研究中首次超越 3 名放射科住院医(83.84% vs 77.27%)。
  • 怎么拿:HuggingFace gated 仓库(签署非商业协议),3 个 JSON 共约 1.58GB;胸片图像在另一个仓库(上游 ReXGradient-160K,同协议)。
  • 三个数字陷阱:问题总数四口径、split 双口径、health systems 3 vs 4——全部存照于 §10 与附录 I。

§1.1 技术摘要

ReXVQA(读作"ReX-V-Q-A",Re 前缀承自同实验室的 ReXGradient 与 ReXrank 系列)是一个基准型医学视觉问答(VQA)数据集。它的技术路线是"生成式评测集":不从零标注,而是复用同实验室 2025 年 5 月发布的 ReXGradient-160K 胸片-报告配对库,把其中每份报告交给 GPT-4o(2024-05-01-preview,Azure OpenAI API)做两阶段转换——先把报告转成结构化要点,再按专用医学题式模板生成四选项 MCQ(question stem + 4 options + 正确索引 y∈{0,1,2,3} + 解释 E),生成过程由解剖学分类体系(呼吸/心血管/医疗器械/肌骨等)引导以保证覆盖面。

质控流水线分三层:4 个结构校验器(JSON 结构、数据类型、格式、完整性)做格式把关;3 个内容校验器(难度分类、多样性、内容)做语义把关;最后由专家完成难度三级(easy/medium/hard)终审与抽检。所有通过校验的题目按约 92%/6%/6% 的比例切分为训练/验证/公开测试三部分(论文口径),另有 41,007 道私有测试题不随仓库发布,专供 ReXrank 排行榜在线评测。

评估侧的意义在于给"通用ist 胸片理解"定锚:论文系统评测 8 个开源多模态模型(含医疗特调的 MedGemma-4B-it 与通用模型 Gemini、Qwen2.5-VL 等),发现通用模型在 presence 类问题上与医疗特调模型差距最大(Gemini 62.17% vs MedGemma 85.21%),而医疗特调模型在 negation、鉴别诊断、定位上的优势同样显著。人类对照研究(3 名放射科住院医 × 200 例)中 MedGemma 83.84% vs 最佳住院医 77.27%,是"AI 在大规模胸片 MCQ 基准上超越人类住院医"的标志性结果。

§1.2 战略价值

  1. 规模断层:在此之前的医学 VQA 基准体量在 10^3–10^5 量级——VQA-RAD 3,515 题、PathVQA 约 5,000 题(论文口径 32,799 图文对)、PMC-VQA 约 21 万题但为二元封闭式、EHRXQA 依靠结构化电子病历查询模板合成。ReXVQA 以约 69.5 万道选择题一举把体量推到 10^6 边缘,且每题带解释与难度标签,支持按技能×难度二维切片评测。
  2. 技能框架可迁移:五技能分类(presence/negation/diff dx/location/geometric)源自对放射科读片认知任务的系统梳理(论文引用 VQA-RAD 的任务分类、Goryachev 等对 negation 临床重要性的研究), negation 与 presence 合计约 72% 的分布本身就是对"读片首先回答有/无"这一临床直觉的量化。这个框架后来被同系列工作复用,可作为其他影像模态 VQA 基准的设计模板。
  3. “报告驱动"而非"模板驱动”:论文明确把自身与既有 VQA 数据集的差异化定位为"问题源自真实临床报告而非人工模板或通用图像标注"。报告四段结构(Indication/Comparison/Findings/Impression)保留了临床语境,题目天然带"检查指征与前后对比"信息,这是 MIMIC-CXR-VQA 类结构化标签法覆盖不到的。
  4. 排行榜闭环:私有测试集挂接 ReXrank(rexrank.ai),形成"公开集自测 + 私有集防过拟合刷榜"的两级评测体系,与 ReXGradient-160K(预训练语料)、ReXErr-v1(报告错误标注)构成同实验室的胸片 AI 评测全家桶。

§1.3 同类数据集横向对比

数据集 年份 规模 题型 图像源 标注方式 库内条目
VQA-RAD 2018 3,515 题 开放+封闭混合 315 张胸片 医生人工 vqa-rad(240)
SLAKE 2021 28,398 题 开放+封闭 10,282 张多模态影像 医生双语标注 slake
VQA-MED 2019 起 年度挑战赛制 开放+封闭 每届数千张 医生+众包 vqa-med(280)
PathVQA 2020 约 32,799 图文对/约 5,000 QA 口径 开放+封闭二元 病理切片 从教科书图文自动提取 pathvqa(260)
PMC-VQA 2023 约 21.5 万题 二元封闭式 PubMed 文献图 自动生成+人工校验 pmc-vqa(270)
OmniMedVQA 2024 约 11.8 万题聚合 选择题 12 个开源数据集聚合 聚合再标注 omnimedvqa(290)
EHRXQA 2023 约 4.3 万题 模板合成问答 MIMIC-CXR 结构化 EHR 查询模板合成 ehrxqa
ReXVQA 2025 约 69.5 万题(四口径) 四选项 MCQ+解释 ReXGradient-160K 胸片 GPT-4o 报告生成+校验器+专家审阅 本条目

读表三要点:第一,ReXVQA 的规模是 VQA-RAD 的约 200 倍,但单题信息密度更低(生成式 vs 人工精标)——两者不是替代关系而是互补关系,VQA-RAD 恰好被 ReXVQA 论文引用为任务分类框架的参照。第二,表中除 ReXVQA 与 EHRXQA 外均为人工标注或人工校验为主,"生成式基准"的代表是本条目与 EHRXQA 两条技术路线:前者从自由文本报告生成,后者从结构化数据库模板合成。第三,全表仅 SLAKE 提供双语,ReXVQA 为纯英文。

§1.4 版本时间轴

时点 事件 依据
2024-11-14 数据卡 News:“Dataset updated to remove biased samples and balance answer options”——早于论文半年,说明语料在发布前已迭代过至少一轮 HF README News 区
2025-05 上游 ReXGradient-160K 发布(arXiv:2505.00228),提供图像与报告底座 上游论文
2025-06-04 arXiv 2506.04353 v1 首发,ReXVQA 随论文发布(HF 仓库开通) arXiv
2025-06-06 arXiv v2 修订(v2 页面无正文文档,条目按 v1 存照) arXiv 版本记录
2025-04-07 数据许可协议版本落款(Non-Commercial Data Access and Use Agreement v.1) LICENSE 文件头部
2026-01 正式版发表于 Biocomputing/PSB 2026(World Scientific),DOI 10.1142/9789819824755_0018,PMID 41758146 World Scientific/PMID

注意两个反直觉的时间细节:其一,News 日期(2024-11)早于论文(2025-06),加上数据卡 YAML 沿用上游标题(坑 1),说明该数据卡是从 ReXGradient-160K 复制改造而来,News 区也是沿承痕迹;其二,LICENSE 协议落款(2025-04-07)早于论文发布两个月,说明发布流程在论文定稿前已走完法务。

§1.5 典型应用场景

  1. 医疗 VLM 能力画像:8 个模型 × 5 技能 × 3 难度的三维切片矩阵(§5.3),适合做模型选型与能力短板诊断——例如某模型 negation 得分高但 diff dx 低,提示其"看得到但推不动",应补充鉴别诊断类推理训练。
  2. 人类对照与教育研究:200 例人类对照子集 + 住院医成绩(77.27%)提供了医学教育场景的锚点,可用于住院医培训效果追踪或 AI 辅助教学设计(注意:题目为 AI 生成,教学使用需教师复核)。
  3. 医疗 MCQ 生成方法研究:两阶段生成 + 7 校验器 + 难度分级的流水线(§3.5)是"LLM 自动出题"的完整范本,可迁移到其他报告型临床文本。
  4. ReXrank 在线评测:不想本地搭评测环境的团队直接提交 ReXrank(§8.1),用 41,007 道私有测试题获得防过拟合的公开排名。
  5. 预训练+评测一体化管线:用上游 ReXGradient-160K 做视觉-语言预训练、用 ReXVQA 做能力评测,同源数据避免域漂移,是同实验室推荐的自洽闭环。

§2 医学背景

§2.1 ICD-11 与 SNOMED CT 映射

ReXVQA 的题目由解剖学分类体系(anatomy taxonomy)引导生成,覆盖呼吸系统、心血管系统、医疗器械、肌骨系统等胸片可显影范畴。与 ICD-11 及 SNOMED CT 的映射关系如下(映射为本条目整理,数据集本身不带 ICD-11 编码):

题目覆盖范畴 代表性发现 ICD-11 编码 SNOMED CT
呼吸系统-感染 肺炎、浸润影 CA40-Z 肺炎类 233604007 Pneumonia
呼吸系统-胸腔 胸腔积液、气胸 CB27 胸腔积液 / CB21 气胸 15485004 Pleural effusion / 36118008 Pneumothorax
心血管 心影增大、肺水肿、充血性心力衰竭 CB4Z 心力衰竭 / BA5Z 缺血性心脏病 84114007 Heart failure / 300936004 Ischemic heart disease
医疗器械 气管插管、中心静脉导管、起搏器、引流管 X 系列结局测量类(器械在位) 12564008 Endotracheal tube 等器械概念
肌骨 肋骨骨折、脊柱侧弯、肩关节术后 ND56 肋骨骨折等 283380008 Rib fracture
肿瘤性病变 肺结节、肿块、纵隔增宽 2A00-Z 肺部占位类 34456004 Pulmonary nodule

上表只列代表锚点,ReXVQA 的 category 字段(五技能)与 ICD-11 是正交的两个维度:前者描述"读片认知操作"(回答有/无/在哪里/最像什么),后者描述"临床实体"。检索者在做疾病分层评测时应从题干文本自行抽取疾病实体,不能直接复用 category 字段——这是本数据集与 ChestX-ray14 类"逐图贴病签"数据集在结构上的关键差异。

§2.2 疾病背景与流行病学

胸片是全世界影像量最大的检查之一,也是急诊与基层医疗机构的首选胸部检查。读片认知研究(论文引用 Goryachev 等 2007 年对放射报告否定句的研究)显示,放射报告中的否定表述(“no pneumothorax”“no evidence of consolidation”)出现频率极高,是报告的结构性组成——这也解释了 ReXVQA 五技能分布中 negation 占 36.5% 的现实来源:绝大多数胸片检查的结论是"阴性发现",把阴性发现问对、答对,本身就是读片能力的主要成分。

上游 ReXGradient-160K 的报告来自 79 家站点的常规诊疗(routine care),覆盖门诊随访、急诊、住院与床旁检查的全谱系,因此 ReXVQA 的疾病先验分布接近真实临床流量的分布——常见病(肺炎、心衰、胸腔积液、COPD 急性加重)占绝对多数,罕见病样本稀少。这意味着:在 ReXVQA 上评测的模型表现"贴近日常读片负荷",但不能由此推断罕见病读片能力;罕见病研究者应把本基准当作"基础盘"而非"全谱系"。

§2.3 临床任务定义:五技能框架

ReXVQA 把胸片读片拆解为五类可评测的认知技能,这是理解本数据集的钥匙(分布数字出自论文引言):

技能 英文 占比 认知操作 题目示例形态
存在性判断 presence 36.1% 回答"有没有某发现" “Is there evidence of pleural effusion?”
否定性判断 negation 36.5% 回答"是否确认某阴性发现" “Which finding is absent from the image?”
鉴别诊断 differential diagnosis 20.9% 多发现比较、最可能诊断推理 “What is the most likely diagnosis given…?”
定位与分布 location & distribution 约 6% 空间定位、单双侧、肺野分布 “Where is the consolidation located?”
几何信息 geometric information 不足 0.5% 大小、角度、管端位置测量 “Is the endotracheal tube tip above the carina?”

四个使用要点:

  1. 分布不均衡是特性不是缺陷:negation+presence 合计约 72%,忠实反映了放射报告的语言构成。做技能均衡评测时应按 category 字段分层抽样,而不是随机抽全量(全量结果会被两大类主导)。
  2. geometric 类样本稀少:不足 0.5%(按论文口径约 3,000 道以内)意味着该技能上任何模型对比都缺乏统计功效,论文自己也只在 Geometric Information Assessment 小节做参考性讨论(MedGemma 80.45%、Janus-Pro-7B 75.42%),不宜作为结论依据。
  3. 四选项 + 解释元组:与一般 VQA 的"开放生成"或"二选一"不同,ReXVQA 采用 USMLE 风格四选项(y∈{0,1,2,3}),且要求模型输出 (y, E)——正确选项索引加解释。这使评测可以同时考察答案正确性与解释合理性,是仿医学执照考试的判定范式。
  4. 难度三级:easy/medium/hard 由 LLM 初评、专家验证,支持"同技能不同难度"的稳健性分析。论文按难度分层报告了结果(见 §5.3)。

§2.4 患者人群构成

ReXVQA 本身不发布患者人口学数据;人群属性全部继承上游 ReXGradient-160K:

  • 规模:160,000 项检查 / 273,004 张图像 / 109,487 名患者 / 79 家医疗站点。
  • 患者级分布(HF README 口径,随问答对统计):训练 split 覆盖 95,299 名患者 / 138,993 项检查 / 237,127 张图像;验证 split 6,953 名患者;公开测试 split 6,801 名患者;私有测试 10,000 项检查。
  • 站点构成:79 家站点;README 与上游数据卡写"3 个美国医疗系统",论文引言写"four U.S. health systems"——两口径冲突存照于坑 4。
  • 检查类型:常规诊疗胸片(含床旁/AP 位),图像为 DICOM 转 16-bit PNG 并降采样至原图 25%。

需要特别强调的是患者与题目不是一对一:一份报告可生成多道题(平均每检查约 3.6–4.3 道,视口径),同一患者的多份报告也可能各自产题。官方 split 按"检查级"切分(README 统计了各 split 的 unique studies 与 patients,分母互斥),但检索者自行重切时若不按患者分桶,会出现同一患者跨集——这是 §5.3 泄漏风险的核心。

§2.5 临床价值定位

ReXVQA 在临床 AI 证据链中的位置是"能力测评层"而非"辅助决策层":

  1. 对模型开发者:它是目前规模最大、技能框架最完整的开源胸片 MCQ 基准,适合在模型发布前做能力画像与回归测试;但非商业协议禁止把评测结果作为商业宣称的直接依据(需另获授权)。
  2. 对临床科室:83.84% vs 77.27% 的人类对照结果说明,医疗特调 VLM 已能在"考试式"读片任务上超过住院医平均线——这为"AI 二读""住院医自测工具"等应用提供了量化依据,但距独立诊断仍有距离(题目是四选一,错误率被选项猜中率兜底在 25% 之下,与开放读片的难度不同质)。
  3. 对医学教育:难度三级 + 解释元组天然适合做题库。但必须注意题目为 AI 生成,教学引用前应由带教医师复核题干与答案(论文未披露全量专家逐题复核,见 §7.2)。
  4. 对政策与卫生经济研究:五技能框架提供了"AI 读片能力应按技能采购/认证"的讨论基础——一个 negation 满分的模型未必能做鉴别诊断,技能级报告比单一总分更能支撑分级准入决策。

§2.6 金标准描述:报告四段结构与题目生成语境

ReXVQA 没有传统意义的"金标准标注",其"真值"由上游报告承载。理解上游报告的四段结构(ReXGradient-160K 用 GPT-4o 辅助从自由文本抽取)是理解题目生成语境的前提:

段 内容 对题目生成的意义
Indication 检查指征 提供临床语境,常出现在题干的病例背景里
Comparison 与前片对比 生成"较前变化"类题目(含时间推理)
Findings 系统性发现描述 存在性/定位/几何题的主要事实来源
Impression 结论印象 鉴别诊断题与否定性结论的主要来源

对"金标准"的三层理解:

  1. 第一层(图像事实):胸片本体,来自上游 79 站点 DICOM,已去标识、16-bit PNG、降采样 25%——图像质量受上游处理决定,ReXVQA 不改写。
  2. 第二层(报告真值):放射医生的自由文本报告经 GPT-4o 结构化。报告本身是临床工作的真实产物(高保真),但四段划分是模型决策(有结构化噪声,上游论文承认非全量人工复核)。
  3. 第三层(题目真值):GPT-4o 从报告生成 MCQ,经 7 校验器 + 专家审阅。题目答案的正确性以报告为准——报告写错,题目跟着错;报告含糊,题目的"最可能诊断"就有解释空间。论文通过校验器压低此类噪声,但未提供端到端的错误率数字,这是引用本基准时应保留的不确定性。

一句话总结:ReXVQA 的真值链条是"报告→题目"的单向传递,它评测的是模型对报告所载临床事实的理解,而不是对图像的独立诊断能力——两者的差距正是生成式基准方法论的核心议题(见 §8.4)。

§3 数据集规格

§3.0 版本与获取渠道抉择矩阵

你的需求 应取的数据 渠道 许可动作
只做 VQA 模型评测(不想碰图像) 不成立——评测必须配图 ReXVQA(问答)+ ReXGradient-160K(图像) 两个仓库各签一次同款协议
完整复现论文评测(8 模型 × 5 技能) ReXVQA 公开三分 + 上游图像 两仓库 + 本条目 §6 代码 同上
提交排行榜 只需推理端点/预测文件 ReXrank(rexrank.ai)在线提交 遵守 ReXrank 条款
只想读题研究 MCQ 生成方法 ReXVQA JSON 即可 ReXVQA gated 仓库 签署协议
商业用途 需另行授权 联系 Gradient Health / 数据卡邮箱 单独商业许可
引用数字写论文 论文 + 数据卡双口径核对 arXiv 2506.04353 + HF README 按坑 2/4/7 声明口径

§3.1 模态详情

  • 图像模态(上游承载):胸部 X 光,DICOM 原始采集经光度反转(MONOCHROME1)、16-bit 最小-最大归一化、cubic 插值降采样至原图 25% 后存储为 PNG;含 PA/AP/LAT 多视角与床旁片。
  • 文本模态(本仓库承载):每道 MCQ 含英文题干(question)、四个选项(options)、正确索引(answer,y∈{0,1,2,3})、解释(explanation)、难度(difficulty:easy/medium/hard)与技能类目(category:五类之一)。字段语义按论文 §3.3 与数据卡描述整理;因 gated 限制,本条目撰写时点未能对 JSON 原始文件采样核实(存照见坑 6 与附录 N)。
  • 关系结构:题目→报告→检查→患者→图像的多级外键。本仓库的 JSON 未随附图像路径文件(上游 metadata 才有),检索者需自行按 study/image 标识对齐两侧仓库。

§3.2 按子集样本数

论文口径(主口径,splits 加总 695,663):

Split 题目数 占比
Training 572,952 82.4%
Validation 40,878 5.9%
Public Test 40,826 5.9%
Private Test(ReXrank 专用) 41,007 5.9%
合计 695,663 100%

HF README 口径(数据卡,公开 JSON 加总 599,919):

Split QA pairs Studies Images Patients
Training 489,523 138,993 237,127 95,299
Validation 34,500 9,901 16,837 6,953
Public Test 34,889 9,957 16,937 6,801
Private Test 41,007 10,000 — —
合计 599,919 168,851 — —

两口径的差异与归因见坑 2 与附录 I。简言之:README 数字合计(599,919)比论文(695,663)少约 9.6 万道,且数据卡 News 记录 2024-11-14"移除偏倚样本"——最合理的解释是数据卡落后于论文的最终生成池。复现论文用论文口径,检查仓库文件用 README 口径。

§3.3 数据格式

仓库 metadata/ 目录实测文件清单(hf-mirror tree API,2026-09-30):

metadata/
├── train_vqa_data.json    1,388,369,965 B(约 1.29 GiB,LFS)
├── valid_vqa_data.json       97,501,862 B(约 93 MiB,LFS)
└── test_vqa_data.json        98,707,686 B(约 94 MiB,LFS)
  • 三个 JSON 文件均为 LFS 对象,合计 1,583,579,513 字节(约 1.58GB / 1.47 GiB)。
  • 仓库另有 README.md(数据卡)与 LICENSE(协议全文,11,359 字节实测)。
  • 图像文件不在本仓库——README 明示 PNG 存于 ReXGradient-160K 仓库;本仓库 configs 段引用的 metadata/{train,valid,test}_metadata.csv 在文件树中不存在(沿承上游数据卡的复制痕迹,坑 3)。
  • 数据卡 configs 声称 train/test 配置指向本仓库文件树中不存在的路径;实际可用的就是上述三个 JSON。

§3.4 存储大小

项 大小 说明
问答语料(本仓库) 约 1.58GB 3 JSON,上表实测字节
上游图像(另下) 上游未披露总体积 273,004 张 16-bit PNG(降采样 25%)
完整评测环境 建议预留 ≥50GB 图像 + 解压缓冲 + 模型权重(8 模型并行评测另计)

注意 JSON 的加载效率:train 文件 1.29 GiB 用 json.load 全量载入内存峰值约 4–8GB(Python 对象膨胀),16GB 内存以下机器建议用流式解析或先转换为 Parquet(§6.3 提供转换代码)。

§3.5 标注方式

生成式标注流水线全貌(论文 §3):

ReXGradient-160K 放射报告(160,000 份,英文自由文本)
        │
        ▼  阶段一:报告结构化
GPT-4o (2024-05-01-preview, Azure OpenAI API)
把报告转成结构化 bullet points(要点化,去口语冗余)
        │
        ▼  阶段二:MCQ 生成
专用 medical prompt template 生成四选项 MCQ
  ├── 解剖 taxonomy 引导(呼吸/心血管/器械/肌骨…)
  ├── 五技能分配(presence/negation/diff dx/location/geometric)
  └── 输出 (题干, 4 选项, y∈{0,1,2,3}, 解释 E)
        │
        ▼  三层质控
① 4 个结构校验器:JSON 结构 / 数据类型 / 格式 / 完整性
② 3 个内容校验器:难度分类 / 多样性 / 内容
③ 难度三级初评(easy/medium/hard)→ 专家审阅阶段终验
        │
        ▼
按约 92/6/6 三分(train/valid/public test)+ 41,007 私有测试

三个方法论要点:第一,"两阶段"的意义在于先把自由文本压成事实要点再出题,避免题干直接复述报告长句导致答案泄露;第二,校验器是代码化的确定性检查(结构类)与 LLM 评审(内容类)的混合,比纯人工筛查可扩展得多,这也是 69.5 万量级能够达成的前提;第三,专家环节的作用是难度校准与抽样审阅,不是全量逐题复核——数据卡未披露专家审阅的覆盖率(见 §7.2)。

§3.6 标注者资质与一致性

  • 生成模型:GPT-4o(2024-05-01-preview),通过 Azure OpenAI API 调用——版本锁定保证了生成行为的可复现窗口,但 OpenAI 已退役该版本,日后复现需注意模型快照差异。
  • 专家审阅:论文提及 Expert Review Phase 与难度验证,作者团队含放射科临床背景成员(首尔国立大学团队,Seunghyeon Roh、Won Jung Kim、Meesun Lee),但未披露逐题复核比例、专家人数与 Kappa 一致性指标——这是与人工标注数据集(如 VQA-RAD 报告的双医生标注一致率)相比最大的方法论缺口。
  • 人类对照研究:3 名放射科住院医(radiology residents)完成 200 例随机样本测试,提供了人类成绩锚点(最佳 77.27%),但样本量与资质层级(均为住院医,无 attending 层)限制了"超越人类专家"表述的强度——准确说法是"超越人类住院医"。

§3.7 采集周期

  • 上游报告采集:ReXGradient-160K 于 2025-05 发布,79 站点常规诊疗数据的回溯性汇集(具体采集窗口上游论文口径,本数据集不重复采集)。
  • MCQ 生成窗口:2024 年内(数据卡 News 2024-11-14 已完成一轮修订,论文 2025-06 发布)。
  • 版本节奏:ReXVQA 无 v2 数据发布记录;论文 v2(2025-06-06)为文本修订。数据卡 lastModified 与仓库变更需在引用时自查(hf-mirror 端点可查)。

§3.8 地域覆盖

  • 上游 79 家站点为全球多站点(Gradient Health 汇聚),其中美国医疗系统数量存在口径冲突:论文引言 “sourced from four U.S. health systems” vs README/上游数据卡 “3 U.S. health systems”(坑 4 存照)。
  • 题目语言为英文;上游报告为英文自由文本。
  • 本条目撰写时点无法核实站点的国别分布明细(上游未公开站点清单),引用"多站点多样性"时应以上游论文的站点统计为准。

§3.9 设备规格

图像设备信息继承上游:DICOM 原始采集含常规数字化放射(DR/CR)与床旁设备,PA/AP/LAT 多视角。上游数据卡未公开设备厂商与型号分布。对本数据集的直接影响是:图像分辨率为上游降采样版的 16-bit PNG,任何依赖原始 DICOM 灰度精度或高分辨率细节的评测在本基准上不成立——geometric 类题目(管端位置、大小测量)受此限制尤甚,这与五技能中 geometric 占比不足 0.5% 的设计取舍互为因果。

§3.10 深度溯源链

完整资产血缘(自上而下三层):

[层1 患者检查] 79 站点 DICOM 胸片 + 放射报告(Gradient Health 汇集,HIPAA 双路去标识)
      │ 上游仓库:rajpurkarlab/ReXGradient-160K(rid 717,同款非商业协议)
      ▼
[层2 结构化报告] GPT-4o 辅助四段化(Indication/Comparison/Findings/Impression)
      │ 上游论文 arXiv:2505.00228 披露流水线
      ▼
[层3 MCQ 语料] GPT-4o 两阶段生成 + 7 校验器 + 难度三级 + 专家审阅
      │ 本仓库:rajpurkarlab/ReXVQA(本条目)
      ▼
[层4 评测生态] 论文 8 模型评测 + ReXrank 私有测试集(41,007)在线排行
      │ 论文 arXiv:2506.04353 / PSB 2026;rexrank.ai
      ▼
[层5 同族延伸] ReXGroundingCT(CT 定位)/ ReXInTheWild / MAIDA 等后续工作(同 lab、同协议家族)

溯源完整性评价:从 DICOM 到 MCQ 的每一步转换都有论文或数据卡披露,但每一步的中间产物(结构化要点、被校验器淘汰的题目、专家改判记录)均未公开——想要审计"题目是否忠实于报告"的研究者只能拿到首尾两端的资产,中间层不可复现。这是生成式基准的通病,也是 §8.4 讨论的方法论边界。

§4 数据结构

§4.0 目录树

rajpurkarlab/ReXVQA(HuggingFace gated 仓库,实测 tree/main 2026-09-30)
├── README.md                      # 数据卡(含 YAML 元数据、split 表、News、三段 BibTeX)
├── LICENSE                        # ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1
│                                  #   (11,359 B 实测;协议全文即许可文件)
└── metadata/
    ├── train_vqa_data.json        # 1,388,369,965 B — 训练问答对
    ├── valid_vqa_data.json        #    97,501,862 B — 验证问答对
    └── test_vqa_data.json         #    98,707,686 B — 公开测试问答对

配套的外部资产(不在本仓库):

rajpurkarlab/ReXGradient-160K(上游图像与报告,同款协议,另签)
├── images/…(273,004 张 16-bit PNG,降采样 25%)
├── reports.csv                    # 四段结构化报告
└── metadata.csv                   # 检查级元数据(患者/视角/站点等)

rexrank.ai                        # 私有测试集 41,007 道在线评测(无需下载)

三个必须记住的结构事实:第一,本仓库只有 JSON,configs 段引用的 metadata/*_metadata.csv 是上游数据卡的复制残留、文件不存在(坑 3);第二,私有测试集(41,007 道)没有公开文件,任何声称"下载了 ReXVQA 私测集"的仓库都是仿制品;第三,JSON 是 LFS 对象,git clone 需先装 git-lfs,用 huggingface-cli download 则无此顾虑。

§4.1 DAIMS 字段字典

问答记录的字段字典如下(字段名按论文 §3.3 与数据卡口径整理;JSON 原文件 gated 未能采样,实际键名以拿到文件后为准——差异处理见坑 6):

字段 类型 取值域 语义 使用提示
question / question_text sc:Text 英文自由文本 MCQ 题干,含临床语境 仿 USMLE 语体;长题干常含 Indication/Comparison 信息
options list[sc:Text] 长度 4 四个选项文本 选项顺序即索引 0-3;2024-11-14 已做过选项分布再平衡
answer / y sc:Integer 正确选项索引 评测时按索引比对,不要按选项文本(文本可能改写)
explanation / E sc:Text 英文自由文本 解释(生成式质控产物) 可用于 CoT 蒸馏,但注意是 GPT-4o 生成而非医生书写
difficulty [“sc:Text”,“cr:Label”] easy / medium / hard 三级难度(LLM 初评+专家验证) 技能×难度二维分层评测的坐标之一
category / skill [“sc:Text”,“cr:Label”] 五技能之一 presence / negation / differential diagnosis / location & distribution / geometric information 分布 36.1/36.5/20.9/约6/<0.5(论文口径)
study_id / image 关联键 sc:Text 上游标识 关联上游图像与报告 关联键的确切字段名 gated 未实测,拿到文件先 jq 'keys' 探查

字段字典的"双重不确定性"声明:以上键名是按论文描述整理的语义字段,不是对 JSON 的逐字节转写。拿到数据后第一件事是核对真实键名与本表的对应关系,并把映射写进你的数据加载脚本(§6.3 的代码把这一步做成了显式断言)。

§4.2 关键分布

五技能分布(论文口径):

negation            ████████████████████████████████████ 36.5%
presence            ███████████████████████████████████  36.1%
differential dx     ████████████████████                 20.9%
location & dist.    ██████                                ~6%
geometric           ▏                                     <0.5%

难度分布:easy/medium/hard 三级,论文按难度分层报告了模型成绩(如 geometric 类 MedGemma 总体 80.45% 但 Janus-Pro-7B 在 hard 档更接近),全量难度比例论文未以单一数字披露——拿到 JSON 后应自行统计 difficulty 字段的边际分布并写进实验日志。

答案选项分布:数据卡 News 记录 2024-11-14 “balance answer options”——发布版应近似均匀(每选项约 25%)。若你在历史快照或第三方镜像上发现答案索引严重偏斜(比如 y=2 占 40%),你拿的是旧版语料,应回官方仓库重新下载(这也是坑 2 口径分叉的时间截面证据)。

§4.3 文本统计

题目文本没有官方统计表,以下为按生成机制推导的量级参考(拿到数据后请实测替换):

  • 题干长度:USMLE 风格题干通常 1–3 句、20–60 tokens;含病例背景的长题干可达 100+ tokens。
  • 选项长度:短选项(是/否变体、解剖部位)到长选项(完整诊断短语)混合。
  • 解释长度:GPT-4o 生成的解释通常 1–4 句。
  • 训练集 JSON 密度:489,523 道题(README 口径)占 1.29 GiB,平均每道题约 2.8KB 原始 JSON(含格式开销),与"题干+4 选项+解释"的体积量级自洽。

§4.4 数据层级与连接关系

患者 patient(约 10.9 万)
 └── 检查 study(16 万,含视角与日期)
      ├── 图像 image(27.3 万张,上游 PNG)
      └── 报告 report(四段结构化文本)
           └── MCQ 题 ×k(k 平均约 3.6–4.3,视口径)
                ├── 四选项 + 答案索引
                ├── 解释 E
                └── (difficulty, category) 标签

连接关系的三条规则:

  1. 一对多贯穿全链:1 患者 → n 检查 → 1 报告/检查 → k 题。任何"随机划分"都必须在患者级做,否则 k>1 的兄弟题会把答案风格与患者特征带到测试集(§5.3)。
  2. 跨仓外键:ReXVQA JSON 与上游 ReXGradient-160K 通过检查/图像标识关联;两侧仓库的键命名系统一致(同 lab 同批次设计),但对齐脚本要自己写——官方没有发布现成的 join 表。
  3. 私测集无连接:41,007 道私测题不在任何公开 JSON 里,只有 ReXrank 服务端持有;本地永远无法本地评测私测集。

§4.5 缺失值与信息性缺失

位置 缺失类型 含义与处置
私有测试集文件 结构性缺失 41,007 题仅存于 ReXrank——不要试图在公开渠道找,找不到是常态不是故障
图像路径 结构性缺失 本仓库不含图像与路径表——与上游 metadata 对齐(§4.4 规则 2)
metadata CSV(configs 引用) 幽灵文件 数据卡 configs 指向不存在的文件(坑 3)——忽略 configs,用实际文件树
站点/人口学字段 继承性缺失 上游公开版不发布站点清单与人口学明细——公平性研究受限(§7.5)
专家复核覆盖率 元数据缺失 论文未披露专家审阅比例——质量审计只能抽样自做
前后对比日期 脱敏缺失 上游日期做了 ≤365 天偏移——"较前变化"类题目的真实时间间隔不可恢复

"信息性缺失"一条值得展开:2024-11-14 修订"移除偏倚样本"意味着存在一个更早、更大、含偏倚的版本,但官方没有发布 removed 样本的清单与移除规则。做数据集演化或数据清洗研究的人拿不到 diff——这是本数据集最显眼的不可复现点。

§5 数据划分与使用建议

§5.1 官方划分

双口径并存(详见 §3.2),使用决策树:

你要做什么?
├── 复现论文实验 / 写对比论文
│   → 用论文口径:572,952 / 40,878 / 40,826(+ 私测 41,007 不可得)
│   → 报告数字时注明"论文 Table 口径,加总 695,663"
├── 检查本地文件完整性
│   → 用 README 口径:489,523 / 34,500 / 34,889(加总 599,919)
│   → 你的 JSON 行数对不上这两个数的任何一个?先查快照版本(坑 2)
└── 提交 ReXrank
    → 本地无需私测集;按 ReXrank 提交格式输出预测

无论用哪个口径,split 间的患者互斥是官方设计(README 分 patients 统计就是佐证);自己重切 split 属于高级操作,需同时满足患者级分桶+技能分层两项(§5.4)。

§5.2 ReXrank 与私有测试集

私有测试集 41,007 道的双侧协议:

  • 数据侧:不随仓库发布、无公开镜像。论文正文与 HF README 对该数字完全一致(两处都是 41,007),可信度高。
  • 服务侧:ReXrank(rexrank.ai)在线评测,原为报告生成排行榜(Zhang 2025,AAAI Bridge AIMedHealth),后扩展 VQA 榜。提交方上传预测,服务端在隔离环境打分。
  • 防刷榜设计:私测集+在线评测 = 基准领域的标准"考试院"模式(类比 GLUE/SuperGLUE),防止本地调参过拟合公测集后宣称 SOTA。
  • 引用纪律:报告"在 ReXVQA 上取得 X%"时必须写明是 Public Test(40,826 论文口径 / 34,889 README 口径)还是 ReXrank 私测(41,007)。两个集合规模接近、题目同源,但成绩不可互换——公测集上刷出来的分数在私测集上通常回落。

§5.3 泄漏风险清单

风险 机制 症状 防线
兄弟题泄漏 一份报告生成多道题(平均约 4 道) 同报告的题跨集,答案风格互通 划分检查:同 study 的题必须同 split
患者级泄漏 同患者多次检查,报告模板化 "同一病人"的书写习惯跨集 划分检查:同 patient 的题必须同 split(官方已做,自切者必做)
生成器泄漏 全部题目出自同一 GPT-4o 快照 模型若同源(GPT-4o 家族多模态版)变相"见过生成分布" 评测结论中声明生成器与被测模型的血缘
上游预训练泄漏 用 ReXGradient-160K 预训练再测 ReXVQA 报告文本(题目的事实来源)在预训练语料里 在论文中显式声明两段式用法,并跑"纯外部预训练"对照
公测集调参过拟合 反复在 Public Test 上迭代 公测虚高、私测回落 开发期用 Validation split,公测只碰 3 次以内

§5.4 交叉验证建议

训练集 57.3 万道(论文口径)做 k 折交叉验证的可行方案:

  1. 分层变量:(category × difficulty) 二维分层,每折技能与难度边际分布一致;
  2. 分桶变量:patient_id 哈希分桶,桶间患者互斥;
  3. 折数取舍:k=5 为性价比拐点(每折 11 万+题,8 模型 × 5 折 = 40 次训练,医疗 VLM 推理成本可观);若算力紧张,用固定 Validation split + bootstrap 置信区间替代完整 k 折;
  4. 报告规范:无论 k 折还是单切,都要报告按技能分层的准确率——总分会被 presence/negation 主导(约 72%),单看总分等于没测(技能分层见 §2.3;泄漏处理见 §5.3)。

§5.5 外部验证建议

ReXVQA 结论要外推,建议的三角验证组合:

  • 人工精标小集对照:在公测集抽 200–500 题,请放射科医生独立判卷,量化"报告真值 vs 影像事实"的偏离率(生成式基准的系统性盲区,§8.4);
  • 跨基准横评:同一模型在 VQA-RAD(人工精标)与 ReXVQA(生成式)上的成绩相关性——若正相关弱,说明两基准测的不是同一种能力;
  • 技能缺口验证:把 ReXVQA 上 diff dx 拉胯的模型放到 SLAKE 的诊断类子集上,验证"鉴别诊断弱"是基准特异还是模型固有。

§6 AI 就绪指南

§6.0 云端快速启动

# Colab 示例:凭据走 Colab Secret(HF_TOKEN),不要硬编码
import os
assert os.environ.get("HF_TOKEN") or True  # Colab: 从 Secret 注入 HF_TOKEN
# pip install -U huggingface_hub pandas ijson pillow torch torchvision

要点:本仓库的 JSON 无需 git-lfs(用 huggingface_hub 直接下);图像需另下上游仓库;两仓库共用同一 HF 账号,但协议签署是网页操作、每仓库各一次,token 只解决"你是谁",不解决"你签没签"。

§6.1 快速上手

# 1) 下载问答语料(gated:先在网页签协议,见 §6.2)
from huggingface_hub import hf_hub_download

train_json = hf_hub_download(
    repo_id="rajpurkarlab/ReXVQA",
    repo_type="dataset",
    filename="metadata/train_vqa_data.json",
    token=os.environ["HF_TOKEN"],
)

# 2) 探查真实键名(字段语义见 §4.1;JSON 大,用流式探查)
import ijson, json
with open(train_json, "rb") as f:
    first = next(ijson.items(f, "item"), None)
print(json.dumps(first, indent=2, ensure_ascii=False)[:800])
# 把 first 的真实键名与 §4.1 字段字典对表,写进你的加载器

# 3) 图像另从上游取(同协议,另签)
#    hf_hub_download(repo_id="rajpurkarlab/ReXGradient-160K", ...)

§6.2 数据获取

gated 双重门的完整通过流程:

第 1 步 注册与登录
  hf-mirror / HF 主站注册账号 → 生成 Fine-grained 只读 Token(勾选该数据集读权限)

第 2 步 网页签署协议(本仓库)
  访问 https://huggingface.co/datasets/rajpurkarlab/ReXVQA
  填写 extra_gated_fields 四项:Name / Institution / Email / 同意条款 checkbox
  提交后门禁解除(本协议为签署即过型,无人工审批等待)

第 3 步 网页签署协议(上游仓库)
  同款协议在 rajpurkarlab/ReXGradient-160K 再签一次——两个仓库门禁独立!
  (想下图像的人最常踩的坑:只签了 ReXVQA,拉上游图像 401)

第 4 步 CLI 下载
  export HF_TOKEN=hf_xxx
  huggingface-cli download rajpurkarlab/ReXVQA --repo-type dataset \
    --include "metadata/*.json" --local-dir ./rexvqa
  huggingface-cli download rajpurkarlab/ReXGradient-160K --repo-type dataset \
    --include "images/*" "reports.csv" "metadata.csv" --local-dir ./rexg160k

第 5 步 完整性体检(下载后立即做,§6.3 代码)

四条工程红线:

  1. 镜像站拿不到这个仓库:公共镜像不持有你的授权凭据,未登录/未签署一律被拒——实测响应为 “Access to dataset rajpurkarlab/ReXVQA is restricted”。元信息(README/tree/resolve 的公开文件)可走镜像,数据文件必须走官方端点 + token。
  2. 签署即过 ≠ 自动下载:网页签完协议后 token 立即生效,但已发起的下载进程要重启才会带上新权限。
  3. 马萨诸塞州管辖条款:协议 v.1(2025-04-07)明确受马萨诸塞州法管辖,违规报告邮箱 MAIDA_Support@hms.harvard.edu——企业合规审查时把这条递给法务。
  4. 非商业边界:协议禁商业、禁临床、禁再分发、禁发布数据目录;署名要求(引用 ReXGradient-160K 与 Gradient Health)适用于所有衍生论文与产品文档。

§6.3 预处理全流程

# 步骤 0:把 1.29 GiB 的 train JSON 转成 Parquet(一次性,加速后续所有实验)
import ijson, json, pandas as pd

def json_to_parquet(json_path: str, out_path: str):
    """流式读取大 JSON → Parquet。真实键名以 §6.1 探查结果为准,此处用常见键名示范。"""
    KEY_QUESTION, KEY_OPTIONS, KEY_ANSWER = "question", "options", "answer"
    KEY_EXPL, KEY_DIFF, KEY_CAT = "explanation", "difficulty", "category"
    rows = []
    with open(json_path, "rb") as f:
        for rec in ijson.items(f, "item"):
            rows.append({
                "question":  rec[KEY_QUESTION],
                "options":   json.dumps(rec[KEY_OPTIONS], ensure_ascii=False),
                "answer":    int(rec[KEY_ANSWER]),
                "explanation": rec.get(KEY_EXPL, ""),
                "difficulty":  rec.get(KEY_DIFF, ""),
                "category":    rec.get(KEY_CAT, ""),
            })
    df = pd.DataFrame(rows)
    # 体检断言:四选项、答案索引合法、字段非空
    assert (df["options"].apply(json.loads).apply(len) == 4).all(), "存在非四选项题"
    assert df["answer"].between(0, 3).all(), "answer 越界"
    df.to_parquet(out_path, index=False)
    return df

train_df = json_to_parquet("rexvqa/metadata/train_vqa_data.json", "train.parquet")
print(train_df["category"].value_counts())   # 五技能边际分布(应≈36.5/36.1/20.9/6/<0.5)
print(train_df["difficulty"].value_counts()) # 难度边际分布(官方未披露,自行记录)
print(train_df["answer"].value_counts(normalize=True))  # 选项均衡性(应≈各 25%)

# 步骤 1:与上游图像对齐(键名以上游 metadata.csv 实际列名为准)
# up_meta = pd.read_csv("rexg160k/metadata.csv")
# qa_meta = pd.read_csv("rexvqa_qa_study_map.csv")  # 若 JSON 内含 study 关联键则直接用
# joined = qa_meta.merge(up_meta, on="study_id", validate="many_to_one")

# 步骤 2:图像读取——上游 PNG 已统一方向与 16-bit 归一化,转 float 后 /65535 即 [0,1]
# import numpy as np, PIL.Image as Image
# def load_image(path):
#     img = np.asarray(Image.open(path), dtype=np.float32) / 65535.0
#     return img  # HxW 或 HxWx3

§6.4 PyTorch DataLoader 完整代码

"""ReXVQA 评测用 Dataset:图像(上游 ReXGradient-160K)+ MCQ(本仓库 JSON)。
假设:已下载两仓库并完成 §6.3 的对齐表(study_id -> image 路径列表)。
"""
import json
import numpy as np
import pandas as pd
import torch
from PIL import Image
from torch.utils.data import Dataset


class ReXVQADataset(Dataset):
    """一条样本 = 一道 MCQ。评测协议:模型输出 (y, E),这里只结构化输入侧。"""

    def __init__(self, parquet_path: str, align_csv: str, image_root: str,
                 tokenizer, max_len: int = 512, image_size: int = 448):
        self.df = pd.read_parquet(parquet_path)
        self.align = pd.read_csv(align_csv)          # 列: question_key, study_id
        self.image_root = image_root
        self.tk = tokenizer
        self.max_len = max_len
        self.image_size = image_size

    def __len__(self) -> int:
        return len(self.df)

    def _load_image(self, study_id: str) -> torch.Tensor:
        """上游一检查多图(正侧位):评测时最常见做法是把同检查全部图拼通道/序列输入。
        这里给出单图简化版(PA 优先),多图策略按你的模型架构定。"""
        paths = self.align.loc[self.align["study_id"] == study_id, "image_path"].tolist()
        pa = next((p for p in paths if "PA" in p.upper()), paths[0])
        img = Image.open(f"{self.image_root}/{pa}").convert("L")
        img = img.resize((self.image_size, self.image_size), Image.BILINEAR)
        t = torch.from_numpy(np.asarray(img, dtype=np.float32) / 65535.0)
        return t.unsqueeze(0).repeat(3, 1, 1)        # 灰度复制到 3 通道

    def __getitem__(self, idx: int):
        row = self.df.iloc[idx]
        study_id = self.align.iloc[idx]["study_id"]
        pixel_values = self._load_image(study_id)

        prompt = (
            "You are a radiologist. Answer the multiple-choice question "
            "about the chest X-ray and explain your reasoning.\n"
            f"Question: {row['question']}\n"
            "Options:\n" +
            "\n".join(f"{chr(65+i)}. {o}" for i, o in enumerate(json.loads(row["options"]))) +
            "\nRespond with the option index and an explanation."
        )
        enc = self.tk(prompt, truncation=True, max_length=self.max_len, return_tensors="pt")
        return {
            "pixel_values": pixel_values,
            "input_ids": enc["input_ids"].squeeze(0),
            "attention_mask": enc["attention_mask"].squeeze(0),
            "label": torch.tensor(int(row["answer"]), dtype=torch.long),
            "category": row["category"],
            "difficulty": row["difficulty"],
        }


def evaluate_skill_accuracy(model, loader, device: str) -> dict:
    """按 (category, difficulty) 分层准确率——总分会被 presence/negation 主导,分层才有信息量。"""
    model.eval()
    agg: dict = {}
    with torch.no_grad():
        for batch in loader:
            out = model(pixel_values=batch["pixel_values"].to(device),
                        input_ids=batch["input_ids"].to(device),
                        attention_mask=batch["attention_mask"].to(device))
            pred = out.logits[:, :4].argmax(-1).cpu()          # 四选项头
            for p, y, c, d in zip(pred, batch["label"],
                                  batch["category"], batch["difficulty"]):
                k = (c, d)
                n, hit = agg.get(k, (0, 0))
                agg[k] = (n + 1, hit + int(p == y))
    return {f"{c}/{d}": hit / n for (c, d), (n, hit) in agg.items() if n > 0}

§8 方法学启示:可迁移的四条经验

8.1 "LLM 出题 + 规则门 + 专家抽审"是可复制的生产函数

ReXVQA 流水线最有复用价值的不是 69.6 万这个数字,而是它的成本结构设计:把人类智力精确投放在机器失效的环节。结构四门(JSON/类型/格式/完整性)是纯机器活;内容三门(难度/多样性/质量)半机器半规则;专家只在语义存疑处介入。任何拥有"结构化文本 + 领域知识库"的团队都可以按 §3.1-3.3 的骨架搭同款流水线。复制的三个前置条件(§3.6):源文本质量、影像-文本可靠关联、可调度的领域专家。复制时的红线:论文未披露专家审阅的抽样率与淘汰率(坑 5),复现者需要自行设计并披露这两个人力参数——这是原流水线留下的透明度债务,别继承它。

8.2 认知技能轴是比器官轴更好的基准组织方式

以器官/疾病为轴的基准回答"模型会不会认这个病",以认知技能为轴的基准回答"模型会不会做这类推理"。ReXVQA 的分技能结果(§4.2)证明了技能轴的判别力:MedGemma 在鉴别诊断上领先第二名 8.54 个百分点,却在否定检测上输给通用模型 Eagle2——如果只看 overall,这个结构性信息完全不可见。设计新评测的迁移建议:先枚举目标领域专家实际使用的推理操作(放射科是存在/否定/定位/鉴别/测量),再为每个技能锚定文献来源与题量下限,最后按技能分桶生成与质检。技能轴的代价是题量分配的头部集中(ReXVQA 里否定+存在占 72%),设计时应预设小技能桶的最小统计基数。

8.3 AI vs 人类对照的对照组设计教训

ReXVQA 的人类研究(3 住院医 × 200 例)提供了正面与反面教材。正面:同题作答、随机抽样、结果以绝对差报告——比"模型准确率 vs 文献人类准确率"的跨研究对照严谨得多。反面:受训者不是专家终点、随机抽样无难度分层、封闭题式与临床任务有距离。设计同类对照的改进清单:纳入至少一名 board-certified 资深医生作上限参照;按题目难度/技能分层抽样;报告人类读者间一致性(否则"最佳人类"是个幸存者数字);补充开放式任务作外部效度检验。引用 ReXVQA 人类结论时,这四条即是完整的方法论护栏。

8.4 多口径数字的治理:从"发现矛盾"到"登记口径"

ReXVQA 的四个问题总数(§2.5、坑 2)不是孤例而是生成式数据集的通病:论文数字、平台数字、数据卡数字在数据集生命周期里各自演化(清洗、去重、补发),没人负责回写对齐。本条目的处理流程可复制:① 找出全部口径及各自出处与时间点;② 判断哪个口径可自洽(splits 加总吻合);③ 主口径固定为可自洽者;④ 其余口径进"双口径登记表"(附录 I);⑤ 条目内凡涉该数字处均注明口径编号。检索者拿到这个流程,面对任何多口径数据集都能十分钟内建立引用纪律。

§9 与库内条目的关系

9.1 家族图谱与互链清单

库内条目 rid 关系 互链方向
ReXGradient-160K 717 直接上游:图像+报告来源;同 DUA 协议家族;数据卡 title 沿承其名 双向必链
VQA-MED 280 同任务(医学 VQA)不同代际:2019 ImageCLEF 挑战赛 vs 2025 生成式 双向
VQA-RAD 240 同任务不同代际:2018 人工标注小集;且被 ReXVQA 论文引为技能框架参照 双向
PathVQA 260 同任务不同模态:病理图问答 vs 胸片问答 双向
PMC-VQA 270 同任务不同生成路线:文献图文自动生成 vs 报告流水线生成 双向
OmniMedVQA 290 同任务不同策略:12 源聚合 vs 单源深加工 双向
EHRXQA — 同任务不同原料:EHR 结构化数据+影像 vs 纯影像报告 双向
SLAKE — 同任务不同语言生态:双语医学 VQA 双向

9.2 分工声明:ReXVQA 与 VQA-MED(280)

两者检索时最易混淆(同为"胸片/医学 VQA"高频词),分工如下:

  • VQA-MED(rid 280):ImageCLEF 2019 年度挑战赛的医学 VQA 数据,以挑战赛为组织形式(年度赛题+参赛队伍),图像源为多中心医学影像(不限于胸片),规模为挑战赛量级(数千题),许可按届注册;
  • ReXVQA(本条目):2025-2026 年的胸片专用 VQA 基准,以技能框架为组织形式(五技能+七道校验门),图像源为单一上游 ReXGradient-160K 的 16 万 study,规模为 69.6 万题量级,许可为 Harvard 非商业 DUA。

两者相隔六年、组织形式不同、规模差两个数量级、许可体系不同——库内共存无冲突。写综述时的时间线用法:VQA-MED 代表"挑战赛驱动"的第二代范式(在其时代是主流),ReXVQA 代表"平台化生成"的第三代范式。

9.3 检索路径建议

  • 从上游数据进:先读 ReXGradient-160K(717) 条目了解影像规格(16-bit PNG、降采样 1/4、79 站点),再回本条目看问答层;
  • 从基准对比进:§2.6 规格对照表 + §4.1 八模型榜 → 跨条目引用时按 §4.5 守则统一口径;
  • 从许可合规进:§6.2 条款表 → 你的使用场景若涉商业/临床,直接判死(无需细读);学术用途再过五条款清单;
  • 从方法论进:§3 流水线 + §8.1 复现骨架 → 自建生成式 VQA 基准的团队取用。

§10 避坑清单:八个已踩过的坑

坑 1:HF 数据卡标题不是 ReXVQA。rajpurkarlab/ReXVQA 的 YAML frontmatter 写 title: "ReXGradient-160K Dataset"、license_name: rexgradient——整卡沿承上游数据卡框架。按卡片标题或 license_name 检索/归类会把 ReXVQA 误并入 ReXGradient-160K 条目(本库两条目分立:rid 717 与本条目)。以仓库名 + 论文标题双锚点确认身份。

坑 2:问题总数四口径。① 论文正文 splits 加总 695,663(572,952+40,878+40,826+41,007);② arXiv 摘要约 696,000 / 正文引言 approximately 695,000;③ HF README 正文 653,834;④ HF README splits 加总 599,919(489,523+34,500+34,889+41,007)。四数互斥不可调和,推测为"生成全集→清洗发放"的时间线演化。本条目主口径 695,663(唯一自洽加总);引用任何总数先声明口径编号。

坑 3:configs 引用的文件不存在。HF 数据卡 configs 段配置了 metadata/{train,valid,test}_metadata.csv 三个文件路径,实际文件树(tree API 实测 2026-09-30)只有 {train,valid,test}_vqa_data.json。load_dataset(..., revision="main") 按 configs 走会报文件缺失。直接读 JSON 或按实际文件树写加载脚本。

坑 4:医疗系统数 3 vs 4。HF README 与上游 ReXGradient-160K 论文:3 家美国医疗系统 79 站点;ReXVQA 论文引言:“sourced from four U.S. health systems”。本条目按上游与数据卡口径写 3 家;论文引言的 4 存照。转引时以数据卡/上游论文为准并注明。

坑 5:专家审阅的透明度缺口。论文披露流水线含 Expert Review Phase,但未披露抽样比例、审阅人数、淘汰率。69.6 万题的逐题人工审阅在人力上不可行,几乎必然是抽样制——但方案未公开。引用"经专家验证"表述时保留分寸,不升级为"全部经专家逐题审定"。

坑 6:字段结构无法签署前预览。问答 JSON 为 gated,匿名实测访问被拒(“Access to dataset rajpurkarlab/ReXVQA is restricted”)。本条目 §2.4 的字段清单按论文描述转写,非实测——签署前不要把字段名写进硬编码脚本,签署后以实际 JSON 结构为准。

坑 7:83.24% 与 83.84% 两个 MedGemma 数字。83.24% = 公开测试集 overall(8 模型榜);83.84% = 人类研究 200 随机例子集。媒体与部分转引常混用。规则:谈榜单用 83.24%,谈"超过人类"用 83.84% + 200 例 + 住院医语境。

坑 8:News 日期早于论文。HF 数据卡 News:“[Nov 14, 2024] Dataset updated to remove biased samples and balance answer options”——早于论文首发(2025-06-04)约七个月,且语用上是上游 ReXGradient 系的更新口吻(又一处数据卡沿承痕迹)。不要用该 News 推断 ReXVQA 本体的发布时间线;论文与 HF 树抓取时间才是可靠锚点。

§11 总结

11.1 三句话总结

  1. ReXVQA 用"GPT-4o 两步生成 + 七道校验门"把 16 万份真实放射报告变成约 69.6 万道五技能框架的四选一胸片 VQA 题,是库内规模最大、组织轴最新的医学 VQA 数据集。
  2. 它的榜单结果(MedGemma-4B-it 83.24% overall,分技能四冠一失)与人类对照(200 例上 83.84% vs 最佳住院医 77.27%)共同给出了"专用医学模型超越受训人类"目前最完整的一份证据,但结论的适用边界(住院医、200 例、封闭题式)必须随数字一起引用。
  3. 它的 gated 双仓结构(问答 JSON 本仓 + PNG 上游仓)与非商业 DUA 使其获取摩擦显著高于库内开放 VQA 前辈——学术可用、商用禁行、二次集成不可能。

11.2 适合谁

  • 医学多模态大模型评测者:需要分技能诊断(哪里强哪里弱)而非单一总分;
  • 医学 VQA 数据集设计者:生成流水线(§3)+ 口径治理(§8.4)都是现成模板;
  • 放射学 AI 教育研究者:五技能框架本身是可用的教学分类学;
  • 研究"AI vs 人类"方法论的团队:§4.3/§8.3 的对照组设计正反教材。

11.3 不适合谁

  • 需要即插即用开放数据的团队:gated + 禁再分发 + 双仓对齐,工程与合规成本都不低;
  • 商业产品或临床部署验证:DUA 明文禁止,无变通空间;
  • 需要几何/测量类大规模训练数据的项目:该技能占比不足 0.5%;
  • 需要开放题式(自由文本报告式问答)的项目:全部题目是四选一封闭题。

11.4 30 秒决策卡

你的情况 行动
想快速跑通一个医学 VQA 实验 换库内开放条目(PathVQA/PMC-VQA 类,§2.6 表)——ReXVQA 不是最快路径
评估医学多模态模型 签 DUA 下公开 splits(§6.1 流程),按论文口径复现 + §4.5 守则报告
需要 ReXrank 私有集成绩 只能经 rexrank.ai 提交预测,数据不在你手里(§5.1)
要建自己的生成式 VQA 基准 §3.1-3.3 骨架 + §8.1 三前置 + 专家抽样率自行披露
引用"AI 超过人类" 附录 I 口径 4 + §7.4 表格的正确表述模板
写医学 VQA 综述 §2.6 三代技术路线表 + §7.3 时间轴可直接取用

11.5 条目内快速锚点

要找 去处
四口径问题总数全表 坑 2 + 附录 I 登记表
gated 签署步骤 §6.1 流程实录(含实测拦截存照)
分技能模型成绩 §4.2 五榜表 + §4.5 四条守则
流水线复现骨架 §3 + 附录 F SOP 模板
"AI 超人类"正确表述 §7.4 传播边界表

FAQ(高频问答 32 问)

A. 基础认知

Q1:ReXVQA 是数据集还是排行榜?
两者都是但主体是数据集:HF 仓库实存约 1.58GB 问答 JSON(train/valid/test 三文件,tree API 实测),公开 splits 可签协议后下载复现;ReXrank(rexrank.ai)是其私有测试集(41,007 题)的评测外挂。本库"纯排行榜不立项"判例(ReXrank 案例)不适用于它——语料属性实测坐实。

Q2:名字 ReXVQA 怎么拆?
ReX = 系列名(ReXGradient/ReXrank 同族,放射 radiology 的变体拼写),VQA = Visual Question Answering。全家族覆盖"影像库(ReXGradient-160K)→ 榜单平台(ReXrank)→ 问答基准(ReXVQA)"三层。

Q3:谁做的?
Harvard Medical School Rajpurkar Lab(通讯 Pranav Rajpurkar)牵头,与 Saama AI Research(一作 Ankit Pal、Malaikannan Sankarasubbu)和首尔国立大学(Seunghyeon Roh、Won Jung Kim、Meesun Lee)合作,8 作者横跨三机构。

Q4:发表在哪?
正式版在 Biocomputing/Pacific Symposium on Biocomputing (PSB) 2026 论文集(World Scientific,DOI 10.1142/9789819824755_0018,PMID 41758146);预印本 arXiv:2506.04353(2025-06-04)。论文章节 CC BY-NC 4.0。

Q5:数据在哪发布?
HuggingFace:rajpurkarlab/ReXVQA(问答 JSON,gated)+ 上游 rajpurkarlab/ReXGradient-160K(胸片 PNG 与报告,gated 同族协议)。国内访问可走 hf-mirror.com 镜像(gated 授权仍在 HF 侧完成)。

Q6:它解决什么前人没解决的问题?
胸片 VQA 的"规模-真实性"两难:人工数据集(VQA-RAD 类)太小、模板生成数据集句式可背诵。ReXVQA 以真实报告为原料、LLM 出题加七道门质检,并第一个以"认知技能"为组织轴。

B. 数据与获取

Q7:公开 splits 有多大?
两个口径并读:论文口径 train 572,952 / valid 40,878 / public test 40,826(加私有 41,007 合计 695,663);HF README 口径 train 489,523 / valid 34,500 / public test 34,889(加私有 41,007 合计 599,919)。差异为发放版清洗所致,见坑 2。

Q8:图像文件在 ReXVQA 仓库里吗?
不在。本仓库只有问答 JSON;16-bit PNG(DICOM 转换、降采样 1/4)在上游 ReXGradient-160K 仓库(本库 rid 717)。完整实验需两次 gated 授权 + 跨仓对齐。

Q9:gated 流程要填什么?
四个字段:Name、Institution、Email、勾选确认框。勾选即视同签署《ReXGradient-160K Non-Commercial DUA v.1》全文(内嵌于数据卡与 LICENSE 文件)。实测未授权访问直接返回限制提示。

Q10:能商用吗?
不能。DUA 明文:仅限非商业研究与非临床目的;禁止再分发、禁止发布数据目录、仅可下载研究必需部分;马萨诸塞州法管辖;终止时须销毁数据。

Q11:问答 JSON 能预览字段吗(签署前)?
不能。2026-09-30 实测匿名经 hf-mirror 请求 train JSON 首部 3KB,返回 “Access to dataset rajpurkarlab/ReXVQA is restricted”。字段结构只能按论文描述推断(§2.4),签署后以实际为准。

Q12:数据卡 configs 里的 CSV 文件为什么找不到?
configs 段配置的 metadata/{train,valid,test}_metadata.csv 实际不存在于本仓库文件树——数据卡沿承上游所致(坑 3)。直接加载三个 _vqa_data.json 即可。

C. 统计与发现

Q13:五技能各占多少?
否定 36.5% / 存在 36.1% / 鉴别诊断 20.9% / 定位分布约 6% / 几何 <0.5%。前两项合计约 72%,论文称各 split 分布高度一致。

Q14:哪个模型最强?
论文评估窗口(2025 年中)8 模型中 MedGemma-4B-it 最强:公开测试集 83.24% overall。注意榜单是时点快照,新模型需另测(§4.5 守则二)。

Q15:MedGemma 全部单项第一吗?
不是。五技能中它拿了四项(存在 85.21%/定位 83.47%/鉴别 76.71%/几何 80.45%),否定检测由通用模型 Eagle2 以 86.32% 夺冠,MedGemma 85.03% 第三。

Q16:"AI 超过人类"的确切含义?
3 名放射科住院医在 200 例随机子集与模型同题:MedGemma 83.84% vs 最佳住院医 77.27%。三重边界:住院医非资深专家、随机抽样无难度分层、四选一封闭题非开放式报告(§4.3)。

Q17:83.24 和 83.84 哪个对?
都对但语义不同:83.24% 是公开测试集 overall(榜单数字);83.84% 是人类研究 200 例子集上的成绩。谈"超过人类"必须用后者及其语境(坑 7)。

Q18:分技能里哪些结论可信度高?
存在/否定/鉴别三大技能(题量占 93%+)可信;定位(约 6%)次之;几何(<0.5%)上的排名受抽样误差支配,仅作参考不作结论(§4.5 守则三)。

D. 题式与流水线

Q19:为什么是四选一?
论文有专门辩护:镜像 USMLE/放射学 board 考试惯例(临床熟悉感)+ 客观可复现打分。正确答案索引 y∈{0,1,2,3}。

Q20:模型只要选对就行吗?
论文任务定义要求输出解释元组 (y, E)——选择加解释。解释分量用于评估推理过程。纯准确率复现是降配实现,与他人含解释评估的成绩不可直接比(§4.5 守则四)。

Q21:题目是 GPT-4o 自己写自己评吗?
生成是 GPT-4o 两步(报告→bullet→MCQ),质检是 4 结构+3 内容校验器加专家审阅——不是自出自评闭环。但专家审阅的抽样率未披露(坑 5),"人工把关"的深度要保留分寸。

Q22:难度标签可信吗?
LLM 初评 + 专家验证的二级校准,三级(easy/medium/hard)。可信度中等:初评来自生成模型自身,验证覆盖度未知。用作分层参考指标,不作金标准。

Q23:为什么否定题占三分之一多?
临床重要性驱动:否定检测是避免假阳性的核心技能,也是放射 NLP 长期难点(Goryachev 2007);且它是 VQA-RAD/MIMIC-CXR-VQA 等前代数据集的最高频问型(框架锚点,§3.4)。

Q24:流水线能搬到其他科室吗?
能。三个前置:结构化报告文本、影像-文本可靠关联、可调度的领域专家(§3.6)。prompt template 换科室惯例即可,七道门架构通用。

E. 许可与生态

Q25:论文的 CC BY-NC 4.0 覆盖数据吗?
不覆盖。CC BY-NC 4.0 只及论文章节;数据受单独的 Harvard DUA 约束。引用论文表格与下载数据是两条合规线,别混。

Q26:Gradient Health 是谁?
上游影像的商业供体:跨 3 家美国医疗系统 79 站点的医学影像公司,把数据提供给 Harvard 再非商业转授权。DUA 的署名义务直接点名它——商业数据进学术基准的典型通道(§7.2)。

Q27:私有测试集能下载吗?
不能。41,007 题只在 ReXrank 平台作在线评测,题目本身不发放。想进榜只能提交模型预测;想"本地近似复现"私有集不存在合法路径。

Q28:ReXrank 和 ReXVQA 什么关系?
平台与挂载基准的关系。ReXrank 起家于报告生成排行(Zhang et al. 2025,AAAI Bridge AIMedHealth),ReXVQA 的私有 VQA 测试集挂靠其上——同一实验室的评测基础设施复用(§5.2)。

Q29:和 MAIDA 什么关系?
同实验室协议家族:ReXVQA 数据卡协议的报告违规邮箱为 MAIDA_Support@hms.harvard.edu,提示同组 MAIDA 系列数据集共用法务通道(详见附录 H DUA 速查)。

Q30:引用哪个 BibTeX?
数据引 pal2025rexvqa(注意 README citation 的 journal 字段写 arxiv,正式发表信息按 PSB 2026 补全;README 元数据的沿承痕迹另见坑 1/坑 8);图像来源同时引 ReXGradient-160K 论文(zhang2025rexgradient);榜单机制引 zhang2024rexrank。附录 O 有完整条目。

F. 复现与工程

Q31:复现 8 模型评测需要什么?
签名授权的两个仓库(PNG+JSON)、按论文的图像输入规格预处理、8 模型推理(含解释输出)、公开测试集打分。工程要点:答题用 few-shot 还是 zero-shot、解释是否参与打分,论文均有设定,偏离须声明(§4.5 守则四)。

Q32:自动化脚本里该用哪个总数?
分字段用:splits 明细按你实际下载的 JSON 实测;论文语境引 695,663;绝不把 README 的 653,834 或 splits 加总 599,919 与论文数字混在同一张表里(附录 I 有登记表可直接抄)。

事实清单(硬事实 36 条)

  1. ReXVQA 全称 A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding(论文标题,arXiv:2506.04353)。
  2. 正式发表于 Biocomputing/PSB 2026,World Scientific,DOI 10.1142/9789819824755_0018,PMID 41758146。
  3. arXiv 预印本 2506.04353,v1 2025-06-04。
  4. 论文章节许可 CC BY-NC 4.0。
  5. 作者 8 人:Ankit Pal, Jung-Oh Lee, Xiaoman Zhang, Malaikannan Sankarasubbu, Seunghyeon Roh, Won Jung Kim, Meesun Lee, Pranav Rajpurkar。
  6. 机构三:Saama AI Research、首尔国立大学、Harvard Medical School。
  7. HF 仓库 rajpurkarlab/ReXVQA,gated(Name/Institution/Email/checkbox 四字段)。
  8. 数据许可 license: other / license_name: rexgradient,实体为 ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1(2025-04-07 版署)。
  9. 协议主办方 President and Fellows of Harvard College;供体 Gradient Health(商业公司)。
  10. 问题总数论文口径 695,663(splits 加总:572,952+40,878+40,826+41,007)。
  11. arXiv 摘要口径 approximately 696,000;正文引言 approximately 695,000 MCQs。
  12. HF README 正文口径 653,834。
  13. HF README splits 加总口径 599,919(489,523+34,500+34,889+41,007)。
  14. HF README split 明细:train 489,523 pairs/138,993 studies/237,127 images/95,299 patients。
  15. private test 41,007 pairs / 10,000 studies——论文与 README 唯一完全一致的数字。
  16. 上游 ReXGradient-160K:160,000 study / 273,004 unique images / 109,487 patients / 3 家美国医疗系统 / 79 医学站点。
  17. 论文引言写 four U.S. health systems(与上游 3 家冲突,坑 4)。
  18. 图像规格:DICOM 转 16-bit PNG,按 DUA 降采样至原尺寸 1/4;PNG 存于上游仓库。
  19. 上游报告四段式:Indication / Comparison / Findings / Impression。
  20. 仓库文件实测(tree API 2026-09-30):train_vqa_data.json 1,388,369,965 B;valid_vqa_data.json 97,501,862 B;test_vqa_data.json 98,707,686 B;合计约 1.58GB。
  21. 数据卡 configs 引用的 metadata/{train,valid,test}_metadata.csv 实际不存在于文件树(坑 3)。
  22. 数据卡 YAML title 为 “ReXGradient-160K Dataset”(沿承上游,坑 1)。
  23. 五技能占比:negation 36.5% / presence 36.1% / differential diagnosis 20.9% / location & distribution 约 6% / geometric <0.5%(论文引言)。
  24. MCQ 四选项,y∈{0,1,2,3};任务定义含解释元组 (y,E);对标 USMLE/board 题式。
  25. 生成模型 GPT-4o(2024-05-01-preview,Azure OpenAI API),两步:报告→bullet points→MCQ。
  26. 质检:4 structural validators(JSON 结构/数据类型/格式/完整性)+ 3 content validators(难度/多样性/内容),全过方入基准。
  27. 难度三级 easy/medium/hard:LLM 初评 + 专家验证。
  28. 认知框架锚点:VQA-RAD(Lau 2018)、MIMIC-Ext-MIMIC-CXR-VQA(Bae 2024)、否定临床重要性(Goryachev 2007)。
  29. 评估 8 模型:Eagle2, Gemini, Janus-Pro-7B, LLaVA, Phi-3.5, Qwen2VL, Qwen2.5-VL, MedGemma-4B-it。
  30. MedGemma-4B-it 公开测试集 overall 83.24%(全场最佳)。
  31. 分技能:存在 MedGemma 85.21%(前 best Gemini 62.17%);定位 MedGemma 83.47%;鉴别 MedGemma 76.71%(次名 Eagle2 68.17%);几何 MedGemma 80.45%(次名 Janus-Pro-7B 75.42%);否定 Eagle2 86.32%(Gemini 85.68%,MedGemma 85.03%)。
  32. 人类研究:3 名放射科住院医 × 200 随机例;MedGemma 83.84% vs 最佳住院医 77.27%。
  33. 子类目:exam quality MedGemma 71.23%(LLaVA 10.30%);呼吸三项(肺胸膜混浊/肺透亮/肺容积)MedGemma 80.44%/87.88%/78.64%。
  34. README News:[Nov 14, 2024] 去除偏倚样本并平衡选项——早于论文首发(坑 8)。
  35. gated 下载实测被拒:“Access to dataset rajpurkarlab/ReXVQA is restricted”(2026-09-30,hf-mirror)。
  36. 数据问题联系 xiaoman_zhang@hms.harvard.edu(主题行 ReXVQA);协议违规报告 MAIDA_Support@hms.harvard.edu。

术语表(30 条)

# 术语 释义
1 VQA Visual Question Answering,视觉问答:给定图像与问题输出答案
2 MCQ Multiple-Choice Question,多选题;ReXVQA 中固定四选一
3 study 放射学检查事件单位,可含一或多个投照位图像
4 否定检测 Negation detection:确认某征象不存在,假阳性控制的关键技能
5 存在性评估 Presence assessment:判断某征象是否存在
6 鉴别诊断 Differential diagnosis:多个候选诊断中判定最可能者
7 定位与分布 Location & distribution:征象的空间位置与分布模式判断
8 几何信息评估 Geometric assessment:大小/间距/角度等空间测量判断
9 解释元组 (y,E) 任务定义要求模型同输答案索引与解释文本
10 ReXGradient-160K 上游数据集:16 万 study 胸片+报告(本库 rid 717)
11 ReXrank 同实验室在线评测平台(rexrank.ai),私有测试集所在
12 gated dataset 需登录并同意条款方可下载的 HF 数据集发布形式
13 DUA Data Use Agreement,数据使用协议
14 Gradient Health 上游影像的商业供体公司
15 PSB / Biocomputing Pacific Symposium on Biocomputing,全球范围内历史悠久的生物计算年会
16 16-bit PNG 16 位灰度深度 PNG;DICOM 窗宽窗位信息的保留格式
17 降采样 1/4 图像线性尺寸缩至原 1/4(像素数 1/16),DUA 合规要求
18 结构校验器 检查 JSON 结构/类型/格式/完整性的自动门
19 内容校验器 检查难度/多样性/语义质量的自动门
20 难度三级 easy/medium/hard,LLM 初评+专家验证
21 幻觉残留 生成模型引入源文本外事实的风险,模板式生成不存在此风险
22 可背诵性 模板式数据集上模型习得句式规律而非推理能力的失效模式
23 private test set 不公开发放、仅平台侧评测的保留集
24 MedGemma-4B-it Google 医学特调多模态模型,4B 指令微调版;本基准冠军
25 Eagle2 通用多模态模型(9B 档);否定技能冠军
26 Janus-Pro-7B 深度求索通用多模态模型;几何次名
27 human reader study 人机同题对照实验设计
28 residents 放射科住院医:专科培训中的受训医师
29 attending 完成专科培训的执业医师;ReXVQA 人类研究中未包含
30 DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维数据集评估框架

附录

附录 A:条目信息速查卡

项 值
条目名 ReXVQA
url_name rexvqa
类型 生成式 VQA 基准 + 流水线方法论 + 榜单生态(三合一)
论文 Biocomputing/PSB 2026,DOI 10.1142/9789819824755_0018;arXiv:2506.04353
团队 Rajpurkar Lab(HMS)× Saama AI Research × 首尔国立大学
规模 论文口径 695,663 题 × 160,000 study(四口径并存见坑 2)
许可 Harvard 非商业 DUA v.1(gated);论文 CC BY-NC 4.0
抓取时点 2026-09-30
库内互链 rexgradient-160k(717)/vqa-med(280)/vqa-rad(240)/pathvqa(260)/pmc-vqa(270)/omnimedvqa(290)/ehrxqa/slake

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 论文+HF 双可索引;但数据卡 title 沿承上游名(坑 1)干扰检索归类
A 可获取性 5 gated 双仓+禁再分发;协议全文公开、签署即得是补偿项;私有集不可及
I 可互操作 6 JSON 原生机器可读;但 configs 路径失效(坑 3)、字段签署前不可预览(坑 6)、图像在另一仓库
M 元数据质量 7 五技能占比/难度/题式在论文中完备;四口径总数与审阅透明度缺口(坑 2/坑 5)扣分
S 可持续性 6 HF+ReXrank 双平台;但 ReXrank 私有评测构成单点依赖,DUA 终止须销毁数据
综合评级 6.2/10(中) 文档与溯源质量高;获取摩擦与口径混乱拉低,适合机构研究者而非即插即用

附录 C:逐项证据链自证

关键数字 来源 位置/方式
DOI 10.1142/9789819824755_0018 / PMID 41758146 World Scientific/PSB 2026 WebSearch 五源互证(2026-09-29/30)
695,663 splits 加总 论文正文 §3.5 arXiv HTML v1 全文抓取
约 696,000 / 695,000 arXiv 摘要/引言 同上
653,834 HF README 正文 hf-mirror resolve 抓取
599,919(README splits 加总) HF README Dataset Composition 同上
split 明细(489,523/138,993/237,127/95,299 等) HF README 同上
五技能占比 36.5/36.1/20.9/6/<0.5 论文引言与 §3.5.1 arXiv HTML
GPT-4o 两步生成/版本号 论文 §3.3 arXiv HTML
4+3 校验器 论文 §3.3 公式 k=4, l=3 arXiv HTML
8 模型名单与分技能成绩 论文 §5 与 Figure 2 图注 arXiv HTML
人类研究 3×200/83.84/77.27 论文摘要与 §5 arXiv HTML
JSON 三文件字节数 tree API 实测 hf-mirror API 2026-09-30
DUA 全文条款 LICENSE 文件 11,359B 实抓 hf-mirror resolve
gated 拦截报错 train JSON 首部请求实测 hf-mirror 2026-09-30
title 沿承/News 日期 README YAML frontmatter hf-mirror resolve

附录 D:数据获取决策树

需求是什么?
├── 只想"看看长什么样"
│   └── 论文 Figure 1 样例 + 本条目 §2.4 论文口径字段描述(签署前零预览,坑 6)
├── 做模型评测(学术)
│   ├── 1) HF 账号签 ReXVQA gated 协议 → 下三个 JSON(1.58GB)
│   ├── 2) 签 ReXGradient-160K 同族协议 → 下 PNG(跨仓对齐)
│   ├── 3) 公开测试集复现 → 按 §4.5 守则报告
│   └── 4) 要私有集成绩 → 只能 rexrank.ai 提交预测(§5.1)
├── 商业/临床用途
│   └── 直接放弃:DUA 明文禁止,无变通(§6.2)
├── 设计自己的生成式基准
│   └── 读 §3 流水线 + §8.1 骨架;专家抽样率须自行披露
└── 写综述/教学
    └── §2.6 三代表 + §7.3 时间轴 + §7.4 叙事边界表直接引用

附录 E:五技能与临床认知的映射

技能 临床动作原型 失效的临床后果 基准中的角色
存在性评估 “片子上有没有异常?” 漏诊 最大头技能之一,模型区分度最大的单项之一
否定检测 “能确认没有结节吗?” 假阳性/过度随访 占比最高;通用模型反超医学特调模型的单项
鉴别诊断 “最可能是哪个?” 误诊方向错误 难度最高;MedGemma 优势最大(+8.54pp)
定位与分布 “病灶在哪、怎么分布?” 定位错误影响随访方案 小桶技能(约 6%),统计效力中等
几何信息 “结节多大、变大了吗?” 测量误判影响病程评估 最小桶(<0.5%),排序结论不采信

附录 F:生成流水线复现骨架(SOP 模板)

阶段 0 原料与合规(周级)
  - 源文本:结构化报告(四段式或等效),去标识核验
  - 影像关联:study 级 ID 双向可追溯
  - 伦理/协议:数据协议覆盖"衍生题库"条款核查

阶段 1 生成(API 成本主导)
  - 步骤 A:报告 -> bullet points(GPT-4o,保语境压冗余)
  - 步骤 B:bullet -> MCQ(专用 prompt template 内嵌解剖 taxonomy)
  - 难度初评:生成时同步输出 easy/medium/hard

阶段 2 自动质检(代码主导)
  - 结构四门:JSON 合法 / 字段类型 / 选项与解释格式 / 无空值
  - 内容三门:难度校准 / 多样性(近重复检测)/ 语义质量
  - 全过才入池;每题保留七门通过日志

阶段 3 专家环节(人力主导)
  - 抽样审阅:披露抽样率与审阅人数(ReXVQA 未披露——补上这一课)
  - 语义存疑题人工终审;淘汰率入文档

阶段 4 发布治理
  - splits 冻结与加总自检(防坑 2 式四口径)
  - 数据卡与论文数字对齐责任人指定
  - 版本化:清洗事件(如去偏倚)写入 News 并注明影响量级

附录 G:八模型结果登记表(论文口径)

模型 overall(公开测试集) 备注
MedGemma-4B-it 83.24% 总冠军;四技能第一
Eagle2 未披露单项总榜值(论文表) 否定冠军 86.32%;鉴别次名 68.17%
Gemini 未披露(论文表) 否定次名 85.68%;存在前 best 62.17%
Janus-Pro-7B 未披露(论文表) 几何次名 75.42%;定位次名 64.62%
Qwen2.5-VL 未披露(论文表) 定位第三 63.24%;exam quality 60.92%
Qwen2VL 未披露(论文表) 上代对比项
Phi-3.5 未披露(论文表) Figure 1 答错案例主角之一
LLaVA 未披露(论文表) exam quality 10.30% 垫底

注:论文 HTML 版可机读的总体成绩以摘要与图注披露为主(MedGemma 83.24%);其余模型的 overall 数值以论文 Table 2 为准,签署后续更新触发附录 J 触发点。

附录 H:DUA 十一条速查(LICENSE 文件实测)

条 主旨 一句话影响
I 接受协议即约束 下载即签约
II 署名仓库+Gradient Health 所有产出必须署名
III 非商业非临床+十项承诺 用途红线;仅下载必需部分
III.B 四项禁止(重识别/链接/联系受试者) 跨库 join 前过合规
IV 免责声明 数据"AS IS"
V 责任限制 Harvard 免直接损害责任
VI 用户承担责任 违约自负
VII 马萨诸塞州法管辖 诉讼地锁定
VIII 完整协议/可分割性 条款无效不连坐
IX 违规报告义务 24 小时内报 MAIDA 邮箱
X-XII 权属/机构名使用/终止销毁 终止时销毁并可索证明

附录 I:多口径登记表

# 项 口径 A 口径 B 口径 C 口径 D 处理
1 问题总数 695,663(论文 splits 加总) ~696,000(arXiv 摘要)/~695,000(引言) 653,834(HF README) 599,919(README splits 加总) 主口径 A;其余存照
2 医疗系统数 3 家 79 站点(README/上游论文) four(ReXVQA 论文引言) — — 按 A 引,B 存照
3 MedGemma 成绩 83.24%(公开测试集 overall) 83.84%(人类研究 200 例子集) — — 榜单用 A,人机对比用 B
4 论文发表 arXiv 2506.04353(2025-06-04) PSB/Biocomputing 2026(DOI 10.1142/9789819824755_0018) README citation 写 journal=arxiv — 正式引用按 B

附录 J:维护计划与触发点

触发点 条件 动作 优先级
论文 Table 2 全量成绩 获得 PSB 正式版全文 补齐附录 G 空格 1
ReXrank VQA 榜扩容 新模型入榜/机制变更 §5 追记 2
HF 数据卡更新 title 修正/configs 修复/新版本发放 坑 1/坑 3 复核 3
字段结构披露 签署后实测 JSON 或官方数据字典发布 §2.4/附录 N 升级为实测口径 4
DUA 换版 v.2 或许可以外条款出现 §6 重写 5

附录 K:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(论文)+ HF repo(数据)
F2 富元数据 ✅ 论文方法节+五技能占比+难度体系
A1 可访问协议 ⚠️ gated+DUA:签署即得但非开放;私有集仅平台侧
A2 元数据可访问 ✅ 数据卡/论文/LICENSE 全部公开可读
I1 互操作格式 ⚠️ JSON 原生;configs 失效、图像跨仓
I2 词汇表引用 ✅ 五技能锚定既有文献问型
R1 来源溯源 ✅ 上游 ReXGradient-160K 谱系明确
R3 可复现流程 ⚠️ 流水线有骨架但专家抽样率未披露
AI-Ready 综合 中 元数据优、获取中摩擦、二次集成不可行

附录 L:缩写速查

缩写 全称
VQA Visual Question Answering
MCQ Multiple-Choice Question
CXR Chest X-ray
PSB Pacific Symposium on Biocomputing
DUA Data Use Agreement
HMS Harvard Medical School
SNU Seoul National University
LLM / LVM Large Language Model / Large Vision(-Language) Model
HF HuggingFace
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
USMLE United States Medical Licensing Examination

附录 M:基于本数据集的研究检查清单(12 项)

  1. 许可核对:用途是否落在"非商业+非临床"内?越线即止,无变通。
  2. 口径声明:问题总数、MedGemma 成绩、系统数——每个数字注明口径编号(附录 I)。
  3. 双仓对齐:问答 JSON 的 study/图像标识与上游 PNG 的对齐脚本先于任何模型实验。
  4. configs 失效:加载脚本按实际文件树(三个 _vqa_data.json)写,不按数据卡 configs(坑 3)。
  5. 字段实证:字段名以签署后实际 JSON 为准;论文口径字段描述(§2.4)仅作设计参考。
  6. 技能分层:模型对比结论只在存在/否定/鉴别三大技能上作正式表述(§4.5 守则三)。
  7. 解释分量:严格复现含 (y,E) 元组;降配复现须在论文中声明。
  8. 人机对比表述:凡引"超过人类"必挂住院医/200 例/封闭题三重边界(§7.4 模板)。
  9. 再分发红线:聚合基准、数据目录、衍生发放均触碰 DUA 第 III.B 条——内部使用为主。
  10. 销毁义务:项目终止时销毁数据并可被要求出具证明——数据留存策略提前设计。
  11. 引用完整:基准引 pal2025rexvqa(PSB 2026 口径)、图像引 zhang2025rexgradient、平台引 zhang2024rexrank。
  12. 时点存照:HF README 数字随清洗事件变动,引用注明抓取日期(本条目基准时点 2026-09-30)。

附录 N:问答记录数据字典(论文口径,签署前推断版)

字段(语义) 类型(推断) 取值域 依据
问题文本 string 自然语言问句 论文任务定义 Q_i
四选项 list[string] 长度 4 O_i =
正确答案索引 int y∈{0,1,2,3}(论文公式)
解释文本 string 最低长度有校验(v₃ 门) Format Validator
难度 string/enum easy/medium/hard Difficulty Classification
技能类别 string/enum 五技能 §3.5.1
解剖类别 string taxonomy 类别(呼吸/心血管/器械/肌骨等) §3.3 taxonomy
study/图像标识 string/int 关联上游 ReXGradient-160K README 对齐逻辑

升级路径:本表为论文口径推断版(坑 6);签署后实测字段名/类型/嵌套结构后按附录 J 触发点 4 升级为实测版。抽样自检建议:技能类别分布应复现 36.5/36.1/20.9/6/<0.5 的大致形状;难度三档应均有覆盖。

附录 O:引文规范

@inproceedings{pal2026rexvqa,
  title     = {ReXVQA: A Large-scale Visual Question Answering Benchmark
               for Generalist Chest X-ray Understanding},
  author    = {Pal, Ankit and Lee, Jung-Oh and Zhang, Xiaoman and
               Sankarasubbu, Malaikannan and Roh, Seunghyeon and
               Kim, Won Jung and Lee, Meesun and Rajpurkar, Pranav},
  booktitle = {Biocomputing 2026: Proceedings of the Pacific Symposium},
  publisher = {World Scientific},
  year      = {2026},
  doi       = {10.1142/9789819824755_0018}
}

@article{pal2025rexvqa,
  title   = {ReXVQA: A Large-scale Visual Question Answering Benchmark
             for Generalist Chest X-ray Understanding},
  author  = {Pal, Ankit and Lee, Jung Oh and Zhang, Xiaoman and
             Sankarasubbu, Malaikannan and Roh, Seunghyeon and
             Kim, Won Jung and Lee, Meesun and Rajpurkar, Pranav},
  journal = {arXiv preprint arXiv:2506.04353},
  year    = {2025}
}

@article{zhang2025rexgradient,
  title   = {ReXGradient-160K: A Large-Scale Publicly Available Dataset
             of Chest Radiographs with Free-text Reports},
  author  = {Zhang, Xiaoman and Acosta, Juli{\'a}n N. and Miller, Josh and
             Huang, Ouwen and Rajpurkar, Pranav},
  journal = {arXiv preprint},
  year    = {2025}
}

@article{zhang2025rexrank,
  title   = {ReXrank: A Public Leaderboard for AI-Powered Radiology
             Report Generation},
  author  = {Zhang, Xiaoman and Zhou, Hong-Yu and Yang, Xiaoli and
             Banerjee, Oishi and Acosta, Juli{\'a}n N and Miller, Josh and
             Huang, Ouwen and Rajpurkar, Pranav},
  journal = {AAAI Bridge Program AIMedHealth},
  year    = {2025}
}

附录 P:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
本体论文 “ReXVQA” OR doi:10.1142/9789819824755_0018 OR arXiv:2506.04353 PSB 2026 章节页/arXiv 页
数据仓库 site:huggingface.co ReXVQA / HF API datasets?search=ReXVQA rajpurkarlab/ReXVQA
上游影像 ReXGradient-160K(本库 rid 717 条目) 同族协议与影像规格
平台 rexrank.ai ReXrank 榜单(报告生成+VQA)
团队谱系 Rajpurkar lab datasets / monk1337 PSB-Conference-2025 系列数据集与补充材料
技能框架 “negation assessment” “chest X-ray” benchmark 本体论文及引用者
反例(勿用) 数据卡标题 “ReXGradient-160K Dataset” 直搜 会命中的是上游而非本条目(坑 1)

检索卫生两条:一、以 HF 数据卡标题定位本数据集会走错仓库——认准仓库名 ReXVQA 与论文标题双锚点;二、README 正文数字(653,834 与 splits 表)是发放时点快照,引用注明抓取日期并对照论文口径。


尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(arXiv:2506.04353 / PSB 2026,DOI 10.1142/9789819824755_0018)、HF 数据卡与 LICENSE 文件(hf-mirror 实抓)、仓库文件树 API 实测与 gated 拦截实测为源;问题总数四口径、数据卡沿承上游 title、configs 失效、医疗系统数 3/4 冲突、83.24 与 83.84 双数字等原始文档缺陷已在坑点与附录 I 存照。条目与库内 ReXGradient-160K(rid 717,直接上游)、VQA-MED(rid 280)、VQA-RAD(rid 240)、PathVQA(rid 260)、PMC-VQA(rid 270)、OmniMedVQA(rid 290)等条目互链,构成医学 VQA 家族三代技术路线的完整检索面。后续维护触发点见附录 J。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • rex-in-the-wild — 共享标签:多模态 / 视觉问答 / 医学问答 / 评测基准
  • vqa-med — 共享标签:医学影像 / 多模态 / 视觉问答
  • 3dreasonknee — 共享标签:医学影像 / 多模态 / 视觉问答 / 评测基准
  • omnimedvqa — 共享标签:医学影像 / 视觉问答 / 评测基准
  • pathvqa — 共享标签:多模态 / 视觉问答 / 评测基准
  • derm1m — 共享标签:多模态 / 视觉问答 / 评测基准
  • medreco-db — 共享标签:多模态 / 视觉问答 / 医学问答
  • mimic-cxr — 共享标签:医学影像 / X光影像 / 多模态
  • latte-cxr — 共享标签:医学影像 / X光影像 / 多模态
  • ms-cxr-t — 共享标签:医学影像 / X光影像 / 多模态 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集