信息速览
ReXVQA — 大规模胸片视觉问答基准 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ReXVQA |
| 英文全称 | ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding |
| 别名/简称 | ReXVQA(注意与上游图像源 ReXGradient-160K、排行榜 ReXrank 是三个不同的东西,见 §8.1) |
| 疾病分类 | 胸部影像全疾病谱(ICD-11:CA4Z 肺炎 / CB27 胸腔积液 / CB4Z 心力衰竭 / 1B2Z 肺结核等,详见 §2.1) |
| SNOMED CT | 233604007 Pneumonia / 15485004 Pleural effusion / 84114007 Heart failure / 300936004 Ischemic heart disease(详见 §2.1) |
| 数据模态 | 胸部 X 光影像(上游 PNG)+ 英文 MCQ 问答对(四选项 + 解释) |
| AI 任务类型 | 医学视觉问答(VQA)、多模态医学知识评测、读片技能画像、人类对照评测 |
| 样本总数 | 论文口径约 695,663 道 MCQ / 160,000 项检查(上游);HF README 口径 653,834 道(公开+私有加总 599,919,四口径存照见坑 2 与附录 I) |
| 数据大小 | 约 1.58GB(3 个 JSON 实测:1,388,369,965 B + 97,501,862 B + 98,707,686 B);图像本体在上游仓库 |
| 数据格式 | JSON(问答对);图像为上游 16-bit PNG(DICOM 降采样至原图 25%) |
| 许可证 | ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1(HF license: other / license_name: rexgradient) |
| 访问级别 | 申请审核(HuggingFace gated:签署非商业协议;协议受马萨诸塞州法管辖) |
| DUO 标签 | NPUNCU(非商业非营利);图像与报告本体在上游,DUO 语义由上游协议承载 |
| 语言 | 题干与选项为英文 |
| 首发日期 | 2025-06-04(arXiv v1 论文随附发布;数据卡 News 显示 2024-11-14 已有一轮样本修订,见坑 8) |
| 最后更新 | 2025-06(arXiv v2 修订);正式版发表于 Biocomputing/PSB 2026(DOI 10.1142/9789819824755_0018) |
| 发布机构 | Rajpurkar Lab(哈佛医学院)× Saama AI Research × 首尔国立大学 |
| 官方主页 | https://huggingface.co/datasets/rajpurkarlab/ReXVQA |
| 下载地址 | https://huggingface.co/datasets/rajpurkarlab/ReXVQA(gated,需先签署非商业协议;图像另赴 ReXGradient-160K) |
| DOI | 10.48550/arXiv.2506.04353(预印本);正式版 10.1142/9789819824755_0018(PSB 2026,PMID 41758146) |
| 引用次数 | 精确计数以 Google Scholar 页面为准(截至 2026-09 查询时点未采信具体数字;论文 2025-06 首发、PSB 2026 正式发表) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方 train/valid/test 三分 + 统一 JSON 格式 + 逐题难度与技能标签;扣分项:图像与问答分仓(需配合上游仓库)、gated 双重门、README 与论文数字口径分叉、无官方评测代码 |
| 页面状态 | published |
导语读法三则:
- 只想下数据:直奔 §6.2 获取流程——注意这里是"双重门"(HF 账号 + 签署协议),而且问答 JSON 里没有图像,必须同时拿上游 ReXGradient-160K 的胸片(JSON 与图像分仓,见 §3.3)。
- 关心数字口径:直奔坑 2(问题总数四口径,含 split 双口径)与附录 I 多口径登记表——论文说 695,663 道、README 说 653,834 道,两个都对,取决于你读哪份文档。
- 做模型评测:先读 §5.2 的 ReXrank 分工声明——公开测试集(40,826 或 34,889 道,视口径)与私有测试集(41,007 道)是两个集合,混用是审稿高危错误。
§0 E-E-A-T 信任声明与免责声明
审核声明:本条目由千方病案医数集编辑部于 2026-09-30 基于一手来源撰写与审核。核心事实经三源互证:arXiv 论文 HTML 正文(2506.04353v1)、HuggingFace 数据卡与仓库文件树实测(经 hf-mirror.com 镜像端点)、以及 World Scientific 会议版(Biocomputing/PSB 2026)出版记录。所有关键数字在正文标注出处;文档之间的数字冲突不在正文中强行统一,而是在坑点与附录 I 逐条存照。
医学免责声明:本条目为数据集技术文档,不构成临床建议。ReXVQA 的题目由大语言模型从放射报告中自动生成,虽经校验器与专家审阅,但不应被视为放射科医生书写的教学金标准;任何基于本数据集训练或评测的模型,其输出均不得直接用于临床诊断决策。数据许可明确禁止商业用途与临床用途。
数据免责声明:本条目所述数据以发布时点的官方仓库状态为准(抓取时点 2026-09-30)。HuggingFace 数据卡与论文存在多处数字口径差异(问题总数、split 规模、health systems 数量),本条目以"论文口径"与"README 口径"双轨陈述,检索者引用任何数字前应先核对附录 I 的口径登记表。
AI 参与声明:本条目由 AI 辅助起草并经人工校验(详见 §10 AI 使用声明卡)。
§1 数据集概览
§1.0 30 秒速览
- 一句话:ReXVQA 把 16 万份胸片检查的真实放射报告,用 GPT-4o 转成了约 69.5 万道仿 USMLE(美国执业医师考试)风格的四选一选择题,把"胸片理解"变成了一场可以打分的大考。
- 谁出的:哈佛医学院 Rajpurkar 实验室(Pranav Rajpurkar 组)+ Saama AI Research + 首尔国立大学,8 位作者。
- 考什么:五类放射读片核心技能——presence(病灶存在性,36.1%)、negation(否定性,36.5%)、differential diagnosis(鉴别诊断,20.9%)、location & distribution(定位与分布,约 6%)、geometric information(几何信息,不足 0.5%)。
- 结果如何:MedGemma-4B-it 在 8 个开源多模态模型中以 83.24% 总体准确率居首,并在 200 例人类对照研究中首次超越 3 名放射科住院医(83.84% vs 77.27%)。
- 怎么拿:HuggingFace gated 仓库(签署非商业协议),3 个 JSON 共约 1.58GB;胸片图像在另一个仓库(上游 ReXGradient-160K,同协议)。
- 三个数字陷阱:问题总数四口径、split 双口径、health systems 3 vs 4——全部存照于 §10 与附录 I。
§1.1 技术摘要
ReXVQA(读作"ReX-V-Q-A",Re 前缀承自同实验室的 ReXGradient 与 ReXrank 系列)是一个基准型医学视觉问答(VQA)数据集。它的技术路线是"生成式评测集":不从零标注,而是复用同实验室 2025 年 5 月发布的 ReXGradient-160K 胸片-报告配对库,把其中每份报告交给 GPT-4o(2024-05-01-preview,Azure OpenAI API)做两阶段转换——先把报告转成结构化要点,再按专用医学题式模板生成四选项 MCQ(question stem + 4 options + 正确索引 y∈{0,1,2,3} + 解释 E),生成过程由解剖学分类体系(呼吸/心血管/医疗器械/肌骨等)引导以保证覆盖面。
质控流水线分三层:4 个结构校验器(JSON 结构、数据类型、格式、完整性)做格式把关;3 个内容校验器(难度分类、多样性、内容)做语义把关;最后由专家完成难度三级(easy/medium/hard)终审与抽检。所有通过校验的题目按约 92%/6%/6% 的比例切分为训练/验证/公开测试三部分(论文口径),另有 41,007 道私有测试题不随仓库发布,专供 ReXrank 排行榜在线评测。
评估侧的意义在于给"通用ist 胸片理解"定锚:论文系统评测 8 个开源多模态模型(含医疗特调的 MedGemma-4B-it 与通用模型 Gemini、Qwen2.5-VL 等),发现通用模型在 presence 类问题上与医疗特调模型差距最大(Gemini 62.17% vs MedGemma 85.21%),而医疗特调模型在 negation、鉴别诊断、定位上的优势同样显著。人类对照研究(3 名放射科住院医 × 200 例)中 MedGemma 83.84% vs 最佳住院医 77.27%,是"AI 在大规模胸片 MCQ 基准上超越人类住院医"的标志性结果。
§1.2 战略价值
- 规模断层:在此之前的医学 VQA 基准体量在 10^3–10^5 量级——VQA-RAD 3,515 题、PathVQA 约 5,000 题(论文口径 32,799 图文对)、PMC-VQA 约 21 万题但为二元封闭式、EHRXQA 依靠结构化电子病历查询模板合成。ReXVQA 以约 69.5 万道选择题一举把体量推到 10^6 边缘,且每题带解释与难度标签,支持按技能×难度二维切片评测。
- 技能框架可迁移:五技能分类(presence/negation/diff dx/location/geometric)源自对放射科读片认知任务的系统梳理(论文引用 VQA-RAD 的任务分类、Goryachev 等对 negation 临床重要性的研究), negation 与 presence 合计约 72% 的分布本身就是对"读片首先回答有/无"这一临床直觉的量化。这个框架后来被同系列工作复用,可作为其他影像模态 VQA 基准的设计模板。
- “报告驱动"而非"模板驱动”:论文明确把自身与既有 VQA 数据集的差异化定位为"问题源自真实临床报告而非人工模板或通用图像标注"。报告四段结构(Indication/Comparison/Findings/Impression)保留了临床语境,题目天然带"检查指征与前后对比"信息,这是 MIMIC-CXR-VQA 类结构化标签法覆盖不到的。
- 排行榜闭环:私有测试集挂接 ReXrank(rexrank.ai),形成"公开集自测 + 私有集防过拟合刷榜"的两级评测体系,与 ReXGradient-160K(预训练语料)、ReXErr-v1(报告错误标注)构成同实验室的胸片 AI 评测全家桶。
§1.3 同类数据集横向对比
| 数据集 | 年份 | 规模 | 题型 | 图像源 | 标注方式 | 库内条目 |
|---|---|---|---|---|---|---|
| VQA-RAD | 2018 | 3,515 题 | 开放+封闭混合 | 315 张胸片 | 医生人工 | vqa-rad(240) |
| SLAKE | 2021 | 28,398 题 | 开放+封闭 | 10,282 张多模态影像 | 医生双语标注 | slake |
| VQA-MED | 2019 起 | 年度挑战赛制 | 开放+封闭 | 每届数千张 | 医生+众包 | vqa-med(280) |
| PathVQA | 2020 | 约 32,799 图文对/约 5,000 QA 口径 | 开放+封闭二元 | 病理切片 | 从教科书图文自动提取 | pathvqa(260) |
| PMC-VQA | 2023 | 约 21.5 万题 | 二元封闭式 | PubMed 文献图 | 自动生成+人工校验 | pmc-vqa(270) |
| OmniMedVQA | 2024 | 约 11.8 万题聚合 | 选择题 | 12 个开源数据集聚合 | 聚合再标注 | omnimedvqa(290) |
| EHRXQA | 2023 | 约 4.3 万题 | 模板合成问答 | MIMIC-CXR | 结构化 EHR 查询模板合成 | ehrxqa |
| ReXVQA | 2025 | 约 69.5 万题(四口径) | 四选项 MCQ+解释 | ReXGradient-160K 胸片 | GPT-4o 报告生成+校验器+专家审阅 | 本条目 |
读表三要点:第一,ReXVQA 的规模是 VQA-RAD 的约 200 倍,但单题信息密度更低(生成式 vs 人工精标)——两者不是替代关系而是互补关系,VQA-RAD 恰好被 ReXVQA 论文引用为任务分类框架的参照。第二,表中除 ReXVQA 与 EHRXQA 外均为人工标注或人工校验为主,"生成式基准"的代表是本条目与 EHRXQA 两条技术路线:前者从自由文本报告生成,后者从结构化数据库模板合成。第三,全表仅 SLAKE 提供双语,ReXVQA 为纯英文。
§1.4 版本时间轴
| 时点 | 事件 | 依据 |
|---|---|---|
| 2024-11-14 | 数据卡 News:“Dataset updated to remove biased samples and balance answer options”——早于论文半年,说明语料在发布前已迭代过至少一轮 | HF README News 区 |
| 2025-05 | 上游 ReXGradient-160K 发布(arXiv:2505.00228),提供图像与报告底座 | 上游论文 |
| 2025-06-04 | arXiv 2506.04353 v1 首发,ReXVQA 随论文发布(HF 仓库开通) | arXiv |
| 2025-06-06 | arXiv v2 修订(v2 页面无正文文档,条目按 v1 存照) | arXiv 版本记录 |
| 2025-04-07 | 数据许可协议版本落款(Non-Commercial Data Access and Use Agreement v.1) | LICENSE 文件头部 |
| 2026-01 | 正式版发表于 Biocomputing/PSB 2026(World Scientific),DOI 10.1142/9789819824755_0018,PMID 41758146 | World Scientific/PMID |
注意两个反直觉的时间细节:其一,News 日期(2024-11)早于论文(2025-06),加上数据卡 YAML 沿用上游标题(坑 1),说明该数据卡是从 ReXGradient-160K 复制改造而来,News 区也是沿承痕迹;其二,LICENSE 协议落款(2025-04-07)早于论文发布两个月,说明发布流程在论文定稿前已走完法务。
§1.5 典型应用场景
- 医疗 VLM 能力画像:8 个模型 × 5 技能 × 3 难度的三维切片矩阵(§5.3),适合做模型选型与能力短板诊断——例如某模型 negation 得分高但 diff dx 低,提示其"看得到但推不动",应补充鉴别诊断类推理训练。
- 人类对照与教育研究:200 例人类对照子集 + 住院医成绩(77.27%)提供了医学教育场景的锚点,可用于住院医培训效果追踪或 AI 辅助教学设计(注意:题目为 AI 生成,教学使用需教师复核)。
- 医疗 MCQ 生成方法研究:两阶段生成 + 7 校验器 + 难度分级的流水线(§3.5)是"LLM 自动出题"的完整范本,可迁移到其他报告型临床文本。
- ReXrank 在线评测:不想本地搭评测环境的团队直接提交 ReXrank(§8.1),用 41,007 道私有测试题获得防过拟合的公开排名。
- 预训练+评测一体化管线:用上游 ReXGradient-160K 做视觉-语言预训练、用 ReXVQA 做能力评测,同源数据避免域漂移,是同实验室推荐的自洽闭环。
§2 医学背景
§2.1 ICD-11 与 SNOMED CT 映射
ReXVQA 的题目由解剖学分类体系(anatomy taxonomy)引导生成,覆盖呼吸系统、心血管系统、医疗器械、肌骨系统等胸片可显影范畴。与 ICD-11 及 SNOMED CT 的映射关系如下(映射为本条目整理,数据集本身不带 ICD-11 编码):
| 题目覆盖范畴 | 代表性发现 | ICD-11 编码 | SNOMED CT |
|---|---|---|---|
| 呼吸系统-感染 | 肺炎、浸润影 | CA40-Z 肺炎类 | 233604007 Pneumonia |
| 呼吸系统-胸腔 | 胸腔积液、气胸 | CB27 胸腔积液 / CB21 气胸 | 15485004 Pleural effusion / 36118008 Pneumothorax |
| 心血管 | 心影增大、肺水肿、充血性心力衰竭 | CB4Z 心力衰竭 / BA5Z 缺血性心脏病 | 84114007 Heart failure / 300936004 Ischemic heart disease |
| 医疗器械 | 气管插管、中心静脉导管、起搏器、引流管 | X 系列结局测量类(器械在位) | 12564008 Endotracheal tube 等器械概念 |
| 肌骨 | 肋骨骨折、脊柱侧弯、肩关节术后 | ND56 肋骨骨折等 | 283380008 Rib fracture |
| 肿瘤性病变 | 肺结节、肿块、纵隔增宽 | 2A00-Z 肺部占位类 | 34456004 Pulmonary nodule |
上表只列代表锚点,ReXVQA 的 category 字段(五技能)与 ICD-11 是正交的两个维度:前者描述"读片认知操作"(回答有/无/在哪里/最像什么),后者描述"临床实体"。检索者在做疾病分层评测时应从题干文本自行抽取疾病实体,不能直接复用 category 字段——这是本数据集与 ChestX-ray14 类"逐图贴病签"数据集在结构上的关键差异。
§2.2 疾病背景与流行病学
胸片是全世界影像量最大的检查之一,也是急诊与基层医疗机构的首选胸部检查。读片认知研究(论文引用 Goryachev 等 2007 年对放射报告否定句的研究)显示,放射报告中的否定表述(“no pneumothorax”“no evidence of consolidation”)出现频率极高,是报告的结构性组成——这也解释了 ReXVQA 五技能分布中 negation 占 36.5% 的现实来源:绝大多数胸片检查的结论是"阴性发现",把阴性发现问对、答对,本身就是读片能力的主要成分。
上游 ReXGradient-160K 的报告来自 79 家站点的常规诊疗(routine care),覆盖门诊随访、急诊、住院与床旁检查的全谱系,因此 ReXVQA 的疾病先验分布接近真实临床流量的分布——常见病(肺炎、心衰、胸腔积液、COPD 急性加重)占绝对多数,罕见病样本稀少。这意味着:在 ReXVQA 上评测的模型表现"贴近日常读片负荷",但不能由此推断罕见病读片能力;罕见病研究者应把本基准当作"基础盘"而非"全谱系"。
§2.3 临床任务定义:五技能框架
ReXVQA 把胸片读片拆解为五类可评测的认知技能,这是理解本数据集的钥匙(分布数字出自论文引言):
| 技能 | 英文 | 占比 | 认知操作 | 题目示例形态 |
|---|---|---|---|---|
| 存在性判断 | presence | 36.1% | 回答"有没有某发现" | “Is there evidence of pleural effusion?” |
| 否定性判断 | negation | 36.5% | 回答"是否确认某阴性发现" | “Which finding is absent from the image?” |
| 鉴别诊断 | differential diagnosis | 20.9% | 多发现比较、最可能诊断推理 | “What is the most likely diagnosis given…?” |
| 定位与分布 | location & distribution | 约 6% | 空间定位、单双侧、肺野分布 | “Where is the consolidation located?” |
| 几何信息 | geometric information | 不足 0.5% | 大小、角度、管端位置测量 | “Is the endotracheal tube tip above the carina?” |
四个使用要点:
- 分布不均衡是特性不是缺陷:negation+presence 合计约 72%,忠实反映了放射报告的语言构成。做技能均衡评测时应按 category 字段分层抽样,而不是随机抽全量(全量结果会被两大类主导)。
- geometric 类样本稀少:不足 0.5%(按论文口径约 3,000 道以内)意味着该技能上任何模型对比都缺乏统计功效,论文自己也只在 Geometric Information Assessment 小节做参考性讨论(MedGemma 80.45%、Janus-Pro-7B 75.42%),不宜作为结论依据。
- 四选项 + 解释元组:与一般 VQA 的"开放生成"或"二选一"不同,ReXVQA 采用 USMLE 风格四选项(y∈{0,1,2,3}),且要求模型输出 (y, E)——正确选项索引加解释。这使评测可以同时考察答案正确性与解释合理性,是仿医学执照考试的判定范式。
- 难度三级:easy/medium/hard 由 LLM 初评、专家验证,支持"同技能不同难度"的稳健性分析。论文按难度分层报告了结果(见 §5.3)。
§2.4 患者人群构成
ReXVQA 本身不发布患者人口学数据;人群属性全部继承上游 ReXGradient-160K:
- 规模:160,000 项检查 / 273,004 张图像 / 109,487 名患者 / 79 家医疗站点。
- 患者级分布(HF README 口径,随问答对统计):训练 split 覆盖 95,299 名患者 / 138,993 项检查 / 237,127 张图像;验证 split 6,953 名患者;公开测试 split 6,801 名患者;私有测试 10,000 项检查。
- 站点构成:79 家站点;README 与上游数据卡写"3 个美国医疗系统",论文引言写"four U.S. health systems"——两口径冲突存照于坑 4。
- 检查类型:常规诊疗胸片(含床旁/AP 位),图像为 DICOM 转 16-bit PNG 并降采样至原图 25%。
需要特别强调的是患者与题目不是一对一:一份报告可生成多道题(平均每检查约 3.6–4.3 道,视口径),同一患者的多份报告也可能各自产题。官方 split 按"检查级"切分(README 统计了各 split 的 unique studies 与 patients,分母互斥),但检索者自行重切时若不按患者分桶,会出现同一患者跨集——这是 §5.3 泄漏风险的核心。
§2.5 临床价值定位
ReXVQA 在临床 AI 证据链中的位置是"能力测评层"而非"辅助决策层":
- 对模型开发者:它是目前规模最大、技能框架最完整的开源胸片 MCQ 基准,适合在模型发布前做能力画像与回归测试;但非商业协议禁止把评测结果作为商业宣称的直接依据(需另获授权)。
- 对临床科室:83.84% vs 77.27% 的人类对照结果说明,医疗特调 VLM 已能在"考试式"读片任务上超过住院医平均线——这为"AI 二读""住院医自测工具"等应用提供了量化依据,但距独立诊断仍有距离(题目是四选一,错误率被选项猜中率兜底在 25% 之下,与开放读片的难度不同质)。
- 对医学教育:难度三级 + 解释元组天然适合做题库。但必须注意题目为 AI 生成,教学引用前应由带教医师复核题干与答案(论文未披露全量专家逐题复核,见 §7.2)。
- 对政策与卫生经济研究:五技能框架提供了"AI 读片能力应按技能采购/认证"的讨论基础——一个 negation 满分的模型未必能做鉴别诊断,技能级报告比单一总分更能支撑分级准入决策。
§2.6 金标准描述:报告四段结构与题目生成语境
ReXVQA 没有传统意义的"金标准标注",其"真值"由上游报告承载。理解上游报告的四段结构(ReXGradient-160K 用 GPT-4o 辅助从自由文本抽取)是理解题目生成语境的前提:
| 段 | 内容 | 对题目生成的意义 |
|---|---|---|
| Indication | 检查指征 | 提供临床语境,常出现在题干的病例背景里 |
| Comparison | 与前片对比 | 生成"较前变化"类题目(含时间推理) |
| Findings | 系统性发现描述 | 存在性/定位/几何题的主要事实来源 |
| Impression | 结论印象 | 鉴别诊断题与否定性结论的主要来源 |
对"金标准"的三层理解:
- 第一层(图像事实):胸片本体,来自上游 79 站点 DICOM,已去标识、16-bit PNG、降采样 25%——图像质量受上游处理决定,ReXVQA 不改写。
- 第二层(报告真值):放射医生的自由文本报告经 GPT-4o 结构化。报告本身是临床工作的真实产物(高保真),但四段划分是模型决策(有结构化噪声,上游论文承认非全量人工复核)。
- 第三层(题目真值):GPT-4o 从报告生成 MCQ,经 7 校验器 + 专家审阅。题目答案的正确性以报告为准——报告写错,题目跟着错;报告含糊,题目的"最可能诊断"就有解释空间。论文通过校验器压低此类噪声,但未提供端到端的错误率数字,这是引用本基准时应保留的不确定性。
一句话总结:ReXVQA 的真值链条是"报告→题目"的单向传递,它评测的是模型对报告所载临床事实的理解,而不是对图像的独立诊断能力——两者的差距正是生成式基准方法论的核心议题(见 §8.4)。
§3 数据集规格
§3.0 版本与获取渠道抉择矩阵
| 你的需求 | 应取的数据 | 渠道 | 许可动作 |
|---|---|---|---|
| 只做 VQA 模型评测(不想碰图像) | 不成立——评测必须配图 | ReXVQA(问答)+ ReXGradient-160K(图像) | 两个仓库各签一次同款协议 |
| 完整复现论文评测(8 模型 × 5 技能) | ReXVQA 公开三分 + 上游图像 | 两仓库 + 本条目 §6 代码 | 同上 |
| 提交排行榜 | 只需推理端点/预测文件 | ReXrank(rexrank.ai)在线提交 | 遵守 ReXrank 条款 |
| 只想读题研究 MCQ 生成方法 | ReXVQA JSON 即可 | ReXVQA gated 仓库 | 签署协议 |
| 商业用途 | 需另行授权 | 联系 Gradient Health / 数据卡邮箱 | 单独商业许可 |
| 引用数字写论文 | 论文 + 数据卡双口径核对 | arXiv 2506.04353 + HF README | 按坑 2/4/7 声明口径 |
§3.1 模态详情
- 图像模态(上游承载):胸部 X 光,DICOM 原始采集经光度反转(MONOCHROME1)、16-bit 最小-最大归一化、cubic 插值降采样至原图 25% 后存储为 PNG;含 PA/AP/LAT 多视角与床旁片。
- 文本模态(本仓库承载):每道 MCQ 含英文题干(question)、四个选项(options)、正确索引(answer,y∈{0,1,2,3})、解释(explanation)、难度(difficulty:easy/medium/hard)与技能类目(category:五类之一)。字段语义按论文 §3.3 与数据卡描述整理;因 gated 限制,本条目撰写时点未能对 JSON 原始文件采样核实(存照见坑 6 与附录 N)。
- 关系结构:题目→报告→检查→患者→图像的多级外键。本仓库的 JSON 未随附图像路径文件(上游 metadata 才有),检索者需自行按 study/image 标识对齐两侧仓库。
§3.2 按子集样本数
论文口径(主口径,splits 加总 695,663):
| Split | 题目数 | 占比 |
|---|---|---|
| Training | 572,952 | 82.4% |
| Validation | 40,878 | 5.9% |
| Public Test | 40,826 | 5.9% |
| Private Test(ReXrank 专用) | 41,007 | 5.9% |
| 合计 | 695,663 | 100% |
HF README 口径(数据卡,公开 JSON 加总 599,919):
| Split | QA pairs | Studies | Images | Patients |
|---|---|---|---|---|
| Training | 489,523 | 138,993 | 237,127 | 95,299 |
| Validation | 34,500 | 9,901 | 16,837 | 6,953 |
| Public Test | 34,889 | 9,957 | 16,937 | 6,801 |
| Private Test | 41,007 | 10,000 | — | — |
| 合计 | 599,919 | 168,851 | — | — |
两口径的差异与归因见坑 2 与附录 I。简言之:README 数字合计(599,919)比论文(695,663)少约 9.6 万道,且数据卡 News 记录 2024-11-14"移除偏倚样本"——最合理的解释是数据卡落后于论文的最终生成池。复现论文用论文口径,检查仓库文件用 README 口径。
§3.3 数据格式
仓库 metadata/ 目录实测文件清单(hf-mirror tree API,2026-09-30):
metadata/
├── train_vqa_data.json 1,388,369,965 B(约 1.29 GiB,LFS)
├── valid_vqa_data.json 97,501,862 B(约 93 MiB,LFS)
└── test_vqa_data.json 98,707,686 B(约 94 MiB,LFS)
- 三个 JSON 文件均为 LFS 对象,合计 1,583,579,513 字节(约 1.58GB / 1.47 GiB)。
- 仓库另有 README.md(数据卡)与 LICENSE(协议全文,11,359 字节实测)。
- 图像文件不在本仓库——README 明示 PNG 存于 ReXGradient-160K 仓库;本仓库 configs 段引用的
metadata/{train,valid,test}_metadata.csv在文件树中不存在(沿承上游数据卡的复制痕迹,坑 3)。 - 数据卡 configs 声称 train/test 配置指向本仓库文件树中不存在的路径;实际可用的就是上述三个 JSON。
§3.4 存储大小
| 项 | 大小 | 说明 |
|---|---|---|
| 问答语料(本仓库) | 约 1.58GB | 3 JSON,上表实测字节 |
| 上游图像(另下) | 上游未披露总体积 | 273,004 张 16-bit PNG(降采样 25%) |
| 完整评测环境 | 建议预留 ≥50GB | 图像 + 解压缓冲 + 模型权重(8 模型并行评测另计) |
注意 JSON 的加载效率:train 文件 1.29 GiB 用 json.load 全量载入内存峰值约 4–8GB(Python 对象膨胀),16GB 内存以下机器建议用流式解析或先转换为 Parquet(§6.3 提供转换代码)。
§3.5 标注方式
生成式标注流水线全貌(论文 §3):
ReXGradient-160K 放射报告(160,000 份,英文自由文本)
│
▼ 阶段一:报告结构化
GPT-4o (2024-05-01-preview, Azure OpenAI API)
把报告转成结构化 bullet points(要点化,去口语冗余)
│
▼ 阶段二:MCQ 生成
专用 medical prompt template 生成四选项 MCQ
├── 解剖 taxonomy 引导(呼吸/心血管/器械/肌骨…)
├── 五技能分配(presence/negation/diff dx/location/geometric)
└── 输出 (题干, 4 选项, y∈{0,1,2,3}, 解释 E)
│
▼ 三层质控
① 4 个结构校验器:JSON 结构 / 数据类型 / 格式 / 完整性
② 3 个内容校验器:难度分类 / 多样性 / 内容
③ 难度三级初评(easy/medium/hard)→ 专家审阅阶段终验
│
▼
按约 92/6/6 三分(train/valid/public test)+ 41,007 私有测试
三个方法论要点:第一,"两阶段"的意义在于先把自由文本压成事实要点再出题,避免题干直接复述报告长句导致答案泄露;第二,校验器是代码化的确定性检查(结构类)与 LLM 评审(内容类)的混合,比纯人工筛查可扩展得多,这也是 69.5 万量级能够达成的前提;第三,专家环节的作用是难度校准与抽样审阅,不是全量逐题复核——数据卡未披露专家审阅的覆盖率(见 §7.2)。
§3.6 标注者资质与一致性
- 生成模型:GPT-4o(2024-05-01-preview),通过 Azure OpenAI API 调用——版本锁定保证了生成行为的可复现窗口,但 OpenAI 已退役该版本,日后复现需注意模型快照差异。
- 专家审阅:论文提及 Expert Review Phase 与难度验证,作者团队含放射科临床背景成员(首尔国立大学团队,Seunghyeon Roh、Won Jung Kim、Meesun Lee),但未披露逐题复核比例、专家人数与 Kappa 一致性指标——这是与人工标注数据集(如 VQA-RAD 报告的双医生标注一致率)相比最大的方法论缺口。
- 人类对照研究:3 名放射科住院医(radiology residents)完成 200 例随机样本测试,提供了人类成绩锚点(最佳 77.27%),但样本量与资质层级(均为住院医,无 attending 层)限制了"超越人类专家"表述的强度——准确说法是"超越人类住院医"。
§3.7 采集周期
- 上游报告采集:ReXGradient-160K 于 2025-05 发布,79 站点常规诊疗数据的回溯性汇集(具体采集窗口上游论文口径,本数据集不重复采集)。
- MCQ 生成窗口:2024 年内(数据卡 News 2024-11-14 已完成一轮修订,论文 2025-06 发布)。
- 版本节奏:ReXVQA 无 v2 数据发布记录;论文 v2(2025-06-06)为文本修订。数据卡 lastModified 与仓库变更需在引用时自查(hf-mirror 端点可查)。
§3.8 地域覆盖
- 上游 79 家站点为全球多站点(Gradient Health 汇聚),其中美国医疗系统数量存在口径冲突:论文引言 “sourced from four U.S. health systems” vs README/上游数据卡 “3 U.S. health systems”(坑 4 存照)。
- 题目语言为英文;上游报告为英文自由文本。
- 本条目撰写时点无法核实站点的国别分布明细(上游未公开站点清单),引用"多站点多样性"时应以上游论文的站点统计为准。
§3.9 设备规格
图像设备信息继承上游:DICOM 原始采集含常规数字化放射(DR/CR)与床旁设备,PA/AP/LAT 多视角。上游数据卡未公开设备厂商与型号分布。对本数据集的直接影响是:图像分辨率为上游降采样版的 16-bit PNG,任何依赖原始 DICOM 灰度精度或高分辨率细节的评测在本基准上不成立——geometric 类题目(管端位置、大小测量)受此限制尤甚,这与五技能中 geometric 占比不足 0.5% 的设计取舍互为因果。
§3.10 深度溯源链
完整资产血缘(自上而下三层):
[层1 患者检查] 79 站点 DICOM 胸片 + 放射报告(Gradient Health 汇集,HIPAA 双路去标识)
│ 上游仓库:rajpurkarlab/ReXGradient-160K(rid 717,同款非商业协议)
▼
[层2 结构化报告] GPT-4o 辅助四段化(Indication/Comparison/Findings/Impression)
│ 上游论文 arXiv:2505.00228 披露流水线
▼
[层3 MCQ 语料] GPT-4o 两阶段生成 + 7 校验器 + 难度三级 + 专家审阅
│ 本仓库:rajpurkarlab/ReXVQA(本条目)
▼
[层4 评测生态] 论文 8 模型评测 + ReXrank 私有测试集(41,007)在线排行
│ 论文 arXiv:2506.04353 / PSB 2026;rexrank.ai
▼
[层5 同族延伸] ReXGroundingCT(CT 定位)/ ReXInTheWild / MAIDA 等后续工作(同 lab、同协议家族)
溯源完整性评价:从 DICOM 到 MCQ 的每一步转换都有论文或数据卡披露,但每一步的中间产物(结构化要点、被校验器淘汰的题目、专家改判记录)均未公开——想要审计"题目是否忠实于报告"的研究者只能拿到首尾两端的资产,中间层不可复现。这是生成式基准的通病,也是 §8.4 讨论的方法论边界。
§4 数据结构
§4.0 目录树
rajpurkarlab/ReXVQA(HuggingFace gated 仓库,实测 tree/main 2026-09-30)
├── README.md # 数据卡(含 YAML 元数据、split 表、News、三段 BibTeX)
├── LICENSE # ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1
│ # (11,359 B 实测;协议全文即许可文件)
└── metadata/
├── train_vqa_data.json # 1,388,369,965 B — 训练问答对
├── valid_vqa_data.json # 97,501,862 B — 验证问答对
└── test_vqa_data.json # 98,707,686 B — 公开测试问答对
配套的外部资产(不在本仓库):
rajpurkarlab/ReXGradient-160K(上游图像与报告,同款协议,另签)
├── images/…(273,004 张 16-bit PNG,降采样 25%)
├── reports.csv # 四段结构化报告
└── metadata.csv # 检查级元数据(患者/视角/站点等)
rexrank.ai # 私有测试集 41,007 道在线评测(无需下载)
三个必须记住的结构事实:第一,本仓库只有 JSON,configs 段引用的 metadata/*_metadata.csv 是上游数据卡的复制残留、文件不存在(坑 3);第二,私有测试集(41,007 道)没有公开文件,任何声称"下载了 ReXVQA 私测集"的仓库都是仿制品;第三,JSON 是 LFS 对象,git clone 需先装 git-lfs,用 huggingface-cli download 则无此顾虑。
§4.1 DAIMS 字段字典
问答记录的字段字典如下(字段名按论文 §3.3 与数据卡口径整理;JSON 原文件 gated 未能采样,实际键名以拿到文件后为准——差异处理见坑 6):
| 字段 | 类型 | 取值域 | 语义 | 使用提示 |
|---|---|---|---|---|
| question / question_text | sc:Text | 英文自由文本 | MCQ 题干,含临床语境 | 仿 USMLE 语体;长题干常含 Indication/Comparison 信息 |
| options | list[sc:Text] | 长度 4 | 四个选项文本 | 选项顺序即索引 0-3;2024-11-14 已做过选项分布再平衡 |
| answer / y | sc:Integer | 正确选项索引 | 评测时按索引比对,不要按选项文本(文本可能改写) | |
| explanation / E | sc:Text | 英文自由文本 | 解释(生成式质控产物) | 可用于 CoT 蒸馏,但注意是 GPT-4o 生成而非医生书写 |
| difficulty | [“sc:Text”,“cr:Label”] | easy / medium / hard | 三级难度(LLM 初评+专家验证) | 技能×难度二维分层评测的坐标之一 |
| category / skill | [“sc:Text”,“cr:Label”] | 五技能之一 | presence / negation / differential diagnosis / location & distribution / geometric information | 分布 36.1/36.5/20.9/约6/<0.5(论文口径) |
| study_id / image 关联键 | sc:Text | 上游标识 | 关联上游图像与报告 | 关联键的确切字段名 gated 未实测,拿到文件先 jq 'keys' 探查 |
字段字典的"双重不确定性"声明:以上键名是按论文描述整理的语义字段,不是对 JSON 的逐字节转写。拿到数据后第一件事是核对真实键名与本表的对应关系,并把映射写进你的数据加载脚本(§6.3 的代码把这一步做成了显式断言)。
§4.2 关键分布
五技能分布(论文口径):
negation ████████████████████████████████████ 36.5%
presence ███████████████████████████████████ 36.1%
differential dx ████████████████████ 20.9%
location & dist. ██████ ~6%
geometric ▏ <0.5%
难度分布:easy/medium/hard 三级,论文按难度分层报告了模型成绩(如 geometric 类 MedGemma 总体 80.45% 但 Janus-Pro-7B 在 hard 档更接近),全量难度比例论文未以单一数字披露——拿到 JSON 后应自行统计 difficulty 字段的边际分布并写进实验日志。
答案选项分布:数据卡 News 记录 2024-11-14 “balance answer options”——发布版应近似均匀(每选项约 25%)。若你在历史快照或第三方镜像上发现答案索引严重偏斜(比如 y=2 占 40%),你拿的是旧版语料,应回官方仓库重新下载(这也是坑 2 口径分叉的时间截面证据)。
§4.3 文本统计
题目文本没有官方统计表,以下为按生成机制推导的量级参考(拿到数据后请实测替换):
- 题干长度:USMLE 风格题干通常 1–3 句、20–60 tokens;含病例背景的长题干可达 100+ tokens。
- 选项长度:短选项(是/否变体、解剖部位)到长选项(完整诊断短语)混合。
- 解释长度:GPT-4o 生成的解释通常 1–4 句。
- 训练集 JSON 密度:489,523 道题(README 口径)占 1.29 GiB,平均每道题约 2.8KB 原始 JSON(含格式开销),与"题干+4 选项+解释"的体积量级自洽。
§4.4 数据层级与连接关系
患者 patient(约 10.9 万)
└── 检查 study(16 万,含视角与日期)
├── 图像 image(27.3 万张,上游 PNG)
└── 报告 report(四段结构化文本)
└── MCQ 题 ×k(k 平均约 3.6–4.3,视口径)
├── 四选项 + 答案索引
├── 解释 E
└── (difficulty, category) 标签
连接关系的三条规则:
- 一对多贯穿全链:1 患者 → n 检查 → 1 报告/检查 → k 题。任何"随机划分"都必须在患者级做,否则 k>1 的兄弟题会把答案风格与患者特征带到测试集(§5.3)。
- 跨仓外键:ReXVQA JSON 与上游 ReXGradient-160K 通过检查/图像标识关联;两侧仓库的键命名系统一致(同 lab 同批次设计),但对齐脚本要自己写——官方没有发布现成的 join 表。
- 私测集无连接:41,007 道私测题不在任何公开 JSON 里,只有 ReXrank 服务端持有;本地永远无法本地评测私测集。
§4.5 缺失值与信息性缺失
| 位置 | 缺失类型 | 含义与处置 |
|---|---|---|
| 私有测试集文件 | 结构性缺失 | 41,007 题仅存于 ReXrank——不要试图在公开渠道找,找不到是常态不是故障 |
| 图像路径 | 结构性缺失 | 本仓库不含图像与路径表——与上游 metadata 对齐(§4.4 规则 2) |
| metadata CSV(configs 引用) | 幽灵文件 | 数据卡 configs 指向不存在的文件(坑 3)——忽略 configs,用实际文件树 |
| 站点/人口学字段 | 继承性缺失 | 上游公开版不发布站点清单与人口学明细——公平性研究受限(§7.5) |
| 专家复核覆盖率 | 元数据缺失 | 论文未披露专家审阅比例——质量审计只能抽样自做 |
| 前后对比日期 | 脱敏缺失 | 上游日期做了 ≤365 天偏移——"较前变化"类题目的真实时间间隔不可恢复 |
"信息性缺失"一条值得展开:2024-11-14 修订"移除偏倚样本"意味着存在一个更早、更大、含偏倚的版本,但官方没有发布 removed 样本的清单与移除规则。做数据集演化或数据清洗研究的人拿不到 diff——这是本数据集最显眼的不可复现点。
§5 数据划分与使用建议
§5.1 官方划分
双口径并存(详见 §3.2),使用决策树:
你要做什么?
├── 复现论文实验 / 写对比论文
│ → 用论文口径:572,952 / 40,878 / 40,826(+ 私测 41,007 不可得)
│ → 报告数字时注明"论文 Table 口径,加总 695,663"
├── 检查本地文件完整性
│ → 用 README 口径:489,523 / 34,500 / 34,889(加总 599,919)
│ → 你的 JSON 行数对不上这两个数的任何一个?先查快照版本(坑 2)
└── 提交 ReXrank
→ 本地无需私测集;按 ReXrank 提交格式输出预测
无论用哪个口径,split 间的患者互斥是官方设计(README 分 patients 统计就是佐证);自己重切 split 属于高级操作,需同时满足患者级分桶+技能分层两项(§5.4)。
§5.2 ReXrank 与私有测试集
私有测试集 41,007 道的双侧协议:
- 数据侧:不随仓库发布、无公开镜像。论文正文与 HF README 对该数字完全一致(两处都是 41,007),可信度高。
- 服务侧:ReXrank(rexrank.ai)在线评测,原为报告生成排行榜(Zhang 2025,AAAI Bridge AIMedHealth),后扩展 VQA 榜。提交方上传预测,服务端在隔离环境打分。
- 防刷榜设计:私测集+在线评测 = 基准领域的标准"考试院"模式(类比 GLUE/SuperGLUE),防止本地调参过拟合公测集后宣称 SOTA。
- 引用纪律:报告"在 ReXVQA 上取得 X%"时必须写明是 Public Test(40,826 论文口径 / 34,889 README 口径)还是 ReXrank 私测(41,007)。两个集合规模接近、题目同源,但成绩不可互换——公测集上刷出来的分数在私测集上通常回落。
§5.3 泄漏风险清单
| 风险 | 机制 | 症状 | 防线 |
|---|---|---|---|
| 兄弟题泄漏 | 一份报告生成多道题(平均约 4 道) | 同报告的题跨集,答案风格互通 | 划分检查:同 study 的题必须同 split |
| 患者级泄漏 | 同患者多次检查,报告模板化 | "同一病人"的书写习惯跨集 | 划分检查:同 patient 的题必须同 split(官方已做,自切者必做) |
| 生成器泄漏 | 全部题目出自同一 GPT-4o 快照 | 模型若同源(GPT-4o 家族多模态版)变相"见过生成分布" | 评测结论中声明生成器与被测模型的血缘 |
| 上游预训练泄漏 | 用 ReXGradient-160K 预训练再测 ReXVQA | 报告文本(题目的事实来源)在预训练语料里 | 在论文中显式声明两段式用法,并跑"纯外部预训练"对照 |
| 公测集调参过拟合 | 反复在 Public Test 上迭代 | 公测虚高、私测回落 | 开发期用 Validation split,公测只碰 3 次以内 |
§5.4 交叉验证建议
训练集 57.3 万道(论文口径)做 k 折交叉验证的可行方案:
- 分层变量:
(category × difficulty)二维分层,每折技能与难度边际分布一致; - 分桶变量:patient_id 哈希分桶,桶间患者互斥;
- 折数取舍:k=5 为性价比拐点(每折 11 万+题,8 模型 × 5 折 = 40 次训练,医疗 VLM 推理成本可观);若算力紧张,用固定 Validation split + bootstrap 置信区间替代完整 k 折;
- 报告规范:无论 k 折还是单切,都要报告按技能分层的准确率——总分会被 presence/negation 主导(约 72%),单看总分等于没测(技能分层见 §2.3;泄漏处理见 §5.3)。
§5.5 外部验证建议
ReXVQA 结论要外推,建议的三角验证组合:
- 人工精标小集对照:在公测集抽 200–500 题,请放射科医生独立判卷,量化"报告真值 vs 影像事实"的偏离率(生成式基准的系统性盲区,§8.4);
- 跨基准横评:同一模型在 VQA-RAD(人工精标)与 ReXVQA(生成式)上的成绩相关性——若正相关弱,说明两基准测的不是同一种能力;
- 技能缺口验证:把 ReXVQA 上 diff dx 拉胯的模型放到 SLAKE 的诊断类子集上,验证"鉴别诊断弱"是基准特异还是模型固有。
§6 AI 就绪指南
§6.0 云端快速启动
# Colab 示例:凭据走 Colab Secret(HF_TOKEN),不要硬编码
import os
assert os.environ.get("HF_TOKEN") or True # Colab: 从 Secret 注入 HF_TOKEN
# pip install -U huggingface_hub pandas ijson pillow torch torchvision
要点:本仓库的 JSON 无需 git-lfs(用 huggingface_hub 直接下);图像需另下上游仓库;两仓库共用同一 HF 账号,但协议签署是网页操作、每仓库各一次,token 只解决"你是谁",不解决"你签没签"。
§6.1 快速上手
# 1) 下载问答语料(gated:先在网页签协议,见 §6.2)
from huggingface_hub import hf_hub_download
train_json = hf_hub_download(
repo_id="rajpurkarlab/ReXVQA",
repo_type="dataset",
filename="metadata/train_vqa_data.json",
token=os.environ["HF_TOKEN"],
)
# 2) 探查真实键名(字段语义见 §4.1;JSON 大,用流式探查)
import ijson, json
with open(train_json, "rb") as f:
first = next(ijson.items(f, "item"), None)
print(json.dumps(first, indent=2, ensure_ascii=False)[:800])
# 把 first 的真实键名与 §4.1 字段字典对表,写进你的加载器
# 3) 图像另从上游取(同协议,另签)
# hf_hub_download(repo_id="rajpurkarlab/ReXGradient-160K", ...)
§6.2 数据获取
gated 双重门的完整通过流程:
第 1 步 注册与登录
hf-mirror / HF 主站注册账号 → 生成 Fine-grained 只读 Token(勾选该数据集读权限)
第 2 步 网页签署协议(本仓库)
访问 https://huggingface.co/datasets/rajpurkarlab/ReXVQA
填写 extra_gated_fields 四项:Name / Institution / Email / 同意条款 checkbox
提交后门禁解除(本协议为签署即过型,无人工审批等待)
第 3 步 网页签署协议(上游仓库)
同款协议在 rajpurkarlab/ReXGradient-160K 再签一次——两个仓库门禁独立!
(想下图像的人最常踩的坑:只签了 ReXVQA,拉上游图像 401)
第 4 步 CLI 下载
export HF_TOKEN=hf_xxx
huggingface-cli download rajpurkarlab/ReXVQA --repo-type dataset \
--include "metadata/*.json" --local-dir ./rexvqa
huggingface-cli download rajpurkarlab/ReXGradient-160K --repo-type dataset \
--include "images/*" "reports.csv" "metadata.csv" --local-dir ./rexg160k
第 5 步 完整性体检(下载后立即做,§6.3 代码)
四条工程红线:
- 镜像站拿不到这个仓库:公共镜像不持有你的授权凭据,未登录/未签署一律被拒——实测响应为 “Access to dataset rajpurkarlab/ReXVQA is restricted”。元信息(README/tree/resolve 的公开文件)可走镜像,数据文件必须走官方端点 + token。
- 签署即过 ≠ 自动下载:网页签完协议后 token 立即生效,但已发起的下载进程要重启才会带上新权限。
- 马萨诸塞州管辖条款:协议 v.1(2025-04-07)明确受马萨诸塞州法管辖,违规报告邮箱 MAIDA_Support@hms.harvard.edu——企业合规审查时把这条递给法务。
- 非商业边界:协议禁商业、禁临床、禁再分发、禁发布数据目录;署名要求(引用 ReXGradient-160K 与 Gradient Health)适用于所有衍生论文与产品文档。
§6.3 预处理全流程
# 步骤 0:把 1.29 GiB 的 train JSON 转成 Parquet(一次性,加速后续所有实验)
import ijson, json, pandas as pd
def json_to_parquet(json_path: str, out_path: str):
"""流式读取大 JSON → Parquet。真实键名以 §6.1 探查结果为准,此处用常见键名示范。"""
KEY_QUESTION, KEY_OPTIONS, KEY_ANSWER = "question", "options", "answer"
KEY_EXPL, KEY_DIFF, KEY_CAT = "explanation", "difficulty", "category"
rows = []
with open(json_path, "rb") as f:
for rec in ijson.items(f, "item"):
rows.append({
"question": rec[KEY_QUESTION],
"options": json.dumps(rec[KEY_OPTIONS], ensure_ascii=False),
"answer": int(rec[KEY_ANSWER]),
"explanation": rec.get(KEY_EXPL, ""),
"difficulty": rec.get(KEY_DIFF, ""),
"category": rec.get(KEY_CAT, ""),
})
df = pd.DataFrame(rows)
# 体检断言:四选项、答案索引合法、字段非空
assert (df["options"].apply(json.loads).apply(len) == 4).all(), "存在非四选项题"
assert df["answer"].between(0, 3).all(), "answer 越界"
df.to_parquet(out_path, index=False)
return df
train_df = json_to_parquet("rexvqa/metadata/train_vqa_data.json", "train.parquet")
print(train_df["category"].value_counts()) # 五技能边际分布(应≈36.5/36.1/20.9/6/<0.5)
print(train_df["difficulty"].value_counts()) # 难度边际分布(官方未披露,自行记录)
print(train_df["answer"].value_counts(normalize=True)) # 选项均衡性(应≈各 25%)
# 步骤 1:与上游图像对齐(键名以上游 metadata.csv 实际列名为准)
# up_meta = pd.read_csv("rexg160k/metadata.csv")
# qa_meta = pd.read_csv("rexvqa_qa_study_map.csv") # 若 JSON 内含 study 关联键则直接用
# joined = qa_meta.merge(up_meta, on="study_id", validate="many_to_one")
# 步骤 2:图像读取——上游 PNG 已统一方向与 16-bit 归一化,转 float 后 /65535 即 [0,1]
# import numpy as np, PIL.Image as Image
# def load_image(path):
# img = np.asarray(Image.open(path), dtype=np.float32) / 65535.0
# return img # HxW 或 HxWx3
§6.4 PyTorch DataLoader 完整代码
"""ReXVQA 评测用 Dataset:图像(上游 ReXGradient-160K)+ MCQ(本仓库 JSON)。
假设:已下载两仓库并完成 §6.3 的对齐表(study_id -> image 路径列表)。
"""
import json
import numpy as np
import pandas as pd
import torch
from PIL import Image
from torch.utils.data import Dataset
class ReXVQADataset(Dataset):
"""一条样本 = 一道 MCQ。评测协议:模型输出 (y, E),这里只结构化输入侧。"""
def __init__(self, parquet_path: str, align_csv: str, image_root: str,
tokenizer, max_len: int = 512, image_size: int = 448):
self.df = pd.read_parquet(parquet_path)
self.align = pd.read_csv(align_csv) # 列: question_key, study_id
self.image_root = image_root
self.tk = tokenizer
self.max_len = max_len
self.image_size = image_size
def __len__(self) -> int:
return len(self.df)
def _load_image(self, study_id: str) -> torch.Tensor:
"""上游一检查多图(正侧位):评测时最常见做法是把同检查全部图拼通道/序列输入。
这里给出单图简化版(PA 优先),多图策略按你的模型架构定。"""
paths = self.align.loc[self.align["study_id"] == study_id, "image_path"].tolist()
pa = next((p for p in paths if "PA" in p.upper()), paths[0])
img = Image.open(f"{self.image_root}/{pa}").convert("L")
img = img.resize((self.image_size, self.image_size), Image.BILINEAR)
t = torch.from_numpy(np.asarray(img, dtype=np.float32) / 65535.0)
return t.unsqueeze(0).repeat(3, 1, 1) # 灰度复制到 3 通道
def __getitem__(self, idx: int):
row = self.df.iloc[idx]
study_id = self.align.iloc[idx]["study_id"]
pixel_values = self._load_image(study_id)
prompt = (
"You are a radiologist. Answer the multiple-choice question "
"about the chest X-ray and explain your reasoning.\n"
f"Question: {row['question']}\n"
"Options:\n" +
"\n".join(f"{chr(65+i)}. {o}" for i, o in enumerate(json.loads(row["options"]))) +
"\nRespond with the option index and an explanation."
)
enc = self.tk(prompt, truncation=True, max_length=self.max_len, return_tensors="pt")
return {
"pixel_values": pixel_values,
"input_ids": enc["input_ids"].squeeze(0),
"attention_mask": enc["attention_mask"].squeeze(0),
"label": torch.tensor(int(row["answer"]), dtype=torch.long),
"category": row["category"],
"difficulty": row["difficulty"],
}
def evaluate_skill_accuracy(model, loader, device: str) -> dict:
"""按 (category, difficulty) 分层准确率——总分会被 presence/negation 主导,分层才有信息量。"""
model.eval()
agg: dict = {}
with torch.no_grad():
for batch in loader:
out = model(pixel_values=batch["pixel_values"].to(device),
input_ids=batch["input_ids"].to(device),
attention_mask=batch["attention_mask"].to(device))
pred = out.logits[:, :4].argmax(-1).cpu() # 四选项头
for p, y, c, d in zip(pred, batch["label"],
batch["category"], batch["difficulty"]):
k = (c, d)
n, hit = agg.get(k, (0, 0))
agg[k] = (n + 1, hit + int(p == y))
return {f"{c}/{d}": hit / n for (c, d), (n, hit) in agg.items() if n > 0}
§8 方法学启示:可迁移的四条经验
8.1 "LLM 出题 + 规则门 + 专家抽审"是可复制的生产函数
ReXVQA 流水线最有复用价值的不是 69.6 万这个数字,而是它的成本结构设计:把人类智力精确投放在机器失效的环节。结构四门(JSON/类型/格式/完整性)是纯机器活;内容三门(难度/多样性/质量)半机器半规则;专家只在语义存疑处介入。任何拥有"结构化文本 + 领域知识库"的团队都可以按 §3.1-3.3 的骨架搭同款流水线。复制的三个前置条件(§3.6):源文本质量、影像-文本可靠关联、可调度的领域专家。复制时的红线:论文未披露专家审阅的抽样率与淘汰率(坑 5),复现者需要自行设计并披露这两个人力参数——这是原流水线留下的透明度债务,别继承它。
8.2 认知技能轴是比器官轴更好的基准组织方式
以器官/疾病为轴的基准回答"模型会不会认这个病",以认知技能为轴的基准回答"模型会不会做这类推理"。ReXVQA 的分技能结果(§4.2)证明了技能轴的判别力:MedGemma 在鉴别诊断上领先第二名 8.54 个百分点,却在否定检测上输给通用模型 Eagle2——如果只看 overall,这个结构性信息完全不可见。设计新评测的迁移建议:先枚举目标领域专家实际使用的推理操作(放射科是存在/否定/定位/鉴别/测量),再为每个技能锚定文献来源与题量下限,最后按技能分桶生成与质检。技能轴的代价是题量分配的头部集中(ReXVQA 里否定+存在占 72%),设计时应预设小技能桶的最小统计基数。
8.3 AI vs 人类对照的对照组设计教训
ReXVQA 的人类研究(3 住院医 × 200 例)提供了正面与反面教材。正面:同题作答、随机抽样、结果以绝对差报告——比"模型准确率 vs 文献人类准确率"的跨研究对照严谨得多。反面:受训者不是专家终点、随机抽样无难度分层、封闭题式与临床任务有距离。设计同类对照的改进清单:纳入至少一名 board-certified 资深医生作上限参照;按题目难度/技能分层抽样;报告人类读者间一致性(否则"最佳人类"是个幸存者数字);补充开放式任务作外部效度检验。引用 ReXVQA 人类结论时,这四条即是完整的方法论护栏。
8.4 多口径数字的治理:从"发现矛盾"到"登记口径"
ReXVQA 的四个问题总数(§2.5、坑 2)不是孤例而是生成式数据集的通病:论文数字、平台数字、数据卡数字在数据集生命周期里各自演化(清洗、去重、补发),没人负责回写对齐。本条目的处理流程可复制:① 找出全部口径及各自出处与时间点;② 判断哪个口径可自洽(splits 加总吻合);③ 主口径固定为可自洽者;④ 其余口径进"双口径登记表"(附录 I);⑤ 条目内凡涉该数字处均注明口径编号。检索者拿到这个流程,面对任何多口径数据集都能十分钟内建立引用纪律。
§9 与库内条目的关系
9.1 家族图谱与互链清单
| 库内条目 | rid | 关系 | 互链方向 |
|---|---|---|---|
| ReXGradient-160K | 717 | 直接上游:图像+报告来源;同 DUA 协议家族;数据卡 title 沿承其名 | 双向必链 |
| VQA-MED | 280 | 同任务(医学 VQA)不同代际:2019 ImageCLEF 挑战赛 vs 2025 生成式 | 双向 |
| VQA-RAD | 240 | 同任务不同代际:2018 人工标注小集;且被 ReXVQA 论文引为技能框架参照 | 双向 |
| PathVQA | 260 | 同任务不同模态:病理图问答 vs 胸片问答 | 双向 |
| PMC-VQA | 270 | 同任务不同生成路线:文献图文自动生成 vs 报告流水线生成 | 双向 |
| OmniMedVQA | 290 | 同任务不同策略:12 源聚合 vs 单源深加工 | 双向 |
| EHRXQA | — | 同任务不同原料:EHR 结构化数据+影像 vs 纯影像报告 | 双向 |
| SLAKE | — | 同任务不同语言生态:双语医学 VQA | 双向 |
9.2 分工声明:ReXVQA 与 VQA-MED(280)
两者检索时最易混淆(同为"胸片/医学 VQA"高频词),分工如下:
- VQA-MED(rid 280):ImageCLEF 2019 年度挑战赛的医学 VQA 数据,以挑战赛为组织形式(年度赛题+参赛队伍),图像源为多中心医学影像(不限于胸片),规模为挑战赛量级(数千题),许可按届注册;
- ReXVQA(本条目):2025-2026 年的胸片专用 VQA 基准,以技能框架为组织形式(五技能+七道校验门),图像源为单一上游 ReXGradient-160K 的 16 万 study,规模为 69.6 万题量级,许可为 Harvard 非商业 DUA。
两者相隔六年、组织形式不同、规模差两个数量级、许可体系不同——库内共存无冲突。写综述时的时间线用法:VQA-MED 代表"挑战赛驱动"的第二代范式(在其时代是主流),ReXVQA 代表"平台化生成"的第三代范式。
9.3 检索路径建议
- 从上游数据进:先读 ReXGradient-160K(717) 条目了解影像规格(16-bit PNG、降采样 1/4、79 站点),再回本条目看问答层;
- 从基准对比进:§2.6 规格对照表 + §4.1 八模型榜 → 跨条目引用时按 §4.5 守则统一口径;
- 从许可合规进:§6.2 条款表 → 你的使用场景若涉商业/临床,直接判死(无需细读);学术用途再过五条款清单;
- 从方法论进:§3 流水线 + §8.1 复现骨架 → 自建生成式 VQA 基准的团队取用。
§10 避坑清单:八个已踩过的坑
坑 1:HF 数据卡标题不是 ReXVQA。rajpurkarlab/ReXVQA 的 YAML frontmatter 写 title: "ReXGradient-160K Dataset"、license_name: rexgradient——整卡沿承上游数据卡框架。按卡片标题或 license_name 检索/归类会把 ReXVQA 误并入 ReXGradient-160K 条目(本库两条目分立:rid 717 与本条目)。以仓库名 + 论文标题双锚点确认身份。
坑 2:问题总数四口径。① 论文正文 splits 加总 695,663(572,952+40,878+40,826+41,007);② arXiv 摘要约 696,000 / 正文引言 approximately 695,000;③ HF README 正文 653,834;④ HF README splits 加总 599,919(489,523+34,500+34,889+41,007)。四数互斥不可调和,推测为"生成全集→清洗发放"的时间线演化。本条目主口径 695,663(唯一自洽加总);引用任何总数先声明口径编号。
坑 3:configs 引用的文件不存在。HF 数据卡 configs 段配置了 metadata/{train,valid,test}_metadata.csv 三个文件路径,实际文件树(tree API 实测 2026-09-30)只有 {train,valid,test}_vqa_data.json。load_dataset(..., revision="main") 按 configs 走会报文件缺失。直接读 JSON 或按实际文件树写加载脚本。
坑 4:医疗系统数 3 vs 4。HF README 与上游 ReXGradient-160K 论文:3 家美国医疗系统 79 站点;ReXVQA 论文引言:“sourced from four U.S. health systems”。本条目按上游与数据卡口径写 3 家;论文引言的 4 存照。转引时以数据卡/上游论文为准并注明。
坑 5:专家审阅的透明度缺口。论文披露流水线含 Expert Review Phase,但未披露抽样比例、审阅人数、淘汰率。69.6 万题的逐题人工审阅在人力上不可行,几乎必然是抽样制——但方案未公开。引用"经专家验证"表述时保留分寸,不升级为"全部经专家逐题审定"。
坑 6:字段结构无法签署前预览。问答 JSON 为 gated,匿名实测访问被拒(“Access to dataset rajpurkarlab/ReXVQA is restricted”)。本条目 §2.4 的字段清单按论文描述转写,非实测——签署前不要把字段名写进硬编码脚本,签署后以实际 JSON 结构为准。
坑 7:83.24% 与 83.84% 两个 MedGemma 数字。83.24% = 公开测试集 overall(8 模型榜);83.84% = 人类研究 200 随机例子集。媒体与部分转引常混用。规则:谈榜单用 83.24%,谈"超过人类"用 83.84% + 200 例 + 住院医语境。
坑 8:News 日期早于论文。HF 数据卡 News:“[Nov 14, 2024] Dataset updated to remove biased samples and balance answer options”——早于论文首发(2025-06-04)约七个月,且语用上是上游 ReXGradient 系的更新口吻(又一处数据卡沿承痕迹)。不要用该 News 推断 ReXVQA 本体的发布时间线;论文与 HF 树抓取时间才是可靠锚点。
§11 总结
11.1 三句话总结
- ReXVQA 用"GPT-4o 两步生成 + 七道校验门"把 16 万份真实放射报告变成约 69.6 万道五技能框架的四选一胸片 VQA 题,是库内规模最大、组织轴最新的医学 VQA 数据集。
- 它的榜单结果(MedGemma-4B-it 83.24% overall,分技能四冠一失)与人类对照(200 例上 83.84% vs 最佳住院医 77.27%)共同给出了"专用医学模型超越受训人类"目前最完整的一份证据,但结论的适用边界(住院医、200 例、封闭题式)必须随数字一起引用。
- 它的 gated 双仓结构(问答 JSON 本仓 + PNG 上游仓)与非商业 DUA 使其获取摩擦显著高于库内开放 VQA 前辈——学术可用、商用禁行、二次集成不可能。
11.2 适合谁
- 医学多模态大模型评测者:需要分技能诊断(哪里强哪里弱)而非单一总分;
- 医学 VQA 数据集设计者:生成流水线(§3)+ 口径治理(§8.4)都是现成模板;
- 放射学 AI 教育研究者:五技能框架本身是可用的教学分类学;
- 研究"AI vs 人类"方法论的团队:§4.3/§8.3 的对照组设计正反教材。
11.3 不适合谁
- 需要即插即用开放数据的团队:gated + 禁再分发 + 双仓对齐,工程与合规成本都不低;
- 商业产品或临床部署验证:DUA 明文禁止,无变通空间;
- 需要几何/测量类大规模训练数据的项目:该技能占比不足 0.5%;
- 需要开放题式(自由文本报告式问答)的项目:全部题目是四选一封闭题。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 想快速跑通一个医学 VQA 实验 | 换库内开放条目(PathVQA/PMC-VQA 类,§2.6 表)——ReXVQA 不是最快路径 |
| 评估医学多模态模型 | 签 DUA 下公开 splits(§6.1 流程),按论文口径复现 + §4.5 守则报告 |
| 需要 ReXrank 私有集成绩 | 只能经 rexrank.ai 提交预测,数据不在你手里(§5.1) |
| 要建自己的生成式 VQA 基准 | §3.1-3.3 骨架 + §8.1 三前置 + 专家抽样率自行披露 |
| 引用"AI 超过人类" | 附录 I 口径 4 + §7.4 表格的正确表述模板 |
| 写医学 VQA 综述 | §2.6 三代技术路线表 + §7.3 时间轴可直接取用 |
11.5 条目内快速锚点
| 要找 | 去处 |
|---|---|
| 四口径问题总数全表 | 坑 2 + 附录 I 登记表 |
| gated 签署步骤 | §6.1 流程实录(含实测拦截存照) |
| 分技能模型成绩 | §4.2 五榜表 + §4.5 四条守则 |
| 流水线复现骨架 | §3 + 附录 F SOP 模板 |
| "AI 超人类"正确表述 | §7.4 传播边界表 |
FAQ(高频问答 32 问)
A. 基础认知
Q1:ReXVQA 是数据集还是排行榜?
两者都是但主体是数据集:HF 仓库实存约 1.58GB 问答 JSON(train/valid/test 三文件,tree API 实测),公开 splits 可签协议后下载复现;ReXrank(rexrank.ai)是其私有测试集(41,007 题)的评测外挂。本库"纯排行榜不立项"判例(ReXrank 案例)不适用于它——语料属性实测坐实。
Q2:名字 ReXVQA 怎么拆?
ReX = 系列名(ReXGradient/ReXrank 同族,放射 radiology 的变体拼写),VQA = Visual Question Answering。全家族覆盖"影像库(ReXGradient-160K)→ 榜单平台(ReXrank)→ 问答基准(ReXVQA)"三层。
Q3:谁做的?
Harvard Medical School Rajpurkar Lab(通讯 Pranav Rajpurkar)牵头,与 Saama AI Research(一作 Ankit Pal、Malaikannan Sankarasubbu)和首尔国立大学(Seunghyeon Roh、Won Jung Kim、Meesun Lee)合作,8 作者横跨三机构。
Q4:发表在哪?
正式版在 Biocomputing/Pacific Symposium on Biocomputing (PSB) 2026 论文集(World Scientific,DOI 10.1142/9789819824755_0018,PMID 41758146);预印本 arXiv:2506.04353(2025-06-04)。论文章节 CC BY-NC 4.0。
Q5:数据在哪发布?
HuggingFace:rajpurkarlab/ReXVQA(问答 JSON,gated)+ 上游 rajpurkarlab/ReXGradient-160K(胸片 PNG 与报告,gated 同族协议)。国内访问可走 hf-mirror.com 镜像(gated 授权仍在 HF 侧完成)。
Q6:它解决什么前人没解决的问题?
胸片 VQA 的"规模-真实性"两难:人工数据集(VQA-RAD 类)太小、模板生成数据集句式可背诵。ReXVQA 以真实报告为原料、LLM 出题加七道门质检,并第一个以"认知技能"为组织轴。
B. 数据与获取
Q7:公开 splits 有多大?
两个口径并读:论文口径 train 572,952 / valid 40,878 / public test 40,826(加私有 41,007 合计 695,663);HF README 口径 train 489,523 / valid 34,500 / public test 34,889(加私有 41,007 合计 599,919)。差异为发放版清洗所致,见坑 2。
Q8:图像文件在 ReXVQA 仓库里吗?
不在。本仓库只有问答 JSON;16-bit PNG(DICOM 转换、降采样 1/4)在上游 ReXGradient-160K 仓库(本库 rid 717)。完整实验需两次 gated 授权 + 跨仓对齐。
Q9:gated 流程要填什么?
四个字段:Name、Institution、Email、勾选确认框。勾选即视同签署《ReXGradient-160K Non-Commercial DUA v.1》全文(内嵌于数据卡与 LICENSE 文件)。实测未授权访问直接返回限制提示。
Q10:能商用吗?
不能。DUA 明文:仅限非商业研究与非临床目的;禁止再分发、禁止发布数据目录、仅可下载研究必需部分;马萨诸塞州法管辖;终止时须销毁数据。
Q11:问答 JSON 能预览字段吗(签署前)?
不能。2026-09-30 实测匿名经 hf-mirror 请求 train JSON 首部 3KB,返回 “Access to dataset rajpurkarlab/ReXVQA is restricted”。字段结构只能按论文描述推断(§2.4),签署后以实际为准。
Q12:数据卡 configs 里的 CSV 文件为什么找不到?
configs 段配置的 metadata/{train,valid,test}_metadata.csv 实际不存在于本仓库文件树——数据卡沿承上游所致(坑 3)。直接加载三个 _vqa_data.json 即可。
C. 统计与发现
Q13:五技能各占多少?
否定 36.5% / 存在 36.1% / 鉴别诊断 20.9% / 定位分布约 6% / 几何 <0.5%。前两项合计约 72%,论文称各 split 分布高度一致。
Q14:哪个模型最强?
论文评估窗口(2025 年中)8 模型中 MedGemma-4B-it 最强:公开测试集 83.24% overall。注意榜单是时点快照,新模型需另测(§4.5 守则二)。
Q15:MedGemma 全部单项第一吗?
不是。五技能中它拿了四项(存在 85.21%/定位 83.47%/鉴别 76.71%/几何 80.45%),否定检测由通用模型 Eagle2 以 86.32% 夺冠,MedGemma 85.03% 第三。
Q16:"AI 超过人类"的确切含义?
3 名放射科住院医在 200 例随机子集与模型同题:MedGemma 83.84% vs 最佳住院医 77.27%。三重边界:住院医非资深专家、随机抽样无难度分层、四选一封闭题非开放式报告(§4.3)。
Q17:83.24 和 83.84 哪个对?
都对但语义不同:83.24% 是公开测试集 overall(榜单数字);83.84% 是人类研究 200 例子集上的成绩。谈"超过人类"必须用后者及其语境(坑 7)。
Q18:分技能里哪些结论可信度高?
存在/否定/鉴别三大技能(题量占 93%+)可信;定位(约 6%)次之;几何(<0.5%)上的排名受抽样误差支配,仅作参考不作结论(§4.5 守则三)。
D. 题式与流水线
Q19:为什么是四选一?
论文有专门辩护:镜像 USMLE/放射学 board 考试惯例(临床熟悉感)+ 客观可复现打分。正确答案索引 y∈{0,1,2,3}。
Q20:模型只要选对就行吗?
论文任务定义要求输出解释元组 (y, E)——选择加解释。解释分量用于评估推理过程。纯准确率复现是降配实现,与他人含解释评估的成绩不可直接比(§4.5 守则四)。
Q21:题目是 GPT-4o 自己写自己评吗?
生成是 GPT-4o 两步(报告→bullet→MCQ),质检是 4 结构+3 内容校验器加专家审阅——不是自出自评闭环。但专家审阅的抽样率未披露(坑 5),"人工把关"的深度要保留分寸。
Q22:难度标签可信吗?
LLM 初评 + 专家验证的二级校准,三级(easy/medium/hard)。可信度中等:初评来自生成模型自身,验证覆盖度未知。用作分层参考指标,不作金标准。
Q23:为什么否定题占三分之一多?
临床重要性驱动:否定检测是避免假阳性的核心技能,也是放射 NLP 长期难点(Goryachev 2007);且它是 VQA-RAD/MIMIC-CXR-VQA 等前代数据集的最高频问型(框架锚点,§3.4)。
Q24:流水线能搬到其他科室吗?
能。三个前置:结构化报告文本、影像-文本可靠关联、可调度的领域专家(§3.6)。prompt template 换科室惯例即可,七道门架构通用。
E. 许可与生态
Q25:论文的 CC BY-NC 4.0 覆盖数据吗?
不覆盖。CC BY-NC 4.0 只及论文章节;数据受单独的 Harvard DUA 约束。引用论文表格与下载数据是两条合规线,别混。
Q26:Gradient Health 是谁?
上游影像的商业供体:跨 3 家美国医疗系统 79 站点的医学影像公司,把数据提供给 Harvard 再非商业转授权。DUA 的署名义务直接点名它——商业数据进学术基准的典型通道(§7.2)。
Q27:私有测试集能下载吗?
不能。41,007 题只在 ReXrank 平台作在线评测,题目本身不发放。想进榜只能提交模型预测;想"本地近似复现"私有集不存在合法路径。
Q28:ReXrank 和 ReXVQA 什么关系?
平台与挂载基准的关系。ReXrank 起家于报告生成排行(Zhang et al. 2025,AAAI Bridge AIMedHealth),ReXVQA 的私有 VQA 测试集挂靠其上——同一实验室的评测基础设施复用(§5.2)。
Q29:和 MAIDA 什么关系?
同实验室协议家族:ReXVQA 数据卡协议的报告违规邮箱为 MAIDA_Support@hms.harvard.edu,提示同组 MAIDA 系列数据集共用法务通道(详见附录 H DUA 速查)。
Q30:引用哪个 BibTeX?
数据引 pal2025rexvqa(注意 README citation 的 journal 字段写 arxiv,正式发表信息按 PSB 2026 补全;README 元数据的沿承痕迹另见坑 1/坑 8);图像来源同时引 ReXGradient-160K 论文(zhang2025rexgradient);榜单机制引 zhang2024rexrank。附录 O 有完整条目。
F. 复现与工程
Q31:复现 8 模型评测需要什么?
签名授权的两个仓库(PNG+JSON)、按论文的图像输入规格预处理、8 模型推理(含解释输出)、公开测试集打分。工程要点:答题用 few-shot 还是 zero-shot、解释是否参与打分,论文均有设定,偏离须声明(§4.5 守则四)。
Q32:自动化脚本里该用哪个总数?
分字段用:splits 明细按你实际下载的 JSON 实测;论文语境引 695,663;绝不把 README 的 653,834 或 splits 加总 599,919 与论文数字混在同一张表里(附录 I 有登记表可直接抄)。
事实清单(硬事实 36 条)
- ReXVQA 全称 A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding(论文标题,arXiv:2506.04353)。
- 正式发表于 Biocomputing/PSB 2026,World Scientific,DOI 10.1142/9789819824755_0018,PMID 41758146。
- arXiv 预印本 2506.04353,v1 2025-06-04。
- 论文章节许可 CC BY-NC 4.0。
- 作者 8 人:Ankit Pal, Jung-Oh Lee, Xiaoman Zhang, Malaikannan Sankarasubbu, Seunghyeon Roh, Won Jung Kim, Meesun Lee, Pranav Rajpurkar。
- 机构三:Saama AI Research、首尔国立大学、Harvard Medical School。
- HF 仓库 rajpurkarlab/ReXVQA,gated(Name/Institution/Email/checkbox 四字段)。
- 数据许可
license: other/license_name: rexgradient,实体为 ReXGradient-160K Non-Commercial Data Access and Use Agreement v.1(2025-04-07 版署)。 - 协议主办方 President and Fellows of Harvard College;供体 Gradient Health(商业公司)。
- 问题总数论文口径 695,663(splits 加总:572,952+40,878+40,826+41,007)。
- arXiv 摘要口径 approximately 696,000;正文引言 approximately 695,000 MCQs。
- HF README 正文口径 653,834。
- HF README splits 加总口径 599,919(489,523+34,500+34,889+41,007)。
- HF README split 明细:train 489,523 pairs/138,993 studies/237,127 images/95,299 patients。
- private test 41,007 pairs / 10,000 studies——论文与 README 唯一完全一致的数字。
- 上游 ReXGradient-160K:160,000 study / 273,004 unique images / 109,487 patients / 3 家美国医疗系统 / 79 医学站点。
- 论文引言写 four U.S. health systems(与上游 3 家冲突,坑 4)。
- 图像规格:DICOM 转 16-bit PNG,按 DUA 降采样至原尺寸 1/4;PNG 存于上游仓库。
- 上游报告四段式:Indication / Comparison / Findings / Impression。
- 仓库文件实测(tree API 2026-09-30):train_vqa_data.json 1,388,369,965 B;valid_vqa_data.json 97,501,862 B;test_vqa_data.json 98,707,686 B;合计约 1.58GB。
- 数据卡 configs 引用的 metadata/{train,valid,test}_metadata.csv 实际不存在于文件树(坑 3)。
- 数据卡 YAML title 为 “ReXGradient-160K Dataset”(沿承上游,坑 1)。
- 五技能占比:negation 36.5% / presence 36.1% / differential diagnosis 20.9% / location & distribution 约 6% / geometric <0.5%(论文引言)。
- MCQ 四选项,y∈{0,1,2,3};任务定义含解释元组 (y,E);对标 USMLE/board 题式。
- 生成模型 GPT-4o(2024-05-01-preview,Azure OpenAI API),两步:报告→bullet points→MCQ。
- 质检:4 structural validators(JSON 结构/数据类型/格式/完整性)+ 3 content validators(难度/多样性/内容),全过方入基准。
- 难度三级 easy/medium/hard:LLM 初评 + 专家验证。
- 认知框架锚点:VQA-RAD(Lau 2018)、MIMIC-Ext-MIMIC-CXR-VQA(Bae 2024)、否定临床重要性(Goryachev 2007)。
- 评估 8 模型:Eagle2, Gemini, Janus-Pro-7B, LLaVA, Phi-3.5, Qwen2VL, Qwen2.5-VL, MedGemma-4B-it。
- MedGemma-4B-it 公开测试集 overall 83.24%(全场最佳)。
- 分技能:存在 MedGemma 85.21%(前 best Gemini 62.17%);定位 MedGemma 83.47%;鉴别 MedGemma 76.71%(次名 Eagle2 68.17%);几何 MedGemma 80.45%(次名 Janus-Pro-7B 75.42%);否定 Eagle2 86.32%(Gemini 85.68%,MedGemma 85.03%)。
- 人类研究:3 名放射科住院医 × 200 随机例;MedGemma 83.84% vs 最佳住院医 77.27%。
- 子类目:exam quality MedGemma 71.23%(LLaVA 10.30%);呼吸三项(肺胸膜混浊/肺透亮/肺容积)MedGemma 80.44%/87.88%/78.64%。
- README News:[Nov 14, 2024] 去除偏倚样本并平衡选项——早于论文首发(坑 8)。
- gated 下载实测被拒:“Access to dataset rajpurkarlab/ReXVQA is restricted”(2026-09-30,hf-mirror)。
- 数据问题联系 xiaoman_zhang@hms.harvard.edu(主题行 ReXVQA);协议违规报告 MAIDA_Support@hms.harvard.edu。
术语表(30 条)
| # | 术语 | 释义 |
|---|---|---|
| 1 | VQA | Visual Question Answering,视觉问答:给定图像与问题输出答案 |
| 2 | MCQ | Multiple-Choice Question,多选题;ReXVQA 中固定四选一 |
| 3 | study | 放射学检查事件单位,可含一或多个投照位图像 |
| 4 | 否定检测 | Negation detection:确认某征象不存在,假阳性控制的关键技能 |
| 5 | 存在性评估 | Presence assessment:判断某征象是否存在 |
| 6 | 鉴别诊断 | Differential diagnosis:多个候选诊断中判定最可能者 |
| 7 | 定位与分布 | Location & distribution:征象的空间位置与分布模式判断 |
| 8 | 几何信息评估 | Geometric assessment:大小/间距/角度等空间测量判断 |
| 9 | 解释元组 (y,E) | 任务定义要求模型同输答案索引与解释文本 |
| 10 | ReXGradient-160K | 上游数据集:16 万 study 胸片+报告(本库 rid 717) |
| 11 | ReXrank | 同实验室在线评测平台(rexrank.ai),私有测试集所在 |
| 12 | gated dataset | 需登录并同意条款方可下载的 HF 数据集发布形式 |
| 13 | DUA | Data Use Agreement,数据使用协议 |
| 14 | Gradient Health | 上游影像的商业供体公司 |
| 15 | PSB / Biocomputing | Pacific Symposium on Biocomputing,全球范围内历史悠久的生物计算年会 |
| 16 | 16-bit PNG | 16 位灰度深度 PNG;DICOM 窗宽窗位信息的保留格式 |
| 17 | 降采样 1/4 | 图像线性尺寸缩至原 1/4(像素数 1/16),DUA 合规要求 |
| 18 | 结构校验器 | 检查 JSON 结构/类型/格式/完整性的自动门 |
| 19 | 内容校验器 | 检查难度/多样性/语义质量的自动门 |
| 20 | 难度三级 | easy/medium/hard,LLM 初评+专家验证 |
| 21 | 幻觉残留 | 生成模型引入源文本外事实的风险,模板式生成不存在此风险 |
| 22 | 可背诵性 | 模板式数据集上模型习得句式规律而非推理能力的失效模式 |
| 23 | private test set | 不公开发放、仅平台侧评测的保留集 |
| 24 | MedGemma-4B-it | Google 医学特调多模态模型,4B 指令微调版;本基准冠军 |
| 25 | Eagle2 | 通用多模态模型(9B 档);否定技能冠军 |
| 26 | Janus-Pro-7B | 深度求索通用多模态模型;几何次名 |
| 27 | human reader study | 人机同题对照实验设计 |
| 28 | residents | 放射科住院医:专科培训中的受训医师 |
| 29 | attending | 完成专科培训的执业医师;ReXVQA 人类研究中未包含 |
| 30 | DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维数据集评估框架 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | ReXVQA |
| url_name | rexvqa |
| 类型 | 生成式 VQA 基准 + 流水线方法论 + 榜单生态(三合一) |
| 论文 | Biocomputing/PSB 2026,DOI 10.1142/9789819824755_0018;arXiv:2506.04353 |
| 团队 | Rajpurkar Lab(HMS)× Saama AI Research × 首尔国立大学 |
| 规模 | 论文口径 695,663 题 × 160,000 study(四口径并存见坑 2) |
| 许可 | Harvard 非商业 DUA v.1(gated);论文 CC BY-NC 4.0 |
| 抓取时点 | 2026-09-30 |
| 库内互链 | rexgradient-160k(717)/vqa-med(280)/vqa-rad(240)/pathvqa(260)/pmc-vqa(270)/omnimedvqa(290)/ehrxqa/slake |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | 论文+HF 双可索引;但数据卡 title 沿承上游名(坑 1)干扰检索归类 |
| A 可获取性 | 5 | gated 双仓+禁再分发;协议全文公开、签署即得是补偿项;私有集不可及 |
| I 可互操作 | 6 | JSON 原生机器可读;但 configs 路径失效(坑 3)、字段签署前不可预览(坑 6)、图像在另一仓库 |
| M 元数据质量 | 7 | 五技能占比/难度/题式在论文中完备;四口径总数与审阅透明度缺口(坑 2/坑 5)扣分 |
| S 可持续性 | 6 | HF+ReXrank 双平台;但 ReXrank 私有评测构成单点依赖,DUA 终止须销毁数据 |
| 综合评级 | 6.2/10(中) | 文档与溯源质量高;获取摩擦与口径混乱拉低,适合机构研究者而非即插即用 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/方式 |
|---|---|---|
| DOI 10.1142/9789819824755_0018 / PMID 41758146 | World Scientific/PSB 2026 | WebSearch 五源互证(2026-09-29/30) |
| 695,663 splits 加总 | 论文正文 §3.5 | arXiv HTML v1 全文抓取 |
| 约 696,000 / 695,000 | arXiv 摘要/引言 | 同上 |
| 653,834 | HF README 正文 | hf-mirror resolve 抓取 |
| 599,919(README splits 加总) | HF README Dataset Composition | 同上 |
| split 明细(489,523/138,993/237,127/95,299 等) | HF README | 同上 |
| 五技能占比 36.5/36.1/20.9/6/<0.5 | 论文引言与 §3.5.1 | arXiv HTML |
| GPT-4o 两步生成/版本号 | 论文 §3.3 | arXiv HTML |
| 4+3 校验器 | 论文 §3.3 公式 k=4, l=3 | arXiv HTML |
| 8 模型名单与分技能成绩 | 论文 §5 与 Figure 2 图注 | arXiv HTML |
| 人类研究 3×200/83.84/77.27 | 论文摘要与 §5 | arXiv HTML |
| JSON 三文件字节数 | tree API 实测 | hf-mirror API 2026-09-30 |
| DUA 全文条款 | LICENSE 文件 11,359B 实抓 | hf-mirror resolve |
| gated 拦截报错 | train JSON 首部请求实测 | hf-mirror 2026-09-30 |
| title 沿承/News 日期 | README YAML frontmatter | hf-mirror resolve |
附录 D:数据获取决策树
需求是什么?
├── 只想"看看长什么样"
│ └── 论文 Figure 1 样例 + 本条目 §2.4 论文口径字段描述(签署前零预览,坑 6)
├── 做模型评测(学术)
│ ├── 1) HF 账号签 ReXVQA gated 协议 → 下三个 JSON(1.58GB)
│ ├── 2) 签 ReXGradient-160K 同族协议 → 下 PNG(跨仓对齐)
│ ├── 3) 公开测试集复现 → 按 §4.5 守则报告
│ └── 4) 要私有集成绩 → 只能 rexrank.ai 提交预测(§5.1)
├── 商业/临床用途
│ └── 直接放弃:DUA 明文禁止,无变通(§6.2)
├── 设计自己的生成式基准
│ └── 读 §3 流水线 + §8.1 骨架;专家抽样率须自行披露
└── 写综述/教学
└── §2.6 三代表 + §7.3 时间轴 + §7.4 叙事边界表直接引用
附录 E:五技能与临床认知的映射
| 技能 | 临床动作原型 | 失效的临床后果 | 基准中的角色 |
|---|---|---|---|
| 存在性评估 | “片子上有没有异常?” | 漏诊 | 最大头技能之一,模型区分度最大的单项之一 |
| 否定检测 | “能确认没有结节吗?” | 假阳性/过度随访 | 占比最高;通用模型反超医学特调模型的单项 |
| 鉴别诊断 | “最可能是哪个?” | 误诊方向错误 | 难度最高;MedGemma 优势最大(+8.54pp) |
| 定位与分布 | “病灶在哪、怎么分布?” | 定位错误影响随访方案 | 小桶技能(约 6%),统计效力中等 |
| 几何信息 | “结节多大、变大了吗?” | 测量误判影响病程评估 | 最小桶(<0.5%),排序结论不采信 |
附录 F:生成流水线复现骨架(SOP 模板)
阶段 0 原料与合规(周级)
- 源文本:结构化报告(四段式或等效),去标识核验
- 影像关联:study 级 ID 双向可追溯
- 伦理/协议:数据协议覆盖"衍生题库"条款核查
阶段 1 生成(API 成本主导)
- 步骤 A:报告 -> bullet points(GPT-4o,保语境压冗余)
- 步骤 B:bullet -> MCQ(专用 prompt template 内嵌解剖 taxonomy)
- 难度初评:生成时同步输出 easy/medium/hard
阶段 2 自动质检(代码主导)
- 结构四门:JSON 合法 / 字段类型 / 选项与解释格式 / 无空值
- 内容三门:难度校准 / 多样性(近重复检测)/ 语义质量
- 全过才入池;每题保留七门通过日志
阶段 3 专家环节(人力主导)
- 抽样审阅:披露抽样率与审阅人数(ReXVQA 未披露——补上这一课)
- 语义存疑题人工终审;淘汰率入文档
阶段 4 发布治理
- splits 冻结与加总自检(防坑 2 式四口径)
- 数据卡与论文数字对齐责任人指定
- 版本化:清洗事件(如去偏倚)写入 News 并注明影响量级
附录 G:八模型结果登记表(论文口径)
| 模型 | overall(公开测试集) | 备注 |
|---|---|---|
| MedGemma-4B-it | 83.24% | 总冠军;四技能第一 |
| Eagle2 | 未披露单项总榜值(论文表) | 否定冠军 86.32%;鉴别次名 68.17% |
| Gemini | 未披露(论文表) | 否定次名 85.68%;存在前 best 62.17% |
| Janus-Pro-7B | 未披露(论文表) | 几何次名 75.42%;定位次名 64.62% |
| Qwen2.5-VL | 未披露(论文表) | 定位第三 63.24%;exam quality 60.92% |
| Qwen2VL | 未披露(论文表) | 上代对比项 |
| Phi-3.5 | 未披露(论文表) | Figure 1 答错案例主角之一 |
| LLaVA | 未披露(论文表) | exam quality 10.30% 垫底 |
注:论文 HTML 版可机读的总体成绩以摘要与图注披露为主(MedGemma 83.24%);其余模型的 overall 数值以论文 Table 2 为准,签署后续更新触发附录 J 触发点。
附录 H:DUA 十一条速查(LICENSE 文件实测)
| 条 | 主旨 | 一句话影响 |
|---|---|---|
| I | 接受协议即约束 | 下载即签约 |
| II | 署名仓库+Gradient Health | 所有产出必须署名 |
| III | 非商业非临床+十项承诺 | 用途红线;仅下载必需部分 |
| III.B | 四项禁止(重识别/链接/联系受试者) | 跨库 join 前过合规 |
| IV | 免责声明 | 数据"AS IS" |
| V | 责任限制 | Harvard 免直接损害责任 |
| VI | 用户承担责任 | 违约自负 |
| VII | 马萨诸塞州法管辖 | 诉讼地锁定 |
| VIII | 完整协议/可分割性 | 条款无效不连坐 |
| IX | 违规报告义务 | 24 小时内报 MAIDA 邮箱 |
| X-XII | 权属/机构名使用/终止销毁 | 终止时销毁并可索证明 |
附录 I:多口径登记表
| # | 项 | 口径 A | 口径 B | 口径 C | 口径 D | 处理 |
|---|---|---|---|---|---|---|
| 1 | 问题总数 | 695,663(论文 splits 加总) | ~696,000(arXiv 摘要)/~695,000(引言) | 653,834(HF README) | 599,919(README splits 加总) | 主口径 A;其余存照 |
| 2 | 医疗系统数 | 3 家 79 站点(README/上游论文) | four(ReXVQA 论文引言) | — | — | 按 A 引,B 存照 |
| 3 | MedGemma 成绩 | 83.24%(公开测试集 overall) | 83.84%(人类研究 200 例子集) | — | — | 榜单用 A,人机对比用 B |
| 4 | 论文发表 | arXiv 2506.04353(2025-06-04) | PSB/Biocomputing 2026(DOI 10.1142/9789819824755_0018) | README citation 写 journal=arxiv | — | 正式引用按 B |
附录 J:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 论文 Table 2 全量成绩 | 获得 PSB 正式版全文 | 补齐附录 G 空格 | 1 |
| ReXrank VQA 榜扩容 | 新模型入榜/机制变更 | §5 追记 | 2 |
| HF 数据卡更新 | title 修正/configs 修复/新版本发放 | 坑 1/坑 3 复核 | 3 |
| 字段结构披露 | 签署后实测 JSON 或官方数据字典发布 | §2.4/附录 N 升级为实测口径 | 4 |
| DUA 换版 | v.2 或许可以外条款出现 | §6 重写 | 5 |
附录 K:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI(论文)+ HF repo(数据) |
| F2 富元数据 | ✅ | 论文方法节+五技能占比+难度体系 |
| A1 可访问协议 | ⚠️ | gated+DUA:签署即得但非开放;私有集仅平台侧 |
| A2 元数据可访问 | ✅ | 数据卡/论文/LICENSE 全部公开可读 |
| I1 互操作格式 | ⚠️ | JSON 原生;configs 失效、图像跨仓 |
| I2 词汇表引用 | ✅ | 五技能锚定既有文献问型 |
| R1 来源溯源 | ✅ | 上游 ReXGradient-160K 谱系明确 |
| R3 可复现流程 | ⚠️ | 流水线有骨架但专家抽样率未披露 |
| AI-Ready 综合 | 中 | 元数据优、获取中摩擦、二次集成不可行 |
附录 L:缩写速查
| 缩写 | 全称 |
|---|---|
| VQA | Visual Question Answering |
| MCQ | Multiple-Choice Question |
| CXR | Chest X-ray |
| PSB | Pacific Symposium on Biocomputing |
| DUA | Data Use Agreement |
| HMS | Harvard Medical School |
| SNU | Seoul National University |
| LLM / LVM | Large Language Model / Large Vision(-Language) Model |
| HF | HuggingFace |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| USMLE | United States Medical Licensing Examination |
附录 M:基于本数据集的研究检查清单(12 项)
- 许可核对:用途是否落在"非商业+非临床"内?越线即止,无变通。
- 口径声明:问题总数、MedGemma 成绩、系统数——每个数字注明口径编号(附录 I)。
- 双仓对齐:问答 JSON 的 study/图像标识与上游 PNG 的对齐脚本先于任何模型实验。
- configs 失效:加载脚本按实际文件树(三个
_vqa_data.json)写,不按数据卡 configs(坑 3)。 - 字段实证:字段名以签署后实际 JSON 为准;论文口径字段描述(§2.4)仅作设计参考。
- 技能分层:模型对比结论只在存在/否定/鉴别三大技能上作正式表述(§4.5 守则三)。
- 解释分量:严格复现含 (y,E) 元组;降配复现须在论文中声明。
- 人机对比表述:凡引"超过人类"必挂住院医/200 例/封闭题三重边界(§7.4 模板)。
- 再分发红线:聚合基准、数据目录、衍生发放均触碰 DUA 第 III.B 条——内部使用为主。
- 销毁义务:项目终止时销毁数据并可被要求出具证明——数据留存策略提前设计。
- 引用完整:基准引 pal2025rexvqa(PSB 2026 口径)、图像引 zhang2025rexgradient、平台引 zhang2024rexrank。
- 时点存照:HF README 数字随清洗事件变动,引用注明抓取日期(本条目基准时点 2026-09-30)。
附录 N:问答记录数据字典(论文口径,签署前推断版)
| 字段(语义) | 类型(推断) | 取值域 | 依据 |
|---|---|---|---|
| 问题文本 | string | 自然语言问句 | 论文任务定义 Q_i |
| 四选项 | list[string] | 长度 4 | O_i = |
| 正确答案索引 | int | y∈{0,1,2,3}(论文公式) | |
| 解释文本 | string | 最低长度有校验(v₃ 门) | Format Validator |
| 难度 | string/enum | easy/medium/hard | Difficulty Classification |
| 技能类别 | string/enum | 五技能 | §3.5.1 |
| 解剖类别 | string | taxonomy 类别(呼吸/心血管/器械/肌骨等) | §3.3 taxonomy |
| study/图像标识 | string/int | 关联上游 ReXGradient-160K | README 对齐逻辑 |
升级路径:本表为论文口径推断版(坑 6);签署后实测字段名/类型/嵌套结构后按附录 J 触发点 4 升级为实测版。抽样自检建议:技能类别分布应复现 36.5/36.1/20.9/6/<0.5 的大致形状;难度三档应均有覆盖。
附录 O:引文规范
@inproceedings{pal2026rexvqa,
title = {ReXVQA: A Large-scale Visual Question Answering Benchmark
for Generalist Chest X-ray Understanding},
author = {Pal, Ankit and Lee, Jung-Oh and Zhang, Xiaoman and
Sankarasubbu, Malaikannan and Roh, Seunghyeon and
Kim, Won Jung and Lee, Meesun and Rajpurkar, Pranav},
booktitle = {Biocomputing 2026: Proceedings of the Pacific Symposium},
publisher = {World Scientific},
year = {2026},
doi = {10.1142/9789819824755_0018}
}
@article{pal2025rexvqa,
title = {ReXVQA: A Large-scale Visual Question Answering Benchmark
for Generalist Chest X-ray Understanding},
author = {Pal, Ankit and Lee, Jung Oh and Zhang, Xiaoman and
Sankarasubbu, Malaikannan and Roh, Seunghyeon and
Kim, Won Jung and Lee, Meesun and Rajpurkar, Pranav},
journal = {arXiv preprint arXiv:2506.04353},
year = {2025}
}
@article{zhang2025rexgradient,
title = {ReXGradient-160K: A Large-Scale Publicly Available Dataset
of Chest Radiographs with Free-text Reports},
author = {Zhang, Xiaoman and Acosta, Juli{\'a}n N. and Miller, Josh and
Huang, Ouwen and Rajpurkar, Pranav},
journal = {arXiv preprint},
year = {2025}
}
@article{zhang2025rexrank,
title = {ReXrank: A Public Leaderboard for AI-Powered Radiology
Report Generation},
author = {Zhang, Xiaoman and Zhou, Hong-Yu and Yang, Xiaoli and
Banerjee, Oishi and Acosta, Juli{\'a}n N and Miller, Josh and
Huang, Ouwen and Rajpurkar, Pranav},
journal = {AAAI Bridge Program AIMedHealth},
year = {2025}
}
附录 P:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本体论文 | “ReXVQA” OR doi:10.1142/9789819824755_0018 OR arXiv:2506.04353 | PSB 2026 章节页/arXiv 页 |
| 数据仓库 | site:huggingface.co ReXVQA / HF API datasets?search=ReXVQA | rajpurkarlab/ReXVQA |
| 上游影像 | ReXGradient-160K(本库 rid 717 条目) | 同族协议与影像规格 |
| 平台 | rexrank.ai | ReXrank 榜单(报告生成+VQA) |
| 团队谱系 | Rajpurkar lab datasets / monk1337 PSB-Conference-2025 | 系列数据集与补充材料 |
| 技能框架 | “negation assessment” “chest X-ray” benchmark | 本体论文及引用者 |
| 反例(勿用) | 数据卡标题 “ReXGradient-160K Dataset” 直搜 | 会命中的是上游而非本条目(坑 1) |
检索卫生两条:一、以 HF 数据卡标题定位本数据集会走错仓库——认准仓库名 ReXVQA 与论文标题双锚点;二、README 正文数字(653,834 与 splits 表)是发放时点快照,引用注明抓取日期并对照论文口径。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(arXiv:2506.04353 / PSB 2026,DOI 10.1142/9789819824755_0018)、HF 数据卡与 LICENSE 文件(hf-mirror 实抓)、仓库文件树 API 实测与 gated 拦截实测为源;问题总数四口径、数据卡沿承上游 title、configs 失效、医疗系统数 3/4 冲突、83.24 与 83.84 双数字等原始文档缺陷已在坑点与附录 I 存照。条目与库内 ReXGradient-160K(rid 717,直接上游)、VQA-MED(rid 280)、VQA-RAD(rid 240)、PathVQA(rid 260)、PMC-VQA(rid 270)、OmniMedVQA(rid 290)等条目互链,构成医学 VQA 家族三代技术路线的完整检索面。后续维护触发点见附录 J。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rex-in-the-wild — 共享标签:多模态 / 视觉问答 / 医学问答 / 评测基准
- vqa-med — 共享标签:医学影像 / 多模态 / 视觉问答
- 3dreasonknee — 共享标签:医学影像 / 多模态 / 视觉问答 / 评测基准
- omnimedvqa — 共享标签:医学影像 / 视觉问答 / 评测基准
- pathvqa — 共享标签:多模态 / 视觉问答 / 评测基准
- derm1m — 共享标签:多模态 / 视觉问答 / 评测基准
- medreco-db — 共享标签:多模态 / 视觉问答 / 医学问答
- mimic-cxr — 共享标签:医学影像 / X光影像 / 多模态
- latte-cxr — 共享标签:医学影像 / X光影像 / 多模态
- ms-cxr-t — 共享标签:医学影像 / X光影像 / 多模态 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

