ReXInTheWild (rex-in-the-wild) — AI-Ready Wikipedia

哈佛 Rajpurkar 组的医学照片理解统一基准——484 张源自 PMC 文献的'野外'普通照片配 955 道两阶段临床医生审核的多选题,覆盖七临床主题,通用旗舰模型 68-78% 而医疗专用 MedGemma 仅 37%,CC BY-NC-ND 3.0 HuggingFace 公开直链

来源 BIOMEDICA(CVPR 2025,PMC-OA 非商用 Natural Images 切片)随机采样 32,982 张 → GPT-5 两步视觉过滤 → 484 张医学照片;GPT-5 生成 1,086 道候选题 → 两阶段临床医生审核 → 955 题;data/qa.csv(12 字段)+ data/images/ 484 张 jpg(共 52,947,394 字节)发布时间: 2026-09-30最后更新: 2026-09-30 阅读 11
ReXInTheWild (rex-in-the-wild) — AI-Ready Wikipedia

信息速览

数据集名称ReXInTheWild (rex-in-the-wild) — AI-Ready Wikipedia
数据类型人工标注,影像数据,原始数据
规模受试者人数未披露(484 张照片中含患者与健康人,无个体标识与人口学字段);955 道多选题 / 471 图 × 2 题 + 13 图 × 1 题 / 源自 381 篇 PMC 文献
接入方式BIOMEDICA(CVPR 2025,PMC-OA 非商用 Natural Images 切片)随机采样 32,982 张 → GPT-5 两步视觉过滤 → 484 张医学照片;GPT-5 生成 1,086 道候选题 → 两阶段临床医生审核 → 955 题;data/qa.csv(12 字段)+ data/images/ 484 张 jpg(共 52,947,394 字节)
AI 就绪度

INFOBOX — ReXInTheWild 一屏速览

维度 内容
本质 医学照片(普通相机拍摄)理解统一评测基准——不是胸片、不是报告语料、不是训练集
团队 Harvard Medical School 生物医学信息系(rajpurkarlab),一作/通讯 Oishi Banerjee,PI Pranav Rajpurkar;12 作者 7 机构
论文 arXiv:2603.19517 [cs.CV],v1 提交于 2026-03-19(11 页 4 图),DOI 10.48550/arXiv.2603.19517
数据 955 道多选题 × 484 张照片,全部选自 PMC 开放获取文献(381 篇);qa.csv(约 0.54 MB)+ 图像包(约 53 MB)
主题 七临床主题:躯干四肢 372 / 头颈 246 / 眼 148 / 口颌 116 / 皮肤毛发 37 / 外科操作 26 / 其他 10
管线 BIOMEDICA 采样 32,982 → GPT-5 两步过滤 → 543 图 → 每图 5 候选题 → 精选 1,086 → 两阶段医生审核 → 955 题
主榜 Gemini-3 78% / Claude Opus 4.5 72% / GPT-5 68% / MedGemma-4B 37%(医疗专用反而垫底)
错误学 四类错误分类法:几何 0.30 / 定位 0.33 / 特征 0.38 / 因果 0.15;99% 错误可归类
Split 仅 eval 一个评测 split——零样本评测用,不可训练
获取 HuggingFace 公开直链(gated=false),rajpurkarlab/ReXInTheWild
许可 数据集 CC BY-NC-ND 3.0(底层 PMC 非商用图像混合许可取最严);论文文本 CC BY-NC-ND 4.0
库内互链 rexgradient-160k(717,同实验室 ReX 家族)、vqa-rad(240)、slake(250)、pathvqa(260)、pmc-vqa(270) 等

ReXInTheWild 是一个把"AI 看病"的考场从影像科搬到日常生活里的评测基准:它不用 X 光机、病理切片或眼底相机拍出来的标准影像,而是收集 484 张普通相机拍摄的、出现在已发表医学文献里的"野外"照片——伤口、斜视、肿胀的关节、术后疤痕——再配上 955 道由临床医生逐题审核的多选题,去问多模态大语言模型:你真的看懂了吗?基准最刺眼的发现是:通用旗舰模型得分 68%-78%,而专为医疗训练的 MedGemma 只有 37%。名字里的 ReX 是 rajpurkarlab 实验室的家族前缀(同族还有 ReXGradient-160K 与 ReXrank),但这个数据集与胸片报告毫无关系——论文在图像筛选阶段明确把 X 光片剔除出局。

导语读法三则:

  1. 只想下数据跑评测:直奔 §6 获取与许可——单 eval split、CSV+JPG 双文件、CC BY-NC-ND 3.0 禁商用,加载代码可直接复制。
  2. 关心模型评测结论:直奔 §4 主榜与分类别分析、§5 四类错误分类法——医疗专用模型为何垫底的讨论在 §4 末段。
  3. 做医学 VQA 选型对比:直奔 §7 生态与互链——它与 VQA-RAD/SLAKE/PMC-VQA 的边界,以及与同实验室 rexgradient-160k(717) 的分工。

§0 导读:这个数据集解决什么问题

医学视觉语言模型(Vision-Language Model, VLM)的评测考场几乎全部设在"受控环境"里:X 光、CT、病理切片、眼底照片——由专业设备采集、标准体位拍摄、经临床流程归档。但真实世界里,医疗视觉信息的第一现场往往是一部普通手机:患者把皮疹拍照发进在线问诊平台,家属把术后伤口照片贴上健康论坛,全科医生用手机记录腕关节活动度随访问诊。论文引言给出一组场景综述:远程医疗、在线健康社区、床旁伤口随访、消费级设备皮肤病与眼科筛查——普通照片早已深度参与医疗信息流通,却没有一个统一基准回答"模型能不能看懂这些照片"。

这个空白不是没人做过题,而是没人在正确的粒度上做过题。现有医学 VQA 基准(VQA-RAD、PathVQA、SLAKE)聚焦放射与病理的专科影像;综合性基准(MMMU、PMC-VQA)把少量照片混进海量其他临床图像里,无法单独考察照片这一类;皮肤科有 DermaVQA、MM-Skin 等专属数据集,其他专科的照片资源则碎片化在步态分析、龋齿检测等窄任务里。结果是"照片理解"成了一道所有模型都被考过、但从未被单独划出考场的题。

ReXInTheWild 的回答分三层。第一层是数据:484 张源自 381 篇 PMC 开放获取文献的医学照片,覆盖七个临床主题,每张配 1-2 道多选题,全部经两阶段临床医生审核。第二层是方法:一套"GPT-5 生成候选 + 自动对抗性编辑 + 专家分诊重写"的基准构建流水线,从 32,982 张候选图像压到 955 道合格题,每一道都有文献溯源(pmc_url 字段直达原文)。第三层是批判:评测揭示医疗专用模型 MedGemma 反而大幅落后于通用旗舰,且错误呈四级结构——从最基础的左右不分,到最高层的因果误判——暗示"医学照片理解"需要的不是更多医学图文对,而是自然图像与医学知识的融合。

§0 读法三则:

  1. 这个条目的数据集类型是"评测基准"而非"训练语料":仅 eval 单 split、无训练集,AI-Ready 的意义在于"拿起来就能测",而不在"拿起来就能练"(§2、§6)。
  2. 全文硬数字均经本代理对 qa.csv 逐行实核(2026-09-30):955 题、484 图、七主题分布与论文百分比逐项吻合;正文与论文表的口径冲突仅在错误多类占比一处(17% vs 0.16),已在坑 4 存照。
  3. 检索时若把 ReXInTheWild 当作胸片报告数据集去搜会一无所获——名字里的 ReX 只是实验室品牌前缀,与 ReXGradient-160K 的关系是"同家族不同物种"(坑 1、坑 2)。

0.1 在库内评测型条目坐标系中的位置

把本条目放进库内"评测/问答型"条目的坐标系,能更快锚定它的差异化身份:

库内条目(rid) 考场 图像形态 与本条目的关系
vqa-med(280) 医学 VQA 任务系谱(2019 任务集) 专科影像为主 系谱参照,任务定义早于"照片"意识
vqa-rad(240) / slake(250) / pathvqa(260) 放射/病理专科影像 VQA X 光、CT、病理切片 本条目刻意绕开的"受控影像"考场
pmc-vqa(270) / omnimedvqa(290) 混合多域医学 VQA 混合(含少量照片) 本条目的差异化靶点:照片无法被单独考察的问题
pmc-oa(320) / pmc-oa-subset(360) PMC 图文生态 原生图文档案 本条目图像的终极上游生态
rexgradient-160k(717) 胸片报告生成 胸片 + 报告文本 同实验室"另一翼"(§9.2)

这张表的读法:库内已有条目覆盖了"专科影像考试"与"混合多科考试",唯独"普通照片单科考试"是空白——ReXInTheWild 恰好补在这个空位上。它不替代任何现有条目,而是让"模型看懂患者拍的照片吗"这个问题第一次有了库内可引用的量化答案。

§1 数据集速览:十二问十二答

Q1:ReXInTheWild 到底是什么类型的数据集?
评测基准(benchmark):955 道单图多选题,用于零样本评测多模态大语言模型对医学照片的理解能力。它不是训练语料——官方只发布 eval 一个 split,没有 train/validation 划分,图像也只有 484 张。

Q2:“in the wild”(野外)指什么?
指照片拍摄于非受控环境:普通相机而非专业影像设备,非标准体位与构图,光照角度随意。不过需要澄清:这些照片全部选自已发表的 PMC 文献(患者知情同意的发表物),并非从社交网络爬取的未授权照片——"wild"形容的是拍摄场景与图像质量,不是获取渠道。

Q3:955 道题长什么样?
每道题一行 CSV 记录:一张图 + 一段问题 + 3-5 个选项(choice_a 到 choice_e,缺省留空)+ 唯一正确答案 + 七类主题标签 + 来源文献三件套(pmc_url/title/authors)。问题既有"图中 ruler 量的是什么距离"这类细粒度测量题,也有"这种术后表现提示什么"这类临床推理题。

Q4:七个临床主题分别是什么、各占多少?
Trunk & Extremities(躯干与四肢)372 题、Head & Neck(头颈)246、Eyes(眼)148、Mouth & Jaws(口颌)116、Skin & Hair(皮肤与毛发)37、Surgical & Procedural(外科与操作)26、Other 10。注意皮肤科被主动压缩——团队指示生成阶段跳过以皮肤科为主的图像,把那片领域让给 DermaVQA/MM-Skin 等专属基准。

Q5:题目是谁出的、谁审的?
GPT-5 出初稿:每张图生成 5 道候选题,再经两轮自动编辑(删提示性短语、精炼干扰项)。然后按清晰度/医学相关性/医学难度/视觉难度四维评分,每图精选 2 题,共 1,086 道进人工审核。审核两阶段:第一阶段住院医或医师逐题分诊(保留/重写/删除),第二阶段由 6 年以上经验的资深临床医生终审。最终 645 题原样保留、310 题重写、131 题删除,剩 955 题。

Q6:图像从哪来的、怎么筛的?
上游是 BIOMEDICA(CVPR 2025 发布的 PMC 开放获取全量图文档案,2400 万图文对)。团队从其"非商用许可 + Natural Images 聚类"切片随机采样 32,982 张,用 GPT-5 做两步过滤:先按图注剔除非人物/身体部位的图(风景、X 光片等),再看图像本身保留"普通非临床场景中的人物或身体部位"。合格率不足 5%,最终进入出题环节的图像 543 张。

Q7:模型成绩如何?
Gemini-3 78%(95% CI 0.75-0.81)、Claude Opus 4.5 72%(0.69-0.75)、GPT-5 68%(0.65-0.71)、MedGemma-4B-IT 37%(0.34-0.40)。最大的新闻是医疗专用模型 MedGemma 垫底——比最好的通用模型低 41 个百分点。

Q8:为什么医疗模型反而考砸了?
论文给出两层解释:规模与推理算力差距(4B 参数、无思维链 vs 旗舰级推理模型),以及更根本的假设——医学照片理解可能主要依赖对自然图像分布的广泛暴露,而非仅仅堆医学图文语料。MedGemma 在受控医学影像上训练,遇到光照随意、构图突兀的"野外"照片就遭遇域偏移(domain shift)。

Q9:错误都错在哪?
论文把 3 个顶级模型的 150 个抽样错误归成四类:测量/几何错误(左右不分、屈伸混淆)、定位错误(从耳廓解剖定位错到"没看见脚在地上")、特征描述错误(颜色形状质地判断失败)、因果错误(逻辑链断裂)。前三类各占三成以上,因果类占 15% 且多数与低层错误共现——高层错误往往"建立在"低层错误之上。

Q10:为什么它对 AI-Ready 重要?
它是"轻量可复现评测"的样板:两个文件(CSV+图像包)不到 54 MB,直链公开无门槛,字段结构自解释,每道题带文献溯源可审计——一个团队半天就能跑完一次完整评测。它的局限也很典型:单 split、无排行榜、无官方评测代码仓库,AI-Ready 光谱上属于"数据就绪、工具链欠奉"的一端。

Q11:题目出错怎么办——数据里有错误答案吗?
不排除个别瑕疵(131 题被删、310 题被重写说明构建方对质量相当较真),但每题都带 pmc_url——发现可疑题目时回查原文是最快的仲裁路径。这也正是溯源字段的设计意图:与其宣称"零错误",不如把验证成本降到一次点击。

Q12:它和"数据集"这个词的标准定义相符吗?
符合广义定义(结构化数据集合),但要按"评测基准"的子类理解:它没有按样本组织的人群/病例结构,而是按题目组织——每行是一条"考题记录"而非一条"病例记录"。做队列式分析(按患者聚合、按疾病分组)在这个数据上没有抓手,做 psychometric 式分析(题目难度、区分度)反而有完整素材。

§2 数据构成与规格

2.1 总体规模与文件形态

ReXInTheWild 的全部家当是 HuggingFace 仓库里的两个数据文件:

文件 规格 内容
data/qa.csv 542,925 字节(约 0.54 MB) 955 行数据 × 12 列,UTF-8 编码
data/images/ 484 个 JPG,共 52,947,394 字节(约 50.5 MiB) 与 qa.csv 的 file_name 一一对应的原始照片
README.md 1,857 字节 数据集卡(HF frontmatter + 结构说明 + 许可声明)

图像文件名自带溯源信息:PMC3115275_SNI-2-72-g006.jpg 这样的命名直接嵌入 PMC 文章编号(PMC3115275)、期刊卷期码与图序号,肉眼即可对回原文。HuggingFace 元数据将规模档位标记为 n<1K、模态标记为 image+text、格式标记为 csv,config 名为 default、split 名为 eval——整份数据在 HF 的 datasets 库里一个 load_dataset("rajpurkarlab/ReXInTheWild") 即可加载。

2.2 qa.csv 的 12 个字段

字段 类型 说明
file_name string 图像相对路径(images/PMC*.jpg)
question string 问题文本,含情境描述与提问
choice_a – choice_e string × 5 选项槽位;每题实际 3-5 个选项,未用槽位留空
answer string 正确答案的选项原文(不是字母编号)
tag string 七临床主题分类标签
pmc_url string 来源文献的 PMC 页面链接
title string 来源文献标题
authors string 来源文献作者列表(缩写格式)

三处使用细节值得注意:

  1. answer 是文本不是字母。955 题实测全部满足 answer ∈ {choice_a…choice_e 中非空项},但评测脚本必须按文本匹配而非固定槽位匹配——同一数据集内正确答案落在 a/b/c/d/e 各槽的频次并不均衡。
  2. 选项数不统一。实测分布:3 选项 4 题、4 选项 440 题、5 选项 511 题。解析时遍历五个槽位、以空串判空即可,不要假设固定四选一。
  3. CSV 内含引号换行。部分 title/authors 字段带逗号与换行,wc -l 会数出 960 行;用 csv 解析器按 RFC 4180 读取才是准确的 955 行(坑 3)。

2.3 七临床主题的分布与含义

qa.csv 的 tag 字段实测分布(绝对数),与论文报告的百分比逐项吻合:

tag 题数 实测占比 论文口径 典型考察点(qa.csv 例)
Trunk & Extremities(躯干与四肢) 372 38.9% 39% 关节屈伸角度、步态与体位、脊柱侧弯外观、肌腱术后康复动作
Head & Neck(头颈) 246 25.8% 26% 耳廓解剖定位、头面部术后表现、颈部肿块、颅骨修补术后
Eyes(眼) 148 15.5% 15% 睑裂宽度、上睑下垂分型、瞳距测量、眼睑松弛症体征
Mouth & Jaws(口颌) 116 12.1% 12% 张口度测量、咬合关系、牙科修复体识别、颞下颌关节检查
Skin & Hair(皮肤与毛发) 37 3.9% 4% 非皮肤科主导的皮肤表现(皮肤科主体被主动排除)
Surgical & Procedural(外科与操作) 26 2.7% 3% 术式辨认、切口设计原则、引流与缝合材料识别
Other(其他) 10 1.0% 1% 无法归入上述六类的散点(含远程就诊摄影质量类题目)

分布本身是一份"设计意图说明书":四肢与头颈合计近 65%,因为这两大片区域最适合用普通照片呈现(关节活动、体态、面部体征),且文献供给充足;皮肤科主动压缩到 4%——论文明确指示生成阶段跳过皮肤主导图像,理由是"那些最好由现有数据集覆盖"(DermaVQA、MM-Skin)。使用者若想拿 ReXInTheWild 测皮肤科理解,样本量不支持这种结论。

2.4 例题画廊:七个主题各看一道真题

以下七道例题全部从 qa.csv 原文摘录(2026-09-30 实抓),每主题一道,可直观感受题目颗粒度:

主题 问题(原文节译) 正确答案 考察点
Eyes “图中演示的是哪种评估眼睑松弛度的操作?” “用尺测量上睑的垂直上睑牵拉(松弛度)试验” 五个选项全部是真实存在的眼科检查操作(下睑回弹试验/提上睑肌功能/外眦牵拉试验/MRD1 测量),干扰项专业度极高
Trunk & Extremities “在子图 B 中,哪条腿承重更多?” “右腿(支撑腿)” 多格拼版图内的空间指代 + 体重分布判断——典型的"几何+定位"复合考题
Surgical & Procedural “这道疤痕最符合哪种手术入路?” “股骨干骨折固定的外侧入路” 五选项为五个真实骨科入路(髌骨旁外侧/大转子入路/Hardinge 入路等),需凭疤痕位置形态反推术式
Mouth & Jaws “图中操作最可能的目的?” “唇纹形态的法医识别记录(cheiloscopy)” 干扰项含敷料/斑贴试验/胶带撕脱取样等近似操作,考非常识性专业知识
Head & Neck “图中哪些耳廓亚结构畸形或缺如?” “对耳轮和舟状窝” 耳廓解剖的五对精细亚结构辨析——论文定位错误类型的代表性地形
Skin & Hair “哪项描述最符合该皮损的形态?” “下垂状、分叶状软组织肿块伴冗余皮肤及低位溃疡” 形态学描述词的精确匹配(悬垂/分叶/冗余/溃疡四要素)
Other “视频问诊中,哪条即时指令最能改善画面?” “调整握持让手指不要挡住镜头” 唯一的"非医学知识"题——考远程就诊场景的实用摄影指导

画廊透露的两个信息:其一,干扰项不是胡编的错项,而是真实的邻近临床操作与描述——这是"对抗性精炼"环节的产出,也解释了为什么通用大模型会栽;其二,题目谱系从"专业解剖辨析"一路铺到"手指别挡镜头",横跨专业与生活两个语义层——这正是"野外"二字的实际含义。

2.5 图像的"文献出身"及其双重含义

484 张照片全部来自 381 篇 PMC 开放获取文献,这是理解这份数据的钥匙,也是它最容易被误读的地方。

积极面:授权干净——所有图像天然落在 PMC Open Access 非商用子集内,个别图像的原始许可为 CC-BY-NC、CC-BY-NC-SA 或 CC-BY-NC-ND,团队取其中最严格的 CC-BY-NC-ND 作为整体口径发布(§6);可审计——每张图带 pmc_url,任何一道题的医学事实都能回溯到同行评议原文,审核阶段的医生正是这么做的(“cross-referenced the original PubMed articles”)。

受限面:论文 Limitations 自述三点分布偏差——①文献图像可能带标注箭头、多格拼版(panel)或部分涂黑,与"患者自拍"的真实形态有差距;②文献选题偏长尾疾病与重症表现,常见病、轻度表现的覆盖可能不足;③照片是从第三方视角"转述"的临床影像,而真实患者生成照片(patient-generated photos)更多呈现常见主诉与轻度表现。换言之,ReXInTheWild 测的是"模型对文献级医学照片的理解",把它直接外推为"远程医疗场景下的真实患者照片理解"时要打一个折扣。

2.6 与上游 BIOMEDICA 的数据血缘

ReXInTheWild 的图像不是从 PMC 原站逐篇抓取的,而是从 BIOMEDICA(Lozano、Min Woo Sun、Burgess 等,CVPR 2025,arXiv:2501.07171)二次选取。BIOMEDICA 把 PMC Open Access 子集整体序列化为约 2,400 万图文对、600 万余篇文章、27 TB 的 WebDataset 流式档案,并按 DINOv2 特征聚类做了主题分组(其中就有"Natural Images"组)与许可标注。

ReXInTheWild 的取样口径是 BIOMEDICA 中**“非商用许可 + Natural Images 标签”**的图像:随机采样 32,982 张 → GPT-5 两步过滤 → 不足 5% 合格。这条血缘关系有三层含义:①许可链继承 BIOMEDICA 的非商用切片口径,最终由 ReXInTheWild 以最严 CC-BY-NC-ND 统一;②"Natural Images 聚类"是个噪声聚类(论文原话 noisily clusters),所以需要 GPT-5 二次过滤——32,982 张里大量是图表、X 光片等混入物;③任何对图像来源的深度审计都要同时对照 BIOMEDICA 与 PMC 两级元数据。

2.7 与专科影像 VQA 的形态对照

把 ReXInTheWild 放进医学 VQA 的坐标系,形态差异一目了然:

维度 ReXInTheWild VQA-RAD PathVQA SLAKE
图像类型 普通相机照片(文献图) 放射影像 病理图 放射+解剖标注图
图像量 484 315 4,977(图对) 742
题目量 955(单选) 3,515 32,799 6,420
题型 多选 3-5 项 开放+封闭 开放+封闭 开放+封闭
专科跨度 七大临床主题跨科 放射科 病理科 放射科为主
图像来源 PMC 文献 公开放射数据集 病理教科书 公开放射数据集
规模定位 轻量评测基准 中型基准 大型训练+评测 中型基准

对照的启示:ReXInTheWild 用最小体量换最大专科跨度——它不追求"大数据",追求的是"第一个把照片单拎出来考"的建制化。对选型者的含义:训练医学 VQA 用 PathVQA/SLAKE 这类大供给,评测"野外照片"泛化用本条目,两者是互补而非竞争关系。

2.8 数据质量实测报告(本代理逐项校验,2026-09-30)

除论文口径外,本代理对 qa.csv 与 images 目录做了独立质量校验,结果如下:

校验项 方法 结果 判定
记录数 Python csv.DictReader 955 行(wc -l 物理 960 行系引号换行) 与论文一致
图像-表格关联 file_name 对 images 目录清单差集 484/484 双向命中,无孤儿记录/死链 优
答案完备性 answer ∈ options® 逐行断言 955/955 通过 优
选项数枚举 非空 choice 槽计数 3/4/5 选项 = 4/440/511 题 与论文口径一致
主题枚举 tag 值域检查 恰好 7 个枚举值,无脏值 优
溯源完整性 pmc_url 非空 + 格式匹配 955/955 非空且均为 pmc.ncbi.nlm.nih.gov 域 优
溯源一致性 pmc_url 数 vs title 数 381 URL / 377 标题(4 处标点级变体) 良(不影响主口径)
文件完整性 API 字节数 vs 目录清单 52,947,394 字节 / 484 文件逐项对齐 优
隐私字段 姓名/ID/联系方式列扫描 无(authors 仅为文献署名) 优

这份报告可以当作"下游使用前的验收基线":任何人在本数据上搭建评测流之前,跑一遍同款断言(附录 A 提供代码)即可确认拿到的副本与官方发布一致。对一份发布半年、无第三方复现报告的数据集,这种"可复制验收"是低成本的自保手段。

§3 构建管线:从 32,982 张到 955 道

3.1 管线全景

论文 Figure 2 把构建过程分为三个 Stage,本节按时间顺序展开为六个步骤,每步的关键数字均出自论文正文:

BIOMEDICA 非商用 Natural Images 切片
        │ 随机采样 32,982 张
        ▼
[步骤1] GPT-5 两步图像过滤(caption 级 + 图像级)
        │ 合格率 <5%
        ▼
[步骤2] GPT-5 逐图生成 5 道候选题(3-5 选项)
        │ 跳过无医学内容/皮肤主导图像 → 543 图留存
        ▼
[步骤3] 两轮自动编辑(删提示性短语 + 精炼干扰项)
        ▼
[步骤4] GPT-5 四维评分,每图精选 2 题 → 1,086 题
        ▼
[步骤5] Stage 1 临床医生逐题分诊(保留/重写/删除)
        ▼
[步骤6] Stage 2 资深医生终审 → 645 保留 + 310 重写 − 131 删除
        ▼
    955 题 × 484 图(正式版)

3.2 步骤 1:两步图像过滤

第一步按图注(caption)过滤:剔除图注描述对象不是人或身体部位的图像——风景、显微镜下的非组织图像、X 光片等专科影像都在此列。这一步同时完成了两件事:筛掉噪声聚类混入物,以及把"照片"与"医学影像"切开——后者是 ReXInTheWild 与整个 ReX 家族其他数据集划清边界的动作。

第二步按图像本身过滤:GPT-5 直接看图,保留"普通非临床场景中可见的人或身体部位"。两步之后合格率不足 5%——论文以此说明"Natural Images 聚类"里真正可用的野外医学照片多么稀少,也侧面论证了为什么此前没人建成这个基准:原始供给看起来很大(2400 万图文对),可用的部分近乎沙里淘金。

3.3 步骤 2:候选题生成与域避让

对每张有效照片,GPT-5 被要求生成 5 道候选题,每题 3-5 个选项,且题目应在视觉与医学两个维度都有挑战性——既不能看图注就能答,也不能靠常识蒙对。同时给定一条域避让指令:跳过缺乏医学内容的图像,以及以皮肤科为主题的图像(理由:皮肤科已有专属基准覆盖)。

本步结束时留存 543 张图。注意 543 是"出题环节留存数"而非步骤 1 的过滤输出数——后者论文正文未披露具体张数(坑 6)。543 张图 × 每图 5 题 = 2,715 道候选题的理论上限。

3.4 步骤 3:两轮自动编辑

第一轮删除泄露答案的提示性短语。论文给了具体示例:原始问题"Based on the location and length of the linear incision on the mid-thigh, which procedure is this scar most consistent with?“(基于大腿中段线性切口的位置与长度,这道疤最符合哪种术式?)被改写为"Which procedure is this scar most consistent with?”(这道疤最符合哪种术式?)——前半句的定位描述实际上把答案递到了嘴边。

第二轮精炼干扰项(distractor):提示模型使用更具迷惑性的错误选项策略,例如当图像含细微异常时提供"the image is normal"(图像正常)作为干扰项。这一步对抗的是"排除法秒杀"——若三个选项明显荒谬,第五个再难的知识点也会被蒙对。

3.5 步骤 4:四维评分精选

2,715 道候选不能全进人工审核(成本不可行),团队用 GPT-5 给每道题在四个维度打 1-5 分:清晰度(clarity)、医学相关性(medical relevance)、医学难度(medical difficulty)、视觉难度(visual difficulty),四维求和后每图取前 2 题。这一步把候选池压到 1,086 题(543 图 × 2 题)。

"每图最多 2 题"的设计还有一条隐性约束:同图两题必须考察不同知识点(审核规则允许医生提出全新题目替换,但要求与同图另一题保持区分度)。

3.6 步骤 5-6:两阶段人工审核

Stage 1:住院医师或医师逐题审核,按三分法定处置——

分诊集 含义 终局
Q_acc 题目-答案对可直接接受 保留
Q_rew 需重写以保证清晰度与临床相关性 医生可提出全新题目替换,仅要求与同图另一题区分
Q_del 直接删除 通常因图像不适合或无法支撑两道独立临床题

Stage 2:由一名 6 年以上经验的资深临床医生对每道题及其 Stage 1 分类做终审裁决。两阶段的审核者都被要求以清晰度与临床相关性为先,保证难度梯度,并交叉回查原始 PubMed 文献与医学文献验证有挑战性的题目。

终审结果:645 Q_acc + 310 Q_rew + 131 Q_del = 1,086。Q_rew 的 310 题经重写后保留,故最终 955 = 645 + 310,对应 484 张图(471 图各 2 题 + 13 图 1 题)。131 题连同其图像(543 − 484 = 59 张图被整体弃用或部分弃用)出局。

一个诚实的观察:审核淘汰率约 12%(131/1086),重写率约 29%(310/1086)——接近四成的题目经医生之手改动。这套"GPT-5 生成 + 专家两段审核"的分工产生的不是"AI 出题、人类盖章",而是"AI 起草、人类重写"——这也是全文把数据定性为 clinician-verified(医生核验)而非 clinician-annotated(医生原创)的原因。

3.7 与同类基准构建管线的成本结构对比

环节 ReXInTheWild 传统专家手写 VQA 纯模型合成 VQA
候选生成 GPT-5(每图 5 题) 专家逐题撰写 模型批量生成
难度控制 自动对抗编辑 + 四维评分 依赖专家经验 通常缺失
人工审核 两阶段、可回查文献 即写作即审核 常为抽检或不审
淘汰/重写率 12% / 29%(实测口径) 低(写作即定稿) 高或不披露
单题专家耗时 分钟级(分诊+重写) 十分钟级起 近零
可扩展性 中(受审核瓶颈) 低 高(无质保)

这条管线的可迁移价值在于"把专家时间花在刀刃上":机器负责起量与初筛,专家负责分诊与终审。PANDA-PLUS 的三层标注流水线(学生标注→复核→专家终审)是同一哲学在像素标注场景的变体——两者都把"专家逐题/逐张亲做"改写为"专家只做裁决",用流程结构换取规模与质量的平衡点。

3.8 管线的残余偏差清单

流水线每一步都是过滤器,过滤器都有偏。把各步的系统性偏差汇总成清单,供使用者评估结论适用范围:

环节 残余偏差 方向
采样(BIOMEDICA 切片) 只含非商用许可文献 → 开放性更强的期刊/地区被系统性排除 来源偏
caption 过滤 依赖图注质量 → 图注与图不符的样本可能被误筛 噪声
视觉过滤(GPT-5) "普通非临床场景"的判定边界主观 → 室内临床感照片可能被误留/误剔 定义偏
域避让(皮肤科跳过) 皮肤主题仅 37 题 → 该域结论不可下 覆盖偏
四维评分(GPT-5) GPT-5 的审美/难度观成为初筛标准 → 可能系统性淘汰"GPT-5 觉得容易但人类觉得难"的题 模型偏
审核(两阶段医生) 审核者科室构成未披露 → 主题间审核质量可能不均 专业偏
溯源(文献原文) 文献本身的重现性危机传染给基准 → 个别题目的医学事实可能随文献撤稿失效 时效风险

这份清单不是对管线的否定——相反,能在论文里凑齐这么多"账目"本身就是质控的体现——而是提醒:基于 955 题的任何跨模型结论,都携带上述偏差的联合效应。

3.9 接入现有评测框架:三种格式转换

主流多模态评测框架各有自己的数据格式,以下给出 qa.csv 到三种常见形态的最小转换逻辑(伪代码级,字段对齐关系按实测 schema 写定):

转换一:LMMS-Eval / VQA 风格(question + options + answer_key)

record = {
    "question_id": f"{Path(r['file_name']).stem}__{idx}",   # 图内多题需唯一 id
    "image": r["file_name"],                                  # 相对 images/ 的路径
    "question": r["question"],
    "options": options(r),                                    # 非空选项按 a-e 顺序
    "answer_key": options(r).index(r["answer"]),              # 转为槽位索引
    "category": r["tag"],
}

要点:answer_key 由原文反查槽位索引,转换后必须断言 0 <= answer_key < len(options)(坑 9 的转换期变体)。

转换二:OpenAI 风格 messages(多模态 chat 格式)

messages = [{
    "role": "user",
    "content": [
        {"type": "image_url", "image_url": {"url": f"file://{image_path}"}},
        {"type": "text", "text": r["question"] + "\n" + "\n".join(
            f"{'ABCDE'[i]}. {opt}" for i, opt in enumerate(options(r))
        )},
    ],
}]
# 期望输出:正确选项的完整原文;判分时用 startswith/包含匹配 + 原文兜底

要点:字母前缀是提示工程的一部分——论文协议是"选项打乱后作答",字母标注方式会影响小模型表现,复现时保持与论文一致的呈现顺序并固定打乱种子。

转换三:表格化分析格式(每模型 × 每题一行)

result_row = {
    "file_name": r["file_name"], "tag": r["tag"],
    "question": r["question"], "gold": r["answer"],
    "pred_modelA": ..., "correct_modelA": ...,
    "error_codes_modelA": "E2|E3",    # 按 §5.6 编码手册填写
    "pmc_url": r["pmc_url"],          # 保留溯源,方便错误回查原文
}

要点:保留 pmc_url 列——错误分析阶段回查原文的效率差异巨大,这是本数据集赠给错误学的结构化红利。

§4 评测结果:四个模型的同场竞技

4.1 主榜:旗舰与专科的分野

论文对四个多模态模型做了统一协议评测(全部为单次全量 955 题,95% 置信区间按题目二项分布计算):

模型 类型 版本标识 准确率 95% CI
Gemini-3 通用旗舰 Gemini-3-Pro-Preview 78% 0.75 – 0.81
Claude Opus 4.5 通用旗舰 claude-opus-4-5-20251101 72% 0.69 – 0.75
GPT-5 通用旗舰 2025-08-07(API 2024-12-01-preview) 68% 0.65 – 0.71
MedGemma-4B-IT 医疗专用 MedGemma-4B-IT(HF Transformers) 37% 0.34 – 0.40

三个可直接读出的结论:

  1. 即使最强的通用旗舰也远未饱和:78% 意味着五分之一强的问题仍然答错——对一个"看图识别伤口与体态"的任务,这个错误率在真实远程医疗场景里不可忽视。
  2. 医疗专用标签不等于医疗照片能力:MedGemma 比 GPT-5 低 31 个百分点,比 Gemini-3 低 41 个百分点。
  3. 模型排名的置信区间互不重叠(Gemini 0.75-0.81 vs Claude 0.69-0.75 临界相切 vs GPT 0.65-0.71 vs MedGemma 0.34-0.40),前三名的位次虽接近但整体梯度可信。

4.2 推理配置的透明度

论文 §2.3 完整披露了各模型的推理参数,这种级别的可复现性细节在评测论文中值得原样保留:

模型 采样参数 关键配置
GPT-5 temperature=1, top_p=1 版本 “2025-08-07”,API “2024-12-01-preview”
Claude Opus 4.5 temperature=1, max_tokens=512 版本 “claude-opus-4-5-20251101”
Gemini-3 temperature=1, top_p=0.95, top_k=64, thinking=True 版本 “Gemini-3-Pro-Preview”
MedGemma 非采样(num_beams=1) 经 HF Transformers 本地推理

统一协议还包括:所有模型被指示按患者视角解释"左/右"(影像学惯例的镜像逻辑,普通照片与读片相反);答案选项顺序打乱后送入;MedGemma 用束搜索而非采样,消除随机性对 4B 小模型的额外扰动。

4.3 分主题表现:稳定性中的暗礁

模型排名在七个主题内基本保持一致,但各模型都有自己的"最弱科":

模型 最弱主题 该主题准确率 95% CI
GPT-5 Eyes(眼) 59% 0.51 – 0.67
Claude Opus 4.5 Eyes(眼) 67% 0.60 – 0.75
MedGemma Head & Neck(头颈) 31% 0.26 – 0.37
Gemini-3 Head & Neck(头颈) 74% 0.69 – 0.79

眼睛与头颈是共同的重灾区——这两个区域的考题高度依赖精细空间测量(睑裂宽度、瞳距、耳廓亚结构定位)与精细解剖区分(螺旋缘 vs 对耳轮褶皱),恰好是下节错误分类法里"几何错误"与"定位错误"的高发地形。GPT-5 与 Claude 的第二弱科同为 Head & Neck(67% / 71%),MedGemma 与 Gemini-3 的第二弱科信息论文未展开,但整体结论一致:越需要毫米级视觉测量的主题,模型越挣扎。

4.4 "医疗模型垫底"的正确解读

MedGemma 37% 是全文最有传播力也最容易被误读的数字(坑 7)。把它读成"医疗专用模型不如通用模型"是过度概括——正确的读法有三层:

  1. 规模混杂:MedGemma-4B 与三个旗舰模型不在同一参数/算力档位。论文自己承认"差异可能源于模型规模与推理时算力的不同"(differences in model size and inference-time compute)。
  2. 训练分布错配:MedGemma 的医疗语料以受控影像与医学文本为主,而本基准考的是自然图像分布下的临床推理——论文的核心假设恰是"医学照片理解可能主要受益于对自然图像分布的大量暴露,而非仅仅依赖策划的医学图文语料"。
  3. 任务形态错配:本基准的考题不是"识别病灶"而是"理解一张普通照片里的医学情境"——后者一半是自然图像理解(构图、光照、几何、身体姿态),一半才是医学知识。MedGemma 的强项区域被任务定义刻意绕开了。

对使用者的操作含义:若要评测"医疗 VLM 在远程医疗照片场景的就绪度",ReXInTheWild 是合适的探针;若要评测"医疗 VLM 在影像科工作流的表现",本基准不是正确的考场。

4.5 论文图表索引(复现与引用对照用)

编号 内容 正文对应
Figure 1 医学照片的挑战示意(技术缺陷示例)+ 示例题对 §1 引言;域偏移直观呈现
Figure 2 构建管线三阶段(A 图像筛选 / B 问题生成 / C 自动与专家验证) §2 Methods;本条目 §3 的骨架
Figure 3 四模型总体与分主题成绩 §3.1;本条目 §4.1/§4.3 数据源
Figure 4 四类错误失败模式示例(含正常生理描述错误) §3.2;本条目 §5.1 数据源
Table 1 错误类型分模型占比(含 1+/2+ 类列) §3.2;本条目 §5.2 数据源

§5 错误分类法:四层抽象的失败地图

5.1 四类错误的定义与实例

论文对错误做了系统分类学(taxonomy)建设:从三个顶级模型(Gemini-3、Claude Opus 4.5、GPT-5)各抽取 50 个错误,共 150 个,由一名有经验的临床医生按四类归置(允许多重归类)。四类按抽象层级从低到高:

层级 错误类型 定义 论文实例
L1 Measurement/Geometry Errors(测量/几何错误) 基础几何判断失败 分不清身体左右侧;分不清关节处于屈曲还是伸展位
L2 Localization Errors(定位错误) 空间定位失败,谱系从医学细粒度到自然图像大尺度 细粒度:混淆耳螺旋缘(helical rim)与对耳轮褶皱(antihelical fold);大尺度:没注意到人的双脚是在地面上的
L3 Characterization Errors(特征描述错误) 对解剖特征的定性描述失败 颜色、形状、质地判断错误——可能源于自然图像理解差,也可能源于医学术语依赖专门描述词
L4 Causality Errors(因果错误) 因果与意图推理失败 说不出某个姿势会牵涉/影响哪些肌肉;不理解操作背后的逻辑

5.2 定量结果:错误的地形图

150 个抽样错误的归类统计(Table 1 原文数字):

模型 几何 定位 特征 因果 ≥1 类 ≥2 类
Claude Opus 4.5 0.28 0.24 0.38 0.16 0.98 0.08
Gemini-3 0.34 0.36 0.36 0.18 1.00 0.22
GPT-5 0.28 0.40 0.40 0.10 1.00 0.18
均值 0.30 0.33 0.38 0.15 0.99 0.16

四个可操作的读数:

  1. 覆盖率 99%:几乎所有错误都能落进四类框架——分类法有足够概括力,可直接复用为其他医学照片评测的错误编码本。
  2. 区分度:仅约六分之一错误跨类:正文口径为"only 17% belonged to multiple categories",Table 1 均值行为 0.16(分模型 0.08/0.22/0.18 的均值;坑 4 存照两口径差异)——四类大体捕捉的是互不重叠的失败模式。
  3. 特征描述(0.38)与定位(0.33)、几何(0.30)三足鼎立:低中层错误合计远超一半,说明顶级模型的瓶颈不在高深医学推理,而在把图看清楚。
  4. 因果错误(0.15)最少但共生性强:多数因果错误与其他类型共现——高层错误往往"建造在"低层错误的废墟上(论文原话:high-level errors tend to be “built on” lower-level mistakes)。修复几何与定位能力,可能连带治愈一部分"推理"问题。

5.3 缓解策略的四层映射

论文讨论节把四类错误逐一映射到技术缓解方案,构成一张"错误→药方"的对照表:

错误层 缓解方案 成本量级
几何/定位(L1-L2) 为 MLLM 挂载细粒度关键点检测或目标检测工具 低(现有工具即可)
特征描述(L3) 医学术语检索与相似案例查找工具(lookup/search) 中(需领域知识库)
因果(L4) 推理时计算(思维链)+ 先修复底层错误 中高(推理成本上升)
全局 检索增强生成(RAG)或模块化工具调用框架;不在临床数据或自然图像上单独微调,必须融合 架构级

这张表是全文最具工程落地价值的部分:它把"医疗 VLM 需要改进"的空泛结论翻译成了分层的工具箱清单。

5.4 与既有医学 AI 错误编码传统的衔接

四类分类法不是凭空造轮子,它可放进医学 AI 错误学的既有谱系里理解:

编码传统 抽象轴 与本分类法的关系
放射科报告错误分类(假阳性/假阴性/属性级错误,如 CRIMSON 的八属性体系) 临床内容维度 本分类法管"看图能力"层,报告错误学管"说出来对不对"层,互补
医学影像 VQA 错误分析(感知错误 vs 知识错误) 感知/知识二分 本分类法把"感知"细分为几何/定位/特征三层,粒度更细
通用视觉推理错误学(计数/空间/属性) 视觉技能维度 本分类法的 L1-L2 与之同源,L3-L4 加入医学语义
患者安全事件分层(near-miss → harm) 临床后果维度 本分类法不评后果——同一几何错误在"娱乐姿势问答"与"伤口随访"里后果截然不同

这层衔接的含义:四类分类法填的是"视觉感知失败"的精细刻度空位,与报告生成评估(同实验室 CRIMSON)分别在"看"与"说"两端。两者拼起来,才是医疗 VLM 失败模式的完整地图。

5.5 论文自述局限的四条边界

评测结论的适用范围受限于数据构建方式(§4 Limitations 原文归纳):

  1. 文献图像 ≠ 患者自拍:部分图像带标注、拼版或涂黑,与典型照片有分布差。
  2. 长尾偏倚:文献选题偏重罕见病与重症,常见病与轻度表现可能欠采样。
  3. 生成器偏置:GPT-5 参与初始出题可能引入偏置——但论文指出 Gemini-3 与 Claude Opus 4.5 均优于 GPT-5,说明"出题者偏好自家答案"的效应未主导结果。
  4. 静态图像的能力边界:某些医学评估本就不应只凭照片进行(触诊、动态检查、高级影像),基准中的这类题目对模型是"不公平但真实"的考题——它测的正是"模型知不知道自己不该答"之外的实际表现。

5.6 错误编码操作手册:如何把四类分类法用到自己的模型上

复用这套分类法时,可直接采用以下编码规范(依据论文定义整理,含本代理补充的操作细则):

编码 名称 判定问题(编码时自问) 边界情形处理
E1 测量/几何 模型是否在左右/屈伸/角度/距离等基础几何判断上出错? 若几何错误又引发了后续描述错误,同时记 E1 与相应高层码
E2 定位 模型是否把发现放错了位置(亚结构级或"在图里找错了地方"级)? “找不到目标”(漏检)与"放错位置"(错检)都记 E2
E3 特征描述 模型对颜色/形状/质地/大小的定性描述是否与图不符? 描述用词不规范但方向正确,不记 E3(那是术语问题不是视觉问题)
E4 因果 模型是否在因果链/意图/机制推理上出错? 多数 E4 与 E1-E3 共现:全部记录,统计时区分"纯 E4"与"共现 E4"
E0 未归类 以上皆非 论文口径下 E0 仅约 1%;若自评 E0 超过 10%,应先怀疑编码理解偏差而非数据异常

操作建议(论文未给出、由本代理依标注规范惯例补充):①双人独立编码 + 一致性系数报告(论文单标注者是它的短板,复用者可以做得更好);②先编码再讨论(防锚定);③抽样建议按模型 × 主题分层,而非论文的纯随机每模型 50 例——分层能让小主题的错误也进入样本。

§6 获取与许可:一个文件包的门怎么进

6.1 获取路径

唯一官方获取渠道是 HuggingFace(截至核验时点无独立 GitHub 代码仓库,坑 8):

# 方式一:datasets 库(推荐)
from datasets import load_dataset
ds = load_dataset("rajpurkarlab/ReXInTheWild")   # 单 eval split
row = ds["eval"][0]
row["file_name"]   # 'images/PMC8855428_....jpg'
row["question"]    # 问题文本
row["answer"]      # 正确选项原文(非字母)

# 方式二:直链下载(CSV + 图像包)
# https://huggingface.co/datasets/rajpurkarlab/ReXInTheWild/resolve/main/data/qa.csv
# 图像逐一位于 .../resolve/main/data/images/<file_name>

仓库 gated=false,无需登录、无使用协议门槛;中国大陆网络环境下 HF 主站不可达时,hf-mirror.com 的 API/raw/resolve 端点可完整替代(网页端可能跳转主站,属镜像站行为,坑 8)。整包体积约 53 MB,加载后即可离线评测。

6.2 许可结构:一层声明、三层血缘

层 对象 许可 含义
1 ReXInTheWild 数据集本体 CC BY-NC-ND 3.0 署名-非商用-禁止演绎;HF README frontmatter 与正文声明一致
2 底层图像(经 BIOMEDICA) PMC-OA 非商用子集,混合 CC-BY-NC / CC-BY-NC-SA / CC-BY-NC-ND 团队取最严格口径整体发布
3 论文文本(arXiv) CC BY-NC-ND 4.0 论文本体的许可,与数据集许可版本号不同(坑 5)

三层里的关键约束是 **ND(禁止演绎)+ NC(非商用)**的组合:

  • ND 对评测的影响有限:跑评测、改 prompt、变换选项顺序属于"使用"而非"演绎作品"——但若要发布"改写版题目"或"图像裁剪增强版"数据集,ND 条款构成直接障碍。
  • NC 对商业化产品的影响是刚性的:用本基准评测商业远程医疗产品内部模型属于研究使用边缘,将数据集本身纳入商业产品或付费服务则明确越界。
  • 溯源义务可一键履行:qa.csv 自带 pmc_url/title/authors,署名(BY)要求由数据结构天然满足——这是文献溯源设计的意外红利。

使用者还要注意许可版本链:图像的原始许可(个别为 CC-BY-NC-SA)在同一 ShareAlike 条款下可能反向约束衍生品,涉及再分发场景时应对 381 篇来源文献的许可逐一核验,而非只看数据集整体声明。

6.3 三种使用者画像的获取路线

画像 目标 推荐路线 关键提醒
评测工程师 两小时内跑通四模型复现 §6.1 加载 → 附录 A 断言校验 → 附录 C 手册 别跳过 qa.csv 断言(955/484/answer 匹配三件套)
数据集研究者 评估管线可迁移性 §3 全节 → §5.6 编码手册 → §8 启示 注意 §3.8 残余偏差清单,别把"有账目"当成"无偏差"
产品/临床决策者 判断医疗 VLM 能否用于照片场景 §0 → §4.4 → §11 记住三个数字:78/37/53MB——能力上限、专科短板、使用成本

6.4 版本链与维护状态

核验时点(2026-09-30)的状态:HF 仓库单版本(commit aceeb8f,2026-03-18 发布),无历史分叉;论文 arXiv v1 唯一版;无官方排行榜、无官方评测代码库、无 issue 区公告的更新计划。HF 端下载量 45、点赞 0——发布半年,社区生态尚未形成。这既是风险(无第三方复现校验)也是机会(错误分类法、分主题分析都是可复现的论文级开放题)。

§7 生态与影响:一个实验室的产品矩阵

7.1 rajpurkarlab 的 “ReX” 家族

ReXInTheWild 的名字前缀是理解其生态位的第一把钥匙:它是 Harvard Medical School Rajpurkar 实验室(rajpurkarlab)“ReX” 产品矩阵的最新成员。核验时点可确证的家族成员:

成员 形态 数据/对象 与本条目关系
ReXGradient-160K(库内 717) 训练/评测语料 16 万张胸片 + 报告(美国三大影像体系) 同家族不同物种:影像报告 vs 野外照片
ReXrank(rexrank.ai) 在线排行榜 胸片报告生成(ReXGradient 10,000 studies 测试集 + MIMIC-CXR/IU-Xray/CheXpert Plus,8 指标) 排行榜范式,无独立新语料
ReXVal 错误标注基准 胸片报告的临床错误标注(放射科医生参与) 报告质量评测组件
CRIMSON 评估指标 报告生成的临床锚定评分(含 RadJudge/RadPref 配套基准) 指标层,代码开源于 GitHub
ReXecution 评估框架 临床医生中心的医学 AI 助手评估(CXR 解读,2025-12 会议论文) 方法论层
ReXInTheWild(本条目) 评测基准 955 题 × 484 张野外医学照片 家族中唯一离开影像科的一个

家族演进逻辑清晰可读:ReXrank(2024-11)建胸片报告排行榜 → ReXGradient(2025)补最大测试语料 → ReXVal/CRIMSON(2025-2026)深化错误度量 → ReXecution(2025-12)走向临床工作流评估 → ReXInTheWild(2026-03)跳出影像科,把评测半径扩到"普通相机能拍到的全部医学情境"。实验室的长期主张一致:医学 AI 的评测要贴着真实世界的使用方式走。

7.2 上游 BIOMEDICA 与同代基准

上游关系(§2.6 已述):BIOMEDICA(CVPR 2025)提供图像池,ReXInTheWild 完成从"图文档案"到"临床考题"的价值增殖——这个"大海捞针+精加工"的模式与库内 pmc-oa(320)、pmc-oa-subset(360) 条目描述的 PMC 生态直接衔接。

同代对照系(论文 Related Benchmarks 节引用的坐标系):

  • 专科影像 VQA:VQA-RAD、PathVQA、SLAKE——与本基准互补,分别镇守放射与病理。
  • 混合多模态基准:MMMU、PMC-VQA——混入少量照片但无法单独考察,ReXInTheWild 的差异化正在于此。
  • 皮肤科专属:DermaVQA(MICCAI 2024)、MM-Skin——本基准主动避让的领域。
  • 窄任务碎片集:步态分析、龋齿检测等——论文批评的"碎片化"现状,本基准自称第一个跨专科照片统一基准(“to our knowledge, the first”)。

7.3 BIOMEDICA 深读:上游为什么重要

把 BIOMEDICA 单独拎出来讲,是因为它是理解本数据集"天生上限"的钥匙:

  • 规模与噪声并存:2400 万图文对听起来无限供给,但"Natural Images"聚类是 DINOv2 无监督聚类的产物(论文原话 noisily clusters),32,982 张采样里合格率不足 5%——上游的一次聚类误差被下游两步过滤消化。
  • 许可预过滤的价值:BIOMEDICA 为每张图带许可标注,ReXInTheWild 直接取"非商用"切片,避免了逐篇回查 PMC 许可的巨大工程——这是"站在档案级上游肩上"的直接红利。
  • 聚类标签 ≠ 主题保证:本条目的七主题 tag 是构建时重新人工(+GPT-5)标注的,不是 BIOMEDICA 聚类标签的子集——使用者不要拿 BIOMEDICA 的簇标签去预测本基准的 tag。
  • 双上游审计路径:审一道题 = qa.csv 行 → 图像文件名内嵌 PMC 编号 → BIOMEDICA 元数据 → PMC 原文四级链路。任何一级断链都值得在 issue 区反馈。

7.4 引用与影响力轨迹

论文 2026-03-19 提交,核验时点(2026-09-30)被第三方索引(dblp/OpenAIRE/ADS/Scholar)稳定收录,OpenAIRE 引文计数 0、HF 下载量 45——处于"已归档、待发酵"阶段。对一个发布半年的评测基准,这属于正常冷启动;其长期影响力主要押注在两个未兑现的基础设施上:官方排行榜(家族有 ReXrank 的成熟先例可复用)与错误分类法的社区采用率。

§8 方法学启示:五条可迁移的经验

  1. "域避让"式数据设计。构建多域基准时主动排除已有专属基准的域(本例:皮肤科让位给 DermaVQA/MM-Skin),既避免重复劳动,又让新基准的贡献边界清晰可测。库内多域数据集(如 omnimedvqa(290) 的整合路线)可对照参考这条"做减法"的路线。
  2. "生成+两段审核"的人机分工模板。GPT-5 起草与对抗性编辑负责规模,医生分诊(保留/重写/删除三分法)与资深终审负责质量,文献溯源字段负责可审计——三层各司其职,29% 重写率证明"重写"通道不是摆设。任何"用 LLM 造医学题"的项目都应内置重写通道而非只做通过/不通过二元判定。
  3. 错误分类法是评测的二次产出。本基准的可复用资产不止 955 道题:四层错误分类法 + 150 错误的标注样本,本身就是一份可迁移的评测方法论——后来者做新基准时,可以直接借用这套错误编码本做对照分析。评测论文的长期价值往往在错误学而不在榜单。
  4. 把账目写进论文。从 32,982 采样到 955 定稿,每一步的流入流出数字(含"不足 5%"这种粒度的披露)都在正文留痕——这让第三方可以重构整条漏斗的效率与损耗,也让"543 不是过滤输出"这类口径问题有据可查。数据集论文的可信度,一半来自这些枯燥的中间数。
  5. 溯源字段是许可与人性的双重设计。pmc_url/title/authors 三列同时解决了三件事:CC BY 的署名义务、医学事实的仲裁路径、错误分析的回查入口。一份 CSV 自带的溯源结构,胜过一页许可声明。

§9 与库内条目的关系

9.1 互链图谱

库内条目(rid) 关系 互链建议
rexgradient-160k(717) 同实验室 ReX 家族:160K=胸片影像+报告的生成式语料;本条目=野外照片 VQA 评测。两者共同构成 rajpurkarlab"真实世界医学 AI 评测"的两翼 双向互链,条目内互称家族成员并对比分工
vqa-rad(240) 本基准论文引用的专科影像 VQA 代表;形态对照见 §2.7 从本条目 §2.7 表链出
slake(250) 同上(放射+解剖标注) 同上
pathvqa(260) 同上(病理,大型) 同上
pmc-vqa(270) 论文批评的"混合型"基准——照片混入无法单测;本基准的差异化靶点 本条目 §7.2 叙述链出
vqa-med(280) 医学 VQA 任务系谱参照 §0.1 坐标表链出
omnimedvqa(290) 多域 VQA 整合路线 vs 本条目的域避让路线 §8 方法启示对照
pmc-oa(320) / pmc-oa-subset(360) PMC 开放获取图文生态的上游叙述(本条目图像的终极源头) §2.5/§2.6 血缘链出

writing/ 目录内的 rexerr(已完成 FACTS.md)同属 ReX 家族候选,正式入库后可补链;rexgrounding-ct、rexvqa 在核验时点尚无内容,暂不互链。

9.2 与 rexgradient-160k(717) 的分工精述

两条目的互链叙述需精确到数据形态,避免读者把两者当成"同物不同版本":

  • rexgradient-160k:16 万级胸片影像 + 放射报告文本,服务报告生成模型的训练与评测;数据形态是 DICOM 影像对 + 结构化报告;规模是它的价值。
  • ReXInTheWild:955 道多选题,服务多模态大模型的零样本评测;数据形态是 CSV 题 + 照片包;跨专科跨度是它的价值。
  • 共同点仅三层:同一实验室(rajpurkarlab)、同一品牌前缀(ReX)、同一主张(真实世界评测)。图像模态(X 光 vs 自然照片)、任务(生成 vs 选择)、规模(16 万 vs 955)、许可结构(各自独立声明)全部不同。

一句话给互链定调:160K 是"让模型学会写胸片报告"的操场,InTheWild 是"看模型能不能看懂手机照片"的考场——操场再大也替代不了考场,反之亦然。

9.3 互链落地建议(供主会话发布时参考)

  • rexgradient-160k(717):在其 §7 生态节(或对应位置)增补一段"ReX 家族新成员"引述,指向本条目;本条目 §7.1/§9.2 已回链。
  • vqa-rad(240)/slake(250)/pathvqa(260):在各自"相关基准"或"对比"小节补一句"普通照片形态的跨专科评测另见 rex-in-the-wild";本条目 §2.7 已列出对照表。
  • pmc-vqa(270):本条目 §7.2 引用了论文对其"混合型"的批评——建议 pmc-vqa 条目侧以"局限与后续"口吻回链,形成批评-回应的成对叙述。
  • pmc-oa(320)/pmc-oa-subset(360):作为图像上游生态,在其"下游应用"类目下补挂本条目。
  • 暂不落地:rexerr(已有 FACTS,待其入库)、rexgrounding-ct/rexvqa(空目录)、BIOMEDICA(库内无条目,经由 pmc-oa 叙述衔接)。

§10 避坑清单:九个已踩过或必踩的坑

坑 1:把 ReXInTheWild 当胸片报告数据集

名字带 ReX、出自 rajpurkarlab、常与 ReXGradient 并列出现在检索结果——极易被二手信息转述成"胸片报告数据集"(本条目的派发 brief 即如此误记,见 FACTS.md 第 9 节存照)。实核:论文 §2.1 明确把 X 光片列为过滤剔除对象;摘要、HF 卡、字段结构均无任何胸片/报告元素。所有"胸片"预期都应清零后再读这份数据。

坑 2:ReX 家族成员混用

ReXGradient-160K(语料)、ReXrank(排行榜)、ReXVal(错误标注)、CRIMSON(指标)、ReXecution(框架)、ReXInTheWild(本基准)是六个不同层次的产物,引用时需精确到形态。最常见错误是把 ReXrank 的测试集当成独立数据集引用、或把 ReXGradient 的报告语料说成本基准的图像来源。

坑 3:用 wc -l 数 qa.csv 得 960

CSV 的 title/authors 字段含引号包裹的换行,wc -l 按物理行数得 960;RFC 4180 口径(csv 解析器)按记录数得 955——与论文、README、HF 卡三方一致。任何统计脚本必须用 csv 模块而非按行 split。

坑 4:错误多类占比的 17% vs 0.16

论文正文写"only 17% belonged to multiple categories",Table 1 均值行 2+ Types 为 0.16(分模型 0.08/0.22/0.18 的算术均值)。两口径差 1 个百分点,疑为加权 vs 算术均值的差异。引用时以 Table 1 分模型数字为准,如需总括值注明口径。

坑 5:license 版本号双口径

数据集 = CC BY-NC-ND 3.0(HF README frontmatter cc-by-nc-nd-3.0);论文文本 = CC BY-NC-ND 4.0(arXiv HTML 页头)。数据集相关的引用与再分发一律以 3.0 为准;两个版本号不得互相套用(4.0 的条款特性不适用于本数据集)。

坑 6:543 与 32,982 的口径错位

32,982 是 BIOMEDICA 采样数(步骤 1 输入);543 是出题后留存图像数(步骤 2 输出)。步骤 1 过滤后的图像张数论文未披露(仅给"不足 5%“合格率),不得把 543 记为"过滤后图像数”。管线各步数字:32,982 → (<5% 合格,张数未披露)→ 543 图出题 → 1,086 题进审 → 955 题定稿。

坑 7:把 MedGemma 37% 读成"医疗模型不行"

MedGemma-4B 与三个旗舰存在规模与推理算力的数量级差距,且其训练分布(受控影像+医学文本)与本基准的考察面(自然图像分布下的临床推理)错位。论文自身的解读是"医学照片理解可能主要需要自然图像暴露",而非医疗路线的失败。二次传播时带上下文,防止断章。

坑 8:获取渠道的非官方变体

论文与 HF 卡均未链接任何 GitHub 代码仓库——第三方镜像或个人复现仓库都不是官方渠道。大陆网络下 hf-mirror.com 网页端会跳转主站(非大陆 IP 检测),但 API/raw/resolve 端点功能完整;以 hf-mirror API 抓取的元数据与主站一致。引用数据集时一律指向 HF 官方仓库。

坑 9:answer 字段按槽位字母处理

answer 是选项原文文本而非 “A”/“B” 字母(实测 955/955 题的 answer 均精确匹配某个非空选项槽),且选项数 3-5 不等(3 选项 4 题 / 4 选项 440 题 / 5 选项 511 题)。评测脚本若假设"四选一、按字母判分"会同时踩中两个错:槽位错配与选项数越界。另有一个隐蔽变体:极少数选项的原文自带字母前缀(如实测一例选项原文为 “C (immediate push-off after landing)”——文献子图标注残留在选项文本里),简单的"取首字母"启发式在这种题上会翻车;按全文精确匹配并保留原文展示是唯一稳的口径。

§11 总结

ReXInTheWild 用最小的数据体量(955 题、484 图、53 MB)完成了一次考场建制:把"普通照片里的医学理解"从混合基准的背景噪声里单拎出来,配齐了溯源(381 篇 PMC 文献逐题可查)、质控(两阶段医生审核、29% 重写率)、透明度(推理参数全披露)与方法论(四层错误分类法)。它的主榜结果——通用旗舰 68-78%、医疗专用 37%——为"医疗 VLM 需要自然图像暴露"的论点提供了首个建制化证据;它的管线为"LLM 生成 + 专家裁决"的基准构建提供了带成本结构的模板;它的许可(CC BY-NC-ND 3.0)与单 eval split 设计则提醒使用者:这是一份评测资产而非训练资产。在 AI-Ready 光谱上,它属于"数据就绪、工具链欠奉"的一端——数据本身拿起就能用,排行榜、代码库与社区生态则留给论文之外的后来者。

FAQ(高频问答 50 问)

Q1:ReXInTheWild 里有多少道题、多少张图?
955 道多选题,484 张照片。每图配 1-2 题(471 图 × 2 题 + 13 图 × 1 题),全部题目经两阶段临床医生审核。

Q2:数据存在哪里、怎么下载?
HuggingFace rajpurkarlab/ReXInTheWild,gated=false 无需登录。核心是 data/qa.csv(约 0.54 MB)与 data/images/ 下 484 个 JPG(约 50.5 MiB)。load_dataset("rajpurkarlab/ReXInTheWild") 一步加载,或走 resolve 直链。

Q3:整包下载要多少流量?
约 53 MB。这是它"轻量评测"定位的直接体现——半张图的钱跑一次完整多模态评测。

Q4:题目是什么格式?
每题一行 CSV:一张图 + 问题 + 3-5 个选项(choice_a 至 choice_e,未用槽位留空)+ 正确答案原文 + 主题标签 + 来源文献三件套(pmc_url/title/authors),共 12 个字段。

Q5:选项一定是 5 个吗?
不是。实测 3 选项 4 题、4 选项 440 题、5 选项 511 题。解析时以空串判空槽位,不要假设固定数量。

Q6:answer 字段是字母还是文本?
选项原文文本(如 “Narrowed palpebral fissure from upper-lid edema causing mechanical ptosis”),不是 A/B/C 字母。955 题实测全部如此,评测脚本要按文本匹配。

Q7:七个主题怎么分布?
躯干四肢 372、头颈 246、眼 148、口颌 116、皮肤毛发 37、外科操作 26、其他 10。头两区合计约 65%。

Q8:为什么皮肤科只有 37 题?
主动避让:生成阶段被明确指示跳过皮肤主导图像,把该领域让给 DermaVQA、MM-Skin 等专属基准。不要用本基准下皮肤科结论。

Q9:图像是从网上爬的吗?
不是。全部选自 PubMed Central 开放获取文献(381 篇),经 BIOMEDICA 档案二次选取,每张图带 pmc_url 可回溯原文。患者已通过论文发表渠道授权。

Q10:“in the wild” 到底指什么?
拍摄场景与图像质量的"非受控"——普通相机、非标准体位、随意光照。不是指数据获取渠道的野生(未授权)状态。

Q11:图像里是真实患者吗?
是已发表文献中的临床病例照片与健康人照片(论文图示含"healthy subjects and patients with medical conditions"),无个体标识、无人口学信息。部分图像带文献特有的标注、拼版或涂黑。

Q12:有训练集吗?
没有。官方只发布 eval 一个 split,设计用途就是零样本评测。想拿它训练属于用途越界且数据量不支持。

Q13:题目是谁出的?
GPT-5 起草:每图 5 道候选题,两轮自动编辑(删提示短语、精炼干扰项),四维评分后每图精选 2 题,共 1,086 题进入人工审核。

Q14:题目是谁审的?
两阶段:第一阶段住院医或医师逐题分诊(保留/重写/删除三分法),第二阶段 6 年以上经验资深临床医生终审。结果 645 保留、310 重写、131 删除。

Q15:审核淘汰了多少?
131/1086 ≈ 12% 直接删除,310/1086 ≈ 29% 重写。近四成题目被医生动过——这是 clinician-verified(医生核验)与"AI 出题人类盖章"的本质区别。

Q16:哪些模型被评测过?成绩如何?
Gemini-3 78%、Claude Opus 4.5 72%、GPT-5 68%、MedGemma-4B-IT 37%(95% CI 见 §4.1 表)。医疗专用模型垫底是论文最核心的发现。

Q17:MedGemma 为什么只有 37%?
三层原因:模型规模与推理算力差距(4B vs 旗舰)、训练分布错配(受控影像 vs 野外照片)、任务形态错配(照片理解 vs 影像识别)。不能简化为"医疗模型不行"(坑 7)。

Q18:评测时用了什么推理配置?
论文全披露:GPT-5 temperature=1/top_p=1;Claude temperature=1/max_tokens=512;Gemini-3 temperature=1/top_p=0.95/top_k=64/thinking=True;MedGemma 非采样 num_beams=1。左右方位统一按患者视角解释,选项打乱。

Q19:模型错在哪?
四类:测量/几何(左右不分、屈伸混淆)、定位(从耳廓亚结构到"脚在地上")、特征描述(颜色形状质地)、因果(逻辑链断裂)。150 个抽样错误中几何 0.30/定位 0.33/特征 0.38/因果 0.15。

Q20:错误分类法能复用吗?
可以。99% 的抽样错误能归入四类框架,仅约六分之一跨类——分类法有覆盖度也有区分度,可直接作为其他医学照片评测的错误编码本。

Q21:license 是什么?商业项目能用吗?
CC BY-NC-ND 3.0。NC 禁止商用、ND 禁止演绎(改题/裁图再分发受限),署名义务由自带溯源字段天然满足。商业产品将其用于内部研究性评测属灰色地带,纳入产品或付费服务明确越界。

Q22:为什么是 3.0 不是 4.0?
底层 PMC 图像混合许可(CC-BY-NC/NC-SA/NC-ND)中含 3.0 版本条款,团队按最严格兼容口径统一到 3.0。论文文本本身是 CC BY-NC-ND 4.0——两个版本号各管各的对象,不要混用(坑 5)。

Q23:有官方排行榜或评测代码吗?
核验时点都没有。论文的 4 模型成绩是唯一公开基线;论文与 HF 卡均未链接 GitHub 仓库。家族先例 ReXrank 提供了排行榜的可能性,但尚未落地。

Q24:和 VQA-RAD/SLAKE/PathVQA 是竞争关系吗?
互补。它们守放射/病理的专科影像考场,本条目守"野外普通照片"考场——图像类型、专科跨度、题型、规模全不同(对照表见 §2.7)。训练用大供给基准,评测野外泛化用本条目。

Q25:和 rexgradient-160k 什么关系?
同实验室(rajpurkarlab)同前缀(ReX)的两个不同物种:717 是 16 万张胸片+报告的生成式语料,本条目是 955 题的野外照片 VQA 基准。图像模态、任务、规模、许可全部不同(§9.2)。

Q26:和 PMC-VQA 的区别?
PMC-VQA 把照片混进大量其他临床图像里无法单独考察;本条目把照片单拎出来且跨七专科统一出题——论文正是以此为差异化立足点。

Q27:图像源头 BIOMEDICA 是什么?
CVPR 2025 发布的 PMC-OA 全量图文档案(约 2400 万图文对、27 TB、WebDataset 流式),带主题聚类与许可标注。本条目从其"非商用+Natural Images"切片采样 32,982 张起步。

Q28:32,982 怎么变成 484 的?
GPT-5 两步过滤(caption 级 + 图像级)合格率不足 5% → 出题后 543 图留存 → 审核后 484 图。注意步骤 1 的输出张数论文未披露,543 不是过滤输出数(坑 6)。

Q29:qa.csv 用 Excel 打开会出问题吗?
会有隐患:title/authors 字段含逗号与内嵌换行,需 UTF-8 + RFC 4180 兼容解析;wc -l 会数出 960 行(物理行)而非 955 题(逻辑记录)。统计一律用 csv 解析器(坑 3)。

Q30:这份数据的 AI-Ready 短板是什么?
数据层几乎满血(直链、轻量、自解释字段、逐题溯源),工具链层欠奉:无官方排行榜、无评测代码库、无第三方复现校验、HF 下载量低(45,2026-09-30 抓取)。评测者需要自建评分脚本与统计口径。

Q31:可以用它做训练或微调吗?
设计上不可以(仅 eval split、许可 ND 限制演绎、数据量不支持),但"用它的题做 few-shot 示例"或"用它的错误分类法设计训练目标"属于合理的研究性使用——边界在于不要把它变成训练语料本身。

Q32:题目难度有官方分级吗?
没有官方难度字段。可用作代理的信号:GPT-5 四维评分只用于内部精选、未随数据发布;使用者可自行按主题(眼/头颈更难)、按选项数(5 选项题干扰更密)做难度分层。

Q33:一次完整评测要花多少算力/费用?
数据侧近乎零(53 MB);推理侧取决于模型:MedGemma-4B 本地可跑(单卡);三个旗舰按 955 题 × 单图输入计,API 费用在数十美元量级(含思维链的 Gemini-3 最高)。

Q34:论文的置信区间是怎么算的?
题目级二项分布的 95% 置信区间(正文方法名以 “Wil” 开头,按上下文为 Wilson 类口径;本条目按"95% CI"中性表述引用)。分主题 CI 同理但样本更小(如 Eyes 148 题),区间相应更宽。

Q35:能自己往里加题吗?
技术上可以(schema 简单),许可上受 ND 限制(衍生数据集不能以原许可再分发)。合规路线:自建扩充题集,发布时标注"评测协议参照 ReXInTheWild"而不混用原始题目。

Q36:七主题题量悬殊(372 vs 10),统计上要注意什么?
分主题报告时 Other(10 题)与 Surgical & Procedural(26 题)的 CI 极宽,"某模型在 Other 上更强"之类结论没有统计意义。建议合并报告或只做点估计。

Q37:图像有没有患者隐私风险?
图像全部来自 PMC 已发表文献(出版流程已含知情同意与去标识审查),数据集不含姓名/ID 等新标识。使用者仍应履行 BY 署名义务——这是许可要求也是学术伦理要求。

Q38:和 omnimedvqa(290) 的"大杂烩"路线比,哪个更值得接进评测流?
看目的:要"广覆盖回归测试"用 omnimedvqa(域多、量大);要"照片场景专项体检"用本条目(域窄、颗粒细、有错误学框架)。两者在评测矩阵里正交,不是二选一。

Q39:论文为什么特意声明"跳过皮肤科"?
防止照抄式重复建设——皮肤照片 VQA 已有 DermaVQA/MM-Skin 两个成熟基准。这条声明同时也是对使用者的警告:Skin & Hair 37 题只是"非皮肤主导"的残留,不是皮肤科评测集。

Q40:MedGemma 为什么选 4B 版本?
论文未解释。合理推测:4B 是当时可单卡复现的尺寸,且论文卖点是"专用小模型 vs 通用旗舰"的现实差距。复现者若要控制规模变量,应自行补测同家族更大参数版本——这是论文留下的开放题。

Q41:数据里有没有重复题?
实测 955 题的 file_name+question 组合唯一;同图两题被审核规则强制区分知识点。但"考点相似的不同题"(如两张图都考 MRD 测量)天然存在——这是"同一临床技能多题采样"的设计特征,不是缺陷。

Q42:能拿它的错误分类法标注自己模型的错误吗?
可以,这正是它作为"二次产出"的价值。要点:分类定义见 §5.1;允许多重归类;建议两名标注者独立标注后算一致性(论文只用单标注者,这是它自己可改进的点)。

Q43:HF 下载量为什么这么低?
发布半年 + 无排行榜导流 + 评测论文常见"论文即用"模式(作者自评后社区跟进滞后)。低下载量不构成对数据质量的否证,但意味着"论文成绩之外没有第二来源可交叉验证"。

Q44:这份数据会被更新吗?
核验时点无官方更新信号。按家族惯例(ReXrank 持续运营),排行榜化是最可能的方向;但截至 2026-09-30,一切"将要更新"的说法都是推测。

Q45:如果只记住一件事?
ReXInTheWild 证明了"模型在标准化影像上的能力不能自动外推到患者随手拍的照片"——通用旗舰 68-78%,医疗专用 37%。给模型做体检时,别忘了这份 955 题的野外考卷;记住四个锚点:955 题/484 图、CC BY-NC-ND 3.0、eval 单 split、医疗专用垫底。

Q46:直接拿论文成绩当自己模型的对标线合理吗?
方向合理,数字要打折使用:论文成绩是特定版本字符串 + 特定提示协议下的单次结果,模型 API 迭代后会有漂移。对标时复刻协议(附录 C)比复刻数字重要。

Q47:这个基准测得出"模型会不会给危险医疗建议"吗?
测不出。它测的是照片理解与临床推理的准确率,不是安全性;错误分类法里也没有"危险建议"这一类。安全评估要用专门的 red-teaming 基准,两者不能互相替代。

Q48:九百多题对统计功效够吗?
对全量比较够(955 题下 5 个百分点的差异 CI 不重叠);对分主题比较勉强(148 题的眼部差异要 >10 个百分点才可信);对 Other/Surgical 两主题不够(10/26 题)。用前先算自己关心层级的功效。

Q49:五十三 MB 里最值钱的是什么?
按复用价值排序:①pmc_url 溯源列(审计基础设施);②四类错误分类法(方法论资产,虽不在数据文件里);③955 道医生核验过的题目本体;④图像本体(多数可从 PMC 公开渠道再获得)。这个排序解释了为什么 ND 许可对本数据集的伤害相对有限。

Q50:千方库为什么值得收录一个"只有 955 题"的小数据集?
因为 AI-Ready 不等于 AI-大。这个条目的价值在类型稀缺性(库内唯一的普通照片 VLM 基准)、方法论完整性(管线账目 + 错误学 + 复现手册)与家族坐标(补全 rajpurkarlab 图谱、锚定 rexgradient-160k 的另一翼)——三者都不随题目数量缩水。

事实清单(硬事实 46 条)

  1. 数据集全称 ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding;slug rex-in-the-wild。
  2. 发布方 rajpurkarlab(Harvard Medical School 生物医学信息系);HF 仓库 rajpurkarlab/ReXInTheWild。
  3. 论文 arXiv:2603.19517 [cs.CV](跨列 cs.LG),v1 提交 2026-03-19 22:54:28 UTC,11 页 4 图。
  4. 论文 DOI 10.48550/arXiv.2603.19517;作者 12 人;一作 Oishi Banerjee(通讯邮箱 oishi_banerjee@g.harvard.edu)。
  5. HF 仓库 lastModified 2026-03-18T07:57:05Z,commit sha aceeb8ff56ee5b0d9bb7b48a0c947895d0119b19。
  6. 规模:955 道多选题 × 484 张照片;381 篇独立 PMC 来源文献。
  7. 每图题数:471 图 × 2 题 + 13 图 × 1 题。
  8. qa.csv 542,925 字节、12 字段;images 共 52,947,394 字节(484 个 JPG)。
  9. 选项数分布:3 选项 4 题 / 4 选项 440 题 / 5 选项 511 题;answer 全部为选项原文且必在选项集合内(955/955 实测)。
  10. 七主题实测分布:Trunk & Extremities 372 / Head & Neck 246 / Eyes 148 / Mouth & Jaws 116 / Skin & Hair 37 / Surgical & Procedural 26 / Other 10;与论文百分比 39/26/15/12/4/3/1 逐项吻合。
  11. HF 元数据:size_categories n<1K;task_categories visual-question-answering + question-answering;format csv;config default 单 eval split;gated=false。
  12. 图像上游:BIOMEDICA(CVPR 2025,arXiv:2501.07171,约 2400 万图文对)"非商用 + Natural Images"切片随机采样 32,982 张。
  13. 图像过滤:GPT-5 两步(caption 级 + 图像级),合格率不足 5%;步骤 1 输出张数论文未披露。
  14. 出题:GPT-5 每图 5 候选题(3-5 选项);跳过无医学内容与皮肤主导图像;543 图留存。
  15. 自动编辑两轮:删提示性短语(论文含大腿切口示例);精炼干扰项(含"图像正常"策略)。
  16. 精选:GPT-5 四维评分(clarity/medical relevance/medical difficulty/visual difficulty,各 1-5 求和),每图取前 2 题,1,086 题进审。
  17. 人工审核两阶段:Stage 1 住院医/医师三分法(Q_acc/Q_rew/Q_del);Stage 2 一名 6+ 年经验资深临床医生终审。
  18. 审核结果:645 保留 + 310 重写 + 131 删除 = 1,086;终版 955 题(955 = 645 + 310)。
  19. 评测模型与成绩:Gemini-3 78%(CI 0.75-0.81)/ Claude Opus 4.5 72%(0.69-0.75)/ GPT-5 68%(0.65-0.71)/ MedGemma-4B-IT 37%(0.34-0.40)。
  20. 推理配置:GPT-5 temp=1/top_p=1(版本 “2025-08-07”);Claude temp=1/max_tokens=512(claude-opus-4-5-20251101);Gemini-3 temp=1/top_p=0.95/top_k=64/thinking=True(Gemini-3-Pro-Preview);MedGemma num_beams=1 非采样。
  21. 统一协议:左右按患者视角解释;选项打乱;GPT-5 API 版本 “2024-12-01-preview”。
  22. 分主题最弱项:GPT-5 与 Claude 弱在 Eyes(59%/67%);MedGemma 与 Gemini-3 弱在 Head & Neck(31%/74%)。
  23. 错误研究:3 模型 × 50 错 = 150 个,一名有经验临床医生归类;四类均值几何 0.30/定位 0.33/特征 0.38/因果 0.15。
  24. 错误覆盖:99% 落入至少一类;多类占比正文口径 17%、Table 1 均值口径 0.16(分模型 0.08/0.22/0.18)。
  25. 许可:数据集 CC BY-NC-ND 3.0(HF frontmatter cc-by-nc-nd-3.0);论文文本 CC BY-NC-ND 4.0;底层图像为 PMC-OA 非商用子集混合许可取最严。
  26. 获取:HF 公开直链 gated=false,无登录门槛;核验时点无官方 GitHub 代码仓库、无官方排行榜。
  27. HF 社区指标(2026-09-30 抓取):downloads 45,likes 0。
  28. 资助:O.B. — Biswas Family Foundation Transformative Computational Biology Grant(与 Milken Institute 合作);S.E.K. — 韩国 KHIDI(保健福祉部)Grant # RS-2024-00403047。
  29. 机构 7 个:Harvard DBMI(5 人)、Seoul National University Hospital 研究所、MGH 消化科、Heidelberg 大学医院神经放射、King Abdulaziz Medical City(3 人)、University of Cincinnati 肺科(详见 FACTS 第 3 节双挂靠说明)。
  30. 论文关键词:Patient-Generated Health Data、Domain Shift、Diagnostic Reasoning、Multimodal Large Language Models、Vision-Language Models。
  31. 自述局限四条:文献图像带标注/拼版/涂黑;长尾与重症偏倚;GPT-5 出题偏置(受 Gemini/Claude 更优所缓解);静态图像能力边界。
  32. 家族成员:ReXGradient-160K(库内 717)、ReXrank(rexrank.ai)、ReXVal、CRIMSON(GitHub 开源)、ReXecution——本条目为家族中唯一非影像科数据集。
  33. 论文引用的对照基准:VQA-RAD、PathVQA、SLAKE、MMMU、PMC-VQA、DermaVQA、MM-Skin 及步态/龋齿等窄任务集。
  34. 论文自我定位:“to our knowledge, the first benchmark to evaluate vision–language models across multiple clinical specialties using ordinary photographs”。
  35. 图像文件名内嵌 PMC 编号与图序(如 PMC3115275_SNI-2-72-g006.jpg),肉眼可对回原文。
  36. qa.csv 独立标题 377 个(对应 381 个 pmc_url,4 处标点级变体)——标题数不作为正文口径。
  37. 审核者被要求交叉回查原始 PubMed 文献验证有挑战性的题目(论文原文 cross-referenced)。
  38. 论文给出两轮自动编辑的具体示例(大腿切口题删定位描述)与干扰项策略("图像正常"选项)。
  39. 缓解策略分层:几何/定位→关键点/目标检测工具;特征描述→术语检索;因果→思维链;全局→RAG/工具调用,融合训练主张。
  40. 同图两题须考察不同知识点:审核规则允许医生提出全新题目替换,但要求与同图另一题区分。
  41. hf-mirror.com 网页端对非大陆 IP 跳转主站,但 API/raw/resolve 端点完整可用(本条目全部 HF 数据经此实抓)。
  42. 本条目成稿期间遭遇 /tmp part 池并发覆写事故(同名代理实例覆写 part1-5),已按五步处置迁移私有区并全量重写——见文末事故附记。
  43. 覆写事故鉴别的覆写版指纹:keywords 含 “Pranaj Rajpurkar” 拼写错误、“人工关” 笔误 ×7、patient_tags 无据含"儿童"——这些特征串可作为 /tmp 池中覆写残留文件的快速鉴别器。
  44. 实测每主题第 2 题样本:Trunk 题答案 “C (immediate push-off after landing)” 证明个别选项原文自带字母前缀(文献子图标注残留),坑 9 的隐蔽变体。
  45. qa.csv 的 question 中存在跨子图指代题(如 “In subfigure B…” / “Compared with subfigure a…”)——多格拼版图上的空间指代是该基准的固有难度构成。
  46. 本条目全部 HF 元数据与文件均于 2026-09-30 经 hf-mirror API 抓取,抓取脚本为一次性只读操作,未向 HF 写入任何数据。

术语表(40 条)

术语 英文 释义
野外照片 in the wild photograph 普通相机在非受控环境拍摄的照片,光照/角度/构图非标准化
医学照片 medical photograph 含医学相关内容的普通照片(区别于 X 光/CT/病理等专用影像)
患者生成健康数据 patient-generated health data, PGHD 由患者而非临床流程产生的健康信息,手机照片是主要形态之一
视觉语言模型 vision-language model, VLM 同时处理图像与文本的多模态模型
多模态大语言模型 multimodal large language model, MLLM 在大语言模型基础上扩展视觉输入的多模态模型,本文与 VLM 互换使用
视觉问答 visual question answering, VQA 给定图像与问题、输出答案的任务范式
多选题 multiple-choice question, MCQ 提供 3-5 个选项、要求选出唯一正确项的题目形态
域偏移 domain shift 训练分布与测试分布不一致导致的性能退化;本基准考医疗模型从影像到照片的域偏移
干扰项 distractor 多选题中除正确答案外的迷惑选项;对抗性精炼指让其更难排除
提示性短语 leading phrase 题干中泄露答案线索的描述(论文示例:题干含切口位置与长度描述)
分诊三分法 Q_acc / Q_rew / Q_del 审核阶段对题目的三种处置:原样保留 / 重写 / 删除
临床医生核验 clinician-verified 题目由模型起草、医生逐题核验修正(区别于 clinician-annotated 医生原创)
错误分类法 error taxonomy 将模型错误按抽象层级归类的编码体系;本基准提出四类框架
测量/几何错误 measurement/geometry error 左右侧不分、屈伸关节混淆等基础几何判断失败
定位错误 localization error 空间定位失败,谱系覆盖耳廓亚结构到"脚在地上"
特征描述错误 characterization error 对颜色/形状/质地的定性描述失败
因果错误 causality error 因果与意图推理失败;多与低层错误共现
思维链 chain-of-thought, CoT 推理时让模型先产出中间推理步骤;论文列为因果错误的缓解手段
检索增强生成 retrieval-augmented generation, RAG 生成前先检索外部知识;论文列为全局缓解方向
零样本评测 zero-shot evaluation 不经任何本基准训练数据微调,直接测试;本基准仅支持此用法
单评测集 eval-only split 只发布评测划分、无训练/验证划分的数据组织方式
PMC 开放获取子集 PubMed Central Open Access subset PMC 中以开放许可发布的文献集合,本基准全部图像的最终来源
WebDataset WebDataset 以 tar 分片流式读取的大规模数据集格式;BIOMEDICA 的序列化形态
CC BY-NC-ND CC BY-NC-ND 署名-非商用-禁止演绎许可组合;本数据集整体许可(3.0 版)
拼版 panel 学术文献图中多子图合并排版的形态;论文局限性提及的图像差异来源之一
排行榜 leaderboard 持续收集模型成绩的在线评测设施;家族内 ReXrank 为先例,本基准暂无
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 本库数据集 AI-Ready 五维评估框架(附录 B)
睑裂宽度 palpebral fissure width 眼科测量指标,qa.csv 眼部题目的典型考察对象
MRD marginal reflex distance 眼睑位置测量(角膜光反射至上睑缘距离),眼部细粒度测量题实例
螺旋缘 helical rim 耳廓外缘解剖结构;定位错误实例中与对耳轮褶皱混淆的对象
对耳轮褶皱 antihelical fold 耳廓对耳轮的折返结构;同上
唇纹形态学 cheiloscopy 以唇纹形态做个体识别的法医学分支;qa.csv 口颌题实例
束搜索 beam search 保留多条候选序列的确定性解码方式;MedGemma 评测采用(num_beams=1)
Wilson 区间 Wilson interval 二项比例的置信区间算法;论文正文方法名以 “Wil” 开头,按中性口径引用
确定性解码 greedy/deterministic decoding 固定输出消除采样随机性;小模型评测常用
过滤漏斗 filtering funnel 采样→过滤→出题→精选→审核的逐级收敛结构;本管线 32,982→955
域避让 domain avoidance 建基准时刻意排除已有专属基准的领域;本例为皮肤科
溯源字段 provenance fields qa.csv 的 pmc_url/title/authors 三列,支撑逐题审计
训练-评测边界 train/eval boundary 本数据集"只能评不能练"的使用限制(单 eval split + ND 许可)
版本锚点 version anchor HF commit sha(aceeb8f)与 arXiv v1(2026-03-19)构成的双固定引用点

附录

附录 A:数据字典与加载规范

qa.csv 完整数据字典(12 列,实测口径):

# 列名 非空数 约束与说明
1 file_name 955 形如 images/PMC<编号>_<文件标识>.jpg;484 个唯一值;与 images 目录一一对应
2 question 955 自然语言问题;部分含情境限定语(如 “Compared with subfigure a…”)
3 choice_a 955 选项槽 a,恒非空
4 choice_b 955 选项槽 b,恒非空
5 choice_c 951 3 选项题留空(4 题)
6 choice_d 515 5 选项题才非空
7 choice_e 511 仅 5 选项题非空
8 answer 955 选项原文;955/955 可在 choice_a-e 中精确匹配
9 tag 955 七枚举值之一(见 §2.3 表)
10 pmc_url 955 形如 https://pmc.ncbi.nlm.nih.gov/articles/PMC<编号>/;381 个唯一值
11 title 955 来源文献标题;377 个去重值(4 处标点级变体)
12 authors 955 缩写格式作者串

稳健加载片段(Python,处理内嵌换行与空槽位):

import csv
from collections import Counter

with open("qa.csv", newline="", encoding="utf-8") as f:
    rows = list(csv.DictReader(f))

assert len(rows) == 955                     # 逻辑记录数,非 wc -l 的 960
assert len({r["file_name"] for r in rows}) == 484

def options(r):
    return [r[k] for k in ("choice_a","choice_b","choice_c","choice_d","choice_e") if r[k].strip()]

for r in rows:
    assert r["answer"] in options(r)        # 答案必在选项内(文本匹配,非字母)
print(Counter(r["tag"] for r in rows))      # 应得 §2.3 七主题分布

评测计分建议:按 tag 分组报告准确率与 95% 置信区间(与论文口径可比);选项顺序打乱前固定随机种子以保复现;MedGemma 类小模型建议非采样解码以消除方差。

附录 B:DAIMS 评估全表

评分框架:DAIMS 五维(可发现性 Discoverability / 可获取性 Accessibility / 互操作性 Interoperability / 元数据完备性 Metadata / 可持续性 Sustainability),每维 0-10 分,子项 0/0.5/1 三档。评分为本库编辑部口径(2026-09-30,基于对 HF 仓库、论文与 qa.csv 的逐项实核),反映"AI 系统与研究者拿起来就能用的程度"。

B.1 总览
维度 得分 一句话依据
可发现性 Discoverability 8.5/10 arXiv+HF+六大索引齐备,但名称易与 ReX 家族混淆、无排行榜聚合入口
可获取性 Accessibility 9/10 直链公开、gated=false、53 MB 轻量;扣分在 NC-ND 许可与大陆网络可达性
互操作性 Interoperability 8/10 CSV+JPG 最小形态、12 字段自解释;answer 文本匹配与内嵌换行需防呆
元数据完备性 Metadata 7.5/10 逐题文献溯源是亮点;患者/人口学/图像技术元数据完全缺失
可持续性 Sustainability 5.5/10 单版本无更新机制、无代码库、无排行榜、社区指标冷清
加权总评 7.7/10 数据即用型评测资产;短板集中在生态与维护层
B.2 可发现性 Discoverability:8.5/10
子项 得分 依据
正式出版物配套 1 arXiv:2603.19517,DOI 注册,论文-数据互链
跨库索引覆盖 1 dblp/OpenAIRE/ADS/Google Scholar/BIP!/CatalyzeX 全部收录
官方仓库唯一性 1 HF 单一官方仓库,无镜像混淆(第三方镜像非官方)
检索关键词覆盖 0.5 标题词明确;但 “ReX” 前缀与家族成员高度易混,二手转述常见类型误标(坑 1)
社区聚合入口 0.5 无排行榜/论文代码榜收录
命名可读性 0.5 “ReXInTheWild” 含驼峰与缩写,跨语言检索易失配
描述质量 1 HF 卡含概览/结构/许可三节;论文摘要自包含
引用就绪度 1 论文给出 HF 链接,数据引用路径清晰
术语标准化 1 tag 枚举、字段名直白
版本可追溯 1 arXiv v1 与 HF commit 双锚点

说明:本维度的唯一实质风险是"名字撞车"——ReXInTheWild/ReXGradient/ReXrank/ReXVal 在检索中互相稀释,且二手信息(包括本条目的派发 brief)常把本基准误标为胸片数据集。库内条目的价值之一即是把正确的类型边界(照片 VQA vs 胸片报告)固定下来。

B.3 可获取性 Accessibility:9/10
子项 得分 依据
无门槛下载 1 gated=false,无登录/无协议墙
总量轻量 1 53 MB,普通带宽分钟级
结构简单 1 两类文件(CSV+JPG),无嵌套归档
载入即用 1 load_dataset 单行加载
镜像可达性 0.5 hf-mirror API/raw/resolve 可用,网页端会跳主站
许可开放度 0.5 CC BY-NC-ND 3.0:研究自由、商用禁止、演绎受限
图像许可透明 1 混合许可策略公开声明(取最严口径)
溯源自足 1 pmc_url 内嵌,署名义务自动履行
API 稳定性 1 resolve 端点带版本锚点(commit sha)
备用渠道 0.5 无 Zenodo/机构库副本;HF 单点

说明:可获取性是本数据集最强的维度——"无门槛 + 轻量 + 自解释"三连使其成为少见的"5 分钟冷启动"评测资产。两个 0.5 的扣分项均非数据方过错:NC-ND 是继承图像许可链的被动选择;网络可达性是部署环境问题。

B.4 互操作性 Interoperability:8/10
子项 得分 依据
格式通用性 1 CSV(RFC 4180)+ JPG,零专用格式
字段自解释 1 12 字段名即文档
编码规范 1 UTF-8;引号转义合规
答案机读性 0.5 answer 为文本非字母,需文本匹配;无标准化选项编号列
内嵌换行防呆 0.5 title/authors 含引号内换行,朴素按行解析会错位(坑 3)
图像-表格关联 1 file_name 精确关联,无孤儿记录(实测 484/484 命中)
类别枚举稳定 1 tag 七值封闭集合
多框架兼容 1 datasets/pandas/polars/mlcroissant 官方标签齐备
评测脚本参考 0.5 论文披露推理参数但无官方评测代码
与同类基准对齐 0.5 单选题型与 VQA-RAD 等的开放题不直接互通;tag 与专科体系无官方映射

说明:CSV+JPG 是互操作性的"最大公约数"选择,配套 mlcroissant 标签说明团队考虑过机器可读元数据标准。answer 文本匹配这一设计在评测工程上略反直觉(多数基准用字母槽位),评测脚本需要一条额外的规范化管道(大小写/空白处理),但不构成实质性障碍。

B.5 元数据完备性 Metadata:7.5/10
子项 得分 依据
逐条溯源 1 每题带 pmc_url/title/authors,可回溯同行评议原文
领域标注 1 tag 七主题封闭枚举
题目属性 1 选项/答案结构完整,选项数实测可枚举
许可元数据 1 仓库级许可声明 + 底层图像许可策略说明
构建过程元数据 1 论文披露完整管线数字(采样/过滤/审核各步)
评测元数据 0.5 推理参数全披露,但成绩无逐题明细表发布
图像技术元数据 0.5 无分辨率/设备/拍摄条件的结构化字段(可从 JPG 头提取但未提供)
患者/人口学元数据 0 无年龄/性别/族裔字段;公平性分析不可行
标注者元数据 0.5 审核角色披露但人数未披露
数据质量标识 1 审核三分类的去向(保留/重写/删除)在论文中量化披露

说明:这是一份"文献型数据集"的典型元数据画像——溯源链极强(比多数 VQA 基准好),个体级信息极弱(无人口学、无临床诊断标签)。对"可审计性"要求高的场景(监管、复核)它表现优异;对"人群代表性"要求高的场景(公平性、流行病学推断)它几乎不提供抓手。

B.6 可持续性 Sustainability:5.5/10
子项 得分 依据
仓库可用性 1 HF 托管,机构实验室背书
版本固定 1 commit sha 锚点 + arXiv v1 双锚点
更新机制 0 无版本路线/变更日志;发布半年零更新
官方代码库 0 无评测脚本/排行榜代码仓库
第三方复现 0 下载量 45、点赞 0,未见独立复现报告
维护方响应 0.5 HF Community 区无公告核验;实验室活跃(家族持续产出)但本仓库无维护痕迹
引用持续性 0.5 OpenAIRE 引文 0,影响力待发酵
许可长期确定性 1 许可条款清晰且与上游一致,无收回风险信号
机构承诺 1 Harvard DBMI 实验室 + 论文资助方(Biswas/KHIDI)双重背书
资源备份 0.5 无 Zenodo/机构库冗余副本

说明:可持续性是最弱维,且弱因高度结构化——"论文即终态"的发布模式(数据随论文一次性放出,无配套基础设施)在评测型数据集中常见。改进杠杆也清晰:官方放出一个 50 行的评测脚本加一个静态排行榜页,即可把该维拉到 7.5 以上;家族内 ReXrank 的基础设施可直接复用。

B.7 AI-Ready 综合判词

ReXInTheWild 的 AI-Ready 形态可概括为"即用型考卷,未装配考务系统":数据本体(考卷)在可发现、可获取、可机读三个维度都接近满配;评测基础设施(考务——排行榜、脚本、复现网络)完全缺位。对立即要跑评测的团队,它是库内最轻的入口之一;对要建立持续评测体系的团队,它提供的是考题与错误分类法两份资产,考务系统需要自建。与库内 rexgradient-160k(717) 对照——后者胜在规模与生态位(家族排行榜承托),本条目胜在即用性与跨专科覆盖——两者共同补全 rajpurkarlab"真实世界医学 AI 评测"的图谱。

B.8 评分敏感性说明(分数在什么情况下会变)

DAIMS 五维分不是物理常数,以下敏感性供后续复评者校准:

情形变动 影响维度 方向 幅度估计
官方上线排行榜或评测代码库 可持续性 升 +1.5 至 +2.5(5.5 → 7-8)
出现 Zenodo/机构库冗余副本 可获取性、可持续性 升 各 +0.5
论文期刊版发表或被正式会议收录 可发现性 升 +0.5
HF 下载量破千 / 出现独立第三方复现报告 可持续性 升 +1("第三方复现"子项 0→1)
发现官方 GitHub 仓库确实存在(本代理受沙箱限制未证实) 可持续性、互操作性 升 各 +0.5 至 +1
数据集改用 CC BY-NC 4.0(放宽 ND) 可获取性 升 +0.5
库内 BIOMEDICA 条目入库 可发现性(互链) 升 +0.5
反向情形:HF 仓库失效/论文撤稿 全维 剧降 直接触发条目重写而非调分

说明:最可能的近期变动是前两行——家族有 ReXrank 基础设施先例,排行榜化的边际成本低。复评者应先核对 FACTS.md 第 6/9 节的核验时点快照,再决定是否重跑全部子项。

附录 C:复现论文评测的操作手册

按论文协议复现四模型评测的最短路径(约半天工作量):

第一步:环境与数据(约 10 分钟)

pip install datasets pillow
python -c "from datasets import load_dataset; ds = load_dataset('rajpurkarlab/ReXInTheWild'); print(ds)"
# 断言:ds['eval'].num_rows == 955
# 大陆网络不可达主站时:export HF_ENDPOINT=https://hf-mirror.com

第二步:提示词构造(约 30 分钟)

按论文协议拼装:系统指令(按患者视角解释左右、从选项中选择)+ 图像 + 打乱后的选项列表。两个必须复刻的细节:①选项顺序打乱且固定随机种子;②答案匹配按选项原文精确比较(坑 9),比较前做 strip() 规范化。

第三步:四模型推理(约 1-3 小时)

模型 接入方式 关键参数
GPT-5 官方 API temperature=1, top_p=1;固定版本字符串
Claude Opus 4.5 官方 API temperature=1, max_tokens=512;固定版本字符串
Gemini-3 官方 API temperature=1, top_p=0.95, top_k=64, thinking=True
MedGemma-4B-IT HF Transformers 本地 num_beams=1(确定性解码)

第四步:计分与报告(约 30 分钟)

全量准确率 + 95% CI(Wilson 或 bootstrap);按 tag 分组报告,Other/Surgical 两组只做点估计;与论文成绩对照时允许 ±2 个百分点内的版本漂移(模型 API 随时间更新)。若复现值偏离论文超过 5 个百分点,优先排查:①选项未打乱导致的位置偏置;②左右视角指令缺失;③answer 文本匹配未规范化。

常见翻车点速查:wc -l 数行(坑 3)、按字母判分(坑 9)、把 543 当过滤输出(坑 6)、用未经授权的第三方镜像(坑 8)。

附录 D:与库内相邻条目的 AI-Ready 横向对照

以库内同属"医学图像 + 模型评测"光谱的条目为参照(评分为本库口径,供选型者建立相对坐标):

维度 ReXInTheWild(本条目) rexgradient-160k(717) pmc-vqa(270) vqa-rad(240)
数据形态 955 MCQ + 484 照片 16 万胸片 + 报告文本 混合影像 VQA 放射影像 VQA
主用途 零样本评测 训练/评测报告生成 训练+评测 评测为主
规模量级 10² 10⁵ 10⁴⁺ 10³
专科跨度 七主题跨科 胸科单科 多科混合 放射单科
溯源能力 逐题 PMC 链接 数据集级来源说明 部分溯源 数据集级
评测基础设施 无(论文单点) ReXrank 排行榜承托 无 无
许可开放度 CC BY-NC-ND 3.0 独立声明 各自声明 各自声明

对照读法:本条目在"溯源能力 × 轻量度"两个格子是光谱上的极值点——没有任何一个相邻条目能做到"每道题一键回查同行评议原文 + 全包 53 MB"。它的不可替代性不在规模,而在这两个极值与错误分类法三件套。

附录 E:qa.csv 原题速览(每主题前 2 题,实测摘录)

下表从 qa.csv 按文件顺序取每主题前 2 题(共 14 题)原文摘录,供未下载数据的读者感受题目形态;完整 955 题请以官方 qa.csv 为准。

# 主题 问题(中文转述) 选项数 正确答案要点
1 Eyes 演示的是哪种评估眼睑松弛度的操作? 5 用尺测量的上睑垂直牵拉(松弛度)试验
2 Eyes 右侧子图中,睑缘与瞳孔中心的距离是多少? 4 19 mm
3 Head & Neck 颅骨修补术后图中观察到什么表现? 5 术区毛发再生、无缝线敷料引流物
4 Head & Neck 哪些耳廓亚结构畸形或缺如? 5 对耳轮与舟状窝
5 Mouth & Jaws 图中测量的是哪段距离? 4 最大张口距离(张口度)
6 Mouth & Jaws 该测距操作对评估哪个临床问题最直接有用? 5 张口受限(trismus)程度
7 Trunk & Extremities 图中哪个关节屈曲幅度最大? 4 膝关节(股胫关节)
8 Trunk & Extremities 哪个子图显示落地后的立即蹬伸? 4 “C (immediate push-off after landing)”——注意该选项原文自带字母前缀(文献子图标注残留)
9 Skin & Hair 左图中脱发模式最符合哪个诊断? 4 雄激素性(男性型)脱发伴双侧额颞部退缩
10 Skin & Hair 面部皮损的描述匹配(第二题,依原文件顺序) 4-5 形态学描述词匹配
11 Surgical & Procedural 疤痕最符合哪种手术入路? 5 股骨干骨折固定外侧入路
12 Surgical & Procedural 从胸部延伸向面部的皮瓣是哪种? 5 带蒂胸三角肌皮瓣(pedicled deltopectoral skin flap)
13 Other 视频问诊中哪条指令最能改善画面? 5 调整握持勿让手指挡住镜头
14 Other 图中哪个可见迹象最提示疲劳或情绪低落? 4 右手撑头、含胸坐姿

速览读法:前 8 题已经能看出"干扰项真实、测量颗粒细、拼版图指代"三大特征;13-14 题展示 Other 主题其实是"远程医疗实用指南"性质——它们是整份数据里离"患者真实使用场景"最近的题。

尾注

本条目由写手代理 agent-f-rexinthewi 撰写于 2026-09-30,全部硬数字经三源互证(arXiv 论文全文实抓 / HuggingFace 仓库 API 与文件实核 / 第三方学术索引交叉),其中数据本体统计(955 题、484 图、七主题分布、选项分布、答案完备性、例题画廊)由代理对 qa.csv 逐行解析实测。事实档案见同目录 FACTS.md;双口径冲突与遗留疑点的逐条存照见 FACTS.md 第 9 节。条目归类与互链以千方病案医数集受控词表为准;发布由主会话串行负责。

事故附记(成稿过程存档)

2026-09-30 00:14-00:21(+0800)期间,本代理按纪律包以 /tmp/rex-in-the-wild_agent-f-rexinthewi_part1-5.md 前缀直写五个 part;写至 part5 后经内容核对发现 part1-4 已被另一进程覆写(特征:keywords 出现 “Pranaj Rajpurkar” 拼写错误、“人工关” 笔误 ×7、patient_tags 无实核依据添加"儿童"、章节编排整体重构),随后发现备份前的 part5 亦被同名实例覆写(FAQ 题数与事实清单条数均与本人原稿不符;因覆写者同为 agent-f-rexinthewi 身份,签名特征鉴别失效)。处置:①弃用 /tmp 共享池,改用本目录 .parts_agent-f-rexinthewi/ 私有区;②part1-5 全量重写(内容依据本代理独立完成的 FACTS.md 与实抓原始数据 qa.csv/论文 HTML,未采用覆写版任何段落);③重拼后按章节序核对(§0-§11→FAQ→事实清单→术语表→附录 A-D→尾注);④本附记即事故第⑤步存档。建议主会话:排查同名代理 agent-f-rexinthewi 的并发实例,后续派发避免同名代理前缀。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • rexvqa — 共享标签:多模态 / 视觉问答 / 医学问答 / 评测基准
  • pathvqa — 共享标签:多模态 / 视觉问答 / 评测基准
  • derm1m — 共享标签:多模态 / 视觉问答 / 评测基准
  • medreco-db — 共享标签:多模态 / 视觉问答 / 医学问答
  • 3dreasonknee — 共享标签:多模态 / 视觉问答 / 评测基准
  • vqa-med — 共享标签:多模态 / 视觉问答
  • tdc — 共享标签:多模态 / 评测基准
  • pmc-vqa — 共享标签:多模态 / 视觉问答
  • omnimedvqa — 共享标签:视觉问答 / 评测基准
  • healthsearchqa — 共享标签:医学问答 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集