信息速览
INFOBOX — ReXInTheWild 一屏速览
维度 内容 本质 医学照片(普通相机拍摄)理解统一评测基准——不是胸片、不是报告语料、不是训练集 团队 Harvard Medical School 生物医学信息系(rajpurkarlab),一作/通讯 Oishi Banerjee,PI Pranav Rajpurkar;12 作者 7 机构 论文 arXiv:2603.19517 [cs.CV],v1 提交于 2026-03-19(11 页 4 图),DOI 10.48550/arXiv.2603.19517 数据 955 道多选题 × 484 张照片,全部选自 PMC 开放获取文献(381 篇);qa.csv(约 0.54 MB)+ 图像包(约 53 MB) 主题 七临床主题:躯干四肢 372 / 头颈 246 / 眼 148 / 口颌 116 / 皮肤毛发 37 / 外科操作 26 / 其他 10 管线 BIOMEDICA 采样 32,982 → GPT-5 两步过滤 → 543 图 → 每图 5 候选题 → 精选 1,086 → 两阶段医生审核 → 955 题 主榜 Gemini-3 78% / Claude Opus 4.5 72% / GPT-5 68% / MedGemma-4B 37%(医疗专用反而垫底) 错误学 四类错误分类法:几何 0.30 / 定位 0.33 / 特征 0.38 / 因果 0.15;99% 错误可归类 Split 仅 eval 一个评测 split——零样本评测用,不可训练 获取 HuggingFace 公开直链(gated=false), rajpurkarlab/ReXInTheWild许可 数据集 CC BY-NC-ND 3.0(底层 PMC 非商用图像混合许可取最严);论文文本 CC BY-NC-ND 4.0 库内互链 rexgradient-160k(717,同实验室 ReX 家族)、vqa-rad(240)、slake(250)、pathvqa(260)、pmc-vqa(270) 等
ReXInTheWild 是一个把"AI 看病"的考场从影像科搬到日常生活里的评测基准:它不用 X 光机、病理切片或眼底相机拍出来的标准影像,而是收集 484 张普通相机拍摄的、出现在已发表医学文献里的"野外"照片——伤口、斜视、肿胀的关节、术后疤痕——再配上 955 道由临床医生逐题审核的多选题,去问多模态大语言模型:你真的看懂了吗?基准最刺眼的发现是:通用旗舰模型得分 68%-78%,而专为医疗训练的 MedGemma 只有 37%。名字里的 ReX 是 rajpurkarlab 实验室的家族前缀(同族还有 ReXGradient-160K 与 ReXrank),但这个数据集与胸片报告毫无关系——论文在图像筛选阶段明确把 X 光片剔除出局。
导语读法三则:
- 只想下数据跑评测:直奔 §6 获取与许可——单 eval split、CSV+JPG 双文件、CC BY-NC-ND 3.0 禁商用,加载代码可直接复制。
- 关心模型评测结论:直奔 §4 主榜与分类别分析、§5 四类错误分类法——医疗专用模型为何垫底的讨论在 §4 末段。
- 做医学 VQA 选型对比:直奔 §7 生态与互链——它与 VQA-RAD/SLAKE/PMC-VQA 的边界,以及与同实验室 rexgradient-160k(717) 的分工。
§0 导读:这个数据集解决什么问题
医学视觉语言模型(Vision-Language Model, VLM)的评测考场几乎全部设在"受控环境"里:X 光、CT、病理切片、眼底照片——由专业设备采集、标准体位拍摄、经临床流程归档。但真实世界里,医疗视觉信息的第一现场往往是一部普通手机:患者把皮疹拍照发进在线问诊平台,家属把术后伤口照片贴上健康论坛,全科医生用手机记录腕关节活动度随访问诊。论文引言给出一组场景综述:远程医疗、在线健康社区、床旁伤口随访、消费级设备皮肤病与眼科筛查——普通照片早已深度参与医疗信息流通,却没有一个统一基准回答"模型能不能看懂这些照片"。
这个空白不是没人做过题,而是没人在正确的粒度上做过题。现有医学 VQA 基准(VQA-RAD、PathVQA、SLAKE)聚焦放射与病理的专科影像;综合性基准(MMMU、PMC-VQA)把少量照片混进海量其他临床图像里,无法单独考察照片这一类;皮肤科有 DermaVQA、MM-Skin 等专属数据集,其他专科的照片资源则碎片化在步态分析、龋齿检测等窄任务里。结果是"照片理解"成了一道所有模型都被考过、但从未被单独划出考场的题。
ReXInTheWild 的回答分三层。第一层是数据:484 张源自 381 篇 PMC 开放获取文献的医学照片,覆盖七个临床主题,每张配 1-2 道多选题,全部经两阶段临床医生审核。第二层是方法:一套"GPT-5 生成候选 + 自动对抗性编辑 + 专家分诊重写"的基准构建流水线,从 32,982 张候选图像压到 955 道合格题,每一道都有文献溯源(pmc_url 字段直达原文)。第三层是批判:评测揭示医疗专用模型 MedGemma 反而大幅落后于通用旗舰,且错误呈四级结构——从最基础的左右不分,到最高层的因果误判——暗示"医学照片理解"需要的不是更多医学图文对,而是自然图像与医学知识的融合。
§0 读法三则:
- 这个条目的数据集类型是"评测基准"而非"训练语料":仅 eval 单 split、无训练集,AI-Ready 的意义在于"拿起来就能测",而不在"拿起来就能练"(§2、§6)。
- 全文硬数字均经本代理对 qa.csv 逐行实核(2026-09-30):955 题、484 图、七主题分布与论文百分比逐项吻合;正文与论文表的口径冲突仅在错误多类占比一处(17% vs 0.16),已在坑 4 存照。
- 检索时若把 ReXInTheWild 当作胸片报告数据集去搜会一无所获——名字里的 ReX 只是实验室品牌前缀,与 ReXGradient-160K 的关系是"同家族不同物种"(坑 1、坑 2)。
0.1 在库内评测型条目坐标系中的位置
把本条目放进库内"评测/问答型"条目的坐标系,能更快锚定它的差异化身份:
| 库内条目(rid) | 考场 | 图像形态 | 与本条目的关系 |
|---|---|---|---|
| vqa-med(280) | 医学 VQA 任务系谱(2019 任务集) | 专科影像为主 | 系谱参照,任务定义早于"照片"意识 |
| vqa-rad(240) / slake(250) / pathvqa(260) | 放射/病理专科影像 VQA | X 光、CT、病理切片 | 本条目刻意绕开的"受控影像"考场 |
| pmc-vqa(270) / omnimedvqa(290) | 混合多域医学 VQA | 混合(含少量照片) | 本条目的差异化靶点:照片无法被单独考察的问题 |
| pmc-oa(320) / pmc-oa-subset(360) | PMC 图文生态 | 原生图文档案 | 本条目图像的终极上游生态 |
| rexgradient-160k(717) | 胸片报告生成 | 胸片 + 报告文本 | 同实验室"另一翼"(§9.2) |
这张表的读法:库内已有条目覆盖了"专科影像考试"与"混合多科考试",唯独"普通照片单科考试"是空白——ReXInTheWild 恰好补在这个空位上。它不替代任何现有条目,而是让"模型看懂患者拍的照片吗"这个问题第一次有了库内可引用的量化答案。
§1 数据集速览:十二问十二答
Q1:ReXInTheWild 到底是什么类型的数据集?
评测基准(benchmark):955 道单图多选题,用于零样本评测多模态大语言模型对医学照片的理解能力。它不是训练语料——官方只发布 eval 一个 split,没有 train/validation 划分,图像也只有 484 张。
Q2:“in the wild”(野外)指什么?
指照片拍摄于非受控环境:普通相机而非专业影像设备,非标准体位与构图,光照角度随意。不过需要澄清:这些照片全部选自已发表的 PMC 文献(患者知情同意的发表物),并非从社交网络爬取的未授权照片——"wild"形容的是拍摄场景与图像质量,不是获取渠道。
Q3:955 道题长什么样?
每道题一行 CSV 记录:一张图 + 一段问题 + 3-5 个选项(choice_a 到 choice_e,缺省留空)+ 唯一正确答案 + 七类主题标签 + 来源文献三件套(pmc_url/title/authors)。问题既有"图中 ruler 量的是什么距离"这类细粒度测量题,也有"这种术后表现提示什么"这类临床推理题。
Q4:七个临床主题分别是什么、各占多少?
Trunk & Extremities(躯干与四肢)372 题、Head & Neck(头颈)246、Eyes(眼)148、Mouth & Jaws(口颌)116、Skin & Hair(皮肤与毛发)37、Surgical & Procedural(外科与操作)26、Other 10。注意皮肤科被主动压缩——团队指示生成阶段跳过以皮肤科为主的图像,把那片领域让给 DermaVQA/MM-Skin 等专属基准。
Q5:题目是谁出的、谁审的?
GPT-5 出初稿:每张图生成 5 道候选题,再经两轮自动编辑(删提示性短语、精炼干扰项)。然后按清晰度/医学相关性/医学难度/视觉难度四维评分,每图精选 2 题,共 1,086 道进人工审核。审核两阶段:第一阶段住院医或医师逐题分诊(保留/重写/删除),第二阶段由 6 年以上经验的资深临床医生终审。最终 645 题原样保留、310 题重写、131 题删除,剩 955 题。
Q6:图像从哪来的、怎么筛的?
上游是 BIOMEDICA(CVPR 2025 发布的 PMC 开放获取全量图文档案,2400 万图文对)。团队从其"非商用许可 + Natural Images 聚类"切片随机采样 32,982 张,用 GPT-5 做两步过滤:先按图注剔除非人物/身体部位的图(风景、X 光片等),再看图像本身保留"普通非临床场景中的人物或身体部位"。合格率不足 5%,最终进入出题环节的图像 543 张。
Q7:模型成绩如何?
Gemini-3 78%(95% CI 0.75-0.81)、Claude Opus 4.5 72%(0.69-0.75)、GPT-5 68%(0.65-0.71)、MedGemma-4B-IT 37%(0.34-0.40)。最大的新闻是医疗专用模型 MedGemma 垫底——比最好的通用模型低 41 个百分点。
Q8:为什么医疗模型反而考砸了?
论文给出两层解释:规模与推理算力差距(4B 参数、无思维链 vs 旗舰级推理模型),以及更根本的假设——医学照片理解可能主要依赖对自然图像分布的广泛暴露,而非仅仅堆医学图文语料。MedGemma 在受控医学影像上训练,遇到光照随意、构图突兀的"野外"照片就遭遇域偏移(domain shift)。
Q9:错误都错在哪?
论文把 3 个顶级模型的 150 个抽样错误归成四类:测量/几何错误(左右不分、屈伸混淆)、定位错误(从耳廓解剖定位错到"没看见脚在地上")、特征描述错误(颜色形状质地判断失败)、因果错误(逻辑链断裂)。前三类各占三成以上,因果类占 15% 且多数与低层错误共现——高层错误往往"建立在"低层错误之上。
Q10:为什么它对 AI-Ready 重要?
它是"轻量可复现评测"的样板:两个文件(CSV+图像包)不到 54 MB,直链公开无门槛,字段结构自解释,每道题带文献溯源可审计——一个团队半天就能跑完一次完整评测。它的局限也很典型:单 split、无排行榜、无官方评测代码仓库,AI-Ready 光谱上属于"数据就绪、工具链欠奉"的一端。
Q11:题目出错怎么办——数据里有错误答案吗?
不排除个别瑕疵(131 题被删、310 题被重写说明构建方对质量相当较真),但每题都带 pmc_url——发现可疑题目时回查原文是最快的仲裁路径。这也正是溯源字段的设计意图:与其宣称"零错误",不如把验证成本降到一次点击。
Q12:它和"数据集"这个词的标准定义相符吗?
符合广义定义(结构化数据集合),但要按"评测基准"的子类理解:它没有按样本组织的人群/病例结构,而是按题目组织——每行是一条"考题记录"而非一条"病例记录"。做队列式分析(按患者聚合、按疾病分组)在这个数据上没有抓手,做 psychometric 式分析(题目难度、区分度)反而有完整素材。
§2 数据构成与规格
2.1 总体规模与文件形态
ReXInTheWild 的全部家当是 HuggingFace 仓库里的两个数据文件:
| 文件 | 规格 | 内容 |
|---|---|---|
data/qa.csv |
542,925 字节(约 0.54 MB) | 955 行数据 × 12 列,UTF-8 编码 |
data/images/ |
484 个 JPG,共 52,947,394 字节(约 50.5 MiB) | 与 qa.csv 的 file_name 一一对应的原始照片 |
README.md |
1,857 字节 | 数据集卡(HF frontmatter + 结构说明 + 许可声明) |
图像文件名自带溯源信息:PMC3115275_SNI-2-72-g006.jpg 这样的命名直接嵌入 PMC 文章编号(PMC3115275)、期刊卷期码与图序号,肉眼即可对回原文。HuggingFace 元数据将规模档位标记为 n<1K、模态标记为 image+text、格式标记为 csv,config 名为 default、split 名为 eval——整份数据在 HF 的 datasets 库里一个 load_dataset("rajpurkarlab/ReXInTheWild") 即可加载。
2.2 qa.csv 的 12 个字段
| 字段 | 类型 | 说明 |
|---|---|---|
| file_name | string | 图像相对路径(images/PMC*.jpg) |
| question | string | 问题文本,含情境描述与提问 |
| choice_a – choice_e | string × 5 | 选项槽位;每题实际 3-5 个选项,未用槽位留空 |
| answer | string | 正确答案的选项原文(不是字母编号) |
| tag | string | 七临床主题分类标签 |
| pmc_url | string | 来源文献的 PMC 页面链接 |
| title | string | 来源文献标题 |
| authors | string | 来源文献作者列表(缩写格式) |
三处使用细节值得注意:
- answer 是文本不是字母。955 题实测全部满足 answer ∈ {choice_a…choice_e 中非空项},但评测脚本必须按文本匹配而非固定槽位匹配——同一数据集内正确答案落在 a/b/c/d/e 各槽的频次并不均衡。
- 选项数不统一。实测分布:3 选项 4 题、4 选项 440 题、5 选项 511 题。解析时遍历五个槽位、以空串判空即可,不要假设固定四选一。
- CSV 内含引号换行。部分 title/authors 字段带逗号与换行,
wc -l会数出 960 行;用 csv 解析器按 RFC 4180 读取才是准确的 955 行(坑 3)。
2.3 七临床主题的分布与含义
qa.csv 的 tag 字段实测分布(绝对数),与论文报告的百分比逐项吻合:
| tag | 题数 | 实测占比 | 论文口径 | 典型考察点(qa.csv 例) |
|---|---|---|---|---|
| Trunk & Extremities(躯干与四肢) | 372 | 38.9% | 39% | 关节屈伸角度、步态与体位、脊柱侧弯外观、肌腱术后康复动作 |
| Head & Neck(头颈) | 246 | 25.8% | 26% | 耳廓解剖定位、头面部术后表现、颈部肿块、颅骨修补术后 |
| Eyes(眼) | 148 | 15.5% | 15% | 睑裂宽度、上睑下垂分型、瞳距测量、眼睑松弛症体征 |
| Mouth & Jaws(口颌) | 116 | 12.1% | 12% | 张口度测量、咬合关系、牙科修复体识别、颞下颌关节检查 |
| Skin & Hair(皮肤与毛发) | 37 | 3.9% | 4% | 非皮肤科主导的皮肤表现(皮肤科主体被主动排除) |
| Surgical & Procedural(外科与操作) | 26 | 2.7% | 3% | 术式辨认、切口设计原则、引流与缝合材料识别 |
| Other(其他) | 10 | 1.0% | 1% | 无法归入上述六类的散点(含远程就诊摄影质量类题目) |
分布本身是一份"设计意图说明书":四肢与头颈合计近 65%,因为这两大片区域最适合用普通照片呈现(关节活动、体态、面部体征),且文献供给充足;皮肤科主动压缩到 4%——论文明确指示生成阶段跳过皮肤主导图像,理由是"那些最好由现有数据集覆盖"(DermaVQA、MM-Skin)。使用者若想拿 ReXInTheWild 测皮肤科理解,样本量不支持这种结论。
2.4 例题画廊:七个主题各看一道真题
以下七道例题全部从 qa.csv 原文摘录(2026-09-30 实抓),每主题一道,可直观感受题目颗粒度:
| 主题 | 问题(原文节译) | 正确答案 | 考察点 |
|---|---|---|---|
| Eyes | “图中演示的是哪种评估眼睑松弛度的操作?” | “用尺测量上睑的垂直上睑牵拉(松弛度)试验” | 五个选项全部是真实存在的眼科检查操作(下睑回弹试验/提上睑肌功能/外眦牵拉试验/MRD1 测量),干扰项专业度极高 |
| Trunk & Extremities | “在子图 B 中,哪条腿承重更多?” | “右腿(支撑腿)” | 多格拼版图内的空间指代 + 体重分布判断——典型的"几何+定位"复合考题 |
| Surgical & Procedural | “这道疤痕最符合哪种手术入路?” | “股骨干骨折固定的外侧入路” | 五选项为五个真实骨科入路(髌骨旁外侧/大转子入路/Hardinge 入路等),需凭疤痕位置形态反推术式 |
| Mouth & Jaws | “图中操作最可能的目的?” | “唇纹形态的法医识别记录(cheiloscopy)” | 干扰项含敷料/斑贴试验/胶带撕脱取样等近似操作,考非常识性专业知识 |
| Head & Neck | “图中哪些耳廓亚结构畸形或缺如?” | “对耳轮和舟状窝” | 耳廓解剖的五对精细亚结构辨析——论文定位错误类型的代表性地形 |
| Skin & Hair | “哪项描述最符合该皮损的形态?” | “下垂状、分叶状软组织肿块伴冗余皮肤及低位溃疡” | 形态学描述词的精确匹配(悬垂/分叶/冗余/溃疡四要素) |
| Other | “视频问诊中,哪条即时指令最能改善画面?” | “调整握持让手指不要挡住镜头” | 唯一的"非医学知识"题——考远程就诊场景的实用摄影指导 |
画廊透露的两个信息:其一,干扰项不是胡编的错项,而是真实的邻近临床操作与描述——这是"对抗性精炼"环节的产出,也解释了为什么通用大模型会栽;其二,题目谱系从"专业解剖辨析"一路铺到"手指别挡镜头",横跨专业与生活两个语义层——这正是"野外"二字的实际含义。
2.5 图像的"文献出身"及其双重含义
484 张照片全部来自 381 篇 PMC 开放获取文献,这是理解这份数据的钥匙,也是它最容易被误读的地方。
积极面:授权干净——所有图像天然落在 PMC Open Access 非商用子集内,个别图像的原始许可为 CC-BY-NC、CC-BY-NC-SA 或 CC-BY-NC-ND,团队取其中最严格的 CC-BY-NC-ND 作为整体口径发布(§6);可审计——每张图带 pmc_url,任何一道题的医学事实都能回溯到同行评议原文,审核阶段的医生正是这么做的(“cross-referenced the original PubMed articles”)。
受限面:论文 Limitations 自述三点分布偏差——①文献图像可能带标注箭头、多格拼版(panel)或部分涂黑,与"患者自拍"的真实形态有差距;②文献选题偏长尾疾病与重症表现,常见病、轻度表现的覆盖可能不足;③照片是从第三方视角"转述"的临床影像,而真实患者生成照片(patient-generated photos)更多呈现常见主诉与轻度表现。换言之,ReXInTheWild 测的是"模型对文献级医学照片的理解",把它直接外推为"远程医疗场景下的真实患者照片理解"时要打一个折扣。
2.6 与上游 BIOMEDICA 的数据血缘
ReXInTheWild 的图像不是从 PMC 原站逐篇抓取的,而是从 BIOMEDICA(Lozano、Min Woo Sun、Burgess 等,CVPR 2025,arXiv:2501.07171)二次选取。BIOMEDICA 把 PMC Open Access 子集整体序列化为约 2,400 万图文对、600 万余篇文章、27 TB 的 WebDataset 流式档案,并按 DINOv2 特征聚类做了主题分组(其中就有"Natural Images"组)与许可标注。
ReXInTheWild 的取样口径是 BIOMEDICA 中**“非商用许可 + Natural Images 标签”**的图像:随机采样 32,982 张 → GPT-5 两步过滤 → 不足 5% 合格。这条血缘关系有三层含义:①许可链继承 BIOMEDICA 的非商用切片口径,最终由 ReXInTheWild 以最严 CC-BY-NC-ND 统一;②"Natural Images 聚类"是个噪声聚类(论文原话 noisily clusters),所以需要 GPT-5 二次过滤——32,982 张里大量是图表、X 光片等混入物;③任何对图像来源的深度审计都要同时对照 BIOMEDICA 与 PMC 两级元数据。
2.7 与专科影像 VQA 的形态对照
把 ReXInTheWild 放进医学 VQA 的坐标系,形态差异一目了然:
| 维度 | ReXInTheWild | VQA-RAD | PathVQA | SLAKE |
|---|---|---|---|---|
| 图像类型 | 普通相机照片(文献图) | 放射影像 | 病理图 | 放射+解剖标注图 |
| 图像量 | 484 | 315 | 4,977(图对) | 742 |
| 题目量 | 955(单选) | 3,515 | 32,799 | 6,420 |
| 题型 | 多选 3-5 项 | 开放+封闭 | 开放+封闭 | 开放+封闭 |
| 专科跨度 | 七大临床主题跨科 | 放射科 | 病理科 | 放射科为主 |
| 图像来源 | PMC 文献 | 公开放射数据集 | 病理教科书 | 公开放射数据集 |
| 规模定位 | 轻量评测基准 | 中型基准 | 大型训练+评测 | 中型基准 |
对照的启示:ReXInTheWild 用最小体量换最大专科跨度——它不追求"大数据",追求的是"第一个把照片单拎出来考"的建制化。对选型者的含义:训练医学 VQA 用 PathVQA/SLAKE 这类大供给,评测"野外照片"泛化用本条目,两者是互补而非竞争关系。
2.8 数据质量实测报告(本代理逐项校验,2026-09-30)
除论文口径外,本代理对 qa.csv 与 images 目录做了独立质量校验,结果如下:
| 校验项 | 方法 | 结果 | 判定 |
|---|---|---|---|
| 记录数 | Python csv.DictReader | 955 行(wc -l 物理 960 行系引号换行) | 与论文一致 |
| 图像-表格关联 | file_name 对 images 目录清单差集 | 484/484 双向命中,无孤儿记录/死链 | 优 |
| 答案完备性 | answer ∈ options® 逐行断言 | 955/955 通过 | 优 |
| 选项数枚举 | 非空 choice 槽计数 | 3/4/5 选项 = 4/440/511 题 | 与论文口径一致 |
| 主题枚举 | tag 值域检查 | 恰好 7 个枚举值,无脏值 | 优 |
| 溯源完整性 | pmc_url 非空 + 格式匹配 | 955/955 非空且均为 pmc.ncbi.nlm.nih.gov 域 | 优 |
| 溯源一致性 | pmc_url 数 vs title 数 | 381 URL / 377 标题(4 处标点级变体) | 良(不影响主口径) |
| 文件完整性 | API 字节数 vs 目录清单 | 52,947,394 字节 / 484 文件逐项对齐 | 优 |
| 隐私字段 | 姓名/ID/联系方式列扫描 | 无(authors 仅为文献署名) | 优 |
这份报告可以当作"下游使用前的验收基线":任何人在本数据上搭建评测流之前,跑一遍同款断言(附录 A 提供代码)即可确认拿到的副本与官方发布一致。对一份发布半年、无第三方复现报告的数据集,这种"可复制验收"是低成本的自保手段。
§3 构建管线:从 32,982 张到 955 道
3.1 管线全景
论文 Figure 2 把构建过程分为三个 Stage,本节按时间顺序展开为六个步骤,每步的关键数字均出自论文正文:
BIOMEDICA 非商用 Natural Images 切片
│ 随机采样 32,982 张
▼
[步骤1] GPT-5 两步图像过滤(caption 级 + 图像级)
│ 合格率 <5%
▼
[步骤2] GPT-5 逐图生成 5 道候选题(3-5 选项)
│ 跳过无医学内容/皮肤主导图像 → 543 图留存
▼
[步骤3] 两轮自动编辑(删提示性短语 + 精炼干扰项)
▼
[步骤4] GPT-5 四维评分,每图精选 2 题 → 1,086 题
▼
[步骤5] Stage 1 临床医生逐题分诊(保留/重写/删除)
▼
[步骤6] Stage 2 资深医生终审 → 645 保留 + 310 重写 − 131 删除
▼
955 题 × 484 图(正式版)
3.2 步骤 1:两步图像过滤
第一步按图注(caption)过滤:剔除图注描述对象不是人或身体部位的图像——风景、显微镜下的非组织图像、X 光片等专科影像都在此列。这一步同时完成了两件事:筛掉噪声聚类混入物,以及把"照片"与"医学影像"切开——后者是 ReXInTheWild 与整个 ReX 家族其他数据集划清边界的动作。
第二步按图像本身过滤:GPT-5 直接看图,保留"普通非临床场景中可见的人或身体部位"。两步之后合格率不足 5%——论文以此说明"Natural Images 聚类"里真正可用的野外医学照片多么稀少,也侧面论证了为什么此前没人建成这个基准:原始供给看起来很大(2400 万图文对),可用的部分近乎沙里淘金。
3.3 步骤 2:候选题生成与域避让
对每张有效照片,GPT-5 被要求生成 5 道候选题,每题 3-5 个选项,且题目应在视觉与医学两个维度都有挑战性——既不能看图注就能答,也不能靠常识蒙对。同时给定一条域避让指令:跳过缺乏医学内容的图像,以及以皮肤科为主题的图像(理由:皮肤科已有专属基准覆盖)。
本步结束时留存 543 张图。注意 543 是"出题环节留存数"而非步骤 1 的过滤输出数——后者论文正文未披露具体张数(坑 6)。543 张图 × 每图 5 题 = 2,715 道候选题的理论上限。
3.4 步骤 3:两轮自动编辑
第一轮删除泄露答案的提示性短语。论文给了具体示例:原始问题"Based on the location and length of the linear incision on the mid-thigh, which procedure is this scar most consistent with?“(基于大腿中段线性切口的位置与长度,这道疤最符合哪种术式?)被改写为"Which procedure is this scar most consistent with?”(这道疤最符合哪种术式?)——前半句的定位描述实际上把答案递到了嘴边。
第二轮精炼干扰项(distractor):提示模型使用更具迷惑性的错误选项策略,例如当图像含细微异常时提供"the image is normal"(图像正常)作为干扰项。这一步对抗的是"排除法秒杀"——若三个选项明显荒谬,第五个再难的知识点也会被蒙对。
3.5 步骤 4:四维评分精选
2,715 道候选不能全进人工审核(成本不可行),团队用 GPT-5 给每道题在四个维度打 1-5 分:清晰度(clarity)、医学相关性(medical relevance)、医学难度(medical difficulty)、视觉难度(visual difficulty),四维求和后每图取前 2 题。这一步把候选池压到 1,086 题(543 图 × 2 题)。
"每图最多 2 题"的设计还有一条隐性约束:同图两题必须考察不同知识点(审核规则允许医生提出全新题目替换,但要求与同图另一题保持区分度)。
3.6 步骤 5-6:两阶段人工审核
Stage 1:住院医师或医师逐题审核,按三分法定处置——
| 分诊集 | 含义 | 终局 |
|---|---|---|
| Q_acc | 题目-答案对可直接接受 | 保留 |
| Q_rew | 需重写以保证清晰度与临床相关性 | 医生可提出全新题目替换,仅要求与同图另一题区分 |
| Q_del | 直接删除 | 通常因图像不适合或无法支撑两道独立临床题 |
Stage 2:由一名 6 年以上经验的资深临床医生对每道题及其 Stage 1 分类做终审裁决。两阶段的审核者都被要求以清晰度与临床相关性为先,保证难度梯度,并交叉回查原始 PubMed 文献与医学文献验证有挑战性的题目。
终审结果:645 Q_acc + 310 Q_rew + 131 Q_del = 1,086。Q_rew 的 310 题经重写后保留,故最终 955 = 645 + 310,对应 484 张图(471 图各 2 题 + 13 图 1 题)。131 题连同其图像(543 − 484 = 59 张图被整体弃用或部分弃用)出局。
一个诚实的观察:审核淘汰率约 12%(131/1086),重写率约 29%(310/1086)——接近四成的题目经医生之手改动。这套"GPT-5 生成 + 专家两段审核"的分工产生的不是"AI 出题、人类盖章",而是"AI 起草、人类重写"——这也是全文把数据定性为 clinician-verified(医生核验)而非 clinician-annotated(医生原创)的原因。
3.7 与同类基准构建管线的成本结构对比
| 环节 | ReXInTheWild | 传统专家手写 VQA | 纯模型合成 VQA |
|---|---|---|---|
| 候选生成 | GPT-5(每图 5 题) | 专家逐题撰写 | 模型批量生成 |
| 难度控制 | 自动对抗编辑 + 四维评分 | 依赖专家经验 | 通常缺失 |
| 人工审核 | 两阶段、可回查文献 | 即写作即审核 | 常为抽检或不审 |
| 淘汰/重写率 | 12% / 29%(实测口径) | 低(写作即定稿) | 高或不披露 |
| 单题专家耗时 | 分钟级(分诊+重写) | 十分钟级起 | 近零 |
| 可扩展性 | 中(受审核瓶颈) | 低 | 高(无质保) |
这条管线的可迁移价值在于"把专家时间花在刀刃上":机器负责起量与初筛,专家负责分诊与终审。PANDA-PLUS 的三层标注流水线(学生标注→复核→专家终审)是同一哲学在像素标注场景的变体——两者都把"专家逐题/逐张亲做"改写为"专家只做裁决",用流程结构换取规模与质量的平衡点。
3.8 管线的残余偏差清单
流水线每一步都是过滤器,过滤器都有偏。把各步的系统性偏差汇总成清单,供使用者评估结论适用范围:
| 环节 | 残余偏差 | 方向 |
|---|---|---|
| 采样(BIOMEDICA 切片) | 只含非商用许可文献 → 开放性更强的期刊/地区被系统性排除 | 来源偏 |
| caption 过滤 | 依赖图注质量 → 图注与图不符的样本可能被误筛 | 噪声 |
| 视觉过滤(GPT-5) | "普通非临床场景"的判定边界主观 → 室内临床感照片可能被误留/误剔 | 定义偏 |
| 域避让(皮肤科跳过) | 皮肤主题仅 37 题 → 该域结论不可下 | 覆盖偏 |
| 四维评分(GPT-5) | GPT-5 的审美/难度观成为初筛标准 → 可能系统性淘汰"GPT-5 觉得容易但人类觉得难"的题 | 模型偏 |
| 审核(两阶段医生) | 审核者科室构成未披露 → 主题间审核质量可能不均 | 专业偏 |
| 溯源(文献原文) | 文献本身的重现性危机传染给基准 → 个别题目的医学事实可能随文献撤稿失效 | 时效风险 |
这份清单不是对管线的否定——相反,能在论文里凑齐这么多"账目"本身就是质控的体现——而是提醒:基于 955 题的任何跨模型结论,都携带上述偏差的联合效应。
3.9 接入现有评测框架:三种格式转换
主流多模态评测框架各有自己的数据格式,以下给出 qa.csv 到三种常见形态的最小转换逻辑(伪代码级,字段对齐关系按实测 schema 写定):
转换一:LMMS-Eval / VQA 风格(question + options + answer_key)
record = {
"question_id": f"{Path(r['file_name']).stem}__{idx}", # 图内多题需唯一 id
"image": r["file_name"], # 相对 images/ 的路径
"question": r["question"],
"options": options(r), # 非空选项按 a-e 顺序
"answer_key": options(r).index(r["answer"]), # 转为槽位索引
"category": r["tag"],
}
要点:answer_key 由原文反查槽位索引,转换后必须断言 0 <= answer_key < len(options)(坑 9 的转换期变体)。
转换二:OpenAI 风格 messages(多模态 chat 格式)
messages = [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": f"file://{image_path}"}},
{"type": "text", "text": r["question"] + "\n" + "\n".join(
f"{'ABCDE'[i]}. {opt}" for i, opt in enumerate(options(r))
)},
],
}]
# 期望输出:正确选项的完整原文;判分时用 startswith/包含匹配 + 原文兜底
要点:字母前缀是提示工程的一部分——论文协议是"选项打乱后作答",字母标注方式会影响小模型表现,复现时保持与论文一致的呈现顺序并固定打乱种子。
转换三:表格化分析格式(每模型 × 每题一行)
result_row = {
"file_name": r["file_name"], "tag": r["tag"],
"question": r["question"], "gold": r["answer"],
"pred_modelA": ..., "correct_modelA": ...,
"error_codes_modelA": "E2|E3", # 按 §5.6 编码手册填写
"pmc_url": r["pmc_url"], # 保留溯源,方便错误回查原文
}
要点:保留 pmc_url 列——错误分析阶段回查原文的效率差异巨大,这是本数据集赠给错误学的结构化红利。
§4 评测结果:四个模型的同场竞技
4.1 主榜:旗舰与专科的分野
论文对四个多模态模型做了统一协议评测(全部为单次全量 955 题,95% 置信区间按题目二项分布计算):
| 模型 | 类型 | 版本标识 | 准确率 | 95% CI |
|---|---|---|---|---|
| Gemini-3 | 通用旗舰 | Gemini-3-Pro-Preview | 78% | 0.75 – 0.81 |
| Claude Opus 4.5 | 通用旗舰 | claude-opus-4-5-20251101 | 72% | 0.69 – 0.75 |
| GPT-5 | 通用旗舰 | 2025-08-07(API 2024-12-01-preview) | 68% | 0.65 – 0.71 |
| MedGemma-4B-IT | 医疗专用 | MedGemma-4B-IT(HF Transformers) | 37% | 0.34 – 0.40 |
三个可直接读出的结论:
- 即使最强的通用旗舰也远未饱和:78% 意味着五分之一强的问题仍然答错——对一个"看图识别伤口与体态"的任务,这个错误率在真实远程医疗场景里不可忽视。
- 医疗专用标签不等于医疗照片能力:MedGemma 比 GPT-5 低 31 个百分点,比 Gemini-3 低 41 个百分点。
- 模型排名的置信区间互不重叠(Gemini 0.75-0.81 vs Claude 0.69-0.75 临界相切 vs GPT 0.65-0.71 vs MedGemma 0.34-0.40),前三名的位次虽接近但整体梯度可信。
4.2 推理配置的透明度
论文 §2.3 完整披露了各模型的推理参数,这种级别的可复现性细节在评测论文中值得原样保留:
| 模型 | 采样参数 | 关键配置 |
|---|---|---|
| GPT-5 | temperature=1, top_p=1 | 版本 “2025-08-07”,API “2024-12-01-preview” |
| Claude Opus 4.5 | temperature=1, max_tokens=512 | 版本 “claude-opus-4-5-20251101” |
| Gemini-3 | temperature=1, top_p=0.95, top_k=64, thinking=True | 版本 “Gemini-3-Pro-Preview” |
| MedGemma | 非采样(num_beams=1) | 经 HF Transformers 本地推理 |
统一协议还包括:所有模型被指示按患者视角解释"左/右"(影像学惯例的镜像逻辑,普通照片与读片相反);答案选项顺序打乱后送入;MedGemma 用束搜索而非采样,消除随机性对 4B 小模型的额外扰动。
4.3 分主题表现:稳定性中的暗礁
模型排名在七个主题内基本保持一致,但各模型都有自己的"最弱科":
| 模型 | 最弱主题 | 该主题准确率 | 95% CI |
|---|---|---|---|
| GPT-5 | Eyes(眼) | 59% | 0.51 – 0.67 |
| Claude Opus 4.5 | Eyes(眼) | 67% | 0.60 – 0.75 |
| MedGemma | Head & Neck(头颈) | 31% | 0.26 – 0.37 |
| Gemini-3 | Head & Neck(头颈) | 74% | 0.69 – 0.79 |
眼睛与头颈是共同的重灾区——这两个区域的考题高度依赖精细空间测量(睑裂宽度、瞳距、耳廓亚结构定位)与精细解剖区分(螺旋缘 vs 对耳轮褶皱),恰好是下节错误分类法里"几何错误"与"定位错误"的高发地形。GPT-5 与 Claude 的第二弱科同为 Head & Neck(67% / 71%),MedGemma 与 Gemini-3 的第二弱科信息论文未展开,但整体结论一致:越需要毫米级视觉测量的主题,模型越挣扎。
4.4 "医疗模型垫底"的正确解读
MedGemma 37% 是全文最有传播力也最容易被误读的数字(坑 7)。把它读成"医疗专用模型不如通用模型"是过度概括——正确的读法有三层:
- 规模混杂:MedGemma-4B 与三个旗舰模型不在同一参数/算力档位。论文自己承认"差异可能源于模型规模与推理时算力的不同"(differences in model size and inference-time compute)。
- 训练分布错配:MedGemma 的医疗语料以受控影像与医学文本为主,而本基准考的是自然图像分布下的临床推理——论文的核心假设恰是"医学照片理解可能主要受益于对自然图像分布的大量暴露,而非仅仅依赖策划的医学图文语料"。
- 任务形态错配:本基准的考题不是"识别病灶"而是"理解一张普通照片里的医学情境"——后者一半是自然图像理解(构图、光照、几何、身体姿态),一半才是医学知识。MedGemma 的强项区域被任务定义刻意绕开了。
对使用者的操作含义:若要评测"医疗 VLM 在远程医疗照片场景的就绪度",ReXInTheWild 是合适的探针;若要评测"医疗 VLM 在影像科工作流的表现",本基准不是正确的考场。
4.5 论文图表索引(复现与引用对照用)
| 编号 | 内容 | 正文对应 |
|---|---|---|
| Figure 1 | 医学照片的挑战示意(技术缺陷示例)+ 示例题对 | §1 引言;域偏移直观呈现 |
| Figure 2 | 构建管线三阶段(A 图像筛选 / B 问题生成 / C 自动与专家验证) | §2 Methods;本条目 §3 的骨架 |
| Figure 3 | 四模型总体与分主题成绩 | §3.1;本条目 §4.1/§4.3 数据源 |
| Figure 4 | 四类错误失败模式示例(含正常生理描述错误) | §3.2;本条目 §5.1 数据源 |
| Table 1 | 错误类型分模型占比(含 1+/2+ 类列) | §3.2;本条目 §5.2 数据源 |
§5 错误分类法:四层抽象的失败地图
5.1 四类错误的定义与实例
论文对错误做了系统分类学(taxonomy)建设:从三个顶级模型(Gemini-3、Claude Opus 4.5、GPT-5)各抽取 50 个错误,共 150 个,由一名有经验的临床医生按四类归置(允许多重归类)。四类按抽象层级从低到高:
| 层级 | 错误类型 | 定义 | 论文实例 |
|---|---|---|---|
| L1 | Measurement/Geometry Errors(测量/几何错误) | 基础几何判断失败 | 分不清身体左右侧;分不清关节处于屈曲还是伸展位 |
| L2 | Localization Errors(定位错误) | 空间定位失败,谱系从医学细粒度到自然图像大尺度 | 细粒度:混淆耳螺旋缘(helical rim)与对耳轮褶皱(antihelical fold);大尺度:没注意到人的双脚是在地面上的 |
| L3 | Characterization Errors(特征描述错误) | 对解剖特征的定性描述失败 | 颜色、形状、质地判断错误——可能源于自然图像理解差,也可能源于医学术语依赖专门描述词 |
| L4 | Causality Errors(因果错误) | 因果与意图推理失败 | 说不出某个姿势会牵涉/影响哪些肌肉;不理解操作背后的逻辑 |
5.2 定量结果:错误的地形图
150 个抽样错误的归类统计(Table 1 原文数字):
| 模型 | 几何 | 定位 | 特征 | 因果 | ≥1 类 | ≥2 类 |
|---|---|---|---|---|---|---|
| Claude Opus 4.5 | 0.28 | 0.24 | 0.38 | 0.16 | 0.98 | 0.08 |
| Gemini-3 | 0.34 | 0.36 | 0.36 | 0.18 | 1.00 | 0.22 |
| GPT-5 | 0.28 | 0.40 | 0.40 | 0.10 | 1.00 | 0.18 |
| 均值 | 0.30 | 0.33 | 0.38 | 0.15 | 0.99 | 0.16 |
四个可操作的读数:
- 覆盖率 99%:几乎所有错误都能落进四类框架——分类法有足够概括力,可直接复用为其他医学照片评测的错误编码本。
- 区分度:仅约六分之一错误跨类:正文口径为"only 17% belonged to multiple categories",Table 1 均值行为 0.16(分模型 0.08/0.22/0.18 的均值;坑 4 存照两口径差异)——四类大体捕捉的是互不重叠的失败模式。
- 特征描述(0.38)与定位(0.33)、几何(0.30)三足鼎立:低中层错误合计远超一半,说明顶级模型的瓶颈不在高深医学推理,而在把图看清楚。
- 因果错误(0.15)最少但共生性强:多数因果错误与其他类型共现——高层错误往往"建造在"低层错误的废墟上(论文原话:high-level errors tend to be “built on” lower-level mistakes)。修复几何与定位能力,可能连带治愈一部分"推理"问题。
5.3 缓解策略的四层映射
论文讨论节把四类错误逐一映射到技术缓解方案,构成一张"错误→药方"的对照表:
| 错误层 | 缓解方案 | 成本量级 |
|---|---|---|
| 几何/定位(L1-L2) | 为 MLLM 挂载细粒度关键点检测或目标检测工具 | 低(现有工具即可) |
| 特征描述(L3) | 医学术语检索与相似案例查找工具(lookup/search) | 中(需领域知识库) |
| 因果(L4) | 推理时计算(思维链)+ 先修复底层错误 | 中高(推理成本上升) |
| 全局 | 检索增强生成(RAG)或模块化工具调用框架;不在临床数据或自然图像上单独微调,必须融合 | 架构级 |
这张表是全文最具工程落地价值的部分:它把"医疗 VLM 需要改进"的空泛结论翻译成了分层的工具箱清单。
5.4 与既有医学 AI 错误编码传统的衔接
四类分类法不是凭空造轮子,它可放进医学 AI 错误学的既有谱系里理解:
| 编码传统 | 抽象轴 | 与本分类法的关系 |
|---|---|---|
| 放射科报告错误分类(假阳性/假阴性/属性级错误,如 CRIMSON 的八属性体系) | 临床内容维度 | 本分类法管"看图能力"层,报告错误学管"说出来对不对"层,互补 |
| 医学影像 VQA 错误分析(感知错误 vs 知识错误) | 感知/知识二分 | 本分类法把"感知"细分为几何/定位/特征三层,粒度更细 |
| 通用视觉推理错误学(计数/空间/属性) | 视觉技能维度 | 本分类法的 L1-L2 与之同源,L3-L4 加入医学语义 |
| 患者安全事件分层(near-miss → harm) | 临床后果维度 | 本分类法不评后果——同一几何错误在"娱乐姿势问答"与"伤口随访"里后果截然不同 |
这层衔接的含义:四类分类法填的是"视觉感知失败"的精细刻度空位,与报告生成评估(同实验室 CRIMSON)分别在"看"与"说"两端。两者拼起来,才是医疗 VLM 失败模式的完整地图。
5.5 论文自述局限的四条边界
评测结论的适用范围受限于数据构建方式(§4 Limitations 原文归纳):
- 文献图像 ≠ 患者自拍:部分图像带标注、拼版或涂黑,与典型照片有分布差。
- 长尾偏倚:文献选题偏重罕见病与重症,常见病与轻度表现可能欠采样。
- 生成器偏置:GPT-5 参与初始出题可能引入偏置——但论文指出 Gemini-3 与 Claude Opus 4.5 均优于 GPT-5,说明"出题者偏好自家答案"的效应未主导结果。
- 静态图像的能力边界:某些医学评估本就不应只凭照片进行(触诊、动态检查、高级影像),基准中的这类题目对模型是"不公平但真实"的考题——它测的正是"模型知不知道自己不该答"之外的实际表现。
5.6 错误编码操作手册:如何把四类分类法用到自己的模型上
复用这套分类法时,可直接采用以下编码规范(依据论文定义整理,含本代理补充的操作细则):
| 编码 | 名称 | 判定问题(编码时自问) | 边界情形处理 |
|---|---|---|---|
| E1 | 测量/几何 | 模型是否在左右/屈伸/角度/距离等基础几何判断上出错? | 若几何错误又引发了后续描述错误,同时记 E1 与相应高层码 |
| E2 | 定位 | 模型是否把发现放错了位置(亚结构级或"在图里找错了地方"级)? | “找不到目标”(漏检)与"放错位置"(错检)都记 E2 |
| E3 | 特征描述 | 模型对颜色/形状/质地/大小的定性描述是否与图不符? | 描述用词不规范但方向正确,不记 E3(那是术语问题不是视觉问题) |
| E4 | 因果 | 模型是否在因果链/意图/机制推理上出错? | 多数 E4 与 E1-E3 共现:全部记录,统计时区分"纯 E4"与"共现 E4" |
| E0 | 未归类 | 以上皆非 | 论文口径下 E0 仅约 1%;若自评 E0 超过 10%,应先怀疑编码理解偏差而非数据异常 |
操作建议(论文未给出、由本代理依标注规范惯例补充):①双人独立编码 + 一致性系数报告(论文单标注者是它的短板,复用者可以做得更好);②先编码再讨论(防锚定);③抽样建议按模型 × 主题分层,而非论文的纯随机每模型 50 例——分层能让小主题的错误也进入样本。
§6 获取与许可:一个文件包的门怎么进
6.1 获取路径
唯一官方获取渠道是 HuggingFace(截至核验时点无独立 GitHub 代码仓库,坑 8):
# 方式一:datasets 库(推荐)
from datasets import load_dataset
ds = load_dataset("rajpurkarlab/ReXInTheWild") # 单 eval split
row = ds["eval"][0]
row["file_name"] # 'images/PMC8855428_....jpg'
row["question"] # 问题文本
row["answer"] # 正确选项原文(非字母)
# 方式二:直链下载(CSV + 图像包)
# https://huggingface.co/datasets/rajpurkarlab/ReXInTheWild/resolve/main/data/qa.csv
# 图像逐一位于 .../resolve/main/data/images/<file_name>
仓库 gated=false,无需登录、无使用协议门槛;中国大陆网络环境下 HF 主站不可达时,hf-mirror.com 的 API/raw/resolve 端点可完整替代(网页端可能跳转主站,属镜像站行为,坑 8)。整包体积约 53 MB,加载后即可离线评测。
6.2 许可结构:一层声明、三层血缘
| 层 | 对象 | 许可 | 含义 |
|---|---|---|---|
| 1 | ReXInTheWild 数据集本体 | CC BY-NC-ND 3.0 | 署名-非商用-禁止演绎;HF README frontmatter 与正文声明一致 |
| 2 | 底层图像(经 BIOMEDICA) | PMC-OA 非商用子集,混合 CC-BY-NC / CC-BY-NC-SA / CC-BY-NC-ND | 团队取最严格口径整体发布 |
| 3 | 论文文本(arXiv) | CC BY-NC-ND 4.0 | 论文本体的许可,与数据集许可版本号不同(坑 5) |
三层里的关键约束是 **ND(禁止演绎)+ NC(非商用)**的组合:
- ND 对评测的影响有限:跑评测、改 prompt、变换选项顺序属于"使用"而非"演绎作品"——但若要发布"改写版题目"或"图像裁剪增强版"数据集,ND 条款构成直接障碍。
- NC 对商业化产品的影响是刚性的:用本基准评测商业远程医疗产品内部模型属于研究使用边缘,将数据集本身纳入商业产品或付费服务则明确越界。
- 溯源义务可一键履行:qa.csv 自带 pmc_url/title/authors,署名(BY)要求由数据结构天然满足——这是文献溯源设计的意外红利。
使用者还要注意许可版本链:图像的原始许可(个别为 CC-BY-NC-SA)在同一 ShareAlike 条款下可能反向约束衍生品,涉及再分发场景时应对 381 篇来源文献的许可逐一核验,而非只看数据集整体声明。
6.3 三种使用者画像的获取路线
| 画像 | 目标 | 推荐路线 | 关键提醒 |
|---|---|---|---|
| 评测工程师 | 两小时内跑通四模型复现 | §6.1 加载 → 附录 A 断言校验 → 附录 C 手册 | 别跳过 qa.csv 断言(955/484/answer 匹配三件套) |
| 数据集研究者 | 评估管线可迁移性 | §3 全节 → §5.6 编码手册 → §8 启示 | 注意 §3.8 残余偏差清单,别把"有账目"当成"无偏差" |
| 产品/临床决策者 | 判断医疗 VLM 能否用于照片场景 | §0 → §4.4 → §11 | 记住三个数字:78/37/53MB——能力上限、专科短板、使用成本 |
6.4 版本链与维护状态
核验时点(2026-09-30)的状态:HF 仓库单版本(commit aceeb8f,2026-03-18 发布),无历史分叉;论文 arXiv v1 唯一版;无官方排行榜、无官方评测代码库、无 issue 区公告的更新计划。HF 端下载量 45、点赞 0——发布半年,社区生态尚未形成。这既是风险(无第三方复现校验)也是机会(错误分类法、分主题分析都是可复现的论文级开放题)。
§7 生态与影响:一个实验室的产品矩阵
7.1 rajpurkarlab 的 “ReX” 家族
ReXInTheWild 的名字前缀是理解其生态位的第一把钥匙:它是 Harvard Medical School Rajpurkar 实验室(rajpurkarlab)“ReX” 产品矩阵的最新成员。核验时点可确证的家族成员:
| 成员 | 形态 | 数据/对象 | 与本条目关系 |
|---|---|---|---|
| ReXGradient-160K(库内 717) | 训练/评测语料 | 16 万张胸片 + 报告(美国三大影像体系) | 同家族不同物种:影像报告 vs 野外照片 |
| ReXrank(rexrank.ai) | 在线排行榜 | 胸片报告生成(ReXGradient 10,000 studies 测试集 + MIMIC-CXR/IU-Xray/CheXpert Plus,8 指标) | 排行榜范式,无独立新语料 |
| ReXVal | 错误标注基准 | 胸片报告的临床错误标注(放射科医生参与) | 报告质量评测组件 |
| CRIMSON | 评估指标 | 报告生成的临床锚定评分(含 RadJudge/RadPref 配套基准) | 指标层,代码开源于 GitHub |
| ReXecution | 评估框架 | 临床医生中心的医学 AI 助手评估(CXR 解读,2025-12 会议论文) | 方法论层 |
| ReXInTheWild(本条目) | 评测基准 | 955 题 × 484 张野外医学照片 | 家族中唯一离开影像科的一个 |
家族演进逻辑清晰可读:ReXrank(2024-11)建胸片报告排行榜 → ReXGradient(2025)补最大测试语料 → ReXVal/CRIMSON(2025-2026)深化错误度量 → ReXecution(2025-12)走向临床工作流评估 → ReXInTheWild(2026-03)跳出影像科,把评测半径扩到"普通相机能拍到的全部医学情境"。实验室的长期主张一致:医学 AI 的评测要贴着真实世界的使用方式走。
7.2 上游 BIOMEDICA 与同代基准
上游关系(§2.6 已述):BIOMEDICA(CVPR 2025)提供图像池,ReXInTheWild 完成从"图文档案"到"临床考题"的价值增殖——这个"大海捞针+精加工"的模式与库内 pmc-oa(320)、pmc-oa-subset(360) 条目描述的 PMC 生态直接衔接。
同代对照系(论文 Related Benchmarks 节引用的坐标系):
- 专科影像 VQA:VQA-RAD、PathVQA、SLAKE——与本基准互补,分别镇守放射与病理。
- 混合多模态基准:MMMU、PMC-VQA——混入少量照片但无法单独考察,ReXInTheWild 的差异化正在于此。
- 皮肤科专属:DermaVQA(MICCAI 2024)、MM-Skin——本基准主动避让的领域。
- 窄任务碎片集:步态分析、龋齿检测等——论文批评的"碎片化"现状,本基准自称第一个跨专科照片统一基准(“to our knowledge, the first”)。
7.3 BIOMEDICA 深读:上游为什么重要
把 BIOMEDICA 单独拎出来讲,是因为它是理解本数据集"天生上限"的钥匙:
- 规模与噪声并存:2400 万图文对听起来无限供给,但"Natural Images"聚类是 DINOv2 无监督聚类的产物(论文原话 noisily clusters),32,982 张采样里合格率不足 5%——上游的一次聚类误差被下游两步过滤消化。
- 许可预过滤的价值:BIOMEDICA 为每张图带许可标注,ReXInTheWild 直接取"非商用"切片,避免了逐篇回查 PMC 许可的巨大工程——这是"站在档案级上游肩上"的直接红利。
- 聚类标签 ≠ 主题保证:本条目的七主题 tag 是构建时重新人工(+GPT-5)标注的,不是 BIOMEDICA 聚类标签的子集——使用者不要拿 BIOMEDICA 的簇标签去预测本基准的 tag。
- 双上游审计路径:审一道题 = qa.csv 行 → 图像文件名内嵌 PMC 编号 → BIOMEDICA 元数据 → PMC 原文四级链路。任何一级断链都值得在 issue 区反馈。
7.4 引用与影响力轨迹
论文 2026-03-19 提交,核验时点(2026-09-30)被第三方索引(dblp/OpenAIRE/ADS/Scholar)稳定收录,OpenAIRE 引文计数 0、HF 下载量 45——处于"已归档、待发酵"阶段。对一个发布半年的评测基准,这属于正常冷启动;其长期影响力主要押注在两个未兑现的基础设施上:官方排行榜(家族有 ReXrank 的成熟先例可复用)与错误分类法的社区采用率。
§8 方法学启示:五条可迁移的经验
- "域避让"式数据设计。构建多域基准时主动排除已有专属基准的域(本例:皮肤科让位给 DermaVQA/MM-Skin),既避免重复劳动,又让新基准的贡献边界清晰可测。库内多域数据集(如 omnimedvqa(290) 的整合路线)可对照参考这条"做减法"的路线。
- "生成+两段审核"的人机分工模板。GPT-5 起草与对抗性编辑负责规模,医生分诊(保留/重写/删除三分法)与资深终审负责质量,文献溯源字段负责可审计——三层各司其职,29% 重写率证明"重写"通道不是摆设。任何"用 LLM 造医学题"的项目都应内置重写通道而非只做通过/不通过二元判定。
- 错误分类法是评测的二次产出。本基准的可复用资产不止 955 道题:四层错误分类法 + 150 错误的标注样本,本身就是一份可迁移的评测方法论——后来者做新基准时,可以直接借用这套错误编码本做对照分析。评测论文的长期价值往往在错误学而不在榜单。
- 把账目写进论文。从 32,982 采样到 955 定稿,每一步的流入流出数字(含"不足 5%"这种粒度的披露)都在正文留痕——这让第三方可以重构整条漏斗的效率与损耗,也让"543 不是过滤输出"这类口径问题有据可查。数据集论文的可信度,一半来自这些枯燥的中间数。
- 溯源字段是许可与人性的双重设计。pmc_url/title/authors 三列同时解决了三件事:CC BY 的署名义务、医学事实的仲裁路径、错误分析的回查入口。一份 CSV 自带的溯源结构,胜过一页许可声明。
§9 与库内条目的关系
9.1 互链图谱
| 库内条目(rid) | 关系 | 互链建议 |
|---|---|---|
| rexgradient-160k(717) | 同实验室 ReX 家族:160K=胸片影像+报告的生成式语料;本条目=野外照片 VQA 评测。两者共同构成 rajpurkarlab"真实世界医学 AI 评测"的两翼 | 双向互链,条目内互称家族成员并对比分工 |
| vqa-rad(240) | 本基准论文引用的专科影像 VQA 代表;形态对照见 §2.7 | 从本条目 §2.7 表链出 |
| slake(250) | 同上(放射+解剖标注) | 同上 |
| pathvqa(260) | 同上(病理,大型) | 同上 |
| pmc-vqa(270) | 论文批评的"混合型"基准——照片混入无法单测;本基准的差异化靶点 | 本条目 §7.2 叙述链出 |
| vqa-med(280) | 医学 VQA 任务系谱参照 | §0.1 坐标表链出 |
| omnimedvqa(290) | 多域 VQA 整合路线 vs 本条目的域避让路线 | §8 方法启示对照 |
| pmc-oa(320) / pmc-oa-subset(360) | PMC 开放获取图文生态的上游叙述(本条目图像的终极源头) | §2.5/§2.6 血缘链出 |
writing/ 目录内的 rexerr(已完成 FACTS.md)同属 ReX 家族候选,正式入库后可补链;rexgrounding-ct、rexvqa 在核验时点尚无内容,暂不互链。
9.2 与 rexgradient-160k(717) 的分工精述
两条目的互链叙述需精确到数据形态,避免读者把两者当成"同物不同版本":
- rexgradient-160k:16 万级胸片影像 + 放射报告文本,服务报告生成模型的训练与评测;数据形态是 DICOM 影像对 + 结构化报告;规模是它的价值。
- ReXInTheWild:955 道多选题,服务多模态大模型的零样本评测;数据形态是 CSV 题 + 照片包;跨专科跨度是它的价值。
- 共同点仅三层:同一实验室(rajpurkarlab)、同一品牌前缀(ReX)、同一主张(真实世界评测)。图像模态(X 光 vs 自然照片)、任务(生成 vs 选择)、规模(16 万 vs 955)、许可结构(各自独立声明)全部不同。
一句话给互链定调:160K 是"让模型学会写胸片报告"的操场,InTheWild 是"看模型能不能看懂手机照片"的考场——操场再大也替代不了考场,反之亦然。
9.3 互链落地建议(供主会话发布时参考)
- rexgradient-160k(717):在其 §7 生态节(或对应位置)增补一段"ReX 家族新成员"引述,指向本条目;本条目 §7.1/§9.2 已回链。
- vqa-rad(240)/slake(250)/pathvqa(260):在各自"相关基准"或"对比"小节补一句"普通照片形态的跨专科评测另见 rex-in-the-wild";本条目 §2.7 已列出对照表。
- pmc-vqa(270):本条目 §7.2 引用了论文对其"混合型"的批评——建议 pmc-vqa 条目侧以"局限与后续"口吻回链,形成批评-回应的成对叙述。
- pmc-oa(320)/pmc-oa-subset(360):作为图像上游生态,在其"下游应用"类目下补挂本条目。
- 暂不落地:rexerr(已有 FACTS,待其入库)、rexgrounding-ct/rexvqa(空目录)、BIOMEDICA(库内无条目,经由 pmc-oa 叙述衔接)。
§10 避坑清单:九个已踩过或必踩的坑
坑 1:把 ReXInTheWild 当胸片报告数据集
名字带 ReX、出自 rajpurkarlab、常与 ReXGradient 并列出现在检索结果——极易被二手信息转述成"胸片报告数据集"(本条目的派发 brief 即如此误记,见 FACTS.md 第 9 节存照)。实核:论文 §2.1 明确把 X 光片列为过滤剔除对象;摘要、HF 卡、字段结构均无任何胸片/报告元素。所有"胸片"预期都应清零后再读这份数据。
坑 2:ReX 家族成员混用
ReXGradient-160K(语料)、ReXrank(排行榜)、ReXVal(错误标注)、CRIMSON(指标)、ReXecution(框架)、ReXInTheWild(本基准)是六个不同层次的产物,引用时需精确到形态。最常见错误是把 ReXrank 的测试集当成独立数据集引用、或把 ReXGradient 的报告语料说成本基准的图像来源。
坑 3:用 wc -l 数 qa.csv 得 960
CSV 的 title/authors 字段含引号包裹的换行,wc -l 按物理行数得 960;RFC 4180 口径(csv 解析器)按记录数得 955——与论文、README、HF 卡三方一致。任何统计脚本必须用 csv 模块而非按行 split。
坑 4:错误多类占比的 17% vs 0.16
论文正文写"only 17% belonged to multiple categories",Table 1 均值行 2+ Types 为 0.16(分模型 0.08/0.22/0.18 的算术均值)。两口径差 1 个百分点,疑为加权 vs 算术均值的差异。引用时以 Table 1 分模型数字为准,如需总括值注明口径。
坑 5:license 版本号双口径
数据集 = CC BY-NC-ND 3.0(HF README frontmatter cc-by-nc-nd-3.0);论文文本 = CC BY-NC-ND 4.0(arXiv HTML 页头)。数据集相关的引用与再分发一律以 3.0 为准;两个版本号不得互相套用(4.0 的条款特性不适用于本数据集)。
坑 6:543 与 32,982 的口径错位
32,982 是 BIOMEDICA 采样数(步骤 1 输入);543 是出题后留存图像数(步骤 2 输出)。步骤 1 过滤后的图像张数论文未披露(仅给"不足 5%“合格率),不得把 543 记为"过滤后图像数”。管线各步数字:32,982 → (<5% 合格,张数未披露)→ 543 图出题 → 1,086 题进审 → 955 题定稿。
坑 7:把 MedGemma 37% 读成"医疗模型不行"
MedGemma-4B 与三个旗舰存在规模与推理算力的数量级差距,且其训练分布(受控影像+医学文本)与本基准的考察面(自然图像分布下的临床推理)错位。论文自身的解读是"医学照片理解可能主要需要自然图像暴露",而非医疗路线的失败。二次传播时带上下文,防止断章。
坑 8:获取渠道的非官方变体
论文与 HF 卡均未链接任何 GitHub 代码仓库——第三方镜像或个人复现仓库都不是官方渠道。大陆网络下 hf-mirror.com 网页端会跳转主站(非大陆 IP 检测),但 API/raw/resolve 端点功能完整;以 hf-mirror API 抓取的元数据与主站一致。引用数据集时一律指向 HF 官方仓库。
坑 9:answer 字段按槽位字母处理
answer 是选项原文文本而非 “A”/“B” 字母(实测 955/955 题的 answer 均精确匹配某个非空选项槽),且选项数 3-5 不等(3 选项 4 题 / 4 选项 440 题 / 5 选项 511 题)。评测脚本若假设"四选一、按字母判分"会同时踩中两个错:槽位错配与选项数越界。另有一个隐蔽变体:极少数选项的原文自带字母前缀(如实测一例选项原文为 “C (immediate push-off after landing)”——文献子图标注残留在选项文本里),简单的"取首字母"启发式在这种题上会翻车;按全文精确匹配并保留原文展示是唯一稳的口径。
§11 总结
ReXInTheWild 用最小的数据体量(955 题、484 图、53 MB)完成了一次考场建制:把"普通照片里的医学理解"从混合基准的背景噪声里单拎出来,配齐了溯源(381 篇 PMC 文献逐题可查)、质控(两阶段医生审核、29% 重写率)、透明度(推理参数全披露)与方法论(四层错误分类法)。它的主榜结果——通用旗舰 68-78%、医疗专用 37%——为"医疗 VLM 需要自然图像暴露"的论点提供了首个建制化证据;它的管线为"LLM 生成 + 专家裁决"的基准构建提供了带成本结构的模板;它的许可(CC BY-NC-ND 3.0)与单 eval split 设计则提醒使用者:这是一份评测资产而非训练资产。在 AI-Ready 光谱上,它属于"数据就绪、工具链欠奉"的一端——数据本身拿起就能用,排行榜、代码库与社区生态则留给论文之外的后来者。
FAQ(高频问答 50 问)
Q1:ReXInTheWild 里有多少道题、多少张图?
955 道多选题,484 张照片。每图配 1-2 题(471 图 × 2 题 + 13 图 × 1 题),全部题目经两阶段临床医生审核。
Q2:数据存在哪里、怎么下载?
HuggingFace rajpurkarlab/ReXInTheWild,gated=false 无需登录。核心是 data/qa.csv(约 0.54 MB)与 data/images/ 下 484 个 JPG(约 50.5 MiB)。load_dataset("rajpurkarlab/ReXInTheWild") 一步加载,或走 resolve 直链。
Q3:整包下载要多少流量?
约 53 MB。这是它"轻量评测"定位的直接体现——半张图的钱跑一次完整多模态评测。
Q4:题目是什么格式?
每题一行 CSV:一张图 + 问题 + 3-5 个选项(choice_a 至 choice_e,未用槽位留空)+ 正确答案原文 + 主题标签 + 来源文献三件套(pmc_url/title/authors),共 12 个字段。
Q5:选项一定是 5 个吗?
不是。实测 3 选项 4 题、4 选项 440 题、5 选项 511 题。解析时以空串判空槽位,不要假设固定数量。
Q6:answer 字段是字母还是文本?
选项原文文本(如 “Narrowed palpebral fissure from upper-lid edema causing mechanical ptosis”),不是 A/B/C 字母。955 题实测全部如此,评测脚本要按文本匹配。
Q7:七个主题怎么分布?
躯干四肢 372、头颈 246、眼 148、口颌 116、皮肤毛发 37、外科操作 26、其他 10。头两区合计约 65%。
Q8:为什么皮肤科只有 37 题?
主动避让:生成阶段被明确指示跳过皮肤主导图像,把该领域让给 DermaVQA、MM-Skin 等专属基准。不要用本基准下皮肤科结论。
Q9:图像是从网上爬的吗?
不是。全部选自 PubMed Central 开放获取文献(381 篇),经 BIOMEDICA 档案二次选取,每张图带 pmc_url 可回溯原文。患者已通过论文发表渠道授权。
Q10:“in the wild” 到底指什么?
拍摄场景与图像质量的"非受控"——普通相机、非标准体位、随意光照。不是指数据获取渠道的野生(未授权)状态。
Q11:图像里是真实患者吗?
是已发表文献中的临床病例照片与健康人照片(论文图示含"healthy subjects and patients with medical conditions"),无个体标识、无人口学信息。部分图像带文献特有的标注、拼版或涂黑。
Q12:有训练集吗?
没有。官方只发布 eval 一个 split,设计用途就是零样本评测。想拿它训练属于用途越界且数据量不支持。
Q13:题目是谁出的?
GPT-5 起草:每图 5 道候选题,两轮自动编辑(删提示短语、精炼干扰项),四维评分后每图精选 2 题,共 1,086 题进入人工审核。
Q14:题目是谁审的?
两阶段:第一阶段住院医或医师逐题分诊(保留/重写/删除三分法),第二阶段 6 年以上经验资深临床医生终审。结果 645 保留、310 重写、131 删除。
Q15:审核淘汰了多少?
131/1086 ≈ 12% 直接删除,310/1086 ≈ 29% 重写。近四成题目被医生动过——这是 clinician-verified(医生核验)与"AI 出题人类盖章"的本质区别。
Q16:哪些模型被评测过?成绩如何?
Gemini-3 78%、Claude Opus 4.5 72%、GPT-5 68%、MedGemma-4B-IT 37%(95% CI 见 §4.1 表)。医疗专用模型垫底是论文最核心的发现。
Q17:MedGemma 为什么只有 37%?
三层原因:模型规模与推理算力差距(4B vs 旗舰)、训练分布错配(受控影像 vs 野外照片)、任务形态错配(照片理解 vs 影像识别)。不能简化为"医疗模型不行"(坑 7)。
Q18:评测时用了什么推理配置?
论文全披露:GPT-5 temperature=1/top_p=1;Claude temperature=1/max_tokens=512;Gemini-3 temperature=1/top_p=0.95/top_k=64/thinking=True;MedGemma 非采样 num_beams=1。左右方位统一按患者视角解释,选项打乱。
Q19:模型错在哪?
四类:测量/几何(左右不分、屈伸混淆)、定位(从耳廓亚结构到"脚在地上")、特征描述(颜色形状质地)、因果(逻辑链断裂)。150 个抽样错误中几何 0.30/定位 0.33/特征 0.38/因果 0.15。
Q20:错误分类法能复用吗?
可以。99% 的抽样错误能归入四类框架,仅约六分之一跨类——分类法有覆盖度也有区分度,可直接作为其他医学照片评测的错误编码本。
Q21:license 是什么?商业项目能用吗?
CC BY-NC-ND 3.0。NC 禁止商用、ND 禁止演绎(改题/裁图再分发受限),署名义务由自带溯源字段天然满足。商业产品将其用于内部研究性评测属灰色地带,纳入产品或付费服务明确越界。
Q22:为什么是 3.0 不是 4.0?
底层 PMC 图像混合许可(CC-BY-NC/NC-SA/NC-ND)中含 3.0 版本条款,团队按最严格兼容口径统一到 3.0。论文文本本身是 CC BY-NC-ND 4.0——两个版本号各管各的对象,不要混用(坑 5)。
Q23:有官方排行榜或评测代码吗?
核验时点都没有。论文的 4 模型成绩是唯一公开基线;论文与 HF 卡均未链接 GitHub 仓库。家族先例 ReXrank 提供了排行榜的可能性,但尚未落地。
Q24:和 VQA-RAD/SLAKE/PathVQA 是竞争关系吗?
互补。它们守放射/病理的专科影像考场,本条目守"野外普通照片"考场——图像类型、专科跨度、题型、规模全不同(对照表见 §2.7)。训练用大供给基准,评测野外泛化用本条目。
Q25:和 rexgradient-160k 什么关系?
同实验室(rajpurkarlab)同前缀(ReX)的两个不同物种:717 是 16 万张胸片+报告的生成式语料,本条目是 955 题的野外照片 VQA 基准。图像模态、任务、规模、许可全部不同(§9.2)。
Q26:和 PMC-VQA 的区别?
PMC-VQA 把照片混进大量其他临床图像里无法单独考察;本条目把照片单拎出来且跨七专科统一出题——论文正是以此为差异化立足点。
Q27:图像源头 BIOMEDICA 是什么?
CVPR 2025 发布的 PMC-OA 全量图文档案(约 2400 万图文对、27 TB、WebDataset 流式),带主题聚类与许可标注。本条目从其"非商用+Natural Images"切片采样 32,982 张起步。
Q28:32,982 怎么变成 484 的?
GPT-5 两步过滤(caption 级 + 图像级)合格率不足 5% → 出题后 543 图留存 → 审核后 484 图。注意步骤 1 的输出张数论文未披露,543 不是过滤输出数(坑 6)。
Q29:qa.csv 用 Excel 打开会出问题吗?
会有隐患:title/authors 字段含逗号与内嵌换行,需 UTF-8 + RFC 4180 兼容解析;wc -l 会数出 960 行(物理行)而非 955 题(逻辑记录)。统计一律用 csv 解析器(坑 3)。
Q30:这份数据的 AI-Ready 短板是什么?
数据层几乎满血(直链、轻量、自解释字段、逐题溯源),工具链层欠奉:无官方排行榜、无评测代码库、无第三方复现校验、HF 下载量低(45,2026-09-30 抓取)。评测者需要自建评分脚本与统计口径。
Q31:可以用它做训练或微调吗?
设计上不可以(仅 eval split、许可 ND 限制演绎、数据量不支持),但"用它的题做 few-shot 示例"或"用它的错误分类法设计训练目标"属于合理的研究性使用——边界在于不要把它变成训练语料本身。
Q32:题目难度有官方分级吗?
没有官方难度字段。可用作代理的信号:GPT-5 四维评分只用于内部精选、未随数据发布;使用者可自行按主题(眼/头颈更难)、按选项数(5 选项题干扰更密)做难度分层。
Q33:一次完整评测要花多少算力/费用?
数据侧近乎零(53 MB);推理侧取决于模型:MedGemma-4B 本地可跑(单卡);三个旗舰按 955 题 × 单图输入计,API 费用在数十美元量级(含思维链的 Gemini-3 最高)。
Q34:论文的置信区间是怎么算的?
题目级二项分布的 95% 置信区间(正文方法名以 “Wil” 开头,按上下文为 Wilson 类口径;本条目按"95% CI"中性表述引用)。分主题 CI 同理但样本更小(如 Eyes 148 题),区间相应更宽。
Q35:能自己往里加题吗?
技术上可以(schema 简单),许可上受 ND 限制(衍生数据集不能以原许可再分发)。合规路线:自建扩充题集,发布时标注"评测协议参照 ReXInTheWild"而不混用原始题目。
Q36:七主题题量悬殊(372 vs 10),统计上要注意什么?
分主题报告时 Other(10 题)与 Surgical & Procedural(26 题)的 CI 极宽,"某模型在 Other 上更强"之类结论没有统计意义。建议合并报告或只做点估计。
Q37:图像有没有患者隐私风险?
图像全部来自 PMC 已发表文献(出版流程已含知情同意与去标识审查),数据集不含姓名/ID 等新标识。使用者仍应履行 BY 署名义务——这是许可要求也是学术伦理要求。
Q38:和 omnimedvqa(290) 的"大杂烩"路线比,哪个更值得接进评测流?
看目的:要"广覆盖回归测试"用 omnimedvqa(域多、量大);要"照片场景专项体检"用本条目(域窄、颗粒细、有错误学框架)。两者在评测矩阵里正交,不是二选一。
Q39:论文为什么特意声明"跳过皮肤科"?
防止照抄式重复建设——皮肤照片 VQA 已有 DermaVQA/MM-Skin 两个成熟基准。这条声明同时也是对使用者的警告:Skin & Hair 37 题只是"非皮肤主导"的残留,不是皮肤科评测集。
Q40:MedGemma 为什么选 4B 版本?
论文未解释。合理推测:4B 是当时可单卡复现的尺寸,且论文卖点是"专用小模型 vs 通用旗舰"的现实差距。复现者若要控制规模变量,应自行补测同家族更大参数版本——这是论文留下的开放题。
Q41:数据里有没有重复题?
实测 955 题的 file_name+question 组合唯一;同图两题被审核规则强制区分知识点。但"考点相似的不同题"(如两张图都考 MRD 测量)天然存在——这是"同一临床技能多题采样"的设计特征,不是缺陷。
Q42:能拿它的错误分类法标注自己模型的错误吗?
可以,这正是它作为"二次产出"的价值。要点:分类定义见 §5.1;允许多重归类;建议两名标注者独立标注后算一致性(论文只用单标注者,这是它自己可改进的点)。
Q43:HF 下载量为什么这么低?
发布半年 + 无排行榜导流 + 评测论文常见"论文即用"模式(作者自评后社区跟进滞后)。低下载量不构成对数据质量的否证,但意味着"论文成绩之外没有第二来源可交叉验证"。
Q44:这份数据会被更新吗?
核验时点无官方更新信号。按家族惯例(ReXrank 持续运营),排行榜化是最可能的方向;但截至 2026-09-30,一切"将要更新"的说法都是推测。
Q45:如果只记住一件事?
ReXInTheWild 证明了"模型在标准化影像上的能力不能自动外推到患者随手拍的照片"——通用旗舰 68-78%,医疗专用 37%。给模型做体检时,别忘了这份 955 题的野外考卷;记住四个锚点:955 题/484 图、CC BY-NC-ND 3.0、eval 单 split、医疗专用垫底。
Q46:直接拿论文成绩当自己模型的对标线合理吗?
方向合理,数字要打折使用:论文成绩是特定版本字符串 + 特定提示协议下的单次结果,模型 API 迭代后会有漂移。对标时复刻协议(附录 C)比复刻数字重要。
Q47:这个基准测得出"模型会不会给危险医疗建议"吗?
测不出。它测的是照片理解与临床推理的准确率,不是安全性;错误分类法里也没有"危险建议"这一类。安全评估要用专门的 red-teaming 基准,两者不能互相替代。
Q48:九百多题对统计功效够吗?
对全量比较够(955 题下 5 个百分点的差异 CI 不重叠);对分主题比较勉强(148 题的眼部差异要 >10 个百分点才可信);对 Other/Surgical 两主题不够(10/26 题)。用前先算自己关心层级的功效。
Q49:五十三 MB 里最值钱的是什么?
按复用价值排序:①pmc_url 溯源列(审计基础设施);②四类错误分类法(方法论资产,虽不在数据文件里);③955 道医生核验过的题目本体;④图像本体(多数可从 PMC 公开渠道再获得)。这个排序解释了为什么 ND 许可对本数据集的伤害相对有限。
Q50:千方库为什么值得收录一个"只有 955 题"的小数据集?
因为 AI-Ready 不等于 AI-大。这个条目的价值在类型稀缺性(库内唯一的普通照片 VLM 基准)、方法论完整性(管线账目 + 错误学 + 复现手册)与家族坐标(补全 rajpurkarlab 图谱、锚定 rexgradient-160k 的另一翼)——三者都不随题目数量缩水。
事实清单(硬事实 46 条)
- 数据集全称 ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding;slug rex-in-the-wild。
- 发布方 rajpurkarlab(Harvard Medical School 生物医学信息系);HF 仓库
rajpurkarlab/ReXInTheWild。 - 论文 arXiv:2603.19517 [cs.CV](跨列 cs.LG),v1 提交 2026-03-19 22:54:28 UTC,11 页 4 图。
- 论文 DOI 10.48550/arXiv.2603.19517;作者 12 人;一作 Oishi Banerjee(通讯邮箱 oishi_banerjee@g.harvard.edu)。
- HF 仓库 lastModified 2026-03-18T07:57:05Z,commit sha aceeb8ff56ee5b0d9bb7b48a0c947895d0119b19。
- 规模:955 道多选题 × 484 张照片;381 篇独立 PMC 来源文献。
- 每图题数:471 图 × 2 题 + 13 图 × 1 题。
- qa.csv 542,925 字节、12 字段;images 共 52,947,394 字节(484 个 JPG)。
- 选项数分布:3 选项 4 题 / 4 选项 440 题 / 5 选项 511 题;answer 全部为选项原文且必在选项集合内(955/955 实测)。
- 七主题实测分布:Trunk & Extremities 372 / Head & Neck 246 / Eyes 148 / Mouth & Jaws 116 / Skin & Hair 37 / Surgical & Procedural 26 / Other 10;与论文百分比 39/26/15/12/4/3/1 逐项吻合。
- HF 元数据:size_categories n<1K;task_categories visual-question-answering + question-answering;format csv;config default 单 eval split;gated=false。
- 图像上游:BIOMEDICA(CVPR 2025,arXiv:2501.07171,约 2400 万图文对)"非商用 + Natural Images"切片随机采样 32,982 张。
- 图像过滤:GPT-5 两步(caption 级 + 图像级),合格率不足 5%;步骤 1 输出张数论文未披露。
- 出题:GPT-5 每图 5 候选题(3-5 选项);跳过无医学内容与皮肤主导图像;543 图留存。
- 自动编辑两轮:删提示性短语(论文含大腿切口示例);精炼干扰项(含"图像正常"策略)。
- 精选:GPT-5 四维评分(clarity/medical relevance/medical difficulty/visual difficulty,各 1-5 求和),每图取前 2 题,1,086 题进审。
- 人工审核两阶段:Stage 1 住院医/医师三分法(Q_acc/Q_rew/Q_del);Stage 2 一名 6+ 年经验资深临床医生终审。
- 审核结果:645 保留 + 310 重写 + 131 删除 = 1,086;终版 955 题(955 = 645 + 310)。
- 评测模型与成绩:Gemini-3 78%(CI 0.75-0.81)/ Claude Opus 4.5 72%(0.69-0.75)/ GPT-5 68%(0.65-0.71)/ MedGemma-4B-IT 37%(0.34-0.40)。
- 推理配置:GPT-5 temp=1/top_p=1(版本 “2025-08-07”);Claude temp=1/max_tokens=512(claude-opus-4-5-20251101);Gemini-3 temp=1/top_p=0.95/top_k=64/thinking=True(Gemini-3-Pro-Preview);MedGemma num_beams=1 非采样。
- 统一协议:左右按患者视角解释;选项打乱;GPT-5 API 版本 “2024-12-01-preview”。
- 分主题最弱项:GPT-5 与 Claude 弱在 Eyes(59%/67%);MedGemma 与 Gemini-3 弱在 Head & Neck(31%/74%)。
- 错误研究:3 模型 × 50 错 = 150 个,一名有经验临床医生归类;四类均值几何 0.30/定位 0.33/特征 0.38/因果 0.15。
- 错误覆盖:99% 落入至少一类;多类占比正文口径 17%、Table 1 均值口径 0.16(分模型 0.08/0.22/0.18)。
- 许可:数据集 CC BY-NC-ND 3.0(HF frontmatter
cc-by-nc-nd-3.0);论文文本 CC BY-NC-ND 4.0;底层图像为 PMC-OA 非商用子集混合许可取最严。 - 获取:HF 公开直链 gated=false,无登录门槛;核验时点无官方 GitHub 代码仓库、无官方排行榜。
- HF 社区指标(2026-09-30 抓取):downloads 45,likes 0。
- 资助:O.B. — Biswas Family Foundation Transformative Computational Biology Grant(与 Milken Institute 合作);S.E.K. — 韩国 KHIDI(保健福祉部)Grant # RS-2024-00403047。
- 机构 7 个:Harvard DBMI(5 人)、Seoul National University Hospital 研究所、MGH 消化科、Heidelberg 大学医院神经放射、King Abdulaziz Medical City(3 人)、University of Cincinnati 肺科(详见 FACTS 第 3 节双挂靠说明)。
- 论文关键词:Patient-Generated Health Data、Domain Shift、Diagnostic Reasoning、Multimodal Large Language Models、Vision-Language Models。
- 自述局限四条:文献图像带标注/拼版/涂黑;长尾与重症偏倚;GPT-5 出题偏置(受 Gemini/Claude 更优所缓解);静态图像能力边界。
- 家族成员:ReXGradient-160K(库内 717)、ReXrank(rexrank.ai)、ReXVal、CRIMSON(GitHub 开源)、ReXecution——本条目为家族中唯一非影像科数据集。
- 论文引用的对照基准:VQA-RAD、PathVQA、SLAKE、MMMU、PMC-VQA、DermaVQA、MM-Skin 及步态/龋齿等窄任务集。
- 论文自我定位:“to our knowledge, the first benchmark to evaluate vision–language models across multiple clinical specialties using ordinary photographs”。
- 图像文件名内嵌 PMC 编号与图序(如 PMC3115275_SNI-2-72-g006.jpg),肉眼可对回原文。
- qa.csv 独立标题 377 个(对应 381 个 pmc_url,4 处标点级变体)——标题数不作为正文口径。
- 审核者被要求交叉回查原始 PubMed 文献验证有挑战性的题目(论文原文 cross-referenced)。
- 论文给出两轮自动编辑的具体示例(大腿切口题删定位描述)与干扰项策略("图像正常"选项)。
- 缓解策略分层:几何/定位→关键点/目标检测工具;特征描述→术语检索;因果→思维链;全局→RAG/工具调用,融合训练主张。
- 同图两题须考察不同知识点:审核规则允许医生提出全新题目替换,但要求与同图另一题区分。
- hf-mirror.com 网页端对非大陆 IP 跳转主站,但 API/raw/resolve 端点完整可用(本条目全部 HF 数据经此实抓)。
- 本条目成稿期间遭遇 /tmp part 池并发覆写事故(同名代理实例覆写 part1-5),已按五步处置迁移私有区并全量重写——见文末事故附记。
- 覆写事故鉴别的覆写版指纹:keywords 含 “Pranaj Rajpurkar” 拼写错误、“人工关” 笔误 ×7、patient_tags 无据含"儿童"——这些特征串可作为 /tmp 池中覆写残留文件的快速鉴别器。
- 实测每主题第 2 题样本:Trunk 题答案 “C (immediate push-off after landing)” 证明个别选项原文自带字母前缀(文献子图标注残留),坑 9 的隐蔽变体。
- qa.csv 的 question 中存在跨子图指代题(如 “In subfigure B…” / “Compared with subfigure a…”)——多格拼版图上的空间指代是该基准的固有难度构成。
- 本条目全部 HF 元数据与文件均于 2026-09-30 经 hf-mirror API 抓取,抓取脚本为一次性只读操作,未向 HF 写入任何数据。
术语表(40 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| 野外照片 | in the wild photograph | 普通相机在非受控环境拍摄的照片,光照/角度/构图非标准化 |
| 医学照片 | medical photograph | 含医学相关内容的普通照片(区别于 X 光/CT/病理等专用影像) |
| 患者生成健康数据 | patient-generated health data, PGHD | 由患者而非临床流程产生的健康信息,手机照片是主要形态之一 |
| 视觉语言模型 | vision-language model, VLM | 同时处理图像与文本的多模态模型 |
| 多模态大语言模型 | multimodal large language model, MLLM | 在大语言模型基础上扩展视觉输入的多模态模型,本文与 VLM 互换使用 |
| 视觉问答 | visual question answering, VQA | 给定图像与问题、输出答案的任务范式 |
| 多选题 | multiple-choice question, MCQ | 提供 3-5 个选项、要求选出唯一正确项的题目形态 |
| 域偏移 | domain shift | 训练分布与测试分布不一致导致的性能退化;本基准考医疗模型从影像到照片的域偏移 |
| 干扰项 | distractor | 多选题中除正确答案外的迷惑选项;对抗性精炼指让其更难排除 |
| 提示性短语 | leading phrase | 题干中泄露答案线索的描述(论文示例:题干含切口位置与长度描述) |
| 分诊三分法 | Q_acc / Q_rew / Q_del | 审核阶段对题目的三种处置:原样保留 / 重写 / 删除 |
| 临床医生核验 | clinician-verified | 题目由模型起草、医生逐题核验修正(区别于 clinician-annotated 医生原创) |
| 错误分类法 | error taxonomy | 将模型错误按抽象层级归类的编码体系;本基准提出四类框架 |
| 测量/几何错误 | measurement/geometry error | 左右侧不分、屈伸关节混淆等基础几何判断失败 |
| 定位错误 | localization error | 空间定位失败,谱系覆盖耳廓亚结构到"脚在地上" |
| 特征描述错误 | characterization error | 对颜色/形状/质地的定性描述失败 |
| 因果错误 | causality error | 因果与意图推理失败;多与低层错误共现 |
| 思维链 | chain-of-thought, CoT | 推理时让模型先产出中间推理步骤;论文列为因果错误的缓解手段 |
| 检索增强生成 | retrieval-augmented generation, RAG | 生成前先检索外部知识;论文列为全局缓解方向 |
| 零样本评测 | zero-shot evaluation | 不经任何本基准训练数据微调,直接测试;本基准仅支持此用法 |
| 单评测集 | eval-only split | 只发布评测划分、无训练/验证划分的数据组织方式 |
| PMC 开放获取子集 | PubMed Central Open Access subset | PMC 中以开放许可发布的文献集合,本基准全部图像的最终来源 |
| WebDataset | WebDataset | 以 tar 分片流式读取的大规模数据集格式;BIOMEDICA 的序列化形态 |
| CC BY-NC-ND | CC BY-NC-ND | 署名-非商用-禁止演绎许可组合;本数据集整体许可(3.0 版) |
| 拼版 | panel | 学术文献图中多子图合并排版的形态;论文局限性提及的图像差异来源之一 |
| 排行榜 | leaderboard | 持续收集模型成绩的在线评测设施;家族内 ReXrank 为先例,本基准暂无 |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability | 本库数据集 AI-Ready 五维评估框架(附录 B) |
| 睑裂宽度 | palpebral fissure width | 眼科测量指标,qa.csv 眼部题目的典型考察对象 |
| MRD | marginal reflex distance | 眼睑位置测量(角膜光反射至上睑缘距离),眼部细粒度测量题实例 |
| 螺旋缘 | helical rim | 耳廓外缘解剖结构;定位错误实例中与对耳轮褶皱混淆的对象 |
| 对耳轮褶皱 | antihelical fold | 耳廓对耳轮的折返结构;同上 |
| 唇纹形态学 | cheiloscopy | 以唇纹形态做个体识别的法医学分支;qa.csv 口颌题实例 |
| 束搜索 | beam search | 保留多条候选序列的确定性解码方式;MedGemma 评测采用(num_beams=1) |
| Wilson 区间 | Wilson interval | 二项比例的置信区间算法;论文正文方法名以 “Wil” 开头,按中性口径引用 |
| 确定性解码 | greedy/deterministic decoding | 固定输出消除采样随机性;小模型评测常用 |
| 过滤漏斗 | filtering funnel | 采样→过滤→出题→精选→审核的逐级收敛结构;本管线 32,982→955 |
| 域避让 | domain avoidance | 建基准时刻意排除已有专属基准的领域;本例为皮肤科 |
| 溯源字段 | provenance fields | qa.csv 的 pmc_url/title/authors 三列,支撑逐题审计 |
| 训练-评测边界 | train/eval boundary | 本数据集"只能评不能练"的使用限制(单 eval split + ND 许可) |
| 版本锚点 | version anchor | HF commit sha(aceeb8f)与 arXiv v1(2026-03-19)构成的双固定引用点 |
附录
附录 A:数据字典与加载规范
qa.csv 完整数据字典(12 列,实测口径):
| # | 列名 | 非空数 | 约束与说明 |
|---|---|---|---|
| 1 | file_name | 955 | 形如 images/PMC<编号>_<文件标识>.jpg;484 个唯一值;与 images 目录一一对应 |
| 2 | question | 955 | 自然语言问题;部分含情境限定语(如 “Compared with subfigure a…”) |
| 3 | choice_a | 955 | 选项槽 a,恒非空 |
| 4 | choice_b | 955 | 选项槽 b,恒非空 |
| 5 | choice_c | 951 | 3 选项题留空(4 题) |
| 6 | choice_d | 515 | 5 选项题才非空 |
| 7 | choice_e | 511 | 仅 5 选项题非空 |
| 8 | answer | 955 | 选项原文;955/955 可在 choice_a-e 中精确匹配 |
| 9 | tag | 955 | 七枚举值之一(见 §2.3 表) |
| 10 | pmc_url | 955 | 形如 https://pmc.ncbi.nlm.nih.gov/articles/PMC<编号>/;381 个唯一值 |
| 11 | title | 955 | 来源文献标题;377 个去重值(4 处标点级变体) |
| 12 | authors | 955 | 缩写格式作者串 |
稳健加载片段(Python,处理内嵌换行与空槽位):
import csv
from collections import Counter
with open("qa.csv", newline="", encoding="utf-8") as f:
rows = list(csv.DictReader(f))
assert len(rows) == 955 # 逻辑记录数,非 wc -l 的 960
assert len({r["file_name"] for r in rows}) == 484
def options(r):
return [r[k] for k in ("choice_a","choice_b","choice_c","choice_d","choice_e") if r[k].strip()]
for r in rows:
assert r["answer"] in options(r) # 答案必在选项内(文本匹配,非字母)
print(Counter(r["tag"] for r in rows)) # 应得 §2.3 七主题分布
评测计分建议:按 tag 分组报告准确率与 95% 置信区间(与论文口径可比);选项顺序打乱前固定随机种子以保复现;MedGemma 类小模型建议非采样解码以消除方差。
附录 B:DAIMS 评估全表
评分框架:DAIMS 五维(可发现性 Discoverability / 可获取性 Accessibility / 互操作性 Interoperability / 元数据完备性 Metadata / 可持续性 Sustainability),每维 0-10 分,子项 0/0.5/1 三档。评分为本库编辑部口径(2026-09-30,基于对 HF 仓库、论文与 qa.csv 的逐项实核),反映"AI 系统与研究者拿起来就能用的程度"。
B.1 总览
| 维度 | 得分 | 一句话依据 |
|---|---|---|
| 可发现性 Discoverability | 8.5/10 | arXiv+HF+六大索引齐备,但名称易与 ReX 家族混淆、无排行榜聚合入口 |
| 可获取性 Accessibility | 9/10 | 直链公开、gated=false、53 MB 轻量;扣分在 NC-ND 许可与大陆网络可达性 |
| 互操作性 Interoperability | 8/10 | CSV+JPG 最小形态、12 字段自解释;answer 文本匹配与内嵌换行需防呆 |
| 元数据完备性 Metadata | 7.5/10 | 逐题文献溯源是亮点;患者/人口学/图像技术元数据完全缺失 |
| 可持续性 Sustainability | 5.5/10 | 单版本无更新机制、无代码库、无排行榜、社区指标冷清 |
| 加权总评 | 7.7/10 | 数据即用型评测资产;短板集中在生态与维护层 |
B.2 可发现性 Discoverability:8.5/10
| 子项 | 得分 | 依据 |
|---|---|---|
| 正式出版物配套 | 1 | arXiv:2603.19517,DOI 注册,论文-数据互链 |
| 跨库索引覆盖 | 1 | dblp/OpenAIRE/ADS/Google Scholar/BIP!/CatalyzeX 全部收录 |
| 官方仓库唯一性 | 1 | HF 单一官方仓库,无镜像混淆(第三方镜像非官方) |
| 检索关键词覆盖 | 0.5 | 标题词明确;但 “ReX” 前缀与家族成员高度易混,二手转述常见类型误标(坑 1) |
| 社区聚合入口 | 0.5 | 无排行榜/论文代码榜收录 |
| 命名可读性 | 0.5 | “ReXInTheWild” 含驼峰与缩写,跨语言检索易失配 |
| 描述质量 | 1 | HF 卡含概览/结构/许可三节;论文摘要自包含 |
| 引用就绪度 | 1 | 论文给出 HF 链接,数据引用路径清晰 |
| 术语标准化 | 1 | tag 枚举、字段名直白 |
| 版本可追溯 | 1 | arXiv v1 与 HF commit 双锚点 |
说明:本维度的唯一实质风险是"名字撞车"——ReXInTheWild/ReXGradient/ReXrank/ReXVal 在检索中互相稀释,且二手信息(包括本条目的派发 brief)常把本基准误标为胸片数据集。库内条目的价值之一即是把正确的类型边界(照片 VQA vs 胸片报告)固定下来。
B.3 可获取性 Accessibility:9/10
| 子项 | 得分 | 依据 |
|---|---|---|
| 无门槛下载 | 1 | gated=false,无登录/无协议墙 |
| 总量轻量 | 1 | 53 MB,普通带宽分钟级 |
| 结构简单 | 1 | 两类文件(CSV+JPG),无嵌套归档 |
| 载入即用 | 1 | load_dataset 单行加载 |
| 镜像可达性 | 0.5 | hf-mirror API/raw/resolve 可用,网页端会跳主站 |
| 许可开放度 | 0.5 | CC BY-NC-ND 3.0:研究自由、商用禁止、演绎受限 |
| 图像许可透明 | 1 | 混合许可策略公开声明(取最严口径) |
| 溯源自足 | 1 | pmc_url 内嵌,署名义务自动履行 |
| API 稳定性 | 1 | resolve 端点带版本锚点(commit sha) |
| 备用渠道 | 0.5 | 无 Zenodo/机构库副本;HF 单点 |
说明:可获取性是本数据集最强的维度——"无门槛 + 轻量 + 自解释"三连使其成为少见的"5 分钟冷启动"评测资产。两个 0.5 的扣分项均非数据方过错:NC-ND 是继承图像许可链的被动选择;网络可达性是部署环境问题。
B.4 互操作性 Interoperability:8/10
| 子项 | 得分 | 依据 |
|---|---|---|
| 格式通用性 | 1 | CSV(RFC 4180)+ JPG,零专用格式 |
| 字段自解释 | 1 | 12 字段名即文档 |
| 编码规范 | 1 | UTF-8;引号转义合规 |
| 答案机读性 | 0.5 | answer 为文本非字母,需文本匹配;无标准化选项编号列 |
| 内嵌换行防呆 | 0.5 | title/authors 含引号内换行,朴素按行解析会错位(坑 3) |
| 图像-表格关联 | 1 | file_name 精确关联,无孤儿记录(实测 484/484 命中) |
| 类别枚举稳定 | 1 | tag 七值封闭集合 |
| 多框架兼容 | 1 | datasets/pandas/polars/mlcroissant 官方标签齐备 |
| 评测脚本参考 | 0.5 | 论文披露推理参数但无官方评测代码 |
| 与同类基准对齐 | 0.5 | 单选题型与 VQA-RAD 等的开放题不直接互通;tag 与专科体系无官方映射 |
说明:CSV+JPG 是互操作性的"最大公约数"选择,配套 mlcroissant 标签说明团队考虑过机器可读元数据标准。answer 文本匹配这一设计在评测工程上略反直觉(多数基准用字母槽位),评测脚本需要一条额外的规范化管道(大小写/空白处理),但不构成实质性障碍。
B.5 元数据完备性 Metadata:7.5/10
| 子项 | 得分 | 依据 |
|---|---|---|
| 逐条溯源 | 1 | 每题带 pmc_url/title/authors,可回溯同行评议原文 |
| 领域标注 | 1 | tag 七主题封闭枚举 |
| 题目属性 | 1 | 选项/答案结构完整,选项数实测可枚举 |
| 许可元数据 | 1 | 仓库级许可声明 + 底层图像许可策略说明 |
| 构建过程元数据 | 1 | 论文披露完整管线数字(采样/过滤/审核各步) |
| 评测元数据 | 0.5 | 推理参数全披露,但成绩无逐题明细表发布 |
| 图像技术元数据 | 0.5 | 无分辨率/设备/拍摄条件的结构化字段(可从 JPG 头提取但未提供) |
| 患者/人口学元数据 | 0 | 无年龄/性别/族裔字段;公平性分析不可行 |
| 标注者元数据 | 0.5 | 审核角色披露但人数未披露 |
| 数据质量标识 | 1 | 审核三分类的去向(保留/重写/删除)在论文中量化披露 |
说明:这是一份"文献型数据集"的典型元数据画像——溯源链极强(比多数 VQA 基准好),个体级信息极弱(无人口学、无临床诊断标签)。对"可审计性"要求高的场景(监管、复核)它表现优异;对"人群代表性"要求高的场景(公平性、流行病学推断)它几乎不提供抓手。
B.6 可持续性 Sustainability:5.5/10
| 子项 | 得分 | 依据 |
|---|---|---|
| 仓库可用性 | 1 | HF 托管,机构实验室背书 |
| 版本固定 | 1 | commit sha 锚点 + arXiv v1 双锚点 |
| 更新机制 | 0 | 无版本路线/变更日志;发布半年零更新 |
| 官方代码库 | 0 | 无评测脚本/排行榜代码仓库 |
| 第三方复现 | 0 | 下载量 45、点赞 0,未见独立复现报告 |
| 维护方响应 | 0.5 | HF Community 区无公告核验;实验室活跃(家族持续产出)但本仓库无维护痕迹 |
| 引用持续性 | 0.5 | OpenAIRE 引文 0,影响力待发酵 |
| 许可长期确定性 | 1 | 许可条款清晰且与上游一致,无收回风险信号 |
| 机构承诺 | 1 | Harvard DBMI 实验室 + 论文资助方(Biswas/KHIDI)双重背书 |
| 资源备份 | 0.5 | 无 Zenodo/机构库冗余副本 |
说明:可持续性是最弱维,且弱因高度结构化——"论文即终态"的发布模式(数据随论文一次性放出,无配套基础设施)在评测型数据集中常见。改进杠杆也清晰:官方放出一个 50 行的评测脚本加一个静态排行榜页,即可把该维拉到 7.5 以上;家族内 ReXrank 的基础设施可直接复用。
B.7 AI-Ready 综合判词
ReXInTheWild 的 AI-Ready 形态可概括为"即用型考卷,未装配考务系统":数据本体(考卷)在可发现、可获取、可机读三个维度都接近满配;评测基础设施(考务——排行榜、脚本、复现网络)完全缺位。对立即要跑评测的团队,它是库内最轻的入口之一;对要建立持续评测体系的团队,它提供的是考题与错误分类法两份资产,考务系统需要自建。与库内 rexgradient-160k(717) 对照——后者胜在规模与生态位(家族排行榜承托),本条目胜在即用性与跨专科覆盖——两者共同补全 rajpurkarlab"真实世界医学 AI 评测"的图谱。
B.8 评分敏感性说明(分数在什么情况下会变)
DAIMS 五维分不是物理常数,以下敏感性供后续复评者校准:
| 情形变动 | 影响维度 | 方向 | 幅度估计 |
|---|---|---|---|
| 官方上线排行榜或评测代码库 | 可持续性 | 升 | +1.5 至 +2.5(5.5 → 7-8) |
| 出现 Zenodo/机构库冗余副本 | 可获取性、可持续性 | 升 | 各 +0.5 |
| 论文期刊版发表或被正式会议收录 | 可发现性 | 升 | +0.5 |
| HF 下载量破千 / 出现独立第三方复现报告 | 可持续性 | 升 | +1("第三方复现"子项 0→1) |
| 发现官方 GitHub 仓库确实存在(本代理受沙箱限制未证实) | 可持续性、互操作性 | 升 | 各 +0.5 至 +1 |
| 数据集改用 CC BY-NC 4.0(放宽 ND) | 可获取性 | 升 | +0.5 |
| 库内 BIOMEDICA 条目入库 | 可发现性(互链) | 升 | +0.5 |
| 反向情形:HF 仓库失效/论文撤稿 | 全维 | 剧降 | 直接触发条目重写而非调分 |
说明:最可能的近期变动是前两行——家族有 ReXrank 基础设施先例,排行榜化的边际成本低。复评者应先核对 FACTS.md 第 6/9 节的核验时点快照,再决定是否重跑全部子项。
附录 C:复现论文评测的操作手册
按论文协议复现四模型评测的最短路径(约半天工作量):
第一步:环境与数据(约 10 分钟)
pip install datasets pillow
python -c "from datasets import load_dataset; ds = load_dataset('rajpurkarlab/ReXInTheWild'); print(ds)"
# 断言:ds['eval'].num_rows == 955
# 大陆网络不可达主站时:export HF_ENDPOINT=https://hf-mirror.com
第二步:提示词构造(约 30 分钟)
按论文协议拼装:系统指令(按患者视角解释左右、从选项中选择)+ 图像 + 打乱后的选项列表。两个必须复刻的细节:①选项顺序打乱且固定随机种子;②答案匹配按选项原文精确比较(坑 9),比较前做 strip() 规范化。
第三步:四模型推理(约 1-3 小时)
| 模型 | 接入方式 | 关键参数 |
|---|---|---|
| GPT-5 | 官方 API | temperature=1, top_p=1;固定版本字符串 |
| Claude Opus 4.5 | 官方 API | temperature=1, max_tokens=512;固定版本字符串 |
| Gemini-3 | 官方 API | temperature=1, top_p=0.95, top_k=64, thinking=True |
| MedGemma-4B-IT | HF Transformers 本地 | num_beams=1(确定性解码) |
第四步:计分与报告(约 30 分钟)
全量准确率 + 95% CI(Wilson 或 bootstrap);按 tag 分组报告,Other/Surgical 两组只做点估计;与论文成绩对照时允许 ±2 个百分点内的版本漂移(模型 API 随时间更新)。若复现值偏离论文超过 5 个百分点,优先排查:①选项未打乱导致的位置偏置;②左右视角指令缺失;③answer 文本匹配未规范化。
常见翻车点速查:wc -l 数行(坑 3)、按字母判分(坑 9)、把 543 当过滤输出(坑 6)、用未经授权的第三方镜像(坑 8)。
附录 D:与库内相邻条目的 AI-Ready 横向对照
以库内同属"医学图像 + 模型评测"光谱的条目为参照(评分为本库口径,供选型者建立相对坐标):
| 维度 | ReXInTheWild(本条目) | rexgradient-160k(717) | pmc-vqa(270) | vqa-rad(240) |
|---|---|---|---|---|
| 数据形态 | 955 MCQ + 484 照片 | 16 万胸片 + 报告文本 | 混合影像 VQA | 放射影像 VQA |
| 主用途 | 零样本评测 | 训练/评测报告生成 | 训练+评测 | 评测为主 |
| 规模量级 | 10² | 10⁵ | 10⁴⁺ | 10³ |
| 专科跨度 | 七主题跨科 | 胸科单科 | 多科混合 | 放射单科 |
| 溯源能力 | 逐题 PMC 链接 | 数据集级来源说明 | 部分溯源 | 数据集级 |
| 评测基础设施 | 无(论文单点) | ReXrank 排行榜承托 | 无 | 无 |
| 许可开放度 | CC BY-NC-ND 3.0 | 独立声明 | 各自声明 | 各自声明 |
对照读法:本条目在"溯源能力 × 轻量度"两个格子是光谱上的极值点——没有任何一个相邻条目能做到"每道题一键回查同行评议原文 + 全包 53 MB"。它的不可替代性不在规模,而在这两个极值与错误分类法三件套。
附录 E:qa.csv 原题速览(每主题前 2 题,实测摘录)
下表从 qa.csv 按文件顺序取每主题前 2 题(共 14 题)原文摘录,供未下载数据的读者感受题目形态;完整 955 题请以官方 qa.csv 为准。
| # | 主题 | 问题(中文转述) | 选项数 | 正确答案要点 |
|---|---|---|---|---|
| 1 | Eyes | 演示的是哪种评估眼睑松弛度的操作? | 5 | 用尺测量的上睑垂直牵拉(松弛度)试验 |
| 2 | Eyes | 右侧子图中,睑缘与瞳孔中心的距离是多少? | 4 | 19 mm |
| 3 | Head & Neck | 颅骨修补术后图中观察到什么表现? | 5 | 术区毛发再生、无缝线敷料引流物 |
| 4 | Head & Neck | 哪些耳廓亚结构畸形或缺如? | 5 | 对耳轮与舟状窝 |
| 5 | Mouth & Jaws | 图中测量的是哪段距离? | 4 | 最大张口距离(张口度) |
| 6 | Mouth & Jaws | 该测距操作对评估哪个临床问题最直接有用? | 5 | 张口受限(trismus)程度 |
| 7 | Trunk & Extremities | 图中哪个关节屈曲幅度最大? | 4 | 膝关节(股胫关节) |
| 8 | Trunk & Extremities | 哪个子图显示落地后的立即蹬伸? | 4 | “C (immediate push-off after landing)”——注意该选项原文自带字母前缀(文献子图标注残留) |
| 9 | Skin & Hair | 左图中脱发模式最符合哪个诊断? | 4 | 雄激素性(男性型)脱发伴双侧额颞部退缩 |
| 10 | Skin & Hair | 面部皮损的描述匹配(第二题,依原文件顺序) | 4-5 | 形态学描述词匹配 |
| 11 | Surgical & Procedural | 疤痕最符合哪种手术入路? | 5 | 股骨干骨折固定外侧入路 |
| 12 | Surgical & Procedural | 从胸部延伸向面部的皮瓣是哪种? | 5 | 带蒂胸三角肌皮瓣(pedicled deltopectoral skin flap) |
| 13 | Other | 视频问诊中哪条指令最能改善画面? | 5 | 调整握持勿让手指挡住镜头 |
| 14 | Other | 图中哪个可见迹象最提示疲劳或情绪低落? | 4 | 右手撑头、含胸坐姿 |
速览读法:前 8 题已经能看出"干扰项真实、测量颗粒细、拼版图指代"三大特征;13-14 题展示 Other 主题其实是"远程医疗实用指南"性质——它们是整份数据里离"患者真实使用场景"最近的题。
尾注
本条目由写手代理 agent-f-rexinthewi 撰写于 2026-09-30,全部硬数字经三源互证(arXiv 论文全文实抓 / HuggingFace 仓库 API 与文件实核 / 第三方学术索引交叉),其中数据本体统计(955 题、484 图、七主题分布、选项分布、答案完备性、例题画廊)由代理对 qa.csv 逐行解析实测。事实档案见同目录 FACTS.md;双口径冲突与遗留疑点的逐条存照见 FACTS.md 第 9 节。条目归类与互链以千方病案医数集受控词表为准;发布由主会话串行负责。
事故附记(成稿过程存档)
2026-09-30 00:14-00:21(+0800)期间,本代理按纪律包以 /tmp/rex-in-the-wild_agent-f-rexinthewi_part1-5.md 前缀直写五个 part;写至 part5 后经内容核对发现 part1-4 已被另一进程覆写(特征:keywords 出现 “Pranaj Rajpurkar” 拼写错误、“人工关” 笔误 ×7、patient_tags 无实核依据添加"儿童"、章节编排整体重构),随后发现备份前的 part5 亦被同名实例覆写(FAQ 题数与事实清单条数均与本人原稿不符;因覆写者同为 agent-f-rexinthewi 身份,签名特征鉴别失效)。处置:①弃用 /tmp 共享池,改用本目录 .parts_agent-f-rexinthewi/ 私有区;②part1-5 全量重写(内容依据本代理独立完成的 FACTS.md 与实抓原始数据 qa.csv/论文 HTML,未采用覆写版任何段落);③重拼后按章节序核对(§0-§11→FAQ→事实清单→术语表→附录 A-D→尾注);④本附记即事故第⑤步存档。建议主会话:排查同名代理 agent-f-rexinthewi 的并发实例,后续派发避免同名代理前缀。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rexvqa — 共享标签:多模态 / 视觉问答 / 医学问答 / 评测基准
- pathvqa — 共享标签:多模态 / 视觉问答 / 评测基准
- derm1m — 共享标签:多模态 / 视觉问答 / 评测基准
- medreco-db — 共享标签:多模态 / 视觉问答 / 医学问答
- 3dreasonknee — 共享标签:多模态 / 视觉问答 / 评测基准
- vqa-med — 共享标签:多模态 / 视觉问答
- tdc — 共享标签:多模态 / 评测基准
- pmc-vqa — 共享标签:多模态 / 视觉问答
- omnimedvqa — 共享标签:视觉问答 / 评测基准
- healthsearchqa — 共享标签:医学问答 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

