信息速览

HeadQA — 西班牙医学考试问答数据集 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | HEAD-QA |
| 英文全称 | HEAD-QA: A Healthcare Dataset for Complex Reasoning |
| 别名/简称 | HeadQA、HEAD-QA v1、aghie/head-qa、dvilares/head_qa |
| 疾病分类 | 全医学知识谱系(非单一疾病数据集);MIR 医学题覆盖 ICD-11 主要章节高频考点,代表性映射:BA41 急性心肌梗死 / 1G4Z 脓毒症 / CA40.0 肺炎 / CB4Z 心力衰竭(详见 §2.1) |
| SNOMED CT | 57054005 Acute myocardial infarction / 91302008 Sepsis / 233604007 Pneumonia / 84114007 Heart failure(代表性高频考点,详见 §2.2) |
| 数据模态 | 文本(多选题干 + 4-5 个选项)+ 图像(约 14% 医学题附临床图像) |
| AI 任务类型 | 问答(多选 QA)、复杂推理基准、自然语言推理、跨语言迁移评估、视觉-语言多模态(图像题) |
| 样本总数 | 6,765 题(v1,2013-2017 年卷)/ 12,751 题(v2,2013-2022 年卷) |
| 数据大小 | ~159 MB(HF 双语全量含图像)/ 纯文本 JSON 约 15 MB |
| 数据格式 | JSON(v1 官方)/ Parquet(HF 自动转换与 v2)/ 图像独立包(JPEG/PNG) |
| 许可证 | MIT(代码与数据仓库);试题内容再分发须遵守西班牙卫生部三条件(注明来源、不得歪曲、注明更新日期);HEAD-QA v2 为 CC BY 4.0 |
| 访问级别 | 开放 |
| DUO 标签 | NRES |
| 语言 | 西班牙语(原版)/ 英语(机器翻译);v2 增意大利语、加利西亚语、俄语 |
| 首发日期 | 2019-06-14(arXiv:1906.04701)/ 2019-07(ACL 2019 会议发表) |
| 最后更新 | 2025-11-19(HEAD-QA v2 发布,arXiv:2511.15355;2026-03-30 修订为 LREC 2026 camera-ready) |
| 发布机构 | 拉科鲁尼亚大学 CITIC 计算机系(David Vilares & Carlos Gómez-Rodríguez) |
| 官方主页 | http://aghie.github.io/head-qa |
| 下载地址 | https://huggingface.co/datasets/dvilares/head_qa(HF)/ GitHub 仓库内 Google Drive 链接(v1 原始 JSON + 图像包) |
| DOI | 10.18653/v1/P19-1092(论文) |
| 引用次数 | 157+(Semantic Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— HF 一行加载、官方 train/dev/test 划分、规模小上手快、六科均衡;扣分项:v1 已冻结、图像题弱对齐、英文版为机翻、LLM 预训练污染风险未受控 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(西班牙医疗岗位考试体系、ICD-11/SNOMED CT 映射、考试金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(name+qid 复合键、字段语义)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与拉科鲁尼亚大学 CITIC、西班牙卫生部、HuggingFace 无任何商业利益关联。本页面不销售 HEAD-QA 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。HEAD-QA 试题内容反映 2013-2017 年(v2 至 2022 年)西班牙临床指南与考试口径,部分"正确答案"在当前指南下可能已更新。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。HEAD-QA 仓库采用 MIT 许可,但试题内容再分发须同时遵守西班牙卫生部规定的三项条件(注明来源、不得歪曲内容、注明所复用文件的最后更新日期——HEAD-QA 标注为 2019-01-14)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
HEAD-QA 是西班牙拉科鲁尼亚大学 CITIC 团队于 2019 年发布的医疗问答基准,包含 6,765 道西班牙政府医疗岗位准入考试真题(2013-2017 年卷),覆盖医学、护理、药学、生物、心理、化学六个学科,提供西班牙语原版和机器翻译英文版,约 14% 的医学题还附带胸片、皮肤病变等临床图像。
它的独特价值在于"真实"二字:这些不是众包编写的玩具题,而是西班牙住院医师规范化培训(MIR 体系)的全国性选拔考试题——人类考生需要本科毕业后再备考一年以上才能通过。2019 年发布时,最好的 AI 系统准确率仅 34.6%,全部科目达不到人类及格线;而到 2025 年,Llama-3.1-70B 已能答对 83%。HEAD-QA 完整见证了医疗 AI 推理能力的六年跨越,至今仍是评估多语言 LLM 医疗知识的标准基准(lm-evaluation-harness 内置任务)。
你可以用它来:评估大模型的医疗知识与复杂推理能力(尤其是西班牙语等非英语能力)、做跨语言迁移研究(西英对照天然成对)、压测 RAG/CoT 等推理策略、或者利用图像题子集做医疗视觉问答实验。
§1.1 摘要
HEAD-QA 由 David Vilares 与 Carlos Gómez-Rodríguez 构建(ACL 2019,DOI: 10.18653/v1/P19-1092),原始素材为西班牙卫生、消费与社会福利部(Ministerio de Sanidad, Consumo y Bienestar Social)每年举办的六类医疗岗位准入考试试卷:医学(MIR)、护理(EIR)、药学(FIR)、生物(BIR)、心理(PIR)、化学(QIR),取 2013-2017 年共五年考卷,从 PDF 解析为结构化 JSON 并移除官方作废题,最终 6,765 题(六科各 1,069-1,149 题,近似均衡)。2013-2014 年卷为 5 选项,2015 年起为 4 选项。官方按年份划分:2013+2014 年卷为训练集(2,657 题)、2015 年卷为验证集(1,366 题)、2016-2017 年卷为测试集(2,742 题)——刻意不做随机划分,以便与官方公布的人类考生成绩可比。英文版由 Google 2018 年 seq2seq NMT 系统机器翻译生成(人工评估 adequacy 4.35-4.71/5)。2025 年 11 月,原团队发布 HEAD-QA v2:12,751 题、覆盖 2013-2022 十年考卷、新增意大利语/加利西亚语/俄语机器翻译版、334 道图像题、Parquet 格式、CC BY 4.0 许可(arXiv:2511.15355,LREC 2026)。
§1.2 战略价值分析
范式开创维度:2018-2019 年正是 SQuAD 式抽取式 QA 被刷到"超人"的年代,学界开始反思数据集是否迁就了神经模型的能力舒适区。HEAD-QA 与 AI2 的 ARC 几乎同期,把"研究生级专业知识 + 多跳推理"引入多选 QA 评测:题目不提供上下文文档,系统必须自己从维基百科等开放语料中检索知识再推理——这在当时直接击穿了 DrQA、BiDAF 等主流神经阅读器(准确率 27-29%,低于传统 TF-IDF IR 的 34.6%)。论文用事实证明:表层模式匹配在真正的专业推理面前失效,知识获取与推理链构建才是瓶颈。这一判断后来被整个 RAG 与 LLM 时代的文献反复验证。
多语言生态维度:医疗 NLP 基准长期是英语独角戏(MedQA、PubMedQA、MMLU 医学子集均基于美国体系)。HEAD-QA 是第一个研究生级的非英语医疗推理基准,锚定了全球第二大母语——西班牙语——的医疗 AI 评估坐标系。它随后被 EleutherAI lm-evaluation-harness 收为标准任务(headqa_es / headqa_en),进入 BigScience 生物医学合集(bigbio),成为西班牙本土模型(MarIA、BETO、bsc-bio 系列)与多语言模型必测项目。2025 年 v2 扩展到五种语言,进一步把它从"西语基准"升级为"多语言医疗推理对照实验台"。
时代标尺维度:HEAD-QA 是少有的、能完整记录 LLM 革命六年跨度的医疗基准:2019 年最佳系统 34.6%(全部科目低于人类及格线);2020 年 MurKe 多步推理 44.4%;2023 年 GPT-4 在 2022 年 MIR 新卷上达 86.81%(西班牙语,Guillen-Grima et al. 2023);2025 年开源 Llama-3.1-70B 在 v2 上达 83.15%。这条曲线既是"基准从不可能到饱和"的标准叙事样本,也暴露了新时代的方法论问题——预训练数据污染、答案位置偏差、CoT 失效——使 HEAD-QA 从"能力标尺"转变为"评测方法论研究对象",教学价值反而更高。
§1.3 横向对比
| 数据集 | 题量 | 语言/来源 | 选项 | 核心差异化 |
|---|---|---|---|---|
| HEAD-QA v1 | 6,765 | 西班牙语(+机翻英语)/ 西班牙 MIR 等国考 2013-2017 | 4-5 | 首个研究生级非英语医疗推理基准;六学科均衡;官方年份划分可与人类成绩对照 |
| HEAD-QA v2 | 12,751 | 西/英/意/加利西亚/俄 五语 / 2013-2022 | 4-5 | 十年跨度、334 图像题、Parquet、无官方划分、CC BY 4.0 |
| MedQA(USMLE) | 12,723(英文 4 选项版) | 英语(+中文/繁中)/ 美国医师执照考试 | 4-5 | 美国临床体系;英文医疗 QA 主战场 |
| MedMCQA | 194,000+ | 英语 / 印度 AIIMS、NEET 考试 | 4 | 规模最大;附带解释标注 |
| PubMedQA | 273,000(1k 人工标注) | 英语 / PubMed 摘要 | yes/no/maybe | 文献理解而非考试推理 |
| MMLU 医学子集 | 约 1,500(6 个医学子任务) | 英语 / 混合来源 | 4 | 通用 LLM 评测的医学切片,非专门基准 |
| Antidote CasiMedicos | 约 22,000 | 西班牙语 / 同源 MIR 考卷 + 解释性标注 | 4-5 | 与 HEAD-QA 同源但重"解释",EXPLA 标注 |
HEAD-QA 的不可替代性在三点:六学科均衡的真实国考结构(MedQA/MedMCQA 均为单一医师考试)、西英成对语料带来的天然跨语言对照、以及官方按年份划分 + 公开人类成绩构成的"人机对照"设计——这在医疗 QA 数据集中独一无二。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2013-2017 | 西班牙卫生部举行六类医疗岗位年度国考(MIR/EIR/FIR/BIR/PIR/QIR),试题 PDF 公开 |
| 2019-01-14 | GitHub 仓库 aghie/head-qa 创建,v1 数据冻结(内容更新基准日) |
| 2019-06-14 | arXiv:1906.04701 首发 |
| 2019-07 | ACL 2019 正式发表(Florence,P19-1092,pp. 960-966) |
| 2020 | Liu et al. 提出 MurKe 多步推理框架,刷新官方排行榜(44.4% / 46.7%) |
| 2020-12 | 进入 HuggingFace datasets(社区贡献者 Maria Grandury,PR #1455) |
| 2022 | 收录进 BigScience 生物医学数据集合集(bigbio/head_qa) |
| 2023-11 | GPT-4 通过 2022 年 MIR 考试 86.81%(Guillen-Grima et al., Clin Pract) |
| 2023-2024 | 成为 EleutherAI lm-evaluation-harness 标准任务(headqa_en / headqa_es) |
| 2025-11-19 | HEAD-QA v2 发布:12,751 题、2013-2022、五语言、334 图像题、CC BY 4.0 |
| 2026-03-30 | v2 论文修订版(LREC 2026 camera-ready,arXiv:2511.15355v2) |
§1.5 典型 AI 应用场景
- LLM 医疗知识与推理评估:多选 QA 形式天然适配 loglikelihood 与生成式两种评测;西英双版本可同时报告"医疗能力"与"非英语能力落差"(如 Llama-3.1-8B 英 70.4% vs 西 61.9%)。
- 跨语言迁移与翻译鲁棒性研究:同一批题目的西/英(v2 五语)成对版本是受控的跨语言对照实验材料。
- 推理策略压测:v2 论文系统证明 CoT、few-shot、RAG 在该基准上几乎无增益甚至负增益——是检验"推理增强技术边界"的理想负例测试台。
- 医疗视觉问答(VQA):约 14% 的 MIR 题附临床图像(v1 约 160 题;v2 共 334 题),可构建小规模真实考试 VQA 评测。
- 西班牙语医疗 NLP 微调与教学:2,657 题官方训练集 + 题量适中的规模,适合课堂全流程演示与小模型领域适配实验。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
HEAD-QA 不是单一疾病数据集,而是覆盖全医学知识谱系的考试基准。其中 MIR(医学)1,149 题对应 ICD-11 主要章节的临床高频考点;FIR(药学)对应 ICD-11 之外的 ATC 药物分类与药理学;EIR(护理)覆盖护理程序与患者管理;BIR/QIR/PIR 分别对应基础生物学、化学(含放射化学与药物化学计算)与临床心理学。代表性考点到 ICD-11 的映射如下(以论文样例与 MIR 考试公开考纲为据):
| 考试学科 | 覆盖领域 | ICD-11 代表性章节/编码 | 典型考点举例 |
|---|---|---|---|
| Medicine(MIR) | 内、外、妇、儿、急诊全科 | BA41 急性心肌梗死 / 1G4Z 脓毒症 / CA40.0 肺炎 / CB4Z 心力衰竭 / 2 肿瘤各章 | 诊断推理、鉴别诊断、首选检查与治疗 |
| Pharmacology(FIR) | 药理学、药剂学、药事管理 | 对应 ATC 分类体系(ICD-11 外) | 抗菌药选择(如流感嗜血杆菌脑膜炎首选头孢噻肟)、药物相互作用、剂量计算 |
| Nursing(EIR) | 内外科护理、社区护理、护理程序 | 与 MIR 同谱系,偏护理视角 | 患者教育、应激情境沟通、围手术期护理 |
| Biology(BIR) | 分子生物学、遗传学、微生物学 | 05 内分泌/代谢、20 发育异常相关基础 | 分子机制、实验室技术、遗传病基础 |
| Chemistry(QIR) | 无机/有机/分析化学、放射化学 | 对应化学品与药物化学(v2 已将化学式转 SMILES) | 化学计算、反应机理、分析技术 |
| Psychology(PIR) | 临床心理学、心理测量、心理治疗 | 06 精神、行为或神经发育障碍(如 6A00-6A0Z 神经发育障碍) | 人格理论(如 Eysenck 模型)、心理评估、治疗流派 |
为什么"考试锚定"对 AI 研究是资产:西班牙 MIR 体系以题难、区分度高著称(考生按分数排名选专科与医院),命题由卫生部专家委员会完成并经过考后作废题校审——这相当于一个持续五年、每年六科、由国家级专家维护的"医学知识难度校准器"。其副作用是内容深度绑定西班牙临床体系(药品商品名、社保流程、本土指南),跨体系迁移时需在方法学中声明(见 §7.3)。
§2.2 SNOMED CT 映射
| 代表性考点 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 急性心肌梗死 | BA41 | 57054005 | Acute myocardial infarction (disorder) |
| 脓毒症 | 1G4Z | 91302008 | Sepsis (disorder) |
| 肺炎 | CA40.0 | 233604007 | Pneumonia (disorder) |
| 心力衰竭 | CB4Z | 84114007 | Heart failure (disorder) |
| 先天性巨结肠(Hirschsprung 病,论文样例题) | LB16(消化系统结构发育异常) | — | 论文 Table 1 医学样例题题干疾病 |
| 流感嗜血杆菌 b 型脑膜炎(论文样例题) | 1C10(细菌性脑膜炎相关) | — | 论文 Table 1 药学样例题(首选头孢噻肟) |
说明:HEAD-QA 官方未提供任何 ICD/SNOMED 结构化标注,上表为千方编辑部依据论文公开样例与 MIR 考纲建立的内容锚定映射,供检索与跨数据集对齐使用;DAIMS 第 13 项(编码映射标准)因此记 ⚠️(见 §7.7)。
§2.3 考试体系背景(本数据集的"临床场景")
西班牙的医疗专科岗位准入实行全国统考制:医学毕业生参加 MIR 考试(Médico Interno Residente,住院医师规范化培训准入),护理、药学、生物、心理、化学专业毕业生分别参加 EIR/FIR/BIR/PIR/QIR 考试,录取者按分数排名依次选择专科方向与就职医院/机构。考生需持有对应学士学位(4-6 年),通常全职备考一年以上;每年每科数千人竞争有限名额。试题为 225-235 题左右的单项选择题(2013-2014 年 5 选项,2015 年起 4 选项),答对 +3 分、答错 -1 分(POINTS 计分制),部分题目在考后经申诉程序由官方作废——HEAD-QA 已将这些作废题移除。这一体系的知识要求被公认为"对高度专业化的人类也极具挑战"(论文摘要原文),2016 年各科目前 10 名考生平均 POINTS 为 515-627 分、及格线 180-219 分,而 2019 年最佳 AI 系统在所有科目均未及及格线。
§2.4 临床认知任务定义
| 认知任务 | 定义 | 在 HEAD-QA 中的体现 | 对应 AI 能力 |
|---|---|---|---|
| 知识回忆 | 直接考查事实性知识 | “流感嗜血杆菌 b 型脑膜炎首选抗生素?” | 参数化知识储备(LLM 权重内知识) |
| 诊断推理 | 从病史/检查结果推导最可能诊断 | 题干含病例 vignette(MIR 题干平均 55 tokens,最长 308) | 多跳推理、鉴别诊断 |
| 治疗决策 | 选择首选治疗/检查/处理流程 | MIR/EIR 高频题型 | 指南一致性推理 |
| 定量计算 | 药理剂量、化学计量、统计计算 | FIR/QIR 计算题 | 算术 + 单位换算 |
| 图像判读 | 结合胸片/皮肤/心电等图像答题 | 约 14% MIR 题 + EIR 2019-2022 部分题(v2) | 视觉-语言多模态 |
| 社会-职业情境 | 医患沟通、应激处理、伦理法规 | 各科均有少量(论文 §2 明确提及) | 情境理解、价值观对齐 |
§2.5 来源与"考生人群"特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 西班牙卫生、消费与社会福利部(Ministerio de Sanidad, Consumo y Bienestar Social)官方试卷 PDF,国家级统考 |
| 采集时间 | v1:2013-2017 年(5 年 × 6 科);v2:2013-2022 年(10 年 × 6 科) |
| 命题者 | 卫生部专家委员会;考后经申诉与作废题校审 |
| 考生人群 | 对应专业本科毕业生(4-6 年学制),通常备考 ≥1 年;每年每科数千人 |
| 题量结构 | v1 六科各 1,069-1,149 题(近似均衡);放射物理(RFIR)因 PDF 公式解析困难被排除 |
| 语言 | 卡斯蒂利亚西班牙语(西班牙本土变体,非拉美西语) |
| 内容侧重 | 以技术性问题为主,兼含社会性情境题(论文 §2) |
| 人类成绩(2016 年官方) | 各科前 10 名考生平均 POINTS 515-627;及格线 180-219 |
§2.6 金标准/参考标准
| 数据划分 | 标注方式 | 标注者 | 金标准性质 |
|---|---|---|---|
| Train(2013-2014 年卷,2,657 题) | 官方考试答案键(每题唯一正确选项) | 西班牙卫生部命题与阅卷专家委员会 | 国家级考试官方答案;作废题已移除 |
| Dev(2015 年卷,1,366 题) | 同上 | 同上 | 同上 |
| Test(2016-2017 年卷,2,742 题) | 同上 | 同上 | 同上 |
| 英文版 | 机器翻译(2018 Google seq2seq NMT),答案键不变 | 无人工逐题校对;论文做了抽样人工评估 | 翻译质量:adequacy 4.35-4.71/5、fluency 4/5;非人工翻译 |
| 人类对照 | 官方公布考生成绩分布 | 全体真实考生 | 论文 Table 9 给出 2016 年各科前 10 名均值与及格线 |
金标准的时效性警告:答案键以考试当年的官方口径为准。2013-2017 年的抗菌药选择、疫苗指征、诊疗流程在 2026 年视角下已有更新——模型答对"2013 年的正确答案"不等于符合当前临床实践(详见 §6.5 坑点 8 与 §7.6)。
§3 数据集规格
§3.0 版本抉择矩阵
HEAD-QA 存在 v1(2019)与 v2(2025)两代,且 v1 有西/英两个语言版本。30 秒选型:
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现 2019-2024 年文献结果;需要官方 train/dev/test 划分;需要与 lm-evaluation-harness 历史结果对齐 | v1(dvilares/head_qa) | ~159 MB(双语含图像) | 唯一带官方年份划分的版本;文献中"HEAD-QA"默认指它;排行榜(Vilares 2019 / Liu 2020)均基于 v1 |
| 评估当代 LLM;需要 2018-2022 新考卷降低污染;需要五语言或 334 道图像题 | HEAD-QA v2(alesi12/head_qa_v2) | Parquet(HF 自动) | 十年跨度、五语言、PIL 图像字段、CC BY 4.0;注意无官方划分,需自行定义协议 |
| 只做西班牙语医疗 NLP 微调训练 | v1 西语 train split | ~2,657 题 | 规模适中、官方划分干净;英文版是机翻不宜作训练语料 |
| 医疗 VQA 多模态实验 | v2 图像子集(334 题) | 随 Parquet 内嵌 | v2 图像为 PIL 对象直接可用;v1 图像需单独下载 zip 并自行按题干编号对齐 |
v1 vs v2 关键差异速查:
| 维度 | HEAD-QA v1(2019) | HEAD-QA v2(2025) |
|---|---|---|
| 题量 | 6,765(每语言) | 12,751(每语言) |
| 考卷年份 | 2013-2017 | 2013-2022 |
| 语言 | 西语 + 机翻英语 | 西语 + 机翻英/意/加利西亚/俄 |
| 翻译引擎 | Google seq2seq NMT(2018) | Llama-3.1-8B(instruction-tuned) |
| 官方划分 | 有(按年份:2657/1366/2742) | 无(统一基准集合) |
| 图像题 | 约 14% MIR 题,独立 zip 包 | 334 题,Parquet 内嵌 PIL 字段 |
| 文件格式 | JSON(+HF Parquet 转换) | Parquet |
| 化学式处理 | 原始文本 | 已转 SMILES |
| 许可证 | MIT + 卫生部三条件 | CC BY 4.0 |
| 论文 | ACL 2019(10.18653/v1/P19-1092) | arXiv:2511.15355(LREC 2026) |
§3.1 模态详细说明
HEAD-QA 以文本多选题为主体模态:每题由题干(qtext)+ 4-5 个选项(answers)+ 唯一正确答案编号(ra)构成。题干长度学科差异显著:MIR 题干平均 55.29 tokens(最长 308,含完整病例 vignette),EIR 平均 29.03,而 BIR 平均仅 11.11 tokens;选项平均 5.08-9.54 tokens(论文 Table 3)。这一"题干越长越难"的结构直接解释了 2019 年基线的科目难度梯度(见 §8.1)。
第二模态为临床图像:约 14% 的 MIR 题在题干中引用编号图像(“Question linked to image no. X”),内容涵盖胸片、皮肤病变、心电图、显微图像等;作者提示部分图像展示严重创伤或疾病且质量参差("可印刷辨识"级别)。v1 中图像以独立 zip 发布、靠题干文本弱对齐;v2 将 334 张图像以 PIL 对象内嵌 image 字段,并新增 2019-2022 年 EIR 图像题 36 道。
第三"模态"是跨语言文本对:v1 的西-英、v2 的西-英/意/加利西亚/俄机器翻译版本,题号一一对应,构成天然的多语言平行评测语料。
§3.2 样本量拆分
v1(6,765 题,官方划分,论文 Table 2 精确值):
| 科目 | 考试代码 | 总数 | Train(2013-2014) | Dev(2015) | Test(2016-2017) |
|---|---|---|---|---|---|
| Biology | BIR | 1,132 | 452 | 226 | 454 |
| Nursing | EIR | 1,069 | 384 | 230 | 455 |
| Pharmacology | FIR | 1,139 | 457 | 225 | 457 |
| Medicine | MIR | 1,149 | 455 | 231 | 463 |
| Psychology | PIR | 1,134 | 453 | 226 | 455 |
| Chemistry | QIR | 1,142 | 456 | 228 | 458 |
| 合计 | — | 6,765 | 2,657 | 1,366 | 2,742 |
v2(12,751 题,2013-2022,无官方划分,按科目总计):BIR 2,119 / QIR 2,140 / MIR 2,156 / EIR 2,069 / FIR 2,146 / PIR 2,121。按年份:2013-2018 每年约 1,318-1,372 题,2019-2020 每年约 1,074-1,078 题(各科题量下调),2021-2022 每年约 1,230-1,240 题(v2 论文 Table 1)。
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| v1 官方 JSON | HEAD.json / HEAD_EN.json + train/dev/test_ 前缀分片 | GitHub 仓库内 Google Drive 链接;每语言 4 个 JSON + 每卷一个 .gold TSV(qid → 正确 aid) |
| v1 HuggingFace | dvilares/head_qa(Parquet 自动转换) | 13,530 行(6,765 × 西/英);config 默认西语,en 为英文版;image 列为 PIL 或空 |
| v1 BigBio | bigbio/head_qa | BigScience 生物医学统一 schema 封装 |
| v1 图像包 | 独立 zip(Google Drive) | 含图像、原始 PDF 等;按卷内编号引用 |
| v2 | alesi12/head_qa_v2(Parquet) | 每题 8 字段(qid/qtext/ra/answers/image/year/category/name),图像 PIL 内嵌,化学式已转 SMILES |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| HF 全量下载(v1 双语 + 图像) | ~159 MB | modeldatabase 快照口径 |
| HF 自动转换 Parquet(v1) | ~122 MB | 同上 |
| v1 纯文本 JSON(单语言) | ~15 MB 量级 | 轻量,可全量入内存 |
| v2 Parquet | 百 MB 量级 | 含 334 张内嵌图像 |
§3.5 标注方式
HEAD-QA 没有传统意义的"人工标注"——每题的正确答案(ra)直接采用西班牙卫生部官方考试答案键,这是国家级标准化考试的金标准标签。数据构建流程为:
- 从卫生部官网获取六科五年(2013-2017)试卷 PDF;
- PDF 解析提取题干、选项、答案键(放射物理 RFIR 因公式解析困难被整体排除);
- 移除考后官方作废题;
- 英文版经 Google 2018 年 seq2seq NMT 机器翻译,论文抽样人工评估翻译质量(adequacy 4.35/4.71,fluency 4/5),未逐题人工校对;
- 图像题保留题干中的图像编号引用,图像文件单独打包。
§3.6 标注者资质
答案键的产生者是西班牙卫生部组织的命题与阅卷专家委员会(医疗各专科高级职称专家),考后经公开申诉程序校审并作废争议题——这是标准化考试领域最高等级的标签生产流程。机器翻译无逐题人工标注者;论文作者(计算语言学研究者)完成了翻译质量抽样评估与解析校验。
§3.7 数据采集时间范围
v1:2013 年 1 月至 2017 年 12 月(五年度考试);v1 内容冻结于 2019-01-14(仓库声明的内容更新基准日)。v2:2013-2022(十年度考试)。
§3.8 地理覆盖
西班牙全国统考(单国家来源)。内容深度绑定西班牙医疗体系:本土临床指南、药品商品名与审批口径、社保与岗位制度。这是其作为"国家级真实考试"的价值来源,也是跨境泛化的主要限制(见 §7.3)。
§3.9 采集"设备"规格(试卷与解析链)
| 环节 | 规格 | 说明 |
|---|---|---|
| 试卷载体 | 官方 PDF 考卷(Cuaderno,每卷约 225-235 题) | 卫生部官网公开近 5 年卷 |
| 解析工具 | 自研 PDF 解析脚本(未公开细节) | RFIR 因公式/方程解析困难被排除 |
| 翻译引擎 | Google seq2seq NMT(2018) | 论文抽样评估 adequacy 4.35-4.71/5 |
| v2 翻译引擎 | Llama-3.1-8B instruction-tuned | 格式错误最少配置(28 处);回译 BLEU:gl 0.66 / it 0.57 / en 0.41 / ru 0.33 |
| IR 基线检索语料 | eswiki-20180620 / enwiki-20180701 Wikipedia dump + DrQA TF-IDF 索引 | 复现 2019 基线所需 |
| v2 结构化处理 | 化学式 → SMILES 转换(少数受影响题人工处理) | 便于文本模型消费 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 命题 | 西班牙卫生部六科专家委员会 | 每年每科约 225-235 道单选题;2013-2014 五选项,2015 起四选项 |
| 2. 考试与校审 | 全国统考 + 考后申诉作废机制 | 作废题形成"官方质量过滤" |
| 3. 公开 | 卫生部官网历年试卷 PDF 公开 | 附带再分发三条件(署名/不歪曲/注明更新日期) |
| 4. 解析结构化 | 拉科鲁尼亚大学 CITIC 自研 PDF 解析 | PDF → JSON(qid/qtext/answers/ra/image/year/category/name);RFIR 排除;作废题移除 |
| 5. 翻译 | Google seq2seq NMT(2018,v1)/ Llama-3.1-8B(2025,v2) | 西语原版 → 英(v1)/ 英意加利西亚俄(v2)机翻版 |
| 6. 发布 | GitHub + Google Drive(2019)→ HuggingFace(2020,Maria Grandury 贡献)→ bigbio(2022)→ v2 HF(2025) | v1 冻结;v2 CC BY 4.0 独立仓库 |
§4 数据结构详解
§4.0 目录结构预览
v1 官方下载包(ES_HEAD / EN_HEAD 两个语言包,结构对称):
ES_HEAD/
├── HEAD.json # 全量 6,765 题(unsupervised setting 用)
├── train_HEAD.json # 训练集 2,657 题(2013-2014 年卷)
├── dev_HEAD.json # 验证集 1,366 题(2015 年卷)
├── test_HEAD.json # 测试集 2,742 题(2016-2017 年卷)
└── *.gold # 每卷一个 TSV:qid → 正确 aid(供 eval.py 计分)
HEAD-QA-images-pdfs.zip # 独立图像/原始 PDF 包(约 14% MIR 题引用)
EN_HEAD/ # 英文机翻版,文件名带 _EN 后缀,结构同上
HuggingFace(推荐路径):
dvilares/head_qa # 默认 config = 西语;config 'en' = 英语
├── train: 2657 / validation: 1366 / test: 2742(每语言)
alesi12/head_qa_v2 # v2:单一 split,12,751 题 × 5 语言 config
§4.1 DAIMS 标准化字段描述表
核心 RecordSet:questions(每题一行)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| name | string | 考卷标识(唯一键左半) | “Cuaderno_2013_1_B” | 溯源到具体考卷;防跨卷撞键 | 无 | 不允许缺失 | {年份}{版本} 模式 |
| qid | int | 卷内题号(唯一键右半,全局不唯一) | 1 | 与 name 组成复合主键 | 无 | 不允许缺失 | 1-235 左右 |
| category | string | 学科 | “biology” | 分科评估/分层 | 无 | 不允许缺失 | medicine / nursing / pharmacology / biology / psychology / chemistry |
| year | int/string | 考试年份 | 2013 | 按年划分;时效性分析 | 无 | 不允许缺失 | 2013-2017(v1)/ 2013-2022(v2) |
| qtext | string | 题干 | “Los potenciales postsinápticos excitadores:” | 模型输入 | PDF 解析残留个别断行;英文版为机翻 | 不允许缺失 | 平均 11-55 tokens,最长 308 |
| answers | list[dict] | 选项列表,每项 | [{aid:1, atext:“…”}, …] | 模型输入 | 同 qtext | 不允许缺失 | 4 或 5 项(2013-2014 为 5) |
| ra | int | 正确答案 aid(金标签) | 3 | 评估靶标 | 官方答案键;作废题已移除 | 不允许缺失 | 1-5 |
| image | PIL/路径/空 | 关联临床图像 | PIL.Image 或 “” | 多模态输入 | 质量参差;v1 弱对齐 | 空 = 无图(约 86% MIR 题与几乎全部其他科题) | 约 14% MIR 题非空 |
复合主键警告:qid 仅在单张考卷内唯一,跨卷合并时必须使用 (name, qid) 复合键,否则将发生大规模撞键(v2 论文 §2.2 明确:“A unique identifier requires both name and qid”)。这是本数据集最高频的工程错误之一(见 §6.5 坑点 7)。
§4.2 标签分布统计
| 维度 | 分布 | 说明 |
|---|---|---|
| 学科分布 | 六科各 1,069-1,149 题(15.8%-17.0%) | 近似均衡,无需类别重采样 |
| 正确答案位置 | 近似均匀,首/尾位略少 | v2 论文确认:命题人倾向避免把正确答案放在两端(Attali & Bar-Hillel 2003 记录的考试设计偏差) |
| 选项数 | 5 选项题 2,657(39.3%,2013-2014)/ 4 选项题 4,108(60.7%) | v2 十年口径下 5 选项占 21% |
| 随机基线 | 5 选项 20% / 4 选项 25% | 跨年合并评估时随机水平不一致(见 §6.5 坑点 2) |
| 图像题 | 约 14% MIR 题(v1 约 160 题;v2 共 334 题) | 其余科目基本无图 |
§4.3 关键字段描述性统计
- 题干长度:BIR 平均 11.11 / QIR 15.82 / FIR 18.18 / PIR 21.91 / EIR 29.03 / MIR 55.29 tokens(最长 308)。
- 选项长度:平均 5.08(BIR)- 9.54(EIR)tokens,最长 94。
- 难度梯度(2019 基线佐证):题干最短的 FIR/BIR 基线最高(约 38%),题干最长的 MIR 最低(约 30%)——"题干长度"是该数据集最强的单变量难度代理。
- 每年每科题量约 225-235;2019-2020 年各科题量下调至约 177-183/年(v2 统计)。
- HF 行数:13,530 = 6,765 × 2(西/英各一份完整副本)。
§4.4 数据层级关系
考卷(name,如 Cuaderno_2013_1_B;year + category 唯一确定)
└─ 题目(qid,卷内唯一;name+qid 全局唯一)
├─ qtext(题干,可能引用 image no. X)
├─ answers[](4-5 个 {aid, atext})
├─ ra(正确 aid,金标签)
└─ image(可选,v1 外部文件 / v2 内嵌 PIL)
- 无患者、无就诊、无时序层级——这是扁平的"考卷 → 题目"两级结构,与 MIMIC 类 EHR 数据集的三级主键完全不同。
- 语言版本间按
(category, year, qid)一一对齐:西语题与英语题共享同一 name+qid(英文版文件名与字段不变,仅文本翻译)。 - v1 与 v2 的 2013-2017 部分内容同源但不保证逐题一致(v2 重新解析并新增 SMILES 处理),合并使用前必须按 (year, category, qid) 校验(见 §6.5 坑点 7)。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 字段 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| 结构性缺失 | image | 该题本无图 | 空值 = 无图题(非"图丢失") | 不可把空 image 当作数据损坏过滤;正确做法是按"题干是否含 image no. 引用"二次核对 |
| 翻译性缺失 | qtext/atext(EN) | 机翻引擎对化学式、表格型题干处理不佳 | 无显式标记 | 英文版个别题语义破损;英文实验应在局限性中声明 |
| 排除性缺失 | RFIR 放射物理全科 | PDF 公式解析困难,整体未收录 | 整个第七科缺失 | 若研究宣称"西班牙医疗国考全覆盖"则不准确 |
| 校审性缺失 | 作废题 | 考后官方作废,已从数据集移除 | 移除无标记 | 与官方原始卷题号可能存在跳号;按 qid 对齐官方原始 PDF 时注意 |
| 时间性缺失 | 2018+ 年卷(v1) | v1 冻结于 2019-01 | v2 已补齐 | 用 v1 评估当代 LLM 时污染风险更高(见 §6.5 坑点 5) |
§5 数据划分与使用建议
§5.1 官方数据划分
v1 官方划分(按考试年份):
| 划分 | 年卷 | 题量 | 设计意图 |
|---|---|---|---|
| Train | 2013 + 2014 | 2,657 | 监督训练(也是仅有的 5 选项年份) |
| Dev | 2015 | 1,366 | 调参与早停 |
| Test | 2016 + 2017 | 2,742 | 最终评估(全部 4 选项) |
论文明确不采用随机划分的两条理由:(1) 各科题量与内容本由医疗专家设计以规避偏差;(2) 更重要的——只有按年份划分才能与官方公布的人类考生成绩进行同卷对照。复现论文或与 Vilares 2019 / Liu 2020 比较时,必须使用此划分。
v2 无官方划分:12,751 题作为统一基准集合发布,作者定位于"评估而非训练",使用者需自行定义评估协议(建议至少按年份分层报告)。
§5.2 推荐划分策略
- 复现/比较研究:严格使用 v1 官方划分(train/dev/test = 2013-14/2015/2016-17)。
- LLM 评估:不需要划分——在全量(或 test split)上做 zero/few-shot 评测即可;务必同时报告西语与英语两个版本,差值即"非英语能力落差"。
- 降低污染的评估:优先用 v2 的 2019-2022 年卷(GPT-3.5/4 预训练语料截止后举行),或至少按年份分层报告 2018 年前后差异。
- 训练用划分:若需监督微调,建议按年份 forward-chaining(如 2013-2015 train / 2016 dev / 2017 test),模拟"用历史题预测新题"的真实场景;避免随机划分——同一考纲下相邻年份题目风格高度相似,随机划分会高估泛化。
- 分科评估:始终按 category 分层报告六科成绩,全库均值会掩盖 MIR(最难)与 FIR(最易)之间约 8-15 个百分点的结构性差异。
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | LLM 预训练语料已摄入公开考卷 PDF(2013 年起官网公开) | 高(对当代 LLM) | 用 v2 的 2019-2022 年卷做"后污染期"对照;在论文中声明污染未受控;优先报告模型截止日后的年份 |
| 2 | 用机翻英文版训练、再在西语原版上评估(同一题的两种语言天然泄漏) | 高 | 跨语言实验必须保持"训练语言 ≠ 评估语言"的题集隔离;同一 (name,qid) 不得跨语言分别进入训练与测试 |
| 3 | 把 v1 与 v2 混合后随机划分(2013-2017 部分同源重复) | 中高 | 二选一使用;或按 (year,category,qid) 去重 |
| 4 | 用包含试题解析网页的检索语料做 RAG(历年 MIR 题在备考网站有大量解析) | 中 | 检索库去污染:按题干近似匹配过滤备考网站页面 |
| 5 | 评估时把答案位置信息泄露进 prompt 模板(如固定示例的答案分布偏斜) | 低中 | few-shot 示例答案位置均衡化;做选项 shuffle 稳健性测试 |
§5.4 交叉验证建议
- 监督实验:以年份为折叠轴做 5 折交叉验证(每年一卷为折),比随机 K 折更能反映"新年卷"泛化。
- 跨语言稳健性:以语言为折叠轴(train EN → test ES,与反向),复现 Vilares 2019 的 cross-lingual 设计。
- 选项顺序稳健性:对每题做 2-4 次选项重排评估并报告均值 ± 方差——v2 论文与 Pezeshkpour & Hruschka 2023 均表明 LLM 对选项顺序敏感。
§5.5 外部验证
HEAD-QA 上的模型/方法,经典外部验证路径为:MedQA / MedMCQA(美国与印度医师考试体系,检验跨体系迁移)、Antidote CasiMedicos(同源 MIR 考卷 + 解释标注,检验解释生成能力)、MMLU 医学子集(通用 LLM 评测口径对齐)、以及 v2 新增的意/加利西亚/俄语言版(跨语言零样本迁移)。详见 §7.8 外部验证矩阵。
§6 AI 就绪指南
§6.0 云端快速启动
🚀 5 分钟极速体验(无需下载):HEAD-QA 已托管于 HuggingFace,任何能跑
datasets库的环境(Google Colab 免费 CPU 即可)都可一行加载:from datasets import load_dataset ds = load_dataset("dvilares/head_qa") # 西语原版 print(ds["test"][0]) # 查看第一题LLM 评测一键命令(EleutherAI lm-evaluation-harness 内置任务):
pip install lm-eval lm_eval --model hf --model_args pretrained=meta-llama/Llama-3.1-8B-Instruct \ --tasks headqa_es,headqa_en --num_fewshot 0 --batch_size 8全量 6,765 题 × 2 语言在单张 24 GB 消费级 GPU 上约 1-2 小时可完成 loglikelihood 评测。
§6.1 快速上手
# ========================================
# HEAD-QA 快速上手 — HuggingFace datasets 版
# 环境要求: datasets>=2.14, pandas
#
# 目录结构预期:无需本地下载,HF 自动缓存至 ~/.cache/huggingface/
# - 默认 config 为西语原版;config='en' 加载机翻英文版
# - v1 官方划分: train(2013-14)=2657 / validation(2015)=1366 / test(2016-17)=2742
# - ⚠️ 复合主键: 跨卷合并时必须使用 (name, qid),qid 单独不唯一
# ========================================
from datasets import load_dataset
# 步骤 1:加载西语原版(默认 config)
ds_es = load_dataset("dvilares/head_qa")
ds_en = load_dataset("dvilares/head_qa", "en") # 机翻英文版
print(ds_es) # DatasetDict: train 2657 / validation 1366 / test 2742
# 步骤 2:查看一道题(2013 年生物卷第 1 题,5 选项)
q = ds_es["train"][0]
print(q["name"], q["year"], q["category"], q["qid"])
print(q["qtext"])
for a in q["answers"]:
print(f" {a['aid']}. {a['atext']}")
print("正确答案 aid =", q["ra"])
# 步骤 3:最简评估循环——统计随机基线与'最长选项'基线
import random
def eval_baseline(split, strategy="random", seed=42):
rng = random.Random(seed)
correct, points = 0, 0
for q in split:
n = len(q["answers"])
if strategy == "random":
pred = rng.randint(1, n)
elif strategy == "longest": # 2019 论文的 length 基线
pred = max(q["answers"], key=lambda a: len(a["atext"]))["aid"]
hit = int(pred == q["ra"])
correct += hit
points += 3 if hit else -1 # 官方 POINTS: 对+3 / 错-1
n_q = len(split)
print(f"{strategy}: acc={correct/n_q:.3f} POINTS={points}")
eval_baseline(ds_es["test"], "random") # 4 选项年份 ≈ 0.25
eval_baseline(ds_es["test"], "longest") # 论文报告 test 上约 0.31
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| HuggingFace(推荐) | https://huggingface.co/datasets/dvilares/head_qa | ~159 MB | load_dataset 一行加载,免注册;含西/英两 config 与官方划分 |
| v1 官方包(GitHub) | https://github.com/aghie/head-qa(README 内 Google Drive 链接) | ~15 MB/语言 + 图像包 | ES_HEAD / EN_HEAD zip + 图像 PDF 包;MIT 许可 |
| BigBio 封装 | https://huggingface.co/datasets/bigbio/head_qa | 同上 | BigScience 生物医学统一 schema |
| v2 | https://huggingface.co/datasets/alesi12/head_qa_v2 | 百 MB 级 | Parquet + PIL 图像内嵌;CC BY 4.0 |
| 原始考卷 PDF | 西班牙卫生部官网(fse.mscbs.gob.es 历年考卷页) | — | 再分发须遵守三条件(署名/不歪曲/注明更新日期) |
许可证要点:GitHub 仓库整体为 MIT;试题内容再分发须同时满足西班牙卫生部三条件——(1) 任何情况下不得歪曲内容原意;(2) 必须注明来源;(3) 必须注明所复用文件的最后更新日期(HEAD-QA 标注为 2019-01-14)。v2 为 CC BY 4.0。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 4 步预处理代码(构建评测就绪的干净题集)</b></summary>
from datasets import load_dataset
import random, re
ds = load_dataset("dvilares/head_qa")
# 步骤 1:打平为统一记录 + 复合主键
def flatten(split, lang):
rows = []
for q in split:
rows.append({
"uid": f"{q['name']}#{q['qid']}", # ⚠️ 唯一键 = name + qid
"year": int(q["year"]), "category": q["category"],
"qtext": q["qtext"].strip(),
"options": [a["atext"].strip() for a in q["answers"]],
"gold": int(q["ra"]), "n_opts": len(q["answers"]),
"has_image_ref": bool(re.search(r"image no\.?\s*\d+", q["qtext"], re.I)),
"lang": lang,
})
return rows
rows = flatten(ds["test"], "es")
# 步骤 2:图像题标记与分流(文本-only 评估建议单独报告或排除)
text_only = [r for r in rows if not r["has_image_ref"]]
with_img = [r for r in rows if r["has_image_ref"]]
print(f"文本题 {len(text_only)} / 图像引用题 {len(with_img)}")
# 步骤 3:选项重排(消除位置偏差,评估稳健性)
def shuffle_options(row, seed=0):
rng = random.Random(row["uid"] + str(seed))
idx = list(range(row["n_opts"])); rng.shuffle(idx)
row["options"] = [row["options"][i] for i in idx]
row["gold"] = idx.index(row["gold"] - 1) + 1 # gold 是 1-based aid
return row
rows_shuffled = [shuffle_options(dict(r), seed=k) for k in (1, 2) for r in rows]
# 对每题 2 次重排取平均准确率,即得抗位置偏差估计
# 步骤 4:构造 prompt(西语原版 + 字母编号)
LETTER = "ABCDEFGHIJKLMNOPQRSTUVWXYZ"
def to_prompt(r):
opts = "\n".join(f"{LETTER[i]}. {t}" for i, t in enumerate(r["options"]))
return f"Pregunta:\n{r['qtext']}\n{opts}\nRespuesta correcta:"
print(to_prompt(rows[0]))
</details>
预处理三原则:(1) 任何合并、去重、对齐都用 (name, qid) 复合键;(2) 图像题与纯文本题分开报告,不要静默混合;(3) 报告准确率时同时给 POINTS——两者因 4/5 选项混杂不可互换(见 §6.5 坑点 2)。
§6.4 框架加载
# PyTorch:把多选题转为 (题干+选项) 分类样本
import torch
from torch.utils.data import Dataset, DataLoader
class HeadQADataset(Dataset):
def __init__(self, hf_split, tokenizer, max_len=256):
self.data, self.tok, self.max_len = hf_split, tokenizer, max_len
def __len__(self):
return len(self.data)
def __getitem__(self, i):
q = self.data[i]
# 每个选项单独编码,输出 (n_opts, seq_len) 供选项打分模型使用
enc = [self.tok(q["qtext"], a["atext"], truncation=True,
max_length=self.max_len, padding="max_length",
return_tensors="pt")
for a in q["answers"]]
input_ids = torch.stack([e["input_ids"].squeeze(0) for e in enc])
attn_mask = torch.stack([e["attention_mask"].squeeze(0) for e in enc])
label = torch.tensor(q["ra"] - 1) # 转 0-based
return input_ids, attn_mask, label
loader = DataLoader(HeadQADataset(ds["train"], tokenizer), batch_size=8, shuffle=True)
# lm-evaluation-harness:与社区结果对齐的标准姿势(loglikelihood 多选)
lm_eval --model hf \
--model_args pretrained=meta-llama/Llama-3.1-8B-Instruct,dtype=bfloat16 \
--tasks headqa_es,headqa_en \
--num_fewshot 0 --output_path results/headqa_llama8b.json
§6.5 常见坑点
⚠️ 坑点 1:英文版是机器翻译,不是"英文医疗文本"(分类:预处理陷阱)
问题:HEAD-QA_EN 由 Google 2018 年 seq2seq NMT 整体翻译,未逐题人工校对。药物名、解剖学术语、西班牙本土制度名词存在误译/生硬翻译;个别表格型题干与化学式在翻译中变形。
症状:同一模型在 EN 版上的错误集中在特定术语题;EN-ES 成绩差被错误解读为"模型西语能力差"。
解决:(1) 跨语言实验的结论表述为"西语原版 vs 机翻英语版"而非"西语 vs 英语能力";(2) 术语敏感任务(药学 FIR)优先用西语原版;(3) 引用 EN 版成绩时在方法学注明翻译引擎与论文的抽样质量分(adequacy 4.35-4.71/5);(4) 需要高质量英文医疗题时改用 MedQA。
参考:Vilares & Gómez-Rodríguez (2019) §2 翻译质量评估;HF dataset card Licensing/Translation 说明。
⚠️ 坑点 2:选项数 4/5 混杂——随机基线与 POINTS 跨年份不可比(分类:评估误用)
问题:2013-2014 年卷为 5 选项(随机 20%),2015 年起 4 选项(随机 25%)。官方 POINTS 规则(对 +3 / 错 -1)下,盲猜期望分别为 -0.75 与 -0.5/题;且 Accuracy 与 POINTS 之间因选项数不同不存在固定换算(论文脚注 13 明确说明)。
症状:全库合并报告的"平均准确率"相对随机水平的提升幅度被高估/低估;直接用 Accuracy × 3 之类公式推算 POINTS 得到错误结论。
解决:(1) 按年份/按划分(train=5 选项,test=4 选项)分别报告;(2) 需要单一数字时用官方 eval.py 同时输出 Accuracy 与 POINTS;(3) 论文写作中注明"5 选项题占 v1 的 39.3%(v2 的 21%)"。
参考:Vilares & Gómez-Rodríguez (2019) §4 Metrics 及脚注 13;官方 eval.py。
⚠️ 坑点 3:图像题在纯文本管线中静默失败(分类:工程陷阱)
问题:约 14% 的 MIR 题(v1 约 160 题;v2 共 334 题,含 EIR 2019-2022 的 36 题)必须看图作答。纯文本模型在这些题上接近乱猜,拖低 MIR 整体成绩——MIR 的"最难科目"地位部分是图像题缺失造成的假象。v1 图像还在独立 zip 包中,靠题干文本弱对齐,极易遗漏。
症状:MIR 分类目准确率系统性低于其他科目 5-10 个百分点;复现他人结果时 MIR 子集对不上;v1 评估中图像题被当作普通文本题处理而无任何报错。
解决:(1) 用正则(如
image no\.?\s*\d+)标记图像引用题,单独报告或排除;(2) v2 直接用image is not None过滤;(3) 做多模态实验时优先用 v2(PIL 内嵌对齐);(4) 报告 MIR 成绩时注明"文本题口径"还是"含图像题口径"。参考:Vilares & Gómez-Rodríguez (2019) §2(约 14% 说明);HEAD-QA v2 论文 §2.3(334 题分布);Guillen-Grima et al. (2023)(GPT-4 图像题仅 26.1%/13.0%)。
⚠️ 坑点 4:POINTS 计分与"不回答"策略(分类:评估误用)
问题:官方考试计分为对 +3 / 错 -1 / 不答 0——真实考生可以策略性放弃无把握的题。绝大多数 LLM 评测只报 Accuracy、强制作答,完全不建模"不答"选项,与人类考生策略不对等;v2 论文为此专门报告 Pna(未答率)。
症状:强制作答的 LLM 在 POINTS 口径下分数远低于按准确率直觉换算的值;与"及格线 180-219"直接比较时得出过于悲观的结论。
解决:(1) 论文同时报 Accuracy 与 POINTS;(2) 如要模拟真实考试策略,对模型置信度设阈值,低于阈值记"不答"(0 分);(3) 人机对照时引用论文 Table 9 的口径(并注意其脚注:人类卷末 10 题为备用题,非严格可比)。
参考:Vilares & Gómez-Rodríguez (2019) Table 9 及脚注 14;HEAD-QA v2 论文(Pna 指标)。
⚠️ 坑点 5:LLM 预训练污染——"83% 准确率"要打折扣(分类:数据泄漏)
问题:2013-2017 年考卷 PDF 自考试当年起即在卫生部官网公开,各类备考网站还有大量逐题解析。主流 LLM 的预训练语料几乎必然包含 HEAD-QA 原题或解析,v1/v2 论文均未做系统去污染分析。
症状:同一模型在 2013-2017 年卷(高污染)上的成绩显著高于 2019-2022 年卷(低污染);小模型"异常好"的医疗成绩;模型能复述题目原文。
解决:(1) 优先使用模型语料截止日之后举行的考卷(v2 的 2019-2022 年卷);(2) 按年份分层报告成绩,观察"污染梯度";(3) 做 n-gram 重叠检测(题干 13-gram 与语料匹配率)并在局限性中声明;(4) 把 HEAD-QA 定位为"相对排名工具"而非"绝对能力证明"。
参考:HEAD-QA v2 论文(2013-2022 扩展动机之一);Guillen-Grima et al. (2023) 选择 2022 新卷即为此考量。
⚠️ 坑点 6:答案位置偏差 × LLM 中间选项偏好(分类:偏倚陷阱)
问题:正确答案在首/尾位置出现率略低(命题人心理,Attali & Bar-Hillel 2003 的经典考试设计偏差);而研究表明 LLM 在多选任务中恰好偏好中间选项(Pezeshkpour & Hruschka 2023;Zheng et al. 2024)。两者方向一致,会系统性高估模型成绩。
症状:固定选"B/C"的盲猜基线略高于 25%;模型在不同选项排列下成绩波动 2-5 个百分点。
解决:(1) 每题做 2-4 次选项重排取平均(§6.3 步骤 3 已给代码);(2) 报告"固定位置基线"(blind1-blind4,2019 论文有此基线)作为参照;(3) few-shot 示例的答案位置做均衡化设计。
参考:HEAD-QA v2 论文 §2.3;Pezeshkpour & Hruschka (2023) “Large Language Models Sensitivity to the Order of Options in Multiple-Choice Questions”。
⚠️ 坑点 7:v1 与 v2 混用 + qid 撞键(分类:工程陷阱)
问题:v1(6,765 题,2013-2017,JSON,MIT)与 v2(12,751 题,2013-2022,Parquet,CC BY 4.0)的 2013-2017 部分同源但不保证逐题一致(v2 重新解析、化学式转 SMILES);且 qid 只在单卷内唯一,跨卷/跨版本合并时直接以 qid 为键会发生大规模撞键。
症状:合并后题目数对不上;评估时同一题出现两次(随机划分下训练/测试泄漏);引用"HEAD-QA"却不注明版本导致结果无法复现。
解决:(1) 全程使用
f"{name}#{qid}"复合键;(2) v1/v2 二选一,不混合;(3) 论文与模型卡中写明"v1(6,765 题,2013-2017)"或"v2(12,751 题,2013-2022)"及对应 HF 仓库名。参考:HEAD-QA v2 论文 §2.2(“A unique identifier requires both name and qid”);dvilares/head_qa 与 alesi12/head_qa_v2 数据集卡。
⚠️ 坑点 8:答案的"当年正确性"——旧指南陷阱(分类:标签理解)
问题:金标签是考试当年的官方答案键。2013-2017 年(v1)的抗菌药选择、疫苗指征、筛查流程、诊疗规范在 2026 年视角下已有实质更新;西班牙本土药品商品名与医保目录更是有时效性。
症状:模型按 2026 年指南作答被判"错误";微调后模型学到过时临床实践;用 HEAD-QA 微调的医疗模型给出陈旧治疗建议。
解决:(1) 把 HEAD-QA 定位为"推理与知识基准",不作为临床知识源;(2) 训练临床模型时对治疗类题目做时效性过滤或重标注;(3) 论文中声明"答案以考试当年口径为准";(4) 需要当代指南对齐的评估时,结合 2022 年后新卷(v2 尾部年份)与现行指南人工复核子集。
参考:本页 §2.6 金标准时效性警告;§7.6 数据漂移提示。
版本提示:引用排行榜数字时必须注明设置(unsupervised 全库 6,765 题 vs supervised test 2,742 题)与聚合口径(按类目平均 vs 按题聚合)——2019 论文表格与官方网页 leaderboard 的 POINTS 均值即因聚合口径不同而存在差异,两者各自正确,混引会出错。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 选项顺序重排(抗位置偏差,评估与训练皆宜) | 回译增强(EN 版本就是机翻,再回译会放大误差) |
| 题干/选项的拼写级噪声注入(评估鲁棒性) | 改动 ra 标签或"重新判定"旧答案而不声明 |
| 跨语言配对作为多任务样本(西-英同题对) | 把机翻英文版当作"英文母语医疗语料"做预训练 |
| 按年份做 forward-chaining 课程学习 | 把 v1 与 v2 的 2013-2017 同源题视为独立样本 |
| 图像题的图像常规增强(旋转/缩放,仅训练时) | 对化学式/SMILES 做字符级扰动(破坏语义) |
§6.7 模型推荐
| 任务 | 推荐方案 | 预期性能(有据可查口径) |
|---|---|---|
| 快速基线(CPU) | TF-IDF IR(DrQA retriever + Wikipedia 索引) | unsup 32.9-34.6%(Vilares 2019) |
| 复现 pre-LLM SOTA | MurKe 多步推理 + 知识抽取 | unsup 44.4% / sup 46.7%(Liu et al. 2020) |
| 当代开源 LLM 评估 | Llama-3.1-70B-Instruct(zero-shot 生成式) | v2 口径 en 83.15% / es 83.27%(Correa-Guillén et al. 2025) |
| 小模型基线 | Llama-3.1-8B-Instruct / Mistral-7B-v0.3 | v2 口径 en 70.4% / 59.6%(西语 61.9% / 52.8%) |
| 闭源参照 | GPT-4(MIR 2022 新卷 182 文本题) | 86.81%(西语,Guillen-Grima et al. 2023) |
| 教学演示 | length/ random/ blind 基线 + HF 加载 | 25-31%(5 分钟课堂可复现) |
§6.8 计算资源需求
| 硬件 | 最小配置 | 推荐配置 |
|---|---|---|
| 磁盘 | 1 GB(纯文本) | 5 GB(含 v1/v2 图像与 HF 缓存) |
| 内存 | 4 GB | 16 GB(IR 索引构建另需 20+ GB) |
| GPU | 无需(基线/7-8B 量化模型 CPU 慢速可跑) | 1 × 24 GB(8B 模型 bf16)/ 4 × 40 GB A100(70B,v2 论文配置) |
| 评测时间 | 8B 模型全量双语约 1-2 小时(24 GB 单卡) | 70B 模型约半天(4 × A100,v2 论文口径) |
§6.9 评估指标
def headqa_metrics(predictions, golds):
"""官方双指标:Accuracy + POINTS(对+3/错-1/不答0)。
predictions: list[int|None],None 表示'不答'(真实考试策略建模)
"""
n = len(golds)
correct = sum(p == g for p, g in zip(predictions, golds) if p is not None)
wrong = sum(p is not None and p != g for p, g in zip(predictions, golds))
acc = correct / n
points = 3 * correct - 1 * wrong # 不答计 0 分
pna = sum(p is None for p in predictions) / n # v2 论文的未答率 Pna
return {"accuracy": acc, "POINTS": points, "Pna": pna}
社区共识:多选 QA 主指标为 Accuracy(lm-evaluation-harness 的 headqa 任务即报 acc);与西班牙考试传统或人类成绩对照时必须给 POINTS;LLM 时代建议加分报 Pna(未答率)与选项重排均值 ± 方差。严禁只报 POINTS 或只报 Accuracy 而不说明口径(见 §6.5 坑点 2/4)。
§6.10 MLOps 笔记
- 版本锁定:模型卡/论文中写明
dvilares/head_qa(v1)或alesi12/head_qa_v2(v2)+ HF revision hash;v1 已冻结,v2 仍在演进(2026-03-30 修订)。 - 引用要求:使用数据须引 ACL 2019 论文(§9 BibTeX);再分发试题内容须遵守卫生部三条件(署名、不歪曲、注明更新日期 2019-01-14)。
- 官方脚本状态:aghie/head-qa 的 run.py/eval.py 依赖 torch 1.0.0 / allennlp 0.20.1 / python 3.6.7(2021 年后停更),2026 年环境下基本不可运行——用 HF datasets + 自写 20 行评估循环替代,不要试图复活老环境。
- 图像合规:作者提示部分图像展示严重创伤/疾病,公开展示与教学使用时需注意场合与受众提示。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 答案位置偏差 | 正确答案略少出现在首/尾位(命题人心理);LLM 偏好中间选项,方向一致 | 中 | 选项重排评估(§6.3);报告 blind 基线 |
| 国家/体系偏倚 | 内容绑定西班牙临床指南、药品名、社保制度 | 高(跨境) | 跨境结论用 MedQA/MedMCQA 对照验证 |
| 语言变体偏倚 | 卡斯蒂利亚西班牙语,非拉美变体 | 中 | 拉美应用前做变体适配评估 |
| 难度-长度混杂 | 题干越长准确率越低(MIR 平均 55 tokens 最难);"科目难度"部分反映文本长度 | 中 | 分科报告;控制题干长度后比较 |
| 图像题混杂 | MIR 含约 14% 图像题,文本-only 评估时拖低该科成绩 | 中 | 图像题单独报告(坑点 3) |
| 年代偏倚 | v1 反映 2013-2017 指南;v2 延伸至 2022 | 中高(2026 视角) | 治疗类题目时效性声明;优先用尾部年份 |
| 污染偏倚 | 公开多年,LLM 预训练已摄入 | 高(对当代 LLM) | 用模型截止日后年份评估;n-gram 去污染 |
| 翻译偏倚 | EN 版为机翻,术语误差集中于药学/解剖 | 中 | 术语敏感任务用西语原版 |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 正确答案键(ra) | 极高(国家级考试官方答案 + 考后申诉校审) | 命题委员会流程保障 | 以考试当年指南为准,存在时效性 |
| 作废题移除 | 官方校审后移除 | 官方程序 | 移除无标记,与原始 PDF 题号可能跳号 |
| 英文翻译 | 机器翻译,抽样 adequacy 4.35-4.71/5、fluency 4/5 | 单引擎一致输出 | 非逐题人工校对;术语误译存在 |
| 图像对齐(v1) | 题干文本引用编号,弱对齐 | 人工可查 | 无独立 has_image 字段,需正则识别 |
| 图像对齐(v2) | PIL 字段内嵌,强对齐 | 自动管线 + 少量人工处理 | 334 题规模仍小 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨考试体系(西班牙 → USMLE/NEET) | 中高 | 题型相似但指南、药品名、制度不同;需 MedQA/MedMCQA 对照 |
| 跨语言(西语 → 英语) | 中 | Vilares 2019:EN IR 34.6% 反超 ES IR 32.9%(机翻可用但引入变量);v2:小模型 en-es 差 6.8-8.5 个百分点 |
| 跨时间(2013-2017 → 2022+) | 中高 | 指南更新;GPT-4 在 2022 新卷 86.81% 与旧卷成绩不可直接混算 |
| 跨"考生 → 真实临床" | 高 | 多选考试能力 ≠ 临床决策能力;论文与 v2 均强调这是推理基准而非临床系统验证 |
| 跨亚群体(六学科之间) | 中 | MIR 最难(题干最长 + 图像题);FIR/BIR 最易;全库均值掩盖结构差异 |
§7.4 伦理考量
- 数据不含任何患者个人数据——全部为公开考试题;但约 14% 图像题源自真实临床影像(考卷脱敏材料),作者提示部分图像展示严重创伤或疾病,教学与展示需注意受众。
- 试题版权归西班牙卫生部所有,再分发须遵守三条件(署名、不歪曲、注明更新日期)——把题目喂给商业模型 API 前,应确认该用途与"不歪曲"及署名义务的兼容性。
- 不得用 HEAD-QA 成绩宣称模型"达到行医水平":它是入学考试基准,与临床执业能力之间存在本质鸿沟;2019 论文与 v2 论文均未做此类宣称,使用者亦不应越界。
- 英文版为机翻的事实必须在衍生工作中如实标注,避免下游把机翻文本误认为英文母语医疗语料。
§7.5 公平性评估
# 按学科 × 语言 × 年份 × 选项位置的多维分群评估
import pandas as pd
df = pd.DataFrame(results) # 每行: uid, year, category, lang, n_opts, gold_pos, correct
report = (df.groupby(["lang", "category"])["correct"]
.agg(["mean", "count"]).round(3))
print(report)
# 选项位置公平性:检验模型是否偏好中间选项
df["is_edge"] = df["gold_pos"].isin([1, df["n_opts"]])
print(df.groupby("is_edge")["correct"].mean()) # 两端 vs 中间位的成绩差
已知差异(有据):v2 论文报告小模型英语优于西语 6.8-8.5 个百分点(Llama-3.1-8B 70.43 vs 61.93;Mistral-7B 59.55 vs 52.79),70B 级基本持平——语言公平性与模型规模正相关,是评估小模型多语言公平性的现成对照设计。
§7.6 数据漂移提示
- 临床知识漂移:2013-2017(v1)至 2026 年间,抗菌谱、肿瘤方案、疫苗指征多轮更新;评估当代模型时应预期"旧答案失效率"随年份线性增长。
- 监测信号:按年份分层的准确率曲线(污染与漂移方向相反,需同时讨论);治疗类题目的人工抽检失效率。
- v2 的十年跨度(2013-2022)本身就是研究"医学知识时间稳定性"的天然实验材料——同一模型在不同年份卷上的成绩梯度值得专门报告。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本) | ✅ | 每行一题,JSON/Parquet 结构规整 |
| 2 | 有唯一标识符列 | ✅ | (name, qid) 复合键全局唯一(qid 单独不唯一,已明示) |
| 3 | 无 Unicode 或特殊字符 | ⚠️ | 西语变音符(á/ñ/ü)、希腊字母、化学式需 UTF-8 正确处理;v2 已将化学式转 SMILES |
| 4 | 无重复行 | ✅ | 官方考卷 + 作废题移除,无重复题 |
| 5 | 缺失值已识别并编码 | ⚠️ | image 空值 = 无图(结构性缺失),语义已明但无独立 has_image 列(v1) |
| 6 | 标签列被明确标识 | ✅ | ra 字段(正确 aid) |
| 7 | 已对罕见类别(<3%)进行分组 | ✅ | 六科各 15.8%-17.0%,均衡无需分组 |
| 8 | 偏倚评估已完成 | ✅ | 位置偏差、体系偏倚、语言落差均有文献与本页 §7.1 记录 |
| 9 | 有完整的数据字典 | ⚠️ | HF dataset card 有字段说明,但无独立正式数据字典文档 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | §4.5 已补全(官方文档未系统化) |
| 11 | 数据采集设备和设置已记录 | ✅ | 试卷来源、PDF 解析链、翻译引擎与质量分均有记录(§3.9) |
| 12 | 已移除完全共线性变量 | ✅ | 文本 QA 无此问题(不适用即满足) |
| 13 | 对编码的映射标准已说明 | ⚠️ | 官方无 ICD/SNOMED 映射;本页 §2.1/§2.2 已建立代表性锚定 |
| 14 | 对时间戳的处理已明确说明 | ✅ | year 字段 + 按年份官方划分 |
| 15 | 训练/验证/测试划分建议已给出 | ✅ | v1 官方年份划分(v2 无划分已明示) |
| 16 | 数据泄漏风险已被讨论 | ❌ | v1/v2 官方均未系统讨论 LLM 预训练污染;本页 §5.3/§6.5 坑点 5 补位 |
| 17 | 标签分布已被分析 | ✅ | 选项位置均匀性经 v2 论文验证(首尾略少) |
| 18 | 选择性测量偏倚已被讨论 | ✅ | RFIR 排除、作废题移除均有记录(§3.5/§4.5) |
| 19 | 外部验证建议已给出 | ⚠️ | 无官方外部验证框架;本页 §5.5/§7.8 补位 |
| 20 | 数据更新和版本信息已记录 | ✅ | v1(2019 冻结)→ v2(2025-11,2026-03 修订)脉络清晰 |
| 21 | 最小必要预处理脚本已提供 | ⚠️ | 官方 eval.py 依赖链化石级(torch 1.0.0)不可运行;HF 加载一行可用 |
| 22 | 合规使用要求已明确 | ✅ | MIT + 卫生部再分发三条件 + v2 CC BY 4.0,层次清楚 |
| 23 | 多模态对齐方法已说明 | ⚠️ | v1 题干文本弱对齐 + 独立图像包;v2 PIL 强对齐但无图像级标注 |
| 24 | 去标识化方法已被记录 | ✅ | 公开考试题,无 PHI;图像为考卷脱敏材料 |
DAIMS 评分:19.0 / 24
评分解读:良好——标签金标准等级(国家级考试官方答案)、官方年份划分、双语成对与清晰的许可证层次是核心资产;主要失分在官方未讨论 LLM 时代的数据污染、图像题对齐弱、无正式数据字典与标准术语映射。
对你意味着什么:HEAD-QA 是"拿来就能评"的轻量级基准——HF 一行加载、规模适中、六科均衡、双指标明确,DAIMS 的 15 个 ✅ 集中在"考试金标准"这一结构性优势上。需要在动手前补的三件事:(1) 用复合键 (name, qid) 管理数据并决定 v1/v2 二选一;(2) 用正则把图像题分流,文本与多模态分开报告;(3) 在论文/模型卡的局限性中写明污染未受控与机翻英文版两个事实。扣分项里没有"致命伤",全是可通过良好工程实践弥补的文档型缺口。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| HEAD-QA_EN(跨语言) | 同数据集机翻版 | unsupervised 多选 QA | 34.6%(EN IR)vs 32.9%(ES IR) | +1.7 pp | Vilares 2019:机翻英文版反超西语原版,证明跨语言迁移可行且机翻质量可用 |
| MIR 2022 新卷(v1 之外年份) | 西班牙卫生部 / 多机构联合研究 | 182 道文本题多选 | GPT-4 86.81%(西语) | 远超 v1 全部历史基线 | Guillen-Grima et al. 2023:GPT-4 大幅超越 GPT-3.5(p<0.001);图像题骤降至 26.1%(英)/13.0%(西),多模态是短板 |
| HEAD-QA v2(2018-2022 扩展年卷) | 拉科鲁尼亚大学 | 开源 LLM zero-shot | Llama-3.1-70B 83.15%(en)/ 83.27%(es) | 8B 模型 en-es 差 8.5 pp | Correa-Guillén et al. 2025:规模是主因;CoT/RAG/few-shot 无一致增益 |
| lm-evaluation-harness 标准化评测 | EleutherAI(社区基础设施) | loglikelihood 多选 | 因模型而异 | N/A | HEAD-QA 成为多语言模型发布标配测试,跨模型可比性由统一 harness 保障 |
HEAD-QA 在 2026 年还值得用吗? 值得,但要换个用法。作为"绝对能力证明"它已被 LLM 刷穿(70B 级 83%+、GPT-4 86.81%),且污染问题不可逆;作为多语言落差测量仪(同题西英对照)、推理策略边界压测台(CoT/RAG 失效的负例场景)、小模型医疗适配训练集(2,657 题官方 train)和教学数据集,它仍是西班牙语医疗 NLP 生态中结构最干净、文档最完整的基准。需要当代临床知识评估时,请用 v2 的尾部年份并配合现行指南人工复核。
§8 基准性能与生态
§8.1 排行榜
HEAD-QA 的排行榜分两个时代:pre-LLM 时代(2019-2021,官方 leaderboard 采用 unsupervised / supervised 双设置)与 LLM 时代(2023 起,zero/few-shot 生成式评测)。两个时代的数值口径完全不同,不可混排。
Pre-LLM 官方排行榜(来源:官方主页 aghie.github.io/head-qa,Avg. accuracy / Avg. POINTS):
| 排名 | 模型 | 设置 | Accuracy | POINTS | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|---|---|
| 1 | MurKe(Multi-step Reasoning + Knowledge Extraction) | supervised | 46.7 | 199.8 | 2020 | 检索支持文档 → 迭代查询重构 → 蕴含打分,多步可解释推理 | Liu Y, Chowdhury S, Zhang C, Caragea C, Yu PS. “Interpretable Multi-Step Reasoning with Knowledge Extraction on Complex Healthcare Question Answering.” arXiv:2008.02434 (2020) | — |
| 2 | MurKe | unsupervised | 44.4 | 172.3 | 2020 | 同上(不在 HEAD-QA 上训练) | 同上 | — |
| 3 | TF-IDF IR 基线(英文版) | supervised | 37.2 | 111.8 | 2019 | 题干+选项为查询,DrQA retriever 检索 Wikipedia,相关度投票 | Vilares D, Gómez-Rodríguez C. “HEAD-QA: A Healthcare Dataset for Complex Reasoning.” ACL 2019: 960-966. DOI: 10.18653/v1/P19-1092 | https://github.com/aghie/head-qa |
| 4 | TF-IDF IR 基线(英文版) | unsupervised | 34.6 | 71.2 | 2019 | 同上 | 同上 | 同上 |
2019 论文完整基线组(unsupervised accuracy,论文 Table 5):ES random 23.8 / blind 系 22.1-24.7 / length 28.1 / ES IR 32.9 / EN IR 34.6 / EN DrQA 28.5 / EN BiDAF 28.9 / EN DGEM 29.1 / EN DecompAtt 27.5。要点:全部神经模型(DrQA/BiDAF/DGEM/DecompAtt)均输给传统 TF-IDF IR——这是 2019 年论文的核心发现。
分科目基线(unsupervised accuracy,官方主页):EN IR——BIR 37.9 / MIR 30.3 / EIR 32.6 / FIR 38.7 / PIR 34.7 / QIR 33.7;MurKe——BIR 45.5 / MIR 42.4 / EIR 42.3 / FIR 48.0 / PIR 44.3 / QIR 44.3。MIR(医学)在所有方法下均为最难科目。
LLM 时代参照(口径各异,不可与上表直接比较):
| 模型 | 口径 | Accuracy | 年份 | 完整引用 |
|---|---|---|---|---|
| GPT-4 | MIR 2022 新卷 182 道文本题,西语生成式 | 86.81% | 2023 | Guillen-Grima F et al. “Evaluating the Efficacy of ChatGPT in Navigating the Spanish Medical Residency Entrance Examination (MIR).” Clin Pract 13(6):1460-1487. DOI: 10.3390/clinpract13060130 |
| Llama-3.1-70B-Instruct | HEAD-QA v2 全量,zero-shot | 83.15%(en)/ 83.27%(es) | 2025 | Correa-Guillén A, Gómez-Rodríguez C, Vilares D. “HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning.” arXiv:2511.15355(LREC 2026) |
| Llama-3.1-8B-Instruct | 同上 | 70.43%(en)/ 61.93%(es) | 2025 | 同上 |
| Mixtral-8x7B-v0.1-Instruct | 同上 | 70.59%(en)/ 66.01%(es) | 2025 | 同上 |
| Mistral-7B-Instruct-v0.3 | 同上 | 59.55%(en)/ 52.79%(es) | 2025 | 同上 |
| 人类前 10 名(2016 各科) | 官方考试成绩(POINTS 口径) | 515.2-627.1 POINTS | 2016 | Vilares & Gómez-Rodríguez (2019) Table 9 |
不可直接比较警告:(1) unsupervised(全库 6,765 题)与 supervised(test 2,742 题)题集不同;(2) Accuracy 与 POINTS 不可换算(坑点 2);(3) GPT-4 的 86.81% 仅覆盖 2022 年 MIR 单科的 182 道文本题,与 v1/v2 全库口径不同;(4) 官方网页 leaderboard 与论文表格的 POINTS 均值聚合口径不同(按题 vs 按类目),各自正确不可混引。
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现/对比 2019-2021 文献 | v1 官方划分 + TF-IDF IR / MurKe 数字 | 官方 leaderboard 双设置是历史基线 |
| 评估当代 LLM 医疗能力 | v2 全量 zero-shot + 西英双报告 | 与 v2 论文四模型数字可直接对齐 |
| 测多语言公平性 | v1/v2 西英成对题 + 选项重排 | 同题对照消除内容变量,差值即语言落差 |
| 压测推理策略(CoT/RAG) | v2 全量 + v2 论文协议 | 该基准上 CoT/RAG 已被证明无增益,适合作为负例对照 |
| 教学/课程演示 | HF 加载 + length/random 基线 + 一道 MIR 病例题 | 5 分钟全流程,25-31% 基线立竿见影 |
§8.3 官方评测协议
v1 协议(Vilares & Gómez-Rodríguez 2019 §4):双设置——unsupervised(系统不在 HEAD-QA 上训练,全库 6,765 题评测)与 supervised(2013-14 train / 2015 dev / 2016-17 test);双指标——Accuracy(答对率)与 POINTS(对 +3 / 错 -1);官方 eval.py 按卷计分后聚合,同时报告六科分类目成绩。
v2 协议(Correa-Guillén et al. 2025):无官方划分;zero-shot / few-shot / CoT / RAG / probability-based 五种推理策略;指标为 Accuracy + Pna(未答率);16-bit、A100 40GB 硬件口径;probability-based 设计下 Pna=0。
lm-evaluation-harness 协议:loglikelihood 多选(对每个选项计算条件对数似然取最大),headqa_es / headqa_en 两任务,报 accuracy——注意该口径不建模"不答",与官方 POINTS 不可比。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| HEAD-QA v2 | 后继 | 12,751 题、十年跨度、五语言、CC BY 4.0(arXiv:2511.15355) |
| Antidote CasiMedicos | 同源扩展 | 同源 MIR 考卷 + 解释性标注(EXPLA),约 22,000 题,重"解释"而非"答题" |
| MedQA | 同类(美国) | USMLE 风格,英文医疗 QA 主战场 |
| MedMCQA | 同类(印度) | 194k+ 题,AIIMS/NEET 考试,附解释 |
| PubMedQA | 互补 | 文献摘要 yes/no/maybe,非考试推理 |
| MMLU 医学子集 | 同类(通用) | 通用 LLM 评测的医学切片 |
| ARC(AI2 Reasoning Challenge) | 灵感同代 | 2018 年中小学科学多选推理,HEAD-QA 论文的方法论对话对象 |
| bigbio/head_qa | 封装版 | BigScience 生物医学统一 schema |
§8.5 关键论文 Top 8
- Vilares D, Gómez-Rodríguez C (2019), ACL 2019: 960-966. “HEAD-QA: A Healthcare Dataset for Complex Reasoning.” — 数据集本体,权威引用入口。DOI: 10.18653/v1/P19-1092
- Correa-Guillén A, Gómez-Rodríguez C, Vilares D (2025), arXiv:2511.15355(LREC 2026). “HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning.” — 十年扩展 + 五语言 + LLM 基准,"规模即一切、推理策略无增益"的系统性证据。
- Liu Y, Chowdhury S, Zhang C, Caragea C, Yu PS (2020), arXiv:2008.02434. “Interpretable Multi-Step Reasoning with Knowledge Extraction on Complex Healthcare Question Answering.” — MurKe 多步推理,pre-LLM 时代官方排行榜榜首(44.4/46.7)。
- Guillen-Grima F et al. (2023), Clin Pract 13(6):1460-1487. “Evaluating the Efficacy of ChatGPT in Navigating the Spanish Medical Residency Entrance Examination (MIR).” — GPT-4 通过 MIR 新卷 86.81%,图像题短板的首个系统证据。DOI: 10.3390/clinpract13060130
- Chen D, Fisch A, Weston J, Bordes A (2017), ACL. “Reading Wikipedia to Answer Open-Domain Questions.” — DrQA,HEAD-QA IR 基线的检索-阅读框架来源。
- Clark P et al. (2018), arXiv:1803.05457. “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.” — 同代复杂推理多选基准,HEAD-QA 的方法论对话对象(ARC-solvers 被直接迁移评测)。
- Pezeshkpour P, Hruschka E (2023), arXiv:2308.11483. “Large Language Models Sensitivity to the Order of Options in Multiple-Choice Questions.” — LLM 选项顺序敏感性,HEAD-QA 评估设计的必读方法论。
- Gutiérrez-Fandiño A et al. (2022), Procesamiento del Lenguaje Natural 68: 39-60. “MarIA: Spanish Language Models.” — 西班牙国家级语言模型项目,HEAD-QA 所在的西语 NLP 评估生态坐标。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| Semantic Scholar 引用(ACL 2019 论文) | 157 次(influential 20,截至 2026-09) |
| GitHub(aghie/head-qa) | 33 stars / 6 forks(截至 2026-09;2021-02 后停止代码更新) |
| HuggingFace 月下载 | 约 1,157 次(dvilares/head_qa,截至 2026-09 快照) |
| lm-evaluation-harness | 内置标准任务 headqa_en / headqa_es(2023 年并入主线) |
| BigScience 生物医学合集 | bigbio/head_qa 收录 |
| 衍生模型 | tasksource 系列等在 head_qa 上微调的模型(HF 可查) |
| v2 发布 | 2025-11 arXiv,LREC 2026 camera-ready(2026-03-30 修订) |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/热度(截至 2026-09) | 为什么值得关注 |
|---|---|---|---|---|
| aghie/head-qa | 官方代码 | https://github.com/aghie/head-qa | 33 / 6 | 官方仓库:IR/DrQA/ARC-solvers 基线与 eval.py;依赖链已过时,以 README 与数据链接价值为主 |
| dvilares/head_qa | 数据托管 | https://huggingface.co/datasets/dvilares/head_qa | 月下载约 1,157 | v1 标准入口,西/英双 config + 官方划分 |
| alesi12/head_qa_v2 | 数据托管 | https://huggingface.co/datasets/alesi12/head_qa_v2 | v2 官方 | 十年五语版,PIL 图像内嵌,CC BY 4.0 |
| EleutherAI lm-evaluation-harness | 评测框架 | https://github.com/EleutherAI/lm-evaluation-harness | 社区标准 | headqa_es/headqa_en 内置任务,跨模型可比的标准姿势 |
| bigbio/head_qa | 数据封装 | https://huggingface.co/datasets/bigbio/head_qa | BigScience 合集 | 与 270+ 生物医学数据集统一 schema,适合多任务联合实验 |
| 官方主页 + leaderboard | 排行榜 | http://aghie.github.io/head-qa | — | pre-LLM 时代官方排行榜与六科分类目成绩 |
| 西班牙卫生部历年考卷页 | 原始来源 | https://fse.mscbs.gob.es/(历年考卷检索) | — | 原始 PDF 与官方答案键;做去污染或新卷扩展的官方源头 |
§9 相关资源与引用
官方资源
- 数据集主页(含 leaderboard):http://aghie.github.io/head-qa
- GitHub 仓库:https://github.com/aghie/head-qa
- HuggingFace v1:https://huggingface.co/datasets/dvilares/head_qa
- HuggingFace v2:https://huggingface.co/datasets/alesi12/head_qa_v2
- BigBio 版:https://huggingface.co/datasets/bigbio/head_qa
- ACL Anthology 论文页:https://aclanthology.org/P19-1092/
- arXiv(v1):https://arxiv.org/abs/1906.04701
- arXiv(v2):https://arxiv.org/abs/2511.15355
- 许可证:MIT(仓库)+ 西班牙卫生部再分发三条件;v2 CC BY 4.0
BibTeX 引用
% 1) 数据集论文(v1,必引)
@inproceedings{vilares-gomez-rodriguez-2019-head,
title={HEAD-QA: A Healthcare Dataset for Complex Reasoning},
author={Vilares, David and G{\'o}mez-Rodr{\'i}guez, Carlos},
booktitle={Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics},
pages={960--966},
year={2019},
address={Florence, Italy},
publisher={Association for Computational Linguistics},
doi={10.18653/v1/P19-1092}
}
% 2) HEAD-QA v2(使用 v2 时必引)
@misc{correa2025headqav2,
title={HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning},
author={Correa-Guill{\'e}n, Alexis and G{\'o}mez-Rodr{\'i}guez, Carlos and Vilares, David},
year={2025},
eprint={2511.15355},
archivePrefix={arXiv},
note={LREC 2026 camera-ready}
}
% 3) 如使用 MurKe 排行榜数字
@misc{liu2020murke,
title={Interpretable Multi-Step Reasoning with Knowledge Extraction on Complex Healthcare Question Answering},
author={Liu, Ye and Chowdhury, Shaika and Zhang, Chenwei and Caragea, Cornelia and Yu, Philip S.},
year={2020},
eprint={2008.02434},
archivePrefix={arXiv}
}
署名义务提示:再分发试题内容时,除引用论文外,还须按西班牙卫生部要求注明来源(Ministerio de Sanidad, Consumo y Bienestar Social)与所复用文件的最后更新日期(HEAD-QA v1 为 2019-01-14)。
教程与学习资源
- HF dataset card(含字段说明与加载示例):https://huggingface.co/datasets/dvilares/head_qa
- GitHub README(IR 索引构建、DrQA/ARC-solvers 复现指南,历史文档):https://github.com/aghie/head-qa
- lm-evaluation-harness headqa 任务定义(标准评测口径):https://github.com/EleutherAI/lm-evaluation-harness/tree/main/lm_eval/tasks/headqa
- HEAD-QA v2 论文 HTML 版(统计表与协议细节最完整):https://arxiv.org/html/2511.15355v2
原始论文
- Vilares D, Gómez-Rodríguez C (2019). “HEAD-QA: A Healthcare Dataset for Complex Reasoning.” Proceedings of ACL 2019, pp. 960-966, Florence, Italy. DOI: 10.18653/v1/P19-1092. arXiv:1906.04701.
- Correa-Guillén A, Gómez-Rodríguez C, Vilares D (2025). “HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning.” arXiv:2511.15355(LREC 2026 camera-ready,2026-03-30 v2)。
- Guillen-Grima F et al. (2023). “Evaluating the Efficacy of ChatGPT in Navigating the Spanish Medical Residency Entrance Examination (MIR).” Clin Pract 13(6):1460-1487. DOI: 10.3390/clinpract13060130. PMID: 37987431.
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch / WebFetch(多源检索) | 2026-09-05 | 4 组检索 + 3 次定向抓取:官方主页、ACL 论文全文、GitHub API、Semantic Scholar API、v2 arXiv 全文,用于数字核实 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 ACL Anthology、官方主页、GitHub、HuggingFace、arXiv 与 PubMed 公开资料中整理结构化信息;(2) 生成 §6 的 Python/bash 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Vilares & Gómez-Rodríguez (2019), ACL 2019: 960-966 — HEAD-QA 原始论文(DOI: 10.18653/v1/P19-1092,含 Table 2/3/5-9 全部统计)
- HEAD-QA 官方主页(http://aghie.github.io/head-qa)— leaderboard、legal requirements、样例题
- aghie/head-qa GitHub 仓库 + GitHub API(star/fork/license/commit 时间快照,2026-09-05)
- HuggingFace dvilares/head_qa dataset card(字段、划分、license、下载量快照)
- HuggingFace datasets PR #1455(head_qa 入库记录,Maria Grandury 贡献)
- Correa-Guillén et al. (2025), arXiv:2511.15355v2 — HEAD-QA v2 论文全文(规模、五语言、四模型五策略基准、位置偏差)
- Liu et al. (2020), arXiv:2008.02434 — MurKe 论文(排行榜榜首数字复核)
- Guillen-Grima et al. (2023), Clin Pract 13(6):1460-1487(PMID: 37987431)— GPT-4 MIR 2022 评估
- Semantic Scholar API(P19-1092 引用数快照,2026-09-05)
- EleutherAI lm-evaluation-harness headqa 任务定义(headqa_en/headqa_es)
- bigbio/head_qa dataset card(BigScience 收录确认)
- modeldatabase HEAD-QA 镜像页(HF 下载量与文件大小快照)
- 西班牙卫生部再分发法律条款(mscbs.gob.es avisoLegal,三条件)
- Gutiérrez-Fandiño et al. (2022), MarIA 论文(arXiv:2107.07253,西语模型生态背景)
- Attali & Bar-Hillel (2003) 与 Pezeshkpour & Hruschka (2023)(答案位置偏差方法论文献,经 v2 论文转引核实)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(考试体系、ICD-11/SNOMED 映射、金标准) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(题量、划分、v1/v2 差异) | 千方病案医学编辑部 | 与 ACL 论文 Table 2 及 v2 论文 Table 1 交叉比对 | ✅ 已验证 |
| §4 数据结构(复合键、DAIMS 字段字典) | 千方病案医学编辑部 | 与 HF dataset card 及 v2 论文 §2.2 交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方 eval.py 口径比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与官方 leaderboard、论文原文及 Semantic Scholar 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
